2026-08-12

148 篇
AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss Figure 1
2026-08-12cs.CV

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

Peking University

2026-08-12视觉感知

本文针对用固定预训练特征优化 Fréchet 距离时的“Fréchet hacking”问题:目标指标下降但图像伪影和跨特征空间对齐可能变差。核心做法是在 FD-Loss 的静态编码器外加入对抗学习的特征表示,并用真实特征白化抑制尺度放大、稳定极小极大训练。ImageNet 一步生成实验显示,AdvFD 在 JiT、pMF 及不同规模模型上减少伪影,并改善训练内与未参与训练编码器上的 Fréchet 指标。

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning Figure 1
2026-08-12cs.RO

Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning

Wenrui Bao, Tianyun Jiang, Zhiben Chen, Ser-Nam Lim, Peter D. Peng, Yuzhang Shang

2026-08-12机器人强化学习

这篇论文针对手术机器人中带动作标签示教昂贵、仅有内窥镜视频更易获取的问题,提出 Surgical WAM:先用无动作视频学习手术视觉动力学,再在固定动作标注预算上微调,并以滚动时域方式闭环输出 dVRK 动作块。四个 SurRoL 仿真任务中,视频预训练将平均成功率从 63.5% 提升到 77.8%,PegTransfer 提升 20 个百分点,收益主要出现在接触丰富和双臂协作任务。

Capturing Uncertainty in Human Motion for Representation Learning in Soccer Figure 1
2026-08-12cs.CV

Capturing Uncertainty in Human Motion for Representation Learning in Soccer

Yizhou Xu, Lars Bretzner, Tiesheng Wang, Atsuto Maki

KTH Royal Institute of Technology

2026-08-12安全鲁棒

这篇论文针对足球场景中人体动作快速、多模态且标注稀缺的问题,用未来运动预测作为3D骨架表征的自监督目标。核心做法是把未来3D运动离散成代码本,并在每帧预测未来运动模式的概率分布,从而显式建模不确定性而非回归单一平均轨迹。实验在世界杯WorldPose和私有数据上提升运动预测,并迁移到动作识别、射门定位等下游任务,显示跨任务表征收益。

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics Figure 1
2026-08-12cs.CV

VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics

Bowei Liu, Zheng Lu, Yuhan Bian, Xinchen Zhang, Xingming Shui, Yuesheng Huang, Xuhuan Li, Zihao Liu, Yifan Yang, Jun Zhou, Xiu Li

2026-08-12视觉语言视觉感知强化学习

针对高保真 AI 生成视频使传统 MLLM 检测器容易依赖粗标签或教师推理而泛化不足的问题,论文提出“元检测”强化学习:用可验证的伪造时间区间作为证据监督,并通过边界帧条件的视频片段重建构造真假配对数据,再用 EGRR 按证据质量重分配奖励。实验称该方法在跨生成器和分布外检测上更稳健,但具体增益中数据构造与奖励机制的相对贡献仍需消融支撑。

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation Figure 1
2026-08-12cs.CV

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

Shiyu Xuan, Zechao Li

2026-08-12视觉语言强化学习

针对 GUI 视觉定位模型部署后参数冻结、遇到新界面难以从失败交互中学习的问题,论文提出测试时自演化闭环:用 MLLM Reflector 评估并生成失败反思,再通过反思引导的 on-policy 自蒸馏把文本反思转成 token 级监督,并用对比校准抑制错误前缀污染。六个基准上平均较基座提升 7.4%,相对 GUI-RCPO 最高平均增益 7.7%。

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment Figure 1
2026-08-12cs.CV

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

National Key Laboratory for Novel Software Technology, Nanjing University, China

2026-08-12视觉语言强化学习

本文针对多模态大模型用整图-长文本预训练时难以学习对象与词语对应关系的问题,提出 MMCS:把文本实体替换为对应视觉对象嵌入,让生成局部上下文时直接依赖对象级视觉特征。作者还构建 77.3 万样本合成管线;实验显示 5 万样本即可达到或超过 60 万图文对训练效果,并在视觉定位和感知任务上分别带来约 7.9% 和 2.1% 平均提升。

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting Figure 1
2026-08-12cs.CV

CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting

Jiayu Ding, Meilu Song, Yun Chen, Wei Gao, Ge Li

Peking University, Shenzhen Graduate School, Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, North China Electric Power University, Department of Computer Science and Technology, Hunan University, College of Computer Science and Electronic Engineering

2026-08-12三维

这篇论文针对现有 3D Gaussian Splatting 分割多停留在显式物体名或简单描述、难以处理具身操作中的隐含意图与空间/功能推理问题,提出 Reasoning 3D Gaussian Segmentation 任务,并构建 Causal-LERF 与 Causal-ScanNet 基准。核心做法是用 3D 场景图承载结构关系、用 LLM 将隐式指令解析为可执行意图,从而分离结构感知与逻辑推理。实验显示 CausalSplat 在新基准的 2D/3D 指标上优于现有方法,并对常规指代表达和开放词汇分割保持泛化。

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models Figure 1
2026-08-12cs.CV

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

2026-08-12视觉语言数据集/基准

这篇论文针对多模态大模型中人物知识删除难以在无原始训练语料条件下评测的问题,提出 PRMU 基准,用公开人物、文本/视觉探针、对抗测试和邻近人物局部性分析模拟真实删除请求,并给出 SGPE 无语料编辑基线。实验显示现有方法常在遗忘强度与局部性之间失衡,且易被多模态线索重新激活;SGPE 在遗忘、局部性和通用能力之间取得较稳折中。

SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring Figure 1
2026-08-12cs.CV

SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring

Moti Rattan Gupta, Anupam Sobti

2026-08-12视觉感知

针对农业监测中光学影像易受云层影响、现有 SAR 表征又偏向目标检测或粗粒度地物分类的问题,SAR2Agri专门用 Sentinel-1 SAR 强度时序做自监督预训练,引入时间差预测、未来帧预测、掩码与TD→TD+FF课程学习来捕捉作物物候的时空变化。在SICKLE上作物类型IoU达84.9%,较光学基线高15.3点、较既有SAR基线高2.2点,并提升产量估计,但物候日期任务相对光学略有下降。

Is There Really a Camouflaged Object? Towards Realistic Camouflaged Object Detection Figure 1
2026-08-12cs.CV

Is There Really a Camouflaged Object? Towards Realistic Camouflaged Object Detection

Huafeng Chen, Yueming Lyu, Chenyang Si, Wende Tan, Liucheng Guo, Caifeng Shan

2026-08-12视觉感知

论文指出现有伪装目标检测默认图中必有目标,部署到纯背景或非伪装目标场景时会产生大量误报。作者构建含正负样本的 OPC16K,并提出 OPCNet,将分割改为目标存在性与伪装性联合推理,结合层级存在判断、前背景相似关系建模和特征调制。实验显示其在 realistic COD 协议下能显著降低负样本误报,同时保持伪装目标分割精度。

AlbumentationsX: One Augmentation Pipeline for Images and Related Annotations Figure 1
2026-08-12cs.CV

AlbumentationsX: One Augmentation Pipeline for Images and Related Annotations

Vladimir Iglovikov

2026-08-12视觉感知

本文针对视觉训练中图像与掩码、框、关键点、视频帧或体数据被不同随机变换破坏对齐的问题,提出用单一 Compose 统一保存增强策略、概率、标注设置与随机种子,并一次采样后同步作用于所有目标。主要结果是给出可复现、可检查、可扩展的增强管线,支持实例级掩码-框-标签绑定及多模态目标;但文中以API设计与示例为主,未充分说明对模型精度或训练效率的量化增益。

Every Packet Counts: Dispersing Information for Loss-Resilient Learned Image Compression Figure 1
2026-08-12cs.CV

Every Packet Counts: Dispersing Information for Loss-Resilient Learned Image Compression

Yuhang Wei (1), Chuqin Zhou (1), Yibo Shi (2), Jing Wang (2), Guo Lu (1) ((1) Shanghai Jiao Tong University, (2) Huawei Technologies Ltd.)

Shanghai Jiao Tong University, Central Media Technology Institute, Huawei Technologies Ltd.

2026-08-12视觉感知

面向卫星、应急等易丢包链路中学习式图像压缩质量骤降的问题,论文指出脆弱性来自包内信息分布不均和熵编码顺序依赖。方法通过通道间能量重分配、交错通道分组把关键信息分散到各包,并用两层双分支自回归缩短错误传播链。实验显示在20%丢包下较LossResilientLIC平均PSNR提升1.84 dB,方差降一个数量级,且可泛化到突发丢包。

Cross-View Feature Matching: Survey, Benchmarking, and Foundation-Model Perspectives Figure 1
2026-08-12cs.LG

Cross-View Feature Matching: Survey, Benchmarking, and Foundation-Model Perspectives

Songlin Du, Xiaoyong Lu, Zeyu Wu, Xiaobo Lu, Guobao Xiao, Bin Fan, Jiayi Ma, Takeshi Ikenaga

2026-08-12数据集/基准

针对跨视角图像匹配在机器人定位、SLAM与三维重建中方法分散、评测不可比的问题,本文将其统一为几何对应建模任务,梳理特征提取、稀疏/稠密匹配、VFM融合、训练策略与鲁棒估计,并在MegaDepth、ScanNet、HPatches等数据集上重评代表方法。主要结果是给出一致分类和基准比较,指出当前瓶颈在效率、极端条件鲁棒性、跨域泛化和显式几何推理。

Learning Gaussian Structure: Intervention-Guided Density Control for Feed-Forward Driving Reconstruction Figure 1
2026-08-12cs.CV

Learning Gaussian Structure: Intervention-Guided Density Control for Feed-Forward Driving Reconstruction

Hang Li, Jiahe Li, Meiying Gu, Jin Zheng, Lina Yu, Xiao Bai

2026-08-12规划控制三维

这篇论文针对前馈式驾驶场景高斯重建中“LiDAR 点一经初始化就固定为最终 primitive 集”的问题,认为缺少按场景增删高斯的机制会导致细节模糊。核心做法是用剪枝/新增干预引起的局部梯度响应变化来监督 Densify Map,并结合跨时间点查询显式聚合邻近特征。实验在 Waymo 和 PandaSet 上优于已有方法,但具体增益在多大程度来自结构学习而非数据或规模仍需看完整消融。

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets Figure 1
2026-08-12cs.CV

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

Department of Biomedical Data Science, Geisel School of Medicine at Dartmouth, Dartmouth Hitchcock Medical Center, Department of Urology, Yale University

2026-08-12数据集/基准

该文针对全身 PET/CT 病灶分割中专家标注昂贵、跨癌种和示踪剂泛化困难的问题,提出 FEEDS:先用 DINOv2 特征在未标注库中一次性挑选多样且代表性的病例,再进行监督训练,避免主动学习或半监督的反复训练。实验在 AutoPET-III、Deep-PSMA 和 DHMC 上显示,约 30% 标注预算即可接近全量标注表现,并优于随机采样、伪标签半监督和少量标注基线。

Static in Frames, Dynamic in Events: Rethinking Features in Event Cameras as Motion Cues Figure 1
2026-08-12cs.CV

Static in Frames, Dynamic in Events: Rethinking Features in Event Cameras as Motion Cues

Hesam Araghi, Jan van Gemert, Nergis Tomen

Computer Vision Lab, Delft University of Technology

2026-08-12视觉感知

这篇论文针对事件相机表示常被当作预处理而缺少运动语义解释的问题,指出事件角点检测中的结构张量 Harris 特征值和时空密度并非普通局部特征,而是可编码运动方向的线索。作者给出平移角点的理论分析,并在合成数据与 DSEC 光流实验中验证,将这些特征接入 IDNet 可稳定提升精度,尤其在数据较少和小模型场景更明显。

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering Figure 1
2026-08-12cs.CV

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering

Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu

2026-08-12视觉语言视觉感知

针对长图像描述难以用文本重合或开放式 LLM 打分验证细粒度事实的问题,CapProbe 将整图拆成前景与背景语义区域,并为每个区域生成多类别选择题,把描述评估转为区域对齐的密集事实检查。基准含 346 张图、1868 个区域和 25650 个问题;在 13 个 VLM 上显示覆盖率差距明显,并揭示能力与描述效率的权衡及稀疏指标遗漏的失败模式。

Entropy-Centric Explainable AI for Remote Sensing Image Segmentation Figure 1
2026-08-12cs.CV

Entropy-Centric Explainable AI for Remote Sensing Image Segmentation

Ali Saleh, Abdul Karim Gizzini, Mohamad Ghassany, Ali J. Ghandour

Faculty of Engineering, Lebanese University, Beirut, Lebanon, University of Paris-Est Créteil (UPEC), LISSI/TincNET, F-94400, Vitry-sur-Seine, France., EFREI, EFREI Research Lab, F-94800 Villejuif, France., National Center for Remote Sensing - CNRS, Mansourieh, 22411, Lebanon.

2026-08-12视觉感知

面向遥感语义分割中黑箱模型难以解释、影响关键场景可信使用的问题,论文提出基于熵不确定性的采样式 XAI 方法,通过两阶段采样扰动并计算目标区域熵空间得分来评估图像区域重要性,同时设计 H-SIT 评价流程结合置信度、IoU 与熵指标检验显著区域是否真正影响预测。在 WHU 建筑足迹分割实验中,该方法相较已适配的分割 XAI 基线表现出更高保真度,能更好排除无关区域并定位决策关键区域。

A Comparative Evaluation of Deep Learning Object Detection Models on a Real-World Multi-Plant Dataset from Africa Figure 1
2026-08-12cs.CV

A Comparative Evaluation of Deep Learning Object Detection Models on a Real-World Multi-Plant Dataset from Africa

Ismail Ismail Tijjani, Sunusi Muhammad Ibrahim, Amina Ibrahim Khaleel, Lanre Olusegun Akinola, Fatima Isa Jibrin, Muhammad Bashir Aliyu, Abdullahi Abdussalam Dalhat, Abdullahi Suiudeen

Department of Mechatronics Engineering, Bayero University, Kano, Nigeria., Department of Chemical and Petroleum Engineering, Bayero University, Kano, Nigeria., Department of Artificial Intelligence and Cybersecurity, Alpen-Adria-Universität Klagenfurt, Austria., Department of Computer Science, Gombe State University, Nigeria., Department of Mechatronics Engineering, Aliko Dangote University of Science and Technology, Wudil, Nigeria., Department of Computer Engineering, Ahmadu Bello University, Zaria, Nigeria., Department of Computer Science, Federal University Dutse, Nigeria.

2026-08-12视觉感知强化学习数据集/基准

针对非洲真实农田数据稀缺、受控数据难以反映光照变化、遮挡和复杂背景的问题,论文发布尼日利亚农场采集的 AgriAISeg 数据集,并在芝麻、卷心菜、番茄上统一比较 YOLO 系列、Faster R-CNN 与 RT-DETR。结果显示 RT-DETR 综合最佳,mAP@0.5:0.95 达 0.624,YOLOv8/YOLO11 表现稳定且训练效率更高,而 Faster R-CNN 在复杂田间条件下明显落后。

HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation Figure 1
2026-08-12cs.CV

HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation

Raphael Lorenzo-Louis, Fabio Amadio, Bertrand Luvison, Serena Ivaldi

2026-08-12机器人数据集/基准

这篇论文针对服务机器人在真实人群中需要提前判断谁会发生物理交互的问题,提出 HUI360:从移动机器人第一视角采集的 360°野外数据集,并配套自动标注、人工校正和评测协议。其核心贡献更偏向数据与基准建设,包含 4310 条轨迹、超过 100 万检测标注,以及对 SSUP-HRI 的扩展标注以支持跨数据集评估。实验显示 LSTM 在同域和跨域 AUC 上优于 MLP、随机森林,但跨机器人平台性能下降明显,说明主要瓶颈仍在泛化,增益可能主要来自 scaling / data。

3D Weighted Geometric Graph Neural Networks for Sheep Facial Pain Assessment Figure 1
2026-08-12cs.CV

3D Weighted Geometric Graph Neural Networks for Sheep Facial Pain Assessment

Alam Noor, Luis Almeida, Mohamed Daoudi

CISTER Research Center, Porto, Portugal, Faculty of Engineering University of Porto, Portugal, IMT Nord Europe, Institut Mines-Télécom, Univ. Lille, Centre for Digital Systems, F-59000 Lille, France

2026-08-12三维

本文针对羊疼痛评估中2D人脸式建模忽略三维解剖关系的问题,将SPFES的耳、眼、鼻等地标用单目深度估计嵌入3D图,并以距离、表面共面性和注意力加权进行WG-GNN消息传递,还用双侧检测平均贴合临床评分。实验报告验证准确率73.2%、总体准确率78.33%±2.2%,双侧平均带来6.7%提升,但相较其既有2D结果的实际增益来源仍不够清楚。

Multi-Level Evidence Aggregation for Robust Facial Phenotype Retrieval in Rare Genetic Disorder Prioritization Figure 1
2026-08-12cs.CV

Multi-Level Evidence Aggregation for Robust Facial Phenotype Retrieval in Rare Genetic Disorder Prioritization

Alexander Hustinx, Carolin Kaffiné, Behnam Javanmardi, Tzung-Chien Hsieh, Peter Krawitz

organization=Institute for Genomic Statistics and Bioinformatics, University Hospital Bonn

2026-08-12安全鲁棒

这篇论文针对罕见遗传病面部表型检索中过度依赖单张图像、单个近邻匹配的问题,提出无需重训 GestaltMatcher-Arc 的推理期多层证据聚合:合并同一患者多图像、构建患者加权疾病质心,并融合个体近邻与质心评分。在 GMDB v1.1.4 上,Top-1 准确率在常见病子集由 38.52% 提升至 48.82%,罕见未见疾病由 19.38% 提升至 23.79%,多图像患者场景增益更明显。

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models Figure 1
2026-08-12cs.CV

When Visual Signals Mislead: A Mechanistic Study of Attribute Hallucination in Vision-Language Models

Yufei Zhang, Chenlu Zhan, Hongwei Wang

Zhejiang University

2026-08-12视觉语言视觉感知

本文针对 VLM 在识别对象后仍误判颜色、状态、材质等属性的幻觉问题,质疑“语言先验主导”这一常见解释。作者提出 VISOR,用空白图像分解视觉信号与语言先验,并据此路由校准、拒答或视觉适配。实验显示,在 10,791 个负样本上假阳性主要由视觉信号质量预测,先验接近随机;在 Qwen、InternVL、LLaVA 上可降低属性假阳性。

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video Figure 1
2026-08-12cs.CV

R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video

Ke Ma, Yamin Mao, Weiming Li, Shuai Tan, Yijie Zhong, Hao Chen, Haofen Wang, Meng Wang

College of Design and Innovation, Tongji University, Samsung R&D Institute China - Beijing, Shanghai Jiao Tong University, Shanghai Research Institute for Intelligent Autonomous Systems

2026-08-12视觉感知

面向可穿戴/第一视角长视频中“物体被放到哪、何时改变状态”等问答难题,R4DSG认为单纯字幕或片段检索难以保留持续物体身份与空间变化。其核心是用稳定锚点和动态物体构建相对4D场景图记忆,以锚点相对迁移替代全局三维重建,并生成可检索记忆条目。在EgoLifeQA物体子集上,问题检索条件下较EgoRAG-Text总体提升6.7点,when类提升12.5点。

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning Figure 1
2026-08-12cs.CV

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

Liangyu Fu, Junbo Wang, Yuke Li, Ya Jing, Xuecheng Wu, Zhiyong Wang

2026-08-12视觉语言视觉感知

本文针对零样本视频描述中“训练只见文本、推理只见视频”造成的跨模态分布落差,提出 WSV:用预训练文生视频模型从文本合成视频潜表示,再用 3D 卷积 polisher 对齐真实视频潜空间,并以 prompter 条件化 GPT-2 生成描述。其核心洞察是让模型在训练时学习近似视觉分布,而非仅做文本到视觉的线性映射;在 MSVD、MSR-VTT、VATEX 上报告达到 B@4 52、CIDEr 95.7。

HNDiff: Haze-Noise Diffusion for Image Dehazing Figure 1
2026-08-12cs.CV

HNDiff: Haze-Noise Diffusion for Image Dehazing

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan, National Tsing Hua University, Taiwan, National Chengchi University, Taiwan

2026-08-12视觉感知生成模型

HNDiff针对现有去雾扩散模型从纯高斯噪声重建、忽略雾形成物理机制而导致重建保真度不足的问题,将大气散射模型嵌入扩散过程:前向同时加入雾与噪声,并用雾感知调度器按雾密度分配噪声,反向联合去雾去噪;其 Latent HNDiff 还能作为先验接入现有去雾骨干,在七个数据集上提升四类主流模型并达到SOTA。

Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers Figure 1
2026-08-12cs.CV

Putting Registers to Work: Task Registers for Token Pruning in Vision Transformers

Hongsen Cao, Mona Jaber, Shanxin Yuan, Ahmed Sayed

2026-08-12视觉感知

这篇论文关注 ViT 预训练骨干在分类、分割、检测中复用时,统一 token 剪枝策略难以迁移的问题。作者通过冻结管线的受控探针发现,不同任务和层深对保留准则、预算分配与 dense 恢复偏好明显不同,并提出 TAP:用任务专属 register 动态控制 token 排序、全局剪枝预算和恢复尺度。在 0.5 保留率下,TAP-J 在 ADE20K 达 47.0 mIoU、COCO 达 53.7 box AP,同时带来约 1.3× 编码器吞吐提升并保持 ImageNet 竞争力。

PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders Figure 1
2026-08-12cs.CV

PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders

Man Jiang, Ouxiang Li, Weibao Xue, Zhenhua Tang, Yuan Wang, Shuo Wang, Yanbin Hao

2026-08-12视觉感知

本文针对扩散文生图模型中概念擦除难以兼顾“精确”和“持久”的问题,提出用 k-sparse Autoencoder 分解去噪网络内部激活,通过对比目标与非目标提示定位稀疏概念特征,再把抑制目标特征和保持互补特征写入模型参数。实验中,PEAK 在 I2P 上将 NudeNet 检测从 582 降至 6,平均攻击成功率从 96.52% 降至 5.63%,同时在 MS-COCO 上保持近零 KID。

ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes Figure 1
2026-08-12cs.CV

ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes

Xinrui Lin, Sha Zhang, Shumin Wang, Zenghuan Zhu, Jiajun Deng, Yanyong Zhang

2026-08-12视觉语言三维

本文针对杂乱三维场景中机器人需按语言指令定位小型可交互区域的问题,指出现有方法常因候选区域缺失、粒度过粗或关系推理混淆而失败。ThinkAfford将任务拆为高召回 affordance 候选生成与指令驱动选择:APG用可学习 affordance 提示和多层视觉特征生成细粒度候选,VPAR在标注叠图上推理并用GRPO按三维重叠奖励优化选择。在SceneFun3D上取得10.69% AP50、25.46% AP25,优于可比基线。

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores Figure 1
2026-08-12cs.CV

A Dataset and Benchmark for Optical Music Recognition of String Quartet Scores

Dongmin Kim, Brian Liu, Jose J. Valero-Mas, Dasaem Jeong

Music & Arts Learning (MALer) Lab, Sogang University, Seoul, South Korea, Pattern Recognition and Artificial Intelligence Group, University of Alicante, Alicante, Spain, The dataset and benchmark code are publicly available at

2026-08-12视觉感知数据集/基准

多声部乐谱的 OMR 研究长期受限于缺少对齐数据,本文构建 OSSQ-OMR,将 116 部弦乐四重奏的 IMSLP 扫描谱与数字转写逐项视觉对齐,并提供系统/谱表两级图像及 LMXE、**kern、ABC 三种编码。基准显示任务可行,最佳 OMR-NED 在合成图像为 3.6%、扫描图像为 5.9%,且编码和分割选择对结果影响大于模型架构。

CARE: Confidence-Aware Reasoning for Reliable Medical VQA Figure 1
2026-08-12cs.CV

CARE: Confidence-Aware Reasoning for Reliable Medical VQA

Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

University of Michigan, City University of Hong Kong

2026-08-12视觉感知

针对医疗 VQA 中推理型多模态模型虽能生成 CoT、却常把主观置信度与真实诊断准确率错配的问题,CARE 将经验证的 Medical-CoT 合成数据用于 SFT 冷启动,并在 GRPO 中引入置信度感知奖励,把“答对且有相称置信度”纳入优化目标。文中报告其在三个医疗 VQA 基准上同时提升准确率、降低 ECE 与幻觉率,但具体增益中数据合成与奖励设计各自贡献仍需看消融细节。

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs Figure 1
2026-08-12cs.CV

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

2026-08-12视觉语言规划控制

针对现有 VLM 后门多为固定触发器到固定目标、难以适应攻击目标变化的问题,论文提出一次投毒后可在推理时动态指定目标 caption 的 any-to-any 后门。核心做法是用多样触发-文本对诱导模型学习“触发即指令”,再用特征空间隐写把任意目标文本映射为隐蔽扰动或非语义 patch。LLaVA 在 Flickr8k/30k 上显示较高控制成功率、干净性能基本保持,并能绕过若干经典防御。

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes Figure 1
2026-08-12cs.CV

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

University, of Chinese Academy of Sciences (UCAS), Beijing, 101480, China, Institute of Information Engineering, CAS, Beijing, 100085, China

2026-08-12视觉语言数据集/基准

复杂城市场景中的雨雾、夜间和遮挡会使多模态大模型仅凭最终答案评测时掩盖感知与推理脱节。论文提出 AD2-Bench,将问题拆成证据链并用事实、逻辑、一致性和可解释性诊断;同时提出 EGVOR,以显式 Evidence Atoms 约束空间定位与语义描述。实验显示该方法能降低推理不稳定性并提升可信多模态认知,但具体增益来源仍可能部分来自数据与训练流程。

Multiple Scale Latents for Learned Image Compression Figure 1
2026-08-12cs.CV

Multiple Scale Latents for Learned Image Compression

Jonas Brenig, Radu Timofte

2026-08-12视觉感知

这篇论文针对学习式图像压缩中单一潜变量和超先验难以同时刻画多尺度空间结构的问题,提出在不同分辨率上设置多个潜变量,并为各尺度配套熵模型,以更细地分摊图像结构信息。方法可端到端用标准率失真目标训练,并能接入现有上下文建模;在 Kodak 上相对 VVC 报告 17.9% BD-rate 降低,但具体增益在多尺度表示、熵模型选择与训练规模之间的归因仍不完全清楚。

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding Figure 1
2026-08-12cs.CV

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

2026-08-12视觉感知生成模型

面向自动驾驶、具身机器人等连续视频场景,StreamFlow针对流式MLLM在有限记忆下重复编码静态内容、历史证据访问僵硬的问题,提出动态中期记忆、潜在长期记忆与基于视觉注意力的按需注入机制,在编码前过滤时序冗余并在生成中补回相关历史视觉信息。实验报告StreamingBench准确率67.73%,较前最佳高4.63%,VAS提升59.1%,同时延迟和峰值显存分别降低50.4%与21.1%。

Mixture-of-Experts-based Entropy Model for Learned Image Compression Figure 1
2026-08-12cs.CV

Mixture-of-Experts-based Entropy Model for Learned Image Compression

Jonas Brenig, Radu Timofte

2026-08-12视觉感知

针对学习式图像压缩中熵模型需适应不同图像特性、但自回归上下文建模计算代价较高的问题,论文将稀疏 MoE 引入分组通道熵模型,用门控为每张图像选择专家,并结合共享自注意力与 FFT 注意力专家提升上下文预测容量。结果显示 MoEE 在 Kodak 上相对 VVC 达到 -16.85% BD-Rate,并在与 DCAE、MLIC++ 等方法比较时保持有竞争力的解码延迟。

GS-CPE: Unified 6-Degree-of-Freedom Camera Pose Estimation via 3D Gaussian Splatting Figure 1
2026-08-12cs.CV

GS-CPE: Unified 6-Degree-of-Freedom Camera Pose Estimation via 3D Gaussian Splatting

Huaiyuan Weng, Chul Min Yeum, Su-Min Kang

Huaiyuan Weng and Chul Min Yeum are with the Department of Civil and Environmental Engineering, University of Waterloo, 200 University Ave. W., Waterloo, ON N2L 3G1, Canada.

2026-08-12三维

本文针对机器人在预建三维地图中做 6-DoF 视觉定位时难以同时兼顾泛化、精度与效率的问题,提出 GS-CPE:先基于图像检索和几何估计在 3DGS 场景中获得粗位姿,再用可见性掩码、多尺度优化和自适应重渲染进行 RGB warping 精修。实验覆盖 7Scenes、Cambridge、FAST-LIVO2 等室内外数据,报告相较 APR、SCR 与神经渲染定位方法取得更高精度和更好泛化。

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense Figure 1
2026-08-12cs.CV

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

Siyuan Liang, Yupeng Qiu, Junfeng Fang, Rong-Cheng Tu, Jiaxing Huang, Dacheng Tao

Nanyang Technological University, National University of Singapore

2026-08-12视觉感知安全鲁棒

针对文本到视频模型易被越狱提示诱导生成违规内容、而输入过滤或重写会带来语义扭曲和延迟的问题,SafeCA从扩散过程的交叉注意力特征入手,指出 clean 与 jailbreak 样本存在累积分离和线性可分性增强现象,并据此定位高风险步与模块进行能量归一化注意力抑制、语义适配和恶意词回溯。实验在 Open-Sora 与 CogVideo 上将攻击成功率相对降低约20%,额外开销约0.1秒,同时基本保持文本视频一致性。

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation Figure 1
2026-08-12cs.CV

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

The Hong Kong University of Science and Technology

2026-08-12视觉感知

论文针对现有相机运动理解只做整段标签、忽略镜头内变化和复合运动的问题,提出按时间区间定位并识别多种同时发生运动的任务与 CamChoreo 基准;方法上用 CamDistill 将 3D 几何教师的相机 token 蒸馏到轻量分支,推理时移除教师。实验中 4B 模型经 SFT 从任务基线提升到 62.2 micro F1,CamDistill 达 67.5,并接近直接注入几何特征的效果。

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences Figure 1
2026-08-12cs.CV

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

University of Bologna, NOVA School of Science and Technology, University of Bologna Bologna Italy, NOVA School of Science and Technology NOVA Laboratory for Computer Science and Informatics Lisbon Portugal

2026-08-12视觉语言视觉感知

针对多图叙事和生成视频评估中常见的“只看单帧、不看顺序”问题,本文将 LVLM 作为时间顺序裁判来诊断其视觉序列推理能力,构造 PRISM/MIRAGE 等成对比较任务并分析首因、近因等位置偏置。结果显示,模型在单序列打分上看似可用,但在区分正确顺序与打乱序列时显著崩塌,微调后偏置仍存在,说明瓶颈更像结构性缺陷而非单纯数据不足。

VIDS-Seg: Towards Reliable Uncertainty Quantification in Pediatric Cardiac Ultrasound Segmentation Figure 1
2026-08-12cs.CV

VIDS-Seg: Towards Reliable Uncertainty Quantification in Pediatric Cardiac Ultrasound Segmentation

Paul Fischer, Ece Ozkan

2026-08-12视觉感知安全鲁棒

本文关注成人心超分割模型用于儿科、尤其婴儿时可能“自信地失效”的安全问题。作者将 VIDS 的分布外自适应先验扩展到密集分割,仅在轻量预测头上做摊销变分推断,以避免重训主干。实验显示其分割精度不降,但不确定性与错误区域更一致,并改善婴儿射血分数估计和心功能异常检测。

Sensor-Informed Per-Point Covariance for Structured-Light 3D Imaging Figure 1
2026-08-12cs.CV

Sensor-Informed Per-Point Covariance for Structured-Light 3D Imaging

Sehoon Tak, Jae-Sang Hyun

2026-08-12三维

这篇论文针对结构光三维重建中点云协方差常被设为常数或由局部几何估计、难以反映传感测量噪声的问题,提出将实验测得的相位精度经标定的相位到深度/三维映射传播为逐点3×3协方差,并用横向扰动补全满秩。重复平面实验显示主不确定方向与视线一致,G-ICP中相比各向同性常数模型有明显改进,但与几何协方差的互补收益范围仍有限。

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes Figure 1
2026-08-12cs.CV

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

∗ Equal contribution. 1 Department of Robotics, Perception and Learning, KTH Royal Institute of Technology, Sweden.

2026-08-12视觉感知

这篇论文针对服务机器人仅记住物体位置和时间、难以回答“谁如何使用过物体”等活动问题,提出 GESTO:把4D场景图与原子人-物交互和高层目标事件组成的两级活动记忆相连,并从RGB-D流自动抽取、分组和修正 grounding。实验在既有问答基准及新增 Space2Event/Event2Space 查询上取得约0.70-0.75分,接近使用真值事件与物体关联的方法,消融显示事件层级与上下文修正均有贡献。

ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral Figure 1
2026-08-12cs.CV

ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

Md Rabiul Islam, Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

2026-08-12视觉感知

本文针对肺结节良恶性筛查中专科影像模型依赖标注数据、难解释且缺少可审计分诊策略的问题,提出 ConfTriage:让 LLM 读取结构化结节属性的自然语言描述,并用 Platt 校准后的置信度决定是否转交专科 DL 后备模型。实验显示语言化属性承载主要诊断信号,低层图像统计贡献很小;在 LIDC-IDRI 上达到 F1 88.22%、AUC 0.92,约 76.5% 病例由零样本 LLM 直接处理。

NullEdit: Stealthy Image Protection via VLM Condition Redirection Figure 1
2026-08-12cs.CV

NullEdit: Stealthy Image Protection via VLM Condition Redirection

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

2026-08-12视觉语言视觉感知

这篇论文针对公开图片可被 VLM+DiT 编辑器按指令无微调篡改的问题,提出 NullEdit:不破坏图像外观或身份,而是在 VLM 联合条件表示上用正常编辑/无编辑锚点进行重定向,并通过跨提示梯度平均泛化到未见指令。实验在 Step1X-Edit、Qwen-Image-Edit 及人脸数据集上,相比 SOTA 平均降低 EditReward IF 0.813,同时保持主体身份和源内容。

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models Figure 1
2026-08-12cs.CV

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

2026-08-12视觉语言视觉感知

本文针对VLM在多视角空间推理中几何表示脆弱、而直接特征蒸馏又会破坏视觉-语言对齐的问题,提出MVRD:不匹配教师几何特征本身,而蒸馏跨视角patch余弦相似关系,使学生保留预训练语义空间。实验显示其在VSI-Bench优于SFT和特征蒸馏,接近特征融合方法,同时参数和延迟开销更低,并迁移到3D场景理解任务。

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility Figure 1
2026-08-12cs.RO

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

◆ University of Washington, ‡ Allen Institute for AI

2026-08-12强化学习

这篇论文针对现有世界-动作模型主要预测 RGB 潜变量、缺少操控所需几何与语义监督的问题,提出 Flex-π:用同一冻结视频 VAE 编码 RGB 与 3D pointmap,并加入 DINO 语义流,在 Mixture-of-Transformers 中联合去噪动作和多视觉流;训练时通过流 dropout 与跨模态强制,使单一 checkpoint 可在动作-only 到全联合生成间切换。实验显示其在 RoboTwin、LIBERO 和真实双臂精细操作中较强基线提升约 1.9× 到 2-7×,且动作-only 推理快于 π0.5。

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset Figure 1
2026-08-12cs.CV

The GENEA Challenge 2026: A Large-Scale Disentangled Evaluation of Speech-Driven Gesture Generation on the Seamless Interaction Dataset

Rajmund Nagy, Silvia Arellano García, Hendric Voss, Mihail Tsakov, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter

KTH Royal Institute of Technology, Bielefeld University, Electronics and Telecommunications Research Institute (ETRI)

2026-08-12数据集/基准

针对语音驱动手势生成缺少可比评测、BEAT2 已难区分进展的问题,本文将 GENEA 2026 转向更大且含双人互动与语义手势的 Seamless Interaction 数据集,并用解耦的人类偏好、音频/文本错配评测分别考察动作真实感、语音对齐、对话者响应和语义表达。结果显示 mocap 仍显著优于参赛系统:最佳系统语音对齐仅 32%,双人响应基本接近机会水平,语义表达最佳也只有 8%,说明当前模型短板主要在条件对齐而非单纯生成动作。

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms Figure 1
2026-08-12cs.CV

PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms

Yutong Jiang, Zahra Atashgahi, Carlos Soto Garcia Delgado, Ruben Brokkelkamp, Davide Zanutto, Efşan Sökmen, Shahin Shahkarami

2026-08-12视觉语言

PolyLayout面向家装零售中的真实户型难题:现有布局生成多假设矩形房间,难以同时满足门窗、异形边界和商品级摆放规则。论文将任务拆成家具功能聚类、VLM在多边形平面上的宏观锚定,以及规则求解器的碰撞消解与精确落位。结果显示其在IKEA商品和不规则房间上获得更高感知合理性、较好几何合规和低延迟,但评测房间数量较少,跨设置增益来源仍需更受控验证。

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations Figure 1
2026-08-12cs.CV

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

Bar-Ilan University, Ramat Gan, Israel, University of Groningen, Groningen, The Netherlands

2026-08-12视觉语言

针对大视觉语言模型常在图像问答中生成未被视觉证据支持的内容,本文关注比整体判别更可操作的 token 级幻觉定位。UniProbe 不微调骨干模型,而是从单次前向中抽取图像 patch、查询和生成 token 的内部轨迹,用注意力图、ViT、GNN 与 GRU 联合建模空间、关系和序列结构,并扩展到流式解码中拒绝重采样疑似幻觉 token。实验显示其在 token 级和对象幻觉检测上优于既有方法,自适应后可将对象幻觉降低最高 55%,延迟约为标准生成的 1.06 倍。

MIRA: Medical Image Reflection for Agentic Diagnosis Figure 1
2026-08-12cs.CV

MIRA: Medical Image Reflection for Agentic Diagnosis

Shengzhi Wang, Jun Yang, Kai Wu, Xiaozhong Ji, Yiwen Ye, Ziyang Chen, Mingliang Xiong, Wen Fang, Mingqing Liu, Mengyuan Xu, Miaoxuan Shan, Caiyan Liu, Bin He, Qingwen Liu

Tongji University, Nanjing University, Northwestern Polytechnical University, Security University of China

2026-08-12视觉感知

医学视觉诊断中,盲目调用放大、定位或检索工具可能引入噪声并放大错误推理。MIRA的核心在于把诊断改造成主动取证、工具使用校验和反思纠错的循环,并用MCTS生成的工具轨迹做SFT,再以在线反思原则演化进行RL优化。实验显示其在多类医学VQA、病灶、放射和病理基准上稳定优于Qwen3-VL-8B,并接近更强开源或闭源模型。

Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models Figure 1
2026-08-12cs.RO

Neural Introspection Gating for Adaptive KV-Cache Reuse in Vision-Language-Action Models

Zhijie Wu, Kento Kawaharazuka, Kei Okada

2026-08-12视觉语言视觉感知

这篇论文针对 VLA 实时控制中相邻帧视觉 token 重复计算代价高、而既有 VLA-Cache 仅凭图像相似度可能复用过期 KV 的问题,提出无需训练的 Gated VLA-Cache:用动作解码时 top-1/top-2 logit margin 作为模型自信度门控,低置信时触发全量重算。实验在 LIBERO 多套任务和 OpenVLA/OpenVLA-OFT 上显示,它在 Goal、Long 等盲缓存掉点场景可恢复超过全部损失精度,同时保留约 80% 计算节省。

Modelling Geographic Atrophy Progression using Implicit Neural Representations Figure 1
2026-08-12cs.CV

Modelling Geographic Atrophy Progression using Implicit Neural Representations

Simone Sarrocco, Paul Friedrich, Florentin Bieder, Christina Bornberg, Philippe Valmaggia, Peter Maloca, Philippe Cattin

2026-08-12视觉感知

针对地理萎缩进展高度个体化且纵向FAF数据稀缺的问题,本文将病灶变化建模为连续的眼别轨迹,用带眼别潜变量、时间和年龄调制的隐式神经表示联合生成FAF图像与GA分割。结果显示其图像质量大体保持竞争力,同时在多种预测场景中取得更低病灶面积MAE和更高DICE,优势主要体现在个体化分割与面积估计。

Fast and Memory-Efficient Wavelet Convolutions via I/O-Aware Reformulation Figure 1
2026-08-12cs.CV

Fast and Memory-Efficient Wavelet Convolutions via I/O-Aware Reformulation

Amit Aflalo, Shahaf E. Finder, Roy Amoyal, Eran Treister, Oren Freifeld

The Department of Computer Science, Ben-Gurion University of the Negev, Israel

2026-08-12视觉感知

论文针对 WTConv 虽能以线性参数扩大感受野、但实际实现被 HBM 数据搬运拖慢的问题,指出瓶颈不在 FLOPs 而在中间小波系数反复物化。作者用 I/O 模型指导精确重写:片上重算 Haar 分析、将多级合成折叠为按坐标位索引的闭式过程,并把通道缩放并入卷积权重。CUDA 实现使 HBM 流量约降 2.55 倍,训练相对参考实现最高加速 4.35 倍,峰值显存约减半。

BPG: Balancing Plasticity and Generalization for Domain Incremental Learning Figure 1
2026-08-12cs.CV

BPG: Balancing Plasticity and Generalization for Domain Incremental Learning

Qiang Wang, Songlin Dong, Shaokun Wang, Jizhou Han, Xiang Song, Chenhao Ding, Yuhang He, Yihong Gong

Qiang Wang, Jizhou Han, Yuhang He, and Yihong Gong are with the College of Artificial Intelligence, Xi’an Jiaotong University, Xi’an, China., Songlin Dong is with Shenzhen University of Advanced Technology, Shenzhen, China., Shaokun Wang is with Harbin Institute of Technology, Shenzhen, China., Xiang Song and Chenhao Ding are with the School of Software Engineering, Xi’an Jiaotong University, Xi’an, China.

2026-08-12学习理论

这篇论文针对域增量学习中参数隔离方法的两类失衡:不同域难度不同却使用统一 adapter 容量,以及测试时硬选择域 ID 容易误分。BPG 的核心做法是用预训练特征可分性为各域动态分配 adapter 维度,并在推理时以置信度加权混合多个域专家。实验在 DomainNet、CDDB、CORe50 上优于统一容量和硬选择基线,DomainNet 遗忘率最低降至 0.22%。

Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery Figure 1
2026-08-12cs.CV

Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery

Roni Blushtein-Livnon, Tal Svoray, Osher Rafaeli, Michael Dorman, Itay Fischhendler, Havazelet Yahel, Emir Galilee

2026-08-12视觉感知

面向离网地区小型光伏缺乏时空清查数据、遥感分割又受目标稀疏和背景失衡影响的问题,论文系统比较 SAM3 的文本、几何与混合提示,并考察标注规模、迁移训练、分辨率和跨数据集稳定性。核心洞察是提示类型主导模型行为:纯文本提示最弱且最敏感,空间提示显著提升精度和鲁棒性,混合提示最佳;少量数百标注已带来主要收益,迁移学习总体增益有限。

Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization Figure 1
2026-08-12cs.CV

Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization

Swarnim Maheshwari, Syed Imam Ali, Vineeth N. Balasubramanian

Indian Institute of Technology Hyderabad, Kandi, Telangana, India, Abstract. Most image colorization systems operate in Lab space by pre-, sistent formulation: convert an RGB image to the Lab color space [8], preserve, the fixed-luminance bottleneck in Lab-based colorization and show why it is

2026-08-12视觉感知

这篇论文针对传统 Lab 上色固定亮度通道导致无法调整明暗的问题,指出该假设在红光不敏感的历史正色片中会系统性压低红色和亮部。作者将上色改写为基于图像编辑基础模型的全 RGB 生成,并用混合灰度目标同时训练全色与正色条件。实验显示其在常规灰度上保持竞争力,在正色输入上更稳健、局部颜色伪影更少,但真实胶片响应的物理建模仍较简化。

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment Figure 1
2026-08-12cs.CV

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

2026-08-12视觉语言数据集/基准

这篇论文针对多模态模型在情感理解中常把“人物表达的情绪”和“观众被唤起的情绪”分开、且标注粒度粗的问题,构建 E3mo-Bench:基于 2524 个视频生成 12314 个问答,覆盖感知、开放词表识别和 VAD 评估,并用 Bayesian Pairwise Alignment 将稀疏成对比较校准为连续情感分数。实验显示现有 MLLM 在唤起/表达两类范式上表现明显失衡,细粒度识别和维度评分仍是短板。

MVTrack: Ultrafast Appearance-Free Moving Object Tracking from Compressed Bitstreams Figure 1
2026-08-12cs.CV

MVTrack: Ultrafast Appearance-Free Moving Object Tracking from Compressed Bitstreams

Iñaki Erregue, Kamal Nasrollahi, Sergio Escalera

2026-08-12视觉感知

这篇论文针对大规模监控中 RGB 解码与检测器带来的算力瓶颈,主张许多跟踪任务只需运动而非外观信息。核心做法是直接从 H.264 码流的运动向量构建 MVDet 检测器,并用基于运动学的 MVLink 进行关联,完全绕开像素重建。在 VIRAT 上,MVTrack 相比 YOLO26n 参数少 60 倍、FLOPs 少 40 倍、CPU 延迟降低 8.6 倍,同时取得更好的跟踪表现。

Compositional Benchmark Synthesis for Hierarchical Human Action Recognition Figure 1
2026-08-12cs.AI

Compositional Benchmark Synthesis for Hierarchical Human Action Recognition

Farnaz Soleimani (LISSI), Abdelghani Chibani (LISSI), Yacine Amirat (LISSI), Ghazaleh Khodabandelou (LISSI)

A benchmark-generation and evaluation framework that builds a four-level intention hierarchy from a flat, single-label action corpus., isolated clips, 1 label each, labeled episodes

2026-08-12视觉感知数据集/基准

面向机器人协作等场景中从动作推断长期意图的需求,本文不提出新识别模型,而是把单标签动作库组合成动作、活动、低层意图、高层意图四级基准。关键在于保留真实动作特征、用覆盖感知采样缓解主体不均衡,并将生成规则与评估逻辑分离以降低循环监督。实例生成15002个片段,主体使用Gini由0.566降至0.248,四类基线均出现0.13至0.17 macro-F1的组合泛化缺口,说明难点更像是基准结构属性。

FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding Figure 1
2026-08-12cs.CV

FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding

Fufangchen Zhao, Jinhu Fu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Danfeng Yan

2026-08-12视觉感知

论文指出反事实视频理解的多选评测会通过问题和选项泄露待检查事件,使模型从主动发现退化为文本引导验证。FADE以证据优先的两阶段训练结合证据内化SFT与逐步移除文本锚点的RL,并把既有MCQ改写为MCQ、开放问答和描述任务评测。基于Qwen3-VL-8B,在DualityVidQA-test和IPV-Bench取得三类任务SOTA,且OQA和描述保留率达90.4%与67.4%,高于GPT-5.6。

Where To Look? : Causal Tracing of Vision Encoders in VLM Figure 1
2026-08-12cs.CV

Where To Look? : Causal Tracing of Vision Encoders in VLM

Naren Kumar S, Tirth Bhatt, Mayank Singh

LINGO Research Group, Indian Institute of Technology Gandhinagar, India

2026-08-12视觉语言视觉感知

这篇论文针对 VLM 高分表现是否真的依赖目标区域视觉证据的问题,将因果追踪扩展到视觉编码器,用激活修补衡量层- token 对图文相似度的因果贡献,并与目标框 IoU 比较。结果显示,CLIP 及更大 VLM 中因果重要 token 常位于目标区域外,整体相关性很低,且在不同扰动下仍存在;结构追踪实验也表明模型容易依赖外观线索,说明性能提升不等于空间因果 grounding 更好。

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting Figure 1
2026-08-12cs.RO

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

The Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology, The Hong Kong University of Science and Technology (Guangzhou) Guangzhou Guangdong China, The Hong Kong University of Science and Technology Hong Kong China

2026-08-12机器人视觉语言三维

面向家庭移动操作中语言目标在遮挡、杂乱和基座姿态约束下难以可靠落地的问题,论文把主动多视角 Semantic-3DGS 作为感知到动作的共享中介,并只在扩散 VLA 后段注入三维语义以保留动作先验。真实机器人实验显示,长时程成功率达 60%,高于 PointVLA 的 40% 和 DexVLA 的 28%;重度杂乱场景达 74%,并能缓解高度变化和照片诱导误抓。

Beyond Pixels: From Video Priors to 4D Worlds Figure 1
2026-08-12cs.CV

Beyond Pixels: From Video Priors to 4D Worlds

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

2026-08-12视觉感知强化学习

这篇论文针对4D生成中“先生成RGB再重建”易累积误差、端到端几何生成又绑定特定视频模型的问题,提出把共享VAE的视频DiT最终去噪latent作为可复用4D接口。Latent-to-4D用L4AR对齐视频latent与4D解码token网格,并在约1K重建片段上训练后跨同VAE生成器迁移;在Text4D-200和I4D-200上DINO-F1较Wan+4RC提升2.88–5.81点,人评也偏好其几何与时序稳定性,但结论仍限于共享VAE设定。

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement Figure 1
2026-08-12cs.CV

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

Indian Institute of Technology Jammu, SCB Dental College and Hospital, Cuttack

2026-08-12安全鲁棒

这篇论文针对医疗场景中 LLM 被迫作答时容易过度自信、而简单拒答又降低可用性的矛盾,提出把 abstention 视为不确定性控制信号:先独立验证多选假设,只有输出 UNKNOWN 时再用 SNOMED CT 做定向本体 grounding。实验显示该策略在 MedReason/MedQA 上将题级准确率从 82.9% 提升到 92.5%,假设级准确率从 92.0% 提升到 96.2%,且接近知识图谱检索方法但不需预先构建 curated KG。

InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection Figure 1
2026-08-12cs.CV

InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection

Qi Ming, Zihan Yang, Shaoguang Huang, Si Sun, Hanqing Zhang, Nanqing Liu, Jiahui Lv, Juan Fang, Aleksandra Pizurica

Beijing University of Technology, 2 Southwest University, 3 China University of Geosciences Wuhan, Tsinghua University, 5 Beijing Institute of Technology, Yunnan Normal University, 7 Beijing Forestry University, Department of Telecommunications and Information Processing (TELIN), Ghent University

2026-08-12视觉语言视觉感知

面向RGB-红外目标检测的双分支冗余与部署开销,InterPruner指出单模态剪枝会忽略跨模态补偿和场景变化,因而用Taylor-Implicit准则评估通道贡献、MIRA分析模态间可补偿冗余,并引入语言先验做场景感知通道锚定。实验称在FLIR上剪掉50%通道仍可提升0.6% mAP,但增益来源是否来自剪枝准则本身仍需更多消融支撑。

Grid-Preserving Knowledge Distillation: Transferring Convolutional Inductive Bias to Vision Transformers under Data Scarcity Figure 1
2026-08-12cs.CV

Grid-Preserving Knowledge Distillation: Transferring Convolutional Inductive Bias to Vision Transformers under Data Scarcity

Junyong Choi, Cheolhyeon Park, Jaehoon Cho

2026-08-12视觉感知

本文针对小数据下 ViT 难以学到 CNN 局部性、平移等变等归纳偏置的问题,指出常规特征蒸馏因池化、展平或 logit 投影破坏空间网格对应而失效。作者提出 iBKD/IBAM,在训练中保持教师与学生特征的网格传递,通过多层对齐、可变形增强和卷积交叉注意力注入 CNN 偏置,推理时仍是原始 ViT。实验覆盖 7 个 Transformer 骨干和 6 个小数据基准,优于通用 KD 与 LG/ALG,且数据越少优势越明显。

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence Figure 1
2026-08-12cs.AI

Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence

Haoyu Zhang, Zhipeng Li, Xiaoying Tang, Tianshu Yu, Yiwen Guo

The Chinese University of Hong Kong, Shenzhen, This factorization is motivated by data availability, systems explore speech-centered instruction follow-

2026-08-12视觉感知

论文针对全模态对话系统“能说但没有视觉在场”的问题,提出 Ex-Omni-2D:先由对话上下文生成视觉思维计划,再用多码本语音单元同时驱动个性化语音和帧对齐头像视频,从而绕开大规模文本-语音-视频全配对数据需求。实验给出教师模型与前缀流式学生模型的质量/效率权衡,四步推理四卡端到端 RTF 为 1.293,但流式版本仍非真正实时。

Compact Feed-Forward 3D Gaussians via Saliency-Guided Primitive Merging Figure 1
2026-08-12cs.CV

Compact Feed-Forward 3D Gaussians via Saliency-Guided Primitive Merging

Tim-Felix Fassch, Jochen Kall, Cyrill Stachniss

2026-08-12三维

针对前馈3D Gaussian重建常产生逐像素高冗余基元、拖慢渲染并增加存储的问题,论文提出一个可接在任意前馈骨干后的显著性引导合并模块:用自适应超像素按纹理复杂度分配容量,再以学习式编码、跨视角匹配融合和LOD解码生成紧凑高斯。结果显示在约1/20基元数量下基本保持新视角合成质量,并较既有减基元方法更稳健。

Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models Figure 1
2026-08-12cs.CV

Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models

Seokhyun Youn, Dahyeon Kye, Sung-Ho Bae, Jihyong Oh

2026-08-12视觉感知三维

本文针对3D视觉基础模型虽能前向预测深度、位姿和点图,但预训练中缺少显式多视几何一致性导致结果不稳定的问题,提出Self-Geometry:在测试时用2D像素匹配作为伪监督,结合多视一致性、极线一致性和梯度解耦,并用SO(3)视角采样与LoRA轻量适配。实验显示其在6个VFM和4个基准上普遍提升位姿与几何估计,单场景适配可在约两分钟内完成。

MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding Figure 1
2026-08-12cs.CV

MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

2026-08-12视觉语言数据集/基准

该文针对现有视觉语言模型在艺术理解中偏向表层描述、缺少形式分析、情感与历史语境的问题,提出 MMArt:为 74234 幅 WikiArt 作品同时构建叙事、形式、情感、历史四种独立视角及统一 caption。核心洞察是不同视角并非冗余:生成重建中形式描述最能保留构图风格,检索中叙事描述 R@1 达 44.0%,而形式仅 7.8%,历史视角在留一分析中最难替代。

Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition Figure 1
2026-08-12cs.CV

Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition

Zhibin Ma, Pengwen Dai, Yi Liu, Xugong Qin, Chenyun Yu, Xiaochun Cao

2026-08-12视觉感知

针对场景文本识别中竖排、倒置等多方向输入常使识别器依赖方向估计、校正模块和旋转增强的问题,本文将旋转等变编码器与利用交叉注意力旋转不变性的解码器结合为 RISTER,并给出相应理论证明。实验显示其在标准与多方向基准上达到 SOTA,在通用多方向数据集上较次优方法准确率高 4.0%,且不增加额外推理开销。

Visual Geometry Foundation-Aware Gaussians for Single-Frame Surround-View Driving Reconstruction Figure 1
2026-08-12cs.CV

Visual Geometry Foundation-Aware Gaussians for Single-Frame Surround-View Driving Reconstruction

Junhong Lin, Jinlong Wang, Xianda Guo, Yanlun Peng, Wei Zheng, Guoqing Liu, Hanli Wang, Tiesong Zhao, Wei Gao

Xianda Guo is with Wuhan University, Wuhan, China. Yanlun Peng is with Great Wall Motor, China. Wei Zheng, Guoqing Liu is with Minieye Corporation, Shenzhen 518055, China., Hanli Wang is with Tongji University, Shanghai, 200100, China., Tiesong Zhao is with Fuzhou University, Fuzhou, 350108, China., Our code will be available at: https://github.com/JHLin42in/VGGD.

2026-08-12三维

这篇论文针对单帧环视自动驾驶重建中相机重叠少导致的几何不稳定、尺度漂移和渲染伪影,提出 VGGD:把几何建模前移到预训练视觉几何基础模型 VGGT,并用 Dual-Path Neck 分离几何一致性与外观补全特征,配合 Scale Warmup 稳定早期尺度学习。nuScenes 单帧实验显示其在对比方法中取得最佳整体新视角渲染质量,并提升相对几何一致性。

Bridging Severe Cross-Modal Misalignment: End-to-End Visible-Infrared Object Detection via Explicit Feature-Domain Affine Registration Figure 1
2026-08-12cs.CV

Bridging Severe Cross-Modal Misalignment: End-to-End Visible-Infrared Object Detection via Explicit Feature-Domain Affine Registration

Qi Ming, Yuyang Wang, Mingjing Zhao, Yifan Xiao, Zhixin Guo, Zhiqiang Zhou, Peng Sun, Juan Fang, Fuqiang Yang, Xudong Zhao

Beijing University of Technology, China, Central South University, China, Beijing Electronics Science & Technology Institute, Beijing Institute of Technology, China, Information Support Force Engineering University, China, Trunk Technology (Beijing) Co., Ltd., China

2026-08-12视觉感知

针对可见光-红外目标检测在传感器视角、位姿或平台运动导致的大幅跨模态错位下融合失效的问题,论文提出 JFRDet:用 CMAA 在特征域显式估计并施加图像级仿射配准,再用 IGCF 按光照自适应融合 RGB/红外信息,并以 AQCG 按配准质量调节检测监督。作者还构建 DVMA 强错位基准,报告在该数据集上达到 69.7% mAP50;但结果依赖新构造数据集,跨真实场景泛化仍需进一步验证。

Chartography: A Benchmark for Professional Chart Understanding Figure 1
2026-08-12cs.CV

Chartography: A Benchmark for Professional Chart Understanding

Suhaas Garre, Chris Mutty, Sushant Mehta, Edwin Chen

2026-08-12数据集/基准

现有图表理解基准多集中于简单柱线饼图且已接近饱和,难以反映医疗、工程、金融等专业场景中的真实读图需求。Chartography用100个专家编写并三重验证的专业图表任务,引入按题校准的容差和全对全错评分,强调视觉估计与领域约定。30种前沿模型配置中最佳仅45.0% pass@1,错误主要来自视觉定位、稀疏坐标读数、3D投影和规则使用,而非单纯推理不足。

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus Figure 1
2026-08-12cs.AI

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

2026-08-12视觉语言

论文针对多模态大模型推理链中局部看似合理但会级联导致错误的步骤,提出无需训练的 VERDICT:让视觉、逻辑、上下文三个冻结评审独立打分,并用闭式共识建模分歧,把跨模态不一致作为不稳定信号来过滤和排序候选步骤。六个空间推理、视觉 grounding 与多模态抽象基准上,相比基线最高提升 5.95%,且未出现低于基线的退化。

Cross-View Sequential Visual Localization with Spatio-Temporal Context Modeling for Autonomous Driving Figure 1
2026-08-12cs.CV

Cross-View Sequential Visual Localization with Spatio-Temporal Context Modeling for Autonomous Driving

Jiaping Wang, Shaobo Li, Zhen Wang

and HD map matching, increasing cost and limiting scalability, School of Information Engineering, Chang'an University, P.R.China

2026-08-12视觉感知

这篇论文针对自动驾驶跨视角视觉定位中单帧匹配忽略时间上下文、易受遮挡光照和重复纹理影响的问题,提出在地面序列与卫星图匹配中引入递归跨帧注意力,用历史状态增强当前粗粒度特征,并结合候选区域分类与局部偏移估计实现两阶段定位。实验显示,CVIS平均误差由3.80米降至1.57米,KITTI-CVL迁移误差为2.61米,实车零样本平均误差2.84米。

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets Figure 1
2026-08-12eess.IV

Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets

Carlos Zamora, Hiram Zuniga, Ulises Orozco-Rosas, Kenia Picos

2026-08-12视觉感知数据集/基准安全鲁棒

针对白血病细胞显微图像在染色、设备和站点协议差异下泛化差的问题,本文将五个异构数据集标签统一,构建两阶段诊断流程,并比较 DinoBloom、BiomedCLIP、CLIP 在线性探测、LoRA 与检索增强分类下的表现;其关键洞察是用留出数据集暴露模型是否依赖数据集伪特征,但具体性能数值与各模块增益在给定文本中未充分说明。

PolypVision: A Three-Stage Hierarchical Deep Learning Framework for Classification and Segmentation of Colorectal Polyps Figure 1
2026-08-12cs.CV

PolypVision: A Three-Stage Hierarchical Deep Learning Framework for Classification and Segmentation of Colorectal Polyps

Hamidreza Bolhasani, Hamidreza Rastad, Amir Mohammad Akbari, Mohammad Tashakoripour, Parnian Asadollahi, Ata Khodami, Mojgan Forootan

Iran University of Science and Technology, Tehran, Iran, Tehran University of Medical Sciences, Tehran, Iran, Shahid Beheshti University of Medical Sciences, Tehran, Iran, polyp analysis. PolypVision is freely available as a web application at https://polypvision.com, a, related tasks—is particularly effective when labeled data is scarce, as is common in gastrointestinal pathology, Stage 3 (backbone initialization), enabling efficient learning from limited labeled data., coarse to fine-grained labels, has been explored in skin lesion analysis but remains underexplored in

2026-08-12视觉感知

针对结直肠息肉在内镜中需同时完成分型、边界定位和切除决策的问题,PolypVision将EfficientNetV2-M分类、UNet++分割和腺瘤亚型识别串成三阶段递进迁移流程,并加入Paris/JNet与切除方式建议。其在多公开数据集上报告帧分类AUC约0.99、Kvasir-SEG检测mAP@50为94.4%,但仍需前瞻性外部验证,且下游误差会受第一阶段影响。

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks Figure 1
2026-08-12cs.CV

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks

Wenbo Dong, Dipankar Bhattacharya, Akinari Kobayashi, Akira Seino, Fuyuki Tokuda, Xuzhao Huang, Kai Tang, Norman C. Tien, Kazuhiro Kosuge

2026-08-12视觉感知

面向机器人从叠放布料中取顶层的场景,论文指出层间边界弱、颜色纹理相近会使通用语义或边缘分割不稳定。其核心做法是在编码器-解码器分割骨干训练时加入边缘感知与形状感知两个辅助分支,用CAD参考掩码约束整体形状,推理阶段仍只用骨干网络。真实布料数据实验显示该训练策略优于若干基线,消融也支持两类监督对精度提升有贡献。

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation Figure 1
2026-08-12cs.IR

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

Zhuchenyang Liu, Ziyi Wang, Yao Zhang, Yu Xiao

Aalto University, Finland

2026-08-12视觉感知

面向企业文档检索等场景,现有视觉文档检索模型要么依赖数十亿参数、索引昂贵,要么小模型需多向量存储。DistilVDR用单个8B视觉语言教师分别蒸馏查询端和文档端,形成524M非对称单向量检索器,无需相关性标签或负采样。HiRes在ViDoRe v1-v3达61.74 NDCG@5、保留教师86.9%,Fast达59.98;索引较强小型多向量基线小15.6倍、速度约快一个数量级,但增益来源未被完全拆分。

MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models Figure 1
2026-08-12cs.CV

MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

Yuan Wang, Hualiang Wang, Yixin Chen, Songtao Jiang, Shujian Gao, Jiaming Lin, Siming Fu, Jian Wu, Zuozhu Liu

Zhejiang University, Fudan University

2026-08-12视觉语言视觉感知

MedUP针对医学VLM虽能生成文本但难以精确分割和定位的问题,认为坐标字符串或外部分割器会割裂区域与语言表示。其核心是UniMedTok,将医学区域掩码离散化为LLM词表中的mask token,使文本与区域在同一序列中双向建模。作者构建1.84M样本的UniMed-Train和UniMed-Bench,实验显示其在VQA、文本引导分割和区域理解上优于原生、agent式及双解码器Med-VLM,并接近专用分割模型。

InSight-doc: Agentic Visual Perception for Long-Document Understanding Figure 1
2026-08-12cs.CV

InSight-doc: Agentic Visual Perception for Long-Document Understanding

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

The Hong Kong University of Science and Technology

2026-08-12视觉感知

长文档视觉问答把多页高清图像直接塞入 MLLM,容易带来高延迟、长上下文退化和幻觉。InSight-doc 的核心是把分辨率作为推理时资源:先低分辨率浏览全文,再在多轮推理中按区域裁剪放大获取证据,且不依赖外部检索器。作者用含缩放轨迹的 SFT 数据和困难 RL 样本训练 8B 模型,在多项文档 VQA 上较基线提升 4.3–16.4 个准确率点,长文档幻觉降超 40%,延迟降 41%–68%。

Gaussian Sculpting: End-to-End Controllable Surface Reconstruction via Field Optimization Figure 1
2026-08-12cs.CV

Gaussian Sculpting: End-to-End Controllable Surface Reconstruction via Field Optimization

Ke Jiaxin, Juncheng Liu, Yi Wang, Zhouhui Lian, Bin Liu, Shengfa Wang, Xiangjia He

Dalian University of Technology, Massey University, Peking University, School of Computer Science, University of Nottingham Ningbo China, Dalian University of Technology China, Massey University New Zealand, Peking University China, School of Computer Science, University of Nottingham Ningbo China Ningbo China

2026-08-12规划控制优化算法三维

这篇论文针对3D Gaussian Splatting在视角受限时表面不完整、浮动伪影和后处理网格难以纠错的问题,提出将高斯锚定到演化的可微表面上,用受约束高斯作为渲染代理来引导SDF场优化,并通过双层训练隔离几何与高斯梯度、结合八叉树式多分辨率细分。实验显示其在物体级场景中能减少冗余表面和浮动伪影,补全缺失结构,在较低分辨率下仍获得更干净完整的网格。

BooST: Bridging Semantics and Motions for Efficient Skill Transfer Figure 1
2026-08-12cs.RO

BooST: Bridging Semantics and Motions for Efficient Skill Transfer

Jusuk Lee, Daesol Cho, Jonghun Shin, Seungyeon Yoo, Jonghae Park, Taekbeom Lee, H. Jin Kim

2026-08-12视觉感知

机器人技能迁移常在语义意图与运动细节之间取舍,导致跨任务泛化、抗视觉干扰和部署效率难以兼顾。BooST 的关键思路是用跨模态 VQ-VAE 将视觉语言语义与动作轨迹共同量化到统一技能码本,再蒸馏为轻量策略。仿真和真实 UR3 实验显示,它在少样本适应、跨机器人迁移和动态视觉干扰下均优于多类技能基线。

Rethinking Data Efficiency in Industrial Dense Prediction: Pretraining Coherence, Not Inductive Bias, Determines ViTs Low-Data Advantage Figure 1
2026-08-12cs.CV

Rethinking Data Efficiency in Industrial Dense Prediction: Pretraining Coherence, Not Inductive Bias, Determines ViTs Low-Data Advantage

Haoran Sui, Yaoyuan Jia

2026-08-12视觉感知

面向工业检测中标注样本稀缺、ViT-CNN混用效果不稳的问题,论文认为低数据劣势主要来自ImageNet预训练ViT骨干与COCO预训练CNN neck的统计/结构不一致,而非自注意力本身。其提出轻量AlignBlock做金字塔特征校准,并用2×2分解实验隔离骨干与neck贡献;结果显示近域场景约200样本后Swin-Graft可超过YOLOv11x,但远域小样本下CNN仍占优。

$π$-SUB: A Physics-Informed Synthetic Underwater Benchmark Dataset for Underwater Image Enhancement Figure 1
2026-08-12cs.CV

$π$-SUB: A Physics-Informed Synthetic Underwater Benchmark Dataset for Underwater Image Enhancement

Namritha Lasyapriya Maddali, Rajini Makam, Suresh Sundaram, Narasimhan Sundararajan

Namritha is an Intern at Department of Aerospace Engineering, Indian Institute of Science and Student at Department of Computer Science, PES University, Bangalore, India.

2026-08-12视觉感知数据集/基准

面向AUV/ROV视觉中真实成对清洁参考难获取、现有合成水下数据物理过程不足的问题,π-SUB用扩展Jaffe–McGlamery模型联合建模深度相关下行辐照、Jerlov水型IOP、生物吸收/荧光及散射,生成可控成对基准。实验显示其FID较Syrea低46%,训练多种UIE模型后在真实基准上提升UIQM并降低NIQE。

A HamNoSys-Guided Dataset and Baselines for Fine-Grained Isolated Handshape Recognition in Sign Language Figure 1
2026-08-12cs.CV

A HamNoSys-Guided Dataset and Baselines for Fine-Grained Isolated Handshape Recognition in Sign Language

Ushnish Sarkar, Suvajit Patra, Bhaswar Chattopadhyay, Pranab Singha Roy, Tapas Samanta

2026-08-12视觉感知数据集/基准

面向手语转写与识别中细粒度手形缺少统一、可跨说话人评测资源的问题,论文以 HamNoSys 4 手形表定义160类,采集15人14.4万张真实RGB图像,并给出ResNet、ViT、GCN、XGBoost及LOSO协议基准。结果显示被试相关划分可取得稳定参考性能,但跨被试泛化下降,且相近手形仍易混淆。

Iterative Erasure Count Is Not an Affine-Invariant Concept Dimension Figure 1
2026-08-12stat.ML

Iterative Erasure Count Is Not an Affine-Invariant Concept Dimension

Tingan Jin, Shuhang Dong, Haosong Li, Chung-Hsien Chou

2026-08-12视觉感知

论文针对用迭代擦除次数衡量神经表示中“概念维度”的做法,指出该计数会随可逆仿射重参数化改变,并非坐标无关的语义维度。作者通过高斯构造、ridge/QR 分析和 V-JEPA2 视觉接触案例证明,在预测信息与守护秩不变时,欧氏擦除轨迹和累计秩仍可变化,因此该指标只能解释为依赖度量、探针和停止规则的程序性估计。

Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration Figure 1
2026-08-12cs.CV

Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration

Sangwoo Jo, Donggeun Ko, Jayeon Kang, Youngsang Kwak, Jaehwa Kwak, Sungjoon Choi

Korea University, Seoul, South Korea

2026-08-12视觉感知生成模型

图像复原常在低失真与高感知质量之间摇摆,扩散采样或两阶段生成又带来高成本。PCFlow将退化图像到清晰目标的过程建模为连续潜在流,用一致性流匹配实现少步推理,并以LCPL和冲突梯度投影缓解结构保真与感知锐利的优化冲突。实验覆盖人脸复原、超分、去噪、修补和上色,显示其在轻量卷积骨干下以更低计算量取得有竞争力的失真-感知折中。

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models Figure 1
2026-08-12cs.CV

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

Yuhang Song, Bor-Jiun Lin, Jiaxu Liu, Te-Chuan Chiu, Anh Nguyen, Chun-Yi Lee

2026-08-12视觉感知

这篇论文针对长时序导航中 VLM 难以高效利用历史视觉信息的问题,提出 Dynamic Context Adapter:不把历史帧直接拼接进 Transformer,而是将其动态压缩为固定大小记忆,并通过轻量适配器注入多层 VLM,从而保留预训练骨干结构和常数输入长度。实验显示,DCA 在长程 VLN 任务上达到或超过既有成功率,同时降低超过 25% 的注意力 FLOPs,并节省约 13% 到 15% 峰值显存。

Rethinking Text-Based Image Retrieval in Specific Domain Figure 1
2026-08-12cs.CV

Rethinking Text-Based Image Retrieval in Specific Domain

Jingyang Tan, Sheng Yang, Yuanpeng Chen, Jian Wang, Nianjin Ye, Chen Xing, Lanpeng Jia

2026-08-12视觉感知

针对监控等垂直场景中文本查询常对应多张相关图像、单匹配基准会把潜在正样本误判为负样本的问题,论文构建DSMM-TBIR数据引擎和含5万图像的SecMM-TBIR基准,并提出SAFT,用跨模态软标签监督和图像模态结构蒸馏缓解语义压缩下的假负例。多种CLIP类模型上,SAFT相较标准ITC微调在SecMM-TBIR的mAP@20平均提升7.8点,并报告对通用域也有改进。

Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training Figure 1
2026-08-12cs.CV

Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training

Yingsheng Liu, Haiming Li, Jingmin Zhu, Jiajun Sun, Victoria Mar, Monika Janda, H. Peter Soyer, Zongyuan Ge, Zhen Yu

2026-08-12视觉语言

这篇论文针对医学图像-表格预训练中表格特征被当作扁平向量、连续值重建不稳定的问题,提出 AID:用无标签的重要性估计自适应遮蔽关键临床特征,并将连续表格值软离散化为有序语义区间来做分布匹配。作者在 SLICE-3D、HOP 与 EyePACS 上报告达到新的 SOTA,并强调跨皮肤科与眼科的鲁棒性和泛化能力。

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis Figure 1
2026-08-12cs.CV

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

2026-08-12视觉感知

本文针对 InfinityStar 在高分辨率视频自回归生成中后期注意力代价高、跨尺度或跨片段复用稀疏掩码不可靠的问题,提出训练自由的 SparSTAR:在每个高成本尺度按当前 Q/K 动态选择分块稀疏注意力,并保留必要条件上下文。实验证明重要块会随尺度和片段迁移,动态重算优于掩码复用;在 720p 文生/图生视频上约获 1.6 倍端到端加速,质量接近稠密 InfinityStar。

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning Figure 1
2026-08-12cs.CV

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

2026-08-12视觉语言视觉感知强化学习安全鲁棒

SafeCap针对视觉输入绕过LVLM文本侧安全对齐的问题,将安全判断前置为可训练的自描述过程:模型先生成安全相关图像 caption,再作答,并用冻结LLM对 caption 是否足以支持安全决策提供强化学习信号。实验显示,在5个多模态安全和6个视觉能力基准上,DirectCap路径的安全均值提升3.7至19.0分,同时基本保持视觉效用。

Towards Color-Faithful Low-Light Image Enhancement via Adaptive Color Debiasing and Saturation Rectification Figure 1
2026-08-12cs.CV

Towards Color-Faithful Low-Light Image Enhancement via Adaptive Color Debiasing and Saturation Rectification

Zhichen Yang, Rui Xu, Yuzhen Niu, Fusheng Li, Hui Da, Ri Cheng

Fuzhou University, Fuzhou University Fuzhou Fujian China

2026-08-12视觉感知

论文针对低光增强中“亮度恢复后颜色偏移被放大、局部欠饱和与过饱和并存”的问题,提出 CAGE:在自适应圆柱 LAB 空间中先用 AdaCCT 前向变换校正嵌入式色偏,再在逆变换中把越界色度转为亮度补偿以修正饱和度。多基准实验显示,该框架可接入不同 LLIE backbone,并更稳定地降低色偏和饱和异常、提升整体视觉质量。

RadFusion: Towards Threshold-Controllable Radiology Report Generation Figure 1
2026-08-12cs.AI

RadFusion: Towards Threshold-Controllable Radiology Report Generation

Ying Jin, Noel C. F. Codella, John Corring, Mu Wei, Dinei Florencio, Eric Horvitz

2026-08-12规划控制

本文针对放射报告生成缺乏可调诊断阈值的问题,提出 RadFusion:用多标签分类器给出各疾病置信度,结合 VQA 报告生成器提供细节,再由 LLM 按选定阈值重写诊断内容。MIMIC-CXR 上生成报告的 ROC 行为贴近分类器,且相对非受控生成在匹配特异性下敏感性提升 6.9%,匹配敏感性下特异性提升 20.7%。

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars Figure 1
2026-08-12cs.CV

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars

Haozhong Xiong, Yao Yu, Yu Zhou, Sidan Du

2026-08-12视觉感知

本文针对可动画人体头像中衣物动态只由当前骨架姿态预测会产生一对多歧义、过平滑和时序闪烁的问题,提出 DSAR 双流自回归框架:几何流传递上一帧表面位移,状态流用记忆库检索历史隐状态,并配合运动自适应聚合与正则化。实验称其在渲染质量、时序一致性和训练外动作泛化上优于现有方法。

SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception Figure 1
2026-08-12cs.CV

SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

Yiyang Su, Jie Zhu, Feng Liu, Anil K. Jain, Xiaoming Liu

Michigan State University, Drexel University, University of North Carolina, Chapel Hill, face similarities, which do not provide semantic labels. On the temporal front, WebBody consists of, more than 90% static images. Compiling and labeling a video dataset of comparable scale to learn, Simultaneously, to model kinematic continuity without requiring a massive, newly labeled video

2026-08-12视觉感知

这篇论文针对现有人体识别基础模型过度依赖静态几何纹理、容易受服装等瞬时噪声干扰且忽略步态时序的问题,提出 SapiensID 2.0:用 MLLM 离线生成软生物特征语义,通过 ITA 对齐稳定身份特征、TND 去除动态干扰,并用 K-SAH 跨帧跟踪语义块建模运动连续性。实验称其在图像/视频行人重识别和步态识别上达到 SOTA,同时保持人脸识别鲁棒性。

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs Figure 1
2026-08-12cs.CV

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

Congyang Ou, Ruike Song, Yang Zhou, Libo Sun, Haokui Zhang, Zhenbo Luo

2026-08-12视觉语言视觉感知

这篇论文针对 VLM 中大量视觉 token 带来的推理延迟和 KV 缓存开销,指出深层 LLM 会逐步把部分视觉信息吸收到文本表示中,并用 CMA/CMR 衡量尚未被文本子空间解释的残差信息。基于此提出免训练的 SIEVE,结合残差、文本注意力和多样性选 token;在 LLaVA-NeXT-7B 上仅保留 11.1% 视觉 token 仍保持 97.5% 平均性能,并获得 2.49× 端到端加速。

Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation Figure 1
2026-08-12cs.CV

Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation

Guixu Lin, Yuyang Yu, Xiang Ji, Linyao Chen, Zhengwei Yin, Mengshun Hu, Mingdeng Cao, Shengfeng He, Yinqiang Zheng

The University of Tokyo, South China University of Technology, Wuhan University, Singapore Management University, The University of Tokyo Tokyo Japan, South China University of Technology Guangzhou China, Wuhan University Wuhan China, Singapore Management University Singapore Singapore

2026-08-12视觉感知

这篇论文针对扩散式视频插帧在大时间间隔和复杂运动下易产生模糊、结构变形与时序不一致的问题,引入事件相机的高时间分辨率运动线索。核心做法不是重训模型,而是把事件流转换为 IWE 和双向稀疏光流,并通过 IWE 编码器与对齐融合适配器注入预训练 DiT 视频扩散模型。实验称在真实与合成基准上优于现有方法,同时构建了 EvPexels 数据集,但具体增益中数据规模与适配器设计的相对贡献仍需进一步辨析。

FUSE: Frame-Unified Stress Estimation from Facial Video Figure 1
2026-08-12cs.CV

FUSE: Frame-Unified Stress Estimation from Facial Video

Stefanos Gkikas, Thomas Kassiotis, Yang Guo, Guangliang Li, Giorgos Giannakakis

2026-08-12视觉感知

针对面部视频压力识别常依赖短窗口切分、需调窗口长度与聚合且丢失全局时序的问题,FUSE将整段视频的时间维折叠到通道维,用非对称注意力一次处理完整记录。58名受试者实验中,τ=15取得69.44%最高准确率,完整3600帧输入仍有69.03%,但未与同划分窗口基线直接比较,增益来源仍不够清楚。

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation Figure 1
2026-08-12cs.CV

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

Huazhong University of Science & Technology

2026-08-12视觉感知规划控制安全鲁棒

本文针对流式视频扩散生成中训练噪声采样与推理去噪顺序不一致的问题,将逐帧噪声水平建模为带时间相关性的随机过程,并用连续训练轨迹从独立采样过渡到推理一致采样。Stream Forcing 通过联合校准和高斯 Copula 相关采样兼顾覆盖度与时序结构,在 UCF-101 上 FVD 提升 36.6%,长时域零样本外推提升 27.9%,并在 nuScenes 世界建模中改善 FID/FVD。

MammoMix: Leveraging Mixture of Experts for Robust Mammogram Breast Detection Figure 1
2026-08-12cs.CV

MammoMix: Leveraging Mixture of Experts for Robust Mammogram Breast Detection

Dinh Tan Nguyen, Hoang Quan Dang, Chen Zhang, Sai Ho Ling

2026-08-12视觉感知安全鲁棒

针对乳腺钼靶检测在跨医院、设备和人群数据上容易退化的问题,MammoMix用按数据域训练的多专家检测器替代单一模型,并通过门控融合与MoCAE置信度校准抑制过度自信专家主导。论文在CSAW、DDSM、DMID三套公开数据上报告其平均精度和可靠性优于YOLO/DETR等基线,尤其在异质性更强的数据上更明显。

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics Figure 1
2026-08-12cs.CV

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

Tsinghua University, Shanghai AI Laboratory

2026-08-12数据集/基准

现有蛋白数据多停留在静态复合物或单体轨迹,难以学习多链从解离到结合的动力学过程。DynaPPI的核心是用MD记录复合物重组轨迹,并配套坐标、能量、接触图等AI友好标签,面向扩散模型做条件生成预测。文中主要给出约1万复合物、10^8至10^11帧的建设目标和流程,实际发布规模、模型基准增益与实验验证仍未充分说明。

Lesion-Aware Adaptive Fourier Neural Operator for CT-to-PSMA PET Synthesis in Prostate Cancer Figure 1
2026-08-12cs.CV

Lesion-Aware Adaptive Fourier Neural Operator for CT-to-PSMA PET Synthesis in Prostate Cancer

Rashmi Bhaskara, Waleed M. Almutairi, Matthew Gopaulchan, Maram Musaad Alqurashi, Francis Asamoah, Alex Ocana, Clinton D. Bahler, Oluwaseyi M. Oderinde

2026-08-12视觉感知

该文针对CT合成PSMA PET时全局损失容易忽略小体积病灶、导致摄取活性被低估的问题,提出LAFNO:用CT派生的局部对比度与纹理无序代理替代昂贵的放射组学条件,并在AFNO瓶颈结合病灶TLA、肿瘤核心和瘤周监督。结果显示其全图SSIM仍具竞争力,同时降低患者级TLA误差并提升肿瘤核心放射组学一致性;但瘤周复现依赖示踪剂,生物保真仍未完全解决。

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation Figure 1
2026-08-12cs.CV

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

Ruizhong Liu, Tingzhang Luo, Zaiyan Zhang, Jundong Chen, Hongruixuan Chen, Shaoguang Huang, Hongyan Zhang

2026-08-12视觉感知

本文针对遥感开放词汇分割在跨地域、分辨率和成像平台变化下视觉-文本匹配易失效的问题,提出不再把辅助视觉基础模型直接用于文本匹配,而是将其结构敏感特征作为代价聚合与解码的空间引导;通过多旋转 CLIP 代价体、SGA 结构引导聚合和 CAD 代价感知解码提升跨数据集一致性。在覆盖六大洲七个数据集的 HRLC 基准上,GeoSeg-OV 在两种训练设置下平均 mIoU 分别较现有方法提升 2.5 和 2.7,并展示了无需目标域标注或重训练的零样本制图能力。

DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving Figure 1
2026-08-12cs.CV

DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving

Zebin Xing, Yupeng Zheng, Qiang Chen, Linbo Wang, Yichen Zhang, Pengxuan Yang, Junli Wang, Deheng Qian, Xiaoqing Ye, Junyu Han, Yifeng Pan, Qichao Zhang, Dongbin Zhao

Institute of Automation, Chinese Academy of Sciences, Chongqing Chang’an Technology Co., Ltd., Institute of Automation, Chinese Academy of Sciences Beijing China, Chongqing Chang’an Technology Co., Ltd. Chongqing China

2026-08-12视觉感知

这篇论文针对自动驾驶 VLA 模型在相似失败场景中反复出错、难以利用历史经验的问题,提出 DriveVLA-M0:用失败案例构建潜在记忆池,并以解耦道路结构与动态交互的检索模型找回相似场景,再通过解耦 LoRA 的测试时训练只调整动作解码器。NAVSIMv1/v2 上分别达到 94.1 PDMS 和 47.0 EPDMS,额外反向延迟约 26.44 ms;但增益可能部分来自记忆规模扩展 / data。

A second-order theory of texture for depth from focus Figure 1
2026-08-12cs.CV

A second-order theory of texture for depth from focus

Sreekar Ranganathan, Ioannis Gkioulekas

Carnegie Mellon University, Pittsburgh PA, USA

2026-08-12学习理论

论文针对传统被动对焦测深在“无纹理”表面上失效的问题,提出用波动光学解释粗糙微结构产生的主观散斑,并将其定义为二阶纹理;核心洞察是窄带光谱滤波可在自然光下提升这种纹理对比度,使普通相机的 DFF 获得可用焦点信号。理论、仿真和室内外实验显示,10–100 nm 滤波即便带来欠曝光,仍能显著改善稀疏纹理场景的深度重建。

FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition Figure 1
2026-08-12cs.CV

FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

Lujie Ban, Jiangtao Zhu, Yuanheng Yu, Jiasheng Shi, Chenhao Ma

The Chinese University of Hong Kong, Shenzhen,2 University of Washington, and labels they are linked to (Figure 1) [1, 18]. Consequently, trans-, to distant labels. Therefore, current evaluations make it difficult to, are difficult to obtain reliably from automatic LLM labeling, while, data-construction requirement: the labels must remain consistent, labels auditable, FormStruct-Bench decouples annotation from gen-, scalability of automatic generation., exact labels, diagnostic constraints, and provenance., local grid of region 𝑟∈R, F𝑟the fillable fields of region 𝑟with, Form-like tables combine local grids, fillable fields, selection con-

2026-08-12视觉感知数据集/基准

这篇论文针对表单式文档既不像普通表格、也不只是字段抽取的问题,指出现有基准难以定位结构识别失败原因。FormStruct-Bench用层级页面区域、局部网格、字段/控件组和关系边构建可诊断评测,并通过70个模板生成7000个可追溯实例。实验覆盖14类系统和SFT模型,最佳文档级得分达83.85%,但细粒度结构得分仍低于18%,说明当前模型会读内容却难以恢复可靠层级结构。

Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation Figure 1
2026-08-12cs.LG

Share First, Route What Remains: A Unified Framework for Token-Adaptive MoE Computation

Gongli Zhang, Zhulin Liu, C. L. Philip Chen

2026-08-12视觉感知

针对传统 MoE 以完整专家和固定 top-k 路由为单位、容易重复计算或容量分配不匹配的问题,论文提出先抽取可共享通道、再对剩余内容动态路由的 UniF-MoE。其核心洞察是共激活专家只在部分 value 位置对齐,且共享覆盖越高,残余专家需求越低;因此用共享宽度、共享内容和残余专家数联合决定 token 级计算。DomainBed 与 GLUE 实验显示,该方法在提升预测性能的同时减少激活计算、延迟和内存。

Towards Unified Dynamic Face Landmark Detection Figure 1
2026-08-12cs.CV

Towards Unified Dynamic Face Landmark Detection

Sebastian Regalado, Varshanth R. Rao, Ruowei Jiang, Parham Aarabi, Igor Gilitschenski

University of Toronto

2026-08-12视觉感知

现有人脸关键点检测通常绑定单一数据集的点位定义,训练和推理都缺乏跨格式复用能力。论文将关键点表示为沿面部部件轮廓的FPALP进度值,并用查询式解码器按需输出任意点位,从而统一多种N点标注格式。多基准实验显示,该单模型在效率更高的同时保持竞争力,并在若干设置下超过现有方法。

CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images Figure 1
2026-08-12cs.CV

CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images

Haeyun Choi, Minhyuk Jang, I-Gil Kim

2026-08-12视觉感知三维

面向只有两张运动模糊图像、且缺少位姿和测试时优化的极端稀疏三维重建场景,CasDeblurGS的核心思路是先用遮挡感知的2D跨视图对应筛掉不可靠匹配,再借助临时的无位姿3DGS重渲染提供全局引导,使去模糊结果更适合后续重建。在Deblur-NeRF真实和合成场景上,相比最强基线PSNR分别提升1.19 dB和2.11 dB,并显示出更好的新视角质量与多视图几何一致性。

ENCORE: Efficient Noise Context-Aware Representation for Low-Dose CT Denoising Figure 1
2026-08-12cs.CV

ENCORE: Efficient Noise Context-Aware Representation for Low-Dose CT Denoising

Minwoo Yu, N. Robert Bennett, Jongduk Baek, Adam S. Wang

2026-08-12视觉感知

低剂量 CT 去噪中,通用自然图像网络难以刻画重建后非平稳、空间相关的噪声。ENCORE 将 Cornish-Fisher 噪声合成、自协方差噪声上下文和按局部解剖/噪声调权的 FlyingConv 结合,并用 CUDA 加速整条流程;在 Mayo2016/2020 及真实扫描实验中,相比常规 UNet/NADD 等提升 PSNR/质感与推理延迟,还可通过缩放上下文实现零样本可控去噪。

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning Figure 1
2026-08-12cs.CV

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

Santa Clara University

2026-08-12视觉感知

论文针对交通异常视频长期停留在“是否异常/何时异常”检测层面、缺少可解释理解的问题,提出 TAR 训练集与 TAR-Bench 评测,将问答、时序推理和场景理解统一为 10 类任务,并用 MAVEN 生成带推理链的监督数据。实验显示,VLM 的问答准确率不能可靠代表时序和场景推理能力;在 TAR 上多任务微调后,完整模型相对零样本基线综合得分提升 21.4 分。

UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment Figure 1
2026-08-12cs.CV

UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment

Zijian Gu, Weikai Lin, Shuang Zhou, Zihan Chen, Song Wang

University of Central Florida, University of Rochester, Harvard Medical School, University of Virginia, University of Central Florida Orlando FL United States, University of Rochester Rochester NY United States, Harvard Medical School Boston MA United States, University of Virginia Charlottesville VA United States

2026-08-12视觉感知

这篇论文针对医学图文诊断中的模态捷径问题:模型常依赖报告文本中的显性诊断线索,忽视影像细粒度特征。UniMod的核心做法是同时监督图像、文本和融合三条诊断路径,并加入跨模态与同模态对齐,迫使各模态具备独立预测能力。在Harvard-Glaucoma和CheXpert Plus上,其AUC分别达0.850和0.966,优于OGM-GE、Gradient Blending等基线,并可无结构改动扩展到5类多标签任务。

Frozen Brain-MRI Foundation Models Are Site Fingerprints Figure 1
2026-08-12cs.CV

Frozen Brain-MRI Foundation Models Are Site Fingerprints

Saman Rahbar

University of British Columbia, Vancouver, Canada

2026-08-12视觉感知

多中心脑 MRI 常被汇总后交给冻结基础模型提取“解剖”表征,但论文指出这些嵌入首先强烈携带采集站点指纹。作者用线性/非线性探针审计 ABIDE-I/II 与多种 3D 编码器,发现站点在深层约 0.9 平衡准确率可解码,显著高于性别、年龄和诊断;随机网络与原始降采样图像也能达到相近水平,说明信号主要来自低层成像统计而非预训练。去除站点子空间可降低泄露,但会损伤分割中的解剖信息。

MRIComp4Flow: Compression of 3D Brain MRI for Training Multi-Modal Generative Models Figure 1
2026-08-12cs.CV

MRIComp4Flow: Compression of 3D Brain MRI for Training Multi-Modal Generative Models

Lisa K. Fischer, Mykhailo Riabets, Daniel Rueckert, Benedikt Wiestler, Anke Meyer-Baese, Sandeep Nagar

2026-08-12生成模型三维

针对多模态3D脑MRI训练生成模型时存储与I/O成本过高的问题,MRIComp4Flow将BraTS体数据切片压缩为JPEG2000/JPEG-LS,并在解码后训练统一的Wavelet Flow Matching合成模型。主要洞察是生成模型对适度有损压缩也较鲁棒:JPEG2000标称20:1时实现约12.9倍存储缩减,PSNR/SSIM与未压缩训练统计等价;更高压缩下逐步出现伪影并在200:1以上明显崩塌。

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks Figure 1
2026-08-12cs.CV

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

University of Virginia, KBR Inc., NASA Ames, carnegie mellon university, University of Virginia USA, KBR Inc., NASA Ames USA, carnegie mellon university USA

2026-08-12安全鲁棒

安全关键视觉模型常在罕见或语义复杂场景中失效,传统像素扰动难解释真实风险。SeFaR以自然语言需求和满足前提的图像为起点,用层次化语义概念、扩散生成和视觉语言反馈生成保持前提的扰动,并自适应定位致错特征。案例结果显示其能产生有效测试样本,发现与需求无关却影响决策的颜色、车型、天气等脆弱因素。

TRACE-GS: On-Policy Trajectory Distillation with Privileged Geometric Conditioning for Sparse-View 3DGS Restoration Figure 1
2026-08-12cs.CV

TRACE-GS: On-Policy Trajectory Distillation with Privileged Geometric Conditioning for Sparse-View 3DGS Restoration

Linlian Jiang, Yuchen Xi, Sadman Rakib Pinon, Ruigang Yang, Yang Wang, Xinxin Zuo

2026-08-12强化学习规划控制三维

这篇论文针对稀疏视角 3DGS 中几何欠约束导致扩散修复滚动时误差累积的问题,提出 TRACE-GS:训练阶段用密集视角几何作为特权信息构造教师,并在学生自身访问的去噪轨迹上做速度与跨视角检索对齐,部署时仅保留稀疏视角学生。实验称其在多个数据集和稀疏视角设置下带来一致增益与较强泛化。

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models Figure 1
2026-08-12cs.CV

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

2026-08-12视觉语言视觉感知

面向机器人操作、导航等具身任务中对3D空间关系的需求,论文针对现有VLM依赖额外几何编码器、推理成本高的问题,提出将场景级3D几何与物体位置、朝向、尺寸等属性蒸馏为可解码的连续Space Tokens,并接入思维链推理。结果显示其在VSI-Bench上使Qwen3-VL-8B提升4.3点、SenseNova-SI-1.3提升1.3点,并在物体尺寸和房间尺寸估计上达到较高表现。

Beyond Decision Boundaries: Relational Geometry Attacks on Contrastive Embedding Manifolds Figure 1
2026-08-12cs.AI

Beyond Decision Boundaries: Relational Geometry Attacks on Contrastive Embedding Manifolds

Fei Zhao, Peiyuan Zhang, Xi Li, Chengcui Zhang, Nitesh Saxena

The University of Alabama at Birmingham, Texas A&M University, The University of Alabama at Birmingham Birmingham USA, Texas A&M University College Station USA

2026-08-12学习理论

本文关注对比学习/孪生验证系统中不同于分类边界的安全弱点:决策依赖嵌入空间的成对相似关系。作者提出关系几何攻击,通过推远正样本、拉近负样本来破坏甚至反转流形结构,并用离线训练的轻量生成器实现单次前向扰动。实验显示多种验证架构性能显著下降,Markmatch 准确率从 95.4% 降至 38.6%,但跨场景泛化与防御有效性仍需更多说明。

A Convolutional Layer Activation Dimensionality Reduction for Out-of-Distribution and Adversarial Attack Detection Methods Figure 1
2026-08-12cs.CV

A Convolutional Layer Activation Dimensionality Reduction for Out-of-Distribution and Adversarial Attack Detection Methods

Leandro de Souza Rosa, Lorenzo Capelli, Clara Nunes Barrancos, Mauro Mangia, Riccardo Rovatti

2026-08-12视觉感知

针对CNN中间激活维度过高导致OOD与对抗样本检测成本高、压缩率与信息保留难兼顾的问题,论文提出一种用于卷积层激活的可控高压缩降维方法,将DMD的通道平均直觉与MACS的截断SVD控制能力结合,并改造两类检测器以支持通用降维。实验显示该方法在标准OOD和攻击检测上AUC通常持平或优于最强替代方案,同时降低计算与内存开销。

More Accurate, Less Human: Gestalt Grouping in Vision Models Figure 1
2026-08-12cs.CV

More Accurate, Less Human: Gestalt Grouping in Vision Models

Sudhanva Manjunath Athreya, Sai Phani Kumar Malladi

University of Utah

2026-08-12视觉感知

论文针对视觉模型被用于图表理解和可视化评估时“是否像人一样组织视觉结构”的证据不足,提出复用既有心理物理实验数据的 Gestalt 分组行为评测,覆盖闭合与相似性四类任务并比较45个模型。结果显示,常规准确率与人类行为一致性经常脱钩,部分闭源大模型虽基准强但感知对齐偏低,且这种人类相似性具有明显任务依赖性。

Human versus Computer Vision Figure 1
2026-08-12cs.CV

Human versus Computer Vision

Elena Sirotkina

Center for Data Science, New York University

2026-08-12视觉感知

本文针对显著性模型被用于替代真实观众注视测量的问题,审视“单一注意力图可代表所有人”的前提。核心洞察是把模型从受众侧审计,并用群体内部凝视一致性判断哪些群体可被学习。结果显示,未训练的中心先验超过所有训练网络,剩余准确性还偏向年轻、白人和政治温和观众,约13名真实观众即可达到最佳模型水平。

DoseBridge: Denoising Diffusion Bridge Model for Dose Prediction in Lung Intensity-Modulated Proton Therapy Figure 1
2026-08-12cs.CV

DoseBridge: Denoising Diffusion Bridge Model for Dose Prediction in Lung Intensity-Modulated Proton Therapy

Zerun Zhang, Xiaoda Cong, Xiangkun Xu, Peter Y. Chen, Xuanfeng Ding

Correspondence: Xuanfeng Ding, Corewell Health William Beaumont University

2026-08-12生成模型

肺部 IMPT 剂量不仅由 CT 和器官轮廓决定,还强依赖束流方向,而临床质子数据又很少。DoseBridge 将预测建模为从患者 CT 到剂量的扩散桥,并显式输入空间对齐束流 mask,多尺度轻量融合几何先验。在 52 例单中心数据上,10 例测试 MAE 为 4.170 Gy、PSNR 23.06 dB、SSIM 0.798,且改变束流 mask 可相应改变低剂量入口区。

Motion Artifact-Aware Self-Supervised Representation Learning for 3D Brain MRI Motion Artifact Reduction Figure 1
2026-08-12cs.CV

Motion Artifact-Aware Self-Supervised Representation Learning for 3D Brain MRI Motion Artifact Reduction

Mojtaba Safari, Shansong Wang, Zach Eidex, Matthew Goette, Tonghe Wang, Zhen Tian, Xiaofeng Yang

This research is supported in part by the National Institutes of Health under Award Numbers R01CA272991, R01DE033512 and P30CA008748.

2026-08-12三维

这篇工作针对脑 MRI 运动伪影校正中真实成对干净/污染数据和 k-space 难以获得的问题,提出 SSRL-MAR:先用 3D patch 对比学习提取与解剖相对解耦的运动表征,再用该表征驱动伪影合成器和校正网络形成自监督闭环。结果显示其在模拟数据上达到 PSNR 23.81 dB、SSIM 91.55%,在 MR-ART 上经无监督域适配较 source-only 监督模型最高提升约 2 dB,并接近需真实配对数据的 oracle 模型。

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text Figure 1
2026-08-12cs.CV

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

2026-08-12生成模型

本文针对文本驱动手物交互生成中,扩散模型难处理变长、组合动作和自动终止,而自回归离散 token 又损失接触细节的问题,提出 MAD-HOI:用解耦连续潜空间表示物体、左右手运动,再以 masked autoregressive transformer 条件化 flow-matching 生成。实验在 ARCTIC、GRAB 上显示其交互更多样、物理合理性更好,并支持补全、插值、组合序列和 EOM 预测。

P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing Figure 1
2026-08-12cs.CV

P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing

Amoon Jamzad, Dilakshan Srikanthan, Faranak Akbarifar, Nooshin Maghsoodi, Parvin Mousavi

2026-08-12视觉感知

这篇论文针对医学视觉基础模型的空间嵌入难以解释的问题,提出 P3CA:由用户选定局部区域,在该区域估计归一化与主协方差方向,再投影到全图,以查看局部相关特征在何处出现。实验覆盖自然图像、结直肠病理嵌入和空间转录组;结果显示它能揭示全局 PCA 压低的局部结构,并在匹配提示的病理分类中显著优于全局 PCA,但性能增益可能受提示选择和数据分布影响。

4D-WAM: 4D Consistent World Modeling for Autonomous Driving Figure 1
2026-08-12cs.CV

4D-WAM: 4D Consistent World Modeling for Autonomous Driving

Jiacheng Fu, Yibo Yuan, Meng Tian, Yue Li, Jiangtong Zhu, Jianhua Han, Yueyi Zhang, Jianwu Fang, Jianru Xue, Hang Xu, Zhiwei Xiong

2026-08-12强化学习

这篇论文针对自动驾驶世界-动作模型仅用2D视频监督导致未来场景虽逼真但几何/物理上4D不一致、进而误导规划的问题,提出用冻结几何基础模型在训练期提供特征与深度一致性损失,并发现早期去噪步已形成驾驶决策,因而加强高噪声阶段采样。实验称其在NAVSIM-v1/v2及困难场景取得SOTA,且不增加推理开销。

Signpost Watermarking: Joint Optimization for Visual Watermark Coexistence Figure 1
2026-08-12cs.CV

Signpost Watermarking: Joint Optimization for Visual Watermark Coexistence

Shruti Agarwal, Vishal Asnani, John Collomosse

2026-08-12优化算法

针对多套视觉水印在同一图像或视频中叠加时互相干扰、难以互操作的问题,论文提出“signpost”水印思路,并把共存性显式纳入解码器感知训练目标,而非依赖偶然兼容。实验覆盖多种图像与视频水印系统,显示该方法能在保持较高感知质量和自身鲁棒性的同时,更好保留已有水印的解码准确率;但具体增益在不同水印组合间仍有差异。

When Repository Labels Are Not Image-Level Truth: A Supervision Auditing Framework for Chest Radiograph AI Figure 1
2026-08-12eess.IV

When Repository Labels Are Not Image-Level Truth: A Supervision Auditing Framework for Chest Radiograph AI

Yesika Alexandra Agudelo-Londoño, Jhon Wilmer Pino-Román, Brahian Carrera Rodríguez, José Miguel Castañeda-Bedoya, Juan Pablo Gómez-López, Aura C. Puche-Sarmiento, Niharika S. D'Souza, Juan Sebastian Osorio-Valencia, Jon E. Duque-Grajales, Jazmín Ximena Suárez-Revelo, Jorge Mario Vélez-Arango, Gabriel Castrillón

2026-08-12视觉感知

这篇论文针对胸片 AI 中常把报告抽取标签当作图像真值的问题,提出 Repository Supervision Auditing,在建模前用放射科专家图像级标注审计监督信号。以 MIMIC-CXR 心脏扩大为例,仓库标签与专家判断几乎无一致性,仅识别 1% 专家阳性,错误主要来自报告未提及而非明确否定;用审计后队列训练的 DenseNet121 测试 ROC-AUC 为 0.853。

LEGO: Leveled Language Gaussian Splatting Figure 1
2026-08-12cs.CV

LEGO: Leveled Language Gaussian Splatting

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

2026-08-12三维

LEGO面向开放词汇三维场景理解中语义层级不稳定的问题:2D SAM粒度随视角变化,按物理尺度又会受实例大小差异影响。其核心是把多视角SAM掩码按共可见性和3D尺度自适应重分级,形成视角和尺度更一致的结构层级,并结合CLIP与层级语言场景图支持空间推理。实验称其在可提示和开放词汇3D分割基准上达到新SOTA。

Protection Levels for Vision-Based Pose Estimation Figure 1
2026-08-12cs.RO

Protection Levels for Vision-Based Pose Estimation

Olivia Beyer Bruvik, Romeo Valentin, Marc R. Schlichting, Don Walker, Mykel J. Kochenderfer

2026-08-12视觉感知三维

面向航班进近中视觉位姿估计的认证需求,论文把GNSS中的RAIM保护级概念引入跑道关键点PnP,给出覆盖3/6自由度且考虑未检出故障的概率误差界。分析显示保护级随关键点噪声近线性增大,随关键点数增加而下降;案例中1 km距离下沿航向位置保护级由4点时400 m以上降至20点时约32 m,但完整6自由度保护级约大一个数量级,主要受姿态故障难检测限制。

ReCBM: Uncertainty-Gated Relational Reasoning for Concept Bottleneck Models Figure 1
2026-08-12cs.AI

ReCBM: Uncertainty-Gated Relational Reasoning for Concept Bottleneck Models

An Sui, Yuzhu Li, Fuping Wu, Xiahai Zhuang

2026-08-12安全鲁棒

该文针对概念瓶颈模型在概念缺失、翻转或不可靠时会传播错误语义证据的问题,提出 ReCBM:用概念不确定性门控共现、蕴含、互斥等关系推理,只让可信概念参与修正。实验显示其在多数据集上提升概念与任务恢复,支持仅基于不确定性的干预,并能抽取紧凑概念子集且基本不损失下游性能。

LoRCA: LoRA Cycle Adaptation for Histology to HiP-CT Translation with DINOv3 Figure 1
2026-08-12eess.IV

LoRCA: LoRA Cycle Adaptation for Histology to HiP-CT Translation with DINOv3

Yang Zhou, Edoardo Occhipinti, Banboye Kidzeru Elvis, Jishizhan Chen, Stathis Megas, Joseph Brunet, Joanna Purzycka, Theresa Urban, Hector Dejea, Sarah Amalia Teichmann, Menna R Clatworthy, Paul Tafforeau, Peter D Lee, Claire L Walsh

2026-08-12视觉感知

针对 H&E 组织切片与 HiP-CT 三维体数据外观差异大、难以配准的问题,论文提出 LoRCA:在冻结 DINOv3 共享骨干上加入模态专属 LoRA,并用循环一致与对抗训练做无配对风格转换,以减少结构漂移。实验显示其在 FID、互信息、边缘保持和 MatchAnything 特征对应上优于 CycleGAN,但尚未验证真实配准精度,骨干冻结的增益来源不清。

Implicit representations are dead. Long live explicit primitives! Figure 1
2026-08-12eess.IV

Implicit representations are dead. Long live explicit primitives!

Nil Stolt-Ansó, Maik Dannecker, Wenqi Huang, Andras Jakab, Daniel Rueckert

2026-08-12视觉感知

针对高分辨率医学图像中隐式神经表示依赖全局 MLP、训练慢且显存开销高的问题,论文将字典、INR、特征网格和显式高斯基元统一为基函数展开,强调局部可优化基元的闭式性质与计算优势。在 2D 组织病理和 3D 肺 CT 上,显式高斯表示在多种压缩率下重建质量持平或优于隐式方法,同时优化时间和反传显存更低。

Pre- to Post-Contrast Synthesis of Breast DCE-MRI using Latent Bridge Matching Figure 1
2026-08-12eess.IV

Pre- to Post-Contrast Synthesis of Breast DCE-MRI using Latent Bridge Matching

Sina Amirrajab, Zohaib Salahuddin, Henry C Woodruff, Philippe Lambin

2026-08-12视觉感知

这篇论文针对乳腺 DCE-MRI 中钆对比剂带来的扫描负担,尝试从平扫图像合成峰值增强图像。核心做法不是从噪声生成,而是在 VAE 潜空间学习平扫到增强图像的“桥”并逐步修正,以保持个体解剖结构。91例 DUKE 验证中,加入肿瘤掩膜后 MSE 从1.023降至0.940、FRD从7.523降至4.716、肿瘤SSIM升至0.429,但该结果依赖真实肿瘤掩膜,临床泛化仍需验证。

Robustness of transferability estimation metrics for medical imaging Figure 1
2026-08-12eess.IV

Robustness of transferability estimation metrics for medical imaging

Niclas Claßen, Théo Sourget, Dovile Juodelyte, Rob van der Goot, Veronika Cheplygina

2026-08-12安全鲁棒

本文关注医学影像迁移学习中如何低成本选择预训练源模型的问题,质疑现有迁移性估计指标在自然图像和准确率导向设置下的可靠性。作者通过改变目标数据子集规模、随机种子及参考评价指标,发现TE指标排名对数据扰动和AUROC等评价选择高度敏感,与真实微调排名整体一致性较低,提示这类指标在医学场景中需谨慎使用。

Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory Figure 1
2026-08-12cs.LG

Transformer Geometry Observatory TGO-IV: Developmental Topology Observatory

Kaustubh Kapil, Kishor P. Upla

2026-08-12视觉感知

本文针对现有 Transformer 可解释性多停留在单层几何或整体相似度、难以刻画表征流形全局拓扑演化的问题,提出 TGO-IV,用持久同调在各层 token 表征点云上构建 Vietoris–Rips 复形,并结合持久图、Betti 曲线及层间距离追踪拓扑变化。实验显示训练中连通分量更早合并,高阶结构短暂出现后简化,层间拓扑差异随优化收敛而下降,支持“渐进拓扑稳定化”假说;但其对任务性能或机制解释的直接增益文中未充分说明。

Energy and Performance Benchmarking of Deep Learning Models for Breast Cancer Detection Figure 1
2026-08-12eess.IV

Energy and Performance Benchmarking of Deep Learning Models for Breast Cancer Detection

Samar Garrab, Ghada Achour

2026-08-12视觉感知数据集/基准

这篇论文针对乳腺癌检测模型只看精度、忽视训练和推理能耗的问题,在乳腺超声和 BreakHis 400X 两个数据集上比较 7 类 CNN、Transformer 与混合架构,并用 CodeCarbon 统计 CO2 排放。结果显示 EfficientNet、ResNet 精度较强但排放更高,DenseNet 表现较弱;DeiT 在超声数据上取得较好精度-能耗平衡,而 BreakHis 上 ViT 和 Swin 更优,说明模型选择需同时依赖数据模态、性能和环境成本。

Structural Guidance for Unified Joint Demosaicing and Denoising Figure 1
2026-08-12eess.IV

Structural Guidance for Unified Joint Demosaicing and Denoising

Qixin Zheng, Ping Chen, Qiangqiang Shen, Haijin Zeng

2026-08-12视觉感知

本文针对统一联合去马赛克与去噪在斜边、重复纹理和摩尔纹处仅靠像素监督易损失结构的问题,提出在CFA与噪声条件化的SwinIR恢复分支外,引入冻结DINOv3结构编码器、轻量适配器和残差融合,并用辅助干净mosaic约束保留传感器域信息。实验显示其在多种Single/Quad/Nona-Bayer与噪声设置下优于统一和专用基线,结构复杂区域改善更明显,但真实RAW噪声与结构分支推理成本仍是限制。

SpecF2M: A Spectral-Aware Multi-task Network Estimating Axial Length and Refractive Error from Pediatric Fundus Photographs Figure 1
2026-08-12eess.IV

SpecF2M: A Spectral-Aware Multi-task Network Estimating Axial Length and Refractive Error from Pediatric Fundus Photographs

Mengxian He, Xinyue Liu, Yunyun Sun, Wei Hao, Minqing Zhang, Lichun Wang, Shunyi Zhang, Wu Yuan

2026-08-12视觉感知

该文针对儿童近视筛查中眼轴长度和屈光误差测量依赖专用设备、流程复杂的问题,提出 SpecF2M,用眼底照预测 AL、SPH、CYL;其核心在于解剖先验增强、空间-频谱混合骨干和专家路由多任务头,并指出 CYL 与眼底近视模式耦合较弱。在 4359 次儿童就诊、6966 张图像上,AL 和 SPH 的 MAE 分别为 0.5347 mm、0.7062 D,优于受控 CNN/ViT 基线,但仍需外部验证。

APCReg: Anatomical-Prior-Guided Coarse-to-Fine CBCT--IOS Registration via Multi-View Projection and Reliability-Controlled Residual Correction Figure 1
2026-08-12eess.IV

APCReg: Anatomical-Prior-Guided Coarse-to-Fine CBCT--IOS Registration via Multi-View Projection and Reliability-Controlled Residual Correction

Xincan Zheng, Yaqi Wang, Zhi Li, Jiahao Bao, Lan Feng, Yiru Xia, Shuai Wang

2026-08-12规划控制

本文针对CBCT与口内扫描在模态差异、重叠有限和大位姿偏差下难以自动配准的问题,提出APCReg:先用解剖先验驱动的多视角投影做粗配准,再用重叠感知匹配、牙弓结构假设选择和无真值保留规则控制残差修正。在60例测试颌骨上达到0.87 mm Chamfer距离、2.92 mm Hausdorff距离,并在六项指标中优于所评估开源基线。

Knowledge-Guided 3D CT Generation: A Conditioning-Centric Taxonomy Figure 1
2026-08-12eess.IV

Knowledge-Guided 3D CT Generation: A Conditioning-Centric Taxonomy

Francesca Pia Panaccione, Eugenio Lomurno, Matteo Matteucci

Department of Electronics, Information, and Bioengineering

2026-08-12三维

该综述针对3D CT条件生成研究增长快但难以横向比较的问题,指出关键不只在生成架构,而在外部知识如何表示、注入并约束采样。论文提出以知识类型、集成范式和生成架构构成的K×I×A分类空间,系统整理既有方法,揭示主流模式、评估协议不统一和若干欠探索组合;文中未给出统一实验增益,主要结果是设计空间与研究空白的归纳。

Longitudinal 3D Foundation Modeling for Neoadjuvant Breast Cancer Response Prediction from Serial DCE-MRI Figure 1
2026-08-12eess.IV

Longitudinal 3D Foundation Modeling for Neoadjuvant Breast Cancer Response Prediction from Serial DCE-MRI

Fidel Omar Tito Cruz, Neda Ghafouri, Zengyan Wang, Pegah Khosravi, Yu Tian, Chen Chen

2026-08-12三维

针对乳腺癌新辅助化疗中单次 MRI 难以反映治疗动态的问题,本文把冻结的 3D 基础模型 Pillar-0 扩展到纵向 DCE-MRI,用 TDN 融合四个时间点、实际扫描间隔、缺失掩码及临床治疗变量。982 例 I-SPY2/ACRIN-6698 上,临床变量仍是最强单信号,但纵向 3D 影像与其融合后 AUROC 达 73.6%、平衡准确率 69.1%,较 clinical-only 约提升 4.8 点。

Algorithmic statistics of retinal images Figure 1
2026-08-12eess.IV

Algorithmic statistics of retinal images

Loan Huynh, Ronald Zambrano, Layton Aho, Fabio Lavinsky, Gadi Wollstein, Joel S. Schuman, Andrew R. Cohen

Department of Electrical and Computer Engineering, Drexel University, Philadelphia, PA, USA, School of Biomedical Engineering, Science and Health Systems, Drexel University, Philadelphia, PA, USA, Sidney Kimmel Medical College, Thomas Jefferson University, Philadelphia, PA, USA, Vickie and Jack Farber Vision Research Center, Wills Eye Hospital, Philadelphia, PA, USA

2026-08-12视觉感知

针对3D视网膜OCT图像复杂、难以可视化且神经网络等非度量特征可能引入结构性失真的问题,本文用归一化压缩距离结合各向异性多尺度结构增强滤波,构造NCV特征来度量图像间真实视觉差异。实验将NCD与医生测得的视野功能变化对齐,预测误差约0.5 dB,并在青光眼患者和非人灵长类数据上展示了纵向结构变化的可视化与量化能力。

Rescene: band-limited stochastic forcing turns a frozen neural weather operator into a climate emulator Figure 1
2026-08-12cs.AI

Rescene: band-limited stochastic forcing turns a frozen neural weather operator into a climate emulator

Minjong Cheon

Department of Computer Science and Engineering, Sejong University

2026-08-12视觉感知

这篇论文针对机器学习天气模型长时间自由积分易爆炸、漂移或丢失季节循环的问题,提出在冻结的视觉 Transformer 天气算子外加一个仅 0.4M 参数的 Rescene 包装器:慢时钟负责向逐日气候态稳定回拉,带限随机扰动头恢复天气变率。结果显示其可无明显漂移积分 100 年,恢复主要日变率、阻塞频率和集合校准,并揭示冻结算子在未被直接强迫的小尺度上仍能提供能量,说明其不只是平滑后处理器。

2026-08-11

313 篇
Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots Figure 1
2026-08-11cs.CV

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

Mohamed bin Zayed University of Artificial Intelligence, Aalto University

2026-08-11视觉感知

论文针对视觉多模态模型自我改进中反馈过粗、视觉蒸馏又依赖外部标注或强模型的问题,提出 CVPD:用模型自身在裁剪与遮除反事实视图下的分布变化定位“视觉盲点”,并转化为正负教师的逐 token 对比蒸馏信号。在 Qwen3-VL-8B 上,该方法较六类自演化基线在 12 个基准均无退化,OCRBench、MMStar 细粒度感知和逻辑推理分别提升约 3.60、3.38、3.08。

Multimodal Model Diffing for Feature Discovery and Control Figure 1
2026-08-11cs.CV

Multimodal Model Diffing for Feature Discovery and Control

Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald Clark

University of Oxford

2026-08-11视觉语言规划控制

论文针对多模态大模型内部视觉能力难以定位和干预的问题,提出 MMDiff:用基础语言模型 SAE 与多模态适配后 SAE 做特征级 diff,再通过逐 token 对比激活找出任务相关特征并用于消融或 steering。实验覆盖 LLaVA-MORE、PaliGemma 2、InternVL3.5,在空间、OCR、安全任务上实现选择性行为控制,消融分别降低目标能力或攻击成功率,steering 较单层基线小幅提升准确率。

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning Figure 1
2026-08-11cs.CV

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning

Haodong Li, Shaoteng Liu, Tianyu Wang, Chongjian Ge, Sihui Ji, Jiahan Zhang, Xin Lin, Haolin Lu, Zhe Lin, Manmohan Chandraker

2026-08-11视觉感知强化学习

论文针对视频扩散模型偏重拟合像素、难以外推物理动态的问题,提出 LDR:在结构化潜空间中把状态转移写成显式运动学积分,只回归高阶残差而非直接预测下一帧潜变量。其在 PhyWorld 五类受控物理任务上验证,OOD 与 ID 误差差距较 DiT 基线小 20 倍以上,同时参数少 26 倍、推理快 143 倍;但实验仍限于简单模拟物体,真实场景扩展文中未充分说明。

Overcoming Data Scarcity and Confidentiality in Hardware Assurance via Synthetic Generation Figure 1
2026-08-11cs.CR

Overcoming Data Scarcity and Confidentiality in Hardware Assurance via Synthetic Generation

Gijung Lee, Ronald Wilson, Damon L. Woodard, Domenic Forte

Florida Institute of National Security, University of Florida, Gainesville, Florida, USA

2026-08-11视觉感知

这篇论文针对硬件保障中 SEM 芯片图像难获取、标注成本高且真实版图涉及 IP 泄露的问题,提出用少量种子样本训练 StyleGAN 生成失真但结构多样的掩膜,再由 Pix2PixHD 合成逼真 SEM 图像。实验中,仅用 5000 张合成图训练的 U-Net 在真实图像分割上超过用 350 张真实图训练的基线,同时作者用布局差异论证共享模型较难反推出原始专有布线。

Beyond Hazard Resemblance: Contrastive Event Adjudication for Training-Free Video Anomaly Detection Figure 1
2026-08-11cs.CV

Beyond Hazard Resemblance: Contrastive Event Adjudication for Training-Free Video Anomaly Detection

Wenti Yin, Xiang Wang, Huaxin Zhang, Hanqing Wang, Hongbo Shao, Changxin Gao, Nong Sang

2026-08-11视觉感知

这篇论文针对训练自由视频异常检测中“识别出危险相似性”并不等于“判定异常”的问题,提出 CEAVAD:把异常概念改写为可证伪的危险/良性事件假设,用公共安全知识构造对照,再由冻结视觉语言模型和 MLLM 结合前后时序证据裁决哪种解释更成立。实验称其在 UCF-Crime、UBnormal、XD-Violence 上达到训练自由方法的 SOTA,并能给出定位与证据化解释。

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning Figure 1
2026-08-11cs.CV

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

University of Trento, Italy, University of Bergamo, Italy

2026-08-11视觉感知

本文针对多模态指令微调中私有数据分散、集中式 MoE 训练难以获得数据且不便移除特定知识的问题,提出 DistMoE:在公共 FFN 外加入客户端私有专家,并用公共锚定的残差正则与本地路由校准,使独立专家无需跨客户端私有数据 rehearsal 也能组合。实验覆盖多类视觉问答与 MLLM 基准,显示其在保持专家可增删复用的同时取得有竞争力的域适应与泛化表现。

Space-Creating versus Dead Possession: An Off-Ball Possession-Quality Index for Broadcast Football Figure 1
2026-08-11cs.CV

Space-Creating versus Dead Possession: An Off-Ball Possession-Quality Index for Broadcast Football

Seongjin Choi

2026-08-11视觉感知

论文针对足球控球率难区分“有效牵制空间”和“无效倒脚”的问题,提出两层离球控球质量指标:先用事件数据标记低威胁控球,再用转播视频重建球员位置并计算空间创造指数。世界杯样本显示,垃圾控球与积分、xG差负相关,且在控制VAEP和场地倾斜后仍显著;31个视频窗口中多数确为空间未创造,但少数被事件指标误判,说明离球空间信息能补足纯事件模型。

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents Figure 1
2026-08-11cs.AI

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu

Shanghai Artificial Intelligence Laboratory, Fudan University, Shanghai Jiao Tong University, The Hong Kong University of Science and Technology

2026-08-11规划控制安全鲁棒

论文针对 LLM Agent 安全机制部署后难以随新风险更新、且上下文、记忆、工具权限等职责耦合导致故障难归因的问题,提出 SHE:将安全 harness 拆成系统提示、规则库、安全记忆和工具策略四类可编辑工件,并用轨迹失败诊断驱动局部演化与安全-效用验证。实验显示其在 Agent-SafetyBench 上较静态 SafeHarness 将 ASR 降低约 3.1 倍,同时提升良性任务效用,并在 AgentHarm 和跨模型设置中保持一定泛化。

Financial Numerical Prediction and Allocation as Token Generation Figure 1
2026-08-11cs.CV

Financial Numerical Prediction and Allocation as Token Generation

Xu Ouyang, Moontae Lee

2026-08-11视觉感知

本文针对金融预测中回归头、排序头和策略头割裂的问题,探索让因果语言模型直接生成可约束的数值 token。FinATOM 用同一无任务头接口输出三步收益预测和五 ETF 多头权重,并结合因果均值-方差教师与 GRPO 优化 Sharpe。2023–2025 ETF 测试中净 Sharpe 从 1.394 升至 1.494,FinTexTS 上策略阶段仅小幅提升,结论更偏可行性验证而非稳健优越性。

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains Figure 1
2026-08-11cs.CV

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

Zhejiang University, Tongji University, Yale University

2026-08-11视觉感知

本文针对科学视频生成“看起来真实但机制错误”的评测缺口,提出 Sci-VBench:覆盖四大学科、60 个主题的 1253 个专家标注任务,并为每例提供参考指南和 1–5 分细则,使非专家和 MLLM 评审更接近专家判断。对 16 个模型的结果显示,感知质量分数差异很小,但提示对齐、科学与因果正确性差异显著,闭源模型优势明显,说明视觉逼真尚未带来可靠的科学动态建模。

Towards Expert-level Medical AI for Real-time Video Consultations Figure 1
2026-08-11cs.AI

Towards Expert-level Medical AI for Real-time Video Consultations

Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemengway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno, Po-Hsuan Cameron Chen, Mike Schaekermann, Anil Palepu

2026-08-11视觉感知

这篇论文针对文本医疗 AI 难以利用视频问诊中的语音、表情、姿态和可见体征等信息,提出 Gemini 驱动的 AMIE Video 多智能体系统,将低延迟对话、临床推理和实时视听感知结合,并配套视听能力分类与自动评测。在含 100 个场景的随机 OSCE 中,临床评估认为其在问诊、诊断、管理和观察检查上达到或优于初级保健医生,但医患关系建立仍弱于医生,细粒度解剖与细微情绪感知也未充分解决。

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance Figure 1
2026-08-11cs.RO

RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance

Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li

2026-08-11机器人

这篇论文针对通用机器人策略中奖励监督难以跨任务、跨本体扩展的问题,提出用到语言目标的时间距离,即 cost-to-go,替代偏好标注或归一化进度来训练价值基础模型。RynnValue 通过时间戳自动构造标签,并用随机采样、时序打乱和 value-isolation attention 抑制捷径学习。在 7000 小时、约 300 万片段上训练后,其 OOD 排序 Kendall τ 达 0.675,超过偏好监督基线,并将真实机器人在线/离线成功率分别提升到 72.5% 和 82.5%。

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing Figure 1
2026-08-11cs.CV

From Diagnosis to Correction: Benchmarking and Improving Real-World Table Parsing

Jutao Xiao, Yuan Qu, Dongsheng Ma, Fan Wu, Tianyao He, Weihong Li, Jie Yang, Yu Qiao, Bin Wang, Conghui He

2026-08-11强化学习数据集/基准

论文针对现有文档解析器在通用基准上分数很高、但真实复杂表格仍频繁出错的问题,构建了含916张表格的诊断基准 TableParseMap,揭示大表、弱视觉线索和渲染不一致是主要瓶颈;提出无需重训的 DEC 框架,用分解、增强和纠错配合视觉一致性门控与排序器改进冻结解析器。实验中 DEC 在三种解析器上平均提升 TEDS 1.57 分,在 TableParseMap 上提升 1.89 分,大表场景提升 5.66 分。

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation Figure 1
2026-08-11cs.CV

MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation

Haoyu Yang, Meixing Shi, Zengjie Chen, Haoran Sun, Haitao Leng, Xiaoming Shi, Yuxiang Cai, Yankai Jiang

2026-08-11视觉感知

医学视觉语言模型通常能回答问题但缺少像素级定位,分割模型又依赖固定类别或精确提示,MedPixel试图弥合这一监督错配。其核心是把既有分割掩码转化为约44万像素-语言样本,并用共享<SEG>接口连接Qwen2.5-VL与SAM2,再以PLPO用掩码质量校准生成响应。实验显示其在推理/解释型分割上相对基线增益最明显,也提升VQA、零样本迁移和不精确空间提示下的鲁棒性,但部分收益可能来自data与scaling。

Modern Backbones Improve Multi-task DETR for Mammography Classification and Lesion Localization Figure 1
2026-08-11cs.CV

Modern Backbones Improve Multi-task DETR for Mammography Classification and Lesion Localization

Dinh Tan Nguyen, Quang-Hien Kha, Le-Hoang Nguyen, Minh-Toan Dinh, Xuan-Huy Nguyen, Dac Phu Ho, Cao Truong Tran, Sai Ho Ling, Lan T Ho-Pham, Liem Pham, Nguyen Quoc Khanh Le

2026-08-11视觉感知

这篇论文关注乳腺X线AI同时给出检查级恶性预测和可疑区域定位的问题,动机是单纯分类难以提供可供医生核查的空间证据。作者在固定多任务DETR框架下替换骨干网络,核心洞察是共享表征质量显著影响分类与定位的平衡。结果显示ConvNeXtV2在OPTIMAM上最佳,AUC 97.96%、mAP@.5 25.08%;DINOv3在SGM1k上最佳,AUC 90.97%、mAP@.5 27.04%,MambaVision整体较弱。

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection Figure 1
2026-08-11cs.CV

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

Zhejiang University

2026-08-11视觉感知强化学习

这篇论文针对工业异常检测中 MLLM 依赖推理时参考图像、带来检索与计算开销的问题,提出 ADOPD:训练时让参考感知教师评估学生自身生成的轨迹,并用匹配/错配参考区分学习方向与更新强度,从而把参考比较能力内化到仅看查询图像的学生模型中。实验在 MMAD 零样本设置达到 77.31% 平均准确率,比 Qwen3-VL-4B 提高 6.14 点,并超过一图参考推理 2.64 点。

NTIRE 2026 Low-light Enhancement: Twilight Cowboy Challenge Figure 1
2026-08-11cs.CV

NTIRE 2026 Low-light Enhancement: Twilight Cowboy Challenge

Aleksei Khalin, Egor Ershov, Artyom Panshin, Sergey Korchagin, Georgiy Lobarev, Arseniy Terekhin, Sofiia Dorogova, Amir Shamsutdinov, Yasin Mamedov, Bakhtiyar Khalfin, Bogdan Sheludko, Emil Zilyaev, Nikola Banić, Georgy Perevozchikov, Radu Timofte, Shuai Liu, Yuqian Zhang, Lize Zhang, Yibin Huang, Chaoyu Feng, Luyang Wang, Xiaotao Wang, Dongqing Zou, Lei Lei, Tianli Liu, Dejun Hao, Chunxia Lei, Furkan Kınlı, Andrei Mironov, Alexander Dikov, Aleksei Sadokhin, Vladimir Zvorygin, Constantine Habarlak, Shuwei Yue, Egor Mirantsov, Daniil Okunev, Dmitry Arkhipov, Aleksandr Yugay, Anas M. Ali, Bilel Benjdira, Wadii Boulila, Wei Zhou, Linfeng Li, Lingdong Kong, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Jiajia Liu, Yaokun Shi

2026-08-11视觉感知

本文面向手持夜景拍摄中“短曝光噪声高、长曝光易模糊”的矛盾,组织RAW域多帧低光增强挑战,要求在未对齐的手机burst图像上联合完成运动补偿与去噪。核心价值在于用585个真实室内/室外低光场景和盲测协议逼近实际移动摄影条件,而非假设RGB域或完美配准。结果显示10支队伍超过基线,最高提升6.49 dB PSNR、0.0101 SSIM;但最佳成绩依赖集成和测试时增强,实用增益与算力代价之间仍需权衡。

C$^2$A: Coupling Spatial Evidence with Clinical Priors via Co-occurrence Aware Class Attention for Multi-Label Chest X-Ray Classification Figure 1
2026-08-11cs.CV

C$^2$A: Coupling Spatial Evidence with Clinical Priors via Co-occurrence Aware Class Attention for Multi-Label Chest X-Ray Classification

Akash Gogineni, Nagur Shareef Shaik, Aasrith Mandava, Adnan Masood, Dong Hye Ye

2026-08-11视觉感知

针对胸片多标签诊断中病灶位置证据被全局池化稀释、疾病共现关系又常与视觉特征脱节的问题,C²A用类别专属空间注意力提取每种病的局部描述符,并以由经验共现矩阵初始化的可学习图进行一次残差消息传递,将临床先验直接注入分类头。在CheXpert五类任务上,方法取得0.895宏平均AUROC,优于GCG等基线,提升主要集中在肺不张等空间证据模糊且强共现类别。

REFRAMED: Towards Realistic Audio Description Generation for Movies Figure 1
2026-08-11cs.CL

REFRAMED: Towards Realistic Audio Description Generation for Movies

Igor Sterner, Mirella Lapata, Alex Lascarides, Frank Keller

School of Informatics, University of Edinburgh, The video is available from second 37 onwards at https://rottentomatoes.com/m/the girl with, professionally transcribed AD versions each, scene boundaries, AD-to-scene labels

2026-08-11视觉感知

论文针对电影音频描述生成与真实需求脱节的问题:现有方法通常预先给定描述片段和时间,弱化了“何时说、说什么”的编辑决策。作者提出 Reframed 任务与数据集,要求模型在对白空隙中联合选择描述位置和内容,并提供双版本专业 AD、字幕和剧本对齐数据。实验显示现有 AD 系统和多模态 LLM 虽优于简单基线,但与专业人工仍有明显差距。

Disentangling Co-Occurring Retinal Pathologies with Saliency-Guided Sparse Expert Routing Figure 1
2026-08-11cs.CV

Disentangling Co-Occurring Retinal Pathologies with Saliency-Guided Sparse Expert Routing

Nagur Shareef Shaik, Jeongwoo Park, Yeong-Jin Kim, Jaeuk Jung, Hyunjung Oh, Dong Hye Ye

2026-08-11视觉感知

针对眼底图像中多种病变共现时共享特征易纠缠、解释性差的问题,论文将病灶显著性引导的GCG前端与稀疏MoE路由结合,让不同空间token按病变证据进入专门专家,并用共享专家吸收通用视网膜结构。在ODIR五类多标签、患者不交叉5折评估中,模型达到0.912 macro AUC和0.653 macro F1,较DKCNet分别提升0.017和0.038,路由分布也显示出与病种相关的专家专化。

HandSplatter: Automated Digital Goniometry from Neural Rendering Figure 1
2026-08-11cs.CV

HandSplatter: Automated Digital Goniometry from Neural Rendering

Emmett Chen, Neal Chen, Xiang Li, Quanzheng Li, Siyeop Yoon

2026-08-11视觉感知

这篇论文面向手指关节活动度的临床量化,针对人工量角器耗时且一致性不足、现有软件精度不够的问题,提出将多视角重建、Gaussian Splatting、SAM-2 分割、MediaPipe 关键点三角化与离散密度爬山校正结合的 3D 关节定位流程。作者在 20 名受试者静息手势上与量角器对比,结果显示可近似传统评估并显著减少测量时间,但具体误差和统计增益文中未充分说明。

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling Figure 1
2026-08-11cs.CV

World Tokens: Enhancing Embodied Policies with Training-Time World Modeling

Qu Tang, Benhui Zhuang, Bo Yuan, Xue Yu, Longteng Guo, Junlan Feng

2026-08-11强化学习

论文针对 VLA 缺少动作相关时序演化监督、而 WAM 在线视频推理开销大的矛盾,提出训练期 World Adapter 将 VLM 表征压缩为 world tokens,同时约束未来视频去噪和动作生成,并强制策略只能使用这些 token;部署时移除视频分支。结果显示 2B 模型在 LIBERO 达 98.2%,SIMPLER 两项为 71.5%/82.1%,真实 R1 Pro 成功率由 59.4% 提升到 76.0%,但训练成本较高。

LookAgain: Closed-Loop GUI Grounding with Visually Grounded Reflection Figure 1
2026-08-11cs.CV

LookAgain: Closed-Loop GUI Grounding with Visually Grounded Reflection

Renshan Zhang, Haoyang Meng, Yixiao He, Rui Shao, April Hua Liu, Liqiang Nie

2026-08-11视觉语言

本文针对 GUI grounding 在小目标、密集控件和分布外界面上易失效的问题,提出 LookAgain:把坐标预测视为可检验假设,通过 locate 标记并裁剪局部视图,再由 confirm 接受或继续修正,形成闭环视觉反思;训练上用反思轨迹 SFT 冷启动并以终端正确性做 GRPO。实验显示 LookAgain-8B 在 OSWorld-G 达 73.0,较 Qwen3-VL-8B 提升 21.7 点,并在 UIVision、ScreenSpot-Pro 等困难基准取得显著增益。

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes Figure 1
2026-08-11cs.CV

Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann

2026-08-11视觉语言三维

针对植被中小型/伪装目标缺少标注且跨场地泛化差的问题,论文用少量目标场地未标注照片驱动 VLM 构建粗 3D 植被场景,再放置已知目标网格并经 LoRA+扩散重纹理生成带框、掩码和遮挡标签的数据。关键洞察是“分级 mask-lock”比照片数量更影响效果:轻微允许扩散改动物体外观优于完全保护,无遮挡约束会破坏标签。在 SULAND 地雷检测跨站点实验中,合成数据训练的 YOLOv11-L mF1 高于更大真实标注跨站点基线,但结论仍限于单任务、单地形和单检测器。

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning Figure 1
2026-08-11cs.CV

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

Hong Kong University of Science and Technology, The Chinese University of Hong Kong, Zhejiang University

2026-08-11视觉感知

论文针对视觉语言模型“用图像工具思考”中返回像素是否真正贡献推理增益的问题,提出 TextCall:保留工具名、坐标、目标描述和意图等文本脚手架,仅跳过返回图像。实验显示在 LoRA、全量微调和 RL 中性能持平或更好,延迟降低 29–46%,说明当前基准上的增益主要来自工具调用时生成的结构化文本而非像素本身。

MPISuperRes-PnP: A Super-Resolution Zero-Shot Plug-and-Play Reconstruction Algorithm for Magnetic Particle Imaging Figure 1
2026-08-11cs.CV

MPISuperRes-PnP: A Super-Resolution Zero-Shot Plug-and-Play Reconstruction Algorithm for Magnetic Particle Imaging

Vladyslav Gapyak, Thomas März, Andreas Weinmann

Institute for the Protection of Terrestrial Infrastructures, German Aerospace Center (DLR), Sankt Augustin, Germany, Data Science Institute, European University of Technology, European Union, Algorithms for Computer Vision, Imaging and Data Analysis Lab, Technische Hochschule Würzburg-Schweinfurt, Ignaz-Schön-Straße 11, 97421 Schweinfurt, Germany

2026-08-11三维

面向测量式磁粒子成像中系统矩阵网格粗、重新高分辨率标定成本随维度急增的问题,论文把超分辨率直接写入能量最小化重建,并用 plug-and-play 分裂迭代接入预训练高斯去噪器,实现零样本深度先验。实验在合成数据和真实 MPI 数据上做定量、定性评估,显示可提升重建分辨率且未观察到明显幻觉伪影。

CIFA: Contextual-Intersectional Fairness Auditing for Hidden Subgroup Discovery in Face Analysis Figure 1
2026-08-11cs.CV

CIFA: Contextual-Intersectional Fairness Auditing for Hidden Subgroup Discovery in Face Analysis

Nazia Aslam, Khalid Adnan Alsayed, Thomas B. Moeslund, Kamal Nasrollahi

2026-08-11视觉感知

本文关注人脸分析中总体准确率和单一人口属性公平性掩盖的隐性失效:光照、模糊、图像质量、配饰等上下文因素会与性别、种族等属性交互。CIFA将人口、上下文及其交叉子群纳入统一审计,并排序最差群体;在FairFace、CelebA、UTKFace上用ResNet-50和ViT-B/16验证,发现最差群体准确率差距可达26.43%,常见缓解方法虽有改善但不稳定。

Removing Infrastructure Barriers in Human-Robot Collaboration Through Wireless Reconfigurable Cells Figure 1
2026-08-11cs.RO

Removing Infrastructure Barriers in Human-Robot Collaboration Through Wireless Reconfigurable Cells

Emma Takács, Mátyás Hajós, Ádám Juniki, Ádám Fischer, Zoltán Komáromi, Kristóf Abai, Dániel Horváth, Sándor Máthé, Konstantinos Kousias, Bence Tipary

Removing Infrastructure Barriers in Human-Robot Collaboration, Human-Robot Collaboration (HRC) plays a vital, real-time perception and safe collaboration are greatly limited, in availability. This paper presents a highly flexible, wire-, Human-Robot Collaboration (HRC) is increasingly vital, HUN-REN Institute for Computer Science and Control (HUN-REN, E¨otv¨os Lor´and University (ELTE), Budapest, Hungary, University of Oslo, Norway, A supplementary video demonstrating the workcell is available at, as industrial collaborative robot (cobot) arms and their sensor, cells offers a solution, yet commercially available wireless, unavailable. Current industrial implementations still heavily

2026-08-11机器人

面向再制造等频繁重构的人机协作工位,论文针对供电/数据线缆限制移动性并带来安全风险的问题,提出电池供电的机器人挂载多传感器平台、5G边缘卸载与具备手部感知的视觉流程。系统在匈牙利和挪威多类5G网络中验证,视觉检测mAP@50–95达97.74%、平均推理12.5 ms,兼容网络下往返最低12 ms,但5G互操作性仍是实际部署限制。

EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization Figure 1
2026-08-11cs.CV

EgoHieraLoc: A Cortically Inspired Hierarchical Segmentation-Guided Framework for Egocentric Visual Query Localization

Yifei Cao, Guolong Wang, Mingliang Hou, Xiya Bu, Daming Liu, Yu Liu

2026-08-11视觉感知

针对第一视角视频中目标边界模糊、遮挡和视角变化导致的查询定位不稳,EgoHieraLoc借鉴人类层级视觉流程,将SAM分割先验、查询感知相关滤波与多尺度区域反馈结合,并用语义-几何联合置信度筛选可靠视角完成3D融合。实验显示其在VQL-2D和VQL-3D基准上达到SOTA,消融表明GSJC可提升成功率并降低定位误差。

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation Figure 1
2026-08-11cs.CV

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

2026-08-11视觉感知

本文针对视频扩散模型少步采样中“质量高但多样性低”和“多样性好但画质弱”的冲突,提出 DUET:按噪声阶段拆分专家,高噪声由 sCM 负责结构、布局和运动多样性,低噪声由 DMD 细化外观质量,并用角色化 RL 适配形成 DUET+。在 Wan2.1-T2V-1.3B 的两步生成实验中,DUET 接近 DMD 画质且保留约两倍于 DMD 的结构多样性,DUET+ 进一步提升总体质量。

NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation Figure 1
2026-08-11cs.CV

NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation

Haiyang Yan, Jinyue Guo, Yanchao Zhang, Bingqing Wang, Zhenchen Li, Jing Liu, Jiazheng Liu, Linlin Li, Hua Han

2026-08-11视觉感知三维

针对荧光显微三维神经元稀疏、细长且易被滑窗分割打断的问题,NeuroRefiner将专家“全局观察—局部修正”流程形式化为多智能体闭环:用拓扑指标定位错误、生成修正指令,并由TopoRefineNet执行体素级编辑。实验在BigNeuron、CWMBS和ZBFWB上优于既有方法,其中ZBFWB F1提升3.02%,但具体增益在多智能体推理与专用编辑网络之间的拆分仍需看消融细节。

LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection Figure 1
2026-08-11cs.CV

LoRA-based Adaptation Alone Is Not Enough: Understanding the Limits of Foundation Models for Face Presentation Attack Detection

Peter Lorenz, Anjith George, Marcel Sébastien

2026-08-11视觉感知

针对人脸呈现攻击检测在跨数据集时因传感器、光照和攻击形式变化而失效的问题,本文统一评测32个视觉基础模型和9个VLM,重点检验LoRA适配是否足够。结果显示零样本接近随机,LoRA可将多数模型域内ACER降到2%以下,但跨域仍高达约20%至43%,说明其主要优化数据集内决策边界,泛化更依赖预训练表征和适配数据。

Unsupervised Domain Adaptation for Multitask Image Analysis in Realistic Context with Extreme Label Shift; Application to the CTAO first Large Sized Telescope Figure 1
2026-08-11astro-ph.IM

Unsupervised Domain Adaptation for Multitask Image Analysis in Realistic Context with Extreme Label Shift; Application to the CTAO first Large Sized Telescope

Michaël Dell'aiera, Thomas Vuillaume, Alexandre Benoit

2026-08-11视觉感知

论文面向伽马射线望远镜中“仿真有标签、真实观测无标签且类别极端失衡”的视觉分析难题,将无监督域自适应与多任务权重平衡结合,并提出条件化 UDA 及重要性加权来缓解 label shift。作者在数字基准和 CTAO 首台 LST 控制退化仿真上比较多种方法,结果显示极端标签偏移会显著限制常规 UDA,而条件化策略能改善目标域分类表现;但真实观测上的增益仍文中未充分说明。

Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking Figure 1
2026-08-11cs.CV

Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking

Liying Yang, Hao Mo, Jialun Liu, Chen Liu, Xinxing Yu, Chenhao Guan, Hui Ma, Xiao Cao, Ajian Liu, Yanyan Liang

SCSE, Macau University of Science and Technology 1, The University of Queensland 2, Great Bay University 3, Tsinghua University 4, National University of Singapore 5, Institute of Automation, Chinese Academy of Sciences (CASIA) 6

2026-08-11视觉感知三维

这篇论文针对现有4D重建与点跟踪多停留在整数帧或依赖B样条等启发式插值、缺少连续运动一致性的问题,提出Uni4R:用ODE建模任意时刻速度场,并用最优传输/Flow Matching在特征流形上提供全局运动方向先验,再通过积分一致性从整数帧点图监督训练。实验称其在4D重建、点跟踪及连续时间运动学基准上达到SOTA,且80帧推理为1.57秒。

Structure-Enhanced Features and Quality-Aware Dynamic Anchor Scoring for Robust Lane Detection Figure 1
2026-08-11cs.CV

Structure-Enhanced Features and Quality-Aware Dynamic Anchor Scoring for Robust Lane Detection

Weize Cai, Yongqi Dong, Zhida Shao, Yichen Liu, Zixin Fu

2026-08-11视觉感知安全鲁棒

本文针对车道线细长、遮挡多导致特征连续性丢失,以及锚框分类分数与线级定位质量脱节的问题,在ADNet上加入GHVT横纵向结构建模模块,并用LQAS以质量监督、难负样本抑制和排序约束校准预NMS分数。VIL-100上ADNet-R34的F1@50由89.97提升至91.28,且FP/FN下降;CULane、TuSimple和消融显示主要增益来自结构特征增强,LQAS更多改善候选排序。

A Hybrid Neural-Microfacet BRDF Model for Real-Time Rendering Figure 1
2026-08-11cs.GR

A Hybrid Neural-Microfacet BRDF Model for Real-Time Rendering

Louis De Oliveira, Anastasia Karpova, Georges Nader, Antoine Houdard, Pierre Mezieres, Damien Rioux-Lavoie, Romain Pacanowski

2026-08-11视觉感知

实时渲染中的微表面 BRDF 高效且可编辑,但难以拟合衍射、虹彩、多层等复杂外观;纯神经模型表达力强却成本高且不易调参。本文将 GGX 微表面模型与共享小型 MLP 残差校正结合,用低维潜变量表示材料,并联合拟合解析参数和神经项。在 MERL、UTIA、RGL 测量数据上,同等内存下优于既有神经方法,且保持较低评估开销、重要性采样和艺术家可编辑性。

ResemBrick: Brick Reconstruction from Photographs with Perceptual Fidelity and Buildability Figure 1
2026-08-11cs.CV

ResemBrick: Brick Reconstruction from Photographs with Perceptual Fidelity and Buildability

Xilun Chen, Hanwen Wan, Yusong Zhao, Zexin Lin, Ruixiang Liao, Xiaoqiang Ji

2026-08-11三维

ResemBrick关注从少量无位姿照片生成可手工拼装的彩色积木模型,动机在于粗体素预算下外观相似度与结构稳定性相互牵制。其核心是把体素化改写为预算分配问题,用分辨率条件网络选择更保真的表面体素,再通过支持感知贪心放置和确定性修复保证接地连通。实验显示其在相同预算下感知保真优于几何选择器,并在测试物体上实现零悬空、零不稳定积木。

Illusion or Integrity? Geometrical Consistency Metric for AIGC Video Quality Evaluation Figure 1
2026-08-11cs.CV

Illusion or Integrity? Geometrical Consistency Metric for AIGC Video Quality Evaluation

Yifei Xue, Yuanchen Fei, Hao Zhang, Chenzhi Nie, Tie ji, Yizhen Lao

Hunan University, Hunan University China

2026-08-11视觉感知数据集/基准

该文针对生成视频“看起来真实但不满足多视图几何”的评估缺口,提出无需真值的 GeoCon-Bench:用平移门控在单应性与基础矩阵模型间切换,以内点率、几何误差评估刚性背景,并用光流指标分开衡量动态区域。论文还构建20个场景、六类运动的数据集,在多种AIGC模型上验证该指标可揭示传统感知/语义指标难覆盖的几何一致性问题。

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving Figure 1
2026-08-11cs.RO

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

Southeast University, Tsinghua University, Peking University

2026-08-11规划控制

FactorDrive针对自动驾驶VLA/CoT规划中过度依赖固定推理模板、缺少车道几何与动态交互等空间物理证据的问题,提出以规划关键因素驱动的自适应多步推理,并用PCF-CoT监督与MCTS引导的QS-GRPO搜索更优推理路径。实验在nuScenes和NAVSIM上报告达到SOTA,但具体增益中数据构建、搜索优化与模型规模的相对贡献仍需进一步拆分。

TeaMatch: Teachable Cross-Modal Representation Learning for 2D-3D Matching Figure 1
2026-08-11cs.CV

TeaMatch: Teachable Cross-Modal Representation Learning for 2D-3D Matching

Chongjian Wang, Junjie Gao

Shandong Women’s University, Shandong University of Science and Technology, Shandong Women’s University Jinan China, Shandong University of Science and Technology Qingdao China

2026-08-11三维

TeaMatch针对2D-3D匹配在噪声、低重叠和歧义结构下对应关系不稳定的问题,提出以“可教性”衡量跨模态表示:用退化输入下的弱学生在分离区域上恢复教师匹配偏好,并以对应级与几何约束反向正则教师。该训练期框架不增加推理成本,在7-Scenes和RGB-D Scenes V2等基准上提升强检测式/无检测式基线的鲁棒匹配与位姿估计表现。

GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association Figure 1
2026-08-11cs.CV

GenTrack3: Hybrid Stochastic-Deterministic Online Multi-Object Tracking with Cluster-Aware Association

Toan Van Nguyen, Rasmus G. K. Christiansen, Dirk Kraft, Leon Bodenhagen

*SDU Robotics, University of Southern Denmark, detection matching approach is introduced to enhance scalability with increasing target numbers while supporting, sented to address this issue but exhibited poor scalability as the, dating scheme and velocity regression. However, scalability, for temporal and scalable numbers of targets. Section 3 evalu-, Xi,t = (ui,t, vi,t, wi,t, hi,t), characterized by center (ui,t, vi,t) and, posed track-detection matching for scalable numbers of targets.

2026-08-11视觉感知

该文针对多目标跟踪中遮挡、非线性运动、非高斯噪声和目标数变化导致的身份保持问题,提出GenTrack3:用粒子集估计每个tracklet的不确定性,同时以确定性数据关联控制轨迹生成与删除,并通过聚类感知的track-to-detection匹配降低全局代价矩阵的扩展压力、支持群组跟踪。论文称在MOT17和MOT20上验证了有效性,但给定文本未呈现实验表格,具体精度增益和增益来源文中未充分说明。

You Only Flow Once: Calibrated and Real-Time Radar Pose Estimation with Multi-Hypothesis Normalizing Flows Figure 1
2026-08-11cs.CV

You Only Flow Once: Calibrated and Real-Time Radar Pose Estimation with Multi-Hypothesis Normalizing Flows

Jonas Leo Mueller, Sebastian Hoefler, Dario Zanca, Naga Venkata Sai Jitin Jami, Thomas Altstidl, Bjoern M. Eskofier

Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany, Munich Center for Machine Learning (MCML), Munich, Germany, Institute of AI for Health, Helmholtz Zentrum München, Germany

2026-08-11生成模型三维

毫米波雷达点云稀疏且含噪,同一观测常对应多种人体姿态,确定性回归会掩盖不确定性,扩散采样又难实时。论文提出 MH-NFPG,用时空 Transformer、异方差高斯先验与条件归一化流一次前向生成多假设姿态分布。三组雷达基准上校准误差较扩散基线降低 34% 到 85%,精度持平或更好,并以约 80 FPS 实现实时推理。

MSP-Net: Manifold-Guided Spectral Prompt Network for Hyperspectral Object Tracking Figure 1
2026-08-11cs.CV

MSP-Net: Manifold-Guided Spectral Prompt Network for Hyperspectral Object Tracking

Juliu Li, Hanlin Qin, Shuowen Yang, Jingjing Li, Yuedong Tan, Shuai Yuan, Huixin Zhou

2026-08-11视觉感知

针对高光谱目标跟踪中固定波段融合依赖传感器、忽略谱带流形关系且难以适应目标外观变化的问题,MSP-Net用图驱动流形路由自适应分组谱带,并结合模板外观生成动态谱条件提示,再用历史形态约束稳定定位。实验在HOT2020/2023等数据集上AUC超过0.80、Precision超过0.96,显示跨传感器和复杂背景下更稳健。

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation Figure 1
2026-08-11cs.CV

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

2026-08-11视觉感知数据集/基准

本文针对一次性生成交互式网页的评测短板:静态截图、代码或最终成功率难以解释具体失败及其成因。VideoVIBE将人工操作录像转化为细粒度诊断问答,覆盖语义逻辑、视觉运动、结构时序和功能执行等失败,并以源码作辅助证据;配套的V2Lens通过视频、视觉工具和代码核验进行保守修正。在13个视频多模态模型上,最佳单模型Gemini-2.5-Flash得64.54,V2Lens提升到71.72,说明视频驱动诊断能更有效刻画生成网页质量。

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation Figure 1
2026-08-11cs.CV

From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation

Zeyuan Ma, Jiaxin Chen, Di Huang

State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, School of Computer Science and Engineering, Beihang University, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University Beijing China, School of Computer Science and Engineering, Beihang University Beijing China

2026-08-11机器人视觉语言视觉感知优化算法

这篇论文针对长航程无人机视觉语言导航中地标难以精确落地、历史观测噪声积累和局部循环导致决策不稳的问题,将其归结为策略状态构建不足。方法把指令相关的物体语义与空间线索注入当前视角,用动态时间聚合筛选全历史并生成地标提示,再结合拓扑停滞识别与GRPO奖励优化动作。在AerialVLN和OpenFly上报告达到SOTA,消融支持DTA与LOC的贡献,但真实飞行部署仍未充分验证。

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images Figure 1
2026-08-11cs.CV

PressureMesh: 3D Human Mesh Estimation from Multi-Device Pressure Images

Changhai Ma, Ziyu Wu, Yunkang Zhang, Fangting Xie, Mengting Niu, Heyu Ding, Quan Wan, Jiayue Yuan, Boyan Liu, Yi Ke, Xiaohui Cai

2026-08-11视觉感知三维

本文针对单一床垫、椅子或地毯压力传感覆盖范围有限、难以处理多表面日常姿态的问题,提出 MDP-Net,从床、椅、地毯的时序压力图直接回归 SMPL 三维人体网格,并用 MoE 式模块自适应融合跨设备互补信息。作者还构建含 12 名受试者、96K 同步压力序列和多视角标注的 MDP 数据集;在该数据集上达到 12.6 cm MPJPE、14.5 cm MPVE,优于单设备基线。

Towards Collaborative Joint Perception and Prediction: Framework, Baseline Evaluation, and Deployment Perspectives Figure 1
2026-08-11cs.CV

Towards Collaborative Joint Perception and Prediction: Framework, Baseline Evaluation, and Deployment Perspectives

Lei Wan, Hannan Ejaz Keen, Alexey Vinel

Towards Collaborative Joint Perception and, Karlsruhe Institute of Technology, Karlsruhe, 76131, Germany., enabling advanced Collaborative Perception (CP) capabilities. Extending beyond, these capabilities, this work focuses on Collaborative Joint Perception and Pre-, sions. We present a conceptual framework for Collaborative Joint Perception, implement a minimal end-to-end Co-P&P prototype that couples collaborative, via FutureDet, showing that collaboration improves forecasting accuracy while, Keywords: Autonomous Driving, Connected Autonomous Vehicles, Collaborative, Perception, Collaborative Joint Perception and Prediction, Collaborative Joint Perception and Prediction, Collaborative Perception, Collaborative Scene Completion

2026-08-11数据集/基准

本文针对单车感知易受遮挡、模块化检测到预测流程会累积误差的问题,提出将V2X协同感知与运动预测统一的Co-P&P框架,并比较检测级、跟踪级、预测级融合。结果显示预测级融合反而弱于更早阶段融合;RENO点云压缩结合FutureDet的原型在约34倍低带宽下仍保留协同预测收益。

DocPure: Prompt-Free Unified Document Restoration via Degradation-Aware Structure-Guided Wavelet Modulation Figure 1
2026-08-11cs.CV

DocPure: Prompt-Free Unified Document Restoration via Degradation-Aware Structure-Guided Wavelet Modulation

Lingming Su (1), Wanglong Lu (1 and 2), Tao Wang (3), Kaihao Zhang (4), Nan Zhang (1), Liyan An (1), Hanli Zhao (1) ((1) College of Computer Science and Artificial Intelligence, Wenzhou University, Wenzhou, China, (2) AI Analytics Team, Nasdaq, St. John's, Canada, (3) vivo Mobile Communication Co., Ltd, Shanghai, (4) College of Engineering and Computer Science, The Australian National University, Canberra, Australia)

2026-08-11视觉感知

DocPure面向文档图像在拍摄和传输中同时遭遇模糊、噪声、压缩伪影、阴影等退化的问题,试图避免为不同退化训练独立模型或在推理时手工指定任务提示。其核心是用退化感知结构自编码器预测干净结构先验,并结合小波频域分解与跨频自适应调制,让低频结构信息约束高频文字细节恢复。实验覆盖12个数据集和4类任务,结果显示整体达到或超过现有方法,但具体增益来源仍需看消融与数据设置。

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework Figure 1
2026-08-11cs.CV

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

Dongxu Ge, Shansong Liu, Cheng Gong, Xiao-Lei Zhang, Chi Zhang, Xuelong Li

University of Science and Technology of China, Institute of Artificial Intelligence, China Telecom (TeleAI), Northwest Polytechnical University, University of Science and Technology of China Hefei China, Institute of Artificial Intelligence, China Telecom (TeleAI) Beijing China, Northwest Polytechnical University Xi’an China

2026-08-11视觉语言视觉感知数据集/基准

这篇论文针对音频到图像生成中数据集画质低、音画对齐粗糙导致强文生图模型微调效果受限的问题,构建323K音频-图像-文本三模态A2I-Set,并用多阶段筛选、生成与人工评测集提升训练和评估质量;基于该数据微调的AudioCanvas在视觉表现和跨模态一致性上优于既有方法,但部分增益可能主要来自更高质量数据与合成流程。

TriView-YOLO: Early Multi-View Fusion for Ground Penetrating Radar Cavity Detection in Soft, High-Water-Content Soils Figure 1
2026-08-11cs.CV

TriView-YOLO: Early Multi-View Fusion for Ground Penetrating Radar Cavity Detection in Soft, High-Water-Content Soils

Suphawut Thawinutchokaudom, Sompote Youwai, Warat Kongkitkul, Mitsumasa Yamashina, Jose M.D.S. Rodrigues Neto, Jun Shinohara

¹ AI Research Group, Department of Civil Engineering, Faculty of Engineering, King Mongkut’s University of Technology Thonburi, ² Center for Disaster Management Informatics Research, Ehime University, Matsuyama, Japan, ³ Canaan Geo Research Co., Ltd., Matsuyama, Ehime, Japan, requiring labels on one view only, derived labels (Section V-B).

2026-08-11视觉感知强化学习

面向曼谷软黏土、高含水地层中GPR空洞反射弱、人工判读成本高的问题,论文将纵向B-scan、C-scan和横向B-scan早期融合为9通道输入,仅改YOLOv12首层且只需单视图框标注。实地未增强测试上mAP50为0.558±0.028、3.1 ms/图,多视图提升召回;合成/公开数据、DINOv3、COCO预训练和放大模型均未带来收益,提示域匹配比通用迁移更关键。

A Height-Constrained 2-Point Minimal Solver for Pose Estimation from Active LED Markers with Event Cameras Figure 1
2026-08-11cs.CV

A Height-Constrained 2-Point Minimal Solver for Pose Estimation from Active LED Markers with Event Cameras

Runze Yuan, Alexander Kappler, Jun Zhang, Kuangyi Chen, Fabio Morbidi, Pascal Vasseur, Cédric Demonceaux, Friedrich Fraundorfer

Institute of Visual Computing, Graz University of Technology 2 MIS laboratory, University of Picardie Jules Verne 3 ICB laboratory, University of Burgundy Europe

2026-08-11优化算法三维

面向室内、隧道等 GNSS 受限场景中的低时延定位,论文利用机器人常见的倾角与高度先验,把事件相机观测到的两个主动 LED 标记转化为无歧义的 P2P 位姿求解问题,并给出闭式与线性最小二乘解及退化分析。合成和真实实验显示,该方法位置精度优于现有 P2P,在远距离观测时优势更明显,整体接近 P3P 表现。

XFeat Revisited: Reproducibility and Evaluation of a Lightweight Image Matcher Figure 1
2026-08-11cs.CV

XFeat Revisited: Reproducibility and Evaluation of a Lightweight Image Matcher

Lazar Đoković, Aimee Lin

University of Ljubljana

2026-08-11视觉感知数据集/基准

面向机器人、AR 等受限设备上的实时图像匹配需求,本文复现并重评轻量级匹配器 XFeat,重点厘清论文、补充材料与代码不一致带来的可复现性问题。核心洞察是其精度-效率优势基本可复现,但并非所有架构解释都成立:独立关键点分支对半稠密匹配有帮助但增益较原称更弱,单跳连位置的收益文中未充分说明。实验显示复现模型在 MegaDepth-1500、ScanNet-1500 接近或部分超过官方 checkpoint,同态估计一致,但 Aachen 定位低于原报告,跨模态场景退化明显。

Renormalising Generative Models for Active Inference: Foundations, Derivations, and Verification Figure 1
2026-08-11cs.AI

Renormalising Generative Models for Active Inference: Foundations, Derivations, and Verification

Karim Zaghw, Andrew Pashea, Marc Pritsch, Wouter Nuijten, Karl Friston, Lancelot Da Costa

2026-08-11生成模型

本文针对离散主动推断在复杂时空任务中状态、转移和策略规模迅速膨胀的问题,重构了可重整化生成模型:把低层状态与路径粗粒化为高层原因,再作为经验先验反向约束低层推断与规划。核心贡献不是提出新实验基准,而是给出自洽推导、显式区分固定点方程与 SPM 实现,并提供经 oracle 验证的 Python 复现;结果显示其能忠实复现三个示范,但独立性能增益和泛化效果文中未充分说明。

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping Figure 1
2026-08-11cs.CV

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen

2026-08-11数据集/基准

面向实际农业监测中跨年份泛化、细粒度作物区分、耕地边界识别和季中预测不足的问题,SwissCrop25构建了覆盖瑞士2019–2025年的全国级基准,结合Sentinel-2、温度物候信息、73类作物和5类非作物,并采用留一年测试。结果显示领域模型优于EO基础模型Galileo,TSViT总体最佳且较U-TAE高12个百分点macro-mIoU,温度特征提升鲁棒性,但早季预测中U-TAE更占优。

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction Figure 1
2026-08-11cs.CV

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

2026-08-11视觉感知

GeoRoute针对交通长时未来帧预测中扩散模型易出现的静态结构漂移、残影和时序不一致问题,提出无需训练的混合推理框架:前视车载场景用多帧深度点泼溅把历史静态像素投影到生成结果中,动态和低置信区域保留基模型输出;其他视角由Qwen辅助路由到运动预测器。其在AI City Challenge Track 5官方全测试榜排名第5,得分73.28,但动态目标运动仍主要依赖基生成器。

Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance Figure 1
2026-08-11cs.CV

Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

2026-08-11视觉语言

本文针对全能图像复原中常见的整图统一处理假设,指出雨、雾、噪声等退化在空间位置和强度上并不均匀。MGN-AIR用像素级视觉提示估计局部退化强度,并结合文本提示生成逐像素复原矩阵,引导不同区域采用不同复原策略。实验覆盖去噪、去雨、去模糊、去雾、去雪和低光增强,在多项基准上优于已有方法,复合退化场景报告约1.51 dB PSNR提升。

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge Figure 1
2026-08-11cs.CV

Agreement-Based Audio-Visual Segmentation:Champion Report for the MeViS-Audio Track in the 8th LSVOS Challenge

Yiwen Ren, Jianing Liu, Yingxin Wang, Kexin Zhang, Licheng Jiao, Lingling Li, Xu Liu

2026-08-11视觉感知

本文面向 MeViS-Audio 中“语音指代运动目标并需判断目标是否存在”的视频分割难题,核心思路不是依赖单一分割器置信度,而是先用 ASR 转文本,再生成多条候选 mask 轨迹,以候选间平均 IoU 一致性选取整段轨迹,并用方向、数量、复数规则和视频级存在分类器修正边界案例。系统在官方隐藏测试取得 0.5952 J&F、0.7931 无目标准确率、0.9205 有目标准确率,最终分 0.769589,排名该赛道第一。

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search Figure 1
2026-08-11cs.CV

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

2026-08-11视觉感知

这篇论文针对文本描述在真实监控图像中检索异常行人的 Sim2Real 难题:全局图文嵌入容易忽略动作、物体交互等细节,而直接用多模态大模型扫全库代价过高。FaLCon 的核心是以完整描述作锚点保召回,再用外观、动作、物体分面作受限修正,并在小候选集上结合 Qwen3、完形验证和多智能体证据推理做不确定性共识。PAB 上最终达到 95.41% mAP@10、94.44% R@1、99.09% R@5。

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation Figure 1
2026-08-11cs.CV

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

2026-08-11机器人视觉语言视觉感知强化学习

这篇论文针对无人机视觉语言导航中行为克隆缺少闭环纠错、失败样本利用低和长尾场景泛化弱的问题,提出 RecoverFly 作为后训练框架:在语法约束动作 token 上做强化学习,反复回放未解决失败案例,并用两阶段长尾课程与参考策略 KL 约束稳定更新。在 TravelUAV 上,相比 AerialVLA 成功率提升 3.12 至 8.37 个百分点,并在 seen、unseen-map、unseen-object 划分取得最佳表现。

Flow-based conditional cardiac anatomy generation for virtual cohorts Figure 1
2026-08-11cs.LG

Flow-based conditional cardiac anatomy generation for virtual cohorts

Konstantinos Kevopoulos, Beatrice Moscoloni, Benjamin Alheit, Cameron Beeche, Julio A. Chirinos, Alexander Heinlein, Mathias Peirlinck

2026-08-11生成模型

面向心脏数字孪生和虚拟队列,论文针对真实影像解剖数据受限且需保留人群亚组差异的问题,提出 CAN-FLOW:先学习几何形变动量的低维表示,再用条件 normalizing flow 建模性别、年龄和 BMI 相关分布。基于 2208 名 UK Biobank 健康受试者,模型较 cVAE 更好复现双心室表型分布、条件趋势、尾部样本和高维形状变异。

A Content-Aware Pure Permutation with Intrinsic Avalanche Effect: Breaking the Diffusion-Permutation Dichotomy Figure 1
2026-08-11cs.CV

A Content-Aware Pure Permutation with Intrinsic Avalanche Effect: Breaking the Diffusion-Permutation Dichotomy

Zahra Ghoraeian, Mohammad-Reza Sadeghi, Samaneh Mashhadi

2026-08-11生成模型

针对传统像素置乱只依赖图像尺寸、难以在纯置乱阶段产生差分敏感性的问题,论文提出TCA:用Canny边缘与角点构造Delaunay三角剖分,再由内容相关网格生成全局置换,使单像素变化可重塑置换模式。50张标准图像实验报告NPCR达97.10%、UACI为20.06%,但代价是三角剖分带来的速度下降。

Sekai2: From World Exploration to Interactive World Modeling Figure 1
2026-08-11cs.CV

Sekai2: From World Exploration to Interactive World Modeling

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge

2026-08-11强化学习

Sekai2针对交互式世界模型缺少长时序、相机轨迹和时间对齐语义同时具备的真实视频数据这一瓶颈,构建多源数据集并引入分层语义标注、姿态轨迹和带回访/闭环的全景子集。其结果是128,892段、2,826小时视频,覆盖113个国家或地区、649,597个时间定位片段,可用于长时程视频生成、相机可控合成和空间一致性预训练;方法贡献可能主要来自scaling / data。

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction Figure 1
2026-08-11cs.RO

VANE: Reliable Test-Time Training for Vision-Language-Action Models via Future Visual Representation Prediction

Hongjin Ji, Guoyang Xia, Luoyang Sun, Fangxiang Feng, Lei Ren

The Chinese University of Hong Kong, Shenzhen, Beijing University of Posts and Telecommunications, Institute of Automation, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Li Auto Inc.

2026-08-11视觉语言视觉感知

这篇论文针对VLA机器人在部署时用无标签交互流做测试时训练容易出现任务干扰和闭环误更新的问题,提出VANE:用上下文路由的潜提示混合表示任务修正,以未来视觉表征预测作为自监督信号,并通过影子更新、延迟验证和按证据提交来抑制退化。实验中,VANE在SimplerEnv WidowX上比对应TTT基线平均成功率高3.2个百分点,结论部分报告从64.3%提升到71.2%;但Google Robot结果显示增益受任务和机体影响,泛化性仍有限。

DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging Figure 1
2026-08-11cs.CR

DiffSafeMerge: Mitigating Backdoor Inheritance in Diffusion Model Merging

Jiayang Zhang, Ji Guo, Jiachen Li, Wenshu Fan, Wenbo Jiang

2026-08-11生成模型安全鲁棒

这篇论文针对扩散模型 checkpoint 合并中的供应链风险:恶意源模型的后门可能在干净生成正常时被继承。DiffSafeMerge 的关键思路是用少量无标签干净数据和攻击无关 stress probe,按源与 UNet 块扫描合并比例,识别稳定放大的可疑贡献,并在干净去噪损失预算内向可信参考收缩。实验覆盖4类攻击、2个数据集和21个目标条件,在已有零 ASR 情况下保持安全,在4个继承风险案例中三次种子均未出现目标匹配,同时在同为零最坏目标 ASR 的方法中取得较低平均 FID。

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer Figure 1
2026-08-11cs.CV

Unveiling the Secret of AdaLN-Zero in Diffusion Transformer

Jie Zhu, Mingyu Ding, Boqiang Duan, Leye Wang, Jingdong Wang

2026-08-11生成模型

本文针对 DiT 中 adaLN-Zero 为何优于 adaLN 这一机制问题展开分析,指出其收益主要来自零初始化带来的更好优化起点,而非仅是 SE-like 结构或渐进更新顺序;据此提出 adaLN-Gaussian 初始化与 SE-adaLN-Zero。实验在四个数据集、ImageNet1K 及文本到图像设置中显示两者可提升优化效率与生成性能。

Foundation Models are Implicit Deepfake Detectors Figure 1
2026-08-11cs.CV

Foundation Models are Implicit Deepfake Detectors

Stefan Smeu, Dragos-Alexandru Boldisor, Elisabeta Oneata, Dan Oneata

2026-08-11视觉感知

针对深伪检测依赖额外分类器且跨生成方式泛化不稳的问题,论文指出自监督基础模型本身已携带判别信号:伪造图像和视频会产生更低幅值、更稀疏的特征。作者用特征范数及L1/L2比值构造无需训练的异常分数,在多数据集、多骨干上达到或超过复杂方法,并发现信号主要来自语义偏移,且随模型规模增强,可能主要来自scaling / data。

MeanSR: Restoration Trajectory Learning for One-Step Perceptual Super-Resolution Figure 1
2026-08-11cs.CV

MeanSR: Restoration Trajectory Learning for One-Step Perceptual Super-Resolution

Axi Niu, Jiawei Kou, Kang Zhang, Qingsen Yan, Jinqiu Sun, Yanning Zhang

2026-08-11规划控制

扩散式超分辨率虽感知质量高,但多步去噪慢;一阶段蒸馏法又依赖昂贵教师模型。MeanSR的关键在于把低分辨率到高分辨率的有限时间恢复过程显式建模为LR条件平均速度场,并重写轨迹匹配、加入分阶段时间采样。实验显示其在合成和真实基准上优于CTMSR的CLIPIQA、MUSIQ、MANIQA,同时降低FLOPs与延迟,细节更锐利、伪影更少。

One Model to Magnify Them All: Efficient Scale-Invariant Histopathology via Conditional Normalization and Continuous Magnification Training Figure 1
2026-08-11cs.CV

One Model to Magnify Them All: Efficient Scale-Invariant Histopathology via Conditional Normalization and Continuous Magnification Training

Agnieszka Florkowska, Henning Müller, Marek Wodzinski

2026-08-11视觉感知

数字病理全切片在不同放大倍率下呈现互补信息,但固定倍率模型面对连续变化的扫描分辨率会退化,部署还常需多模型集成。本文用像素尺寸条件化 LayerNorm,由小型 MLP 动态生成归一化仿射参数,并配合连续倍率采样训练,使 ResNet/U-Net 可在未见倍率上推理。PANDA 实验中单个模型在分类和分割上平均匹配或超过单倍率基线,各倍率均列前三,并将五模型成本降至约 1/4-1/5。

Sign Language Recognition Using Original and Synthetic Depth Image Based Point Cloud Data Models Figure 1
2026-08-11cs.CV

Sign Language Recognition Using Original and Synthetic Depth Image Based Point Cloud Data Models

Rustem Ozakar, Eyup Gedikli

Department of Computer Engineering, Erzurum Technical University, Trabzon University

2026-08-11视觉感知三维

针对手语识别中过度依赖 RGB、深度数据集稀缺的问题,本文用 Depth Anything V2 从 RGB 合成深度图,再生成点云,并在三套含 RGB-D 的数据集上比较原始/合成深度点云的 PointNet、PGM 与 LSTM 模型。结果显示原始深度整体更稳,但合成深度多数情况下已接近可用,且在少数模型上反超;这些异常增益来源不清,仍需更多预处理和数据集验证。

CableDex: Cable Length Estimation on Industrial Reels Using a Handheld Device Figure 1
2026-08-11cs.CV

CableDex: Cable Length Estimation on Industrial Reels Using a Handheld Device

Francisco Guillén, Ricardo Almeida, Bruno Silva, João C. Neves

University of Beira Interior, University of Beira Interior NOVA-LINCS UBI Portugal, University of Beira Interior IT - Instituto de Telecomunicações Portugal

2026-08-11视觉感知

面向工厂中线缆卷盘剩余长度难以快速、准确测量的问题,CableDex用手机单张照片串联标定、YOLO11s实例分割、PnP位姿恢复和截锥体积估计,并结合标签中的线缆截面积换算长度。系统在5类卷盘75次现场测试中达到4.90% MAPE,分割模型99.5% mAP50、5.66 ms推理;但精度依赖规则绕线假设,松散或不规则缠绕下表现文中未充分说明。

CoInS-Net: A Continuous Position-Aware Network for Joint Medical Image Interpolation and Segmentation Figure 1
2026-08-11cs.CV

CoInS-Net: A Continuous Position-Aware Network for Joint Medical Image Interpolation and Segmentation

Yujia Sun, Ningfeng Que, Peiting Shi, Rongrong Fu, Yingying Yang, Xinhang Li, Yin Dai

2026-08-11视觉感知

针对各向异性医学体数据中层间采样稀疏导致的结构不连续、边界模糊,以及插值与分割分开建模带来的误差传播和冗余计算,CoInS-Net用共享Swin编码器、连续位置查询、原型式双向任务交互和多尺度协同解码,将任意位置切片插值与病灶分割端到端联合优化;四个公开数据集上相较最佳基线提升1.12–1.67 dB PSNR、1.8–2.9个百分点Dice,并将推理延迟近乎减半。

Efficient Human-Contact Representation for Human-Scene Interaction Figure 1
2026-08-11cs.CV

Efficient Human-Contact Representation for Human-Scene Interaction

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

2026-08-11视觉感知

本文针对人-场景交互中接触表示冗余、拖慢推理且影响精度的问题,提出 ECO:利用稀疏接触掩码只保留与物理接触相关的人体顶点信息,并用稀疏算子替代网络中的稠密计算。实验覆盖三个公开基准的接触预测与场景合成任务,报告重建精度优于现有方法,且相对近期基线至少获得 12 倍计算加速。

Imaginative Generative AI: Crossing the Entropy Wall into Worlds Beyond Imitation Figure 1
2026-08-11cs.LG

Imaginative Generative AI: Crossing the Entropy Wall into Worlds Beyond Imitation

Hossein Goli, Farzan Farnia, Amin Gohari

2026-08-11生成模型强化学习模仿学习

本文针对生成模型只模仿数据分布、难以修复多样性损失或定义超出数据的新颖性这一问题,提出 IGA:在接近参考分布的同时约束谱熵,并用“熵墙”区分数据内多样性修复与超越数据的想象式生成。理论上给出 KL 锚定下的指数倾斜形式,并导出无需重训的扩散模型 IGA Guidance;合成与视觉实验显示其能提升熵墙内多样性并实现可控谱外推。

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits Figure 1
2026-08-11cs.AI

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

Xinqi Yang, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

2026-08-11数据集/基准

针对现有多模态基准难以检验真实电路题中“看图到建模再求解”的长链条能力,本文构建 CircuitReason-1k,收集1000道教材电路题,配套图、问题、类型化答案和解题过程,并用题型/依赖深度 taxonomy 与混合评分协议评估。九个MLLM中最高准确率为84.8%,但长程题性能持续下降,主要暴露拓扑到目标绑定、物理约定和最终结果传递错误。

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution Figure 1
2026-08-11cs.CV

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

2026-08-11视觉感知强化学习

这篇论文针对真实图像超分中低质输入不清导致的内容漂移:细节被扩散先验“补错”,文本语义也可能偏移。作者提出一阶段 FSP-Diff,用结构细节引导的双路径同时注入高频结构并调制语义条件。实验称其在标准 Real-ISR 基准上优于现有一阶段扩散方法,但具体增益在多大程度来自结构细节设计仍需结合消融判断。

FeedbackTrack: Visual-Cortex-Inspired Cross-Frame Feedback for Transformer Tracking Figure 1
2026-08-11cs.CV

FeedbackTrack: Visual-Cortex-Inspired Cross-Frame Feedback for Transformer Tracking

Yueyang Cang, Xiaoteng Zhang, Zhiyuan Ning, Yuchen He, Li Shi

2026-08-11视觉感知

本文针对 Transformer 跟踪器多依赖逐帧前馈特征、难以让上一帧中间表征直接影响当前视觉处理的问题,提出 FeedbackTrack:在选定 Transformer 组之间缓存一帧历史状态,并通过 Query Feedback 与 Gate Feedback 分别调制搜索查询和注意力输出。该机制基本保留原跟踪流程、参数增加低于 1%,在 SPMTrack 与 ARTrackV2 的五种配置上稳定提升 LaSOT 与 GOT-10k,GOT-10k AO 提高 2.3–4.1 点,消融显示增益主要来自跨帧反馈而非单纯增加调制容量。

Deep Learning based Detection of Fishing Vessels and Fishing Monitoring using Nightlight Images Figure 1
2026-08-11cs.CV

Deep Learning based Detection of Fishing Vessels and Fishing Monitoring using Nightlight Images

Shantakar Mohanty, Prasun Kumar Gupta, Raian Vargas Maretto

Indian Institute of Remote Sensing, ISRO, Dehradun, India, University of Twente, Faculty of Geo-Information Science and Earth, for vessel detection in optical and radar satellite imagery, exhibiting high accuracy and scalability (Graziano

2026-08-11视觉感知

针对AIS缺失或被关闭导致的小型“暗船”监管盲区,本文用SDGSAT-1夜光影像做印度西海岸渔船检测,并设计双分支YOLO11融合10米全色与40米RGB特征以适配弱小光斑目标。模型报告precision 0.99、recall 0.93、mAP@50 0.96,2022-2023年检出31525艘次,其中77.3%未匹配AIS,显示近岸50-100公里大陆架为主要作业带。

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation Figure 1
2026-08-11cs.CV

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

2026-08-11生成模型规划控制

面向城市通信、感知与网络规划中射线追踪成本高、实测难扩展且难表达用户意图的问题,ControlRadio将无线电地图生成建模为文本与环境布局共同约束的扩散合成任务,引入布局感知ControlNet、可调噪声先验和解耦微调以增强物理一致性与可控性。实验称其在多种城市场景达到领先精度,并将在线生成从分钟级降至亚秒级,但该加速主要是离线训练后的摊销优势。

Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation Figure 1
2026-08-11cs.CV

Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation

Zhe Li, Honghao Qiao, Zhixin Xu, Qijie Wang, Bo Peng, Dawei Li

2026-08-11视觉感知

本文针对游戏资产 RGBA 动画生成中数据稀缺、先生成 RGB 再抠 alpha 易在半透明区域失真且计算浪费的问题,构建 GameAlpha-2.4K 数据集,并用合并 RGB-A latent 的图像条件 DiT 单阶段生成颜色与透明度。核心洞察是 alpha 可作为可见性信号,早期预测透明 token 后用 visibility router 与 x0-lock 跳过后续更新。实验显示其 FVD 优于两阶段基线,后两步跳过约 35% token,带来 1.2 倍骨干加速且质量接近 dense;但数据多为合成,前景密集场景加速受限。

One-Time Training for All Grains: Open-Set Grain Recognition and Quantitative Analysis Figure 1
2026-08-11cs.CV

One-Time Training for All Grains: Open-Set Grain Recognition and Quantitative Analysis

Qihe Su, Mengyu Sun, Yuxi Ke, Zhuoyan Jiang, Wanneng Yang, Chenglong Huang, Ziyuan Yang

2026-08-11视觉感知

针对谷物品种持续增加导致固定类别识别模型需反复采集数据和重训练的问题,本文提出 GROW:先做类别无关的单粒定位、计数和表型测量,再将视觉嵌入与形态描述子写入可扩展 GrainBank,通过加权 top-k 检索识别品种,新品种只需追加描述子。实验覆盖品种扩展、密度变化和背景迁移,注册时间由联合重训练的 4153 秒降至 39 秒,同时保持有竞争力的识别表现。

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs Figure 1
2026-08-11cs.CV

Beyond Global Editing: Per-Instance Disentangled Subspaces for Training-Free Hallucination Mitigation in LVLMs

Ali Cheraghian, Hamidreza Dastmalchi, Hamed Barzamini, Morteza Saberi, Mojtaba Golzan, Shafin Rahman, Hossein Rahmani

2026-08-11视觉语言

针对视觉语言模型容易把图像中不存在的内容说出来、而微调成本高的问题,论文提出训练-free的逐样本模型编辑:先用幻觉/真实描述的隐藏状态差异聚类并提取多个低秩幻觉子空间,推理时按当前输入自适应加权投影以抑制相应方向。实验称在六个基准和四类LVLM上稳定降低幻觉并保持原模型能力,但具体增益来源仍需结合消融判断。

Revisiting the Current Frame: Physical-Trace-Guided Network Output Correction for Video Restoration Figure 1
2026-08-11cs.CV

Revisiting the Current Frame: Physical-Trace-Guided Network Output Correction for Video Restoration

Yifeng Lin, Liuxiang Qiu, Guangming Ren, Tiesong Zhao

2026-08-11视觉感知

这篇论文针对视频复原中参考帧因遮挡、曝光差异或对齐误差带来局部错误的问题,提出把当前低质量帧重新作为时间对齐的观测锚点。核心做法是从辐射可观测性、结构保持和时间一致性等物理痕迹估计空间信任场,在复原输出与当前帧之间自适应校正。实验覆盖HDR视频重建和视频去雨,显示可在不改动原复原网络的情况下稳定提升多种SOTA模型。

GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models Figure 1
2026-08-11cs.AI

GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models

Zhihang Liu, Mei-Po Kwan, Jinlin Wu, Hao Li

2026-08-11视觉感知

面向新发滑坡缺少标注时视觉基础模型跨域误报高的问题,GeoPhysAdapter将地形、材料与降雨触发按其原生尺度分别用于像素和候选滑坡体的有界修正,并在证据不足时回退到视觉预测。实验显示,候选体尺度比像素尺度更能匹配粗粒度物理先验,错误降低23.99%,IoU提升0.031,且增益在多视觉骨干和预注册复现实验中保持为正。

Diffusion Image Editing via Asynchronous Token Decoding Figure 1
2026-08-11cs.CV

Diffusion Image Editing via Asynchronous Token Decoding

Yang Shi, Liangsi Lu, Minzhe Guo, Yifeng Xie, Yanhui Chen, Jingchao Wang, Xuhang Chen

Guangdong University of Technology, Hong Kong Baptist University, Peking University, Huizhou University, Guangdong University of Technology Guangzhou China, Hong Kong Baptist University Hong Kong China, Peking University Beijing China, Huizhou University Huizhou China

2026-08-11视觉感知生成模型

这篇论文针对文本引导扩散编辑中“全局同步改提示词”容易牵动背景和布局的问题,提出 ATDEdit:在 DiT 的 token 表示上用条件惊讶度动态找出应编辑位置,只让高响应 token 接受目标条件更新,并用源端 KV 记忆与硬投影约束保留 token。方法无需外部 mask 或微调,在 PIE-Bench 上取得较强保真结果,PSNR 27.44 dB、LPIPS 0.055,同时保持有竞争力的语义对齐。

Warp-free Cross-view Geo-localization via Feature-space Consensus Mining Figure 1
2026-08-11cs.CV

Warp-free Cross-view Geo-localization via Feature-space Consensus Mining

Zhuo Song, Lian Xu, Runqing Jiang, Yongjian Zhang, Kunhong Li, Ye Zhang, Yulan Guo

2026-08-11视觉感知

这篇论文针对街景与卫星图跨视角定位中,几何扭曲依赖强先验且会引入失真和噪声监督的问题,提出不做显式 warp,而是在训练阶段通过联合视角分支、全局模式探针和共识约束,在特征空间挖掘两视图共享语义;推理时丢弃辅助分支。实验称在 CVUSA、CVACT、University-1652 和 VIGOR 上达到 SOTA,并在跨区域设置下保持较强泛化。

MemeMind: Reference-Guided Trace Construction for Offline Context Optimization Figure 1
2026-08-11cs.CV

MemeMind: Reference-Guided Trace Construction for Offline Context Optimization

Run Yang, Weihang Wang, Boheng Sheng, Yuchen He, Jielei Zhang, Pengyu Chen, Zhiyu Wu, Qiang Sun, Huyang Sun, Longwen Gao

Fudan University

2026-08-11优化算法

这篇论文针对离线上下文优化中“同一问题所有 rollout 都失败”导致缺少可复用成功过程的问题,提出 MemeMind:用离线参考答案反推并验证工具调用轨迹,再将其压缩为共享和分工具指南供冻结模型推理使用。在 MemeX 表情包理解任务上,相比最强基线,Qwen3-VL-30B 提升约 21%–22%,235B 提升约 8%,消融显示主要增益来自 TraceBuilder 构造成功工具过程。

Degraded Infrared Small Object Detection via Degradation-Adapted Physics-Guided Restoration Figure 1
2026-08-11cs.CV

Degraded Infrared Small Object Detection via Degradation-Adapted Physics-Guided Restoration

Xinkai Lu, Wenjun Chen, Yi Li, Yi Chang, Luxin Yan

2026-08-11视觉感知

这篇论文针对雾、非均匀性等退化会压低红外小目标与背景对比、且通用复原易抹掉弱目标的问题,提出 DAISOD:先感知退化类型和强度,再用物理模型约束的分支估计退化参数并自适应融合,同时用对比学习对齐干净域特征。作者还构建了含多类退化强度的 IR-HDSOD 基准,实验显示其在多种退化条件下优于现有方法,但真实退化数据上的泛化仍需进一步验证。

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation Figure 1
2026-08-11cs.CV

Bootstrapping Vision-Language Model for Hysteroscopic Surgical Scene Segmentation

Jun Huang, Meiyi Chen, Zijie Yue, Yuhang Xiao, Fang Li, Hanli Wang, Xiaowen Tong, Yi Guo, Miaojing Shi

College of Electronic and Information Engineering, Tongji University, Shanghai, China., Department of Obstetrics and Gynecology, Tongji Hospital of Tongji University, Shanghai, China., Department of Obstetrics and Gynecology, Shanghai East Hospital, Shanghai, China., School of Medicine, Tongji University, Shanghai, China., extensive assessments by gynecologists, as well as multicentre and prospective validations, hysteroscopic surgeries. Code is available at https://github.com/viscom-tongji/VLM-hyster.

2026-08-11视觉语言视觉感知

宫腔镜场景中病灶形态相似且存在反光、模糊和液体遮挡,导致器械与病灶像素级定位困难。论文提出 VLM-hyster,用 MedCLIP 图像编码器、Transformer 解码器和类别文本提示,并通过掩码蒸馏过滤低相关视觉特征;同时构建三中心 4020 张、15 类标注数据集。实验报告 OIoU 达 80.35,优于 Med-SAM 的 74.29 和 Med-VLM 的 76.83,并通过多中心、前瞻验证和妇科医生评估支持其泛化性。

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation Figure 1
2026-08-11cs.AI

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador Herrera

2026-08-11视觉感知

这篇论文针对“CAD 外观看似正确但未必可工程使用”的评估缺口,提出 CADEngBench,将参数化零件生成/编辑、B-Rep 有效性、工程与 DFM 约束、线性 FEA 以及装配关节和实体 grounding 分轨测试。结果显示,八个多模态代码模型在编辑已有 CAD 上明显强于从零生成,但复杂编辑、结构响应匹配和精确装配关系恢复仍是主要短板。

UniDFKD: A Unified Semantic Prior Framework for Architecture-Agnostic Data-Free Knowledge Distillation Figure 1
2026-08-11cs.CV

UniDFKD: A Unified Semantic Prior Framework for Architecture-Agnostic Data-Free Knowledge Distillation

Xuewan He, Tong Chu, Zihan Cheng, Yuchen Su, Qianxin Xia, Guoming Lu, Jielei Wang, Wen Li

2026-08-11视觉感知

针对无数据知识蒸馏长期依赖 BatchNorm 统计、难以迁移到 ViT/LayerNorm 等架构的问题,UniDFKD 将有效先验重新解释为深层类别语义,并用语言驱动的类别条件、空间归因锚定和师生空间证据对齐统一生成与蒸馏流程。实验覆盖 CNN 与 ViT、同构和异构设置,报告相较既有方法平均绝对提升超过 20%。

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views Figure 1
2026-08-11cs.CV

GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views

Jiahui Cui, Yan Zhao, Kan Wei, Enze Zhu, Peirong Zhang, Lei Wang, Yiru Wang

Aerospace Information Research Institute, Chinese Academy of Sciences, Key Laboratory of Target Cognition and Application Technology (TCAT), University of Chinese Academy of Sciences, School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Aerospace Information Research Institute, Chinese Academy of Sciences Beijing China, Key Laboratory of Target Cognition and Application Technology (TCAT) Beijing China, University of Chinese Academy of Sciences Beijing China, School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences Beijing China

2026-08-11视觉感知

这篇论文针对无人机视角中目标小、背景杂导致的跨模态关注错位,以及俯视视角下外观结构相似、细粒度属性难区分的问题,提出 GRASP:用区域级图文对齐抑制背景干扰,并通过语义原型码本与文本/视觉扰动构造困难负样本强化属性判别。实验在 GeoText-1652 和未见 ERA 数据集上验证了其在无人机图文检索中的竞争性能,且训练期机制不增加推理开销。

Did the Grid Erase the Event? EndoClock for Auditing Medical World-Model Pipelines Figure 1
2026-08-11cs.CV

Did the Grid Erase the Event? EndoClock for Auditing Medical World-Model Pipelines

Yarin Udi, Tom Sharon-Shahak, Roee Masad, Dan Pri-Tal

2026-08-11强化学习

论文关注医疗世界模型中常见的固定网格同步预处理:当观测时钟受生理或采集状态影响时,重采样可能在训练前抹掉任务相关事件。作者提出 EndoClock,用四类“见证”层级审计证据是否仍存在于数值、更新模式、原生时间或外部采集通道中。结果以超声心动图案例说明,B-mode 写出在多普勒采集时停止,关键事件只留在外部日志;真正的无见证区间无法靠更细网格或下游模型恢复。

Task-Adaptive 3D Cross-Field MRI Translation via Field-Conditioned Content-Style Pretraining Figure 1
2026-08-11cs.CV

Task-Adaptive 3D Cross-Field MRI Translation via Field-Conditioned Content-Style Pretraining

Haowen Pang, Yingqi Hao, Pengli Zhu

2026-08-11三维

这篇论文针对不同磁场强度 MRI 间信噪比、对比度和空间细节差异带来的域偏移,提出以场强条件控制的三维内容-风格预训练框架,将解剖结构与场强相关外观解耦,再适配 Any-to-7T、0.1T-to-High 和 Any-to-Any 任务。成对测试显示方法能在五种场强、三种模态上保持三维结构一致性,但低场到高场、尤其 0.1T-to-7T 和 FLAIR 的残余对比不匹配仍存在,增益来源不清。

In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation Figure 1
2026-08-11cs.CV

In-Loop Model Adaptation with Coupled Latent-Noise Guidance for High-Fidelity Subject-Driven Text-to-Image Generation

Yushun Tang, Weiming Chen, Siyi Liu, Yi Zhang, Feng Wu, Zhihai He

2026-08-11视觉感知

这篇论文针对主体驱动文生图中“参考主体身份难保持、预训练扩散模型又难随新主体快速适配”的问题,提出在生成循环内进行模型自适应:推理时只微调图像交叉注意力的 K/V 参数,并用 DDIM 反演链与纯文本生成链构成的潜变量-噪声一致性损失,同时约束身份保真和文本对齐。实验显示 IMA 相比现有微调式和免微调方法提升了主体一致性与生成质量,但大幅视角、形状或颜色变化下仍受一致性约束限制。

RealDenseFace: Real-time Monocular 3D Face Reconstruction from Dense UV-space Priors Figure 1
2026-08-11cs.CV

RealDenseFace: Real-time Monocular 3D Face Reconstruction from Dense UV-space Priors

Linzhou Li, Tianjia Shao, Kun Zhou

State Key Lab of CAD&CG, Zhejiang University

2026-08-11三维

该文针对单目3D人脸重建中高精度优化拟合过慢的问题,提出在FLAME UV空间预测稠密对应与相对深度先验,并将拟合写成带解析雅可比的非线性最小二乘,用定制Gauss-Newton求解器快速收敛。结果显示其在NeRSemble SVFR上优于Pixel3DMM,单图约0.18秒,在线跟踪达84 FPS,离线序列较VHAP快24倍以上。

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models Figure 1
2026-08-11cs.LG

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

Harbin Institute of Technology (Shenzhen), Zhejiang University, Harbin Institute of Technology

2026-08-11生成模型强化学习

DreOPD针对流匹配文生图模型后训练中多目标冲突、RL梯度高方差与OPD只能模仿教师的问题,提出用退化参考模型构造教师-参考对比,并将隐式奖励外推转化为闭式速度回归目标,使学生可沿教师优势方向外推而非仅插值。单教师和多教师实验显示,其平均指标优于OPD和多任务RL基线,并在多数指标上超过专门教师。

BAG: Budget-Aware Gating for Diffusion Caching Figure 1
2026-08-11cs.CV

BAG: Budget-Aware Gating for Diffusion Caching

Tong Zhao, Mingkun Lei, Yucheng Han, Chi Zhang

2026-08-11生成模型

本文针对 DiT 生成推理中扩散缓存难以同时兼顾预算精确控制与样本自适应的问题,提出 BAG:用离线搜索得到的高质量缓存调度蒸馏出一个不足 1K 参数的门控网络,按剩余预算和轨迹变化逐步决定计算或复用特征。实验在 FLUX.1-dev 与 Wan2.1 上显示,BAG 在匹配 NFE 的多档加速下稳定优于 TeaCache、MagCache、SeaCache 等方法,约 5× FLUX 加速时 PSNR 提升 1.2 dB。

RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation Figure 1
2026-08-11cs.CV

RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation

Yuhan Li, Fangao Zeng, Sicong Kang, Mengfei Xu, Hao Zhou, Wei Li, Pipei Huang, Bingbing Ni

Shanghai Jiao Tong University

2026-08-11视觉感知强化学习

论文针对文本到图像模型中强化学习对齐与少步蒸馏通常分阶段进行、成本高且可能互相抵消的问题,提出 REST:直接复用 RL 采样中带奖励的中间轨迹作为学生蒸馏信号,并用 AMD 按优势加权甚至排斥低奖励轨迹。在构图、OCR 与偏好对齐实验中,少步无 CFG 推理可接近或超过 40 步 RL 教师,额外训练开销低于 25%,DrawBench PickScore 较 RTDMD 提升 0.82。

PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection Figure 1
2026-08-11cs.CV

PatchHead: Learning Spatial Patch Evidence for Generalizable AI-Generated Image Detection

Shengbo Qi, Hongyi Fang, Benjia Zhou, Rui Mao

2026-08-11视觉感知

这篇论文关注 AI 生成图像检测在跨生成器、跨数据集时泛化差的问题,指出仅用 DINO 的全局 CLS token 会压缩并削弱分散在局部区域的生成痕迹。作者提出轻量 PatchHead,保留 patch token 的二维空间结构并用局部卷积聚合证据。在九个跨数据集基准上,其平均平衡准确率由最强基线 91.6% 提升到 94.6%,最差场景由 82.4% 提升到 89.4%,额外计算开销很小。

FedTVD: Balancing Data Quality and Quantity for Robust Federated Learning Figure 1
2026-08-11cs.LG

FedTVD: Balancing Data Quality and Quantity for Robust Federated Learning

Radwan Selo, Majid Kundroo, Taehong Kim

organization=School of Information and Communication Engineering, Chungbuk National University

2026-08-11安全鲁棒

针对联邦学习中客户端标签分布偏斜与数据量差异共同导致的聚合偏置和模型漂移,FedTVD用总变差距离衡量本地标签分布偏离程度,并与样本量联合决定客户端权重,削弱大而偏的数据源影响。实验在FMNIST、CIFAR-10/100及多种异质性设置下优于FedAvg等方法,高偏斜CIFAR-10上最高提升10.6%,但增益对具体超参与分布假设的敏感性文中未充分说明。

FedA2L: Adaptive layer-wise learning rate adjustment in decentralized federated learning Figure 1
2026-08-11cs.LG

FedA2L: Adaptive layer-wise learning rate adjustment in decentralized federated learning

Van Truong Vo, Khoa Nguyen, Taehong Kim

organization=School of Information and Communication Engineering, Chungbuk National University

2026-08-11视觉感知

本文针对去中心化联邦学习在非 IID 数据下使用统一学习率导致层间优化需求失配、收敛慢的问题,提出 FedA2L:利用每轮本地训练前、训练后、邻居聚合后三种模型状态,估计层级权重发散与聚合稳定性,并据此无服务器、无额外通信地调整逐层学习率。实验覆盖多种 DFL 算法、模型和数据集,报告最高 4.94 倍收敛加速,并较调度器基线减少最多 59% 通信轮数。

NBA_Streaming: A Large-Scale Benchmark for Fine-Grained Basketball Commentary Generation in Continuous Streams Figure 1
2026-08-11cs.CV

NBA_Streaming: A Large-Scale Benchmark for Fine-Grained Basketball Commentary Generation in Continuous Streams

Lifang Wu, Yuyang Wu, Yangdong Gao, Fengyu Liu, Ya Jing, Liang Wang

School of Information Science and Technology, Beijing University of, Chinese Academy of Sciences, Beijing 100864, China

2026-08-11数据集/基准

这篇论文针对现有篮球视频字幕多依赖离线短片、难以在连续直播中判断何时解说且缺少球员身份和细粒度动作监督的问题,提出 NBA_Streaming 基准,包含 307 小时比赛和约 3.5 万个对齐事件,并设计“事件完成优先定位+以球为中心语义 grounding”的因果两阶段框架。实验显示现有基线在时机、事实落地和细节描述上明显受限,该框架取得稳定提升,但仍留有较大性能差距。

RAGMesh with FaME-G2E: Long-Form Text-Driven 3D Face Generation and Editing Figure 1
2026-08-11cs.CV

RAGMesh with FaME-G2E: Long-Form Text-Driven 3D Face Generation and Editing

Hao Li, Ju Dai, Feng Zhou, Mengting Shi, Haofei Wang, Zhen Song, Wei Zhou, Lei Li, Junjun Pan

Hao Li and Junjun Pan are with the State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China.

2026-08-11三维

本文针对长文本驱动3D人脸生成/编辑中局部几何难对齐的问题,指出仅靠全局语义或2D先验容易漏掉眉眼、脸颊、嘴角等细微且方向敏感的形变。其核心做法是构建FaME-G2E大规模文本-网格/文本-blendshape数据集,并用RAGMesh检索全局与区域几何先验,通过MSRF融合和AdaRAGS区域监督约束生成。实验称其在局部几何精度、文本可控性、区域编辑和推理效率上优于现有方法,但增益可能主要来自数据规模与检索先验共同作用。

Rethinking Medical Landmark Localization with Prototype Learning-based Progressive Offset Correction Figure 1
2026-08-11cs.CV

Rethinking Medical Landmark Localization with Prototype Learning-based Progressive Offset Correction

Jingxian Xu, Yuhao Huang, Rusi Chen, Yanfeng Zhou, Dong Ni

2026-08-11视觉感知

医学图像标志点定位常受解剖相似性、观察者差异和单阶段全局预测限制,而级联细化又增加计算负担。论文提出 PPOC-LL,用多尺度动态感知进行粗到细补偿,并以原型相似匹配预测局部偏移、误差感知正则稳定训练。在 X 光与超声三类数据上优于既有方法,同时保持较低模型复杂度。

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression Figure 1
2026-08-11cs.CV

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

The University of Sydney, Tongji University, University of Surrey, Nankai University, Cornell University, City University of Hong Kong

2026-08-11安全鲁棒

这篇论文针对VLM视觉token压缩只优化平均准确率、忽视错误后果差异的问题,提出按任务或问题可观测风险分配视觉计算预算,而非仅按注意力、冗余等内容信号删token。核心洞察是同等预算下应优先保护高代价请求,并用离线校准的错误-预算曲线在线分配。实验显示高风险错误从0.300降至0.133,混合负载成本加权错误降38%,且延迟较全分辨率低约21%。

LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search Figure 1
2026-08-11cs.CV

LightAIR: Lightweight Action Inversion and Riemannian Rectification for Text-based Person Anomaly Search

Yulun Zhang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Zihang Qiu, Zhilin Wang, Ruxin Wang, Yupeng Hu

Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shandong University, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences Shenzhen China, Shandong University Jinan China

2026-08-11视觉感知

本文面向文本行人异常搜索中“同外观、异动作”难以区分的问题,指出静态外观会淹没细微动作且欧氏对比学习易产生捷径。LightAIR用文本语义先验做动作反演,并通过正交零空间投影与黎曼梯度校正保持动作/外观解耦。文中称其在TPAS和TIPR数据集上超过现有方法,但具体增益来源仍需结合消融进一步判断。

OGG-FR: Orthogonal Gradient Gaming and Frequency Rectification for Unmanned Aerial Vehicle Infrared Image Super-Resolution Figure 1
2026-08-11cs.CV

OGG-FR: Orthogonal Gradient Gaming and Frequency Rectification for Unmanned Aerial Vehicle Infrared Image Super-Resolution

Yongsong Huang, Qingzhong Wang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

2026-08-11视觉感知优化算法

面向无人机红外超分在边缘设备上依赖轻量模型、但像素损失与频域损失易因低对比和噪声产生梯度冲突的问题,OGG-FR将频域梯度分解为与像素梯度平行的冗余项和正交创新项,并按冲突/兼容两种状态用MGDA、方差校正和高频残差置信度调整更新。文中在低光UAV热红外基准的BI/BD退化、4倍和8倍设置下报告多模型增益,并用梯度分析支持其优化机制。

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection Figure 1
2026-08-11cs.CV

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

Michigan State University, University of North Carolina at Chapel Hill

2026-08-11视觉感知三维

本文针对单目3D检测中物体级深度精度不足的问题,指出深度基础模型虽有零样本泛化,但直接替换检测器深度反而降低Omni3D AP3D。RefineAny3D的核心洞察是把深度误差转成投影框与目标的图像语义对齐,由VLM通过离散动作token迭代调远、调近或保持,而非回归数值深度。作为后处理模块,它在闭集、开放词表检测器和3D自动标注工具上均带来一致提升,并可跨类别、场景和相机泛化。

Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction Figure 1
2026-08-11cs.CV

Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction

Tianchen Deng, Chongdi Wang, Nailin Wang, Lei Zhao, Ziqi Ma, Tianjun Zhang, Zhe Liu, Danwei Wang, Hesheng Wang

2026-08-11三维

面向NeRF式SLAM在大场景中易遗忘、内存膨胀和轨迹漂移的问题,本文将场景渐进拆成多个神经子图,并用基于SALAD全局描述子的局部到全局回环、光流跟踪和子图间在线蒸馏来约束位姿与边界一致性。实验覆盖公开基准、自建室内外数据和板载部署,报告在重建质量与定位鲁棒性上优于现有神经SLAM方法。

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images Figure 1
2026-08-11cs.CV

Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi

2026-08-11视觉感知数据集/基准

这篇论文针对红外图像评测中“答案正确但解释不依赖热证据”的隐性问题,提出将答案正确性、解释扎实度和热 grounding 分离的评估框架,并用双 LLM 裁判校准判断。实验显示,仅用可见光化渲染会明显削弱热依据而准确率变化不大;训练-free 的 TGF 反馈能在不改答案的情况下提升解释 grounding。

UniMoFlow: Grounding Instruction-Driven 3D Human Motion Editing in Generation Figure 1
2026-08-11cs.CV

UniMoFlow: Grounding Instruction-Driven 3D Human Motion Editing in Generation

Yilei Hua, Beibei Jing, Ce Zheng, Hanyu Zhou, Yawei Luo, Wei Yang

2026-08-11视觉语言生成模型三维

这篇工作针对自然语言编辑三维人体动作时难以同时做到语义命中、时空定位和保留未改内容的问题,将编辑能力直接并入文本到动作生成框架。其核心是用闭环合成与筛选构建更大更多样的 Omni-MoEdit,并以统一 latent flow-matching 模型 UniMoFlow 共享生成与编辑知识,推理时用 SAFE 调节编辑强度。实验显示其在目标文本对齐、编辑有效性和循环一致性上优于既有编辑器,同时保持接近的源动作保真与生成质量,但增益可能主要来自 scaling / data。

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning Figure 1
2026-08-11cs.CV

CodecArena: Codec Quality Assessment via Visual Reinforcement Learning

Jiaye Fu, Weiqi Li, Qiankun Gao, Yanchen Zhao, Xiandong Meng, Jian Zhang, Siwei Ma, Jiaqi Zhang

2026-08-11强化学习

低/超低码率下,生成式视频编解码器会合成看似清晰但不忠实的细节,使 LPIPS、DISTS 等相似度指标误判质量。CodecArena 将评测改为以源视频为条件的视觉语言比较推理,并用 Facet-GRPO 在身份、物体、文字、纹理和时序一致性上锚定偏好学习。作者构建自动偏好集和人工排序基准,实验显示其与人类判断的一致性优于传统感知指标和既有 VLM 评测器。

Bright-Channel Retinex Enhancement with a Conditional Overdispered-Noise Analysis Figure 1
2026-08-11cs.CV

Bright-Channel Retinex Enhancement with a Conditional Overdispered-Noise Analysis

Jongpil Jeong

J. Jeong is with the 3D Optical Imaging Systems Lab, Department of Eletronics and Information Communication Engineering, Kyushu Institute of Technology, Iizuka, Fukuoka, Japan

2026-08-11视觉感知

本文针对低照度图像增强中无监督照明估计易放大噪声的问题,提出训练自由的 BRINEX:用局部亮通道构造 Retinex 照明图,并以条件负二项伪计数模型解释除法后的异方差噪声,指出像素级 Retinex 比值可视作条件 MLE,再用双边滤波抑噪。LOL-v1 上非训练方法中取得 17.74 dB PSNR、0.739 SSIM,约 43 FPS,但噪声模型为诊断性而非真实传感器标定。

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution Figure 1
2026-08-11cs.CV

When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution

Yu Shi, Yuyao Zhang, Yu-wing Tai

Dartmouth College

2026-08-11生成模型

本文针对潜空间扩散/DiT超分辨率中VAE压缩削弱像素证据、导致细节幻觉的问题,提出PGSR:在VAE前保留低分辨率像素特征,并分别用于引导潜变量流匹配轨迹和注入冻结VAE解码器。实验显示其在真实感与保真度权衡上优于现有潜式生成超分方法,输出更锐利且更贴合输入;但具体增益中各模块贡献需依赖消融验证。

Visual Distortion Detection in UGC Images Using Large Multimodal Models Figure 1
2026-08-11cs.CV

Visual Distortion Detection in UGC Images Using Large Multimodal Models

Ziheng Jia, Yingji Liang, Jiaying Qian, Xiongkuo Min

2026-08-11视觉语言视觉感知

本文针对UGC图像质量评估中局部失真难以精确定位、合成失真到真实场景泛化不足的问题,提出VIGIL:用LMM回到目标检测范式,构建VIGIL-140K数据集,并把LLM解码器多层作为同步检测器,同时保留背景类预测中的失真线索。实验显示其在合成域和S2A真实失真检测上优于强基线,但增益可能部分来自数据规模与后处理。

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation Figure 1
2026-08-11cs.CV

View-Adaptive Renderer for View-Consistent 2D-to-3D Generation

U-Chae Jun, Jaeeun Ko, Jiwoo Kang

Department of IT Engineering, Sookmyung Women’s University, University, Seoul, 04310, South Korea.

2026-08-11三维

本文针对单图到3D流程中先生成多视图、再用NeRF重建时常见的视角不一致问题,提出视角自适应神经渲染器:各视角用专门层修正局部误差,同时共享全局骨干,并通过自注意力融合多视图特征以保持结构一致。实验显示其在新视角合成和3D重建质量上优于NeRF基线,且无需SDS监督即可接近最优性能,计算开销相对更低。

Contrastive Mask Fidelity: Reference-Free Auditing of Ground-Truth Masks in Remote Sensing Semantic Segmentation Figure 1
2026-08-11cs.CV

Contrastive Mask Fidelity: Reference-Free Auditing of Ground-Truth Masks in Remote Sensing Semantic Segmentation

Shuaishuai Cao, Shuwei Peng, Meng Tang, Min Huang, Youjin Wang, Jie Chen, Jing Ouyang, Zhiwei Zhai

2026-08-11视觉感知

这篇论文针对遥感语义分割中“真值”掩码可能粗糙、漏标或错位,导致 mIoU 只衡量贴合标注而非贴合图像的问题,提出无需训练、无需参考标注的 CMF:通过保留/擦除掩码区域的反事实视图,让冻结的遥感视觉语言模型判断类别证据是否在掩码内且不在外部。实验审计 10 个数据集 10731 个图像-类别对,发现建筑、道路、车辆等人工类常更支持候选掩码;CMF 与三人盲审共识一致率达 81%,并用于保守仲裁后提升跨域迁移。

Real Data Closes Synthetic-to-Real Gap in Optical Chemical Structure Recognition Figure 1
2026-08-11cs.LG

Real Data Closes Synthetic-to-Real Gap in Optical Chemical Structure Recognition

Yani Guan, Dengpan Dong, Zi Wei, Shuang Luo, Dan Hannah, Yumin Zhang, Kang Xu

2026-08-11视觉感知

论文针对化学结构识别在合成图像上表现接近饱和、却难以迁移到真实论文和专利图像的问题,系统比较真实数据比例、VLM 基座和 LoRA 适配范围。核心洞察是标注真实图像比扩大合成数据或简单加视觉 LoRA 更关键,且视觉适配收益依赖基座。Qwen 在 ACS 上由 0.15 提升到 0.46,最佳 GLM 模型在 ACS、CLEF-IP、UOB、USPTO 上分别达到 0.49、0.65、0.84、0.76。

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision Figure 1
2026-08-11cs.CV

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

Institute of Information Science, Beijing Jiaotong University, City University of Macau, Beijing Jiaotong University Visual Intelligence + X International Joint Laboratory Beijing China, City University of Macau Macau Macau

2026-08-11视觉感知

这篇论文针对局部图像编辑中“文字缺少像素级位置、草图缺少语义意图”的双重歧义,提出包含源图、目标图、局部草图和指令的 SI-Data,并在 FLUX 上用 SPE、草图触发 token 和叠加信号融合空间与语义约束。实验显示 SI-Edit 相比文本、区域或草图基线有更好的结构对齐和语义遵循,尤其适合弯曲、拉伸等细粒度局部形变。

TLDChoiceNet: Quantitatively Choosing a Transfer Learning Dataset Figure 1
2026-08-11cs.CV

TLDChoiceNet: Quantitatively Choosing a Transfer Learning Dataset

Jing Ning, James D. Braza

Department of Computer Science, Stanford University

2026-08-11数据集/基准

本文针对小样本图像任务中“该用哪个预训练/迁移数据集”的选择缺少量化依据这一问题,提出 TLDS 三元组数据集与 TLDChoiceNet,用目标集和候选迁移集/模型嵌入预测微调后精度;其 v2 通过按类别的 ResNet50v2/激活嵌入将测试 MSE 从 0.154 降至 0.031,并提出 DD、ACC 两个无监督指标,其中 ACC 与微调精度线性相关 R² 达 0.97,显示低层数据统计可能解释主要迁移收益。

Learning human joint torques from pixels Figure 1
2026-08-11cs.CV

Learning human joint torques from pixels

Chen Chen, Rui Cheng

Beijing Normal-Hong Kong Baptist University, Zhuhai, China, AnHui University, Hefei, China

2026-08-11视觉感知

论文针对关节力矩估计依赖肌电、动捕、力板或仿真数据、难以用于普通单目图像的问题,构建VID真实图像逆动力学数据集与评测协议,并提出结合姿态预训练概率特征、标记点回归和时序力矩推理的VID-Network。在63,369帧VID上,模型mPJE为1.7612 N·m/kg,较最佳基线降低39.81%,显示从真实图像直接估计人体关节力矩具有可行性。

Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective Figure 1
2026-08-11cs.CV

Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective

Hongyi Fang, Chuwen Xie, Benjia Zhou, Yu-Xuan Qiu, Chenggong Hu, Zhibin Wang, Chao Chen, Jianbin Qin, Rui Mao

2026-08-11视觉感知

这篇论文针对训练免费 VAR 图像编辑中过度依赖目标条件重生成、易造成源图漂移和额外计算的问题,提出从源图 token 出发建模编辑量的 EditMod:在共享自回归上下文中比较源/目标条件预测差,并作为分尺度残差更新源表示。实验显示其在保持文本对齐的同时取得较高源图保真度,1K 图像单 A100 端到端约 1.57 秒。

Diagnosing as Cardiologists Do: ECG Agents with Doctor-Grounded Priors for Clinical Reasoning Across Diseases and Populations Figure 1
2026-08-11eess.SP

Diagnosing as Cardiologists Do: ECG Agents with Doctor-Grounded Priors for Clinical Reasoning Across Diseases and Populations

Hongxiang Gao, He-yang Xu, Yuwen Li, Minghui Zhao, Zhipeng Cai, Xingyao Wang, Chenxi Yang, Jianqing Li, Chengyu Liu

State Key Laboratory of Digital Medical Engineering, Southeast University, School of Instrument Science and Engineering, Southeast University

2026-08-11视觉感知

论文关注现有 ECG 多模态模型虽会给诊断标签、但缺少心电图医生式的波形定位、间期测量与证据归因这一问题。作者提出 LuminaECG,将十二导联 ECG 渲染到标准网格纸并显式标出 P 波、QRS 波群和 T 波,用医生先验组织训练数据,再以 2B 视觉语言模型微调完成诊断推理。结果显示其在波形测量、诊断恢复和报告生成上优于多类零样本基线,CODE-test 达 macro-F1 0.840、micro-F1 0.852,并能跨地区数据集迁移。

Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation Figure 1
2026-08-11cs.CV

Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation

Xuanyu Liu, Zheng Fang, Hongyang He, Yundi Hong, Daizong Liu

2026-08-11视觉感知

这篇论文关注半监督视觉基础模型适配中伪标签噪声会把可靠、模糊和错误梯度挤入同一个 LoRA 低秩空间的问题。TriNoL 的核心洞察是让置信度决定适配路径而非只决定损失权重,用正向、对齐、负向三个 LoRA 专家分别处理不同可靠性样本。实验显示其在低标注和噪声较强场景更有优势,如 FOOD-101、Semi-Aves 和 ImageNet 1% 多项优于 FineSSL/V-PET,但在较稳定设置中并非始终领先。

GeoAI-based post-segmentation quality validation of building footprints via spatial feature engineering Figure 1
2026-08-11cs.CV

GeoAI-based post-segmentation quality validation of building footprints via spatial feature engineering

Shah Imran Ahsan Chowdhury, Kazi Jihadur Rashid, Rajsree Das Tuli, Rahul Saha, Bulbul Ahammad

Department of Computer Science and Engineering, Jahangirnagar University, Department of Geography, Florida State University, Department of Geography and Environmental Sustainability, The University of Oklahoma

2026-08-11视觉感知

本文针对深度学习建筑物轮廓分割结果虽像素准确、却常含拓扑错误和畸变多边形、难以直接入库的问题,提出后分割GeoAI质检框架:融合U-Net与SAM-LoRA候选轮廓,经矢量化、规则化和去重后,用24类几何、空间上下文及影像特征训练对象级分类器。独立地点测试中,决策树以几何和空间特征表现最佳,准确率95.31%、F1为91.06%,将数据库残余错误率由27.32%降至4.62%。

Diversity Matters: Distributional Feature Coverage Sample Selection for Data-Efficient Backdoor Attacks Figure 1
2026-08-11cs.CR

Diversity Matters: Distributional Feature Coverage Sample Selection for Data-Efficient Backdoor Attacks

Yi Yang, Xiaoke Chen, Jinyang Huang, Feng-Qi Cui, Yu-Tong Guo, Jia-Cheng Zhao, Haiming Jin, Xiaokang Zhou, Meng Li

2026-08-11视觉感知

这篇论文针对低投毒率后门攻击中“选哪些样本”比单纯扩大预算更关键的问题,指出逐样本打分容易选到语义重复样本。作者提出 DFCS,用冻结预训练特征按投毒预算聚类,并从每簇选中心最近样本,以覆盖候选分布。实验在 CIFAR-10、Tiny-ImageNet、Imagenette 的 BadNets 和 Blended 设置中平均 ASR 达 96.30%,较最强对比方法平均高 4.60 个百分点,同时基本保持干净精度。

Bridging the Gap Between Semantics and Reconstruction:Unifying Sign Language Translation and Production Figure 1
2026-08-11cs.CL

Bridging the Gap Between Semantics and Reconstruction:Unifying Sign Language Translation and Production

Xiao Liu, Shiwei Gan, Yafeng Yin, Jiaxin Yin, Bowen Guo, Yaqi Sun, Zhiwei Jiang, Lei Xie

State Key Laboratory of Novel Software Technology, Nanjing University, State Key Laboratory of Novel Software Technology, Nanjing University Suzhou Jiangsu China, State Key Laboratory of Novel Software Technology, Nanjing University Nanjing Jiangsu China

2026-08-11三维

这篇论文针对手语翻译和手语生成长期分开建模的问题,指出二者虽是手语与文本的反向映射,但共享表示会受“语义抽象”和“动作重建”目标冲突限制。作者提出 Uni-SLTP,用 SR-RVQ 分层姿态 tokenizer 区分语义锚点与残差动作细节,并用统一自回归模型完成双向生成;实验显示其提升手语生成的动作精度,同时保持有竞争力的手语翻译表现。

SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs Figure 1
2026-08-11cs.CV

SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs

Shiwei Gan, Xiao Liu, Yafeng Yin, Zhiwei Jiang, Bowen Guo, Lie Xie, Sanglu Lu, Hongkai Wen

State Key Laboratory of Novel Software Technology, Nanjing University, University of Warwick, State Key Laboratory of Novel Software Technology, Nanjing University Nanjing Jiangsu China, State Key Laboratory of Novel Software Technology, Nanjing University Suzhou Jiangsu China, University of Warwick Coventry United Kingdom

2026-08-11视觉感知

本文针对无 Gloss 手语翻译中 LLM 难以理解连续视觉特征、且自回归拼接易偏向文本的问题,提出 SignLlama:用过滤伪 Gloss 的 CTC 预训练缩小视觉与文本表征差距,再以视觉优先蒸馏让遮蔽文本的路径学习依赖视频生成。实验显示其在 Phoenix14T、CSL-Daily 等数据集上达到或接近最佳结果,且不依赖额外模态或外部手语预训练数据。

DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models Figure 1
2026-08-11cs.CV

DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models

Chen-Hsiu Huang, Mario Köppen, Ja-Ling Wu

National Taiwan University, Taipei, Taiwan, Kyushu Institute of Technology, Fukuoka, Japan

2026-08-11生成模型

这篇论文针对潜在扩散模型生成图像的版权追踪与虚假信息风险,指出现有频域水印依赖手工几何图案、容量受限且训练中难以显式适配攻击。DeepFreqMark用神经编码器/解码器在DCT或FFT潜变量频域端到端嵌入消息,并用保持高斯方差的Slerp模拟攻击以避免DDIM反演开销。实验称其在多种真实攻击下BER低于基线,同时可扩展到256 bit容量并维持生成质量。

Detecting Clear Contact Lenses for Iris Recognition: A Two-Stage Mask-Guided Attention Approach Figure 1
2026-08-11cs.CV

Detecting Clear Contact Lenses for Iris Recognition: A Two-Stage Mask-Guided Attention Approach

Parisa Farmanifard, Arun Ross

Michigan State University, East Lansing, MI 48824

2026-08-11视觉感知

这篇论文针对虹膜识别中常被忽视的透明隐形眼镜问题,指出其虽无明显纹理伪影,却会在虹膜缘产生细微信号并降低商业匹配器表现。方法将花纹镜片检测与透明/无镜片区分拆成两阶段,并在ConvNeXt中引入Hough解剖ROI掩码、空间注意力和通道重标定以聚焦边界区域。四个数据集上整体准确率为90.0%–98.8%,基于预测标签的z-score校准使EER降低4.1%–28.3%。

CoRe-UIE: Rethinking Coexisting and Region-wise Degradation for Underwater Image Enhancement Figure 1
2026-08-11cs.AI

CoRe-UIE: Rethinking Coexisting and Region-wise Degradation for Underwater Image Enhancement

Weifeng Kong, Chenghao Xu, Lin Chen, Ziheng Cao, Guanying Huo

2026-08-11视觉感知

面向水下机器人感知中常见的区域异质退化,CoRe-UIE指出颜色偏移、散射雾化、纹理衰减和光照不均常在局部共存,统一映射难以兼顾。方法以共享内容专家加四类机制专家,通过退化线索驱动的区域Top-k路由协同恢复,并用HSIC约束降低专家冗余。实验在UIEB、LSUI、U45上显示其定量表现有竞争力,视觉增强更均衡。

Fourier Self-Supervision for Fine-Grained Generalized Category Discovery Figure 1
2026-08-11cs.CV

Fourier Self-Supervision for Fine-Grained Generalized Category Discovery

Sarah Rastegar, Mina Ghadimi Atigh, Pascal Mettes, Yuki M. Asano, Cees G. M. Snoek

2026-08-11视觉感知

本文针对细粒度广义类别发现中,常规自监督/对比学习容易依赖表面线索、难以区分相近类别的问题,提出 Fourier Self-Supervision:用低通频率学习更抽象的类别层级与泛化信息,用高通频率强化边缘、纹理等细节辨别,并在独立潜空间中融合两者。实验显示其在多个细粒度基准上超过现有方法,类别数未知时仍有效,粗粒度和长尾设置也具竞争力。

RMR-Net: Degradation-Evidence-Guided Road-Image Restoration for Defect Detection Figure 1
2026-08-11cs.CV

RMR-Net: Degradation-Evidence-Guided Road-Image Restoration for Defect Detection

Amir Ghorbani, Amirali K. Gostar, WeiQin Chuah, Vahid Ghorbani, Aidan Blair, Alireza Bab-Hadiashar

2026-08-11视觉感知

这篇论文针对车载道路图像中运动模糊、失焦、低照和噪声会削弱裂缝与坑洞边界的问题,提出 RMR-Net:用图像估计退化状态,并可融合受控合成退化参数,通过 FiLM、任务证据注意力和有界细节残差保留检测相关高频结构。在 IVCNZ 与 PCM 的八种退化测试中,冻结 YOLO11s 评估下七项 mAP50 最优,但辅助参数并非真实车载遥测,外场有效性文中未充分说明。

Damage Classification for 3D Point Cloud Data via 3D Data Analysis and Vision Foundation Model-based 2D Projections Figure 1
2026-08-11cs.CV

Damage Classification for 3D Point Cloud Data via 3D Data Analysis and Vision Foundation Model-based 2D Projections

Evan Perez, Kalelo Dukuray, Erika Ardiles-Cruz, Jie Wei

2026-08-11视觉感知三维

本文针对三维点云损伤细粒度分类中计算开销高、受损样本稀缺的问题,比较了直接在点云上做部件分割、TDA特征压缩与异常检测的3PDA,以及将点云多视角投影后调用视觉基础模型的2PDA。结果显示,3PDA在少数几何类别上精度更高但代价大,2PDA精度略低却显著降低时间复杂度并具备更广泛的类别泛化能力。

Topology-Aware Global-Local Mamba Networks for Palm Vein Biometrics Figure 1
2026-08-11cs.CV

Topology-Aware Global-Local Mamba Networks for Palm Vein Biometrics

Zhengxi Wu, Felix Marattukalam, Waleed H. Abdulla

University of Auckland, New Zealand

2026-08-11视觉感知

针对掌静脉纹理细、拓扑长程依赖强且公开数据有限的问题,论文将Sobel边缘先验、方向条带卷积、多尺度局部特征和四向Mamba扫描组合,并用分阶段门控融合服务于验证。结果在HKPU-NIR和VERA上取得最低EER(0.08%、0.61%)且参数最少,但top-1仍低于GLVM,FLOPs较高,部分增益来源需更统一基线验证。

EndoMD-SLAM: Endoscopic Gaussian Splatting SLAM under Optical Degradation with Memory and Static-Transient Decomposition Figure 1
2026-08-11cs.CV

EndoMD-SLAM: Endoscopic Gaussian Splatting SLAM under Optical Degradation with Memory and Static-Transient Decomposition

Nuo Chen, Kangqi Ni, Lulin Liu, Joga Ivatury, Ying Ding, Farshid Alambeigi, Tianlong Chen, Zhiwen Fan

∗ These authors contributed equally. Nuo Chen and Zhiwen Fan are with Texas A&M University, College Station, TX, USA. Kangqi Ni and Tianlong Chen are with the University of North Carolina, at Chapel Hill, Chapel Hill, NC, USA. Lulin Liu is with Texas A&M University, College Station, TX, USA, and the University of Minnesota, Minneapolis, MN, USA., Joga Ivatury, Ying Ding, and Farshid Alambeigi are with the University of Texas

2026-08-11三维

这篇论文针对内窥镜3DGS SLAM在冲洗、水滴和碎屑等光学退化下容易跟踪漂移、把瞬态污染物写入长期地图的问题,提出EndoMD-SLAM:用时间记忆筛掉低可信观测并基于干净关键帧重定位,同时用自监督静态-瞬态分解隔离污染物。在退化导向结肠镜基准上,绝对轨迹误差降低91%,渲染PSNR提升9.9 dB。

Can Webcam Gaze Constrain Mesa-Objectives in Driving Models? An Instrument Precision Analysis Figure 1
2026-08-11cs.CV

Can Webcam Gaze Constrain Mesa-Objectives in Driving Models? An Instrument Precision Analysis

Lennox Anderson, Ahmed Boutar, Jonah Mulcrone, Tal Erez

Duke University, Durham, NC 2ONYX AI LLC, gaze is available during training but not at deployment, additional information available only during training, with, angle in controlled lab settings, degrading further online., Data quality and noisy labels. Northcutt et al. (2021), found that even 3.4% average label error across major, across all viewers. Center: viewer-separated attention, Platform available at https://github.com/Onyx-AI-

2026-08-11视觉感知

这篇论文关注自动驾驶危险检测模型可能学到伪目标的问题,检验训练阶段加入普通摄像头采集的人类注视是否能约束此类 mesa-objectives。核心洞察不是提出有效增益,而是通过校准、随机森林与因果 Transformer 对照实验排除模型因素,发现注视特征均无显著提升;几何分析进一步说明 WebGazer 误差远大于多数危险目标尺寸,导致对象级注视归因在该精度下不可行。

Zero-shot 2D Grounding with Novel Affordance Types Figure 1
2026-08-11cs.CV

Zero-shot 2D Grounding with Novel Affordance Types

Haomeng Zhang, Raymond A. Yeh

Department of Computer Science, Purdue University

2026-08-11视觉语言

本文针对2D可供性定位长期只评测已见可供性类型的问题,提出新可供性类型零样本定位任务与AGD20K-NAT、UMD-NAT基准。核心思路是利用物体子部件与可交互区域的相关性,用分割线索构建免训练的AffordAnything,并以轻量融合得到AffordAnything+。实验显示现有VLM和定位方法在NAT上明显受限,AffordAnything+在AGD20K-NAT上较OOAL的IoU@0.4绝对提升12.3%。

From Noise to Meaning: Meaningful Secret Sharing with Tamper Detection for Facial Recognition Figure 1
2026-08-11cs.CV

From Noise to Meaning: Meaningful Secret Sharing with Tamper Detection for Facial Recognition

Ajnas Muhammed, Iurii Medvedev, Nuno Gonçalves

Institute of Systems and Robotics, University of Coimbra, Coimbra, Portugal, 3030-290

2026-08-11视觉感知

面部识别训练依赖敏感生物特征数据,传统视觉秘密共享虽能分散存储,却因噪声状份额易暴露且缺少篡改检测。论文将人脸补丁份额嵌入自然封面图,并结合自适应 LSB、SHA-256 与 DWT 水印做双层完整性验证。多数据集实验显示其可降低份额可识别性,抵抗翻转、裁剪和替换攻击,并保持或提升识别准确率。

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision Figure 1
2026-08-11cs.CV

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

Delin Mao, Chenghao Sun, Jingwei Song, Chishui Chen, Linfeng Zhang

2026-08-11视觉感知

本文针对小型多模态模型学习视觉工具时的两类错配:SFT 模仿强教师但超出学生感知能力,RL 又容易抑制工具或奖励无效调用。ToolVision 用学生尺度评审团筛选有证据增益的工具轨迹,并仅在工具对冻结模型确有帮助的问题上给予奖励。ToolVision-8B 在七个基准均优于基座,在三项高分辨率任务超过 Thyme、CodeVision 和 CodeDance,并在 V*、HRBench 8K 上超过 Qwen3-VL-32B-Thinking。

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability Figure 1
2026-08-11cs.CV

From Recovery to Drop-off: How Action Post-training Reduces a VLM's Late-Layer Depth Decodability

Alexander Hackett, Arnaud Denis-Remillard, Axel Cassou

2026-08-11视觉语言

本文关注VLM经动作后训练成为VLA后,原有空间几何表征是否仍可被读出。作者用权重匹配的Molmo2-ER/MolmoAct2-LIBERO逐层探测深度信息,并通过消融定位机制:VLA各层深度可解码性均低于基座,末层还出现明显“cliff”式崩塌;删除后期MLP写入可恢复大部分末端跌落,说明动作训练可能重用途径并干扰几何读出。

City Sentinel: A Unified AI-Based Smart Surveillance Framework for Real-Time Multi-Threat Detection Using Deep Learning Figure 1
2026-08-11cs.CV

City Sentinel: A Unified AI-Based Smart Surveillance Framework for Real-Time Multi-Threat Detection Using Deep Learning

Hanan Syed Shabir, Noor Fatima, Safia Baloch, Masroor Hussain

GIK Institute

2026-08-11视觉感知

面向城市监控中人力盯屏疲劳、单任务系统割裂和多界面切换的问题,City Sentinel 将人脸、车牌、火烟、武器/刀具、暴力和事故检测统一到基于 RTSP、FastAPI、Next.js 与 PostgreSQL 的多模型平台。其创新主要在工程集成与可扩展架构,而非新模型;在 RTX 3060 上中位端到端延迟 743 ms,4 路流低于 2 秒,脸匹配 91.2%、车牌读取 85.7%,但遮挡、低光和非标准车牌下仍明显退化。

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images Figure 1
2026-08-11cs.CV

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

Rui Li, Chenxi Duan, Haoyang Yang

Institute for Data, Systems, and Society, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, United States, Department of Civil Engineering and Management, School of Engineering, The University of Manchester, Manchester, United Kingdom, Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University, Hong Kong Special Administrative Region, China

2026-08-11视觉感知

面向遥感影像中用语音指代目标并输出像素级掩码的交互需求,论文构建了含多口音、多噪声条件的 VoiceAeroRef,并提出 AeroReformer2:用保边视觉路径、保留语音 token 的编码、核线性交叉注意力和高分辨率细化头降低跨模态匹配开销。Swin-B 版本在 clean split 达到 62.09% mIoU、68.22% oIoU,较最强音频适配基线分别提升 5.38 和 2.08 个百分点,hard set mIoU 为 54.09%。

Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction Figure 1
2026-08-11cs.CV

Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction

Aya Manel Zitouni, Aicha Zenakhri, Karim Haroun, Larbi Boubchir

2026-08-11视觉感知

该文针对ViT在人脸表情识别中对所有图像token等量计算、边缘部署成本高的问题,提出SAE用token pruning保留眼睛、嘴部和脸颊等更具情绪判别力的区域,并结合地标与图像流的金字塔交叉融合。RAF-DB实验显示,其在丢弃40% token时取得最佳精度,丢弃90%时精度仅较基线下降约0.3%,总体可在接近或超过现有方法的同时显著降复杂度。

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline Figure 1
2026-08-11cs.CV

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid

Bangladesh University of Engineering and Technology

2026-08-11视觉语言视觉感知

这篇论文针对真实 CCTV 交通事故中无标注训练数据、碰撞瞬间短且画质差导致时间、位置和类型联合预测困难的问题,提出无需训练的粗到细 VLM-Tracking 流水线:先用 Qwen3-VL 粗定位事故时间,再在局部窗口结合 YOLO11x、BoT-SORT、框标注和归一化坐标文本细化判断。在 2027 段真实测试视频上 HM 达 0.504,较官方最佳集成基线 0.412 相对提升 22%。

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3) Figure 1
2026-08-11cs.CV

Toward Mask Annotation-Free Surgical Instrument Segmentation from Endoscopic Images Using Text-Prompted Segment Anything Model 3 (SAM3)

Nakul Poudel, Richard Simon, Cristian A. Linte

2026-08-11视觉感知

本文针对手术器械分割依赖像素级标注或人工点框提示的问题,尝试用 SAM3 的文本提示实现无掩码标注流程。关键做法不是直接输入器械类别名,而是用通用提示“tool”先生成类别无关掩码,再用基于 SAM3 掩码区域微调的 Qwen 判别器械类别,将定位与分类解耦。在 EndoVis 2017/2018 上,该方法仍落后于全监督模型,但明显优于直接用 SAM3 类别文本提示做实例分割,说明瓶颈主要在跨域语义提示与细粒度器械识别。

SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport Figure 1
2026-08-11cs.CV

SLAP: Selective Local Vision-Language Alignment for Fish Re-Identification via Partial Optimal Transport

Cigdem Beyan, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen

2026-08-11视觉语言视觉感知

针对鱼类重识别中身份线索常集中在头部、鳃盖等局部区域,而现有 CLIP 式方法用全局图文对齐易引入背景和弱判别区域的问题,SLAP 将图像 patch 与多个身份提示通过部分最优传输做选择性局部对齐,只保留视觉编码器用于推理。实验显示其在 Melops 的闭集、开集评测均优于近期 CLIP-ReID 方法,并在其他海洋 ReID 数据集上表现出一定泛化性。

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models Figure 1
2026-08-11cs.RO

SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models

Junjie He, Junfeng Li, Zhide Zhong, Haodong Yan, Ruixin Li, Yangyang Zheng, Jiaguan Zhu, Tianran Zhang, Yuqiao Du, Wen Chen, Shunbo Zhou, Haoang Li

2026-08-11强化学习

SG-WAM针对现有世界-动作模型主要依赖视觉线索、语言指令与预测视频语义错位的问题,引入VLM语义规划器,提前生成文本对齐与空间感知的语义前瞻,并注入视频与动作预测过程。其洞察是用目标物体语义和几何线索约束未来生成,可让动作更贴合指令;在LIBERO、LIBERO-Plus及真实机器人实验中报告了SOTA表现和更强鲁棒性。

Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding Figure 1
2026-08-11cs.CV

Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding

Donghui Feng, Fengxi Zhang, Changsheng Gao, Wenhan Yang, Qi Wang, Qunshan Gu, Hongwei Hu, Zhengxue Cheng, Li Song

2026-08-11视觉感知

面向边缘—云端分布式部署中 ViT 中间特征传输带宽高的问题,论文指出现有方法把全局 token 与 patch token 展平成伪图像,忽略了 patch 网格上的局部空间冗余。VTC 将两类 token 分路编码,用因子先验处理全局 token、用空间—通道上下文模型压缩 patch 网格,并加入中间层特征匹配和可变码率模块。在 DINOv2 与 SAM3 的分类、分割、检测实验中,达到未压缩性能 90% 时码率降低 15.7–37.4 倍。

LogiShot: Logically Coherent Cross-Shot Video Generation Figure 1
2026-08-11cs.CV

LogiShot: Logically Coherent Cross-Shot Video Generation

Shuai Guo, Yuhang Yang, Zeyu Zhang, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

2026-08-11视觉感知

LogiShot针对多镜头视频生成中单段虽合理但跨镜头叙事断裂的问题,强调目标镜头应利用上下文视频推断因果、并行等逻辑关系并保持视觉细节一致。方法用冻结VLM联合编码上下文、提示和起始帧,提供多模态线索,同时在DiT中保留上下文潜变量作为视觉记忆。作者构建110K样本数据集和专门基准,实验显示其在跨镜头逻辑一致性指标上优于现有基线。

MRI super-resolution in ten sampling steps using a diffusion bridge model Figure 1
2026-08-11cs.CV

MRI super-resolution in ten sampling steps using a diffusion bridge model

Mojtaba Safari, Hang Yu, Zach Eidex, Mingzhe Hu, Ryan J. Sanford, Alexandru Florea, Shansong Wang, Chih-Wei Chang, Erik H Middlebrooks, Aditya Juloori, Stanley L. Liauw, Ralph Weichselbaum, Xiaofeng Yang

2026-08-11生成模型

为缓解高分辨率 MRI 扫描时间长、运动伪影多与低分辨率重建失真的矛盾,论文提出 SR-DBM,将超分辨率建模为低/高分辨率分布间的扩散桥,用 Doob h-transform 固定端点并从实测 LR 图像而非高斯噪声出发,仅十步采样。其在 7T 脑 T1 与前列腺 T2 数据上相较九种方法取得最高 PSNR、SSIM 和最低 GMSD,但临床泛化仍需更多验证。

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents Figure 1
2026-08-11cs.CV

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

2026-08-11机器人数据集/基准

针对现有城市导航基准在真实感、连续可探索性和街区复杂度上的不足,论文提出360CityArena,用602段东京秋叶原360度视频构建互联街道环境,并设计175个人工任务覆盖环境理解、路径推理和空间推理。实验显示当前LMM智能体与人类差距很大,最佳Gemini 2.5 Flash仅17.1%准确率,远低于人类77.3%,且地图/位置信息增益不稳定,暴露出视觉定位、规划与低层动作控制的系统性瓶颈。

AdapterMoE: A Two-Stage Hard-Routing Mixture-of-Experts Architecture for Multi-Crop Disease Recognition with Calibrated Rejection and Incremental Learning Figure 1
2026-08-11cs.CV

AdapterMoE: A Two-Stage Hard-Routing Mixture-of-Experts Architecture for Multi-Crop Disease Recognition with Calibrated Rejection and Incremental Learning

Pin-Hsun Huang, Shaou-Gang Miaou

2026-08-11视觉感知

本文针对多作物病害识别中跨作物特征干扰、开放集误判和软路由 MoE 专家塌缩问题,提出 AdapterMoE:先用硬路由识别作物并结合 MSP、Energy 与 KNN 做拒识,再由冻结 EfficientNet-B0 上的作物专属 Adapter 细分类。结果显示其精度与强基线接近,但训练成本约为全量训练的 9%,新增作物约 1.14 分钟,OOD 作物拒识率达 95.7%;田间 PlantDoc 上分类明显退化,说明瓶颈仍可能主要来自数据域偏移。

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation Figure 1
2026-08-11cs.CV

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

Xiamen University, Xiamen University Key Laboratory of Multimedia

2026-08-11视觉感知

本文面向域泛化语义分割在自动驾驶、机器人感知等场景中遇到的天气、光照和地域域偏移问题,指出现有风格随机化易扭曲特征流形、特征归一化会压制判别细节。LASA以源域特征作结构锚点,并引入视觉语言先验指导风格迁移,再通过域感知查询适配与解码优化对齐类别响应。在GTAV到BDD及ACDC雪天、夜间等挑战基准上,相比既有方法取得5.48%、8.91%、8.64%的mIoU提升。

UPolarSQ: Polar Representation Learning for Optic Disc and Peripapillary Atrophy Segmentation and Quantification in Fundus Photographs Figure 1
2026-08-11cs.CV

UPolarSQ: Polar Representation Learning for Optic Disc and Peripapillary Atrophy Segmentation and Quantification in Fundus Photographs

Mengxian He, Yunyun sun, Ziyue Gao, Wengkei Lam, Shunyi Zhang, Wu Yuan

2026-08-11视觉感知

本文针对近视眼底中视盘变形和盘周萎缩边界弯曲、遮挡导致笛卡尔分割易碎裂且量化依赖后处理的问题,提出以视盘中心极坐标重表示OD/PPA,将二维轮廓转为径向曲线,并用带径向-角向解耦模块和边界辅助监督的UPolarSeg完成分割,随后直接读出视盘形态与PPA宽度指标。内部和外部队列实验显示,该框架提升OD/PPA分割表现,并降低生物标志物估计误差,但具体泛化增益仍可能受中心定位和数据分布影响。

Parcel2Progression: An Anatomy-aware Longitudinal Framework for Alzheimer's Disease Diagnosis Figure 1
2026-08-11cs.CV

Parcel2Progression: An Anatomy-aware Longitudinal Framework for Alzheimer's Disease Diagnosis

Madhumitha Venkatesh, Shanawaj S Madarkar, Konda Reddy Mopuri

Indian Institute of Technology Hyderabad, India

2026-08-11视觉感知

本文针对阿尔茨海默病早期结构 MRI 线索细微、纵向扫描长度不规则且高分辨率 4D 建模计算昂贵的问题,提出 P2P:先用脑图谱引导的 Parcel Encoder 将 3D 扫描编码为解剖分区表征,再用加入年龄信息的纵向 Transformer 聚合多次随访。结果显示其在 ADNI、AIBL、MIRIAD 上优于多种基线,纵向信息带来 AD 分类和 MCI 转化预测平衡准确率最高约 5% 和 7% 的增益,并能给出较符合临床的分区显著性解释。

IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack Figure 1
2026-08-11cs.CV

IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack

Yi Pan, Jun-Jie Huang, Tianrui Liu, Zihan Chen, Lin Liu, Zhao Wentao

College of Computer Science and Technology, College of Computer Science and Technology National University of Defense Technology Changsha China

2026-08-11生成模型

本文针对扩散式非受限迁移攻击在深层去噪轨迹上显存开销高、且扰动不区分频率的问题,提出 IDATA:用可逆扩散模块按需重构中间状态以实现近常数显存反传,并用小波分解将扰动限制在低频潜空间。实验显示其在多模型、多数据集和防御场景下提升攻击成功率,同时降低显存并保持较好感知质量。

AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval Figure 1
2026-08-11cs.CV

AnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document Retrieval

Haoyu Zuo, Yibo Yan, Xin Zou, Shuliang Liu, Yi Cao, Mingdong Ou, Xuming Hu

2026-08-11视觉感知

多向量视觉文档检索虽能保留版面、表格和局部视觉线索,但每页数百个 patch 向量带来索引与 MaxSim 计算开销。AnchorFold 的核心是先用递归注意力传播找出高中心性锚点,再把其余 token 按检索空间相似度折叠并加权聚合,避免纯剪枝丢证据或纯合并不分重点。ViDoRe v1/v2 和 REAL-MM-RAG 上,在三种骨干下均优于训练-free 基线,5 倍压缩平均保留 98.3% NDCG@5,20 倍仍保留 92.4%。

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases Figure 1
2026-08-11cs.CV

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

2026-08-11视觉语言数据集/基准

该文针对番茄叶病害识别长期停留在图像分类、缺少真实场景多模态诊断评测的问题,构建 TomaMMU 与 TomaBench:含 28,808 张图像、213,119 个人工标注 VQA,并按基础感知、病理理解、专家诊断组织七类任务。对 14 个 VLM 的评测显示其在细粒度识别和事实推理上明显不足;在 TomaMMU 上简单微调后,困难 MCQ 准确率提升至 96.09%,但增益可能主要来自领域数据适配。

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors Figure 1
2026-08-11cs.CV

High-Quality Exposure Correction with Diffusion-Based Image Generation Priors

Ziwen Li, Meng Cao, Jinpu Zhang, Chunyang Li, Long Bao, Heng Sun, Yuehuan Wang

2026-08-11视觉感知生成模型

论文针对回归式曝光校正偏重像素误差、难以恢复极端过曝或欠曝区域感知质量的问题,提出 DPEC:将预训练扩散模型微调用作单步曝光校正先验,并通过联合交叉注意力把多尺度扩散特征注入回归模型,让扩散侧侧重低频内容、回归侧保留高频细节。实验称其在多个曝光校正数据集上优于现有方法,兼顾保真度、感知质量和视觉效果。

Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation Figure 1
2026-08-11cs.CV

Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation

Jonathan Suprijadi, Raphael Stock, Moritz Langenberg, David Zimmerer, Kim-Celine Kahl, Stefan Denner, Yannick Kirchhoff, Karol Gotkowski, Maximilian Rokuss, Jeremias Traub, Tassilo Wald, Constantin Ulrich, Klaus Maier-Hein

2026-08-11三维

本文针对3D CT报告生成中视觉token过长、LLM计算瓶颈明显的问题,系统比较视野裁剪、分辨率、视觉编码器、投影压缩器和LLM选择。核心洞察是,在固定LLM视觉token预算下,解剖ROI裁剪最稳定地提升临床F1,而继续升分辨率只有PerceiverResampler等能承受强压缩的投影器受益;最佳配置在CT-RATE和Merlin上分别达到49.5和49.0 macro F1。

SRE-FER: Regional residual evidence learning for mitigating local evidence dilution in fine-grained facial expression recognition Figure 1
2026-08-11cs.CV

SRE-FER: Regional residual evidence learning for mitigating local evidence dilution in fine-grained facial expression recognition

Jiaye Song, Ruochen Zhang, Yuliang Wang, Jiaqi Wu

2026-08-11视觉感知

论文针对细粒度表情识别中 DINOv3 等基础模型用全局读出会稀释局部肌肉线索的问题,提出 SRE-FER:在保留全局分类器的同时,用 RERA 从区域 patch token 生成零初始化残差 logits,并在训练阶段用 AU/FACS 先验约束区域证据,推理时不依赖 landmark。RAF-DB、FERPlus、AffectNet-7 上分别达到 92.76%、91.32%、67.78%,但固定区域划分和 Full 分支的独立增益仍文中未充分说明。

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Predictio Figure 1
2026-08-11cs.CV

OccAnyScene: Towards Unified Indoor-Outdoor 3D Occupancy Predictio

Junjie Liu, Wanshui Gan, Zitong Dai, Guiping Cao, Yan Li, Ke Chen, Dongmei Jiang, Xiangyuan Lan, Jianguo Zhang

Shanghai AI Laboratory, Pengcheng Laboratory

2026-08-11三维

这篇论文针对现有三维语义占据模型通常绑定特定室内或室外协议、难以在不同相机配置、空间尺度和语义体系间复用的问题,提出跨场景占据预测设定。核心洞察是以每个像素对应的有限视锥而非单条射线作为几何参照,并通过 PFFA 聚合像素视锥特征、FPGC 生成受深度和视锥约束的高斯表示。实验显示单一模型在 Occ-ScanNet 上达到 59.92% mIoU、在 SurroundOcc-nuScenes 上达到 23.06% mIoU,且接近分别训练的专用模型。

CUPA-T2*: Covariance-Aware Uncertainty Propagation and Alignment for T2* Mapping in Accelerated MRI Figure 1
2026-08-11cs.CV

CUPA-T2*: Covariance-Aware Uncertainty Propagation and Alignment for T2* Mapping in Accelerated MRI

Gideon N. L. Rouwendaal, Natascha Niessen, Hannah Eichhorn, Dirk H. J. Poot, Christine Preibisch, Julia A. Schnabel

2026-08-11安全鲁棒

针对加速 MRI 中重建伪影和噪声会传递到 T2* 拟合的问题,CUPA-T2* 将 MC dropout 得到的体素级跨回波协方差显式传播到异方差 MLP,并用相关正则对齐重建不确定性与预测方差。实验显示整体精度与基线接近,高加速下白质误差更低,不确定性对齐显著增强,但校准和选择性预测指标变差,收益具有组织依赖性。

Semi-Dense Matching Uncertainty Is Not Just Local Confidence Figure 1
2026-08-11cs.CV

Semi-Dense Matching Uncertainty Is Not Just Local Confidence

Khoa Hoang, Hoang-Tuan Nguyen, Huong Ninh, Hai Tran, Long Q. Tran

University of Engineering and Technology, Vietnam National University, Hanoi, Optoelectronics Center, Viettel Aerospace Institute, Viettel Group, National Yang Ming Chiao Tung University, Taiwan

2026-08-11安全鲁棒

这篇论文针对半稠密粗到细匹配中不确定性被简化为局部置信度的问题,指出粗匹配失败会产生被现有方法忽略的长尾误差,并影响下游几何估计。作者用仅9个参数的后验校准双 Laplace 混合模型同时刻画细化噪声与粗分配失败,并用 CoRe 将粗成功后验作为软权重重拟合几何模型。实验显示该方法在多种预训练匹配器和鲁棒估计器上提升同应性等几何精度,且额外开销较小。

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling Figure 1
2026-08-11cs.CV

UniSpace: Unified Visual Representation and Scalable Multimodal Modeling

Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan

2026-08-11视觉语言

UniSpace针对语义ViT最终token丢失像素细节、难以同时支撑理解与生成编辑的问题,指出瓶颈主要在patch嵌入而非冻结Transformer块,并提出Patch Reparameterization,在保留语义通路的同时加入重建感知嵌入。该表示被扩展到8B MoE模型后,无需独立VAE即可统一理解、文生图和指令编辑,实验显示具备实用生成编辑效果并保持视觉理解能力。

FiRe: Fixed-Noise Refinement for Visual Counterfactual Explanations Figure 1
2026-08-11cs.CV

FiRe: Fixed-Noise Refinement for Visual Counterfactual Explanations

Yan Zeng, Changlu Guo, Oskar Kristoffersen, Anders Nymark Christensen, Morten Rieger Hannemose, Anders Bjorholm Dahl

2026-08-11视觉感知

FiRe针对扩散式视觉反事实解释中反向去噪轨迹长、噪声状态与干净分类器输入不匹配、编辑难以局部化的问题,将图像映射到固定中间噪声层并迭代细化,引入PMF直接预测干净图像,同时用动态双掩码、自适应引导和早停控制可见改动。在CelebA、CelebA-HQ和CheXpert五类任务上,相比最强近期基线约快3倍、FLOPs少8倍,反事实质量相当或更优。

A Dynamic-Semantics Framework for Grounding Human Referring Expressions in Visual Perceptual Data Figure 1
2026-08-11cs.HC

A Dynamic-Semantics Framework for Grounding Human Referring Expressions in Visual Perceptual Data

Joseph Bingham

2026-08-11视觉语言

本文针对现有视觉语言模型难以在多轮指称中维持稳定“概念契约”的问题,提出把共同基础外显为Γ、Ξ、Ω三类可审计绑定,并结合SIFT、UQI等感知对齐来解释人类对抽象七巧板的描述。在Stanford重复指称语料上,单句top-5命中率为83.56%,但top-1仅41.66%,且系统仍是被动匹配器,交互修复能力文中未实现。

Degradation-Guided Underwater Image Restoration with Task-Oriented Latent Control Figure 1
2026-08-11cs.CV

Degradation-Guided Underwater Image Restoration with Task-Oriented Latent Control

Xu Zhang, Xuhui Cao, Kangzhe Yuan, Laibin Chang, Yichu Xu, Shi Chen, Huan Zhang, Yong Chen

2026-08-11视觉感知规划控制

本文针对水下图像退化既能提供恢复线索、又会随跳连把退化特征带入解码器的问题,提出 PROTEUS:用空间变化的退化提示做动态特征调制,并以任务导向潜变量控制跳连通道复用。实验覆盖 5 个配对和 4 个无参考基准,报告了有竞争力的恢复质量,同时模型规模为 2.61M 参数、18.52G FLOPs。

JSGS: JPEG State-Guided Supervision for 3D Gaussian Splatting from Mixed-Quality Views Figure 1
2026-08-11cs.CV

JSGS: JPEG State-Guided Supervision for 3D Gaussian Splatting from Mixed-Quality Views

Jinhua Cui, Anhong Wang, Kai Hu, Donghan Bu, Peihao Li, Tammam Tillo, Hao Jing, Shiao Xu

2026-08-11视觉感知三维

这篇论文针对混合 JPEG 质量视角会把块效应、振铃等压缩残差错误注入共享 3DGS 表示的问题,提出利用每张图像文件中的亮度/色度量化表来指导监督。其核心是构造视角相关的 JPEG 观测算子,并在 DCT 低频、中频上按量化状态重加权残差,同时用块级不一致约束高不透明小高斯。实验在 7 个场景、3 种混合质量分布下取得最低平均 LPIPS 和最高平均 SSIM,渲染速度约 150 FPS,但 PSNR 均值仍由 FDS-GS 更高。

Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception Figure 1
2026-08-11cs.CV

Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception

Jingyun Chen, Fengchun Liu, Linghan Cai, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Lequan Yu, Yongbing Zhang

College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, School of Computing and Data Science, The University of Hong Kong

2026-08-11视觉感知

针对全切片病理图像中诊断证据稀疏、尺度跨度大且难以穷尽查看的问题,论文提出 AdaptivePath,将证据获取建模为主动感知序列决策:用病理专家审核的异常区域标签训练导航器,逐级选择位置和观察尺度,再由解释、审议和仲裁模块整合形态学证据。结果显示其在病理 VQA、六个 TCGA 癌种亚型零样本分类和医师辅助实验中取得较强表现,但目前主要限于 H&E 切片。

Multi-Relational Knowledge Graph Enhanced Embedding for Trajectory-User Linking Figure 1
2026-08-11cs.LG

Multi-Relational Knowledge Graph Enhanced Embedding for Trajectory-User Linking

Zhifeng Chu, Bin Wang

2026-08-11规划控制

针对轨迹-用户关联中候选用户多、签到轨迹稀疏且时空语义常被分开建模的问题,MakeTUL将访问时间、POI类别和转移速度组织为多关系知识图谱,并引入跨轨迹高阶共现先验,再用双分支分类保留结构与序列证据。在Foursquare三城、多用户规模实验中五项指标均优于基线,JKT 1400用户下ACC@1和Macro-F1分别提升10.67%和12.70%。

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling Figure 1
2026-08-11cs.CV

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

2026-08-11强化学习

针对长程交错图文序列中自注意力开销过高、现有方法偏重视觉剪枝且损失文本上下文的问题,VLZip将图像与文本片段统一压缩为分层软前缀,并在每个解码层注入,以保留全局叙事信息。实验显示其可将训练上下文扩展到120K、推理超过280K,并在LongVLBench等长上下文多模态任务上优于基线,但具体增益中数据与benchmark构造的贡献仍需进一步拆分。

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models Figure 1
2026-08-11cs.CV

VADER: Adaptive Debiasing for Hallucination Mitigation in Video Large Language Models

Dong Xing, Jiaxin Chen, Hang Yang, Peixun Liu, Qiushi Yang, Yuqing Wang

2026-08-11视觉感知

视频大语言模型在事件顺序、动作识别和时间一致性上容易依赖语言先验产生幻觉,VADER针对训练自由解码中的固定干预和粗糙扰动问题,按视频-问题自适应选择层与强度重分配系统/视频注意力,并逐帧擦除高重要视觉token构造先验分支做对比抑制;在多个VideoLLM和事件级基准上提升 grounding,LLaVA-Video-7B 在 EventHallusion 达到72.60%。

REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering Figure 1
2026-08-11cs.CV

REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering

Caijun Yan, Yang Zhou, Meixing Shi, Haoran Sun, Yichen Li, Yuxiang Cai, Yankai Jiang

2026-08-11视觉感知

长视频问答常因固定时间切片和只按语义相关性检索,遗漏关键的时间、因果或细粒度动作证据。REVEAL用视觉相似性构建离线-在线分层视频记忆,并把自动生成的rubric放入推理循环,显式判断证据是否充分、定位缺口后再检索。论文称该方法无需额外训练,在多项长视频QA基准上超过开源和闭源强基线。

Population-Scalable Multi-Agent World Modeling Figure 1
2026-08-11cs.CV

Population-Scalable Multi-Agent World Modeling

Renjie Zhao, Yuxiang Wu, Mingyu Zhang, Jiaxin Li, Sisi Li, Yimin Sheng, Tianxi Tan, Zhenkai Zhang, Jianyi Zhu, Yong-Lu Li

Shanghai Jiao Tong University

2026-08-11强化学习

本文针对多智能体世界模型通常绑定固定智能体数量、难以在推理时扩展的问题,提出 Khora:用共享 STBoard 表示持续演化的世界状态,再通过与群体规模无关的逐视角渲染接口生成各智能体观测。实验以定性评估和实时原型为主,显示其可扩展到训练外的智能体数量并保持多视角与动作一致性,但系统性量化指标文中未充分说明。

Goal-oriented Navigation Instruction Generation with Tour Video Priors Figure 1
2026-08-11cs.CV

Goal-oriented Navigation Instruction Generation with Tour Video Priors

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

2026-08-11机器人视觉感知

本文针对现有导航指令生成多依赖既定轨迹、难以从紧凑环境先验中规划目标路线的问题,提出 VideoNIG:利用第一视角 tour video、初始观测和文本/视觉目标直接生成可执行导航指令,并配套 60K 视频基准、选择式空间一致性与导航执行评测。结果显示现有 MLLM 在长程视频空间 grounding 上明显不足,而两阶段课程学习在文本质量、空间一致性和下游执行上均有提升。

RobustDefect-LLM: Explainable and Robustness-Aware Industrial Surface Defect Classification with Decision Support and AI-Assisted Reporting Figure 1
2026-08-11cs.CV

RobustDefect-LLM: Explainable and Robustness-Aware Industrial Surface Defect Classification with Decision Support and AI-Assisted Reporting

Nazlıcan Düşünmez, Halûk Gümüşkaya

Department of Computer Engineering, İstanbul Arel University, 34537 Istanbul, Türkiye, consistent, reliable, and scalable quality inspection., traceability, and human-centered decision support in addition to high predictive performance., categories from the publicly available NEU-DET dataset. Grad-CAM is employed to visualize class-

2026-08-11安全鲁棒

面向工业表面缺陷检测中仅有高准确率但缺少可解释性、置信度处理和可追溯流程的问题,本文将迁移学习CNN、Grad-CAM、规则化决策、受控LLM报告和移动端原型整合为质检工作流。MobileNetV3-Large在NEU-DET上达99.26%准确率,但与DenseNet121差异不显著;强退化下准确率跌至40%以下,说明鲁棒性仍需真实工业验证。

EvTrajGS: Accurate and Efficient 3D Gaussian Splatting from Unposed Event Streams Figure 1
2026-08-11cs.CV

EvTrajGS: Accurate and Efficient 3D Gaussian Splatting from Unposed Event Streams

Zixuan Chen, Jiakai Zhang, Junhao Dong, Guangcong Wang, Jianhuang Lai, Yew-Soon Ong, Xiaohua Xie

and with the Guangdong Province Key Laboratory of Information Security Technology, Guangzhou 510006, Guangdong, China

2026-08-11三维

这篇论文面向无精确位姿的事件相机三维重建,针对固定外部位姿精度不足、SLAM式联合优化开销大的矛盾,提出 EvTrajGS:用连续时间轨迹表示离散粗位姿,并将邻近轨迹状态聚合为时间耦合位姿,再配合按损失重加权的事件采样来稳定位姿与3DGS联合优化。实验称其在合成和真实数据上同时提升重建与位姿精度,PSNR 提高约 3.8 dB、SSIM 提高 0.1、ATE RMSE 降低 40%以上,并比 IncEventGS 快近 7 倍。

Where Is the Bee? Detecting Tiny Pollinators with a Single Collaborative-Head Transformer Figure 1
2026-08-11cs.CV

Where Is the Bee? Detecting Tiny Pollinators with a Single Collaborative-Head Transformer

Junsu Kim, Seungryul Baek

2026-08-11视觉感知

这篇论文面向田间关键帧中极小传粉昆虫检测,难点在于目标仅占画面约0.16%且蜜蜂类别占八成标注。作者选择 Co-DINO+Swin-L 作为强检测器,并通过稀有类优先的 crop-mosaic 训练池和类加权 fixed-ETF 查询正则缓解类别失衡。最终在 BuzzSpot FinalTest 上无集成、无测试增强取得 0.5062 mAP,排名第一。

CDGC-Net: 3D Medical Image Segmentation with Cooperative Dual-Scale Self-Attention and Grouped Channel Modeling Figure 1
2026-08-11cs.CV

CDGC-Net: 3D Medical Image Segmentation with Cooperative Dual-Scale Self-Attention and Grouped Channel Modeling

Zheyang Jing, Qin Lu, Jianwang Li, Yujie Yang, Chen Yi, Shaofeng Jiang

2026-08-11视觉感知三维

本文针对3D医学图像分割中全局解剖上下文与局部边界细节难以对齐、通道关系建模不足的问题,提出在UNETR++式U形框架中用CDGC块统一建模双尺度空间注意力与分组层次通道注意力,并通过共享键投影和残差对齐增强空间-通道交互。在Synapse、ACDC、BraTS和LA上平均DSC分别达86.96%、92.91%、82.56%和93.52%,同时较UNETR++减少约40%参数和FLOPs。

On-Device Multi-Species Malaria Detection with Uncertainty-Calibrated Slide-Level Aggregation Figure 1
2026-08-11cs.CV

On-Device Multi-Species Malaria Detection with Uncertainty-Calibrated Slide-Level Aggregation

Idaya Seidu, Ahmed Tahiru Issah, Charles B. Delahunt, Carine Mukamakuza

2026-08-11视觉感知安全鲁棒

面向资源受限地区显微疟疾诊断中缺少专家、网络和算力不稳定的问题,本文将 YOLOv13n/TFLite 部署到手机端,结合多虫种与白细胞检测、置信度校准软计数、bootstrap 置信区间、早停和人工复核来生成片级寄生虫血症估计。在 2739 张厚血涂片图像上,mAP@0.5 为 0.863,片级计数相关 r=0.951,离线单图流程约 10.27 秒,但跨站点和真实患者级验证仍未充分说明。

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories Figure 1
2026-08-11cs.CL

OpenVisTool: An Open Recipe for Synthesizing Instructive Visual Tool-Use Trajectories

Changhao Xiang, Shilin Zhang, Zheng Ma, Kanzhi Cheng, Ruize Ma, Yi Feng, Jianbing Zhang, Zhi Wang, Zhen Wu, Xinyu Dai, Lewei Lu

2026-08-11视觉感知

本文针对视觉工具使用训练中“答对即有用”的筛选假设,指出教师轨迹可能在无需工具时也答对,导致学生只学到工具调用模式。OpenVisTool以结果正确性和工具观测的因果效用共同筛选轨迹,并通过难度筛选、领域化合成和监督验证构建42K数据集。实验显示在4B到27B骨干上均提升工具使用表现,并在两个域外基准上有增益。

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation Figure 1
2026-08-11cs.CV

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

Junyin Zhang, Siyu Huang, Jianxiong Ye, Haowei Gong, Ruicheng Zhang, Deyu Meng, Chenqiang Gao

Ruicheng Zhang is with the Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, Guangdong 518055, P.R. China., Deyu Meng is with the School of Mathematics and Statistics, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, P.R. China.

2026-08-11视觉感知生成模型

针对可见光到红外翻译中扩散模型虽能生成外观、却易破坏目标位置和细节从而影响检测标注复用的问题,SC-Diff将SAM3提取的语义掩码同时用于条件输入和去噪U-Net自注意力校准,通过SGSC增强同类token交互、抑制跨类干扰。实验显示其提升红外感知质量,并让合成数据更有利于下游红外目标检测。

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling Figure 1
2026-08-11cs.CV

MotionCraft: Latent World Modeling with Sparse Attention for Visual Upscaling

Rong Fu, Chunlei Meng, Yangchen Zeng, Xiaowen Ma, Yongtai Liu, Wangyu Wu, Shuo Yin, Zijian Zhang, Sicheng Li, Yingrui Ji, Chenhao Wang, Simon Fong

2026-08-11强化学习

面向视频超分在大运动、复杂退化和流式场景中难以兼顾细节、长程时序一致性与效率的问题,MotionCraft 将恢复建模为运动感知的潜在状态预测,用运动可靠性门控稀疏注意力,并通过全局与空间控制调节平滑度和保真度。实验称其在重建、感知质量和运行效率上取得较好折中,但具体增益来源仍依赖各组件消融支撑。

Rethinking Attention Locality in Spiking Transformers Figure 1
2026-08-11cs.CV

Rethinking Attention Locality in Spiking Transformers

Zeqi Zheng, Zizheng Zhu, Yuping Yan, Wenxuan Pan, Zhaofei Yu, Yaochu Jin

Zhejiang University, Westlake University, Peking University

2026-08-11视觉感知

本文关注脉冲 Transformer 中无 Softmax 的 SSA 难以形成稳定空间局部交互的问题,指出已有局部增强方法存在“计算局部性不等于空间局部性”和统一替换不适配不同架构的现象。作者提出 SCLA-BCP,用连续局部区域约束注意力,并用轻量卷积分支补充跨边界信息,再按架构分层部署;在分类、检测、分割及神经形态数据集上取得一致增益,COCO mAP@50 最高提升 9.50%,ADE20K mIoU 最高提升 3.42%,额外开销有限。

ERF-GS: Reconstructing Fast Motion from Disjoint Event-RGB Viewpoints Figure 1
2026-08-11cs.CV

ERF-GS: Reconstructing Fast Motion from Disjoint Event-RGB Viewpoints

Xiaoyang Bai, Zhenyang Li, Weiwei Xu, Edmund Y. Lam, Yifan Peng

Department of Electrical and Electronic Engineering, The University of Hong Kong, Hong Kong SAR, China, State Key Lab of CAD&CG, Zhejiang University, Hangzhou, China

2026-08-11视觉感知

论文针对快速运动导致低帧率 RGB 多视角重建模糊、动态 3DGS 难以恢复细节的问题,提出 ERF-GS,将事件相机的高时间分辨率信号分别用于优化损失 EARL 和高斯增密 EDS,且不要求事件与 RGB 视角对齐或共享监督。实验在加入运动模糊、RGB/事件视角分离的 Neu3D 与 Nvidia 变体上,相比 4DGS 和 E-D3DGS 提升重建质量;但事件均为模拟,真实采集有效性仍文中未充分说明。

A Combined Feature-Based Framework for Disguise and Spoofing Detection in Face Recognition Systems Figure 1
2026-08-11cs.CV

A Combined Feature-Based Framework for Disguise and Spoofing Detection in Face Recognition Systems

Sangiya Pararajasingham

2026-08-11视觉感知

面部识别在门禁、移动和金融场景中同时受照片/视频欺骗与外观伪装影响,而既有方法多分开处理。本文把两类风险放入统一两阶段框架,对 PCA、LBP、HOG、SURF、Harris 加 MED 的五种经典特征流水线做同协议比较;结果显示 HOG 方案整体最稳,伪装混合场景达 94.59%、欺骗检测 91.67%,LBP 欺骗检测最高为 93.2%,但姿态鲁棒性较弱。

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models Figure 1
2026-08-11cs.CV

eBIRD: Event-based Intensity Image Reconstruction Using Controllable Diffusion Models

Ignacio Bugueno-Cordova, Fabian Valderrama, Rodrigo Verschae

2026-08-11视觉感知生成模型规划控制三维

事件相机只记录亮度变化,导致从稀疏异步事件恢复强度图像时外观细节不足。eBIRD 将 DDPM 与 ControlNet 结合,用事件帧作为条件,并比较通用与类别专用训练策略。结果显示,N-MNIST 上通用模型更优,而 RGBE-Gaze 人脸重建中专用模型最好,说明扩散先验有效但收益依赖任务域,增益来源仍可能受训练协议与数据规模影响。

Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation Figure 1
2026-08-11cs.CV

Towards Adaptive Super-Resolution and Quality Assessment via Test-Time Adaptation

Ajeet Kumar Verma

Indian Institute of Technology Jammu, Indian Institute of Technology Jammu Jammu J & K India

2026-08-11视觉感知

针对真实视频超分在未知压缩、噪声、模糊和屏幕内容中泛化差、且缺少高分辨率参考的问题,论文将测试时自适应用于无参考质量评估,并把自适应质量预测作为超分感知损失,同时设计面向屏幕内容的结构/文本保持与分区域适配策略。实验显示多种VQA基线的相关性指标稳定提升,SAMA的SRCC增益最大,但完整系统增益来源仍需更多消融说明。

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation Figure 1
2026-08-11cs.CV

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

2026-08-11优化算法

针对医学报告生成中事实错误频发、常规DPO把临床差异与表述差异混在一起且缺少视觉对齐的问题,论文提出DPO-Clin:用实体级诊断构造语言形式对齐但临床事实不同的偏好对,并通过检索增强的多模态DPO和反事实不确定实体样本强化图文 grounding。实验覆盖MIMIC-CXR、IU X-Ray和内镜数据,显示其在临床感知指标上优于SFT基线和已有DPO方法。

RenderMatte: Exact-Alpha Rendering and Group-Relative Alignment for Image Matting Figure 1
2026-08-11cs.CV

RenderMatte: Exact-Alpha Rendering and Group-Relative Alignment for Image Matting

Zecheng Ren, Yafei Hu, Jianing Zhao, Ruichen Cong, Qun Jin, Yiren Song

2026-08-11视觉感知

RenderMatte面向开放场景抠图中透明度细节和稀疏边界难监督的问题,将FLUX.1 Kontext改造成trimap引导的alpha预测器,并用alpha-edge损失与组相对alpha对齐强化边界、trimap一致性和合成一致性。论文还构建含精确strand级alpha标注的8.35万合成训练集,在多项基准上取得SOTA,但增益可能部分来自模型与数据规模。

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion Figure 1
2026-08-11cs.CV

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

2026-08-11三维

RayLift针对相机式3D语义场景补全中立体深度被当作确定约束的问题:边界、弱纹理等区域的匹配误差会直接污染体素表示。其核心思路是保留立体几何的尺度参考,同时引入冻结3D视觉基础模型提供的互补几何先验,在每条相机射线上按深度置信度、几何差异和空间不确定性生成候选证据,再注入体素特征。SemanticKITTI与SSCBench-KITTI-360实验显示占据IoU和语义mIoU均有稳定提升。

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions Figure 1
2026-08-11cs.CV

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui

2026-08-11视觉感知

这篇论文面向“只有文字步骤、缺少配图”的操作说明生成问题,指出现有文生图难保跨步骤一致性,视频扩散全量微调又会吸收低质视频噪声。InstructionCrafter的核心做法是冻结空间层以保留单帧画质,只训练时间与文本条件通路,并加入一致性与上下文时间适配器来传递步骤关系。实验在ShowHowTo和WikiHow-VGSI上同时提升步骤忠实度、一致性和画质,并减少模糊、噪声与字幕伪影。

FreCast: Refining Radar Echo Intensity via Phase-Preserving Amplitude Residual Diffusion for Precipitation Nowcasting Figure 1
2026-08-11cs.CV

FreCast: Refining Radar Echo Intensity via Phase-Preserving Amplitude Residual Diffusion for Precipitation Nowcasting

Heping Fang, Zihuai Yin, Kaicheng Mao, Peiguang Zhang, Peng Yang

2026-08-11生成模型

本文针对降水临近预报中“位置大体正确但雷达回波强度偏差仍大”的问题,提出 FreCast:先生成未来回波,再在频域保留相位作为空间结构约束,仅用扩散模型修正幅度谱残差,以减少强度误差且避免破坏雨带形态。三组数据实验显示其在预报技巧指标上稳定优于基线,并在较长预见期更好保持连续雨带和强降水结构。

ARC: Augmented-Rank Conformalization for Changepoint Localization --- Finite-Sample Validity and Distribution-Robust Efficiency Figure 1
2026-08-11stat.ML

ARC: Augmented-Rank Conformalization for Changepoint Localization --- Finite-Sample Validity and Distribution-Robust Efficiency

Chenchen Peng, Mixia Wu, Qijing Yan, Zhiqi Shen, Jie Zhang

School of Mathematics, Statistics and Mechanics, Beijing, University of Technology, Beijing 100124, China, College of Computing and Data Science, Nanyang Technological, University, Singapore 639798, Singapore

2026-08-11安全鲁棒

这篇论文针对变点定位中“覆盖率已有有限样本保证、但置信集合长度在重尾、偏斜和分布迁移下失控”的问题,提出只依赖段内秩的 ARC 打分族,并接入现有 conformal 后端。核心洞察是秩统计使整个置信集合对严格单调边际变换不变,从而把一次验证的长度性质迁移到同一秩结构的分布族。理论给出任意冻结权重下的有限样本覆盖和效率迁移结果,实验显示覆盖率达标、单调变换下集合完全一致,且在 well-log 数据上可缩小到少数候选点;但序列相关和趋势型变化仍超出其精确适用范围。

Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information Figure 1
2026-08-11cs.CV

Learning Deep Modality-Shared Self-Expressiveness for Image Clustering with Textual Information

Xianghan Meng, Wei He, Zhiyuan Huang, Chun-Guang Li

or post-processing. The code is available at: https:, OWADAYS vast quantities of unlabeled data are gener-, without relying on ground-truth labels [1], [2]. The geometric, School of Artificial Intelligence, Beijing University of Posts and Telecom-, e.g., by maximizing the similarity of pseudo-labels across, e.g., pseudo-labeling [20], cluster and graph-level contrastive, classifier and align the pseudo-labels of each sample—as, expressive model focuses on improving the scalability [66]–

2026-08-11视觉感知

本文针对VLM辅助图像聚类中直接做图文对齐可能破坏各模态内部几何结构的问题,提出DeepMORSE,用模态共享的自表达系数捕捉共同分区,同时允许图像和文本各自形成子空间联合结构,并用编码率正则避免表示坍塌。实验覆盖六个聚类基准,在UCF-101、DTD-47和ImageNet-Dogs上报告超过3%的提升,并在检索和零样本分类中显示一定迁移性。

Agentic AI-powered flexible fiber-bundle endoscopy for high-resolution NIR-II fluorescence imaging in vivo Figure 1
2026-08-11cs.CV

Agentic AI-powered flexible fiber-bundle endoscopy for high-resolution NIR-II fluorescence imaging in vivo

Yanzhao Shi, Yuanhua Liu, Sixin Xu, Wayne Jason Li, Yuyuan Chen, Danyang Xu, Zhisheng Wu, Hanze Yu, Ian Yu-Hong Wong, Simon Ying-Kit Law, Hongjie Dai, Liangqiong Qu, Feifei Wang

Department of Electrical and Computer Engineering, School of Biomedical Engineering, The, University of Hong Kong, Hong Kong SAR, China., Materials Innovation Institute for Life Sciences and Energy (MILES), The University of Hong, Kong Shenzhen Institute of Research and Innovation (HKU-SIRI), Shenzhen 518045, China., Department of Mechanical Engineering, The University of Hong Kong, Hong Kong SAR, Department of Surgery, School of Clinical Medicine, LKS Faculty of Medicine, The University, JC STEM Lab of Nanoscience and Nanomedicine, Department of Chemistry and School of, Biomedical Sciences, The University of Hong Kong, Hong Kong SAR, China., School of Computing and Data Science, The University of Hong Kong, Hong Kong SAR, decision-making by visualizing fluorescently labeled anatomical structures and pathological

2026-08-11视觉感知

针对柔性光纤束内窥镜在 NIR-II 荧光成像中分辨率低、蜂窝伪影和纤芯串扰加剧的问题,本文做了光学与计算协同设计:优化超细光纤束,并提出由视觉语言模型路由的 GAME 专家恢复框架。结果显示系统可覆盖 485–1550 nm、细胞到人/鼠组织尺度,重建分辨率提升约 4 倍,并完成小鼠体内及人胃管、淋巴系统投影成像验证。

Anatomically Consistent Cross-Contrast Super-Resolution of Anisotropic Brain T2w MRI Figure 1
2026-08-11cs.CV

Anatomically Consistent Cross-Contrast Super-Resolution of Anisotropic Brain T2w MRI

Mengqi Shen, Haicheng Wang, Meghna Trivedi, Tony J. Wang, Yuanguang Xu, Yingyan Zeng, Yading Yuan

Data Science Institute, Columbia University, New York, NY, USA, Department of Radiation Oncology, Columbia University Irving Medical Center, Herbert Irving Comprehensive Cancer Center, Columbia University, Department of Mechanical and Materials Engineering, University of Cincinnati

2026-08-11视觉感知

针对临床T2w脑MRI常见各向异性采集导致冠状/矢状面模糊、影响小结构与3D分析的问题,论文提出VIPP-SR:用各向同性T1c作解剖锚点,训练视角无关的局部T1c到T2w生成器,并通过三正交视图的投影优化强制解剖一致性。无需高分辨率T2w真值,在BraTS-MET和零样本BraTS-GLI上均提升分割Dice,消融显示主要增益来自跨平面自一致性。

DoRF++: Spherical Representation Learning over Doppler Radiance Fields for Robust Wi-Fi Sensing Figure 1
2026-08-11cs.CV

DoRF++: Spherical Representation Learning over Doppler Radiance Fields for Robust Wi-Fi Sensing

Navid Hasanzadeh, Shahrokh Valaee

2026-08-11安全鲁棒

论文针对 Wi-Fi CSI 手势/活动识别在跨用户、环境变化和多径随机性下泛化差的问题,提出将多条多普勒速度投影视为未知方向的虚拟相机,先恢复共享的潜在 3D 运动,再投影到球面网格,并用球面 Transformer 分类。实验称其在自采手势数据集上优于现有 Wi-Fi HAR 方法,尤其提升单接收 AP 和复杂手势的跨用户准确率。

Gated Spatial Redundancy Projection for Pathology Transformer Attentions Figure 1
2026-08-11cs.CV

Gated Spatial Redundancy Projection for Pathology Transformer Attentions

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

2026-08-11视觉感知

这篇论文针对病理全切片中相邻 patch 高度相似导致 Transformer 自注意力反复混入冗余邻域信息、削弱细微诊断或预后信号的问题,提出 Gated SRP:在每个注意力头中估计局部冗余方向,并用可学习有符号门控校正注意力输出的冗余投影分量。实验显示其在 5 个 TCGA 生存队列上取得最高平均 C-index,在 5 个切片分类数据集的 16 项指标中改进 12 项,且仅增加约 0.02% 参数。

PARAGraph: Pathology-Anatomy-Aware Hierarchical Graph for Diabetic Retinopathy Grading Figure 1
2026-08-11cs.CV

PARAGraph: Pathology-Anatomy-Aware Hierarchical Graph for Diabetic Retinopathy Grading

Ziyang Zhang, Yuankai Huo, Yalin Zheng, He Zhao

2026-08-11视觉感知

本文针对糖尿病视网膜病变分级中端到端模型证据不透明、纯病灶图又易受分割噪声影响的问题,提出 PARAGraph:用视盘-黄斑中心建立归一化解剖坐标,将病灶类别、面积和位置组织成层次异构图,并通过全局视觉上下文双阶段融合补足漏检证据。Messidor-2、APTOS、DDR 实验显示其较现有方法取得一致性能提升,解释性和抗噪分析表明预测更贴近病灶证据。

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression Figure 1
2026-08-11cs.CV

VOICE: A Vision-Omics Foundation Model Integrating Direct and Retrieval-Based Prediction of In-situ Single-Cell Gene Expression

Xin Luo, Yicheng Tao, Haoxuan Zeng, Suyuan Wang, Chenzi Ouyang, Meiqi Zhu, Kai Liu, Shuibing Chen, Jie Liu

University of Michigan, University of Michigan Ann Arbor Michigan USA

2026-08-11视觉感知

空间转录组成本高且基因面板有限,论文希望用常规 H&E 图像扩展单细胞分子分析。VOICE 的核心是把细胞形态与转录组基础模型对齐,并结合形态直接回归与相似细胞检索,再按基因加权融合。模型在 2300 万细胞训练后,对留出患者、切片和部分重叠面板均优于既有单细胞表达预测方法,但增益可能部分来自 scaling / data。

Tropical Cyclone Forecasting via Latent Rectified Flow using Satellite Imagery and Atmospheric Fields Figure 1
2026-08-11cs.CV

Tropical Cyclone Forecasting via Latent Rectified Flow using Satellite Imagery and Atmospheric Fields

Meheru Zannat, Sk. Md. Masudul Ahsan

Department of Computer Science and Engineering, Khulna University of Engineering & Technology

2026-08-11视觉感知生成模型

热带气旋预报受数值天气模式成本高、生成模型只预测单一模态且采样慢的限制。本文用五通道VAE和潜在Rectified Flow联合生成红外卫星图与ERA5风温压场,并从生成风场用 steering flow 读出路径、再以DRaFT优化轨迹误差。在2022留出风暴上,PSNR/SSIM优于级联扩散基线,采样约快30倍,+9小时路径误差降至62.4公里。

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation Figure 1
2026-08-11cs.CV

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

Uri Z. Kialy, Gil Ben-Artzi

2026-08-11视觉感知

论文针对PEFT常以参数量衡量效率、却未必降低训练计算的问题,提出CFT:先用面向目标分布的电路归因和近零初始化探测头找出应微调的Transformer子图,再只更新该子图。结果显示其无需新增参数和推理开销,约20个epoch达峰值,在VTAB、医学影像和视觉语言任务上保持接近强基线精度,同时减少2.3–6.6倍训练FLOPs、最高缩短16倍时间。

A continually expandable foundation model for brain MRI Figure 1
2026-08-11cs.CV

A continually expandable foundation model for brain MRI

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

2026-08-11视觉感知

脑 MRI 模型常按疾病、队列或协议分别训练,新增数据微调又易遗忘旧能力。本文提出 Alcmaeon,将 42.5 万余 3D MRI/派生图自监督预训练、潜空间扩散生成与 Graph-Blueprint Pruning 结合,用模块级“蓝图”保护早期领域关键路径并释放剩余容量继续学习。结果显示,GBP 在健康老化、神经退行、发育/精神和肿瘤序列扩展中比普通顺序适配和 EWC 更少遗忘,肿瘤域后优势最明显;不同层表示可支持合成、分类、生存和术后预测,但不存在单一最优表示。

Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No Figure 1
2026-08-11cs.CV

Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No

Ji Huang, Barry Devereux, Hui Wang

Queen’s University Belfast

2026-08-11视觉语言

这篇论文针对VLM能识别视频事件却难以给出时间戳的问题,指出瓶颈主要是任务接口而非视觉感知:直接回归时间会产生高置信错误,改为对候选片段逐级询问“是否发生该事件”并按Yes概率排序。提出的FV-Action无需训练,在四个冻结骨干上将Charades-STA R@0.5提升28到50点,Qwen2.5-VL达到56.8%,并在TACoS、ActivityNet和QVHighlights上优于直接预测。

Three Necessary Principles for Self-Supervised Visual Representation Learning Figure 1
2026-08-11cs.CV

Three Necessary Principles for Self-Supervised Visual Representation Learning

Nikos Giakoumoglou, Paschalis Giakoumoglou, Tania Stathaki

2026-08-11视觉感知

针对自监督视觉表征中语义不变性、空间结构与塌缩防护常被混在一起的问题,论文将训练信号拆成观察、预测、正则化三项必要原则,并用统一能量分解解释主流方法。理论上证明无负样本对齐若缺少正则化会允许常量编码器,动量编码器收敛时不能保证防塌缩;在ViT-Tiny/STL-10实验中,线性探测、patch检索和梯度分析显示三者信号互补,任意两项难以替代第三项。

Open-World Semantic Segmentation with Sensitivity Modeling Figure 1
2026-08-11cs.CV

Open-World Semantic Segmentation with Sensitivity Modeling

Anastasios Romanos Varvarigos, Nikos Giakoumoglou, Tania Stathaki

2026-08-11视觉感知强化学习

面向自动驾驶和机器人场景理解中的开放世界分割,论文针对闭集模型遇到未知物体时易过度自信的问题,在语义原型与对比嵌入双解码器外加入轻量敏感性解码器,捕捉局部纹理异常和多尺度激活不稳定。Cityscapes 与 BDD-Anomaly 实验显示其在保持闭集精度的同时提升异常分割,BDD-Anomaly 上 AUROC 提高 2.4%、FPR@95TPR 降低 2.5 个百分点。

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering Figure 1
2026-08-11cs.CV

Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering

Yusra Tariq, Rakesh Chandra Joshi

2026-08-11视觉感知

医学VQA需要把病灶纹理、边界等细粒度视觉证据与临床问题对齐,单纯空间域交叉注意力容易混合全局结构和局部纹理且成本较高。本文用问题条件化的双分支频域融合,在视觉2D与文本1D傅里叶谱上做滤波和跨模态门控,并结合BiomedCLIP双层特征与BioBART生成答案。PMC-VQA预训练后在VQA-RAD、SLAKE上带来频域模块增益,但结论也承认未超过当前SOTA,且对闭合式器官存在类问题可能退化。

A Controlled Study of Feature-Based Knowledge Distillation Across Student Designs Figure 1
2026-08-11cs.LG

A Controlled Study of Feature-Based Knowledge Distillation Across Student Designs

Abhinand Balachandran, Praveen Prashant

Georgia Institute of Technology

2026-08-11规划控制

这篇论文关注小模型部署时的知识蒸馏选择:在教师、训练配方和随机种子受控的条件下,比较仅匹配 logits 与额外匹配中间特征的效果。核心洞察是特征蒸馏并非稳定增益项,且同一辅助损失权重会在不同学生模型上产生不同梯度尺度。实验显示 logit KD 提升所有学生;Attention Transfer 对 CustomResNet 平均为负、对 MobileNetV2 为正;FitNets 在 15 组配对中均弱于 logit KD。

Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation Figure 1
2026-08-11cs.CV

Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation

Haozhe Wang, Jintao Cheng, Weibin Li, Xiaoyu Tang

2026-08-11视觉感知

本文针对开放词汇语义分割中 CLIP 密集预测不稳定、现有方法又依赖改动宿主模型内部结构的问题,提出测试时原型适配 TPA:从少量无标注部署图像中筛选宿主高置信 patch,用冻结 DINO 特征聚合类别原型,并在推理时与原 logits 融合。结果显示其在五类 OVSS 宿主、三种 CLIP backbone 和八个基准上稳定提升,约 10% 部署图像即可构建有效原型库。

What Irregularity Costs: CUDA C++, Rust, and Triton on a Hash-Blocked GPU Workload Figure 1
2026-08-11cs.CV

What Irregularity Costs: CUDA C++, Rust, and Triton on a Hash-Blocked GPU Workload

Petr Korolev (Spacial Intelligence Labs)

Spacial Intelligence Labs

2026-08-11视觉感知

这篇论文针对常见 GPU 语言评测偏重矩阵乘等规则负载的问题,把实时三维重建中的哈希分块 TSDF 融合作为不规则基准,比较 CUDA C++、cuda-oxide Rust 与 Triton。核心洞察是语言差异主要暴露在开放寻址、原子插入和可变探测深度上:规则更新阶段三者接近,不规则分配阶段 Rust 接近 CUDA,而 Triton 慢一个数量级以上且有静默丢块风险。

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System Figure 1
2026-08-11cs.CV

Ego-OSCAR: Egocentric Open source Stereo CAptuRe System

Gunjan Paul, Senthil Palanisamy, Satpal Singh Rathore, Pratyush Kumar Patnaik, Shubhanshu Khatana, Abhishek Anand

FPV Labs

2026-08-11视觉感知

面向VLA/具身智能对大规模真实交互数据的需求,论文认为瓶颈在于可复制、低成本且带几何与惯性信息的第一视角采集。Ego-OSCAR的核心是开放硬件的头戴式同步全局快门RGB双目+IMU系统,并配套采集、标定、同步与看门狗软件。结果显示其约200美元成本下完成6个月分布式部署,获得550小时/相机、1462段会话、209315个开放词表动作片段,96%会话可用,但端到端机器人策略增益文中未充分说明。

Action- and Language-Conditioned Video Assessment for Embodied Control Figure 1
2026-08-11cs.RO

Action- and Language-Conditioned Video Assessment for Embodied Control

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

Robotics Program, Korea Advanced Institute of Science and Technology (KAIST), Daejeon 34141, School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)

2026-08-11视觉感知规划控制

这篇论文针对具身智能多步指令执行中仅看最终图像或嵌入相似度容易漏掉中间状态变化的问题,提出 ALVA:先用视觉语言模型按动作序列概括帧间转移,再依据语言指令给出离散轨迹进度评分。其价值在于把“动作是否导致了正确视觉变化”显式纳入评估。在 ALFRED/AI2-THOR 模拟家居任务中,ALVA 相比静态图像和嵌入基线反馈更有效,误报率接近零,并缩小了与真值 oracle 的差距,但结论仍限于所测模拟环境和 VLM 骨干。

High-Capacity Generalized Hopfield Networks Figure 1
2026-08-11cs.CV

High-Capacity Generalized Hopfield Networks

Victor Galitski

Joint Quantum Institute, Department of Physics, University of Maryland, College Park, MD 20742, USA

2026-08-11视觉感知

针对连续变量 Hopfield 网络随维度升高容量反而下降的问题,论文把记忆与神经元推广到 SU(d) 对称空间,并用李代数把非线性几何约束转成辅助 Hilbert 空间中的线性代数;其关键洞察是召回可视为带尖峰矩阵的主特征向量对齐,较不易受随机串扰影响。数值与 replica 分析显示 d=3 起临界容量相对向量 Hopfield 近一个数量级提升,且随 d 增长,并在 RGB 图像修复和广义 LLG 动力学中演示召回。

VTO: Visual Tool Orchestration for Video Anomaly Detection Figure 1
2026-08-11cs.CV

VTO: Visual Tool Orchestration for Video Anomaly Detection

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

State Key Laboratory of Networking and Switching Technology, School of Digital Media & Design Art, State Key Laboratory of Networking and Switching Technology Beijing University of Posts and Telecommunications Beijing China, School of Digital Media & Design Art Beijing University of Posts and Telecommunications Beijing China

2026-08-11视觉感知

本文针对视频异常检测在开放场景中难以泛化、现有多模态代理易把工具当作孤立模块且因结果奖励过粗而过早停止的问题,提出 VTO:用过程监督强化学习和基础模型驱动的认知评估器,对每一步工具调用、逻辑性与因果完整性给出反馈,并配套构建含 12 个视觉工具的 VAD-Tool 基准。实验显示,VTO 在工具调度准确率上较基线最高提升 10.2 个百分点。

Retrieval-Augmented Generation-Based Color Restoration for Low-Light Image Enhancement Figure 1
2026-08-11eess.IV

Retrieval-Augmented Generation-Based Color Restoration for Low-Light Image Enhancement

Li-Wei Lu, Shaou-Gang Miaou

2026-08-11视觉感知

论文针对低光增强模型亮度和结构已较好、但仍常出现天空偏绿、肤色偏黄等色偏的问题,将颜色恢复从前端增强中解耦出来,作为冻结 LLIE 模型后的 RAG 式后处理模块:用 VGG19 特征双索引检索外部高质量参考图,再通过 GlobalSPHistAdaIN 注入全局颜色统计并做残差校正。实验显示其在 LOL 系列数据集上稳定改善 ΔE2000 和 MAEab,并可迁移到 LLFormer、FLIGHTNet、IAT 等不同前端,且 VGG 检索优于 CLIP,提示颜色修复更依赖纹理与结构相似而非语义相似。

BAP-MOS: Bandit-Based Adaptive Prompting for Boundary-Sensitive Multi-Organ Segmentation Figure 1
2026-08-11cs.CV

BAP-MOS: Bandit-Based Adaptive Prompting for Boundary-Sensitive Multi-Organ Segmentation

Satvik Praveen, Shengji Jin, Ahmed Lamidi, Xin Qian, Yi Sheng

2026-08-11视觉感知生成模型学习理论

针对多器官超声分割中 Dice 很高但相邻器官边界仍偏差明显的问题,BAP-MOS 将点、框及组合提示的选择建模为按器官自适应的多臂老虎机,并用 Dice、MSD、HD95 组合反馈驱动,只微调 mask decoder。其在前列腺 TRUS 上取得 Dice 0.982、HD95 0.482、MSD 0.204,相比最强传统基线约降 HD95 48%、MSD 45%,但外部 PFUS1 泛化结果表述较粗,细节文中未充分说明。

Wiener Representation Filtering for VLM Hallucination Suppression Figure 1
2026-08-11cs.CV

Wiener Representation Filtering for VLM Hallucination Suppression

Ameen Ali, Tamim Zoabi, Lidor Brami, Lior Wolf

Tel Aviv University

2026-08-11视觉语言

针对视觉语言模型常把图像中不存在的物体、属性或关系说出来的问题,论文把幻觉视为隐藏表示中的结构化谱失真,用少量配对样本离线估计协方差,并以 Wiener 型闭式滤波一次性改写深层前馈投影权重,无需训练且不增加推理开销。实验显示该方法在 LLaVA-1.5、MiniGPT-4、Gemma3、mPLUG-Owl2 等模型上降低 CHAIR、POPE、MME 的物体幻觉,同时基本保持描述流畅性和回答质量。

Learning Structural Illumination for Unsupervised Low-light Enhancement Figure 1
2026-08-11cs.CV

Learning Structural Illumination for Unsupervised Low-light Enhancement

Tianle Du, Peiyuan He, Hainuo Wang, Tianxiu Yu, Xiaojie Guo

Tianjin University 2 Dunhuang Academy

2026-08-11视觉感知

本文针对无监督低光增强中固定曝光目标泛化差、低信噪暗区干扰照明估计的问题,提出 RISE 将相对照明结构与绝对曝光解耦,并从可靠亮区关键照明线索推断结构;同时用输入自适应的 DMER 替代固定曝光参考。多基准和真实场景实验显示,其在无监督方法中取得更好的 PSNR-FLOPs 权衡和更自然的视觉结果。

EFFEKT: Efficient Federated Knowledge Transfer to Foundation Models Figure 1
2026-08-11cs.CV

EFFEKT: Efficient Federated Knowledge Transfer to Foundation Models

Matteo Caligiuri, Francesco Barbato, Pietro Zanuttigh, Francesco Restuccia

Northeastern University, Boston (MA), United States, University of Padua, Padua, Italy, Department of Information Engineering, Department of Electrical & Computer Engineering

2026-08-11视觉感知

论文针对联邦学习中基础视觉模型难以下放到边缘设备、而本地数据又受隐私约束的问题,提出 EFFEKT:客户端只训练轻量代理模型,服务器通过 C2S 蒸馏把客户端知识写入领域 LoRA,并用联合对齐维持代理特征与基础模型一致。实验在 5 个细粒度视觉领域较既有方法平均提升 top-1 3.9%、top-5 2.7%,并在树莓派和 Jetson 等低功耗设备上验证了较低能耗与通信开销。

Compositional Cross-Modality Translation via Whole-Volume Multitask Latent Flow Matching Figure 1
2026-08-11cs.CV

Compositional Cross-Modality Translation via Whole-Volume Multitask Latent Flow Matching

Daniele Molino, Alessio Zoboli, Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

2026-08-11生成模型

针对医学跨模态合成常受限于2D/patch处理和单任务建模的问题,论文将大规模预训练3D VAE作为全体积先验,把翻译简化为潜空间条件流匹配,并用一个多任务模型覆盖MRI/CBCT到CT及MRI序列转换。实验显示全体积优于patch,多任务性能接近专用模型,还支持未见解剖区域零样本和跨数据集组合翻译。

When Does An Extra View Help? Adapting Single-View 3D Reconstruction with Extra Imagery Figure 1
2026-08-11cs.CV

When Does An Extra View Help? Adapting Single-View 3D Reconstruction with Extra Imagery

Y Huynh, Duc Thanh Nguyen, Thao Minh Le, Mohamed Abdelrazek

2026-08-11视觉感知三维

本文针对单图三维重建在未知物体上缺少背面与遮挡信息、生成视角易不一致的问题,提出 ASV3D:在测试时引入一张额外图像,并用一致性门控为每个目标视角选择更有用的条件图像;进一步用对比学习优化跨视角一致性。实验显示,该方法在基准和真实物体数据上提升两类单图重建管线的精度、鲁棒性和用户偏好。

Staying True to the Origin: Continuous Image Stylization with Smooth Transitions Figure 1
2026-08-11cs.CV

Staying True to the Origin: Continuous Image Stylization with Smooth Transitions

Rui Xu, Hanmo Zhang, Songhua Liu

2026-08-11视觉感知

这篇论文针对图像风格迁移中“内容保持、强风格化、强度可控”难以同时满足的问题,提出两阶段训练:先让 DiT 多参考编辑模型学习高强度端点风格化,再冻结基座并用低秩锚点投影器把离散风格强度映射到参数空间,推理时通过强度感知样条插值实现连续控制。实验显示该方法能在平滑调节风格强度时更稳定地保留内容布局与细粒度风格细节。

SUMI: Scalable Unified Model for 3D Point Cloud Inference Figure 1
2026-08-11cs.CV

SUMI: Scalable Unified Model for 3D Point Cloud Inference

Yanlong LI, Kanchana Thilakarathna

School of Computer Science, The University of Sydney

2026-08-11三维

本文针对点云补全中粗到细框架的细化阶段过度依赖简单上采样、难以恢复局部几何的问题,提出 SUMI:把扩散噪声作为特征级细化信号,通过噪声条件交叉注意力与粗结构交互,而非单独生成点坐标。该模块可接入既有粗到细模型,在 PCN、ShapeNet-55/34 和 MVP 上相对强基线稳定提升,ShapeNet-55 CD 最高降低 16.1%,并在 MVP 各输出密度取得最佳 CD。

SCTD 3.0: Sonar Common Target Detection in the Wild - A Large-Scale, Multi-Scene Dataset from Real Marine Surveys Figure 1
2026-08-11cs.CV

SCTD 3.0: Sonar Common Target Detection in the Wild - A Large-Scale, Multi-Scene Dataset from Real Marine Surveys

Peng Zhang

2026-08-11视觉感知数据集/基准

针对真实海域SAS目标检测数据稀缺、场景单一且标注难以反映声学成像机理的问题,SCTD 3.0汇集1万余幅多频段实测SAS切片,覆盖十余类小目标、多海底地貌、视角和距离,并提出将目标物理属性、部署状态与散射现象解耦的层级标注。论文还建立检测、细粒度分类和属性预测的多任务基准,在跨域、跨场景、跨频段、跨视角设置下评测主流模型,但具体性能增益来源文中未充分说明。

Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence Figure 1
2026-08-11cs.IR

Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence

Sankalp Nagaonkar, Rohit Garg, Ankit Raj, Ashish Choithani, Ashutosh Trivedi

2026-08-11强化学习

论文认为面向摄像头、屏幕、直播和档案的视频搜索,难点不在单次模型排序,而在持续增长的视觉记忆、时间对齐、上下文选择和可回放证据。其核心是用 VDB 将多分析器产生的场景、artifact、来源时间和分层索引持久化,并区分 memory、context、evidence。在 4 个公开数据集、9800 多个查询上,通用组件流水线的 Recall@1/3/10 高于商业视频原生检索系统,但 Recall@50 略低,说明主要增益来自系统设计而非端到端视频预训练。

NeuroGuard: Neural Gradient Update Aware of Representation Damage Figure 1
2026-08-11cs.CV

NeuroGuard: Neural Gradient Update Aware of Representation Damage

Taigo Sakai, Kazuhito Hotta

2026-08-11优化算法

该文关注长尾类增量学习中“新类适应”与“旧类表征保护”的冲突,认为问题不只在重放、分类器或损失设计,也在任务边界处表征应被更新多强。NeuroGuard在DGR上加入无可学习参数的更新控制:用教师不确定性自适应缩放梯度,用低置信旧样本重加权蒸馏,并把旧记忆泄漏纳入缩放决策。五个LT-CIL设置中均优于DGR,四个主要比较取得最高任务无关准确率;固定缩放对照落后,支持增益主要来自边界自适应scaling。

EvBS: Event-guided Blur Synthesis for Domain-adaptive Motion Deblurring Figure 1
2026-08-11cs.CV

EvBS: Event-guided Blur Synthesis for Domain-adaptive Motion Deblurring

Junsik Jung, Seokryun Choi, Yoonki Cho, Woo Jae Kim, Andrew Jeong, Sung-Eui Yoon

Korea Advanced Institute of Science and Technology, Korea Advanced Institute of Science and Technology Daejeon Republic of Korea

2026-08-11视觉感知

针对预训练去模糊模型在真实场景中因相机环境和运动分布变化而退化、影响自动驾驶和机器人感知可靠性的问题,EvBS利用事件相机的高时间分辨率将运动与视觉内容解耦,通过内在运动重加模糊和跨样本外在运动迁移生成目标域训练对,并用扩散模型辅助微调。实验显示其在多个未见真实数据集上提升图像式和事件式去模糊模型的鲁棒性。

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models Figure 1
2026-08-11cs.CV

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

Electrical and Computer Engineering Department, UC Santa Barbara 1, Computer Science Department, UC Santa Barbara 2

2026-08-11视觉语言视觉感知

ZOMP针对边缘设备或闭源API只能前向调用、无法反传微调CLIP的场景,认为既有零阶提示调优因单模态或浅层搜索而限制效果。方法用跨模态低秩因子把视觉与文本深层提示绑定,并结合梯度校正动量和随查询预算增长的秩调度,降低零阶估计噪声。在13个视觉语言基准、5000次查询预算下,其少样本精度、查询效率及迁移/OOD泛化均优于既有BP-free方法。

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets Figure 1
2026-08-11cs.RO

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

the Key Laboratory of Target, Aerospace Information Research Institute, Chinese Academy of Sciences, School of Artificial Intelligence, Shanghai Jiaotong University, Space Engineering University

2026-08-11视觉感知三维

这篇论文针对单图生成可仿真3D资产时“看起来像”但缺少尺度、部件关系、材料和关节等物理可用性的痛点,认为问题在于现有VLM直接输出全局资产令位置与形状耦合且中间推理不可监督。PhysX-CoT把生成拆成可解析的部件级物理状态链,并用3D框负责位置、本地编码负责形状,再以GRPO奖励解析、 grounding 和物理一致性。统一重训基线和UE5测试显示其在几何、尺度、物理属性与可执行有效性上优于最接近方法。

Evidence-RL: Towards Evidence-intensive Visual Reasoning Figure 1
2026-08-11cs.CV

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

National University of Singapore, Zhejiang University, Fudan University, Tsinghua University

2026-08-11强化学习

本文针对 VLM 后训练中“答对但未必看图”的问题,指出全局扰动或注意力代理只能衡量粗粒度图像依赖,难以识别答案是否因局部证据而成立。核心方法 CED 通过反事实地中和候选证据区域,并与非证据区域的支持度下降对比,把证据依赖信号并入 GRPO。实验覆盖九个基准和四个骨干,显示其优于既有 RL 后训练方法,尤其改善幻觉、计数、空间与先验冲突场景,且不增加推理开销。

EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking Figure 1
2026-08-11cs.CV

EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking

Jan Kulik, Bjarni Dagur Thor Karason, Yung-Hsu Yang, Boyang Sun, Marc Pollefeys, Xi Wang

2026-08-11视觉感知三维

EgoTrack3D面向机器人和具身智能中第一视角视频难以长期维护动态三维场景的问题,将2D分割提升到全局3D坐标,并用点级运动评分、外观/几何关联和体素合并维护静态与动态物体轨迹;还提供稀疏3D框变体以适配无可靠深度的场景。在ADT上相较最强基线PCL提升11%,但密集版本依赖准确深度、位姿和分割,真实端到端增益仍受这些模块限制。

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation Figure 1
2026-08-11cs.CV

Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation

Yichun Yeh, Yiheng Li, Xiaobo Hu, Zhen Lei, Yang Yang

2026-08-11机器人视觉语言

这篇论文针对图文伪造检测中“有框无因”或解释与定位脱节的问题,提出 EFR 框架:先用 Anchor-and-Verify 将结论坐标作为证据锚点,再用可验证奖励和 MDA 路由分别约束分类、脸部定位与文本定位训练。实验称在 DGM4 上达到 SOTA,并能输出与空间证据绑定的取证推理记录,但具体增益中数据构造贡献占比仍需结合消融判断。

PE-Mamba: Bidirectional Selective Layer Aggregation for AI-Generated Image Detection Figure 1
2026-08-11cs.CV

PE-Mamba: Bidirectional Selective Layer Aggregation for AI-Generated Image Detection

Kutub Uddin, Nusrat Tasnim, Khalid Malik

2026-08-11视觉感知

本文针对 AI 生成图像检测中 ViT 中间层特征常被无序加权平均、忽略由浅层纹理到深层语义的层级顺序这一问题,提出 PE-Mamba:在 PE-Core 上用 LoRA 微调,并以双向选择性 SSM 聚合 CLS token,再结合软最大全局聚合与 sigmoid 门控融合。实验称其在 UniversalFakeDetect 达到 96.6% mACC、99.5% mAP,在 AIGCDetect 达到 95.3% mACC、98.1% mAP,优于 18 个检测器且仅训练 1.3% 参数。

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval Figure 1
2026-08-11cs.CV

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

2026-08-11数据集/基准

现有人类运动-文本检索基准多依赖室内 MoCap,类别长尾且描述短而重复,难以可靠评估开放场景中的跨模态对齐。MRBench 通过多源运动、118 类均衡覆盖和三粒度文本标注构建更严格测试集,并用规则、LLM/VLM筛选及人工验证保证语义对应。实验显示既有模型存在明显跨数据集泛化缺口且对查询粒度敏感;作者的粒度感知轻量模型提升混合粒度检索,同时基本保持标准描述性能。

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence Figure 1
2026-08-11cs.CV

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

Ling Lin, Yang Bai, Congcong Zhu, Jiangming Shi, Meng Wang, Yang Long, Jingrun Chen, Ling Shao, Huazhu Fu

2026-08-11视觉感知

这篇论文针对视觉空间推理中多模态大模型自回归 CoT 易在早期步骤出错并累积偏差的问题,将逐步推理建模为有限时域决策过程,用离线推理树和 Monte Carlo 回报估计相对优势,训练 Step/Trajectory Advantage Gate 在推理时筛选高价值前缀与轨迹。作者还构建 Reasoning-Tree-160k,实验称可在多项视觉空间理解与推理基准上提升现有 MLLM 的最终答题准确率。

AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining Figure 1
2026-08-11cs.CV

AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining

Vasileios Tzouras, Paraskevas Pegios, Lazaros Nalpantidis

2026-08-11视觉感知

面向田间农业视觉中标注昂贵、自然图像预训练模型存在域偏移且全量适配成本高的问题,本文汇集17个公开数据源构建AgriField-40K,并提出只训练轻量适配器的AgriMAE持续预训练框架,比较像素重建与DINOv3语义特征重建。结果显示其在分类、分割、检测上稳定优于原MAE适配器,语义重建收益更大,并可用最多少9倍可训练参数达到或超过全量微调。

AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection Figure 1
2026-08-11cs.CV

AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection

Xu Zhang, Xinqing Li, Jianpeng Xie, Zeshuai Zhu, Xin He, Yun Liu

2026-08-11视觉感知

AdaDINO针对DINO等视觉基础模型按单图预训练、难以在遥感双时相变化检测中提前建模跨时相关系的问题,将交互移入冻结骨干:CGLA在中间层注入反向时序残差,BSCS以批共享通道块削减FFN计算,CPGR复用编码端变化先验做细化。四个基准上性能达到或超过VFM基线,在SYSU-CD上剪去62.5% FFN宽度后仍有85.29% F1,并带来1.41倍吞吐提升。

Distilling Physical Priors into Streaming World Models Figure 1
2026-08-11cs.CV

Distilling Physical Priors into Streaming World Models

Liangliang Zhao, Junying Wang, Danni Yang, Yifan Chang, Bin Fu, Yu Qiao, Bowen Zhou, Yihao Liu

2026-08-11强化学习

这篇论文针对流式世界模型长时滚动中易违背物理约束的问题,提出 PhyS:用 12 万真实物理交互视频及结构化因果标注强化 14B 双向 DiT 教师,再蒸馏到 1.3B 因果 DiT,并用 TCR 将窗口级物理奖励对齐到去噪动作。实验显示其在 PhysicsIQ 上较教师提升 18.2%,并显著改进多种 Forcing 基线及多个物理视频基准。

LIBAD: A Multimodal Anomaly Detection Benchmark for Li-Ion Battery Electrode Manufacturing Figure 1
2026-08-11cs.CV

LIBAD: A Multimodal Anomaly Detection Benchmark for Li-Ion Battery Electrode Manufacturing

Wenbo Sui, Daniel Lichau, Harold Phelippeau, Zhao Liu

2026-08-11视觉语言视觉感知数据集/基准

本文针对现有多模态工业异常检测多面向离散产品、且默认模态证据强相关的问题,提出锂电池电极制造基准 LIBAD,覆盖真实卷对卷产线、可见光与高/低分辨率 X-ray 的弱相关缺陷场景。论文进一步提出密度感知的 DA-Core 记忆库选择,以保留正常特征的局部密度;在 0.05 coreset 下将 FPR95 从 60.4% 降至 54.3%,并较最佳标准 coreset 推理快 43.9%。

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model Figure 1
2026-08-11cs.CV

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

Zhennan Chen, Tianxing Shi, Pengcheng Xu, Kepan Nan, Qian Wang, Zili Yi, Jian Yang, Ying Tai

2026-08-11视觉感知

SynVAR针对视觉自回归模型在复杂多物体场景中低分辨率早期错误会跨尺度传播、导致空间关系错乱、语义混淆和细节退化的问题,提出无需训练的协同控制框架:用全局空间引导约束早期布局,用动态感受野限制抑制语义串扰,并用高频补偿恢复细节。实验显示其可插入Infinity、Switti等VAR文生图模型,在Geneval和T2I-CompBench总体分数上分别平均提升19.6%和7.9%,但效果仍受基础模型先验和经验步数选择限制。

LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection Figure 1
2026-08-11cs.CV

LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection

Shangye Song, Tianzhi Zhu, Syed Ariff Syed Hesham, Xin He, Yun Liu

2026-08-11视觉感知

这篇论文针对伪装目标检测中前景与背景高度相似、弱边界难以保留的问题,指出现有 LMM-to-SAM 方法虽有语言提示,但主要作用在解码器,未显式组织稠密视觉特征。LAD-COD 用可训练层级视觉分支保留纹理、边界和上下文,并通过 LADVF 将指令目标嵌入扩展到 patch 级语义检索与门控残差融合。实验在 CAMO、COD10K、NC4K 的 12 个数据集-指标组合上均取得最好报告结果。

FlexSplat: Flexible Feed-Forward 3D Gaussian Splatting without Point Cloud Correspondence Figure 1
2026-08-11cs.CV

FlexSplat: Flexible Feed-Forward 3D Gaussian Splatting without Point Cloud Correspondence

Amir Sabbaghziarani, Hanting Ye, Maria Gorlatova, Yi Ding

2026-08-11三维

FlexSplat针对前馈3D高斯重建仍依赖已知相机位姿、且像素/点对应会带来冗余高斯的问题,提出将几何Transformer与查询式高斯解码器联合训练,预测相机和深度,并用深度引导参数化、多视图可变形注意力和不确定性加权深度一致性形成跨视图共识。在ShapeNet-SRN和GSO上,它无需相机或深度真值即可接近有位姿SOTA,GSO感知质量达到对比方法最佳,但主要增益更多来自去除标定需求而非PSNR提升。

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning Figure 1
2026-08-11cs.CV

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

Zhejiang University, Beijing Jiaotong University, Zhejiang University Hangzhou China, Beijing Jiaotong University Beijing China

2026-08-11视觉语言视觉感知强化学习

该文针对体育转播中球员密集、目标小且动作相似导致多模态模型依赖语言先验的问题,提出 SportsGrounder:用开放词汇检测器筛选领域相关候选框,并通过逐帧交错融合坐标、语义与全局特征保持时序对齐,再用动作感知监督和混合偏好优化约束动作表征。基于 SoccerNet 与 FineSports 构建的密集体育 VQA 实验显示,其细粒度推理准确率达到 SOTA。

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange Figure 1
2026-08-11cs.CV

SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange

Jaemo Jeong, Junho Yoon, Hyunju Kim, Dongman Lee

2026-08-11视觉感知

本文针对训练-free音视频事件感知中相近标签共享证据导致的误共激活问题,指出单一阈值难以同时保留真类并排除伪类。SCoPE用稀疏标签竞争先削弱共享证据,再通过跨模态先验降低对应事件选择成本,但仍由目标模态重判。实验在CLIP+CLAP的LLP上较AV2A提升Type@seg 7.45点、Event@seg 5.04点,并可无改动迁移到OV-AVEBench和VGGSound-AVEL100k。

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification Figure 1
2026-08-11cs.CV

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

Yang Shu

Zhejiang University, Hangzhou, China

2026-08-11视觉语言

这篇论文关注多模态 LLM 评审面板在引用“同行判断”时是否会被不可信文本误导。作者提出“源盲锚定”攻击视角,并用盲投票一致性做验证防御;实验显示,自评或同行引用都会造成约19–26个百分点锚定差距,伪造错误引用比自然错误同行意见更易推翻正确判断,而面板共识验证可拦截84.9%伪造攻击、将净伤害降低97.5%。

SegDem: Segmentation helps Demosaicing Figure 1
2026-08-11cs.CV

SegDem: Segmentation helps Demosaicing

Ping Chen, Xiangming Wang, Yongyong Chen, Jiezhang Cao, Kai Zhang, Jingyong Su, Jie Liu, Haijin Zeng

Harbin Institute of Technology, Shenzhen, Shanghai Jiao Tong University, Nanjing University (Suzhou), Code will be available at https://github.com/cipi666/SegDem

2026-08-11视觉感知

本文针对去马赛克在物体边界、细结构和重复纹理处易产生伪色、拉链与摩尔纹的问题,提出将实例分割学到的区域和边界结构表示迁移到RAW条件重建中,而非在重建时直接预测语义;同时用冻结DINOv2对齐两阶段特征以保持结构一致性。实验覆盖卷积、Transformer和状态空间骨干及Single/Quad-Bayer布局,显示一致增益,但具体增益幅度需依赖文中表格判断。

DeCo: Zero-Shot Industrial Anomaly Generation through Decoupling and Recoupling Figure 1
2026-08-11cs.CV

DeCo: Zero-Shot Industrial Anomaly Generation through Decoupling and Recoupling

Shilei Zeng, Xurui Li, Yaohan Tang, Yu Zhou

2026-08-11视觉感知

面向工业缺陷样本稀缺的冷启动检测,DeCo认为零样本异常生成的关键瓶颈在于异常结构与来源产品纹理纠缠、以及与目标产品融合不可控。方法用DR-Flow和PI-Flow把产品无关的异常结构绑定到异常 token,再通过混合注入和PCC与目标正常纹理重耦合。用其生成数据训练检测器,在MVTec AD和VisA上像素AP分别提升5.1%和8.2%。

Vision-Language Grounding as Bidirectional Concept Correspondence Figure 1
2026-08-11cs.CV

Vision-Language Grounding as Bidirectional Concept Correspondence

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna

University of Washington, Allen Institute for AI

2026-08-11视觉语言视觉感知

论文指出现有视觉语言 grounding 多把文本片段预先给定,忽略了“哪些词真正指向图像实体”这一前置问题;因此提出双向概念对应,把文本掩码、实例图像掩码和跨模态匹配统一预测。ConCor-1 用可学习 bridge tokens 接入预训练 VLM,并在统一数据格式上训练;实验显示其在长 caption 的 JointF1 提升 48%,零样本 LVIS 提升 29%。

UniScale: Arbitrary-Scale Industrial Anomaly Generation Figure 1
2026-08-11cs.CV

UniScale: Arbitrary-Scale Industrial Anomaly Generation

Shilei Zeng, Linxin Guan, Xurui Li, Yaohan Tang, Yu Zhou

2026-08-11视觉感知

UniScale针对工业缺陷样本稀缺且扩散模型难以生成小尺度异常的问题,指出VAE与U-Net的多级下采样会让小缺陷在潜空间中丢失。方法上通过误差抑制的多尺度训练学习位置相关纹理,并在推理时先生成异常再融合背景,避免细节被背景淹没。实验在VisA和MVTec AD 2上提升生成质量,IS(a)相对提高45.86%和37.70%,并带来下游像素级IoU或AUROC增益。

LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering Figure 1
2026-08-11cs.CV

LHSDet: High-Resolution AI-Generated Image Detection via Visual Question Answering

Qian Yao, Jun-Jie Huang, Yongjun Wang, Luming Yang

Qian Yao, Jun-Jie Huang, and Yongjun Wang are with the College of Computer Science and Technology, National University of Defense Technology, Changsha 410073, China (e-mail:

2026-08-11视觉感知

本文针对高分辨率 AI 生成图检测中常见下采样会丢失纹理伪迹、未知生成器又限制大规模训练的问题,将检测改写为 VQA 任务。LHSDet 以低层非重叠 patch 纹理、高层 SigLIP2 视觉特征和 BLIP-2 caption 语义三分支融合,并用 LoRA 微调。实验称其在多类扩散和自回归生成器、WildRF 及高分辨率场景上更稳健,高分辨率检测准确率较次优方法提升超过 9%。

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems Figure 1
2026-08-11cs.CV

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

Henri Vanhuynegem, Weitao Xu, Yiran Shen, Guohao Lan

Henri Vanhuynegem is with the Department of Software Technology, Delft, University of Technology, Delft, The Netherlands., Weitao Xu is with the Department of Computer Science, City University, Yiran Shen is with the School of Software, Shandong University, Jinan, Guohao Lan is with the School of Computer Science, University of Macau, the laboratory to the devices that people carry and wear., based VQA, the visual input sits at the center of this trade-off., mobile visual assistance, but they still center mainly on answer

2026-08-11视觉语言数据集/基准

针对手机和智能眼镜依赖云端 VLM 做视觉问答时成本、时延与准确率难以权衡的问题,论文提出 VQABENCH,将客户端图像预处理作为受控变量,比较12种方法、3个VQA数据集和4个商业模型。结果显示预处理并非总有益,效果受模型、API形态、计费规则和任务影响;压缩通常能保准确降载荷,意图引导裁剪有较好时延-准确率折中,过度缩减会明显伤害质量。

Distilling CT Foundation Models into Editable Concept Bottlenecks for Lung Nodule Malignancy Prediction Figure 1
2026-08-11cs.CV

Distilling CT Foundation Models into Editable Concept Bottlenecks for Lung Nodule Malignancy Prediction

Fakrul Islam Tushar, Stephen Adamo, Geoffrey D. Rubin

2026-08-11视觉感知

这篇论文针对 CT 基础模型用于肺结节恶性预测时难解释的问题,将两种冻结表征蒸馏为 8 个放射科概念瓶颈,并用可加模型结合结节大小预测风险。结果显示 FMCIB 对若干形态概念的保真度高于 CT-FM,但整体仍偏低;概念+大小模型内外部 AUROC 约为 0.86/0.72-0.73,接近单独大小,主要价值在可分解和可编辑解释而非精度提升。

IRPol-Fuse: Energy-structure coordination for infrared polarization fusion under low visibility Figure 1
2026-08-11cs.CV

IRPol-Fuse: Energy-structure coordination for infrared polarization fusion under low visibility

Zhuangfan Huang, Chusheng Fang, Xiaosong Li, Yang Liua, Xiaoqi Cheng, Haishu Tan

Guangdong Provincial Key Laboratory of Industrial Intelligent Inspection Technology, Foshan University, Foshan 528225, China.

2026-08-11视觉感知

这篇论文针对低照、遮挡等低能见度场景中红外图像保热目标但缺细节、偏振图像含结构但易被融合网络压制的问题,提出 IRPol-Fuse,用偏振注意力、红外高亮注入和偏振纹理注入协调“能量-结构”。作者还构建 110 对齐样本的 LI-PI 数据集,并在 LI-PI、LDDRS 及检测任务上显示其能同时改善热目标保持、纹理恢复和视觉自然性。

SeqLoc: Beyond the Single Frame for Cross-View Geo-Localization in Feature-Sparse Scenes Figure 1
2026-08-11cs.CV

SeqLoc: Beyond the Single Frame for Cross-View Geo-Localization in Feature-Sparse Scenes

Junwei Zheng, Yun Huang, Ruize Dai, Ruiping Liu, Yufan Chen, Kunyu Peng, Kailun Yang, Jiaming Zhang, Guangming Wang, Olaf Wysocki, Rainer Stiefelhagen

2026-08-11视觉感知

本文针对基于 OSM 的跨视角地理定位在乡村道路、林道等特征稀疏场景中单帧观测高度歧义、易沿道路方向误匹配的问题,构建 CV-FSS 基准,并提出无需训练的 SeqLoc,在测试时递归融合位姿似然,通过熵调制、地图引导重定位和峰值锚定平滑避免错误置信锁死。实验显示其在 CV-FSS 和 CV-RHO 上显著优于单帧方法,位置与朝向召回提升超过 50%。

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain Figure 1
2026-08-11cs.RO

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain

Shreyam Gupta (1), P. Agrawal (2), Priyam Gupta (3), R. Gautam (1) ((1) Robotics Research Group, Indian Institute of Technology (BHU), Varanasi, India, (2) University of Colorado, Boulder, USA, (3) Intelligent Field Robotic Systems (IFRoS), University of Girona, Spain)

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in, Robotics Research Group, Indian Institute of Technology (BHU), Varanasi, India, University of Colorado, Boulder, USA, Erasmus Mundus — Intelligent Field Robotic Systems (IFRoS), University of Girona, Spain, This paper presents a collaborative UAV-UGV nav-, Collaboration, ception to a collaborative, mixed air-ground approach. By, map. [Northern Robotics Laboratory, 2020] Thermal imag-, The field of UAV-UGV collaboration has matured signif-, retical principles of heterogeneous collaboration, engineered, Node, and the Collaborative Communication Bridge.

2026-08-11机器人

雪地高海拔场景会同时削弱地面视觉、里程计和传统避障能力,论文因此把感知上移到无人机、让地面车按空中语义地图行驶。核心做法是用合成雪增强训练轻量 U-Net 分割可通行道路,结合 GPS/IMU 的 EKF、YOLOv5+深度跟踪地面车,并用动态代价地图重规划。实验主要在 Gazebo 仿真中验证,报告分割训练准确率 96.5%、无人机定位最大误差约 ±0.5 米,但真实雪地泛化和增益来源仍文中未充分说明。

From Benchmark Performance to Tool Deployment: Human-in-the-Loop Anomaly Detection Figure 1
2026-08-11cs.LG

From Benchmark Performance to Tool Deployment: Human-in-the-Loop Anomaly Detection

Mike Szklarzewski, CJ George, Gavin Smithson, Christopher Stokes, Dakota Fulp, William M. Jones, Benjamin Wynn, Alexander Ur, Agit Yesiloz, Clint Kallenbach, Mark Swartz, Nathan DeBardeleben, Sharmistha Chakrabarti

2026-08-11视觉感知数据集/基准

这篇论文针对工业异常检测从学术基准走向真实质检部署时表现不稳定的问题,评测19个无监督模型在BowTie反光金属制造数据上的跨色彩配置与预处理鲁棒性,并提出含标注、热图审查、SAM候选区域修正和验证引擎的人机协同框架。结果显示模型对预处理和成像条件高度敏感,没有单一方法稳定占优,名义数据质量也会影响部署可靠性。

DINO-3DRA: Leveraging 2D Foundation Model Semantics for 3D Cerebral Aneurysm Segmentation Figure 1
2026-08-11cs.CV

DINO-3DRA: Leveraging 2D Foundation Model Semantics for 3D Cerebral Aneurysm Segmentation

Jiayang Lu, Fengming Lin, Alejandro F. Frangi, Ali Sarrami-Foroushani

2026-08-11视觉感知三维

针对3DRA脑动脉瘤分割中病灶体素极少、与血管形态相近且缺少大规模3D预训练的问题,DINO-3DRA将冻结的DINOv3二维语义特征注入3D U-Net,并用Room-Lite恢复层间连续性、校准残差融合稳定跨维迁移。在多中心数据上Dice达0.758、HD95为2.75 mm,较nnU-Net提升13%,外部数据零微调时消除基线的低Dice失败案例。

Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation Figure 1
2026-08-11cs.CL

Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn, Katarzyna Kowol, Karolina Piosek, Wojciech Kusa

NASK National Research Institute, Warsaw, Poland

2026-08-11视觉语言视觉感知数据集/基准

针对英语中心训练导致VLM难以理解本地文化、符号和方言语境的问题,本文提出波兰单文化视觉语言基准PoVisLE,手工构建1117张图像和2366个VQA对,并强调问题需结合视觉证据、语言现象与文化知识多跳推理。对16个开放和闭源模型评测显示,最佳Qwen3.5-397B准确率为71.45%,方言和地域词最薄弱;去图或去问题消融表明任务不能仅靠文本先验或选项偏差解决。

XClipGS: Exact Half-Space Clipping for Medical Volume Gaussian Splatting Figure 1
2026-08-11cs.CV

XClipGS: Exact Half-Space Clipping for Medical Volume Gaussian Splatting

Zhongpai Gao, Benjamin Planche, Meng Zheng, Anwesa Choudhuri, Chaoyi Zhou, Terrence Chen, Ziyan Wu

2026-08-11三维

本文针对医学体数据高斯泼溅在交互裁剪时暴露未监督内部结构、且传统方法只能整粒保留或丢弃高斯的问题,提出在 affine EWA 模型下对半空间受限高斯做闭式逐 splat 积分,并用多距离、多平面裁剪视图监督内部。八个 CT/MRI 上其 PSNR 高于 ClipGS,渲染超过 650 FPS,切面 SSIM 提升且泄漏显著降低。

Rethinking 3D Segmentation from Individual LiDAR Scans: Incidence-Aware Sampling on the SIP Benchmark Figure 1
2026-08-11cs.CV

Rethinking 3D Segmentation from Individual LiDAR Scans: Incidence-Aware Sampling on the SIP Benchmark

Seongyong Kim, Jingdao Chen, Yong Kwon Cho

Graduate Student, School of Civil and Environmental Engineering, Georgia Institute of Technology, 790 Atlantic Dr., Atlanta, Assistant Professor, Department of Computer Science and Engineering, Mississippi State University, 665 George Perry St, Professor, School of Civil and Environmental Engineering, Georgia Institute of Technology, 790 Atlantic Dr., Atlanta, GA, large and curated datasets, with growing emphasis on scalable backbones and general-purpose

2026-08-11视觉感知数据集/基准三维

面向施工现场单站 LiDAR 扫描,论文指出常规下采样会保留大量平面冗余、削弱梯子等稀疏细结构,使采样本身成为分割瓶颈。其核心做法是在几何归一化流形空间按入射关系选点,再保留原欧氏坐标给下游模型。SIP 基准上,Point Transformer 和 PointNeXt 的跨分辨率 mIoU 提升,非平面类别尤其梯子增益更明显,并降低了对采样分辨率的敏感性。

Multi-Task Consistency-based Detection of Adversarial Attacks Figure 1
2026-08-11cs.CV

Multi-Task Consistency-based Detection of Adversarial Attacks

Cong Chen, Jean-Philippe Monteuuis, Jonathan Petit

2026-08-11视觉感知

面向自动驾驶视觉感知中对抗扰动难以及时、低成本发现的问题,论文提出利用多任务输出一致性来做反应式检测:比较目标检测与实例分割结果,并设计一致性分数和模型配对选择策略,以捕捉局部或全局攻击造成的跨任务不一致。在 BDD100k 上针对多种模型的 PGD 攻击评估中,方法报告 ROC-AUC 达 99.9%,但结果主要限于所设白盒攻击模型。

LoRSA: Toward Generalizable Parameter-Efficient Fine-Tuning for Biomedical Downstream Tasks Figure 1
2026-08-11cs.CV

LoRSA: Toward Generalizable Parameter-Efficient Fine-Tuning for Biomedical Downstream Tasks

Saed Moradi, Benyamin Ghojogh, M. Hadi Sepanj, Yimin Yang, Ashirbani Saha

Department of Oncology, McMaster University, Hamilton, Canada, Department of Systems Design Engineering, University of Waterloo, Waterloo, Canada, Department of Electrical and Computer Engineering, University of Waterloo, Waterloo, Canada., Department of Electrical and Computer Engineering, Western University, London, Canada

2026-08-11视觉感知

这篇论文针对医学视觉基础模型在小样本源域微调后易陷入狭窄低秩子空间、外部域泛化不足的问题,提出 LoRSA:同时学习密集低秩的全局适配与动态结构稀疏的残差低秩适配。实验以 DINOv3-Base 做乳腺密度四分类,在 MammosighTR 和 RSNA 外部集上分别较最强基线提升 2.15 和 3.09 个 macro-F1 百分点,并用权重子空间分析支持两类更新方向互补。

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning Figure 1
2026-08-11cs.CV

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

Saim Rehman, Muhammad Shafique

2026-08-11视觉语言视觉感知数据集/基准安全鲁棒

论文针对视觉语言模型在模糊、旋转、低对比度、裁剪等劣化输入下的科学推理脆弱性,提出 BRUCE 基准,通过渐进扰动协议、RCI/T-RCI 指标和分层失败 taxonomy 衡量鲁棒性退化。实验覆盖化学与数学数据集,指出干净准确率不能可靠预测腐蚀升级下表现,不同扰动会触发 OCR、空间、符号和语义等不同失败模式。

Ghost Features and Spooky Transfer Learning for Hypercomplex-Valued Neural Networks Figure 1
2026-08-11cs.CV

Ghost Features and Spooky Transfer Learning for Hypercomplex-Valued Neural Networks

Guilherme Vieira Neto, Marcos Eduardo Valle

2026-08-11视觉感知

该文针对超复值网络缺少预训练模型、难以利用迁移学习的问题,提出把已训练实值层嵌入超复层,使实部保持原输出,虚部产生由代数耦合诱导的“ghost features”,再通过“spooky transfer learning”注入下游网络。作者声称这些隐藏特征可带来更高效的网络和更丰富表示,但给定文本未充分说明具体实验增益、任务范围及增益来源。

Vision Meets WiFi: Physics-Grounded Estimation of Volumetric Mechanical Properties Figure 1
2026-08-11cs.CV

Vision Meets WiFi: Physics-Grounded Estimation of Volumetric Mechanical Properties

Ali Bahri, Hongliang Li, Soufiane Lamghari, Jie Chuai, Zhitang Chen

Huawei Noah’s Ark Lab, Canada, Huawei Noah’s Ark Lab, Hong Kong SAR, China

2026-08-11视觉感知

这篇论文针对仅凭视觉难以判断物体内部材料和力学参数的问题,提出 ViWi:用少量“材料槽”聚合属于同一材料的体素,并引入 WiFi 频段电磁仿真的 RF 描述符补充视觉缺失的全局组成线索。实验显示其在 GVM 体素级力学属性估计的 6 项指标中提升 4 项,并改善 ABO-500 真实物体质量估计,尤其在视觉歧义较强时收益更明显。

Tokenizer Generator Coupling in Medical Image Generation Figure 1
2026-08-11cs.CV

Tokenizer Generator Coupling in Medical Image Generation

Liam Chalcroft

University College London

2026-08-11视觉感知

这篇论文针对医学图像生成中常把 tokenizer 当作固定预处理的做法,系统考察 tokenizer、生成器与采样器是否可分开选择。作者在 ChestMNIST-64 上交叉比较 VQ/LFQ/FSQ、连续 AE/VAE、多类生成器和采样设置,发现最佳量化器会随生成器变化,重建 PSNR 不能可靠预测生成质量;提出 neighbour-conditional predictive gain 作为无生成器的 modelability 指标。主要结果是 LFQ-1024 在默认离散网格中较强,但调参后的 D3PM/SE-D3PM 可把 FID-192 从约 0.44/0.41 降到 0.09/0.10,结论仅限低分辨率、无条件、非临床 FID 评估。

SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models Figure 1
2026-08-11cs.CV

SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models

Ziqiao Yu

2026-08-11强化学习

论文针对世界模型部署后动力学变化与语义表征稳定性的冲突:直接微调会改写共享表示,完全冻结又无法适应。SpikeWorld将多模态脉冲世界模型训练与部署期外部快状态分离,用预测残差更新动作校正和下一状态残差而不改权重。结果显示联合训练降低动作预测误差,并在剪切、衰减扰动及Meta-World闭环中提升预测、跟踪和冻结策略奖励;但线性衰减上RLS更强,说明贡献主要是冻结多模态模型中的适配集成。

CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting Figure 1
2026-08-11cs.CV

CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting

Quang Minh Dinh, Tuan Kiet Doan

2026-08-11视觉感知生成模型强化学习

面向自动驾驶场景中长时序、文本条件交通视频预测的时空一致性与安全仿真需求,CosmosAlign认为关键不在扩大世界模型容量,而在让预训练Cosmos3-Nano与下游分布对齐。方法采用两阶段LoRA对齐条件模式和结构化提示,并在推理端用一致性medoid选样与运动自适应静态区域融合提升稳定性;在AI City Challenge 2026 Track 5取得76.49总分并排名第一。

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding Figure 1
2026-08-11cs.CV

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

2026-08-11视觉感知

这篇论文针对小时到天级视频中端到端送入 MLLM 成本过高、预先构建层级或图记忆又可能与查询不匹配的问题,提出 MERIT:在构建阶段保留细粒度片段并用多种语义 key 提高召回,在推理时只围绕命中片段做邻域扩展和查询相关过滤。结果显示,该简化记忆流程在 EgoLifeQA、LVBench 和 Video-MME Long 上达到 SOTA,并降低了复杂全局记忆构建开销。

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography Figure 1
2026-08-11cs.AI

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

Jalil Jalili, Hossein Taghizad, Anuwat Jiravarnsirikul, Christopher Bowd, Akram Belghith, Raheleh Kafieh, Christopher A. Girkin, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

Division of Ophthalmology Informatics and Data Science, Viterbi Family Department of Ophthalmology, Shiley Eye Institute, University of California, San Diego, La Jolla, CA, USA., Hamilton Glaucoma Center, Viterbi Family Department of Ophthalmology, Shiley Eye Institute, University of California, San Diego, La Jolla, CA, USA, Department of Electrical and Computer Engineering, University of Quebec at Trois-Rivières, Trois-, Faculty of Medicine Siriraj Hospital, Department of Ophthalmology, Mahidol University, Bangkok, Department of Engineering, Durham University, South Road, Durham DH1 3LE, UK, CAG: F: National Eye Institute, EyeSight Foundation of Alabama, Research to Prevent Blindness, F: Centervue, Optina, Machine MD, iCare, NEI, NIMHD, RPB, LMZ: F: The Glaucoma Foundation, The National Institutes of Health, The National Eye, Institute, Heidelberg Engineering GmbH, Topcon Medical Systems Inc. and nonfinancial

2026-08-11视觉感知模仿学习

这篇论文针对多模态 LLM 在眼底青光眼筛查中易幻觉、准确率有限且重复运行不稳定的问题,将 LLM 从直接判读者改为调度者,调用图像质量评估、青光眼分类和视盘/视杯分割模型后再反思整合。实验显示该 agentic 流程在 ORIGA 与 RIM-ONE-v3 上使分类准确率提升 16–47 个百分点,CDR 误差下降 15–50%,一致性最高达 κ=0.96,接近专科医生水平。

Data collection from highways: a geometric, class-agnostic approach to embedded vehicle counting Figure 1
2026-08-11cs.CV

Data collection from highways: a geometric, class-agnostic approach to embedded vehicle counting

Lucas Gouveia Omena Lopes, William W. M. Lira, Alexandre M. Lima, Thales M. A. Vieira

2026-08-11视觉感知

本文针对边缘设备上缺少已训练目标检测器、算力和功耗受限时的高速路车流采集问题,提出不做车辆识别和轨迹跟踪的几何计数:用背景减除获得运动前景,在道路虚拟线圈/车道占用边缘上直接计数,并用 blob 统计自校准车道几何。实验显示该方法在四段视频上达到 83.3%–100% 计数准确率,实地部署为 91%,明显高于同算力下 37.5% 的 blob 跟踪基线。

HeatCast: A Benchmark for Neighborhood-Scale LST Forecasting across 124 U.S. Cities Figure 1
2026-08-11cs.CV

HeatCast: A Benchmark for Neighborhood-Scale LST Forecasting across 124 U.S. Cities

Jesus Guerrero, Isaac Corley, Leon Najafirad, Maryam Tabar, Paul Rad

University of Texas at San Antonio, University of Texas at San Antonio San Antonio TX USA

2026-08-11数据集/基准

城市热风险需要街区尺度预测,但现有 LST 研究多局限于少数城市、粗分辨率或不可复现。HeatCast 提供覆盖 124 个美国城市、2013 至 2025 年、30 米月度 Landsat 的开放基准,含固定时序划分、LCZ 分层评估和代码权重。结果显示 Earthformer 将 RMSE 从 CNN+LSTM 的 10.42 K 降至 7.74 K,且非 LST 辅助通道单独预测达 7.72 K,提示地表形态与光谱信息是主要信号。

Adversarial Attacks on Deep OCR Systems Figure 1
2026-08-11cs.CR

Adversarial Attacks on Deep OCR Systems

Wenbo Sun, Hongzong LI, Yanyun Wang, Jiahao MA, Shuxin Zhuang, Rong Feng, Shiqin Tang, Zi Liang

Nanjing University of Aeronautics and Astronautics, Northwestern Polytechnical University, The Chinese University of Hong Kong, The University of Hong Kong, City University of Hong Kong, Centre for Artificial Intelligence and Robotics, Chinese Academy of Sciences, The Hong Kong Polytechnic University

2026-08-11视觉感知

这篇论文关注生成式 OCR 被用于数据库、检索和智能体后,文本转写错误可能带来的安全风险。作者将仅能查询输出字符串的 Deep-OCR 攻击建模为零阶优化,用序列相似度构造有界损失,并以随机方向有限差分和投影 Adam 在不可见扰动预算内搜索。试验验证了端到端评测流程并暴露重复、截断、提示泄漏等失效,但正式小规模 pilot 尚未达到严格攻击成功阈值,定向改写也未成功,因此有效性结论仍受限。

JUMP-lite: Compact, reproducible benchmarking of cell representations Figure 1
2026-08-11q-bio.QM

JUMP-lite: Compact, reproducible benchmarking of cell representations

Alán F. Muñoz, Johan Fredin Haslum, Runxi Shen, Anne E. Carpenter, Shantanu Singh

Broad Institute of MIT and Harvard, Cambridge, MA 02142, USA

2026-08-11数据集/基准

这篇论文针对 Cell Painting 数据规模过大、评测流程割裂导致细胞表征方法难以公平比较的问题,构建了 116GB 的 JUMP-lite 子集和 Nahual 部署框架,并系统评估 JPEG XL 有损压缩影响。结果显示中高质量压缩基本保留生物信号,CellProfiler 与 MorphEM 表现最强,深度模型在速度上有明显优势。

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models Figure 1
2026-08-11cs.AI

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

Hsu-kuang Chiu, Stephen F. Smith

2026-08-11视觉语言视觉感知数据集/基准

论文针对现有端到端 VLA 自动驾驶多聚焦单车、难以在部分可观测场景中协同感知与规划的问题,提出 CMU-Drive 闭环多车基准,并引入 V2V-VLA 在一次前向推理中联合生成控制、轨迹、语言推理和通信策略。基准覆盖 220 条安全关键路线、最多 16 辆联网车且单 GPU 可评测;实验显示 V2V-VLA 相比基线取得更高驾驶分数和成功率。

FlowErase-OPD: Multi-Concept Erasure via Anchored On-Policy Distillation in Flow Matching Models Figure 1
2026-08-11cs.CV

FlowErase-OPD: Multi-Concept Erasure via Anchored On-Policy Distillation in Flow Matching Models

Yi Sun, Yimin Zhou, Xinhao Zhong, Zhiqi Zhang, Junhao Li, Bin Chen

2026-08-11生成模型强化学习

针对 Flux 等 flow matching 文生图模型中多概念擦除难以兼顾安全性与生成质量的问题,FlowErase-OPD 将多个单概念擦除教师通过 on-policy distillation 合并为一个 LoRA,并用保留教师与自适应权重调度平衡擦除和保真。实验覆盖裸露、物体和艺术风格擦除,显示其在擦除率、FID、CLIP 及对抗鲁棒性上优于或接近现有方法,但增益中各组件贡献仍主要依赖消融结果支撑。

HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers Figure 1
2026-08-11cs.CV

HSMLA: Hierarchical Softmax Multi-scale Linear Attention for Efficient Vision Transformers

Dong Liu, Yanxuan Yu, Renata Borovica-Gajic, Ying Nian Wu

2026-08-11视觉感知

本文针对高分辨率密集预测中 ViT 自注意力开销过高、线性注意力又削弱局部边界建模的问题,提出 HSMLA:以多尺度 ReLU 线性注意力覆盖全局上下文,仅对内容判定的关键 token/区域执行稀疏 softmax 精修,并用深度卷积增强局部表征。实验称其在分割、超分和医学影像任务上取得最高约 4.2 倍推理加速,CT 器官分割 Dice 87.3%、病理 WSI AUC 94.2%,但具体增益中架构、数据与实现优化的贡献仍需看完整消融。

NewtonGS: Physics-Structured Object-Level Neural Newtonian Dynamics for Gaussian Scene Animation Figure 1
2026-08-11cs.CV

NewtonGS: Physics-Structured Object-Level Neural Newtonian Dynamics for Gaussian Scene Animation

Lianlei Shan, Feiyang Ye, Yan Chen, Yong Wu

2026-08-11三维

NewtonGS针对静态3D Gaussian资产缺少可编辑物体级动力状态的问题,将每个物体表示为含位姿、速度、尺度和接触属性的22维状态,并用解析牛顿动力学、四元数运动、离散地面接触与可学习残差联合滚动,再统一变换对象内所有Gaussian。实验在程序生成的State-32与Gaussian-32上验证,较五个解析基线降低轨迹、终点和速度误差,但真实场景与复杂交互仍文中未充分说明。

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding Figure 1
2026-08-11cs.RO

LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding

Zhewei Zhang, Puyue Wang, Guanren Qiao, Yijie Weng, Jiawei Hu, Guo Li, Lujia Wang, Junyan Wang, Tao Gu, Hongliang Lu, Guiliang Liu, Hong Jia, Xinhu Zheng

2026-08-11视觉语言视觉感知

本文关注 VLA 中被忽视的 VLM 到动作解码器接口:只用末层或一对一层对齐会限制不同深度任务信息的互补利用。LIRA 将该接口重述为深度感知路由,让每个融合块从对应层附近的局部窗口聚合 LIRA Query,同时保留任务 token 对齐且不改主干和训练流程。在 0.5B 配置下,其在 LIBERO、CALVIN、LIBERO-Plus 和真机任务上优于 VLA-Adapter,零样本 LIBERO-Plus 成功率由 59.1% 提升到 78.0%。

MAGIC-SSCIL: Manifold Anchoring and Geometric Incremental Calibration for Semi-Supervised Class Incremental Learning Figure 1
2026-08-11cs.CV

MAGIC-SSCIL: Manifold Anchoring and Geometric Incremental Calibration for Semi-Supervised Class Incremental Learning

Yousef Abdi, Mohammad Asadpour, Yousef Seyfari

forget catastrophically due to feature drift, and their pseudo-labels become increasingly unreliable, as the label space grows. In this paper, we propose MAGIC (Manifold Anchoring and Geometric, MAGIC's design centers on two components. The first is Soft-Weighted Geometry Calibration, (SWGC), which uses graph-based label propagation on the learner's plastic feature space to weight, plastic adapter. Across CIFAR-100, CUB-200, and ImageNet-R, at label ratios of 1%, 5%, and, low-label setting, where confidence thresholding fails most clearly., supervised learning, Label propagation, a Faculty of Electrical and Computer Engineering, Universityof Tabriz, Tabriz, Iran, c Faculty of Engineering, University of Maragheh, Maragheh,Iran, Learning (Task-IL), a task identifier is available at inference, which allows task-specific, while the label set stays fixed. The most demanding and realistic setting is Class-Incremental, defined labels, new product types, or previously unseen species in ecological monitoring. It is also

2026-08-11视觉感知

这篇论文面向无样本保存、标注极少的半监督类增量学习,解决特征漂移和伪标签随类别增多而失效的问题。MAGIC用图标签传播替代置信度阈值,并以SWGC校准冻结骨干上的类统计、用GSA约束表示几何,生成旧类幻影特征。实验在CIFAR-100、CUB-200和ImageNet-R的1%/5%/10%标注率下优于多种CIL+FixMatch和SSCIL基线,低标注细粒度场景收益最明显。

LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents Figure 1
2026-08-11cs.CV

LAVE: Latent Visual Evidence-Enhanced Planning for Video Tool-use Agents

Zijian Wang, Junnan Zhu, Rongzhen Li, Xiao Liu, Guohui Xiang, Quan Lu, Lijia Liu, Yining Wang, Jiang Zhong, Kaiwen Wei

2026-08-11视觉感知规划控制

长视频工具型智能体通常把视觉工具结果压缩成文字,导致未被语言化的视觉证据在后续规划中丢失。LAVE的核心洞察是保留工具前向过程中的时序定位潜在视觉证据,并以双通道接口在规划阶段按需检索复用,而不训练、不回放帧。实验在Video-MME、LongVideoBench和CG-Bench上均有提升,Video-MME在相近帧预算下较最强基线提高3.76分。

ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making Figure 1
2026-08-11cs.CV

ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making

Ningxin Pan, Hanyu Li, Yehui Tang

2026-08-11视觉语言视觉感知强化学习数据集/基准

这篇论文关注 VLM 从“看懂图像”到“基于图像做出全局有效决策”的能力缺口,提出 ComplexityWorld:用隐藏结构生成任务、渲染成多样视觉场景,并用可执行验证器接受任意可行解。390 个任务覆盖 39 个视觉世界和 29 类决策。结果显示多数模型直接看图 VAR 低于 40%,GPT-5.6-Sol 为 75.6%;显式结构输入显著提升且等价视觉呈现差异最高达 38.3 点,说明瓶颈主要在视觉证据组织到决策结构的转换,agent scaffold 增益较小且依模型而异。

Predictive Failure Detection in Network Hardware Using Thermal Imaging and Deep Learning with Sensor Fusion Figure 1
2026-08-11cs.CV

Predictive Failure Detection in Network Hardware Using Thermal Imaging and Deep Learning with Sensor Fusion

Ashly Joseph

2026-08-11视觉感知

面向数据中心网络设备故障会造成停机、且热异常和功耗波动常先于失效出现的问题,本文用热成像结合功率传感序列做三类状态预测,并比较预训练 CNN 与 CNN-LSTM 融合模型。核心洞察是 ROI 裁剪、归一化与传感器融合对效果影响很大:ResNet-50 由原始输入的 52% 提升到 91%,融合模型达到 94%。但数据为模拟生成,真实设备迁移性文中未充分说明。

Multi-Branch Policy Optimization for Multimodal Large Language Models Figure 1
2026-08-11cs.CV

Multi-Branch Policy Optimization for Multimodal Large Language Models

Shuai Lyu, Yuning Gong, Ruiling Gao, Xiaoran Shang, Zhonghong Ou, Ping Zong, Yifan Zhu, Yuan Sun, Yang Qin, Peng Hu

Beijing University of Posts and Telecommunications, Sichuan University, Shanghai University, Huawei Technologies Ltd., Beijing University of Posts and Telecommunications Beijing China, Sichuan University Chengdu China, Shanghai University Shanghai China, Huawei Technologies Ltd. Shenzhen China

2026-08-11视觉语言强化学习优化算法

这篇论文针对多模态大模型强化学习中轨迹级优势分配过粗的问题:视觉理解存在多种可能解释,单一路径奖励会稀释关键感知与推理片段的学习信号。作者提出 MBPO,在视觉-语言决策点构造推理树,用兄弟分支相对优势做片段级信用分配,并用时序回放缓冲复用有效片段。实验显示其在 Geometry3K、MMK12 及多个域外基准上优于 GRPO、DAPO 等基线,训练信号更稳定,但额外训练成本较高。

Real-time physics inversion for retrieval of sub-pixel wildfire temperatures from VSWIR imaging spectroscopy Figure 1
2026-08-11cs.CV

Real-time physics inversion for retrieval of sub-pixel wildfire temperatures from VSWIR imaging spectroscopy

William R. Keely, Philip G. Brodrick, Katherine Mistick, Adam Chlus, Robert O. Green, Philip E. Dennison

2026-08-11视觉感知

论文针对现有火点温度反演依赖单一或少数温度端元、易受大气残差、饱和波段和空间分辨率影响的问题,提出面向 VSWIR 成像光谱的全物理前向模型反演,将太阳反射与热辐射联合拟合,并用两组分高斯描述亚像元内的明火/阴燃温度分布,在机载 GPU 上实现飞行节奏内估计。实验在模拟注入热信号上达到 41.8 K RMSE,在 168 次 AVIRIS-3 火场过境中 SWIR 残差不超过 10%,并在粗化到类星载分辨率时保持约 27.16 K 的平均绝对误差。

Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real Figure 1
2026-08-11cs.CV

Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real

Abdullah Naeem, Anav Katwal, Ayon Dey, Noman Khan, Md Tamjidul Hoque

2026-08-11视觉感知三维

本文针对仓库多摄像头三维跟踪在 Sim2Real 场景下推理不能使用深度的问题,比较显式几何提升与单目估计深度伪 LiDAR 两条 RGB-only 路线。核心洞察是跨视角几何一致性比单帧深度精度更关键:基于 YOLO11x、标定单应性、尺寸先验和离线轨迹拼接的方案达到 13.0 3D HOTA,而伪 LiDAR 仅 0.12,失败主要来自多视角深度尺度与定位不一致。

Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects Figure 1
2026-08-11cs.CV

Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects

Felix Schaller

2026-08-11强化学习安全鲁棒

针对自动驾驶封闭类别检测器会把未知道路物体强行误判或漏检的问题,论文把层级语义分类与类别无关区域提议结合,用CLIP叶节点打分向上聚合,并以安全下限决定输出粗类或未知障碍。在7个COCO留出类、235个真实目标上,平面分类头100%给出自信错误标签,而该层级方法无自信细类错误,94%被安全处理,但69%选择保守拒识,说明安全性提升以特异性为代价。

Beyond Isotropic Assumptions: Continuity-Constrained Segmentation and GPU Morphometry for Nanoscale GBM Analysis Figure 1
2026-08-11cs.CV

Beyond Isotropic Assumptions: Continuity-Constrained Segmentation and GPU Morphometry for Nanoscale GBM Analysis

Arash Fatehi, Robin Ebbestad, Linus Butt, Hans Blom, Sigrid Lundberg, Hannes Olauson, Hjalmar Brismar, David Unnersjö-Jess, Thomas Benzing, Katarzyna Bozek

A. Fatehi and K. Bozek are with the Institute for Biomedical Informatics, Faculty of Medicine and University Hospital Cologne, University of Cologne, Center for Molecular Medicine Cologne (CMMC), University of Cologne, Faculty of, Medicine and University Hospital Cologne, Cologne, Germany.D. Unnersjö-Jess, L. Butt, and T. Benzing are with Department II of Internal, Medicine, University of Cologne, Faculty of Medicine and University Hospital, University of Cologne, Faculty of Medicine and University Hospital Cologne, Cologne, Germany.D. Unnersjö-Jess is also with MedTechLabs, Karolinska University, the Division of Renal Medicine, Department of Clinical, Sciences, Intervention and Technology, Karolinska Institutet, Stockholm, Sweden, and the Science for Life Laboratory, Department of Applied Physics, Royal, Institute of Technology (KTH), Solna, Sweden.R. Ebbestad and H. Brismar are with the Science for Life Laboratory, Department of Women’s and Children’s Health, Karolinska Institutet, Solna, Sweden.H. Brismar is also with the Science for Life Laboratory, Department of

2026-08-11视觉感知

针对各向异性共聚焦体数据中轴向欠采样导致薄膜结构断裂、且上采样标注成本过高的问题,论文在原始采集网格上训练3D U-Net/SwinUNETR,通过随机旋转补足轴向连续性并加入z轴连续性损失,再用GPU射线-表面相交做GBM厚度测量。结果显示分割精度接近专家一致性,可减少台阶伪影并捕捉病变肾小球基底膜增厚。

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion Figure 1
2026-08-11cs.CV

Multimodal Skin Lesion Classification with Swin Transformer and Clinical Metadata Fusion

Nethmi Pathirana, Isuru Munasinghe, Dileeka Alwis

2026-08-11视觉语言

针对皮肤病灶图像中类别不均衡、相似病灶难区分且缺少临床上下文的问题,论文将 Swin Transformer 的皮肤镜图像特征与年龄、性别、部位等结构化元数据融合,并加入类别加权、温度校准、不确定性估计和可解释性分析。在 HAM10000 上报告 92.55% 准确率和 91.33% macro F1,少数类表现较强,但外部验证与相对单模态增益仍需更多说明。

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference Figure 1
2026-08-11cs.CV

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference

Jinlong Yang, Jinke Wu, Lizilin, Yao Zhou

Sichuan University, School of Artificial Intelligence, Sichuan University, Sichuan University Chengdu China, School of Artificial Intelligence, Sichuan University Chengdu China

2026-08-11生成模型

这篇论文针对扩散 Transformer 推理中高倍加速易失真的问题,指出 DiT 特征轨迹虽整体平滑但存在尖锐局部不规则,使基于导数的多项式外推在长步预测时易振荡或漂移。BRACE 改用滑动窗口缓存的历史特征构造带 Chebyshev 权重的重心有理预测,避免不稳定导数估计。实验称其在 DiT-XL/2、FLUX.1-dev、HunyuanVideo 等模型上以很小额外开销取得更好的质量-效率权衡。

A Review of Vision-Based Vehicle Detection for UAV-Based Traffic Monitoring: Experimental Insights and Future Directions Figure 1
2026-08-11cs.CV

A Review of Vision-Based Vehicle Detection for UAV-Based Traffic Monitoring: Experimental Insights and Future Directions

Jianlin Ye, Christos Kyrkou

2026-08-11视觉感知

面向固定路侧设施难以覆盖动态交通、无人机又受尺度变化、运动成像和算力延迟约束的问题,本文综述无人机交通监测中的视觉车辆检测,重点梳理YOLO等深度模型、数据集、部署约束与多机融合。核心洞察是检测精度不能单独评价,需与实时边缘处理、交通控制系统兼容性和跨无人机跟踪共同考虑;文中还通过若干数据集比较实验支撑模型取舍,但具体增益来源未充分说明。

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping Figure 1
2026-08-11cs.CV

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

Rui Yang, Wei Zhou, Dingyong Gou, Xiaohui Cui, Cong Li, Yinyin Gong, Yipo Huang, Jiliang Zhao

State Key Laboratory of Mobile Network and Mobile Multimedia Technology, ZTE Corporation, School of Data Science and Institute of Artificial Intelligence, Chang’an University, State Key Laboratory of Mobile Network and Mobile Multimedia Technology, ZTE Corporation Shenzhen China, School of Data Science and Institute of Artificial Intelligence, Chang’an University Xi’an China

2026-08-11视觉感知数据集/基准

针对现有可解释美学裁剪多把解释作为事后文本、缺少构图依据的问题,COMEX将任务重构为“裁剪框—构图类别—解释”的联合预测,并用扩图与IO反转构建3.3万组带构图标注的数据,再以SFT+GRPO优化裁剪、构图一致性和解释忠实度。实验显示其在COMEX及既有裁剪基准上优于多种LVLM和裁剪方法,但数据依赖合成外扩与专有模型标注,可能带来域偏差。

Latent-Frequency Validity: Fast Spectral Editing with Screened Video-VAE Transfer Operators Figure 1
2026-08-11cs.CV

Latent-Frequency Validity: Fast Spectral Editing with Screened Video-VAE Transfer Operators

Bowen Xue, Jiafeng Xiong, Xin Quan

2026-08-11视觉感知生成模型

论文针对视频 VAE 中直接做频谱编辑虽快、却可能因像素频段在潜空间跨通道重分布而失真的问题,提出 LFV:用目标保真度和往返漂移共同筛选从逐通道校准到全通道混合的潜频率算子。544 个 VAE-编辑单元中生成 423 个低成本算子,约三分之一需要通道混合,速度约为像素滤波再编码的 3 倍,并揭示不同 VAE 的频谱耦合与稳定性边界。

Temporal Generalization in fNIRS-Based Autism Classification: A Cross-Time-Window Transfer Benchmark Figure 1
2026-08-11cs.CV

Temporal Generalization in fNIRS-Based Autism Classification: A Cross-Time-Window Transfer Benchmark

Marios Petrov, Sahana Vinayak, Targol Bakhtiarvand, Moses Smith Guddah, Adham Atyabi, Frederick Shic, Kevin A. Pelphrey

2026-08-11学习理论数据集/基准

本文针对 fNIRS 自闭症分类中常被忽略的时间窗错位问题:不同受试者血流反应延迟不同,使固定窗口训练的模型部署时失效。作者将其定义为跨时间窗迁移基准,把 fNIRS 转为拓扑图并比较视觉模型与多种适应策略。结果显示零样本跨窗仅54–69%,约5%个体微调可达90–96%,无个体数据的对抗/自监督方法也有78–90%,且2.5秒短窗已含可用判别信息。

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems Figure 1
2026-08-11cs.CV

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

Zhijing Zhang, Jinpeng Yu, Xin Song, Bingnan Li, Chuyue Li, Changhui Du, Xiaolin Fang, Jiaming Liu, Ruihua Huang

Southeast University

2026-08-11视觉感知

本文关注图像创作对话中的下一步编辑建议:多数后续需求依赖当前图像,纯文本推荐难以保证可执行性。核心做法是用人工意图表构造SFT目标,再用位置校正点击偏好和多目标GRPO对齐用户选择,并加入图像优先的source-target验证器约束视觉一致性。在线A/B显示CTR提升32.70%、取图率提升16.32%、人均轮次提升39.90%,视觉不一致率从3.7%降至0.9%。

Coarse-to-Fine Registration of Jawbone CT and Intraoral Scan Data Using GeDi and ICP with Pseudo-IOS Ground Truth Figure 1
2026-08-11eess.IV

Coarse-to-Fine Registration of Jawbone CT and Intraoral Scan Data Using GeDi and ICP with Pseudo-IOS Ground Truth

Sho Mitarai, Hikaru Kayo, Hisashi Ozaki, Yuichiro Imai, Megumi Nakao

* School of Human Health Sciences, Graduate School of Medicine, Kyoto University, Kyoto, Japan., ** Department of Oral and Maxillofacial Surgery, Rakuwakai Otowa Hospital, Kyoto, Japan., corresponding points, techniques that are laborious and, has thus been essentially unavailable for this task.

2026-08-11视觉感知

针对牙颌 CT 与口内扫描因重叠区域有限、缺乏真实对应而难以自动配准和量化评估的问题,论文用同坐标系 CT 生成 pseudo-IOS 作为可知真值,并采用 GeDi 全局匹配加 ICP 局部细化。7 例实验中,ICP 单独易陷入局部最优,GeDi+ICP 在上下颌及金属伪影条件下保持 0.55–0.69 mm MAE,伪影影响存在但幅度较小。

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation Figure 1
2026-08-11cs.CV

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

Department. of Civil & Environmental, Wayne State University, Department of Civil & Environmental Engineering, Institute for AI and Data Science (AIDaS), Department of Computer Science, interpretability: combining linear probing, logit lens, centered, centered kernel alignment (CKA) [18], and cross-attention, labels is scarce, dangerous to collect, and impossible to control, weather conditions, yielding 1,725,712 labeled images. The

2026-08-11视觉语言视觉感知

面向城市积水中道路通行、EV/AV安全对厘米级水深感知的需求,论文用UE5生成281万张合成图并微调LLaMA 3.2-Vision;其关键点不是单纯全量调参,而是用线性探针、logit lens、CKA和注意力熵定位L23等关键跨注意力层,只微调5–6层。Dense模型MAE达0.40 cm,MI6以约86–88%更少可训练参数在真实300图测试上优于STURM基线。

XEns-CKD: An Explainable Ensemble-Based Approach for Chronic Kidney Disease Stage Detection Figure 1
2026-08-11cs.CV

XEns-CKD: An Explainable Ensemble-Based Approach for Chronic Kidney Disease Stage Detection

Rehan Ahmad, Gousia Habib, Muhammad Shaban, Ishfaq Ahmad Malik

SVKM’s, NMIMS, Mukesh Patel School of Technology Management and Engineering, Shirpur, Maharashtra, India., *2FCAI Fellow University of Helsinki and ELLIS Institute Helsinki, Finland, COER University, Roorkee, India, Shoolini University Solan Himachal Pradesh, India

2026-08-11视觉感知

针对 CKD 早期分期依赖 GFR 检测且侵入、耗时的问题,本文用超声图像训练三个参数配置不同的 ViT,并通过集成聚合完成正常及 1–5 期分类,同时结合 LIME、LRP 与注意力图标出疑似受累肾区。私有数据集上总体准确率为 86.36%,较文中对比方法提升约 4%,但增益来源不清,且数据私有使泛化判断受限。

MVMD: A Multi-View Approach for Enhanced Mirror Detection Figure 1
2026-08-11cs.CV

MVMD: A Multi-View Approach for Enhanced Mirror Detection

Yidan Shen, Yu Wen, Chen Zhang, Xin Fu, Renjie Hu

University of Houston

2026-08-11视觉感知

MVMD针对镜面反射会在多视角三维重建中制造虚假物体和几何扭曲的问题,把镜面检测从单图扩展到仅用RGB的多视角输入。其核心洞察是利用视角变化下镜内外物体运动差异及镜像对称关系,通过跨/自注意力的视间、视内模块和边界细化模块建模,并构建98场景、3181图像的数据集。实验相比单图方法准确率最高提升2.6%、IoU最高提升11.1%。

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning Figure 1
2026-08-11cs.RO

Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning

Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang

2026-08-11机器人

该综述针对接触敏感操作中视觉中心方法难以处理遮挡、形变与力调节的问题,提出 TF-ART 分类框架,将力觉/触觉、多模态融合、动作生成、动作细化和低层控制放到同一信息流中比较。主要结果是系统梳理近期方法如何在不同阶段引入接触反馈,并总结任务、传感器与硬件约束;文中未充分说明该框架带来的定量性能增益。

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization Figure 1
2026-08-11cs.RO

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

Peng Xu, Chengcheng Wang, Shaohua Wan

2026-08-11机器人优化算法

面向无人机视觉语言导航的边缘部署瓶颈,论文指出感知分辨率比语言模型规模更关键:2B 模型配高保真视觉输入可接近 7B 基线。为解决行为克隆在 OOD 场景碰撞率高的问题,AeroDPO 用仿真回滚、特权干预和视觉语言过滤自动生成偏好对,无需人工标注;在 TravelUAV 未建图场景成功率达 49.16%,并显著降低碰撞率。

Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models Figure 1
2026-08-11cs.CV

Impact of Dataset Composition on Embedded Real-Time UAV Wildfire Detection Using Compact YOLO Models

Eduardo de los Santos, Andre S. Kelbouscas, Ricardo B. Grando, Bruna V. Guterres

2026-08-11视觉感知数据集/基准

本文关注无人机野火早期检测中真实航拍标注数据稀缺、嵌入式算力受限的问题,不再改进检测器结构,而是用紧凑 YOLO 作为统一验证器,对比真实、增强、真实+AI合成及其增强四类训练集。结果显示,真实未增强数据在召回率与 mAP 的部署权衡上最好,合成扩充和常规增强未带来更优选择,说明该场景下数据真实性与域匹配比单纯扩规模更关键。

Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions Figure 1
2026-08-11cs.CV

Auditing Medical Vision-Language Models on Chest Radiographs: Estimating Reference Agreement Across Institutions

Pengyang Yu, Yiou Wang, Zhongping Dong, Sahraoui Dhelim, Chun-Mei Feng, M. Tahar Kechadi

2026-08-11视觉语言视觉感知

这篇论文关注胸片医疗视觉语言模型只给离散结论、缺少置信度时,医院如何判断其本地参考一致性。作者在三家机构数据、三种VLM、六类发现和两种提问接口上做严格机构留出评估,发现错误模式随机构、发现和接口显著变化;自适应选择估计器未优于简单固定方法,Beta-Binomial与目标端逻辑模型Brier约0.085且难分高下,95%区间实际覆盖仅87%,说明可靠性需按站点和接口重新审计。

P2Voxel: Pyramid Pivot Voxelization for 3D Mesh Tokenization Figure 1
2026-08-11cs.CV

P2Voxel: Pyramid Pivot Voxelization for 3D Mesh Tokenization

Zhenhong Sun, Haozhe Liu, Yifu Wang, Xibin Song, Senbo Wang, Huadong Mo, Daoyi Dong, Hongdong Li, Pan Ji

Australian National University, Vertex Lab, University of New South Wales, University of Technology Sydney, Equal Contribution. Work done during an internship at Vertex Lab.Corresponding authors.

2026-08-11三维

这篇论文针对三角网格拓扑不规则、难以作为紧凑可学习 token 的问题,提出 P2Voxel:把每个活跃体素编码为表面 pivot 点和方向符号,并用金字塔策略只在高曲率、薄结构等复杂区域细化,再以 Pyramid VAE 学习局部可重建块。实验称其在 ABO、Objaverse 和 Wild 上以更少 primitives 达到有竞争力的重建质量,但生成建模收益仍待进一步验证。

SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments Figure 1
2026-08-11cs.RO

SC$^{2}$-WM: A Self-Correcting World Model with Closed-Loop Feedback for Vision-and-Language Navigation in Continuous Environments

Xuan Yao, Yuze Zhu, Junyu Gao, Zongmeng Wang, Changsheng Xu

2026-08-11机器人视觉感知强化学习

本文针对连续环境视觉语言导航中开环策略易累积状态漂移、外部奖励又稀疏的问题,提出 SC2-WM,用世界模型的前瞻预测与当前潜状态差异构造内部反馈,在执行前做状态级计划修正,并在测试时按条件更新世界模型。实验显示其在标准 VLN-CE 基准和真实部署中提升导航鲁棒性与泛化,但具体增益来源仍需结合消融细节判断。

Learning an Interior Layout Policy in a Domain Specific Language Action Space Figure 1
2026-08-11cs.CV

Learning an Interior Layout Policy in a Domain Specific Language Action Space

Yuhao Lu, Weichen Zhang, Wenyi Xiao, Haohui Chen, Yiyun Fei

2026-08-11强化学习

针对室内布局生成常把房间简化为包围盒、直接回归坐标而难以表达门窗等结构约束的问题,本文将布局决策转为可解释的 DSL 动作序列,并构建 3D-FrontDSL 进行监督微调,再用碰撞、越界、可达性和设计逻辑等奖励做 GRPO 强化学习。实验显示,微调后的 4B LLM 在空间合理性和设计逻辑上优于强基线及少样本大模型。

Performance of large language models in the optical diagnosis of colorectal polyps Figure 1
2026-08-11cs.CV

Performance of large language models in the optical diagnosis of colorectal polyps

Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V.G.L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles Ménard, Joshua Landy, Samir C. Grover

Scarborough Health Network Research Institute, Toronto, Ontario, Canada, Division of Gastroenterology, Hepatology and Nutrition, and The SickKids Learning and Research Institutes, The Hospital, Department of Paediatrics, Temerty Faculty of Medicine, University of Toronto, Toronto, Ontario, Canada, Division of Gastroenterology, University of Calgary, Division of Gastroenterology, Department of Medicine, Queen’s University and Kingston Health Sciences Centre, Department of Medicine, University of Toronto, Toronto, Ontario, Canada, Université de Montréal, Department of Medicine, Montreal, Quebec, Canada, Centre de Recherche du Centre hospitalier de l’Université de Montréal (CRCHUM), Montreal, Quebec, Canada, Interventional and Experimental Endoscopy (InExEn), Department of Internal Medicine II, University Hospital Würzburg, Centre Hospitalier Universitaire de Sherbrooke, Division of Gastroenterology, Sherbrooke, Quebec, Canada, Division of Gastroenterology and Hepatology, University of Toronto, Toronto, Ontario, Canada, Scarborough Health Network Research Institute

2026-08-11视觉感知

结直肠息肉的内镜光学诊断直接影响切除策略和随访,但医生间一致性有限。本文将五个多模态大模型放到PRIME白光/NBI图像集上,对Paris、NICE和组织学预测做专家对照评估,核心洞察是通用MLLM已能较好区分肿瘤性与非肿瘤性息肉,但细分类仍弱。结果显示各模型二分类F1均超过0.9,Gemini 2.5 Pro在侵袭性和腺瘤分级上最好,Claude Opus 4/GPT-5的Paris正确率最高为41.7%,整体仍未达到ESGE临床阈值。

NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages Figure 1
2026-08-11cs.CV

NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages

Yiyao Chen, Yucheng Li, Jungong Tong, Shaoqi Wang, Kunhao Zhou, Ziquan Wei, Monica Murea, Marissa DiPiero, Tingting Dan, Guorong Wu

2026-08-11视觉感知规划控制

该文针对神经影像从原始归档到可分析结果过程中,BIDS标准化、模态预处理和质控依赖项目脚本与人工经验的问题,提出将流程知识封装为三个可由LLM调用的技能,并由智能体按数据模态动态编排、记录可审计质控。系统在17个队列、超过12.3万名受试者上部署,报告将训练与处理周期由2到3个月压缩到约1周;但跨站点可复现性和下游统计增益文中未充分说明。

World Simulator: Queer Erotica and the Absurdity of AI Video Models That Promise the World Figure 1
2026-08-11cs.MM

World Simulator: Queer Erotica and the Absurdity of AI Video Models That Promise the World

Adam Cole, Mick Grierson

University of the Arts London, work challenges the hubris of the "world simulator" label, asking, highlights the absurdity of the "world simulator" label. Specifically, contexts, we can surmise from available research on dataset filtering

2026-08-11视觉感知强化学习

本文动机是质疑商业 AI 视频模型将自身包装成“世界模拟器”的完整性承诺。作者以批判性创作方式,把酷儿情色影像输入 Wan 2.1 VACE 视频到视频流程,用受限扩散步数观察模型如何从暧昧肉身运动坍缩为家电、建筑等熟悉物。结果以多屏装置呈现模型对性与身体经验的结构性盲区,说明其所谓世界模拟更像经由数据过滤和安全规训后的残缺表征。

PragyaDoc: A Universal Document Intelligence Framework for Multilingual Medical Document Understanding in Low-Resource Settings Figure 1
2026-08-11cs.CV

PragyaDoc: A Universal Document Intelligence Framework for Multilingual Medical Document Understanding in Low-Resource Settings

Jagpal Singh Jhala

2026-08-11视觉感知

本文面向印度低资源医疗场景中英文病历难以被患者和基层卫生人员理解的问题,提出 PragyaDoc:并行集成 PaddleOCR、EasyOCR、DocTR,并用 IoM/IoU 与词汇对齐融合,再以确定性空间规则约束双 LLM 抽取和印地语本地化,降低 OCR 噪声下的幻觉。50 份真实医疗文档上,typed 文档达到 92% 字符准确率、90% 药物抽取准确率和 95% 剂量计划准确率,但手写场景仍明显受限。

2026-08-10

102 篇
SimWAM: A Simple World Action Model for End-to-End Autonomous Driving Figure 1
2026-08-10cs.CV

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

Huazhong University of Science & Technology, 2 Dongfeng Research & Development Institute.

2026-08-10强化学习

SimWAM针对现有自动驾驶World-Action Model在推理时依赖未来视频生成、延迟高的问题,提出只在训练中用视频生成传递场景动态先验的方案:视频专家与轻量动作专家联合flow matching,并用隔离注意力保证动作分支不看未来帧,部署时丢弃视频分支;再用GRPO优化组合驾驶奖励。结果在NAVSIM达到91.5 PDMS,较已有WAM规划器延迟更低,并可零样本迁移到nuScenes。

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation Figure 1
2026-08-10cs.CV

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

Youjun Zhao, Alex Warren, Gary K.L. Tam, Rynson W.H. Lau

2026-08-10视觉感知生成模型强化学习

本文关注视频扩散模型在镜面场景中常生成内容错误、空间错位或时序不稳的反射问题。MirrorWorld 将任务拆成“反射什么”和“如何排列”,用 SRD 从冻结视觉基础模型蒸馏跨区域语义关系,并用 GTA 学习几何变换对齐镜内布局;作者还整合四个镜面视频数据集形成重建基准,实验显示其优于图像反射生成方法和强视频修补基线。

SABRE: Scalable and Automated Benchmarking of VLMs under Stress Figure 1
2026-08-10cs.CV

SABRE: Scalable and Automated Benchmarking of VLMs under Stress

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

University of Chicago, Toyota Technological Institute at Chicago, Stony Brook University

2026-08-10视觉语言数据集/基准

本文针对VLM进展快而压力测试构建慢、难以持续暴露弱点的问题,提出SABRE:由任务说明和数据模式自动生成/编辑图像与问答,再用过滤VLM筛掉已会样本,并结合人工校验和局部修复。其实例SABRE-Prior检验模型能否在世界先验冲突时依据视觉证据作答,6个VLM宏平均准确率仅17.8%至31.3%,均值22.6%,显示现有模型仍容易被常识先验牵引。

Conformal Coverage Guarantees for Any Video Temporal Grounder Figure 1
2026-08-10cs.CV

Conformal Coverage Guarantees for Any Video Temporal Grounder

Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

Department of Electrical and Computer Engineering, Texas A&M University at Qatar, Doha, Qatar, College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar, Department of Computer and Electrical Engineering, Texas A&M University, College Station, TX, USA, the quantile of a temporal nonconformity score on held-out labels and widening the base prediction by, Preprint • Kurban Intelligence Lab • https://github.com/KurbanIntelligenceLab/cover, Kurban Intelligence Lab

2026-08-10视觉感知

视频时序定位中,同一事件边界本就有标注歧义,单一区间预测无法告诉下游何时可信。论文提出 Cover,用保形预测在 held-out 标注集上校准时间非一致性分数,后处理任意本地化器或黑盒 VLM,将点预测扩成带 1−α 覆盖保证的时间区域,无需重训。三套基准、五个 grounder 上实际覆盖率贴近目标,并揭示固定 padding 和已有不确定性头的可靠性明显不足。

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning Figure 1
2026-08-10cs.CV

I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

Beijing Jiaotong University, School of Computer Science and Technology, College of Electronic and Information Engineering, School of Computing and Communications, Beijing Jiaotong University Beijing China, MAIS Institute of Automation, Chinese Academy of Sciences Beijing China, School of Computer Science and Technology University of Chinese Academy of Sciences Beijing China, College of Electronic and Information Engineering Tongji University Shanghai China, School of Computing and Communications Lancaster University Lancaster United Kingdom

2026-08-10视觉感知

这篇论文针对现有视频推理多停留在“视频-文本”输入、难以处理参考人像约束下的身份匹配与跟踪问题,提出 ICQ 任务及 ISYV 数据、评测和模型框架。核心做法是用参考图像条件化查询,并通过 ICQ 模块压缩身份表征、ESR 奖励引导选择有效视频片段。实验显示主流 MLLM 在跨域身份匹配和长程跟踪上明显不足,ISYV-Model 在 7B 设置下平均准确率提升到约 57%,接近部分闭源模型表现。

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling Figure 1
2026-08-10cs.CV

UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

2026-08-10强化学习

UniJEPA针对现有JEPA在图像变换、视频预测和动作规划中各自训练、潜空间不兼容的问题,提出用共享编码器与预测器同时学习光度预测和时序预测,并以高斯正则替代EMA、stop-gradient等防塌缩技巧。实验显示其在ImageNet、SSv2、EK-100和离线目标规划上达到或超过任务专用JEPA,规划成功率75.8%,速度显著快于生成式世界模型。

Addressable Memory for Video World Models Figure 1
2026-08-10cs.CV

Addressable Memory for Video World Models

Xindi Wu, Sven Elflein, James Lucas, Olga Russakovsky, Laura Leal-Taixé, Despoina Paschalidou, Jonathan Lorraine, Aljoša Ošep

Princeton University, University of Toronto, Vector Institute

2026-08-10视觉感知强化学习

本文关注交互式视频世界模型在长时间 rollout 后重访场景时失去视觉一致性的问题,指出瓶颈不只是 KV 缓存容量,而是 RoPE 位置超出训练范围导致记忆不可寻址,以及旋转空间压缩会相位抵消。WorldTrace 通过给压缩槽分配分布内虚拟位置,并以 Field/Landmark 分别维护连续历史和关键场景痕迹,无需重训即将长程时间一致性提升 15.5%、LoopBench 情景召回提升 19.5%。

GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation Figure 1
2026-08-10cs.CV

GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation

Yonglong Zhang, Zongwu Xie, Yang Liu

2026-08-10视觉感知

面向在轨服务中未见航天器难以用人工掩码训练且基础模型提示不稳定的问题,GeoDistill-Refine先用多提示投票生成SAM 3伪掩码,再让轻量TinyUNet先学轮廓、后用可靠性门控的SDF/骨架/面积几何监督细化。SpaceSense-Bench HJM上较普通伪标签学生提升IoU 0.0456、Boundary F1 0.1380,外部数据边界或前景精度有增益;但验证掩码仍用于选点和阈值,骨架与面积项独立贡献仍未充分说明。

SkySeaLand: A Wide-Format Satellite Transportation Benchmark with an Ultra-Lightweight Detection Baseline Figure 1
2026-08-10cs.CV

SkySeaLand: A Wide-Format Satellite Transportation Benchmark with an Ultra-Lightweight Detection Baseline

Md. Zahid Hasan Riad, Md Sultanul Islam Ovi

2026-08-10视觉感知数据集/基准

针对卫星交通目标常因小尺度与宽幅场景在方形缩放中丢失细节的问题,论文提出 SkySeaLand 数据集,覆盖陆地与海上四类交通目标,并提供 COCO/YOLO 标注,同时给出 12 类检测器基准和 1.22M 参数 SkyDet 轻量基线。结果显示 YOLO/RT-DETR 的 mAP50 为 84.4–88.2,模型变大未带来稳定增益;SkyDet 以 4.90MB 达到 60.5 mAP50、72.8 FPS,但精定位差距较大,增益来源不清。

Measurements Automatically Extracted from Zero Echo Time MRI Using Deep Learning Image Segmentation and Geometric Modeling Agree with Expert Manual Readings Figure 1
2026-08-10cs.AI

Measurements Automatically Extracted from Zero Echo Time MRI Using Deep Learning Image Segmentation and Geometric Modeling Agree with Expert Manual Readings

Jack Consolini, Eric A. Bogner, Meghan Sahr, Matthew F. Koff, Kevin M. Koch, Hollis G. Potter

Department of Radiology and Imaging, Hospital for Special Surgery, New York, NY, USA

2026-08-10视觉感知

为减少髋关节撞击/发育不良术前评估对CT辐射和人工量角的依赖,本文用nnU-Net从ZTE MRI分割股骨、骨盆及骨性标志点,再以几何模型自动计算多种形态学角度。骨分割Dice超过0.96,版本角、冠状中心边缘角和Tönnis角与专家读数一致性优秀,但alpha角和股骨颈干角表现较弱,说明自动ZTE MRI量化对部分覆盖与版本指标可行。

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model Figure 1
2026-08-10cs.RO

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

2026-08-10视觉语言视觉感知规划控制

这篇论文针对驾驶VLA中深层语言解码器带来的控制延迟,追问单个规划token的有效信息究竟在第几层形成。作者用冻结轨迹规划器作为“轨迹空间logit lens”逐层解码,并发现导航意图首层已可线性读出,但与原规划器兼容的轨迹表示需随深度逐步成形;按规划token角度变化剪掉32层中的8层,约5%开环误差代价换来1.33倍解码器加速,但结论限于ORION与Bench2Drive,未证明闭环安全。

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation Figure 1
2026-08-10cs.CV

H2AL: Hyperbolic Hierarchy-aware Aggregative Learning for Registration-based Few-shot Medical Image Segmentation

Jia Wang, Jiaming Cai, Zunying Hu, Zhanjie Wu, Jinyuan Liu, Hua Cheng, Yun Peng

Dalian University of Technology, Beijing Children’s Hospital, Capital Medical University, Chongqing University of, Dalian University of Technology Dalian China, Beijing Children’s Hospital, Capital Medical University Beijing China

2026-08-10视觉感知

针对配准式少样本医学图像分割中伪标签易受小结构歧义和解剖层级缺失影响的问题,H²AL把双曲空间的层级建模注入欧氏语义特征,并用梯度聚合联合优化配准与分割解码器。论文在脑部和心脏两类数据、五种设置下报告优于现有RFMIS方法,小结构Dice相对次优在配准和分割上分别提升1.47%和1.84%。

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models Figure 1
2026-08-10cs.RO

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models

Ziheng Liu, Quantao Yang

School of Computer Science and Technology, Zhejiang Gongshang University, Hangzhou

2026-08-10视觉语言视觉感知强化学习

这篇论文针对VLA模型下游适配中SFT受离线分布限制、统一RL更新易扰动语义表示的问题,提出TEMPO:冻结视觉语言骨干,只对语义投影层和低层动作专家分别做TD3式后训练,并采用语义慢更新、动作快更新的双时间尺度策略,以稳定潜在动作同时吸收在线控制反馈。在CALVIN和两项真实操作任务上,TEMPO相较预训练VLA和RL后训练基线取得更好的长程表现与更高奖励。

Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination Figure 1
2026-08-10cs.CV

Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

Zichuan Wang, Songlin Yang, Bo Peng, Zhenchen Tang, Yang Li, Beibei Dong, Jing Dong

School of Artificial Intelligence, University of Chinese Academy of Sciences, New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Science, Hong Kong University of Science and Technology

2026-08-10视觉语言

本文针对 LVLM 将不存在物体写入图像描述的问题,质疑“注意力不足”解释,发现真实与幻觉物体在中后层可有相近视觉注意力,差异在高注意区域经 Logit Lens 解码后是否与生成 token 语义一致。作者据此区分视觉不确定性与上下文先验两类机制,并提出免训练的检测缓解框架,用一致性检查定位幻觉,再用 HARM 或 VEED 处理;在多个幻觉基准和模型上报告达到 SOTA。

EliSeg: Verified Target Construction for Report-Grounded Abnormality Segmentation Figure 1
2026-08-10cs.CV

EliSeg: Verified Target Construction for Report-Grounded Abnormality Segmentation

Chengyi Peng, Haoyu Yang, Meixing Shi, Yuxiang Cai, Yankai Jiang

2026-08-10视觉感知

这篇论文针对胸片报告并非分割指令的问题:报告中可能含否定、既往或不相关发现,传统方法依赖预先给定目标或空间提示,等于使用隐藏 oracle。EliSeg 将任务拆成目标构造与掩膜生成,用 Actor 提议目标和掩膜、文本 Verifier 独立核验合格发现,并在不一致时修正重跑。MIMIC-CXR-ILS 上优于直接分割和级联方法,能抑制不合格提及的误分割,并在 CheXlocalize 上显示一定迁移性。

Foundation Models Adaptation for Multi-View Multi-modal Cardiac MRI Segmentation and Direct Ejection Fraction Estimation Figure 1
2026-08-10cs.CV

Foundation Models Adaptation for Multi-View Multi-modal Cardiac MRI Segmentation and Direct Ejection Fraction Estimation

Sina Amirrajab, Cian M Scannell, Volker Vehof, Michael Bietenbeck, Ali Yilmaz

2026-08-10视觉感知

该文针对多视角、多序列心脏 MRI 自动分析中模型常需按任务和模态分别训练的问题,探索将 CMR 基础模型细调与组合用于分割和直接 LVEF 估计。方法以 CineMA 构建 cine 与 LGE/瘢痕专用分割器,并用冻结的 CMR Transformer、CMRCLIP 嵌入经注意力 MIL 回归 EF。验证集中 cine Dice 为 0.862–0.902,LGE Dice 为 0.621–0.846,LVEF MAE 4.96 个百分点、相关 0.91;但 LGE 瘢痕仍难,且 nnU-Net 在部分任务仍更强。

Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders Figure 1
2026-08-10cs.CL

Gaze Behavior in Visual World Experiments Can be Modeled With Off-the-shelf Language-Vision Encoders

Rahul Murali Shankar, Titus von der Malsburg, Sebastian Padó

University of Stuttgart, Germany

2026-08-10视觉感知强化学习

本文针对视觉世界实验中语言与视觉共同驱动眼动、而现有神经语言模型多只处理单模态文本的问题,提出用无需微调的 CLIP 双编码器结合 Integrated Jacobians,把词元-图像 patch 归因直接映射为凝视预测。结果显示,该方法能较稳健复现 Altmann 与 Kamide 经典英语实验中的预测性注视效应,说明人类对未出现目标物的预期可能已蕴含在视觉-语言预训练的相关结构中。

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN Figure 1
2026-08-10cs.AI

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

Institute of Artificial Intelligence, China Telecom, 2Zhejiang University, 3Tongji University, Shanghai Jiao Tong University, continuous navigation: every action changes the viewpoint and, consequently, the visual evidence available

2026-08-10机器人强化学习三维

本文针对连续视觉语言导航中动作策略缺少“动作会如何改变未来观测”的显式约束,提出 WNM-3D:从单目历史观测提取几何感知特征,并转成 3D 场景 token 作为扩散式世界-动作模型的共享条件,同时生成未来视图与动作。GN-Bench 结果显示其优于强 VLM 导航策略和 2D 条件版本;消融表明主要闭环增益来自 DAgger,DanceGRPO 只在其后进一步细化。

CANIS: Generation-Assisted 3D Canonicalization via an Image-Semantic Bridge Figure 1
2026-08-10cs.CV

CANIS: Generation-Assisted 3D Canonicalization via an Image-Semantic Bridge

Kendong Liu, Yuxin Yao, Junhui Hou

2026-08-10视觉感知三维

针对3D物体规范化中几何线索难以区分语义朝向、且现有方法常依赖类别模板或专门训练的问题,CANIS利用冻结的图像到3D生成模型生成规范姿态代理,并通过渲染图像建立输入与代理之间的语义锚点来约束配准。实验显示其在合成、部分观测和真实扫描上提升朝向一致性,并改善旋转扰动下的分类、部件分割和稠密对应表现。

Flow-Corrected Shape Optimization: Taming Manifold Drift in High-Dimensional 3D Models Figure 1
2026-08-10cs.CV

Flow-Corrected Shape Optimization: Taming Manifold Drift in High-Dimensional 3D Models

Emilien Seiler, Nicolas Talabot, Yingxuan You, Federico Stella, Pascal Fua

Nicolas Talabot, CVLab, EPFL, We demonstrate the effectiveness and scalability of FCSO with generative shape priors, from simple

2026-08-10生成模型优化算法三维

本文针对高维3D生成模型中潜空间优化容易偏离有效形状流形的问题,提出FCSO,将目标梯度下降与flow matching校正交替执行,把“优化性能”和“拉回形状先验”解耦。实验覆盖从DeepSDF类简单潜空间到Hunyuan3D等复杂先验,在气动阻力降低、物体柔顺性等任务上优于现有正则化、扩散/流引导基线,并保持较好的几何有效性;代价是每轮校正需额外多次向量场前向计算。

An AI4AI Framework for Visual Token Pruning Figure 1
2026-08-10cs.LG

An AI4AI Framework for Visual Token Pruning

Zhen Liu, Wenli Huang, Wei Song, Yuhan Liu, Zhiqin Yang, Jingwen Fu

2026-08-10视觉感知

这篇论文针对多模态大模型视觉 token 过多导致推理成本高、手工剪枝策略难以适配不同预算和架构的问题,提出 AutoPrune:用包含 131 个原子的 TPDSL 将候选策略表示为对强基线的受约束残差修改,让 LLM 在评估反馈中搜索可执行剪枝策略。实验显示,在 14 个多模态基准和 3 个 MLLM 上,即使移除 94.4% 视觉 token,仍保留超过 99% 全 token 性能,并带来 9.9 倍 FLOPs 与 6.4 倍 prefill 延迟下降。

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation Figure 1
2026-08-10cs.CV

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

Francisco Caetano, Tim J.M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A.H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H.N. De With, Fons van der Sommen

2026-08-10视觉感知

该工作针对内镜生成模型受自然图像先验错配和大规模 DiT 训练成本限制的问题,提出 REVEAL:用 GN-5M 上预训练的内镜编码器对齐扩散潜变量,强调黏膜纹理和解剖结构而非通用语义。实验显示其生成质量、修复/外扩结构一致性和污染鲁棒性较强,且作为特征提取器可超过 EndoViT、Endo-FM;但部分增益可能主要来自 scaling / data。

InstanceSplat: Instance-Aware Feed-Forward 3D Gaussian Splatting for Scene Understanding Figure 1
2026-08-10cs.CV

InstanceSplat: Instance-Aware Feed-Forward 3D Gaussian Splatting for Scene Understanding

Minchao Jiang, Xiaoxuan Ma, Shunyu Jia, Haoru Wang, Zhang Liang, Wentao Zhu

2026-08-10三维

这篇论文针对现有前馈 3DGS 多偏类别语义、实例级方法又依赖逐场景优化的问题,提出 InstanceSplat,从无位姿多视图图像一次前向预测同时含外观、几何、实例身份和语言语义的高斯表示。其关键在于用共享 3D 高斯做跨视角实例 grounding,并以实例结构耦合重建、实例分割和开放词汇语义。实验显示在新视角合成、实例分割和开放词汇理解上达到 SOTA,并具备较好效率与跨数据集泛化。

Human-AI Perceptual Alignment by Playing Hues and Cues Figure 1
2026-08-10cs.CV

Human-AI Perceptual Alignment by Playing Hues and Cues

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

Nuria Alabau-Bosque

2026-08-10视觉感知

为弥补传统视觉基准难以评估细粒度、带文化语义的颜色感知对齐,论文把 Hues and Cues 棋盘的 480 个颜色格映射到 CIE xy 空间,并用 325 名人类数据建立一致性基线来测试 162 个 CVLM。结果显示模型能复现食物、植物等具体概念的记忆色,但在抽象、主观和流行文化词上明显偏离,常出现语义误判或坍缩到默认蓝色;数据集策划质量比单纯规模更影响对齐。

Multiple Hypothesis Flow Estimation for Video Frame Interpolation under Matching Ambiguity Figure 1
2026-08-10cs.CV

Multiple Hypothesis Flow Estimation for Video Frame Interpolation under Matching Ambiguity

Zibo Su, Jing Kong, Ruixing Wang, Zhanhe Zhang, Kun Wei

2026-08-10视觉感知生成模型

这篇论文针对视频插帧中重复纹理、旋转对称和高速模糊导致的匹配歧义,指出单一光流会过早丢弃可行对应并引入重影或模糊。方法保留 top-K 粗匹配锚点,分别用局部注意力细化,再由可靠性路由为每个位置选择一个流-外观假设而非软融合。实验在自建 MA-HD 和公开基准上取得最佳 LPIPS、DISTS,说明多假设保留再硬选择有助于感知质量。

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation Figure 1
2026-08-10cs.CV

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

Swiss Institute of Bioinformatics (SIB), Switzerland

2026-08-10数据集/基准

这篇论文针对腰椎 MRI 自动报告缺少可靠基准、通用文本指标难以反映椎间盘级诊断正确性的问题,系统评测多类 VLM,并通过扰动实验指出流畅报告仍可能隐藏定位或否定错误。核心创新是引入半监督 U-Net++ 生成的椎间盘级异常热图作为架构无关的视觉 grounding。主要结果显示,该辅助输入可提升模型对解剖异常的敏感性,并提供可检查的解释输出,但具体量化增益文中片段未充分说明。

Geometry-Aware Camera Localization for Bronchoscopy Figure 1
2026-08-10cs.CV

Geometry-Aware Camera Localization for Bronchoscopy

Lumin Chen, Qingyao Tian, Jinpeng Li, Haoyu Jiang, Huai Liao, Xinyan Huang, Hongbin Liu, Dong Yi

Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Institute of Automation, Chinese Academy of Sciences, The First Affiliated Hospital, Sun Yat-sen University, Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences Hong Kong China, Institute of Automation, Chinese Academy of Sciences Beijing China, The First Affiliated Hospital, Sun Yat-sen University Guangzhou China

2026-08-10视觉感知

支气管镜定位受气道低纹理、视野狭窄和实时毫米级精度要求限制,通用视觉定位难以直接适用。论文提出 GABL,将术前 CT 气道图结构先验、图引导粗到细锚点定位、因果 Transformer 时序跟踪与 RGB-深度匹配联合起来,减少视觉歧义和位姿抖动;实验称相较既有最优方法平移误差降 8.37%、旋转误差降 31.76%,并以 33.6 FPS 实现约 4 倍加速。

International Transfer of Stochastic Cortical Self-Reconstruction Figure 1
2026-08-10cs.CV

International Transfer of Stochastic Cortical Self-Reconstruction

Fabian Bongratz, Zhizheng Zhuo, Chao Zhang, Yaou Liu, Dennis M. Hedderich, Christian Wachinger

2026-08-10三维

本文关注个体级皮层萎缩检测在跨国家、跨人群数据中的可迁移性:SCSR不依赖年龄、性别等协变量建模,而是从个体皮层厚度随机子集重建健康参考并生成Z分数。在中国队列上,UKB预训练模型可直接迁移,SUNet微调后平均pairwise AUC达0.848,且全年龄段重建误差较低,说明跨人群泛化较强;但适配收益相对有限,增益来源不清。

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs Figure 1
2026-08-10cs.CV

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

2026-08-10视觉感知

RoRA针对MLLM视觉token序列过长导致的prefill、KV缓存和推理开销问题,指出现有剪枝把保留token同质化处理,难以确认目标区域是否已覆盖。其核心是按语义核心、互补上下文和细节三种角色分配预算,并用AAR显式建模已覆盖的对象支撑区域。在LLaVA与Qwen-VL系列上,RoRA在相同预算下优于训练-free基线,88.9%剪枝仍保留LLaVA-1.5约96.5%性能,66.7%剪枝带来1.33倍端到端加速。

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies Figure 1
2026-08-10cs.RO

AutoIntervene: Calibrated Intervention for Action-Chunking Imitation Learning Policies

Jinhe Tang, Weiming Zhi

School of Computer Science and 2 Australian Center For Robotics, The University of Sydney, Australia, College of Connected Computing, Vanderbilt University, TN, USA

2026-08-10模仿学习

动作分块模仿策略虽能提升时序平滑性,但在感知误差或执行漂移后仍可能输出看似连贯却脱离示范分布的动作。AutoIntervene的核心是用成功轨迹构建视觉-动作支持记忆,并分别以阶段局部支持触发人工接管、全局支持判断何时交还策略,阈值由留出专家示范分位数校准。九个真实双臂任务中,该方法在迭代适应后提升成功率,并比手动切换减少操作者控制时间。

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark Figure 1
2026-08-10cs.CV

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark

R. G. Bahumanya, Harshith V. M., Shreyank N. Gowda, Anala M. R

2026-08-10数据集/基准

本文关注计算病理中测试时自适应不仅会影响准确率,也可能改变模型给出的可解释性热图这一临床审计风险。作者未提出新TTA算法,而是构建大规模基准,引入解释稳定性指标ESI,系统比较17种TTA、5类骨干和4类归因方法。结果显示,冻结骨干方法解释漂移最小,CoTTA、RoTTA等持续自适应漂移最大;卷积网络比Transformer和病理基础模型更敏感,且解释稳定性与准确率、校准表现弱相关。

KnifeHunter: Structured Local Representation Learning for Fine-Grained Knife Image Retrieval in Law Enforcement Figure 1
2026-08-10cs.CV

KnifeHunter: Structured Local Representation Learning for Fine-Grained Knife Image Retrieval in Law Enforcement

Syed Sameed Husain, Eng-Jon Ong, Stephen Simpson, Trevor Hamshere, Matt Turner, Miroslaw Bober

2026-08-10视觉感知

针对警方刀具识别依赖人工比对、现场图像噪声大且类别差异细微的问题,论文构建了包含警方案件、零售和边检来源的 KnifeHunter 数据集,并提出 CoRe-Net,用结构化局部原型表示和双向全局-局部融合保留刃形、锯齿、标记等细粒度线索。EVA02-Base 上 Medium 协议 mAP 达 88.0%,含干扰库仍有 85.1%,实地部署 mP@1 为 99.2%。

YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family Figure 1
2026-08-10cs.CV

YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family

Xu Lin, WenJie Nie, Jinlong Peng, Weifu Fu, YueXiao Ma, Xiawu Zheng, Yong Liu

2026-08-10视觉感知

该文面向YOLO系列在新数据集或下游检测场景中全量微调成本高的问题,尝试把LoRA、Adapter等参数高效微调思路系统接入YOLO家族,以减少可训练参数并保持检测性能。由于PDF文本抽取主要落在标题和参考文献,方法与实验细节缺失,判断受限于 PDF 文本抽取质量;主要结果、相对全量微调的精度/参数权衡及增益来源文中未充分说明。

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video Figure 1
2026-08-10cs.RO

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video

Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao

∗ Equal contribution. 1 Nanjing University, Nanjing, China. 2 China Mobile Research Institute, Beijing, China. † Corresponding author: Xiao-Xiao Long

2026-08-10机器人视觉感知三维

C2Dex针对单目人类视频到灵巧手操作中接触漂移、穿透和跨手型迁移失真的问题,核心是把逐帧噪声接触聚合为物体规范空间中的稳定物体侧接触,并同时用于HOI重建约束和保接触重定向。其在DexYCB/TACO端到端成功率达57.78%/26.67%,高于最强基线17.78%/10.00%,并做了真实机器人回放验证。

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams Figure 1
2026-08-10cs.SE

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

Simon Scholz, Mersedeh Sadeghi

University of Cologne, University of Cologne Cologne Germany

2026-08-10数据集/基准

这篇论文针对手绘 UML 到可执行模型评测缺少公开基准的问题,构建 CAS2UML:557 个手绘类图和活动图样本,每个配套人工验证的 PlantUML,并提供渲染与语法校验脚本。其主要贡献不是新模型,而是把视觉草图、可编辑真值和验证流程绑定起来,使 sketch-to-UML、图像到模型和多模态生成方法可在同一可执行参考上复现实验。

IceHorizon: A Dataset for Horizon Detection in Ice-Covered Maritime Environments and Comparative Evaluation of Detection Methods Figure 1
2026-08-10eess.IV

IceHorizon: A Dataset for Horizon Detection in Ice-Covered Maritime Environments and Comparative Evaluation of Detection Methods

Alisa Pesotskaia, Emin Zerman

2026-08-10视觉感知数据集/基准

冰区海面天空与水面低对比、冰块和雾等干扰使地平线检测难以支撑船舶/无人机导航。本文贡献在于发布含船载与无人机视频标注的 IceHorizon 数据集,并用 MAD、NMHD、覆盖率和耗时比较四种传统方法与两种深度学习+线检测混合方法。结果显示混合方法整体最稳、精度最高,船载场景显著优于无人机场景,说明视角、雾、山体和弯曲地平线仍是主要瓶颈。

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection Figure 1
2026-08-10cs.CV

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

2026-08-10视觉感知

面向跨平台、跨波段红外小目标检测,论文指出传统二值掩码监督会丢失场景语义并削弱跨域泛化。其核心是先用视觉语言指令学习建立“理解后检测”的JinSight表示,再通过低秩LSI融合全局语义与多尺度空间特征,并发布OmniIRST-VL数据集。实验称在WideIRSTD上较SOTA提升超过14% IoU。

Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs Figure 1
2026-08-10cs.CV

Stable Curves, Unstable Items: Item-Level Scaling Heterogeneity in Video LLMs

Wenzhang Sun, Chunfeng Wang, Xiangchen Yin, Yujia Chen, Hao Li, Kun Zhan

2026-08-10视觉感知

这篇论文针对 Video LLM 评测中只看平均 scaling 曲线的问题,指出增加帧数或分辨率时,整体分数平稳可能掩盖样本级“救回”和“伤害”的相互抵消。作者提出以同一模型、同一题目在不同视觉预算下的配对响应轨迹为审计对象,量化 oracle headroom、视觉混淆和文本覆盖。五个开源模型、多类任务上均显示不存在统一最优预算,MCQA 中有 8.8–18.9 个点潜在提升且 12.5%–25.5% 样本高预算反而变错,置信级联还能以低 31.7% 平均帧成本匹配 128 帧精度。

Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs Figure 1
2026-08-10cs.CV

Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs

Kai Li, Lutao Jiang, Zhenyang Li, Jiayu Dong, Jierui Zhang, Yingda Yin, Runze Zhang, Kai Yan, Xiaoyang Huang, Keyang Luo, Xin Wang, Xiangyu Zhao, Weikai Chen

2026-08-10三维

Scenix针对少量未标定RGB视角难以恢复可编辑室内三维场景的问题,将重建表述为可执行场景程序预测,先由LayoutVLM推断房间结构、物体语义与位姿,再用开放词汇资产生成和Critic-Editor-Verify闭环细化空间一致性。论文还构建约11万场景的XScene并引入观测一致监督;实验显示其在XScene、真实图像和SpatialGen迁移中优于单视角基线,但部分增益可能主要来自数据规模与监督设计。

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models? Figure 1
2026-08-10cs.CL

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?

Jiankun Wang, Yisen Gao, Ziwei Zhang, Xingcheng Fu, Jiaxin Bai, Chen Gao

2026-08-10生成模型

本文针对视觉 RAG 中“检索证据越多越好”在扩散语言模型下失效的问题,指出更多页面虽提高答案页召回,却会因并行去噪中的来源一致性丢失与语义冲突降低准确率。作者提出无需训练的 ECF,用首步答案块熵和空白对照筛选候选证据,并结合多粒度证据单元。三种多模态 DLM、五个视觉问答基准上,ECF 较最强固定 top-k 平均提升 2.62 个百分点。

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models Figure 1
2026-08-10cs.CV

HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models

Yu Xue, Haoxuan Qu, Zhuoling Li, Hongbin Xu, Jianxiong Yin, Simon See, Hossein Rahmani, Jun Liu

2026-08-10视觉感知生成模型

本文针对现成 DiT 文生图模型在训练自由高分辨率生成中易出现空间错乱、推理时间过长的问题,指出位置嵌入表达能力受限和高分辨率注意力计算开销是关键瓶颈,并提出 HRDiT:用空间位置对齐缓解结构失序,用按头自适应注意力剪枝降低耗时。实验显示该方法可在 FLUX、Stable Diffusion 3 等模型上提升高分辨率图像质量并加速生成。

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration Figure 1
2026-08-10cs.CV

Local Epistemic Uncertainty Guided Active Sampling for Plug-and-play Diffusive Image Restoration

Jiaqi Zhang, Zheng Pang, Rongrong Gao, Qiyuan Zhang, Yang Yang

Jiangsu University, Xi’an University of Technology, Jiangsu University Zhenjiang China, Xi’an University of Technology Xi’an China

2026-08-10视觉感知安全鲁棒

针对扩散图像复原中固定约束权重难以处理空间非均匀退化、统一采样步长又带来冗余或误差累积的问题,论文提出 LEADer,用局部认知不确定性调节空域先验强度,并以不确定性轨迹进行自适应跳步。其作为即插即用模块可接入多种 DMIR 基线,实验显示复原质量提升、采样时间显著下降且额外内存开销很小。

When One Modality Is Not Enough: Multimodal Sex and Life-Stage Classification of Red Deer from Aerial RGB-Thermal Video Figure 1
2026-08-10cs.CV

When One Modality Is Not Enough: Multimodal Sex and Life-Stage Classification of Red Deer from Aerial RGB-Thermal Video

Hugo Markoff, Christoph Praschl, Ivan Ludoški, Sara Beery, Michael Ørsted, David C. Schedl

2026-08-10视觉语言视觉感知

这篇论文针对无人机野生动物调查只计数、难以给出性别和年龄结构的问题,提出在红鹿航拍 RGB-热红外视频中逐阶段融合两种模态:跨模态确认目标、筛掉遮挡帧,并用 DINOv3 特征在轨迹层投票分类,幼体则借助地理校正后的体型估计。结果显示融合管线在四次飞行中正确分类 25/26 个体,优于任一单传感器的 20/26,物种分类达 96.0%。

Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding? Figure 1
2026-08-10cs.CV

Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?

Yun Li, Biao Yang, Peixi Wu, Yunhao Zhou, Mingzhou Jiang, Wei Yuan, Fan Yang, Wenwu Ou

2026-08-10生成模型数据集/基准

这篇论文针对现有嵌入评测偏重检索可分性、无法判断向量中信息是否还能被生成器读取的问题,提出 GEB:冻结图像/图文嵌入,只让解码器基于嵌入和问题作答。结果显示纯视觉嵌入得分仅 28.25–33.21,图文联合编码最高 65.56,但仍低于可看原图的 Qwen3-VL-2B 的 84.30;场景文字和文档信息尤其难恢复,说明强检索表现不等于保留细粒度生成所需信息。

Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation Figure 1
2026-08-10cs.CV

Summarize First, Download Later: Onboard VLMs for Bandwidth-Efficient Earth Observation

Junghwan Park, Sangcheol Sim, Woojin Cho, Darongsae Kwon

2026-08-10视觉语言

这篇论文针对地球观测卫星高分辨率数据增长与下行带宽、接触窗口受限之间的矛盾,提出先由星载量化VLM生成场景文本摘要,再由地面用VQA追问确认价值,最后只下载关键影像的交互式下行流程。实验在Jetson平台和遥感场景上验证,文本包约485B,相比预览图和全分辨率影像可显著节省带宽;紧凑VLM可运行但仍有几十秒级延迟,鲁棒性与能耗问题文中未充分说明。

Casting the Net! Revisiting MasterFace Impersonation Attacks Figure 1
2026-08-10cs.CR

Casting the Net! Revisiting MasterFace Impersonation Attacks

Seunghun Paik, Sunpill Kim, Chanwoo Hwang, Jae Hong Seo

Hanyang University, Hanyang University Seoul Republic of Korea

2026-08-10视觉感知

论文针对现实人脸识别系统中攻击者只能少量尝试、无内部信息时通常以 FMR 作为安全基线的问题,重新评估 MasterFace 威胁。核心洞察是许多系统依赖公开商业 API,攻击者可合法查询相似度,并把模板空间覆盖建模为最大覆盖问题,利用 Gram 分解构造 API 定制的“net”并重建人脸。实验显示在最多 30 次认证尝试内,对开源和商业 API 系统的冒充率最高放大 9.5 倍,说明现代部署仍存在非平凡风险。

Dual-Space Modality Consistency Learning for Universal Cross-Modal Re-Identification Figure 1
2026-08-10cs.CV

Dual-Space Modality Consistency Learning for Universal Cross-Modal Re-Identification

Yujian Zhao, Yukang Zhao, Hankun Liu, Haoxuan Xu, Bo Li, Hanzi Wan, Guanglin Niu

2026-08-10视觉感知

针对跨模态重识别中过度依赖空间特征对齐、忽视频域尤其高频差异的问题,论文提出 DSMCL,在空间中做高斯分布一致性约束,并用身份感知的跨模态对比学习约束高频表示,试图保留判别细节而抑制模态噪声。其作为即插即用模块,在 5 个数据集、17 种协议上提升多种基线,如 SYSU-MM01 Rank1 88.2%→92.3%、HOSS-ReID 31.3%→38.8%、CMShipReID mAP 66.8%→73.9%。

ELMZip: Onboard Satellite Image Compression via Extreme Learning Machines for Efficient Downlink Figure 1
2026-08-10cs.LG

ELMZip: Onboard Satellite Image Compression via Extreme Learning Machines for Efficient Downlink

Woojin Cho, Junghwan Park, Sangcheol Sim, Steve Andreas Immanuel, Junhyuk Heo, Darongsae Kwon

2026-08-10视觉感知

面向小卫星多光谱影像下行带宽、能耗和过境时间受限的问题,ELMZip将每幅图像的神经表示拟合改写为随机特征ELM的凸最小二乘,并通过预共享固定特征仅下传量化输出权重。实验在Sentinel-2 L0/L1C与Jetson Nano模拟环境中显示,在约10倍压缩约束下,其能耗约为INR基线的十分之一,同时PSNR/SSIM整体更高,复杂城市区域提升更明显。

Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal Figure 1
2026-08-10cs.CV

Degradation-Aware Prompt Learning with Cross-Modal Compensation for Adverse Weather Removal

Wanshu Fan, Yunzhe Zhang, Yue Shen, Liyan Wang, Jing Qin, Kin-Man Lam, Cong Wang, Jinshan Pan

Educational Department of Liaoning Province, China (Grant No. LJ222511258003), Interdisciplinary project of Dalian University (Grant No. DLUXK-2025-QN-020), Center (Grant No. D23006). (Corresponding authors: Jing Qin

2026-08-10视觉感知

针对雨、雾、雪等恶劣天气退化空间分布不均、现有统一复原模型缺少显式语义与局部退化建模的问题,论文提出 DCMPC-Net,用预训练视觉语言模型生成退化感知跨模态提示,并通过注意力对齐与双特征补偿把语义先验注入解码和结构细节恢复。实验称其在任务特定和统一设置下均优于现有方法,但具体增益来源仍需结合消融细节判断。

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning Figure 1
2026-08-10cs.CV

Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning

Chen Ling, Hanqian Li, Dongnan Liu, Keyu Qian, Jungang Li, Xinglong liu, Shiyi Wang, Xin Dong, Pengcheng Zhu, Wei Zhou, Linjian Mo, Nai Ding

2026-08-10视觉感知

该文针对多模态大模型在反常识视觉场景中“看到了却仍按语言先验作答”的问题,指出瓶颈主要在共享语言解码器而非视觉感知。其核心做法是用 FFD 构造文本反常识语料,并通过 TACT 进行仅文本的两阶段后训练,强化依据证据的推理、抑制先验轨迹。实验显示该方法在多个视觉反常识基准上提升表现,同时基本保留通用能力。

Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning Figure 1
2026-08-10cs.LG

Walkable to Whom? Capturing Subjective Variability in Walkability Perception Using Multimodal Deep Learning

Moloud Damandeh, Meead Saberi

2026-08-10视觉语言

论文针对现有步行友好度模型把个体差异平均掉、且多依赖车载街景视角的问题,构建了含1196名受访者、29870条评分的人行道视角数据集,并提出融合图像与受访者属性的用户条件多模态模型。结果显示,人行道视角评分显著高于街景视角;加入用户属性后QWK由0.29升至0.47,约65%相对提升,说明“谁在评价”对感知步行性有可学习影响。

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward Figure 1
2026-08-10cs.CV

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

Mingyang Wu, Kaituo Feng, Bohao Li, Kaixiong Gong, Zihao Yin, Xiangyu Yue

MMLab, CUHK, Peking University

2026-08-10视觉语言视觉感知强化学习

该文针对音视频联合字幕缺少细粒度数据、强化学习奖励过粗和评测难以衡量原子事实的问题,构建 AVCap-100K,并用 Da-GRPO 将奖励改为基于问答核查的细节一致性信号,同时提出 AVCap-Bench/Score。实验显示 7B、30B 模型较开源基线提升,30B 在多项评测上接近或超过 Gemini-2.5-Pro,但增益可能同时来自数据规模与模型 scaling。

MaskFlow: Precise, Consistent and Seamless Regional Image Editing Figure 1
2026-08-10cs.CV

MaskFlow: Precise, Consistent and Seamless Regional Image Editing

Rui Xu, Yang Yong, Shunzi Yang, Ruihao Gong, Chengtao Lv

Beihang University, Nanyang Technological University

2026-08-10视觉感知生成模型

区域图像编辑的难点在于既要把修改严格限制在用户掩码内,又要避免背景漂移和边界接缝。MaskFlow 的核心做法是把掩码写入概率路径与 flow-matching 目标,并在训练和采样中用 Soft-Poisson 去缝模块修正向量场;同时构建 MEData 支持训练。实验显示其在自然场景和信息图上相较现有编辑/修复方法提升了定位、背景保持和边界融合效果。

Vernata: Self-Supervised Learning of LiDAR Point Representations Figure 1
2026-08-10cs.CV

Vernata: Self-Supervised Learning of LiDAR Point Representations

Oliver Lemke, Alexander Liniger, Abel Gawel, Marco Hutter

2026-08-10视觉感知

该文针对户外机器人 LiDAR 点云标注昂贵、监督训练难以随数据规模扩展的问题,在 Sonata 自监督框架上提出 Vernata:用稀疏视图增强应对距离相关点密度变化,引入 memory bank 稳定受限算力下的训练,并通过 2D DINOv2 特征跨模态蒸馏提供细粒度语义信号。线性探测语义分割中,TartanGround mIoU 达 54.7、Waymo 达 57.1,较 Sonata 分别提升 5.9 和 7.3 点;缺少颜色或法线时仍保持约 49.4/50.2 mIoU。

RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived Projections Figure 1
2026-08-10cs.CV

RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived Projections

Kabila Haile Soboka

The University of Texas at Austin, The University of Texas at Austin Austin Texas USA

2026-08-10视觉感知三维

该文针对CT肋骨骨折逐处三维定位费时、体素检测标注和计算成本高的问题,探索由CT生成AP/侧位双平面投影后检测、配对并三角化的辅助流程。核心洞察是几何和已配对定位并非瓶颈,真正限制在跨视角对应置信度,且改进主要来自侧位检测器质量。封闭55例上仅15/601处实现10mm内正确3D定位,收益率2.50%,每例0.436个假3D点,说明其更适合作为保守的高置信辅助定位原型而非完整自动重建器。

MuST-VAD: Mutual Structured Learning for Video Anomaly Detection Figure 1
2026-08-10cs.CV

MuST-VAD: Mutual Structured Learning for Video Anomaly Detection

Satoshi Hashimoto, Hitoshi Nishimura, Mori Kurokawa

2026-08-10视觉感知

弱监督视频异常检测受限于固定视觉特征,难以捕捉交互、动作语义和场景上下文。MuST-VAD的核心是把LVLM到检测器的单向语义迁移改成双向闭环:检测器选关键片段并用置信加权预测反哺LVLM,LVLM再更新表征训练MIL检测器。在UCF-Crime上,相比同配置一次迁移基线,AUROC从88.15%升至88.63%,AP从37.25%升至42.46%,AP超过此前最好结果4.13点。

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models Figure 1
2026-08-10cs.CV

Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models

Minseok Kang, Hyunwoo Kim, Chanyoung Kim, Minwoo Kim, Jaekoo Lee, Dahuin Jung

2026-08-10视觉语言视觉感知

这篇论文针对视觉语言模型在边缘或实时场景中难以部署、现有剪枝依赖任务样本或偏向 LLM 激活特征的问题,提出无需重训练的 PORTA。其核心是用通用校准数据中的激活变化衡量跨模态特征重要性,并按层输出变化自适应分配稀疏率。实验覆盖 CLIP、BLIP、Qwen2-VL,在分类、检索和 VQA 等任务的高稀疏设置下优于 Wanda、SparseGPT 等基线。

From Points to Edges: Edge-Conditioned Spectral Operators for Physics-Sensitive PDE Learning Figure 1
2026-08-10cs.AI

From Points to Edges: Edge-Conditioned Spectral Operators for Physics-Sensitive PDE Learning

Zhentao Tan, Ruijie Quan, Yi Yang

2026-08-10视觉感知

这篇论文针对谱神经算子依赖点特征选择频域模式、难以响应材料界面和高梯度流场等局部物理敏感结构的问题,提出 ESO:用 PVMM 将邻域成对变化注入谱混合,并用 PAR 对关键区域加权监督。作者在九个结构化与非结构化 PDE 基准上报告优于现有方法,且区域分析显示在系数跳变和高梯度区域误差更低。

HazeSpikeMamba: Coupling Spiking-Inspired and State-Space Features for Self-Supervised Real-World Dehazing Figure 1
2026-08-10cs.CV

HazeSpikeMamba: Coupling Spiking-Inspired and State-Space Features for Self-Supervised Real-World Dehazing

Haoran Liu, Huibin Li, Mingzhe Liu, Peng Li, Guibin Zan

School of Artificial Intelligence and Electronic Engineering, Sichuan Technology and Business, University, Chengdu 611745, China, Chengdu University of Technology, College of Nuclear Technology and Automation, Sigray, Inc., Concord, CA 94520, USA, free labels during adaptation. A shared checkpoint is adapted once on each complete unlabeled, prediction back to the observed hazy domain, so an unlabeled real hazy image supplies its own

2026-08-10强化学习

真实雾天图像缺少成对清晰标注,合成雾训练的去雾模型易失效。HazeSpikeMamba用脉冲启发的TPCNNSpike建模局部邻域传播,用去掉窗口注意力的Mamba状态空间分支建模全局雾分布,并以冻结退化网络做无清晰标签的转导式自监督适配。模型仅2.02M参数,在RTTS、URHI、HSTS上提升BRISQUE和NIMA;但评测依赖整套目标集适配,非零样本设置。

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE Figure 1
2026-08-10cs.CV

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

Yunkai Yang, Yudong Zhang, Xinying Chen, Haoyuan Liang, Yizhuo Niu, Jinshuai Cheng, Kunquan Zhang, Liziyue Fang, Weitao Wan, Runmin Dong

2026-08-10规划控制

该文针对 MM-DiT 中多参考、按布局生成时全分辨率画布填充带来的计算浪费,以及 Shifted-RoPE 破坏绝对空间对应的问题,提出 ControlRef:用 UILC 注意力掩码隔离实例语义,并以 Anchored 4D-RoPE 将布局和参考 token 锚定到几何中心、沿 z 轴区分实例。实验报告其在保真度和定位精度上达到 SOTA,稀疏布局推理延迟降低超过 80%,密集场景显存开销降低约 50%。

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition Figure 1
2026-08-10cs.CV

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

2026-08-10视觉感知

面向城市监控、工业 CPS 等不能集中视频数据的场景,FedVAR 关注联邦细粒度视频异常识别中非 IID 客户端导致的语义错位。其核心是借助 CLIP 构建全局“正常性”原型,将本地视觉与文本特征重新对齐,并以低通信开销学习异常方向。实验覆盖多种非 IID 划分、跨域和未见异常类别,报告较现有联邦异常检测基线在检测与识别指标上更稳健。

DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding Figure 1
2026-08-10cs.CV

DAEP: Difficulty-Aware Evidence Planning for Medical Video Corpus Temporal Answer Grounding

Tianjian He, Yujie Liu, Zhiping Huang, Changbo Xu

2026-08-10视觉语言视觉感知规划控制

医疗教学视频问答不仅要找答案,还要定位支撑片段;DAEP的核心洞察是把题目给定的简单/复杂标签用作推理时的证据规划信号,联合调节字幕、视觉和流程上下文权重、检索宽度、边界扩展与重排序强度。在NLPCC 2026 DA-TAGVC官方评测中,BIGC以0.2728平均分获10队第一,消融显示视觉证据、流程上下文和难度感知规划均有贡献,复杂问题增益最大。

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection Figure 1
2026-08-10cs.CV

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu, Congyan Lang, Junliang Xing

2026-08-10视觉感知

针对现有深伪视频检测在新生成方法上泛化差、且基准多缺少可审计细粒度证据的问题,论文构建了含10万视频、33种合成方法的 FaceVid-Forensics-100K,并用纹理、光照、运动、物理四类专家智能体加裁判智能体进行取证推理。跨域评测中,该小型开源 MLLM 组合达到69.87%准确率、53.28% F1,优于单模型及GPT、Gemini等闭源基线。

RegionDet: A Benchmark for Region Detection Beyond Object Instances Figure 1
2026-08-10cs.CV

RegionDet: A Benchmark for Region Detection Beyond Object Instances

Liang Wan, Yuhan Wang, Yupeng Zhang, Zhen Xu, Han Wang, Fangjie Fu, Sirui Zhu

2026-08-10视觉感知数据集/基准

本文针对现实视觉系统中大量目标并非单个清晰物体、而是由状态、关系和场景功能定义的区域这一缺口,提出 Region Detection 任务和 RegionDet 基准,用 COCO 风格框标注八类区域目标。实验显示,监督闭集检测器只能部分学习区域模式,零样本/开放词汇检测器表现很弱,暴露出现有视觉语言检测器的物体中心偏置,以及弱边界、强上下文依赖和关系理解不足等瓶颈。

Are Visual Place Recognition Models Recognizing Places or Conditions? Distractor-Augmented Evaluation and Condition Suppression Figure 1
2026-08-10cs.RO

Are Visual Place Recognition Models Recognizing Places or Conditions? Distractor-Augmented Evaluation and Condition Suppression

Beomsu Kim, Minwoo Jung, Giseop Kim

B. Kim and G. Kim are with the Department of Robotics and Mecha-, M. Jung is with the Department of Mechanical Engineering, Seoul National

2026-08-10视觉感知数据集/基准

这篇论文关注长期视觉地点识别在众包、多条件地图中可能把“相同天气/光照”误当作“相同地点”的问题。作者提出加入受控干扰样本的 DAR/RSR 评估,并用 INLP、LEACE 等线性概念擦除做条件抑制。实验覆盖 11 种方法和 6 个数据集,显示 DAR@1 排名不同于常规 R@1,条件抑制通常提升 DAR@1 且基本不损害 R@1。

ECAD: Expanding Class-Agnostic Detection Beyond Thing-Centric Objectness Figure 1
2026-08-10cs.CV

ECAD: Expanding Class-Agnostic Detection Beyond Thing-Centric Objectness

Liang Wan, Zixin Ren, Yupeng Zhang, Yuhan Wang, Fangzhuo Gao

2026-08-10视觉感知

论文指出现有类别无关检测仍受“可数物体”标注约束,难以发现道路、天空、水面、球场等对空间理解和交互有用的视觉元素。其核心是提出 ECAD 设定、BTCO-Bench 基准和冻结 DINOv3 的轻量 ECADet,并用 GAER、PGQM改善多形态元素定位与 objectness 估计;实验显示其在该基准上优于代表性类别无关和候选框方法。

GOPI: Generation-Oriented 3D Pose Inference for Furniture Insertion from Single-View RGB-D Indoor Scenes Figure 1
2026-08-10cs.CV

GOPI: Generation-Oriented 3D Pose Inference for Furniture Insertion from Single-View RGB-D Indoor Scenes

Ruifeng Zhai, Renjie Liu, Guangrun Wang, Liang Lin

). Guangrun Wang and Liang Lin are with the School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou 510000, China, the Guangdong Key Laboratory of Big Data Analysis and Processing

2026-08-10三维

这篇论文针对单视角 RGB-D 家具插入中仅靠 2D 掩码无法确定真实尺度和三维位置的问题,主张先做 3D 位姿推断再生成图像。其核心是 GOPI:结合观测场景与家具几何先验,通过数据驱动的迭代推断得到可行摆放,并将位姿投影为像素级生成约束。实验显示其在合成场景中比直接回归等基线有更好的几何可行性、布局一致性和跨尺度投影-生成对齐,但真实场景泛化文中未充分说明。

Bend the Basics: Degradation-Aware Deformable Tokenization for All-in-One Image Restoration Figure 1
2026-08-10cs.CV

Bend the Basics: Degradation-Aware Deformable Tokenization for All-in-One Image Restoration

Zihao He, Yunfeng Wu, Xinchao Wang, Songhua Liu

2026-08-10视觉感知

本文针对统一图像复原中固定 patch 切分难以适应雨、雾、噪声、模糊、低光等空间混合退化的问题,提出 FIT:用退化编码器估计全局向量和空间退化图,驱动可变形嵌入与反嵌入,让 token 化边界随局部退化调整,并用任务 token dropout 降低对硬标签依赖。在 BSD68、Rain100L、SOTS、GoPro、LOLv1 上报告五退化平均 30.72 dB、三退化 32.83 dB,较近年统一复原方法提升约 0.5–1.1 dB。

R2S-EGO: Dual-Proxy Refinement for Sparse-Capture Real-to-Sim Figure 1
2026-08-10cs.RO

R2S-EGO: Dual-Proxy Refinement for Sparse-Capture Real-to-Sim

Shuai Fang, Xin Deng, Yuchen Kang, Zhenjiang Li, Jie Chen

The Hong Kong Polytechnic University

2026-08-10视觉感知

论文针对稀疏真实采集难以覆盖机器人自视角训练视图的问题,提出 R2S-EGO:用仿真 rollout 得到可执行的机器人视角查询域,再用捕获对齐的几何代理为生成视图提供结构约束,并将生成观测作为低权重伪观测迭代细化场景。结果显示,6 张采集图在 G1 自视角上 PSNR 达 19.062 dB,优于 14.226 dB 基线;真实 G1 坐下任务成功率为 82.5%,高于 GaussGym 的 10.0%。

AdvTiles: Physical Adversarial Camouflage Clothing against Person Detectors via Learnable Tiles Figure 1
2026-08-10cs.CV

AdvTiles: Physical Adversarial Camouflage Clothing against Person Detectors via Learnable Tiles

Jinlei Wang, Jiahuan Long, Mingkai Sun, Yafei Guo, Yuanhao Huang, Ming Wang, Junqi Wu, Jiacheng Hou, Hongbo Chen, Xingxing Wei, Tingsong Jiang, Wen Yao

2026-08-10视觉感知

这篇论文针对行人检测物理对抗服装中“自然外观”和攻击强度难以兼顾的问题,提出将迷彩图案表示为可学习 tile 的组合,而非整体优化纹理;通过 ST Gumbel-Softmax 联合学习 tile 图案与空间布局,并用 3D Gaussian Splatting 纳入视角、尺度、光照和背景变化。实验显示其在多种检测器上平均 ASR 达 86.2%,并制作成可穿戴服装验证了真实场景效果。

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models Figure 1
2026-08-10cs.RO

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

2026-08-10视觉语言强化学习

这篇论文针对 JEPA 世界模型只做前向预测时,潜变量未必能可靠表征机器人本体状态和状态变化的问题,提出 PSG-JEPA:在训练中加入单帧本体状态 grounding 与多步关节角变化 grounding,推理时不增加开销。实验覆盖探针可辨识性、冻结潜变量目标规划、仿真与真机策略学习,结果显示其整体优于 LeWM 等潜世界模型基线,且消融表明两类 grounding 分别影响状态辨识和规划效果。

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model Figure 1
2026-08-10cs.CV

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

Peking University, Nanjing University, Stanford University, Peking University Beijing China, Nanjing University Nanjing China, Stanford University Stanford California USA

2026-08-10生成模型

本文针对扩散模型用强化学习微调时奖励稀疏、固定采样步数导致训练成本高的问题,提出 PAST:用去噪进展构造内在奖励,并结合残余噪声预测与文本-图像对齐信号,按提示难度自适应提前终止采样,同时动态平衡内外奖励和探索/收敛。实验称其可将现有 RL 微调效率最高提升 66.7%,偏好优化质量最高提升 29.5%,但具体增益在多大程度来自终止策略、奖励设计或评估设置仍需看完整实验细节。

UniCycleFlow: Bidirectional Unpaired Image Translation with a Shared Rectified Flow Figure 1
2026-08-10cs.CV

UniCycleFlow: Bidirectional Unpaired Image Translation with a Shared Rectified Flow

Xianhao Zhou, Jianghao Wu, Shaoting Zhang, Guotai Wang

2026-08-10视觉感知生成模型

本文针对无配对双向图像翻译中两方向通常由独立映射建模、只在端点用循环一致性约束的问题,提出用同一个时间条件 rectified flow 速度场的正反向积分统一两域转换,并以源条件端点、self-flow matching、离散循环闭合和表示路径速度正则约束轨迹。实验在10个方向中7项取得最低FID,一步Euler推理下平均FID为55.1。

AnyTrack: Unifying Visual Object Tracking with Any Modalities Figure 1
2026-08-10cs.CV

AnyTrack: Unifying Visual Object Tracking with Any Modalities

Hao Li, Yunzhi Zhuge, Wenning Hao, Pingping Zhang, Xiaoxiong Zhang, Dong Wang, Huchuan Lu

Army Engineering University of PLA, Dalian University of Technology, National University of Defense Technology, Army Engineering University of PLA Nanjing China, Dalian University of Technology Dalian China, National University of Defense Technology Nanjing China

2026-08-10视觉感知

AnyTrack针对现有多模态跟踪器绑定固定传感器组合、遇到缺失或退化模态时适应性差的问题,提出单模型支持任意模态组合的统一框架。其核心在于用MIM做跨模态动态交互与时序聚合,并用CUM通过全局-局部提示建立目标上下文对应关系。论文还扩展灰度、语言和音频标注基准,实验显示在完整和缺失模态设置下均达到SOTA。

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts Figure 1
2026-08-10cs.AI

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

2026-08-10视觉语言强化学习规划控制

这篇论文针对手术视频世界模型中多种控制信号直接融合易导致解剖结构变形、器械外观漂移和时序不一致的问题,提出以首帧外观和层级语义掩码构成稳定锚点,再由边缘、深度、光流专家相对锚点提取增量并分阶段组合到 Wan2.2。实验称其在 Cholec80-SurgWAM 上优于现有可控视频生成和手术世界模型基线,提升生成质量、时序一致性与多模态可控性。

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models Figure 1
2026-08-10cs.CV

GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models

Yuanfu Sun, Yuanhang Ren, Kang Li, Chuanhao Ji, Jiaxi Li, Jiajin Liu, Ninghao Liu, Qiaoyu Tan

New York University, Tsinghua University, New York University Shanghai, University of Georgia, The Hong Kong Polytechnic University

2026-08-10视觉语言数据集/基准

现有视觉图推理评测常把图像转写成文本图后再答题,难以检验模型是否真正基于视觉结构做多步推理。GraphVerse以真实图场景构建单图与双图任务,引入语义保持的图中心图像编辑作为视觉推理压力测试,并用VGR-Score评估过程质量。实验显示当前MLLM在结构对齐和复杂推理上仍有明显短板,同时验证编辑策略有效,且能力可迁移到更广的多模态推理任务。

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models Figure 1
2026-08-10cs.CV

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

Peking University, Nanjing University, Stanford University, Peking University Beijing China, Nanjing University Nanjing China, Stanford University Stanford California USA

2026-08-10生成模型优化算法

本文针对扩散模型偏好强化学习中“把最终奖励回填到所有去噪步”导致的时间目标错配、奖励黑客和优化弱化问题,提出 SGPO:用 SNR 与相邻潜变量语义变化识别混沌、结构稳定、收敛三阶段,并分别采用退出混沌、偏好优化加多样性探索、稳定收敛的逐步目标。16 组实验报告生成质量平均提升 26.7%、收敛速度提升 36.7%,但具体增益来源仍需结合消融细节判断。

Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation Figure 1
2026-08-10cs.CV

Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation

Kuan Xing, Ye Wang, Changyi Gan, Yuheng Li, Thao Nguyen, Yi Chang, Yilin Wang

2026-08-10视觉感知规划控制

论文关注艺术家条件图像生成中的“经典符号捷径”:模型常把梵高、齐白石等名字误解为固定天空、配色或题跋,压过用户场景。作者提出 Atelier,将模糊艺术意图显式拆成场景锚点、保留/变换策略、风格时期假设、局部证据绑定与避捷径约束,并用 ArtIntentBench 评测。结果显示其在开放和闭源生成器上提升风格忠实度与结构保持,显著降低快捷替换率,但闭源后端仍受预训练偏置限制。

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos Figure 1
2026-08-10cs.AI

From Cheap Fakes to Pure Synthesis: Addressing the New Era of T2V Fake News Videos

Yifeng Luo, Yupeng Li, Liang Lan, Tian Wang

Department of Interactive Media, Hong Kong Baptist University, Institute of Artificial Intelligence and Future Networks, Hong Kong Baptist University AI and Social Good Lab, AI Media Centre, Hong Kong Baptist University Hong Kong China, Hong Kong Baptist University AI Media Centre, Institute of Artificial Intelligence and Future Networks Beijing Normal University Zhuhai China

2026-08-10视觉感知

本文关注 T2V 生成使假新闻视频从拼接改造转向“纯合成”,导致文本与视频高度一致、传统跨模态不一致检测失效。作者将任务改为真实、廉价伪造、纯合成伪造三分类,构建 PS-FNVD,并用 R-T2V 联合语义推理与生成痕迹判断真伪;在 10 个基线对比中,准确率和宏 F1 分别领先次优 12.20 和 8.46 个百分点。

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models Figure 1
2026-08-10cs.RO

AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Models

Guiyu Zhao, Longteng Guo, Yanghong Mei, Zilin Zhu, Yu Zhang, Bin Cao, Mingming Yu, Xingjian He, Jie Jiang, Jing Liu

2026-08-10视觉语言视觉感知强化学习

AtlasVLA针对腕部单目VLA在遮挡和长程任务中容易遗忘空间目标与执行进度的问题,将瞬时2D观测更新为体素哈希的4D持久世界记忆,并结合Ego-Working记忆跟踪自身状态与任务阶段,再用DiT条件生成动作。实验显示其仅用腕部相机在LIBERO、RLBench和真实任务上达到SOTA,LIBERO-Long和真实长程任务成功率分别提升9.4和17.5个百分点。

WaveFreqAnchor: Wave-Structural Anchoring and Frequency Correction Diffusion for Training-Free Face Restoration Figure 1
2026-08-10cs.CV

WaveFreqAnchor: Wave-Structural Anchoring and Frequency Correction Diffusion for Training-Free Face Restoration

Zelin Du, Wenjie Li, Zhengxue Wang, Juncheng Li, Cailing Wang, Guangwei Gao

2026-08-10生成模型

本文针对扩散式人脸复原在重度退化下容易出现身份结构漂移的问题,提出无需训练的 WaveFreqAnchor:用锚空间小波结构引导约束低维面部结构,并通过小波-傅里叶低频相位校正和受限高频增强补足细节。实验显示其在身份相似度、保真度和感知质量上优于多种现有方法,但极端偏色、过曝和低对比场景仍有限制。

Suppress and Diversify: Refining Robust Pathways for Corruption Robustness Figure 1
2026-08-10cs.CV

Suppress and Diversify: Refining Robust Pathways for Corruption Robustness

Jiangang Yang, Wenhui Shi, Xiaoran Xu, Wenyue Chong, Luqing Luo, Jing Xing, Jian Liu

2026-08-10安全鲁棒

面向安全关键视觉系统在噪声、模糊、低照等自然腐蚀下易失效的问题,论文从计算路径角度刻画内部鲁棒性,发现鲁棒特征随网络加深逐步衰减且与整体性能相关,并提出训练期 S&D:动态选择鲁棒路径、抑制非鲁棒路径,再用保持结构对称的变换增加多样性。八个基准上的分类、检测、分割实验显示其可提升腐蚀鲁棒性和 OOD 泛化,且不改结构、无测试时开销;但文中也承认存在干净精度权衡和大规模验证不足。

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models Figure 1
2026-08-10cs.AI

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

2026-08-10视觉语言

论文关注多种 agentic 多模态模型合并时能力保留不均、关键动作遗忘导致长程任务失败的问题。AgentPatch 的核心思路是先选稳定合并骨干,再恢复弱任务独有残差,并用轨迹对比定位行为关键神经元进行受保护插值。六个 agentic 与多模态基准上,它能缓解弱任务退化,同时较好保留搜索和视觉处理等互补能力。

CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition Figure 1
2026-08-10cs.CV

CoDAT: Collaborative Dual-Attention Transformer with Low-Cost Temporal Modeling for Efficient Edge Action Recognition

Novendra Setyawan, Chi-Chia Sun, Mao-Hsiu Hsu, Wen-Kai Kuo, Jing-Ming Guo, Jun-Wei Hsieh

Mao-Hsiu Hsu and Wen-Kai Kuo are with Department of Electro-Optics, National Formosa University, Huwei 632301, Taiwan., Jing-Ming Guo is with Department of Electrical Engineering, National Taiwan University of Science and Technology, Taipei 106335, Taiwan., Jun-Wei Hsieh is with College of Artificial Intelligence and Green Energy, National Yang Ming Chiao Tung University, Tainan 711010, Taiwan.

2026-08-10视觉感知

面向边缘 IoT 上实时动作识别的时延、能耗和内存约束,CoDAT 用协作双注意力替代常规多头注意力:SSHA 以步幅稀疏投影压缩全局上下文,SCA 聚合局部信息,并用零参数 TShift 传递帧间信息。Jetson AGX Orin 与 Raspberry Pi 5 实验显示,其在 Kinetics-400、MA-52、UCF-101 上保持竞争精度,同时相较多种 CNN/Transformer 基线最高获得约 2.9×、5×或 6×速度优势及更低 FLOPs。

Corrupting Attention: Evasion-Based Adversarial Attacks on Encoder Attention in Detection Transformers Figure 1
2026-08-10cs.CV

Corrupting Attention: Evasion-Based Adversarial Attacks on Encoder Attention in Detection Transformers

Ridma Jayasundara, Shaheer Mohamed, Tharindu Fernando, Harshala Gammulle, Basura Fernando, Sanka Rasnayake, A V Subramanyam, Sridha Sridharan, Clinton Fookes

2026-08-10视觉感知

面向安全关键视觉系统中检测 Transformer 鲁棒性不足的问题,论文指出现有攻击多盯检测输出而忽略编码器注意力这一空间推理核心。其创新是用不可感知的有界扰动直接把模型自身注意力推向多种腐化目标,无需可见 patch 或外部 sink token。实验显示 DETR-R50 在 COCO 上 mAP 从 42.1 降至 0.97,DINO-Swin-L 从 56.8 降至 1.44,显著强于同预算 AFOG。

When Semantics Saturate or Emerge: Adaptation-Conditional Semantic Utility in Source-Free Cross-Domain Few-Shot Learning Figure 1
2026-08-10cs.CV

When Semantics Saturate or Emerge: Adaptation-Conditional Semantic Utility in Source-Free Cross-Domain Few-Shot Learning

Wei Liu, Xing Deng, Haijian Shao

2026-08-10视觉感知

本文关注源无关跨域小样本中一个常被忽略的问题:冻结 CLIP 的零样本提示词好坏,是否还能预测 LoRA 视觉适配后的价值。作者固定算法、样本和骨干,仅比较类名模板与详细描述,提出适配前后语义效用的成对评估。结果显示 EuroSAT、CropDisease 中详细语义优势被适配吸收,而 ISIC、ChestX 中语义价值反而在适配后显现,说明提示词评估不能只看零样本准确率。

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness Figure 1
2026-08-10cs.CV

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness

Julia Anna Mielcarz, Daniel Klaaby, Mostafa Mehdipour Ghazi

2026-08-10规划控制三维安全鲁棒

这篇论文关注3D医学基础模型作为MRI特征提取器时是否会被扫描伪影误导,动机是下游精度难以暴露表征层面的不稳定。作者用BraTS-Africa构造七类伪影、五档强度和四种序列,比较五个预训练3D编码器的CKA、RankMe、UMAP及分割一致性。结果显示鲁棒性强烈依赖模型和伪影类型,3DINO最稳定、BrainIAC最敏感;许多情况下表征几何已漂移但有效秩未坍缩,说明更大规模或脑MRI专用预训练并不自动带来伪影不变性,增益来源不清。

SLED: Scalable Location Encoding via Distillation Figure 1
2026-08-10cs.CV

SLED: Scalable Location Encoding via Distillation

Kevin Lane, Zhongying Wang, Esther Rolf, Morteza Karimzadeh

2026-08-10视觉感知

本文针对现有位置编码器依赖 CLIP 式对比学习、需 16K 级大 batch、易受假负样本和多模态时空配准约束的问题,提出用经纬度作为绑定模态的蒸馏框架 SLED,以 MSE 从 Sentinel-1/2、Landsat 等地观测模型中学习位置嵌入。结果显示其在 batch 128 下仍可训练,预训练最高提速 47 倍,并在 19 个以人类活动相关变量为主的基准上达到或超过 SatCLIP、GeoCLIP 等方法;多模态增益存在但并非所有任务一致。

Toward surface-based registration of a virtual preoperative cutting guide onto the mandible for reconstruction surgery Figure 1
2026-08-10cs.CV

Toward surface-based registration of a virtual preoperative cutting guide onto the mandible for reconstruction surgery

Yue Yang, Jie Ying Wu

Vanderbilt University, Department of Computer Science, 1400 18th Avenue South, Suite A4004 Nashville, TN 37212, USA.

2026-08-10三维

这篇论文针对下颌重建中实体3D打印切割导板成本高、周期长且难以术中调整的问题,提出用HoloLens 2深度点云将虚拟导板无标记配准到暴露下颌。核心思路是把牙齿作为经口视野中最稳定、最有辨识度的自然几何特征,结合牙齿加权的全局配准与非对称点到面ICP处理“完整CT模型对局部术中点云”的匹配。模型实验中,全暴露、中等暴露和仅牙齿暴露的中位TRE分别为4.05、6.10、7.10 mm,显示替代实体导板具备可行性,但延迟仍有0.805 s。

Improving Low-Resolution Face Recognition under Limited Data: How Synthetic Data Generation Can Close the Domain Gap Figure 1
2026-08-10cs.CV

Improving Low-Resolution Face Recognition under Limited Data: How Synthetic Data Generation Can Close the Domain Gap

Luis S. Luevano, Ünsal Öztürk, Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

Idiap Research Institute, Switzerland

2026-08-10视觉感知

本文关注监控等场景中低分辨率人脸缺少真实标注数据、常靠高分辨率图像合成训练的问题。作者系统比较插值退化、知识蒸馏、PDT、Real-ESRGAN式退化和身份感知超分前端,核心洞察是合成基准上的最优退化不等于真实低分辨率上的最优。实验显示合成投入并非越复杂越好,简单插值增强仅在紧凑骨干上带来改进,而超分前端未超过强骨干直接输入基线,且公平性偏差无稳定改善。

Implicit Neural Speckle Denoising Figure 1
2026-08-10eess.IV

Implicit Neural Speckle Denoising

Matthew R. Ziemann, Casey J. Pellizzari, Tyler J. Hardy, Christopher A. Metzler

DEVCOM Army Research Laboratory, 2800 Powder Mill Rd, Adelphi, MD, USA, Department of Computer Science, University of Maryland, 8125 Paint Branch Dr, College Park, MD, USA, Department of Physics and Meteorology, United States Air Force Academy, USAFA, CO, USA

2026-08-10视觉感知

这篇论文针对相干成像中动态场景无法依赖传统散斑平均、且缺少干净训练目标的问题,提出用时空隐式神经表示直接拟合带噪复场观测,并把孔径导致的空间相关散斑写入最大似然模型,而非按像素独立噪声处理。其矩阵无关实现结合 FFT、随机近似和共轭梯度以降低计算量,并用盲 holdout 准则早停。仿真和实验室数字全息结果显示,相比经典、无监督和监督基线,该方法在空间细节、时间一致性和不同孔径统计下更稳健,但代价是每个序列需重新优化,推理速度仍慢。

TaskSense: Focusing on What Matters in World Models Figure 1
2026-08-10cs.AI

TaskSense: Focusing on What Matters in World Models

SM Mazharul Islam, Manfred Huber

2026-08-10强化学习

本文针对视觉世界模型用整图重建学习表示时容易把容量浪费在背景和干扰物上的问题,提出 TaskSense:在编码前用由上一潜状态条件化的随机空间注意力筛选观测,并用逆动力学约束注意力保留与控制相关的区域,只重建被关注内容。实验显示其在标准 DeepMind Control 上接近 DreamerV3,在 Distracting Control 中更稳健;但长期奖励相关性与动作可预测性的差异仍是局限。

InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion Figure 1
2026-08-10cs.CV

InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion

Guangzhao Li, Qingyan Wei, Huayu Zheng, Yige Zheng, Chaoyang Zhang, Jie Yang, Yunan Ding, Yan Tai, Siqi Luo, Xiaohong Liu

2026-08-10视觉感知

本文针对多类别参考图像插入中统一模型容易被服饰、人物、配饰等任务的异质目标相互干扰的问题,提出先训练类别专家、再用 IOPD 将专家策略蒸馏到单一学生模型的框架,并用 TAGC、区域均衡 Flow Matching 和 Reference CFG 强化几何约束与参考一致性。在 AnyInsertion 和自建多类别测试集上,多数指标达到最优,消融显示空间控制、参考保真和跨类别整合均有贡献。

Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition Figure 1
2026-08-10cs.CV

Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

2026-08-10视觉感知

细粒度视频表情识别在跨被试推理时易受个体表情差异和稀有类别冷启动影响,传统在线 TTA 又带来优化开销。该文提出 EB-CaP,用 CLIP 视觉-文本相似度驱动轻量能量模型,从当前无标注视频即时采样个性化类别原型,并结合正负缓存、熵门控和多样性门控修正预测。在 BioVid、StressID 和 BAH 上优于现有 TTA,且保持较低计算与存储开销。

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin Figure 1
2026-08-10cs.AI

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

2026-08-10视觉感知

这篇论文针对 MLLM 视觉 token 过多导致推理昂贵的问题,指出用于剪枝的最佳中层文到视觉注意力并非固定层,而会随样本变化。作者提出 MAP,用问题对比选择样本级教师层,并将其中层注意力蒸馏到轻量预测器,使推理时可在首个语言层前剪枝。实验中,LLaVA-NeXT-7B 仅保留 5.56% 视觉 token 仍保持 97.5% 性能,并获得 3.09 倍端到端加速。

SubtleTalk: Generating Controllable Weakly-correlated Facial Dynamics for 3D Talking Heads via Residual Flow Matching Figure 1
2026-08-10cs.GR

SubtleTalk: Generating Controllable Weakly-correlated Facial Dynamics for 3D Talking Heads via Residual Flow Matching

Chenyang Ding, Shuai Tan, Qunfen Lin, Xinwei Jiang, Zijiao Zeng, Ye Pan

Shanghai Jiao Tong University, Shanghai Jiao Tong University Shanghai China

2026-08-10生成模型规划控制三维

该文针对语音驱动3D说话头虽能对齐口型、但眉眼眨动和头部等弱相关动态常静态化或重复的问题,提出SubtleTalk:用韵律、区域强度和VA情绪信号补足条件信息,并在稳定语音运动先验上做残差流匹配以建模一对多变化;同时构建约3900身份、74小时的SubtleTalk-Face数据集。实验显示其在弱相关动态的真实感和多样性上优于既有方法,同时保持口型同步,但部分增益可能主要来自数据规模和标注质量提升。

TransSLR: A Lightweight Transformer for Sign Language Recognition Figure 1
2026-08-10cs.CV

TransSLR: A Lightweight Transformer for Sign Language Recognition

Lucia Yen Wanchi, Samuel Johnny, Victor Tolulope Olufemi, Emmanuel Aaron, Moise Busogi

Carnegie Mellon University Africa

2026-08-10视觉感知

这篇论文针对中非手语等低资源手语识别中,大规模 ASL/WLASL 预训练模型因词汇和动作域差异难以迁移的问题,提出从头训练的轻量级 TransSLR,用归一化骨架姿态序列替代 RGB 外观建模,以提升跨签者泛化和部署效率。在 CASL-W60 上达到 80.39% 准确率,较此前最佳提升 10.46 个百分点。

Deep Evidential Regression for Sparse Forest Height Estimation from Multimodal Satellite Imagery Figure 1
2026-08-10cs.CV

Deep Evidential Regression for Sparse Forest Height Estimation from Multimodal Satellite Imagery

Laura Bader, Muhammad Ammar Ahmed, Xiao Xiang Zhu, Göran Kauermann

2026-08-10视觉语言视觉感知

针对森林高度遥感估计中标注稀疏、地域分布偏移且常规 U-Net 只给点预测的问题,本文将深度证据回归接入多模态 Sentinel-1/2 U-Net,并用 masked evidential loss 只在有效树木清查像素上训练,从而单次前向同时输出高度及 aleatoric、epistemic 不确定性。实验显示其高度预测接近确定性 U-Net,同时不确定性校准更有意义,尤其在林地边界等困难区域升高;但不确定性分解解释仍偏启发式,非林地区零高度学习不足。

UAV3DCrop: Benchmarking 3D Reconstruction in Repeated Multi-Angle UAV Crop Surveys Figure 1
2026-08-10cs.CV

UAV3DCrop: Benchmarking 3D Reconstruction in Repeated Multi-Angle UAV Crop Surveys

Junxiong Zhou, Xuechen Li, Chonghao Qiu, Lang Qiao, Xiaowei Jia, Qi Yang, Chishan Zhang, Leikun Yin, Nanshan You, Vipin Kumar, David Mulla, Ce Yang, Zhenong Jin, Licheng Liu

University of Minnesota, Twin Cities, USA, University of Wisconsin–Madison, USA, University of Pittsburgh, USA, Max Planck Institute for Biogeochemistry, Germany, Boston University, USA, Peking University, China

2026-08-10数据集/基准三维

论文针对作物三维监测中“图像渲染好不等于几何和农学指标可靠”的问题,构建UAV3DCrop基准,覆盖4类作物、91个场景和重复多角度无人机航测,并分场景优化与零样本前馈两条轨道评测。核心洞察是不同目标会改变方法排序:Splatfacto-big外观最佳,Scaffold-GS深度和冠层高度更强;前馈模型中仅MapAnything较稳定地恢复米制尺度,其余模型的尺度失败会被对齐评测掩盖。

DREAMS: Diverse Reactions of Engagement and Attention Mind States Dataset Figure 1
2026-08-10cs.HC

DREAMS: Diverse Reactions of Engagement and Attention Mind States Dataset

Monisha Singh, Gulshan Sharma, Ximi Hoque, Abhinav Dhall

2026-08-10数据集/基准

本文关注人机交互中“看起来投入”与“真正专注”并不总一致的问题,构建了含32名用户自然场景面部视频、自标注参与度与注意状态的DREAMS数据集,并比较单任务、迁移和多任务分类。结果显示,迁移/多任务对参与度预测更好,注意力似乎比参与度更能指示另一方;较高参与和注意还与更低认知负荷、更好问答表现相关。

TRACE: Ergodic Trajectory Optimization for Active Scene Reconstruction Figure 1
2026-08-10cs.RO

TRACE: Ergodic Trajectory Optimization for Active Scene Reconstruction

Ziyue Zheng, Linli Shi, Bingkun He, Wen Jiang, Ziyun Wang

2026-08-10规划控制优化算法三维

TRACE针对Gaussian Splatting主动重建中NBV逐点贪心规划导致路径割裂、转场浪费感知预算且难满足动力学约束的问题,将任务改写为遍历覆盖式轨迹优化:从在线地图的不确定性和可见性生成信息分布,并用核遍历 horizon planner、梯度流和视野耗竭机制联合优化可执行轨迹与观测覆盖。在Replica八个场景中,相同mapper与预算下较最强NBV基线平均提升约1.5 dB PSNR,并展示可直接在四足和机械臂上执行。

$\boldsymbolλ$-Orthogonality Regularization for Compatible Representation Learning Figure 1
2026-08-10cs.LG

$\boldsymbolλ$-Orthogonality Regularization for Compatible Representation Learning

Simone Ricci, Niccolò Biondi, Federico Pernici, Ioannis Patras, Alberto Del Bimbo

DINFO (Department of Information Engineering), University of Florence, Italy, MICC (Media Integration and Communication Center), Queen Mary University of London, UK

2026-08-10视觉感知

面向大规模检索系统更新时新旧模型嵌入不兼容、全量回填成本高的问题,论文提出在仿射映射中加入可调的 λ-正交性正则,在保持旧表示几何结构的同时允许面向下游分布的局部适配,并结合监督对比损失与部分回填排序策略。实验称其在多架构、多数据集上优于既有兼容学习方法,能较好保留零样本性能,并用少于一半图库回填接近新模型效果。

2026-08-07

132 篇
Does FLAIR super-resolution erase or hallucinate small white-matter lesions? Figure 1
2026-08-07cs.CV

Does FLAIR super-resolution erase or hallucinate small white-matter lesions?

Zahra Khodakarami, Yue Li, Pulkit Khandelwal, John Detre, Sandhitsu Das, Christopher Brown, David Wolk, Paul Yushkevich

2026-08-07视觉感知

临床 FLAIR 常为厚层采集,超分辨率虽可改善各向同性重建,但可能影响白质高信号小病灶的真实保留。本文以 ADNI 高分辨率 FLAIR 人工标注为参照,模拟 3/5 mm 厚层并按单病灶评估“擦除”和“幻觉”。结果显示 SR 的主要风险是擦除真实小病灶且随层厚加重,而非产生大量假病灶;ECLARE 保留小病灶最好,T1 引导 INR 仅接近三次插值,提示应按病灶保真度而非视觉质量验证 SR。

UQ-Loc: Uncertainty-Aware LiDAR Scene Coordinate Regression Figure 1
2026-08-07cs.CV

UQ-Loc: Uncertainty-Aware LiDAR Scene Coordinate Regression

Jacek Komorowski

2026-08-07安全鲁棒

该文针对LiDAR场景坐标回归只给确定性对应点、难以区分玻璃、植被、动态物体等低可信区域的问题,在LightLoc上加入逐体素各向异性高斯协方差头,用NLL与kNN平滑训练,并把不确定性引入SC2-PCR的种子打分和马氏距离内点判定。实验报告显示其提升6DoF定位精度,同时得到校准较好的协方差,但具体增益在不同模块间的来源仍需消融支撑。

TLNM: Externally Validated Tooth Detection, Numbering and Segmentation from Smartphone Photographs Using Mask R-CNN Figure 1
2026-08-07cs.CV

TLNM: Externally Validated Tooth Detection, Numbering and Segmentation from Smartphone Photographs Using Mask R-CNN

Arash Nedaei, Henna Tiensuu, Elina Väyrynen, Saujanya Karki, Jaakko Suutala

2026-08-07视觉感知

面向普通手机口腔照片难以替代临床影像、且远程筛查缺少可靠牙位索引的问题,TLNM在Mask R-CNN中加入遮罩灰世界白平衡和解剖约束检测层,以降低光照、遮挡和误检影响。模型在1272张标注图像上训练,内测AP50为0.818、F1为0.884,外部数据上AP50达0.901、F1达0.928,显示跨设备与采集协议仍具一定泛化性。

OTLesMix: Wasserstein Barycenter and Optimal Transport Map for Synthetic Lesion Generation with Diverse Shapes and Locations Figure 1
2026-08-07cs.CV

OTLesMix: Wasserstein Barycenter and Optimal Transport Map for Synthetic Lesion Generation with Diverse Shapes and Locations

Robin Trombetta, Carole Lartizien

2026-08-07视觉感知

这篇论文针对医学图像分割中标注稀缺、常规混合增强难以产生多样病灶形状与位置的问题,提出 OTLesMix:用 Wasserstein 重心插值生成新病灶掩码,再用最优传输映射补全病灶强度并贴入训练图像。其核心洞察是把形状、位置和纹理迁移分开建模,无需训练生成模型。三项脑病灶分割实验中,相比不用合成数据 Dice 提升 2.9 至 6.6 点,并优于已有 mix-based 方法。

MASS: Multiplayer World Models with Authoritative Shared State Figure 1
2026-08-07cs.CV

MASS: Multiplayer World Models with Authoritative Shared State

Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

2026-08-07强化学习

这篇论文针对多人世界模型把世界状态与各玩家视角潜变量混在一起,导致重复计算、跨视角不一致和扩展性差的问题,提出以“权威共享状态”作为唯一递归记忆:Logic Engine预测类型化全局状态,再由Rendering Engine按相机渲染视图。实验在多人Snake等任务上显示,MASS的状态恢复率达0.76,高于最强视频基线0.128,并可推进1024名玩家、10000步的长滚动。

Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model Figure 1
2026-08-07cs.CV

Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model

Saad Ahmed, Md Khalid Syfullaha

2026-08-07视觉感知

这篇论文针对孟加拉手语识别难以在手机等端侧部署的问题,指出现有数据多为受控采集且缺少专家验证、模型又依赖重型预训练骨干。作者构建了专家校验的 RSBdSL38 数据集,并设计 29.8 万参数的注意力轻量 CNN;模型从零训练达 96.37% 准确率,量化后 0.48 MB、手机单图 3.98 ms,但独立签名者划分降至 85.18%,显示真实泛化仍是主要瓶颈。

PRISM: Distribution-Gated Flow Matching for Controllable Unpaired Image Translation Figure 1
2026-08-07cs.CV

PRISM: Distribution-Gated Flow Matching for Controllable Unpaired Image Translation

Elad Yoshai, Natan T. Shaked

2026-08-07视觉感知生成模型规划控制

本文针对无配对图像翻译中“哪些区域该变、哪些结构该保留”难以用全局噪声或引导系数控制的问题,提出 PRISM:用源特征到目标分布的标准化距离学习逐特征门控,并同时控制初始化与流匹配 ODE 传输时序,可在推理时局部覆盖。实验覆盖自然图像与病理等五个任务,PRISM 在四项取得最佳 FID/KID,第五项接近最优,病理核计数保持也最接近理想。

Depth-Guided Video Object Counting in Crowded Scenes Figure 1
2026-08-07cs.CV

Depth-Guided Video Object Counting in Crowded Scenes

Yuanjing Xu, Xinyan Liu, Weidong Chen, Zixuan Zou, Linhao Zhang, Zhuangzhe Meng, Antoni B. Chan, Weigang Zhang

Harbin Institute of Technology, City University of Hong Kong, University of Science and Technology, Qingdao Research Institute

2026-08-07视觉感知

本文面向货架盘点、仓储巡检等拥挤遮挡视频中的实例计数,指出仅靠 RGB 难以区分外观相近且相互遮挡的目标。核心做法是在检测和跨帧去重中显式引入深度线索,通过多尺度 RGB-D 交叉注意力、遮挡预测和深度约束跟踪减少漏检与重复计数;同时发布 RGBD-VideoCount 数据集。实验称相对基线 MAE 降低 62.01%,RMSE 也有一致改善。

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation Figure 1
2026-08-07cs.CV

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

Bingyuan Wang, Baistan Zhyldyzbekov, Kunyu Feng, Zeyu Wang

2026-08-07视觉感知强化学习规划控制

本文针对视频生成中情绪常被单一文本条件混合表达、导致氛围泛化、语义线索弱和情绪过渡突兀的问题,提出在冻结 Video DiT 内将视觉氛围、局部情感语义线索和时间演化解耦的 EmoWorld。其核心是用中性/情绪化全景对离线提取层级情感方向和线索库,并以 VAS、SAS、TAS 分别控制全局、局部和时序情绪;在 Wan2.2 上分别带来 19%/37% 的情绪对齐提升和 15% 的过渡单调性提升,但效果仍可能部分来自离线编辑数据与多次前向 scaling。

Reversible Unlearnable Examples: Towards the Copyright Protection in Deep Learning Era Figure 1
2026-08-07cs.CR

Reversible Unlearnable Examples: Towards the Copyright Protection in Deep Learning Era

Binze Wang, Jinyu Tian, Xingrun Wang, Xiaochen Yuan, Jianqing Li

2026-08-07视觉感知

针对深度学习中图像数据既可能被盗用于训练、又可能泄露后需验证归属的问题,本文指出直接叠加不可学习扰动与数字水印会相互干扰。其方法用最小化输入输出互信息生成可逆的类级不可学习扰动,并设计双水印提取器,使扰动存在或移除时都能验权;在 ImageNet、CIFAR10 和 Pets 上实验显示可同时降低未授权训练效果并保持水印提取可靠性。

CFGPNet: Cross-Attention-Based Fused Gradient Programmed Network Framework for Multispectral Object Detection Figure 1
2026-08-07cs.CV

CFGPNet: Cross-Attention-Based Fused Gradient Programmed Network Framework for Multispectral Object Detection

Nima Hatami, Karim Faez, Saeed Sharifian, Hamidreza Amindavar

aDepartment of Electrical Engineering, Amirkabir University of Technology, 15914, Tehran, Iran, offering useful accuracy–efficiency trade-offs across three model scales. The code, data, and fine-tuned models are available at, even when cross-modal information is available [5]. From an

2026-08-07视觉感知优化算法

CFGPNet面向低照、恶劣天气和多尺度场景下RGB-T检测中跨模态交互不足、融合不稳和注意力开销高的问题,采用RepViT式GELAN骨干、Cross-CEA高效交互、ASAF选择聚合融合,并加入可编程梯度辅助分支改善训练。其在FLIR、M3FD、LLVIP、VEDAI、MFAD五个基准上给出较强mAP结果,但各模块相对增益与是否主要来自模型规模或训练配置仍需看消融细节。

HOPE: Hand-Object Pressure Estimation from Monocular Videos Figure 1
2026-08-07cs.CV

HOPE: Hand-Object Pressure Estimation from Monocular Videos

Subin Jeon, Byungjun Kim, Hanbyul Joo

Seoul National University

2026-08-07视觉感知

HOPE针对现有视觉压力估计多局限于平面传感器和单帧输入、难以处理任意手物交互的问题,将单目视频中的压力与接触统一表示到MANO手网格顶点上,并融合触觉手套、平面压力与仅接触数据训练;顶点锚定视频Transformer结合接触门控压力头建模时序载荷变化。实验覆盖OpenTouch、PressureVisionDB和HOI接触基准,显示其可从戴手套监督泛化到裸手及野外视频。

EvReflection: Event-Driven Micro-Dynamics for Reflection Removal Figure 1
2026-08-07cs.CV

EvReflection: Event-Driven Micro-Dynamics for Reflection Removal

Jiaxiao Wang, Dachun Kai, Huyue Zhu, Quanquan Hu, Zhenyang Xu, Xiaoyan Sun

2026-08-07视觉感知

本文针对玻璃反射去除中单帧外观先验易混淆、传统多帧又依赖较大位移的问题,提出用事件相机捕捉轻微手持运动下反射层与透射层的微动态差异。EvReflection 通过 MDD 分离事件流中的层级运动先验,再由 PAR 调制 RGB 特征完成去反射,并配套仿真流程与 EVR2 数据集;在合成和真实基准上分别较最佳方法提升超过 1.6 dB 和 1.2 dB PSNR。

Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions Figure 1
2026-08-07cs.CV

Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions

Zhongyao Wang, Wanli Ouyang, Taoyong Cui, Pheng Ann Heng

2026-08-07视觉感知规划控制

论文针对冻结视觉编码器分析中只看“变了什么”而忽略“在哪里变”、且多操作可能共用同一槽位的操作洗白问题,提出支持×操作网格、留一单元评测与SO-OPF分解读出。结果显示DINOv3在Shapes3D和COCO上可较好恢复保留组合,但从扁平标签学习分配有代价;MuJoCo上出现明显槽位塌缩,说明方法能暴露而非消除跨渲染器边界。

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments Figure 1
2026-08-07cs.RO

Prior-SG: Task and Prior Driven Region Segmentation for Scene Graphs in Arbitrarily-Structured Environments

Giorgio Tonetti, Laurent Kneip, Abel Gawel, Marco Hutter

Giorgio Tonetti, Laurent Kneip, Abel Gawel, and Marco Hutter are with the RAI Institute. Additionally, Giorgio Tonetti and Marco Hutter are with ETH Zurich.

2026-08-07视觉感知

该文针对传统3D场景图依赖局部视觉聚类或墙体等几何假设、难以处理开放式和任意结构环境的问题,提出Prior-SG:用LLM生成任务相关的先验图,并将RGB-D构建的实例图与多尺度开放词汇特征、物体、几何和拓扑约束做MAP/MRF对齐。实验显示其在模拟住宅和真实开放场景中提升语义区域分割精度,可在无物理墙边界时划分功能区域,并支持按任务零样本重构空间语义。

BendTwin: Robust Dense-to-Sparse Physical Reconstruction with Bending-Aware Differentiable Spring-Mass Models Figure 1
2026-08-07cs.CV

BendTwin: Robust Dense-to-Sparse Physical Reconstruction with Bending-Aware Differentiable Spring-Mass Models

Yixiong Jing, Qi Wang, Lin Chen, Junwei Jiang, Guangming Wang, Haibing Wu, Olaf Wysocki, Wanli Ma, Brian Sheil

University of Cambridge, Institute of Automation, Chinese Academy of Sciences, Northwestern Polytechnical University, The Hong Kong Polytechnic University

2026-08-07三维安全鲁棒

BendTwin面向机器人交互中从稀疏RGB-D视频构建可预测的可变形物体数字孪生,指出仅用轴向弹簧的PhysTwin在图被下采样后容易欠约束、局部形变不稳。其核心是在可微弹簧-质点模型中加入表面三元组的弯曲刚度与阻尼,用角度偏差约束补足长度约束。实验显示其在重建、再仿真和未来预测上优于轴向基线,并在不同下采样比例下保持更稳定。

Visual Grounding in Zero-Shot Vision-Language Control Figure 1
2026-08-07cs.RO

Visual Grounding in Zero-Shot Vision-Language Control

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà

2026-08-07视觉语言视觉感知规划控制

本文针对零样本视觉语言控制中“轨迹成功是否真的来自视觉理解”这一问题,提出包含盲图、重复输入、车道轴镜像、非视觉基线和管线检查的输入消融评测。结果显示,多数直接控制 VLM 近似图像不变,常速慢行策略甚至优于几何脚本,六个本地 VLM 均未同时满足纵向与横向视觉 grounding;但对称共识守护器可在受控泄漏下实现约 0.954 平衡准确率,说明当前 VLM 更适合作为选择性纵向危险辅助,而非端到端控制器。

CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query? Figure 1
2026-08-07cs.AI

CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?

Zijie Wang, Chen Zhong, Wei He

2026-08-07视觉感知

本文关注开放词汇遥感变化检测中,每个文本查询都重复解析双时相场景、且时间证据与语义判别相互耦合的问题。CogVis将任务拆成场景变化感知、语义记忆校准和区域验证:先提取可复用的类别无关变化先验,再为具体查询估计阈值并过滤不可靠候选。七个基准上报告达到SOTA,且多查询推理吞吐提升28.50%。

Learning visual representations for compositional analysis of artworks and photographs Figure 1
2026-08-07cs.CV

Learning visual representations for compositional analysis of artworks and photographs

Fatemeh Behrad, Tinne Tuytelaars, Johan Wagemans

KU Leuven University

2026-08-07视觉感知

本文针对艺术作品与照片中“构图”难以从语义内容中分离、且缺少可解释表示的问题,比较了基于人类知觉分组的 OCL 区域分解加 GAT 空间关系建模,与微调自监督基础模型两条路线。结果显示,冻结编码器时 OCL+GAT 以较少参数取得有竞争力且可解释的表现;数据充足并微调时 DINOv2 更强,但代价是解释性和跨域泛化下降,部分增益可能主要来自 scaling / data。

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation Figure 1
2026-08-07cs.CV

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation

Manuel Laufer, Dominik Mairhöfer, Malte Sieren, Hauke Gerdes, Fabio Leal dos Reis, Arpad Bischof, Thomas Käster, Erhardt Barth, Jörg Barkhausen, Thomas Martinetz

2026-08-07三维

这篇论文针对放射检查中摆位不规范会导致重拍、增加辐射的问题,提出从既有 CT 扫描合成配对的深度图与 X 光图像,用于训练拍片前的患者姿态评估模型。核心价值在于绕开真实采集的伦理与监管限制,并可生成非诊断姿态样本。实验在上踝关节任务上显示,3077 对合成图像预训练可提升真实数据姿态评估,最高增益约 11 个百分点,但验证仍限于单部位、单中心和特定采集设置。

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training Figure 1
2026-08-07cs.CV

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

2026-08-07生成模型强化学习安全鲁棒

论文针对扩散模型后训练中潜空间奖励只给标量、无法判断反馈可靠性的问题,提出 SURE:让 SURE-LRM 从普通成对偏好中预测样本自适应的奖励均值与不确定性,并由 SURE-REFL 在去噪轨迹中按可靠性加权局部反馈,避免反复解码和完整反传。实验显示其提升偏好预测,在图像与视频生成指标、VBench 质量/语义/总分及训练稳定性上优于对比方法。

Confidence matters: Leveraging Multi-view Geometric Priors for GS-based Reconstruction Figure 1
2026-08-07cs.CV

Confidence matters: Leveraging Multi-view Geometric Priors for GS-based Reconstruction

Hongyu Zhou, Zorah Lähner

2026-08-07三维

本文针对 3DGS 依赖 SfM 初始化和光度优化、在高反光或弱纹理场景中几何重建易失真的问题,系统考察法线与深度先验的接入方式。核心洞察是多视角模型 VGGT 产生的几何预测不仅比单视角更稳定,其置信度图还能对错误先验降权,避免正则化传播伪几何。实验显示该策略在多个基准上提升网格重建质量,尤其对镜面物体和复杂场景增益明显。

Dense-Cast: A lightweight ensemble of deep learning architectures for precipitation nowcasting Figure 1
2026-08-07cs.CV

Dense-Cast: A lightweight ensemble of deep learning architectures for precipitation nowcasting

Gourav Jyoti Kalita, Hidam Kumarjit Singh

Department of Electronics and Communication Technology, Gauhati University, Guwahati-781014, pathway for water returning to the atmosphere, influencing freshwater availability, agricultural, tackle problems caused by diverse patterns of precipitation, data unavailability and imbalance arising

2026-08-07视觉感知

这篇论文面向东北印度季风期强降水的短临预报需求,将降水预测建模为仅依赖历史降水图像的确定性图像到图像任务。核心做法是把 DenseNet 式密集连接、残差结构、深度可分离卷积和 Transformer 编码器组合成轻量模型,用前 5 个半小时步预测后 2 个半小时。基于 GPM IMERG 数据,30 分钟预报达到 MAE 0.235 mm、RMSE 0.735 mm、KGE 0.816,但相对各组件的独立增益来源仍不够清晰。

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case Figure 1
2026-08-07cs.CV

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

2026-08-07视觉感知

本文以阴影去除检验通用视觉语言/生成编辑模型是否能替代传统低层视觉先验。核心洞察是,单次生成虽能去阴影但易幻觉或改写场景,因此提出带探测、失败筛选、重试、多候选过滤与物理阴影形成约束的 agentic 选择流程。该方法在 SRR 基准上 CDD 达 0.0075,较最强先前方法降低至少 47%,但文中也指出非阴影区域保真仍会受生成编辑影响。

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents Figure 1
2026-08-07cs.CV

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

2026-08-07视觉感知

这篇论文针对离线训练移动 GUI 代理时“只看当前前缀却丢掉下一屏证据”的监督缺口:许多操作为什么正确,要到点击后的界面才显现。作者提出 GHD,把下一张截图作为训练期特权信息,让共享参数教师在学生失败且能用后见信息恢复示范动作时才进行蒸馏。实验显示其在 AndroidWorld 和 AndroidLab 上优于 SFT/GRPO,7B、8B 开放数据模型平均 Pass@1 均提升,且推理阶段不增加额外模块。

Bar-JEPA: Extracting Values from Bar Chart with Joint-Embedding Predictive Architecture Figure 1
2026-08-07cs.CV

Bar-JEPA: Extracting Values from Bar Chart with Joint-Embedding Predictive Architecture

Poonam Poonam, Alexander Epple, Timo Ropinski

2026-08-07视觉感知

针对真实标注柱状图稀缺导致图表反渲染难训练的问题,Bar-JEPA 将自监督微调的 I-JEPA 用作柱状图特征提取器,并改造为支持可变分辨率输入,再用轻量解码器回归柱、刻度和原点以恢复数值。实验显示,领域内自监督微调能明显提升下游表现、加快收敛,但方法仅覆盖垂直非堆叠柱状图且未达到 SOTA。

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval Figure 1
2026-08-07cs.CV

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

Glint Lab, (LVLM)-based retrievers are efficient and scalable, directly encoding raw multimodal, Meng et al., 2025). Although efficient and scalable, directly encoding the, query elaboration.

2026-08-07视觉语言

本文针对统一多模态检索中直接嵌入易忽略细粒度差异、查询式 CoT 又不了解检索器误判的问题,提出 UniME-R1:先看初检候选,用 adviser 诊断 hard negatives 暴露的混淆点,生成面向检索的 RC-CoT,并自适应选择重排或全库再检索。实验在 MMEB-V2 及多类图文、视频、文档检索任务上相对强基线取得稳定提升,但具体增益中数据构造与强化学习各自贡献仍需结合消融判断。

DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval Figure 1
2026-08-07cs.CV

DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval

Xi Chen, Xu Chen, Xiangyang Jia, Wei Wang, Xu Zhang, Zhenyuan Sun

2026-08-07视觉感知

针对遥感图文档案持续增长时,直接微调会因尺度变化、文本语义漂移和检索排序结构破坏而遗忘历史数据的问题,DARAD在视觉端用空间融合适配器处理多尺度线索,在文本端用多专家语义路由限制嵌入漂移,并通过双向排序蒸馏保留历史跨模态排名。多阶段持续检索实验显示,其在新数据适应和历史性能保持上优于现有持续学习基线。

Integrating Implicit and Explicit Relational Biases through Graph-Based Multiple Instance Learning: A Case Study in Skin Lesion Diagnosis Figure 1
2026-08-07cs.AI

Integrating Implicit and Explicit Relational Biases through Graph-Based Multiple Instance Learning: A Case Study in Skin Lesion Diagnosis

Rafał Buler (1), Jakub Buler (1), Maciej Bobowicz (2), Michał Grochowski (1) ((1) Gdańsk University of Technology, (2) Medical University of Gdańsk)

Gdańsk University of Technology, Gdańsk, Poland, Medical University of Gdańsk, Gdańsk, Poland

2026-08-07视觉感知

针对医学图像中仅靠卷积或独立 patch 聚合难以刻画病灶区域关系的问题,论文把 ConvMAE 自监督学习到的隐式 patch 表征与图结构 MIL/GNN 的显式消息传递结合,比较网格、随机和 kNN 拓扑。结果显示组合式关系建模优于单独隐式建模:ISIC-2018 balanced accuracy 从 EfficientNetB3 的 76.17% 提升到 79.27%,ISIC-2019 从 59.84% 提升到 60.67%,但跨数据集增益幅度有限。

PaCoNet: Deep Data Extraction for Parallel Coordinates Figure 1
2026-08-07cs.CV

PaCoNet: Deep Data Extraction for Parallel Coordinates

Poonam Poonam, Hannah Kniesel, Pere-Pau Vázquez, Timo Ropinski

2026-08-07视觉感知

平行坐标图常用于高维数据分析,但线段密集重叠使现有柱状图、折线图抽取方法和VLM难以恢复逐样本数据。PaCoNet将图像恢复、颜色类别分离与基于线先验的结构检测结合,并构建大规模合成训练/基准数据集。实验显示其在合成测试上优于VLM、DHT和DHLP,LC-MAE降至约0.37,遮罩过滤后sAP也显著提高;真实图仅做定性展示,泛化幅度仍文中未充分说明。

Iterate or Widen? When Test-Time Refinement Helps LiDAR Scene Completion: A Controlled Study of Evidence Geometry, Training Coverage, and Compute Figure 1
2026-08-07cs.CV

Iterate or Widen? When Test-Time Refinement Helps LiDAR Scene Completion: A Controlled Study of Evidence Geometry, Training Coverage, and Compute

Shijie Hao, Weining Zhang

Phillips Exeter Academy, Cheung Kong Graduate School of Business

2026-08-07规划控制

本文关注 LiDAR 语义场景补全中测试时计算应投向迭代细化还是更宽的一次性预测。其价值在于用参数匹配、相同腐蚀掩码和训练覆盖控制拆开混杂因素,指出迭代收益受证据几何约束:连续扇区缺失下较宽模型提升 0.911 mIoU,但独立稀疏化仅增 0.300,远小于观测族增强的 5.975;对加性杂波无效且带来更高延迟和显存。

Wan-Animate-2: Pushing the Application Boundaries of Character Animation Figure 1
2026-08-07cs.CV

Wan-Animate-2: Pushing the Application Boundaries of Character Animation

Guangyuan Wang, Li Hu, Dechao Meng, Zhongyi Zhang, Peng Zhang, Mingyang Huang, Ruoshi Zhang, Ke Sun, Zhe Zhang, Xingjun Wang, Gang Cheng, Bang Zhang

Tongyi Lab, Alibaba Group

2026-08-07学习理论

本文针对角色动画中显式/隐式运动表示易丢失细节、身份漂移,以及 ICL 方案计算成本高、难以实时交互的问题,提出直接在重设计 DiT 中消费驱动视频的 Wan-Animate-2,并用双分支、时间对齐 RoPE、稀疏参考注意力和文本视角 LoRA 改善运动注入与视角控制;Lite 版通过教师强制、误差缓冲和 Self-Forcing 蒸馏降低延迟。实验和用户研究显示其在多角色与复杂动作上提升保真度并接近实时流式动画,但具体量化增益来源仍需看完整实验细节。

Universal Concept Disruption for SAM3 Image Segmentation Figure 1
2026-08-07cs.CV

Universal Concept Disruption for SAM3 Image Segmentation

Hao Wang, Yuxuan Zhang, Wei Yang

2026-08-07视觉感知

针对 SAM3 从几何提示转向开放词汇概念分割后鲁棒性缺口,论文指出 presence-gated 概念存在判断会成为新的通用攻击面,并提出 UCD 用单一有界扰动联合破坏文本条件输入、共享视觉特征、存在门控分数和掩码空间有效性。在五个数据集上,UCD 将平均 mask AP 从 59.43 降至 18.73、cgF1 从 50.32 降至 20.49,并可迁移到 SAM3.1 和视频推理,简单防御恢复有限。

Multi-Year Geospatial Reasoning using Interannually-Consistent Historical Predictions as a Free Input Modality Figure 1
2026-08-07cs.CV

Multi-Year Geospatial Reasoning using Interannually-Consistent Historical Predictions as a Free Input Modality

Syed Roshaan Ali Shah, Kasper Bonte, David Bekaert, Kristof Van Tricht, Dieter Wens

2026-08-07视觉感知

论文针对年度地球观测产品每年独立分类、却闲置历史预测与外部掩膜的问题,提出把过往类别及置信度作为免费输入模态,用CTY嵌入编码器按年份建模,并将BVL掩膜在历史和目标年中一致表示。在约540万欧洲作物像素上,历史预测使作物类F1提升1.6个百分点,BVL一致建模再带来约2.5个百分点,增益主要集中在多年稳定的果树和多年生作物。

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model Figure 1
2026-08-07cs.CV

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

Shanghai Jiao Tong University, Shanghai Artificial Intelligence Laboratory, Shanghai Jiao Tong University Shanghai China, Shanghai Artificial Intelligence Laboratory Shanghai China

2026-08-07视觉感知生成模型

针对短视频扩散模型外推到长视频时易出现时序不连贯、运动单一或片段断裂的问题,Diff-VF提出无需训练的插件式长视频生成框架,通过混合噪声初始化、加权窗口采样和时间扩展采样,在潜空间同时约束全局语义、平滑窗口衔接并建立远程依赖。实验在LaVie和HunyuanVideo上表明,其相较FreeNoise、FreeLong、RIFLEx在时序一致性与运动多样性之间取得更好折中,并保持接近的逐帧质量。

Topology-Aware Neighborhood Learning for Source-Free Cross-Scene Hyperspectral Image Classification Figure 1
2026-08-07cs.CV

Topology-Aware Neighborhood Learning for Source-Free Cross-Scene Hyperspectral Image Classification

Qingmei Li, Juepeng Zheng, Jiarui Zhang, Jianxi Huang, Haohuan Fu

in part by the Fundamental Research Funds for the Central Universities, Sun Yat-sen University, under Project 24xkjc002

2026-08-07视觉感知

这篇论文针对高光谱跨场景分类中源数据因隐私或存储限制不可用的问题,转向源-free自适应。核心做法是用熵动量伪标签稳定目标域监督信号,并通过上下文邻域拓扑同时建模全局协同关系与局部近邻结构,以替代源数据对齐。三组跨场景实验显示其优于现有方法,消融也支持各模块贡献。

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models Figure 1
2026-08-07cs.CV

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller

2026-08-07数据集/基准三维

该文关注3D CT基础模型能否在不微调时支持全扫描偶发病灶识别,提出以冻结特征在三类胸部CT队列上比较10个编码器,并用kNN、零样本和线性探针隔离表征能力。结果显示没有统一最优模型,细粒度token化结合影像-文本对齐通常更强,但轻量监督模型仍有竞争力;更关键的瓶颈来自病灶大小与组织对比度,小而低对比的局灶病变普遍难以被全局嵌入捕获。

Training a Conditioned Video Game Agent on a VLM Annotated Dataset Figure 1
2026-08-07cs.AI

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

Katrin Schmid, Iuri Frosio

2026-08-07视觉语言视觉感知数据集/基准

论文针对视频游戏强化学习中奖励依赖引擎访问、设计成本高且常稀疏的问题,提出用VLM按人类可描述目标为离线游戏数据标注奖励,再训练可由期望回报条件化的代理。在Trackmania小规模实验中,代理能实时估计这些奖励并随回报设定改变驾驶行为,但作者也指出结果仍属早期,稀疏奖励和训练稳定性限制明显。

VLMs for Videogame Data Annotation Figure 1
2026-08-07cs.AI

VLMs for Videogame Data Annotation

Katrin Schmid, Iuri Frosio

2026-08-07视觉语言视觉感知

这篇论文关注 VLM 在电子游戏视频中自动标注奖励信号的可靠性,动机是游戏场景与真实世界视觉和物理规律存在明显域差。作者以赛车游戏帧序列问答为例,指出 VLM 会误读位置、碰撞和屏幕提示,并提出基于少量人工标注的线性 Reward Annotation Model、提示优化及输入长度/分辨率/批量提问分析。结果显示,单个 VLM 零样本表现不稳,输出混合和优化提示可提升标注质量,但成本、时序精度和上下文长度之间仍需权衡。

GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models Figure 1
2026-08-07cs.AI

GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models

Shuai Wang, Yaxin Feng, Xuekun Jiang, Shihan Tian, Ningyu Yan, Xing Shen, Chaoyang Lyu, Hui Wang, Yunsong Zhou, Hanqing Wang, Jiangmiao Pang, Yang Xiang, Xing Gao, Chunhua Shen, Weinan Zhang

2026-08-07视觉感知强化学习数据集/基准

GAUGE针对机器人学习中仿真视觉逼真但物理不准的问题,提出以真实实验测量为基准的诊断评测,覆盖刚体、线缆、织物和体积软体,并同时考察物理引擎与视频世界模型。结果显示没有引擎在各类任务上都可靠,冲击接触、快速织物运动和大变形误差突出;视频模型虽能生成符合法律形式的轨迹,却常估错加速度、动量传递和振荡时序。

Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models Figure 1
2026-08-07cs.CV

Respect Your Zero-Shot Uncertainty: Conservative Calibration for Test-Time-Adapted Vision-Language Models

Jingyan Jiang, Yaru Sun, Xiao Chen, Jiazhen Huang, Caiting Li, Zhijian He, Yin Chen, Pingting Hao

2026-08-07视觉语言视觉感知安全鲁棒

这篇论文关注视觉语言模型在测试时适应后虽提升识别率、却常让置信度失准的问题,尤其影响安全场景中的决策可信度。核心洞察是 TTA 会在预测类别不变时继续降低熵、抬高置信度,形成“预测保持锐化”;作者据此提出 ZAEC,用零样本熵作逐样本锚点,对过度锐化样本做最小温度缩放且不改排名。实验覆盖5种TTA方法和15个数据集,ZAEC在ViT-B/16上取得最低平均ECE,RN50上也有一致改善。

MirrorNet: Can Medical Image Anonymization Really Protect Patient Identity? Figure 1
2026-08-07cs.CV

MirrorNet: Can Medical Image Anonymization Really Protect Patient Identity?

Attila Simkó

Department of Diagnostics and Intervention, Umeå University, Umeå, Sweden

2026-08-07视觉感知

论文质疑医学影像去标识化只删除元数据是否足以保护身份,提出用一对循环一致VAE在骨盆CT切片与人脸照片间学习可逆跨域映射,刻意通过低维潜变量而非配准传递信息。实验报告可从保留测试CT恢复可识别身份图像,identity-region MAE为0.163,并可反向合成CT;但因真实患者照片缺失、使用固定 surrogate identity 配对,身份泄露结论的外推强度文中未充分说明。

Floating Radiance Networks Figure 1
2026-08-07cs.CV

Floating Radiance Networks

Krzysztof Byrski, Rafał Tobiasz, Grzegorz Wilczyński, Mikołaj Zieliński, Dawid Baran, Dominik Belter, Jacek Tabor, Przemysław Spurek

Jagiellonian University, Faculty of Mathematics and Computer Science, Poznań University of Technology, Institute of Robotics and Machine Intelligence, IDEAS Research Institute, Source code is available online. Source code can be found at:

2026-08-07视觉感知

针对 NeRF 表达力强但渲染慢、3DGS 高效却难以支持连续外观和传统光追流程的问题,FlaRe 将可光线追踪的平面高斯基元与每基元潜变量、共享轻量解码器结合,在同一表示中预测局部颜色和透明度。实验显示其在标准重建基准上保持有竞争力画质,并支持交互渲染、递归光追、形变、网格提取和风格化,但大场景远场精度与硬件依赖仍是限制。

Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press Figure 1
2026-08-07cs.CV

Mapping Armenian Paris: Extracting and Geocoding Commercial Advertisements from the 20th-Century Diaspora Press

Chahan Vidal-Gorène (CJM, LIPN), Seda Kirakosyan (UFAR), Edita Matevosyan (UFAR)

École nationale des chartes, PSL University, Paris, France, with 3,270 advertisement-level annotations, a Label Studio template that

2026-08-07视觉感知

这篇论文面向20世纪巴黎亚美尼亚侨民商业史料难以检索和定位的问题,构建IIIF驱动的广告抽取、OCR/结构化解析与地理编码流水线。核心做法是用VLM为西亚美尼亚历史报刊低资源场景启动数据与解析,结合YOLO检测、Mistral筛选、Gemini结构化抽取。结果显示检测mAP50约0.927,边框广告接近饱和但无边框广告仍明显困难,并产出500页、3270条广告标注语料。

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models Figure 1
2026-08-07cs.CV

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

2026-08-07生成模型强化学习安全鲁棒

本文针对基于视频生成模型的 World-Action Model 在 VAE 潜空间中过度保留纹理、光照等外观细节,导致机器人动作预测在视觉分布外条件下脆弱的问题,提出 Robust-WAM:保留原有 VAE 生成路径和大规模预训练动力学先验,同时在动作流中加入带时间位置编码的可学习 query,并对齐未来帧的 DINOv3 语义特征以提供外观不变的前瞻信息。实验显示其在 RoboTwin、LIBERO-Plus 和真实机器人上提升多个 WAM 基线的 OOD 成功率,且基本不牺牲域内表现。

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation Figure 1
2026-08-07cs.CV

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation

Xiaobin Huang, Zilong Huang, Yang Luo, Hongchao Fan, Yiping Chen, Ting Han

2026-08-07强化学习

这篇论文针对现有文本驱动3D生成将城市外部与室内空间分开建模、导致建筑内外语义和几何不一致的问题,提出 HoloWorld:用持续更新的跨尺度 world context 从城市规划传递到街区和单体建筑,并将外部建筑实例、轮廓与视觉属性约束到室内生成。实验显示其城市外部生成 AQS 较 SOTA 提升 7.68%,RDR 最高,同时保持较强的跨街区连续性和建筑级内外对应;但当前仅处理单层室内,垂直结构仍未充分建模。

MAVISEG: Manifold Propagation and Visual Prototypes for Zero-Shot Open-Vocabulary Segmentation in Diffusion Transformers Figure 1
2026-08-07cs.CV

MAVISEG: Manifold Propagation and Visual Prototypes for Zero-Shot Open-Vocabulary Segmentation in Diffusion Transformers

Rajatsubhra Chakraborty, Xujun Che, Ritabrata Chakraborty, Xi Niu, Depeng Xu

2026-08-07视觉感知生成模型

这篇论文关注冻结文本到图像扩散 Transformer 用于零样本开放词汇分割时,现有读出方法逐像素匹配单一文本概念,容易丢失时间、外观和几何结构信息。MaViSeg 将多时间步集成、无标注图像自举视觉原型和特征图上的流形传播作为免训练精炼层,保留原有捕获方式。实验在六个基准上均取得训练免费方法中最高 mIoU,平均较 ConceptAttention 提升 4.0、较 Seg4Diff 提升 4.5。

D-CLOT: Double Closed Loop Optimal Transport for Unsupervised Action Segmentation Figure 1
2026-08-07cs.CV

D-CLOT: Double Closed Loop Optimal Transport for Unsupervised Action Segmentation

Elena Bueno-Benito, Mariella Dimiccoli

2026-08-07视觉感知

本文针对无监督动作分割中 CLOT 的表示与动作原型不同步问题:帧/片段特征经 OT 循环被重塑,但定义 OT 代价的原型只靠伪标签梯度更新,易影响过渡段和短动作。D-CLOT 用图约束保持局部几何,并周期性以 k-means 或 OT 重心重估原型。五个基准上较 CLOT 提升,YTI 单视频最高 +12.7 F1、+10.2 mIoU,并给出 Assembly101 首个无监督基线。

Shape-Aware Oriented Bounding Box (OBB) to Horizontal Bounding Box (HBB) Conversion Figure 1
2026-08-07cs.CV

Shape-Aware Oriented Bounding Box (OBB) to Horizontal Bounding Box (HBB) Conversion

Badha Rathna Sabhapathy, Gotam Dahiya, Vishesh Vatsal

2026-08-07学习理论

面向遥感船舶检测中模型输出 OBB、评测或标注却要求 HBB 的后处理落差,论文提出用超椭圆船体模型刻画 hull shape、fullness 与方向角,再投影得到更贴合目标的水平框。相比外接 HBB、等面积 HBB 和 GBB 边缘化方法,在 ShipRSImageNet 与 Sentinel-2 自建数据上取得更高平均 IoU、减少过包围和欠包围;但方法依赖参数校准,跨船型泛化仍需验证。

DTRNet: Dual Text-Radical Decoding for Handwritten Chinese Text Recognition with Faked Character Detection Figure 1
2026-08-07cs.CV

DTRNet: Dual Text-Radical Decoding for Handwritten Chinese Text Recognition with Faked Character Detection

Runrui Li, Lin Zhu, Hua Huang

School of Artificial Intelligence

2026-08-07视觉感知

面向K-12手写中文识别中“伪造字”易被OCR按上下文纠正为正常字的问题,DTRNet将行级文本识别与逐字结构校验解耦:文本分支负责转写,部件分支预测合法IDS并结合字典判别伪造字,IGCA再用结构证据校准识别置信度。实验称其在重构的Visual-C3零样本检测基准、OCR工具和多模态大模型对比中均提升检测效果,同时保持较强识别性能并给出部件级解释。

Curia-MAE: Multi-Modal Multi-Anatomy MAE Pre-Training for 3D Medical Image Segmentation Figure 1
2026-08-07cs.CV

Curia-MAE: Multi-Modal Multi-Anatomy MAE Pre-Training for 3D Medical Image Segmentation

Théo Danielou, Antoine Saporta, Léo Alberge, Corentin Dancette

2026-08-07视觉感知三维

针对放射学基础模型在三维分割中难以用冻结编码器接近 nnU-Net、且既有 MAE 多限于单模态单解剖区域的问题,Curia-MAE 在卷积 MAE 中加入鲁棒重建损失、特征正则和局部-全局相似约束,并用约 30 万 CT/MRI 体数据预训练。八个解剖与病灶分割基准显示,其冻结编码器性能优于强 MAE 基线,全量微调仍具竞争力,病灶任务上更有优势。

Overcoming Attention Drift: Homogeneity-Heterogeneity Guided Feature Aggregation for Low-Light Remote Sensing Image Enhancement Figure 1
2026-08-07cs.CV

Overcoming Attention Drift: Homogeneity-Heterogeneity Guided Feature Aggregation for Low-Light Remote Sensing Image Enhancement

Yaozi Zhong, Xingxing Yang, Shaohui Mei, Mingyang Ma

2026-08-07视觉感知

针对极低照度遥感图像中自注意力易跨物理边界错误聚合、导致边缘模糊和色彩失真的问题,论文提出 HALO,将增强建模为由基础模型先验约束的特征聚合:用 DINOv3 语义同质性作正偏置、Depth Anything 3 伪三维边界异质性作负惩罚,并通过 H2CAM 融合。实验称其在 8 个合成与真实基准上达到 SOTA,提升边界清晰度、颜色保真和下游检测表现。

Accurate Localization of Road Traffic Objects on the Road Plane Using Surveillance Camera Imagery Figure 1
2026-08-07cs.CV

Accurate Localization of Road Traffic Objects on the Road Plane Using Surveillance Camera Imagery

Jan Gawroński, Witold Czajewski

2026-08-07视觉感知

针对路侧单目监控中用检测框中心定位车辆会受透视和视差影响、导致道路平面误差放大的问题,本文将检测与几何回归解耦:先用 YOLO26 检车,再用 ResNet34 预测车辆底面投影四边形并取其中心定位。CARLA 预训练、DAIR-V2X 微调后,平均像素误差由 31.77px 降至 15.30px,中远距地面定位误差也显著下降。

Controllable Clothing: Precise Labels and Generation for Virtual Try-On with Latent Diffusion Models Figure 1
2026-08-07cs.CV

Controllable Clothing: Precise Labels and Generation for Virtual Try-On with Latent Diffusion Models

Max Rehman Linder

2026-08-07生成模型规划控制

论文针对现有扩散式虚拟试衣虽能生成逼真图像、但难以精确控制衣长、版型和细节落位的问题,提出用 GPT-4 语义标签与基于分割图的像素级位置特征增强数据,并将这些标签投影进 IP-adapter/自定义 ControllableClothing 模块。实验显示边界和位置类连续特征对控制效果较有帮助,训练可能更快且推理可控性更强;但 one-hot 语义标签增益来源不清,部分结论文中未充分说明。

Bayesian adaptively-weighted ensembles for few-shot abdominal segmentation Figure 1
2026-08-07cs.CV

Bayesian adaptively-weighted ensembles for few-shot abdominal segmentation

Abbas Al-Sabbagh, Shalom F. Mushtaq, Tomás M. da Silva, Kushagra Soni, Binawei Gbamila, Sri Atluri, Qianye Yang, Yipeng Hu, Claire C. Villette, Shaheer U. Saeed

2026-08-07视觉感知

这篇论文针对少标注和跨机构域偏移下腹部/盆腔 MRI 分割不稳定的问题,指出不同 few-shot 分割器在解剖结构和机构间可靠性互补,固定集成权重难以适配目标域。方法用少量支持集适配多个模型,再用贝叶斯优化在目标验证集上学习体素概率图加权。实验称在跨机构男性盆腔数据上显著优于单模型、固定权重集成、从零训练和近期集成方法。

Energy-Guided Flow Matching Figure 1
2026-08-07cs.CV

Energy-Guided Flow Matching

Haoyang Tong (1 and 2), Yu He (2), Fang Li (2), Lichen Ma (2 and 3), Jingling Fu (2), Dong Chen (2), Zhen Chen (2), Junshi Huang (2), Jie Cao (1) ((1) MAIS & NLPR, CASIA, (2) <a href="http://JD.com" rel="external noopener nofollow" class="link-external link-http">this http URL</a>, (3) Xi'an Jiaotong University)

2026-08-07生成模型

针对像素空间生成中全局结构与高频细节需同时学习、标准 Flow Matching 只指向固定干净端点的问题,本文提出 EG-FM:用热核滤波的动态端点和按样本频谱能量调度的高频释放,显式形成由粗到细的生成轨迹,并相应重定向速度目标。实验显示其无需改 backbone,在 ImageNet 256/512 和文生图任务上降低 FID、提升 GenEval/DPG-Bench,且训练轮数更少。

STAIL: Semantic Text-Anchored Incremental Learning for Medical Imaging via Large Language Models Figure 1
2026-08-07cs.CV

STAIL: Semantic Text-Anchored Incremental Learning for Medical Imaging via Large Language Models

Songpan Gao, Yajie Zhang, Guanxing Chen, Jiayu Qian, Zhenzhen Liu, Shijun Li, Xiaowei Zhu, Yao Hu, Kay Chen Tan, Yu-An Huang, Shiqi Wang, Zhi-An Huang

2026-08-07视觉感知

STAIL针对医疗影像持续学习中旧类遗忘、原始图像回放带来的存储与隐私成本,提出用少量图像锚点加大量文本描述构成语义巩固缓冲,并以冻结LLM语义空间约束视觉特征更新。其核心洞察是把文本作为压缩记忆和稳定先验,替代密集像素回放。在眼底、超声、X光三类数据上作为插件提升多种基线,AAA-AUC平均增益2.24%,BWT-AUC增益3.55%。

Ordered Diffusion for 3D Human Registration Figure 1
2026-08-07cs.CV

Ordered Diffusion for 3D Human Registration

Mattia Masiero, Ilya A. Petrov, Daniel Cremers, Gerard Pons-Moll, Riccardo Marin

University of Tübingen, Germany, Tübingen AI Center, Germany, Technical University of Munich, Germany, Munich Center for Machine Learning, Germany, Max Planck Institute for Informatics, Saarland Informatics Campus, Germany, Corresponding Author 1 University of Tübingen, Germany

2026-08-07生成模型三维

本文针对3D人体配准中噪声、遮挡和软组织形变带来的多解不确定性,指出单一回归会产生不可信的平均形状;提出ODin,将模板到扫描的对齐建模为保持点顺序语义的3D扩散生成过程,并用全局、局部与位置条件引导去噪。实验称其在完整和部分人体扫描上优于回归骨干及NICP等工程化方法,同时推理时间减少约三分之二。

Vorch-Omni: Multi-Task Orchestration of Sight and Sound Figure 1
2026-08-07cs.CV

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

2026-08-07视觉感知

论文针对视频生成、编辑、扩展和音视频合成长期依赖任务专用管线的问题,提出以“任意条件到任意输出”为统一接口,用 token 级掩码、任务角色标识和位置类型区分目标、源内容与参考,并结合 VLM 与 VAE 条件路径及版本化数据管线训练单一扩散 Transformer。结果显示模型可覆盖 10 多类任务、30 多种配置;人工评测中相较 Wan 2.7 多数持平,但在音画同步、参考对齐、音频指令遵循和音频质量上更受偏好。

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments? Figure 1
2026-08-07cs.RO

XEWorld: Can Action-Conditioned World Models Generalize to Unseen Robot Embodiments?

Yixiang Chen, Jiabing Yang, Yuan Xu, Qisen Ma, Keji He, Peiyan Li, Kai Wang, Ziheng He, Xiangnan Wu, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

2026-08-07机器人强化学习

论文针对机器人动作条件世界模型只在已见本体上评测、难以判断是否学到物理动力学的问题,提出 XEWorld 跨本体测试床,在相同场景和任务中隔离机器人形态变量。实验显示,现有模型迁移能力主要受视觉相似性而非运动学相似性支配,更像二维模式匹配器;零样本泛化依赖像素级动作和显式时空对齐,少样本适配虽能恢复外观却会遗忘已见本体。

KVAE: Family of Tokenizers for Multimodal Generative Models Figure 1
2026-08-07cs.CV

KVAE: Family of Tokenizers for Multimodal Generative Models

Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

Kandinsky Lab

2026-08-07视觉语言生成模型

本文关注潜空间扩散模型中 tokenizer 对训练效率、生成质量和可扩展性的直接影响,提出覆盖音频、图像、视频的 KVAE 系列:48kHz 音频连续 tokenizer、两种因果视频压缩配置和 8 倍图像 tokenizer,并强调压缩率与 diffusability 的权衡。实验称其在重建指标和文本条件生成的客观、主观评测上达到或超过 Wan、HunyuanVideo、FLUX、MovieGen、StableAudio 等开源 tokenizer,但具体增益可能部分来自训练细节、数据和模型选择,来源未完全拆清。

VSMP-IMU: Video-Grounded Semantic Motion Programs for Sensor-Aware Synthetic IMU Generation Figure 1
2026-08-07cs.CV

VSMP-IMU: Video-Grounded Semantic Motion Programs for Sensor-Aware Synthetic IMU Generation

Lala Shakti Swarup Ray, Vitor Fortes Rey, Mengxi Liu, Paul Lukowicz, Bo Zhou

2026-08-07视觉感知

论文针对可穿戴 HAR 中标注 IMU 稀缺、长尾和跨人泛化困难的问题,提出用视频抽取语义运动程序 SMP,将活动不变量与可控执行变化分离,再生成运动并映射到目标 IMU 域。实验在五个数据集上较 real-only 提升 9.77 Macro-F1,较最强合成基线提升 4.04,低资源和尾类场景增益更大,但部分控制在传感器落地后会衰减。

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding Figure 1
2026-08-07cs.CV

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

2026-08-07视觉感知

长视频理解中,MLLM 受上下文长度和计算成本限制,现有基于 CLIP 等外部打分的选帧方法又容易与目标模型真实证据需求错位。EviSelect 的核心思路是用稀疏预填充近似目标 MLLM 的内部注意力证据,并据此动态决定保留时间点、局部采样率和空间分辨率,再用 GRPO 以准确率和视觉 token 成本联合优化。三项长视频基准上,该方法在性能优于既有方法的同时,将选中视觉 token 约减半,并取得 3.9 倍端到端加速。

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification Figure 1
2026-08-07cs.CV

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

Zhejiang University

2026-08-07强化学习

该文针对自回归长音视频生成中训练用干净历史、推理用自生成历史导致的身份漂移、模糊和音画失同步问题,提出按 flow-matching 噪声水平匹配残差注入,并用任务嵌入解耦历史、参考图和目标视频以避免位置外推。作者称在 ST-Bench 和新长程音视频基准上稳定性与音画保真优于基线,但结论又称相关评测和消融仍是下一步,实际增益幅度与来源文中未充分说明。

SR-JEPA: Learning Predictive Latent State in 3D Scenes Figure 1
2026-08-07cs.CV

SR-JEPA: Learning Predictive Latent State in 3D Scenes

Zihan Zhou, Qifu Wen, Xi Zeng

Boston University, Boston, MA, USA, Shanghai Jiao Tong University, Shanghai, China

2026-08-07三维

论文关注 JEPA 中常被忽略的预测器:当 3D 场景中整个物体被删除时,它到底能推断什么。SR-JEPA 以原生点云训练自监督 EMA 潜变量,并用固定无形状查询测试冻结预测路径。结果显示,缺失物体语义宏准确率达 43.13%,显著高于几何/随机基线;预测器随机化或替换上下文会明显掉点,说明信号来自学习到的上下文补全而非简单捷径。

HyTBE: Hyperbolic Target-Background Expert Model for Cross-Domain Infrared Small Target Detection Figure 1
2026-08-07cs.CV

HyTBE: Hyperbolic Target-Background Expert Model for Cross-Domain Infrared Small Target Detection

Aohua Li, Jin Kuang, Yubing Lu, Pingping Liu

2026-08-07视觉感知

这篇论文针对红外小目标检测跨域部署中性能明显下降的问题,指出关键不只是目标或背景外观变化,而是目标-背景判别关系在未见域发生偏移。HyTBE通过扰动目标或背景扩展训练关系模式,并在双曲空间建模目标/背景锚点距离,再用MoE适配器校准多尺度特征。留一域实验在NUAA-SIRST、NUDT-SIRST和IRSTD-1K上优于竞争方法。

Flow-Map Distillation on Relation Manifolds for Image Restoration Figure 1
2026-08-07cs.CV

Flow-Map Distillation on Relation Manifolds for Image Restoration

Zihao He, Songhua Liu

School of Artificial Intelligence, School of Artificial Intelligence Shanghai Jiao Tong University Shanghai City China

2026-08-07视觉感知生成模型

本文针对图像复原知识蒸馏中只对齐教师与学生静态特征/关系矩阵、忽略收敛路径的问题,提出 FoRM:把关系矩阵蒸馏建模为关系流形上的连续 flow-map,并用真实桥接状态约束半群一致性与端点锚定,避免预测中间态误差累积。在超分、去雨、去噪、去模糊和低光增强等任务上,方法相对多种蒸馏基线取得稳定提升,并将朴素 flow matching 蒸馏的训练方差约降 50%。

Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning Figure 1
2026-08-07cs.CV

Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning

Bryan Wong, Xun Xu, Huazhu Fu, Nancy F. Chen, Mun Yong Yi

2026-08-07视觉感知

本文针对全切片病理图像推理中“语义相关”补丁未必能区分诊断假设的问题,提出 BEACON 将取证过程改写为贝叶斯证据获取:维护候选诊断的概率信念,并按期望信息增益选择补丁,必要时继续取证或放大检查。零样本实验覆盖五个 WSI-VQA 基准,结果显示其在训练-free agentic 方法中整体表现最好,同时减少取证轮次。

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video? Figure 1
2026-08-07cs.CV

GST-Bench: Can VLMs Develop Global Spatial Awareness from Video?

Qifeng Zhang, Kaixiang Huang, Heng Dong, Huang Fang, Junting Chen, Junjie Zhu, Yonghang Chen, Zhiyu Zhang, Wei Li

2026-08-07视觉语言视觉感知

面向机器人等具身智能场景,论文指出现有空间基准多停留在单帧或少视角局部感知,难以检验长视频中的全局空间表征。GST-Bench通过不可见目标、轨迹外查询视角、精确距离/角度指标和俯视图映射,评估自定位、目标定位与场景结构理解。22个VLM评测显示最强零样本模型仅42.68,显著低于人类79.08;GST-Train微调可将Qwen3-VL-8B提升到53.52,说明瓶颈主要在跨帧全局整合。

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on Figure 1
2026-08-07cs.CV

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

2026-08-07视觉感知

视频虚拟试衣常依赖人体解析、姿态估计和服装形变等显式几何预处理,遮挡或大幅运动下误差会逐帧放大。UniVVT的核心洞察是用多模态语义隐式表达“换什么、换到哪里、如何换”,通过MLLM场景任务感知器和语义桥接扩散视频生成器,推理时去掉mask、pose和warping模块。文中称其在多个图像与视频试衣基准上达到SOTA或竞争性结果,并降低部署复杂度。

ConceptADapt: Concept-guided Adaptive Feature Reconstruction with Dynamic Attention for Few-Shot Industrial Anomaly Detection Figure 1
2026-08-07cs.CV

ConceptADapt: Concept-guided Adaptive Feature Reconstruction with Dynamic Attention for Few-Shot Industrial Anomaly Detection

Yufei Li, Yicheng Ruan, Long Tian, Dongsheng Wang, Liang Bao

2026-08-07视觉感知三维

面向新产品冷启动时正常样本极少导致工业缺陷检测泛化脆弱的问题,ConceptADapt将有限支持样本压缩为固定“正常概念”,用动态注意力稀疏自编码器抑制特征捷径,并在推理时仅通过LoRA调整FFN以适配查询特征、避免原型漂移。实验在MVTec-AD、VisA和MPDD的多种shot设置下,报告检测与定位均优于或达到SOTA。

LiteKD-Net: Lightweight Knowledge-Distilled Network for Mobile Image Denoising Figure 1
2026-08-07cs.CV

LiteKD-Net: Lightweight Knowledge-Distilled Network for Mobile Image Denoising

Zhou Zhiyi

2026-08-07视觉感知

面向手机端图像去噪,论文关注真实配对数据难获取与重模型难部署的问题。LiteKD-Net用带像素串扰的物理噪声模拟生成训练对,将Real-ESRGAN改为等分辨率教师,并用深度可分离Lite-RRDB学生配合特征蒸馏降低推理成本。实验称较基线模型尺寸约缩小10倍、速度约提升2倍,且在真实数据上接近教师质量并优于SwinIR;但增益中模拟数据、结构轻量化与蒸馏各自贡献仍需看消融细节。

Unified Agent: Managing Interactions across Devices Figure 1
2026-08-07cs.AI

Unified Agent: Managing Interactions across Devices

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

University of California, San Diego

2026-08-07视觉感知

本文针对跨设备、跨时间的用户请求:关键线索常分散在不同设备和历史时刻,现有单代理或多代理难以在当前观测不足时决策。核心洞察是让代理维护紧凑、可行动的显式状态,记录设备绑定的交互证据、用户陈述事实和持续请求,而非保存完整历史。作者构建 UA-Bench,并显示 Unified Agent 在默认设置及不同 MLLM 家族、能力和推理预算下均优于四类改造基线,说明收益主要来自状态设计。

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams Figure 1
2026-08-07cs.CV

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

MoE Key Lab of Artificial Intelligence, Institute of AI, School of Computer Science, Shanghai Jiao Tong University, Institute of Artificial Intelligence, Beihang University

2026-08-07视觉感知生成模型三维

本文针对事件相机只记录亮度变化、难以从长间隔和复杂运动中恢复颜色纹理的问题,提出 Engram-E2VID:先由事件和参考帧估计目标时刻结构脚手架,再在一阶段扩散骨干中用结构 token 激活参考帧的外观“记忆”,避免依赖像素级对齐。三组基准上相较最强同输入方法 PSNR 最高提升 3.29 dB、LPIPS 降低 0.08,并在间隔增大时退化更慢。

PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models Figure 1
2026-08-07cs.CV

PhyLatent: Learning Dynamics-Relevant Representations for JEPA World Models

Xi Zeng, Haojie Ren, Ziying Song

School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore, School of Artificial Intelligence (School of Software), Yanshan University, Qinhuangdao, China, The University of Sheffield, Sheffield, United Kingdom

2026-08-07强化学习

这篇论文针对 JEPA 世界模型中“全局不坍塌”仍可能丢失物理状态与动作后果的问题,指出物理不变性、状态可辨识性和反事实动态三类局部坍塌。PhyLatent 通过物理状态监督、未来对齐、静态视觉不变、反事实分支分离和潜变量去噪来约束训练;在 OGBench-Cube 上三类失败率均下降,MPC 成功率由 70.0% 提升到 78.1%,TwoRooms 也由 81.0% 提升到 98.0%。

Iterative Hybrid Discrete-Continuous Viewpoint Planning for UAV Photogrammetry Figure 1
2026-08-07cs.CV

Iterative Hybrid Discrete-Continuous Viewpoint Planning for UAV Photogrammetry

Alan Grech, Daniel Pisani, Andre Grima, Carl James Debono, Saviour Formosa, Dylan Seychell

2026-08-07规划控制

针对常规无人机航线难以适配复杂场景几何、导致局部重建缺失或误差较大的问题,论文从代理重建出发,将表面点的正视性、距离、视差和多视角观测数与全局可见性、重叠和连通性联合建模,并用离散候选生成、CMA-ES连续优化与冗余剔除迭代规划视点。三组合成场景实验显示,其在精度和完整性上优于若干既有路径规划方法,且图像数量更少,但效果仍依赖代理模型质量。

One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding Figure 1
2026-08-07cs.CV

One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding

Wang Chen, Yu Chen, Xiang Wang, Shuai Li, Jinfa Huang, Xiawu Zheng

Media Analytics and Computing Lab, Xiamen University, Xiamen, China, Department of Computer Science, University of Rochester, Rochester, NY, USA

2026-08-07视觉感知

长视频输入 LMM 时帧冗余高、上下文预算不固定,逐预算选帧会导致证据不稳定且需反复运行。论文将选帧改写为 Matryoshka 排序:一个序列的小前缀优先保留查询证据,长前缀逐步补充时间覆盖和视觉多样性;MEC 通过稀疏索引、局部放大和位置自适应贪心实现。四个基准、六种预算下平均比均匀采样高 3.77 个百分点,并将端到端选择延迟降低约 47.37–51.19%。

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models Figure 1
2026-08-07cs.CV

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

2026-08-07机器人视觉感知强化学习三维

LAWM-3D关注机器人世界模型对昂贵动作标注和平台动作空间不一致的依赖,指出单纯加入多视角视频不足以获得3D动作理解,问题来自未来帧外观泄漏和视角差异。方法通过视角不变动作token、与3D基础模型的几何对齐、非注入式RGB-D重建来约束潜在动作更关注几何运动。实验称在生成质量、物理一致性、动作可控性和OOD泛化上优于DreamDojo等基线。

G$^2$ARD-GS: Geometry-Guided Anchor-Regularized Gaussian Splatting Distillation Figure 1
2026-08-07cs.CV

G$^2$ARD-GS: Geometry-Guided Anchor-Regularized Gaussian Splatting Distillation

Puyuan Zhang, Jianming Huang, Wenkai Ye, Wei Dong

Shanghai Jiao Tong University, Shanghai, China, Jishu Technology Co., Ltd., China

2026-08-07三维

这篇论文针对城市级 LiDAR 点云转 3DGS 后高斯数量过大、压缩又容易破坏表面支撑的问题,提出 G²ARD-GS:通过多轮表面感知合并、几何信息视角选择,以及锚点和有效秩正则,在固定拓扑上恢复外观而尽量保持几何结构。实验显示其在 MatrixCity 的 5×到30×压缩下优于 PUP,PSNR 高 3.2–6.8 dB;作为冻结几何用于新轨迹外观适配也提升 3.7–4.9 dB,并在 KingsCollege 30×压缩下保持相机配准能力,但评测主要集中在少量场景,泛化仍需更多验证。

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding Figure 1
2026-08-07cs.CV

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

The Hong Kong University of Science and Technology, Xiaohongshu Inc., The University of Hong Kong, The Chinese University of Hong Kong

2026-08-07视觉感知

这篇论文针对现有流式视频评测多依赖短片段和选择题、难以检验长期因果理解的问题,提出 StreamArena:用 243 个平均 88.8 分钟视频和 3646 个开放问答同时评估实时感知、历史回溯、主动交互与工具使用。实验揭示近期帧记忆、文本化记忆和压缩视觉记忆各有失效点,并提出双层 StreamMind,将前台交互监控与后台多模态记忆检索解耦,在四类能力上均超过流式基线,且查询延迟降低 66.2%。

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding Figure 1
2026-08-07cs.CV

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

2026-08-07视觉感知

这篇论文针对视频异常理解中“能说清异常”不等于“始终盯对异常实例”的问题,提出以轨迹为中心的 TAU-Bench,将异常实例跟踪、像素级掩码与实例、事件、场景层级语义标注统一起来。基准包含 1,118 个视频、1,454 条一致身份轨迹和 202,438 个掩码;实验显示现有 VLM 即使生成合理描述,仍常在定位和跟踪正确异常实例上失效,暴露语义推理与视觉 grounding 的脱节。

SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment Figure 1
2026-08-07cs.CV

SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan, Ming Jie Lee

Universiti Malaya, 2 Universiti Tunku Abdul Rahman, 3 National University of Singapore

2026-08-07视觉语言视觉感知

本文针对科学图像质量不仅取决于清晰度、还取决于标签、单位和结构是否支持科学理解的问题,提出 SciQNet:先用科学文档图像做领域自适应预训练,再以评分监督和多选 VQA 理解监督联合微调。一个关键观察是 40% 分层预训练数据优于全量,说明相关性可能比规模更重要;最终 SIQA-S 92.21、SIQA-U 47.38、综合 69.80,并在评分赛道排名第 2。

DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation Figure 1
2026-08-07cs.CV

DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation

Jiaxuan Li, Qing Xu, Xiangjian He, Yue Li, Daokun Zhang, Fiseha B. Tesema, Rong Qu

2026-08-07视觉语言视觉感知安全鲁棒

针对医学图像分割中图文对齐在边界模糊、数据稀缺和域偏移下容易过度确定的问题,DistMedVL在冻结视觉语言编码器上加入轻量PCM-Adapter,将文本与视觉特征建模为带方差的分布,并用马氏距离对齐与分布流可靠性门控抑制不可靠维度。八个医学分割基准显示其仅需6.3M可训练参数即可优于现有方法,并提升数据效率、扰动鲁棒性和跨数据集泛化。

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition Figure 1
2026-08-07cs.AI

A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition

Jiaheng Chen, Jiaxing Li, Tinghe Zhang, Chaopeng Guo

Software College, Northeastern University, Software College, Northeastern University Shenyang China

2026-08-07规划控制

这篇论文针对多智能体轨迹预测中社会影响被端到端模型混在一起、难以区分长期意图与局部交互的问题,提出 INTraJ:先用邻居未来信息形成社会化规划参考轨迹,再用残差建模反应式调整,并统一适配多目标和单目标预测。实验覆盖 Argoverse 2、ETH/UCY、SDD 等,显示 FDE 和长时域一致性有稳定提升,部分设置达到 SOTA。

URNet: A Unified Reparameterized Network for Efficient RGB-D Semantic Segmentation Figure 1
2026-08-07cs.CV

URNet: A Unified Reparameterized Network for Efficient RGB-D Semantic Segmentation

Guoan Xu, Zhengxue Wang, Yang Xiao, Ligeng Chen, Guangwei Gao, Dongchen Zhu

University of Technology Sydney, Nanjing University of Science and Technology, Honor Device Co., Ltd., Shanghai Institute of Microsystem and Information Technology, CAS, University of Technology Sydney Sydney New South Wales Australia, Nanjing University of Science and Technology Nanjing China, Honor Device Co., Ltd. Beijing China, Shanghai Institute of Microsystem and Information Technology, CAS Shanghai China

2026-08-07视觉感知

URNet针对RGB-D语义分割中双编码器计算冗余、深度特征建模不足和跨模态交互稀疏的问题,将RGB与深度放入统一编码器,并用RGB-D预训练缓解预训练/微调输入不匹配;其RepBlock结合线性门控注意力进行多尺度融合,PMD解码器做轻量金字塔聚合。文中在NYUDepth V2、SUN-RGBD等基准上报告达到或接近SOTA且效率更高,但具体增益中预训练数据与结构设计的相对贡献仍需看消融细节。

SafeDivertor: Faithful Divertor Heat Flux Reconstruction from Macroscopic Plasma State Signals via Time-Frequency Prior Exploitation Figure 1
2026-08-07cs.AI

SafeDivertor: Faithful Divertor Heat Flux Reconstruction from Macroscopic Plasma State Signals via Time-Frequency Prior Exploitation

Hao Si, Zehua Chen, Qingquan Yang, Xiao Wang, Dengdi Sun, Wanli Lyu, Gaoting Chen, Guosheng Xu, Hang Su, Jin Tang, Jun Zhu

2026-08-07三维安全鲁棒

这篇论文瞄准聚变装置偏滤器热通量难以及时评估的问题,尝试绕开依赖红外测温与热传导反演的离线流程,直接用放电中的多源宏观等离子体信号重构时序径向热通量。核心创新是构建 DivMPS2HF 数据集,并在 SafeDivertor 中结合物理先验初始化、输入扰动、多尺度 STFT 频谱损失和渐进训练,以减少信号依赖偏置并保留瞬态变化。实验称其在五项指标上优于多种时间序列基线,且推理效率具备在线部署潜力。

Dual-Attention and Adversarial Transfer Networks for Sim-to-Real Cross-Orientation Wireless Sensing Figure 1
2026-08-07cs.CV

Dual-Attention and Adversarial Transfer Networks for Sim-to-Real Cross-Orientation Wireless Sensing

Linfeng Du, Kehan Wu, Tong Zhang, Rui Wang

2026-08-07视觉感知

本文针对毫米波人体活动识别在用户朝向变化时性能下降、逐朝向采集标注数据成本高的问题,提出 S2M-Sense:用物理引导仿真从单朝向深度动作扩展多朝向无线数据,并结合双链路多普勒谱的双注意力特征提取与少量无标注实测样本的对抗迁移。仿真与实测谱图 SSIM 达 0.84,仅仿真训练准确率 88.33%,加入 16 个无标注实测样本后达 95%。

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming Figure 1
2026-08-07cs.CV

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

Tongji University, Harbin Institute of Technology, Shenzhen, Shanghai Jiao Tong University

2026-08-07视觉感知

论文针对现有音视频扩散模型只能离线生成短片、难以在因果流式场景中保持口型同步和身份稳定的问题,提出 Vorch-Streamer:用教师/扩散强制与长程 Self Forcing 将双向模型后训练为因果生成器,并引入 LLM 预测 25Hz 语音规划 token 来显式控制每个块该说什么。实验显示其可从文本实时联合生成长时头像音视频,达到 27.12 FPS,超过 24 FPS 播放速率,同时保持较好的同步、语音准确率和长程一致性。

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation Figure 1
2026-08-07cs.CV

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

Fudan University

2026-08-07视觉语言视觉感知

针对现有视频身份替换多依赖掩码/姿态控制、难处理多人且缺少成对数据的问题,Vorch-IR将单/双人身份与背景替换统一为指令驱动的多模态生成任务,用索引参考图和文本绑定目标,并通过自动数据构造与重叠时序推理扩展长视频。实验显示其在身份保持、动作保真和时序一致性上优于对比方法,但具体增益中 scaling / data 的贡献仍需进一步拆分。

ChronoVision: Temporal Reasoning via Latent State Reconstruction Figure 1
2026-08-07cs.CV

ChronoVision: Temporal Reasoning via Latent State Reconstruction

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

University of Illinois Urbana-Champaign, University of Pennsylvania

2026-08-07视觉感知三维

本文针对多模态大模型在多步时间与三维视觉变化中依赖语言推理、难以保持连续状态的问题,提出 ChronoVision:用潜在最终状态重构和 ROI 注意定位来对齐视觉过程,并以隐式过程 grounding 的强化学习约束结果、潜在轨迹与关注区域。其还将视频推理改写为 Vbvr-VQA 图像排序任务,减少语言捷径;实验在 Vbvr-VQA 达 74.8%/71.6% 准确率,在 IntPhys2 达 55.0%。

SCI-CLIP: Segment-Centric Inference with Reference Memory for Training-Free Open-Vocabulary Segmentation Figure 1
2026-08-07cs.CV

SCI-CLIP: Segment-Centric Inference with Reference Memory for Training-Free Open-Vocabulary Segmentation

Mohamad Zamini, Diksha Shukla

2026-08-07视觉感知

该文针对免训练开放词汇分割中 CLIP patch 特征与像素级区域预测粒度不一致的问题,提出以“segment”作为统一推理单元:用区域约束 token 交互和特征传播,引入跨窗口上下文补全,并以同一粒度构建/查询参考记忆。结果显示其在八个 OVSS 基准上提升分割结构、上下文鲁棒性和样例校正效果,但具体增益拆分仍需看完整实验细节。

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping Figure 1
2026-08-07cs.CV

Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping

Jinho Kim, Jinwoo Kim, Seon Joo Kim

2026-08-07三维

针对多曝光融合只给出 SDR、HDR 重建又依赖线性域建模和后续色调映射的问题,DOME-HDR 将三张包围曝光图先经 LoRA 扩散模型融合成稳定 SDR,再用双交叉注意力引入欠/过曝互补信息,并以该 SDR 引导增益图反色调映射生成 HDR。在 Kalantari、Tel、Challenge123 上取得 SOTA HDR 指标,消融支持注意力设计和 SDR 引导的贡献。

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs Figure 1
2026-08-07cs.CV

TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs

Yanqi Wu, Runhe Lai, Xinhua Lu, Qichao Chen, Zhiping Zhou, Jia-Xin Zhuang, Weijiang Yu, Ruixuan Wang

2026-08-07视觉语言视觉感知

针对大视觉语言模型在图像描述中生成不存在物体的可靠性问题,TruthLens指出真实与幻觉物体 token 在隐藏表示中可分,但该信号被 LM head 弱化;方法通过罕用特殊 token 的对数概率构造逐物体真实性分数,并用 MSE 微调显式读出该信号。实验显示其在多种 LVLM 和跨类别基准上优于现有检测方法,Qwen2.5-VL-7B 在 MS-COCO 上 AUROC 较前最好方法提升超过 17%。

ALTER: Modeling Longitudinal Changes via Regional Differencing for 3D CT Report Generation Figure 1
2026-08-07cs.CV

ALTER: Modeling Longitudinal Changes via Regional Differencing for 3D CT Report Generation

Dongchen Li, Jitao Liang, Wei Li

2026-08-07三维

这篇论文针对3D CT自动报告中难以刻画患者随访变化的问题,指出仅看当前检查或做全局历史匹配会掩盖区域级病灶演变。ALTER通过先融合既往CT与报告,再让当前解剖区域从既往体数据中检索对应代理并做区域差分,最后把差异与当前异常状态转为提示引导生成。实验在RadGenome-ChestCT和CTRG-Chest-548K上多数指标达到SOTA,但具体临床可靠性仍需进一步验证。

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction Figure 1
2026-08-07cs.LG

LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction

Yingqing Guo, Hui Yuan, Zijian He, Mengdi Wang, Zheng Ding

2026-08-07生成模型

本文针对流模型用 GRPO 做在线强化学习时的训练-推理不一致:训练需随机 rollout,而推理常用确定性 ODE,有限步 SDE 会因噪声产生模糊样本。LC-GRPO 的关键做法是在每步先走与推理对齐的 ODE Euler,再用由流速度恢复 score 的 Langevin 校正提供探索且保持可计算似然。理论上其可降低 ODE 步的 Wasserstein 误差;在 SD3.5、FLUX 与 HunyuanVideo 上提升图像/视频奖励优化,并缩小 rollout 与 ODE 评估差距。

Uncertainty-Aware World Model for Aerial Image-Goal Navigation Figure 1
2026-08-07cs.CV

Uncertainty-Aware World Model for Aerial Image-Goal Navigation

Deyi Zhu, Haoyu Fan, Yinan Zhu, Weichen Zhang, Shilin Ma, Xinlei Chen, Yansong Tang

Tsinghua Shenzhen International Graduate School, Tsinghua University

2026-08-07机器人视觉感知强化学习安全鲁棒

面向无人机图像目标导航,论文指出户外长时域预测存在多种合理未来,现有世界模型用单点或少量采样给候选轨迹打分,容易误拒可行路径。UA-NWM 将轨迹评分视为条件 OOD 检测,在 DINOv3 潜空间中用不确定性子空间表示可解释偏差,并由 HEP 只惩罚正交残差。实验显示其在离线、在线和真实无人机测试中优于现有导航世界模型,同时保持较低推理延迟。

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs Figure 1
2026-08-07cs.CV

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

Ziling Huang, Shin'ichi Satoh

National Institute of Informatics, Japan

2026-08-07视觉感知

长视频理解受限于 MLLM 视觉 token 预算,均匀采样偏全局覆盖而帧选择易丢失故事线。论文提出 VideoRouter,将视频组织为问题无关的时间层级,同时构建全局与局部证据视图,并用验证引导路由选择更受证据支持的答案。实验显示其在 VideoMME 上较同骨干 SOTA 帧选择方法提升 2.9 分,并在 LongVideoBench 上优于单分支推理。

A Multi-Layer System for Ultra-High-Resolution Static 360-Degree Telepresence Figure 1
2026-08-07cs.HC

A Multi-Layer System for Ultra-High-Resolution Static 360-Degree Telepresence

Jiapeng Chi, Gerd Bruder, Carsten Neumann, Carolina Cruz-Neira, Dirk Reiners

2026-08-07视觉感知

这篇论文针对静态360度远程临场中全景视野清晰度不足、直播硬件又难以同时覆盖高分辨率与交互的问题,提出用8K全景相机加4K PTZ相机的三层表示:离线瓦片化超高清背景、实时前景动态更新和用户关注区域4K直播。实验与用户研究显示,该设计相比视频超分方法能更清楚恢复细节,并在静态场景中较好平衡沉浸感、实时性与局部检查能力。

CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images Figure 1
2026-08-07cs.CV

CoordRefer: Coordinate-Aware 3D Visual Grounding from Multiview Images

Haijie Li, Jiaxin Zhang, Dave Zhenyu Chen, Youyu Chen, Yanmin Wu, Jian Zhang

2026-08-07视觉语言视觉感知三维

本文针对多视角图像三维视觉定位中坐标系选择与3D框回归联合优化导致的坐标相对歧义:同一物体框在不同参考帧下有不同数值表示,易产生无效折中预测。CoordRefer将参考帧选择与坐标条件化框回归解耦,并用坐标感知SFT结合基于3D IoU奖励的GRPO对两阶段优化。实验中,在ScanRefer上相对坐标无关基线提升约11% Acc@0.25和7% Acc@0.5,几何精修版本还超过部分显式3D输入方法。

EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal Figure 1
2026-08-07cs.CV

EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen, Qimeng Wu, Zhengbo Zhang, Wenming Yang, Zhiyong Wu

2026-08-07视觉感知强化学习

针对视频目标移除常遗漏阴影、反射、涟漪、烟尘等目标诱发效应且跨帧不稳定的问题,EffectLearner引入VLM目标-效应推理器,将结构化效应分析压缩为语义上下文来指导DiT视频擦除器,并结合运动感知掩码与一致性损失;同时构建EffectWorld和渐进训练。在ROSE-Bench及EffectWorld评测上多数指标优于基线,显示复杂效应和开放场景下的移除质量与时序稳定性更好。

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs Figure 1
2026-08-07cs.CV

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

School of Information, Renmin University of China

2026-08-07数据集/基准安全鲁棒

本文关注 MLLM 是否能在动态视频中提前识别真实物理风险,而不只是事后描述事故或识别有害内容。作者提出 SPRINT,用 2888 个体育视频标注早期危险线索、事故时刻和分层原因,并加入安全样本检测误报。实验显示模型危险提示准确率可超 95%,但原因识别低于 50%,且显式危险提问会显著诱发安全视频误报,说明现有模型的主动安全更多是表层告警,缺乏稳健的因果理解。

Hierarchical Flow Matching for 3D Point Cloud Generation Figure 1
2026-08-07cs.CV

Hierarchical Flow Matching for 3D Point Cloud Generation

Linhao Wang, Qichang Zhang, Ye Su, Hao Wang

Shandong Normal University, University of Macau

2026-08-07生成模型三维

针对点云生成中全局拓扑与局部几何难以同时建模、CNF训练昂贵且扩散采样缓慢的问题,本文提出HFM,将流匹配拆成潜空间全局形状流与条件点级细节流,用OT直线路径和MSE目标端到端训练。实验在ShapeNet、ModelNet上显示其生成质量达到或超过部分现有方法,并可用少量Euler步采样。

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction Figure 1
2026-08-07cs.CV

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

2026-08-07视觉语言数据集/基准三维

本文针对机械工程图到高保真3D CAD重建缺少真实大规模基准的问题,提出OmniMech:包含25.1万带尺寸、公差和语义标注的工业二维正投影图,并配套原生CAD、STEP/B-rep、网格和多视角渲染,评测参数化程序生成、图纸到3D推理、标注约束理解和工具增强推理。结果显示,通用VLM和CAD专用模型在可执行程序合成、细粒度几何恢复及尺寸公差约束落地上仍明显不足。

HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models Figure 1
2026-08-07cs.CV

HERA: Historical Evidence Routing Adapter for Physical Prediction in Latent World Models

Yuanruyi, Yue Cao, Haojia Gao, Guanqiu Guo, Ziyuezhang, Shangqin, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

2026-08-07强化学习

这篇论文关注潜在视频世界模型在遮挡场景中难以调用早期物体证据的问题。作者提出 HERA/RRPM,在冻结 V-JEPA 2 预测器的前提下,用结构化补丁记忆、Memory Registers 与 Workspace Registers 将历史证据选择性路由到预测过程。IntPhys2 Main 上 pairwise AvgSurprise 从 52.57% 提升到 54.35%,固定相机连续性和不变性子集提升更明显,但总体增益幅度仍较有限。

DynaPix: Can Vision-Language Models Identify the Exact Future? Figure 1
2026-08-07cs.CV

DynaPix: Can Vision-Language Models Identify the Exact Future?

Thong Nguyen, Vinh-Hien Do, Quynh Vo, Cong-Duy Nguyen, See-Kiong Ng

Centre for AI Research, VinUniversity, National University of Singapore

2026-08-07视觉语言视觉感知

这篇论文针对具身智能中“预测真实未来状态”而非生成合理描述的需求,提出 DynaPix:用物理仿真提供可验证真值,让模型在相近候选图或万帧库中找出精确未来帧。结果显示,现有 VLM 在事件锚定时尚可,但按经过时间定位几乎接近随机;基于仿真记录的物理 CoT 蒸馏和检索微调能显著提升部分任务,但长时距时间锚定仍未解决。

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning Figure 1
2026-08-07cs.CV

APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning

Sadegh Jafari, Mohiuddin Bilwal, Fan Zhou, Brian Gelder, Ali Jannesari

Department of Computer Science, Iowa State University, Department of Agricultural and Biosystems Engineering

2026-08-07视觉感知

APQF针对视觉模型在边缘部署中计算和存储成本高、压缩方案依赖人工调参且难跨架构迁移的问题,引入由 profiling 驱动的多智能体流程,用实测层级代价与剪枝敏感性指导结构化剪枝、混合精度量化和自适应微调。实验覆盖 CNN 与 ViT,在 ImageNet 上将 bit-ops 降至原始的 5.6% 至 7.7%,较联合剪枝量化基线在有限训练预算下高约 17 个 Top-1 点,CIFAR-10 上多数架构也取得更高压缩率或精度。

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing Figure 1
2026-08-07cs.CV

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

University of Rochester

2026-08-07视觉感知数据集/基准

针对视频生成与编辑评测任务割裂、固定维度难以覆盖实例需求且评分证据不足的问题,VideoArgus为每个输入先生成与输出无关的样本级评分规程,再用VLM问答和视觉工具按准则取证评分。其VideoArgus-Bench覆盖五类任务、1026个实例;在1260个视频的人类一致性测试中,排序相关性优于对应专用评测器,且不同骨干下排名较稳定。

CDSeg: A Renderable Gaussian Carrier for Image-to-3D Label Transfer Figure 1
2026-08-07cs.CV

CDSeg: A Renderable Gaussian Carrier for Image-to-3D Label Transfer

Wentao Sun, Yiping Chen, Zhengsen Xu, Jonathan Li, John S. Zelek

Department of Systems Design Engineering, University of Waterloo, N2L 3G1 Waterloo, Canada, School of Geospatial Engineering and Science, Sun Yat-sen University, 519082 Zhuhai, China, Department of Geomatics Engineering, University of Calgary, T2N 1N4 Calgary, Canada

2026-08-07视觉感知三维

针对2D图像掩码难以稳定落到3D并跨视角复用的问题,CDSeg把高斯溅射基元作为可渲染标签载体,用渲染得到的像素-基元可见关系和多视角投票完成标签融合;它同时支持保留点云索引和直接标注优化高斯场景,无需专门3D分割训练。实验覆盖提示、实例、语义和LiDAR迁移,在DesktopObjects-360、NeRDS-360和ScanNet-v2上分别达到92.35%、95.89%和65.77% mIoU,并能处理百万级基元。

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers Figure 1
2026-08-07cs.GR

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

Hosei University

2026-08-07视觉感知

这篇论文针对现有图形摘要生成多为栅格图、难以在论文写作和审稿中反复修改,且容易脱离研究者真实数据的问题,提出 Editable GA Generation 任务、GenGA 向量化 SVG 生成框架,并用 SIC 衡量局部编辑是否会牵连全局结构。实验显示,GenGA 在编辑简易性上优于既有方法,并在简洁性和语义对齐上超过人工图形摘要,SIC 也与人工编辑成本相关。

A Foundational EDM2-Based Generative Model for High-Resolution Synthetic Fetal Ultrasound Imaging from Open Datasets Figure 1
2026-08-07eess.IV

A Foundational EDM2-Based Generative Model for High-Resolution Synthetic Fetal Ultrasound Imaging from Open Datasets

Harvey Mannering, Yilin Zhang, Ziao Liu, Zhiwu Huang, Jacqueline Matthew, Miguel Xochicale

2026-08-07生成模型数据集/基准

针对胎儿超声数据稀缺、隐私受限且标注困难的问题,论文用多源开放数据训练 EDM2 扩散模型,生成六类 512×512 合成图像,并通过 EDM2-S/XL 与 autoguidance 提升质量。结果显示整体 FID 从 Tian 等的 176.85 降至 104.25,合成预训练再微调的集成分类准确率达 93.36%,但临床评分仅 2.67/5,仍有平滑、散斑和解剖不一致问题;增益可能主要来自 scaling / data。

MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation Figure 1
2026-08-07cs.CV

MOSAIK: Multi-Patch Content-Aware Spatial Allocation of Image Tokens for Efficient Generation

Mohammadreza Hami, Mohammadreza Samadi, Chao Gao, Negar Hassanpour

2026-08-07视觉感知

像素空间扩散能避免 VAE 重建上限,但高分辨率下 token 数使自注意力开销很大;MOSAIK 的核心洞察是图像不同区域对粗 patch 的损伤不同,因此用中间去噪特征预测局部退化,并在给定预算下为敏感区域分配细 patch、简单区域分配粗 patch。实验显示其在约 70% FLOPs、83% token 减少时 GenEval 基本匹配完整 PixelDiT,DPG-Bench 仅降 1.0 分。

Invisible Shortcuts: Why Vision Encoders Know Your Camera Figure 1
2026-08-07cs.CV

Invisible Shortcuts: Why Vision Encoders Know Your Camera

Vladan Stojnić, Ryan Ramos, Giorgos Kordopatis-Zilos, Noa Garcia, Giorgos Tolias

VRG, FEE, Czech Technical University in Prague, The University of Osaka, sion, whether through categorical labels (ImageNet) or billion-scale cap-, vision, including object–background dependencies [21,45,64], color–label correla-, similar conditions, creating systematic associations between labels or captions, vision: categorical label supervision on ImageNet and caption supervision on

2026-08-07视觉感知

本文关注视觉编码器为何会受相机与图像处理元数据影响:作者指出,JPEG 质量、焦距、相机型号等肉眼不可见的像素级痕迹会因与 ImageNet/LAION 语义监督相关而成为捷径特征。通过诊断指标和受控相关性实验,论文显示相关性越强,模型越会编码元数据,语义预测在元数据分布漂移下退化越明显;针对单一元数据的预训练或后处理缓解还能泛化到未见属性,并在保持下游性能的同时改善 OOD 泛化,但也会削弱生成图像检测能力。

Adapting Vision Foundation Models with Cascaded Semantics Figure 1
2026-08-07cs.CV

Adapting Vision Foundation Models with Cascaded Semantics

Xi Xiao, Xingjian Li, Cheng Han, Tianyang Wang, Lin Zhao, Yunbei Zhang, Guosheng Hu, Runmin Jiang, Xi Li, Xiao Wang, Min Xu

University of Alabama at Birmingham, Carnegie Mellon University, University of Missouri–Kansas City, Northeastern University, Tulane University, University of Bristol, Oak Ridge National Laboratory

2026-08-07视觉感知

这篇论文针对视觉提示调优依赖随机初始化、缺少可解释先验的问题,提出将颜色、纹理、形状等手工图像先验注入输入空间,并用逐样本自注意力语义引导特征空间,再通过级联融合和重加权适配器贯穿 ViT 适配。实验覆盖 34 个分类数据集,声称仅调优 0.74% 参数即可优于多种 PEFT 基线,并在消融和表征分析中显示对定位、类间分离和迁移有帮助。

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model Figure 1
2026-08-07cs.CV

Text-Guided Refinement of Multi-sequence Glioma Subregion Segmentation with a Vision-Language Foundation Model

Zach Eidex, Yu-nong Lin, Mojtaba Safari, Sean Pitroda, Ralph Weichselbaum, Zhen Tian, Xiaofeng Yang

Department of Biomedical Informatics, Emory University School of Medicine, Atlanta, GA, USA, Department of Radiation and Cellular Oncology, The University of Chicago, Chicago, IL, USA, Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine, Atlanta, GA, USA

2026-08-07视觉语言视觉感知

针对胶质瘤亚区勾画中人工修 contour 耗时、传统分割模型难以按医生文本意图局部修正的问题,本文在冻结 VoxTell/Qwen 主体的基础上加入轻量指令分支,将结构化纠错提示注入多尺度解码器,实现扩张、收缩、增删等文本引导细化。BraTS-GLI 测试中 T1c 单模态平均 DSC 由 0.774 提升至 0.796,跨数据集由 0.527 升至 0.550,且优于空白和矛盾提示,说明增益与文本指令相关但幅度较小。

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation Figure 1
2026-08-07cs.RO

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

The Hong Kong University of Science and Technology, National University of Singapore, Nanyang Technological University, Wuhan University, Sun Yat-sen University, Xidian University, Southeast University

2026-08-07机器人强化学习

这篇论文针对多视角 VLA 将主视角与腕部视角并列融合、忽视腕部近端接触动态的问题,提出 W2-VLA:用任务条件化的潜在接口把全局任务语境传给腕部预测器,预测未来腕部 latent,并以结构化 W2-CoT 监督塑造该接口。实验在 LIBERO、RoboTwin 2.0 和真实单臂/双臂任务上优于基线,LIBERO 平均成功率 98.5%,且推理无需 CoT、动作生成超过 80 Hz。

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection Figure 1
2026-08-07cs.CV

LoDA: A Level of Detection Aware Method and a Multimodal Sensing Benchmark for Object Level Change Detection

Haitian Wang, Xinyu Wang, Sheldon Fung, Xian Zhang, Zichen Geng

Western Australia Machine Intelligence Group Pty Ltd, Department of Computer Science and Software Engineering, School of Electrical Engineering, Computing and Mathematical Sciences, Western Australia Machine Intelligence Group Pty Ltd Nedlands WA Australia, Department of Computer Science and Software Engineering The University of Western Australia Crawley WA Australia, School of Electrical Engineering, Computing and Mathematical Sciences Curtin University Bentley WA Australia

2026-08-07视觉语言视觉感知数据集/基准

面向自动驾驶和智慧城市中高精地图随时间失配的问题,本文把多时相车载 LiDAR 变化检测从点级差分推进到对象级地图更新。核心做法是显式建模局部可检测限,将配准不确定性、点密度和表面粗糙度传播到变化判定中,并结合几何代理、语义实例和高度/体积/法向位移线索输出新增、移除、增大、减小或不变标签;同时发布 Subiaco 双时相多模态基准 LoDA。结果显示方法在 LoDA 上达 95.0% ACC、90.8% macro F1、83.0% macro IoU,并在 Urb3DCD-V2 上优于已报告强基线。

Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation Figure 1
2026-08-07cs.CV

Positive-Unlabeled Preference Optimization For Chest X-ray Report Generation

Yuta Kobayashi, Pradyun Ramesh, Muhammad Ahmed Chaudhry, Vincent Jeanselme, Judy Wawira Gichoya, Sanmi Koyejo, Kathleen Capaccione, Shalmali Joshi

Columbia University &Pradyun Ramesh ∗, Columbia University &Muhammad Ahmed Chaudhry, Stanford University &Vincent Jeanselme, Columbia University &Judy Wawira Gichoya, Emory University &Sanmi Koyejo, Stanford University &Kathleen Capaccione, Columbia University &Shalmali Joshi, Columbia University

2026-08-07优化算法

这篇论文关注胸片报告生成中的“遗漏噪声”:回顾性报告常把实际存在但临床优先级较低的发现写漏,导致VLM学会少报。作者将未提及发现视为未标注而非阴性,提出PU-DPO,用编辑生成“提及/省略”对比偏好并进行噪声校正。实验显示其在半合成噪声和真实胸片基准上提高多种病灶检测率与隐藏阳性恢复,较标准DPO更稳健。

Context Matters: Support Set Selection and Failure Detection for In-Context Medical Image Segmentation Figure 1
2026-08-07cs.CV

Context Matters: Support Set Selection and Failure Detection for In-Context Medical Image Segmentation

Youssef Gehad, Emmanuel Zerefa, Krish Kabra, Guha Balakrishnan

2026-08-07视觉感知

这篇论文针对医学图像 in-context 分割对支持集高度敏感的问题,研究如何在无需重训的场景下降低错误风险。核心做法是用 DINOv3 图像嵌入按查询相似度选择支持样本,并训练 transformer 分类器仅凭查询与支持图像预测分割是否会低于 IoU 阈值。实验在四个基准和三种模态上表明,相似度选择普遍不弱于随机采样,小支持集时收益最大,失败检测也在所有任务上超过随机水平。

Evaluating Machine Learning Models for Post-Wildfire Debris-Flow Prediction Figure 1
2026-08-07cs.LG

Evaluating Machine Learning Models for Post-Wildfire Debris-Flow Prediction

Quinn Ledingham, Zhengsen Xu, Yimin Zhu, Zack Dewis, Mabel Heffring, Saeid Taleghanidoozdoozan, Motasem Alkayid, Megan Greenwood, Lincoln Linlin Xu

2026-08-07生成模型

针对火后泥石流预警中样本少、类别不平衡且灾害/非灾害特征重叠的问题,论文系统比较15类机器学习模型,并用SHAP检验特征依赖、用TabPFN生成合成样本做增强。结果显示TabPFN在未增强时威胁评分最高为0.637,但与ExtraTrees等树模型差距很小;短时降雨强度和风暴累积量最关键,合成增强除CNN外普遍带来小幅收益。

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval Figure 1
2026-08-07cs.CV

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

The George Washington University, trieval direction, and description length. Code and dataset are available

2026-08-07视觉语言视觉感知

这篇论文针对CLIP/BLIP依赖短caption训练、难以处理细粒度长文本检索的问题,控制架构和视觉编码器不变,只改变文本监督粒度来做消融。核心洞察是,多句段落监督比增加caption数量或扩展位置编码更能教会文本编码器利用长上下文;在50万CC3M合成数据上,段落模型在ShareGPT4V追平Long-CLIP-L,并在DOCCI图到文R@1上高出14点以上,同时发现硬负例在仅微调文本端时反而显著伤害性能。

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI Figure 1
2026-08-07cs.CV

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

2026-08-07视觉感知

本文针对将 CNN 时代的 Grad-CAM 直接套用于 Vision Transformer 的方法错配问题,系统审计 550 余篇论文并筛出 175 篇相关工作,提出按特征位置、梯度目标、token 处理、空间重建和聚合策略划分的适配分类。主要发现是多数论文未充分说明数学或实现细节,同一 ViT 在不同层和权重选择下可产生显著不同热图,使“使用 Grad-CAM”本身并不足以构成可复现解释。

WorldClaw: Agentic 3D Open-World Generation at Scale Figure 1
2026-08-07cs.AI

WorldClaw: Agentic 3D Open-World Generation at Scale

Chunchao Guo, Jinpeng Li, Yang Li, Zilong Huang

2026-08-07强化学习三维

面向游戏、VR、具身智能与机器人仿真中可探索且可编辑的大规模三维环境,WorldClaw的核心洞察是先全局确定语义、区域组织和地形,再按需生成局部实例内容。它用规划代理、区域感知地形、图像到3D资产重建和渲染反馈细化,把文本提示转成显式网格世界;实验显示可生成多样地貌、清晰区域结构和较丰富物体组合,但效率开销与对底层模型能力的依赖仍较明显。

Disentangling 3D Modeling from Spatial Reasoning Figure 1
2026-08-07cs.LG

Disentangling 3D Modeling from Spatial Reasoning

Haoze Sun, Jiequan Cui, Qingshan Xu, Richang Hong

2026-08-07三维

这篇论文针对现有空间推理模型把3D感知与推理耦合训练、成本高且难诊断的问题,提出DiSR:先用现成感知专家提取位置、尺寸、朝向等结构化3D证据,再让LoRA微调的LLM只在这些证据上推理。实验显示其在3DSRBench和SPAR-Bench上分别超过此前最佳3.77%和1.70%,同时显著减少训练数据、参数和算力。

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion Figure 1
2026-08-07cs.CV

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

2026-08-07视觉感知生成模型

该文针对少步自回归视频扩散在实时生成中依赖干净历史帧导致细节泄漏、动态退化且难以并行的问题,提出 In-Context Forcing:按距离为上下文帧设置递减噪声,并用 Step-wise Rolling KV Cache 维持训练一致性。实验显示其在 VBench 上提升视觉质量、语义/动态表现,并通过跨帧因果注意力加速推理。

Coherence-Oriented Dream Scene Visualisation Figure 1
2026-08-07cs.AI

Coherence-Oriented Dream Scene Visualisation

Azra Açıl, Simon Colton

School of Electronic Engineering and Computer Science, Queen Mary University of London, UK

2026-08-07视觉感知

本文面向梦境难以用文字传达且单图生成缺乏时序连贯的问题,提出 DSV:用 Qwen 将梦境拆成四个时间面板,经提示词扩展、SDXL img2img 链式生成和 CLIP 反馈重生成来同时维持叙事、视觉与语义一致性。在 50 条 DreamBank 梦境上,作者用 CLIP、DINOv2 和 Qwen2-VL 评估对齐、相邻面板相似度及七项质量指标,但具体相对基线和增益来源文中未充分说明。

NeuroAdaptTrainer: A Fiji/ImageJ Plugin for YOLO-Based Neuron Segmentation, InteractiveCorrection and Transfer Learning Figure 1
2026-08-07cs.CV

NeuroAdaptTrainer: A Fiji/ImageJ Plugin for YOLO-Based Neuron Segmentation, InteractiveCorrection and Transfer Learning

Daniela Eraso-Casas, Gerard Villarroya-Pique, Esther Serrano-Pertierra, M. Teresa Fernández-Sánchez, Antonello Novellie, Angel Rio-Alvarez, Víctor M. González

Computer Sciences Department, University of Oviedo, Asturias, Spain, Electrical Engineering Department, University of Oviedo, Asturias, Spain, Biomedical Engineering Center (BME), University of Oviedo, Asturias, Spain, Biochemistry and Molecular Biology Department, University of Oviedo, Asturias, Spain, Institute of Biotechnology of Asturias (IUBA), University of Oviedo, Asturias, Spain, Psychology Department, University of Oviedo, Asturias, Spain

2026-08-07视觉感知

该工作面向神经元显微图像计数与分割中人工标注耗时、跨显微镜和成像条件泛化差的问题,提出将YOLO实例分割嵌入Fiji/ImageJ的NeuroAdaptTrainer插件;核心在于把自动检测、交互式纠错、YOLO格式标注生成、迁移学习和外部验证串成无需编码的闭环。主要结果是发布开源v1.0工具,可在单图或批量图像上运行并比较基础/微调模型,但文中未充分说明定量精度增益。

A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization Figure 1
2026-08-07cs.CR

A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization

Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay, Chandan Karfa

2026-08-07视觉感知优化算法

该文关注ViT为满足边缘端能耗与时延约束而采用的输入自适应推理,却可能被攻击者反向利用来增加计算量。论文的主要洞察是把SlowFormer通用补丁与DeSparsify逐图扰动放到A-ViT、ATS、AdaViT等剪枝框架下统一比较,并用GFLOPs、精度损失和Attack Success衡量效率退化。结果显示攻击可显著抵消剪枝带来的计算节省,甚至推高内存、能耗和时延;现有防御只能部分恢复效率,且跨框架鲁棒性和硬件实测仍不足。

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances Figure 1
2026-08-07cs.RO

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

Jihoon Oh, Kento Kawaharazuka, Kei Okada

The authors are with the University of Tokyo, Japan.

2026-08-07视觉语言视觉感知

这篇论文针对人类视频难直接迁移到机器人、且单一可供性难形成可执行动作的问题,提出从第一视角视频中用3D重建、手部网格和分割自动抽取视觉接触、抓取姿态与轨迹,并训练统一的视觉语言可供性模型VLAff。其主要创新在于把“在哪交互、如何抓、怎样运动”放入同一模型和数据集EgoAffordance中学习跨模态关联。实验显示其在视觉可供性预测上达到SOTA,并可用于零样本操作和可供性引导学习,但部分增益可能主要来自 scaling / data。

StyleComposer: Training-Free Multi-Reference Style Composition Figure 1
2026-08-07cs.CV

StyleComposer: Training-Free Multi-Reference Style Composition

Sanghyeok Lee, Jihye Kang, Namhyuk Ahn

2026-08-07三维

针对现有参考引导风格化把颜色、纹理和结构混成单一风格信号、难以分别指定来源和强度的问题,StyleComposer发现扩散模型中没有一个表示能同时解耦三者,于是将颜色路由到VAE色彩子空间、纹理和结构分别经注意力K/V与早期Q特征控制,并按去噪时间协调。实验显示其在三参考组合中取得最高Composition与Selectivity,用户研究也更偏好其联合满足参考与提示的结果。

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation Figure 1
2026-08-07cs.CV

Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation

Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

CISPA Helmholtz Center for Information Security 2 Hewlett Packard Enterprise

2026-08-07视觉感知

论文关注多轮视觉故事生成中的安全盲区:单张图片看似无害,组合后却可能形成仇恨叙事。作者构建 HatefulStoryPrompts 和 HatefulVisualStory,评测前沿图像生成模型与审核器,发现模型完成仇恨故事率均超 80%、最高 99.0%,现有检测器召回偏低;交互感知监控可将召回提升到 92.6%–97.3%。

MapTCL: Temporal Consistency Learning via Bidirectional Alignment for Vectorized HD Map Construction Figure 1
2026-08-07cs.CV

MapTCL: Temporal Consistency Learning via Bidirectional Alignment for Vectorized HD Map Construction

Hyeonseo Kim, Juyeb Shin, Hyeonjun Jeong, Hiwon Shin, Dongsuk Kum

2026-08-07视觉感知

MapTCL针对在线矢量化HD地图在遮挡和动态场景中易出现帧间抖动、实例闪烁的问题,核心洞察是仅做逐帧监督不足以约束同一地图元素的时间一致性。方法以训练期辅助损失形式引入双向矢量一致性学习和栅格一致性学习,对相邻帧预测做坐标对齐与双向匹配,不增加推理开销。在nuScenes和Argoverse 2上分别带来约+3.7/+3.1 mAP及+2.8/+2.5 C-mAP提升。

RIG-RoPE: Relation- and Instance-Gated Rotary Positional Encoding with Duration-Aware Temporal Coordinates Figure 1
2026-08-07cs.CL

RIG-RoPE: Relation- and Instance-Gated Rotary Positional Encoding with Duration-Aware Temporal Coordinates

Donggen Li

Sichuan University

2026-08-07视觉感知

本文针对多模态序列中 RoPE 静态坐标的两个问题:跨模态/跨实例图像块并无可靠空间位移,却仍被施加高宽旋转;文本、图像、视频又常被等步长计时。RIG-RoPE 通过实例门控仅保留同一视觉实例内的空间旋转,并用信息持续时间构造时间坐标,无新增参数且可嵌入注意力核。主要结果是给出形式化论证和实现路径,但大规模实验留待后续,实际增益文中未充分说明。

2026-08-06

131 篇
CoCo-IR: Contextual Composed Image Retrieval Figure 1
2026-08-06cs.CV

CoCo-IR: Contextual Composed Image Retrieval

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

2026-08-06视觉感知三维

这篇论文针对传统组合图像检索只能处理单轮“图像+指令”、难以承接真实搜索中连续修改意图的问题,提出多轮上下文检索任务 CoCo-IR,并用 LMM 生成随对话历史演化的 TIE 嵌入,配合自动合成与难负例验证的数据引擎训练。结果显示其在 CIRCO 达到 39.4 mAP@5,在四轮 CoCo-IR 上 R@1 为 44.1,明显高于改造后的既有方法 28.2。

Objects as Audio-Visual Modal Sound Fields Figure 1
2026-08-06cs.CV

Objects as Audio-Visual Modal Sound Fields

Zisen Shao, Zihao Wei, Derong Jin, Ruohan Gao

2026-08-06视觉感知

本文针对现有3D物体重建偏重几何与外观、难以刻画敲击声中材料和结构信息的问题,提出AV-MSF:用3D Gaussian Splatting及密集视觉特征提供几何先验,再以物理可解释的模态频率、阻尼和位置相关增益表示声音场,从少量敲击录音重建物体声学响应。在ObjectFolder Real和RealImpact上,其新接触点声音合成优于物理仿真和数据驱动基线,并支持接触定位与声音编辑。

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding Figure 1
2026-08-06cs.CV

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

Zhejiang University, Stanford University, Zhejiang University Hangzhou Zhejiang China, Stanford University Stanford California USA

2026-08-06三维

SmartMage针对3D场景理解中固定融合RGB、深度、点云、体素等模态会引入噪声和浪费计算的问题,提出按问题语义动态选模态的SMART路由,并用MAGE将模态token分配给专家以形成专门化推理。实验称其在五个3D基准达到SOTA,并在RGB-only视频任务保持竞争力;ScanFacet还显示不同语义问题确有稳定模态偏好。

Predicting Brain Morphometry with MT-GNN: Mesh Evolution in Continuous Time with Graph-Based Metric Tensor Embeddings Figure 1
2026-08-06cs.CV

Predicting Brain Morphometry with MT-GNN: Mesh Evolution in Continuous Time with Graph-Based Metric Tensor Embeddings

Hao Ding, Daniel Semchin, Paul M. Thompson, Boris Gutman

2026-08-06视觉感知

这篇论文面向阿尔茨海默等场景中亚皮层结构形态随时间变化很小、易被扫描噪声淹没的问题,提出 MT-GNN 不直接外推顶点,而是在连续时间预测网格的内在度量张量,并通过可微 ARAP 重建约束生成可实现表面。ADNI 14 个结构实验中,它在所有预测时距和全部结构上优于时间均值、DCM 与 TransforMesh,平均顶点误差较时间均值低 2.29%。

OPD-V: Visual On-Policy Self-Distillation with Modality Balance Figure 1
2026-08-06cs.CV

OPD-V: Visual On-Policy Self-Distillation with Modality Balance

Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

2026-08-06强化学习

本文关注多模态大模型在视觉推理自蒸馏中易被文本先验主导、导致特权视觉信息利用不足的问题。核心洞察是将“模态平衡”本身作为特权信息,用放大图正教师与遮罩图负教师的 logits 差定义可信 token 区域,只在该区域做 JS 自蒸馏。实验覆盖 6 个基准、4 个骨干和 5 种后训练方法,显示 OPD-V 稳定提升推理性能并降低训练开销。

IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers Figure 1
2026-08-06cs.CV

IRIS: A Visual Cortex-Inspired Framework for Analyzing Orientation Selectivity in Vision Transformers

Vaishnavi B Mohan, Vijayakrishna Naganoor, Yashas Annadani, Shashank Hegde

University of Washington, USA, Gladstone Institute, USA

2026-08-06视觉感知

这篇论文关注 ViT 缺少局部归纳偏置时,是否仍会形成类似 V1 的低层方向选择性表征。作者提出 IRIS,用 RSS、ORS 和调谐带宽等神经科学指标,在不同深度、训练范式、模型规模与训练阶段上探测冻结 ViT。结果显示训练目标比规模更决定方向编码位置,早中层会逐步招募方向选择单元,深层则转向更宽、更语义化的表征;RSS 峰值还可作为选择微调解冻层数的启发式依据。

Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition Figure 1
2026-08-06cs.CV

Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition

Paritosh Parmar, Landy Lan, Hong Yang, Chen Yi, Chiat Pin Tay

Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore

2026-08-06视觉感知安全鲁棒

这项工作针对教室监控中安全事件难以及时发现、且涉及儿童隐私和部署算力约束的问题,构建合成 CCTV 视频与真实课堂姿态数据结合的基准,并用骨架姿态的方向、速度、加速度等层级运动学特征进行识别,再通过教师到学生的蒸馏压缩多阶运动推理。实验显示其在低于大型基线十分之一计算量下取得更好性能,并具备较强域外与合成到真实泛化能力。

HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes Figure 1
2026-08-06cs.CV

HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes

Orazio Pontorno, Luca Guarnera, Zahid Akhtar, Sebastiano Battiato

Department of Mathematics and Computer Science, University of Catania, Catania, Italy, Department of Electrical and Computer Engineering, State University of New York Polytechnic Institute, Utica, NY, USA

2026-08-06视觉感知

针对AI篡改CT在临床流程中的安全风险,HexMIL关注现有检测器对未知生成模型泛化差、且缺乏可解释性的问题。方法用体级二分类标签训练,将CT按切片和patch做层级MIL,并把两级门控注意力直接组合成3D归因图,从模型前向过程解释篡改区域。跨生成器测试中,在M3DSynth和CT-GAN上较基线提升约9.1 AUC、9.4 F1,并取得更好的IoU和Pointing Game定位结果。

Lesion Detection in CT with Frozen Self-Distilled Features: SALT, a Spatially Adaptive Label-Guided Temperature Figure 1
2026-08-06cs.CV

Lesion Detection in CT with Frozen Self-Distilled Features: SALT, a Spatially Adaptive Label-Guided Temperature

Mahmut S. Gokmen, Evan W. Damron, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

University of Kentucky, University of Louisville

2026-08-06视觉感知

CT病灶常很小且标注稀缺,常规自监督预训练对所有图像位置一视同仁,难以让病灶在冻结特征中形成清晰几何分离。论文提出SALT,在预训练时用弱框标注定位病灶区域,并在该区域锐化教师温度、提高patch损失权重,推理时仍是普通冻结编码器。对照同架构同数据模型,病灶/背景分离边距由0.105升至0.449,3D检测CPM由0.394升至0.508,增益主要集中在小于6毫米病灶。

Bag-of-Visual-Words for Spatial Mapping of Lung Adenocarcinoma Growth Patterns Figure 1
2026-08-06cs.CV

Bag-of-Visual-Words for Spatial Mapping of Lung Adenocarcinoma Growth Patterns

Darya Ardan, Valentin Oreiller, Henning Müller

2026-08-06视觉感知

这篇论文针对肺腺癌全切片中生长模式空间分布难以用单个主标签或小块聚类刻画的问题,提出以ROI为单位的弱监督BoVW流程:用冻结病理基础模型嵌入聚类成视觉词典,再以同类ROI直方图原型做JSD近邻匹配并投射为空间图。87例CPTAC-LUAD上,肿瘤/健康平衡准确率达0.974;二分类分级达0.729,高于均值池化SVM的0.678。

HelloWorld: Enabling Socially Interactive Characters in Video World Models Figure 1
2026-08-06cs.CV

HelloWorld: Enabling Socially Interactive Characters in Video World Models

Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato

2026-08-06视觉感知强化学习

现有视频世界模型多能控制镜头或事件,却难让场景角色主动回应用户。HelloWorld将交互按钮、文本提示和相机轨迹结合,通过自蒸馏生成含社交动作与镜头运动的数据微调模型,并用训练-free时序交叉注意力掩码定位响应时间。HelloWorldBench实验显示其在交互类型、时机和面向观众等指标上优于基线,同时保持较好的画质与相机跟随能力。

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection Figure 1
2026-08-06cs.CV

VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection

Narges Rashvand, Ghazal Alinezhad Noghre, Shanle Yao, Gabriel Maldonado, Hamed Tabkhi

Electrical and Computer Engineering Department, University of North Carolina at Charlotte, base for this work is available at https://github.com/TeCSAR-UNCC/VQ-VAD., anomalies. While these approaches have advanced the field by reducing the need for labeled anomalies, they

2026-08-06视觉感知

这篇论文针对视频异常检测中异常样本稀缺、外观噪声和隐私问题,转向基于人体姿态的运动建模,并指出连续潜空间难以形成紧凑可迁移的正常行为模式。VQ-VAD将VQ-GAN改造为关键点序列的离散运动码本,只用正常动作训练,以重建误差判别异常;在HR-SHT上达81.83%,从CMU Panoptic跨域到HR-SHT无需重训达76.69%,跨数据集结果显示一定鲁棒性。

Beyond Reprojection Error: Camera Calibration with 3D Targets Figure 1
2026-08-06cs.CV

Beyond Reprojection Error: Camera Calibration with 3D Targets

Dennis Ruppel, Hasan Kutlu, Kai A. Neumann, Martin Knuth, Pedro Santos, Andreas Weinmann, Arjan Kuijper

2026-08-06三维

这篇论文针对传统相机标定过度依赖平面靶和重投影误差、未必反映3D重建精度的问题,提出基于场景射线的标定评估框架,并设计带环形特征的二十面体3D标定靶。核心洞察是用交会误差和重建误差直接衡量物方空间精度。实验显示广义畸变模型更贴近物理成像,合成数据中二十面体靶平均交会误差约降40%、bootstrap稳定性更好,但真实数据收益受制造公差强烈限制。

MarsCast: Transfer Learning of AI Weather Foundation Models to Planetary Atmospheres Figure 1
2026-08-06astro-ph.EP

MarsCast: Transfer Learning of AI Weather Foundation Models to Planetary Atmospheres

M.L. Carroll, J. Li, S.D. Guzewich, G.Villanueva, J.A. Caraballo-Vega, M.J. Frost

) NASA Goddard Space Flight Center, ) ADNet Systems, Inc.

2026-08-06视觉感知

这篇论文关注地球天气基础模型能否迁移到火星大气,以降低行星天气预报的训练和计算成本。作者将 GraphCast 接入 MCD 火星气候数据,并用太阳辐射等变量微调;零样本只能保留初始形态、很快退化到气候均值,微调后约 10 个 epoch 即开始学习昼夜温度循环,10 天预报可复现季节和垂直温度结构,但增益可能主要来自 scaling / data 与火星特定强迫。

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing Figure 1
2026-08-06cs.CV

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

The University of Hong Kong 2 Wan Team, Alibaba Group 3 Zhejiang University 4 Peking University

2026-08-06视觉感知数据集/基准

该文针对指令式视频编辑评测仍偏图像编辑、忽视时间与音频且指标容易高估“看起来合理但未按指令编辑”的问题,提出 OmniEdit-Bench,将任务扩展到空间、时间、音频、参考与推理维度,并用准确性约束保真、真实感和一致性评分。实验显示现有开源与商业模型在视频特有维度和隐式推理指令上普遍表现不足。

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes Figure 1
2026-08-06cs.CV

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

2026-08-06视觉语言生成模型强化学习

本文针对统一多模态预训练仍依赖经验调参、模态交互机制不清的问题,系统比较语言、视觉理解与视觉生成的知识流。核心洞察是跨模态迁移明显不对称:语言和视觉理解更能促进生成,任务复杂度决定协同或竞争,早期联合训练优于后期对齐并可避免“视觉懒惰”。实验在合成与大规模真实数据上验证,并将非对称数据配比、共享注意力/归一化、分离 FFN 与 MoE 结合,在 13.5B MoE、2T tokens 规模下仍保持高效,部分生成效果可用约 5% 计算预算获得。

Promptable Animal Pose Tracking Across Species Figure 1
2026-08-06cs.CV

Promptable Animal Pose Tracking Across Species

Le Li, Daniela Ivanova, Nicolas Pugeault

School of Computing Science, University of Glasgow

2026-08-06视觉感知三维

面向跨物种动物行为分析中标注昂贵、固定关键点模型泛化差的问题,论文提出可提示的动物姿态跟踪框架:用户只需在参考帧标注关键点,系统利用 DINOv3、扩散特征等视觉基础模型进行匹配,并提供监督的关键点提示编码器路线与免训练的无监督对应路线。在 APTv2 和 TigDog 上,方法显示出较好的精度与跨物种鲁棒性权衡。

ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing Figure 1
2026-08-06cs.CV

ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing

Xu Guo, Zhengxuan Wei, Xinghui Li, Hanzhuo Huang, Xinyu Liu, Xiangyang Luo, Min Wei, Yiran Zhu, Qiulin Wang, Yulong Xu, Xintao Wang, Pengfei Wan, Qi Fan, Xiangwang Hou

2026-08-06视觉感知

这篇论文针对视频创作中生成、参考驱动与编辑通常割裂、且多轮镜头历史会让上下文读取成本持续增长的问题,提出交互式多镜头视频创作框架 ContextMaster。其核心是用角色感知位置编码区分参考、历史、源视频和目标,并通过可缓存干净上下文、固定预算稀疏路由和 ConstraintSink 保持约束可见,再用特权上下文蒸馏训练少步推理模型。实验显示其在 T2MV、R2MV、V2MV 及组合流程中提升任务完成度和跨镜头一致性,并在单 GPU 上达到 16 FPS。

Towards Valid B-Rep Generation: Training-Free Wireframe Anomaly Detection and Repair Figure 1
2026-08-06cs.CV

Towards Valid B-Rep Generation: Training-Free Wireframe Anomaly Detection and Repair

Jingyu Wu, Youcheng Cai, Tengyu Luo, Ligang Liu

2026-08-06视觉感知

针对多阶段 B-Rep 生成中间线框的自交、边塌缩和孤立顶点会传导为无效 CAD 实体的问题,论文提出无需训练的 WDR,在推理阶段用 VLM 粗筛结合几何/拓扑能量检测风险,并通过能量引导重采样或扩散 guidance 局部再生成。实验在三个生成器、两个数据集上将 OCCT 核验有效率提升 10.9–26.9 个百分点,同时基本保持多样性和分布质量;但方法依赖暴露线框并增加推理成本。

UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction Figure 1
2026-08-06cs.CV

UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction

Bo Kong, Liruiz Jia, Yi Liang, Chao Liu, Dongfang Han, Tianwei Yan, Yuan Liu, Shengquan Liu

Xinjiang University, Chongqing Jiaotong University, Xinjiang University Urumqi China, Chongqing Jiaotong University Chongqing China

2026-08-06视觉语言安全鲁棒

这篇论文针对统一多模态关系抽取中图文噪声传播和模态分布错位的问题,提出“先去噪、再校准、后融合”的UG-UMRE框架:用高斯不确定性建模和自监督对比学习增强单模态特征,再通过联合偶然不确定性对齐缩小跨模态分布差。实验在UMRE、MORE、MNRE上优于已有方法,消融显示UDUA与JAUA均有贡献,且可插入FocalMRE和REMOTE带来稳定提升。

Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection Figure 1
2026-08-06cs.CV

Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

Weihan Cai, Hao Tan, Zichang Tan, Jun Wan, Xinping Gao

2026-08-06视觉语言视觉感知

本文针对现有 AI 生成图像检测器在跨生成器、后处理和真实场景中泛化不足的问题,指出视觉语言模型 PE 的冻结特征已含有更清晰的来源语义结构,但普通线性探针未能利用。作者提出语义原型校准 SPC,用文本分支初始化真假图像类别原型并用监督数据校准;PE-SPC 在多类基准上超过 DINOv3 线性基线,达到新的最佳结果。

An active-learning framework for real-time depth perception from monocular vision streams Figure 1
2026-08-06cs.CV

An active-learning framework for real-time depth perception from monocular vision streams

Xiaorong Zeng, Weiqiang Chen, Peng Shi, Liang Su, Zirui Wang, Xuewu Ji, Shuiwen Shen

W. Chen and L. Su are with King Long United Automotive Industry Co. Ltd., Xiamen 361023, China., P. Shi is with the School of Electrical and Electronic Engineering, The University of Adelaide, Adelaide, SA 5005, Australia., X. Ji is with the School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China.

2026-08-06视觉感知

这篇论文针对轻量级单目深度模型在边缘部署后遇到光照、天气和域偏移时性能下降的问题,提出以 MobileNetV3-Small 为骨干的在线主动学习框架:用 GCAF 精简跨尺度融合,并通过“预测-评估-校正”闭环选择高置信视频信号更新模型,结合 EWC 约束高 Fisher 参数以实现选择性可塑性。实验称计算量约降 75%,同时保持有竞争力的深度精度,并显示在线适应能力取决于参数可塑性的调控而非单纯模型规模。

Enhancing Low Back Pain Assessment with Diffusion Models for Lumbar Spine MRI Segmentation Figure 1
2026-08-06cs.CV

Enhancing Low Back Pain Assessment with Diffusion Models for Lumbar Spine MRI Segmentation

Maria Monzon, Thomas Iff, Ender Konukoglu, Catherine R. Jutzeler

2026-08-06视觉感知生成模型

腰痛 MRI 评估依赖精细分割,但退变、狭窄等病变会扭曲腰椎结构,使常规模型和人工标注都不稳定。本文将分割视为条件生成,提出 2D SpineSegDiff,并结合 nnU-Net 预分割减少扩散步数,同时用随机采样给出不确定性热图。其在 SPIDER 数据集上总体接近 nnU-Net,退变椎间盘识别更有优势,但统计结果也显示滑脱和椎间隙变窄仍会显著拉低 Dice,临床泛化仍需更大数据验证。

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation Figure 1
2026-08-06cs.CV

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

2026-08-06视觉感知

这篇论文针对视频生音频中动态事件难以与声音时序对齐的问题,指出连续帧的时间差分是区别于图像生音频的关键视觉线索。作者提出TD-V2A,在帧级差分上增强视觉条件,并用分层持续学习与退火差分引导分别改进训练和采样。VGGSound、AudioSet实验显示其在无需额外监督或专用音视频预训练模型的情况下提升生成质量,并超过CAVP等对比方法。

When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit Figure 1
2026-08-06cs.AI

When Shared Rollouts Fail in Defensive Driving Evaluation: A NAVSIM Score Basis Audit

Ziang Wei, Minjun Yu, Zheyuan Lai, Mingjie Pang, Wei Li

2026-08-06数据集/基准

这篇论文质疑 NAVSIM 等重仿真指标是否真能评估防御性驾驶:若参考轨迹和候选策略共享不稳定 rollout,再叠加“参考失败则宽恕”的规则,盲探针也会被错误加分。作者提出共享失败宽恕崩塌审计,用盲策略、依赖栈和求解器对照定位问题;在 12,146 个 navtest token 上,Ignore-All 反超人类回放和 PDM-Closed,而替换求解器后恢复盲策略垫底,说明数值不稳定是直接触发因素。

STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models Figure 1
2026-08-06cs.CV

STEP-OPD: Rethinking Output Targets and Internal Dynamics in On-Policy Distillation for Diffusion Models

Qingyan Wei, Guangzhao Li, Xiaobing Tu, Yinggui Wang, Xiantao Zhang, Jinkui Ren, Xiaohong Liu, Linfeng Zhang

2026-08-06生成模型强化学习

本文针对现有 on-policy 蒸馏只匹配教师输出速度、难以超越教师且缺少层内表征约束的问题,提出 STEP-OPD:用任务教师与共享基座模型的速度差构造“超出教师”的外推目标,并对齐学生与教师跨网络块的表征变化方向和幅度。实验显示其在组合对齐、文字渲染和人类偏好上均优于 DiffusionOPD/DanceOPD,GenEval 从 0.927 提升到 0.961,并超过对应单任务教师。

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations Figure 1
2026-08-06cs.CV

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

Department of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran, Advanced Diagnostic and Interventional Radiology Research Center (ADIR), Tehran University of Medical Sciences, Tehran, Iran

2026-08-06视觉语言视觉感知安全鲁棒

本文针对医疗视觉语言模型仅看平均准确率会掩盖临床风险的问题,构造脑 MRI 多切片诊断的视觉与文本扰动评测:在临床证据不变时重排切片、交换标签位置,并在去除病灶切片后做负控。结果显示模型对呈现顺序和文本框架高度敏感,简单反转切片可导致最高 48.9% 预测翻转,标签重排引发最高 67.8% 不一致,去除关键证据后仍有最高 76.1% 给出确定诊断,说明鲁棒性指标对安全部署更关键。

Training Crossroads for Recurrent Vision Transformers: Recurrence, Neural ODEs, and Deep Supervision Figure 1
2026-08-06cs.LG

Training Crossroads for Recurrent Vision Transformers: Recurrence, Neural ODEs, and Deep Supervision

Grzegorz Gruszczynski, Pawel Olszowiec, Michal Byra, Grzegorz Stefanski, Alberto Presta

2026-08-06视觉感知

本文针对 ViT 深度增加带来的参数线性膨胀,系统比较单块循环 bViT、Neural ODE 训练和阶段式深监督,而非提出新架构。核心洞察是循环共享并非无条件更优:算力受限时标准 ViT 更准,内存受限时 bViT 的精度-参数权衡更好;残差块作 ODE 时需使用状态相减向量场,错误建模会损失 3–6 个百分点,高阶求解器更像结构偏置而非纯数值改进,深监督提升长步外推稳定性但牺牲名义精度。

Persistent Object Narratives for Token-Efficient Video Language Models Figure 1
2026-08-06cs.CV

Persistent Object Narratives for Token-Efficient Video Language Models

Junzhe Chen, Siyuan Meng, Xiaojie Guo

2026-08-06视觉感知

本文针对视频语言模型视觉 token 随帧数膨胀且缺少跨时间对象绑定的问题,提出 SlotNarrative:先用 slot 将视觉特征组织为对象观察,再用无参数记忆把反复出现的对象关联成持久叙事,并拆成身份 token 与状态 token。其固定仅分配 144 个视觉 token,在三个开放式 VideoQA 基准上报告了优于多种紧凑接口的准确率-token 权衡。

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen Figure 1
2026-08-06cs.CV

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen

Delft University of Technology, The Netherlands

2026-08-06数据集/基准

这篇论文瞄准事件相机数据长期偏向自动驾驶、无人机且日常人类活动多为脚本化采集的问题,提出 EventKitchen:用头戴式多传感器在真实厨房中采集非脚本化双目事件数据,并同步 RGB、深度和 IMU。数据覆盖 10 名参与者、13 个厨房、5.5 小时记录,含 10,762 个动作片段和 13,482 个框标注;作者还给出动作识别、目标检测和双目深度估计基线,显示该数据集可作为神经形态视觉在具身/厨房场景中的多任务基准。

Towards a satellite image manipulation and deepfake localization benchmark dataset Figure 1
2026-08-06cs.CV

Towards a satellite image manipulation and deepfake localization benchmark dataset

Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu

Oak Ridge National Laboratory

2026-08-06机器人视觉感知数据集/基准

针对生成式 AI 使卫星影像伪造更逼真、现有遥感 deepfake 数据缺少像素级定位真值或地理元数据的问题,论文构建 fmow-fake-small 基准:基于 fMoW 制作 30 张真实与 30 张篡改图,覆盖随机拼接、目标拼接和扩散修复,并提供掩码、地理配准与采集元数据。主要结果是发布一个可用于检测与定位评测的原型数据集;文中未充分说明算法性能增益。

RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection Figure 1
2026-08-06cs.CV

RegisterBridgeMM: A Register-Centric Framework for RGB-Infrared Object Detection

Zian Wang, Hangchuan Liang, Yuehua Chen, Changchun Li, Chaoyi Guo, Mingzhe Liu, Fangming Gu

Jilin University, China, Taiyuan University of Technology, China, Shenzhen University, China

2026-08-06视觉感知

论文针对RGB-红外检测中密集patch交互成本高、轻量注入又易受主从模态假设限制的问题,提出利用DINOv3预训练register token作为跨模态通信载体;其核心洞察是register中存在共享/特异信息结构,并通过Aggregate-Bridge-Project流程实现双向读取、共识残差调节和特征校准。在LLVIP、M3FD、DroneVehicle、FLIR-Aligned上冻结双骨干仍取得最高mAP50-95。

Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator Figure 1
2026-08-06cs.CV

Global Attention-Fused Image Cropping with Attention-Guided and Global-Aligned Crop Evaluator

Haotian Yang, Zhile Yang, Kin-Man Lam, Patrick Le Callet, Xin Sun

2026-08-06视觉感知

该文针对现有图像裁剪方法过度依赖显著区域、对全局构图关系和裁剪边界变化不敏感的问题,提出 GAFIC:用 AGFF 将候选框区域重要性融合为全局表征,再用 GACE 对齐框内、框外与全图特征以评分候选裁剪。实验在 GAIC 和 CPC 上显示其较多种 SOTA 在裁剪准确性与排序稳定性上更好,适合不改动像素的审美裁剪场景。

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions Figure 1
2026-08-06cs.CV

When Diffusion Models Forget Who You Are: Identity Preservation in Face Inpainting under Large Occlusions

Feng Ding, Shuhuai Xie, Yue Zhou, Yulan Zhang, Guopu Zhu, Mengyao Xiao

2026-08-06生成模型

这篇论文关注大遮挡人脸修复中扩散模型容易“补成别人”的问题,尤其是文本编辑指令会削弱身份一致性。作者提出 ReSem-Face,先从多张参考图中预测缺失区域的身份相关语义先验,再通过语义注意力、身份注意力和文本条件共同约束 U-Net 去噪。实验在 CelebAHQ-IDI-5 和 VGGFace2 上显示,其在严重语义遮挡下身份保持更稳,文本可控编辑质量也优于代表性基线。

Rethinking Pixel Mean Flows via Interval Denoiser Figure 1
2026-08-06cs.CV

Rethinking Pixel Mean Flows via Interval Denoiser

Alexander Zaytsev, Dmitry Baranchuk, Alexander Korotin, Aibek Alanov

2026-08-06生成模型

针对扩散/Flow模型多步采样开销大、潜空间自编码器限制像素保真,以及Pixel MeanFlow缺少严格推导的问题,本文从flow matching ODE直接推导Interval Denoiser,把跨时间区间的预测约束在去噪图像流形上,并用残差裁剪与时间采样课程支持长区间训练。在ImageNet 256上从头训练,1步FID 4.55、2步FID 3.98,且未使用感知损失。

StaticSegFormer: An Efficient High-Performance Semantic Segmentation Based on Static Structured Pruning Figure 1
2026-08-06cs.CV

StaticSegFormer: An Efficient High-Performance Semantic Segmentation Based on Static Structured Pruning

Timo Bartels, Danish Nazir, Jan Piewek, Thorsten Bagdonat, Tim Fingscheidt

2026-08-06视觉感知

这篇论文针对语义分割中 FLOPs 与真实 GPU 帧率脱节的问题,指出动态结构化剪枝虽可降计算量,却因运行时矩阵组装带来额外开销。作者在 SegFormer 注意力层中静态剪除完整 attention heads,并保留剩余头维度形成瓶颈,以更直接提升推理效率。在 Cityscapes 和 ADE20K 上,该方法在 mIoU 基本不降的同时降低 FLOPs,Cityscapes 帧率最高相对提升 34%,尤其适合小编码器和大分辨率输入。

Segmentation Pre-training for Label-Efficient Lumbar Spine Degeneration Grading Figure 1
2026-08-06cs.CV

Segmentation Pre-training for Label-Efficient Lumbar Spine Degeneration Grading

Monzon Maria, Zisserman Andrew, Jutzeler Catherine R., Jamaludin Amir

2026-08-06视觉感知

腰椎退变自动分级依赖大量专家序位标注,成本高且难扩展;本文的关键洞察是,椎体、椎间盘和椎管分割伪标签能提供与分级相关的几何先验。作者先用自动分割掩码预训练3D ResNet,再用少量分级标签微调多任务头;在约2000例、多中心11类病变上,分割Dice约0.94,所有标注比例下ROC-AUC均优于从头训练,20%标签即可接近全监督表现,低患病率或强空间形态病变增益最大。

On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing Figure 1
2026-08-06cs.CV

On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing

Simon Lösche, Barış Büyüktaş, Mathis Adler, Angelos Zavras, Ioannis Papoutsis, Begüm Demir

BIFOLD - Berlin Institute for the Foundations of Learning and Data, 10587 Berlin, Germany, Orion Lab, School of Rural, Surveying and, Geoinformatics Engineering, National Technical University of Athens, 15772, Institute of Astronomy, Astrophysics, Space Applications, Department of Informatics and Telematics, Harokopio University

2026-08-06视觉语言

遥感联邦学习面临数据不能集中、客户端非 IID 导致泛化下降的问题,而 VLM 虽有迁移能力却带来通信和算力压力。论文系统比较全量微调、单编码器微调、提示学习与 LoRA 在 CLIP 式联邦遥感分类中的取舍,核心洞察是不存在通用最优策略:全量/视觉侧微调更利于任务内专化,提示学习和 LoRA 更适合受限通信与跨域泛化。实验覆盖 BigEarthNet-S2、EuroSAT、RESISC45 和 ImageNet,并给出按约束选择适配策略的经验准则。

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking Figure 1
2026-08-06cs.CV

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

actions. Multiple AI agents collaboratively transform user intents, OOKING has long relied on human labor, yet human-, centered cooking suffers from two inherent limitations., labor and training costs, frequent turnover, and limited process, Zihan Song and Yueshuo Sun are with the College of Mechanical and, Vehicle Engineering, Hunan University, Changsha 410082, China (e-mails:, Hongwei Huang and Bai Li are with the School of Information and, Electronic Engineering, East China Normal University, Shanghai 200241, Yonglin Tian and Fei-Yue Wang are with the State Key Laboratory for, Management and Control of Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China (e-mails: yonglin.tian, approaches that improve transparency and controllability of

2026-08-06生成模型规划控制

这篇论文针对烹饪机器人在固定脚本下难以个性化、端到端大模型又缺乏可审计控制的问题,提出把用户意图逐级转成标准菜谱、显式流程控制和原子动作代码的多智能体框架,并结合多模态闭环监督、异常恢复与偏好更新。实机实验显示其能完成多种个性化场景并处理异常,但量化增益和对比基线文中未充分说明。

FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening Figure 1
2026-08-06cs.CV

FUSEP: A Multi-Center Benchmark for Diverse Tasks in Early Pregnancy Fetal Ultrasound Screening

Bin Pu, Jiewen Yang, Liwen Wang, Ying Tan, Guannan He, Xingbo Dong, Qika Lin, Jiarong Guo, Lixian Yang, Zuozhu Liu, Shengli Li, Kenli Li

Hunan University, The Hong Kong University of Science and Technology, Anhui University, National University of Singapore, Zhejiang University, Hunan University Changsha Hunan China, The Hong Kong University of Science and Technology HKSAR China, Anhui University Hefei Anhui China, National University of Singapore Singapore Singapore, Zhejiang University Hangzhou Zhejiang China

2026-08-06强化学习数据集/基准

针对早孕胎儿超声缺少公开、多中心、细粒度标注数据而限制自动辅助筛查的问题,FUSEP汇集3家医院CRL与NT两类标准切面4017张图像,并由专家标注14类解剖结构、45820个框,形成面向多目标检测和域适应的基准。论文报告全监督、半监督、UDA及源无关UDA基线,用于衡量跨设备、医院和扫描差异下的结构检测能力;具体最优增益来源仍可能主要来自数据规模与标注覆盖。

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models Figure 1
2026-08-06cs.RO

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

Houze Xu, Jizhong Li, Ziyi Ye

Fudan University

2026-08-06视觉语言视觉感知规划控制

这篇论文针对长程机器人任务中 VLA 只看当前观测易丢失阶段历史、跳步或重复执行的问题,提出把任务进展维护为可递归更新的显式语言记忆,并将高层 VLM 的语义状态跟踪与低层 VLA 的连续控制解耦。实验覆盖仿真和真实机器人,显示该记忆机制能提升阶段成功率与鲁棒性、减少阶段混淆,但接触精度等低层控制瓶颈仍未被语言记忆解决。

Splat-Based Metal Artifact Reduction in Cone-Beam CT via Compact Attenuation Modeling Figure 1
2026-08-06cs.CV

Splat-Based Metal Artifact Reduction in Cone-Beam CT via Compact Attenuation Modeling

Kiseok Choi, Jaemin Cho, Inchul Kim, Min H. Kim

2026-08-06视觉感知

该文针对锥束 CT 中金属植入物引发的束硬化、条纹和阴影伪影,指出传统单能量重建与真实多色 X 射线衰减不匹配。方法将多色前向投影嵌入高斯 splatting,并用低维材料参数刻画能量相关衰减,无需金属掩膜即可联合优化结构与材料。实验显示其在模拟和真实 CBCT 上比 FDK、LIMAR、Polyner 等更快收敛,并更好抑制伪影、保留细节。

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs Figure 1
2026-08-06cs.CV

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University, Zhongguancun Academy, Stevens Institute of Technology

2026-08-06视觉语言

论文关注多模态大模型空间推理中间步骤与图像不一致、错误沿 CoT 传播的问题,这对机器人等真实环境决策尤其关键。核心做法不是训练新模型,而是构建空间证据图追踪原子空间判断,并用 SERA 评估检测、定位和几何证据可靠性,定位最早可信矛盾后再引导模型局部修正。15 个模型-数据集设置下平均准确率 68.94%,较基线提升 8.55 个百分点。

Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstruction Figure 1
2026-08-06cs.CV

Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstruction

Kiseok Choi, Hyeongjun Cho, Inchul Kim, Min H. Kim

2026-08-06三维

本文针对稀疏视角锥束 CT 中 Gaussian splatting 在真实采集下容易出现条纹、针状伪影的问题,指出主因并非视角稀疏本身,而是采集几何尤其相机位姿误差被可微投影放大。作者分析位姿扰动传播机制,并提出联合优化体表示与几何参数的自校准框架;实验显示其在真实和受控扰动数据上较 FDK、NeAT、Thies 等方法减少伪影、保留细节,但极端 25 视角下仍需额外正则化。

Simile Understanding in Text-to-Image Models: An Evaluation Framework Figure 1
2026-08-06cs.CV

Simile Understanding in Text-to-Image Models: An Evaluation Framework

Luecheng Wang, Shintaro Ozaki, Hidetaka Kamigaito, Katsuhiko Hayashi, Jingun Kwon, Manabu Okumura, Taro Watanabe

The University of Tokyo, Nara Institute of Science and Technology, Chungnam National University, Institute of Science Tokyo, The University of Tokyo Tokyo Japan, Nara Institute of Science and Technology Nara Japan, Chungnam National University Daejeon Republic of Korea, Institute of Science Tokyo Tokyo Japan

2026-08-06视觉感知数据集/基准

这篇论文关注文生图模型处理明喻提示时常把“喻体”画成真实物体的失效模式。作者构建了以 YOLO 可检测类别为喻体的受控明喻基准,用目标检测量化 literalization bias,并结合 Diffusion Lens 分析文本编码层。实验显示多种架构均存在稳定字面化倾向,随机重生成和层替换只能在部分模型上缓解,且不等同于真正理解明喻。

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors Figure 1
2026-08-06cs.CV

Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors

Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim

2026-08-06视觉感知

这篇论文针对稀疏 dToF 传感器虽有准确尺度但分辨率低、噪声和采样形态多变,难以直接服务机器人/3D 感知的问题,提出 RGB 与稀疏深度分支编码、用 masked joint attention 让深度引导图像特征,并配合逼真的 dToF 仿真训练。模型仅用合成数据训练,在 6 个数据集和 3 类真实设备上零样本优于现有深度补全方法,同时推理更轻量。

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning Figure 1
2026-08-06cs.AI

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

2026-08-06视觉语言

这篇论文关注多模态模型在截图、文档中“读到问题”后是否真能把它当作指令使用。作者提出 VTS,将同一问题从文本提示移到图像像素中,以隔离语义通道差异,并进一步用 prompt-region grounding 对齐问题区域与文本语义。实验显示六个模型在四个基准上全部掉点,平均下降 17.8 分;该训练方法将 VTS 准确率从 58.0 提升到 66.3,且基本保留原始文本接口表现。

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations Figure 1
2026-08-06cs.RO

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations

Martin Köppel, Tobias Cronauer, Zekiye Ilknur-Öz, Sebastian Dubiel, Patrick Naumann, Philipp Neumaier

2026-08-06视觉感知

面向GoA3/GoA4自动列车运行,论文关注多传感器标注数据在版本、溯源和合规管理上的工程瓶颈。其核心做法是把railLabel标注、MARV传感器元数据与GitLab CI/CD结合,用临时SQLite构建关系后生成静态React目录,避免运行时后端和文档漂移。结果显示页面加载约138–414 ms、构建约20–49分钟,并在架构对比中降低了相对单体数据目录的运维负担。

Multi-View Face and Gesture Animation with Dynamic Gaussians Figure 1
2026-08-06cs.CV

Multi-View Face and Gesture Animation with Dynamic Gaussians

Alireza Javanmardi, Vippin Kumar Jeetmal, Christen Millerdurai, Alain Pagani, Didier Stricker

German Research Center for Artificial Intelligence (DFKI), 2 RPTU

2026-08-06三维

这篇论文针对上半身数字人动画中“脸部细节”和“手势准确性”难以同时保持的问题,提出 MVFGA:将人脸、双手分别参数化拟合后与上半身网格融合,再在网格上绑定动态 3D Gaussians 进行多视角一致渲染。作者还发布含 15 人、17 相机的 MVFGA-MoCap 数据集;实验显示其在面部表情、手部动作和新视角真实感上优于现有上半身动画基线。

YOLOv14:Unified Cross-Domain Real-Time Object Detectionwith Adaptive Multi-View Representation Figure 1
2026-08-06cs.CV

YOLOv14:Unified Cross-Domain Real-Time Object Detectionwith Adaptive Multi-View Representation

Jinling Jia, Jian Lu, Jone Yawl, Chenbin Zhang

Nanjing University of Posts and Telecommunications

2026-08-06视觉感知

这篇论文针对实时检测器在鱼眼畸变、全景、航拍视角和游戏渲染人物等非理想输入下性能下降的问题,提出 YOLOv14,将可变形区域注意力、Game2Real 域适配、多视角条件化、自适应增强与动态特征金字塔路由整合到统一框架。文中报告 COCO val2017 达到 49.1 mAP、T4 上 2.91 ms,并在鱼眼、全景、无人机和游戏人物基准上分别提升 4.1、6.6、6.4 和 26.1 mAP,但具体增益拆分仍需看消融支撑。

A Multi-Sensor Dataset for Monitoring the Operational Environment of Rail Vehicles Figure 1
2026-08-06cs.CV

A Multi-Sensor Dataset for Monitoring the Operational Environment of Rail Vehicles

Claudio Diotallevi, Rodrigo Gudiño, Zaharia Pachalieva, Philipp Neumaier, Patrick Naumann, Erik Bochinski, Volker Eiselein, Martin Köppel

2026-08-06数据集/基准

面向GoA2到GoA4铁路自动化对可靠环境感知与大规模标注数据的需求,论文发布了由DB InfraGO与understandAI构建的铁路多传感器数据集,覆盖两类车辆、RGB/IR相机、LiDAR、雷达及定位等传感器,并采用3D标注投影、多级质检流程。数据集包含88.2分钟传感器数据和超过700万条、21类对象标注,可按申请获取;文中主要结果是数据规模与生产流程展示,未给出模型性能增益评测。

Design Choices That Matter: A Functional ANOVA Analysis for Remote Sensing Multi-Label Classification Figure 1
2026-08-06cs.LG

Design Choices That Matter: A Functional ANOVA Analysis for Remote Sensing Multi-Label Classification

Maryam Gholami Shiri, Eva Tuba, Sašo Džeroski, Tome Eftimov, Ana Nikolikj

Department of Knowledge Technologies, Jožef Stefan Institute, Jožef Stefan International Postgraduate School, Computer Systems Department, Trinity University, Singidunum University

2026-08-06视觉感知

这篇论文针对遥感多标签分类基准常停留在模型排名、难以迁移到新数据集的问题,用 fANOVA 分解架构、微调、学习策略和初始化等设计选择对性能波动的贡献,并把重要性谱作为数据集表征。结果显示,不同数据规模与标签复杂度下主导因素会切换:大规模数据更受微调和架构影响,小数据更依赖初始化,中等场景则由架构与学习策略交互主导。

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models Figure 1
2026-08-06cs.CV

UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models

Haiyang Zhou, Wangbo Yu, Chaoran Feng, Xunyu Zhou, Yonghong Tian, Li Yuan

2026-08-06视觉感知生成模型强化学习

本文针对单目图像/视频在大视差新视角合成中相机控制不准、遮挡导致几何失真的问题,提出 UniWorld-View:用遮挡感知点云渲染生成显式3D条件,并以双流视频扩散模型融合源输入与几何先验。其关键洞察是先处理可见性歧义,再让生成模型补全内容。WorldScore 与零样本 NVS 实验显示其在可控性、几何一致性和视觉质量上优于已有方法。

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO Figure 1
2026-08-06cs.CV

Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO

Xuzheng Yang, Jun Ling, Tao Huang, Caiyan Qin, Peng Wang

2026-08-06视觉感知

这篇论文关注广义指代表达理解中“目标不存在”时仍幻觉框选的问题,动机来自机器人和具身场景对可靠拒答的需求。核心做法是用 RC-GRPO 在负样本 rollout 中校准 None 输出,同时惩罚正样本过度拒答,并加入拒答理由强化。三组 GREC 基准显示其在保持正样本定位能力的同时提升了不存在目标的拒绝可靠性。

MOAT: Model-Agnostic Randomized Transformations for preventing Efficiency Degradation Attacks on ViTs Figure 1
2026-08-06cs.CR

MOAT: Model-Agnostic Randomized Transformations for preventing Efficiency Degradation Attacks on ViTs

Anadi Goyal, Nandish Chattopadhyay, Chandan Karfa, Anupam Chattopadhyay, Norrathep Rattanavipanon

2026-08-06视觉感知

本文关注自适应 ViT 的令牌剪枝虽能降算力,却会被 DeSparsify、Slowformer 等效率退化攻击诱导保留过多 token,从而抬高推理 FLOPs、延迟和能耗。MOAT 的核心思路是不改模型和剪枝机制,仅在输入端串联随机缩放、中值滤波与 JPEG 压缩来削弱对抗噪声,使 token 重要性更接近干净图像。实验称其在所评估 ViT 上将攻击下 GFLOPs 退化限制在距未攻击模型 3.4% 以内。

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding Figure 1
2026-08-06cs.CV

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang

Y. Feng, A. Nguyen, and B. Huang are with the Department of, Computer Science, University of Liverpool, Liverpool L69 3BX, U.K., University of Oxford, Oxford OX1 3PJ, U.K., Department of Surgery and Cancer, Imperial College London, London SW7 2AZ

2026-08-06视觉感知生成模型

针对手术视频中生成式模型推理慢、检索式模型难处理复杂时序与意图问题,SurgNarrator将理解任务转化为面向手术概念词表的生成式检索,并结合Qwen3-VL-Embedding-8B、时序感知对比学习和按术式分层检索。在12个零样本基准上,其识别与推理表现优于既有方法,输出阶段延迟较生成式基线降低两个数量级以上。

Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors Figure 1
2026-08-06cs.CV

Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors

Yueqiang Zhang, Liang Deng, Yi Zhang, Baoqiong Wang, Wenjun Chen, Shuixin Pan, Yulan Guo, Qifeng Yu

2026-08-06三维

针对机器人平台微小位姿变化中相机外参误差容易淹没真实运动的问题,论文将6-DOF估计改写为相邻帧投影差分约束,直接由图像位移和已知3D点求平台运动,并证明平移外参误差一阶抵消、旋转误差有界。实验显示其在单/多相机微动估计中比PnP类方法更准且更快,5点0.5像素噪声下达到毫米级平移误差和亚毫秒运行时间。

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight Figure 1
2026-08-06cs.CV

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Bailin Li, Yan Wang

2026-08-06机器人强化学习

移动操作不能简单视为导航加桌面操作,因为移动视角、多模态路径和早期误差会放大长期因果依赖。MobileWAM将视频扩散式世界动作模型接入全身控制,用分层联合注意力融合视觉先验与动作专家,并以Chain-of-Foresight训练时预测未来潜变量、Mobile MoE区分移动与操作动态。结果在ManiSkill-HAB以RGB单阶段训练达到73.0%成功率,并迁移到ARX Lift2真实任务,长时程优势更明显且推理快于生成后执行式WAM。

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion Figure 1
2026-08-06cs.CV

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

Hainan University, Guangdong Ocean University, Hainan University Haikou China, Guangdong Ocean University Zhanjiang China

2026-08-06视觉语言生成模型

论文针对血管、道路、裂缝等细长曲线结构在扩散生成中易断裂、难对齐且标注稀缺的问题,提出 CSGen:用24K多域多模态数据训练统一模型,并通过分层渐进控制分离拓扑线索与视觉上下文,再用稀疏感知重加权强化细小结构。实验显示其结构准确性、视觉真实感和下游分割增益优于SD3.5 LoRA/ControlNet等基线。

Overcoming Statistical Bias in Action-Controllable World Models Figure 1
2026-08-06cs.CV

Overcoming Statistical Bias in Action-Controllable World Models

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

2026-08-06强化学习规划控制

这篇论文针对动作条件世界模型中“视频预测准但不听动作”的统计偏置问题:模型可能依赖视觉惯性和常见运动模式,而非动作因果效应。作者提出 CoCo,用多步反事实一致性约束正向、逆动作和零动作轨迹,并用镜像场景与变换动作约束空间等变性;同时给出 ARC、DE 和 Mini-SSMB 评测。结果显示其降低零动作漂移,在 Mini-SSMB 上提升动作响应一致性,并在 VP2 视觉规划中达到 73.1% 平均成功率。

DisMix: Order-Aware Mixup for Medical Imaging via Disentangling Ordinal and Non-Ordinal Features Figure 1
2026-08-06cs.CV

DisMix: Order-Aware Mixup for Medical Imaging via Disentangling Ordinal and Non-Ordinal Features

Dileepa Pitawela, Gustavo Carneiro, Hsiang-Ting Chen

2026-08-06视觉感知

本文针对医学影像分级中常规 mixup 会把病变严重度线索与成像风格、背景等非序特征混在一起、破坏等级结构的问题,提出 DisMix:用双码本 VQ-VAE 解耦序特征和非序特征,并在潜空间分别执行保序插值与外观扰动。四个医学数据集、六类序分类器和六种 mixup 基线上的实验显示,DisMix 在 24 个组合中多数取得最佳准确率或 MAE,并在数据稀缺和标注分歧下仍有效。

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI Figure 1
2026-08-06cs.CV

YOLO-PVC: 2D-to-3D Consolidation of Slice-wise Detections for Volumetric Liver Tumor Localization in MRI

Talha Waqas, Mounir Lahlouh, Kawther Taibouni, Mahnoor Waqas, Salar Ahmed, Sébastien Mulé, Yasmina Leroul-Chenoune

2026-08-06视觉感知三维

这篇论文针对逐片2D检测用于肝脏MRI三维肿瘤定位时易出现深度方向断裂、漏检和离群切片的问题,提出YOLO-PVC:先用连续性约束选择稳定切片段,再用百分位统计融合框坐标,并以轻量MLP校准轴向范围。在三类肝肿瘤MRI上,启发式PVC的3D IoU达0.665,Hybrid MLP-PVC提升到0.710,主要增益来自更稳定的深度估计而非更重的3D模型。

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition Figure 1
2026-08-06cs.CV

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

Zehao Bao, Shujun Guo, Bruce X.B. Yu

The University of Hong Kong, Zhejiang University

2026-08-06视觉语言视觉感知生成模型

这篇论文针对零样本骨架动作识别中“动作骨架相似但物体或场景不同”导致的歧义,指出传统 RGB/骨架独立打分再融合难以在无目标域校准时选择可靠模态。其核心做法是在扩散式 classify-by-generation 框架中引入非扩散 RGB 条件 token,让 RGB 与文本共同作为稳定视觉锚点指导骨架去噪评分。实验显示 TDSM-MM 在 NTU-60/120 四个划分中三个取得最佳归纳准确率,并在 NTU-120 96/24 上以 71.3% 超过既有转导方法 69.1%。

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation Figure 1
2026-08-06cs.CV

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

2026-08-06三维

这篇论文针对单视角姿态引导人体生成在大视角变化下容易丢失身份、纹理错位和凭空补全的问题,提出 DAC-Pose,将任务拆成语义推理 PSR 与视角差异感知编码 DAVE 两个协作代理:前者推断不可见区域的细粒度外观,后者显式建模姿态导致的空间错位。文中在 DeepFashion 和 Market-1501 上报告优于现有方法,尤其改善剧烈视角变化下的纹理对齐和身份一致性。

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding Figure 1
2026-08-06cs.CV

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

Jiuhe Qu, Yingping Liang, Ying Fu

Beijing Institute of Technology, Beijing Institute of Technology Beijing China

2026-08-06三维

HiSC针对多视角3D VLM中重复观测和大面积无信息区域导致的视觉token冗余与高推理成本,核心思路是把压缩从独立token选择提升为基于几何与语义线索的空间簇处理:先用空间图合并跨视角和物理一致区域,再在LLM内部按簇分层剪枝以兼顾物体覆盖和细节保留。实验称其在多种3D推理基准上可减少超过90% token且性能损失较小。

TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition Figure 1
2026-08-06cs.CV

TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition

Fang Li, Shihao Zou, Weixin Si, Yang Gao, Shuai Li, Aimin Hao

State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology

2026-08-06视觉感知

本文针对手术视频中器械-动作-目标三元组既受帧内解剖/流程约束、又需跨帧保持一致的问题,提出时序-关系协同推理框架:用多尺度空间先验和MS-CAMRE建模标签节点与边关系,再以BTRFA融合时序记忆和关系注意力,并引入TCER衡量组合一致性。在CholecT45和ProstaTD上,AP_IVT分别提升5.1%和7.8%,TCER相对降低超过36%和25%。

COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation Figure 1
2026-08-06cs.CV

COSMO: Consensus-Driven Shift Modulation for Source-Free Domain Adaptation

Bo Li, Junjie Peng, Xiaohua Xie, Jianhuang Lai

School of Computer Science and Engineering, Sun Yat-sen University

2026-08-06视觉感知

论文关注源数据不可用的域自适应中,源模型自监督易放大偏差,而 VLM 指导又可能在冲突样本上抹掉本来正确的源模型证据。COSMO 将问题改写为逐样本可靠性分配,用熵加权共识锚点和随训练调制的动态共识共同监督两分支。四个基准上在相同 VLM 骨干下取得 SOTA,消融显示其更能平衡保留源证据与吸收 VLM 语义。

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering Figure 1
2026-08-06cs.CV

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

2026-08-06视觉感知

论文针对现有第一视角视频基准偏重日常场景、难以检验模型在手术、工业装配、极限运动和动物视角等专业域中的泛化能力,提出 EgoCross 挑战与封闭式跨域视频问答评测,设置受限源与开源两条赛道。结果显示,领域感知推理、时序 grounding、检索增强和参数高效微调有效,但跨专业域鲁棒泛化仍明显困难。

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding Figure 1
2026-08-06cs.CV

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

Zhejiang University, Beihang University

2026-08-06视觉感知

长视频问答中相关证据稀疏且不同视频分布的模态密度、结构和证据模式差异大,固定视频代理容易冗余或失配。MetaVideoAgent的核心是按目标分布自动演化代理:先用稀疏采样画像指导初始设计,再以Gold Path诊断失败并生成最小验证任务,约束式修改责任模块。VA-EvoBench上四轮演化将宏平均准确率从38.44%提升到51.47%,较最佳固定代理高6.39个百分点且单题token和帧成本最低。

ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields Figure 1
2026-08-06cs.CV

ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields

Seunghyeon Song, Joo Chan Lee, Chanung Park, Jun Young Jeong, Minseo Lee, Eunbyung Park, Jong Hwan Ko

Sungkyunkwan University, Electronics and Telecommunications Research Institute, Yonsei University, Sungkyunkwan University Suwon Gyeonggi-do, Electronics and Telecommunications Research Institute Daejeon Republic of Korea, Yonsei University Seoul Republic of Korea

2026-08-06三维

这篇论文针对动态 4D Gaussian Splatting 中“运动表达能力”和“存储效率”难以兼顾的问题,指出现有锚点式方法为每个锚点分配固定高斯数量和特征维度,容易在简单区域浪费容量、在快速运动或细节区域又不够用。ACA-GS 通过按局部时空复杂度自适应调整每个锚点的高斯数量,并用可学习特征掩码分配通道容量,在 MPEG、Panoptic Sports 和 N3DV 上保持相近画质的同时降低存储,MPEG 上相对已有锚点方法最高约提升 1.5 倍压缩率。

PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning Figure 1
2026-08-06cs.CV

PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning

Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang

2026-08-06视觉感知强化学习

这篇论文针对 VLM 难以从视频可靠理解碰撞、运动演化和反事实干预的问题,提出 PhysMind:先把视频重建为可复用的可执行物理世界,再通过物体分割、网格重建、6D 位姿跟踪和连续时间系统辨识拟合隐含物理参数,按问题执行查看、延续或编辑。实验显示其在 CLEVRER 相比直接 CoT 提升 38.23 个点,在 Physion++ 提升 8.08 个点,反事实任务超过最强 VLM 基线 19.25 个点。

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching Figure 1
2026-08-06cs.CV

Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching

Runwei Guan, Di Tian, Ningwei Ouyang, Ruixiao Zhang, Shaofeng Liang, Haocheng Zhao, Lianqing Zheng, Xiaokai Bai, Guotao Wang, Daizong Liu, Henghui Ding, Hui Xiong

2026-08-06视觉语言三维

本文针对自动驾驶3D视觉定位长期依赖室内RGB-D/点云或室外单目图像、难以表达距离、几何和运动等物理线索的问题,提出含相机、LiDAR和4D雷达的Talk2Sensors数据集,并设计TSFormer按语言提示动态路由外观、结构与运动信息,避免稠密视觉特征淹没稀疏雷达线索。实验显示其在Talk2Sensors上较最强基线提升8.05 mAP,并可迁移到Mono3DRefer取得53.05% Acc@0.5。

OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes Figure 1
2026-08-06cs.CV

OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes

Xia Yan, He Wu, Yanghui Xu, Zizhao Wu, Jiazhou Chen

2026-08-06三维

针对现有语言高斯泼溅多面向室内、小尺度场景,在无人机户外场景中易受遮挡、远距离视角和跨视图不一致影响的问题,OutLangSplat用区域级2D语义与3D结构双分支对齐融合,并按像素贡献和视图语义一致性进行免训练聚合,提升语言特征的空间完整性与可靠性;论文还标注四个真实UAV数据集,实验显示其在开放词汇语义分割和实例定位上优于现有方法。

ColorFD: A Finite-Difference Guided Black-Box Physical Adversarial Attack for Remote Sensing Object Detection Figure 1
2026-08-06cs.CV

ColorFD: A Finite-Difference Guided Black-Box Physical Adversarial Attack for Remote Sensing Object Detection

Tiannuo Guo, Guhang Qiu, Yuzhen Xie, Rui Feng, Ligang Li, Deliang Xiang

2026-08-06视觉感知

面向遥感目标检测中更贴近真实部署的黑盒物理攻击问题,ColorFD将扰动限制为多个可打印纯色小方块,用差分进化联合优化位置与颜色,并通过目标级适应度、有限差分关键区域定位和类别共性区域先验缩小搜索空间。实验显示其在YOLOv3u、YOLOv5u和Faster R-CNN上优于测试的黑盒补丁基线,接近部分白盒方法,且实物拍摄验证了从数字域到真实成像的可迁移性。

VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis Figure 1
2026-08-06cs.CV

VoxStruct3D: Structure-Leading Flow Matching for Voxel-Space 3D MRI Synthesis

Fang Li, Yang Gao, Shihao Zou, Weixin Si, Hongyu Wu, Qing Xia, Shuai Li, Aimin Hao

2026-08-06生成模型三维

VoxStruct3D针对3D MRI生成中潜空间自编码器易损失细节、直接体素建模又易出现块状伪影和解剖不一致的问题,提出体素空间flow matching框架:用VVG的重叠体素解码与跳连缓解patch边界伪影,并以SFIF引入由3DINO提取的结构先行轨迹,通过PA-RoPE和非对称注意力单向指导图像生成。文中在病理与健康T1脑MRI上报告其在分布对齐、多样性和感知质量上整体最优,消融显示VVG与SFIF分别贡献细节连续性和结构一致性。

Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling Figure 1
2026-08-06cs.CL

Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

Han Chen, Ming Li, Hong Jiao, Tianyi Zhou

2026-08-06视觉感知

这篇论文面向新题缺少学生作答数据时的难度冷启动预测,关注数学题中图表、几何关系等视觉证据应如何进入模型。作者系统比较纯文本、视觉文本化和保留原图的图像原生建模,并对LLM/VLM做监督回归适配;结果显示两类视觉接口均优于纯文本,最佳RMSE约从0.517降至0.506/0.497,但领先方法区分不稳,图像增益来源仍未完全隔离。

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation Figure 1
2026-08-06cs.CV

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

2026-08-06视觉语言视觉感知

这篇论文针对现有可供性 grounding 多停留在单物体、单步骤的问题,提出把桌面任务中的下一步操作拆成直接对象、工具和目标位置三类角色,并要求模型同时推断剩余计划与分割对应功能部位。其核心贡献是 EgoAfford 基准和 3B EgoLens 参考模型,数据含约 1.55 万张人工核验合成图及少量真实测试图。实验显示,现有 referring-segmentation MLLM 和 VLM-SAM2 流水线在下一步推理与角色条件部位定位上仍有明显短板,EgoLens 在合成与真实观测上给出较强基线,但增益可能部分来自 in-domain data。

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory Figure 1
2026-08-06cs.CV

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

School of Computer Science, Peking University, Key Lab of High Confidence Software Technologies, Peking University, Institute of Information Engineering, Chinese Academy of Sciences, Department of Computer Science and Technology, Tsinghua University

2026-08-06视觉感知

FocusMem面向GUI智能体长程交互中记忆压缩的失真、固定读出和错误检索干扰问题,将潜在记忆拆成内容保留、状态条件读出与信任门控三部分,并在冻结策略下训练。五个GUI基准上相较无记忆、原始轨迹回放和既有潜在记忆方法取得一致成功率提升,诊断实验表明增益主要来自更可恢复的内容、更贴合当前决策的读出和对无关证据的抑制。

Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution Figure 1
2026-08-06cs.CV

Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution

Axi Niu, Knag Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

2026-08-06视觉感知

低分辨率场景文字超分常依赖外部 OCR 或分离的图像/文本先验,容易把识别错误传入重建且推理链路很重。DualTSR 的核心做法是把连续图像潜变量的条件流匹配与离散文本 token 的吸收态扩散耦合在同一多模态 Transformer 中,使文字假设和图像恢复同步互相修正。实验称其在 CTR-TSR 的 2×、4× 设置及 RealCE 子集上取得多项最佳指标,相比 DiffTSR 在 4× 下 ACC 提升 12.78 个百分点,参数和延迟也显著降低。

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding Figure 1
2026-08-06cs.CV

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang

2026-08-06三维

这篇论文针对切片式3D医学MLLM视觉token随切片数膨胀、相邻切片证据高度重复而性能收益递减的问题,提出无需训练的CARVE,在深度窗口内按跨切片证据做各向异性预算分配,用代表切片锚点保留空间结构,并从全体切片检索局部变化证据后折叠冗余token。实验显示在约保留20% token时,AMOS-MM报告生成优于所有压缩基线,VQA平均保持98.1%全token性能。

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction Figure 1
2026-08-06cs.CV

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

2026-08-06视觉语言视觉感知强化学习

论文关注VLM在跨市场广告偏好预测中被密集视觉和商品信息主导、忽视国家等稀疏关键变量的CVE问题。GeoReward通过市场检索增强、国家语义调制视觉特征和选择性敏感损失,强化地域上下文在奖励建模中的权重;在MACP数据集上较基线准确率提升超过15.75%,并可作为RL奖励引导生成更符合区域偏好的广告背景。

Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs Figure 1
2026-08-06cs.CV

Privacy-Preserving Action Recognition: Taxonomy, Methods, and Privacy-Utility Trade-offs

Sareer Ul Amin, Muhammad Ayaz, Muhammad Munsif, Sanghyun Seo

2026-08-06视觉感知

这篇综述关注视频动作识别在安防、医疗和智能环境中泄露身份与外观信息的问题,将隐私保护动作识别整理为输入、表示、模型、输出空间与五类机制的二维 taxonomy,并强调评测标准缺失是核心瓶颈。文中基于 2018–2026 年 32 篇论文比较隐私-效用权衡:骨架方法约 85% 准确率但丢失外观信息,对抗方法约 80% 效用且中等隐私,差分隐私常低于 70%,跨数据集、 adaptive attacker 与边缘实时部署验证仍不足。

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models Figure 1
2026-08-06cs.CV

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

State Key Laboratory of Information Engineering in Surveying Mapping and Remote Sensing, Wuhan University, China, Electronic Information School, Wuhan University, China

2026-08-06视觉语言视觉感知

DIVE针对VLM视觉token远多于文本、推理成本高的问题,指出一次性Top-k打分会忽略已保留证据对剩余token价值的影响。它以免训练的“选择—更新—重评估”机制,用提示条件残差动态挑选互补视觉证据。实验显示在多种VLM、图像与视频任务和token预算下优于静态剪枝,视觉token减少88.9%时仍保留未压缩模型98.2%的平均性能。

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles Figure 1
2026-08-06cs.CV

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

2026-08-06视觉感知

本文关注 VLM 推理中视觉 token 过长带来的计算瓶颈,追问现有剪枝到底删掉了哪些功能角色的 token。作者把 EmbedLens 的 alive、sink、dead 角色分析引入 FastV、DART、DivPrune,并改进为基于质心的角色分配与角色保护剪枝。结果显示,各方法存在不同角色偏置,但“多删非 alive”并不必然带来更好性能;保护 dead 等非语义 token 有时还能维持或提升表现,说明其结构性注意交互仍会影响剪枝后的模型行为。

REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding Figure 1
2026-08-06cs.CV

REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding

Boyang Li, Chenhui Gou, Jianfei Cai

2026-08-06视觉语言视觉感知

REZE针对零样本视频时序定位中直接让VLM生成时间戳不稳定的问题,将任务拆成短片段级查询识别与外部确定性时序聚合:先得到查询置信度曲线,再按任务输出单区间、多区间或高光分数。该训练-free框架可用于视频和图像VLM,在Charades-STA和QVHighlights上全面优于直接时间戳生成,并在QVHighlights训练-free moment retrieval与highlight detection上达到新的最好结果。

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment Figure 1
2026-08-06cs.CV

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia

2026-08-06视觉语言视觉感知

EndoVLM针对胃肠内镜中“一个报告对应大量无序冗余图像”、难以做帧级图文对齐的问题,利用348K病例构建视觉语言预训练。其关键在于用解剖描述驱动稀疏池化筛选语义帧,并以解剖/病理软标签逐步对齐,再对高语义帧做MAE重建。实验显示其在风险分层、息肉分割、解剖识别和视频诊断等任务上优于现有基础模型,并具备较强零样本泛化。

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models Figure 1
2026-08-06cs.CV

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang

2026-08-06视觉语言视觉感知

这篇论文针对 MoE 视觉语言模型部署时专家池存储开销大、现有训练-free 合并又容易被大量图像上下文 token 的全局路由统计主导的问题,提出按图像上下文、问题、答案生成阶段刻画专家角色的 RoleMerge。其核心是用阶段归一化路由画像和专家-阶段信息损失判断可合并性,并保留答案解码专家差异;在三类模型和多项基准上,相同专家保留率下宏平均性能优于对比方法,最高相对提升 9.6%。

TwinIR: Coordinated Invisible Dual-Point Attacks on Online HD Map Construction Figure 1
2026-08-06cs.CV

TwinIR: Coordinated Invisible Dual-Point Attacks on Online HD Map Construction

Haibo Hu, Jianghuai Deng, Chen Tang, Yang Lou, Qian Xu, Jianping Wang

City University of Hong Kong

2026-08-06视觉感知

本文针对在线高精地图构建中的物理攻击失效问题,指出单点扰动后邻近边界会通过“跨边界补偿”帮助模型恢复原道路几何。TwinIR以至多两个近红外攻击点协同遮蔽目标边界与补偿边界,并约束可见光可察觉性;在nuScenes和实车测试中,相比干净输入显著降低mAP,并提高不可达目标与不安全规划轨迹比例。

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning Figure 1
2026-08-06cs.CV

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Pengcheng Pan, Xinfang Zhang

2026-08-06视觉语言

这篇论文针对多模态模型虽能裁剪/缩放却缺少“该看哪里”的任务条件策略,提出 Q-CueGraph:用 OCR/版面图或查询条件视觉节点生成受预算约束的坐标级证据窗口,并可用冻结读者的答题正确性做效用排序。在冻结 Qwen2.5-VL-7B 上,V*Bench 仅用 19% 图像面积将准确率从 0.696 提升到 0.833,InfographicVQA 约半幅面积达到全图 ANLS 的 92%。

When does training on downscaled images yield the same gradients? Figure 1
2026-08-06cs.CV

When does training on downscaled images yield the same gradients?

Seunghyun Ji

2026-08-06视觉感知优化算法

本文关注扩散 Transformer 训练中能否用降采样图像替代原分辨率步骤,以降低随分辨率超线性增长的成本。核心洞察是梯度差异不仅由高噪声下的频谱损失决定,还包含与目标 token 数相关、噪声无法消除的计算图底噪。作者用去偏梯度探针验证该分解,并据此只在安全噪声窗口降采样训练 LoRA,固定步数下训练时间减少 14.6%,权重端点接近原生训练。

Robustness Emerges Early in Training Dynamics, but Is Not Preserved Figure 1
2026-08-06cs.LG

Robustness Emerges Early in Training Dynamics, but Is Not Preserved

Jiangang Yang, Wenhui Shi, Lu Hu, Jing Xing, Jian Liu

2026-08-06强化学习安全鲁棒

针对自然腐蚀下深度网络鲁棒性不足,论文发现浅层在训练早期会自发形成更稳定表示和平坦损失景观,但常规收敛会使这种鲁棒性衰退。作者提出无新增参数的 EPS 与 AWR,通过早停浅层更新或回退浅层权重来保留早期鲁棒先验;实验显示其在多架构、腐蚀基准、迁移、动态适应以及检测和分割任务中提升鲁棒性,但主要聚焦低层视觉腐蚀,非完整分布偏移解法。

Season: Spectrum-Aware Orthogonal Gradient Refinement for Transfer-Based Adversarial Attacks Figure 1
2026-08-06cs.CV

Season: Spectrum-Aware Orthogonal Gradient Refinement for Transfer-Based Adversarial Attacks

Tianyi Wang, Zhenghao Gao, Shengjie Xu

Tongji University, Huazhong University of Science and Technology, Wuhan LightRead Intelligent Technology Co., Ltd.

2026-08-06优化算法

本文针对迁移式对抗攻击在 CNN、ViT 等异构架构间失效的问题,指出根因在于 CNN 偏高频纹理、ViT 偏低频形状的谱偏置不匹配。Season 将梯度拆成结构低频与纹理高频分支,用低显著性引导把高频扰动转向背景,并通过正交投影减少两类更新互相干扰。作为免训练插件,它在 ImageNet 上增强 8 类基线攻击,平均迁移成功率提升 6.6 个百分点,最高提升 16.0 个百分点。

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation Figure 1
2026-08-06cs.CV

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

2026-08-06视觉语言视觉感知

论文针对开放世界图像生成中模型缺乏外部知识、容易生成事实错误的问题,提出 ToolArtist:将推理、搜索工具调用和原生图像生成统一为同一 UMM 策略,并用 SFT 轨迹转换与 RAD-GRPO 联合优化意图和图像质量。实验显示其在 WISE 和 WorldGenBench-Humanities 上优于固定流程或仅部分代理化的开源方法,但部分专有模型仍在若干类别领先。

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing Figure 1
2026-08-06cs.CV

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

2026-08-06视觉语言优化算法数据集/基准

PCB 自动布线仍依赖专家,现有多模态模型是否能处理真实几何、电气与制造约束缺少系统评估。OmniRouting 构建了 1681 个原理图耦合的工业级 PCB 基准,覆盖走线、过孔、层分配、设计规则与工具增强任务。实验显示当前 LMM 在路径规划、DRC 遵守和电气连通保持上普遍失效,但具体量化增益与失败边界文中未充分说明。

UBLLIE: Unified Backlight and Low-Light Image Enhancement Figure 1
2026-08-06cs.CV

UBLLIE: Unified Backlight and Low-Light Image Enhancement

Yasmin Yasin, Muhammad Usman, Ibrahim Radwan, Saeed Anwar

2026-08-06视觉感知

该文针对逆光局部曝光失衡与低照度全局欠曝都会削弱视觉感知和下游识别、跟踪等任务的问题,提出一个无需成对真值的统一增强框架。方法用CLIP学习正负文本提示提供语义监督,并在对称残差U-Net中加入ASPP以捕捉多尺度照明上下文。作者在BAID、Backlit300、LOL和VE-LOL-L等数据集上报告其在保真度、感知质量和泛化上优于多种监督与无监督基线。

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes Figure 1
2026-08-06cs.CV

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu

Centre for AI Research, VinUniversity, National University of Singapore

2026-08-06视觉感知

这篇论文针对现有视频理解只做动作标签预测、已发生片段检索或内部未来建模的问题,提出预测式状态检索 PSR:从视频前缀和时间问题预测物体未来状态,并跨视频/图像检索同语义状态实例。作者构建含人工验证和 oracle 上限的基准,并提出冻结编码器 LFTR,通过语义与视觉空间融合、硬负样本训练提升检索。结果显示真实未来状态一旦给定可高效检索,但各类预测器包括大型多模态模型远低于上限,主要瓶颈是未来状态预测而非感知。

Thinking with Anchors: Grounded and Efficient Document Reasoning Figure 1
2026-08-06cs.CV

Thinking with Anchors: Grounded and Efficient Document Reasoning

Sichen Zhu, Yuchen Zhu, Wenzhuo Xu, Jason Kuen, Wanrong Zhu, Jing Shi, Xuan Shen, Quanyi Wang, Yiwei Wang, Yujun Cai, Bing Shuai, Qin Zhang, Yongxin Chen, Shilong Liu, Molei Tao, Jiuxiang Gu

2026-08-06视觉感知

针对文档理解仍偏重元素定位、缺少可验证中间证据的问题,本文将文本框、实体、多边形、语义标签统一为“视觉锚点”,构建 ADOPD 2026 与 DocCount,用于区域语义标注、统一 grounding 和密集计数评测。结果显示现有检测/分割器和零样本 VLM 在该域存在明显差距,尤其长尾语义与密集计数仍困难;微调标注器和分组 refinement 可部分缓解,但增益来源可能主要来自 data。

Foreseeing the Invisible: Amodal Reconstruction of Leaf Fossil Images Figure 1
2026-08-06cs.CV

Foreseeing the Invisible: Amodal Reconstruction of Leaf Fossil Images

Liuxiang Yue, Ailin Zhang, Ziyue Zhao, Yikun Duan

2026-08-06视觉感知三维

该文面向化石叶片常被岩石遮挡、破损而古植物分析又依赖完整轮廓和叶脉的问题,将其定义为无可见掩码输入的 amodal 重建。核心做法是在 DINOv3+DPT 上全量小学习率微调,并用可见叶片、完整叶片、主脉和细脉四个头让叶脉结构约束形状补全。模型仅用合成数据训练,在验证集达到 95.0% Dice / 90.5% IoU,并可迁移到真实标本;量化后还能离线浏览器运行,但多叶实例和合成到真实域差仍是限制。

muSync-GS: Physics-Synchronized Driving Video Synthesis for Weather and Geometric Road Hazards Figure 1
2026-08-06cs.CV

muSync-GS: Physics-Synchronized Driving Video Synthesis for Weather and Geometric Road Hazards

Yang Chen, Yicheng Zhu, Tao Li, Zilin Bian

Rochester Institute of Technology, City University of Hong Kong

2026-08-06视觉感知

针对恶劣天气、低附着制动和不平路面等高风险驾驶数据难采且现有视频编辑只改外观、不改车辆响应的问题,muSync-GS用共享的降水路面状态和道路高程同时驱动3D Gaussian场景编辑、胎路摩擦、车辆动力学与自车相机轨迹。其在12个CarSim留出案例上取得较低速度、俯仰、滑移率和轮载RMSE,并在重建场景实验中展示了视觉编辑与物理标注的同步性。

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models Figure 1
2026-08-06cs.CV

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Fan Huang, Zhizhong Su, Wei Sui, Xinggang Wang

2026-08-06强化学习安全鲁棒

这篇论文针对世界动作模型在鲁棒性与推理开销之间的矛盾:去掉推理期未来表征虽快但会削弱分布外泛化。作者的核心洞察是未来表征应在推理时保留,并通过一次计算后缓存复用;Faster-WAM用SparseMoT做稀疏视频-动作交互,并用Interval KV-Fusion聚合多层未来信息。实验显示其在LIBERO-Plus上将成功率从Fast-WAM的49.14%提升到73.57%,同时比Joint-WAM快2.21倍,并在LIBERO、RoboTwin 2.0和真实操作中保持较强表现。

CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention Figure 1
2026-08-06cs.CV

CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention

Yan Zhang, Yinan Wu, Haoran Duan, Jungong Han

Department of Automation, Tsinghua University

2026-08-06视觉语言视觉感知

论文针对 VLA 在视觉信息强、语言指令弱时容易被显著物体或熟悉布局“视觉覆盖”的问题,将其建模为视觉混杂导致的因果混淆。CofactVLA 在单次前向中构造去语言的反事实分支,用 OPG 在动作速度场上剔除视觉偏置,并用 CCR 在特征协方差层面压制视觉捷径。实验称其在多种仿真基准达到 SOTA,真实 OOD 场景成功率绝对提升 52.3%,但具体增益对数据和基座模型的依赖仍需进一步拆解。

Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection Figure 1
2026-08-06cs.CV

Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection

Zijian Zhuang, Yixiong Zou, Yuhua Li, Ruixuan Li

2026-08-06视觉感知生成模型

本文针对跨域小样本目标检测中目标域样本少、与通用域差距大的问题,重新审视用扩散模型直接合成训练数据的可行性。核心洞察是将域差距拆成视觉差距和语义差距:用弱噪声保留专家域有效信息,并通过选择性背景修复避开难生成的前景语义。SITN在6个CDFSOD数据集和4个跨域小样本分割数据集上提升性能并达到新的SOTA。

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination Figure 1
2026-08-06cs.CV

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

Lei Peng, Shuai Lv, Wei Hu

University of Science and Technology of China, University of Science and Technology of China School of Artificial Intelligence and Data Science Hefei Anhui China, University of Science and Technology of China State Key Laboratory of Precision and Intelligent Chemistry Hefei Anhui China

2026-08-06视觉语言

本文针对视觉语言模型在多步推理中逐渐依赖语言先验、视觉 grounding 衰减的问题,提出 ReGround:先让模型自诊断何时、何处丢失视觉依据,再重新注入图像进行有针对性的复查。关键洞察是单纯复看图像可能伤害性能,诊断质量才决定收益;在八个基准和两个 VLM 骨干上取得稳定提升,尤其利于视觉密集型多步推理,且无需外部工具或改模型结构。

Image Classification Using CNN-QNN Hybrid Model with Optimized Correlated Features Figure 1
2026-08-06cs.CV

Image Classification Using CNN-QNN Hybrid Model with Optimized Correlated Features

Minseo Seong, Youngwook Kim

Sogang University

2026-08-06视觉感知

针对浅层、少量量子比特的 CNN-QNN 图像分类器难以充分利用纠缠的问题,论文反常规地不做特征去相关,而是在 CNN 输出端加入相关性正则,将特征平均相关推向约 0.5,以匹配 QNN 的纠缠结构。仿真与 CIFAR-10、Fashion-MNIST、雷达微多普勒三类二分类实验显示,中等相关性相比低相关、高相关或不约束设置通常带来更高准确率和更低方差;但实验仍限于模拟器和二分类,真实硬件泛化文中未充分说明。

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models Figure 1
2026-08-06cs.CV

Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Siming Fu, Haojun Xu, Ruizhe He, Zheming Fu, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Linjiang Huang, Si Liu

2026-08-06生成模型强化学习

本文针对文本到图像模型各有所长但架构、VAE 与噪声日程不兼容,难以合并部署的问题,提出 Poly-OPD:用像素桥把学生样本送入异构教师并做按噪声幅值对齐的 on-policy 修正,再以 DINOv2 特征监督;同时用梯度兼容性决定共享注意力 LoRA、隔离 FFN 适配器,并按师生差距分配组合能力训练。实验将 FLUX.1-dev 和 Z-Image 蒸馏到 2.5B SD3.5-Medium,使 GenEval 从 67.3 升至 73.3,DrawBench HPSv3 从 9.34 升至 11.35。

iStructTab: Structured Feature Sequencing for Multimodal Learning of Image and Tabular Data Figure 1
2026-08-06cs.CV

iStructTab: Structured Feature Sequencing for Multimodal Learning of Image and Tabular Data

Al Zadid Sultan Bin Habib, Md Younus Ahamed, Prashnna Gyawali, Gianfranco Doretto, Donald A. Adjeroh

Lane Department of Computer Science and Electrical Engineering, West Virginia University, Morgantown, WV 26506, USA, Scientific Computing and Imaging Institute & Department of Biomedical Informatics, The University of Utah, Salt Lake City, UT 84112, USA

2026-08-06视觉语言视觉感知

图像与表格数据融合常受表格列无序、跨模态结构不匹配影响,导致冗余和泛化下降。iStructTab将特征排列建模为列置换问题,用GEDS基于图相似传播生成结构化顺序,并在带记忆token的顺序感知Transformer中加入排序损失。六个多模态基准上较拼接和多种强基线提升准确率、校准、扰动鲁棒性与OOD稳定性,但具体增益中排序、模型容量与数据因素的相对贡献仍需细看。

An Analysis and Implementation of Seam Carving for Content-Aware Image Resizing Figure 1
2026-08-06cs.CV

An Analysis and Implementation of Seam Carving for Content-Aware Image Resizing

Francesco Tosoni

L’EMbeDS, Sant’Anna School of Advanced Studies

2026-08-06视觉感知

针对传统缩放会整体变形、裁剪只能丢弃边缘内容的问题,本文实现并分析了 seam carving 的内容感知图像重定向流程。核心在于用梯度能量和动态规划寻找低重要度接缝,并加入 forward energy、接缝插入和权重 mask,以减少直线结构伪影并支持物体保护/移除。实验以自然图像示例展示门廊、桥梁等显著结构在缩放中更易保持比例,但主要是定性展示,缺少系统量化评估。

Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle Figure 1
2026-08-06cs.CR

Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle

Jiaming Zhang, Boyang Chen, Zherui Li, Fuyao Zhang, Xinyu Yan, Hong Xi Tae, Wenwen He, Xuan Wang, Siqi Guo, Junhao Dong, Kun Wang, Hanxun Huang, Yige Li, Xingjun Ma, Yang Cao, Lingjuan Lyu, Wei Yang Bryan Lim

J. Zhang, B. Chen, X. Yan, Z. Li, F. Zhang, H. X. Tae, W. He, X. Wang, S. Guo, J. Dong, K. Wang and W. Y. B. Lim are with the College of Computing and Data Science, Nanyang Technological University, Singapore. W. Y. B. Lim is the corresponding author., H. Huang is with the School of Computing and Information Systems, University of Melbourne, Australia., Y. Li is with the School of Computing and Information Systems, Singapore Management University, Singapore., X. Ma is with the Institute of Trustworthy Embodied AI, Fudan University, China., Y. Cao is with the Department of Computer Science, School of Computing, Institute of Science Tokyo, Japan.

2026-08-06视觉感知

针对视觉内容一旦进入 AI 管线后所有者难以控制其用途的问题,本文将对抗扰动从“攻击”重新界定为主动保护机制,并按内容生命周期统一整理隐私滤波、不可学习样本、生成式防护、对抗验证码与溯源机制。核心洞察是这些方法共同利用人类感知与机器推理的差异;比较结果显示,现有工作多停留在静态或弱自适应对手与受控基准上,真实部署证据仍不足。

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models Figure 1
2026-08-06cs.CV

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack

South Dakota State University, South Dakota State University Brookings SD USA

2026-08-06视觉感知

这篇论文针对现有视频语言评测偏短片、单句或问答,难以衡量模型生成分钟级段落描述的问题,提出 CLIP-CC-Bench:用 200 个90秒电影片段和专家段落标注,去除专名偏置,并以五个嵌入模型进行粗粒度叙事匹配与细粒度内容核查、Borda 聚合排序。作者评测17个VLM,并报告评委一致性与bootstrap稳定性,显示该协议可揭示长描述中的整体叙事与细节覆盖差距。

Binding Biometrics with AI Agent Identifiers for Delegation of Authority Figure 1
2026-08-06cs.CV

Binding Biometrics with AI Agent Identifiers for Delegation of Authority

Joseph Geo Benjamin, Anil K Jain, Karthik Nandakumar

Michigan State University, MI, USA

2026-08-06视觉感知

论文针对多代理任务委托中“谁授权、谁负责”难以追踪的问题,提出 BIND:在授权时把人脸生物特征与代理 ID、任务范围绑定,并由审计方同时完成身份认证和令牌恢复。方法用特征适配将深度人脸嵌入转为二进制表示,结合模糊承诺和 Turbo 纠错码实现绑定;实验显示在 CFP-FF 上零误匹配率下 TMR 达 96%,可支持 1024 位代理令牌,但安全性分析仍部分留待未来工作。

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration Figure 1
2026-08-06cs.RO

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason

University of Southern California, Thomas Lord Department of Computer Science

2026-08-06视觉感知安全鲁棒

这篇论文针对 VLA 机器人在杂乱、光照、物体变化和指令改写等部署偏移下容易失败且现有隐藏状态风险探针依赖同分布校准的问题,提出 SAFECAST:用视觉与语言对比扰动轨迹同时增强探针训练和保形校准。实验显示其在 DROID 真实数据、LIBERO 仿真和多种 VLM 骨干上显著提升失效检测 ROC-AUC/F1,联合视觉-语言扰动优于单模态,并观察到带对比集的仿真到真实校准可优于仅用真实 rollout 训练。

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models Figure 1
2026-08-06cs.CV

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

2026-08-06视觉语言视觉感知数据集/基准

这篇论文针对多模态模型在真实场景中视觉线索与场景文字冲突时缺少可量化诊断的问题,提出 SIGNPOST-Bench:用同一图像的原始、去字、相似、随机和对抗文本五种版本,在地理定位连续空间中衡量模型是否被文字带偏。结果显示,20 个 MLLM 在对抗文字下中位定位误差从 282km 升至 1347km,且所有模型预测都平均向注入目标偏移,说明干净输入能力不能充分代表冲突鲁棒性。

Transferable Dual-Stream Representations for Mesoscale-Preserving Sea Surface Temperature Downscaling Figure 1
2026-08-06cs.LG

Transferable Dual-Stream Representations for Mesoscale-Preserving Sea Surface Temperature Downscaling

Parth Doshi, Priyanka Aravindan, Vaishnav Vaidheeswaran, Md Mahbub Alam, Gabriel Spadon

Dalhousie University, Dalhousie University Halifax NS Canada

2026-08-06视觉感知

本文针对海表温度降尺度中像素损失易产生过平滑、难保留锋面和涡旋等中尺度结构的问题,提出 EddyFlow,将大气强迫、海洋记忆与扩散细化分流建模,并用谱约束强调物理尺度一致性。模型在圣劳伦斯湾训练后可迁移到未见海域,零样本 RMSE 较强基线降低 21%,相对持久性最高达 85.6% 技能,PSD 比值接近 1.00。

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films Figure 1
2026-08-06cs.CV

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

University of Science and Technology of China, JD Explore Academy

2026-08-06视觉感知

OmniVR针对老电影中画面与声音退化同时存在、单独修复易破坏音画一致性的问题,将修复建模为低质音视频条件下的联合生成。其核心是把22B音视频DiT从T2AV平滑迁移到AV2AV,并结合联合退化模拟、首帧锚定、损失重加权和波形监督。OmniVRBench上视觉六项指标、音频质量与同步性均优于级联或单模态基线,但部分增益可能主要来自scaling / data。

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images Figure 1
2026-08-06cs.CV

PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images

Ruiqi Wang, Yiming Qian, Fenggen Yu, Yuxuan Lu, Dakuo Wang, Hao Zhang, Jing Huang

2026-08-06视觉感知三维

这篇论文针对工业检测中物体姿态未知、稀疏视角难以支撑3D重建的问题,提出PADFormer在2D图像空间用ViT做跨视角掩码重建:只用正常参考图学习生成同姿态的无异常查询图,并通过动态patch选择、STN对齐和多次随机掩码集成定位缺陷。结果显示其在PAD稀疏视角基准达到SOTA,同时在FSAD任务保持相近性能,效率优于依赖密集多视角和位姿标注的3D方法。

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation Figure 1
2026-08-06cs.RO

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

2026-08-06机器人视觉感知

这篇论文针对灵巧操作中机器人示教昂贵、海量第一视角人类视频又高度混杂的问题,提出把VLA后训练的人类数据选择建模为推荐检索:对每条机器人示教在形态无关动作空间中做召回、排序、重排序,从3200万样本中挖出任务相关子集且不改模型结构。实验用不到5%的视频样本,将总体成功率从47.7%提升到61.1%,但Drill任务退步,说明增益依赖人类视频池是否覆盖目标技能。

Adversarially Robust Abductive Fusion of Pre-trained Transformer-based Perception Models Figure 1
2026-08-06cs.AI

Adversarially Robust Abductive Fusion of Pre-trained Transformer-based Perception Models

Mario Leiva, Yue Ma, Qinru Qiu, Gerardo Simari, Paulo Shakarian

2026-08-06安全鲁棒

本文针对预训练视觉感知模型在新环境分布偏移和协同标签翻转攻击下集成失效的问题,提出用各模型训练嵌入构建 Label Vector Pool,以几何距离学习无领域知识的错误检测规则,再通过一致性溯因和整数规划/启发式搜索选择预测。实验显示其干净数据上接近最强多数投票,LVP 规则与领域知识规则 F1 差距小于 0.002;在 90% 翻转率下 F1 为 0.42,高于 MV-Plurality 的 0.35。

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering Figure 1
2026-08-06cs.CV

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

Department of Cyber Physical Systems, Clark Atlanta University, Department of Computer Science and Engineering, United International University, Department of Electrical and Computer Engineering, North South University

2026-08-06视觉语言视觉感知

面向边缘空中观测中算力、内存和联网受限且缺少配准热红外/LiDAR数据的问题,TriCLE从单张RGB飞机图像合成FLIR风格热图和伪LiDAR深度,并用紧凑Qwen3-VL结合专家航空分类进行三模态推理。GSPO对齐在测试集达78.00%准确率、0.793加权F1,4-bit量化后可在8GB显存下1.48秒处理一组三模态输入,但真实传感器验证仍不足。

TRNet: Topography-Guided Frequency Rectification and Structure-Aware Decoding for Multimodal Paddy Rice Segmentation Figure 1
2026-08-06cs.CV

TRNet: Topography-Guided Frequency Rectification and Structure-Aware Decoding for Multimodal Paddy Rice Segmentation

Kaiwen Xiao, Chunlong Fu, Liping Zheng, Yanfeng Su

2026-08-06视觉语言视觉感知

本文面向山地丘陵区超高分辨率水稻分割中地形阴影、陡坡纹理与真实田块结构混淆的问题,提出TRNet:将粗分辨率DEM和坡度作为上下文而非细节证据,通过地形引导的频率校正抑制陡坡伪响应,并用结构感知解码联合边界与内部线索。Area A和更陡、更少水稻的Area B上Rice IoU达85.10%和80.68%,较Dual-Encoder U-Net提升9.15和18.83个百分点,但跨季节、跨传感器泛化仍文中未充分说明。

LiNC: Lightweight Noise Correction via Per-Sample Trust and Gaussian Mixture Modeling Figure 1
2026-08-06cs.LG

LiNC: Lightweight Noise Correction via Per-Sample Trust and Gaussian Mixture Modeling

Abhishek Moturu, Babak Taati, Anna Goldenberg

Department of Computer Science, University of Toronto, UHN KITE Research Institute, Vector Institute, Institute of Biomedical Engineering, Rehabilitation Sciences Institute, Department of Laboratory Medicine and Pathobiology

2026-08-06三维

医学影像标注常受阅片差异和错误影响,干净验证集又昂贵;LiNC在常规训练中为每个样本学习信任参数,用其在观测标签和模型预测间插值,并用三成分GMM区分干净、模糊和噪声样本后分阶段纠正。实验覆盖十个MedMNISTv2二维数据集、最高50%标签噪声,报告准确率更稳、误标检测较强,50%噪声下末轮平均准确率提升21.41个百分点。

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization Figure 1
2026-08-06cs.CV

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

2026-08-06优化算法

高分辨率图像和长视频会让 VLM 产生大量视觉 token,推高 LLM 侧计算与显存成本,而固定压缩率难以匹配不同问题的证据需求。RUTA 将视觉 token 削减表述为 rate-utility 优化,按查询构造候选 token、用 Bernoulli 门控自适应决定保留数量,并让保留 token 聚合被删 token 信息。在五个基准上,它仅用约 2.0%/4.2% 视觉 token,仍保留 LLaVA-NeXT-7B/Qwen3-VL-8B 全 token 基线 88.2%/94.4% 的性能。

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models Figure 1
2026-08-06cs.CV

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

Jiaju Han, Xuemeng Sun, Qike Zhang, Xiang Chen, Luwei Yang, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

2026-08-06视觉语言

本文针对自动驾驶在恶劣能见度下对摄像头和激光雷达依赖过强的问题,提出仅用连续十帧4D雷达的Radar4D-VLM,将雷达证据组织为目标、场景和运动token并接入冻结语言模型,同时用对齐、置换和无语言监督做归因审计。结果显示Top-64提案召回率达98.13%,接口可适配多类LLM且确实依赖真实雷达时序,但对齐语言监督未带来稳定的直接预测增益。

Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding Figure 1
2026-08-06cs.CV

Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang

2026-08-06三维

这篇论文面向具身/家庭智能体在隐私敏感场景中感知人体行为的需求,尝试让大模型读取稀疏噪声较强的毫米波雷达序列。核心做法是用同步3D姿态作为训练期监督,预训练时迫使雷达编码器学习人体结构与运动学 token,推理时仅用雷达并与LLM对齐;同时构建真实场景 mmMind-Bench。实验显示其在行为描述、时空问答和未见动作泛化上优于现有雷达语言基线,但具体增益可能同时来自姿态监督与新增真实数据。

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering Figure 1
2026-08-06cs.CV

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

Department of Computer Science, Rice University, College of Sciences, Georgia Institute of Technology

2026-08-06视觉感知

这篇论文针对视频问答中长文本 CoT 推理开销高、且许多问题只需定位视觉证据即可回答的问题,提出 DyLaR:先用感知 latent 表示与问题相关的视频证据,再按需决定是否加入推理 latent。其关键洞察是“所有问题都要感知 grounding,但并非都要推理”。在九个视频基准和四类 MLLM 骨干上,DyLaR 在平均准确率上超过同骨干基线,同时把每题生成长度压到 20 token 以内;消融显示感知 grounding、推理 latent 监督和自适应路由均有贡献。

Interpretable Fuzzy Inference for UAV Target Tracking Using Bounding-Box Geometry Figure 1
2026-08-06cs.RO

Interpretable Fuzzy Inference for UAV Target Tracking Using Bounding-Box Geometry

Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati, Nicholas Edmond, Hossein Z. Saghazadeh, Olusola Odeyomi, Parham Kebria, Abdollah Homaifar

2026-08-06视觉感知学习理论

这篇论文面向无人机仅凭机载视觉跟踪地面目标时,偏航控制既要实时又要可解释的问题,提出用 YOLO 检测框的中心、面积和宽高比输入模糊推理,而不做显式几何重建。其核心在于用训练集分位数构造无泄漏的 27 条规则,并比较 Mamdani 与一阶 Takagi-Sugeno 模型。VICON 数据上,Takagi-Sugeno 在 6169 个样本、五次划分中达到约 0.140° MAE、±1° 内 99.676%,但真实外场泛化仍文中未充分说明。

GEB-Bench: Abstract Structures Told in Many Voices Figure 1
2026-08-06cs.CV

GEB-Bench: Abstract Structures Told in Many Voices

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

Fudan University, Peking University

2026-08-06视觉感知

本文关注多模态模型是否能摆脱表面外观,识别并迁移抽象结构。GEB-Bench将自指、递归、莫比乌斯等25类结构用场景、故事、数学和程序骨架多种“声音”生成,并把数量、角度等设为不计分干扰项。对37个模型的结果显示,单一表征内识别明显强于跨表征映射,错误更符合形式结构而非感知相似性,只有前沿模型能部分缩小这一差距。

LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching Figure 1
2026-08-06cs.CV

LoRetta: A Foundation Model and Extensive Dataset for Global-Scale Remote Sensing Dense Image Matching

Siwei Yu, Han Guo, Zhenwei Shi, Zhengxia Zou

2026-08-06视觉感知数据集/基准

面向跨季节、跨传感器和大尺度位移下遥感影像密集匹配失效且耗时的问题,LoRetta将任务拆成可匹配区域/仿射几何定位与局部残差配准,并配套LEVIR-GM全球多时相光学基准及匹配性标签。其在LEVIR-GM上AUC达83.3%,较RoMa v2高1.6点,PCK@1/2px提升6.5/8.2点,延迟降低47.8%。

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization Figure 1
2026-08-06cs.LG

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

Boyao Wang, Zhihan Lei

Machine Learning Department, Carnegie Mellon University

2026-08-06视觉感知

论文针对模块化/MoE网络中学习路由常难以形成专家分工的问题,提出无需参数和辅助损失的SpecDrop:用推理时可用的类别标签固定提高对应分支激活概率,并保留跨类泄漏。核心洞察是路由是否有效主要取决于训练信号与目标类别的粒度对齐。实验显示其在CIFAR-100和ImageNet等清晰视觉分区上优于同参数无标签路由基线,但在SlimPajama、SuperNI等模糊分区上与No-Routing基本持平;且若只看精度,带同样标签的输出mask更强。

Advancing Utility Pole and Sign Detection Through Deep Learning Figure 1
2026-08-06cs.CV

Advancing Utility Pole and Sign Detection Through Deep Learning

Carl Dickinson, Gaetano Di Caterina

2026-08-06视觉感知

针对木质电线杆巡检仍依赖人工、直升机或无人机且难以量化倾斜的问题,论文用Google Street View构建OHL-UK数据集,并将DETR扩展为检测、实例分割与倾角估计一体化框架,覆盖无横担等视觉特征弱的杆体和小尺寸警示牌。结果显示,杆体和标志检测mAP分别达90.43%与88.26%,倾角估计MAE为1.01度,优于RetinaNet、Faster R-CNN和YOLOv3-Tiny等基线。

When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning Figure 1
2026-08-06cs.CR

When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning

Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou

2026-08-06视觉语言视觉感知

论文针对多模态对比学习训练集后门检测中过度依赖 CLIPScore 的问题,指出良性与投毒图文对相似度分布重叠且固定阈值缺乏统计保证。其核心是 CASCADE:先用跨模态一致性粗筛高置信样本,再以高置信投毒集为参照,用文本空间非一致性分数和保形预测细分可疑样本。在 CC3M 上报告平均 FPR@100%TPR 为 5.79%、AUROC 为 0.9867,并称对自适应攻击仍有效。

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts Figure 1
2026-08-06cs.GR

NuclearDiffusion: Text-to-Image Foundation Models for Learning Nuclear Energy Concepts

Mohammed I. Radaideh, Jeremy Moon, Andre Gala-Garza, Emma Son, Yug Shah, Majdi I. Radaideh

Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan 48109, USA, Michigan Institute for Computational Discovery and Engineering (MICDE), University of Michigan, Ann Arbor, Michigan 48109, USA, Department of Nuclear Engineering and Radiological Sciences, University of Michigan, Ann Arbor, Michigan 48109, USA, Department of Electrical Engineering and Computer Science, University of Michigan, Ann Arbor, Michigan 48109, USA

2026-08-06视觉感知生成模型

这篇论文针对通用文生图模型在核工程概念上常生成物理错误、技术不一致图像的问题,构建了1000张带标注核能图像数据集,并微调SDXL、SD-v3.5和Flux.1。结果显示微调显著提升SDXL、仅小幅改善SD-v3.5、对Flux.1无明显收益;商业模型虽擅长宽泛核能场景,但在专业提示上不如领域适配模型稳定。

2026-08-05

146 篇
ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs Figure 1
2026-08-05cs.CV

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

2026-08-05视觉语言

这篇论文针对多模态大模型扩展时常在参数规模或串行推理计算上增加成本、且 ViT 与 LLM 计算分配固定的问题,提出 ParVL:用共享骨干加分支前缀并行复用 ViT/LLM,分别控制视觉与语言分支数。实验显示不同任务偏好的计算分配不同,1B 平均分从 49.6 到 50.5,2B/8B 平衡配置也小幅优于单分支;增益幅度不大,且受限于单一骨干和 SFT 子集,泛化仍需验证。

Perceptual Anchoring: Prototype-Guided Text Calibration for Training-free Open-Vocabulary Semantic Segmentation Figure 1
2026-08-05cs.CV

Perceptual Anchoring: Prototype-Guided Text Calibration for Training-free Open-Vocabulary Semantic Segmentation

Wanli Ma, Jiangwen Lu, Qinmu Peng, Xinge You

School of Electronic Information and Communications, Huazhong University of Science and Technology, Wuhan 430074, China, National Anti-counterfeit Engineering Research Center, Huazhong University of Science and Technology, Wuhan 430074, China, School of Automation, Hangzhou Dianzi University, Hangzhou 310018, China

2026-08-05视觉感知

这篇论文针对训练-free 开放词汇语义分割中“通用文本类别嵌入”与图像内具体实例外观不匹配的问题,指出仅增强视觉特征会导致掩码不完整和背景误检。其核心是借鉴感知锚定,用初始匹配得到的可靠视觉证据构建类别原型,再自适应校准文本嵌入。实验在八个基准和六类方法上显示该插件式模块能稳定提升分割完整性与准确性。

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent Figure 1
2026-08-05cs.CV

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao

2026-08-05视觉语言视觉感知

论文关注多模态研究代理从静态图像扩展到视频时的两类失效:偏向文本检索而忽视视觉工具,以及依赖参数记忆绕过真实探索。作者提出分离感知与探索、分阶段解锁工具的 Video-DeepResearch,并用 SFT+GRPO 训练,同时构建需视觉定位和外部知识推理的 VideoDR-Bench。35B-A3B 平均准确率达 64.0%,超过 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro,工具调用分析也显示视觉探索更充分。

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion Figure 1
2026-08-05cs.CV

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

Joy Future Academy, JD

2026-08-05视觉感知生成模型

这篇论文针对流式视频编辑中无法等待未来帧、算力和记忆需受限且长时间易漂移的问题,提出16B自回归扩散框架JoyAI-Video-Edit。核心做法是分块因果化编辑器,并结合源锚定分布匹配蒸馏与长程自回归蒸馏,把生成压到两步同时约束源视频保真和误差累积。实验称其优于现有流式编辑器,长短视频上接近强离线系统,并在单张B200上实现720p约30FPS。

UniWorld-Design: From Pixel Generation to Layer-Native Design Figure 1
2026-08-05cs.CV

UniWorld-Design: From Pixel Generation to Layer-Native Design

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

2026-08-05强化学习

这篇论文针对现有文生图只输出扁平 RGB、缺少可编辑结构的问题,提出将语义 RGBA 图层作为生成、理解和编辑的原生单元。其核心是 T2RGBA 从文本生成透明素材,I2L 按指令把成图分解为有序、完整语义图层,支持递归分解和目标抽取。实验中 I2L 相比 Qwen-Image-Layered 降低 37% 每层 RGB L1、提升 34% Alpha Soft IoU,T2RGBA 获得最高 CLIP Score,但 alpha 边界和密集文字仍是短板。

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints Figure 1
2026-08-05cs.CV

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints

Noor Hussein, Anil K. Jain, Karthik Nandakumar

Michigan State University, East Lansing, MI 48824, USA

2026-08-05生成模型强化学习

本文针对重叠指纹会让现有匹配器混合两枚手指纹线、进而增加误匹配风险的问题,把分离重叠纹线转化为潜空间扩散修复任务。核心做法是从 Stable Diffusion 逐步注入指纹先验、部分指纹补全能力和多通道重叠感知条件,并用联合组成损失约束两路重建一致性。实验在两个公开数据集上显示,重建出的组件指纹能以很高概率匹配回对应真值,但具体增益在多大程度来自数据规模与分阶段训练仍需进一步辨析。

Latent Reward Registers for Diffusion Preference Alignment Figure 1
2026-08-05cs.LG

Latent Reward Registers for Diffusion Preference Alignment

Yuanshen Guan, Zipeng Feng, Zhiwei Xiong, Peiqin Sun

University of Science and Technology of China

2026-08-05生成模型强化学习

本文针对扩散模型偏好对齐中只依赖最终图像奖励导致的长程信用分配和高训练成本问题,提出在冻结 DiT 中加入不改写生成器状态的 latent reward registers,从中间噪声 latent 直接预测终端偏好并产生逐步梯度。该信号用于 RG-OPD 训练和 RGS 推理;实验显示高噪声下排序准确率领先,RG-OPD 相比在线 RL 最高节省 33 倍 GPU 小时,RGS 在免训练方法中同时提升对齐与感知指标。

PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection Figure 1
2026-08-05cs.LG

PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection

Mateusz Smendowski, Kamil Faber, Piotr Nawrocki, Nathalie Japkowicz, Roberto Corizzo

2026-08-05视觉感知

这篇论文针对多变量时间序列异常检测中表示选择敏感、TS2I 如何处理高维多通道数据不清的问题,提出 PRISM 元工作流,将时间序列到图像变换与通道构造解耦,并强调 channelization 是关键设计维度,给出基于均值、标准差、最大值的 MSM 方案。实验覆盖 14 个 TSB-AD 数据集和 7000 余组配置,PRISM 在 10 个数据集上取得最佳 VUS-PR,MSM 相比 PCA 通道化提升 11–27%,冻结 ImageNet 编码器仍保留 92% 微调性能。

GeoMAR: Unleashing Geometrically Aligned Features for Masked Autoregressive Blind Face Restoration Figure 1
2026-08-05cs.CV

GeoMAR: Unleashing Geometrically Aligned Features for Masked Autoregressive Blind Face Restoration

Lu Gan, Hanyu Yan, Chaofeng Chen, Junqi Hu, Dan Zeng

School of Artificial Intelligence, Sun Yat-sen University, Institute for Math and AI, Wuhan, School of Artificial Intelligence, Wuhan University, The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR, Sun Yat-sen University Zhuhai China, School of Artificial Intelligence, Wuhan University Wuhan China, The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR Guangzhou China

2026-08-05视觉感知

GeoMAR针对盲人脸修复中严重退化导致的条件特征歧义和一次性码本预测脆弱问题,提出用退化图像与人脸解析图共同驱动VLM生成部件级几何文本先验,再通过SFT与KV-Q交换注意力对齐到低质特征,并把潜码预测改为Masked Autoregressive的多步粗到细修复。实验覆盖一个合成和三个真实基准,显示其在感知质量与结构一致性上较现有方法更有竞争力。

Low-Dimensional High-Leverage Subspace Optimization: Beyond Full-Parameter Coupled Training for Neural Network Quantization Figure 1
2026-08-05cs.CV

Low-Dimensional High-Leverage Subspace Optimization: Beyond Full-Parameter Coupled Training for Neural Network Quantization

Peng Xia, Junbiao Pang, Zheng Huang

2026-08-05优化算法

论文针对低比特量化在紧凑网络中因全参数耦合训练而易失准的问题,指出归一化层仿射参数是低维但高杠杆的响应控制子空间,并提出 NAP:冻结主干,仅在目标伪量化图下调节 BN/RMSNorm 的 scale/shift,或与量化尺度交替优化。实验显示其能显著恢复 MobileNetV2 等模型的 W4A4/W2A4 精度,提升 PTQ 和部分饱和 QAT,并扩展到分割与语言模型;但收益依赖量化后端和检查点,个别设置会退化。

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding Figure 1
2026-08-05cs.CV

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

2026-08-05视觉感知

长视频问答只能输入少量帧,固定采样或一次性相关性筛选难以按问题调整证据量,而代理式搜索又开销很高。EcoFrame的核心洞察是复用VLM推理中的输出熵判断证据是否足够,并用帧级注意力决定向哪些时间段扩展候选帧,无需训练。实验显示其在Video-MME、LongVideoBench和MLVU上提升准确率-效率权衡,Qwen2.5-VL平均64.4,高于BOLT的63.5,并较AKS/BOLT提速1.85倍、较A.I.R.最高提速13.5倍。

StreamDAM: Presence-Aware Memory for Real-Time Streaming Video Object Segmentation Figure 1
2026-08-05cs.CV

StreamDAM: Presence-Aware Memory for Real-Time Streaming Video Object Segmentation

Xiang Chen

2026-08-05视觉感知

这篇论文针对高精度视频目标分割模型在真实 30fps 流式协议下因计算超时而反复输出旧掩码、且无法判断目标是否仍存在的问题。StreamDAM 将失败归因于 DAM4SAM 的记忆管线:一方面通过图捕获、减少主机同步和限制干扰物分析让管线按帧率运行,另一方面用单一学习到的 presence 信号统一控制记忆写入、读取窗口、输出抑制和重检测。实验在四个基准和五个现代基线下显示,StreamDAM 平均流式精度最高,基本追回离线模型因时钟约束损失的性能,并在 MOSE-hard 上超过其离线基座。

UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution Figure 1
2026-08-05cs.CV

UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution

Kunquan Zhang (1), Peilang Li (1), Xikun Hu (2), Yunkai Yang (1), Yushan Zou (2), Zhiwei Zhang (1), Runmin Dong (1) ((1) Sun Yat-sen University, (2) National University of Defense Technology)

Sun Yat-sen University, National University of Defense Technology

2026-08-05视觉感知

这篇论文面向遥感批量标注中提示分割模型难以适应新场景、未见类别和多意图任务切换的问题,提出 UniEvo-RS:用统一多指令框架整合文本与视觉提示,并从少量人工修正样本中提炼正、负原型,在固定记忆预算下无训练更新地增强目标召回、抑制背景误检。实验称其在多数遥感分割设置达到 SOTA,且少量 exemplar 反馈可提升未见类别的跨图像预标注精度。

NCGR: Noise-Conditional Gated Rectification for Camera Extrinsic Perturbations in BEV 3D Object Detection Figure 1
2026-08-05cs.CV

NCGR: Noise-Conditional Gated Rectification for Camera Extrinsic Perturbations in BEV 3D Object Detection

Wenbin Pan, Wanhao Liu, Liwei Luo, Panshuo Li, Yong Xu, Renquan Lu

2026-08-05视觉感知三维

本文针对相机外参扰动会使 BEVFormer 类空间交叉注意力的参考点投影偏移、进而采样错误图像区域的问题,提出 NCGR:不显式回归完整六自由度外参,而是在 SCA 内为每个 query-相机对预测带门控的二维残差校正,并用 clean teacher/perturbed student 的 BEV 一致性训练,使推理时无需扰动元数据。nuScenes 模拟动态/静态扰动实验中,五相机动态压力测试 NDS 达 39.69%,高于 BEVFormer 的 28.00% 和 CAPE 的 33.23%,干净外参下性能基本保持。

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement Figure 1
2026-08-05cs.CV

CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement

Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja Ganu

2026-08-05视觉语言视觉感知强化学习

本文针对胸片 VLM 只会生成流畅报告、缺少可调诊断阈值、空间定位和定量测量能力的问题,提出 CARE-X:在生成骨干上联合训练分类与定位辅助头,并用 DAPO 按临床奖励优化报告、VQA 和 grounding;对需测量的诊断则结合 Qwen3-VL 与确定性工具。结果显示其在四个报告基准多数指标达 SOTA,ReXVQA 准确率 94.0%,工具测量在五类疾病上平均 F1 提升 43.6 个百分点,并在印度 NH 临床数据上验证了罕见 ICU 病变泛化。

MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization Figure 1
2026-08-05cs.CV

MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji

Tsinghua University, Huazhong University of Science and Technology, University of Chinese Academy of Sciences, Tsinghua University Shenzhen China, Tsinghua University Beijing China, Huazhong University of Science and Technology Wuhan China, University of Chinese Academy of Sciences Beijing China

2026-08-05视觉语言视觉感知学习理论

MuRA针对视觉语言模型在分布偏移下测试时适应不稳的问题,指出固定 LoRA 秩会让复杂样本欠拟合、简单样本过拟合,并利用视觉复杂度与最优秩的相关性做动态路由。方法用多秩正交分解初始化不同容量模块,再以统一融合和持续更新路由进行 token 级秩选择。实验称其在域泛化和跨数据集评测中达到更高准确率,同时降低吞吐与显存开销。

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models Figure 1
2026-08-05cs.CV

BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models

Sadab Shiper, Tawsif Tashwar Dipto, Mir Md Inzamam, Eshat Tanzeem

Islamic University of Technology, Bangladesh, BRAC University, Bangladesh

2026-08-05视觉语言视觉感知数据集/基准

本文针对孟加拉语街景文字识别缺少真实场景评测的问题,提出 BanglaWild:2535 张公共空间图像配逐字转写、标准拼写及诊断属性,并同时评测 OCR 与 VLM。结果显示,强系统约 60% 错误来自视觉误识别而非传统认为的合字/正字问题;同系列大模型未必优于小模型,LoRA 主要减少弱模型灾难性失败,对已有能力上限提升有限。

CPrefix: A Combinatorial Tensor Framework for Structured Discrete Color Mappings Figure 1
2026-08-05cs.CV

CPrefix: A Combinatorial Tensor Framework for Structured Discrete Color Mappings

Yvan Richard

2026-08-05视觉感知

针对离散多通道颜色映射只保存采样值、难以分析结构的问题,CPrefix用多项计数张量把RGB等观测组织到离散Pascal单纯形的潜在组合坐标中,从而分离组合结构与设备测量值。论文在ICC显示和打印配置上做潜在重建与感知色域传输,显示可较准确重建,并用残差衡量映射与该表示的兼容性;但具体相对基线和增益来源文中未充分说明。

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation Figure 1
2026-08-05cs.CV

LiteMVS: Efficient Multi-View Stereo with Foundation Distillation and Expert Aggregation

Tianbao Zhang, Zeyu Liu, Shuyu Wu, Fanxing Li, Zhaoxin Fan, Wenjun Wu, Danping Zou

Shanghai Key Laboratory of Intelligent Sensing and Recognition, Shanghai Jiao Tong University, Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University

2026-08-05视觉感知

LiteMVS面向机器人和具身场景中实时、稳定的三维感知需求,针对传统多视角立体在弱纹理和重复区域匹配不可靠、单目模型又缺少多视几何约束的问题,将轻量分割语义特征注入代价体,并用MoE自适应聚合不同深度假设,同时通过基础视觉模型蒸馏相对深度和法向先验而不增加推理开销。在ScanNetv2、7-Scenes及抓取下游任务中,文中报告其在深度估计、重建质量和速度之间取得更优权衡。

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding Figure 1
2026-08-05cs.CV

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

Jiapeng Li, Yong Li, Junjie Zhou, Fan Zhang, Yu Liu

2026-08-05视觉语言

本文针对城市智能中街景、遥感、文本、区域与时序变化证据难以用同一嵌入空间比较的问题,提出GeoMEB基准和Geo-Embed模型,将45类任务统一为带指令的查询-目标匹配。核心洞察是城市相似性取决于语义、跨视角、区域和时间关系而非纯图文对齐;实验显示Geo-Embed总体优于代表性多模态嵌入模型,相对最强基线提升15.3%。

FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis Figure 1
2026-08-05cs.CV

FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis

Zhang Weihui, Wang Ruizhi, Xu Hongye, Wang Huiqiong, Sun Li, Song Mingli

Zhejiang University, Zhejiang, China

2026-08-05生成模型

针对洪灾前后配对卫星影像稀缺、现有生成模型容易把积水放错位置并扭曲道路建筑等稳定结构的问题,FlowForm在Stable Diffusion中加入浅水方程残差约束的洪水潜变量分支,并用深度、语义、边缘特征锚定地形结构;同时构建约1万对FloodScape数据。实验显示其在视觉质量、前后图像相似性、淹没区域一致性及地理留出事件泛化上优于对比方法。

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space Figure 1
2026-08-05cs.CV

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

Amir Mohammad Ezzati† Sharif University of Technology, Kiyan Rezaee† Michigan State University, Bardiya Kariminia Shahid Beheshti University, Mohamad Amin Yousefi University of Tehran, Asal Mohammadjafari Mamaqani Amirkabir University of Technology, Behrad Samimi Sharif University of Technology, Mohammad Hossein Rohban Sharif University of Technology, Code is publicly available at https://github.com/amirezzati/uhpdet., with external evidence, but their effectiveness is limited by the availability and coverage of those resources. In, without external resources, typically by exploiting signals already available within the model. A prominent

2026-08-05视觉语言视觉感知

针对现有黑盒幻觉检测常把视觉语言模型不确定性压缩为单一一致性分数、容易漏掉高一致性的错误回答,本文提出 UHP Detection:同时考察图像/文本扰动与陈述/否定两条轴,提取四类一致性组的组内和组间特征训练轻量分类器。实验在 AMBER、PhD 和三种 LVLM 上显示,其相对强黑盒基线最高提升 18.72% AUC-ROC、20.07% AUC-PR,并有跨数据集泛化证据。

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models Figure 1
2026-08-05cs.CV

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

Northwestern Polytechnical University, Peking University, Tsinghua University

2026-08-05视觉感知

OmniPack针对全模态大模型中音视频 token 序列过长、低预算压缩易丢失分散证据的问题,提出无需训练的两阶段压缩:LLM 前按模态建模重要性、全局覆盖与相似合并,LLM 内再利用文本引导和音视频协作做语义筛选。实验覆盖3个骨干和5个基准,在Qwen2.5-Omni-7B上以16.7% FLOPs保留98.0%性能,6.8% FLOPs仍保留92.9%。

AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding Figure 1
2026-08-05cs.CV

AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding

Yuxiang Duan, Huining Li, Ao Li, Shuai Feng, Lanju Kong, Ning Liu, Jian Zhang, Xingdong Sheng, Yuntao Du

2026-08-05视觉感知

针对视频异常理解中固定采样证据不足、单智能体把探索与决策混在一起导致协调弱的问题,AgenticVAU将任务改写为免训练的多智能体“探索-验证”流程,用规则构建、搜索规划、视频观察和最终决策四类智能体共享锚点证据库,按支持、反驳或不确定组织观察。在VAU-Bench的ECVA、UCF-Crime和MSAD子集上,它优于零样本推理和强化微调基线,分类任务提升更明显。

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding Figure 1
2026-08-05cs.CV

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

Northwestern Polytechnical University, Northwestern Polytechnical University Software School Xi’an Shaanxi China, Northwestern Polytechnical University School of Computer Science Xi’an Shaanxi China

2026-08-05视觉语言三维

这篇论文针对零样本3D视觉定位中“左侧、后方”等视角依赖描述容易歧义、相似实例干扰严重的问题,提出无需训练的TDVR框架:先构建语义3D场景图,用LLM融合外观与空间关系并结构化查询,再推断最匹配观察视角,结合混淆、类别和外观得分定位目标。在ScanRefer上相对既有零样本SOTA提升Acc@0.25 15.25%、Acc@0.5 14.46%,Sr3D总体准确率达70%。

Unsupervised Adversarial Domain Adaptation for Uterine layer Segmentation: From Labeled Cine to Unlabeled Dynamic EPI MRI Figure 1
2026-08-05eess.IV

Unsupervised Adversarial Domain Adaptation for Uterine layer Segmentation: From Labeled Cine to Unlabeled Dynamic EPI MRI

Smiti Tripathy, Milauni Desai, Jordina Aviles Verdera, Jana Hutter

2026-08-05视觉感知

该文针对动态功能子宫 MRI 中人工标注稀缺、EPI 分辨率低且与 cine MRI 存在域偏移的问题,提出以标注 cine 向未标注动态 EPI 迁移的 U-Net-LSTM 与多尺度对抗判别器,利用时间层运动特征做子宫分层分割。模型取得 Dice 0.88、Jaccard 0.80,并在 14/39 例中观察到结合带面积与 T2* 的负相关,提示可联合评估蠕动收缩与氧合变化。

Towards Reliable and Reproducible Fetal Brain Biometry: A Deep Learning Approach Using MRI Figure 1
2026-08-05cs.CV

Towards Reliable and Reproducible Fetal Brain Biometry: A Deep Learning Approach Using MRI

Francesca Maccarone, Marina Di Stefano, Giorgio Longari, Giulia Frigerio, Gloria Rizzato, Rocco Prudentino, Nivedita Agarwal, Tommaso Ciceri, Denis Peruzzo, Simone Melzi

a NeuroImaging Laboratory, Scientific Institute IRCCS Eugenio Medea, Bosisio Parini (LC), Italy, b University of Milano-, Bicocca, Milan, Italy, c Image Sciences Institute, Division Imaging and Oncology, University Medical Center Utrecht, convolutional neural network is trained to regress landmark coordinates from brain segmentation label maps, followed by, evaluated on two publicly available fetal MRI datasets comprising 150 volumes (gestational age range: 20–37 weeks), available automated pipeline, the proposed method achieves comparable or improved accuracy for most measurements., scalability that support integration into clinical workflows., process is time-consuming, labour-intensive, and prone to inter- and intra-observer variability [2,11,12]. Image quality is, including reliance on 2D slice-based analysis, lack of standardized pipelines, limited availability of publicly accessible

2026-08-05视觉感知

胎儿脑 MRI 生物测量仍依赖人工在特定切面量取,耗时且受观察者和胎动伪影影响。本文将 3D 超分辨重建后的分割标签图输入 3D CNN 回归解剖标志点,再用按测量项设计的几何优化细化位置,兼顾可解释性和自动化。在两个公开数据集 150 例上,多数指标平均绝对误差低于 2 mm、标志点误差低于 4 mm,跨采集设置较稳定,但胼胝体长度仍是主要难点。

Attention is Case-Sensitive Figure 1
2026-08-05cs.CV

Attention is Case-Sensitive

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

University of Applied Science Esslingen, Karlsruhe Institute of Technology, University of Michigan

2026-08-05视觉感知

这篇论文追问大小写是否只是分词细节,还是会像人类视觉中的大写显著性一样改变模型注意力。作者将语义和词序固定,只改变目标片段大小写,在9个LLM和4个VLM上做实证,发现大写或交替大小写能稳定吸引文本注意力,并部分迁移到视觉注意力;但注意力增强不等于性能提升,交替大小写还会降准,推理模型的“思考”阶段可缓冲文本中的表面格式影响。

MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding Figure 1
2026-08-05cs.CV

MultiCompose: Multi-Concept Personalized Composition with Per-Subject Attribute Binding

Ruirui Zhang, Zhengkai Zhao, Pan Gao

Nanjing University of Aeronautics and Astronautics, Nanjing University of Aeronautics and Astronautics College of Computer Science and Technology Nanjing Jiangsu China, Nanjing University of Aeronautics and Astronautics College of Artificial Intelligence Nanjing Jiangsu China

2026-08-05三维

MultiCompose针对多个人性化主体同图生成时身份易退化、服饰/配件/持物等属性易串绑的问题,将单概念微调与多主体推理解耦:用语义保持正则维持属性绑定能力,再以两阶段推理自动建立布局,并通过跨注意力隔离和互斥软掩码路由各主体预测。实验显示其在常规指标和新提出的MSP-Bench上优于现有方法,同时更能暴露身份、绑定与错配三类失效。

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation Figure 1
2026-08-05cs.SE

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

2026-08-05视觉语言

论文关注截图生成前端代码时,MLLM 是否真的依据像素而非重复 UI 模式补全代码。作者构造视觉模式补全偏置基准,在 30 个网页上扰动单一卡片宽度或字体大小并让模型补回被遮蔽值。结果显示五个前沿模型普遍偏向重复基线:卡片宽度平均偏置 69.78%、文本字号 80.22%,准确率仅 21.17% 和 7.89%;噪声、更细微扰动和边界位置会进一步放大偏置,说明失效主要受视觉显著性影响。

Keep the Needle, Prune the Haystack: Defect-Preserving Token Pruning for Efficient Zero-Shot Anomaly Detection Figure 1
2026-08-05cs.CV

Keep the Needle, Prune the Haystack: Defect-Preserving Token Pruning for Efficient Zero-Shot Anomaly Detection

Yanning Hou, Jingyuan Zhang, Xiaoyun Wang, Qixiang Ma, Sihang Zhou, Ke Xu

Anhui University, Hefei, China, National University of Defense Technology, Changsha, China, level localization. A pruning strategy centered on dominant

2026-08-05视觉感知

本文针对零样本视觉异常检测中 ViT 对所有图像 token 做密集推理的高成本问题,指出异常 token 被误剪会直接丢失检测证据,而早层虽省算力却语义不可靠。KeepAD 采用浅层局部覆盖保留与异常救援、深层原型引导和自适应预算剪枝,并用密集到稀疏自蒸馏训练路由。在 13 个工业与医疗基准上,其 token 保留率低于 20%,图像级和像素级 AUROC 平均下降控制在 2.7 个百分点内,最高相对 CLIP 基线提速 7.9 倍。

XiDepth: a Lightweight and Efficient Network for Self-supervised Monocular Depth Estimation Figure 1
2026-08-05cs.CV

XiDepth: a Lightweight and Efficient Network for Self-supervised Monocular Depth Estimation

Elena Izzo, Riccardo Toniolo, Lamberto Ballan

2026-08-05视觉感知

针对单目自监督深度估计在嵌入式设备上常受参数量、能耗和算子兼容性限制的问题,XiDepth将XiNet块引入轻量U-Net式多尺度深度网络,避免深度可分离卷积和复杂注意力,并用相邻帧视图重建训练。其在KITTI上以约0.8M参数达到或超过已有方法,并在Raspberry Pi 4上报告FLOPs降40%、能耗降35%,但具体增益中架构与实现优化的贡献划分文中未充分说明。

Morphology-Aware Implicit Super-Resolution Network for Pathological Images Figure 1
2026-08-05cs.CV

Morphology-Aware Implicit Super-Resolution Network for Pathological Images

Jiaming Liang, QiHui Han, Haolin Chen, Chengxin Ye, Jiawen Liu, Jiazhou Chen, Xiaoqi Sheng, Hongmin Cai

2026-08-05视觉感知

这篇论文针对数字病理中低分辨率扫描成本低但易丢失细胞边界、核纹理等诊断形态的问题,提出 Morph-ISR,将超分辨率改写为连续坐标查询,并用位置感知隐式核生成器适配不同组织形态,再借助预训练细胞分割网络提供形态保真先验约束边界与区域重建。在 TCGA 与零样本 SurGen 上,LPIPS、ST-LPIPS 相比次优方法最高降低 38.37% 和 39.55%,同时保持较强 PSNR/SSIM,并报告了较高吞吐与紧凑参数量。

When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware Figure 1
2026-08-05cs.CV

When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware

Hao Dou, Ruiwen Tian

Harbin Institute of Technology, Harbin, China

2026-08-05视觉语言

论文针对“减少视觉 token 是否必然加速多模态推理”的常见假设,提出端到端 break-even 测量框架,把决策开销、可复用计算和可避免算子纳入同一延迟边界。结果显示,后视觉 Oracle 虽平均只需保留 23.92% token,但固定安全预算仍为 100%;两种自回归探针反而更慢。Static 在两类 GPU 上有显著延迟下降,而预视觉图像尺寸规则虽删 token 更少,却因可跳过预处理和视觉编码,在 A100 上节省更多时间。

Learning Biomechanically Plausible Human Motion from Sparse Radar Point Clouds Figure 1
2026-08-05cs.CV

Learning Biomechanically Plausible Human Motion from Sparse Radar Point Clouds

Jonas Leo Mueller, Markus Gambietz, Alexander Weiss, Daniel Krauss, Bjoern M. Eskofier

Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg, Erlangen, Germany, Munich Center for Machine Learning (MCML), Munich, Germany, Institute of AI for Health, Helmholtz Zentrum München, Neuherberg, Germany

2026-08-05三维

针对雷达人体姿态估计常用无约束关键点导致骨长漂移、足部穿地且临床可解释性弱的问题,论文把可微全身生物力学骨架、基于雷达的个体化 scaling 和足地接触损失接入时序点云网络,直接预测关节广义坐标。11 名健康受试者康复动作 LOOCV 中,MPJPE 为 6.456 cm、角度误差 8.083°、接触 F1 为 0.935,较 mmMesh 位置误差略降并获得一致骨长;但仍是受控小样本概念验证。

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification Figure 1
2026-08-05cs.CV

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

2026-08-05规划控制

本文针对VLM在空间关系问答中虽能识别物体却常选错实例或依赖全局模糊视图的问题,提出无需训练的SEER证据接口:先隐藏候选关系做自定位,再构造带主客体角色标记的局部视图,并结合全图、稀疏几何和可选逆关系一致性。结果显示其在冻结GQA测试上较Full提升约3.94点,在EmbSpatial上跨模型提升4.35至11.79点,主要收益来自查询相关证据与角色绑定。

Geospatial-Prior Guidance for 3D Semantic Scene Completion Figure 1
2026-08-05cs.CV

Geospatial-Prior Guidance for 3D Semantic Scene Completion

Meng Wang, Shougao Zhang, Wenzhe He, Ruihui Li, Nan Hu, Zhuo Tang, Kenli Li

2026-08-05三维

本文针对车载图像做3D语义场景补全时视野受限、遮挡区域缺乏约束的问题,提出GeoScene,将卫星图像与OSM道路/建筑等结构化地理信息作为软先验,而非硬约束注入。核心在于学习体素级观测可靠性与地理先验可靠性,并据此自适应融合特征,减少错位或过时地图带来的误导。SemanticKITTI和SSCBench-KITTI-360实验显示其在地理先验辅助设置下提升几何与语义补全,收益主要集中在道路、建筑等静态结构类。

A machine-readable catalogue of the Tsiolkovsky papers (fond 555, Archive of the Russian Academy of Sciences), and a way to measure how well its handwriting can be read Figure 1
2026-08-05cs.CL

A machine-readable catalogue of the Tsiolkovsky papers (fond 555, Archive of the Russian Academy of Sciences), and a way to measure how well its handwriting can be read

Vladimir Beskorovainyi

Moscow Institute of Physics and Technology (MIPT)

2026-08-05视觉感知

这篇论文面向齐奥尔科夫斯基档案虽已扫描却无法检索的问题,构建覆盖2019个文件、51008页扫描的机器可读目录,并补齐日期、手写/打字页分类和部分机器转写。核心洞察是利用同一文本的手稿与打字副本,在缺少真值时估计手写识别误差。结果显示手写页两次读取词级一致率中位数仅37%,分类约80%准确,因而当前质量不足以支持逐词校勘。

Predictive Enhancement Calibration for Latent Breast MRI Virtual Contrast Enhancement Figure 1
2026-08-05eess.IV

Predictive Enhancement Calibration for Latent Breast MRI Virtual Contrast Enhancement

Qin Lei, Hao Wu

2026-08-05视觉感知

这篇论文针对乳腺MRI虚拟增强中预训练潜空间生成器与MRI非标准强度尺度不匹配的问题,指出强度窗口会在生成前影响放射组学保真度,独立归一化又会造成源图与目标图坐标不一致。作者提出PEC,用共享且病例自适应的强度坐标训练,并在推理时从平扫图预测目标上界,结合FLUX潜流模型与LoRA参考条件。MAMA100内部评估中,PEC在8项指标点估计上均优于固定宽窗口和分离坐标,MSE与LPIPS证据最强,但外部验证和尾部预测误差仍是限制。

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models Figure 1
2026-08-05cs.CV

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

2026-08-05视觉语言视觉感知

SlimVLM面向视觉语言模型在端侧/机器人等资源受限场景中参数大、推理开销高的问题,指出冗余视觉token会干扰语言骨干的结构重要性估计。其核心做法是先用文本到视觉注意力筛除低价值视觉token,再按模块输出的Pearson相关性动态分配剪枝率,联合剪除注意力头和MLP通道。实验显示在LLaVA-1.5等模型上20%剪枝仍接近原始精度,并在多模态基准上优于既有结构化剪枝方法。

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning Figure 1
2026-08-05cs.CV

Beyond Simply Environment Scaling: Designing Effective Environment Distributions for Multimodal Agent Learning

Kejian Zhu, Zhuoran Jin, Dongqi Huang, Hongbang Yuan, Yupu Hao, Kang Liu, Jun Zhao

The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China, School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

2026-08-05视觉语言

论文指出,多模态智能体训练并非简单扩大环境池就能提升,混合环境会带来冗余、负迁移和梯度冲突,且多模态场景更严重。作者从环境分布的多样性与难度结构入手,提出基于元能力覆盖的 AES 环境选择,以及结合视觉辅助逐步削弱和状态规模递进的 HDC 课程。实验显示,用更少但更合适的环境可优于全量训练,AES+HDC 在多设置下取得 143.2% 平均相对增益。

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities Figure 1
2026-08-05cs.CV

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mianzhao Wang, Shengyong Chen

Engineering Research Center of Learning-Based Intelligent System (Ministry of Education), Engineering Research Center of Learning-Based Intelligent System (Ministry of Education) Tianjin University of Technology Tianjin China

2026-08-05视觉语言视觉感知

面向工业裂缝分割中传感器缺失和边缘算力受限的问题,Compass 将缺失模态适应从完整语义学习中解耦:用退化模拟双流互蒸馏和原型补全缓解语义坍塌,以 Needle RWKV 建模裂缝方向连续性,并用证据融合抑制不可靠模态。三数据集结果显示其在多种缺失场景达到 SOTA;在 CrackDepth 深度缺失 90% 时,以 2.58M 参数取得 F1 0.8216、mIoU 0.8434。

Test-Time Augmentation for Tabular-to-Image Classifiers under Distribution Shifts Figure 1
2026-08-05cs.CV

Test-Time Augmentation for Tabular-to-Image Classifiers under Distribution Shifts

Malena Loza, Felipe Grijalva, Eva Milara, Luis Bote-Curiel, Francisco J. Lara-Abelenda, David Chushig-Muzo

2026-08-05视觉感知

这篇论文关注表格数据转图像后在分布偏移下的鲁棒性问题,动机是现有 tabular-to-image 分类器虽能借用 CNN/ViT,但 OOD 表现缺少系统评估。作者将测试时增强引入该场景,比较 6 种编码器和 25 类增强策略,核心洞察是并非所有图像增强都适合表格图像:保持特征值与像素强度关系的几何、光度和复合增强更稳定,而直方图均衡、太阳化等频率/编码变换会破坏语义映射。实验显示 TTA 在 HELOC 等有效分布偏移下可提升 OOD 稳定性,复合策略取得较好鲁棒性-方差折中,但在 Voting 上增益有限。

S$^3$-Diff: Structural Semantic Synergy Diffusion Model for High Fidelity Super Resolution of Pathological Images Figure 1
2026-08-05cs.CV

S$^3$-Diff: Structural Semantic Synergy Diffusion Model for High Fidelity Super Resolution of Pathological Images

Jiaming Liang, QiHui Han, Guangye Ou, Jiawen Liu, Haolin Chen, Xi Zhong, Jiazhou Chen, Xiaoqi Sheng, Hongmin Cai

South China University of Technology, Affiliated Cancer Hospital of Guangzhou Medical University, Guangdong University of Technology, South China University of Technology School of Computer Science and Engineering Guangzhou China, South China University of Technology Software Engineering Guangzhou China, South China University of Technology School of Computer Science Guangzhou China, South China University of Technology Future Technology School Guangzhou China, Affiliated Cancer Hospital of Guangzhou Medical University Department of Radiology Guangzhou China, Guangdong University of Technology School of Computer Science and Technology Guangzhou China, South China University of Technology School of Future Technology Guangzhou China

2026-08-05视觉感知生成模型

针对低分辨率病理切片在存储、传输受限场景中常见但易丢失诊断形态的问题,S3-Diff将扩散超分与结构、语义约束结合:用SAM和风险先验构造样本级结构锚点,并用其调优DINOv3语义控制去约束去噪。实验称其在TCGA等数据上优于现有方法,LPIPS/ST-LPIPS最高提升约23%,且下游生存分析表现更好。

IRIS: Visual-Semantic Binding for Forgery-Resistant Watermarking of Diffusion Images Figure 1
2026-08-05cs.CV

IRIS: Visual-Semantic Binding for Forgery-Resistant Watermarking of Diffusion Images

Xiaoyan Feng, Zheng Gao, Tong Guan, Rui Bao, Bokang Zeng, Xiaoyu Li, Jiaojiao Jiang

2026-08-05视觉感知生成模型

扩散图像水印常与载体内容无关,容易被转移到伪造图像上。IRIS的关键做法是在生成末端先从干净图像的CLIP视觉语义读出内容码,再用密钥生成一次性环形水印并回放到低噪声DDIM步骤,同时用规范化保持对JPEG等处理稳定、对语义改动敏感。三组提示集上其TPR约0.99,PSNR 30.2、SSIM 0.92,并在伪造转移和再生成移除攻击中优于对比水印。

MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction Recognition Figure 1
2026-08-05cs.CV

MinerU.Chem: A High-Precision System for Optical Chemical Structure and Reaction Recognition

Haote Yang, Jiang Wu, Jingchao Wang, Xingjian Wei, Lixin Ma, Linye Li, Chen Zhu, Xiaolong Wu, Yuheng Lu, Ziran Zhu, Junyuan Gao, Lingli Ge, Yuan Xu, Huijie Ao, QianQian Wu, Dechen Lin, Huaiyu Gu, Lu Chen, Shengxin Lu, ShaSha Wang, Yuanyuan Cao, Zhejia Yu, Ruijie Zhang, Zimai Tian, Jiaxing Sun, Yinfan Wang, Jiahe Song, Chuang Wang, Yubin Wang, Rui Nie, Hao Zheng, Bowen Jiang, Hongbin Lai, Yifan He, Chengjin Liu, Tingting Zhang, Liqun Wei, Lijun Wu, Bin Wang, Yuqiang Li, Guangyu Wang, Wei Li, Bowen Zhou, Dahua Lin, Conghui He

Yuqiang Li1, Guangyu Wang1, Wei Li1, Bowen Zhou1, Dahua Lin1, Conghui He1 1Shanghai Artificial Intelligence Laboratory, 2East China Normal University, 3Tongji, University, 4Fudan University, 5East China University of Science and Technology, 6Beijing, University of Posts and Telecommunications, 7Shanghai Jiao Tong University, 8Jilin, University, 9Beihang University, 10South China Normal University, 11Peking University, Northwestern Polytechnical University, The system has been integrated into the MinerU online platform and is available at MinerU., structure depictions encode atom connectivity, visual layout, atom and group labels, stereochemical

2026-08-05视觉感知

有机化学文献中的分子结构和反应路线常以图像、表格呈现,通用解析难以转成可追踪的机器可读数据。MinerU.Chem在MinerU管线中加入化学相关性过滤、结构检测、标识符抽取、基于CARBON的结构识别和反应解析,兼顾图像布局与复杂化学语义,并导出MolFile/SMILES。在MolRecBench-Wild可评测子集上SMILES精确匹配率达93.02%,高于文中最佳对比GPT-5.6-Sol的74.87%。

GVCCTurbo: Rate-Compute Quality Scheduling for Codebook Driven Generative Compression Figure 1
2026-08-05cs.CV

GVCCTurbo: Rate-Compute Quality Scheduling for Codebook Driven Generative Compression

Ziyue Zeng, Dingjie Peng, Xun Su, Hiroshi Watanabe

2026-08-05生成模型

本文针对生成式压缩中“采样步数、码率和计算量”被绑定的问题:缩短生成器调用虽省时,却会减少携带目标信息的码本校正。GVCCTurbo将先验刷新与有限码率校正解耦,用BPP驱动轨迹长度和刷新周期调度,无需重训模型或码本。720p实验中先验评估从20次降至9次,解码时间约降44%,但高运动内容有小幅LPIPS代价,且时序指标与跨协议泛化文中未充分说明。

Detecting Pose Estimation Failures via Keypoint Self-Consistency Figure 1
2026-08-05cs.CV

Detecting Pose Estimation Failures via Keypoint Self-Consistency

Robin Chan

∗ Work done while visiting researcher in CVLab at EPFL in Lausanne.

2026-08-05三维

这篇论文针对关键点式 6D 位姿估计中单个关键点误差会经 PnP 放大、却缺少可靠失败预警的问题,提出用2D关键点之间的几何自一致性来判别估计是否失效。方法以成对距离、重投影一致性及可选渲染/掩码一致性构造手工特征,再用逻辑回归输出失败概率。LINEMOD Occluded 上结果显示其优于关键点置信度和 conformal prediction 基线,且无渲染特征版本已接近完整模型,说明主要信号来自轻量几何一致性。

How Many Labels Are Enough? ALDA: Active Learning Deployment Advisor for Medical Image Classification Figure 1
2026-08-05cs.CV

How Many Labels Are Enough? ALDA: Active Learning Deployment Advisor for Medical Image Classification

Julia Machnio, Mads Nielsen, Mostafa Mehdipour Ghazi

2026-08-05视觉感知

医疗影像主动学习在落地时常要先选采样策略,但不同数据集和预算下策略排名不稳定,选错反会增加标注成本。ALDA的核心不是提出新采样方法,而是用短期试点拟合各策略学习曲线,判断能否达到临床阈值、估计所需标签数,并用部署窗口衡量阈值不确定性风险。四个医学分类任务显示,它可用15%至30%预算预测较优策略,相比较差选择最多节省82%标注成本。

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology Figure 1
2026-08-05cs.CV

From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology

Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muhammad Muzammal Naseer, Sajid Javed

2026-08-05视觉感知

针对病理全切片模型多依赖单一分辨率、难同时捕捉细胞细节与全局组织结构的问题,论文提出 MRPT,用相邻分辨率交叉注意力和层级自监督把细胞、patch、区域到 WSI 表征串联起来,并扩展为 MRPT-LLaVA。模型在 34 个数据集的癌症分型、组织表型和 WSI 问答上超过既有基础模型与多模态大模型,但部分增益可能主要来自 scaling / data。

Principles of Robot Autonomy Figure 1
2026-08-05cs.RO

Principles of Robot Autonomy

Daniele Gammelli, Joseph Lorenzetti, Katie Luo, Gioele Zardini, Marco Pavone

This material will be published by Cambridge University Press as Principles of Robot Autonomy by Daniele Gammelli, Posted on arXiv with the written permission of Cambridge University Press. The definitive version will be published, by Cambridge University Press.

2026-08-05机器人

面向自驾、无人机、腿足和空间机器人等在不确定环境中不能依赖人工逐项干预的问题,本文将机器人自主性界定为感知-决策-行动闭环,并用 See-Think-Act 统一传统模型化算法与学习式端到端方法。主要结果是一套覆盖运动规划与控制、感知、定位建图、决策与强化/模仿学习的系统化教材框架,配套可交互 Python 练习;具体性能增益文中未充分说明。

Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation Figure 1
2026-08-05cs.RO

Lightweight 3D Object Detection via Mamba-Based Knowledge Distillation

Quoc Cuong Ninh, Huy Xuan Pham, Anh Tung Nguyen, Dinh Hoan Trinh

2026-08-05视觉感知三维

面向自动驾驶和机器人端侧部署,本文针对 LiDAR 三维检测模型计算量高、轻量学生模型精度易下降的问题,提出多分支 Mamba 教师骨干,并用框感知的体素空间特征对齐和 Mamba 投影模块进行知识蒸馏。实验在 nuScenes 和真实数据上显示,学生模型能显著降低模型规模与推理延迟,同时保持接近教师和主流方法的检测精度。

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution Figure 1
2026-08-05cs.RO

Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution

Weichen Xu, Zhenhua Liu, Lin Luo, Yaobo Liang, Chengtang Yao, Qingyu Mei, Jian Cao, Xixin Cao, Xing Zhang, Jiaolong Yang, Baining Guo

2026-08-05强化学习

这篇论文针对分块式 VLA 固定执行 horizon 容易错过关键操作前重规划时机的问题,指出成败不只取决于步长而取决于边界是否落在精细阶段前。作者提出 BCP,把 horizon 选择拆成连续的“继续/重规划”伯努利决策,并用轨迹级强化学习和兼顾成功率与调用成本的奖励训练冻结 VLA 的轻量头。在 RoboTwin 2.0、LIBERO 和真实机器人上均提升成功率,低成功任务和真实任务增益尤其明显。

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification Figure 1
2026-08-05cs.CV

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

2026-08-05数据集/基准三维

这篇论文针对现有 UI 代码生成基准偏重单轮整页复刻、难以评估真实迭代编辑的问题,提出 MT-Web2Code,用反向污染轨迹构造多轮区域重建与局部修改任务,并同时评估目标区域还原和非目标内容保持。对 13 个前沿代码智能体的实验显示,它们在缺失区域重建、细粒度视觉-代码对齐和多轮一致性上仍明显不足,早期错误会在后续轮次中放大。

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding Figure 1
2026-08-05cs.CV

Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

University of Chinese Academy of Sciences, Beijing, China, State Key Laboratory of Communication Content Cognition, Beijing, China, Peng Cheng Laboratory, Shenzhen, Guangdong, China, National University of Singapore, Singapore

2026-08-05视觉语言生成模型

本文针对生成式视觉定位中坐标被当作孤立符号、难以表达数值邻近和轴语义的问题,提出 Hi-Token:将每个归一化坐标拆成带轴信息的百/十/个位 token,以更密集的监督和粗到细结构改善坐标生成;同时用 Hi-GAR 在训练中引入多尺度几何奖励。实验显示该方法在 RefCOCO 系列和三种 VLM backbone 上提升 mIoU 与多档 IoU 精度,Hi-R1 多数指标超过强专用基线,但层级拆分、轴词表和词表规模各自贡献仍未充分拆开。

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs Figure 1
2026-08-05cs.MM

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

Harbin Institute of Technology, Shenzhen, Tsinghua Shenzhen International Graduate School, Tsinghua University, Peng Cheng Laboratory, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Harbin Institute of Technology, Shenzhen Shenzhen China, Tsinghua Shenzhen International Graduate School, Tsinghua University Shenzhen China, Peng Cheng Laboratory Shenzhen China, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences Shenzhen China

2026-08-05视觉感知

论文针对多模态推理中显式 CoT 代价高、易引入视觉幻觉,以及免训练潜在推理用熵切换不稳定的问题,指出熵会混淆视觉感知歧义与逻辑不确定性。其核心是用视觉到文本注意力比判断当前解码更偏感知还是推理,并在感知 token 上走连续潜空间、推理 token 上保留显式生成。实验称该免训练 AGS 在多类模型和基准上提升准确率、减少幻觉,并降低自回归步数与延迟。

A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition Figure 1
2026-08-05cs.RO

A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition

Nitin Kumar Singh, Arie Rachmad Syulistyo, Yuichiro Tanaka, Hakaru Tamukoh

2026-08-05视觉感知

这篇论文针对深度学习手语识别训练开销高、难以上边缘设备的问题,用 MediaPipe 提取手部与姿态关键点,再以结合深层与双向结构的混合 reservoir computing 建模时序,最终只训练岭回归读出层。在 WLASL100 上取得 Top-1 61.12%、Top-5 86.05%、Top-10 92.56%,训练时间降至数秒;但与深度模型的公平性和具体增益来源文中未充分说明。

Stop Replacing Noise with Noise: Two-Source Reliability Assessment for Label Correction and Sample Reweighting in Label-Noise Learning Figure 1
2026-08-05cs.LG

Stop Replacing Noise with Noise: Two-Source Reliability Assessment for Label Correction and Sample Reweighting in Label-Noise Learning

Wenxiao Fan, Kan Li

2026-08-05视觉感知

这篇论文针对噪声标签学习中“降低原标签权重就自动提高伪标签权重”的隐含耦合,指出伪标签也可能继承已吸收的噪声偏差。作者提出 TRACE,分别用损失、浅层关系稳定性和预测一致性评估原标签,用置信度独立评估伪标签,再进行校正与重加权。实验显示其可作为插件提升多种 refurbishment 基线,在合成、人标和真实噪声数据上提高准确率与伪监督可靠性。

Dual-domain U-Nets with embedded back projection operators for motion-resolved 4D CBCT reconstruction Figure 1
2026-08-05cs.CV

Dual-domain U-Nets with embedded back projection operators for motion-resolved 4D CBCT reconstruction

Ivo Herzig, Pascal Paysan, Daniel Barco, Marc André Stadelmann, Frank-Peter Schilling, Igor Peterlik, Michal Walczak, Lijin Aryananda, Woo Sang Ahn, Rudolf Marcel Füchslin, Lukas Lichtensteiger

2026-08-05三维

针对胸部放疗中4D CBCT采集时间长、剂量高且易受呼吸运动造成条纹伪影的问题,论文提出双域U-Net:编码器在投影域处理,解码器在体域重建,并用非训练反投影算子替代跳连,从常规自由呼吸扫描直接预测静态体数据和10相DVF,无需呼吸信号或分箱。模拟测试指标与SART-TV基本持平,临床专家更常偏好其肿瘤和食管可见性,并显示动态结构更清晰、运动伪影减少。

SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing Figure 1
2026-08-05cs.CV

SLAMFormer-$\infty$: Infinite SLAM Transformer for Unbounded Frontend and Backend Processing

Zhijian Fang, Weicheng Zheng, Yijun Yuan, Weibang Wang, Zhuoguang Chen, Chang Sun, Junhao Huang, Kenan Li, Minghui Qin, Hang Zhao

IIIS, Tsinghua University

2026-08-05学习理论

该文针对现有学习式单目 SLAM 在长距离场景中受训练尺度、有限上下文和“只优化位姿不改几何”限制的问题,提出用记忆条件定义可变坐标系的 SLAMFormer-∞,并通过 PGGO 在同一 Transformer 内联合细化长程轨迹与稠密几何。实验显示其在大规模数据集上重建质量更好、定位表现有竞争力,并能处理超过 17 km 的城市序列。

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet Figure 1
2026-08-05cs.CV

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

University of Ioannina, Department of Medical Physics, School of Medicine, University of Patras, Computational BioMedicine Laboratory, & Biomedical Research Institute

2026-08-05视觉感知

针对饮食记录依赖人工回忆且细粒度菜品识别易受外观变化、相似菜式和组合餐影响的问题,OliveGemma在开源PaliGemma-2-3B上用LoRA适配地中海与欧洲菜品,将三套数据统一为216类并构造指令问答监督,只更新0.78%参数。三折实验中Top-1达92.96%,高于DenseNet-121约7.31个百分点,并显著超过多种零样商业VLM;但增益可能主要来自领域数据与封闭词表设定。

SGFormer: Structure-Guided Transformer for Robust Local Feature Matching Figure 1
2026-08-05cs.CV

SGFormer: Structure-Guided Transformer for Robust Local Feature Matching

Runyu Zhu

2026-08-05安全鲁棒

SGFormer针对LoFTR类无检测匹配在大视角变化下注意力发散、把高置信匹配分配到非重叠区域的问题,引入结构引导Transformer和TSA模块,用浅层局部结构线索调制全局注意力,使特征更集中于重叠区域的显著结构。实验在MegaDepth-1500达到98.2%平均匹配准确率,并在HPatches和Aachen-Day-Night上显示较强鲁棒性。

HyperbolicDiffusion: Sharp & Scalable Tiled Generation on the Hyperbolic Plane Figure 1
2026-08-05cs.CV

HyperbolicDiffusion: Sharp & Scalable Tiled Generation on the Hyperbolic Plane

Hugo Caselles-Dupré

2026-08-05生成模型

这篇论文针对平面拼接式扩散难以直接生成可导航双曲平面内容的问题:双曲面积随半径指数增长,窗口布局和多窗口交界模糊都会迅速恶化。作者提出无需训练的 HyperbolicDiffusion,用 HBC 将覆盖规划化为按环动态规划,并用永久 surface ID 共享潜空间,再对高重叠交界区重噪修复。实验显示 294 组布局无空洞、平均 0.45 秒规划,窗口数在部分设置中距最优 10% 内,修复阶段提升边缘清晰度并改善重投影视角一致性。

Multi-Task Multi-Frame Visual Piano Transcription Figure 1
2026-08-05cs.SD

Multi-Task Multi-Frame Visual Piano Transcription

Yonghyun Kim, Hoyeol Sohn, Juhan Nam, Alexander Lerch

2026-08-05视觉感知

本文针对音频钢琴转录在延音踏板下难以定位真实松键、既有视觉方法偏重短窗 onset 且 offset 与力度不足的问题,提出 V2N:用 1 秒视频上下文、逐帧监督和 onset/offset/key hold/velocity 多任务头直接建模琴键物理状态,并用 offset 引导解码。消融表明多任务与更长时序上下文同时改善 onset、释放与力度预测,在 PianoVAM 和 R3 上达到视觉钢琴转录新 SOTA;跨数据集迁移仍失败,限制主要来自固定几何预处理。

Earth Embeddings Figure 1
2026-08-05cs.CV

Earth Embeddings

Adam J. Stewart, Heng Fang, Isaac A. Corley, Xiao Xiang Zhu

Chair of Data Science in Earth Observation, Technical University of Munich, Munich, Germany, KTH Royal Institute of Technology, Stockholm, Sweden

2026-08-05视觉感知

论文关注地球观测从“用户自行运行基础模型”转向可复用嵌入产品的需求,指出用位置、图像块或像素向量替代反复处理海量卫星影像可降低下游成本。核心贡献是系统梳理隐式位置嵌入、显式块级和像素级嵌入,并比较覆盖、分辨率、存储、许可与可复现性。文中结论较谨慎:嵌入在土地覆盖、作物和空间预测中证据最强,语义搜索仍缺基准,时序变化任务评估不足。

Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and Region Figure 1
2026-08-05cs.CV

Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and Region

Sanayya, Rakshith Sathish, Ashwathi Nambiar

2026-08-05视觉感知

这篇论文针对卫星道路提取在跨地区、跨传感器和不同分辨率下易断裂、泛化差的问题,将其视为持续适应而非单纯换网络结构。方法用高分辨率教师到低分辨率学生的课程式知识蒸馏,结合多传感器训练和拓扑感知损失,训练单一模型覆盖0.3至1.0米影像;在City-Scale和Global-Scale等基准上最高提升22个F1点、15个APLS点,并宣称推理快3倍。

SRAP: SVD-Refined Adversarial Perturbations for Imperceptible Face-Swap Defense Figure 1
2026-08-05cs.CV

SRAP: SVD-Refined Adversarial Perturbations for Imperceptible Face-Swap Defense

Sungwon Cho, Kwanghyun Ko, Myungjoo Kang

Department of Mathematical Sciences, Seoul National University

2026-08-05视觉感知

这篇论文面向人脸换脸滥用前的主动防护,关注传统 PGD 扰动虽能破坏身份特征、却容易在背景和高频成分上产生可见噪声的问题。SRAP 的核心洞察是后部奇异分量更富含高频伪影,而身份敏感区域才更有防御价值,因此在优化中结合逐通道截断 SVD 与身份重要性掩码。实验在 CelebA-HQ 和 VGGFace2-HQ 上显示,其在保持竞争性身份扰乱效果的同时提升受保护图像保真度,但评估主要限于 SimSwap 等设置。

FreqAdapt: Frequency-Adaptive Processing for RAW Object Detection Figure 1
2026-08-05cs.CV

FreqAdapt: Frequency-Adaptive Processing for RAW Object Detection

Hanxi Li, Huiling Li

University of Science and Technology China, 2 Li Auto Inc, 3 Hunan University

2026-08-05视觉感知

这篇论文针对传统 sRGB/ISP 流程会压缩 RAW 传感器信息、在低光和恶劣天气下影响检测的问题,提出 FreqAdapt:将白平衡、伽马等强度操作映射到傅里叶幅度域,将颜色校正、锐化等结构操作放到相位相关分支,并用频域编码器自适应预测参数。实验声称在多种 RAW 检测数据集上以更少参数取得 SOTA,但摘要级片段未给出具体数值。

Residual Flow Matching with Dynamic Cross-Interaction for 3D Multi-Person Motion Prediction Figure 1
2026-08-05cs.CV

Residual Flow Matching with Dynamic Cross-Interaction for 3D Multi-Person Motion Prediction

Wei Wei, Yinyuan Zhao, Ruixuan Yu

2026-08-05生成模型三维

这篇论文针对多人3D动作预测中“从纯噪声生成骨架”易破坏结构、早期跨人交互会传播噪声的问题,提出先用确定性粗预测提供运动锚点,再对残差做Flow Matching,并用随ODE积分进程增强的动态跨人交互来抑制早期伪相关。实验称在多个多人动作基准上达到SOTA精度,但具体增益在多大程度来自残差建模、交互门控或架构容量仍需看消融细节。

DRPFNet: Dual-domain Residual Progressive Fusion Network for RGB-Thermal Object Detection Figure 1
2026-08-05cs.CV

DRPFNet: Dual-domain Residual Progressive Fusion Network for RGB-Thermal Object Detection

Zian Wang, Changchun Li

College of Computer Science and Technology, Jilin University, China

2026-08-05视觉感知

本文针对 RGB-T 目标检测中多尺度融合彼此孤立、融合到检测缺少反向细化、且忽视 RGB/热红外频域互补的问题,提出 DRPFNet:用 MRF-BFE 做跨尺度残差累积与双向增强,DFAF 分离 RGB 高频边缘和热红外低频结构,EGMK 用边缘引导检测增强。文中称其在两个公开 RGB-T 数据集上取得有竞争力的精度与效率,但具体增益来源仍需结合消融细看。

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models Figure 1
2026-08-05cs.CL

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

Xiaolin Chen, Xuemeng Song, Wenhao Shi, Xianjing Han, Mong-Li Lee, Wynne Hsu

2026-08-05视觉语言数据集/基准

这篇论文针对现有视觉情感理解默认情绪感知具有普遍性、忽视文化差异的问题,提出文化条件视觉情感理解任务,并构建 ArtECulture 基准,覆盖英中阿三种文化、6792 幅艺术图像及文化级情绪解释。实验显示 16 个 MLLM 零样本表现均不理想,最佳准确率低于 50%,且普遍呈现英语中心偏置;其训练-free 检索增强方法通过文化情绪知识库提升了预测与解释质量。

Can Text-to-Image Models Draw from the Right Frame of Reference? Figure 1
2026-08-05cs.CV

Can Text-to-Image Models Draw from the Right Frame of Reference?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

2026-08-05视觉感知

本文针对文生图中方向词常被默认按相机视角理解、难以遵循物体自身参考系的问题,提出 FoR-T2I 基准,用成对 Cam/FoR 提示隔离参考系混淆,并分层评估单步、多关系和链式方向转换。22 个模型在 FoR 提示上平均准确率显著低于 Cam,最佳也仅 44.3%;VLM 门控改写只将平均 FoR 准确率从 25.0% 提至 29.2%,说明问题尚未被提示工程充分解决。

When Oracle Conditioning Misleads Deployment: Conditioning-Availability Bias in Echocardiographic Segmentation Figure 1
2026-08-05cs.CV

When Oracle Conditioning Misleads Deployment: Conditioning-Availability Bias in Echocardiographic Segmentation

Dang P. M. Cao, Hieu D. Pham, Hieu Pham

2026-08-05视觉感知

本文关注条件分割模型在评测时使用“oracle”辅助信号、部署时只能使用估计信号所造成的可用性偏差。作者提出 oracle-估计与 oracle-随机两类 Dice 差距,用于区分真实部署路径损失和对条件信号的潜在脆弱性。CAMUS 上出现估计相位导致的严重崩溃,EchoNet 上估计路径尚可但随机相位暴露强敏感性;部署感知选点和相位扰动可缩小差距,但 EF 误差与偏差未必同步恢复。

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference Figure 1
2026-08-05cs.CV

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

Shanghao Liu, Renze Chen, Size Zheng, Yuanqiang Liu, Yun (Eric) Liang, Hailong Yang

Beihang University, Peking University

2026-08-05视觉感知生成模型

视频扩散 Transformer 在高分辨率长视频上受自注意力二次复杂度限制,推理成本高。SPADE 的关键在于把静态、半静态和动态稀疏统一为 vDiT-SSR 表达,并用 SICS 做按输入、按注意力头的分块方案选择,再配合低开销索引、Flash 块稀疏注意力和 kernel grouping 执行。实验在 Hunyuan-Video 与 Wan 2.1/2.2 的 T2V/I2V 上显示,注意力加速约 2.26–3.40 倍、端到端约 1.49–1.80 倍,同时基本保持生成质量。

PolyLayout: Multi-room Manhattan Layout Estimation Figure 1
2026-08-05cs.CV

PolyLayout: Multi-room Manhattan Layout Estimation

Gustav Hanning, Shaohui Liu, Rémi Pautrat, Marc Pollefeys, Kalle Åström, Viktor Larsson

2026-08-05视觉感知

多视角室内布局估计常受限于单房间、长方体假设和跨数据集泛化不足,难以服务复杂建筑感知。PolyLayout将房间表示为曼哈顿3D多边形,用神经网络学习优化目标,同时保留显式投影与多边形更新,并在多房间间共享方向、地面和天花板高度,迭代拆分/合并墙面拓扑。论文在新增合成与真实多房间基准上显示,其准确性和鲁棒性均优于Plane-DUSt3R、PixCuboid等方法。

LocAnyMed: Vision-Language Grounding for Multimodal Medical Images Figure 1
2026-08-05cs.CV

LocAnyMed: Vision-Language Grounding for Multimodal Medical Images

Zihan Wang, Tong Liu, Zhiwei Wang, Tao Huang, Wentao Jiang, Sihan Ma, Shanshan Ye, Xiaohui Yang, Jing Zhang

2026-08-05视觉语言视觉感知

该文针对通用视觉定位模型难以处理低对比、弱边界且跨模态差异显著的医学图像问题,构建约20万条 CT、光学、超声和 X 光统一 grounding 数据,并在 LocateAnything-3B 上做全参微调,引入模态共享/专属视觉专家及2万条解释型 CoT 子集。主要结果是 F1@IoU 0.50 从10.64提升到85.59,但增益可能主要来自 scaling / data,专家结构的独立贡献需看消融细节。

Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging Figure 1
2026-08-05cs.LG

Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

Siming Fu, Zheming Fu, Ruizhe He, Hualiang Wang, Jie Huang, Xiaoxiao Ma, Mingchen Zhong, Weihu Huang, Xiaoxuan He, Haojun Xu

2026-08-05生成模型强化学习

这篇论文针对跨模型族蒸馏中教师与学生不共享 VAE、架构和噪声时间表的问题,指出传统潜变量或像素回归会因表示空间和时间对齐失配而失效。Any-OPD 将教师仅作为黑盒采样器,用冻结 DINOv2 表征比较双方解码图像,并按连续噪声水平对齐轨迹,配合学生 VAE 重编码的锚定阶段。实验把 12B FLUX.1-dev 蒸馏到 2.5B SD3.5-Medium,PickScore 从 0.846 升至 0.884,HPSv3 从 9.12 升至 10.97,直接 latent 回归则训练崩溃。

Recurrent Contrastive Learning for Imbalanced Medical Image Classification Figure 1
2026-08-05cs.CV

Recurrent Contrastive Learning for Imbalanced Medical Image Classification

Zhiyuan Zhu, Xinling Meng, Junxuan Yu, Jiongquan Chen, Qiongying Ni, Tuhang Shao, Yuhao Huang, Luping Zhou, Ruiyang Huang, Yuxue Wang, Rongliang Zhang, Xue Wang, Tianhong Tang, Likun Wang, Junbo Chen, Yong Jiang, Yongping Lu, Xin Yang

2026-08-05视觉感知

针对医学影像中罕见疾病样本少、尾类特征易被头类挤压的问题,论文提出 RCL:用 DINOv3+LoRA 提取特征,并通过跨训练阶段的 Temporal Memory Queue 构造 Temporal Anchors,主动扩展尾类潜在支撑区域。实验在私有颈动脉数据、KneeOA 和 APTOS 2019 上相对强基线取得一致提升,但手工超参数依赖仍是限制。

PLS-Calib: A Partial Least Squares Framework for Event Camera and Odometry Calibration under Ground Motion Constraints Figure 1
2026-08-05cs.RO

PLS-Calib: A Partial Least Squares Framework for Event Camera and Odometry Calibration under Ground Motion Constraints

Guangyu Li, Xiao Li, Yujie Wu, Changshuo Wang, Prayag Tiwari, Jiang Cai, Fangwen Yu, Mingkun Xu

2026-08-05优化算法

这篇论文针对地面机器人难以进行完整 6-DoF 激励、导致事件相机与里程计外参旋转标定不稳定的问题,提出用偏最小二乘回归替代 CCA 的相关性白化步骤,在潜变量空间建模异步传感器运动关联,并结合极性增强时间表面提升圆形靶标检测。合成与真实实验显示其在受限平面运动下比 CCA 和神经标定基线更稳、更准。

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates Figure 1
2026-08-05cs.CV

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

Jinya Sakurai, Shueicheng Yan, Xun Xu

2026-08-05视觉感知安全鲁棒

针对文本到图像模型在对抗或隐晦提示下仍会生成裸露、受保护 IP 或特定风格的问题,论文提出 T2S2:不改模型权重,而是在扩散过程中读取中间干净图像估计,用稀疏边界目标检测违规概念,并在首次违规时通过截断反传优化文本条件中的低秩残差。实验在 SD v1.4/v3.5 上显示,其在裸露移除、IP 抑制和风格擦除中较 SLD、SAFREE 等更好平衡抑制与保真,且安全样本延迟基本稳定。

3DGSI-Assessor: A Large-Scale Dataset and An LMM-based Method for 3D Gaussian Splatting Image Quality Assessment Figure 1
2026-08-05cs.CV

3DGSI-Assessor: A Large-Scale Dataset and An LMM-based Method for 3D Gaussian Splatting Image Quality Assessment

Yuke Xing, Jiarui Wang, William Gordon, Zhu Li, Guangtao Zhai, Yiling Xu

Yuke Xing, Jiarui Wang, Guangtao Zhai and Yiling Xu are with the School of Information Science and Electronic Engineering

2026-08-05视觉感知数据集/基准三维

针对3DGS压缩带来的漂浮、表面散射以及几何与颜色失真可分离的问题,论文构建3DGS-IEval-15K+,用1.52万张图和三维度MOS标注支撑细粒度IQA;并提出结合全局语义与局部几何/颜色特征的LMM评估器,一次预测整体、几何、颜色质量。实验显示其在该数据集上优于30余种IQA指标,并在其他NVS基准上具备一定泛化能力。

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs Figure 1
2026-08-05cs.CV

GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs

Zichuan Fu, Shirong Wang, Wenlin Zhang, Guojing Li, Yimin Deng, Jingtong Gao, Junjia Qi, Hanyu Yan, Yefeng Zheng, Xiaopeng Li, Wanyu Wang, Xian Wu, Xiangyu Zhao

2026-08-05视觉语言三维

GUI-Lens针对高分辨率、密集GUI中VLM能识别目标却难以精确点击的问题,将一次性坐标预测改为由模型主动选择区域与尺度的粗到细裁剪,并结合OCR/组件坐标提示和视觉验证来降低早期定位误差传播。四个GUI grounding基准、三类通用VLM上的实验显示,整体准确率最高提升24.9个百分点,GPT-5.5后端达到ScreenSpot-Pro的SOTA。

Efficient Video Dataset Distillation via Cluster-Guided Prototype Blending Figure 1
2026-08-05cs.CV

Efficient Video Dataset Distillation via Cluster-Guided Prototype Blending

Chongle Ren, Guang Li, Wenbo Huang, Naoki Saito, Takahiro Ogawa, Miki Haseyama

2026-08-05视觉感知数据集/基准

视频数据集蒸馏在动作识别中受时序维度拖累,传统合成样本需反复梯度优化,构建成本高。ProtoBlend的核心思路是不用优化存储视频,而由教师模型筛选高置信片段、按特征聚类分配类内名额,再将原型与锚样本混合并同步混合软标签。实验覆盖MiniUCF、HMDB51、Kinetics-400和Something-Something V2,显示其在精度与构建效率之间更均衡,但主要增益相对各组件和教师质量的来源仍需结合消融判断。

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation Figure 1
2026-08-05cs.MM

Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation

Leiye Liu, Miao Zhang, Jiahong Jiang, Jingjing Li, Jialong Zhong, Kai Peng, Tingwei Liu, Wei Ji, Yongri Piao, Huchuan Lu

Dalian University of Technology, Carnegie Mellon University, Yale University, Dalian University of Technology Dalian Liaoning China, Carnegie Mellon University Pittsburgh Pennsylvania USA, Yale University New Haven Connecticut USA

2026-08-05视觉感知

这篇论文面向音视频实例分割中混合声源难以对应到具体视觉实例、音画状态不同步导致跟踪断裂的问题,提出 H2S:用 ASP 将混合音频解耦并从语义到空间建立层级匹配,用音频调制的 Mamba/ADM 动态调整状态更新。AVISeg 上以 ResNet50 达到 48.54 mAP,较此前最佳提升 7.8%。

NanoMorph-3D: An End-to-End Physics-Driven Unrolling Framework for Nanomaterial Reconstruction Figure 1
2026-08-05cs.CV

NanoMorph-3D: An End-to-End Physics-Driven Unrolling Framework for Nanomaterial Reconstruction

Beiyuan Zhang, Hesong Li, Ziqi Wu, Ruiwen Shao, Ying Fu

Beijing Institute of Technology, Beijing Institute of Technology Beijing China

2026-08-05三维

这篇论文针对电子断层成像中有限角采集导致的 missing wedge、噪声和复杂纳米拓扑失真问题,提出将近端梯度下降展开为物理约束网络,并用层次注意力、Physics-Normalization 与双域正弦注意力显式建模投影轨迹和 sinogram 一致性;实验称其在多类纳米形貌上取得更高保真度和更快重建,但具体增益有多少来自合成数据规模仍需进一步核实。

Clarity Contrast and Similarity Selection for Multi-Focus Image Fusion Figure 1
2026-08-05cs.CV

Clarity Contrast and Similarity Selection for Multi-Focus Image Fusion

Yicheng Zhang, Haoyou Deng, Zhiqiang Li, Wenti Yin, Nong Sang, Changxin Gao

2026-08-05视觉感知

这篇论文针对多焦点图像融合中深度方法缺少源图像显式交互、边界区域易模糊或产生伪影的问题,提出 CSNet:用清晰度对比注意力在源图像间互相增强清晰特征、抑制模糊特征,并用相似性选择策略处理离焦扩散影响下的边界像素。实验声称在四个基准上较现有方法取得更好的指标和视觉质量。

CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment Figure 1
2026-08-05cs.CV

CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment

Jing Dai, Qibin Zhang, Weiwei Zhou, Mingde Xu, Jingsong Liu, Jingdong Zhang, Hongming Xu

2026-08-05视觉感知

该文针对癌症生存预测中临床表格信息因离散、稀疏、低维而难以与病理全切片和基因组数据融合的问题,提出 CIGTSurv:先把年龄、分期、TNM 等临床变量转写为整体文本并用 BiomedBERT 编码,再以临床信息为锚,通过局部原型关联和 MMD 全局特征对齐缓解模态异质性。五个 TCGA 癌种实验显示其达到优于既有多模态基线的生存预测表现。

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis Figure 1
2026-08-05cs.CV

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

Zhejiang University, Westlake University, Harbin Institute of Technology, Hangzhou Dianzi University, Zhejiang University Hangzhou China, Westlake University Hangzhou China, Harbin Institute of Technology Shenzhen China, Hangzhou Dianzi University Hangzhou China

2026-08-05视觉感知

皮肤影像诊断中,皮肤镜与临床照片的概念体系、粒度和语义不一致,使可解释概念瓶颈模型难以跨机构迁移和支持医生干预。UniCon用统一概念原型码本建立共享语义空间,并以开放语言的多面语义描述和可靠性门控聚合连接诊断与干预。实验显示其在保持较高诊断准确率的同时,可桥接不同临床概念体系并实现跨站点概念干预。

Self-Supervised Representation-Guided Generative Dataset Distillation Figure 1
2026-08-05cs.CV

Self-Supervised Representation-Guided Generative Dataset Distillation

Mingzhuo Li, Guang Li, Linfeng Ye, Jiafeng Mao, Takahiro Ogawa, Konstantinos N. Plataniotis, Miki Haseyama

2026-08-05生成模型数据集/基准

这篇论文针对数据集蒸馏从“随机初始化训练”转向“冻结自监督预训练编码器+轻量头”后的目标错位:合成样本需要保留预训练表征空间的类内外几何。SRG用真实图像SSL特征构造类原型,并在扩散采样中先用最近真实样本潜变量锚定视觉真实性,后用原型对齐、类间区分和类内分配引导表征。实验显示其在多数据集和IPC设置下优于生成式基线,并具备跨编码器迁移,但依赖ImageNet预训练生成器限制了适用域。

iFAN: Inference-Aware Learning for Plain Mask Transformers Figure 1
2026-08-05cs.CV

iFAN: Inference-Aware Learning for Plain Mask Transformers

Fang Li, Yu He, Haoyang Tong, Lichen Ma, Jingling Fu, Wenxiao Fan, Tongxuan Liu, Luohang Liu, Ke Zhang, Junshi Huang

2026-08-05视觉感知

论文针对 plain mask transformer 训练与推理不一致的问题:最高概率-掩码分数的 query 未必给出最佳掩码,且最终层可能丢掉中间层更好预测。iFAN 通过 APMR 引入掩码质量校准和跨 query 排名抑制高置信错误竞争者,并用 CLSD 将中间层优势蒸馏到最终层;这些目标仅用于训练。COCO、ADE20K、Cityscapes 上平均提升 1.20 PQ、1.30 AP、0.63 mIoU,几乎不增加推理开销。

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction Figure 1
2026-08-05cs.CV

CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction

Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren

2026-08-05视觉感知强化学习

本文针对 Mother–Child ERCP 中双内镜视角独立运动、信息不对称导致单流世界模型难以预测未来的问题,提出 CrossScope:保留两路专属专家,并用几何引导的定向残差路由,让 Mother 视角提供 Child 运动线索,Child 外观仅在空间对齐有效时反哺 Mother。作者还构建同步幻体与真实双视角基准,实验显示其在画面保真、结构保持、目标定位和运动一致性上优于强视频生成基线。

DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack Figure 1
2026-08-05cs.CV

DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

Hoseong Tae, Jong-Seok Lee

School of Integrated Technology, Yonsei University

2026-08-05生成模型

论文针对流匹配 VLA 被认为较抗对抗扰动的现象,指出既有攻击忽略了多步去噪 ODE。DRIFT 将通用物理贴片放在机械臂夹爪视野中,直接扰动去噪速度场,并发现只攻击第一步比攻击多步更强且更省,原因是输入空间梯度冲突。在 π0、π0.5 和四个 LIBERO 套件上,小贴片几乎破坏所有原本可完成任务,显著强于动作空间和嵌入空间基线。

Bridging Online and Offline Handwriting via Differentiable Physical Rendering Figure 1
2026-08-05cs.CV

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

2026-08-05视觉感知

这篇论文针对手写生成中轨迹模型可执行但缺少纹理、图像模型逼真但丢失笔顺的问题,引入六参数物理笔刷模型和可微渲染器,把笔画运动映射到像素外观,并结合文本到轨迹生成、风格参数观测与扩散细化形成统一框架。实验和机器人书法演示显示其能同时生成结构一致的手写图像和可直接执行的轨迹,但真实工具参数迁移仍需额外标定。

CRIL-U-Net: Compact Ratio-Interaction Learning for Focal Cortical Dysplasia Segmentation from T1w and FLAIR MRI Figure 1
2026-08-05cs.CV

CRIL-U-Net: Compact Ratio-Interaction Learning for Focal Cortical Dysplasia Segmentation from T1w and FLAIR MRI

Soumen Ghosh, Amit Soni Arya, Tilottama Goswami, Subhojit Mandal, John Phamnguyen, Rajat Vashistha

The University of Queensland, Bennett University, University College of Engineering, Osmania University, The University of Queensland Brisbane Australia, Bennett University Greater Noida India, University College of Engineering, Osmania University Hyderabad India, Royal Brisbane and Women’s Hospital The University of Queensland Brisbane Australia

2026-08-05视觉感知

这篇论文针对FCD病灶小、MRI表现 subtle 且T1w/FLAIR简单拼接难以显式建模跨模态关系的问题,提出在3D U-Net前加入轻量CRIL模块,学习局部、体素级混合和比例式交互。五折实验中,配合FTF损失时Dice由3D U-Net的0.136升至0.196,检出病例从36/85增至44/85;但漏检率仍达48.2%,且缺少外部验证和组件消融,临床可用性仍有限。

EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation Figure 1
2026-08-05cs.CV

EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation

Rui Nie, Chuang Wang, Haitao Zhou, Jiahe Song, Buyu Li, Sheng Wang, Qian Yu

2026-08-05生成模型规划控制三维

这篇论文针对3D资产局部编辑中目标区域难定位、非目标区域易漂移的问题,提出无需训练和反演的EditFlow3D:用VLM自动生成视觉引导与细化3D掩码,再以掩码差分流限制编辑区域,并用逐步轨迹保持约束未编辑部分。实验在EditFlow-Bench和Edit3D-Bench上显示,其目标编辑准确性和非目标区域保真度优于现有方法。

Frequency-Decorrelated Temporal Ensembles for EEG--fNIRS Imagined-Handwriting Decoding Figure 1
2026-08-05cs.CV

Frequency-Decorrelated Temporal Ensembles for EEG--fNIRS Imagined-Handwriting Decoding

Xiao Fan, Hongbin Guo, Yubo Han, Yi Zhang

Xidian University

2026-08-05视觉感知

这篇论文面向跨被试想象手写解码,动机是非侵入式 EEG 噪声大、个体书写想象序列差异强,而稀疏 fNIRS 难以捕捉快速笔画动态。FRED 的核心在于把手写想象建模为多秒时序过程,用多频段 EEG 视图构造低相关集成,并在已知每 12 试次类别配额下做匈牙利约束解码。完整系统总体准确率 0.7952、私榜 0.7718,fNIRS 单独接近随机,主要增益来自频率多样化 EEG 集成和协议匹配推理。

SpreadMark: Robust Image Watermarking via Spread-Spectrum Embedding Figure 1
2026-08-05cs.CR

SpreadMark: Robust Image Watermarking via Spread-Spectrum Embedding

Wei Song, Yuxin Cao, Zhenchang Xing, Liming Zhu, Jin Song Dong, Yulei Sui, Jingling Xue

2026-08-05视觉感知安全鲁棒

论文针对隐形图像水印在再生成、白盒扰动和潜空间稀疏化下易被移除的问题,指出现有编码器-解码器常把单个比特集中嵌入在小区域。SpreadMark 将每个比特映射为覆盖全图的伪随机扩频码,并用匹配滤波、卷积分支和稀疏化感知训练联合解码。在 COCO、DIV2K 与九种方法对比中,它在再生成和潜空间稀疏化下保持较高检测率,同时 JPEG、加噪鲁棒性和感知质量也较有竞争力。

Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models Figure 1
2026-08-05cs.MM

Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

2026-08-05视觉感知

这篇论文关注视频大模型在事件先后判断中会迎合错误说法或拒绝正确说法的问题,指出关键不只是“是否信用户”,还包括稀疏采样帧是否包含证据。作者用事件重排和采样偏移分离可得性与加权效应,在9个开源模型上发现证据缺失时真假主张接受率相同;即使采到事件,多数能读顺序的模型仍会迎合。提出的反转测试可在可读顺序模型上把顺序准确率提升到0.92-1.00,并在无依据时选择重采样或 abstain。

Surface Keypoint Representation for Multi-Object and Articulated Human-Object Interaction Generation Figure 1
2026-08-05cs.CV

Surface Keypoint Representation for Multi-Object and Articulated Human-Object Interaction Generation

Xiaogang Peng, Zeyu Han, Zichong Meng, Yiming Xie, Jihua Zhu, Gang Hua, Huaizu Jiang

Northeastern University, Xi’an Jiaotong University, Northeastern University 360 Huntington Ave Boston MA 02115 USA, Northeastern University USA, Xi’an Jiaotong University China

2026-08-05视觉感知

这篇论文针对现有 HOI 生成多假设单一刚体、难处理可变数量物体和关节机构的问题,用物体表面非共线关键点轨迹统一表示刚体、多物体与铰接部件运动,并引入全身表面到物体表面的时空接触距离场,将生成分解为物体运动、接触预测和人体合成三阶段。在 ParaHome、HIMO、ARCTIC、OMOMO 上相较既有方法表现更好或相当。

CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation Figure 1
2026-08-05cs.CV

CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation

Tingzhang Luo, Ruizhong Liu, Yichao Liu, Cheng Fan, Yu Liu, Jianyuan Guo

2026-08-05视觉语言视觉感知优化算法

这篇论文针对遥感指代表达分割中 VLM-SAM 管线耦合弱、模型偏向物体语义而忽视空间关系的问题,提出 CROSS:用语言引导的级联蒸馏把 SAM 的几何亲和先验注入 SigLIP 中间层,并通过视觉遮挡干扰项与空间反事实文本进行双约束对比学习。实验称其在 RRSIS 基准上达到 SOTA,且在空间描述扰动下定位更稳定。

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation Figure 1
2026-08-05cs.CV

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

2026-08-05机器人视觉感知

这篇论文针对 VLN 中“走到哪一步”和“怎么执行这一步”被下一动作预测混在一起的问题,提出 Route2Step:先用指令分析模块显式跟踪当前子指令与恢复状态,再由动作模块生成局部动作,并用 E-SPA 从路线演示中对齐步骤监督。R2R-CE 上 SR 由 48.1% 提升到 55.3%,SPL 由 43.3% 到 48.2%,且只需 11.5K 直接动作监督状态。

Frozen High-Resolution Inference for Cross-City Object Detection: An AI City Challenge 2026 Study Figure 1
2026-08-05cs.CV

Frozen High-Resolution Inference for Cross-City Object Detection: An AI City Challenge 2026 Study

Jaeuk Kim

2026-08-05视觉感知

这篇研究面向跨城市目标检测中目标城市无标注、服务器只返回混合AP的受限场景,考察固定RF-DETR配置如何选型。核心洞察是无需更新参数,仅把704训练的检查点以1120高分辨率冻结推理即可取得最佳混合AP,主要改善中小目标;AP从0.3272升至0.3654,高于1120微调的0.3470。但文中也明确指出每项配置仅提交一次,且无法证明增益来自目标城市,增益来源可能主要来自scaling。

Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds Figure 1
2026-08-05cs.CV

Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds

Ning Zhu, An Chen, Mengfei Zhao, Juntao Xu, Jingze Liang, Boyuan Gu, Liang-Jian Deng

2026-08-05规划控制

这篇论文针对多概念文本生成中对象遗漏、融合和属性串绑的问题,指出故障常在去噪前的初始注意力空间分配已出现:不同概念落到重叠区域后会沿去噪过程持续耦合。RTD用一次 pilot attention 估计重叠,通过SOD形成无布局先验的分离目标,再用IGR对初始latent做尺度稳定的一次性校正。实验显示其在三个组合生成基准上达到领先结果,AE-Bench对象对上较CO3的BLIP-VQA提升45.8%,ImageReward提升19.6%,且快2.3倍。

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval Figure 1
2026-08-05cs.CV

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

Posts and Telecommunications Institute of Technology, Posts and Telecommunications Institute of Technology Ha Noi Vietnam

2026-08-05视觉感知

针对零样本草图检索中“适配草图-照片差异”与“保持 CLIP 泛化能力”之间的矛盾,SeCo-SBIR 将可学习提示先经文本编码器,再逐层注入视觉编码器,并用冻结 CLIP 分支的扰动一致性约束抑制已见类过拟合;在标准 ZS-SBIR、广义和跨数据集设置均达到 SOTA,TU-Berlin-Ext 与跨数据集增益尤为明显。

Non-Destructive Quantification of Urea Adulteration in Bovine Milk Using Transmittance Multispectral Imaging Figure 1
2026-08-05cs.CV

Non-Destructive Quantification of Urea Adulteration in Bovine Milk Using Transmittance Multispectral Imaging

Sharukshan Niranjan, Iresha Ranaweera, Tharindu Chandrarathne, Kalana Dissanayaka, Roshan Godaliyadda, Vijitha Herath, Parakrama Ekanayake, Janak Vidanarachchi

2026-08-05视觉感知

针对牛奶中尿素掺假的现场快速定量检测难题,论文用自建透射式多光谱成像系统采集365–940 nm的12个离散波段,并在密度平衡样品上以回归模型估计尿素浓度。核心价值在于把低成本成像与密度控制结合,削弱密度混杂因素;实验中多元线性回归验证R²为0.9599,前馈神经网络提升到0.9773,但结果仍主要限于受控实验室样品。

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models Figure 1
2026-08-05cs.CV

Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models

Paribesh Regmi, Qingshuang Chen, Chi Zhang, Heba Aly, Yelin Kim, Hongda Mao

2026-08-05视觉感知

视频语言模型在多帧输入下视觉 token 数量暴涨,推理延迟和 TFLOPs 成为部署瓶颈。论文提出后处理式两阶段剪枝:先按帧间多样性去除冗余帧,再用 token 嵌入相关矩阵的特征值衰减率自适应决定保留比例,避免固定剪枝率。实验称该方法在三种 VLM、五个数据集上保持或提升性能,在 10% token 保留率的视频字幕任务中准确率提升约 7%,同时 TFLOPs 降低 95%。

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis Figure 1
2026-08-05cs.CV

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

Jiakai Lin, Zijun Li, Guoyu Lu

Jiakai Lin, Zijun Li and Guoyu Lu are with the Intelligent Vision and Sensing (IVS) Lab at Indiana University Bloomington.

2026-08-05视觉语言三维

针对根系三维结构低纹理、遮挡缠绕且标注数据稀缺导致表型分析难解释的问题,论文将机器人三维点云中的无监督 W-LBC 骨架提取与 Evidence-First 语言微调结合,用根数、长度、分叉角和密度等量化证据约束 GPT-4o 推理。实验覆盖 12 种植物,显示该流程能生成较稳健、可解释的根系形态分析;但语言推理增益相对骨架质量和合成指令数据的贡献拆分文中未充分说明。

A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion Figure 1
2026-08-05cs.CV

A Unified Resolution-Conditioned Framework for Orthogonal Line-Scanning Image Fusion

Yiming Gong, Kai Wang

Department of Physics, University of Michigan, Ann Arbor, 48109, MI, USA, Zhuhai Key Laboratory of Optoelectronic Functional Materials and Membrane Technology, Zhuhai, 519082, Guangdong Province, China

2026-08-05视觉感知

针对线扫描显微为提速引入横向各向异性、且现有深度融合模型需按狭缝配置分别训练的问题,论文提出以分辨率比为条件的 CondLAformer,用 FiLM 注入退化参数,并将 RELA 改为随分辨率自适应的多尺度深度卷积和注意力温度。基于物理 PSF 仿真数据,单模型在多种及未见配置上达到 34–40 dB PSNR,明显优于无条件多配置训练和跨配置专用模型。

FaithIR: Rethinking Infrared Image Super-Resolution from Perceptual Sharpness to Task Relevant Fidelity Figure 1
2026-08-05cs.CV

FaithIR: Rethinking Infrared Image Super-Resolution from Perceptual Sharpness to Task Relevant Fidelity

Axi Niu, Zhenguo Wu, Kang Zhang, Qingsen Yan, Jinqiu Sun, Yanning Zhang

2026-08-05视觉感知

本文针对红外超分中“看起来更锐”反而可能破坏热分布、目标轮廓并影响检测/分割的问题,提出 FaithIR:不借助自然图像生成器或分词器预训练,而在像素域用条件 flow matching,将 patch 级全局结构引导到像素级重建。FLIR-IISR、M3FD、FMB 实验显示其重建保真、跨数据集泛化及下游检测/分割表现更稳,核心结论是任务相关保真比感知锐度更关键。

Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining Figure 1
2026-08-05cs.CV

Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining

Bangjie Sun, Nayoung Kim, Mun Choon Chan, Jun Han

2026-08-05视觉感知

论文关注深度感知哈希在近重复图像匹配中易被微小对抗扰动逃逸的问题。核心思路不是重训哈希模型,而是在发布阶段对参考图像做不可感知加固,并在匹配阶段用随机平滑聚合多次比较,从外围提升经验与认证鲁棒性。实验覆盖8种哈希和3个数据集,白盒攻击成功率由98.6%降至11.8%,黑盒由20.6%降至1.3%,并给出约0.3的ℓ2认证半径。

Channel-wise Dynamic Knowledge Distillation via Adaptive Sample Generation for Action Recognition Figure 1
2026-08-05cs.CV

Channel-wise Dynamic Knowledge Distillation via Adaptive Sample Generation for Action Recognition

Ping Li, Chenhao Ping, Jie Song, Mingli Song

2026-08-05视觉感知

这篇论文针对动作识别模型蒸馏中固定样本导致师生特征难对齐、统一通道权重忽略运动语义差异的问题,提出 ASCD:先用频域高斯掩码和通道中心频率差引导自适应样本生成,再按通道和训练阶段动态调整蒸馏强度,并用样本梯度约束输出相似性。在 UCF101、Kinetics-400、Something-Something-v2 及 CIFAR-100、ImageNet 上报告达到 SOTA,但具体增益的消融归因仍需看完整实验细节。

FakeI2V-Bench: Benchmarking the Applicability of Image-level Deepfake Detectors for Deepfake Video Detection Figure 1
2026-08-05cs.CR

FakeI2V-Bench: Benchmarking the Applicability of Image-level Deepfake Detectors for Deepfake Video Detection

Pei Li, Sihan Chen, Delong Ran, Tianshuo Cong

School of Cyber Science and Technology, Shandong University, Institute for Network Sciences and Cyberspace, BNRist, Tsinghua University, School of Cryptologic Science and Engineering, Shandong University, Qingdao, Shandong China, Tsinghua University, Beijing China, Shandong University, Jinan, Shandong China

2026-08-05视觉感知数据集/基准

本文针对视频生成模型快速迭代下深伪视频检测基准不足、图像级检测器能否迁移到视频场景缺少系统评估的问题,构建 FakeI2V-Bench,覆盖 97,548 个视频,并统一评测 8 个视频级与 12 个图像级检测器。核心洞察是,简单图像级检测器经帧到视频聚合已可接近甚至略超视频级方法,而 IV-Bridge 通过视频帧微调和随机森林多模式聚合进一步提升表现,使 11 个图像级检测器超过现有视频级方法,最佳 AUC 达 93.80%。

SUV: Future Scene Understanding as Video Generation for End-to-End Driving Figure 1
2026-08-05cs.CV

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue

2026-08-05视觉感知

端到端驾驶需要预测未来场景,而现有多任务或语言化接口难以同时表达稠密结构与连续动态。SUV将未来RGB、语义分割、相对深度和实例轨迹统一为视频流,由预训练Wan2.2-5B视频专家生成,并让动作专家直接关注这些潜变量规划轨迹。单前视相机下,其在NAVSIM-v2 navtest/navhard达91.0/36.9 EPDMS,WOD-E2E RFS为7.94,消融表明结构化未来监督和直接访问未来流均有助于规划。

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models Figure 1
2026-08-05cs.CV

GSTEP: Global Spatio-Temporal Density-Driven Visual Token Pruning for Efficient Video Large Language Models

Mengjie Zhang, Qihui Zhu, Tao Zhang, Shuangwu Chen, Huihuang Qin, Yu Guo, Shenghao Ye, Zijian Wen, Yunpeng Hou, Dong Jin, Xiaobin Tan, Huasen He, Jian Yang

University of Science and Technology of China, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, University of Science and Technology of China He Fei China, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center He Fei China

2026-08-05视觉感知

这篇论文针对长视频 VideoLLM 中视觉 token 数量过大、推理成本高的问题,指出按片段分配预算会让短但关键信息密集的片段被“饿死”,也会丢掉局部不显著但全局重要的 token。GSTEP 将视频视为连续时空信息流,结合平滑帧间变化与帧内空间密度做全局采样;在多模型多基准上,75% token 剪枝仍保持最高 100.2% 平均性能,并带来 1.17 倍端到端加速。

DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers Figure 1
2026-08-05cs.CV

DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers

Binglei Li, Mengping Yang, Zhiyu Tan, Xiaomeng Yang, Zhizhong Huang, Junping Zhang, Hao Li

2026-08-05生成模型

本文关注 DiT 内部表征为何影响生成质量这一尚不清晰的问题,提出用 Weighted Diversity Score 衡量不同 Transformer block 间的表征差异,并发现其与 FID 高度相关。基于此,DiverseDiT++ 通过长残差连接和表征多样性损失提升 block 间差异,在 ImageNet 生成、一步生成、蛋白逆折叠和 3D 分子生成中均带来更快收敛和稳定性能增益。

CorePath: A Breast-Specialized Pathology Foundation Model for Core Needle Biopsy Diagnosis and Risk-Controlled Report Generation Figure 1
2026-08-05cs.CV

CorePath: A Breast-Specialized Pathology Foundation Model for Core Needle Biopsy Diagnosis and Risk-Controlled Report Generation

Ting Yin, Danning Li, Chen Shu, Xiaoxia Yao, Boyu Fu, Yujing Chang, Tianyu Shi, Mengna Feng, Jie Chen, Jing Fu, Xiuli Xiao, Tianlin Li, Mumin Shao, Jiaxin Bi, Wenchuan Zhang, Xiaoyan Wu, Xiao Han, Zhang Zhang, Yuhao Yi, Hong Bu

Department of Pathology, West China Hospital, Sichuan University, Chengdu, China, Institute of Clinical Pathology, West China Hospital, Sichuan University, Chengdu, China, The Hong Kong University of Science and Technology (Guangzhou), College of Computer Science, Sichuan University, Sichuan University-Pittsburgh Institute, Sichuan University, Department of Pathology, Sichuan Provincial People’s Hospital, Chengdu, China, Department of Pathology, The Affiliated Hospital of Southwest Medical University, Luzhou, China, Department of Pathology, The Fourth Affiliated Hospital of Southwest Medical University, Meishan, China, Department of Pathology, Shenzhen Traditional Chinese Medicine Hospital, The Fourth Clinical Medical College of Guangzhou University of Chinese Medicine, Shenzhen, China, College of Biomedical Engineering, Sichuan University, Chengdu, China

2026-08-05规划控制安全鲁棒

乳腺穿刺活检样本少且形态相近,通用病理模型易误判并在报告中幻觉。CorePath用7901对全切片-报告对PRISM做乳腺专科微调,并以CorePath-CRG加入构象置信门控和Learn-Then-Test风险控制。多中心与公开基准上其分类AUC优于PRISM,五分类CNB亚型AUC达0.9526-0.9735,报告非乳腺幻觉由30.1%降至2.8%,受控发布输出为0%。

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds Figure 1
2026-08-05cs.CV

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

2026-08-05视觉语言数据集/基准

这篇论文针对光刻缺陷复检中“只判定有无缺陷”不足以支撑工程审查的问题,提出 LDU-Bench,将真实 IC-SEM 图像下的复检流程拆成缺陷筛查、形态识别、粗定位和基于图像证据的原因分析,并用任务指标、诊断读数和 LCS 衡量能力链。实验显示,现有多模态大模型虽能较可靠完成初筛,但该能力难以迁移到形态对齐、定位和证据到原因映射,暴露出结构化理解断裂。

Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation Figure 1
2026-08-05cs.CV

Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation

Jialu Huang, Yingxuan You, Fei Wang, Zheng Dang

2026-08-05视觉语言优化算法三维

这篇论文针对开放词汇 3D 室内场景生成中局部关系约束容易导致全局语义矛盾、物理不可行且依赖 VLM 初始化的问题,提出以场景图显式验证语义一致性的 GSV,并用进化搜索结合梯度细化的 GPFS 探索非凸可行空间。实验显示该方法在语义一致性和物理合理性上达到当前最佳,但具体增益在多大程度来自图验证或混合优化仍需看消融细节。

RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing Figure 1
2026-08-05cs.CV

RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing

Ruiliang Gong, Zhen Wang, Yanghao Wang, Long Chen

Department of Computer Science and Engineering, The Hong Kong University of Science and Technology

2026-08-05视觉感知

本文针对无反演 flow 图像编辑中目标侧状态构造不合理的问题:常用等位移做法在高噪声下仍保持源/目标侧距离,易导致过强更新和无关区域改动。RIDGE 的核心洞察是把当前编辑状态视作未知干净目标状态的近似,并用同一噪声重新加噪,使位移随噪声自然收缩;同时用模型内部预测和动态软掩码强化早期目标语义。实验在 PIE-Bench 系列、SD3 Medium 与 FLUX.1-dev 上显示其在源保持、目标对齐和感知质量间取得较好折中。

TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models Figure 1
2026-08-05cs.CV

TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

Seokho Han, Dongwei Wang, Jinhee Kim, Yiran Chen, Kang Eun Jeon, Huanrui Yang, Jong Hwan Ko

2026-08-05生成模型

这篇论文针对扩散模型静态量化按最敏感去噪步统一设定位宽、导致大量步骤计算浪费的问题,提出 TASQ:用一个共享最高精度权重缓冲区,通过按阶段和层学习 LSB 掩码,在不同去噪阶段截断不同数量的低位,并配合位串行 Temporal-Precision Engine 执行。实验在 PixArt-Σ、SANA-1.6B 和 SDXL-Turbo 上显示,其在接近静态量化质量的同时,将执行周期较静态量化降低约 25–50%,较朴素 8-bit 位串行执行降低 6.1–7.5 倍。

PDD-RRG: Posterior Diagnostic Decision for Study-level Radiology Report Generation Figure 1
2026-08-05cs.CV

PDD-RRG: Posterior Diagnostic Decision for Study-level Radiology Report Generation

Yang Yu, Yiming Ji, Bin Dai, Dong Zhang, Zhiyong Zhou, Shoushan Li, Yakang Dai

School of Computer Science & Technology, Soochow University, Suzhou Institute of Biomedical Engineering and Technology, Jiangsu Key Lab of Language Computing, Suzhou

2026-08-05视觉感知

论文针对放射报告生成中“输入越多不一定诊断越准”的问题,指出多视角和历史资料可能引入可避免错误。PDD-RRG不重训基础模型,而是从不同输入子集生成多份报告,提取14类临床观察并用贝叶斯后验与验证集阈值做诊断级融合,再反向修订报告。在MIMIC-CXR和三个RRG模型上的实验显示,该后处理框架能提升临床有效性。

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching Figure 1
2026-08-05cs.CV

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

Yoshiki Ito

Research & Development Group Hitachi, Ltd. Tokyo Japan

2026-08-05视觉感知

这篇论文针对运动技能反馈中专家示范难以在推理时持续获得的问题,提出 AIDE:训练阶段用学习者-专家姿态对构建教师模型,推理阶段学生模型仅凭学习者姿态生成反馈,并通过分离学习者 token 与差异 token、共享编码器和初始化实现隐式迁移。ExpertAF 实验显示,它多数指标优于无参考基线,接近需要专家参考的方法,但足球小样本下部位预测下降,泛化仍需更多验证。

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation Figure 1
2026-08-05cs.CV

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

Yizhuo Jia, Jingyun Hua, Yuanxing Zhang

2026-08-05视觉语言视觉感知

本文关注文生视频中训练 captions 与推理时提示增强器输出即使共享 schema 仍存在的 PE-Caption gap。CAPE-T2V 的关键做法是用外部 captioner 锚定 PE,并让同一 PE 同时生成 DiT 微调 captions 和推理改写提示,实现两侧条件分布对齐。实验在 Wan2.2、LTX-2.3 的 StoryEval、VBench-2.0、T2V-CompBench 上均优于 schema-aligned 对照,并以更低 MMD² 支持差距缩小。

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing Figure 1
2026-08-05cs.CV

Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing

Changhao Zhao, Haoxiang Li, Yuke Li, Hai Liu, LingLin Zeng

2026-08-05视觉感知

遥感语义分割依赖像素标注且图像尺度大、目标密集,现有训练自由开放词汇方法多绑在可改内部结构的 CLIP 上。本文提出 DinoSplat-OV,将冻结的 DINOv3/DINO.txt 独立用于该任务,通过文本感知拉普拉斯传播降噪保边、Gaussian Splatting 上采样恢复像素级特征,并用全局锚滑窗处理大图;在 UDD5、DOTA、LoveDA、Vaihingen 等数据集上达到与现有训练自由方法相当或更优的表现。

Clinically-Grounded Hierarchical Classification for Consistent Chest X-ray Interpretation Figure 1
2026-08-05cs.CV

Clinically-Grounded Hierarchical Classification for Consistent Chest X-ray Interpretation

Jong Hak Moon, Minjun Kim

2026-08-05视觉感知

这篇论文针对胸片自动判读中细粒度病灶预测常与解剖层级矛盾的问题,提出 CHASE:用 9 个区域、17 个子区域和 28 个病灶构成临床层级,并在 ViT 不同深度接入多级分类头,联合多级监督、全局 KL 对齐和层级违规惩罚来约束预测一致性。实验显示其在各层级 AUC 优于平面和层级基线,概率层级一致性达到 74.26%,注意力图也更符合从解剖区域到病灶证据的定位过程。

V-FIND: Revealing the Intrinsic Forgery Knowledge Encoded in Video Forgery Detectors Figure 1
2026-08-05cs.CV

V-FIND: Revealing the Intrinsic Forgery Knowledge Encoded in Video Forgery Detectors

Shichao Kan, Chengpeng Hong, Jingtong Dou, Chuancheng Shi, Yuhan Liu, Linrui Xu, Yixiong Liang, Yigang Cen, Yanpeng Sun, Fei Shen, Tat-Seng Chua

2026-08-05视觉感知

这篇论文针对视频伪造检测器长期被当作黑箱、依赖全模型重训的问题,提出从内部表征中寻找可复用的伪造判别知识。V-FIND 先定位真实与伪造视频差异显著的关键层,再筛选携带稳定伪造信号的潜在锚点神经元,形成紧凑取证子空间。在冻结骨干、仅训练线性分类器的设置下,该子空间在多个外部生成视频基准上仍有较强检测效果,神经元干预也支持其功能特异性。

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding Figure 1
2026-08-05cs.CV

Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding

Lucy Lin, Ayush Jain, Yifan Liu, Katerina Fragkiadaki

Carnegie Mellon University

2026-08-05视觉语言视觉感知三维

Qwen-3D针对现有VLM难以处理长时、多视角视频且3D LMM在定位与分割上弱于专用系统的问题,提出在Qwen骨干中用深度和位姿压缩视觉token,并以3D RoPE让注意力在世界坐标中运行,同时接入查询式分割解码器直接把语言落到3D场景表示上。实验显示其在3D grounding、实例分割和VQA上超过既有3D LMM,并保持较强2D能力。

Material-Segmented Per-Pixel Emissivity Correction for Thermographic Anomaly Detection in Cultural Heritage Digital Twins Figure 1
2026-08-05cs.CV

Material-Segmented Per-Pixel Emissivity Correction for Thermographic Anomaly Detection in Cultural Heritage Digital Twins

Jonathan Klingspon, Scott McAvoy, Maurizio Seracini, Falko Kuester

¹ University of California, San Diego — J. Klingspon (Ph.D. Student, Computer Engineering, Dept. of Computer Science and, San Diego State University — M. Seracini (Professor).

2026-08-05视觉感知

论文针对文化遗产热成像中“全图单一发射率”会在异质材料表面制造或掩盖温度异常的问题,提出用共标定 RGB 的 SAM 开放词汇材料分割查表生成逐像素发射率,并嵌入原始辐射反演。结果显示,在含低发射率材料且查表准确的合成场景中 MAE 由 1.97 K 降至 0.91 K,但真实风化遗产多接近默认高发射率,收益主要限于低发射率例外。

RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models Figure 1
2026-08-05cs.CV

RealWeather: Realistic and Scene-Faithful Weather Translation with Driving World Models

Yuwei Ning, Liangzhi Wang, Yi Xiao, Zhenhua Wu, Yun Pang, Mingkun Chan, Jichang Li, Guanbin Li

2026-08-05强化学习

面向自动驾驶在长尾恶劣天气中的训练与评测,RealWeather试图解决真实成对天气视频难采集、现有合成或几何方法在真实感与场景保真间取舍的问题。其核心是从真实恶劣天气视频学习天气动态,通过渐进真实度自举缩小伪清晰输入到真实输入的域差,并用基于分割奖励的场景保真强化学习抑制车道、车辆、行人等关键结构幻觉。实验显示其在Waymo、nuScenes和自建数据上提升视觉真实感与结构保持,并支持长尾天气生成和零样本域外泛化。

Modeling Scientific Experiment Scenes: Dataset and Model Figure 1
2026-08-05cs.CV

Modeling Scientific Experiment Scenes: Dataset and Model

Minghao Zou, Qingtian Zeng, Shangkun Liu, Cong Liu, Paul L. Rosin, Guanghui Yue, Jun Liu, Wei Zhou

2026-08-05数据集/基准

本文针对现有场景图生成数据集偏向日常图像、难以刻画科学实验中专用仪器和细粒度物理关系的问题,构建 PhysScene 数据集,并提出结合视觉-文本编码、视觉与几何双路径关系解码的 CM-DPG,以缓解长尾谓词和开放词汇泛化困难。实验显示其在 PhysScene 与 VG150 的多种设置下具备竞争力,消融支持各组件贡献。

Test Time Adaptation Methods for Point Cloud Registration in Laparoscopic Surgery Figure 1
2026-08-05cs.CV

Test Time Adaptation Methods for Point Cloud Registration in Laparoscopic Surgery

Nina Bodelot, Soufiane Belharbi, Eric Granger

2026-08-05三维

本文关注腹腔镜手术中合成训练点云到真实术中点云的域偏移问题,指出配准任务不同于分类,偏移主要作用于术中点云且缺少 logits/熵等 TTA 信号。作者改造 Point-TTA、LN、PEA 与 Purge-Gate,使其适配非对称点云对,并以 inlier ratio 替代熵准则。实验显示 P2P 上方法普遍降误差,但 LN 在 P2ILReg 上退化;输入适配延迟低且跨合成与真实数据更稳定,不过总体增益仍较小。

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews Figure 1
2026-08-05cs.CV

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

Sukhrobbek Ilyosbekov

2026-08-05视觉感知规划控制

这篇论文针对商用黑盒图像编辑 API 做医美预览时常把鼻部、下颌等局部请求扩散到皮肤、光照和其他面部区域的问题,研究仅在客户端能否控制编辑范围。核心做法不是改模型,而是用人脸关键点生成区域 mask,将 API 输出中目标区域裁回原图并羽化融合。试验显示该 masked composite 在不明显削弱目标区域变化的情况下显著提高局部化,中位提升 0.446,且测试的原生 inpainting 未优于简单合成;但文中也明确未做医生评估,不能说明临床准确性。

A Human-in-the-Loop Deep Learning Framework for Color Reconstruction of Lenticular Films Figure 1
2026-08-05cs.CV

A Human-in-the-Loop Deep Learning Framework for Color Reconstruction of Lenticular Films

Saptarshi Neil Sinha, Tiago Kleist, Giorgio Trumpy

Colourlab, Norwegian University of Science and Technology, Gjøvik, Norway

2026-08-05三维

针对Kodacolor等透镜胶片在弯曲透镜、低对比或受损扫描中自动边界检测易失效、颜色难以展陈的问题,论文提出人在回路的深度学习流程:用可编辑的矢量透镜边界让专家先校正,再用于颜色提取、去马赛克和迭代微调,并将重建色度与原始银盐亮度融合以保留纹理。实验在一个困难胶片序列上显示,较以往自动方法能产出可展陈的彩色重建,但量化增益和泛化范围文中未充分说明。

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning Figure 1
2026-08-05cs.CV

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

Northwestern University, dataset with scalable synthetic generation across diverse chart types and, grounding for enhanced chart understanding capabilities. Code is available, • We introduce a scalable synthetic CQA data generation method (§4) that systematically

2026-08-05视觉感知

这篇论文针对多模态模型做图表问答时常把视觉定位与推理链割裂的问题,提出 CURV:把图表问答改写为逐步推理并在每一步动态聚焦相关图像区域,再用三层课程式合成数据 CCQA 从单步运算推进到多图组合任务。实验显示其相对基线最高提升 20.50%,在真实图表基准和域外多模态推理上也有 12.30% 和 10.20% 的增益,但部分收益可能与合成数据规模和课程构造有关。

In-Context Collapse in Vision-Language Models and How to Mitigate it? Figure 1
2026-08-05cs.CV

In-Context Collapse in Vision-Language Models and How to Mitigate it?

Mohammad Rostami

2026-08-05视觉语言视觉感知

论文针对多示例视觉语言 ICL 中“示例越多反而越差”的现象,指出这不是格式错误,而是视觉-语言整合路径的判断崩塌,并区分“抗示例累积”和“能否学习新规则”两种能力。作者用无污染合成任务、自然图像和 VQA 验证该现象可低于随机水平,再通过损伤-修复定位到连接器与早中层,提出 CircA 适配器;一次训练即可迁移缓解崩塌,在部分任务上把准确率从机会水平提升到约 0.71/0.60。

Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems Figure 1
2026-08-05cs.CR

Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems

Mohammad Imtiaz Hasan, M Sabbir Salek, Nathan Jones, Mashrur Chowdhury, Rong Ge

Glenn Department of Civil Engineering, Clemson University, Clemson, SC 29634, National Center for Transportation Cybersecurity and Resiliency, School of Computing

2026-08-05视觉感知安全鲁棒

面向智能交通中依赖路侧视频的行人/车辆检测,论文指出风险不只是对抗扰动误分类,而是目标可被从视频流中语义移除。其核心做法是用历史帧中空间一致的背景补丁替换目标区域,并结合上下文 alpha 融合实现近实时攻击。SC-CVT 路口实验显示,YOLO 检测最多下降 97.59%,帧级成功率 94.48%,PSNR 超 40 dB、SSIM 超 0.996,且多种篡改检测器识别能力有限。

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation Figure 1
2026-08-05cs.CV

A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation

Ruida Cheng, Tejas S. Mathai, Benjamin Hou, Qingqing Zhu, Zhiyong Lu, Matthew McAuliffe, Ronald M. Summers

a Scientific Application Services, Center of Information Technology, NIH, b National Center for Biotechnology Information, National Library of Medicine, NIH, c Imaging Biomarkers and Computer-Aided Diagnosis Laboratory, Radiology and Imaging Sciences, Clinical Center, NIH, Harvester [3] further combined iterative hard-negative mining with a 2.5D context-enhanced CenterNet to generate 2D

2026-08-05视觉感知

这篇论文针对 DeepLesion 中小病灶在原始 CT 切片上难检测、难分割且报告生成缺少病灶语义 grounding 的问题,提出统一 2D 流程:先用保留空间细节并含 MoE 的 YOLO-TLP-MOE 定位,再以检测框裁剪后用 Swin-UMamba 分割,并把局部/全局视觉特征、框位置、粗解剖区域和病灶类型注入短报告生成。结果为检测 mAP50 70.1%、分割 Dice 62.6%、BLEU-1 64.3%,但分割标签来自 GrabCut,误检会向后级传播。

SAGE: Semantic Explainability of Attention-Based Survival Models in Computational Pathology Figure 1
2026-08-05cs.CV

SAGE: Semantic Explainability of Attention-Based Survival Models in Computational Pathology

Abdallah Lamane, Abdul Rahman Diab, Ren-Chin Wu, William Lotter

Massachusetts Institute of Technology, Cambridge, MA, USA, Department of Data Science, Dana-Farber Cancer Institute, Boston, MA, Department of Pathology, Dana-Farber Cancer Institute, Boston, MA, Department of Pathology, Brigham and Women’s Hospital, Boston, MA, Harvard Medical School, Boston, MA, a scalable, model-agnostic framework for understanding what ABMIL, ConceptMIL [14] is a label-free concept bottleneck model whose prediction is a

2026-08-05视觉感知

针对病理ABMIL生存模型的注意力热图只能说明“看哪里”、难以解释“看到了什么”的问题,SAGE在冻结模型上用病理视觉语言模型把注意力加权到25个组织学概念,并在队列层面关联预后预测。七个TCGA癌种和三类基础模型实验中,它复现坏死等不良预后特征,并发现KIRC中血管生成等癌种特异信号;消融显示这些关联依赖学习到的注意力而非概念出现频率。

PixelUp: Zero-Shot Semantic Feature Upsampling for Fine-Grained Vision Tasks Figure 1
2026-08-05cs.CV

PixelUp: Zero-Shot Semantic Feature Upsampling for Fine-Grained Vision Tasks

Deepank Singh, Anurag Nihal, Vedhus Hoskere

2026-08-05视觉感知

PixelUp针对视觉基础模型patch token分辨率过粗、直接放大输入又代价高且易产生特征伪影的问题,提出一个零样本、VFM无关的特征上采样器。其核心是在查询侧引入冻结语义编码器的多尺度语义特征,并用粗到细窗口交叉注意力生成像素级特征。实验显示单一checkpoint可迁移到多种VFM,在语义分割平均提升约1.2 mIoU,NYUv2深度估计δ1提升约0.25,并改善开放词汇与无监督分割。

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation Figure 1
2026-08-05cs.CV

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

Jiazhen Liu, Mingkuan Feng, Long Chen

The authors are with The Hong Kong University of Science and Technology (HKUST), Hong Kong.A preliminary version of this work was presented at CVPR 2026

2026-08-05视觉感知

本文针对 MLLM 分割中精度、对话能力与推理速度难以兼顾的问题,提出 Structured All-Mask Prediction:先生成带 ID/可选框的目标列表,再在共享多类 mask 空间中一次性预测所有目标。STAMPlus 在单一 checkpoint 下覆盖指代表达、推理、开放词汇语义/实例及遥感小目标分割,报告达到 SOTA,并将 12 类重复推理延迟由 13.50s 降至 5.16s。

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI Figure 1
2026-08-05cs.CV

Confident but Unreliable: A Behavioral Safety Audit of Vision-Language Models on Brain MRI

Amir Sabbaghziarani, Mohammadsajad Abavisani, Sergey Plis

TReNDS Center, Tri-Institutional Georgia State University/Georgia Institute of Technology/Emory University Center for Translational Research in Neuroimaging and Data Science (TReNDS)

2026-08-05视觉语言视觉感知安全鲁棒

这篇论文关注医疗VLM在脑MRI上“说得自信但未必可靠”的安全风险,动机是现有评测过度依赖准确率而忽视置信度、拒答和幻觉。作者构建无需新增标注的自动化审计,用元数据、切片几何和分割掩码生成标签,并同时评估校准、 confident error 与 abstention。六个模型几乎都愿意作答,但ECE达0.27–0.40,错误答案平均置信度仍有0.82–0.97,33–46%为高置信错误;医学适配提升肿瘤检测却未改善置信可靠性。

Oh Deer, How Should I Handle This? Seasonal Priors for Selective Wildlife Annotation and Classification Figure 1
2026-08-05cs.CV

Oh Deer, How Should I Handle This? Seasonal Priors for Selective Wildlife Annotation and Classification

Hugo Markoff, Christoph Praschl, Anton Hjalte Jørgensen, Christian Emil Mogensen, Mathias Bech Skadhauge, Sara Beery, Michael Ørsted, David C. Schedl

2026-08-05视觉感知

本文针对无人机航拍野生动物细粒度识别中标签本身不可靠的问题,以赤鹿成年雄性识别为例,提出用鹿角季节周期作为软先验来判断 RGB、热成像及配对视图何时可信。核心洞察是季节性不仅影响模型表现,也预示标注员弃标和模态证据缺失;RGB+热成像配对复核将可解析样本从单模态约三成提升到 52.8%,并找回多批单模态漏掉的雄性标签,置信度弃权后覆盖样本准确率最高达 98.9%。

Quo Vadis, World Modeling? Figure 1
2026-08-05cs.CV

Quo Vadis, World Modeling?

Yu Yang, Xuemeng Yang, Licheng Wen, Lingdong Kong, Xiaobin Hu, Dongyue Lu, Wei Chow, Xiyan Huang, Yuxiang Feng, Yue Liao, Jianbiao Mei, Daocheng Fu, Rong Wu, Pinlong Cai, Ran Yi, Ying Tai, Jiangning Zhang, Botian Shi, Yong Liu, Shuicheng Yan

2026-08-05强化学习

为解决机器人和数字智能体依赖真实环境交互时成本高、风险大、难并行且反馈滞后的问题,本文将世界模型从“预测物理下一状态”重构为面向智能体的信息转移代理,提出六类代理功能和推理指导、训练优化、协同演化三层赋能框架。主要结果是给出一套设计空间、评测取向和开放挑战,而非新的实验性能提升;具体量化增益文中未充分说明。

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing Figure 1
2026-08-05cs.CV

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Zhuo Chen, Chunchao Guo

2026-08-05视觉语言三维

本文针对3D理解、生成与编辑长期割裂且编辑数据稀缺的问题,提出Hunyuan3D-Buffalo 1.0:用87M规模多模态3D语料和Nano3D-v2构造一致编辑对,将3D VLM的语义、结构、空间理解接入扩散式3D生成。实验称其在文生3D和3D编辑上达到SOTA或领先,并显示理解与生成会共同提升编辑,但部分增益可能主要来自scaling / data。

Micro-Segmentation Anomaly Detection in Zero-Trust Software-Defined Network Fabrics Figure 1
2026-08-05cs.CR

Micro-Segmentation Anomaly Detection in Zero-Trust Software-Defined Network Fabrics

Ashly Joseph

2026-08-05视觉感知

论文针对零信任 SDN 中攻击者可在合法微分段内横向移动、绕过粗粒度监测的问题,将微分段上下文显式并入异常检测,并比较 ViT 与 1D-CNN 在原始流量和分段流量上的表现。模拟数据结果显示,分段输入使 F1 从约 0.90/0.92 提升到 0.94/0.95,ViT 略优且能发现慢速外泄等细粒度异常;但验证主要来自模拟环境,真实网络泛化仍文中未充分说明。

Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control Figure 1
2026-08-05cs.RO

Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control

Weili Zeng, Yitong Xing, Fulong Liu, Chengqun Yang, Antao Xiang, Feng Tian, Jingnan Gao, Jisong Cai, Xin Wang, Xiaomin Wu, Yao Mu, Xiaokang Yang, Yichao Yan

Shanghai Jiao Tong University, Qilu University of Technology (Shandong Academy of Sciences)

2026-08-05强化学习规划控制

这篇论文针对机器人控制中世界模型推理昂贵、生成视频未必适合作为动作接口的问题,提出 Enfold:用教师强制的视频生成器多层中间状态监督仅看当前图像和语言的编码器,并让该表示同时服务未来生成与动作读出,部署时不再运行生成器。实验显示其在 LIBERO、RoboTwin2.0 和真机任务保持高成功率,相比 Fast-WAM 动作延迟降低 3.7 倍,Flash 版本达 10.1 倍,同时表征分析表明其更关注长时程变化并抑制无关外观扰动。

2026-08-04

331 篇
WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity Figure 1
2026-08-04cs.CV

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

2026-08-04强化学习数据集/基准

本文针对可控视频模型被用作世界模型时,现有评测偏重画质和显式指令完成、难以检验场景隐含反应的问题,提出 WorldExam 分层基准,以 4 个诊断层级、8 类任务和 1474 个案例评估相机、动作和语言驱动模型的视觉质量、控制遵循、空间一致性与世界反应性。对 20 个模型的结果显示,三类接口各有短板:相机模型控制精确但缺少动态交互,动作模型主体控制较好但环境常不响应,语言模型交互更强但复杂控制不稳,说明高画质不等于具备内在反应能力。

VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification Figure 1
2026-08-04cs.CV

VR3D: View-Robust 3D Representation Learning for Aerial-Ground Person Re-Identification

Chao Ji, Shiyu Xuan, Zechao Li

2026-08-04三维安全鲁棒

这篇论文针对无人机与地面视角下行人重识别中遮挡、几何形变导致的视角偏置问题,主张仅在2D图像空间学习不变特征仍会绑定视角信息。VR3D将单张图像提取的3D先验、2D外观特征和体素结构对齐到规范3D空间,并用可靠性感知融合处理极端视角和重建误差。实验在CARGO、AG-ReID.v1/v2上优于近期方法,CARGO Rank-1提升5.63%。

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation Figure 1
2026-08-04cs.CV

CAPEval: A Decoupled Caption Evaluation across Understanding and Generation

Zhipeng Liu, Haochen Wang, Zhaoxiang Zhang

University of Chinese Academy of Sciences, Institute of Automation, Chinese Academy of Sciences

2026-08-04视觉语言数据集/基准

针对图像描述质量常被压成单一分数、难以解释其对理解与生成任务影响的问题,CAPEval将描述拆成覆盖度和精确度,并用人工长描述与原子检查项评估10个captioner,再在受控VLM训练和T2I微调中验证。结果显示,理解性能主要随语义覆盖度提升,而生成质量更依赖事实精确度,且合适的质量结构有时比模型规模更关键。

UEmbed: Unified Sparse and Dense Multimodal Embeddings Figure 1
2026-08-04cs.CV

UEmbed: Unified Sparse and Dense Multimodal Embeddings

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

2026-08-04视觉语言

针对学习式稀疏检索长期依赖双向编码器、且多模态扩展常需额外跨模态模块的问题,UEmbed在解码器式多模态模型中加入多个可学习特殊 token,并将词表分区预测稀疏权重,同时由EOS产生稠密向量,实现一次因果前向同时输出稀疏与稠密表示。9B模型在MMEB-v2上稠密71.8、稀疏71.0,稀疏多模态检索达新高,并在BEIR及混合检索、工具调用场景显示实用性。

ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment Figure 1
2026-08-04cs.CV

ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment

Nan Bi, Taoyue Wang, Lijun Yin, Vandana Sharma

School of Computing, Binghamton University, Binghamton, NY, USA, Department of Anesthesiology, SUNY Upstate Medical University, Syracuse, NY, USA, This work was supported by Watson College-Upstate Medical Pilot Research Grant Program and NSF(CNS-1629898)

2026-08-04视觉感知

临床疼痛评估缺少带自报告标签的真实面部视频,且热成像、深度虽有用却难以部署。ReMiX-MAE用RGB/热/深度进行自监督跨模态掩码预训练,并显式模拟模态缺失,把训练期多模态线索迁移到RGB-only推理;同时构建含治疗前后纵向记录的SMP数据集。实验显示其在SMP上优于RGB-only MAE,伪多模态特征在五分类中进一步提升,跨数据集迁移也更稳健。

Estimating SSIM from MSE for DCT-Based Compressed Images Figure 1
2026-08-04cs.MM

Estimating SSIM from MSE for DCT-Based Compressed Images

Luc Trudeau, Maria G. Martini

Kingston University London, London, UK

2026-08-04视觉感知

针对视频/图像编码中反复计算 SSIM 需要访问失真图局部统计、难以在多码率流水线中复用的问题,论文提出只用全局 MSE/PSNR 和参考图局部方差来估计局部误差,并用方差加权与标准差加权重分配全局 MSE。Kodak 与 Xiph Subset1 的 JPEG 实验显示,该方法较全局 MSE 基线显著提升 SSIM 估计精度,但更广泛编码场景的泛化仍文中未充分说明。

Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation Figure 1
2026-08-04cs.AI

Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation

Michael Farmer

2026-08-04视觉语言

本文回应“科学假设生成必须依赖持续具身交互”的观点,聚焦跨领域结构等同这类窄义溯因。核心洞察是提出“表征 grounding”和“约定空间”:科学图示可暴露潜在不变量,帮助在缺少共享术语的领域间检索同构结构。作者将其组织为 Abduction Loop,并以一个多模态模型从引力记忆图示联想到弱透镜 Kaiser-Squires 复形的案例作可能性见证,同时设计 DAB-30 评测;但文中明确未证明当前模型具备一般科学创造力。

Token Radius Attention for Efficient Video Generation Figure 1
2026-08-04cs.CV

Token Radius Attention for Efficient Video Generation

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

2026-08-04视觉感知

视频扩散 Transformer 的 3D 自注意力随分辨率和时长呈二次增长,成为推理瓶颈。论文指出不同 query 的注意力需求差异很大,且可由注意力熵近似预测,并提出无需训练的 TRA:将熵映射为 token 预算,再转为带时间衰减的局部半径掩码。实验在 Wan 与 HunyuanVideo 的 T2V/I2V 配置上仅保留 9%–19% 注意力交互,获得 1.56–2.05 倍加速且质量接近 dense attention。

DyFrDet: Towards Accurate Small Object Detection via Dynamic Frequency Suppression with Label Disambiguation Figure 1
2026-08-04cs.CV

DyFrDet: Towards Accurate Small Object Detection via Dynamic Frequency Suppression with Label Disambiguation

Zihan Yang, Yang Guo, Hongxing Zhang, Dan Lu, Siyuan Yao

Hangzhou International Innovation Institute of Beihang University, Beijing University of Posts and Telecommunications, Shenzhen Campus of Sun Yat-sen University, Hangzhou International Innovation Institute of Beihang University Hangzhou China, Beijing University of Posts and Telecommunications Beijing China, Shenzhen Campus of Sun Yat-sen University Shenzhen China

2026-08-04视觉感知

本文针对小目标检测中视觉线索不足、复杂背景频域噪声和低分辨率标注歧义导致的定位不准问题,提出 DyFrDet:用 DyFrFPN 将金字塔特征转到频域,并由动态频带预测器同时抑制低频冗余与高频噪声;再用标签消歧模块以概率分布建模边框回归不确定性。实验称其在多个小目标检测基准上达到 SOTA,尤其适用于密集或稀疏场景中的极小目标定位。

Fermat Active Laplace Learning for Semi-Supervised Hyperspectral Image Classification Figure 1
2026-08-04cs.CV

Fermat Active Laplace Learning for Semi-Supervised Hyperspectral Image Classification

Vutichart Buranasiri, James M. Murphy

Department of Mathematics, Tufts University

2026-08-04视觉感知

面向高光谱图像在低标注率下难以训练可靠分类器的问题,论文将密度感知的 Fermat 距离引入主动式 Laplace/Poisson 标签传播,提出全量 FALL 与基于地标近似和交叉验证选 p 的 A-FALL。Salinas A 与 Pavia 实验显示其相对 PWLL-τ 提升总体精度,A-FALL 更适合大场景,但增益对数据集与近似 scaling 的依赖仍需进一步说明。

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation Figure 1
2026-08-04cs.CV

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

Peking University, Taiyuan University of Technology, Peking University Beijing China, Taiyuan University of Technology Taiyuan China

2026-08-04视觉感知

这篇论文针对音频驱动视频生成中扩散采样推理昂贵、现有缓存只看视觉冗余而忽视音频时序重要性的问题,提出 EchoCache:用音频时频能量作为跨模态显著性锚点,在时间步和潜变量粒度动态决定更新或复用,并用量化残差降低缓存开销。实验显示其在 Wan2.2-S2V/EMTD 上取得 2.46 倍加速,同时保持较好的 FID、FVD 与音画同步指标。

Action-grounded tissue affordance enables anticipatory auto-framing that lowers surgeon cognitive workload during laparoscopic surgery Figure 1
2026-08-04cs.CV

Action-grounded tissue affordance enables anticipatory auto-framing that lowers surgeon cognitive workload during laparoscopic surgery

Jiayu Gu, Yiwei Wang, Jie Zhang, Guojun Cao, Keshen Lyu, Song Zhou, Yimeng Chen, Haorui Wang, Qingmin Feng, Shenchao Shi, Huan Zhao, Wenbin Chen, Caihua Xiong, Chidan Wan, Jing Samantha Pan, Xiong Cai, Han Ding

. Department of Hepatobiliary Surgery, Union Hospital, Tongji Medical College, Huazhong University of, . School of Mechanical Science and Engineering, Huazhong University of Science and Technology, . Department of Psychology, Sun Yat-sen University, Guangzhou, China, . Institute of Biomedical Engineering, Union Hospital, Tongji Medical College, Huazhong University of, . Institute of Medical Equipment Science and Engineering, Huazhong University of Science and, . Department of Hepatobiliary and Pancreatic Surgery, Renmin Hospital of Wuhan University, Wuhan, require dense spatial labels that only experts can produce, and that expertise is tacit: surgeons converge on, the same interaction loci without being able to state the rules they use. Here we show that such labels can be, constrained tracking, and produces labels that match the accuracy of annotators given full procedural, context. A model trained on these soft labels predicts affordance in real time, reaching 95.16% directional, supervision from action rather than annotation offers a scalable route to anticipatory assistance in the

2026-08-04视觉感知

腹腔镜自动取景的瓶颈在于手术关注区域依赖隐性专家经验,逐帧标注昂贵且难扩展。论文提出 DiffeoAfford,用已完成手术中的器械接触轨迹和微分同胚约束组织跟踪反推组织可供性软标签,再训练实时预测模型驱动 AffordView。结果显示其标签接近有上下文标注者,预测与后续相机运动方向一致率达 95.16%,并在 12 对胆囊切除术中降低主观、生理和行为层面的认知负荷。

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment Figure 1
2026-08-04cs.CV

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

Northeastern University

2026-08-04视觉语言视觉感知

本文针对车损理赔中划痕、细裂等微小且易与反光混淆的损伤,指出强 VLM 虽能做语义分类却缺乏可靠像素级定位。核心做法是用 TinyDamage 专用分割模型承担空间 grounding,并将掩码与结构化结果接入 LangGraph 生成报告;实验显示分割约束将报告幻觉率由 78%/92% 降至 31%,且损失设计比架构更关键。

Calibrated Similarity and Graph Clustering for Open-Set Animal Re-Identification Figure 1
2026-08-04cs.CV

Calibrated Similarity and Graph Clustering for Open-Set Animal Re-Identification

Mohamed ElBassat, Seifeldin Elkerdany, Mohamed ElBialy, Gamal Abouelhamd, Jana Ghoneim, Assem Elkady, Mohamed Elboraay, Nelly Semenova

Faculty of Computer Science and Engineering, Alamein International University, New Alamein City, 51718, Egypt, Faculty of Computers and Data Science, Alexandria University, Alexandria, Egypt, Faculty of Engineering, Alexandria University, Alexandria, Egypt, Alexandria Higher Institute of Engineering and Technology, Alexandria, Egypt, Moscow Pedagogical State University (MPGU University), 1/1 Malaya Pirogovskaya St., Moscow, 119435, Russian Federation

2026-08-04视觉感知

面向野外监测中既要识别已知个体又要发现新个体的开放集动物重识别难题,论文将目标分割、物种特定预处理、MiewID全局特征与ALIKED/DISK局部匹配的校准融合,再用图聚类生成身份簇。结果显示整体相似度到聚类流程是主要增益来源,最佳公开ARI为0.72124,私有ARI最高达0.71087。

ISRS-DETR: Detection-Guided Click Propagation for Remote Sensing Interactive Segmentation Figure 1
2026-08-04cs.CV

ISRS-DETR: Detection-Guided Click Propagation for Remote Sensing Interactive Segmentation

Thanh Duc Pham, Anh Nguyen, Duong Duc Hieu, Minh-Tan Pham

2026-08-04视觉感知

论文针对遥感交互式分割中高分辨率、小目标稀疏且同类实例需反复点击的问题,指出遥感场景存在较强同类目标相关性。ISRS-DETR将RF-DETR检测解码器接入CrossCut式分割框架,用动态Top-K筛选可靠框并转为模拟点击,把一次用户点击传播到同类实例。三项遥感基准上取得SOTA分割精度,并显著降低每图点击次数。

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving Figure 1
2026-08-04cs.CV

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

Ambarish Govindarajulu Kaliamurthi (San Jose State University), Kaikai Liu (San Jose State University)

2026-08-04视觉语言

MoRAL针对车端算力受限下VLM难以进行可靠度量空间推理的问题,将LiDAR距离、目标形态和雷达Doppler速度显式编码进BEV图像,再用两阶段LoRA先学视觉词汇、再学驾驶推理。结果显示,2B模型在nuScenes上胜过零样本8B基线的七类问题,急刹召回由10.8%升至47.8%,且可在8GB GPU上运行;但评价依赖LLM裁判,闭环驾驶收益文中未充分说明。

UAV-Based Environmental Monitoring of Rip-Current Indicators Using Wavelet-Derived Texture Features Figure 1
2026-08-04cs.CV

UAV-Based Environmental Monitoring of Rip-Current Indicators Using Wavelet-Derived Texture Features

Yonatan Ben Avraham, Baruch Binyaminov, Yehudit Aperstein

Intelligent Systems, Afeka Academic College of Engineering, Tel Aviv 6998812, Israel

2026-08-04视觉感知

针对无人机RGB图像中离岸流常表现为破浪、泡沫或泥沙纹理的细微缺口、难以稳定识别的问题,论文将离散小波提取的空间频率纹理融入CNN与YOLOv8,比较通道替换和双流融合等方案。结果显示小波特征优于RGB基线:双流分类准确率超过95%,通道替换检测mAP@50达94%;但结论主要限于所评数据集,跨海况泛化仍需进一步验证。

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis Figure 1
2026-08-04cs.CV

InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis

Jiawei Wang, Hao Yu, Yongzhen Hu, Xinyi Yang, Tao Ni, Xin Zhan, Junbo Chen, Xiaowei Zhou, Ruizhen Hu, Sida Peng

State Key Laboratory of CAD&CG, Zhejiang University, Zhejiang University, Shenzhen University, State Key Laboratory of CAD&CG, Zhejiang University China, Zhejiang University China, Shenzhen University China

2026-08-04三维

InfiniSplat针对单图前馈3DGS在大基线视角下因像素对齐高斯导致结构撕裂、表面不连贯的问题,提出以单目几何先验进行表面对齐支撑点采样,并用查询条件隐式解码预测高斯属性。实验显示其在多数据集跨域NVS上优于现有单图前馈基线,并能从Hypersim泛化到开放场景;消融表明几何采样、隐式解码和DINO/CNN双分支共同贡献增益。

Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning Figure 1
2026-08-04cs.CV

Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning

Monan Sun, Bangzhen Liu, Huaidong Zhang, Shengfeng He

2026-08-04三维

这篇论文针对点云自回归生成中常见的启发式排序、下采样会破坏拓扑连续性的问题,提出 PointRSP:先用递归谱划分把点云分解为非平衡二叉树,再用双流级联生成器分别建模结构演化和坐标特征,并用几何校准位置编码稳定早期生成。实验称其在生成质量、多样性和复杂三维拓扑泛化上达到 SOTA,但大规模场景和超高密度点云的可扩展性文中未充分验证。

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation Figure 1
2026-08-04cs.CV

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation

Jiaming Chen, Guoan Xu, Aoshen Huang, Haozhuo Zhang, Yang Li, Wei Pan

🖂 {}^{\text{\Letter}} Corresponding authors. 1 Jiaming Chen, Haozhuo Zhang, and Wei Pan are with the Department of Computer Science, The University of Manchester, Manchester M13, Sydney, NSW 2007, Australia. 3 Aoshen Huang is with the School of Control Science and Engineering, Shandong University, Jinan 250061, China. 4 Yang Li is with the School of Computer Science, Shanghai Jiao Tong

2026-08-04机器人强化学习

这篇论文针对自动导航中像素级世界模型计算开销大、潜空间方法仍依赖重型解码器的问题,提出 DF3:在冻结视觉基础模型的编码器内注入预测查询和任务查询,并用 MACF 结合光流扭曲与潜特征相关来对齐历史帧、预测未来特征。Cityscapes 与四足机器人仿真零样本实验显示,其精度接近现有方法,同时降低延迟和显存,但仍局限于 observation-only 预测。

Loggia dei Lanzi: AI Thermography Enhancement Comparisons through 3D Photogrammetry Figure 1
2026-08-04cs.CV

Loggia dei Lanzi: AI Thermography Enhancement Comparisons through 3D Photogrammetry

Scott McAvoy, Jonathan Klingspon, George Bent, Dave Pfaff, Aviral Agarwal, Maurizio Seracini, Falko Kuester

Cultural Heritage Engineering Initiative (CHEI), University of California San Diego, Washington and Lee University

2026-08-04三维

本文面向文化遗产热成像中低分辨率热图难以支撑三维记录的问题,以佛罗伦萨 Loggia dei Lanzi 冬季热成像为基准,比较原始热图、FLIR UltraMax 硬件超分和 AI 超分在 SfM 流程中的效果。核心洞察是把增强质量落实到隐蔽结构识别、tie-point 生成和三维热模型密度/精度上,而非仅看图像观感;结果显示热成像揭示了封堵开口和材料过渡等隐藏特征,但各增强方案带来的定量增益大小文中片段未充分说明。

USP-Mamba: Unmixing-Derived Spectral and Structural Prompting for Hyperspectral Image Super-Resolution Figure 1
2026-08-04cs.CV

USP-Mamba: Unmixing-Derived Spectral and Structural Prompting for Hyperspectral Image Super-Resolution

Shi Chen, Jie Zhang, Yicong Zhou

2026-08-04视觉感知

针对高光谱单图超分中 Mamba 扫描会破坏二维邻接、且状态参数缺少高光谱先验的问题,USP-Mamba把解混得到的全局材料组成作为持续光谱提示,并结合空间/频率结构提示调节状态演化;再用 Hilbert 与语义邻域扫描兼顾局部连续性和非局部依赖。文中称其在多个基准上优于代表性方法,但具体增益来源仍需结合消融细节判断。

Does Explainability Transfer? A Controlled Benchmark of Attribution Methods on Vision Transformers and CNNs Figure 1
2026-08-04cs.CV

Does Explainability Transfer? A Controlled Benchmark of Attribution Methods on Vision Transformers and CNNs

Sathiyamohan Nishankar, Nethmi Pathirana, Pubudu Sanjeewani, Asanka Perera, Selvarajah Thuseethan

2026-08-04视觉感知规划控制数据集/基准

这篇论文关注视觉模型解释方法能否从 CNN 迁移到 ViT,这对依赖视觉感知的机器人系统做安全诊断和失效分析很关键。作者构建受控基准,在8类骨干上比较13种归因方法,并同时评估忠实性、定位、鲁棒性、复杂度和开销。结果显示解释质量强依赖架构,CNN上的方法排名不能可靠迁移到Transformer;CAM在常规框级定位上看似占优,但像素级评估暴露出指标饱和问题,注意力回滚更稳定却定位较差。

GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience Figure 1
2026-08-04cs.CV

GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

Sitong Gong, Caixin Kang, Tianyu Yan, Guo Chen, Bo Zheng, Kaipeng Zhang, Yunzhi Zhuge, Xiang Ruan, Huchuan Lu, Yifei Huang

2026-08-04视觉感知

GROVE面向可穿戴助手在连续视频中既要被动回答历史问题、又要主动利用过往经验提醒用户的需求。其核心是把流式视频因果构造成按时间尺度分层的记忆,包括感知痕迹、时刻、事件和跨天模式,并为各层设计匹配的检索技能,使问答和主动辅助共享同一记忆接口。论文在MM-Lifelong、EgoServe等五个基准上取得对比方法中最佳结果,消融显示时间分层与尺度化检索互补,跨天证据场景中模式层贡献最大。

Loop-Mamba: A Loop Mamba with Degradation-Aware and Shared Memory for Old Photo Restoration Figure 1
2026-08-04cs.CV

Loop-Mamba: A Loop Mamba with Degradation-Aware and Shared Memory for Old Photo Restoration

Runci Bai, Yucheng Xin, Pu Wang, Yongcong Wang, Chen Wu, Dianjie Lu, Guijuan Zhang, Pengwen Dai, Guangwei Gao, Siyuan Yao, Zhuoran Zheng

2026-08-04视觉感知

针对老照片中划痕、褪色、模糊和缺失等多种退化相互耦合、传统迭代修复计算开销大且难以保持结构连续的问题,Loop-Mamba将修复建模为循环状态演化:用SGDE估计局部退化图和全局难度,并通过共享结构记忆Mamba跨轮次传播隐状态。文中称其在SynOld上优于现有方法,并提出ODRS衡量退化恢复与结构重建。

Context-Aware Mixture of Domain Experts for Bodily Expression of Emotion in the Wild Figure 1
2026-08-04cs.CV

Context-Aware Mixture of Domain Experts for Bodily Expression of Emotion in the Wild

Mohammad Mahdi Dehshibi, David Masip

2026-08-04视觉感知

论文针对肢体情绪识别中“同一姿态在不同场景/物体下含义不同”的问题,提出 CA-MoDE,将场景和物体专家的软预测转为情绪-上下文共现先验,并用 max-endorsement 门控按情绪维度选择最强上下文证据,避免平均融合稀释有效信号。在 BoLD 上仅用单帧图像取得 ERS 0.3269,超过若干依赖时序线索的对比方法,但连续 VAD 回归仍较弱。

Implicit Neural Representations for Multimodal Longitudinal Image Imputation and Interpolation Figure 1
2026-08-04cs.CV

Implicit Neural Representations for Multimodal Longitudinal Image Imputation and Interpolation

Sina Wendrich, Lukas Förner, Zoe Reinke, Kartikay Tehlan, Ansgar Berlis, Michael Frühwald, Matthias Wagner, Thomas Wendler

2026-08-04视觉语言视觉感知

这篇论文面向肿瘤随访中多参数 MRI 常出现序列缺失、扫描协议和分辨率不一致的问题,提出面向单个患者的条件隐式神经表示,将空间坐标、时间和模态作为连续输入,并用随机模态 dropout 适配不完整纵向数据。方法可在不统一体素网格的情况下补全缺失模态并做时空插值,同时用跨模态自一致性估计置信度。5 名儿童脑肿瘤患者实验显示,T1CE 和 FLAIR 相比线性插值有显著提升,T1CE 平均 MS-SSIM 为 0.95±0.02,置信度与真实重建质量最高相关到 Pearson r=0.996,但样本规模较小。

Global-Scale Self-Supervised Spatiotemporal Learning for NDVI Time-Series Reconstruction Figure 1
2026-08-04cs.CV

Global-Scale Self-Supervised Spatiotemporal Learning for NDVI Time-Series Reconstruction

Ang Li, Menghui Jiang, Xiaobin Guan, Dong Chu, Huanfeng Shen

a School of Resource and Environmental Sciences, Wuhan University, Wuhan 430079, China, b School of Geography and Tourism, Anhui Normal University, Wuhu 241002, China, c Key Laboratory of Earth Surface Processes and Regional Response in the Yangtze River, d Key Laboratory of Geographic Information System of Ministry of Education, Wuhan 430079, e Key Laboratory of Digital Cartography and Land Information Application of the Ministry of

2026-08-04三维

针对云污染和噪声导致的全球 NDVI 时间序列缺失,论文提出 GloSSR:用真实云污染模式人工退化较干净观测来构造自监督训练对,并结合双向 Transformer、ConvLSTM、时序/通道注意力与时空先验约束。MODIS 实验中三地 MAE 为 0.0273、0.0243、0.0279,真实序列、长期趋势和 AVHRR 迁移测试显示其具备较好的大尺度重建能力。

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks Figure 1
2026-08-04cs.RO

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

Arnold Network-based framework for fast, scalable, and inter-, environments, reliable and scalable traversability analysis, Department of Information Engineering, University of Padova, Italy., for scalable terrain traversability analysis. Based on hand-, rection toward transparent and scalable decision-making, map the predicted semantic classes to traversability labels.

2026-08-04视觉感知

这篇论文针对地形可通行性模型在安全导航中难解释、难部署的问题,提出基于 Kolmogorov-Arnold Network 的 TravKAN,用可学习一元函数建模非线性特征交互,并引入 LiDAR 反射率手工特征;训练后可抽取 TravKAN-Lite 符号表达式。实验覆盖 SemanticKITTI、nuScenes 与 EastPark,性能优于常规深度模型、接近 XGBoost,Lite 版小于 1KB 且 CPU 每帧约 0.16ms。

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation Figure 1
2026-08-04cs.CV

GEOID-Flood: A Large-Scale Multi-Modal Benchmark Dataset for Flood Segmentation

Gaetano Chiriaco, Luca Barco, Andrea Bragagnolo, Claudio Rossi, Edoardo Arnaudo

2026-08-04视觉感知数据集/基准

针对洪水制图中现有数据集难以同时支持灾前/灾后SAR、配准光学影像和永久水体区分的问题,GEOID-Flood构建了覆盖65国219次事件的多模态分割基准,并提供事件级评测协议。实验显示,地理基础模型仅有稳定但有限优势,微调后的光学-SAR融合最利于识别临时淹没,且该数据训练模型对未见事件迁移更好。

CalibBEV: LiDAR-Camera Calibration via BEV Alignment Figure 1
2026-08-04cs.CV

CalibBEV: LiDAR-Camera Calibration via BEV Alignment

Filippo D'Addeo, Lorenzo Cipelli, Adriano Cardace, Emanuele Ghelfi, Andrea Zinelli, Massimo Bertozzi

Equal contribution. University of Bologna, Department of Industrial Engineering, Italy., University of Parma, Department of Engineering and Architecture, Italy., Stanford University, USA., VisLab srl, an Ambarella Inc. company, Italy.

2026-08-04视觉感知

针对自动驾驶中激光雷达与相机外参标定依赖跨模态点像素匹配、易受模态差异和场景变化影响的问题,CalibBEV将两类传感器特征提升到统一BEV空间,先用隐式对齐回归粗标定,再通过BEV特征 warping 显式细化,并用CLIP式对比损失缩小特征鸿沟。在KITTI和nuScenes上,相比既有方法RRE分别降51%和68%,RTE降80%和91%,且可扩展到多相机设置。

The Push-Forward Transform for Continuous and Robust Comparison of Dynamic Shapes Figure 1
2026-08-04cs.CV

The Push-Forward Transform for Continuous and Robust Comparison of Dynamic Shapes

Roua Rouatbi, Juan-Esteban Suarez Cardona, Ivo F. Sbalzarini

Faculty of Computer Science, Dresden University of Technology, Dresden, Germany, Max Planck Institute of Molecular Cell Biology and Genetics, Dresden, Germany, Center for Systems Biology Dresden, Dresden, Germany, Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Cluster of Excellence Physics of Life, Dresden University of Technology, Dresden, Germany, Munich Center for Machine Learning (MCML), Munich, Germany, Now at: Department of Mathematical Modeling and Machine Learning, University of Zurich, Zurich, Switzerland

2026-08-04安全鲁棒

针对动态形状比较中对齐、参数化和地标依赖带来的不稳定性,论文提出 Push-Forward Transform,将形状上的 SDF 或其他标量场映射到共同参考域,并构造可解释的谱形态度量。实验覆盖 2D、3D 与时序形状,显示其对旋转、尺度、噪声更稳健,还可联合分析形态与强度信号;但具体相对增益在不同任务中的来源仍需结合完整基准细节判断。

A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology Figure 1
2026-08-04cs.CV

A General-Purpose VLM Can Teach an Astronomy Foundation Model to Better Recognize Galaxy Morphology

Dichang Zhang, Jiaqi Deng, Yixuan Shao, Yuanpeng Liu, Jiali Cui, Zhiqiang Lao, Heather Yu, Liang Peng, Simon Birrer, Dimitris Samaras

Department of Computer Science, School of Computer Science, Department of Physics and Astronomy, Department of Computer Science Stony Brook University Stony Brook New York USA, School of Computer Science University of Technology Sydney Sydney New South Wales Australia, Department of Physics and Astronomy Stony Brook University Stony Brook New York USA

2026-08-04视觉语言三维

面向 LSST、Euclid 等大规模巡天中星系形态标注昂贵且存在跨望远镜域移的问题,论文发现通用 VLM 的零样本 VQA 还不能替代人工,但其软预测和不确定性含有可用形态先验;据此将其蒸馏到 Zoobot,并结合树结构监督、主动选样和先验校正,在两个巡天域和不同标注预算下稳定提升分类表现。

SpikeRestormer: Towards Energy-Efficient All-in-One Image Restoration via Unified Event Reasoning Figure 1
2026-08-04cs.CV

SpikeRestormer: Towards Energy-Efficient All-in-One Image Restoration via Unified Event Reasoning

Shengkai Hu, Jie Shao, Jiaqi Ma, Xu Zhang, Keying Wu, Qilu Zhu, Beihang Song, Jun Wan

2026-08-04视觉感知

面向统一图像复原,论文针对ANN方法能耗高、SNN处理静态退化图像缺少显式事件且脉冲响应不可靠的问题,提出SpikeRestormer:用减法注意力提取退化事件、层级贝叶斯跳连筛选可靠事件,并以加法注意力构建复原事件。实验显示其在AiOIR多任务上接近ANN性能,同时在SNN方法中取得更优结果并显著降低能耗。

Extended Field of View Analysis for VideoGAN-based Trajectory Generation Figure 1
2026-08-04cs.CV

Extended Field of View Analysis for VideoGAN-based Trajectory Generation

Annajoyce Mariani, Kira Maag, Hanno Gottschalk

2026-08-04视觉感知生成模型规划控制

面向自动驾驶预测与规划中需要多样、真实且高效的未来轨迹生成,论文将语义 BEV 交通视频的 VideoGAN 框架扩展到更大视野,引入改进语义表示、图关联轨迹提取,以及针对幻觉和目标保持性的量化评估。实验显示在 15–25 米视野下仍能生成统计上较真实的轨迹和空间关系,20 秒场景推理低于 20 毫秒,但相对扩散模型的质量增益来源不清。

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration Figure 1
2026-08-04cs.CV

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Aoru Xue (1), Yujing Sun (2), Yiming Ren (1 and 2), Kwok-Yan Lam (2), Mao Ye (3), Yuexin Ma (1) ((1) ShanghaiTech University, Shanghai, China, (2) Digital Trust Centre, Nanyang Technological University, Singapore, (3) <a href="http://EABOT.AI" rel="external noopener nofollow" class="link-external link-http">this http URL</a>, China)

2026-08-04视觉感知

Sen-Cap针对多传感器动捕中标定依赖强、视角变化易传递误差,以及点云噪声或传感器失效导致轨迹不稳的问题,提出在人中心空间内统一估计局部姿态与体形的UAME,并用自适应传感器融合支持未标定、数量可变的LiDAR/相机输入;同时以迭代扩展搜索的NTT增强全局平移鲁棒性。实验在Human-M3、FreeMotion上达到主要指标SOTA,并在LiDARHuman26M、RELI11D展示跨域泛化。

EOVSAM: Efficient Open-Vocabulary Segmentation with SAM 3 in One Pass Figure 1
2026-08-04cs.CV

EOVSAM: Efficient Open-Vocabulary Segmentation with SAM 3 in One Pass

Haomin Peng, Yongkang Li, Zhaoxiang Liu, Xiaojie Jin, Shiguo Lian, Yunchao Wei, Xinggang Wang

2026-08-04视觉感知

这篇论文针对 SAM 3 做开放词汇分割时需逐类提示、随类别数线性变慢的问题,将 SAM 3 改造成无提示的一次前向掩码生成器,并用注意力聚合把 SigLIP 特征汇成对象级表征,实现定位与开放词汇分类端到端联合优化。实验显示其在多个语义与全景分割基准上优于原始 SAM 3,推理最高加速 338 倍,低分辨率下仍保持较高精度。

Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow Figure 1
2026-08-04cs.CV

Open-Set Visual Text Forensics via Sparse-Constraint Rectified Flow

Jiangling Zhang, Shuxuan Gao, Zeyu Chen, Yichao Liu, Yu Zhou

School of Computer Science and Artificial Intelligence, [ 1]College of Computer Science, Nankai University Tianjin China, School of Computer Science and Artificial Intelligence Wuhan University of Technology Wuhan China, [ 1]College of Computer Science &, College of Cryptology and Cyber Science

2026-08-04生成模型优化算法

针对生成式模型让文字篡改更难被闭集判别器识别的问题,论文把检测改写为估计图像局部回到真实视觉文本统计所需的“修复代价”。其核心是稀疏约束 Rectified Flow,配合自监督伪造注入和像素空间 Forensic-DiT 保留高频取证线索。在三个基准上取得 SOTA,F1 和 IoU 分别较次优高 3.2、4.8 个百分点,并显示较强零样本泛化。

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts Figure 1
2026-08-04cs.CV

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

ARTORG Center for Biomedical Engineering Research, University of Bern, Shanghai Jiao Tong University, ARTORG Center for Biomedical Engineering Research, University of Bern Bern Switzerland, Shanghai Jiao Tong University Shanghai China

2026-08-04数据集/基准

这篇论文针对胸片视觉语言预训练过度依赖 MIMIC-CXR、难以利用多源分类数据的问题,提出 HarMoE:用统一 229 类疾病词表和掩码监督整合 873K 图像,并以数据集感知低秩残差专家隔离来源偏差、保留共享病理表征。实验显示其在 11 个基准上提升零样本分类、域外迁移和定位,RSNA、COVID-QU-Ex、Montgomery 的 AUC 分别提升 2.9%、4.6%、4.1%。

An Accessible Solution for Deformable Image Registration Compared with Learning-Based Approaches Figure 1
2026-08-04eess.IV

An Accessible Solution for Deformable Image Registration Compared with Learning-Based Approaches

Onur Ali Zeybekoglu, David Tilly, Orcun Goksel

2026-08-04视觉感知

针对形变图像配准中深度模型虽快但可解释性和物理约束较弱的问题,本文重新审视基于全变分正则的 pTVreg,给出更易用的 Python 实现,并结合 ADMM 优化、高阶插值与贝叶斯超参自动调节。在 Lung250M-4B 肺 CT 基准上,该方法超过多种学习式方法和既有 pTVreg 变体,说明经典解析方法在特定 DIR 任务中仍可取得领先结果。

GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition Figure 1
2026-08-04cs.CV

GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition

Jidong Kuang, Hongsong Wang, Jie Gui

School of Cyber Science and Engineering, Southeast University, School of Computer Science and Engineering, Southeast University, School of Cyber Science and Engineering, Southeast University Nanjing China

2026-08-04视觉感知生成模型

针对零样本骨架动作识别中纯文本类别原型缺少几何结构和物理约束、易与真实骨架分布错位的问题,GenPrior把预训练文本到动作模型生成的运动序列作为结构先验,提取运动原型与类内离散度,并用门控融合和推理阶段原型细化抑制合成噪声、校准未见类边界。在NTU-60、NTU-120和PKU-MMD上,文中报告其在ZSL与GZSL设置下均达到当前最优。

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use Figure 1
2026-08-04cs.CV

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

2026-08-04视觉感知

这篇论文针对视觉语言模型在固定工具集上易记忆调用模式、难以多步组合并根据工具反馈调整的问题,提出 VC-Tooler:用分层合成轨迹覆盖单工具 grounding、多工具组合和多样工具接口,再经监督冷启动与工具感知强化学习训练。实验称其在 8 个通用与智能体基准上达到开源模型 SOTA,V* 为 95.8%、VTC-Bench 为 35.3%,但数据合成与 RL scaling 对增益的贡献仍需进一步拆解。

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models Figure 1
2026-08-04cs.CV

Local Margin Restoration for Test-Time Adaptation of Vision-Language Models

Yan Huang, Guowei Wang, Xu Wang, Kangjun Liu, Xin Lin

Guangzhou University, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine, Jinan University, Pengcheng Laboratory, Guangzhou University Guangzhou China, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine Guangzhou China, Jinan University Zhuhai China, Pengcheng Laboratory Shenzhen China

2026-08-04视觉语言视觉感知

这篇论文针对 CLIP 等视觉语言模型在测试时分布偏移下易被错误伪标签带偏的问题,指出失败不只来自置信度不足,还来自近邻类别语义几何被破坏和流式偏置累积。方法 LMR 用 PMR 保护近 top 候选、只拉开外部 hard negatives,并用自适应 margin 与偏置校正抑制模式坍塌;在 CIFAR-C、ImageNet-C 和 ImageNet 变体上优于多种 TTA 基线,低 batch 场景也保持较好效率与鲁棒性。

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting Figure 1
2026-08-04cs.CV

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

Kaiyuan Pu, Tiantian Yang, Dan Zeng

School of Artificial Intelligence, Sun Yat-sen University, The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR, Sun Yat-sen University Zhuhai China, The Technology Innovation Center for Collaborative Applications of Natural Resources Data in GBA, MNR Guangzhou China

2026-08-04三维

VARPose针对稀疏2D关节输入限制3D lifting表达力、遮挡下易产生深度歧义的问题,将VAR的next-scale思想迁移到骨架粒度,把关节密度视为尺度;其粒度无关Pose Tokenizer用统一码本编码多密度姿态,UniSkelar再由粗到细生成密集2D姿态。实验称其在姿态稠密化上优于既有方法,并能提升3D姿态估计与人体网格恢复,尤其缓解遮挡和检测误差导致的结构崩塌。

Self-supervised DXA representations encode multi-system disease risk, biological aging and heritability Figure 1
2026-08-04cs.CV

Self-supervised DXA representations encode multi-system disease risk, biological aging and heritability

Gil Sasson, Zachary Levine, Smadar Shilo, Sarah Kohn, Guy Lutsker, Anastasia Godneva, Adam Gabet, David Krongauz, Adina Weinberger, Yann LeCun, Randall Balestriero, Eran Segal

Department of Computer Science and Applied Mathematics, Weizmann Institute of, Gray Faculty of Medical and Health Sciences, Tel Aviv University, Tel-Aviv, Israel., The Jesse Z and Sara Lea Shafer Institute for Endocrinology and Diabetes, National Center for, Childhood Diabetes, Schneider Children’s Medical Center of Israel, Petah Tikva, Israel., Department of Molecular Cell Biology, Weizmann Institute of Science, Rehovot, Israel., Courant Institute of Mathematical Sciences, New York University, New York, NY, USA., AMI Labs, Paris, France., Department of Computer Science, Brown University, Providence, RI, USA., Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE., Prof. Eran Segal, Department of Computer Science and Applied Mathematics, Weizmann, Institute of Science, Rehovot, Israel, Tel: 972-8-934-3540, Fax: 972-8-934-4122, Email:, pixels. Trained from scratch on 11,540 unlabeled Human Phenotype Project scans, LeDXA was

2026-08-04安全鲁棒

常规 DXA 只输出骨密度、脂肪和瘦体重等标量,丢掉全身空间结构;本文用 LeJEPA 在 1.15 万张无标注 DXA 上训练 LeDXA,直接学习全身表征。外部 UKBB 验证显示,其在现患/新发疾病、年龄表型和死亡风险分层上优于 DXA 表格读数与 DINOv3,并能恢复骨和体成分相关遗传信号。

CLEAR: Conflict-aware Learning via Evidence-guided Adaptive Routing for Unified Sparse-View 3D Gaussian Super-Resolution Figure 1
2026-08-04cs.CV

CLEAR: Conflict-aware Learning via Evidence-guided Adaptive Routing for Unified Sparse-View 3D Gaussian Super-Resolution

Hantang Li, Qiang Zhu, Xiandong Meng, Debin Zhao, Xiaopeng Fan

2026-08-04三维

本文针对稀疏、低分辨率视图下3D Gaussian超分辨率中几何约束不足与高频细节缺失的问题,提出单阶段CLEAR框架,将真实LR观测与外部HR先验统一优化。核心洞察是稀疏视角会加剧LR/HR梯度冲突,因此以LR梯度为锚进行冲突感知校正,并用证据引导的Patch-to-Gaussian路由选择性注入细节和致密化。实验称在合成与真实4×超分辨率基准上提升渲染质量与几何保真度。

RSC-GestureNet: Reliability-Aware Selective Causal Recognition of Chinese Traffic Police Gestures Figure 1
2026-08-04cs.CV

RSC-GestureNet: Reliability-Aware Selective Causal Recognition of Chinese Traffic Police Gestures

Cheng Li, Renjun Gao, Boyi Fu

2026-08-04视觉感知

面向自动驾驶中交通警察手势需在线、稳定且可拒判识别的问题,论文提出 RSC-GestureNet,将姿态置信度显式纳入图推理、因果时序聚合和选择性输出,并构建 CTPGesture-C 腐蚀评测。其在官方 CTPGesture v1 因果协议上达到 91.71% macro-F1、91.69% 在线 macro-F1,较复现的 MD-GCN/HLP-GCN 提升约 3.23–4.11 个 macro-F1 点,表明可靠性建模有助于早期和鲁棒识别。

T$^2$exture: Sparsely Perturbed Thermal-to-Texture Imaging Figure 1
2026-08-04cs.CV

T$^2$exture: Sparsely Perturbed Thermal-to-Texture Imaging

Jiashuo Chen, Cheng Dai, Yanan Hu, Fanglin Bao

2026-08-04视觉感知

针对被动长波红外图像细纹理缺失、光谱采集或可见光配准代价高且易退化的问题,T²exture用少量主动热扰动关键帧与密集被动帧重建连续热纹理;核心是把热纹理定义为source-on/off残差,并用两阶段AMT/VFI先估计被动基线、再传播稀疏锚点。模拟与真实实验显示纹理和结构保持优于VFI基线,AMT-L仅增0.20M参数、PSNR提升6.66 dB。

DerainSplat: Feed-Forward Clean 3D Gaussian Splatting from Sparse Rainy Views Figure 1
2026-08-04cs.CV

DerainSplat: Feed-Forward Clean 3D Gaussian Splatting from Sparse Rainy Views

Fuzhen Jiang, Changyue Shi, Chuxiao Yang, Xinyuan Hu, Wenjie Ye, Minghao Chen

2026-08-04三维

面向具身智能、自动驾驶等需要稳定三维感知的雨天场景,本文指出先单帧去雨再做前馈 3DGS 会破坏跨视角一致性。DerainSplat 通过合成多视角雨天数据和显式天气因子监督,将天气分解为几何匹配与外观融合的支持信号,并用雨天循环一致性约束干净重建。实验在 RealEstate10K、ACID、Mip-NeRF360 和真实雨景上优于现有前馈基线,但效果可能部分来自专门构建的数据规模与合成因素覆盖。

SPIRIT: Spatio-temporal Pairwise Relational Modeling of Instrument-Tissue Interactions for Surgical Action Triplet Recognition Figure 1
2026-08-04cs.CV

SPIRIT: Spatio-temporal Pairwise Relational Modeling of Instrument-Tissue Interactions for Surgical Action Triplet Recognition

Saurav Sharma, Lorenzo Arboit, Nabani Banik, Sarah Meuli, Julia Alekseenko, Jan Liechti, Franziska Heitzinger, Michela Orsi, Didier Mutter, Daniel Gero, Philipp C. Nett, Beat P. Muller, Joel L. Lavanchy, Nicolas Padoy

University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France, University of Pavia, Italy, University Digestive Health Care Center – Clarunis, Basel, Switzerland, Department of Surgery, Università di Roma Tor Vergata, Rome, Italy, University Hospital of Strasbourg, France, University Hospital Zurich, Switzerland, University Hospital Bern, Switzerland, Department of Biomedical Engineering, University of Basel, Allschwil, Switzerland

2026-08-04视觉感知

这篇论文针对手术动作三元组识别在不同医院间泛化不足的问题,认为将“器械-动作-目标”直接当作扁平类别会丢失交互结构。SPIRIT先学习器械、动词和目标的时空表示,再显式建模器械-目标与器械-动词关系,并用图推理组合三元组。在新建的四中心胃旁路MultiBypass-4C-T40基准上,模型在多种评测协议中优于强基线,增益主要体现于成对关系和最终三元组层面。

SWINSleepNet: A Hierarchical Context-Aware Framework for Sleep Staging (v2) Figure 1
2026-08-04cs.CV

SWINSleepNet: A Hierarchical Context-Aware Framework for Sleep Staging (v2)

Chongjian Wang, Junjie Gao

2026-08-04视觉感知

针对自动睡眠分期在N1等过渡阶段易混淆、单个epoch内细粒度结构与跨频谱区域依赖建模不足的问题,论文提出SwinSleepNet,将原始EEG卷积分支与时频图Swin Transformer分支融合,再用双向上下文模块建模跨epoch时序。实验在Sleep-EDF-20、Sleep-EDF-78和SHHS上显示整体指标较强,并对N1及过渡epoch更稳定,但具体增益相对各模块的来源仍需消融进一步确认。

GSRAIN: Physically Calibrated High-/Low-Frequency Rainfall Synthesis for 3D Gaussian Driving Scenes Figure 1
2026-08-04cs.CV

GSRAIN: Physically Calibrated High-/Low-Frequency Rainfall Synthesis for 3D Gaussian Driving Scenes

Fanyu Wang, Longgao Zhang, Junyi Chen

Fanyu Wang, Longgao Zhang, and Junyi Chen are with the College of Automotive and Energy Engineering, Tongji University, Shanghai, China.Corresponding author: Junyi Chen.

2026-08-04三维

面向自动驾驶雨天测试中真实降雨难控制、现有仿真缺少物理标定和多视角一致性的问题,GSRAIN将3DGS场景中的雨效拆成高频雨滴/雾化与低频湿路面外观:前者由实测降雨数据映射到0–13 mm/h强度,后者用几何感知单步扩散做多视角外观迁移并融合渲染。实验中FID为149.09,优于CycleGAN-Turbo和WeatherEdit,并在检测与闭环驾驶评估中呈现场景相关的性能变化。

AdaForensics: Learning A Characteristic-aware Adaptive Deepfake Detector Figure 1
2026-08-04cs.CV

AdaForensics: Learning A Characteristic-aware Adaptive Deepfake Detector

Xiaoke Yang, Haixu Song, Xiangyu Lu, Shao-Lun Huang, Yueqi Duan

Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China, Department of Electronic Engineering, Tsinghua University, Beijing, China

2026-08-04视觉感知

针对固定深度伪造检测器难以适应不同人脸特征导致的伪造痕迹差异,AdaForensics将检测知识分解为特征无关与特征相关两部分,并用双分支HyperNetwork按输入人脸动态生成主检测器层权重。论文在FaceForensics、Celeb-DF和DFDC上的同域与跨域实验报告优于现有方法,但具体增益与模型规模、训练数据的关系仍需进一步核验。

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs Figure 1
2026-08-04cs.CV

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin

State Key Lab. of Blockchain and Data Security, Zhejiang University, ZJU-Hangzhou Global Scientific and Technological Innovation Center, Mohamed Bin Zayed University of Artificial Intelligence

2026-08-04视觉感知数据集/基准

这篇论文针对视频大模型在具身智能与世界模型中缺乏物理规律理解的问题,提出 PhyCheck 数据集,用粗粒度合规判断、细粒度视觉证据链和带外部因果背景的诊断子集来评估物理一致性。实验显示,用该数据微调 Qwen2.5-VL 可提升物理一致性判断,但模型在利用额外因果条件修正判断上仍明显不足。

Douyin Multimodal Embedding Model Technical Report Figure 1
2026-08-04cs.IR

Douyin Multimodal Embedding Model Technical Report

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

Renmin University of China GSAI, scalable, compatible with offline corpus encoding, and well aligned with industrial vector-search systems. However

2026-08-04视觉语言

面向抖音等十亿级多模态检索,论文试图解决传统对比式 MLLM embedding 高效但细粒度不足、显式 CoT 又难在线服务的问题。DME 采用两阶段训练,在大规模对比预训练后加入隐藏空间证据型潜在推理和训练期交叉条件重建,使向量同时保留检索证据与对端语义。实验中 2B/9B 在 MMEB-v2 达到 74.8/78.4,视频和视觉文档检索优势明显,线上搜索 A/B 报告 0.1% LT 增益。

UniqueSplat: View-conditioned 3D Gaussian Splatting for Generalizable 3D Reconstruction Figure 1
2026-08-04cs.CV

UniqueSplat: View-conditioned 3D Gaussian Splatting for Generalizable 3D Reconstruction

Haixu Song, Xiaoke Yang, Shengjun Zhang, Jiwen Lu, Yueqi Duan

2026-08-04三维

面向稀疏视图下可泛化三维重建,论文指出现有前馈3DGS为整个场景预测固定高斯,难以适配目标视角而产生裂缝、模糊等伪影。UniqueSplat将目标视角条件写入高斯预测过程,用双分支超网络分别建模跨视角共享信息与视角特定知识,为每个查询视角动态生成定制辐射场。在RealEstate10K、ACID、DTU及跨数据集测试中优于pixelSplat、MVSplat等方法,显示较强泛化能力。

Quaternion Tensor Modeling for Joint Color-Polarization Demosaicking Figure 1
2026-08-04cs.CV

Quaternion Tensor Modeling for Joint Color-Polarization Demosaicking

Yanqing Song, Jifei Miao, Chaoqian Li, Rui Mei, Kit Ian Kou, Liqiao Yang

School of Mathematics and Statistics, Yunnan University, Kunming, Yunnan, 650091, China, Department of Mathematics, Faculty of, Science and Technology, University of Macau, Macau 999078, China, School of Computing and Artificial Intelligence, Southwestern University of Finance and Economics

2026-08-04视觉感知

这篇论文针对彩色偏振滤波阵列每像素只观测12个潜在分量之一、导致联合去马赛克病态且易产生伪影的问题,提出将四个偏振方向编码为三阶四元数张量,并以颜色通道为第三模施加低秩先验;同时把空间梯度变换到 Stokes 域,用自适应权重分别约束强度、偏振和残差变化。实验显示该优化模型在去马赛克质量上优于现有插值、优化和学习方法。

HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams Figure 1
2026-08-04cs.CV

HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams

Shivani Mall, Swarnim Jain, Joao F. Henriques

Swarnim Jain 1 1 1 Intern at VGG from the University of Cambridge., Visual Geometry Group, University of Oxford

2026-08-04视觉感知

这篇论文针对全高清视频识别中卷积和视觉 Transformer 随分辨率近二次增长的显存与计算瓶颈,提出 HiResNets:把残差流作为全分辨率缓冲区,让残差块仅通过可微 log-polar 变换在焦点附近高分辨率读写,并可逐层移动焦点。实验显示该结构在自我中心视频、小目标和细粒度识别任务上优于常规骨干,同时降低计算并产生较可解释的类人注视策略。

Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models Figure 1
2026-08-04cs.CV

Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models

Xuanhui Lin, Junhao Dong, Mingrong Gong, Yucheng Chen, Xinghua Qu, Yew-Soon Ong

2026-08-04视觉语言视觉感知

本文针对视觉语言模型对抗攻击常沿单一路径、跨任务迁移弱且优化成本高的问题,提出 CoEvoAttack:在文本侧演化源类附近的 hard negative 语义,在图像侧对目标物体区域维护扰动种群,并结合动量梯度、选择、变异和交叉共同搜索。作者给出可行性与最优适应度不退化分析,并在 Florence-2、OFA、UnifiedIO-2 的图像描述、检测、区域分类和定位任务上报告更高平均攻击成功率与跨任务成功率。

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression Figure 1
2026-08-04cs.CV

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang

Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing, China, School of Future Technology, University of Chinese Academy of Sciences, Beijing, China, School of Engineering, Cardiff University, Cardiff, United Kingdom

2026-08-04视觉语言

这篇论文针对高分辨率 VLM 中视觉 token 过多导致推理和 KV cache 成本上升的问题,指出传统 Top-K 重要性筛选会重复保留显著区域并丢失互补证据。作者提出训练免费的 GMC,将压缩视为保留解码器“消息”的 coreset:联合选择查询相关、外观和坐标证据载体,并把被删 token 的状态迁移到代表 token。实验显示在 Qwen2.5-VL-7B 上减少 80.2% 视觉 token 仍保留 97.78% 平均能力,部分配置达到 100.36%。

PromptPath: Prompt-Adaptive Computational Pathways for In-Context Learning Figure 1
2026-08-04cs.CV

PromptPath: Prompt-Adaptive Computational Pathways for In-Context Learning

Hangrui Zhang, Feifei Shao, Yawei Luo, Ping Liu, Jiaxiang Liu, Zuoqi Tang, Zhao Wang, Hongwei Wang, Jun Xiao

Zhejiang University, China, University of Nevada, Reno, USA, Guangdong Institute of Intelligence Science and Technology, China

2026-08-04视觉感知

本文针对视觉上下文学习中提示只影响输入表征、难以改变深层计算流程的问题,提出 PromptPath:由提示驱动路由选择并组合轻量低秩专家,使不同任务形成显式、可解释的动态计算路径。实验覆盖 3D 点云与 2D 视觉识别,报告相较 MICAS、Condenser 等基线稳定提升,并具备跨数据集、跨任务泛化能力。

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models Figure 1
2026-08-04cs.CV

HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models

Jin Cui, Chuanchang Su, Jiayi Lu, Xinyue Long, Boran Zhao, Pengju Ren

2026-08-04视觉语言视觉感知

这篇论文针对VLM在小文字、细粒度属性和局部纹理等任务上视觉证据不足的问题,提出“频谱响应刚性”这一诊断:预训练视觉编码器的层级频率分配主要由架构和预训练决定,难随问题变化。HAFI-VLM通过DCT频率分支、文本调制的多层频率注入和浅层LLM适配器补充任务相关证据,在LLaVA-1.5和Qwen2.5-VL上提升通用VQA、文本理解与抗幻觉表现。

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression Figure 1
2026-08-04cs.CV

Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression

Tianyu Liang, Xiangxi Zheng, Yilin Wang, Dongxing Mao

Southeast University, Nanjing University, Zhejiang University, National University of Singapore, Southeast University Nanjing China, Nanjing University Nanjing China, Zhejiang University Hangzhou China, National University of Singapore Singapore Singapore

2026-08-04视觉感知

这篇论文关注视觉文本压缩中“把长文本渲染成图像再由 ViT 编码”带来的语义偏移:同一内容走文本路径和图像路径会产生不一致表示。作者提出 SPIRAL,用模型自身文本路径监督图像路径,结合 token 级 on-policy distillation 与序列级 DPO 对齐局部忠实性和整体连贯性。在 VTCBench 上,Qwen3-VL-8B 分数从 35.10 提升到 54.02,接近原生文本输入的 55.60,并显示一定跨基准泛化。

DeGS: A Scalable 3DGS Architecture via Decoupled Workload Parsing and Reorganization Figure 1
2026-08-04cs.AR

DeGS: A Scalable 3DGS Architecture via Decoupled Workload Parsing and Reorganization

Minnan Pei, Gang Li, Zeyu Zhu, Siting Wang, Junwen Si, Zhuoran Song, Yu Feng, Fangxin Liu, Xiaoyao Liang, Jian Cheng

2026-08-04生成模型三维

本文针对3D Gaussian Splatting 渲染加速器扩展性差的问题,指出瓶颈来自“边检查边混合”数据流放大空间冗余和像素异步终止带来的时间冗余。DeGS 将有效工作解析、任务重组和颜色混合解耦,用 span parsing 与打包调度把不规则负载整理成无冲突的稠密包。28nm 评估显示其相对 GSCore、GBU、GCC 提升吞吐 2.36–7.25 倍、端到端速度 1.82–6.02 倍,并在高分辨率下扩展到 1024 个 PE 仍保持 80% 以上利用率。

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion Figure 1
2026-08-04cs.CV

Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

2026-08-04视觉语言视觉感知

针对可见光-红外检测中模态不对称、直接特征混合易导致单模态过拟合和梯度冲突的问题,论文提出训练/推理解耦的 ADCR:训练时用语义掩码在双分支间交换空间特征以削弱模态身份依赖,推理时用可学习通道竞争选择更可靠通道。五个基准实验显示其相对 SOTA 有持续提升,尤其在模态失衡和空间错位场景更明显。

CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding Figure 1
2026-08-04cs.CL

CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding

Wei Jia, Zhicong Lu, Yu Chen, Xiang Wang, Shuai Li, Wenqian Lv, Jiayue Cao, Huaxing liu

2026-08-04视觉语言视觉感知学习理论

本文针对视频时序定位中仅用最终区间 IoU 奖励会造成“看到了边界却没生成正确时间戳”的证据—时间戳错配问题,提出 CAVE:用起止边界证据 token、监督热身、边界视觉证据奖励和按定位能力自适应衰减的 PAGE 门控,把注意力证据显式对齐到真实边界。多组 VTG 基准实验显示其提升定位精度,并减少证据与预测时间戳的不一致。

STEAM:ASpatio-TEmporal Alignment Mixture-of-Experts Model with Hierarchical Pre-training for EEG Decoding Figure 1
2026-08-04cs.CV

STEAM:ASpatio-TEmporal Alignment Mixture-of-Experts Model with Hierarchical Pre-training for EEG Decoding

Zhu Chen, Dingkun Liu, Yuheng Chen, Dongrui Wu

2026-08-04视觉感知

针对 EEG 解码中跨范式泛化弱、面向特定范式再训练成本高、下游适配参数量大的问题,STEAM 采用通用到范式的分层预训练,并用双分支时空编码、共享软 MoE 对齐空间与时间表征,同时引入频率感知注意力。实验覆盖 7 个数据集和 14 个设置,模型取得最佳平均排名,计算成本相对可控,Stage-II 范式专门化和仅更新约 5.1% 参数的轻量适配也带来稳定收益。

GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation Figure 1
2026-08-04cs.CV

GIFT: Geometry-Invariant Fine-Tuning for Non-Lambertian Monocular Depth Estimation

Xianghui Fan, Zhaoyu Chen, Bingqian Wu, Dayu Li, Xin Zeng, Huanran Cui, Guangzhen Xu, Xiangru Huang, Hang Yang

2026-08-04视觉感知

本文针对单目深度模型在镜面、透明物体上把反射或透射内容误当真实几何的问题,提出 GIFT:在相机和目标几何固定、外观受控变化的图像组上,用几何一致性损失配合冻结模型自蒸馏,无需实测深度标签并以 LoRA 高效微调。实验在 GIFT-I 与 Booster 上显示,方法能降低非朗伯表面的深度幻觉,同时基本保持原模型在其他区域的能力。

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing Figure 1
2026-08-04cs.CV

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

2026-08-04视觉感知数据集/基准

针对多源图像编辑评测仍沿用单图编辑基准、难以同时衡量视觉质量、指令遵循和属性保持的问题,论文构建了含3000个实例、16类任务、36K结果和108K MOS的MIE-Bench,并在其上训练MLLM评测器MIEScore。实验显示其与人类偏好相关性优于传统IQA、视觉语言指标和现有MLLM评测方法,且可泛化到其他IEQA数据集;但具体增益可能主要来自更贴近任务的数据与监督。

TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval Figure 1
2026-08-04cs.CV

TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval

Ji Huang, Yongsheng Dai, Tianyu Ren, Barry Devereux, Hui Wang

2026-08-04视觉感知

这篇论文针对视频时刻检索中静态场景图只能逐帧建模、难以表达对象关系随时间演化和持续时长的问题,提出基于动态场景图的 TBSG-Net。其核心是将动态场景图转为带时间跨度的时序二部场景图,并用结合 Transformer 与 GCN 的编码器同时建模全局事件依赖和局部关系。实验在 Charades-STA 及两个抗偏置变体上取得更高 R@1,IoU=0.7 相对提升最高达 42.32%,并展示了到 ActivityNet Captions 的零样本泛化。

Protocol generalisation for brain tissue microstructure estimation via hypernetwork-controlled geometric deep learning Figure 1
2026-08-04eess.IV

Protocol generalisation for brain tissue microstructure estimation via hypernetwork-controlled geometric deep learning

Andrea Brigliadori, Leevi Kerkela, Hui Zhang

2026-08-04规划控制

针对扩散 MRI 微结构估计中机器学习模型随 b-vector 或 b-value 改变需重训、且难兼顾旋转等变性的问题,论文用超网络根据 b-value 生成 SCNN 权重,使模型同时覆盖 b-vector 与 b-value 协议变化。以 NODDI 合成与在体数据验证,hSCNN 在未见 b-value 上降低 RMSE 和偏差,并与传统拟合结果更一致,显示可减少协议变化带来的重训需求。

Mapping melliferous tree species in Kenya via one-class classification with hyperspectral unsupervised domain adaptation Figure 1
2026-08-04eess.IV

Mapping melliferous tree species in Kenya via one-class classification with hyperspectral unsupervised domain adaptation

Zhaozhi Luo, Janne Heiskanen, Ilja Vuorinne, Ian Ocholla, Shiqi Zhang, Saana Järvinen, Xinyu Wang, Yanfei Zhong, Petri Pellikka

a Department of Geosciences and Geography, University of Helsinki, P.O. Box 64, 00014 Helsinki, Finland, b Finnish Meteorological Institute, P.O. Box 503, 00101 Helsinki, Finland, c Institute for Atmospheric and Earth System Research, University of Helsinki, P.O. Box 4, 00014 Helsinki, Finland, d School of Emergency Management, Xihua University, 610037 Chengdu, China, e School of Remote Sensing and Information Engineering, Wuhan University, 430079 Wuhan, China, f State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, 430072 Wuhan, China, extensive labeled data from other classes. Although existing OCC methods perform well in trained domains, the, patterns of these melliferous tree species and the nectar source availability, offering an important reference for, Contents lists available at ScienceDirect, Available online 8 January 2026, -2716/© 2025 The Authors. Published by Elsevier B.V. on behalf of International Society for Photogrammetry and Remote Sensing, Inc. (ISPRS). This is an, ground-based field surveys (Thijs et al. 2015), which are labor-intensive

2026-08-04视觉感知

肯尼亚养蜂业受限于关键蜜源树种空间分布不清,论文用机载高光谱与激光雷达数据提出 HyUDA-One,将一类分类与无监督域自适应结合,并用空间-光谱正则化伪正样本学习缓解跨区域域偏移。结果显示其在未标注区域泛化更好,训练域三类树种 F1 为 0.768–0.845,未训练域两类 F1 达 0.756 和 0.884,并生成蜜源可用性地图。

Déjà Cue: Localizing States in Object Histories via Vocabulary-Relative Coordinates Figure 1
2026-08-04cs.CV

Déjà Cue: Localizing States in Object Histories via Vocabulary-Relative Coordinates

Haofan Cao, Zhichao You, Yunkai Yang, Liang Guo, Jie Wang, Chongshou Li

2026-08-04视觉感知

论文关注同一物体在视频历史中“何时处于某状态”的定位问题,指出独立图文相似度会被物体身份等共享信息掩盖状态差异。Déjà Cue 的核心洞察是把同组候选状态描述作为相对坐标系,减去状态均衡中心后再做稳健标定和可见段多尺度扫描,无需训练。在 78 个 VOST 历史上,仅改变查询参考系就将 tIoU 0.5 的 R@1 从 10.3% 提升到 20.5%,Top-1 tIoU 从 16.0% 提升到 21.5%。

RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos? Figure 1
2026-08-04cs.CV

RSVideo: Are Your Vision-Language Models Ready for Remote Sensing Videos?

Hongjie Zhou, Shiqin Wang, Haoyang Chen, Haonan Guo, Di Wang, Juhua Liu, Fu Lin, Yong Luo

Wuhan University, Zhongguancun Academy

2026-08-04视觉语言视觉感知

论文针对连续遥感视频中小目标、短暂状态和场景约束空间关系难以被现有视觉语言模型捕捉的问题,构建 RSVideo-10K/RSVideo-Bench 统一评测,并提出基于时空证据聚焦的强化学习框架,在固定视觉 token 预算下保留相关帧区证据、压缩背景。实验显示现有模型从自然视频迁移到遥感视频存在约 40.7% 性能落差,RSVideo 在 26 个开源骨干上稳定提升,最高增益 9.01%,最佳准确率 40.63%。

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents Figure 1
2026-08-04cs.CV

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

Jia-Chen Zhang, Ze-Yu Zhang, Kai-Wei Zhang

2026-08-04视觉感知

这篇论文关注计算机使用代理中的间接提示注入:许多攻击并非删除文件或转账,而是点赞、关注、下载包等低危动作,因看似合理而绕过人工确认。作者提出 II-Bench 与 HITLCUA,在虚拟机和隔离 Web 环境中模拟人类审核,覆盖 444 个样例。实验显示,主流 CUA 对这类“隐形墨水”目标仍频繁执行,说明现有人在环防线对低显著性攻击存在系统盲区。

Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling Figure 1
2026-08-04cs.CV

Beyond Global Latents: Chunk-Based Sparse Grid VAE for Scalable 3D Modeling

Kaiyi Zhang, Zhihao Liang, Haolin Liu, Qingxiang Lin, Zeqiang Lai, Yunfei Zhao, Bowen Zhang, Xianghui Yang, Zibo Zhao, Chunchao Guo, Long Quan

Hong Kong University of Science and Technology, The Chinese University of Hong Kong

2026-08-04生成模型三维

这篇论文针对高分辨率稀疏体素 VAE 随活跃表面单元增长而显存、计算迅速上升的问题,提出将全局潜空间改为可拼接的局部 chunk 表示。核心在于用局部算子、BBOP 均衡划分和 S-Curve 加权缝合,使训练与推理 chunk 大小、编码与解码分区解耦。实验显示其在 512³ 到 1536³ 重建及图像到 3D 指标上达到或接近最优,并能以更小显存支持并行推理。

ASTRA: Asynchronous Spatio-Temporal Reconstruction via Trajectory Alignment Figure 1
2026-08-04cs.CV

ASTRA: Asynchronous Spatio-Temporal Reconstruction via Trajectory Alignment

Junyu Zhu, Hao Zhu, Xinzhuo Zhang, Hongdong Li, Zhan Ma, Xun Cao

J. Zhu, H. Zhu, Z. Ma, X. Cao are with the School of Electronic Science and Engineering, Nanjing University, Nanjing, 210023, China.

2026-08-04规划控制三维

ASTRA针对多相机动态三维重建中常见的帧不同步问题,指出仅靠光度误差会在低纹理区域失去时间对齐信号,并把时间偏差错误吸收到形变或几何中。其核心做法是用2D运动轨迹监督重建点的投影运动,联合优化相机时间偏移与动态高斯表示,并通过动态与置信掩码过滤不可靠轨迹。在4DGS、EDGS等骨干上,方法在最高25帧异步下仍保持较稳同步,约提升1.4 dB PSNR、时间偏移MAE降低54.0%,同步成功率接近提升4倍。

SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching Figure 1
2026-08-04cs.CV

SPARE: Structural Parameter-Free Affinity Regularization for Flow Matching

Zong-Wei Hong, Jinglun Li, Shen Zhang, Yuhan Liu, Linze Li, Yao Tang

2026-08-04生成模型

本文针对扩散/flow matching Transformer 训练慢、表示正则化常依赖外部编码器或只做无目标排斥的问题,提出 SPARE:直接用干净 VAE latent 中 token 两两相似度作为结构目标,匹配图像内及跨图像同位置亲和关系,无需投影头和新增参数。在 ImageNet 256×256 的 SiT 训练中,它以约 0.08GB 额外显存取得参数免费正则器中最低 FID,并可与 REPA 叠加提升到 FID 1.90。

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes Figure 1
2026-08-04cs.CV

Grounding and Explaining Visual Evidence for AI-Generated Image Detection in Human-Centric Scenes

Kun Guo, Yuzhou Yang, Haoyue Wang, Qichao Ying, Sheng Li, Zhenxing Qian

2026-08-04视觉语言视觉感知

针对人像等人本场景中 AI 生成图像检测只给真假、解释与证据区域不一致的问题,论文构建 HAVE 数据集,覆盖约 7.9 万张图像和 10.6 万个带框证据及区域解释,并提出 PAVE 联合完成真假判断、证据定位与解释生成,通过裁判式对齐奖励和感知正则促使模型依赖可见区域。实验显示其在 HAVE 与外部数据上的检测、定位和解释质量均优于对比方法,但具体增益中数据规模与方法设计的贡献仍需区分。

DiffPrune: differentiable information throttling for token pruning in vision-language models Figure 1
2026-08-04cs.CV

DiffPrune: differentiable information throttling for token pruning in vision-language models

Landi He, Mingde Yao, Shawn Young, Lijian Xu

Shenzhen University of Advanced Technology, CUHK MMLab, CPII under InnoHK

2026-08-04视觉语言视觉感知

这篇论文针对视觉语言模型视觉 token 过多导致推理成本高、而现有 Gumbel-Softmax/STE 剪枝训练存在前向硬选择与反向软近似不一致的问题,提出 DiffPrune:训练时不丢 token,而用按重要性调制的保方差噪声连续削弱信息,使评分直接反映信息损失;推理时再按分数 Top-K 硬剪枝。在十个 VLM 基准上保留 96.5% 全模型精度,并将 LLM prefill 加速 2.85 倍,额外开销 0.69 ms。

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning Figure 1
2026-08-04cs.CV

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

2026-08-04视觉感知

AdaThinkV针对视频多模态模型在简单问题中过度链式推理、复杂问题又可能推理不足的问题,将“是否显式思考”建模为按题估计的准确率收益与输出长度成本权衡。其ThinkGain用成对THINK/ANSWER rollout监督模式选择,VRPO扩展低方差失败样本以恢复RL信号;在统一视频推理评测中平均准确率40.79,较最强自适应基线高2.98点且少用22.7%输出token。

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs Figure 1
2026-08-04cs.CV

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

2026-08-04视觉感知

ET-Prune针对文本密集MLLM中固定视觉token保留率容易删掉小字、标签或字段证据的问题,将剪枝改写为按问题分配证据预算:用解码器侧partial-QK估计问题相关视觉证据,保护类文本区域,并按证据不确定性和文本密度动态设定token下限。实验显示其在两类骨干、三个文本富集基准的六组比较中领先或持平,在约保留一半视觉token时优于剪枝基线,OCRBench-v2上分别提升1.80和0.68个百分点。

Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation Figure 1
2026-08-04cs.CV

Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation

Haijie Yang, Jindi Bao, Yixuan Dong, Hongliang Zhang, Jian Bi, Hao Tang, Zhenyu Zhang, Jianjun Qian, Jian Yang

2026-08-04规划控制

该文针对音频驱动肖像动画中情绪控制弱、扩散推理反复计算外观特征导致难以实时的问题,提出先用一次训练的高斯情绪代理头像生成可控运动,再通过 one-shot 重定向迁移到任意人像,并用低秩缓存复用参考外观特征。实验称其在 RTX 4090 上实现实时生成,同时提升情绪表现、身份保持并降低推理成本。

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation Figure 1
2026-08-04cs.CV

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni

2026-08-04视觉感知数据集/基准

文本到 SVG 生成已有进展,但评测仍依赖代码检查或栅格图指标,难以捕捉几何、布局等人类感知中的关键问题。SVGEval 将 SVG 代码与渲染结果共同纳入评估,设计语义、几何、空间布局和美学四维协议,并用多轮人工标注构建分阶段基准。实验显示,多模态模型在语义和美学判断较好,但在几何与布局评估上明显不足;基于该数据训练的可解释评分器也表明视觉 grounding 与推理监督是主要增益来源。

Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis Figure 1
2026-08-04cs.RO

Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

Lingwei Dang, Ziyan Qiu, Jiajia Cheng, Shishuo Shang, Zhenhao Zhang, Yufei Zhu, Qingxin Xiao, Pan Liu, Shenghui Huang, Yun Hao, Juntong Li, Qingyao Wu

2026-08-04三维

针对三维室内布局生成器常出现碰撞、越界、遮挡门窗和阻塞通行等局部残余错误,Roomer将修复建模为对象级、验证门控的局部状态编辑:用RoState/RoReview定位责任物体,由视觉语言规划器提出StatePatch,再经确定性候选搜索和全场景校验后提交。论文还构建Roomer-CC和Roomer-Eval,实验显示其在保留有效区域的同时提升物理有效性与空间可用性,并可迁移到外部生成器。

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Figure 1
2026-08-04cs.CV

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Ziyu Ma, Hailang Huang, Shun Zou, Yong Wang, Shidong Yang, Yiming Hu, Fei Wei, XiangXiang Chu

2026-08-04强化学习

这篇论文针对长程智能体在持续执行中容易出现上下文膨胀、任务状态丢失和自我误判累积的问题,把长程执行重构为外部任务状态管理。核心是 Manage-Execute-Audit 循环:管理器规划子任务,执行器用新上下文完成,审计器只读验证环境变化后再更新状态。实验显示该框架在 WeaveBench、Terminal-Bench 2.1 和 OSWorld 2.0 上均提升 Qwen 与 Claude 的表现。

OSSDD - a New Open Dataset for Sentinel-1 Ship Detection Figure 1
2026-08-04cs.CV

OSSDD - a New Open Dataset for Sentinel-1 Ship Detection

Horst Hammer, Sylvia Hochstuhl, Antje Thiele, Tobias Brosch, Padraig Davidson, Tim Remiger, Michael Teutsch

2026-08-04视觉感知数据集/基准

面向SAR船舶检测中高质量训练数据稀缺、许多公开集仅提供不透明8-bit图像而影响泛化的问题,OSSDD基于OpenSARShip重建Sentinel-1检测数据,提供VV/VH浮点幅度图、船舶掩膜、水平框和旋转框标注,共15,197个patch、55,759艘船;作者用Faster R-CNN、FCOS、DETR验证可训练性并给出基准结果,具体性能增益更多可能主要来自data。

FAST-GS: Frequency Aware Space-time Gaussian Splatting for Photorealistic Dynamic Novel View Synthesis Figure 1
2026-08-04cs.CV

FAST-GS: Frequency Aware Space-time Gaussian Splatting for Photorealistic Dynamic Novel View Synthesis

Zhengyang Zhang, Ziyu Lu, PengCheng Li, Hongbo Duan, Yi Liu, Pengting Luo, Peiyu Zhuang, Xinghui Li, Shaohua Ma

2026-08-04三维

FAST-GS针对4D Gaussian Splatting用单一多项式建模运动时难以拟合火焰等高频局部变化、长序列易轨迹漂移的问题,将高斯点位移改为傅里叶多频分解,并加入频率加权的运动正则以抑制高频抖动、保留低频连贯性。在N3V和Google Immersive上,方法提升复杂动态区域的渲染质量;示例表中PSNR高于对比方法,但训练更慢、存储不占优。

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field Figure 1
2026-08-04cs.CV

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

2026-08-04视觉感知

这篇论文针对固定布局室内配家具中“单件看似匹配、组合后风格冲突”的问题,将家具选择建模为场景级结构化优化。核心做法是用动态超图风格场刻画多家具高阶依赖,并以反事实替换和 Mahalanobis 能量评估候选在当前场景中的兼容性,推理时只更新房间候选分布。3D-FRONT 实验显示其在家具检索和场景风格一致性上优于对象级与场景级检索基线。

Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding Figure 1
2026-08-04cs.CV

Event ActivityNet: A Large-Scale Simulated-Event Benchmark for Untrimmed Action Understanding

Cheng-Yao Hong, Ting-Wei Lin, Yun-Chung Lai, Hua-Wei Lee, Hwann-Tzong Chen, Tyng-Luh Liu

2026-08-04数据集/基准

论文针对事件相机领域长期缺少非裁剪、长时序动作理解基准的问题,构建了由 ActivityNet 转换而来的 Event ActivityNet,提供 3263 个视频、200 类、5/9-bin 事件体素、时序标注和字幕对齐,并支持识别与因果在线 TAL。结果显示,渐进式规模训练将识别 Top-1 从 52.25 提至 66.42,在线 TAL mAP 从 21.7 提至 29.0;但数据为模拟事件,真实相机部署结论仍受限,增益可能主要来自 scaling / data。

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation Figure 1
2026-08-04cs.CV

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

Liming Tan, Ye Chen, Hao Zhang, Lirong Qian, Feifei Li, Bingbing Ni

2026-08-04视觉感知规划控制

UniMoCa针对人体视频生成中动作视觉条件与相机几何编码异构,导致多人、大幅运动和动态镜头下归因混乱、误差敏感的问题,提出MCVP把3D人体运动与相机轨迹统一渲染为身份无关的视觉代理,并加入相机轨迹标记。基于Wan2.2 I2V实验显示,其在动作控制、相机控制、时序一致性和鲁棒性上均有提升,但具体增益中数据集构建贡献占比文中未充分说明。

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation Figure 1
2026-08-04cs.CV

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

Nanyang Technological University 2 Centrale Supélec, Singapore Management University, University of Cambridge

2026-08-04视觉感知数据集/基准

本文针对现有文生视频评测偏重画质、物理合理性和文本对齐、忽视文化语境的问题,提出 CultureVidBench:以 1000 个跨 12 国的提示覆盖物质文化、社会实践与仪式,并用人工和多模态大模型从文化忠实度、多模态文化呈现等维度评测 7 个 T2V 模型。结果显示,模型虽能保持较好语义对齐和视觉质量,但在欠代表地区、仪式流程、可见文字与音频等细粒度文化线索上仍系统性失真。

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection Figure 1
2026-08-04cs.CV

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

2026-08-04视觉语言

这篇论文关注 VLM 在图像证据变化后为何仍沿用旧答案,指出问题不只是“没再看图”,而是先前 CoT 中承载证据的文字推理会形成可复用捷径,与当前视觉重算竞争。作者用匹配反事实框架在 16 个 VLM 上验证,删除或打乱旧证据会显著削弱先验控制;提出无需训练的 FSAF 隔离旧 CoT,使五个 Qwen VLM 的视觉更新率由 35.28% 提升到 53.61%,先前答案率降至 3.67%。

CHOW-SLAM: Compact Hybrid Representation with Complementary Overlap Window Optimization for RGB-D SLAM Figure 1
2026-08-04cs.CV

CHOW-SLAM: Compact Hybrid Representation with Complementary Overlap Window Optimization for RGB-D SLAM

Wenxuan Ji, Jin Xiao, Xiaoguang Hu, Jiaqi Shi, Zichong Jia, Baochang Zhang

2026-08-04强化学习优化算法

这篇工作针对在线资源受限下 NeRF/RGB-D SLAM 难以同时保持紧凑场景表示与长期历史约束的问题,提出 CHOW-SLAM:用参数化平面/网格与哈希特征组成尺度互补的 P-H 表示,并以重叠窗口联合近期帧、高重叠局部帧和分散历史关键帧优化。实验显示其在多数据集上提升重建质量和相机跟踪精度,但动态、室外和大尺度场景仍受限。

PNEC-Mamba: Prototype-Guided Positive-Negative Evidence Calibration for Hyperspectral Image Classification Figure 1
2026-08-04cs.CV

PNEC-Mamba: Prototype-Guided Positive-Negative Evidence Calibration for Hyperspectral Image Classification

Mingzhen Xu, Can Xu, Di Wang, Haonan Guo, Bo Du

2026-08-04视觉感知

针对高光谱像素中光谱相似、混合像元和邻域干扰导致的证据纠缠,PNEC-Mamba不只增强特征,而是用动态类别原型区分支持分类的正证据与来自竞争类别的负证据,并按多源不确定性选择性校准,再做全分辨率一致性细化。其在Pavia University、Houston和WHU-Hi-HanChuan上OA分别达96.77%、92.18%、94.11%,优于对比方法。

Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery Figure 1
2026-08-04cs.CV

Assessing the Benefits of Combining Advanced Deep Learning Techniques for Post-Disaster Building Damage Assessment from UAV Imagery

Huy Quang Ung, Guillaume Habault, Roberto Legaspi, Hao Niu, Lian Cao, Masato Taya

2026-08-04视觉感知

面向灾后无人机影像中的建筑损毁快速评估,论文指出纯CV模型依赖标注且泛化弱,LVLM又不擅长精确定位,因此提出先用Grounding DINO等检测建筑框、再交由LVLM判定损毁等级和解释上下文的解耦框架。在RescueNet和FloodNet上,该组合用于统计完好、部分损毁和完全毁坏建筑,较单独基线最高提升约2.1个R²点,并在少量检测标注下仍有效。

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph Figure 1
2026-08-04cs.CV

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph

Zhenhao Zhang, Jiajun Zhang, Wei Min, Yebin Liu

2026-08-04三维

PhotoHOI针对现有HOI合成依赖预先给定物体几何、轨迹或任务条件的问题,尝试从单张真实RGB照片和开放词汇指令生成3D手物交互序列。核心做法是用VLM解析任务,恢复相关3D场景并规划避碰物体轨迹,再用任务条件接触先验和接触条件抓取先验约束手部生成。实验在GRAB、H2O及真实照片上显示接触质量、穿透控制、任务成功率和场景一致性优于代表性基线。

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models Figure 1
2026-08-04cs.CV

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

2026-08-04视觉语言视觉感知

SpatioLM针对VLM语义能力强但3D度量与空间推理不足的问题,尝试避免依赖深度、点云、相机参数或外部空间编码器。其核心是在冻结VLM主干上加入可插拔SV-Module,用伪深度和相机射线监督诱导视觉token中的几何结构,推理时仍只需2D输入。实验显示其在空间感知、空间理解上提升明显,VSI-Bench达71.6,并能迁移到具身操作任务,同时较少损害通用能力。

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation Figure 1
2026-08-04cs.CV

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

Jeonghyeok Do, Munchurl Kim

Information & Electronics Research Institute, School of Electrical Engineering

2026-08-04生成模型

这篇论文针对遥感生成模型依赖自然图像预训练、易产生视角与尺度偏差的问题,提出从零训练的 9B 参数 GeoCore-9B:用 Flow Matching DiT 结合文本、GSD、经纬度条件,并以冻结的卫星专家模型做训练期地理语义对齐。实验显示其在遥感图像保真度、地理结构准确性,以及云去除、SAR 到光学转换等下游任务上达到或接近 SOTA;但具体增益可能主要来自 scaling / data。

Beyond Illumination: A Conditional Mutual Information-Guided Network for Low-Light Image Enhancement Figure 1
2026-08-04cs.CV

Beyond Illumination: A Conditional Mutual Information-Guided Network for Low-Light Image Enhancement

Ya-nan Guan, Shaonan Zhang, Tao Dai, Tianqu Zhuang, Yongchao Qiao, Zhensen Chen, Shu-Tao Xia, Hang Guo

2026-08-04视觉感知

本文针对低光增强中过度强调亮度、忽视亮度与色度交互的问题,提出以条件互信息估计“给定亮度后色度还能提供多少有效信息”,并用 CMIC 与 D2IR 在区域和阶段上动态调节双分支信息注入。实验显示 CMIG-Net 在多个成对 LLIE 基准上优于 CIDNet,PSNR 最高提升 0.619 dB,Sony-Total-Dark 提升 0.382 dB。

Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory Figure 1
2026-08-04cs.CV

Transformer Geometry Observatory TGO-III: Semantic Geometry Observatory

Kaustubh Kapil, Kishor P. Upla

2026-08-04视觉感知

论文关注 ViT 训练过程中语义结构如何在表示空间中形成,而不只看全局谱或 token 几何。TGO-III 的核心是用线性探针、Fisher Ratio、类中心距离、局部内在维度和 Local PCA Rank 观测类别级几何演化,提出语义扩展与此前流形扩展相联系。实验在 ViT-Small/16 与 ImageNet-100 上显示,训练后期类别更线性可分、类间中心更远,判别性主要集中在较深层;但是否能泛化到更大模型和任务,文中未充分说明。

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation Figure 1
2026-08-04cs.CV

Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

Shenzhen University of Advanced Technology, Shenzhen Technology University

2026-08-04视觉感知数据集/基准

这篇论文针对视觉文本压缩评测中过度依赖下游任务的问题,指出多模态模型可用语言先验或少量关键词补全文本,从而高估压缩保真度。作者提出解耦语义与视觉的完整 OCR 评测框架,并构建低语义相关的 ZeroSense 基准。实验显示其文本保留率与传统下游/OCR 指标显著背离,如 FOX 10× 下仅估计 11.8%,凸显现有 VTC 评测可能不可靠。

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model Figure 1
2026-08-04cs.LG

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

2026-08-04生成模型强化学习规划控制安全鲁棒

这篇论文针对扩散世界模型反复调用大 Transformer 导致推理慢的问题,指出现有缓存只看局部漂移会低估误差在后续潜变量转移中的累积风险。WorldDynCache 用条件与去噪阶段感知的潜变量转移替代模型,并用在线校准的风险控制器决定何时回退精确计算;在 HunyuanVoyager-13B、Aether-5B 上分别获得 4.92 倍和 2.15 倍加速,同时在 WorldScore、PSNR、SSIM、LPIPS 上优于对比缓存方法。

MoCRA: Mixture of Compositional Rank-1 Atoms for 4K All-in-One Video Restoration Figure 1
2026-08-04cs.CV

MoCRA: Mixture of Compositional Rank-1 Atoms for 4K All-in-One Video Restoration

Yongcong Wang, Pu Wang, Hingchin Chen, Runci Bai, Yucheng Xin, Chen Wu, Chengchao Shen, Guangwei Gao, Siyuan Yao, Pengwen Dai, Zhuoran Zheng

2026-08-04视觉感知

本文针对无退化标签、原生4K输出且需视频稳定的全能视频复原问题,指出低分辨率代理只适合雾和低照度、会丢失雨线和噪声。MoCRA据此提出按频带匹配的组合条件机制,用稀疏重组的rank-1原子同时驱动粗分支和原生分辨率细化器,并构建UHV-4K-AIO基准。实验显示其以3.6M参数在四类退化上取得最佳平均PSNR,4K单帧低于0.5秒且无需光流。

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents Figure 1
2026-08-04cs.CV

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang

2026-08-04视觉语言视觉感知

论文针对多模态智能体在开放世界长程检索中只在输入或答案阶段使用视觉、难以让中途发现的图像继续驱动搜索的问题,提出 DeepVoyager-VL:用视觉增强事件图合成长链条、含中间视觉依赖的数据,并设计按需加载图像/裁剪的主动视觉获取机制,仅靠监督微调学习搜索轨迹。在十个多模态搜索基准上实验显示方法有效,但具体增益来源可能同时来自数据合成与交互协议设计。

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent Figure 1
2026-08-04cs.CV

PartMat: Material-Aware 3D Part Decomposition with a Single Global Latent

Guangming Fu, Jin Song, Yiyun Fei, Guoqiu Li, Ruigao Yang, Jianan Jiang

2026-08-04三维

面向可编辑三维资产,本文指出按功能部件分解难以服务材质替换、物理属性赋值等需求,提出按材质边界拆分的 PartMat。其核心是用单一全局 latent 表示多材质部件,配合 PartVAE 一次解码、扩散生成、强化学习抑制错分与重叠,并用稀疏体素 flow refiner 补几何细节。约 30 万带材质标注物体上的实验显示,材质分解精度优于基线,同时保持相近几何质量和更高推理效率。

Detail Continuation over a Trustworthy Coarse Scale for Autoregressive Super-Resolution Figure 1
2026-08-04cs.CV

Detail Continuation over a Trustworthy Coarse Scale for Autoregressive Super-Resolution

Hongyi Fang, Jiahui Wu, Yichen Yue, Benjia Zhou, Dan Zeng

Sun Yat-Sen University, Beijing Institute of Technology, Technology Innovation Center for Collaborative Applications, Sun Yat-Sen University Zhuhai China, Beijing Institute of Technology Zhuhai China

2026-08-04视觉感知

这篇论文针对生成式超分辨率中细节幻觉和自回归误差累积问题,指出低分辨率输入在粗尺度上仍有较可靠证据,因此不必从最粗尺度完整自回归生成。方法 K2N 先用 LR 直接预测粗尺度前缀,再让 VAR 只续写更细尺度细节。实验显示其在常规超分指标上接近 VARSR,同时在幻觉诊断评测中更能保留由 LR 支持的结构。

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models Figure 1
2026-08-04cs.CV

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

Yongkang Zhou, Xiang Xia, Cheng Yan, Fan Xu, Wuyang Zhang

2026-08-04视觉语言视觉感知生成模型规划控制

DAVET针对扩散视觉语言模型在每个去噪步反复使用大量视觉 token、推理成本高的问题,指出视觉证据需求随去噪阶段变化且不同骨干呈现早期 grounding 或后期 verification 差异。方法无需训练,将视觉证据视为可调资源,按阶段轨迹、操作需求和风险动态分配证据预算,并可由池化、剪枝或合并实现。实验在 LLaDA-V 和 LaViDa 多个视觉理解基准上取得平均 1.55 倍加速,平均相对性能下降 1.86%。

SecondOpinion: Anatomy-Aware Gated Reasoning for Efficient Medical Image Analysis Figure 1
2026-08-04cs.CV

SecondOpinion: Anatomy-Aware Gated Reasoning for Efficient Medical Image Analysis

Siam Tahsin Bhuiyan, Rashedur Rahman, Sefatul Wasi, Riyadul Islam, Syoji Kobashi, Ashraful Islam, Saadia Binte Alam

2026-08-04视觉感知

论文针对医学影像模型对所有病例使用固定计算量的问题,提出 SecondOpinion:先用快速主干判断,只有 GateKeeper 预测主干可能出错时才调用解剖引导分支,并用轻量交叉注意力融合。结果显示其在胸片和骨盆骨折任务上接近 always-on 双流性能、优于若干基线,同时第二分支仅在 9.23% 胸片、24.12% 可见骨折和 45.71% 不可见骨折样本上激活。

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking Figure 1
2026-08-04cs.CV

Parameter-Dynamic Adaptive Fusion and Calibration Network for RGBT Tracking

Zhaoding Ding, Chenglong Li, Jiandong Jin, Kewei Ying, Wentao Wu

2026-08-04视觉感知

这篇论文针对 RGBT 跟踪中固定融合参数难以适应目标外观变化、模态质量波动及历史时空噪声的问题,提出 PAFCNet:用目标自适应超网络从模板表示动态生成融合与校准参数,并分别调制 RGB/TIR 融合和时空 token 传播。实验显示其在多个 RGBT 基准上取得有竞争力的性能,但具体增益相对各组件和模型规模的来源仍需结合消融进一步判断。

Illuminating Visual Identity in Universal Multimodal Embeddings Figure 1
2026-08-04cs.CV

Illuminating Visual Identity in Universal Multimodal Embeddings

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

Shanghai Jiao Tong University 2 Alibaba Group

2026-08-04视觉语言

这篇论文指出通用多模态嵌入虽擅长语义检索和指令理解,却缺少区分同一人物、车辆或物体身份的细粒度能力。作者将视觉身份判别形式化为四类任务,构建含真实与合成数据的 MVEB,并用身份感知采样与对比损失联合训练。实验显示 VisID 指标提升约 25% 以上,同时基本保持 MMEB 上的通用多模态检索表现。

Investigating Social Bias in Narrative Image Generation Figure 1
2026-08-04cs.CV

Investigating Social Bias in Narrative Image Generation

Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

2026-08-04视觉感知

现有图像生成偏见评测多停留在单张照片,难以捕捉故事板、漫画等叙事格式中的角色关系与情节走向偏差。本文将文本偏见框架 BBG 扩展到图像生成,比较六个 T2I 模型在照片、故事板和四格漫画中的偏见表达;结果显示专有模型照片偏见率约25.9%,故事板和漫画分别提高9.6和18.2个百分点,且韩语提示偏见更高,说明叙事视觉格式会放大或显化原本隐蔽的社会刻板印象。

LiveLight: Real-time Streaming Video Relighting with Interactive Control Figure 1
2026-08-04cs.CV

LiveLight: Real-time Streaming Video Relighting with Interactive Control

Yue Ma, Jiangming Wang, Yucheng Wang, Xilai Wang, Zhiyuan Li, Xinyu Wang, Hongyu Liu, Ruofan Liang, Songchun Zhang, Yuxuan Xue, Qifeng Chen

University of Macau, University of Tuebingen

2026-08-04视觉感知规划控制

LiveLight针对现有视频重光照方法依赖离线整段生成、难以交互且易闪烁的问题,将3D点光源控制转为MPLI条件并用轻量适配器注入扩散模型,同时通过低步数蒸馏、几何反馈约束和滚动窗口潜变量传播实现流式一致性。实验显示其在真实与合成基准上优于离线基线,默认约15.78 fps,并在用户偏好、时序稳定和光照可控性上取得更好结果。

DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing Figure 1
2026-08-04cs.CV

DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing

Siying Li, Ying Ni, Jie Sun, Jian Sun, Haotian Shi

2026-08-04三维

面向端到端自动驾驶闭环测试,论文针对现有仿真在真实感、交互性和实时性之间难以兼顾的问题,提出将3DGS场景解耦为静态背景与可操控车辆资产,并用压缩、地图引导配准和代理重光照处理效率、几何与光照冲突。实验显示该框架能以交互速率插入多车,提升度量与光照一致性,为高保真传感器仿真提供可用平台。

Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM Figure 1
2026-08-04cs.CV

Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM

Dayu Li, Shihao Zhou, Leizhi Shu, Jin Wu, Chi Man Vong, Jufeng Yang

2026-08-04视觉感知

面向雨、雾、雪等恶劣天气下退化空间不均、像素级扫描易跨语义边界混合噪声的问题,论文提出SSR,将视觉SSM的序列建模从固定像素路径改为超像素语义引导扫描,并用区域级门控校准局部异常退化。六个基准实验显示其在保持竞争计算成本的同时优于多种现有方法,但推理速度仍受不规则索引和超像素聚类开销限制。

Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit Figure 1
2026-08-04cs.CV

Can Urban Blight Be Accessed with Vision-language Models: A Case Study in Detroit

Xiaohao Yang, Aohua Tian, Derek Van Berkel, Xu Qiang, Mark Lindquist

School for Environment and Sustainability, School of Information, University of Michigan, Ann Arbor, USA

2026-08-04视觉语言视觉感知

针对传统城市衰败入户调查成本高、更新慢的问题,本文以底特律住宅为案例,探索用开源视觉语言模型结合多视角街景识别屋顶、墙面、门窗破损等衰败线索,并用结构化提示输出二值与概率判断。核心洞察是不同 VLM 对损坏属性各有强弱,多视角信息可提升预测;基于 XGBoost 的堆叠集成整体优于单模型,可作为低成本、可持续更新的住房状况监测补充。

SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation Models Figure 1
2026-08-04cs.CV

SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation Models

Xingyan Li, Jordan A. Caraballo-Vega, Jie Gong, Mark L. Carroll, Jianwu Wang

University of Maryland, Baltimore County, NASA Goddard Space Flight Center, University of Maryland, Baltimore County Baltimore Maryland USA, NASA Goddard Space Flight Center Greenbelt Maryland USA

2026-08-04视觉感知

这篇论文针对地理空间基础模型跨传感器微调中的两类实际障碍:下游传感器波段与预训练输入不匹配,以及全量微调成本高。SPECTRA用BRE把所有可用波段路由成预训练兼容输入,再用ST-LoRA按阶段可迁移性分配LoRA秩。实验覆盖3个GeoFM和4个分割数据集,BRE平均提升约2.88 mIoU,ST-LoRA在保持竞争性能的同时减少可训练参数;但作者也指出收益依赖波段错配程度,部分rank规划验证仍不充分。

IDraw: Artist Verification from Digital Drawing Images Figure 1
2026-08-04cs.CV

IDraw: Artist Verification from Digital Drawing Images

Nayoung Kim, Nan Jiang, Bangjie Sun, Jaewon Shin, Sojeong Kim, Jun Han

2026-08-04视觉感知

针对数字绘画在线传播中作者身份争议仅能依赖成品图和少量参考图的场景,IDraw 的核心思路是用训练阶段采集的数位笔压力、速度等传感信号监督图像编码器,从成品图中捕捉绘画行为线索,并抑制同一物体带来的内容相似性。论文构建了37名画师、1110幅画及14类传感信号的数据集,在未见过画师上跨9种骨干均优于常规图像验证,错误率最高降低40%。

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency Figure 1
2026-08-04cs.CV

Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency

Hakan Emre Gedik, Shashank Gupta, Alan Bovik

The University of Texas at Austin, 2 University of Colorado Boulder

2026-08-04视觉感知

针对无参考图像质量评估中缩放丢失细节、跨分辨率泛化差、多数据集 MOS 难统一及高分辨率计算开销大的问题,论文提出 ReLIQS:用 CLIP 多尺度固定 patch 同时保留原图细节和全局语义,并学习 IQA 专用显著性来挑选少量关键 patch,再以排序/相关性目标支持多数据集训练。实验显示其在真实、合成和 AIGC 及 UHD 基准上优于多类 CNN、CLIP 和 MLLM 基线,并可在超高分辨率场景减少最高约 90% 计算量。

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors Figure 1
2026-08-04cs.CV

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors

Yuxin Yao, Kendong Liu, Shiqi Zhou, Jiazhi Xia, Junhui Hou

2026-08-04生成模型三维

G-Skin针对3D Gaussian资产难以直接绑定任意骨架的问题:缺少高质量3DGS蒙皮数据,而转用网格方法又受重建网格质量和泛化能力限制。其核心做法是用骨架可控的2D生成先验合成姿态引导图,再结合几何正则优化高斯蒙皮权重,并可适配减轻动画伪影的增强3DGS表示。实验称其在多类复杂对象上优于现有网格迁移方法,但具体增益来源仍可能受生成先验质量影响。

When Extreme Darkness Meets Motion Blur: MeanFlow for Unified RAW Restoration Figure 1
2026-08-04cs.CV

When Extreme Darkness Meets Motion Blur: MeanFlow for Unified RAW Restoration

Zepu Wang, Jingze Liang, Weijie Xiao, Kexin Chen

2026-08-04生成模型

论文关注极暗 RAW 成像中常被忽略的手持运动模糊,指出仅做提亮和降噪难以恢复已被相机抖动抹去的结构。核心做法是构建含受控运动退化的 SIDED 数据集,并用统一 RAW tokenizer 对齐暗光与正常曝光域,再以 MeanFlow 在潜空间一次函数评估完成增强和运动感知恢复。实验称在 SIED 与 SIDED 上取得最佳 PSNR/SSIM/SAM,运动退化场景 PSNR 较最强基线提升约 6–7 dB,但部分增益可能主要来自 scaling / data。

STC-Net: Electroluminescence-Based Solar Cell Crack Segmentation for Power Loss Estimation Figure 1
2026-08-04cs.CV

STC-Net: Electroluminescence-Based Solar Cell Crack Segmentation for Power Loss Estimation

Shanaka Ramesh Gunasekara, Akila Eranda Devanarayana, Imasha Guruge, Nuwantha Fernando, Ehsan Asadi

RMIT University, University of Jaffna

2026-08-04视觉感知

针对光伏电池 EL 图像中裂纹细长、断续且需保持拓扑连续,通用分割网络难以精确刻画并关联功率损失的问题,STC-Net 引入边缘/频谱先验、方向感知过滤和边界拓扑细化,并用预测掩码构造裂纹相关非活性面积代理。PVEL-S 上训练指标较高,未见样本达到 72.52 MIoU、80.16 MDice;但功率损失仍是简化替代量,需实测电学数据验证。

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models Figure 1
2026-08-04cs.CV

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

Hai Nguyen, Tung Vu, Cong Tran

Hai Nguyen, Tung Vu, and Cong Tran are with the Posts and Telecommunications Institute of Technology, Hanoi, Vietnam.

2026-08-04视觉语言视觉感知数据集/基准

这篇论文针对VLM在室内机器人场景中难以从单张RGB图像完成“多个同类物体中谁离参考物最近、距离多少”的度量空间推理问题,提出CIDQ任务与SpatialQuery-1M基准。核心做法是用单目深度和相机几何恢复实例级地面坐标,再转成统一BEV块状表示,并把几何不确定性写入推理提示。零样本下,Qwen3-VL-8B版SpatialQuery达到0.259米Floor-MAE、90.5% Unc-Acc@0.3米和84.18%接近判断准确率,优于多类微调或闭源模型。

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization Figure 1
2026-08-04cs.CV

UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization

Inha Lee, Dongjae Jeong, Junhee Lee, Kyungdon Joo

2026-08-04优化算法

UniSim-SLAM针对前馈SLAM中两视图低延迟但易漂移、多视图子图约束强但更新慢且尺度不一致的问题,将两视图关键帧跟踪与周期性多视图子图细化统一到Sim(3)多层因子图中,联合优化关键帧和子图位姿,并用视图到视图、视图到子图、子图到子图约束传播尺度与漂移修正。在未标定设置下,TUM RGB-D和7-Scenes轨迹误差较此前最佳分别降低38.5%和45.9%。

Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting Figure 1
2026-08-04cs.CV

Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting

Ruifeng Wang, Di Yang, Jiangtao Wang

School of Artificial Intelligence & Data Science, USTC, Hefei, China, Suzhou Institute for Advanced Research, USTC, Suzhou, China

2026-08-04视觉感知

论文针对球员中心足球触球事件检测中既要精确定位时间、又要归因到具体球员的问题,指出现有 DST 将球员槽位展平会削弱多智能体建模。其核心做法是 ME-DST 保留实体轴,用时间注意力建模单个球员轨迹、空间注意力建模球员交互,并加入角色嵌入、战术特征和视觉模型融合。在 FOOTPASS 上 Micro F1 达 0.778,较 TAAD+DST 提升 10.3 个百分点;消融显示实体轴和角色身份是主要增益来源。

ARM: Detector-Agnostic Changepoint Attribution with Finite-Sample Error Control Figure 1
2026-08-04stat.ME

ARM: Detector-Agnostic Changepoint Attribution with Finite-Sample Error Control

Chenchen Peng, Mixia Wu, Qijing Yan, Da Chen, Zhiqi Shen

School of Mathematics, Statistics and Mechanics, Beijing, University of Technology, Beijing 100124, China, College of Computing and Data Science, Nanyang Technological, University, Singapore 639798, Singapore, College of Electrical Engineering, Sichuan University, Chengdu

2026-08-04规划控制

多变量监测中,检测到变点后仍需判断哪些坐标真正变化,而直接在估计变点处逐坐标检验会放大假阳性。ARM将任意检测器输出包装为跨候选切分的秩最大统计,并给出位置/尺度标签;有限样本下可控制单坐标错误、FWER与任意依赖下FDR。仿真显示其比朴素检验更稳健,金融案例中识别出2008危机相关尺度变化。

Generative AI and Foundation Models in Medical Image Figure 1
2026-08-04cs.CV

Generative AI and Foundation Models in Medical Image

Masahiro Oda

2026-08-04视觉感知生成模型

面向医疗影像中生成式AI快速扩散但开发范式尚不清晰的问题,本文梳理扩散模型、LLM与基础模型如何从判别式任务扩展到图像生成、报告生成和多任务迁移。核心洞察是医疗AI性能提升可能主要来自scaling / data与大规模算力,而非单一结构改进;文中以综述和案例讨论为主,未给出新模型实验结果,结论强调建设国家级医疗影像数据与计算资源。

Generative Brownian Bridge Diffusion In Motion Space For Enhanced Myocardial Strain Analysis Figure 1
2026-08-04cs.CV

Generative Brownian Bridge Diffusion In Motion Space For Enhanced Myocardial Strain Analysis

Rishov Paul, Frederick H. Epstein, Miaomiao Zhang

2026-08-04生成模型

该文面向常规 cine CMR 难以获得高精度心肌应变、而 DENSE 等高级采集成本高且不易部署的问题,提出在时空位移运动空间中构建 Brownian bridge 扩散模型,将配准得到的运动场随机映射到 DENSE 质量运动,并用 CMR 图像特征约束解剖一致性。多中心数据实验显示,该方法在运动重建和应变量化上优于现有学习式基线,推理阶段不需专门采集。

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering Figure 1
2026-08-04cs.CV

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

Mohamed Basem, Vincent Christlein

2026-08-04视觉语言视觉感知安全鲁棒

本文关注多语言考试图像问答中,VLM即使理解图像也会因冗长解释、语言不符或格式错误而失分的问题。核心洞察是输出控制与模型选择同等关键:选择题直接对A-E候选标签打分并融合,开放题用图像增强、确定性生成和清洗组合答案;无需任务训练,MCQ获0.7108准确率第三,OpenQA以0.6488 COMET获第一。

Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding Figure 1
2026-08-04cs.CV

Few-Shot Concept Prompt Learning for Segmentation Foundation Models via Visual Grounding

Rahul Venkataramani, Rachana Sathish

2026-08-04视觉语言视觉感知

该文针对 SAM3/Medical SAM3 在医学分割中依赖自然语言提示且易受术语和视觉分布错配影响的问题,提出 FS-CPL:用少量图像-掩码样本直接学习连续概念提示,冻结骨干并绕过 tokenizer。实验覆盖超声与内镜四个数据集,较文本提示最高提升 Dice 0.62,并能叠加提升 Medical SAM3,说明视觉 grounding 与领域预训练互补。

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection Figure 1
2026-08-04cs.CV

FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection

Yaning Zhang, Jiao Wu, Zan Gao, Linlin Shen

Corresponding author: Linlin ShenYaning Zhang and Jiao Wu are with the Computer Vision Institute, School of Artificial Intelligence, Shenzhen, also with National Engineering Laboratory for Big Data System Computing, Technology, Shenzhen University, and Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen

2026-08-04视觉语言视觉感知

针对深伪检测在性别、年龄、种族交叉群体上易受数据不均衡影响、跨操纵泛化和公平性不足的问题,FairForensics构建人口统计均衡基准,并把表情嵌入的真假分布差异作为高层伪造先验,结合人口感知文本提示、视觉语言对齐和原型公平约束来抑制身份与群体捷径。实验称其在均衡基准和跨数据集评测中同时提升检测泛化与公平性,达到SOTA。

Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering Figure 1
2026-08-04cs.CV

Ground, Cover, and Refine: Evidence-Centric Frame Selection for Long-Video Question Answering

Fan Wei, Siru Zhong, Runmin Dong, Miao Yang, Zhaoyang Luo, Haohuan Fu

2026-08-04视觉感知

长视频问答受视觉 token 预算限制,关键证据常被稀疏采样遗漏,且字幕/ASR 与画面证据对齐不足。GCR 将固定帧选择视为证据策展:把时间文本渲染到对应真实帧,补充视觉锚点与多样上下文,并回访遗漏片段替换弱证据帧,无需训练或改模型。在 LongVideoBench 与 Video-MME、三种 7B VLM 和多种帧预算下均有提升,LLaVA-OV 32 帧分别达 64.25% 和 62.15%。

StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting Figure 1
2026-08-04cs.CV

StreamSplat: Streaming Feed-Forward 3D Gaussian Splatting

Changhao Song, Yuxuan Wang, Qibiao Li, Youcheng Cai, Ligang Liu

2026-08-04三维

StreamSplat针对现有前馈3DGS需一次性联合处理固定上下文、难以用于连续视频重建的问题,提出按chunk因果更新的场景状态。其核心是体素对齐因果缓存VACC,并用历史投影深度锚定和缓存引导特征注入复用旧几何,降低长序列内存增长与局部误差累积。实验显示其在稀疏因果输入下接近现有方法,并能扩展到256至1024视图,固定视图基线则出现显存瓶颈。

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models Figure 1
2026-08-04cs.CV

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

Yu Chen, Xiaohong Li, Xiaole Wang, Jianjin Zhang, Jun Sun, Yafeng Deng

2026-08-04视觉语言视觉感知

长视频视觉语言模型的视觉 token 数量会显著推高预填充计算和 KV 缓存开销,而直接丢弃或重编码又容易损失细节或增加对齐训练成本。CRAFT 将压缩拆成无参全局相似度选 token 与可学习的位置感知、通道门控融合,且不依赖具体查询。六个视频理解基准显示其在 2× 到 32× 压缩下优于既有方法,约 8× 压缩仍保留约 97% 平均精度并降低延迟与 FLOPs。

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring Figure 1
2026-08-04cs.CV

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi

2026-08-04三维

本文面向实时语音驱动的三维伴随手势生成,指出现有逐片段开环生成虽能保证局部质量,但缺少“要到达哪里”的前向约束,长时间会累积漂移。StreamTalk用说话人动作库检索片段尾部关键姿态作为锚点,并通过生成-检索-细化闭环、随机锚点遮蔽训练和部件感知DiT来利用稀疏边界条件。BEAT2实验显示其FGD达到SOTA,显著降低长时漂移,并以76 FPS实时运行。

Dynamic Resolution Routing for Efficient Egocentric Grounding Figure 1
2026-08-04cs.CV

Dynamic Resolution Routing for Efficient Egocentric Grounding

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

National University of Singapore, The Hong Kong University of Science and Technology, Nanyang Technological University

2026-08-04视觉语言

本文针对第一视角视觉定位中小目标依赖高分辨率、但多模态大模型视觉 token 成本过高的问题,指出现有基于注意力或相似度的 latent token 裁剪容易保留背景、丢失目标证据。SmartRes 改在像素空间做动态分辨率路由,用低分辨率全局视图引导轻量 router 只激活目标相关高分辨率 patch,并用 margin 正则缓解前景背景不平衡。Ego4D 和 EgoIntention 上最多减少 67% 视觉 token,保留 86.4% 全分辨率性能,推理最高快 1.66 倍。

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning Figure 1
2026-08-04cs.CV

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

China University of Petroleum, Shanghai Jiao Tong University, School of Computer Science, Wuhan University, Nanyang Technological University, The University of Hong Kong, Shanghai Jiao Tong University Shanghai China, School of Computer Science, Wuhan University Wuhan China, Nanyang Technological University Singapore Singapore, The University of Hong Kong Hong Kong China

2026-08-04视觉感知

本文针对多模态大模型在视觉指令微调后,内部视觉表征随层数加深逐步偏离并退化的问题,指出直接对齐外部视觉基础模型虽能增强语义却难以稳定表征。其核心创新是 SSVAL:用视觉锚点提示在训练中吸收 VFM 知识,并结合空间与频域对齐损失约束中间层。实验显示该方法在多项多模态基准、不同视觉编码器和模型规模上优于已有方法,且推理开销较小。

Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations Figure 1
2026-08-04cs.CV

Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations

Zhixue Fang, Zhimin Zhang, Bi'an Du, Zijie Meng, Yan Zhou, Wei Hu, Guoxin Zhang, Pengfei Wan, Kun Gai

2026-08-04视觉感知

这篇论文针对跨物种或跨结构视频运动迁移中固定骨架、姿态或部件对应失效的问题,提出“超越形态”的开放类别运动迁移视角:先用语义运动、轨迹、点跟踪、边缘和 6-DoF 轴等抽象运动视图合成跨类监督,再把这种监督内化为直接由参考视频驱动的生成模型。作者构建 OpenVMT 数据集与基准,在 Same、Near、Far 类别间隔上报告了更好的运动保真和目标外观保持,但具体增益中数据构造与模型 scaling 的贡献仍需进一步拆分。

Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge Figure 1
2026-08-04cs.CV

Linear Multi-Timescale Retention as a Memory-Efficient Vision-Language Bridge

Ashfak Yeafi, Mehedi Hasan, Md Khairul Islam

2026-08-04视觉语言视觉感知

这篇论文针对高分辨率视觉语言模型中注意力桥接层显存随视觉 token 二次增长、而 MLP 桥又缺少空间序列路由的问题,提出 LIA-MTR:用正特征映射、写入门控和多时间尺度衰减的固定递归记忆来线性压缩视觉序列。实验显示其在 1.6 万 token 检索中避免 Lost in the Middle,可处理 26 万视觉 patch 且占用 11.2GB 显存,MME 指令微调后从 MLP 的 68.11% 提升到 71.00%,但空间定位指标下降,局部精度权衡仍需关注。

When Measurement Conventions Masquerade as Calibration Gains in Cardiac Digital Twins Figure 1
2026-08-04cs.CV

When Measurement Conventions Masquerade as Calibration Gains in Cardiac Digital Twins

Dang P. M. Cao, Hieu Pham

2026-08-04视觉感知

本文关注心脏数字孪生中从超声图像估计射血分数时,校准收益可能被测量约定混淆的问题。作者用共享 U-Net 骨干的四种前端做约定感知审计,核心洞察是 CAMUS 上相位条件化看似降低偏差,实际主要由单平面提取与双平面临床标签的约 +6.30 EF 点差异解释;在平面对齐的 EchoNet 复现实验中,基线高估消失且模型排序反转,说明所谓增益并非稳定的观测算子校准改进。

D^2-4DGS: Dual-Depth Guided Sparse-Camera 4D Gaussian Splatting Figure 1
2026-08-04cs.CV

D^2-4DGS: Dual-Depth Guided Sparse-Camera 4D Gaussian Splatting

Jijian Zhao

2026-08-04三维

本文针对动态4D Gaussian Splatting在稀疏相机输入下几何约束不足、易出现缺失结构和漂浮高斯的问题,核心思路是联合利用单目深度的稠密覆盖与多视几何深度的坐标一致性:先对齐并验证双源深度,再用可靠锚点指导剪枝、深度监督和欠重建区域增密,最后进行RGB-D联合优化。实验在三个动态数据集的2/3/4视角设置中均取得最高PSNR,平均较各设置最佳对手提升1.33 dB。

Enhancing Visual Perception in Foggy Conditions via Multiclass Fog Density Modeling Figure 1
2026-08-04cs.CV

Enhancing Visual Perception in Foggy Conditions via Multiclass Fog Density Modeling

Mohamad Mofeed Chaar, Galia Weidl

University of Applied Sciences, Aschaffenburg, Germany

2026-08-04视觉感知

本文针对自动驾驶在浓雾中视觉检测显著退化、且真实雾密度标注数据稀缺的问题,用 Waymo 图像结合估计深度合成五级雾密度数据,并主张按雾强度训练多个专用感知模型,而非单一通用模型。实验显示该策略在重雾下更有效,极重雾类别召回率由 0.076 提升到 0.232,但增益可能主要来自按条件分组训练与合成数据匹配。

Measuring Product Quality Using Images: The CLIP Q-Score and an Application to Real Estate Figure 1
2026-08-04econ.EM

Measuring Product Quality Using Images: The CLIP Q-Score and an Application to Real Estate

Fabian Slonimczyk, Danila Karapsin

2026-08-04视觉感知

本文针对电商和房地产等市场中“图像承载质量信息但难以量化”的问题,提出用 CLIP 文本-图像相似度构造可复现、低成本的 CLIP Q-score,而非依赖不稳定的托管多模态模型。以约50万张房源图片验证后,该分数与 LLM 评价、自报房屋状态和城市空间规律一致,并在控制常规特征后显著预测租售价格;高分房源还更易成交或出租。

V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory Figure 1
2026-08-04cs.AI

V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory

Dingyi Kang, Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

2026-08-04视觉语言

这篇论文针对长期多模态智能体记忆中“相似不等于相关”和跨模态检索偏移的问题,提出 V-Mem:按查询与目标证据模态路由检索,将对话按轮组织,并用假想 caption 或图像关键词增强查询锚点来跨越模态差距。在 Mem-Gallery 上得分 0.82,显著高于次优 0.56,含图查询优势最大;LoCoMo 上也从 0.58 提升到 0.69。

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision Figure 1
2026-08-04cs.CV

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

2026-08-04视觉语言视觉感知

这篇论文针对自动驾驶 VLM 仍难以用真实物理单位理解动态场景的问题,提出用车载雷达的距离与 Doppler 信号作为免人工标注监督,将雷达点投影到图像并构造运动状态、径向速度等问答训练信号。实验显示 STAR-VLM 在运动分类和度量径向速度估计上达到 SOTA,并超过部分任务专用方法,但当前能力仍限于相对径向速度。

Recursive Vision Language Models for General Symbolic Reasoning Figure 1
2026-08-04cs.CV

Recursive Vision Language Models for General Symbolic Reasoning

Omid Nejati Manzari, Guillaume Lajoie, Hassan Rivaz

2026-08-04视觉感知

论文针对 LLM 在数独、迷宫和 ARC 等需搜索、回溯与精确结构输出的任务上受固定自回归深度限制的问题,提出基于 Qwen 的 R-Qwen:把候选解显式序列化并递归改写,配合约束投影、LoRA 微调和分层监督加权。实验称其在八个符号推理基准上超过递归模型和更大 LLM,ARC-AGI 相比基线提升 27.6%,但具体增益中数据、训练策略与递归机制的相对贡献仍需进一步拆分。

ST-LoRA: Single Trajectory LoRA Ensemble for Uncertainty Aware Agricultural Segmentation Figure 1
2026-08-04cs.CV

ST-LoRA: Single Trajectory LoRA Ensemble for Uncertainty Aware Agricultural Segmentation

Mohamed Farag, Genc Hoxha, Yahia Maleki, Chris McCool, Ribana Roscher

2026-08-04视觉感知规划控制安全鲁棒

面向农业语义分割部署中既要高精度又要可靠不确定性、但深度集成开销过大的问题,论文提出 ST-LoRA:用单次训练轨迹的快照生成多个 LoRA 适配器,共享冻结骨干,并指出密集预测中前馈层比注意力层更关键。实验在花椰菜与甜椒数据、SegFormer/Mask2Former 上显示,其分割、校准、分布外检测接近或超过全秩集成,同时显著降低参数、存储、训练与推理成本。

UCBound-Net: Uncertainty-Guided Boundary-Aware Continual Learning for Domain-Incremental Ultrasound Segmentation Figure 1
2026-08-04cs.CV

UCBound-Net: Uncertainty-Guided Boundary-Aware Continual Learning for Domain-Incremental Ultrasound Segmentation

Mohammad Amanour Rahman

2026-08-04视觉感知学习理论安全鲁棒

本文针对超声分割在跨解剖域持续学习中易遗忘旧任务的问题,指出高不确定性边界区域更容易被新任务更新覆盖。UCBound-Net用MC Dropout熵图加权边界蒸馏、校准过度自信错误,并按边界不确定性选择少量回放样本。在BUSI到TN3K序列实验中,相比朴素微调将遗忘指标改善43.3%,平均DSC约0.755且ECE最低;但验证仅限两任务设置,长期序列稳定性文中未充分说明。

Rolling Shutter Camera Self-Calibration Figure 1
2026-08-04cs.CV

Rolling Shutter Camera Self-Calibration

Yongcong Zhang, Navid Rabbani, Bangyan Liao, Chengbo Wang, Yizhen Lao, Adrien Bartoli

2026-08-04视觉感知

滚动快门相机在运动中会产生行曝光畸变,而现有标定多依赖标定板或IMU,限制了无约束场景应用。论文提出目标和硬件无关的RS自标定BA,将行相关连续轨迹模型与“畸变GS图像”校正场结合成双投影约束,同时估计内参与读出时间比。仿真显示双投影版本在轨迹不平滑、RS强度和噪声变化下误差更低,真实数据也验证了精度与鲁棒性。

Stochastic Sequential Search in Very-High-Dimensional Feature Selection Figure 1
2026-08-04cs.LG

Stochastic Sequential Search in Very-High-Dimensional Feature Selection

Petr Somol, Jiř\'ı Grim

Institute of Information Theory and Automation, The Czech Academy of Sciences

2026-08-04视觉感知

高维特征选择中,传统顺序/浮动搜索每步遍历候选特征,难以扩展到数千维,只能退化为忽略特征交互的排序方法。论文提出随机顺序搜索,用固定预算采样替代全量扫描,并用在线学习的依赖统计、softmax 温度和均匀探索保持可达性。实验显示,sSFFS 在 madelon 以约四分之一评估量保持 full-SFFS 97%以上目标值,在 gisette 和 reuters 上优于 BIF/DAF;但 gisette 的验证收益受准则限制。

Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers Figure 1
2026-08-04cs.CV

Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

Robin Kim, Colin Samplawski, Benjamin M. Marlin

2026-08-04视觉感知三维

这篇论文关注一个基础问题:只用2D框和类别训练的DETR,物体级query embedding是否已经包含可恢复的3D信息。作者冻结多种预训练检测Transformer,用线性与非线性探针预测物体深度和相机坐标下3D位置,发现部分标准DETR的深度探针可达到或超过零样本Depth Anything 2,3D定位误差也仅比专门用3D监督训练的MonoDETR高数十厘米;但实时、轻量变体表现较弱,说明效率化设计可能削弱隐式3D表征。

GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization Figure 1
2026-08-04cs.CV

GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization

Baihan Yang, Tiexin Li, Yuheng Liu, Xin Lin, Xinke Li, Xiaohui Xie, Truong Nguyen

2026-08-04优化算法三维

针对3D Gaussian Splatting场景中交互式选物依赖多视角SAM、重训练或高显存计算的问题,GaussianSelector直接在原生高斯基元上构建几何一致的superpoint图,将稀疏涂鸦通过可见性和透射率提升到3D证据,并用全局graph cut传播选择结果。实验显示其在NVOS上接近多视角SAM方法的选择质量,同时显著减少交互视角、计算量和显存需求。

Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning Figure 1
2026-08-04cs.CV

Towards Compact Unified Multimodal Tracking: Synergizing Knowledge Distillation with Structural Pruning

Yuqi Li, Yuedong Tan, Huiran Duan, Weilun Feng, Chuanguang Yang, Zhulin An, Zongwei Wu, Shiping Wen, Tingwen Huang, Yingli Tian

2026-08-04视觉语言视觉感知

面向边缘设备部署,论文指出统一多模态跟踪的瓶颈不仅在骨干网络,也在常被忽视的预测头。作者通过轻量化解码器提升速度,并用双重对齐蒸馏分别传递空间定位特征与语义决策分布,以弥补学生模型容量缺口。实验覆盖五个基准,DTrack 在 RGBT234 上达到 91.5% MPR、54 FPS,较教师模型约 5 倍加速且保持较高精度。

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs Figure 1
2026-08-04cs.CV

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto

2026-08-04视觉感知

手术场景 MLLM 通常把大量密集视觉 token 输入语言模型,推理成本高且回答难追溯到图像区域。Slot2Text 的核心思路是用 Slot Attention 将自监督视觉特征压缩成带区域身份和掩码的少量 slot token,并提供 Fast 与可定位的 Reason 两种模式。在多项手术 VQA 和 grounding 基准上,Fast 接近 SOTA,同时总 token 减少 91.8%、视觉前缀从 1295 降至 47;Reason 则以额外延迟换取显式空间证据。

VGER: Voxel-Guided Global Event Ranking for Event Cloud Attribution Figure 1
2026-08-04cs.CV

VGER: Voxel-Guided Global Event Ranking for Event Cloud Attribution

Youxin Jiang, Baoheng Fu, Hongwei Ren, Xiangqian Wu

2026-08-04视觉感知

事件相机模型虽能直接处理稀疏异步事件流,但单点显著性难以解释哪些时空事件结构真正支撑预测。VGER的核心是把体素扰动得到的任务相关区域证据回传到事件级,并与梯度证据融合,形成全局事件排序,同时评估高重要与低重要两端。实验在3个事件基准、PointNet/PointNet++/EventMamba等9种设置中均优于点级显著性基线。

Clear-Weighted Bit Allocation for Satellite Downlinks Figure 1
2026-08-04cs.NI

Clear-Weighted Bit Allocation for Satellite Downlinks

Alireza Furutanpey, Qiyang Zhang, Yujie Huang, Philipp Raith, Schahram Dustdar

2026-08-04视觉感知

针对遥感卫星成像量超过间歇下行能力、传统云检测丢帧会误删大量晴空地表的问题,本文把云概率只用于训练加权神经压缩,并用编码器特征估计晴空价值来调度可续传的基础层和增强层。结果显示在相同晴空质量下最多少用47.8%字节,DPMW调度使按期完整交付从38.1%升至83.5%,但真实任务收益仍需进一步验证。

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression Figure 1
2026-08-04cs.CV

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

1 University of Illinois Urbana-Champaign, 2 2 Northwestern University

2026-08-04视觉语言

这篇论文针对具身代理在长时程替用户做选择时难以累积证据、理解隐含偏好并跨环境比较的问题,提出 DunphyBench 房屋选择基准,并指出未筛选的多模态历史会引入噪声,记忆管理是关键瓶颈。为此设计偏好条件化的 MeMento 记忆压缩器,用固定记忆 token 保留决策相关信息;实验中准确率较最强基线提升 7.18%,同时内存使用减少 85.38%。

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration Figure 1
2026-08-04cs.RO

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration

Haoran Liao, Pengyue Wang, Shuoyu Chen, Kehan Cheng, Xuhang Chen, Yuhao Lin, Mu Lin, Zhizhao Liang, Xiaoyi Fan, Chengyi Xing, Dan Niu, Yi-Lin Wei, Wei-Shi Zheng

Sun Yat-sen University, Stanford University, Southeast University

2026-08-04机器人模仿学习

DynamicManip针对动态操作中示教采集成本高、策略响应慢的问题,提出从单条静态示教合成多样动态轨迹的数据增强流程,并用动态阶段指示器自适应调整策略推理频率。其基准和仿真/真实实验显示,平均成功率提升18.4个百分点、策略查询延迟降低32.9%;但具体增益中数据扩增与策略自适应各自贡献仍需结合消融判断。

PackingGPT: 3D Packing Agent for Real Furniture in Last-Mile Delivery Figure 1
2026-08-04cs.CV

PackingGPT: 3D Packing Agent for Real Furniture in Last-Mile Delivery

Yi You, Hui Li

Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University, Hong Kong, China, Findings: Five baseline packing methods were tested on our dataset without considering the Centre-of-, and an available vehicle, predicting whether the items will fit and remain stable in transit.

2026-08-04三维

本文针对家具自提/末端配送中“扁平包装能否稳定装进已被杂物占用的私家车后备箱”这一现实问题,提出HFVP基准数据集和将装箱序列 token 化的Lego-Language Packing框架,把重心稳定性纳入逐件放置决策。结果显示,忽略重心约束的启发式方法在轿车场景有10%-40%箱体失稳,而加入CoM约束训练后,LLP在SUV-500上失效率降至0.67%,并能泛化到未见家具和不同杂物布局。

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking Figure 1
2026-08-04cs.RO

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking

Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou

2026-08-04机器人视觉感知

GenTrack针对零样本人形跟踪依赖大规模具身数据、且人类/重定向动作未必可由机器人闭环执行的问题,提出生成器与跟踪器在线共训练:用执行反馈对文本到动作生成器做物理对齐,再用新生成动作扩展跟踪训练,并以锚定和回放抑制漂移。在Unitree G1、ProtoMotions和SONIC上,方法提升生成动作可执行性与语义一致性,并扩大AMASS、LAFAN及野外分布外测试中的零样本覆盖和跟踪精度。

Training-Free Out-of-Distribution Detection for Pathology Whole-Slide Images Figure 1
2026-08-04cs.CV

Training-Free Out-of-Distribution Detection for Pathology Whole-Slide Images

Sabri Mustafa Kahya, Richard R. Chen, Muhammet Sami Yavuz, Jerry Jierui Lou, Akanimoh Adeleye, Haci Ali Kahya, Jana Lipkova

2026-08-04视觉感知

病理全切片模型在临床部署时会遇到罕见疾病、近域异常和染色/扫描差异,需在超出训练分布时拒答。论文提出无需再训练的 ZIO,用病理视觉语言基础模型构建文本与视觉类原型,并通过原型收缩融合两种模态来打分,兼容切片级和 patch 级模型。在五个独立队列、超过 1.47 万张 WSI 上,ZIO 优于单模态原型和 40 种 OOD 方法。

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space Figure 1
2026-08-04cs.RO

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E.H. Tay, Marcelo H. Ang Jr., Haiyue Zhu

2026-08-04强化学习

SG-WAM针对现有世界动作模型在像素预测中承担过多感知负担、在潜空间预测中又可能与策略表征脱节的问题,提出在策略自身表征空间内学习带几何约束的动作条件动力学:用动态token和EMA策略目标进行自引导未来对齐,并以几何监督塑造图像token。实验中0.9B模型在无大规模具身预训练下,LIBERO平均成功率达98.5%,LIBERO-Plus达73%,并报告了分布内外真实评测增益。

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision Figure 1
2026-08-04cs.CV

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

Purdue University, University of Illinois Urbana-Champaign

2026-08-04视觉感知

本文针对长文本人体动作数据只有片段级标注、缺少帧到短语对应关系的问题,提出 FineMoLA:先用 LLM 拆出动作短语,再把帧-短语匹配建模为带熵正则的最优传输,并用 Sinkhorn 推断伪帧级对齐。SnapMoGen 实验显示其运动-文本 grounding 优于基线,但生成任务收益与泛化范围文中未充分说明。

Understanding Synergistic Interactions among Pathology Foundation Models via Adaptive Fusion Figure 1
2026-08-04cs.CV

Understanding Synergistic Interactions among Pathology Foundation Models via Adaptive Fusion

Yuxiang Xiao, Yang Hu, Bin Li, Tianyang Zhang, Zexi Li, Huazhu Fu, Jens Rittscher, Kaixiang Yang

2026-08-04视觉感知

这篇论文针对病理基础模型训练数据、结构和自监督目标不透明带来的表征偏差,提出 AdaFusion:先压缩多个冻结 PFM 的异构特征,再用样本条件门控自适应加权模型级或通道级贡献。实验覆盖治疗反应预测、前列腺癌分级和空间基因表达回归,结果显示其整体优于单模型及 Self-Attn、Top-3 MoE 等融合基线,并能用贡献图解释不同模型偏好的组织形态区域。

Harnessing Adversarial Distillation to Customise Debiased, Disease-Specific Pathology Foundation Models for Breast Cancer Figure 1
2026-08-04cs.CV

Harnessing Adversarial Distillation to Customise Debiased, Disease-Specific Pathology Foundation Models for Breast Cancer

Zhiwei Chen, Yang Hu, Yuxiang Xiao, Yakun Ju, Tianyang Zhang, Yingxue Xu, Wei Li, Hao Chen, Jens Rittscher, Kaixiang Yang

2026-08-04视觉感知

该文针对通用病理基础模型在乳腺癌场景中参数大、推理成本高且易继承多中心站点偏差的问题,提出 SmartStu:用多教师蒸馏训练轻量学生模型,并引入预测噪声/站点线索的对抗教师来压制非生物学特征,辅以伪影注入自监督。三套外部乳腺癌队列上,小模型体量缩小 30 倍以上,同时基本保持甚至局部超过通用 PFM 的 bAcc 和 AUC。

CORTIVA: Candidate-Score Fusion of Complementary Visual Teachers for EEG- and MEG-to-Image Retrieval Figure 1
2026-08-04cs.CV

CORTIVA: Candidate-Score Fusion of Complementary Visual Teachers for EEG- and MEG-to-Image Retrieval

Junhan Wang, Kani Chen

2026-08-04视觉感知

本文针对EEG/MEG视觉检索中多种视觉监督被过早压成单一嵌入、丢失模型间分歧的问题,提出CORTIVA:让三条解码路径分别对同一候选图像库打分,再在温度缩放后的候选分数层面融合。实验显示其在THINGS-EEG2上达到73.5% Top-1、95.3% Top-5,较最强基线提升10.3和5.4个百分点,并在THINGS-MEG上取得42.4% Top-1;消融与权重控制表明增益主要来自互补分数整合,而非复杂加权规则。

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle Figure 1
2026-08-04cs.CV

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

2026-08-04视觉感知

PixVL针对像素级MLLM中区域理解与区域分割相互干扰、且高质量mask-text配对数据稀缺的问题,提出自监督Mask-Text一致性循环。其关键洞察是单靠重分割IoU不足以评价描述质量,因此加入混淆候选语义验证、跨视图验证和质量耦合的双向学习,使描述生成与文本到掩码互为验证信号。实验显示该方法在区域理解和分割任务上均带来稳定提升。

Prompt-Driven Simulation with Feature Perturbation for Cross-Domain Few-Shot Object Detection Figure 1
2026-08-04cs.CV

Prompt-Driven Simulation with Feature Perturbation for Cross-Domain Few-Shot Object Detection

Linhai Zhuo, Junxi Cai, Tianwen Qian, Qingping Zheng, Yang Liu

Fuzhou University, Xiamen University

2026-08-04视觉感知

针对跨域少样本检测中标注稀缺与源/目标域差异叠加的问题,PSP-FSOD用VLM提示驱动生成同时改变前景和背景、且保持语义与空间对齐的训练样本,并在多尺度特征中加入带分布校正的高斯扰动以降低域特定依赖。实验显示其在多个CD-FSOD基准上稳定优于现有增强方法,1/5/10-shot指标从34.2/44.3/46.6提升到36.4/45.0/47.1。

DeVIT: Low-Power Vision Transformer Acceleration Using Delta Computation Figure 1
2026-08-04cs.CV

DeVIT: Low-Power Vision Transformer Acceleration Using Delta Computation

Reyhaneh Hosseinzadeh, Parham Zilouchian Moghaddam, Mehdi Modarressi

2026-08-04视觉感知

DeVIT面向ViT在边缘设备上因密集GEMM、MAC和存储带宽过高而难以低功耗部署的问题,利用低比重量化带来的权值取值局部性,将每行权重排序并以delta形式存储,通过复用前一乘积、用移位加法近似小差分,减少乘法器需求。实验报告归一化计算负载降至0.53,单GEMM能耗159.57 nJ,较对比中最低能耗ShiftAddLLM低约5.5%,但精度有一定下降。

Driver2Map: Imitating Human Driving for Online High-Definition Map Construction Figure 1
2026-08-04cs.CV

Driver2Map: Imitating Human Driving for Online High-Definition Map Construction

Pan Yin, Runtian Xia, Weisong Kuang, Kaiyu Li, Cong Zhao, Xiangyong Cao

2026-08-04视觉感知

Driver2Map面向在线高精地图构建中车载多视角图像、SD地图与卫星图难以对齐和融合的问题,模仿人类驾驶员先感知、再关注结构、最后补全遮挡的过程,提出三模态框架、两阶段坐标对齐、姿态引导BEV融合和预训练地图先验细化。nuScenes实验显示其在不同BEV范围和语义类别上优于已有方法,IoU与AP均有提升。

Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data Figure 1
2026-08-04cs.CV

Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data

Advait Pavuluri, Shamik Karkhanis, Uzma Mushtaque

2026-08-04模仿学习

本文关注自动驾驶车队海量视频中“值得人工复查”片段的无标签筛选问题,检验用冻结 V-JEPA 编码器加轻量预测头、以遮挡嵌入预测误差衡量新颖性的方案。核心洞察是跨数据集评测会把域差异误判为复查价值:AP 可达 0.89,但在同一 nuScenes 公平基准上降至 0.29、接近 0.24 随机水平;同一嵌入上的监督探针达 AP 0.50,说明失败主要在自监督目标而非表征本身。

SphereVideo: Prototype-anchored Hyperspherical Boundary for Continual AI-generated Video Detection Figure 1
2026-08-04cs.CV

SphereVideo: Prototype-anchored Hyperspherical Boundary for Continual AI-generated Video Detection

Fei Li, Yue Yu, Yuran Wang, Xinghan Li, Jingjing Chen, Yu-Gang Jiang

Fudan University, Peking University, Fudan University Shanghai China, Peking University Beijing China

2026-08-04视觉感知学习理论

针对AI生成视频检测在新生成模型出现时易失效、持续学习中易遗忘的问题,SphereVideo把真实视频特征在超球面上的紧凑分布作为稳定锚点,学习以真实原型为中心的边界,并用帧级平滑与片段级打乱对比强化时间一致性建模。实验显示其在持续学习与泛化基准上优于既有方法,已见数据提升3.08%,未见生成器数据提升4.00%。

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning Figure 1
2026-08-04cs.CL

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

The University of Hong Kong

2026-08-04数据集/基准

针对现有图表 VQA 基准多停留在单图感知或简单跨图比较、难以检验长上下文多步推理的问题,LongChart 用潜在图约束的数据合成流程构造内部一致的多图多问基准,平均每例含 6.5 张图和 31.2 个问题,并覆盖抽取、比较、计算、定位与指点。对 10 个 MLLM 的评测显示,随着计算 hop 和分析复杂度上升,准确率显著下降且模型差异扩大,说明当前模型在复杂多图推理上仍不稳。

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning Figure 1
2026-08-04cs.CV

Remember-R1: Mitigating Long-Context Visual Forgetting through Reinforcement Learning

Jianmin Chen, Jiaqi Tang, Wei Wei, Xiaogang Xu, Jiafei Wu, Zhe Liu, Qianzhou Wang, Yingying Yan, Botong Geng, Yuyang Xia, Lei Zhang, Qifeng Chen

Northwestern Polytechnical University, Hong Kong University of Science and Technology, Zhejiang University, Northwestern Polytechnical University Xi’an China, Hong Kong University of Science and Technology Hong Kong China, Zhejiang University Hangzhou China

2026-08-04强化学习

这篇论文针对多模态大模型长链式推理中后期逐渐脱离图像证据的“视觉遗忘”问题,提出 Remember-R1:不改变推理流程,而是在原始生成轨迹上用强化学习过程奖励约束视觉关键词覆盖、后期视觉依赖保持和关键区域关注。实验覆盖两种模型规模和七个多模态基准,显示推理性能稳定提升,注意力分析也表明视觉注意衰减被减缓。

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents Figure 1
2026-08-04cs.CV

SPAE: Spectrally Guided Autoencoder for Pretrained Visual Latents

Yibin Huang, Jixiang Hong, Zongzhao Li, Yuhan Dai, Zhibin Wang, Chunwei Wang, Jun Song, Chen Wang, Xiaofei Sun, Xiaoxiao Xu, Conghui Zhu

Gaoling School of Artificial Intelligence, Renmin University of China

2026-08-04视觉感知

SPAE关注预训练视觉模型语义 latent 用于生成时的不稳定性:高维特征虽利于理解和重建,但 DiT 生成 latent 与编码器 latent 在高频谱上失配,且高频细节与语义跨通道纠缠。方法用紧凑瓶颈压制不稳定高频、保留语义,并以通道掩码促进解耦;实验显示其在理解、重建和生成质量之间取得更均衡表现。

Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection Figure 1
2026-08-04cs.CV

Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection

Ziheng Wang, Chaolang Li, Yutong Yang, Xiaohan Xu, Chongxiang Yang, Hengxuan Zhong, Zhen Liang, Pengwen Dai

2026-08-04视觉感知

本文针对RGB-Event小目标检测中“定位与分类共用同一融合表示”的问题,指出Event更擅长类别无关定位、RGB更适合局部区域内分类。作者提出AERODet,用SURE按尺度估计两模态可靠性以校准解码器聚合,并用TDSR将定位、目标性和RGB语义分类解耦;在FRED和NeRDD上达到SOTA,FRED challenging较最强基线提升10.7 mAP。

Ranking Image Fusion the Way Humans Do: A Learned Pairwise Preference Metric for Infrared-Visible Fusion Assessment Figure 1
2026-08-04cs.CV

Ranking Image Fusion the Way Humans Do: A Learned Pairwise Preference Metric for Infrared-Visible Fusion Assessment

Haoran Liu, Mingzhe Liu, Peng Li, Guibin Zan

School of Artificial Intelligence and Electronic Engineering, Sichuan Technology and Business, University, Chengdu 611745, China, Chengdu University of Technology, College of Nuclear Technology and Automation, Sigray, Inc., Concord, CA 94520, USA, model that operationalizes the human A/B/Tie comparison protocol as a repeatable, scalable, benchmark, labeled under a blinded, randomized, two-stage protocol with expert adjudication., closely and reproduces the tie-aware Bradley–Terry rankings derived from human labels, Case 3: labMan, ADF vs. RP_SR, (color speckle noise across the labMan scene

2026-08-04视觉感知

红外-可见光融合缺少参考真值,传统客观指标常把伪纹理或丢失热目标的结果排在前面,偏离人类偏好。本文把评估改成源图条件下的 A/B/平局成对偏好学习,构建覆盖 VIFB 25 种方法、6300 对比较的人工偏好集,并用 LPIFM 直接预测三类判断再汇总排名;在全方法池上准确率达 0.792–0.840、排序相关 0.941–0.977,显著高于最佳传统指标 SCD 的 0.629。

UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction Figure 1
2026-08-04cs.CV

UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction

Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

University of Minnesota

2026-08-04生成模型

UDT针对DiT后层被去噪细节牵引、编码解码能力失衡,以及现有U-Net式DiT下采样不适配Transformer的问题,提出保持token通道维度不变、用数据自适应token合并/反合并完成层级降采样与上采样。该设计兼顾表征一致性、跨注意力/REPA兼容性和计算效率;在ImageNet 256上,XL模型40个epoch即可超过SiT 1400个epoch的FID,并在CFG下达到约1.35-1.38 FID。

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion Figure 1
2026-08-04cs.CV

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion

Jiawei Guo, Junxian Li, Yixin Tang, Bingya Zhang, Jiaxin Lu, Yulun Zhang, Shangchen Zhou

2026-08-04视觉感知

TurboClear针对扩散式物体及阴影/反射等伴随效应移除推理成本高、一步蒸馏易破坏“编辑受影响区域、保留背景”空间非对称性的问题,提出区域校准分布匹配,用效应区域为生成与保真分配不同蒸馏目标,并用可学习空间融合在推理时合并移除流与保留流。实验显示其在接近或优于ObjectClear、OmniPaint等质量的同时,将计算开销分别最高降低40.04倍和665倍。

Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images Figure 1
2026-08-04cs.CV

Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images

Shuliang Zhu, Qi Wang, Ryugo Morita, Jinjia Zhou

2026-08-04视觉感知生成模型

这篇论文针对无约束人物照片中视角、姿态、裁剪和遮挡导致的全身捕捉对应关系不可靠问题,提出 Astrolabe:把粗粒度的 SPH 球面图转换为有界空间噪声偏移,并在带路由的扩散校正器中用于参考关联,在优化式重建中用于引导蒸馏。核心洞察是对应不必像素级准确,粗视角和身体布局已足以组织扩散先验。实验显示其在 Puzzle-IOI 与 4D-Dress 上提升图像指标,Puzzle-IOI 几何指标也改善,4D-Dress 几何总体稳定。

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere Figure 1
2026-08-04cs.CV

Rethinking Video Token Compression with a Global Codebook: Learning Once, Compressing Everywhere

Jiayang He, Tianling Xu, Diancheng Kang, Huaide Jiang, Junyan Bai, Shaoming Zheng, Xuan Song

2026-08-04视觉感知

视频大模型处理长视频时会产生大量冗余视觉 token,现有压缩多在推理阶段逐视频计算,额外开销和模型耦合较重。ONCE 的核心思路是离线学习冻结特征空间中的全局码本,推理时用码本查找、重分配和均值池化复用跨视频的分组先验。实验显示其在四个视频理解基准和两个骨干上保持竞争精度,紧 token 预算下优于对比压缩方法,B=512 时预填充 FLOPs 大幅下降并带来约 2.96 倍端到端加速,但仍不能减少视觉编码成本。

Hermite Curves as Trajectory Priors for Vision-Language-Action Models Figure 1
2026-08-04cs.RO

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng

Qi Lv, Zhao Yang, Mingyuan Yao, Yinan Shi, and Yawei Jueluo are with Jiangsu Cytoderm Intelligent Technology Co., Ltd., China, 215334.

2026-08-04视觉语言视觉感知规划控制

本文针对 VLA 动作块被逐时刻展平后容易产生抖动和块间不连续的问题,引入以端点位置与速度参数化的分段三次 Hermite 曲线先验,并比较 token、scaffold 与训练正则三种用法。结果显示,仅作为辅助训练约束的 Hermite Regularization 最有效,在 LIBERO、LIBERO-plus 和真实机器人任务上均提升成功率,且推理无额外开销,说明轨迹结构更适合作为学习阶段的归纳偏置。

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2 Figure 1
2026-08-04cs.CV

A Benchmark Dataset for MLLM-Generated Image Detection: GPT Image2 & Nano Banana2

Zirui Zhang, Yinbo Yu, Donghai Guan, Chunwei Tian, Daoqiang Zhang, Qi Zhu

2026-08-04视觉感知数据集/基准

针对 GPT Image2、Nano Banana2 等 MLLM 生成图像更逼真、文本与局部编辑痕迹更弱的问题,论文构建覆盖纹理、结构、混合内容及三类生成协议的检测基准,并指出传统检测器从旧基准迁移到该场景会明显退化。作者进一步提出融合纹理证据与结构伪影先验的 SAP-DSP,实验显示其在新基准上更稳定,但具体增益是否来自结构建模还是数据适配仍需进一步拆解。

From Forest to Future Capital: Tracking Land Cover Change in Ibu Kota Nusantara (IKN) from 2021 to 2026 with PlanetScope Imagery Figure 1
2026-08-04cs.CV

From Forest to Future Capital: Tracking Land Cover Change in Ibu Kota Nusantara (IKN) from 2021 to 2026 with PlanetScope Imagery

Clarissa Rui Min Ong, Elizabeth Tee Inn Loo, Kenneth Woon Hao Soh, William Rachmadi, Qiming Zheng, Hao Li

2026-08-04视觉感知

为检验印尼新首都IKN“森林城市”愿景与核心政府区快速建设之间的张力,论文用2021-2026年PlanetScope高分辨率时序影像、NDVI/NDRE/NDWI指数和SVM地类分类量化地表变化。核心洞察是建设扩张已造成可观生态转化:开发用地增加672%,总植被减少18.1%,平均NDVI下降17.1%,碳储量下降0.28%,其中2023-2024年植被损失最集中。

VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval Figure 1
2026-08-04cs.CV

VaRS-Doc: Interpretation-Aware Variant Representations via Latent Self-Probing for Visual Document Retrieval

Haocheng Wang, Tongkun Guan, Wei Shen, Xiaokang Yang

2026-08-04视觉感知

这篇论文针对视觉文档检索中离线索引必须使用固定文档表示、但查询意图会改变同一页面语义解读的矛盾,提出 VaRS-Doc:用潜在自探测 token 在编码阶段生成多个互补解释分支,并在 late interaction 检索时由查询选择最匹配变体。两阶段训练用于避免分支坍缩。实验显示其在视觉文档检索基准上达到 SOTA,并验证不同变体确有互补使用。

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling Figure 1
2026-08-04cs.CV

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

Puzhuo Zheng, Hasan Kurban

2026-08-04视觉语言视觉感知

论文关注视觉语言模型测试时扩展中,候选答案选择容易把图像依据与语言先验猜测混为一谈的问题。作者审计扰动一致性选择 PGS,并提出格式匹配控制 MatchedCtrl,指出关键混杂来自 CoT 与短答案解码格式差异。实验显示 PGS 相比普通多数投票可有大幅提升,但在同预算同格式控制下不优于 MatchedCtrl,扰动稳定性只能部分诊断视觉依赖,不能作为可靠选择信号。

Fruit-HSNet: A Machine Learning Approach for Hyperspectral Image-Based Fruit Ripeness Prediction Figure 1
2026-08-04cs.CV

Fruit-HSNet: A Machine Learning Approach for Hyperspectral Image-Based Fruit Ripeness Prediction

Ahmed Baha Ben Jmaa, Faten Chaieb, Anna Fabijańska

Efrei Research Lab, Paris Panthéon-Assas University, Paris, France, Institute of Applied Computer Science, Lodz University of Technology, Łódź, Poland

2026-08-04视觉感知

面向水果成熟度预测中标注数据有限、跨高光谱相机和水果类型泛化不足的问题,论文提出 Fruit-HSNet,将傅里叶变换提取的空间特征与中心像素光谱签名进行可学习融合,再用全连接分类器判别成熟度。在 DeepHS Fruit 五类水果、三种相机数据上,报告总体准确率 70.73%,较既有最佳方法提升约 12%,但具体增益中各模块贡献仍需结合消融进一步确认。

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning Figure 1
2026-08-04cs.RO

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning

Volodymyr Havrylov, Faris Janjoš, Andreas Look, Jürgen Mathes, Andreas Geiger

University of Tübingen, Bosch Center for Artificial Intelligence, Coburg University, Tübingen AI Center

2026-08-04视觉感知规划控制

针对端到端自动驾驶规划只在输出端监督、深层表示梯度较弱的问题,PRISM指出既有VLM潜空间监督的收益主要来自与真实未来轨迹的分布对齐,而非语言语义推理;据此将中间轨迹相关latent建模为可重参数化概率分布,并用ELBO直接从GT路径施加深监督。在nuScenes/VAD-Tiny设置下,相比强向量化基线规划L2误差约降8%、碰撞率约降3%,且额外计算开销很小。

QuerySplat: Decoupling Geometry and Appearance Representations in 3DGS Prediction Figure 1
2026-08-04cs.CV

QuerySplat: Decoupling Geometry and Appearance Representations in 3DGS Prediction

Yinglong Li, Donghui Shen, Xiaoyu Zhang, Zhichao Ye, Hongyu Wu, Aimin Hao, Guofeng Zhang, Haomin Liu

2026-08-04三维

QuerySplat针对前馈3DGS中像素对齐方法空间受限、query方法缺少3D先验且几何与外观耦合导致模糊和依赖位姿的问题,提出几何/外观双分支query解码器,并用预训练VGM提供规范坐标和早期深度正则。实验在DL3DV上取得SOTA,新视角合成PSNR较最佳无位姿和需位姿基线分别提升2.30 dB与1.04 dB。

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering Figure 1
2026-08-04cs.CV

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

Changwoo Baek, Kyeongbo Kong

2026-08-04三维

3DZip针对投影式3D VLM在三维问答中每个场景产生大量token、推理开销高的问题,指出仅按空间邻近压缩会留下对象级长尾冗余。方法将粗体素聚合、基于特征多样性的DPP锚点选择和空间约束合并串联,以兼顾对象覆盖与几何一致性;在ScanQA、SQA3D、OpenEQA上,128个token保留94.7%原始性能并带来1.92倍推理加速。

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction Figure 1
2026-08-04cs.CV

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang

Tsinghua University, Shenzhen International Graduate School, Huawei Technologies Ltd, Harbin Institute of Technology, Shenzhen, Peng Cheng Laboratory, Tsinghua University, Shenzhen International Graduate School Shenzhen Guangdong China, Huawei Technologies Ltd Shenzhen Guangdong China, Harbin Institute of Technology, Shenzhen Shenzhen Guangdong China, Peng Cheng Laboratory Shenzhen Guangdong China

2026-08-04三维

动态物体会污染观测、误导不确定性估计和视点规划,使面向静态场景的主动三维重建难以可靠工作。DynActiveGS将3D Gaussian Splatting用于闭环主动探索,核心是把不确定性分解为结构不足与运动干扰,并用其加权优化、选择视点和约束路径。实验在动态基准上提升重建精度、完整性、渲染质量与探索效率,但验证仍主要限于仿真场景。

Think in Sets for Streaming Video Token Compression Figure 1
2026-08-04cs.CV

Think in Sets for Streaming Video Token Compression

Moxu Duan, Jingwen Fu, Yuwang Wang

2026-08-04视觉感知

面向流式 VideoLLM 中视觉 token 随帧累积导致的预填充延迟和显存压力,本文将压缩从独立打分改写为集合选择,强调 token 的边际增益取决于已保留内容。NovaCov 用有容量上限、带时效权重的历史参考库刻画已传达信息,并以双分支子模覆盖目标兼顾当前帧代表性与历史新颖性。实验显示其在流式和离线基准上优于训练自由压缩方法,保留 ReKV 99.6% 准确率并降低 46% 预填充延迟。

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos Figure 1
2026-08-04cs.CV

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

2026-08-04视觉感知数据集/基准

这篇论文针对现有音视频生成多停留在“按描述合成”、缺少由用户交互触发的真实响应监督的问题,提出 InteracVid 数据集,从直播视频中构建包含前序音视频上下文、弹幕/重构查询和真实响应片段的三元组,并用元数据对齐与查询重构扩展样本。数据规模超过45.4万条、覆盖多类场景;人工评估显示交互因果性和边界较可靠,微调后提升交互规划与音视频响应生成,但增益可能主要来自 data。

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering Figure 1
2026-08-04cs.IR

UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering

Ganzhong Luo, Yang Ren, Hanyong Wang, Shuyu Zheng, Menglong Yang

School of Aeronautics and Astronautics, Sichuan University, School of Aeronautics and Astronautics, Sichuan University Chengdu China

2026-08-04视觉感知

针对知识型视觉问答中单一图像或文本检索易漏召回、重排器又忽视候选来源先验的问题,UniHEAR将I2I与I2T候选统一建池,用粗检索描述符调节多模态注意力并融合熵加权先验,同时兼顾实体与章节检索。实验在E-VQA和InfoSeek上提升检索与问答表现,Recall@1较强基线分别提高6.7和1.2点。

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity Figure 1
2026-08-04cs.RO

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo

2026-08-04机器人

本文针对多机器人深度估计中平台、环境和深度范围差异导致联邦学习退化的问题,提出 FeDepth:用描述符驱动的软聚类让客户端可同时参与多个簇,以刻画真实部署中重叠而非清晰分离的数据分布。论文还构造 HPE 与 BMR 两类非 IID 场景;实验显示该方法在多种深度网络上较标准 FL 和硬聚类 CFL 更稳健。

MiniWorld: Democratizing the Training of Video World Models from Scratch Figure 1
2026-08-04cs.CV

MiniWorld: Democratizing the Training of Video World Models from Scratch

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

2026-08-04视觉感知强化学习

MiniWorld针对视频世界模型从零训练门槛高、后训练流程复杂且与因果流式推理不匹配的问题,提出块因果Video DiT、分块非递减噪声调度、两阶段续训与滚动KV缓存的开源训练/推理配方。论文主要结果是模型可在单台8卡服务器数日内训练,并支持有界计算下的长时程动作条件视频生成,但相对大模型的质量增益来源仍需更多实验说明。

CoT-Edit: Let CoT Guide Instruction Video Editing Figure 1
2026-08-04cs.CV

CoT-Edit: Let CoT Guide Instruction Video Editing

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

University of Science and Technology of China, Zhongguancun Academy, Tsinghua University

2026-08-04视觉感知

这篇论文针对复杂场景中仅靠文本指令进行视频编辑时容易选错目标、运动轨迹不合理和时序不稳定的问题,提出 Plan-Guide-Edit:先由带 CoT 的多模态大模型解析视频与指令,生成关键帧框和增强指令,再用框条件掩码约束扩散编辑器。实验显示其在多相似目标定位、物体添加的物理一致性和视觉质量上优于多种文本驱动基线,但具体增益中规划、掩码与联合训练各自贡献仍需看消融细节。

SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs Figure 1
2026-08-04cs.CV

SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs

Junsheng Wang, Chao Chen, Mengying Xie, Mingyan Li, Fuqiang Gu

2026-08-04视觉感知

这篇论文针对LLM仅依赖自然语言生成布局时难以稳定表达几何关系和物体依赖的问题,提出SG-Layout:先将指令解析为场景图,用关系图编码器和投影器对齐到LLM token空间,再通过LoRA做指令微调。实验覆盖图像布局、室内场景合成和机器人重排,显示其相对同一Qwen3-8B骨干提升空间推理与几何一致性,优势主要出现在关系密集、组合复杂场景。

From Patches to Evidence Balls: Class-Conditioned Evidence Retrieval for Few-Shot Whole Slide Image Classification Figure 1
2026-08-04cs.CV

From Patches to Evidence Balls: Class-Conditioned Evidence Retrieval for Few-Shot Whole Slide Image Classification

Di Zhang, Li Zhang, Jiashuai Liu, Junbo Lu, Zhi Zeng, Jiusong Ge, Chunze Yang, Yi Niu, Jian Chen, Kai He, Zeyu Gao, Chen Li

University of Cambridge

2026-08-04视觉感知

少样本全切片分类中,诊断线索稀疏且类别相关,传统 MIL 将大量 patch 压成全局表示,容易稀释证据并削弱可解释性。EviBall 将局部 patch 组织为兼具语义、空间和支持质量的“证据球”,再用语言或 RNA 引导的类别查询做类条件检索。实验覆盖形态学与分子终点任务,在 1/2/4/8-shot 设置下整体优于视觉和多模态 MIL 基线,并给出空间定位的类别证据。

SSR: Similarity-Shift Refinement for Training-Free Object-Centric Masks Figure 1
2026-08-04cs.CV

SSR: Similarity-Shift Refinement for Training-Free Object-Centric Masks

Xiaoqian Lu, Guangfu Guo

2026-08-04视觉感知

这篇论文针对物体中心模型常见的掩码碎片化、边界泄漏和错误合并问题,提出无需训练的 SSR 后处理方法。核心洞察是利用冻结 DINOv2 中自注意力 value 聚合前后 patch 相似度的正向变化,而非静态特征相似度,构图后一次传播原始 slot 软分配。实验在 24 个模型-数据集组合上均提升 all-pixel ARI,平均增益 8.5 个百分点,但纹理密集场景可能过度合并相似区域。

Lethe: How Hard Is It to Forget? A Benchmark for Federated Unlearning in Medical Imaging Figure 1
2026-08-04cs.CV

Lethe: How Hard Is It to Forget? A Benchmark for Federated Unlearning in Medical Imaging

Shengchao Chen, Ting Shu

University of Technology Sydney, Shenzhen University

2026-08-04数据集/基准

这篇论文针对医疗联邦学习中医院退出、患者撤回同意或类别下线后的“遗忘”需求,指出现有联邦遗忘评测多来自自然图像,难以判断其在临床数据上的可靠性。作者提出 Lethe 基准,覆盖16个数据集、8类医学任务、12种方法和三种遗忘粒度,并以重训模型衡量效用、隐私与成本。主要结果是方法差异往往由遗忘请求难度决定:简单请求难区分方法,而在许多跨站点泛化任务中,客户端遗忘几乎不改任务性能,残余成员信息才是关键风险。

Logit-Origin Centering for Singleton Test-Time Adaptation Figure 1
2026-08-04cs.LG

Logit-Origin Centering for Singleton Test-Time Adaptation

Mayank Sharma, Rohit Kumar Mourya, Pratik Mazumder

2026-08-04视觉感知

这篇论文并非机器人操作研究,而是面向表格数据的单样本流式测试时自适应:现有FTTA依赖批量统计,在每次只来一个无标签样本时会退化或失效。作者将问题重述为logit位置可识别性,提出冻结模型、仅用历史logit均值做PLOC中心化。五个TableShift基准、三类骨干和多检查点上,PLOC提升准确率、校准和似然,并基本保持AUROC。

PlantRig - From Bones to Branches: Adaptation of Autoregressive Rigging Models for Plant Skeletal Reconstruction Figure 1
2026-08-04cs.CV

PlantRig - From Bones to Branches: Adaptation of Autoregressive Rigging Models for Plant Skeletal Reconstruction

Nathan Hu, Yang Yang, Fumio Okura

Computer Science, University of Osaka, Osaka, Japan

2026-08-04三维

本文关注通用自回归骨骼绑定模型在植物三维骨架重建中的域迁移问题,动机来自农业表型、采摘修剪和数字孪生对分枝拓扑的需求。论文发现 UniRig 失败主要源于分支 token 在采样中被压制,以及冻结网格编码器对结构差异不敏感;据此用多轮 L-system 合成数据微调。结果显示模型可逐步恢复复杂分枝,并扩展到含叶片植物,但增益可能主要来自数据与微调规模。

ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models Figure 1
2026-08-04cs.CV

ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models

Hashmat Shadab Malik, Toluwani Aremu, Samuele Poppi, Muzammal Naseer, Salman Khan

2026-08-04视觉感知

针对 CLIP 类视觉语言模型在未知攻击预算下测试时防御强度固定、易对弱攻击过度修正或对强攻击不足的问题,ReACT-CLIP 用低/高噪声探测下的视觉特征相对漂移估计每个样本所需修正强度,并结合弱空间增强下的预测分布不稳定性决定是否介入。该方法无需训练,在 12 个下游数据集、ImageNet 及分布偏移变体上提升多类攻击和扰动预算下的鲁棒准确率,最高较最强基线高 46.50 个百分点,同时基本保持干净精度。

One Query, Many Scales: Sparse Mixture-of-Experts for Efficient Hierarchical Cross-View Geo-Localization Figure 1
2026-08-04cs.CV

One Query, Many Scales: Sparse Mixture-of-Experts for Efficient Hierarchical Cross-View Geo-Localization

Ruijie Fan, Junyan Ye, Qi Zhu, Weijia Li

2026-08-04视觉感知

面向大范围跨视角地理定位,论文针对固定分辨率平铺检索成本高、粗到细自回归易受早期错误影响的问题,提出GeoMoE:用稀疏专家双编码器学习跨分辨率统一嵌入,再用父子层级上的概率束搜索只比较少量候选。结果在Just Zoom In达95.78% R@40m,在VIGOR-M以5.27%穷举L3匹配计算取得62.39% R@1,并优于最强穷举基线3.12个百分点。

Extended KAFR: A kinematic-adaptive paradigm for the efficient analysis of surgical video Figure 1
2026-08-04cs.CV

Extended KAFR: A kinematic-adaptive paradigm for the efficient analysis of surgical video

Huu Phong Nguyen, Shekhar Madhav Khairnar, Ganesh Sankaranarayanan

2026-08-04视觉感知

本文针对手术视频时长达数小时、逐帧分析计算成本高的问题,将原用于机器人手术的 KAFR 扩展到腹腔镜场景。核心思路是用 YOLO 跟踪器械运动,并按位移或速度变化自适应挑选信息帧,再由 X3D 做阶段识别。在 Cholec80 上仅使用 0.58% 帧即取得 91.0% F1,接近 LoViT 和 Trans-SVNet,说明运动驱动采样在低画质、手持镜头干扰下仍有效。

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception Figure 1
2026-08-04cs.CV

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

2026-08-04视觉感知

这篇论文针对多目标结构化视觉感知中 GRPO 只给整段回答打分、容易同时强化正确框和重复/错误框的问题,提出 MCR-GRPO:用留一法估计每个预测框对匹配集合价值的边际贡献,并映射回生成该框的 token。其连续匹配评估器结合匈牙利匹配、计数归一化和连续 IoU。实验称在 REC、DOD、分割和计数任务上优于既有 GRPO 基线,并保持 VQA 能力。

Struct-GStream: Towards Efficient Free-Viewpoint Video Streaming at Low-Bitrates with Structured 3D Gaussians Figure 1
2026-08-04cs.CV

Struct-GStream: Towards Efficient Free-Viewpoint Video Streaming at Low-Bitrates with Structured 3D Gaussians

Han Jiao, Jiakai Sun, Lei Zhao, Wei Xing, Huaizhong Lin, Zhanjie Zhang, Ao Ma

College of Computer Science and Technology, Zhejiang University, China, Chinese Academy of Sciences, Beijing, China, University of Science and Technology Beijing, China

2026-08-04视觉感知三维

面向动态场景自由视点视频的在线流式构建,现有 NeRF/3DGS 方法常依赖完整序列或带来较高存储与训练开销。Struct-GStream 的核心是用可移动动态锚点生成结构化 3D Gaussians 表达主体运动,再用自由 3DG 的全局生成、剪枝与优化补齐缺失区域和新出现物体。实验显示其相较在线 FVV 方法在训练时间、存储和渲染质量上更优,同时保持有竞争力的渲染速度。

FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds Figure 1
2026-08-04cs.AI

FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das

2026-08-04强化学习

论文针对全球南方高密度、遮挡严重、交通主体异质的城市环境,指出现有 JEPA 世界模型在这类混合交通中容易丢失交互动态。FactorJEPA 将未来表征拆成布局、主体和交互通道,并加入可见性门控以保留部分可观测对象。作者构建 22 城市、1000 小时 DENSEWORLD 数据集,报告在未来 latent 误差、干预敏感性和遮挡鲁棒性上优于基线,但运动信息存在可复现的权衡。

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA Figure 1
2026-08-04cs.RO

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

2026-08-04生成模型

针对自动驾驶 VLA 自回归解码延迟高、长序列易受 exposure bias 影响,而从零训练扩散策略又偏单任务的问题,WAM-Diff2 将预训练自回归驾驶通用模型分阶段蒸馏为离散扩散模型:先用块因果注意力逐步放大并行块,再做块级和跨尺度蒸馏。实验覆盖规划、驾驶问答和感知任务,性能与自回归基线持平或更好,解码提速 2.8 倍,结合 FlashInfer 与 CUDA Graphs 后最高 15.1 倍。

Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking Figure 1
2026-08-04cs.CV

Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking

Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez

University of Helsinki, University of Copenhagen, University Grenoble Alpes, University of Lorraine

2026-08-04视觉感知数据集/基准

这篇论文针对视觉语言幻觉基准过度依赖特定模型、容易随模型迭代失效的问题,提出用人工撰写幻觉样本替代或补充模型生成样本。核心是构建多语言 SHEEP 数据集,并进行细粒度跨度级标注,比较随机采样、LVLM-judge 预筛和人工编写三种来源。结果显示,人工样本带来更高标注一致性和更可控的幻觉类型分布,同时与模型样本分布相近,可较合理反映检测器在 LVLM 数据上的表现。

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning Figure 1
2026-08-04cs.CV

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang

School of Computer, Electronics and Information, School of Computer, Electronics and Information Guangxi Key Laboratory of Multimedia Communications and Network Technology Guangxi University Nanning Guangxi China, School of Computer, Electronics and Information Guangxi University Nanning Guangxi China

2026-08-04视觉语言视觉感知

这篇论文针对零样本图像描述中用文生图合成训练对时常见的细粒度错配问题:图像和文本整体看似相关,却遗漏实体或属性落地错误。作者提出 ReCap,不再只按全局相似度重匹配或重生成图像,而是检测图像支持的实体并结合检索文本线索重写 caption,再用自适应动态加权降低噪声样本影响。实验显示其在域内和跨域零样本 caption 基准上提升一致性并达到当前最优表现。

Understanding and Overcoming Cross-modal Fusion Bias in Multimodal Anomaly Detection From A Fisher Information Perspective Figure 1
2026-08-04cs.CV

Understanding and Overcoming Cross-modal Fusion Bias in Multimodal Anomaly Detection From A Fisher Information Perspective

Kaifang Long, Lianbo Ma, Liming Liu, Guoyang Xie

Northeastern University, Northeastern University Shenyang China

2026-08-04视觉语言视觉感知

本文针对RGB-深度多模态工业异常检测中一类被忽视的融合偏置:早期训练阶段某一模态信息获取过快并压制另一模态,导致融合性能瓶颈。作者用Fisher信息矩阵刻画这种抑制现象,并提出可插拔UCFB,通过动态调节模态正则权重和典型相似性分析增强跨模态交互。在MVTec 3D-AD与Eyecandies上,方法在单类、多类和少样本设置均带来稳定提升。

One-Sided Quantile Coupling for Flow Matching Figure 1
2026-08-04cs.LG

One-Sided Quantile Coupling for Flow Matching

Jin-Young Kim, So-Yoon Cho, Hyun-Gyoon Kim

2026-08-04生成模型

本文针对 Flow Matching 中源样本与数据样本配对代价高、会影响轨迹几何和训练方差的问题,提出一侧分位数耦合 QC-FM:只采样数据批次,沿少量随机正交投影按秩映射到高斯分位数,再用条件高斯补全,从而避免小批量 OT 的成对代价矩阵和分配求解。在 CIFAR-10、CelebA、FFHQ、ImageNet-64 上,QC-FM 在相同训练预算下优于基线和 OT-CFM,FID 最高降低 12.9%,但其理论主要解释切片方差与局部耦合,非全局 OT 保证。

Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models Figure 1
2026-08-04cs.CV

Location-Aware Fine-Grained Representation Learning for Medical Vision Foundation Models

Myeongkyun Kang, Yanting Yang, Xiaoxiao Li

2026-08-04视觉感知

医学图像诊断依赖细微且局部的证据,但现有医学视觉编码器往往只能兼顾语义或空间一致性之一。本文提出 LoFi,用文本到框的 grounding 与框到文本的 grounded captioning 训练视觉编码器,并构建含 448 万图文框三元组的 MedG 数据集。实验显示其在短语定位、VQA 和扰动下区域器官分类中优于多类通用/医学基础模型和 SOTA LVLM,但增益可能部分来自大规模数据。

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection Figure 1
2026-08-04cs.CV

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

2026-08-04视觉语言视觉感知安全鲁棒

这篇论文针对工业多路视频安全监控中 CoT-VLM 延迟高、输出不稳定且难审计的问题,将视觉语言推理压缩为有限法规空间中的单步规则 ID 预测,并用 SymPO 强化相近违规类别边界、以熵触发人工复核。四个月矿井部署显示其推理速度提升 19.45 倍,确认违规发现量为人工巡检的 2.78 倍。

Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction Figure 1
2026-08-04cs.CV

Swimm3R: Splatting with Medium-aware SfM for Underwater 3D Reconstruction

Minseong Kweon, Junaed Sattar

The authors are with the Department of Computer Science & Engineering, and the Minnesota Robotics Institute (MnRI), University of

2026-08-04三维

水下三维重建常因散射、衰减导致SfM位姿和稀疏点不可靠,影响机器人定位与建图。Swimm3R将空中图像几何先验蒸馏到水下域,并用物理头估计介质参数、位姿和恢复点云,再以Beta Splatting和散射感知梯度优化几何与外观。在Barbados数据集上,其相较WaterSplatting提升PSNR 1.47 dB,并提高下游定位RRA@15、RTA@15约2.0和2.4个百分点。

GraRe: Grasp Candidate Re-Ranking for Frozen 6-DoF Grasp Detectors Figure 1
2026-08-04cs.RO

GraRe: Grasp Candidate Re-Ranking for Frozen 6-DoF Grasp Detectors

Jibao Yuan, Yuhui Zhao, Yinzhen Lv, Chao Xu, Shun Li, Chenxi Deng, Shaofei Chen

2026-08-04视觉感知

这篇论文抓住了6-DoF抓取检测中的一个实际瓶颈:检测器往往已生成可成功抓取的候选,但置信度排序把它们排得太低。GraRe在不改动冻结检测器和候选位姿的前提下,利用候选属性、分层局部几何和物体上下文估计抓取质量,再与原置信度融合重排。实验显示其在GraspNet-1Billion上对三种检测器均有提升,Average AP最高增加13.60点,并在真实杂乱场景中提高抓取表现。

Stipple: Real-Time Incremental Gaussian Splatting with Visual-Inertial Tracking Figure 1
2026-08-04cs.RO

Stipple: Real-Time Incremental Gaussian Splatting with Visual-Inertial Tracking

Kilian Northoff, Mateo de Mayo, Daniel Cremers

2026-08-04视觉感知三维

这篇论文针对3DGS虽能高效渲染但依赖离线SfM和重训练、难用于机器人/XR实时重建的问题,将Basalt视觉惯性跟踪与Brush上的增量Gaussian Splatting结合,用双目、IMU、关键帧剔除、深度初始化和位姿图同步等VIO信息替代部分重预处理。在EuRoC和MSD实验中,Stipple通常以更高跟踪FPS获得可比或更好的重建质量,但Machine Hall场景质量落后且评测使用训练关键帧,公平性仍受限。

No Figure
2026-08-04cs.CV

Look Up and Look Back: Hidden Attention and Latent Orientation in a Frozen Foundation Model for Panoramic SLAM

Zhuang Xiong, Guohao Zhang, Chen Zhang, Zheyu Jiang, Yuchao Mei, Qingshan Xu, Wenbing Tao

National Key Laboratory of Science and Technology on Multi-spectral Information Processing, Huazhong University of, School of Information Science and Technology, University of Science and Technology of China, Hefei, China, kens for center-preserving spherical canonicalization, with-

2026-08-04视觉感知

针对单目全景 SLAM 中相机倾斜、尺度漂移和误回环导致的长序列不稳定问题,HALO-SLAM 从冻结的 PanoVGGT 内部表示中解码重力方向,并用跨视角注意力作为回环候选的低成本兼容性筛选,再经密集几何验证生成 Sim(3) 约束。实验覆盖 5 个真实全景基准 125 条序列,报告 100% 成功率,并相对最佳 ERP 原生基线降低 ATE 30–88%。

PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos Figure 1
2026-08-04cs.CV

PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos

Dongheng Lin, Jianbo Jiao

2026-08-04视觉感知

这篇论文针对动画生产中“油漆桶”上色依赖离散调色板、但区域匹配在遮挡、形变和碎片区域上容易歧义的问题,提出无需训练、可插拔的 PeCA 推理框架。核心思路不是重训更强模型,而是在测试时利用目标条件的参考扩展、颜色空间软投票和相邻帧门控传播,把孤立区域匹配改为时空上下文支持的颜色分配。实验称在既有基准和新增长视频测试上,对任务训练模型与冻结基础骨干均有稳定提升,但具体增益规模需结合正文表格判断。

MBO Scheme for Local Chan--Vese Segmentation Figure 1
2026-08-04cs.CV

MBO Scheme for Local Chan--Vese Segmentation

Kevin Bui, Adina Ciomaga

2026-08-04视觉感知

这篇论文针对传统 Chan–Vese 在光照偏置、强度不均图像上易分割失准,以及局部模型用有限差分/水平集求解较慢的问题,将局部 Chan–Vese 能量改写为可由 MBO 阈值动力学处理的形式,并给出两相、多相和彩色图像实现。实验覆盖灰度、医学、显微和彩色图像,显示方法能在保持局部统计鲁棒性的同时获得可用分割结果,但相对速度和精度增益幅度文中未充分说明。

Similarity Weighted Aggregation with Global Differential Privacy for Federated Brain Lesion Segmentation Figure 1
2026-08-04cs.AI

Similarity Weighted Aggregation with Global Differential Privacy for Federated Brain Lesion Segmentation

Muhammad Irfan Khan, Eero Lehtonen, Joni Obradovic, Elina Kontio, Esa Alhoniemi, Suleiman A. Khan, Mojtaba Jafaritadi

2026-08-04视觉感知

针对多机构脑肿瘤 MRI 分割中数据不能集中、站点分布非 IID 且模型更新可能泄露隐私的问题,论文提出 DP-SimAgg:在服务器端先做 L2 裁剪,再按更新相似度加权聚合,并注入高斯噪声给出逐轮差分隐私保证。FeTS 2022 实验显示,严格隐私预算下仍有可用 Dice,较宽松预算下接近非私有基线,但隐私会带来明显精度权衡。

PhenoStitch: Training-Free Panoptic Crop Mapping from Satellite Image Time Series Figure 1
2026-08-04cs.CV

PhenoStitch: Training-Free Panoptic Crop Mapping from Satellite Image Time Series

Xuechen Li

2026-08-04视觉感知

针对农田全景制图依赖密集地块标注、难迁移到新区域和新季节的问题,PhenoStitch 将地块边界与作物识别解耦:用冻结 SAM 过分割,结合 NDVI 与 Sentinel-1 的谐波物候签名、Potts 图能量合并和少样本原型分类,无需梯度训练。在每类 20 个标注地块、约 1% 标签下,PASTIS-R 上取得 20.0 crop mIoU、76.2 SQ、6.2 PQ,并在 ZueriCrop 保持领先;消融显示雷达信息贡献最大。

MIDAL: Math Image Descriptions for Accessible Learning Figure 1
2026-08-04cs.CV

MIDAL: Math Image Descriptions for Accessible Learning

Rebeka Popek, Vaghawan Ojha, Young Hwan You

Department of AI, E.K. Solutions Pvt. Ltd.

2026-08-04视觉感知

针对开放数学教材中图表替代文本缺失、复杂公式图难以被视障学习者理解的问题,MIDAL构建了含2,020张数学图像、长描述、标题和上下文的数据集,覆盖小学到大学内容,并通过人工审核对齐无障碍描述规范。主要结果是发布了可用于训练视觉语言模型生成数学图像描述和辅助数学推理的资源,但文中未充分说明模型训练后的实际增益。

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking Figure 1
2026-08-04cs.CV

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

2026-08-04视觉语言视觉感知

针对单一匹配式跟踪器在长时序、相似干扰物和多模态场景中易漂移且缺乏纠错的问题,论文提出 ACTrack,将匹配跟踪器、SAM3 运动/感知模块和 VLM 重提示模块作为可调用工具,由冲突触发机制协调使用。实验称其在 LaSOT、GOT-10K、TrackingNet 等 RGB 基准及 LasHeR、VisEvent、TNL2K、DepthTrack 等多模态基准上超过既有方法,并以约 30% 可训练参数实现统一适配。

Deep Learning CNN and Recurrence Analysis for Alpha Gamma EEG Biomarkers in Fragile X Syndrome Figure 1
2026-08-04cs.LG

Deep Learning CNN and Recurrence Analysis for Alpha Gamma EEG Biomarkers in Fragile X Syndrome

Zag ElSayed, Payton Siekierski, Jack Yanchen Liu, Ernest Pedapati

2026-08-04视觉感知

本文针对脆性X综合征中alpha/gamma脑电异常难以转化为稳定生物标志物的问题,将带通分解后的EEG表示为时序特征、时频图和递归图,并用CNN、LSTM及混合模型联合建模空间频谱、时间调制和非线性复现结构。文中称主体独立评估下混合模型优于单模态基线,gamma特征判别力较强,alpha-gamma融合最好;但具体数据规模、指标和增益来源文中未充分说明。

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design Figure 1
2026-08-04cs.CV

AIMold: An Autonomous AI-based Pipeline for Complex Mold Design

Pengyun Qiu, Shuo Wang, Zeyuan Chen, Yihao Zhi, Chongjie Ye, Xiaoguang Han

2026-08-04视觉感知

AIMold针对复杂注塑件中倒扣、侧孔等结构使两板模难以自动设计的问题,构建了含专业模具装配标注的 MoldCAD 数据集,并将脱模方向、辅助件与上下模生成串成条件生成流程。实验显示其可生成较完整的制造友好模具装配,但水密性、分辨率效率和数据规模仍受限。

CADENA: Stepwise CAD Reverse Engineering Figure 1
2026-08-04cs.CV

CADENA: Stepwise CAD Reverse Engineering

Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov, Antonio Rodriguez, Daniil Ignatiev, Nikita Gavrilov, Rustam Uzdenov, Alexey I. Boyko, Igor Pasechnik, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov

Lomonosov Moscow State University, Innopolis University, FusionBrain Lab

2026-08-04视觉感知

这篇论文针对网格或无历史模型难以编辑的问题,认为CAD逆向不应一次性生成完整程序,而应像工程师一样逐步建模并检查残差几何。CADENA每步执行并渲染当前CAD操作,用几何反馈和在线强化学习修正后续决策,同时提出含3396个真实机械零件的CADENA-Bench和GMS指标。结果显示其在DeepCAD、Fusion360、MCB等五个数据集上总体优于既有方法,但在齿轮/轴承等类别仍弱于CADFit,增益也可能部分来自数据与训练设置。

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality Figure 1
2026-08-04cs.RO

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality

Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

§ Intelligent Space Robotics Lab, Skolkovo Institute of Science and Technology, Moscow, Russian Federation, ‡ R&D Center, MWS, Moscow, Russian Federation

2026-08-04机器人视觉语言

机器人直接在实体上编程成本高且有安全风险,语言指令又可能产生错误定位或不可达动作。ORCESTRA的核心是把混合现实数字孪生作为中间验证层,统一无代码路点示教与VLM语言控制,并在同一后端完成度量 grounding、具身校验、可编辑预览和确认后执行。文中展示系统可在Quest 3上支持UR3、KUKA、AgileX和Unitree G1等异构机器人,但缺少系统实验和用户研究,实际效率与安全增益仍文中未充分说明。

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport Figure 1
2026-08-04cs.CV

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

Zhiqiang Lao

2026-08-04视觉感知

这篇论文针对一帧一帧套用 ChordEdit 时出现的时间闪烁和编辑强度漂移问题,把低能量传输平滑从采样时间扩展到视频时间:共享噪声、用运动对齐聚合相邻帧编辑场,并可平滑近端校正。在 TGVE/DAVIS 上,文中报告翘曲误差降 78%、闪烁降 49%,CLIP 帧一致性提升 9–10 点,同时保持 2 NFE/帧。

Hi-TOPS: Hierarchical Topology-aware Scoring Prior for 3D Part Decomposition Figure 1
2026-08-04cs.GR

Hi-TOPS: Hierarchical Topology-aware Scoring Prior for 3D Part Decomposition

Ruoyu Wu, Zhenhong Sun, Xiaoming Gong, Yuxin Xian, Zhi Wang, Yawen Chen, Huadong Mo, Daoyi Dong

University of New South Wales, Australian National University, Nanjing University, Southwestern University of Finance and Economics, University of Technology Sydney, University of New South Wales Canberra Australia, Australian National University Canberra Australia, Nanjing University Nanjing China, Southwestern University of Finance and Economics Chengdu China, University of Technology Sydney Sydney Australia

2026-08-04三维

该文针对3D部件分解中全局方法跨关节泄漏、局部几何方法易受噪声影响的尺度错配问题,提出多分辨率中尺度Flow-Freeze拓扑感知评分先验,用曲率、法向和密度线索约束SQ基元增长并回映射到网格。实验显示其能更稳定地分离关节和细薄结构,保留可编辑基元与残余细节,但定量增益来源仍需结合完整实验表进一步判断。

NISF++: Geometrically-grounded implicit representations of 3D+time cardiac function from 2D short- and long-axis MR views Figure 1
2026-08-04cs.CV

NISF++: Geometrically-grounded implicit representations of 3D+time cardiac function from 2D short- and long-axis MR views

Nil Stolt-Ansó, Maik Dannecker, Steven Jia, Julian McGinnis, Daniel Rueckert

2026-08-04三维

该文针对心脏 MRI 短轴、长轴二维切片难以被常规网格网络整合为一致 3D+time 表示的问题,提出 NISF++,用神经隐式函数融合任意方向视图,并将成像平面的刚体位姿设为可学习以校正呼吸/患者运动,同时加入 CMR 物理约束支持超分辨率强度与分割查询。在 UK Biobank 120 例实验中,其平面内分割接近现有方法,切片对齐有定量和定性改善,并展示了缺失视图下的泛化潜力。

LUT: Latent Utility Training for Visual Reasoning Figure 1
2026-08-04cs.CV

LUT: Latent Utility Training for Visual Reasoning

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

2026-08-04视觉感知

这篇论文针对视觉推理中潜在思维依赖框、草图或交错推理标注、且缺少“是否有助于答案”评估的问题,提出 LUT:只用标准 VQA 三元组,在轨迹层用信息增益筛选并课程蒸馏有用潜在轨迹,在步骤层用答案到潜变量的归因加权强化学习。实验显示其在感知密集视觉推理基准上优于既有潜在推理方法,并以更低标注成本接近交错文本-潜变量方法。

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations Figure 1
2026-08-04cs.CV

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

organization=Department of Computer Science, Durham University

2026-08-04视觉感知强化学习数据集/基准

艺术图像修复常面对裂纹、污渍和半透明遮挡等未知退化,现有基准多假设退化算子已知,难以衡量模型对残留语义信息的利用。本文构建 MDTD-Art 纹理透明遮罩数据集与 MDTD-ArtIR 基准,用不同不透明度模拟损伤,并比较通用修复、图像编辑和视觉语言模型。结果显示,图像编辑模型在任意纹理退化下普遍优于专用修复架构,结构化提示进一步提升细节保持和结构一致性,但真实物理损伤外推仍需谨慎。

Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling Figure 1
2026-08-04cs.LG

Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling

Zixuan Zhu, Rui Wang, Lihua Jing, Jinwen Zhong

Institute of Information Engineering, Chinese Academy of Sciences, School of Cyber Security, University of Chinese Academy of Sciences

2026-08-04视觉感知

针对第三方训练数据可能植入后门、且训练后难以清除的问题,论文观察到后门知识在早期更易被简单路径吸收,并提出 TR:训练时加入轻量“诱饵”捷径分支捕获后门,再用基于熵的知识解耦引导主干学习良性特征,训练后删除捷径即可净化模型。实验覆盖4个数据集、5种架构和多类攻击,显示能降低后门成功率并保持正常精度,但对更复杂优化型攻击的适用性仍需进一步验证。

Foveated Probes Recover Localized Binding Information in Vision Foundation Models Figure 1
2026-08-04cs.CV

Foveated Probes Recover Localized Binding Information in Vision Foundation Models

Mateusz Michalkiewicz, Mahsa Baktashmotlagh, Guha Balakrishnan

2026-08-04视觉感知

这篇论文针对视觉基础模型探针常用全局图像向量导致的误判:空间绑定失败未必表示特征缺失,可能是读出时被池化抹掉。作者冻结编码器,只比较全局、foveated attention pooling 与 oracle 读出,并用 NSR 解释干扰。在合成绑定中 foveated 达 93.5%、接近 oracle 99.3%,而全局近随机;GQA 局部颜色任务也由约 4% 提升到 17%。

Generated Images Are Easier to Forget: A Machine Unlearning Perspective for Synthetic Image Detection Figure 1
2026-08-04cs.CV

Generated Images Are Easier to Forget: A Machine Unlearning Perspective for Synthetic Image Detection

Jun Nie, Yonggang Zhang, Tongliang Liu, Yiu-ming Cheung, Bo Han, Xinmei Tian

University of Science and Technology of China, Hong Kong Baptist University, The Hong Kong University of Science and Technology, The University of Sydney

2026-08-04视觉感知

本文针对现有合成图像检测依赖标注数据、遇到新生成模型和真实域偏移时泛化不足的问题,观察到预训练大视觉模型在正常状态下难以区分真假图像,但在机器遗忘过程中生成图像特征退化更快。基于这一洞察,作者提出无数据剪枝式遗忘和有数据遗忘两类检测方法,在多类基准及 Sora 等不可访问生成模型图像上优于常规检测器。

Coverage-Driven Adaptive Keyframe Selection for Video Understanding Figure 1
2026-08-04cs.CV

Coverage-Driven Adaptive Keyframe Selection for Video Understanding

Junyang Zhang, Puhan Luo, Chen Tang, Yuxi Shi, Xiang-Yang Li

2026-08-04视觉感知

这篇论文针对长视频理解中关键帧筛选本身也会成为计算瓶颈的问题,提出无需训练的 CSES:先用相关性峰值显著性判断证据是局部集中还是全局分散,再以语义相关性、时间冗余和视觉冗余构造覆盖式子模选择,并用覆盖饱和自适应停止打分和选帧。实验显示,在四个 LVLM、两个基准上保持相近准确率,同时较基线少打分约 4.1–13.0 倍,输入关键帧减少 18.4%–20.5%,选帧速度提升 3.1–5.4 倍。

AeroLLE: Constrained Pseudo-Supervision for Nighttime Aerial Image Enhancement with the AeroNight-1.5K Benchmark Figure 1
2026-08-04cs.CV

AeroLLE: Constrained Pseudo-Supervision for Nighttime Aerial Image Enhancement with the AeroNight-1.5K Benchmark

Wei Lu, Hongyuan Liu, Si-Bao Chen

2026-08-04视觉感知数据集/基准

面向夜间无人机图像中曝光不均、混合光照和缺少真实配准白天参考的问题,论文提出 AeroNight-1.5K 伪配对基准,并用 AeroLLE 将 HVI 可见性恢复与冻结基底上的低分辨率有界增益/偏置校准分开,以限制生成参考带来的内容偏移。结果在300对保留伪配对集上取得最高 PSNR 和第二高 SSIM,但物理真实恢复能力仍文中未充分说明。

FreqAnchorAD: Language-Free Zero-Shot Anomaly Detection via Frequency-Deviation Anchoring Figure 1
2026-08-04cs.CV

FreqAnchorAD: Language-Free Zero-Shot Anomaly Detection via Frequency-Deviation Anchoring

Jianfeng Qiu, Peiyuan Li, Juan Xie, Xueliang Ma, Sihang Zhou, Yanning Hou, Ke Xu

2026-08-04视觉感知

本文针对零样本异常检测中过度依赖空间特征、难以捕捉细微纹理和边界缺陷的问题,指出异常偏差并非总由高频主导,低中高频均可能提供关键证据。方法以 LFCM 注入局部频率线索,并用 FDAP 在源域构建的通道坐标中进行正常/异常锚点相对判别,AAS 稳定锚点空间。在 13 个工业与医疗基准上,图像级识别和像素级定位平均性能达到 SOTA。

E2Pano: Learning Event-to-Panorama Image Reconstruction Figure 1
2026-08-04cs.CV

E2Pano: Learning Event-to-Panorama Image Reconstruction

Zhenyang Li, Zongqi He, Jia Pan, Shijie Lin, Yifan Peng

The University of Hong Kong

2026-08-04视觉感知三维

E2Pano针对事件相机快速旋转扫描中传统优化代价高、平面学习模型缺少球面几何约束的问题,提出从事件到全景图的几何引导流水线:保留球面坐标,经轻量增强与频域监督,再用带3D位置编码的球面Transformer重建亮度全景。实验显示其在合成与实采旋转数据上重建更清晰、光度重建成本低于优化基线,但方法仍依赖ES-ICP对齐,且主要限于近纯旋转和灰度重建。

Proteus: A Truncation-Robust Entropy Model for Progressive LiDAR Compression Figure 1
2026-08-04cs.CV

Proteus: A Truncation-Robust Entropy Model for Progressive LiDAR Compression

Yihan Qiu, Xiaodong Lin, Baoquan Zhao, Hailong Jiao, Ge Li

Peking University, Sun Yat-sen University

2026-08-04安全鲁棒

面向车联网、无人机集群等动态无线场景,论文关注 LiDAR 点云压缩在带宽骤降时易截断失效、且鲁棒生成式重建会削弱物理边界可验证性的问题。Proteus 将距离图按重要/次要位平面拆成 SIG 与 INS:前者保证可独立解码的基础几何,后者让截断退化为确定的空间精度损失,并优先保几何再补属性。实验称其在 Waymo 和 SemanticKITTI 上可承受约 70% 码流截断,理想信道下也优于 G-PCC、Draco、JPEG XL 和 Unicorn。

BRIC-Net: Boundary-Reliable Illumination-Color Interaction for Remote Sensing Image Deshadowing Figure 1
2026-08-04cs.CV

BRIC-Net: Boundary-Reliable Illumination-Color Interaction for Remote Sensing Image Deshadowing

Wei Lu, Yi Liu, Si-Bao

2026-08-04视觉感知学习理论

遥感图像去阴影难在半影边界不确定和RGB回归易引入色偏,影响后续解译。BRIC-Net将RGB外观与CIELAB亮度引导分流,用LRP构造可靠亮度先验,浅层BAGM处理边界混合,深层SCMM协调空间与通道响应。在AeroDS-Syn和SRGTA上PSNR达29.46/27.96 dB,并在真实集取得最低PIQE;但仍依赖外部阴影掩码。

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation Figure 1
2026-08-04cs.CV

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

2026-08-04安全鲁棒

本文关注单目深度估计在相机轻微滚转下明显失稳的问题,将其归因于训练图像普遍接近水平所形成的长尾“水平先验”。核心做法是在训练期加入 ID-Constraint,用几何与空间推理等旋转不变辅助监督约束深度骨干,推理时不增加开销。作者在 5 个数据集、4 类滚转设置上验证,显示 ViT 与扩散式深度模型都会随滚转退化,而该方法在非水平尾部样本上更稳。

CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds Figure 1
2026-08-04cs.CV

CopyCat: Improving Fine-Grained Subject Consistency in Subject-to-Image Models within Seconds

Peng Zheng, Ruiqi Liu, Rui Ma, Zuxuan Wu

2026-08-04视觉感知

本文针对主体到图像生成中常见的细粒度身份细节丢失问题,指出合成训练对往往只提供粗粒度监督。CopyCat的核心是在预训练模型上加入轻量FCLoRA,用单张代理图同时作为条件与重建目标做一次精确自重建,并发现双流DiT中只适配视觉流更有利。实验在DreamBench和XVerseBench上显示,单主体和多主体场景的主体一致性均有稳定提升。

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation Figure 1
2026-08-04cs.CV

Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation

Chenggong Hu, Shaoyin Ma, Yi Wang, Li Sun, Mingli Song, Jie Song

School of Software Technology, Zhejiang University, College of Computer Science and Technology, Zhejiang University, Ningbo Global Innovation Center, Zhejiang University, School of Software Technology, Zhejiang University Ningbo China, College of Computer Science and Technology, Zhejiang University Hangzhou China, Ningbo Global Innovation Center, Zhejiang University Ningbo China

2026-08-04规划控制

该文针对情感说话人脸生成中隐式特征可逼真但强度不可控、显式几何可控却易损失纹理的问题,提出 GemTalk:用视觉引导音频情感投影提取唇形与表情特征,再生成身份相关 blendshape 几何先验,并通过 GEM 动态调节隐式特征幅值。实验显示其在照片真实感、表情动态与连续情感强度控制上优于对比方法。

PixelSR: Efficient Screen Content Super-Resolution via Pixel Classification Figure 1
2026-08-04cs.CV

PixelSR: Efficient Screen Content Super-Resolution via Pixel Classification

Zhiheng Li, Lei Chen, Jie Zhou, Jiwen Lu

The authors are with the Department of Automation, Tsinghua University, Beijing, 100084, China.

2026-08-04视觉感知

本文针对屏幕内容超分中自然图像方法难以利用文字、图形的锐利边缘与像素级重复性的问题,提出 PixelSR:训练时用软像素分箱聚合内容注意力,引入非局部信息;推理时将高分辨率像素分为唯一、重复和背景像素,用在线查表与最近邻减少网络计算。实验显示其在屏幕内容超分上达到领先 PSNR,同时缩短推理时间,但方法依赖屏幕内容的重复结构,泛化到自然图像受限。

WiFuse: An Attention Mechanism for Human Activity Recognition using Fused CSI Amplitude and Delay-Doppler Channel Features Figure 1
2026-08-04cs.CV

WiFuse: An Attention Mechanism for Human Activity Recognition using Fused CSI Amplitude and Delay-Doppler Channel Features

Alison M. Fernandes, Hermes I. Del Monego, Bruno S. Chang, Anelise Munaretto, Hélder M. Fontes, Rui L. Campos

2026-08-04视觉感知

论文针对 Wi-Fi CSI 人体活动识别中多径、硬件相位偏移、多人交互导致精度下降的问题,提出 WiFuse:融合去噪幅度流与相位校正后的 Delay-Doppler 运动表征,并用带注意力的 ResNet-TCN 和两阶段迁移学习建模时空依赖。结果在 XRF55 最高达 95.28%,Wi-MIR 达 98.20%;但相对强基线的增益较小,部分增益来源仍需更细致归因。

Where Does Generative Difficulty Reside? An Empirical Study of Target Representations Figure 1
2026-08-04cs.CV

Where Does Generative Difficulty Reside? An Empirical Study of Target Representations

Marcel Plocher, Bernhard Schölkopf, Andreas Geiger, Gege Gao

University of Tübingen, Tübingen, Germany, Max Planck Institute for Intelligent Systems, Tübingen, Germany, Tübingen AI Center, Tübingen, Germany, ELLIS Institute, Tübingen, Germany, interchangeable interfaces: once an encoder and decoder are available, a genera-

2026-08-04生成模型

本文针对生成模型常把目标表示视为可替换接口的问题,在统一的 masked autoregressive rectified-flow 框架下比较像素、SD-VAE、DINOv2 与 MAE 特征。核心洞察是生成难度不由压缩率、重建保真或语义聚类单独决定,而会在上下文建模、局部去噪和推理控制间重新分配。ImageNet 实验显示 DINOv2 收敛最快且无 CFG 即达较低 FID,MAE虽重建更好但生成明显更差,像素则需专门的预测、mask 与 guidance 配置。

Diagnosing Under-Development of Irreversible Processes in Video Generation Figure 1
2026-08-04cs.CV

Diagnosing Under-Development of Irreversible Processes in Video Generation

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

2026-08-04视觉感知

这篇论文关注视频生成是否能表现融化、锈蚀、燃烧等不可逆过程,指出直接统计“反转”会被噪声和停滞误导,因而提出以属性进展和停滞率为核心的诊断协议。结果显示,7个文本到视频模型相较真实视频几乎没有不可逆属性进展,92%至100%片段接近停滞;作者还发现后验读出引导容易被模型投机满足,并主张在解耦属性潜变量中结构性施加单调约束。

InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning Figure 1
2026-08-04cs.CV

InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning

Chaoyue Wu, Yunfei Zhang, Si Wu

2026-08-04视觉感知生成模型

论文针对语义布局到图像扩散中同类密集实例易被合并、边界和外观混淆的问题,提出用实例中心坐标作为可查询锚点:经傅里叶编码形成坐标 token,并用实例区域监督注意力,同时通过独立实例适配器和掩码引导融合保留预训练骨干的全局语义。Cityscapes 实验显示其能减少行人、车辆等拥挤场景的实例纠缠,提升图像真实感和语义一致性。

Representation Transfer of Foundation Models for Ultra-Widefield Retinal Imaging Figure 1
2026-08-04cs.CV

Representation Transfer of Foundation Models for Ultra-Widefield Retinal Imaging

Mingya Alexa Gong, Da Ma, Lovre Antonio Budimir, Ivana Matovinovic, Sven Loncaric, Myeong Jin Ju, Yukun Zhou, Siegfried K. Wagner, Pearse A. Keane, Marinko V. Sarunic

Institute of Ophthalmology, University College London, London, United Kingdom, Wake Forest University School of Medicine, Winston-Salem, NC, USA, Virginia Tech-Wake Forest University School of Biomedical Engineering and Sciences, Blacksburg, VA, USA, University of Zagreb Faculty of Electrical Engineering and Computing, Zagreb, Croatia., Department of Ophthalmology and Visual Sciences, University of British Columbia, Vancouver, BC, Canada, School of Biomedical Engineering, University of British Columbia, Vancouver, BC, Canada, NIHR Biomedical Research Centre, Moorfields Eye Hospital NHS Foundation Trust, London, United Kingdom, Department of Medical Physics and Biomedical Engineering, University College London, London, United Kingdom

2026-08-04视觉感知

针对超广角眼底图像高分辨率、弱标注且基础模型迁移机制不清的问题,本文在固定的patch级MIL框架中比较监督、MAE与自蒸馏ViT表征,核心洞察是预训练目标会同时改变可迁移特征和MIL注意力聚合行为。结果显示监督与DINO类模型优于冻结MAE,DINOv3在五分类糖网分级上QWK达0.863;部分微调可缩小MAE差距,DINOv3增益可能主要来自scaling / data。

Element-Aware Group Learning for E-Commerce Image Generation Figure 1
2026-08-04cs.CV

Element-Aware Group Learning for E-Commerce Image Generation

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

2026-08-04视觉感知

论文针对电商图像生成中“提示词整体得分难以定位具体设计问题”的瓶颈,提出 EAGLE-GRPO:把结构化提示拆成构图、背景、卖点等元素,用 rollout 组内已有奖励差异通过闭式核岭回归分解元素级 credit,再映射回 token 训练,无需额外反事实采样或 critic。实验显示其在 GPT-Image-2 与 FLUX.2 上优于标准 GRPO 和提示词基线,人评盲测偏好率为 62%,但固定 18 类元素对不同品类的适配仍有限。

Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts Figure 1
2026-08-04cs.CV

Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Experts

Ziang Wu, Peng Jin, Qishen Yin, Munan Ning, Hao Li, Peizhen Zhang, Li Yuan

2026-08-04视觉语言视觉感知

这篇论文关注视觉语言 MoE 在图像分辨率、图像数量和提示长度变化时的专家负载失衡问题,指出标准 Switch 辅助损失只平衡混合 token,图文负载误差会在某一比例下相互抵消。作者推导固定图文负载曲线,并提出 ReBA:按模态分开平衡、按每张图像等权聚合。实验显示其在四个 split backbone 上降低各基准输入负载,并在分辨率和 tiling 变化下改善平均与最坏负载,任务精度基本持平。

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation Figure 1
2026-08-04cs.CV

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation

Jinhua Zhang, Yisong Lin, Wei Long, Shuhang Gu

2026-08-04视觉感知

这篇论文针对离散自回归图像生成中“交叉熵训练目标”和“生成图像分布评估”不一致、以及 teacher forcing 与推理上下文不一致的问题,提出用 Fréchet 距离做后训练:先无梯度生成自身 rollout 上下文,再用概率级 STE 在保持硬解码的同时传递图像级梯度。实验在四类生成器、八个 ImageNet 256 配置上平均降低 FID 41.4%、FDr6 52.0%,且不增加参数或推理步数,但 STE 偏差和单次消融限制仍需注意。

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations Figure 1
2026-08-04cs.AI

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

Shalom Kachko, Raz Lapid, Margarita Vald, Almog Dubin, Moshe Sipper

2026-08-04视觉语言视觉感知

本文针对 VLM 中图像 patch 与文本 token 在共享残差流里如何融合仍不清楚的问题,提出 LENS,用 MFA 将激活分解为局部低秩高斯邻域,并为这些邻域自动生成跨模态语义标签。实验显示,LLaVA 更偏后期渐进融合,Qwen3-VL 则早期融合、部分再分离后输出前重组;基于 MFA 质心的干预多数情况下优于 DiffMeans 和 VL-SAE,并提升 Qwen3-VL 跨模态检索 R@1。

Test-Time Curriculum for Open-Set AIGC Detection Figure 1
2026-08-04cs.CV

Test-Time Curriculum for Open-Set AIGC Detection

Yiqian Zhang, Zheyuan Gu, Xiangzhao Hao, Zefeng Zhang, Jingjia Mao, Jiahao Hu, Jiaxu Miao, Jun Yu, Zhenyu Zhang, Shuohuan Wang, Yu Sun

Work done during an internship at Baidu Inc.Corresponding author.

2026-08-04视觉感知

面对新生成模型不断出现导致的开放集分布偏移,论文把 AIGC 图像检测从一次训练部署转为测试时自适应问题。核心做法 TTC 用无标签测试数据做课程式自训练,先选类别均衡的高置信伪标签样本,再逐步加入更难样本,并用多尺度一致性改进伪标签。五个基准及新建 AIGCGuard 上显示平均检测精度明显提升,但效果依赖测试集批量适应设定。

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation Figure 1
2026-08-04cs.RO

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

Xiaoyang Chen, Shengcheng Luo, Haoran Guo, Jiaming Jiang, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

2026-08-04视觉感知

DexMani针对灵巧旋转中反复接触切换会影响后续可旋转性的难点,提出用人类视觉触觉示范学习“接触条件下的旋转可操作性演化”能量先验,而非直接迁移关节轨迹,并将其作为强化学习的残差引导。该表示较少绑定具体手型,在Shadow、Allegro、XHand及LEAP等多种手和任务上取得最高成功率,LEAP平均成功率57.5%,并带来更平滑的旋转;但每个任务-手型仍需单独训练策略。

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable Figure 1
2026-08-04cs.CV

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

Beijing University of Posts and Telecommunications, Tsinghua University, Beijing Institute of Technology

2026-08-04视觉感知生成模型数据集/基准

论文针对生成图像虽美观但栅格化后难以编辑的问题,提出“图像到可编辑重建”任务,并给出 DrawAI-Bench 与 DrawAI-Flow:前者用 39 项规则和 VLM 评测同时衡量保真度与可编辑性,后者通过解析规划和代码渲染迭代生成 SVG/PPTX。实验比较 13 个模型和 5 种 agent harness,显示性能与成本强依赖模型-框架-流程组合,结构化流程能稳定提升可编辑结构,但直接提示尚不足以可靠完成该任务。

Zero-Cost Virtual RNA: Approximating Immunotherapy Signatures via Cross-Modal WSI Retrieval Figure 1
2026-08-04cs.CV

Zero-Cost Virtual RNA: Approximating Immunotherapy Signatures via Cross-Modal WSI Retrieval

Sigrid Vila-Bagaria, Mar Teixidó, Miquel Piñol, Felip Vilardell, Robert Montal, Veronica Vilaplana

2026-08-04视觉感知

针对胃腺癌免疫治疗中“炎症型”表型需昂贵10基因RNA检测、而WSI二分类会丢失连续分子谱的问题,论文提出VITA:训练时对齐H&E全切片与RNA到共享空间,推理时仅用H&E检索相似病例并估计连续RNA签名。在TCGA 265例上,VITA分类准确率0.72、F1为0.72,接近CLAM,并取得0.66 Spearman相关;但仅单队列验证,增益幅度有限。

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor Figure 1
2026-08-04cs.CR

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

Tsinghua University 2 Shandong University 3 Wuhan University, Shandong Key Laboratory of Artificial Intelligence Security, Shandong University, State Key Laboratory of Cryptography and Digital Economy Security, Tsinghua University, Zhongguancun Laboratory, Beijing, China 7 Shandong Institute of Blockchain, Shandong, China, National Financial Cryptography Research Center, Beijing, China

2026-08-04生成模型安全鲁棒

针对扩散模型语义水印依赖 VAE 编码器检测而形成的后门攻击面,论文提出 GhostVAE:先学习鲁棒通用触发器,再以参数对齐目标微调后门编码器,使干净图仍可正常验水印、触发图则逃避检测。在三类语义水印和三种 LDM 上,平均干净真阳性率 94.4%、攻击成功率 94.6%,且 17 种输入、参数和潜空间防御均难以可靠识别或移除该后门。

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning Figure 1
2026-08-04cs.CV

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

2026-08-04视觉感知

这篇论文针对工具增强视觉语言智能体“答对但解释不忠实”的风险,提出 DiffuseAgent-MI:用 KL 最小能量模型把扩散采样锚定到可解释特征单元,并结合自演化奖励、轨迹验证与修复循环,使推理过程同时优化准确率和机制忠实性。实验称其在 GeoQA、SciVis、VQA-v2 与内部集上最高提升 5.1 个百分点,MI-Faith 与人工可解释性一致性也显著提高。

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching Figure 1
2026-08-04cs.CV

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

Hongjie Wu, Yiping Xie, Jiancheng Lv

College of Computer Science, Sichuan University, Sichuan University Chengdu China

2026-08-04生成模型

该文针对潜流模型求解图像逆问题时高频细节恢复差的问题,指出压缩解码器的低秩雅可比会造成“一阶流形盲区”,使像素测量残差难以通过潜变量梯度传回。作者提出 HDPS,将像素空间的 Langevin 数据一致性更新与潜空间流匹配先验解耦,并用优化式潜变量对齐替代直接编码以减少语义漂移。实验覆盖五类逆问题,显示其优于潜空间方法和解耦基线,主要增益来自对高频结构残差的显式吸收。

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards Figure 1
2026-08-04cs.CV

DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards

Yunhao Wang, Binghong Wu, Zhenyu Huang, Jiacheng Shi, Shuo Huang, Tinghao Yu, Feng Zhang

2026-08-04强化学习优化算法

本文针对文档解析中强化学习奖励在高精度阶段区分度不足的问题:接近正确的文本、表格和公式输出常获得相近分数,难以继续优化。核心做法是提出 Step-Aware Annealing,随训练进程逐步提高参考奖励曲率,并结合文本 NED、表格 TEDS、公式 Rubric+edit 的元素化奖励。OmniDocBench 和 DocElemHard 实验显示,该机制相较未退火奖励能稳定提升 GRPO 式训练,且无需额外训练奖励模型。

Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations Figure 1
2026-08-04cs.CV

Unleashing the Power of Text: Text-Guided Flow Matching for Image Fusion under Complex Degradations

Axi Niu (1), Jieheng Li (1), Kang Zhang (2), Qingsen Yan (1), Jinqiu Sun (3), Yanning Zhang (1) ((1) School of Computer Science, Northwestern Polytechnical University, Xi'an, China, (2) School of Electrical Engineering, KAIST, Daejeon, Republic of Korea, (3) School of Aeronautics and Astronautics, China)

2026-08-04视觉感知生成模型

面向真实场景中红外-可见光图像常受单一或复合退化影响、可靠模态线索不足的问题,TGFusion将去退化与融合统一为文本引导的潜空间流匹配过程,并让文本作为独立语义流与红外、可见光和融合流进行逐层联合注意力交互,而非固定条件注入。实验显示其在复杂退化下提升感知质量、结构细节和红外显著性,并改善下游语义分割表现。

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding Figure 1
2026-08-04cs.CV

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding

Yiwen Wang, Yuyang Deng, Yihao Long, Xi Zhao

Xi’an Jiaotong University

2026-08-04视觉语言三维

本文针对3D视觉定位中闭集分类难以泛化、简单多视角聚合会削弱视角证据的问题,提出GuideGround:用VLM生成对象语义描述并解析目标/锚点,同时保留各候选视角的独立定位假设,再由VLM做视角级验证。实验在ReferIt3D上超过既有SOTA,消融显示语义增强和视角验证均有贡献。

Test-time Adaptation of Pelvic Bone Segmentation Models via Dynamic Reliability-Guided Figure 1
2026-08-04cs.CV

Test-time Adaptation of Pelvic Bone Segmentation Models via Dynamic Reliability-Guided

Ling Ren, Chao Deng, Ziming Wang, Yuecong Xu, Kai Zheng

2026-08-04视觉感知

面向机器人辅助骨盆创伤手术中的跨医院部署问题,论文指出源域训练的CT骨盆分割模型在新中心会因域偏移出现边界退化、解剖结构不一致和类别不平衡。作者提出ReGA测试时自适应框架,用SICE评估伪标签可靠性,并结合可信特征细化、区域级对比学习和师生训练在线更新模型。三套异构3D骨盆CT实验显示其优于多种TTA基线,但临床实时性与复杂结构边界策略仍有待进一步说明。

RadYOLO: Computationally Efficient 3D Object Detection and Segmentation in CT and MRI Figure 1
2026-08-04cs.CV

RadYOLO: Computationally Efficient 3D Object Detection and Segmentation in CT and MRI

Kai Geissler, Laurens Müller-Groh, Hans Meine

2026-08-04视觉感知三维

针对3D CT/MRI检测与分割模型计算开销高、难以在临床或边缘硬件部署的问题,RadYOLO将YOLO11扩展到三维医学影像,并加入适合小目标的框参数化、TAL小目标回退和原型式实例分割头。在5个CT/MRI数据集上,它检测性能优于或持平nnDetection,病灶检测优于nnU-Net,GPU推理快8–46倍,CPU也可在数秒内完成;但大器官精确定位和全分辨率分割仍更偏向nnU-Net。

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance Figure 1
2026-08-04cs.CV

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang

Zhejiang University, Vivo Mobile Communication Co., Ltd

2026-08-04视觉语言

这篇论文针对机器人可供性定位中“小模型会给出坐标却未真正看向可交互部位”的问题,指出现有 SFT/RL 主要约束输出框,容易依赖物体级捷径。SpatialAfford 先用 SAA 将跨模态注意力对齐到真实可供性区域,再用 Spatial-Aware GRPO 优化坐标预测,把“看哪里”和“落在哪里”拆开训练。实验称其在 ShareRobot-Bench、ReasonAff、PartAfford 上稳定提升,4B 模型可超过若干 7B+ 基线。

Optical Flow from Photons Figure 1
2026-08-04cs.CV

Optical Flow from Photons

Wendi Liu, Weichao Zeng, Weihang Ran, Yujie Lu, Yinqiang Zheng

2026-08-04生成模型

本文针对高速、低照场景中传统相机易模糊欠曝、SPAD单帧光子又过于稀疏的问题,提出QuantaFlow:把SPAD表示构建嵌入光流迭代更新,用当前光流对齐光子切片,再做光子通量变换与自适应多尺度融合,以同时抑制噪声和运动模糊。作者构建合成数据集,并在合成与真实SPAD数据上显示其比帧、事件和脉冲相机方法能恢复更完整运动和更清晰边界。

Image-Space Rule Discovery Figure 1
2026-08-04cs.CV

Image-Space Rule Discovery

Misora Sugiyama, Toya Oyama, Hirokatsu Kataoka

2026-08-04视觉感知

论文关注视觉模型是否能像做纸面题一样在图像中读指令、推规则并直接把答案写回原图,而不只是输出文本答案。核心创新是提出 WISRD 工作表式图像空间规则发现基准,强调目标定位、输出数量控制、无关内容保留和抑制多余编辑。结果显示 Nano Banana Pro 在共享子集 Auto-Strict 仅达 48.7%,明显高于 Qwen/FLUX 等,但仍在绑定、保真和抽象类推上脆弱,说明当前能力更多是部分利用图内指令而非完整规则发现。

Practical Noise Modeling for SPAD Intensity Imaging Figure 1
2026-08-04cs.CV

Practical Noise Modeling for SPAD Intensity Imaging

Wendi Liu, Yujie Lu, Zengxi Zhang, Haiyang Jiang, Weihang Ran, Yinqiang Zheng

2026-08-04视觉感知

这篇工作针对 SPAD 强度成像在低照度和 HDR 场景中受暗计数、串扰、响应不均等耦合噪声限制的问题,主张不再强行分解不可观测事件,而是用二项累积观测、曝光相关暗计数、曝光无关暗偏置和像素级响应图建立可标定模型,并据此合成训练噪声与做 SPAD-DSC 预校正。实验在真实 SPAD 数据集上显示该建模链路优于既有噪声合成/去噪方案,但温度、时间抖动等因素文中未充分覆盖。

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents Figure 1
2026-08-04cs.CV

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng

2026-08-04视觉感知生成模型

机器人操作需要在动作发生前预测物体的 6-DoF 轨迹,但现有方法常依赖视频、深度或 CAD,或先生成视频再解析像素,成本高且误差累积。DreamTraj 的核心洞察是视频扩散模型早期去噪 latent 中已含可解码的运动计划,因此用冻结骨干的注意力轨迹和隐藏状态直接读出轨迹,并配套 Move 细粒度指令数据集;实验称在平移和旋转预测上达到 SOTA,且比生成后提取快 4.6 倍。

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings Figure 1
2026-08-04cs.CV

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

Kaho Li, Pengyu Zeng, Yuqin Dai, Jun Yin, Tianjing Feng, Shuai Lu

Shenzhen International Graduate School, Tsinghua University, Shenzhen 518055, China, UCL Institute for Environmental Design and Engineering, The Bartlett School of Environment, Energy and Resources, University College London, London, UK

2026-08-04视觉语言

本文针对建筑图纸中平面、剖面与立面并非普通视角变化而是不同几何投影/切割的问题,提出 CrossProjection,用锚点化标注同时评测匹配、配准和自由几何定位。结果显示 GPT-5.5 分类准确率达 82.4%,高于 Qwen 与 GLM,但点/区域定位明显下降,线定位更差,说明闭选项或标记正确不等于可靠的候选无关空间 grounding。

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds Figure 1
2026-08-04cs.CV

Scene2Sound: Auditory-Grounded Soundscape Generation for 3D Gaussian Worlds

Masaki Yoshida, Ren Togo, Takahiro Ogawa, Miki Haseyama

Hokkaido University

2026-08-04强化学习三维

论文针对可自由漫游的3D Gaussian Splatting世界“只有视觉、缺少随视点一致变化的声音”的问题,提出训练-free的Scene2Sound:自动选取多视角,用VLM找出应发声物体,并以Gaussian set matching把跨视角检测合并为持久3D声源,再交由对象式音频引擎实时空间化。实验显示其在生成和真实360°场景上保持单视角基线的音频质量,同时显著改善听者移动一致性与跨视角 grounding,用户研究也支持感知收益。

Structured Proxy Features for Multimodal NSCLC Survival Prediction from Pretreatment CT Figure 1
2026-08-04cs.CV

Structured Proxy Features for Multimodal NSCLC Survival Prediction from Pretreatment CT

Huu Phong Nguyen, Delower Hossain, Ehsan Saghapour, Zhandos Sembay, Jake Y. Chen

Department of Biomedical Informatics and Data Science, School of Medicine, The University of Alabama at, Department of Computer Science, The University of Alabama at Birmingham (UAB), Birmingham, AL, United, System Pharmacology and AI Research Center (SPARC), The University of Alabama at Birmingham (UAB), requiring annotated survival labels [59]. This encourages the use of a Transformer-based Masked Autoencoder as, analyses characterizing the proxy-feature branch. Source code is publicly available on GitHub.

2026-08-04视觉语言

本文针对NSCLC术前CT生存预测中,传统影像组学和深度特征难以显式建模肿瘤异质性与形态相互作用的问题,提出用放射组学参数化的细胞自动机生成生长率、坏死比例等六个结构化代理特征,并与TMAE CT表征、影像组学和临床变量融合。在Lung1队列上四模态模型C-index达0.641、iAUC 0.731,略高于既有多模态基线;但验证仍局限于固定队列,外部泛化和真实增益来源仍需进一步确认。

Reconstruction-Shift Discrimination via Mask-Guided Latent Diffusion for Medical Anomaly Detection Figure 1
2026-08-04cs.CV

Reconstruction-Shift Discrimination via Mask-Guided Latent Diffusion for Medical Anomaly Detection

Yibo Wan, Jinyu Cai, Yunhe Zhang, Yi Bin, See-kiong Ng

2026-08-04视觉感知生成模型三维

针对重建残差在医学异常检测中容易混淆病灶、正常解剖差异和成像噪声的问题,论文提出 DMD:在量化潜空间用局部掩码制造重建偏移,并把原图与扩散重建图配对形成自监督判别信号;推理时分类器给出图像级异常分数,残差负责像素级定位。五个脑 MRI、乳腺超声和胸片数据集上整体优于对比方法,但跨病种与采集条件的泛化仍文中未充分说明。

Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection Figure 1
2026-08-04cs.CV

Beyond Static Anchors: Bounded Prototype Conditioning for Language-Free Medical Anomaly Detection

Yibo Wan, Jinyu Cai, Seekiong-Ng

2026-08-04视觉感知学习理论

针对跨器官、跨模态医学异常检测中固定文本提示或视觉锚点容易失准的问题,ReCAP将正常/异常原型改为随输入图像上下文有界调制的视觉原型,并在少样本场景加入正常样本记忆库以保留目标域差异。实验覆盖六个医学基准,在零样本全部图像级AUROC和三项分割AUROC上最佳,少样本23/24项最佳,且推理延迟较最快基线降低70%以上。

Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis Figure 1
2026-08-04cs.CV

Poplar: A Scalable Pipeline for Human-Centric Image Dataset Synthesis

Zhishan Zou

2026-08-04视觉感知数据集/基准

本文针对单张人像生成效果已较好、但难以规模化构建语义多样且一致的人本摄影数据集的问题,提出 Poplar 的 Specify–Render–Inspect 流水线:用常识约束采样结构化属性生成提示词,经扩散模型渲染,再由视觉语言模型按固定规则质检。最终构建 Poplar-9K,从 11765 个候选中保留 9401 个图文对,验收率 79.9%,并发布提示、配置和审核记录以支持可复现构建。

Boosting Generalizable Depth Estimation in Endoscopy by Mixture of Lightweight Experts and Intrinsic Image Alignment Figure 1
2026-08-04cs.CV

Boosting Generalizable Depth Estimation in Endoscopy by Mixture of Lightweight Experts and Intrinsic Image Alignment

Liangjing Shao, Beilei Cui, Yiming Huang, Changjing Liu, Hongliang Ren

2026-08-04视觉感知

这篇论文针对内窥镜深度估计中组织外观差异大、反光和照明变化导致跨场景泛化差的问题,提出自监督框架 EndoMINI:用 MiLoRE 将 MoE 与 LoRA 结合,在 ViT 编码器中按场景特征选择轻量专家,并通过内在图像分解引入去照明对齐损失。实验称其在 SCARED 有监督评测及 Hamlyn、SERV-CT 零样本深度估计上优于已有方法,同时提升自运动和相机内参预测。

Where did the ambiguity go? Examining how multimodal models interpret polysemous words Figure 1
2026-08-04cs.AI

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

Princeton University

2026-08-04视觉语言

本文关注生成模型在无上下文多义词上是否会保留人类式的语义不确定性,创新在于把100个多义词转化为跨文本、图像和人类基线可比较的词义分布。结果显示,图像生成比文本生成更强地塌缩到少数词义,二者又低于人类;模型能描述多义性,却在实际生成中表达不出来。

Decoding Children's Gait Behavior Figure 1
2026-08-04cs.CV

Decoding Children's Gait Behavior

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

2026-08-04视觉感知

论文针对儿童步态筛查中3D设备昂贵、侵入性强且现有成人步态模型难以识别发育期细微异常的问题,提出CGV多视角儿童步态视频数据集,并设计ChildGait-Video以结合骨架关键点提示和前景裁剪进行EVGS评分预测。实验显示通用VLM和步态基础模型表现不足,而该方法在34个评分项上达到约70%至93%的最高准确率。

Artificial Intelligence for the Characterization of Particles and Fibers by Optical Microscopy Figure 1
2026-08-04cs.CV

Artificial Intelligence for the Characterization of Particles and Fibers by Optical Microscopy

Simiao Sun, Kenneth Ng, Lynn Lee, Astrid Harth, Asami Odate, Aggelos Katsaggelos, Manuel Ballester Matito, Nicholas Eastaugh, Marc Walton

) Department of Chemistry, University of Hong Kong, Hong Kong SAR, ) Museum Studies Program, University of Hong Kong, Hong Kong SAR, ) Department of History, City University, Hong Kong, Hong Kong SAR, ) Department of Electrical and Computer Engineering, Northwestern University, USA, available. 4,5 Compared with other instrumental methods used in cultural heritage, such as, micron-to-submicron range.6 As written by McCrone in the Journal of the American Institute of, “pseudo” labels in deep learning, these imprecise or inconsistent metadata hinder the, development of reliable AI models.13,14 In cultural heritage, a clear example of such a weak label

2026-08-04视觉感知

针对文化遗产中粒子与纤维显微图像来源杂、标注弱、光照和倍率差异大导致检索困难的问题,本文用LongCLIP文本语义锚与图像特征构造可解释的多模态教师向量,再蒸馏到仅看图像的ViT学生模型。结果显示该方法约达80%伪类验证准确率和75%细粒度描述Recall@1,但具体增益相对更强基线的来源文中未充分说明。

The 1st AI Children Challenge Figure 1
2026-08-04cs.CV

The 1st AI Children Challenge

Boyi Li, Yifan Shen, Houze Yang, Xu Cao, Guojun Yun, Li Gao, Turong Chen, Long Xu, Jianguo Cao, Meihuan Huang

University of Illinois Urbana-Champaign, The Hong Kong Polytechnic University

2026-08-04视觉感知

本文针对儿童步态异常诊断仍依赖医生主观观察、成人步态模型难以处理儿童运动高变异性的问题,提出首届 AI Children Challenge,并发布 CGPS 儿童 2D 关键点步态序列数据集,设置 EVGS 评分和双侧痉挛型脑瘫步态分类两条任务。主要结果是建立了面向儿科视觉步态分析的评测与可复现竞赛框架;最终排名和模型增益文中未充分说明。

ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression Figure 1
2026-08-04cs.CV

ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

Renjie Liang, Zijian Xu, Jinqian Pan, Chengkun Sun, Zhengkang Fan, Shawn Li, You Qin, Mei Liu, Jie Xu

2026-08-04生成模型三维

3D CT 进入视觉语言模型时会产生上万视觉 token,常规网格平均易把器官、病灶和空气混在一起,削弱下游诊断线索。ORCA 的核心是无需训练地按空间连通、特征相似和器官引导聚合 token,并用区域质心位置编码补回布局信息。在 CT-RATE 和 Merlin、五种编码器上的属性预测、VQA 和报告生成中,它在相同预算下优于现有压缩方法,可实现 64 倍上下文压缩、约 50 倍 KV-cache 缩减和 31 倍处理加速。

Belief-Space Perception Routing under Coupled Sensor Faults and Compute Contention Figure 1
2026-08-04cs.RO

Belief-Space Perception Routing under Coupled Sensor Faults and Compute Contention

Sparsh Roy, Vihan Aggarwal, Davin Yin

2026-08-04视觉感知

针对机器人在恶劣天气下传感器退化、同时机载算力被规划控制争用而导致感知超时的问题,本文把传感器故障信念和算力拥塞信念用 HMM 估计,并以 noisy-OR 耦合来路由 YOLO 配置。结果显示在人为设定的耦合场景中,超时率较解耦策略降低 1.1–9.4 个百分点,但真实序列中未检出自然耦合,因而更像机制验证而非完整现场证明。

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation Figure 1
2026-08-04eess.IV

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

Xuan Cuong Ngo

2026-08-04视觉感知

本文针对放射报告生成中过度依赖语言先验、视觉证据与文本语义对齐不足的问题,提出 PALM:用病理原型作为图文共享语义锚点,避免把临床相近的未配对病例当作负样本,并通过 Masked Evidence Modeling 强化局部影像证据编码。实验在 MIMIC-CXR、IU X-Ray 和 MIMIC-ABN 上显示其提升报告生成质量与异常鲁棒性,但原型依赖 CheXpert 预定义标签,细粒度病灶覆盖仍受限。

Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers Figure 1
2026-08-04cs.CV

Interpretability-Guided Soft Pruning of Attention Heads in Vision Transformers

Kamil Książek, Piotr Suszyński, Michał Jan Włodarczyk, Jacek Tabor, Przemysław Biecek

Centre for Credible Artificial Intelligence, Warsaw University of Technology, Jagiellonian University, University of Warsaw

2026-08-04视觉感知

这篇论文针对 DINOv2 等视觉 Transformer 计算和内存开销大、注意力头功能不透明的问题,先把注意力图视为图并用拉普拉斯特征向量生成 Laplace maps,再按谱特征聚类注意力头以发现功能冗余,进而提出可微的 SAPER 软 Top-K 剪枝框架。实验显示其在 ImageNet-1K 上相比 RAPTOR 可进一步降低 FLOPs,同时保持较强分类精度,但具体增益在多大程度来自解释性先验与后续微调仍需结合完整消融判断。

Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind Figure 1
2026-08-04cs.CL

Cross-Task Dissociation in Frontier Vision-Language Model Theory of Mind

Kejia Zhang, Youran Sun, Chugang Yi, Haizhao Yang

University of Maryland, College Park

2026-08-04视觉语言视觉感知学习理论

本文关注前沿视觉语言模型的心智理论能力是否能跨任务保持一致,而非只看单一 ToM 分数。作者将视觉视角采择的 Keysar Director Task 与抽象运动意图归因的 Frith-Happé 三角形任务配对,用同一组九个 VLM 对照人类参考画像。结果显示模型在 Director Task 中常犯自我中心错误,推理提示可缓解部分模型;在三角形任务中又普遍低估意图,且没有模型同时最接近典型成人参考,揭示了明显的跨任务能力解离。

MDWD: A Street-Level Dataset for Municipal Solid Waste Detection in Dense Urban Environments Figure 1
2026-08-04cs.CV

MDWD: A Street-Level Dataset for Municipal Solid Waste Detection in Dense Urban Environments

Andrea Filiberto Lucas, Mark Bugeja, Carl James Debono, Dylan Seychell

2026-08-04视觉感知数据集/基准

面向密集城市中依赖人工巡查、缺少街景级实例标注基准的市政垃圾监测问题,论文提出 MDWD:含 3,697 张高分辨率街景图、11,461 个框标注,覆盖马耳他五类实际收运垃圾流,并用多代 YOLO 与 RF-DETR 建立基线。结果显示 RF-DETR-M 在测试集达到 94.49% mAP50 和 93.56% F1,小模型也保持较强精度,说明该数据集可支撑实时与 Transformer 检测器训练。

Semantically Calibrated Evidence Composition for CT Vision-Language Learning Figure 1
2026-08-04cs.CV

Semantically Calibrated Evidence Composition for CT Vision-Language Learning

Guoliang You, Haifan Gong, Xiaomeng Chu

2026-08-04视觉语言视觉感知

这篇论文针对CT视觉语言学习中全局报告对齐缺少可解释局部证据、器官级对齐又难以形成检查级语义的问题,提出SCOPE:用固定解剖身份的查询抽取器官证据,再由全局查询组合并用诊断总结校准,最后作为残差注入全体积表示。在CT-RATE和RadChestCT上macro AUC达85.0和72.2,较前SOTA提升7.2和4.2,并改善线性探测与跨模态检索。

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving Figure 1
2026-08-04cs.CV

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

Rochester Institute of Technology, 2 NVIDIA

2026-08-04视觉感知

本文针对端到端视觉语言自动驾驶中导航指令常被车道几何、交通流等视觉先验淹没的问题,将其解释为回归训练下的条件策略坍缩。作者把分类器自由引导引入轨迹回归,并提出单次前向的 Latent-Centroid Steering,用预计算的指令类潜在中心替代逐样本无条件分支来增强指令效应。实验称其在 Bench2Drive 成功率相对提升 8%,nuScenes 轨迹误差相对降低 5.6%,同时约减半 CFG 推理延迟。

Attention-Steered Vision-Language Models for Sign Language Translation Figure 1
2026-08-04cs.CV

Attention-Steered Vision-Language Models for Sign Language Translation

Meibo Hu, Guohao Sun, Annemarie D. Ross, Sheng Li, Zhiqiang Tao

Rochester Institute of Technology, 2 University of Virginia, National Technical Institute for the Deaf / Rochester Institute of Technology

2026-08-04视觉语言视觉感知

本文针对通用视觉语言模型做手语翻译时常看错区域和帧的问题,提出 AttnSign:在监督微调中用手部、脸部等前景先验约束空间注意力,并在 GRPO 阶段以运动峰值构造节奏目标替代通用 KL 约束,引导模型关注关键帧。实验在 How2Sign 和 OpenASL 上分别达到 BLEU-4 15.54 和 20.75,超过专用 SLT 方法与通用 VLM 基线。

Real-Time Visual Obstruction Detection in Surgical Augmented Reality Figure 1
2026-08-04cs.CV

Real-Time Visual Obstruction Detection in Surgical Augmented Reality

Shih-Chin Yang, Yanming Xiu, Hanting Ye, Qi Chen, Elias Rotondo, Maria Gorlatova

Department of Computer Science, Duke University, Department of Electrical and Computer Engineering, Duke University † † thanks:

2026-08-04视觉感知

本文针对手术 AR 中虚拟提示遮挡器械等关键信息、影响时敏操作的问题,提出小到大级联 VLM 管线:用分割一致性支持早退,并对困难帧的大模型输入做注意力视觉 token 剪枝。作者还构造伪 AR 遮挡检测基准,结果达到 87.43% 准确率、479 ms 平均延迟,相比云端大模型延迟降低 62.90%;但仍属静态图像和合成遮挡上的初步验证。

Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining Figure 1
2026-08-04cs.CV

Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining

Guoliang You, Haifan Gong, Xiaomeng Chu

2026-08-04视觉语言视觉感知

这篇论文针对CT视觉语言预训练只学习“有什么”而忽略病灶负担程度的问题,提出Spectrum:在全片与器官尺度上挖掘跨患者低到高负担关系,并用BDA对齐图像与报告的病理负担方向,以替代稀缺的纵向监督。实验显示其在CT-RATE零样本AUROC达85.6,在外部RAD-ChestCT达72.7,并提升线性探测与检索表现。

Manifold-GS: Certified Hybrid Assets via Varifold-Conservative Gaussian Splatting Figure 1
2026-08-04cs.CV

Manifold-GS: Certified Hybrid Assets via Varifold-Conservative Gaussian Splatting

Boyang Li

Peking University

2026-08-04三维

这篇论文针对3D Gaussian Splatting虽适合新视角合成、却难以作为可编辑几何资产的问题,提出将表面型高斯视为无向varifold,并把几何质量与渲染不透明度分离,以保证分裂、克隆等细化操作下的几何量守恒。方法只导出置信认证的开放表面补丁,未认证区域保留为残余splat。三组DTU实验显示其编辑泄漏为零、纹理往返PSNR约30.1/35.3/33.7 dB,碰撞浮面少于2DGS、SuGaR和Poisson基线,但覆盖率较低,且文中明确不主张RGB-only重建SOTA。

MedSAM2-Anatomy: Training-Free Inference-Time Optimization for Musculoskeletal Segmentation Figure 1
2026-08-04eess.IV

MedSAM2-Anatomy: Training-Free Inference-Time Optimization for Musculoskeletal Segmentation

John Garcia Henao, Nicholas Bünger, Benedikt Herzog, Cindy Guerrero Toro, Benjamin Vella, Matthias Biner, Rico Brütsch, Carmen Castroviejo Fernandez, Felix Öttl, Norman Juchler, Armando Hoch, Bettina Hochreiter, Sven Hirsch, Sebastiano Caprara

Digital Medicine Unit Team, Balgrist University Hospital, 8008 Zurich, Switzerland, Research Centre for Computational Health, Zurich University of Applied Sciences (ZHAW), 8820 Wädenswil, Switzerland, Hip and Pelvis Surgery Team, Balgrist University Hospital, 8008 Zurich, Switzerland, Shoulder and Elbow Surgery Team, Balgrist University Hospital, 8008 Zurich, Switzerland

2026-08-04视觉感知优化算法

针对髋、肩术前规划中高分辨率 CT/MRI 分割依赖人工标注、冻结 CNN 遇到域偏移易失效而基础模型又需人工提示的问题,论文提出 MedSAM2-Anatomy:用冻结专家模型生成解剖先验和多提示,再驱动冻结 MedSAM2,并通过候选掩膜融合与不合理先验剔除完成无训练推理优化。独立 Balgrist-V0 上,髋 MRI 中位 Dice 从 0.71 提升到 0.92,HD95 从 22.0mm 降至 5.0mm;但公开 TotalSegmentator 基准上专家模型仍最强,说明收益依赖先验可靠性。

SCALP: Semi-Supervised Statistical Shape Modeling from Imperfect 3D Photogrammetry via Landmark-Anchored Spectral Warp Figure 1
2026-08-04cs.CV

SCALP: Semi-Supervised Statistical Shape Modeling from Imperfect 3D Photogrammetry via Landmark-Anchored Spectral Warp

Nawazish Khan, Sanjay Bhandari, Sarang Joshi, Alzbeta Novotna, Tiffany Jeong, Loretta Bowman, Michael Hernandez, Tobi Somorin, Viraj Govani, Jesse Glodstein, Shireen Elhabian

2026-08-04三维

这篇论文针对婴儿颅缝早闭评估中 CT 有辐射、3D 摄影扫描又常含缺失与肩颈等杂乱结构的问题,提出 SCALP:先用少量标注加未标注数据训练 Point Transformer 定位颅面标志点,再以这些标志点锚定低频 Laplace-Beltrami 谱形变模板,直接生成稠密对应并过滤非颅部区域。实验显示其在婴儿摄影测量数据上优于无监督点云对应方法,但跨机构泛化与临床增益仍需更多验证。

RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding Figure 1
2026-08-04cs.CV

RadPRISM: Schema-stratified radiology-report supervision for concept-disentangled image representations and visual grounding

Fabian Drexel, Marlene Fritzsche, Era Stambollxhiu, Miriam Kumpf, Lena Schmitzer, Lea Schumann, Jannik Kahmann, Friedrich Puttkammer, Johannes Moll, Jannik Lübberstedt, Zeineb Ben Chaaben, Anirudh Narayanan, Cosmin I. Bercea, Sebastian Ziegelmayer, Marcus R. Makowski, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem

2026-08-04视觉语言视觉感知

针对医学视觉语言预训练把整份报告压入单一嵌入空间、难以保留概念结构和定位解释的问题,RadPRISM用临床定义的19概念schema将放射报告拆成概念级文本片段,并为每个概念学习独立视觉子空间。其在20万余胸片检查上训练,内部零样本宏AUROC由0.717提升至0.868,外部分类接近CARZero,视觉定位最高有4.3倍优势,读片研究显示概念级检索top-3正确率为0.78。

Automatic LV Localization and Short-Axis Plane Estimation from Arbitrary CMR Slice Figure 1
2026-08-04eess.IV

Automatic LV Localization and Short-Axis Plane Estimation from Arbitrary CMR Slice

Yi Yu, Yixuan Liu, Ziyu Zhang, Parker Martin, Zhenyu Bu, Yuchi Han, Yuan Xue

2026-08-04视觉感知

针对心脏磁共振中左心室短轴方向通常依赖离散视角分类或多切片几何交会、难以从任意单张切片估计连续3D方向的问题,本文将3D朝向检测引入CMR,并提出PCC嵌入以缓解角度边界、180度歧义和极区不稳定;在四个数据集上平均mIoU达86.18%、角度偏差3.39度。

RPL-UIE: Reliable Prior Learning for Underwater Image Enhancement Figure 1
2026-08-04eess.IV

RPL-UIE: Reliable Prior Learning for Underwater Image Enhancement

Yifan Chen, Jiaming Liu, Ye Zheng, Zhe Sun, Tao Chen

Yifan Chen is with the College of Future Information Technology, Fudan University, Shanghai 200433, China, and also with the Institute of, Engineering, Northeastern University, Shenyang 110819, China, China Telecom, China, and also with the School of Artificial, University, Xi’an 710072, China, Fudan University, Shanghai 200433, China

2026-08-04视觉感知

水下图像增强中,退化输入推断的先验易受色偏、散射和信息缺失影响,进而导致生成式复原的语义漂移。RPL-UIE用教师-学生框架先从退化-参考图像学习外观与光度空间先验,再让学生在无参考推理时估计这些先验,并通过残差扩散和频率校准缩小先验差距。多基准、检测/分割下游任务及ROV实拍实验显示其提升了复原质量和感知可用性,但极端浑浊、低光和迭代开销仍是限制。

Rethinking Pretraining for Specialized Design Data: Evidence from the JONES-19 Cultural Design Dataset Figure 1
2026-08-04cs.LG

Rethinking Pretraining for Specialized Design Data: Evidence from the JONES-19 Cultural Design Dataset

Alexandros Haridis, Charles Zhou

Harvard University, Cambridge, MA 02139, USA

2026-08-04数据集/基准

本文关注小规模、类别不均衡的文化纹样数据是否必须依赖 ImageNet 预训练,动机是检验自然图像“视觉常识”对专业设计档案的迁移价值。作者在 JONES-19 上用 ResNet18/50 对比预训练、从零训练及 multi-crop 增强,核心洞察是高度结构化的设计图像可通过局部采样学习到足够表征。结果显示预训练确有提升,但从零训练结合 multi-crop 基本追回增益,提示数据策展与领域合适增强可能比盲目扩大通用预训练更关键。

Counting the Cost of War Under Satellite Embargo: Zero-Shot Estimation of Impacted Infrastructure Figure 1
2026-08-04cs.CV

Counting the Cost of War Under Satellite Embargo: Zero-Shot Estimation of Impacted Infrastructure

Saleh Sakib Ahmed, M. Sohel Rahman

2026-08-04视觉感知

针对战区事后卫星影像被封锁或延迟时难以及时估算受影响建筑的问题,论文将损毁评估转化为基于事前地图、事件坐标和武器载荷的零样本几何计数任务。核心做法是用 Hopkinson-Cranz scaling 投影爆炸范围,并结合自适应视场的 SAMGeo 与 2.5D 深度增强 LVLM 分流计数。结果显示,稀疏区域中 2D 分割更快且接近最优,密集城区中深度提示显著缓解屋顶粘连导致的漏计。

FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration Figure 1
2026-08-04eess.IV

FDIR: Harmonizing Fidelity and Human-Machine Preference in Lossy Compression Image Restoration

Kuan-Yen Chen, Fang-Yi Su, Philip Chikontwe, Jung-Hsien Chiang

Department of Computer Science and Information Engineering, National Cheng Kung University, Tainan, Taiwan, Department of Biomedical Informatics, Harvard Medical School, Boston, MA, USA

2026-08-04视觉感知

本文针对压缩图像复原中保真度、人眼感知与下游机器任务偏好难以兼顾的问题,提出 FDIR 将复原拆成两阶段:先用质量引导的一步流匹配在潜空间恢复全局语义,再以像素空间确定性细节细化约束残差,减少生成式幻觉。实验显示其在极端压缩下取得最佳保真度和次优感知指标,并在实用压缩率下领先 7/10 个下游任务。

Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models Figure 1
2026-08-04cs.CV

Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

Yanbin Hu, Jin Cui, Jun Ye, Jiepeng Zhou, Jiangcheng Song, Boran Zhao, Pengju Ren

2026-08-04视觉语言视觉感知三维

论文针对3D-VLM依赖深度、点云等推理期输入导致RGB-only部署受限的问题,提出用训练期深度、物体与关系证据构造教师,并通过残差注入、logit/结构蒸馏和证据敏感加权,只迁移RGB可恢复的空间推理能力。实验中教师在11项指标中7项最佳,RGB-only学生在全部11项上超过匹配基线,ScanQA和Scan2Cap CIDEr提升明显。

What Carries the Signal in Pathology Foundation-Model Atlases? A Patient-Level Controlled Benchmark in Breast Cancer Figure 1
2026-08-04cs.CV

What Carries the Signal in Pathology Foundation-Model Atlases? A Patient-Level Controlled Benchmark in Breast Cancer

Chimdi Walter Ndubuisi

Department of Electrical Engineering and Computer Science, University of Missouri, Columbia, MO 65211, USA

2026-08-04规划控制数据集/基准

这篇论文针对病理基础模型图谱常以队列级基因排序代替患者级预测的问题,重建了乳腺癌患者级受控基准,比较嵌入、组织组成、细胞计数和几何解码器的真实信号来源。结果显示,冻结模型嵌入能预测部分分子程序,但优势并不稳定:基底型几乎可由组织组成解释,细胞计数已接近模型表现;所谓黎曼几何模块基本无增益,岭回归反而明显优于图解码器。

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models Figure 1
2026-08-04cs.CV

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models

Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

.​ Department of Radiology, Perelman School of Medicine, University of Pennsylvania, .​ Department of Radiology, University of Wisconsin–Madison School of Medicine and, .​ Department of Radiology, Cooper University Hospital, Cooper Medical School of Rowan, University, Camden, New Jersey, USA, .​ College of Computing and Informatics, Drexel University, Philadelphia, Pennsylvania, .​ Department of Computer Science and Engineering, University of Minnesota Twin Cities, .​ Istanbul Training and Research Hospital, Department of Radiology, İstanbul, Türkiye, .​ Department of Radiology, School of Medicine, Acıbadem Mehmet Ali Aydınlar, University, Istanbul, Türkiye., .​ UC Davis Graduate School of Management, Davis, CA, available benchmarks emphasize disease classification, report generation, or broad visual

2026-08-04视觉语言视觉感知数据集/基准

现有医学 VLM 评测多关注诊断、报告或宽泛 VQA,难以暴露左右性、定位和解剖关系等放射科空间错误。SPARC-Rad 的核心贡献是构建 300 个来自 TCIA 健康对照影像的人工标注图文问答,覆盖 CT、MRI、X 光及五类解剖区域,并配套标准提示、LLM 评分、人审和分组分析流程。文中主要结果是给出可复用基准与数据分布,未充分说明具体模型实测性能或增益来源。

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning Figure 1
2026-08-04cs.CV

Logographic Character Visual Pretraining via Semantic-based Contrastive Learning

Daqian Shi, Wei Cao, Xiaoyu Zheng, Lida Shi, Xiaolei Diao, Cedric M John

Queen Mary University of London, Jilin University, King’s College London, University College London, Queen Mary University of London London UK, Jilin University Changchun China, King’s College London London UK, University College London London UK

2026-08-04视觉感知

针对汉字、甲骨文等表意文字数据长尾、少样本和新字不断出现导致视觉识别模型泛化受限的问题,论文提出用语言模型提取字符上下文语义,并将字符间连续语义相关性作为对比预训练的软监督,而非把所有负样本等距推开。核心洞察是表意字符的字形视觉语义与语境语义存在对应关系,可用后者约束视觉表征空间。多数据集和下游任务实验显示该方法优于现有字符识别与对比学习基线。

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh Figure 1
2026-08-04cs.CV

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Li

Tsinghua University, The Hong Kong Polytechnic University, University of Electronic Science and Technology of China, Sun Yat-sen University, The University of Hong Kong, University of Science and Technology of China, Nanyang Technological University, SparcAI Inc., Tsinghua University Shenzhen China, The Hong Kong Polytechnic University Hong Kong China, University of Electronic Science and Technology of China Chengdu China, Sun Yat-sen University Guangzhou China

2026-08-04视觉感知强化学习

论文针对视频扩散模型在4D生成渲染中难以同时服从相机轨迹与物体内部动画的问题,提出DAR:将动画网格投影为tracking、world position和normal组成的4D G-buffer,并与Plücker相机射线一起注入Wan2.2控制接口。核心洞察是tracking+世界坐标比相机相关深度更能解耦表面身份与观察运动;在68例DAR-4D基准上,LoRA版PSNR 23.22、SSIM 0.895,较Wan2.2-Depth提升1.54 dB,完全微调达PSNR 25.36。

DODA: A Database of Datasets for Aesthetics Research Figure 1
2026-08-04cs.CV

DODA: A Database of Datasets for Aesthetics Research

Lisa Koßmann, Ralf Bartho, Christoph Redies, Johan Wagemans

Laboratory of Experimental Psychology, Department of Brain and Cognition, University, Leuven AI Institute, University of Leuven (KU Leuven), Leuven, Belgium, Experimental Aesthetics Group, Institute for Anatomy I, University Hospital Jena, facilitates collaboration across the fields of empirical and computational aesthetics.

2026-08-04数据集/基准

针对审美研究中图像数据集分散、标注标准不一、复用困难的问题,DODA构建了一个集中式数据集数据库与Web检索工具,汇总120余个含审美相关标注的数据集,并按规模、图像类型、标注方式、评分尺度、来源和可用性等维度整理。论文的主要结果是给出可筛选的元数据框架,展示其可帮助研究者选择合适数据、发现数据重叠与复用机会,但实际对模型性能或研究效率的量化增益文中未充分说明。

DS@GT ARC at MEDIQA-CORE-Task-1 2026: Trimodal Model Fusion with Task-Specific Gates for Brain Tumor Subtype Classification Figure 1
2026-08-04cs.CV

DS@GT ARC at MEDIQA-CORE-Task-1 2026: Trimodal Model Fusion with Task-Specific Gates for Brain Tumor Subtype Classification

Hoang Thanh Thanh Truong, Charles R. Clark

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332, University of Florida, Stadium Rd, Gainesville, FL 32611

2026-08-04视觉感知

这篇论文面向脑肿瘤诊断等待周期长的问题,尝试用MRI、病理切片和放射报告三模态信息提前预测胶质瘤分型。核心做法是为分子类型、LGG/HGG和WHO分级分别学习模态门控,而非共享一个融合表示。其全模态平均macro-F1为0.801,略高于基线0.796并列验证队伍第二;但优势主要依赖病理模态,缺失模态时反而落后,报告模态增益有限。

From Pixels to PCells: A Neurosymbolic Approach to Photonic Component Creation Figure 1
2026-08-04cs.CV

From Pixels to PCells: A Neurosymbolic Approach to Photonic Component Creation

Aadarsh Agarwal, Kenaish Al Qubaisi, Dirk Englund

Research Laboratory of Electronics, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, USA, The College, University of Chicago, Chicago, Illinois 60637, USA

2026-08-04视觉感知

论文针对光子集成器件设计中“图像几何”难以转成可编辑参数化版图的问题,提出 PixCell:用受限几何 DSL、可执行 PCell 与确定性渲染验证把视觉目标转为程序。结果显示,多模态代理经验证器可在 8 类器件上达到超过 0.9 的平均 IoU,并支持跨材料栈重定向与仿真;但开源模型经 verifier 训练后的提升较小,可能主要来自 scaling / data。

Beyond Edge Maps: Wavelet-Domain Conditioning for Multi-Adapter Map-to-Satellite Diffusion Figure 1
2026-08-04cs.CV

Beyond Edge Maps: Wavelet-Domain Conditioning for Multi-Adapter Map-to-Satellite Diffusion

Arisha Prasain

Department of Electronics and Computer Engineering, Pulchowk Engineering Campus, Tribhuvan University

2026-08-04生成模型

针对低资源地区卫星底图更新慢、而 OSM 等地图数据更易获得的问题,论文提出只依赖地图源的卫星图生成框架:将 OSM 栅格与其平移不变小波子带分别训练为两个 ControlNet 适配器,再用 MultiControlNet 融合空间结构和频域细节。在尼泊尔自建数据集和 Pix2Pix 上,联合条件在 SSIM、PSNR 及部分 LPIPS 指标上优于单一条件,但 FID 由小波单独条件更好,且作者承认测试规模较小,分布真实性增益需谨慎解读。

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation Figure 1
2026-08-04cs.CV

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

Rongxiang Zhang, Songhua Liu

2026-08-04视觉感知

LeapTalk针对长时、实时说话人头像生成中扩散模型延迟高、流式自回归易误差累积和身份漂移的问题,将生成从噪声到数据改写为参考图像锚定的 Brownian bridge 数据到数据传输,并用异构 DMD、SNR 对齐时间变换和音频驱动 CFG 蒸馏到单步学生模型。实验称其可在单 GPU 上以 1 步、最高 200 FPS 生成开放长度视频,同时保持较好的唇形同步、身份一致性和视觉质量。

Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search Figure 1
2026-08-04cs.CV

Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search

Saif U Din, Muhammad Ahsan Hussain, Radu Timofte, Dmitry Ignatov

Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany

2026-08-04视觉感知

这篇论文针对 LLM 生成 CNN 在移动端部署时仅看 GPU 精度不足的问题,提出把 QLoRA 架构生成、INT8 TFLite 导出和真实 Android 设备延迟测试闭环起来,并用量化精度/延迟作为门控反馈。结果显示 CIFAR-10 首轮移动得分提升约 25.6 倍,但后续 GPU 精度上升并未带来移动收益;CIFAR-100 则基线最好,说明端侧反馈与多数据集验证是必要的。

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference Figure 1
2026-08-04cs.CV

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

2026-08-04视觉感知

针对文本密集型 MLLM 中视觉 token 剪枝只看准确率会掩盖 OCR 证据丢失的问题,本文提出将答案表现、空间来源可追溯性、干预诊断和实际开销联合审计。结果显示,Qwen 在 30% 保留率下准确率接近全量,但不同剪枝策略的正向证据覆盖率差异很大;跨三种模型还呈现各自的质量-风险-可追溯性前沿,并带来最高 4.32 倍预填充加速。

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs Figure 1
2026-08-04cs.CV

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

2026-08-04视觉语言

这篇论文关注多模态大模型在高风险决策中“答对但依赖错模态”的隐患,指出像素或 token 级解释无法回答图像、文本或二者交互究竟谁驱动预测。作者提出 CMA,用耦合扩散生成图像-only、文本-only 和联合反事实,并以 Shapley 值量化模态贡献;在合成基准中 98% 识别正确驱动模态,并在临床数据上揭示准确率看不到的跨模态推理失败。

K-space Gaussian Representation for Parallel MRI Figure 1
2026-08-04cs.CV

K-space Gaussian Representation for Parallel MRI

Yu Guan, Mingyu Hu, Jiale Hu, Zhuoxu Cui, Dong Liang, Qiegen Liu

2026-08-04三维

针对并行 MRI 中缺失 k-space 样本通常只在离散网格上插值、难以刻画连续频域信号的问题,论文提出 KGR:在原生复杂 k-space 中用共享几何的 Gabor-Gaussian 基元建模,并结合 Hankel 低秩投影和频率自适应拟合保持多线圈一致性。多数据集和 Poisson、radial 采样实验显示其较代表性重建基线在指标与视觉质量上更好,但方法仍是 scan-specific、二维,均匀笛卡尔高加速场景鲁棒性有限。

Explainable Multimodal AI for Adaptive Calibration of Archaeological Sensing Workflows Figure 1
2026-08-04cs.CV

Explainable Multimodal AI for Adaptive Calibration of Archaeological Sensing Workflows

Nevio Dubbini, Daniel P. van Helden, Claudia Sciuto, Martina Naso, Arthur Leck, Clement Joubert, Heeli C. Schechter, Remy Chapoulie, Gabriele Gattiglia

King's College London, UK​, MAPPA Lab, University of Pisa, Italy​, Archéosciences Bordeaux UMR6034 CNRS- University Bordeaux Montaigne, France, INRIA, University of Bordeaux, France​, Hebrew University of Jerusalem, Israel

2026-08-04视觉语言生成模型

面向考古器物多模态数字化中校准可靠性、采集质量和跨模态一致性难以自动评估的问题,论文将校准视为统计一致性判断,在3D重建、HSI、XRF与拉曼数据上构建统一特征空间,结合异常检测、监督分类和XAI,把退化特征映射到采集纠正动作。实验显示该框架能捕捉多模态采集变异并完成质量判别,但部分结果仍偏初步,增益来源不清。

Beyond Random Partitioning: Unsupervised Spatio-Temporal Stratification for Cohort Balancing in Longitudinal Medical Imaging Figure 1
2026-08-04cs.CV

Beyond Random Partitioning: Unsupervised Spatio-Temporal Stratification for Cohort Balancing in Longitudinal Medical Imaging

Qinghui Liu, Jon André Ottesen, Atle Bjørnerud, Kyrre Eeg Emblem

2026-08-04视觉感知

论文针对纵向医学影像小样本中随机划分易造成强度分布和随访时间偏移的问题,提出先审计空间网格、强度指纹与时间轨迹,再在六维强度-时间特征上用 K-means 聚类并按簇分层抽样的无监督 SOP。脑 MRI 队列上,最大跨子集强度偏差由随机划分的 34.1% 降至 2.1% 以下,时间间隔也更接近总体均值。

Volcanic Clouds Detection through QCNN and Geostationary Satellite Multispectral Imagery Figure 1
2026-08-04cs.CV

Volcanic Clouds Detection through QCNN and Geostationary Satellite Multispectral Imagery

Federica Torrisi, Claudia Corradino, Alessandro Grilli, Tommaso Catuogno, Mattia Verducci, Elisabetta Paladino, Luigi Giannelli, Alessandro Sebastianelli

2026-08-04视觉感知

本文面向火山云与气象云相似、喷发样本少且地球同步卫星光谱采样较粗的问题,尝试把参数化量子电路嵌入AlexNet式CNN,在SEVIRI多光谱图像上比较2/4量子比特QCNN与经典模型。文中说明其用于区分灰云、SO2、混合云和非火山背景,但给出的片段未充分说明具体性能结果,量子层带来的增益来源不清。

Empirical investigation of 3D CT Foundation Models and Unsupervised Adaptation for Head and Neck Cancer Recurrence Prediction Figure 1
2026-08-04cs.CV

Empirical investigation of 3D CT Foundation Models and Unsupervised Adaptation for Head and Neck Cancer Recurrence Prediction

Bilel Guetarni, Feryal Windal, David Pasquier, Halim Benhabiles

2026-08-04三维

针对放疗后头颈癌两年复发预测中放射组学可复现性差、3D CT 基础模型跨中心泛化未知的问题,论文系统比较四种冻结 VFM、无监督少样本适配及临床影像融合策略。结果显示没有单一模型全面占优,VISTA3D 内部表现最好,CT-CLIP 外部泛化更强;门控融合和少样本预训练有助提升,但外部验证仍明显掉点,通用泛化尚未解决。

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining Figure 1
2026-08-04cs.CV

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology(Guangzhou), School of Management, Department of Computer Science and Engineering, Hong Kong University of Science and Technology (Guangzhou) Guangzhou China, The Hong Kong University of Science and Technology(Guangzhou) Guangzhou China, School of Management Northwest Polytechnical University Xi’an Xi’an China, The Thrust of Artificial Intelligence, Information Hub The Hong Kong University of Science and Technology(Guangzhou) Guangzhou China, The Thrust of Intelligent Transportation, System Hub The Hong Kong University of Science and Technology(Guangzhou) Guangzhou China, Thrust of Artificial Intelligence The Hong Kong University of Science and Technology(Guangzhou) Guangzhou China, Department of Computer Science and Engineering The Hong Kong University of Science and Technology Hong Kong SAR Hong Kong

2026-08-04数据集/基准安全鲁棒

本文针对施工安全模型在真实工地中面临的长尾危险、重复巡检数据和时间/场地分布变化,提出 SafeBuild-Bench,并用 GEMS 以模型不确定性和图多样性筛选高价值样本。基准含 3314 个专家验证任务,支持按月份和场地分层评测;实验显示现有多模态大模型总体最好约 60 分,说明其施工安全理解仍不可靠。

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation Figure 1
2026-08-04cs.CV

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation

Yehui Yang, Bo Zhao, Junzhe Cao, Hui Ma, Yue Sun, Wenjin Wang, Zitong Yu

2026-08-04视觉感知

该文针对视频远程心率估计中弱生理信号易受运动、光照和遮挡干扰,且多个强估计器输出可能相互冲突的问题,提出 PhysAgent:把候选心率和波形视为待验证假设,由轻量 MLLM 多代理整理场景、质量和分歧证据,再用确定性生理约束校验并融合。四个公开 rPPG 基准的实验显示,其在域内和跨域平均表现最好,消融支持多代理推理与确定性验证的互补作用。

Noise-Robust Conditional Flow Matching: Generating Clean Samples from Noisy Datasets Figure 1
2026-08-04cs.CV

Noise-Robust Conditional Flow Matching: Generating Clean Samples from Noisy Datasets

Adrian Urbański, Gabriel della Maggiora, Artur Yakimovich

Center for Advanced Systems Understanding (CASUS), Görlitz, Germany, Institute of Computer Science, University of Wrocław, Wrocław, Poland, School of Computation, Information and Technology, Technical University of Munich, Germany

2026-08-04生成模型数据集/基准安全鲁棒

针对科学成像中常只有单次含噪观测、干净数据昂贵或不可得的问题,论文提出 NR-CFM:在条件流匹配中学习可观测的 noisy bridge,并用端点校正恢复干净分布;AWGN 有闭式修正,复杂高斯协方差用数据驱动修正。实验显示其在多数设定优于 NR-GAN,高噪声下接近 Ambient Diffusion,并能在 SNR 0.001 的粒子图像上生成合理结构,但依赖已知噪声模型。

ELECTRIC: Evidential Learning-Enhanced CT Reconstruction via Iterative Correction Figure 1
2026-08-04cs.CV

ELECTRIC: Evidential Learning-Enhanced CT Reconstruction via Iterative Correction

Ge Wang

Department of Biomedical Engineering, Department of Electrical, Computer and Systems Engineering, Department of Computer Science, Rensselaer Polytechnic Institute, Troy, New York, USA

2026-08-04三维

本文针对CT重建中深度先验通常只给出图像均值、却不决定“该信多少”的问题,提出ELECTRIC:用证据学习估计误差相关的不确定性,并转成空间自适应先验精度嵌入Poisson加权MAP迭代。Mayo低剂量CT模拟中,先验均值较FBP误差约降70%,闭环更新提升测量一致性并比固定先验更抗强度误设;但实验仍偏小规模,校准与联合训练尚未充分验证。

Fast Trainable Multilinear Bases for Image Compression Figure 1
2026-08-04eess.IV

Fast Trainable Multilinear Bases for Image Compression

Shiwen An, Zhongyi Ni, Huanhai Zhou, Jin-Guo Liu

Department of Information and Communication Engineering, Institute of Science Tokyo, Yokohama 226-8501, Japan, Center for Advanced Intelligence Project (AIP), RIKEN, Tokyo 103-0027, Japan, Thrust of Advanced Materials, The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, Guangdong 511453, China

2026-08-04视觉感知

针对 DCT/FFT 等固定变换难以适配不同图像分布、而深度编码器参数开销过大的问题,论文把快速可逆变换重写为等距张量网络,并在酉矩阵流形上按数据集训练少量参数的多线性基。结果显示其在自然图像上基本追平 DCT,在 Quick Draw 线稿上以相同重建质量约减少 20% 字节,但方法仍是离线基设计,尚非完整可部署 codec。

Retrieval-Based Cross-Domain Generalization in Optical Networks via Global Features Figure 1
2026-08-04eess.SP

Retrieval-Based Cross-Domain Generalization in Optical Networks via Global Features

Ali Al Housseini, Carlos Natalino, Paolo Monti, Omran Ayoub

2026-08-04学习理论

针对光网络中 QoT 估计模型在拓扑、业务和设备配置变化下容易因分布偏移失效的问题,论文将对比学习得到的全局嵌入直接作为检索空间,用近邻投票替代源域训练的参数分类器,并通过向数据库加入少量目标域样本实现免重训练适配。实验显示其在双向跨域零样本中取得最高 MF1 和 PR-AUC,少样本场景下也更稳定,尤其在源/目标差异较大时收益明显。

Linguistic Context Recodes Visual Representations in Vision-Language Models Figure 1
2026-08-04cs.AI

Linguistic Context Recodes Visual Representations in Vision-Language Models

Brian Song, Michael A. Lepori, Ellie Pavlick

Brown University

2026-08-04视觉语言视觉感知

这篇论文针对VLM中视觉表征是否只是被语言读取的静态信息库这一问题,研究语言目标如何反向改写视觉token。核心发现是语言会在目标相关物体上形成可线性解码的抽象“引用”表征,并在后层放大与任务相关的颜色、形状等属性;通过 steering 和消融实验,作者进一步证明这些重编码会因果影响模型在计数、判断、空间及自然图像任务中的输出。

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs Figure 1
2026-08-04cs.CL

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

Meituan 2 Tsinghua University

2026-08-04视觉语言视觉感知

本文针对 VLM 构建中 LLM 骨干选择缺乏可预测准则的问题,提出以文本基准经 PCA 得到的能力分数替代参数量,并建模其向多模态能力的 transfer 与 absorption。作者训练 150 余个 VLM 验证该 scaling law,可从 8B 外推到 72B、预测训练轨迹并泛化到未见模型族;同时发现部分文本榜单与多模态表现负相关,base 模型通常比指令微调模型更适合作骨干。

2026-08-03

98 篇
Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark Figure 1
2026-08-03cs.CV

Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

Muyao Niu, Mingze Ma, Yifan Zhan, Qingtian Zhu, Zhihang Zhong, Wei Guo, Chang Wen Chen, Yinqiang Zheng

The University of Tokyo, Adelaide University, School of Artificial Intelligence (SAI), Hong Kong Polytechnic University, The University of Tokyo Tokyo Japan, Adelaide University Adelaide Australia, School of Artificial Intelligence (SAI) Shanghai Jiao Tong University Shanghai China, Hong Kong Polytechnic University Hong Kong SAR China

2026-08-03三维安全鲁棒

本文针对极暗环境下 RGB 图像噪声重、传统 RGB-NIR 方法依赖干净 RGB 监督且跨场景鲁棒性不足的问题,提出在多视角 3D 神经隐式建模中融合 noisy RGB 与 NIR 结构线索,并用 NIR 调制位置编码和 Color Code MLP 抑制噪声过拟合、缓解 NIR 到 RGB 的颜色歧义。合成与真实数据实验显示,该方法在无需干净 RGB 监督时优于多类基线,并能适应不同噪声水平。

Scaling Properties of Text Conditioning in Visual Generation Figure 1
2026-08-03cs.CV

Scaling Properties of Text Conditioning in Visual Generation

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

2026-08-03视觉感知

本文针对文本到图像中“提示越长未必越好”的问题,指出真正可扩展的是图像扎根的信息量而非 token 数。作者用 GPG、ED 衡量结构化提示的信息含量,并将场景、物体、几何和关系写成可编辑字段来训练扩散模型与提示器。结果显示,自然语言长提示很快饱和甚至退化,而结构化提示可降低扩散损失,在组合、推理和世界知识评测上超过多数开源模型,并接近或超过部分闭源模型。

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering Figure 1
2026-08-03cs.CV

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

2026-08-03视觉感知

长文档视觉问答的瓶颈在于证据稀疏且跨页、跨区域分布,现有方法往往只优化页面检索或页内区域定位。HierDoc 将证据获取拆成页面策略与区域策略两级集合预测,并用分阶段 GRPO 和粒度化奖励分别训练,再把整页、区域裁剪与 OCR/表格文本交给回答模型。在五个多页/长文档 VQA 基准上,其开放权重表现达到最优或相当水平,LongDocURL 相对最强开放基线提升 16.87%,区域证据还使页级系统准确率和 F1 分别提升 5.51% 与 4.82%。

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding Figure 1
2026-08-03cs.CV

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

2026-08-03视觉语言

论文针对多模态大模型将代码渲染成图像后视觉 token 成本高的问题,指出冗余主要来自缩进/换行造成的空白区域、与指令无关的代码区域以及固定压缩率不适配样本差异。CodeShrink 通过无空白渲染、指令感知 token 选择和强化学习自适应配置联合压缩,在代码问答、克隆检测和补全中最多减少 71.2% 视觉 token,并达到或超过未压缩文本输入表现。

OASIS: Occlusion-aware Single-image Hand Avatar Reconstruction via 3D Gaussian Splatting Figure 1
2026-08-03cs.CV

OASIS: Occlusion-aware Single-image Hand Avatar Reconstruction via 3D Gaussian Splatting

Zhisheng Han, Shiyao Wu, Jiayan Qiu, Yakun Ju, Lu Liu, Le Zhang, Pengfei Feng, Huiyu Zhou, Zheheng Jiang

University of Leicester, University of Exeter, University of Birmingham, China University of Geoscience, University of Leicester Leicester UK, University of Exeter Exeter UK, University of Birmingham Birminghan UK, China University of Geoscience Wuhan China

2026-08-03视觉感知三维

OASIS面向单张图像重建可动画手部头像,针对手部强自遮挡、单视角证据稀疏以及关节形变复杂导致NeRF式方法慢且细节不足的问题,改用3D Gaussian Splatting,并通过几何对齐视觉证据token、可见性条件点图注意力和Feature-on-Mesh形变表示来区分可靠观测与遮挡区域。实验称其在挑战姿态和野外图像上优于基线,适配约5分钟、渲染约390 FPS,并支持纹理编辑和文本生成头像等应用。

FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control Figure 1
2026-08-03cs.CV

FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control

Songchun Zhang, Sitong Guo, Xianghao Kong, Pengwei Liu, Yuwei Guo, Lvmin Zhang, Anyi Rao

2026-08-03视觉感知规划控制三维

这篇论文针对视频合成中“控制轨迹越精细,前景动态越难保真”的矛盾,提出 FlexComposer 将静态图片和动态素材统一为轨迹条件生成问题。核心做法是用规范化前景表示分离物体自身运动与全局位移,再通过无需额外适配器的空间感知潜变量注入把前景沿用户轨迹放入背景,并结合合成到真实的混合数据训练学习光照和阴影融合。实验显示其在视觉质量、时间一致性和轨迹跟随上优于现有方法,但具体增益中数据规模与模型设计的相对贡献仍需进一步拆分。

RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning Figure 1
2026-08-03cs.RO

RayViT: Ray-Conditioned Visual Representations for Viewpoint-Robust Imitation Learning

Qian Wang, Longrui Chen, Peiran Sun, Aleksandar Taranovic, Niklas Freymuth, Ge Li, Weiran Liao, C. F. Maximilian Nagy, Yucheng Tan, Tao Chen, Gerhard Neumann

Karlsruhe Institute of Technology, Germany, University of Leeds, United Kingdom

2026-08-03模仿学习安全鲁棒

这篇论文针对视觉模仿学习在相机位置变化下容易失效的问题,指出纯 RGB/预训练 ViT 表征缺少相机到世界的几何关系。RayViT 用 Plücker ray map 将内外参编码为逐像素射线,通过门控交叉注意力生成几何感知 CLS token,并把射线特征作为 patch 位置嵌入,再配合跨视角余弦一致性损失。在 RoboCasa 多任务相机扰动下鲁棒性提升约 13 个百分点,真实多任务平均完成阶段数提升 1.78。

A Human-Centered Validation of the Explainability-Performance Coefficient Figure 1
2026-08-03cs.LG

A Human-Centered Validation of the Explainability-Performance Coefficient

Christian Oliva, Luis F. Lago-Fernández

2026-08-03视觉感知

针对深度模型解释质量难以客观评估、且常与人类理解脱节的问题,本文将 EPC 扩展为模型无关的 EPC score,用特征稀疏性与保留性能的权衡衡量解释。实验覆盖表格、文本和图像,显示该指标能区分不同解释器与架构条件,Integrated Gradients整体更优,并与情感词典判断和 ImageNet 空间标注较强一致。

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning Figure 1
2026-08-03cs.RO

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

Tongji University, Shanghai Innovation Institute, Fudan University

2026-08-03视觉语言视觉感知强化学习

论文针对 VLA 强化学习中 critic 依赖单帧观测、难以处理机器人操作部分可观测性的问题,指出单纯堆叠历史帧缺少学习时序动力学的监督。WCM 将轻量世界模型目标与价值估计联合训练,预测未来潜在状态以改进 critic 表征。实验覆盖 149 个仿真任务和 7 个真实任务,在多种 VLA backbone、IND/OOD 设置下均提升成功率,尤其增强泛化表现。

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models Figure 1
2026-08-03cs.CL

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

2026-08-03视觉语言数据集/基准

面向需要从行为而非话语内容理解社交关系的多模态系统,FriendBench用同类破冰对话的20秒片段构造熟人/陌生人二分类基准,并匹配人类评测。结果显示最强模型准确率已接近人群,但更偏向判断“陌生人”,且未像人类一样从可见行为中获得额外增益,暴露出现有模型在视觉社交线索利用上的缺口。

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling Figure 1
2026-08-03cs.RO

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

Li Lin, Wujun Xu, Weiwei Meng, Kaiwen Xia, Kang Hao Cheong, Shuai Wang

2026-08-03视觉语言视觉感知

FibVLA针对长时程机器人操作中“需要历史上下文但实时推理开销过高”的矛盾,提出按斐波那契/对数间隔回看视觉帧与本体状态,并用通道级时序编码过滤背景冗余、流匹配生成动作分布,再通过递归复用前一动作块降低重复编码。实验称其在仿真与15项真实任务上提升成功率和动作平滑性,并较视频式时序基线响应更快。

CoDe-SSM: Context-Detail Decoupled State Space Model for Efficient UHD Image Restoration Figure 1
2026-08-03cs.CV

CoDe-SSM: Context-Detail Decoupled State Space Model for Efficient UHD Image Restoration

Jiaxu Su, Zhijian Wu, Jun Li, Bo Zhang, Yefeng Zheng

2026-08-03视觉感知

本文针对UHD图像复原中全局退化线索需要聚合、局部纹理又容易被压缩抹掉的矛盾,提出CoDe-SSM,将聚类得到的共享上下文交给GCSM做原型级SSM推理,再用LHFM从聚类残差中按高频掩码和稀疏卷积专家恢复细节。在低光、雾、雨、雪、模糊五类基准上,PSNR/SSIM和LPIPS均优于现有方法,且参数量约2.88M,说明增益主要来自显式的上下文-细节解耦。

TOOD: Task-Aware Out-of-Distribution Score Calibration for Continual Learners Figure 1
2026-08-03cs.CV

TOOD: Task-Aware Out-of-Distribution Score Calibration for Continual Learners

Mostafa ElAraby, Samer B. Nashed, Liam Paull

DIRO, Mila - Quebec AI Institute

2026-08-03视觉感知

本文关注持续学习中被常规准确率指标忽视的 OOD 检测退化:模型即使保留旧类分类能力,也可能逐步失去拒识未知输入的校准性。核心洞察是区分出 confidence gap 与 manifold crowding 两种机制,并提出无需训练的 TOOD,按任务分解能量分数并用回放统计校准。CIFAR 与 ImageNet-1K 流实验显示其多数设置优于未校准能量分数,在 10 个 CIFAR 配置中 8 个排名前二,但不能解决特征空间拥挤。

TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning Figure 1
2026-08-03cs.CV

TraceViT: Grounded Trace Supervision for Visual Abstract Reasoning

Binnan Liu, Yechi Ma, Tian Xie, Wei Hua

2026-08-03视觉感知

这篇论文针对循环视觉推理器只监督最终答案、导致中间迭代缺乏语义约束的问题,提出 TraceViT:从程序化 ARC 任务中改写并验证出单调的中间网格轨迹,用任务参考与对象工作区为每轮迭代提供 grounding,并用软对齐处理轨迹长度不匹配。模型在 ARC-AGI-1 上达到 67.8% pass@2、ARC-AGI-2 上达到 24.3%,消融显示轨迹监督只有与 grounding 结合时才带来明显收益。

Explaining AI-Image Detection: What the Heatmap Actually Shows Figure 1
2026-08-03cs.CV

Explaining AI-Image Detection: What the Heatmap Actually Shows

Leonid Kuturin, Ilya Sotnikov, Mark Khusnutdinov, Mikhail Potemkin, Pavel Baranas, Aleksandra Korepanova, Alexander Kalashnikov

Sirius Educational Centre, Big Challenges programme, HSE University, Faculty of Computer Science

2026-08-03视觉感知

论文面向电商评价图像伪造检测:生成图像成本降低后,平台不仅要判别真假,还要给出可申诉的证据。核心洞察是常规高分检测器主要吃到压缩/格式来源捷径,而非合成痕迹;对齐编码后PR-AUC从0.9999降至0.7254。作者进一步用因果删除检验热力图,发现解释效果依赖检测器本身,17种方法中仅部分优于随机或先验,尚不能证明热力图是忠实解释。

DynoDINO: Harnessing Dynamic Latent Information from DINO Features for Multi-Phase Medical Image Segmentation Figure 1
2026-08-03cs.CV

DynoDINO: Harnessing Dynamic Latent Information from DINO Features for Multi-Phase Medical Image Segmentation

Yu-Pu Hsu, Jen-Jee Chen, Yu-Chee Tseng

College of Artificial Intelligence, National Yang Ming Chiao Tung University

2026-08-03视觉感知

多期增强CT肿瘤分割的难点在于相位间呼吸错位、强化模式非线性以及临床采集中常有缺失相位。DynoDINO将DINO特征用于统一流程,先做切片级对齐,再用Mix-attention建模跨期动态,并以自适应门控保留诊断性差异、抑制错位残差。三组数据集结果显示其在常规、位移和缺相条件下均改善边界与结构一致性。

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation Figure 1
2026-08-03cs.CV

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

2026-08-03视觉语言视觉感知

面向多模态视频生成中不同任务各自建模、VLM层级表征利用不足的问题,MoRoute将冻结VLM与预训练视频DiT视为异构专家,用轻量逐块路由器让每个DiT层按输入动态选择相关VLM层,并把参考图像/源视频作为上下文token注入以保留细节。在IntelligentVBench、OpenVE-Bench和RefVIE-Bench上均超过最强基线,1–5分制平均提升0.15、0.18和0.34。

The K-Space Signature: Frequency-Domain Representation Learning for Medical Deepfake Detection Figure 1
2026-08-03cs.CV

The K-Space Signature: Frequency-Domain Representation Learning for Medical Deepfake Detection

Riccardo Raciti, Francesco Guarnera, Francesco Rundo, Luca Guarnera, Sebastiano Battiato

2026-08-03视觉感知

针对生成式模型可伪造3D MRI、威胁临床数据真实性的问题,论文提出K-Space Signature:把MRI转到Log-PSD频域并减去全局解剖先验,以突出扫描仪硬件噪声和生成痕迹,再用3D MLP-Mixer与ArcFace分类。多中心、多生成器实验中准确率和ROC-AUC超过0.99,未见扫描仪零样本场景最高约0.93,但仍依赖代表性真实数据来估计先验。

OSAGEN: Object-Aware Mask Priors and Multistage Decoupled Diffusion for Industrial Anomaly Generation Figure 1
2026-08-03cs.CV

OSAGEN: Object-Aware Mask Priors and Multistage Decoupled Diffusion for Industrial Anomaly Generation

Jinyi Xu, Peng Chen, Yunkang Cao, Chengliang Liu, Xinghui Dong, Chao Huang

2026-08-03生成模型

工业异常检测缺少真实缺陷和像素标注,常用的掩码引导生成又容易过度贴合掩码形状或与当前物体不匹配。OSAGEN的关键在于用三阶段解耦扩散分别学习正常外观、粗条件下的缺陷语义和细粒度掩码校准,并用Query-Bias-Gen生成物体感知掩码先验、ISC限制异常扩散。实验显示其在MVTec AD和VisA上AP-P/F1-P达88.1/82.2和68.5/66.1,消融表明物体感知掩码带来主要增益。

Multi-Source Multi-View Graph Domain Adaptation with Hyperbolic Residual Encoding for Cross-Site MDD Identification from rs-fMRI Figure 1
2026-08-03cs.CV

Multi-Source Multi-View Graph Domain Adaptation with Hyperbolic Residual Encoding for Cross-Site MDD Identification from rs-fMRI

Zhanpeng Zheng, Xiran Chen, Haiteng Jiang, Renjie Tian, Qinyu Cai, Jiexi Liu, Xiaofeng Chen, Weikai Li, Yansu Wang

2026-08-03视觉感知

该文针对跨站点 rs-fMRI 抑郁识别中扫描站点分布偏移、功能连接视图异构和脑网络层级结构难以统一建模的问题,提出多源多视图图域适应框架:分别编码 Pearson、稀疏表示和 Granger 因果图,显式建模跨视图交互,并用双流融合、双曲残差编码及类条件对齐等策略做无监督目标站点适配。七个目标站点上平均准确率 73.60%、AUC 71.90%,较最强基线提升 5.93/4.75 个百分点,但独立外部验证仍未充分说明。

Leveraging Transfer Learning with Class-Specific Decoders for Laparoscopic Segmentation Figure 1
2026-08-03cs.CV

Leveraging Transfer Learning with Class-Specific Decoders for Laparoscopic Segmentation

Priya Tomar, Aditya Parikh, Christian Bauckhage, Rafet Sifa

University of Bonn, Germany

2026-08-03视觉感知

本文针对腹腔镜多器官分割中小器官占比低、跨手术域标注稀缺的问题,评估类别专属解码器在 CholecSeg8K 与 DSA 间的迁移效果,并比较只微调解码器与全网络微调。结果显示,CEMD 在 CholecSeg8K 总 Dice 提升约 4%,主要来自胆囊类别;跨域预训练后全量微调在 DSA 达到 62.4% Dice 且收敛更快,但类别不均衡仍未被充分解决。

Lightweight Neural Networks for Affordance Segmentation: Enhancement of the Decoder Module Figure 1
2026-08-03cs.CV

Lightweight Neural Networks for Affordance Segmentation: Enhancement of the Decoder Module

Simone Lugani, Edoardo Ragusa, Rodolfo Zunino, Paolo Gastaldo

2026-08-03视觉感知

这篇论文面向假肢、外骨骼等可穿戴机器人上的视觉可供性分割,矛盾在于任务需要语义抽象但端侧算力有限。作者不再只调骨干网络,而是系统比较轻量分割头的卷积、上采样和多尺度连接,并加入目标分割辅助头形成层级多任务。实验在 IIT 与 UMD 上显示,多种解码器以更少参数超过基线,最佳 TOT 约 92.8,高于基线 91.2,但实际实时延迟文中未充分说明。

Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification Figure 1
2026-08-03cs.CV

Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification

Stanislaw Janik, Michal Byra

Institute of Fundamental Technological Research, Polish Academy of Sciences, Warsaw, Poland Samsung AI Center, Warsaw, Poland

2026-08-03视觉感知

论文针对隐式神经表示(INR)权重空间分类中参数高维、结构复杂且判别信息分布不清的问题,提出结合元学习的层级 MoE Transformer,让专家路由按 INR 层和 token 结构进行条件计算,并加入权重归因与结构化剪枝分析。实验称在 MNIST、CIFAR-10、Imagenette 到 ImageNet-1K 等基准上达到权重空间模型 SOTA,但仍落后传统像素模型且训练成本更高。

MoPET: Parameter-Efficient Mixture-of-Experts for Unified Medical Image Classification Figure 1
2026-08-03eess.IV

MoPET: Parameter-Efficient Mixture-of-Experts for Unified Medical Image Classification

Sebastian Doerrich, Daniel Würtinger, Francesco Di Salvo, Shyam Nandan Rai, Christian Ledig

2026-08-03视觉感知

针对医学图像多任务适配中全量微调易过拟合、单任务PEFT适配器又难统一部署的问题,MoPET将LoRA/BOFT低秩专家注入冻结基础模型,并用学习式稀疏路由缓解跨模态梯度冲突。MedMNIST实验显示PEFT优于全量微调,单个MoPET在4个异构数据集上略高于最佳独立适配器,辅助数据联合训练也提升小样本目标;但专家数、路由模式和增益来源仍文中未充分说明。

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models Figure 1
2026-08-03cs.CV

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

2026-08-03视觉语言视觉感知

这篇论文关注红外视觉语言模型从封闭类别走向开放词汇后带来的定向语义操控风险:攻击者不只是让模型出错,而是把热成像语义拉向指定概念。核心做法是把低对比度 QR 结构作为热触发器,保留功能区、优化冷热中性模块及位置尺度等渲染参数,并用无梯度搜索完成黑盒攻击。实验显示该方法可在多种 CLIP 式编码器上改变图文对齐,并迁移到描述生成和 VQA,说明分类侧语义偏移会传播到生成任务。

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs Figure 1
2026-08-03cs.CV

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Nan Duan, Tong Jia, Chaoran Luo, Ying Li

2026-08-03视觉语言

这篇论文针对VLM幻觉检测中过度依赖单一现象信号、跨模型和任务稳定性不足的问题,提出从注意力头层面刻画“忠实角色”及其在幻觉 token 上的系统性偏离 Role-Break。核心洞察是幻觉信息主要存在于保留头身份后的多头偏离模式中,而非某个全局注意力特征的升降。基于该信号,作者构建无需微调VLM、特征维度低于5000的线性检测器,在六个VLM和四个基准上平均AUROC达93.23,并展示检测到的token可用于小规模干预。

OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning Figure 1
2026-08-03cs.CV

OSEF: One-Step Evidence Fusion for Cross-Video Scene Procedure Planning

Zhentong Ye, Lei Zhang, Sijia Zhou, Yingda Yu, Yuehan Shi, Jiaqi Xuan, Shuaiwu Dong, Guanchao Tong, Meimei Zhang, Bin Li

2026-08-03视觉感知规划控制

这篇论文针对真实视频过程规划中“证据不预先给定”的问题,将跨视频检索、时间窗口定位和动作序列预测合并为CVSPP任务。核心思路是OSEF不先硬选单个视频片段,而是在所有候选上构建查询条件化的软证据格,并用token-global适配器交给规划器,缓解同任务视频歧义和检索错误传播。实验中OSEF在6个可排序单元均排名第一,在匹配COIN/CrossTask单元上将exact-video-and-plan成功率提升2.9至10.7点,主要增益来自token-global接口。

Dense Temporal Contrast Synthesis via Conditioned Latent Transport Figure 1
2026-08-03cs.CV

Dense Temporal Contrast Synthesis via Conditioned Latent Transport

Smriti Joshi, Apostolia Tsirikoglou, Daniel M. Lang, Richard Osuala, Noah Márquez Varaa, Alejandro Guzman, Grzegorz Skorupko, Sebastian Ibarra Arregui, Lidia Garrucho, Akane Ohashi, Dimitra Ntoula, Eugen Divjak, Oğuz Lafcı, Jan C. Peeken, Julia A. Schnabel, Fredrik Strand, Oliver Diaz, Karim Lekadir

2026-08-03视觉感知

这篇工作针对乳腺 DCE-MRI 对钆造影剂的依赖带来的禁忌、耗时和环境问题,提出以预增强图像为结构锚点、用连续采集时间条件化的潜变量传输模型,单次前向合成任意时刻的增强序列。结果显示其在多类图像与时序指标上优于基线和 SOTA,外部队列具备一定鲁棒性,并将肿瘤分割 Dice 从 0.49 提升到 0.60;放射科读片中 70% 病例可支持与真实 DCE-MRI 相同管理决策。

VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection Figure 1
2026-08-03cs.CV

VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection

Peng Chen, Kaige Li, Wei Wang, Mingbo Yang, Wenqiang Wang, Li Shen, Fangjun Huang, Chao Huang

2026-08-03视觉感知

这篇论文针对 CLIP 零样本异常检测中固定文本提示难以覆盖异常语义、全局视觉特征忽视细微纹理变化的问题,提出 VFAD:一方面用变分语义提示从密集 patch 中抽取异常相关局部语义,另一方面用小波频率分解和专家聚合增强结构与纹理表征。实验称其在 13 个工业和医学基准上优于现有 ZSAD 方法,但具体增益在不同模块间的来源仍需看消融细节。

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation Figure 1
2026-08-03cs.CV

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

Muhammad Talha, Muhammad Ahmed Amer

2026-08-03视觉语言视觉感知

SatEdit针对卫星图像编辑中对象尺度小、场景密集且缺少成对编辑监督的问题,提出用SAM2生成候选掩码、VLM标注语义并经少量人工校验,再通过掩码引导修复构造添加/移除训练对。其核心价值在于把昂贵的编辑对标注拆成分割、语义标注与合成监督流程。基于SODA-A的1014张图像和852个标注微调LoRA后,模型在受控比较中取得最高掩码区域语义对齐,CLIP为0.6322、CLIP delta为0.0726,同时定性保持背景,但泄漏与编辑强度仍存在权衡。

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation Figure 1
2026-08-03cs.CV

DualDiT: A Conditional Dual-Output Diffusion Transformer for Joint OCT Image and Segmentation Mask Generation

Fernando García-Torres, Rocío del Amor, Sandra Morales, Álvaro Barroso, Peter Heiduschka, Björn Kemper, Valery Naranjo

2026-08-03视觉感知生成模型

针对小鼠OCT视网膜层标注稀缺、手工分割成本高的问题,DualDiT将图像与分割掩码经VAE映射到共享潜空间,并用双输出扩散Transformer联合建模二者分布,以生成解剖对齐的图像-掩码对。实验中其FID/sFID为56.14/114.35,优于DDPM和LDM,专家难以区分部分合成样本,合成数据还提升了下游U-Net分割的Dice和IoU,但具体增益幅度文中片段未充分说明。

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition Figure 1
2026-08-03cs.CV

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

Wenzhuo Sun, Mingjian Liang, Richard Attfield, Zongyuan Ge, Xuelian Cheng, Pamela Carreno-Medrano

2026-08-03视觉语言视觉感知

这篇论文面向自然访谈视频中的矛盾/犹豫识别,动机是这类状态常分散在语言、语音、表情和停顿等弱线索中,单一模态或简单投票容易误判。核心做法是用 CALM-AH 组合文本、声学、视觉和行为统计特征,并引入 RG-MEC:以初始预测为锚点,只有 CALM-AH、AffectGPT 和语义验证器三者一致时才改写标签。ABAW11 参与者独立数据上,CALM-AH Macro-F1 为 0.7525,完整系统提升到 0.7771,但不同专家各自贡献和增益来源仍未充分说明。

BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning Figure 1
2026-08-03cs.RO

BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning

BWM Team

Model: huggingface.co/BLM-Lab/Boundless-World-Model

2026-08-03机器人强化学习

机器人学习需要能在上机前预测细粒度动作后果的低成本模拟器,以减少真实采集和物理仿真的 sim-to-real 代价。BWM 将视频世界模型按目标机器人做领域后训练,并用轨迹回放、重叠采样、初始观测增强及动态历史/动作条件保持动作-观测对齐。结果显示其在 WorldArena 综合排名第一,物理机器人数据增强成功率达 71.00%,评估器与硬件结果相关性最高为 0.908。

FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement Figure 1
2026-08-03cs.CV

FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement

Takashi Otonari, Toshihiko Yamasaki

2026-08-03生成模型三维

FillGS针对稀疏视角下4D Gaussian Splatting在快速运动区域容易因时空观测不足产生伪影的问题,核心思路是按渲染敏感度和运动感知观测密度主动选择需要生成模型补全的时空虚拟视角,并过滤与真实观测冲突或疑似生成错误的像素再微调。实验在新构造的稀疏多视角视频划分上显示,相比插值、覆盖率和其他选择策略,方法在PSNR、SSIM、LPIPS、FID等指标及视觉伪影上整体更优。

Training-Free Entity-Level Few-Shot Segmentation of Remote Sensing Images with Advection Refinement Figure 1
2026-08-03cs.CV

Training-Free Entity-Level Few-Shot Segmentation of Remote Sensing Images with Advection Refinement

Xueting Bai, Huan Ni

2026-08-03视觉感知

针对遥感少样本分割中跨域训练成本高、逐像素匹配易受尺度变化和纹理噪声干扰的问题,ELFSS-AR将SAM3生成的类别无关区域作为实体单元,融合支持样本原型与文本语义,并用平流方程在特征和相似度空间传播语义信息。实验称其在多个遥感数据集上优于FSS、CDFSS和训练免费OVSS方法,且无需额外训练;但实体生成稳定性仍是主要限制。

OsteoCAD: A Human-in-the-Loop Cloud-Edge Framework for Bone Tumor Segmentation Figure 1
2026-08-03cs.CV

OsteoCAD: A Human-in-the-Loop Cloud-Edge Framework for Bone Tumor Segmentation

Maximo Rodriguez-Herrero, Dante D. Sanchez-Gallegos, Heriberto Aguirre-Meneses, Marco Antonio Núñez-Gaona, J. L. Gonzalez-Compean, Jesus Carretero

2026-08-03视觉感知

这篇论文针对资源受限医院难以部署医学影像深度学习的问题,提出 OsteoCAD:以容器化云边架构连接本地临床流程与远程 GPU,并支持人工闭环标注、数据集扩展、训练和推理。其价值不在新分割模型,而在降低从零数据到临床试用的工程门槛;在墨西哥骨肿瘤 CT 场景中构建 67 例数据,16 例初始评估 Dice 达 0.84±0.02,但泛化与相对现有平台的增益来源仍未充分说明。

CBCT-IQ: A Publicly Available Annotated Cone-Beam CT Dataset for Image Quality Assessment and Benchmarking Figure 1
2026-08-03cs.CV

CBCT-IQ: A Publicly Available Annotated Cone-Beam CT Dataset for Image Quality Assessment and Benchmarking

Sepideh Hatamikia, Anna Breger, Clemens Karner, Birgit Pohn, Poorya MohammadiNasab, Martin Buschmann, Stephanie Nougaret, Laura Haddad, Ali Abbasian Ardakani, Afshin Mohammadi, Paul Apfaltrer, Wolfgang Birkfellner, Alfred Pohl, Ander Biguri, Gernot Kronreif, Carola-Bibiane Schönlieb, Tess Reynolds

CBCT-IQ: A Publicly Available Annotated Cone-Beam, Austrian Center for Medical Innovation and Technology (ACMIT), Wiener Neustadt, Austria, Department of Medicine, Faculty of Medicine and Dentistry, Danube Private University, Krems, Center for Medical Physics and Biomedical Engineering, Medical University of Vienna, Vienna, Department of Applied Mathematics and Theoretical Physics (DAMTP), University of Cambridge, Faculty Computer Science and Applied Mathematics, University of Applied Sciences Technikum, Department of Radiation Oncology, University Hospital Vienna and Medical University of Vienna, Department of Radiology, Montpellier Cancer Institute, PINKCC lab U1194, University of, Department of Radiology, Faculty of Medicine, Urmia University of Medical Science, Urmia, Iran, Clinical Institute for Diagnostic and Interventional Radiology and Nuclear Medicine, University, Clinical Department of Ophthalmology and Optometry, University Hospital Wiener Neustadt, Wiener, Image X Institute, Faculty of Medicine and Health, University of Sydney, Australia

2026-08-03视觉感知数据集/基准

针对CBCT图像质量评估缺少公开专家标注数据、难以验证定量IQA指标的问题,本文发布CBCT-IQ数据集:基于不同采集与重建参数生成1764张切片,由3名临床专家对整体图像和ROI进行四级评分,并用其评测26种全参考/无参考IQA方法;结果表明该数据集可作为CBCT IQA的标准化基准,并提出的指标排序能区分较细微的质量差异。

TAVI-TEC: An AI-Based Tool for Procedural Planning of Transcatheter Aortic Valve Implantation Figure 1
2026-08-03cs.CV

TAVI-TEC: An AI-Based Tool for Procedural Planning of Transcatheter Aortic Valve Implantation

Alessandra Zerillo, Stefano Cannata, Diego Bellavia, Daniele Ciriello, Simone Manini, Salvatore Pasta, Caterina Gandolfo

Department of Research, IRCCS-ISMETT, Palermo, Italy., Department for the Treatment and Study of Cardiothoracic Diseases and Cardiothoracic Transplantation, D/Vision Lab, Dalmine, Italy., Department of Engineering, Viale delle Scienze, Università degli Studi di Palermo, Palermo, Italy., Department of Engineering, University of Palermo, Department of Research, IRCCS Mediterranean Institute for Transplantation and Advanced Specialized Therapies, centerline extraction, landmark identification, and annular plane definition was implemented to quantify key, most misclassifications occurring between adjacent prosthesis sizes. Though further multicenter validation

2026-08-03规划控制

针对TAVI术前CTA测量依赖人工标注、耗时且存在操作者差异的问题,TAVI-TEC将心血管结构分割、钙化检测、中心线/标志点提取、瓣环平面定义和MLP瓣膜尺寸预测整合进网页DICOM阅片流程。109例SAPIEN 3 Ultra病例中,测量约2–6分钟完成,瓣环面积/周长与医生测量高度一致,瓣膜尺寸预测准确率为82%,但仍需多中心和更多瓣膜平台验证。

When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration Figure 1
2026-08-03cs.CV

When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration

Kesheng Chen, Yamin Hu, Wenjian Luo

2026-08-03视觉感知

本文关注视觉语言模型在反常但清晰的视觉证据面前仍被常识先验牵引的问题。核心洞察是反事实图像上的错误常指向无图输入时偏好的“普通答案”,据此提出SPC按候选答案估计并选择性扣除先验,只在校正后支持充分时改判。实验显示其提升反事实图像准确率,同时基本保留常识图像表现,并能迁移到多类冲突设置。

CorrelationFlow: A Training-Free Geometric Approach for LiDAR Scene Flow Estimation Figure 1
2026-08-03cs.CV

CorrelationFlow: A Training-Free Geometric Approach for LiDAR Scene Flow Estimation

Minh-Quan Dao, Yancong Lin, Julie Stephany Berrio Perez, Holger Caesar

University of Nottingham, University of Queensland

2026-08-03生成模型

这篇论文针对 LiDAR 场景流方法过度依赖相似深度架构和自监督损失、在稀疏远距或快速目标上共同失效的问题,提出无需训练的 CorrelationFlow:将连续点云投影为 BEV 占据图,用时空连通域分离目标,再通过归一化互相关峰值估计刚体位移,并给出单帧对的稀疏关键点版本。在 Argoverse 2 2026 多域挑战中,其无监督赛道排名第二,且长距离退化更平缓,说明部分场景流能力可由经典几何而非模型扩展获得。

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs? Figure 1
2026-08-03cs.CV

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

2026-08-03视觉感知

论文关注MLLM时代显著目标检测是否仍需专门监督,指出传统掩码评测混淆了显著性判断、定位和分割。作者构建SaliLLM将任务拆成实体定位与提示分割,发现MLLM已擅长找出显著物体但难以形成精确前景掩码,并据此前景组织提出免训练FOCUS。其通过协议校准和感知传播对齐粒度与范围,在13个RGB/RGB-D/RGB-T基准上总体超过多类SOTA,MAE相对全监督、弱监督和自监督方法分别降低11%、34%、48%。

Multi-Modal Object Re-Identification with Dual Semantic Guidance and Global-Local Mutual Modulation Figure 1
2026-08-03cs.CV

Multi-Modal Object Re-Identification with Dual Semantic Guidance and Global-Local Mutual Modulation

Weixiang Zhou, Xingguo Xu, Yuhao Wang, Cong Wang, Yang Yang, Zhixun Su, Jinshan Pan

2026-08-03视觉感知

这篇论文针对多模态目标重识别中背景干扰、跨模态错位和只建模全局特征的问题,提出用统一的 MLLM 文本先验与软语义掩码共同指导视觉表征,并通过 TSI、MGLM 和分层 MoE 在全局语义与局部部件之间相互调制。实验在三个多模态 ReID 基准上验证有效性,但具体增益来源和代码细节仍需等公开实现进一步判断。

Domain-Division based Progressive Learning for Source-Free Domain Adaptation Figure 1
2026-08-03cs.CV

Domain-Division based Progressive Learning for Source-Free Domain Adaptation

Pan Liu, Jing Li, Meng Zhao, Wanli Xue, Qinghua Hu, Shengyong Chen

Qinghua Hu is with the College of Intelligence and Computing, Tianjin University, Tianjin 300350, China

2026-08-03视觉感知

针对源数据不可用时自训练易偏向高置信样本、忽略困难目标样本并累积伪标签错误的问题,论文提出 DPL:按适应难度划分易/难子域,并在两阶段中交替进行不确定性感知自训练、子域图对比对齐和面向不同子域的渐进一致性/实例对比学习。实验在多个常用 SFDA 基准上优于已有方法,但具体增益主要来自哪类损失仍需结合消融判断。

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation Figure 1
2026-08-03cs.CV

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation

Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

School of Software, Dalian University of Technology, School of Computing Technologies, RMIT University, Dalian University of Technology Affiliated Center Hospital

2026-08-03视觉感知

超声分割受噪声、低对比度和边界模糊影响,且现有方法多依赖特定任务模型或人工框点提示,临床交互不够灵活。UltraSAM3将SAM3适配为图像-掩码-概念三元组训练,并用指令代理把复杂自然语言转成短概念提示,在37个公开数据集、13类解剖结构上提升跨器官、外部数据和复杂指令下的分割表现;但增益可能主要来自超声专用数据规模与概念标注。

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification Figure 1
2026-08-03cs.CV

Locally Consistent Transductive Information Maximization for Few-Shot Remote Sensing Scene Classification

Karim El Khoury, Benoît Gérin, Benoît Macq, Christophe De Vleeschouwer

2026-08-03视觉感知

遥感场景少样本分类常需在成批图像块上推理,单独处理查询样本会浪费其共同分布结构。论文在 TIM++ 中加入近邻预测一致性正则,提出 LC-TIM,并用 RSVLM 与 DINOv3 特征融合构建更强亲和图。十个数据集实验显示,转导方法普遍优于零样本基线,LC-TIM 在低样本场景提升最明显。

SERUM: State Extraction and Refinement for User Modeling Figure 1
2026-08-03cs.LG

SERUM: State Extraction and Refinement for User Modeling

Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

Minnesota NLP Lab, University of Minnesota

2026-08-03视觉感知

这篇论文针对主动式 AI 助手缺少可从原始屏幕/第一视角视频中自动获得的用户行为模型这一问题,提出 SERUM:用多轮 VLM 标注在动作识别与意图推断间迭代,并结合上下文和语义归一化合并状态,生成动作与意图的马尔可夫转移模型。在 61 个视频、四类任务上,状态词表约在第 8 轮趋于稳定,归一化模型较频率基线有更低困惑度和更好预测,人工也更偏好最终标签。

MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation Figure 1
2026-08-03cs.CV

MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation

Yifei Zhu, Mingyi Shi, Yangyang Cai, Miao Cheng, Yoshifumi Kitamura, Taku Komura

2026-08-03生成模型

这篇论文针对文本到人体动作生成中“语义特征好但不一定适合生成”的问题,指出直接把图像领域 RAE 思路迁到 Motion-JEPA 潜空间会因谱条件差和解码器敏感方向放大误差而失败。MoRAE 通过32维紧凑瓶颈和运动耦合训练重塑潜空间,使标准非自回归 Flow-Matching DiT 在 HumanML3D、KIT-ML 上取得更好的语义匹配与物理合理性指标。

Progressive Decision-Making for Localizing Open-Ended AI-Generated Image Forgeries Figure 1
2026-08-03cs.CV

Progressive Decision-Making for Localizing Open-Ended AI-Generated Image Forgeries

Jingyi Hou, Xiaoxia Chen, Leyu Zhou, Zhichuang Wang, Zhijie Liu

J. Hou, X. Chen, L. Zhou, Z. Wang and Z. Liu are with the School of Artificial Intelligence, University of Science and Technology Beijing, Beijing, China, with the Institute of Artificial Intelligence, University, Key Laboratory of Intelligent Bionic Unmanned Systems, Ministry of, Education, University of Science and Technology Beijing, Beijing 100083

2026-08-03视觉感知

该文针对 AI 生成/编辑图像伪造痕迹弱、区域可靠性不均且难以用固定模式覆盖的问题,认为最终定位不应是一-shot 像素预测,而应是逐步形成的决策状态。方法用轻量证据投影器将中观痕迹转为决策证据,并以 EG-Mamba 结合不确定性和边界约束更新掩码。实验覆盖传统与 AI 生成伪造基准,显示在未见 AI 伪造上增益更明显。

Have I Seen You? Embedding Behavior Signals Synthetic Face Dataset Membership Figure 1
2026-08-03cs.CV

Have I Seen You? Embedding Behavior Signals Synthetic Face Dataset Membership

Paweł Borsukiewicz, Daniele Lunghi, Wendkûuni C. Ouédraogo, Jacques Klein, Tegawendé F. Bissyandé

University of Luxembourg, Luxembourg

2026-08-03数据集/基准

针对合成人脸数据被用于降低隐私风险但其生成器仍依赖真实人脸训练的问题,论文提出一种数据集级成员推断攻击:通过黑盒查询人脸识别模型嵌入,利用不同候选数据集的探针到质心相似度及稳健 z 分数,先识别训练识别器的合成数据集,再追溯生成器的真实源数据。实验覆盖 11 个识别模型、11 个合成数据集和 7 个真实数据集,合成训练集识别率达 100%,真实源数据集识别率为 54.5%,说明合成数据仍会保留可利用的数据集级泄漏信号。

On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models Figure 1
2026-08-03cs.CV

On the Efficacy of Self-Supervised Point Cloud Encoders for Efficient 3D Large Language Models

Yao Zheng, Tian Zhang

Beijing University of Posts and Telecommunications

2026-08-03三维

这篇论文针对3D-LLM依赖昂贵多模态点云编码器的问题,系统比较PCP-MAE、Point-MAE、自监督预训练与随机初始化在MiniGPT-3D中的效果。核心洞察是预训练目标与编码器架构存在明显交互,且四阶段下游训练本身能把随机编码器训练到接近自监督方案。结果显示最佳自监督组合开放词表准确率达59.0%,但闭集ModelNet40仅13–18%,显著落后多模态基线约62%,说明纯几何预训练仍难提供语义边界。

First Investigation of Deep Learning for Intraoperative Gauze Segmentation in Minimally Invasive Abdominal Surgery Figure 1
2026-08-03cs.CV

First Investigation of Deep Learning for Intraoperative Gauze Segmentation in Minimally Invasive Abdominal Surgery

Priya Tomar, Maximilian Broß, Philipp Feodorovici, Jan Arensmeyer, Philipp Leifels, Aditya Parikh, Hanno Matthaei, Christian Bauckhage, Helen Schneider, Rafet Sifa

University of Bonn, University Hospital Bonn, Germany

2026-08-03视觉感知

本文针对腹腔微创/机器人手术中纱布遗留风险,研究真实术中视频里的纱布精细分割,而非传统粗检测。核心贡献是构建含三类纱布、血液干扰和形态变化的院内真实数据,并比较 CNN、Transformer 与混合分割模型,同时评估自动跟踪伪标注缓解标注稀缺。结果显示真实数据能削弱既有研究中“有血则难检测”的性能折衷,DeepLab 等模型在带血场景表现较强,自动跟踪标注对通用场景有增益,但增益来源可能主要来自 data。

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection Figure 1
2026-08-03cs.CV

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

Zhiying Cui, Minghao Yang, Linlin Gao, Jie Liu, Pengyuan Li

Ningbo University, Hokkaido University, analytical interpretations. When figures are copied, relabeled, National Institute of Standards

2026-08-03视觉感知数据集/基准

论文针对科学图像抄袭缺少系统评测的问题,提出 SciFigPlag-Bench,将“复用什么”和“如何改动”拆成双层分类,并用真实案例、合成正例和相似负例构建基准,覆盖检测、溯源、类型分类与区域定位四项任务。实验显示现有视觉语言模型在细粒度来源推理、复用类型理解和空间证据定位上仍明显不足。

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples Figure 1
2026-08-03cs.CV

A Frozen Pixel-Space Diffusion Model Can Guide Itself with Its Own Samples

Zixuan Fu, Chong Wang, Lanqing Guo, Kailai Zhou, Jiahao Nie, Bihan Wen

2026-08-03生成模型

论文针对像素空间扩散模型需同时建模全局结构与局部纹理、重训成本高的问题,提出 Synthetic Self-Guidance:冻结预训练骨干,在中间层训练轻量预测头,用中间粗预测与最终预测的差异作为采样自引导方向;且适配器只用模型自生成样本训练。ImageNet 上该方法以不到 1% 全量训练计算量稳定降低 FID,无 CFG 时 JiT 多变体降幅超过 50%,有 CFG 时也将 JiT-H/16 从 1.86 降至 1.67、PixelREPA-H/16 从 1.81 降至 1.59。

Forwardrobe: Garment-Aware Gaussian Avatars from a Single Image Figure 1
2026-08-03cs.CV

Forwardrobe: Garment-Aware Gaussian Avatars from a Single Image

Daisheng Jin, Shuyun Wang, Ying He

Nanyang Technological University, The University of Queensland

2026-08-03视觉感知三维

单图可动画人体重建在宽松服装上常因身体绑定拓扑与蒙皮假设而失真,限制换装和编辑。Forwardrobe 将衣物在规范高斯空间中显式解耦为独立资产,并用服装类别线索初始化连续几何与蒙皮,再加入姿态条件形变和外观残差。实验显示其在裙装等松散衣物的重建、动画连续性和跨人体虚拟试穿上优于现有单图方法。

StraightDP: Geometry-Aware Differential Privacy for Rectified-Flow Transformers Figure 1
2026-08-03cs.LG

StraightDP: Geometry-Aware Differential Privacy for Rectified-Flow Transformers

Xujun Che, Depeng Xu, Xintao Wu

2026-08-03生成模型

本文针对强隐私预算下文本条件生成模型经 DP-SGD 训练后效用骤降的问题,指出 rectified flow 在噪声端主要由类别条件低阶矩决定、靠近数据端才需要样本细节。StraightDP 先用少量隐私预算一次性发布白化类别矩,再将剩余预算用于预声明的时间分段 DP-SGD,并加入流范数约束骨干。MNIST 上 ε=1 时,矩释放已显著优于均匀 DP-SGD,完整流程达到 0.81 准确率和 FID 56;在冻结 SD3-medium 中,采样时注入也优于预算匹配的 DP-LoRA。

MHRGait: Gait Recognition from Momentum Human Rig Pose Figure 1
2026-08-03cs.CV

MHRGait: Gait Recognition from Momentum Human Rig Pose

Huiran Duan, Qian Zhou, Xianda Guo, Hua Zou, Guoying Zhao, Zhongyuan Wang, Yingli Tian

2026-08-03视觉感知三维

该文针对步态识别中过度依赖轮廓、骨架坐标或网格几何、易混入衣着体型等干扰的问题,提出用184维Momentum Human Rig身体与手部控制参数直接表征行走,并按解剖语义建模帧内协同与时序变化;MHRGait在CCPG和SUSTech1K等四个基准上取得模型式方法中的较强表现,且以2.76M参数、0.69 GFLOPs保持较低计算量,融合轮廓的MHRGait++也带来稳定增益。

Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation Figure 1
2026-08-03cs.CV

Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation

Beomyoung Kim, Sung Ju Hwang

2026-08-03视觉感知

这篇论文针对现有分割模型仍常出现边界粗糙、语义混淆和结构错误的问题,认为传统形态学合成噪声难以模拟真实模型失误。作者提出 Phoenix,用对抗嵌入攻击生成语义相关的噪声,并用三向对比学习约束真值、噪声输入和预测之间的特征关系。实验显示其在多类掩码细化任务和多种分割模型上优于 SegFix、SegRefiner、SAMRefiner 等方法,最高带来约 16.1% AP mask 绝对提升。

Parameter-Efficient Fine-Tuning for Spiking Point Cloud Models Figure 1
2026-08-03cs.CV

Parameter-Efficient Fine-Tuning for Spiking Point Cloud Models

Zihao Guo, Jihua Zhu, Yiding Sun, Lin Chen, Danwei Wang

2026-08-03三维

这篇论文针对脉冲点云预训练模型下游适配仍需全量微调、参数与存储开销高,以及二值脉冲会丢失阈下信息的问题,提出 SpikePEFT:冻结突触骨干,仅通过 IDT 调节膜衰减和发放阈值,并用 SSDA 区分近阈值静默状态以补回任务相关信号。实验显示其仅更新约 5% 参数,在 ModelNet40 达 92.4%,ScanObjectNN 最难划分达 85.6%,且在多个划分上超过全量微调。

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning Figure 1
2026-08-03cs.CV

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

Junbo Wang, Liangyu Fu, Yuke Li, Xuecheng Wu, Zhiyong Wang

2026-08-03视觉语言视觉感知

这篇论文针对情感视频字幕中硬性情绪层级容易误删正确情绪词、难以表达混合情绪的问题,提出 SAGML:用类别与词级情绪节点构成异质图,以软门控替代树形硬掩码,并结合因果语言解码器与多任务情绪监督。实验在 EmVidCap-S/L/全集均优于既有方法,全集上 Accsw、Accc、CIDEr、CFS 分别提升 6.7、7.7、9.0、8.6 点,但文中结果可能部分受更强语言模型 scaling 影响。

Rethinking Detection Calibration: A Coordinate and Direction Perspective Figure 1
2026-08-03cs.CV

Rethinking Detection Calibration: A Coordinate and Direction Perspective

Juyong Lee, Seungjin Jung, Jungmin Lee, Sunju Lee, Jongwon Choi

2026-08-03视觉感知

本文关注目标检测在自动驾驶等安全场景中过度自信的问题,指出仅按整框 IoU/精度校准会掩盖各坐标的错位和偏移方向。作者提出后处理框架 ReDC,用坐标级对齐率重编码置信度,并估计每个坐标的偏移方向,再聚合为框级定位分数。在 COCO、Cityscapes 的域内和域外实验中,ReDC 在坐标级与方向感知校准上优于既有方法,同时保持接近的框级校准表现。

ReMoE: Report-Guided Mixture-of-Experts for Multimodal OCT/OCTA Anomaly Detection Figure 1
2026-08-03cs.CV

ReMoE: Report-Guided Mixture-of-Experts for Multimodal OCT/OCTA Anomaly Detection

Zihan Nie, Qincheng Qiao, Muhao Xu, Wei Feng, Xinguo Hou, Weiye Song, Zongyuan Ge

2026-08-03视觉语言视觉感知

本文针对OCT/OCTA异常检测中过度依赖视觉外观偏差、难以利用正常报告语义的问题,提出ReMoE:将正常报告语义蒸馏为图像条件伪文本先验,并结合模态锚点通过混合专家调制编码器-解码器特征差异,使异常分数更贴近结构、血管与层级语义偏离。在私有配对报告数据和OCTA500-3MM设置上优于现有视觉及多模态基线。

GO-PRE: Goal-Oriented Next-Best-View Selection via Predictive Rendering Entropy for Active 3D Reconstruction Figure 1
2026-08-03cs.CV

GO-PRE: Goal-Oriented Next-Best-View Selection via Predictive Rendering Entropy for Active 3D Reconstruction

Yan Song, Zhihao Li, Chenglong Li, Li He, Yan Wang, Wenqiang Zhang

2026-08-03三维

面向机器人/受限采集中的主动三维重建,GO-PRE指出传统以参数不确定性或几何启发式选择视角,容易与最终的新视角渲染质量错位。其核心是把信息增益定义在预测空间,在用户指定目标视角流形上最大化平均边际预测熵的预期下降,并基于3D Gaussian Splatting给出可实时计算的采集规则。多基准实验显示,该方法较现有NBV策略提升重建质量,并给出更可靠的不确定性估计。

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting Figure 1
2026-08-03cs.CV

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

2026-08-03视觉感知

这篇论文针对 SAM/SAM2 直接用于体数据时缺乏切片间上下文、重建 3D 架构又代价高的问题,提出 SAM+D:在冻结 Transformer 中加入按深度路由的 LoRA 专家和零参数的深度通道平移,以一套轻量机制把 SAM 提升到 3D、把 SAM2 提升到 3D+T。实验覆盖 CT 器官分割和细胞跟踪,在单点提示下取得竞争性或更好结果,同时仅训练约 2.8%/3.7% 参数。

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing Figure 1
2026-08-03cs.CV

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

2026-08-03视觉感知强化学习数据集/基准

这篇论文针对多参考图像编辑中跨参考一致性与整体和谐难评估、现有奖励模型难支持强化学习的问题,提出 EVR:按参考一致性、场景、和谐度、指令一致性和质量拆分评价,由 MLLM 生成多条候选判断,再用验证器逐条视觉 grounding 过滤幻觉,形成奖励信号。实验显示其在 Qwen-Image-Edit 上带来明显提升,对基座模型人类偏好胜率达 67%,一致性和和谐度接近或超过 NanoBanana。

SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift Figure 1
2026-08-03cs.CV

SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift

Sagar Lekhak, Prasanna Reddy Pulakurthi, Lalit Joshi, Ramesh Bhatta, Emmett J. Ientilucci

2026-08-03视觉感知数据集/基准

面向无人机/地面机器人RGB表面地雷检测,论文指出原SULAND标注错误和OOD类别约定会扭曲域迁移评估,因此构建保留原图与划分、但重审标注的SULAND_v2,并用9类检测器35种配置做基准。结果显示标注修正使YOLOv8 IID mAP@50提升14.6–19.6个百分点,修正OOD类别后均值约升25个百分点;YOLOv12-Small IID最佳,RF-DETR-Large OOD更强,说明IID高分不足以证明可部署性。

Point2Radio: A Foundation Model for Cross-Scene Radio Fields from Material-Aware Point Clouds Figure 1
2026-08-03cs.NI

Point2Radio: A Foundation Model for Cross-Scene Radio Fields from Material-Aware Point Clouds

Chaozheng Wen, Chenghong Bian, Hongze Chen, Jun Zhang

2026-08-03三维

这篇论文针对三维场景中无线电场需逐场景仿真或重新拟合、难以跨环境复用的问题,提出用含材料信息的点云作为输入,通过层次化 tokenization 与 TX 条件化 CSC 注意力学习可迁移传播先验,并用查询解码器预测 PG、PAS 等量。在 337 个场景、86272 个 TX 条件场的跨场景测试中,PG MAE 达 0.871 dB,相比同划分 UNet 基线降误 76.7%,但增益可能也来自更大数据与模型 scaling。

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts Figure 1
2026-08-03cs.RO

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

2026-08-03机器人强化学习安全鲁棒

针对视频生成式世界动作模型在视觉分布偏移下会把未来预测“拉回”训练域、削弱控制鲁棒性的问题,ST-WAM提出用DINOv3语义特征同时承担未来监督与历史检索,并与VAE细粒度动态联合建模。结果显示其在LIBERO达98.7%、RoboTwin 2.0达92.8%,LIBERO-Plus零样本较Fast-WAM提升21.3个百分点,真实视觉偏移成功率由25.8%升至61.5%。

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models Figure 1
2026-08-03cs.CV

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

Zixuan Liu, Juntao Cai, Xiaoxu Cai, Haishuai Wang, Jiajun Bu

2026-08-03视觉语言

本文针对多模态大模型在文本预设与图像证据冲突时仍易跟随误导性语言线索、产生幻觉的问题,提出 CAER:先用 span-grounded evidence router 定位可疑文本片段并从冻结视觉 token 中取证,再用支持/纠错双前缀专家按冲突状态生成回答。实验在 MMMC 与新建 AgriConflict 上显示,其无需更新主干即可提升冲突检测与更可靠的视觉一致生成。

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning Figure 1
2026-08-03cs.CV

Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning

Duy Tran Thanh, Thien-Phuc Doan, Long Nguyen-Vu, Ngo Tan Vu Khanh

2026-08-03视觉语言视觉感知

论文针对严格零样本图像描述中“只在检索阶段做一次图文对齐、解码后缺少视觉校验”导致的性能停滞,提出在IFCap上加入更强检索编码器、跨注意力Verifier和自监督共识蒸馏的Beam重排器。COCO Karpathy上CIDEr从108.0升至117.6,SPICE达21.9,并在Flickr30k、NoCaps有迁移增益;但主要提升来自检索与验证检查点,仍可能部分受scaling和COCO相关Verifier影响。

Classification of COVID-19 cases from chest CT volumes using hybrid model of 3D CNN and 3D MLP-Mixer Figure 1
2026-08-03cs.CV

Classification of COVID-19 cases from chest CT volumes using hybrid model of 3D CNN and 3D MLP-Mixer

Masahiro Oda, Tong Zheng, Yuichiro Hayashi, Yoshito Otake, Masahiro Hashimoto, Toshiaki Akashi, Shigeki Aoki, Kensaku Mori

Information and Communications, Nagoya University, Nagoya, Japan, Graduate School of Informatics, Nagoya University, Nagoya, Japan, Graduate School of Science and Technology, Nara Institute of Science and Technology, Nara, Japan, Research Center for Medical Bigdata, National Institute of Informatics, Tokyo, Japan, Department of Radiology, Keio University School of Medicine, Tokyo, Japan, Department of Radiology, Juntendo University, Tokyo, Japan

2026-08-03三维

针对 COVID-19 诊断中胸部 CT 需要同时利用局部病灶与全肺范围影像模式、且医学数据有限的问题,论文将 3D CNN 的局部特征提取与 3D MLP-Mixer 的全局特征混合结合,用于 CT 体数据二分类。在 1205 例 CT 上取得 79.5% 准确率,高于传统 3D CNN+简单 MLP 基线,但临床可用性仍需更大数据和增强验证。

RAID: Towards Robust AI-Generated Image Detection with Bit-Reversed Images Figure 1
2026-08-03cs.CV

RAID: Towards Robust AI-Generated Image Detection with Bit-Reversed Images

Renxi Cheng, Jie Gui, Hongsong Wang

School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China, Purple Mountain Laboratories, Nanjing 210000, China, Engineering Research Center of Blockchain Application, Supervision And Management, (Southeast University), Ministry of Education, China, School of Computer Science and Engineering, Southeast University, Nanjing 210096, China, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary, Applications (Southeast University), Ministry of Education, China

2026-08-03视觉感知安全鲁棒

针对生成图像越来越逼真、现有检测器跨生成器和跨数据集鲁棒性不足的问题,RAID从比特平面差异入手,将图像比特位反序以放大原图中不显著的伪造噪声和细节伪迹,再用梯度选块与轻量卷积分类器检测。实验覆盖跨生成器、跨数据集和零样本设置,声称在40余个基准上优于既有方法且速度近百倍提升,但具体增益中数据集构造与表示变换的相对贡献仍需进一步拆分验证。

LegoQ: Density-Matrix Representation Learning with Spectral-Spatial State Transitions for Hyperspectral Classification Figure 1
2026-08-03cs.CV

LegoQ: Density-Matrix Representation Learning with Spectral-Spatial State Transitions for Hyperspectral Classification

Weijia Cao, Xiaofei Yang, Fu Wang, Yicong Zhou, Xiang Zhou

2026-08-03视觉感知

针对高光谱分类中混合像元、谱间歧义和少标注导致的向量表示难以解释不确定性问题,LegoQ将分组光谱持续编码为满足PSD、Hermitian和迹归一约束的密度矩阵,并用光谱、空间、组间耦合转移及Uhlmann保真度原型头完成分类。Indian Pines十次实验OA为96.20±0.70%,WHU-Hi-LongKou最佳OA为97.52%;但消融和边界像元诊断仍不足,增益来源不清。

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs Figure 1
2026-08-03cs.CV

SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs

Jian Yu, Fei Shen, Cong Wang, Jian Wang, Lu Jin.Xiaoyu Du, Jinhui Tang, Tat-Seng Chua

2026-08-03安全鲁棒

本文针对多模态大模型中安全机制容易被跨模态输入绕过的问题,提出 SafeNexus:先用有害/良性样本的中间层激活差异定位各模态安全神经元,再找出文本、图像、音频共享的通用安全神经元,并通过推理时放大激活或仅微调这些神经元来增强防护。实验显示其在多种跨模态安全基准上优于现有方法,同时基本保持通用能力。

Visual Distribution Anchoring for Efficient Prompt Tuning Figure 1
2026-08-03cs.CV

Visual Distribution Anchoring for Efficient Prompt Tuning

Pouya Parsa, Raoof Zare Moayedi, Seongjin Choi

University of Minnesota, University of Minnesota USA

2026-08-03视觉感知

论文针对提示调优在跨域视觉识别中“语义类名保留但目标域外观缺失”的问题,提出无需训练的 VDA:用冻结语义与域模板分类器将无标注目标图像硬分组,离线估计类级视觉原型并与语义分类器融合。核心洞察是类名难以预测目标域原型,但粗糙伪标签下的局部视觉证据仍有用。十个 ImageNet 到目标域迁移中,VDA 分别提升 CLIP、TCP、MaPLe 约 3.2-3.4 点,并提升 PromptKD 2.79 点。

Retrieval-Driven Training-Free AI-Generated Video Attribution Figure 1
2026-08-03cs.CV

Retrieval-Driven Training-Free AI-Generated Video Attribution

Renxi Cheng, Chaolei Han, Jie Gui, Hongsong Wang

School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China, Purple Mountain Laboratories, Nanjing 210000, China, Engineering Research Center of Blockchain Application, Supervision And Management, (Southeast University), Ministry of Education, China, School of Computer Science and Engineering, Southeast University, Nanjing 210096, China, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary, Applications (Southeast University), Ministry of Education, China

2026-08-03视觉感知

针对 AI 生成视频难以溯源且监督式归因依赖封闭类别和大量标注的问题,论文将归因改写为参考库检索:通过自适应正交颜色变换、多尺度量化残差和时序语义聚合提取生成器指纹,无需重新训练即可接入新模型。在 GenVidBench 上同时提升检测与归因表现,报告 Rank-1 准确率和 mAP 分别优于现有方法 20.5% 与 16.6%。

Automated classification method of COVID-19 cases from chest CT volumes using 2D and 3D hybrid CNN for anisotropic volumes Figure 1
2026-08-03cs.CV

Automated classification method of COVID-19 cases from chest CT volumes using 2D and 3D hybrid CNN for anisotropic volumes

Masahiro Oda, Tong Zheng, Yuichiro Hayashi, Yoshito Otake, Masahiro Hashimoto, Toshiaki Akashi, Shigeki Aoki, Kensaku Mori

Nagoya University, \supit bGraduate School of Informatics, \supit cGraduate School of Science and Technology, Nara Institute of Science and Technology, \supit dResearch Center for Medical Bigdata, National Institute of Informatics, \supit eDepartment of Radiology, Keio University School of Medicine, \supit fDepartment of Radiology, Juntendo University

2026-08-03三维

这篇论文针对胸部 CT 层厚不一致导致常规 3D CNN 难以稳定提取特征的问题,提出先在轴状、冠状、矢状三个平面做并行 2D 特征提取,再融合进入 3D CNN 的混合结构,并加入空洞卷积和密集池化连接以利用多尺度空间信息。在 1288 个 CT 体数据上,平均分类准确率由无混合流的 79.5% 提升到 83.3%,显示主要增益来自对各向异性体数据的结构适配。

A Biometric Sensor Network to Enable Real-Time Measurement of Individual Student Engagement in STEM Lecture Environments Figure 1
2026-08-03cs.CR

A Biometric Sensor Network to Enable Real-Time Measurement of Individual Student Engagement in STEM Lecture Environments

Ahmed Elsayed

2026-08-03视觉感知

针对 STEM 课堂中学生参与度难以实时、个体化且低干扰测量的问题,本文构建由学生处理单元组成的生物特征传感网络,将人脸、视线与情感分析放到端侧执行,并以加密后端管理会话与数据。实验显示系统可支撑多设备带宽、亚秒级同步、10 秒片段实时推理和超过两小时电池运行,相比实验室基线提升了安全性、自治性和数据可靠性。

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models Figure 1
2026-08-03cs.CV

DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models

Omid Ahmadieh, Nima Karimian

University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing

2026-08-03视觉感知生成模型

该文针对人脸识别系统在窄决策边界下易被规避、且现有像素噪声或局部补丁攻击真实感和跨模型迁移不足的问题,提出 DiffAttack:在 Stable Diffusion 潜空间中用 LoRA 调整交叉注意力,并由多个替代人脸识别模型的身份距离梯度引导生成目标身份外观。实验在 FFHQ、CelebA-HQ 上报告平均攻击成功率 84.86%,相对噪声和语义攻击迁移性分别提升约 15.28% 和 5.21%。

Group-wise Supervision with Focal-Dice Loss for Long-Tailed Indoor Semantic Occupancy Prediction Figure 1
2026-08-03cs.CV

Group-wise Supervision with Focal-Dice Loss for Long-Tailed Indoor Semantic Occupancy Prediction

Qi Zheng, Zihuang Su, Xiao Pan

2026-08-03视觉感知

本文针对室内语义占据预测中类别极度长尾的问题:墙、地板等头部体素主导训练,稀有但关键物体识别不足。方法将类别按语义一致性与频次混合做分组,并用多尺度“主干-专家”预测头配合 Unified Focal-Dice 损失,同时强化难样本梯度与区域几何完整性。在 EmbodiedScan 上相对基线提升 11.38%,长尾类别有明显增益,但具体消融细节在给定片段中未充分说明。

Domain-Adaptive Deep Joint Source-Channel Coding for Image Classification Figure 1
2026-08-03cs.IT

Domain-Adaptive Deep Joint Source-Channel Coding for Image Classification

Yishen Li, Xuechen Chen, Xiaoheng Deng, Hao Zhang

2026-08-03视觉感知

面向训练域与部署域分布不一致导致任务型 Deep JSCC 图像分类性能下降的问题,论文先用分类-容量-不变性函数分析信道容量、跨域不变性与目标域精度的非单调关系,再提出基于伪标签的类级对抗对齐和置信筛选对比学习。数字与 PACS 数据集在 AWGN、Rayleigh 信道上显示目标域泛化提升,SVHN→MNIST 在 10 dB CSNR 达到 98.15%,且推理时不增加额外网络。

Physics-Aligned Self-Supervised Learning for Scientific Imaging Figure 1
2026-08-03cs.CV

Physics-Aligned Self-Supervised Learning for Scientific Imaging

Bashir Kazimi, Stefan Sandfeld

2026-08-03视觉感知

这篇论文针对科学成像中直接套用自然图像 SSL 增强会引入错误不变性的问题,提出按测量算子筛选物理一致对称与采集扰动的增强设计流程,并用表示几何诊断和单因素消融验证。作者在实空间电镜和 4D-STEM 上比较 DINOv2、SimCLR、MAE、VICRegL、I-JEPA,显示物理对齐增强显著提升依赖跨视图一致性的模型表现,降低取向回归误差,并增强对探测器增益、分辨率下降等采集变化的鲁棒性。

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging Figure 1
2026-08-03cs.CV

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez

University of Las Palmas de Gran Canaria

2026-08-03视觉感知数据集/基准三维

该文针对脑肿瘤MRI三维分割中不同论文因数据、预处理和训练协议不一致而难以公平比较的问题,构建统一基准,在BraTS 2023脑膜瘤与BraTS 2024治疗后胶质瘤上对3D U-Net、SegResNet、Swin UNETR、SegMamba和SegMambaV2做同条件评测。核心价值在于同时考察精度、推理时间和参数规模,揭示不同架构在准确性与计算成本间的取舍;但具体最优模型和数值增益在给定文本中未充分说明。

Learning Manifolds in High-D Point Embedding for Anisotropic Surface Approximation from Unstructured Point Clouds Figure 1
2026-08-03cs.GR

Learning Manifolds in High-D Point Embedding for Anisotropic Surface Approximation from Unstructured Point Clouds

Hongbo Li, Haikuan Zhu, Xiaohu Guo, Wenping Wang, Jing Hua, Zichun Zhong

2026-08-03三维

面向机器人、自动驾驶和 AR/VR 中密集点云难以实时处理的问题,论文提出 HD-PEA,直接从无结构点云学习高维欧氏嵌入流形,并在高维空间估计切子空间、稀疏采样与重建各向异性网格。实验覆盖 Thingi10K、AIM@SHAPE、Stanford、ScanNet 等数据集,报告在表面精度、网格质量、轻量化和可扩展性上优于多类重建方法。

FocusGS: Spatial Delta Layers for Local Repair and Deterministic Editing of Trained 3D Gaussian Assets Figure 1
2026-08-03cs.CV

FocusGS: Spatial Delta Layers for Local Repair and Deterministic Editing of Trained 3D Gaussian Assets

Yiqun Pan, Yukun Shi

2026-08-03三维

本文针对已训练 3D Gaussian 资产在交付后难以局部修复和精确编辑的问题,指出全图优化会造成小 ROI 的空间梯度饥饿。FocusGS 将维护请求建模为空间增量层:修复时只添加局部 Gaussian 基,确定性编辑时用 EIF 先擦除旧载体再插入目标内容。实验显示局部修复 ROI PSNR 提升 7.91 dB,83 次编辑均改善目标区域,公开案例达到 5/5 OCR 命中。

Can Synthetic Data Overcome the Generalization Limits of AI-Based Flower and Pod Detection Across Cowpea Breeding Genotypes and Environments? Figure 1
2026-08-03cs.CV

Can Synthetic Data Overcome the Generalization Limits of AI-Based Flower and Pod Detection Across Cowpea Breeding Genotypes and Environments?

Hamid Kamangir, Jonathan Berlingeri, Earl Ranario, Isaac Kazuo Uyehara, Lars Lundqvist, Heesup Yun, Christine H. Diepenbrock, Brian N. Bailey, J.Mason Earles

Department of Plant Science, University of California Davis, Davis, CA, USA., Department of Biological and Agricultural Engineering, University of California Davis, Davis, CA, USA.

2026-08-03视觉感知生成模型学习理论

这篇论文关注豇豆育种中花与荚检测模型跨基因型、地点和年份失效的问题,指出性能下降与可测的图像分布偏移相关。核心做法不是单纯增加合成图像,而是用程序化3D植株生成数据,并按真实相机统计优化成像增强和HDR表示来缩小 sim-to-real 差距。结果显示,未见条件下花检测mAP@50可从76.3%降至50.6%,而优化HDR合成数据加少量真实图像可在空间泛化上达到或超过真实数据基线,时间迁移增益较弱。

Do Medical Foundation Models Generalize on the African Brain? Figure 1
2026-08-03cs.CV

Do Medical Foundation Models Generalize on the African Brain?

Kaouther Mouheb, Gonzalo Esteban Mosquera Rojas, Juancito van Leeuwen, Stefan Klein, Esther E. Bron

2026-08-03视觉感知

针对医学基础模型主要在欧美高资源数据上评测、非洲脑 MRI 泛化性缺乏系统证据的问题,本文比较四类基础模型在尼日利亚痴呆分类与 BraTS-Africa 肿瘤分割上的表现。核心洞察是性能差异并不稳定指向非洲队列劣势,可能主要来自数据规模。结果显示分类增益有限,BrainIAC 最高 ROC-AUC 为 0.86;分割任务提升更明显,MedSAM2 Dice 最高达 0.86。

Uncertainty-Aware Deepfake Detection via Multi-View Structural Learning Figure 1
2026-08-03cs.CV

Uncertainty-Aware Deepfake Detection via Multi-View Structural Learning

Muhammad Umar Farooq, Kutub Uddin, Awais Khan, Khalid Malik

College of Innovation and Technology, University of Michigan, Flint, MI 48502

2026-08-03视觉感知安全鲁棒

这篇论文针对深伪检测在分布外操控和真实退化下容易过度自信的问题,提出 DISCERN:把 CLIP 视觉特征、面部语义一致性和语义-取证结构依赖三路证据联合建模,并用分支分歧校准将冲突显式转化为不确定性。以 FaceForensics++ 训练的跨数据集实验显示,其在泛化、校准和选择性预测上优于对比方法,但具体增益中各分支贡献仍需看消融细节。

WaiT for the Signal: Simple Frequency-Aware Flow-Matching Figure 1
2026-08-03cs.CV

WaiT for the Signal: Simple Frequency-Aware Flow-Matching

Krunoslav Lehman Pavasovic, Théophane Vallaeys, Stéphane Mallat, Giulio Biroli, Luke Zettlemoyer, Brian Karrer, Jakob Verbeek

2026-08-03生成模型

本文针对高分辨率生成中标准 flow matching 对所有空间频率同等处理、早期在近似纯噪声的高频上浪费计算的问题,提出用无损小波分解让低频先形成全局结构,高频延后加入联合去噪。该方法几乎不改架构,只调整粗细频带噪声日程,并用 FID、5cFID、hFWD 评估全局、局部和纹理质量。在 ImageNet 512 上达到 FID 1.43、最多降采样计算约 50%,2B 模型 FID 1.3,并扩展到 OpenImages、1024 文生图和视频生成。

SCMA: Structure-Conditioned and Metal-Aware Flow Matching for CT Metal Artifact Reduction Figure 1
2026-08-03cs.CV

SCMA: Structure-Conditioned and Metal-Aware Flow Matching for CT Metal Artifact Reduction

Heran Wang, Jianing Sun, Xu Jiang, Genwei Ma, Xing Zhao, Jigang Duan

2026-08-03生成模型

本文针对CT金属伪影中生成模型易脱离个体结构和投影物理约束的问题,提出SCMA:以线性插值校正图像作为结构条件,在Flow Matching训练中加入由金属掩膜和距离变换构造的动态空间权重,并在推理时交替执行投影一致性校正。实验覆盖模拟与真实CT数据,显示其较代表性MAR方法能更好抑制条纹/暗带、保留局部解剖结构,并减少与测量不一致的幻觉结构。

ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding Figure 1
2026-08-03cs.CV

ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding

Shijie Wang, Xiangzhao Hao, Yueti Li, Guangyu Cao, Xinyu Tang, Haiyun Guo

2026-08-03视觉语言

本文针对通用多模态嵌入中“增加推理计算会带来串行生成延迟”的问题,提出把额外计算放到模型深度而非 token 维度。核心洞察是检索判别能力主要在中后层形成,因此 ReLoop-UME 只循环复用该检索形成阶段,并用可学习检索寄存器跨循环积累证据。实验显示其在 MMEB-V2、MRMR 和不同骨干上提升检索效果,同时比 UME-R1 快 44.9 倍、比 PLUME 快 1.5 倍。

Mirror Learning Figure 1
2026-08-03cs.LG

Mirror Learning

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

University of British Columbia

2026-08-03视觉感知

这篇论文针对行为克隆依赖大量第一人称、带动作标注示范而难以利用第三人称观察的问题,提出 Mirror Learning:用微调视频扩散模型把观察到的示范者视角转换成学习者可用的伪第一人称视频,再由逆动力学模型补全动作,合成 mirror data。实验在 CARLA 和 Minecraft 中验证视角生成能力,并在自动驾驶设置中显示仅用 mirror data 可训练策略,且与真实第一人称数据联合训练能提升开放环轨迹指标;但真实机器人操作场景的泛化与闭环安全性文中未充分说明。

Simulative Anomaly Detection using 2D Tomography Figure 1
2026-08-03eess.IV

Simulative Anomaly Detection using 2D Tomography

Moti Ben-Harush, Nimrod Teneh, Gregory Lukovsky

2026-08-03视觉感知

面向肿瘤等组织内异常的射频层析成像设计,论文关注真实实验中入射场难以准确测量导致重建退化的问题。其核心做法是用简化的二维散射仿真替代耗时三维建模,快速评估不同介电参数误差下的成像鲁棒性。结果显示,5%相对介电常数误差仍可检出异常但深度估计变差,15%误差会产生不现实偏移,从而给出可接受误差上限。

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift Figure 1
2026-08-03cs.LG

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift

Mushir Akhtar, M. Tanveer

Department of Mathematics, Indian Institute of Technology Indore, India

2026-08-03视觉语言视觉感知

论文关注临床分布迁移下医学视觉语言模型的风险:总体覆盖率看似达标时,某个疾病类别仍可能被系统性漏覆盖。作者提出 CALCoDe,用交叉验证发现脆弱类别,再以独立校准集给出类别条件阈值,并结合局部 conformal 与支持度审计。两项皮肤病外部迁移、四个冻结 VLM 上,CALCoDe 是唯一在八种设置中同时达到 0.95 边际覆盖和最差类覆盖的方法。

Predicting Steel Fatigue Life from Micrographs Using Physics-Informed Deep Learning Figure 1
2026-08-03cs.LG

Predicting Steel Fatigue Life from Micrographs Using Physics-Informed Deep Learning

Aryuemaan Kumar Chowdhury

2026-08-03视觉感知

传统钢材疲劳寿命测试耗时且具破坏性,论文尝试用显微组织图像直接预测疲劳寿命。核心做法是结合七阶段 OpenCV 预处理、28 维物理特征与 GNLL 双头 CNN,同时输出寿命与不确定性。在合成显微图基准上,ResNet-50 达到 R²=0.93、RMSE=0.18,校准误差较 MSE 降低 76%;但验证完全依赖合成数据,真实样本迁移效果文中未充分说明。

Optical Flow Sensor: A Direction-Selective Bionic Retina Design Figure 1
2026-08-03cs.AR

Optical Flow Sensor: A Direction-Selective Bionic Retina Design

Juchen Zhou, Bonan Yan, Yuchao Yang

2026-08-03生成模型

论文针对机器人等边缘视觉中传统帧式或DVS外接处理光流带来的延迟、带宽和功耗问题,提出像素级OFS仿生视网膜传感器,在片上结合ON/OFF事件比较与时间差测量直接输出光流向量,并设计OF-AER读出及光忆阻器版本。实验称其相较FPGA加速DVS功耗降低303倍、保持微秒级延迟,输出数据量减少约3.3倍;具体增益对工艺与系统假设的依赖文中未充分说明。

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding Figure 1
2026-08-03cs.AI

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

Zhejiang University, Xidian University, Zhejiang University Hangzhou China, Xidian University Xi’an China

2026-08-03视觉感知

ViSAGE针对长视频多模态代理在压缩、分段处理和向量检索中易丢失身份线索、产生实体混淆的问题,提出以实体为中心的自校正记忆:用跨模态绑定锚定身份,借双向记忆细化回溯修正历史记录,并用多代理交叉验证约束证据一致性。实验在M3-Bench-robot、M3-Bench-web和Video-MME-long上较强基线平均提升5.9%,但具体增益来源仍需更多消融支撑。

Meshy T2: Fast Native Mesh Generation with Flow Matching Figure 1
2026-08-03cs.GR

Meshy T2: Fast Native Mesh Generation with Flow Matching

Jiale Xu, Rendong Liang, Yuhao Long, Siyuan Shen, Zangyueyang Xian, Zeyi Xu, Yuanming Hu

2026-08-03生成模型

本文针对现有3D生成方法需从隐式场后处理成网格、或自回归序列生成过慢且易累积拓扑错误的问题,提出Meshy T2:用近乎无损的顶点集mesh VAE联合解码顶点、边连接和面朝向,并以图像条件体素流到网格流的两阶段flow matching生成可控顶点预算的原生网格。实验显示其图像到网格中位耗时约6秒,几何保真度达到SOTA,并能直接生成多部件连通组件。

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs Figure 1
2026-08-03cs.CL

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs

Andong Hua, Colton Bishop, Igor Mordatch, Arian Hosseini, Jindong Gu, Aleksandra Faust, Rebecca Roelofs, Yao Qin

University of California, Santa Barbara

2026-08-03视觉语言数据集/基准

论文关注多模态大模型在语义等价的文本与图文交错输入下回答不一致的问题,提出 TokenSwap 将文本概念替换为语义对齐图像,并构建 TokenSwap-Bench 衡量模态差距。对 42 个模型测试发现性能普遍下降 4.2%–47.4%,推理模型差距更小;提示和单纯 scaling 效果有限,TokenSwap 训练可缓解差距且基本不损害原有能力。

2026-07-31

131 篇
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval Figure 1
2026-07-31cs.CV

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

University of Illinois at Urbana-Champaign, 2 Microsoft Research, 3 Google DeepMind

2026-07-31视觉语言视觉感知

长图像集合和长视频中,VLM 往往被大量无关帧干扰,且全量视觉 token 推理受显存限制。ReToken 的关键洞察是传统 query-key 注意力并不适合做视觉检索,最终层 value 空间更能表征可用于回答的内容;因此只训练一个附加到问题中的可学习检索 token,在冻结 VLM 情况下从预填 KV cache 中选取相关视觉 token。实验显示其在 Visual Haystacks 上为 Qwen3VL-8B、InternVL3.5 带来 13.4/12.4 点提升,并能零样本迁移到 LVBench 长视频,提升 8.0 点。

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine Figure 1
2026-07-31cs.CV

ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine

Yukang Cao, Haozhe Xie, Beichen Wen, Runmao Yao, Yinghao Liu, Yue Huang, Zhichao Liao, Yunxiang Wang, Haiheng Liu, Xingshun Tian, Dawei Su, Long Zhuo, Dacheng Tao, Xiaogang Wang, Liang Pan, Ziwei Liu

2026-07-31视觉感知

这篇论文针对具身智能缺少真实、同步、多模态家庭交互数据的问题,提出 ACE 环境采集系统,把真实住宅按桌面级与房间级两种尺度改造成标定同步的记录场。其核心价值在于同时捕获第一/第三人称视频、人体/手/物体轨迹、音频与触觉,并发布 ACE-Data-0:150 小时、7.5 万段、200 类任务数据;基准结果显示现有方法在接触、遮挡、自运动和长时序场景下明显失效。

PhiZero: A World Model Built Around Physical Language Figure 1
2026-07-31cs.CV

PhiZero: A World Model Built Around Physical Language

Shuyao Shang, Yuqi Wang, Ruopeng Gao, Xu Chen, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)

2026-07-31强化学习

PhiZero针对视频世界模型只在像素空间预测、难以显式建模物理演化的问题,提出从野外视频自监督学习离散“物理语言”,先在该空间推理状态转移再用扩散解码成视频。实验覆盖生成与理解基准,显示其在物理一致性、交互式 rollout、动作条件模拟和零样本运动迁移上有效;但具体增益中 scaling / data 的贡献仍需进一步拆分。

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers Figure 1
2026-07-31cs.CV

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

2026-07-31生成模型

视觉生成在高分辨率图像、长视频和多模态上下文下受全注意力二次成本限制。Chimera 将 KDA 线性状态跟踪、周期性 MLA 全局交互、模态感知短卷积和 MoE 组合,并用 HeteroP 建立跨尺度调参和 Chinchilla 式 scaling law。实验显示其相对 Wan-2.1 2B 可达 7.3 倍预训练计算效率,并能从 5 秒训练零样本外推到 30 秒视频,但部分增益可能主要来自 scaling / data。

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models Figure 1
2026-07-31cs.AI

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

The University of Hong Kong, Xi’an Jiaotong University, Nanjing University, University of Science and Technology of China, National University of Singapore, Fudan University

2026-07-31强化学习数据集/基准

本文针对计算机使用智能体的奖励/评测越来越依赖 VLM 裁判、但其可靠性缺乏系统检验的问题,构建跨 Web、移动、Ubuntu、Windows 的 OSReward 人工金标基准,并揭示主流裁判普遍偏宽松、容易把失败轨迹判为成功。作者进一步发布 OS-Shepherd-100K 并训练 9B/35B 开放奖励模型,在困难集上以约低 30–60 倍成本接近商业裁判表现。

Beacon: Knowing When and How to Perform Agentic Visual Reasoning Figure 1
2026-07-31cs.CV

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

Peking University

2026-07-31视觉感知

论文指出,现有智能体视觉推理常把“会用工具”等同于“该用工具”,导致困难样本上的收益被简单样本上的工具误伤抵消。Beacon将工具调用适应性和工具效果分开评估,并在RL中引入必要性感知奖励与提示引导能力扩展,使模型更倾向于在文本推理不足时调用Python视觉/数值工具。13个基准上,Beacon平均性能最好,且工具收益与工具伤害的差距最大。

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation Figure 1
2026-07-31cs.CV

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

2026-07-31视觉语言强化学习三维

这篇论文关注多模态 on-policy 蒸馏中教师纠错混有语言先验和教师偏差、未必来自视觉证据的问题。VAD 通过对同一教师比较证据存在与移除时的 token 概率变化,构造带符号的视觉归因方向,并只用与该方向对齐的纠错重建学生目标,同时区分支持与反驳信号。实验在 4B、9B 模型和六个细粒度视觉基准上优于直接特权视角蒸馏与视觉优势加权。

MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers Figure 1
2026-07-31cs.CV

MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk

Department of Computer Science and Engineering, Khulna University of Engineering & Technology (KUET)

2026-07-31视觉感知

ViT 后训练量化在边缘部署中常用统一位宽,但不同注意力、归一化和激活组件对量化的脆弱性差异很大,导致精度预算浪费。MixFrag 用小校准集比较全精度与单组件量化输出的 KL 散度来估计脆弱性,并把位宽分配建模为多选择背包问题。实验显示其在 ImageNet 多种 ViT 上保持竞争性分类精度,在 COCO 检测和实例分割中优于既有混合精度 PTQ,MP3/MP3 设置最高提升 9.6 AP。

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation Figure 1
2026-07-31cs.CV

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

Huazhong University of Science and Technology, China, Zhejiang University, China

2026-07-31三维

ROAD针对高保真3D生成依赖大规模数据和算力、从零学习几何的问题,尝试把判别式3D基础模型中的语义与结构先验转移到扩散生成器。其关键洞察是3D生成/判别潜空间不存在天然逐token对应,因此用全局语义凝聚和基于匈牙利匹配的结构最优对齐分别约束宏观语义与局部几何。实验称其在Step1X-3D框架下仅用约1.5%训练数据即可取得有竞争力效果,且推理阶段不引入额外3D基础模型开销。

Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently Figure 1
2026-07-31cs.CV

Finding Change in Satellite Archives from Text: How to Combine Before-and-After Images Efficiently

Simon Roy, Mark Bong, Giovanni Beltrame

2026-07-31视觉感知

面向用自然语言在海量双时相卫星档案中检索“哪里发生了某类变化”的需求,论文不再单纯提出新模型,而是在固定 CLIP 编码器和训练设置下比较注意力、Mamba 与瓶颈压缩融合。核心洞察是标准 ViT patch 数下 Mamba 的线性复杂度未转化为实际低延迟,TBF 更划算;再配合差分预筛级联,可在 LEVIR-CC 上保持或提升召回,将查询成本降低约 10-15 倍。

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion Figure 1
2026-07-31cs.CV

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

Transvascular Implantation Devices Research Institute, Zhejiang University, Hangzhou, China, Zhejiang University, Hangzhou, China, Liangzhu Laboratory, Hangzhou, China, Hangzhou Institute of Technology, Xidian University, Hangzhou, China, Hangzhou Dianzi University, Hangzhou, China, Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence, Hangzhou

2026-07-31视觉语言视觉感知生成模型

针对医学图像融合中统一规则难以体现诊断意图、DiT 序列化又可能破坏二维解剖连续性的问题,MIND 用 BioMedGPT 生成病灶感知融合文本,并通过多尺度潜空间适配器注入源图像结构特征,再以医学语义一致性损失约束图文对齐。实验在 Harvard、BraTS、GFP 上报告更好的融合质量,并提升脑肿瘤分割表现,说明收益来自意图引导与结构保持的联合设计。

ScaFE: Data-Efficient Scar Classification with LLM-Generated Clinical Feature Programs Figure 1
2026-07-31cs.CV

ScaFE: Data-Efficient Scar Classification with LLM-Generated Clinical Feature Programs

Ruman Wang, Hangting Ye

2026-07-31视觉感知

针对瘢痕照片中瘢痕疙瘩与增生性瘢痕难区分、标注少且跨医院成像差异大的问题,ScaFE不让VLM直接看图诊断,而是用LLM检索临床证据并生成可本地执行的特征程序,再由随机森林分类,兼顾隐私、可审计和数据效率。在三院600张照片留一医院评测中达到81.0%站点宏平均平衡准确率,比BiomedCLIP高10.0个百分点;仅用10%开发数据仍有72.0%,但仍需前瞻性临床验证。

MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition Figure 1
2026-07-31cs.CV

MarkushGlyph and OCSRGlyph: Improved Chemical Structure Recognition

Alex Andonian, Samuel G Rodriques, Andrew D White, Siddharth M Narayanan

2026-07-31视觉感知

论文面向专利和文献中化学结构图难以程序化检索的问题,将普通 OCSR 与 Markush 结构识别统一为图像到文本翻译。核心做法是用 OCSRGlyph 通过手性样本重采样提升立体化学识别,并用 MarkushGlyph 直接读取整页结构图与周边文字,避免多阶段管线,同时提出更严格的 CXSMILES 图等价评估。结果显示 OCSRGlyph 在 USPTO OCSR 上达 93.8% exact match,MarkushGlyph 在 IP5-M、M2S、USPTO-M 三个基准均超过既有方法;但统一模型的 OCSR 仍未达最优,增益可能部分来自 scaling / data。

What to Remove, What to Preserve: Dual-Ambiguity Rectification for All-in-One Image Restoration Figure 1
2026-07-31cs.CV

What to Remove, What to Preserve: Dual-Ambiguity Rectification for All-in-One Image Restoration

Cencen Liu (1), Wen Yin (1), Dongyang Zhang (1), Dongmin Li (1), Shan Zhao (2), Bing Su (2), Tao He (1), Jielei Wang (1), Guoming Lu (1) ((1) University of Electronic Science and Technology of China, (2) Jiigan Technology)

University of Electronic Science and Technology of China, University of Electronic Science and Technology of China Chengdu Sichuan China

2026-07-31视觉感知

本文针对统一图像复原中退化线索与场景内容在共享表示里纠缠的问题,指出其会造成误删真实细节和残留噪声/雨雾等伪影。核心创新是将歧义拆为通道语义歧义与空间响应歧义,用退化原型表示、提示调制和正交子空间约束分别建模“该去除什么、该保留什么”。实验显示DAR-Net在三类和五类退化设置下平均PSNR较最强基线提升0.14 dB和0.34 dB,并在CDD-11、WeatherBench上表现更好。

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding Figure 1
2026-07-31cs.CV

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

Bowen Liu, Shuning Wang, Xinpeng Ding, Zhiheng Wu, Bodong Du, Xiaomeng Li

2026-07-31视觉感知生成模型

论文指出长视频理解的瓶颈不只在选到相关帧,还在于模型是否能把跨时刻线索整合成可用于回答的证据。GenEvA在帧选择后加入查询条件的潜在证据聚合接口,用少量latent tokens按证据分布汇总多帧信息,并自适应决定是否调用。实验在四个基准和两类Video-MLLM上相对同帧数基线稳定提升,8帧下LLaVA-Video平均提升5.2点,Qwen2.5-VL在LVBench最高提升10.1点,额外视频token开销仅0.11%–0.40%。

RefCaptioner: Multi-Reference Image-Grounded Video Captioning Figure 1
2026-07-31cs.CV

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang

Shanghai AI Lab

2026-07-31视觉语言视觉感知

这篇论文针对常规视频字幕只能描述内容、难以把局部视觉事实精确对应到多张参考图的问题,提出多参考图像 grounded 视频字幕任务和 RefCaptioner。方法用混合 SFT 保留通用描述能力,再以 HCD-GRPO 同时优化事实性、短语级绑定、干扰图抑制和同主体参考一致性。作者构建 2 万视频训练集与 MRVBench,结果显示其在开源模型中综合最好,并在通用字幕基准上保持竞争力。

AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans Figure 1
2026-07-31cs.CV

AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans

Jingwen Yang, Senmao Wang, Luoyao Kang, Runmeng Cui, Keying Zhang, Yunjia Bao, Haifan Gong, Lin Lin, Haiyue Jiang

2026-07-31视觉感知强化学习

本文针对耳廓 CT 中目标小、软骨边界弱、标签嵌套重叠导致的精细分割困难,将分割从一次性前馈预测改写为潜空间中的解剖状态演化。AuricularWorld 在 nnU-Net 框架内引入三步循环世界模型 rollout,并用层级 add/remove 动作与前景均衡损失约束结构修正。193 例数据实验显示其 Dice 达 78.42%,相较 nnU-Net 小幅提升 0.67 个百分点,但 HD95 降低约 43.2%,主要收益体现在边界误差改善。

Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous Vehicles Figure 1
2026-07-31cs.CV

Towards Real-Time PixOOD: Efficient Anomaly Segmentation for Autonomous Vehicles

Luca de Martino, Federico Aromolo, Federico Nesti, Giorgio Buttazzo

2026-07-31视觉感知

面向自动驾驶和铁路场景的像素级异常分割,论文关注现有 PixOOD 精度虽高但嵌入式部署过慢的问题。核心做法是将 Neyman-Pearson 评分阶段改写为 GPU 原生实现,并结合 ONNX-to-TensorRT 编译与精度选择,减少 CPU 往返开销。在 AP 几乎不变的情况下,RTX 4060 最高达 182 FPS,Jetson AGX Orin 达 75 FPS,较原始基线约提升 18-20 倍。

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation Figure 1
2026-07-31cs.AI

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin, Juan Moreno-Garcia

Escuela Superior de Informática, Department of Technologies and Information Systems, Universidad de Castilla-La Mancha, Paseo de la Universidad 4, Ciudad Real, 13071, Spain

2026-07-31生成模型

论文针对纳卫星下传带宽受限和航空目标数据类别失衡这两个瓶颈,提出把6U CubeSat上的边缘推理与FLUX+LoRA生成式少数类增广结合起来,并以8MB Edge TPU SRAM约束选择、量化检测器。实验显示,平衡数据将mAP@50从77.9%提升到82.2%,直升机类F1从0.683升至0.811,INT8模型预计可在轨达到25–30 FPS。

Can Vision-Language Models Reason about AI Edits in Images? Figure 1
2026-07-31cs.CV

Can Vision-Language Models Reason about AI Edits in Images?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

Rensselaer Polytechnic Institute

2026-07-31视觉语言视觉感知

针对生成式图像篡改越来越难检测且现有可解释伪造检测依赖强监督推理标注的问题,本文用GRPO以格式和准确性奖励训练VLM先生成推理轨迹再判断篡改,并由轻量分割模型定位区域。多数据集结果显示其检测准确率和eff-IoU平均优于多种2025年基线,定位mIoU也保持前二,说明弱监督RL可提升VLM对AI编辑痕迹的可解释检测能力。

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding Figure 1
2026-07-31cs.CV

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

Haiyue Zhang, Yi Bin, Xun Jiang, Zeyu Ma, Duo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

are with Tongji University, Shanghai, China.

2026-07-31视觉感知

长视频理解受视觉 token 与上下文窗口限制,固定或纯相关性采样容易漏掉关键证据或产生冗余。VisualRouter 的核心洞察是按问题所需证据将查询路由为全局或局部:前者混合相关性与时间覆盖,后者按事件分段分配并去冗余选帧。实验在 Video-MME、LongVideoBench、MLVU 上相对均匀采样分别提升 5.2%、7.7%、11.6%,但增益主要依赖查询分类与采样启发式的稳健性。

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA Figure 1
2026-07-31cs.CV

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

2026-07-31三维

这篇论文针对机器人三维问答依赖昂贵3D标注、专用训练和完整重建的问题,提出 ViewMind3D:用问题驱动视角筛选、语言引导目标框、BEV相机位姿提示和角色化推理,把通用LLM/VLM组织成免训练的多视角3D推理流程。在 ScanQA 与 SQA3D 上,其零样本表现接近或超过部分训练式3D-LLM,ScanQA 达 73.4 CIDEr,SQA3D 总准确率 50.8%,空间相关问题收益更明显。

Kohn-Sham Spectral Embedding on Sparse Graphs at the Nishimori Temperature for Image Classification Figure 1
2026-07-31cs.LG

Kohn-Sham Spectral Embedding on Sparse Graphs at the Nishimori Temperature for Image Classification

V.S. Usatyuk, D. A. Sapozhnikov, S. I. Egorov

Department of Computer Engineering, South-West State University, T8 LLC, Research and Development Department

2026-07-31视觉感知

论文动机是降低大规模图像分类中顶层全连接分类器的参数与计算负担。作者将冻结CNN特征映射到稀疏QC-LDPC图,在Nishimori温度下用Kohn-Sham式谱嵌入和星域手术控制受挫环。ImageNet-1000报告88.93% Top-1、约21.24M参数,但采用传导式评估,和标准归纳模型对比的增益来源不清。

Negative controls reveal volume-driven confounding in radiomics and imaging foundation model features Figure 1
2026-07-31cs.CV

Negative controls reveal volume-driven confounding in radiomics and imaging foundation model features

Katy L. Scott, Sejin Kim, Joshua Siraj, Caryn Geady, Matthew Boccalon, Mattea Welch, Mogtaba Alim, Andrew J. Hope, Benjamin Haibe-Kains

Princess Margaret Cancer Centre, University Health Network

2026-07-31规划控制

这篇论文关注放射组学和影像基础模型中常被忽视的体积混杂:看似预测肿瘤生物学的特征,可能只是肿瘤大小或背景信息的代理。作者提出 READII-2-ROQC,用保持体积不变的负控扰动破坏空间纹理,并在三套癌症影像队列上检验 PyRadiomics 与 FMCIB 特征。结果显示,多种已发表生存模型在纹理被打乱后仍保持性能,提示主要由体积或上下文驱动;部分 HPV 预测信号则对扰动敏感,可能含有更真实的边界或瘤周信息。

QQWorld: Quantile-Quantile Matching for World Model Regularization Figure 1
2026-07-31cs.LG

QQWorld: Quantile-Quantile Matching for World Model Regularization

Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

Xi’an Jiaotong University

2026-07-31强化学习

QQWorld针对潜在世界模型中EP正则虽约束高斯性、却对尾部样本梯度迅速消失的问题,指出重尾潜变量会放大多步规划误差。其用分位数-分位数匹配直接对齐投影潜变量与高斯分位数,并引入跨批次排序池改善估计。实验显示,在四个控制环境中相较LeWM提升平均规划成功率,同时降低QQ误差并显著削薄潜变量尾部。

Large scale cross-regional remote sensing flood monitoring framework for operative mapping and impact analysis Figure 1
2026-07-31cs.CV

Large scale cross-regional remote sensing flood monitoring framework for operative mapping and impact analysis

Ilya Novikov, Svetlana Illarionova, Ruslan Dzharkinov, Maria Smirnova, Ayrat Abdullin, Anna Korotkova, Mariia Ulianova, Dmitrii Shadrin, Evgeny Burnaev

2026-07-31视觉感知

针对大范围、跨气候区洪水监测中标注稀缺、区域泛化差和地面观测不足的问题,本文构建融合 SAR、多光谱、水体指数与 DEM 派生特征的 21 通道端到端框架,并比较监督 U-Net++ 与自监督 AnySat。七个俄罗斯区域验证显示,多模态 U-Net++ 平均 F1 为 0.84±0.11,效果优于 AnySat;后者稳定性更好。基于预测洪水范围的灾损评估在 2019 Tulun 洪水上总体接近官方结果,但物质损失受开源数据限制。

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer Figure 1
2026-07-31cs.CV

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen

2026-07-31三维

这篇综述针对手-物交互中形状、空间、物理、语义和动态不确定性难以统一建模的问题,提出以基础模型“先验”而非仅按任务划分文献:将HOI归为三类重建和三类生成任务,并把先验细分为几何、语义、视觉三大类八种子先验。主要结果是给出这些先验进入HOI流程、缓解何种不确定性的系统映射,并进一步梳理其在机器人预训练、技能迁移和数据生成中的作用;定量增益并非本文重点,文中未充分说明。

Explaining Image Similarity with Automatically Extracted Concept Activation Vectors Figure 1
2026-07-31cs.CV

Explaining Image Similarity with Automatically Extracted Concept Activation Vectors

Isaac Roberts, Petra Bevandic, Alexander Schulz, Barbara Hammer

2026-07-31视觉感知

本文针对图像检索、人脸识别等任务中“相似为何成立”难以解释的问题,提出用稀疏自编码器自动抽取概念激活向量,并在嵌入空间沿概念方向扰动来估计各概念对相似度的贡献,同时扩展到图像对定位、群组解释和样例检索。实验显示,潜空间扰动比像素遮挡更接近数据分布,概念重要性可线性恢复相似度分数,定性结果也支持其解释模型个体与群组相似判断的有效性。

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow Figure 1
2026-07-31cs.CV

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow

Jin Cao, Zian Meng, Kaipeng Zhang

Alaya Lab, Shanghai Innovation Institute

2026-07-31视觉感知强化学习

这篇论文针对交互式视频世界模型难以同时获得精确动作控制与跨场景泛化的问题,提出用“同一动态、不同外观”的 shadow pairs 来分离动态与外观,并通过 cross-shadow prediction 学到统一的动作潜表示,使演示视频可作为可复用动作资产。实验覆盖人物、相机、游戏和机器人等动态族,在动作迁移和长时 rollout 中优于潜动作及交互式世界模型基线,盲评平均胜率为 86%。

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models Figure 1
2026-07-31cs.CV

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, School of Information Engineering, Xiamen Ocean Vocational College, Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University Xiamen Fujian China, School of Information Engineering, Xiamen Ocean Vocational College Xiamen Fujian China

2026-07-31视觉语言

针对多模态大模型中视觉 token 数量大、静态 Top-k 剪枝易在浅层误删深层推理所需线索的问题,论文提出 Trend-aware Pruning,将剪枝视为跨层注意力趋势建模:收集历史注意力流,识别上升、波动、下降趋势,并可重新激活“后发重要”的 token。实验显示在多种 MLLM 和任务上能保留约 98.89% 平均性能、FLOPs 降至 55.10%,最终层约保留 23 个视觉 token。

Same Branches, Different Trees: A Bifurcation Connectedness Metric for Coronary Artery Segmentation and FFR-CT Decision Agreement Figure 1
2026-07-31cs.CV

Same Branches, Different Trees: A Bifurcation Connectedness Metric for Coronary Artery Segmentation and FFR-CT Decision Agreement

Maame Owusu-Ansah, Kelvin Lee, Dr Vinod Venugopal, Muhammad Moazzam Jawaid, Wenting Duan, James Brown

2026-07-31视觉感知

面向FFR-CT依赖血管树连通性的场景,论文指出Dice等重叠指标会漏掉冠脉分叉断裂这类可改变治疗决策的错误,提出/系统评估分叉连通性指标BCS及soft-BCS。结果显示BCS与标准指标相对独立,能区分断裂与单纯变细,并在重度病变中更好对应预测几何与真值几何的FFR-CT决策一致性;但文中也说明其反映的是几何保真而非临床FFR准确性。

AdaAnchor4D: Anchor-Conditioned Spatiotemporal Feature Aggregation for Monocular UAV 4D Reconstruction Figure 1
2026-07-31cs.CV

AdaAnchor4D: Anchor-Conditioned Spatiotemporal Feature Aggregation for Monocular UAV 4D Reconstruction

Peiyi Xu, Junpeng Zhang, Guanbin Li, Ronghua Shang, Mingtao Feng, Le Dong, Weisheng Dong, Guangming Shi, Jie Feng

2026-07-31三维

这篇论文面向单目无人机视频中的动态城市重建,动机是现有动态高斯方法用固定规则聚合共享时空特征,难以适应不同区域和时刻的运动差异,易产生重影和模糊。AdaAnchor4D以锚点为局部动态单元,通过ACFA按锚点嵌入和时间自适应重加权时空特征,并用DLGD解耦锚点状态与局部几何变形、DACW缓解非均匀锚点分布与均匀网格的失配。实验在UAV-Arc4D、VisDrone和UAVDT上显示其提升渲染质量,同时保持实时渲染和紧凑表示。

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding Figure 1
2026-07-31cs.CV

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

2026-07-31视觉感知

面向流式视频问答,模型需在问题未知时保留长期视觉证据,而现有记忆多按 token、时间冗余或片段压缩,难以追踪持续变化的物体。ObjectStream 的核心洞察是把冻结 Video-LLM 表征中涌现的潜在物体作为记忆锚点,跨帧关联并结合物体变化残差和近期窗口,无需训练或外部检测器。实验显示其在 OVO-Bench 实时感知上提升 Qwen2.5-VL-7B 10.0 分,同时约减半显存和 TTFT,离线长视频中丢弃 82.5% 视觉 token 仍超过全 token 基线。

MonoVoc: Decoupling Geometry and Semantics for Lightweight Monocular Open-Vocabulary 3D Gaussians Figure 1
2026-07-31cs.CV

MonoVoc: Decoupling Geometry and Semantics for Lightweight Monocular Open-Vocabulary 3D Gaussians

Pouya Ardekhani, Zahra Dehghanian, Morteza Abolghasemi, Hamid R. Rabiee

Sharif University of Technology, Tehran, Iran

2026-07-31三维

MonoVoc针对单目视频构建开放词汇3D高斯地图时语义特征存储大、需多视角或场景级优化的问题,将几何重建与语义接入解耦:先用HI-SLAM2生成固定高斯几何,再通过语义颜色去混合、调色板量化和对象级嵌入建立可查询语义地图。Replica实验显示其保持较好渲染质量和有竞争力的分割精度,同时相比现有方法显著降低内存占用。

Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras Figure 1
2026-07-31cs.CV

Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras

Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani, Rodolfo Zunino, Paolo Gastaldo

2026-07-31视觉感知

面向可穿戴机器人中受功耗、体积和实时性限制的可供性分割,论文关注如何有效利用 RGB-D 而非简单拼接深度信息。核心做法是为嵌入式设备重构硬件感知 NAS 搜索空间,并提供将预训练 RGB 网络扩展到深度输入的微调方案。实验在 UMD 和 IIT 数据集上显示,所得模型多数位于性能与模型规模、FLOPs 的 Pareto 前沿,并在 Jetson Nano 与 RealSense 原型上实现实时推理。

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3 Figure 1
2026-07-31cs.AI

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

Jens Lehmann, Andrei Aioanei, Sahar Vahdati

Dresden University of Technology, TIB – Leibniz Information Centre for Science and Technology, Leibniz University of Hannover

2026-07-31强化学习

论文针对 ARC-AGI-3 中“边探索边省动作”的技能获取问题,提出 Tycho:把交互历史转化为可执行、可验证、可修复的程序化世界模型,并由策略决定何时建模、委托、修复或绕过模型。结果显示,委托式建模优于直接推理和自动修复;在所选策略下 GPT-5.6 Sol 与 Opus 5 均完成 25 个公开游戏,达到 100 RHAE,说明模型准确性本身不等于更好行动决策。

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions Figure 1
2026-07-31cs.CV

Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions

Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao

School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology Wuhan China

2026-07-31视觉语言安全鲁棒

单目深度在玻璃、镜面、雨夜等场景中容易受纹理和可见性歧义影响,现有鲁棒方法多按场景分别增强。本文的核心洞察是用包含空间关系的长文本描述补足视觉线索,提出 CapDepth:以长 caption 模板、动态文本编码器和文本自适应解码器引导深度预测。实验称其在非朗伯表面和恶劣天气下分别降低 25.0% 与 22.0% 深度误差。

MSCM-net: A hyperspectral image classiffcation method based on multi-scale convolution and Mamba Figure 1
2026-07-31cs.CV

MSCM-net: A hyperspectral image classiffcation method based on multi-scale convolution and Mamba

Jianjun Chen, Linlin Wang, Lifang Chang, Limin Huo, Shujiang Song, Yanjia Zhao, Mingwei Shao

2026-07-31视觉感知

针对高光谱分类中 CNN 难以建模长程依赖、Transformer 计算开销较高的问题,MSCM-net 将多尺度卷积与 Mamba 串联:MCSE 用不同卷积核和 SENet 融合局部光谱-空间特征,Mamba 建模中心像素与邻域序列关系,并以双分支聚合中心与全局信息。文中在 Indian Pines、WHU-Hi-HongHu 和 Salinas 上报告了更高分类性能和较低计算成本,但具体增益仍可能受模块组合与实验设置共同影响。

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation Figure 1
2026-07-31cs.CV

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini

2026-07-31视觉语言数据集/基准

面向灾害响应中的多模态蒸馏,论文针对 Incidents1M 缺少文本、现有危机数据图文错配的问题,构建了从10万张图像生成20万条描述的流程,并用图像盲的 Qwen3.5-9B 作为 LLM-as-a-Judge 验证文本是否保留灾害语义。结果显示两种 Qwen3.5 标注架构语义一致性为78.65/100,生成描述呈高精度77.6%、低召回46.0%的保守特征,同时暴露原始人工标签不一致。

TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting Figure 1
2026-07-31cs.CV

TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting

Jiwen Liu, Shujuan Li, Xiaohan Li, Zijie Meng, Xinyue Liu, Yulong Xu, Yan Zhou, Guoxin Zhang

2026-07-31视觉感知三维

针对视频重拍依赖3D重建或稀缺成对轨迹数据、难以处理大幅视角变化的问题,TARS从扩散模型时间步敏感性出发,指出高噪声阶段主要决定相机运动与粗结构,并用大规模自监督数据结合文本视角与相机条件训练,减少对3D和成对数据的依赖。实验显示其在相机控制精度、时间一致性和一三人称/反打等语义视角变换上优于既有方法,但增益可能主要来自 scaling / data。

Space2Ground 2.0: A Multi-Source Dataset and Framework for Agricultural Monitoring through Fusion of Street-Level and Satellite Imagery Figure 1
2026-07-31cs.CV

Space2Ground 2.0: A Multi-Source Dataset and Framework for Agricultural Monitoring through Fusion of Street-Level and Satellite Imagery

Iason Tsardanidis, Alkiviadis Koukos, George Choumos, Vasileios Sitokontantinou, Charalampos Kontoes

Operational Unit BEYOND Centre, IAASARS, National Observatory of Athens, Athens, Greece

2026-07-31视觉感知数据集/基准

该文针对仅靠卫星遥感难以进行地块级农业监测、且光学影像受云遮挡影响的问题,提出 Space2Ground 2.0,将 Sentinel-1/2 时序与 Mapillary 街景通过语义过滤、质量评估和视角-地块关联自动整理成多源数据集。其在塞浦路斯从90多万张图像中筛出46,050张,关联8,581个地块;作物分类实验显示,街景与卫星融合可提供细粒度互补信息并提升分类表现。

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE Figure 1
2026-07-31cs.CV

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang

Shanghai Jiao Tong University, Tianji KernalMind Co., Ltd., The Hong Kong University of Science and Technology, Southeast University, Renmin University of China, The University of Tokyo

2026-07-31强化学习三维

EgoGenesis针对具身操作中真实第一视角视频-动作数据昂贵且现有生成器易出现相机、物体和末端执行器漂移的问题,提出保持首帧三维场景锚点并在线刷新状态的OAPM,以及把相机感知三维动作坐标注入交叉注意力的A3D-RoPE。实验显示,用400条生成轨迹增强400条真实轨迹后,真实机器人OOD成功率单臂从77%升至84%,双臂从53%升至70%。

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents Figure 1
2026-07-31cs.AI

Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents

Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi

2026-07-31强化学习

论文针对GUI智能体从仿真基准走向真实设备时的可靠性、长程任务和跨平台协作不足,提出Qwen-UI-Agent:以百台级真实手机环境、多域执行框架、GUI+CLI统一动作和批量动作、长轨迹在线强化学习及AutoResearch式数据飞轮支撑能力迭代。结果显示其在MobileWorld、MobileWorld-Real、AndroidDaily上达82.1%、92.2%、97.5%,桌面与浏览器任务也接近前沿模型;但具体增益来源可能主要来自scaling / data,消融贡献仍需细看。

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification Figure 1
2026-07-31cs.CV

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

Peking University

2026-07-31视觉感知

FaithEyes针对智能体VLM“会调用工具但未必使用到有效视觉证据”的问题,指出现有奖励和工具反馈都不区分过程图像是否有用。其核心做法是让模型以子智能体自评每次工具调用的帮助性,并将判断同时写入后续上下文和工具奖励。经SFT+RL训练后,论文称其在视觉感知与推理基准上达到相当或更优准确率,并显著提升工具使用忠实性。

Scaling Vision-Language Models Is Not Enough to Mitigate Bias Figure 1
2026-07-31cs.CV

Scaling Vision-Language Models Is Not Enough to Mitigate Bias

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

Information Technologies Institute, CERTH, Information Technologies Institute, CERTH Thessaloniki Greece

2026-07-31视觉语言视觉感知

这篇论文针对视觉语言模型常按总体准确率和规模选型、却可能继承网络数据伪相关偏差的问题,系统评估194个公开VLM在ImageNet、CelebA和UrbanCars上的零样本表现。核心洞察是偏差越复杂,模型规模越不能预测稳健性:规模相关性从ImageNet的0.68降至多属性偏差的0.05,受控比较中放大模型还使UrbanCars最差组准确率平均下降4.2%;相比之下,训练数据规模与清洗质量更稳定,精 curated 数据在同规模下最高带来25% WGA提升。

UniCross: Unified Cross-Skill Dexterous Manipulation Synthesis Figure 1
2026-07-31cs.RO

UniCross: Unified Cross-Skill Dexterous Manipulation Synthesis

Hui Zhang, Julian Ferchow, Jie Song, Mirko Meboldt

2026-07-31机器人

这篇论文针对灵巧手操作中抓取、搬移、手内旋转和平移长期被分开建模、难以连续组合的问题,提出以手-物体相对运动为核心的统一任务表述,共享状态、动作空间和目标结构,并用手中心物体表示蒸馏单一跨技能策略。实验显示,该策略在四类技能上保持较高成功率,能串接长时序操作,并对未见物体、外力扰动和不同手形态有较好泛化。

Think with Extra-Image: A Farmland Segmentation Agent Driven by Spatio-Temporal Information Gain Figure 1
2026-07-31cs.CV

Think with Extra-Image: A Farmland Segmentation Agent Driven by Spatio-Temporal Information Gain

Haiyang Wu, Weiliang Mu, Zhuofei Du, Dandan Zhong, Kaijie Shi, Haifeng Li, Chao Tao

2026-07-31视觉感知

这篇论文认为农田遥感分割的瓶颈不只是模型表征,而是单幅图像缺少物候变化和空间上下文证据;提出“Think with Extra-Image”范式和 FarmSeeker 代理,在不确定区域按需查询跨时空信息并细化掩码。作者还构建 FM-Seg69K 与 GSFS-Bench,实验显示其在多区域和歧义场景下比现有方法更稳定,但具体性能增益来源仍可能受数据与训练规模影响。

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image Figure 1
2026-07-31cs.CV

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image

Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo

KAIST UVR Lab

2026-07-31视觉感知生成模型三维

面向 VR/AR 中单图生成可控、三维一致头部头像的需求,S-Avatar 先用扩散模型生成高分辨率 3D Gaussian Splatting 规范头像,再将 FLAME 拟合到 splats 并通过绑定模板驱动表情变形。论文称其在公开数据集的新视角与表情生成上优于现有方法,尤其改善侧后方等未见视角的真实感和一致性。

OPLD: On-Policy Latent Distillation for Multimodal Reasoning Figure 1
2026-07-31cs.CV

OPLD: On-Policy Latent Distillation for Multimodal Reasoning

Shoutai Zhu, Tianyang Xu, Bin Sun, Mingyuan Xu, Yu Liu, Qinzhen Guo

2026-07-31视觉语言强化学习

OPLD针对多模态视觉推理中显式CoT、工具调用或特征级潜变量对齐带来的训练推理不一致和抽象推理不足问题,提出在策略上教师-学生潜变量蒸馏:学生先按当前策略生成潜在推理轨迹,具备特权多模态CoT的教师再进行token分布监督与潜轨迹对齐。实验称其在多类多模态基准上优于现有潜推理方法,并在多个任务达到SOTA。

What Makes Deep Learning Work for Traditional Chinese Medicine Tongue Diagnosis? A Comprehensive Ablation Study Figure 1
2026-07-31cs.CV

What Makes Deep Learning Work for Traditional Chinese Medicine Tongue Diagnosis? A Comprehensive Ablation Study

Longxia Gao, Linan Wang, Yuhe Han, Junze Geng, Meng Zhang, Hanqing Zhao

College of Traditional Chinese Medicine, Hebei University, Baoding, Hebei, China

2026-07-31视觉感知

论文针对中医舌诊深度学习研究常停留在小数据、单模型验证的问题,系统消融骨干、损失、增强、训练策略与标签设计。核心洞察是简单而匹配任务的配置更关键:ConvNeXt-Tiny、带正类权重的 BCE、克制颜色增强和弱组集成表现更稳。976 样本最佳 weighted-F1 为 0.6625,扩展到 11101 样本升至 0.7761,而细化到 45 类标签会崩至 0.22,增益可能主要来自 scaling / data。

ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate Figure 1
2026-07-31eess.IV

ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate

Zheyuan Zhang, Johnson Wu

2026-07-31视觉感知生成模型

ReGenVC面向弱带宽下传统x264/x265在极低码率会严重块效应的说话人视频场景,将首帧、姿态关键点和元数据作为码流,并用四步蒸馏扩散Transformer重建视频;其关键不在通用压缩,而在通过8卡序列并行、空间切分VAE和重叠流水线把生成式解码推到实时。文中报告77帧约26kB、约为无明显伪影x264/x265的十分之一,并在8 GPU节点上达到24fps,但评测主要集中在少量说话人片段。

Convolutional Neural Shading for High-Quality 3D Reconstruction from Multi-View Images Figure 1
2026-07-31cs.CV

Convolutional Neural Shading for High-Quality 3D Reconstruction from Multi-View Images

Juheon Hwang, Taewan Kim, Heeseok Oh, Jiwoo Kang

Department of Electrical and Electronic Engineering, Yonsei, University, Seoul, 03722, South Korea., Data Science Major, Dongduk Women’s University, Seoul, 02748, South, Department of Applied AI, Hansung University, Seoul, 02876, South, University, Seoul, 04310, South Korea., ing industries [1–3]. Traditionally, creating 3D content requires laborious manual work, labor with 3D reconstruction techniques using multi-view images. In past years, 3D

2026-07-31视觉感知三维

这篇论文针对多视图三维重建中仅依赖单点位置、法线和视角会丢失邻域几何关系的问题,尤其关注暗区、无纹理区域和图像边界处的细节缺失与表面断裂。核心做法是用卷积神经着色器建模局部空间上下文,并加入细节位移网络在渲染坐标中学习位置和法线的邻域相关位移。实验显示,CNS 相比 Neuralangelo 等方法在重建形状细节和渲染质量上有明显提升。

Collaborative Feature Aggregation for Face Super-Resolution and Robust Re-Identification Figure 1
2026-07-31cs.CV

Collaborative Feature Aggregation for Face Super-Resolution and Robust Re-Identification

Juheon Hwang, Taewan Kim, Jiwoo Kang

Collaborative Feature Aggregation for Face, Department of Electrical and Electronic Engineering, Yonsei, University, Seoul, 03722, South Korea., Data Science Major, Dongduk Women’s University, Seoul, 02748, South, University, Seoul, 04310, South Korea., We propose a novel collaborative approach for face super-resolution (SR), across time or viewpoints, by introducing a transformer-based collaborative fea-, Therefore, we address these issues by introducing a novel collaborative face, a transformer-based collaborative identity aggregation to fully utilize face video, For collaborative identity

2026-07-31安全鲁棒

这篇论文针对监控等场景中低分辨率人脸超分容易模糊、失真并影响重识别的问题,提出利用同一人的多帧或多视角人脸进行协同特征聚合。方法以共享身份编码器和 Transformer 自注意力融合跨图像身份线索,再将统一身份先验注入级联超分网络逐步恢复细节。实验称其在超分质量和重识别性能上均优于现有方法,但具体增益来源与数据规模影响仍需结合完整实验进一步判断。

Face and Voice Cross-modal Association with Learning Convex Feature Embedding Figure 1
2026-07-31cs.CV

Face and Voice Cross-modal Association with Learning Convex Feature Embedding

Taewan Kim, Jiwoo Kang

Data Science Major, Dongduk Women’s University, Seoul, 02748, South, University, Seoul, 04310, South Korea., been approached as classification problems, where common labels are used to establish, the presence of shared labels. Furthermore, there are limitations in the ability to learn, same label. It is insufficient to fully consider the differences between audio and video.

2026-07-31优化算法

本文针对人脸-声音关联中跨模态特征差异大、易产生误匹配的问题,提出用同一身份的人脸与语音嵌入生成可学习的凸组合中间特征,并结合跨模态注意力,将两种模态拉向身份相关的凸区域。作者在 VoxCeleb 上验证了检验、匹配和检索任务,相比既有方法取得更好结果,但具体增益中各组件贡献仍需看消融细节。

Towards Practical Algorithm Selection for Unsupervised Domain Adaptation in Medical Imaging Figure 1
2026-07-31cs.CV

Towards Practical Algorithm Selection for Unsupervised Domain Adaptation in Medical Imaging

Yiheng Xiong, Luisa Gallée, Daniel Santak Wolf, Heiko Hillenhagen, Michael Götz

2026-07-31视觉感知

这篇论文关注医学影像 UDA 落地时无法用目标域标签选择算法和超参数的问题。核心做法是用多个无标签验证器先在各算法内提名模型,再跨算法聚合预测形成一致性参考,选择最匹配的候选。实验覆盖脑 MRI 与胸片七个迁移场景,平均准确率 86.3%,优于最佳单一验证器 81.0%,并将相对 Oracle 的差距约减半。

mmRadarTwin: A Measurement-Calibrated Signal-Level Digital Twin Platform for Indoor mmWave Radar Figure 1
2026-07-31cs.CV

mmRadarTwin: A Measurement-Calibrated Signal-Level Digital Twin Platform for Indoor mmWave Radar

Jianyi Zhou, Chenghao Zhang, Yanli Li, Dong Yuan

The University of Sydney, The University of Sydney Sydney NSW Australia

2026-07-31视觉感知

室内毫米波雷达受多径、材料和硬件处理影响,真实量测难复现,限制感知模型的数据扩展与诊断。mmRadarTwin将UE5场景仿真与真实FMCW雷达接到同一接收通道和距离-角度处理域,并保留路径级归因以区分材料、几何和未建模机制误差。在办公室154个位姿实验中,物理路径仿真召回中央视场70.8%的几何支撑响应区域,但仍暴露弱路径、位移和缺失物理机制等残差。

GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios Figure 1
2026-07-31cs.LG

GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios

Yiming Xu, Jihua Kang, Chunsai Du, Qifan Zhang, Wangqiu Zhou, Yiting Wu, Tianqi Li, Qi Song

University of Science and Technology of China, ByteDance Inc., Hefei University of Technology, University of Science and Technology of China Hefei Anhui China, ByteDance Inc. Shanghai China, Hefei University of Technology Hefei Anhui China

2026-07-31视觉感知

本文面向长文档与会议纪要难以快速转化为清晰图示的问题,提出 GVR-Coder:先构建 DocMeetSVG-100K 数据集,再用课程式拒绝采样、布局约束知识、双渲染奖励强化学习和生成-验证-修复闭环,让模型同时关注 SVG 代码结构与渲染效果。实验显示其在自动指标和人工评估中优于基线,生成图在语义一致性、结构复杂度和视觉美观度上更稳。

BladeYOLO: Wind Turbine Blade Defect Detection with Limited Annotations and Weak-Saliency Awareness Figure 1
2026-07-31cs.CV

BladeYOLO: Wind Turbine Blade Defect Detection with Limited Annotations and Weak-Saliency Awareness

Yabin Xu, Fangtao Zhang, Fan Wang, Zhan Wang, Honghua Chen, Mingqiang Wei, Haoran Xie, Sam Kwong

2026-07-31视觉感知

针对风机叶片缺陷在现场标注稀缺、目标小且低对比、易受雾霾和光照影响的问题,BladeYOLO在YOLOv12-L中引入DINOv3初始化的ViT骨干,并用Mamba弱缺陷增强与傅里叶风格注入强化细节和环境适应性。实验称其在WTBlade-Defect和公共Wind Surface Defect上优于现有方法,后者mAP50提升3.5%、mAP50-95提升2.5%,但具体增益中预训练与结构改动的相对贡献仍需看消融。

Landmark shape spaces with induced metrics Figure 1
2026-07-31cs.CV

Landmark shape spaces with induced metrics

Sarang Joshi, Peter W. Michor, Stefan Sommer

2026-07-31视觉感知

这篇论文针对传统 Kendall 形状空间可能出现标志点碰撞、且度量依赖标志点数量,而 LDDMM 又缺少统一去除全局刚体运动与固定尺度机制的问题,提出以 screened elasticity operator 构造的新型标志形状空间。核心洞察是让算子零空间精确等于无穷小刚体运动,使度量可从微分同胚群下降,同时保留局部刚体变形、去除全局刚体运动并固定尺度。文中给出相应核、商空间几何、匹配与测地线数值方案,主要结果是统一两类形状分析框架并展示蝴蝶等标志匹配示例。

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion Figure 1
2026-07-31cs.CV

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

Tsinghua University, Sun Yat-sen University

2026-07-31视觉感知生成模型优化算法

这篇论文针对文生视频扩散模型中短时闪烁、运动崩塌等稀疏时间伪影,指出现有 DPO 依赖人工偏好或奖励模型且监督在时间上分配不准。作者提出 cIPO:从真实视频加噪再由当前模型去噪重建,把原视频与重建偏差构造成隐式偏好,并只集中优化高重建误差片段。实验显示该方法在多个数据集上提升视频真实感和时间一致性,但具体增益与基线规模、数据设置的关系仍需细看。

TSOG: A Format For Temporally And Spatially Ordered Gaussians Figure 1
2026-07-31eess.IV

TSOG: A Format For Temporally And Spatially Ordered Gaussians

Shady Gmira, Evangelos Alexiou, Emmanouil Potetsianakis, Emmanuel Thomas

2026-07-31三维

面向4D Gaussian Splatting在动态场景中存储、传输和互操作成本高的问题,TSOG把SOG的空间有序索引扩展到时间维,引入每个高斯的生命周期timeline及几何、外观的时间参数化,并继续用索引对齐图像编码属性。实验相对PLY序列和FreeTimeGS压缩文件体积超过90%,PSNR变化约为-0.42至+0.85 dB,表明质量损失较小。

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment Figure 1
2026-07-31cs.CV

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

2026-07-31视觉感知

论文针对现有人脸重演在说话和夸张表情中忽略舌头、导致口腔区域不自然的问题,提出将舌头合成从普通修复中分离出来,并用面部几何动态锚定。方法先借助 SAM 与人脸解析自举训练舌头分割器,再以 FLAME/高斯重演结果约束潜空间遮罩扩散,并用自适应 mask 扩张改善边界过渡。实验称在 VFHQ 上各类舌头专用指标均超过基线两倍以上,VLM 评测也支持感知质量提升。

Split and Drive: Dual-Axis Disentanglement for Real-Time Gaussian Head Avatars Figure 1
2026-07-31cs.CV

Split and Drive: Dual-Axis Disentanglement for Real-Time Gaussian Head Avatars

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

2026-07-31三维

这篇论文针对单图生成可动画 3D 头部 Gaussian avatar 时真实实时性不足的问题:既有方法常把人脸跟踪延迟排除在推理外,又用统一表示混合不同面部区域。SpiD 的核心是在计算轴内置轻量运动编码器、端到端学习驱动参数,并在特征轴拆成动态头部、静态外观和口腔内部三类 Gaussian 分支。实验称其在包含完整驱动流程的单 GPU 设置下达到最快推理速度,并保持与主流方法竞争的渲染质量。

MUL-T: Decoding Spatial Cellular Architecture in Multiplexed Tissue Images Figure 1
2026-07-31cs.AI

MUL-T: Decoding Spatial Cellular Architecture in Multiplexed Tissue Images

Farzaneh Seyedshahi, Kai Rakovic, Adalberto Claudio Quiros, John LeQuesne, Ke Yuan

2026-07-31视觉感知

多重组织成像需要同时刻画细胞表型与空间关系,传统手工特征、袋式细胞统计和图模型在异质面板与大规模样本上泛化或计算受限。MUL-T将分割细胞离散化为“细胞 token”,用轻量 Transformer做掩码上下文预测,并以CLS表征组织结构。实验覆盖肿瘤模式、分级、PD-L1和跨数据集疗效预测,整体优于经典特征基线,接近大型ViT但参数和训练成本更低。

ENCORE: Event-Assisted Complementary Motion Refinement for Learned Video Compression Figure 1
2026-07-31cs.CV

ENCORE: Event-Assisted Complementary Motion Refinement for Learned Video Compression

Shuhan Ye, Hongbin Yu, Chenqi Kong, Pingchuan Ma, Chong Wang, Jun Wan, Qixin Zhang

Shuhan Ye and Qixin Zhang are with the School of Computer Science, Hongbin Yu and Chong Wang are with the School of Artificial Intelligence

2026-07-31视觉感知

ENCORE针对RGB帧离散采样导致的快速运动、模糊、遮挡和低照度下运动估计不稳问题,引入事件相机作为仅用于运动建模的辅助模态,而不编码重建事件流。其核心是将RGB-事件特征分解为共享与特有运动,再筛选相对RGB活跃且新颖的事件证据,并按能量路由修正光流。实验在BS-ERGB、HQ-EVFI和CED上均提升压缩率失真表现,BS-ERGB最高报告20.80% PSNR-RGB和22.14% MS-SSIM-RGB BD-rate节省。

Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic Figures Figure 1
2026-07-31cs.CV

Beyond Classification: Pathology Foundation Models as Detection Encoders for Mitotic Figures

Sweta Banerjee, Alireza Teimoury, Nils Porsche, Alexandra K. Stoll, Viktoria Weiss, Niklas Hargarter, Jonas Ammeling, Thomas Conrad, Christoph Stroblberger, Christopher Kaltnecker, Robert Klopfleisch, Christof A. Bertram, Katharina Breininger, Marc Aubreville

2026-07-31视觉感知

这篇论文关注病理基础模型是否不只适合有丝分裂象分类,也能提供足够空间分辨率用于密集检测。作者将冻结的 UNI、Virchow、H-Optimus 等 ViT 编码器接入 RetinaNet、Faster R-CNN 和 Deformable DETR,并与端到端 ResNet50 对比;结果显示 H-optimus-0、Virchow 具备竞争力,OOD 测试上可能更稳健,但增益来源仍不完全清楚。

Deep learning-based hierarchical insect classification using camera trap imagery Figure 1
2026-07-31cs.CV

Deep learning-based hierarchical insect classification using camera trap imagery

Zaki Mahfoud, Juan A. Chiavassa, Simon Walther, Florian Haselbeck, Ehsan Yaghoubi

a Weihenstephan-Triesdorf University of Applied Sciences, Department of Sustainable, b Weihenstephan-Triesdorf University of Applied Sciences, Institute for Biomass Research, c Weihenstephan-Triesdorf University of Applied Sciences, Department of Sustainable, - Hierarchy maximises use of partially-labelled data, minimises unclassified samples.

2026-07-31视觉感知

针对昆虫多样性监测依赖专家、数据长尾且标注粒度不一的问题,论文构建约百万张相机陷阱昆虫图像的五层34类数据集,并将分类器改为利用生物分类层级、带类别均衡权重和置信阈值的层级预测;在测试集五个层级达到80%至99%准确率,对部分类别稀有和相似昆虫也能保持较好区分,但低分辨率、小样本异质类仍是主要限制。

ViP-Rig: Visual-Prompted Controllable Rigging Figure 1
2026-07-31cs.CV

ViP-Rig: Visual-Prompted Controllable Rigging

Zihan Qin, Mingze Sun, Yifan Mao, Jialei Xu, Jingfeng Guo, Changrong Hu, Wenbo Zhao, Junjun Jiang, Xianming Liu

2026-07-31规划控制

ViP-Rig针对自动绑定只能从几何生成“合理”骨架、难以满足具体动画任务的问题,把用户在渲染图上的2D骨架草图和刚性区域图转成紧凑视觉提示,并通过适配器注入冻结的骨架生成与蒙皮预测骨干,从而同时控制关节布局、分支和局部变形行为。在Articulation-XL2.0及ModelsResource零样本评测中,它比几何条件基线更接近目标骨架和蒙皮权重,定性结果也显示可做局部编辑。

Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting Figure 1
2026-07-31cs.CV

Now You Have My Healthy Attention: A U-DiT for Brain-MRI Inpainting

Danilo Danese, Angela Lombardi, Tommaso Di Noia

2026-07-31视觉感知

本文面向 BraTS 脑 MRI 肿瘤区域健康组织补全,动机是为配准、分割等下游分析提供患者特异的无病灶参考。方法采用 U-DiT 式 3D 编码器-解码器,在低分辨率 token 上做全局注意力,并限制空洞 token 只读取已知健康区域,同时引入对侧半球镜像作为先验。官方验证集 219 例上达到 SSIM 0.864、PSNR 24.7 dB、MSE 4.6e-3,但作者也指出回归式优化会带来纹理平滑,真实感与失真指标仍有张力。

FootprintNet: State-Transition-Guided Dynamic Footprint Learning for Multi-temporal Remote Sensing Change Detection Figure 1
2026-07-31cs.CV

FootprintNet: State-Transition-Guided Dynamic Footprint Learning for Multi-temporal Remote Sensing Change Detection

Haotian Zhang, Hao Chen, Han Guo, Zhengxia Zou, Zhenwei Shi

Beihang University 1 , Shanghai Artificial Intelligence Laboratory 2

2026-07-31视觉感知

针对多时相遥感变化检测常把每个位置简化为一次最终变化、难以刻画建筑反复建设/拆除的问题,论文提出 UBDD 任务与 FootprintNet,用状态-动作转移约束、非对称时间边界对比和时空状态空间扫描学习动态足迹,并给出 BCDS 评价时间语义偏移。在 TSCD、MUDS、WUSU 上相对 SOTA 的 mIoU 分别提升 0.67%、1.12%、5.84%。

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval Figure 1
2026-07-31cs.CV

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

Shandong University, City University of Hong Kong, Harbin Institute of Technology (Shenzhen), Shandong Jianzhu University, Shandong University Qingdao Shandong China, City University of Hong Kong Hong kong China, Harbin Institute of Technology (Shenzhen) Shenzhen Guangdong China, Shandong Jianzhu University Jinan Shandong China, Shandong University Jinan Shandong China

2026-07-31视觉感知

FiRE针对复杂图像检索中长文本、视觉对话和组合查询难以被现有MLLM细粒度理解的问题,核心做法是自动构建含参考图、细粒度 caption、修改文本与目标图的FiGMaQ五元组数据,并将微调拆成上下文推理与检索对齐两阶段。实验覆盖五个检索数据集,显示其在零样本设置下优于既有方法,且使用更轻量的MLLM骨干;但具体增益中数据规模与目标解耦各自贡献仍需结合消融判断。

LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference Figure 1
2026-07-31cs.CV

LAST: The Last Query Token Guides Visual Token Pruning for Edge-Cloud Collaborative MLLM Inference

Feng Yang, Xinrui Ju, Keyang Zhang, Xiandong Meng, Rongqun Lin, Howard Leung, Shiqi Wang, Haoliang Li, Chris Xing Tian

2026-07-31视觉感知

面向边云协同 MLLM 推理,论文指出密集视觉 token 会增加传输与云端计算,而现有剪枝要么不看查询、要么依赖云端模型状态。LAST 的核心洞察是用边侧小 VLM 中“最后一个查询 token”对视觉 token 的注意力作为轻量查询相关性信号,并结合特征多样性筛选。实验覆盖 11 个多模态基准,在仅保留 12.5% 视觉 token 时保持 95.4% 全 token 准确率,显示预传输查询感知剪枝可显著降本。

ARD-REFSM: Enhancing Reflection Symmetry Detection with Asymmetric Denoising and Rotation Equivariance Figure 1
2026-07-31cs.CV

ARD-REFSM: Enhancing Reflection Symmetry Detection with Asymmetric Denoising and Rotation Equivariance

Dongfu Yin, Rourou Su, Cong Zhao, Fei Yu

2026-07-31视觉感知

本文针对反射对称检测中非对称区域干扰和旋转姿态导致的特征不一致问题,提出 ARDNet:用初始对称得分图作为权重抑制背景伪影,并通过原图与旋转图的特征相似性匹配和旋转损失约束得分图一致性。论文还构建含多类干扰的 GMSYM 数据集,并在 DENDI、NYU、LDRS、SDRW 与 GMSYM 上报告精度和鲁棒性达到 SOTA。

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow Figure 1
2026-07-31cs.LG

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

Dongxiu Liu, Haoyi Niu, Peng Cheng, Yuan Gao, Xirui Kang, Sangli Teng, Koushil Sreenath, Xianyuan Zhan

2026-07-31生成模型强化学习

这篇论文针对离散帧式世界模型难以处理连续物理时间、 irregular 采样和长时预测的问题,提出 PT-Flow/ODEWorld:在解耦的动态潜空间中学习受 ODE 约束的连续速度场,用数值积分完成未来、任意分辨率甚至反向预测。实验覆盖 LIBERO、AgiBot-World 和真实机器人任务,显示其在视频生成、长程重建和下游策略学习中兼顾视觉保真与可规划表征。

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting Figure 1
2026-07-31cs.CV

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

South China University of Technology, South China University of Technology Guangzhou China

2026-07-31视觉语言

本文针对场景文字识别与定位中,多 patch 视觉 grounding 容易引入冗余、邻近文字干扰和小文本定位歧义的问题,提出 SPaTS:每个文本实例只选一个锚定视觉 token,再通过全图特征细化几何边界;同时用强化学习的 SPaSO 在无最优 patch 标注下优化离散选择,并以 DEA、PED稳定表示与解码。实验称其在多个基准上显著优于闭源 MLLM 和 OCR MLLM,但具体增益拆分仍需看完整实验细节。

CoRE-UIR: Prior-guided common and residual experts for efficient all-in-one remote sensing image restoration Figure 1
2026-07-31cs.CV

CoRE-UIR: Prior-guided common and residual experts for efficient all-in-one remote sensing image restoration

Zaiyan Zhang, Qiangqiang Yuan, Jie Li, Ziyang Lihe, Yu Wan, Yuzeng Chen, Xin Su, Liangpei Zhang

2026-07-31视觉感知

面向无人机和卫星遥感图像中雾、雨、低光、模糊等单一或复合退化,论文关注统一恢复模型中退化提示弱、全秩多专家冗余的问题。CoRE-UIR用冻结CLIP构造退化先验,通过全局特征调制处理统计偏移,并以公共密集专家加低秩残差专家分解共享与特异恢复能力。实验称其相对BaryIR平均PSNR提升1.05 dB、速度快11.83倍、峰值显存降低85.3%,但具体增益中数据集扩展的贡献仍需进一步区分。

Unifying Adversarially Robust Model Experts in Vision-Language Models Figure 1
2026-07-31cs.CV

Unifying Adversarially Robust Model Experts in Vision-Language Models

Nguyen Duc Thai, Junhao Dong, Sua Qi Rong, Hua Yu, Yew-Soon Ong

2026-07-31视觉语言视觉感知安全鲁棒

这篇论文针对 CLIP 等视觉语言模型在对抗扰动下易失效、且不同对抗微调方法各有适用场景的问题,提出 CARE:同时训练图文对齐专家与图像不变性专家,并通过嵌入空间协调交换知识,最后合并为单一鲁棒模型。实验显示 CARE 在经典图像分类和下游视觉语言任务上优于单独的 TeCoA、FARE 专家,但更大模型下的计算瓶颈仍文中未充分解决。

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos Figure 1
2026-07-31cs.AI

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

Hefei University of Technology, Faculty of Psychology, Beijing Normal University, The Chinese University of Hong Kong, Shenzhen, University of Science and Technology of China, tation of the mental state supported by the available multi-, files to binary or ordinal labels (e.g., “depressed” vs. “non-, tic labels, MMHBench is designed to assess fine-grained, vided in Table 1. To support scalable yet reliable benchmark

2026-07-31视觉感知数据集/基准

现有心理健康视频基准多停留在抑郁等粗粒度分类,难以检验模型是否真正理解行为、关系语境与隐含心理状态。MMHBench用268部长视频构建2184个多视角问题,区分第三人称观察与第一人称代入,并用多智能体生成、反馈和专家验证保证题目质量。对22个多模态大模型的评测显示该任务仍很困难,尤其第一人称问题准确率明显低于第三人称,暴露出基于证据的角色化心理推理短板。

DECODE: Tackling Representation and Decision Degradation in Continual AI-Generated Image Detection Figure 1
2026-07-31cs.CV

DECODE: Tackling Representation and Decision Degradation in Continual AI-Generated Image Detection

Zihao Cai, Xinghan Li, Ruiyan Yang, Xue Song, Haijun Shan, Jingjing Chen

2026-07-31视觉感知

这篇论文关注生成模型持续演进下,AI 生成图像检测器在增量适配新生成域时遗忘旧知识的问题。作者指出遗忘不只来自特征表示退化,还包括分类头决策边界漂移,提出 DECODE:用 SDR 约束 LoRA 子空间以保留多样取证线索,并用 CDA 在适配器合并后闭式重校准分类头。实验覆盖 19 个生成域,平均准确率 99.36%、遗忘率 0.39%,对 11 个未见生成器准确率 95.36%。

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing Figure 1
2026-07-31cs.CV

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

2026-07-31三维安全鲁棒

这篇论文面向救援无人机等远距离场景中“看懂”人体非语言意图的数据稀缺问题,提出在真实4K航拍视频中按几何一致性放置3D人体的方法:用单目深度和语义锚点构建局部3D世界模型,以刚体变换不变的仿射锚点权重跟踪落地点,并用SVD估计地面旋转。由此生成Drones2BodyLanguage数据集,在场景和动作不重合划分上显著提升12种骨架意图识别模型表现,零样本准确率约从0.48/0.32/0.20升至0.74/0.67/0.58,并在两个野外新场景验证迁移。

EEG-EditBench: Probing Visual Information in EEG-Image Retrieval Models with Controlled Image Edits Figure 1
2026-07-31cs.CV

EEG-EditBench: Probing Visual Information in EEG-Image Retrieval Models with Controlled Image Edits

Kaifan Zhang, Lihuo He, Yuqi Ji, Junjie Ke, Lukun Wu, Tianhao You, Xinbo Gao

2026-07-31视觉感知规划控制

本文针对标准 EEG-图像检索只验证跨类别识别、难以说明模型究竟利用哪些视觉线索的问题,提出 EEG-EditBench:在 THINGS-EEG2 测试图像上构造受控编辑候选,分别改变物体身份、属性、背景和存在性。结果显示,常规检索高准确率并不稳定迁移到编辑诊断;模型较能区分身份或移除变化,但对颜色、材质、纹理、形状和状态等细粒度属性最脆弱。

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation Figure 1
2026-07-31cs.CV

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

2026-07-31视觉感知数据集/基准

针对少样本医学图像分割方法各自评测、难以横向选择的问题,论文提出 FAME 统一基准,覆盖专家模型、SAM/CLIP/MLLM 等 23 类方案,在 14 个 ROI 任务上同时考察零样本、10-shot、目标缺失识别和分布迁移。结果显示,直接利用支持掩码进行视觉适配通常优于提示式策略,更多样本只有在模型能有效吸收时才带来收益;语义迁移明显难于成像域变化,定位强也不等于能可靠拒识缺失目标。

Simplifying Neural Networks During Training Figure 1
2026-07-31cs.AI

Simplifying Neural Networks During Training

Lorenzo Sciandra, Samuele Fonio, Roberto Esposito

Department of Computer Science, University of Turin, Turin, Italy

2026-07-31视觉感知

这篇论文针对过参数神经网络训练后期存在冗余层、部署成本高的问题,提出在训练过程中依据神经崩塌与 Tunnel Effect 的表示动态来裁剪网络。核心做法是用 Inverse Fisher Criterion 监测各层从特征提取到分类压缩的转折点,稳定后删除尾部层并接入轻量分类头继续训练。实验覆盖 MLP、VGG、ResNet 的图像分类任务,报告最高约 94% 参数减少,同时保持接近完整模型的精度;但方法依赖清晰稳定的层间转折,噪声 IFC 情况下的可靠性仍未充分说明。

VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection Figure 1
2026-07-31cs.CV

VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection

Songsong Duan, Xi Yang, Nannan Wang

2026-07-31视觉感知

该文针对伪装目标检测中仅靠 RGB 容易被低对比外观误导、而现有 RGB-D 融合又会使两种模态表征同质化的问题,提出 VCP-DCN。其核心是用可分离原型学习保留 RGB 与深度的共性和特异性,再通过双注意力交互与深度自适应注入完成融合。实验显示该方法在三个 COD 基准上超过 15 个 SOTA,并可迁移到 RGB-D 显著目标检测。

FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference Figure 1
2026-07-31cs.CV

FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Qianli Ma, Fanshuai Meng, Weijia Jia

2026-07-31生成模型

本文针对扩散模型推理中缓存/预测特征会累积漂移、而验证阶段已计算的精确特征常被丢弃的问题,提出 FeatFix:在固定稀疏的层-时间步位置,直接用已付费计算的完整精确块输出替换草稿输出,从而局部校正误差且不额外重算整步。实验覆盖 FLUX、Qwen-Image、HunyuanVideo-1.5 和 DiT-XL/2,最高相对 Vanilla 加速 6.70 倍,并保持竞争性质量。

SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and Classification Figure 1
2026-07-31cs.CV

SAFViT: Spatial Attention Fusion Gating for Vision Transformer-Based Nucleus Segmentation and Classification

Harshit Mittal, Arash Rabbani

2026-07-31视觉感知

本文针对病理细胞核分割中常规跳连无差别融合多尺度特征、易把冗余或冲突信息传入解码器的问题,提出在 CellViT 中用 SAF 门控同时评估编码器局部细节与解码器全局上下文,并以逐像素 softmax 生成“信任热图”自适应融合。实验显示 SAFViT 在 PanNuke 上取得最高 mPQ 0.471,主要来自少数类 Dead 细胞 F1 从 0.373 提升到 0.518,而 Dice、AJI 等整体分割指标增益较小。

Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA Figure 1
2026-07-31cs.CV

Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

Zhongkuan Mao, Xianjie Liu, Tianyu Meng, Yidong Wang, Wenzhuo Zhao, Ronghao Xian, Yao Jiang, Fei Shen, Junfeng Fang, Yong Dai, Yi Zhang, Keren Fu

2026-07-31视觉感知

针对高分辨率 VQA 中小目标、局部文字和空间关系容易被大量视觉 token 淹没的问题,论文指出关键信息并非总是缺失,而是在中间层已被定位后于后续层被稀释。Thinking-Once 无需训练和额外裁剪重编码,通过问题条件注意力筛选实体与背景证据并路由到深层。五个基座模型上平均提升约 2.7–3.1 分,并降低约 4GB 峰值显存,Qwen2.5-VL-7B 跨基准均值从 72.5 提至 79.1。

Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language Understanding Figure 1
2026-07-31cs.AI

Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language Understanding

Shiwei Gan, Lichen Wang, Xiao Liu, Yafeng Yin, Kuizhuang Liu, Sanglu Lu, Lei Xie

2026-07-31数据集/基准

本文针对现有手语理解任务只做识别或翻译、难以检验语义理解的问题,提出手语问答 SLQA,并基于 PHOENIX14T 和 CSL-Daily 用模板自动构建 SignQA 基准,覆盖位置、结构、视觉搜索、gloss 识别和翻译理解等问题。方法上给出带问题条件时序下采样和域内知识迁移的基线,实验显示其在各类问题上优于代表性视觉语言模型,但数据由模板生成,泛化到开放问答的程度文中未充分说明。

Endo-NeRF++: Uncertainty-Aware Neural Rendering with Multi-Resolution Hash Encoding for Dynamic Surgical Scene Reconstruction Figure 1
2026-07-31eess.IV

Endo-NeRF++: Uncertainty-Aware Neural Rendering with Multi-Resolution Hash Encoding for Dynamic Surgical Scene Reconstruction

Gousia Habib, Laura Ruotsalainen

2026-07-31三维安全鲁棒

面向机器人微创手术中组织形变、遮挡和高反光导致的动态三维重建不稳问题,Endo-NeRF++在EndoNeRF上加入多分辨率哈希编码、时序特征融合和不确定性感知自适应采样,把更多计算分配给高不确定区域。机器人手术视频实验显示,相比EndoNeRF,PSNR最高提升1.22 dB,SSIM提升5.3%,LPIPS降低55.1%,但具体增益在各模块间的归因仍需看消融是否充分。

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction Figure 1
2026-07-31cs.CV

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

2026-07-31视觉语言

本文针对 LVLM 在图像描述中自信生成不存在物体的问题,指出仅靠输出置信度难以判断视觉支撑,粗粒度抑制还会损伤覆盖率。核心洞察是幻觉物体在生成时会留下跨注意力头的有符号内在 grounding signature,VGD据此逐个物体验证,高风险时回滚KV缓存并局部重写。实验显示其在 CHAIR、AMBER-G 上显著降低物体幻觉,AMBER-G CHAIR 降低43.6%,同时保留99.6% grounded-object coverage。

SPFM-Net: Semantic-Prior-Guided Frequency-Constrained Mamba for Invisible Watermark Attack Figure 1
2026-07-31cs.CV

SPFM-Net: Semantic-Prior-Guided Frequency-Constrained Mamba for Invisible Watermark Attack

Chunpeng Wang, Yanan Shi, Zhiqiu Xia, Jidong Yang, Suo Gao, Qi Li

2026-07-31视觉感知

针对隐形水印攻击中“去除更彻底但画质更差”的矛盾,SPFM-Net把水印移除改写为语义引导的图像恢复:用高比例遮挡和预训练MAE削弱局部水印线索,再结合多尺度频域残差交互与Mamba全局建模分离水印和内容。实验覆盖空间域、变换域、矩域和深度水印,显示其在去水印效果与感知质量之间取得更好折中,并具备未见深度水印的零样本移除能力。

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA Figure 1
2026-07-31cs.CV

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

Tongji University, East China Normal University, Tongji University Shanghai China, East China Normal University Shanghai China

2026-07-31数据集/基准

LoMeVQA针对现有医学VQA多停留在单次影像、难以评估疾病随访变化的问题,构建了含206K问答对的纵向医学视觉问答基准,覆盖进展分类、描述、报告生成、差异区域定位与描述,并用知识图谱实体抽取和时间演化建模生成样本。实验显示通用和医学MLLM在该基准上表现较弱,最佳分类约55%、定位约25%;微调得到的MedLong-8B取得各任务最优,但增益可能主要来自LoMeVQA数据训练。

FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack Figure 1
2026-07-31cs.CV

FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack

Chunpeng Wang, Yuxin Li, Xiaoyu Wang, Jidong Yang, Suo Gao, Qi Li

2026-07-31生成模型

论文针对隐形图像水印攻击中“去除水印”和“保持画质”难以兼顾的问题,提出将水印痕迹按频域解耦处理的 FDDWAN:先用小波分解分别扰动低、高频子带,再用残差扩散只细化剩余水印相关差异,避免整图重建带来内容破坏。在 CelebA 和 ImageNet、四类水印方案上的实验显示,其水印移除效果与视觉保真度优于常规和学习式攻击方法,但推理开销较高。

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography Figure 1
2026-07-31cs.CV

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

Technion – Israel Institute of Technology, Ben-Gurion University of the Negev

2026-07-31视觉感知

该文针对胸片库通常只有自由文本报告、现有医学视觉语言模型按报告匹配训练而难以满足短临床查询的问题,提出 CXR-Retrieve,将检索定义为阳性、合取和否定病理约束满足,并用标签感知对比微调吸引兼容样本、排斥矛盾样本。基于 CXR-CLIP 时,两病灶合取 Precision@5 提升 8.5 个百分点,否定查询提升 22.0 个百分点。

Private Face Recognition Training Dataset Publication via Identity-Decoupled and Geometry-Preserving Face Distillation Figure 1
2026-07-31cs.CV

Private Face Recognition Training Dataset Publication via Identity-Decoupled and Geometry-Preserving Face Distillation

Shuhuan Chen, Xiangyu Zhu, Weisong Zhao, Siran Peng, Tianshuo Zhang, Haoyuan Zhang, Haichao Shi, Xiao-Yu Zhang, Zhen Lei

2026-07-31视觉感知数据集/基准

这篇论文针对人脸识别训练集发布中的隐私-效用矛盾:保留身份线索有利于监督学习,却会增加与真实个体的可链接性。作者提出将源身份语义与可用于识别的代理身份几何分离,通过正交几何保持和关系拓扑对齐生成可发布代理人脸。实验显示,PFD在多种域迁移场景下优于所比较的发布基线,并在IJB-C监控场景将TAR@FAR=1e-3提高3.94%,同时降低源身份链接风险。

DS@GT ARC at ImageCLEFmedical 2026: Architectural Diversity for Concept Detection and Foundation-Model Scaling for Caption Prediction in Medical Image Analysis Figure 1
2026-07-31cs.CV

DS@GT ARC at ImageCLEFmedical 2026: Architectural Diversity for Concept Detection and Foundation-Model Scaling for Caption Prediction in Medical Image Analysis

Bowen Wang, Youwen Zhang, Ritesh Mehta

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332

2026-07-31视觉语言视觉感知

本文面向 ImageCLEFmedical 中放射图像概念检测与报告生成的长尾标注和事实性难题,比较集成视觉编码器、冻结 BiomedCLIP 检索与不同规模 VLM 的取舍。核心洞察是概念检测依赖正则化阈值与架构多样性,而 caption 生成可能主要来自 scaling / data。结果上,三模型融合获概念检测第一,KNN 几乎同分且成本更低,Gemma-3 27B caption 排名第三。

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement Figure 1
2026-07-31cs.LG

DAS-PMVC: A Framework for Partial Multi-View Clustering via Dual Alignment and Structure Enhancement

Shubin Ma, Liang Zhao, Chuanye He, Zhenjiao Liu, Liang Zou, Lin Yuanbo Wu, Yu Shao

Dalian University of Technology, Inspur Group Co., Ltd., China University of Mining and Technology, The University of Warwick, Dalian University of Technology Dalian Liaoning China, Inspur Group Co., Ltd. Jinan Shandong China, China University of Mining and Technology Xuzhou Jiangsu China, The University of Warwick Coventry West Midlands United Kingdom

2026-07-31视觉感知

针对多视图数据采集时样本跨视图不完全对齐、直接丢弃失配样本会降低聚类可用性的动机,DAS-PMVC用锚图先做结构对齐,再通过预训练的图卷积特征学习和对比损失、匈牙利算法进行二次语义对齐。实验称在多个数据集上优于现有部分多视图聚类方法,但具体增益来源仍需结合消融细节判断。

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder Figure 1
2026-07-31cs.CV

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

Jaehun Jung, Wonjun Kim

2026-07-31生成模型三维

面向智能眼镜等设备仅能获得头部位姿、身体其余部分不可见的问题,EgoGVAE用全身动作VAE的潜空间作为训练期引导,使头到动作网络的高斯潜分布对齐全身先验,并用可学习 token 表示未观测身体部位。实验称其在基准上提升自我中心全身网格重建效果,且推理为一步采样,比扩散方法快50倍以上。

Articulated Object Reconstruction from Rest-State Observation Figure 1
2026-07-31cs.CV

Articulated Object Reconstruction from Rest-State Observation

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

2026-07-31三维

这篇论文针对可交互数字孪生中“只有闭合静止状态、没有开合运动”的关节物体重建难题,提出 Rest2Art:以显式网格作为跨模型校验与融合载体,用 VLM 与 SAM3 互相修正部件层级和分割,再用视频扩散模型生成可能的开合运动并以几何一致性约束关节参数。实验显示其在部件分解和关节估计上可与需要观测运动或生成式基线竞争,但效果仍依赖预训练模型假设。

Three-Photon Bayesian Imaging of Ortho-Positronium Figure 1
2026-07-31cs.CV

Three-Photon Bayesian Imaging of Ortho-Positronium

L. Raczynski, W. Krzemien, A. Coussat, M. Bala, B.C. Hiesmayr, K. Klimaszewski, M. Obara, R. Y. Shopa

L. Raczyński, M. Bała, K. Klimaszewski, M. Obara, R. Y. Shopa are with the National Centre for Nuclear Research, Department of, Complex Systems, 05-400 Otwock, PolandW. Krzemień is with the National Centre for Nuclear Research, Department of

2026-07-31视觉感知

这篇论文针对常规 PET 只利用双光子、正电子素三光子事件统计少且定位精度不足的问题,提出 TRIO:把飞行时间三边定位、能量约束和源自正电子素 QED 衰变的物理先验统一为贝叶斯 MAP 逐事件重建。基于 Siemens Biograph Quadra 的蒙特卡洛结果显示平均定位误差为 1.62 cm,优于时间法 3.05 cm,并显著好于单独能量重建的 18 cm。

PrintAnything: Learning an Intermediate Representation for 3D printing G-code Generation Figure 1
2026-07-31cs.CV

PrintAnything: Learning an Intermediate Representation for 3D printing G-code Generation

Sangmin Hong, Daniel Sungho Jung, Heewon Kim, Kyoung Mu Lee

2026-07-31三维

这篇论文针对点云难以直接进入现有3D打印切片流程、点云转网格又易引入孔洞和拓扑错误的问题,提出PrintAnything:将无朝向点云按打印层投影为切片对齐表示,并用包含占用、区域和流量的G-plan map桥接点云与G-code。实验在Slice-100K上显示其优于先重建网格再切片的基线,CD降至0.047,3D/2D F1分别达0.741和0.677。

Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs Figure 1
2026-07-31cs.CV

Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs

Jiasheng Li, Zhong Ji, Yan Zhang, Huihui Li

Tianjin University, Tianjin, China, Tsinghua University, Beijing, China

2026-07-31视觉语言安全鲁棒

这篇论文针对VLM视觉token缩减虽省算力却可能丢失或混淆关键语义的问题,提出“先校准再推理”的CaRe框架:先用多方向扰动寻找稳定且多样的校准锚点,再从未选token中筛出可靠信号注入锚点。实验显示在剪除94.4%视觉token时仍保留96.4%全token性能,并最高获得2.30倍端到端加速。

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation Figure 1
2026-07-31cs.CV

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

Shenzhen University, Peking University, Shenzhen University Shenzhen China, Peking University Beijing China

2026-07-31视觉感知强化学习

针对多模态模型一次性生成 SVG 时无法查看渲染结果、易产生几何漂移和幻觉的问题,RefineSVG把图像到SVG改为渲染-观察-修正闭环:用外部渲染器生成预览和Diff-Map,再以ReAct式反馈驱动代码修正,并用SVG语义词表缓解上下文压力。实验显示其在重建保真度、结构准确性和代码效率上优于基线。

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles Figure 1
2026-07-31cs.CV

JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles

Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao

University of Southern California, National University of Singapore, Texas A&M University, Rice University, The University of North Carolina at Chapel Hill

2026-07-31视觉语言

本文以拼图作为检验 VLM 空间/几何推理的代理任务,动机是现有矩形切块基准在重复纹理中标签含混且规模偏小。JigShape 引入带凸凹咬合边界的 95K 拼图,并用有/无形状消融区分视觉与几何线索。结果显示零样本模型几乎不会利用几何约束,除 GPT-5.5 在 4×4 上超过随机外多为随机;微调可在 4×4 接近满分,但随网格增大迅速崩塌,说明可扩展约束满足仍是短板。

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers Figure 1
2026-07-31cs.CV

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

2026-07-31视觉语言视觉感知安全鲁棒

论文针对多模态模型在封闭式视觉问答中“高置信但证据不对题”的风险检测问题,提出 WEP:在单次 prefill 中读取分层有符号视觉证据,并用证据来源与空间集中度构成可解释风险组合,再与置信度融合。三种 MLLM、四个二分类基准上,错误排序平均 AP 提升 0.134,12 个模型-数据集组合均为正增益。

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective Figure 1
2026-07-31cs.LG

Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective

Rishabh Iyer, Truong Pham, Anay Majee

The University of Texas at Dallas, Richardson, TX, USA

2026-07-31视觉感知

本文针对子模信息度量在表征学习中虽有效但几何含义不清的问题,建立统一理论框架,将不同 SIM 目标对应到类内方差、协方差体积、质心分离、Mahalanobis 分离与多模态覆盖等统计量。受控合成实验显示各度量行为与理论解释一致,结论是 Graph Cut、LogDet、Facility Location 分别适合紧致分离、协方差感知和覆盖/长尾场景。

Learning Color Grading, No Photo Sharing: Federated Aesthetic Preference Learning for Personalized Image Enhancement Figure 1
2026-07-31cs.CV

Learning Color Grading, No Photo Sharing: Federated Aesthetic Preference Learning for Personalized Image Enhancement

Chuanzhi Xu, Ziyuan Tao, Jean Julien KNell, Yanrong Chen, Haolan Guo, Xuanhua Yin, Adnan Mahmood, Weidong Cai

2026-07-31视觉感知

本文针对个性化修图依赖集中收集私人照片、评分且难以在端侧部署的问题,提出 FedPAIE:用联邦学习训练轻量审美评分器,再在本地少量反馈上校准,并冻结其指导轻量 CLUT 增强器做无配对色彩调整。其关键在于用保真约束和 excess-gap 惩罚抑制代理评分过优化。MIT-Adobe FiveK 与 Flickr-AES 实验显示,该方法在偏好提升与图像保真之间取得较好折中。

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models Figure 1
2026-07-31cs.CV

MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Models

Wenjie Zhu, Yabin Zhang, Wenjun Zeng, Lei Zhang

2026-07-31视觉语言数据集/基准

本文关注多模态大模型在图像语境不完整或被扰动时的可靠性:既不能对真正图文不匹配的问题硬答,也不应因干扰线索而过度拒答。MMOOC的核心在于同时构造可回答的 shifted in-context 与不可回答的 OOC 样本,覆盖3类题型、8类偏移和6种视觉场景,并用模型过滤加人工验证保证质量。实验显示,现有开源和闭源模型普遍难以平衡准确回答与合理拒答,模型规模或通用能力并不必然带来更强 OOC 鲁棒性,后训练和提示可改善但增益来源仍需进一步拆解。

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans Figure 1
2026-07-31cs.CV

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans

Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li

School of Computer Science and Technology, Harbin Institute of Technology, Harbin 150001, China

2026-07-31视觉感知

该文针对文本生成360度动态人体时,先生成视频再重建4D资产带来的高成本、几何不完整和视角不一致问题,提出直接在4D Gaussian Splatting表示空间中扩散生成。核心做法是用带时间注意力的3D U-Net建模人体时空结构,并构建6万对text-to-4DGS数据,配合2D正则和免训练4D插值。实验显示其可在一分钟内生成动态人体,时间与多视角一致性优于既有方法,推理时间降低超过10倍;但部分收益可能主要来自大规模数据与表示选择。

BlindPSNR: A No-Reference Fidelity Predictor for Low-Light Image Enhancement Figure 1
2026-07-31cs.CV

BlindPSNR: A No-Reference Fidelity Predictor for Low-Light Image Enhancement

Mingzhe Lyu, Jinqiang Cui, Hong Zhang

2026-07-31视觉感知

低光增强在不同场景中常需从多组参数结果里选最接近真值的候选,但真实部署缺少参考图,传统无参考 IQA 又偏向感知质量而非 PSNR。BlindPSNR 利用成对训练数据可解析得到 log-MSE/PSNR 监督,在推理时仅输入低光图和增强图,通过窗口交叉注意力融合并做异方差回归。RealX3D 留出集 top-1 从标量回归的 54.4% 提升到 89.5%,平均 regret 降至 0.026 dB,但跨域 top-1 仅 12–38%,泛化仍受限。

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging Figure 1
2026-07-31cs.CV

MedXplore: Towards Reliable and Unbiased Generalized Category Discovery in Medical Imaging

Jianwei He, Kailin Lyu, Junhao Dong, Long Xiao, Wenjie Hou, Jingze Lu, Di Wu, Lin Shu, Jie Hao

Institute of Automation, Chinese Academy of Sciences, Nanyang Technological University, Institute of Automation, Chinese Academy of Sciences Beijing China, Nanyang Technological University Singapore Singapore

2026-07-31视觉感知

医学影像中未知或罕见病种持续出现,现有GCD方法依赖闭集假设且易受细微病灶、模态差异和旧类偏置影响。MedXplore从频域感知和决策边界两层改进:FAAC提取全频谱病灶语义锚点,ACAM按难度与置信度自适应调整角度间隔。多数据集实验显示All准确率较最强基线平均提升8.5%,Kvasir误判旧类率由14.50%降至0.80%。

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing Figure 1
2026-07-31cs.CV

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie

2026-07-31数据集/基准

论文针对多人图像编辑中近身接触容易出现肢体融合、多余手脚和身体穿插,而现有评测只看身份、动作或VLM打分难以发现这些错误的问题,提出MPIE-Bench视频挖掘基准和MPIE-Eval网格评测,用多人人体网格重建分别衡量解剖完整性与接触几何。10个编辑器测试显示最佳Anatomy仅0.65、Interaction仅0.72,且领先模型不一致,而VLM评分普遍高于0.95;五人标注验证新指标更贴近人类判断。

MeshFM: 2D Features Are All You Need for 3D Shape Understanding Figure 1
2026-07-31cs.CV

MeshFM: 2D Features Are All You Need for 3D Shape Understanding

Jinfan Zhou, Richard Liu, Itai Lang, Rana Hanocka

2026-07-31三维

MeshFM针对现有2D特征蒸馏到3D时需逐形状优化、特征噪声和任务专用化的问题,提出先用SAM细化的多视角2D基础模型特征生成3D teacher field,再训练前馈网络直接预测旋转鲁棒的通用网格特征。无需3D标注和任务微调,在部件分割、稠密对应与形变等任务上接近或超过受3D监督的专用方法;但旋转优势部分来自SO(3)增强,论文也承认与未增强基线比较可能占优。

ZMIS-SAM: Segment Anything Model Enhanced with Wavelet Transform for Zooplankton Microscopy Image Instance Segmentation Figure 1
2026-07-31cs.CV

ZMIS-SAM: Segment Anything Model Enhanced with Wavelet Transform for Zooplankton Microscopy Image Instance Segmentation

Dekun Yuan, Zhongwei Li, Zheng Qiao, Jie Zhang

2026-07-31视觉感知

论文针对 SAM 迁移到浮游动物显微图像时缺乏领域先验、易误分类、细长透明附肢断裂和边界不完整的问题,提出 ZMIS-SAM:在 ViT 中加入形状与强度适配器,用 NFAM 融合通用与领域特征,并用小波多尺度多方向增强恢复高频边界细节。作者还构建 ZMIS5K 数据集,实验显示完整模型在该集上达到 73.6% mAP、94.6% AP50 和 80.7% AP75,并在跨域数据上表现出一定泛化能力。

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA Figure 1
2026-07-31cs.CV

Objective-Aligned Direct Answer SFT for Robust Multi-Frame Medical VQA

Site Li, Jianyi Hao, Xiaofeng Liu

Yale University

2026-07-31安全鲁棒

针对多帧医学 VQA 中复杂控制器、重排序和续训策略是否必要的问题,论文提出“与最终答案目标对齐”的直接答案 SFT 作为稳健比较基线。核心洞察是,在固定划分、预算、随机种子和校准后,越贴近评测目标的答案-only LoRA 微调越稳。结果显示该方法在 MedGemma-1.5-4B 上较冻结基线提升约 6.31 个百分点,且 text30/text35/vision35 差异不显著,复杂辅助机制未形成更稳健优势。

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning Figure 1
2026-07-31cs.CV

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

Site Li, Jianyi Hao, Xiaofeng Liu

Yale University

2026-07-31视觉感知

这篇论文针对多图像医学问答中模型需跨有序影像整合证据、且易受答案顺序扰动影响的问题,提出关键不在更长提示或更深搜索,而在推理时的智能体决策规则。作者用同一 ShinkaEvolve 预算比较五种策略,发现简单的 order-vote 聚合最稳健,最终测试准确率 57.89%,高于固定基线 52.73% 和更复杂的 order-rerank 55.79%;将搜索从 50 代加到 100 代反而降至 56.02%,说明过度搜索可能放大验证噪声。

Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings Figure 1
2026-07-31cs.CV

Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings

Mingi Kim, Yongjun Kim, Hyungki Kim

2026-07-31视觉语言

这篇论文面向工业中大量以扫描图或 PDF 保存的二维 CAD 图纸,目标是从栅格图恢复可编辑的参数化 CAD 代码。核心做法是将几何轮廓与尺寸标注分开提取,再用交叉注意力和 Annotation Grounding Loss 显式对齐标注与对应几何区域,随后交给 LLM 生成 SPCC 代码。实验显示其优于现有基线,并在接近扫描工业图纸的条件下保持鲁棒性。

Cross-Embodiment Transfer via Behavior-Aligned Representations Figure 1
2026-07-31cs.RO

Cross-Embodiment Transfer via Behavior-Aligned Representations

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

2026-07-31视觉感知

论文针对跨机器人本体模仿学习中观测与动作空间难以对齐、迁移收益不稳定的问题,提出用与行为相关且跨本体较不变的表示来隐式连接数据,如末端执行器轨迹、语言运动和目标框,并在 VLA 中与动作联合预测。RoboCasa-X 与真实机器人实验显示,末端执行器轨迹最有效,表示随预训练数据规模增大更有用,也可利用无动作数据;仿真到真实迁移中任务进度提升 28%,但部分增益可能主要来自 scaling / data。

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction Figure 1
2026-07-31cs.CV

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

2026-07-31生成模型

针对纵向脑 MRI 预测中整体结构稳定而病灶进展细微、易被统一体素预测路径淹没的问题,ProgFormer 在体素空间引入粗到细的 Diffusion Transformer:粗路径建模 3D patch 级脑结构与时间上下文,细路径借助粗表示做补丁内体素细化,并用条件 flow matching 直接生成未来扫描。ADNI、AIBL、OASIS 的成对和轨迹评测显示其在 PSNR 与区域误差上优于多种基线,消融支持细路径主要改善局部结构细节。

IGME: Efficient Chained Method Ensemble for Transferable Semantic Segmentation Attacks Figure 1
2026-07-31cs.CV

IGME: Efficient Chained Method Ensemble for Transferable Semantic Segmentation Attacks

Mengqi He, Jing Zhang

School of Computing, College of Systems & Society, The Australian National University, Canberra, ACT, Australia

2026-07-31视觉感知

语义分割的迁移攻击需要在像素级损失上反复前后向,模型集成虽能提升迁移性但计算代价高。IGME将可微攻击组件串联到单一源模型计算图中共享梯度,并用类似积分梯度的路径平均稳定更新方向。在Pascal VOC和Cityscapes上,它相对单源基线在部分跨架构迁移设置有提升,运行时间优于模型集成,但增益并非对所有架构一致。

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System Figure 1
2026-07-31cs.CV

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

2026-07-31视觉感知

本文针对文本到视频模型难以从压缩提示中恢复完整物理演化的问题,提出 VideoCoCo:由代码智能体生成可执行 Blender 程序作为过程级 CoT,先模拟确定性时空草图,再用视频生成引擎做草图条件编辑。作者还构建 VideoCoCo-3K 对齐数据集;在 PhyGenBench 上从 0.475 提升到 0.558,在 VBench-2.0 上从 52.18 提升到 77.88,但复杂流体等现象仍受 Blender 表达能力限制。

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology Figure 1
2026-07-31cs.CV

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

2026-07-31视觉感知

PanDent针对牙科全景片中多模态大模型缺少细粒度、临床可信评测的问题,构建了9524例带专家验证牙位级结构化标注的OPG数据,并用临床规则生成与结构证据对应的报告,从而评估结构-语言一致性。实验显示,现有模型虽能生成流畅报告,但牙位定位和诊断一致性错误明显;在PanDent上微调后,视觉定位与诊断正确性显著提升,说明性能改进可能主要来自高质量牙位级数据监督。

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation Figure 1
2026-07-31cs.LG

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

Alexi Gladstone, Heng Ji, Yilun Du

2026-07-31视觉感知

论文针对生成模型训练与推理不一致、难以端到端处理多峰分布的问题,提出 Explorative Modeling:在训练环节探索 K 个生成-数据匹配并选择最近者更新,以把“生成过程分解”转为“训练循环分解”。实验显示,探索可作为参数和数据之外的第三预训练轴,在图像、视频、语言上提升效率与性能,并在控制任务中以少 16-256 倍推理步数匹配扩散基线。

Shared Semantic Codebook Distillation for Unpaired Cross-Modal Medical Classification Figure 1
2026-07-31cs.CV

Shared Semantic Codebook Distillation for Unpaired Cross-Modal Medical Classification

Dillan Imans, Phuoc-Nguyen Bui, Duc-Tai Le, Hyunseung Choo

2026-07-31视觉感知

针对医学场景中强模态昂贵、弱模态更易部署且两者常无患者级配对的问题,论文提出 SSCD:把教师和学生特征映射为共享离散语义码本上的分布,并在全局与类别条件层面对齐,避免直接特征匹配。OCT→眼底和 CT→胸片实验中,学生 macro-F1 分别由 64.5 提升到 70.2、73.8 提升到 76.3,且推理时不增加成本。

Bunraku: Turning a Single Illustration into an Editable Live2D Character Figure 1
2026-07-31cs.CV

Bunraku: Turning a Single Illustration into an Editable Live2D Character

Junhao Chen, Jingjia Mao, Dayong Li, Chenghai Li, Saining Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

Tsinghua University, Nanyang Technological University, SparcAI Inc., Tsinghua University Shenzhen China, Nanyang Technological University Singapore, SparcAI Inc. 221 W 9th St PMB 141 Wilmington DE 19801 USA, Tsinghua University Beijing China

2026-07-31视觉感知

论文针对 Live2D 角色制作中分层、补全、网格与关键帧变形高度依赖人工的问题,提出从单张插画生成可编辑 Live2D 资产的两阶段系统。关键洞察是动画不能逐层独立预测,而应让所有层的顶点在统一画布中联合自注意力建模,以保持眼睛、头发、衣物等跨层协同。实验显示联合预测显著优于逐层方案,Stage 2 在 50 个留出角色上方向余弦均值约 0.768,并发布 8884 模型语料与 Live2D-Bench。

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models Figure 1
2026-07-31cs.LG

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

Supratik Bhowal, Subhrajyoti Basu, Aritra Gir Mahanta, Anik Pal Chowdhury

Department of Computer Science (AIML), Department of Computer Science and Business System, Department of Computer Science and Engineering, Department of Computer Science (AIML) IEM Kolkata, School of UEMK Kolkata India, Department of Computer Science and Business System Heritage Institute of Technology Kolkata India, Department of Computer Science and Engineering Indian Institute of Information Technology, Kalyani Kalyani India

2026-07-31视觉语言视觉感知

本文关注医疗视觉语言模型的链式推理究竟参与决策,还是只是事后解释或迎合外部文本。作者提出 CoT-Mediate,单点改写模型自身推理中的临床关键属性,并用重提示与前缀强制、不同来源标注区分推理中介和顺从性。结果显示前缀强制下两模型更常随推理改变答案,LLaVA-Med 提升尤大;来源效应呈模型差异,去除图像反而增强文本依赖,侧别信息最不稳定。

VETO: Towards Protecting Images From Frontier AI Editing Figure 1
2026-07-31cs.CV

VETO: Towards Protecting Images From Frontier AI Editing

Jonas Grebe, Hossein Shakibania, Tobias Braun, Marcus Rohrbach, Anna Rohrbach

2026-07-31视觉感知

本文针对 FLUX.2 等新一代开放图像编辑模型可直接利用参考图像进行身份抽取与场景重构、从而绕过传统编码器级防护的问题,提出 Veto:通过给图像加入轻微 cloak,扰乱 DiT 编辑器读取源图的联合注意力机制。同时构建覆盖局部编辑与开放场景重构的 VetoBench。实验显示,Veto 在两个现代编辑模型和三个基准上比既有防护取得更好的编辑抑制与图像保真权衡,但对变换、架构迁移和未来适配的鲁棒性仍未充分解决。

Toward Multi-Modal Deep Learning for Pulmonary Disease Classification: A Texture-Based Machine Learning Pilot Study on Public Chest X-Ray Data Figure 1
2026-07-31eess.IV

Toward Multi-Modal Deep Learning for Pulmonary Disease Classification: A Texture-Based Machine Learning Pilot Study on Public Chest X-Ray Data

Yogisri Pujitha Chinthoti

pneumonia using the publicly available COVID-19 Image Data Collection (668, for COVID-19 versus other-pneumonia classification using a small, publicly available, representations when sufficient training data is available., scale, label noise, and clinical validation [1], [4]. Wang et al. introduced ChestX-ray8, a large public, used across many published studies as an early, openly available resource for radiograph-based, We use the publicly available COVID-19 Image Data Collection assembled by Cohen et al. [11], chest radiographs labeled either “COVID-19” or another pneumonia etiology (viral, bacterial, or, fungal), excluding CT volumes, lateral views, and unlabeled (“to-do”) entries. This yielded 668

2026-07-31视觉感知

本文动机是为胸片肺病自动分类建立可复现、避免患者泄漏的基线,而非直接宣称完成多模态深度系统。核心做法是用公开Cohen数据集,将HOG、GLCM纹理与强度特征结合逻辑回归、随机森林和SVM,并以患者级5折验证评估COVID-19与其他肺炎。最佳SVM准确率75.4%、AUC 0.755,仅小幅超过71.6%多数类基线,说明手工纹理特征有一定信号,但受小样本、类别不平衡和缺少正常对照限制;多模态CNN-Transformer仍主要是未来方案。

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation Figure 1
2026-07-31cs.CV

OVEarth-Bench: Evaluating Category Breadth and Query Diversity for Open-Vocabulary Earth Observation

Kaiyu Li, Zepeng Xin, Zixuan Jiang, Jing Fu, Lanxuan Xue, Lingyu Zhang, Xiangyong Cao

2026-07-31视觉感知

这篇论文针对开放词汇地球观测评测中类别窄、查询形式单一的问题,提出 OVEarth-Bench:用 172 类层级 taxonomy、1346 个正负词汇表达,以及词汇、指代表达和推理查询统一评测掩码与框定位。系统测试 49 个通用和 EO 专用模型后发现,现有方法整体能力仍有限,宽类别集能给出更稳定排名,MLLM 方法表现最强,而 EO 专用模型通常未超过通用强模型。

Theatre Chapbooks At Scale: A Statistical Comparative Analysis of Typography Figure 1
2026-07-31cs.CV

Theatre Chapbooks At Scale: A Statistical Comparative Analysis of Typography

Diego Belzarena (UDELAR, CB), Seginus Mowlavi (CB), Paula Casariego Castiñeira (ROMA TRE), Alejandra Ulla Lorenzo (USC), Gregory Randall (UDELAR), Jean-Michel Morel (LU - Hong Kong)

Université Paris-Saclay, ENS Paris-Saclay, Centre Borelli, France, Lingnan University, Hong Kong, a manual procedure based on the analysis of the typography and, if available, the, As our method does not rely on the availability or production of any training, dependently. The code is available at https://github.com/diegobelzarena/

2026-07-31视觉感知

这篇论文针对17世纪西班牙戏剧小册子大量缺失或伪造出版信息、人工比对字体难以扩展的问题,提出无需标注训练数据的自动字体相似度分析流程:从书页中抽取罗马体和斜体字符原型,计算跨书字体距离,并用 a contrario 统计框架判断相似性是否显著。作者在约100本文献上验证,发现若干新的印刷商归属并修正旧归属,但具体增益可能主要来自 scaling / data。

RadHarmony: Radiological Data Handling in the Era of Agentic AI Figure 1
2026-07-31cs.AI

RadHarmony: Radiological Data Handling in the Era of Agentic AI

Frank Li, Bardia Khosravi, Mohammadreza Chavoshi, Theo Dapamede, YoungSeok Jeon, Janice Newsome, Hari Trivedi, Judy Gichoya

2026-07-31视觉感知

放射影像研究常被数据集格式、目录、标签和标注类型不一致拖慢,RadHarmony把24个公开数据集的元数据、加载、缓存、划分和增强统一到一个Python接口,并引入AI辅助的数据集接入流程。实验用三类异构胸片数据无专用代码预训练ViT,展示了低摩擦多数据集训练的可行性;性能增益并不稳定,主要结论是工程瓶颈被显著降低。

2026-07-30

96 篇
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM Figure 1
2026-07-30cs.CV

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding

Huazhong University of Science and Technology, 2 Huawei Technologies Co. Ltd, China

2026-07-30视觉语言视觉感知

TurboVLA针对现有VLA以大语言模型为中心导致推理慢、显存高的问题,提出将执行层从V→L→A改为直接的V+L→A:视觉和指令分别编码,通过轻量双向跨模态交互融合,再非自回归预测连续动作块。在LIBERO上以0.2B参数、0.9GB显存和31.2ms延迟达到97.7%成功率,说明许多执行级操控未必需要LLM作为核心接口。

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion Figure 1
2026-07-30cs.CV

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion

Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys

Microsoft Spatial AI Lab

2026-07-30视觉感知

VidMap针对任意长视频中相机位姿与内参难以可靠恢复的问题,指出SLAM的因果增量式易受初始化和跟踪失败影响,而传统SfM忽略时间顺序、易被视觉对称和极端运动误导。其核心是在离线SfM中显式保留视频时序,将局部跟踪与长程回环分开处理,并引入稠密宽基线匹配和单目度量深度先验以抑制漂移。实验显示,在含极端运动、对称结构和未知内参的机器人及用户视频基准上,VidMap较现有SLAM/SfM更稳健且精度更高。

HumanCLAW: Can Vision-Language Models Act Through a Body? Figure 1
2026-07-30cs.CV

HumanCLAW: Can Vision-Language Models Act Through a Body?

Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

2026-07-30视觉语言视觉感知

这篇论文关注如何判断 VLM 是否真正具备“通过身体行动”的能力,而不是把失败混同于底层运动控制失误。HumanCLAW 将决策与执行解耦,让模型逐步输出原子全身技能,再由运动生成与半物理仿真实现其后果;基于 1218 个室内长程任务测试九个 VLM,最佳成功率仅 16.8%,显示瓶颈主要在身体自我定位、到达判断与碰撞感知,而非目标识别。

Anatomy Contextualized Adaption of CT Foundation Models Figure 1
2026-07-30cs.CV

Anatomy Contextualized Adaption of CT Foundation Models

Roshan Kenia, Stephanie L McNamara, William Lotter

2026-07-30视觉感知

该文针对CT视觉语言基础模型用整卷表征会稀释细粒度解剖信号、而细粒度预训练又丢失全局上下文且成本高的问题,提出ACA:冻结Merlin/CT-CLIP,用TotalSegmentator提取解剖级嵌入,再以跨解剖Transformer结合解剖级与扫描级文本对齐。实验在Merlin和CT-RATE上提升零样本诊断AUROC,平均优于全局模型和改造后的细粒度基线,缓存嵌入后训练低于1小时。

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications Figure 1
2026-07-30cs.CV

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

2026-07-30视觉语言

面向机器人、具身智能和安全监控等需可审计空间判断的场景,论文针对多模态大模型细粒度空间关系弱、易幻觉的问题,提出训练-free的 ByDeWay-V2:在深度分层提示外,用 YOLO-World-L 检测框计算左右、内外、接触等显式关系谓词并注入提示。实验显示其在 BLINK 上使 Qwen2.5-VL 相比 LDP 的 F1 相对提升 46%,并将 BLIP-Base 在 VSR 上提升到 0.53,轻量配置可在 CPU 和 40 token 预算下运行。

SeasonStereo: Robust Dense Stereo Matching for Multi-Date Satellite Imagery via Generative AI Figure 1
2026-07-30cs.CV

SeasonStereo: Robust Dense Stereo Matching for Multi-Date Satellite Imagery via Generative AI

Álvaro Díaz-Laureano, Roger Marí, Elías Masquil, Pablo Arias, Gabriele Facciolo

2026-07-30视觉感知生成模型安全鲁棒

多日期卫星立体匹配常因季节与光照变化失去光度一致性,而真实配准多时相数据和 LiDAR 几何标签成本很高。SeasonStereo 的核心思路是用生成模型从同步立体对合成可控季节变化,并结合基础立体模型的零样本视差、同步对光度重建和边缘平滑监督微调。实验称其在 WorldView-3 同步与异步测试上达到 LiDAR 监督方法精度,同时建筑边界更锐利,降低了真实多时相与 LiDAR 标注依赖。

DLAM: Distributional Latent Actions with Temporal Constraints Figure 1
2026-07-30cs.RO

DLAM: Distributional Latent Actions with Temporal Constraints

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

2026-07-30优化算法

这篇论文针对机器人动作标注稀缺、而无动作视频丰富的问题,认为仅靠重建学习的潜在动作缺少适合控制的时间结构。DLAM将帧间转移建模为对角高斯,并用等间隔三元组上的归一化组合、反转约束同时约束均值和方差;下游只用冻结编码器的均值作为流匹配策略的辅助目标。在MetaWorld、LIBERO和真实任务上较ALAM和π0基线提升成功率,消融显示均值约束贡献最大,方差与相关性建模带来补充收益。

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs Figure 1
2026-07-30cs.CV

Towards Grounded GI Endoscopy VQA via Multi-Task Learning on Small VLMs

Itbaan Safwan, Ramail Khan, Muhammad Annas Shaikh, Muhammad Atif Tahir

2026-07-30视觉语言

针对胃肠内镜 VQA 中小模型虽能答题但未必依据病灶区域的问题,论文提出多任务微调:复用息肉专家掩码,用 GastroNet+Grad-CAM 为其他发现生成弱定位,并加入无医学术语的视觉描述任务。在 Florence-2、Qwen3.5、InternVL3.5 上,相比仅 VQA 训练均提升准确率,主要集中在外观和空间问题,并改善答案 token 与相关图像区域的隐式对齐;但 Grad-CAM 掩码质量仍待人工验证。

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection Figure 1
2026-07-30cs.CV

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

2026-07-30视觉感知强化学习

本文针对现有多模态大模型式 AIGI 检测过度依赖解释或推理模板、细粒度异常感知不足的问题,提出 Veritas++:先用人工标注伪影构造低幻觉冷启动,再通过 PoRL 以可验证奖励强化细节、语义异常和像素差异感知,并用 VaOPD 选择高价值信号自蒸馏到推理中。实验显示其在感知任务和检测基准上较 Veritas 与多类基线有明显提升,且可适配新生成器场景。

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring Figure 1
2026-07-30cs.CV

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

2026-07-30视觉感知

论文针对自回归视频扩散在长时间自回放中出现的色彩漂移、运动停滞和视觉崩塌,指出误差累积主要表现为低频谱能量漂移,attention sink 只能部分缓解。作者提出免训练的 FreqForcing,通过谱自锚定融合锚点注意力的低频稳定性与局部注意力的高频动态信息,将 5 秒 Self-Forcing 扩展到 120 秒生成,并在 VBench-Long 上优于现有免训练方法、接近部分训练式方案。

Step-Attention Refinement of DINOv3 Features for Efficient Anterior Eye Segmentation Figure 1
2026-07-30cs.CV

Step-Attention Refinement of DINOv3 Features for Efficient Anterior Eye Segmentation

Philippe Baumstimler, Jean-Mathieu Gagnon, Sébastien Gagné, Mathieu Duchesneau, Clément Playout, Lama Séoud

2026-07-30视觉感知

这篇论文针对临床前眼段图像中采集协议、遮挡和光照差异导致分割模型跨域退化的问题,提出在蒸馏版 DINOv3 ViT-Small 上加入 step-attention 特征细化模块,先在低分辨率空间逐步适配多层 Transformer 表征,再进行卷积解码。作者在 333 张、8 种临床采集协议、7 类标注的私有数据上评估,完全微调时达到 85.55% mIoU,并在 4 个未见公开数据集上表现出更强跨域鲁棒性;但数据集较小且私有,泛化结论仍需更多外部验证。

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context Figure 1
2026-07-30cs.CV

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu

2026-07-30数据集/基准

这篇论文针对传统图像质量评估脱离论文语境、难以发现图注不符、引用无关或误导性图表的问题,提出 SciFigQual-Bench,将科学图像与图注、引用句和全文上下文绑定,并按清晰度、布局、图注匹配、上下文相关性和误导风险打分。数据含 6,308 个专家聚合标注实例;其 SFQ-Agent 在 eval1200 上平均绝对误差降至 0.418,±1 分一致率达 93.4%,但增益可能部分来自更强模型和分阶段证据融合。

Visual Credit Audit for Multimodal Spatial Reasoning Figure 1
2026-07-30cs.CV

Visual Credit Audit for Multimodal Spatial Reasoning

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

2026-07-30视觉语言

这篇论文针对封闭式是/否空间推理评测中“答对但未必看图”的问题,提出训练无关的 Visual Credit Audit,将图像相对文本/空白控制带来的决策支持与关系特异视觉响应分开衡量。实验覆盖4个开放多模态大模型和2个空间基准,发现12.73%–26.25%的正确决策缺乏视觉信用,图像置换使D-CC下降21.25–47.80点,说明单看准确率会高估真实视觉空间推理能力。

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence Figure 1
2026-07-30cs.CV

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

2026-07-30视觉感知

论文指出科学图表评价不能只看图像清晰度或通用图文匹配,还要判断图是否支撑论文中的具体论证。SciFigAlign将图像、caption、引用段落和论文上下文联合建模,用CLIP/SciBERT、跨模态注意力与CubeMLP回归,并加入同篇内排序损失。在3857个会议论文图表数据上,测试宏MAE为0.3524、同篇成对排序准确率81.64%,相对最佳LLM评审基线误差降低59%。

ScratchSim: A Procedural Synthetic Data Pipeline for Surface Scratch Detection Figure 1
2026-07-30cs.CV

ScratchSim: A Procedural Synthetic Data Pipeline for Surface Scratch Detection

Paul Julius Kühn, Saptarshi Neil Sinha, Tiago Kleist, Richard Hoffmann, Arjan kuijper, Michael Weinmann

2026-07-30视觉感知

面向工业表面划痕检测中真实缺陷样本少、标注成本高的问题,本文用 BlenderProc 构建可配置材质、相机与域随机化的程序化合成数据流水线,并自动生成 COCO 标注。实验在两类材质物体和 YOLOX、YOLO26、LW-DETR 上比较四种训练策略,结果显示仅用合成数据仍受域差影响,但合成预训练后用真实数据微调稳定优于仅真实训练,混合训练也能在真实数据稀缺时恢复性能。

Object Detection for Autonomous Driving in Chinese Rural Scenes: An Experimental Study on Real-Synthetic Data Mixing and Model Evaluation Figure 1
2026-07-30cs.CV

Object Detection for Autonomous Driving in Chinese Rural Scenes: An Experimental Study on Real-Synthetic Data Mixing and Model Evaluation

Danning Zhu, Ziyan Lin, Jing Wu

2026-07-30视觉感知数据集/基准

这篇论文针对中国农村自动驾驶场景中真实标注稀缺、三轮车/低速车/摊位等类别缺失导致的泛化问题,构建河南实拍与 Unreal Engine 合成混合的14类检测数据集,并统一评测13个主流检测器。结果显示适量合成数据更有效,1:0.5混合下 YOLO11m 达到最高 mAP@0.5=0.758;但1:1合成比例带来域偏移,长尾非标准目标仍是主要瓶颈。

Mitigating Compounding Error via Video Representation Regularization Figure 1
2026-07-30cs.CV

Mitigating Compounding Error via Video Representation Regularization

Taiye Chen, Qi Zhang, Yisen Wang

Peking University

2026-07-30视觉感知

这篇论文针对视频扩散世界模型在滑窗自回归生成中长期漂移、误差累积的问题,指出帧质量崩坏与隐藏表征有效秩下降密切相关,且单纯扩大训练数据不能缓解。作者提出视频表征正则化,在 DiT 隐状态上约束表征分布以抑制维度坍塌;在 VBench 上相较 Diffusion Forcing,美学质量由 38.65 提升到 55.56,成像质量由 44.37 提升到 72.08。

Lottery Tickets Are Not Deployment Tickets Figure 1
2026-07-30cs.LG

Lottery Tickets Are Not Deployment Tickets

Bum Jun Kim

2026-07-30视觉感知

论文针对彩票票据/稀疏模型能否直接替换已部署稠密模型的问题,指出单看干净精度恢复会忽略固定阈值、审核预算和下游策略。其创新在于以部署运行点为基准审计校准、OOD、类别可靠性、表示和策略动作,并提出行为兼容距离。实验显示多种数据集和骨干上稀疏模型虽常匹配精度,仍产生行为差异,固定阈值下约7%至10%的接受/复核决策被改变。

InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry Figure 1
2026-07-30cs.CR

InkShield: Writing Style Protection Against Unauthorized Handwriting Mimicry

Jian Xiong, Wenbo Jiang, Zihan Wang, Rui Zhang, Wenshu Fan, Hongwei Li, Guowen Xu

2026-07-30视觉感知

本文针对一张公开手写样本即可被生成模型复用为“风格钥匙”的伪造风险,提出发布前防护方法 InkShield。核心做法是用诱饵书写者定义风格偏移方向,并将扰动限制在笔画边缘,再通过冻结的手写生成代理优化,使扰动不显著污染空白背景且能跨文本生效。在 IAM 上,目标作者 Top-1/Top-5 检索率由 11.94%/36.52% 降至 2.03%/8.79%,LPIPS 为 0.0078,并在其他生成器上显示一定迁移性。

Robust RPC Bundle Adjustment for Multi-Date Satellite Imagery with Season-Invariant Correspondences Figure 1
2026-07-30cs.CV

Robust RPC Bundle Adjustment for Multi-Date Satellite Imagery with Season-Invariant Correspondences

Roger Marí, Elías Masquil, Xavier Bou, Thibaud Ehret, Gabriele Facciolo

2026-07-30视觉感知安全鲁棒

多时相卫星影像因季节、光照和地物变化,传统手工特征匹配会产生噪声连接并影响无地面控制点的 RPC 光束法平差。论文的核心做法是用 SuperPoint+LightGlue 提取更具季节不变性的同名点,并用 DINOv2 全局相似度筛选匹配图,在保持连通性的同时减少高风险配对。WorldView-3 实验显示其相较开源基线降低重投影和 3D 一致性误差,并显著缩短 39-42 视图集合的匹配时间。

Progressive Multimodal Alignment for Continual Instruction Tuning Figure 1
2026-07-30cs.CV

Progressive Multimodal Alignment for Continual Instruction Tuning

Duzhen Zhang, Yahan Yu, Qiaoyi Su, Jiahua Dong, Tielin Zhang

Mohamed bin Zayed University of Artificial Intelligence, Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences, Kyoto University, Migu Culture Technology Co.,Ltd., State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Mohamed bin Zayed University of Artificial Intelligence Abu Dhabi United Arab Emirates, Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences Shanghai China, Kyoto University Kyoto Japan, Migu Culture Technology Co.,Ltd. Beijing China

2026-07-30视觉语言

本文关注多模态持续指令微调中被忽视的投影器遗忘:视觉分布和指令语义变化会使共享投影器漂移,破坏旧任务的跨模态对齐。PMA用轻量描述器检测分布变化,按需扩展投影专家,并通过可扩展路由器在无任务ID下融合专家,同时保留预训练投影器作稳定锚点。实验显示其接入DISCO等方法后,在UCIT和MLLM-DCL上稳定提升,并可迁移到LLaVA、InternVL等骨干。

From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models Figure 1
2026-07-30cs.CV

From Keypoints to Predictive Distributions: Post-Hoc Uncertainty for YOLO-Pose Models

Alexej Klushyn, Juan Rivero Sesma, Florian Seligmann, Richard Kurle, Kinh Tieu, Jayant Sen Gupta

Karlsruhe Institute of Technology, over keypoint locations, centered at the model’s original predictions. Concretely, we train, % probability ellipse centered at the original YOLO prediction, centered at the model’s original predictions. Ellipses denote the corresponding 95% probability regions., parameters fixed and learn bivariate predictive distributions over keypoint locations, centered at the model’s

2026-07-30三维安全鲁棒

本文针对 YOLO-Pose 只给关键点位置、缺少逐点空间不确定性的部署痛点,提出冻结原模型、后接概率头来预测每个关键点的二维离散矩阵,并用 Gaussian 或 Student-t 做校准。其重点不在提升定位均值,而是保留既有模型行为同时给下游筛选、加权和传感器融合提供可靠协方差;COCO 实验显示不确定性可用于关键点可靠性排序,Student-t 更贴合重尾残差,飞机着陆示例展示了其在安全关键位姿估计中的用途。

Prior Directions: Why GUI Grounding Gets Locked in the Past Figure 1
2026-07-30cs.CV

Prior Directions: Why GUI Grounding Gets Locked in the Past

Weile Gong, Zijian Lu, Mingcai Chen, Yiping Zuo, Xin He, Weibei Fan

Nanjing University of Posts and Telecommunications, Nanjing, China

2026-07-30视觉语言

本文关注GUI智能体在界面变化后仍受过期语言记忆牵引的问题,将其定义为视觉锁定。核心洞察是锁定强弱不取决于表示变化幅度,而取决于变化是否集中到可复用的Prior Directions。四个VLM的受控实验显示,锁定更强的模型位移更小但方向更集中;移除这些方向分量可恢复60/66个干净样例的视觉 grounding,而等范数正交移除效果很弱。

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents Figure 1
2026-07-30cs.CV

CinemaTraj: Composing Atomic Camera Trajectories for 3D Scenes with LLM Agents

Qianru Li, Xuyang Chen, Erkin Türköz, Lu Liu, Xuqin Wang, Liqiu Meng, Tao Wu, Yanfeng Zhang

Technical University of Munich, Huawei Dresden Research Center, Technical University of Munich Munich Germany, Huawei Dresden Research Center Munich Germany

2026-07-30三维

针对文本生成3D场景运镜常缺少真实空间约束、而几何规划又忽略电影语义的问题,CinemaTraj让LLM基于3D场景图把提示分解为dolly、orbit、crane等原子镜头,并用可优化的参数化轨迹结合SDF避碰与遮挡优化。ScanNet++实验和用户研究显示,其在提示对齐、运动质量、安全性和目标覆盖上优于对比方法。

StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction Figure 1
2026-07-30cs.GR

StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction

Gahye Lee, Gyoonseo Kim, Wonjong Jang, Jooeun Son, Seungyong Lee

2026-07-30三维

面向可交互物体的重建需要同时恢复部件几何与运动,但仅靠光度监督容易把外观、形状和关节参数纠缠在一起,导致部件边界模糊。StructureGS 在 3D Gaussian Splatting 中为每个部件引入 OBB 结构代理,并用部件拟合、接触等损失约束空间紧致性和相邻部件连接关系。实验显示其在几何质量、部件分解和运动估计上优于现有方法,且在稀疏视角下更稳定,但弱视觉变化场景仍可能失败。

Hearsay: Vision-Language Medical Diagnoses Without an Image Figure 1
2026-07-30cs.CV

Hearsay: Vision-Language Medical Diagnoses Without an Image

Siddharth Vohra

Carnegie Mellon University, Carnegie Mellon University Pittsburgh PA USA

2026-07-30视觉语言视觉感知

本文关注临床流程中图像缺失时,视觉语言模型仍可能输出诊断的安全风险。核心洞察是这种“幻像”并非随机,而会被年龄、性别、种族等人口学描述系统性塑形;作者用结构化 JSON 输出与文本判别双通道审计发现,Claude、GPT-5.4、Gemini 在胸片、MRI、皮肤场景中会生成带偏向的疾病名,如黑色素瘤和结节病,且部分回答文字承认无图像但诊断字段仍被填充。

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation Figure 1
2026-07-30cs.CV

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

2026-07-30视觉语言视觉感知

针对医学视觉语言预训练中轻量文本编码器难处理长临床报告、直接引入生成式医学 LLM 又会带来表示坍缩、显存开销和否定/左右侧混淆的问题,SCALPEL 先用临床报告对 PMC-LLaMA 做 CRC 微调,再冻结文本端并缓存特征,通过非对称对齐和解剖-否定感知损失训练视觉端。实验称其在 MIMIC-CXR、CheXpert、IU X-Ray 的检索、零样本分类和医学 VQA 上达到 SOTA,但具体增益中 scaling 与目标函数的相对贡献仍需看消融细节。

ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures Figure 1
2026-07-30cs.CV

ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

Fahad Ahmed, Sören Auer, Jennifer D'Souza

2026-07-30视觉感知

面向ALD/ALE论文图表中大量关键信息不在正文、且现有多模态模型缺少领域推理能力的问题,本文构建Sci-ImageMiner竞赛基准:覆盖205篇论文、1951张图和四类端到端任务,并引入专家标注流程。结果显示,现有模型在图像分类和摘要上较稳,但在数据抽取与VQA式科学推理上明显受限,说明瓶颈不只是视觉识别,还在领域知识与结构化推理。

BATS: Resource-Efficient Volumetric Segmentation with Boundary-Aware Mixed-Resolution Tokens Figure 1
2026-07-30cs.CV

BATS: Resource-Efficient Volumetric Segmentation with Boundary-Aware Mixed-Resolution Tokens

David Hagerman, Roman Naeem, Fredrik Kahl

2026-07-30视觉感知学习理论

BATS针对3D体积分割中密集多尺度特征带来的显存和推理成本问题,提出按预测边界自适应保留混合分辨率token:均质区域粗表示,边界、薄结构和小目标细处理,并用并行边界预测、fine-first级联和父簇注意力避免粗尺度误判丢失细节。五个CT/MRI数据集上其平均Dice仅低于MedNeXt-L 0.37点,LiTS最佳,在KiTS、LiTS、BraTS显存降低超53%,但BraTS因token更密集推理变慢。

Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory Figure 1
2026-07-30cs.CV

Ripple: Real-Time Streaming Audio-Video Generation With Cross-Modal Recurrent Memory

Yanbo Ding, Zhizhi Guo, Quanyue Song, Yishan He, Zhixiang He, Yongxiang Li, Yali Wang

Work done during an internship at China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.Project leader.

2026-07-30视觉感知

Ripple针对现有音视频生成高延迟、流式方法依赖不断增长KV缓存而难以长时生成的问题,提出固定滑窗结合跨模态循环记忆:音频与视频各自压缩历史状态,再通过跨模态注意交互以维持同步和长期一致性。配合三阶段因果适配、记忆蒸馏和在线强化后训练,模型在480P上达到约28 FPS、较教师模型快15倍以上,并在短视频和30秒长视频基准上优于既有离线与在线方法。

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching Figure 1
2026-07-30cs.RO

From Uncertainty to Determinism: Coarse-to-Fine Visual Floorplan Localization without Ray Matching

Shiyong Meng, Bolei Chen, Ping Zhong, Yang Wan, Rongzhi Wang, Jiazhi Xia, Jianxin Wang

2026-07-30安全鲁棒

这篇论文针对室内视觉平面图定位中重复布局和跨模态信息不对称导致的多峰位姿不确定性,认为不应先压缩为稀疏射线再匹配地图。其核心是 CF2Loc:用图像条件位姿扩散模型生成全局多假设,再在候选位置周围裁剪平面图做局部残差细化,从概率搜索过渡到确定性亚米级修正。实验在 S3D full 和 ZInD 上报告优于现有方法的精度、鲁棒性和效率,并省去离线地图预处理与测试时查表。

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation Figure 1
2026-07-30cs.CV

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation

Jiaxing Li, Kai Zou, Cindy Zhou, Kaichen Huang, Junyao Gao, Zile Wang, Yang Liu, Bin Liu, Bo An, Yangguang Li

Nanyang Technological University, Wellington College, UK

2026-07-30视觉感知

面向自回归视频生成的少步蒸馏,本文指出现有 DMD 多阶段流程把初始化和精炼目标分布割裂,单看 VBench 会掩盖覆盖不足。DistillAlign 用共享潜空间的精度/覆盖评估诊断分布匹配,并将 DMD 的模式寻优与一致性蒸馏的模式覆盖约束联合训练,缓解后期多样性漂移。实验显示其同时提升质量、覆盖和多样性,且 Wan-1.3B 教师配置超过部分 Wan-14B 基线。

PRISM-Net: Patient-specific reference-guided inter-breast symmetry matching for three-class breast DCE-MRI classification Figure 1
2026-07-30cs.CV

PRISM-Net: Patient-specific reference-guided inter-breast symmetry matching for three-class breast DCE-MRI classification

Boya Zhang, Shuaiwen Zhou, Di Kong, Mingxu Wang, Wenbiao Du, Yiman Zhong, Yuexin Duan, Xiawei Yue, Liuquan Cheng, Xiru Li

2026-07-30视觉感知

该文针对乳腺 DCE-MRI 中个体背景强化易干扰无病灶、良性、恶性三分类的问题,提出无需配准的 PRISM-Net,将对侧乳腺作为患者自身参考,通过双侧特征匹配和非对称注意力突出可疑差异。模型在 ODELIA 及外部机构测试中较基线取得更高 Macro/Micro AUC 和 QWK,消融显示双侧关系建模与重加权均有贡献。

See2Think: Do Multimodal Models Really Use Intermediate Visual States? Figure 1
2026-07-30cs.CV

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

The Hong Kong University of Science and Technology, Central South University, Shanghai AI Laboratory, The Hong Kong University of Science and Technology (Guangzhou), University of Science and Technology of China, Fudan University, Wuhan University

2026-07-30视觉语言

这篇论文针对多模态模型生成草图、标注等中间视觉状态后是否真正依赖它们的问题,提出 See2ThinkBench 与 VAoT,把动作是否相关、渲染是否忠实、后续推理是否采纳分开诊断。实验显示不同模型和环境下最优策略不一致,模型常能选对视觉操作,但渲染质量是主要瓶颈;在任务相关的错误反馈下,3D 场景准确率下降超过 10 个百分点,说明部分模型确实受视觉状态行为性影响。

Searching for Robust Augmentations to Improve Out-of-Domain Generalization in Dermoscopic Skin Cancer Classification Figure 1
2026-07-30cs.CV

Searching for Robust Augmentations to Improve Out-of-Domain Generalization in Dermoscopic Skin Cancer Classification

Alexander Kozachok, Ilya Latyshev, Evgeny Karpulevich, Elena Kozachok, Egor Ushakov, Oleg Samovarov

2026-07-30学习理论安全鲁棒

针对皮肤镜分类模型在设备、光照和采集伪影变化下容易失效的问题,本文把重点从换模型转向系统搜索数据增强策略。结果显示,模拟真实域偏移的光度变换与混合策略比追求域内精度更关键,在源外测试上ROC-AUC约提升0.053,但最优策略是在同一 held-out 来源上选择和评估,效果仍需更严格的源隔离验证。

Long-Tailed 3D Point Cloud Dataset Distillation Figure 1
2026-07-30cs.CV

Long-Tailed 3D Point Cloud Dataset Distillation

Jiahao You, Xu Han, Jinfeng Xu, Xianzhi Li

2026-07-30数据集/基准三维

这篇论文关注三维点云数据集蒸馏中被忽视的长尾分布问题,尤其是训练集和测试集同时不均衡时,简单做类别均衡合成集反而会削弱头部类别表现。作者提出按类别规模和边际收益自适应分配合成预算,并用全局-局部特征对齐与先验感知监督优化合成点云;在多个点云分类基准上优于现有蒸馏/coreset方法,ShapeNet55相对SOTA提升约7.0个百分点。

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation Figure 1
2026-07-30cs.CV

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

2026-07-30强化学习

本文针对游戏世界模型只预测像素、容易违背血量归零、技能槽不足等规则的问题,提出显式建模内部状态的 StatePlay。其核心是用状态-画面-动作同步数据和 MoT 式双分支结构联合预测状态与生成画面,让状态反过来约束帧生成。在 Street Fighter 3 上,状态预测归一化 L1 低于 0.06,机制一致性较无状态基线提升 18.6%;但验证集中在单一游戏,跨类型泛化文中未充分说明。

Multimodal fusion of visual and morphometric features for avian bone classification Figure 1
2026-07-30cs.CV

Multimodal fusion of visual and morphometric features for avian bone classification

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi

University of Copenhagen, Denmark, University of Turin, Italy​, University of Groningen, Groningen, Netherlands​, zooarchaeological identification. The approach contributes to ongoing efforts to develop scalable, to the development of a scalable multimodal classification pipeline and to the broader

2026-07-30视觉语言

论文针对鸟类考古骨骼鉴定依赖专家、形态差异细微且数据异构的问题,提出将骨骼图像经 BiRefNet/SAM2 分割、EfficientNet 提取视觉特征,并与骨测量数据做特征级融合的多模态框架。结果显示骨类型分类准确率达 86%,科级分类 top-1 为 51%、top-3 为 75%;但模型主要在完整现代标本上验证,且未按个体级划分,真实考古残片上的泛化仍需进一步说明。

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives Figure 1
2026-07-30cs.CV

Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives

Xiaolong Liu, Junjian Li, Yuan Xiao, Jiaqi Deng, Dayong Ye, Tianqing Zhu, Huan Huo

University of Technology Sydney, City University of Hong Kong, City University of Macau, University of Technology Sydney Sydney Australia, City University of Hong Kong Hong Kong China, City University of Macau Macau China

2026-07-30视觉感知生成模型

本文针对文本到图像扩散模型中仅做 prompt inversion 难以同时保证可读提示词与重建保真度的问题,提出 Dualin:先结合 VLM、CLIP 与 LLM 反推出可解释硬提示词,再用无条件 DDIM inversion 恢复目标图像的潜在噪声,将语义与结构分开建模。实验显示其在提示词质量和图像相似度上优于既有方法,并可支持无需重新优化的可控图像编辑。

Online Handwriting Trajectory Reconstruction from Kinematic Sensors using Temporal Convolutional Network Figure 1
2026-07-30cs.CV

Online Handwriting Trajectory Reconstruction from Kinematic Sensors using Temporal Convolutional Network

Wassim Swaileh, Florent Imbert, Yann Soullard, Romain Tavenard, Eric Anquetil

2026-07-30规划控制三维

论文面向可在纸张等任意表面书写的传感数字笔,解决仅由噪声较大的 IMU/运动学信号在线重建手写轨迹的问题。核心做法是用 DTW 对齐笔端信号与平板真值的不同采样率,并设计受 TCN 启发的时序卷积网络及触笔笔画训练流程,同时提出新基准数据集和基于 Fréchet 距离的评测。实验显示其相对主要竞争方法有明显改进,但具体增益在多大程度来自对齐、模型或数据仍需进一步拆分说明。

CASIAL: Geometric Distortion Robust Image Watermarking Figure 1
2026-07-30cs.CV

CASIAL: Geometric Distortion Robust Image Watermarking

Yupeng Qiu, Han Fang, Ee-Chien Chang

2026-07-30视觉感知安全鲁棒

本文针对深度图像水印在裁剪、遮挡、缩放、旋转等几何变换下易丢失区域证据或解码失同步的问题,提出 CASIAL:用覆盖图像感知的消息扩散把比特证据分布到整幅图像,并用空间注意力学习几何不变对齐表示。实验显示其在六类几何扰动上优于 11 个基线,同时保持较高视觉质量,并对信号、光照及未见黑盒扰动仍有一定鲁棒性。

FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models Figure 1
2026-07-30cs.CV

FreeShadow: Training-Free Shadow Removal via Illumination Transfer and Selective Content Preservation in Diffusion Models

Yinan Wang, Yan Huang, Yong Xu, Patrick Le Callet

2026-07-30生成模型

针对阴影去除依赖成对/非成对数据导致泛化弱、零样本方法又需测试时优化且易出伪影的问题,FreeShadow直接利用预训练Stable Diffusion先验,通过照明转移注意力把非阴影区域光照传到阴影区域,并选择性注入对光照不敏感的注意力与高频特征以保内容,再用局部纹理保持重光照缓解VAE纹理错位。实验显示其在域外图像上更稳健,能生成更自然的无阴影结果。

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models Figure 1
2026-07-30cs.CV

TPD: Temporal Prior Decoupling for Text-to-Video Diffusion Models

Taewon Kang, Matthias Zwicker

2026-07-30视觉感知生成模型

本文针对文本到视频扩散模型在“早期场景持续、后续事件出现”提示中常忽略晚段事件的问题,提出时间先验抑制这一诊断,并用无需训练的 TPD 在采样时构造早段反事实,将全提示与反事实差异作为被压制信号,通过按帧和去噪步调度的下界约束恢复晚段语义。实验显示其提升晚段概念实现,同时基本保持早段一致性、时序连贯和视觉质量。

Sequence-SOD: Bio-inspired Sequence-aware Spiking ObjectDetection for Event Cameras Figure 1
2026-07-30cs.CV

Sequence-SOD: Bio-inspired Sequence-aware Spiking ObjectDetection for Event Cameras

Katharina Bendig, René Schuster, Didier Stricker

RPTU – Technical University Kaiserslautern-Landau, DFKI – German Research Center for Artificial Intelligence, However, many SNN object detectors process isolated event intervals with a single label and reset the network state after, sequence-aware SNN object detector that processes extended event sequences containing labels at multiple time points., encompassing multiple labels across different time points in, sequences that may contain multiple labels at different

2026-07-30视觉感知

面向事件相机在自动驾驶等连续高速场景中的检测需求,论文指出现有 SNN 检测器常按孤立时间窗预测并重置状态,浪费了膜电位的时序记忆。Sequence-SOD 将多标签事件序列顺序输入 SSD 式 Spiking DenseNet,并在序列内保留神经元状态。Gen1 数据集上 mAP 从 23.38 提升到 25.30,结合事件增强达到 26.88,理论预测频率为 40 Hz。

Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation Figure 1
2026-07-30cs.CV

Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation

Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xiao Jin, Yubo Yuan, Qing Yin, Jie Yang, Zhengzhong Tu

2026-07-30视觉感知

论文针对现有视频生成多为离线短片、难以在播放过程中持续响应用户的问题,提出将视频生成视为带状态的 Live Model:按时间块流式生成,并用有界多尺度记忆维持主体、场景和风格,同时支持运行中切换提示词。系统结合事件对齐训练、少步蒸馏、流式超分和多 GPU 推理,在报告配置下实现 4K 24FPS、平均可见响应低于 1 秒,并在 DOVER、VideoAlign 与长程偏好评测中取得领先;但具体增益中模型、数据和服务工程各自贡献仍需消融进一步说明。

Physically Real-time Infrared Attack against Optical Flow Estimation Networks Figure 1
2026-07-30cs.CV

Physically Real-time Infrared Attack against Optical Flow Estimation Networks

Shen You, Wei Jiang, Jiarui Liu, Yijian Ye, Qiuzhen Lin, Xiangtao Li, Ka-Chun Wong

City University of Hong Kong, University of Electronic Science and Technology, Shenzhen University, Jilin University

2026-07-30生成模型

本文关注光流估计网络作为自动驾驶、监控等下游系统上游模块时的物理鲁棒性风险。作者提出用人眼不可见的红外灯进行实时物理攻击,预先生成大量对抗样本并动态显示,强调从“数字生成再物理部署”转向“物理训练与部署”。实验称该方法在不同光照、目标速度和位置下均能显著干扰光流估计,但具体增益相对各损失项的来源仍需看完整消融。

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time Figure 1
2026-07-30cs.CV

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

2026-07-30视觉感知生成模型

本文针对扩散文生图在复杂组合提示下容易漏物体、串属性和空间错配的问题,提出无需训练的 AnchorSteer,从推理端同时改造初始噪声和去噪轨迹:用 CLIP 先验与 LP-SDS 构造更贴合文本且保持分布一致的初始化,再通过 VLM 诊断驱动的 Think-Erase-Retouch 循环中途回滚并修正语义偏差。实验称其在 GenEval 和 T2I-CompBench++ 上较现有基线提升文本图像对齐,同时保持视觉质量。

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation Figure 1
2026-07-30cs.CV

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao

2026-07-30强化学习三维

本文针对单张室内全景图难以生成可自由漫游、可用于仿真的3D场景的问题,提出以NavMesh规划的度量轨迹驱动全景视频扩散,再由前馈重建器转为3D Gaussian的两阶段流程。关键在于用可控多视角视频弥合生成与重建,并通过长短轨迹混合训练和shortcut自一致性把采样降到4步。实验显示其在全景视频质量和下游3D重建上优于几何条件基线,并能零样本泛化到未见室内场景。

FPSGen: Flexible Point Cloud Scene Generation with BEV-Supported Transport Flows Figure 1
2026-07-30cs.CV

FPSGen: Flexible Point Cloud Scene Generation with BEV-Supported Transport Flows

Wenzhe He, Meng Wang, JiaWei Qian, Jinfeng Xu, Ying Liu, Ruihui Li

2026-07-30生成模型三维

FPSGen针对户外点云生成中过度依赖部分LiDAR扫描的问题,指出训练与推理初始化不一致会放大稀疏和遮挡偏差。方法用BEV密度、高度与掩码先验采样点源,并以教师-学生近似最优传输拉直生成路径,从而统一无条件、LiDAR和布局条件生成。实验称其在SemanticKITTI完成任务的JSD与体素IoU达到领先水平,在KITTI-360无条件生成中Coverage最佳,且单步传输仍保持较强效果。

FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID Benchmarking Figure 1
2026-07-30cs.CV

FakeIDet3-DB: Refining Digital Attacks and Patch Extraction for Secure ID Benchmarking

Muñoz-Haro Javier, Teruel Andres, Tolosana Ruben, DeAlcala Daniel, Vera-Rodriguez Ruben, Morales Aythami, Fierrez Julian

2026-07-30数据集/基准

针对真实身份证件难以因隐私合规而用于伪造检测训练、合成模板又缺少真实安全纹理导致域偏移的问题,本文构建 FakeIDet3-DB:在真实政府 ID 上生成经典与生成式 AI 数字篡改,并通过 PACE 在匿名遮挡边界提取高语义密度补丁以避免 PII 泄露。数据含 6.4K 余张图像和约 5.2M 补丁;现有方法在检测上仍有 32.45% EER、定位 AUC-ROC 为 83.48%,显示真实高质量 ID 篡改仍具挑战。

Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach Figure 1
2026-07-30cs.CV

Understanding Knowledge Transfer Mechanism in Heterogeneous MLLM Fusion: A Simple Linear Approach

Yinghao Hou, Jiahe Fan, Yuanhao Pu, Zongyuan Chen, Hong Xie

2026-07-30视觉感知

论文针对异构多模态大模型融合中“小模型到底继承了什么能力”这一不透明问题,提出训练-free 的 CDPI 线性探针,将大模型参数方向投射并少量注入小模型,以分解组件、层映射和注入比例的影响。实验显示跨尺度增益主要集中在高层推理,感知能力基本不变,且收益多来自语言模型线性权重,只在小注入比例的低干扰区间稳定出现。

JEPADepth: Masked Predictive Representation Learning for Self-Supervised Monocular Depth Estimation Figure 1
2026-07-30cs.CV

JEPADepth: Masked Predictive Representation Learning for Self-Supervised Monocular Depth Estimation

Ionuţ Grigore, Călin-Adrian Popa

2026-07-30视觉感知

JEPADepth针对自监督单目深度过度依赖像素级光度重建、易受光照和纹理变化影响的问题,在标准视图合成训练中加入I-JEPA式掩码表征预测,用DINOv3特征约束区域级空间关系,且推理时不增加模块。实验显示其在KITTI上优于同一光度基线,并在Make3D、Cityscapes零样本迁移中取得最好或接近最好的多项指标,但具体增益仍可能部分来自DINOv3预训练表征。

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution Figure 1
2026-07-30cs.CV

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

Tsinghua University, Beijing National Research Center for Information Science and Technology

2026-07-30视觉语言

本文针对多模态大模型视觉指令微调成本高、视觉与文本 token 在深层可能不需共享同一路径的问题,提出 DVP:前半层共享处理后按模态拆分,视觉 token 仅经过一个新训练的 Transformer 块,文本继续走冻结 LLM 深层。基于 LLaVA-1.5/Vicuna-7B 的实验显示,其在 MME、POPE、ChartQA 上接近全量微调,POPE 还略高于基线,但更复杂推理和更大规模模型上的有效性文中未充分说明。

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM Figure 1
2026-07-30cs.CV

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, School of Electronic and Computer Engineering, Peking University, Shenzhen 518055, China, Peng Cheng Laboratory, Shenzhen, 518055, China, College of Physics and Information Engineering, Fuzhou University, Fuzhou 350108, China

2026-07-30三维

论文针对3D Gaussian Splatting质量评估不能只看单视角2D失真的问题,提出SpatialQ:用VGGT式多视图编码器学习跨视角与几何质量表征,再让Qwen多模态模型结合图像、深度、点云和相机参数推理退化类型与严重度,并以此修正基础分数。实验称其在3DGS场景质量预测上更稳健,且能给出与场景结构一致的退化归因。

R-SLPR: Region-based Small-to-Large Point-cloud Registration with Contrastive Learning Figure 1
2026-07-30cs.CV

R-SLPR: Region-based Small-to-Large Point-cloud Registration with Contrastive Learning

Yusen Wan, Zeyuan Chen, Qianshi Zou, Xu Chen

Yusen Wan, Zeyuan Chen, Qianshi Zou, and Xu Chen are with the Department, of Mechanical Engineering, University of Washington, Seattle, WA, USA.

2026-07-30视觉感知

这篇论文针对机器人场景中“小片段点云对齐到大规模参考点云”这一高尺度差、低重叠问题,指出现有配准方法通常默认两云规模接近。R-SLPR将任务拆成区域提议、区域匹配和迭代细化,用Fibonacci网格生成候选区域,并以对比学习增强局部匹配判别,再通过CASR逐步收敛到目标区域。在ModelNet40上,方法报告位置MAE 0.009、旋转MAE 1.104,优于多种基线;但实测主要集中在合成基准,真实机器人部署泛化仍需更多验证。

Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer Figure 1
2026-07-30cs.CV

Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer

Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Stephen Gould, Damith Ranasinghe

2026-07-30视觉感知

论文针对零样本视觉语言模型OOD检测中“基准榜首能否迁移到新部署”的选择问题,发现不同ID数据集和VLM会导致检测器排名反转。核心洞察是各方法依赖的绝对匹配强度、相对/空间尖锐度及外部语义覆盖并不等价,因此提出CEG用ID分位数做非补偿融合。实验覆盖17个ID数据集、3个VLM和7类检测器,显示所有检测器至少在一个域FPR95超过80%,CEG可将GL-MCM和MCM的family-balanced FPR95显著降低。

Classification of Disease from Lungs X-ray Images using VGG16, VGG19 and ResNet50 Models Figure 1
2026-07-30cs.CV

Classification of Disease from Lungs X-ray Images using VGG16, VGG19 and ResNet50 Models

Nand Lal Yadav, Rajesh Kumar, Satyendra Singh, Sudhakar Singh

Department of Electronics and Communication, University of Allahabad, Prayagraj, India., Technology (IJDDT) and is available online at https://doi.org/10.25258/ijddt.16.26s.117 .

2026-07-30视觉感知

针对肺炎、结核、肺癌与正常胸片的早筛需求,论文比较了 VGG16、VGG19 与 ResNet50/ResNet50v2 在肺部 X 光多分类中的迁移学习表现,并考察数据增强前后指标。主要结果称三者均可用、ResNet50 系列准确率和效率最佳,但具体数据规模、划分与增益来源文中未充分说明。

ContactFlow: A video action conditioning that transfers across embodiments Figure 1
2026-07-30cs.RO

ContactFlow: A video action conditioning that transfers across embodiments

Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum

University of Bonn, Lamarr Institute

2026-07-30视觉感知生成模型

这篇论文针对视频世界模型在机器人操作中常忽略接触物理、且动作条件绑定特定手爪或人体形态的问题,提出 Contact Flow:用演员与目标物体之间 3D 接触点的时序轨迹作为跨具身动作表示。作者将其用于条件视频生成,并接入“提出-想象-验证-执行”流程,由 VLM筛选生成的候选执行结果;在 DROID、未见物体/场景和真实桌面任务上展示了从人类示范到不同机器人形态的迁移能力,但实时性和对深度、标定、分割质量的依赖仍是限制。

3DGBGS: 3D Granular Ball Gaussian Splatting for Compact Novel View Synthesis Figure 1
2026-07-30cs.CV

3DGBGS: 3D Granular Ball Gaussian Splatting for Compact Novel View Synthesis

Meng Yang, Shuyin Xia, Dawei Dai, YiWang

This work was supported by the Chongqing Key Laboratory of, Computational Intelligence, the Key Laboratory of Cyberspace Big Data, Co-construction Key Laboratory of Digital Economy Intelligence, and the, Key Laboratory of Big Data Intelligent Computing, Chongqing University, of Posts and Telecommunications, Chongqing, China.Meng Yang, Shuyin Xia, and Dawei Dai are with Chongqing University, of Posts and Telecommunications, Chongqing, China.Yi Wang is with Chongqing Ant Consumer Finance Co., Ltd.

2026-07-30三维

这篇论文针对 anchor-based 3DGS 用固定体素化从 SfM 点云建锚点时难以适应空间非均匀分布、容易在平滑区域产生冗余的问题,引入粒球计算来按局部复杂度自适应划分点云:用粒球中心初始化更紧凑的锚点,并用半径提供高斯生成的局部尺度先验。在四个基准、19 个场景上,方法平均减少初始锚点 37.1%、最终锚点 10.0%、存储 9.8%,同时保持接近 Scaffold-GS 的渲染质量。

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots Figure 1
2026-07-30cs.RO

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen

∗Equal contribution. 1University of California San Diego, 2VinMotion, Hanoi University of Science and Technology, 4VinUniversity, 5University, level distillation with pseudo-label supervision from the

2026-07-30机器人视觉感知

这篇论文针对人形机器人中语音比文本更自然、但现有抓取检测多依赖文本提示的问题,研究如何把已训练好的文本条件模型低成本迁移到语音输入。核心洞察是用 Whisper 编码语音,再以轻量 MLP 投影到 ALBEF 的图文共享表示空间即可缩小文本-语音表征差距。仿真和真实人形机器人实验显示,Speech2Grasp 在抓取检测上达到或优于 ASR 级联系统,并因跳过转写降低推理延迟。

Representation Trajectories Matters: Complementary Evidence for OOD Detection and Image Classification Figure 1
2026-07-30cs.CV

Representation Trajectories Matters: Complementary Evidence for OOD Detection and Image Classification

Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Hamed Damirchi, Stephen Gould, Damith Ranasinghe

2026-07-30视觉感知

这篇论文关注视觉模型只使用最终表示会丢掉“如何得到表示”的可靠性信息。作者把同一样本跨层状态串成表示轨迹,区分类共享迁移与样本特异偏离,用轨迹惊讶度补充最终状态检测。结果显示该信号在 OpenOOD 多数比较中降低 FPR95,并在 clean 分类上几乎全面提升,但 shifted 数据收益依赖架构和扰动类型。

MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models Figure 1
2026-07-30cs.CV

MedARC: Training-Free Adaptive Redundancy Compression of Visual Tokens for 3D Medical Vision-Language Models

Yitao Zhu, Mengjun Liu, Yingji Fu, Haowen Pang, Anqi Qiu

2026-07-30视觉语言视觉感知三维

针对3D医学VLM中体数据产生大量冗余视觉token、压缩又易丢失病灶线索的问题,MedARC提出无需训练的自适应压缩:融合视觉注意力、文本查询相似度和3D视觉基础模型的结构异常性评分,保留高重要token并合并冗余token。CT-RATE与MR-RATE实验显示其可降低token开销和推理时间,同时保持或提升报告生成与VQA诊断表现。

From Spatial Semantics to Temporal Context: Leveraging Gaze Trajectory for Weakly Supervised Medical Image Segmentation Figure 1
2026-07-30cs.CV

From Spatial Semantics to Temporal Context: Leveraging Gaze Trajectory for Weakly Supervised Medical Image Segmentation

Shaoxuan Wu, Xiao Zhang, Xiaodi Zhao, Yunzhi Tian, Yilin Tang, Jun Feng

2026-07-30视觉感知规划控制

针对医学图像分割依赖像素级标注、现有凝视监督多将注视点压成静态注意图而丢失诊断过程的问题,TrailNet将医生凝视轨迹作为时序上下文显式建模,并与图像空间语义交互;同时用多尺度不确定性解码和循环蒸馏缓解探索性注视噪声、支持无凝视推理。在两个公开数据集上Dice达到81.25%和81.85%,优于已有弱监督方法。

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models Figure 1
2026-07-30cs.CV

TPCD: Tone-Pressure Contrastive Decoding and the Label-Free Gating Bottleneck in Vision-Language Models

Jinkun Zhao, Kui Zhang, Wenjun Wu

Beihang University

2026-07-30视觉语言视觉感知

论文关注高压、诱导式提问会让视觉语言模型把不确定视觉证据说成确定答案的问题。核心做法是把高压提示下的 logits 当作负分支,从安全中性分支中做对比解码,并指出真正瓶颈在于无标签路由何时启用该抑制。结果显示,TPCD 可将 LLaVA 在 tone-matters 上的 ASR 从 66.75% 降到 0.50%,但会严重损伤正例;加入任务先验或答案分歧门控后,可在 GLM、Llama held-out 模型上优于安全提示,但路由仍是后验、表面形式规则,未充分证明具备 grounding 感知能力。

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling Figure 1
2026-07-30cs.CV

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

2026-07-30视觉感知规划控制

面向电影叙事视频中多镜头切换、角色/场景可控和长时一致性难以兼顾的问题,CineWeaver指出预训练视频扩散模型的主要障碍是推理过程偏向时间连续性,而非缺乏场景生成能力。方法通过位置编码、注意力、VAE解码等推理期操作打断镜头间连续性,并用按镜头路由的参考条件与锚点记忆维持身份和全局外观。实验显示其无需重训练即可生成更清晰转场、更稳定参考一致性的长视频,但摘要片段未充分说明相对各基线的具体量化增益。

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding Figure 1
2026-07-30cs.CV

EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding

Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng

2026-07-30数据集/基准安全鲁棒

EgoSafe针对现有安全视频评测偏重第三人称、二分类和表层识别,难以检验第一人称受限视野下的证据推理问题,构建了3000段手机采集视频与12000个样本,并用四层HRE要求模型从可见线索推到盲区行为和因果结果。实验显示Qwen3-VL、Gemini、VideoLLaMA 3等虽能较好描述画面,但在多步推理、遮挡和噪声下明显掉分,暴露出感知与推理脱耦及过度自信。

Semantic-Aware Temporal Adaptation for UAV Anti-UAV Tracking Figure 1
2026-07-30cs.CV

Semantic-Aware Temporal Adaptation for UAV Anti-UAV Tracking

Xiaozhen Qiao, Da Zhang, Yubin Guo, Junyu Gao, Zhiyuan Zhao, Xuelong Li

UAV and UAV object tracking tasks. The code will be available, X. Qiao is with the School of Information Science and Technology, University of Science and Technology of China, Hefei 230026, China., This work was done during a research internship at the Institute of, D. Zhang and J. Gao are with Northwestern Polytechnical University, Xi’an, China, and also with the Institute of Artificial Intelligence (TeleAI), Y. Guo is with the University of Science and Technology of China, Hefei, China, and also with the Institute of Artificial Intelligence (TeleAI), China, Z. Zhao and X. Li are with the Institute of Artificial Intelligence (TeleAI), • We conduct comprehensive experiments centered on

2026-07-30视觉感知

这篇论文针对空中平台追踪敌方无人机时相机与目标同时运动、外观快速失真且易被相似干扰物误导的问题,提出 SATATrack:用目标语言描述作为跨帧语义锚点,引导状态空间时序传播,并在测试时用 TADA 对齐视频内特征分布且不更新权重。实验称其在 UAV-Anti-UAV 上达到 SOTA,并在 Anti-UAV 与常规 UAV 跟踪任务上保持竞争力。

HERMES: A Hybrid Ensemble for Head-and-Neck Tumor Segmentation, TN Staging, and Recurrence-Free Survival on PET/CT Figure 1
2026-07-30cs.CV

HERMES: A Hybrid Ensemble for Head-and-Neck Tumor Segmentation, TN Staging, and Recurrence-Free Survival on PET/CT

Kai Wang, Meixu Chen, Elie Nasr, Ryan Lanning, Moyed Miften

2026-07-30视觉感知

HERMES面向HECKTOR 2026中PET/CT头颈肿瘤从分割到TN分期和无复发生存预测的一体化需求,核心洞察是下游分期不应依赖泛化影像组学,而应从预测掩膜提取与AJCC定义一致的结节数量、大小和负荷等几何特征。其10折STU-Net集成驱动全流程,在验证集上Mean Dice为0.641,T/N平衡准确率为0.580/0.642,RFS C-index为0.679;N分期增益较清晰,但部分交叉验证区间仍含零。

Interpretable Image-Level Acne Severity Grading via EfficientNet-B0 Transfer Learning and Grad-CAM Figure 1
2026-07-30cs.CV

Interpretable Image-Level Acne Severity Grading via EfficientNet-B0 Transfer Learning and Grad-CAM

Sophie Zeng, Sean Kalaycioglu, Collin Hong, Haipeng Xie

Dr. Robot Inc., Toronto, ON, Canada, Department of Aerospace Engineering, Toronto Metropolitan University, Toronto, ON, Canada, Skinopathy Inc., Toronto, ON, Canada

2026-07-30视觉感知

针对痤疮严重度人工分级受医生差异和拍摄条件影响的问题,本文用 ImageNet 预训练 EfficientNet-B0 在 ACNE04 上做四级 Hayashi 图像级分类,并用 Grad-CAM 提供可检查的病灶关注区域,同时发布 Python/MATLAB 跨平台实现。448 张留出测试集上准确率 93.5%、macro-F1 94.4%、加权 κ 为 0.956,错误多为相邻等级;但临床部署仍需跨设备、前瞻外部验证。

CG-World: A Large-Scale World-State Dataset and Protocol for World Models Figure 1
2026-07-30cs.AI

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo

2026-07-30强化学习数据集/基准

这篇论文瞄准世界模型缺少同时对齐状态、动作、事件与观测的数据基础问题,提出从工业 CG 生产流程中抽取中间世界状态的 CG-World 协议与约 85 万段数据,并显式记录干预与反事实分支。实验覆盖几何条件视频生成、动作预测和 VLA 闭环迁移,显示结构化监督能带来稳定提升;但其物理真实性受生产偏差和引擎特性限制,可能主要来自 data scaling 与更密集标注。

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing Figure 1
2026-07-30cs.CV

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

2026-07-30视觉感知

本文针对人脸防伪从单一真假判别走向可审查证据的需求,提出 FAS-R1:先用 2.3 万长 CoT 数据冷启动多模态模型,再以面向防伪的 GRPO 训练,引入退化模拟增强稳定视觉线索,并用难度感知重加权缓解易样本主导。3B 模型在域内达到 98.75% 真实性准确率、93.33% 攻击类型准确率和 96.30/94.73% AP@40/AP@50,并提升跨域与解释质量。

When Fish Look Alike: Tracking Identities with Dual-branch Elasticity Figure 1
2026-07-30cs.CV

When Fish Look Alike: Tracking Identities with Dual-branch Elasticity

Vran Lee, Xin Liu, Yijie Wei, Yeqiang Liu, Hwa Liang Leo, Zhenbo Li

China Agricultural University, Beijing Normal University, National University of Singapore

2026-07-30视觉感知

本文面向密集、外观高度相似且会快速形变的鱼群多目标跟踪,动机是现有依赖重型 Re-ID 的方法难以部署到水下边缘设备。TIDE 的核心思路是弱化外观匹配,使用基于质心距离和结构一致性的 AGCIoU 做关联,并提供轻量/可扩展双分支以适配不同算力。实验中 L 分支以 20.47G FLOPs 达到 28.43 HOTA,相比 SU-T 降低约 38.7 倍计算量;S 分支达到 29.98 HOTA。

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering Figure 1
2026-07-30cs.CV

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

Yu Wang, Sharon Li

Department of Computer Sciences, University of Wisconsin-Madison

2026-07-30视觉语言

本文关注统一多模态模型中“理解”和“生成”是否真的共享语义空间。作者提出跨分支语义 steering:从一侧提取语义方向并注入另一侧,以干预结果检验可迁移性。结果显示,理解分支学到的对象中心语义可有效控制图像生成并提升语义忠实度、缓解关系幻觉;反向从生成到理解基本无效,说明架构统一不等于表示对齐,差异可能来自生成侧更偏低层外观特征。

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation Figure 1
2026-07-30cs.CV

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

2026-07-30视觉感知

针对手持内镜中白光与窄带图像成对但未配准、直接融合会污染病灶边界的问题,论文提出先用拓扑正则化的可微配准估计局部对应可靠性,再在复数频谱中让白光主导幅值外观、窄带主导相位结构,并按可靠性抑制错配交互。实验称在成对 WLI/NBI 数据上优于多模态分割基线,消融支持配准可靠性与模态角色设计的贡献。

Zero-Fi: Zero-Shot Wi-Fi-Based Human Activity Recognition via Contrastive Signal-Language Alignment Figure 1
2026-07-30cs.CV

Zero-Fi: Zero-Shot Wi-Fi-Based Human Activity Recognition via Contrastive Signal-Language Alignment

Yitong Shen, Cheng Guo, Peiliang Wang, Jingzhe Zhang, Yi Sheng, Haopeng Zhang, Hongfei Xue, Yili Ren

2026-07-30视觉感知

针对现有 Wi-Fi 人体活动识别依赖封闭类别和逐类标注、难以识别训练外动作的问题,Zero-Fi 将互补 Wi-Fi 信号特征与由大语言模型生成的动作属性描述进行对比式信号-语言对齐,并用域判别器与天线共轭乘法抑制环境和硬件噪声。在严格零样本设置下,多组公开数据集平均准确率达 69.58%,优于基线。

Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance Figure 1
2026-07-30eess.IV

Rethinking Clinical Relevance in Chest X-ray Machine Learning: How Evaluation References Define Performance

Panagiotis Fytas, Ian Selby, Clemens Karner, Judith Babar, Simon Baker, Jake Beckford, Timothy J. Sadler, Shahab Shahipasand, Arthikkaa Thavakumar, John Li Chen, Alex Sawer, Michael Roberts, Jonathan Weir-McCall, J. H. F. Rudd, Carola-Bibiane Schönlieb, Anna Korhonen, Anna Breger

2026-07-30数据集/基准

这篇论文关注胸片机器学习中“用什么作为评估真值”这一常被弱化的问题:报告标签、图像专家标签和通用图像质量指标可能对应不同临床含义。作者构建含配对图像/报告标注与专家质量评分的 XQA-Chest,并重标注部分 MIMIC-CXR,比较分类模型和 IQA 指标。结果显示,更换评估参考会显著改变性能估计和模型排序,SSIM、PSNR 等也常不能反映诊断可用性,说明评估参考本身应被视为临床有效性的核心条件。

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models Figure 1
2026-07-30cs.CV

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

University of Copenhagen, University of Cambridge, Clemson University

2026-07-30视觉语言

论文针对多模态大模型在视觉证据与语言先验冲突时究竟是“没看见”还是“不会用”的问题,提出用最终层图像 token 重建来分离感知与利用,并构建 WhatIfVis 测试视觉上下文敏感性。结果显示粗粒度视觉属性仍被编码,瓶颈主要在模型无法稳定控制依赖图像还是先验;SFT、激活定位和单一 steering vector 可提升这种可控性。

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer Figure 1
2026-07-30cs.CV

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer

Nazanin Amini, Kevin Desai

2026-07-30视觉感知

MoSAIC面向角色动作编辑中“只替换局部风格、保留原动作时序与根轨迹”的需求,指出自重建训练缺少局部替换的反事实监督,容易忽略参考或污染未选部位。其核心是按身体区域分解内容/参考条件,并用对齐干预构造同步参考和精确局部目标。实验显示,相比全身路由,保留区域误差从70.64降至66.45 mm,离目标泄漏从18.08降至9.88 mm,同时保持选区响应。

Eddeep: a deep-learning framework for fast eddy-current distortion correction in diffusion MRI Figure 1
2026-07-30cs.CV

Eddeep: a deep-learning framework for fast eddy-current distortion correction in diffusion MRI

Antoine Legouhy, Ross Callaghan, Yuchuan Qiao, Whitney Stee, Philippe Peigneux, Hojjat Azadbakht, Hui Zhang

Hawkes Institute & Department of Computer Science, University College London, AINOSTICS ltd., Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University, affiliated at CRCN - Centre for Research in Cognition and Neurosciences, and UNI - ULB Neuroscience Institute, GIGA - Cyclotron Research Centre - In Vivo Imaging, University of Liège (ULiège)

2026-07-30生成模型

扩散 MRI 的涡流畸变会随梯度方向和强度变化,造成体间错位,而 FSL Eddy 等迭代校正代价较高。Eddeep 将问题拆成监督式图像外观标准化与无监督配准,并用物理约束的二次畸变模型联合估计涡流和头动参数,实现单次前向校正。在 UK Biobank 与 Memodyn 上,其多项质量指标接近 FSL Eddy,同时显著缩短推理时间。

HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework Figure 1
2026-07-30cs.CV

HeteroPROPMT: A Real-time and Privacy-Preserving Heterogeneous Collaborative Perception Framework

Armin Maleki, Hayder Radha

Electrical and Computer Engineering, Michigan State University

2026-07-30视觉感知

这篇工作针对车路协同感知中不同传感器、模型和训练域导致的 BEV 特征域偏移,以及现有方法需重训或依赖私有元数据的问题,提出 HeteroPROMPT:用低秩视觉 prompt 与 FiLM 只调节少量模块,并用自编码器压缩特征来无元数据识别模态和路由。OPV2V-H、V2XSet 实验显示其 AP 优于已有异构协同感知方法,训练开销降约 96%,模态分类准确率超过 99.99%。

Comparing the Performance of Foundation Model Derived Embeddings with Traditional Approaches for Distant Metastasis Prediction in Head and Neck Cancer Figure 1
2026-07-30cs.CV

Comparing the Performance of Foundation Model Derived Embeddings with Traditional Approaches for Distant Metastasis Prediction in Head and Neck Cancer

Erich Schmitz, Meixu Chen, Bowen Jing, Jing Wang

Intelligence and Automation (MAIA) Laboratory, Department of Radiation Oncology, University, of Texas Southwestern Medical Center, Dallas, Texas, accessible and scalable option., VI. Data Availability

2026-07-30视觉感知

这篇论文针对头颈癌远处转移风险预测中,传统影像组学和深度特征依赖肿瘤分割或ROI、流程耗时且带主观性的痛点,比较了直接从全量预处理CT中提取CT Foundation嵌入的方案。其核心洞察是基础模型特征在减少专家标注和3D训练负担的同时仍具竞争力:在RADCURE 2327例上AUC达0.791,高于影像组学0.772和深度特征0.753,接近组合特征0.794。

Lightweight Image Classification of Raptor Species for Edge Devices: Rare-Species Dataset Expansion via Video Frame Extraction, Knowledge Distillation, and TensorRT Deployment Figure 1
2026-07-30cs.CV

Lightweight Image Classification of Raptor Species for Edge Devices: Rare-Species Dataset Expansion via Video Frame Extraction, Knowledge Distillation, and TensorRT Deployment

Takeshi Nishikawa

2026-07-30视觉感知数据集/基准

面向风电场猛禽撞击缓解中的边缘端实时物种识别,论文用视频帧扩增稀有类数据并重训 DINOv2-L 教师,再压缩到 MobileNetV4、ViT-Small、EfficientNet-B0 等学生模型。关键洞察是主要收益来自稀有类数据扩增和教师再微调,而非蒸馏或更新到 DINOv3。三学生集成在分组划分下宏召回达 0.935,EfficientNet-B0 经 TensorRT FP16 在 Jetson Orin Nano 上达 3.19 ms/图且几乎保持 FP32 预测一致。

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models Figure 1
2026-07-30cs.CV

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

The University of Texas at Austin, University of Colorado Boulder

2026-07-30生成模型

本文针对预训练扩散模型受 SDR 训练数据偏置影响、难以生成真实 HDR 亮度结构的问题,提出无需训练的 LumaGuide:在采样时用可微能量引导匹配 PQ 空间亮度直方图,并以 Wasserstein 距离塑形输出分布。实验称其在 Flux、SDXL、SD3 和 CogVideoX 上改善 HDR 统计对齐、保留语义与阴影细节,并可扩展到带时间一致性约束的视频生成。

Spline-Based Boundary Representations for Sparse View Reconstruction and Simulation Using Isogeometric Analysis Figure 1
2026-07-30cs.CV

Spline-Based Boundary Representations for Sparse View Reconstruction and Simulation Using Isogeometric Analysis

Davor Dobrota, Vsevolod Skorokhodov, Chenghao Xu, Olga Fink, Malcolm Mielle

2026-07-30学习理论三维

这篇论文针对图像重建模型难以直接用于数值仿真的问题,提出 FORGE-SIM:从稀疏位姿 RGB 图像直接优化多片 B 样条边界表示,并把纹理、热场和语义场投影到同一样条基上,连接 CAD/IGA 仿真流程。实验显示,较好重建的形状上热仿真与模态分析接近基于真值网格的 FEM,视觉重建指标也不弱于网格优化基线;但六片球面参数化限制了拓扑,细节可能被过度平滑。

BG-REAL: A Public Real-Data Anchored Benchmark for Background Manipulation Detection and Localization Figure 1
2026-07-30cs.CV

BG-REAL: A Public Real-Data Anchored Benchmark for Background Manipulation Detection and Localization

Bugra Alperen Uluirmak, Rifat Kurban

2026-07-30机器人视觉感知数据集/基准

本文针对背景篡改常被现有取证评测忽视的问题,提出 BG-REAL 基准:以 Open Images V7 构建 7000 个样本、六类编辑、匹配真实重编码对照和源隔离划分,用于检测与定位背景操作。主要洞察是重编码伪迹会成为捷径,基线在匹配真实对照上的误报率高达 0.57 至 1.00;TruFor 的 AUROC 约 0.84,明显优于 MVSS-Net 和 HiFi-Net,但该基准仍非完全真实世界数据集。

Lag-aware cross-hand alignment for dual-hand action segmentation Figure 1
2026-07-30cs.CV

Lag-aware cross-hand alignment for dual-hand action segmentation

Fatemeh Ziaeetabar

Department of Computer Science, School of Mathematics, Statistics and Computer Science, College of Science, University of Tehran, Tehran, Iran

2026-07-30视觉感知

本文针对双手动作分割中左右手状态切换常不同步的问题,指出同一时间索引融合会在边界附近混合不同语义阶段。核心方法 LACA 显式估计双向时间偏移分布,并用空状态抑制无匹配的跨手信息;其在线变体 LACA-C 仅用当前和过去帧。在 HA-ViD 与 ATTACH 上,LACA 相比复现 Polyphony 提升 F1@50 和边界 F1,且仅增加约 0.0086M 参数。

Where Physics Meets Privacy: Federated PINNs for Privacy-Preserving Brain Tumor Biomechanical Modeling Figure 1
2026-07-30cs.CV

Where Physics Meets Privacy: Federated PINNs for Privacy-Preserving Brain Tumor Biomechanical Modeling

Mahmuda Akter Sristy, Md Al-Mahfuz Chowdhury, Momota Ahsana Meem, Sajid Ahamed, Kazi Irfan Subhan

Dept. of Computer Science and Engineering, United International University

2026-07-30视觉感知

这篇论文针对脑肿瘤MRI建模中患者数据难以跨院集中、纯数据驱动模型又缺少组织力学约束的问题,提出把联邦学习与线性弹性方程约束的PINN结合,在三处模拟临床站点用FedAvg共享权重而不共享原始数据。实验在四类脑肿瘤数据上达到91.4%准确率,略高于集中式基线90.0%,平均AUC为0.985,并改善垂体瘤分类;但站点为模拟划分,真实跨院泛化与增益来源仍需进一步验证。

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models Figure 1
2026-07-30cs.CV

WildShadowRemover: In-the-Wild Video Shadow Removal via Detail-Preserving Video Diffusion Models

Jiamin Xu, Cong Wang, Zheng Dong, Chi Wang, Renshu Gu, Weiwei Xu, Gang Xu

2026-07-30视觉感知生成模型

本文针对野外视频阴影去除在复杂光照、多样阴影和缺少成对训练数据下泛化差、时序不稳定的问题,提出用预训练视频扩散模型经 LoRA 适配,并结合细节注入、阴影掩码引导的频率调制和 DA3 深度先验来保纹理、抑制阴影伪影;同时构建 WildShadow 数据集。实验显示其在去阴影质量、时序一致性和跨场景泛化上优于既有方法,但增益可能部分来自 scaling / data。

Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography Figure 1
2026-07-30cs.CV

Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

Quoc-Huy Trinh, Minh-Van Nguyen, Ulas Bagci

Northwestern University, Technical University of Denmark

2026-07-30三维

针对3D CT自监督编码器难以保留粗粒度空间与几何结构、影响器官识别和空间问答的问题,Rad-JEPA 3D用遮挡视图预测完整体数据的潜表示,并以H-Mamba融合切片连续性建模和跨平面注意力,再用HSOR减少中间特征冗余。约12万CT预训练后,在Spatial-Med取得最佳平均空间推理分数,闭合式VQA也达到竞争水平,但部分收益可能来自数据规模。

A Picture Says Thousands of Words - Harnessing Dermal Exposure Data from Images through Hybrid Deep Learning for Enhanced Safety Assessment Figure 1
2026-07-30cs.CV

A Picture Says Thousands of Words - Harnessing Dermal Exposure Data from Images through Hybrid Deep Learning for Enhanced Safety Assessment

Hua Qian, Manisha Kotha, Tuan Tran, Jennifer Shin, Haining Zheng

available, can significantly enhance the accuracy of both, consuming, subjective, and not easily scalable., The advancement and widespread availability of record-, tool, or VIA, to label pictures in Common Objects in Con-, number of images available for our pilot study, the perfor-, exposed skin. Also, the effort of labeling a large number

2026-07-30视觉感知安全鲁棒

针对化学操作和消费品使用中皮肤暴露面积难以靠人工观察规模化量化的问题,论文用 Mask R-CNN 先分割人体并遮蔽背景,再用颜色分割估计裸露皮肤,规避光照、肤色与背景干扰。在 170 张室内刷漆图片上,与人工估计的总体一致性约为 80%,显示图像可为职业与产品安全评估提供可扩展的暴露数据。

DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving Figure 1
2026-07-30cs.CV

DVPSFormer: Efficient Online Depth-aware Video Panoptic Segmentation for Autonomous Driving

Yung-Hsu Yang, Luigi Piccinelli, Siyuan Li, Mattia Segu, Lei Ke, Martin Danelljan, Yuqian Fu, Zuria Bauer, Fisher Yu, Hermann Blum, Marc Pollefeys

INSAIT, Sofia University, University of Bonn

2026-07-30视觉感知

面向自动驾驶中的在线4D场景理解,论文针对现有DVPS方法多阶段、依赖离线跟踪且延迟高的问题,提出DVPSFormer:用分割查询显式离散化前景和背景,并通过D2C深度头单次解码度量深度,同时用在线多数投票修正跟踪中的类别不一致。在Cityscapes-DVPS和SemKITTI-DVPS上超过既有SOTA,并在20帧关联设置下约快18倍。

TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions Figure 1
2026-07-30cs.CV

TraceCLIP: Recovering Local Semantics from Patch-to-CLS Contributions

Xinran Liu, Shouqian Shi, Yutong Chen, Ge Wang, Xin-Wei Yao, Sheng Zhong

2026-07-30视觉感知

TraceCLIP针对CLIP只用CLS全局表征对齐文本、局部语义难以直接用于开放词汇密集预测的问题,指出局部语义在patch写入CLS注意力输出的贡献项中更显式,而非最终patch状态中。方法无需训练,提取patch-to-CLS贡献并构造语义测地拓扑门控来校准patch亲和传播。八个零样本语义分割基准上,较最强训练-free方法平均mIoU提升1.3至4.5点。

ScalablePromptus: Scalable and High-Fidelity Prompt-Based Video Streaming Figure 1
2026-07-30eess.IV

ScalablePromptus: Scalable and High-Fidelity Prompt-Based Video Streaming

Zehao Cao, Bowei Xu, Xun Cao, Zhan Ma, Hao Chen

2026-07-30视觉感知

这篇论文针对基于提示的视频流在网络波动下易因提示截断而质量崩塌的问题,提出 ScalablePromptus:在提示反演中加入语义与颜色约束,用球面插值保持中间帧嵌入几何,并通过 dropout 训练形成按重要性排序的提示维度,使接收端可直接用任意前缀重建视频。结果显示稳定网络下仅有小幅增益,但在丢包/截断场景中相对 Promptus 将退化降低 82%–95%。

Weight and Height Estimation from a Single Human Image Captured in the Wild Figure 1
2026-07-30cs.CV

Weight and Height Estimation from a Single Human Image Captured in the Wild

Hira Yaseen, Arif Mahmood, Waqas Sultani

H. Yaseen, A. Mahmood, W. Sulatni are with the Department, of Computer Science, Information Technology University (ITU), 346-B, Ferozepur Road, Lahore, Pakistan.

2026-07-30视觉感知

本文针对野外单人图像中身高、体重和 BMI 难以由受控测量获得的问题,构建含 6105 张带标签日常图像的数据集,并比较 RGB、深度、边缘、姿态亲和图等模态及单任务/多任务 CNN。结果显示全身图像优于半身和人脸,多任务联合预测通常优于单任务,ResNet-50 多数实验最好;但数据集公开状态与各模态增益来源仍未充分说明。

Knowledge-guided Disentanglement with Atomic Actions for Action Recognition Figure 1
2026-07-30cs.CV

Knowledge-guided Disentanglement with Atomic Actions for Action Recognition

Tianci Wu, Siqi Cao, Guangming Zhu, Jiang Lu, Siyuan Wang, Longfei Zhang, Jincai Huang, Jun Sheng, Liang Zhang

Xidian University, National University of Defense Technology, Human Institute of Advanced Technologyy, Shanghai Road Transport Development Center, Xidian University Xi’an China, National University of Defense Technology Changsha China, Human Institute of Advanced Technologyy Changsha China, Shanghai Road Transport Development Center Shanghai China

2026-07-30视觉感知

本文针对复杂场景中多目标、并行动作导致整体视频表征难以区分细粒度语义的问题,提出 KDA:用 LLM 将动作标签拆解为原子动作,并通过 KIM 注入时空场景图节点,再由 KDM 与 KD Loss 做知识解耦以指导动作表征分离。实验称其在多标签动作识别基准上达到 SOTA,且模块可迁移到其他基线,但具体增益中有多少来自 LLM 先验仍需更多消融支撑。

Shape-Based Inductive Bias for Glioma Grading from Tumor Contours Figure 1
2026-07-30eess.IV

Shape-Based Inductive Bias for Glioma Grading from Tumor Contours

Puneet Velidi, Michelle F. Miranda, Farouk Nathoo, Ashery Mbilinyi, Cédric Beaulac

Department of Mathematics and Statistics, University of Victoria, Department of Computer Science

2026-07-30视觉感知

论文针对胶质瘤分级中直接栅格化肿瘤掩膜会让模型浪费容量学习平移、旋转、尺度等无关变化的问题,提出先做功能形状对齐,再把全局形变与傅里叶残差按频率组织成形状 token。BraTS 2020 患者独立五折验证中,小型 MLP 以 2.9k–117.3k 参数达到 71.5% 平衡准确率和 54.9% LGG F1,优于 ResNet-18、ViT-Tiny及接近/略优于形状 Transformer,但像素基线从零训练,部分增益可能来自 scaling / data。

2026-07-29

104 篇
VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening Figure 1
2026-07-29cs.CV

VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening

Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid

2026-07-29视觉语言

针对畜牧早筛中动物无法描述症状、单纯图像诊断可靠性有限的问题,VetClaw将树莓派相机、OpenClaw边缘交互、LangGraph状态化流程和云端VLM组合成可调度、可记录、带安全规则和升级机制的筛查系统。实验显示,图像-only零样本分类较弱,加入症状文本或图文输入可提升表现,但数据集较小,且文本提示可能带来标签泄漏,临床有效性仍需验证。

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? Figure 1
2026-07-29cs.AI

Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions?

Abhishek Pillai, Samir Kumar Nayak, Yuan Chen

after pairs labeled from 5 actions + its payload., centered computing → Human computer interaction (HCI), a₂, …. Gold labels derive from recorded events. (B) Temporal ordering: 3 screenshots from 1 trajectory under shuffled opaque labels

2026-07-29视觉感知

论文关注桌面 CUA 在异步渲染、延迟截图和错误上下文下是否真正理解 GUI 状态转移,而不只是完成终局任务或定位单帧元素。作者提出 DDB,以 Linux 多应用轨迹构造三帧时序排序、跨轨迹干扰识别和前后帧动作重建,诊断状态验证、来源追踪与上下文控制。8类模型评测显示该能力仍未饱和:最佳时序精确率约65%,存在按展示顺序复制的偏置;动作重建中点击易定位但拖拽等动作家族识别更难。

Wonder: Video World Model Done Better Figure 1
2026-07-29cs.CV

Wonder: Video World Model Done Better

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei

2026-07-29视觉感知强化学习

面向交互式仿真、机器人等需要低延迟可控视觉世界的场景,Wonder试图解决现有视频世界模型在相机跟随、长期记忆和实时性之间的冲突。其核心是把相机轨迹渲染成像素对齐的坐标场,并用稀疏全保真KV记忆与改进蒸馏维持可控性和复访一致性。实验显示其在图像/视频条件生成中优于近期流式模型,可分钟级16 FPS生成并保持稳定延迟。

Pictura: Perspective-View Self-Play at Scale for Driving Figure 1
2026-07-29cs.CV

Pictura: Perspective-View Self-Play at Scale for Driving

Yuan Yin, Elias Ramzi, Marc Lafon, Valentin Charraut, Victor Bares, Yihong Xu, Éloi Zablocki, Alexandre Boulch, Thibault Buhet, Andrei Bursuc, Matthieu Cord

2026-07-29视觉感知

该文针对自动驾驶自博弈训练依赖特权向量状态、与车载相机部分可见视角存在表示鸿沟的问题,提出 Pictura:在闭环强化学习中用 GPU 光栅器为每个智能体实时渲染自车透视图,并用 PPO 从图像直接训练 Alberti。结果显示其在单 H100 上达 50 万 agent-steps/s,训练 500 亿步后接近特权向量策略,并在重渲染的 WOMD 布局上零样本优于特权基线。

Parallel Decoding Distillation for Fast Image and Video Generation Figure 1
2026-07-29cs.CV

Parallel Decoding Distillation for Fast Image and Video Generation

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

NVIDIA, 2 Weizmann Institute of Science, † equal advising

2026-07-29视觉感知

为降低扩散/flow 图像与视频生成中大量迭代采样带来的计算开销,论文提出 PDD:用并行解码器在一次前向中预测一组时间区间的平均速度,而非依赖 VSD、GAN 损失、JVP 或有限差分。该轨迹蒸馏方法可适配预训练模型并支持可变 NFE,在 LTX-2.3、Wan 14B 和 Qwen-Image 上以 4-8 NFE 达到 SOTA,同时改善视频多样性。

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing Figure 1
2026-07-29cs.CV

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

National University of Defense Technology, Wuhan University, Tsinghua University

2026-07-29视觉感知

本文针对超高分辨率遥感图像中有效证据稀疏、分散且单纯放大难以处理全局搜索和跨区域推理的问题,提出多工具视觉推理框架:构建含1.3万条轨迹的GeoMTVR,并用RTAL强化工具调用、定位和结果解释决策,训练GeoLens。实验显示其相较直接推理和单一zoom-in基线在准确率、证据 grounding 与工具使用效率上均有提升。

On the Use of Synthetic Data for Threshold Calibration in Face Recognition: Performance and Security Implications for Border Control Systems Figure 1
2026-07-29cs.CV

On the Use of Synthetic Data for Threshold Calibration in Face Recognition: Performance and Security Implications for Border Control Systems

Arto Apila

Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland

2026-07-29视觉感知规划控制

面向欧盟边境 EES 等低误匹配率场景,论文关注合成脸数据能否替代受隐私和采集限制的真实数据来校准人脸验证阈值。其核心洞察是阈值可靠性取决于真实/合成分数分布尾部是否一致,而非平均性能相近。实验显示合成数据可支持开发和初步校准,但跨域到非受控真实场景时性能明显下降,并会提高形变攻击风险,实际部署仍需代表性真实数据验证和调整。

Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics Figure 1
2026-07-29cs.CV

Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics

Timy Phan, Jannik Wiese, Björn Ommer

represented as a distribution of possible states, which collapses as new observations become available. Analogously

2026-07-29视觉感知

这篇论文针对从单帧和少量约束预测未来运动时,多数视频世界模型偏重外观生成、难以显式表达不确定性的局限,提出 GARFIELD:用结构化时空概率潜变量表示场景元素可能轨迹,并可由稀疏目标逐步收缩分布。它同时支持一致轨迹采样和确定性密度解码,在运动规划上接近大型视频模型,轨迹采样快 97 倍,密度估计比蒙特卡洛快两个数量级。

Quasi-SVD: Learning a Lie-constrained matrix factorisation for real-time imaging Figure 1
2026-07-29cs.CV

Quasi-SVD: Learning a Lie-constrained matrix factorisation for real-time imaging

Christopher Hahne

University of Bern

2026-07-29视觉感知

这篇论文针对医学实时成像中 SVD 成为吞吐瓶颈的问题,提出 Quasi-SVD:用李代数矩阵指数硬约束一个分解因子的正交性,其余部分用软约束恢复,从而避开传统奇异向量迭代并更适合 GPU 并行。方法在超声定位显微背景分离和 Mueller 矩阵偏振成像上达到 SSIM 0.89–0.94,相比 cuSOLVER 与随机 SVD 加速约 3–20 倍,吞吐超过 25 FPS;但其取舍是优先重建质量而非精确谱恢复。

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection Figure 1
2026-07-29cs.CV

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

The Hong Kong Polytechnic University, University College London, Tsinghua University, Sun Yat-sen University, National University of Singapore, The Hong Kong Polytechnic University Hong Kong China, University College London London United Kingdom, Tsinghua University Beijing China, Sun Yat-sen University Guangzhou China, National University of Singapore Singapore Singapore

2026-07-29视觉语言视觉感知

针对新一代生成图像表面伪影减少、RGB 线索难以支撑可靠检测与解释的问题,LaP-Forensics 引入冻结 Stable Diffusion 的 DDIM 反演重建残差,将其作为显式一致性证据与 RGB 语义双流融合,并用 Where-What-Why 与 GRPO 约束定位、结构化解释和证据引用。实验显示其在 UniversalFakeDetect 跨生成器检测和 SynthScars 伪影定位上表现有竞争力,但自由文本解释真实性及后处理鲁棒性仍未充分解决。

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition Figure 1
2026-07-29cs.CV

Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition

Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy

2026-07-29视觉语言视觉感知

本文面向视频中犹豫/矛盾情绪识别,动机是此类信号常由面部、语音、语言和肢体之间的短时冲突产生,普通多模态融合难以捕捉。PRISM-AH将其建模为随时间展开的跨模态不一致,结合预测惊讶、行为原型、元数据调制和知识引导LLM后融合。在BAH公开测试集上macro F1达0.6133,高于零样本基线0.2827。

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities Figure 1
2026-07-29cs.CV

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

2026-07-29视觉感知

现有任意模态到任意模态模型多依赖编码器-解码器或扩散结构,难以利用预训练 decoder-only 先验。Modus 将文本、RGB、深度、法线、边缘、分割、检测框和视觉特征统一为单一自回归/流匹配序列,无专用头或任务管线,并构建 2900 万样本对齐数据训练。实验显示其用一个模型覆盖 VQA、文生图、深度、法线、grounding 和检索等零样任务,整体接近多任务或专用基线,但部分增益可能主要来自 scaling / data。

Face De-Identification: A Domain-Centric Survey from Capture to Processing Figure 1
2026-07-29cs.CV

Face De-Identification: A Domain-Centric Survey from Capture to Processing

Hui Wei, Hao Yu, Guoying Zhao

2026-07-29视觉感知

面对人脸数据采集带来的隐私、合规与下游可用性冲突,本文将人脸去标识化从传统数字后处理扩展为贯穿物理外观、传感器成像和数字处理的域中心框架。其核心洞察是按隐私变换发生位置统一整理方法、数据集与评测协议,指出现有研究过度偏向数字域且缺少同时衡量隐私保护、任务效用和视觉质量的标准基准。主要结果是形成覆盖三类域的系统综述,并归纳跨模态、基础模型级、可验证可逆和公平性保障等开放方向。

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA Figure 1
2026-07-29cs.CV

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

2026-07-29视觉语言视觉感知

本文面向游戏 QA 中人工难以穷尽检查的几何穿模问题,将自主探索智能体、Godot 自动标注管线与零样本 VLM 检测结合,评估通用视觉语言模型是否可替代专门训练的漏洞检测器。核心洞察是 VLM 能识别明显穿模线索,但在近接触、遮挡和视角拥挤等正常画面上假阳性很高;Gemini-3.1-Flash 整体最稳,开源模型对提示词的精确率-召回率波动明显,因此更适合作为多阶段 QA 的高召回候选筛选器,而非独立判定器。

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone Figure 1
2026-07-29cs.RO

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

Simple AI : Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li

2026-07-29机器人

论文针对机器人操作中真实机器人遥操作数据昂贵、无机器人 UMI 数据又常因位姿漂移、同步和视野不足只能用于预训练的问题,提出 HiFi-UMI,通过头戴离线 stereo-inertial SLAM、原生双夹爪相对位姿、微秒级硬触发同步和超宽视野采集提升数据保真度。结果显示,仅用 HiFi-UMI 做后训练即可在三类 VLA/WAM 主干上接近或匹配域内遥操作,最强策略在精密插入任务达 85%,且 4000 小时预训练进一步降低动作误差并提升真实机器人成功率。

TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors Figure 1
2026-07-29cs.CV

TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors

Xia Du, Zhuosen Bao, Zheng Lin, Jizhe Zhou, Jiawei Lian, Chi-man Pun, Jun Luo, Wei Ni, Symeon Chatzinotas

2026-07-29生成模型规划控制

针对黑盒 AIGC 鉴伪器中后处理扰动易留伪迹、训练式规避难适配冻结扩散模型的问题,TIGA 将攻击信号注入 DDIM 采样轨迹:用多 surrogate 梯度形成可迁移先验,再以有限差分查询估计目标方向,并按噪声日程和频域约束注入。实验称其在通用检测器上达到 100% 黑盒攻击成功率,对未见检测器和常见后处理也更稳健,同时保持较好感知质量。

Open-Ended CT Volume Segmentation with Weak Supervision from Language Figure 1
2026-07-29cs.CV

Open-Ended CT Volume Segmentation with Weak Supervision from Language

Sanjay Subramanian, Junwei Yu, Zirui Wang, Rohil Malpani, Maggie Chung, Adam Yala, Dan Klein, Trevor Darrell

Department of Electrical Engineering and Computer Science, UC Berkeley, Department of Radiology and Biomedical Imaging, UC San Francisco

2026-07-29视觉感知

这篇论文针对 CT 体积分割中强标注昂贵、病灶类型和语言描述开放的问题,提出将放射报告中的病灶描述及可见切片索引转化为弱监督信号,与少量体素级强标注共同微调 SAM3。核心洞察是报告虽不给出精确掩膜,却能提供沿深度轴的定位约束;在 ReXGroundingCT 上,相比仅用强监督,Dice 在 1000 个全标注体积时相对提升 8%,在 250 个时提升 22%。

Shieldstral Figure 1
2026-07-29cs.CL

Shieldstral

Antonia Calvi, Avinash Sooriyarachchi, Giada Pistilli, Guillaume Lample, Maarten Buyl, Maximilian Augustin, Maximilian Müller, Pierre Stock, Tom Bewley, Wassim Bouaziz, Yimu Pan

2026-07-29视觉感知

现有安全护栏多依赖固定类别,难以适配不同场景政策且不易整合异构数据。Shieldstral 将文本/图像内容审核统一为带自然语言查询的 yes/no 问答,并用 5410 万样本和对比构造训练 3B 多模态分类器;结果在文本安全上平均 F1 84.9%,多模态安全 F1 83.8%,细粒度政策适配 F1 91.3%,但增益可能主要来自数据规模与构造。

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection Figure 1
2026-07-29cs.CV

Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection

Junghyun Kim, Seunghyun Kim, Jiyoung Woo

Department of AI and Big Data Engineering, Soonchunhyang University, Asan, South Korea

2026-07-29视觉感知

本文关注 ImageCLEF 2026 中深度伪造生成与检测的攻防问题,动机是评估真实场景下检测器对对抗后处理和分布变化的脆弱性。核心做法是用 FLUX.1-dev+PuLID 生成保身份人脸,并以多模型 PGD 同时攻击 12 个检测器;检测端则组合 SigLIP+DINOv2 与 GenD-DINOv3。结果显示生成可对主办方检测器达 90% 规避率,检测基线伪造准确率 99.4%,但真实图像误报高;净化响应实验发现 EFFORT 的 logit 变化可较好识别对抗输入。

Beyond Static Costs: Learning-Dynamics Aware Loss Functions for Long-Tailed Classification Figure 1
2026-07-29cs.CV

Beyond Static Costs: Learning-Dynamics Aware Loss Functions for Long-Tailed Classification

Varad Shinde, Nikhil Kumar Shrey, Magesh Rajasekaran, Md Saiful Islam Sajol, Harshil Bhargava, Subhajit Sidanta, Supratik Mukhopadhyay, Yimin Zhu

2026-07-29视觉感知

针对长尾分类中传统重加权只依赖静态类别频次、难以反映训练过程中各类实际学习进展的问题,论文提出 LDAL 损失,用特征表示强度、预测熵刻画类别难度,并加入跨 epoch 预测变化正则以稳定优化。实验称其在多个长尾基准上优于现有重加权损失,在准确率与泛化之间取得更好折中,但具体增益来源仍需结合消融细节判断。

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion Figure 1
2026-07-29cs.CV

Food Image Segmentation with LLM-Derived Ingredient Labels and Multimodal Fusion

Jui-Feng Chi, Wei-Ta Chu, Sheng-Long Lin

2026-07-29视觉语言视觉感知

针对食物图像中相似食材和长尾类别难分的问题,论文用 LLM 从图像推断食材标签,再经 BERT 编码注入分割网络,提出可插拔的特征级 LIM-F 和查询级 LIM-Q,避免依赖配对图文或菜谱数据。在 FoodSeg103 上,Swin-L+Mask2Former 结合 LIM-Q 达到 55.0 mIoU,LIM-F 达到 54.4,并在 CNN 架构上从 47.7 提升到 49.8,但标签生成误差对结果的影响文中未充分说明。

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models Figure 1
2026-07-29cs.CV

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

MoE Key Lab of BIPC, NEL-BITA, University of Science and Technology of China, Hefei, China, APKL of BIIP, IAI, Hefei Comprehensive National Science Center

2026-07-29视觉语言

面向高分辨率输入下多模态大模型视觉 token 过多、现有剪枝要么依赖跨模态注意力难以前置、要么计算开销大的问题,SepPrune 观察到模态分隔符在浅层注意力中承担视觉与文本桥接作用,并用分隔符作为统一 query、复用首层投影参数在进入 LLM 前选择重要视觉 token。实验在 Qwen2.5-VL-7B 和 InternVL3 上验证,报告在丢弃 80.2% 视觉 token 时仍保留 96.3% 原始准确率。

Freq-RemoteVAR: Next-Frequency Autoregressive Modeling for Remote Sensing Change Detection Figure 1
2026-07-29cs.CV

Freq-RemoteVAR: Next-Frequency Autoregressive Modeling for Remote Sensing Change Detection

Luqi Gong, Rui Xu, Yue Chen, Chao Li, Jingqi Hong, Xuefeng Zhao

2026-07-29视觉感知

这篇论文针对遥感双时相变化检测中一步式掩码回归易受阴影、季节差异、配准误差等伪变化干扰的问题,提出将变化掩码按频率从低到高自回归生成。核心在于用傅里叶变换与量化构造多频 token,并通过 Frequency VAR Transformer、尺度对齐 RoPE 交叉注意力和变化质量控制模块,把空间图像证据与频域生成过程对齐。实验在 CDD、GZ-CD、LEVIR-CD 上优于既有方法,尤其在外观变化复杂和噪声干扰场景下更稳健。

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition Figure 1
2026-07-29cs.CV

Explicit Layer Modeling for Video Object Insertion and Layer Decomposition

Kyujin Han, Seungjoo Shin, Sunghyun Cho

2026-07-29视觉感知

论文针对视频插入与分层分解缺少显式前景层监督的问题,提出含合成、背景、RGBA前景三元组的 TriLayer 数据集,并用双分支 DBL-Diffusion 同时建模 RGB 合成与前景层。结果显示在物体插入真实感、后续可编辑性和分解质量上优于现有方法,但复杂物理交互和高动态运动仍未充分解决。

Fine-Grained Food Image Understanding via Target-Aware Data Alignment Figure 1
2026-07-29cs.CV

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

2026-07-29视觉感知

本文针对细粒度食物图像理解中网页图文数据与目标域不匹配、字幕噪声导致 CLIP 类模型难学到可靠视觉语义对齐的问题,提出以数据为中心的流程:先按目标图像分布筛选训练样本,再用 VLM 重写更贴近视觉内容的描述,并在专家分歧时调用 VLM 融合决策。实验显示,字幕精炼平均带来约 19% 增益,完整方法的检索得分超过纯 VLM 检索两倍且更省计算。

FLASH: Efficient Impact Fall Detection with Unified Hypergraph State-Space Model Figure 1
2026-07-29cs.CV

FLASH: Efficient Impact Fall Detection with Unified Hypergraph State-Space Model

Tresor Y. Koffi, Youssef Mourchid, Yohan Dupuis

2026-07-29视觉感知

本文针对跌倒检测中“触地冲击时刻”难以实时、精确定位的问题,提出 FLASH:用生物力学固定超边的单矩阵超图建模多关节协同,再接入 Mamba 做线性复杂度时序建模。实验在 UP-Fall 和 UMAFall 上报告达到 SOTA,并较双表示方法降低 71.3% FLOPs、推理加速 93.9%,且具备跨数据集零样本泛化;但具体增益中超图设计与 Mamba 各自贡献仍需看消融细节确认。

Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning Figure 1
2026-07-29cs.CV

Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning

Tiecheng Cai, Zexian Yang, Chao Chen, Shanshan Lin, Xiangwen Liao

2026-07-29视觉语言视觉感知

这篇论文针对情感图像描述中情绪控制与视觉忠实性难以兼顾、局部线索易被误读并引发幻觉的问题,提出 SEA-Cap:先挖掘对象级情感证据,再由生成器、幻觉检查器和仲裁器通过共享黑板迭代修正描述。其核心洞察是把情感从全局标签约束转为可验证的局部视觉证据;实验称在两个基准上减少幻觉并达到 SOTA,但具体增益来源仍需结合完整实验细节判断。

GeoMFD: Continual Drone-View Geo-Localization with Geometry-Aware Adapter and Margin-Field Distillation Figure 1
2026-07-29cs.CV

GeoMFD: Continual Drone-View Geo-Localization with Geometry-Aware Adapter and Margin-Field Distillation

Zhongwei Chen, Hai-jun Rong, Tao Zhang, Xianfeng Nie, Xiangbao Zhang, Guoqi Li, Zhao-Xu Yang

2026-07-29视觉感知

论文针对无人机跨视角地理定位在真实部署中环境持续变化、为每个环境维护独立模型成本高且单模型顺序适配易遗忘的问题,提出C-DVGL设定与GeoMFD。其关键在于用冷启动建立稳定嵌入空间,借几何感知适配器做受控残差更新,并通过边界场蒸馏保持正样本与难负样本的相似度间隔。实验称在五个DVGL数据集和多种任务顺序下,单个持续更新模型能减轻遗忘,并接近或优于环境专用及连续检索基线。

A Unified Benchmark and Modality-Adaptive Network for Day-and-Night Drone-View Geo-Localization Figure 1
2026-07-29cs.CV

A Unified Benchmark and Modality-Adaptive Network for Day-and-Night Drone-View Geo-Localization

Songtianhao Xu, Zhongwei Chen, Zhao-Xu Yang, Weifeng Wang

2026-07-29数据集/基准

这篇论文针对无人机视角地理定位在夜间、弱光和跨模态场景缺少统一评测的问题,构建了包含可见光无人机、红外无人机和卫星图像三元对齐的 IRCHN 基准,并提出 MASTR-Net,用模态自适应特征增强、双向状态空间关系建模和软最优传输对齐同时处理视角差异与可见光/红外差异。实验显示该方法在 IRCHN 上优于现有方法,并在 IR-VL328、CVGL-RGBT 上保持有竞争力的表现。

Image Quality Dependent Degradation for AI Systems Figure 1
2026-07-29cs.CV

Image Quality Dependent Degradation for AI Systems

Yannick Kees, Elena Hoemann, Frank Köster, Sven Hallerbach

German Aerospace Center (DLR) Institute for AI Safety and Security

2026-07-29视觉感知

本文针对自动驾驶视觉感知在噪声、黑暗等低质量图像下容易漏检行人的安全风险,提出按图像质量自适应退化的目标检测策略:用 normalizing flow 比较输入与训练数据来估计质量,并据此降低置信阈值、优先提升召回。实验表明该质量定义与检测精度相关,系统能在低质量图像上显著提高召回,同时基本保持高质量图像的准确性。

A systematic evaluation of machine learning classifiers for event-by-event background rejection in LAFOV PET scanners Figure 1
2026-07-29cs.CV

A systematic evaluation of machine learning classifiers for event-by-event background rejection in LAFOV PET scanners

Konrad Klimaszewski, Michał Obara, Mateusz Bala, Beatrix C. Hiesmayr, Lech Raczyński, Roman Y. Shopa, Wojciech Zdeb, Wojciech Krzemien

National Centre for Nuclear Research, Department, IT:U Interdisciplinary Transformation University, University of Vienna, Faculty of Physics, Währingerstrasse 17, 1090 Vienna, Austria and

2026-07-29数据集/基准

LAFOV PET 提升灵敏度的同时显著增加偶然、体散射和探测器散射背景,论文将原始符合事件过滤建模为四类监督分类,系统比较 XGBoost、AdaBoost 与 ANN 及 4/6 特征组合。结果显示 AF 与时间差最关键,4 特征模型跨体模更稳健;最佳准确率在 NEMA IEC/XCAT 上约 0.74/0.69,优于几何切割,但对体内散射抑制有限,进一步图像质量增益仍需更丰富输入或专门散射处理。

Impact Detection in Fall Events: Leveraging Spatio-Temporal Graph Convolutional Networks and Recurrent Neural Networks Using 3D Skeletons Data Figure 1
2026-07-29cs.CV

Impact Detection in Fall Events: Leveraging Spatio-Temporal Graph Convolutional Networks and Recurrent Neural Networks Using 3D Skeletons Data

Tresor Y. Koffi, Youssef Mourchid, Mohammed Hindawi, Yohan Dupuis

2026-07-29视觉感知三维

论文聚焦跌倒检测中“是否真正撞击地面”的时刻定位问题,动机是减少近跌倒或下坠过程触发的误报。方法将三维人体骨架建模为时空图,结合 STGCN、GRU 与 BiLSTM 捕捉关节空间关系和时间动态,并在改进的 UP-Fall 三维骨架数据集上评估;文中报告多种跌倒场景下准确率超过 90%,但相对各模块的具体增益来源未充分说明。

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications Figure 1
2026-07-29cs.CV

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

2026-07-29视觉感知数据集/基准

面向自然语言“一句话修图”从专用工具走向通用系统的需求,本文系统梳理指令式图像编辑的数据构建、任务边界、模型演进与评测缺口。核心贡献是给出分层编辑任务分类,并提出含5类、21项细粒度指标的CDD-IIE Bench,用于诊断开源模型能力与局限。主要结果显示扩散、自回归及统一架构各有优势,但现有方法在统一定义、可比评测和复杂组合编辑上仍不充分。

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation Figure 1
2026-07-29cs.CV

OmniPhys: Knowledge-Graph-Driven Benchmarking and Collective Optimization for Physical Commonsense in Text-to-Image Generation

Yajing Xu, Yarong Lan, Jiaoyan Chen, Yichi Zhang, Jeff Z. Pan, Mingchen Tu, Zhizhen Liu, Wen Zhang, Huajun Chen

Zhejiang University, The University of Manchester, The University of Edinburgh, Zhejiang University Hangzhou, Zhejiang China, The University of Manchester Manchester United Kingdom, The University of Edinburgh Edinburgh United Kingdom, Zhejiang University Ningbo, Zhejiang China

2026-07-29视觉感知优化算法数据集/基准

本文针对文生图模型常生成违背物理常识的画面、且现有评测难以定位具体物理知识缺口的问题,提出基于物理知识图谱的 OmniPhys 基准,并用隐式场景与双路径验证做细粒度诊断;同时提出 OmniPrompt,通过多随机样本和跨查询反馈聚合降低提示优化中的噪声。实验覆盖 12 个 T2I 模型,发现普遍物理瓶颈,并显示该提示策略能提升不同骨干的物理一致性。

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation Figure 1
2026-07-29cs.CV

Beyond Facial Consistency: Personalized Person Image Generation with Holistic Identity Preservation

Yuxuan Xiao, Shanshan Zhang, Jian Yang, Shengcai Liao

2026-07-29视觉感知

本文针对个性化人物生成中“脸像但整体不像”或“外观一致但脸不稳”的矛盾,指出脸部与全身外观分支在扩散去噪中的信号强度失衡是关键问题。方法在 FLUX.1-dev 上构建外观/人脸双分支,并用 DBS 的时间自适应门控与区域感知优化协调两类身份约束。Pexels-100 评测显示其较开源基线取得更好的脸部保真与整体外观一致性折中,但复杂姿态和手部细节仍有限。

Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact Figure 1
2026-07-29cs.CV

Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact

Mateusz Kozłowski

2026-07-29视觉语言视觉感知数据集/基准

这篇论文的动机不是提升机器人或视觉模型性能,而是审计医学影像 VLM 基准从预定方案到发布产物的可复现性断裂。核心洞察是把结果拆成意图、执行、观测、分析、报告和发布等状态,并用哈希、调用记录、DICOM 渲染与键控统计追踪偏差。审计发现 300 次计划调用中仅 297 次有非空输出,60 次 Claude A/B 条件实际绑定同一 C 提示,4 张影像极性渲染错误,统计修正后数值可复现但无法恢复原始性能与提示效应结论。

The LAIA Dataset: Labelled Attention for Intelligent Automobiles Figure 1
2026-07-29cs.CV

The LAIA Dataset: Labelled Attention for Intelligent Automobiles

A. Contreras, D. Porres, R. Abad, P. Cano, G. Villalonga, A. M. López, A. Hernández-Sabaté

All the authors are with the Computer Vision Center. A.M. López and A. Hernández-Sabaté are also with the Computer Science Department of Universitat Autònoma de Barcelona.

2026-07-29数据集/基准

端到端自动驾驶虽能直接从传感器学习控制,但缺少“驾驶者看哪里”的监督,解释性不足。LAIA 在 CARLA 闭环场景中采集 44 名参与者约 15 小时驾驶,提供六种天气下的 RGB、分割、深度、光流、CAN 与同步眼动数据;论文展示其可用于比较人类凝视与模型注意力,从而分析模型决策依据,但对性能增益的量化结果文中未充分说明。

CORF-GS: Real-Time Wireless Radiance Field Reconstruction via Coupled Optical-RF Gaussian Splatting Figure 1
2026-07-29eess.SP

CORF-GS: Real-Time Wireless Radiance Field Reconstruction via Coupled Optical-RF Gaussian Splatting

Jinya Zhang, Jiajia Guo, Chao-Kai Wen, Shi Jin

2026-07-29三维

面向无线数字孪生等场景中实时获取信道知识的需求,CORF-GS将光学图像与RF观测耦合到共享几何、分模态外观的3D高斯表示中,并在新关键帧到来时用光学引导采样补充高斯,再通过光学-RF联合优化避免RF被固定光学几何牵制。仿真中其RF谱合成优于NeRF、WRF-GS+和RF-3DGS,重建时间降至2分18秒,约快6.4倍。

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition Figure 1
2026-07-29cs.CV

ReDesign: Recovering Editable Design Structures from Images via Agentic Decomposition

Jooyeol Yun, Jintae Park, Hyesu Lim, Junha Hyung, Hyungjin Chung, Jaegul Choo

2026-07-29视觉感知

这篇论文针对设计资产常只剩截图或栅格导出、难以继续编辑的问题,提出 ReDesign:让 VLM 代理按树状层级逐步分解图像,并在每次扩展时用局部验证执行接受、剪枝或重试,以减少工具级错误累积。作者还构建 Figma Edit Replay Benchmark,用 909 个 Figma 文件和 14,796 条编辑指令评估可编辑性;结果显示其在布局、颜色和文本编辑上优于分层分解和串行工具流水线,同时保持较好视觉还原。

Few-Shot Open-Vocabulary Remote Sensing Segmentation via Textual Inversion Figure 1
2026-07-29cs.CV

Few-Shot Open-Vocabulary Remote Sensing Segmentation via Textual Inversion

Junhyuk Heo, Junghwan Park

2026-07-29视觉感知

这篇论文关注开放词表分割在遥感俯视图中失效的问题,指出瓶颈常不是分割模型看不见目标,而是类别名称在视觉语言空间中定位不准。方法用少量带掩码样本做 textual inversion,在冻结 SegEarth-OV3 上学习伪词查询,推理时不再携带支持图像。结果显示,受影响类别 mIoU 从 3.9 提升到 39.4,八个遥感数据集上也优于依赖视觉提示的少样本方法。

OrthKD: Extracting Generalized Clinical Knowledge from Heterogeneous Teachers for Lightweight Deployment Figure 1
2026-07-29cs.LG

OrthKD: Extracting Generalized Clinical Knowledge from Heterogeneous Teachers for Lightweight Deployment

Yi Xu, Cheng Chen, Mufan Cao

Tongji University, Shanghai, China

2026-07-29视觉感知

面向基层糖尿病视网膜病变筛查,论文关注轻量模型在设备受限和跨域场景下的可靠性问题。核心洞察是异构教师存在“专长不对称”:弱 ViT 的 logits 会误导学生,但其全局特征仍有价值;OrthKD 因此只信任强 CNN 的决策监督,并从弱 ViT 做特征蒸馏和正交约束。实验中 5.4M 参数 MobileNetV3 在 EyePACS 达到 0.885 QWK,Messidor-2 零样本 QWK 从 0.507 提升到 0.728。

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection Figure 1
2026-07-29cs.CV

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

Harbin Institute of Technology, University of Agder

2026-07-29视觉感知

本文针对通用场景音视频 AIGC 检测中“音画内容应一致”假设失效的问题,指出在人脸深伪之外,真实视频的跨模态相似度可能反而低于伪造视频。作者提出 DAV-Det,将音频与视觉证据解耦建模,再做决策级融合:视觉侧捕捉全局、patch 与区域伪造线索,音频侧建模时域和频谱异常。该方法在 IJCAI-ECAI 2026 DDL 2.0 通用 AIGC 音视频检测挑战中排名第一,最终分数为 0.8460。

Visual prompt engineering for video models Figure 1
2026-07-29cs.CV

Visual prompt engineering for video models

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

2026-07-29视觉感知

论文关注视频模型已成为视觉推理基础模型后,是否也能像语言模型一样通过“提示工程”提升表现。作者提出 VIPE:用图像编辑模型在不改变任务逻辑的前提下改造首帧视觉提示,并可自动生成、筛选变体。实验显示,将抽象草图转为更真实的视觉上下文可在物理推理、排序、迷宫等任务上提升视频模型准确率,且常优于文本提示优化;增益主要被解释为弥合抽象输入与视频模型现实视频表征之间的域差。

Multi-Scale Structural Features for Continual, Comprehensible Visual Recognition in a Developmental Learning Framework Figure 1
2026-07-29cs.LG

Multi-Scale Structural Features for Continual, Comprehensible Visual Recognition in a Developmental Learning Framework

Zeki Doruk Erden

2026-07-29视觉感知

论文针对连续视觉识别中梯度模型易覆盖旧知识、且内部结构难解释的问题,提出把2D形状转为包含多尺度边缘、轮廓及空间关系的统一关系网络,并在无梯度的 Modeller 框架中逐样本局部细化学习,配合缺失感知读出。作者在类增量 MNIST 上报告约0.87准确率,高于此前约0.50,并在不存储旧数据、无任务边界下保持已学类别,结果表明改进主要来自更强的结构表征与读出机制。

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation Figure 1
2026-07-29cs.CV

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation

Weiming Zhuang, Jiabo Huang, Jingtao Li, Zhizhong Li, Chen Chen, Sina Sajadmanesh, Lingjuan Lyu

2026-07-29视觉感知

该文针对统一视觉理解与图像生成模型训练成本高、理解所需连续特征与生成所需离散 token 冲突的问题,提出 Argus-Unified:在冻结的预训练 VLM 视觉编码器上同时保留连续 token 用于理解、学习离散 token 用于生成,并以两阶段训练复用已有视觉语言对齐。实验显示其用 15.6M 数据和约 2000 美元成本,在 GQA、POPE、VQAv2 上达到领先理解性能,生成质量接近 Janus 系列,但大规模扩展与图像编辑能力文中未充分说明。

ReLATE: Reliability-Guided Evidence Fusion for Robust UAV--Satellite cross-view Geo-Localization Figure 1
2026-07-29cs.CV

ReLATE: Reliability-Guided Evidence Fusion for Robust UAV--Satellite cross-view Geo-Localization

Haochen Jiang, Jialei Pan, Yuzhe Sun, Zhe Dong, Lecheng Ren, Yanfeng Gu, Tianzhu Liu

2026-07-29安全鲁棒

这篇论文针对无人机到卫星跨视角地理定位在雨雾、模糊、噪声、压缩等真实退化下缺少系统评测的问题,构建 UAVSat-Deg 鲁棒性基准,并提出 ReLATE 用结构平滑的可靠性场筛选可信局部 token,再自适应融合到多分支描述子中。实验显示其在两个退化测试集和双向检索上取得最佳平均鲁棒性能,同时保持接近干净图像精度。

I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models Figure 1
2026-07-29cs.CV

I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models

Yimao Guo, Zuomin Qu, Wei Lu

School of Computer Science and Engineering, Sun Yat-sen University, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology

2026-07-29视觉感知

本文针对图像到视频模型被用于未授权人像动画和深伪生成的问题,提出 I2VShield,在发布图像前加入近不可见扰动以主动防护。核心思路是用文本自适应扰动生成器替代逐样本梯度优化,并通过 MAD 目标直接扰乱 DiT 的多模态注意力对齐。实验称其在多数据集和主流 DiT-I2V 模型上能显著破坏时空一致性,同时大幅降低显存与计算成本。

Group Equivariant Diffusion for Anomaly Detection in Computational Cytology Figure 1
2026-07-29cs.CV

Group Equivariant Diffusion for Anomaly Detection in Computational Cytology

Swarnadip Chatterjee, Ssharvien Kumar Sivakumar, Anirban Mukhopadhyay

2026-07-29视觉感知生成模型

这篇论文针对细胞学中异常细胞稀少且单细胞朝向不影响诊断的问题,指出普通扩散异常检测会因旋转、翻转产生不稳定重建和排序。作者将 D4 旋转/反射等变性注入 U-Net 与采样过程,用等变噪声和帧平均稳定伪健康重建。在骨髓与外周血细胞数据上,该方法提升 AUC 和 top-K 异常细胞召回,并显著降低变换下分数方差。

Beyond Counts: A Distributional Robustness Margin For Pathology Foundation Models Figure 1
2026-07-29cs.CV

Beyond Counts: A Distributional Robustness Margin For Pathology Foundation Models

Clément Grisi, Jeroen van der Laak, Geert Litjens

Department of Pathology, Radboud University Medical Center, Nijmegen, The Netherlands

2026-07-29安全鲁棒

病理基础模型易把染色、扫描和机构差异编码进表征,导致跨中心泛化和捷径学习风险。本文指出既有RI指标受计数、池化和固定邻域限制,提出逐样本的CRoMa距离边际分布来衡量生物匹配与混杂干扰的相对接近性。实验覆盖20个tile级和4个slide级编码器,显示模型中位鲁棒性排序较稳定,但低尾脆弱性差异明显,且CRoMa更高时下游捷径导致的性能下降更小。

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation Figure 1
2026-07-29cs.CV

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

2026-07-29数据集/基准

本文针对医学 Agentic AI 概念混用、架构差异大且评估难以支撑临床落地的问题,做范围综述和系统证据映射;核心洞察是将工具调用、检索、记忆、反馈修正和多智能体协作视为系统级临床工作流能力,而非单一基础模型能力。作者筛查1649条记录、纳入557项研究,发现应用已覆盖问答、影像、EHR、药物安全和临床试验预测,但证据仍主要来自公开基准、模拟或回顾数据,安全性、可追溯性、流程可靠性和前瞻验证不足。

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model Figure 1
2026-07-29cs.AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

Chung-Ang University, Republic of Korea

2026-07-29视觉语言视觉感知

这篇论文针对大规模VLA难以部署到嵌入式机器人硬件的问题,提出0.9B参数的CoTinyVLA,用双视角时间帧、35B教师的分层CoT蒸馏和指令改写增强来替代单纯扩大模型。在LIBERO-Plus上,其四个套件成功率均超过最强7B基线,推理显存约2.25GiB;消融显示三类设计分别改善视觉时序、物理状态和语言扰动鲁棒性。

Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs Figure 1
2026-07-29cs.CV

Safety-Aware Cascaded Inference for Crop Damage Assessment with Controlled Error Trade-offs

José Thiéry Messigbédé Hagbe, Gani Kawsar Gounou, Songbian Karim Zimé

2026-07-29规划控制安全鲁棒

论文针对小农农业保险中漏检作物受损比误报代价更高的问题,提出 CascadeCropNet:先用 Sentinel 做健康/受损分流,再由 Expert 细分类,并通过阈值在部署时调节召回与专家负载。结果显示在肯尼亚玉米图像数据上受损召回达 0.974,漏检较平铺基线最多降 54%;但其稳健性主要来自级联隔离与校准路由,并非任意分布偏移下的保证。

Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns Figure 1
2026-07-29cs.CV

Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns

Hong Chen, Kang Chen, Yuxuan Fan, Bo Wang, Yubo Gao, Yuanlin Chu, Xuming Hu

2026-07-29视觉感知

这篇论文关注多轮视觉对话中图像KV缓存被提前压缩后,后续问题是否仍能访问关键视觉事实。作者提出CVMA因果审计框架,通过区域删除、整图删除和助手文本KV干预区分“没再需要视觉”“事实已被说出”和“真正遗忘”。结果显示,当前注意力常无法预测未来有用区域,甚至差于随机;损失主要出现在高视觉依赖轮次,而已显式 verbalize 的事实可由文本KV部分替代,未说出的事实则不可靠。

DensFiLM: Density-Conditioned Video Saliency for Crowd Scenes Figure 1
2026-07-29cs.CV

DensFiLM: Density-Conditioned Video Saliency for Crowd Scenes

Anis Ur Rahman

CSC - IT Center for Science Ltd., Espoo, Finland

2026-07-29视觉感知

本文关注拥挤场景中注视策略会随人群密度变化的问题:稀疏场景更依赖个体跟踪,密集场景更依赖群体运动和场景地标。DensFiLM 在 Video Swin 编码瓶颈处用轻量 FiLM 注入密度条件,以选择适合不同密度的抽象特征。其在 CrowdFix 上取得 NSS 1.434、CC 0.517,优于 ACLNet,且模型自预测密度几乎匹配人工标签;消融显示 RAFT 光流和更大时序/社会力模块未带来增益。

Reading Legends on Ancient Coins: An Object Detection Approach for Character Recognition on a Novel Roman Republican Dataset Figure 1
2026-07-29cs.CV

Reading Legends on Ancient Coins: An Object Detection Approach for Character Recognition on a Novel Roman Republican Dataset

Hafeez Anwar

2026-07-29视觉感知数据集/基准

论文面向古罗马共和时期钱币铭文识别:这些字符承载年代与发行者信息,但受手工铸造、磨损腐蚀、位置和成像差异影响,传统分类难以利用。作者构建5654张钱币、21类字符、38808个标注的数据集,并将字符识别转化为YOLO目标检测基准;多版本比较中YOLOv7-L取得最佳mAP50 90.4%,但增益来源可能主要来自模型scaling / data,文中未充分说明泛化到完整铭文读取的效果。

Bi-Level Collaborative Learning for Few-Shot Scribble-Supervised Medical Image Segmentation Figure 1
2026-07-29cs.CV

Bi-Level Collaborative Learning for Few-Shot Scribble-Supervised Medical Image Segmentation

Xiang-Xiang Su, Yufan Ye, Yihang Zheng, Min Gan, Guang-Yong Chen

Fuzhou University, Qingdao University, Fuzhou University Fuzhou China, Qingdao University Qingdao China

2026-07-29视觉感知

这篇论文针对医学图像中涂鸦标注既稀疏、病例数又少时,模型难以恢复完整区域和边界的问题,提出 BiSCL:用可学习超像素网络提供结构先验,并与分割网络双向协同,通过区域伪标签传播和空间先验过滤减少错误扩散。实验显示在 ACDC 与 Prostate 数据集仅 5 个涂鸦标注病例下优于现有涂鸦监督方法。

ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID Figure 1
2026-07-29cs.CV

ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID

Xulin Li, Yan Lu, Bin Liu, Jiaze Li, Qinhong Yang, Tao Gong, Qi Chu, Nenghai Yu

2026-07-29视觉感知

本文针对行人重识别中邻居特征交互依赖“邻居可靠”这一隐含前提的问题,指出仅用亲和关系会在模糊查询、小图库或跨域场景中放大错误邻居影响。ANFI 同时建模亲和与差异关系,并用基于邻域结构的相似度和噪声关系监督自适应加权。实验覆盖标准、跨模态与跨域设置,显示其相对图邻居方法和重排序方法在多种邻居分布下更稳健。

Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment Figure 1
2026-07-29cs.CV

Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment

Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li

East China Normal University, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Hangzhou Hyperspectral Imaging Technology Co., Ltd., Fudan University Shanghai Cancer Center, East China Normal University Shanghai China, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine Shanghai China, Hangzhou Hyperspectral Imaging Technology Co., Ltd. Hangzhou China, Fudan University Shanghai Cancer Center Shanghai China

2026-07-29视觉语言优化算法

针对H&E到IHC虚拟染色中像素不对齐、不同生物标志物形态差异大且可靠性难解释的问题,论文提出DMCoStain,通过迭代筛选更优配对样本并训练标志物专属模型;其MEGFS利用病理专家式视觉语言评估检查染色风格、位置、比例和强度。多组织多标志物实验报告达到SOTA,但增益可能主要来自数据筛选与专用模型协同。

RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection Figure 1
2026-07-29cs.CV

RDVSv2: A Large-scale Benchmark for RGB-D Video Salient Object Detection

Tianyu Li, Jiahao He, Keren Fu, Qijun Zhao

National Key Laboratory of Fundamental Science on Synthetic Vision, Sichuan University, Chengdu, China, College of Computer Science, Sichuan University, Chengdu, China

2026-07-29视觉感知数据集/基准

针对 RGB-D 视频显著目标检测缺少大规模、高质量且几何一致基准的问题,RDVSv2 从公开立体视频构建 249 段、29077 帧密集标注数据,并用眼动指导掩码标注;同时提出基于 SAM2 的 CPSAM,通过 PEFT 融合 RGB、深度与光流。实验显示该数据集显著提高评测难度,CPSAM 在 RDVSv2 及既有基准上取得 SOTA,但增益可能部分来自数据规模与基础模型能力。

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors Figure 1
2026-07-29cs.CV

Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors

Jaeha Kim, Kyoung Mu Lee

2026-07-29视觉感知生成模型

面向分类、分割、检测等下游任务,论文指出扩散式图像复原的随机采样会造成任务相关细节不稳定。作者提出 NOLA:用无噪声单步前向替代多步采样,并发现这种设定下 LoRA 比 ControlNet 更能适应输入分布偏移;再配合任务保持 GAN 改善感知质量。实验显示其在多类 TDIR 任务、真实退化图像和 OCR 上优于既有扩散基线,同时降低推理步数。

HOME: Robust Hough-space Matching Method for Structured and Textureless Videos Figure 1
2026-07-29cs.CV

HOME: Robust Hough-space Matching Method for Structured and Textureless Videos

Masaki Satoh

2026-07-29视觉感知安全鲁棒

论文针对机器人视觉前端在走廊、柱体等强线结构或弱纹理场景中 ORB 等点特征易失效、传统线特征又过重的问题,提出 HOME:把图像映射到 Hough 空间,以稳定极值作关键点,并用一维径向描述子完成高效匹配。实验以单应估计验证,在 TUM 结构/纹理视频上,HOME 在弱纹理和无纹理场景显著降低失败率并优于 ORB、AKAZE 与 LSD/LBD,且速度更适合边缘机器人。

Gaussian Volumetric Representation for Efficient Shear-Warp Visualization Figure 1
2026-07-29cs.CV

Gaussian Volumetric Representation for Efficient Shear-Warp Visualization

Mayuri Mathur (1), Ojaswa Sharma (1) ((1) Indraprastha Institute of Information Technology Delhi)

2026-07-29三维

针对MRI、CT等大规模医学体数据在实时可视化中计算和存储开销高的问题,论文将高斯表示从表面重建扩展到体数据,用可学习高斯核近似稠密体素,并通过蒙特卡洛稀疏体素监督与逐步加入切片采样的课程学习,对齐shear-warp切片渲染流程。实验报告在保持解剖结构与纹理细节的同时实现最高43.86 FPS和11.31:1压缩率,但相对不同采样策略的增益来源仍需更多消融支撑。

Hyperspectral Intrinsic Decomposition: Joint Recovery of Reflectance and Photometric Components for Non-Lambertian Scenes Figure 1
2026-07-29cs.CV

Hyperspectral Intrinsic Decomposition: Joint Recovery of Reflectance and Photometric Components for Non-Lambertian Scenes

Hao Ye, Zhan Shi, Chenglong Huang, Tao Lv, Mingjie Ji, Qiu Shen, Xun Cao

2026-07-29视觉感知

面向真实高光物体的高光谱本征分解,论文指出朗伯假设和简化镜面先验难以同时恢复反射率、阴影、高光与光照谱。其核心是把二色反射模型中的四个异构分量改写为两个光谱-空间目标,并用全局光度不变边缘先验与局部高光引导注意力处理软/强高光和裁剪失真;同时发布 CITE 数据集和 PISG 合成器,实验显示在 CITE 及额外 HSI 上更稳健。

Leak-Free Cross-Validated Stacking with Per-Architecture Calibration for Sand-Boil Segmentation in Earthen Levees Figure 1
2026-07-29cs.CV

Leak-Free Cross-Validated Stacking with Per-Architecture Calibration for Sand-Boil Segmentation in Earthen Levees

Padam Jung Thapa, Anav Katwal, Ayon Dey, Abdullah Bin Naeem, Steve Sloan, Kendall Niles, Md Tamjidul Hoque

The Center for Advanced Computer Studies (CACS), School of Computing and Informatics, University of Louisiana at Lafayette, Lafayette, LA 70504, USA, Department of Computer Science, LSU New Orleans, New Orleans, LA 70148, USA, US Army Corps of Engineers, Engineer Research and Development Center, Vicksburg, MS 39180, USA

2026-07-29视觉感知

这篇论文面向堤坝巡检中砂涌像素级分割,动机是标注稀缺下集成调参和合成数据容易造成评估泄漏。核心做法是用带父图像过滤的交叉验证 stacking、逐架构温度校准和掩码条件合成来获得更可信的训练与评估;结果显示 Updated SandBoilNet 的 IoU 从同划分基线 0.608 提升到 0.707,筛选合成数据到 0.718,但校准集成反而低于最佳单模型,说明收益主要来自模型与数据而非 stacking。

PanoLess: Environment Reconstruction from Partial Reflective Views Figure 1
2026-07-29cs.CV

PanoLess: Environment Reconstruction from Partial Reflective Views

Ahitagni Das, Ashok Veeraraghavan, Vivek Boominathan

2026-07-29三维

本文针对机器人、AR等场景中难以获取全景视图的问题,利用单侧拍摄的反光物体来反推出周围环境。核心做法是用表面对齐2D Gaussian Splatting获得稳定法线和反射方向,并融合到神经cubemap,同时显式预测可见性图以区分观测支持与推断区域。实验在合成基准和真实手持数据上优于反射感知基线,报告约5 dB提升和小于5度的平均法线误差。

Balanced Soft mixture-of-expert model for Glaucoma Detection Figure 1
2026-07-29cs.CV

Balanced Soft mixture-of-expert model for Glaucoma Detection

Sai Venkatesh Chilukoti, Krishna Rauniyar, Min Shi, Xiali Hei

2026-07-29视觉感知

针对多模态青光眼检测中单一模态易主导训练、导致其他表征欠优化的问题,论文提出三专家的 balanced soft MoE:两个单模态专家加一个多模态专家,并用 CNN 门控与负载均衡损失分配权重。在 FairVision、FairDomain、HarvardGF 等数据上以 AUC 评估,方法超过单模态、多模态基线和现有平衡多模态模型;但具体增益中负载均衡与模型容量的相对贡献文中未充分说明。

Beyond Background Bias: Saliency-Driven Prototype Alignment for Dataset Distillation Figure 1
2026-07-29cs.CV

Beyond Background Bias: Saliency-Driven Prototype Alignment for Dataset Distillation

Yawen Zou, Wenqi Cai, Guang Li, Ling Xiao, Chunzhi Gu, Chao Zhang

University of Toyama, Hokkaido University, University of Fukui

2026-07-29数据集/基准

这篇论文针对扩散式数据集蒸馏中原型易混入背景、与类别判别区域对齐不足的问题,提出用轻量分类器集成的 Grad-CAM 显著性来重加权 VAE 潜特征,再进行 K-Means 与置信度感知的 hard-prototype refinement。扩散骨干保持冻结,方法可插入 LDM/DiT;实验称在多数据集、不同 IPC 和迁移场景中稳定优于强基线,但具体增益来源仍可能部分依赖显著性分类器质量。

Sense it with your eyes: Sensation Generation and Understanding for Advertisements Figure 1
2026-07-29cs.CV

Sense it with your eyes: Sensation Generation and Understanding for Advertisements

Aysan Aghazadeh, Sina Malakouti, Adriana Kovashka

2026-07-29视觉感知

论文关注广告如何仅凭视觉线索唤起味觉、触觉等身体感受,以提升说服力这一此前较少被计算建模的问题。作者构建 Sensory Ad 数据集和层级感觉分类任务,提出 SenseScore 评估感觉唤起强度,并用多智能体 SAGA 改进广告图生成。结果显示 SenseScore 与人工判断 Kappa 达 0.8,较基线提升约 40%,SAGA 在信息-图像对齐、感觉唤起和说服性上优于常规 T2I。

Human-in-the-Loop Signature Bootstrapping for UAV Hyperspectral PFM-1 Mine Detection Figure 1
2026-07-29cs.CV

Human-in-the-Loop Signature Bootstrapping for UAV Hyperspectral PFM-1 Mine Detection

Sagar Lekhak, Prasanna Reddy Pulakurthi, Emmett J. Ientilucci

2026-07-29视觉感知

这篇论文关注无人机高光谱排雷中“光谱签名不匹配”导致的高误报检查负担,而不提出新检测器。作者比较外部SVC签名、全知场景内签名与人工确认后逐步更新的签名自举,强调应按目标发现曲线和候选复查次数评价。结果显示自举最终可达到场景内签名效果,但效率差异很大:ACE仅两轮、9个候选确认7处目标,CEM和MF分别需22、38次,SAM需数千次。

MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing Figure 1
2026-07-29cs.CV

MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing

Katsuya Ogata, Zongshang Pang, Mayu Otani, Yuta Nakashima

The University of Osaka, CyberAgent, Inc.

2026-07-29视觉感知数据集/基准

现有视频摘要基准多按通用显著性选片,难以评估“为传达特定叙事消息而剪辑”的能力。MEDit-Bench将60个长视频配对多条编辑消息和540个专业剪辑,并用时间对齐指标、消息歧义/上下文分层与人类偏好评测揭示:不同消息会产生显著不同剪辑,LLM-as-judge存在严重位置偏差,强MLLM在宽松阈值接近人类但严格切点与感知质量仍明显落后。

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition Figure 1
2026-07-29cs.CV

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

School of Computer Science, Shanghai Jiao Tong University, Zhongguancun Academy, Shanghai Innovation Institute

2026-07-29视觉语言

这篇论文针对现有上下文学习评测偏重文本、难定位多模态失败环节的问题,提出 CLBench-V,将能力拆成证据定位、新信息应用和新知识学习三层,并结合公开任务与新构造的科学、金融等数据集。实验覆盖 3443 个样本和 6 个多模态模型,最佳总分仅 0.2847,显示当前模型即使能接收图文长上下文,也难以稳定利用其中定义的知识。

FunnelAL: Retrieve-then-Rank Active Learning for Single-Class Discovery Figure 1
2026-07-29cs.CV

FunnelAL: Retrieve-then-Rank Active Learning for Single-Class Discovery

Reihaneh Rostami (RAIC Labs), Brian Goodwin (RAIC Labs)

RAIC Labs, RAIC Labs USA

2026-07-29视觉感知

这篇论文面向大规模单类目标发现中的标注瓶颈:既要从海量图像中快速找候选,又要区分视觉相近的负样本。核心思路是把主动学习改造成推荐系统式漏斗,先用嵌入检索缩小范围,再用 RankNet 利用高精度阶段,并在收益下降后混入 QBC 探索。三组细粒度/遥感图像实验中,FunnelAL 在最终 F1、AULC、标注轮数和含噪标注鲁棒性上整体领先或并列领先。

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field Figure 1
2026-07-29cs.CV

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field

Zhenning Shi, Chen Xu, Junhao Zhang, Kefei Zhang, Linjie Liu, Zhedong Zheng, Tao Li

Nankai University, Tianjin, China, University of Macau, Macau, China, Beihang University, Beijing, China

2026-07-29生成模型

本文针对真实图像复原中扩散模型从高斯噪声采样慢且与输入不一致、残差方法又难复用预训练生成先验的问题,提出 ScaleResfusion,在 Rectified Flow 轨迹中加入残差项并学习残差向量场,使采样可从带噪低质图像出发,同时保持与预训练流模型的分布和线性过程一致,支持 LoRA 微调与蒸馏加速。实验称其在多种真实复原任务上达到 SOTA,并可用 4 步采样获得较高效率。

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding Figure 1
2026-07-29cs.CV

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

Ghazal Kaviani, Ghassan AlRegib

2026-07-29视觉感知

长视频问答中,相关证据随时长变得稀疏,更多无关帧反而会干扰 MLLM。FORGE 的核心洞察是避免把查询-帧相关性压成单一相似度分数,而是在预训练多模态嵌入中构造查询条件几何,用正交性同时刻画相关性与多样性。其在 Video-MME 和 LongVideoBench 上提升关键帧选择分数 11.0–15.3 分,并在 8 个开源 MLLM 上带来最高 8.7 点问答准确率增益。

Medical world models in healthcare: foundations, applications, and challenges for trustworthy clinical translation Figure 1
2026-07-29cs.CV

Medical world models in healthcare: foundations, applications, and challenges for trustworthy clinical translation

Zhaoyan Chen, Zhongxiu Cong, Zhuanfeng Jin, Wanshu Fan, Dongsheng Zhou, Qi Ai, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

2026-07-29强化学习

临床决策需要预测患者随时间和干预变化的轨迹,而现有医疗 AI 多停留在静态诊断或风险预测。本文以结构化综述和证据映射界定“医疗世界模型”,提出患者状态表示、时序动力学、干预条件模拟和医生监督规划四级能力框架。筛选1455篇文献后纳入98项来源,其中仅14项符合严格经验定义;结果显示该方向已有轨迹预测和候选干预比较的技术可行性,但多为回顾性或临床前研究,因果识别、不确定性、外部验证和长期误差仍是主要瓶颈。

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking Figure 1
2026-07-29cs.CV

CD-RMOT-Bench: Benchmarking the Cross-Domain Referring Multi-Object Tracking

Xiangqun Zhang, Likai Wang, Zekun Qian, Ruize Han, Wei Feng

School of Computer Science and Technology, Tianjin University, Tianjin, China, Shenzhen University of Advanced Technology, Shenzhen, China

2026-07-29视觉感知数据集/基准

这篇论文针对语言指代表达的多目标跟踪在真实部署中会遭遇天气、视角和合成到真实等域偏移的问题,提出CD-RMOT任务与CD-RMOT-Bench,将可控数字孪生变化和真实恶劣域视频纳入统一评测。核心洞察是性能下降不只是检测失败,更来自表达条件下的时序关联和目标选择不稳定;其QCA方法通过查询稳定、对齐和语言校准建立较强基线,并在实验中显著缓解跨域RMOT退化。

WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing Figure 1
2026-07-29cs.CV

WHTMix: Efficient Stereo Depth Estimation via Walsh-Hadamard Token Mixing

Prathyush Sajith, Emadeldeen Hamdan, Ahmet Enis Cetin

Dept. of Electrical and Computer Engineering, University of Illinois at Chicago

2026-07-29视觉感知

面向自动驾驶和机器人中的高分辨率双目深度估计,论文针对立体 Transformer 中联合自注意力随像素数二次增长的延迟瓶颈,提出用数据无关的 Walsh-Hadamard token mixer 替换上下文聚合阶段,同时保留跨视图注意力做匹配。其洞察是该替换只在长序列、低通道的密集预测场景有利;在 CARLA 上基本保持 EPE 的同时减少 2.46 倍计算和 2.65 倍延迟,并用 log-disparity 损失改善远距目标,但 KITTI 迁移精度下降。

Leveraging Semantic Maps for City-Scale Cross-View Localization Figure 1
2026-07-29cs.RO

Leveraging Semantic Maps for City-Scale Cross-View Localization

Ethan Fahnestock, Erick Fuentes, Philip R Osteen, Nicholas Roy

CSAIL, MIT 2 DEVCOM Army Research Laboratory (ARL)

2026-07-29视觉感知

本文针对机器人在无 GNSS 或先验位姿较弱时,如何利用 OpenStreetMap 等大规模语义地图完成跨视角定位的问题。核心做法是用 VLM 从地面全景中抽取可映射地标,并将其蒸馏为轻量匹配器,再与贝叶斯滤波融合形成定位似然。实验显示,该方法在最大 628 km² 区域及夜间、雪storm、雨雾、灾后变化等场景中能更快收敛,并具备跨城市与恶劣条件泛化能力。

ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction Figure 1
2026-07-29cs.CV

ObliCity: A Benchmark and Baseline for Roof-to-Ground Projection Displacement Correction

Kai Li, Yupeng Deng, Ligao Deng, Zhihao Xi, Chenhao Wang, Jierui Zhang, Yingrui Ji, Yu Meng, Xiangyu Zhao

2026-07-29数据集/基准

本文针对倾斜视角遥感中屋顶与地面轮廓存在投影位移、传统屋顶分割或高度回归难以刻画真实建筑位置的问题,将屋顶到足迹偏移向量(RFOV)抽取独立出来,并构建含高分辨率 UAV 与全球卫星数据的 ObliCity 基准。方法上提出模拟人工拖拽标注过程的 ODE 框架 DragRoof,用 end token 判断收敛;实验显示其在方向和长度精度上优于现有方法,且只需较少推理步数。

LGFNet: A CTC-Guided Local-Global Fusion Framework for Single-Channel Sleep Staging Figure 1
2026-07-29cs.CV

LGFNet: A CTC-Guided Local-Global Fusion Framework for Single-Channel Sleep Staging

Chongjian Wang, Zhenghang Hou, Junjie Gao, Xiaofang Zhong, Shiyuan Han, Tong Zhang

2026-07-29视觉感知

针对单通道睡眠分期在长程依赖、N1等模糊转折和跨受试者/采样率/导联分布偏移下易失效的问题,LGFNet用局部-全局并行编码器结合CTC-Attention联合训练,并在解码端加入CTC引导与Viterbi平滑以约束阶段连续性。五个公开数据集上其优于现有单通道方法,Sleep-EDF-78上相较DMIN提升1.27%准确率、1.74%宏F1和1.93% κ。

OrganLens: Organ-Specific Representation Learning for CT Foundation Models Figure 1
2026-07-29cs.CV

OrganLens: Organ-Specific Representation Learning for CT Foundation Models

Zhixuan Ge, Anqi Li, Sadeer Al-Kindi, Hanwen Xu, Wei Qiu

Rice University, Department of Cardiology, University of Washington, Rice University Houston Texas USA, Department of Cardiology DeBakey Heart and Vascular Center Houston Texas USA, University of Washington Seattle Washington USA

2026-07-29生成模型

这篇论文针对CT基础模型通常只给出整卷表征、难以服务器官级异常和预后分析的问题,提出OrganLens:用器官身份条件化共享DINOv2编码器,并结合器官引导裁剪、蒸馏和解剖掩码监督,在推理时无需外部分割即可生成11个器官表征。实验显示,匹配器官表征在检测和预后任务上更强,如心脏肥大AUROC由0.910升至0.953,肺癌死亡风险C-index提升14.2%,全局表征仍保持较好的图文检索能力。

OpenPVMapper: A Multi-source, Nationwide Database of Rooftop Photovoltaic Systems in France Figure 1
2026-07-29cs.CV

OpenPVMapper: A Multi-source, Nationwide Database of Rooftop Photovoltaic Systems in France

Gabiel Kasmi

of installed capacity, each documented with its provenance, detection method, and, where available, available. It is released under an open (CC-BY) license alongside the full source code used to build it., but is scarcely and unevenly available: building a comprehensive crowdsourced PV layer from scratch, as demonstrated, for the UK by Stowell et al. (2020), requires a dedicated, sustained community effort that is not available in every, ones: aggregating multiple noisy, independent labels reliably outperforms any single label, expert or not (Dawid and, systems below 36 kWp (97%) – the power class least documented by existing public data. The dataset is available at

2026-07-29视觉感知

针对屋顶光伏安装分散、公共登记缺少细粒度位置且单一遥感检测受覆盖和偏差限制的问题,OpenPVMapper将全国航空影像深度检测、OpenStreetMap与FRPV概率数据按来源层级融合,并用跨源一致性作为置信度线索。结果覆盖法国本土113.6万套、约15.01 GWp,整体精度约74–75%,两种独立方法一致时精度升至97%,说明主要增益来自多源互证与规模化数据整合。

FIDAC: An Easy-to-use Pipeline to Extract and Interpret Interpersonal Distance From Video Figure 1
2026-07-29cs.CV

FIDAC: An Easy-to-use Pipeline to Extract and Interpret Interpersonal Distance From Video

Keshav Rastogi, Eugy Han, Jeremy N. Bailenson

University of California, Berkeley, Department of Media Production, Management, and Technology, University of Florida, Department of Communication, Stanford University, University of California, Berkeley Berkeley CA United States, Department of Media Production, Management, and Technology, University of Florida Gainesville FL United States, Department of Communication, Stanford University Stanford CA United States

2026-07-29视觉感知

针对人际距离难以从普通视频中连续、低成本提取的问题,FIDAC将OpenCV抽帧、多模型人脸检测、人工补标与基准尺校准串成易用流程,把2D视频中的人脸框转为位置和距离数据。其核心价值在于用模型融合和人工编码补检测缺口,并以已知距离缓解深度失真;但文中主要给出系统设计与使用流程,未充分说明在不同深度、角度下的定量精度或相对现有方法的增益。

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos Figure 1
2026-07-29cs.CV

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

Ce Zhang, Jinxi He, Katia Sycara, Yaqi Xie

2026-07-29视觉感知

长视频理解受限于 MLLM 上下文窗口,少量关键帧若只按时间或相关性抽样,容易在空间细节与长期上下文之间失衡。LENS 的核心是按文本查询自适应分配帧预算:对细节问题做区域级空间放大,对事件级问题用多帧聚合扩大时间视野,且无需训练。实验显示它在 Video-MME、LongVideoBench、MLVU 等基准上稳定优于均匀采样和已有训练-free 方法,Qwen2.5-VL 在 Video-MME 8 帧设置从 53.3% 提升到 60.7%。

Analysis of the Shortcut Learning and Clever Hans Effect in CNN based ECG Image Classification Figure 1
2026-07-29eess.IV

Analysis of the Shortcut Learning and Clever Hans Effect in CNN based ECG Image Classification

Abhay Kumar Pathak, Mrityunjay Chaubey, Manjari Gupta, Deepti Mishra

Department of Computer Science, Institute of Science, Banaras Hindu University, Varanasi, India., Department of Computer Science (IDI), Norwegian University of Science and Technology (NTNU), Gjøvik, Norway., University of Petroleum and Energy Studies, Dehradun, India., Clever Hans effect in a publicly available ECG image dataset using convolutional neural networks. In process we, available ECG image dataset. The dataset consists of four classes, originally developed made available and used

2026-07-29视觉感知

这篇论文关注 ECG 图像分类中高准确率是否来自波形形态而非报告版式、文字或伪影等捷径线索。作者构造六类受控图像表示,包括仅波形、去波形元数据以及人为红箭头、对比度和模糊伪影,并结合 Shortcut Retention、预测一致性、置信度差异、Integrated Gradients 与遮挡敏感性分析模型依据。文中核心结果是:分类性能和归因会随这些非生理线索显著变化,提示部分 CNN 存在 Clever Hans 式行为;但片段未给出完整数值,具体增益来源仍需看全文结果表。

OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis Figure 1
2026-07-29cs.CV

OPERA: Offline Policy-guided Expert Routing and Adaptation for Universal Biomedical Image Analysis

Zihan Li, Feiyang Liu, Dandan Shan, Ruibo Wang, Qingqi Hong

University of Washington, Delft University of Technology, Xiamen University, University of Washington Seattle USA, Delft University of Technology Delft Netherlands, Xiamen University Xiamen China

2026-07-29视觉感知强化学习

针对医疗影像模型跨设备、协议和人群时易失效且反复微调成本高的问题,OPERA将多专家集成的权重分配建模为离线策略学习,在不更新专家参数的情况下结合置信度校准、批级分布自适应和实例级路由。论文在9个涵盖眼底、X光、CT、MRI及多模态任务的数据集上与30余种基线比较,报告性能和校准均有稳定提升,但具体增益在多大程度来自专家多样性与路由策略仍需更多消融支撑。

IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation Figure 1
2026-07-29cs.CV

IMPRINT: Image-Conditioned Query Enrichment for Long-Tail Object Goal Navigation

Jelin Raphael Akkara, Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

University of Padova, Italy.

2026-07-29机器人视觉感知

这篇论文针对开放词表 ObjectNav 在长尾、细粒度目标上仅靠文本查询难以稳定定位的问题,提出 IMPRINT:用网页检索图像丰富目标查询,并与可查询语义地图匹配聚合,无需训练或改导航策略。作者还构建 HSSD-rare 评测长尾类别;在 OVON 与 HSSD-rare 上提升目标 grounding 和导航表现,但结果显示端到端收益受下游检测质量明显制约。

MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks Figure 1
2026-07-29cs.CV

MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks

Taimoor Rizwan, Sara Atito, Zhenhua Feng, Muhammad Awais, Josef Kittler

University of Surrey, Jiangnan University, motivate a method and evaluation protocol centred on two-parent identity balance rather than visual plausibility alone.

2026-07-29生成模型规划控制

针对人脸识别在证件签发和边检中可能被双身份 morph 图像欺骗的问题,MorphUNet 将扩散式人脸融合表述为由 α 控制的生物特征传输:把两位父身份的 CLIP 外观与 ArcFace 身份证据分离成 token bank,并在 U-Net 中用父身份分离的双交叉注意力延迟融合,以减少偏向单一身份。实验在 FEI/FRLL 和 6 个识别系统上显示,其 c=3 MAP 分别达 0.919/0.886,FID 也最佳,且检测器跨数据集下仍较难检出。

Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models Figure 1
2026-07-29cs.CV

Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models

Taimoor Rizwan, Sara Atito, Muhammad Awais, Zhenhua Feng, Josef Kittler

Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, School of Artificial Intelligence and Computer Science, Jiangnan University

2026-07-29视觉感知生成模型

本文针对扩散式人脸生成中高分辨率输出易发生身份漂移的问题,提出 Diff-ID:用 21 万张身份中心数据、BLIP 标注、ArcFace/CLIP 双交叉注意力适配器和按时间步加权的身份损失,在生成与 DDIM morphing 中共同约束身份与真实感。实验显示其原始 ArcFace 相似度不如 InstantID,但 FID 更低、FIQ 身份-真实感折中最好,增益可能部分来自数据构建与训练规模。

ScoreShield: Differentially Private Release of Similarity Scores Figure 1
2026-07-29cs.IR

ScoreShield: Differentially Private Release of Similarity Scores

Behrooz Razeghi, Parsa Rahimi

School of Engineering and Applied Sciences, Harvard University, 2School of Engineering, École

2026-07-29视觉感知

论文关注 RAG、检索和人脸识别等系统公开余弦相似度分数时的成员推断风险;核心思路是在按全局敏感度加高斯噪声后,将结果投影回合法的分数向量或 Gram 矩阵集合。理论上保持 (ε,δ)-DP,并把全量 Gram 发布的 Frobenius 风险 scaling 从朴素机制的 Θ(n³) 改善到固定隐私参数下的 O(n²),实验覆盖 RAG、视觉检索、人脸识别和推荐任务。

Unifying Active Learning and Semi-Supervised Learning for Medical Image Segmentation Figure 1
2026-07-29cs.CV

Unifying Active Learning and Semi-Supervised Learning for Medical Image Segmentation

Bahram Jafrasteh, Cheng Wan, Heejong Kim, Johannes C. Paetzold, Qingyu Zhao

Department of Radiology, Weill Cornell Medicine, New York, NY, USA, Department of Electrical and Computer Engineering, Cornell University, Ithaca, NY, USA

2026-07-29视觉感知

论文针对医学分割在极少标注体数据下同时面临“选哪些病例标注”和“如何利用未标注数据”的冷启动问题,提出 RegAL,用同一套拓扑感知 Pareto 准则统一主动学习与半监督训练:高不确定、多样且拓扑异常的样本用于标注,稳定 atlas 用于配准增强 Mean Teacher。实验在 BraTS、dHCP、ProstateX 上显示其在低标注预算下 Dice 和边界误差均优于现有 AL/SSL/ASSL 基线。

Enabling Fully Integer-Only Inference for Lightweight Detection Transformers Figure 1
2026-07-29cs.CV

Enabling Fully Integer-Only Inference for Lightweight Detection Transformers

Thanh Cong Le, Michal Szczepanski, Martyna Poreba

2026-07-29视觉感知

这篇论文针对轻量级 DETR 在 NPU、微控制器等整数硬件上仍依赖 Softmax、GELU、特征融合等浮点算子的部署瓶颈,提出 I-LW-DETR:通过保尺度分支卷积、符号相关 ShiftGELU 和受约束 Shiftmax,把前向传播全部改为整数运算。实验显示该流程在多种模型规模下仅带来中等精度下降,同时模型约缩小 3.6 倍、计算量降低一个数量级以上。

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models Figure 1
2026-07-29cs.CV

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

2026-07-29视觉语言

这篇论文针对现有多模态大模型评测难以把视觉感知错误与推理、知识错误分离的问题,提出 PerceptionBench:从 42 个已有基准中的前沿模型失败案例出发,归因最早错误步骤并归纳出 10 类原子视觉感知能力,再构建 3000 道经验证、短答案的问题。对 16 个前沿 MLLM 的结果显示,最高准确率仍未超过 60%,感知相关幻觉最弱,且相近总分背后能力画像差异明显。

Intrinsic and Triangulation-Agnostic Attention: A Simple and Powerful Approach for Learning on Meshes Figure 1
2026-07-29cs.GR

Intrinsic and Triangulation-Agnostic Attention: A Simple and Powerful Approach for Learning on Meshes

Ashwath Shetty, Zihan Zhu, Soeren Pirk, Noam Aigerman

Kiel University, Kiel University Germany

2026-07-29视觉感知

针对标准 Transformer 在三角网格上忽略度量、拓扑且受剖分影响的问题,论文将 query/key/value 视为连续曲面信号的离散化,并用内蕴、剖分无关的网络与 FEM 质量加权积分重构自注意力。实验显示该层在高频特征预测、形变、全/部分稠密对应和表面描述子预测上优于网格方法与点云 Transformer,但大网格可扩展性仍受 PDE 求解和自注意力成本限制。

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model Figure 1
2026-07-29cs.CV

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

2026-07-29视觉语言

论文针对现有视觉语言模型在连续视频流中重复编码静态区域、实时响应成本高的问题,提出 Mage-VL:用类视频编码的运动向量和残差能量选择动态 16×16 patch,并加入事件门控与因果解码的双系统流式架构。结果显示 4B 模型在静态任务接近 Qwen3-VL-4B,视频理解和2D/3D空间推理更强,视觉 token 减少约75%,推理最高加速3.5倍。

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed Figure 1
2026-07-29cs.CV

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

2026-07-29视觉感知

论文指出通用图像生成毒性检测以固定安全准则服务所有用户,难以覆盖边缘社群的表征伤害;核心洞察是需按社群定义动态毒性准则,并以失明/低视力与侏儒症社群构建 CTD 任务。2,400 张生成图像实验显示,约 35% 被现有检测器判安全的图像含社群伤害,零样本 F1 仅 0.32/0.37;ICL、VQA 和轻量微调可提升到 0.50/0.78 与 0.48/0.59,但仍显著低于通用毒性检测约 0.9。

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization Figure 1
2026-07-29cs.CV

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

2026-07-29视觉语言

灾害社媒图像常含模糊、口语化地名,单靠文本或视觉都难以快速定位。DisasterTD将多模态大模型用于地名抽取和候选位置生成,再用社媒图像、遥感图像及可选街景的跨视角匹配做消歧,并用DINOv2缓解视角域差。在Hurricane Harvey数据上,1000米内准确率达71.62%、50米内47.01%,均值和中位误差降至11.33公里和0.68公里,增益主要体现在歧义地名场景。

Track-Leakage-Free Hold-Out Self-Validation for Photogrammetric Reconstruction: Protocol, Sensitivity, and Limits Figure 1
2026-07-29cs.CV

Track-Leakage-Free Hold-Out Self-Validation for Photogrammetric Reconstruction: Protocol, Sensitivity, and Limits

Behnam Asadi

2026-07-29三维

针对摄影测量重建缺少外部控制点时难以自评可靠性的问题,论文提出按点轨阻断泄漏的留出重定位协议,用内部几何一致性估计置信度。实验显示该指标在高质量或整体扭曲模型上常饱和,不能追踪RTK/激光真值精度,也不能替代GCP;它主要能提示会破坏内部一致性的碎片化失败。

Gradient-Based Latent Decomposition Reveals Mechanisms of Feature Degradation in Weakly Supervised Mammography Figure 1
2026-07-29cs.CV

Gradient-Based Latent Decomposition Reveals Mechanisms of Feature Degradation in Weakly Supervised Mammography

Vinceline Bertrand, Ionut Cardei

2026-07-29优化算法

本文针对弱监督乳腺钼靶模型中“病灶类型较稳定、恶性细粒度线索易退化”的可靠性问题,提出基于梯度的 H-VAE 潜变量正交分解,指出粗标签监督只约束约 4.4% 的一维方向,约 95.6% 表征落在脆弱残差子空间。CBIS-DDSM 上 Stage-1 AUC 为 0.866、Stage-2 AUC 为 0.552,重建稳定性差距显著,并在 MIL/MTL 与跨模态实验中观察到类似现象。

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities Figure 1
2026-07-29cs.MM

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

NJU-LINK Team, Nanjing University, National University of Singapore, Beijing University of Posts and Telecommunications, University of Illinois Urbana-Champaign, Xi’an Jiaotong University

2026-07-29视觉感知数据集/基准

论文针对现有视频编辑评测多忽视音画耦合的问题,提出 AVE-Compass 基准,用音视频联动指令、细粒度 checklist、真实感量表和跨模态指标诊断编辑完成度、非目标内容保持与同步一致性。实验显示现有开闭源模型在跨模态指令执行和音频保持上仍不可靠;其 AVE-Agent 通过任务分解、自反思和评测反馈改善联合编辑的指令执行、保真与音画对齐。

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding Figure 1
2026-07-29cs.AI

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

2026-07-29视觉感知

长视频问答受限于 MLLM 上下文窗口,均匀采样或静态按问题选帧容易漏掉关键时序证据。ReMem 的核心是训练-free 地把问题解析为不同时间粒度,并利用视频结构记忆做双语义帧对齐与动态路由,从而在有限帧预算下减少冗余、保留事件结构。实验在四个 LongVideoQA 基准和三种 MLLM 上验证,LLaVA-Video 在 LVBench、LongVideoBench 分别达 54.5% 和 67.1%,较基线提升 12.3 和 8.2 个百分点。

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model Figure 1
2026-07-29cs.IR

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

Meta Platforms, Inc., Menlo Park, CA, USA, Meta Platforms, Inc., Bellevue, WA, USA, Meta Platforms, Inc., New York, NY, USA

2026-07-29视觉语言视觉感知

短视频推荐常依赖共现或语义相似,难以补上“下一集、答案、后续结果”等逻辑连续性。NEXT 将推荐改写为 Item-to-Intent-to-Item:先由 8B 视觉语言模型抽取多模态证据并生成/验证下一意图,再写入有向知识图谱供检索。结果显示 NEXT-8B 在 DocVQA 达到最佳单模型表现,线上 A/B 带来 +0.53% 观看时长和 +0.51% 不同视频曝光;但端到端增益中模型训练、候选源与系统工程各自贡献文中未充分说明。

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation Figure 1
2026-07-29cs.IR

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

2026-07-29数据集/基准

面向文档关键信息抽取中训练集人工标注昂贵且难扩展的问题,DocAnnot用LVLM一次抽取字段值,结合OCR框与空间感知上下文匹配SICM完成标签-文本对齐。其在CORD、SROIE上自动标注F1为0.679、0.846,用自动标注数据训练的LayoutLMv3等仍有可用表现,但尚不能替代人工复核。

A Functional Approach to Curve Alignment and Shape Analysis Figure 1
2026-07-29stat.ME

A Functional Approach to Curve Alignment and Shape Analysis

Issam-Ali Moindjié, Cédric Beaulac, Marie-Hélène Descary

Department of mathematics, Université du Québec à Montréal, Canada

2026-07-29视觉感知

这篇论文针对图像轮廓形状分析中离散采样会削弱连续几何结构、且平移旋转缩放与起点重参数化相互影响的问题,提出在函数数据分析框架下用基展开解析估计这些形变并完成曲线对齐,再分别对对齐轮廓和剩余形变变量做 PCA 建模。模拟数据与 MPEG-7 实验显示,该方法能恢复形变参数并刻画随机轮廓分布,在传统 FDA 失效场景中更稳健。

2026-07-28

243 篇
Data Pyramid for Embodied Manipulation Figure 1
2026-07-28cs.RO

Data Pyramid for Embodied Manipulation

Yifan Ye, Yankai Fu, Yaoxu Lv, Bohan Hou, Jun Cen, Lingdong Kong, Duo Zheng, Tianxing Chen, Jiaming Liu, Ziang Cao, Yunfan Lou, Wei Chow, Xian Sun, Yingshuo Wang, Kuangzhi Ge, Xiaowei Chi, Xidong Zhang, Zhibo Pang, Yiwu Zhong, Sirui Han, Zhihe Lu, Weihao Yuan, Qifeng Chen, Michael Yu Wang, Yao Mu, Ziwei Liu, Jianfei Yang, Ping Luo, Shanghang Zhang

2026-07-28机器人

面向具身操作中“该用什么数据训练基础模型”的问题,论文提出以可扩展性与机器人对齐为主轴的数据金字塔,将真实机器人、UMI、人类视角、仿真和通用视觉语言数据统一比较,并从质量、多样性、复用性、物理保真度分析取舍。主要结果是梳理了近期模型的数据配方演化:训练正从单一真实轨迹转向多源混合,但动作与几何对齐、触觉、失败恢复和原则化配比仍是关键瓶颈。

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding Figure 1
2026-07-28cs.CV

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang

2026-07-28视觉语言视觉感知

临床多模态模型的瓶颈在于医学影像以视觉证据为核心,且同时包含2D与3D数据,常规单一视觉编码器和文本匹配式评测难以支撑真实诊疗。ClinFusion通过级联组合视觉编码器与空间感知局部融合统一多源医学图像,并提出指令跟随与RoI grounded报告评测。结果显示其在多数2D/3D医学基准、报告生成和文本医学任务上超过主流开源模型,放射科医师盲评也支持其报告质量优势。

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation Figure 1
2026-07-28cs.CV

Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation

Bingnan Li, Haozhe Wang, Haozhong Xiong, Fangtai Wu, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang

2026-07-28生成模型强化学习

本文针对扩散模型 on-policy 蒸馏中 CFG 只匹配组合速度会掩盖正负分支误差的问题,指出教师负分支含学生不可见信息时会出现 Negative Branch Asymmetry,导致推理 guidance scale 改变后性能漂移。作者提出 PDM 分别约束正分支与条件方向,并在密到疏视频控制中显示其较朴素匹配更稳健、控制保真度更高,但 PDM 相对 IBM 的增益来源仍偏经验性。

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability Figure 1
2026-07-28cs.CV

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

Work done while the author was at the Centre for Responsible AI, IIT Madras

2026-07-28视觉感知

针对胸片诊断中视觉模型黑箱化、VLM解释易流于语言生成的问题,本文提出KANEx,用KAN的可解释函数单元约束视觉证据,并设计由KAN前向激活生成的KAN-Map热图替代梯度近似。在MIMIC-CXR相关数据上,KAN变体提升定位与文本解释质量约10%,KAN-Map相较梯度方法在IoU、faithfulness和LExT上有更大增益,但临床验证仍未充分说明。

MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale Figure 1
2026-07-28cs.CV

MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale

Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

University of Washington, University of Washington Seattle Washington USA

2026-07-28视觉感知

MicroZoom关注普通照片到显微级千兆像素图像之间的极端放大鸿沟,动机是现有超分方法在65–350倍尺度下容易在材质边界混淆纹理、在大画布上破坏织物等重复结构。核心做法是用真实显微参考约束生成,并以两级级联扩散先恢复全局结构、再补局部细节,同时用分割掩码抑制跨材质串扰。实验在自采日常物体上展示了更连贯、材质更贴近参考的可视化结果,但目标是合理合成而非真实重建。

Infrared Imaging Empowered by Artificial Intelligence for Pediatric Skeletal Triage: A Narrative Review and Future Perspectives Figure 1
2026-07-28cs.CV

Infrared Imaging Empowered by Artificial Intelligence for Pediatric Skeletal Triage: A Narrative Review and Future Perspectives

Sajad Amiri, Pardis Afshar, Elham Anjomshoa

Department of Medicine, Tehran University of Medical Sciences, Tehran, Iran, Department of Computer Engineering, Sharif University of Technology, Department of Computer Science, Shahid Bahonar University of Kerman, Kerman, Iran, pediatric skeletal radiography. Progress requires multi-center paired datasets, externally validated models

2026-07-28视觉感知

儿科骨折筛查仍依赖有电离辐射的 X 光,论文动机是降低儿童反复影像检查的长期风险。文章综述并提出用多谱段红外的透射/反射采集,结合 Pix2Pix、CycleGAN、Swin-Unet 等跨模态生成合成 X 光片,并用不确定性门控决定是否转诊常规放射。主要结果是论证儿童肢体尺寸和近红外穿透证据支持可行性,但未给出临床实测性能,关键瓶颈在配对 IR/X-ray 数据、多中心验证、肤色/体型泛化和光源安全认证。

DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement Figure 1
2026-07-28cs.CV

DreamStyle3D: Efficient 3D Stylized Asset Generation via Dual-Attention Disentanglement

Kai Wang, Ziheng Ouyang, Xuying Zhang, Ming-Ming Cheng, Qibin Hou

VCIP, Nankai University, Zhongguancun Academy, JD Explore Academy, VCIP & AAIS, Nankai University, VCIP, Nankai University Tianjin China, Zhongguancun Academy Beijing China, JD Explore Academy Beijing China, VCIP & AAIS, Nankai University Tianjin China

2026-07-28三维

本文针对现有三维风格化多依赖2D到3D间接流程、难以同时兼顾风格一致性、几何保持和速度的问题,提出DreamStyle3D,在原生3D扩散潜空间中用解耦双交叉注意力分别建模内容几何与参考风格,并配合风格解耦增强和约1.5万组三元组数据生成流程。实验显示其可在约10秒内生成几何较稳定、风格较一致的3D资产,但数据管线与增强策略对增益的具体贡献仍需看消融细节。

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams Figure 1
2026-07-28cs.AI

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

Temple University, Temple University Department of Computer and Information Sciences Philadelphia PA USA 19122

2026-07-28视觉语言视觉感知

论文针对 ER 图常以图片形式存在、难以被数据库工具直接利用的问题,提出 ERUnderstand 基准:收集 2960 张教育、真实与合成 ER 图,并配套标准 JSON 与结构化评分,评估 VLM 从图像恢复可执行模式的能力。结果显示模型能较好识别常见元素,但弱实体、多值属性和 n 元关系 F1 大幅下降;推理增强带来 15–25% Macro-F1 提升,仍受布局、语言先验和复杂度影响。

SADe: Sparse-Atom Support Decontamination for Few-Shot Segmentation with Weak Support Annotations Figure 1
2026-07-28cs.CV

SADe: Sparse-Atom Support Decontamination for Few-Shot Segmentation with Weak Support Annotations

Hang Xing, Guangjun Liu, Yan Xia, Xueming Ding

2026-07-28视觉感知

弱标注少样本分割中,框、涂鸦或伪掩码常混入背景与相似纹理,污染原型或提示。SADe将问题改写为仅在支持图像侧清洗标注,用DINO特征上的稠密相似度与稀疏自编码器原子激活对比估计补丁可靠性,再输出可接入不同FSS模型的清洁掩码。实验显示其在6/9个独立设置中mIoU最高,并在盒标注插件评测70/72项优于原始支持。

Panda: Unsupervised Pelvic Anomaly Detection for Real-Time MR Imaging Figure 1
2026-07-28cs.CV

Panda: Unsupervised Pelvic Anomaly Detection for Real-Time MR Imaging

Anika Knupfer, Maximilian Lindholz, Johanna Paula Müller, Jordina Aviles Verdera, Smiti Tripathy, Susanne Schulz-Heise, Jana Hutter

2026-07-28视觉感知

针对盆腔 MRI 中异常少见、形态多样且难以标注,监督方法难以用于实时介入场景的问题,本文将 Dinomaly 改造为无监督框架:用冻结 DINOv3 ViT 学习正常表征,结合带噪 MLP 瓶颈和线性注意力解码器,以特征余弦距离生成像素级异常图。实验在 Uterine Myoma 子集上达到 88.06% 像素级 AUROC、帧级 95.45% 特异性,并以 40.5 slices/s 满足实时反馈需求。

Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking Figure 1
2026-07-28cs.CV

Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

Andong Lu, Ziyi Zha, Jiandong Jin, Shihao Li, Chenglong Li, Jin Tang, Bin Luo

School of Computer Science and Technology, Anhui University, China, School of Artificial Intelligence, Anhui University, China

2026-07-28视觉感知

针对RGBT跟踪中因传感器失效、遮挡或错位导致的模态缺失问题,论文提出SCDT,将缺失模态补全和完整模态增强统一为时空条件去噪过程。其关键在于同时利用当前帧空间线索、短期历史运动连续性和长期模态演化,并用噪声强度调节重建或增强目标。实验称在三个公开RGBT基准上超过现有方法,但具体增益来源仍需结合完整消融判断。

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification Figure 1
2026-07-28cs.CV

Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

Francisco Mena, Dino Ienco, Roberto Interdonato, Cassio F. Dantas, Simon Besnard

2026-07-28视觉感知

论文针对训练时多模态齐全、部署时任意子集缺失的问题,认为仅强化融合不足,转而用多模态协同学习让各模态在特征与决策层互相蒸馏。提出 Co-Miss 与 FullCo:前者结合缺失蒸馏,适合少量缺失;后者用互蒸馏,在中重度缺失更稳。两项传感器分类基准显示其鲁棒性优于多种基线,但 Co-Miss 存在组合数随模态数指数增长的限制。

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design Figure 1
2026-07-28cs.CV

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

2026-07-28生成模型

本文针对扩散 Transformer 的 MoE 扩展常靠堆参数和高稀疏率、训练部署成本偏高的问题,提出 MMOE,将路由专家、共享与轻量 copy/zero/constant 专家、门控残差路由和注意力残差信息复用组合进 SiT。作者在单节点 8 张 H100、ImageNet 条件生成设置下报告其比 dense SiT 和中间 MoE 变体收敛更快、FID 更低,并在稀疏模型中取得较好质量-成本平衡;但对已发表扩散 MoE 的直接对比和文本到图像泛化文中未充分说明。

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels Figure 1
2026-07-28cs.CV

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

Zhuchenyang Liu, Yao Zhang, Yu Xiao

Aalto University

2026-07-28视觉感知

本文关注视觉文档问答中“答对但证据定位错”的归因幻觉,指出问题可能不是模型缺乏定位能力,而是坐标输出接口限制表达。作者改用逐字引用证据并由版面解析器和多模态检索器映射到页面区域,再以无区域标签的 GRPO 奖励训练引用质量。在验证版 CiteVQA 上,证据召回由最高约 8 提升到 26–47,幻觉率约减半;8B 模型严格归因准确率从 22.4 提升到 33.8。

Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts Figure 1
2026-07-28cs.CV

Test-Time Adaptation via Dual Distillation for Videos Under Severe Distribution Shifts

André Sacilotti, Samuel Felipe dos Santos, Jurandy Almeida

University of São Paulo, Federal University of São Carlos, University of São Paulo São Carlos São Paulo Brazil, Federal University of São Carlos Sorocaba São Paulo Brazil

2026-07-28视觉感知

针对视频动作识别在真实跨域、连续时序数据下测试时自适应易退化和遗忘的问题,论文提出 TADD:冻结 CLIP 主干,仅在线更新轻量投影适配器,并用零样本蒸馏保持通用语义、目标蒸馏保留源域判别知识。在 UCF-HMDB、Daily-DA、Sports-DA 上相对既有 TTA 方法分别最高提升 3.81%、2.63%、3.03%。

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment Figure 1
2026-07-28cs.CV

QueenVIS: Rethinking Image-Only Training for Video Instance Segmentation via Query Enrichment

Arian Kheirandish, Fardin Ayar, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

Amirkabir University of Technology (AUT), Tehran, Iran, The University of Tokyo, Tokyo, Japan

2026-07-28视觉感知

QueenVIS针对视频实例分割依赖昂贵视频级身份标注的问题,指出图像训练方法的瓶颈在于对象查询跨帧漂移。它在单帧训练中加入特征预测和中心预测辅助头,把外观与空间先验注入Mask2Former查询,推理时丢弃辅助头,并用无训练的查询传播与记忆库做关联。在YouTube-VIS和OVIS上较MinVIS最高提升6.7、4.8 AP,长序列提升10.3 AP,显示图像训练仍有较大潜力。

CameraAnything: Refilming Videos with Arbitrary Camera Control Figure 1
2026-07-28cs.CV

CameraAnything: Refilming Videos with Arbitrary Camera Control

Yixuan Li, Yanhong Zeng, Ka Leong Cheng, Jiayi Zhu, Hanlin Wang, Wen Wang, Yihao Meng, Hao Ouyang, Qiuyu Wang, Yue Yu, ZiDong Wang, Yiyuan Zhang, Yujun Shen, Dahua Lin

2026-07-28视觉感知规划控制

CameraAnything针对现有视频重拍方法多只控制外参、难以同时调整焦距和分辨率的问题,将逐像素Plücker射线注入与分辨率感知3D RoPE结合,在目标latent上统一建模内外参,并用合成多机位数据和正交训练覆盖组合编辑。实验显示其在视角、焦距、分辨率和多镜头转换任务上优于已有方法,但实际增益中数据规模与合成管线的贡献仍需区分。

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding Figure 1
2026-07-28cs.CV

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

2026-07-28视觉感知

针对长视频问答中所有样本都走同一套工具推理流程、导致简单问题计算冗余且复杂问题证据控制不足的问题,CADER把工具调用改为基于置信度的样本级决策:先用全局帧推理和logit margin早退,高不确定样本再进入时序裁剪、轻量语义验证与RGR重采样的闭环证据搜索。多项VideoQA实验显示其在绕过部分二阶段计算的同时提升性能,并可在未做工具使用训练的骨干上接近专门工具增强方法。

Denoising 3D images: robustness of persistent homology measures Figure 1
2026-07-28cs.CG

Denoising 3D images: robustness of persistent homology measures

Ebru Dagdelen, Aakash Karlekar, Manav Arora, Matthew Illingsworth, Jonathan Jaquette, Linda J. Cummings, Lou Kondic

Department of Mathematical Sciences, New Jersey Institute of Technology

2026-07-28视觉感知三维安全鲁棒

该文针对3D多孔介质图像中体素级噪声会生成大量短寿命持久同调特征、导致计算变慢且统计失真的问题,系统比较高斯卷积与机器学习去噪后多种PH度量的鲁棒性。核心洞察是瓶颈距离相对受稳定性保护,而生成元计数、统计向量化和持久图像更易受噪声与去噪参数影响;实验在合成多孔介质数据上表明,合适去噪可降低计算负担并更接近真实拓扑,但不同度量的可靠性差异显著。

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding Figure 1
2026-07-28cs.CV

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

Jiameng Zhang, Srikanth Madikeri

University of Zurich

2026-07-28视觉语言视觉感知

面向工业视频审核等只能抽取8–16帧的部署场景,论文指出密集预训练MLLM在稀疏推理下存在明显训练-部署错配。核心洞察是瓶颈主要在稀疏视觉特征而非语言推理,因此只微调最后三层ViT并结合边界感知采样。实验中该策略以约4%参数达到68.8% temporal mIoU,超过密集零样本8B模型12.8点,Hybrid16在有边界标注时较均匀采样再提升26点。

DSCH-Loss: A Dynamic Semantic Channel Objective for Deep Semantic Hashing Figure 1
2026-07-28cs.AI

DSCH-Loss: A Dynamic Semantic Channel Objective for Deep Semantic Hashing

Tobias J. Bauer, Christian Riess, Daniel Loebenberger, Christian Bergler

aFraunhofer Institute for Applied and, Hamming distances derived from label similarities. However, Wang et al. [3] present an elaborate taxonomy on cross-modal, the label-similarity of the samples [18]. As their work provides, of semantic channels is elaborated in detail in Section III-B., issue is addressed in [27] and elaborated upon in Section IV-D., with a one-hot encoded label vector li ∈{0, 1}c where c is, the number of labels in the dataset. The to be learned cross-, if they have at least one label in common, mathematically, of samples. The more the label vectors of two samples align, the, similarity between label vectors as inter-sample similarity score:, of their labels as calculated in Equation (1). In essence, the

2026-07-28视觉感知

论文针对深度语义哈希中固定宽度语义通道会造成损失景观不连续、从而影响跨模态检索优化的问题,提出 DSCH-Loss,用动态大小和位置的语义通道替代原有约束,并强调用 tie-aware mAP 处理哈希距离离散带来的排序并列。实验在两个数据集、两类架构和多种码长上显示,DSCH 在 40 个检索任务中有 35 个显著优于对比损失,最高 mAP 提升约 1.75 个百分点。

EgoPlay: Event-Triggered Video Editing for Egocentric Streams Figure 1
2026-07-28cs.CV

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

Snap Inc., King Abdullah University of Science and Technology (KAUST), Snap Inc. USA, King Abdullah University of Science and Technology (KAUST) Saudi Arabia

2026-07-28视觉感知

面向常开式第一视角/AR视频中“事件发生后才触发特效”的需求,EgoPlay将事件识别、触发前保持和触发后视频编辑合并到一个扩散式V2V模型,并构建10.6万组正负及多事件训练数据与事件感知评测。Ego4D上其编辑质量、视觉质量和背景一致性均明显优于EgoEdit及VLM检测-编辑级联,但实时因果版本在负触发和精确定时上仍有限。

DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding Figure 1
2026-07-28cs.IR

DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

Shuo Wang, Kai Zhang, Wenyuan Huang, Yizheng Yu, Xia Liao, Junming Su, Qing Wang, Fang Xi

Corresponding author: F. Xi.S. Wang, K. Zhang, W. Huang, Y. Yu, J. Su, Q. Wang, and F. Xi are with QiYuanLab, Beijing, China.

2026-07-28视觉感知

面向复杂文档中的图表、表格等高密度版面,论文指出现有多模态 Graph RAG 把定位、语义理解和关系抽取压在一次 VLM 推理中,易产生 Visual Attention Sink 并带来高 token 成本。DeCoRAG 通过先生成全局语义锚点,再用 RAP-Crop 裁剪信息密集区域,最后做局部结构抽取来解耦流程。实验显示其相对最强基线语义通过率最高提升 12.5%,离线图构建 prompt token 减少 40.8%,且 DocVQA 上有一定跨版面泛化。

A Modern ConvNet for Solar Filament Detection Figure 1
2026-07-28astro-ph.SR

A Modern ConvNet for Solar Filament Detection

J. R. Hu, Q. Hao, Z. Zheng, P. F. Chen, C. Li, Y. Meng

2026-07-28视觉感知

针对Hα太阳暗条自动检测中尺度差异大、目标占比低且人工标注不足的问题,论文提出以MORDEN语义分割为核心的流程,结合大卷积、实例归一化、多尺度模块及DenseCRF、DBSCAN后处理,并由小规模MHAS扩展生成AHAS数据集。实验显示MORDEN优于若干开放模型,DenseCRF改善边缘细节,数据扩展和聚类后处理表现稳定,但增益可能部分来自scaling / data。

FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models Figure 1
2026-07-28cs.LG

FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models

Kaiyang Ye, Yuan Ge, Junxiang Zhang, Bei Li, Ziming Zhu, Haishu Zhao, Xiaoqian Liu, Chenglong Wang, Jingbo Zhu, Zhengtao Yu, Tong Xiao

Northeastern University 2 NiuTrans Research 3 Kunming University of Science and Technology, on sparse outcome rewards (Lu & Lab, 2025

2026-07-28视觉感知生成模型强化学习规划控制

FlowCTS针对流模型缺少自回归式下一步分布、难以直接套用 on-policy distillation 的问题,将监督对象从局部 KL 转为同一学生访问状态出发的学生/参考连续轨迹,并推导时间加权的速度匹配上界。实验显示,单状态 FlowCTS-OPD 收敛更快,GenEval 0.90→0.93、OCR 0.90→0.92、PickScore 22.75→23.06;作者还指出传统 KL 监督偏向后期去噪,与早期误差更大的阶段不匹配。

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes Figure 1
2026-07-28cs.CV

DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes

Jiahao Xie, Zhongbin Guo, Qianle Wang, Ruiqi Lu, Dongling Xiao, Wanxuan Sun, Cheng Yang

2026-07-28视觉语言优化算法

这篇论文针对 VLM 预训练数据配方仍依赖人工堆叠、比例拍脑袋且新数据准入难归因的问题,将混合优化拆成跨能力类别的预算分配和类别内数据源选择:前者用单变量迭代搜索,后者基于数据集级质量、难度评分和多样性约束做凸优化。实验显示该配方优于启发式基线,小规模代理上找到的比例可迁移到更大训练规模,80B 额外多模态 token 下达到接近更大预算开源模型的效果,但具体增益仍可能部分来自 data scaling。

NSL-SLAM: High-Fidelity Neural Structured-Light Depth for Practical SLAM and Reconstruction Figure 1
2026-07-28cs.CV

NSL-SLAM: High-Fidelity Neural Structured-Light Depth for Practical SLAM and Reconstruction

Jiaheng Li, Binsheng Zhang, Xinhai Chang, Wenzheng Chen

Wangxuan Institute of Computer Technology, Peking University, Beijing Academy of Artificial Intelligence, Beijing, China, School of Computer Science and Technology, Beihang University, Yuanpei College, Peking University

2026-07-28三维

这篇论文针对结构光相机虽能提供稠密尺度深度、但传统深度质量限制 SLAM 稳定性和重建细节的问题,提出 NSL-SLAM:把冻结单目深度先验嵌入神经结构光视差迭代解码,并以高质量深度为主信号,辅以稀疏视觉匹配、轻量 BA 和在线高斯地图。结果显示深度 RMSE 较 NSL 降低 35%,Replica-SL 跟踪与重建优于基线,真实 8 场景无灾难失败并将轨迹偏差降低 43.3%,系统可 20.9 FPS 在线运行。

Rethinking Expert Training for Model Merging with Prompt Learning Figure 1
2026-07-28cs.CV

Rethinking Expert Training for Model Merging with Prompt Learning

Christos Georgakilas, Aniello Panariello, Samir El Karrat Moreno, Simone Calderara, Dimosthenis Karatzas, Joost van de Weijer

Computer Vision Center, Barcelona, Spain, AImageLab, University of Modena and Reggio Emilia, Italy

2026-07-28视觉感知

这篇论文把模型合并的瓶颈从“如何合并”转向“专家如何训练”:作者发现 CLIP 中仅学习任务提示、冻结骨干已能避免权重合并干扰,并在多任务时很有竞争力;进一步提出先学提示再微调视觉编码器的 DTE,使任务更新幅度更小、专家更易合并。实验覆盖多种 CLIP、全参/LoRA、8/14/20 任务及异构专家,显示 DTE 能稳定提升多种合并方法的性能。

ESRVS: Extreme Semi-Supervised Retinal Vessel Segmentation with a Single Annotated Image Figure 1
2026-07-28cs.CV

ESRVS: Extreme Semi-Supervised Retinal Vessel Segmentation with a Single Annotated Image

Mingzhi Xu, Yizhe Zhang

2026-07-28视觉感知

针对视网膜血管分割中像素级标注昂贵、极低标注下易出现伪标签噪声和拓扑断裂的问题,ESRVS只用一张标注参考图,借助目标域适配的DINOv3多粒度原型、物理先验和对抗式逐步细化传播监督。在八个公开数据集上,它以远少于常规半监督方法的标注量取得六个数据集最佳Dice/clDice、全部数据集最佳HD95,并保留约93.7%的全监督Dice表现。

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models Figure 1
2026-07-28cs.CV

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

Qihui Zhu, Yuchen Wang, Zijian Wen, Tao Zhang, Mengjie Zhang, Yang Liu, Shuangwu Chen, Siying Wu, Jian Yang, Xiaofeng Jiang

2026-07-28视觉语言强化学习

本文针对多模态大模型后训练中 OPSD 依赖外部轨迹、人工证据或局部标注而难扩展的问题,提出用同一图像的高低分辨率差异构造特权信息:低分辨率学生生成轨迹,高分辨率教师在同轨迹上给 token 级分布监督。实验显示在 Qwen3.5-9B 原分辨率平均相对提升 5.45%,且较 OPSD 训练加速 1.78 倍。

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation Figure 1
2026-07-28cs.CV

Bigger or Cheaper? Scale and Quantization Effects on Uncertainty Signals in Vision-Language Models Under Image Degradation

M M Asif Ferdous

2026-07-28视觉语言视觉感知安全鲁棒

这篇论文面向边缘/消费级部署中图像退化导致的误答风险,比较 Qwen2-VL 在模型规模与 4-bit 量化下的两类不确定性信号。核心洞察是,模型“说出的置信度”并不可靠,规模变大主要提升内部 token 概率的错误检测能力。实验显示 7B-4bit 在固定显存预算下优于 2B-fp16,内部 AUROC 可达 0.98,但严重低光下仍需上游图像质量检查。

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction Figure 1
2026-07-28cs.CV

MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction

Dehao Hao, Kaiyi Zhang, Tanghui Jia, Xiangjun Gao, Dongyu Yan, Weikai Chen, Zeyu Hu, Lingting Zhu, Yingda Yin, Runze Zhang, Li Yuan, Xin Wang, Long Quan

2026-07-28生成模型三维

本文针对3D潜空间扩散中VAE重建质量受限的问题,指出稀疏体素精细但代价高、VecSet紧凑但因潜变量稀疏和全局注意力过平滑而丢细节。MSVS-VAE通过分层point-shuffle增密锚定VecSet,并用局部AVS-Conv和多尺度查询解码兼顾全局结构与局部几何。在Objaverse、ABO和野外数据上,其重建优于既有集合式和体素式VAE,解码约快10倍且比体素基线紧凑约10倍。

InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting Figure 1
2026-07-28cs.CV

InterOCF: Spatio-Temporal 2D-3D Interaction for Camera-Only 4D Occupancy Forecasting

Qi Zhang, Xinquan Yu, Kaiyi Zhang, Hui Huang

2026-07-28三维

InterOCF针对仅相机4D占用预测中常见的“只在3D体素空间滚动预测”问题,认为该范式会丢失多视角图像细节且时序建模不稳。方法同时在3D体素和2D多视角分割序列中建模时空动态,并用STIM显式交换2D-3D特征。在nuScenes、Lyft-Level5和nuScenes-Occupancy上均超过既有基线。

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning Figure 1
2026-07-28cs.CV

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

Shaofei Lei

2026-07-28视觉语言视觉感知

MAViE针对VLM只用最终层视觉特征易丢失文字、局部属性和空间关系,而高分辨率又带来大量视觉token的问题,提出多层ViT特征的门控融合与问题条件自适应token路由,并用蒸馏和空间多样性约束缓解压缩损失。文中模拟结果称token减少约80%、TTFT从228ms降至129ms、平均分提升2.2个百分点,但作者明确说明这些数值仍是占位,真实增益需正式训练和评测验证。

IJCB-AFMFR 2026: Competition on Adapting Foundation Models for Face Recognition Using Synthetic Training Data Figure 1
2026-07-28cs.CV

IJCB-AFMFR 2026: Competition on Adapting Foundation Models for Face Recognition Using Synthetic Training Data

Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira, Arturas Nakvosas, Hatef Otroshi Shahreza, Sébastien Marcel, Rishabh Shukla, Aditya Takkar, Rushil Khullar, Lalak Yadav, Gourav Gupta, Anant Gupta, Shiqi Yu, Vitomir Struc, Naser Damer, Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany, Technical University of Darmstadt, Germany, 3Vilnius University, Lithuania, Idiap Research Institute, Switzerland, 5Indian Institute of Technology Jammu, India, ArogyaPandit Private Limited, India, 7Southern University of Science and Technology, China, University of Ljubljana, Slovenia, the baseline. Notably, full fine-tuning with Sub-Center Arc-, ticularly large-margin softmax losses, and the availability of, access restrictions, significantly limiting the availability of

2026-07-28视觉感知

面对真实人脸数据受隐私与合规限制、合成数据训练仍缺少基础模型适配基准的问题,本文固定 CLIP ViT-L/14 与 IDPERTURB 数据,比较全量和有限数据下的微调策略。结果显示,合成数据适配可显著优于原始 CLIP,部分超过基线;全量数据中 Sub-Center ArcFace 全微调领先,有限数据中 rsLoRA 更有效,但增益可能主要来自 scaling / data。

Accuracy potential of visual localization exploiting high-end street-level imagery Figure 1
2026-07-28cs.CV

Accuracy potential of visual localization exploiting high-end street-level imagery

Jonas Meyer, Stephan Nebiker, Pascal Theiler, Norbert Haala

2026-07-28视觉感知

针对城市环境中 GNSS 受遮挡、多路径影响而难以满足测绘级定位的问题,本文用精确地理配准的高分辨率街景影像直接作为场景表示,结合先验引导检索、在线局部 SfM 与 PnP 位姿估计,并构建含亚厘米真值的 FHNW Muttenz 数据集。实验显示平移中位误差约 1–5 cm、旋转 0.05–0.1°,有利条件下可达 1 cm 和 0.03°,表明视觉定位有潜力补充测绘级 GNSS。

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding Figure 1
2026-07-28cs.CV

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

2026-07-28视觉语言

这篇论文针对多模态大模型在自由形式视觉定位中难以同时做好密集感知和复杂指代理解的问题,提出 Motto:把思考 token 显式绑定到图像网格位置,并用 Scan-Focus-Action 式的自适应 token 链在直接感知与推理定位间切换。作者还构建 PR-Bench 刻画感知-推理差距,并称在十余个 grounding 基准上达到 SOTA,但具体增益来源仍需结合消融判断。

GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion Figure 1
2026-07-28cs.CV

GenSplatCodec: Feed-Forward Gaussian Splatting Compression via One-Step Diffusion

Qiang Hu, Zhenlong Wu, Lei Huang, Zihan Zheng, Xiaoyun Zhang, Wenjun Zhang

2026-07-28生成模型三维

本文针对前馈3D Gaussian Splatting在低码率传输中高频纹理和视角相关外观易丢失的问题,将压缩解码从确定性重建改为受几何约束的生成式恢复。方法用结构高斯流加轻量外观参考流,并以一步扩散、层级几何控制和跨视角潜变量交互生成新视角。实验称在DL3DV、RealEstate10K上取得更优率失真表现,并相对YoNoSplat以约17倍更低存储达到相近保真度。

Ambient pressure compensation and robust position control of oil-filled electric joint systems for underwater manipulators Figure 1
2026-07-28cs.CV

Ambient pressure compensation and robust position control of oil-filled electric joint systems for underwater manipulators

Hongrui Wu, Songhui Wang, Xin Wang

aSchool of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen, 518055, Guangdong, China, available. However, they could only work within a depth of 500 m owing to the absence of the pressure compensation, ∗Corresponding author. School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen, 518055, Guangdong

2026-07-28规划控制安全鲁棒

面向深海电动水下机械臂关节,论文针对高环境压力下壳体抗压、油液泄漏以及充油带来的参数不确定和扰动问题,提出机械/驱动/控制一体化设计:分析压力补偿模块,优化密封结构,并用μ综合设计鲁棒位置控制器。实验验证了方案可行性,但相对传统控制的定量增益来源仍需结合完整实验细节判断。

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention Figure 1
2026-07-28cs.LG

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

Huawei Technologies Co., Ltd.

2026-07-28视觉感知

这篇论文针对视频扩散模型中 attention 计算昂贵、直接用标准 MXFP4 会因块内裁剪/下溢权衡和 softmax 行归一化失配而损伤生成质量的问题,提出无需校准和 QAT 的 MXAttention:用 UOS 推导固定最优缩放边界 Qmax=7.25,并用 PNQ 在归一化前量化 softmax 指数以保持行和为一。在 Wan2.2 与 HunyuanVideo 上,它恢复直接 MXFP4 与 FP16 间 VBench 成像质量差距的至少 95%,各项指标相对 FP16 退化小于 0.01。

HistoGPA: A Context-Conditioned Gene-Prior Attention Framework for Histology-Based Spatial Gene Expression Prediction Figure 1
2026-07-28cs.CV

HistoGPA: A Context-Conditioned Gene-Prior Attention Framework for Histology-Based Spatial Gene Expression Prediction

Ziang Liu, Xinhai Chen, Yigui Feng, Shuai Li, Qingyang Zhang, Jie Liu

2026-07-28视觉感知

这篇论文针对H&E病理图像预测空间基因表达时局部形态含义依赖组织上下文、预训练基因先验也并非固定适用的问题,提出HistoGPA,用共享的切片级表征同时调制局部视觉特征并条件化基因嵌入,再通过交叉注意力检索基因先验。在HEST-1k十类癌症上,其宏平均基因PCC在top-50和top-1500高变基因设置均优于对比方法,并更好恢复癌相关基因空间模式。

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation Figure 1
2026-07-28cs.CV

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

Qijun Gan, Chenwei Zhang, Meiguang Jin, Junfeng Ma, Qiu Shen

2026-07-28视觉感知

TaoMate针对长时数字人自回归生成中KV缓存遗忘早期身份/场景信息、完整历史又昂贵且易累积误差的问题,提出锚点引导的持久多模态记忆:保留不可变视觉锚点,将已完成音视频块压缩为固定容量动态状态,并用参考感知调制与因果上下文蒸馏降低递归漂移。实验显示其在跨提示长视频中保持外观稳定和音画同步,三卡阶段并行达到约35 FPS,超过24 FPS实时播放需求。

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation Figure 1
2026-07-28cs.CV

PRISM: Prompt Refinement via Image-grounded Self-rewarding Mechanism for Text-to-Image Generation

Guo Tang, HongJie Luo, Tianxu Wang, Ying Zhang, Hao Wang

Harbin Institute of Technology, Shenzhen, Sun Yat-sen University, South China University of Technology, Guangdong University of Technology

2026-07-28视觉感知强化学习

PRISM针对文本到图像生成对提示词高度敏感、现有优化缺少基于生成图像的失败诊断这一问题,提出把提示改写、视觉诊断与自奖励训练整合到统一VLM中,从语义一致性、美学质量和偏好对齐三维度打分,并用理想点与Chebyshev混合奖励优化提示策略。实验称其在整体图像质量和细粒度语义对齐上优于多种基线,同时能给出可解释的定向改写反馈。

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG Figure 1
2026-07-28cs.IR

Energy Constrained Hierarchical Underwater Monitoring via Local Multi-Agent RAG

Mohamed Amine Janati, Laurent Gautier, Stéphane Barbot

2026-07-28视觉感知

面向水下长期监测中电量受限、通信带宽低、原始多模态数据难以及时回传的问题,论文提出由低功耗 MAX78000/MAX78002 哨兵节点和按需唤醒 Jetson Orin NX 组成的分层架构,并把本地 BioCLIP/OpenCLIP 检索、物种识别与多智能体 RAG 控制结合起来。视觉和声学案例显示该系统可在边缘生成结构化报告并压缩待传信息,但节能和识别增益的定量来源文中未充分说明。

Multiview Multi-Person Human Mesh Recovery Under Large Scenes with Occlusions Figure 1
2026-07-28cs.CV

Multiview Multi-Person Human Mesh Recovery Under Large Scenes with Occlusions

Qi Zhang, Tao Yu, Jiechao He, Antoni B. Chan, Hui Huang

2026-07-28视觉感知

这篇工作针对现有 HMR 多停留在小场景、少人或单视角设置,难以处理大范围拥挤遮挡的问题,构建了含 15 个复杂场景、最多 50 视角和 30 人的合成基准,并提出将多视角特征融合为场景级 3D 体、再以骨盆关节点生成个体查询解码 SMPL-X 的模型,同时用朝向损失和 3D 关节密度损失缓解遮挡下的姿态歧义。实验显示现有 SOTA 在该基准上明显受限,而该方法在大场景强遮挡下取得更好结果;但增益可能部分来自新数据规模与合成标注设置。

UMI3D: Robust 3D Generation on Unconstrained Multi-Image Inputs via Simultaneous Focus Cross-Attention Routing Figure 1
2026-07-28cs.CV

UMI3D: Robust 3D Generation on Unconstrained Multi-Image Inputs via Simultaneous Focus Cross-Attention Routing

Zefan Qu, Zhenwei Wang, Gerhard Petrus Hancke, Rynson W.H. Lau

Department of Computer Science, City University of Hong Kong

2026-07-28视觉感知三维安全鲁棒

UMI3D针对单图3D基础模型在非受控多图输入下几何扭曲、纹理混乱的问题,指出关键不在容量而在缺少体素级选择可信参考图的机制。方法以免训练插件形式改造交叉注意力,用VRS从模型内部注意力估计体素-图像亲和,并由SFC-Attn在每步去噪中同时激活多图但让每个体素聚焦最佳图像。实验称其在新构建的非受控多图基准和多种应用上提升生成一致性与鲁棒性,但对强对称物体仍不稳定。

Superpixel-Based QUBO for Scalable Quantum-Enhanced Medical Image Segmentation Figure 1
2026-07-28cs.CV

Superpixel-Based QUBO for Scalable Quantum-Enhanced Medical Image Segmentation

Mohammad Chalhoub, Mahdi Chehimi, Laia Domingo, Omar Alhussein, Ahmed Farouk, Saif Al-Kuwari

Department of Electrical and Computer Engineering, American University of Beirut, Beirut, Lebanon, Centre de Visió per Computador (CVC), Barcelona, Spain, Ingenii Inc., New York, USA, KU 6G Research Center, College of Computing, and Mathematical Sciences, Khalifa University, Abu Dhabi 127788, UAE, Qatar Center for Quantum Computing, College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar, Department of Computer Science, Faculty of Computers and Artificial Intelligence, Hurghada University, Hurghada, Egypt

2026-07-28视觉感知

论文针对像素级 QUBO 医学图像分割变量数过大、不得不降采样而丢失细节的问题,提出先用 SLIC 超像素保留全分辨率结构,再在区域邻接图上构造结合 min-cut 与平滑项的 QUBO。INbreast 乳腺钼靶实验中,平均变量数由 1764 降至 48,IoU 从 0.73 提升到 0.76,运行时间从 21.97 秒降至 0.67 秒,但增益可能主要来自超像素尺度化。

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation Figure 1
2026-07-28cs.CV

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

Robotics Research Center (RRC), IIIT HyderabadProject Page - https://silica-mirage.github.io/ Code - https://github.com/rtarun1/Silica Dataset - Mirage18k

2026-07-28视觉感知生成模型

针对玻璃等透明表面会让常规深度传感器失效、监督式玻璃深度模型又缺少真实标注且泛化差的问题,SILICA将文本到图像扩散模型的先验改造成单步联合玻璃分割与深度估计框架,用CLIP任务提示经交叉注意力路由分割和深度信息,并用预测掩码校正传感器深度;在Mirage 18k和未见室内场景上报告零样本性能优于现有方法,部分指标接近20%提升。

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation Figure 1
2026-07-28cs.CV

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

Moku Lab, Hujing Digital Media & Entertainment Group, Beijing Film Academy

2026-07-28视觉感知数据集/基准

现有视频生成评测多依赖网页或模板提示,难以衡量专业电影语言能力。FilmBench从获奖影片片段反推1169个T2V/R2V提示,覆盖20类电影和大量多镜头场景,并用3级电影学分类与FilmOps自动评测器评分。实验中其模型排序与专家高度一致,Spearman达0.95/0.96,同时显示当前模型在动态美学和多镜头一致性上仍明显不足。

MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving Figure 1
2026-07-28cs.CV

MATS: A novel multi-modality multi-task learning framework for 3D perception in autonomous driving

Junchen Huo, Wanming Hao, Song Wang, Enqing Chen, Shouyi Yang, Guanghui Wang

2026-07-28三维

面向自动驾驶中相机与 LiDAR 多任务 3D 感知,论文指出把多模态信息压到单一 BEV 特征图容易造成容量不足和任务负迁移。MATS 通过模态自适应 BEV 融合生成多候选特征,并用任务特定 MoE 为检测和地图分割选择合适特征。在 nuScenes 上,作者报告其联合任务和单任务设置均优于现有基线。

TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation Figure 1
2026-07-28cs.CV

TreeAdapter: Hierarchical Taxonomy-Guided Adapter Composition for Fine-Grained Species Image Generation

Yuze Sun, Zhongjie Duan, Yingda Chen

2026-07-28视觉感知

本文针对通用文生图模型在稀有生物物种上易生成粗粒度、缺少细微形态差异的问题,提出 TreeAdapter:把生物分类树显式转化为适配器组合结构,叶节点学习物种特征,祖先节点学习亲缘类群共享残差。实验在三个生物多样性基准上优于通用和领域基线,消融显示层级共享同时改善 FID 与 BioCLIP,且比平坦增大单物种适配器更省参数。

Effect of User-Prompted Priors on Semi-Automated Cancer Lesion Segmentation in Whole-Body Computed Tomography Figure 1
2026-07-28cs.CV

Effect of User-Prompted Priors on Semi-Automated Cancer Lesion Segmentation in Whole-Body Computed Tomography

Isac Stark, Johan Öfverstedt, Elin Lundström, Simon Ekström, Håkan Ahlström, Joel Kullberg

2026-07-28视觉感知

针对 RECIST 单径测量与总肿瘤体积标注耗时之间的矛盾,论文系统比较全身 CT 病灶半自动分割中不同用户提示先验的作用。核心洞察是空间先验越具体、覆盖的正交平面越多,nnU-Net 分割越准确;三平面轮廓提示在外部 3865 个病灶上平均 Dice 达 0.882,显著高于无先验的 0.671,但真实交互耗时与操作者差异文中未充分说明。

Surgical Re-enactment for Operating Room Workflow Datasets Figure 1
2026-07-28cs.RO

Surgical Re-enactment for Operating Room Workflow Datasets

Jana Nina Friedrich, Andrea Karin Maria Ross, Angelo Henriques, Mario Peter Martin Weisser, Ling Zhang, Mohammad Ali Nasseri

2026-07-28生成模型数据集/基准

这篇论文针对真实手术室多视角工作流数据难以采集的问题,提出在重建手术室中复演完整手术流程的八阶段方法,强调临床专家全程参与、角色训练、现场观察和逐次复盘,以获得可重复、易标注的数据。作者在机器人辅助眼科手术中录制了10次完整复演,覆盖7个角色和5路RGB-D视角,后期复演更接近真实OR动态,但量化验证仍文中未充分说明。

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding Figure 1
2026-07-28cs.CV

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

Tencent T Lab

2026-07-28视觉感知

论文针对自动驾驶中“交通标志规则是否适用于某条车道”不能仅靠识别、还需结合车道拓扑和场景推理的问题,提出为 VLM 引入 CoT:先用强 LLM 两轮生成并经 VLM 验证筛选推理链,再用 SFT 加 GRPO 训练。MapDR 实验显示其相较 RuleVLM 在可解释性和答案准确率上均有稳定提升,但具体增益中数据构造与强化学习各自贡献仍需看消融细节。

Face Age Verification Vulnerabilities Under Simple Appearance Manipulations Figure 1
2026-07-28cs.CV

Face Age Verification Vulnerabilities Under Simple Appearance Manipulations

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

2026-07-28机器人

针对线上平台依赖人脸年龄验证而可能被简单外观变化绕过的问题,论文系统评估胡茬、胡须、眼妆、口红等可模拟操作对7类视觉/多模态模型的影响。核心洞察是模型会把易伪造的成人外观线索当作年龄捷径;胡茬平均造成20.8%翻转,MiVOLO最高达61.4%,女性等群体受影响更大,少量操纵样本的线性探针可部分缓解。

LCMamNet: A Lightweight Cross-scale Mamba Network for Infrared Small Target Detection Figure 1
2026-07-28cs.CV

LCMamNet: A Lightweight Cross-scale Mamba Network for Infrared Small Target Detection

Yuhao Fan, Le Hui, Yuchao Dai

Yuchao Dai.)Yuhao Fan, Le Hui, and Yuchao Dai are with the School of Electronics, and Information, Northwestern Polytechnical University, Xi’an 710072, China

2026-07-28视觉感知

这篇论文面向红外小目标仅占少量像素、易被云层纹理和强边缘淹没的问题,提出轻量级 LCMamNet:先用交叉方向瓶颈残差块保护局部弱目标结构,再在潜空间用双向 Mamba 做密集跨尺度交互,并通过渐进解码抑制背景细节泄漏。在 IRSTD-1k、NUAA-SIRST、NUDT-SIRST 上分别达到 71.25%、79.60%、95.58% mIoU,仅 1.175M 参数、6.91 GFLOPs,平均延迟 6.62 ms,显示其更偏向边缘实时部署。

Do Current Retrievers Cover All the Evidence? A Controlled Study of Conjunctive Cross-Page Retrieval Figure 1
2026-07-28cs.CV

Do Current Retrievers Cover All the Evidence? A Controlled Study of Conjunctive Cross-Page Retrieval

Sungguk Cha, DongWook Kim, Mintae Kim, Youngsub Han, Byoung-Ki Jeon, Sangyeob Lee

2026-07-28规划控制

本文关注多条件长文档检索中“找到相关文档”不等于“覆盖全部证据”的问题,构造 n-Clue/CrossPage 以区分 gold discovery 与 complete-first 排序。核心洞察是条件覆盖才是瓶颈:条件分解和词法-视觉融合分别带来约 6.8–7.3 与 8.7 点提升,通用重排器反而降低 Gold-NDCG;最强混合方法 gold 命中达 81.1%,但完整优先仅 35.8%,模型从 0.6B 扩到 8B 无明显收益。

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning Figure 1
2026-07-28cs.RO

DeVA: Decoupled Video-Action Model with physical guidance for robot policy learning

Mengqi Zhang, Sahil Khose, Simar Kareer, Yuchen Song, Unnat Jain, Judy Hoffman

University of California, Irvine, Georgia Institute of Technology

2026-07-28机器人视觉感知强化学习

DeVA针对VLA静态预训练难以学习物理动态、既有视频-动作模型又常在共享表征中牺牲优化性的矛盾,采用解耦的视频专家与动作专家,通过多层视频特征传递、桥接token以及affordance/相对深度监督,把时空预测和物理线索注入控制分支。实验覆盖RoboCasa、LIBERO、LIBERO-plus和真实双臂任务,显示其在少量示范下优于或接近扩散策略、微调VLA和近期VAM,并比统一架构收敛更快。

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling Figure 1
2026-07-28cs.CV

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

Zhipeng Bao, Zhen Zhu, Nupur Kumari, Anurag Bagchi, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

Carnegie Mellon University, University of Illinois Urbana-Champaign, Toyota Research Institute

2026-07-28视觉感知

这篇论文针对统一视觉生成中扩散模型推理慢、任务体系碎片化的问题,提出用 MLLM 解析文本与图像条件,再由 next-scale VAR 解码器在统一离散视觉 token 空间中生成图像、深度、修复和编辑结果。实验覆盖 15 个以上任务,显示相对扩散基线最高可降 19 倍延迟且质量持平或更好;消融指出 VQ-VAE 码本规模与层级设计是 VAR 扩展到 UVG 的关键因素。

Image Inpainting via Stochastic Dynamics Figure 1
2026-07-28cs.CV

Image Inpainting via Stochastic Dynamics

Jiaqi Kuang, Zihao Guo, Zhongmin Qian

Oxford Suzhou Centre for Advanced Research, University of Oxford, Institute for Advanced Research, Great Bay University, Mathematical Institute, University of Oxford

2026-07-28视觉感知

针对传统修补依赖局部扩散、深度方法又需大量训练且可解释性弱的问题,本文把图像补全表述为受观测像素约束的反向随机动力学过程,用参考数据集的核加权经验统计直接引导缺失像素,避免训练网络或显式密度建模。实验在MNIST、Fashion-MNIST和MVTec上优于Mean Fill、Telea和Navier-Stokes,在CelebA上也保持竞争力,但在异质自然图像上的增益更有限。

LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising Figure 1
2026-07-28cs.CV

LoTA-N2N: Local Trace Adaptation for Zero-Shot Self-Supervised Image Denoising

Jintong Hu, Bin Xia, Junlin Liu, Jiayue Liu, Wenming Yang

Tsinghua University, The Chinese University of Hong Kong, University of Southern California, Peking University

2026-07-28视觉感知

针对单幅图像自监督去噪在噪声相关、空间非平稳或未知时代理目标可能偏离监督目标的问题,论文将MSE差异分解为常数项与残差-预测误差的trace交互,并指出全局交互会因空间抵消而掩盖局部失配。LoTA-N2N用两阶段零样本适配:先由互补子图训练教师生成干净代理,再压制patch级绝对trace。实验在自然、共聚焦和X光图像上较迭代匹配MSE普遍提升,但相关噪声下存在明确边界。

ViDS: Video Diffusion Shader using 3D Face Tracking Figure 1
2026-07-28cs.CV

ViDS: Video Diffusion Shader using 3D Face Tracking

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

Technical University of Munich

2026-07-28视觉感知生成模型三维

本文针对单图人像动画中身份保持、细粒度表情控制与长视频稳定性难以兼顾的问题,提出用3DMM跟踪得到的像素对齐法线图作为显式几何条件,把视频扩散模型作为神经着色器,并通过自回归采样延长生成窗口。实验表明,相比地标或隐式运动条件,ViDS在VFHQ和Celeb-V-Text上提升身份一致性、姿态/表情跟随和跨片段连贯性,但效果仍依赖3D跟踪质量。

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion Figure 1
2026-07-28cs.CV

BeyondFusion: Self-Aligned Latent Diffusion for Calibration-Free Infrared Super-Resolution and Infrared-Visible Fusion

Minchong Chen, Xiaoyun Yuan, Minyu Cao, Jianing Zhang, Jun Zhang, Shuyang Liu, Xiaokang Yang

2026-07-28生成模型

本文面向移动红外-可见双摄中低分辨率红外与跨传感器错位并存的问题,将红外超分和红外-可见融合统一为同一潜在扩散过程的两个输出。核心创新是用 CMSA 在去噪 U-Net 的共享注意力空间中重组两模态 latent token,避免显式配准,并配合错位增强学习内容自适应交互。实验覆盖公开数据、合成错位和真实未同步移动采集,显示在重建、融合及行人检测下游任务上均有收益。

LU-500: A Logo Benchmark for Concept Unlearning Figure 1
2026-07-28cs.CV

LU-500: A Logo Benchmark for Concept Unlearning

Keyu Li, Jin Gao, Jialing Zhang, Dequan Wang

Shanghai Jiao Tong University, LU-500 is available at

2026-07-28数据集/基准

这篇论文针对文本生成图像中的公司 Logo 遗忘评测缺口,指出 Logo 往往是小区域、强语义绑定且可被产品或场景隐式触发,不能用全局概念抑制或关键词过滤简单处理。作者构建 LU-500,覆盖财富 500 强近万组显式/隐式提示与 Logo 图像,并用局部擦除、全局保真、像素和潜空间指标联合评估。实验显示 NP、SLD、SEGA、ESD、Forget-Me-Not 等方法难以在去除 Logo 证据的同时保持非目标内容,ProLU 虽改善局部擦除但会改写语义,说明提示过滤不能替代模型级解耦。

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation Figure 1
2026-07-28cs.CV

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

2026-07-28视觉感知

针对训练免费指代表达视频分割中“一次定位后直接传播”容易产生初始提示错误和时序漂移的问题,ReflexTrack把反馈引入预测层:先用关键帧掩码反向修正框与正负点提示,再对整段掩码序列定位低质量区间并选择性重传播修复。所有组件推理时冻结,在 Ref-VPS 上 Q=69.7、ReasonVOS 上 J&F=67.2,说明增益主要来自空间与时间层面的显式验证和局部修复。

Cascade Forgery Mining Network for Fingerprint Presentation Attack Detection Figure 1
2026-07-28cs.CV

Cascade Forgery Mining Network for Fingerprint Presentation Attack Detection

Hongyan Fei, Chuanwei Huang, Zheng Wang, Pengcheng Luo, Jingwei Li, Jufu Feng

2026-07-28视觉感知

针对现有指纹活体检测模型只关注局部区域、容易漏掉低清晰脊线中的伪造痕迹,论文提出用局部 Gabor 特征确定性度量伪造证据提取难度,并据此让 CFM-Net 对高难区域进入更深级联特征提取;同时用方向引导对抗训练削弱身份信息干扰。LivDet 2019/2021 上显示其在跨材料、跨传感器和高 AED 指纹场景优于已有方法。

When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents Figure 1
2026-07-28cs.CV

When Low CER is Not Enough: An Analysis of Hallucinations in Vision-Language OCR Systems on Historical Uruguayan Documents

Marina Gardella (CB), Camilo Mari{ñ}o (UDELAR, CB), Diego Belzarena (UDELAR, Ignacio Ram{í}rez (UDELAR), Gregory Randall (UDELAR), Jean-Michel Morel (LU - Hong Kong)

Université Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, France, Lingnan University, Hong Kong

2026-07-28视觉语言视觉感知

本文关注历史档案 OCR 中“低 CER/WER 不等于可靠转写”的问题,比较传统 OCR 与视觉语言模型在乌拉圭独裁时期微电影扫描文档上的表现。核心洞察是,VLM 虽在字符和词错误率上更优,却会产生拼写规范化、无依据补全、语义替换等幻觉,尤其会改动人名等关键实体。结果表明,标准指标掩盖了事实失真风险,历史与法律档案评测需引入面向实体和语义可靠性的指标。

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning Figure 1
2026-07-28cs.CV

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

2026-07-28视觉感知

面向海洋视频中关键事件稀疏、短暂且需领域知识的问题,论文构建了首个事件中心的 MarineEVT 数据集,含 2 万个多任务视频问答,并提出 EVT-R1,将视频理解拆成多轮视觉工具辅助推理,用检测、深度、方向等工具定位关键时空线索。实验比较 11 个 VLM,EVT-R1 相比最佳开源和商业模型分别提升 5.22 和 11.09,但具体增益中数据、工具推理与模型规模的贡献仍需进一步拆分说明。

PointCHR: Point Cloud Analysis via Curvature-Aware Hyperbolic Rectification Figure 1
2026-07-28cs.CV

PointCHR: Point Cloud Analysis via Curvature-Aware Hyperbolic Rectification

Xinxing Yu, Liying Yang, Hao Mo, Hui Ma, Fang Kai, Ajian Liu, Yanyan Liang

2026-07-28三维

PointCHR针对点云中高曲率边缘、角点稀疏却语义关键,而欧氏统一特征空间易让这些细节被低曲率表面挤压的问题,提出曲率感知的双曲校正:用PCP学习逐点径向缩放,HST将特征对齐到庞加莱球,CGD以闭式测地扩张稳定地把复杂区域推向高容量边界。实验显示其在多个点云基准达到SOTA,并改善复杂几何处的边界刻画。

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification Figure 1
2026-07-28cs.CV

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

comparing block proxy scores against a threshold during online softmax. This design enables dynamic yet controllable, This threshold selects blocks under a dynamic yet controllable budget, without materializing the full proxy map.

2026-07-28视觉感知

该文针对视频扩散 Transformer 长序列下注意力推理成为瓶颈的问题,指出现有训练-free 块稀疏方法路由开销高、预算难控且丢弃未选块会损伤质量。Sol-Attn 将基于均值/方差的查询相关阈值、在线 softmax 中即时稀疏化和未选块代理分数复用融合到单次 kernel 中,避免物化代理图并补偿近似误差。实验称视频生成和编辑端到端加速约 2.1×、2.3×,结合 Sol-Engine 最高约 5×,同时基本保持视觉质量。

A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal Figure 1
2026-07-28cs.CV

A Unified Stereo Geometry Estimation Framework for Disparity and Surface Normal

Qizhe Wei, Xianda Guo, Shaocong Xu, Hong Li, Runyi Yang, Hao Zhao

Beijing Institute of Technology, School of Computer Science, Wuhan University, Beihang University, INSAIT, Sofia University, Beijing Institute of Technology BAAI Beijing China, School of Computer Science, Wuhan University Wuhan China, Beihang University BAAI Beijing China, INSAIT, Sofia University Sofia Bulgaria, BAAI AIR, Tsinghua University Beijing China

2026-07-28视觉感知

面向机器人场景中低光、反光、透明物体等双目匹配易失效区域,本文提出 GeoStereo,将前馈视差估计与扩散式法线估计联合起来,用初始视差生成法线先验并构造右图到左图的对齐条件,使法线分支的结构先验反向改善视差。实验显示其在 KITTI、NYUv2 等零样本视差基准取得 Rank-1,并在 iBims-1、ScanNet 等室内法线评测上表现领先,但扩散分支带来效率开销。

Disentangling Semantic Attention from Structural Bias in the Attention Manifold Figure 1
2026-07-28cs.CV

Disentangling Semantic Attention from Structural Bias in the Attention Manifold

Pengkun Jiao, Bin Zhu, Jingjing Chen, Yu-gang Jiang

Fudan University, Singapore Management University, Fudan University Shanghai China, Singapore Management University Singapore

2026-07-28视觉感知

这篇论文关注多模态大模型中注意力被无语义视觉 token 或固定图像位置吸走,导致视觉证据被语言先验压过并产生幻觉的问题。作者的核心洞察是将 visual attention sink 视为广义结构偏置而非孤立异常点,并提出免训练的 SPAR,用显著性引导去除结构噪声、把注意力预算重分配给有效视觉区域。实验声称在多类自发幻觉和诱导幻觉基准上提升视觉 grounding,且推理开销很小。

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models Figure 1
2026-07-28cs.CV

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

State Key Laboratory of Communication Content Cognition, People’s Daily Online, Nanyang Technological University, Tongji University, Nanjing University of Science and Technology, National University of Singapore, University of Science and Technology of China

2026-07-28视觉感知生成模型数据集/基准

现有 AI 图像检测基准多依赖过时生成器且偏重整图合成,难以反映真实编辑场景。DailyBench 以现代开源和商业模型构建 FakeBench 与 ManipulationBench,覆盖高质量整图生成和物体级局部篡改,并提出 FPD 作为强基线。实验显示,已有检测器在 GenImage 上 91-96% 的平衡准确率降至 FakeBench 60-76%、ManipulationBench 54-66%,暴露出明显泛化缺口。

AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars Figure 1
2026-07-28cs.CV

AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars

Hengyuan Zhang, Jingna Sun, Meiguang Jin, Junfeng Ma

2026-07-28视觉感知

AptAvatar面向生产级音频驱动虚拟人视频生成中“高质量但推理慢、长视频易漂移”的矛盾,尝试在不削减模型容量、分辨率和时域窗口的前提下做两步扩散生成。核心是用端点锚定分布蒸馏稳定多步教师到两步学生的压缩,并用自生成历史回放缓解分块长程推理中的训练-测试不一致。实验显示其可生成720p长视频,仅需2次NFE,相比多步基线约60倍加速,同时维持身份一致性、视觉质量和动作表现。

Structural Loss Metrics for Tensor Approximation via Matrix Low-Rank Approximation Figure 1
2026-07-28cs.CV

Structural Loss Metrics for Tensor Approximation via Matrix Low-Rank Approximation

Hiroki Hasegawa

2026-07-28视觉感知

论文针对张量低秩近似常用重构误差无法揭示多模态结构退化的问题,提出 Direction Loss 与 Interaction Loss 分别度量跨模态子空间偏移和核心张量交互失真,并给出误差正交分解与稳定性界。合成和高光谱实验显示,重构误差相近时结构损失可显著不同,Direction Loss 最高相差 4.6 倍且与视觉模糊相关。

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform Figure 1
2026-07-28cs.CV

Low-light Image Enhancement via Multi-scale Attention combined with Fourier Transform

Wenbin Du, Jian Long, Zhu Cao

Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, East China University of Science and Technology, Shanghai, 200237, China, College of Electronics and Information Engineering, Tongji University, Shanghai 201804, China, Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University, Shanghai 201210, China

2026-07-28视觉感知

面向低照度场景中亮度恢复不准、暗区纹理丢失会影响夜间感知与下游视觉任务的问题,论文提出 MSFT,将傅里叶幅度信息与多尺度注意力结合,用最大灰度先验和低光图像构造引导,并在解码阶段加入多形状协同注意力增强细节。实验覆盖 LOL、SID、SMID、SDSD,相比 Retinexformer 在 SDSD-outdoor 上 PSNR 提升 11.92 dB、SSIM 达 0.988,但具体增益来源仍需更多消融支撑。

Effective Receptive Field Ordering Matters for Infrared Small Target Detection Figure 1
2026-07-28cs.CV

Effective Receptive Field Ordering Matters for Infrared Small Target Detection

Guoyi Zhang, Yanjin Du, Zhengyao Zhao, Tongsu Zhang, Guangsheng Xu, Siyang Chen, Xiangpeng Xu, Han Wang, Xiaohu Zhang

2026-07-28视觉感知

针对红外小目标检测中以往主要改进单个算子、较少显式考虑有效感受野组织的问题,论文提出将特征细化视为残差逐步校正,并指出感受野尺度与残差频率对应且非线性变换顺序不可交换。基于此构建仅用3×3卷积的V-cycle式RFONet,在多基准上报告SOTA表现,参数量1.16M、速度超过157 FPS,并显示更好的噪声鲁棒性与跨数据集泛化。

Multimodal Semantic-Probabilistic Objectness for Open World Object Detection Figure 1
2026-07-28cs.CV

Multimodal Semantic-Probabilistic Objectness for Open World Object Detection

Weijun Tian, Rui Liu

2026-07-28视觉语言视觉感知强化学习

这篇论文针对开放世界检测中已知类、未知物体与背景边界模糊的问题,指出仅靠 PROB 的视觉概率 objectness 难以区分“像物体但不属已知类”的查询。MSPO 用冻结 CLIP 为当前已知类别构造扩展文本语义原型,将解码器查询投到同一空间估计已知语义支持,并与视觉 objectness 融合,而不使用未来类别名。实验显示其在 M-OWODB、S-OWODB 上提升 PROB 的综合指标,保持未知召回竞争力,并使 PASCAL VOC 最终 mAP 最高提升 2.7 点。

Mutual Modality Trust with Lightweight Reconstruction Regularization for Fine-grained Tire Pattern Recognition Figure 1
2026-07-28cs.CV

Mutual Modality Trust with Lightweight Reconstruction Regularization for Fine-grained Tire Pattern Recognition

Jianning Yang, Jie Fang, Xinda Ma, Zirui Song, Dianwei Wang, Nan Wang

2026-07-28视觉感知三维

面向车辆安全监测、自动驾驶感知和维修场景中的细粒度轮胎花纹识别,论文针对单一视觉源、纹理细节难建模和小样本过拟合问题,提出表面与压痕双分支框架,通过互模态信任融合、频域分层引导和轻量重建正则增强特征稳定性,并构建 MTire299 多源数据集;实验称在两个公开轮胎数据集上优于既有方法,但具体增益来源仍需结合消融进一步判断。

Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI Figure 1
2026-07-28cs.CV

Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

Yu Li, Wengan He, Wenhui Xu, Lihong Jiang, Fan Xiao, Zhuohang Huang, Yuanzhu Liang, Jiayi Liu, Yuxi Chen, Yongsheng Luo

2026-07-28视觉语言

这篇综述面向彩色眼底照相分析中数据、预处理与模型脱节的问题,梳理从早期小规模单任务数据集到百万级、多模态、图文配对与基础模型预训练数据的演进。核心洞察是性能提升并非只来自网络结构,而是数据规模、标注粒度、成像质量控制和多模态监督共同推动;主要结果是汇总了74个数据集及其任务、标注和局限,但具体模型增益来源文中未充分说明,可能主要来自 scaling / data。

Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation Figure 1
2026-07-28cs.CV

Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation

Mohammed Aldeen, Muhammad Sami Irfan, Sagar Dasgupta, Long Cheng, Mizanur Rahman, Mashrur Chowdhury

School of Computing, Clemson University, Clemson, SC, USA, Department of Civil, Construction & Environmental Engineering, The University of Alabama, Glenn Department of Civil Engineering, Clemson University, Clemson, SC, USA, roads in Tuscaloosa, Alabama, equipped with time-synchronized GNSS, IMU, and camera logs to validate, This manuscript has been submitted to NAVIGATION, Journal of the Institute of Navigation, *Mohammed Aldeen, School of Computing, Clemson University, Clemson, SC, USA., Service Centre (GSC), 2026

2026-07-28机器人视觉语言视觉感知

自动驾驶高度依赖 GNSS,隐蔽欺骗可在几何上看似合理却诱导错误机动。本文将前向相机、车载速度/加速度/航向率与 GNSS 机动放入 VLM 的语义行为空间比较,并用三阶段微调检测不一致。在独立实车数据和三类智能攻击上,微调模型 F1 达 94%–95%,显著高于零样本 23%–32%,自适应推理还将调用量降至 14%。

RODR: Riemannian Orthogonally Decoupled Regularization for Disentangled Manifold Representation Figure 1
2026-07-28cs.CV

RODR: Riemannian Orthogonally Decoupled Regularization for Disentangled Manifold Representation

Jiayu Zhu, Wenlai Zhao

2026-07-28视觉感知

这篇论文针对点云去噪中表面拟合与采样均匀性被欧氏损失耦合、导致梯度干扰和点聚集的问题,提出 RODR:将更新正交分解到法向与切向子空间,并用向量注意力和熵自适应调节强度。实验显示其在 PUNet/PCNet 上整体接近现有方法,点分布更均匀、局部聚集减少,但部分数据集标注为 ongoing,增益稳定性仍需更多验证。

TimePLE: Rethinking Temporal Representation for Video Temporal Grounding Figure 1
2026-07-28cs.CV

TimePLE: Rethinking Temporal Representation for Video Temporal Grounding

Yuhui Zeng, Xinyu Mao, Xiaokun Liu, Xin Tao, Jinfa Huang, Jiayi Ji, Xiawu Zheng

Media Analytics and Computing Lab, Xiamen University, Xiamen, China, The Chinese University of Hong Kong, HKSAR, China, Department of Computer Science, University of Rochester, Rochester, NY, USA, end boundaries [14, 38], providing smoother temporal supervision without discrete time labels. Nevertheless

2026-07-28视觉语言视觉感知

TimePLE针对视频时序定位中“先预测起止点、再拼成片段”与区间级监督不匹配的问题,提出把事件片段作为原生预测对象:用位置-时长规范空间表示所有合法区间,并由单个<|TIMESPAN|>隐变量解码联合分布,同时对输入时间锚点采用同一几何表示。作者还构建9万样本并人工核验3千标注,在四个VTG基准上平均mIoU达58.9,较端点式基线提升明显,短中时长事件收益更突出。

Manifold-Constrained Noise Optimization for Diverse Diffusion Sampling Figure 1
2026-07-28cs.CV

Manifold-Constrained Noise Optimization for Diverse Diffusion Sampling

Qitan Shi, Cheng Jin, Ziyuan Liu, Yuantao Gu

2026-07-28生成模型优化算法

这篇论文针对少步蒸馏扩散模型在同一提示下不同随机种子仍生成近似图像的多样性塌缩问题。核心洞察是把初始噪声优化限制在低频仿射球面上,用黎曼更新保持高斯先验范数并固定不稳定高频分量,同时让新样本特征避开已有生成的子空间。实验显示 MoNO 在多个蒸馏文生图模型上提升 per-prompt 多样性,并基本维持图像质量。

DuoAD: Leveraging [CLS] Dual Characteristics for Training-Free Few-Shot Anomaly Detection Figure 1
2026-07-28cs.CV

DuoAD: Leveraging [CLS] Dual Characteristics for Training-Free Few-Shot Anomaly Detection

Jyun-Ze Tang, Po-Han Huang, Ming-Ching Chang, Chih-Fan Hsu, Jeng-Lin Li

University at Albany, State University of New York, NY, USA

2026-07-28视觉感知

针对少样本工业异常检测中依赖人工调参、忽略 ViT 全局上下文的问题,DuoAD 利用 [CLS] token 的双重特性:语义稳定性用于自动选择增强,注意力 logits 用于连续重加权 patch 异常分数,从而实现免训练、免阈值调参。实验在 MVTec-AD、VisA、Real-IAD 的 1-shot 设置下分别达到 97.7%、93.2%、84.5% Image-AUC,并显示多层特征聚合对 DINOv3 很关键。

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering Figure 1
2026-07-28cs.CV

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

2026-07-28视觉语言视觉感知

针对VQA答案虽正确但缺少可验证视觉依据的问题,DDVT将答案预测与区域级 grounding mask 联合建模;核心做法是用问题引导的动态区域模块选择不同分辨率区域,并通过跨模态多尺度聚合融合像素级与区域级特征。论文称在多个常用基准上超过现有方法,但片段未给出具体数值,增益幅度与主要来源仍需看完整实验表。

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape Figure 1
2026-07-28cs.CV

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

School of Artificial Intelligence, Shenzhen Technology University, School of Innovation Design, Shenzhen Technology University, Stanford University

2026-07-28视觉感知

针对情感图像编辑常依赖预定义因素或模板、难以利用具体图像语义的问题,论文提出 EmoScope,将任务从“如何编辑”改为先判断“什么可编辑”,用情感条件下的可供性推理构造图像特定策略,并在锚点、变量、上下文层级中权衡一致性与表现力。人类评测覆盖 8 类情绪,4693 份有效回答显示其相对两类基线平均偏好率达 88.1%,同时指出现有分类器指标对非刻板、上下文驱动编辑存在盲区。

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention Figure 1
2026-07-28cs.CV

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

2026-07-28视觉感知

现有 gaze decoding 多把注视轨迹映射到固定类别,难以表达开放目标和细粒度意图。本文提出 Gazette,将图像与 scanpath 输入多模态大模型生成自然语言目标描述,并用 GPT-4 基于多被试共同注视模式合成 think-aloud 辅助监督,以削弱个体差异。实验覆盖视觉搜索、指代表达和 VQA,显示其相对普通指令微调及若干分类式基线有明显提升,但伪标注依赖 LLM 先验。

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception Figure 1
2026-07-28cs.CV

SimBEV2X: A Large-Scale Dataset and Data Generation Tool for Multi-Task Vehicle-to-Everything Cooperative Perception

Goodarz Mehr, Sepideh Gohari, Montasir Abbas, Azim Eskandarian

the SimBEV2X dataset, and CoBEVFusion are available at, Autonomous Robots and Vehicles Laboratory (ARVL), College of Engineer-, ing, Virginia Commonwealth University (VCU), Richmond, Virginia, United, Montasir Abbas is with the Charles E. Via, Jr. Department of Civil, ‡ Labels for sky, train, and rock are supported by SimBEV2X but not present in the dataset., extensive labor required for data annotation [12], [13]. Because, To demonstrate the scalability and utility of SimBEV2X, • We introduce SimBEV2X, a highly scalable and user-

2026-07-28数据集/基准

面向V2X协同感知缺少大规模、多模态、多任务数据且真实采集标注成本高的问题,论文基于CARLA提出SimBEV2X生成工具,通过随机化场景、天气、交通与多智能体配置,自动产出车辆和RSU的3D框、HD地图、BEV分割和3D占用标注。其数据集含258个场景、10.22万帧、58.85万点云、超300万图像和2733万框,并用CoopDet3D及加入FAX注意力的CoBEVFusion建立基线,后者表现更好,但增益可能主要来自数据规模与融合模块组合。

Embeddings based Anomaly Detection for Cleaning Global Crop Type Reference Datasets Figure 1
2026-07-28cs.CV

Embeddings based Anomaly Detection for Cleaning Global Crop Type Reference Datasets

Syed Roshaan Ali Shah, Kristof Van Tricht, Christina Butsko, Jeroen Degerickx, Zoltan Szantoi

2026-07-28视觉感知数据集/基准

针对全球作物类型参考数据来源混杂、标签噪声难以用统一规则清洗的问题,论文提出基于预训练地球观测编码器嵌入的局部异常检测:只在同区域、同作物样本内比较质心距离和近邻结构。实验显示其能以最高0.84 AUROC找回合成错标,标记样本降权或移除后,WorldCereal五个区域的作物类型宏F1平均提升约2.1点,但过度清洗会损伤性能。

Long-Tailed Medical Image Classification Figure 1
2026-07-28cs.CV

Long-Tailed Medical Image Classification

Nathanael Ren, Saagar Arya

Pratt School of Engineering, Duke University

2026-07-28视觉感知

该文针对胸片多标签分类中的长尾分布问题,动机是常规CNN易偏向高频疾病、削弱罕见病识别可靠性。核心做法是比较SaliencyMix、Manifold Mixup、MoEx等增强,并结合Asymmetric Loss与类别感知采样改善少数类表示。实验在NIH ChestX-ray14上以AP、F1、AUROC等验证集指标评估,称最佳模型结果较有前景,但具体增益幅度与来源文中未充分说明。

Head Avatars with Dynamic Explicit Hair Figure 1
2026-07-28cs.CV

Head Avatars with Dynamic Explicit Hair

Vanessa Sklyarova, Haonan Chen, Berna Kabadayi, Tobias Kirschstein, Zicong Fan, Xi Wang, Gerard Pons-Moll, Matthias Nießner, Marc Pollefeys, Michael J. Black, Justus Thies

2026-07-28视觉感知

该工作针对头部数字人中头发常被静态或手工物理参数处理、导致转头和晃动时不真实的问题,提出 DynHair:用显式发丝对齐的 3D Gaussian 表示头发,并以头部角速度、加速度和相对重力驱动 LSTM+FiLM+MLP 预测发丝形变,结合光度、几何和物理正则端到端训练。实验显示其在发丝动态、时间一致性和跨主体泛化上优于现有头部 avatar 方法,但发身碰撞和分割误差仍是限制。

Controllable Diversity in Normalization-Based Implicit Ensembles via Softmax-Temperature Modulation Figure 1
2026-07-28cs.LG

Controllable Diversity in Normalization-Based Implicit Ensembles via Softmax-Temperature Modulation

Mihai Suteu, Ovidiu Serban

Data Science Institute, Imperial College London

2026-07-28规划控制

深度集成能给出可靠不确定性但训练和存储成本随成员数线性增长,现有隐式集成又缺少训练中调控成员多样性的手段。论文提出仅复制归一化层的 σN-Ens,用 sigmoid 缩放表示特征重要性,并用 softmax 温度正则控制共享与分歧水平。实验显示其在 CIFAR、ImageNet、SST-2 上以更少参数匹配或超过深度集成,校准在分布偏移下较稳,但 OOD 检测较弱。

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Figure 1
2026-07-28cs.SD

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang, Kexin Huang, Qi Luo, Zhe Xu, Ying Zhu, Jin Wang, Tengyue Zhang, Qi Chen, Cheng Chang, Songlin Wang, Junqi Dai, Jiasheng Ye, Xiaogui Yang, Tianyi Liang, Xiangyu Peng, Zhaoye Fei, Shimin Li, Qinyuan Cheng, Xie Chen, Xinchi Chen, Xipeng Qiu

Fudan University, Shanghai Innovation Institute, Shanghai Jiao Tong University

2026-07-28视觉感知生成模型

本文针对音视频联合生成中音频与视频 VAE 潜空间各自训练、缺乏细粒度同步对齐的问题,提出 jointly trained OmniVAE:在重建目标外加入片段级双向对比学习来对齐音视频时序语义,并用冻结语义编码器做单模态蒸馏。实验显示,两类训练目标分别提升跨模态同步与潜空间可学习性,下游文本到音视频生成在质量和同步指标上均有改进,且推理阶段不增加额外成本。

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models Figure 1
2026-07-28cs.CV

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

Zhaoyuan He, Muhammad Muaz, Lili Qiu

Department of Computer Science, The University of Texas at Austin, Austin, TX, USA

2026-07-28生成模型

高分辨率图像与视频扩散模型推理昂贵,主要瓶颈来自多步去噪中反复计算注意力密集特征。OmniCache的核心洞察是中间特征在帧内、帧间、运动块和去噪步之间存在可复用冗余,因此用Token、Frame、Block和Layered Cache分层跳过计算并恢复位置一致的缓存激活,而非像 token merging 那样平均特征。实验在SD3、SVD-XT和Latte上实现约25%至35%延迟下降,同时基本保持视觉质量和运动一致性。

STEER: Steerable Dyadic Head Avatars Figure 1
2026-07-28cs.CV

STEER: Steerable Dyadic Head Avatars

Kartik Teotia, Helge Rhodin, Hyeongwoo Kim, Marc Habermann, Christian Theobalt

Max Planck Institute for Informatics and Saarland Informatics Campus, Max Planck Institute for Informatics, Max Planck Institute for Informatics and Saarland Informatics Campus Germany, Max Planck Institute for Informatics Germany

2026-07-28视觉感知

STEER针对现有语音驱动/双人头像方法难以显式控制目光、点头节奏和情绪的问题,提出用公开视频追踪生成伪标签,并以因果flow-matching Transformer学习伴侣感知的头部运动,再通过FLAME到Gaussian头像驱动空间的映射实现高保真渲染。实验显示其在运动质量、动态性和多样性上优于近期双人运动基线,伴侣耦合保持竞争力,并支持实时交互控制;但控制维度仍是离散标签,泛化受标注管线和RealTalk数据分布限制。

Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations Figure 1
2026-07-28cs.CV

Consistent Evidence, Robust Recognition: Faithful Attribution Regularization under Geometric Transformations

Xianghao Jiao, Ruoyu Chen, Wei Wang, Jiazi Hu, Jiawei Liang, Shangquan Sun, Shiming Liu, Qunli Zhang, Xiaochun Cao

2026-07-28视觉感知安全鲁棒

本文针对几何变换下模型可能转向不对应证据、而 Grad-CAM 等显著图一致性未必代表真实决策一致的问题,提出无需标注的子模搜索归因正则化,用决策影响筛选紧凑判别区域,并以排序损失对齐搜索路径和停止点。ImageNet-100 上归因稳定性由 0.14 提升到 0.27,Insertion/Deletion 明显改善;ImageNet-1K 上变换输入准确率小幅提升,干净准确率损失约 0.30 个百分点。

Beyond Appearance: A Multi-cue Framework and Large-scale Benchmark for Pedestrian Association and Tracking on Mobile Aerial-Ground Platforms Figure 1
2026-07-28cs.CV

Beyond Appearance: A Multi-cue Framework and Large-scale Benchmark for Pedestrian Association and Tracking on Mobile Aerial-Ground Platforms

Ruiqi Wu, Bingliang Jiao, Ruize Han, Hangzheng Yu, Xunkai Jiang, Shining Wang, Yuanqi Hu, Wenxuan Wang, Peng Wang

School of Computer Science, Northwestern Polytechnical University, Xi’an, China, Ningbo Institute, Northwestern Polytechnical University, Ningbo 315000, China, and National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, Xi’an, China, Ruize Han is with the Shenzhen University of Advanced Technology, Shenzhen, China

2026-07-28视觉感知数据集/基准

本文面向移动空地多摄像头中的行人关联与跟踪,针对视角剧变使外观匹配失效的问题,提出 FUSION:将外观、局部环境、3D结构和邻居关系自适应融合,并用跨视角历史特征同步增强轨迹表示;同时发布更大规模 RealMvMoAT 基准。实验称其在该数据集和六个公开基准上达到 SOTA,但具体增益中方法与数据规模的贡献仍需进一步区分。

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis Figure 1
2026-07-28cs.CV

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

2026-07-28视觉感知

这篇工作针对病理诊断依赖低倍结构到高倍细胞形态的跨尺度推理,而现有病理 VLM 和 VQA 多停留在单尺度且易被文本捷径破解的问题。作者构建基于诊断路径的 PathScale-VQA,并用文本对抗筛选、结构化干扰项和尺度感知强化学习训练 PathScale-R1。实验显示其在跨尺度病理问答上达到最优,并能迁移到常规单尺度 VQA。

RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction Figure 1
2026-07-28cs.CV

RoadVGGT: Road-Structure-Aware Feed-Forward Road Surface Reconstruction

Han Jiao, Chen Liu, Jiakai Sun, Zhanjie Zhang, Mengyuan Yang, Yimeng Li, Mofan Zhou, Kun Zhan, Lei Zhao

2026-07-28三维

面向高精地图和自动驾驶感知中的大规模道路表面重建,RoadVGGT试图摆脱逐场景优化带来的训练成本和覆盖设计依赖。其核心是在OmniVGGT几何预测上接入高斯属性头,并用道路平面对齐的置信加权网格融合、类别分组和路缘保护压缩冗余高斯。实验显示该方法在保持紧凑表示的同时提升BEV图像、语义映射、 elevation估计和新视角合成质量。

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation Figure 1
2026-07-28cs.CV

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation

Jianhan Lin, Yuchu Qin, Jiateng Yuan, Wenbo Zhang, Shuai Gao

2026-07-28三维安全鲁棒

面向自动驾驶和移动机器人在复杂环境中的稳健定位,DAP-Pose针对多传感器异步、浅层融合和物理约束缺失问题,提出端到端视觉-IMU-GNSS融合框架,通过DTA在潜空间对齐时间偏移,BCF建模跨模态运动交互,并加入SO(3)与GNSS尺度约束抑制漂移。在KITTI上报告平均平移误差1.31%、旋转误差0.46°,且在人工时间错位下仍保持鲁棒。

Source-Free Controlled Adaptation of Teachers for Continual Test-Time Adaptation Figure 1
2026-07-28cs.LG

Source-Free Controlled Adaptation of Teachers for Continual Test-Time Adaptation

Anurag Roy, Riddhiman Moulick, Vinay Kumar Verma, Saptarshi Ghosh, Abir Das

Indian Institute of Technology, Kharagpur

2026-07-28规划控制

这篇论文针对持续测试时适应中目标域不断变化、教师模型固定 EMA 动量易导致伪标签噪声累积和模型漂移的问题,提出 DMSE:用预测熵动态调节教师更新动量,并直接用源预训练分类器权重估计类原型,避免访问源数据或统计量。实验在四个基准上优于多种 CTTA 方法,包括部分依赖源数据的方法;但在干净 CIFAR-100 保持源域性能时存在退化,说明动态适应仍可能带来漂移。

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratories Figure 1
2026-07-28cs.RO

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratories

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

2026-07-28机器人数据集/基准

面向化学自驱实验室中失败代价高、真实故障数据稀缺且评测粗粒度的问题,本文提出 LabRobFail:通过仿真在控制、物理和语义层注入故障,构建 2 万余条轨迹、11 类细粒度失败,并评测检测、定位、严重度和纠正等能力。专用 LabRobFail-VLM 在已见环境故障检测达 92.58%、时间定位达 85.58%,接入实时监督后使 VLA 任务成功率提升 10–20 个百分点;但训练主要依赖合成环境,真实泛化仍需进一步验证。

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation Figure 1
2026-07-28cs.CV

Parameter-Efficient Adaptation of SAM3 for Prompt-Driven Surgical Concept Segmentation

Changjing Liu, Yiming Huang, Beilei Cui, Liangjing Shao, Long Bai, Yanheng Li, Haoxuan Che, Hongliang Ren

2026-07-28视觉感知

这篇论文针对手术图像与自然图像预训练分布差异、而现有医学 SAM 全量微调成本过高的问题,提出在 SAM3 的提示编码器、检测器和跟踪器中加入 LoRA,并冻结视觉骨干,仅训练 0.98% 参数,同时用统一概念词表跨数据集共享权重。实验称其在 CholecSeg8k、EndoVis18、CaDISv2 上优于零样本 SAM3、SurgTPGS 和全量微调 Medical SAM3,并可服务于后续重建与仿真流程。

GNM Head: A Generative aNthropometric Model of the human head Figure 1
2026-07-28cs.CV

GNM Head: A Generative aNthropometric Model of the human head

Stylianos Ploumpis, Jan Bednarik, Gaspard Zoss, Ruslan Guseinov, Luca Prasso, Prashanth Chandran, Oliver Boyne, Vasileios Choutas, Timo Bolkart, Daoye Wang, Menglei Chai, Di Qiu, Sebastian Winberg, Gilles Rainer, Lewis Bridgeman, Delio Vicini, Jérémy Riviere, Yannick Boetzel, Alexander Koumis, Jay Busch, Cynthia Herrera, Jacob Still, Scott Ysebert, Peter Lincoln, Sergio Orts Escolano, Christoph Rhemann, Erroll Wood, Thabo Beeler, Stefanos Zafeiriou

2026-07-28生成模型

现有人头3DMM多只建模外表面,缺少牙齿、舌头和精细眼部结构,限制生成、人脸重建与动画中的几何约束。GNM将头脸、颈部、眼球、牙齿和舌头纳入统一参数空间,并加入语义采样、局部表情与碰撞约束拟合管线。实验显示其在目标3D人脸拟合和表达控制上优于FLAME,但增益可能部分来自更高质量数据与更完整资产。

Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping Figure 1
2026-07-28cs.CV

Perturbation-Aware Diffusion-Guided Hybrid Segmentation for Robust and Annotation-Efficient Plant Stress Phenotyping

Gurbhit Chaurakoti, Soumyashree Kar

aDepartment of Electrical Engineering, National Institute of Technology Delhi, New Delhi, 110036, India, bCentre of Studies in Resources Engineering, Indian Institute of Technology Bombay, Powai, Mumbai, 400076, India, DeepLabV3+, and SegFormer backbones generate coarse masks that are refined by Denoising Diffusion, or when only a small amount of labeled data, is available., local resources, where the available Graphics, introduced DeepLabV3+, which combines atrous, controllability through conditioning.

2026-07-28视觉感知生成模型安全鲁棒

本文针对植物胁迫分割在光照、遮挡、跨域和少标注条件下易失效的问题,将U-Net、DeepLabV3+、SegFormer与DDPM、潜空间扩散、语义引导扩散组合,用扩散模块细化粗掩码,并以扰动分析指导重训练。最佳模型在PlantSegV3上达到71.83% refined mIoU和26.10% Boundary-F1,低数据与外部数据集适应实验显示其鲁棒性和标注效率较好。

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation Figure 1
2026-07-28cs.CV

Contrastive Parameter Disentanglement for Multi-modal Remote Sensing Image Generation

Yu Zhang, Wenda Zhao, Haojun Tang, Haipeng Wang

2026-07-28视觉感知

论文针对遥感生成长期偏向单一光学模态、难以同时利用红外和 SAR 互补信息的问题,提出从 LoRA 参数层面解耦语义不变性与模态属性:用 A 矩阵承载跨模态语义锚点,多个 B 矩阵适配不同模态,并通过 query-key 结构迁移保持跨模态空间对齐。实验显示其在生成质量、语义一致性及下游分类上优于现有方法。

RRTrack: Robust and Recoverable Object 6D Pose Tracking for Dynamic Scenes Figure 1
2026-07-28cs.CV

RRTrack: Robust and Recoverable Object 6D Pose Tracking for Dynamic Scenes

Junyue Li, Ye Zheng, Yifan Chen, Zhe Sun, Xuelong Li

2026-07-28视觉感知三维安全鲁棒

RRTrack面向机器人在快速运动、完全遮挡和目标重现时容易丢失6D位姿的问题,将记忆式视频分割与CAD/RGB-D位姿细化做成2D–6D闭环,并用渲染掩码一致性约束记忆更新;目标丢失后,再用DINOv2双模板库结合离线合成视图和在线观测锚点恢复位姿。其自建动态合成基准显示,相比FoundationPose,ADD-S AR提升66.3%、AUC提升65.7%,同时达到55.2 FPS,真实实验也验证了噪声场景下的鲁棒性。

XMatchAD: A Cross-Modal Matching Perspective on Reconstruction-based Anomaly Detection Figure 1
2026-07-28cs.CV

XMatchAD: A Cross-Modal Matching Perspective on Reconstruction-based Anomaly Detection

Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai

2026-07-28视觉感知三维

针对重建式无监督异常检测中细小缺陷不敏感、误检漏检和边界模糊的问题,XMatchAD将输入图像与重建图像视为伪跨模态对,利用窗口化交叉注意力做局部匹配,并结合频率感知融合强化高频边界信息;在MVTec-AD、VisA和MPDD上报告优于现有多类别检测与定位方法。

GRAPE: Graduated Routing for Articulated Portrait mesh Estimation Figure 1
2026-07-28cs.CV

GRAPE: Graduated Routing for Articulated Portrait mesh Estimation

Yunfei Liu, Lijian Lin, Ye Zhu, Yu Li

International Digital Economy Academy

2026-07-28视觉感知

GRAPE针对单目肖像网格估计中“悬浮头”、颈肩运动缺失以及下颌与表情参数纠缠的问题,提出将FLAME头部与SMPL-X躯干合成PPM,并用按解剖层级逐步回归的PAA网络和Graduated-Mask Router约束从躯干、颈部、头部到下颌和表情的估计。实验显示其在网格恢复、姿态对齐和下颌-表情解耦上优于已有方法,并能改善语音驱动说话人和3D肖像生成。

WGDnet: Wishart-guided Geometric-aware Deep Network for PolSAR Image Classification Figure 1
2026-07-28cs.CV

WGDnet: Wishart-guided Geometric-aware Deep Network for PolSAR Image Classification

Junfei Shi, Haojia Zhang, Yu Cheng, Yuke Li

2026-07-28视觉感知

这篇论文针对 PolSAR 分类中传统 Wishart 模型难以端到端适配、深度网络又常忽略协方差统计与方向几何结构的问题,提出 WGDNet:用可学习 Wishart 卷积提取多尺度方向统计边缘,再以方向先验聚合和自适应几何卷积建模各向异性地物。四个真实数据集结果显示其分类精度和边界保持优于对比方法。

A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting Figure 1
2026-07-28eess.IV

A Controlled Visual-Backbone Benchmark for Multimodal Short-Term Solar Irradiance Forecasting

Oshadha Samarakoon, Dushan Herath, Ishara Ranmandala, Dilshara Herath, Roshan Godaliyadda, Parakrama Ekanayake, Vijitha Herath

Dept. of EEE, University of Peradeniya, MARC, University of Peradeniya

2026-07-28视觉语言规划控制数据集/基准

针对短时太阳辐照预测中常把视觉编码器、时序模型和训练策略一起改变而难以归因的问题,本文固定多模态流程,仅替换 ConvNeXt、Swin 与多种视觉 Mamba 骨干,提供受控基准。结果显示 Folsom 严格划分下视觉模型均优于智能持久性,VMamba Small 与 Swin Base RMSE 约 65 W/m²;但 NREL 小样本严格划分中智能持久性最好,说明跨数据集优势并不稳固,架构优劣和增益来源仍需更多统计验证。

PathSelect: Sequential Token Selection for Whole Slide Pathology Figure 1
2026-07-28cs.CV

PathSelect: Sequential Token Selection for Whole Slide Pathology

Jingzhi Chen, Landi He, Zehong Chen, Peihang Wu, Lijian Xu

Shenzhen University of Advanced Technology

2026-07-28视觉感知

本文针对全切片病理图像输入 token 极长、静态采样易丢失稀疏诊断证据的问题,将 token 裁剪改写为可学习的顺序选择。PathSelect 在冻结 SlideChat 编码器和 LLM 的前提下,用 Soft Top-K、VP 噪声门和去噪器训练可微路由,推理时仅保留 Scorer 做 Hard Top-K。实验显示平均仅用 44.86 个 token,在 SlideBench TCGA 达到 74.00% 准确率,并实现约 36.6 倍 token 压缩。

Segmentation Robustness and Predictive Utility in Glioblastoma Radiomics: Evidence for a Trade-off in Survival Modelling Figure 1
2026-07-28eess.IV

Segmentation Robustness and Predictive Utility in Glioblastoma Radiomics: Evidence for a Trade-off in Survival Modelling

Mariya Miteva, Maria Nisheva-Pavlova

Faculty of Mathematics and Informatics – Sofia University St. Kliment Ohridski, 5 James, the University of Pennsylvania Glioblastoma Imaging, Genomics, and Radiomics (UPENN-

2026-07-28视觉感知安全鲁棒

这篇论文针对胶质母细胞瘤影像组学生存建模中“分割越稳健是否越有用”的常见假设,比较自动与专家修正分割下4752个MRI特征的ICC稳健性,并在删失感知模型中评估预测价值。结果显示,约48.1%特征稳健,但加入影像组学或按稳健性筛选均未稳定优于临床基线,模型选中特征反而更不稳健,提示稳健性不能单独作为特征选择依据。

Markerless Motion Capture in Routine Clinical Upper Limb Assessments: Validity and Insights Beyond Ordinal Scoring Figure 1
2026-07-28cs.CV

Markerless Motion Capture in Routine Clinical Upper Limb Assessments: Validity and Insights Beyond Ordinal Scoring

Tim Unger, Olivier Lambercy, Roger Gassert, Andreas R. Luft, R. James Cotton, Chris Easthope Awai

Data Analytics & Rehabilitation Technology (DART), Lake Lucerne Institute, Vitznau, Switzerland, Rehabilitation Engineering Laboratory, ETH Zurich, Zurich, Switzerland, Lake Lucerne Institute, Vitznau, Switzerland, Shirley Ryan AbilityLab, Department of Physical Medicine and Rehabilitation, Northwestern University, Chicago, IL, USA

2026-07-28强化学习

针对 ARAT 等上肢康复量表主观、离散且易饱和的问题,论文把基于多摄像头 RGB 的无标记动作捕捉嵌入常规临床评估,用连续运动学指标补足人工评分。20 名神经系统患者、47 次评估中的 1174 个任务显示,重建误差在临床可接受范围内且不随损伤程度明显恶化,指标能按预期区分评分组;纵向病例还揭示相同 ARAT 增益背后的不同恢复模式,并在量表到顶后继续捕捉改善。

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion Figure 1
2026-07-28cs.CV

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

Guo Yurong, He Yufei, Li Yonghao, Chang Dongliang, Zhang Ke, Ma Zhanyu

North China Electric Power University, Beijing University of Posts and Telecommunications, North China Electric Power University Baoding Hebei China, Beijing University of Posts and Telecommunications Beijing China

2026-07-28视觉感知规划控制

该文针对红外-可见光融合中离散提示难以表达细粒度用户意图的问题,提出 ConFusion:用高斯条件的实例级空间调制学习连续融合空间,并结合双分支特征解耦、Grounded SAM 掩码和文本语义增强来分别控制模态特异与不变信息。实验称其在融合质量和下游任务指标上优于现有方法,但依赖 LLM 与分割模型带来额外开销,鲁棒性受意图解析和实例掩码质量限制。

Weakly Supervised Instance-Level Gleason Pattern Estimation Using Primary and Secondary Labels Figure 1
2026-07-28cs.CV

Weakly Supervised Instance-Level Gleason Pattern Estimation Using Primary and Secondary Labels

Nao Sugeta, Kaito Shiku, Shinnosuke Matsuo, Ryoma Bise

2026-07-28视觉感知

针对前列腺癌病理中只有切片级 Primary/Secondary Gleason 标签、缺少 patch 级标注的问题,本文将 Gleason 评分的临床定义显式写入 MIL:先汇总实例预测为类别计数,再约束主导与次主导模式及其 dominance,从而学习局部 Gleason 模式。在 SICAP-MIL 上,该方法优于已有 MIL,并给出更具空间可解释性的实例级预测。

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents Figure 1
2026-07-28cs.CV

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents

Yunlong Lin, Zixu Lin, Zhaohu Xing, Biqiang Li, Chenxin Li, Haonan Wang, Haitao Wu, Hengyu Liu, Jianghai Chen, Kaituo Feng, Kaixin Li, Shawn Chen, Shijue Huang, Sixiang Chen, Tsung-Yi Ho, Wenxuan Huang, Xiangyan Liu, Xiaomeng Hu, Xuanhua He, Yan Sun, Yunqing Zhao, Zhiqin Yang, Zehan Wang, Zhengyang Tang, Tianyu Pang, Xiangyu Yue

2026-07-28视觉语言

针对创意生成从单次提示转向长流程、多模态项目时上下文易丢失、版本和反馈难追踪的问题,JarvisHub将画布建模为智能体可读写的项目图,并通过画布状态、协议桥和运行时统一工具调用、修改校验与轨迹记录。论文展示其可支撑叙事媒体、网页等长流程创作,但结果主要是定性案例,缺少系统基准和量化增益。

SketchMamba: A Lightweight State-Space Model for Joint Progressive Sketch Classification and Stroke Auto-Completion Figure 1
2026-07-28cs.CV

SketchMamba: A Lightweight State-Space Model for Joint Progressive Sketch Classification and Stroke Auto-Completion

Kavish Jhaveri, Arya Shah

The National High School, Ahmedabad, India, Indian Institute of Technology, Gandhinagar, India

2026-07-28视觉感知

这篇论文面向流式绘图交互中“边画边识别并补全”的需求,指出以往矢量草图方法常把识别和生成分开处理。SketchMamba的核心是用同一个因果Mamba状态同时驱动逐步分类、笔画GMM预测和笔状态预测,并用每步分类监督塑造中间状态。结果显示其在Quick, Draw! 58类上最终Top-1为94.93%,渐进AUC为0.706;消融表明早期识别能力主要来自密集监督,而非单纯架构替换。

Neuromorphic Object Detection: An In-Depth Study and Future Directions Figure 1
2026-07-28cs.CV

Neuromorphic Object Detection: An In-Depth Study and Future Directions

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

2026-07-28视觉感知

面向高速运动、低照度和边缘功耗约束下传统相机检测退化的问题,本文系统梳理事件相机目标检测,从事件表示、时序建模、多模态融合、异步处理、低延迟与能效计算等维度重构方法谱系,并补充数据集、指标和代表模型基准比较。主要结果是给出当前模型在精度、速度、鲁棒性与能耗上的横向差异,指出标准化评测不足仍限制真实进展判断。

D3O: Dynamic Distribution Distillation for Ordinal Regression Figure 1
2026-07-28cs.CV

D3O: Dynamic Distribution Distillation for Ordinal Regression

Chunlai Dong, Yaojun Hu, Yuyang Xu, Haochao Ying, Jian Wu

Zhejiang University, Zhejiang University Hangzhou China

2026-07-28视觉感知

这篇论文针对有序回归中离散标签来自连续语义切分、边界模糊且受主观标注噪声影响的问题,指出固定标签监督会把不可靠的顺序关系全局固化。D3O用自蒸馏动态演化标签分布,并结合视觉语言对齐的有序感知增强与基于CDF的跨层蒸馏,使监督随样本不确定性更新。文中在四类有序回归任务上报告优于现有方法,尤其在噪声和类别不均衡设置下更明显。

GaitFace: A Multimodal Dataset for Long-Range Person Identification Figure 1
2026-07-28cs.CV

GaitFace: A Multimodal Dataset for Long-Range Person Identification

Alain Komaty, Luis S. Luevano, Vidit Vidit, Anjith George, Zeina Al Amine, Sébastien Marcel

Idiap Research Institute, Martigny, Switzerland

2026-07-28视觉语言数据集/基准

面向边境通行、监控等远距离身份识别中低分辨率、视角变化和环境退化带来的失效问题,GaitFace构建了公开的脸部-步态多模态数据集,结合手机预注册、最长约100米的多视角户外采集、光学变焦与原生低清视频,并覆盖两次会话的外观变化。基准实验显示,现有SOTA脸部和步态模型在低分辨率及高视角条件下明显退化,光学辅助虽有帮助但不能消除该场景难度。

Geometry Meets Semantics: Fractional Gradient Stabilization for Semantic-Driven Bounding Box Optimization in Visual Detection Tasks Figure 1
2026-07-28cs.CV

Geometry Meets Semantics: Fractional Gradient Stabilization for Semantic-Driven Bounding Box Optimization in Visual Detection Tasks

Qi Ming, Haitian Yang, Xudong Zhao, Mingjing Zhao, Liuqian Wang, Nanqing Liu

Beijing University of Technology, ShanghaiTech University, Beijing Institute of Technology, Beijing Electronic Science and Technology Institute, Zhengzhou University, Yunnan Normal University

2026-07-28视觉感知优化算法学习理论

该文针对视觉检测中 IoU 框回归只看几何、且旋转框角度梯度易震荡的问题,提出 FrSIoU:用框内语义相似度与几何 IoU 联合监督,并通过自适应门控和分数阶历史状态抑制异常梯度。实验覆盖多种检测器、框表示和任务,文中称可稳定带来性能增益,但具体增益来源仍需结合代码与消融进一步核实。

ATCNet-CIAM for Multi-Session Motor Imagery EEG Signal Classification Figure 1
2026-07-28cs.CV

ATCNet-CIAM for Multi-Session Motor Imagery EEG Signal Classification

Le Huu Son Hai, Nguyen Chi Hai, Truong Viet Vu, Nguyen Phuc Nguyen, Nguyen Thai Anh, Ngo Hoang Tu

2026-07-28视觉感知

该文针对运动想象 EEG 在跨被试、跨会话中信噪比低和分布漂移导致解码不稳的问题,提出在 ATCNet 中加入频带感知的通道集成注意、交叉门控通道-时间交互、ECA-TCN 与自适应窗口融合,以增强谱-空-时特征选择。实验在 BCI IV-2a/2b 和 WBCIC-MI 上取得 86.32%、87.96% 及 89.46%/83.64% 的准确率,并显示跨会话稳定性有所改善,但跨会话退化仍未完全解决。

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction Figure 1
2026-07-28cs.CV

Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang

Tongyi Lab, Tongyi Lab Beijing China

2026-07-28强化学习

本文针对上半身人像生成只复现动作、难以稳定刻画手物接触与局部场景变化的问题,提出以连续人体状态和离散交互状态联合控制的人本世界模型:用多尺度隐式运动表示融合躯干、手和面部动态,并用少量语言编码命令表示接触状态。实验显示其在细粒度动作、手物协调和身份一致性上优于基线,并可在双 H100 上以 25 FPS 流式生成,但实时性依赖高端算力。

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving Figure 1
2026-07-28cs.CV

MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving

Zhijing Cheng, Xuancheng Zhang, Donglin Di, Lei Fan, Baorui Ma, Hao Li, Xun Yang

2026-07-28视觉感知

MOJITO针对端到端自动驾驶中“感知压缩后再规划”的信息瓶颈,提出图像、LiDAR与动作三分支并行的统一传感器到动作框架,用逐块Modal Joint Attention让规划token直接访问细粒度多模态特征,并兼容ViT/DiT基础模型、减少锚点和辅助监督依赖。在NAVSIM v1/v2上分别达到88.9 PDMS和88.4 EPDMS,报告为当前最优,同时展示了扩展性、指令跟随和多样轨迹生成能力。

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation Figure 1
2026-07-28cs.CV

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

The Chinese University of Hong Kong, The University of Hong Kong, The Hong Kong University of Science and Technology

2026-07-28机器人视觉感知

MemVLN针对连续视觉语言导航中长时视觉历史与低延迟控制难以兼顾的问题,引入类人情景记忆和程序记忆:用金字塔分辨率保留近期细节并压缩远期观测,用单 token 中层动作词表减少自回归解码。实验显示,MemVLN-4B在R2R、RxR成功率较Qwen3-VL-4B分别提升5.8%和9.7%,推理提速7倍并达到14 FPS。

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation Figure 1
2026-07-28cs.CV

Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation

Musa Tur Farazi, Nufayer Jahan Reza

2026-07-28视觉语言

本文面向低资源孟加拉语政治 meme 识别,动机在于图像线索、风格化 OCR 文本和讽刺语境难以用单模态或简单拼接建模。方法用 VLM 提取 OCR,结合 OpenCLIP/XLM-R,并以 token-region 跨注意力对齐文本语义与视觉区域,同时考察政治词典先验。PoliMemeDecode 上 Macro-F1 约 0.94、MCC 约 0.88;但词典手工增强反而影响校准,说明收益主要来自学习式多模态融合。

To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion Figure 1
2026-07-28cs.CV

To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion

Shaswati Saha, Rajasekhar Anguluri, Manas Gaur

2026-07-28安全鲁棒

论文针对扩散模型概念擦除中“擦得干净”与“保留可用性”难以兼顾的问题,指出静态概念库难覆盖真实去噪触发方向。PARSE无需训练,直接用CFG查询模型词表构建擦除/保留子空间,并在发现再触发方向时自适应扩展;在NSFW、风格和物体擦除实验中,相比多种基线提升攻击下鲁棒性,同时维持较好FID,并用BEUS统一衡量二者平衡。

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation Figure 1
2026-07-28cs.CV

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu

2026-07-28三维

PlanCraft针对住宅生成中“先给完整条件、直接让LLM布置3D”与真实建筑设计流程不匹配的问题,提出渐进式草图到户型再到家具的管线:用SketchPlan从8万真实户型重放绘制过程,PlanCraft-Diff粗到细补全可向量化平面图,再由约束求解的Agent在房间边界内布置。实验显示其FID较最佳2D方法低61.1%,专家评估空间合理性比既有3D系统高15分。

Learning Sampling Parameters for Diffusion Models Figure 1
2026-07-28cs.LG

Learning Sampling Parameters for Diffusion Models

Arisrei Lim, Yossi Gandelsman

fidelity image generation. Progress has come from novel scalable denoising architectures [5], diffusion models. Concretely, we learn policies that predict four schedulable parameters across

2026-07-28生成模型

论文针对扩散模型推理参数通常对所有提示和去噪步固定的问题,提出 LeSAMP:冻结图像模型,用经 GRPO 训练的 LLM 按提示生成逐时间步的正/负提示、CFG 和噪声调度。其核心洞察是把采样参数策略作为外部可学习控制,而非微调扩散权重。实验在 FLUX.1 和 SD 3.5 上相对默认、SAP、R2F 取得最高 68.12% 人类偏好模型胜率、73.37% VLM 评判胜率,用户研究最高 59.46%。

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation Figure 1
2026-07-28cs.CV

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

2026-07-28视觉感知

这篇论文针对视频生成中物理行为难以用文本精确指定的问题,提出用参考视频作为“视觉上下文”来传递材料响应、接触、形变和运动轨迹等物理线索。VIPER借助MLLM提取参考视频中的可迁移物理信息,并通过分层训练引导图生视频模型;同时构建VIPER-19K数据集。实验显示其在参考物理相似度和人工偏好上优于代表性基线,且保持相近的视频质量。

Robust 6-DoF Object Pose Tracking with Built-In Recovery under Occlusions and Rapid Object Motions Figure 1
2026-07-28cs.CV

Robust 6-DoF Object Pose Tracking with Built-In Recovery under Occlusions and Rapid Object Motions

Balázs Opra, Léo Ghafari, Thomas Stewart, Cyrill Stachniss

2026-07-28视觉感知三维安全鲁棒

面向机器人操作中遮挡、出框和快速运动导致6DoF位姿跟踪丢失且难以自动恢复的问题,论文在RGB-D模型跟踪框架中结合学习式关键点匹配、优化对齐、关键帧管理与循环一致性可靠性检测,并在失效后进行全局重检测和候选验证。实验显示其在常规基准上接近SOTA精度,在遮挡和快速运动场景更稳健,速度达57.6 FPS。

Direction-adaptive Mamba: Spatial-Frequency Dual-Domain Collaborative Learning for PolSAR Image Classification Figure 1
2026-07-28eess.IV

Direction-adaptive Mamba: Spatial-Frequency Dual-Domain Collaborative Learning for PolSAR Image Classification

Junfei Shi, Yu Cheng, Haojia Zhang, Wenqiang Hua, Junhuai Li, Maoguo Gong

2026-07-28视觉感知

针对 PolSAR 分类中现有 Mamba 仅做空间扫描、易丢失边缘纹理且固定扫描难刻画各向异性散射的问题,论文提出 DA-Mamba-DDCL:用 NSCT 分解低频全局与多方向高频结构,并按边缘方向自适应扫描,再与空间域散射特征融合。三组真实 PolSAR 数据集上优于已有方法,但具体增益在多大程度来自方向扫描或双域融合仍需结合消融细节判断。

Multi-Modal Object Re-Identification with Prompt-S6 and Semantic-Aware Knowledge Guidance Figure 1
2026-07-28cs.CV

Multi-Modal Object Re-Identification with Prompt-S6 and Semantic-Aware Knowledge Guidance

Weixiang Zhou, Jiabei Zuo, Yuhao Wang, Cong Wang, Huchuan Lu, Zhixun Su

source code is available at https://github.com/zw-absin/PRISM., Weixiang Zhou and Zhixun Su are with the School of Mathematical, Sciences and the Key Laboratory for Computational Mathematics and Data, Intelligence of Liaoning Province, Dalian University of Technology, Dalian, Jiabei Zuo is with the School of Computer Science and Technol-, ogy, Dalian University of Technology, Dalian, 116024, China (e-mail:, Yuhao Wang and Huchuan Lu are with the School of Future Technology, School of Artificial Intelligence, Dalian University of Technology, Dalian, Cong Wang is with the Department of Radiology and Biomedical Imag-, ing, University of California, San Francisco, 94107, USA (e-mail: super-

2026-07-28视觉感知

面向复杂光照、遮挡和背景杂乱下的多模态目标重识别,论文指出现有方法既难抑制背景干扰,也多停留在两两模态融合。PRISM以Prompt-S6实现线性复杂度跨模态交互,引入语义掩码驱动的token剪枝和渐进式三模态融合,在四个多模态ReID基准上验证了更好的有效性与效率。

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models Figure 1
2026-07-28cs.CV

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models

Yiming Zhong, Chang Nie, Caifeng Shan

Nanjing University

2026-07-28视觉感知

Omni-Prune针对OmniLLM在音视频输入下token序列过长、推理prefill延迟和显存开销高的问题,提出无需训练的查询感知剪枝框架。其关键在于用音频显著峰划分自适应时间窗,并将编码器注意力、文本查询相关性和音视频配对关系统一纳入token选择,再用K-medoids补足代表性线索。实验在五个全模态视频基准上显示,方法在保留超过99%完整模型性能的同时,最高获得3.25倍prefill加速和1.3倍显存降低。

Semantic Semi-Incremental Data-Association-Free Object SLAM Figure 1
2026-07-28cs.RO

Semantic Semi-Incremental Data-Association-Free Object SLAM

Yihao Zhang, Jungseok Hong, John J. Leonard

2026-07-28视觉感知

这篇论文针对对象 SLAM 中地标观测与变量关联易出错、且传统 DAF-SLAM 难以利用语义信息和长轨迹易受里程计漂移影响的问题,提出语义化、半增量的数据关联自由框架,同时估计位姿、地标位置、语义、关联和地标数量。核心做法是把类别标签或视觉基础模型特征并入关联优化,并用分块处理降低漂移与计算量;在合成和真实数据上相对 kSLAM 及多种强基线表现更好,但异常观测处理仍未解决。

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models Figure 1
2026-07-28cs.CV

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

2026-07-28视觉语言视觉感知

本文针对端侧大视觉语言模型中视觉编码器被重型 CLIP/SigLIP 主干拖慢的问题,提出 UltraViT:基于真实设备延迟设计金字塔式异构空间混合器,并用密集蒸馏加冻结 LLM 生成监督进行两阶段预训练。实验显示其在保持多模态语义能力的同时优于 FastVLM 等编码器基线,端侧速度约快 1.7 倍。

Investigating the Visual Cues of CNNs for Vascular Segmentation: A Case Study in Microscopy and Fundus Imaging Figure 1
2026-07-28eess.IV

Investigating the Visual Cues of CNNs for Vascular Segmentation: A Case Study in Microscopy and Fundus Imaging

Weslley dos Santos Silva, Cesar Henrique Comin

Department of Computer Science, Federal University of São Carlos, São Carlos, SP, Brazil

2026-07-28视觉感知

针对血管分割模型“能分对但不知凭什么”的问题,本文在显微与眼底成像中用像素归一化/打乱、轮廓与中心线输入、感受野调节来拆解 CNN 对强度、纹理、形状和上下文的依赖。结果显示强度比纹理更关键,但扰动后仍能保持较高性能;仅靠稀疏形状难以恢复完整血管,模型实际多依赖约 20 像素的局部感受野,眼底图像从全局上下文获得小幅收益。

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing Figure 1
2026-07-28cs.CV

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

Jakub Rymarski (1, 2), Adam Rempała (1), Bartłomiej Sobieski (1, Przemysław Biecek (1, 2) ((1) University of Warsaw, Poland, (2) Centre for Credible AI, Warsaw University of Technology, Poland)

University of Warsaw, Poland, Centre for Credible AI, Warsaw University of Technology, Poland

2026-07-28视觉感知

本文关注BiomedCLIP等医学视觉语言模型解释中,子词分词把临床概念切碎导致跨模态归因噪声和组合爆炸的问题。作者提出ParseFIxLIP,用依存句法树将相关词合成语义单元,再计算Weighted Banzhaf交互。ROCOv2和示例分析显示,该方法在长放射描述上比原始token级基线更稳健、解释更连贯,但主要是解释质量改进而非模型性能提升。

Codebook Capacity Governs Perceptual Quality Across Resolutions in Hierarchical Discrete Video Compression Figure 1
2026-07-28eess.IV

Codebook Capacity Governs Perceptual Quality Across Resolutions in Hierarchical Discrete Video Compression

Manikanta Kotthapalli, Banafsheh Rekabdar

Department of Computer Science, Portland State University

2026-07-28视觉感知

针对连续潜变量视频压缩在不同分辨率下常需重新训练或率失真校准的问题,论文系统考察层次离散 MS-VQ-VAE 的跨分辨率行为,核心洞察是感知质量主要受码本容量 K 控制,而非空间分辨率。UCF101 上 12 个设置显示,K 对 LPIPS 的影响约为分辨率的 10 倍,熵效率随分辨率升高仍稳定或提升,并在低码率下相对 H.264/H.265 获得明显 LPIPS 改善;但仅覆盖 64 到 256 分辨率且未比较主流学习式 codec。

Trainable Nonexpansive Denoisers for Contractive Image Reconstruction Figure 1
2026-07-28eess.IV

Trainable Nonexpansive Denoisers for Contractive Image Reconstruction

Arghya Sinha, Aditya Banerjee, Trishit Mukherjee, Kunal N. Chaudhury

2026-07-28视觉感知三维

论文针对PnP图像重建中深度去噪器反复迭代易失稳、现有Lipschitz约束多只在训练样本上经验成立的问题,提出利用图像格点置换构造可训练的全局非扩张去噪器,并经对称化与前向算子组合得到收缩重建迭代。实验在超分辨率和去模糊上达到接近软约束基线的效果,同时给出全局收敛与Lipschitz保证。

Patient-Agnostic Synthetic Pretraining for Efficient Patient-Specific Intraoperative 2D/3D Registration Figure 1
2026-07-28eess.IV

Patient-Agnostic Synthetic Pretraining for Efficient Patient-Specific Intraoperative 2D/3D Registration

Minheng Chen, Youyong Kong

2026-07-28三维

这篇论文针对术中单视角2D/3D配准中每位患者都需从头训练模型、成本高且难部署的问题,提出先在多CT合成DRR上做患者无关预训练,再用少量目标患者合成投影适配,并结合无需分割的域随机化、球面相似学习和可微LM优化细化位姿。多解剖数据实验显示,该策略可显著减少患者特异训练需求,同时保持较准确的配准性能;但具体收益与预训练规模、随机化设置的解耦关系仍需看完整实验细节。

Stabilizing Deep Reconstruction Operators with Contractive Anchoring Figure 1
2026-07-28eess.IV

Stabilizing Deep Reconstruction Operators with Contractive Anchoring

Arghya Sinha, Trishit Mukherjee, Kunal N. Chaudhury

2026-07-28三维

这篇论文针对 PnP/RED 图像重建中预训练去噪器反复迭代会出现 PSNR 先升后崩的稳定性问题,提出用收缩锚点算子对黑盒重建算子做自适应顺序平均,在不重训或修改原网络的情况下约束局部不稳定性。实验覆盖多种近端算法、去噪器、噪声和成像任务,显示方法能持续避免 collapse,并提升重建流程的可靠性。

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models Figure 1
2026-07-28cs.CV

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

University of Doha for Science and Technology, Doha, Qatar, North South University, Dhaka, Bangladesh

2026-07-28视觉语言视觉感知

这篇论文关注VLM中向冻结语言模型注入场景图、几何关系等辅助信号时为何常失效。核心洞察是可学习门控几乎总会在行为上关闭,源于死梯度或负效用;因此作者改用双曲视觉关系图的几何损失在训练前向中正则化LoRA,并强调前缀注入需做嵌入范数对齐。实验显示保留几何路径可维持GQA关系题精度,VSR上去掉几何损失下降4.6pp,但结果主要限于LLaVA-1.5-7B与GQA,泛化性仍需验证。

A Reference-Free Framework for Evaluating Single-Frame ISP Pipelines Figure 1
2026-07-28eess.IV

A Reference-Free Framework for Evaluating Single-Frame ISP Pipelines

Yujin Cho, Sira Ferradans, Jean-Michel Morel, Gabriele Facciolo, Thomas Eboli

Lingnan University, Hong Kong

2026-07-28视觉感知

面向手机相机 ISP 调参与评测中难以获取严格对齐干净参考图的问题,本文将全参考指标转化为无参考估计:由处理后的 sRGB 图像和 ISO 预测代理参考,再计算 PSNR、SSIM、LPIPS。实验显示模型可由合成数据迁移到真实 ISP,并优于直接指标回归和常规盲 IQA;LoRA 微调可适配组件或配置变化,但跨传感器泛化文中未充分说明。

Hiding in Plain Sight: An Effective Physical Adversarial Patch Attack against Visual-Infrared Fused Face Detection Figure 1
2026-07-28cs.CR

Hiding in Plain Sight: An Effective Physical Adversarial Patch Attack against Visual-Infrared Fused Face Detection

Qiucheng Yu, Tao Ni, Yihe Zhou, Jiayimei Wang, Qingchuan Zhao

2026-07-28视觉感知

视觉-红外融合人脸检测常用于测温与安防,但既有对抗贴片多只针对单一模态或停留在数字域,难以评估真实风险。论文提出 VIPatch,将渐变口罩与创可贴作为自然外观载体,并联合优化可见光和红外扰动以制作物理贴片。实验称其在数字和物理场景攻击成功率均超过 90%,同时较不易被人察觉。

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features Figure 1
2026-07-28cs.CV

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

Chen-Yi Lu, Yueh-Shao Chen, Somali Chaterji

2026-07-28视觉感知

这篇论文针对 CLIP 将“有狗”和“没有狗”等相反文本映射得过近、导致视觉检索和判别忽略否定的问题,提出“表示坍塌”解释:中间层仍保留组合语法,后层为视觉对齐而抹掉否定信号。PeakPatch 在冻结 CLIP 的前提下从峰值中间层提取否定特征并修正最终嵌入/分数,仅增 5.2M 参数;在 NegBench 上 COCO MCQ 达 74.3%、VOC MCQ 达 65.5%,OOD 否定检索也超过微调基线。

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation Figure 1
2026-07-28cs.CV

WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, jiebo Luo

Media Analytics and Computing Lab, Xiamen University, Xiamen, China, Department of Computer Science, University of Rochester, Rochester, NY, USA

2026-07-28视觉感知

长视频输入会让 LVLM 视觉 token 数量激增,现有剪枝或合并方法又容易混淆时序冗余与空间细节。WaveZip 的核心洞察是用小波变换把低频结构和高频细节解耦:时间上用帧相关性与帧间变化分配 token 预算,空间上用查询显著性重权高频细节,且无需任务训练。实验显示在 10 倍压缩下仍保留 99.6% 全量性能,优于近期压缩方法。

SARATR-X-v2: Scale-Aware Structural Pre-Training for SAR Foundation Models Figure 1
2026-07-28cs.CV

SARATR-X-v2: Scale-Aware Structural Pre-Training for SAR Foundation Models

Weijie Li, Yafei Song, Yongxiang Liu, Bowen Peng, Jie Zhou, Jingyuan Xia, Wei Yang, Tianpeng Liu, Zhen Liu, Li Liu

increasingly available for tasks such as image classification, by the Innovation Research Foundation of National University of Defense, The authors are with the College of Electronic Science and Technology, National University of Defense Technology, Changsha 410073, China (e-

2026-07-28视觉感知

本文针对 SAR 掩码预训练中过度重建像素、易受相干斑扰动且难以适配分类、检测、分割不同尺度需求的问题,提出 SARATR-X-v2:用六种固定结构算子构造具物理稳定性的多尺度目标,并通过可学习权重融合为重建监督。实验在 12 个 SAR 基准上取得领先迁移表现,合成斑噪下表征漂移较像素监督降低近两个数量级,消融显示主要增益来自结构目标与自适应跨尺度融合。

A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions Figure 1
2026-07-28cs.CV

A Reconstruction-Based Framework for Caption Evaluation Beyond Reference Captions

Zhijiang Tang, Jiaxin Qi, Kaihua Tang, Yuhua Zheng, Jianqiang Huang

Computer Network Information Center, Chinese Academy of Sciences, China, Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, China, Tongji University, China

2026-07-28视觉语言数据集/基准三维

针对图像描述评测过度依赖人工参考、难以衡量语义保真的问题,论文提出以“由描述重建图像并在下游视觉语言任务上保持等价”为核心的无参考评测框架,用任务问答一致性替代像素级相似度。实验分析了生成器、评判器和问题选择带来的依赖,并提出低成本 CTTD 基准作为近似替代,可复现完整任务套件的总体趋势,但其与人类偏好的对应关系仍文中未充分说明。

BoneAgeTW2: Automated Skeletal Maturation Assessment via the Tanner-Whitehouse 2 Method, Deep Learning, and Clinical Report Generation with Distribution Curves Figure 1
2026-07-28cs.CV

BoneAgeTW2: Automated Skeletal Maturation Assessment via the Tanner-Whitehouse 2 Method, Deep Learning, and Clinical Report Generation with Distribution Curves

Juan Manuel Castillo Pinto

2026-07-28视觉感知

该文针对TW2骨龄评估耗时、依赖专家且缺少开源完整流程的问题,提出BoneAgeTW2:用YOLOv8定位20块手骨、EfficientNet-B3分骨分类成熟阶段,并自动计算RUS/Carpal分数、置信区间和高斯分布报告。系统声称CPU下5秒内出具PDF报告,但性能多为预期值,尚未临床验证,实际增益来源不清。

Counterfactual Motion Reliability Learning for Robust UAV Tracking Figure 1
2026-07-28cs.CV

Counterfactual Motion Reliability Learning for Robust UAV Tracking

Yuehai Chen

2026-07-28视觉感知安全鲁棒

这篇论文针对红外反无人机跟踪中目标小、低对比且易被热干扰和背景运动误导的问题,指出关键不只是引入运动信息,而是判断运动是否与目标一致。CMRTrack通过训练时构造“擦除目标”的反事实历史分支,约束运动编码器抑制伪运动,并用运动引导 token 调制与可靠性分数融合接入一流 Transformer 跟踪器;在 Anti-UAV410 上优于多种现有方法,并显著提升 OSTrack 基线。

Out-of-Length Scene Text Recognition: A Two-Axis Diagnosis and a Training-Free Fix Figure 1
2026-07-28cs.CV

Out-of-Length Scene Text Recognition: A Two-Axis Diagnosis and a Training-Free Fix

Zobeir Raisi, John Zelek

2026-07-28视觉感知

针对场景文字识别模型在训练长度外长文本上失效的问题,论文将故障拆成编码器宽度与解码器时间两轴,指出主要瓶颈来自宽图像输入导致的视觉表征分布外退化,而非单纯位置编码外推。RoPE 缩放和轻量微调只能小幅降低 CER;其训练-free 的重叠裁剪、独立解码与几何锚定编辑距离拼接方法,在 LTB 上达到约 43% 平均词准确率,PARSeq 上达 47.11%,接近或超过既有长文本方法。

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models Figure 1
2026-07-28cs.CV

OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models

Jinsen Su, Yongdong Luo, Yuexiao Ma, Yibo Hu, Meiguang Jin, Xiaowu Zheng

2026-07-28视觉感知

判断受限于 PDF 文本抽取质量。论文面向全模态大模型在图像、视频、音频等输入下 token 数量膨胀、推理成本高的问题,提出按模态解耦的 token 压缩思路,试图为不同模态采用更合适的保留或合并策略;但当前文本主要抽到题名与参考文献,方法细节、实验指标和主要增益文中未充分说明,实际结果与增益来源不清。

Fashion-3DLR: A Controllable 3D Garment Generation Using Pairwise Fashion Elements for Intelligent Design Figure 1
2026-07-28cs.CV

Fashion-3DLR: A Controllable 3D Garment Generation Using Pairwise Fashion Elements for Intelligent Design

Shenghao Yang, Hongtao Zhang, Yuhan Yi, Zhihao Tang, Zihao Cui, Lian Wen, Han Yan, Yuan Gao, Mingbo Zhao

Donghua University, Shanghai Artificial Intelligence Laboratory, Donghua University Shanghai China, Shanghai Artificial Intelligence Laboratory Shanghai China

2026-07-28规划控制三维

针对3D服装生成难以同时保留草图结构、纹理外观并支持后续仿真与试穿的问题,Fashion-3DLR用GFF-DiT融合成对时尚元素,再以rectified flow生成几何潜变量并解码为3DGS或网格。实验称其在结构、纹理质量、物理仿真和虚拟试穿上优于既有方法,但具体增益来源仍需更多消融支撑。

A Scale-adaptive Vision Model Links C. elegans Neuronal Morphology to Behavior for Neurotoxicity Assessment Figure 1
2026-07-28cs.CE

A Scale-adaptive Vision Model Links C. elegans Neuronal Morphology to Behavior for Neurotoxicity Assessment

Haochao Ying, Shenchong Lv, Yutao Sun, Zijian Tu, Xufeng Jin, Yuyang Xu, Yizhe Wang, Wei Yang, Xiaomin Yue, Jian Wu, Peilin Yu

2026-07-28视觉感知生成模型

针对线虫神经毒性评估仍依赖人工形态评分、且难以预测行为后果的问题,本文构建 CeNeuMorph 共聚焦图像基准,并提出尺度自适应自监督视觉模型,在固定 token 预算下联合学习不同分辨率与 patch 尺度。模型在分类、分割、检测上优于通用和生医基础模型,断裂检测准确率达 88.4%,结合形态描述符可预测多巴胺相关行为缺陷,并在 180 种农化物筛查中指认苯并咪唑基团的潜在神经毒性关联。

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation Figure 1
2026-07-28cs.CV

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

Hangzhou Dianzi University, University of Zurich, University of Exeter

2026-07-28机器人视觉语言视觉感知

该文针对连续视觉语言导航中视觉细节冗余导致泛化变差、计算负担加重的问题,提出 CompactNav,以“最小充分表示”为核心,通过指令条件视觉过滤、低秩跨模态约束对齐和压缩世界模型,仅保留与路径规划相关的语义、拓扑和几何信息。实验在 R2R-CE 与 RxR-CE val-unseen 上相对既有 SOTA 提升 SR/SPL 约 2.0/1.0 与 0.94/0.78,但低秩瓶颈与锚点质量的影响仍需进一步验证。

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion Figure 1
2026-07-28cs.AI

CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion

Shreshth Saini, Neil Birkbeck, Yilin Wang, Balu Adsumilli, Alan C. Bovik

2026-07-28视觉感知生成模型

视频扩散的测试时搜索能提升质量,但每个候选都全量去噪,成本高昂。CachedSearch 的关键洞察是缓存虽有损,却通常保留验证器排序,因此可先用激进缓存廉价探索,再只对胜出种子全算力重生成。实验显示在 best-of-8 中保留 94.7% 增益、仅用 63% 成本,并在六个模型、四类架构上大体成立。

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video Figure 1
2026-07-28cs.CV

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

Graduate School of Information Science and Technology, University of Tokyo, Tokyo, Japan

2026-07-28视觉语言视觉感知强化学习

针对交通事故视频中现有VLM多停留在场景理解、缺少真实急救调度规程支撑的问题,本文提出DispatchRAG:先将行车记录仪片段转为文本,再检索日本交通法规与EMS协议,由LLM生成带规则引用的紧急程度、派遣单位和三类对象处置建议。作者还构建500段视频的Accident Dispatch Dataset,实验显示该分解式、协议约束方案在紧急度、派遣与转运等结构化决策上优于端到端VLM。

Occlusion-Point Reuse for Ray-Traced Ambient Occlusion and Shadow Figure 1
2026-07-28cs.GR

Occlusion-Point Reuse for Ray-Traced Ambient Occlusion and Shadow

Haojie Jin, Fujia Su, Zehui Lin, Chenxiao Hu, Jierui Ren, Yuqing Yuan, Yanchen Zhang, Zhongtao Wang, Yisong Chen, Kangying Cai, Guoping Wang, Sheng Li

Peking University, Peking University Beijing China

2026-07-28视觉感知

本文针对实时光线追踪中 AO 与软阴影在低采样预算下噪声高、传统光样本复用不适合 AO 且在半影和薄遮挡物附近易失效的问题,提出复用首个命中遮挡点而非最终可见性或光样本,将两类估计改写到遮挡物域并用 MIS 合并邻域样本。实验显示其 AO 和阴影质量优于无复用基线,阴影在相近成本下也优于光样本复用。

SHReg: Strictly Rotation-Equivariant Point Cloud Registration via Spherical Harmonics Figure 1
2026-07-28cs.CV

SHReg: Strictly Rotation-Equivariant Point Cloud Registration via Spherical Harmonics

Chongjian Wang, Junjie Gao

2026-07-28三维

SHReg针对点云配准中大旋转下描述子既要不变又要保留可辨几何信息的矛盾,避免依赖局部参考系或旋转增强来近似不变性。方法用球谐函数和SO(3)不可约表示构建严格旋转等变骨干,同时产生不变描述子和等变方向线索,使单个对应点也能提出刚体变换假设,减少RANSAC式采样。实验在3DMatch、3DLoMatch和KITTI上显示其配准精度与大旋转鲁棒性优于已有方法。

Inverse Bayesian Inference for Extracting Lesion Dynamics from Longitudinal Spectral CT Figure 1
2026-07-28cs.CV

Inverse Bayesian Inference for Extracting Lesion Dynamics from Longitudinal Spectral CT

Lukas Förner, Melina Wördehoff, Julian Steffens, Maximilian Schmutz, Rainer Claus, Josua Decker, Thomas Kröncke, Kartikay Tehlan, Thomas Wendler

2026-07-28视觉感知

针对纵向医学影像常把各时间点静态处理、难以解释病灶演化机制的问题,论文用逆向贝叶斯推断从光子计数谱 CT 中估计线性 ODE 参数,将变化分解为病灶自身动力学、同器官卫星灶数量影响和卫星灶行为耦合。实验在 10 名 NSCLC 患者 32 个转移灶上显示,肺部高能通道存在显著负数量耦合,提示竞争动态;肝转移灶出现约 +1 的协同行为耦合,但作者也指出肝脏样本少且共线性较强,解释需谨慎。

DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding Figure 1
2026-07-28cs.CV

DishSeg24k: A Large-Scale Benchmark for Food Segmentation with Stochastic Expert Decoding

Yilin Wang, Haochen Shi, Guanyu Chen, Weiqing Min, Jinkai Zheng, Chenggang Yan, Shuqiang Jiang

Institute of Computing Technology, CAS, Hangzhou Dianzi University, North China Electric Power University, Lishui Institute of Hangzhou Dianzi University, Institute of Computing Technology, CAS Beijing China, Hangzhou Dianzi University Hangzhou China, North China Electric Power University Beijing China, Lishui Institute of Hangzhou Dianzi University Lishui China

2026-07-28视觉感知数据集/基准

这篇论文针对真实餐饮场景中菜品遮挡密集、类别细粒度相似和长尾分布导致现有食物分割基准不足的问题,提出 DishSeg24k 数据集,并设计 FEAST,将查询解码建模为 MDP,引入强化学习引导的 MoE 与双 critic 路由优化。实验显示其在 DishSeg24k 上较已有方法提升 3.21% mIoU、3.68% mDice、4.00% mAcc,并在 FoodSeg103 上也有增益。

Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models Figure 1
2026-07-28cs.CV

Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models

Sultan Alshehri, Zhantao Yang, Han Zhang, Marios Savvides

2026-07-28视觉语言视觉感知

论文针对 CLIP/SigLIP 等双编码视觉语言模型在“有 A 且无 B”等组合检索中把相似度误当逻辑约束的问题,指出失败主要来自标量相似度对概念证据的袋式平均,而非编码器完全缺失概念信息。其提出免训练的 LCSE,将原子概念证据抽取与布尔约束执行分离,并只在需要时编辑分数;在 FACTOR-Bench 上达 85.5%,优于最佳微调基线 73.2%,SigLIP 2 上达 90.7%,同时基本保持常规检索性能。

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs Figure 1
2026-07-28cs.CV

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

2026-07-28视觉感知

针对高分辨率 MLLM 中视觉 token 数量激增导致剪枝选择本身成为延迟瓶颈的问题,论文提出 SFPruner,将冗余控制嵌入打分空间:先用语义引导的 ridge leverage 抑制协方差层面的主导冗余,再用基于排序的方向性掩码并行压低相似低分 token。结果显示在 Qwen2.5-VL 选 512 个 token 时选择耗时由 112.4ms 降至 2.5ms,并在激进压缩下保持接近 SOTA 的性能。

When Less Is More: A Controlled Benchmark of Lightweight CNNs for Satellite Land-Cover Segmentation on DeepGlobe Figure 1
2026-07-28cs.CV

When Less Is More: A Controlled Benchmark of Lightweight CNNs for Satellite Land-Cover Segmentation on DeepGlobe

Atiq Ur Rehman, Joseph Michael Donovan

of Economics & Decision Sciences, University of South Dakota, Vermillion, SD, USA., University of South Dakota, Vermillion, USA, models in resource-constrained remote-sensing environments, enabling scalable land-cover mapping.

2026-07-28视觉感知规划控制数据集/基准

本文针对遥感地物分割中轻量模型与深层CNN的效率-精度取舍缺少受控比较的问题,在DeepGlobe上统一预处理、训练协议和无增强设置,比较CNN、AlexNet、VGG16、InceptionV3与MobileNetV2的多版本。核心洞察是更大模型不必然更优:24.98MB的MobileNetV2_v1取得最高总体精度0.7906和mIoU 0.4625,但牧场与裸地等光谱相近少数类仍混淆明显。

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars Figure 1
2026-07-28cs.CV

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Work done during an internship at China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.

2026-07-28视觉感知

OmniMate面向开放式多轮交互头像生成中难以预知响应长度、长时生成易身份漂移的问题,提出进度控制器显式建模每个流式片段的完成度,并用多参考图像与参考语音持续约束视觉和说话人身份。基于交互版VerseBench的实验显示,其在低延迟流式生成、执行/聆听状态切换和长时音视频一致性上优于多类基线。

Breaking the Synthetic-Real Domain Shortcut for Training-Free Generative Replay-based Class Incremental Learning Figure 1
2026-07-28cs.CV

Breaking the Synthetic-Real Domain Shortcut for Training-Free Generative Replay-based Class Incremental Learning

Tao Zhang, Qixuan Fan, Yiyuan Liang, Yanjie Wang, Song Yan, Tian Tian, Jiahuan Zhou, Luxin Yan, Sheng Zhong, Xu Zou

2026-07-28生成模型

本文针对无样本类增量学习中用冻结文生图模型生成旧类样本时的失败模式:合成旧类与真实新类混训会让模型利用“真实/合成”域差异而非类别语义。作者提出 DREAM,通过特征域校正、正交子空间投影和真实原型约束削弱域捷径。实验覆盖 CIFAR-10/100、ImageNet-Subset、Tiny-ImageNet,报告优于现有无样本 CIL 方法。

mmSimPrior: Learning Simulation Priors for Data-Efficient Real-World Generalizable Radar-Based Human Motion Reconstruction Figure 1
2026-07-28cs.CV

mmSimPrior: Learning Simulation Priors for Data-Efficient Real-World Generalizable Radar-Based Human Motion Reconstruction

Cheng Guo, Qiming Cao, Shengkai Xu, Haoyu Xie, Kaixiang Su, Pu Wang, Hongfei Xue

2026-07-28强化学习三维

毫米波雷达可在隐私和弱光场景下重建人体运动,但真实配对雷达-动作数据昂贵且易过拟合部署环境。mmSimPrior将仿真监督拆成信号、运动和映射先验,并用物理启发域随机化缓解仿真到真实差距,支持零样本和少量真实序列适配。在无重叠评测中,仅用24条真实序列时MPJPE较最强基线降低24.7%–39.0%,零微调分类模式也降低8.5%。

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation Figure 1
2026-07-28eess.IV

PriSAR: 3D Geometric-Prior-Guided Diffusion for Parameter-Controlled SAR Image Generation

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

College of Information Science and Technology, Beijing University of Chemical Technology, Beijing 100029, China, Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing 100190, China

2026-07-28视觉感知生成模型规划控制三维

针对SAR图像受观测角度影响大、真实数据稀缺且常规生成模型缺少显式几何控制的问题,PriSAR把3D模型经轻量射线投射得到的视角相关点云先验,与文本和视觉条件通过FiLM融合,并用LoRA适配SD3.5 Medium。真实SAR飞机数据实验显示,该几何先验提升了结构保真度、视角一致性和数据增强效果,但点云先验构建仍带来额外CPU开销。

HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale Figure 1
2026-07-28cs.CV

HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale

Aniket Sakpal, Yang Jiang, Rouzbeh Davoudi, Shayan Hassantabar, Mani Najmabadi

2026-07-28视觉感知

文中针对图生视频在营销、房产等高信任场景中易出现模糊、抖动和相对输入图像的幻觉、难以规模化质检的问题,提出HALLELUAI闭环系统:按单个资产评估画质、运动和源图一致性,并把结构化诊断交给代理再生成模块做提示、相机、模型或底图调整。人工参与评测显示其与创意专家判断较一致,可产出生产级视频,但具体量化增益和成本边界文中未充分说明。

Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions Figure 1
2026-07-28cs.LG

Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions

Quyen Tran, Hai Nguyen, Quan Dao, Zhuowei Li, Nam Le, Trung Le, Dimitris Metaxas

Rutgers University 2Tuft University 3HUST 4Monash University

2026-07-28视觉感知

这篇论文针对解析式类增量学习在长尾数据流中明显失效的问题,指出根因不是单纯样本少,而是 RLS Gram 矩阵中尾类方向发生谱塌缩,导致求逆放大噪声。作者提出 GSR,用球面流形混合和自适应谱增密选择性抬升尾类小特征值,在不显著压缩头类的情况下改善稳定秩;实验称在长尾 CIL 基准上优于现有解析式方法。

Layering Virtual Try-On Figure 1
2026-07-28cs.CV

Layering Virtual Try-On

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

2026-07-28视觉感知

本文针对现有虚拟试衣只擅长单件替换、难以在保留内层衣物的同时完成加穿、脱层和连续编辑的问题,提出 LVTON 基准与方法。核心洞察是将任务拆成通用试衣先验与层叠遮挡知识:先用时尚视频经分割和修复生成的无掩码、姿态变化数据学习变形与身份保持,再用小规模层叠数据微调学习组合逻辑。结果显示其在 LVTON 上优于现有方法,并在传统 VTON 基准上具备较好迁移和零样本能力。

Controlling Embedding Spaces with Text-Conditioned Transformations Figure 1
2026-07-28cs.CV

Controlling Embedding Spaces with Text-Conditioned Transformations

Joseph Fioresi, Fabian Caba Heilbron, Pankaj Nathani, Mubarak Shah, Kushal Kafle

2026-07-28规划控制

这篇论文针对 CLIP/SigLIP 等多模态嵌入把物体、颜色、视角、风格等语义压到单一向量后,细粒度属性难以被检索或聚类控制的问题,提出用文本条件超网络生成全局仿射变换,在冻结编码器和既有索引上直接重塑嵌入空间。其核心洞察是把“按属性相似”转化为潜空间变换,而非重训编码器或调用大模型重标注。实验称在属性检索和多属性聚类上达到或超过现有方法,覆盖 19 类属性、187 个子类,且推理开销接近于零。

Small-Pollinator Detection in Cluttered Field Video Figure 1
2026-07-28cs.CV

Small-Pollinator Detection in Cluttered Field Video

Onur Onal (Iowa State University), Chen Chen (Institute of AI, University of Central Florida)

2026-07-28视觉感知

本文面向田间视频中传粉昆虫目标极小、背景杂乱且易受模糊遮挡影响的问题,在单GPU预算下系统比较YOLO与RF-DETR、输入分辨率、切片推理、融合和时序后处理。核心洞察是检测器选择与分辨率提升比复杂推理策略更有效;RF-DETR Large 1344分辨率在隐藏测试集达0.405 mAP50:95,优于1120模型和YOLO基线,而蜂与食蚜蝇混淆仍是主要瓶颈。

AdaKAN: A dual-branch adaptive Kolmogorov-Arnold network for medical image segmentation Figure 1
2026-07-28cs.CV

AdaKAN: A dual-branch adaptive Kolmogorov-Arnold network for medical image segmentation

Dalia Alzu'bi, Deep Bhattacharyya, Ali Ayub, A. Ben Hamza

Department of Cybersecurity and Intelligent Systems Engineering, Concordia University, Montreal, Canada

2026-07-28视觉感知

针对医学图像分割中卷积难建模长程依赖、Transformer 计算开销高、MLP/KAN 表达受限的问题,AdaKAN 在 U 形编码器-解码器中结合卷积、Efficient Attention 与双分支 AdaptKAN:一支用 Bernstein 多项式 KAN 做平滑函数逼近,另一支做通道细化和自适应缩放。文中称其在多类医学数据集上取得优于现有方法的分割精度,但具体增益来源仍可能受模块叠加与 scaling 影响。

Meshless Domain Randomization via Explicit Parameter Perturbation of 3D Gaussian Splatting Figure 1
2026-07-28cs.GR

Meshless Domain Randomization via Explicit Parameter Perturbation of 3D Gaussian Splatting

Felipe Nunes Carbone de Carvalho, Joyce de Morais Souza, Alan de Aguiar, Charles Morphy D. Santos, João Paulo Gois

2026-07-28三维

面向昆虫等复杂有机体的合成训练数据,传统基于网格的域随机化会在建模半透明结构、细毛和视角相关反射时引入损失。论文的核心做法是直接扰动 3D Gaussian Splatting 参数:用球谐系数改变颜色与烘焙光照,用 3D 空间噪声替换纹理以突出形态,并在 Unity 中随机背景、自动生成 2D 框标注。结果上展示了一条无需网格提取的标注数据生成流程,但检测或分类增益文中未充分说明。

Same Predictions, Different Reasons: The Effect of Quantization on Model Explanations Figure 1
2026-07-28cs.LG

Same Predictions, Different Reasons: The Effect of Quantization on Model Explanations

Kazi Kamruzzaman Rabbi, Md. Zami Al Zunaed Farabe, M. Sohel Rahman

2026-07-28视觉感知

本文关注后训练量化在保持预测准确率之外,是否也保留视觉模型的解释依据。作者用Grad-CAM与LIME同时比较五种CNN在FP32、INT8、INT4下的注意区域和特征归因,指出准确率不能代表解释稳定性。结果显示DenseNet161在两种精度下最稳,VGG19和ResNet18较稳,而EfficientNet-B0与MobileNetV2尤其在LIME归因上明显退化,说明量化部署需同时考虑架构与可解释性风险。

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests Figure 1
2026-07-28cs.CV

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

Yale University

2026-07-28视觉感知

这篇论文针对多模态模型在遮挡、支撑和精确计数等空间推理中容易“答对但过程不对”的问题,提出 Spatial-IQ,将堆叠三维物体计数拆成9个感知与认知子任务,并用约8万条 Isaac Sim 合成数据做诊断。结果显示,强模型常靠捷径取得目标任务正确率,却不保留人类式层级推理;用层级 CoT 监督和可验证奖励强化学习后,子任务一致性与最终计数准确率均明显提升。

Robustifying pathology foundation models via fine-tuning Figure 1
2026-07-28cs.CV

Robustifying pathology foundation models via fine-tuning

Alexandre Filiot, Oskar Thaeter, Benoit Schmauch, Lionel Guillou

Institute of Pathology, Technical University of Munich, School of Computation, Information and Technology, Technical University of Munich

2026-07-28安全鲁棒

病理基础模型在跨实验室部署时易受扫描仪、染色流程等采集差异干扰,导致特征混入非生物因素。本文的核心思路是直接对编码器做统一的轻量微调,而非只在下游校正,使表示对采集因素更不敏感。作者在10个模型上验证,PathoROB鲁棒性平均由0.72升至0.87,跨Patho-Bench、HEST和THUNDER的综合性能平均提升43%,且总体未观察到鲁棒性与性能的权衡。

Gaze-Anchored Social Net: Decoding Implicit Relations via Joint Modeling Figure 1
2026-07-28cs.CV

Gaze-Anchored Social Net: Decoding Implicit Relations via Joint Modeling

Yuqi Hou, Zhuo Chen, Han Hu, Je Woo Kim, Jianbo Jiao, Hyung Jin Chang

2026-07-28视觉感知

本文针对多人注视估计中常把个体独立处理、把社会关系作为事后离散标签的问题,提出 ANCHOR 以目标人为中心联合建模注视与潜在社会关系,通过关系注意力、特征调制和协同优化缓解任务梯度冲突。作者还扩展 GazeFollow,加入多人注视与社会影响排序标注,报告达到 SOTA,并给出静态注视模式可学习隐含社会层级的定量证据。

ID-V2V: Identity-Preserving Video Restylization Figure 1
2026-07-28cs.CV

ID-V2V: Identity-Preserving Video Restylization

Yuancheng Xu, Mingming He, Pablo Salamanca, Li Ma, Yash Kant, Emmett Steven, Paul Debevec, Ning Yu

Eyeline Labs, Netflix United States of America and Eyeline Labs United States of America, Eyeline Labs United States of America

2026-07-28视觉感知

这篇论文面向影视后期中“先捕捉表演、再改变场景与风格”的需求,解决视频重风格化时人脸身份、表情、视线和口型易漂移的问题。核心洞察是将身份保持从自由生成中解耦,视为只允许光照变化的人脸重光照问题,并用重光照人脸、法线、编辑关键帧和深度序列构造单视频训练监督。实验显示其在人脸相似度、细粒度表演保持、单人与多人场景及视觉质量上优于现有方法。

Agentic Autoresearch for CT Reconstruction Figure 1
2026-07-28cs.AI

Agentic Autoresearch for CT Reconstruction

Andreas Maier, Lucas Kachelriess, Siming Bayer, Yixing Huang, Yan Xia, Amber Simpson, Moritz Zaiss

Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU), Erlangen, Germany, Peking University, Beijing, China, University of Alberta, Edmonton, Canada, Department Artificial Intelligence in Biomedical Engineering (AIBE), Friedrich-Alexander-Universität Erlangen-Nürnberg (FAU), Erlangen, Germany

2026-07-28三维

这篇论文针对CT重建方法众多但人工实现、调参与公平比较成本高,且理想数据榜单难反映真实鲁棒性的问题,构建了由LLM代理驱动的自动研究循环,在统一可微扇束投影器和冻结指标下实现并评测26种方法。结果显示,代理可规模化完成基准测试并组合出极小参数量的竞争性求解器,但未发明新方法;更关键的是,轻微噪声几乎反转乳腺CT榜单,说明理想数据排名不能可靠预测真实扰动下表现。

Hybrid Semantic and Spectral Ensemble for Robust Synthetic Image Source Attribution Figure 1
2026-07-28cs.CV

Hybrid Semantic and Spectral Ensemble for Robust Synthetic Image Source Attribution

Md. Ajwad Hossain

2026-07-28视觉感知安全鲁棒

针对合成图像溯源在真实部署中易受 JPEG 压缩、模糊等分布偏移影响的问题,本文将 EMA 正则的 EfficientNet-B0 语义分支与基于噪声残差、SVD 频谱、LBP 和 XGBoost 的取证分支加权融合。该方法在含 10 类生成器、55% 严重退化测试样本的挑战中取得 95.60% 私榜准确率,并可在 CPU 上完成端到端运行。

Learning Dense 2D-3D Correspondence for X-ray-to-CT Registration of Knee Bones Figure 1
2026-07-28eess.IV

Learning Dense 2D-3D Correspondence for X-ray-to-CT Registration of Knee Bones

Rembert Daems, Jonas Grammens, Caro Roten, Andrew Meyer, Thomas Luyckx, Matthias Verstraete

2026-07-28三维

本文针对单张X光与术前CT配准膝骨6自由度位姿时初始化敏感、深度歧义和逐患者优化成本高的问题,学习跨患者的密集2D-3D嵌入对应,并用透射感知的多正样本InfoNCE监督射线上骨点,测试时直接PnP+RANSAC求解。结果显示其在未见患者上泛化良好、捕获范围更宽且成本低两个数量级,但单视角残余误差主要仍来自几何深度歧义,真实片临床精度尚未达到。

DY-LUT: Depth-Aware YCbCr Lookup Tables for Real-Time Underwater Image Enhancement Figure 1
2026-07-28eess.IV

DY-LUT: Depth-Aware YCbCr Lookup Tables for Real-Time Underwater Image Enhancement

Cunhao Zhu, Xiangtao Kong, Dongliang Xu, Zhiheng Zhang, Tianyu Wang, Yue Yao

Shandong University, The Hong Kong Polytechnic University, Mohamed bin Zayed University of Artificial Intelligence

2026-07-28视觉感知

这篇论文针对水下图像中随深度和波长变化的非均匀衰减,提出在 YCbCr 空间结合深度进行查表增强。核心思路是用双分支编码器预测全局 LUT 融合权重和像素级潜在退化索引,驱动可学习 4D LUT 并辅以轻量局部细化。实验显示其 3.56M 参数模型在 UIEB-90、LSUI 等数据上取得有竞争力的质量,同时较高容量基线快 9–304 倍,4K 自适应推理约 7 ms,并能改善检测和特征匹配。

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents Figure 1
2026-07-28cs.SE

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

Yan Yang, Xiangru Jian, Ziyang Luo, Zirui Zhao, Yutong Dai, Ziji Shi, Hanshu Yan, Jun Hao Liew, Silvio Savarese, Junnan Li

2026-07-28视觉感知

论文针对长程电脑操作代理过度依赖截图感知的问题,指出像素只是程序状态的有损投影,难以保证最终文件、后端或 DOM 状态正确。StateAct 让主代理优先用代码读写真实程序状态,仅将少量不可状态化子任务交给 GUI 子代理,并用独立 finish gate 检查持久化结果。OSWorld 2.0 上,Claude Opus 4.8 的二值成功率由 20.6% 提升到 26.9%,部分成功率由 54.8% 到 61.6%,成本约降 9 倍;剩余瓶颈主要转向推理和值正确性。

Small, Bias-Free, Blind and Convolutional Denoiser: A compact ConvNeXt U-Net for blind Gaussian color-image denoising Figure 1
2026-07-28eess.IV

Small, Bias-Free, Blind and Convolutional Denoiser: A compact ConvNeXt U-Net for blind Gaussian color-image denoising

Nikolas Markou

2026-07-28视觉感知三维

本文针对盲高斯彩色图像去噪中大模型依赖和跨噪声泛化问题,提出0.82M参数的无偏置ConvNeXt U-Net,将冻结Gabor前端、拉普拉斯金字塔跳连和全程齐次设计结合,使单一模型可按尺度外推噪声水平。结果在CBSD68、Kodak24、McMaster、Urban100上匹配或超过DnCNN/FFDNet,但仍落后大型CNN/Transformer;文中无消融,增益来源不清。

Learning-based Hierarchical Tracheal Anatomy Understanding from Sparse Surgical Demonstration Annotations for Ultrasound Robots Figure 1
2026-07-28eess.IV

Learning-based Hierarchical Tracheal Anatomy Understanding from Sparse Surgical Demonstration Annotations for Ultrasound Robots

Hiu Ching Cheung, Wenchao Yue, Zhengran Han, Mingcong Chen, Guanglin Cao, Hongbin Liu, Hongliang Ren

Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong, China, Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom, Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China, SLAI Shenzhen Loop Area Institute, China

2026-07-28机器人模仿学习

针对气管切开中切口定位依赖触诊和超声操作者经验的问题,论文把轻量YOLO定位与SAM2稀疏提示分割解耦结合,并利用甲状软骨锚点和软骨声影的层级顺序来减少超声纹理歧义。在受控与泛化数据上YOLOv8n+SAM2平均DSC为0.777,高于U-Net泛化DSC不超过0.494,速度达6.92 FPS,显示其更适合闭环机器人超声引导。

JPEG AIC2026: A large-scale dataset for fine-grained assessment of image coding Figure 1
2026-07-28eess.IV

JPEG AIC2026: A large-scale dataset for fine-grained assessment of image coding

Mohsen Jenadeleh, Jon Sneyers, João Ascenso, Thomas Richter, Alexander Karabutov, Panqi Jia, Elena Alshina, Osamu Watanabe, António Pinheiro, Touradj Ebrahimi, Dietmar Saupe

2026-07-28视觉感知数据集/基准

面向高保真图像压缩中细微伪影难以评测的问题,本文构建 AIC2026 数据集:从 2787 张候选图像中经语义聚类、指标分歧分析和人工筛选得到 70 张源图,并覆盖传统与学习式编解码器、细粒度 JND 失真级别。实验用 36 种 IQA 方法分析后发现,现有指标在细微质量差异上分歧明显,尤其难稳定评价学习式压缩伪影。

Inter-Reflective Gaussian Splatting for Robust and Efficient Inverse Rendering Figure 1
2026-07-28cs.GR

Inter-Reflective Gaussian Splatting for Robust and Efficient Inverse Rendering

Chun Gu, Xiaofei Wei, Zixuan Zeng, Yuxuan Yao, Li Zhang

2026-07-28三维安全鲁棒

这篇论文针对高斯溅射逆渲染难以同时处理二次可见性、间接光照和高光材质的问题,提出 IRGS++:以可微 2D 高斯光线追踪评估完整渲染方程,并结合金属材质建模、反射场景初始化、MIS 去噪和基于网格的重光照查询。实验显示其在低光泽与高光基准上提升材质分解和重光照质量,并取得较好的质量-速度折中。

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose Figure 1
2026-07-28eess.IV

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose

Thomas Bucher, Didier Neuenschwander, Thomas Petutschnigg, Michael Murek, David Bervini, Andreas Raabe, Manuela Eugster

Neuro Robotics Group, ARTORG Center, University of Bern, Bern, Switzerland, Department of Neurosurgery, Inselspital, Bern University Hospital, University of Bern, Bern, Switzerland

2026-07-28视觉感知三维

这篇论文针对神经外科显微镜视频长期只能作定性记录、缺少可量化三维几何的问题,尝试把单目显微图像与神经导航位姿结合,用未微调的 Depth Anything 3 估深并融合为点云/泊松网格。其关键洞察是现有手术设备已记录足够信息,可在导航坐标系中恢复毫米级表面:两个动脉瘤训练模型上误差约 1.02–2.33 mm,更多图像主要提升完整度,深走廊仍有局部缺失。

Generative Video Compression with Adaptive Score Distillation Figure 1
2026-07-28eess.IV

Generative Video Compression with Adaptive Score Distillation

Naifu Xue, Zhaoyang Jia, Haosen Li, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Qi Meng, Yuan Zhang, Yan Lu

2026-07-28视觉感知生成模型

面向超低码率视频压缩,本文针对现有扩散式编解码器依赖文本生成预训练骨干、未按压缩目标训练的问题,提出从零联合训练的像素域 GenVC,并用全局到局部层级恢复时空细节;其关键洞察是 DMD 蒸馏会因教师在学生偏移样本上给出误导梯度而导致运动停滞,因此用 Adaptive Score Distillation 按与真值方向的一致性门控更新。实验称相对 GLVC 在匹配 LPIPS/FID 下分别节省 62.5%/71.3% 码率,478M 模型可单步解码 1080p 达 15.1 fps。

Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models Figure 1
2026-07-28cs.CV

Cheap Probes Predict Expensive Training in 3D-CT Vision--Language Models

Renjie Liang

University of Florida, Gainesville, FL, USA

2026-07-28视觉感知三维

这篇论文针对3D CT视觉语言模型中编码器和token压缩方案需要逐一昂贵微调的问题,提出用冻结特征上的轻量probe先做候选排序。核心创新是构建图像可验证的临床属性探测基准,并用尺度合理性、可分性两道门控约束标签质量。初步结果显示,疾病probe AUROC与下游报告生成clinical micro-F1在6个配置上相关约r=0.95,但作者也承认结论仍受单数据集、少量配置和近似排序不稳限制。

Dementia Etiology Diagnosis via Collaborative Meta Knowledge Enhancement Figure 1
2026-07-28cs.LG

Dementia Etiology Diagnosis via Collaborative Meta Knowledge Enhancement

Siyuan Du, Mengxi Chen, Xinyang Jiang, Zilong Wang, Jiangchao Yao, Dongsheng Li, Ya Zhang, Lili Qiu, Yanfeng Wang

2026-07-28视觉感知

本文针对多中心痴呆病因诊断中采集协议、队列分布和模态缺失带来的异质性,提出 COME 框架,将采集语义、数据来源和模态指示编码为元知识 token 注入统一 Transformer,并用参考模型的信赖域约束抑制伪相关。七个队列实验显示平均 macro-AUC 达 85.62%,较最强基线提升 4.29 点,跨中心和跨序列泛化也更好,但部分收益可能仍来自更大规模多源数据训练。

Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging Figure 1
2026-07-28eess.IV

Frequency-Aware Dual-Stream Learning for Balanced Realism and Fidelity in Electron Microscopy Imaging

Longmi Gao, Zhengkai Zhao, Pan Gao, Manoranjan Paul

2026-07-28视觉感知

针对电镜成像中高分辨率、采集速度与辐照损伤之间的矛盾,论文认为单流网络难以同时兼顾真实纹理和像素保真。其核心是用小波将低频结构与高频细节解耦,分别交给条件扩散模型和 Transformer 重建。实验称在 EMDiffuse 等数据上提升 LPIPS 与分辨率比,并保持较有竞争力的 PSNR/SSIM,但具体增益来源仍可能受模型与数据规模影响。

pyALDIC: A Python Implementation of Augmented Lagrangian Digital Image Correlation with a GUI, Adaptive Meshing, and Mask-Aware Subset Splitting Figure 1
2026-07-28eess.IV

pyALDIC: A Python Implementation of Augmented Lagrangian Digital Image Correlation with a GUI, Adaptive Meshing, and Mask-Aware Subset Splitting

Zixiang Tong, Jin Yang

Department of Aerospace Engineering and Engineering Mechanics, The University of Texas at Austin, Austin, TX 78712, USA, Texas Materials Institute, The University of Texas at Austin, Austin, TX 78712, USA

2026-07-28视觉感知

针对传统局部DIC在噪声、裂纹/孔洞和大位移梯度下易失效,以及原AL-DIC依赖MATLAB、不便开源工作流集成的问题,本文将增强拉格朗日DIC重写为跨平台Python软件pyALDIC,并加入GUI/API、四叉树自适应网格、掩膜感知子区分裂和Local/AL-DIC可切换求解。验证覆盖合成位移、刚体运动、Mode-I裂纹、自适应细化和单轴拉伸实验,局部求解基准约每秒处理1.8万至1.9万个兴趣点。

Real-time Reconstruction of Human Visual Perception from fMRI Figure 1
2026-07-28cs.CV

Real-time Reconstruction of Human Visual Perception from fMRI

Rishab S. Iyer, Jiaxin Cindy Tu, Cesar Kadir Torrico Villanueva, Anish Mahishi, Ross P. Kempner, Jacob S. Prince, Ernest W. Lo, Akash Bhowmick, Hritik Arasu, Amaar Chughtai, Elizabeth A. McDevitt, Paul S. Scotti, Kenneth A. Norman

Princeton University, Dartmouth College, Icahn School of Medicine at Mount Sinai, Harvard University, University of Texas at Dallas, Medical AI Research Center (MedARC)

2026-07-28三维

该文针对实时 fMRI 神经反馈难以使用高精度视觉解码模型的问题,将计算量较大的 MindEye2 改造成可实时运行的 fMRI 到图像重建流程,并接入 RT-Cloud 在线处理。结果显示,在仅用约 1 小时 3T 数据微调后,系统可在受试者看图后数秒内进行单试次检索或重建,最快检索约 9.5 秒,证明离线级细粒度视觉解码可部分迁移到实时闭环场景。

Beyond Error-vs-Discard Characteristic: Toward Stable and Reliable Evaluation for Face Image Quality Assessment Figure 1
2026-07-28cs.CV

Beyond Error-vs-Discard Characteristic: Toward Stable and Reliable Evaluation for Face Image Quality Assessment

Bhavesh Wani, Žiga Babnik, Vitomir Štruc, Philipp Terhörst

Johannes Gutenberg University Mainz, Germany, University of Ljubljana, Slovenia

2026-07-28视觉感知数据集/基准

这篇论文针对人脸图像质量评估中主流 EDC 协议的可比性问题,指出逐步丢弃样本会造成测试集分化,而每步重估阈值又带来阈值漂移,使不同方法实际在不同数据和操作点上比较。作者提出固定阈值、比例配对丢弃等 EDC 变体,并引入不丢弃样本的排序一致性评估 RCE。五个数据集、四个识别模型和 15 种 FIQA 方法的实验显示,传统 EDC 下表现较好的新方法在 RCE 下常明显退步,说明既有排名可能不稳定。

Post-Operative Glioma Segmentation via Loss Stabilization, Normalization and Subspace Attention Figure 1
2026-07-28cs.CV

Post-Operative Glioma Segmentation via Loss Stabilization, Normalization and Subspace Attention

Alexandru Crişan, Diana Borza

2026-07-28视觉感知

术后胶质瘤分割受切除腔、伪影和跨医院 MRI 强域移影响,常规 SwinUNETR 加 GDL 在外部队列上会明显失稳。论文的核心洞察是把问题拆成损失稳定性、强度归一化和瓶颈特征校准:用 Dice-CE 替代 GDL,结合脑掩膜百分位归一化、体素级对比学习,并提出 SACA 按通道子空间做类别注意力。结果显示 GDL 的 WL Dice 从内部 0.88 跌到外部 0.73,SACA 使 ET 敏感性提升 8%,与 nnU-Net 集成后稳定配置 WL Dice 达 0.94,最佳 HD95 为 2.92 mm。

Advancing All-Weather Building Damage Mapping to the Instance Level: Outcomes and Insights from the 2026 Bright Challenge Figure 1
2026-07-28cs.CV

Advancing All-Weather Building Damage Mapping to the Instance Level: Outcomes and Insights from the 2026 Bright Challenge

Hongruixuan Chen, He Huang, Haifeng Wang, Jian Song, Junjue Wang, Weihao Xuan, Hamish Mitchell, Jiepan Li, Wei He, Liangpei Zhang, Zijie Wang, Chen Zhong, Jiazhen Zhao, Lei Hu, Ting Hu, Hongyan Zhang, Gregory Angelides, Miriam Cha, Clifford Broni-Bediako, Junshi Xia, Taylor Perron, Naoto Yokoya

2026-07-28视觉感知

这篇论文面向灾后云烟、夜间等条件下光学影像不可用的问题,将建筑损毁评估推进到“逐建筑实例”的全天气设定:用灾前亚米级光学图像和灾后 SAR 图像检测、勾画并分类建筑。Bright Challenge 扩展了约 29.1 万栋建筑标注,并用未见过的 2025 灾害事件测试泛化。结果显示优胜方案明显超过基线,但跨事件 mAP 仅约 0.18,远低于域内 0.513;关键洞察是需分模态编码、后期融合,并将建筑定位与损毁判别解耦。

AI-generated Images Challenge Visual Trust in High-risk Scenarios Figure 1
2026-07-28cs.CV

AI-generated Images Challenge Visual Trust in High-risk Scenarios

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

2026-07-28视觉感知安全鲁棒

本文关注生成图像在灾害、事故、交易凭证、身份背书等高风险证据场景中削弱视觉信任的问题,提出 SafeIMG 基准,以 12 类公共与个人安全场景、GPT Image 2 生成图像和人工定位/解释异常来评估检测器是否真正抓住可疑证据。结果显示现有方法远不可靠:最佳 VLM 仅识别 49.5%,最佳专用检测器 33.1%,显著低于人类 81.7%,且对常识冲突、物理不一致和传播退化尤其脆弱。

QFedPolyp: A Communication- and Inference-Efficient Federated Learning Framework for Polyp Segmentation Figure 1
2026-07-28cs.LG

QFedPolyp: A Communication- and Inference-Efficient Federated Learning Framework for Polyp Segmentation

Madan Baduwal, Priyanka Paudel

2026-07-28视觉感知

该文针对多医院息肉分割中原始数据难共享、联邦学习又通信开销大的问题,提出 QFedPolyp:在各客户端用轻量 U-Net 做量化感知训练,并传输低比特参数后用 FedAvg 聚合。结果显示,全精度联邦模型在 Kvasir-SEG 和 CVC-ClinicVideoDB 上 Dice 达 0.910/0.930,8-bit 通信约降 4 倍且保持竞争精度,量化模型推理最高加速 1.5 倍。

A Diagnostic Gap Framework for Evaluating Reconstruction Fidelity in Weakly Supervised Mammography Figure 1
2026-07-28cs.CV

A Diagnostic Gap Framework for Evaluating Reconstruction Fidelity in Weakly Supervised Mammography

Vinceline Bertrand, Ionut Cardei

2026-07-28三维

本文针对弱监督乳腺影像流水线中重建、定位与分类耦合后难以判断诊断信号在哪一阶段丢失的问题,提出“诊断 gap”评估框架,用冻结分类器同时衡量决策保持与解释保持,并以 VQ-VAE-GAN、VAE-GAN、SDEdit 构成保真度阶梯。结果显示高保真自编码重建几乎不损害 AUC 和归因图,而低保真扩散重建使 AUC 明显下降,说明诊断退化主要随重建保真度变化,并非重建本身的必然代价。

Cortex: Compact Behavior Cloning for Quake with Frozen Visual Features Figure 1
2026-07-28cs.CV

Cortex: Compact Behavior Cloning for Quake with Frozen Visual Features

Dzmitry Malyshau

2026-07-28模仿学习

本文追问在不引入强化学习、显式记忆或目标条件的情况下,简单行为克隆能在视觉复杂的 Quake 中走多远。Cortex 将冻结的 DINOv3 视觉特征接入仅 10.98M 可训练参数的六层 Transformer 控制器,突出小型专用策略与精确评测。结果显示它从未通关 E1M1,但能稳定到达早期关键路点并完成多数击杀,强于同一评测下的小样本 P2P/NitroGen 参考;失败主要指向分布偏移,跨系统增益来源不清。

Nova3D: Code-Native Generation of Programmable 3D Assets Figure 1
2026-07-28cs.GR

Nova3D: Code-Native Generation of Programmable 3D Assets

Nimra Noor, Muhammad Bilal, Abdullah Hussain, Hassan Baig

University of Edinburgh

2026-07-28三维

Nova3D针对传统3D生成只输出不透明网格、难以被交互系统检查、编辑和驱动的问题,改为生成可执行的Blender程序,把命名部件、层级、约束和关节作为资产原生结构。实验显示其54/54生成有效程序和GLB,满足51/52个数值或计数约束,并支持局部编辑与关节动画;但纹理真实感仍弱于强网格生成模型。

Benchmarking the Domain Gap: Model Selection Instability Under Domain Shift in Video Capsule Endoscopy Figure 1
2026-07-28cs.CV

Benchmarking the Domain Gap: Model Selection Instability Under Domain Shift in Video Capsule Endoscopy

Dan Hanson, Debesh Jha

Department of Computer Science, Biomedical Perception & Intelligence Lab, University of South Dakota

2026-07-28视觉感知数据集/基准

这篇论文关注胶囊内镜分类中常被忽视的模型选择问题:单一数据集上的最优骨干是否能在真实跨来源部署中保持优势。作者在Kvasir-Capsule、CV2024和Galar间构建共享标签评测,比较11个预训练视觉骨干的跨目标排名稳定性。结果显示域内排名对外部目标的预测能力强烈依赖目标数据集,Kvasir与Galar较一致但与CV2024较弱,且外部目标间也弱相关,说明峰值单数据集性能不足以支撑稳健模型选择。

Fast Fourier Convolutional GAN for 30 m Clear-Sky Land Surface Temperature Gap-Free Reconstruction Figure 1
2026-07-28cs.CV

Fast Fourier Convolutional GAN for 30 m Clear-Sky Land Surface Temperature Gap-Free Reconstruction

Marwa Alfouly, Smajil Halilovic, Nils Bochow, Thomas Hamacher, Niklas Boers, Konrad Schindler

Technical University of Munich, Chair of Renewable and Sustainable Energy Systems, Germany, Technical University of Munich, Professorship of Earth System Modelling, Germany, Helmholtz Centre for Polar and Marine Research, Alfred Wegener Institute, Germany, Swiss Federal Institute of Technology Zurich (ETH Zurich), Institute of Geodesy and Photogrammetry, Switzerland

2026-07-28生成模型三维

这篇论文针对热红外卫星地表温度受云遮挡而难以形成30米无缝产品的问题,将LaMa式大掩膜修复改造为多模态Fast Fourier Convolutional GAN,引入SAR等近全球可得辅助数据以扩大感受野并约束重建。实验显示在不同LST分位上,重建像素的场景平均RMSE四分位范围约为0.8–1.8 K,并能处理超过70%云缺口的Landsat场景;但跨区域泛化增益来源仍可能主要来自数据与尺度设置。

Generative Augmentation for EEG Motor Imagery Classification: A Class-Conditional VAE with Cycle-Consistent Decoder Refinement Figure 1
2026-07-28cs.CV

Generative Augmentation for EEG Motor Imagery Classification: A Class-Conditional VAE with Cycle-Consistent Decoder Refinement

Matei Moldoveanu, Alain Sirois, Claire Ben Ali, Fabien Lotte, Florian Yger

Inria Center at Univ. Bordeaux / LaBRI, Talence, France

2026-07-28视觉感知生成模型

本文针对运动想象 EEG 数据采集成本高、跨被试变化大导致分类器训练不稳的问题,提出带类别条件先验、潜空间分类器、Log-Euclidean 协方差约束与循环一致性解码器精炼的 CVAE,用生成样本做数据增强。实验覆盖被试内与 LOSO 跨被试设置及 CSP+LDA、TGSP+SVM、MDM、EEGNet 等分类器;结果表明生成数据更像保留类别结构和协方差信息的补充样本,MDM 点估计可能提升,但整体增益小且依赖分类器,增强收益仍较保守。

Calibration-Free 3D Multi-Camera People Tracking for Indoor Environment Figure 1
2026-07-28cs.CV

Calibration-Free 3D Multi-Camera People Tracking for Indoor Environment

Ponleur Veng (CADT, M-PSI), Dominique Vaufreydaz (LIG, Phutphalla Kong (CADT)

Cambodia Academy of Digital Technology, the scalability of 3D tracking systems and restricts their, as a viable foundation for scalable 3D multi-camera tracking., scalable, geometry-aware tracking systems deployable in, CenterNet [31] formulated detection as a pixel-wise prediction, (SfM) pipelines like COLMAP [18], which limit scalable

2026-07-28视觉感知三维

这篇论文针对多摄像头三维行人跟踪依赖人工相机标定、难以扩展到教室等遮挡室内场景的问题,提出用VGGT从视频中恢复几何结构,并以头部关键点进行姿态引导的3D提升,再结合外观与几何代价做跨相机聚类。在AI City Challenge 2024上,无标定条件下HOTA达到53.13%,虽低于最强标定系统,但超过部分标定基线。

Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction Figure 1
2026-07-28cs.CV

Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction

Min-Jae Kim, Jun-Yeong Moon, Mujeen Sung, Gyeong-Moon Park

Korea University, Seoul, Republic of Korea, Kyung Hee University, Yongin, Republic of Korea

2026-07-28视觉语言视觉感知

论文针对现有 backchannel 预测主要依赖语音和文本、忽视表情手势等视觉线索及长程对话语境的问题,提出 CAMA-BC:先用含视频的未标注完整对话做上下文对齐,再用监督 backchannel 样本细化,并通过多层跨模态注意力建模不同模态随时间变化的主导性。实验显示其优于既有方法和简单拼接式多模态基线,尤其提升同理等复杂反馈类别识别。

CrossSpine: Multi-scale Cross-sequence Attention with Anatomical Priors for Automated Pfirrmann Grading Figure 1
2026-07-28cs.CV

CrossSpine: Multi-scale Cross-sequence Attention with Anatomical Priors for Automated Pfirrmann Grading

Hai Son Nguyen, Duong Ngoc Vu, Trong-Nghia Nguyen, Bien Tran Van, Van-Dem Pham, Trang Mai Xuan, Huan Vu, Thien Van Luong

2026-07-28视觉感知

本文针对常规单流模型难以整合多 MRI 序列、且忽略不同椎间盘节段退变先验的问题,提出 CrossSpine:用多尺度跨序列注意力融合不同序列特征,并在分类器中注入 IVD 节段信息。作者还整理了 237 名患者、1185 个椎间盘记录的数据集;实验显示相较基线 Macro F1 相对提升超过 125%,Mean AUPRC 提升 99%,Mean AUROC 提升 36%,但类别极不均衡,极少数 Grade V 样本可能限制结论稳健性。

Trustworthy Medical Segmentation: Uncertainty-Aware U-Net Evaluation Under Clinical Image Degradation Figure 1
2026-07-28cs.CV

Trustworthy Medical Segmentation: Uncertainty-Aware U-Net Evaluation Under Clinical Image Degradation

Pranav Kaliaperumal, Manisha Kaliaperumal

2026-07-28视觉感知数据集/基准安全鲁棒

论文针对医学分割模型在真实临床退化图像中可能静默失效的问题,构建了面向脑肿瘤 MRI 的可复现实验基准:用合成 BraTS 风格数据评估 U-Net/Attention U-Net 在八类退化、五级强度下的精度、校准和选择性预测,并以 MC dropout 给出体素级不确定性。结果显示 Attention U-Net 干净数据 Dice 可达 0.990,但严重高斯噪声下降到 0.089;不确定性随退化升高并可用于失效检测,AUROC 为 0.843。

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models Figure 1
2026-07-28cs.CV

PCA: Persistence-Aware Compression and Aggregation for Fast Video Large Language Models

Zihan Song, Shuo Ye, Bo Zhao, Ruixin Zhang, Jiayu Zhang, Shouhong Ding, Zitong Yu

2026-07-28视觉感知

该文针对视频大模型处理长视频时相邻帧冗余导致视觉编码和注意力推理开销过高的问题,提出无需训练、可插拔的 PCA:先用帧间相似度动态下采样保留关键帧,再通过持久性感知运动增强把邻近时间上下文聚合进保留帧。实验称其在多个视频理解基准上优于 FastV、DyCoke 等方法,并相对基线获得 1.8 至 2.5 倍加速,同时保持或提升准确率。

Structural Preservation Governs Data Augmentation in Deep Learning-Based Laser Speckle Material Classification Figure 1
2026-07-28cs.CV

Structural Preservation Governs Data Augmentation in Deep Learning-Based Laser Speckle Material Classification

Mohamed Abdallah Salem, Nourhan Zein Diab

2026-07-28视觉感知

这篇论文针对激光散斑材料分类中常规图像增强与相干成像物理不匹配的问题,系统比较旋转、模糊、独立噪声、散斑相关噪声等扰动对 ResNet18 和 EfficientNet-B0 的影响。核心洞察是增强是否有效主要取决于是否保留空间相干性和频率结构,而非扰动强度本身;实验显示高斯模糊和独立像素噪声显著降低宏 F1,空间相关的散斑感知扰动则带来显著正效应。

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models Figure 1
2026-07-28cs.CV

Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li

China Mobile Information Technology Co., Ltd., Shenzhen, 518000, China, School of Information Science and Engineering, NingboTech University, Ningbo, 315100, China

2026-07-28视觉语言视觉感知

面向多版式、含印章水印和低对比噪声的真实文档抽取,论文将任务拆成文档类型分类与按类条件化抽取,用预测类别动态构造 ICL 提示以降低单一提示的冗余和不确定性。基于 Qwen2.5-VL-7B,在16类招投标证件上零样本 F1 达86.43%,高于监督 OCR&UIE 基线68.08%;领域微调后升至93.65%,但分类误差对抽取链路的影响文中仍需更细说明。

A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection Figure 1
2026-07-28cs.CV

A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection

Ali Borji

2026-07-28视觉感知

本文针对传统对抗样本之外的“可见大扰动但模型仍保持原预测”现象,追问其是否真的体现人类与模型感知差距,以及现有 OOD 检测、校准和防御能否处理。论文用 NKE 式样本在 MNIST、CIFAR-10、ImageNet 上联合评估,发现人类/识别代理显著退化而模型仍高置信正确,置信度与能量检测几乎失效,Mahalanobis 可被自适应攻击绕过,经典对抗训练等防御也基本无效。

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia Figure 1
2026-07-28cs.CV

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

RIIMA Laboratory, Computer Science Faculty, USTHB University, 16111, Algeria

2026-07-28视觉感知

该文针对精神分裂症认知康复中实体操作需临床人工评估、主观且难扩展的问题,提出带双摄像头桌面微缩场景的交互平台,用微调视觉语言模型把手部与玩具车运动转成语义描述,并与语音指令核对以验证动作。作者收集了4634段桌面康复视频场景,实验称可连接底层运动与临床反馈;但具体量化指标和相对增益文中未充分说明。

CausalGate: Causal Importance Distillation for Transformer Module Pruning Figure 1
2026-07-28cs.LG

CausalGate: Causal Importance Distillation for Transformer Module Pruning

Kiran Nair, Smriti Regmi, Rodrigue Rizk

2026-07-28视觉感知

这篇论文针对LLM推理中按相似度或激活幅值跳过模块容易误删关键计算的问题,提出CausalGate:离线逐个干预Attention与MLP子层,用置零后最终logit分布的KL变化衡量因果重要性,再蒸馏为静态门控以避免运行时路由开销。实验称在TinyLlama、Qwen2.5和Llama-3.1上较动态路由和层跳过基线更好保持语言建模与常识推理性能,并带来实际延迟下降。

$γ$-Bridge: A Look-Parametric Diffusion Bridge Figure 1
2026-07-28cs.CV

$γ$-Bridge: A Look-Parametric Diffusion Bridge

Xuran Hu, Yujie Zhu, Tengxi Wang, Jilong Li, Wufan Zhao

2026-07-28生成模型

针对SAR等相干成像中的乘性Gamma斑点噪声,本文认为现有扩散去噪多用抽象噪声日程,难以按物理视数L适配不同传感器。γ-Bridge把扩散桥时间直接参数化为L,构造精确Gamma边际和闭式Gamma–Lévy反向后验,并用输入/输出视数控制实现smart-start。模型仅在单视数合成Gamma自然图像上训练,却可零样本处理多种SAR传感器,并在合成基准和无参考真实SAR验证中取得领先结果。

DAMamba-UNet3D: A Parameter-Efficient Mamba State Space U-Net with Dynamic Adaptive Scan for 3D Medical Image Segmentation Figure 1
2026-07-28cs.CV

DAMamba-UNet3D: A Parameter-Efficient Mamba State Space U-Net with Dynamic Adaptive Scan for 3D Medical Image Segmentation

Mohammad Arafat Hussain, Ellen Grant, Yangming Ou

2026-07-28视觉感知三维

这篇论文针对3D医学分割中卷积缺少全局上下文、Transformer代价高、现有Mamba分割器依赖固定扫描且参数量大的问题,提出在U-Net编码器中引入三平面动态自适应扫描DAS,让Mamba按内容重排体数据特征。BraTS 2020上,5.3M参数模型以约1/13参数接近SegMamba,70M版本Dice达0.829并略高于SegMamba;但实验仅限单一数据集,DAS相对架构与scaling的独立增益来源不清。

TOM-GS: Editable Video Representation via Temporal Opacity Modulation of Static 3D Gaussians Figure 1
2026-07-28cs.CV

TOM-GS: Editable Video Representation via Temporal Opacity Modulation of Static 3D Gaussians

Marek Lisowski, Łukasz Smoliński, Kornel Howil, Piotr Biliński, Marcin Mazur, Przemysław Spurek

University of Warsaw, Faculty of Mathematics, Informatics, and Mechanics, Jagiellonian University, Faculty of Mathematics and Computer Science, IDEAS Research Institute

2026-07-28视觉感知三维

该文针对动态 3DGS/INR 视频表示虽能重建但不便编辑的问题,提出 TOM-GS:保持标准静态 3D 高斯几何不变,只为每个高斯学习时间透明度的均值与尺度,用淡入淡出表示运动和遮挡变化,并用 AnyCam 定位、逆 PSNR 采样等训练策略稳定优化。结果显示其在 DAVIS 上优于既有可编辑视频表示,同时保留与常规 3D 编辑和物理仿真的兼容性。

Visual Token Compression Enhances Robustness of MLLMs Figure 1
2026-07-28cs.CV

Visual Token Compression Enhances Robustness of MLLMs

Shishen Gu, Jiequan Cui, Wenbo Hu, Zenglin Shi, Zhenzhen Hu, Richang Hong

Hefei University of Technology, Hefei University of Technology Hefei China

2026-07-28安全鲁棒

本文关注多模态大模型因视觉-语言表征错位而更易被越狱攻击、产生幻觉的问题,核心洞察是部分视觉 token 可视为偏离语言特征空间的 OOD 噪声。方法通过度量视觉 token 到语言空间的距离,在合适层迭代剪除远距离 token,实现训练-free压缩。实验在七个基准上显示,越狱防御平均提升 13.29%,幻觉缓解保持竞争力,同时基本维持 MME 等通用能力并提升推理效率。

Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework Figure 1
2026-07-28cs.CV

Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework

Lewen Mi, Manyi Li, Yuling Sun, Yufan Zhang, Yuxin Shi, Yulong Bian, Xiangxian Li, Juan Liu

Shandong University, Fudan University, Beijing Jiaotong University, Shandong University Weihai Shandong China, Shandong University Jinan Shandong China, Fudan University Shanghai China, Beijing Jiaotong University Weihai Shandong China

2026-07-28视觉感知数据集/基准安全鲁棒

面向儿童的 AIGC 视频风险不同于成人视角的违规检测,许多问题隐藏在叙事、情绪和跨帧细节中。论文构建含 605 个真实视频的 CAVSR 基准和 6 类、26 细粒度风险体系,并提出结合多智能体问答、专家知识与历史经验的 QVRS-E 迭代审查框架。实验显示其在细粒度与合并类别设置下均优于多种基线,并能增强通用视觉语言模型的风险识别与报告稳定性。

Real-Time Semantic Segmentation with Optimized RetinaNet Architectures for Embedded Automotive Systems Figure 1
2026-07-28cs.CV

Real-Time Semantic Segmentation with Optimized RetinaNet Architectures for Embedded Automotive Systems

Sai Sidharth D

Code available at: https://github.com/sidarthd/opt-retinaseg/tree/main, Semantic segmentation, which assigns a class label to every pixel, integer arithmetic units available on automotive NPUs.

2026-07-28视觉感知

面向车载嵌入式平台算力、内存和功耗受限下的实时语义分割需求,论文将 RetinaNet 的 FPN 与 focal loss 思路改造成 Opt-RetinaSeg:轻量混合骨干、精简金字塔和紧凑分割头,并结合结构化剪枝、INT8 量化与蒸馏。Cityscapes/BDD100K 与 Jetson Xavier NX、QCS610 测试显示其达到 73.9% mIoU、70.4 FPS,较 ResNet-50 基线提速 7.4 倍、模型缩小 4 倍,精度下降小于 3%。

scMIR: a vision-language foundation model for single-cell light microscopy image representation Figure 1
2026-07-28cs.CV

scMIR: a vision-language foundation model for single-cell light microscopy image representation

Yifan Shang (1 and 2), Jiahui Tan (2), Xiangxiang Zeng (2), Renjie Zhou (1) ((1) Department of Biomedical Engineering, The Chinese University of Hong Kong, Hong Kong, China, (2) College of Computer Science and Electronic Engineering, Hunan University, Changsha, China)

Laser Metrology and Biomedicine Lab, Department of Biomedical Engineering, The Chinese University of Hong, State Key Laboratory of Chemo and Biosensing, College of Computer Science and Electronic Engineering, Hunan, University, Changsha 410082, China, thus limiting their scalability and reliability in large, heterogeneous datasets [17-19].

2026-07-28视觉语言视觉感知

单细胞光学显微图像受细胞类型、成像模态和实验条件差异影响,传统任务模型难以跨场景泛化。scMIR将结构化实验语义与图像重建联合预训练,在统一表征中同时保留形态与生物上下文;在16个基准的分类、聚类、表型推断和批次校正中优于任务专用及通用预训练模型,且无需任务特定微调。

RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus Figure 1
2026-07-28cs.CV

RMS@CC-MMD 2026: Multimodal Misogyny Detection via Geometric Interaction and Multi-View Consensus

Md. Ajwad Hossain

Department of Electronics and Telecommunication Engineering, Department of Electronics and Telecommunication Engineering Chittagong University of Engineering & Technology (CUET) Chattogram Bangladesh

2026-07-28视觉语言视觉感知

面向跨文化网络迷因中的厌女检测,论文强调仇恨语义常由图像与文字的冲突共同形成,低资源语言、OCR 噪声和转写混杂会进一步削弱单模态或简单拼接方法。GeoMVC 在冻结 CLIP/mCLIP 表征上加入 Hadamard 乘积与余弦相似度建模几何交互,并用原文、过滤文本和英译文本做多视图投票。系统在 Malayalam 和 Chinese 赛道分别取得 Macro F1 0.892、0.895,但 Tamil 仅 0.521,显示方法对强 code-mixing 仍不稳。

StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design Figure 1
2026-07-28cs.CV

StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design

Yin Wang, Haotian Hu, Jineng Han, Wentao Qiu, Zhenhua Ge, Liujian Tang, Fanyi Wang

2026-07-28视觉语言视觉感知

面向手机端 UI 代理,论文针对小模型在 OCR、界面理解、VQA 与元素定位间难以兼顾精度和延迟的问题,提出 0.9B StepX-Edge,通过 UI 适配视觉编码、渐进投影连接器、五阶段课程训练和分模块 PTQ/QAT 量化协同设计提升端侧可用性。结果显示其在 ScreenQA、中文 OCRBench v2 上超过更大基线,RefCOCO 和 OCRBench v1 接近 1.3B–2.3B 模型,并在骁龙 8 Gen5 上实现约 0.84 秒首 token、98 tok/s、1.4GB 峰值内存。

LowAux-RDNet: Low-Pass Residual Supervision with Scene-Balanced Real-World Training for Single-Image Reflection Removal Figure 1
2026-07-28cs.CV

LowAux-RDNet: Low-Pass Residual Supervision with Scene-Balanced Real-World Training for Single-Image Reflection Removal

Jizhong Li

Fudan University

2026-07-28视觉感知强化学习

本文针对单图反射去除中残差监督易受配准、曝光和噪声高频污染影响的问题,在 RDNet 显式分解框架上加入仅训练使用的低通残差辅助损失,并用 RRW 真实配对数据做场景均衡采样以减轻相邻帧偏置。统一评测下五数据集宏平均达到 27.546 dB PSNR、0.9220 SSIM,整体更均衡;但 Postcard 中清晰语义反射仍困难,部分增益可能主要来自 data 与评测协议统一。

EditCLEVR: A Paired-Scene Intervention Benchmark for Compositional Faithfulness of Object-Centric Representations Figure 1
2026-07-28cs.CV

EditCLEVR: A Paired-Scene Intervention Benchmark for Compositional Faithfulness of Object-Centric Representations

Anuraag Gadehothur Karnam, Tarunesh Sathish

2026-07-28数据集/基准

这篇论文针对目标中心表征评测只看分割、单图属性或下游任务,难以判断对象代码是否忠实响应语义编辑的问题,提出 EditCLEVR 成对场景干预基准,用已知单对象属性变化和无编辑重渲染同时评估变化定位、稳定性与解码后的场景图干预准确率。实验显示,即使用真实实例掩码,CoGenT 组合 OOD 退化仍存在,掩码来源只能解释部分差距,单看局部性或稳定性会高估语义忠实性。

Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model Figure 1
2026-07-28cs.CV

Visible-Light Imaging Diagnosis of Neutral Particle Emission Tomography in the Tokamak Divertor: An Efficient Transformer-based Surrogate Model

Xiao Wang, Hao Si, Qiang Chen, Yu-Xiang Zhang, Beihe Zhang, Jianhua Yang, Qingquan Yang, Dengdi Sun, Wanli Lyu, Guosheng Xu, Jin Tang

. School of Computer Science and Technology, Anhui University, Hefei 230601, China., . School of Artificial Intelligence, Anhui University, Hefei 230601, China., . Institute of Plasma Physics, Hefei Institutes of Physical Science, Chinese Academy of Sciences, Hefei 230031, China.

2026-07-28视觉感知

针对托卡马克偏滤器中性粒子发射层析重建耗时、病态且易受噪声影响的问题,论文将可见光连续帧到二维光强分布的反演改写为端到端回归,并提出含空间/时间差分注意力的 Delta-InvFormer 以捕捉等离子体动态并抑制噪声。在 EAST 真实数据上,该模型相较传统迭代方法约快 200 倍,同时在两个测试炮次上取得优于经典方法和深度学习基线的总体精度。

Histopathological Spectrum-Guided Prostate Stratification via Segmentation-Assisted Diagnostic Transformer Figure 1
2026-07-28cs.CV

Histopathological Spectrum-Guided Prostate Stratification via Segmentation-Assisted Diagnostic Transformer

Leyang Li, Lihua Chen, Huangang Hu, Tianhang Hao, Hao Cheng, Xin Zhang, Qianru Sun, Bingxu Lu, Wenlong Yu, Feng Duan

College of Artificial Intelligence, Nankai University, School of Electronics and Information Engineering, Tiangong University, Tianjin 300387, China, School of Artificial Intelligence, Hebei University of Technology, Tianjin 300401, China, North China Digital Health Technology Co., Ltd., Jinan 250117, China, School of Computing and Information Systems, Singapore Management University, Singapore 178902, Singapore

2026-07-28视觉感知

这篇工作针对前列腺 mpMRI 诊断中过度依赖 PI-RADS 或二分类、难以反映病理异质性的问题,构建活检确认的 PCa-HSD 四分类任务,区分正常、BPH、nsPCa 与 sPCa,并提出用 SAM3 零样本分割提供解剖先验、融合 T2WI/ADC/DWI 跨层序列特征的 LSDT。344 例五折验证中最佳平均准确率 0.633、JointRecall 0.768,但数据规模较小,增益可能部分来自新任务与标注设定。

MIME: Multimodal Interactive Motion Encoder Figure 1
2026-07-28cs.CV

MIME: Multimodal Interactive Motion Encoder

Addison Zucek, Prerit Gupta, Kamila Kuatova, Aniket Bera

Purdue University

2026-07-28视觉语言

MIME面向双人交互动作中的文本-动作对齐问题,认为早期/晚期融合难以同时保留个体动作结构和帧同步关系。其核心是为两名演员保留独立流,并注入显式关系特征、双向共注意力和课程式对比学习。在Inter-X检索上优于融合基线,2000样本库文本到动作R@1相对提升12.8%;作为冻结先验迁移到InterHuman时提升语义对齐,但生成质量增益有限。

FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog Figure 1
2026-07-28cs.CV

FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog

Vansh Panwar

2026-07-28数据集/基准

雾天会同时削弱相机与激光雷达感知,但现有数据集难以隔离雾浓度影响。FogDrive用CARLA构建成对清晰/三档雾场景,提供多相机、深度、语义、LiDAR、雷达及一致2D/3D标注。基准显示,多雾密度训练可改善3D框几何稳定性,而PSNR、SSIM与下游检测表现相关性不足。

Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning Figure 1
2026-07-28cs.AI

Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose M. Alvarez

NVIDIA & University of Ottawa

2026-07-28视觉感知

面向自动驾驶等部署场景,论文关注大规模候选数据难以直接按目标测试分布筛选的问题。TTCov用未标注部署样本构建并扩展LLM原子命题Atlas,再以K-Atlas频率匹配进行预算化数据选择,把适配放在训练前而非推理时更新模型。实验显示其在城市迁移中提升部署概念覆盖、分布匹配和端到端驾驶表现,但收益仍可能主要来自更贴近测试分布的数据选择。

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion Figure 1
2026-07-28cs.CV

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

Jiacheng Liu, Jason Liu

Trendinsight Lab / UC San Diego

2026-07-28视觉感知生成模型

本文针对百亿级视频 DiT 在单机上微调时同时受参数状态和长视频注意力显存限制的问题,提出将权重、主权重与 Adam 状态常驻 CPU 内存、按层流式送入单块 H200,并用 3D Deformable Slide Attention 以运动自适应局部采样替代全局注意力。结果显示该原型可在 1.5TB 主存下完成 105B DiT 全参数适配,支持 256 帧 1080p,并在 VBench 上取得接近全局注意力基线的时序一致性和文本对齐;但带宽瓶颈仍在,增益主要来自系统卸载与线性局部注意力设计。

DINOv3-MIL: Per-Kidney Multi-Label Tumour and Cyst Detection from Foundation-Model Patch Tokens on KiTS23 Figure 1
2026-07-28cs.CV

DINOv3-MIL: Per-Kidney Multi-Label Tumour and Cyst Detection from Foundation-Model Patch Tokens on KiTS23

Vishalakshi M, Sahil Sharma, Pramod Kumar P

DINOv3-MIL: Per-Kidney Multi-Label Tumour and Cyst Detection, Department of Computer Science and Artificial Intelligence, SR University, Warangal, India, School of Computing, Ulster University, Belfast, United Kingdom, we ask which aggregator delivers on per-kidney multi-label, multi-label setting addressed here has not been studied., This work makes two contributions. (i) A per-kidney multi-label tumour/cyst task on KiTS23 including, crops of 192×192×96 voxels with multi-label (tumour, cyst) at prevalence 0.59 and 0.37. An 80/10/10, Table 1 reports test performance. Gated attention MIL achieves the highest AUROC for both labels

2026-07-28视觉感知

这篇论文针对肾脏 CT 中每肾多标签肿瘤/囊肿检测,关注冻结 DINOv3 patch token 在体数据上如何聚合才兼顾小病灶识别与可解释性。作者在 KiTS23 上比较 CLS 线性探针、门控注意力 MIL 和 ProtoViT 式原型头,核心洞察是 5.5 万级 token 下空间注意力比全局池化或原型匹配更能保留小体积病灶信号。测试集上注意力 MIL 的肿瘤/囊肿 AUROC 达 0.74/0.80,囊肿较两种基线高 0.25/0.29,注意力也在标注病灶内显著富集;但样本划分单一且测试集较小。

Text-based Tactile Graphics Generation for the Visually Impaired Figure 1
2026-07-28cs.GR

Text-based Tactile Graphics Generation for the Visually Impaired

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

2026-07-28视觉感知

这篇论文针对盲人和低视力用户触觉图形制作依赖专家、难以规模化和个性化的问题,提出从自然语言直接生成可3D打印的2.5D触觉图形系统。核心在于把全局浅浮雕几何、可平铺的细粒度触觉纹理和规范盲文放进同一可制造表示,并用模板约束、扩散式文本到纹理和底面展平保证可读性与可打印性。实物打印评测和用户研究显示,参与者相较基线更偏好其结果。

URHead: A Unified UV-Space Representation for Joint Mesh-3DGS Optimization in Head Avatars Figure 1
2026-07-28cs.GR

URHead: A Unified UV-Space Representation for Joint Mesh-3DGS Optimization in Head Avatars

Seonghak Lee, Junhee Cho, Jisoo Park, Min-Gyu Park, Jongmin Lee, Ju Hong Yoon, Junseok Kwon

2026-07-28优化算法三维

URHead针对可动画头部头像中网格可控但细节不足、3DGS逼真但结构不稳的问题,将网格属性与高斯属性统一到共享UV空间,并通过联合优化与误差驱动的自适应高斯分配,让网格承担低频结构、高斯补充残差细节。实验称其在标准头部头像基准上优于网格、3DGS及既有混合方法,提升重建质量和动画一致性。

DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification Figure 1
2026-07-28cs.AI

DocHRL: A Hierarchical Reinforcement Learning Framework for Cost-Optimised Document Classification

Mohammed Yousif, Prabhjot Singh, Arjun Pankajakshan, Madhu Reddiboina

2026-07-28强化学习

这篇论文针对企业文档分类中固定流水线不区分样本难度、导致算力与人工审核成本浪费的问题,提出 DocHRL:用分层强化学习把分类流程建模为逐文档的成本最小化决策,上层选择视觉模型、OCR、LLM 或人工审核等选项,下层选择具体工具,并把推理、误分类和人工成本统一进奖励。在 RVL-CDIP 上,方法达到 0.973 macro F1,平均成本降至 2.74,较最佳单模型和集成基线分别降低约 69% 和 65%。

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG Figure 1
2026-07-28cs.AI

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

Bosch AI Research Center, University of Notre Dame, Pennsylvania State University

2026-07-28规划控制

针对多模态 RAG 直接用图文输入在扁平证据库中检索、易出现指代不清和证据漂移的问题,MM-R2 先将图像-问题解析为包含意图、视觉指称和约束的检索状态,再在结构化 KnowledgeMap 中选择检索单元并迭代取证。作者还构建 MM-R2-Traj,用 SFT 与 GRPO 训练检索轨迹;在 Infoseek 和 Encyclopedic VQA 上提升答案准确率,并给出更可检查的检索过程。

Concept-based Visual Counterfactual Explanations with Diffusion Models Figure 1
2026-07-28cs.AI

Concept-based Visual Counterfactual Explanations with Diffusion Models

Yassine Oueslati, Daniil Kirilenko, Martin Gjoreski, Marc Langheinrich

2026-07-28生成模型

这篇论文针对视觉反事实解释中扩散方法依赖外部噪声鲁棒分类器、部署脆弱且难以解释的问题,提出 C-VCE:把概念瓶颈嵌入生成 U-Net,用可干预语义概念引导采样,并结合概率式近邻正则和梯度掩码限制局部改动。CelebA 等实验显示其翻转率持平或更高,同时生成图像更接近原图、失真更少。

2026-07-27

67 篇
Robot-Factored World Models via Robot Rendering Figure 1
2026-07-27cs.RO

Robot-Factored World Models via Robot Rendering

Byungjun Kim, Taeksoo Kim, Hyunsoo Cha, Hanbyul Joo

Seoul National University

2026-07-27机器人强化学习

这篇论文针对机器人视频世界模型中动作表示不稳的问题:直接用控制量会让模型同时学习执行动力学与场景响应,而用未来状态又会泄漏结果。作者将动作先经控制器生成可部署的名义轨迹,再用 URDF 渲染为相机对齐的机器人几何,并加入末端与场景深度,让模型专注预测物体交互。实验显示该接口优于向量条件基线,并能迁移到未见机器人及由人类演示重定向的操作视频生成。

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction Figure 1
2026-07-27cs.CV

SM4RT: Learning Structured Motion Geometry for 4D Reconstruction

Shing Ho J. Lin, Wenzhao Zheng, Dong Zhuo, Yuqi Wu, Jie Zhou, Jiwen Lu

Intelligent Vision Group, Tsinghua University

2026-07-27三维

SM4RT针对单目视频4D重建中常把运动视为独立点位移、缺少物体级运动结构的问题,提出Structure-of-Motion表示:用少量时序SE(3) twist运动基与时间共享的像素分配来绑定共同运动的点,并配套运动几何编码/解码器一次前向联合预测几何、轨迹和运动结构。论文报告其在运动重建基准上取得强性能,同时保持更连贯、可解释的结构化运动。

Twins: Learn to Predict Unified Representations with Focal Loss Figure 1
2026-07-27cs.CV

Twins: Learn to Predict Unified Representations with Focal Loss

Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

2026-07-27视觉感知

该文针对连续多模态模型中理解用 ViT 特征与生成用 VAE latent 割裂的问题,提出 Twins:在同一 token 网格上按通道拼接 SigLIP2 与 FLUX VAE 特征,保持序列长度不变。作者进一步指出 DiT 会优先拟合低频、低内在维的 ViT 分量,并用面向 VAE 大残差的 focal 回归重加权缓解失衡;ImageNet 上相较 MSE 最高提升 10.57 gFID,同时保持较强理解能力并改善重建保真度。

CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation Figure 1
2026-07-27cs.MM

CARA: Concept-Aware Risk Attention for Interpretable Collision Anticipation

Zhishan Tao, Ruoyu Wang, Yucheng Wu, Enjun Du, Yilei Yuan, Sherwin Ho, Yue Su, Jinbo Su, Yi Hong

Shanghai Jiao Tong University, The University of Hong Kong, Fudan University, The Hong Kong University of Science and Technology (Guangzhou), University of Pennsylvania, Renmin University of China

2026-07-27安全鲁棒

这篇论文针对自动驾驶碰撞预警中“预测准但难解释”的问题,提出 CARA 将事故叙事中抽取的风险概念与视频帧对齐,形成随时间演化的概念轨迹,并用其直接调控空间、时间注意力,而非事后解释。实验显示其在三个基准上提升预警准确性和提前量,同时给出较稀疏、语义化的风险证据;但概念质量仍依赖文本概念库覆盖。

Optimal Transport Image Representation and Deep Covariance Alignment (CORAL) for Control Valve Stiction Detection Figure 1
2026-07-27cs.CV

Optimal Transport Image Representation and Deep Covariance Alignment (CORAL) for Control Valve Stiction Detection

Seshu K. Damarla

Department of Chemical and Materials Engineering, University of Alberta, Edmonton, Alberta, Canada, representations by optimizing a combined objective: a cross-entropy loss on labeled simulation data and a, Deep CORAL (covariance-alignment) loss between simulation data and unlabeled target-domain industrial, (i.e. valve output) is available, but it is rarely measured in, 𝑖∈{0,1} is the label for this image

2026-07-27视觉感知规划控制

本文针对仿真训练的阀门黏滞检测模型迁移到真实工业回路时的域偏移问题,将OP/PV时序转为基于切片Wasserstein距离的最优传输图像,并用Deep CORAL对齐仿真与无标注工业数据的特征协方差。在20个独立ISDB回路上检出18个,13个黏滞样本全召回,准确率90%、F1为92.86%,较手工特征基线明显降低漏检。

Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering Figure 1
2026-07-27cs.CV

Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering

Oriol Jiménez-Ayguadé, Antonio Agudo

2026-07-27视觉感知

这篇论文针对高斯、圆盘和传统三角 splatting 在锐边、曲面与局部凹形几何上需要大量基元的问题,提出在三角形每条边加入可学习控制点位移,并在重心坐标空间做视角一致的可微光栅化。其核心洞察是保留三角形平面与 GPU 友好性,同时让边界可非凸变形。实验称在多种真实场景中优于近期非体积基元方法,并保持有竞争力的实时渲染效率。

SceneActBench: Can Agents Act on the 3D Scenes They See? Figure 1
2026-07-27cs.AI

SceneActBench: Can Agents Act on the 3D Scenes They See?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

2026-07-27三维

本文针对现有3D评测多停留在问答或单物体操作、难以衡量智能体是否能按视觉输入改造完整场景的问题,提出SceneActBench:在统一agent-environment循环中覆盖布局、相机、关节物体、重建和动态五类任务,并用隐藏3D真值的几何指标评分。11种专有VLM配置总体仅38.6至50.2,且强项分散,说明场景级3D行动仍不是单一能力已解决的问题。

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models Figure 1
2026-07-27cs.CV

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models

Yebin Zheng, Haonan An, Guang Hua, Zhiping Lin, Yuguang Fang

Department of Infocomm Technology, Singapore Institute of Technology, Department of Computer Science, City University of Hong Kong, School of Electrical and Electronic Engineering, Nanyang Technological University

2026-07-27生成模型三维安全鲁棒

论文针对扩散模型潜变量水印易破坏高斯先验、引入潜变量相关性并导致可检测或可移除的问题,提出 LAW 以潜变量成对角度的反向编码嵌入比特,并用 LAW-M 选择幅值更稳定的维度增强鲁棒性。作者还闭式分析水印诱导的稀疏相关结构,实验显示其在多种后处理与再生成攻击下鲁棒性和图像保真度优于既有方法,但 LAW-M 需额外图像级密钥管理。

IR275K: A Benchmark for Infrared Multi-Frame Super-Resolution Toward Efficient Remote Sensing Figure 1
2026-07-27cs.CV

IR275K: A Benchmark for Infrared Multi-Frame Super-Resolution Toward Efficient Remote Sensing

Jie Deng, Heyang Wang, Changxin Wang, Junkai Shen, Hongyi Chen, Zhiping He, Hongxing Qi, Xudong Zhang, Jianyu Wang

Hangzhou Institute for Advanced Study, Shanghai Institute of Technical Physics, of the Chinese Academy of Sciences, Shanghai 200000 China., University of Chinese Academy of Sciences

2026-07-27数据集/基准

这篇论文针对红外遥感多帧超分缺少统一评测的问题,提出IR275K基准,覆盖594段红外序列和275,196帧,并固定序列级划分与4倍超分协议,以反映低热对比、噪声、弱纹理和平台运动。论文还用CGMamba验证隐式多帧融合需空间锚定:加入2D RoPE与中心引导Cross-Mamba后达到33.19 dB PSNR,较红外单帧方法高0.35–0.52 dB;去掉2D RoPE下降1.53 dB并出现网格伪影。

Active few-shot segmentation by reinforcing data selection Figure 1
2026-07-27cs.CV

Active few-shot segmentation by reinforcing data selection

Chenlan Zhao, Benny Wong, Timothy F. Lundberg, Ahmed M. Elsayed, Abdallah Aljarkas, Hamad A. Aljamaan, Lynn Karam, Qianye Yang, Yipeng Hu, Claire C. Villette, Shaheer U. Saeed

2026-07-27视觉感知

医学图像少样本分割中,性能不仅受标注数量影响,更取决于支持集样本是否覆盖目标域差异且互补。本文将支持集选择建模为强化学习问题,让智能体按集合整体优化候选未标注图像,而非逐样本打分;在跨机构盆腔 MRI 分割上,相比随机选择、TBP 和 DVRL 在多种支持集规模与解剖结构上取得一致提升。

SiPhy: Single-Image Physical Property Reasoning Figure 1
2026-07-27cs.CV

SiPhy: Single-Image Physical Property Reasoning

Hoang Le, Joonwoo Kwon, Elkhan Ismayilzada, Yufei Zhang, Zijun Cui

2026-07-27视觉感知

SiPhy关注机器人与仿真中仅凭单张图像估计物体质量、密度和刚度的需求,动机是摆脱多视角重建和交互监督的成本。其核心思路是用伪体素采样引入粗3D结构,并结合CLIP视觉特征、VLM材料先验和重量感知厚度修正来推断物理属性。在ABO-500、MVImgNet-100和PhysXNet-100上,其质量、密度和杨氏模量误差均优于多种单视图及多视图基线。

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions Figure 1
2026-07-27cs.CV

Time-Reversed Imaging: A Multimodal Benchmark and Framework for Reconstructing Past Human-Environment Interactions

Jorge Bacca, Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura

2026-07-27视觉语言数据集/基准

这篇论文瞄准机器人、安防等场景中“只看到事后状态、未记录触发动作”的反向感知问题,提出用热、紫外和可见光残留痕迹推断近期人-环境交互,并构建 TRACE-HEI 三模态基准。核心洞察是物理残留可约束原本高度不适定的过去重建;实验显示多模态融合优于单模态,能提升事件语义判断和扩散重建一致性,但仍受痕迹衰减影响。

SLIP: Segmentation with Low-latency Interactive Prompting for 3D Medical Images Figure 1
2026-07-27cs.CV

SLIP: Segmentation with Low-latency Interactive Prompting for 3D Medical Images

Baptiste Podvin, Alexandre Ancel, Flavio Milana, Chiara Innocenzi, Davide Arrigo, Federico Espinola Schulze, Guido Torzilli, Jacques Marescaux, Daniel George, Alexandre Hostettler, Toby Collins

2026-07-27视觉感知三维

SLIP针对3D医学交互分割中每次提示都重算、延迟高、难以撤销提示且真实用户验证不足的问题,提出将图像编码与提示推理解耦:预先缓存patch特征,并用轻量记忆库在patch间传播交互状态,支持低延迟更新和prompt undo。论文报告其在13个公开数据集达到SOTA,并在含6名专家的前瞻用户研究中较nnInteractive更快、更受偏好。

Geometric 2D Scene Graph Generation Figure 1
2026-07-27cs.CV

Geometric 2D Scene Graph Generation

Christoph Jahn, Urs Waldmann, Bastian Goldluecke

Department of Computer and Information Science, University of Konstanz, Konstanz, Germany

2026-07-27视觉感知

面向机器人/制造装配中零件如何连接与按何顺序组装的问题,本文避免依赖语义标签,先由 Faster R-CNN 提取几何表示,再用 Transformer 预测邻接矩阵,并结合 Siamese+aGCN刻画连接关系。实验在小规模玩具车辆数据上验证,可从三类车辆泛化到未见车型;但数据集很小,结论更接近概念验证,实际增益来源仍需更充分消融说明。

fMRI2Face: A Full-HD fMRI-Video Dataset and Geometry-Guided Neural Decoding Framework for Dynamic Human Face Reconstruction Figure 1
2026-07-27cs.CV

fMRI2Face: A Full-HD fMRI-Video Dataset and Geometry-Guided Neural Decoding Framework for Dynamic Human Face Reconstruction

Jingyang Huo, Xiangru Huang, Chentao Shen, Yikai Wang, Yun Wang, Jianxiong Gao, Shihao Jin, Yanwei Fu, Jianfeng Feng

2026-07-27视觉感知数据集/基准三维

本文针对 fMRI 人脸解码中数据分辨率低、背景干扰强且难以同时恢复身份与表情运动的问题,构建了 62,856 对全高清、背景可控的数字人视频-fMRI 数据集,并用外观上下文与可变形 3D 人脸控制共同约束视频扩散生成。实验表明该框架能更稳定地重建身份、表情连续性和头部运动,但实际增益可能部分来自更大规模、更可控的数据。

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding Figure 1
2026-07-27cs.CV

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

2026-07-27视觉语言视觉感知

本文针对医学多模态大模型在报告生成和诊断中常因底层视觉感知不足而失可靠的问题,提出 Perception-Bench 从属性、空间定位、疾病预测到报告生成系统追踪失败,并设计 RadSight 以双 2D/3D 编码器和四阶段课程学习强化证据级感知。结果显示其在六类评测及公开 2D/3D 医学基准上均优于现有模型,空间定位和临床诊断提升尤为明显。

Class-Balanced Softmax: A Bayes Theory-Based Method for Long-Tailed Recognition Figure 1
2026-07-27cs.LG

Class-Balanced Softmax: A Bayes Theory-Based Method for Long-Tailed Recognition

Yi-Hang Zhu, Rajeev Raman, Shiqi Su, Jianyuan Sun, Xinyu Yang, Nan Xing, Huiyu Zhou

2026-07-27视觉感知学习理论

本文针对长尾分类中普通 Softmax 和 Balanced Softmax 偏向头部类别、尾部类训练误差与泛化差距更大的问题,提出基于贝叶斯推导与幂律校准的 Class-Balanced Softmax,通过在 logits 中加入可调的类别样本数项统一并放松 Balanced Softmax 的固定假设。作者还定义“preference issue”和模型不平衡度指标,用于刻画这种偏置;在 ImageNet-LT、iNaturalist2018、LVIS 等大规模基准上,CBS 报告优于 Balanced Softmax 等方法且几乎不增加计算与参数。

From level set evolution to threshold optimization: A grayscale level set framework for image segmentation Figure 1
2026-07-27cs.CV

From level set evolution to threshold optimization: A grayscale level set framework for image segmentation

Xingkai Li, Jiebao Sun, Fanghui Song, Zhichang Guo

School of Mathematics, Harbin Institute of Technology, Harbin, 150001, Heilongjiang, China.

2026-07-27视觉感知优化算法

针对噪声、低对比度和灰度不均等多重退化下传统水平集分割依赖长度正则、计算慢且数值不稳的问题,论文提出先将图像预处理为平滑图像,再把水平集限制为由灰度阈值诱导的“灰度水平集”,从而把 PDE 演化转为一维阈值搜索。文中给出相应理论关系与增量更新算法,复杂度由 O(MNS) 降至 O(NS),实验显示在多类退化图像上保持分割效果并显著提速。

AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment Figure 1
2026-07-27cs.CV

AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment

Ziyao Huang, Shunkai Li, Juan Cao, Chenyu Li, Youliang Zhang, Zixiang Zhou, Cong Wang, Yuan Zhou, Qinglin Lu, Fan Tang

University of Chinese Academy of Sciences

2026-07-27视觉感知

该文针对人-物交互视频生成中仅靠文本意图难以约束接触、物体响应和多阶段动作的问题,提出 AgentHOI:先由感知、关系分析和运动规划等多代理生成时间化交互计划,再用隐式文本-运动表示对齐把 T2M 先验蒸馏进视频扩散模型,推理时无需显式动作输入。实验称其在穿戴、骑乘等场景中提升交互自然性、物体外观保持和复杂指令遵循。

TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution Figure 1
2026-07-27cs.CV

TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution

Sicheng Gao, Zhuyun Zhou, Yixuan Liu, Tong Shen, Zongwei Wu, Radu Timofte

2026-07-27视觉感知生成模型

TRaM-VSR针对一阶段扩散视频超分中密集时空 token 计算昂贵、简单裁剪又易丢细节和引发闪烁的问题,提出结合运动时序线索、文本语义相似度与网络深度先验的 token 路由/合并机制:关键结构 token 走高保真局部分支,低信息 token 聚合到全局分支,并由离线规划器选择压缩区间。实验显示其在显著加速推理的同时,基本保持重建质量和时间一致性。

Deep Convolutional Large-Margin $\ell_p$-SVDD for Visual Anomaly Detection Figure 1
2026-07-27cs.CV

Deep Convolutional Large-Margin $\ell_p$-SVDD for Visual Anomaly Detection

Alireza Dastmalchi Saei, Shervin Rahimzadeh Arashloo

2026-07-27视觉感知

针对视觉异常检测中异常样本稀缺、类别极不均衡且深度特征缺少明确大间隔边界的问题,本文提出 DLM-SVDD,将可训练 CNN 表征与大间隔 ℓp-SVDD 核边界联合优化,并用 Frank-Wolfe 对偶更新和边界诱导的平滑违例损失交替训练;同时比较多种核近似以提升可扩展性。实验显示其在多个基准、少样本和长尾/不均衡设置下优于固定特征基线并具备较强竞争力,但具体增益中近似策略与表征学习的相对贡献仍需结合消融判断。

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs Figure 1
2026-07-27cs.CV

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

2026-07-27视觉感知

面向港口等遥感垂直场景,通用 RS-MLLM 往往缺少多源观测、空间证据和拒答能力,直接用少量目标数据 SFT 容易不足。论文提出 FBA,将后训练拆成遥感语义锚定、跨场景/跨模态桥接和证据驱动场景调优,并构建 CPRS 与 HarborEval;在相近训练预算下,LLaVA-v1.5 上 HarborEval 从 57.95 提升到 70.29,Qwen3-VL 从 81.09 提升到 83.37。

LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR Figure 1
2026-07-27cs.CV

LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

Xudong Liu, Bicheng Wan, Yulin Jin

2026-07-27视觉感知

高分辨率文档 OCR 的 VLM 会产生大量空白或冗余视觉 token,导致推理成本高,而通用压缩又可能删掉细粒度文字信息。LayoutLite 的核心是在视觉编码器与语言解码器之间做 token 级隐式版面分析,用多层特征预测重要性并剪除低信息 token,同时保留空间位置。实验显示在 FireRed-OCR、Logics-Parsing-V2 上压缩至 50% 时,OmniDocBench 分数几乎不降,prefill 延迟、FLOPs 和 KV cache 均降低超过 40%。

Bowel Obstruction Detection and Localization on Abdominal CT with Deep Learning Figure 1
2026-07-27cs.CV

Bowel Obstruction Detection and Localization on Abdominal CT with Deep Learning

Moritz Vandenhirtz, Andrea Agostini, Dana Belde, Mélanie Roschewitz, Ismaiel Chikh Bakri, Tilo Niemann, André Euler, Julia E Vogt

\addr 1 Department of Computer Science, Department of Radiology, affiliated Hospital for Research and Teaching of the Faculty of Medicine of the University of Zurich, Department of Forensic Medicine Zurich, University of Zurich

2026-07-27视觉感知

针对肠梗阻 CT 阅片量大且转折区定位耗时的问题,论文提出贴近放射科逐层阅片流程的多任务框架,同时做患者级梗阻检测和切片级转折区排序,并用 P2P 概率选择掩膜在切片内给出更忠实的可解释定位。在 1427 例内部腹部 CT 上,最佳模型检测准确率达 93%,转折区 Hit@10 达 95%,但外部泛化仍文中未充分说明。

JustDepth: Real-Time Radar-Camera Depth Estimation with Single-Scan LiDAR Supervision Figure 1
2026-07-27cs.CV

JustDepth: Real-Time Radar-Camera Depth Estimation with Single-Scan LiDAR Supervision

Wooyung Yun, Dongwook Kim, Soomok Lee

Wooyung Yun and Dongwook Kim are with the Department of Artificial Intelligence, Ajou University, Suwon 16499, Republic of Korea, Soomok Lee is the Corresponding author † and is the Faculty of Department of Computer Science, Kennesaw State University, Marietta GA, 30060, United States

2026-07-27视觉感知

面向自动驾驶中相机缺少尺度、毫米波雷达稀疏但具鲁棒量测、现有雷达-相机深度方法延迟高且依赖额外标注的问题,JustDepth将雷达回波压缩为固定宽度1D表示,用高度融合模块和轻量GNN直接预测稠密深度,并用仅训练阶段的置信度头及同步增强缓解单帧LiDAR监督条纹。nuScenes上其精度保持与近期方法相近,推理延迟降低39.7倍,VHGR条纹指标降低66%。

dRAE: Representation Autoencoder with Hyper-Spherical Codes Figure 1
2026-07-27cs.CV

dRAE: Representation Autoencoder with Hyper-Spherical Codes

Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye

2026-07-27视觉感知

该文针对高维视觉表征离散化时 VQ 易码本坍塌、难以同时服务理解与生成的问题,指出根因是欧氏距离与表征空间各向异性几何不匹配。dRAE 用超球量化以角度相似度路由、保留幅值给解码器,分离语义方向与尺度影响;实验显示码本可扩到 131,072 且利用率达 100%,重建、理解和生成任务均有提升。

Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis Figure 1
2026-07-27cs.CV

Visual Relocalization from Sparse Views in Aliased and Low-Texture Environments via Novel View Synthesis

Maria Peribañez, Javier Civera, Rudolph Triebel, Riccardo Giubilato

2026-07-27视觉感知

面向行星类低纹理、强混淆且视角稀疏的机器人重定位场景,论文用3D Gaussian Splatting替代传统特征匹配,并在训练中联合光度损失、MVS深度/法线约束与LiDAR Chamfer几何对齐,以提升高斯地图的几何一致性。实验在行星模拟数据上显示,几何监督能明显改善单图6-DoF重定位精度,但具体增益在不同监督项间的贡献仍需结合消融表判断。

CARDIAG: A Dense Segment Classification Benchmark of Deep Learning Architectures for Coronary Angiography Figure 1
2026-07-27cs.CV

CARDIAG: A Dense Segment Classification Benchmark of Deep Learning Architectures for Coronary Angiography

Dominik Bernard Lau, Hubert Malinowski, Jerzy Szyjut, Adam Brzeski, Tomasz Dziubich, Radosław Targoński, Tomasz Figatowski, Natalia Zielińska

Gdańsk University of Technology, NASK National Research Institute, Medical University of Gdańsk

2026-07-27数据集/基准

该文针对冠脉造影像素级 SYNTAX 分段缺少可复现实验协议和公开数据的问题,提出 CARDIAG 多中心、多标签基准,并比较 24 类 CNN、Transformer 与状态空间模型。其洞察是高低分辨率特征共同重要,且需用中心、人口学和投照参数检验泛化与校准。最佳单模型 ConvNeXt V2+DeepLabV3+ macro F1 为 0.456,集成 Mamba U-Net 与 FPN 后提升到 0.479。

GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels Figure 1
2026-07-27cs.CV

GLI-AL: A Multi-Modal Glioma MRI Label Resource with Unified Anatomy-Lesion Labels

Xingyu Xiang, Shuang Hao, Fan Wang, Jianhua Ma, Chunfeng Lian

2026-07-27视觉感知

该文针对 BraTS-GLI 只标注肿瘤亚区、把共存白质高信号等异常误作正常组织而引入标签噪声的问题,构建 GLI-AL:覆盖 1251 例四模态胶质瘤 MRI 的八类统一解剖-病灶标签资源,并提供纯化/扩展子集、修复标签和可追溯元数据。验证显示,WMH 感知监督在保持健康组织分割表现的同时,相比噪声对照提高了对共存病灶的敏感性。

A Framework for Individual Tree Growth Reconstruction Using Multi-Platform Laser Scanning Figure 1
2026-07-27cs.CV

A Framework for Individual Tree Growth Reconstruction Using Multi-Platform Laser Scanning

Daniella Tavi, Valtteri Soininen, Lassi Ruoppa, Jesse Muhojoki, Juha Hyyppä

Department of Remote Sensing and Photogrammetry, Finnish Geospatial Research Institute FGI, The National Land Survey of Finland, Vuorimiehentie 5, Espoo, FI-02150, Finland, Department of Computer Science, School of Science, Aalto University, P.O. Box 11000, Aalto, FI-00076, Finland, The increasing availability of repeated airborne LiDAR acqui-, in which segment labels were assigned based on the nearest

2026-07-27三维

针对多时相激光扫描中单木对应困难、历史胸径数据稀缺且生长量接近测量噪声的问题,论文提出用一次MLS/TLS树干测量结合多期ALS高度变化,通过深度分割迁移和height-based scaling重建胸径与材积生长。结果显示该建模法优于直接差分独立属性估计,5/10年DBH和材积增长RMSE相对人工估计更低,12年尺度误差仍基本稳定。

Projection Pursuit CPCANet for Domain Generalization Figure 1
2026-07-27cs.CV

Projection Pursuit CPCANet for Domain Generalization

Yu-Hsi Chen, Abd-Krim Seghouane

The University of Melbourne

2026-07-27学习理论

本文针对域泛化中 CPCANet 在小批量、高维特征下协方差估计秩亏、只能恢复截断公共子空间的问题,提出 PP-CPCANet:不显式估计协方差,而是在 Stiefel 流形上学习全局正交基,并用带对称破缺的 detached-median L1 投影离散度目标提取稳健公共主成分。实验称其在四个标准 DG 基准上达到 SOTA 且训练更稳定,但具体增益相对各组件的来源仍需结合消融进一步判断。

InnoText: A Unified Model for Visual Text Generation and Editing Figure 1
2026-07-27cs.CV

InnoText: A Unified Model for Visual Text Generation and Editing

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

2026-07-27视觉感知

视觉文本生成与编辑要求字符结构清晰、尺度稳定,中文和小字号场景尤其困难;InnoText 将生成和编辑统一到 DiT 框架中,并通过字体大小感知调制、小字符增强和区域加权损失改善多尺度字形建模。论文称其在英中双语数据集上较现有方法提升生成准确性和编辑质量,但具体增益中数据构建与模型设计的贡献占比仍需进一步拆分。

Spectral Prior for Reducing Exposure Bias in Diffusion Models Figure 1
2026-07-27cs.CV

Spectral Prior for Reducing Exposure Bias in Diffusion Models

Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji

2026-07-27生成模型

本文针对扩散模型采样中的 exposure bias,指出训练与推理的偏差并非统一噪声尺度错误,而是随频率、时间步和模型变化的谱失配。作者提出 SPA:先从训练数据拟合时间相关功率谱先验,再在推理中用 FFT 梯度引导中间预测对齐。实验覆盖 DDPM、SDXL、SD3.5、FLUX 等,FID/HPSv3 等指标稳定提升,额外开销约 3–4%,但增益机理仍有部分假设成分。

FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection Figure 1
2026-07-27cs.CV

FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection

Md Redwanul Haque, Manzur Murshed, Manoranjan Paul, Tsz-Kwan Lee

2026-07-27视觉感知

这篇论文针对 AIGC 检测器在未见生成器上容易依赖低层纹理伪迹而失效的问题,提出 FAIR:训练时临时引入场景构图结构 SCS 作为正交的宏观结构先验,约束优化轨迹并抑制纹理捷径,推理时丢弃该先验,因此不增加部署开销。作者将其接入 AIDE、PatchCraft,在五个大规模基准和 60 多个未见域上报告最高约 8% 的准确率提升。

CommandLM: Data driven behavior level descriptor for ego vehicles Figure 1
2026-07-27cs.CV

CommandLM: Data driven behavior level descriptor for ego vehicles

Boris Tokic, Constantin Selzer, Fabian B. Flohr

Munich University of Applied Sciences, Munich, Germany

2026-07-27视觉感知

面向自动驾驶落地中行为决策难解释、难审计的问题,CommandLM将多相机与LiDAR的时序BEV特征经Q-Former接入量化并LoRA微调的LLM,生成自车意图级中文本描述,并用行为导向数据增强减少坐标依赖。实验优于BLIP-2,CIDEr 0.67、BERT-F1 0.88;但人工评估仅58%描述同时准确、高效且合规,语义幻觉与路径忠实度仍是限制。

The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing Figure 1
2026-07-27eess.IV

The Lift Spectrum: How Measurement-to-Space Adaptivity Shapes Robustness in Image-Free Single-Pixel Sensing

Yuyuan Han, Jingwei Li, Long Qiu, Chong Wang, Wenxuan Hao, Jiangyu Han, Xinyu Yao, Yuchen He, Hui Chen, Jianbin Liu, Huaibin Zheng

2026-07-27视觉感知安全鲁棒

面向低功耗边缘感知中的单像素压缩测量,论文指出免成像推理的关键不在是否重建,而在把1D测量映射到2D空间的“lift”。作者提出lift谱系,并用STSF的循环编码、跨注意力空间检索和TPLS重建先验调度实现内容自适应lift。实验显示其在3.13%采样率下较既有免成像基线提升3.2至9.9个百分点mIoU,低至0.39%仍较稳定;无噪声下重建再分割更强,但有测量噪声时免成像方案因避免噪声放大而反超,并可零微调迁移到真实单像素平台。

Alleviating Regional Shortcuts for Few-Shot Class-Incremental Learning Figure 1
2026-07-27cs.CV

Alleviating Regional Shortcuts for Few-Shot Class-Incremental Learning

Haichen Zhou, Yazhe Lyu, Yixiong Zou, Ruixuan Li, Yuhua Li

*These authors contributed equally to this work.The authors are with the School of Computer Science and Technology, Huazhong University of Science and Technology

2026-07-27视觉感知

这篇论文针对少样本类增量学习中新类样本常被误判为基类的问题,指出根因是基类训练形成的“区域捷径”:模型过度依赖基类最判别性局部区域,迁移到新类时难以关注真正的新类区域。作者从组合学习视角将局部语义单元拆为公共与判别原语,并提出 ARS-CDP 约束模型学习更可迁移的公共原语,同时保留判别原语以减轻遗忘。标准 FSCIL 基准上的实验显示,该方法在准确率和可解释性上均较现有方法有稳定提升。

ReCowGnition: A Realistic Biometric Benchmark for Cow Face Recognition Figure 1
2026-07-27cs.CV

ReCowGnition: A Realistic Biometric Benchmark for Cow Face Recognition

Marco Huber, Marco Kiesewalter, Judith Louise Pieper, Bastian Kubsch, Naser Damer

2026-07-27视觉感知数据集/基准

面向精准畜牧中非侵入式个体识别需求,论文指出现有牛脸识别多依赖私有小数据和分类式评测,难以比较与迁移。其核心贡献是公开 ReCowGnition:真实奶牛场自动采集的 161 头牛、6838 张牛脸图像,并给出基于生物识别范式的2个验证和4个识别协议及口鼻锚定检测对齐流程。六类基线评测显示现实场景仍具挑战,主要价值在于建立可复现实验基准而非提出显著新模型。

Rethinking Multi-Branch and Cross-Backbone Fusion for Vehicle Re-Identification in the Foundation-Model Era Figure 1
2026-07-27cs.CV

Rethinking Multi-Branch and Cross-Backbone Fusion for Vehicle Re-Identification in the Foundation-Model Era

Yu Wang, Hongyu Yang

Huahuan (Yunnan) Technology Co., Ltd., Yunnan, China

2026-07-27视觉感知

论文质疑基础模型时代车辆重识别中“多分支/跨骨干融合必然带来互补增益”的常见假设,构建强 DINOv3-ConvNeXt 单骨干基线并用检索级分支诊断分析冗余与可融合性。结果显示,同骨干多头基本退化为冗余,CNN-Transformer 虽有差异但难转化为收益;单骨干在 VeRi-Wild 达 88.19 mAP,重排序后达 92.38,融合增益最高仅约 0.11 mAP 且成本更高。

A Smooth Phase-Separation Model for Weak-Boundary Segmentation of Homogeneous Structures Figure 1
2026-07-27cs.CV

A Smooth Phase-Separation Model for Weak-Boundary Segmentation of Homogeneous Structures

Zihan Li, Jiebao Sun, Fanghui Song, Zhichang Guo

School of Mathematics, Harbin Institute of Technology

2026-07-27视觉感知学习理论

这篇论文针对相邻同质结构在弱边界、灰度分布重叠时容易被传统变分模型合并或泄漏的问题,提出将 softmax 区域拟合与 Cahn-Hilliard 相场正则结合的平滑相分离模型,并给出混合 L2-H-1 梯度流、能量耗散与弱解唯一性分析。实验显示其在合成和医学图像上能更稳定分离弱边界结构,边界定位和分割精度优于若干变分、相场及深度学习基线。

Scaling Native Multimodal Pre-Training From Scratch Figure 1
2026-07-27cs.CL

Scaling Native Multimodal Pre-Training From Scratch

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

The Chinese University of Hong Kong, LLM Department, Tencent

2026-07-27视觉语言

针对从零训练原生多模态模型缺乏可预测扩展规律的问题,论文用 IsoFLOP 与训练曲线包络估计计算最优前沿,区分语言与多模态目标的资源分配规律。核心发现是语言扩展几乎不受数据配比影响,而多模态扩展强依赖多模态比例,文本偏重数据只在更大模型下更高效;实验还显示跨模态训练可提升纯文本空间推理并带来多模态上下文学习,但验证规模仅到 3B。

Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation Figure 1
2026-07-27cs.CV

Small Vision-Language Models Know When They Are Wrong But Cannot Say So: A Two-Model Study of Stated versus Internal Confidence Under Realistic Image Degradation

M M Asif Ferdous

2026-07-27视觉语言视觉感知

本文关注小型开源视觉语言模型在压缩、模糊、低光等真实图像退化下能否可靠表达不确定性。核心洞察是区分口头置信度与生成答案的内部 token 概率:前者在 Qwen2-VL 中几乎恒定、在 SmolVLM 中难以解析,后者却能较好区分对错。3,800 次预测显示内部置信度 AUROC 最高达 0.99,但严重欠曝光下两类信号均失效。

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection Figure 1
2026-07-27cs.CV

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

Hao Yang, Jin Wang, Xuejie Zhang

2026-07-27视觉语言视觉感知

针对有害 meme 检测中双流视觉语言模型缺少背景知识、单一 CoT 推理不稳定且跨模态细粒度对齐不足的问题,EVL-MCoT 引入多条推理链以降低偏差,并用原型引导与上下文引导解码加强视觉细节和文本提示的融合。论文在 HatefulMemes 与 MultiOFF 上报告了有竞争力的结果,但具体增益来源仍需结合消融进一步判断。

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents Figure 1
2026-07-27cs.AI

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

University of Technology Nuremberg

2026-07-27数据集/基准

本文关注通用 MLLM 在无需航拍任务微调时,能否从单条高层指令完成无人机长程任务。作者提出 MissionBench,用 120 个三维仿真任务和闭环评估同时考察导航、视角选择、执行与报告。结果显示 22 个模型中最强者成功率仍低于 35%,远低于人类 84.4%,但规模增大带来稳定提升,提示当前瓶颈不只是空间感知,还包括多步规划与自适应推理。

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning Figure 1
2026-07-27cs.CV

Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning

Hao Yang, Jin Wang, Xuejie Zhang

2026-07-27视觉语言

这篇论文针对小型多模态 CoT 模型在图文融合后容易抹平细粒度差异的问题,提出 VSSD:用大多模态模型注意力定位并遮蔽关键图像区域,构造负扰动样本,再通过 SVD 提取原图与扰动图之间的主导特征偏移,将其作为 steering vector 做层间蒸馏。ScienceQA 和 M3CoT 实验显示,该方法能提升推理解释生成与答案预测表现。

Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models Figure 1
2026-07-27cs.CV

Medical-Checklist: Assessing the Comprehension of Medical Images by Multimodal Models

Bannapol Limanond, Masanori Suganuma, Takayuki Okatani

2026-07-27视觉语言视觉感知

针对医学多模态模型在Med-VQA等任务高分但未必真正理解图像的问题,论文提出Medical-Checklist:给每张医学图像配正确说明和仅替换一个医学概念的错误说明,用二选一检验基础医学概念理解,并降低数据偏置、覆盖OOD输入。对4个先进医学多模态模型评测显示,它们仍难稳定识别明显错误 caption,说明现有成绩不足以支撑临床可靠性。

Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation Figure 1
2026-07-27cs.CV

Rethinking Layer-Wise Information Allocation for Vision Foundation Model Adaptation

Yuqi Li, Xi Xiao, Yunbei Zhang, Lin Zhao, Yu Li, Aiden Zhao, Tianyang Wang, Hao Xu, Yingli Tian

City College of New York, CUNY, University of Alabama at Birmingham, Tulane University, Northeastern University, George Washington University, Harvard University, City College of New York, CUNY New York NY USA, University of Alabama at Birmingham Birmingham AL USA, Tulane University New Orleans LA USA, Northeastern University Boston MA USA, George Washington University Washington DC USA, Harvard University Cambridge MA USA

2026-07-27视觉感知

论文针对视觉基础模型用冻结骨干做参数高效适配时,提示调优对层数、位置和任务分布高度敏感的问题,指出瓶颈不只是优化,而是跨层信息保留与压缩缺乏约束。其提出PIB,将提示视为层级信息瓶颈,要求浅层保留判别所需局部证据、深层压制冗余和捷径因素。实验覆盖34个数据集,在平均仅调0.35%参数下取得FGVC 92.1%、HTA 93.01%、VTAB-1k 77.33%,并报告分布偏移和细粒度场景鲁棒性改善。

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation Figure 1
2026-07-27cs.CV

TextSLIP: Text Self-Supervised CLIP for Medical Report Generation

Haoyu Jiang, Ziping Cong

2026-07-27视觉感知

这篇论文针对CLIP式医学视觉语言预训练在报告生成中只做粗粒度图文对齐、难以提供细粒度语义监督的问题,提出TextSLIP,在CLIP目标外加入基于ESimCSE的文本内对比学习,以结构化文本嵌入来反向强化视觉编码器。作者在700万脑MRI图文对上预训练,并接入R2Gen微调,较同数据CLIP基线在报告生成指标上稳定提升;但验证主要限于脑MRI和BLEU、ROUGE等词面指标。

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model Figure 1
2026-07-27cs.CV

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

2026-07-27视觉语言视觉感知

面向低空无人机通信中传统统计模型难以刻画具体场景、多径射线追踪又依赖精确三维地图且计算昂贵的问题,论文提出 PanoLAMP:用收发端全景 RGB-D 观测驱动预训练视觉语言模型,并通过深度位置编码、LoRA 适配和多任务 MoE 头预测相对 LoS 的时延、功率与到达角偏移。在 18,949 条合成 UAV-车辆链路上,该方法优于代表性基线,并在不同飞行高度上表现出更好的泛化。

Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions Figure 1
2026-07-27cs.CV

Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions

Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo, Pedro Henriques Abreu

Computer Science Division, Aeronautics Institute of Technology and Science and Technology Institute, Federal University of São Paulo, University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering, Computer Science Division, Aeronautics Institute of Technology and Science and Technology Institute, Federal University of São Paulo São José dos Campos Brazil, University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering Coimbra Portugal

2026-07-27视觉感知生成模型

针对医学图像中伪影、缺失区域和病灶变化会影响诊断可靠性的问题,本文系统梳理60项扩散模型修复研究,并给出方法分类、数据集与评估设置对比。核心洞察是DDPM和潜空间扩散已成主流,应用集中在伪影去除、数据增强、伪健康重建和异常检测,尤其面向MRI与CT;结果显示其能生成解剖上较合理的修复并辅助下游任务,但标准基准、数据多样性和临床验证仍不足。

ISPCloak: Weaponizing ISP for Optimization-Free Physical Camouflage against Deepfake Detectors Figure 1
2026-07-27cs.CV

ISPCloak: Weaponizing ISP for Optimization-Free Physical Camouflage against Deepfake Detectors

Jiale Zhao, Jiajun Wan, Lei Tang, Ye Qin, Kebing Jin, Jinghui Qin

Guangdong University of Technology, Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University, Guangdong University of Technology Guangzhou China, Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University Guiyang China

2026-07-27优化算法

论文针对深伪检测器主要依赖数字合成痕迹、忽视真实相机成像物理特征的漏洞,提出 ISPCloak:先抑制生成痕迹,再用可逆 ISP 映射到 RAW 域,注入符合泊松-高斯传感器噪声并经 ISP 重建,以无需迭代优化的方式伪装成真实拍摄图像。实验称该方法能在视觉改动很小、耗时仅数十毫秒的情况下显著提升攻击成功率,并具备较好的跨检测器迁移性。

Learning Adaptive Semantic Gaussian Allocation for 3D Occupancy Figure 1
2026-07-27cs.CV

Learning Adaptive Semantic Gaussian Allocation for 3D Occupancy

Kanglin Ning, Yiran Zhao, Wenrui Li, Houde Quan, Qifan Li, Xingtao Wang, Xiaopeng Fan

2026-07-27三维

这篇论文关注语义高斯用于3D占用预测时的固定预算分配问题:现有方法多改进形状、初始化或增密,却可能让简单区域冗余、薄结构和类别边界支持不足。作者提出SAGFormer,用高斯属性与局部几何-语义上下文为保留、克隆、拆分、抑制候选打分,并做全局Top-K选择。实验在nuScenes-SurroundOcc和SSCBench-KITTI-360上提升占用预测,减少语义混合和未使用高斯,但动态目标增益有限。

Farmland Extent and Visible Boundary Mapping from 1 m NAIP Imagery Using Residual U-Net and Text-Prompted SAM 3 Refinement Figure 1
2026-07-27cs.CV

Farmland Extent and Visible Boundary Mapping from 1 m NAIP Imagery Using Residual U-Net and Text-Prompted SAM 3 Refinement

Mohammadreza Narimani, Vikram Anand, Parastoo Farajpoor

2026-07-27视觉感知学习理论

针对农田边界图层常缺失、过时且难以支撑作物统计和土地转用监测的问题,本文用1 m NAIP RGB影像训练场景级划分的ResUNet,并以文本提示的冻结SAM 3掩膜作逻辑并集补全。ResUNet在测试集Dice为0.9234、IoU为0.8605,难例融合后Dice从0.858升至0.955、0.804升至0.903;但SAM增益只在选定样例展示,泛化贡献仍文中未充分说明。

SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes Figure 1
2026-07-27cs.CV

SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes

Chia-Tung Ho, Haoyu Yang, Guanglei Zhou, Yoshi Nishi, Yaguang Li, Walker Turner, Cunxi Yu, Yiran Chen, Brucek Khailany

Duke University

2026-07-27优化算法

面向先进制程中局部布线设计规则违规难以由模板化工具修复的问题,SCALE用自监督方式把多层版图序列化并学习补全被遮挡多边形,再用规则约束采样和工业DRC筛选生成违规数据,微调专用DRC-VLM指导代理修复。实验显示其生成数据覆盖更多拓扑和规则,在100个sub-2nm真实案例上使修复成功率提升12–25%,最高达97%。

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering Figure 1
2026-07-27cs.CV

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang

The Pennsylvania State University

2026-07-27生成模型

这篇论文针对长时程自回归生成渲染中的“重访不一致”问题:相机离开后再返回同一位置时,受限 KV cache 已遗忘旧视角,模型会重新生成不同外观。作者不训练新模型,而是利用 3D 引擎已有的相机位姿和深度对应关系,检索姿态匹配的历史 latent chunk 作为闭环记忆,并用深度重投影给注意力加入几何对应偏置。实验在 TartanAir/TartanGround 闭环轨迹上显示,该方法在像素、语义和几何一致性指标上优于训练自由基线,同时基本不损害整体视频质量。

Toward High-Fidelity 3D Point-Cloud Learning for Brain Folding Morphology Prediction Using Trans-Unet Figure 1
2026-07-27cs.CV

Toward High-Fidelity 3D Point-Cloud Learning for Brain Folding Morphology Prediction Using Trans-Unet

Geran Zhao, Xiaotian Li, Poorya Chavoshnejad, Mir Jalil Razavi, Akbar Solhtalab, Lijun Yin, Guifang Fu

Department of Mathematics and Statistics, Binghamton University, School of Computing, Binghamton University, Vestal, NY 13850, USA, Department of Mechanical Engineering, Binghamton University, Vestal, NY 13850, USA, Akbar Solhtalab

2026-07-27三维

脑皮层折叠预测受三维点云无序、局部结构难捕捉和高分辨率计算成本限制。论文将有限元生成的脑表面与纤维点云先映射到二维网格,再用结合 CNN 与自注意力的 U 形 Trans-Unet 同时建模局部纹理和长程深度关系。实验用于从早期状态预测最终折叠形态,报告在保真度和精度上优于既有点云方法,但增益来源与数据规模、有限元先验的关系仍需进一步拆分说明。

A Dual Path Framework with Hotspot Guided Fusion for Three Dimensional CT to PET Synthesis in Head and Neck Cancer Figure 1
2026-07-27cs.CV

A Dual Path Framework with Hotspot Guided Fusion for Three Dimensional CT to PET Synthesis in Head and Neck Cancer

Mohd Maaz Khan, Oluwaseyi Oderinde

Advanced Molecular Imaging in Radiotherapy (AdMIRe) Research Laboratory, School of Health Sciences, Purdue University, West Lafayette, IN, 47907, USA, Department of Radiation Oncology, Indiana University School of Medicine, Indianapolis, IN 46202, USA

2026-07-27视觉感知

本文针对头颈癌 PET 成像成本高、重复获取受限的问题,尝试从常规 CT 合成三维 PET-like 体数据。核心做法是将定量 SUV 回归 U-Net 与生成式 cGAN 分成双路径,再用热点引导的拉普拉斯金字塔融合,在高摄取区域保留回归结果、背景区域利用对抗纹理。44例 QIN-HEADNECK 五折验证得到 MAE 0.00395、PSNR 39.19 dB、SSIM 0.9634,但高代谢肿瘤 SUV 仍系统性低估,尚不足以支持定量诊断。

What Happens to Accuracy When Photo Lineups Contain Non-Mated Rank-One Images From Large Galleries? Figure 1
2026-07-27cs.CV

What Happens to Accuracy When Photo Lineups Contain Non-Mated Rank-One Images From Large Galleries?

Genesis Argueta, Kevin W. Bowyer, Michael King, Jayeeta Dhar

University of Notre Dame, Florida Institute of Technology

2026-07-27视觉感知

本文关注执法中人脸识别检索结果进入目击者照片列队后是否放大误认风险,核心洞察是图库越大,rank-one 非同人候选越像真实嫌疑人,却不一定更像填充人,从而破坏列队公平性。实验比较 500、5,000、24,000 图库,发现大图库显著提高错误指认率及错误信心,对将此类列队结果作为逮捕依据提出质疑。

Risk-Routed Implicit Boundary Refinement for Robust Ultrasound Image Segmentation Figure 1
2026-07-27cs.CV

Risk-Routed Implicit Boundary Refinement for Robust Ultrasound Image Segmentation

Jingguo Qu, Xinyang Han, Xiang Wang, Yuqi Yang, Tonghuan Xiao, Sheng Ning, Jing Qin, Ann Dorothy King, Winnie Chiu-Wing Chu, Jing Cai, Michael Ying

2026-07-27视觉感知学习理论安全鲁棒

本文针对超声分割中散斑噪声、弱边界和跨设备/操作者分布偏移导致的轮廓不稳定问题,提出 RIBR:不让隐式神经表示直接生成整幅掩码,而是作为受风险门控的 logit 残差,仅在疑似边界区域做局部修正,并用几何与散斑感知正则抑制非边界振荡。九个超声数据集结果显示,其在紧凑参数量下取得最佳宏平均表现并降低边界误差。

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms Figure 1
2026-07-27cs.CL

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

Wichita State University, USA, CCDS, Independent University, Bangladesh

2026-07-27视觉语言数据集/基准

面向政府档案中多份表格被扫描成同一文件且常乱序的实际流程,Khondo提出首个孟加拉政府表格文档包拆分基准,覆盖双语、视觉原生输入、14类行政领域和5种拼接/打乱方式。结果显示,多模态大模型能较好聚类同源页面,但在页面被打乱后重建原始顺序明显失效;显式排序提示和英文版本有帮助但不足,说明页序恢复是低资源视觉文档理解的主要瓶颈。

Physiological Signals as a Forensic Modality for Talking-Face Deepfake Detection Figure 1
2026-07-27cs.LG

Physiological Signals as a Forensic Modality for Talking-Face Deepfake Detection

Othmane Harraq, Tamer Aldwairi

Temple University

2026-07-27视觉感知

本文针对说话人脸深伪没有真实视频生理基底这一特点,尝试把远程光电容积脉搏信号作为视觉取证通道,而非依赖纹理或音频同步。方法用 RhythmFormer 提取逐视频 rPPG 波形,再以轻量 1D 分类器判别真伪;核心洞察是不同生成器的像素合成策略会稳定影响生理可检出性。在 Celeb-DF++ TF 子集的身份独立评测中,1D ResNet 达到 AUC 0.806、EER 27.8%,优于复现实验中的 DeepFakesON-Phys 0.622,但真实身份数量较少,泛化上限仍受数据约束。

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints Figure 1
2026-07-27cs.CV

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis

University of Texas at Dallas, 2 Amazon Web Services

2026-07-27视觉语言优化算法安全鲁棒

这篇论文针对LVLM在复杂视觉推理中“答对但前后矛盾”的鲁棒性问题,提出成对逻辑等价问题的ConVBench,并用逻辑一致性与鲁棒准确率共同评估;方法上以自动生成问答对结合GRPO,引入准确性与一致性双奖励训练ConVLM。实验称其在ConVBench上达到开源模型SOTA,甚至超过Claude-3.7-Sonnet,并在其他数据集上有泛化增益。

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On Figure 1
2026-07-27cs.CV

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

Oxygen AIGC Group & Joy Future Academy

2026-07-27视觉感知

虚拟试衣仍受限于单品类、干净商品图和遮罩修补范式,难以保留身份与服饰细节。Oxygen-TryOn将任务改为多参考、理解驱动的生成,结合专用数据引擎与CPT-SFT-RL训练,支持衣物、鞋包和配饰的自由组合。实验称其在公开与自建基准上超过多种闭源和开源模型,但增益可能主要来自大规模数据与训练配方。

Hash-QNeRF: Multiresolution Hash Encoding for Quantum Neural Radiance Fields Figure 1
2026-07-27quant-ph

Hash-QNeRF: Multiresolution Hash Encoding for Quantum Neural Radiance Fields

Digonto Biswas, Tana Ballove, Anjan Bandyopadhyay, Sutanu Mangal, Arun Kumar Pati

Centres of Innovation and Research, KIIT Deemed to be University

2026-07-27三维

这篇论文针对 QNeRF 中正弦位置编码随场景复杂度和分辨率扩展不佳的问题,将 Instant-NGP 的多分辨率哈希网格接入量子 NeRF,仅替换空间编码而保留视角编码、幅度 MLP、PQC、奇偶测量和体渲染流程。实验在单个合成 Blender 场景上训练到 loss 0.003534、约 24.5 dB PSNR,并在 FakeKyiv/FakeTorino 噪声模型下保持 0.93–0.98 保真度;但泛化、速度增益和相对 QNeRF 的优势文中未充分说明。

Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration Figure 1
2026-07-27cs.LG

Self-Poisoning in Adaptive Out-of-Distribution Detection: A Sharp-Threshold Theory and Certified Label-Free Calibration

Vishnu Bindu Balachandran

2026-07-27视觉感知学习理论

这篇论文针对测试时自适应 OOD 检测中无标签流更新记忆库会自我污染的问题,指出其不是随机噪声而是带阈值的强化动力学相变:入库错误率的斜率超过 1 时检测器会崩溃。作者用广义 Pólya urn 建模并提出只依赖冻结保留集的 WARDEN 认证入库门控,同时给出 CDC 处理漂移下静态校准失效;实验显示阈值预测匹配 96 个设置,未门控方法 AUROC 最多损失 0.163,而门控可控制误报并压低污染。

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images Figure 1
2026-07-27cs.SE

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images

Ronak Bhalgami

2026-07-27视觉感知

论文针对长代码上下文在商业多模态 API 中的输入 token 计费问题,比较源码文本与紧凑渲染图片的黑盒用量统计。核心洞察是“图片省 token”高度依赖提供商和长度,而非通用结论:Anthropic、OpenAI 在测试范围内始终更低,Gemini 需到约 200 行才低于文本。675 组配对显示图片/文本 token 比约为 0.135、0.194、0.242,但文中明确未验证语义保真、任务效果、延迟或真实成本。

Local Synaptic Rules Can Implement a SIGReg Gradient Without Backpropagation Figure 1
2026-07-27cs.NE

Local Synaptic Rules Can Implement a SIGReg Gradient Without Backpropagation

Martin Andrews

2026-07-27优化算法

这篇论文针对大脑如何在无标签、无反向传播条件下学习表征的问题,指出STDP增强臂与类颗粒细胞稳态可分别等价实现SIGReg的相似性、方差和协方差梯度,且只需局部信号。实验中,有序合成流将CSR提升到2.49而随机顺序仅0.83;有序MNIST上线性探针达87.3%,但相对随机顺序仅增0.8个百分点,增益来源仍需谨慎解读。

2026-07-24

107 篇
3D-Aware VLMs with Implicit and Explicit Geometries Figure 1
2026-07-24cs.CV

3D-Aware VLMs with Implicit and Explicit Geometries

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

Nanyang Technological University, DAMO Academy, Alibaba Group, HuPan Lab

2026-07-24视觉语言三维

本文针对仅依赖2D视觉输入的VLM在精细3D定位和空间推理上缺少可解释几何细节的问题,提出VLM-IE3D:从RGB视频同时构建隐式几何token和由重建深度/点云属性编码的显式几何token,并用3D-aware adapter与2D视觉特征融合。实验覆盖3D视频检测、视觉定位、密集描述和空间推理,显示其在RGB-only方法中表现更优,并接近部分使用3D输入的方法。

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers Figure 1
2026-07-24cs.CV

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

University of California, Los Angeles

2026-07-24生成模型强化学习

这篇论文针对多智能体视频世界模型只依赖历史帧条件、难以维持跨视角共享状态的问题,提出 WorldWeaver:在自回归扩散 rollout 中加入可持续更新的世界状态寄存器,并用智能体状态、鸟瞰图和场景文本监督其语义,再以 MoT 分离状态与像素建模。在双智能体 Minecraft 实验中,显式状态建模提升了逻辑一致性和生成质量,但真实世界状态监督的可获得性仍是限制。

Unified Video Dense Prediction from Disjoint Data Figure 1
2026-07-24cs.CV

Unified Video Dense Prediction from Disjoint Data

Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

2026-07-24视觉感知

这篇论文针对机器人/具身场景理解中几何、语义、材质等密集标注分散且难以共同标注的问题,提出 UniD:先用扩散模型先验学习各任务潜空间,再通过轻量任务投影器蒸馏到统一视频骨干,无需重叠标注或伪标签。实验显示其在八类任务上接近专用模型,并在 OOD、时间稳定性和跨任务一致性上优于统一基线。

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning Figure 1
2026-07-24cs.CV

Inference-Time Scaling of Diffusion Models via Progressive Seed Pruning

Rogerio Guimaraes, Pietro Perona

2026-07-24生成模型

这篇论文针对扩散/flow 生成在测试时扩展中常把算力浪费在完整去噪大量低质种子的问题,提出 Progressive Seed Pruning:早期并行探索更多初始噪声种子,用中间去噪结果的黑盒奖励逐步剪枝,把后续预算留给更有希望的轨迹。在固定模型评估次数下,PSP 在 GenEval、人工提示对齐评价及多种骨干上优于 BoN、重要性采样和树搜索基线,并支持离线搜索剪枝日程。

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation Figure 1
2026-07-24cs.RO

Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L.S. Wong

Northeastern University

2026-07-24机器人学习理论数据集/基准

这篇论文针对机器人语言操作中“更多数据仍不等于真正理解指令”的问题,指出微调策略会偏向颜色、物体等显著因素而忽视动词、大小等语义因素。作者提出FDR/FDH诊断因子偏置,并用结果指导示教数据分配;在六个基础策略、仿真和真机实验中,颜色最占优、动词和大小最弱,偏置感知采集可在更少示教下提升组合泛化。

GraphVid: Interactive Graph-Controllable Video Generation Figure 1
2026-07-24cs.CV

GraphVid: Interactive Graph-Controllable Video Generation

Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu, Adheesh Juvekar, Muntasir Waheed, Ismini Lourentzou

GraphVid: Interactive Graph-Controllable, University of Illinois Urbana-Champaign, Fig. 1: GraphVid enables controllable multi-object image-to-video genera-, Abstract. Controllable video generation remains challenging due to, GraphVid delivers strong controllability and video quality. Compared, erful paradigm for controllable video generation., PLAN Lab https://plan-lab.github.io/graphvid, Keywords: Controllable Video Generation · Scene Graphs, Recent work on controllable I2V generation has largely focused on trajectory-, Despite recent progress, existing approaches for controllable video generation, tions, trajectories, optical flows, or physics labels, which are expensive to obtain

2026-07-24视觉感知规划控制

GraphVid针对文本提示和轨迹控制难以精确描述多物体交互的问题,将单帧图像解析为可编辑的有向交互场景图,并用边感知图推理把关系转成视频扩散模型的条件 token,在冻结 DiT 上用 LoRA 适配。文中还构建约2.7万段带交互图的视频数据集;相较 Motion-I2V,FID/FVD最高降39.9%/37.6%,PSNR与SSIM也明显提升。

Synthetic data generation framework for quality control automation in gravure printing Figure 1
2026-07-24cs.CV

Synthetic data generation framework for quality control automation in gravure printing

Korota Arsène Coulibaly, Mohamed Hamlich, Khalid Hmali, Andrea Trombin

2026-07-24规划控制

针对凹版印刷质检中真实缺陷稀缺、人工标注昂贵且图案频繁变化的问题,论文提出按物理外观模拟褶皱、条纹、套印偏差等缺陷,并同步生成框/分割标注的合成数据框架。用7533张合成图训练RF-DETR后,在真实工业样本上达到80.9% mAP,但真实测试集规模与相对真实数据训练的增益来源文中未充分说明。

Self-Supervised Learning of Structured Dynamics from Videos Figure 1
2026-07-24cs.CV

Self-Supervised Learning of Structured Dynamics from Videos

Lukas Knobel, Andrew Zisserman, Yuki M. Asano

Fundamental AI Lab, UTN, VGG, University of Oxford

2026-07-24视觉感知

这篇论文针对视频表征中相机运动与物体运动被帧间变化混在一起的问题,提出在冻结图像 ViT 特征上训练结构化动力学模型 SDM,用未来特征预测把主导运动与残余动态分成两个递归 token,并结合真实视频自监督与 Kubric 弱监督。在 ProbeMotion 上,SDM 优于 CLS/平均池化等骨干基线,并在 7 个探针任务中有 3 个超过强监督 VGGT,说明冻结图像特征可被重组为较可解释的视频动力学表征。

Scene Parameter Saliency via Differentiable Light Transport Figure 1
2026-07-24cs.CV

Scene Parameter Saliency via Differentiable Light Transport

Linas Beresna, Eugene Fiume

2026-07-24视觉感知

论文针对可微渲染中的梯度长期只被优化器使用、难以帮助人理解场景参数影响的问题,提出将标量图像指标对几何、材质、光照等参数的反向梯度视为“度量显著图”。核心洞察是显著性沿物理光传输而非神经权重传播,可揭示多次反射导致的非直观敏感因素。实验显示眩光、平均亮度和感知评分在同一场景下给出明显不同的参数排序,说明影响因素依赖具体指标。

Visual Contrastive Self-Distillation Figure 1
2026-07-24cs.CV

Visual Contrastive Self-Distillation

Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di Fu

University of Maryland, College Park, University of California, San Diego, Duke University

2026-07-24视觉感知

这篇论文针对 on-policy 自蒸馏仍依赖外部教师、特权答案或视觉证据来制造教师-学生信息不对称的问题,提出 VCSD:在同一生成前缀下对比 EMA 教师在原图与内容擦除图上的 token 分布,用视觉内容引起的概率差来重塑原图教师分布并蒸馏给学生。实验在 ViRL39K 和七个视觉语言基准上显示,VCSD 在 Qwen3-VL 与 Qwen3.5 多个规模均优于匹配 OPSD,且不增加推理成本。

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation Figure 1
2026-07-24cs.CV

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

2026-07-24视觉感知

针对长时高分辨率视频生成中全 softmax Video DiT 计算随 token 数二次增长的问题,SANA-Video 2.0 用 3:1 的线性注意力与 softmax 锚点混合,并通过 AttnRes 将锚点更新跨层复用,以缓解纯线性注意力的表达瓶颈。模型从零训练到 5B/14B 规模,5B 在单 H100 上 480p 40 步采样达 VBench 84.30、耗时 13.2 秒,Sol-Engine 后 720p/5s 为 13.06 秒,显示主要收益来自注意力结构与系统优化的共同作用。

UnDA: Unpaired Domain Alignment for Cross-Modal Knowledge Transfer in Medical Imaging Figure 1
2026-07-24cs.CV

UnDA: Unpaired Domain Alignment for Cross-Modal Knowledge Transfer in Medical Imaging

Rafsan Jany, Shadab Tanjeed Ahmad, Ahsan Bulbul, Tahsinul Islam, Md Azam Hossain, Abu Raihan Mostofa Kamal

2026-07-24视觉感知

针对医学影像中成对多模态数据难获取、跨模态蒸馏易受模态差距和不确定源域预测噪声影响的问题,UnDA用训练期可移除的类token对齐模块、按置信度加权的最优传输和逐类ProtoNCE,在非配对批次间传递结构知识。实验覆盖BraTS 2023脑肿瘤T2-FLAIR到T1和MM-WHS MRI到CT分割,报告目标模态精度与边界指标持续提升,如Tumor Core HD95由29.1 mm降至12.4 mm。

Towards Robust Iris Recognition Through Occlusion Identification and Conditional Diffusion-Based Reconstruction Figure 1
2026-07-24cs.CV

Towards Robust Iris Recognition Through Occlusion Identification and Conditional Diffusion-Based Reconstruction

Kamrul Hasan, Mylene C.Q. Farias, Oleg V. Komogortsev

Texas State University, San Marcos, Texas, USA

2026-07-24视觉感知生成模型三维安全鲁棒

针对眼睑、睫毛、反光等遮挡会破坏虹膜纹理、直接匹配或只用可见区域不可靠的问题,本文把遮挡类型识别、基于遮挡类别条件的DDPM局部重建和VGG19-HPMNet识别串成流程。CASIA-Iris-Thousand合成遮挡实验中,重建使VGG19-HPMNet的EER由3.29%降至2.88%、Rank-1由93.22%升至94.47%;但评估依赖预定义合成遮挡,且相对部分强重建基线的统计优势文中未充分说明。

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing Figure 1
2026-07-24cs.CV

ElasticTTT: Prior-Preserving Test-Time Tuning for Video Editing

Yueyi Liu, Chi Zhang, Sen Cui, Miao Liu

2026-07-24视觉感知

该文针对视频扩散模型中测试时微调容易把模型过拟合到单个源视频的问题,指出其会导致文本条件失效和空间区域纠缠的“先验崩塌”。ElasticTTT通过目标分布正则、对比式CFG和异步噪声调度,在优化与采样两端保留生成先验并隔离编辑区域;实验称在单样本视频编辑中优于推理式、TTT式和训练式基线,并有人评与消融支持。

Boosting Robustness for All-Weather Self-Supervised Depth Estimation in Autonomous Driving Figure 1
2026-07-24cs.CV

Boosting Robustness for All-Weather Self-Supervised Depth Estimation in Autonomous Driving

Mengshi Qi, Xiaoyang Bi, Xianlin Zhang, Huadong Ma

2026-07-24安全鲁棒

本文针对自动驾驶中雨雾雪夜等场景会破坏自监督深度估计的亮度一致性假设、且雷达在相机视角下过稀的问题,提出用真实非配对全天候数据训练“天气专家”多教师,并以不确定性加权蒸馏,同时通过POV-BEV相机雷达融合利用更密集的BEV雷达点。实验显示其在RADIATE上AbsRel误差较SOTA降低26%,在nuScenes夜间降低23%。

GS-Agent: Creating 4D Physical Worlds With Generative Simulation Figure 1
2026-07-24cs.RO

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

University of Massachusetts Amherst 2 Genesis AI

2026-07-24生成模型强化学习

这篇论文针对文本到4D动态世界生成中物理一致性和可控性不足的问题,提出GS-Agent:用多智能体把资产选择、材质调参、场景布置、运动控制以及相机灯光配置拆解为可执行代码,并将物理引擎反馈纳入迭代。实验显示其在液体、软体和刚体交互场景中,相比视频生成模型和通用智能体基线更符合指令、物理更合理且控制更细。

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model Figure 1
2026-07-24cs.CV

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model

Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, Rengan Xie

State Key Laboratory of CAD&CG, Zhejiang University, North China Electric Power University, State Key Laboratory of CAD&CG, Zhejiang University Hangzhou China, North China Electric Power University Beijing China

2026-07-24生成模型三维

低分辨率纹理使大量旧 3D 资产难以复用,而直接套用自然图像超分会在 UV 接缝处产生不连续。Texture++ 将纹理超分转到多视角渲染空间,通过自适应视角选择、四叉树区域掩码与局部扩散超分,只更新需要增强的区域并合并回纹理图;实验显示其在细节恢复、接缝连贯性和定量指标上优于现有方法。

Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation Figure 1
2026-07-24cs.CV

Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation

Hyunmin Cho, Jaejun Yoo, Kyong Hwan Jin

2026-07-24视觉感知

本文针对坐标式隐式神经表示容易先拟合低频、细节恢复需更大模型的问题,提出权重共享的正弦递归块,并用谐波线谱解释反复展开如何扩展有效频谱。实验显示其在RGB图像重建中以更少参数和优化步数超过前馈INR基线,并在超分、NeRF和SDF任务上有较好迁移。

Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window Figure 1
2026-07-24cs.CV

Future Rendering $\neq$ Future Surface: A Benchmark and Dataset for Dynamic Surface Reconstruction Beyond the Observed Window

Yukun Shi, Minglun Gong

University of Guelph

2026-07-24数据集/基准三维

这篇论文针对动态三维重建通常只评估观测时间窗内效果、难以支撑 AR 与机器人预判未来几何的问题,提出 FutureSurf 基准:用解析运动和精确未来网格真值,在后 25% 时间窗以 Chamfer 距离评估未来表面。结果显示 DG-Mesh 等方法即使在原则上可预测的运动上仍有 2.7–6.6 倍未来误差缺口,且渲染质量与表面准确性相关性很弱。

CLUIE: Clustering-Aware Recurrent Propagation with Local Structural Compensation for Underwater Image Enhancement Figure 1
2026-07-24cs.CV

CLUIE: Clustering-Aware Recurrent Propagation with Local Structural Compensation for Underwater Image Enhancement

Kui Jiang, Zefan Feng, Laibin Chang, Yan Luo, Junjun Jiang, Xiaopeng Fan

2026-07-24视觉感知

本文针对水下退化在空间上不均匀、固定扫描式 RWKV 难以对齐相似退化区域的问题,提出 CLUIE:先用特征聚类动态重排 token,使递归状态沿语义和退化相关区域传播,再用伪暗响应调制的局部卷积补偿结构连续性。多组水下增强基准显示其在恢复质量与计算效率上具有竞争力,但硬聚类稳定性和物理可解释性仍有限。

SPDCN: Strip-based Deformable Convolutional Network for Steel Surface Defect Segmentation Figure 1
2026-07-24cs.CV

SPDCN: Strip-based Deformable Convolutional Network for Steel Surface Defect Segmentation

Zhongming Liu, Bingbing Jiang, Guangxin Wan, Xiang Zou

2026-07-24视觉感知

面向钢材表面裂纹、划痕等细长且方向不定的缺陷,论文指出普通卷积的方形感受野和固定采样网格难以贴合边界。SPDCN用模糊增强多尺度上下文模块处理尺度变化,并以水平/垂直条带卷积预测可变形卷积偏移,使采样沿缺陷主方向自适应变形。在公开钢材缺陷分割基准上优于多种方法,NEU-Seg达到89.60% mIoU,参数量为3.54M。

GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis Figure 1
2026-07-24cs.CV

GrainGS: Gradient-Decoupled Gaussian Splatting for Efficient Dynamic Novel View Synthesis

Jiahao He, Yihua Shao, Zhengkai Zhao, Pan Gao, Fei Ma, Jingcai Guo, Hao Tang, Nicu Sebe, Qi Tian

Nanjing University of Aeronautics and Astronautics, Nanjing, Jiangsu, China

2026-07-24优化算法三维

GrainGS针对动态3D Gaussian Splatting中局部运动表达、结构稳定性和模型紧凑性难以兼顾的问题,提出层级锚点脚手架结合逐高斯形变,并用静态预热与stop-gradient隔离形变梯度对canonical几何的干扰,同时以canonical-residual外观分解处理时变光照。实验在D-NeRF和DG-Mesh上显示其兼顾质量、实时渲染和存储,合成基准平均PSNR 36.98 dB、435.6 FPS、4.67 MB。

KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers Figure 1
2026-07-24cs.LG

KroQuant: Kronecker-Structured Block Transforms for Efficient Post-Training Quantization of Diffusion Transformers

Yann Bouquet, Alireza Khodamoradi, Kristof Denolf, Mathieu Salzmann

2026-07-24生成模型

这篇论文针对扩散 Transformer 在 W4A4 后训练量化中因激活离群值导致画质下降、且 AdaLN 使变换必须在线执行的问题,提出 KroQuant:用 32 维块内的 Kronecker 结构可逆变换替代简单通道缩放,并与 LoRaQ 权重校准结合。在 PixArt-Σ、SANA、FLUX.1-schnell 上,其 LPIPS/PSNR 多数优于 SVDQuant 和 LoRaQ,MI350 上量化 kernel 最高快 14%,但 FLUX 部分指标增益不一致。

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV Figure 1
2026-07-24cs.CV

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

2026-07-24视觉感知

面向无人机在高度、俯仰、横滚和视场连续变化下单目深度估计泛化不足的问题,DAPM将视角参数与地面参考深度分布建立几何耦合,并用IGD进行姿态监督和特征增强,结合PQB粗到细量化处理大尺度深度变化。作者还构建含4.2万张合成图像的UAPD数据集,实验显示其在深度与相机姿态估计上优于主流方法。

Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping Figure 1
2026-07-24cs.CV

Adaptive Identity Anchoring: Closed-Loop Keyframe Placement for Synthetic Paired Supervision in Video Face Swapping

Logan Robbins

2026-07-24视觉感知

论文针对视频换脸缺少真实成对监督的问题,指出现有 SyncID-Pipe 只在首尾帧注入身份,长间隔中身份和皮肤微纹理容易漂移。其核心是自适应身份锚定:用闭环评分找出身份最差帧并追加锚点,同时用真实视频频谱约束纹理。文中主要给出算法、数据过滤机制和可证伪实验设计,未充分报告实际训练增益或定量结果。

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach Figure 1
2026-07-24cs.CV

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

School of Artificial Intelligence, Beihang University, Center for the Applied Statistics, School of Statistics, Renmin University of China, School of Computer Science & Technology, Beijing Jiaotong University, School of Software, Center for the Applied, Statistics, School of Statistics, Renmin University of China, School of Computer Science and Engineering, Beihang University, School of Artificial Intelligence, Beihang University

2026-07-24三维

本文针对异构联邦场景中隐私保护提示调优的矛盾:单一共享提示会抹平可迁移知识,多专家又放大差分隐私噪声和通信开销。FedSEPT用低秩子空间分解共享专家、仅同步紧凑因子,并通过实例感知路由做logit级融合。11个异构基准显示,在相同隐私约束下,其本地适应与全局泛化权衡优于强基线。

GLAM-SLAM: Real-time Gaussian Large-scale Mapping via Flow Densification and Spatial Decomposition Figure 1
2026-07-24cs.RO

GLAM-SLAM: Real-time Gaussian Large-scale Mapping via Flow Densification and Spatial Decomposition

Panagiotis Mermigkas, Argyris Manetas, Petros Maragos

2026-07-24生成模型三维

GLAM-SLAM针对现有3D高斯单目SLAM难以同时支持长序列、实时性和低显存的问题,将ORB-SLAM2式稀疏跟踪与并行高斯建图解耦;其关键在于用基于光流和极线约束的锚点致密化缓解稀疏初始化不足,并按空间分区为局部场景配置MLP。作者在KITTI、Oxford RobotCar和Málaga长序列上报告重建质量较次优方法提升约15%,同时保持实时运行和更好的可扩展性。

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation Figure 1
2026-07-24cs.CV

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

Dongbin Na

2026-07-24视觉语言视觉感知

论文针对视觉语言助手流式生成中,基于推理链的安全护栏难以实时拦截有害回复的问题,提出不生成 CoT 的 ResponseGuard,用请求、回复和图像的 pooled 表征一次前向给出风险分数。结果显示,2B 模型在回复有害性检测上超过 3B 推理护栏,耗时约低 150 倍,并可逐句筛查并提前截断多数有害回答;但请求侧和图像-only 场景仍有差距,文中认为瓶颈更可能来自冻结视觉编码器而非缺少推理链。

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation Figure 1
2026-07-24cs.CV

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

Sung-Hoon Yoon, Hoyong Kwon, Changgyoon Oh, Kuk-Jin Yoon

2026-07-24视觉感知

这篇论文针对开放词汇语义分割中“CLIP有语义但定位粗、DINOv3定位强但缺文本对齐”的矛盾,提出用ODE把CLIP文本嵌入连续流向DINO视觉流形,并用STF、GCF分别处理文本语义和CLS全局上下文,辅以切空间速度投影保持超球面几何。实验称其在多个OVSS基准上超过现有方法并达到SOTA,但具体增益与DINOv3骨干能力的分离仍需看完整消融。

ASTRA-Net: Anatomy-Specific Transfer and Representation Alignment for Drug-Induced Sleep Endoscopy Segmentation Figure 1
2026-07-24cs.CV

ASTRA-Net: Anatomy-Specific Transfer and Representation Alignment for Drug-Induced Sleep Endoscopy Segmentation

Suhua Sun, Yuqiao Wang, Sheng Liu, Rui Fan, Jiajun Wang, Ruoyan Xu, Yixin Chen, Tao Li, Yan Yan

Department of Otolaryngology, Peking University Third Hospital, Beijing, China, Institute of Medical Technology, Peking University Health Science Center, Beijing, China, National Biomedical Imaging Center, College of Future Technology, Peking University, Beijing, China

2026-07-24视觉感知

针对DISE定量分析中真实像素标注稀缺、不同VOTE解剖层面气道边界难以稳定分割的问题,ASTRA-Net用CT虚拟内镜帧做ConvNeXt特征对齐,再以少量真实掩码训练分层UNet++解码器,并用零掩码约束无效或不匹配平面。100帧留出集上MMD集成Dice为0.8927、IoU为0.8239,平面分类准确率0.92;但缺少real-only基线,虚拟数据和对齐带来的增益来源不清。

Incremental Optimal Assignment for Real-Time Crowd Tracking Figure 1
2026-07-24cs.CV

Incremental Optimal Assignment for Real-Time Crowd Tracking

Ismail H. Toroslu

2026-07-24视觉感知

这篇论文针对密集人群多目标跟踪中逐帧轨迹-检测分配成为实时瓶颈的问题,利用人群簇导致的块稀疏代价矩阵,提出逐个加入目标的增量最优分配方法,并用已对上一子问题最优的对偶势进行热启动,配合对角重排减少无效扫描。实验在200到5000人合成/仿真人群场景中保持与匈牙利算法相同最优匹配,报告3.7到6.5倍加速;但真实检测器闭环与身份保持收益文中未充分说明。

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features Figure 1
2026-07-24cs.CV

Quality-Aware Multimodal Fusion Reveals Implicit Identity in Valence-Arousal Features

Jisu Kim, Benjamin S. Riggan

University of Nebraska-Lincoln

2026-07-24视觉语言

这篇论文针对非受控视频中表情、遮挡、光照和音频质量波动会削弱静态人脸识别的问题,提出将视听价效-唤醒度估计作为预训练任务,并用QAAF按样本估计各模态可靠性,通过软门控和质量相关 dropout 自适应融合。结果显示其在Aff-wild2上将平均CCC提升到0.472,缺失模态时更稳健;VA特征还在AFEW-VA和YTF上补充ArcFace,略降EER并修正部分误接受。

M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data Figure 1
2026-07-24cs.LG

M$^3$-Gen: Interpretable Multimodal Generation of Gene Expression Profiles Using Clinical and Imaging Data

Francesca Pia Panaccione, Carlo Sgaravatti, Marco Venere

2026-07-24视觉语言

针对基因表达数据昂贵、隐私敏感且难以与病理图像和临床信息配齐的问题,M3-Gen用对比学习对齐WSI切片与临床文本嵌入,再以注意力融合条件化WGAN-GP生成表达谱,并可追踪影响生成的图像区域。在TCGA十二类肿瘤上,作者报告生成结果在分布一致性和下游预测上较真实且具功能意义,但具体相对增益来源仍需更多消融支撑。

SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion Figure 1
2026-07-24cs.CV

SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion

Wenbin Duan, Yan Shu, Zhuoyuan Fu, Fangmin Zhao, Yan Li, Yaru Zhao, Binyang Li

2026-07-24生成模型规划控制

本文针对 FLUX 等 Rectified Flow 模型反演中线性离散求解误差累积、影响重建和编辑一致性的问题,提出从流形几何理解轨迹弯曲:弯曲并非单纯数值误差,而是约束潜变量留在数据流形附近的向心作用。SlerpFlow 将径向与角向动态解耦,用球面线性插值校正速度方向并缓存校正速度,在不增加函数调用、无需训练的情况下提升重建保真度和编辑语义对齐;但背景保持在部分指标上略弱于 FireFlow。

PC-Edit: Prompt-Contrastive Region Discovery and Region-Guided Editing Figure 1
2026-07-24cs.CV

PC-Edit: Prompt-Contrastive Region Discovery and Region-Guided Editing

Jian Zhang, Zhijun Zhang

School of Electronic and Information Engineering, South China University of Technology, Guangzhou, China, SD3 (Esser et al. 2024) and FLUX (Black Forest Labs 2024)., est Labs 2024) and KV-Edit (Zhu et al. 2025) can preserve, est Labs 2024) and KV-Edit (Zhu et al. 2025) achieve strong

2026-07-24视觉感知

PC-Edit针对无用户掩码的文本引导图像编辑中,物体替换容易定位不准、残留源物体或破坏背景的问题,提出在同一潜变量和时间步下对比源/目标提示的图像 token 注意力输出,分别发现源擦除区与目标生成区,并在区外注入源 K/V 特征。实验在 PIE-Bench 和含人工区域标注的 EditRegion-Bench 上显示,其在无需手工区域时取得更好的编辑质量、区域定位和背景保持。

Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning Figure 1
2026-07-24cs.CV

Unlearning Under Imbalance: Benchmarking Fairness in Multimodal LLM Unlearning

Lorenzo Orsingher, Thomas De Min, Massimiliano Mancini, Davide Talon, Elisa Ricci

2026-07-24视觉语言数据集/基准

本文关注多模态大模型在“被遗忘权”场景中的非均衡遗忘请求:若某些人口子群更频繁要求删除,常规遗忘会改变模型对群体的内部关联并放大偏见。核心贡献是构建可控的 FAIRGET VQA 基准,并提出用偏置感知 PCA 约束激活 steering 的 FAUN,在遗忘身份信息的同时抑制群体方向。实验显示 FAUN 在 FAIRGET 和 FIUBench 上兼顾遗忘、保留性能与公平性,DP 明显低于 SimNPO。

HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors Figure 1
2026-07-24cs.CV

HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors

Siyu Li, Kunyu Peng, Di Wen, Beiping Hou, Zhiyong Li, Kailun Yang

2026-07-24视觉感知

这篇论文针对自动驾驶拓扑建图中车道中心线缺少直接视觉标记、导致检测和连通关系推理不稳的问题,提出用层次化几何先验补足视觉线索:一方面从透视道路结构图中自适应筛选显式先验,另一方面约束中心线的方向、平行/垂直等隐式几何一致性。OpenLane-V2 上的中心线、车道段和鲁棒性实验显示,该模块可插入不同基线并带来稳定精度提升。

Flash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier Transform Figure 1
2026-07-24cs.CV

Flash EQ-Linear: Accelerating Equivariant Linear Layers via Group-wise Discrete Fourier Transform

Zhongchen Zhao, Jixin Wang, Qi Xie, Hui Lin, Lei Zhang, Deyu Meng, Zongben Xu

Xi’an Jiaotong University, The Hong Kong Polytechnic University

2026-07-24视觉感知

这篇论文针对等变网络“省参数但不省计算”的瓶颈,指出常用 EQ-Linear 的组循环权重本质上是在群维度做循环卷积,而非普通稠密矩阵乘法。作者用群维 DFT、卷积定理和实数 DFT 共轭对称性设计 Flash EQ-Linear,并实现前后向 CUDA 核;结果显示算子前向最高约 2 倍快于 PyTorch F.linear,Flash EQ-ViT/EQ-Swin 端到端最高约 1.7 倍加速,同时保持等变模型的精度和参数优势。

Detectors Learn the Wrong Thing: Shortcut-Resistant Adversarial Training Against Physically Realizable Attacks Figure 1
2026-07-24cs.CV

Detectors Learn the Wrong Thing: Shortcut-Resistant Adversarial Training Against Physically Realizable Attacks

Yuanhao Huang, Yilong Ren, Jinlei Wang, Xuesong Bai, Zheng Zhang, Haiyang Yu

2026-07-24视觉感知

针对物理可实现对抗纹理中检测器把“攻击纹理”误学成行人证据的问题,论文提出 InsCAT:用实例级对比约束让带纹理行人特征贴近干净行人、远离纯纹理负样本,并配合在线纹理优化维持攻击压力。实验覆盖多种纹理、数据集和检测器,渲染 nuScenes 攻击 AP 达 82.3%,较最强基线高 11.1 点,纹理误检率从 AT-Mix 的 46.9% 降至 7.3%,实物测试 F1 为 96.6%、FPR 为 1.8%。

Stokes-Informed Diffusion for Robust Linear Polarization Estimation Figure 1
2026-07-24cs.CV

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

Yidong Luo, Chenggong Li, Yuchao Feng, Boxin Shi, Junchao Zhang, Xin Yuan

2026-07-24生成模型安全鲁棒

这篇论文针对单张 RGB 图像估计线偏振时硬件依赖强、问题病态,尤其弱偏振区域 AoP 易失稳的问题,提出 GenPolar:不直接回归 DoLP/AoP,而是在 Mueller/Stokes 形式下按 RGB 通道预测 S1、S2,再解析得到偏振量,并用可观测性掩码监督 AoP。方法还通过多步扩散到一步生成器的蒸馏和 VAE 编码器 LoRA 适配降低推理成本与域偏差;在 RLP、DoFP 和混合数据上提升 DoLP 保真度、AoP 稳定性,并带来材料检测和去反射增益。

T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video Figure 1
2026-07-24cs.CV

T-STAR: A Large-Scale Benchmark for Spatio-Temporal Panoptic Scene Graph Generation in Satellite Video

Linlin Wang, Xue Yang, Zhihuang Zhou, Zhenyu Zhong, Ruiyuan Zhang, Yansheng Li

2026-07-24视觉感知数据集/基准

针对卫星视频现有数据集多停留在检测、分割和跟踪、缺少对象关系与时间语义的问题,T-STAR将任务推进到时空全景场景图生成,提供跨帧一致实例掩码、39类对象和70类关系标注,并覆盖380万余时空三元组。论文还给出统一基线框架以增强实例关联和关系预测,实验表明该基准能暴露自然视频方法迁移到卫星场景的不足,但具体增益来源可能主要来自数据规模与任务设定。

DART: A Degradation-Aware Recurrent Transformer for Archival Film Restoration Figure 1
2026-07-24cs.CV

DART: A Degradation-Aware Recurrent Transformer for Archival Film Restoration

Mikołaj Jastrzębski, Wojciech Kozłowski, Kamil Adamczewski

2026-07-24视觉感知

老电影修复难点在于划痕、灰尘、闪烁、模糊等复合退化与真实场景结构混杂,且缺少干净参考视频。DART的核心是显式预测并时序传播连续缺陷掩码,用其指导循环融合,并通过AdaLN-Zero按退化严重度调制Transformer,从被动重建转向损伤感知修复。实验称其在真实档案影片基准上提升无参考感知质量,同时模型较紧凑;但仍主要面向黑白 footage,且依赖光流精度。

Learning-based Seam Correspondence Reconstruction in Sewing Patterns Figure 1
2026-07-24cs.CV

Learning-based Seam Correspondence Reconstruction in Sewing Patterns

Zhendong Wang, Jintong Wang, Chen Liu, Yao Jin, Ligang Liu, Huamin Wang

Zhejiang Sci-Tech University, University of Science and Technology of China, Zhejiang Sci-Tech University Hangzhou China, University of Science and Technology of China Hefei China

2026-07-24三维

这篇论文针对数字服装纸样常缺少缝合标注、依赖人工专家才能转成3D服装的问题,提出从2D裁片几何直接恢复缝合关系的两级图学习框架:先用裁片语义和人体区域先验重建粗连接,再通过消息传递学习边表示预测细粒度缝线对应。实验显示其可处理多对一、曲线和裁片内缝合,在多类服装上获得较高缝合准确率和泛化表现。

Physics-Informed Deep Learning Model for Cross-Modality Super-Resolution in Fluorescence Microscopy Figure 1
2026-07-24cs.CV

Physics-Informed Deep Learning Model for Cross-Modality Super-Resolution in Fluorescence Microscopy

Mohammad Soltaninezhad, Elena Corbetta, Francisco Paez Larios, Paul M. Jordan, Oliver Werz, Christian Eggeling, Thomas Bocklitz

. Department “Photonic Data Science”, Leibniz Institute of Photonic Technology, Member of, Leibniz Health Technologies, Member of the Leibniz Center for Photonics in Infection Research, . Work group “Photonic Data Science”, Institute of Physical Chemistry (IPC) and Abbe Center, of Photonics (ACP), Friedrich Schiller University Jena, Member of the Leibniz Center for, . Institute of Applied Optics and Biophysics, Friedrich Schiller University Jena, Jena, Germany, . Leibniz Institute of Photonic Technologies Department of Biophysical Imaging, Jena, Germany, . Department of Pharmaceutical/Medicinal Chemistry, Institute of Pharmacy, Friedrich Schiller, University Jena, 07743 Jena, Germany, . Jena Center for Soft Matter (JCSM), Friedrich Schiller University Jena, 07743 Jena, Germany, evaluated using a limited paired confocal–STED dataset of TOM20-labeled mitochondria in human, for gentle, routine, and scalable imaging (4,5). As a result, there is strong motivation to develop

2026-07-24视觉感知

针对共聚焦到 STED 超分辨转换中纯数据驱动模型易产生不符合光学成像规律的细节,论文将显微镜 PSF 作为物理约束加入 GAN 损失,在仅 42 对线粒体图像上比较模拟与实测 PSF。结果显示适中 PSF 权重提升结构一致性、PSNR/MMSIM 和频域贴近度,但过强约束会退化,说明增益依赖权重与 PSF 设定。

Out of Sight, Still in Mind: Token Compression for Omni-LLMs Figure 1
2026-07-24cs.CV

Out of Sight, Still in Mind: Token Compression for Omni-LLMs

Suho Yoo, Youngjoon Jang, Hyebin Cho, Joon Son Chung

VGG, University of Oxford

2026-07-24视觉感知

这篇论文针对 Omni-LLM 推理中视觉 token 占比过高、注意力成本随序列长度急剧上升的问题,提出训练-free 的 ReMo:不是单纯删视觉 token,而是判断信息能否由音频或短文本代理承载,将音视频投到共享空间以去除音频可解释的视觉冗余,并用带位置的对象描述替代部分视觉语义。在 Qwen2.5-Omni 多尺度和多个音视频基准上,ReMo 压缩约 54% 输入 token,平均准确率仍达到或略高于全 token 模型。

Decoupling Cross-Modality Manifold Discrepancy: Leveraging Visible Diffusion Priors for Infrared Super-Resolution Figure 1
2026-07-24cs.CV

Decoupling Cross-Modality Manifold Discrepancy: Leveraging Visible Diffusion Priors for Infrared Super-Resolution

Yunpeng Hua, Hongwei Yu, Jiawei Li, Qiankun Liu, Huimin Ma, Jiansheng Chen

University of Science and Technology Beijing, University of Science and Technology Beijing Beijing China

2026-07-24生成模型

针对红外超分辨率中可见光扩散先验会带来模态分布偏差、且静态边缘约束难以控制逐步去噪轨迹的问题,论文提出冻结预训练扩散骨干的 Shift-IISR:用 GRM 从可见/红外成对潜特征中学习红外模态位移,并用 LSR 在每个去噪步注入结构线索。实验显示该方法在保持竞争性超分性能的同时,提升了全局分布一致性和局部结构保真度。

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA Figure 1
2026-07-24cs.CV

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

2026-07-24视觉感知

现有知识密集型 VQA 多只看最终答对率,难以判断错误来自视觉定位、实体识别还是检索推理。本文在 CRAG-MM 上加入目标区域、实体名和视觉复杂度等分阶段标注,构建 CRAG-MM-Diagnostics;分析显示主要瓶颈在知识检索与推理,同时 VLM 对非显著或冷门目标识别不足,检索器也难融合文本线索。基于目标裁剪的双模态 RAG 使 GPT-5 和 Qwen 准确率分别提升 13.3 和 8.5 个百分点。

DTIF: Robust Loop Closure Detection via Delaunay Triangle Topology in Complex Forests Figure 1
2026-07-24cs.CV

DTIF: Robust Loop Closure Detection via Delaunay Triangle Topology in Complex Forests

Xin Zhao, Jianping Li, Qin Zou, Fuxun Liang, Zhen Dong, Bisheng Yang

2026-07-24视觉感知安全鲁棒

面向林下 GNSS 缺失、多平台低成本 LiDAR 地图难以无初值融合的问题,DTIF 将树干视为稳定地标,用 Delaunay 三角拓扑替代易受噪声和遮挡影响的点级特征匹配,并把边长、半径一致性与强弱顶点支持转化为加权对应,再在重力对齐下解耦估计偏航、水平和高程平移。仿真与真实森林实验显示,其以较低计算开销实现较准确配准,适合资源受限边缘平台。

Safety-oriented sidewalk and road segmentation for smartphone-based assistive navigation Figure 1
2026-07-24cs.CV

Safety-oriented sidewalk and road segmentation for smartphone-based assistive navigation

Hakan Calim, Anamaria Dumitrescu, Adarsh Bhandary Panambur, Huzaifa Asif, Andreas Maier

2026-07-24机器人视觉感知安全鲁棒

面向盲人和低视力行人的手机导航,论文指出普通分割精度不足以衡量安全性,关键风险是把道路误判为可通行人行道。其贡献是构建胸前视角 SENSATION-DS 数据集、统一九类标签,并结合合成数据与 SAM2 伪标签做目标域适配,同时引入 Road-as-Sidewalk 错误率和 Android 端测速。结果显示合成数据提升总体 mIoU,SAM2 更稳定降低误安全错误;UPerNet-MobileNetV3 mIoU 最高,DeepLabV3Plus-MobileNetV3 错误率最低且手机端最快,但真实用户收益仍需验证。

Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents Figure 1
2026-07-24cs.CV

Causal-AgentIR: Self-Evolving Causal Memory for Adaptive Image Restoration Agents

Hu Gao, Yulong Chen, Lizhuang Ma

2026-07-24视觉感知

现实图像退化类型复杂且会随场景变化,现有修复智能体多依赖静态工具描述和反思回滚,难以沉淀长期经验。Causal-AgentIR的核心是把退化、区域、工具、动作、质量变化、成本和用户偏好组织为可自更新的因果记忆图,并由多智能体协作进行检索、推理、评估和记忆清理。文中称其在多类任务、真实场景和混合退化基准上验证了有效性与泛化性,但摘要片段未给出具体数值增益。

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results Figure 1
2026-07-24cs.CV

The Second LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

Xiang Chen, Hao Li, Jiangxin Dong, Jinshan Pan, Xin Li, Hongbo Ding, Junpeng Jiang, Xingyu Qiu, Yilian Zhong, Yuxiang Chen, Shibo Yin, Zixuan Huang, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Xiaodong Zhou, Qingyue Cao, Changwei Gong, Jingyun Liu, Xingchen Yi, Hansen Shi, Ruiyi Liu, Jirui Xie, Tao Liu, Wenzhuo Ma, Hongzhen Li, Yongyong Chen, Zheng Zhou, Jingyong Su, Jie Liu, Haijin Zeng, Cheng Li, Peishuai Zha, Ziyi Wang, Jian Tang, Yan Chen, Long Bao, Heng Sun, Jiyuan Zhang, Shuai Liu, Wei Ding, Chengjun Guo, Yibin Huang, Xiaotao Wang, Dongqing Zou, Lei Lei, Xiaofeng Wang, Xiao Liu, Yulin Wu, Yuhan Zhao, Shurui Peng, Chao Ren, Yu-Kai Wang, Kosuke Shigematsu, Asuka Shin, Rong-Lin Jian, Cheng-Jun Kang, Jin-Hui Jiang, Jialin Zhou, Kuo Yuan, Songyu Zhang, E B Benson, Ashfaq Hussain, Pruthvikanth AC, Qirui Chen, Jinyuan Chen, Jun Zhang, Xu Zhang, Xuhui Cao, Jiaqi Ma, Laibin Chang, Yuchun Miao, Yichu Xu, Yuanzhi Yao, Shi Chen, Yuning Cui, Huan Zhang, Lefei Zhang, Saeed Ahmad, Ik Hyun Lee, Jun Young Park, Ji Hwan Yoon, Shangquan Sun, Behrooz Nobahar-Moghanlou, Majid Edalatjou, Karim Shahi-Niyar, Ruibo Zhang, Dexiang Hong, Xinyan Liu, Shengeng Tang, Weidong Chen

2026-07-24视觉感知强化学习

本文面向真实成像中模糊、低光、雾、雨、雪等退化混杂且合成数据域差明显的问题,报告第二届 LoViF 全能图像复原挑战。核心价值在于用 FoundIR-LoViF 统一真实配对基准和 PSNR、SSIM、LPIPS 复合评分,对多退化共享建模能力进行可复现比较。158 人报名、20 队进入最终排名,结果总结了有效设计策略,但具体领先方法的增益来源在片段中未充分说明。

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models Figure 1
2026-07-24cs.CV

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, Zhonghai Wu

Peking University, Joy Future Academy, Peking University Beijing China, Joy Future Academy Beijing China

2026-07-24视觉语言

本文针对多模态大模型幻觉诊断仍停留在粗粒度检测、难以指导修正的问题,提出将幻觉片段定位、类型分类与可解释纠错建议统一建模,并构建 HalluScope-30K 与多粒度联合奖励训练 4B/8B 诊断模型。结果显示其在 MHALO 和自建细粒度分类基准上达到最好表现,完整诊断反馈还能将 Qwen3-VL-8B 与 LLaVA-1.5-7B 的纠错准确率显著提高,但增益可能部分来自数据规模与任务专门化训练。

Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance Figure 1
2026-07-24cs.CV

Loss Landscape Topology Reveals Why Simple Baselines are Competitive at 3D Point Cloud Segmentation Under Class Imbalance

Antonis Savva, Christos Kyrkou, Theocharis Theocharides

2026-07-24视觉感知三维

这篇论文针对3D点云语义分割中的长尾类别不平衡,检验2D视觉常用重加权和专用损失是否仍有效。核心洞察是从误差模式、决策边界和损失景观解释:不平衡程度会塑造优化拓扑,限制损失级改造的收益。实验在DALES和S3DIS、KPConv与RandLA-Net上显示,普通交叉熵通常仅落后专用方法0.8-3.3% mIoU,调参不当还会明显退化。

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models Figure 1
2026-07-24cs.CV

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

Peking University, Joy Future Academy, Peking University Beijing China, Joy Future Academy Beijing China

2026-07-24视觉语言

论文指出,多模态大模型在机器人操作、导航等场景所需的空间关系判断中,常因2D图像表征与真实3D结构不一致而产生关系幻觉,且现有免训练幻觉抑制方法改善有限。Geo3R的核心是先从单图提取任务相关物体和多坐标系几何证据,再用结构化几何卡片引导模型推理。三类场景、18项任务实验显示,该方法在多种MLLM上稳定提升,Gemini-3-Flash与Qwen3-VL-8B平均准确率分别提升7.06%和10.90%。

The RealDefocus Benchmark for Defocus Deblurring Figure 1
2026-07-24cs.CV

The RealDefocus Benchmark for Defocus Deblurring

Tim Seizinger, Zhuyun Zhou, Radu Timofte

2026-07-24数据集/基准

针对单图散焦去模糊缺少真实、高分辨率且协议统一的评测数据,论文将 RealBokeh 的多光圈采集反向组织为 RealDefocus 基准,提供 2.3 万对、4400 场景、f/2.0 到 f/20.0 的真实光学模糊与固定划分,并加入跨数据集验证。实验显示强散焦下现有方法差距明显,FFTFormer 等取得最高平均指标,但增益可能主要来自 scaling / data。

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs Figure 1
2026-07-24cs.CV

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

Jiameng Li, Han Zhou, Matthew B. Blaschko

2026-07-24视觉感知

这篇论文针对多模态大模型 PTQ 中通道量化误差与任务损失敏感性错位的问题,指出仅按激活幅值或模态、token 重要性做 channel-wise scaling 会保护错通道。C-PTQ 用对角 Fisher 近似 Hessian,把梯度方差作为通道级权重融入量化目标,在不引入 LoRA 等辅助模块的情况下,在 Qwen2.5VL、InternVL2、LLaVA-OV 的 8 个基准上报告了权重量化和权重-激活量化的 SOTA 表现。

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text Figure 1
2026-07-24cs.CV

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

Zhejiang University

2026-07-24生成模型

这篇论文针对空间任务中“用坐标或文字回答”与生成模型“以像素作答”的接口错位,提出 ProVisE:用受约束的可视化回答和解析器把生成图像转成原基准可评分的结构预测,并构建 SpatialGen-Bench。结果显示,图像生成模型在可直接标注区域、路径等像素空间答案时具竞争力,但在组合式空间推理上仍明显落后于文本输出 VLM。

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects Figure 1
2026-07-24cs.CV

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, College of Design and Innovation, Tongji University, Shanghai Institute for Intelligent Autonomous Systems, Tongji University, School of Software and Engineering, Huazhong University of Science and Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology Wuhan China, College of Design and Innovation, Tongji University Shanghai China, Shanghai Institute for Intelligent Autonomous Systems, Tongji University Shanghai China, School of Software and Engineering, Huazhong University of Science and Technology Wuhan China

2026-07-24强化学习数据集/基准

面向自动化生物实验室中透明耗材难以识别、分割和抓取的问题,TransBiolab将重复实例、遮挡杂乱和标定多视角采集统一进真实RGB-D数据集,提供15类物体、98场景、16万帧与百万级实例标注。基准显示现有分割、深度补全和6D位姿方法在透明物体的类别、几何、视角与拥挤度变化下仍有明显性能缺口,机器人实验也表明感知误差会传导到系统级操作成功率。

Counterfactual Explainability Framework With CycleGAN And Counterfactual-Classifier Alignnment Score for Retinal Disease Classification Figure 1
2026-07-24cs.LG

Counterfactual Explainability Framework With CycleGAN And Counterfactual-Classifier Alignnment Score for Retinal Disease Classification

Kritanu Chattopadhyay, Sayanjit Singha Roy, Soumya Chatterjee

Kritanu Chattopadhyay is with the Department of Mechanical Engineering, National Institute of Technology Durgapur, West Bengal, 713209, India.

2026-07-24生成模型

本文针对眼底病变分类模型虽准确但难以给出临床可解释依据的问题,提出 CounterFundus:用 CycleGAN 生成“病变到正常”的反事实眼底图,并以差分图定位病灶,同时用 CCAS 将 Spearman、IoU 和 pointing accuracy 合成评价其与 EigenCAM 证据的一致性。EfficientNet-B5 在锁定测试集达 95.38% 准确率、99.69% AUC,反事实样本具备一定结构相似性,CCAS 过滤增强还能提升分类表现。

Do Pathology Vision-Language Models Truly See Pathology? Figure 1
2026-07-24cs.CV

Do Pathology Vision-Language Models Truly See Pathology?

Chengyang Zhang, Wenchuan Zhang, Bo Li, Xinyu Liu, Jiaming Yang, Mengran Li, Chenxun Deng, Jie Chen, Yang Zhang, Wei Ju, Yuhao Yi, Hong Bu, Jiancheng Lv

2026-07-24视觉语言视觉感知

本文质疑病理视觉语言模型在VQA高分是否真的来自图像理解,而非文本先验或答案捷径。核心洞察是提出视觉依赖、领域训练带来的多模态增益与实体级视觉定位三类诊断维度,并构建含2600样本的PathBind。对18个VLM的评测显示,部分模型无图仍能取得较高准确率,病理微调提升答题表现却未同步提升视觉语义绑定,说明现有基准可能高估了真实病理视觉能力。

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement Figure 1
2026-07-24cs.CV

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

2026-07-24视觉感知

本文针对传统情感图像分析难以评估开放式 MLLM 视觉情绪理解的问题,提出将任务改写为情绪陈述判断 ESJ,并用 INSETS 构建 46.2 万样本语料和覆盖极性、解释、场景、主观性的 MVEI 基准,同时训练 EmObserver。实验显示 MVEI 能揭示现有模型细粒度短板,EmObserver 在多项 AICA 基准上取得更好准确性、泛化与推理一致性,但具体增益可能主要来自数据与训练流程。

Achieving Text-based Person Retrieval with Any Granularity Figure 1
2026-07-24cs.CV

Achieving Text-based Person Retrieval with Any Granularity

Jialong Zuo, Hanyu Zhou, Dongyue Wu, Yongtai Deng, Mengdan Tan, Nong Sang, Changxin Gao, Xiang Bai

2026-07-24视觉感知

论文针对文本行人检索中查询描述粒度不可控的问题,指出固定粒度训练与一对一评测会低估粗粒度查询下的合理多匹配。其创新在于定义五级粒度、构建 UFine6926-MG 与 MG-Eval,并提出 CMAM,用正交专家、概率跨身份对齐和粒度一致推理建模多粒度匹配。实验称其在各粒度上优于现有方法,但增益可能部分来自新数据与评测设定。

HyperImageNet: A Large-Scale High-Spatial Resolution Hyperspectral Imagery Classification Benchmark Figure 1
2026-07-24cs.CV

HyperImageNet: A Large-Scale High-Spatial Resolution Hyperspectral Imagery Classification Benchmark

Chuguang Zeng, Jingtao Li, Yinhe Liu, Yanfei Zhong

Wuhan University, labels, and object-level instance masks, supporting both, spatial resolution, and the labor-intensive annotation process, high-quality geometric segmentation masks from unlabeled, Regarding the construction of the labeling system, we, the United States Department of Agriculture (USDA) with, merely provide a single label modality, HyperImageNet, level semantic labels (TIF), and object-level instance masks, University[6], Center[6], of classification labels. The total number of categories in, fine-grained subcategory labels. Furthermore, to bridge

2026-07-24视觉感知数据集/基准

针对高质量高光谱遥感数据规模小、类别粗且缺少实例级标注的问题,本文构建 HyperImageNet:26084 个机载高空间/光谱分辨率图像块、224 个波段、138 类,并同时提供原始影像、像素语义标签和实例掩码。其核心价值在于用严格空间隔离的开放环境协议评估细粒度理解和 HyperFree 微调,结果显示该基准可支撑语义/实例分割与开放场景测试,但性能增益可能主要来自 data scaling。

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation Figure 1
2026-07-24cs.CV

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

2026-07-24视觉语言视觉感知

面向遥感图像解译中 LVLM 黑盒定向攻击研究不足的问题,GeoThreat 的核心洞察是同时约束全局语义与局部感知线索:用替代视觉编码器的 class token 做概念校准,并结合跨层注意力与目标相似度梯度筛选关键 patch,再跨注意力对齐目标局部语义。实验显示其在多类通用与遥感 LVLM 上提升了攻击迁移性和可控性,但具体增益的消融来源仍需结合完整结果判断。

Spectral-Spatial Synergistic Guided Network for Hyperspectral Salient Object Detection Figure 1
2026-07-24cs.CV

Spectral-Spatial Synergistic Guided Network for Hyperspectral Salient Object Detection

Yanyan Peng, Tingfa Xu, Yao Xiao, Peifu Liu, Shuyan Bai, Fengxiang Xu, Jianan Li

2026-07-24视觉感知

本文针对高光谱显著目标检测中光照等外因造成的谱变化易被误判为材料差异的问题,提出 S3GNet:用谱导数和超像素区域建模增强稳健谱表征,再通过谱-空流注意力协同融合与渐进门控解码恢复边界和小目标。实验称其在基准上优于现有方法,相比 Hyper-HRNet 的 Fβ 提升 10.8%,且参数量和 FLOPs 分别仅为其 33.0% 和 48.0%。

GroupVideo: Multi-Identity Customized Text-to-Video Generation Figure 1
2026-07-24cs.CV

GroupVideo: Multi-Identity Customized Text-to-Video Generation

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

2026-07-24视觉感知

这篇论文针对多人物定制视频中常见的身份混淆、表情僵硬和“复制粘贴”式运动问题,提出基于视频 DiT 的 GroupVideo。核心思路不是简单拼接多张人脸,而是用视觉与语义双重身份对齐、语义感知器和 ID 定位模块把人物身份、文本动作和空间位置关联起来,并配合人脸框约束、mask 正则和两阶段训练。实验称其在多角色身份保持与动作自然度上优于已有方法,同时构建了 2 万条多人视频数据集;但具体增益中模型设计与数据规模的贡献占比仍需进一步拆解。

WAT3R: Feedforward Underwater 3D Reconstruction Figure 1
2026-07-24cs.CV

WAT3R: Feedforward Underwater 3D Reconstruction

Jiayi Xu, Jiahao Lu, Ziqiang Zheng, Yihao Tan, Yaolong Zhu, Yuan Liu, Sai-Kit Yeung

The Hong Kong University of Science and Technology, The Chinese University of Hong Kong, Peking University

2026-07-24三维

WAT3R针对水下光衰减与后向散射破坏跨视角特征一致性、使传统SfM和逐场景优化难以可靠实时重建的问题,提出前馈式水下三维重建框架,并用UIFM物理退化合成、几何约束自监督和真实水下多视图重投影适配来缩小陆地下预训练模型的域差。实验在FLSea、SQUID、USOD10K上显示其在多视图/单目深度和相机位姿估计中优于现有方法。

ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning Figure 1
2026-07-24cs.CV

ProCap: Prominence-guided Object Rectification for Faithful and Comprehensive Video Captioning

Debjyoti Das Adhikary, Aritra Hazra, Partha Pratim Chakrabarti

The authors are with the Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur, Kharagpur 721302, India

2026-07-24视觉语言视觉感知

这篇论文针对视频字幕中大模型易遗漏显著物体或产生幻觉、而重训练成本高的问题,提出无需改动基座模型的 ProCap:先按空间显著性、时间持续性和关系动态为检测物体打分,再用迭代提示把高显著但缺失的物体补入字幕。作者在 MSVD、MSR-VTT 和 110 人主观评测中报告完整性最高提升 48%、幻觉最高降低 45%,但具体增益中检测器与提示策略各自贡献仍需更多消融说明。

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization Figure 1
2026-07-24cs.AI

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

Lihuang Fang, Yuchen Zou, kebin Jin, Jinghui Qin

Guangdong University of Technology, Southern University of Science and Technology, Xi’an Jiaotong University, Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University, Guangdong University of Technology Guangzhou China, Southern University of Science and Technology Shenzhen China, Xi’an Jiaotong University Xi’an China, Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University Guiyang China

2026-07-24视觉语言强化学习

这篇论文针对多模态情绪理解中固定提示难以处理稀疏、异步且模态依赖的情绪线索的问题,提出 EmoAgent-R1:先用合成 CoT 与路由数据冷启动,再通过路由代理选择专门情绪推理代理,并用带 PMI 渐进 token 调制的 P-GRPO 改善稀疏奖励的信用分配。实验称其在 MER-UniBench 上提升情绪推理表现与训练稳定性,但具体增益来源仍需结合消融进一步判断。

Explainable Deepfake Detection Challenge Figure 1
2026-07-24cs.CV

Explainable Deepfake Detection Challenge

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Usman Tariq, Jianfei Cai, Abhinav Dhall

Monash University, The University of Queensland, American University of Sharjah, Monash University Melbourne Australia, The University of Queensland Brisbane Australia, American University of Sharjah Sharjah United Arab Emirates

2026-07-24视觉感知

该文针对深度伪造检测只给真假标签、难以支持取证与内容审核决策的问题,提出ACM MM 2026可解释检测挑战:基于XPlainVerse同时评测图像真伪分类和面向技术/普通用户的两类自然语言证据说明,并引入语义、简洁性与实体/证据 grounding 指标。主要结果表明,检测准确率与解释质量是不同能力,强分类模型不一定能定位并说明正确视觉证据。

AUCH-Net: Action Unit-Based Consistency-Aware Hypergraph Network for Cross-Domain Few-Shot Facial Expression Recognition Figure 1
2026-07-24cs.CV

AUCH-Net: Action Unit-Based Consistency-Aware Hypergraph Network for Cross-Domain Few-Shot Facial Expression Recognition

Xinhan Qiu, Yan Yan, Rui Zhu, Si Chen, Hanzi Wang

Key Laboratory of Multimedia Trusted Perception

2026-07-24视觉感知

本文针对跨域小样本表情识别中源域基础表情与目标域复合表情差异大、标注样本少导致特征迁移弱的问题,提出以面部动作单元为语义桥梁的 AUCH-Net,通过一致性感知超图建模 AU 间高阶关系,并用关系一致性与 AU 正则约束提升可迁移表示。实验覆盖实验室与自然场景数据集,结果显示其相较多种现有 CF-FER 方法取得稳定优势。

Sparse Concept Channels in Frozen 3D CT Vision Encoders Figure 1
2026-07-24cs.CV

Sparse Concept Channels in Frozen 3D CT Vision Encoders

Farhad Nooralahzadeh, Lea Bogensperger, Christian Bluethgen, Michael Krauthammer

2026-07-24视觉感知三维

论文关注冻结三维CT视觉语言编码器的可解释性:临床发现究竟由哪些内部通道表示。作者提出无需训练的概念通道探针,按校准集选择性找出每个发现约10个稀疏通道,并用消融验证其因果作用。结果显示Top-10通道可接近或超过全维分类、优于零样本文本提示,并在Pillar-0与Merlin上复现;结合模板生成报告时,F1和BLEU优于CT-CHAT且延迟低22倍。

Latent Variable-Mediated Cross-Learning for Few-Shot Acoustic Impedance Imaging Figure 1
2026-07-24cs.CV

Latent Variable-Mediated Cross-Learning for Few-Shot Acoustic Impedance Imaging

Junheng Peng, Yong Li, Mingwei Wang, Yi Bao

2026-07-24视觉感知

这篇论文面向地震声阻抗成像中井日志标签极少、震源子波未知且信号带限导致反演病态的问题,提出 RD-SCL:把子波视为潜变量,用可微的频域一阶 Tikhonov 正则反卷积在训练中闭式估计,并在有标注与无标注道之间做对称交叉一致性约束。实验在 SEAM 和 Marmousi 2 上显示其优于多种监督和半监督方法,同时仅约 56.5k 参数、计算成本较低。

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving Figure 1
2026-07-24cs.CV

HyWorldVLA: A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving

Quanfu Yu, Xian Wu, Hao Xu, Liulong Ma

Automotive New Technology Research Institute, BYD Company Limited

2026-07-24视觉语言视觉感知强化学习

这篇论文针对自动驾驶 VLA 中像素级世界模型抗噪弱、纯潜空间模型缺少像素约束而表征退化的问题,提出 HyWorldVLA:预训练阶段同时预测视频 VAE 潜变量并重建帧,用像素监督约束潜表征;协同微调阶段只用潜特征驱动动作专家生成轨迹。NAVSIM v1/v2 实验显示其优于像素式和潜式基线,并补充了噪声鲁棒性评估。

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval Figure 1
2026-07-24cs.CV

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

2026-07-24视觉感知安全鲁棒

该文针对文本到视频检索中点向量匹配难以表达语义歧义和一对多对应的问题,提出 DAB 将文本与视频嵌入建模为高斯分布,并用确定性的扩散式桥接过程在均值和方差空间对齐,同时以 KL 散度做分布感知对比学习。实验在 MSR-VTT、MSVD、VATEX 上优于概率式和扩散式基线,并报告更好的不确定性校准与平均排名表现。

Unsupervised Metal Artifact Reduction in Dental CBCT using Fine-tuned Cycle-Consistent Adversarial Networks Figure 1
2026-07-24cs.CV

Unsupervised Metal Artifact Reduction in Dental CBCT using Fine-tuned Cycle-Consistent Adversarial Networks

G.L.T. Chamika, S.N.A. Dhanapala, P.H.S.V. Nimalaweera, Maheshi B. Dissanayake, Ruwan D. Jayasinghe

Department of Electrical and Electronic Engineering, University of Peradeniya, Peradeniya, Sri Lanka, Department of Oral Medicine and Periodontology, Faculty of Dental Sciences, University of Peradeniya, Peradeniya, Sri Lanka

2026-07-24视觉感知

针对牙科CBCT中金属种植体伪影会遮挡关键解剖结构、且监督式MAR难以获得严格配对数据的问题,本文采用微调CycleGAN进行无监督伪影去除,结合U-Net生成器、PatchGAN判别器和损失调节以减少结构幻觉。约4000张ToothFairy非配对图像实验显示BRISQUE提升34.6%、FID由207.03降至157.04、SSIM为0.9105,单切片推理约3.03 ms;但极端病例仍建议人机协同验证。

FSB-Net: Frequency-Spatial Boundary Network for Brain Stroke Lesion Segmentation in Non-Contrast CT Figure 1
2026-07-24cs.CV

FSB-Net: Frequency-Spatial Boundary Network for Brain Stroke Lesion Segmentation in Non-Contrast CT

Linke Fan, Xianglong Li, Huixin Huang, Kai Shu

2026-07-24视觉感知学习理论

这篇论文针对非增强 CT 中卒中病灶低对比、形态差异大和边界模糊导致分割不准的问题,提出 FSB-Net,将病灶边界视为特征频谱中的高频成分,用小波分解提取多尺度边界,再通过频率-空间交叉注意力和傅里叶域边界损失强化轮廓。实验称其在公开卒中 CT 数据集上优于 U-Net、UNet++、MANet 和 DeepLabV3+,在 Dice、IoU 与 HD95 上达到最佳。

RECO: Region-Aware Compensation for Extrinsic Perturbations in Roadside 3D Detection Figure 1
2026-07-24cs.CV

RECO: Region-Aware Compensation for Extrinsic Perturbations in Roadside 3D Detection

Junsheng Du, Zhaocheng He, Yuhuan Lu

2026-07-24视觉感知三维

RECO针对路侧单目3D检测对相机外参漂移和瞬时抖动高度敏感的问题,将外参修正建模为近、远区域的分段6DoF位姿补偿,并用可学习距离边界与sigmoid软门控保持BEV投影连续,再以2D/3D重投影辅助监督联合训练。实验在DAIR-V2X-I和Rope3D的yaw及z轴扰动、瞬时噪声到持久偏移设置下均提升鲁棒性,但真实部署中的长期多相机一致性仍需后续验证。

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention Figure 1
2026-07-24cs.CV

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

Brown University, Massachusetts Institute of Technology

2026-07-24视觉感知

面向交互式世界模型、虚拟化身等需要低延迟连续输出的场景,Ms. Forcing针对滚动扩散窗口中不同噪声状态仍按同一细粒度分词造成的冗余,提出按噪声级别固定调节patch尺度的MSP、匹配注意力密度的MSSA,并用H-DMD缓解训练序列与推理rollout不一致;在832×480、单H200上达到22.84 FPS,比Rolling Forcing快39.6%,同时提升短视频VBench并降低60秒质量漂移。

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer Figure 1
2026-07-24cs.CV

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

2026-07-24生成模型规划控制

MagicMakeup针对妆容迁移中区域控制易溢出、参考妆容与身份特征耦合、缺少高分辨率带区域标注数据的问题,提出基于DiT的框架:用Token-Aligned Region Gating把像素掩码对齐到注意力token并按区域门控,用Cross-Modal Perception Guidance区分应迁移的妆容属性和应保留的身份信息,同时通过1024×1024区域卸妆构造配对数据。实验显示其在区域可控性、妆容保真和身份保持上优于既有方法,并在风格、种族和姿态变化下较稳健。

FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head Figure 1
2026-07-24cs.CV

FA-LAM: Focus-Aware Large Avatar Model for One-Shot 4D Animatable Gaussian Head

Yingdong Hu, Yisheng He, Yiming Jiang, Zehong Lin, Steven Hoi, Jun Zhang

Tongyi Lab, Alibaba Group, Beihang University, Lingnan University

2026-07-24三维

FA-LAM瞄准单图生成可动画化高斯全头与单目视频4D重建中,细节模糊、大视角失真和流式输入开销高的问题。论文的关键洞察是注意力噪声与重建/动画目标梯度冲突会共同损害质量,因此引入语义与对称注意力正则、重建和动画解耦的双阶段训练,以及可见性门控的自回归融合。实验声称在细面部区域、大视角新视角合成和多视图/流式重建上优于既有方法,但具体增益可能部分来自扩展数据与生成侧视监督。

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos Figure 1
2026-07-24cs.CV

Sidewalk Moments: Are Richer Representations Always More Human-Aligned? Evidence from City-Walk Videos

Liu Liu, Freya Huying Tan, Fábio Duarte

2026-07-24视觉感知

论文针对城市步行视频中“更丰富的视频表征是否更贴近人类感知”的假设,比较视频特征、时间平均图像、文本和音频对观看热度的对齐。核心洞察是时间压缩并非信息损失:视频在连续排序相关上最高,但在高低参与度二分类和人工二选一验证中,时间平均图像常匹配或优于视频;视频更适合动态活动场景,TAI更适合稳定空间构图场景。

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing Figure 1
2026-07-24cs.CV

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

Graduate School of Information Sciences, Tohoku University, Japan

2026-07-24视觉感知

面向同时检测实体呈现攻击与数字伪造的人脸反欺骗场景,论文指出多模态 VLM 方案依赖文本编码器且计算开销大。DINO-VPT 在 DINOv2 上引入层级视觉提示树和轻量 PRN,按输入动态选择并注入提示以区分粗到细的伪造线索。在 UniAttackData 上其 ACER 明显低于既有 VLM 和视觉方法,MICO 跨域结果也保持接近传统视觉 SOTA。

MAGE-Vein: Multi-Instance Age and Gender Estimation from Finger Vein Images Figure 1
2026-07-24cs.CV

MAGE-Vein: Multi-Instance Age and Gender Estimation from Finger Vein Images

Katsuki Tanaka, Koichi Ito, Takafumi Aoki, Masakazu Fujio, Yosuke Kaga, Kanade Oshima, Kenta Takahashi

Graduate School of Information Sciences, Tohoku University, Japan., Hitachi, Ltd., Japan.

2026-07-24视觉感知

这篇论文针对指静脉年龄估计长期被认为不可靠的问题,指出失败可能主要来自公开数据集年龄分布偏置和性别血管差异混淆。MAGE-Vein 将同一受试者三根手指的特征做多实例融合,并联合优化年龄回归与性别分类,以抑制局部成像噪声、分离性别相关变化。在402人均衡数据集上达到6.12岁MAE和0.880相关系数,但数据规模仍有限。

Engine-Native Editable 3D World Reconstruction with Objects and Lighting Figure 1
2026-07-24cs.CV

Engine-Native Editable 3D World Reconstruction with Objects and Lighting

Junhao Chen, Xinghao Chen, Henghaofan Zhang, Zihao Qiao, Saining Zhang, Yongzhi Li, Ruqi Huang, Sisi Li, Yimin Sheng, Jianyi Zhu, Hao Zhao

Tsinghua University, Nankai University, University of Electronic Science and Technology of China, Sun Yat-sen University, Nanyang Technological University

2026-07-24强化学习三维

面向单图生成可在 Blender/UE5 中编辑的游戏级三维场景,论文指出现有方法缺少可操作的对象实例与引擎原生灯光表示。其核心是 Lumera 数据集与流程:从 UE5 项目监督预测 3D 框、语义标签和参数化灯光,再组装网格、HDR 环境与受限 agent 修正。结果显示物体检测/几何指标优于多种基线,但单灯定位 F1 仅 0.209,跨引擎泛化和光照强度仍是瓶颈。

WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing Figure 1
2026-07-24cs.CV

WhereEdit: Mask-aware Local Latent Editing for One-Step Image Editing

Ming Hu, Mingyu Dou, Jianfu Yin, Miaomiao Zhang, Cong Hu, Yao Wang, Bingliang Hu, Quan Wang

2026-07-24视觉感知

WhereEdit针对一步式文本图像编辑缺少“改哪里”的空间控制、且局部大幅语义改写强度不足的问题,指出既有方法的全局语义传输会削弱掩码内编辑能力。方法利用模型内部特征自动生成编辑区域,并通过局部自适应调制增强目标区域变化、抑制非目标区域扰动。PIE-Bench实验显示其在一步编辑方法中取得更好编辑质量,同时保持单步生成效率。

Webly Supervised Multi-Label Recognition: Evaluation Benchmark and Dual-Branch Multi-Label Contrastive Learning Figure 1
2026-07-24cs.CV

Webly Supervised Multi-Label Recognition: Evaluation Benchmark and Dual-Branch Multi-Label Contrastive Learning

Zhihua Xu, Zhijing Yang, Yufeng Yang, Tianshui Chen

2026-07-24视觉感知数据集/基准

这篇论文针对网页监督多标签识别缺少统一基准、且网页关键词标签同时存在漏标与误标的问题,构建 Web-COCO/Web-Pascal 并重实现多类基线;方法上用双分支对比学习同时建模类别特定的实例特征、类别原型及二者相似度,用于逐类别纠正噪声标签。实验显示 DBMLCL 在 mAP、OF1、CF1 上优于常规 MLR、弱监督方法和 CLIP 基线,但额外训练成本与网页检索偏差仍是限制。

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes? Figure 1
2026-07-24cs.CV

ViSTR-Bench: Can MLLMs Reason from Continuous Visual Cues in Dynamic Scenes?

Han Li, Si Liu, Zehao Huang, Dongxin Lyu, Longfei Xu, Jiahui Fu, Daxin Tian, Yuliang Xiu, Naiyan Wang

Han Li is with the School of Artificial Intelligence, Beihang University, Beijing 100191, China, and also with the Zhongguancun Academy, Beijing 100094, China.

2026-07-24视觉感知

这篇论文针对现有多模态模型评测偏静态、偏数值预测,难以检验连续视觉线索下动态空间推理的问题,提出 ViSTR-Bench:以定性二选任务评估运动感知、空间关系、结果预测和物理动态。基准包含 15 个子任务、1340 个视频问答,覆盖桌面、室内外场景;对多类闭源、开源和空间专用 MLLM 的测试显示,当前模型在细微运动、复杂关系和时间线索整合上仍显著落后于人类。

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation Figure 1
2026-07-24cs.CV

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

Z. Yang, T. Chen, and H. Lin, are with the Guangdong University of Technology, Guangzhou, China, Z. Xu, K. Wang, and L. Lin are with Sun Yat-sen University, Guangzhou, China, H. Li is with the South China University of Technology, Guangzhou, China

2026-07-24视觉感知

该文针对室内布局生成常把墙、门、窗等建筑结构当作隐含约束,导致碰撞和不可用的问题,提出由生成、评估、修正代理组成的 Agentic Designer,并用逐步共识机制在每次家具放置前做几何校验与迭代修正;同时构建含 1.8 万余标注样本的 InStruct 基准。实验、定性分析和用户研究显示,其在结构遵循和功能连贯性上优于现有方法。

Explainable graph attention network for stress recognition (StressGAT) via differential action units Figure 1
2026-07-24cs.CV

Explainable graph attention network for stress recognition (StressGAT) via differential action units

Thomas Kassiotis, Stefanos Gkikas, Nikolaos Smyrnis, Giorgos Giannakakis

2026-07-24视觉感知

这篇论文针对视觉压力识别中个体中性表情差异、压力随时间累积以及黑箱模型难解释的问题,提出 StressGAT:用相对个人基线的差分面部动作单元建模,并以有向时序图注意力捕捉非线性变化,结合 MIL 注意力定位高压片段和关键 AU。在 58 人压力诱导数据上,LOSO 评估达到 88.62% 准确率、0.89 F1,但相对各模块的独立增益来源仍需更多消融支撑。

SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization Figure 1
2026-07-24cs.CV

SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization

Jiun Lee, Jaekwang Kim, Sangmin Lee

2026-07-24三维

这篇论文针对像素对齐 3D Gaussian Splatting 在高分辨率新视角合成中面临的质量与计算成本矛盾:提高输入分辨率会使骨干网络开销近似二次增长,低分辨率输入又会导致高斯密度不足和伪影。SubSplat 的核心是用 SPGR 将低分辨率网格上的主高斯重参数化为多个子像素高斯,并结合多视角特征聚合和透明度重分配来补回结构细节。RealEstate10K 和 ACID 实验显示其在 2x、4x 输出尺度上优于 MVSplat 等基线,论文称相对全分辨率方案可获得超过 3 倍延迟降低。

Ocular Verification for Virtual Reality Figure 1
2026-07-24cs.CV

Ocular Verification for Virtual Reality

Husanpreet Singh, Robert Tran, Ayushree Kharel, Sudipta Banerjee

2026-07-24视觉感知

这篇论文关注 VR 头显中虹膜/眼周生物认证在非受控采集下失效的问题,系统评估 ISO 虹膜质量指标在 VRBiom 上的适用性,并用几何校正与生成模型处理偏轴视线、反光和不均匀照明。结果显示部分质量指标不适合 VR 数据,图像调整主要提升眼周识别,多模态分数融合相较单独虹膜识别将 EER 降低约 11%。

3D-GIMP: When 3D Gaussian Inpainting Meets PatchMatch Figure 1
2026-07-24cs.CV

3D-GIMP: When 3D Gaussian Inpainting Meets PatchMatch

Xuening Tian, Dieter Schmalstieg, Shohei Mori

University of Stuttgart, University of Stuttgart Stuttgart Germany

2026-07-24三维

这篇论文针对3D Gaussian Splatting中物体移除依赖逐视角扩散补全带来的计算开销、细节变糊和多视角幻觉漂移问题,提出3D-GIMP:只在一个参考视角做生成式补全,再用结合深度补全的3D感知PatchMatch把纹理对应传播到其他视角。实验表明其补全质量可接近多视角扩散方法,同时在渲染速度、跨视角一致性和可扩展性上更优。

Rethinking Open-World Video Anomaly Detection: Diagnosing Definition Blindness Figure 1
2026-07-24cs.CV

Rethinking Open-World Video Anomaly Detection: Diagnosing Definition Blindness

Inpyo Song, Jangwon Lee

2026-07-24视觉感知强化学习

这篇论文指出开放世界视频异常检测不能只看是否找到异常片段,而应检验同一视频在不同异常定义下的时序打分是否随之改变。作者诊断出现有指标被“目标异常 vs 正常”主导,提出 DC-Disc、DC-DetΔ、DC-SelΔ 三个定义条件评测,并用 DeCoS 扣除跨定义共享的异常证据。在 UCF-Crime、XD-Violence 和 MSAD 上,多种强基线暴露出定义盲视,DeCoS 在相关指标上带来显著 AUROC 提升。

A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation Figure 1
2026-07-24cs.RO

A real-time RGB-D perception pipeline for autonomous impact hammers in mining: self-filtering, rock segmentation and rock-breaking poses generation

Martín Gallegos, Francisco Leiva, Patricio Loncomilla, Michelle Cortés, Javier Ruiz-del-Solar

2026-07-24视觉感知三维

面向矿山破碎锤仍依赖远程人工、易受视野和调度瓶颈限制的问题,论文提出实时 RGB-D 感知流水线:结合机器人自过滤、深度背景建模、点云聚类与图像实例分割,生成无机器人干扰的三维场景和满足运动/作业约束的破岩位姿。系统在缩比真实场景和 Jetson AGX Orin 上约 10 Hz、总延迟约 675 ms,并完成闭环验证,显示可支撑自主破碎锤操作。

U-CFR: Uncertainty-Guided Cascade Forward Refinement for Interactive Segmentation Figure 1
2026-07-24cs.CV

U-CFR: Uncertainty-Guided Cascade Forward Refinement for Interactive Segmentation

Elijah Danquah Darko, Min Xian, Terence Soule, Tiankai Yao, Matthew William Anderson

Department of Computer Science, University of Idaho, Idaho National Laboratory

2026-07-24视觉感知安全鲁棒

论文针对交互式分割在复杂边界、小目标和细结构上需要反复人工修正的问题,提出 U-CFR:在推理阶段融合分割不确定性、轮廓梯度和边缘预测,自动生成面向模糊边界的伪点击,并用分割/边缘双头网络级联细化掩码。实验称其提升初始掩码和边界精度,在 Berkeley 等困难数据集上将所需点击数降低超过 10%,但具体增益中各组件贡献仍需结合消融进一步判断。

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation Figure 1
2026-07-24cs.CV

DS@GT ARC at ImageCLEFmed GANs 2026: Geometric Filtering for Privacy-Preserving CT Slice Generation

Eric Regina, Richard Arnaud, Samir Hadi Cisneros

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332

2026-07-24视觉感知生成模型

这篇论文面向医学 CT 合成数据中的隐私泄露问题,采用 OT 条件流匹配生成肺部切片,并在生成后用自编码器潜空间、DPP 与 Stein Kernel Thinning 做几何筛选。结果显示,100 轮训练模型在隐私与保真间最均衡,PPS 0.549、FID 0.3290;筛选版本 FID 最优至 0.2639,但患者重识别泄露仍接近满分,说明降低近邻复制并不足以消除身份风险。

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis Figure 1
2026-07-24cs.CV

Spatially Grounded Concept Bottleneck Models for Trustworthy Breast Ultrasound Diagnosis

Moshiur Rahman Tonmoy, Dunren Che, Haitham Y. Adarbah, Afzel Noore

2026-07-24视觉感知

这篇论文针对乳腺超声 CBM 虽可解释但概念激活可能落在无关区域的问题,提出 SG-CBM:用病灶粗分割生成病灶内 ROI 与后方声学带,对不同概念施加分组空间约束,同时保持线性概念瓶颈。五折验证中诊断 AUROC 从 0.869 提升到 0.892,概念预测与空间对齐也改善,并通过标注腐蚀实验显示监督质量会显著影响可信性。

ODeform: Learning Continuous 4D Motion for Shape Deformation with Neural ODEs Figure 1
2026-07-24cs.CV

ODeform: Learning Continuous 4D Motion for Shape Deformation with Neural ODEs

Yordanka Velikova, Mahdi Saleh, Liming Kuang, Benjamin Busam

Technical University of Munich 2 Munich Center for Machine Learning (MCML)

2026-07-24视觉感知

面向机器人操作中需实时预测柔性物体连续形变的问题,ODeform将点云几何与材料等物理条件编码到统一潜空间,并用神经ODE学习连续4D动力学,以避免离散时间步带来的中间状态不一致和仿真开销。实验显示其在未见物理参数上优于基线,并可迁移到真实3D采集的新形状,支持插值与外推。

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion Figure 1
2026-07-24cs.CV

Axolotl3D: a Unified Framework for Faithful 3D Shape Completion

Anita Hu, Maria Shugrina

2026-07-24三维

这篇论文针对现有图像到三维生成方法依赖单视角、完整可见输入,难以处理遮挡、多视角重建和几何编辑的问题,提出 Axolotl3D:用图像、可见性掩码、相机参数和部分点云共同约束扩散式三维补全,将点云作为几何锚点、相机用于跨视角对齐,并通过合成多种观测缺失情形统一训练。实验在 Toys4K 和 OmniObject3D 的干净与遮挡设置下优于已有方法,也展示了真实重建和几何一致编辑能力。

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics Figure 1
2026-07-24cs.RO

PhysCoRe: Physics-Corrected Residual World Models for Material-Aware Deformable Dynamics

Haocheng Yin, Shuohan Tao, Yongsheng Chen, Lu Gan

Georgia Institute of Technology

2026-07-24强化学习

面向机器人对可变形物体的操作预测,PhysCoRe试图解决传统物理模型需逐物体标定、纯学习模型又缺乏物理约束的问题。其核心是在可微MPM仿真器中加入材料运动估计MfM和动力学残差校正RfD,从视觉交互中推断逐粒子材料并修正仿真偏差。真实弹性与弹塑性操作序列上,模型预测精度优于现有物理和学习基线,置信度分布也与可识别区域相关,但跨类别泛化和更复杂材料仍未充分验证。

Masked Topology Modeling for Self-Supervised Learning on Parametric CAD Figure 1
2026-07-24cs.CV

Masked Topology Modeling for Self-Supervised Learning on Parametric CAD

Heinrich Jiang, Jennifer Jang

2026-07-24视觉感知

针对原生可编辑 B-rep CAD 数据稀缺、标注成本高的问题,本文把 CAD 面邻接关系作为自监督信号,提出 Masked Topology Modeling:遮蔽图边并预测边的凸凹性与曲线类型,再结合 MoCo 对比学习、连通面区域重建和合成 B-rep 预训练数据。实验称在 F360、SolidLetters、MFInstSeg 达到 SOTA,在 CadSynth 低标注设置下接近或匹配近期方法,但部分收益可能来自额外合成数据与模型规模。

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring Figure 1
2026-07-24cs.CV

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

2026-07-24视觉感知生成模型强化学习

现实视频去模糊在相机抖动、物体运动和离焦混合时容易失效,且会影响移动影像和三维重建。RealVDeblur的核心是把大规模3DGS与高帧率视频合成数据、视频扩散先验结合,并通过逐帧VAE编码、一 步蒸馏和Temporal Window Mask提升长视频推理稳定性。实验显示其在真实基准上获得更好的感知质量、语义一致性和时序稳定性,并改善严重模糊下的3D重建鲁棒性。

Detecting Neural Network Failures through Spectral Analysis of Internal Activations Figure 1
2026-07-24cs.LG

Detecting Neural Network Failures through Spectral Analysis of Internal Activations

Arunan J

2026-07-24视觉感知

针对神经网络在分布偏移或对抗扰动下可能高置信误判、而输出置信度难以识别的问题,论文提出监测层间内部激活的频谱漂移,用 STFT、小波和统计量训练轻量检测器 SDNN。CIFAR-10 上 AUROC 为 79.0±25.3%,高于 MaxSoftmax 和 Energy Score 的约 50%水平,但训练方差很大,STFT 增益来源不清,泛化到其他架构和数据集文中未充分说明。

CT-Merging: Consensus Directions and Task-Level Scaling for LoRA Adapter Merging Figure 1
2026-07-24cs.LG

CT-Merging: Consensus Directions and Task-Level Scaling for LoRA Adapter Merging

Keumseo Ryum, Joonhyuk Kang

2026-07-24视觉感知

这篇论文针对多任务部署中每个任务保留一个 LoRA adapter 带来的存储与路由成本,指出现有 SVD 合并在重构新基后直接沿用原奇异值会产生系数幅度失配。CT-Merging 用任务子空间投影的平均值提取共识方向,并以任务级 RMS 能量缩放替代逐秩奇异值复制。在 DC-Merge/KnOTS 的 CLIP adapter 基准上,其平均归一化准确率多数设置优于基线,ViT-B/32 和 ViT-L/14 分别较 DC-Merge 提升 2.56 与 1.51 点。

StrideDiffusion: Accelerating Diffusion Models for Time-series Generation Figure 1
2026-07-24cs.AI

StrideDiffusion: Accelerating Diffusion Models for Time-series Generation

Du Yin, Estrid He, Julián Jerónimo Bañuelos, Yang Yang, Feng Hu, Yuchen Luo, Hao Xue, Stephan Sigg, Flora Salim

Aalto University

2026-07-24生成模型

本文针对时间序列扩散模型推理需数百到上千步、难以低延迟部署的问题,提出无需训练的 StrideDiffusion。其核心洞察是反向去噪中不同频段活跃程度不同,因而用相对能量、功率漂移和相位速度自适应选择步长:高频活跃时细步,低频稳定后大步跳跃。实验显示无条件生成仅需 14-66 次函数评估,可达 18.9 倍加速;插补和预测也有 5-14 倍加速且精度相近。

A Graph Neural Network approach to zero-shot Digital Twins Figure 1
2026-07-24cs.LG

A Graph Neural Network approach to zero-shot Digital Twins

Alicia Tierz, Icíar Alfaro, David González, Elías Cueto

Aragon Institute of Engineering Research (I3A). Universidad de Zaragoza. Zaragoza, Spain.

2026-07-24视觉感知

论文针对传统数字孪生在新几何、边界条件下需重训的问题,提出把实时视觉分割/光流与热力学约束的图神经网络 Local-TIGNN 结合,用辅助 GNN 从稀疏视觉边界推断不可观测场,并通过闭环数据同化抑制滚动误差。实验覆盖黏弹性梁大变形和黏性流体晃荡,显示可在未见几何上零样本生成物理仿真,延迟约 25 ms/帧,但与强基线的定量增益文中片段未充分说明。

2026-07-23

88 篇
ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion Figure 1
2026-07-23cs.CV

ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token Expansion

Cho In, Jeonghwan Cho, Mijin Yoo, Gim Hee Lee, Seon Joo Kim

Yonsei University, National University of Singapore, Yonsei University South Korea, National University of Singapore Singapore

2026-07-23三维

现有前馈 3DGS 多按输入像素生成高斯,容量随分辨率和视角数增长,难以像优化式 3DGS 那样把表示集中到复杂区域。ATSplat 以稀疏 3D anchor token 构建场景骨架,用相对 3D 偏移生成局部高斯,并通过受渲染误差监督的不确定性预测自适应扩展高难区域 token。RealEstate10K 和 DL3DV 上达到 SOTA 质量,同时高斯数量减少 5.7 倍以上,12 张 512×960 输入下重建低于 1 秒、311K 高斯渲染达 1136 FPS。

PercepCap: Video Captioner with Structured Spatio-Temporal Perception Figure 1
2026-07-23cs.CV

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

State Key Laboratory for Novel Software Technology, Nanjing Univerisity, Shanghai AI Laboratory

2026-07-23视觉语言视觉感知

这篇论文针对视频字幕模型把时空感知隐含在最终文本中、难以定位和监督感知错误的问题,提出 PercepCap:先生成包含目标轨迹和事件时间段的结构化感知链,再据此写字幕。训练上结合 PD-SFT、PG-RL 和从字幕反向锚定目标/事件的数据构造,使感知证据与描述对齐;在 DREAM-1K、CaReBench、VidCapBench 及 ShortVidBench、MotionBench 上均优于 Qwen3-VL 基线。

Persian Pixel: A large-scale synthetic OCR dataset for Persian language Figure 1
2026-07-23cs.CV

Persian Pixel: A large-scale synthetic OCR dataset for Persian language

Pouria Mahdi, Haq Nawaz Malik

The Persian Pixel dataset is publicly available at

2026-07-23数据集/基准

本文针对波斯语 OCR 受连写字形、上下文变体、Naskh/Nastaliq 字体差异和标注数据稀缺制约的问题,提出 Persian Pixel 合成数据集。其核心做法是用 SynthOCR-Gen 从七百万词语料生成句子、段落和整页级图文对,并加入二十余种扫描退化以缩小合成到真实差距。主要结果是公开 34.3 万余个带精确标注和元数据的样本,可用于微调 TrOCR、Donut 等模型;但文中未充分说明其带来的实际识别性能增益。

Self Gradient Forcing: Native Long Video Extrapolation Figure 1
2026-07-23cs.CV

Self Gradient Forcing: Native Long Video Extrapolation

Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan

Joy Future Academy, JD

2026-07-23视觉感知优化算法

这篇论文针对自回归视频扩散在长时生成中身份、布局和时间一致性逐步漂移的问题,指出 Self Forcing 虽使用自生成历史,却因冻结历史 KV 缓存而缺少未来损失对“记忆写入”的监督。作者提出 SGF,通过无梯度串行 rollout 记录状态,再并行重算上下文 KV 与因果注意力,补回受限的上下文梯度路径。实验显示其在 5 秒窗口训练下可外推到分钟级视频,并在 60 秒、240 秒上较 Self Forcing 改善主体一致性、背景布局和稳定性。

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs Figure 1
2026-07-23cs.CV

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

2026-07-23视觉语言

这篇论文针对多模态大模型推理成本固定、难以随输入复杂度和运行预算调整的问题,提出 SmartVL:把视觉 token 保留量与 LLM 层/头计算量放到同一预算条件下联合调度,而不是分别剪枝或跳层。核心洞察是视觉信息密度会影响后续语言模型所需推理容量。实验显示其在 VQAv2、TextVQA、VizWiz 等基准上取得更好的准确率-效率 Pareto 前沿,50% FLOPs 下相对 AdaLLaVA 有明显收益。

Test-Time Training for Modality Order Consistency in Vision-Language Models Figure 1
2026-07-23cs.CV

Test-Time Training for Modality Order Consistency in Vision-Language Models

Aditi Gupta, Yossi Gandelsman

University of Chicago

2026-07-23视觉语言视觉感知

这篇论文关注视觉语言模型对图像与问题输入顺序的异常敏感性:语义不变的顺序交换会造成显著准确率差异。作者将更稳定的图像优先分支作为教师,在测试时用 KL 目标修复问题优先分支,并用激活 patching 将失效定位到中层网络。实验显示该方法在多模型、多数据集上明显缩小顺序差距,且部分提升图像优先性能,但推理成本增加,开放式任务验证仍不足。

Toward Reliable RGB-D Semantic Segmentation: Handling Missing Modalities via Condition Dropout Figure 1
2026-07-23cs.CV

Toward Reliable RGB-D Semantic Segmentation: Handling Missing Modalities via Condition Dropout

Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren

2026-07-23视觉感知

这篇论文关注 RGB-D 语义分割在真实部署中常见的传感器失效问题:模型若只在 RGB 与深度齐全时训练,缺失任一模态会明显崩溃。作者提出 Condition Dropout,在预训练模型上冻结原编码器,复制可训练编码器,并随机模拟完整、缺 RGB、缺深度输入,通过零初始化特征注入做二阶段适配。NYU-Depth V2 和 SUN RGB-D 实验显示,该方法显著提升缺失模态鲁棒性,同时基本保持甚至略微提高完整模态精度,但推理参数、显存和延迟开销增加。

Evolving Cache Schedules for Fast Diffusion Policy Inference Figure 1
2026-07-23cs.CV

Evolving Cache Schedules for Fast Diffusion Policy Inference

Siying Wang, Kangye Ji, Di Wang, Fei Cheng

2026-07-23生成模型强化学习

扩散策略在机器人闭环控制中表现强,但多步去噪带来较高实时推理开销。论文指出不同 Transformer 块和时间步的缓存冗余并不均匀,并将缓存刷新建模为全局块-时间步调度问题,用进化搜索、冗余感知初始化和目标早停寻找免训练缓存方案。实验称在多项操作基准上基本保持 DP-T 性能,同时最高获得约 8.05 倍动作生成加速,FLOPs 从 15.77G 降至 1.96G。

Diverse-Intent Multi-Turn Fashion Image Retrieval Figure 1
2026-07-23cs.CV

Diverse-Intent Multi-Turn Fashion Image Retrieval

Mingqiang Tang, Haokun Wen, Meng Liu, Yupeng Hu, Weili Guan, Xuemeng Song

2026-07-23视觉感知

论文针对真实购物中多轮检索意图会在属性修改、同款换视角、搭配查找等任务间切换的问题,指出现有方法过度依赖单一属性编辑和文本化中介,易丢失细粒度视觉线索。作者构建含26K会话、7类任务和回退行为的DIM-Fashion,并提出直接对齐多模态对话查询与服饰图库嵌入的FashionAM;实验显示其在DIM-Fashion及MT-FashionIQ上优于既有方法。

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose? Figure 1
2026-07-23cs.CV

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

Qiwei Ma, Chunping Qiu, Xinjun Cheng, Xiaoyu Zhang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

2026-07-23视觉语言视觉感知三维

本文针对遥感图像场景理解中,领域专用多模态大模型是否仍优于通用视觉语言模型这一问题,系统梳理RS-MLLM技术路线并做诊断比较。核心洞察是专用模型在视觉定位、高分辨率VQA等任务仍有优势,但通用CV-MLLM无需遥感微调也能在多项任务匹敌甚至超过它们;主要瓶颈仍是空间关系推理、细粒度理解、指令多样性和跨任务泛化。

Self-supervision drives representational convergence in medical foundation models more than clinical supervision Figure 1
2026-07-23cs.CV

Self-supervision drives representational convergence in medical foundation models more than clinical supervision

Soroosh Tayebi Arasteh, Sebastian Ziegelmayer, Mahshad Lotfinia, Lisa Adams, Sven Nebelung, Jakob Nikolas Kather, Daniel Truhn

2026-07-23视觉感知学习理论

这篇论文针对医学基础模型常被默认可互换的假设,系统检验不同图像/文本编码器是否形成共享表征。核心洞察是,表征收敛主要由自监督预训练目标驱动,而非模型规模或临床标签监督;在胸片上自监督模型对齐最高,标签监督和图文监督明显较低。收敛仍有限,难以匹配放射科医生的病例相似性判断,但线性分类器跨编码器和外部医院迁移仍保留约85%性能。

How Does Urban Context Relate to Residential Building Health? A Vision-POI Fusion Framework for Building-Level Housing Inspection Figure 1
2026-07-23cs.CV

How Does Urban Context Relate to Residential Building Health? A Vision-POI Fusion Framework for Building-Level Housing Inspection

Kun Zhao, Helei Ren, Guilin Tang, Tianyi Chen, Zhehui Song, Xing Liu, Lijian Zhou, Yuhong Zhao, Xiang Gao, Jinming Jiang, Qichao Ban

2026-07-23视觉感知

面向住宅楼栋体检中室内/半封闭问题难以靠航拍或街景规模化识别的痛点,论文将多视角现场图像检测聚合为楼栋级特征,并引入500-1500米POI刻画周边功能环境。结果显示主要提升来自多视角聚合,Macro-F1由60.84%升至74.95%;POI融合进一步到76.79%,但增益有限且类别相关,更像辅助先验而非因果或替代视觉证据。

Vera: Identity-Faithful Human Subject-to-Video Generation Figure 1
2026-07-23cs.CV

Vera: Identity-Faithful Human Subject-to-Video Generation

Yulong Xu, Xinyue Liu, Shujuan Li, huafeng shi, Yan Zhou, Jiwen Liu, Xintao Wang, Yu Shen Liu, Huaibo Huang

Institute of Automation, Chinese Academy of Sciences, Tsinghua University

2026-07-23视觉感知

Vera针对人像S2V中面部身份随姿态、遮挡和多人互动漂移的问题,认为通用主体一致性不足以约束细粒度身份与角色绑定。其核心是用跨片段检索构建百万级身份对齐人像图文视频数据,并结合IFMS聚焦身份区域监督、RALA调控DiT中参考身份读出。实验显示其提升单/多人身份一致性、角色绑定和运动自然度,减少身份混淆与参考图过度复制。

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training Figure 1
2026-07-23cs.CV

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

Qiwei Ma, Bin Deng, Junjie Zhu, Qiangjuan Huang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

2026-07-23视觉感知

这篇论文针对可见光-红外预训练中“所有空间 patch 同等可靠”的隐含假设,指出低纹理、弱梯度和模态特有效应会给对比学习引入噪声监督。核心创新是 IAS:用红外边缘/梯度先验、可学习软重要性掩码和课程式采样重加权 patch 对齐,且不改主干。实验称其在红外分割、检测、可见光分割和跨模态检索上相对强基线均有稳定提升。

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing Figure 1
2026-07-23cs.CV

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

2026-07-23视觉感知数据集/基准

这篇论文针对遥感图像编辑不同于自然图像的约束:模型不仅要按指令改图,还要保持地理拓扑、非目标区域和传感器风格一致。作者提出 RS-RIE-Bench,将任务划分为时间、因果和空间推理,并用目标区域合理性、非目标保持和图像质量一致性评测。实验显示现有八类编辑模型表现很弱,最强模型严格整体准确率仅 24.28%,因果与空间推理尤其困难。

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving Figure 1
2026-07-23cs.CV

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding

Tsinghua University

2026-07-23强化学习

PerceptDrive针对端到端自动驾驶中感知基础模型知识在查询压缩和静态融合中易丢失、难按场景分配的问题,提出按几何、语义、动态先验分支保留信息,并用场景条件路由在生成前自适应融合;训练时蒸馏规则子指标,推理仍为单相机单轨迹。其在NAVSIM v1/v2达到90.4 PDMS和90.2 EPDMS,消融显示保留目标与路由均有贡献,但闭环泛化仍未验证。

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation Figure 1
2026-07-23cs.CV

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee

Z. Rao and F. Tang are with University of Chinese Academy of Sciences, Beijing, China., T.-Y. Lee is with National Cheng Kung University, Tainan, Taiwan.

2026-07-23视觉感知

本文针对现有 HOI 视频生成多依赖离线短片和复杂条件、难以实时长时保持交互的问题,提出 StreamHOI。其核心洞察是流式生成中的 sink-local 记忆存在交互一致性与短期运动连续性的取舍,且不同 Transformer 块偏好不同历史区域,因此通过 HOI 感知块分析、按块分配记忆布局的 B-MST,以及记忆距离缩放强化早期交互状态访问。实验显示其在交互合理性、物体保真、人像质量和效率上优于长视频与 HOI 基线,并达到 17.6 FPS、首块延迟 0.75 秒。

SHFormer: Dynamic Spectral Filtering Convolutional Neural Network and High-pass Kernel Generation Transformer for Adaptive MRI Reconstruction Figure 1
2026-07-23cs.CV

SHFormer: Dynamic Spectral Filtering Convolutional Neural Network and High-pass Kernel Generation Transformer for Adaptive MRI Reconstruction

Sriprabha Ramanarayanan, Rahul G. S., Mohammad Al Fahim, Keerthi Ram, Ramesh Venkatesan, Mohanasankar Sivaprakasam

2026-07-23三维

该文针对注意力式 MRI 重建偏向低频、跨模态或分布偏移时需重训的问题,提出 SHFormer:用动态谱滤波 CNN 捕获可迁移频率特征,并由高通核生成 Transformer 强化细节恢复。实验覆盖监督、自监督、扩散训练及开闭集泛化,在未见场景最高约提升 1 dB PSNR、0.01 SSIM,但具体增益在多组件中的来源仍需进一步拆解。

Real-Time EEG Cap Electrode Detection for Guided Point-of-Care Placement Figure 1
2026-07-23cs.CV

Real-Time EEG Cap Electrode Detection for Guided Point-of-Care Placement

William Lehn-Schiøler, Mads Sverker Nilsson, Nicki Skafte Detlefsen

Department of Health Technology, Technical University of Denmark, Lyngby, Denmark, Department of Applied Mathematics and Computing, Technical University of Denmark, Lyngby, Denmark, donning events per workup. In each setting, whoever is available — an on-call resident, a ward nurse

2026-07-23视觉感知

这篇论文面向床旁或非专业人员佩戴 EEG 帽时电极位置难以实时质控的问题,提出用普通 RGB 摄像头先以单类 YOLO 检测实体电极,再借助人脸关键点几何分配 10–20 角色,从而验证实际佩戴而非预测目标位置。五受试者 LOSO 下 mAP@.5 达 0.94±0.07,YOLOv10n 在 CPU 上约 19 FPS;但数据规模很小,小号帽泛化下降且与受试者身份混杂。

HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation Figure 1
2026-07-23cs.CV

HeadCast: Casting Attention Heads for Efficient Autoregressive Video Generation

Jinliang Shen, Lianghao Su, Zheming Li, Kang He, ZiLiang Lai, Yanbing Jiang, Chengru Song

2026-07-23视觉感知

针对自回归视频扩散在长视频和高分辨率下 KV cache 持续膨胀、注意力推理成本占主导且粗暴裁剪会闪烁的问题,HeadCast 观察到预训练模型的注意力头具有稳定异质模式,将其一次性分为 Sink、Dummy、Spatial、Global 并采用对应缓存路径,保留全局头以维持时序一致性。无需训练下,在多种 AR 视频模型上达到 720P 最高 1.62×、1080P 最高 1.95× 加速,VBench 质量接近全注意力。

RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs Figure 1
2026-07-23cs.CV

RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs

Xin Li, Siyuan Duan, Shang Wang, Zhimin Mao, Bingliang Hu, Geng Zhang

Key Laboratory of Spectral Imaging Technology CAS, Xi’an Institute of Optics and Precision Mechanics, Chinese Academy, University of Chinese Academy of Sciences

2026-07-23视觉感知

这篇论文面向 GNSS 受限场景下无人机冷启动全局视觉定位,核心问题是 UAV 实拍与参考地图之间的视角、成像平台和外观域差异。作者用 Google 3D Tiles 采样接近 UAV 视角的参考图,并以近姿态正样本、远距离难负样本微调 SALAD;RIM 进一步复用同一 DINOv2 token 场同时做全局检索和局部匹配,降低重排序开销。零样本测试中其 Recall@1 明显优于 SALAD,Top-5 完整查询约 67.9 ms,但增益可能部分来自 3D Tiles 数据构造。

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models Figure 1
2026-07-23cs.CV

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

Dr. Ambedkar Institute of Technology, India, Heritage Institute of Technology, India

2026-07-23视觉语言视觉感知

这篇论文关注VLM在RAG/VQA等场景中可能被无关或错误图文上下文牵引的问题,指出多模态语境下牵引可由文本和视觉两路独立触发,并需区分“与场景矛盾但世界可能”和反事实。核心贡献是提出ENTRAP-VL分类探针:1500个手工构造样本、文本流8类条件和视觉流3类条件及评测协议。文中未报告具体模型测量结果,主要结果是发布用于后续严谨诊断的资源与分类框架。

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images Figure 1
2026-07-23cs.CV

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

(1) The D-Lab, Department of Precision Medicine, GROW - Research Institute for Oncology and, Reproduction, Maastricht University, Maastricht, the Netherlands., (2) Division of Cardiovascular Imaging, Department of Cardiology I, University Hospital Münster, for enhanced CMR reading is limited by labor-intensive data curation, suboptimal model performance, labels from narrative CMR reports and preprocessing multimodal imaging data, including cine and late-

2026-07-23视觉感知

针对心脏 CMR 解读依赖专家且训练数据整理成本高的问题,本文把本地开源 LLM 报告标注、cine/LGE 多模态预处理与 DINO、VST、UMedPT 等视觉基础模型微调结合,并用集成提升稳健性。在 1067 例独立测试中,HCM、心淀粉样变 AUC 分别达 0.959、0.966,DCM、ICM 约 0.84;但单中心单厂商数据限制了泛化判断。

Factor-Informed Uncertainty Distillation for Gaze Estimation Figure 1
2026-07-23cs.CV

Factor-Informed Uncertainty Distillation for Gaze Estimation

Mohammadreza Jamalifard, Yaxiong Lei, Javier Fumanal Idocin, Parastoo Azizinezhad, Tom Foulsham, Javier Andreu-Perez

University of Essex, University of Essex Colchester UK

2026-07-23安全鲁棒

这篇论文关注真实场景凝视估计中模型会对低质输入过度自信、难以及时拒判的问题。核心做法是用照明、清晰度、眼部可见性和对称性等可解释质量因子训练梯度提升教师,再把“质量到误差”的排序信号蒸馏到单次前向的不确定性头。实验在 ETH-XGaze、Gaze360、MPIIFaceGaze 上显示,FIUD 相比确定性和采样式基线提升了不确定性与误差排序相关性及选择性预测,尤其在非受控数据上更明显。

GaussianSeed: Hierarchical Gaussian Seeding for High-Resolution 3D Occupancy Prediction Figure 1
2026-07-23cs.CV

GaussianSeed: Hierarchical Gaussian Seeding for High-Resolution 3D Occupancy Prediction

Xinzhuo Li, Xianghui Pan, Jiayuan Du, Wei Wei, Liuyi Wang, Chengju Liu, Qijun Chen

2026-07-23三维

该文针对视觉三维占据预测在0.1m高分辨率下计算和显存开销过大的问题,提出GaussianSeed,用由粗到细的层级3D Gaussian种子替代密集体素表示,并配合RBGI、HGSD、GSPE实现相机端到端细化。实验在Occ3D-nuScenes和新建六相机TJScenes上显示其延迟最低、精度仍具竞争力,尤其在细粒度场景中优于既有稀疏范式。

Importance-Aware OBS Pruning for Diffusion Models Figure 1
2026-07-23cs.CV

Importance-Aware OBS Pruning for Diffusion Models

Ba-Thinh Lam, Srijan Das, Hieu Le

Department of Computer Science

2026-07-23生成模型

这篇论文针对扩散模型剪枝中 OBS 类准则只最小化平均重建误差、容易在高稀疏率下破坏主体和结构的问题,提出在二阶剪枝目标中加入空间重要性图,用 CFG、边缘或检测信号强调语义关键区域,并保持一次性、免训练和闭式权重更新。实验称在 MS-COCO、多种结构化与非结构化剪枝设置下,相比 OBS-Diff 更能保留主体一致性和结构正确性,优势在高压缩率时更明显。

A Systematic Benchmark of Intensity Normalisation Methods for 3D Knee MRI Segmentation and Cross-Domain Generalisability Figure 1
2026-07-23cs.CV

A Systematic Benchmark of Intensity Normalisation Methods for 3D Knee MRI Segmentation and Cross-Domain Generalisability

Oliver Mills, Philip Conaghan, Samuel Relton

2026-07-23视觉感知数据集/基准三维

这篇论文针对膝关节 MRI 跨中心分割中强度差异导致的域偏移问题,系统比较 7 种无需目标域再训练的归一化方案在 3D U-Net 半月板分割上的影响。结果显示内测差异很小,外部 SKM-TEA 上 Z-score、Nyúl 和 CLAHE 更稳健,但方法间约 1% DSC 的差距远小于跨数据集约 10% 的性能下降,说明归一化有可测作用,却不足以解决主要域偏移。

Toward Seasonal Guidelines for Robust Deep-Learning Sentinel-2 Building Detection in Different Area Types Figure 1
2026-07-23cs.CV

Toward Seasonal Guidelines for Robust Deep-Learning Sentinel-2 Building Detection in Different Area Types

Michał Romaszewski, Kamil Drejer, Katarzyna Kołodziej, Anna Zawadzka, Stanisław Lewiński, Przemysław Głomb, Marek Ruciński, Michal Krupiński, Krzysztof Gryguc Przemysław Sekułaa, Szymon Sala

Institute of Theoretical and Applied Informatics, Polish Academy of Sciences, Space Research Centre, Polish Academy of Sciences

2026-07-23视觉感知安全鲁棒

针对Sentinel-2十米分辨率下建筑易受季节、植被遮挡和建成区形态影响的问题,论文构建华沙多时相数据集,并用BDOT10k栅格化标注比较U-Net与DeepLabV3+、L1C与L2A及跨月份迁移。核心洞察是训练/推理月份和区域类型会显著改变检测稳定性,可据此给出季节化选模指南;具体最佳月份和量化增益在给定文本中未充分说明。

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching Figure 1
2026-07-23cs.CV

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

2026-07-23生成模型

StereoFlow针对传统双目匹配将多峰对应关系压成单点回归、在遮挡和深度不连续处易均值化的问题,将确定性视差先验与生成式分布建模结合:级联匹配网络先给出多尺度条件,StereoDiT再围绕先验建模局部歧义,并用Transition Flow Matching实现少步采样。实验称其在Scene Flow、KITTI、ETH3D和Middlebury取得多项SOTA,零样本场景下细节和几何一致性更好。

Forecasting the Number of Harvest-ready Fruits of Sweet Peppers Using Multimodal Time-Series Data Figure 1
2026-07-23cs.CV

Forecasting the Number of Harvest-ready Fruits of Sweet Peppers Using Multimodal Time-Series Data

Enrico Pallotta, Mohamed Farag, Esra Guclu, Chris McCool, Ribana Roscher, Juergen Gall

2026-07-23视觉语言

面向温室甜椒单株采收量预测中公开时序数据稀缺、单一计数模型缺少置信度的问题,本文发布两季691株、4837张图像的多模态数据集,并将DinoV3视觉特征、成熟度计数与含时间间隔的LSTM融合,再用深度集成估计不确定性。结果相较持久性基线RMSE降低33%和38%,但较仅计数模型平均仅增益1.2%,视觉增益较小。

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training Figure 1
2026-07-23cs.RO

Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training

Taewon Seo, Seonae Jeon, Giwon Lee, Kuk-Jin Yoon, Daehee Park

2026-07-23规划控制

面向拥挤场景中的移动机器人,论文关注边缘设备上将行人运动预测与自车安全规划统一到紧凑模型时的共享编码器冲突。其核心洞察是“Skill Conflict”:两类任务争用相同参数会削弱专门化能力;DPT通过互斥掩码分配任务关键参数,并用稀疏模型合并保留最有影响的参数。在JRDB和JTA上,方法相较多种统一模型与合并基线同时改善预测误差、规划误差和碰撞率。

OffNadirLoc: Benchmark and Framework for Challenging UAV-to-Satellite Geo-Localization under Large Off-Nadir Views Figure 1
2026-07-23cs.CV

OffNadirLoc: Benchmark and Framework for Challenging UAV-to-Satellite Geo-Localization under Large Off-Nadir Views

Qian Qiao, Wenye Liu, Ting Liu, Jiuhe Shu, Peng Wang

School of Computer Science, Northwestern Polytechnical University

2026-07-23强化学习数据集/基准

本文针对无人机在海域、山地或应急任务中难以获得近正射视角的问题,提出大离轴 UAV-卫星定位基准 OffNadirLoc,并给出 ONLoc:用结构感知权重抑制遮挡和重复区域,再用多视角组级监督学习视角不变表示。实验显示其在新基准和四个近正射数据集上超过现有方法,并具备一定零样本泛化能力。

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program Figure 1
2026-07-23cs.CV

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program

Mengtian Li, Xinru Guo, Xiaoru Lin, Xiao Rong, Zhifeng Xie, Chaofeng Chen

Shanghai University, Institute for Math and AI, Wuhan, Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects Shanghai China, Shanghai University Shanghai China, Institute for Math and AI, Wuhan School of Artificial Intelligence, Wuhan University Wuhan Hubei China

2026-07-23视觉语言

该文针对剧本到电子剧场节目册生成中长文本理解不足、跨页面风格漂移和角色资产难以精确组合的问题,提出训练-free的多智能体流程:先解析剧本,再用RAG与VLM评审的ToT循环生成主海报,并以其作为全局风格锚指导背景、角色肖像和程序化排版,还扩展到语音对话式虚拟角色。实验在ETP-Pro上显示其在戏剧审美、主题忠实度、可读留白和交互性指标上优于多种基线。

SIINR: Structurally Informed Implicit Neural Representations for super-resolution with uncertainty quantification of clinical quality diffusion MRI datasets Figure 1
2026-07-23cs.CV

SIINR: Structurally Informed Implicit Neural Representations for super-resolution with uncertainty quantification of clinical quality diffusion MRI datasets

Tom Hendriks, William Consagra, Anna Vilanova, Yogesh Rathi, Maxime Chamberland

2026-07-23生成模型数据集/基准安全鲁棒

临床 dMRI 为缩短扫描常采用厚层采集,导致层间结构缺失,影响 FA/MD 和纤维追踪等分析。SIINR 将监督 3D U-Net 作为高分辨率软先验,再用逐病例自监督 INR 融合原始低分辨率数据,并给出重建不确定性。实验显示其在开放数据集上优于插值方法,临床 MS 和脑损伤病例中能保留强度变化并标出高不确定区域,但训练数据覆盖和退化模拟仍限制泛化判断。

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection Figure 1
2026-07-23cs.CV

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection

Yechan Kim, JongHyun Park, Dongho Yoon, Namhoon Jung, Moongu Jeon

2026-07-23视觉感知

针对真实航拍 RGB-T 数据采集成本高、视角控制弱、模态对齐和标注困难的问题,G-MAD 将 Arma3 改造成可脚本化的数据生成框架,支持场景约束采样、多视角同步可见光/热红外采集和基于引擎几何信息的自动框标注,并发布 AMOD 基准。实验显示,多视角训练较最佳单视角 mean AP50:95 提升 6.39,AMOD 预训练在 DIOR-R 和 HIT-UAV 上分别带来 6.69、2.51 AP50 增益。

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment Figure 1
2026-07-23cs.CV

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

Xujie Zhang, Runyan Du, Song Chang, Jiang Li, Dongliang Shao, Liping Wu, Wei Luo, Xiaochao Qu, Luoqi Liu, Xiaodan Liang

2026-07-23视觉感知

WearWow针对2K多服饰虚拟试穿中注意力序列过长导致的显存爆炸,以及扩散模型在高分辨率下抹平织物细节的问题,提出自适应2D Token Packing压缩衣物条件并保留空间先验,同时用多维试穿奖励对齐语义纹理与服装分布。论文还构建WearWow-2K数据集,实验称在原生2K、免掩码、多服饰合成上优于商业基线,但增益中数据与scaling贡献仍需进一步拆分。

LoRFT: Benchmarking Long-Range Vehicle Trajectory Reconstruction from Fixed Highway Cameras Figure 1
2026-07-23cs.CV

LoRFT: Benchmarking Long-Range Vehicle Trajectory Reconstruction from Fixed Highway Cameras

Yufan Zhu, Kefu Yi, Xueju Zhang, Yunyang Tian, Long Chen, Zixuan Xiao

School of Transportation, Changsha University of Science and Technology

2026-07-23规划控制数据集/基准三维

固定高速摄像头能长期采集交通视频,但远距离车辆因透视压缩、尺度衰减而导致轨迹断裂。论文将其重定义为从可靠近场轨迹重建远场延续的问题,提出 LoRFT 基准及道路几何感知的 Map-RSTNet;在 22 个场景上,相比最强基线 ADE、FDE 和 5 秒 RMSE 分别降低 11.0%、15.4%、10.5%。

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction Figure 1
2026-07-23cs.CV

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

• Yue Zhao is with Shandong Second Medical University. E-mail:, • Qiong Zeng, the corresponding author, is with the School of Computer, Science and Technology, Shandong University, and the Shandong Provincial, Key Laboratory of Computing-Network Integration, Shandong University.

2026-07-23视觉语言数据集/基准

这篇论文针对现有图像到代码评测多停留在单图表、难以检验多视图仪表盘的数据绑定和交互逻辑的问题,提出 MV-Bench:从 Tableau 工作簿抽取结构化真值并生成 1048 个可执行基准样本。实验显示,当前多模态模型能较好复现视觉布局,最高 75.45%,但数据绑定仅 21.71%、交互完整性仅 11.68%,说明外观相似不能代表功能正确。

StrokeSeg2: Stroke Lesion Segmentation in Clinical Research Workflows Figure 1
2026-07-23cs.CV

StrokeSeg2: Stroke Lesion Segmentation in Clinical Research Workflows

Youwan Mahé (EMPENN, MALT), Axel Plessis (EMPENN), Stéphanie Leplaideur (EMPENN, MPR, CMRRF), Elise Bannier (EMPENN), Florent Leray (EMPENN, SED (Rennes)), Francesca Galassi (EMPENN)

CHU Rennes, Physical Medicine and Rehabilitation Department, Rennes, France, Centre de Kerpape, Ploemeur, France, CHU Rennes, Radiology Department, Rennes, France

2026-07-23视觉感知生成模型

临床研究中,脑卒中病灶分割模型虽精度高,但常受 Python/Docker 依赖和硬件需求限制。StrokeSeg2 将 nnU-Net 管线改为跨平台 C++/Qt 应用,并用知识蒸馏与 ONNX FP16 压缩部署;结果显示 0.84M 参数学生模型保留较稳定分割表现,同时能耗降逾 90%、推理时间平均降 84%,主要增益来自架构蒸馏。

OSVE: One Step Video Editing with One Step Diffusion Models Figure 1
2026-07-23cs.CV

OSVE: One Step Video Editing with One Step Diffusion Models

Habin Lim, Gyeong-Moon Park

2026-07-23视觉感知生成模型

针对文本引导视频编辑中多步反演与采样导致延迟过高的问题,OSVE将一阶T2I扩散模型改造成“一步反演、一步生成”流程:用可学习编码器直接预测初始噪声,并通过SAE损失保持源视频结构,UFE则把多帧潜变量统一处理以增强时序一致性。实验显示其编辑质量接近或优于多步方法,同时速度提升约155至171倍,使实时视频编辑更可行。

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition Figure 1
2026-07-23cs.CV

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

Arizona State University, Tempe, AZ, USA, University of California, Merced, CA, USA

2026-07-23视觉感知

面向机器人手术中的器械-组织交互识别,论文针对冻结视觉编码器定位弱、全量微调易依赖背景捷径的问题,提出 LAViFiT:用逆动力学从相邻帧差异中压缩潜在动作,并以正向世界模型和 patch 级 SIG 正则引导编码器关注动作相关区域。多编码器、多数据集实验显示其提升识别与图文对齐,并获得更好的交互区域 grounding 和空间一致性。

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation Figure 1
2026-07-23cs.CV

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

2026-07-23视觉语言生成模型

该文针对热红外到可见光人脸转换中的几何错位、语义属性不匹配和身份退化问题,提出 MTVDiff,在潜空间扩散中联合热图、深度和文本条件,通过双分支跨注意力融合、门控文本视觉对齐与 SFT 注入多模态先验。MCXFace 和 SpeakingFaces 实验显示其较 GAN 与扩散基线提升图像质量和验证性能,FID 最高降 48.3%,Rank-1 最高升 8.9%。

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness Figure 1
2026-07-23cs.RO

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

Zhejiang University, Wuhan University, Hunan University, Zhejiang University Hangzhou Zhejiang China, Wuhan University Wuhan Hubei China, Hunan University Changsha Hunan China

2026-07-23机器人安全鲁棒

EA-Nav针对跨本体视觉导航中“同一画面对应不同安全动作”的歧义问题,主张在模仿学习阶段显式引入机器人几何形态。方法用互联网第一视角视频构建异构预训练数据,并以本体几何条件 token、空间风险感知和高风险轨迹增强来修正短期轨迹。实验显示其在不同本体设置下提升导航性能与安全性,但更复杂运动约束如转弯半径仍未充分建模。

Current Injection Spiking Neural Network for Infrared and Visible Image Fusion Figure 1
2026-07-23cs.CV

Current Injection Spiking Neural Network for Infrared and Visible Image Fusion

Rui Zhao, Zhuoyuan Li, Wenrui Li, Yanchen Dong, Yajing Zheng, Giuseppe Valenzise, Weisi Lin

2026-07-23视觉感知

面向无人机、移动机器人等受限平台的红外/可见光连续感知,论文指出直接用二值脉冲做跨模态融合会丢失阈下互补信息;CIS-Fuse 将辅助模态以门控电流注入膜电位,并用双向融合模块在发放前整合两路特征。四个融合基准及检测、分割任务显示其质量接近 ANN 方法,推理能耗约低于同规模 DCEvo 一个数量级。

Robust Activation Map Rectification for Weakly Supervised Volumetric Segmentation: Temporal Coherence as a Free Lunch Figure 1
2026-07-23cs.CV

Robust Activation Map Rectification for Weakly Supervised Volumetric Segmentation: Temporal Coherence as a Free Lunch

Renshu Gu, Jialiang Chen, Fei Gao, Hang Su, Jun Qi, Jiamin Xu, Yicheng Shen, Jiayu Zhang, Jiaxi Pan, Caiming Zhang, Gang Xu

2026-07-23视觉感知安全鲁棒

这篇论文针对弱监督三维医学分割中 CAM 噪声大、会把错误提示传给 SAM/MedSAM 的问题,提出无需额外训练和原型图像的 CSSeg。核心洞察是利用体数据切片间的时间/结构一致性:VRAA 聚合跨切片激活以降噪,BER 用双向极值检查修正不合理激活。多数据集实验报告最高 20.5% Dice、40.3% mIoU 提升,并将推理时间降低 5 倍以上。

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding Figure 1
2026-07-23cs.RO

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

2026-07-23视觉语言强化学习数据集/基准

本文针对具身世界模型评测中过度依赖逆动力学模型导致的失败归因不清问题,提出 KineBench:用分割、深度估计和 CAD 约束 6D 位姿跟踪直接从生成视频恢复末端执行器轨迹,并在 ManiSkill3 闭环执行,同时引入 SPARC 和可操作度等 3D 运动学指标。基于 20 个操作任务的评测显示,这些指标能提供与成功率互补的诊断信号,且前沿模型在任务复杂度升高时呈现非线性、受难度约束的 scaling。

PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy Figure 1
2026-07-23eess.IV

PRISM-DR: Per-lesion Retinal Inference with Specialist Models for Diabetic Retinopathy

Zübeyr Özeren, Tansel Uyar

2026-07-23视觉感知

本文针对糖尿病视网膜病变早期小病灶易漏检、四类病灶形态和尺度差异大而单一多类检测器容易偏向常见类别的问题,提出PRISM-DR:为微动脉瘤、出血、硬/软性渗出分别训练专用YOLO检测器,并按病灶调节预处理、切片、增强、集成和跨类重叠抑制。IDRiD五折训练后测试mAP50为0.527、F1为0.529,硬性渗出AP50最高0.561;外部零微调迁移随成像尺度差异明显下降,说明方法可行但绝对性能仍受小规模单源数据限制。

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos Figure 1
2026-07-23cs.CV

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

✉ Corresponding author. 1 The authors are with Information Hub, The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China, Emails:, The author is with University of Freiburg, Freiburg, German, Emails:, The author is with Hangzhou City University, Hangzhou, China, Emails:, The author is with Fudan University, Shanghai, China, Emails:, The author is with Department of Computer Science, Hong Kong Baptist University, Hong Kong, China, Emails:

2026-07-23视觉语言视觉感知

面向无人机边飞边理解的语言引导感知,论文指出小目标细节易被视觉 token 压缩抹掉、长视频又难完整缓存历史。其贡献是构建像素级开放词表数据集 DroneEyes,并提出 SkyAnchor:用语义感知 token 路由保留目标信息,用分层记忆维持流式一致性。实验显示其在描述与指代表达分割上超过现有 MLLM,并在 SkyFind 零微调和真实 UAV 部署中取得明显增益。

MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts Figure 1
2026-07-23cs.CV

MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts

Huangbiao Xu, Huanqi Wu, Xiao Ke, Jiaxin Cai, Junyi Wu, Jinglin Xu

2026-07-23视觉感知

这篇论文针对动作质量评估中按动作类型分别训练模型导致部署依赖标签、跨动作泛化差的问题,提出 all-in-one AQA 设定与 MoAKE 框架。其核心是用多个动作知识专家在共享语义空间中学习互补模式,并通过分段原型与 AIISRM 建模不同时间粒度关系,动态融合以缓解负迁移。实验在三个长时动作数据集上优于现有方法,并在三个短时动作数据集的零/少样本评估中表现出一定跨动作泛化能力。

Lean-SAM2: Target-Anchored Memory and Encoder Acceleration for SAM2 Figure 1
2026-07-23cs.CV

Lean-SAM2: Target-Anchored Memory and Encoder Acceleration for SAM2

Xudong Ouyang, Wenlun Zhang, Yimin Xu, Huazhong Liu, Yunshan Zhong

X. Ouyang is with the School of Biomedical Engineering, Hainan University, Hainan 570228, China., W. Zhang is with the Department of Electronics and Electrical Engineering, Keio University, Kanagawa 223-8522, Japan., Y. Xu is with the College of Computer Science, Shenyang Aerospace University, Shenyang 110135, China.

2026-07-23视觉感知

Lean-SAM2针对SAM2在视频分割中历史记忆交叉注意力开销大、每帧全图编码冗余的问题,指出现有剪枝和稀疏路由在遮挡、干扰物下易丢失目标信息。其核心是用提示派生的目标锚点约束记忆剪枝、时序压缩与保险记忆,并以风险感知路由决定何时启用重编码。五个VOS基准显示其在保持精度的同时提速,LVOSv2上较Efficient-SAM2的J&F还提升3.6%至5.0%。

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation Figure 1
2026-07-23cs.AI

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

Zhengxian Wu, Junjie Gao, Kai Yang

2026-07-23视觉语言数据集/基准

这篇论文针对多模态搜索智能体只看最终答案会掩盖过程失真的问题,提出六类“静默失败” taxonomy,并用统一 ReAct 轨迹、LLM 评审与跨评审验证同时检查答案正确性和证据扎根性。在 MMSearch-Plus 的 800 条轨迹上,作者发现表面准确率持续高估真实轨迹正确率,且更强模型并不会消除这类失败,只是失败类型随能力变化而转移。

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning Figure 1
2026-07-23cs.CV

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

Md Tanvirul Alam

Rochester Institute of Technology

2026-07-23视觉感知

视觉语言模型的 RLVR 受限于缺少覆盖广、可精确验证且可复现的视觉训练环境。Trace 将场景语法、可执行任务程序、查询变化和奖励验证解耦,用共享语义状态生成图像、问题、答案与可回放轨迹,覆盖 11 类视觉域的 1000 个任务。在 6.4 万实例上训练 Qwen2.5-VL 后,24 个外部基准宏平均提升 3.51/4.06 点;但文中未充分说明各领域、采样或渲染控制分别贡献了多少增益。

Physics-Aware Complex-Valued State Space Model with Scattering-Prior Feature Modulation for PolSAR Image Classification Figure 1
2026-07-23cs.CV

Physics-Aware Complex-Valued State Space Model with Scattering-Prior Feature Modulation for PolSAR Image Classification

Fangyan Zhang, Fan Zhang, Shiqi Zhou, Jun Ni, Carlos López-Martínez, Qiang Yin

2026-07-23视觉感知

针对PolSAR分类中复值幅相耦合易被削弱、长程空间依赖难建模且散射先验常停留在输入层的问题,论文提出CV-SSMNet:在复数域用状态空间模型建模长程上下文,并将H/A/α、Freeman-Durden功率和Span等先验作为FiLM式调制信号约束特征演化。空间块划分实验显示其在三组L波段数据和P波段BIOMASS评估中提升区域一致性与边界保持,精度具竞争力。

WASABI: Whole-graph Assignment-based Stabilizer for lAne topology By Inter-frame tracking Figure 1
2026-07-23cs.CV

WASABI: Whole-graph Assignment-based Stabilizer for lAne topology By Inter-frame tracking

Tetsuhiro Uchida, Myu Sasaki, Kensho Nakajima, Yasuhiro Shimada, Toru Saito

2026-07-23视觉感知

面向自动驾驶中车道拓扑感知的漏检、错误连接、重复检测和标签闪烁问题,WASABI将车道段与LCLC连接作为联合跟踪目标,在实时约束下结合曲线匹配、全局分配、拓扑修正与历史平滑。内部16段序列上,LCLC F1由0.834升至0.948,中心线横向误差由2.50米降至0.95米,连接切换率降63.3%,但验证依赖内部数据,泛化性文中未充分说明。

Frequency-Hierarchical Active k-Space Sampling for Diagnostic MRI Figure 1
2026-07-23cs.CV

Frequency-Hierarchical Active k-Space Sampling for Diagnostic MRI

Ruru Xu, Kian Anvari Hamedani, Zhikai Yang, Ilkay Oksuz

2026-07-23视觉感知

这篇论文针对加速 MRI 中采样预算有限且诊断任务不同频段依赖不同的问题,提出 HieraSample:固定低频核心保留解剖上下文,用余弦退火逐步放宽加速率,并由 Mamba 策略按点选择高频 k-space 坐标。fastMRI+ 膝关节实验中,ACL 诊断在 4×到 10×接近全采样 oracle,ACL 严重程度较 ASSDM 最高提升 20.4 AUC 点;但评估限于单线圈单部位和单随机种子,调度与低频基础的独立增益来源不清。

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing Figure 1
2026-07-23cs.CV

Look Before You Edit: Attention-Guided Camera Placement and Multi-View Alignment for 3D Gaussian Splatting Editing

Jaeyeon Park, Taeho Kang, Youngki Lee

Seoul National University, Seoul National University Seoul South Korea

2026-07-23三维

这篇论文针对文本驱动 3DGS 编辑中复用 COLMAP 训练视角导致目标被裁切、注意力定位差和多视角漂移的问题,提出 LB-Edit:先用扩散模型自/交叉注意力选择适合 ROI 的编辑距离与少量多样视角,再通过 token 对应和共享 3D 注意力场对齐外观与位置。实验显示其在指令一致性、多视角一致性和编辑局部性上获最高用户偏好,仅用约 5 个视角并将延迟最多降至约 1/7。

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking Figure 1
2026-07-23cs.CV

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking

Zhaodong Ding, Chenglong Li, Zeyu Ding, Futian Wang, Jin Tang

Anhui University, Hefei 230601, China.

2026-07-23视觉感知数据集/基准

这篇论文针对真实协同感知中传感模态和观测平台会随时间变化的问题,提出 DRGBT-1K 动态 RGBT 跟踪基准,而不是继续沿用固定平台、固定 RGB/TIR 输入的评测设定。其核心贡献是构建 1045 段全真实采集序列、795K 帧对及细粒度标注,并提供未对齐版本和 UGVT-1K;对 20 种跟踪器的统一评测显示,现有方法在模态缺失、视角突变和跨平台切换下明显退化,提示主要瓶颈来自真实动态数据分布而非单一模型设计。

Global Building Area Estimation Products: How Accurate Are They? Figure 1
2026-07-23cs.CV

Global Building Area Estimation Products: How Accurate Are They?

Saad Lahrichi, Doa'a Allabadi, Kyle Bradbury, Jordan Malof

Doa’a Allabadi

2026-07-23视觉感知

这篇论文针对全球建筑面积产品已被用于城市化、能耗和排放评估但缺少公平精度基准的问题,使用高分辨率人工标注的 ORBITaL-Net 作为真值,在多种参考网格和指标下比较 GHSL、TEMPO、GBA 与 Overture。结果显示 GBA 或 TEMPO 通常最优,但结论依赖评价标准;各产品在非洲、亚洲和高密度城市区域误差明显增大,提示下游使用需按区域和场景校准。

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation Figure 1
2026-07-23cs.CV

Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation

Kwonyoung Ryu, In-Jae Lee, Jonghyun Jin, Hyunjee Lee, Jongmin Lee, Jaesik Park

2026-07-23视觉感知

针对少视角下新视点全景分割依赖显式3D重建、且重建误差会传递到标签的问题,本文指出大规模视图合成模型仅由RGB监督学到的跨视角对应可迁移到非外观信号,并将输入视角全景标签二进制编码后经冻结模型传播到目标视角。ScanNet上取得33.56 PSNR和0.5949 mIoU,分割接近高斯重建方法,同时渲染质量高出7 dB以上,Replica上也无需微调优于对比方法。

EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration Figure 1
2026-07-23cs.RO

EgoRecovery: Acquiring Failure Recovery Ability Through Human Recovery Demonstration

Zuhao Ge, Yuchen Zhou, Weitao Zhou, Minglei Li, Xinyu Li, Chao Wu, Hanwen Zhao, Haotian Wang, Zuxuan Wu, Xiaosong Jia, Yu-Gang Jiang

2026-07-23模仿学习

这篇论文针对机器人模仿学习在偏离成功轨迹后难以自我恢复的问题,指出恢复数据用机器人遥操作采集成本高、覆盖失败模式困难。核心做法是用第一视角人类短恢复片段高效覆盖失败状态,并通过“纠正意图”瓶颈和恢复门控迁移到机器人动作,而非直接复制人类动作。真实机器人实验显示,相比仅用机器人恢复、直接混合人类恢复或无门控意图迁移,EgoRecovery 在失败起点恢复成功率上更高,同时基本保留正常执行能力。

Efficient Tracking and Understanding Object Transformations Figure 1
2026-07-23cs.CV

Efficient Tracking and Understanding Object Transformations

Yihong Sun, Bharath Hariharan

Cornell University

2026-07-23视觉感知

这篇论文面向机器人操作和视频理解中物体切割、展开、相变等状态变化的跟踪问题,指出 TubeletGraph 逐帧分割并跟踪全场景实体导致成本过高。核心洞察是 SAM2 多候选掩码的不一致可作为变化触发信号,FluxGraph 只在不确定区域发现候选并用反向跟踪过滤无关物体。实验在 VOST、VSCOS、M3-VOS、DAVIS17 上获得 3.3–10.7 倍加速,同时基本保持或略提升跟踪与状态图质量。

An Exploratory Analysis of Pain Localization via Explainable Computational Modeling Figure 1
2026-07-23cs.CV

An Exploratory Analysis of Pain Localization via Explainable Computational Modeling

Ioannis Kyprakis, Stefanos Gkikas, Eric Nichols, Yu Fang, Manolis Tsiknakis

Hellenic Mediterranean University, Honda Research Institute Japan, ticularly when labeled data are limited [19]. The majority of, voice features. Beyond the laboratory, the authors in [48], Human-Machine Interface Laboratory at the University of

2026-07-23视觉感知

本文针对无法自述患者的疼痛部位识别问题,比较可解释手工特征与端到端深度序列模型在多模态可穿戴生理信号上的表现。核心洞察是小样本、10秒窗口下,EDA频谱等生理先验特征比深度模型更稳健;Extremely Randomized Trees取得最高macro-F1 0.539,且疼痛检测F1 0.815与定位F1约0.552的差距提示自主神经信号对具体部位存在上限。

Analytic Distribution of Classifier-Free Guidance for Schedule Design Figure 1
2026-07-23cs.LG

Analytic Distribution of Classifier-Free Guidance for Schedule Design

Enze Jiang, Zheng Ma

School of Mathematical Sciences, Shanghai Jiao Tong University

2026-07-23视觉感知

这篇论文针对 CFG 实际采样分布长期被简单乘积分布启发式替代的问题,从概率流 ODE 出发推导常数与时变 guidance 的解析路径积分形式,指出关键影响来自沿采样轨迹累积的指数修正且由 ω(t)-1 加权,并据此提出 DG-CFG 调度。在解析 toy model 与 Stable Diffusion 1.5 上,该方法改善强 guidance 下的饱和、质量退化和多样性-保真权衡,并以更少 NFE 达到固定质量目标。

ReFace: Reorganizing Facial Spatiotemporal Representations for Improved Pain Assessment Figure 1
2026-07-23cs.CV

ReFace: Reorganizing Facial Spatiotemporal Representations for Improved Pain Assessment

Stefanos Gkikas, Yu Fang, Christian Arzate Cruz, Muhammad Umar Khan, Raul Fernandez Rojas

2026-07-23生成模型

该文针对面部视频疼痛评估中过度依赖整脸建模、难以显式捕捉局部疼痛线索的问题,提出 ReFace:在 token 化前将人脸重组为四个空间象限,并在统一时空表示中建模。AI4Pain 上视频单模态测试准确率达 56.00%,高于同协议下对比方法;单象限也保持竞争力,但验证集规模较小且统计显著性文中未充分说明。

A Unified Tokenization Framework for Pain Recognition using Heterogeneous 3D Modalities Figure 1
2026-07-23cs.CV

A Unified Tokenization Framework for Pain Recognition using Heterogeneous 3D Modalities

Stefanos Gkikas, Christian Arzate Cruz, Valentina Becchetti, Muhammad Umar Khan, Alessandro Giuseppi, Raul Fernandez Rojas

Honda Research Institute Japan, Sapienza University of Rome, University of Canberra, Honda Research Institute Japan Wako City Japan, Sapienza University of Rome Rome Italy, University of Canberra Canberra Australia

2026-07-23视觉感知三维

疼痛评估过度依赖主观自报,临床连续监测和无法表达患者场景需要更客观的识别方法。本文将面部视频、原始 fNIRS 与频谱 fNIRS 统一折叠为共享 token 序列,用同一骨干保留时空和时频结构,减少模态专用设计。AI4Pain 实验显示其在单模态和多模态设置下达到测试集 SOTA,并可在 GPU/CPU 上实时推理。

Point-Selection Fine-Tuning Framework for Robust Point Cloud Classification Figure 1
2026-07-23cs.CV

Point-Selection Fine-Tuning Framework for Robust Point Cloud Classification

Da Li, Chang Ma, Dongfu Yin

2026-07-23三维安全鲁棒

这篇论文针对点云预训练模型在噪声、遮挡等腐蚀输入下微调易放大离群点、破坏原有鲁棒先验的问题,提出 PSFT:先按预池化特征估计点影响并保留低影响点,再在冻结骨干上生成逐层提示,并用 Beta 门控特征过滤残余噪声。实验显示其在 ModelNet-C、ModelNet40-C 上跨多种骨干降低腐蚀错误率,并在 ScanObjectNN-C 的强骨干设置中取得更好结果。

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving Figure 1
2026-07-23cs.CV

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

Beihang University, China, Zhongguancun Laboratory, China, Chery Automobile Co., Ltd., China

2026-07-23视觉语言视觉感知生成模型安全鲁棒

针对VLM自动驾驶缺少真实高危长尾场景、仿真生成存在sim-to-real差距的问题,SafeGen将场景生成建模为由灾难性终态约束的视频扩散过程,先用VLM从正常驾驶视频中推断潜在风险终态,再通过深度投影与边界条件扩散生成时序一致的VRU冲突视频。实验显示其相对基线平均提升VLM裁判评分24.25%,用生成数据微调后真实场景表现提升15.9%。

PhenSPINE: A Standardized Benchmark for Spine Pathology Diagnosis Figure 1
2026-07-23cs.CV

PhenSPINE: A Standardized Benchmark for Spine Pathology Diagnosis

Duong Ngoc Vu, Hai Son Nguyen, Trong-Nghia Nguyen, Bien Tran Van, Trang Mai Xuan, Huan Vu, Thien Van Luong

2026-07-23数据集/基准

这篇论文针对脊柱病变自动诊断缺少多序列、高质量基准的问题,发布 PhenSPINE MRI 数据集,包含 250 名患者的 16,813 张图像,并为椎间盘位置引入位置编码以显式建模解剖上下文。实验显示 SAG-T2 单序列最有效,Macro F1 达 50.31%;多序列融合反而下降,作者认为主要受周围解剖噪声和特征冗余影响。

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation Figure 1
2026-07-23cs.RO

NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation

Junzhe Wu, Yue Hu, Zeyu Han, Po-Hsun Chang, Yinan Dong, Behrad Rabiei, Maani Ghaffari

University of Michigan, Ann Arbor, Tsinghua University

2026-07-23机器人数据集/基准

NavVerse针对现有导航基准割裂室内、室外且弱化真实机器人执行的问题,构建了Isaac Sim中的连续物理仿真基准,覆盖室内、室外和室内到室外场景,并引入PlaceNav等任务与安全指标。实验显示,RL、VLA和模块化方法在跨场景迁移、找出口、越过边界和地形适应上仍明显不足;端到端VLA零样本成功率最高,模块化方法更安全。

A Unified Variational Framework for Deep Weakly Supervised Image Segmentation Figure 1
2026-07-23cs.CV

A Unified Variational Framework for Deep Weakly Supervised Image Segmentation

Yin King Chu, Lingfeng Li, Sung Ha Kang, Jianping Zhang, Xue-Cheng Tai

2026-07-23视觉感知

针对稀疏像素标注下分割训练易受 PCE 缺乏显式正则约束影响的问题,论文把 simplex 约束 Potts 模型、平滑周长正则与 RKHS 模糊隶属函数统一成可优化的变分损失。实验显示其在单图迭代分割和弱监督网络训练中相较非训练方法与 PCE 更稳健,并带来去噪、边界细化和伪影抑制,但具体增益幅度需结合完整实验表判断。

Domain Shift in Echocardiography: Interpretable Quantification and Prediction of Cross-Dataset Left Ventricular Segmentation Figure 1
2026-07-23cs.CV

Domain Shift in Echocardiography: Interpretable Quantification and Prediction of Cross-Dataset Left Ventricular Segmentation

Soroush Elyasi, Nasim Dadashi Serej, Julie Wall, Massoud Zolgharni

THRIVE Centre, School of Computing and Engineering, University of West London, London, UK, School of Computing and Engineering, University of West London, London, UK, segmentation, enabling scalable segmentation with strong performance [8], [9], [10], [11]. However, wherever it can be reliably identified from the available data. In particular, samples associated with GE

2026-07-23视觉感知数据集/基准

针对超声心动图左室分割跨数据集部署时性能骤降且成因不清的问题,论文用手工超声特征、VAE潜变量和分割潜特征联合度量域差异,指出许多表观迁移问题来自视野与构图等几何预处理差异,而非单纯亮度或厂商效应;几何感知预处理可改善部分差迁移案例,Dice下降预测达到R²=0.612、MAE=0.082,并支持一定程度的无掩膜迁移风险监测。

Pathologist Attention-Aligned Report Generation for Prostate Histopathology Figure 1
2026-07-23cs.CV

Pathologist Attention-Aligned Report Generation for Prostate Histopathology

Ruoyu Xue, Suryakant Singh, Souradeep Chakraborty, Pierre Marza, Oksana Yaskiv, Constantin Friedman, Natallia Sheuka, Paul Friedman, Bharat Ramlal, Beatrice Knudsen, Rajarsi Gupta, Joel Saltz, Prateek Prasanna, Gregory Zelinsky, Dimitris Samaras

2026-07-23视觉感知

这篇论文针对前列腺全切片病理报告生成缺少人类诊断注意力约束的问题,收集121张WSI的病理医生多尺度视野轨迹、语音描述和光标信息,并用注意力对齐损失让模型关注更接近专家证据区域。该方法训练时引入辅助监督、推理时无需额外输入,在报告生成和VQA上平均提升NLP指标10.9%、五类临床要素准确率19.3%,同时生成更贴近病理医生关注区域的可视化依据。

EGRNet: A Lightweight Semantic Segmentation Network with Edge-Gated Refinement and Adversarial Sensing Figure 1
2026-07-23cs.CV

EGRNet: A Lightweight Semantic Segmentation Network with Edge-Gated Refinement and Adversarial Sensing

Bareera Qaseem, Mohsin Kamal, Muhammad Naveed Aman

School of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), School of Computing, University of Nebraska-Lincoln, Semantic segmentation refers to the process of assigning a semantic label to each pixel in an image. It enables

2026-07-23视觉感知

面向自动驾驶等边缘场景,论文试图在实时语义分割中同时降低计算量、保留边界细节并提高对抗扰动感知能力。EGRNet用深度可分离卷积、空洞残差块、SE注意力和边缘门控精炼模块融合原始/精炼特征,并加入轻量攻击检测。Cityscapes上以0.46M参数达到65.28% mIoU,但对抗检测的具体增益来源仍需更多实验证明。

Deep Shape Regression for Planar Curves with Multimodal Covariates Figure 1
2026-07-23stat.ME

Deep Shape Regression for Planar Curves with Multimodal Covariates

Manuel Pfeuffer, Roshan Prakash Rane, Hadya Yassin, Kerstin Ritter, Sonja Greven

2026-07-23视觉语言

本文面向医学轮廓等平面曲线形状随多模态协变量变化的建模问题,动机是传统形状回归难同时处理旋转、尺度、重参数化不变性和图像等高维输入。核心洞察是将曲线复值化后,条件 full Procrustes 均值可由条件协方差的首特征函数给出,并用带模态专属编码器的深度协方差平滑来估计。模拟和 ADNI 海马轮廓实验显示,该方法能恢复更清晰的条件均值及与文献一致的协变量效应。

VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers Figure 1
2026-07-23cs.CV

VQ-Transplant: Efficient VQ-Module Integration for Pre-trained Visual Tokenizers

Xianghong Fang, Yuan Yuan, Dehan Kong, Tim G. J. Rudner

University of Toronto, Boston College

2026-07-23视觉感知

这篇论文针对先进离散视觉 tokenizer 训练成本高、VQ 算法难以低成本迭代的问题,提出 VQ-Transplant:冻结预训练编码器和解码器,仅替换 VQ 模块,并用少量解码器适配缓解量化空间不匹配;同时引入 MMD-VQ 做分布对齐。实验中接入 VAR 后以约 95% 更低训练成本达到接近或优于原模型的重建质量,报告 rFID 0.81、相对 VAR 训练快 21.8 倍。

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning Figure 1
2026-07-23cs.CV

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

Santiram Tiwari, Nishant Sinha, Kunal Kislay

KGraph AI Solutions Pvt. Ltd., Bangalore, India – 560016

2026-07-23视觉感知

这篇论文针对长视频问答中独立缓存视频片段的 KV 记忆难以保持全局时间顺序的问题,提出无需训练的 ChronoStitch:先用三轴 multimodal RoPE 将局部视觉 key 重映射到全局时空坐标,再只重算少量受跨片段注意力影响最大的视觉 token。实验显示其在 TempCompass 时间子集上优于朴素拼接和仅位置修正,整体提升 4.8 个点、事件排序提升 7.0 个点,并比完整联合预填充快 3.3 倍。

Synthetic and Derived Training Images for Campus Waste Detection: A Multi-Seed Evaluation with YOLOv8n Figure 1
2026-07-23cs.CV

Synthetic and Derived Training Images for Campus Waste Detection: A Multi-Seed Evaluation with YOLOv8n

Ali Behbahani, Newsha Javanmardi, Shahriar Ahmed, Ling Chen, Phouvadeth Vathana

University of Tennessee, Knoxville, USA

2026-07-23视觉感知数据集/基准

面向校园垃圾桶近距离、手持物体场景,论文检验合成/派生图像是否能弥补仅148张真实照片的数据稀缺。其关键洞察是把增广来源、混合比例、手部复合和多随机种子分开评估,发现“更多图像”并不等于更有用:真实数据训练的YOLOv8n mAP@0.5为0.691,背景替换和完整增广池反而降至0.560和0.487,孤立物体接近但未超过基线,手部复合增益也不可靠。

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models Figure 1
2026-07-23cs.CV

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

Bradley Department of Electrical and Computer Engineering, Virginia Tech, USA, Virginia Tech Transportation Institute, USA, Sanghani Center for Artificial Intelligence and Data Analytics, USA

2026-07-23视觉感知三维

针对自动驾驶多模态大模型多依赖2D图像、难以直接利用LiDAR和立体相机时序3D信息的问题,D3VL将点云或双目深度投影为深度图,与视频帧一起经现有视觉编码器和LLM拼接建模,避免额外点云模块;在KITTI QA上相对基线提升约11%,并提出含多样驾驶条件的WaymoQA扩展,但具体增益中数据与微调贡献仍需进一步拆分说明。

Geospatial Diffusion-based Evolution Synthesis (GeoDES) for Storm-Centered Weather Augmentation Figure 1
2026-07-23cs.LG

Geospatial Diffusion-based Evolution Synthesis (GeoDES) for Storm-Centered Weather Augmentation

Sonia Cromp, Satya Sai Srinath Namburi GNVV, Youran Wang, Grace Kisslinger, Frederic Sala, James Booth, Allegra LeGrande

for Storm-Centered Weather Augmentation, University of Wisconsin-Madison, University of Georgia, City College of New York, NASA Goddard Institute for Space Studies, centered bounding boxes with dimensions L1×L2, over T timesteps and V variables. GeoDES uses a prompt, (GeoDES) for modeling extratropical cyclone structures. We follow a storm-centered approach (e.g., Booth, et al., 2018), treating each cyclone as a “video” anchored to its moving low-pressure center (Figure 4). To, The storm-centered framing and temporal inflation strategy directly resolve structural limitations of existing, centered data is a common format (e.g., Booth et al., 2018

2026-07-23生成模型

针对全球天气模型分辨率不足、区域模型受固定边界和极端风暴样本稀缺限制的问题,GeoDES将温带气旋表示为随低压中心移动的风暴视频,用2D空间预训练、时间膨胀到3D扩散模型并非自回归生成完整生命周期。在2016-2024年北大西洋测试中,其峰值涡度误差较最强基线低52%,异常相关系数高8%,且更好保持极端风暴的动能分布。

Crowd4D: Scene-Aware Monocular 4D Crowd Reconstruction Figure 1
2026-07-23cs.CV

Crowd4D: Scene-Aware Monocular 4D Crowd Reconstruction

Hongbo Kang, Tianyi Zhou, Qingyang Yang, Hongwei Wen, Jing Huang, Yu-Kun Lai, Kun Li

2026-07-23三维

本文针对大场景单目视频中人群4D重建的深度歧义、尺度漂移和复杂地形对齐问题,提出Crowd4D,将场景几何纳入人群与场景的联合优化。核心是用SIPC&SIS构建HSIP作为人-场景交互代理,约束行人可行位置与全局尺度,并用CSCR维持局部人群结构的时间一致性。实验显示其在复杂大规模真实场景中优于现有方法,但仍依赖场景重建、初始化和跟踪质量。

BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics Figure 1
2026-07-23eess.IV

BLUE: Semantics-Preserving Video Compression for Efficient Vision-Language Surveillance Analytics

Shubham Baid, Akash James, Sahil Chachra, Nishant Sinha, Kunal Kislay

2026-07-23视觉语言视觉感知

本文针对固定监控视频在存储、传输和 VLM 推理中成本高、而传统 H.265 主要面向人眼重建的问题,提出 BLUE:在编码前抑制静态背景冗余、保留前景活动,并利用小 P 帧作为跳过 VLM 调用的信号。VIRAT 与 CHAD 上,BLUE 相比原始 H.265 几乎不降低语义评分,同时带来 40%–84% 文件缩减,并在 CHAD 上估计减少约 53% VLM 调用。

Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream Figure 1
2026-07-23cs.CV

Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream

Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington, Bloomington, IN, USA, College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar, Preprint • Kurban Intelligence Lab • https://github.com/KurbanIntelligenceLab/streamdet, Kurban Intelligence Lab

2026-07-23视觉感知强化学习

论文针对 AI 生成视频检测在线部署时成本高、需等完整视频的问题,把任务改写为流式感知:直接解析压缩码流中的 GOP 运动场,用单调运行最大值和一次终点校准阈值实现 anytime 早停,并仅将不确定样本升级到像素/VLM 检测。结果显示,该 CPU 前端以低五个数量级计算量达到可用排序能力;在 GenVidBench 上延迟 15% 样本可将准确率从 0.75 提至 0.78,同时比全量像素检测省约 7 倍计算,但分布漂移下误报控制会变差。

Strong Gravitational Lensing Posterior Sampling in Pixel-Space Using Diffusion Models and Recurrent Inference Machines Figure 1
2026-07-23astro-ph.IM

Strong Gravitational Lensing Posterior Sampling in Pixel-Space Using Diffusion Models and Recurrent Inference Machines

Guillaume Payeur, Laurence Perreault-Levasseur, Gabriel Missael Barco, Yashar Hezaveh

Department of Physics, Université de Montréal, Montreal QC, Canada, Mila - Quebec AI Institute, Montreal QC, Canada, Ciela Institute, Institute for Astrophysics and Machine Learning, Montreal QC, Canada, Trottier Space Institute, McGill University, Montreal QC, Canada, Center for Computational Astrophysics, Flatiron Institute, New York, USA, Perimeter Institute for Theoretical Physics, Waterloo ON, Canada

2026-07-23生成模型

针对高分辨率、高信噪比强引力透镜中源星系亮度与前景质量分布需像素级联合推断、且后验高维非线性的问题,论文提出 DiRIM,将循环推断机用于估计条件后验 score,再通过扩散反向 SDE 采样。实验在宇宙学流体模拟生成的真实感透镜数据上显示,该方法可同时恢复源图像与会聚图,并把模拟观测拟合到噪声水平。

Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling Figure 1
2026-07-23eess.IV

Group-of-Latents: Perceptual Video Compression at Extreme Bitrates via Masked Latent Generative Modeling

Shaokang Wang, Jinchang Xu, Peidong Jia, Zhijian Hao, Siyuan Qian, Fei Zhao, Rui Ma, Xiaozhu Ju, Jian Tang, Xiaodong Xie, Shanghang Zhang, Huizhu Jia

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China, State Key Discipline Laboratory of Wide Band-Gap Semiconductor Technology, School of Microelectronics, Xidian University, Xi’an, China

2026-07-23视觉感知生成模型

这篇工作针对极低码率视频压缩中传统失真优化易产生模糊、难同时保留纹理与运动的问题,提出在因果 tokenizer 潜空间中按 GoL 显式拆分 I/P latents:只传输少量 I-latent 锚点,再用预训练 DiT 去噪并从噪声生成 P-latents。实验显示其可在低于 0.005 bpp 的码率下保持较好感知细节和时间一致性,但具体增益中预训练生成先验与结构设计的贡献边界仍需更多消融说明。

When Does Consensus Beat Voting? A Critical Analysis of Statistical Label Fusion in Medical Image Segmentation Figure 1
2026-07-23cs.LG

When Does Consensus Beat Voting? A Critical Analysis of Statistical Label Fusion in Medical Image Segmentation

Renjie He

When Does Consensus Beat Voting? A Critical Analysis of Statistical Label Fusion in Medical, Statistical Label Fusion in Medical Image Segmentation, Department of Radiation Oncology, The University of Texas MD Anderson Cancer Center, Houston, TX 77030, USA, executed on Google Colab., forward when image data and computational resources are available. Conformal prediction offers, available.

2026-07-23视觉感知

这篇论文针对医学图像多专家分割中“STAPLE 何时优于多数投票”的基准构建问题,系统推导其 EM 形式、可识别性与边界条件,并用七组受控实验指出一个关键洞察:在常见标注者数量下,STAPLE 多数时候近似为阈值化投票而非真正可靠性估计。结果显示 J≥7 时 Dice>0.99 地贴近阈值平均图,但 EM 局部最优普遍、类别不平衡下性能可崩塌;多数投票在小结构场景反而更稳,深度共识与保形预测只在有图像数据和算力时更有价值。

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models Figure 1
2026-07-23cs.LG

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

2026-07-23视觉语言视觉感知强化学习

这篇论文针对 VLA 模型中纯在线 RL 泛化强但交互成本高、纯离线 SFT 在分布外场景弱的问题,考察离线监督能否作为 RL 微调中的持续约束而非仅作初始化。作者在 OpenVLA LoRA 上提出两种离线引导 PPO:参考 SFT 策略的 KL 正则和离线数据行为克隆辅助项。实验显示,两者在 1M 步时均优于同预算 PPO,其中 RefKL 约用一半在线训练预算达到接近 2M 步 PPO 的 IND/OOD 成功率。

Decodable but Not Detectable: A Leakage Fingerprint for Near-OOD Benchmarks Figure 1
2026-07-23cs.LG

Decodable but Not Detectable: A Leakage Fingerprint for Near-OOD Benchmarks

Vishnu Bindu Balachandran

2026-07-23数据集/基准

这篇论文针对近分布外检测基准中“把已训练类别当作 OOD”导致评测反转的问题,提出一种泄漏指纹:监督可解码性近乎完美而无监督检测显著崩塌。作者在刻意泄漏与干净控制实验中验证该指纹具备较高灵敏度和特异性,并给出 leave-class-out 修正;修正后发现扰动信号虽可被监督读出,但无监督检测并不优于普通 embedding Mahalanobis 基线。

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions Figure 1
2026-07-23cs.LG

Native Multi-Dimensional Subquadratic Operators via Input Dependent Long Convolutions

David R. Wessels, Farhad Ramezanghorbani, David W. Romero, Alireza Moradzadeh, Olivia Viessmann, Maksim Zhdanov, John St. John, Ken Janik, David M Knigge, Yucheng Tang, Erik J Bekkers, Saee Gopal Paliwal

AMLab, University of Amsterdam

2026-07-23视觉感知

这篇论文针对高分辨率图像、3D 医学影像、PDE 场等多维长上下文中注意力计算二次增长、而 Mamba 等递归模型需强行一维扫描的问题,提出 HyenaND:用输入条件化的全局多维长卷积在原生几何上建模,并以 nSubQ CUDA 融合 FFT 路径实现次二次加速。实验显示其在基因组、视觉、医学影像和 PDE 任务上可匹配强注意力基线,混合 HyenaND-注意力结构进一步优于纯注意力和递归混合模型。

2026-07-22

93 篇
Appearance Pointers -- Multimodal Region Control of Diffusion Transformers Figure 1
2026-07-22cs.CV

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

Brown University

2026-07-22视觉语言生成模型规划控制

这篇论文针对文本提示难以精确控制生成图中局部材质、身份和布局的问题,提出 Appearance Pointers:用区域对应网络把文本或参考图与用户掩码对齐,生成紧凑指针 token,引导 DiT 在指定位置调用相应外观信息,并通过空间聚合支持多区域、多模态单次去噪。实验在自建 AppearancePointers-37K 上显示,文本区域生成多数指标最好或次优,图像区域控制优于 MS-Diffusion 和 DreamRenderer。

Masked Visual Actions for Unified World Modeling Figure 1
2026-07-22cs.CV

Masked Visual Actions for Unified World Modeling

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang

Stanford University, University of Maryland, College Park, Harvard University

2026-07-22强化学习

这篇论文针对视频模型难以用机器人动作进行可控干预的问题,提出 Masked Visual Actions:把机器人或物体的部分时空轨迹直接表示为像素空间掩码条件。核心洞察是同一视频模型通过显露不同实体,可同时充当前向动力学模型和逆向模型。仅用约15小时真实与仿真数据微调后,单一检查点在多场景、多 embodiment 中提升视觉保真和可控性,并用于策略评估、模型规划和由目标物体运动合成机器人动作。

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis Figure 1
2026-07-22cs.CV

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Xuetao Feng, Xiaoyong Zhu

2026-07-22数据集/基准三维

论文针对现有图像生成/编辑基准多停留在常识、浅层因果和知识回忆,难以检验专业知识密集型视觉推理的问题,提出 ExpertVerse:按9类认知能力与8类专家学科构造58个子任务,覆盖单图编辑、多图合成和文生图,并扩展 ExpertVerse-100K 训练 KnowThinker 与 BPPO。实验称其在 ExpertVerse、KRIS-Bench、UniREditBench、WiseEdit 等基准上显著优于开源方法并接近或超过部分闭源模型,但部分增益可能主要来自数据规模与合成标注。

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use Figure 1
2026-07-22cs.CV

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

University of Chinese Academy of Sciences, 2Institute of Automation, CAS, 3Southeast University, Shopee, 5Tsinghua University, 6Beijing University of Technology, regions. Code is available at https://github.

2026-07-22视觉感知

这篇论文针对长音视频中关键证据稀疏且跨模态、全程高保真输入代价过高的问题,提出让全模态模型先看低成本全局预览,再按需调用时间区间 zoom-in 工具复查视听片段。核心在于用 TimeAnchor 统一不同采样粒度下的时间参数,并用合成轨迹训练工具调用行为。实验显示其在多模态与视频基准上提升答案准确率和时间定位,同时把高保真计算集中到有效片段。

ROMS-IMLE: A Minimalist Approach to Competitive Single-Step Generative Modelling Figure 1
2026-07-22cs.LG

ROMS-IMLE: A Minimalist Approach to Competitive Single-Step Generative Modelling

Chirag Vashist, Ke Li

APEX Lab, Simon Fraser University, Simon Fraser University, Amii and CIFAR, subsequent work has grown steadily more complicated, introducing elaborate architectures [41, 38]

2026-07-22生成模型

论文针对扩散/流匹配依赖多步渐进生成、采样成本高的问题,检验单步生成是否也能达到竞争性能。其核心做法是在 IMLE 上加入按上采样阶段的监督、频谱相关的阶段 specialization 和鲁棒损失,而非迭代去噪或 Transformer。实验显示 ROMS-IMLE 在 CIFAR-10、CelebA-HQ 和 ImageNet 256 上取得竞争性 FID,ImageNet 256 FID 为 2.56,并以更少参数和函数评估保持较好 precision/recall。

InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation Figure 1
2026-07-22cs.CV

InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation

Khawar Islam, Arif Mahmood, Xin Jin, Naveed Akhtar

2026-07-22安全鲁棒

本文针对传统 mixup 在跨图像混合时易破坏语义、显著区域计算又带来训练开销的问题,提出 InstructMixup:在单一样本内提取多尺度显著补丁,用指令引导生成模型离线编辑并缓存,再结合只作用于显著区域的自适应分形扰动和多模式混合。实验覆盖分类、鲁棒性、迁移与自监督等七类基准,报告均优于九种增强方法;但生成编辑与分形扰动各自的独立增益仍需依赖消融判断。

ERank in Latent Space as an Image-Complexity and Richness Measure Figure 1
2026-07-22cs.CV

ERank in Latent Space as an Image-Complexity and Richness Measure

Maksim Smirnov, Grigory Kononov, Anastasiia Linich, Egor Surkov, Egor Shvetsov

2026-07-22视觉感知

这篇论文针对图像“丰富度”难以无标签、逐样本度量的问题,提出在冻结视觉编码器的中间特征上计算通道协方差的有效秩 ERank,用活跃且去相关的特征方向数刻画复杂度。实验显示该指标与码率、清晰度、边缘密度及 IC9600 人类复杂度标注相关,并可作为数据筛选信号改善超分辨率与 OCR;但对分类、分割、去噪无明显帮助,说明其作用边界主要在任务难度由输入视觉丰富度主导时。

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs Figure 1
2026-07-22cs.RO

From Distances to Trajectories: Real-Time Signed Distance Function Mapping and Distance-Accelerated Motion Planning for UAVs

Jason Stanley (1), Zhirui Dai (1), Qihao Qian (1), Tzu-Chin Ho (1), Tianxing Fan (1), Siddharth Saha (2), Christopher Barngrover (2), Ki Myung Brian Lee (1), Nikolay Atanasov (1) ((1) UC San Diego, La Jolla, USA, (2) Shield AI, San Diego, USA)

2026-07-22规划控制

面向无人机在未知杂乱环境中的实时自主飞行,论文认为建图与规划不应再由二值占据图松散连接,而应共享SDF距离场表示。其核心是用OREN结合八叉树先验与神经残差在线重建可微非截断SDF,并用Bubble*直接基于距离生成安全球廊完成搜索与轨迹优化。实验显示OREN的SDF估计较基线提升22%,Bubble*在约90米复杂环境中1至3秒完成规划,碰撞检查较A*减少91%至99%,并在Jetson Orin NX四旋翼上闭环运行。

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation Figure 1
2026-07-22cs.CV

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

Shandong University, China University of Petroleum (East China)

2026-07-22机器人视觉语言

这篇论文针对无人机视觉语言导航中单次推理容易在复杂场景产生不安全或次优轨迹的问题,提出无需训练的测试时扩展框架:先并行生成多条候选航迹,再对每条进行自我修正,并用安全性、目标一致性和前进进度打分选择方案。实验称该组合优于传统基线和单一顺序/并行 scaling,并达到该任务 SOTA,但具体增益可能主要来自推理预算增加。

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image Figure 1
2026-07-22cs.CV

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

2026-07-22视觉语言视觉感知数据集/基准

本文针对全切片病理诊断中“能推理但未必会找证据”的评测缺口,提出 PathAgentBench,将跨倍率诊断过程组织成诊断树,覆盖图文匹配、文本检索图像、诊断区域定位和多尺度推理。基于 2,012 张 WSI、17,135 条专家标注路径评测 20 个模型后发现,模型在给定证据上的多尺度推理可超过 93%,但定位证据明显薄弱,最佳文本引导 mIoU 低于 0.09,自主探索命中率随放大倍率急剧下降。

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings Figure 1
2026-07-22cs.CL

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

2026-07-22视觉语言学习理论

本文关注多方会议中多模态大模型是否具备心智理论推理能力,因为真实会议里的态度常由语音、视线、姿态和轮次共同表达。核心贡献是提出 MeetingToM,将评测分为个体心理状态、双人指向与态度、群体共识三层,并突出“伪共识”这一隐性分歧场景。实验显示现有模型仍难整合非语言线索、识别隐藏态度并区分真实共识与表面一致。

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer Figure 1
2026-07-22cs.CV

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu

S-Lab, Nanyang Technological University, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center

2026-07-22视觉感知

这篇论文针对机器人在长时动态视频中仅重建几何、难以持续识别同一物体的问题,提出 IGGT4D,将相机运动、3D 几何和实例身份放入因果流式 Transformer 中联合更新,并用几何约束生成 InsScene4D-147K 监督数据。实验显示其在3D重建、位姿估计、实例空间跟踪和开放词汇分割上优于现有流式基线,同时保持在线长序列推理能力。

Anatomy-Aware 3D Mesh Refinement of Pericardium Segmentations on Computed Tomography Figure 1
2026-07-22cs.CV

Anatomy-Aware 3D Mesh Refinement of Pericardium Segmentations on Computed Tomography

Andreas W. Aspe, Jonas Jalili Loft, Michael Huy Cuong Pham, Andreas Ohrt Johansen, Jørgen Tobias Kühl, Klaus Fuglsang Kofoed, Kristine Aavild Sørensen, Rasmus R. Paulsen, Josefine Vilsbøll Sundgaard

DTU Compute, Technical University of Denmark, Kongens Lyngby, Denmark, Department of Cardiology, The Heart Center, Copenhagen University Hospital –, Department of Radiology, The Diagnostic Center, Copenhagen University Hospital, Department of Clinical Medicine, Faculty of Health and Medical Sciences, University of Copenhagen, Copenhagen, Denmark, ⋆Code available at: https://github.com/andreasaspe/3DMeshRefinement

2026-07-22视觉感知三维

针对心包在CT中边界弱、易与周围组织混淆且影响心外膜脂肪定量的问题,本文提出无需重训的3D网格后处理:用TotalSegmentator提供的邻近解剖结构构造向量场,并结合平滑、法向一致性和边长约束迭代修正初始分割。实验在高分辨率CGPS和稀疏标注SAROS上均提升体积、表面和解剖指标,且对低数据或跨域模型等较弱初始分割收益最大。

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency Figure 1
2026-07-22cs.RO

Cognitive Dual-Process Planning for Autonomous Driving with Structured Scene Knowledge and Verifiable Reasoning-Action Consistency

Zhongyao Yang (1 and 2), Haoyu Li (1 and 2), Yu Yan (1 and 2), Zhuangxuan Yu (1 and 2), Jiangfeng Nan (3), Jinrui Nan (1 and 2) ((1) School of Mechanical Engineering, Beijing Institute of Technology, Beijing, China, (2) National Engineering Research Center of Electric Vehicles, (3) School of Mechanical Engineering, Southeast University, Nanjing, China)

2026-07-22规划控制

该文针对自动驾驶高层规划中VLM推理成本高、自由文本理由难验证且可能与动作不一致的问题,提出结构化S-CoT、视觉仲裁器快慢路由和规则验证结合GRPO的双过程框架。在NAVSIM人工验证样本上达到80.14%规划准确率、97.20%一致性,并较全量慢推理降低17.39%延迟;但长尾低能见度和交通标志场景鲁棒性仍下降。

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU Figure 1
2026-07-22cs.CV

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo

2026-07-22强化学习

这篇论文瞄准交互式世界模型从“生成视频”走向可持续闭环控制时的数据、漂移和部署瓶颈。ABot-World-0 将多源游戏/仿真/公开视频数据、键盘动作统一控制、双向教师到因果学生蒸馏和 LongForcing 结合起来,试图提升长时序可控性与一致性。结果显示其可在单张 RTX 5090 上以约 19GiB 显存实现 720P 最高 16FPS、1.2 秒首帧延迟,但具体增益中 data 与系统优化占比仍需更多消融支撑。

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding Figure 1
2026-07-22cs.CV

Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding

Junlin Chang, Longhao Zou, Rui Li

2026-07-22三维

针对点云预训练骨干全量微调成本高、现有PEFT只作用于下采样后粗 token 而难以保留局部几何的问题,PLT在冻结骨干外构建层级局部特征金字塔,并通过局部-全局融合与动态多尺度提示把原始点的细粒度结构反馈进主干。实验称其在分类和密集预测上优于既有PEFT,分类仅训练2.71%参数,密集预测7.69%,在PointGPT-L上降至0.36%。

Sarus: Privacy-Preserving Multi-Vendor Perception Fusion via Homomorphic Encryption Figure 1
2026-07-22cs.CR

Sarus: Privacy-Preserving Multi-Vendor Perception Fusion via Homomorphic Encryption

Munawar Hasan, Apostol Vassilev

National Institute of Standards and Technology, USA, Michigan Technological University, USA

2026-07-22视觉感知

Sarus针对多厂商协同感知中检测结果会泄露模型行为和场景信息的问题,提出将目标检测压缩为共享空间格上的高斯矩向量,并用同态加密在服务器端直接融合。KITTI上结合YOLOv8与LiDAR检测器可提升场景覆盖,尤其在单模态随距离退化时更明显;代价是密文通信和解密开销较大,但运行时间随占用bin数和厂商数近似线性增长。

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers Figure 1
2026-07-22cs.CV

Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformers

Maohua Li, Qirui Li, Yanke Zhou, Yiduo Li, Zhaosheng Chi, Chao Xu, Cuifeng Shen, Yixuan Xu, Hanlin Tang, Kan Liu, Tao Lan, Lin Qu, Shao-Qun Zhang

2026-07-22生成模型

针对现代文生图 DiT 中聊天模板 token 是否只是格式残留这一问题,论文用注意力分解、span 干预、head 移植和层级 mask 做因果分析,发现结构模板 token 虽在编码器输出几乎不含提示语义,却会成为图像到文本注意力汇并维持物体身份。由此提出免训练剪枝规则,删除偏向 prompt token 的头可省约 20% 注意力 FLOPs,GenEval 仅降 1.4 分。

Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models Figure 1
2026-07-22cs.CV

Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

Lisa Weijler, Irene Ballester, Guofeng Mei, Tolga Birdal, Pedro Hermosilla

Imperial College London

2026-07-22生成模型三维

这篇论文针对稀疏、未定姿图像下三维重建存在多解且传统前馈几何基础模型只能给出确定性结果的问题,提出在 VGGT 潜空间直接做条件生成。核心洞察是 VGGT token 位于四个高维超球面的乘积流形上,需用黎曼 Flow Matching 才能保持潜码有效;在 RE10K、ScanNet++ 和 ETH3D 上,相比近期场景生成基线同时改善单视图外观和聚合三维几何。

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval Figure 1
2026-07-22cs.CV

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

Hong Kong University of Science and Technology, Hong Kong University of Science and Technology (Guangzhou)

2026-07-22三维

本文针对“在参考3D房间上按自然语言编辑后再检索目标房间”的需求,指出现有2D组合检索、单物体3D编码和静态场景定位难以处理物体集合中的非对称匹配。CR-Refiner以训练-free重排序方式,用LLM解析编辑实体,结合非平衡最优传输、结构先验和LLM验证器评分候选;同时发布3D-CER基准。实验显示其在三类基础检索器和各编辑轴上稳定提升hard-subset R@1与mAP@10。

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval Figure 1
2026-07-22cs.CV

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

Hao Wu, Heyi Lin, Zilin Wang, Huizai Yao, Hao Wang, Hui Xiong

Hong Kong University of Science and Technology, Hong Kong University of Science and Technology (Guangzhou), Hong Kong University of Science and Technology Hong Kong China, Hong Kong University of Science and Technology (Guangzhou) Guangzhou China

2026-07-22三维

本文针对开放集三维形状检索中仅靠外观特征会混淆几何结构相近但功能不同零件的问题,提出 GATE-3D:在测试时依据外观与几何排序的跨模态分歧,为每个查询自适应决定几何重排权重,无需重训主干。实验显示其在 OS-ESB-core 上较外观基线 mAP@10 提升 2.00 点并降低 10.8% 几何误报,在几何不敏感数据集上也能基本避免无条件融合带来的退化。

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility Figure 1
2026-07-22cs.CV

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek

University of Aberdeen, UK, University College London, UK

2026-07-22三维

这篇论文针对单目视频中人体常被裁切、遮挡或只露出头肩时,现有高斯 avatar 方法仍强行优化全身而污染可见区域的问题。FlexiAvatar 的核心做法是按可见身体部位限制 3D Gaussian 优化,并结合抗遮挡 SMPL-X 跟踪、局部残差细化和扩散式未见区域纹理补全。实验覆盖全身、上半身和头部数据,报告平均 PSNR 约提升 3%,同时在部分可见场景减少需优化与渲染的 Gaussian 数量。

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention Figure 1
2026-07-22cs.CV

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

Indian Institute of Technology Ropar, Deakin University, University of Central Florida, Queensland University of Technology, Murdoch University, Indian Institute of Technology Ropar Rupnagar Punjab India, Deakin University Melbourne Victoria Australia, University of Central Florida Orlando Florida USA, Queensland University of Technology Brisbane QLD Australia, Murdoch University Perth Western Australia Australia

2026-07-22视觉语言

本文针对医学多模态数据中影像、EHR、组学等分布差异大、配对稀缺且融合计算昂贵的问题,提出 CURE:以级联方式逐步接入模态,并用 HyFuse 结合高效残差卷积、混合几何注意力、可学习晚融合和共享信息细化来学习顺序不敏感表征。16 个公开数据集上相对 DRIFA-Net、HEALNet 等最高提升约 3.97%,计算成本最高降低约 87.8%。

Wavefront Parallelization for Efficient Learned Image Compression Figure 1
2026-07-22eess.IV

Wavefront Parallelization for Efficient Learned Image Compression

Shimon Murai, Fangzheng Lin, Kasidis Arunruangsirilert, Jiro Katto

2026-07-22视觉感知

针对学习式图像压缩中空间自回归熵模型解码必须逐像素串行、导致预训练高RD模型难部署的问题,论文将上下文依赖重写为稀疏DAG,提出无需训练的交错wavefront调度,并用Lamport定理说明其在约束下的最优性;结合批处理和Tensorized rANS后,在Kodak等数据上对多种AR骨干取得约13至35倍、最大约71.9倍加速,同时基本保持原BD-rate和bpp/PSNR。

Context-structured Video Anomaly Detection with Large Vision-Language Models Figure 1
2026-07-22cs.CV

Context-structured Video Anomaly Detection with Large Vision-Language Models

Dongjun Kim, Changjae Oh, Andrea Cavallaro, Jeonghoon Mo

2026-07-22视觉语言视觉感知

针对视频异常检测中异常样本稀缺、训练式方法迁移成本高,以及现有 LVLM 整段推理易漏掉局部异常线索的问题,本文提出 CSI-VAD,将视频拆成环境、目标和时间三类上下文分别推理,再用分数或投票聚合。该训练-free 设计不依赖预定义异常文本提示,在 UCF-Crime 和 UBnormal 上稳定优于直接整体推理基线,并达到与已有方法竞争的水平。

Delineate Anything v2: A Global Foundation Model for Field Delineation Figure 1
2026-07-22cs.CV

Delineate Anything v2: A Global Foundation Model for Field Delineation

Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin, Charlotte Julia Li-Xing Wang, Zoltan Szantoi

2026-07-22视觉感知

该文针对大范围农田边界提取中通用视觉模型缺乏地理尺度感、行政地块标签常把多个真实田块合并的问题,提出 Delineate Anything v2。核心思路可能主要来自 scaling / data:构建覆盖61国、7300万实例的 FBIS-73M,并用分辨率感知的数据清洗修复合并地块噪声。其在100国手工基准上较前作提升0.284 mAP@0.5,乌克兰全国制图耗时5.4小时。

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing Figure 1
2026-07-22cs.CV

Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

Xinjie Zhang, Peng Zhang, Shicheng Zheng, Jinghao Guo, Zhaoyang Jia, Yifei Shen, Xun Guo, Yuxuan Luo, Jiahao Li, Wenxuan Xie, Fanyi Pu, Xiaoyi Zhang, Kaichen Zhang, Zongyu Guo, Tianci Bi, Dongnan Gui, Zhening Liu, Zimo Wen, Zihan Zheng, Senqiao Yang, Xiao Li, Jinglu Wang, Bin Li, Yan Lu

2026-07-22视觉感知生成模型

Mage-Flow针对高分辨率生成/编辑在训练、微调和部署中过于昂贵的问题,不再单纯扩大骨干,而是联合优化轻量Mage-VAE、原生分辨率打包的4B扩散Transformer和CUDA融合内核。其结果是在保持重建与生成/编辑质量竞争力的同时,将训练吞吐提升约2.5倍,Turbo版在A100上1024²生成0.59秒、编辑1.02秒。

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions Figure 1
2026-07-22cs.CV

Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions

Qianpu Chen, Derya Soydaner

2026-07-22视觉感知

针对仇恨内容可通过视觉错觉隐藏、导致常规审核模型只看原图而失效的问题,论文将检测改写为“先恢复隐藏含义、再判断危害”的感知检索任务,提出 Adaptive View Retrieval:用多种感知变换构建视图库,并按图像自适应选择可信视图匹配模板。在 HatefulIllusion 上,冻结 CLIP 即达 93.2% balanced accuracy,并优于单一滤波、原图基线及多项跨基准设置。

Contrastive On-Policy Distillation Figure 1
2026-07-22cs.CV

Contrastive On-Policy Distillation

Jiacheng Ruan, Jun Tang, Wenzhen Yuan, Ting Liu, Shuai Bai, Dayiheng Liu, Zhibo Yang, Yuzhuo Fu

Shanghai Jiao Tong University

2026-07-22强化学习

本文关注大模型/VLM推理链过长带来的效率问题:传统在策略蒸馏只匹配单一教师分布,难以区分“有用推理”和冗余延展。COPD让同一学生生成 token 在轻/重推理指令下由冻结教师分别打分,用对数概率差构造逐 token 偏好信号,引导学生学到更紧凑的推理。九个多模态基准显示其能显著缩短推理长度且基本不损性能,并可扩展到无需额外教师的自蒸馏。

Gaze-DETR: Top-Down Guidance Through Priority Maps for Infrared Weak-Small UAV Detection with DETR Figure 1
2026-07-22cs.CV

Gaze-DETR: Top-Down Guidance Through Priority Maps for Infrared Weak-Small UAV Detection with DETR

Nian Liu, Yuxin Yang, Shubo Lin, Sikui Zhang, Liang Li, Boyu Cai, Yizheng Wang, Weiming Hu, Jin Gao

are with the State Key Laboratory of Multimodal Artificial, Intelligence Systems, Institute of Automation, Chinese Academy, School of Advanced Interdisciplinary Sciences, University of, Chinese Academy of Sciences, Beijing 101408, China. S. Zhang, is also with the School of Artificial Intelligence, University, of Chinese Academy of Sciences, Beijing 101408, China. W. Hu, is also with the Beijing Key Laboratory of Super Intelligent, Security of Multi-Modal Information, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China. B. Cai and, W. Hu are also with the School of Information Science and, Technology, ShanghaiTech University, Shanghai 201210, China.

2026-07-22视觉感知

论文针对红外弱小无人机在噪声、杂波和遮挡中易被淹没的问题,指出仅用框监督难以在定位前排序候选区域。Gaze-DETR引入类人视觉搜索的空间优先图,通过RPFM增强高优先响应、PAQI生成解码器锚查询,并用框、高真实凝视或伪凝视监督训练。在TIR-UAV120-Gaze和Anti-UAV410上取得约86-87 mAP50、89-91 F1,优于DINO-DETR等基线。

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling Figure 1
2026-07-22cs.CV

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

2026-07-22强化学习

该文针对小说改编成电影时长程叙事、角色与场景状态易漂移的问题,将任务重定义为“动态电影世界建模”,用构建与演化两阶段、多代理协作来维护实体状态、镜头规划和闭环校验。作者还提出含15部小说与9项指标的FilmEval,实验称较现有视频生成代理在叙事忠实度和跨场景一致性上提升最明显,但像素级运动与空间一致性仍受底层生成模型限制。

CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement Figure 1
2026-07-22cs.CV

CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement

Zhihao Yang, Zhiyu Xiang, Peng Xu, Tianyu Pu, Kai Wang, Eryun Liu, Dongping Zhang, Yong Ding

2026-07-22视觉感知三维

CoGoal3D针对V2X协同感知中主流BEV特征融合忽略高度与姿态差异、导致3D空间错位的问题,提出两阶段框架:先用多尺度3D感知全局融合增强跨车对齐,再以3D点重建辅助细化候选框,并配套多智能体协同数据增强以减少信息损失。在DAIR-V2X、V2V4Real和V2X-Real上,3D AP@0.7分别提升10.86%、10.34%和10.18%。

IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion Figure 1
2026-07-22cs.CV

IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion

Lei Hu

2026-07-22视觉感知

这篇论文针对工业多视角异常检测中遮挡、设备故障导致视角信息缺失的问题,指出现有方法独立建模各视角,缺少跨视角一致性且易过拟合缺失区域。作者构建 RIMAD 不完整多视角基准,并提出 IMMoE,用多视角专家融合补全跨视角信息,结合局部 dropout 与区域自适应损失提升鲁棒性;在 RIMAD 和 Real-IAD 上取得 SOTA,RIMAD 像素级和图像级指标分别提升 11.8% 和 2.8%。

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval Figure 1
2026-07-22cs.CV

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

2026-07-22视觉感知

这篇论文针对零样本视频时刻检索中,查询文本与视频帧或自动字幕之间的模态差异和语言风格差异会导致候选片段不稳定的问题,提出 Self-SiMS:先利用视频内部自相似性生成和评分片段,再用查询感知的 MLLM 重排序。实验称其在多个 ZMR 基准上达到当前最优,但具体增益来源仍需结合完整实验细节判断。

Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation Figure 1
2026-07-22cs.CV

Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation

Jiuhe Qu, Yingping Liang, Ying Fu

2026-07-22视觉感知安全鲁棒

这篇论文针对遥感变化检测中光照、阴影、天气等非语义扰动易被误判为真实变化的问题,提出 SCDistill:用扩散模型生成语义不变的环境扰动样本,并通过语义不变自蒸馏让检测器在干净与扰动图像间保持一致表征。实验称其在多个语义变化检测基准达到 SOTA,并能迁移到二值变化检测和变化描述任务。

Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction Figure 1
2026-07-22cs.CV

Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction

Tianyang Huang, Alessio Lombardi, Ahmed Elnagar, Ahmed Zalouk, George Paul, Sepehr Najjarpour, Arvid Sigurdsson, Khalid Ismail, Mohamed Ragab, Edlira Vakaj

Buro Happold Ltd., London, United Kingdom, Birmingham City University, Birmingham, United Kingdom, is labor-intensive and error-prone. Automating drawing, To fill this research gap, we collaborated with industry ex-, detailed manual labels. Currently, the field is dominated

2026-07-22视觉感知数据集/基准

本文针对 AEC 工程图纸信息抽取仍依赖人工、通用文档布局模型缺乏领域验证的问题,提出将布局检测作为连接标题栏、视图区域与图形内容的关键中间层,并构建 551 张立面工程图的 FELD 基准与 ADIRO 标注体系。实验比较 Faster R-CNN、YOLOv12、RF-DETR、Qwen3-VL 和 DocLayout-YOLO,RF-DETR 达到 mAP50 0.949,Qwen3-VL 的 F1 为 0.911;消融还显示通用文档预训练在该领域可能产生“domain interference”。

SWITi: Quantifying and Reducing Tiling Artifacts with Sliding Window Inner Tiling Figure 1
2026-07-22cs.CV

SWITi: Quantifying and Reducing Tiling Artifacts with Sliding Window Inner Tiling

Federico Carrara, Aman Kukde, Melisande Croft, Joran Deschamps, Florian Jug

2026-07-22视觉感知

大幅面生物医学图像常需分块推理,感受野不足和后验模型独立采样会在拼接处产生伪影,易被误认为真实结构。SWITi在测试时滑动内裁剪窗口并平均重叠预测,把固定缝隙误差分散到不同位置;同时提出无需参考图的FRT和ASV指标。作者在2D/3D荧光显微图像分离任务上显示,该方法在不增加后验模型前向次数的情况下明显削弱拼接缝,并保持或提升重建保真度与分辨率。

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization Figure 1
2026-07-22cs.CV

DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization

Thanni Adewuyi, Angelica Obayi, Andem Aniekan, Samuel Okoko, Angel Ezendu, Ephraim Usani, Ademide Animasaun, Philip Chibundu, Christian Maurice, Mary Donald Essien, Oluwaseun Odunsi, Oluwasegun Oguntuase, Abiodun Adereni

2026-07-22视觉语言强化学习优化算法

针对胸片自动报告常见的格式失守、解剖遗漏和语义幻觉,DobicVLM在MedGemma-4B监督微调后引入GRPO,并用可审计的规则奖励约束结构、解剖清单、语义相似度和长度。模型在1000例私有数据上训练、69例盲评中多数指标优于Gemini 2.5 Flash,印象准确率达27.2%、医学术语达86.5%,但完整性和转诊建议有小幅取舍。

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model Figure 1
2026-07-22cs.CV

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

2026-07-22视觉感知安全鲁棒

针对大视觉语言模型在视觉对抗扰动下跨任务失效、现有防御偏向分类且泛化不足的问题,论文提出 DAFT:用冻结原始视觉编码器约束干净/对抗特征,并以图像描述引导语义对齐,从视觉与语义两路微调 CLIP 编码器。实验显示,仅替换 LLaVA 的视觉编码器即可在零样本分类、图像描述和 VQA 的鲁棒评测中优于 TeCoA、FARE 等方法。

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion Figure 1
2026-07-22cs.RO

NGPS: GPS-Denied Aerial Geo-Localization and 2.5D Reconstruction via Deep Satellite Image Matching and Multi-Rate Sensor Fusion

Sanket Sharma

2026-07-22视觉感知三维

该文面向高空无人机在 GPS 失效、VIO 长程漂移且难以闭环的场景,提出用下视图像与地理配准卫星图做深度特征匹配,并以匹配置信度自适应调节 UKF 噪声,结合速度预测搜索窗口和多频率时间队列融合 VIO/IMU。五段 60–150 m 飞行中定位 RMSE 为 2.94 m,较单目 VIO 提升约 3.5 倍,并支持实时 2.5D 正射重建。

Learning Explicit Physical Parameter Control and Benchmarking for Video Generation Figure 1
2026-07-22cs.CV

Learning Explicit Physical Parameter Control and Benchmarking for Video Generation

Yanxun Li, Hao Wen, Bingze Song, Jiashu Zhu, Aiming Hao, Chubin Chen, Jintao Chen, Jiahong Wu, Xiangxiang Chu, Miao Wang

State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University

2026-07-22视觉感知规划控制数据集/基准

这篇论文针对现有图像到视频模型“看起来合理但不受显式物理参数支配”的问题,构建了含13万条刚体仿真视频的 PhyParam-Dataset,并提出用物理注意力路由绑定物体级力、质量、摩擦、恢复系数与场景重力的扩散模型,同时配套 PhyParam-Bench 评估物理一致性。实验显示其在保持视觉质量的同时提升物理可控性和一致性,但范围仍限于紧凑刚体,扭矩、软体和流体等未充分覆盖。

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering Figure 1
2026-07-22cs.CV

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

School of Electrical and Information Engineering, Tianjin University, The International Joint Institute of Tianjin University, Fuzhou, Tianjin University, Department of Automation, Tsinghua University

2026-07-22视觉语言强化学习规划控制

长文档多模态问答中,不同问题对局部文本、表格结构、跨页聚合和页面图像的证据需求不同,固定式 RAG 容易过度或不足检索。TAP-RAG 的核心是用 TAPC 为每个查询生成可执行策略,再控制图扩散、视觉检查、证据融合和拒答阈值。实验在 DocBench 与 MMLongBench-Doc 上较同骨干 RAG-Anything 分别提升 9.1 和 4.5 个百分点,表明收益主要来自查询时证据使用控制。

SynGallery: A Synthetic Gallery of Real Paintings for Instance-Level Artwork Recognition Figure 1
2026-07-22cs.CV

SynGallery: A Synthetic Gallery of Real Paintings for Instance-Level Artwork Recognition

Patryk Bartkowiak, Jakub Markil, Bartosz Kotrys, Dominik Michels, Sören Pirk, Wojtek Palubicki

2026-07-22视觉感知

这篇论文针对艺术品实例识别中“馆藏目录照训练、游客现场照测试”的域差问题,提出 SynGallery:把真实画作目录图贴入程序生成的 3D 展厅,随机视角、灯光、画框、玻璃等场景因素,同时保持作品身份不变。核心洞察是收益主要来自几何视角变化而非逼真相机退化;在 Met 上,合成图单独训练优于同量 studio 图,加入全量训练集后 GAP 从约35.97提升到38.48。

Local Label-Informed Feature Transfer for Generating Ground-Truth Medical Images: A Comparison of GAN- and Diffusion-Based Approaches Figure 1
2026-07-22cs.CV

Local Label-Informed Feature Transfer for Generating Ground-Truth Medical Images: A Comparison of GAN- and Diffusion-Based Approaches

Rick Wilming, Irem Ozseker, Luca Matteo Cornils, Ahcène Boubekki, Benedict Clark, Danny Panknin, Stefan Haufe

2026-07-22视觉感知生成模型

为评估医学影像 XAI,需要既真实又有已知判别区域的病灶数据;该文提出 LLIFT,在无需像素级病灶标注训练的情况下,将弱标签学习到的病理特征注入用户指定 MRI 区域,并比较 GAN 与 ControlNet 扩散修复实现。实验显示两者生成分布的 FID 接近健康/病理类间参考,视觉上病灶较真实,但对 XAI 评测有效性的增益仍主要依赖该半合成设定。

Wave2Body: Rethinking mmWave Human Pose Estimation as Radar-to-Body Token Translation Figure 1
2026-07-22cs.CV

Wave2Body: Rethinking mmWave Human Pose Estimation as Radar-to-Body Token Translation

Bo Liang, Chen Gong, Wei Gao, Chenren Xu

School of Computer Science, Peking University 2 University of Pittsburgh, Key Laboratory of High Confidence Software Technologies, Ministry of Education (PKU)

2026-07-22三维

Wave2Body针对毫米波点云稀疏、视角相关导致3D人体姿态恢复欠约束的问题,认为直接从雷达到关节坐标回归会把雷达表征、人体先验和跨模态对齐混在有限配对数据中学习。其核心是将任务改为雷达到身体token翻译:分别预训练自监督雷达tokenizer和组合式身体VQ-VAE,再用轻量翻译器与根位置头做配对对齐。在M4Human和mmBody上,跨主体、跨动作及mmBody MPJPE分别有约9.7%、3.8%、8.2%改进,并显著降低训练和推理FLOPs。

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification Figure 1
2026-07-22cs.CV

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

Bohan Su, Jiashuo Wang, Fangyi Liu, Mang Ye

2026-07-22三维

这篇论文针对通用行人重识别在遮挡、换装和跨模态场景中过度依赖2D外观的问题,提出UniGeo:将单目SMPL几何转为运动学关节结构,并用一致性感知可靠性门控只在3D估计可信时作为残差注入,避免噪声负迁移。实验显示其在结构线索更关键的PRCC、Occluded-Duke和SYSU-MM01上分别带来Rank-1提升,同时在常规数据集上保持竞争力。

Think Sparse, Predict Dense: Continuous Thought Machines for Image Super-Resolution Figure 1
2026-07-22cs.CV

Think Sparse, Predict Dense: Continuous Thought Machines for Image Super-Resolution

Zekai Shi

Xi’an Jiaotong University

2026-07-22视觉感知

本文针对连续思维机器从分类等紧凑决策扩展到超分辨率时会丢失位置证据的问题,提出 DQ-CTM/ThinkSR,用低秩方式把窗口级紧凑思维状态转成逐位置 dense queries,在保留密集特征载体的同时按 thought tick 迭代重建。初步四步实验显示 PSNR-Y 从 28.10 提升到 30.28,100 张图均随 tick 改善,但评估范围较小,增益来源和与强递归基线的比较文中未充分说明。

OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation Figure 1
2026-07-22cs.CV

OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation

Shuimu Chen, Jing Jin, Nan Su, Hongbo Xu, Zebang Cheng, Wenming Yang, Fei Ma, Guijin Wang

Tsinghua University, Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), Shenzhen University

2026-07-22视觉感知强化学习

OPD-IAD针对LVLM工业异常检测中“能生成判断但难以稳定转成像素级热图”的问题,提出用含缺陷证据的特权上下文,对模型自身在线生成轨迹做密集自蒸馏,并以最终判断重编码出正常/异常语义锚点,再与密集视觉特征对比生成热图。实验称其在五个IAD数据集上整体优于现有LVLM方法,多数图像级、像素级和问答指标领先。

Open-Vocabulary Gaze Object Prediction: Benchmark and Method Figure 1
2026-07-22cs.CV

Open-Vocabulary Gaze Object Prediction: Benchmark and Method

Binglu Wang, Sensen Niu, Ying Chen, Guangyu Guo

Xi’an University of Architecture and Technology, DAMO Academy, Alibaba Group, Zhejiang University, Xi’an University of Architecture and Technology College of Artificial Intelligence and Rebotics Xi’an China, Xi’an University of Architecture and Technology College of Computer and Information Engineering Xi’an China, DAMO Academy, Alibaba Group Hangzhou China, Zhejiang University College of Computer Science and Technology Hangzhou China

2026-07-22数据集/基准

论文针对现有凝视目标预测依赖封闭类别、难以处理真实场景长尾和未见物体的问题,提出 DiSG 基准,覆盖86类野外凝视对象并设置开放词汇评测;方法将文本驱动候选发现与凝视引导选择解耦,并用 GIST 选择性微调以保留语义泛化。实验显示其在开放词汇设置有效,并在传统封闭词汇 GOP 上超过既有方法。

In-Context Learning for Wound Classification with Small Multimodal Language Models Figure 1
2026-07-22cs.CV

In-Context Learning for Wound Classification with Small Multimodal Language Models

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

Jönköping University, Jönköping, Sweden, Halmstad University, Halmstad, Sweden, Centre for Reliable Machine Learning, Royal Holloway, University of London, Egham, Surrey, UK

2026-07-22视觉语言

论文针对伤口图像分类依赖大量标注和任务重训的问题,考察小型多模态语言模型能否通过检索式上下文学习实现免训练适配。核心洞察是按查询检索相似支持图像,尤其结合 MMR,比零样本和随机 few-shot 更稳定,并不只是 kNN 投票。Qwen 3.5 27B 在 Kaggle 上达 0.872 准确率、0.871 F1,在 Medetec 上达 0.678 准确率、0.670 F1,增益仍受模型规模、检索策略和数据集难度影响。

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting Figure 1
2026-07-22cs.CV

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

2026-07-22视觉感知三维

ZeroSplat针对现有指称式3D Gaussian Splatting只能处理单目标、且依赖逐场景语义特征优化的问题,提出更贴近真实指令的GR3DGS任务,要求分割零个、一个或多个目标。其核心思路是不向高斯点额外存储语义特征,而是利用多视角几何约束把2D VLM先验提升到3D点级空间,直接在原始高斯集合中定位目标。论文还构建GR-LERF与GR-ScanNet基准,并报告在广义与单目标场景中均优于现有方法且效率更高。

UVFaceFusion: Fast Multi-view Topologically Consistent Face Reconstruction in the Wild via UV-space Neural Fusion Figure 1
2026-07-22cs.CV

UVFaceFusion: Fast Multi-view Topologically Consistent Face Reconstruction in the Wild via UV-space Neural Fusion

Xin Ming, Yuxuan Han, Junhai Yong, Feng Xu

School of Software and BNRist, Tsinghua University, School of Software and BNRist, Tsinghua University Beijing China

2026-07-22三维

面向数字人制作中“高保真几何”和“固定拓扑、野外泛化”难以兼得的问题,UVFaceFusion将多视角VGGT点图借助Pixel3DMM对应关系提升到统一UV空间,用带mask的神经融合替代启发式BA拓扑优化。方法只在Ava-256训练,却能泛化到多基准和日常采集,16视图在RTX 4090上少于3秒重建,并报告达到SOTA精度。

STS-NET: Spatio-Temporal Stress Network for Self-Supervised Crop Stress Detection using Satellite Image Time Series Figure 1
2026-07-22cs.CV

STS-NET: Spatio-Temporal Stress Network for Self-Supervised Crop Stress Detection using Satellite Image Time Series

Pradeep Dalal, Rajiv Ranjan, Sushil Ghildiyal, Shashank Tamaskar, Neeraj Goel

P. Dalal, S. Ghildiyal, and N. Goel are with the Department of Computer Science and Engineering, Indian Institute of Technology, Autonomous Systems, Plaksha University, Mohali 140306, India (e-mail:

2026-07-22视觉感知

针对作物水分和氮素胁迫早期检测依赖人工巡田、标注数据稀缺且难以建模时序变化的问题,STS-NET用自监督3D卷积自编码器从PlanetScope卫星时间序列及NDVI、GNDVI、RECI、NDRE等植被指数中学习时空特征,再接传统分类器识别甘蔗胁迫。在受控田块验证中,水胁迫、氮胁迫和复合胁迫精度分别为97.98%、85.08%和83.47%,但跨地区、跨作物泛化仍文中未充分说明。

Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation Figure 1
2026-07-22cs.CV

Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

Amber Yijia Zheng, Lu Liu, Raymond A. Yeh, Xi Yin

2026-07-22视觉感知规划控制

本文关注文本到视频生成中训练数据被系统性忽视的问题,用程序化 Moving Alphabet 控制字母外观、运动、时长与字幕噪声,隔离数据分布和标注质量的影响。实验显示,内容复杂度与视频长度的均衡混合比单一专长数据更利于泛化;字幕正确性和完整性显著影响性能与训练效率,且错误字幕带来的损失难以靠 CFG 或少量高质量微调完全弥补。

Image Editing Models are Numerical Solvers Figure 1
2026-07-22cs.CV

Image Editing Models are Numerical Solvers

Ulysse Mizrahi

Tel Aviv University

2026-07-22视觉感知优化算法

论文动机是把各类 PDE/物理仿真从专用离散化和数据结构中抽象出来,探索是否可用同一图像编辑接口表示。核心做法是将输入、边界和解场渲染为图像,并用 LoRA/AdaLN 适配标量参数,让 FLUX 类预训练编辑模型学习数值映射。实验覆盖椭圆方程、热/Burgers、Navier-Stokes、弹性、断裂和最优传输等,显示模型可拟合多种静态与时变场及冲击行为,但守恒、稳定性、数值范围和混沌长时预测仍受限。

CGMap: A Geospatially Aware Deep Learning Framework for Crop Gap Mapping Using UAV Figure 1
2026-07-22cs.CV

CGMap: A Geospatially Aware Deep Learning Framework for Crop Gap Mapping Using UAV

Karan Sharma, Rajiv Ranjan, Dinesh Kumar, Shashank Tamaskar

2026-07-22视觉感知

针对印度甘蔗早期出苗依赖人工巡田、漏检缺苗会造成减产的问题,CGMap用无人机正射影像和YOLOv8检测幼苗,再将检测中心转为地理点云,并用MST做行向归一化以适配不同种植方向,推断连续缺株并导出WKT缺苗图。文中称可在约30分钟内生成田块级发芽图并支持补栽决策,但检测精度和增产幅度量化不充分,泛化仍需多年多地验证。

Privileged Lesion-Context Relational Distillation for Mask-Free Skin Lesion Classification Figure 1
2026-07-22cs.CV

Privileged Lesion-Context Relational Distillation for Mask-Free Skin Lesion Classification

Abu Mukaddim Rahi, Md Mithun Hossain, Md Zulficar Hasan Joy, M. F. Mridha, Md. Jakir Hossen

2026-07-22视觉感知

针对皮肤病灶分类中分割掩码有助于定位但推理阶段不实用的问题,论文提出 PLCRD:训练时让教师模型利用原图与掩码病灶视图,学生仅看原图,并通过病灶-上下文关系、注意力和分布蒸馏吸收掩码信息。其核心在于传递关系结构而非直接对齐特征,支持异构网络;在 HAM10000 上 macro-F1 为 0.773、AUROC 为 0.976,并在 ISIC 2018 外部验证 macro-F1 达 0.732。

GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors Figure 1
2026-07-22cs.CR

GLID: Gated Local Intrinsic Dimension Repairs the Blind Spots of Face-Forgery Detectors

Guang Yang, Fengchen Liu

University of California, Los Angeles, University of California, Berkeley

2026-07-22视觉感知

这篇论文针对人脸伪造检测器在训练未覆盖生成器上接近失效的问题,提出 GLID:把单张图像的 ViT patch token 视为流形,在多层估计局部内在维度,并通过置信门控只在基模型不确定时注入几何信号。核心洞察是 GAN 与扩散伪造会在不同网络深度扰动 token 流形,且微调只会吸收已覆盖家族的辅助增益。实验在 16 轴跨生成器基准上取得 0.805 mean AUC,优于重训基线,生成类轴提升 +0.084 AUC,但 T2I 和野外场景仍有更强对手。

Cross-Modal UAV Object Tracking: State-Aware Representation Learning and A Unified Benchmark Figure 1
2026-07-22cs.CV

Cross-Modal UAV Object Tracking: State-Aware Representation Learning and A Unified Benchmark

Yun Xiao, Zhihong Hong, Jiandong Jin, Chenglong Li, Jin Tang, Amir Hussain

2026-07-22视觉感知数据集/基准

这篇论文针对无人机在可见光与热红外间切换时,目标外观突变和双相机位置差导致的空间偏移问题,提出单分支的状态感知跟踪方法 SARLA,用模态状态与空间状态 token 分别建模跨模态外观关联和跨帧位移,并加入空间偏移预测损失;同时发布含 1079 段、67 万余帧的 CM-UOT 基准,在该数据集上相对 20 个跟踪方法取得更优表现。

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks Figure 1
2026-07-22cs.CV

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

Lachlan McGinness

Australian National University, Acton, ACT, Australia

2026-07-22视觉感知学习理论

本文针对小语言模型在手写试卷视觉评分中易被整页扫描的无关内容干扰、且视觉 token 成本高的问题,检验用预先定位的 bounding box 只裁出答题区域是否有效。核心洞察是把版面定位前置为简单预处理,可降低模型的视觉搜索负担。基于澳大利亚物理奥赛126份手写答卷和4B到72B开源VLM的实验,裁剪显著提高评分准确率并减少FLOPs;但样本和题型较窄,泛化到复杂评分任务仍需更多验证。

Posterior Samplings are Missing Modalities Generators for Medical Image Translation Figure 1
2026-07-22cs.CV

Posterior Samplings are Missing Modalities Generators for Medical Image Translation

Jonghun Kim

2026-07-22视觉感知

针对临床 MRI 常因采集时间和协议限制缺失部分模态、而既有翻译模型多绑定固定源-目标组合的问题,本文把缺失模态生成建模为联合分布下的线性逆问题,用 flow matching 学习完整多模态先验,并在推理时通过后验采样约束已观测模态一致性;同时用 many-to-one 采样缓解多目标生成误差传播。在 BraTS、IXI 及肿瘤分割下多数场景优于基线,显示合成图像更能保留临床相关结构。

Weakly Supervised Pathology-Informed Representation Learning for PET-Based Content Retrieval of Intra-Tumour Heterogeneity Figure 1
2026-07-22cs.CV

Weakly Supervised Pathology-Informed Representation Learning for PET-Based Content Retrieval of Intra-Tumour Heterogeneity

Rajat Vashistha, Sandra Brosda, Lauren G. Aoude, Christine Jestin Hannan, James M. Lonie, Jessica Ng, Andrew Nathanson, Ellie Vloedmans, Caroline Cooper, Andrew P. Barbour, Viktor Vegh

School of Human Movement and Nutrition Sciences, Faculty of Health, Medicine and Behavioural Sciences, The, University of Queensland, Brisbane, Australia, Frazer Institute, Faculty of Health, Medicine and Behavioural Sciences, The University of Queensland, Brisbane, Department of Surgical Sciences, Uppsala University, Uppsala, Sweden., PA Southside Clinical Unit, Faculty of Health, Medicine and Behavioural Sciences. The University of Queensland, biopsy approach. The code will be made available upon publication at GitHub: https://github.com/rajat-mae/virtual-, H&E representations for downstream pathology tasks [8]. Particularly for the cases of weak labels, sparse and noisy

2026-07-22视觉感知

针对PET全肿瘤代谢信息难以刻画组织学异质性、而H&E又侵入且难与PET配准的问题,本文用弱监督教师-学生框架把H&E表征用于训练、推理时仅需PET,并引入热点条件嵌入、伪体素/最优传输监督来学习肿瘤内异质性。实验显示病理信息与热点建模逐步提升检索表现,热点表示优于全局PET和传统基线,且原型并非只反映高FDG摄取。

SkyEV: RGB-Event UAV detection and tracking dataset and baseline Figure 1
2026-07-22cs.CV

SkyEV: RGB-Event UAV detection and tracking dataset and baseline

Jakub Mandula, Sebastian Heusinger, Julian Moosmann, Christian Vogt, Michele Magno

2026-07-22视觉感知数据集/基准

面向机场等反无人机场景中小目标、强光/杂背景和相机自运动导致的视觉检测困难,SkyEV发布同步未压缩RGB与双事件相机数据,覆盖8类无人机、不同镜头和复杂真实条件,并配套统一加载器与RGB-事件融合基线。实验用于建立该数据集上的检测/跟踪基准,显示多模态方案可处理小尺度目标,但具体增益幅度文中未充分说明。

Continual Video-MLLM Adaptation over Evolving Domains Figure 1
2026-07-22cs.CV

Continual Video-MLLM Adaptation over Evolving Domains

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

School of Software Technology, Zhejiang University, Ningbo, China, Zhejiang Key Laboratory of Digital-Intelligence Service Technology, China, Hong Kong Polytechnic University, Hong Kong SAR, The University of Southern Queensland, Australia

2026-07-22视觉感知

这篇论文针对 Video-MLLM 在真实部署中视频域持续变化、直接微调易遗忘且共享适配空间会互相干扰的问题,提出 DAER:冻结主干,用按域隔离的轻量专家承载增量知识,并用基于原型分布匹配的域内/域间路由在无任务标签推理时选择专家,还通过相似域合并控制参数增长。十个 VidQA 域上的实验显示,DAER 在两类主干上优于既有方法,InternVideo2.5-8B 平均准确率由 64.38% 提升到 67.59%,遗忘从 1.81 降到 -0.14。

Confidence-Gated Vision-Only Heading Alignment for UAV-UGV Cooperative Systems Figure 1
2026-07-22cs.RO

Confidence-Gated Vision-Only Heading Alignment for UAV-UGV Cooperative Systems

Reza Ahmari, Vahid Hemmati, Parham Kebria, Olusola Odeyomi, Kaushik Roy, Abdollah Homaifar

2026-07-22视觉感知

这篇论文关注 UAV-UGV 协作中“视觉航向预测何时应被执行”为控制命令的问题,而非重新训练预测器。核心做法是在固定预测器上加入置信门控,用检测框面积和短窗航向波动分别刻画可见性与稳定性,并比较冻结保持与有界混合回退。真实数据及扰动实验显示,门控提升被执行帧精度但牺牲执行率;稀疏执行下冻结策略会累积过期命令误差,有界混合能改善命令级精度和平滑性。

Generative World Renderer at the Speed of Play Figure 1
2026-07-22cs.CV

Generative World Renderer at the Speed of Play

Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang

2026-07-22生成模型强化学习

这篇论文针对原始 AlayaRenderer 质量较高但 50 步扩散、G-buffer 编码和 VAE 解码过慢,难以用于实时交互的问题,提出 AlayaRenderer-Flash:把固定窗口渲染改为自回归流式生成,引入分层历史压缩、4 步蒸馏和轻量编解码器,在保留 G-buffer 与文本提示控制的同时,将速度从 0.56 FPS 提升到 31.54 FPS,并展示了可在物理引擎中 30 FPS 运行的可玩生成式世界。

Decoupled Pipeline with Proposal Reranking and Score Fusion for Positive-Unlabeled Marine Species Detection Figure 1
2026-07-22cs.CV

Decoupled Pipeline with Proposal Reranking and Score Fusion for Positive-Unlabeled Marine Species Detection

Robert James Brock, Sebastian Maximilian Krupa, Jason Kahei Tam

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332

2026-07-22视觉感知

本文针对 FathomNetCLEF 2026 中海洋物种检测的稀疏标注、正例-未标注评测和训练/测试域偏移问题,提出将检测与细粒度分类解耦:用冻结 Megalodon YOLOv8x 生成全局与切片候选框,再由 LoRA 微调的 DINOv3 ViT-H 分类,并用检测与分类置信度几何融合重排。核心洞察是保留候选召回、避免过强过滤和改进排序,比微调检测器或 noisy pseudo-label 更有效;最终私榜 mAP 0.1757,102 队第 12。

Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models Figure 1
2026-07-22cs.CV

Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models

Gautam Rajendrakumar Gare, Jia Shi, Zhiqiu Lin, Deepak Pathak, John Galeotti, Deva Ramanan

2026-07-22视觉语言视觉感知

这篇论文针对用 LLM 根据类别名生成属性来解释 CLIP 零样本分类的问题,指出这类属性主要依赖类别名而非图像证据,移除类别名后 ImageNet 准确率从 59.5% 跌至 15.5%。作者改为用目标图像集合在 CLIP 空间中从属性池筛选每类属性,使无类别名提示达到 23.8%,在多种 ImageNet 分布偏移上保持增益,并在单样本设置下优于 CoOp 且计算更快。

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching Figure 1
2026-07-22cs.CV

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

Xin Xu, Shuhao Zhan, Wei Liu, Zheng Wang, Kui Jiang, Chia-Wen Lin

2026-07-22视觉感知

这篇论文针对传统可见光-红外行人重识别默认查询与图库模态固定、难以适应开放场景中可见-only、红外-only或混合查询的问题,提出VIMI-ReID任务并重组SYSU、RegDB基准。核心洞察是同模态相似性既有利于同模态匹配,也会干扰跨模态匹配;MAMT用共享与模态特定Transformer及自适应匹配模块动态融合特征,实验显示其在SYSU-VIMI和RegDB-VIMI上优于现有VI-ReID方法。

Cross-Dataset Generalization in Breast MRI Tumor Classification via Class-Wise Dataset Mixing Figure 1
2026-07-22cs.CV

Cross-Dataset Generalization in Breast MRI Tumor Classification via Class-Wise Dataset Mixing

Mohammad Ali Dadrast, Hamid Usefi

2026-07-22学习理论数据集/基准

本文关注乳腺 MRI 肿瘤分类在跨机构数据上的失效:模型可能把数据集来源当作标签捷径,而非学习肿瘤特征。作者用 Duke、fastMRI 构造标签与来源完全混淆的训练集,并在独立多中心 MAMA-MIA 上验证,发现外部准确率接近随机;再通过类内混合让每个类别都包含两个来源样本,在相同模型下将 EfficientNet-B3 准确率/F1 提升至 0.8884/0.8994,说明数据组合方式本身是泛化可靠性的关键因素。

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts Figure 1
2026-07-22cs.CV

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

Department of CMPS, University of British Columbia, Canada, Department of Computer Science, University of British Columbia, Canada

2026-07-22视觉语言视觉感知

本文关注视觉语言模型在机器人/工业巡检中容易漏判“物体关键部件缺失”的风险,构建经人工验证的 MissingBench-Verified,专测飞机无发动机等违背常识先验的图像。结果显示,10个领先 VLM 均有显著失败率,即使给出裁剪、增强、外部检测器等工具证据,模型仍常坚持内部先验,提示该问题难靠提示或事后校正解决。

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking Figure 1
2026-07-22cs.CV

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

2026-07-22视觉感知

这篇论文针对视频生成在熔化、挤压、破裂等非刚体形变中常把注意力分散到无关区域、导致物理不一致的问题,提出 DeforM:先用 VLM 推理目标物体并生成时空掩码,再通过免训练注意力调制或训练式掩码注入,把生成能力集中到物理关键区域。实验显示其在形变场景的视觉质量和物理一致性上优于多种基线,但具体增益与基座模型能力、训练数据规模的关系仍需进一步拆分说明。

Fluid-SDF: Ultra-Lightweight and Editable Implicit Shape Representation via Differentiable Primitives Figure 1
2026-07-22cs.CV

Fluid-SDF: Ultra-Lightweight and Editable Implicit Shape Representation via Differentiable Primitives

Pradyumna Sripada, Chinmay Nadgir, Ksheer Agrawal, Krishna Kanth Kodanganti

University of California, San Diego (UCSD)

2026-07-22视觉感知

针对MLP式隐式形状表示参数多、难编辑且易受噪声影响的问题,Fluid-SDF用可微CSG框架替代神经网络,以仿射椭圆原语和LogSumExp平滑并集表示2D SDF。论文报告其在少于100个参数下可重建复杂非凸形状,mIoU达到或超过同等预算MLP,并在20%噪声下更抗过拟合;同时参数可直接编辑,但3D效果主要停留在公式扩展,实证仍限于2D。

Deep Learning Estimation of Sex, Age, Height, and Weight from CT-derived Digitally Reconstructed Radiographs Figure 1
2026-07-22cs.CV

Deep Learning Estimation of Sex, Age, Height, and Weight from CT-derived Digitally Reconstructed Radiographs

Tomohiro Kikuchi, Kohei Yamamoto, Yukihiro Nomura, Yosuke Yamagishi, Takeharu Yoshikawa, Toshiaki Akashi, Jun Kamohara, Hiroyuki Fujii, Harushi Mori

Department of Radiology, Jichi Medical University, 3311-1 Yakushiji, Shimotsuke-shi, Tochigi, 329-0498, Japan., Data Science Center, Jichi Medical University, 3311-1 Yakushiji, Shimotsuke-shi, Tochigi, 329-0498, Japan., Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital, 7-3-1, Center for Frontier Medical Engineering, Chiba University, 1-33 Yayoicho, Inage-Ku, Chiba, Japan., Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo, 7-3-1 Hongo, Department of Diagnostic Radiology, Tokyo Metropolitan Institute for Geriatrics and Gerontology, 35-2 Sakae-cho, Jichi Medical University, 3311-1 Yakushiji, Shimotsuke, Tochigi, 329-0498, Japan, Large-scale, multi-institutional medical imaging databases are increasingly available for artificial, inference code are publicly available.

2026-07-22视觉感知

这篇论文针对医学影像库中性别、年龄、身高、体重等基础元数据缺失或不一致的问题,将三维 CT 转成保持真实尺度的冠状 DRR,并用 ConvNeXt、ViT、MaxViT 多任务集成同时预测四类属性。在日本九机构 12.9 万次 CT 上训练验证,外部测试性别准确率达 0.997,年龄、身高、体重 MAE 分别为 3.57 年、2.59 cm、3.40 kg;跨非日本数据身高误差上升,提示泛化仍受人群分布影响。

Seeing Before Generating: Object Perception Enhances Single-View 3D Reconstruction Figure 1
2026-07-22cs.CV

Seeing Before Generating: Object Perception Enhances Single-View 3D Reconstruction

Y Huynh, Duc Thanh Nguyen, Mohamed Abdelrazek

Deakin University, School of Information Technology

2026-07-22三维

单视图三维重建常因只依赖几何或生成先验而在遮挡、语义一致性和结构合理性上不稳。本文的核心洞察是先“看懂”物体,再生成形状:将预训练 VLM、LLM 与单目深度模型提取的语义和几何感知信号,以模型无关、即插即用方式注入现有重建管线。作者在两个主流单视图三维重建流程和基准数据上报告了持续且明显的性能提升,表明显式物体感知能有效缓解单视图重建歧义。

Norm or Direction? Decoding Vision Mambas for High-Resolution Vision Figure 1
2026-07-22cs.CV

Norm or Direction? Decoding Vision Mambas for High-Resolution Vision

Jin Yu, Juyoun Park

Center for Humanoid Research, Korea Institute of Science and Technology

2026-07-22视觉感知

本文针对 MambaOut 在分类上可替代 VMamba、但 VMamba 在高分辨率密集任务仍占优的矛盾,分析两者表征是否真正不同。核心洞察是把空间 token 分解为范数与方向:MambaOut 依赖少量高范数前景 token,而 VMamba 主要把判别信息保存在方向并更广泛分布。实验显示这种方向编码在高分辨率分类和全量微调分割中更稳定,但具体由哪些 SSM/模块成分导致仍文中未充分说明。

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs Figure 1
2026-07-22cs.CV

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

Binesh Sadanandan, Vahid Behzadan

2026-07-22视觉语言数据集/基准

这篇论文针对医学视觉语言模型常用注意力热图是否真的指向诊断依据的问题,提出用放射科标注框、像素掩码和16×16遮挡因果图联合评估解释忠实性。结果显示,多种MedGemma、Qwen3-VL、LLaVA-RAD等VLM的热图要么不随因果重要区域变化,要么几乎未用图像,且掩码内归因不超过22%;相同协议下CXR分类器能通过,说明问题主要在VLM热图解释而非评估指标。

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data Figure 1
2026-07-22cs.CV

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb, Hakim Ghazzai, Jonathan Klein, Katja Froehlich, Soeren Pirk, Wojciech Palubicki, Gianluca Setti, Ahmed M. Eltawil, Dominik L. Michels

Department of Computer Science, University of Calgary, Canada, Department of Computer Science, Kiel University, Germany, Department of Artificial Intelligence, Adam Mickiewicz University, Poland, Department of Electronics and Telecommunications, Polytechnic University of Turin, Italy

2026-07-22视觉感知

本文针对温室番茄表型中真实标注稀缺、遮挡密集导致基础分割模型零样本效果下降的问题,构建UE5程序化樱桃番茄温室生成合成数据,并用其微调SAM 3,结合LoRA、全量微调和权重插值保留通用视觉先验。在三个真实番茄数据集上,最佳模型将零样本宏观果实IoU从52.7%提升到65.6%,但增益可能主要来自合成数据规模与域专门化。

Robust Multi-View Classification under Noisy Supervision via Global Anchor Consensus Figure 1
2026-07-22cs.LG

Robust Multi-View Classification under Noisy Supervision via Global Anchor Consensus

Yuliang Yang, Hongzhe Zhang, Huiru Wang

College of Science, Beijing Forestry University, Beijing 100083, China, School of Software, North University of China, Taiyuan, Shanxi 030051, China

2026-07-22视觉感知安全鲁棒

这篇论文针对多视图分类中训练标签含噪且模型会逐步记忆错误监督的问题,提出 GALA:用每个视图的全局类别锚点作为比单样本预测更稳定的参照,结合跨视图一致性与分类置信度审计标签,并对可疑样本降权、在锚点候选与模型预测一致时才改标。六个数据集实验显示其在 36 个设置中 33 个排名第一,50% 噪声下较最强基线平均提升 7.34 个百分点。

Physics Closure Matters for Machine Olfaction: A Maxwell--Stefan Graph Solver for Identifiable Dynamic Gas Unmixing Figure 1
2026-07-22cs.CV

Physics Closure Matters for Machine Olfaction: A Maxwell--Stefan Graph Solver for Identifiable Dynamic Gas Unmixing

Yue Shi, Liangxiu Han, Xin Zhang, Tam Sobeih

2026-07-22优化算法

本文针对机器嗅觉中传感器响应低维、延迟且由传输、吸附和读出耦合导致的气体解混欠定问题,指出仅拟合时间序列会产生物理闭合错配。其核心是 UnMixNet:把 Maxwell–Stefan 多组分扩散、竞争吸附和非线性传感器转导离散为可微图求解器,用守恒通量投影约束反演过程。实验在 SmellNet 上提升单气味识别、已见/未见混合解混,并在 UCI 动态气体数据上显示推断浓度与设定变化更一致,但中间物理状态仍主要依赖模拟一致性验证。

Recti-Q: Feature-Space Rectification for Out-of-Distribution-Robust Quantized Perception in Edge Robotics Figure 1
2026-07-22cs.CV

Recti-Q: Feature-Space Rectification for Out-of-Distribution-Robust Quantized Perception in Edge Robotics

Hamidreza Yaghoubi Araghi, Parastoo Pilevar, Ming C. Lin

Project Page and Code are available at Recti-Q

2026-07-22机器人安全鲁棒

这篇论文关注边缘机器人中常用的后训练量化:模型在干净数据上精度几乎不降,却会在噪声、恶劣天气和域偏移下显著失稳。作者将其定义为量化诱导鲁棒性缺口,并提出 Recti-Q:冻结4-bit量化骨干,只在分类头加入小型 LoRA 特征校正适配器,用源域数据训练。ImageNet-C 和 PACS 实验显示其能恢复相当一部分 OOD 鲁棒性,有时接近或超过 FP32,同时额外参数低于1%、基本保留量化节省。

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation Figure 1
2026-07-22cs.CV

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, Hung-Yu Tseng

University of Illinois Urbana-Champaign, Carnegie Mellon University, University of Illinois Urbana-Champaign Champaign-Urbana Illinois USA, Carnegie Mellon University Pittsburgh Pennsylvania USA

2026-07-22生成模型三维

AniGS针对3DGS重建场景通常静态、缺少风吹植被等环境动态的问题,将静态大场景表示为canonical 3DGS,并用时间条件形变场建模运动;关键在于把视频扩散先验嵌入迭代的数据-模型更新流程,逐步扩展视角覆盖,并用组合式video-to-video refinement限制静态区域漂移。五个真实大型户外场景实验显示其能生成较自然的分布式环境运动和较高质量新视角视频,但对落叶、昼夜变化等大幅不可逆状态变化仍受限。

Signed Rectified Flow: Negativity-Controlled Generation Figure 1
2026-07-22cs.LG

Signed Rectified Flow: Negativity-Controlled Generation

Runlong Liao, Baiyu Su, Lizhang Chen, Qiang Liu

2026-07-22生成模型规划控制

这篇论文针对生成模型中“想要什么”和“必须避开什么”难以同时建模的问题,将 Rectified Flow 扩展到带正负分布的 signed measure,并证明负质量会形成不可穿越的排斥区域,从而得到按密度比自适应调节的 guidance。实验显示它在 ImageNet 上改善 FID 与召回权衡,在 PointMaze 规划中减少穿墙轨迹,并降低记忆化与不安全概念生成,同时基本保持图像质量。

DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer Figure 1
2026-07-22cs.CV

DuSPiT: Dual-Branch Sub-Patch Pixel Diffusion Transformer

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi

The University of Texas at Austin

2026-07-22生成模型

本文针对像素空间扩散 Transformer 中单一 patch token 同时承担全局建模与局部细节保真的矛盾,提出 DuSPiT:用紧凑 base 分支负责跨 patch 结构推理,高容量 pixel 分支按子 patch 组织外观信息,并通过交叉注意力和层级位置编码对齐两者。实验显示其在纹理、锐利结构等细粒度生成质量上优于既有像素空间 DiT,同时保持更好的质量与效率折中。

Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation Figure 1
2026-07-22cs.CV

Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

Jiabing Yang, Yixiang Chen, Yuan Xu, Qisen Ma, Tao Yu, Peiyan Li, Yingda Li, Yan Huang, Liang Wang

University of Chinese Academy of Sciences, University of Chinese Academy of Sciences Institute of Automation, Chinese Academy of Sciences Beijing China

2026-07-22数据集/基准

本文动机是检验多模态情绪描述偏好评测是否真的依赖视频 grounding,而非被数据偏差驱动。作者用只看描述长度和生成器身份的 content-blind 探针审计 EmoPrefer,发现其 WAF 几乎追平微调 7B 文本/音视频评判器;生成器身份可从文本中 99.5% 恢复,标签 66% 符合生成器胜率先验,去混淆后内容信号接近随机,说明当前榜单分数很大程度衡量风格偏好而非视频一致性。

Now We Know? A Systematic Comparison of TerraMind and THOR Figure 1
2026-07-22cs.LG

Now We Know? A Systematic Comparison of TerraMind and THOR

Frederick Schindlegger, Kenzo Bounegta, Eva Gmelich Meijling, Johannes Jakubik, Arnt-Børre Salberg, Theodor Forgaard, Nicolas Longepe, Valerio Marsocci

University of Münster, Münster, Germany, ESA ϕ \phi -lab, ESRIN, Frascati, Italy, Norwegian Computing Center, Oslo, Norway

2026-07-22视觉感知

本文针对地理空间基础模型评测只给排行榜、难解释性能差异的问题,系统比较 ESA 体系下设计取向相反的 TerraMind 与 THOR。核心洞察是把 patch 大小、解码器复杂度、微调方式、输入模态和模型规模拆开做消融,而非简单判定胜负。结果显示,性能方差更多由 patch 与解码器等部署/架构选择解释,模型身份本身不是主因;TerraMind偏预训练规模与跨模态生成,THOR偏推理时 token 化灵活性,结论还依赖数据集级特征刻画。

ECoNGS: Efficient Compressive Neural Gaussian Splats for Volume Visualization Figure 1
2026-07-22cs.CV

ECoNGS: Efficient Compressive Neural Gaussian Splats for Volume Visualization

Kaiyuan Tang, Chaoli Wang

2026-07-22三维

面向大规模体数据直接体绘制计算和存储开销高、现有 3DGS 类方法逐场景独立优化导致模型冗余的问题,ECoNGS用锚点加轻量 MLP 动态生成可编辑高斯,并通过相似传递函数场景的联合学习和神经熵模型压缩锚点属性。实验称其较 iVR-GS 最高提升 2.2 dB PSNR,同时模型缩小 6.1 倍、训练加速 5.9 倍。

CANDOR: Chance-Calibrated Discordance in Frozen Foundation Encoders Figure 1
2026-07-22cs.LG

CANDOR: Chance-Calibrated Discordance in Frozen Foundation Encoders

Soroosh Tayebi Arasteh, Sven Nebelung, Daniel Truhn

2026-07-22视觉感知

本文针对冻结视觉基础编码器常用 AUROC 读出无法暴露表征几何失败的问题,提出 CANDOR:用等规模正负参考库校准近邻不一致率,使随机水平固定为 50%。在 22 个编码器、20 个数据集上,作者发现模型并非完全“看不见”细粒度证据,但医学发现仍接近随机;胸片、青光眼显著弱于鸟类等任务,失败更多与证据擦除后的表征保留相关,而非模型规模、目标或新旧。

PathReportEval: A Systematic Benchmark for Pathology Report Generation Figure 1
2026-07-22cs.CL

PathReportEval: A Systematic Benchmark for Pathology Report Generation

Suryakant Singh, Sejuti Majumder, Beatrice Knudsen, Joel Saltz, Prateek Prasanna

Department of Biomedical Informatics, Stony Brook University, Department of Pathology, University of Utah

2026-07-22数据集/基准

该文针对病理全切片报告生成中数据、编码器和评测协议不统一、BLEU/ROUGE 等词面指标难以反映临床错误的问题,提出 PathReportEval 标准化基准与可扩展框架,并引入基于结构化临床属性的 CRQS 指标。实验覆盖 TCGA、HistAI、REG 2025、三类病理基础编码器和四种生成方法,显示传统 NLG 指标与临床正确性弱相关,CRQS 能揭示遗漏、幻觉和属性冲突等差异。

Surprise Forcing: What to Remember, When to Skip in Long Video Generation Figure 1
2026-07-22cs.CV

Surprise Forcing: What to Remember, When to Skip in Long Video Generation

Shuwei Shi, Zhen Li, Muyao Niu, Chuanhao Li, Bo Zheng, Kaipeng Zhang, Yinqiang Zheng

2026-07-22视觉感知

长视频生成中,流式自回归扩散受限于固定上下文和统一去噪步数,容易遗忘早期身份、场景等关键信息并浪费计算。Surprise Forcing 将记忆保留和去噪深度视为在线资源分配:用“惊讶度”筛选外部记忆、按相关性检索,并对简单片段跳过去噪步骤。VBench 系列实验显示其提升长程一致性与画质,同时保持实时流式吞吐。

From Pixel to Prognosis: Convolutional and GLCM Feature Fusion for Automated Four-Class Cataract Severity Classification Figure 1
2026-07-22cs.CV

From Pixel to Prognosis: Convolutional and GLCM Feature Fusion for Automated Four-Class Cataract Severity Classification

K. Mithra, Prem Kumar Santhanam

Seidenberg School of Computer Science and Information Systems, Pace University, New York City, NY, USA

2026-07-22视觉感知

本文面向基层和远程医疗中缺少裂隙灯、眼底相机等专用设备的白内障筛查需求,提出用普通彩色眼照经 Hough 圆定位瞳孔 ROI,再融合浅层 CNN 深度特征与 GLCM/强度纹理特征,并由 RBF-SVM 做正常、未成熟、成熟、过熟四分类。300 张临床标注图像上报告 95.0% 准确率,优于纹理-only 和 CNN-only 基线,但数据规模较小,泛化性仍需更多外部验证。

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies Figure 1
2026-07-22cs.CV

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

2026-07-22视觉语言

这篇论文关注机器人/应急场景中VLM安全判断的可靠性:现有安全评测常把场景压成安全/危险二分类,容易混淆异常与真实物理危害。作者提出危害-异常四类标注框架和610图基准,并比较多种提示策略。结果显示,主流VLM常把“不寻常”当作“危险”,而显式区分两者能暴露二分类掩盖的失效模式并改善校准。

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images Figure 1
2026-07-22cs.LG

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images

Alessandro Di Matteo, Sara Moccia, Giuseppe Rizzo, Gianpaolo Grisolia, Ricciarda Raffaelli, Lorenzo Vasciaveo, Francesco D'Antonio, Maria Chiara Fiorentino

2026-07-22视觉感知安全鲁棒

这篇论文针对胎儿超声中胼胝体结构小、低对比噪声强且跨医院设备差异大的定位难题,提出 FedCC:在联邦学习中冻结 DINOv2 主干,仅训练并交换 LoRA 适配器和轻量 YOLO 检测头,以降低隐私、算力和通信压力。在三中心 10970 帧数据上,FedAvg+DINOv2+LoRA 达到 mAP@50 0.857、F1 0.803,并将可训练参数从 24.4M 降至 2.9M,通信成本约降 8.5 倍。

2026-07-21

219 篇
The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric Figure 1
2026-07-21cs.CV

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang

Carnegie Mellon University

2026-07-21视觉感知

这篇论文针对现有图像感知相似度只能给出单一分数、无法区分颜色、姿态、背景等比较维度的问题,构建了包含 25K 图像三元组和百万级人工判断的多方面相似度数据集,并微调 VLM 得到可由自由文本提示指定维度的 TPIPS。实验显示,强 VLM 与人类判断仍有明显差距,而 TPIPS 在合成分布外任务、生成模型细粒度评估和文本引导检索中均优于基线。

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs Figure 1
2026-07-21cs.CV

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

Mohamed bin Zayed University of Artificial Intelligence, University College London, Weizmann Institute of Science

2026-07-21视觉语言视觉感知学习理论

本文针对现代 VLM 图像编辑带来的跨模型分布偏移,研究像素级篡改定位如何避免只记住特定生成器伪迹。核心做法不是改架构,而是用真实/篡改样本均衡 minibatch、对新兴小域做后期注入,并配合低学习率适配。实验称在 GPT-Images-2.0、Gemini-3.1、FLUX.2、Seedream 4.5 等 OOD 域上,相比 PIXAR 平均 gIoU、cIoU 分别相对提升 26.1% 和 26.8%。

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry Figure 1
2026-07-21cs.CV

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

Dingyun Zhang, Lixue Gong, Wei Liu

Scalable Video Editing Pairs for Learning Pixel-pair Correspondence, depend on labour-intensive, time-consuming curated proce-, ment—and demonstrate limited task scalability. As a result, than that available for image editing models. We develop a, rently relies on labour-intensive pipelines such as annotat-, without such elaborate and poorly scalable processes, and, direct approach: a scalable paradigm that leverages only ex-

2026-07-21视觉感知生成模型

FlowMimic针对视频编辑训练数据依赖掩码标注、I2V合成和筛选流程、任务扩展性差的问题,提出用像素对时序扭曲流场把现有图像编辑样本在线变成视频编辑对,并通过模态模仿损失对齐图像/视频生成与编辑分布,还引入区域感知损失强化无掩码指令定位。实验称仅用这类合成视频样本即可在多类编辑任务上训练出可泛化的视频编辑能力,数千步后已有响应,但具体增益来源可能与数据规模和预训练T2IV能力有关。

GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis Figure 1
2026-07-21cs.CV

GigaPath-Flash and GigaTIME-Flash: Efficient Pathology Foundation Models for Whole-Slide and Tumor Microenvironment Analysis

Naoto Usuyama, Jeya Maria Jose Valanarasu, Sicong Yao, Hanwen Xu, Jaspreet Bagga, Guanghui Qin, Robert E. Kramer, Cliff Wong, Soohee Lee, Hao Qiu, Theodore Zhengde Zhao, Racheli Ben Shimol, Angela Crabtree, Kevin Matlock, Eduardo Alejandro Lozano Garcia, Naiteek Sangani, Alberto Santamaria-Pang, Jason Entenmann, Alexandra Q. Bartlett, Bill J. Wright, Bernard A. Fox, Brian Piening, Sheng Zhang, Sheng Wang, Tristan Naumann, Carlo Bifulco, Hoifung Poon

Paul G. Allen School of Computer Science and Engineering, University of Washington, Earle A. Chiles Research Institute, Providence Cancer Institute

2026-07-21视觉感知

这篇论文针对全切片病理基础模型计算开销高、常停留在 tile 级且许可证受限的问题,提出 GigaPath-Flash 与 GigaTIME-Flash:用从 1B GigaPath 蒸馏来的 22M ViT-S 共享编码器,结合 LongNet 做切片级上下文建模,并用于 H&E 到肿瘤免疫微环境/空间蛋白预测。结果显示,GigaPath-Flash 以约 50 倍更低计算保留 97% 原 GigaPath 平均性能,GigaTIME-Flash 相比 CNN 版更准且快 6 倍、显存少 8 倍,但外部验证仍有限。

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement Figure 1
2026-07-21cs.CV

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

Hong Kong University of Science and Technology

2026-07-21视觉语言视觉感知

HOMIE针对人-物中心视频个性化中主体保真与交互关系难兼顾、且多视角/OCR等同一主体参考缺乏对应建模的问题,保留原文本编码器,让MLLM专注推理参考间关系,并通过自注意力中的全局多模态引导和模态-参考嵌入对齐语义、区分/关联参考。实验显示其在多主体、抽象标识放置和同主体增强场景下取得优于已有方法的主体一致性与提示遵循表现。

Three-Body Scattering for Generative Modeling Figure 1
2026-07-21cs.LG

Three-Body Scattering for Generative Modeling

Peng Sun, Zhenglin Cheng, Deyuan Liu, Jun Xie, Xinyi Shang, Tao Lin

Westlake University, 2 Zhejiang University, 3 University College London

2026-07-21生成模型

这篇论文针对一阶生成模型常依赖判别器、扩散路径或自回归分解的问题,提出 TBSM:用能量距离诱导的三体散射,把每个生成样本同时拉向一个真实样本、排斥一个独立生成样本,并用在线跟踪降低随机场噪声。实验显示其在 ImageNet-256 上以 NFE=1 达到 FID 2.23(像素)和 1.63(潜空间),但从大规模初始化、表征空间匹配到完整图像质量的增益来源仍未完全说明。

Certified Training for Convolutional Perturbations Figure 1
2026-07-21cs.CV

Certified Training for Convolutional Perturbations

Benedikt Brückner, Alessio Lomuscio

Imperial College London

2026-07-21视觉感知

这篇论文针对视觉模型在相机抖动、运动模糊等卷积型扰动下缺乏可验证安全性的痛点,提出面向卷积扰动的认证训练方法,利用低维参数化扰动编码和批量化紧界传播来降低过度正则化。实验显示其在 CIFAR10 等设置中显著优于对抗训练,合理强度运动模糊下验证鲁棒准确率可超过 80%,且标准准确率损失约 1%。

Robust Multimodal Dynamic Object Segmentation Figure 1
2026-07-21cs.CV

Robust Multimodal Dynamic Object Segmentation

Zhe Xin, Hanzhi Chang, Penghui Huang, Yinian Mao, Guoquan Huang

2026-07-21视觉语言视觉感知安全鲁棒

针对动态视频中运动物体会破坏静态场景重建、而单一光流或3D重建线索容易在边界一致性和深度误差上失效的问题,论文融合2D点轨迹、MonST3R重建特征与SAM语义特征,用Transformer和聚类聚合进行轨迹动静分类,并以点查询SAM细化多目标掩码。实验报告在动态物体分割和静态场景重建上优于现有方法。

Plenoptic Condensation: A Novel Approach to Generalized Scene Reconstruction Figure 1
2026-07-21cs.CV

Plenoptic Condensation: A Novel Approach to Generalized Scene Reconstruction

Brevin Tilmon, Alex DeJournett, John Leffingwell, Scott Ackerson

2026-07-21三维

本文针对NeRF/3DGS等方法难以同时获得高精度几何、可重光照材质和可用网格的问题,提出Plenoptic Condensation:先把图像转为低表达力的“汤状”场景元素,再自适应凝聚为混合高表达力结构,以联合建模光场与物质场。在受损Fiat车盖实验中,PCon相对NeRO和RT-Splatting几何误差降低到一半以下,并报告局部凹痕轮廓误差35微米;但增益来源与更广泛定量验证仍文中未充分说明。

Lossless-INR: Lossless Volumetric Implicit Neural Representations Figure 1
2026-07-21cs.CV

Lossless-INR: Lossless Volumetric Implicit Neural Representations

Kaiyuan Tang, Daniel Burke, Chaoli Wang

University of Notre Dame

2026-07-21视觉感知

现有体数据 INR 通常以连续值回归压缩体素,残余误差会在体渲染、梯度估计和下游科学分析中放大。Lossless-INR 的关键做法是把每个体素拆成二进制 bit-plane,将重建改写为逐 bit 分类,并用八叉树自适应分块与三值特征网格降低局部拟合难度和存储开销。实验显示其在多种体数据上达到零 bit 错误和逐位精确重建,渲染质量优于有损 Instant-NGP 基线且模型保持相对紧凑。

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning Figure 1
2026-07-21cs.CV

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

2026-07-21视觉感知

工业视频异常检测难在物体会经历压合、变形、装配等细粒度状态变化,单帧或整段视频提示容易忽略局部物理违例。O-VAD将检测单元转向对象轨迹,通过“定位-跟踪-推理”无训练流程累积物体状态演化证据,再做异常判断。实验称其在三个IVAD数据集上超过前沿VLM、智能体框架和微调传统方法,并能输出异常对象、帧位置与过程解释。

SGA: Plug&Play Geometric Verification for Educational Video Synthesis Figure 1
2026-07-21cs.AI

SGA: Plug&Play Geometric Verification for Educational Video Synthesis

Lopez Jhon, Hinojosa Carlos, Ghanem Bernard

King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia

2026-07-21视觉感知

这篇论文针对 LLM 生成 Manim 教学动画时常出现遮挡、错位等几何问题,提出可插拔的 SGA:在渲染前部分执行代码,抽取符号场景图并用边界框、距离等规则检测冲突,再触发定向修正;同时给出无需渲染的 MVQS 指标。实验在 MMMC-Code 上覆盖 4 个模型和 2 条流水线,SGA 在 7/8 配置中提升布局质量,最佳 MVQS 达 73.11,相对原始基线提升 16.1%。

Occlusion-Aware Panoptic Segmentation with Joint Position Embedding and Occlusion-Level Attention Figure 1
2026-07-21cs.CV

Occlusion-Aware Panoptic Segmentation with Joint Position Embedding and Occlusion-Level Attention

Wenbo Wei, Jun Wang, Shan Raza, Abhir Bhalerao

2026-07-21视觉感知

本文针对自动驾驶、机器人等复杂场景中遮挡导致全景分割边界混淆和实例漏检的问题,提出 PEMOLA:用遮挡分类器生成空间遮挡注意力,并将遮挡等级嵌入为通道权重,共同调制 Transformer 的位置编码。实验在 COCO-OLAC 与新标注的 Cityscapes-OLAC 上显示分割质量稳定提升且计算开销很小,但具体增益有多少可能主要来自遮挡标签与数据标注质量。

SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark Figure 1
2026-07-21cs.CV

SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark

Sania Bano, Shahzad Ahmad, Santosh Kumar Vipparthi, Sukalpa Chanda, Subrahmanyam Murala

2026-07-21视觉语言数据集/基准

现有多模态情绪识别基准常规模小、类别偏斜且数据划分易泄漏,影响少数情绪与跨数据集泛化评估。SpEmoC从3100部影视作品中筛出3万段说话片段,提供视频、音频、文本同步标注,并用模型辅助加人工验证保持七类情绪近均衡和作品级划分。实验显示,在域内、跨MELD/CAER、低数据和类别不均衡设置下,均衡数据与严格划分带来更稳定的类别表现,但增益可能主要来自data设计。

Empowering On-Device Model Adaptation with an Edge AI Inference Accelerator Figure 1
2026-07-21cs.LG

Empowering On-Device Model Adaptation with an Edge AI Inference Accelerator

Mateusz Piechocki, Alessandro Capotondi, Marek Kraft

2026-07-21视觉感知

针对边缘设备难以承担完整反向传播、但又需要部署后个性化适配的问题,论文将模型拆成冻结的 INT8 主干和 CPU 上训练的 FP32 分类头,复用 Hailo-8L 推理加速器做特征提取,并强调量化后恢复对特征质量的重要性。实验显示该异构流程相较 Raspberry Pi 5 CPU 训练最高可快 15.4 倍,并持续降低单样本能耗。

SciForma: Structure-Faithful Generation of Scientific Diagrams Figure 1
2026-07-21cs.CV

SciForma: Structure-Faithful Generation of Scientific Diagrams

Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu

Wangxuan Institute of Computer Technology, Peking University, State Key Lab of CAD & CG, Zhejiang University, Wangxuan Institute of Computer Technology, Peking University Beijing China, State Key Lab of CAD & CG, Zhejiang University Hangzhou China

2026-07-21视觉感知

论文针对科学方法图生成中组件、箭头和文字任一出错都会破坏语义的问题,提出将结构保真度拆成 Component/Arrow/Text 三个可验证轴,并用结构清单构建数据、评测和迭代编辑;核心方法 M-DPO 以共同赢家对比轴向失败样本,强调三轴同时正确。实验称 SciForma-9B 在 SciFormaBench-2K 和 AIBench 上超过开源基线及 GPT-Image-1.5,但评测与编辑依赖专有 VLM,部分增益可能主要来自 data。

The Label Complexity of Class-Conditional Coverage under Distribution Shift Figure 1
2026-07-21cs.LG

The Label Complexity of Class-Conditional Coverage under Distribution Shift

Weijia Han, Lisha Qu

University of Washington

2026-07-21视觉感知

论文关注分布偏移下识别系统的安全评估:边际 conformal 覆盖率接近标称值时,类别条件覆盖仍可能在骨架动作识别中大幅失效。核心洞察是无目标标签时无法同时保证逐类有效性与效率,并给出匹配的目标标签复杂度界。实验显示源域逐类校准可部分修复最差类别覆盖,但伪标签和无标签目标数据收益很有限。

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection Figure 1
2026-07-21cs.CV

Sparse Evidence Can Suffice: Agentic Evidence Seeking for Multimodal Video Misinformation Detection

Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou

2026-07-21视觉语言视觉感知

这篇论文针对视频谣言检测中过度依赖整段视频一次性融合的问题,指出真实误信息往往只需少量互补证据即可判定。作者提出 SIEVE,将证据获取与真实性验证解耦,由智能体在视觉帧、OCR、ASR 等通道中按预算主动寻找关键线索,再交给验证器判断。多项基准实验显示,该方法优于对比方法,并能用紧凑证据包接近饱和性能,同时留下可检查的证据轨迹。

VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction Figure 1
2026-07-21cs.CV

VGOcc: Learning Visual-Geometric Gaussians for Vision-Centric 3D Driving Occupancy Prediction

Junhong Lin, Xianda Guo, Kangli Wang, Yuqi Ye, Xiaoyu Liang, Yanlun Peng, Wei Gao

2026-07-21视觉感知三维

VGOcc针对纯视觉占用预测中相机射线深度歧义和高斯表示几何线索不足的问题,将冻结视觉/几何基础模型的语义与深度先验注入高斯初始化和迭代细化:用射线深度假设生成均衡中心,并用位姿感知特征融合多视角信息。nuScenes实验报告达到纯视觉3D占用预测SOTA,但对准确标定和冻结骨干计算开销仍有依赖。

QIRF Quantum-Inspired Non-Orthogonal Function-Space Compression for 3D Gaussian Splatting Figure 1
2026-07-21cs.CV

QIRF Quantum-Inspired Non-Orthogonal Function-Space Compression for 3D Gaussian Splatting

Shizeng Jiang, Hao Zhang, Xuerui Ma, Ying Hu, Tao Zhang

2026-07-21三维

针对3D Gaussian Splatting在复杂场景中高斯数量庞大、存储和渲染成本高的问题,QIRF不再按单个 primitive 打分剪枝,而是把局部重叠高斯视为非正交函数基,通过解析重叠矩阵、辐射响应密度矩阵和广义特征分解选择代表性高斯,并用细节保护减少结构损失。在13个场景上平均移除71.7%高斯,实现约3.54倍原始PLY压缩,渲染速度提升34.3%,PSNR平均微增0.10 dB。

UniETP: Unifying Environments for Generalizable Embodied Task Planning Figure 1
2026-07-21cs.RO

UniETP: Unifying Environments for Generalizable Embodied Task Planning

Peiran Xu, Jiaqi Zheng, Ziyou Wang, Yadong Mu

Peking University

2026-07-21规划控制

论文针对具身任务规划中模拟器割裂、观测与动作空间不统一导致模型难以跨环境评测和扩展数据的问题,提出 UniETP,将 AI2-THOR、VirtualHome、Habitat、BEHAVIOR 统一到标准接口、场景图评测和多粒度动作空间,并用模板、常识库与 LLM 自动生成 500 余个复杂任务。实验用于比较近期 VLM 规划能力并分析瓶颈,但文中片段未充分说明具体数值增益。

Co-addition and Subtraction of Undersampled Images Figure 1
2026-07-21astro-ph.IM

Co-addition and Subtraction of Undersampled Images

Matan Schlanger, Barak Zackay

Department of Particle Physics and Astrophysics, Weizmann Institute of Science

2026-07-21视觉感知

针对欠采样天文巡天图像中子像素配准不适定、叠加与差分非最优导致灵敏度下降和误报增加的问题,论文提出 LUTRA,用统计线性框架联合处理图像叠加与瞬变检测,并支持超分辨率的测光和天体测量。在 ZTF 公开数据上,相比现有流程约提升 1.25 倍 SNR,作者还指出部署仍依赖更精确的 PSF、位移和旋转建模。

SAR Vessel Detection and Gross Tonnage Estimation from Heterogeneous Datasets for Dark Vessel Identification Figure 1
2026-07-21cs.CV

SAR Vessel Detection and Gross Tonnage Estimation from Heterogeneous Datasets for Dark Vessel Identification

Davide Paltrinieri, Andrea Diecidue, Roberto Basla, Daniele Casciani, Piero Fraternali, Giacomo Boracchi

2026-07-21视觉感知数据集/基准

这篇论文针对暗船识别中仅检测船只还不够、还需判断其是否按总吨位应开启 AIS 的问题,提出用异构 SAR 图像与表格 AIS 数据联合训练:Faster R-CNN 多任务预测框、船型和长宽,再用融合尺寸欧氏距离与类别距离的 KNN 估计总吨位。实验显示该框架在检测、分类等单项任务上接近专门方法,并能为小样本船型改善 GT 回归,从而支持自动筛查潜在暗船。

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation Figure 1
2026-07-21cs.CV

Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation

Lingfeng Zhang, Zhanguang Zhang, Liheng Ma, Tongtong Cao, Yingxue Zhang

Noah’s Ark Lab, 2012 Labs, Huawei, Department of Foundation model, 2012 Labs, Huawei

2026-07-21机器人视觉语言视觉感知

这篇论文针对端到端视觉语言导航中行为克隆只监督下一步动作、缺少对未来视觉状态建模的问题,提出 FSC-VLN:在因果 VLM token 序列中加入未来查询和动作查询,训练时用未来图像的冻结视觉嵌入监督未来查询,推理时不需要未来图像。实验在 R2R val-unseen 上相对 StreamVLN 式基线提升 SR/OSR/SPL,长轨迹收益更明显,但整体增益幅度仍偏温和。

When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry Figure 1
2026-07-21cs.CV

When 2D Cues Fail: Improving Image Manipulation Localization with Reliable 3D Geometry

Guofeng Yu, Zhiqing Guo, Dan Ma, Gaobo Yang

School of Computer Science and Technology, Xinjiang University, College of Computer Science and Electronic Engineering, School of Computer Science and Technology, Xinjiang University Urumqi China, College of Computer Science and Electronic Engineering Hunan University, Changsha China

2026-07-21机器人视觉感知三维

论文针对高质量图像篡改在纹理和语义上已能很好融入背景、仅靠2D取证线索容易失效的问题,提出GFrame引入单目重建得到的深度与表面法线,并用可靠性估计选择性融合几何信息、跨尺度传播结构上下文。实验显示其在分布内外基准上提升定位表现,说明可靠3D几何可作为RGB线索的补充,但具体增益来源仍可能受重建质量影响。

Benchmarking NACTI Species Recognition in Long-Tailed Regimes Figure 1
2026-07-21cs.CV

Benchmarking NACTI Species Recognition in Long-Tailed Regimes

Zehua Liu, Tilo Burghardt

2026-07-21视觉感知数据集/基准

本文针对NACTI相机陷阱物种识别中严重长尾分布导致模型偏向常见类、稀有类易失效的问题,系统比较Focal、加权交叉熵、LDAM及LTR调度/正则化组合,并扩展到跨数据集OOD评估。最佳配置在NACTI测试集达99.40% Top-1,但在强域偏移下尾部类别仍会预测崩溃,说明优化层面的长尾方法难以弥合表征瓶颈。

SAMRI-3D: Adapting SAM2 for 3D MRI Segmentation with Global Volume Tokens Figure 1
2026-07-21cs.CV

SAMRI-3D: Adapting SAM2 for 3D MRI Segmentation with Global Volume Tokens

Zhao Wang, Wei Dai, Hongfu Sun, Craig Engstrom, Shekhar S. Chandra

School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Australia, School of Engineering, College of Engineering, Science and Environment, University of Newcastle, Australia, School of Human Movement and Nutrition Sciences, The University of Queensland, Australia

2026-07-21视觉感知三维

针对SAM2直接用于三维MRI时只依赖局部切片记忆、难处理低对比边界且缺少大规模MRI专属评测的问题,SAMRI-3D将体数据按切片传播,并加入由全体切片压缩得到的Global Volume Tokens,再用TSDF重建约束其编码边界几何。实验覆盖34个MRI数据集,冻结编码器仅微调解码器和记忆模块已将Dice从0.58升至0.76,完整模型达0.78,且在8个未见数据集上未下降。

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding Figure 1
2026-07-21cs.AI

Do Maps Still Matter for Machines: Revisiting the Role of Choropleth Maps in Foundation Model Spatial Understanding

Zhiwei Wei, Yonghe Sun, Zhenjia Liu, Wenjia Xu, Chao He, Weihua Dong, Chunbo Liu, Hua Liao

2026-07-21视觉感知

论文追问在多模态基础模型已能直接读取 GeoJSON 等结构化地理数据后,传统分级设色图是否仍有价值。作者构建 ChoroplethMap-Bench,用合成地图、对应数据和五类空间问题对 22 个模型比较 Data Only、Map Only 与 Data + Map。结果显示,地图与符号数据结合通常最优,尤其提升高层空间识别、排序和区域划定任务;但基准为合成设色图,向真实复杂地图泛化仍需验证。

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization Figure 1
2026-07-21cs.CV

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

Rui Chu, Yingjie Lao

2026-07-21视觉语言视觉感知

针对视频摘要中先硬选关键帧再生成易破坏时序连贯、遗漏低亮点信息的问题,HAS将全视频的连续帧级高亮分布作为推理期注意力 steering 信号,冻结多模态LLM但引导其更关注关键片段。实验报告其在SumMe/TVSum的人类重要性相关性、跨模态一致性和多骨干可扩展性上优于多类基线;但高亮分布构造与最终增益的因果贡献仍有待更充分消融说明。

Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation Figure 1
2026-07-21cs.CV

Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation

Zhenjie Liu, Binyan Chen, Hao Chen, Tong Pan, Shangfei Wang

University of Science and Technology of China, University of Science and Technology of China Hefei China

2026-07-21视觉感知

针对多段时间戳动作视频中主体身份随运动累积而漂移的问题,论文将顺序动作拆成以各动作终止状态为锚点的关键帧链,再用参考身份、前一关键帧和多参考/噪声搜索引导生成中间片段,无需微调现有模型。该方案在 IPVG26 Track 2 官方榜单获第三,主要优势体现在身份保持和时间对齐。

Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement Figure 1
2026-07-21cs.CV

Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement

Lingyu Kong, Ruicheng Li, Ruicheng Wang, Sicheng Xu, Chengtang Yao, Jianfeng Xiang, Jiaolong Yang

Tsinghua University

2026-07-21视觉感知

这篇论文针对单目几何估计在细杆、栅栏、小物体等局部结构上易被抹平或扭曲的问题,指出根源是用2D参数化解码3D几何会按图像邻近性错误混合特征。方法在MoGe-2粗点图上构建稀疏体素壳,用自引导稀疏3D U-Net按真实3D邻域迭代细化,并注入2D特征。多数据集零样本实验显示其在全局与局部几何指标、细节可视化上优于现有方法,但边界歧义和飞点仍未完全解决。

Exploration Matters for Escaping the Blur Trap in 3D Gaussian Splatting Figure 1
2026-07-21cs.CV

Exploration Matters for Escaping the Blur Trap in 3D Gaussian Splatting

Chengbo Wang, Guozheng Ma, Jinhong Wu, Tie Ji, Yizhen Lao

Hunan University, Nanyang Technological University

2026-07-21三维

本文针对3D Gaussian Splatting中远处和遮挡区域长期发糊的问题,指出其并非数据不足,而是由2D投影梯度缺少深度方向信号、α混合削弱遮挡高斯梯度造成的“Blur Trap”。作者用随机播种和随机分裂引入显式探索,绕开纯梯度依赖的更新与增密门控,在五个数据集上提升渲染质量且额外开销较小。

MuViSeg: Multi-View Segment Correspondences from Dense Geometry Priors Figure 1
2026-07-21cs.CV

MuViSeg: Multi-View Segment Correspondences from Dense Geometry Priors

Denis Fatykhoph, Timur Akhtyamov, Konstantin Pakulev, German Devchich, Gonzalo Ferrer

2026-07-21视觉感知

MuViSeg针对机器人导航、场景图等需要对象级跨视角身份一致性的场景,指出像素/关键点匹配难以直接服务实例段关联。其核心洞察是按视角变化选择匹配头:近中基线用基于MASt3R的LightGlue式段注意力,宽基线用VGGT支持的多视角联合自注意力恢复传递对应。零样本实验中LGv2在Replica和VKITTI2提升AUPRC,多视角版本接入RoboHop后HM3D成功率从50%升至70%,但闭环评测规模较小。

Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment Figure 1
2026-07-21cs.GR

Packet-Loss Robust 3D Gaussian Compression via Atomic Packaging and GNN-based Error Concealment

Yuxuan Tao, Xuerui Ma, Hao Zhang, Chunhua Peng

Central South University, Malanshan Audio & Video Laboratory, Central South University Changsha China, Malanshan Audio & Video Laboratory Changsha China

2026-07-21三维安全鲁棒

论文针对 3D Gaussian Splatting 压缩流在丢包网络中易因属性包缺失产生“破损 anchor”和连续空洞的问题,提出按 anchor 原子打包、分层随机分组,并在解码端用 CARI 插值与带置信回退的轻量 GNN 修复残差。20% 随机丢包下,整体 PSNR 退化约 3 dB,GNN 在高频复杂场景有补充增益,但码率与运行效率的联合优化仍未充分说明。

Locality-Aware Density Control for Efficient Gaussian-based Image Representation Figure 1
2026-07-21cs.CV

Locality-Aware Density Control for Efficient Gaussian-based Image Representation

Jiacong Chen, Qingyu Mao, Xiandong Meng, Shuai Liu, Chao Li, Fanyang Meng, Youneng Bao, Yongsheng Liang

Shenzhen University, Pengcheng Laboratory, Harbin Institute of Technology (Shenzhen), Shenzhen University Shenzhen China, Pengcheng Laboratory Shenzhen China, Harbin Institute of Technology (Shenzhen) Shenzhen China

2026-07-21视觉感知规划控制三维

本文针对2D Gaussian图像表示在优化中高误差区域逐像素补点、相邻相似高斯冗余保留导致的容量分配低效问题,提出LocoADC密度控制框架。核心洞察是同时利用图像空间误差的局部连续性和高斯空间邻域相似性,通过区域级增密、相似性驱动合并及局部颜色一致性约束调整预算。在Kodak、DIV2K、CLIC上可插入多种基线,30k高斯预算下CLIC相对GI提升2.93 dB PSNR。

Leveraging Dissimilarity Invariance as a Robust Anchor for Learning with Noisy Labels Figure 1
2026-07-21cs.CV

Leveraging Dissimilarity Invariance as a Robust Anchor for Learning with Noisy Labels

Wenxiao Fan, Kan Li

2026-07-21安全鲁棒

针对视觉模型在噪声标签下容易学习到错误相似性的脆弱性,论文提出“非相似性不变”观察:语义无关样本间的差异在不同噪声率下更稳定。基于此设计即插即用的 NegScale,用 SNOP 强化负样本子空间正交、用 DCSA 借差异锚点抑制伪相似;在 CIFAR 合成噪声和真实噪声数据上报告超过现有方法的结果。

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning Figure 1
2026-07-21cs.HC

AlphaOracle: Oracle bone script decipherment via human-workflow-inspired deep learning

Yuliang Liu, Haisu Guan, Pengjie Wang, Xinyu Wang, Jinpeng Wan, Kaile Zhang, Handong Zheng, Xingchen Liu, Zhebin Kuang, Huanxin Yang, Bang Li, Yongge Liu, Lianwen Jin, Xiang Bai

2026-07-21生成模型

甲骨文仍有大量未释字,传统释读依赖少数专家且难以规模化复核。AlphaOracle将摹本解析、字形部件与历时演变、语境检索和文献校验串成仿专家流程,并输出带置信度的证据链。文中报告其释读与专家高度一致,在86名领域专家研究中将分析时间降低64%,79%认为有用,并给出“勞”字新解释。

CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling Figure 1
2026-07-21cs.CV

CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling

Tingjia Zhang, Bo Chen, Shengzhong Liu, Fan Wu, Guihai Chen

Shanghai Jiao Tong University, 2 University of Illinois Urbana-Champaign

2026-07-21三维

面向大规模城市/虚拟场景中 3D Gaussian Splatting 实时渲染掉帧的问题,CaT-GS 的关键洞察是交互式连续视角存在跨帧预处理冗余,且 tile 负载分布不均会压低 GPU 利用率。方法通过多帧投机预处理、跨帧缓存与 CUDA 任务重分配减少重复计算并均衡光栅化负载;实验报告相对原始 3DGS 最高 10 倍加速、较既有 SOTA 最高 70% 加速。

Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA Figure 1
2026-07-21cs.CV

Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA

Yuhao Liu, Cheng Zhao, Guanghui Yue

2026-07-21视觉感知

这篇论文关注内镜 VQA 中“复杂答案正确但对应原子问题答错”的隐藏不一致,指出单看最终答案准确率会高估模型可靠性。作者构建 EndoCA,将复杂问题与同图原子问题成对评测,并提出无需训练的 ASR 用原子答案辅助修正或选择性作答。11 个 VLM 实验显示,多数模型的原子准确率、联合准确率明显低于复杂答案准确率,ASR 在部分公开模型上提升成对正确性或回答子集准确率。

Consistent Feature Transport for Image Relighting Figure 1
2026-07-21cs.CV

Consistent Feature Transport for Image Relighting

Bohan Zhang, Huanwei Liang, Yuhan He, Hongteng Xu, Quxiao Chao, Luoqi Liu, Dixin Luo, Ting Liu

2026-07-21视觉感知

针对扩散式图像重光照在复杂光照下容易改光不稳、身份与几何保持不一致的问题,论文把重光照重新表述为照明特征传输,并提出基于 rectified flow 的 CFT,用轨迹级监督联合学习噪声到图像与光照一致的源到目标传输;同时构建复杂人像重光照数据集。实验显示其相对现有方法有稳定定量和定性提升,并可迁移到风格迁移,但具体增益中方法与数据规模的贡献仍需进一步拆分。

PRiSM: Prototype Regularization for Few-Shot VLMs Figure 1
2026-07-21cs.CV

PRiSM: Prototype Regularization for Few-Shot VLMs

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

2026-07-21视觉语言

该文针对少样本 VLM 适配评测中过度依赖类别均衡与验证集调参的问题,指出在更真实的类别不均衡场景下,增加样本反而会放大多数类导致的原型偏移。PRiSM 将类原型正则化作为可插拔模块,通过类间分离、支持集对齐和保持基线原型一致性来修正原型,并用块 Majorize-Minimize 优化。实验显示其能提升多种 training-free 基线,尤其在严重不均衡和类别数较多时增益更明显。

Vis2Reg: Visibility-Aware Landmark-Free Geometric 3D--2D Registration for Liver Laparoscopy Figure 1
2026-07-21cs.CV

Vis2Reg: Visibility-Aware Landmark-Free Geometric 3D--2D Registration for Liver Laparoscopy

Jiaming Feng, Xukun Zhang, Shahid Farid, Sharib Ali

2026-07-21三维

这篇论文面向腹腔镜肝脏 AR 中预术 3D 模型与术中有限视野表面的配准难题,核心洞察是只用掩膜一致的可见区域约束形变,避免遮挡和不可见结构误导自监督学习。Vis2Reg 通过可微点光栅化、掩膜回投影、鲁棒刚性初始化和隐式形变场完成无标志点几何配准,在真实术中数据上达到 92.6% Dice、1.43 mm Chamfer 距离,推理约 111 ms/帧。

FF-ProCams: Feed-Forward Gaussian Splatting for Projector-Camera System Figure 1
2026-07-21cs.CV

FF-ProCams: Feed-Forward Gaussian Splatting for Projector-Camera System

Ziyao Wang, Yuqi Li, Wenxing Zheng, Jiaying Chen, Chong Wang

2026-07-21三维

本文针对投影-相机系统高保真逆渲染依赖逐场景优化、难以实时部署的问题,提出FF-ProCams:用混合Mamba2-Transformer从8个稀疏视角直接预测可重光照3D Gaussian属性,并配套投影感知可微渲染器和合成数据集。实验显示其在未见投影图案和新位姿下优于需297视角优化的基线,重建仅0.13秒;但分辨率、极稀疏视角和任意ProCams位姿泛化仍受限。

Toward Optimal Adenovirus Detection Using YOLO26 Figure 1
2026-07-21cs.CV

Toward Optimal Adenovirus Detection Using YOLO26

Olivier Rukundo

Department of Electronic and Computer Engineering, University of Limerick

2026-07-21视觉感知

针对 TEM 图像中腺病毒易受破损颗粒、碎屑和染色伪影干扰而难以自动检测的问题,本文将 YOLO26 五种模型规模与四类数据增强设置进行系统对比,并重新生成 YOLO 框标注。主要洞察是更大模型并不一定更优,YOLO26n 结合几何增强 GAS 在检测精度、收敛稳定性和计算效率之间表现最佳;但结论仅基于单一腺病毒 TEM 数据集,泛化性文中未充分说明。

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video Figure 1
2026-07-21cs.CV

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

order interchangeable on CVs. See Acknowledgements. .ETH Zurich, Switzerland Delft University of Technology, Netherlands Microsoft, Switzerland, ETH Zurich, Switzerland Delft University of Technology, Netherlands Microsoft, Switzerland

2026-07-21视觉感知

ReViV瞄准第一视角视频中“看的人”和“被看的场景”长期分开建模的问题:单目RGB往往缺少SLAM轨迹、点云或手部模块,却需要同时恢复身体、手、凝视、相机与深度。论文将这些模态统一为掩码生成建模,用MGET在一次前向中补全 viewer-view 4D动态;在HoloAssist、HOT3D等基准上,人体、手、凝视和相机跟踪达到SOTA或高效率,深度估计保持竞争力,但部分增益可能主要来自大规模数据与训练token scaling。

Medical Imaging Fusing Vision Transformer: Laryngeal Cancer Screening with Explanation Figure 1
2026-07-21cs.CV

Medical Imaging Fusing Vision Transformer: Laryngeal Cancer Screening with Explanation

Haiyang Wang, Luca Mainardi

2026-07-21视觉感知

针对喉癌 NBI 内镜筛查依赖医生经验、耗时且一致性不足的问题,论文将 Swin Transformer 用于良恶性分类,并并行引入 MedSAM 分割可疑病灶区域作为面向临床的解释,而非仅给热图。其在按患者划分的 CE-NBI 测试集上达到 82.33% 准确率、82.72% 加权 F1;但与现有方法的系统对比和增益来源文中未充分说明。

BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis Figure 1
2026-07-21cs.CV

BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis

Moona Mazher, Abdul Qayyum, Steven A. Niederer, Daniel C. Alexander

UCL Hawkes Institute, Department of Computer Science, University College London, National Heart & Lung Institute, Imperial College London, London, United Kingdom, Division of Cardiovascular Medicine, Stanford Cardiovascular Institute, Stanford, University, California, USA, vision by learning transferable representations from large-scale unlabeled data. However, representations from 60,551 unlabeled brain MRI examinations spanning multiple MRI, scalable foundation model for diverse brain MRI applications., dependence on manual annotation limits scalability and restricts the development of, learning transferable representations directly from unlabeled imaging data [4-8]. Rather, than relying on manually curated labels, SSL exploits intrinsic image structure through

2026-07-21三维

针对脑 MRI 基础模型常受任务专用训练、二维切片建模和小规模预训练限制的问题,BrainNext 用 60,551 例无标注多模态体数据进行 MAE 自监督预训练,并采用原生三维 Bi-Directional xLSTM-UNet 学习体素解剖表征。其在 FOMO 2025 的分类、分割和脑龄估计中总排名第二,脑膜瘤分割第一;但相对增益中有多少来自架构、MAE 目标或数据 scaling,文中仍未充分说明。

CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging Figure 1
2026-07-21cs.CV

CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging

Juno Kim, Hye-Jung Yoon, Yesol Park, Byoung-Tak Zhang

2026-07-21视觉感知三维

面向机器人在未知场景中操作与导航时需要识别新物体的问题,CDIS针对逐帧2D掩码投影到3D后易造成身份断裂和实例碎片化的缺陷,引入跨维度流程:先用几何扭曲与多帧匹配跟踪2D实例,再与3D超点关联并合并。实验显示其在公开基准上较现有零样本方法有更高精度和一致性,且无需3D专门训练。

Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence Figure 1
2026-07-21cs.CV

Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence

Katarzyna Filus, Sebastian Pokuciński

Institute of Theoretical and Applied Informatics, Polish Academy of Sciences, Department of Applied Informatics, Silesian University of Technology, Akademicka, isting metrics require external concept labels or depend on pretrained, introduce the Tversky Monosemanticity Score (TMS), a label-free met-, concept labels [9,5], auxiliary classifiers [9], or pretrained embedding models [13]., monosemanticity measure independent of external labels and embedding models., features. TMS is independent of both external concept labels and test-time

2026-07-21视觉感知

论文针对SAE单语义性评估依赖概念标签或外部嵌入编码器、易受编码器几何与各向异性影响的问题,提出Tversky Monosemanticity Score,将单语义性定义为二值化潜变量激活集合的一致性。实验覆盖DINOv3、CLIP、BLIP2及不同稀疏设置,显示TMS与既有指标保持一致、对各向异性更稳健,并能揭示训练动态,在CLIP等各向异性场景下更能预测概念删除效果。

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation Figure 1
2026-07-21cs.RO

From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation

Nabeela Khan, Bowen Wu, Runwu Shi, Benjamin Yen, Takeshi Ashizawa, Carlos Toshinori Ishi, Takashi Minato, Kazuhiro Nakadai

2026-07-21机器人视觉语言视觉感知

这篇论文关注手语生成从离线人体动画走向人形机器人执行时的关键断点:生成的 SMPL-X 动作常有手手、手躯干穿模,导致 IK 不可行或轨迹不稳。作者将体积化 SMPL-X 自碰撞缓解与 VLM 视觉批评器驱动的 IK 重定向结合,在尽量保持原动作和时序平滑的同时修正机器人动作。实验显示碰撞能量均值由 3.52 降至 0.94,8/9 序列改善,VLM 精炼也减少了手部漂移和腕部姿态偏差。

To Blend In, First Decouple: Rethinking Camouflage Image Generation via Context-Decoupled Representations Figure 1
2026-07-21cs.CV

To Blend In, First Decouple: Rethinking Camouflage Image Generation via Context-Decoupled Representations

Wenzhuang Wang, Yifan Zhao, Mingcan Ma, Yunlong Che, Haoran Chen, Ming Liu, Jia Li

State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University, Geely Automobile Research Institute (Ningbo) Co., Ltd, AI Center, Geely, State Key Laboratory of Virtual Reality Technology and Systems, SCSE & QRI, Beihang University Beijing China, Geely Automobile Research Institute (Ningbo) Co., Ltd, AI Center, Geely Ningbo China

2026-07-21视觉感知

针对伪装图像生成中前景与背景条件耦合导致的背景伪影和外观不一致,论文提出 CamoDreamer,将上下文表示解耦为目标与背景两路控制,并用对比上下文桥、解耦同化流和频率自适应融合分别处理差异建模、潜空间交互和纹理结构一致性。实验称其在生成保真度和下游感知任务上显著优于现有方法,且模型较轻量。

DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation Figure 1
2026-07-21cs.CV

DA-Fusion: Deformable Attention-Based RGB-D Fusion Transformer for Unseen Object Instance Segmentation

Yesol Park, Hye-Jung Yoon, Juno Kim, Byoung-Tak Zhang

2026-07-21视觉感知

面向物流拣选中遮挡、堆叠和未知物体导致的实例分割困难,DA-Fusion指出单用RGB易过分割、单用深度易欠分割,因而在Transformer中用可变形注意力多层动态融合纹理与几何信息,并提出面向俯视料箱场景的OCBD数据集。实验显示其在桌面、室内和料箱基准上优于已有UOIS方法,但具体增益中模型设计与新数据贡献的拆分仍需看消融细节。

PC-Seg: Progressive Cross-View Consistency for 3D OCT Segmentation from Sparse 2D Annotations Figure 1
2026-07-21cs.CV

PC-Seg: Progressive Cross-View Consistency for 3D OCT Segmentation from Sparse 2D Annotations

Tsubasa Konno, Takahiro Ninomiya, Yukun Zhou, Koichi Ito, Siegfried K. Wagner, Yiqun Lin, Pearse A. Keane, Toru Nakazawa, Takafumi Aoki

2026-07-21视觉感知三维

这篇论文针对OCT三维分割中体素级标注昂贵、现有半监督方法多按2D切片处理而难以利用三维上下文的问题,提出PC-Seg五阶段课程学习框架:先让单个2D模型在标准与正交切片间建立跨视角一致性,生成体伪标签,再蒸馏到3D模型并进行2D/3D协同训练。实验显示其在MSHC和Duke DME上仅用约0.7%标注即可接近全监督效果,并优于多种半监督与视网膜层分割方法。

SLAM in Low-Light Environments: Project Report Figure 1
2026-07-21cs.RO

SLAM in Low-Light Environments: Project Report

Oleh Basystyi, Anna Stasyshyn, Oleksandr Kosovan, Yaroslav Prytula

Applied Sciences Faculty, Ukrainian Catholic University, Ukrainian Catholic University, in collaboration with the UCU UGV Club.

2026-07-21视觉感知

本文针对低照度、噪声和运动模糊会使UGV依赖的视觉SLAM失效,而增加LiDAR等传感器又带来成本与集成负担的问题,系统比较六类RGB/视觉惯性SLAM在LaMARia低光序列上的表现。核心洞察是,仅靠算法范式切换难以弥合低光差距,稳定跟踪需要惯性融合与全局优化协同;实验中Kimera-VIO唯一跑完整部序列且相对误差最低,但仍有累积漂移,DPVO/DPV-SLAM不丢跟却出现约百米绝对误差,ORB-SLAM3、DSO和OpenVINS在困难低光场景多失败或发散。

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation Figure 1
2026-07-21cs.CV

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen

2026-07-21视觉感知

这篇论文针对医学图像分割中 VLM 零样本能力受域偏移影响、而传统测试时微调又容易被噪声伪标签破坏预训练图文对齐的问题,提出无需更新参数的 MSSA:筛选稳定的图文预测写入在线记忆,再用跨图像结构相似性和原型对齐细化当前样本。实验显示其在多个医学分割基准上稳定优于零样本和微调式 TTA,最高提升 12.2% DSC 与 11.7% mIoU。

Luminosity-Adaptive Contrast Enhancement Using CLAHE for Retinal Fundus Images with Quantitative Validation and Comparative Analysis Figure 1
2026-07-21eess.IV

Luminosity-Adaptive Contrast Enhancement Using CLAHE for Retinal Fundus Images with Quantitative Validation and Comparative Analysis

K. Mithra, Prem Kumar Santhanam

Independent Researcher, Department of Information and Computer Engineering, Scottsdale, AZ, USA, Seidenberg School of Computer Science and Information Systems, Pace University, New York City, NY, USA

2026-07-21视觉感知

这篇论文针对眼底图像中光照不均、低对比度会削弱人工阅片和自动筛查的问题,提出先在 HSV 空间校正 V 通道亮度、再对 V 通道做 CLAHE 的无需训练增强流程,以尽量保留颜色诊断信息。方法在 DRIVE、STARE、CHASEDB1 上验证,DRIVE 上 PSNR 29.3 dB、SSIM 0.91、CNR 3.12,疾病检测 AUC 0.869,且每图约 0.14 秒;但其临床收益仍主要由这些小规模公开数据集支撑。

ShotPlan: Cinematic Video Generation with Learnable Planning Token Figure 1
2026-07-21cs.CV

ShotPlan: Cinematic Video Generation with Learnable Planning Token

Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin Huang, Hongxun Yao, Chi Zhang, Xuelong Li

Institute of Artificial Intelligence (TeleAI), China Telecom, Harbin Institute of Technology

2026-07-21视觉感知规划控制

面向电影化视频生成中多镜头叙事难以精确规划、跨镜头一致性易受损的问题,ShotPlan 将镜头切换显式建模为可学习规划 token,并用 FRoPE 在帧级对齐用户指定转场时间,避免通过注意力掩码或改动视频 token 位置来硬分隔镜头。实验显示其在多镜头生成、硬切/渐变转场控制和主体场景一致性上优于现有方法,并可扩展到局部相机运动控制。

Attention from Above: A Multimodal Model for Drone-Based Object Localization Figure 1
2026-07-21cs.CV

Attention from Above: A Multimodal Model for Drone-Based Object Localization

Hyun-Ki Jung

University of Seoul, Seoul

2026-07-21视觉语言

面向无人机航拍中小目标密集、且目标需由文本提示灵活指定的场景,论文在 YOLO-World 上将 YOLOv8 backbone 的 C2f 替换为带注意力的 A2C2f,以强化局部边界与小目标特征。VisDrone 实验显示相对原模型 precision 43.0%→45.1%、recall 32.8%→35.0%、mAP@0.5 32.5%→35.2%,但低增益类别仍集中在更小且样本较少的目标上。

Early Yield Prediction for Sugar Beet Fields using Satellite Data -- Learnings from Specialized Vision Transformers Figure 1
2026-07-21cs.CV

Early Yield Prediction for Sugar Beet Fields using Satellite Data -- Learnings from Specialized Vision Transformers

Philipp Vaeth, Bhumika Laxman Sadbhave, Denise Dejon, Gunther Schorcht, Magda Gregorova

2026-07-21视觉感知强化学习

本文针对仅依赖公开 Sentinel-2 光学影像进行甜菜田早期产量预测的难题,强调在标签稀缺、田块尺度不一和多光谱输入下需重新审视通用视觉模型设计。核心洞察是,ViT 采用很小 patch 并使用全部可用光谱波段,反而优于常见设置;加入时间编码和排序式训练后,虽绝对产量回归仍很困难,但可在收获前较早识别出相当比例的低产田块。

RayOcc: Occlusion-Aware Ray Occupancy Estimation via Gaussian Mixture Intensity Figure 1
2026-07-21cs.CV

RayOcc: Occlusion-Aware Ray Occupancy Estimation via Gaussian Mixture Intensity

Junho Kim, Seongwon Lee

2026-07-21三维

RayOcc针对纯相机三维语义占据中单条视线可能包含多个被遮挡表面的问题,指出传统softmax深度提升把各深度bin当作互斥选择,会压制薄结构和多层几何。方法用非归一化高斯混合强度建模每条射线,并通过泊松事件形式得到区间占据概率,再自适应初始化多个3D Gaussian。nuScenes实验显示其在高斯占据方法中取得更高IoU和mIoU,但额外计算开销仍存在。

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment Figure 1
2026-07-21cs.AI

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

Wenxiao Fan, Hang Yin, Kan Li

2026-07-21视觉语言

这篇论文针对多模态模型在需要视角转换的空间推理中常依赖相机平面线索的问题,指出参考物体朝向是造成 camera-centric shortcut 的关键因素。作者提出 OrientSAM,用朝向感知 token、傅里叶角度编码和课程学习显式对齐物体朝向,并构建自动化空间监督数据。实验显示其在 Spatial-MM、ViewSpatial 和 3DSRBench 上优于强基线,尤其改善非相机视角、人中心和朝向敏感任务。

BMFA: Boundary-Minority Free-Energy Adaptive Screening Figure 1
2026-07-21cs.CV

BMFA: Boundary-Minority Free-Energy Adaptive Screening

Wenyan Xu, Alizer Wong

Guangdong University of Technology, School of Computer Science, Peking University

2026-07-21学习理论

BMFA针对ViT高效推理中块均值会淹没边界、小目标等少数高响应区域的问题,指出均值汇总与softmax指数聚合不一致,并以局部自由能缺口作为递归细分准则。实验显示其在合成、COCO/LVIS诊断和ImageNet上降低低估并保持71.520% Top-1,但当前仍在完整QK后评估选择质量,速度增益尚未验证。

LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation Figure 1
2026-07-21cs.CV

LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation

Jing Li, Pan Liu, Meng Zhao, Wanli Xue, Yanhong Yang, Xu Cheng, Fan Shi, Jianhua Zhang, Qinghua Hu, Shengyong Chen

2026-07-21视觉感知

这篇论文针对源数据不可用且目标域类别关系未知时,SF-UniDA 仍依赖阈值调参或聚类、难以同时处理开集/部分集等标签偏移的问题,提出用 LLM 生成潜在未知类文本、用 VLM 相似度判断标签偏移并识别未知样本,再以源模型与 CLIP 预测共识细化伪标签。实验覆盖 Office-31、Office-Home、VisDA、DomainNet 的多种标签偏移,报告性能优于现有方法,但具体增益中基础模型先验与适配模块各自贡献仍需细看消融。

Direct Clinical Joint Angle Extraction from Parametric Body Model Rotation Matrices Figure 1
2026-07-21cs.CV

Direct Clinical Joint Angle Extraction from Parametric Body Model Rotation Matrices

Joey Páolo Kardolus, Daan Hendriks, Jaap Jansen

2026-07-21视觉感知

这篇论文瞄准临床关节角测量难以走出实验室的问题,核心洞察是参数化人体模型已经输出逐段旋转矩阵,临床角度可通过静态标定表和摆扭分解直接读出,而不必再做逆运动学或肌骨模型拟合。在 OpenCap LabValidation 单手机视频上,GEM-X 达到 15 个可比角度 4.50° MAE,接近 OpenCap Monocular 的 4.8°;换 SAM 3D Body 仅改标定表为 4.66°,显示方法有一定模型迁移性。

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics Figure 1
2026-07-21cs.CV

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

2026-07-21视觉感知

本文针对古画褪色后仅凭残余视觉信息难以判定历史色彩、直接文本引导又易产生现代化偏色与越界渗色的问题,提出 PoemColor:用 P3 将诗意语义投射到古典调色板流形,再用 SASA 按笔触边界控制语义颜色传播,并结合合成退化与专家修复数据训练。实验报告其优于现有方法,LPIPS 0.334、FID 19.84,颜色分布误差约降 54%。

MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis Figure 1
2026-07-21cs.CV

MixDiffusion: Mixing Diffusion-based Uni-condition Text-to-Image Generation Models for Multi-condition Image Synthesis

Pengcheng Wan, Liang Han, Lin Xu, Bowen Xiao, Liqiang Nie

2026-07-21视觉感知生成模型

本文针对现有可控文生图模型通常只能处理单一或少数固定控制条件的问题,提出无需训练的 MixDiffusion,通过在每个去噪步骤用理论推导的噪声分布整合公式融合多个预训练单条件扩散模型,以支持框、关键点、草图、深度、参考图等多条件协同生成。实验表明该框架在多条件灵活组合下能保持较好的条件一致性和图像保真度,并便于扩展新控制模态。

Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection Figure 1
2026-07-21cs.CV

Brain-Aligned Multi-Stream Video Transformers with Sparse Self-Selection

Amir Hosein Fadaei, Mahyar Maleki, Mohammad-Reza A. Dehaqani

2026-07-21视觉感知

本文针对视频 Transformer 计算开销高、单流结构难以对应生物视觉通路且少有脑数据验证的问题,提出 what/where 双流分解与稀疏 winner-takes-all 自选择机制,用竞争式路由替代密集注意力。实验显示其在 Kinetics-400 和 Something-Something V2 上取得较好的精度-时延折中,并提升空间扰动鲁棒性;EEG 表征相似性峰值达 0.18,优于对比模型。

Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution Figure 1
2026-07-21cs.CV

Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution

Ao Li, Yapeng Du, Yi Xin, Lei Zhu, Le Zhang, Guangtao Zhai, Ce Zhu, Xiaohong Liu

2026-07-21视觉感知生成模型

论文针对真实感超分中连续扩散语义接入不够原生、AR 离散生成又太慢的问题,提出 DiMOO-SR,将超分放到多模态离散扩散 token 空间处理;核心洞察是视觉码本长尾会弱化稀有纹理学习,且并行解码易产生空间孤立错误,因此用 IFS 偏向训练稀有高信息 token,用 SCR 按邻域一致性重排置信度。RealSR、DRealSR 实验显示其在少量并行解码步下改善感知和分布指标。

Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation Figure 1
2026-07-21cs.CV

Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation

Sangmin Han, Jinho Kim, Jinwoo Kim, Dongyoung Kim, Seon Joo Kim

2026-07-21生成模型

这篇论文针对多曝光融合在动态场景和极端曝光下易鬼影、饱和区域需生成补全,而扩散式高分辨率推理又过慢的问题,提出 LIIFusion:低分辨率扩散先生成粗融合,并用自适应曝光校正恢复饱和结构,再以局部隐式函数结合高分辨率过曝/欠曝输入做坐标级细化。实验称在静态和动态基准上保持或提升结构与感知质量,同时较现有生成式 MEF 最高加速 3.5 倍。

Semantic Color Naturalness Breaker: Preventing Illegitimate Colorization via Content-Aware Color Priors Figure 1
2026-07-21cs.CV

Semantic Color Naturalness Breaker: Preventing Illegitimate Colorization via Content-Aware Color Priors

Yuki Nii, Futa Waseda, Ching-Chun Chang, Isao Echizen

2026-07-21视觉感知

论文针对灰度漫画、老照片等被现成模型低成本非法上色的问题,指出既有 Uncolorable Examples 主要压低色度,常留下“灰但自然”的可用结果。作者提出 SCNB,用语义颜色先验和无需真值的 CaCDD 指标直接优化颜色不合语义,从而破坏自然性。ImageNet 实验显示,该方法在小扰动预算、常见后处理和多个上色器上仍能造成较强语义颜色失真。

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning Figure 1
2026-07-21cs.CV

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

2026-07-21视觉感知

这篇论文针对视频空间推理中长时序、视角变化带来的证据冗余与答案不稳定问题,核心洞察是静态场景中的正确空间关系应在跨视角下保持几何一致。ConsiSpace将这种一致性用于记忆写入、融合、检索,并在SFT后用答案、度量和拓扑一致性奖励做自监督强化学习。在VSI-Bench、OSI-Bench和MMSI-Video-Bench上,平均分较最强基线提升12.6分。

Miles: Metric Learning with Expandable Subspace for Pre-Trained Model-Based Class-Incremental Learning Figure 1
2026-07-21cs.CV

Miles: Metric Learning with Expandable Subspace for Pre-Trained Model-Based Class-Incremental Learning

Kai Jiang, Zisong Lin, Hongyuan Zhang, Xueru Bai, Xuelong Li

2026-07-21视觉感知

这篇论文针对预训练模型用于类增量学习时的两难:共享参数易遗忘,按任务扩展分支又增加计算。核心思路是利用预训练特征中未见类仍会聚簇的现象,将度量学习引入可扩展子空间,通过SPP对齐类别原型、SRE以低秩子网络吸收中间特征,并用距离正则缓解新任务过拟合。作者在六个基准上报告Miles在多种CIL设置达到SOTA,但具体增益对各模块和计算开销的依赖仍需看完整实验细节。

Pixel-Space Diffusion Transformers Figure 1
2026-07-21cs.CV

Pixel-Space Diffusion Transformers

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Ehsan Adeli, Kilian M. Pohl, Guoying Zhao

You Wu is with Nanjing University, China., Wei Peng, Yu Zhang, Ehsan Adeli, and Kilian M. Pohl are with Stanford University, USA., Qingyu Zhao is with Cornell University, USA., Athanasios V. Vasilakos is With the Center for AI Research,University of Agder(UiA), Norway., Guoying Zhao is with the University of Oulu, Finland.

2026-07-21生成模型

本文动机是指出潜空间扩散依赖 VAE 压缩,容易丢失纹理、边界和局部结构,并造成重建目标与生成目标错配。文章作为综述,核心洞察是重新评估像素空间扩散 Transformer:用端到端像素建模、x0 预测、多分支/频率解耦和细粒度 token 设计缓解高维计算压力,并把像素、文本和条件纳入统一 token 空间。主要结果是梳理了 pDiT 架构、连续生成机制和多模态统一建模的研究版图;具体性能增益多来自已有方法汇总,增益来源和最终上界文中未充分说明。

Scalable Model-Assisted Multi-Target Estimation in Large Image Collections Figure 1
2026-07-21cs.CV

Scalable Model-Assisted Multi-Target Estimation in Large Image Collections

Max Hamilton, Jinlin Lai, Daniel Sheldon, Subhransu Maji

University of Massachusetts

2026-07-21视觉感知

这篇论文针对大规模图像集合中用视觉模型做科学计量时的偏差与不确定性问题,将有限人工标注和模型预测结合,扩展到多类别计数/比例的同步估计,并系统比较调查抽样中的重要性采样、控制变量、比率估计等方案。结果显示,少目标或中等标注预算下重要性采样更优,多目标或极少标注时均匀采样加控制变量更稳健,10%标注通常可将平均类别误差降至15%以内。

AGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models Figure 1
2026-07-21cs.LG

AGG: Jacobian-Aggregated Group Gradient for Efficient GRPO Training of Diffusion Models

Ruiyi Ding, Jie Li, He Kang, Ziyan Liu, Chengru Song, Yuan chen

2026-07-21生成模型优化算法

本文针对扩散/flow 模型用 GRPO 做偏好对齐时,每个去噪步都需穿过 DiT 反传、训练成本过高的问题。核心洞察是高噪声阶段速度场对参数的 Jacobian 沿轨迹近似线性,因此用端点 Jacobian 的 t 加权插值聚合中间梯度,把每组 W 步反传降到 2 次,并用余弦相似度选择适用区间。实验显示文本到图像训练约获得 2 倍反传加速、单步墙钟提升 17–18%,质量退化很小。

FlexiGrad: Adaptive Gradient Modulation for Hierarchical Fine-Grained Classification Figure 1
2026-07-21cs.CV

FlexiGrad: Adaptive Gradient Modulation for Hierarchical Fine-Grained Classification

Zilu Zhou, Dongliang Chang, Junhan Chen, Zhanyu Ma

2026-07-21优化算法

这篇论文针对层级细粒度分类中粗粒度与细粒度监督共享骨干时产生的梯度冲突,提出无参数的 FlexiGrad,在反向传播中按层级一致性削弱有害冲突分量、增强一致方向,而不改模型结构。在 CUB、FGVC-Aircraft 和 Stanford Cars 上,各层级准确率均提升,细粒度类别收益更明显;但作为 arXiv 预印本,代码与复现实证仍需后续验证。

Hierarchy-Aware and Anatomy-Guided Learning for Lung Ultrasound Video Classification Figure 1
2026-07-21cs.CV

Hierarchy-Aware and Anatomy-Guided Learning for Lung Ultrasound Video Classification

Alya Almsouti, Lotfi Mecharbat, Noha Aboukhater, Yousef Alabrach, Siddiq Anwar, Andre Kumar, Ibrahim Almakky, Mohammad Yaqub

Yousef Alabrach

2026-07-21视觉感知

肺超声用于早期评估肺水肿,但自动视频判读受散斑噪声、伪影和采集差异影响。论文将临床诊断层级引入训练,并用胸膜线掩码监督注意力,使模型更关注解剖相关区域;在1886段公开视频、患者级五折验证中,掩码引导方案取得65.7%宏F1,外部COVID-BLUeS迁移实验也显示较高参数效率和较稳定的胸膜聚焦。

Thinking in Video: Can Video Generators Really Reason About the Real World? Figure 1
2026-07-21cs.CV

Thinking in Video: Can Video Generators Really Reason About the Real World?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

Central South University, Tsinghua University

2026-07-21视觉感知强化学习

论文关注视频生成模型是否真的能作为“世界模拟器”进行因果推理,而不只是生成看似合理的未来画面。作者提出 CGDJ 双重评测框架,用展平时序视频检验显式因果感知,并用未来视频生成检验隐式预测一致性。实验显示开源模型几乎缺乏显式因果理解却仍能生成较合理动态,闭源模型表现更好但对齐仍有限,并存在语言因果判断强于视频呈现的音视频错配。

DecoyFace: Beyond Obfuscation via Controllable and Imperceptible Identity Misdirection for Privacy-Preserving Face Recognition Figure 1
2026-07-21cs.CV

DecoyFace: Beyond Obfuscation via Controllable and Imperceptible Identity Misdirection for Privacy-Preserving Face Recognition

Zhihan Ren, Lijun He, Xinyao Wang, Xinzhu Fu, Fan Li

Shaanxi Key Laboratory of Deep Space Exploration Intelligent, Information Technology, School of Information and Communications, Engineering, Xi’an Jiaotong University, Xi’an 710049, China

2026-07-21视觉感知规划控制

面向端云分离式人脸识别中传输特征和诚实但好奇服务器都可能反演身份的问题,DecoyFace不再追求让重建图像失真,而是将特征分解为重建敏感子空间和互补子空间,在客户端注入可控诱饵身份、服务器端再规范化以保留授权识别。实验显示其在维持竞争性识别精度的同时,将U-Net和Flow-Matching攻击下的身份泄漏降至2.93%和0.74%,且重建仍具高人脸有效性。

Generative Transmission: Rethinking Computation, Bandwidth, and Memory in Communication Figure 1
2026-07-21cs.CV

Generative Transmission: Rethinking Computation, Bandwidth, and Memory in Communication

Xiangyu Chen, Jixiang Luo, Yuankai Fan, Haibin Huang, Chi Zhang, Xuelong Li

2026-07-21生成模型

面向超低带宽、弱网络下视频通信易失真和不稳定的问题,论文提出 GenTrans,将生成式视频压缩扩展为带宽、计算与记忆的系统级协同:用生成先验重建、跨片段记忆和运行态复用减少重复传输与解码,并配合弱网感知传输。实验显示其在低 bpp 下较 HEVC 有更低 LPIPS,且提升带宽效率、解码效率和丢包鲁棒性,但具体实现细节与增益来源仍需更充分说明。

TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning Figure 1
2026-07-21cs.CV

TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning

Bin Han, Robert Wolfe, Bill Howe

2026-07-21强化学习

这篇论文针对航拍图中人行道/过街路径仅做像素分割会产生断裂图、影响无障碍导航的问题,将路径提取建模为“行人行走”的序列决策过程。TraversRL用方向-距离动作逐步扩展图结构,并通过监督预训练加GRPO强化学习,以全局图IoU和局部边重叠奖励兼顾连通性与几何精度。实验显示其相对Tile2Net平均IoU提升43.6%、TravSim提升205%,局部奖励还能进一步小幅提升并减少冗余分支。

DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation Figure 1
2026-07-21cs.CV

DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation

Siobhan Reid, Zhixiang Chi, Li Gu, Omid Reza Heidari, Ziqiang Wang, Yang Wang

2026-07-21视觉感知

面向机器人进入新环境、医疗等只能用少量无标注目标样本且需低开销适应的场景,论文将少样本测试时域适应改写为 LoRA 参数空间合并:先为各源域训练 CLIP 视觉编码器 LoRA,再用元学习超网络根据目标小批量图像生成逐列合并权重,得到单个适配模型。实验称在 DomainNet、Camelyon17、FMoW 上达到 SOTA,平均准确率分别提升约 1.24%、2.70%,FMoW 最差域提升 11.40%。

Bio-SFT: Asymmetric Cortical Guidance and Retinal Adaptation for Robust HDR Reconstruction Figure 1
2026-07-21cs.CV

Bio-SFT: Asymmetric Cortical Guidance and Retinal Adaptation for Robust HDR Reconstruction

Tingyu Cheng, Ting Zhang, Chongyi Li, Zhaoqing Pan, Tiesong Zhao

2026-07-21三维安全鲁棒

本文针对单张 SDR 图像恢复 HDR 时暗区量化噪声、极端亮度和颜色失真容易被多尺度融合放大的问题,提出 Bio-SFT:用可学习 Naka-Rushton 视网膜适应稳定输入,显式拆分 Parvo/Magno 频率通路,并以 SNN 硬门控实现高频到低频的非对称引导。实验称其在 HDRTV1K 上提升 HDR-VDP-3 与 ΔE_ITP、减少伪影,且仅 0.14M 参数,但跨场景泛化幅度仍需更多证据。

An Explainable FFT-Based Spatial-Frequency Fusion Framework for Deepfake Detection Figure 1
2026-07-21cs.CV

An Explainable FFT-Based Spatial-Frequency Fusion Framework for Deepfake Detection

Pamela Kirui, Cho Hyuk, Qingzhong Liu, Haodi Jiang

2026-07-21视觉感知

针对深度伪造痕迹在像素域中日益隐蔽、单一空间或频域特征容易漏检的问题,论文提出 MSCA-FFT:以部分微调的 Xception 提取空间线索,直接从对数 FFT 幅度谱学习频域线索,并经 Transformer 与交叉注意力融合,避免 DCT 方案的逆重建步骤。在 Celeb-DF v2 和 FaceForensics++ 上分别取得 99.98% 与 99.16% AUC,消融显示频域分支提供互补信息,Grad-CAM/LIME 关注眼、口、鼻和面部边界等敏感区域。

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs Figure 1
2026-07-21cs.CV

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs

Yuhan Zhu, Changlian Ma, Xiangyu Zeng, Xinhao Li, Zhiqiu Zhang, Songze Li, Jun Zhang, Tianxiang Jiang, Yuandong Yang, Ziang Yan, Zikang Wang, Xinyu Chen, Haoran Chen, Shaowei Zhang, Limin Wang

Nanjing University, Shanghai AI Laboratory, Shanghai Jiao Tong University, Zhejiang University, University of Science and Technology of China, Fudan University

2026-07-21视觉语言视觉感知

这篇论文关注视频多模态大模型“能描述但不能指出证据何时出现”的问题,将时间定位建模为可变数量的区间集合。TimeLens2的关键在于用93K分阶段验证数据构造可靠多片段监督,并用匹配无关的时间Wasserstein奖励补足tIoU对不重叠预测无梯度的问题。实验显示2B/4B/8B在七个基准上显著优于Qwen3-VL骨干,4B、8B达到开源SOTA。

Does Super-Resolution Preserve Defect Evidence? A Low-False-Call Benchmark for Semiconductor Inspection Figure 1
2026-07-21cs.CV

Does Super-Resolution Preserve Defect Evidence? A Low-False-Call Benchmark for Semiconductor Inspection

Shaoliang Yang, Jun Wang

Santa Clara University

2026-07-21数据集/基准

本文针对半导体检测中“超分图像更清晰但缺陷证据可能丢失”的风险,提出 WaferInspectSR-Bench,将重建质量与低误报率下的检测效用分开评估,并固定检测器比较图像变换。结果显示,学习型超分虽有更高 SSIM,却在所有重复实验中比双三次插值检出更少缺陷;DeepLabV3 直接检测在可行误报率下表现更稳,弱缺陷仍几乎无法可靠检出。

The PanAf-SBR Dataset: Social Behaviour Recognition for Wild Great Apes Figure 1
2026-07-21cs.CV

The PanAf-SBR Dataset: Social Behaviour Recognition for Wild Great Apes

Maciej Braszczok, Otto Brookes, Xiaoxuan Ma, Federico Rossano, Yixin Zhu, Mimi Arandjelovic, Hjalmar Kühl, Majid Mirmehdi, Tilo Burghardt

2026-07-21视觉感知数据集/基准

为弥补野外相机陷阱数据缺少细粒度社会行为标注的问题,本文构建 PanAf-SBR,在 PanAf500 上新增 100 段视频、3.6 万帧和 8.1 万个框、掩码、身份及施受角色行为标签。作者用 AlphaChimp 给出首个野外类人猿社会行为识别基准,并发现 ChimpACT 与 PanAf-SBR 的跨数据集预训练只对部分类别明显有益,背景上下文影响也被单独检验。

Automating Visual Recognition of Leprosy in Wild Chimpanzees Figure 1
2026-07-21cs.CV

Automating Visual Recognition of Leprosy in Wild Chimpanzees

Katie I. Murray, Anna C. Bowland, Marina Ramon, Elena Bersacola, Aissa Regalla, Manmohan D. Sharma, Markus Mueller, Majid Mirmehdi, Dave Hodgson, Kimberley J. Hockings, Tilo Burghardt, Otto Brookes

2026-07-21视觉感知

针对野外黑猩猩麻风病监测中相机陷阱视频规模过大、人工筛查不可行的问题,论文构建 PanLep300 数据集并比较 2D、2.5D 与 3D 识别方案。核心洞察是该病视觉症状较静态,基于个体框裁剪的逐帧预测再简单聚合,反而稳定匹配或优于复杂时序/视频模型;同时指出轨迹首尾的局部可见会压低性能,可通过筛选与聚合策略缓解。

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing Figure 1
2026-07-21cs.CV

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

Kaiwen Jing, Ruixu Jia, Bingyao Li, Ruizhe Ou, Ming Wu, Chuang Zhang

Beijing University of Posts and Telecommunications, Beijing, China, Peking University, Beijing, China, Beijing Wuzi University, Beijing, China

2026-07-21视觉语言视觉感知

面向无人机遥感视频中小目标、视角动态和语言指代像素级分割困难的问题,SkyVLaM将视觉token预算作为核心瓶颈处理:用时序基感知器从patch级视频表示生成稀疏token,并通过残差自适应选择高分辨率密集片段。论文还构建含像素级标注的SkyVid数据集,实验显示其在视频扎根对话和指代表达视频分割上优于对比方法。

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition Figure 1
2026-07-21cs.CV

STAR: Skeletal Token Alignment and Rearrangement for Interaction Recognition

Yuhang Wen, Mengyuan Liu, Zixuan Tang, Junsong Yuan, Sirui Li, Beichen Ding

2026-07-21视觉感知

面向人机/人人交互识别,STAR针对骨架序列虽高效且隐私友好、但交互线索利用不足且缺少视觉语义的问题,提出实体重排与交互时空token建模骨架关系,并在训练阶段用视觉交互区域与骨架表示做对比对齐,推理时仍只需骨架。实验在Chico、HARPER和NTU Mutual系列数据集上优于现有方法。

Understanding From Human Perspective: A Multi-agent System for Interactive Egocentric Medical Image Segmentation Figure 1
2026-07-21cs.CV

Understanding From Human Perspective: A Multi-agent System for Interactive Egocentric Medical Image Segmentation

Rongjun Ge, Dongyang Wang, Heng Zhu, Zhirui Li, Yang Chen, Yuting He

2026-07-21视觉感知

本文面向智能眼镜辅助阅片中的第一视角交互式医学图像分割,动机是医生口头指令常有歧义且头动导致视频目标漂移。EgoMed-Agent用检测、确认、传播三个智能体先按可靠性确认目标,必要时追问,再用逐帧定位纠正掩码传播。实验平均Dice达71.34%,显著高于最佳文本提示基线11.70%。

Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection Figure 1
2026-07-21cs.CV

Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Can Ma, Yu Zhou

2026-07-21视觉感知

面向连续域变化下目标检测容易遗忘旧域的问题,本文提出 OKR:为每个新域增设独立 LoRA 低秩分支,并用梯度正交刷新把新更新投影到历史子空间的正交补,同时加入拓扑一致性保持语义结构。该方法无需旧样本和推理时域路由,在 Pascal VOC 与 BDD100K 序列上较最佳无样本方法分别提升 5.6% 和 6.5% mAP。

MIS-HCC: Hierarchical Channel Clustering for Efficient Medical Image Segmentation Figure 1
2026-07-21cs.CV

MIS-HCC: Hierarchical Channel Clustering for Efficient Medical Image Segmentation

Bo Zhao, Haoran Yu, Lifei Liu, Zongcheng Chu, Yining Liu, Chang Liu, Szu-Yu Chen, Zequn Xie

*Zequn Xie is the corresponding author. 1 Bo Zhao is with Yale University, Haoran Yu is with University of Florida, Lifei Liu is with Wichita State University, Zongcheng Chu is with Purdue University, Yining Liu is with University of California, Berkeley, Chang Liu is with the Institute of Computing Technology, Chinese Academy of Sciences, Szu-Yu Chen is with Stevens Institute of Technology, Zequn Xie is with Zhejiang University

2026-07-21视觉感知

面向医疗分割模型难以部署到边缘或低资源设备的问题,MIS-HCC不再直接删除“冗余”通道,而是用Wasserstein距离度量层内通道相似性,经层次聚类后融合参数,以保留相关特征。实验在BUSI、DSB、ISIC等数据集和U-Net/U-Net++上以87.5%剪枝率比较多种方法,整体Dice/IoU优于RP、PFEC、HRank、CHEX和TPP,但部分ISIC结果增益较小,泛化到更多真实临床场景仍需验证。

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation Figure 1
2026-07-21cs.RO

From Perception to Assistance: Open-Vocabulary Shared Autonomy for Robotic Manipulation

Murilo Vinicius da Silva, Ricardo V. Godoy, Juliano Negri, Gustavo J. G. Lahr, Ranulfo Bezerra, Marcelo Becker

University of São Paulo, São Carlos, Brazil

2026-07-21机器人

面向工业场景中四足移动机械臂遥操作精度不足、避障负担高的问题,本文把开放词汇目标定位、免标定视觉遥操作、在线体素地图与GPU-MPC避碰结合,并用势场在接近阶段纠正操作者指令,同时保留人工主导。实机结果显示接口位置RMSE为59 mm,避障可保持至少18 cm距离;阀门操作和取放任务中完整系统全部成功,去除避碰或辅助模块会导致失败,自治模式每项任务5次中成功4次。

PACE: Polar Axis-Conditioned Estimation for PairUAV Relative Localization Figure 1
2026-07-21cs.CV

PACE: Polar Axis-Conditioned Estimation for PairUAV Relative Localization

Ze Rong

FST and ICI, University of Macau

2026-07-21视觉感知

本文针对 PairUAV 相对定位中航向与距离虽共享图像对上下文、却对解码层证据和训练状态需求不同的问题,提出 PACE:保留 Reloc3r 式共享表示,但为极坐标两轴设计差异化读出,航向利用中后层关系特征,距离保持晚期度量路径。实验显示两轴最优检查点大量不一致,官方隐藏测试中最佳原始预测得分 0.002460,确定性提交封装后达 0.001874;但部分提升来自挑战特定融合与校准,迁移性文中未充分说明。

VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts Figure 1
2026-07-21cs.CV

VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts

Hao Yuan, Yuxuan Luo, Xing Chen, Zhouhui Lian

Fuzhou University, Peking University, Fuzhou University China, Peking University China

2026-07-21视觉感知

这篇论文针对中文矢量字形直接生成中结构、锚点布局与贝塞尔曲线细节被压进同一 SVG 序列、导致复杂字易失效的问题,提出 VecFontLLM:先生成并细化锚点骨架以固定部件和轮廓布局,再补全控制点恢复局部风格,并在测试时用置信度选择部件候选。实验显示其较既有矢量方法明显提升,渲染质量接近栅格基线,同时保留可编辑矢量输出。

Semantic Context Matters: Analysis of Color Names Across Domains Figure 1
2026-07-21cs.CV

Semantic Context Matters: Analysis of Color Names Across Domains

Adilet Yerkin, Elnara Kadyrgali, Malika Ziyada, Nuray Toganas, Muragul Muratbekova, Ayan Igali, Aruzhan Sabitkyzy, Pakizar Shamoi

2026-07-21视觉感知

论文关注同一物理颜色在不同应用语境中会被赋予不同名称的问题,尝试用 COLIBRI 的 86 个模糊颜色类别统一映射化妆品、Crayola 和汽车颜色词汇,并用覆盖率、熵和最大 lift 比较命名分布。结果显示 Crayola 覆盖最广且更均衡,化妆品集中于暖色,汽车颜色偏蓝色与无彩色,说明颜色命名差异不能仅由数值相似度解释。

Induce to Empower: Improving Lightweight Baselines via Foundation Model Induction for Generalized Polyp Segmentation Figure 1
2026-07-21cs.CV

Induce to Empower: Improving Lightweight Baselines via Foundation Model Induction for Generalized Polyp Segmentation

Shivanshu Agnihotri, Snehashis Majhi, Deepak Ranjan Nayak, Dwarikanath Mahapatra, Debesh Jha

2026-07-21视觉感知

该文面向息肉分割中轻量模型跨数据集泛化弱、基础模型直接部署又过重的问题,提出 Lite-π:从轻量编码器诱导出对应 SAM、DINOv2、OneFormer 的原型表示,并用重建监督与基础模型先验对齐,再通过 Transformer/Mamba 融合强化息肉边界和语义特征。在五个基准上,方法持续提升 U-Net、U-Net++、PraNet 等轻量基线,声称以较小额外开销获得更好的泛化性能。

Cross-Coordinate Correspondence Pruning for Image-to-Point Cloud Registration Figure 1
2026-07-21cs.CV

Cross-Coordinate Correspondence Pruning for Image-to-Point Cloud Registration

Xin Liu, Rong Qin, Huipeng Lin, Leizhi Shu, Jin Wu, Chi-Man Vong, Liang Lin, Jufeng Yang

2026-07-21视觉感知三维

本文针对图像到点云配准中粗匹配阶段的点云密度权衡:太稀缺少内点,太密又引入大量外点。核心做法是将3D对应投影到2D坐标系,用轻量网络结合几何与多模态特征预测内点置信度进行CCP剪枝,并用MDPE融合多密度候选以提高召回。实验称在多个基准上Registration Recall较SOTA至少提升8.6%。

BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos Figure 1
2026-07-21cs.CV

BanClickThumb: A Multimodal Dataset and Transformer Fusion Benchmarks for Clickbait Detection in Bengali YouTube Videos

Md. Ariful Islam, Md Tanvirul Islam, Md. Maruf Hossain Miru, Md Khalid Syfullah

2026-07-21视觉语言视觉感知数据集/基准

针对孟加拉语 YouTube 点击诱饵缺少公开多模态数据的问题,论文构建了 7147 个缩略图-标题配对的 BanClickThumb,并系统比较文本、图像及早/晚/中间融合 Transformer。结果显示标题信号强于缩略图,XLM-RoBERTa 文本模型达 0.82 准确率,ViT+XLM-RoBERTa 中间融合提升到 0.84;增益有限,难点仍在密集图中文字、隐喻表达和本土俚语。

VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects Figure 1
2026-07-21cs.CV

VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects

Yanrong Qin, Xiaoyan Cao, Yao Yao

2026-07-21视觉感知

针对蜂群等小目标密集且外观高度相似场景中,多目标跟踪的重识别训练仍按单实例匹配、而推理需全局关联导致身份切换的问题,VLA-ReID将历史轨迹作为查询、当前帧检测作为候选,直接学习帧级关联矩阵,并用FCAE/CAS抑制同帧共同外观成分以放大差异。在BEE24上相较强基线提升HOTA、IDF1等指标,身份切换减少28%。

Noise-Robust Box-Supervised Infrared Small Target Detection via Physics-Inspired Soft Label Optimization Figure 1
2026-07-21cs.CV

Noise-Robust Box-Supervised Infrared Small Target Detection via Physics-Inspired Soft Label Optimization

Xizhe Zhang, Fan Shi, Mianzhao Wang, Jiangpeng Zheng, Xu Cheng, Shengyong Chen

2026-07-21视觉感知优化算法安全鲁棒

本文针对红外小目标检测中像素级标注昂贵且边界模糊、框标注又易被背景污染的问题,提出 HALO:先在框内依据局部辐射统计定位热斑锚点,再生成物理锚定高斯软标签,离线把噪声框转为像素级监督。实验显示其在紧框下与代表性框监督方法相当,在更松或偏移框下更稳健,并通过信杂比分析刻画适用边界。

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs Figure 1
2026-07-21cs.CV

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

Jilin University, Tencent YouTu Lab, and sequential reinforcement learning further refines target-centered coordination. Across visual, ∗Work was done when Ye Wang interned at Tencent YouTu Lab.

2026-07-21视觉感知

论文针对统一多模态模型中“能说对目标却生成不一致图像”的理解-生成语义错位问题,提出 STBridge:以图像编辑的目标状态为共享锚点,把目标描述与编辑结果耦合训练,并通过 SFT 后接序列强化学习优化。实验显示其相对 BAGEL 在理解、生成和编辑基准上均有提升,如 BLINK +5.15、OddGridBench +5.14、ImgEdit +0.46、RISE +21.00,caption-image 一致性也从 0.574 提升到 0.900。

Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures Figure 1
2026-07-21cs.CV

Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures

Gautam Ranka, Paras Chopra

2026-07-21视觉感知

本文追问扩散/去噪模型对视觉错觉的相似人类反应是否只是输出相关,还是源于内部表征。作者跨 U-Net、潜空间扩散和 DiT 等模型逐层定位错觉敏感通道,并用消融检验因果作用;结果显示去噪目标比架构更关键,这些表征与 FLODOG 亮度模型相关且随错觉强度单调变化,但到像素输出前被明显衰减,形成“感知幽灵”。

Learning Emotion from Motion: Kinetic Multi-Stream Skeleton Modeling with Metadata-Conditioned Weak Label Distributions Figure 1
2026-07-21cs.CV

Learning Emotion from Motion: Kinetic Multi-Stream Skeleton Modeling with Metadata-Conditioned Weak Label Distributions

Sosuke Suzuki, Yijin Wei, Koichiro Kamide, Ran Dong, Haoran Xie, Chao Zhang

2026-07-21视觉感知

这篇论文面向骨架动作中的情绪识别,动机是单纯旋转表示难以捕捉位移、速度、肢体关系等细微信号,且硬标签难表达情绪边界模糊性。方法上将6D旋转STGCN++、关节/骨骼/速度/加速度多流与身体部位注意、元数据条件弱标签分布学习独立训练后做概率集成;在DIEM-A留表演者交叉验证中,Accuracy由0.271升至0.366,Macro-F1由0.252升至0.353,消融显示速度、骨骼流及手臂和腿部贡献较大。

The generator is the tracker: Multi-object tracking by painting persistent identity colours Figure 1
2026-07-21cs.CV

The generator is the tracker: Multi-object tracking by painting persistent identity colours

Haiyu Yang, Miel Hostens

Cornell University

2026-07-21视觉感知

论文动机是挑战传统多目标跟踪中“检测再关联”、身份依赖外部状态的范式,检验视频生成模型能否把身份直接维持在像素里。核心做法是微调 LTX-2.3 将 RGB 视频生成持续身份颜色图,并用窗口续接训练维持长视频一致性。DanceTrack 上 HOTA 40.3,低于专用跟踪器,但 AssA 44.1 高于原始基准套件,显示关联能力突出,主要短板在密集场景检测和速度。

DepthART: Scaling Foundation Monocular Depth to Tiny Models Figure 1
2026-07-21cs.CV

DepthART: Scaling Foundation Monocular Depth to Tiny Models

Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe

University of Trento, Beijing University of Posts and Telecommunications, The Hong Kong University of Science and Technology, Tsinghua University, University of Trento Trento Italy, Beijing University of Posts and Telecommunications Beijing China, The Hong Kong University of Science and Technology Hong Kong China, Tsinghua University Beijing China

2026-07-21视觉感知

这篇论文针对单目深度基础模型难以落到端侧小模型的问题,指出小容量网络在蒸馏时易吸收数据集偏置、在度量微调时易因相机变化遗忘几何能力。DepthART用抗偏采样构建训练子集,并冻结编码器、加入相机内参条件适配来稳定尺度。实验显示其在零样本泛化和度量精度上优于既有轻量基线,DepthART-S还可在A6000、Orin NX和Jetson Nano上实现实时推理。

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis Figure 1
2026-07-21cs.CV

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

South China University of Technology, Beijing Normal University, Tsinghua University, South China University of Technology Guangzhou China, Beijing Normal University Beijing China, Tsinghua University Beijing China

2026-07-21三维

HarmoHOI针对手物交互视频中细粒度手部运动、遮挡和多视角几何不一致问题,提出在统一扩散框架内联合生成RGB多视角视频与全局对齐3D点轨迹。其关键做法是把点轨迹编码成伪视频以复用视频基础模型先验,并用GloMAD细化到度量尺度轨迹。实验显示其在视觉质量、运动合理性和多视角几何一致性上优于对比方法。

Autoregressive B-Rep Shape Generation with Parametric Surfaces Figure 1
2026-07-21cs.CV

Autoregressive B-Rep Shape Generation with Parametric Surfaces

Dafei Qin, Rui Xu, Zeyu Shen, Kaichun Qiao, Hongyang Lin, Qixuan Zhang, Huaijin Pi, Lan Xu, Jingyi Yu, Wenping Wang, Taku Komura

The University of Hong Kong, Deemos Technology Co., Ltd., Institute of Software, Chinese Academy of Sciences, ShanghaiTech University, Deemos Technology Co., Ltd., The University of Hong Kong, ShanghaiTech University, Texas A&M University, The University of Hong Kong, Deemos Technology Co., Ltd. China, Institute of Software, Chinese Academy of Sciences China, ShanghaiTech University, Deemos Technology Co., Ltd. China, The University of Hong Kong China, ShanghaiTech University China, Texas A&M University USA

2026-07-21视觉感知

这篇论文针对现有 B-Rep 生成依赖点/网格近似、丢失 CAD 原生曲面类型和参数的问题,提出 ParaCAD:用面为中心的 tokenizer 显式编码解析曲面类型与连续参数,并以自回归方式从点云生成带 UV 域的参数曲面,再通过全局曲面求交和整数规划恢复拓扑。实验显示其在几何精度、点云对齐、水密性和下游可编辑性上优于点式基线,但更复杂自由曲面和可控生成仍是限制。

ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments Figure 1
2026-07-21cs.CV

ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments

Mansi Phute, Alexander Greenhalgh, Matthew Hull, Haoran Wang, Alec Helbling, ShengYun Peng, Elliott Faa, Willian Lunardi, Martin Andreoni, Wenke Lee, Duen Horng Chau

2026-07-21数据集/基准

针对视觉检测对抗补丁常在静态、单场景和后处理渲染中评估而高估鲁棒性的问题,Allude 将 Unreal Engine 场景与 Mitsuba 可微渲染统一起来,支持跨平台、可配置的天气、光照、物体和相机轨迹评测。作者从 5400 种配置采样并复测 CAMOU、RAUCA、FCA,发现天气和连续视角会显著削弱攻击成功率,尤其移动相机暴露了既有方法的评估盲点。

AdvSerial: Physical Adversarial Attacks on Infrastructure-mounted Pedestrian Detectors via Semantic Feature Suppression Figure 1
2026-07-21cs.CV

AdvSerial: Physical Adversarial Attacks on Infrastructure-mounted Pedestrian Detectors via Semantic Feature Suppression

Yuanhao Huang, Yilong Ren, Jinlei Wang, Xuesong Bai, Jinchuan Zhang, Haiyang Yu

2026-07-21视觉感知

面向路侧/高位摄像头行人检测,论文指出现有物理对抗补丁多针对正面单帧,难以在高俯视、衣物形变和连续视频中稳定失效。AdvSerial 将2D攻击、3D服装UV渲染与连续帧优化结合,用特征平滑拼接和Serial Frame Loss抑制行人语义特征并减少时序闪烁。实验中其在真实场景对YOLO-v5达74.8%攻击成功率,将平均置信度从84.30%降至39.38%,并在8类检测器、NapGuard和Sparse4D-v3下显示较强迁移与抗防御能力。

DROID-ANCHOR: Odometry-Anchored Recurrent Metric Depth Estimation Figure 1
2026-07-21cs.RO

DROID-ANCHOR: Odometry-Anchored Recurrent Metric Depth Estimation

Yuxuan Chen, Brook Du

2026-07-21视觉感知

论文针对单目 SLAM 在机器人导航中缺少绝对尺度、易产生尺度漂移的问题,将轮速计或 IMU 里程计作为持续尺度约束注入 DROID-SLAM:用 LSTM 编码高频里程计序列并融合到循环更新,同时在 BA 后端学习时变协方差以权衡视觉重投影和里程计残差。TUM 上相对 DROID-SLAM 降低 RMSE(6.800→1.663)和 AbsRel(0.617→0.528),但仍弱于 Depth Anything V3;泛化受同步 RGB-D 与里程计数据稀缺限制。

High-Capacity Robust Watermarking Technology for High-Resolution Images Figure 1
2026-07-21cs.CV

High-Capacity Robust Watermarking Technology for High-Resolution Images

Shaowu Wu, Wei Lu, Qing Qian, Mingsen Deng

School of Computer Science and, Engineering, Sun Yat-sen University, School of Information, Guizhou University of Finance and Economics, Engineering, Sun Yat-sen University Guangzhou China, School of Information, Guizhou University of Finance and Economics Guiyang China

2026-07-21视觉感知安全鲁棒

面向AIGC溯源与版权认证中高分辨率图像需嵌入大容量元数据的需求,论文提出按块嵌入4KB水印,并用对称可逆编码/解码结构及全局-局部加权损失约束视觉质量和鲁棒性。实验表明该方法可在1024×1024图像上实现0.0313 bpp嵌入率,并在多种噪声攻击下保持较强提取稳定性。

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models Figure 1
2026-07-21cs.CV

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models

Tarun Tomar

2026-07-21视觉语言视觉感知

这篇论文关注VLM在不同视觉任务上都执行完整视觉编码器带来的冗余开销,提出在不微调下用源均衡进化搜索寻找固定数量可跳过的视觉块,并比较共享路径与按OCR、计数、空间等能力划分的路径。结果显示,组合搜索比独立块排序更可靠,SmolVLM2共享四块路径提升4.91点;但能力专属路径不稳定,Qwen六块策略仅高2.17点,Smol在IIIT5K上OCR专属路径反而低13.6点。

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding Figure 1
2026-07-21cs.CV

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

Department of Automation, Tsinghua University

2026-07-21数据集/基准

EvoGUI针对GUI代理端到端成功率混杂感知、规划和恢复能力的问题,把已有操作轨迹归一化为时序排序、反向动作/取值预测和一步后继辨别三类VQA诊断任务,无需额外任务标签即可扩展到新语料。在Mind2Web与WebLINX上构建3000题、120域基准,零样本评测28个VLM配置后,最佳仅达60.4 EvoGain,且模型规模和GUI专门化都不能稳定预测状态转移理解能力。

Articulated Humanoid Head for a Robot Receptionist Capable of Natural Human Interaction Figure 1
2026-07-21cs.RO

Articulated Humanoid Head for a Robot Receptionist Capable of Natural Human Interaction

Tharusha Fonseka, Charuka Bandara, Moshintha Hewavitharana, Melisa Arukgoda, Wageesha N. Manamperi, Udaya S. K. Perera Miriya Thanthrige, Peshala Jayasekara

2026-07-21机器人

面向接待等短时社交场景,论文针对现有人形机器人头部成本高、机构复杂或交互能力不足的问题,提出一套21自由度仿人头部:用嘴、眼、眉、颈机构和硅胶皮肤实现六类基础表情,并结合SCRFD、ArcFace、BYTETrack、Whisper与Llama支持边缘端识别、重识别和对话。实验量化了对话与重识别能力,用户研究给出4.13/5的人类相似度评分,但相对既有系统的成本和维护增益文中未充分说明。

Automated Cardiac Adipose Tissue Segmentation in Computed Tomography: A Literature Review Figure 1
2026-07-21cs.CV

Automated Cardiac Adipose Tissue Segmentation in Computed Tomography: A Literature Review

Andreas W. Aspe, Jonas Jalili Pedersen, Andreas Ohrt Johansen, Klaus Fuglsang Kofoed, Kristine Aavild Sørensen, Rasmus Reinhold Paulsen, Josefine Vilsbøll Sundgaard

2026-07-21视觉感知三维

这篇综述关注心脏周围脂肪在心血管疾病评估中的量化需求:EAT/PAT 在 CT 上人工分割耗时且一致性差。文中梳理近十年传统图像处理、图谱方法与深度学习路线,强调直接分割与“先定心包再阈值”的两类范式,并指出术语、公开标注数据和增强 CT 阈值仍不统一。主要结论是现有自动方法已可接近人工标注质量,具备支撑大规模生物标志物研究和临床分析的潜力。

When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation Figure 1
2026-07-21cs.CV

When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation

Siwei Meng, Yawei Luo, Shu Zhang, Ping Liu

School of Software Technology, Computer Science and Engineering University of Nevada, Reno Reno NV USA, School of Software Technology Zhejiang University Hangzhou Zhejiang China

2026-07-21视觉感知优化算法

论文针对文本到视频物理对齐中“物理更合理但偏离提示语义”的系统性冲突,指出相对物理偏好与逐样本语义约束存在监督不对称。作者提出 PSDPO,在标准 DPO 内按物理与语义信号一致性调制偏好对,并采用分阶段训练抑制语义漂移。实验显示其在 VideoPhy-2 上物理合理性最高约提升 2 倍,同时在 VBench 保持较强语义一致性。

Points as Tori: Fast Pointwise Signed Distance for Point Clouds Figure 1
2026-07-21cs.GR

Points as Tori: Fast Pointwise Signed Distance for Point Clouds

Nicole Feng, Ioannis Gkioulekas, Keenan Crane

Carnegie Mellon University, Carnegie Mellon University 5000 Forbes Ave Pittsburgh PA 15213 USA

2026-07-21三维

点云缺少封闭表面,直接定义有符号距离通常要先重建或做全局求解,难以用于高分辨率和交互查询。本文的关键洞察是把每个带法向点局部拟合为有闭式 SDF 的环面,并用指数加权的卷积距离公式融合,同时用小型预训练网络预测局部曲率和位移参数。结果是在无需空间离散和全局优化的情况下,对摄影测量、网格、3D Gaussian 等点云实现快速逐点 SDF 查询,并支持偏移、形态学、布尔和 sphere tracing 等操作。

Investigation of Polycystic Ovary Syndrome (PCOS) Diagnosis Using Machine Learning Approaches Figure 1
2026-07-21cs.LG

Investigation of Polycystic Ovary Syndrome (PCOS) Diagnosis Using Machine Learning Approaches

Al Zadid Sultan Bin Habib, Md Asif Bin Syed, Md. Ekramul Islam, Tanpia Tasnim

2026-07-21视觉感知

该文针对PCOS早筛依赖临床检查、成本和时间较高的问题,用印度Kerala 541例、43项临床/体征数据构建机器学习诊断流程。核心做法是结合缺失值填补、归一化、采样平衡与多种特征选择,比较CatBoost、XGBoost、LGBM、AdaBoost和随机森林等模型;主要结果称AdaBoost在随机森林特征重要性与最高相关性筛出的10个特征上测试准确率最高,但增益来源不清,可能主要来自数据划分、采样和特征筛选流程。

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning Figure 1
2026-07-21cs.CV

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

Department of Computer Science and Information Systems, Birla Institute of Technology and Science, Pilani, India, Machine Intelligence, Interaction, and Imagination (Mi 3 ) Lab, University of California, Merced, United States

2026-07-21视觉语言视觉感知安全鲁棒

论文针对自动驾驶 VLA/端到端轨迹模型“看见了什么、哪些物体真正影响决策”这一安全解释问题,提出 CVAA:用真实感补全逐个移除前视图物体,构建 Counter-nuScenes,并以轨迹分布偏移衡量因果影响。210 个 nuScenes 场景上的 Alpamayo 1 实验显示,路径内车辆、行人及小面积交通灯影响显著,但也会对人类认为无关的物体敏感;白盒分析进一步表明影响经多条内部路径传播,现有语言模型解释工具难以直接解释其场景表征。

Pediatric Bone Age Prediction Using Deep Learning Figure 1
2026-07-21cs.CV

Pediatric Bone Age Prediction Using Deep Learning

Al Zadid Sultan Bin Habib, Md. Ekramul Islam, Md Asif Bin Syed, Md Younus Ahamed, Tanpia Tasnim

2026-07-21视觉感知

本文面向儿科骨龄评估中人工阅片耗时、依赖放射科经验的问题,使用 RSNA 逾 1.2 万张手部 X 光训练 EfficientNetB0/B4,并将加性注意力接入 EfficientNetB4 做回归预测。结果显示 B4 与 EN-AA 通常比 B0 更接近真实骨龄,训练/验证曲线未见明显过拟合;但注意力带来的独立增益未充分说明,提升可能主要来自 scaling / data。

C3DIR: A Deep Learning 3-Dimensional Cloud Property Retrieval Scheme for Passive Satellite Imagers Figure 1
2026-07-21cs.CV

C3DIR: A Deep Learning 3-Dimensional Cloud Property Retrieval Scheme for Passive Satellite Imagers

Charles H. White, Yoo-Jeong Noh, John M. Haynes, Imme Ebert-Uphoff

CIRA: Cooperative Institute for Research in the Atmosphere, Colorado State University, Fort Collins, CO., ECE: Electrical and Computer Engineering, Colorado State University, Fort Collins, CO.

2026-07-21视觉感知三维

针对被动卫星成像仪难以仅凭可见光、近红外和红外信号恢复云垂直结构的问题,C3DIR用深度学习从多类成像仪估计冰、水云和雨的三维含水量,并通过体素级配准缓解被动成像与EarthCARE主动廓线几何不一致。实验显示其能识别重叠云层、云顶/云底和水凝物,冰云表现最好;液态云和雨水含量仍受传感器敏感性与标注约束限制。

Splat-based 3D Scene Reconstruction with Extreme Motion-blur Figure 1
2026-07-21cs.CV

Splat-based 3D Scene Reconstruction with Extreme Motion-blur

Hyeonjoong Jang, Dongyoung Choi, Donggun Kim, Woohyun Kang, Min H. Kim

2026-07-21三维

低光和快速运动下,RGB-D 重建会同时遇到严重运动模糊、位姿初始化失败和深度重叠不足,导致 COLMAP/ICP 及后续 3DGS 难以工作。本文把光流、ICP、深度约束与 Gaussian Splatting 联合起来,先粗对齐并用深度初始化高斯,再联合优化位姿、几何和曝光期间相机轨迹,用多视角锐化渲染解释模糊图像。新建极端模糊 RGB-D 数据集上的实验显示,其位姿、点云和去模糊重建质量优于现有方法。

Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing Figure 1
2026-07-21cs.CV

Pedestrian Archetypes Extension -- More Pedestrian Models for Autonomous Vehicle Safety Testing

Taorui Huang, Namita Gaidhani, Ritvik Bansal, S M Jubaer, Regina Lim, Rhett Zhao, Gavin Rafael Selin, Sunnie Deng Gao, Hasnain N Syed

2026-07-21安全鲁棒

这篇预印本针对自动驾驶安全测试中行人行为只按单一标签建模、难以覆盖真实危险模式的问题,延续 Pedestrian Archetypes 框架,从 YouTube 行车记录仪风险场景标注中提炼出 7 类新增行人原型,并为每类给出必要/可选行为、视频帧证据及与既有 12 类的差异。主要结果是扩展了危险行人行为测试空间,可用于后续标注、仿真与评估,但文中未充分说明其对模型性能或安全指标的量化增益。

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing Figure 1
2026-07-21cs.CV

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

2026-07-21视觉语言视觉感知安全鲁棒

这篇论文针对统一多模态图像编辑模型可轻易保留人脸身份并生成未授权改图的风险,指出只攻击 ViT 理解分支或 VAE 生成分支都会被另一条视觉路径补偿。作者提出 CCS,同时拉开两分支与干净特征的距离,并用 CKA 破坏跨分支一致性,使模型难以融合出稳定身份表征。实验显示 CCS 在多种编辑指令和基线下更能降低身份保持与编辑完成度,同时保持受保护输入的视觉质量。

Transferable Low-Rank Convolutional Bases for Onboarding Unseen Medical Imaging Modalities Figure 1
2026-07-21cs.CV

Transferable Low-Rank Convolutional Bases for Onboarding Unseen Medical Imaging Modalities

Ranat Das Prangon, Istiaque Ahmed, Shajid Hasan Naim, Waseem Mustak Zisan, Hossain Md Shakhawat

Dept. of Chemical Engineering, Bangladesh University of Engineering and Technology (BUET), Dhaka, Bangladesh., Graduate School of Informatics, Osaka Metropolitan University, Osaka, Japan., Dept. of Mechanical Engineering, Chittagong University of Engineering and Technology (CUET), Chattogram, Bangladesh., Dept. of Computer Science and Engineering, Bangladesh University of Engineering and Technology (BUET), Dhaka, Bangladesh., School of Informatics, Kochi University of Technology, Kami, Kochi 782-8502, Japan.

2026-07-21视觉感知

本文面向已部署医学影像模型接入未见模态时的遗忘与重训成本问题,采用严格留一模态协议,指出仅调分类层不足,适配必须进入卷积特征。核心洞察是源模态学到的低秩卷积基可迁移到新模态,只训练上投影即可接入胸片,用约0.78%全量微调参数,较同规模随机基高6.11个百分点,同时保持源模态精度不变;但数据规模与公开集患者级划分限制仍需注意。

InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection Figure 1
2026-07-21cs.CV

InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection

Jikang Cheng, Hao Shen, Xueyi Zhang, Guangcheng Wang, Zhongyuan Wang, Renye Yan, Baojin Huang

Huazhong Agricultural University, 2 Peking University, National University of Singapore, 4 Nantong University, Wuhan University

2026-07-21视觉感知

这篇论文针对增量人脸伪造检测中回放样本占内存、易遗忘且可能引入隐私风险的问题,提出只保存伪造线索密集的局部区域而非整张脸。核心洞察是人脸存在大量结构冗余,CLIP 辅助定位决定性 patch,再按代表性与信息密度筛选并融合到新任务样本中。实验称在多个增量 deepfake 基准上降低存储需求,同时缓解灾难性遗忘并提升跨域泛化。

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization Figure 1
2026-07-21cs.CV

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

Nikolaos Stathoulopoulos, George Nikolakopoulos

The authors are with the Robotics and AI Group, Department of Computer, Electrical and Space Engineering, Luleå University of Technology, 971 87, Additional material and the source code of this letter are available at our

2026-07-21视觉感知

异构 LiDAR 在视场、分辨率和扫描方式上差异很大,传统基于固定网格或点密度的地点识别容易把未观测区域误当成几何差异。InLiER 的核心是先把结构关键点离散成混合基数 token,再用同一表示完成候选检索、航向对齐和 6-DoF 几何验证。文中报告其在 HeLiPR 七组跨传感器配置和真实外场实验中优于多数手工方法,并在多数跨传感器场景超过学习式 HeLiOS,但对动态障碍仍较敏感。

Dataset Distillation by Influence Matching Figure 1
2026-07-21cs.CV

Dataset Distillation by Influence Matching

Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yangtian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi

2026-07-21数据集/基准

针对数据集蒸馏常用梯度或轨迹匹配只对齐训练过程、未必保证最终模型效果的问题,论文提出 Inf-Match:用可微的样本级影响估计器直接匹配真实集与合成集对收敛参数的影响,避免逆 Hessian 和凸性假设,并通过展开 SGD 与一阶近似实现线性时间估计。实验显示其在 CIFAR、Tiny-ImageNet 多个 IPC 设置领先,Tiny-ImageNet IPC=10 达 31.5%、较 NCFM 高 4.7%,并在 Flickr30K 图文检索蒸馏中取得约 2.5% 平均优势。

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment Figure 1
2026-07-21cs.CV

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

Xidian University, Tsinghua University, Shanghai Road Transport Development Center, Hunan Institute of, Xidian University Xi’an China, Tsinghua University Beijing China, Shanghai Road Transport Development Center Shanghai China

2026-07-21视觉语言强化学习

本文关注 LVLM 幻觉中被忽视的“视觉意识”退化:注意力被非语义 sink token 劫持,且 KV cache 中视觉表征因因果预填充产生空间/查询相关性失真。作者提出无需训练的 SDPR,在注意力重分配、cache 对齐和先验约束对比解码三处介入,强化显著视觉证据。实验称其在多种 LVLM 上优于现有方法,POPE 提升 6.93%,CHAIRs 降低 33.3%,且额外开销较小。

TopoGS: Planar Reconstruction via Topology-aware 3D Gaussian Splatting Figure 1
2026-07-21cs.CV

TopoGS: Planar Reconstruction via Topology-aware 3D Gaussian Splatting

Shanshan Pan, Jiale Chen, Yilin Liu, Hui Huang

2026-07-21三维

TopoGS针对现有3DGS平面重建把平面当作孤立元素、导致边界错位和模型碎片化的问题,将多视图图像分割得到的2D邻接关系锚定到高斯基元中,并在光度、几何与拓扑一致性下联合优化平面参数和连接关系,从而过滤伪邻接、恢复连通的结构化平面模型;在ScanNet++上报告达到高保真平面重建的SOTA,深度误差和边界精度优于对比方法。

Robust PnP on a Neuromorphic Processor for Object Pose Estimation Figure 1
2026-07-21cs.CV

Robust PnP on a Neuromorphic Processor for Object Pose Estimation

Tam Ngoc-Bang Nguyen, Mohsi Jawaid, Tat-Jun Chin

2026-07-21三维安全鲁棒

面向边缘机器人位姿估计中功耗受限、两阶段OPE仍依赖CPU求解PnP的问题,论文将抗外点PnP改写为可在Loihi 2上执行的分布式鲁棒最小二乘过程,并配套事件数据SNN关键点回归,使感知、特征预测到几何优化都可神经形态部署。实验显示能效高于传统实现且精度保持竞争性,但硬件定点和指令限制带来的误差仍存在。

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation Figure 1
2026-07-21cs.CV

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

Huanran Chen and Yinpeng Dong are with the College of Artificial Intelligence, Tsinghua University, Beijing 100083, China., Ranjie Duan and Hui Xue are with the Security Department, Alibaba Group, Hangzhou 310056, China., Xiaochun Cao is with the School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University, Shenzhen 518107, China.

2026-07-21视觉感知

这篇论文针对文生图扩散模型在隐式色情提示和对抗 token 下绕过安全机制的问题,提出从扩散早期预测噪声中做检测与干预。核心洞察是早期噪声已呈现正常/色情语义可分性,并结合轻量噪声分类器、LLM 生成自适应负向提示和初始噪声优化。实验覆盖 SDv1.4/1.5/2.1/XL 与 SDv3,在自然和对抗数据上相较 SLD、UCE、Safree 等方法取得更好的检测与缓解效果。

Spatially-Aware Class-Agnostic Object Counting Figure 1
2026-07-21cs.CV

Spatially-Aware Class-Agnostic Object Counting

Robert Wijaya, Md. Tanvir Hossain, Amanda Kau, Ngai-Man Cheung

2026-07-21视觉感知

这篇论文针对通用物体计数在结构复杂目标上容易把部件误当实例的问题,提出无需文本提示或示例框的 UpCount。其核心是用 MAE 预训练 ViT 抽取多层特征,经 DPT 金字塔与 FeatUp 强化空间细节,再用 proposal-verification 头生成密度图。在 FSC-147 测试集达到 12.39 MAE、100.89 RMSE,并在 CARPK 车辆计数上取得 6.27 MAE、8.79 RMSE。

Test-Time Registers as Global Priors for Tokenized Image Generation Figure 1
2026-07-21cs.CV

Test-Time Registers as Global Priors for Tokenized Image Generation

Cheng-Yao Hong, Yifan Wang, Yuewei Lin, Chenyu You

2026-07-21视觉感知

本文关注 ViT 中常被视为注意力 sink 的 register 是否能在不重训的情况下用于生成。核心洞察是这类特征更集中于低频、全局场景信息,并提出 RegToken:用 NFN 定位层、TokenRank 提取子空间,再构造全局先验 token 注入冻结的 1D token 图像生成管线。ImageNet 上 FID-5k 从 20.5 降至 20.1,SigLIP 从 3.6 升至 3.9,优化步数 74 降至 52,但增益幅度较小。

Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning Figure 1
2026-07-21cs.CV

Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning

Yuqi Zhang, Yadan Luo, Xiangyu Sun, Fengyi Zhang, Zi Huang, Xin Tan

The University of Queensland, East China Normal University, Shanghai AI Laboratory

2026-07-21三维

针对单视图 SAM3D 难以处理真实场景中的遮挡、冗余视角和跨视角冲突,Scene-SAM3D 将问题拆成视角选择、潜变量融合与布局对齐:用世界空间占据覆盖选取互补视角,以锚视角一致性过滤冲突速度更新,并在不改动物体几何的情况下优化刚体高斯布局。在 Replica 和 ScanNet++ 上,场景级 CD 分别降低 43.8% 和 30.9%,同时多视角推理 FLOPs 与延迟约降 20%。

Value-Monotonicity Matters: A Concordance Loss for Deep Survival Prediction Figure 1
2026-07-21cs.LG

Value-Monotonicity Matters: A Concordance Loss for Deep Survival Prediction

Meixu Chen, Kai Wang, Jing Wang

2026-07-21视觉感知

本文关注深度生存预测中“训练看似变好但C-index不变”的模型选择风险:似然损失可在不改变风险排序时继续下降,因而不适合作为昂贵端到端训练的代理信号。作者提出与C-index近似单调对应的Sigmoid Concordance Loss,在18个多模态数据集上C-index与常用似然法相当,校准也接近,但损失值与C-index的秩相关显著更高。

HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition Figure 1
2026-07-21cs.CV

HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition

Kunjie Deng, Jinghui Zhang, Weidong Chen, Ganbin Li, Xiangjun Lyu, Zhendong Mao, Yingchi Yang

State Key Lab of Digestive Health, Beijing 100050, China

2026-07-21视觉感知

手术阶段识别常受边界处视觉歧义、短时噪声和流程语义利用不足影响,HTT-Net的核心思路是把术中阶段描述、相邻阶段转移描述和细粒度语义单元组织成层次语义记忆,用TAS-Con构造更连贯的阶段片段,再用TAS-Calib进行语义校准。文中在Cholec80和LCRS-100上报告了更稳健的阶段识别效果,并通过消融支持语义记忆、片段构造与校准模块的贡献。

Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring Figure 1
2026-07-21cs.CV

Spatiotemporal Facial Action Unit Detection using Twin Cycle Autoencoders for Driver Monitoring

Sai Sidharth D

and temporal dynamics separately, limiting their ability to exploit self-supervisory signal from abundant unlabeled driving video. We, label AU classification. We evaluate TCA on the DISFA and BP4D benchmarks and on an in-cabin naturalistic driving dataset, and observe, high-level affect or fatigue labels., harder than in controlled laboratory settings. In-cabin cameras, fatigue. Moreover, most publicly available AU-annotated corpora, poorly to naturalistic driving footage, while densely AU-labeled, using unlabeled video. Cycle-consistency, popularized in unpaired, unlabeled video, provides such a mechanism: it allows a network, to be trained, in part, without AU labels by requiring that, the label-scarce, high-variability driving setting., based fusion module for multi-label AU classification., large volumes of unlabeled in-cabin driving video via the cycle-

2026-07-21视觉感知

面向车内驾驶员监测中光照变化、遮挡、头姿和短暂低强度表情导致的 AU 检测困难,论文提出双循环自编码器 TCA:分别用空间循环分离身份与 AU 外观,用时间循环约束 AU 轨迹,并通过跨分支对齐和注意力融合利用未标注驾驶视频。实验称在 DISFA、BP4D 和自然驾驶集上优于 CNN-RNN、3D-CNN 与图模型,驾驶集总体 F1 达 63.1%,Jetson Xavier NX 上可实时运行;但太阳镜遮挡仍是主要失效场景。

Hybrid Machine Learning for Articulation Angle Estimation of Truck-Semitrailer Combinations Figure 1
2026-07-21cs.CV

Hybrid Machine Learning for Articulation Angle Estimation of Truck-Semitrailer Combinations

Qixuan Zhang, Jonas Boettcher, Simon F. G. Ehlers, Marvin Stuede

2026-07-21视觉感知

面向商用牵引车缺少铰接角传感器、现有方法依赖初始化或挂车先验的问题,论文将CMS后视相机与车载运动学信号结合,比较CNN/Transformer估计器,并把视觉学习测量通过带不确定性自适应权重的EKF与运动学模型融合。四种真实挂车实验显示,混合方案在新挂车、颜色和光照变化下比纯学习或参数失配的运动学模型更稳健、误差更低。

VisionAssist: An Open-Source Smartphone Assistant for AI-Based Visual Accessibility Figure 1
2026-07-21cs.CV

VisionAssist: An Open-Source Smartphone Assistant for AI-Based Visual Accessibility

Ayşe Özlem Çalışkan, Jordi Sanchez-Riera

2026-07-21视觉感知

针对低视力用户在找物、读文字、理解场景和处理日程时需要频繁切换工具的问题,VisionAssist 将目标定位、图像描述/OCR、联系人与日历语音助手整合到开源跨平台手机应用中,并以语音交互和 TTS 作为主界面。论文称比较了多种 VLM 并评估三类视觉功能与个人助理响应,但片段未给出关键量化结果,实际增益和模型选择依据文中未充分说明。

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model Figure 1
2026-07-21cs.CV

Multi-Dimensional Quality Assessment for AI-Generated Human-Centric Videos: Dataset and Model

Sijing Wu, Yunhao Li, Huiyu Duan, Yucheng Zhu, Xiongkuo Min, Patrick Le Callet, Guangtao Zhai

2026-07-21视觉感知数据集/基准

针对人像类文生视频常见的肢体结构异常、运动不自然和文本不匹配问题,论文构建了 HVEval+:覆盖 1000 个提示、24 个 T2V 模型生成的 2 万视频,并加入 MOS、偏好对和问答标注;同时提出 MoE-Rater,用 MoPE/MoLE 统一评分、成对比较与类别问答。实验显示其在 HVEval+ 和 Human-AGVQA 上优于对比方法,但增益可能部分来自更大规模数据与多任务训练。

Constraint-Anchored Reasoning Traces Figure 1
2026-07-21cs.AI

Constraint-Anchored Reasoning Traces

Zehua Cheng, Wei Dai, Jiahao Sun

Department of Computer Science, University of Oxford, University of Oxford United Kingdom

2026-07-21优化算法

本文针对多模态链式推理中早期错误会持续放大的问题,提出 CART:在自然语言推理轨迹中插入可机器检查的视觉约束锚点,并用神经 grounding 与布尔约束传播进行运行时校验,发现矛盾后回退到一致检查点。实验称其在五个基准上将 snowball rate 从 0.65 降至 0.14,GQA 提升 4.6 个百分点,POPE 达 89.1 F1,代价为最高 18% 推理开销;但增益可能部分来自额外标注数据与 LoRA 训练设置。

Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs Figure 1
2026-07-21cs.CV

Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs

Raza Imam, Darakshan Rashid, Yutong Xie, Dwarikanath Mahapatra, Brejesh Lall, Mohammad Yaqub

2026-07-21视觉语言学习理论

针对医学视觉语言模型在未见成像模态和域偏移下零样本可靠性下降的问题,论文指出测试时专家模型存在“全融合稀释专长、单专家易错配”的两难,并提出无需梯度更新的 MoBE:用熵动态选择专家,再以专家级贝叶斯在线统计校准预测。在多组医学基准上,相比现有 TTA 方法平均提升约 4.72、7.17 和 4.3 个百分点,但个别数据集仍有退化。

OFD-Net: Teacher-Free Reliable Semi-supervised Medical Image Segmentation with Orthogonal Feature Disentanglement Net of Foreground-Background Figure 1
2026-07-21cs.CV

OFD-Net: Teacher-Free Reliable Semi-supervised Medical Image Segmentation with Orthogonal Feature Disentanglement Net of Foreground-Background

Shao-feng Jiang, Zhe-yang Jing, Qin Lu, Huan-huan Shi, Zhen Chen, Cong-xuan zhang, Chen Yi

2026-07-21视觉感知

针对半监督医学分割中伪标签缺乏结构可靠性、易累积错误的问题,OFD-Net用单网络的前景-背景正交特征解耦建立内部结构参照,并通过解耦引导解码和结构一致性重加权伪标签,替代教师网络一致性监督。在ISIC-2016、Kvasir-SEG、Synapse和ACDC上验证有效,ACDC仅10%标注时Dice达90.42%、Jaccard达86.25%,优于KnowSAM。

Foundation-Assisted Active Learning for Object Detection Annotation Figure 1
2026-07-21cs.CV

Foundation-Assisted Active Learning for Object Detection Annotation

Jinchang Zhang, Arnold Zumbrun, Jing Lin, Guoyu Lu

Jinchang Zhang and Guoyu Lu are with the Intelligent Vision and Sensing (IVS) Lab at Indiana University Bloomington.

2026-07-21视觉感知

针对遥感目标检测标注成本高、冷启动阶段框定位噪声大且主动学习易被冗余候选制造的“伪多样性”误导,论文引入 UPN+SAM2 作为稳定定位源,与检测器预测源联合估计不确定性,并用 DINOv2/SAM2 做对象级多样性采样和框替换。DIOR、HRSC2016、DOTAv2、FAIR1M 实验显示其在多数标注预算下达到相当或更优性能,低预算冷启动收益更明显。

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes Figure 1
2026-07-21cs.CV

DORS: Dynamic Attention Routing for Diffusion-based Object Removal in Dense Scenes

Haitong Tang, Haipeng Liu, Yang Wang

School of Computer Science and Information Engineering, Hefei University of Technology, School of Computer Science and Information Engineering, Hefei University of Technology, School of Computer Science and Information Engineering, Hefei University of Technology Hefei China, Hefei University of Technology Hefei China

2026-07-21生成模型

这篇论文针对密集场景中目标移除容易受相似实例干扰、导致残留或复制伪影的问题,将扩散修复中的失败归因于自注意力的错误信息传播。DORS 的核心是训练无关的动态注意力路由:用 IFA 屏蔽相似实例的误导连接,再用 CGR 引入有效上下文以维持结构一致性,并按去噪阶段调节控制强度。实验在新建 DOR-Bench 和公开基准上显示其优于现有方法,尤其改善不完全移除和重复伪影。

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model Figure 1
2026-07-21cs.CV

Position: Explanation Stability Is a Property of the Model Method Pair, Not the Model

Kabilan Elangovan, Daniel Ting

2026-07-21视觉感知

本文针对医学影像 XAI 中常把单一归因方法的稳定性泛化为模型稳定性的做法,提出稳定性应归属于“模型-解释方法”组合。作者用胸片分类中 DenseNet201、ResNet50V2、InceptionV3 的受控实验说明,即使 AUC 均超过 99%,LayerCAM 与 Grad-CAM++ 会给出相反稳定性排序,InceptionV3 在 LayerCAM 下最高但在 Grad-CAM++ 下下降 17.3%,提示监管和评测需明确归因算子并做跨方法验证。

DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution Figure 1
2026-07-21cs.CV

DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution

Yoonseok Choi, Eun-Gyu Ha, Daniel Kim, Mohammed A. Al-masni, Ming-Hsuan Yang, Dong-Hyun Kim

2026-07-21生成模型

针对厚层 MRI 为缩短扫描时间而带来的层间阶梯伪影,DRIFT 将穿层超分建模为连续厚度条件下的两阶段生成过程:先用 APN 给出粗高分辨率解,再用 rectified flow 细化,并以基于层厚带宽缺失的 PAD/AIS 自适应分配 ODE 步数、用 CETA 约束相邻厚度一致性。实验显示其在公开和真实厚层 MRI 上优于回归、INR 与扩散基线,同时降低推理成本。

DARA: Degradation-Aware Low-Rank Residual Adaptation with Original-to-Corrupted Distillation for Corruption-Robust Animal Re-Identification Figure 1
2026-07-21cs.CV

DARA: Degradation-Aware Low-Rank Residual Adaptation with Original-to-Corrupted Distillation for Corruption-Robust Animal Re-Identification

Cynthia Xie, Talia Xu

The University of Auckland

2026-07-21安全鲁棒

针对动物重识别在模糊、噪声、压缩等退化下细粒度身份线索被破坏的问题,DARA将鲁棒性建模为特征空间修复:冻结原骨干,用路由低秩残差专家按输入自适应校正,并以原图教师蒸馏约束个体嵌入和检索关系。四个数据集上,其优于常规和增强训练,可泛化到未见退化与跨域场景,并以0.49%参数、0.05% FLOPs恢复77.0%的腐蚀查询mAP缺口。

Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection Figure 1
2026-07-21cs.AI

Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection

Qiuyuan Li, Hongliang Dai, Piji Li

College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, Nanjing, China, The Key Laboratory of Brain-Machine Intelligence Technology

2026-07-21视觉感知安全鲁棒

本文针对语义熵幻觉检测的一个盲点:模型可能多次稳定生成同一错误答案,导致低不确定性而漏检。作者把检测能力前移到微调阶段,提出基于一对多 SFT 和 DPO 的多样性导向训练,使错误样本更容易暴露语义不一致。实验显示该方法在三个事实问答数据集上优于或接近现有方法,增益主要来自提升幻觉样本可区分性,而非简单增加随机性。

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos Figure 1
2026-07-21cs.CV

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

Abdel-Karim Al-Tamimi, Ali Rodan

Sheffield Hallam University, Sheffield, UK, Yarmouk University, Irbid, Jordan, The University of Jordan, Amman, Jordan

2026-07-21视觉感知

这篇论文针对访谈视频中的矛盾/犹豫识别,动机是数字健康等行为改变场景需要捕捉说话者的迟疑信号。核心洞察是该任务的有效线索主要在转写文本而非视觉/音频中,方法将两个 LoRA 微调文本编码器的多实例学习分数与零样本 14B LLM 判断器加权融合。在 BAH 私有测试集上仅用文本达到 Macro-F1 0.7364、AP 0.7940,显著高于官方视觉基线 0.2827。

SPARE-GS: Structural Parsimony and Resource Efficiency for 3D Gaussian Splatting Figure 1
2026-07-21cs.CV

SPARE-GS: Structural Parsimony and Resource Efficiency for 3D Gaussian Splatting

Zhang Chen, Shuai Wan, Fuzheng Yang, Jiazhi Xia, Weiyao Lin, Junhui Hou

2026-07-21三维

这篇论文针对 3D Gaussian Splatting 训练中高斯元过度增殖导致训练慢、模型冗余和后续压缩困难的问题,将结构演化视为全局预算约束优化,并用区域表征需求分配配额,联合调控增密、剪枝与提前终止。实验显示该插件式方法平均减少 30.38% 高斯数量和 23.81% 训练时间,同时 PSNR 略有提升,并改善压缩、剪枝的率失真表现。

Can Multimodal Large Language Models Understand OCT? Figure 1
2026-07-21cs.CV

Can Multimodal Large Language Models Understand OCT?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

2026-07-21视觉语言

本文关注现有多模态大模型在OCT图像上是否真正具备从视觉感知到临床推理的完整理解能力。作者提出OCT-Bench,用4,137张OCT图像构建10,076道选择题,并按感知、认知、推理三层20项任务细分评测。20个模型结果显示最佳总体准确率仅62.0%,推理最高42.9%,医学适配和模型规模增大都未带来稳定提升。

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration Figure 1
2026-07-21cs.CV

PAVXploreRL: Physical-Action-Visual World Model Reinforcement Learning with Action Exploration

Han Wang, Zijun Wang, Shuoshuo Xue, Rui Cao, Fenjiao Cheng, Xiaodang Liang, Roy Ka-Wei Lee

Singapore University of Technology and Design, Sun Yat-sen University

2026-07-21强化学习

本文针对动作条件机器人世界模型过度依赖专家轨迹和像素重建、难以评估非专家动作的问题,提出 PAVXploreRL:用适配机器人数据的 VJEPA-2 构造物理合理性、动作遵循和视觉保真奖励,并引入噪声扰动的 OOD 动作进行无配对视频的 RL 后训练。实验显示其较预训练基线平均提升 5.6%,并在策略评估中降低 Ctrl-World 式成功率高估。

Digital measurement of droplet flame diameter in microgravity combustion images using Segment Anything Model 2 with automatic prompt selection Figure 1
2026-07-21cs.CV

Digital measurement of droplet flame diameter in microgravity combustion images using Segment Anything Model 2 with automatic prompt selection

Minghui Xu, Chaoyi Zhou, Aaron P. Cecil, Xi Liu, Siyu Huang, Yuhao Xu

aDepartment of Mechanical Engineering, Clemson University, Clemson, SC 29634, USA, bVisual Computing Division, School of Computing, Clemson University, Clemson, SC 29634, USA

2026-07-21视觉感知

这篇论文针对微重力液滴燃烧图像中火焰边界模糊、烟炱尾迹和液滴漂移导致的直径测量偏差,提出将自动对称提示点生成接入 SAM2,并用其视频记忆保持时序一致、用 RANSAC 圆拟合剔除尾迹离群点的全自动流程。在 19537 张三类燃料图像上,相对人工参考平均一致性达 96.9%、MAPE 为 3.1%,标准不确定度 8.54%,效率约提升 229 倍,且明显优于霍夫圆检测。

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings Figure 1
2026-07-21cs.RO

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek

2026-07-21视觉感知安全鲁棒

面向灾害响应、工业现场等高危环境中人类难以及时发现和理解风险的问题,本文构建了一个基于 RIVR/ROS 的 VR-HRI 框架:机器人在虚拟场景中采集视角并调用 VLM 识别隐患,再以 POI 弹窗和语音提示呈现给操作者。用户研究显示,带标注界面较无标注基线更受偏好,参与者报告清晰度、实用性和舒适度较高;但样本仅 27 人,且主要依赖单一 VLM,真实场景泛化仍文中未充分说明。

CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation Figure 1
2026-07-21cs.CV

CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation

Jingyu Hu, Weilong Yan, Zhengzhe Liu, Haipeng Li, Ka-Hei Hui, Hao (Richard) Zhang, Chi-Wing Fu

Jingyu Hu and Chi-Wing Fu are with the Department of Computer Science and Engineering, The Chinese University of Hong Kong., Zhengzhe Liu is with Lingnan University, Hong Kong, China., Weilong Yan is with National University of Singapore., Haipeng Li is with The Hong Kong University of Science and Technology, Hong Kong, China, Ka-Hei Hui is with Autodesk AI Lab., Hao (Richard) Zhang is with Simon Fraser University.

2026-07-21三维

针对三维形状编辑中跨类别泛化、细粒度控制与未编辑区域保持难以兼顾的问题,论文提出 CNS-Edit++:用全局潜变量表达形状语义、用 3D 神经特征体提供局部空间上下文,并在编辑目标下联合优化二者。该框架可接入类别特定反演模型和文本/图像条件的 3D 基础模型,支持复制、缩放、删除、混合与拖拽等操作;实验显示其在多种生成骨干上优于现有方法,但具体收益在不同骨干间的来源仍需结合更多消融判断。

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence Figure 1
2026-07-21cs.AI

From Modalities to Propositions: A Language-Centric Framework for Multimodal Intelligence

Nadine Chang, Maying Shen, Shizhe Diao, Jialiang Wang, Jingde Chen, Thomas Breuel, Pavlo Molchanov, Rafid Mahmood, Jose M. Alvarez

University of Ottawa

2026-07-21视觉语言

论文针对多模态表征依赖高维嵌入、难解释且不利于组合推理的问题,提出用原子命题袋表示图像、视频、文本等观测,并通过全局语义码本归一化等价命题。实验展示其在自动驾驶和开放世界视频中可支持跨模态检索、复杂场景组合查询与训练/评测集知识覆盖差距分析,但具体性能增益幅度与来源文中未充分说明。

AffectFuse: Cross-Task Feature Fusion with Temporal Modeling for Multi-Task Affective Behavior Analysis Figure 1
2026-07-21cs.CV

AffectFuse: Cross-Task Feature Fusion with Temporal Modeling for Multi-Task Affective Behavior Analysis

Dipit Saha, Mohammad Raihan Rashid, Shah Mohammad Abdul Mannan, Ahnaf Tahmid, Md. Mehedi Hasan

Bangladesh University of Engineering and Technology

2026-07-21视觉感知

面向野外人脸情感分析中效价-唤醒、表情分类和动作单元检测三任务结构差异明显的问题,AffectFuse强调编码器之后的轻量适配:冻结AffectNet监督骨干,用时序头和跨任务特征融合提升VA/表情,并对AU用LoRA适配MAE-Face及DISFA逐单元路由。官方验证集得分P=1.7302,说明主要收益来自后编码器建模和任务选择,而非重新训练大型人脸基础模型。

Do Vision Encoders Exhibit Human-like Color Thresholds? Figure 1
2026-07-21cs.CV

Do Vision Encoders Exhibit Human-like Color Thresholds?

Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa

Computer Vision Center, Spain, Image Processing Lab, Universitat de València, Spain, Arab Academy for Science, Technology, and Maritime Transport, Egypt

2026-07-21视觉感知

论文关注当前视觉编码器是否自然学到类似人类的颜色辨别阈值,这是颜色敏感应用中常被默认但缺少验证的前提。作者用受控色彩刺激和 CIEDE2000 人类辨别椭圆,对 50 多个预训练 CNN、ViT 与多模态模型的潜空间相似区域做 mIoU 对齐评估。结果显示整体吻合很弱,最佳 mIoU 仍低于 0.25;自监督模型相对更好,语言监督模型分化明显,说明人类式色彩阈值并不会仅靠大规模视觉训练自然涌现。

Geometry-Enhanced Portion Estimation for Multimodal LLMs Figure 1
2026-07-21cs.CV

Geometry-Enhanced Portion Estimation for Multimodal LLMs

Lin Liao, Peng Li

2026-07-21视觉语言

这篇论文针对图像饮食评估中“识别容易、份量难估”的瓶颈:MLLM能开放词表识别食物,却不擅长克重估计。作者冻结商业MLLM和DINOv2,用食物名称、框和密度范围驱动几何增强份量头,通过跨食物注意力和softmax归属体积避免区域重复计量。在三个真实数据集上,相比MLLM直接估计将逐食物误差降低33–41%,且优于各基准原有图像模型。

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding Figure 1
2026-07-21cs.CV

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence, Xin Qiao, Benjamin Riggan, Chi-En Chiang, Fuchen Li

2026-07-21视觉语言强化学习

针对精细除草中既要识别物种又要定位单株、而传统检测器受闭集类别和跨区域泛化限制的问题,本文将杂草 grounding 转为可提示的多模态推理任务;核心做法是用人工植物性状词典和 Auditor-Synthesizer 生成领域 CoT 冷启动数据,再以 GRPO 和格式、准确率、数量、长度等奖励强化可验证定位。4B 模型在六个数据集、37 类杂草上取得 Precision@0.5 89.30%、Recall@0.5 87.81%,并优于更大的开源模型和若干闭源模型。

Spectral-Morphological Attention U-Net: An Efficient Network for Active Wildfire Detection Figure 1
2026-07-21cs.CV

Spectral-Morphological Attention U-Net: An Efficient Network for Active Wildfire Detection

Yugong Zeng, Jonathan Wu

Department of Electrical and Computer Engineering, University of Windsor

2026-07-21视觉感知

面向卫星主动火点检测中火像素稀疏、类别不均衡以及云烟干扰导致的漏检和误报,论文提出 SMA-UNet,在残差注意力 U-Net 上加入光谱注意力、通道-空间调制和可微形态学门控,以同时强化波段选择与边界约束。模型在 TS-SatFire 和 Sen2Fire 上取得最高 IoU,分别为 75.16% 和 22.50%,且参数量约 8.32M;但跨区域、跨传感器泛化仍需进一步验证。

DS@GT ARC at AnimalCLEF 2026: Species-Aware Graph Construction for Multi-Species Animal Re-Identification Figure 1
2026-07-21cs.CV

DS@GT ARC at AnimalCLEF 2026: Species-Aware Graph Construction for Multi-Species Animal Re-Identification

Evan Sinclair Smith, Anthony Miyaguchi, Snigdha Palamari, Danté Evangelista

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332

2026-07-21视觉感知

面向野外多物种动物重识别中姿态、光照、背景与物种形态差异导致的误匹配问题,论文将聚类重识别建模为物种感知的候选图构建,而非单纯最近邻检索。方法结合物种化预处理、全局描述子、LightGlue局部验证、LightGBM成对打分、保守加边与Leiden社区发现,重点抑制错误桥边造成的身份合并。在AnimalCLEF 2026中取得public ARI 0.733、private ARI 0.674,230队中排名第5。

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models Figure 1
2026-07-21cs.CV

One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models

Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

University of South Florida, University of Massachusetts Lowell, University of South Florida USA, University of Massachusetts Lowell USA

2026-07-21视觉语言视觉感知

本文针对视觉语言模型安全干预多停留在单模态、可能被跨模态输入绕过的问题,系统比较文本与视觉遗忘的双向迁移,指出迁移既不对称也不彻底,且受融合架构影响。作者提出按跨模态影响力选择 Transformer block 的 CrossInf,使遗忘更集中于关键部件;实验显示其可将 LLaVA 的跨模态 ASR 从 13.9% 降至 1.4%,并显著缓解排版攻击下的浅层遗忘。

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models Figure 1
2026-07-21cs.CV

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

School of Computer Science, Peking University

2026-07-21视觉感知规划控制

本文针对统一多模态模型在可控图像生成中难以满足复杂空间关系和逻辑约束的问题,提出 ATLAS,将布局从辅助控制信号提升为贯穿 Think、Plan、Paint 的共享空间表示,并用共享位置 token 与强化学习布局对齐提升计划到图像的一致性。7B/80B 实验显示其在布局型统一 MLLM 上平均提升 65.31%,空间相关任务较基座提升 23.06%,但部分增益可能受模型规模与数据影响。

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence Figure 1
2026-07-21cs.CV

Apple-$π$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence

Runmao Yao, Kairui Hu, Yukang Cao, Ruisi Wang, Shulin Tian, Ziang Cao, Weichen Fan, Ziqi Huang, Yuhao Dong, Hao Li, Zhaoxi Chen, Zhongang Cai, Lei Yang, Ziwei Liu

S-Lab, Nanyang Technological University, The Chinese University of Hong Kong

2026-07-21视觉感知数据集/基准

这篇论文针对视频生成模型是否真正内化物理定律而非只生成“看起来合理”的运动这一问题,提出 Apple-π 基准:用 Orchard 的 400 个经典力学视频、感知-建模-推演三阶段协议和物理约束指标诊断推理链。对 11 个模型的评测显示,最佳视频模型仅得 0.473,主要瓶颈在从物理量感知到定律表述再到时序推演的传递,多定律迁移和 Sim-to-Real 仍明显不足。

Disentangling Model and Human Data Uncertainty in Apparent Facial Age Estimation Figure 1
2026-07-21cs.CV

Disentangling Model and Human Data Uncertainty in Apparent Facial Age Estimation

Andrei Foitos, Ivo Pascal de Jong, Matias Valdenegro-Toro

2026-07-21安全鲁棒

面部表观年龄估计常用于访问控制等敏感场景,但人类标注本身存在主观分歧,单点回归难以表达可靠性。本文用 APPA-REAL 的多标注方差显式监督偶然不确定性,并用 MC-DropConnect、Flipout 与深度集成估计模型不确定性。实验显示,数据规模变化下人类偶然不确定性基本稳定,而训练数据减少会抬高认知不确定性,说明两类不确定性在该回归任务中可被一定程度区分。

OmniStyle-INR: Universal and Multimodal Style Transfer for INRs Figure 1
2026-07-21cs.CV

OmniStyle-INR: Universal and Multimodal Style Transfer for INRs

Rafał Kajca, Michał Miziołek, Kornel Howil, Rafał Tobiasz, Przemysław Spurek

Jagiellonian University, Faculty of Mathematics and Computer Science, Jagiellonian University, Doctoral School of Exact and Natural Sciences, IDEAS Research Institute

2026-07-21视觉语言

这篇论文针对 Gaussian Splatting 在图像和视频等稠密连续信号上参数量接近像素数、压缩与插值优势不足的问题,提出以隐式神经表示作为统一画布的 OmniStyle-INR,将文本或参考图像通过 VGG/CLIP 等特征约束到 2D、视频、3D 和 4D 场景的风格化优化中,并用光流损失维持时序一致性。文中展示其在图像条件和文本条件下能生成细节更充分、整体风格一致的跨模态结果,但具体定量增益来源不清。

Spatial Transport of Integration Error in Generative ODEs Figure 1
2026-07-21cs.CV

Spatial Transport of Integration Error in Generative ODEs

Songheng Yin

Columbia University

2026-07-21生成模型

这篇论文关注生成式 ODE 少步采样中粗积分误差为何在图像空间内不均匀,并追问误差从哪里注入、如何被模型动力学搬运到终点。核心洞察是用带符号的局部截断残差加线性化传播来做空间误差账本,并提出 Flow Complexity 作为可从轨迹读出的局部诊断。实验显示该指标能预测区域误差,端点误差更多来自外部传播而非本地注入,且正则化该变化量可降低少步误差。

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation Figure 1
2026-07-21cs.CV

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

Shanghai Jiao Tong University, Cardiff University

2026-07-21视觉感知规划控制

这篇论文针对物理约束视频生成中一次性由 VLM 预测仿真配置容易失效的问题,提出 PhysAgent 将物理规格视为可执行程序,通过生成、仿真、分阶段验证和定向修复闭环迭代,并用语义化物理控制 API 表达力、扭矩、位姿等事件。实验显示其在物理合理性、提示对齐和复杂场景泛化上优于通用 TI2V 与物理基线。

Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration Figure 1
2026-07-21cs.CV

Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration

Xiaoye Zhu, Weixin Li, Junan Huo, Bozhong Wang, Jia Zeng, Yi Yang, Cen Chen, Qi Liu

South China University of Technology, Code is available at https://github.com/xyzhu1225/CLARE., D workflows through structured collaboration. Clare decouples, collaboration, Clare employs a self-evolution mechanism: it learns

2026-07-21三维

这篇论文针对3D工具编排中用户意图含糊、缺参数或约束冲突导致代理盲目执行的问题,提出CLARE:先澄清再执行的多角色3D代理,并用模拟多轮交互与Multi-turn Reward自演化学习何时提问、何时调用工具。在620任务3D-Clarify基准上,单步和多步成功率达60.40%与43.34%,显著超过基线,但真实用户分布下泛化仍文中未充分说明。

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection Figure 1
2026-07-21cs.CV

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection

Anshu Singh, Alejandro Seif

2026-07-21视觉感知数据集/基准

针对真实工地视频难公开、悬吊载荷下方工人事件稀缺且具有时空关系性的难题,论文提出含55段合成视频的 SynthSite 基准,并设计敏感环境内提取文本、中性环境生成视频的隐私感知流程。实验显示,工人全身混淆的主要损失来自检测保留率下降而非定位漂移,保结构的卡通化比模糊等平滑方法更能保留人-载荷几何线索,并在人工标签上取得最高 F2=0.767。

DMFNet: Dual-Backbone Multiscale Fusion Network for Urban Scene Classification Figure 1
2026-07-21cs.CV

DMFNet: Dual-Backbone Multiscale Fusion Network for Urban Scene Classification

Anamitra Ghosh, Abhiroop Chatterjee, Susmita Ghosh

2026-07-21视觉感知

本文针对遥感城市/航拍场景中尺度变化大、类内差异和类间相似导致的分类困难,提出DMFNet:并行使用ConvNeXt-Tiny与EfficientNet-B1提取互补语义和细节特征,再通过多尺度残差传播、通道融合与空间注意力强化关键区域。其在AID数据集50:50划分上报告97.46%±0.14%平均准确率;但评估主要限于单一数据集,跨域泛化和相对增益来源仍需更多验证。

Local Brushstroke Quality Assessment via Vision-Language Feedback Figure 1
2026-07-21cs.CV

Local Brushstroke Quality Assessment via Vision-Language Feedback

Mio Mitamura, Hirokatsu Kataoka

Tokyo Institute of Science High School, National Institute of Advanced Industrial Science and Technology (AIST), Visual Geometry Group, University of Oxford

2026-07-21视觉语言视觉感知

针对书法教学中局部笔画质量依赖专家、难以自动给出可操作反馈的问题,论文构建了让多模态LLM比较修改前后笔画并输出五档评分和文字理由的评估框架,还初步测试RAG注入规则。结果显示GPT-4o的绝对误差最低(MAE 0.885),但各模型与专家排序相关性均不显著;RAG提升排序相关却降低绝对准确率,说明文本规则注入的收益并不稳定。

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation Figure 1
2026-07-21cs.CV

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

2026-07-21视觉语言视觉感知

针对医学图像分割中仅靠图像易漏检、文本引导方法又常把报告编码成粗粒度语义而难以利用病灶位置的问题,论文提出 LoG,将图文配对输入显式转化为多尺度定位任务,并在特征、注意力和损失三层注入定位约束。实验覆盖三类医学影像数据集,Dice 分别达 91.59%、80.71% 和 94.59%,优于文中比较的现有方法。

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference Figure 1
2026-07-21cs.CV

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

College of Computer Science and Artificial Intelligence, Fudan University, School of Computer Science and Informatics, Cardiff University, School of Artificial Intelligence, Sun Yat-sen University, College of Intelligent Robotics and Advanced Manufacturing, Fudan University

2026-07-21视觉语言

针对LVLM需将大量视觉token送入LLM导致推理开销高的问题,CRISP提出在进入LLM前进行但仍受文本驱动的训练-free剪枝:先用查询关键语义筛出相关视觉token,再用语义多样性补足场景上下文,避免纯视觉预剪枝不看问题和LLM内剪枝效率差的矛盾。在LLaVA-1.5/NeXT上,少量保留token仍维持约99.5%/96.9%性能,并将成本和延迟降低超过2倍。

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings Figure 1
2026-07-21cs.CV

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings

Wei Zhang

2026-07-21视觉感知

这篇论文针对脑 MRI 基础模型分类难以对应临床解剖推理的问题,提出 RegionFM:先用 FastSurfer 将 MRI 划分为解剖区域,再分别提取冻结基础模型嵌入,并用区域可加的逻辑模型把预测分解为各脑区贡献。认知障碍分类实验显示,其性能接近较难解释的微调方案,同时能给出个体和群体层面的区域解释;随机嵌入消融接近随机水平,说明结果主要依赖嵌入中的结构信息。

SGMCE: Segment-Grounded Morphological Concept Explanation for Malaria Parasite Species Identification in Thick Blood Smears Figure 1
2026-07-21cs.CV

SGMCE: Segment-Grounded Morphological Concept Explanation for Malaria Parasite Species Identification in Thick Blood Smears

Ahmed Tahiru Issah, Charles B. Delahunt, Carine Mukamakuza

2026-07-21视觉感知

本文针对厚血涂片中疟原虫分种模型难以被显微镜检员逐例审计的问题,提出无需再训练和形态标注的 SGMCE:用实例掩膜裁剪、14 个手工形态特征与 WHO 知识库约束 GPT-4o,生成支持/排除各物种的形态解释。737 个检测上的 KBC、DS、CCF 均值分别约为 0.91、0.99、0.97,但临床诊断增益仍需人工验证。

ECG-LLM: Foundation Model for ECG-Based Cardiac Reasoning Figure 1
2026-07-21eess.SP

ECG-LLM: Foundation Model for ECG-Based Cardiac Reasoning

Alexander Selivanov, Friederike Jungmann, Jan Kehrer, Karl-Ludwig Laugwitz, Eimo Martens, Daniel Rueckert

Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and, TUM University Hospital, Germany, Department of Cardiology, TUM University Hospital, Germany, Institute for Diagnostic and Interventional Radiology, TUM University Hospital, Technical University of Munich (TUM), Munich, Germany, Department of Computing, Imperial College London, UK, Munich Center for Machine Learning (MCML), Germany, AI systems are limited to fixed diagnostic labels or automated reports, constraining their, generation and the ECG-QA benchmark. By moving beyond fixed-label prediction, this, Fixed label space, limitation: first-line triage often relies on the immediately available ECG, while the imaging-, labels/reports are different observations of a shared underlying cardiovascular state. We there-

2026-07-21视觉感知

面向基层分诊中影像检查滞后、传统 ECG-AI 只能回答固定标签的问题,ECG-LLM 将 ECG、CMR、ECHO 和临床上下文转成统一的问答监督,用原始 12 导联 ECG 驱动大语言模型做自由文本心脏推理。结果显示其能恢复常规 ECG 指标,并从 ECG 推断心室/心房容量、功能、左室壁增厚、主动脉狭窄等影像表型,在报告生成和 ECG-QA 上达到或超过基线;但跨中心临床落地和增益中数据规模贡献仍需进一步验证。

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs Figure 1
2026-07-21cs.CV

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

Harbin Institute of Technology, Shenzhen, Great Bay University, Dongguan Key Laboratory for Intelligence and Information Technology, Harbin Institute of Technology, Shenzhen Shenzhen China, Great Bay University Dongguan China, Dongguan Key Laboratory for Intelligence and Information Technology Dongguan China

2026-07-21视觉语言视觉感知

这篇论文针对微手势识别中短暂、局部运动容易被静态外观和背景噪声淹没的问题,提出 GMoT:用空间显著性加权、相邻帧差分和保守初始化的门控融合,把稀疏运动证据压成适合 MLLM 的运动感知 token,并配合面向解剖部位证据的奖励式训练。其在 iMiGUE 和 SMG 上达到 67.32%/73.11% Top-1,较 Qwen3-VL-8B 提升 6.80/3.11 点,同时报告更好的扰动鲁棒性和跨域迁移。

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations Figure 1
2026-07-21cs.CV

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

2026-07-21视觉感知

论文针对艺术图像中同一作品可对应风格、图像志、历史语境等多种解释关系,而 CLIP 式单一嵌入会压平这些关系的问题,提出 CANVAS:用 sheaf 启发的关系条件投影和图结构对比损失学习多关系图文表示,推理时不依赖外部图连接。在 WikiArt+、SemArt+、HertzianaDP 上,跨模态检索与关系感知分类均优于 VLM 和图方法基线,尤其在未见馆藏数据上增益明显。

The Devil is in the Dark Pixels: Toward Brightness Bias-Robust Denoising Figure 1
2026-07-21cs.CV

The Devil is in the Dark Pixels: Toward Brightness Bias-Robust Denoising

Sungjun Cho, Zhuangzhuang Chen, Xiaomeng Li

2026-07-21安全鲁棒

本文关注图像去噪中被整体 PSNR 掩盖的亮度偏置:信号相关噪声下暗区本已低 SNR,而 MSE 训练又因亮像素残差和 Jacobian 更大,使梯度长期偏向亮区。作者提出 BBRD,将像素按亮度分组、按经验噪声归一化,并用 Group-DRO 动态强化最差亮度段;在 8 种架构、2 个数据集上,相比 13 种损失是唯一同时提升各亮度段的方法,SIDD 上最高带来暗区 +0.45 dB、整体 +0.65 dB。

Deep Learning-based Filtering for Video Coding: A Survey on Architectures, Algorithms, and Complexity Analysis Figure 1
2026-07-21cs.CV

Deep Learning-based Filtering for Video Coding: A Survey on Architectures, Algorithms, and Complexity Analysis

Young-Woon Lee, Byung-Gyu Kim

2026-07-21视觉感知

面向4K/8K、VR和移动端低码率视频中压缩伪影与端侧算力受限的矛盾,本文综述深度学习滤波在HEVC/VVC/NNVC中的应用,提出按滤波嵌入位置、编码信息利用和网络设计划分的三维分类,并重点比较RD增益、kMACs、参数量和解码时间。主要结果是梳理出模型从重型高性能方案转向NPU友好轻量化的趋势,同时指出实时延迟、误差传播、定点推理和模型信令仍是落地瓶颈。

Monte Carlo Dropout Uncertainty and Entropy-Thresholded Selective Prediction for Architecture-Agnostic Brain Tumor MRI Triage Figure 1
2026-07-21cs.CV

Monte Carlo Dropout Uncertainty and Entropy-Thresholded Selective Prediction for Architecture-Agnostic Brain Tumor MRI Triage

Medhansh Sharma

2026-07-21强化学习安全鲁棒

这篇论文关注脑肿瘤 MRI 分类落地时“模型何时该交给医生”的问题,而非单纯追求准确率。核心做法是用 MC Dropout 多次前向估计预测熵,并以熵阈值选择性拒判,同时用感知哈希分组避免近重复泄漏。ViT-B/16 与 ResNet-50 在五个种子下准确率约 0.962/0.964、macro-AUC 0.994,温度缩放后 ECE 约 0.016–0.020,拒判最不确定 5% 后其余样本准确率升至约 0.98;但仍属内部验证,外部分布与真实临床增益文中未充分说明。

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding Figure 1
2026-07-21cs.CV

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

Urock-AI Lab, Republic of Korea

2026-07-21视觉语言

这篇论文面向无云、离线取证等边缘检索场景,压缩 Qwen3-VL-Embedding-2B 以降低部署成本。核心做法是用相邻层 CKA 找出冗余文本解码层并剪掉 4 层,再通过分层蒸馏对齐中间注意力和最终嵌入。结果显示参数和 bf16 体积约降 9.5%,MMEB-V2 保留教师 91.7% 性能,前向延迟约降 10%,但 Winoground 组合推理仍明显较弱。

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data Figure 1
2026-07-21cs.CV

Depth-Regularized JEPA World Models Learn More Transferable Representations from Real Outdoor Robot Data

Usman M. Khan

2026-07-21机器人强化学习

针对真实户外农业机器人视频中光照、植被和地形变化使 JEPA 世界模型难以学到可迁移表征的问题,论文在 LeWorldModel 训练阶段引入深度对齐正则,并用可合并的训练期过参数化缓解预测器瓶颈,推理仍只需 RGB。18M 模型在单平台数据上训练后,视觉里程计探针误差较基线降 33%,惊讶分数区分度和跨域多步 latent rollout 保真度均提升,但闭环规划效果文中未充分说明。

xperception -- Making Robotic Grasping Easier Figure 1
2026-07-21cs.CV

xperception -- Making Robotic Grasping Easier

Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi

2026-07-21机器人

面向高混低量制造中频繁换件导致视觉系统需采集、标注和重训的问题,xperception用CAD模型结合DINOv2、GeDi等基础模型特征做零样本6D位姿估计,并将位姿映射到预设抓取点。论文报告其在遮挡、光照和噪声下可达毫米级精度,已在Automatica 2025散乱笔抓取与激光打标演示及Jetson Thor边缘硬件上验证,TRL接近6。

Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs Figure 1
2026-07-21cs.CV

Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs

Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin

The University of Manchester, The University of Melbourne, University of Illinois at Urbana-Champaign, University of Edinburgh, University of Southern California, Fudan University, University of Newcastle

2026-07-21视觉语言数据集/基准

这篇论文关注 VLM 在反事实图像中是否真正依据可见证据作答,而不是沿用语言和类别先验。作者提出 PriVE-Bench,用原图/反事实图配对区分视觉正确答案与先验一致错误,并用 PriVE-Tools 控制评估框、裁剪、放大、轮廓等工具证据的作用。实验显示这些证据在部分模型和场景中能降低先验跟随,尤其有助于定位信息利用,但效果不稳定,多个开源模型即使获得显式证据仍会按先验回答。

SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval Figure 1
2026-07-21cs.CV

SaaF: Scene-Specific Ambiguity-Aware 3D Language Fields towards Interactive Real-World Object Retrieval

Yuga Yano, Daiju Kanaoka, Hakaru Tamukoh, Yasutomo Kawanishi

2026-07-21强化学习三维

面向服务机器人按自然语言在真实三维场景中找物体,论文指出现有 3D language field 容易把相似实例压到一起,且无法判断“杯子”等模糊指令是否足够明确。SaaF 在 Gaussian Splatting 场景中用跟踪对象、VLM 生成多层次文本标签,并以度量学习训练压缩特征空间,使其同时区分实例和表达歧义。实验显示其检索准确率优于既有 3D language field,并能在开放词汇查询中检测歧义、触发澄清。

DAUPNet: Domain-Aware Uncertainty Modeling for Reliable Prototype Discrimination in Cross-Domain Few-Shot Semantic Segmentation Figure 1
2026-07-21cs.CV

DAUPNet: Domain-Aware Uncertainty Modeling for Reliable Prototype Discrimination in Cross-Domain Few-Shot Semantic Segmentation

Lei Yuan, Zhongxu Hu, Jingyi Wen, Pengxing Yi

Department of Mechanical Science and Engineering, Huazhong University of Science and Technology, China

2026-07-21视觉感知安全鲁棒

本文针对跨域少样本语义分割中原型匹配在强域偏移下不可靠的问题,将瓶颈从单纯特征对齐转向“原型不确定性判别”。DAUPNet通过层级域感知协调稳定支持-查询证据,用概率前景/背景原型表达边界与外观歧义,并以方差加权对比学习降低不可靠比较的影响;在四个目标域上达到1-shot 72.6%、5-shot 76.7%平均mIoU,医学域提升尤为明显。

CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation Figure 1
2026-07-21cs.CV

CoBind: Stage-Aware Compositional Binding for Training-Free Text-to-Image Generation

Kaijie Chen, Ethan Caldwell, Mira Vossen, Julian Hartwell, Serena Whitlock, Adrian Bellamy

Mind Lab

2026-07-21视觉感知

本文针对扩散文生图在多实体提示中易漏物体、错绑属性和颠倒关系的问题,提出训练-free的 CoBind:把提示解析为实体、属性、关系组成的图,并按去噪阶段分别约束布局、属性绑定和细节恢复,还按约束满足度自适应减弱引导。实验在 T2I-CompBench++、GenEval 和多种基础模型上显示,其在属性绑定、实体关系和复杂组合生成上有一致提升,同时基本保持视觉质量。

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models Figure 1
2026-07-21cs.CV

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

Zeyu Xu, Xingzhong Hou, Pengkai Guo, Siling Lin, Xiao Xu, Menghua Zhai, Haoyu Chen, Yunke Zhang, Fei Huang

2026-07-21视觉语言视觉感知

LookME针对VLM稀疏扩展在边缘部署中的内存与延迟矛盾,指出现有PLE主要索引文本、难以增强占主导的视觉/跨模态表示。其核心是为连续多模态嵌入设计场景到场景原语的两级查表,并用稀疏注入选择关键token、复用邻近层表。多项视觉基准显示其优于文本-only PLE式方法,但具体增益幅度与代价细节在片段中未充分说明。

Dual-Domain Self-Supervised Artifact Removal Framework for Photoacoustic Computed Tomography Figure 1
2026-07-21cs.CV

Dual-Domain Self-Supervised Artifact Removal Framework for Photoacoustic Computed Tomography

Yucheng Zhou, Shuang Li, Yu Zhang, Yibing Wang, Chulhong Kim, Seongwook Choi, Changhui Li

2026-07-21视觉感知

针对稀疏探测条件下 PACT 重建易产生结构伪影、而成对高质量训练数据难获得的问题,论文利用 UBP 与 FDM 伪影形态差异,设计共享权重孪生网络,并以跨域保真和不确定性加权一致性进行自监督残差去伪影。仿真、体模、活体大鼠和人体手部实验显示,该方法较 FDM/UBP 及 DIP、A2A、SVD 更能抑制背景伪影并保留血管连续性,人体实验相对最佳基线提升 PSNR 10.14 dB、SSIM 31.0%。

Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation Figure 1
2026-07-21cs.CV

Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation

Yunhang Qian, Jiaquan Yu, Jiawei Liu, Meng Wang, Hongwei Bran Li, Xiaobin Hu

2026-07-21视觉语言视觉感知强化学习

该文针对医学VLM容易依赖语言先验而非病灶等关键视觉证据的问题,提出Med-OPD:用答案感知教师评分和Medical Evidence Advantage衡量token对医学证据的依赖,并在轨迹与token层面重分配蒸馏权重。OmniMedVQA实验显示其在CT、MRI、疾病诊断和病灶分级上均优于SFT与标准OPD,平均准确率分别提升5.24和2.83个百分点。

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis Figure 1
2026-07-21cs.CV

FedDP-PALD: A Privacy-Preserving Federated Latent Diffusion Framework with Prototype Aggregation for Medical Data Synthesis

Md. Sajeebul Islam Sk., Khan Enaet Hossain, Md. Mehedi Hasan Shawon

Department of Computer Science and Engineering, BRAC University, Bangladesh, Department of Mathematics and Statistics, York University, Toronto, Canada, Department of Electrical and Computer Engineering, University of Maryland, College Park, Maryland, USA

2026-07-21生成模型

针对跨机构医疗数据难共享且联邦训练仍可能泄露成员信息的问题,FedDP-PALD用模态感知融合处理X光与ECG缺失情形,并以差分隐私原型混合聚合替代直接共享潜变量,再训练潜空间扩散生成合成表示。实验显示成员推断AUROC从0.6229降至约0.50,合成潜变量训练F1为0.8993、AUROC为0.9057,但相对真实潜变量仍有性能与校准差距。

Rethinking Feature Reliance Evaluation with Semantically Matched Suppression Figure 1
2026-07-21cs.CV

Rethinking Feature Reliance Evaluation with Semantically Matched Suppression

Ning Jiang (1 and 2), Tianyi Luo (4), Zhengyong Huang (1 and 2), Yao Sui (1 and 2 and 3) ((1) Institute of Medical Technology, Peking University Health Science Center, Beijing, China, (2) National Institute of Health Data Science, Peking University, (3) Institute for Artificial Intelligence, (4) School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China)

Institute of Medical Technology, Peking University Health Science Center, Beijing 100191, China, National Institute of Health Data Science, Peking University, Beijing 100191, China, School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China, Institute for Artificial Intelligence, Peking University, Beijing 100871, China

2026-07-21数据集/基准

论文针对形状/纹理依赖评估中“抑制后精度下降”难以比较的问题,指出不同抑制操作会造成不同语义损伤,可能混淆特征依赖判断。其核心做法是按类别可分性损失匹配形状与纹理抑制强度。结果显示,语义匹配后 ImageNet CNN 对纹理抑制退化更大,而 ViT 在两类抑制下更稳,并在脑编码实验中呈现较小表征退化。

Emergent Hierarchical Monosemantic Neurons from the Group-Contrastive Forward-Forward Algorithm Figure 1
2026-07-21cs.CV

Emergent Hierarchical Monosemantic Neurons from the Group-Contrastive Forward-Forward Algorithm

Yiming Tang, Qinglin Qi, Zhaoqian Yao, Harshvardhan Saini, Dianbo Liu

National University of Singapore, Lund University, Chinese University of Hong Kong, Indian Institute of Technology, Dhanbad

2026-07-21视觉感知

论文针对稀疏字典学习依赖线性重构、难以识别非线性概念且缺少层级结构的问题,提出 Group-Contrastive Forward-Forward,通过类别专属路由和类内对比目标,以结构约束而非稀疏性诱导单义神经元。实验显示,GCFF 接在 CLIP 表征上可得到随深度从具体物体到抽象环境属性递进的特征,并在多项图像分类基准上优于既有 forward-forward 方法。

A${}^2$BM: Alignment-Aware Bridge Matching for Image-to-Image Translation Figure 1
2026-07-21cs.CV

A${}^2$BM: Alignment-Aware Bridge Matching for Image-to-Image Translation

Aimi Okabayashi (UBS Vannes), Georges Le Bellier (LIP, CEDRIC - VERTIGO), Nicolas Audebert (LaSTIG, IGN, Charlotte Pelletier (OBELIX), Thomas Corpetti (LETG - Rennes), Nicolas Courty (OBELIX)

signed to leverage prior knowledge when available, and a, coder embeddings when no domain knowledge is available.

2026-07-21视觉感知

这篇论文关注弱对齐图像到图像翻译:真实遥感、跨传感器或异步采集数据很难获得像素级配对,传统 bridge/flow matching 会把错配当作可靠监督。A²BM 的核心做法是在训练中引入由元数据或预训练视觉特征得到的对齐分数,并在推理时把该分数作为控制翻译保真度的条件变量。实验覆盖合成错位和洪灾前后、历史影像、跨传感器超分等真实任务,结果显示其相较 GAN、扩散和 Schrödinger bridge 基线更能保持源图像内容。

SLT: Robust Quantum Neural Networks for Noisy-Label Medical Image Classification via Supermartingale-based Label Transition Figure 1
2026-07-21cs.CV

SLT: Robust Quantum Neural Networks for Noisy-Label Medical Image Classification via Supermartingale-based Label Transition

Jun Zhuang, Mohammad Al Hasan, Yiyu Shi, Chaowen Guan

Boise State University, ID 83725, Indiana University Indianapolis, IN 46202, University of Notre Dame, IN 46556, University of Cincinnati, OH 45221

2026-07-21视觉感知安全鲁棒

本文针对小规模医学图像中标注噪声会放大量子神经网络训练不稳定的问题,提出 SLT:把预测熵的下降建模为超鞅,用其单调趋势决定何时更新标签转移矩阵,从而避免依赖难获得的锚点并减少噪声驱动震荡。实验显示,SLT 在多个医学图像数据集的合成与真实噪声设置下提升 QNN 分类表现,并优于若干经典噪声标签学习基线。

It Depends on the Dataset: When a Brain-Encoding Model's Predicted Responses Beat Their Visual Backbone for Video Memorability Figure 1
2026-07-21cs.CV

It Depends on the Dataset: When a Brain-Encoding Model's Predicted Responses Beat Their Visual Backbone for Video Memorability

Carson Rodrigues

Celabe

2026-07-21视觉感知数据集/基准

论文追问脑编码基础模型的“预测脑响应”能否作为无扫描的人类行为特征,而不只是视觉骨干的再包装。作者用 TRIBE v2 脑投影对比其 V-JEPA2 骨干预测视频记忆度,关键洞察是效果强依赖数据集:Memento10k 上骨干更好,VideoMem 上脑特征更好,跨数据集迁移也沿用这一分裂;控制实验表明 VideoMem 增益并非简单压缩或正则化,但增益边界仍需更多数据集说明。

Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing Figure 1
2026-07-21cs.CV

Beyond Target Scores: Measuring Off-Target Drift in Diffusion-Based Medical Image Editing

Todd Zhou

2026-07-21视觉感知生成模型

论文针对医学扩散图像编辑只看目标分数会掩盖非目标病灶漂移的问题,提出 CIB-Med-1 轨迹级基准,用胸片胸腔积液编辑同时评估目标进展、反转率和 14 个临床干扰轴漂移。核心洞察是目标提升可能来自相关病灶的“奖励黑客”而非可辨识控制;约束引导在保持趋势相关 0.88 的同时,将中位漂移由 0.46 降至 0.20,并提升读片者排序一致性。

Strength-Parity Ensembling with Parameter-Isolated Experts for Multi-Task Affect Recognition Figure 1
2026-07-21cs.CV

Strength-Parity Ensembling with Parameter-Isolated Experts for Multi-Task Affect Recognition

Hong Hai Nguyen, Van Thong Huynh

2026-07-21视觉感知

这篇论文关注 ABAW 多任务情感识别中集成模型“该加谁”的问题:仅换随机种子或微调流程会高度相关,难以带来收益。作者提出 strength-parity 准则,要求新成员既与现有模型去相关又具备相近精度,并用参数隔离的 LoRA 低秩专家制造这种多样性。系统在验证集从基础集成的 1.6669 提升到 1.6949,最强配置达 1.7259。

A Synthetic 3D Gear Dataset for Manufacturing Quality Inspection (MFGNet-Gear) Figure 1
2026-07-21cs.CV

A Synthetic 3D Gear Dataset for Manufacturing Quality Inspection (MFGNet-Gear)

Ruo-Syuan Mei, Chenhui Shao

Department of Mechanical Engineering, University of Michigan

2026-07-21数据集/基准三维

面向齿轮三维质检中真实缺陷稀少、标注昂贵且公开基准不足的问题,本文发布 MFGNet-Gear:用参数化 CAD 同时扰动齿轮设计与缺陷形态,生成 12 种设计、4 类质量状态的 2.4 万个网格和点云。验证显示数据完整且类别均衡,点云全部可读,网格通过率 99.96%;已有子集实验表明可支持设计分类和缺陷检测,但全设计空间评测仍未充分说明。

Identity-Consistent Expression Fields: A Disentangled Neural Radiance Field Framework for Few-Shot Facial Expression Synthesis Figure 1
2026-07-21cs.CV

Identity-Consistent Expression Fields: A Disentangled Neural Radiance Field Framework for Few-Shot Facial Expression Synthesis

Minh Tran

University of Science and Technology of Hanoi

2026-07-21视觉感知

论文针对少样本人脸表情合成中动态 NeRF 在外推到未见表情时容易改变肤质、细节几何等身份特征的问题,提出 ICEF,将静态身份辐射场与表情条件形变解耦,并用身份保持正则和置信度加权 warping 限制低可信外推。文中主要给出框架和按表情外推距离评估身份一致性的协议,缺少充分实验结果,实际增益文中未充分说明。

Depth Estimators Are Implicit Neural Fields for 3D Scene Geometry Inpainting and Reconstruction Figure 1
2026-07-21cs.CV

Depth Estimators Are Implicit Neural Fields for 3D Scene Geometry Inpainting and Reconstruction

Yingzhao Jian, Zihao Lin, Hehe Fan

College of Artificial Intelligence, Zhejiang University. *Corresponding author.

2026-07-21三维

现实三维场景常因遮挡、视角受限或卫星云影出现几何缺失,直接用预训练深度估计器补全又容易与已观测几何不一致或遇到域外数据失效。论文提出 NDF,将深度估计器同时视为一次性预测器和场景级隐式深度场,在测试时用已观测深度统一优化适配先验并约束几何一致性。实验覆盖室内扫描到卫星场景,报告跨视角不一致降低 63.3%、补全精度提升 23.1%。

A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition Figure 1
2026-07-21cs.CV

A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition

Hong Hai Nguyen, Sy Phan Van, Soo-Hyung Kim, Van-Thong Huynh

2026-07-21视觉感知

论文针对野外表情识别中效价-唤醒、离散表情和动作单元标注不完整且长尾的问题,把部分标注多任务学习建模为共享情感潜变量的边缘化,让单任务标注帧也约束共同表示。结果显示单骨干将表情 macro-F1 从 0.403 提到 0.446,双近邻且误差去相关骨干进一步改善动作单元,验证集多任务分数为 1.679;作者也承认最终组装按验证集选源,结论主要依赖受控对比。

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding Figure 1
2026-07-21cs.CV

MAC 2026: Advancing Micro-Action Analysis Towards Fine-Grained Understanding

Kun Li, Dan Guo, Jihao Gu, Pengyu Liu, Xiaobai Li, Haoyu Chen, Yanbin Hao, Guoying Zhao, Meng Wang

United Arab Emirates University, Hefei University of Technology, University College London, Zhejiang University, CMVS, University of Oulu, Hefei University of Technology Hefei China, Zhejiang University University of Oulu Hangzhou China, CMVS, University of Oulu Oulu Finland

2026-07-21视觉感知

微动作因持续时间短、运动幅度弱且类别相似,缺少统一数据和评测,限制了细粒度人体理解研究。论文将 MAC 2026 从识别、检测扩展到细粒度微动作理解,引入由多模态大模型辅助评估的 FMAU 任务,并整合 MA-52、MMA-52、MA-Bench 三类基准。文中总结了赛道设置、协议、参赛方案和结果,但具体性能增益来源未充分说明。

GenSyn10: A Multi-Generative AI Dataset For Benchmarking Image Classification Figure 1
2026-07-21cs.CV

GenSyn10: A Multi-Generative AI Dataset For Benchmarking Image Classification

Md Faraz Kabir Khan, Saeed Anwar, Ghulam Mubashar Hassan

Department of Computer Science and Software Engineering, The University of Western Australia

2026-07-21视觉感知生成模型数据集/基准

针对生成图像检测器常在已见生成器上表现好、遇到新生成器即退化的问题,本文构建了与 CIFAR-10 对齐的 GenSyn10:6 万张来自 FLUX.2-dev、HunyuanImage-3.0 和 Qwen-Image-2512 的合成图像,并用统一提示模板与下采样流程控制变量。17 个分类模型的评测显示,CIFAR-10 训练模型零样本最高达 96.86%,微调后达 99.88%;但真实/合成二分类在未见生成器上降至 79-96%,说明跨生成器泛化仍是核心瓶颈。

Moving Like a Human: Ego-Motion-Normalized Temporal Signatures for Real-Time Aerial Person Tracking on Milliwatt-Class Hardware Figure 1
2026-07-21cs.CV

Moving Like a Human: Ego-Motion-Normalized Temporal Signatures for Real-Time Aerial Person Tracking on Milliwatt-Class Hardware

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

University of Tartu

2026-07-21视觉感知

这篇论文针对轻量无人机跟随拍摄中目标很小、相机剧烈运动且算力只有毫瓦级的问题,提出先用几何方法消除自运动,再把残余运动作为输入,让极小的无状态检测器、卡尔曼跟踪和人体运动验证器协同工作。核心洞察是人的时序运动特征比单帧外观更可靠,且应主要在输入表示中解析。结果显示其在 Pi Zero 2W 上达 31.85 FPS,真实 UAV 视频 AP25 为 0.462,明显快于且优于 YOLOv8n。

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism Figure 1
2026-07-21cs.CV

3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism

Weston Bondurant, Srijan Das, Hieu Le, Stephanie Schuckers

2026-07-21视觉语言三维

这篇论文针对3D人脸头像一旦发布即可被VLM从任意视角推断年龄、性别、表情等敏感属性的隐私风险,提出在3D Gaussian Splatting头像表面外加可学习的高斯“壳”,在不改动原始几何和身份外观的前提下,通过多视角嵌入对齐诱导VLM产生目标属性判断。实验在名人重建头像和多个黑盒VLM上显示,该方法提升属性注入与错配率,同时保持较高感知相似度和身份一致性。

A Step Forward Towards Trustworthy Risk-Aware Facial Retrieval (RA-FR) Figure 1
2026-07-21cs.CV

A Step Forward Towards Trustworthy Risk-Aware Facial Retrieval (RA-FR)

Muhammad Emmad Siddiqui, Muhammad Rafi

2026-07-21安全鲁棒

本文针对监控场景中人脸检索在低清、模糊和光照变化下漏检代价高、固定 Top-k 缺乏部署保证的问题,提出 RA-FR:先用 DiffBIR 与 InterLCM 降低退化噪声,再以 DINOv1 ViT 和 GGeM 提取较稳健表征,并用 conformal prediction 按查询不确定性自适应扩大检索集合。在 IMFDB 上其满足 5% 风险目标,平均返回约 10 张图,SCFace/IMFDB 实验表明风险-效率权衡优于基线。

The JEPA Predictor: A Transferable Operator for Occluded Feature Completion Figure 1
2026-07-21cs.CV

The JEPA Predictor: A Transferable Operator for Occluded Feature Completion

William Nguyen, Christopher Nguyen

Aitomatic, Inc.

2026-07-21视觉感知

这篇论文针对遮挡或局部输入下冻结视觉编码器精度快速下降的问题,提出把预训练后通常被丢弃的 JEPA predictor 作为可迁移的遮挡特征补全算子,通过少量图像拟合线性投影接到 CLIP、DINO、MAE 等非 JEPA 编码器上,无需重训主干。实验显示,在 ImageNet-9 和 Stanford Dogs 上,遮挡比例越高,相对 masked-encoder baseline 的增益越大,CLIP+I-JEPA 在重遮挡 Dogs 上从 15.9% 提升到 52.1%,但低遮挡细粒度任务中线性桥接成本会压过收益。

ForensicNet: Lightweight Attention-Enhanced MobileNetV2 for Automated Face Identification Figure 1
2026-07-21cs.CV

ForensicNet: Lightweight Attention-Enhanced MobileNetV2 for Automated Face Identification

Savitha N J, Lata B T

Department of Computer Science and Engineering, University Visvesvaraya College of Engineering, (UVCE), Bangalore University, CMR Institute of Technology, Bengaluru, India, (UVCE), Bangalore University, Bengaluru, India, in light, occlusion, and lack of labeled data. This paper presents ForensicNet, a lightweight deep learning, used publicly available datasets such as LFW and SCFace, with 15,000 facial images spanning 68 identity, face recognition is the limited availability of labeled forensic, near 100% accuracy on Labeled Faces in the Wild (LFW) with, represents the corresponding identity label among

2026-07-21视觉感知

本文面向监控取证中姿态、光照、遮挡和标注不足导致的人脸识别不稳定问题,提出在 MobileNetV2 中加入 CBAM 通道与空间注意力,并配合两阶段自适应解冻迁移学习,以在轻量部署下强化判别特征。实验在 LFW、SCFace 汇总的 1.5 万张、68 类身份数据上报告 92.4% 准确率、90.8% 精确率、89.5% 召回率和 2.1 GFLOPs,优于 AlexNet、ResNet-50 与原始 MobileNetV2;但真实无约束场景泛化仍文中未充分说明。

AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis Figure 1
2026-07-21cs.LG

AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis

Jialong Zhong, Tingwei Liu, Baokun Yue, Jingjing Li, Yongri Piao, Miao Zhang, Leiye Liu, Jiahong Jiang, Wei Ji, Huchuan Lu

2026-07-21视觉语言

本文面向WSI与基因组联合的癌症生存预测,指出固定模态融合和Mamba按物理顺序扫描会削弱患者级、局部级诊断信号及语义连续性。AdaSurvMamba用DSIR动态重构跨模态重要性,并用SAS基于语义原型重排token、调节状态转移步长。五个TCGA队列上相较既有方法取得一致提升,但具体增益幅度文中片段未充分说明。

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety Figure 1
2026-07-21cs.LG

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

2026-07-21安全鲁棒

这篇论文针对具身智能在家务闭环执行中遇到临时风险时常只能拦截或停工的问题,提出把安全建模为“环境状态—行动意图”的耦合,并用风险拓扑信念图、事实规则记忆和经验元技能做即时干预;其测试时 Test-Verify-Write 循环还能从执行轨迹更新技能。在 IS-Bench 上,多种 VLM 的 Safe-Success 明显提升,Qwen3-VL-8B 增加 30.3%。

What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain? Figure 1
2026-07-21cs.CV

What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?

Anna Bavaresco, Ina Klarić, Raquel Fernández, Marie-Francine Moens

2026-07-21视觉感知

论文追问为何纯语言的图像描述嵌入能解释人脑高级视觉区反应,而不仅是复现视觉模型相关性。作者系统改变 caption 来源与语言模型类型,比较 fMRI 预测、表征相似性和行为相似判断。结果显示,机器生成且视觉信息更充分、流畅度更高的描述常优于 MS COCO 人工标注,文本嵌入模型稳定强于自回归 LM,最佳信号多出现在中间层,说明 caption 内容和语义表征方式共同决定脑对齐效果。

2026-07-20

88 篇
Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs Figure 1
2026-07-20cs.CV

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

Northwestern Polytechnical University, China University of Petroleum, Northwestern Polytechnical University Xi’an Shaanxi China, China University of Petroleum Qingdao Shandong China

2026-07-20强化学习数据集/基准

这篇论文针对现有无人机 MLLM 评测多关注场景理解或任务完成、缺少自我状态与环境状态联合考察的问题,提出 UAV-DualCog 双认知基准,覆盖图像和视频中的视角、运动、相对位置及地标可见性推理,并用语义点云自动生成样本。实验显示,当前模型在粗粒度回答上尚可,但自我状态推理、视角变换、空间定位和时间区间定位仍明显不可靠。

MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction Figure 1
2026-07-20cs.CV

MotionForesight: Re-purposing Video Models for Future 3D Scene-Flow Prediction

Homanga Bharadhwaj, Yash Jangir

2026-07-20视觉感知生成模型三维

本文针对机器人操作中仅凭短时观察预判物体后续运动的需求,将交互预测表述为被操作物体的未来三维场景流预测。核心洞察是复用视频模型中已有的人物交互运动先验:在冻结大模型和三维跟踪器的基础上,用未来帧掩码潜变量和轻量适配器把回溯式跟踪改造成前向预测。实验显示其用约4万段人类视频、无需语言或动作输入,即可在分布外物体、环境和视角上泛化,并优于使用百万级视频训练的更大模型。

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation Figure 1
2026-07-20cs.CV

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

Hao Liu, Chenghuan Huang, Ye Huang, Zhiying Wen, Mohan Zhang, Chen Li, Ziyang Ma, Jing Lyu, Jiangsu Du

Sun Yat-sen University, WeChat HPC, Tencent Inc., WeChat Vision, Tencent Inc., Peking University

2026-07-20视觉感知

针对高分辨率视频 DiT 中自注意力占比高、Top-p 稀疏路由在多 GPU 序列并行下造成负载倾斜的问题,FVAttn 的核心洞察是失衡通常集中在少量重头上,因此可在掩码生成后用轻量 P2P 迁移做运行时负载修复,并把非关键 rank 的空闲时间用于补充高价值块。实验在 Wan2.2/2.1 视频生成上将负载不均衡从 1.34 降至 1.08,注意力较 FlashAttention 加速 4.41 倍,DiT 推理加速约 2.02–2.11 倍且质量指标基本保持。

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA Figure 1
2026-07-20cs.CV

Searching Videos as Trees: Self-Correcting Agents for Grounded Long Video QA

Ce Zhang, Ziyang Wang, Yulu Pan, Oluwatumininu Oguntola, Pranav Wagh, Qiyu Wu, Hiromi Wakaki, Mohit Bansal, Gedas Bertasius

University of North Carolina at Chapel Hill

2026-07-20视觉感知

长视频问答的证据往往很短,单纯用连续裁剪工具易过早缩小到错误区间且难以回退。VTS 将视频按场景边界组织成自适应时间树,让智能体用 zoom_in、zoom_out、shift、answer 等离散动作进行可学习的定位与自纠,并用含错误分支恢复的轨迹训练。实验显示其在 CG-Bench、Haystack-LVBench/Ego4D 上显著提升 grounding 与问答准确率,并可迁移到通用长视频 QA。

Vision-Language Assistant for Emotional Reactions to Risky Driving Figure 1
2026-07-20cs.CV

Vision-Language Assistant for Emotional Reactions to Risky Driving

Harine Choi, Eun Hak Lee, Zhengzhong Tu

Department of Computer Science and Engineering, Texas A&M University, 77840, College Station, Texas, United States, School of Railway Operation Systems, Kyungil University, Gyeongsan-si, Gyeongsangbuk-do, Republic of Korea

2026-07-20视觉语言视觉感知安全鲁棒

针对现有车载视觉语言系统多停留在中性风险提示、难以回应驾驶员紧张或愤怒情绪的问题,论文提出 KYA:用 YOLOv8 从行车记录仪识别突然 cut-in 等风险,并把距离、相对速度、预计到达时间转成行为日志,再由 LLM 按用户偏好的语气生成车内语音反应。108 人用户研究显示,各模型总体可产生情绪匹配回复,其中 YOLOv8s+ChatGPT-4o few-shot 得分最高,为 4.29/5;但统计证据因多选设置只应视为支持性结论。

An Exam for Active Observers Figure 1
2026-07-20cs.CV

An Exam for Active Observers

Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger

University of Southern California

2026-07-20视觉感知

这篇论文针对现有多模态视觉评测多依赖单次图像描述、难以检验主动观察能力的问题,提出 ActiveVision 基准,用分布式扫描、顺序路径追踪和细粒度属性迁移等 17 类任务迫使模型反复回看视觉证据。结果显示前沿 MLLM 表现远低于人类,最佳仅 10.6%,工具编程虽提升到 24.7–50.6%,但仍暴露感知验证瓶颈。

CLIFE: Camera-LiDAR Fusion Framework for Edge-Deployable Roadside VRU Perception Figure 1
2026-07-20cs.CV

CLIFE: Camera-LiDAR Fusion Framework for Edge-Deployable Roadside VRU Perception

Tam Bang, Hoang H. Nguyen, Lei Cheng, Lihao Guo, Siyang Cao, Hussam Abubakr, Tianya Zhang, Austin Harris, Mina Sartipi

2026-07-20视觉感知

CLIFE针对路侧弱势交通参与者感知在遮挡、低光/眩光、天气变化和边缘算力约束下难以稳定部署的问题,提出单嵌入式设备上的相机-LiDAR后融合框架,结合无标靶在线标定与轻量级轨迹关联,降低对云端和人工标定的依赖。系统已部署于查塔努加12个信号路口,代表路口实验显示其提升了感知范围与鲁棒性,融合核心在Jetson AGX Thor上达到53.2 FPS。

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds Figure 1
2026-07-20cs.RO

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

Zhiyuan Wu, Zhuo Chen, Shan Luo

2026-07-20三维

这篇论文针对机器人单次触觉读数难以在三维物体表面定位的问题,提出 VTLoc 将2D触觉图像与物体点云直接对齐。核心做法是用几何多模态对齐重建伪点云以约束空间一致性,再用迭代定位更新器逐步回归接触点,避免依赖大规模物体专属触觉码本。作者在100个真实物体的新基准上报告定位效果提升,但具体增益幅度在给定片段中未充分说明。

Toward Semantic Communication for Real-time Mobile 3D Reconstruction Figure 1
2026-07-20cs.CV

Toward Semantic Communication for Real-time Mobile 3D Reconstruction

Fangzhou Zhao, Yao Sun, Xuesong Liu, Runze Cheng, Shang Kai, Yi Sun

2026-07-20三维

移动端实时三维重建在无线传输下容易因局部失真破坏多视图一致性,导致位姿漂移和结构不稳。本文的关键思路是让语义通信不仅重建图像,还输出像素级置信度,并将其用于RANSAC位姿初始化和束调整,降低不可靠区域权重。仿真显示,相比现有语义通信和传统信源信道编码,方法在保持图像质量的同时提升位姿精度与三维结构一致性。

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos Figure 1
2026-07-20eess.AS

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

University of Maryland, USA

2026-07-20视觉感知

这篇论文针对现有音视频大模型偏重短视频、音频与视觉联合推理不足的问题,提出开放的 AV-Flamingo。核心做法是构建约 700 万音视频 caption/QA 的 AV-Skills 数据,配合三阶段训练和带时间戳 grounding 的 TAVIT 推理框架,以提升长视频中的跨模态、时序和多事件理解。实验显示其在 15 个以上音视频、全模态、音频和视觉基准上优于同规模开放模型,并在长复杂真实视频任务上接近或超过部分更大模型;但增益可能主要来自 scaling / data。

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs Figure 1
2026-07-20cs.CV

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava Madhyastha

University of London, City St George’s, University of London, The Alan Turing Institute

2026-07-20视觉语言

针对图表问答中VLM可能答对却未看对视觉证据的问题,本文提出面向ViT-LLM架构的token级注意力引导显著图:汇总各层各头对视觉token的注意力并映射回patch网格,无需梯度或额外推理即可查看每个生成词关注的图像区域。在Mini-VLAT上的删除评估显示,移除高显著区域会使准确率快速下降,支持其与模型行为存在因果关联。

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA Figure 1
2026-07-20cs.CV

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

Singapore Institute of Technology, Singapore Institute of Technology Singapore

2026-07-20视觉语言视觉感知

本文针对组合式VQA中VLM总体准确率掩盖具体失效机制的问题,提出按推理操作与内部计算路径分解的机制分析框架,结合GQA程序标注和场景图定位关键视觉token。主要发现四类失效:定位、推理、属性抽取和语言先验主导;其中定位与属性抽取主要经MLP传播,空间推理错误依赖后层注意力,说明不同错误需要分别干预。

Adaptive Contrast Enhancement and Optimised Feature Matching for RootSIFT-Based Palm-Vein Recognition Figure 1
2026-07-20cs.CV

Adaptive Contrast Enhancement and Optimised Feature Matching for RootSIFT-Based Palm-Vein Recognition

Kaveen Perera, Fouad Khelifi, Ammar Belatreche

Computer & Information Sciences Department, University of Northumbria at Newcastle, United Kingdom, centred around the mid-tonal range, an indicator typical of low-, extended preprint version of [9], made available as [12], to, improve scalability for larger tile sizes and enhance adaptability

2026-07-20视觉感知

针对近红外掌静脉图像低对比度导致特征提取和匹配不稳的问题,论文提出 ILACS-BGOT,在局部自适应对比拉伸基础上用双向高斯加权重叠块减轻块状伪影,并结合 RootSIFT、KNN+RT 与 MMD 几何过滤调参。作者在 CASIA、PolyU、PUT 上测试 42 组参数,报告 EER 和准确率优于既有方法,且较大模板规模通常带来更好表现。

HCIG: A Hierarchical Cross-Modal Incongruity Graph Network for Multimodal Sarcasm and Cyberbullying Detection Figure 1
2026-07-20cs.CV

HCIG: A Hierarchical Cross-Modal Incongruity Graph Network for Multimodal Sarcasm and Cyberbullying Detection

Bhavana Verma, Priyanka Meel, Dinesh Kumar Vishwakarma

Multimodal Data Analytics Research Laboratory, Department of Information Technology, Delhi Technological University

2026-07-20视觉语言视觉感知

论文针对讽刺与网络欺凌常由图文语义不一致触发、单模态或简单融合难以识别的问题,提出HCIG在 token、短语和全局层级构建跨模态不一致图,并用层级注意力自适应整合;另以GCCN检验矛盾感知图推理。结果显示,HCIG在MMSD达85.74%准确率和85.29% macro-F1,MultiBully上HCIG准确率最高、GCCN macro-F1最高,但跨任务迁移也表明两类任务语义差异明显。

Spatial Normalization for Cross-Domain Retinal Layer Segmentation in Optical Coherence Tomography Figure 1
2026-07-20cs.CV

Spatial Normalization for Cross-Domain Retinal Layer Segmentation in Optical Coherence Tomography

Iker Moran-Cavero, Monica Hernandez, Elvira Mayordomo, Naiara Artiaga, Beatriz Pardiñas, Beatriz Cordon, Elena Garcia-Martin

2026-07-20视觉感知

针对OCT视网膜层分割在噪声、解剖差异和跨设备/人群域偏移下泛化不足的问题,论文将神经影像中的空间标准化引入预处理,提出以黄斑中心为参考的体数据对齐,并系统比较nnU-Net、MGU-Net、SD-LayerNet等模型。结果显示,空间标准化能提升跨域分割的一致性,减少拓扑违规,并改善厚度图等下游生物标志物分析的可靠性。

ArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering Figure 1
2026-07-20cs.CV

ArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

2026-07-20数据集/基准

艺术化图表生成的难点在于不能只追求好看,还要保持数值几何、图中文字和标签绑定正确。ArtChart将任务、基准和评测统一起来,用无文本灰度布局提供显式数学控制,再通过OCR、布局与审美奖励及多专家蒸馏协调文本和风格。实验显示其优于开源T2I、编辑和ControlNet基线,但仍依赖显式布局条件,复杂多系列图表尚未覆盖。

Multi-Modal Semantic Segmentation of Electrolyzer Components for Sustainable Hydrogen Technologies: A Dual-Branch Deep Learning Approach Figure 1
2026-07-20cs.CV

Multi-Modal Semantic Segmentation of Electrolyzer Components for Sustainable Hydrogen Technologies: A Dual-Branch Deep Learning Approach

Wasimul Karim, Nur Mohammad Fahad, Abdul Hasib Siddique, Md Rafiqul Islam, Hooman Mehdizadeh-Rad, Asif Karim, Sami Azam

Applied Artificial Intelligence and INtelligent Systems (AAIINS) Laboratory, Dhaka 1217, Bangladesh, Department of Computer Science and Engineering, University of Scholars, 40 Kemal Ataturk Avenue, Dhaka 1213, Bangladesh, School of Engineering and Energy, Murdoch University, Murdoch, WA 6150, Australia, Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia

2026-07-20视觉感知

面向电解槽退役拆解与回收中的材料识别难题,论文指出仅靠 RGB 难区分外观相近材料,而仅靠高光谱又易损失边界细节;因此提出 HREM-Net,以 HSI/RGB 双分支分别建模光谱与空间信息,并用注意力、动态跨模态门控和复合损失缓解类别不均衡。模型在 Electrolyzers-HSI 上达到 91.66% 平均类别准确率和 0.82 mIoU,并在 PCB-Vision 跨数据集验证中取得 96.91% 准确率和 0.93 mIoU。

PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects Figure 1
2026-07-20cs.CV

PIXIE: A Zero-Shot texture-invariant 6D pose estimation framework for unseen objects with assembly defects

Leon Jungemeyer, Alejandro Magaña, Gautham Mohan, Matthias Karl, Daniel Werdehausen

2026-07-20三维

面向工业场景中零件频繁变化、缺少纹理 CAD 且实物存在装配缺陷的问题,PIXIE 将6D位姿估计限制在几何域:从无纹理3D模型渲染深度/法线图,用预训练跨模态匹配器建立RGB到几何渲染的对应,再经PnP和视角迭代求姿态。该方法无需对象训练,在BOP无纹理物体上达到SOTA,并在含纹理变化、遮挡和装配偏差的新数据集上展示鲁棒性。

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction Figure 1
2026-07-20cs.CV

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

Jehun Kang, Jungha Wang, Youngjun Hwang, David Hyunchul Shim

2026-07-20视觉感知

面向机器人单目视觉中的语义分割与深度估计,多任务 ViT 感知的瓶颈在于解码器既重又易产生任务负迁移。DPNeXt 用冻结 DINOv2-Reg 编码器、轻量多尺度 CNN 融合解码器和无推理开销的边界监督来共享几何与语义线索;在 Cityscapes、NYUv2 上取得对比方法中最佳或领先结果,DPNeXt-S 相比 DPT 可训练参数减少 78.6% 且推理更快。

Beyond Unfolding: 60x Faster One-Stage Unmixing for Closely-Spaced Infrared Small Targets Figure 1
2026-07-20cs.CV

Beyond Unfolding: 60x Faster One-Stage Unmixing for Closely-Spaced Infrared Small Targets

Ximeng Zhai, Zheng Wang, Yaohong Chen, Hao Wang, Ming-Ming Cheng, Yimian Dai

the West Light Foundation of the Chinese Academy of Sciences (XAB2022YN06), Zheng Wang is with Beijing Institute of Astronautical Systems Engineering, Beijing 100094, China

2026-07-20视觉感知

针对密集远距红外小目标因衍射能量重叠而无法按传统一斑一点检测的问题,论文将其转为一对多的亚像素解混任务。核心洞察是 CSIST 解混与超分共享退化模型,因此用单阶段轻量 FOCUS 替代深度展开迭代,并通过粗到细定位、稀疏约束与通量守恒平衡背景抑制和能量恢复。在 CSIST-100K 上,其定位与解混精度达到或超过展开式方法,推理速度提升约 60 倍。

CanonicalPhys: Pose-Robust Remote Photoplethysmography via Canonical-Space Priors Figure 1
2026-07-20cs.CV

CanonicalPhys: Pose-Robust Remote Photoplethysmography via Canonical-Space Priors

Hui Wei, Seyedata Jodeiri Seyedian, Xiaobai Li, Guoying Zhao

Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, ELLIS Institute Finland, Zhejiang University

2026-07-20三维安全鲁棒

本文针对远程光电容积描记在头部姿态变化下误差显著上升的问题,指出关键并非简单数据增强,而是图像坐标中像素与面部解剖区域对应关系不稳定。CanonicalPhys用四点单应性把人脸对齐到规范空间,并在其中引入Lambertian权重、跨ROI时序一致性和POS蒸馏且不增加可训练参数;在MMPD上将大偏航退化从1.60倍降至1.33倍,跨数据集最高降低32% MAE。

DebrisTracer: Reliable Tracking in Hypervelocity Impact Fast Imaging Figure 1
2026-07-20cs.LG

DebrisTracer: Reliable Tracking in Hypervelocity Impact Fast Imaging

Théophane Loloum, Fabien Vivodtzev, David Hébert, Baptiste Reynier, Michel Arrigoni, Julien Tierny

2026-07-20视觉感知

针对超高速撞击高速成像中碎片数量多、噪声强、位移大且遮挡频繁,传统阈值分割和重叠跟踪难以可靠估计质量与速度分布的问题,DebrisTracer在现有拓扑关键点跟踪框架中加入领域知识和物理假设,用于可解释地追踪碎片。实验显示其在碎片表征及喷出质量、弹坑深度等物理验证指标上优于TrackMate等专家常用工具,并能区分快、中、慢等碎片群体。

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection Figure 1
2026-07-20cs.RO

Embodied Active Learning under Limited Annotation and Navigation Budget for Object Detection

Hadrien Crassous, Mohamed Yassine Kabouri, Minahil Raza, Joni Pajarinen, Riad Akrour

2026-07-20机器人视觉感知

面向机器人进入新环境后目标检测易受域偏移影响、但导航时间和人工标注都受限的问题,论文把模型适配表述为具身批量主动学习。核心思路是用连续视角预测的不一致性衡量潜在错误,既引导机器人探索难检区域,也筛选最值得标注的图像。AI2-THOR/ProcTHOR 仿真和 Spot+YOLOv5 实机实验显示,在相同预算下该信号相比多种基线带来更高的最终检测精度。

Rendering 3D Gaussians on a Graph Processor Figure 1
2026-07-20cs.GR

Rendering 3D Gaussians on a Graph Processor

Nicholas Fry, Ignacio Alzugaray, Mark Pupilli, Paul H. J. Kelly, Andrew J. Davison

Imperial College London, Department of Computing

2026-07-20三维

这篇论文动机在于3D Gaussian Splatting在GPU上受DRAM访问主导,难以适配AR、移动机器人等低功耗在线重建场景。作者首次在仅有片上SRAM的Graphcore IPU上实现3DGS渲染,把帧缓冲分配给1472个tile,并用NEWS网格路由与邻域传播显式搬运高斯,核心洞察是利用屏幕空间局部性替代全局随机访问。实验主要揭示了可行性与瓶颈:跨tile带宽、SRAM容量和负载不均会限制性能并产生瓦片伪影,实际增益更多是架构启发而非成熟加速结论。

More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe Figure 1
2026-07-20cs.CV

More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe

Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel (INSAIT, Sofia University "St. Kliment Ohridski")

2026-07-20视觉语言

这篇论文针对遥感 VLM 过度依赖专用架构的趋势,提出保留通用视觉语言模型结构,通过多任务遥感数据和自适应奖励强化学习来统一问答、描述、检测、定位与分割,并让模型按需调用定位工具。实验显示 MLRS 在多类零样本遥感基准上达到有竞争力或 SOTA 表现,且性能随数据规模和任务多样性提升,说明增益可能主要来自 scaling / data,而非架构创新。

Handwritten and Printed Text Segmentation via Region-Aware Human-Writing Descriptor Engineering Figure 1
2026-07-20cs.CV

Handwritten and Printed Text Segmentation via Region-Aware Human-Writing Descriptor Engineering

Zhixian Lu, Jianwei Zhang, Lei Zhang, Fei Yuan, Jin Wang, Chang Liu, Rui Gao, Qiyu Lei

2026-07-20视觉感知

面向纸质文档数字化中手写与印刷文本分离在边缘设备上计算开销过高的问题,论文用句子级连通域分割先抽取文本片段,再设计区域感知手写描述子,以简单统计量刻画手写波动并接入传统分类器。在自建多语种 MAD-HPTS 和 PHD-AS 上,该方法相对深度基线精度仅低约 1.4%,推理速度提升超过 8 倍,RK3576 部署中还报告约 2% 精度优势和 45% 运行时间下降。

Distributional Matching for Vector Quantization: A Unified Theoretical and Empirical Framework Figure 1
2026-07-20cs.CV

Distributional Matching for Vector Quantization: A Unified Theoretical and Empirical Framework

Xianghong Fang, Litao Guo, Hengchao Chen, Yuxuan Zhang, XiaofanXia, Dingjie Song, Yexin Liu, Hao Wang, Harry Yang, Qiang Sun, Yuan Yuan

University of Toronto, The Hong Kong University of Science and Technology, Boston College, Lehigh University, Southern University of Science and Technology

2026-07-20视觉感知

论文针对视觉标记化中向量量化训练不稳和码本坍塌的问题,指出根源在编码特征分布与码向量分布不匹配,而非单独的 STE 或初始化缺陷。其核心做法是用分布匹配统一约束 VQ,并以 Wasserstein 闭式目标实现,MMD 作为非参数替代也有效。实验在 VQ-VAE/VQGAN 与模拟设置中显示更高码本利用率、困惑度和重建质量,但生成下游收益幅度仍需结合更多任务判断。

HETA++: Global Structure-from-Motion with Hybrid Explicit Translation Averaging Figure 1
2026-07-20cs.CV

HETA++: Global Structure-from-Motion with Hybrid Explicit Translation Averaging

Peilin Tao, Hainan Cui, Mengqi Rong, Shuhan Shen

2026-07-20视觉感知

针对全局 SfM 中平移平均在近共线运动、外点特征轨和旋转误差下易退化的问题,HETA++将相对平移与显式特征轨联合建模,先用全局旋转重估并筛除不一致平移,再以凸距离目标初始化相机与3D点,并用紧凑非双线性角度目标、平衡采样特征轨和BA联合细化。实验称其在顺序与无序真实数据上较HETA、GLOMAP等取得更高精度、鲁棒性和更低耗时。

Orbis 2: A Hierarchical World Model for Driving Figure 1
2026-07-20cs.CV

Orbis 2: A Hierarchical World Model for Driving

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

2026-07-20强化学习

本文针对驾驶世界模型只在单一抽象层次逐帧预测、难以兼顾长时空推理与视觉细节的问题,提出 Orbis 2:用压缩 DINO 表征做高层长时域结构预测,再条件化 VAE 潜空间的低层细节生成,并采用 diffusion forcing 预训练、teacher forcing 微调。实验显示其在长时生成 FVD、反事实转向响应以及语义分割/深度线性探测上达到或超过现有方法,但 diffusion forcing 增益的具体来源文中未充分说明。

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting Figure 1
2026-07-20cs.CV

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

University of Electronic Science and Technology of China, University of Electronic Science and Technology of China Chengdu Sichuan China 611731

2026-07-20视觉语言视觉感知模仿学习三维

本文针对自我视角下视野受限、运动剧烈导致的细粒度三维手部姿态预测困难,提出以手部姿态作为人机动作桥梁的 VL-EHPF 任务。核心思路是用稳定完整的第三视角示范补偿第一视角信息缺失,通过 DERM 重建视频级与帧块级 Exo 表征,再由 GLMM 逐级调制 Ego 特征。实验在 AssemblyHands、Ego-Exo4D、EgoMe-pose 及 CALVIN 上优于现有方法,并显示一定人到机器人迁移能力。

Hardware-triggered Time Synchronization of Roadside Multi-lidar, Multi-camera Measurement System for Accurate Data Alignment Figure 1
2026-07-20cs.CV

Hardware-triggered Time Synchronization of Roadside Multi-lidar, Multi-camera Measurement System for Accurate Data Alignment

Shiva Agrawal, Savankumar Bhanderi, Zhiran Yan, Gordon Elger

2026-07-20视觉感知

面向路侧多激光雷达、多相机在密集交通中因采样时钟和软件延迟导致的数据错位问题,论文提出以激光雷达同步脉冲为基准的开源硬件触发电路,为各相机生成可独立配置的延迟触发。实验通过车辆、自行车、行人投影覆盖率选择最佳延迟,三相机分别约为30、50、65 ms,并展示方案可扩展到车载7相机系统。

MDND: Unsupervised Learning Guided by Non-Differentiable Refinement for Shape Correspondence Figure 1
2026-07-20cs.CV

MDND: Unsupervised Learning Guided by Non-Differentiable Refinement for Shape Correspondence

Qinsong Li, Jing Meng, Haibo Wang, Shengjun Liu

2026-07-20视觉感知

这篇论文针对深度函数映射在形状对应中必须端到端可微、难以利用强非可微细化器的问题,提出 MDND:用非可微迭代细化分支生成伪目标,再以一致性损失训练可微特征分支,并设计结合 LBO 与 ELA 的混合基 HWF 细化器。实验称其在非等距形变和拓扑噪声场景优于 ULRSSM、HybridFMaps 等方法,消融显示主要收益来自混合基细化 oracle。

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture Figure 1
2026-07-20cs.CV

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

Meta Reality Labs

2026-07-20视觉感知

本文针对野外全身动捕依赖笨重多相机或仅用头戴设备信号不够准确的问题,提出让多人佩戴智能眼镜的分布式 EgoExoMoCap:将佩戴者的头部/可选腕部轨迹与他人眼镜中的外视角关键点统一到自我坐标系,并用 DINOv3 上下文特征学习关键点置信度以处理遮挡和出视野。实验在 Nymeria 与 EgoHumans 上优于纯自我或外视角基线,但实时性、形体估计和长时严重遮挡仍未解决。

Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction Figure 1
2026-07-20cs.CV

Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction

Jiazhen Huang, Zhiming Liu, Changhu Wang, Wei Ju, Ziyue Qiao, Xiao Luo

2026-07-20视觉感知

本文针对视觉语言模型测试时转导在真实小批量、类别不均衡场景下易退化的问题,指出缺少锚定和固定收缩强度是关键脆弱性。MOON用vMF混合模型在单位球面建模特征,并借助实例级与类别级零样本先验动态收缩,抑制不可靠分配和异常类更新。实验覆盖11个数据集,ImageNet 10种场景较零样本CLIP提升13.2%,且训练无关、开销较低。

Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation Figure 1
2026-07-20cs.CV

Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation

Dimitrios Karageorgiou, Symeon Papadopoulos, Ioannis Kompatsiaris, Efstratios Gavves

2026-07-20视觉感知

本文针对自回归视频扩散在长时生成中因误差累积而走到“终端点”、后续轨迹失真的问题,提出 TANGO:在测试时让模型前瞻一步,用预测噪声是否符合各向同性高斯来判断轨迹可延续性,并通过受限优化绕开终端点。实验称其在 VBench 上较现有方法绝对提升 3.1%,15 秒视频平均 FVD 降低 28.3%,但计算开销与欠表示主题下的失败仍是限制。

Beyond Frontiers: Scene-Anomaly Guided Autonomous Exploration Figure 1
2026-07-20cs.RO

Beyond Frontiers: Scene-Anomaly Guided Autonomous Exploration

Akash Kumbar, Abhinav Raundhal, Madhava Krishna

Robotics Research Center, IIIT-Hyderabad, India † \dagger Project page: https://beyondfrontiers.github.io

2026-07-20视觉感知

这篇论文针对传统自主探索只追逐未知空间、忽视结构上下文而导致重建细节不足的问题,提出将探索重定义为“几何异常最小化”:用基于 Point Transformer V3 的 Δ-Net 从局部点云学习室内结构先验,在线检测破碎墙面、遮挡家具等异常并生成视角。实验称 SCAGE 在各场景约达 90% 覆盖率,相比基线覆盖提升约 15%,重建误差约减半。

Examining the Associations between Visual and Non-Visual Elements and Cyclists' Route Choices for Various Trip Purposes Figure 1
2026-07-20cs.CV

Examining the Associations between Visual and Non-Visual Elements and Cyclists' Route Choices for Various Trip Purposes

Heyang Hua, Koichi Ito, Filip Biljecki

2026-07-20三维

本文关注不同出行目的下骑行者为何偏离最短路径,弥补以往路线选择研究较少同时纳入街景视觉感知、社会经济与二维建成环境因素的不足。研究以蒙特利尔带目的标注的GPS骑行轨迹为基础,结合街景深度学习特征比较实际路径与最短路径。结果显示,通勤、运动、休闲等目的对应的空间偏好不同,实际路径通常有更多绿化和行人/骑行活动、更少机动车与天空暴露;但视觉模型相对非视觉模型拟合增益有限,可能存在特征过多导致的过拟合。

HybridSim: A Physics-Learning Hybrid Digital Twin for mmWave Human Sensing Figure 1
2026-07-20cs.CV

HybridSim: A Physics-Learning Hybrid Digital Twin for mmWave Human Sensing

Weitao Xiong, Tianyu Liu, Peng Li, Kok Chung Chua, Toa Chean Khim, Pu Wang, Hongfei Xue

2026-07-20视觉感知

针对毫米波人体感知中真实标注数据昂贵、动态人体仿真又难兼顾微多普勒细节与室内多径的问题,HybridSim 将传播解耦为直接反射和间接多径:前者用带微表面 BRDF 的逆渲染建模,后者用几何约束 3DGS 与虚拟接收器学习场地特定干扰。固定房间实验显示,其信号更接近物理参考,并能通过数据增强提升下游人体活动识别表现。

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation Figure 1
2026-07-20cs.CV

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

Stefano Silvestrini, Michele Ceresoli

2026-07-20视觉感知

本文针对事件相机多模态自运动估计中“学习模型是否仍编码几何”的问题,分析融合事件、IMU与测距信号的交叉注意力网络。核心洞察是几何并未消失,而是部分摊销到潜空间:嵌入呈低维流形并与速度变量对齐,注意力随角运动和视觉可靠性调整,嵌入范数与马氏距离还能提示高误差窗口;但文中未给出严格可观测性或稳定性保证。

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion Figure 1
2026-07-20cs.CV

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

Oussama Berhili, Yassine Ouzar, Larbi Boubchir

2026-07-20视觉语言视觉感知

论文面向视频中的犹豫/矛盾情绪识别,动机是这类状态常同时体现在措辞、语音韵律和面部微表情中,单一模态难以捕捉冲突线索。方法保留三模态时序 token,用双向跨注意力建模模态间关系,并用门控融合抑制噪声模态;在 BAH 数据上,文本单模态 Macro F1 为 0.6659,多模态验证集达到 0.7394,较最佳单模态提升约 11%。

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding Figure 1
2026-07-20cs.CV

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

2026-07-20视觉感知

长视频理解受限于视觉 token 预算,常规抽帧或先选关键帧再细看容易漏掉分散事件并放大定位错误。MoD-VLLM 将相关/无关片段 grounding 与动态粒度反思闭环结合,对正片段细编码、负片段粗编码,并用强化学习联合优化定位策略和表示;在多项长视频基准及自建 MEventBench 上超过已有方法。

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation Figure 1
2026-07-20cs.CV

SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation

Yilai Liu, Xin Zhang, Shiyuan Zhang, Hongyang Du

The University of Hong Kong, Tsinghua University

2026-07-20视觉感知

这篇论文针对叙事长视频生成中角色跨场景、长间隔重现时容易身份漂移的问题,提出 SlotMem:不再保存整帧关键帧记忆,而是用角色可寻址的紧凑 slot 表示身份特征,并通过角色语义探针、记忆编码器、保守写入器和角色级交叉注意力进行定位、更新与注入。实验显示其在多角色长视频基准上提升长期角色一致性,同时视频质量大体保持相当。

GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing Figure 1
2026-07-20cs.CV

GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

Yujie Li, Jiancheng Pan, Zhiwei Wei, Jiuniu Wang, Mugen Peng, Wenjia Xu

Beijing University of Posts and Telecommunications, Tsinghua University, Hunan Normal University, City University of Hong Kong, Beijing University of Posts and Telecommunications Haidian Beijing China, Tsinghua University Haidian Beijing China, Hunan Normal University Changsha Hunan China, City University of Hong Kong Hong Kong China

2026-07-20数据集/基准

论文针对遥感长期序列中现有MLLM只能做静态或双时相理解、缺少能力诊断的问题,提出ChronoBench按地物感知、变化识别、长期记忆和时空推理分解评测,并据此设计GeoChrono:用位置固定而语义演化的先验构造时间轨迹编码器,同时用粗到细压缩保留动态区域。结果显示长期记忆是主要瓶颈,GeoChrono在ChronoBench达78.34%准确率,较领先商业MLLM高20%以上,压缩模块减少56%以上视觉token且保留94.6%性能。

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging Figure 1
2026-07-20cs.CV

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

Xidian University, Xidian University Xi’an China, Xidian University Xian China

2026-07-20视觉感知

这篇论文针对个性化图像美学评估中用户标注少、审美差异并非均匀出现在所有图片上的问题,提出 PRAC:先挖掘更能暴露个人偏好的样本,再按偏好嵌入寻找审美相近人群并进行模型合并。核心洞察是利用“争议性图片”和“同好群体”提高少样本个性化效率。四个 PIAA 基准实验显示其优于既有方法,并能给出审美判断理由。

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling Figure 1
2026-07-20cs.CV

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

Bo-An Chang, Yu-Chih Chen

2026-07-20视觉感知强化学习数据集/基准

本文针对文生图评估中隐性文化规范被低估、VQA式评测推理成本高的问题,提出基于4.2B MLLM的隐式文化对齐奖励模型,用文化探针和SkipCA让高层语义重新关注早期视觉细节,并以成对排序训练输出标量奖励。在CulturalFrames的3323对图像上达到80.54%成对准确率,优于GPT-4o和VQAScore,单次评估约0.21秒。

The Third Competition on Document Forgery Detection on ID-Cards and Passports Figure 1
2026-07-20cs.CV

The Third Competition on Document Forgery Detection on ID-Cards and Passports

Juan E. Tapia, Mario Nieto, Juan M. Espin, Álvaro S. Rocamora, Javier Barrachina, Naser Damer, Christoph Busch

Fraunhofer Institute for Computer Graphics Research IGD, Darmstadt, Germany, Department of Computer Science, TU Darmstadt, Darmstadt, Germany, Incode Technologies Inc., USA, 6 ID VisionCenter (IDVC), Santiago, Chile, University of Ljubljana,Ljubljana, Slovenia, L3i, La Rochelle University, La Rochelle, France

2026-07-20视觉感知

面对生成式工具和远程开户场景带来的证件伪造升级,本文报告第三届身份证与护照伪造检测竞赛,新增护照并设置合成数据受限与开放商业场景两条赛道。核心洞察是PAD不仅看准确率,更取决于跨攻击类型和成像条件的一致鲁棒性;Incode两赛道均领先,Track 1 AVRank为27.82%,Track 2为68.71%,但复合攻击仍最难,模型规模与鲁棒性未呈明显相关。

IoUPD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models Figure 1
2026-07-20cs.CV

IoUPD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models

Xiuyuan Zhu, Ke Lu, Hao Wu, Zijin Du, Dongming Zhang, Jian Xue

University of Chinese Academy of Sciences, Beijing, China, State Key Laboratory of Communication Content Cognition, Beijing, China, Peng Cheng Laboratory, Shenzhen, Guangdong, China

2026-07-20视觉语言

本文针对多模态大模型把视觉定位转成坐标文本生成时“按 token 训练、按 IoU 评测”的错位问题,提出 IoU-PD:训练阶段用真值框构造带框教师输入,将框从答案标签扩展为特权视觉提示,并用 SFT 锚定加几何重要性与教师可靠性加权的蒸馏损失训练学生。推理时仍只需原图和文本提示,无额外模块;在标准指代表达定位基准上相对强坐标生成基线取得一致但文中承认幅度中等的区域级提升。

Event3R: Asynchronous-to-Global 3D Reconstruction from Event Camera via Spatial-Temporal Feature Aggregation Figure 1
2026-07-20cs.CV

Event3R: Asynchronous-to-Global 3D Reconstruction from Event Camera via Spatial-Temporal Feature Aggregation

Jian Huang, Haotian Shen, Xinhao Lou, Chengrui Dong, Wenpu Li, Peidong Liu

2026-07-20三维

Event3R针对事件相机异步、稀疏且缺少大规模标注数据,难以套用DUSt3R式全局三维重建的问题;核心做法是把事件流体素化为空时bin,用时间注意力聚合运动线索,并以Masked Bin Modeling自监督预训练、对比对齐和一致性损失强化跨视图结构。实验称其在合成与真实基准上实现更稳健、时间一致的全局点云重建,优于既有事件三维方法。

Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance Figure 1
2026-07-20cs.CV

Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance

Euijun Jung, Youngki Lee

Seoul National University

2026-07-20视觉感知规划控制

本文针对文本到动作生成中“动作会出现但每一击何时落下、用哪侧肢体、出现几次不可控”的问题,将单个 stroke 抽象为 Action Unit,显式编码肢体轨迹、类别、时间窗和核心帧,并用轻量门控适配器接入冻结骨干,再以检测器梯度修正推理时序。StrokeBench 上其 per-stroke F1 明显高于 caption、interval/frame text 和轨迹基线,同时保持相近运动质量,核心帧也表现出一定可控性。

Efficient Difficulty-Aware Dynamic Routing for Diffusion-Based Real-World Image Super-Resolution Figure 1
2026-07-20cs.CV

Efficient Difficulty-Aware Dynamic Routing for Diffusion-Based Real-World Image Super-Resolution

Xue Wu, Kang Zhao, Kafeng Wang, Jianfei Chen, Jingwei Xin, Nannan Wang, Xinbo Gao

2026-07-20视觉感知生成模型强化学习

这篇论文针对扩散式真实图像超分中“所有样本走同一推理路径”和 Stable Diffusion VAE 过度下采样损失细节的问题,提出按恢复难度动态路由的 DDR-SR:用难度估计器将图像分配给不同容量、不同 VAE 压缩比的专家网络,简单样本省算力,困难样本保留更多高频信息。实验称其相比现有 SD 超分方法取得更好的质量与效率权衡,但具体增益在多大程度来自路由、VAE 压缩比或模型容量变化仍需看消融细节。

GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking Figure 1
2026-07-20cs.CV

GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking

Youngho Kim, Hoonhee Cho, Jae-Young Kang, Kuk-Jin Yoon

2026-07-20视觉感知强化学习

这篇论文针对事件相机特征跟踪中固定时间窗难以同时适应低运动、突变和高速运动的问题,将事件累积建模为在线序贯决策,用强化学习代理根据运动线索选择继续累积或触发跟踪推理。方法以插件形式接入现有跟踪器,并引入动态运动分布的 DEFT 数据集;实验显示其相较手工启发式窗口在动态场景下更稳健,并在精度与效率之间取得更好折中。

Hierarchical Specialised Ensembles for Classification of Zebrafish Phenotypes Using the Selected Image Recognition Methods Figure 1
2026-07-20cs.CV

Hierarchical Specialised Ensembles for Classification of Zebrafish Phenotypes Using the Selected Image Recognition Methods

Piotr S. Maciąg, Monika Maciąg, Magdalena Majdan

2026-07-20视觉感知

本文面向斑马鱼胚胎毒理实验中人工表型判读耗时且主观的问题,比较三种两阶段层级集成:先区分 Normal、Chorion、Dead、Other,再对 Other 做多标签缺陷识别。核心洞察是第二阶段既不过度泛化也不过度拆成二分类器时更稳;在 ResNet18、ViT、ConvNeXt 对比中,ConvNeXt 整体最佳,专门化层级集成的 F1 平衡性最好,但增益来源是否主要来自骨干 scaling / data 文中未充分说明。

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors Figure 1
2026-07-20cs.CV

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

2026-07-20视觉感知

长视频问答受限于 MLLM 上下文和视觉 token 预算,关键在于测试时从大量帧中选出与问题相关的少量证据帧。论文提出 DAFS,利用小型 MLLM 在非生成前向中的跨模态注意力作为帧相关性信号,并用动态规划联合分配候选帧数和每帧 token 预算。实验显示在 32 帧预算下,Video-MME 相比均匀采样最高提升 6.4 分,并优于若干训练式选择器,且可迁移到不同选择器、回答器和任务。

PE-Field 4D: Video Generation Models as Canvas Figure 1
2026-07-20cs.CV

PE-Field 4D: Video Generation Models as Canvas

Yunpeng Bai, Haoxiang Li, Qixing Huang

University of Texas at Austin, University of Texas at Austin USA

2026-07-20视觉感知

本文针对视频扩散 Transformer 在相机运动和视角变化下难以保持几何结构的问题,将 PE-Field 从图像扩展到 4D 视频编辑。核心洞察是把扭曲位置编码视为几何路由信号,通过几何感知交叉注意力、目标视角重投影位置编码和深度消歧,让生成 token 从对齐的参考帧区域取内容。实验称在相机重轨迹、新视角视频合成和几何编辑中优于现有方法,但代价是更多上下文 token,且效果依赖深度与位姿估计质量。

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach Figure 1
2026-07-20cs.CV

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

Work done during an internship at MedAI Technology (Wuxi) Co. Ltd.

2026-07-20视觉语言数据集/基准

这篇论文针对医疗 LVLM 中多个按模态 LoRA 专家部署成本高、合并方法缺少系统评测的问题,构建覆盖 8 类医学影像和 16 个专家模型的 MergeMedBench。核心洞察是少量“主导参数”对行为更敏感,因此 winner-take-all 在每个 LoRA 位置保留最强参数而非平均。实验显示该方法在平均准确率上明显优于已有合并策略,且可与子空间方法结合带来增益。

Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents Figure 1
2026-07-20cs.CR

Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents

Halima Bouzidi, Mboutidem Ekemini Mkpong, Mohammad Abdullah Al Faruque

University of California, Irvine

2026-07-20视觉语言

本文关注多模态智能体把历史图像无条件写入长期记忆所带来的安全风险:看似正常的图片可在嵌入空间中被推向攻击者指定语义,进而长期污染后续回答。作者提出黑盒、仅改动图像的 Lucid,区分上下文内记忆投毒与无上下文记忆注入,并在五类记忆后端上验证,平均攻击成功率分别达 61.6% 和 58.4%,说明问题来自记忆管线的结构性信任假设。

CSS-BA: Gate-Guided Column Space Search for Bundle Adjustment Figure 1
2026-07-20cs.CV

CSS-BA: Gate-Guided Column Space Search for Bundle Adjustment

Ayano Kaneda, Takafumi Taketomi, Shugo Yamaguchi, Shigeo Morishima

Waseda University, Tokyo, Japan CyberAgent, Inc., Tokyo, Japan

2026-07-20视觉感知

针对低视差、近纯旋转场景中传统 Schur-LM 束调整虽能压低重投影误差却易给出不可靠位姿和焦距的问题,CSS-BA 不改目标函数和变量集,而用几何门控选择高信息相机块,在列空间低维子空间内限制更新方向。实验显示其在弱几何 PhoneSweep 等场景提升相对位姿精度、稳定优化,并在部分困难设置降低焦距误差,但良好条件下收益较有限且有子空间构造开销。

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse Figure 1
2026-07-20cs.CV

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Shanghai Jiao Tong University, Shanghai AI Laboratory, Tsinghua University, University of Science and Technology Beijing, Shanghai AI Laboratory, Shanghai Jiao Tong University, Shanghai AI Laboratory Shanghai China, Tsinghua University Beijing China, University of Science and Technology Beijing Beijing China, Shanghai AI Laboratory Shanghai China

2026-07-20生成模型

DiTango针对DiT扩散模型在长视频/高分辨率生成中推理慢、跨节点并行受通信瓶颈限制的问题,指出CP序列分区的注意力贡献具有明显空间局部性:近邻分区更重要、远端分区贡献较小。它据此将分区重要性与层级通信拓扑对齐,通过锚点引导选择规划器在部分注意力计算和历史attention state复用之间取舍。实验显示其在多节点上最高获得1.9倍端到端加速和3.2倍注意力加速,同时生成质量接近现有方法。

BCG-Former: Toward Pareto-Efficient Hyperspectral Image Classification via Band-Contextual Gating Figure 1
2026-07-20cs.CV

BCG-Former: Toward Pareto-Efficient Hyperspectral Image Classification via Band-Contextual Gating

Gaurav Sharma, Eungjoo Lee

2026-07-20视觉感知

面向无人机和小型星载平台上的高光谱图像分类,本文关注精度之外的延迟与参数预算。BCG-Former以轻量CNN-Transformer为骨架,通过波段上下文门控自适应重标定光谱通道,并用光谱汇总token、单次Band-RoPE和线性注意力联合建模光谱-空间关系。八个空载与无人机数据集上总体精度为91.51%至99.49%,延迟0.91至0.95ms、参数0.10至0.23M,消融显示BCG贡献最大。

STSBench: A Large-Scale Dataset for Modeling Neuronal Activity in the Dorsal Stream of Primate Visual Cortex Figure 1
2026-07-20q-bio.NC

STSBench: A Large-Scale Dataset for Modeling Neuronal Activity in the Dorsal Stream of Primate Visual Cortex

Ethan B. Trepka, Ruobing Xia, Shude Zhu, Sharif Saleki, Danielle Abreu Lopes, Stephen J. Niño Cital, Konstantin F. Willeke, Mindy Kim, Tirin Moore

Neuroscience Interdepartmental Program, Stanford University, Stanford, CA, Department of Neurobiology, Stanford University, Stanford, CA, Howard Hughes Medical Institute, Stanford University, Stanford, CA, Department of Opthalmology, Stanford University, Stanford, CA

2026-07-20数据集/基准

本文针对灵长类视觉背侧通路缺少大规模自然刺激单神经元数据、导致编码模型发展滞后的问题,发布STSBench:记录两只猕猴STS中2244个神经元对约4500段自然视频的反应。其核心价值主要来自数据规模扩展,并用于系统比较背侧通路编码模型与神经活动到视觉输入的重建;结果显示端到端5层3D CNN优于多种基线,扩散式重建也能恢复部分视觉内容。

StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling Figure 1
2026-07-20cs.CV

StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

Jianing Peng, Mengyu Wang, Henghui Ding, Zixiang Li, Ting Liu, Xiaochao Qu, Luoqi Liu, Yao Zhao, Yunchao Wei

Institute of Information Science, Beijing Jiaotong University, Beijing, China, Institute of Big Data, Fudan University, Shanghai, China, Visual Intelligence + X International Joint Laboratory of the Ministry of Education, Beijing, China, Beijing Academy of Artificial Intelligence, Beijing, China, MT Lab, Meitu Inc, Beijing, China

2026-07-20视觉感知

论文针对多参考图像生成中自然语言指令冗长、指代含混以及高质量训练数据稀缺的问题,提出 StructGen:用类似字典的结构化上下文为参考图像分配标识符,并以标识符组织组合意图,同时基于真实图像构建结构化数据和评测集。实验显示其在公共与自建多参考基准上提升语义对齐、主体一致性和人脸身份保持,复杂多参考场景收益更明显。

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification Figure 1
2026-07-20cs.CV

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

2026-07-20视觉语言视觉感知

这篇论文针对乳腺钼靶中病灶面积很小、全图 CLIP 式对齐容易稀释恶性判别线索的问题,提出先检测定位再做区域-文本对比学习的框架:用 ROI 特征对齐由影像元数据构造的结构化描述,并加入语义难负样本和背景抑制,再联合轻量检测头进行分类。实验在 CBIS-DDSM 与 VinDr-Mammo 的域内、跨数据集和迁移设置下优于相关方法,说明区域级语义落地比全局嵌入更适合小病灶判别。

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation Figure 1
2026-07-20cs.CV

Benchmarking MRI Representations for Deep Learning-Based Focal Cortical Dysplasia Segmentation

Soumen Ghosh, John Phamnguyen, Amit Soni Arya, Subhojit Mandal, Tilottama Goswami, Rajat Vashistha

2026-07-20视觉感知数据集/基准

这篇论文关注FCD病灶在常规MRI中细微、异质,导致深度分割难以稳定定位的问题;其核心不是换网络,而是在同一nnU-Net、预处理和五折验证下系统比较T1w、FLAIR、T1w/FLAIR、FLAIR/T1w及组合输入。结果显示FLAIR是最佳单模态,比例图单独不可靠,但与T1w+FLAIR联合可改善边界,四通道配置Dice达0.376,较常规双模态提升约5%。

WREN: Low Light Image Enhancement Using Retinex theory-based Double U-Net-like Structures Figure 1
2026-07-20cs.CV

WREN: Low Light Image Enhancement Using Retinex theory-based Double U-Net-like Structures

Reina Kaneko, Junya Hara, Hiroshi Higashi, Yuichi Tanaka

2026-07-20视觉感知学习理论

面向夜间监控、救援等低照视觉中易过曝、过平滑且对动态范围敏感的问题,WREN按Retinex假设将反射与照明分离,只对照明图用第二个U-Net式网络、Transformer、注意力和可训练引导滤波增强,并用尺度不变损失端到端训练。多数据集实验报告在失真和结构指标及视觉质量上达到SOTA,但具体增益中各模块贡献仍需看消融支撑。

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth Figure 1
2026-07-20cs.CV

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth

Jung-Hee Kim, Xiaoming Liu

2026-07-20视觉感知

本文针对单目度量深度估计的尺度歧义:多视图模型能借助跨视图几何获得稳定尺度,但单图推理时注意力结构退化。作者提出 EpiDistill,用深度引导极线注意力训练多视图教师,并以可学习的 Rectified Stereo Tokens 将极线几何蒸馏到单目 ViT 模型。实验显示该方法可提升 UniDepthV2、DepthPro 等零样本度量深度表现,在 ETH3D、DIODE 和 ScanNet++ 等需尺度对齐的数据上改进明显。

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models Figure 1
2026-07-20cs.CV

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

2026-07-20视觉语言视觉感知

本文针对视觉问答中“问题应放在图像前还是后”的提示顺序矛盾:问题前置虽能引导图像表征关注相关概念,却因远离答案位置而难被解码器读取。作者提出免训练的“问题回声/图像回声”提示,在图像前后重复问题并可重呈图像,同时保留感知引导与答案读出。实验覆盖五个开放 VLM,在 NaturalBench、POPE、Winoground 和 VQAv2 上弥合问题前置劣势,Winoground 最高提升约 19 个组准确率点。

Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference Figure 1
2026-07-20cs.CV

Are All Tokens Necessary for Visual Place Recognition? An Empirical Study of Token Reduction for Efficient Inference

Tong Jin, Yunpeng Liu, Shuyu Hu, Qinghua Zhang, Ruize Han, Song Wang, Feng Lu

2026-07-20视觉感知

面向移动机器人、SLAM等实时视觉地点识别场景,论文关注ViT/Foundation Model处理全部视觉token带来的计算瓶颈。其核心不是提出单一新模型,而是构建首个VPR token reduction系统基准,在统一免训练框架下比较剪枝、合并及混合方法,并分析保留率、插入层、查询/库端配置和边缘部署等因素。实验显示VPR存在明显token冗余,最多可降29%计算量、提44%吞吐,识别精度下降低于1%。

When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models? Figure 1
2026-07-20cs.CV

When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?

Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He, Leonid Sigal

University of British Columbia, Vector Institute

2026-07-20视觉语言视觉感知

本文关注零样本3D CT视觉语言模型在跨机构、多标签异常诊断中是否适合测试时自适应,指出TTA并非总有益,前提是保留体数据深度结构且基础表征已能区分阳性/阴性。核心方法CARVE按每个病例估计阳性标签数,用基数感知的top-k熵目标和保留视图更新,避免普通熵最小化压制共现异常。实验显示其在CT-CLIP、fVLM及多标签、三分类、二分类任务中更稳定提升,但严重外部分布偏移下主要受基础模型迁移能力限制。

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting Figure 1
2026-07-20cs.CV

ImprovedVBGS: Real-time Continual Variational Bayes Gaussian Splatting

Damani Mguni-Coker

2026-07-20三维

面向机器人和自主导航中的在线三维重建,论文指出原始 VBGS 虽能无回放地持续学习,但每帧需遍历所有点与高斯分量,延迟过高。ImprovedVBGS 用 KD-tree 空间截断变分 E 步,并将重分配限制在截断候选内、通过静态填充避免 JAX 动态重编译。在 NeRF Synthetic 上,RTX 3070 Ti 平均延迟由 84.0 秒降至约 0.050 秒,Lego 消融显示质量基本维持在约 21 dB PSNR。

E3DGS: Unified Geometric-Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding Figure 1
2026-07-20cs.CV

E3DGS: Unified Geometric-Photometric Equivariance for 3D Gaussian Splatting via Color-as-Geometry Embedding

Chankyo Kim, Maani Ghaffari

University of Michigan, Ann Arbor, MI, USA

2026-07-20三维

这篇论文针对3D Gaussian Splatting中几何属性与球谐颜色在旋转下变换规则不一致、导致等变学习常被迫丢弃视角相关外观的问题,提出将SH 0-2阶颜色系数嵌入3×3矩阵载体,把光度也视为几何张量,并用统一共轭变换构建SE(3)等变网络。实验覆盖物体识别与动作条件高斯世界模型,显示在相机姿态变化下更稳健且标签效率更高,但高阶SH的实际效果仍留待验证。

Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection Figure 1
2026-07-20cs.CV

Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection

Sodtavilan Odonchimed, Tsogt Enkhbayar, Oyunzul Munkhtamga, Munkhjargal Gochoo

2026-07-20视觉感知生成模型

本文针对城市监控中洪水样本稀缺、鱼眼镜头畸变使传统灾害仿真和识别难以直接适用的问题,提出 PhysFlood:先用 Unik3D、SAM3 与鱼眼地面分割估计具有物理含义的水位掩码,再用扩散 inpainting 从单张正常鱼眼图生成可控洪水场景。实验主要为定性和人工评价,显示生成结果具备一定真实感和鲁棒性,但文中未充分说明对检测模型的实际增益。

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification Figure 1
2026-07-20cs.CV

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

Bibesh Pyakurel, M. G. Sarwar Murshed

2026-07-20视觉语言数据集/基准

针对四指SLAP指纹在边检等高风险身份核验中重要但缺少MLLM评测的问题,论文构建SLAPBench:基于NIST SD302b生成7832个验证对,并比较多模型与三类提示。核心洞察是提示会显著诱发“全判同一人”的正偏置崩塌,连续相似度评分可缓解但不能创造判别能力;Claude得AUC 0.953、EER 11.8%,Qwen3满分更可能暴露近重复/协议风险而非真实生物识别能力。

Intentional Electromagnetic Interference Attacks on Facial Recognition Figure 1
2026-07-20cs.CV

Intentional Electromagnetic Interference Attacks on Facial Recognition

Tyler Fitzsimmons, Adam Czajka

† Department of Computer Science and Engineering, University of Notre Dame, Notre Dame, IN 46556, USA, ‡ Naval Surface Warfare Center, Crane Division, Crane, IN 47522, USA

2026-07-20视觉感知

面部识别逐渐用于门禁与移动设备,论文关注传统数字对抗和呈现攻击之外的相机硬件层风险。作者用常见射频设备对手机前摄施加 intentional EMI,在黑盒、低成本条件下诱发图像条纹伪影,并测试多种人脸匹配器;结果显示在 FMR 0.1%-5% 下 FNMR 可升至 100%,同时发布50人干净/受扰视频数据集和仿真增强代码。

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4 Figure 1
2026-07-20cs.CV

LLM-Driven AutoML for Cross-Lingual Handwritten OCR: Closed-Loop Neural Architecture Search with GPT-5, GPT-4o, and Claude Sonnet 4

Mobina Kashaniyan, Amirhossein Ghassemi, Nasser Mozayani

2026-07-20视觉感知

针对跨文字体系手写 OCR 依赖专家设计架构、难以快速迁移的问题,论文让 GPT-5、GPT-4o 和 Claude Sonnet 4 在闭环 AutoML 中生成、训练评估并据反馈迭代 CNN/Transformer 等模型配置。实验覆盖阿拉伯语、英语和波斯语,每种语言 30 次试验,平均测试准确率超过 93%,推理速度满足实时需求;但作为 arXiv 预印本,数据划分、公平基线和成本控制仍需进一步核验。

Trajectory-aware Cross-view Geo-localization with Sequential Observations Figure 1
2026-07-20cs.CV

Trajectory-aware Cross-view Geo-localization with Sequential Observations

Tianyi Gao, Jiayu Lin, Danielle Beaulieu, Nathan Jacobs

2026-07-20规划控制

该文面向城市机器人在 GPS 受遮挡时的跨视角定位问题,指出现有序列方法多依赖视频而忽略人机协作中常见的路线描述。作者构建约 3.9 万组视频-文本-卫星图三元组 SeqGeo-VL,并提出同时处理视频和文本查询的 TrajLoc,以及用轨迹几何调制表征的 TrajMod。实验显示其在视频和文本地理定位上均优于既有方法,且消融表明时序与空间关系对检索显著有用。

qZACH-ViT: Quantization-Aware Intrinsic Explanations with Recursive Attribution-Stabilized Optimization Figure 1
2026-07-20cs.LG

qZACH-ViT: Quantization-Aware Intrinsic Explanations with Recursive Attribution-Stabilized Optimization

Athanasios Angelakis

BioML Lab, Research Institute CODE, UniBw, Munich, Germany

2026-07-20优化算法

这篇论文针对量化部署中“预测保留但解释证据可能漂移”的问题,在无CLS、无位置编码的ZACH-ViT上加入W8A8量化感知训练和可递归重构logit的内生patch证据,并提出RASO用梯度范数匹配与冲突投影保护分类目标。七个MedMNIST低样本任务中,INT8 ONNX模型相对FP32基线平均提升约0.0313,RASO提升约0.0368,预测一致率达99.9751%,解释图也高度保持;但部署仍是混合精度,RASO并非所有预测或XAI指标最优。

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings Figure 1
2026-07-20cs.AI

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

Louisiana State University, Equal contribution † Work done during graduate studies at the University of Illinois Urbana-Champaign., University of Illinois Urbana-Champaign

2026-07-20强化学习数据集/基准

这篇论文针对通用多模态模型在土木/施工图纸这类高密度工程文档上缺乏真实评测的问题,提出 DrawingVQA:用 33 张 IFC 施工图和 92 个专家问答覆盖感知、上下文解释与专家推理,并用工程任务与模型能力双轴分析。结果显示现有模型与专业人员差距明显,尤其在高层推理、精确空间定位、数量统计和跨图索引上容易失败,说明通用榜单成绩难以直接转化为工程工作流能力。

Dataset-Origin Signatures and Shortcut Learning in Screening Mammography AI: A Cross-Dataset Case Study Figure 1
2026-07-20cs.CV

Dataset-Origin Signatures and Shortcut Learning in Screening Mammography AI: A Cross-Dataset Case Study

Parham Hajishafiezahramini, Matthew Hamilton, Oscar Meruvia-Pastor, Edward Kendall

2026-07-20数据集/基准

这项研究针对乳腺筛查 AI 中“外部阳性病例越多越好”的常见假设,检验真实低患病率筛查数据与异常富集公开数据混合训练的效果。核心洞察是,即使统一预处理,数据集来源特征仍会被模型强烈捕捉,形成捷径学习。实验显示 NLBSD 单独训练 AUC 为 0.737,加入 CBIS-DDSM/CMMD 阳性样本后降至 0.620–0.644,且来源越多退化越明显。

Explicit Over Implicit: Enhancing CNNs Via Complex Structure Tensor Representations for Periocular Recognition Figure 1
2026-07-20cs.CV

Explicit Over Implicit: Enhancing CNNs Via Complex Structure Tensor Representations for Periocular Recognition

Kevin Hernandez-Diaz, Josef Bigun, Fernando Alonso-Fernandez

2026-07-20视觉感知

本文针对CNN在有限训练数据下难以稳定学习眼周纹理方向特征的问题,提出将复结构张量作为显式方向先验输入CNN,用小型复值卷积模块提取带置信度的紧凑方向表示。实验在Cross-Eyed和PolyU眼周识别数据集、开放/封闭场景和六种CNN上进行,较灰度输入降低5%至26%的EER,并显示较小网络也可超过完整CNN;但具体增益中有多少来自特征先验、模型缩小或训练设置,文中未充分说明。

GS-RealBlur: A Flexible Data Acquisition Framework for Real-World Image Deblurring Figure 1
2026-07-20cs.CV

GS-RealBlur: A Flexible Data Acquisition Framework for Real-World Image Deblurring

Mingyang Chen, Zhilu Zhang, Honglei Xu, Renlong Wu, Xiaohe Wu, Wangmeng Zuo

2026-07-20视觉感知强化学习

论文针对去模糊训练数据中“合成模糊不真实、真实采集设备复杂且不便扩展”的矛盾,提出 GS-RealBlur:用手持设备采集真实模糊帧、云台采集清晰帧,并借助 3D Gaussian Splatting 渲染对齐的清晰对应图像;BPR 通过外观一致性和质心约束细化模糊帧位姿。基于该流程构建的 13,209 对数据训练 NAFNet,在跨数据集和野外测试上优于现有合成及真实数据集训练结果,增益可能主要来自更真实且更多样的数据。

Unsupervised Keypoints for Real-Time Fall Detection: Comparative Analysis Under Real-world Conditions with Predictive Bandwidth Reduction Figure 1
2026-07-20cs.CV

Unsupervised Keypoints for Real-Time Fall Detection: Comparative Analysis Under Real-world Conditions with Predictive Bandwidth Reduction

Tasmiah Haque, Jacob Kosinski, Sumit Mohan, Srinjoy Das, Mohammad Abdullah Al-Mamun

Department of Industrial and Management Systems Engineering, West Virginia University, Lane Department of Computer Science and Electrical Engineering, School of Mathematical and Data Sciences, School of Systems Science and Industrial Engineering, Binghamton University

2026-07-20视觉感知强化学习

本文针对居家/医疗场景中跌倒监测受隐私、带宽和遮挡限制的问题,提出在本地提取无监督运动关键点、远端用循环预测与序列分类检测跌倒的框架。核心洞察是解剖学姿态精度未必等于部署鲁棒性:全身清晰时监督关键点更强,但在遮挡评测中监督方法漏检近半跌倒,无监督关键点保持更高敏感性,且在带宽受限预测设置下优势更明显。

Partial Information Decomposition as a Multi-Contrast 3D MRI Selection Strategy for Resource-Constrained Deep Neural Network Training in Brain Tumor Segmentation Figure 1
2026-07-20cs.CV

Partial Information Decomposition as a Multi-Contrast 3D MRI Selection Strategy for Resource-Constrained Deep Neural Network Training in Brain Tumor Segmentation

Agamdeep Chopra, Mehmet Kurt

Department of Mechanical Engineering, University of Washington, Seattle, WA, USA

2026-07-20视觉感知三维

这篇工作针对多对比度三维MRI脑肿瘤分割中全序列训练成本高的问题,提出在正式训练前用部分信息分解评估序列对的冗余、独有与协同信息,从而选择更紧凑的输入。方法选出T1c+T2-FLAIR;在11个轻量3D U-Net配置中,该组合是最佳双输入,平均Dice为0.676,接近四输入模型0.687,并得到Shapley分析支持。

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning Figure 1
2026-07-20cs.CV

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

Department of Computer Science, Code and models will be available at https://github.com/sajeedmehrab/op-hrg., the image region named by a free-form query. The strongest publicly available

2026-07-20视觉语言强化学习

这篇论文针对 MLLM 在视觉定位中容易把“部件”误定位为整个父物体的问题,提出 OP-HRG:先判断查询是物体还是部件,再定位父物体、细化部件框,并用自检与裁剪重编码辅助修正;训练上用分阶段的 part-aware GRPO 奖励约束父物体、部件包含关系和改进幅度。实验显示 4B 模型在 PascalPart、PartImageNet 和 InstructPart 上超过若干 7B grounding LLM 与 SAM3,并可迁移到 reasoning segmentation。

Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark Figure 1
2026-07-20cs.CV

Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark

Silas kwabla Gah, Ebenezer Owusu

2026-07-20视觉感知数据集/基准三维

这篇论文针对广义少样本3D点云分割依赖基类3D标注、逐任务训练和支持集的问题,提出完全免训练的开放词汇方案:用冻结RegionPLC给出密集先验,用SAM3按新类名称在多视角RGB中分割并投影到点云,再以跨视角一致性决定是否覆盖为新类。核心洞察是少样本支持在一致性约束后并不带来额外收益。ScanNet200上新类mIoU提升2.6且基类几乎不降,ScanNet++上新类mIoU从16.2升至31.9。

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories Figure 1
2026-07-20cs.RO

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

Xiaomi Robotics Team : Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen, Wenlong Chen, Xinze He, Bin Li, Qing Li, Zhuorong Li, Heng Qu, Wenxuan Song, Diyun Xiang, Yifan Xie, Peiran Xu, Hangjun Ye, Wen Ye, Han Zhao, Quanyun Zhou

2026-07-20机器人视觉语言视觉感知强化学习

这篇论文针对机器人策略难以像大模型一样受益于规模化数据的问题,提出 Xiaomi-Robotics-1:先用 10 万小时以上真实 UMI 操作轨迹和自动生成的状态转移语言标注预训练,再用跨本体机器人数据做指令对齐。结果显示数据和模型规模提升能传递到未见环境的真实机器人表现,并在 RoboCasa365、RoboDojo 等基准上刷新最好成绩;但增益可能主要来自 scaling / data。

Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection Figure 1
2026-07-20cs.CV

Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection

Manni Cui, Ziheng Qin, ZiAn Wang, Ruiqi Liu, Dianyuan Zou, Jianglan Wei, Han Zhou, Yu Liu, Jingrui Xu, Wenhao Wang, Zhenyu Zhang

Huazhong University of Science and Technology, Institute of Automation, Chinese Academy of Sciences, Jilin University, Vast Intelligence Lab

2026-07-20视觉感知

这篇论文针对 AI 生成视频检测中“视频预训练骨干反而不如图像探针”的现象,指出瓶颈不在骨干而在 CLS/GAP 等全局读出会抹掉局部跨帧伪影和 patch 间关系。作者提出轻量 V-PVP,只替换聚合层,用 patch 速度场的门控注意力和通道速度统计保留时序异常。在冻结 VideoMAE 骨干时,AIGVDBench 上达到 95.28 AUC,并在多种视频骨干和跨生成器基准上优于原读出。

MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation Figure 1
2026-07-20cs.MM

MLLM-DataEngine: Closing the Loop of Multimodal Instruction Tuning Data Generation

Zhiyuan Zhao, Bin Wang, Linke Ouyang, Yiqi Lin, Pan Zhang, Xiaoyi Dong, Jiaqi Wang, Conghui He

2026-07-20视觉语言

针对多模态指令微调数据生成与评测反馈脱节、难以定向修补模型短板的问题,本文提出 MLLM-DataEngine,将评测、坏例分析、GPT-4 数据生成和再训练闭环连接,并用自适应坏例采样选择能力类型与上下文示例。实验显示其能在 SEED-Bench、MMBench 等基准上迭代提升 MiniGPT4、LLaVA-1.5 等模型,且生成数据具备一定跨模型迁移性;但增益可能部分来自新增数据规模。

An Empirical Study of Handcrafted Feature Learning and Convolutional Neural Networks for Facial Expression Recognition Figure 1
2026-07-20cs.CV

An Empirical Study of Handcrafted Feature Learning and Convolutional Neural Networks for Facial Expression Recognition

Chethiya Galkaduwa

2026-07-20视觉感知

该文关注人脸表情识别在真实场景中受光照、姿态、遮挡和数据集条件影响而性能下降的问题,系统比较 HOG+SVM、LBP+逻辑回归与轻量 CNN 在 FER-2013、CK+、KDEF 上的表现。核心洞察是数据集复杂度对结果影响很大,甚至可能超过特征形式本身:CNN 在 FER-2013 和 KDEF 上总体最佳,CK+ 上 HOG+SVM 达到 98.4% 且略高于 CNN,LBP 全面较弱。

2026-07-17

114 篇
Hierarchical Denoising For Multi-Step Visual Reasoning Figure 1
2026-07-17cs.CV

Hierarchical Denoising For Multi-Step Visual Reasoning

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, The Hong Kong University of Science and Technology, Beihang University, Fuzhou University

2026-07-17视觉感知

针对视频生成模型在多步视觉推理中难以同时兼顾全局一致性与低延迟流式输出的问题,论文提出 HDR,将视频潜变量组织成树状层级,在粗层保留多种全局假设、细层逐步细化为具体视觉状态,并用稀疏层级注意力降低时序成本。实验显示其在六类多步任务上成功率由 34.22 提升至 60.29,平均进度提升至 89.56,且流式速度显著快于双向扩散,并展示了机器人迷宫交互迁移潜力。

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators Figure 1
2026-07-17cs.CV

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang

2026-07-17生成模型强化学习

MeanFlow虽能用平均速度实现少步生成,但现有前向过程强化学习主要优化瞬时速度,难以直接用于其偏好对齐。MeanFlowNFT的核心是借MeanFlow恒等式构造诱导瞬时速度预测器,在其上套用DiffusionNFT目标,同时推理仍用平均速度采样,并给出策略改进保证。实验显示其在图像和视频任务上稳定优于MeanFlow基线,在SD3.5-M多数指标领先少步RL方法,Wan2.1上4步VBench 84.33超过50步LongCat-Video RL。

Online Neural Space Time Memory for Dynamic Novel View Synthesis Figure 1
2026-07-17cs.CV

Online Neural Space Time Memory for Dynamic Novel View Synthesis

Baback Elmieh, Lynn Tsai, Zeman Li, Srinivas Kaza, Tiancheng Sun, Gabor Csapo, Ali Behrouz, Yuan Deng, Stephen Lombardi, Steven M. Seitz, Xuan Luo

University of Washington

2026-07-17视觉感知

这篇论文针对多视角流视频中动态新视角合成的核心矛盾:既要记住长时间遮挡区域,又要实时运行。作者提出 NSTM,将昂贵的 TTT 记忆更新降为周期执行、逐帧只做记忆读取,并用跨视角注意力处理当前运动与旧记忆的形变错位;同时加入记忆辅助损失、memory caching 和 L2 更新稳定长上下文。实验在 MVHumanNet++ 人体动态场景上显示可达到摊销实时速度,并保持分钟级记忆与较强合成质量。

Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography Figure 1
2026-07-17cs.CV

Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography

Guang Yang, Wentian Xu, Siyu Wang, Betty Raman, Lei Li, Vicente Grau

2026-07-17视觉感知

这篇论文针对超声心动图中心梗节段定位受图像质量、视角歧义和密集标注成本限制的问题,提出 MCF-Net:用单个模板帧初始化点跟踪获取稀疏心肌运动先验,并将其作为软掩码和门控信号融入 EchoPrime 的双视角特征。实验显示其在节段级 MI 定位上达到 72.4% F1、84.9% 准确率,优于运动、视觉和融合基线。

SceneBind: Binding What and Where Across Vision, Audio and Language Figure 1
2026-07-17cs.CV

SceneBind: Binding What and Where Across Vision, Audio and Language

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

University of Washington, University of Texas at Dallas, Hankuk University of Foreign Studies

2026-07-17视觉感知

这篇论文针对现有多模态编码器偏重“有什么”而缺少显式三维位置的问题,提出 SceneBind:用全局语义嵌入结合对象级语义-空间槽,同时对齐视觉、双耳音频和语言,并以 SceneBind Matching 做跨模态检索与 grounding。作者还构建带空间标注的真实双耳音视频数据集;实验显示其在场景检索、空间检索和对象 grounding 上优于语义型基线,并可零样本迁移到音视频定位任务。

HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning Figure 1
2026-07-17cs.CV

HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning

Pengcheng Zhou, Xuanyu Liu, Yanchen Yin, Bobo Li, Shengqiong Wu, Mong-Li Lee, Wynne Hsu

National University of Singapore, Shandong University of Science and Technology, University of Oxford, National University of Singapore Singapore Singapore, Shandong University of Science and Technology Qingdao China, University of Oxford Oxford United Kingdom

2026-07-17视觉感知

论文针对 VLM 图像地理定位中过度依赖显著地标、忽视街景环境等辅助线索的问题,提出 BI/BH 指标和 LandmarkBias-3K 来量化地标偏置,并用 BF-30K 多证据推理链与多维奖励训练 HoloGeo。结果显示其在 LandmarkBias-3K 上城市级准确率达 27.27%,高于既有开源和领域模型,同时保持常规基准表现。

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors Figure 1
2026-07-17cs.CV

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

2026-07-17视觉感知

针对深伪检测器在无查询黑盒迁移攻击下易依赖脆弱取证线索、CNN 到 ViT 迁移失效的问题,ARMOR++用 VLM 提供面部异常与空间语义先验,再由 LLM 编排 CW、JSMA、STA、SSA、BSR 等多类扰动并自适应重参数化和混合。AADD-2025 实验显示其在低/高质量图像、盲目标 ASR 和防御设置下均优于 ARMOR 与 AutoAttack-PGD,说明当前深伪检测仍有明显可靠性缺口。

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA Figure 1
2026-07-17cs.CL

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

2026-07-17视觉语言

本文动机是指出医疗多模态 VQA 不能只看排行榜分数,还需验证回答是否有可信临床依据。作者回顾 MediaEval Medico 2025 胃肠内镜任务的九个系统,核心洞察是 LoRA/QLoRA 等参数高效适配能带来强答案表现,但不必然产生忠实、完整解释;显式结构化推理、证据 grounding 和校准报告更稳定。结果显示流畅解释与真实依据常脱节,结论偏方法学建议,因非消融分析,增益来源不清。

CRISP: Constrained Refinement via Iterative Squeezing Process for Robust Medical Image Segmentation under Domain Shift Figure 1
2026-07-17cs.CV

CRISP: Constrained Refinement via Iterative Squeezing Process for Robust Medical Image Segmentation under Domain Shift

Yizhou Fang, Pujin Cheng, Yixiang Liu, Xiaoying Tang, Longxi Zhou

2026-07-17视觉感知安全鲁棒

面向医学图像在跨中心、跨人群和跨模态部署时的分布偏移,CRISP抓住前景区域相对排序比绝对概率更稳定这一洞察,通过潜特征扰动提取高精度核心与高召回支撑,并迭代收缩两者获得分割结果;在心脏MRI和CT肺血管任务上,无需目标域数据或测试时更新,HD95较强基线最高降低38.9%。

Divergent Gaze Patterns in Artistic Viewing: Spatial and Temporal Signatures of Attention Across Autistic Individuals, Artists, and Neurotypical Observers Figure 1
2026-07-17cs.CV

Divergent Gaze Patterns in Artistic Viewing: Spatial and Temporal Signatures of Attention Across Autistic Individuals, Artists, and Neurotypical Observers

Mohammed Amine Kerkouri, Daphné Senggaran, Renaud Jusiak, Océane Lehmann, Marouane Tliba, Claire Wardak, Emmanuelle Houy-Durand, Shasha Morel-Kohlmeyer, Aladine Chetouani, Nadia Aguillon-Hernandez

2026-07-17视觉感知

本文关注自闭症成人、艺术家与神经典型观察者在艺术品自由观看中的注意差异,弥补既有自闭症眼动研究偏重社会场景且忽略注视顺序的问题。论文将群体凝视比较同时建模为空间显著性预测和时间扫描路径对齐,并统一提取注视点。结果显示艺术家与神经典型者在空间和时间上高度接近,而自闭症组虽像艺术家一样覆盖更广,却具有更短注视、更低停留和更不一致的扫描路径,并非简单“艺术家式”观看。

Structural-Semantic Reciprocal Learning for Unsupervised Visible-Infrared Person Re-Identification Figure 1
2026-07-17cs.CV

Structural-Semantic Reciprocal Learning for Unsupervised Visible-Infrared Person Re-Identification

Moyao Tian, Shijia Liu, Yan Yang, Xin Yuan, Minshi Chen, Wei Wang, Xiao Wang

2026-07-17视觉感知

本文面向无监督可见光-红外行人重识别中模态差异大、跨模态身份标注缺失且伪标签噪声会逐轮累积的问题,提出SSRL,将细粒度身体部位结构解耦作为稳定空间锚点,并用闭环语义原型在每个epoch校准伪监督。实验在SYSU-MM01和RegDB上优于现有无监督方法,并称在RegDB上超过若干有监督基线。

Symbal: Detecting Systematic Misalignments in Model-Generated Captions Figure 1
2026-07-17cs.CV

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

2026-07-17视觉语言

本文针对多模态模型生成图像描述时的系统性错配:某类反复出现的文本错误会与特定视觉特征绑定,且在医学等场景风险较高。作者提出 Symbal,将问题拆成先聚类并定位重复文本错误、再寻找相关视觉线索的两阶段流程,并构建含 170 万图文对、420 个数据集的 SymbalBench;最佳配置在 63.8% 数据集上识别正确,约为最强基线近 4 倍。

MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos Figure 1
2026-07-17cs.CV

MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos

Ziren Gong, Xiaohan Li, Fabio Tosi, Ninghui Xu, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

2026-07-17视觉感知三维

MAGiSt3R针对多机器人在未知相机参数、单目RGB视频下实时构建一致三维地图的需求,指出NeRF/3DGS式多智能体SLAM依赖场景优化且难以实时,而现有3R前馈重建又易累积漂移。其核心是将3R局部点图估计扩展到多智能体,并用MAGMA在单智能体子图和跨智能体重叠区域间合并点图,再通过位姿图优化抑制漂移。实验显示其在合成与真实数据上较现有前馈方法取得更好的重建和相机跟踪精度,并接近10 FPS。

Ray-based phase error correction for miniaturized DOE projector-based FPP under single-directional hyperbolic projection Figure 1
2026-07-17cs.CV

Ray-based phase error correction for miniaturized DOE projector-based FPP under single-directional hyperbolic projection

Seung-Jae Son, Yatong An, Jae-Sang Hyun

2026-07-17视觉感知

这篇论文针对小型 DOE 投影器在 FPP 三维测量中因非线性投影、散斑和图案不可控带来的系统性相位伪影,提出按投影针孔射线而非图像邻域建模相位误差的方法,并用单方向双曲条纹估计投影器针孔、单标定姿态构建修正模型。实验显示其在平面、球面上与传统方法接近,在高反光扰动、尖锐几何和复杂物体上重建更稳定、误差更低。

DAPGNet: Dynamic Adaptive Physics-Guided Graph Diffusion Network for Hyperspectral Image Classification Figure 1
2026-07-17cs.CV

DAPGNet: Dynamic Adaptive Physics-Guided Graph Diffusion Network for Hyperspectral Image Classification

Pengkun Wang, Weijia Cao, Ning Wang, Xiaofei Yang

2026-07-17视觉感知生成模型

这篇论文针对高光谱分类中混合像元、光谱变化和异质边界使图关系不可靠的问题,提出 DAPGNet:把连续谱段的平滑性、多尺度变化等物理先验从特征表示推进到图拓扑构建和扩散传播中,通过先验感知稀疏图、边偏置注意力与物理门控抑制错误邻域信息。四个公开数据集上,其 OA、AA、Kappa 均优于 CNN、Transformer、Mamba 和图模型基线,AA 相比最强竞争方法提升 3.64–7.31 个百分点。

QuReC: All-in-One Image Restoration with Query-Specific Guidance and Local-Global Response Calibration Figure 1
2026-07-17cs.CV

QuReC: All-in-One Image Restoration with Query-Specific Guidance and Local-Global Response Calibration

Shen Zhou, Jinghui Zhang, Wenbo Huang, Xuwei Qian, Zhen Wu, Guangwen Peng, Zhiyuan Li, Ding Ding, Dian Shen, Fang Dong

Southeast University, Hainan University, Southeast University Nanjing China, Hainan University Hainan China

2026-07-17视觉感知

这篇论文针对一体化图像复原中同一图像内退化类型和强度空间不均、全局提示难以精细适配的问题,提出 QuReC:用 DQRM 为每个空间查询匹配退化原型并重构查询级引导,再用 LGRCM 校准局部与全局响应聚合。实验显示其在多个一体化复原基准上优于现有方法,但具体增益在多大程度来自模块设计而非训练规模或数据,文中未充分说明。

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning Figure 1
2026-07-17cs.CV

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu

University of Illinois Urbana-Champaign

2026-07-17视觉语言

这篇论文针对连续学习中多模态检索模型容易破坏既有跨模态对齐的问题,指出单一 checkpoint 会把所有检索方向锁定在同一种稳定性与可塑性权衡上。AlphaWiSE 的核心做法是在训练后冻结两个来源模型,并为每个对齐参数张量学习一个插值系数,用少量样本生成同规模、无额外推理开销的融合模型。实验在 AudioCLIP 的音频-图像-文本连续检索上显示,其相对 EWC、LwF、iCaRL 等基线在 R@1 和 mAP 上更稳定提升,但具体增益在多大程度来自不同 checkpoint 互补仍需看完整消融。

Quantifying Training Membership Information in the Hyperspherical Embedding Geometry of Face Recognition Models Figure 1
2026-07-17cs.CV

Quantifying Training Membership Information in the Hyperspherical Embedding Geometry of Face Recognition Models

Ünsal Öztürk, Sébastien Marcel

Idiap Research Institute, Martigny, Switzerland

2026-07-17视觉感知

本文关注开放集人脸识别中仅凭嵌入簇几何能否判断某身份是否参与训练,动机是隐私审计而非提升识别率。作者用180个模型和同域/跨域基准量化四类超球面簇统计,核心洞察是训练身份数量主导成员信号,模型骨干和损失头影响较小;同域下训练身份越多信号越弱,而跨域评测会把姿态、年龄、质量、族裔差异误计为成员信息。

Towards Hierarchical Structure Understanding of Newspaper Images Figure 1
2026-07-17cs.CV

Towards Hierarchical Structure Understanding of Newspaper Images

William Mocaër, Solène Tarride, Thomas Constum, Merveilles Agbeti-Messan, Tom Simon, Clément Chatelain, Stéphane Nicolas, Pierrick Tranouez, Sébastien Cretin, Thierry Paquet

2026-07-17视觉感知

面向历史报纸数字化中版面密集、层级嵌套和阅读顺序复杂的问题,本文比较两条结构理解路线:由YOLO、LayoutReader和文章分割算法组成的自底向上流水线,以及端到端分层Transformer Tiramisu,自顶向下联合建模版面层级、语义类别与阅读顺序。作者还发布Finlam La Liberté数据集和合成报纸生成器;实验显示两类方法均能重建复杂报纸层级,但具体增益来源可能部分来自数据与合成训练设计。

ESAR: Event-Based Synthetic Aperture Reconstruction Figure 1
2026-07-17eess.IV

ESAR: Event-Based Synthetic Aperture Reconstruction

Harbir Antil, Daniel Blauvelt, David Sayre

Center for Mathematics and Artificial Intelligence and Department of Mathematical Sciences, George Mason University, Fairfax, Virginia 22030

2026-07-17三维

这篇论文针对事件相机只输出异步亮度变化、难以直接重建静态场景的问题,将单目事件成像改写为合成孔径逆问题:用静态地面 log-radiance 场 θ 作为未知量,并通过投影 P 与时间差分 A 建模观测。核心洞察是近天底运动下多视角近似形成平移孔径,但 AP 同时受空间平均和时间差分导致病态,需正则化求解。实验显示在仿真和 Falcon Neuro 真实数据上可恢复较连贯的大尺度空间结构,并相对抑制细纹理。

DriftWorld: Fast World Modeling through Drifting Figure 1
2026-07-17cs.RO

DriftWorld: Fast World Modeling through Drifting

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

Massachusetts Institute of Technology, 2 Harvard University

2026-07-17强化学习

机器人世界模型若用于在线规划,需要快速生成大量候选动作的未来轨迹,而扩散模型的多步采样成为主要瓶颈。DriftWorld 将 drifting 生成模型改造成动作条件视频预测,通过动作强化的漂移场、DINO 特征空间损失和逐帧动作条件 U-Net,实现单次前向生成。实验在 Bridge-V2、RT-1、Language Table、Push-T、Robomimic 上显示,其速度平均较扩散基线快 17 倍,并在 rollout 质量、动作搜索性能和离线策略排序相关性上达到或超过基线。

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment Figure 1
2026-07-17cs.CV

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

2026-07-17视觉感知

SUFLECA针对CAD到单图像9D对齐中基础视觉特征偏外观、遮挡和仿真到真实域差导致匹配不稳的问题,采用12个真实/合成数据集的67.4万图像进行NOC弱监督特征学习,并用互相一致、几何一致的匹配替代单纯最近邻。结果在ScanNet25k上达到33.4%类别、42.3%实例准确率,较最强零样本基线提升10.3/12.2个百分点,同时实现亚秒级推理和更低显存。

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding Figure 1
2026-07-17cs.CV

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

Xiao Lin, Xiaohu Huang, Kai Han

The University of Hong Kong

2026-07-17视觉感知

这篇论文针对现有 MLLM 空间理解方法依赖单一视觉基础模型先验的问题,指出不同模型在不同空间任务上提供互补知识。作者提出 ViPS,用共享基础编码器加轻量代理近似多模型先验,并按输入任务动态融合注入 MLLM,以降低多专家推理开销。实验在 VSI-Bench 和多个 ScanNet 系列任务上取得 SOTA,覆盖空间推理、3D grounding、密集描述和具身问答。

RoGS: Adaptive Meshgrid Gaussian for Large-Scale Road Surface Mapping Figure 1
2026-07-17cs.CV

RoGS: Adaptive Meshgrid Gaussian for Large-Scale Road Surface Mapping

Tianchen Deng, Zhiheng Feng, Wenhua Wu, Ziming Li, Siting Zhu, Hesheng Wang

2026-07-17三维

面向自动驾驶中大规模道路表面建图的质量与效率瓶颈,RoGS将道路建模为铺在网格上的2D Gaussian surfels,并按车道线、边界、路缘和高度突变等结构自适应加密,同时用多邻近位姿一致性削弱噪声位姿先验。KITTI和nuScenes实验显示,其可重建RGB、语义和高程道路图,并较现有网格方法显著加速。

Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening Figure 1
2026-07-17cs.CV

Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening

Javad Khoramdel, Farhad Hoseyni, Amirhossein Nikoofard

APAC Research Group, Faculty of Electrical Engineering, K. N. Toosi University of Technology, Tehran, Iran

2026-07-17视觉感知

该文针对神经心理绘图筛查 MCI 时数据少、类别不均衡和 MoCA 临界分数诊断模糊的问题,主张不必全量微调大型混合模型,而是在冻结 DINOv2-Small 上用三类绘图专属 prompt 与交叉注意力实现轻量适配,并以注意力图和模态权重提供内生解释;同时设计 MoCA 感知 focal loss 利用连续认知分数。五折分层验证中,MCI 类 F1 为 0.641±0.026,AUC 为 0.795±0.024,较 ResViT 的 MCI F1 提升 0.110。

Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion Figure 1
2026-07-17cs.CV

Weakly-Supervised RGB-D Salient Object Detection via SAM-driven Pseudo Annotation and State Space Interaction-based Diffusion

Wenqi Si, Gongyang Li, Shixiang Shi, Weisi Lin

Wenqi Si, Gongyang Li, and Shixiang Shi are with the School of Communication and Information Engineering, Shanghai University, Shanghai 200444, China (e-mail: {swq

2026-07-17视觉感知生成模型

本文针对 RGB-D 显著目标检测中像素级标注成本高、涂鸦监督又缺少结构细节的问题,提出用 SAM-PAG 将涂鸦扩展为较可靠的密集伪标注,并以结合频域融合、状态空间交互和上下文注入的条件扩散模型迭代去噪生成显著图。实验称其在七个数据集上优于相关涂鸦监督方法,并接近全监督性能。

Video = World + Event Stream Figure 1
2026-07-17cs.CV

Video = World + Event Stream

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

2026-07-17视觉感知强化学习

论文动机是把实时音视频交互从单一“会说会反应的代理”推广为更通用的视频流建模能力。核心洞察是将视频拆成稳定的 world context 与随时间变化的 event stream,用普通视频预训练学习世界如何响应输入,并在下游把多模态输入映射为语音和开放词表行为指令。结果上,v0.3 保持 v0.2 架构与服务拓扑,达到 640×368、25FPS、约 200ms 模型侧延迟和约 550ms 总交互延迟;但文中对相较 v0.2 的定量增益来源未充分说明。

JADE-GS: Joint Alternating Deblurring Guided by Events in 3D Gaussian Splatting Figure 1
2026-07-17cs.CV

JADE-GS: Joint Alternating Deblurring Guided by Events in 3D Gaussian Splatting

Haoyu Fu, Jiafeng Huang, Yuchen Wang, Shengjie Zhao

∗ School of Mechatronic Engineering and Automation, Shanghai University, Shanghai, China, † Shanghai Baoshan Shangda General Intelligent Robotics Research Institute, Shanghai, China, ‡ School of Computer Science and Technology, Tongji University, Shanghai, China

2026-07-17三维

JADE-GS针对高速相机运动下RGB帧模糊会破坏3D重建几何一致性的问题,引入事件相机提供曝光期间运动线索。其核心是用像素级路由门融合EDI的边缘保真与EFNet的纹理恢复,并让2D去模糊教师与3D Gaussian Splatting学生通过多视角渲染和物理再模糊约束双向互正。实验在真实和合成基准上取得最佳LPIPS、CLIP-IQA,PSNR/SSIM具竞争力,且约1小时、低于5GB显存训练并保持实时渲染。

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting Figure 1
2026-07-17cs.CV

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

2026-07-17视觉感知

针对视频物体移除中传统光流/注意力方法易模糊失真、扩散方法虽真实但多步推理慢且易幻觉的问题,D2DF先用草稿引导扩散教师生成高质量结果,再通过PPCD用真值条件提供更稳定的蒸馏目标,将50步细化压缩为一步;进一步用SGFP在潜空间生成伪草稿,摆脱外部草稿依赖。实验称其在多个基准上优于传统和多步生成方法,单视频去噪约1秒,并在效率上显著快于ROSE等扩散基线。

On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline Figure 1
2026-07-17cs.CV

On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline

Yuchen Ren, Zhengyu Zhao, Chenhao Lin, Bo Yang, Chao Shen

School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China, State Key Laboratory of Mathematical Engineering and Advanced Computing, Information Engineering University, Zhengzhou, China

2026-07-17视觉语言视觉感知

本文动机是重新审视视觉语言预训练模型可迁移攻击中过度复杂的三阶段流程,指出其存在单模态选词、引入图像无关词和过度依赖替代模型等问题。核心创新是提出 SimVLA,用跨模态词识别、文本语义抽象和删除重复文本攻击来提升泛化。实验覆盖四个数据集和三类任务,在 Flickr30k 上 R@1 迁移成功率较 SOTA 提升 8.01%-14.71%,同时耗时和显存显著降低。

Stitch-Inferencer: Enhance Endoscopic Video Segmentation and Tracking via Panoramic Reconstruction Figure 1
2026-07-17cs.CV

Stitch-Inferencer: Enhance Endoscopic Video Segmentation and Tracking via Panoramic Reconstruction

Shunsuke Kikuchi, Atsushi Kouno, Hiroki Matsuzaki

2026-07-17视觉感知三维

内窥镜视频受视野狭窄和器械遮挡影响,单帧分割与跟踪容易缺少长期上下文。Stitch-Inferencer的核心思路是把历史有效像素显式拼接成无器械全景画布,再在全景ROI上调用现有模型并投影回当前帧,无需重训。实验显示其在解剖分割和点/框跟踪上对多种基线有稳定提升,拼接模块超过60 FPS,但对非平面形变和视差仍较敏感。

U-shaped Multi-granularity Learning for Vision-Language Models Figure 1
2026-07-17cs.CV

U-shaped Multi-granularity Learning for Vision-Language Models

Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

University of Electronic Science and Technology of China, University of Electronic Science and Technology of China Chengdu China

2026-07-17视觉语言视觉感知

本文针对视觉语言模型提示学习中全局提示缺少局部细节、局部提示又缺少上下文关联的粒度矛盾,提出受 U-Net 启发的 UPrompt,在视觉和文本两侧构建多粒度层级表示,并用粗到细的上下文增强与细到粗的层级监督保持跨尺度一致性。实验覆盖 17 个基准,在 MSCOCO 上较 MAMET、VPKE 分别提升 4.1 和 7.3 rSum,base-to-novel 泛化较 CoCoA-Mix 提升 5.09%,同时展示了不同粒度下的效率取舍。

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation Figure 1
2026-07-17cs.LG

Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation

Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo

The University of Tokyo

2026-07-17视觉感知强化学习

这篇论文针对同一提示下文生图样本常集中在少数视觉模式、在人像场景可能放大表观人口偏差的问题,将多样性定义为预设目标模式覆盖率。核心创新是 multi-axis max@K:按类别先在一组样本中选最佳代表,再聚合奖励,使不同样本可为不同模式获得信用。实验在合成、颜色奖励和 SD3.5-M 表观公平性任务上验证该机制,公平分数较基座提升 0.23–0.36,图像质量和文本对齐基本保持稳定。

DINE: Distance Is Not Enough -- Learning Global Deformation Priors for Robust Soft-Tissue Point Cloud Registration Figure 1
2026-07-17cs.CV

DINE: Distance Is Not Enough -- Learning Global Deformation Priors for Robust Soft-Tissue Point Cloud Registration

Sara Monji-Azad, Rohit Beer, Marvin Kinz, Claudia Scherl, Jürgen Hesser

2026-07-17三维安全鲁棒

针对软组织点云非刚性配准中大形变、噪声和离群点会使仅靠 Chamfer 距离得到局部贴合但全局不合理形变的问题,DINE 将配准写成 MAP 目标,在现有 Robust-DefReg、DefTransNet 上用两阶段训练学习位移场先验,尤其用全场 PCA 高斯先验捕获点间相关性。实验显示其在 DeformedTissue 和 SynBench 上显著降低平均 Chamfer 距离,并提升噪声、离群点和中大形变下的鲁棒性。

Introspective Attention Modulation for Safe Text-to-Image Generation Figure 1
2026-07-17cs.CV

Introspective Attention Modulation for Safe Text-to-Image Generation

Basim Azam, Hossein Rahmani, Naveed Akhtar

2026-07-17视觉感知安全鲁棒

针对文本到图像模型易被提示攻击或 LoRA 等轻量适配绕过安全护栏的问题,论文提出在推理过程中监测并调制扩散 Transformer 的注意力激活,而非改权重或做事后过滤;通过识别不安全注意力并用稀疏逻辑回归重平衡,保留语义对齐与画质。实验称在 I2P、SneakyPrompts、MMA-Diffusion 等标准和对抗基准上,相比概念擦除类方法取得更高安全性并维持感知质量。

Frequency-Structured Field Learning for Light-Field Disparity Estimation Figure 1
2026-07-17cs.CV

Frequency-Structured Field Learning for Light-Field Disparity Estimation

Sara Monji-Azad, Yulin Liu, Jürgen Hesser

Mannheim Institute for Intelligent Systems in Medicine (MIISM), Medical Faculty Mannheim, Heidelberg University, Mannheim, Germany, Interdisciplinary Center for Scientific Computing (IWR), Heidelberg University, Central Institute for Computer Engineering (ZITI), Heidelberg University, CZS Heidelberg Center for Model-Based AI, Heidelberg University

2026-07-17视觉感知

光场视差估计需要同时处理弱纹理区域的全局一致性和遮挡、细结构处的局部精度,传统方法常依赖代价体或离散视差假设。FreqLF将EPI角度视差信息与中心视图特征投影为潜在场,用低频傅里叶分支做全局交互、局部卷积分支保留边界细节,再由坐标条件高斯混合解码视差。在HCI 4D基准上,其无显式代价体的基础模型接近强监督基线,消融显示两类分支互补,但具体相对增益幅度文中片段未充分说明。

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding Figure 1
2026-07-17cs.CV

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

2026-07-17视觉感知

面向现有视频多模态大模型在短视频、长视频与流式交互间泛化弱、视觉 token 成本高且复现不完整的问题,VideoChat3 以 I3D-ViT 和自适应帧分辨率压缩时空表示,并配套 300 万指令数据与课程训练。文中报告其 4B 模型在通用、长视频和流式基准上超过同等或更大开源模型,同时提升训练与推理效率。

Still image and spatial-temporal tomato data enabling detection, segmentation, tracking, and video-instance segmentation using strong and weak labels Figure 1
2026-07-17cs.CV

Still image and spatial-temporal tomato data enabling detection, segmentation, tracking, and video-instance segmentation using strong and weak labels

Michael Halstead, Esra Guclu, Mohamed Farag, Enrico Pallotta, Christian Hund, Ribana Roscher, Maren Bennewitz, Juergen Gall, Cyrill Stachniss, Chris McCool

University of Bonn, Bonn, Germany

2026-07-17视觉感知

面向温室番茄机器人视觉中可用标注数据不足、遮挡和同质果实跟踪困难的问题,论文发布 BUTom21 与 BUTom-ST21 两个数据集:前者为全手工像素级静态图像标注,后者用伪标签扩展到时空视频并保留成熟度、实例与 tracklet 信息。主要结果是提供了检测、分割、MOT/VIS 等任务的基准与手工校正测试集,但具体性能增益可能主要来自 data scaling。

Benchmarking Face Recognition without Real Faces Figure 1
2026-07-17cs.CV

Benchmarking Face Recognition without Real Faces

Paweł Borsukiewicz, Daniele Lunghi, Wendkûuni C. Ouédraogo, Jacques Klein, Tegawendé F. Bissyandé

University of Luxembourg

2026-07-17视觉感知数据集/基准

针对合成脸已能训练人脸识别模型、但评测仍依赖真实人脸而保留隐私风险的问题,论文系统比较12个合成基准、7个真实基准和24个预训练模型。核心洞察是合成数据并非天然可替代真实评测,需同时看验证指标、相似度分布和模型排序一致性;结果显示MorphFace与Vec2Face最接近真实基准,可支持较可靠的隐私友好评测。

TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization Figure 1
2026-07-17cs.CV

TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Hyeonseo Yun, Chang D. Yoo

Korea Advanced Institute of Science and Technology, Daejeon, Republic of Korea, Corresponding AuthorKorea Advanced Institute of Science and Technology, Daejeon, Republic of Korea

2026-07-17优化算法三维

TanGO针对高层3D生成表示中全局token交互导致局部编辑失真、保留区域坍塌的问题,指出VecSet类token虽共享上下文但几何影响具有局部性,并将编辑建模为切空间中的一步最优控制,用源/目标速度场方向差异自适应调节逐token增益。实验显示其在多类文本驱动3D编辑中减少结构伪影,并在CLIP-I、CLIP-T等指标上优于FlowEdit、AnchorFlow等基线。

FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers Figure 1
2026-07-17cs.CV

FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers

Minguk Kang, Suha Kwak

Pika Labs

2026-07-17视觉感知

论文针对实时视频生成中 VAE 解码已成为主要瓶颈的问题,提出纯 Transformer 的 FlashDecoder:按帧从 latent 解码到像素,并用固定窗口滚动 KV cache 只关注近期历史帧,从而避免显式因果 mask、控制显存并支持恒定延迟流式解码。在 Wan2.1/2.2 latent 空间上,其重建质量接近卷积解码器,1080p PSNR 相当,同时吞吐提升 3.6–4.7 倍、显存最高降低 11 倍,优化后最高约 12 倍加速。

Selectivity Drives Efficiency: Dataset Pruning for Visual Place Recognition Figure 1
2026-07-17cs.CV

Selectivity Drives Efficiency: Dataset Pruning for Visual Place Recognition

Tong Jin, Yunpeng Liu, Shuyu Hu, Chun Yuan, Song Wang, Feng Lu

2026-07-17视觉感知数据集/基准

针对视觉地点识别依赖大规模训练集带来的存储与训练成本,论文指出传统按图像样本剪枝不适合成对关系监督,改以“地点”为剪枝单元,并用地点内多样性和地点间相似性衡量正样本变化与难负样本价值。实验显示该方法在多种剪枝率下优于现有剪枝基线;在合并数据集上减少约71%训练数据和79.6%训练时间,仍取得MSLS-val 94.5%、Nordland 97.0% R@1。

Rotational Motion-Induced Error Compensation for Phase-Shifting Profilometry-Based Eye Reconstruction Figure 1
2026-07-17cs.CV

Rotational Motion-Induced Error Compensation for Phase-Shifting Profilometry-Based Eye Reconstruction

Seong-Jin An, Sanghoon Jeon, Yatong An, Jae-Sang Hyun

2026-07-17三维

面向VR/AR头显中更稳定的高精度眼动追踪,论文针对相移轮廓术在眼球帧间旋转时产生的像素错配和相位偏移误差,提出无需外部编码器的旋转运动补偿框架:用用户特定3D眼模型和图像运动线索估计相对旋转,并按眼部区域优化补偿强度。旋转假眼实验显示该方法能明显抑制运动变形、提升三维重建精度,非球形刚体实验也表明补偿思路不只依赖球形眼几何。

Physics-Informed Diffusion for Biomechanically Plausible 3D Sign Language Generation Figure 1
2026-07-17cs.CV

Physics-Informed Diffusion for Biomechanically Plausible 3D Sign Language Generation

Emanuele Colonna, Moises Diaz, Gennaro Vessio, Miguel Angel Ferrer, Giovanna Castellano

2026-07-17生成模型三维

这篇论文针对手语生成中“语义正确但骨架不可信”的问题,提出 PIDiffSign:在扩散式 gloss-to-pose 框架中加入骨长保持、关节角限制、运动平滑和手指活动等可微生物力学约束,并用对比学习强化 gloss-姿态对齐。PHOENIX14T 与 CSL-Daily 实验显示,其在姿态误差、关节角合理性、分布真实感和回译 BLEU-4 上优于强扩散基线。

Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification Figure 1
2026-07-17cs.CV

Blurring Modal Boundaries: A Unified Survey from Single- to Multi-Modal Person Re-ldentification

Xiao Wang, Bing Wang, Bin Yang, Cuiqun Chen, Xin Xu, Mang Ye

2026-07-17学习理论

针对传统 RGB 行人重识别在低照度、遮挡和跨摄像头环境下鲁棒性不足的问题,本文将单模态、可见光-红外、文本/草图图像、NLOS、三光谱与多模态 ReID 统一到“模态对齐”和“多源融合”的框架下梳理,并给出一个基于 Transformer 的 VI-ReID 基线。主要结果是形成任务分类、数据集与方法谱系及未来方向,而非报告新的显著性能突破,基线增益来源文中未充分说明。

An LLM-Based Automatic Sportscast Solution for Robot Soccer Matches Figure 1
2026-07-17cs.CV

An LLM-Based Automatic Sportscast Solution for Robot Soccer Matches

Francesco Petri, Michele Brienza, Daniele Nardi, Domenico Daniele Bloisi, Aldo Gangemi, Vincenzo Suriani

2026-07-17机器人

这篇论文面向 RoboCup 足球赛难以从视频中持续量化进展、并向观众解释比赛过程的问题,扩展 MARIO 框架,将机器人与球的视觉跟踪、场地重投影、规则化事件抽取和 LLM 解说策略结合起来,以符号事件约束生成内容来降低幻觉。文中展示系统可用于直播和赛后生成统计与解说,并能适配不同尺寸的人形机器人,但具体相对基线的量化增益文中未充分说明。

TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis Figure 1
2026-07-17cs.CV

TAMF-VTON: Texture-Aware Mask-Free Virtual Try-On via High-Fidelity Image Synthesis

Jie Wang, Qian He, Gaofeng He, Xiaogang Jin, Huamin Wang

State Key Lab of CAD & CG, Zhejiang University and Style3D Research, State Key Lab of CAD & CG, Zhejiang University, State Key Lab of CAD & CG, Zhejiang University and Style3D Research China, State Key Lab of CAD & CG, Zhejiang University China

2026-07-17视觉感知

这篇论文针对现有虚拟试衣依赖分割/修补掩码、细纹理易丢失且多服装组合受限的问题,将试衣建模为免掩码图像编辑任务。核心做法是在扩散模型中加入轻量 MoE 适配、频域高频监督和自适应修补式数据构造,以兼顾泛化编辑能力与服装纹理保真。实验称其在量化指标和感知质量上优于已有方法,并可在 RTX 4090 INT4 下约 15 秒完成单图推理。

Rare Concept Generation via Counterfactual Inference in Diffusion Models Figure 1
2026-07-17cs.CV

Rare Concept Generation via Counterfactual Inference in Diffusion Models

Zhengyuan Jiang, Haipeng Liu, Meng Wang, Yang Wang

School of Computer Science and Information Engineering, Hefei University of Technology, School of Computer Science and Information Engineering, Hefei University of Technology Hefei China

2026-07-17生成模型

这篇论文针对扩散模型在“长腿向日葵”“打哈欠的橙子”等稀有概念上容易被常识属性牵引、导致异常属性渲染失败的问题,提出免训练的 CI-Diff:用反事实因果推断估计文本提示的自然直接效应,并改写 CFG 来放大异常属性,同时用参考主体边缘约束稳定形态。作者在 RareBench 上报告优于现有扩散与 LLM 辅助方法,但具体增益的消融来源仍需结合完整实验细节判断。

Clean-Reference Streaming Detection of Lens Occlusion and Photometric Transitions for Camera Tamper Monitoring Figure 1
2026-07-17cs.CV

Clean-Reference Streaming Detection of Lens Occlusion and Photometric Transitions for Camera Tamper Monitoring

Bo Ma, WeiQi Yan, Jinsong Wu

2026-07-17视觉感知

本文面向监控摄像头被遮挡或突发光照变化会使下游视觉系统失效的问题,提出一种只用亮度、局部梯度和粗网格统计的流式干净参考状态机,重点在于报警期间不污染参考、用显式抑制门排除照明干扰并按事件只通知一次。实验中在320段受控序列上达到0.800 F1和0.822平衡准确率,低误报审计和公开数据诊断显示方法在声明范围内有效,但不覆盖几何位移、细微遮挡等情况。

WanSong v1.0 Technical Report Figure 1
2026-07-17eess.AS

WanSong v1.0 Technical Report

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

2026-07-17视觉感知

针对自回归或级联音乐生成在长音频效率、稳定音质和可控性上的瓶颈,WanSong 将音频建模为连续 token,采用单阶段纯扩散 hybrid-MMDit,并用双 stem token 分离人声与伴奏以缓解 CFG 下的相互抑制。实验显示其 1024 压缩 VAE 在音乐和语音重建上优于 Stable Audio 2,系统还支持最长 5 分钟多语种歌曲生成;整体增益可能主要来自大规模数据、模型 scaling 与双 stem 设计的共同作用。

On the Disagreement in Perturbation-based xAI -- Benchmarking Perturbation Choices for Flood Detection from SAR Images Figure 1
2026-07-17cs.CV

On the Disagreement in Perturbation-based xAI -- Benchmarking Perturbation Choices for Flood Detection from SAR Images

Anastasia Schlegel, Ronny Hänsch

aMicrowaves and Radar Institute, German Aerospace Center (DLR), Weßling, 82234, Germany, bChair of Remote Sensing Technology, Department of Aerospace and Geodesy, Technical University of Munich, Munich, 80333, Germany, tions, dataset artifacts, label noise, class imbalance, and other, SAR Image & Label, image. Left: SAR image with its reference label and the predicted

2026-07-17视觉感知数据集/基准

面向洪水监测等高风险遥感场景中深度模型解释不稳定的问题,本文系统基准化扰动式 xAI 的两类关键选择:扰动块几何和替换方式。核心洞察是解释热图并非方法的固定输出,而会被这些设置显著牵引;在 SAR 洪水检测实验中,不同扰动策略产生空间焦点转移、相关性差异,甚至相互矛盾的解释,且忠实性表现随场景和参数变化,说明解释结论必须连同扰动设计一起评估。

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models Figure 1
2026-07-17cs.CV

FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models

Wei Li, Peijin Jia, Yuan Ma, Xuefeng Jiang, Titong Jiang, Sheng Sun, Yujian Li, Xin Wen, Han Hong, Zhikang Liu, Bailin Li, Kun Zhan

2026-07-17视觉语言视觉感知

FoMoVLA针对现有VLA偏反应式、缺少对未来场景演化和到达路径建模的问题,提出将未来特征预测作为目标状态锚点,并用稀疏2D点轨迹刻画连续运动,再通过未来条件交叉注意力耦合两者;辅助分支仅训练时使用,推理无额外开销。实验在LIBERO、RoboCasa GR-1 Tabletop和LIBERO-Plus上报告优于多种基线,并显示较强零样本泛化。

GeoDetect: Geometric Adversarial Detection for VLPs Figure 1
2026-07-17cs.CV

GeoDetect: Geometric Adversarial Detection for VLPs

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

The University of Melbourne, Melbourne, Australia, Monash University, Melbourne, Australia, labels, VLPs are optimized to align image and text representations within a

2026-07-17视觉感知

针对视觉语言预训练模型易受对抗样本攻击、而单模态检测信号未必适用于多模态嵌入的问题,论文从VLP嵌入空间的各向异性出发,指出对抗扰动会把表示推向流形外并增大与干净样本的几何距离;GeoDetect据此用LID、k-NN、Mahalanobis和KDE等几何分数做检测,在多种VLP架构、分类与检索任务、单/多模态及自适应攻击下取得较高AUC,且无需微调。

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios Figure 1
2026-07-17cs.CV

VQ-Touch: A Data-Efficient Tactile Generation Framework Across Sensors and Scenarios

Kailin Lyu, Long Xiao, Jianing Zeng, Di Wu, Lin Shu, Jie Hao

Institute of Automation, Chinese Academy of Sciences, Zhongguancun Academy, porting multimodal generation tasks such as images and labels, their limited durability and the laborious real-world acquisition, Label, labels, to address diverse tactile generation requirements., Overview. In this section, we elaborate on VQ-Touch, whose

2026-07-17视觉感知

这篇论文针对触觉图像采集昂贵、易损且跨传感器数据稀缺的问题,提出 VQ-Touch:用含可变形卷积和多尺度融合的 DM-VQGAN 学习离散触觉表征,再结合传感器族聚类、少样本混合训练和统一离散扩散解码器,从视觉图像、触觉图像或标签生成触觉图像。实验显示其在重建、生成、少样本和跨传感器设置中优于现有方法,尤其适合视觉受限场景。

WorkDrive: Roadwork Chain of Causation for Autonomous Driving Figure 1
2026-07-17cs.CV

WorkDrive: Roadwork Chain of Causation for Autonomous Driving

Tianyi Jiang, Wen Zhang, Sihan Yang, Ming Lu, Wentao Zhang

Peking University, Peking University Beijing China

2026-07-17视觉感知

这篇论文针对施工区自动驾驶中车道线、标志等常规线索失效,VLM虽能看见锥桶和护栏却难以把它们转化为规划决策的问题。WorkDrive用深度、开放词表检测、分割和跟踪生成结构化场景事实,再构造面向施工区的因果链标注,并用LoRA微调和基于横向意图-轨迹一致性的GRPO对齐。ROADWork上因果推理标注使ADE降低9.0%,一致性强化学习再带来3.0%提升。

AE-UAV: An Air-to-Air Event-Based UAV Tracking Benchmark and a Real-Time Frequency-Domain Tracker Figure 1
2026-07-17cs.CV

AE-UAV: An Air-to-Air Event-Based UAV Tracking Benchmark and a Real-Time Frequency-Domain Tracker

Zixin Jiang, Bing He, Chaoran Xiong, Zhenzhen Wang, Xin Zhao, Ling Pei

Ling Pei is also with State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai 200240, China.

2026-07-17视觉感知数据集/基准

针对空对空无人机跟踪中帧相机易受高速运动、光照和动态范围限制影响,以及现有事件相机数据集缺少机载视角、跟踪器依赖GPU训练的问题,论文提出AE-UAV基准和免训练FSFT频域跟踪器。AE-UAV含178段飞行序列并用三次B样条做连续时间标注;FSFT结合频域模板匹配、卡尔曼搜索区预测和慢速漂移校正。实验称其在纯CPU上达420 FPS,保留GPU方法93.97%精度并实现5.32倍有效加速。

Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality Figure 1
2026-07-17cs.CV

Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

Kunal Pratap Singh, Ali Garjani, Rishubh Singh, Muhammad Uzair Khattak, Efe Tarhan, Jason Toskov, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

Swiss Federal Institute of Technology Lausanne (EPFL)

2026-07-17视觉语言视觉感知

本文针对家用机器人等部署场景中测试环境固定且传感器丰富的问题,提出 Test-Space Training:仅在目标空间采集无标注多模态数据,通过跨模态预测做自监督表征学习。核心洞察是多模态可部分替代互联网规模数据,尤其结合预训练模型特征作为伪模态后,可在同一环境下达到或超过多种通用预训练基线;仅用物理传感器时仍有收益,但与上界仍有差距。

Causal-Adversarial Probing of Clinical Covariates for Prostate MRI Grading Figure 1
2026-07-17cs.CV

Causal-Adversarial Probing of Clinical Covariates for Prostate MRI Grading

Yipei Wang, Shiqi Huang, Wen Yan, Weixi Yi, Dean C. Barratt, Mark Emberton, Daniel C. Alexander, Veeru Kasivisvanathan, Yipeng Hu

2026-07-17视觉感知

这篇论文针对前列腺 MRI 分级模型可能利用临床协变量捷径而非病灶信号的问题,提出用因果假设配合梯度反转式对抗抑制,逐一测试协变量在表征中的作用。结果显示,抑制年龄、BMI、饮酒可小幅提升 ISUP≥2 分类 AUC,而抑制 PSA 和前列腺体积会明显降分,说明不同协变量分别更像非泛化依赖或任务相关信号。

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding Figure 1
2026-07-17cs.CV

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

Nhat Thanh Tran, Fanghui Xue andShuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

Department of Mathematics, University of California, Irvine, Corresponding authorQualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-07-17视觉感知

面向视频理解中 ViT 全时空注意力计算开销随分辨率和帧数快速上升的问题,VideoSEMA 将空间建模替换为 Mamba-like SEMA:局部窗口注意力并行全局均值近似,再与时间维 softmax 注意力做分解,并给出特定秩条件下等价于全时空注意力的分析。实验显示其在 K400 上以 31M 参数达到 82.4/82.6 top-1,优于更重的 Transformer 和 VideoMamba;在 SSv2 同规模模型中 top-1 领先,且高分辨率外推退化更小。

Variational Inference for Bird's Eye View Segmentation in Autonomous Driving Figure 1
2026-07-17cs.CV

Variational Inference for Bird's Eye View Segmentation in Autonomous Driving

Jingyue Shi, Huaicheng Li, Junhui Zhao, Yanxiang Jiang

2026-07-17视觉感知

本文针对自动驾驶 BEV 分割中多相机融合在遮挡、远距离和复杂交通场景下易生成错误 BEV 表示的问题,将任务建模为变分推断。核心做法是用 Transformer-CVAE 生成多个候选 BEV,并引入 normalizing flow 提升潜变量分布表达能力,再通过 BEV-attention fusion 自适应融合候选结果。实验在 nuScenes 和 OPV2V 上显示其多相机 BEV 分割与车道环境感知优于对比方法。

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models Figure 1
2026-07-17cs.CV

Pretraining Multiple Instance Learning Networks with Multi-Teacher Distillation from Pathology Slide Foundation Models

Mingxi Fu, Jiawen Li, Renao Yan, Jiali Hu, Qiehe Sun, Tian Guan, Yonghong He

Tsinghua Shenzhen International Graduate School, Tsinghua University, University of Washington, City University of Hong Kong (Dongguan), Medical Optical Technology R&D Center, Research Institute of Tsinghua, Jinfeng Laboratory

2026-07-17视觉感知

本文针对病理全切片 MIL 聚合器通常依赖少量 slide 级标签从头训练、易过拟合且迁移性弱的问题,提出用 TITAN 与 CARE 两个 slide 级基础模型进行多教师蒸馏,并以角度离散度归一化损失平衡教师监督,为多类轻量 MIL 架构提供可复用初始化。15 个基准上的线性探测、全量微调和 few-shot 实验显示,蒸馏预训练普遍优于从头训练,优势在低标注和线性评估场景更明显,同时保留轻量模型的计算效率。

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach Figure 1
2026-07-17cs.CV

Team RAS in 11th ABAW Competition: Multimodal Ambivalence Recognition Approach

Elena Ryumina (1), Maxim Markitantov (1), Alexandr Axyonov (1), Fedor Shchetinin (2), Timur Abdulkadirov (1), Dmitry Ryumin (1), Alexey Karpov (1, 2) ((1) St. Petersburg Federal Research Center of the Russian Academy of Sciences (SPC RAS), St. Petersburg, Russia, (2) HSE University, (3) TMO University, Russia)

2026-07-17视觉语言视觉感知

论文针对犹豫/矛盾情绪在语言、语音、表情和场景中表现不一致且现有优胜方案依赖大型集成的问题,提出以文本为锚点的 Text Residual Fusion,用其他模态做门控残差补充。结果显示文本仍是最强单模态,融合模型在 BAH 私有测试集 Macro F1 达 78.24%,较文本模型提升 4.03%,在不使用大规模集成下获得更好的实用性。

GlobalForge: Towards Robust AI-Generated Image Detection Figure 1
2026-07-17cs.CV

GlobalForge: Towards Robust AI-Generated Image Detection

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu

Huazhong University of Science and Technology, Institute of Automation, Chinese Academy of Sciences, Jilin University, Tsinghua University

2026-07-17视觉感知安全鲁棒

这篇论文针对 AIGC 图像检测在社交传播中的 JPEG、模糊、缩放等退化下易失效的问题,指出根因是现有检测器依赖脆弱的局部生成痕迹。GlobalForge 通过局部信息瓶颈抑制捷径,并用全局结构推理与退化对比损失稳定长程结构特征;同时提出 RealDeg-Bench。实验称其在 8 组野外基准平均 BAcc 较 SOTA 提升 5.89%,RealDeg-Bench 平均达 85.81%。

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships Figure 1
2026-07-17cs.CV

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

2026-07-17视觉感知

ReBind针对多参考图像条件视频编辑中指令无法明确标注“哪一属性来自哪张参考图”的瓶颈,提出在语义位置嵌入参考 token 的稠密指令表示,并训练 ReBind-Instruct 生成绑定关系,再用 ReBind-Edit 通过跨注意力将视觉特征绑定到文本锚点。实验显示其指令质量显著优于通用 MLLM,视频编辑在 UniVBench 和 IntelligentVBench 上达到开源方法 SOTA。

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance Figure 1
2026-07-17cs.CV

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

Nanjing University, Shanghai AI Laboratory

2026-07-17视觉感知数据集/基准

针对通用视频基准难以衡量真实盲人辅助能力的问题,VIABench收集视障者第一视角长视频,统一主动提醒、VQA和视觉引导交互三类任务,并提出TPAD评估实时提醒中“何时说、何时沉默”的能力。实验显示现有多模态大模型在该场景仍不可靠,尤其难以提前、及时生成导航关键提醒。

Autoregressive Modeling of Film with Applications in Video Montage Figure 1
2026-07-17cs.CV

Autoregressive Modeling of Film with Applications in Video Montage

Marcelo Sandoval-Castañeda, Fabian Caba Heilbron, Shiry Ginosar, Bryan Rusell, Josef Sivic, Alexei A. Efros, Greg Shakhnarovich

and Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University Czech Republic

2026-07-17视觉感知

这篇论文瞄准大量原始视频难以观看、人工剪辑成本高的问题,把视频蒙太奇建模为长上下文自回归序列预测:用离散视频 token 和显式 CUT token 学习电影剪辑语法,并在推理时只从给定素材中约束解码选镜头、裁剪和排序。结果显示其在镜头顺序预测基准上超过既有方法,用户研究中生成剪辑也更受偏好;但高层叙事、音频编辑和风格条件仍受限。

Image-to-Point Cloud Registration Made Easy with Rectified Flow-based LiDAR Upsampling Figure 1
2026-07-17cs.RO

Image-to-Point Cloud Registration Made Easy with Rectified Flow-based LiDAR Upsampling

Reon Tabata, Kenji Koide, Shuji Oishi, Masashi Yokozuka, Taku Okawara, Aoki Takanose, Jun Miura

2026-07-17视觉感知生成模型三维

这篇论文针对相机与 LiDAR 点云配准中模态差异大、成对标注和外参真值获取成本高的问题,将稀疏 LiDAR 扫描投影为强度图,并用条件 Rectified Flow 补全为稠密图像,再借助预训练图像匹配器和 PnP-RANSAC 估计 6-DoF 位姿。其关键洞察是把 I2P 转化为更成熟的图像匹配问题;在未用 R3LIVE 训练的情况下达到 4.89°/1.63 m 平均误差,单次约 0.68 秒。

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models Figure 1
2026-07-17cs.AI

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

Shanghai Qizhi Institute, The Chinese University of Hong Kong, Hong Kong Embodied AI Lab, Tsinghua University, University of California, Berkeley.

2026-07-17视觉语言视觉感知

本文关注VLA模型中动作监督不仅训练动作头、还会改写预训练多模态表示的问题:直接让动作梯度作用于共享通路虽有助于形成可控表示,却会破坏语言理解和物体 grounding。作者提出以指令条件查询构成的 Action QFormer,在骨干与策略头之间重组信息并缓冲梯度传播。零样本仿真到真实导航中,任务成功率由18.8%升至56.3%,动作生成正确率由22.5%升至75.5%,并显著减少分布外指令。

Knowing You at First Glance: Inferring Apparent Personality from Faces Figure 1
2026-07-17cs.CV

Knowing You at First Glance: Inferring Apparent Personality from Faces

Shuhuan Chen, Xiangyu Zhu, Weisong Zhao, Haichao Shi, Xiao-Yu Zhang, Zhen Lei

2026-07-17视觉感知

面向社交机器人初次接触时缺少对话与多模态线索的问题,论文研究仅凭人脸图像推断“外显”MBTI印象。核心做法是用VLM语义先验增强人脸表征,并通过不确定性感知学习处理主观、噪声标注。实验称在MBTI外显人格基准上取得较强表现,并给出特质相关面部响应分析,但其预测只反映他人感知印象,不等同于真实人格。

SportD: Can VLMs Physically Strategize? Figure 1
2026-07-17cs.AI

SportD: Can VLMs Physically Strategize?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Akshaya Bharadhwaj, Anay Putty, Anirudh Ravishankar, Jaewoong Lee, Jinglin Xiao, Kyumin Andrew Shim, Mishika Ahuja, Nisarga Patil, Leo Liu, Zhuohan Liu, Weining Shen

Princeton University, Rice University, Zhejiang University

2026-07-17视觉语言

这篇论文关注VLM能否从真实视觉场景中做出有价值的物理策略决策,而不只是描述画面。作者构建SportD,用2022世界杯478个持球瞬间让模型在传球或射门间选择,并用控球价值模型评估最优动作与后悔值。结果显示,最佳VLM最优动作准确率仅31.4%,低于职业球员38.9%,且更偏向低风险、低收益选择,说明其更多是在模仿常见踢法,而非稳定评估反事实收益。

Hough-SIFT: Robust Image Registration for Linear Structures via Hough Space Figure 1
2026-07-17cs.CV

Hough-SIFT: Robust Image Registration for Linear Structures via Hough Space

Masaki Satoh

2026-07-17视觉感知安全鲁棒

这篇论文针对电子防抖等图像配准在百叶窗、栅格等强线性结构场景中容易因局部纹理重复而失配的问题,提出把图像先变换到保留纹理的 Hough 空间,再在其中做 SIFT 匹配与单应估计。核心洞察是线结构在 Hough 空间会形成更可区分的峰值。实验显示该方法在线性合成图像和真实视频上比普通 SIFT 更稳健,在普通场景中精度大体相当。

MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation Figure 1
2026-07-17cs.CV

MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation

Yinhan Zhang, Dinwei Tan, Xianghao Kong, Yue Ma, Yeying Jin, Anyi Rao

2026-07-17视觉感知

针对大规模视频扩散模型下游适配成本高、现有 PEFT 仍需大量可训练参数且奖励优化易受高噪声阶段干扰的问题,MagicPrompt 将轻量软提示直接嵌入注意力的 Key/Value 中,并结合像素空间感知奖励与潜空间自监督目标来稳定条件引导训练。实验显示其在文生视频、图生视频和控制到视频任务上以低于 1% 的可训练参数取得接近主流微调方法的效果,并显著降低训练资源需求。

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology Figure 1
2026-07-17cs.AI

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

Sinyoung Ra, Jonghun Kim, Hyunjin Park

2026-07-17视觉感知

该文针对3D脑肿瘤MRI缺少图文配对数据、现有医学VLM偏向2D影像的问题,提出用肿瘤位置和形状信息生成初始报告/VQA,再由多个LLM协同审核与修订以降低幻觉,并用VQ-GAN将3D MRI离散成视觉token进行指令微调。实验称在报告生成和VQA上优于若干2D、3D基线,但缺少放射科专家临床验证,增益可能部分来自合成数据管线的一致性。

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance Figure 1
2026-07-17cs.CV

Advanced Image Generation: Negative Prompt Optimization and Latent Classifier Guidance

Vaddi Charan Sai Nandan Reddy, Harini B, Chandana M S

2026-07-17视觉感知优化算法

针对 Stable Diffusion 仍易产生伪影、语义漂移和不服从提示的问题,论文把自动负面提示生成与潜空间分类器引导合并:用微调 Seq2Seq 生成负面提示,再由 CNN-RNN 分类器评估中间 latent 并回滚低质量更新。实验称可减少伪影、提升语义一致性,但结论也承认分类器指标和 AUC 表现偏弱,整体增益来源仍需更充分消融说明。

Skeleton: Visual Authoring of Non-visual Data Experiences Figure 1
2026-07-17cs.HC

Skeleton: Visual Authoring of Non-visual Data Experiences

Frank Elavsky, Chieri Nnadozie, Lucas Nadolskis, Patrick Carrington, Dominik Moritz

2026-07-17视觉感知

论文关注有视力的可视化作者在为图表设计屏幕阅读器/键盘导航结构时只能写代码、难以检查和迭代的问题。Skeleton 将不可见的节点、边、语义标签和遍历顺序转化为可直接操控的双视图编辑、自动脚手架、实时朗读预览和测试模式。8 名从业者的实地研究显示,可见化导航结构能帮助他们发现结构冗余、重新思考图表架构与输入方式,并把无障碍从合规补丁转为设计问题。

Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection Figure 1
2026-07-17cs.CV

Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection

Peisheng Qian, Jie Xu, Xulei Yang, Na Zhao

2026-07-17视觉感知三维

面向机器人长期部署中不断出现新类别的三维检测,论文指出现有伪标签增量方法会因新旧类别分布漂移引发遗忘,并进一步污染旧类伪标签形成恶性循环。其提出 LDMR,用按类学习动态驱动阶段内复习和跨阶段场景记忆演化。在 SUN RGB-D、ScanNetV2 的 3/5/10 阶段设置中,方法较基线持续降低遗忘并提升检测性能。

HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents Figure 1
2026-07-17cs.CV

HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

Hy Vision Team, Huawen Shen, Zhengyang Tang, Shangpin Peng, Liang Wu, Anran Zhang, Weinong Wang, Yiduo Guo, Chenxin Li, Zhengyao Fang, Yang Ding, Junyi Li, Fei Tang, Zheng Ruan, Yi Zhang, Xingran Zhou, Dingchen Yang, Sunqi Fan, Zhiyi Wan, Han Hu, Xin Lai, Pengyuan Lyu, Chengquan Zhang

2026-07-17视觉感知

移动 GUI 代理面临界面感知精细、交互数据难规模化、长程执行易累积错误的问题。HyMobileAgent 的核心不是单纯放大模型,而是把 GUI 感知数据飞轮、教程视频结构化、百万级真机/沙盒轨迹、PhoneWorld 可重置环境和带死循环检测的规划反思机制联合起来训练。实验显示其在 AndroidWorld 达到 82.6% 成功率、HyMobileOnline 达到 42%,以 A3B 规模接近或超过更大通用代理,但具体增益在各模块间的归因仍需看消融是否充分。

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents Figure 1
2026-07-17cs.CV

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

Susan Liang, Chao Huang, Filippos Bellos, Jing Bi, Jason J Corso, Chenliang Xu

University of Rochester

2026-07-17视觉感知

这篇论文针对主动视觉智能体在部署时可用交互轮数不固定的问题,指出预算过小时现有策略容易持续调用工具而被截断、不给出答案。AdaTurn将轮数预算作为条件输入,并用FA-DAPO把超预算边界训练成强制作答决策,同时配合动态预算和负载均衡调度。实验显示其在低预算下提升明显,如4轮VisualProbe-Medium从36.7%升至47.6%,且较大预算和不同骨干上基本保持性能。

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning Figure 1
2026-07-17cs.CV

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning

Yong Li, Jianwen Lou, Jiayue Ma, Yao-Xiang Ding, Youyi Zheng, Haihua Zhu

2026-07-17强化学习规划控制三维

本文针对数字正畸中牙齿从错颌到目标位姿的三维路径仍依赖人工规划、且需同时满足碰撞安全和路径效率的问题,将对齐过程建模为序贯决策的 MDP。方法在 DDPG 中引入 Transformer 交互建模、稀疏动态移动掩码和两阶段课程学习,在 1 万例专家方案数据上较基线获得更安全、更高效的几何移动路径。

SwinAD: Multi-stage feature reconstruction for unsupervised industrial anomaly detection Figure 1
2026-07-17cs.CV

SwinAD: Multi-stage feature reconstruction for unsupervised industrial anomaly detection

Huong Ninh, Chien Thai, Mai Xuan Trang, Vu-Minh Le, Thanh Ha Le, Long Tran

2026-07-17视觉感知三维

面向工业质检中多类别产品共用模型时正常模式差异大、缺陷标注稀缺且需精确定位的问题,SwinAD用冻结的Swin Transformer V2提取多尺度特征,并通过带瓶颈与dropout的多分支重构保留正常特征多样性,避免单一重构原型过度泛化。其在MVTec AD、VisA和Real-IAD上取得有竞争力的图像级检测,并在像素级定位尤其AP和F1上表现较强。

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition Figure 1
2026-07-17cs.CV

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

Qifan Zhou, Yuan Wang, Yanbin Hao, Xiang Wang, Kuien Liu, Richang Hong, Meng Wang

Qifan Zhou, Yanbin Hao, Richang Hong, and Meng Wang are with the School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China., Yuan Wang is with the School of Cyber Science and Technology, University of Science and Technology of China, Hefei, China., Xiang Wang is with the School of Artificial Intelligence and Data Science, University of Science and Technology of China, Hefei, China., Kuien Liu is with the Institute of Software, Chinese Academy of Sciences, Hefei, China.

2026-07-17视觉感知

针对生成模型从未清洗数据中学到版权、风格或不安全概念且现有擦除方法依赖特定架构的问题,Uni-AdaVD把多模态注意力的value空间作为统一干预位置,用编码器感知目标表征、正交分解和分层自适应位移在推理时抑制目标语义。实验覆盖U-Net、DiT、自回归图像和文生视频模型,显示可处理单/多概念擦除并较好保留非目标内容,且对对抗提示更稳健。

VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation Figure 1
2026-07-17cs.CV

VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

2026-07-17机器人

这篇论文针对 ObjectNav 评测中每个 episode 清空场景经验、与服务机器人反复进入同一环境不符的问题,提出跨 episode 导航设定和 VTM-Nav。其核心是把自采集经验组织成房间级与物体级的层次视觉拓扑记忆,并只在与当前观测一致时作为软引导,另用保守执行守卫减少振荡、受阻和过早停止。在 HM3D v0.1/v0.2 与 MP3D 上,VTM-Nav 相比 WMNav 及带文本跨 episode 记忆的增强基线取得更高成功率。

Compression of 3D Gaussian Splatting Data Using GPU-friendly Graphics Texture Coding Figure 1
2026-07-17cs.CV

Compression of 3D Gaussian Splatting Data Using GPU-friendly Graphics Texture Coding

Amir Said, Randall Rauwendaal

2026-07-17三维

这篇论文针对3DGS球谐颜色系数占用显存、传输和渲染带宽高的问题,提出把SH系数重排为适合GPU纹理压缩的块,并用BC1/BC7等硬件友好格式保持随机访问;关键洞察是3DGS primitive 可按颜色局部分组排序,从而弥补固定码率纹理编码的劣势。实验在 bicycle、bonsai、garden 上显示,排序后PSNR显著提升,BC7首块加BC1其余块可在约9字节/primitive下接近视觉无损。

Multi-Scale ViT Inference with Habitat-Fit Priors and kNN Retrieval for Multi-Species Plant Identification Figure 1
2026-07-17cs.CV

Multi-Scale ViT Inference with Habitat-Fit Priors and kNN Retrieval for Multi-Species Plant Identification

Alper Erten, Murilo Gustineli, Adrian Cheung

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332

2026-07-17视觉感知

本文面向植被样方图像中的多物种识别难题:训练数据多为单株单标签图像,而测试图像高分辨率、物种混杂且尺度变化大。方法以微调 DINOv2 ViT-L/14 为核心,结合多尺度切块推理、FAISS kNN 检索、重复样方的时序融合,以及地理和海拔先验的 habitat-fit 降权。消融显示 habitat-fit 与多尺度聚合贡献最大;最终在 PlantCLEF 2026 私榜宏 F1 达 0.43902,获第三名,未提交配置超过 0.45。

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation Figure 1
2026-07-17cs.CV

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

The Hong Kong University of Science and Technology (Guangzhou), Guangxi Zhuang Autonomous Region Information Center, The Hong Kong University of Science and Technology

2026-07-17视觉语言

这篇论文针对第一视角VQA中多模态大模型易在杂乱场景里定位错误、空间关系判断不足的问题,提出即插即用的ESA框架,用视觉基础模型构建Ego-element Graph,将物体语义、深度/3D位置和区域线索作为中间空间表示注入推理。实验在EgoTextVQA上显示,室内和室外设置分别提升8.14%和8.72%,但具体增益在不同模型与子任务中的来源仍需结合完整消融判断。

Immediate 3D Gaussian Splat Reconstruction of Unordered Input with Global Consistency Figure 1
2026-07-17cs.CV

Immediate 3D Gaussian Splat Reconstruction of Unordered Input with Global Consistency

Andreas Meuleman, Linus Franke, Boris Zhestiankin, Camille Montemagni, George Drettakis

2026-07-17三维

这篇论文针对3DGS采集中常见的乱序拍摄问题:传统SfM需离线处理,在线SLAM式方法又依赖顺序输入,难以及时反馈。作者用视觉地点识别与共视图做全历史快速匹配,结合局部BA、基于簇的无优化回环闭合和渐进层次高斯模型,在保持全局一致性的同时支持大场景在线重建。实验显示其可在多个数据集上处理数千张输入并给出质量较好的即时3DGS结果。

G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction Figure 1
2026-07-17cs.CV

G$^2$SR: Geometric Methods for Fast and Memory-Efficient Gaussian-based Surface Reconstruction

Dasong Gao, Vivienne Sze, Sertac Karaman

2026-07-17三维

面向机器人在线建图,少视角 3DGS 重建既要几何准确又要低延迟、低显存,而端到端大模型容易耗资源且泛化受限。G2SR 的关键是把问题拆开:用轻量网络只做 2D 高斯检测与跨视角跟踪,再用多视几何解析三角化得到尺度化 3D splat。在 ScanNet、Replica、DTU 上,其深度和网格精度达到或超过多种 SOTA,同时在 RTX 4090 上以 69–89 RPS、115–203 MB 显存运行。

Depth-Dependent Hidden-State Collapse in Dynamical System Autoencoders for LiDAR Point-Cloud Classification Figure 1
2026-07-17cs.LG

Depth-Dependent Hidden-State Collapse in Dynamical System Autoencoders for LiDAR Point-Cloud Classification

Patricia Medina, Hy P. G. Lam

2026-07-17视觉感知

本文关注 LiDAR 点云分类中 DSAE 随编码迭代深度增加可能产生的表示失效问题,动机是检验几何特征增强与动态自编码器是否能稳定保留类别信息。核心洞察是 K=5 时隐藏状态方差塌缩到约 10^-5,类间散度被总散度上界约束,因而几乎常量的表示无法支撑分类。实验显示 xyz 与加入 Product Coefficients 均发生塌缩,Random Forest、kNN 与多数类基线宏 F1 同为 0.224688,且特征增强未带来稳定改进。

Cotton-SF YOLO: Learning Structural and Frequency Cues for Early Cotton Square Detection in Complex Field Environments Figure 1
2026-07-17cs.CV

Cotton-SF YOLO: Learning Structural and Frequency Cues for Early Cotton Square Detection in Complex Field Environments

Chengjia Zhang, Yu Li, Feiri Ali, Yan Zhang, Xin Chen, Longke He, Daokun Ma, Liting Gao

2026-07-17视觉感知强化学习

本文面向早期棉蕾在田间小目标、遮挡、低对比度、模糊和光照变化下难检测的问题,基于 YOLO26m 引入动态蛇形卷积捕捉不规则边界,并用 FFT 频域调制强化边缘与纹理线索。自建田间数据集上,mAP50、mAP50:95 和召回率分别达 0.8196、0.4942、0.7939,较基线提升 1.25%、3.45%、2.96%,消融显示结构与频域 cues 互补。

Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models Figure 1
2026-07-17cs.CV

Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models

Izaldein Al-Zyoud, Abdulmotaleb El Saddik

MCRLab, School of Electrical Engineering and Computer Science, University of Ottawa, Ottawa, ON, Canada

2026-07-17视觉感知

论文关注冻结视觉基础模型能否在身份、表情和光照变化下保持人脸部件对应,而不只是学到粗略脸部布局。作者用 FaRL 仅提供区域标签,检验 DINOv3 patch 特征的跨身份近邻匹配和视频标签传播,发现中间层比最终层更保留解剖区域结构:block 18 达到 83.0% 跨身份区域准确率、95.5% 时序跟踪准确率,并在细粒度解剖匹配上明显优于 CLIP。

$K$-NeAS: Scalable Multi-Material CT Reconstruction Using Neural SDFs Figure 1
2026-07-17cs.CV

$K$-NeAS: Scalable Multi-Material CT Reconstruction Using Neural SDFs

Daksh K. Shah, Emmanouil Nikolakakis, Razvan V. Marinescu

2026-07-17三维

针对稀疏视角 CT 中剂量降低与多组织重建的需求,K-NeAS 将 NeAS 从手工设定、两材料硬选择扩展为共享潜表示加 K 个材料头的可微软选择器,并用 GMM 自动估计衰减边界、早期 floater 损失抑制伪几何。在四个临床 CBCT 数据集上,腹部 K=3 的 3D PSNR 较单材料 NeAS 提升 1.88 dB,5/10 视角下最高提升 1.17 dB,但 Jaw 场景受 GMM 边界失准影响表现下降。

Dynamic Manipulation Hypergraphs for HAR: Beyond Pairwise Relations: Dynamic Manipulation Hypergraphs for Vision-Based Human Activity Recognition Figure 1
2026-07-17cs.CV

Dynamic Manipulation Hypergraphs for HAR: Beyond Pairwise Relations: Dynamic Manipulation Hypergraphs for Vision-Based Human Activity Recognition

Fatemeh Ziaeetabar

2026-07-17机器人视觉感知

这篇论文针对细粒度操作活动中手、物体、工具和支撑面的多方关系难以用成对图充分表达的问题,提出随时间变化的操作超图,将多实体交互作为高阶超边建模,并结合接触、距离和运动耦合排序及超图消息传递。在 EPIC-KITCHENS-100/VISOR 和 Assembly101 上,HO-F1 分别较匹配成对图提升 6.9 和 9.5 个百分点,说明增益主要来自动态高阶关系建模。

Beyond scalar losses: calibrating segmentation models via gradient vector field surgery Figure 1
2026-07-17cs.CV

Beyond scalar losses: calibrating segmentation models via gradient vector field surgery

Laurin Lux, Alexander H. Berger, Moritz Knolle, Daniel Rückert, Johannes C. Paetzold

2026-07-17视觉感知优化算法

本文针对医学分割中 Dice/Tversky 等区域损失虽抗类别不均衡、却易产生过度自信概率的问题,从 logit 偏导的梯度场角度解释其校准失效:这类损失主要优化区域重叠而弱化概率误差。作者提出对梯度向量场做“手术”,按预测误差线性缩放偏导,而非设计新的标量损失;在 2D/3D 医学分割实验中显著改善校准指标,同时基本保持分割精度。

MixCompress: Mixture of Experts for Variable Rate Learned Image Compression Figure 1
2026-07-17cs.CV

MixCompress: Mixture of Experts for Variable Rate Learned Image Compression

Calvin-Khang Ta, Praneet Singh, Tong Shao, Peng Yin

2026-07-17视觉感知

针对可变码率学习图像压缩中“一个共享骨干”难以同时服务低码率平滑与高码率细节保真的冲突,MixCompress用稀疏MoE/MoD在分析、合成和超先验模块中按码率分配结构容量,并用CAT做码率条件的小波子带能量调制。实验称其在Kodak、CLIC、Tecnick上达到或超过单码率LALIC、LIC-TCM、FAT,同时减少多码率部署所需的检查点和参数存储。

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning Figure 1
2026-07-17cs.CV

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang, Dmitriy Bespalov, Wesley Rose, Huzefa Rangwala

Stevens Institute of Technology

2026-07-17视觉感知强化学习

针对现有视觉语言模型难以在多幅图像间做系统比较、变化归因和多步推理的问题,SD-MAR用可控扰动生成成对视觉场景,并以可验证奖励配合去KL的GRPO-lite和后向折扣分配强化关键推理步骤。在Qwen2.5-VL-7B与InternVL3-8B上,域内准确率最高提升36.95%,且在MME、MMMU-Pro、MathVista基本不降,MMBench还有小幅增益。

ViPSAM: Visual Prompting Medical Image Segmentation Using Segment Anything Model Figure 1
2026-07-17eess.IV

ViPSAM: Visual Prompting Medical Image Segmentation Using Segment Anything Model

San Lee, Nalee Kim, Jeong Il Yu, Hee Chul Park, Boah Kim

2026-07-17视觉感知

ViPSAM针对质子治疗计划中非增强CT肝病灶边界低对比、人工勾画依赖增强MRI且一致性差的问题,将SAM改造成跨模态视觉提示框架:用增强MRI编码软组织线索,并通过视觉引导交叉注意力和LoRA解码器适配来辅助NCCT分割。文中在匹配NCCT/MRI数据上报告其优于代表性U-Net和SAM方法,但具体增益在多大程度来自视觉提示、数据配准或SAM适配仍需更多消融说明。

DCVC-MB: Neural B-Frame Video Compression using State Space Models Figure 1
2026-07-17cs.CV

DCVC-MB: Neural B-Frame Video Compression using State Space Models

Arjun Arora, Calvin-Khang Ta, Carlos Restrepo-Galeano, Kruthi Murali, Naga Akhil E S, Arunkumar Mohananchettiar, Jay Shingala, Tong Shao, Peng Yin, Sean McCarthy

Dolby Laboratories, 2Ittiam Systems, 3University of Delaware, scalability at 1080p where transformer-based approaches fail.

2026-07-17视觉感知

这篇论文针对神经视频编码长期主要依赖 P 帧、难以高效利用 B 帧双向预测的问题,提出 DCVC-MB:在 IBP/随机访问编码中同时使用前后参考帧,并用线性复杂度的 Mamba 状态空间模型做双向特征融合,另加入熵感知 latent skipping 和推理期优化。实验报告相对既有神经编码器平均最高约 8.98% BD-rate 降低,并相对 VTM-19.0-LDP/RA 取得最高 30.45%/1.81% 改进。

XCT-SAM: Sequential Parameter-Efficient Domain Adaptation of SAM for Industrial XCT Defect Segmentation Figure 1
2026-07-17cs.CV

XCT-SAM: Sequential Parameter-Efficient Domain Adaptation of SAM for Industrial XCT Defect Segmentation

Md Mahedi Hasan, Md Mushfiqur Rahaman, Alan Pachkovskiy, Imtiaz Ahmed, Jeremy Dawson, Srinjoy Das

2026-07-17视觉感知

面向增材制造 XCT 中缺陷稀疏、低对比且跨扫描条件分布漂移大的分割问题,XCT-SAM 不直接把自然图像预训练的 SAM 迁移到 XCT,而是先用合金微结构数据适配 Conv-LoRA,再迁移到 XCT,以较少可训练参数逐步缩小域差。实验显示其在 CycleGAN-XCT OoD 与真实 NIST XCT 上优于零样本 SAM、UNet++、MedSAM、SAM-Med2D 和直接 Conv-LoRA-SAM,IoU 与 Dice 最好;但两阶段训练成本、强噪声鲁棒性和 2D 二分类设定仍是限制。

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation Figure 1
2026-07-17cs.CV

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

Department of Population Health Sciences, Weill Cornell Medicine, New York, USA, School of Physics, Mathematics and Computing, University of Western Australia, Crawley, Australia, Department of Radiology, Weill Cornell Medicine, New York, USA, Biostatistics and Health Data Science, School of Medicine, Indiana University, Indianapolis, USA, Regenstrief Institute, Indianapolis, USA, Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, USA, Department of Computational Medicine, University of California, Los Angeles, USA

2026-07-17视觉语言

胸部 CT 自动报告容易漏掉局部小病灶,且单轮多模态 LLM 生成可能缺乏医学依据。MonteRET 将全局体数据编码、10 个解剖区域表征、基于预测疾病与区域视觉语言相似度的知识检索结合,再由改写代理细化报告。在 RadGenome-ChestCT 与外部 82 例队列上,相比匹配基线和多种方法提升文本质量、语义相似度与临床指标,召回增益最明显,提示漏报减少。

3D Lane Detection with Odometry for High-Speed Vehicle Racing Figure 1
2026-07-17cs.CV

3D Lane Detection with Odometry for High-Speed Vehicle Racing

Omoruyi Atekha, John Subosits, Marcus Greiff

Massachusetts Institute of Technology (MIT), Cambridge, MA, USA., Toyota Research Institute (TRI), 94022 Los Altos, CA, USA. Email of, autonomous racing, containing transforms and labeled, with front forward-facing cameras and associated labels, nuScenes [48], but these do not come with 3D lane labels., frame {G}. To generate labels, locally visible 3D lane labels

2026-07-17视觉感知三维

这篇论文针对赛车高速、弯道和起伏路面下传统自动驾驶车道检测难以兼顾三维精度与实时性的缺口,提出 RaceLane 数据集,并用 ENSEMBLELANES 将多相机预测与 IMU、轮速里程计做时空融合。结果显示在近 300Hz 处理下,相比 BevLaneDet,F1 提升约 3 个点,近车横向 MAE 降低超过 30%,实车部署 F1 超过 0.9、横向误差小于 0.18m。

SeeSE3: Emergence of 3D Space in Vision Features Figure 1
2026-07-17cs.CV

SeeSE3: Emergence of 3D Space in Vision Features

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

2026-07-17视觉感知三维

本文追问被动训练的视觉基础模型是否会在特征空间中自发形成对应 SE(3) 的三维几何结构,而不只是能回归深度或法线。作者提出互邻域拓扑指标和 Poincaré Adapter,从静态场景中的潜在位移线性解码相机运动。实验显示若探测方式合适,若干自监督模型的低维子空间与三维欧氏空间高度相关,可支持纯 latent 的视觉里程计和定位;但动态场景与位姿/状态变化的区分仍未充分说明。

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation Figure 1
2026-07-17cs.GR

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation

NVIDIA : Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning Xu, Qi Wu, Janick Martinez Esturo, Shengyu Huang, Nick Schneider, Laura Leal-Taixe, Zan Gojcic, Sanja Fidler

2026-07-17三维

面向自动驾驶闭环仿真中逐场景优化耗时、难以规模化的问题,Instant NuRec 将短时多相机行车记录一次前向转换为可仿真的分层 3DGS 世界,包含静态/动态高斯、天空 cubemap 与相机色彩校正,并用共享 ViT 编码器和多任务解码器直接预测几何、语义与运动轨迹。实验显示其约 1.5 秒重建 10–20 秒片段,在 Waymo 上 PSNR 比最强基线高 2.01 dB,计算成本较逐场景优化低数个数量级。

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation Figure 1
2026-07-17cs.CV

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

workflows when available. The results reveal a persistent

2026-07-17视觉感知数据集/基准

针对多关键帧视频生成中“给定视觉计划能否按外观、顺序和时机被执行”缺乏专门评测的问题,论文提出 KeyFrame-Compass:386 个受控样例覆盖不同领域、结构、提示粒度、输入格式和关键帧密度,并将关键帧执行拆成存在性、保真度、顺序、定位、持续性、唯一性等指标。九个系统实验显示,当前模型在关键帧忠实度与自然视频质量间存在明显权衡,约束越密性能越差,开源模型尤其难以理解故事板网格输入。

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models Figure 1
2026-07-17cs.CV

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models

Wenxuan Chen, Wenjie Feng

University of Science and Technology of China

2026-07-17视觉感知数据集/基准

针对文本到视频模型中目标概念可能跨帧残留、而直接微调又成本高且易破坏非目标内容的问题,论文提出训练-free 的 SIRUS:用概念子空间定位提示词中的目标证据,并在采样时做局部投影与残差抑制,同时设计面向视频的遗忘、保真、质量、鲁棒性和效率评测。结果显示其在 CogVideoX 上平均遗忘成功率达 70.4%,优于 VideoEraser 的 44.4%,且 VBench 质量下降更小,并在 Wan2.2 上有一定迁移性。

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation Figure 1
2026-07-17cs.CV

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

2026-07-17视觉感知数据集/基准

面向多参考音视频生成,现有评测多停留在文本驱动、单参考保真或孤立音画对齐,难以诊断多实体绑定与跨模态组合错误。MultiRef-Compass构建350个可控样本,并用自动指标结合重判增强的MLLM评审,从基础质量、参考一致性、音画一致性和指令遵循四维14项指标评估。对8个系统的实验显示当前模型在多参考理解、绑定和自然融合上仍有明显短板。

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning Figure 1
2026-07-17cs.RO

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

2026-07-17机器人数据集/基准

面向机器人学习中真实操作数据难收集、难结构化、难复用的问题,Open-AoE把手机第一视角采集、手部/相机轨迹与原子动作标注、重建重定向和训练适配串成开放工具链。其首版汇集约2000小时、500余贡献者、400余机型和8000余任务,主要贡献在于降低数据生产与VLA、WAM、世界模型训练入口门槛,实际模型增益仍需更多消融验证。

OvAi Focus: AI-based Multi-class Segmentation of Functional Ovaries and Adnexal Masses in Gynecological Ultrasound Figure 1
2026-07-17eess.IV

OvAi Focus: AI-based Multi-class Segmentation of Functional Ovaries and Adnexal Masses in Gynecological Ultrasound

Niccolò Tallone, Francesca Salis, Pio Raffaele Fina, Roberta Massobrio, Rosilari Bellacosa Marotti, Daniele Conti, Luca Fuso, Luca Mariani, Annamaria Ferrero, Alessandro Arena, Stefano Cosma, Dan Grisaru, Angelo Lacalandra, Renato Seracchioli, Marianna Roccio, Federica Gerace

Academic Division of Gynecology and Obstetrics, University of Turin, Obstetric and Gynecology Unit, Ospedale Sant’Anna, Department of, Surgical Sciences, University of Turin, Turin, Italy, Tel Aviv Sourasky Medical Center, Tel Aviv, Israel

2026-07-17视觉感知

针对妇科超声中附件包块与功能性卵巢分割受操作者经验、形态差异和图像背景伪相关影响的问题,OvAi Focus采用级联流程:先用Fan-Beam模块隔离有效超声扇区,再用U-Net/EfficientNet进行卵巢、囊性和实性成分多类分割。在6中心1081名女性数据上独立验证,完整病灶、囊性、实性和功能卵巢DICE分别为0.87、0.85、0.68和0.62,实性与卵巢仍是较难类别。

A vision foundation model for single-cell biology via spatial gene cartography Figure 1
2026-07-17q-bio.QM

A vision foundation model for single-cell biology via spatial gene cartography

Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

Department of Electrical Engineering, Stanford University, Stanford, California, USA, Department of Radiation Oncology, Stanford University, Stanford, California, USA, Department of Biomedical Data Science, Stanford University School of Medicine, Stanford, California, USA, Department of Computer Science, Stanford University, Stanford, California, USA, Department of Medicine, Division of Oncology, Stanford University, Stanford, California, USA, Institute of Computational and Mathematical Engineering, Stanford University, Stanford, California, USA, Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, California, USA

2026-07-17视觉感知

单细胞基础模型常把基因当作无序 token,并离散化表达量,削弱共表达结构和强度信息。scVision 用最优传输把 10816 个基因固定到二维网格,将每个细胞渲染为连续表达图像,再以 ViT 掩码重建在 7200 万细胞上预训练。零样本实验中,其冻结表征在细胞类型注释和基因程序发现上优于多种基线,整合任务接近最强 token 模型且保留更多生物结构。

QFireNet: A Quantum-Enhanced U-Net for Wildfire Segmentation from Sentinel-2 Imagery Figure 1
2026-07-17cs.LG

QFireNet: A Quantum-Enhanced U-Net for Wildfire Segmentation from Sentinel-2 Imagery

Jaiman Munshi, Tanvi Tewary, Sawyer Bloom, Aidan Chu, Chetan Maviti, Kyon Winston-Bey, Harshit Badjatia, Farhan Kittur, Vardhan Madhavarapu, Varun Kota, Joshua Kwon, Nazia Rangwala-Vohra, Franz Klein (IonQ Team, App Dev Club, University of Maryland, College Park)

IonQ Team, App Dev Club, University of Maryland, College Park

2026-07-17视觉感知

针对卫星野火分割中火点稀疏、光谱维度高和气溶胶干扰带来的检测困难,论文将变分量子线路作为 U-Net 瓶颈,比较 QuFeX、QB-Net 与经典 FPN。结果显示量子模型在匹配条件下较 U-Net 基线约提升 2 个 Fire F1,但单种子下增益来源不清;更关键的洞察是 Sen2Fire 存在显著域偏移,随机混合数据可使经典 FPN 提升到 39.76。

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability Figure 1
2026-07-17cs.AI

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

Fudan University, Nanyang Technological University

2026-07-17视觉感知

本文关注已后训练的工具型智能体在新增工具后仍沿用旧工具和旧推理路径的问题,指出瓶颈是“行为惯性”而非单纯能力不足。ToolAnchor用教师模型在失败轨迹中提出反事实锚点,经学生 rollout 验证后再用于SFT和RL内化。实验覆盖GAIA、BrowseComp和VDR-Bench,显示其在扩展视觉工具集时提升新工具使用,并兼顾原有工具与推理能力。

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models Figure 1
2026-07-17cs.LG

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models

Ruijiang Dong, Zesheng Ye, Jianzhong Qi, Lei Feng, Feng Liu, Gang Niu, Masashi Sugiyama

University of Melbourne, 2 Southeast University, RIKEN Center for Advanced Intelligence Project, 4 The University of Tokyo

2026-07-17视觉语言视觉感知

论文针对黑盒视觉语言模型零样本分类中提示词集成通常对所有类别共享同一权重的问题,指出不同类别与提示模板的匹配度并不相同。CARPRT利用无标注推理数据估计类别相关的提示权重,在无需训练和访问模型内部表示的条件下重加权提示组合。实验显示其在多种细粒度分类、ImageNet及变体上优于类别无关的提示集成/重加权方法。

ReportMedSAM: Guiding Segmentation Through Radiology Reports Figure 1
2026-07-17cs.CL

ReportMedSAM: Guiding Segmentation Through Radiology Reports

Anghong Du, Theodoros N. Arvanitis, Colin Watts, Alejandro F. Frangi, Le Zhang

2026-07-17视觉感知

这篇论文针对放射报告中目标器官未显式给出、术语多变导致医学分割难以落地的问题,提出 ReportMedSAM:用冻结 BiomedCLIP 中的可学习器官概念库替代规则抽取,并通过正交约束与 MoE 路由连接到分割专家。实验在 AbdomenAtlas 3.0 上显示,其平均 Dice 为 0.647,尤其在同义词提示下保持稳定,但总体精度并未全面超过 SAM3。

DialogueVPR: Towards Conversational Visual Place Recognition Figure 1
2026-07-17cs.AI

DialogueVPR: Towards Conversational Visual Place Recognition

Yukun Song, Changwei Wang, Xingtian Pei, Shibiao Xu, Wenhao Xu, Shunpeng Chen, Yu Zhang, Ke Zhang, Rongtao Xu, Xuxiang Feng, Pengyang Wang

School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology, Macquarie University, University of Macau 6 Aerospace Information Research Institute

2026-07-17视觉感知

这篇论文针对自然语言地理定位中一次性检索难以处理描述含糊、信息不完整的问题,提出对话式地点识别 DlgPR,将视觉地点识别改为“候选分析—主动提问—再检索”的交互推理过程。其核心是 DlgQuest-Cities 基准、CMPL 跨模态检索器与 DQ-Pilot 提问代理,并用 DDI 课程采样和 PRG 奖励训练提问策略。实验显示该方法显著优于静态检索基线,但具体增益中数据构造、检索器与强化学习各自贡献仍需细看消融。

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs Figure 1
2026-07-17cs.CL

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

Northeastern University

2026-07-17视觉语言

这篇论文关注VLM在真实多轮交互中被用户反复质疑时是否仍能坚持视觉证据,而非只看单轮视频问答准确率。作者提出JKP框架,用否定、苏格拉底式追问和带上下文总结的追问连续施压10轮,并在STAR上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B。结果显示平均准确率变化不大,但轨迹层面频繁出现答案翻转、纠错和退化;重复提示的收益有限,更多暴露模型在视觉 grounding、校准与迎合用户之间的压力响应差异。

2026-07-16

102 篇
VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders Figure 1
2026-07-16cs.CV

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

The Chinese University of Hong Kong, Shenzhen, Huazhong University of Science and Technology, Shenzhen Loop Area Institute, University of Science and Technology of China

2026-07-16视觉感知生成模型

这篇论文针对传统视频 VAE/tokenizer 过度追求像素重建、语义和时空结构不足的问题,提出 VideoRAE:用冻结视频基础模型提取多尺度特征,经轻量 1D 自注意力投影压缩,并用局部-全局表征对齐解码,同时支持 DiT 连续潜变量和 AR 离散多码本量化。实验显示其在 UCF-101 上 AR/DiT gFVD 分别达 40/93,约 5 倍加速收敛,替换 LTX-VAE 的 2B 文生视频实验也提升 VBench。

From Pixels to States: Rethinking Interactive World Models as Game Engines Figure 1
2026-07-16cs.CV

From Pixels to States: Rethinking Interactive World Models as Game Engines

Zhen Li, Zian Meng, Shuwei Shi, Mingliang Zhai, Jiaming Tan, Chuanhao Li, Kaipeng Zhang

2026-07-16强化学习

本文针对视频生成式世界模型难以像游戏引擎那样处理规则、状态和实时交互的问题,提出以“动作-状态-观察”循环重审交互式世界模型,并从动作控制、状态动力学、持久性和实时生成四维梳理方法取舍。主要结果是给出统一分析框架,并构建《黑神话:悟空》90小时含动作、真实状态与视觉观测的数据引擎;具体模型增益未充分说明。

Multi-Expert Routing for Multi-Domain Low-Resource OCR: A Manchu Case Study Figure 1
2026-07-16cs.CV

Multi-Expert Routing for Multi-Domain Low-Resource OCR: A Manchu Case Study

Zhan Chen, Jiqiao Ma, Chih-wen Kuo

Institute of Advanced Studies, Beijing Normal University, Zhuhai, China, Faculty of Humanities and Social Sciences, Beijing Normal University–Hong Kong Baptist University United International College (UIC), Zhuhai, China, Department of Applied History, National Chiayi University, Chiayi, Taiwan

2026-07-16视觉感知

针对满文历史文献在正规体、奏折半草体和行书间差异大且标注稀缺的问题,论文把迭代微调过程中留下的不同检查点视为领域专家,并用轻量页面级视觉路由器按书写风格分派,而非训练单一折中模型。结果显示路由器域分类准确率达99.3%,在三类冻结测试集上分别取得0.30%、1.57%、4.83% CER,达到领域标签 oracle 的两位小数水平,但手写测试集规模较小,结论仍偏基准内验证。

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming Figure 1
2026-07-16cs.CV

M$^\text{4}$World: A Multi-view Multimodal Driving World Model for Interactive Object Manipulation and Minute-long Streaming

Ke Cheng, Hanqiao Ye, Lei Shi, Yahui Liu, Yunhan Shen, Jingtao Dong, Zhenke Wang, Wenxuan Ao, Weixiang Xu, Kaining Huang, Shuhan Shen

2026-07-16机器人视觉语言强化学习

面向自动驾驶仿真中难以同时实现物体级可控与长时稳定生成的问题,M4World用共享潜空间DiT统一多视角视频和LiDAR生成,并把3D框、类别、外观描述等融合为对象控制 token,配合多阶段因果训练实现分钟级流式 rollout。实验显示其FID/FVD优于基线,物体视觉/文本条件符合率大幅提升,并在长尾树木运输车数据增强中显著提高目标召回。

Task-Specific Feature Fusion Method for Multi-Task Affective Behavior Analysis Figure 1
2026-07-16cs.CV

Task-Specific Feature Fusion Method for Multi-Task Affective Behavior Analysis

Jiajun Sun, Zhe Gao

2026-07-16视觉感知

论文针对 ABAW11 中 VA、表情分类和 AU 检测虽共享人脸输入、却偏好不同特征与时序处理的问题,提出冻结 DINOv2 ViT-L 与 DINOv3 ConvNeXt 特征后按任务选择融合、平滑、LightGBM、阈值校准等专家配置,而非强行共享多任务结构。验证集结果为 EXPR 0.4222、AU 0.5402、VA 0.6717,总分 1.6341;但结论主要基于验证集,官方测试表现文中未充分说明。

Screening Is Effective for Visual Recognition Figure 1
2026-07-16cs.CV

Screening Is Effective for Visual Recognition

Shunya Shimomura, Kazuhiro Hotta

Meijo University

2026-07-16视觉感知

论文针对 ViT 自注意力用 softmax 相对分配权重、难以独立判定并剔除背景或冗余 patch 的问题,提出 VisionScreen,将语言模型中的 Screening 扩展到二维图像网格,用 query-key 相似度和阈值筛选实现内容与空间相关 patch 的选择性聚合。实验显示其以 5.4M 参数在 ImageNet-1k/CIFAR-100 上达到 72.5%/52.4% Top-1,高于 ViT-Tiny/16 的 68.1%/50.3%。

Music-to-Dance Generation via Atomic Movements Figure 1
2026-07-16cs.CV

Music-to-Dance Generation via Atomic Movements

Xinhao Cai, Yixuan Sun, Minghang Zheng, Qingchao Chen, Xin Jin, Song-chun Zhu, Yang Liu

2026-07-16视觉感知

论文针对现有音乐到舞蹈模型把动作当作连续序列、缺少编舞结构而导致段落不连贯和难编辑的问题,提出用可解释“原子动作”表示舞蹈:先从大规模动作中分割、聚类并借助 LLM 细化语义类别,再分两阶段完成音乐条件下的原子动作规划与扩散式动作补全。实验显示该框架在结构连贯性、节拍对齐、感知自然度和可控编辑上优于基线。

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition Figure 1
2026-07-16cs.CV

CF-Net: Conflict Fusion with Speaker Normalisation and Certainty Weighting for Ambivalence/Hesitancy Recognition

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

2026-07-16视觉感知

本文针对视频中犹豫/矛盾态度难以由单一情绪线索识别的问题,强调关键信号往往来自表情、语音与文本之间的不一致。CF-Net用冻结的视觉、音频和文本骨干提特征,先做说话人归一化以减弱身份泄漏,再用ConflictFusion显式建模跨模态差异,并结合确定性加权损失处理标注歧义。在BAH验证集Macro F1为0.7155,私有测试集为0.7364,显示较好的跨说话人泛化。

PlumeQuant: Uncertainty-aware consistency assessment of methane plume masks and emission-rate estimates Figure 1
2026-07-16cs.CV

PlumeQuant: Uncertainty-aware consistency assessment of methane plume masks and emission-rate estimates

Parisa Masnadi Khiabani, Wolfgang Jentner, Alireza Rangrazjeddi, Michael C. Wimberly, Binbin Weng, David Ebert, Charles Nicholson

Data Institute for Societal Challenges, University of Oklahoma, Norman, OK 73019, USA, Data Science & Analytics Institute, University of Oklahoma, Norman, OK 73019, USA, School of Electrical & Computer Engineering, University of Oklahoma, Norman, OK 73019, USA, School of Industrial & Systems Engineering, University of Oklahoma, Norman, OK 73019, USA, Department of Geography & Environmental Sustainability, University of Oklahoma, Norman, OK 73019, USA, Department of Electrical & Computer Engineering, University of Arizona, Tucson, AZ 85721, USA, Office of Responsible AI, University of Arizona, Tucson, AZ 85721, USA

2026-07-16安全鲁棒

本文面向甲烷羽流产品被用于核查和排放决策时的可靠性问题,提出 PlumeQuant 从已发布的栅格、掩膜、风场和标量结果出发,重算 IME、羽流长度、排放率及五项不确定性,并用遗传算法揭示同一组标量可对应多种合理掩膜。63 条 EMIT/Carbon Mapper 记录显示,CM-like 掩膜能较好复现发布量,但高置信核心仅占可行足迹中位数 13%,弱羽流和低重叠案例需人工复核。

Peak-End-Net: A Peak-End Rule Inspired Framework for Generalizable Video Aesthetic Assessment Figure 1
2026-07-16cs.CV

Peak-End-Net: A Peak-End Rule Inspired Framework for Generalizable Video Aesthetic Assessment

Geng Li, Haiwen Li, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu

Beijing University of Posts and Telecommunications, Beijing University of Posts and Telecommunications Beijing China

2026-07-16视觉感知

这篇论文针对视频美学评价中标注稀缺、主观性强且跨数据集泛化弱的问题,引入心理学“峰终定律”:用预训练图像美学头提供逐帧美学先验,突出关键高峰片段与结尾,并结合美学节奏编码和动态门控融合形成轻量 Peak-End-Net。实验在 VADB 域内评测和 DIVIDE-3K 跨域测试上报告达到 SOTA,说明显式建模人类观看记忆机制有助于提升可解释性与泛化。

A novel unsupervised machine learning strategy to handle multimodal cardiac PET/MRI data Figure 1
2026-07-16cs.CV

A novel unsupervised machine learning strategy to handle multimodal cardiac PET/MRI data

Brunnhilde Ponsi (1 and 2), Thomas Carlier (1 and 2), Lara Marteau (1 and 3), Aurélien Monnet (4), Thomas Eugène (1 and 2), Jean-Michel Serfaty (1 and 5), Nicolas Piriou (1 and 3), Hatem Necib (1 and 2) ((1) Nantes Université, CHU Nantes, Nantes, France, (2) CRCI2NA, INSERM UMR 1307, (3) Cardiology Department, CIC 1413, l'institut du Thorax, (4) Siemens Healthineers France, Courbevoie, (5) Radiology Department, France)

2026-07-16视觉语言

针对左室致心律失常性心肌病缺乏金标准、PET/MRI 多模态信息难以系统整合的问题,论文提出两阶段无监督聚类:先将患者内影像聚成超体素,再做跨患者谱聚类,并为各模态定义异常评分以生成文本和牛眼图报告。在99名患者上与影像医师记录比较,嵌套交叉验证平衡准确率为0.76±0.04,167个数值体模上BA≥0.8,但参考健康簇等参数仍含经验设定。

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning Figure 1
2026-07-16cs.CV

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

Shanghai Artificial Intelligence Laboratory, Shanghai Jiao Tong University, Sichuan University, The Chinese University of Hong Kong, Shenzhen, University of Macau

2026-07-16视觉语言强化学习

论文针对多模态RLVR只奖励答案正确、易让视觉语言模型依赖语言先验而非图像证据的问题,指出同一视觉扰动在不同样本上会产生下降或稳定等异质效果。SIVA-RL用PatchSwap构造局部干预,再由冻结审计策略按实际奖励下降为样本分配敏感性或不变性对齐权重,避免按扰动类型硬设监督方向。在9个推理基准上,3B/7B模型相对GRPO、DAPO基线均有提升,视觉依赖任务增益达8.79个百分点。

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data Figure 1
2026-07-16cs.CV

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

2026-07-16生成模型

针对自动驾驶在雨雾雪等天气下感知退化、而真实成对天气数据难以采集的问题,Cyclone 将潜在扩散模型用于无配对天气编辑,引入循环一致性保持场景结构,并用预训练图文模型蒸馏约束避免退化为恒等映射。实验显示其生成/去除天气更真实且结构更稳定,并在深度估计、语义分割、检测等下游感知任务上带来一致提升,还可蒸馏到视频扩散模型以改善时序一致性。

Thresholded Cross-Attention for Reliable Intensity-Chromaticity Fusion in Low-Light Image Enhancement Figure 1
2026-07-16cs.CV

Thresholded Cross-Attention for Reliable Intensity-Chromaticity Fusion in Low-Light Image Enhancement

Yanyi Wu, Xu Zhang, Junkai Chen, Laibin Chang, Jiaqi Ma, Shi Chen, Linwei Zhu, Jianglei Di, Huan Zhang

2026-07-16视觉感知

这篇论文针对低光增强中 HVI 强度/色度解耦后如何可靠再融合的问题,指出固定比例 Top-K 注意力会在不同层的置信分布下误删有效依赖或保留噪声。其核心是用固定置信阈值的 TCA 自适应保留跨流交互,并配合相位引导频域初始化、残差强度引导和尺度一致正则。实验显示在 LOL、Sony-Total-Dark、LSRW-Huawei 等基准上取得有竞争力的恢复效果、更好的色彩保真度,且参数量约 2.75M。

The 2nd International StepUP Competition for Biometric Footstep Recognition: From Steps to Strides Figure 1
2026-07-16cs.CV

The 2nd International StepUP Competition for Biometric Footstep Recognition: From Steps to Strides

Robyn Larracy, Anant Gupta, Gourav Gupta, Ethan Eddy, Maxime Devanne, Cyril Meyer, Jin-Chern Chiou, Yueh-Shan Lee, Zong-Han Lu, Aaron Tabor, Erik Scheme

* University of New Brunswick, Canada, § Institute of Electrical and Control Engineering, National Yang Ming Chiao Tung University, Taiwan

2026-07-16视觉感知

本文针对压力足迹生物识别在真实部署中受鞋类、步速和少量注册样本影响而泛化困难的问题,报告第二届 StepUP 竞赛的评测设计与结果:在 20 万余足迹的 StepUP-P150 和未公开测试集上,引入更强跨域条件与左右连续足迹的 stride 级验证。结果显示,利用时序模式、左右步融合及推理期归一化/校准可提升表现,最佳 EER 为 8.00%;但对未见个人鞋类和相似干扰者的鲁棒识别仍是主要瓶颈。

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding Figure 1
2026-07-16cs.CV

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding

Guoliang You, Xiaomeng Chu

2026-07-16视觉语言视觉感知生成模型

本文针对CT视觉语言预训练中过度依赖全局扫描-报告对齐、器官级对齐仍混合多种影像表现的问题,提出OCP-CT:用稀疏MoE按潜在放射模式路由图像和文本证据,再由器官槽聚合成模式token,并用带临床相似性的软目标做跨模态对比学习。在CT-RATE和RAD-ChestCT零样本异常诊断上AUROC达84.5%和69.9%,较最强既有结果提升6.7和0.8个百分点。

PiVoT: A Variational Solution for Real-time Large-scale Multi-object Detection and Tracking under Heavy Clutter Figure 1
2026-07-16cs.LG

PiVoT: A Variational Solution for Real-time Large-scale Multi-object Detection and Tracking under Heavy Clutter

Runze Gan, Qing Li, Simon J. Godsill, Mike E. Davies, James R. Hopgood

2026-07-16视觉感知

面向标注稀缺雷达场景中强杂波、大规模多目标和多普勒点云带来的检测跟踪难题,PiVoT将泊松测量模型下的目标状态、形状、存在概率、关联和测量率统一做变分推断,并通过出生剪枝、精确更新的线性化复杂度和高效多普勒建模提升实时性。实验显示其在汽车和海事雷达中优于现有贝叶斯跟踪器,可扩展到千目标,并接近深度检测基线且无需训练。

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild Figure 1
2026-07-16cs.CV

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

2026-07-16视觉语言视觉感知

本文针对现有 HOI 检测依赖封闭标签和标注训练、难以处理开放场景与组合交互的问题,提出训练免费的 AgentHOI,将多模态大模型用于交互语义推理,并结合 grounding 模块完成定位;其关键在于多轮上下文推理补全遗漏交互,以及用语义、空间和外观描述缓解实例定位歧义。实验称其在真实开放设置下优于监督和弱监督方法,但具体增益在多大程度来自所调用基础模型能力仍需结合完整实验细节判断。

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models Figure 1
2026-07-16cs.CV

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

2026-07-16视觉语言三维

本文针对医学MLLM难以从2D图像理解迁移到CT/MRI等3D体数据、且现有VQA或报告数据缺少显式推理监督的问题,提出Hounsfield-CoT:用Observer-Synthesizer按放射科逐层阅片流程生成11.2k切片级空间CoT,强化连续空间跟踪、多切片感知和鉴别排除。基于该数据微调2D预训练模型后,在多个3D医学基准上显著优于2D基线,并接近高成本原生3D架构,但推理链仍可能受全局报告合成带来的空间幻觉影响。

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads Figure 1
2026-07-16cs.RO

Recursive ArUco Markers: A Scalable Fiducial Marker Design for Unmanned Aerial Vehicle Landing Pads

Rafael Munoz-Salinas, Francisco Jose Romero-Ramirez, Sergio Garrido-Jurado

Department of Computer Science and A.I., Universidad de Córdoba, 14071, Córdoba, Spain, Department of Electronics and Computer Engineering, Universidad de Córdoba, 14071, Córdoba, Spain

2026-07-16视觉感知

面向无人机降落中相机距离快速变化、普通 ArUco 近远距离易失效的问题,论文提出递归 ArUco:在父标记黑白比特内都嵌入同一完整标记,并用边界采样避免依赖中心区域。其结果是同一 ID 可跨尺度识别,支持任意递归深度和部分遮挡下检测,并使多架无人机可按不同标记 ID 分配降落点。

Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning Figure 1
2026-07-16cs.CV

Multimodal Assessment of Pancreatic Cancer Resectability Using Deep Learning

Vincent Ochs, Christoph Kuemmerli, Florentin Bieder, Julia Wolleb, Joel L. Lavanchy, Julia Ruppel, Jan Liechti, Stephanie Taha-Mehlitz, Christian Andreas Nebiker, Beat Mueller, Giuseppe Kito Fusai, Joerg-Matthias Pollok, Anas Taha, Philippe C. Cattin, Sebastian Staubli

2026-07-16视觉语言

胰腺癌可切除性判断依赖肿瘤与周围血管关系,临床读片一致性不足。本文将3D增强CT与17项临床变量融合,用Swin-UNETR在训练期通过胰腺、肿瘤和血管辅助分割学习解剖感知特征,并用动态多任务损失平衡分割与分类;推理时无需分割掩码。159例嵌套交叉验证AUC 0.86、准确率0.85,52例外部验证AUC 0.86、准确率0.87,显示一定跨机构泛化能力。

TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model Figure 1
2026-07-16eess.IV

TCAM-Diff: Triplane-Aware Cross-Attention Medical Diffusion Model

Zhenkai Zhang, Krista A. Ehinger, Tom Drummond

2026-07-16生成模型

针对高分辨率3D医学影像生成中显存开销大、细节易在自编码压缩中丢失的问题,TCAM-Diff将密集体数据学习为三平面表示,并用解码器-only重建与三平面感知交叉注意力扩散模型生成特征。实验覆盖脑肿瘤、胰腺和结肠数据,报告在相近潜空间规模下较VAE-GAN、VQ-GAN等取得更好的MSE、SSIM和W-GAN critic生成质量。

Bake It Till You Make It: Ultrafast Spatial Texture-Atlas Splatting Figure 1
2026-07-16cs.CV

Bake It Till You Make It: Ultrafast Spatial Texture-Atlas Splatting

Neel Kelkar, Simon Niedermayr, Kaloian Petkov, Klaus Engel, Rüdiger Westermann

Technical University of Munich, Siemens-Healthineers, Technical University of Munich, Technical University of Munich, Siemens-Healthineers Munich Germany, Technical University of Munich Munich Germany

2026-07-16视觉感知

这篇论文针对3D Gaussian Splatting在高频纹理场景中需要大量 primitive、而神经哈希纹理查询又拖慢推理的问题,提出将几何和外观解耦:用2D Beta surfel表示低频几何与视角相关颜色,用视角无关哈希网格学习纹理残差,并在推理前烘焙成紧凑RGB纹理图集。配合透明度和falloff稀疏正则,方法显著减少surfel和overdraw,在保持接近SOTA画质下相对3DGS最高约5-6倍加速,可在消费级硬件实现4K 60 FPS。

AspectCLIP: Optimizing CLIP Representation Space via Aspect-Guided Consistency Regularization Figure 1
2026-07-16cs.CV

AspectCLIP: Optimizing CLIP Representation Space via Aspect-Guided Consistency Regularization

Yiyang Yao, Shanglin Liu, Jianming Lv, Chengjun Wang, Jinyi Li, Yuchan Jie, Zhihua Jin

2026-07-16视觉感知

本文针对 CLIP 训练中图像信息丰富而文本只描述局部方面导致的表示空间几何不一致,指出全局一致性正则会错误约束“视觉相似但文本关注点不同”的样本。AspectCLIP 用文本语义聚类识别属性一致组,组内施加完整循环一致性,组间仅做原型级约束。实验显示其在下游任务和一致性指标上优于传统正则方法,但具体增益与聚类质量的关系仍需更多说明。

RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics Figure 1
2026-07-16cs.CV

RainDancer: RGB-Event Video Deraining with Rain-Oriented Spiking Dynamics

Kui Jiang, Runzhe Li, Zhaocheng Yu, Guanglu Sun, Junjun Jiang, Xianming Liu

2026-07-16视觉感知

RainDancer针对动态雨天视频中RGB帧难以区分雨纹、纹理、运动边界与遮挡的问题,引入事件相机的高时间分辨率线索,但核心不是直接融合,而是先在RGB和事件模态内分解雨/背景成分,再用雨导向SNN捕捉稀疏突发雨动态并做成分级交互。实验显示其在合成与真实RGB-Event去雨数据上优于RGB和事件引导方法,并提升下游感知鲁棒性。

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation Figure 1
2026-07-16cs.CV

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation

Kamran Shahid, Muhammad Munwar Iqbal

¹ Department of Computer Science, University of Engineering and Technology, Taxila, Pakistan, although these inputs are produced at different stages of care. Indication is available before interpretation, whereas Findings and Impression are written after image review. When report-derived labels are predicted, from the same post-hoc text, high performance may reflect access to the label source rather than independent, substantial report-label circularity., report-label circularity, and Indication operates with information that could be available before a report is issued. A model, [2]. Automated report labelers such as CheXbert convert radiology text into structured observations, at a scale that would be difficult to achieve through manual annotation [3]. Those labels remain, findings. VisualCheXbert was developed partly in response to evidence that report-derived labels and, image-derived labels can disagree [4]. If Findings or Impression are supplied to a model whose, available information is limited to the images and the Clinical Indication. The distinction is not

2026-07-16视觉感知数据集/基准

本文针对胸片多图像分类中临床指征、报告正文与标签来源混杂的问题,区分报告前可用信息和报告后泄漏信息,并用患者聚类评估多种融合设计。结果显示,临床指征比双图像更强,融合后AUROC约0.78;SectionGuard-MI仅小幅提升AUROC但显著提升AUPRC。报告文本模型AUROC接近0.98,说明高分很大程度来自报告-标签循环,增益来源仍需谨慎解释。

EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent Figure 1
2026-07-16cs.CV

EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent

Junlong Li, Junxi Li, Yuxiang Yang, Wenbin Zou, Lap-Pui Chau, Yi Wang

The Hong Kong Polytechnic University, The Hong Kong Polytechnic University Hong Kong China, South China University of Technology Guang Zhou China

2026-07-16视觉感知

面向可穿戴助手和机器人在做饭、装配等日常任务中的第一视角理解需求,论文指出现有 VQA 基准缺少对关键步骤、顺序和完整性的系统评测。其核心贡献是提出 EgoProceVQA 六类关键步骤问题、EgoProceGen 生成 3600 个问答,并设计免训练的 EgoProceAgent 通过工具库和子技能自探索组合策略。实验显示现有 MLLM 仍明显不足,EgoProceAgent 在多项任务上达到开源模型最优,但具体增益幅度文中片段未充分说明。

Anatomically Faithful but Temporally Blind: Auditing Attribution for Left-Ventricular Ejection-Fraction Estimation from Echocardiography Figure 1
2026-07-16cs.CV

Anatomically Faithful but Temporally Blind: Auditing Attribution for Left-Ventricular Ejection-Fraction Estimation from Echocardiography

Hyunkyung Han, Min Jung Kim

2026-07-16视觉感知

这篇论文关注超声心动图视频中射血分数估计的可解释性风险:模型热图看似落在左心室,并不代表抓住了临床关键时刻。作者用 VideoMAE 与 R(2+1)D 在 EchoNet-Dynamic 上审计空间、扰动和时间归因,发现两者左心室定位显著高于随机,但对收缩末/舒张末帧的时间定位接近随机;遮挡实验进一步表明模型本身也未优先依赖这些决定性帧。

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs Figure 1
2026-07-16cs.CV

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

University of Science and Technology of China, State Key Laboratory of Communication Content Cognition, People’s Daily Online, University of Science and Technology of China Hefei China, State Key Laboratory of Communication Content Cognition, People’s Daily Online Beijing China

2026-07-16视觉语言优化算法

本文针对多模态大模型的幻觉与不忠实推理问题,指出错误常源自早期视觉 grounding 并在后续推理中传播,而传统 DPO 只在最终答案层面对齐。Groc-PO 的核心是构造 GCPD,将偏好监督拆到目标定位、上下文 grounding 与 grounded reasoning 三阶段,并用阶段/难度自适应损失训练。实验显示其相较 DPO 等基线在幻觉抑制、上下文理解和复杂忠实推理上更好,但具体增益仍可能部分来自数据设计。

Towards a Modular Bin-picking Framework for Handling Object Pose Uncertainties Figure 1
2026-07-16cs.RO

Towards a Modular Bin-picking Framework for Handling Object Pose Uncertainties

Frederik Hagelskjær

2026-07-16三维

面向工业 bin-picking 中姿态估计歧义与抓取误差会导致插入失败的问题,论文提出可插拔框架,将物体姿态分布、第二视角分布融合、手中位姿验证和重定向托盘组合起来决策。真实系统在三类物体上测试无失败,各模块均提升效率;但当前只处理 SO(2) 不确定性,扩展到完整 SE(3) 仍待验证。

Barnamala: Parameter-Efficient Handwritten Devanagari Recognition at Benchmark Saturation Figure 1
2026-07-16cs.CV

Barnamala: Parameter-Efficient Handwritten Devanagari Recognition at Benchmark Saturation

Ashish Thapa, Samrat Karki

2026-07-16视觉感知数据集/基准

针对 DHCD 手写天城文识别已接近 99.7% 饱和、继续堆大模型难以证明有效的问题,论文提出 1.11M 参数的 Barnamala 紧凑卷积网络,并用精确 McNemar 检验与 Wilson 区间重新评估榜单差异。结果显示其达 99.73%,与 17.32M 参数强基线统计等价,且所有配置共享 11 个错误的内在下限;模型还实现 15.6 倍参数压缩、9.5 倍 CPU 加速,并在数字迁移和扰动鲁棒性上优于大模型。

DNA: Dual-stage Native Attribution for Generated Image Source Tracing Figure 1
2026-07-16cs.CV

DNA: Dual-stage Native Attribution for Generated Image Source Tracing

Chao Wang, Kejiang Chen, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu

Chao Wang, Kejiang Chen, Zijin Yang, Yuang Qi, Weiming Zhang and Nenghai Yu are with the University of Science and Technology of China, Hefei, China

2026-07-16视觉感知

这篇论文面向生成图像取证中“同一模型家族内不同变体”难以追源的问题,指出潜在生成模型的归因线索具有层级性:VAE 更反映家族共享信息,backbone 更保留变体差异。方法以 AEDR 做开放集家族筛选,再用 NPC 比较多噪声水平下的原生预测一致性完成细粒度归因;在 DNA-30K 上端到端准确率达 89.11%,较最强基线仍高 33.81%。

Calibrated Closed-Form Uncertainty for Radiative Gaussian Splatting in Sparse-View CT Figure 1
2026-07-16cs.CV

Calibrated Closed-Form Uncertainty for Radiative Gaussian Splatting in Sparse-View CT

Chulin Zhao, Yiran Xu, Shu Liu

Dundee International Institute, Central South University, Central South University

2026-07-16三维安全鲁棒

这篇论文针对稀疏视角 CT 中辐射 Gaussian Splatting 只能给出点估计、难以判断重建可信区域的问题,利用 X 射线投影和体素化对高斯密度严格线性的性质,推导单次前向即可计算的闭式体素与投影不确定性,并系统评估校准性。结果显示其不确定性在 15 个场景中 14 个能较好排序真实误差,且覆盖门控的采集策略以约十分之一评分成本接近并替代启发式集成方法。

Towards Spatial Supersensing in the Wild Figure 1
2026-07-16cs.CV

Towards Spatial Supersensing in the Wild

Tianjun Gu, Tianyu Xin, Kuan Zhang, Bowen Yang, Kok-Chung Chua, Peize Li, Xinran Zhang, Yupeng Chen, Qiyue Zhao, Qinlei Xie, Jianhang Liu, Yucheng Lu, Yinan Han, Marco Pavone, Yiming Li

Tsinghua University, Stanford University

2026-07-16视觉感知

这篇论文针对现有空间 supersensing 评测偏向合成、室内和物体中心的问题,提出 VSI-Super-Wild:用 442 段真实长视频和 6980 个人工验证问答,从观察者运动、物体、地点与全局环境三类锚点设计四项任务。对 13 个主流多模态模型的结果显示,模型在长时序世界状态维护上普遍接近随机,尤其随时间跨度和空间复杂度增加明显退化,暴露出空间坍缩、语义捷径、更新不足和实例混淆等失败模式。

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching Figure 1
2026-07-16cs.CV

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching

Zehan Liu, Yage He, Xianwu Gong

School of Electronics and Control, Chang’an University

2026-07-16视觉感知

这篇论文针对迭代式立体匹配中相关体搜索与特征 warping 残差 refinement 被割裂建模、且 ConvGRU 难以处理弱纹理区域全局约束的问题,提出 WAVE-Stereo:用 GWCE 在更新输入中并行融合匹配候选、跨视角对齐残差和视差先验,并用 PGCP 周期性注入低分辨率全局上下文。实验显示其在 Middlebury、ETH3D、KITTI、Booster 等零样本评测中保持竞争精度,同时无需外部基础模型,KITTI 2015 D1-all 为 3.18%,推理约 66ms。

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge Figure 1
2026-07-16cs.CV

Learning Speaker Identity Beyond Language and Modality Constraints: Insights from the POLY-SIM 2026 Challenge

Marta Moscati, Muhammad Saad Saeed, Marina Zanoni, Mubashir Noman, Rohan Kumar Das, Monorama Swain, Yassin Terraf, Yufang Hou, Elisabeth Andre, Khalid Mahmood Malik, Markus Schedl, Shah Nawaz

Institute of Computational Perception, Johannes Kepler University, University of Michigan-Flint, Mohamed bin Zayed University of Artificial Intelligence, College of Computing, Mohammed VI Polytechnic University, IT:U Interdisciplinary Transformation University, University of Augsburg, Institute of Computational Perception, Johannes Kepler University Albatross AI Linz Austria, University of Michigan-Flint Flint United States of America, Mohamed bin Zayed University of Artificial Intelligence Abu Dhabi United Arab Emirates, Institute of Computational Perception, Johannes Kepler University Linz Austria, College of Computing, Mohammed VI Polytechnic University Benguerir Morocco, IT:U Interdisciplinary Transformation University Linz Austria

2026-07-16优化算法

论文针对现实说话人识别中常见的视觉缺失与跨语言语音迁移问题,提出 POLY-SIM 2026 挑战作为标准化评测框架,基于 MAV-Celeb 构建英语训练、英语/乌尔都语测试及有脸/缺脸四种协议,并提供双分支人脸-语音基线与 starter kit。其主要贡献是明确衡量多模态模型在部分输入和语言变化下的泛化能力;定量结果和方法间增益文中未充分说明。

Fine-grained CLIP fine-tuning with self-annotated region alignment Figure 1
2026-07-16cs.CV

Fine-grained CLIP fine-tuning with self-annotated region alignment

Chenyang Zhao, Wei Lin, Antoni B. Chan, Janet H. Hsiao

Department of Computer Science, City University of Hong Kong, Division of Social Science, Hong Kong University of Science & Technology

2026-07-16视觉感知

论文针对 CLIP 只做图文全局对齐而导致区域级 dense 表征较弱的问题,提出 SFF-CLIP:在微调时从原始句子中抽取概念短语,并用文本特定热力图在线聚合对应区域特征,实现无需额外框、类别或区域描述的自标注区域-短语对齐,同时保留图文全局对比目标。实验显示其在开放词汇检测、分割等细粒度任务上优于既有微调方法,并基本维持原 CLIP 的图像级能力。

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion Figure 1
2026-07-16cs.CV

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

University, Figure 1: FreeLit enables paired-free controllable indoor relighting from a single image. The red box highlights the user-specified, trollable indoor relighting that explicitly manipulates light-source, controllability-oriented evaluation metrics to quantify alignment, sistent, and controllable relighting, with improved robustness in, Controllable Relighting, Unpaired Learning, Physics-Guided Learn-, lenge in this problem is to enable light-source-level controllability, out physical control, or provide controllability at the cost of, trollable indoor relighting from a single image. Our approach com-, as PSNR and LPIPS do not adequately reflect controllability with, controllability-oriented metrics that explicitly measure alignment, • Paired-free controllable indoor relighting. FreeLit en-

2026-07-16生成模型

室内单图重打光需要按光源位置、颜色和强度精细控制,但成对多光照数据昂贵,逆渲染又在低光下反照率不稳。FreeLit用内在属性构造物理引导光照图和伪重打光监督,再以扩散模型生成结果,并用重打光一致性蒸馏稳定反照率。实验显示其在低光场景中光色与强度控制更一致、几何和阴影保持更稳,但具体增益相对数据规模的来源仍需更多验证。

T3HG-Editor: Text-driven 3D Human Garment Editing with Body Priors Embedded in SMPL-X Figure 1
2026-07-16cs.CV

T3HG-Editor: Text-driven 3D Human Garment Editing with Body Priors Embedded in SMPL-X

Shaoru Sun, Xingtao Wang, Zihan Ma, Wenrui Li, Jiantao Zhou, Debin Zhao, Xiaopeng Fan

2026-07-16三维

面向文本驱动的三维人体服装编辑,论文指出直接把多视角2D编辑结果更新到3D Gaussian容易产生服装形变失真、跨视角不一致和非目标区域污染。T3HG-Editor的核心洞察是把SMPL-X的身体几何与关节先验嵌入编辑流程:沿法线播种可编辑高斯,用同一SMPL-X顶点聚合多视角token,并结合SDF距离场与2D语义掩码裁剪溢出高斯。实验称其在多主体、多服装类型上优于现有方法,主要体现在编辑质量和服装一致性。

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation Figure 1
2026-07-16cs.CV

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

Shanghai Jiao Tong University, Shanghai Artificial Intelligence Laboratory, Southeast University, National University of Singapore, Zhejiang University, University of Oxford, available at github.com/InternRobotics/REAL., © 2026 Shanghai Artificial Intelligence Laboratory. All rights reserved., To resolve these issues, we present REAL (exploRatory, communicativE, And, deployLable), an

2026-07-16机器人视觉感知强化学习

本文针对具身机器人基准依赖仿真特权感知、默认指令明确而难以真实部署的问题,提出 REAL:去除 oracle 物体/位姿接口,用 RGB 探索、检测与视觉提示支撑操作,并引入模拟用户做动态意图澄清;在此上用任务生成、SFT 与在线 RL 训练 Qwen3-VL-8B。REAL-Bench 上交互任务成功率达 56.9%,实体双臂移动机器人 60 次测试端到端成功率为 78.3%。

From Surface Forecasting to Observability Forecasting: A Latent World Model for Cloud-Aware EO Monitoring Figure 1
2026-07-16cs.CV

From Surface Forecasting to Observability Forecasting: A Latent World Model for Cloud-Aware EO Monitoring

Mohanad Albughdadi

European Centre for Medium-Range Weather Forecasts

2026-07-16强化学习

这篇论文把地球观测中的云遮挡问题从“预测地表长什么样”改写为“预测何时可观测”,用基于 JEPA 的 LeWorldModel 学习潜在可见性状态,并结合多光谱、云掩膜和天气协变量。结果显示它显著优于持久性基线,在下一步可用性和首次可用时间预测上表现强,尤其在精确恢复时机上多数划分超过 LightGBM,但 OOD 鲁棒性仍不如后者。

Beyond Color Geometry: Evaluating Human-Like Color Representations in Vision Models Figure 1
2026-07-16cs.CV

Beyond Color Geometry: Evaluating Human-Like Color Representations in Vision Models

Ayan Igali, Pakizar Shamoi

2026-07-16视觉感知

这篇论文关注视觉模型的颜色表征是否接近人类,而不只是符合 CIELAB 等几何距离或硬颜色标签。核心创新是用 COLIBRI 的 86 个模糊人类颜色类别评估 ViT 编码器,并在控制颜色几何后衡量分级对齐。结果显示,各模型在类别边界和紧致性上相近,但 MAE 在超越几何的对齐上明显领先;不过模型同时差异于数据、规模和训练配置,增益来源不清。

Human4K: A Large-Scale 4K Multi-View Mocap Dataset for Whole-Body 3D Human Reconstruction Figure 1
2026-07-16cs.CV

Human4K: A Large-Scale 4K Multi-View Mocap Dataset for Whole-Body 3D Human Reconstruction

Tianshun Han, Ziyu Shi, Lijian Liu, Ajian Liu, Benjia Zhou, Hugo Jair Escalante, Yanyan Liang, Sergio Escalera, Zhen Lei, Jun Wan

2026-07-16数据集/基准三维

针对现有三维人体重建数据在高分辨率图像、精确全身标注和复杂遮挡动作上难以兼顾的问题,Human4K构建了八视角4K与Vicon同步采集的600万帧数据,并用MRRM将动捕结果细化为SMPL-X标注,重点改善手、脚等末端对齐。实验显示,用该数据训练可在标准基准上提升全身重建,尤其对深度歧义和自遮挡姿态更明显;但增益可能主要来自scaling / data。

OvisOCR2 Technical Report Figure 1
2026-07-16cs.CV

OvisOCR2 Technical Report

Shiyin Lu, Yinglun Li, Yu Xia, Yuhui Chen, An-Yang Ji, Jun-Peng Jiang, Qing-Guo Chen, Jianshan Zhao, En Lin, Haijun Li, Cheng Qin, Zhao Xu, Weihua Luo

2026-07-16视觉感知

本文针对文档解析中流水线方法部署复杂、误差逐级累积,而端到端模型性能落后的问题,提出0.8B的OvisOCR2,将页面图像直接生成按阅读顺序组织的Markdown。核心在于结合真实标注清洗与HTML同源合成数据,并用4B分支强化学习、在线蒸馏和模型融合提升小模型。结果在OmniDocBench v1.6得96.58、PureDocBench Avg3得75.06,并在内部长尾场景评测中整体最优。

FastCentNN: Accelerating Centroid Neural Network with Entropy Proxy Figure 1
2026-07-16cs.LG

FastCentNN: Accelerating Centroid Neural Network with Entropy Proxy

Le-Anh Tran

2026-07-16视觉感知

这篇论文针对 Centroid Neural Network 在每次质心分裂前常陷入低移动、低信息量训练阶段的问题,提出 FastCentNN:用每轮总质心位移作为训练不确定性的熵代理,在位移低于阈值并持续若干轮时提前触发分裂,同时保留原有 winner-loser 更新。实验显示其聚类质量基本不变,在二维合成数据上最高提速约 16%,在 MNIST/Fashion-MNIST 上约 5%。

Video to All-in-focus Image Reconstruction Algorithm for Automated Microscopic Urinalysis Figure 1
2026-07-16eess.IV

Video to All-in-focus Image Reconstruction Algorithm for Automated Microscopic Urinalysis

Chinmay Nema, Hari Om Aggrawal, Dipam Goswami, Rajiv Gupta, Vinti Agarwal

Date:Chinmay Nema, Dipam Goswami, and Vinti Agarwal are with Birla Institute of Technology and Science Pilani, India. Hari Om Aggrawal is an independent researcher, India

2026-07-16视觉感知三维

针对尿液样本多层结构导致单一焦平面下细胞易失焦、低成本实验室又缺少自动对焦设备的问题,论文提出用手动调焦视频替代多焦平面逐张采集,并通过基于图像块的全聚焦重建生成可供深度模型检测分类的复合图像。14段真实实验室视频验证中,流程最高达到95%阳性预测值和70%真阳性率,但样本规模较小,泛化能力仍文中未充分说明。

Semantic Anchoring for Robotic Action Representations Figure 1
2026-07-16cs.RO

Semantic Anchoring for Robotic Action Representations

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

Peking University, Eastern Institute of Technology, Ningbo, Shanghai Jiao Tong University

2026-07-16机器人

本文针对 VLA 在少量机器人示范上微调时语义结构被动作监督冲淡、导致泛化下降的问题,提出用预训练语义流形衡量并锚定动作表征。核心洞察是动作表征应保留意图级语义结构,并通过共享/私有通道分解与对比对齐在训练期修复,推理时无额外开销。实验显示该结构与 OOD 成功率同步,方法在仿真和真实平台上提升 ID 与 OOD 表现,真实任务最高分别增益 18.7% 和 21.5%。

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets Figure 1
2026-07-16cs.CV

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets

Xian Li, Rong Wei, Lujie Yang, Haolin Huang, Junyuan Fang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

Zhejiang University, 2 Manycore Tech Inc., University of Electronic Science and Technology of China

2026-07-16视觉语言三维

这篇论文针对现有3D资产虽具视觉外观但缺少关节、材料、密度、摩擦等统一物理语义,难以直接用于机器人仿真交互的问题,提出UniPhys流水线、UniPhys-40K/Bench数据集及UniPhysGen模型,将关节语义与内在物理属性联合建模,并用几何鲁棒关节 grounding 和仿真验证减少结构分解差异带来的偏差。实验显示其在关节 grounding 和物理属性估计上达到多数设置下的SOTA,生成资产可部署到仿真环境。

Visual Place Recognition Using Rate-Encoded Spiking Neural Networks with Discrete STDP Learning Figure 1
2026-07-16cs.NE

Visual Place Recognition Using Rate-Encoded Spiking Neural Networks with Discrete STDP Learning

Altzi Tsanko, Oikonomou Katerina Maria, Antonios Gasteratos

2026-07-16视觉感知

这篇论文针对视觉地点识别中 STDP 脉冲网络分类准确率高但零误报召回不足的问题,提出离散、张量化的 SNN-VPR 实现,并把神经元概率分配、查询间状态重置和速度补偿序列聚合作为关键推理设计来消融。结果显示概率分配将 Nordland 100 地点 R@100P 从 44.13% 提升到 77.93%,k=5 滑窗达到 100%,但部分增益来源仍未充分分离。

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning Figure 1
2026-07-16cs.CV

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

Kaicong Huang, Weiheng Oh, Ruimin Ke

Rensselaer Polytechnic Institute, Rensselaer Polytechnic Institute Troy NY USA

2026-07-16视觉语言视觉感知

论文针对公交车载长视频中乘客上下车与支付行为难以用监督模型标注、直接用 VLM 又成本高且易失焦的问题,提出 GHR-VLM:先在边缘端用门状态、检测和跟踪把视频压缩为乘客级时空证据,再由后端 VLM 做上车识别与支付分类。486 分钟真实公交视频实验显示该混合推理能支持零样本乘客级支付分析,但低质画面下仍存在明显挑战。

Nexus: Native Mesh Generation with Diffusion Figure 1
2026-07-16cs.CV

Nexus: Native Mesh Generation with Diffusion

Hanxiao Wang, Ying-Tian Liu, Yuan-Chen Guo, Qi-Yuan Feng, Zi-Xin Zou, Ding Liang, Biao Zhang, Yan-Pei Cao

MAIS, Institute of Automation, Chinese Academy of Sciences, School of Artificial Intelligence, University of Chinese Academy of Sciences, Tsinghua University, Xi’an Jiaotong University, School of Artificial Intelligence, University of Chinese Academy of Sciences Beijing China, Tsinghua University Beijing China, Xi’an Jiaotong University Xi’an China

2026-07-16生成模型

Nexus针对自回归网格生成依赖序列化、推理慢且易误差累积的问题,将网格拆成顶点与拓扑两部分用扩散整体建模:顶点以八叉树稀疏体素由粗到细生成,拓扑则用Spacetime Interval把边和面编码为连续逐顶点嵌入再恢复连接。论文在Objaverse、Toys4K和野外图像上优于自回归及两阶段基线,并有从业者盲测偏好支持。

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning Figure 1
2026-07-16cs.CV

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

Yuan Xiao and Jing Liao are with the Department, Xiangyu Kong is with the School of Computer Science, Beijing Information Science and Technology University

2026-07-16三维

本文针对现有 VLM 室内三维场景生成多采用一次性布局、局部编辑时需全局重排且易产生物理或语义不合理结果的问题,提出 ThinkBLOX,将布局建模为带视觉状态反馈的逐步推理与放置过程,并构建 22.5 万级 CoT-JSON 放置数据集及分层解耦 GDPO 强化学习来协调物理有效性、语义合理性和推理-动作一致性。实验显示其在物理 plausibility、语义对齐和交互编辑性上优于一阶段及迭代基线。

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation Figure 1
2026-07-16cs.CV

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

Songyu Xu, Xin Wang, Qiang Chen, Xinran Wang, Muxi Diao, Yuxuan Zhang, Kongming Liang, Rui Lin, Zhanyu Ma

2026-07-16视觉感知数据集/基准

这篇论文针对视频生成评测仍偏短提示、粗粒度打分且缺少失败诊断的问题,提出 VGIF-Score:将长指令解析为时空 DAG,用依赖感知 QA 和短路机制评估客观完成度,并结合按指令生成的 AutoRubric 评估主观观感。作者构建含 223 个复杂提示、约 4.3K 细粒度评测项的 VGIF-Bench,在 14 个模型和 3K 多视频上显示该指标更可解释,并揭示模型在因果执行、依赖深度和提示位置上仍明显脆弱。

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots Figure 1
2026-07-16cs.RO

Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots

Ishneet Sukhvinder Singh, Dhanoosh Pooranakumaran, Alex Nguyen, Jia Qi Yip

2026-07-16机器人视觉语言

论文针对机器人仅靠单帧视觉难以感知力、接触和部分本体状态的问题,提出 Kepler-Encoder,将视觉、本体感知、力/扭矩等作为模态 token,用学习查询交叉注意力融合,并以遮蔽跨模态 latent 预测自监督训练。结果显示,测试时仅输入视觉也能更好恢复末端状态尤其是力,优于冻结 ViT 和视觉-only 控制;单一编码器可覆盖四种机器人,且跨模态预测误差可作为无需训练的异常状态监测信号。

DriveFace: A Cross-Spectral Through-Glass Face Dataset for On-the-Move Vehicular Border Control Figure 1
2026-07-16cs.CV

DriveFace: A Cross-Spectral Through-Glass Face Dataset for On-the-Move Vehicular Border Control

Anjith George, Luis Luevano, Alain Komaty, Zeina Al Amine, Vidit Vidit, Sebastien Marcel

Idiap Research Institute, Rue Marconi 19, 1920 Martigny, University of Lausanne (UNIL), Lausanne, Switzerland

2026-07-16规划控制数据集/基准

面向车辆不停驶边检,现有人脸数据集难以覆盖车窗成像、运动模糊、光照变化和可见光到近红外匹配带来的真实退化。DriveFace 提供手机可见光预登记与车内近红外穿玻璃视频,并记录贴膜、姿态、车速等元数据及 PAD 子集;基线模型在该设置下性能明显受限,说明需针对跨光谱、穿玻璃场景设计专门方法。

TRACE-PCa: Predicting Prostate Cancer Progression from Longitudinal MRI During Active Surveillance Figure 1
2026-07-16cs.CV

TRACE-PCa: Predicting Prostate Cancer Progression from Longitudinal MRI During Active Surveillance

Hongye Zeng, Shreeram Athreya, Dingyuan Dai, Steve Raman, Leonard Marks, William Speier, Corey Arnold

2026-07-16视觉感知

该文针对前列腺癌主动监测中过度依赖定期重复活检、且既有模型多只看单时点或依赖病灶分割的问题,提出TRACE-PCa,用冻结的3D MRI基础模型编码基线与随访bp-MRI,并以时间注意力门突出进展相关变化,再融合临床变量预测病理进展。在424例、1221次扫描的队列上,模型AUC达0.704,优于临床列线图和放射组学基线,PPV与特异性更高,显示其可能减少不必要活检。

DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery Figure 1
2026-07-16cs.CV

DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery

Peiyan Gu, Zixin Teng, Xuming He

2026-07-16视觉感知

这篇论文针对在线类别发现中样本必须即时判定“归入旧类还是生成新类”的问题,指出现有半径、哈希或相似度规则把新类出生当作匹配失败后的兜底,难以处理各向异性特征分布和随证据增长而收缩的不确定性。DP-BOA 将该决策改写为基于狄利克雷过程高斯混合与 NIW 先验的后验预测证据比较,用已知类校准先验并在线更新类别统计。实验称其在标准 OCD 基准上整体优于强基线,尤其提升新类发现,同时保持已知类准确率竞争力。

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models Figure 1
2026-07-16cs.CV

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang, Xiaoyi Pang, Jiahui Hu, Jiacheng Du, Shuguo Zhuo

2026-07-16视觉语言视觉感知

该文针对视觉语言模型在边缘设备上因视觉 token 过多导致推理开销高的问题,提出 ALTR:不依赖注意力图,而用特征熵估计 token 信息量,并用变换后一致性信号排序后跨步采样以保留多样性。实验称其在 LLaVA-v1.5、LLaVA-Next、Qwen2.5-VL 等模型和多种 token 预算下保持竞争性能,同时降低计算开销并兼容 FlashAttention 等加速框架。

M2P-AD: Memory-to-Prototype Learning with Boundary-aware Score Refinement for 3D Anomaly Detection Figure 1
2026-07-16cs.CV

M2P-AD: Memory-to-Prototype Learning with Boundary-aware Score Refinement for 3D Anomaly Detection

Seyoung Jeong, Jong Pil Yun, Sang Jun Lee

2026-07-16视觉感知学习理论三维

这篇论文针对3D点云异常检测中记忆库采样易丢失关键正常结构、物体边界处误报偏高的问题,提出M2P-AD:用正常特征聚类学习原型以替代单纯coreset记忆,并结合边界提取与边界感知分数校准抑制伪异常响应。在Real3D-AD、Anomaly-ShapeNet和MulSen-AD上报告达到SOTA,定性结果显示正常区域高分和边界误报均有所减少。

CASA-SDF: Curriculum-Aware Spatial Adaptation with Curvature-Guided Density for Neural Implicit Surface Reconstruction Figure 1
2026-07-16cs.CV

CASA-SDF: Curriculum-Aware Spatial Adaptation with Curvature-Guided Density for Neural Implicit Surface Reconstruction

Lei Yang, Weiqing Li, Zhiyong Su, Liang Xiao

2026-07-16三维

室内隐式重建常在大平面去噪与细结构保真之间摇摆,CASA-SDF将其归因于先验监督生命周期和SDF密度带宽的空间异质性耦合,提出融合语义/光度不确定性的像素级退火SAUA,以及由曲率代理调节锐度的CALADT。ScanNet与Replica结果显示其主要提升完整度和召回率,细结构恢复更好,但精度略低于ND-SDF,存在一定精度-完整度权衡。

GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors Figure 1
2026-07-16cs.CV

GPOcc++: Unified Sparse Gaussian Occupancy Prediction with Visual Geometry Priors

Changqing Zhou, Yueru Luo, Yulan Guo, Bing Wang, Jie Qin, Changhao Chen

Changqing Zhou and Changhao Chen are with The Hong Kong University, Emerging Interdisciplinary Areas, The Hong Kong University of Science and, Technology, Hong Kong SAR 999077, China.Yueru Luo is with The Chinese University of Hong Kong, Shenzhen, China.Yulan Guo is with the School of Electronics and Communication, Engineering, Sun Yat-sen University, Shenzhen 518107, China.Bing Wang is with the Faculty of Engineering, The Hong Kong, Polytechnic University, Hong Kong SAR, China.Jie Qin is with the College of Artificial Intelligence, Nanjing, University of Aeronautics and Astronautics, Nanjing 211106, China.Corresponding author: Changhao Chen.

2026-07-16三维

本文针对视觉几何先验多为可见表面、难以直接支持三维占据中遮挡区域与自由空间推理的问题,提出将几何先验转为稀疏高斯占据表示的 GPOcc++。其核心是沿相机射线生成并偏移锚点,用射线条件的多图像融合统一处理多视角和时序观测,同时用稀疏高斯减少空域计算。室内具身场景和室外自动驾驶实验显示其在单帧、时序、多视角设置下达到 SOTA 或有竞争力表现,并保持较好效率。

EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal Figure 1
2026-07-16cs.RO

EgoHTR: Egocentric 4D Demonstrations of Human Terrain Traversal

Alex Brandes, Haig Conti Georges Sajelian, Manthan Patel, Dominik Hollidt, Chenhao Li, Matthias Heyrman, Oliver Hausdoerfer, Manuel Kaufmann, Xi Wang, Jonas Frey, Angela P. Schoellig, Christian Holz, Marc Pollefeys, Marco Hutter

2026-07-16模仿学习

该文针对人形机器人在非结构化崎岖地形中缺少带场景上下文的人类示范数据的问题,提出 EgoHTR:用穿戴式动捕、第一视角 Aria 传感器和便携 3D 扫描器构建可扩展的 4D 人-场景重建流程。数据集含 7 个场景、8 名受试者、55 段序列和约 15 万帧,并在动捕真值上显示优于既有 4D 人-场景重建基线,还用于训练感知式运动策略并部署到 Unitree G1。

Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation Figure 1
2026-07-16cs.CV

Bring Music The Horizon: Music-Driven 360$^\circ$ Video Generation

Kai Hsu Tsai, Yong Wei Fu, Hung I Yang, Yu-Chih Chen

2026-07-16视觉感知

论文针对现有音乐可视化依赖歌词、生成平面视频且难以表达音乐情绪演进的问题,提出按四小节预测 valence-arousal 情绪轨迹,并结合 EmotiCrafter、SEGA、SDXL 360 LoRA 与图生视频模型生成全景音乐视频。结果显示视频可在 VR 中观看,场景氛围和转场能随音乐结构变化,但主要为定性展示,定量增益来源不清。

HIVE-3D: Hierarchical Voxel Enhancement for High-Quality 3D Scene Generation Figure 1
2026-07-16cs.CV

HIVE-3D: Hierarchical Voxel Enhancement for High-Quality 3D Scene Generation

Bin Zang, Wenting Zheng, Xiaoliang Luo, Zhiyuan Fang, Shi Li, Lvchun Wang, Wei Yu, Yi Zhao, Tian Xie, Yuchi Huo, Rengan Xie

2026-07-16三维

HIVE-3D针对单图生成完整3D场景时全局方法分辨率低、组合方法又易丢失布局一致性的问题,先用TRELLIS生成粗场景,再通过2D分割到3D组件匹配构建层级场景树,并以粗体素和细化图像为条件做组件级体素超分辨率。实验显示其在3D-FRONT等评测中提升几何细节和视觉质量,但IoU低于TRELLIS,部分增益可能来自逐组件细化与对强基座模型的利用。

LPM: Industrial-Scale Generative Video Restoration Figure 1
2026-07-16cs.CV

LPM: Industrial-Scale Generative Video Restoration

Bichuan Zhu, Fulin Li, Jiachao Gong, Jinhua Hao, Kai Zhao, Kun Yuan, Pengcheng Xu, Qiang Wang, Qiao Mo, Yanlong Yuan, Yizhen Shao, Yuxiao Hu, Zixi Tuo, Ming Sun, Chao Zhou, Bin Chen, Bin Yu

2026-07-16视觉感知生成模型

面向 UGC 视频中噪声、模糊、压缩伪影及长视频窗口漂移等工业级修复难题,LPM 采用先图像后视频的扩散式渐进训练,以大规模高质量数据建立空间先验,再用 2D-VAE 与 2D+1D DiT 做时序对齐融合,并通过无固定时序位置编码和时间金字塔推理维持任意长度视频的一致性。系统已在快手生产部署,覆盖约 45% 观看时长,并在相近感知质量下降低码率约 20%;但具体增益中 scaling / data 与架构设计的相对贡献文中未充分说明。

2D Rotary Position Embedding for Scene Text Recognition with Transformers Figure 1
2026-07-16cs.CV

2D Rotary Position Embedding for Scene Text Recognition with Transformers

Zobeir Raisi

2026-07-16视觉感知

本文针对场景文字识别中弯曲、旋转和透视变形文本难以仅靠一维位置编码建模的问题,提出面向STR的2D-RoPE:按文字图像长宽特性分配行列旋转维度,并把旋转位置耦合扩展到编码器-解码器交叉注意力。实验在六个标准基准上显示,增益主要集中于不规则和透视失真的文本,且几乎不增加参数。

TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects Figure 1
2026-07-16cs.CV

TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects

Tahmina Khanam, Hamid Laga, Mohammed Bennamoun, Guanjin Wang, Ferdous Sohel, Farid Boussaid, Anuj Srivastava

2026-07-16生成模型三维

这篇论文针对树木、植物等三维树状对象同时存在表面形变和分支拓扑变化的问题,认为仅用骨架或半径近似会丢失枝条几何细节。其核心是将 SRNF 扩展到树状三维形体,构造带黎曼度量的 TreeSRNF 空间,联合度量弯曲、拉伸与分支滑移,并据此做对应、测地线、统计建模和采样生成。实验在合成与真实植物数据上显示,表示误差更低,配准后的测地距离和一致性优于对比方法。

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding Figure 1
2026-07-16cs.CV

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

2026-07-16三维

这篇论文针对MLLM从2D图像理解3D空间关系时,文本化几何信息会丢失连续线索、单一隐变量又难以适配多类空间任务的问题,提出GeoAnchor,将空间信息拆为位置、方向和几何三类latent并动态重组,配合四阶段协同训练形成局部到全局的推理。实验显示其在SPAR-Bench、SPBench等基准上超过基座模型及GPT-4o、Gemini-2.5-Flash,并在域外ViewSpatial上有一定泛化增益。

Symbiosis-Inspired Knowledge Distillation for Incremental Object Detection Figure 1
2026-07-16cs.CV

Symbiosis-Inspired Knowledge Distillation for Incremental Object Detection

Mingyue Zeng, De Cheng, Zhipeng Xu, Huaijie Wang, Nannan Wang, Xinbo Gao

2026-07-16视觉感知

这篇论文针对增量目标检测中新旧类别共存但旧类常未标注的问题,指出传统“分离特征空间、只保留干净伪标签”的做法会破坏共现与遮挡带来的共享表征。作者提出 SIKD,从空间共生区域蒸馏和语义原型排序对齐两层保留旧类知识。实验声称在多种增量设置下超过现有方法,但具体增益幅度需结合表格进一步核验。

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation Figure 1
2026-07-16cs.RO

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation

Shivansh Patel, Kaifeng Zhang, Sanjay Pokkali, Svetlana Lazebnik, Yunzhu Li

Columbia University

2026-07-16视觉感知

这篇论文针对机器人操作中软体、绳索、纸张等可变形物体难以稳定预测的问题,提出 PGRD:先用可优化弹簧-质点模型提供物理先验,再用网络学习速度残差并通过滑动窗口 Transformer 建模时序依赖,以减少长时滚动误差。实验覆盖多类真实物体,PGRD 在3D轨迹跟踪上优于纯物理和纯学习基线,并在 MPPI 操作规划、语言生成目标图像规划和3D Gaussian Splatting视频预测中展示应用效果。

DreamSat-Pose: Spacecraft Pose Estimation from Single-View 3D Reconstructions and Learned 2D-3D Feature Matching Figure 1
2026-07-16cs.CV

DreamSat-Pose: Spacecraft Pose Estimation from Single-View 3D Reconstructions and Learned 2D-3D Feature Matching

Josiane Uwumukiza, Jocelyn Zhao, Giovanni Lavezzi, Giacomo Battaglia, Paolo Panicucci, Minduli C. Wijayatunga, Victor Rodriguez-Fernandez, Richard Linares

2026-07-16三维

面向非合作航天器近距离操作中单目图像缺深度、未知目标无CAD模型的问题,DreamSat-Pose先由单视图重建三维形状,再用DINOv3图像特征、DGCNN点云特征和双流Transformer学习2D-3D软匹配,最后交给PnP求6DoF位姿。其关键洞察是把直接位姿回归转为重建几何约束下的对应关系求解;在SPE3R上仅用RGB和重建几何达到0.157度平均指向误差,但与需深度输入的FoundationPose并非完全对等比较。

CLIP-Guided Label-Free Discriminative Region Scoring for Fine-Grained Classification Figure 1
2026-07-16cs.CV

CLIP-Guided Label-Free Discriminative Region Scoring for Fine-Grained Classification

Yujie Zhu

State University of New York at Buffalo

2026-07-16视觉感知

论文针对细粒度分类中 CLIP 全局特征难以捕捉局部差异、且缺少真实标签时难以选择判别区域的问题,提出统一的 CLIP 引导无标签区域打分框架,比较 SAM 掩码与随机裁剪,以及相似度、margin、熵等评分策略。实验显示 soft negative margin 最优,伪标签接近真标签表现;随机裁剪在五个数据集上持续优于 SAM,提示保留上下文比语义掩码更稳定。

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment Figure 1
2026-07-16cs.RO

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

University of Illinois Urbana-Champaign, Texas A&M University, University of California, Irvine

2026-07-16视觉感知

本文针对VLA用行为克隆微调后遗忘预训练视觉语言表征、且语言头与动作头监督脱节的问题,提出Anchor-Align:用冻结VLM逐层蒸馏锚定表征,并把连续动作转成离散运动语言标签,在同一机器人观测上联合监督语言与动作。方法在xArm7实机上将两类架构成功率由28%/37%提升到54%/60%,并在LIBERO-PRO、LIBERO-Plus和CALVIN中改善OOD、感知扰动与长程控制表现。

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding Figure 1
2026-07-16cs.CV

ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding

Kai Chen, Ming Dai, Wenxuan Cheng, Wankou Yang

2026-07-16视觉语言视觉感知

ScanFocus针对时空视频定位中长视频低帧率采样导致边界线索丢失、时间端点模糊的问题,将任务拆为全局粗扫描与局部边界精修:先用统一视觉语言融合和语义-运动融合生成粗时空候选,再在候选边界附近密集采样,并用SGTA显式建模短时帧间关系。文中在三个常用基准上报告优于既有方法,且oracle实验显示时间定位是主要瓶颈。

MultiAnimate: A Unified Framework for Controllable Multi-Character Animation Figure 1
2026-07-16cs.CV

MultiAnimate: A Unified Framework for Controllable Multi-Character Animation

Zhongyi Zhang, Guangyuan Wang, Li Hu, Wenbo Zhou, Peng Zhang, Tianyi Wei, Weiming Zhang, Bang Zhang, Nenghai Yu

2026-07-16规划控制

MultiAnimate针对现有角色动画多依赖单参考图、难以处理多角色身份绑定与交互遮挡的问题,提出可同时接收多张角色参考图、独立姿态序列和共享背景的扩散式框架;其关键在于身份专属参考网、身份感知姿态编码器和可选交互引导模块,以减少身份混淆并维护空间关系。实验和消融显示其在复杂多角色动作、位置互换和交互场景中优于已有方法。

AnomExpert: Identifying and Selecting Anatomical Planes for Prenatal Ultrasound Anomaly Diagnosis Figure 1
2026-07-16cs.CV

AnomExpert: Identifying and Selecting Anatomical Planes for Prenatal Ultrasound Anomaly Diagnosis

Jian Wang, Yang Yang, Ziheng Pan, Xiliang Zhu, Yuhan Zhang, Yanfeng Zhou, Dong Ni

2026-07-16视觉感知

产前超声异常诊断需要在多切面图像中先识别解剖平面、再为不同畸形选择有诊断价值的平面,但细粒度平面标注昂贵,常规MIL又会混合异质图像。AnomExpert用可学习平面原型在仅病例级标签下组织无序图像,并通过疾病感知稀疏选择聚合相关平面。多中心3654例实验中优于9种MIL方法,ViT-small达到86.9%准确率和84.2% F1。

FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging Figure 1
2026-07-16cs.CV

FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging

Shengchao Chen, Ting Shu

School of Artificial Intelligence, Shenzhen University, Australian AI Institute, University of Technology Sydney, School of Artificial Intelligence, Shenzhen University Shenzhen China, Australian AI Institute, University of Technology Sydney Sydney Australia

2026-07-16视觉语言

本文针对医疗影像基础模型难以集中汇聚跨机构数据、且客户端模态可能重叠或完全不重叠的问题,提出从头训练的联邦多模态框架 FM²。核心做法是用类别级与领域级双 MoE 分离个性化类别知识和共享跨模态表征,并用 HMA 对齐专家参数,另以本地 GPT-4o caption 作为语义桥接支持 CEL 和 VQA。实验在 MIMH 与真实医学 VQA 数据上优于多种联邦基线,并显示较强跨模态泛化。

RoughNet: Mapping Arctic Sea Ice Roughness Using Diffusion-Based Super-Resolution of Satellite Imagery Figure 1
2026-07-16cs.CV

RoughNet: Mapping Arctic Sea Ice Roughness Using Diffusion-Based Super-Resolution of Satellite Imagery

Tessa Cannon, Michel Tsamados, Petru Manescu, Thomas Newman, Christian Haas, Veit Helm, Weibin Chen, Randall Scharien

Department of Computer Science, University College London, Department of Earth Sciences, University College London, Alfred Wegener Institute Helmholtz Centre for Polar and, Department of Geography, University of Victoria

2026-07-16视觉感知生成模型

北极陆缘海冰粗糙度关系到气候建模与冰上通行安全,但机载 LiDAR 和实地测量成本高、覆盖稀疏。RoughNet 将 10 米 Sentinel-2 多光谱影像映射为 1 米局部去均值高程残差,用条件扩散做跨模态超分辨重建。模型在两个区域训练、未见区域测试,最佳外域 RMSE 约 9 厘米,并较好保持粗糙度分布和谱结构;但像素级误差接近信号尺度,精确地形复原仍有限。

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation Figure 1
2026-07-16cs.CV

DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation

Eungjune Shim, Hansol Lee, Eunjung Ju

2026-07-16视觉感知三维

DiffGI针对隐式体表示难以处理服装等薄壳、开边界和非流形结构,以及几何图像二值占用导致边界台阶和不可微重建的问题,提出用连续2D TSDF表示多图集几何图像,并以可微Marching Squares把3D表面损失回传到2D潜空间。结合带法线渲染损失的VAE和latent diffusion,文中在服装与物体数据上报告了更高重建精度、边界更锐利,并能以32×32紧凑潜空间降低计算开销。

Detector Confidence Signals Presence Rather Than Occlusion in Cluttered Manipulation Figure 1
2026-07-16cs.CV

Detector Confidence Signals Presence Rather Than Occlusion in Cluttered Manipulation

Yuanzhi He

School of Computer Science & Informatics, Cardiff University

2026-07-16机器人

针对机器人在杂乱场景中常把开放词汇检测置信度当作目标可见性信号的问题,论文用几何分割 oracle 对真实可见像素与检测分数逐视角对照,指出置信度更多反映“同类物体存在”而非指定目标未被遮挡。实验显示在三类检测器、九类物体、两种仿真和真实视频中,目标严重遮挡时分数仍近乎不变并常落到同类干扰物上,导致主动感知收益被低估约十倍,门控也会在应移动视角时误判为已找到目标。

Audio-Text Cross-Attention with Psycholinguistic Support Features for Ambivalence/Hesitancy Recognition Figure 1
2026-07-16cs.CV

Audio-Text Cross-Attention with Psycholinguistic Support Features for Ambivalence/Hesitancy Recognition

Luiz F. B. F. Martins, Rodrigo W. Pisaia, Matheus M. Girardi, Isabella Berkembrock, João A. Almeida, André G. Hochuli, Rayson Laroca, Alceu S. Britto Jr

2026-07-16视觉感知

论文面向行为干预视频中的犹豫/矛盾识别,动机是相关线索常只出现在短片段且分散于语音韵律和语言表达。核心做法是放弃视觉帧,将5秒音频-文本窗口用交叉注意力融合,并注入74维心理语言学支持特征,再由门控MIL突出关键窗口。内部开发集上五模型集成达到AP 0.875、macro-F1 0.722,支持特征带来主要增益;官方私有测试结果文中未充分说明。

Marker-free deformable registration and fusion for augmented reality-guided positive margin localization during tumor resection surgery Figure 1
2026-07-16cs.CV

Marker-free deformable registration and fusion for augmented reality-guided positive margin localization during tumor resection surgery

Yue Yang, Annie Benson, Matthieu Chabanas, Jason Slagle, Thomas Myles, Matthew B. Weinger, Jon S. Heiselman, Michael I. Miga, Michael Topf, Jie Ying Wu

2026-07-16视觉感知

头颈肿瘤切除中,阳性切缘通常由病理侧标注,外科医生需凭口头描述在变形后的切除床上定位,误差较大。本文提出无需外部标记的 AR 工作流,将标本 3D 扫描、轮廓约束形变配准、深度点云融合与 HoloLens 投影结合,把病理标签映射回患者切除床。尸体实验中,AR 将端到端定位误差从口头指导的 21.40 mm、查看标本的 16.09 mm 降至 6.19 mm,在线融合约 5.23 s。

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization Figure 1
2026-07-16cs.CV

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

Sydney AI Centre, The University of Sydney, University of Melbourne, City University of Hong Kong, Wuhan University, Mohamed bin Zayed University of Artificial Intelligence

2026-07-16视觉感知

针对公开视频可被图生视频或微调式视频定制滥用的问题,论文指出现有逐帧图像扰动会被3D视频VAE的时序压缩削弱,单视频扰动又易过拟合且不抗时序攻击。其提出TC-UAP,以身份级多帧通用扰动、滑窗优化和时序一致性/攻击代理损失统一保护视频。实验显示其在两类定制场景下身份保护效果优于已有方法,并能泛化到同身份未见视频、抵抗多种未见时序攻击。

SARFA: Segment Anything with Radiomic Feature Alignment Figure 1
2026-07-16cs.CV

SARFA: Segment Anything with Radiomic Feature Alignment

Tyler Ward, Abdullah Imran

Computer Science Department, University of Kentucky, Lexington, KY, USA

2026-07-16视觉感知

针对医学图像中病灶边界模糊、标注者分歧导致 SAM 难以给出可靠单一掩码的问题,SARFA 用概率提示生成多候选分割,并以放射组学特征距离 FRD 对候选排序,结合 DPO 训练偏好更符合解剖和纹理特征的掩码。在 LIDC-IDRI CT 与 BraTS MRI 上,其 GED、FRD 和 HM-IoU 等指标优于多种歧义分割基线。

Reflecting Process Expertise in Procedural Material Generation Figure 1
2026-07-16cs.CV

Reflecting Process Expertise in Procedural Material Generation

Kunal Gupta, Gaurav Joshi, Yen-Ru Chen, Seemandhar Jain, Ishit Mehta, Manmohan Chandraker

2026-07-16视觉感知

这篇论文针对程序化材质生成只复现节点图、缺少专家构建过程理解的问题,提出 MaterialApprentice:从 Blender 教程视频抽取“过程轨迹”,在推理时检索相关示范,由 LLM 先合成构建步骤再编译为可执行材质图。专家评估和 150 人用户研究显示,相比 VLMaterial、BlenderAlchemy、BlenderMCP,其结果更贴近设计意图、编辑成本更低。

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks Figure 1
2026-07-16cs.CV

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

Jae Joong Lee

Department of Computer Science, Department of Computer Science Purdue University West Lafayette Indiana USA

2026-07-16视觉语言视觉感知数据集/基准

这篇论文针对视频 LLM 榜单准确率是否真代表视觉理解提出质疑,设计逐题的 Visual Dependency Gap,用原视频与黑屏条件的正确性差异衡量视觉依赖。结果显示准确率和视觉 grounding 可统计分离,许多时序推理接近语言先验;帧多样性贡献主要增益,时间顺序几乎无贡献,压缩实验还揭示总准确率会掩盖题级答案翻转。

Improving Medical Image Generative Models with Fréchet Distance Loss Figure 1
2026-07-16cs.CV

Improving Medical Image Generative Models with Fréchet Distance Loss

Andrew Marshall, Xuanang Xu, Xiaoran Zhang, Rui Wang, Lawrence Staib, James Duncan

2026-07-16视觉感知生成模型

这篇论文针对医学扩散生成模型难以保留肿瘤不规则形态、导致合成数据对分割帮助有限的问题,将 Fréchet Distance 从评估指标改作微调损失,在预训练自然图像与医学图像编码器特征空间中匹配真实/生成图像的一二阶统计。肝脏 CT 与脑 MRI 实验显示,用 FD-loss 正则化的合成数据训练分割模型时,肿瘤 DSC 相比未正则合成增强提升超过 5%,医学/生物医学编码器通常优于自然图像特征。

FOLIO: Focused Semantic Memory for Streaming Video Understanding Figure 1
2026-07-16cs.CV

FOLIO: Focused Semantic Memory for Streaming Video Understanding

Haoyang Fan, Dhruv Parikh, Anvitha Ramachandran, Sameh Gobriel, Nilesh Jain, Rajgopal Kannan, Viktor Prasanna

University of Southern California (USC), Los Angeles, CA, USA, Intel Labs, USA

2026-07-16视觉感知

FOLIO针对流式视频中历史帧无限增长、未来查询未知导致记忆成本高且检索噪声大的问题,提出无需训练的聚焦语义记忆:用动态焦点决定哪些实体/动作保留细节,结合短期视觉缓冲、实体中心长期记忆和视觉证据缓存,并用混合检索回答查询。在OVO-Bench上达到82.0/69.1感知/回溯准确率,StreamingBench总体74.5,同时降低记忆维护成本。

Differentiable Polarized Path Tracing Figure 1
2026-07-16cs.CV

Differentiable Polarized Path Tracing

Pramod Rao, Jérémy Riviere, Xilong Zhou, Abhijeet Ghosh, Abhimitra Meka, Thabo Beeler, Marc Habermann, Christian Theobalt, Delio Vicini

2026-07-16视觉感知

这篇论文针对传统可微路径追踪只利用强度、难以利用偏振线索的问题,指出线偏振片、漫反射等常见 Mueller 算子秩亏会破坏 PRB 的可逆性假设,导致梯度不稳定或有偏。作者通过在路径重放中加入局部后缀缓存,避免对不可逆 Mueller 矩阵求逆,从而实现偏振感知的无偏梯度估计。实验显示,该方法在显著低于常规 AD 的内存开销下获得一致梯度,并在材质、纹理、法线和几何重建中优于非偏振基线。

AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow Figure 1
2026-07-16cs.CV

AffectFlow-DINO: Uncertainty-Aware Multi-Task Affect Estimation via Conditional Rectified Flow

Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika, Abdenour Hadid

2026-07-16生成模型安全鲁棒

本文针对野外人脸情感标注存在多解性、类别极不均衡和多任务标签缺失的问题,将 DINOv3 特征与条件 rectified-flow 头结合,在22维联合情感空间建模预测分布而非单点输出。结果显示 flow 对价效度-唤醒估计有稳定增益,微调与阈值校准后验证集 P_MTL 达1.177,高于官方基线0.45;但与隐藏测试 SOTA 不可直接比较。

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics Figure 1
2026-07-16cs.CV

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

Yue Chang, Rufeng Chen, Yifan Tian, Dazhi Huang, Zhaofan Zhang, Yi Chen, Wenze Zhang, Li Chen, Hui Xiong, Sihong Xie

The Hong Kong University of Science and Technology (Guangzhou), Jilin University

2026-07-16机器人

这篇论文针对长时程机器人中3D场景图“先全量构建再筛选”带来的感知饱和、语义噪声和延迟问题,提出JITOMA:先保留低成本休眠锚点,再由任务意图按需激活局部子图并执行密集描述和功能推理。配套JITOMA-Bench评估多任务切换与复杂推理,结果显示其显著缩小活跃图规模、降低captioning延迟,并在长时程任务中保持较稳定处理时间。

Active Learning for Efficient Annotation of Surgical Videos with Weak Supervision Figure 1
2026-07-16cs.CV

Active Learning for Efficient Annotation of Surgical Videos with Weak Supervision

Manasa Dendukuri, Matjaz Jogan, Daniel A. Hashimoto, Guiqiu Liao

2026-07-16视觉感知

针对腹腔镜手术视频像素级标注依赖专家且成本高的问题,本文将弱监督工具存在标签、DINOv3特征、时序一致性CAM与主动学习闭环结合,让专家只修正模型提出的伪掩码,并用视频级损失和少量掩码损失联合训练。在Cholec80上,相比全人工标注流程,训练结束时标注工作量约减少50%,但具体性能增益相对各组件的贡献文中仍需更细分说明。

Continuously Evolving Deepfake Detection: An Architecture and Public-Benchmark Evaluation of a Dynamic Detection System Figure 1
2026-07-16cs.CV

Continuously Evolving Deepfake Detection: An Architecture and Public-Benchmark Evaluation of a Dynamic Detection System

Ken Jon Miyachi, Dylan Uys

2026-07-16视觉感知数据集/基准

论文针对深伪检测在真实流通内容上因生成模型快速迭代而失效的问题,提出 BitMind Forensics:通过 Bittensor SN34 的开放对抗竞赛持续刷新训练分布,再导出图像与视频检测快照。结果显示其在 19 个公开基准上整体优于或接近商业与开源强基线,如 Sumsub 原图 AUC 0.936、Deepfake-Eval-2024 图像/视频 AUC 0.915/0.822;但低误报率下部分召回仍有限,增益可能主要来自持续数据更新与规模化训练。

Efficient Computing for Medical Image Acquisition and Reconstruction Figure 1
2026-07-16eess.IV

Efficient Computing for Medical Image Acquisition and Reconstruction

Xiao Wang, Jayasai Rajagopal, Md Safaiat Hossain, Peng Chen, Mohamed Wahib, Enzhi Zhang, Emma J. Reid

2026-07-16视觉感知三维

这篇综述面向CT、MRI、PET、SPECT等医学成像中数据规模上升导致的重建时延、内存和临床部署瓶颈,核心洞察是把不同模态统一为“物理测量到逆问题重建”的计算管线,并从解析、迭代、统计模型到GPU/并行、内存优化和物理感知前向算子梳理效率取舍。主要结果是给出跨模态的计算框架和工程设计原则;未报告新算法的定量实验,具体性能增益来源文中未充分说明。

Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training? Figure 1
2026-07-16cs.CV

Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?

Nusrat Munia, Tyler Ward, Nishat Nayla, Matthew A. Massey, Abdullah-Al-Zubaer Imran

Department of Computer Science, University of Kentucky

2026-07-16视觉感知

本文针对自监督视觉学习中“两阶段预训练再微调”是否优于“监督与自监督联合训练”的未决问题,系统比较8类SSL方法在自然、医学、灾害、遥感等任务和不同标注比例下的表现。核心洞察是两种范式没有绝对优劣:联合训练通常提升低标注场景的数据与训练效率,重建/辅助任务受益更明显;而在专业领域、对迁移性要求更高或部分对比学习方法中,PFT更稳健。

MGFace: Mask-Gated Face Matching via Conditional Similarity Routing Figure 1
2026-07-16cs.CV

MGFace: Mask-Gated Face Matching via Conditional Similarity Routing

Huy Che, Hoang-Minh Trinh, Dinh-Duy Phan, Duc-Lung Vu

2026-07-16视觉感知

面部识别在戴口罩等局部遮挡下精度明显下降,而现有局部重排序方法又常对所有查询执行昂贵的细粒度匹配。MGFace的核心是先用集成在识别骨干中的轻量口罩分类头判断查询状态,再将未遮挡人脸走全局余弦匹配、戴口罩人脸走仅关注上半脸的局部重排序。扩展LFW-Mask实验中,FaceNet/ArcFace分别达到80%以上和90%以上识别准确率,并较EMD重排序约快20倍。

A Masked Autoencoder Approach to Unsupervised Steel Surface Defect Recognition Figure 1
2026-07-16cs.CV

A Masked Autoencoder Approach to Unsupervised Steel Surface Defect Recognition

Shrey Patel

2026-07-16视觉感知

针对钢材表面缺陷标注昂贵、未标注图像充足的问题,论文用ViT式Masked Autoencoder在NEU-DET上做自监督表征学习,随机遮蔽75%图像块并重建,同时加入仅作训练信号的缺陷定位辅助目标;再用UMAP降维和层次聚类实现无监督分组。结果显示重建SSIM达0.92,六类缺陷Hungarian匹配准确率91.3%,但辅助定位带来的增益来源文中未充分说明。

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation Figure 1
2026-07-16cs.CL

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

Ruize Xia

2026-07-16视觉感知生成模型

本文面向文本到手语视频生成的高计算门槛,提出可在单张 NVIDIA L4 上训练和推理的 Text2Sign 扩散基线,用冻结 CLIP 文本编码器、3D 编解码骨干和分解时空注意力降低视频注意力成本。实验显示其在 How2Sign 短片上长训验证损失达 0.00999,推理 32 帧需 12.60 秒、峰值显存 3.12GB;但打乱提示几乎不影响去噪损失,说明语言条件约束仍弱。

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation Figure 1
2026-07-16cs.CV

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S.Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

available here: https://github.com/Boogu-Project/Boogu-Image.

2026-07-16视觉语言视觉感知

本文针对开源图像生成模型在复杂指令理解、双语文字渲染和编辑能力上落后闭源系统的问题,提出 Boogu-Image-0.1 系列,将更强文本编码器、数据与训练流程改进、提示改写、模型路由和推理时反思等 agentic scaling 结合。结果显示其在 Boogu Arena、Qwen-Image、LongText 和编辑基准上达到或超过多数开源模型,部分接近闭源系统;但具体增益可能主要来自 data 与 inference-time scaling 的组合。

C-Norm: Cell-Distribution Normalization Enables Precision Recognition of Medical-Cell Image Figure 1
2026-07-16cs.CV

C-Norm: Cell-Distribution Normalization Enables Precision Recognition of Medical-Cell Image

Yang Qianl, Liu Xiany, Dai Daw, Chen Jing, Shen Xiaoj, Fu Kaiw, Tang Ming, Zou Dongl

2026-07-16视觉感知

该文面向宫颈 TCT 细胞图像中人工阅片耗时、模型临床泛化不稳的问题,指出瓶颈不只是类别不均衡,而是单张图内细胞空间分布失衡与高质量标注稀缺。核心做法是将正常/异常细胞解耦后重合成分布更均匀的样本,并结合 YOLOv12 与 DINOv3 捕捉细微形态差异。实验称优于主流检测方法并达到 SOTA,但具体增益中来自 C-Norm、模型 scaling 或数据扩增的占比仍需看消融细节。

Beyond Backbone Backpropagation: A Decoupled Strategy for Efficient Transfer Learning Figure 1
2026-07-16cs.LG

Beyond Backbone Backpropagation: A Decoupled Strategy for Efficient Transfer Learning

Daniel Vila-Cruz, Laura Morán-Fernández, Verónica Bolón-Canedo

2026-07-16视觉感知

针对临床、边缘等资源受限场景中全量微调成本高的问题,论文提出冻结主干、仅调归一化层,并将特征预计算与分类头优化解耦;其核心洞察是域迁移损失可能更多来自归一化统计失配而非主干表征不足。实验覆盖多种 CNN/Transformer 与三类医学影像数据,显示训练时间和碳排显著下降,精度仅小幅牺牲且部分超过基线。

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation Figure 1
2026-07-16quant-ph

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation

Dongping Liu, Aoyu Zhang, Luyao Zhang

Duke Kunshan University, Duke Kunshan University Suzhou China

2026-07-16视觉感知数据集/基准

论文针对量子线路长期以图示传播、却需人工转写为 SDK 代码的瓶颈,提出 QCV:含132个线路、5种模态、可执行 Braket 代码与酉保真度验证的成本感知视觉代理评测。主要洞察是失败更受线路深度而非量子比特数驱动,CoT 提示增益不显著;中档 Sonnet 4.6 以约18% Opus 单次成本达到核心集91%通过率,级联路由可用38%成本取得84%准确率。

2026-07-15

116 篇
The Seriality Gap in Video Diffusion Models Figure 1
2026-07-15cs.LG

The Seriality Gap in Video Diffusion Models

Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai

2026-07-15视觉感知生成模型

本文追问视频扩散模型能否像世界模拟器一样处理逐步依赖的事件链。作者用硬球碰撞构造低视觉复杂度、可控串行依赖的测试床,提出“seriality gap”:标准双向视频扩散在多球长因果链上随预测长度明显退化,而单球长度对照基本不退化;增加去噪步数帮助有限,增深骨干或自回归/分块生成更有效,并从理论上说明确定性预测中去噪迭代不提供可扩展串行计算。

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models Figure 1
2026-07-15cs.RO

FlowWAM: Optical Flow as a Unified Action Representation for World Action Models

Yixiang Chen, Peiyan Li, Yuan Xu, Qisen Ma, Jiabing Yang, Kai Wang, Jianhua Yang, Dong An, He Guan, Gaoteng Liu, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences, School of Artificial Intelligence, University of Chinese Academy of Sciences

2026-07-15生成模型强化学习

FlowWAM针对世界动作模型难以把机器人动作与预训练视频生成器的像素时序先验对齐的问题,提出用光流视频作为统一动作表示,并以双流扩散框架共享视频生成骨干,同时支持策略预测和动作条件世界建模。光流可从无动作标注视频中提取,便于预训练;在RoboTwin上成功率达92.94%/92.14%,在WorldArena上EWMScore为63.71。

DermDepth: Toward Monocular Metric Scale 3D Reconstruction Models for Dermatology Figure 1
2026-07-15cs.CV

DermDepth: Toward Monocular Metric Scale 3D Reconstruction Models for Dermatology

Héctor Carrión, Narges Norouzi

2026-07-15三维

皮肤病诊疗常需追踪病灶尺寸、形态和表面纹理,但临床多依赖单张2D图像,缺少可量测的3D尺度信息。本文提出面向皮肤科的单目尺度3D重建模型 DermDepth,并构建带像素级深度、法线和相机参数的合成皮肤镜数据 D-Synth,通过微调尺度头和法线头校正基础深度模型在皮肤图像上的系统性尺度偏差。实验显示,合成数据训练可将真实皮肤镜尺度误差从超过16倍降至约1.1倍,少量真实样本微调后可跨SKINL2、WoundsDB和DDI等数据集泛化,并改善不同肤色上的尺度公平性。

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras Figure 1
2026-07-15cs.CV

X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras

Heng Zhou, Shuhong Liu, Yonghao He, Bohao Zhang, Fa Fu, Chenhui Hou, Xianbao Hou, Lijun Han, Wei Sui

2026-07-15视觉感知

面向机器人和自动驾驶中针孔、鱼眼混合多相机带来的投影差异与实时约束,X-Lens用可学习标定token和基于Jacobian的畸变偏置建模跨相机几何一致性,直接预测稠密度量深度与全局尺度,并通过新合成数据集OmniScene扩充训练。实验显示其在异构相机深度估计上较最强基线AbsRel降低25.4%,参数少88.9%,最高41 FPS。

Controllable Generation of Diverse Dermatological Imagery for Fair and Efficient Malignancy Classification Figure 1
2026-07-15cs.CV

Controllable Generation of Diverse Dermatological Imagery for Fair and Efficient Malignancy Classification

Héctor Carrión, Narges Norouzi

2026-07-15视觉感知规划控制

针对皮肤病图像在深肤色和罕见病上标注不足、导致恶性分类公平性受限的问题,论文提出 cgDDI:用扩散修复生成健康皮肤、非参数移植单例病灶,并用文本反演/LoRA做少样本语义生成。其将656张DDI扩展为26.6万张合成图像,在DDI上微调后恶性分类达90.9%,跨F17k提升13.9%,但增益可能主要来自 scaling / data。

ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models Figure 1
2026-07-15cs.CV

ViCo3D: Empowering LiDAR-based Collaborative 3D Object Detection with Vision Foundation Models

Haojie Ren, Songrui Luo, Lingfeng Wang, Yan Xia, Yao Li, Jing Li, Lu Zhang, Jiajun Deng, Yanyong Zhang

University of Science and Technology of China

2026-07-15视觉感知三维

ViCo3D针对V2X协同3D检测中单纯LiDAR BEV特征语义先验不足、跨车端与路侧特征异质影响融合的问题,提出将点云投影为三通道BEV图像并引入DINOv2特征,再用多尺度BEV融合和自车中心跨智能体融合保留互补信息。实验在DAIR-V2X和V2XSet上取得SOTA,DAIR-V2X协同增益最高约为既有方法的1.8倍。

Point Tracking in Surgery--The 2025 Surgical Tattoos in Infrared Challenge (STIRC2025) Figure 1
2026-07-15cs.CV

Point Tracking in Surgery--The 2025 Surgical Tattoos in Infrared Challenge (STIRC2025)

Adam Schmidt, Mert Asim Karaoglu, Zijian Wu, Jiaming Zhang, Yuxin Chen, Tim Salcudean, Ho-Gun Ha, Minkang Jang, Kyungmin Jung, Ihsan Ullah, Hyunki Lee, Suresh Guttikonda, Sarah Latus, Alexander Schlaefer, Xinkai Zhao, Yuichiro Hayashi, Masahiro Oda, Takayuki Kitasaka, Kensaku Mori, Peng Liu, Chenyang Li, Stefanie Speidel, Aoife Gardiner, Agostino Stilli, Danail Stoyanov, Francisco Vasconcelos, Anwesa Choudhuri, Meng Zheng, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Terrence Chen, Ziyan Wu, Alexander Ladikos, Omid Mohareri

Intuitive Surgical Inc., Sunnyvale, USA, Technical University of Munich, Munich, Germany, University of British Columbia, Vancouver, Canada, Johns Hopkins University, Baltimore, USA, Daegu Gyeongbuk Institute of Science and Technology, Daegu, South Korea, Hamburg University of Technology, Hamburg, Germany, SustAInLivWork Center of Excellence, Kaunas, Lithuania, Graduate School of Informatics, Nagoya University, Nagoya, Japan, Information Technology Center, Nagoya University, Nagoya, Japan, Department of Information Science, Aichi Institute of Technology, Aichi, Japan, Research Center for Medical Bigdata, National Institute of Informatics, Tokyo, Japan, German Cancer Research Center (DKFZ), Heidelberg, Germany

2026-07-15视觉感知

面向手术中组织点跟踪对分割、三维重建、虚拟标志点和自主扫描的需求,本文组织 STIRC2025 挑战,用红外手术纹身构建无重叠的 32 段 da Vinci 5 双目序列、234 个标注点,并同时评估跟踪精度与推理延迟。七支队伍提交算法,论文汇总了各方法在体内/离体序列上的排名与效率表现,但具体增益来源更多依赖参赛方案差异,文中未充分说明。

Exact and Calibrated Diffusion Reconstruction for Digital Breast Tomosynthesis Figure 1
2026-07-15eess.IV

Exact and Calibrated Diffusion Reconstruction for Digital Breast Tomosynthesis

Imade Bouftini

2026-07-15生成模型三维

这篇论文针对有限角度 DBT 中扩散重建虽感知质量好、却难以保证数据一致性、幻觉位置和不确定性可信的问题,将每步近端一致性替换为对测量一致集合的精确欧氏投影,并用零空间方差解释误差覆盖。实验中投影残差达 2.4×10^-13、单次约 4.5 ms,较近端求解快 248 倍;在乳腺体模上提升 PSNR/SSIM,校准后 ECE 从 0.029 降至 0.008,但临床噪声和真实病灶验证仍文中未充分说明。

Domain-Incremental Remote Sensing Change Detection via Difference-Guided Adaptation and Frequency-Decoupled Distillation Figure 1
2026-07-15cs.CV

Domain-Incremental Remote Sensing Change Detection via Difference-Guided Adaptation and Frequency-Decoupled Distillation

Daifeng Peng, Yaning Li, Haiyan Guan

School of Remote Sensing and Geomatics Engineering, Nanjing University of Information Science and Technology, Nanjing

2026-07-15视觉感知

面向遥感变化检测在连续跨域部署中的灾难性遗忘问题,论文指出仅保留图像级表征会忽略双时相差异线索。DG-FDD用差异引导动态适配器建模变化相关特征,并在频域解耦结构与风格进行无历史数据蒸馏。三套高分辨率数据集的两域、三域增量实验中,相对单任务模型F1/IoU下降仅约0.23%/0.45%和0.69%/1.31%。

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition Figure 1
2026-07-15cs.CV

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu

Purdue University, USA

2026-07-15视觉感知

这篇论文针对单张餐食图像营养估计中“直接 MLLM 已不弱于检索增强、但缺少可审计明细”的矛盾,提出本地可部署的 Open-KNEAD:先分解食物项,再以营养差异感知检索映射到 FNDDS,并用 recipe-prior 补偿不可见烹调用油等成分。实验覆盖三类菜系和开放模型,显示其多数设置下提升份量估计,在 ACETADA 上较闭源前沿模型直接估计也有约 30% 至 53% 优势。

Real-time fall detection based on vision for low-power edge platforms Figure 1
2026-07-15q-bio.NC

Real-time fall detection based on vision for low-power edge platforms

Wenjun Xia, Zhicheng Peng, Haopeng Li, Zhengdi Zhang

Wenjun Xia and Zhengdi Zhang are the first and corresponding authors, respectively. All authors are with Jiangsu University, Zhenjiang, China.

2026-07-15视觉感知

本文针对边缘端视觉跌倒检测易把下蹲、坐下等动作误判为跌倒的问题,将跌倒建模为人体支撑系统的稳定性丧失,而非静态姿态分类。核心做法是用双 Liquid Time-Constant 网络分别建模质心与支撑基底,并通过稳定流形、反事实轨迹和 TTC 估计判断失稳。实验称模型仅 16.1K 参数,在边缘设备上实现 20–46 ms 实时推理并降低受控动作误报,但完整三状态预测仍留待未来验证。

Rank-1 Identity Consensus Predicts Gallery Enrollment in 1:N Face Matching More Accurately than Score Thresholding Figure 1
2026-07-15cs.CV

Rank-1 Identity Consensus Predicts Gallery Enrollment in 1:N Face Matching More Accurately than Score Thresholding

Gabriella Pangelinan, Aman Bhatta, Michael C. King, Kevin W. Bowyer

2026-07-15视觉感知

针对开放集 1:N 人脸检索中无法预知探针是否已入库、且分数阈值会随图像质量和库规模漂移的问题,论文用多个独立匹配器的 rank-1 身份一致性替代单一分数阈值。36 种图库与质量场景显示,固定阈值在退化图像上 MP 召回跌至 2% 以下,而 1-consistency 无需调参即可接近逐场景 oracle 阈值精度,并在判为已入库时以 97–100% 返回正确身份。

UniMedSeg: Unified In-Context Learning for Multi-Paradigm 2D/3D Medical Image Segmentation Figure 1
2026-07-15cs.CV

UniMedSeg: Unified In-Context Learning for Multi-Paradigm 2D/3D Medical Image Segmentation

Yunzhou Li, Jiesi Hu, Yanwu Yang, Hanyang Peng, Chenfei Ye, Jianfeng Cao, Yixuan Yuan, Ting Ma

2026-07-15视觉感知三维

UniMedSeg针对医学分割中视觉示例、交互提示、语言指令以及2D/3D数据长期被不同模型和分支割裂的问题,将这些异构输入统一编码为共享序列,并用Decoupled Split Attention缓解长上下文尤其是3D体数据的显存与计算瓶颈。在27个公开数据集和2万合成3D体上训练评估后,模型在视觉上下文、交互式和语言引导分割中均达到SOTA,且无需任务微调;但部分增益可能主要来自更大规模 heterogeneous data 与统一训练。

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents Figure 1
2026-07-15cs.CV

Hy-Embodied-VLM-1.0: Efficient Physical-World Agents

Ziyi Wang, Xumin Yu, Yongming Rao, Yonggen Ling, Yunheng Li, Oran Wang, Mingqi Gao, Yuchen Zhou, Yves Liang, Zuyan Liu, Yani Zhang, Rui Huang, Xiaoran Xu, Bowen Yuan, Yifu Yuan, Xu Tan, He Zhang, Yufei Huang, Shenghao Zhang, Hongsheng Wu, Han Hu, Zhengyou Zhang

Futian Laboratory

2026-07-15视觉语言强化学习

面向机器人从数字智能走向物理世界时对动作、状态变化和长程适应的需求,本文提出以动作相关状态理解、动作-转移推理、序列自适应推理为核心的能力 taxonomy,并据此组织预训练、SFT 与强化学习数据,结合 Hy3-A3B、Hy-ViT2 和 MoE 架构提升部署效率。其在 38 个具身基准中 19 项第一,较 Hy-Embodied-0.5 平均提升 8.4%,但具体增益来源未充分消融,可能主要来自 data 与架构共同 scaling。

Inhibited Self-Attention: Sharpening Focus in Vision Transformers Figure 1
2026-07-15cs.CV

Inhibited Self-Attention: Sharpening Focus in Vision Transformers

Peter R.D. van der Wal, Nicola Strisciuglio, George Azzopardi

University of Groningen, University of Twente, Stellenbosch University, University of Malta

2026-07-15视觉感知

这篇论文针对 ViT 自注意力容易被背景和捷径特征分散的问题,提出 Inhibited Self-Attention:保留标准 softmax 前通常被抹去的负相关注意力分数,用作上下文抑制来压低无关区域响应。作者还提出 Attention-on-Objects 指标评估目标区域聚焦程度。实验覆盖 ImageNet-1k、Waterbirds、COCO/COCO-B 和 ImageNet-R,结果显示 ISA 让注意力图更集中于前景目标,降低背景依赖,并改善分类、检测及分布外鲁棒性。

Metric-Guided Synthetic Image Data Rendering for Deep Learning compatible with Agentic AI Figure 1
2026-07-15cs.CV

Metric-Guided Synthetic Image Data Rendering for Deep Learning compatible with Agentic AI

Martina Radoynova, Samuel Pantze, Trina De, Ulrik Günther, Artur Yakimovich

Center for Advanced Systems Understanding (CASUS), Görlitz, Germany, Institute of Computer Science, University of Wrocław, Wrocław, Poland

2026-07-15视觉感知

这篇论文针对生物医学视觉任务中真实标注数据稀缺、合成图像域差难以客观调参的问题,提出用 FID、梯度自然度差异和熵等指标指导 Blender 程序化渲染,并封装为 GraNatPy 与 SynthClaw。实验显示,提升合成数据的真实感、多样性和规模可改善病毒斑实例分割的零样本表现,小目标检测尤其受梯度相似性影响,混入少量真实图像还能进一步提高效果。

Statistical Non-linear Reconstruction Loss for Image Anomaly Detection Figure 1
2026-07-15cs.CV

Statistical Non-linear Reconstruction Loss for Image Anomaly Detection

Nguyen Minh Tri, Hoang Khuong Duy, Huynh Cong Viet Ngu

AIC-Lab, FPT University

2026-07-15视觉感知三维

本文针对重构式图像异常检测中 MSE 容易学习并重构异常高幅值特征、导致“异常泄漏”和同一映射捷径的问题,提出基于 sigmoid 压缩的非线性重构损失,并用正常特征分布置信区间校准缩放因子 k,使优化更聚焦正常流形。在 MVTec-AD 上达到 99.0% Image-AUROC、97.3% Pixel-AUROC,在 VisA 上达到 95.3% 和 99.0%,但最优 CI 仍需按数据集选择。

LARAD: Layout-Aware Road Anomaly Detection via Spatial-Logic Reasoning Figure 1
2026-07-15cs.CV

LARAD: Layout-Aware Road Anomaly Detection via Spatial-Logic Reasoning

Shiyi Mu, Xujie Chen, Shugong Xu

2026-07-15视觉感知

这篇论文针对道路异常分割过度依赖外观新奇性、难以识别“位置不合理但纹理正常”的障碍物,并且级联大模型带来高延迟的问题,提出 LARAD:用 SLVS 合成空间逻辑违规样本和 Logic-6K 数据集训练模型,再在单一分割网络上加入轻量 OoD 引导注意力分支进行布局推理。实验称其在 RoadAnomaly、Fishyscapes、SMIYC 上取得新的精度-效率权衡最优,并保持闭集分割性能。

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning Figure 1
2026-07-15cs.CV

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

NJU-LINK Team, Nanjing University, Institute of Automation, Chinese Academy of Sciences

2026-07-15视觉语言视觉感知

AVSCap针对全模态视频字幕中“看见”和“听见”被松散拼接、非语音声音被ASR偏置忽略的问题,将任务聚焦到事件级音视绑定。其核心是用先解耦锚定、再融合的数据流水线构建AVSCap-130K,并在Qwen2.5-Omni上结合SFT与GRPO,以混合奖励优化声学完整性和跨模态协同;AVSCapBench进一步按视觉、音频、协同事件细粒度评测。实验显示AVSCap-7B在非语音覆盖和音视关系召回上优于开源基线,但部分增益可能主要来自数据构造与奖励设计共同作用。

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning Figure 1
2026-07-15cs.CV

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

2026-07-15视觉语言视觉感知

这篇论文针对机器人视觉地点识别在部署时依赖固定匹配阈值的问题:环境变化或感知混淆会让误接受的回环严重破坏 SLAM。作者提出把 VLM 作为独立的检索后审计器,直接比较查询图和候选图的语义与结构一致性,而不依赖原 VPR 特征、置信度或环境标定。六个数据集、五种 VPR 与四个 VLM 上,平均 recall@1 提升 13.6%,FAR 降至 12%,同时保持 95% 以上精度和 75% 以上覆盖率。

UniVR: Thinking in Visual Space for Unified Visual Reasoning Figure 1
2026-07-15cs.CV

UniVR: Thinking in Visual Space for Unified Visual Reasoning

Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin

2026-07-15视觉感知

论文针对现有多模态模型过度依赖文本推理、难以保持长时序视觉任务中的物理一致性与逻辑连贯性的问题,提出 UniVR 在纯视觉空间中学习推理与规划,并用 VR-GRPO 结合全局奖励和 Step-Focal 子步骤奖励定位细粒度错误;在涵盖操作、空间谜题和物理推理的 VR-X 基准上最高提升约 25%,且可带动多模态理解表现。

AVQ-Attention: Adaptive Vector-Quantized Attention Figure 1
2026-07-15cs.LG

AVQ-Attention: Adaptive Vector-Quantized Attention

Winfried van den dool, Patrick Forré, Amir Habibian, Yuki M. Asano, Max Welling

2026-07-15视觉感知

该文针对长序列 Transformer 注意力二次复杂度高、固定 VQ 注意力又把码本容量均匀分配导致关键区域近似粗糙的问题,提出 AVQ-Attention:在前向过程中用注意力质量评估父码字重要性,并用预学习子码字自适应细化高注意力区域,同时通过 Flash Attention 兼容的 Triton 实现维持 O(MN) 复杂度。实验覆盖 ImageNet、ADE20K 和 Stable Diffusion,显示其相较固定码本 VQ 注意力有更好的精度-效率权衡。

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters? Figure 1
2026-07-15cs.AI

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

University of Glasgow, Institute of Computing Technology, Chinese Academy of Sciences, School of Artificial Intelligence, University of Glasgow United Kingdom, Institute of Computing Technology, Chinese Academy of Sciences China, School of Artificial Intelligence, Shandong University China

2026-07-15视觉语言

论文针对多模态情感识别模型动辄 7B 以上、难以部署到机器人和移动端的问题,提出 Light-MER:用 8B 教师蒸馏到 1B 以下学生,并以 SWD-H 对齐隐藏表示分布、M-GRPO 同时约束生成质量与效率。九个基准实验显示其平均性能可超过教师模型,同时降低显存占用和推理延迟,但具体增益中数据构造与训练配方的贡献仍需进一步拆分。

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models Figure 1
2026-07-15cs.CV

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

Xi’an Jiaotong University, Xi’an Jiaotong University Xi’an China

2026-07-15视觉语言视觉感知

这篇论文针对现有视觉语言模型在多图细粒度比较中容易只看单图或给出不一致推理的问题,提出 CoRe 框架:用结构化视觉元数据自动构造三图比较数据 CoRe-20K,并通过 TriSR 奖励同时约束属性定位、两两判断和三元一致性。实验在 CoRe-Bench 上较最强基线部分准确率提升 28.2 个点,同时保持常规多模态基准竞争力,但具体增益中数据规模与奖励设计的相对贡献仍需进一步拆分。

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting Figure 1
2026-07-15cs.CV

ExtraGS: Enhancing Endoscopic View Extrapolation via Diffusion-Guided 3D Gaussian Splatting

Cheng-Tai Hsieh, Jiwei Shan, Han Fang, Jianshu Hu, Tao Ni, Lijun Han, Yutong Ban, Shing Shin Cheng, Hesheng Wang

2026-07-15生成模型三维

内窥镜视野窄使机器人微创手术中的三维感知在大基线外推时容易出现盲区和伪影,现有 NeRF/3DGS 多依赖稀疏观测而缺乏监督。ExtraGS 的核心是在 3DGS 优化中引入扩散先验,用不确定性引导虚拟相机主动采样盲区,再以置信度加权的伪观测微调以避免破坏可靠区域。多公开内窥镜数据集实验显示其减少外推伪影并取得领先的 PSNR/SSIM 等结果,但真实动态手术、器械遮挡和实时性仍未充分验证。

MBTI: A Multi-Branch Efficient Fine-Tuning Framework for Hyperspectral Image Classification with Foundation Models Figure 1
2026-07-15cs.CV

MBTI: A Multi-Branch Efficient Fine-Tuning Framework for Hyperspectral Image Classification with Foundation Models

Mingzhen Xu, Haonan Guo, Di Wang, Yinghua Qu, Zhiliang Zhou, Lei Zhang, Huiwen Yao, Rui Zhao, Fengxiang Wang, Gang Wan, Bo Du, Liangpei Zhang

2026-07-15视觉感知

针对高光谱基础模型在不同传感器波段配置下难以直接迁移、常规压缩或选带会破坏光谱连续性的问题,MBTI将全波段划分为连续多分支,并用波段复用避免填充或丢弃;各分支引入独立LoRA并通过通道注意力融合。三套高光谱分类数据集上结果优于多种代表方法,rank-8时仅约2.33%–2.36%参数可训练。

No Figure
2026-07-15cs.CV

HSEmotion Team at the 11th ABAW Challenge: Multi-Task Learning and Ambivalence/Hesitancy Video Recognition

Aleksei Bakin, Andrey V. Savchenko

2026-07-15视觉感知

面向野外情感识别中大模型微调成本高、隐私部署受限的问题,本文在 ABAW-11 两项任务中采用冻结轻量视觉、音频与文本编码器,仅训练轻量头,并通过时间平滑、类别校准、AU 阈值优化与后期多模态融合提升表现。结果显示,MTL 指标从 1.31 提升到 1.56,超过 ConvNeXt 基线;A/H 公测视频级 Macro F1 达 0.731,说明主要增益来自校准与融合而非更大 backbone。

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval Figure 1
2026-07-15cs.CV

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

Northwestern Polytechnical University, Shanghai Artificial Intelligence Laboratory, The University of Hong Kong, Monash University, The Chinese University of Hong Kong (Shenzhen)

2026-07-15视觉语言

针对传统多模态 RAG/GraphRAG 将知识图离线固定、单轮检索,导致跨模态关系碎片化、缺失证据无法补全的问题,EvoGraph-R1 将知识超图视为可交互环境,把检索建模为 MDP,让智能体通过 GraphRetrieve、WebSearch、GraphEdit 和 Answer 动态扩展、修正与裁剪图结构。实验声称在多模态 VQA 与文本 QA 上较现有 RAG、GraphRAG 和搜索增强基线提升准确率、覆盖率与证据可追踪性,但具体增益来源仍需结合完整实验细节判断。

RFMSR: Residual Flow Matching for Image Super-Resolution Figure 1
2026-07-15cs.CV

RFMSR: Residual Flow Matching for Image Super-Resolution

Shuwei Huang, Tianyao Luo, Jicheng Liu, Daizong Liu, Pan Zhou

Huazhong University of Science and Technology, Wuhan University

2026-07-15视觉感知生成模型

针对现有图像超分中T2I先验成本高、易引入与低质输入不一致的幻觉,以及标准流匹配从纯噪声出发会丢失结构信息的问题,RFMSR将源分布中心设在低质图像潜变量上,用残差流缩短传输路径,并以两阶段训练兼顾单步生成和多步细化。实验显示其在合成与真实退化基准上达到或超过多种T2I方法,但当前仅验证4倍超分,进一步增益可能仍受模型规模和数据影响。

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation Figure 1
2026-07-15cs.CV

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

2026-07-15视觉感知

针对3D/4D生成中仅依赖2D扩散监督易产生多视角几何幻觉、时间抖动和身份漂移的问题,Hallo4D用多模态大模型从多视角多帧渲染中检测不一致,并通过候选修正投票、光流关键帧采样、外观对齐和曝光约束进行免重训优化。实验显示其在多种生成设置下优于强基线,主要提升时空一致性与非正面视角稳定性。

CRC-HGD: A Histopathological Image Dataset for Grading Colorectal Cancer Figure 1
2026-07-15cs.CV

CRC-HGD: A Histopathological Image Dataset for Grading Colorectal Cancer

Elham Amjadi, Amin Bahreini, Sayed Mohammad Hasan Emami, Sayyed Mohammadreza Hakimian, Alireza Fahim, Hojjatollah Rahimi, Hamidreza Bolhasani

Poursina Hakim Digestive Diseases Research Center, Isfahan University of Medical Sciences, Isfahan, Iran, Division of Transplant Services, Department of Surgery, SUNY Upstate Medical University, Syracuse, New York, USA, Cancer Prevention Research Center, Isfahan University of Medical Sciences, Isfahan, Iran, sections acquired at the Poursina Hakim Research Center of Isfahan University of Medical, is also available. The distinctive feature of this dataset is the provision of labeled specimens across, available histopathological image dataset is the essential first step for training and evaluating such, datasets classify CRC tissue types or provide binary malignant/benign labels, no publicly available dataset, this work, collected from the Poursina Hakim Research Center of Isfahan University of Medical Sciences, dataset supports multi-class tissue classification, it does not provide histologic grade labels., To the best of our knowledge, no publicly available histopathological microscopy image dataset specifically

2026-07-15视觉感知数据集/基准

结直肠癌分级依赖病理医师目视判断,耗时且一致性有限,而现有公开数据多缺少WHO三级分化标签。CRC-HGD的核心贡献是发布214名患者的1914张H&E显微图像,覆盖I/II/III级及4x、10x、20x、40x多倍率,并附少量正常与混合组织图像;主要结果是形成可公开获取的分级基准,但文中未充分说明模型实验增益。

Weakly Supervised Spatio-Temporal Candidate Discovery of Dairy Farm Sites from Seasonal Satellite Imagery Figure 1
2026-07-15cs.CV

Weakly Supervised Spatio-Temporal Candidate Discovery of Dairy Farm Sites from Seasonal Satellite Imagery

Usman Haider, Fatima Khalid, Karl Mason

School of Computer Science, University of Galway, Ireland., Faculty of Computer Science and Engineering, GIK Institute of Engineering Sciences and Technology, Pakistan.

2026-07-15视觉感知

针对农场位置标注不完整、奶牛场证据分散在牧草、道路、建筑和季节植被中的问题,论文将多季节 Sentinel 影像、OSM 弱先验、自监督 Barlow Twins 表征和图平滑结合,用于候选簇排序而非完整清点。在 Cork 的 26722 个瓦片中筛出 71 个簇,Top-5 在 500/1000 米代理评估下精度为 0.60/0.80,但指标依赖 OSM 留出特征,真实检测精度仍需人工验证。

Color Pass-Through via Camera-Display Coupling Figure 1
2026-07-15cs.CV

Color Pass-Through via Camera-Display Coupling

Ruikang Li, Molin Li, Jiarui Wu, Zhe Wei, Pengpeng Liu, Tianfan Xue

2026-07-15视觉感知

这篇论文关注手机或透视设备中“相机拍到再由屏幕显示”后颜色、亮度和对比度偏离真实场景的问题。核心洞察是把相机与显示屏作为耦合系统端到端学习,而非分别校准,并用重拍数据训练像素级神经投影器,再通过相机零空间的低维观察者校正补偿残余色偏。实验显示,相比白平衡和色卡校准等基线,用户研究平均提升约2.0分,定量指标提升超过2倍。

Label-Decoupled Style Augmentation for Domain Generalization in Multi-Label Remote Sensing Scene Classification Figure 1
2026-07-15cs.CV

Label-Decoupled Style Augmentation for Domain Generalization in Multi-Label Remote Sensing Scene Classification

Alaa Almouradi, Erchan Aptoula

2026-07-15学习理论

多标签遥感场景在跨传感器、区域或分辨率部署时易受域偏移影响,而现有 MixStyle 等全局特征统计增强会把一张图当作单一风格,混淆水体、建筑等标签区域。本文用标签注意力或 Grad-CAM 将风格扰动限定在同标签区域,并为各标签独立混合统计量;在 UCM、AID、DFC15 留一域评测中最佳 mAP 为 71.5%,较 ERM 高 5.0 点、较最强全局统计基线高 1.3 点。

Lesion Segmentation in Moderate to Severe Traumatic Brain Injury: An nnU-Net Based Approach with Adaptive Normalization in the AIMS-TBI 2025 Challenge Figure 1
2026-07-15cs.CV

Lesion Segmentation in Moderate to Severe Traumatic Brain Injury: An nnU-Net Based Approach with Adaptive Normalization in the AIMS-TBI 2025 Challenge

Inhwa Son, Gaeun Lee, Sohyeon Sim, Kwang-Hyun Uhm

2026-07-15视觉感知

针对中重度创伤性脑损伤在T1 MRI中病灶形态、大小和位置高度异质,现有自动分割难以稳定泛化的问题,论文在nnU-Net流程中加入仅限脑实质区域的自适应强度归一化,以减少非脑组织和跨受试者强度差异干扰。AIMS-TBI 2025测试集上总体Dice为0.6305,病灶Dice为0.4805、非病灶Dice为0.9324,说明特异性较强,但小而弥散病灶的敏感性仍受限。

No Figure
2026-07-15cs.CV

MambaPSA: A Mamba-based Replacement for C2PSA in YOLO26

Sheng-Wei Chan, Chia-Min Lin, Hsin-Jui Pan, Ching-Yu Tsai, Chih-Hsiang Yang, Yung-Che Wang, Jen-Shiun Chiang

2026-07-15视觉感知

这篇论文针对 YOLO26 中 C2PSA 自注意力计算开销较高、限制轻量化部署的问题,提出用保留 CSP 外壳的 MambaPSA 替换骨干末端 C2PSA,并比较 BiViM 插入 P3/P4/P5 颈部位置的影响。在 PASCAL VOC 上,MambaPSA 以 mAP50:95 仅降 0.1 为代价,减少 2.9% 参数和 12.1% FLOPs,CPU FPS 从 17 提升到 20;P4-BiViM 精度提升最大,但结果仅单 seed,稳定性文中未充分说明。

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning Figure 1
2026-07-15cs.CV

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

Jiahang Wang, Yirong Yang, Yanqing Zhu, Minghua Luo, Shichao Xie, Fei Liu, Mu Xu

2026-07-15机器人视觉语言视觉感知

本文针对视觉语言导航中长程执行易累积偏差、现有高低层模块缺少闭环反馈的问题,提出 ReflectVLN:由意图代理和执行代理双向交互,按进度与偏差信号触发反思、子任务更新和纠错,并用 Action-CoT 约束路径级推理与短程动作生成。实验显示其在 R2R-CE、RxR-CE 上提升成功率和路径效率,在受限数据预算下减少高层调用;但延迟、总计算成本和容量匹配比较文中未充分说明。

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings Figure 1
2026-07-15cs.CV

Text-Aided Multi-Modal Panoptic Symbol Spotting for CAD Floor Plan Drawings

Yan Gong, Bohao Li, Bowen Du, Junchen Ye

2026-07-15视觉感知

这篇论文针对CAD楼层图符号识别中过度依赖几何图元、忽视密集文字标注的问题,提出TextCAD联合建模图元与文本。核心在于用TACE显式编码标注中的类型-属性关系,并通过多层语义过滤在不同下采样尺度对齐文本语义与图元特征,减少跨层语义错配。实验显示其在真实建筑设计数据上优于既有方法,尤其在缺少图层等先验时提升更明显。

MAGE: Color-Invariant and Spatial Knowledge Distillation for Gastric Neoplasm Classification Figure 1
2026-07-15cs.CV

MAGE: Color-Invariant and Spatial Knowledge Distillation for Gastric Neoplasm Classification

Jiho Jun, Jeongwon Woo, Jaemin Song, Thanh Bong Nguyen, Dong-heon Yeon, Donghoon Kang, Jae-Myung Park, Sung-Jea Ko, Kwang-Hyun Uhm

2026-07-15视觉感知

这篇论文针对胃腺瘤与胃癌在内镜白光图像中外观相近、边界模糊且模型易依赖出血和光照等伪相关的问题,提出 MAGE:训练时用带掩膜的灰度病灶专家学习更偏形态结构的表征,再将分类 logits 与空间注意力蒸馏给无需掩膜的全图模型。临床胃镜数据实验显示其优于 YOLO、Swin-Transformer 等检测或分类基线,并能给出更集中于病灶的可解释注意图。

Instance-Enriched Semantic Maps for Visual Language Navigation Figure 1
2026-07-15cs.RO

Instance-Enriched Semantic Maps for Visual Language Navigation

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

2026-07-15机器人

这篇论文针对视觉语言导航中语义地图缺少实例细节、难处理多样化指令且3D表示存储开销大的问题,提出实例增强的2.5D语义地图:用开放词汇全景分割保留垂直层次和小物体,并为实例加入房间上下文与描述性 caption,再通过多类型专家融合检索选择目标。实验显示其相对3D基线AUC提升超27%,目标检索提升超17%,导航成功率提升超23%,存储约减少96%。

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill Figure 1
2026-07-15cs.CL

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill

Yunxin Li, Jinchao Li, Shibo Su, Zhenran Xu, Chenrui Zhao, Tongshu Bian, Xiaoman Liang, Meishan Zhang, Baotian Hu, Min Zhang

Lychee Team, Harbin Institute of Technology, Shenzhen, AI Training Platform, Shenzhen Loop Area Institute

2026-07-15视觉感知

这篇论文针对 OpenClaw 类个人助理难以稳定完成跨平台 GUI 操作、且执行经验无法沉淀复用的问题,提出 KnowAct-GUIClaw:由宿主代理负责长期任务编排与知识检索,GUI 子代理负责视觉操作,并通过可归因记忆、自进化技能库和黑板协议复用历史轨迹。实验覆盖 Android、iOS、HarmonyOS 与 Windows,在 MobileWorld 长程任务上最高达到 64.1% 成功率,记忆与技能也为不同基座模型带来 8.5% 至 16.2% 增益。

Towards Vision-Free CIR: Attribute-Augmented Scoring and LLM-Based Reranking for Zero-Shot Composed Image Retrieval Figure 1
2026-07-15cs.CV

Towards Vision-Free CIR: Attribute-Augmented Scoring and LLM-Based Reranking for Zero-Shot Composed Image Retrieval

Ryotaro Shimada, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

The University of Tokyo

2026-07-15视觉感知三维

论文针对组合图像检索中“以文本表示图像”的 Vision-Free 路线会丢失细粒度视觉信息的问题,提出将数据库图像、参考图像和修改指令转为文本后检索,并加入属性增强混合打分与 LLM 重排序来显式校验颜色、纹理等约束和语义一致性。在 CIRR 上零样本 R@1 达 44.04%,较已有方法提升 8.79%,但 FashionIQ 结果显示无图像嵌入时细粒度匹配仍受限。

Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT Figure 1
2026-07-15cs.CV

Decouple and Reason: Anatomically Guided Two-Stage Voxel-Level Grounding of Free-Text Findings in 3D Chest CT

Kwang-Hyun Uhm, Inhwa Son, Sung-Jea Ko

2026-07-15视觉语言三维

这篇论文针对胸部3D CT报告中的自由文本发现难以精确映射到体素级病灶的问题,提出先做类别无关病灶分割、再对候选子体积与文本进行推理匹配的两阶段DAGG框架。其关键洞察是将定位与语义对齐解耦,并用相对空间坐标、肺叶先验和独立成对对齐缓解局部歧义与医学文本的伪负样本问题。在ReXGroundingCT上,方法取得官方榜单整体grounding质量的SOTA结果。

WanToFight: Real-Time Generative Game Engine for Multi-Player Combat Interaction Figure 1
2026-07-15cs.CV

WanToFight: Real-Time Generative Game Engine for Multi-Player Combat Interaction

Li Hu, Guangyuan Wang, Peng Zhang, Bang Zhang

Tongyi Lab, Alibaba

2026-07-15生成模型

针对现有生成式游戏引擎难以同时处理多人控制、实时推理、精确碰撞和对抗交互的问题,WanToFight将Wan-1.3B改造成流式自回归视频扩散引擎,并用玩家身份绑定与局部因果键盘注入减少串控。实验显示其可在单张RTX 5090上以512×384、30FPS生成完整双人KOF’97对战,但跨游戏和三人以上扩展仍未充分验证。

Medical Image Segmentation based on Deep Active Contour and Mean Curvature Loss Function Figure 1
2026-07-15eess.IV

Medical Image Segmentation based on Deep Active Contour and Mean Curvature Loss Function

Xiao-qiang Zhai, Zhi-feng Pang, Peng Zheng, Ze-wen Li, Yan-zhe Hou

Henan Provincial Center for Applied Mathematics, Henan University, Kaifeng 475004, China, College of Mathematics and Statistics, Henan University, Kaifeng 475004, China, Advanced Institute of Finance, Henan University, Kaifeng 475004, China, School of Software, Henan Agricultural University, Zhengzhou 450000, China, which then limits the scalability and applicability of segmentation methods. In addition, data-, requirement of large labelled datasets [6], [7]. To improve the interpretabilities of deep learning

2026-07-15视觉感知

这篇论文针对医学分割中像素级损失缺少几何先验、边界连通性和平滑性不足的问题,将主动轮廓模型与平均曲率约束合入 DACMC 损失,并用卷积核近似曲率以降低计算开销。作者在肝脏 CT 和脾脏 MRI 数据集上验证,报告优于多种深度主动轮廓相关方法并达到新的最佳结果,但具体增益来源仍需结合完整实验细节判断。

Traceback Translators Against Forgetting in Continual Fake Speech Detection Figure 1
2026-07-15cs.CV

Traceback Translators Against Forgetting in Continual Fake Speech Detection

Enrico Gottardis, Mattia Tamiazzo, Simone Milani

2026-07-15视觉感知

针对语音深度伪造检测器在新生成模型和跨语言数据上持续更新时易灾难性遗忘的问题,论文在冻结的检测骨干中加入轻量级 traceback 域翻译器,将新域特征映射回原始特征空间,并结合 MFCC 片段与扩散模型数据增强。实验显示,相比全量重训和常规域适配,该方法以更少可训练参数保持新数据检测率,同时更好保留旧数据精度;但更大规模域偏移下的稳健性仍待验证。

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding Figure 1
2026-07-15cs.CV

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu

2026-07-15视觉感知三维

长视频理解中,LVLM 的均匀采样会带来高视觉 token 成本,并忽略事件级语义结构。该文提出训练自由的 GMM-EVA,用高斯混合模型从帧级相关性分数中拟合潜在事件,再为每个事件分配一个高分辨率主关键帧和低分辨率辅助帧,以减少事件内冗余。多基准实验显示其优于均匀采样,并在约一半视觉 token 预算下达到或超过部分现有选择方法。

CGRL: Concept-Guided Pruning and Representation Learning for Whole-Slide Image Classification Figure 1
2026-07-15cs.CV

CGRL: Concept-Guided Pruning and Representation Learning for Whole-Slide Image Classification

Thuc Huynh, Tuan Le, Doanh C. Bui

2026-07-15视觉感知强化学习

针对弱监督全切片病理分类中大量无信息 patch 带来冗余、且 MIL 特征与疾病语义对齐不足的问题,CGRL 用疾病提示生成类级概念原型,同时做概念相关性 top-K 剪枝和对比式表征约束。实验在 TCGA-BRCA 与 TCGA-NSCLC 上接入多种 MIL 模型,部分组合提升准确率和 macro-F1,并降低计算量,但增益依赖具体模型与数据集。

VanillaBench: The Hidden Accuracy Cost of Adversarial Robustness Figure 1
2026-07-15cs.CR

VanillaBench: The Hidden Accuracy Cost of Adversarial Robustness

Niklas Bunzel

2026-07-15安全鲁棒

论文针对对抗鲁棒研究常只报告鲁棒模型的干净精度和攻击下精度、却缺少非对抗训练基线的问题,提出 VanillaBench,将 RobustBench 中 186 个模型与多种 vanilla 参照、年份匹配和架构匹配基线比较。结果显示鲁棒模型相对最佳 vanilla 平均低 7.7 至 29.5 个百分点,架构匹配后仍低 3.5 至 17.5 点,说明真实精度代价常被低估。

Edge-Aware Thermal Infrared UAV Swarm Tracking Figure 1
2026-07-15cs.CV

Edge-Aware Thermal Infrared UAV Swarm Tracking

Yu-Hsi Chen

The University of Melbourne

2026-07-15视觉感知

本文针对热红外无人机集群中目标小、遮挡多、机动快且边缘设备算力受限的问题,提出以自适应运动学卡尔曼滤波为核心的在线跟踪流程,引入状态相关运动建模、短暂误检抑制和预测滑行。BSB实验显示其在保持约95 FPS实时性的同时小幅提升HOTA、MOTA和IDF1,但相对基线增益很小,实际收益来源仍需更多边缘设备验证。

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models Figure 1
2026-07-15cs.CV

DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models

Francesco Taioli, Daniel Coelho, Iaroslav Melekhov, Roberto Alcover-Couso, Jose Miguel Grande Saiz, Virginia Fernandez Arguedas, Artur Bekasov

2026-07-15视觉感知生成模型

本文针对文本引导图像编辑中旋转、去背景等操作容易改变物体纹理、几何和细节的问题,构建了含 1.2 万余组源图、提示和 3D 渲染目标图的 ABO-Edit 基准,并指出整流流编辑模型的条件嵌入在高噪声阶段已隐含目标图预测。基于此提出无需新增参数的 FlowMirror 辅助损失来监督该空间,实验显示其在多项生成质量和一致性指标上优于基线。

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs Figure 1
2026-07-15cs.CV

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

Xiamen University, Shenzhen International Graduate School, Tsinghua University, China University of Mining and Technology, Shenzhen Technology University

2026-07-15视觉感知

DynTrace针对MLLM在动态场景中依赖稀疏帧、难以区分相机自运动与真实物体运动的问题,提出无需训练的4D时空推理框架:用轨迹重投影提供几何视觉先验,并以动态轨迹图组织物体级证据链。实验显示其在Dyn-Bench、VLM4D和DSI-Bench上稳定提升开源MLLM表现,说明连续跟踪动态物体证据是改进4D推理的关键。

Adversarial Attacks on Online Handwriting using Salience-based Temporal Editing Figure 1
2026-07-15cs.LG

Adversarial Attacks on Online Handwriting using Salience-based Temporal Editing

Yataro Tamura, Brian Kenji Iwana, Jiseok Lee

2026-07-15视觉感知

这篇论文针对在线手写识别中传统图像式对抗扰动会造成轨迹抖动、且白盒假设不现实的问题,提出 AITE:用 Grad-CAM 估计时间步显著性,再通过插入或删除笔迹点生成对抗样本。实验在 Unipen 和 CASIA-OLHWDB 上显示,该方法相比空间噪声攻击更能保持笔迹结构与平滑性,并在一次性黑盒迁移场景下更有效。

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation Figure 1
2026-07-15cs.CV

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

The Chinese University of Hong Kong (Shenzhen), Technical University of Munich, The Chinese University of Hong Kong (Shenzhen) China, Technical University of Munich Germany

2026-07-15数据集/基准

这篇论文针对遥感智能体多停留在分类、定位等感知任务、难以支撑灾害评估和城市热岛分析等决策型地理推理的问题,提出 TerraLogic 基准,将545个光学、SAR和红外场景组织为含意图、依赖子目标和可执行空间约束的层级任务,并给出 HieraPlan 作为工具增强基线。实验显示现有LLM在层级地理推理上仍明显吃力,HieraPlan在推理稳定性、跨模态泛化和工具失败恢复上更强。

RealSkin: Spatio-Spectral Partial Neural Adjoint Maps for Image-to-3D Attribute Transfer Figure 1
2026-07-15cs.CV

RealSkin: Spatio-Spectral Partial Neural Adjoint Maps for Image-to-3D Attribute Transfer

Jing Li, Yawei Luo, Xiangze Meng, Ying Li, Tieru Wu, Rui Ma

Jilin University, Zhejiang University, North China University of Technology, Jilin University China, Zhejiang University China, North China University of Technology China

2026-07-15视觉感知三维

RealSkin针对真实图像到合成3D资产外观迁移中的分辨率不匹配、拓扑差异和非等距形变问题,将任务重写为局部重建表面与目标子网格之间的部分函数映射。其核心是先用空间引导注册获得粗对应,再用谱感知神经伴随网络在函数空间中建模非等距残差并细化对应。实验称在真实到合成场景中取得优于既有方法的属性迁移效果,但具体增益来源仍需结合消融细节判断。

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence Figure 1
2026-07-15cs.CV

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

Zhishan Zou, Guoyan Sun, Zhiwei Wei, Jiancheng Pan, Yujie Li, Mugen Peng, Wenjia Xu

2026-07-15数据集/基准

这篇论文针对现有无人机多模态模型评测偏重环境理解、忽视机体自身状态的问题,提出 SIS-Bench,将空间认知与自我意识统一到感知、记忆、推理三层任务中,并基于真实 UAV 视频构建 4,856 个问答。评测 26 个模型发现当前 MLLM 对“自我”的建模明显弱于对空间的理解,且层级越高性能越差;引入光流运动特征的 SIS-Motion 可改善感知和记忆,并迁移到导航决策任务。

Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification Figure 1
2026-07-15cs.CV

Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Medical Classification

Jeeyung Kim, Erfan Esmaeili, Qiang Qiu

2026-07-15生成模型

这篇论文针对少样本医学分类中扩散增强样本“看起来真实但未必有用”的问题,提出类别对比影响力 C2I:有用样本应与同类验证梯度对齐、与异类梯度相斥,通常靠近决策边界。作者用 C2I 作为强化学习奖励微调扩散模型,使其生成更能塑造分类边界的样本;在多个少样本医学影像任务上,相比常规和扩散增强基线提升了准确率与鲁棒性,但会带来额外计算开销。

Let RGB Be the Language of Vision Figure 1
2026-07-15cs.CV

Let RGB Be the Language of Vision

Timing Yang, Jinrui Yang, Xinlong Li, Yuhan Wang, Haoran Li, Yanqing Liu, Guoyizhe Wei, Jixuan Ying, Chen Wei, Rama Chellappa, Yuyin Zhou, Cihang Xie, Alan Yuille, Feng Wang

2026-07-15视觉感知

论文针对视觉任务长期依赖分割、深度、姿态等异构表示和专用头的问题,提出 RINO:把各类视觉输入输出都转成 RGB,将理解与条件生成统一为 RGB/text 到 RGB/text 的图像编辑。基于冻结的通用图像编辑器,模型在 20 多个任务上零样本取得接近专家模型或新的条件生成零样本 SOTA;但增益可能主要来自基础编辑模型的 scaling / data,专门训练贡献文中未充分说明。

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning Figure 1
2026-07-15cs.CV

ARDepth: Auto-regressive Monocular Depth Estimation with Progressive Visual Conditioning

Zijie Wang, Wei Zhang, Weiming Zhang, Xiao Tan, Weikai Chen, Xiaoxu Li, Guanbin Li

Wei Zhang, Weiming Zhang and Xiao Tan are with Baidu Inc., Shenzhen, 518066, China., Xiaoxu Li is with the School of Computer Science and Artificial Intelligence, Lanzhou University of Technology, Lanzhou 730050, China.

2026-07-15视觉感知

ARDepth针对扩散式单目深度估计把深度视为全局平滑场、易削弱边界和细结构的问题,提出从粗到细的自回归深度生成框架,并用尺度渐进视觉条件与语义引导对齐不同分辨率阶段。实验显示其在零样本、相对深度和NYUv2域内评测中优于相关AR基线,接近或超过多种扩散先验方法,且随数据规模扩大仍有稳定增益。

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization Figure 1
2026-07-15cs.CV

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

Chuankai Liu is with the Beijing Aerospace Control Center.

2026-07-15视觉感知

这篇论文把跨视角定位从单纯的2D匹配或位姿回归,重新定义为学习极端视角差下稳定语义、结构和几何的训练任务。核心方法CROSS将3D grounding、结构感知匹配和位姿假设排序结合起来,避免僵硬点对点匹配和绝对目标的局限。在KITTI与VIGOR上取得跨视角定位SOTA,并显示出更好的语义一致性、结构可靠性和几何迁移能力。

DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection Figure 1
2026-07-15cs.CV

DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection

Haifa Zhang, Yijing Wang, Peixi Peng, Zhiqiang Zuo

2026-07-15视觉感知三维

本文针对激光雷达-相机3D检测中过度依赖大型2D视觉骨干的问题,指出其不仅参数冗余,还与BEV几何所需的稀疏深度表征不匹配。DeGuNet用仅0.31M参数的深度补全预训练骨干,结合MPIR块和渐进Guide模块处理超过98%无效像素的稀疏投影。nuScenes上替换多种基线后,最高减少66.5%显存、推理加速1.16倍,并带来最高6.20 mAP提升。

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning Figure 1
2026-07-15cs.CV

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

2026-07-15视觉语言

这篇论文针对少样本 VLM 适配中“Top-K 候选常正确、Top-1 细粒度区分不足”的问题,提出 MQAdapter:先用冻结 CLIP 找到相近类别作为语义锚点,再将图文特征编码到量子态,用变分量子线路建模高阶跨模态交互来细化视觉表征。实验覆盖 15 个数据集,报告在仅增加约 0.078M 可训练参数下优于多种适配方法,但量子机制相对经典高阶交互的独立增益仍需更多消融支撑。

Virtual Chromoendscopy with Tunable Visibility Enhancement Figure 1
2026-07-15cs.CV

Virtual Chromoendscopy with Tunable Visibility Enhancement

Yuhi Kanno, Yusuke Monno, Sho Suzuki, Tomohiro Tada, Masatoshi Okutomi

2026-07-15视觉感知

针对传统染色内镜需喷洒靛胭脂、增加检查时间和成本的问题,论文提出 V-ECE:先用梯度增强和红蓝色彩对比增强生成增强染色图像,再训练可调增益的 tunable CycleGAN,从普通内镜图像直接合成不同增强级别的结果。实验显示,单一模型能按用户设定生成较合理的 V-ECE,并与各增益专用模型表现一致;临床有效性仍需在真实内镜环境中进一步验证。

Contrastive-Augmented Flow Matching for Style-Content Disentanglement Figure 1
2026-07-15cs.CV

Contrastive-Augmented Flow Matching for Style-Content Disentanglement

Yusong Li, Pingchuan Ma, Ming Gui, Vincent Tao Hu, Björn Ommer

All authors are with the Computer Vision & Learning Group at the University of Munich during this work.

2026-07-15生成模型

针对仅靠生成式流匹配易产生内容与风格泄漏、难以泛化到新组合的问题,CAtFM在可逆Flow Matching中加入作用于预测端点的对比监督,用语义一致性约束传输结果而非硬性规定中间潜变量。实验在CLIP嵌入空间并用DINO、ALIGN验证,显示其在合成数据、ImageNet、WikiArt、DomainNet和DTD上提升内容/风格检索、聚类分离与开放集鲁棒性。

Physically Aware Radiomics Without Interpolation: Disentangling Voxel Geometry and Signal Modification in CT and MRI Figure 1
2026-07-15cs.CV

Physically Aware Radiomics Without Interpolation: Disentangling Voxel Geometry and Signal Modification in CT and MRI

David Corral Fontecha, Juan Miranda Bautista, Pablo Menendez Fernández-Miranda, Sergio Rubio-Martín, Lara Lloret Iglesias, Jose A. Vega

Department of Radiology, Complejo Asistencial Universitario de León, León, Spain, Department of Radiology, Hospital Universitario Rey Juan Carlos, Móstoles, Madrid, Spain, Health Research Institute of the Jiménez Díaz Foundation, IIS-FJD, Madrid, Spain, Department of Physical Therapy, Occupational Therapy, Rehabilitation and Physical Medicine, Rey Juan Carlos University, Madrid, Spain, Department of Morphology and Cell Biology, Grupo SINPOS, Universidad de Oviedo, Oviedo, Spain, Department of Electrical, Systems and Automation Engineering, Universidad de León, León, Spain

2026-07-15视觉感知

这篇论文针对CT/MRI放射组学中各向异性体素会把真实空间几何与重采样插值造成的信号改变混在一起的问题,提出在修改版PyRadiomics中直接把体素间距纳入纹理邻域计算,而不重采样图像。实验比较原生、重采样、体素间距感知和伪各向同性设置,发现该方法与原生特征高度一致,CT中外部验证性能接近原生方案,重采样则带来更大特征偏移;MRI结果更依赖预处理与分类器。

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction Figure 1
2026-07-15cs.CV

Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction

Yameng Zhang, Zhongyu Chen, Dianye Huang, Xiangyu Chu, K. W. Samuel Au, Zhongliang Jiang

2026-07-15三维安全鲁棒

针对自由手三维超声重建中长轨迹位姿漂移和纯超声/纯相机各自不稳的问题,论文用双目相机提供全局一致轨迹,再由B-mode序列提取局部解剖运动线索,通过跨模态残差和多尺度位姿损失修正探头位姿。在两个自建数据集上平均漂移降至1.67 mm和1.29 mm,较双相机基线提升16.5%和27.1%,体内前臂血管重建Hausdorff距离为1.58 mm。

SeamGen: Artist-Aligned UV Seam Generation via Graph Flow Matching Figure 1
2026-07-15cs.CV

SeamGen: Artist-Aligned UV Seam Generation via Graph Flow Matching

Hao Xu, Yuqing Zhang, Yiqian Wu, Xueqi Ma, Ding Liang, Yan-Pei Cao, Ying-Tian Liu, Xiaogang Jin

State Key Lab of CAD&CG, Zhejiang University

2026-07-15生成模型

SeamGen针对传统UV自动切缝依赖几何失真目标或语义代理、难以符合工业美术切缝习惯的问题,将切缝建模为网格边上的条件生成任务。其核心是用flow matching学习专业UV数据中的逐边缝线分布,并设计结合局部边图注意力与全局顶点自注意力的Mesh Transformer,同时支持约束补全和局部重采样。实验显示其生成的UV岛与缝线路径更接近艺术家布局,感知质量优于xatlas、PartUV等基线。

Demonstration of the common dual-channel feature decoupling characteristic of front-door mediation causal inference methods in whole-slice image classification Figure 1
2026-07-15cs.CV

Demonstration of the common dual-channel feature decoupling characteristic of front-door mediation causal inference methods in whole-slice image classification

Zhirui Zhang, Tianhang Nan, Yong Ding, Zhuolun Song, Dayu Hu, Xiaoyu Cui

. College of Medicine and Biological Information Engineering, Northeastern University, China, classification models using only WSI-level labels [6-8]. This, region) is relevant to the global label and aggregates instance

2026-07-15视觉感知模仿学习

针对WSI弱监督分类中MIL易把染色、扫描等非因果偏差当作诊断依据的问题,论文从前门干预公式出发提出“基线通道+因果通道”的双通道特征解耦解释框架,并用特征差异刻画去混杂强度;在乳腺癌与非小细胞肺癌数据集上,作者验证因果通道可独立完成分类,且与基线特征差异越大越能定位诊断性patch、削弱虚假相关。

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment Figure 1
2026-07-15cs.CV

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

2026-07-15视觉感知

针对现有 MLLM 图像质量评价容易受语义表征主导、对噪声、模糊和压缩伪影等低层退化不敏感的问题,IQA-T1让模型在推理中自主调用噪声残差、梯度统计、频谱等分析工具,把结构化视觉证据纳入质量判断,并用 Q-Tool 的 1.1 万条证据链经 SFT 与 RL 训练工具策略。七个 IQA 基准上平均 PLCC/SRCC 达 0.795/0.784,整体优于传统和近期 MLLM 方法。

UMSS: Towards Unsupervised Multi-modal Semantic Segmentation Figure 1
2026-07-15cs.CV

UMSS: Towards Unsupervised Multi-modal Semantic Segmentation

Haitian Zhang, Thai Duy Nguyen, Xiangyuan Wang, Mohan Liu, Lin Wang

2026-07-15视觉感知

本文针对机器人导航、自动驾驶等场景中多模态语义分割依赖像素标注的问题,提出无监督多模态语义分割任务,并指出直接套用监督融合会因跨传感器结构冲突导致退化。其UniM2以DINOv3为基础,通过跨模态对应协同学习共享潜空间,并用RGB参考的协调器抑制不可靠对齐;在NYU-Depth-v2和MFNet上较RGB基线分别提升6.4%和9.8% mIoU。

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction Figure 1
2026-07-15cs.CV

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik

2026-07-15视觉语言视觉感知三维

本文针对 EEG 图像重建评估中像素/表征指标混淆视觉保真与可恢复语义的问题,提出由多种 VLM 结构化判别感知对齐与语义对齐,并蒸馏为轻量 BCI-Coherence Score。作者在 6855 对重建样本上显示传统指标与语义一致性相关性弱或存在盲区,BCS 对 VLM 共识的预测误差较低,并获较高人类一致性验证,但其作为评估器的泛化边界仍需更多跨数据检验。

Implicit 4D Gaussian Splatting for Fast Motion with Large Inter-Frame Displacements Figure 1
2026-07-15cs.CV

Implicit 4D Gaussian Splatting for Fast Motion with Large Inter-Frame Displacements

Seung-gyeom Kim, Areum Kim, Yongjae Yoo, Sukmin Yun

Department of Applied Artificial Intelligence, Hanyang University, Corresponding author. Also affiliated with Hanyang University ERICA.

2026-07-15三维

这篇论文针对快速运动和大帧间位移下4D Gaussian Splatting容易丢失运动物体的问题,指出失效关键不只是位置跟踪,而是颜色、透明度、尺度等高斯属性在背景主导的重建损失中塌缩。作者提出SPIN-4DGS,先显式收集并细化时空位置,再用轻量前馈网络从位置隐式预测属性,降低逐点存储开销并增强时空一致性。在CMU Panoptic运动场景上,方法在PSNR和SSIM上优于基线,篮球场景较D3DGS提升1.83 dB。

ACID: Adaptive Caching for vIDeo generation Figure 1
2026-07-15cs.CV

ACID: Adaptive Caching for vIDeo generation

Om Agrawal, Saurabh Agarwal, Aditya Akella

2026-07-15视觉感知

视频扩散模型推理慢,现有 TeaCache、EasyCache、DiCache 等动态缓存用固定漂移阈值,导致速度与质量被人为绑定。ACID 的核心洞察是去噪过程中存在漂移变化剧烈的关键步,因此用信号二阶变化在高、低阈值间自适应切换,在关键步保守、其余步骤更激进缓存。实验覆盖三种缓存方法和 HunyuanVideo、Wan 2.1、CogVideoX,显示其可扩展质量-延迟 Pareto 前沿;在 TeaCache+HunyuanVideo 上最高达 2.16 倍加速,并比保守固定阈值再快 38%,质量指标下降很小。

Filtering-out poor-quality images for data preparation Figure 1
2026-07-15cs.CV

Filtering-out poor-quality images for data preparation

Roopdeep Kaur, Gour Karmakar, Muhammad Imran

R. Kaur, G. Karmakar and M. Imran are with the Institute of Innovation, Science and Sustainability, Federation University Australia

2026-07-15视觉感知

针对雨雪、阴影、黑暗、镜头模糊/污渍等环境与相机因素导致识别模型受低质图像拖累的问题,论文不再尝试逐类去噪,而是用图像质量评估指标和验证集阈值直接剔除低质样本,并约束剩余训练量。实验在 CURE-TSR 与 CURE-OR 上报告平均准确率 93.8% 和 84.9%,高于对比滤波方法,但阈值选择带来的数据筛选增益来源仍需进一步拆解。

ProtoPointNet: Prototype-Based Interpretable Classification of 3D Dental Point Clouds with Verifiable Spatial Activations Figure 1
2026-07-15cs.CV

ProtoPointNet: Prototype-Based Interpretable Classification of 3D Dental Point Clouds with Verifiable Spatial Activations

George V. Jose, Thao Liang Chiam, Toby Hughes, Dilan Patel, Alan Brook, Lyle J. Palmer, Nikhil Cherian Kurian

2026-07-15三维

这篇论文针对牙科三维咬合分类中黑箱模型难以给出可核查解剖依据的问题,提出 ProtoPointNet:用包含局部几何、曲率、上下牙弓位移与间隙的14维点描述符,结合共享点云骨干和分任务原型头,把分类证据投回牙面区域。在 Bits2Bites 小样本数据上,平均 macro-F1 为0.724、AUROC 为0.825,垂直和左矢状任务表现最好;但中线任务接近随机,增益在稀有类别上仍不充分说明。

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery Figure 1
2026-07-15cs.CV

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery

Xinyue Xu, Zheng Zhang, Kunyang Ma, Ge Zhu, Lianshuai Cao, Lei Wang, Zixuan Li, Yi Cheng

2026-07-15视觉语言视觉感知

这篇论文针对街景问答中 VLM 易在物体方位、距离上产生空间语义幻觉的问题,提出 DM-KG:用全景分割和单目度量深度估计恢复实体级 3D 坐标,并将对象间钟点方位和欧氏距离编码为 JSON 知识图谱注入模型。实验显示其距离估计 MAE 降低 31.1%、方向角误差降低 65.8%,同时保持较高问答成功率。

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation Figure 1
2026-07-15cs.CV

What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation

Farrukh Rahman

Georgia Institute of Technology

2026-07-15视觉语言视觉感知数据集/基准

这篇论文质疑视频 VLM 时间基准分数到底测到什么:高分可能来自单帧线索、答案先验或位置编码,而非真正按视觉序列理解时间。核心创新是用反转视频但保持 RoPE 前向的 reversal-drop,无需新标注地区分模型依赖视觉顺序还是位置通道。结果显示 Molmo2 更偏位置主导,Qwen3-VL 更偏视觉序列主导;两者总分和多帧增益相近却失败模式相反,激活 patching 进一步支持该差异是模型内部属性。

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence Figure 1
2026-07-15cs.CV

MobileSAM2: Lightweight Segment Anything for Spatial Intelligence

Kai Jiang, Jiaxing Huang, Jingyi Zhang, Weiying Xie, Yunsong Li, Yufei Wang, Aoran Xiao, Dacheng Tao

2026-07-15视觉感知

这篇论文针对 SAM2 难以部署到手机、笔记本、机器人等受限设备的问题,提出用超图知识蒸馏 HyperKD 将教师模型中的跨帧时序关系和对象-部件-子部件等多粒度关系显式建模并迁移到轻量学生模型,同时搜索 MobileSAM2 架构。实验显示其在 LVOS 等基准上优于 TinyViT 替代方案,23M 版本在移动 GPU 上可运行并取得 69.0 J&F,且在具身 AI 任务上有一定泛化表现。

Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction Figure 1
2026-07-15cs.CV

Adaptive Cross-Modal Fusion with Sparse Attention for Pedestrian Crossing Intention Prediction

Md Mahfuzur Rahman, Pengzhan Zhou, A F M Abdun Noor, Md Imam Ahasan, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mustafizur Rahman, Kaixin Gao

Faculty of Information Science & Technology, Multimedia University, Malaysia

2026-07-15视觉感知

面向自动驾驶中提前1–2秒判断行人是否过街的问题,本文认为单模态或密集跨模态注意力容易忽略交通上下文并引入无效模态噪声。ADAPT用共享Swin提取RGB、深度、语义等视觉特征,以门控层级注意力融合局部/全局视觉,再用Mamba编码速度、框和姿态,并通过top-k稀疏跨模态注意力选择有用交互。在JAAD和PIE上报告AUC/准确率领先基线,推理约17.23 ms,但作为arXiv预印本,泛化与增益来源仍需更多独立验证。

Semantic-Edge Response Decoding of SAM3 for Zero-Shot Crack Segmentation Figure 1
2026-07-15cs.CV

Semantic-Edge Response Decoding of SAM3 for Zero-Shot Crack Segmentation

Shipeng Liu, Zhanping Song, Liang Zhao, Dengfeng Chen

Xi’an University of Architecture and Technology

2026-07-15视觉感知

论文针对裂缝细长、断续、低对比导致 SAM3 最终掩码易截断或膨胀的问题,提出 SERD:不微调模型,而是直接解码 SAM3 解码器中的语言条件语义响应,并用轻量边缘先验校准后统一阈值成图。六个公开数据集上平均 Crack IoU 达 61.14%,比原生 SAM3 高 4.63 个百分点,主要增益来自内部响应解码。

GeoSEAN: Explainable Country-Level Image Geolocation for ASEAN Regions Figure 1
2026-07-15cs.CV

GeoSEAN: Explainable Country-Level Image Geolocation for ASEAN Regions

Muhamad Syukron, Danish Rafie Ekaputra, Tintrim Dwi Ary Widhianingsih

2026-07-15视觉感知

针对东盟国家街景、建筑和道路特征相似导致图像国家级定位难解释的问题,GeoSEAN构建了4850张图像数据集,用冻结CLIP特征配合MLP分类,并结合CLIP注意力、YOLO26检测和EBPG分析物体级证据。MLP取得85.91%准确率和F1,且发现高频物体不一定对应最高注意力,提示模型依据与物体出现频率并不等同;但数据规模较小,增益来源可能部分来自数据补充。

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks Figure 1
2026-07-15cs.CV

Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks

Wenhao Zhang, Zhongliang Zhou, John Kang, Sheng Li

University of Virginia, Merck & Co., Inc.

2026-07-15视觉语言视觉感知数据集/基准

本文针对WSI视觉语言模型在零样本VQA中可能被高估的问题,系统审计TCGA衍生训练集与测试集的泄漏。核心洞察是区分患者级与机构级TSS泄漏,并用标准条码追踪重叠。结果显示多个基准病例重叠达92.3%至100%、TSS近乎完全重合,且泄漏信号可由特征线性解码,说明现有成绩可能混入记忆检索而非真实多模态推理。

No Figure
2026-07-15cs.CV

How to Realize Recursively Self-Improving Agents and Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

Chengshuai Yang

NextGen PlatformAI C Corp.

2026-07-15数据集/基准

论文动机是现有 LLM 代理虽能规划、用工具和自我修正,但缺少可部署的递归自改进治理框架,也未保证用户能力同步增长。核心提出以目标、范围、工具、基准和权限约束的专用多代理架构,结合范围路由、快慢双循环、外部治理与 Personal Singularity OS。主要结果是形式化设计、算法、安全不变量和路线图;文中未报告实现或受控实验,实际增益来源不清。

Rough Path Signature-Guided Geometry Augmentation for Few-Shot Industrial Surface Defect Detection Figure 1
2026-07-15cs.CV

Rough Path Signature-Guided Geometry Augmentation for Few-Shot Industrial Surface Defect Detection

Jiaqi Kuang

Oxford Suzhou Centre for Advanced Research, University of Oxford

2026-07-15视觉感知

面向新产线和稀有缺陷中标注极少、边界型瑕疵难被标准检测器学到的问题,论文把 Canny 轮廓视为有序路径,用二阶 rough path signature 尤其 Lévy 面积构造几何响应图,并通过 SIG-AUG/SGAA 生成不改标签的训练视图。在固定 YOLOv8n 下,NEU-DET 10-shot mAP@0.5 从 0.341 提至 0.583,PCB-Defect 10-shot 从 0.086 提至 0.299,但随样本增多增益缩小。

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report Figure 1
2026-07-15cs.CV

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

Institute of Mathematics of the Romanian Academy, Bucharest, Romania, National University of Science and Technology Politehnica Bucharest, Romania, Büchi Labortechnik AG, Flawil, Switzerland

2026-07-15视觉感知

这篇技术报告针对现有神经视频生成和仿真平台在物体恒常性、多演员协同与时序一致性上的不足,提出以可检查的 GEST 事件时空图驱动商业游戏引擎生成视频。核心创新是把自然语言或程序生成的事件图,经验证、实体绑定、时序约束求解和统一采集,转成帧级对齐的 RGB、深度、分割、姿态、空间关系和文本标注。主要结果是形成可规模化生产多模态合成视频数据的系统,但真实下游训练增益需依赖伴随评测,文中未充分说明。

Beyond Perfect Priors: Adaptive Gaussian Graph for 4D Driving Reconstruction in the Wild Figure 1
2026-07-15cs.CV

Beyond Perfect Priors: Adaptive Gaussian Graph for 4D Driving Reconstruction in the Wild

Xiaoyun Dong, Qian Xu, Yun Wang, Yang Lu, Jen-Ming Wu, Jianping Wang

2026-07-15三维

本文针对野外驾驶视频缺少精确位姿、激光深度和人工标注时,传统高斯场景图易把相机误差、动态体运动和拓扑缺失混在一起的问题,提出自校正的 Adaptive Gaussian Graph。核心是用2D基础模型语义特征分离静动态区域,并通过 Tick-Tock 优化解耦相机/背景与动态体,同时按梯度和语义异常动态生成、重分配、剪枝节点。在 KITTI 噪声先验和新建 Wild-30 上,AGG 在重建质量和鲁棒性上优于多种基线,尤其减少动态物体鬼影和缺失。

Uncertainty-Aware Multi-Source Retinal Fluid Segmentation in OCT Figure 1
2026-07-15eess.IV

Uncertainty-Aware Multi-Source Retinal Fluid Segmentation in OCT

Animesh Kumar

2026-07-15视觉感知安全鲁棒

这篇论文针对OCT视网膜积液分割在人工标注慢、跨扫描仪泛化差且缺少可靠性提示的问题,提出带注意力的TransUNet,结合源自适应BatchNorm和MC Dropout/模型集成不确定性,并用UCUS把像素级不确定性转成临床分诊信号。模型在四个来源上验证Dice约0.784,平均fluid Dice约0.78,且不确定性在专家分歧区域显著升高1.34倍;但AROI域Dice仅0.166,说明跨设备鲁棒性仍未充分解决。

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration Figure 1
2026-07-15cs.CV

RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration

Jiahao Luo, Hao Zhang, Jianqi Chen, Yijie He, Jiaxu Zou, Michael Vasilkovsky, Sergei Korolev, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, James Davis, Jian Wang

2026-07-15机器人

面向 AR、社交和游戏中的非人形头部角色,论文关注如何低成本生成可控、可重定向的语义 blendshape。RegHead 的核心是用约 2 万身份数据、固定表情词表和密集随机锚点表示,把无对应关系的表情网格通过前馈注册转成一致基底,避免逐实例优化和人脸模板假设。实验显示其表情保真度优于基线,速度较优化方法高数个数量级,并支持从人脸跟踪到非人形角色的实时重定向。

Compos3D: Interactive Part-Based Composition for Creative Control in Generative 3D Models Figure 1
2026-07-15cs.HC

Compos3D: Interactive Part-Based Composition for Creative Control in Generative 3D Models

Faraz Faruqi, Sean J. Liu, George Fitzmaurice, Justin Matejka

2026-07-15生成模型规划控制三维

针对现有 3D 生成工具主要依赖反复重生成、难以保留局部意图的问题,Compos3D 将生成过程拆成候选生成与部件重混两步,允许用户用 2D 区域或 3D 网格片段选取、摆放并合成新模型。8 名新手用户研究显示,相比局部编辑式重生成,重混带来更强创作控制、意图匹配和满意度,但需要略高操作与认知 effort。

Overview of Cross-Component In-loop Filters in Video Coding Standards Figure 1
2026-07-15cs.CV

Overview of Cross-Component In-loop Filters in Video Coding Standards

Zhaoyu Li, Xuewei Meng, Jiaqi Zhang, Cheng Huang, Chuanmin Jia, Siwei Ma, Yun Jiang

2026-07-15视觉感知

面向视频编码中块效应、振铃及色度失真难以由单分量环路滤波充分抑制的问题,本文梳理利用亮度-色度相关性的跨分量环路滤波,重点比较 CCALF 与 CCSAO 在 VVC、AVS3 和 ECM 中的设计演进。结果显示两类方法可提升 Cb/Cr 编码效率,但在 ECM 中 CCALF 增益较 VTM 明显下降,可能受已有跨分量预测工具影响。

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning Figure 1
2026-07-15cs.AI

The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning

Shelley Cazares

2026-07-15视觉感知

面对卫星与航拍数据规模快速增长、灾害评估等任务难以及时标注的问题,论文将地理空间基础模型概括为“预训练由大模型提供方完成、下游由领域专家适配”的范式。核心洞察是区分自监督视觉GeoFM与对比式视觉语言GeoFM,并给出零样本、少样本、头部微调和全量微调的成本-性能选择框架;主要结果偏综述与框架化,缺少新的实证基准,实际增益来源可能主要来自scaling / data。

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy Figure 1
2026-07-15cs.CV

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

2026-07-15视觉语言视觉感知

本文面向数字行为干预中“口头答应但实际犹豫”的视频识别问题,提出冻结人脸、语音、文本和姿态表征后再融合的校准多模态集成,核心洞察是小数据下避免端到端微调并用姿态提供互补信息。系统在BAH公开测试集达到0.7358 macro-F1,首个私有测试提交为0.7361,显示阈值冻结和无泄漏流程在新参与者上基本可迁移。

From Reconstruction to Interpretation: Zero-Setup Multi-Phase Segmentation of X-ray Tomography Data Figure 1
2026-07-15cs.CV

From Reconstruction to Interpretation: Zero-Setup Multi-Phase Segmentation of X-ray Tomography Data

Pradyumna Elavarthi, Arun J. Bhattacharjee, Harrison Lisabeth, Anca Ralescu, Petrus H. Zwart, Dilworth Parkinson, Elizabeth G. Clark

Department of Computer Science, University of Cincinnati., Energy Geosciences Division, Lawrence Berkeley National Laboratory., Advanced Light Source, Lawrence Berkeley National Laboratory., Center for Advanced Mathematics in Energy Research Applications, Lawrence Berkeley, National Laboratory., enables near real-time beamline feedback and provides a practical foundation for scalable, contrast in samples compared to lab-based tomography techniques. Environmental cells can be

2026-07-15视觉感知三维

针对同步辐射X射线断层扫描重建虽快、分割仍依赖人工阈值或重训而拖慢实验反馈的问题,论文提出零设置多相分割框架,用材料无关的结构掩码定义结合预训练ConvNeXt-UNet,在新数据上直接生成可解释掩码。结果显示其在岩芯微CT测试中达到0.995准确率、0.992宏F1,并优于强度阈值法,可用于近实时束线诊断;但矿物相解释仍需额外表征验证。

Self-Consistent Flow: Unifying Velocity and Endpoint Prediction for Rectified Flow Models Figure 1
2026-07-15cs.CV

Self-Consistent Flow: Unifying Velocity and Endpoint Prediction for Rectified Flow Models

Xu Han, Jiajing Hu, Li-Ping Liu

Department of Computer Science, Tufts University

2026-07-15生成模型

本文针对整流流模型中速度预测与终点预测虽理论等价但训练和采样表现不同的问题,分析学习误差带来的差异:终点预测信号更稳定,速度预测在数据流形附近采样更稳。作者提出 SC-Flow,用同一网络同时预测速度和终点,并以一致性损失约束二者关系;在 CIFAR-10 和 ImageNet 256×256 上相较标准 RF 改善 FID、路径直线性和优化稳定性,但更高分辨率与其他模态仍未充分验证。

Data Safety: Synthetic Data Quality Analysis Using CIFAKE Dataset Figure 1
2026-07-15cs.CV

Data Safety: Synthetic Data Quality Analysis Using CIFAKE Dataset

Kuniko Paxton, Amila Akagić, Koorosh Aslansefat, Dhavalkumar Thakker, Yiannis Papadopoulos

School of Digital and Physical Science, University of Hull, Cottingham Road, Hull, HU6 7RX, United Kingdom, Faculty of Electrical Engineering, University of Sarajevo, Zmaja od Bosne bb, Sarajevo, 71000, Bosnia and Herzegovina

2026-07-15数据集/基准安全鲁棒

论文关注合成图像用于训练时可能带来的数据偏移与安全风险,区别于以往CIFAKE真伪检测工作,转向预评估合成数据能否作为训练资源。其核心洞察是结合DINO特征距离、亮度熵等低层统计和训练层行为,可量化合成/真实分布差异并预测性能退化;实验显示合成数据微调中每类混入约30%真实图像可接近纯真实训练表现,而10%不足以消除偏差。

GaitSpan: Growing Humanoid Locomotion from Walking to Running Figure 1
2026-07-15cs.RO

GaitSpan: Growing Humanoid Locomotion from Walking to Running

Kwan-Yee Lin, Zilin Wang, Janelle J. Liu, Stella X.Yu

University of Michigan, Skyline High School, University of Michigan, UC Berkeley

2026-07-15机器人

本文针对人形机器人常需为走、慢跑、跑步分别训练或切换策略的问题,提出把已学会的行走策略当作“种子技能”扩展:通过多时钟节律生成、基于 SLIP 启发的步幅塑形和残差适应,把同一命令条件策略推向连续速度范围。实验称其可跨五种形态覆盖走到跑,并在未见仿真与真实地形上零样本部署,相比多专家和人体模仿基线学习更快、步态表现更强。

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning Figure 1
2026-07-15cs.LG

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu

2026-07-15视觉感知

这篇论文针对联邦环境下多模态大模型连续微调时的灾难性遗忘问题,动机在于隐私敏感、数据持续变化的场景中不能集中存储原始数据。核心创新是 FedCMM:按视觉、语言和跨模态模块分别做弹性正则保护,用本地生成的嵌入级合成回放替代原始样本,并在服务器端按梯度相似度重加权客户端更新。文中称在两个基准上优于近期基线,提升体现在准确率和后向迁移,但具体增益来源仍需结合消融细节判断。

ACZ-GSeg: Adaptive Concentric Zone-based Two-stage Ground Segmentation for LiDAR Point Clouds Figure 1
2026-07-15cs.CV

ACZ-GSeg: Adaptive Concentric Zone-based Two-stage Ground Segmentation for LiDAR Point Clouds

Ge Zhang Chunyang Wang Bin Liu

School of Optoelectronic Engineering, Xi'an University of, Xi'an University of Technology, Xi'an Key Laboratory of, labor-intensive annotation processes. Second, when there are, acquired using a laboratory RUBY PLUS LiDAR. Experimental

2026-07-15视觉感知三维

这篇论文针对车载/移动机器人 LiDAR 地面分割中远距离点云稀疏、地面起伏和路缘等非地面结构干扰导致的欠分割与误分割问题,提出自适应同心分区的两阶段非学习方法:按距离分布动态划分环区与扇区,再用加权 PCA 粗分割和反射强度、局部高度稳定性细化结果。在 SemanticKITTI 上取得 99.12% Precision、96.24% Recall、97.66% F1,自采 RUBY-PLUS 数据上 F1 为 99.36%,但跨场景泛化与实时开销仍需更多说明。

Causal Supervision of Attention for Affective Behaviour Analysis Figure 1
2026-07-15cs.CV

Causal Supervision of Attention for Affective Behaviour Analysis

Nemanja Rašajski, Konstantinos Makantasis, Antonios Liapis, Georgios N. Yannakakis

2026-07-15视觉感知

面向野外情感行为分析中身份、姿态和光照等虚假相关导致跨主体泛化差的问题,论文在多任务面部情感框架中用因果监督约束注意力关注稳定有效区域,并加入K-V去相关正则与SwiGLU值投影提升表征。s-Aff-Wild2实验显示相对标准注意力池化有稳定增益,官方验证集总分达1.2214。

NEEDL-Bench: Dataset for Swiss Needle Cast and Stomata Detection in Microscopy Images Figure 1
2026-07-15cs.CV

NEEDL-Bench: Dataset for Swiss Needle Cast and Stomata Detection in Microscopy Images

Benjamin Blake, Declan McIntosh, Jürgen Ehlting, Nicolas Feau, Joey B. Tanney, Alexandra Branzan Albu

2026-07-15视觉感知数据集/基准

针对瑞士针叶病严重度仍依赖人工显微计数、难以支撑大规模林木抗病表型评估的问题,NEEDL-Bench提供3250张道格拉斯冷杉针叶显微图,覆盖气孔与病原假子囊壳的关键点和框标注,并设置随机与结构多样性两类评测划分。基线检测最高F1为0.8479,且大模型未带来相称提升,说明瓶颈更可能在低对比、小目标、模糊和遮挡下的领域归纳偏置,而非单纯scaling。

Calibrated Selective Prediction Using Deep Ensembles for ROI-Based Thyroid Nodule Ultrasound Classification Under Dataset Shift: A Retrospective Evaluation Figure 1
2026-07-15eess.IV

Calibrated Selective Prediction Using Deep Ensembles for ROI-Based Thyroid Nodule Ultrasound Classification Under Dataset Shift: A Retrospective Evaluation

Md. Sadibul Hasan Sadib, Md. Mohayminul Mukit, Rahmatul Kabir Rasel Sarker, Tahmid Alam Tamim, Md. Monir Hossain Shimul

Department of Computer Science and Engineering, Daffodil International University, Dhaka, Department of Public Health, Daffodil International University, Dhaka, Bangladesh., Faculty of Health, Education and Life Sciences, Birmingham City University, Birmingham, United, Lecturer, Department of Computer Science and Engineering, Daffodil International University, Savar, Dhaka, Bangladesh.

2026-07-15数据集/基准

针对甲状腺结节超声模型在临床分诊中易过度自信、且跨数据集失准的问题,论文用五成员 ConvNeXt 深度集成、向量校准和互信息拒判构建三层 No-FNA/FNA/放射科复核策略。TN5000 内部 AUC 0.9395、ECE 0.0088,但迁移到 TN3K 后 AUC 降至 0.7870、ECE 升至 0.1899,83.7% 病例需复核,说明选择性预测有助于保守分流,但阈值可迁移性有限,不能直接支持临床部署。

Enabling 24-hour Agricultural Robotics: Unsupervised Day-to-Night Cross-Modal Image Translation for Nighttime Visual Navigation Figure 1
2026-07-15cs.RO

Enabling 24-hour Agricultural Robotics: Unsupervised Day-to-Night Cross-Modal Image Translation for Nighttime Visual Navigation

Robel Mamo, Rajitha de Silva, Grzegorz Cielniak, Taeyeong Choi

LaSER Lab, Kennesaw State University, Marietta, GA 30060, USA., Lincoln Institute for Agri-Food Technology, University of Lincoln, Lincoln LN2 2LG, UK.

2026-07-15机器人视觉感知

针对农业机器人夜间导航缺少标注数据的问题,本文将白天作物行 RGB 图像无监督翻译为夜间近红外图像,并用 CLIP 约束语义一致性、可见性掩码模拟 NIR 照明范围,从而复用白天标签训练夜间分割模型。作者在新建 AgriNight 数据集和真实夜间机器人实验中验证,较现有翻译基线带来更好的图像质量与下游分割/导航表现。

Learning from Complementary Ultrasound Representations for Liver Disease Classification Figure 1
2026-07-15cs.CV

Learning from Complementary Ultrasound Representations for Liver Disease Classification

Sabahattin Mert Daloglu, Gokce Bekar, Ceren Coskun, Senanur Sahin, Harvey Castro, Soner Hacihaliloglu, Halley P. Letter, Ilker Hacihaliloglu

2026-07-15视觉感知

该文针对常规B超难以捕捉NAFLD与NASH细微组织差异的问题,将同一次采集生成的B-mode、物理引导衰减补偿QiUS和局部相位增强EnUS作为互补表征,并用MAE与GCN分类。多中心125例、2547张超声上,相比仅用B-mode,准确率最高由0.635升至0.841,F1由0.444升至0.849,且在人群与站点子组中均有提升;但患者规模较小,泛化仍需更大外部验证。

Analyzing Image Encoder Choices and Graph Homophily in GCN Frameworks for Breast Ultrasound Classification Figure 1
2026-07-15eess.IV

Analyzing Image Encoder Choices and Graph Homophily in GCN Frameworks for Breast Ultrasound Classification

Sabahattin Mert Daloglu, Ceren Coskun, Harvey Castro, Soner Hacihaliloglu, Ilker Hacihaliloglu

2026-07-15视觉感知

针对乳腺超声中噪声强、良恶性边界弱导致GCN相似图质量不稳的问题,论文在统一单层GCN框架下比较CNN、ResNet与自监督ViT编码器,核心洞察是编码器会显著改变图同质性并影响消息传递效果。三折患者级验证显示,高容量编码器整体提升准确率、AUC等指标,其中DINO ViT-S/8最佳,且测试图同质性与准确率呈较强线性相关,但增益可能部分来自模型scaling。

Representation and Reference Selection in Training-Free Synthetic Image Attribution Figure 1
2026-07-15cs.CV

Representation and Reference Selection in Training-Free Synthetic Image Attribution

Meiling Li, Pietro Bongini, Benedetta Tondi, Mauro Barni

∗ College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China, † Department of Information Engineering and Mathematics, University of Siena, Siena, Italy

2026-07-15视觉感知

这篇论文关注无需训练的合成图像来源归因:新生成器不断出现时,重训分类器成本高,改用少量源参考图更可扩展。核心洞察是归因效果由特征层级与参考选择共同决定;在 CLIP、DINOv2 中,中间层比最终语义嵌入更保留来源线索。实验显示语义对齐参考能降低查询-参考错配,少参考时重合成更有用,中等参考池下语义检索的精度-成本更优。

An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering Figure 1
2026-07-15cs.CV

An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering

Mai A. Shaaban, Tausifa Jan Saleem, Alaa Mohamed, Dilnaz Utemissova, Ufaq Khan, Mohammad Yaqub

2026-07-15视觉感知

本文针对医疗VQA系统在真实临床中任务持续到来、目标和监督形式不一致时易遗忘的问题,系统评估多种持续学习方法在分类、多标签、检测、计数和报告生成间顺序训练的表现,并把遗忘与LoRA权重漂移、任务顺序联系起来。结果显示现有方法只能缓解不能消除遗忘,EWC相对最稳,报告生成会显著扰动短答案格式,检测任务整体表现仍弱。

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning Figure 1
2026-07-15cs.CV

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

2026-07-15视觉感知

本文针对视觉生成代理每次任务都从零推理、难以积累经验的“永久新手”问题,提出 SymbOmni:用可优化的 Symbolic Concept Box 将成功操作抽象为可复用的符号工作流指令,并通过归纳-转导循环与语言反馈更新记忆,无需梯度微调。实验称其在迭代创作中优于现有代理和部分闭源模型,token 消耗降低 40% 以上,并在在线学习基准上持续增益;但具体增益中符号记忆、验证器与底层生成模型各自贡献仍需更多消融支撑。

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors Figure 1
2026-07-15cs.CV

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

2026-07-15视觉感知

MetaView针对单图新视角合成中“显式重建一致但泛化差、纯隐式生成灵活但尺度漂移和相机控制弱”的矛盾,提出在扩散式MM-DiT中引入前馈几何网络的隐式几何先验,并用度量深度将RoPE相机编码锚定到真实尺度,以在不做显式3D重建的情况下提升结构一致性和可控性。实验覆盖DL3DV、RealEstate10K等数据集,并引入DMD评估空间对齐,结果显示其在大视角变化和跨域场景下优于多类重建式与隐式基线。

Anatomy-Privileged Distillation with Token Routing for MRI-Based Prediction of Perineural Invasion Figure 1
2026-07-15cs.CV

Anatomy-Privileged Distillation with Token Routing for MRI-Based Prediction of Perineural Invasion

Hyunsu Go, Youngung Han, Kyeonghun Kim, Junga Kim, Dohyun Kweon, Jinyong Jun, Sungha Park, Anna Jung, Induk Um, Yului Jeong, Suah Park, Jina Jeong, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

2026-07-15视觉感知

本文针对肝内胆管癌神经周围侵犯术前只能依赖影像、而人工标注和增强信息难以部署的问题,提出训练时用肿瘤/肝脏掩膜指导教师模型、推理时仅用T2 MRI的解剖特权蒸馏框架,并用共享路由分数同时做token筛选和加权聚合。在155例单中心数据上,M=64学生模型AUROC达0.750,高于匹配MRI基线,且仅1.43 GFLOPs、Jetson上8.02 ms;但外部验证缺失,泛化仍未充分说明。

SpikeDS: Dual Sparsity Spikformer for Perineural Invasion Prediction in 3D MRI Figure 1
2026-07-15cs.CV

SpikeDS: Dual Sparsity Spikformer for Perineural Invasion Prediction in 3D MRI

Induk Um, Youngung Han, Kyeonghun Kim, Yului Jeong, Jina Jeong, Hyunsu Go, Dohyun Kweon, Sungha Park, Junga Kim, Anna Jung, Suah Park, Hyuk-Jae Lee, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Nam-Joon Kim

2026-07-15三维

这篇论文针对胆管癌PNI在3D MRI中信号细微、空间稀疏且体数据计算代价高的问题,提出SpikeDS,将脉冲网络的激活稀疏与基于发放率的窗口剪枝结合,并用跨窗口注意力保留全局上下文。在139例CCA患者5折验证中,模型以14.4 mJ达到AUC 0.753,同时优于基线的性能和能效。

Contrastive Joint-Embedding Prediction for Representation Learning in Structural MRI Figure 1
2026-07-15cs.CV

Contrastive Joint-Embedding Prediction for Representation Learning in Structural MRI

Fabian Mager, Lars Kai Hansen

Department of Applied Mathematics and Computer Science, Technical University of Denmark

2026-07-15视觉感知

这篇论文针对3D结构MRI标注稀缺、体数据训练成本高且单一自监督目标难兼顾分割与识别的问题,提出COJEPA,将JEPA的局部遮挡表征预测与对比学习的全局个体区分能力结合,并扩展到3D MRI。结果显示其在同卵双生子零样本检索R@1达0.84、OpenBHB年龄微调MAE为2.55年,BraTS肿瘤分割接近对比学习基线,说明联合目标能同时保留局部结构和全局判别信息。

Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity Figure 1
2026-07-15cs.CV

Anomalous Frame Detection Using VLM-Based Description Comparison for Extracting Expert-Specific Actions and Contextual Decision-Making Scenes with Intra-Video Self-Similarity

Ryo Sakai, Kaname Yokoyama

Robotics Research Department, Research and Development Group, Hitachi, Ltd., Ibaraki, Japan, he is currently with Graduate school of Engineering, Toyota Technological, Institute.

2026-07-15视觉语言视觉感知

面向铁路、电力等维护场景中专家隐性经验难以传承的问题,论文将手册作业视频与专家视频做异常帧检测:用 VLM 生成逐帧描述,跨视频相似度提取专家特有动作,并借助视频内自相似把稳定片段作为单位识别目标、地点等情境决策差异。在 27 个配电盘维护模拟任务中,动作候选提取率为 65%,决策场景为 61%,相较基线的 59% 和 33% 尤其提升了决策场景发现能力。

GenDiff: A Dose and Anatomy Aware Diffusion Model with Structural Prior Refinement for Low-Dose CT Reconstruction and Generalization Figure 1
2026-07-15cs.CV

GenDiff: A Dose and Anatomy Aware Diffusion Model with Structural Prior Refinement for Low-Dose CT Reconstruction and Generalization

Md Imam Ahasan, Guangchao Yang, A F M Abdun Noor, Kah Ong Michael Goh, S. M. Hasan Mahmud, Md Mahfuzur Rahman

Faculty of Information Science & Technology, Multimedia University, Malaysia

2026-07-15生成模型学习理论三维

低剂量 CT 降低辐射但会引入噪声和结构伪影,且既有模型常绑定特定剂量或解剖部位。GenDiff 将剂量-解剖条件编码、冷扩散迭代、物理一致性更新和结构先验细化结合,用单一模型适配多剂量多部位重建。实验显示其在未见超低剂量、体模和动物数据上仍保持较好泛化,PSNR 最高提升 2.1 dB、SSIM 最高提升 0.035;但部分低剂量数据来自模拟,真实扫描泛化仍需更多验证。

TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction Figure 1
2026-07-15cs.CV

TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction

Md Mustafizur Rahman, Guangchao Yang, A F M Abdun Noor, Md Imam Ahasan, Md Mahfuzur Rahman, Md Ariful Islam

2026-07-15视觉语言规划控制

面向拥挤场景中行人意图多模态、历史时刻重要性不同和社交交互不对称的问题,TSCA-Net在MCK-Net式预测-细化框架上加入时间-空间团注意力、跨行人团势能和按目标熵调节的KAN-LSTM解码器。其在ETH/UCY与SDD上报告ADE/FDE为0.13/0.20米和6.95/10.43像素,ADE较MCK-Net分别提升13.3%和5.96%,消融显示三模块均有贡献。

Do You Remember? Toward Memory-Centric Multimodal AI Figure 1
2026-07-15cs.NE

Do You Remember? Toward Memory-Centric Multimodal AI

Xuguang Yu, Weigang Zheng, Minyue Yu

expert dermatological analyses and 99,000 unlabeled facial images, we find that the, architectural center—systematically fails under backpropagation. Through four

2026-07-15视觉语言

本文针对多模态模型“能理解图像却不能回忆所见”的缺口,尝试把记忆作为架构中心:用VQ-VAE压缩视觉、LLM推理,再用扩散解码检验隐藏状态可否重建。核心发现是LLM视觉隐藏状态几乎不含可恢复视觉信息,反向传播训练共享记忆又受梯度抵消限制;改用局部EMA更新后,64槽记忆接近VQ上界,1024槽在LPIPS/SSIM上超过VQ基线。

2026-07-14

223 篇
Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation Figure 1
2026-07-14cs.CV

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

The University of Hong Kong, 2 ByteDance Seed, 3 Peking University

2026-07-14视觉感知强化学习

针对文本到图像强化学习中奖励模型依赖偏好标注、打分噪声大或问题分解复杂的问题,论文提出 SpectraReward:用冻结 MLLM 在图像条件下回读原提示的 token 似然作为奖励,并在统一多模态模型中用自身理解分支形成 Self-SpectraReward。实验覆盖多种生成器、RL 算法和 MLLM 骨干,在多个 OOD 基准上稳定提升,且自奖励可超过更大外部模型,显示奖励与策略对齐比单纯 scaling 更关键。

Latent-Identity Tuning in Text-to-Image Personalization Models Figure 1
2026-07-14cs.CV

Latent-Identity Tuning in Text-to-Image Personalization Models

Daniel Garibi, Ronen Kamenetsky, Hadar Averbuch-Elor, Daniel Cohen-Or, Or Patashnik

Tel Aviv University, Cornell University

2026-07-14视觉感知

这篇论文针对文本到图像个性化模型中“能复现身份但难以精细修改身份”的问题,提出在冻结的个性化编码器中直接调节身份 latent tokens,而不是编辑单张图像或重新训练模型。核心洞察是这些 token 具有可解释的空间/语义分工,可定位到眼、鼻、唇等面部区域,并在子空间中提取连续编辑方向。实验显示该方法能实现胡须、雀斑、眼睛开合、眉毛迁移等局部身份调整,同时在不同提示词生成中保持修改后身份的一致性。

Evidence-Backed Video Question Answering Figure 1
2026-07-14cs.CV

Evidence-Backed Video Question Answering

Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles

2026-07-14视觉感知

这篇论文针对视频问答模型只给文本答案、缺少可验证视觉依据的问题,提出 E-VQA:答案必须同时包含语义回答、相关时间片段和像素级跟踪 masklet。作者构建 ST-Evidence 基准和 16 万规模指令数据,发现现有模型问答准确率与真实时空 grounding 明显脱钩;用该数据微调 UniPixel 后,时间定位和分割指标较同规模基线显著提升。

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding Figure 1
2026-07-14cs.CV

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu

Zhejiang University

2026-07-14视觉感知

针对体育视频中遮挡、快速运动和判罚证据分散导致单视角模型容易误判的问题,论文提出多视角评测集 SportMV-Bench,并指出现有 MLLM 的主要瓶颈在细粒度视觉感知和视角选择,而非规则知识或逻辑推理。其 SportMV-Agent 通过主动选取视角、调用感知工具并基于证据迭代推理,相比最强 GPT-4.1 基线取得 14.46% 相对提升。

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments Figure 1
2026-07-14cs.CV

LoRA-Based Cascaded Multimodal Fusion for Action Recognition in Medical Training Environments

Divya Mereddy, Jeevan Beedareddy

Vanderbilt University, geneous modalities, supporting scalable adaptation across datasets, cant $exibility and scalability. For example, our approach allows for, chitectures available, their open source is code is not available, we

2026-07-14视觉语言视觉感知

医疗培训场景中的动作识别需要融合骨架、RGB、音频或文本等异构模态,但常规模型在新增模态时计算开销大且需重训。本文将LoRA适配器嵌入级联融合流程,按相关性逐步加入模态,保留已学组件以支持低成本扩展。在NurViD和Nurse Training上,结果显示其优于单模态模型,并接近既有数据集专用基线,但实验仍属初步,具体增益来源不清。

HASTE: A Platform for Rapid Post-Disaster Building Damage Assessment Figure 1
2026-07-14cs.CV

HASTE: A Platform for Rapid Post-Disaster Building Damage Assessment

Caleb Robinson, Anthony Ortiz, Simone Fobi Nsutezo, Cameron Birge, Meygha Machado, Marcelo Duarte, Joaquin Rivero Rodriguez, Anthony Cintron Roman, Kevin White, Inbal Becker-Reshef, Juan M. Lavista Ferres

Microsoft AI for Good Research Lab

2026-07-14视觉感知

HASTE面向灾后最初数小时缺少配准前后影像和同类训练数据的问题,提供无代码平台,让分析员用少量本地标注从灾后卫星图生成逐建筑损毁图。其核心是两条交互式流程:单场景分割,以及用预训练视觉特征汇聚建筑轮廓后在浏览器训练逻辑回归。xBD初步实验显示,后者仅用约二十分之一标签即可接近全监督ResNet-50基线;系统自2023年起支撑30余次真实响应,但实验仍偏二分类且仅覆盖方法2。

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency Figure 1
2026-07-14cs.CV

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

2026-07-14视觉感知强化学习

Cycle-World针对自回归视频世界模型在长时生成中误差累积、结构幻觉和物理不一致的问题,提出以时间可逆性约束前向生成的思路:训练时加入反向预测循环一致性损失,推理时用冻结反向模型做梯度式潜变量校正。论文称该机制可从理论上限制生成漂移,并在VBench的60秒视频生成中提升整体质量与长期时序一致性。

MicroCharNet: Less is More for License Plate Character Detection Figure 1
2026-07-14cs.CV

MicroCharNet: Less is More for License Plate Character Detection

Huy Che, Dinh-Duy Phan, Duc-Lung Vu

2026-07-14视觉感知

面向车牌识别在边缘相机等受限设备上的实时部署,论文提出专门针对字符检测的超轻量 MicroCharNet,用 C2f 主干、CoordAtt、C3k2 颈部和单层 anchor-free 头替代直接缩小通用 YOLO 的思路。其核心洞察是利用任务中小而密集、空间关系明确的字符结构来压低复杂度;在 UFPR-ALPR 上仅 0.08M 参数、0.096 GFLOPs 即超过多种 YOLO 基线,并在多硬件测试中显示更快推理,但全场景鲁棒性仍文中未充分说明。

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents Figure 1
2026-07-14cs.CV

MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents

Kaixin Ma, Di Feng, Alexander Metz, Jiarui Lu, Eshan Verma, Afshin Dehghan

capability levels. The framework and the benchmark are publicly available at https://github.com/apple/ml-mmtoolsandbox., also curate 50 scenarios to explore interactive UI applications. To make benchmark construction scalable, agents. 2. A scalable scenario generation pipeline. 3. A systematic evaluation of diverse models.

2026-07-14视觉感知

现有工具调用评测多偏文本、单轮或小工具集,难以衡量视觉输入下的真实助理任务。MM-ToolSandBox构建含511个工具、16个领域的有状态多轮多图环境,并用信息流驱动生成与人工验证场景。对12个模型评测显示最强成功率仍低于50%,且强模型过半失败来自图像信息抽取错误,说明瓶颈从规划转向视觉精度与多图记忆。

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description Figure 1
2026-07-14cs.CV

StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description

Seung Hyun Hahm, Minh T. Dinh, SouYoung Jin

2026-07-14视觉语言

长视频音频描述的难点在于跨场景保持人物、事件和因果关系,而现有 VLM 往往只看局部片段。StoryTeller 的核心是免训练地维护身份图和带显著性衰减/强化的叙事记忆,并只让经语义过滤与 VLM 验证、由视频支持的事实进入记忆。实验称其在常规指标、StoryAD-QA 和人工评测中提升叙事连贯性、事实 grounding 与故事理解,但具体增益对外部元数据和基础 VLM 能力的依赖仍需进一步拆解。

Higher-Order Cell Tracking Transformer Figure 1
2026-07-14cs.CV

Higher-Order Cell Tracking Transformer

Jordão Bragantini, Ilan Theodoro, Loïc A. Royer

2026-07-14视觉感知

针对活体显微成像中细胞分裂会混淆节点嵌入、候选图又缺乏同质性而使 GNN 聚合噪声的问题,HOCT 将候选细胞链接作为边 token,用带 3D 几何先验的边间注意力比较链接,并配合 parental softmax 与 ILP 求解。实验显示其在 Cell Tracking Challenge 和细菌分裂基准上达到或超过既有方法,无需深度预训练图像编码器;在人机校正场景中,400 个标注可使跟踪错误下降 59%,优于对比 Transformer 的 LoRA 微调。

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception Figure 1
2026-07-14cs.RO

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Jacob, Chao Liu, Peter Yichen Chen, Yuri Ivanov, Wojciech Matusik

2026-07-14机器人

低成本伺服机械臂中电流到力矩的线性假设易受摩擦、滞后、背隙和热漂移破坏,导致仿真迁移和无传感器力感知不稳。NeuralActuator用多任务Transformer从状态、指令和电机遥测历史预测仿真等效力矩、接触门控外力和电机状态,并通过可微仿真用位姿轨迹监督力矩头。实验覆盖OpenManipulator-X、SO-101和Franka,显示较低轨迹误差、较准外力/载荷估计,并提升行为克隆操作成功率。

GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting Figure 1
2026-07-14cs.CV

GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University Xiamen China

2026-07-14视觉感知

针对伪装目标分割中监督方法依赖像素标注、训练自由点提示又对位置误差敏感的问题,GFR-SAM把流程改为生成、过滤、细化:用SAM3跨图像示例提示产生候选掩码,再以DINOv3区域-全局对比排序并结合框与文本提示修边界。在R2C7K上较现有训练自由方法加权F值提升8.7%,并接近监督SOTA。

SVI360: Spherical Video Interpolation Figure 1
2026-07-14cs.CV

SVI360: Spherical Video Interpolation

Le-Kim Nguyen, Renato Martins, Pascal Vasseur, Cedric Demonceaux

2026-07-14视觉感知

SVI360针对普通视频插帧方法在360度球面视频中受极区畸变、非均匀像素密度和大位移影响而易模糊、重影的问题,提出原始视图与旋转正交视图并行的双分支框架,用跨视图位移等变约束和球面加权Charbonnier损失改进光流与中间帧预测。在FlowScape、Flow360、ODV360和360VFI上均优于现有方法,FlowScape较最强基线PSNR提升0.63 dB。

Illuminant-Adaptive 3D Lookup Tables for Camera Color Correction Figure 1
2026-07-14cs.CV

Illuminant-Adaptive 3D Lookup Tables for Camera Color Correction

Claudio Rota, Luca Cogo, Simone Bianco, Raimondo Schettini

Department of Informatics, Systems and Communication, University of Milano-Bicocca, camera hardware constraints. Code and datasets are available at

2026-07-14三维

这篇论文针对相机 ISP 中传统 CCT 插值 CCM 难以处理非线性传感器响应和复杂 LED 光源的问题,提出以照明色度驱动的自适应 3D LUT:MLP 根据 rg 色度插值 Tucker 分解的基 LUT,在保持硬件开销可控的同时生成校正表。实验覆盖多相机、光源和真实图像,报告 CIE ΔE00 最多降低 20%、角误差最多降低 18%,但具体增益中数据规模贡献占比文中未充分说明。

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space Figure 1
2026-07-14cs.CV

ABot-3DWorld 0: A Universal World Model to Explore Any 3D Space

Mingchao Sun, Luyang Tang, Yu Liu, Xu Yan, Zhan Li, Yunwei Zhang, Fei Yu, Zengye Ge, Yumin Liu, Jiacheng Zhang, Yongchang Zhang, Jiawei Zhang, Zhicheng Liu, Zhongxu Sun, Tianjian Ouyang, Wenzheng Chen, Shixing Yang, Nianfei Fan, Guodong Sun, Huan Li, Zheng Zhou, Yongze Li, Yingliang Peng, Mengmeng Du, Yuan Liu, Haozhe Shi, Chunnuo Gong, Chengzhen Yu, Chunxue Jia, Yang Liu, Shiying Zeng, Junnan Lai, Hang Zhang, Ning Guo, Baoquan Chen, Mu Xu, Hongyu Pan

AMAP CV Lab Alibaba Group, AMAP CV Lab, scalable game-world production, and offers substantially greater application value through product forms that, above challenges within a single, unified pipeline (Fig. 2). Our design centers on a four-stage architecture:

2026-07-14强化学习三维

论文针对从单物体生成扩展到可探索三维场景时的表示低效、视角覆盖不足和几何不一致问题,提出以全景图和点云组成的 SGP 统一承接文本、图像、视频输入,再用轨迹规划、全景视频生成和 3DGS 重建生成世界;3DRL、点云条件和合成对齐数据用于提升跨视角一致性。实验称其在开源方法中达到 SOTA,并在丰富多模态输入下比 Marble 保真度更高,但增益可能主要来自 data 与系统规模。

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis Figure 1
2026-07-14cs.CV

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis

Marina Domínguez, Nélida Mirabet-Herranz, Valery Naranjo

2026-07-14视觉感知生成模型

本文针对条件扩散在超声合成中“形状像但B-mode质感不真”的问题,指出掩膜条件难以约束散斑、组织对比和衰减等采集相关外观。核心方法FSCG不重训生成器,而用冻结OpenUS特征库做局部kNN校正并在采样中按特征能量筛选候选。三组数据上相较标准采样平均FID64降56%、FID192降57%、最近邻特征距离降47%,显示领域特征可用于缩小真实感差距。

Event-RGB Adaptive Tracking for Nighttime Highway Perception Figure 1
2026-07-14cs.CV

Event-RGB Adaptive Tracking for Nighttime Highway Perception

Haidong Wang, Hengxing Cai, Wanlei Li, Xiaogang Xiong, Renxin Zhong

Haidong Wang, Hengxing Cai, and Renxin Zhong are with the School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China., Harbin Institute of Technology, Shenzhen, China.

2026-07-14视觉感知

面向夜间高速缺少照明、车辆高速导致 RGB 跟踪模糊失效的问题,论文提出 JEAT,将事件流与 RGB 检测放入统一数据关联,并用基于 NIS 的自适应 EKF 动态调整两类观测权重;同时构建 CARLA 合成数据集 SEHN。文中称可缓解 RGB 与事件相机的互补失效,但具体量化结果和增益来源未充分说明。

Motion4Motion: Motion Transfer Across Subjects at Inference Figure 1
2026-07-14cs.CV

Motion4Motion: Motion Transfer Across Subjects at Inference

Ling-Hao Chen, Zixin Yin, Duomin Wang, Xianfang Zeng, Gang Yu

Tsinghua University, The Hong Kong University of Science and Technology, Tsinghua University China, The Hong Kong University of Science and Technology China

2026-07-14视觉感知

针对现有视频动作迁移依赖人体骨架、难以扩展到动物等异构主体且缺少跨拓扑标注数据的问题,Motion4Motion放弃骨架先验,直接以稠密像素级运动流表示源视频动态,并通过TransPE在推理阶段注入到目标主体,实现无需训练的跨物种动作迁移。实验显示其在保真度和跨形态应用上优于基线,但具体增益来源仍需结合消融细节判断。

Backbone-Agnostic Perturbation-Induced Uncertainty Learning for End-to-End Real-World Image Dehazing Figure 1
2026-07-14cs.CV

Backbone-Agnostic Perturbation-Induced Uncertainty Learning for End-to-End Real-World Image Dehazing

Bingcai Wei

2026-07-14视觉感知强化学习安全鲁棒

这篇论文针对真实成对去雾中雾密度、光照和深度导致的非确定性,认为单纯学习雾图到清晰图的确定性映射会忽略退化敏感特征。其核心是BPUL:用可学习扰动估计通道与空间不确定性,并结合物理先验反向重建雾图与双空间对比约束;在五个真实基准和多种骨干上均带来稳定提升,推理时仅保留轻量调制模块。

Similarity-Guided Curriculum Fine-Tuning of LLMs for Neural Architecture Synthesis Figure 1
2026-07-14cs.CV

Similarity-Guided Curriculum Fine-Tuning of LLMs for Neural Architecture Synthesis

Anujaya Vijayakumar, Radu Timofte, Dmitry Ignatov

Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany

2026-07-14视觉感知

本文关注 LLM 做神经架构搜索时,参考架构的微调顺序是否会影响可执行模型生成,而非只看架构精度排序。核心做法是用 MinHash 估计代码结构相似度,将样本按相似到异质组织成课程,并逐阶段合并 LoRA。结果显示高相似阶段无修复成功率达 60%,但在最异质设置下课程模型无修复仅 7%,低于基座 47%,加入接口修复后二者均为 53%,说明课程调度与接口修复解决的问题不同;结论受单模型、单种子实验限制。

FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry Figure 1
2026-07-14cs.CV

FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry

Muxin Liu (1 and 2), Xiaoyang Lyu (1), Tianhe Ren (1), Peng Dai (1), Xiaoshan Wu (1), Zhiyue Zhang (1), Jiaqi Zhang (1), Jiehong Lin (1), Shaoshuai Shi (2), Xiaojuan Qi (1) ((1) The University of Hong Kong, (2) Voyager Research, DiDi Chuxing)

2026-07-14视觉感知

这篇论文针对单目相对深度虽泛化强、但难以恢复真实尺度的问题,指出全局尺度校准不足以处理空间变化误差,且相机内参覆盖尤其焦距分布会限制零样本度量泛化。FoundationGeo先用DINOv3和1020万多域样本训练相对几何基座,再以像素级尺度场和射线方向校正场做度量校准,并用Blender补齐焦距分布。七个基准上整体优于较重基线,AbsRel和δ1平均分别提升约5.7%和5.2%。

GB-SVFBP: Gaussian-Based Shift-Variant FBP neural network Figure 1
2026-07-14cs.CV

GB-SVFBP: Gaussian-Based Shift-Variant FBP neural network

Chengze Ye, Linda-Sophie Schneider, Yipeng Sun, Andreas Maier

2026-07-14三维

非圆轨迹锥束 CT 中,传统 FBP 难以适配复杂扫描路径,而可微 shift-variant FBP 又因逐投影学习轨迹相关权重而参数过多。本文用可训练二维高斯混合模型表示滤波中的轨迹相关部分,以结构化先验压缩冗余权重;实验显示参数量减少 99%,单轨迹训练时间约降至四分之一,但重建质量仅小幅下降。

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO Figure 1
2026-07-14cs.CV

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

Xin Zhang, Haochen Wang, Yikang Zhou, Jason Li, Robby T. Tan

2026-07-14视觉感知

这篇论文针对 MLLM 中区域描述与指代表达定位长期分开训练、依赖高质量文本-掩码标注和外部评审器的问题,提出 CycleGRPO:让同一模型先由区域生成描述,再用该描述反定位回原区域,以循环一致性作为强化学习奖励。基于 SAMTok 的离散掩码表示,该方法只需区域输入即可联合提升区域理解与定位;实验显示在 GRES、GroundingSuite、DLC-Bench、GCG 等任务上均有增益,且无需针对这些评测集再微调。

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations Figure 1
2026-07-14cs.LG

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

Department of Electrical and Computer Engineering, Lebanese American University, Byblos, Lebanon, Institute of Applied Artificial Intelligence, TÉLUQ University, Montreal, Canada

2026-07-14生成模型

论文针对临床 EEG 癫痫检测中标注稀缺、发作片段占比极低导致模型偏向多数类的问题,提出 DiffEEG:用去噪扩散在 130 万个 TUHSZ 无标注片段上预训练 1D U-Net 表征,再用强化学习决策层直接优化 F1。严格按患者划分评估中,二分类达 81% 准确率、85% 加权 F1,四类分型为 61% 准确率、59% F1,但真实临床召回仍只有 59%,增益来源与泛化边界仍需更多消融说明。

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI Figure 1
2026-07-14cs.CV

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

Huazhong University of Science and Technology, 2 Kingsoft Office

2026-07-14视觉感知

论文针对自然图像预训练视觉编码器难以处理文档中密集文字、细粒度笔画和复杂版式的问题,提出面向文档的 MonkeyOCRv2,并构建 1.13 亿图、17 语种的 MonkeyDoc v2;核心做法是联合图像到文本生成与像素级重建,使表示同时对齐文本内容并保留字形和布局细节。实验显示其替换原编码器可提升识别、检测、公式、篡改等任务,冻结后接轻量语言模型在 MDPBench、OmniDocBench 等文档解析与理解基准上超过更大模型。

Technical Report on the CVPR 2026@AdvML Workshop Challenge Figure 1
2026-07-14cs.CV

Technical Report on the CVPR 2026@AdvML Workshop Challenge

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

Beihang University, University of Chinese Academy of Sciences, Institute of Computing Technology, Chinese Academy of Sciences, Tongji University, iFLYTEK Co., Ltd., Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta, Wenzhou Business College, Jiangnan University, Guangzhou City University of Technology, Institute of Dataspace, Zhongguancun Laboratory, Tsinghua University

2026-07-14视觉感知

本文关注自动驾驶视觉语言智能体在多视角场景问答中的安全脆弱性,动机是错误感知或规划回答可能影响下游决策。报告以CVPR 2026 AdvML挑战为对象,系统梳理图像扰动与后缀文本攻击规则、黑盒迁移评测和优胜方案,核心洞察是视觉侧、场景级多视角优化、QA类型先验和特征空间目标更有效。结果显示54队参赛、21队进入二阶段,领先方法暴露出嵌入图像文字与结构化视觉干扰仍能稳定误导驾驶VLA。

Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations Figure 1
2026-07-14cs.CV

Single-Teacher View Augmentation: Enhancing Knowledge Distillation with Student-Guided Perturbations

Xuyi Yu, Yaohua Liu, Ziming Song, Yinghai Zhao, Huipeng Zhang, Kuizhi Mei

2026-07-14视觉感知

这篇论文针对单教师知识蒸馏视角固定、监督信号多样性不足的问题,指出现有随机扰动缺少语义约束,而结构化多视角又需要预训练和额外参数。其核心是让学生特征生成扰动,并用无参数循环移位扩展多个虚拟教师视角,在保持教师 logits 为稳定锚点的同时提供动态多样性。实验称在 CIFAR-100 和 ImageNet 上优于随机扰动方法,精度接近两阶段方法且参数和训练成本更低。

Training-Free Off-Screen Player Imputation for Broadcast-Based Spatial Football Analytics Figure 1
2026-07-14cs.CV

Training-Free Off-Screen Player Imputation for Broadcast-Based Spatial Football Analytics

Seongjin Choi

2026-07-14视觉感知

论文针对足球转播视角只能看到部分球员、导致控球空间等指标系统性失真的问题,构建开放的模拟视窗基准,并提出无需训练、在线运行的角色锚定质心投票补全方法。结果显示,忽略屏外球员会带来约25.1–26.9个百分点的隐藏区域控制误差,而该方法可将误差约减半,并在真实世界杯片段中显著改变下游空间创造评分。

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction Figure 1
2026-07-14cs.CV

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction

Youngung Han, Dohyun Kweon, Kyeonghun Kim, Hyunsu Go, Jina Jeong, Suah Park, Induk Um, Junga Kim, Anna Jung, Yului Jeong, Sungha Park, Jinyong Jun, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

2026-07-14生成模型

这篇论文针对胆管癌PNI术前预测中MRI征象细弱、分布超出肿瘤边界且扩散Transformer计算昂贵的问题,将PNI建模为基于去噪误差的扩散分类任务,并在注意力头、空间token和MLP宽度上做自适应路由,辅以局部3D卷积估计肿瘤边界附近token重要性。实验报告AUC为0.731、计算量257.57 GFLOPs,但外部多中心泛化仍文中未充分说明。

Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory Figure 1
2026-07-14cs.CV

Parse, Search, and Confirmation: Training-Free Aerial Vision-and-Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory

Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang

School of Computer Science and Information Engineering, Hefei University of Technology, Jianghuai Advance Technology Center, Anhui Provincial Key Laboratory of Humanoid Robots, School of Artificial Intelligence, Beihang University, University of Macau

2026-07-14机器人视觉感知

这篇论文针对高空无人机视觉-对话导航中,通用多模态大模型方向 grounding 弱、缺少长期空间记忆而容易误搜的问题,提出无需训练的 PSC-AVDN:先解析对话中的方向与目标线索,再用搜索与确认两阶段 CoT 逐步定位,并结合多尺度视图、历史视觉记忆和结构化网格记忆维持空间一致性。实验在 ANDH 与 ANDH-Full 上达到训练免费设定的新 SOTA,并可匹配或超过若干微调方法。

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos Figure 1
2026-07-14cs.CV

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

2026-07-14视觉感知

这篇论文针对第一视角连续视频助手“何时该主动开口”的问题,指出现有系统要么被动问答,要么按事件触发,缺少对用户历史、当前活动和打扰必要性的判断。作者提出Vinci2框架:用EgoServe基准覆盖4类时间记忆跨度、10类主动服务,并用免训练的EgoMemo结合多尺度摘要、知识图谱和视觉检索做介入决策。实验显示EgoMemo在EgoServe上建立强基线,并在5个既有第一视角基准上达到有竞争力或SOTA结果。

CFR-Net:Collaborative Feature Refnement Network for Medical Image Anomaly Detection Figure 1
2026-07-14cs.CV

CFR-Net:Collaborative Feature Refnement Network for Medical Image Anomaly Detection

Zihan Nie, Muhao Xu, Wei Feng, Yuan Cui, Hua Wei, Sijie Niu, Yi Wan, Xunbin Wei, Weiye Song, Zongyuan Ge

2026-07-14视觉感知

针对自然图像预训练特征难以适配医学影像、异常又常表现为细粒度局部变化、多尺度上下文错配和方向敏感结构偏移的问题,CFR-Net在教师-学生框架中加入共享多路径特征精炼,并在解码后做跨空间一致性约束,配合方差敏感损失和动态样本重组稳定仅正常样本训练。实验显示其在多类医学异常检测基准上取得有竞争力的分类表现和较强定位能力,但具体增益幅度与来源仍需看完整实验细节。

HyperGS: Fast and Generalizable Gaussian Video Representation Figure 1
2026-07-14cs.CV

HyperGS: Fast and Generalizable Gaussian Video Representation

Fatimah Zohra, Chen Zhao, Shuming Liu, Yahya Al Malallah, Bernard Ghanem

King Abdullah University of Science and Technology (KAUST), Harbin Institute of Technology, Shenzhen

2026-07-14视觉感知三维

HyperGS针对现有视频高斯表示需要逐视频迭代优化、编码慢且难泛化的问题,改用前馈超网络一次性从视频预测每帧显式2D高斯参数;关键洞察是用因子化时空Transformer和查询式解码器生成可解释基元,并用自适应有效秩正则抑制针状退化。实验显示其在K400、SSv2、UCF101上较既有视频编码器提升约2.9–3.1 dB,且在720p视频上可零样本泛化,编码速度比逐视频优化快4到5个数量级。

LightMem-Ego: Your AI Memory for Everyday Life Figure 1
2026-07-14cs.CL

LightMem-Ego: Your AI Memory for Everyday Life

Yijun Chen, Boyi Xiao, Yixian Zhao, Haoting Xia, Buqiang Xu, Jizhan Fang, Yanya Li, Yaqi Zheng, Xuehai Wang, Zirui Xue, Liuxin Zhang, Hui Li, Ningyu Zhang

Zhejiang University, South China University of Technology, Central China Normal University

2026-07-14视觉感知

面向手机与 AI 眼镜持续记录日常视听流却难以长期检索的问题,LightMem-Ego 将第一视角视觉与音频按时间线对齐,构建当前、短期、长期三级多模态记忆,并用路由器按查询意图选择证据。论文展示其可支持找物、对话回忆、生活总结和习惯发现,并在检索、问答与延迟上对比应用型基线;但具体增益幅度和来源文中未充分说明。

Towards Efficient Convolutional Neural Network for Embedded Hardware via Multi-Dimensional Pruning Figure 1
2026-07-14cs.CV

Towards Efficient Convolutional Neural Network for Embedded Hardware via Multi-Dimensional Pruning

Hao Kong, Di Liu, Xiangzhong Luo, Shuo Huai, Ravi Subramaniam, Christian Makaya, Qian Lin, Weichen Liu

School of Computer Science and Engineering, Nanyang Technological University, Singapore, HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University, Singapore, Department of Computer Science, Norwegian University of Science and Technology, Trondheim, Norway., HP Inc., Palo Alto, California, USA

2026-07-14视觉感知

面向边缘设备部署CNN时,单独剪枝深度、宽度或输入分辨率难以兼顾精度、MACs和真实延迟。TECO的核心是先用维度内重要性筛出各维候选,再用跨维度指标综合准确率损失、复杂度和设备延迟,逐步决定剪掉哪类单元。在ImageNet/ResNet50等实验中,文中报告其相近MACs下比HRank高3.97% top-1,并比GAL快1.91倍且精度高1.12%。

Direct Image-to-Modern Vietnamese Translation of Han-Nom Manuscripts via Multimodal RLHF Preference Alignment Figure 1
2026-07-14cs.CL

Direct Image-to-Modern Vietnamese Translation of Han-Nom Manuscripts via Multimodal RLHF Preference Alignment

Thi Kim Trang Vo, Nghia Hieu Nguyen, Ha Minh Tan

2026-07-14视觉语言视觉感知强化学习

本文面向退化、稀缺标注的汉喃手稿到现代越南语翻译,认为问题不应拆成 OCR 后再翻译,而应联合利用图像、汉喃文本和越南语表示。方法以 CLIP、BERT、PhoBERT 与 T5 融合,并在 SFT 后比较 PPO、DPO、KTO 偏好对齐;结果显示 DPO 在 BLEU、ROUGE、语义相似度、CER/WER 和 token accuracy 上最好,PPO 的精确率、召回率和 F1 更高,但增益中各模态与偏好数据的贡献仍需更细消融说明。

Video Transformer for Remote Identity Document Hologram Detection Figure 1
2026-07-14cs.CV

Video Transformer for Remote Identity Document Hologram Detection

Joris Voerman, Nicolas Sidere, Jean-Christophe Burie

2026-07-14视觉感知

面向手机远程身份核验中传统防伪特征难以检测、证件数据稀缺且算力受限的问题,论文提出RIDVS流程,并用轻量视频Transformer ViTransHolo从用户拍摄视频中检测证件全息图。其关键在于利用时序视觉变化替代专用传感器,在MIDV-Holo上将召回率提升26.86%、准确率提升17.93%,F1达98.41%,私有法国证件集也接近满分,但小数据集结果可能偏乐观。

Uncertainty Quantification for EO Regression Tasks: Building Height, Tree Canopy Height and Above-ground Biomass Estimation Figure 1
2026-07-14cs.CV

Uncertainty Quantification for EO Regression Tasks: Building Height, Tree Canopy Height and Above-ground Biomass Estimation

Ritu Yadav, Andrea Nascetti, Yifang Ban

2026-07-14安全鲁棒

针对建筑高度、树冠高度和地上生物量等遥感回归任务只给单点预测、缺少像素级可靠性的问题,论文用全年 Sentinel-1/2 时序显式建模偶然不确定性,对比高斯均值-方差预测与分位数回归以刻画偏态和异方差误差。结果显示两类方法在精度上达到或超过确定性基线和现有全球产品,并给出较校准的置信估计,但具体增益中数据时序融合与不确定性建模各自贡献仍未充分说明。

Diffusion MRI preprocessing affects ADC estimation and automatic PI-RADS v2.1 classification in bi-parametric prostate MRI Figure 1
2026-07-14eess.IV

Diffusion MRI preprocessing affects ADC estimation and automatic PI-RADS v2.1 classification in bi-parametric prostate MRI

Christos Kanakis, Mathias Perslev, Tim Schakel, Silvia Ingala, Akshay Pai, Dennis Klomp, Chantal M.W. Tax

2026-07-14生成模型

前列腺MRI中DWI伪影会影响ADC定量和PI-RADS自动分级,但预处理流程缺乏共识。本文用fastMRI 268例逐步比较去噪、Gibbs校正和畸变校正,并训练DenseNet分类器;结果显示ADC估计随流程显著变化,LLS与IWLLS几乎等价,完整预处理尤其畸变校正提升高风险类别AUROC、敏感性并减少过度自信的漏诊。

Self-supervised training for high-resolution close-range multispectral remote sensing imagery Figure 1
2026-07-14cs.CV

Self-supervised training for high-resolution close-range multispectral remote sensing imagery

Leon-Friedrich Thomas, Mikael Änäkkälä, Antti Lajunen

University of Helsinki, Department of Agricultural Sciences, P.O. Box 28, Fi-00014 Helsinki, Finland, University of Helsinki, Department of Forest Sciences, P.O. Box 27, Fi-00014 Helsinki, Finland, funded by Helsinki University Library.”, publicly available data, the combined and extended dataset, publicly available WeedMap dataset with ground sampling, available high-resolution multispectral UAV data from, unavailable. By restricting the input to these bands, the, unavailable data from Nordic agricultural regions

2026-07-14视觉感知

针对厘米级多光谱无人机农田影像标注成本高、跨传感器数据有限的问题,本文将 msuav500K 与芬兰多年数据 harmonize 为 msuav500k+N,并用绿、红、红边、近红外四波段进行 MoCo-v3/MAE 自监督预训练。结果显示,MoCo-v3 预训练的 Swin Transformer 在 WeedMap 德国与瑞士作物-杂草分割中低标注比例下优势最明显,并超过既有 msuav500K 预训练模型;但部分增益可能主要来自 scaling / data 与训练设定差异。

Efficient Tuning Before Low-Bit Post-Training Quantization for Stochastic Gradient Descent-optimized Models Figure 1
2026-07-14cs.CV

Efficient Tuning Before Low-Bit Post-Training Quantization for Stochastic Gradient Descent-optimized Models

Peng Xia, Junbiao Pang, Muhammad Ayub Sabir

2026-07-14优化算法

论文针对低比特PTQ在2/4 bit下精度大幅下降的问题,指出瓶颈不只是量化后校准误差,也在于全精度模型本身对量化扰动是否鲁棒。其核心做法是在PTQ前用权重/激活量化噪声和SWA预调SGD模型,使其进入更平坦、量化友好的区域,并仍可接入现有PTQ后端。实验在CIFAR-100、Tiny-ImageNet、ImageNet和Cityscapes上均有提升,W2A4下Tiny-ImageNet提升2.14% Top-1,Cityscapes提升5.80% mIoU。

Benchmarking Edge Inference Strategies for Deep Learning Models in Industrial Machine Vision Figure 1
2026-07-14cs.CV

Benchmarking Edge Inference Strategies for Deep Learning Models in Industrial Machine Vision

Miguel Gomez Fernandez, David Castro Boga, Roi Mendez-Rial, Eric Lopez-Lopez

2026-07-14视觉感知数据集/基准

面向工业机器视觉中低时延、数据安全和弱连接带来的边缘部署需求,论文系统比较 PyTorch、ONNX Runtime、OpenVINO 与 TensorRT 在多种 CPU/GPU 平台、CNN 与视觉 Transformer 上的推理时间。核心洞察是框架收益强依赖硬件与模型结构:CPU 上 OpenVINO 最快,GPU 上 TensorRT 通常最快,但在 Transformer 模型上 TensorRT 并不总优于原生 PyTorch。

Longitudinal Multi-View Breast Cancer Risk Prediction Figure 1
2026-07-14cs.CV

Longitudinal Multi-View Breast Cancer Risk Prediction

Solveig Thrun, Zijun Sun, Suaiba A. Salahuddin, Kristoffer Wickstrøm, Elisabeth Wetzer, Stine Hansen, Robert Jenssen, Michael Kampffmeyer

2026-07-14安全鲁棒

这篇论文针对乳腺筛查中仅用单时点或单视角难以捕捉组织随时间细微变化的问题,提出 LMV-Net:对 CC/MLO 两个视角的当前与既往乳腺 X 线特征做显式配准,并用双流自注意力与交叉注意力融合纵向和跨视角信息。在 EMBED 与 CSAW-CC 上,模型在 C-index、1–5 年 AUC 及高乳腺密度等亚组中超过既有方法,说明收益主要来自显式纵向对齐与多视角联合建模。

The In-Car Sign Language Corpus (ICSL): A Multi-Modal Resource for Constrained-Space Sign Language Recognition Figure 1
2026-07-14cs.CL

The In-Car Sign Language Corpus (ICSL): A Multi-Modal Resource for Constrained-Space Sign Language Recognition

Raviteja Boddu, Guilherme Vieira Leite, Joed Lopes da Silva, Ângelo Benetti, Isabela Barbieri, Natália de Melo Afonso, Thyago Santos, Helio Pedrini, Felipe Venâncio Barbosa, José Mario De Martino, Munir Georges, Alessandro Zimmer

2026-07-14视觉感知

该文针对车内共享出行场景中手语识别缺少真实约束数据的问题,构建巴西手语 ICSL 语料库。核心做法是同时采集实验室高精度 MoCap 基线与车内 2D 相机、3D ToF 多模态数据,用于比较虚拟手语 avatar 与真实译员视频,并覆盖遮挡、非正面视角、座椅和空间受限等因素。主要结果是形成超过 150 万帧、带词汇与非词汇 gloss 标注的数据资源;文中主要贡献是数据集与采集协议,未充分说明具体识别模型增益。

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding Figure 1
2026-07-14cs.CV

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

2026-07-14视觉语言

这篇论文针对文本生成 CAD 中复杂结构难保持、几何参数易混淆的问题,提出 HierCAD 将平铺序列生成改为分层推理:先建模对象级部件与布尔流程,再建模局部环拓扑,并用结构对齐和参数扰动排序来约束参数落地。实验显示其在 CAD 序列生成和重建模型评估上优于既有方法,尤其改善多部件、长序列和多环场景的结构与参数一致性。

SLVMBench: Skill Learning from Video Memory Figure 1
2026-07-14cs.CV

SLVMBench: Skill Learning from Video Memory

Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

Tsinghua University, University of Cambridge

2026-07-14视觉感知

面向机器人/智能体在真实场景中需从较早视频示范中学习操作技能并实时应用的问题,SLVMBench将教程视频嵌入长达1-2小时的无关视频流,再要求模型在目标视频特定时刻回答技能相关问题,覆盖记忆、程序知识抽取与迁移。人工标注强调时间校准和避免常识猜测。实验显示现有闭源与开源视频LLM在从长视频记忆中学习并应用技能上明显不足,且教程与任务间隔越长性能下降越显著。

ASUMOT: Motion-Consistency-Based Asynchronous UAV Detection and Tracking with Event Cameras Figure 1
2026-07-14cs.CV

ASUMOT: Motion-Consistency-Based Asynchronous UAV Detection and Tracking with Event Cameras

Baofeng Jia, Xiaoyu Chen, Jingyuan Zhang, Zongze Wu, Haochen li, Jing Han, Lianfa Bai

2026-07-14视觉感知

面向远距离反无人机感知中事件相机响应稀疏、碎片化、噪声多导致一机多斑点和身份不稳的问题,ASUMOT将无人机建模为一组运动一致的事件斑点,并用局部一致性触发、多任务验证与聚类维护目标级轨迹。实验称其在公共数据和新建ES-UAV上改善精度-效率权衡并具备边缘延迟,但极稀疏或近静止目标仍是未解难点。

Metadata Supervised MRI Representations for Modelling and Controlling Acquisition Variability Figure 1
2026-07-14cs.CV

Metadata Supervised MRI Representations for Modelling and Controlling Acquisition Variability

Mehmet Yigit Avci, Pedro Borges, Virginia Fernandez, Natalia Glazman, Paul Wright, Mehmet Yigitsoy, Sebastien Ourselin, Jorge Cardoso

2026-07-14规划控制

这篇工作针对多中心 MRI 中扫描仪和协议差异导致表征混淆、模型跨域失稳的问题,提出用 DICOM 元数据监督学习,将解剖结构与采集相关对比分离,并用同一框架做检索、质控和可控 harmonisation。实验显示解剖表征降低跨序列组织体积变异,在 ADNI 跨厂商阿尔茨海默分类中较原图更稳,同时支持跨对比、跨站点合成;但证据主要限于成人脑 MRI,病灶与伪影因素仍未充分解耦。

A Unified Framework for Comprehensive Cardiac CT Segmentation and Phenotyping: Human-in-the-Loop Data Annotation, Vision Foundation Model Development, Multicenter Evaluation and Clinical Validation Figure 1
2026-07-14cs.CV

A Unified Framework for Comprehensive Cardiac CT Segmentation and Phenotyping: Human-in-the-Loop Data Annotation, Vision Foundation Model Development, Multicenter Evaluation and Clinical Validation

Pooya Mohammadi Kazaj, Leo Fridolin Weber, Wen Xie, Seyed Amir Ahmad Safavi-Naini, Anselm Stark, Giovanni Baj, Ali Mokhtari, Toshiya Yoshida, Christoph Ryffel, Taishi Okuno, Yoshihiro Akashi, Ronny R. Buechel, Thomas Pilgrim, Waldo Valenzuela, George C. M. Siontis, Xiaowei Xu, Moritz Hundertmark, Stephan Windecker, Christoph Grani, Isaac Shiri

Model Development, Multicenter Evaluation and Clinical Validation, -Department of Cardiology, Inselspital, Bern University Hospital, University of Bern, Bern, -Department of Digital Medicine, University of Bern, Bern, Switzerland, -Graduate School for Cellular and Biomedical Sciences, University of Bern, Bern, Switzerland, -Department of Cardiology, St. Marianna University School of Medicine, 2-16-1, Sugao, -Department of Nuclear Medicine, Cardiac Imaging, University Hospital Zurich, Zurich, - Institute for Diagnostic and Interventional Neuroradiology, Inselspital Bern, Bern, Switzerland, Department of Cardiology, Inselspital, Bern University Hospital, University of Bern, limited not by data availability but by the scalability of measurements, which makes routine use, technique, and a self-supervised foundation model pre-trained on 60,000 unlabeled cardiac CT

2026-07-14视觉感知数据集/基准

这篇论文针对心脏 CT 中多结构定量难以规模化、专家标注成本高的问题,构建人机协同标注、CTAug 增强和 6 万余例无标注 CCT 自监督预训练的统一框架。其关键洞察是性能主要受高质量数据与预训练驱动,架构差异相对有限。结果显示,该方法在 1598 例、14 个结构和五个外部数据集上优于现有开源工具,并可支持群体级心脏表型分析。

SalientGS: Unified SfM-to-3DGS with Importance-Guided MCMC Gaussian Allocation Figure 1
2026-07-14cs.CV

SalientGS: Unified SfM-to-3DGS with Importance-Guided MCMC Gaussian Allocation

Tianyu Xiong, Rui Li, Suning Ge, Jiaqi Yang

School of Computer Science, Northwestern Polytechnical University, CEMSE, King Abdullah University of Science and Technology, School of Computer Science, Northwestern Polytechnical University Xi’an China, CEMSE, King Abdullah University of Science and Technology Thuwal Saudi Arabia

2026-07-14三维

SalientGS针对3DGS依赖昂贵COLMAP预处理、且相机位姿误差难以下游修正的问题,提出从无序图像到3DGS的统一流程。其关键在于用多视角残差估计高斯的欠拟合与冗余程度,引导MCMC出生和迁移,把固定容量转向难重建区域,并结合一阶SfM与重投影BA约束联合优化位姿和外观。论文报告端到端约15分钟重建,在1.5M高斯下取得最佳LPIPS,并相对普通MCMC有PSNR与LPIPS增益。

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer Figure 1
2026-07-14cs.CV

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

2026-07-14视觉感知

面向发型迁移中既要保留源身份又要匹配参考发型的难题,论文指出现有双流流程的失败根源是“泄漏”:参考发型特征夹带身份/姿态,源图生成的秃头图残留几何瑕疵。DPF用对抗式发型净化和对比式几何净化分别抑制两类泄漏,实验声称在身份保持、几何对齐和真实感上达到当前最优。

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models Figure 1
2026-07-14cs.CV

LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models

Gangsu Kim, Won-Ki Jeong

2026-07-14视觉感知

本文针对病理基础模型在全切片图像上计算成本高、传统多教师蒸馏难以处理组织异质性的问题,提出用病理报告中的可视化临床关键词作为语义锚点,经 MedSigLIP 对齐后按语义相关性动态选择教师。实验显示,87M 参数学生模型在 WSI 描述、VQA 和分类任务上可匹配或超过 GigaPath、UNI,并提升事实一致性;但具体增益与数据规模、报告质量的关系仍需进一步拆解。

A Nearable Soft Mat Based on Distributed Optical Fiber Sensing for Physiological Monitoring Figure 1
2026-07-14cs.CV

A Nearable Soft Mat Based on Distributed Optical Fiber Sensing for Physiological Monitoring

Vincenzo Lavorgna, Martina Pulcinelli, Andrea Polimadei, Rosaria D Amato, Carlo Massaroni, Michele Arturo Caponero, Emiliano Schena, Daniela Lo Presti

Biomedical Instrumentation, Department of Engineering, Università Campus Bio, - and Nanostructures Laboratory, ENEA Research Center of Frascati, 00044 Frascati, Italy.

2026-07-14视觉感知

针对现有生理监测界面难以同时获得大面积、柔顺且高空间分辨率的身体接触信息,本文将单模光纤以蛇形嵌入硅胶软垫,利用OFDR分布式光纤感知在椅背近身场景中形成2250个感知点。六名受试者实验显示,该垫能重建背部接触的二维动态响应,并从中估计呼吸率和心率,结果与可穿戴参考设备较一致,但样本规模仍偏探索性。

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On Figure 1
2026-07-14cs.CV

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On

Lu Yang, Xiaonan Hu, Yanan Li, Daqi Liu, Xiang Bai, Hao Lu

Huazhong University of Science and Technology, China, Wuhan Institute of Technology, China

2026-07-14视觉感知

这篇论文针对虚拟试衣中扩散模型推理慢、VAE 潜空间压缩导致服装文字和纹理丢失的问题,提出先用 VAR-VTON 在潜空间完成姿态、版型和人物结构合成,再用 STAR-VTON 的像素空间匹配式 refiner 从原服装图直接恢复细节。实验称 VAR-VTON 较扩散基线快 4 倍以上,refiner 在 VITON-HD 和 DressCode 上提升细节保真,并可插入其他 VTON 模型。

HandFlow: Fully Generative 4D Hand Recovery with Flow Matching Figure 1
2026-07-14cs.CV

HandFlow: Fully Generative 4D Hand Recovery with Flow Matching

Mingxi Xu, Bowen Duan, Yi Gu, Zhengyang Shen, Renjing Xu, Yutao Yue

The Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology (Guangzhou) Guangzhou 511400 China

2026-07-14生成模型

针对单目视频中手部遮挡、运动模糊导致确定性回归易抖动和漂移的问题,HandFlow将4D手重建改写为MANO参数空间的条件生成,用流匹配一次ODE采样整段轨迹,并以双流Transformer建模长时依赖、置信度连续mask处理不可靠观测。在DexYCB和HOT3D上,其世界坐标姿态误差较最强基线降逾30%,加速度误差最低,150帧序列单GPU达47 fps。

A Novel Method to Evaluate Models on Unreliable, Noisy and Inconsistent Labels: Adaptive Resolution Label Aggregation (ARLA) Figure 1
2026-07-14cs.CV

A Novel Method to Evaluate Models on Unreliable, Noisy and Inconsistent Labels: Adaptive Resolution Label Aggregation (ARLA)

Natasha Randall, Gernot Heisenberg

Institute of Information Science, Cologne University of Applied Sciences

2026-07-14强化学习

针对分割模型测试标签常含噪声、不一致或边界歧义而导致评估失真的问题,论文提出 ARLA:在推理评估时按标签精度自适应聚合标签与预测分辨率,无需重训模型。洪水遥感案例显示,该方法能缓解林地区域标注不一致和云遮挡漏标影响,并较边界忽略、软标签基线更能保留真实模型错误与有效标签信号。

Parallax Portrait Matting Figure 1
2026-07-14cs.CV

Parallax Portrait Matting

Xin Cai, Jiawen Chen, Lars Jebe, Tianfan Xue, Zhoutong Zhang

2026-07-14视觉感知

针对复杂纹理背景下单张人像抠图易混淆前景、背景且传统多观测方案依赖专门采集设备的问题,论文提出利用手机连拍中轻微视角变化带来的前景-背景视差。方法区分较可靠的背景对齐与更噪声的前景对齐,前者做像素级融合,后者经交叉注意力补偿误差。实验显示其在困难人像中比强单图基线恢复更细的 alpha 细节和更准确的前景颜色。

DynEval: Holistic Evaluations of T2I Generative Models in the Wild Figure 1
2026-07-14cs.CV

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

2026-07-14生成模型数据集/基准

本文针对T2I模型在开放提示下难以自动评估的问题,指出静态提示集、检测器或外部LLM流程容易漏掉局部错配、组合错误和视觉质量缺陷。DynEval用50万生成样本与25万指令数据蒸馏小型VLM评审器,联合判断文本对齐和图像质量;在11个基准上与人类判断相关性更高,并分析36个模型的细粒度失效模式,但增益可能主要来自数据规模与教师蒸馏。

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders Figure 1
2026-07-14cs.CV

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Alexandre Chapin (LIRIS), Emmanuel Dellandrea (LIRIS), Liming Chen (LIRIS)

2026-07-14视觉感知

面向真实场景的对象中心学习通常在场景分解与高保真生成之间依赖复杂管线、VAE 潜空间和预训练扩散先验。Slot-RAE 的核心思路是直接在冻结视觉基础模型的语义特征空间中做 Slot Attention 分解,并用从零训练的 slot 条件 DiT 与 REPA 目标重建特征,从而绕开 VAE 瓶颈。COCO 实验显示其无监督对象发现达到或优于基线,重建与零样本组合生成更强,推理速度约提升 25 倍。

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents Figure 1
2026-07-14cs.CV

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

2026-07-14视觉语言数据集/基准

这篇论文针对现实职业场景中 PDF 问答难以由现有 OCR、表格或文档 VQA 单项基准反映的问题,提出 GDP.pdf:由十个领域从业者编写任务、保留能击败至少两个前沿模型的样本,并用原子化 rubric 与能力标签评测证据 grounding。100 题实验显示七个前沿模型最高严格通过率仅 15%,主要失败来自表格错位、图表误读、遗漏脚注/排除条款和跨页修订。

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning Figure 1
2026-07-14cs.CV

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

National University of Singapore, Center of AI Research, VinUniversity

2026-07-14视觉语言视觉感知

这篇论文针对 VLM 在相对深度、遮挡前后等空间判断上的薄弱点,指出问题不只是缺少深度信息,而是冻结模型难以利用“深度图”这种接口。作者提出免训练的 Depth-Ordinal Prompting,将单目深度压缩为针对问题中目标物体的远近顺序文本提示。实验显示,直接展示伪深度图常在细粒度物体级任务上降级,而 DOP 在深度排序可靠时提升空间推理,在原图证据强时基本保持中性。

TC-MAF: Train-Calibrated Bounded Multi-Evidence Fusion for Multimodal Industrial Anomaly Detection Figure 1
2026-07-14cs.CV

TC-MAF: Train-Calibrated Bounded Multi-Evidence Fusion for Multimodal Industrial Anomaly Detection

Ming Deng, Sijin Sun, Xiaochuan Hu, Xing Wu

Shanghai University, National University of Singapore, University of Electronic Science and Technology of China, Shanghai University Shanghai China, National University of Singapore Singapore Singapore, University of Electronic Science and Technology of China Chengdu China

2026-07-14视觉语言视觉感知学习理论

这篇论文针对RGB-D工业异常检测中辅助重建分支可靠性随类别变化、又缺少异常验证集做类别策略选择的问题,提出以多模态检测器为锚的TC-MAF固定像素级融合:受限引入Dinomaly重建证据、跨模态一致性提示,并用正常训练统计得到的TDC调节辅助权重。MVTec-3D上达到0.979 I-AUROC和0.990 P-AUPRO,消融显示主要增益来自融合结构,TDC只带来较小但稳定的校准收益。

SISA-Rec: A Semantically Integrated Sequential Recommender with Contrastive Alignment Figure 1
2026-07-14cs.CV

SISA-Rec: A Semantically Integrated Sequential Recommender with Contrastive Alignment

Soohan Abbasi, Shahid Munir Shah, Rafia Shaikh, Mahmoud Aljawarneh

2026-07-14视觉感知

该文针对序列推荐在高稀疏和冷启动场景中过度依赖物品 ID、难以利用内容语义的问题,提出 SISA-Rec:在输入端门控融合 ID 与 BERT 文本表示,并将语义相似度直接注入 Transformer 注意力,同时用 BPR 与对比对齐约束行为和语义空间。实验在 99.93% 稀疏的 Amazon Beauty 与 Toys 数据集上优于多种基线,相比 BERT4Rec 的 HR@10、NDCG@10 有明显提升,冷启动用户收益最大。

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video Figure 1
2026-07-14cs.CV

Simple Features and Honest Calibration for Ambivalence and Hesitancy Recognition in Video

Vikas Kumar, Aditya Mishra, Haroon R. Lone

Indian Institute of Science Education and Research Bhopal, India

2026-07-14视觉感知

本文面向访谈视频中的矛盾与犹豫识别,动机是为行为改变场景捕捉适合干预的犹豫时刻。作者的主要洞察是信号更多来自语言而非跨模态冲突结构,提出可靠性门控的 AMF、可解释犹豫标记和从 ASR 时间戳恢复的“被转写抹去时间”特征。实验显示调阈和集成权重易在小验证集过拟合,固定阈值的 AP 加权集成在公开测试上达到 0.731 macro-F1。

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures Figure 1
2026-07-14cs.CV

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

Langxu Zhao, Zuan Gu, Tianhan Gao

2026-07-14视觉感知

透明物体因折射和反光破坏朗伯假设,常使通用深度估计与三维重建模型把背景当作物体表面。GHOST的关键思路不是重训下游模型,而是用DINOv3、透明度分解、法线先验和GeoSemTransNet将透明区域预处理成保留几何结构的“非透明”纹理RGB。实验称该预处理能提升多种SOTA模型在透明物体上的深度与重建精度,但具体增益在不同模块间的来源仍需看消融细节。

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools Figure 1
2026-07-14cs.CV

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

2026-07-14视觉语言

这篇论文针对多模态模型在细粒度视觉推理中频繁调用外部视觉工具、反复编码图像导致延迟高的问题,提出 BEE:把工具调用行为内化为隐式视觉工具,并通过形式化 CoT 微调与自调节奖励学习何时用内部知识、何时调用工具。实验显示其在 HRBench、MME-RealWorld 等感知任务上优于显式工具方法,并在 8K 设置下相对 DeepEyes 最高降低约 86.2% 推理延迟。

FlowPET: Physics-Informed Symplectic Flow Matching for Low-Count PET Reconstruction Figure 1
2026-07-14cs.CV

FlowPET: Physics-Informed Symplectic Flow Matching for Low-Count PET Reconstruction

Zheng Zhang, Hao Tang, Yingying Hu, Zhanli Hu, Jing Qin

2026-07-14生成模型三维

FlowPET针对低计数PET中扩散/生成模型的耗散动力学会抹除弱病灶信号的问题,将重建表述为辛相空间中的保体积输运,用可分离哈密顿系统和辛流匹配构造无散度向量场,并通过PET算子的Range-Null分解在观测空间 enforcing 数据一致性、在零空间注入不确定性。实验在BrainWeb、儿科临床和UDPET数据上显示其SSIM、PSNR优于确定性与随机基线,低对比病灶恢复也更好。

Desc++: Efficient Descriptor Enhancement for Data Association in Existing Visual SLAM Systems Figure 1
2026-07-14cs.RO

Desc++: Efficient Descriptor Enhancement for Data Association in Existing Visual SLAM Systems

Ting-Wei Ou, Huang-Ting Lin, Kuu-Young Young

2026-07-14视觉感知

这篇论文针对现有实时视觉 SLAM 依赖手工描述子、在光照和视角变化下数据关联退化,而替换式学习前端又代价较高的问题,提出 Desc++ 作为即插即用的描述子增强模块。其核心是联合编码描述子与关键点几何,并用 AFT 全局上下文分支和基于 Z-order 的 Mamba 序列建模在线性复杂度下聚合空间关系。实验显示,该方法在 HPatches 匹配、对应关系分析及 ORB-SLAM2/3、RGB-L、MAVIS-SLAM 等系统级评测中提升多数序列的匹配与轨迹精度,但效果仍受初始特征提取质量约束。

Revisiting Matching Response and Swept Feature Volumes for Wide-baseline Omnidirectional Stereo Figure 1
2026-07-14cs.CV

Revisiting Matching Response and Swept Feature Volumes for Wide-baseline Omnidirectional Stereo

Seungjin Jeon, Jongwoo Lim, Changhee Won

∗ Authors contributed equally. † Corresponding author. 1 UVify Corporate Affiliated Research Institute, Republic of Korea.

2026-07-14视觉感知

面向机器人、无人机等宽基线全景多目系统,论文关注遮挡和无有效匹配导致的深度误估及置信度失效问题。核心洞察是将3D编码器输出的匹配响应期望直接作为内生置信信号,并通过 swept feature volume resampling 对齐全局扫描与输入视角,用表面法线辅助正则深度。实验显示该策略提升歧义区域过滤、置信估计和法线预测,同时不增加额外置信分支,部署成本较低。

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder Figure 1
2026-07-14cs.CV

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

Kai Li, Xuechao Zou, Jiashen Fu, Zijun Yan, Xintong Wang, Xiaolin Hu

X. Zou is with the School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China., J. Fu, Z. Yan and X. Wang are with the Department of Computer Science and Technology, Tsinghua University, Beijing, China.

2026-07-14视觉感知

这篇论文针对 U-Net 解码器中高层语义与低层细节融合粗糙的问题,认为注意力不应只来自单一路径或相关性,而应显式利用两路特征的差异。作者提出 FDG 与 EDG,用特征差或熵差生成成对门控,同时调制全局和局部特征。实验覆盖医学分割、遥感去云和语音分离,均优于既有注意力融合方法,其中 EDG 效果更好。

Why Low-Light Cameras Go Color Blind: Removing Color Bias in Raw Denoising Figure 1
2026-07-14cs.CV

Why Low-Light Cameras Go Color Blind: Removing Color Bias in Raw Denoising

Mohammad Mohammadi, Sina Honari, Stavros Tsogkas, Tristan Aumentado-Armstrong, Michael S. Brown, Iqbal Mohomed, Konstantinos G. Derpanis, Alex Levinshtein, Igor Gilitschenski

2026-07-14视觉感知

低照度 RAW 去噪常因相机噪声复杂、缺少成对数据或精确标定而难以泛化,且暗部易出现明显偏色。本文指出黑电平误差是颜色偏置的重要来源,并用全局偏置估计网络先校正 RAW 输入,再进行相机无关去噪;同时发现 SIDD 真值也含偏色并提出 SIDD-CC。实验在 ELD、SID、LRID 上显示其在盲去噪和颜色校正上优于同类方法,部分场景接近或超过强监督/标定方法。

CUST: Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution Figure 1
2026-07-14cs.CV

CUST: Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution

Jeongsoo Kim

2026-07-14视觉感知

CUST面向轻量级图像超分中ViT全局建模成本高、窗口注意力又丢失长程依赖的问题,提出跨窗口相似补丁聚类的CANA与基于多尺度残差信号强化高频细节的MEDA,在更大范围聚合上下文同时控制显存和延迟。实验称其较WSA模型平均推理延迟降26.7%,较CATANet显存平均降83%,×4尺度PSNR平均提升0.094 dB。

Controlling Motion Transfer in Diffusion Transformers via Attention Heads Figure 1
2026-07-14cs.CV

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

2026-07-14生成模型规划控制

针对视频 DiT 做运动迁移时常出现轨迹偏移和结构错位的问题,本文从注意力头层面分析运动与空间结构的编码差异,发现可分离的运动专用头和低熵结构头,并据此提出无需训练的 HALO:用语义对应修正位移图、用选择性特征注入保持布局。实验称其在标准基准和 Movie Scene Dataset 上提升运动一致性与结构对齐。

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video Figure 1
2026-07-14cs.CV

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

2026-07-14视觉感知

这篇论文针对长视频基准分数是否真的反映角色跟踪能力提出质疑,以 InfiniBench 外观顺序任务为对象,通过替换问题中的角色名、开放式回答、字幕和帧采样等九种诊断条件拆解模型行为。结果显示,三类开源 Video-LLM 在换名后仅 4–31% 会改变答案,更依赖性别等粗粒度线索;去掉选项后准确率显著下降,字幕、更多或更优帧也未改善身份绑定,说明现有成绩主要来自浅层视觉和选项偏置,而非真正跟踪人物。

DDR-Net: Haze-Aware Dual-Domain Refinement for Single-Image Dehazing Figure 1
2026-07-14cs.CV

DDR-Net: Haze-Aware Dual-Domain Refinement for Single-Image Dehazing

Xinye Zheng, Ye Yu, Qiang Lu, Jinsheng Luo, Yiran Cui, Yongbin Cheng

2026-07-14视觉感知

DDR-Net面向单图去雾中编码器-解码器瓶颈细化不足、局部结构表达偏弱的问题,核心是在U-Net框架中加入多尺度雾先验提取、梯度感知的细节增强块,以及空间-频率联合的瓶颈 refinement。实验显示其在NH-Haze、O-Haze、Dense-Haze等真实数据集上优于多种去雾方法,在合成集上保持竞争性能,并在Haze4K上以较低参数量和计算量取得接近或领先结果。

WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation Figure 1
2026-07-14cs.CV

WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation

Doeon Kim, Jungyoon Lee, Seongsin Kim, Seong-heum Kim

2026-07-14三维

这篇论文针对 WiFi-CSI 三维人体姿态在跨环境泛化差、标注依赖强和硬件噪声干扰下不稳的问题,提出 WiFi-JEPA:按 CSI 的信道、时间、链路结构做自监督表征学习,并用整条 Tx-Rx 链路遮蔽来学习跨链路空间相关性,同时引入 ray-tracing 模拟 CSI 扩展预训练数据。在 PiW3D 上,真实与模拟预训练结合达到单人 76.8 mm、多人物 93.5 mm MPJPE,优于已有 WiFi 姿态方法;但跨硬件和频段泛化仍文中未充分说明。

FSFVE: Few Shot Compressed Face Video Enhancement Figure 1
2026-07-14cs.CV

FSFVE: Few Shot Compressed Face Video Enhancement

Varun Ramesh Jois, Antonella DiLillo, James Storer

Brandeis University

2026-07-14视觉感知

面向低带宽视频通话中人脸画质严重压缩且实时增强难以在普通 CPU 上运行的问题,FSFVE 利用同一通话内人脸帧高度相关的特点,为单次通话用少量人脸帧训练实例专属模型;其核心是将图像分块转到 DCT 频域,用带正弦激活的 MLP 预测残差,并用频域加权损失加速收敛。实验在 H.264/H.265 高压缩设置下显示,该方法可在约百秒内训练、CPU 实时推理,并在客观指标和感知质量上优于压缩基线及实时对照模型。

RTFVE: Realtime Face Video Enhancement Figure 1
2026-07-14cs.CV

RTFVE: Realtime Face Video Enhancement

Varun Ramesh Jois, Antonella DiLillo, James Storer

2026-07-14视觉感知

面向低带宽视频通话中人脸压缩失真的问题,RTFVE将少量高质量参考帧与低质当前帧结合,在解码后只处理人脸区域,并用像素反洗牌、轻量 shuffle 单元、特征对齐与聚合来降低算力需求。实验显示其在多个低码率设置下提升感知质量,并在低成本 CPU 上达到约24.85 FPS,接近实时;但具体主观增益与不同场景鲁棒性文中未充分说明。

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters Figure 1
2026-07-14cs.RO

Learning to Navigate Efficiently with Only 0.58M Trainable Parameters

Edward Beng Wai Tan, Siew-Kei Lam

College of Computing and Data Science, Nanyang Technological University, Singapore. ∗ Corresponding author.

2026-07-14视觉感知

这篇论文针对点目标视觉导航中过度依赖大模型、大数据和高推理成本的问题,主张把可解析的几何、占据和坐标变换从学习中拆出来,只让三个小模块分别学习局部子目标、可通行后验和轨迹形状。结果显示,模型仅训练0.58M参数、44k帧内一小时训练,在6060个仿真任务中接近NavDP等方法,碰撞率最低且可达50Hz,但真实机器人验证和跨楼层场景仍未充分说明。

Reference-Based Face Super-Resolution Using the Spatial Transformer Figure 1
2026-07-14cs.CV

Reference-Based Face Super-Resolution Using the Spatial Transformer

Varun Ramesh Jois, Antonella DiLillo, James Storer

2026-07-14视觉感知

本文针对人脸超分辨率中高倍放大细节不确定、参考图像难以稳定对齐和筛选的问题,提出 FSRST:用空间变换器替代易训练崩溃的可变形卷积做参考图对齐,并用基于 L2 距离的聚合机制优先利用相似参考、在不匹配时抑制参考信息。实验称该轻量模型在多个数据集上达到或超过现有方法,但固定输入尺寸仍是局限。

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception Figure 1
2026-07-14cs.CV

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

Beihang University, State Key Laboratory of Space Information System and Integrated Application, Nanjing University, Harbin Engineering University, Beijing Zhongguancun Academy

2026-07-14视觉感知安全鲁棒

这篇论文针对开放词汇检测/分割中同一物体被不同同义表达触发不同空间注意力的问题,指出这会削弱真实场景下的定位鲁棒性。SynCLIP通过同义表达间注意力对齐、语义相关区域强化,并构建含同义词和定义的SEViC语料来预训练。实验显示其在多项OVDP基准上提升同义词一致性,并达到CLIP系方法的领先结果。

Temporal Feature Distillation for Label-Efficient Precise Event Spotting in Sports Videos Figure 1
2026-07-14cs.CV

Temporal Feature Distillation for Label-Efficient Precise Event Spotting in Sports Videos

Hao Xu, Xinyu Wei, Sam Wells, Sunil Aryal

Deakin University, Deakin University Melbourne Australia

2026-07-14视觉感知

这篇论文针对体育视频精确事件定位中帧级标注昂贵、相邻帧差异细微而普通自蒸馏易抹平边界线索的问题,提出在骨干特征层做 Temporal Feature Distillation,并用监督预热、Transformer Gate Shift 与运动感知增强保留时序信息。四个细粒度体育基准上均优于监督和半监督基线,FSPerf 仅 10% 标注时较最强对比方法提升 4.54 mAP,80% 标注在两项数据集达到或超过全监督结果。

AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling Figure 1
2026-07-14cs.CV

AsySplat: Efficient Asymmetric 3D Gaussian Splatting for Long-Sequence Scene Modeling

Yingji Zhong, Dave Zhenyu Chen, Fuzhao Ou, Youyu Chen, Zhihao Li, Lanqing Hong, Dan Xu

Huawei Noah’s Ark Lab

2026-07-14三维

针对长序列高分辨率 3DGS 新视角合成中细粒度 token 交互带来的冗余计算,AsySplat 将几何与外观解耦:几何分支用粗粒度 token 和更多参数做多视图重建,外观分支用轻量细粒度 token 保细节,并通过双向连接互相引导。实验称在 32 视角 960P 输入下接近优化式方法且快约 800 倍,零样本优于既有可泛化 3DGS,同时减少参数、训练时间、FLOPs 和高斯数量。

Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics Figure 1
2026-07-14cs.CV

Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics

Yi Tang Soon, Jun-Wei Hsieh

2026-07-14视觉感知

本文针对开放词汇检测中置信度被当作定位概率使用的问题,指出CLIP式区域-文本相似度并不只反映检测正确性,而是混入目标尺度和查询语义具体性的系统偏差。作者用COCO上GroundingDINO、OWL-ViT、YOLO-World及LVIS复现实验证明,大目标得分被抬高、泛化查询得分被压低;简单调阈值难以修正,小目标F1几乎不变。其无参数温度缩放可将小目标Recall@10提升约19.6%,但会牺牲部分排序精度。

LoSA-Net: A Localized and Scale-Adaptive Network for Boundary-Sensitive Prediction of Perineural Invasion in 3D MRI Figure 1
2026-07-14cs.CV

LoSA-Net: A Localized and Scale-Adaptive Network for Boundary-Sensitive Prediction of Perineural Invasion in 3D MRI

Youngung Han, Hyunsu Go, Kyeonghun Kim, Induk Um, Junga Kim, Jaewon Jung, Woo Kyoung Jeong, Won Jae Lee, Pa Hong, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

2026-07-14学习理论三维

这篇论文针对胆管癌周围神经侵犯在3D MRI中信号细弱、易被下采样和全局聚合抹平的问题,提出LoSA-Net,把局部邻域注意力、多尺度深度卷积特征混合与跨尺度边界对齐结合起来强化神经走行边界线索。在168例单中心增强MRI上,模型AUC为0.7567,高于ResNet、DenseNet、Swin和NAT等基线;但样本量较小且缺少外部验证,泛化性仍文中未充分说明。

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies Figure 1
2026-07-14cs.RO

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

2026-07-14机器人视觉语言强化学习

这篇论文针对社交导航中 RL 策略反应快但缺少语义推理、VLM 推理强但延迟高的问题,提出 HUMA:平时由轻量 RL 策略导航,只有在人进入机器人近距离等敏感场景时才调用经 LoRA 后训练的 VLM 进行高层决策。其核心洞察是语义推理应按需触发而非全程使用。实验在 Social-MP3D 和 Social-HM3D 上分别带来 20% 和 3% 的成功率提升,并减少个人空间侵犯与碰撞,另有真实 Mirokaï 机器人部署验证。

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding Figure 1
2026-07-14cs.CV

TreeSoc: Tree-Structured Dynamic Reasoning and Tool Synergy for Soccer Video Understanding

Thanh-Nhan Vo, Thanh-Khoi Nguyen, Trong-Thuan Nguyen, Trung-Hoang Le, Minh-Triet Tran

University of Science, VNU-HCM, Ho Chi Minh City, Vietnam, Vietnam National University, Ho Chi Minh City, Vietnam

2026-07-14视觉感知

本文针对足球视频问答中事件跨帧、概念专业且单次 VLM 推理易误判的问题,提出 TreeSoc:把问题转化为层级推理树,用动态 DFS 分解子任务,并由 MLLM 调度 YOLO26、PRTREID、UniSoccer 等工具和外部知识。其在 SoccerBench 的 TextQA/ImageQA/VideoQA 达到 85.2%/87.4%/82.2%,NExT-QA 为 74.16%,但各工具与树搜索的独立增益来源仍需消融进一步说明。

MMA-Former: Multi-Window Mixture-of-Head Attention Transformer for Adaptive PNI Prediction in 3D MRI Figure 1
2026-07-14cs.CV

MMA-Former: Multi-Window Mixture-of-Head Attention Transformer for Adaptive PNI Prediction in 3D MRI

Youngung Han, Induk Um, Kyeonghun Kim, Junga Kim, Hyunsu Go, Jaewon Jung, Woo Kyoung Jeong, Won Jae Lee, Pa Hong, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

2026-07-14三维

本文针对胆管癌周围神经侵犯在3D MRI中表现细微、且需同时建模局部细节与全局上下文的问题,提出MMA-Former:用粗细双窗口并行提取多尺度特征,并以窗口级Mixture-of-Head路由替代逐token路由,减少冗余并实现空间自适应注意力。在168例单中心T1增强MRI的5折验证中,AUC为0.752,高于ResNet的0.708和3D Swin的0.681;但外部泛化仍受数据规模与单中心限制。

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration Figure 1
2026-07-14cs.CV

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

Zheng Zeng, Deepak Sridhar, Nuno Vasconcelos

2026-07-14视觉感知

针对CLIP等VLM经LoRA专域适配后形成多专家碎片化、联合标签空间中logit不可比导致跨域误判的问题,论文指出关键瓶颈在无监督路由与跨域logit失准,并提出MED-DSLC:用类别派生的域监督训练MoE路由,同时为每个域学习logit缩放以恢复全局可比性。实验显示其在多细粒度基准上平均准确率约提升15%,在域数增加和类别不均衡时更稳健,但部分增益可能主要来自scaling / data。

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion Figure 1
2026-07-14cs.CV

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

2026-07-14生成模型

这篇论文针对随机人体运动预测中骨架结构被硬编码的问题:不同数据集关节数和连接关系不一致,导致跨数据训练、未见骨架泛化和遮挡场景都依赖重定向或重新训练。EquiFusion 的核心是把骨架连接作为输入,并用置换等变的潜扩散架构,使模型权重不绑定具体关节顺序或数量。实验显示其在 AMASS、Human3.6M 等基准达到或超过现有方法,参数量最多减少 75%,训练和推理更快,并在未见骨架、缺失肢体等零样本设置下取得明显提升。

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge Figure 1
2026-07-14cs.CV

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

2026-07-14视觉语言视觉感知生成模型

本文针对CT视觉语言预训练中全局对齐易稀释多器官病灶、局部对齐又未利用报告解剖层级的问题,提出OKA-CT:用报告解析与LLM结构化提取器官异常、疾病、位置和严重度信息,并在两阶段中用于器官监督与语义软目标对比学习。CT-RATE和RAD-ChestCT上零样本诊断AUROC达84.9和72.2,检索与遮挡实验也显示更好的图文对齐和病灶区域敏感性。

Unsupervised Detection of Entry and Exit Regions from Vehicle Trajectories for Camera-Agnostic Turning Movement Counts Figure 1
2026-07-14cs.CV

Unsupervised Detection of Entry and Exit Regions from Vehicle Trajectories for Camera-Agnostic Turning Movement Counts

Parikshit Singh Rathore, Vishwajeet Pattanaik, Punit Rathore

Robert Bosch Centre for Cyber-Physical Systems (RBCCPS), Centre for infrastructure, Sustainable Transportation and Urban Planning (CiSTUP), Indian Institute of Science (IISc), Bengaluru, India

2026-07-14视觉感知

针对路口转向流量统计仍依赖逐摄像头手工标注进出口区域的问题,本文从车辆轨迹的起止点无监督聚类生成可复用的空间多边形,用点在多边形内判定替代每批轨迹重聚类,降低部署成本。作者在班加罗尔25路摄像头和UA-DETRAC上系统调参,推荐配置下中位分类误差约3%,但相较部分轨迹聚类基线以更高误差换取更稳定和更低计算成本。

DP-Splat: Bayesian Nonparametric Complexity Control for Gaussian Splatting Figure 1
2026-07-14cs.CV

DP-Splat: Bayesian Nonparametric Complexity Control for Gaussian Splatting

Aqi Dong

Embry-Riddle Aeronautical University

2026-07-14规划控制三维

该文针对3D Gaussian Splatting中高斯数量依赖启发式增删或预设上限的问题,将VBGS的固定有限混合改为截断Dirichlet过程先验,并保留闭式变分更新,使组件数由数据自适应决定。结果显示其主要收益是复杂度选择而非单组件效率:在3D场景中以约5.9–7.6倍更少组件达到或超过VBGS的颜色预测,并给出校准的颜色不确定性,但作者也明确指出估计的组件数并非真实K的一致估计。

Design Choices in Splitting-Based Self-Supervised Sparse-View CT Reconstruction Figure 1
2026-07-14cs.CV

Design Choices in Splitting-Based Self-Supervised Sparse-View CT Reconstruction

Nadja Gruber, Lukas Neumann, Ander Biguri, Gyeongha Hwang, Markus Haltmeier, Johannes Schwab

2026-07-14三维

针对稀疏视角 CT 中自监督测量划分方法缺少统一比较、且常假设噪声独立的问题,本文将流程拆为划分、预处理和推理三部分,并加入多划分掩码与新推理策略。实验显示最优划分取决于噪声结构:独立噪声下 lattice 更好,相关噪声和真实 2DeteCT 数据上角度掩码更稳,多划分在若干设置中优于纯投影划分。

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments Figure 1
2026-07-14cs.RO

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

Siyi H, Jared Strade, Hyungtae Lim, Luca Carlone

2026-07-14三维

这篇论文面向机器人在室内只观测到局部环境时如何预测未探索区域的问题,核心是把场景补全从单房间物体布局提升到分层3D场景图:先用混合离散-连续图扩散联合生成房间类别、边界与可通行关系,再接入物体层扩散模型生成房内物体。实验在3D-FRONT和Matterport3D上显示,其房间图补全比占据栅格和LLM基线更真实、图结构更一致,并能接入真实机器人数据。

X-GuideAR: An Augmented Reality Framework to Mitigate Radiation Exposure during Fluoroscopic Guidance Figure 1
2026-07-14cs.CV

X-GuideAR: An Augmented Reality Framework to Mitigate Radiation Exposure during Fluoroscopic Guidance

Mingxu Liu, Zixuan Liu, Ruchen Cai, Yu-Chen Ku, Suxi Gu, Amit Jain, Alejandro Martin-Gomez, Mehran Armand

Department of Computer Science, Johns Hopkins University, Department of Orthopaedic Surgery, Johns Hopkins School of Medicine, Department of Electrical Engineering and Computer Science, University of Arkansas, Department of Mechanical Engineering

2026-07-14视觉感知

针对骨科透视导航中为寻找合适解剖视角而反复拍片造成的辐射暴露,X-GuideAR用AR结合合成X光预览,在真实拍片前指导C臂取景,并将钻孔轨迹叠加到实拍X光上辅助S2AI螺钉置入。初步8条轨迹实验显示,X光次数减少62.3%,可容纳安全螺钉直径由传统流程的5.9 mm提升至12.95 mm,但样本量较小,临床泛化仍需验证。

AU-Guided Synthetic Video Generation for Micro-Expression Recognition Figure 1
2026-07-14cs.CV

AU-Guided Synthetic Video Generation for Micro-Expression Recognition

Pei-Sze Tan, Sailaja Rajanala, Yee-Fan Tan, Raphael C.-W. Phan, Huey-Fang Ong

CyPhi AI Lab, Monash University Malaysia

2026-07-14视觉感知

微表情识别受真实数据规模小、人口覆盖窄和类别不均衡限制,模型容易学到身份或采集条件偏差。本文提出 EquiME,用 AU 作为可控中间表示驱动图像到视频生成,从 1.5 万张人脸合成 7.5 万段含五类情绪和人口属性元数据的短视频。跨 SAMM、CASME II 实验显示其训练模型具备有竞争力的迁移表现且架构间波动较小,但增益可能主要来自 scaling / data,合成真实性与真实微表情差距仍需进一步验证。

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting Figure 1
2026-07-14cs.CV

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting

Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung

2026-07-14生成模型

论文针对扩散模型容易继承训练集不均衡、难以采到稀有模式的问题,指出直接用高温采样缩放 score 虽能重加权模式,却会放大单模态方差并破坏反向扩散。作者提出无需训练的方差校正时间平移,在偏移时间步查询网络再按 γ 缩放,以保留多样性增益并抑制质量下降;在 DiT、Stable Diffusion 和 Motion Diffusion 上报告了多样性提升,且对样本质量和条件一致性的损失较小。

Learning To Focus: Anatomy-Guided Attention Regularization for Medical Image Classification Figure 1
2026-07-14cs.CV

Learning To Focus: Anatomy-Guided Attention Regularization for Medical Image Classification

Tonmoy Hossain, Atiqur Rahman, Farhana Hossain Swarnali, Miaomiao Zhang

2026-07-14视觉感知

医学分类模型常只有图像级标签,容易把注意力放到背景、伪影等捷径区域,影响可解释性与泛化。论文提出 Locus,用预训练分割基础模型生成解剖先验,并以自适应注意力正则惩罚背景注意力占优,而非硬性像素对齐。作者在皮肤镜、X 光、病理、超声和心脏 MRI 等八个数据集上报告分类性能与解剖一致性均有提升。

Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels Figure 1
2026-07-14cs.CV

Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels

Venkanna Babu Guthula, Oswin Krause, Dimitri Gominski, Hui Zhang, Johan Mottelson, Ankit Kariryaa, Nico Lang, Christian Igel

2026-07-14视觉感知

这篇论文针对遥感建筑分割中影像与OSM等足迹标签常存在系统性错位、导致模型学到偏移标签的问题,提出AnS框架:用空间变换模块同时估计标签仿射对齐与分割,并以自监督一致性损失和数据增强抑制捷径学习。实验在合成错位和真实城市数据上显示,无需干净“黄金标签”也能提升建筑分割质量并恢复较准确的标签-影像对齐。

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields Figure 1
2026-07-14cs.CV

OmniX: Any-view and Any-time 4D Reconstruction via Feed-forward Trajectory Fields

Yanqin Jiang, Tengfei Wang, Zhengwei Wang, Chenjie Cao, Junta Wu, Wenhan Luo, Weiming Hu, Jin Gao, Chunchao Guo

2026-07-14规划控制三维

OmniX针对动态场景4D重建在大视角运动下难以同时保持几何完整性与时序对应的问题,将静态几何预测与前景运动建模解耦,用少量动态token和稀疏时空注意力生成全像素3D轨迹场,并配套UE5数据引擎构建大规模标注数据。结果显示其在密集3D轨迹预测、3D点跟踪上达到SOTA,深度和相机位姿估计也具竞争力,但增益可能部分来自scaling / data。

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects Figure 1
2026-07-14cs.CV

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

2026-07-14视觉语言视觉感知规划控制数据集/基准三维

这篇论文针对3D生成评测中人工审查昂贵、VLM自动裁判又易受渲染视角、输入模态、提示格式和标注基准影响的问题,提出3D-DefectBench,用九类细粒度缺陷和84种因子化评测管线系统分析误差来源。结果显示模型选择影响最大,但管线因素会与模型交互;六视角RGB已接近更密集或多通道方案,而最佳VLM仍落后训练有素的人类标注者。

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform Figure 1
2026-07-14cs.CV

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

2026-07-14视觉感知生成模型

本文针对文本驱动流模型图像编辑中“贴合目标提示”与“保持源图一致”难以平衡的问题,提出训练-free的 h-Flow。其核心是把编辑表述为 Doob h-Transform 下的多终端条件生成,并将该理论扩展到确定性 Rectified Flow;通过源一致性与目标对齐的 h 函数、闭式重建引导和速度正交分解,把重建方向与语义编辑方向解耦。实验显示该方法在多种编辑场景下更稳健、可控且可与不同前向过程组合,但具体代码尚未发布。

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos Figure 1
2026-07-14cs.CV

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

Hao Zheng, Jinyi Huang, Tiantian Zheng, Xun Xu, Tuka Alhanai

Department of Computer Engineering, New York University Abu Dhabi, UAE, Center for Quantum and Topological Systems, New York University Abu Dhabi, UAE, Center for AI and Robotics, NYUAD, UAE

2026-07-14视觉语言视觉感知

面向人机协作装配中细微动作和手-物交互难以稳定识别的问题,论文将装配动作拆成动词、物体、工具三类语义元素,用模板化 VQA 微调 VLM,并通过分层分配的元素专属 LoRA 交替训练来降低多任务干扰。在 HA-ViD-VQA 和 IKEA-ASM-VQA 上,该方法相对强动作识别基线取得更好结果,同时输出更可解释、近确定的元素级预测。

Mixture of Cognitive Experts in Large Vision-Language Models Figure 1
2026-07-14cs.CV

Mixture of Cognitive Experts in Large Vision-Language Models

Robert Wijaya, Ngai-Man Cheung

2026-07-14视觉语言视觉感知

本文针对 LVLM 在不同视觉语言问题上仍采用统一感知-推理流程、导致证据难核验和幻觉的问题,提出由路由视觉专家生成原子化证据,再按 Bloom 认知层级进行分阶段 verbalization,并用轻量 Trace Module 量化证据使用与推理层级。实验称在多项视觉语言基准上提升感知、空间/关系推理和抗幻觉表现,但具体增益幅度与来源文中未充分说明。

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction Figure 1
2026-07-14cs.CV

MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction

Jinqian Yang, Yichen Wu, Wanhua Li, Haokun Lin, Renzhen Wang, Xiangchu Feng, Xixi Jia

2026-07-14三维

MAC-Splat针对稀疏视角3D Gaussian Splatting中仅靠2D光度监督难以消除深度与对应歧义、易产生几何伪影的问题,引入MASt3R与冻结DINOv3生成语义增强匹配,并用MAC损失在世界坐标中同时约束匹配高斯的位置、形状和外观。ScanNet++实验显示其较Splatt3R平均PSNR提升超过4.5 dB、LPIPS下降,且在低重叠和大视角间隔下更稳定。

Detecting AI-Generated Video: A Vision-Language Dual-View Survey Figure 1
2026-07-14cs.CV

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

MBZUAI, 2Gaoling School of Artificial Intelligence, Renmin University of China, Harvard University

2026-07-14视觉语言视觉感知

针对高保真生成视频使传统伪造检测中依赖低层伪影的思路失效,本文将 AIGC 视频检测重述为“事实保真度验证”,提出视觉-语言双视角四层分类,覆盖内在线索、时空一致性、跨模态一致性与世界级推理。文中系统梳理 221 篇工作、生成范式、指标与基准,主要结果是给出面向可解释、证据优先检测的结构化路线图,而非报告单一新模型性能增益。

Toward Efficient Weakly Supervised Semantic Segmentation Using Only Low-Magnification Histopathological Images Figure 1
2026-07-14cs.CV

Toward Efficient Weakly Supervised Semantic Segmentation Using Only Low-Magnification Histopathological Images

Dung Minh Do, Nhat-Thanh Huynh, Duc Minh Huynh, Doanh C. Bui, Khang Nguyen

2026-07-14视觉感知

面向数字病理中高倍全切片存储传输成本高、像素级标注昂贵的问题,本文系统评估低倍图像经插值或STAR-RL超分重建后用于弱监督语义分割的可行性。核心洞察是重建指标不能可靠预测下游分割效果,分辨率退化存在临界点。实验表明20×在部分大而连续组织上仍可接近40×,但10×会显著损害性能,淋巴细胞等细粒度结构甚至定位失效。

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models Figure 1
2026-07-14cs.CV

Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models

Xiyan Su, Frank Diermeyer, Markus Lienkamp

Institute of Automotive Technology, Technical University of Munich, Munich Germany

2026-07-14强化学习

本文针对驾驶视频世界模型难以按交通规范受控的问题,提出在冻结的 rectified-flow/Open-Sora 2.0 世界模型采样阶段,用可微能量函数直接注入驾驶规则来引导自车轨迹,无需重训或地图/目标框条件。实验显示该方法能把规划轨迹显著拉向反事实刹车目标,但生成视频几乎不随轨迹改变,说明端到端可控性的瓶颈在视频与轨迹流的跨流耦合。

RED-Sphere: Hyperspherical Residual Edge Debiasing for Cross-Population Fundus Disease Domain Generalization Figure 1
2026-07-14cs.CV

RED-Sphere: Hyperspherical Residual Edge Debiasing for Cross-Population Fundus Disease Domain Generalization

Yan Lin, Ziheng Wang, Shuang Chen, Amir Atapour-Abarghouei, Stephen McGough

2026-07-14学习理论

本文关注眼底病变模型在单一来源人群训练后,面对不同族群、采集风格和外观统计时易把人群相关纹理当作疾病证据的问题。RED-Sphere用边缘与特征能量估计捷径响应,经残差软门控、扰动视图一致性约束和超球面原型分类,弱化幅值偏置而保留病灶结构。在White-only Harvard-FairVision SLO协议下,AMD和DR的20个任务-骨干组合均提升外部macro-F1,平均增益约1.28和2.98点。

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation Figure 1
2026-07-14cs.CV

TOLiD: Bridging the Architecture Gap in Vision Foundation Model to LiDAR Pretraining via Token Lifting for Distillation

Sutharsan Mahendran, Darshana Priyasad, Kaushik Roy, Tharindu Fernando, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

2026-07-14视觉感知

TOLiD针对VFM到LiDAR蒸馏中同时存在的模态差异与架构差异,改为把LiDAR骨干接入由冻结VFM初始化的学生ViT,在兼容的patch token空间监督;其用Frustum Pooling/Attention将视锥内点特征聚成token,并用遮罩双线性采样回到点级表示。五个异构数据集和四组跨传感器适配中,冻结骨干加轻量头较SOTA平均提升扩大到约4.2% mIoU,说明收益可能部分来自更大规模、多样化预训练。

TriCons-Pose: Triangle-Invariant Geometric Consistency Learning for Category-Level Object Pose Estimation Figure 1
2026-07-14cs.CV

TriCons-Pose: Triangle-Invariant Geometric Consistency Learning for Category-Level Object Pose Estimation

Zuzhi Yang, Shuai Wang, Mounir Kaaniche, Ziwei Li, Zhiming Cheng, Zhidong Zhao, Chenggang Yan

2026-07-14三维

本文针对类级物体位姿估计中关键点对应在视角扰动、类内形变和遮挡下易发生几何漂移的问题,提出 TriCons-Pose:用跨视图归一化成对距离约束稳定关键点结构,并将三角形不变量注入局部到全局注意力以获得姿态不变特征。REAL275、CAMERA25 和 HouseCat6D 实验显示其提升多项指标,5°2cm 准确率达 62%,在遮挡、杂乱和强类内差异场景更稳。

Water Reflection Detection Using Symmetric Attention Figure 1
2026-07-14cs.CV

Water Reflection Detection Using Symmetric Attention

Shuxuan Yao, Chengjia Wang, Jianyuan Sun, Junyu Dong, Xinghui Dong

2026-07-14视觉感知

水面倒影会让检测和分割模型把真实目标与镜像混淆,导致误检漏检;本文将问题转化为自然水景中的反射轴估计,提出 SAWRD-Net,用二面体群等变卷积显式编码旋转/镜像几何,并结合多尺度对称注意力与低秩矩阵分解解码器回归轴上关键点,再用稳健 PCA 拟合反射轴。在最大水面倒影数据集上,其相对人工标注的真阳性率达到 0.890,优于已有倒影检测方法。

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation Figure 1
2026-07-14cs.CV

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Changfei Fu, Guangcheng Chen, Wenjun Xu, Hong Zhang

Laboratory of Robotics and Computer Vision, Southern University of

2026-07-14规划控制

该文针对VLN-CE中VLM难以利用RGB图像推理3D空间交互的问题,主张不再显式引入深度或几何编码,而是把未来位姿投影为2D像素轨迹,用语言指令配对监督VLM自回归生成坐标序列。核心洞察是轨迹生成可作为像素目标预测的过程化CoT,并更贴近VLM预训练分布。实验称相比像素目标监督进一步提升导航性能,旗舰模型以较少算力和数据达到SOTA水平。

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification Figure 1
2026-07-14cs.RO

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

Northeastern University, Stanford University, Brown University

2026-07-14机器人强化学习三维

机器人操作中的连续高维动作既难离散化又常具多模态,AMP将末端位姿关键点投影到多相机图像,把未来动作块表述为像素级分类热图,并用X-Net保留多视角空间结构。实验显示其在仿真和真实长程任务中较Diffusion Policy、ACT等取得更高成功率,真实任务提升约50%–70%,单次前向推理也明显更快。

Effective Synthetic Image Detection via Noise Residual Clustering Figure 1
2026-07-14cs.CV

Effective Synthetic Image Detection via Noise Residual Clustering

Caihui Yan, Gang Cao, Huawei Tian, Zhen Li, Yuhang Zhai

School of Computer and Cyber Sciences, Communication University of China, Beijing 100024, China, People's Public Security University of China, Beijing 100038, China, Most existing detectors rely on supervised training with large labeled datasets, leading to high costs, fusion. Only a few real image samples are used needed to initialize the clustering centers for, each module is validated by ablation studies. Source code will be publicly available at, free types. Supervised approaches train classifiers on large labeled datasets to distinguish real from

2026-07-14视觉感知

全文短总结尚未生成。

Incremental Online Scene Reconstruction by 3D Gaussian Triangulation Figure 1
2026-07-14cs.CV

Incremental Online Scene Reconstruction by 3D Gaussian Triangulation

Yanjin Zhu, Shaofan Liu, Jianke Zhu

2026-07-14三维

面向机器人等实时场景中离线全局重建难以及时产出网格的问题,论文将优化后的 3D Gaussian 视为可三角化的 surfel,直接增量生成和更新显式网格,并用平面拉近约束与稀疏正则提升表面对齐、抑制离群点;同时冻结已优化历史区域以控制长序列开销。实验称其在公开数据集上较传统 Gaussian 重建方法同时提升渲染质量和重建精度。

HyperBank: A Differentiable Bank of Classical Priors for Few-Shot Spheroid Microscopy Segmentation Figure 1
2026-07-14cs.CV

HyperBank: A Differentiable Bank of Classical Priors for Few-Shot Spheroid Microscopy Segmentation

M. Průšek, A. Novozámský, F. Šroubek, T. Volfová, V. Svobodová Pavlíčková, S. Rimpelová

2026-07-14视觉感知

这篇论文针对少样本肿瘤球显微分割中数据条件、成像设备和光照差异带来的适配问题,提出 HyperBank:将 Frangi、Sauvola、结构张量、梯度和 LoG 等经典先验做成可微特征库,并用支持集拟合与消融来分析哪些视觉线索有效。结果显示,该小模型在对比度驱动的小簇数据上可接近或超过大型基础分割模型,但在纹理复杂、边界弱的 SpheroidJ 上仍落后,说明其价值更偏向可解释诊断与轻量适配,而非通用替代。

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs Figure 1
2026-07-14cs.CV

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

Shubham Rao

Entropy AI Research Labs Private Limited

2026-07-14视觉语言视觉感知

面向工业视觉中缺陷类型变化快、标注样本常少于30张且大模型难以本地部署的问题,本文用“给定正确答案后再生成视觉推理”的方式蒸馏GPT-4.1,将带解释样本用于LoRA微调3B VLM,避免教师误判带来的错误CoT。四个工业分类任务上,该方法在16个种子-任务组合均优于直接微调,平均提升1.7至4.4个百分点;无答案条件的CoT反而下降17.8个百分点。

Spectral Consistent Flow for One-step 3D Medical Image Translation Figure 1
2026-07-14cs.CV

Spectral Consistent Flow for One-step 3D Medical Image Translation

Haoqing Li, Jun Shi, Mingchao Li, Zehua Zhu, Qiwei Jia, Jiong Shi, Hong An

2026-07-14视觉感知生成模型三维

针对三维医学影像跨模态翻译中多步扩散代价高、潜空间流匹配易过平滑并混入源模态特征的问题,论文提出 SC-Flow:用随机 Brownian bridge 建模配对模态间的一步平均速度场,并以频谱一致性校正补偿高频能量衰减。四个数据集实验显示其在保真度、结构一致性、频谱真实性和训练/推理效率上优于多类扩散、GAN 与流匹配基线。

LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow Figure 1
2026-07-14cs.GR

LATO.2: Factorized 3D Mesh Generation with Vertex and Topology Flow

Hang Long, Tianhao Zhao, Junkai Lin, Youjia Zhang, Huipeng Guo, Rendong Liang, Jiale Xu, Jozef Hladký, Matthias Nießner, Wei Yang

Huazhong University of Science and Technology, Technical University of Munich

2026-07-14生成模型三维

这篇论文针对显式网格生成中顶点几何与离散拓扑耦合导致流模型难学、顶点漂移和破面的问题,提出 LATO.2:先用顶点流生成可控数量的顶点,再以已生成顶点为条件用拓扑流预测连接关系,并用共享体素骨架和专用 VAE 支撑两阶段表示。其核心洞察是将连续几何和组合拓扑因子化后,各自可在更自然的连续潜空间中建模。实验称其在几何保真度和连接质量上超过现有拓扑感知网格生成方法,并支持分块高分辨率生成与拓扑自适应编辑。

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen Figure 1
2026-07-14cs.CV

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

2026-07-14视觉感知

这篇论文针对垃圾分类系统只做视觉识别、难以处理处置语义和法规约束的问题,将废弃物识别改成按印度 SWM 2016 规则对齐的视觉问答任务,并构建含 21 类、1.35 万问答对的 WasteVQA 数据集。实验中微调 BLIP 取得 BLEU 0.8291、BERTScore 0.9273,优于传统 CNN 分类基线,但相对提升中数据集构造与模型能力各自贡献仍需更多消融说明。

End-to-End Real-Time Drone-Based Person Detection Framework Using Deep Learning Figure 1
2026-07-14cs.CV

End-to-End Real-Time Drone-Based Person Detection Framework Using Deep Learning

Payel Sarmah, Ayush Ranjan, Piyush Kaushik Bhattacharyya, Anil Kr. Shaw, Pradip Kr. Das

2026-07-14视觉感知

针对无人机视角下行人尺度随高度变化、实时监控易漏检的问题,论文搭建了商用无人机无线视频流到GPU工作站的端到端检测管线,用YOLOv8-nano进行实时行人检测,并重点分析飞行高度与检测稳定性、帧率的关系。模型在VisDrone2019上精度57.4%、召回41%、mAP44.8%、mAP50:95为20.3%,实飞中16至25米高度检测最稳定,帧率保持41 FPS以上、峰值50 FPS;但相对基线增益来源文中未充分说明。

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions Figure 1
2026-07-14cs.CV

Anomalous Frame Detection by Grouping Frame Similarities between Two Videos Computed by Vision-Language Model to Extract Expert Workers' Unique Actions

Ryo Sakai, Yongpeng Cao, Nobutaka Kimura

Robotics Research Department, Research and Development Group, Hitachi, Ltd., Ibaraki, Japan, School of Engineering, The University of Tokyo, Tokyo, Japan, Next Research Department, Research and Development Group, Hitachi, Ltd., Kokubunji, Japan, where data is readily available on the web, fields such as, publicly available and is scarce—face high training costs.

2026-07-14视觉语言视觉感知

针对基础设施维护中专家经验难以通过访谈显性化的问题,论文将按手册作业视频与专家作业视频进行对比,用预训练视觉语言模型构建帧间相似度图,并据此定位专家新增或跳过的异常片段,无需为具体工种重新训练。在模拟配电盘维护的11类非手册动作上,方法取得66.9%抽取率,较传统基线提升约50个百分点。

Benchmarking UAV-based Vehicle Re-Identification under Simulated Weather Conditions Figure 1
2026-07-14cs.CV

Benchmarking UAV-based Vehicle Re-Identification under Simulated Weather Conditions

Vu Minh Tran, Khang Nguyen

2026-07-14数据集/基准

本文关注无人机车辆重识别在真实部署中常遇到的雾、雨天气鲁棒性不足问题,不提出新模型,而是在VRU与UAV-VeID上用解析天气仿真保持身份与划分一致,对CLIP-ReID、MSINet、AdaSP做受控比较。结果显示恶劣天气普遍降低检索性能,雨天退化通常大于雾天;AdaSP最稳健,在VRU-Large雾/雨下mAP为93.0%/88.5%,UAV-VeID-Test为88.7%/76.2%,提示未来评测需纳入天气感知协议。

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders Figure 1
2026-07-14cs.CV

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu

2026-07-14生成模型

针对个人图像被未经同意用于训练、而现有不可学习样本易被对抗训练、压缩和图像变换重新学习且画质下降的问题,DiffUE将防御扰动从像素空间转到扩散自编码器的语义空间,通过修改高层语义特征生成更自然的保护图像。作者在CIFAR-10、CIFAR-100、CelebA-HQ和ImageNet及用户研究中显示,其在保持视觉可用性的同时降低模型学习效果,优于EM、REM、SEM等基线。

Quantum Compressed Sensing CT Reconstruction Algorithm Based on Penalized Weighted Least Squares and Guided Total Variation Figure 1
2026-07-14cs.CV

Quantum Compressed Sensing CT Reconstruction Algorithm Based on Penalized Weighted Least Squares and Guided Total Variation

Yuwen Zhang, Yujie Liu, Ao Wang, Yikuang Yuluo, Shuangyang Zhong, Haijun Yu, Yixing Huang

Department of Medical Imaging Technology, Peking University Health Science Center, Beijing, China

2026-07-14三维

针对稀疏视角、低剂量 CT 中投影噪声不均和传统 TV 易过平滑的问题,论文将光子计数加权的 PWLS 与由先验梯度引导的 GTV 同时写入 QUBO,使量子退火框架仍保持二次形式。实验在含泊松噪声的 10 视角扇束 CT 上显示,PWLS-GTV 优于常规重建和多种 QUBO 变体,D-Wave 混合求解器与经典模拟退火结果接近。

PoseAlign: Sculpting Pose-Consistent Meshes via Text-Guided Deformation Figure 1
2026-07-14cs.GR

PoseAlign: Sculpting Pose-Consistent Meshes via Text-Guided Deformation

Shijin Wang, Zichong Chen, Yang Zhou, Hui Huang

2026-07-14三维

PoseAlign针对文本驱动网格变形中语义对齐容易破坏原始姿态、且大尺度变形易产生不连续伪影的问题,将过程拆成全局姿态缩放与局部细节雕刻:先用Laplacian可微表示配合CLIP做平滑轮廓变形,再用带注意力共享的pose-aligned SDS维持语义部件对应。实验显示其在文本一致性、姿态保持和网格质量上优于TextDeformer、MeshUp等方法。

Projection-Domain Sensitivity Analysis of Vertebral DRRs Under Intrinsic Calibration Perturbation Figure 1
2026-07-14eess.IV

Projection-Domain Sensitivity Analysis of Vertebral DRRs Under Intrinsic Calibration Perturbation

Lin Li, Chaochao Zhou, Benjamin Aubert, Junlin Guo, Junchao Zhu

Department of Mathematics, Tulane University, Department of Computer Science, University of Illinois Urbana-Champaign, EOS, EOS Imaging Inc., Department of Electrical and Computer Engineering, Vanderbilt University, Department of Computer Science, Vanderbilt University

2026-07-14视觉感知

该文针对脊柱透视导航中常用重投影误差难以反映DRR投影一致性的问题,构建合成框架,在固定解剖和位姿下扰动内参,联合评估 landmark、轮廓、silhouette、图像相似度与2D-3D配准误差。结果显示小幅内参误差已会改变椎体投影并传导到配准,且侧位视图比正位更敏感,旋转对齐受影响更明显。

Physics-inspired Pseudo Anomaly Generation and Prototype Feature Guidance for 3D Anomaly Detection Figure 1
2026-07-14cs.CV

Physics-inspired Pseudo Anomaly Generation and Prototype Feature Guidance for 3D Anomaly Detection

Jian Ning, Qin Zou, Linchun Wu, Yuanhao Yue, Kunmo Li, Shoubin Chen, Zhongyuan Wang

School of Computer Science, Wuhan University, Wuhan 430072, Hubei, China, Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), Shenzhen 518060, Guangdong, China, School of Information and Software Engineering, East China Jiaotong University, Nanchang 330013, Jiangxi, China, School of Computer Science and Technology, Dalian University of Technology, Dalian 116024, Liaoning, China

2026-07-14视觉感知三维

这篇论文针对工业三维点云异常检测中真实缺陷稀缺、仅用正常样本训练导致细微几何异常难以分离的问题,提出 PA3AD:用受物理启发的多类伪异常生成模拟凸起、凹陷、孔洞、裂纹和弯曲,并以动量正常原型、差异感知融合和点级位移预测强化正常/异常特征差异。实验在 Anomaly-ShapeNet 和 Real3D-AD 上优于已有方法,但真实物理仿真的近似程度仍需结合代码和更多消融判断。

Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation Figure 1
2026-07-14cs.HC

Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation

Yiluo Wei, Yupeng He, Qiming Ye, Gareth Tyson

The Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology (Guangzhou) Guangzhou China

2026-07-14视觉感知

本文关注开源图像生成生态中创作者如何在海量基础模型与 LoRA 间选择、组合,而非只研究提示词。作者从 Pixiv 抽取 600 万张图像的生成元数据,关联 2.24 万个基础模型和 15.4 万个 LoRA,发现使用高度长尾:80% 图像仅依赖 2.5% 基础模型;模型生命周期较长但采用缓慢,LoRA 使用迅速增长并趋向更细粒度的风格与概念定制。

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation Figure 1
2026-07-14cs.CV

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

University of Massachusetts Amherst, 2 Thoughtworks

2026-07-14视觉感知

本文针对文本到图像生成中同一提示多次采样趋同的样本多样性问题,系统考察自回归图像模型的解码策略。核心洞察是视觉 token 空间高熵且冗余,逐 token 截断难以有效扩展语义模式,因此提出在相似 token 聚类层面进行熵截断的 p-less cluster。四个自回归模型、两个数据集上的结果显示,该方法多数情况下提升 DINOv2/Vendi 多样性,并基本保持图像质量与提示对齐。

Towards Autonomous and Auditable Medical Imaging Model Development Figure 1
2026-07-14cs.CV

Towards Autonomous and Auditable Medical Imaging Model Development

Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan

2026-07-14视觉感知

医学影像任务对模态、验证划分、指标和提交产物要求严格,通用 MLE 代理容易搜索粗糙或依据不可靠分数决策。AMID 的核心是先按数据条件规划可执行方法路线,再用带审核的两阶段探索/利用优化约束验证协议、指标和预测产物。在 20 个医学影像挑战上,其优于通用 MLE 系统,部分任务接近或匹配人工方案,但仍是初步技术报告。

NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices Figure 1
2026-07-14cs.CV

NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices

Filip Pawlicki, Marcel Kańduła, Marcin Pucek, Kamil Dobies

2026-07-14视觉感知

针对现有视频超分模型依赖光流、注意力和自定义算子而难以在 Jetson 等边缘设备实时部署的问题,NanoVSR采用全卷积双向递归结构、结构重参数化和直接加法传播,并用渐进训练学习隐式时空对齐。在 REDS4 等基准上,644k 版本在 Jetson Orin NX 25W 达到 27.2 FPS、28.64 dB,1.7M 版本达到 29.15 dB,体现了质量与端侧吞吐的折中。

Grassmannian Splatting I: Moving rank-2 Spacetime Surfels for Dynamic Scene Rendering Figure 1
2026-07-14cs.CV

Grassmannian Splatting I: Moving rank-2 Spacetime Surfels for Dynamic Scene Rendering

Aaron Maurice Berman, Shantanu Dave

2026-07-14视觉感知

针对动态场景中4D Gaussian切片后仍是体椭球、难以保持表面型几何且训练开销高的问题,论文提出Grassmannian splatting:用支撑在时空3平面上的秩3协方差表示运动primitive,按时间条件化后得到恒速移动的秩2 surfel,并可直接接入标准3DGS光栅器。MonoDyGauBench 17个HyperNeRF场景上训练最快,较强质量基线快4.9至5.6倍,PSNR、MS-SSIM和LPIPS排名第二;局限是直线运动primitive难表达整体旋转。

Differentiable Proxy Learning for Adaptive Quantization Control in H.264 Video Coding Figure 1
2026-07-14eess.IV

Differentiable Proxy Learning for Adaptive Quantization Control in H.264 Video Coding

Qihan Xu, Ivan V. Bajić

This work was supported by the SFU–Huawei Canada Joint Lab and the NSERC grant RGPIN-2021-02485.

2026-07-14视觉感知规划控制

针对 H.264 量化参数不可微、难以按感知质量或机器视觉任务直接优化的问题,论文训练一个贴近 H.264 intra 率失真行为的可微代理,并用 soft-indexing 让全局 QP 与宏块级 spatial-QP 可被梯度优化。冻结代理后训练自适应量化网络,在语义分割和 MS-SSIM 上相对固定 QP 基线最高分别取得 17.12% 与 15.30% BD-rate 降低;但该方法仍限于 intra 编码,扩展到帧间视频编码尚未验证。

On the Real-World Generalisability of Optical Flow Models Figure 1
2026-07-14cs.CV

On the Real-World Generalisability of Optical Flow Models

Petter Reijalt, Sander Gielisse, Rickard Karlsson, Jan van Gemert

2026-07-14生成模型强化学习

这篇论文关注光流模型在真实视频中的泛化,因为现有训练与评测长期依赖合成数据或窄域基准,难以反映机器人等真实场景需求。作者构建含 TAP-Flow、Slow Flow 与新 FlowFactor 的 8204 对真实帧评测集,并用四类因素隔离分析失效模式。结果显示,Sintel、KITTI、Spring 对真实精度预测较弱,光照与大位移最相关,单纯扩大合成训练数据也未必缩小泛化差距。

Not All Color Categories Are Equally Stable: A Multilingual Free Color Naming Experiment Figure 1
2026-07-14cs.CV

Not All Color Categories Are Equally Stable: A Multilingual Free Color Naming Experiment

Nuray Toganas, Adilet Yerkin, Elnara Kadyrgali, Muragul Muratbekova, Aron Karatayev, Pakizar Shamoi

2026-07-14视觉感知

这篇论文关注连续颜色刺激如何被不同语言使用者压缩成离散颜色名,动机在于解释颜色类别边界为何有的稳定、有的易漂移。作者用 COLIBRI 中红、黄、绿的 18 个色样做哈萨克语、俄语、英语自由命名实验,核心洞察是颜色类别的感知稳定性并不均等:绿色在外观变化下仍高度一致,黄色更常被命名为金色或棕色相关词,红色居中,说明部分颜色类别可能占据更宽的感知区域。

Annotation-Free Furniture Codes: What They Encode, and How Far They Transfer Figure 1
2026-07-14cs.CV

Annotation-Free Furniture Codes: What They Encode, and How Far They Transfer

Benjamin Friedman

2026-07-14视觉感知

本文针对室内场景生成依赖人工类别标签和规范朝向的问题,研究能否用无标注几何离散码替代二者。作者用FSQ点云自编码器学习单物体家具码,并通过探针显示其可恢复类别与偏航;改变Chamfer目标可让码在旋转敏感与旋转不变间切换。结果表明细类62.6%、大类85.6%、偏航误差52.7度,但跨ShapeNet迁移明显依赖类别,箱状家具较稳,沙发椅子等有机形状较差。

BOCCHI: A More Realistic and Challenging Benchmark for Local Motion Blur Detection with MSDCT-UNet Figure 1
2026-07-14cs.CV

BOCCHI: A More Realistic and Challenging Benchmark for Local Motion Blur Detection with MSDCT-UNet

Kuan-Lin Chen, Yuan-Kang Lee, Cheng-Yuan Chiang, Jian-Jiun Ding

Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan, MediaTek Inc., Hsinchu, Taiwan

2026-07-14视觉感知数据集/基准

这篇论文针对局部运动模糊检测中过往基准容易让模型学习“低梯度即模糊”捷径的问题,构建了633张真实拍摄、像素级标注的BOCCHI数据集,使平滑清晰区域与模糊区域梯度分布重叠;同时提出在UNet各阶段注入多尺度DCT先验的MSDCT-UNet。实验显示其在BOCCHI域内mIoU和边界定位领先,并且用BOCCHI训练的模型在跨数据集迁移上优于其他训练源。

SPORT: Structure-Aware Prototype Disentanglement for Incomplete Multi-View Clustering Figure 1
2026-07-14cs.CV

SPORT: Structure-Aware Prototype Disentanglement for Incomplete Multi-View Clustering

Yaoyuan Guo, Zhibin Gu, Songhe Feng, Yuhui Zheng, Bing Li

2026-07-14视觉感知

这篇论文针对不完整多视图聚类中原型过度对齐、实例级对比忽略簇结构、缺失视图补全过于依赖全局原型的问题,提出 SPORT:将原型解耦为共享与视图特有成分,只对齐共享语义,并结合结构感知对比学习与全局原型、局部邻域混合补全。六个基准数据集在不同缺失率下优于现有方法。

GNOCHI: Generative Neural mOdel for Close Human-Human Interactions Figure 1
2026-07-14cs.CV

GNOCHI: Generative Neural mOdel for Close Human-Human Interactions

Gonzalo Gómez-Nogales, Marc Comino-Trinidad, Andrés Casado-Elvira, Dan Casas

2026-07-14生成模型

GNOCHI面向虚拟场景中近距离双人交互难生成、易穿模且数据稀缺的问题,用条件VAE在给定一人SMPL姿态时生成另一人的反应姿态,并结合自动数据增强与基于体积代理的自监督碰撞损失。实验显示其可生成运动、舞蹈、打斗等多类更连贯且少碰撞的静态交互姿态,优于BUDDI;但动态过程、完整物理约束和语义合理性仍有限。

TVT-PAPD: Pathology-Aware Prototype Distillation for Self-Supervised Whole Slide Image Classification Figure 1
2026-07-14cs.CV

TVT-PAPD: Pathology-Aware Prototype Distillation for Self-Supervised Whole Slide Image Classification

Ramesh Naidu Laveti, Jaya Sreevalsan-Nair, T K Srikanth

E-Health Research Center, International Institute of Information Technology Bangalore, Karnataka 560100, India.

2026-07-14视觉感知

针对全切片病理图像自监督预训练常学到通用视觉特征、难以保留诊断相关形态模式的问题,TVT-PAPD在轻量Tiny ViT中加入可学习病理原型库,并通过师生原型分布蒸馏约束相似组织区域表征一致。其在TCGA LGG/GBM与IPD-Brain上分别取得93.02%和90.23%加权F1,并显示跨队列泛化与一定原型可解释性。

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding Figure 1
2026-07-14cs.CV

SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding

Abhigya Verma, Khyati Mahajan, Amit Kumar Saha, Shruthan Radhakrishna, Sagar Davasam, Vikas Yadav, Sai Rajeswar Mudumba

2026-07-14规划控制数据集/基准

现有文档 VQA/图表基准难以区分长度、布局、模态和题型等因素导致的失败。SynthDocBench 用全合成、多因素可控的长文档生成流程,覆盖多种版式、24类 D3 图表和跨页证据组合,并用隐藏结构化元数据保证答案可判定。七个前沿 VLM 的评测显示,模型随文档长度和推理深度明显退化,存在“中部最难”的位置敏感性,且长文档中的精确图表读取会显著崩溃。

Self-supervised Automatic Matting Figure 1
2026-07-14cs.CV

Self-supervised Automatic Matting

Xiaonan Hu, Zhiyuan Lu, Jingdong Zhao, Hao Lu

2026-07-14视觉感知

针对高质量 alpha matte 标注昂贵、粗标注仍需逐像素人工的问题,论文提出 SSMatte,仅用 RGB 图像训练自动抠图模型。核心是用冻结自监督 ViT 特征生成语义锚定提示,再以固定点式 alpha-RGB 一致性损失学习细节。实验称其超过弱监督方法,在人像基准接近全监督模型,并随无标注数据增加呈现更好泛化。

Vertical Fusion: Condensing Internal Representations for Robust ViT Classification Figure 1
2026-07-14cs.CV

Vertical Fusion: Condensing Internal Representations for Robust ViT Classification

Francesco Di Salvo, Shyam Nandan Rai, Hamed Damirchi, Ignacio Meza De la Jara, Sebastian Doerrich, Marco Lents, Christian Ledig

2026-07-14安全鲁棒

这篇论文针对 ViT 下游分类过度依赖最后一层、在分布偏移或困难样本上可能丢失有效信号的问题,提出“可恢复性”分析:中间层并非靠多样性互补,而是以冗余稳定的方式保留判别信息。作者据此设计 VFusion,将多层 CLS 表征映射并压缩为全局 token,在 16 个 ID 和 5 个 OOD 数据集上优于常见聚合基线,并弥合最佳单层到 oracle 精度差距的约 45%。

ABot-N1: Toward a General Visual Language Navigation Foundation Model Figure 1
2026-07-14cs.CV

ABot-N1: Toward a General Visual Language Navigation Foundation Model

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Zedong Chu, Xiaolong Wu, Mu Xu

2026-07-14机器人

论文针对通用视觉语言导航中端到端策略易坐标漂移、长尾语义处理弱且难解释的问题,提出 ABot-N1 的慢快双系统:慢速 VLM 生成 CoT 与像素目标,快速动作专家据此输出连续路点,把多类导航任务统一到像素锚点接口。实验称其在五个基准均达 SOTA,POI 到达率提升至 77.3%,室内/室外 point-goal 成功率达 95.4%/92.9%,但部分增益可能主要来自数据与后训练规模。

Robotic Contextual Awareness for Human-Robot Collaboration and Environmental Understanding Figure 1
2026-07-14cs.RO

Robotic Contextual Awareness for Human-Robot Collaboration and Environmental Understanding

Federico Rollo

2026-07-14机器人

面向机器人从结构化工厂走向制造、物流、医疗等人本动态环境时的安全协作难题,本文将上下文感知拆成个体识别跟踪与几何/语义环境理解两条线:通过个性化连续学习的 Re-ID 缓解目标人员长期跟踪中的遗忘问题,并以 LEO-SLAM、子地图回环检测和地面感知强度滤波提升建图与地点识别。实机实验显示其在特定人员协作、玻璃等反射场景下的地图质量和鲁棒性有所改善,但总体增益在不同模块间的归因仍需结合各实验细节判断。

Neural Motion Blending Across Arbitrary Character Topologies Figure 1
2026-07-14cs.CV

Neural Motion Blending Across Arbitrary Character Topologies

Luca Cazzola, Giulia Martinelli, Nicola Conci

2026-07-14视觉感知

这篇论文针对角色动画中不同骨架拓扑之间难以直接做动作混合的问题,提出将动作分解为共享语义码与骨架相关随机细节的扩散自编码框架,并用图式语义编码器把异构骨架映射到同一潜空间,再插值生成过渡动作。在 Truebones Zoo 上,方法能处理同骨架与跨骨架混合,并在无需显式关节对应的异构重定向中优于 Motion2Motion;但远距离语义过渡仍可能产生伪影。

Gradient-Skipping Relevance Propagation for Efficient Explainability of Vision Transformers Figure 1
2026-07-14cs.CV

Gradient-Skipping Relevance Propagation for Efficient Explainability of Vision Transformers

Christopher Buratti, Michele Marchetti, Federica Parlapiano, Davide Traini, Domenico Ursino, Luca Virgili

Polytechnic University of Marche, University of Modena and Reggio Emilia

2026-07-14视觉感知优化算法

本文针对 ViT 可解释性中注意力头被等权处理、残差连接被简化为恒等路径的问题,提出 GradSkip:用梯度流与 Gini 稀疏性自适应加权注意力头,并按因果贡献在注意力路径和残差路径间分配相关性。实验显示其在 ImageNet1K、BloodMNIST 和 ADE20K-150 上提升忠实性与定位表现,同时分类计算量仅 69.39 GFLOPs,较最佳既有方法少 14 倍以上。

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift Figure 1
2026-07-14cs.CV

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

Giang Nguyen, Raghav Mehta, Emma A.M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

College of Engineering and Computer Science, VinUniversity, Hanoi, Vietnam, Imperial College London, London, UK, Radiology Department, Vietnam National Cancer Hospital, Hanoi, Vietnam, VinUni-Illinois Smart Health Center, VinUniversity, Hanoi, Vietnam, The Computer Vision and Medical AI Lab, VinUniversity, Hanoi, Vietnam

2026-07-14数据集/基准安全鲁棒

本文针对乳腺钼靶基础模型在外部域偏移下可靠性不明的问题,构建覆盖15个公开数据集、3类临床任务的统一OOD基准,并用冻结骨干线性探针评估15种模型。结果显示,Mammo-FM、MaMA等乳腺专用视觉语言模型总体最强,但单纯乳腺预训练并不保证泛化,DINOv3仍是强基线,且不同数据集间表现差异明显。

GRC-ProbNet: Uncertainty-aware Feature Extraction for Cardiovascular Disease Classification Figure 1
2026-07-14cs.CV

GRC-ProbNet: Uncertainty-aware Feature Extraction for Cardiovascular Disease Classification

Yash Shah, Omar Todd, Philipp Seeböck, Georg Langs, Ben Glocker, Raghav Mehta

Imperial College London, UK, Medical University of Vienna, Austria

2026-07-14安全鲁棒

针对心脏 CT 疾病分类中确定性分割难以表达解剖歧义的问题,本文在 GRC-Net 上引入深度集成产生多种分割不确定性,并将熵、KL 散度等按结构编码后与放射组学、几何特征一起用于分类。关键洞察是最能预测分割误差的不确定性不一定最利于诊断;在 MM-WHS 和 ASOCA 上 AUROC 从 91.25% 提升到 92.92%,但增益仍需更大队列验证。

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving Figure 1
2026-07-14cs.RO

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving

Kang Ding, Zhigui Lin, Hongsong Wang, Jie Gui, Qi Liu, Zhe Wang, Luqi Tang, Lei He

2026-07-14规划控制

本文针对端到端自动驾驶规划中交互、道路几何和导航意图被混合到同一表示空间、削弱专项推理与可解释性的问题,提出 PrismAD:按语义划分场景 token,并用交互、几何、意图三个独立规划专家及语义路由器分别融合运动预测和自车规划结果。在 nuScenes、NeuroNCAP 和 Turning-nuScenes 上,相比强基线提升开环精度、闭环安全性和转弯场景鲁棒性。

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection Figure 1
2026-07-14cs.CV

Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection

Qi Lu, Ziqi Zhou, Yufei Song, Zijing Li, Lulu Xue, Minghui Li, Shengshan Hu, Leo Yu Zhang

School of Cyber Science and Engineering, Huazhong University of Science and Technology, College of Computer Science, Chongqing University, School of Software and engineering, Huazhong University of Science and Technology, School of Software Engineering, Huazhong University of Science and Technology, School of Information and Communication Technology, Griffith University

2026-07-14视觉语言视觉感知

这篇论文针对社交图片被视觉语言模型通过文本查询推断年龄、地点等隐私的问题,提出 CloakDiff:用扩散式对抗编辑扰动像素嵌入与潜在交叉注意力,同时以可逆网络嵌入原图以便无损恢复,并用保持自注意力与 EDM-Heuristic Sampling 控制画质。实验称其在多数据集和多种 VLM 上具备跨模型、跨提示的隐私干扰效果,同时保持较高视觉质量和可逆性。

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis Figure 1
2026-07-14cs.CV

Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis

Shihao Yuan, Yuanze Li, Ruyi Zhang, Ming Liu, Wangmeng Zuo

2026-07-14视觉感知

这篇论文针对大多模态模型依赖RGB训练、遇到红外/深度等未见视觉模态时泛化不足的问题,提出VVM-Tuning:把不同模态视为同一物理世界的不同采样,用RGB合成外观变化图像并加入模态上下文,分离场景语义与模态外观映射。作者还构建VVM-Bench,覆盖6种真实与合成模态;在5个基座模型上,无需目标模态训练即可带来感知任务约8.2%、理解任务约3.8%的平均提升。

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing Figure 1
2026-07-14cs.CV

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

Jianghan University, University of Science and Technology of China, Southeast University, Zhejiang University

2026-07-14数据集/基准

ChartSync关注图表像素级编辑中“改数值必须同步改几何”的难题,指出现有文本/图表编辑基准多停留在局部文字替换或代码编辑,缺少对级联视觉逻辑的直接诊断。论文构建870组三元样本、覆盖9类图表,并用程序化渲染保证真值的文本-几何耦合,结合客观指标和VLM评审评估。实验显示,多数开源模型在几何同步上明显失效,只有少数前沿闭源模型初具能力,但仍有语义隔离和背景破坏问题。

Structured Evidence Selection for Weakly Supervised Video Anomaly Detection Figure 1
2026-07-14cs.CV

Structured Evidence Selection for Weakly Supervised Video Anomaly Detection

Chenglizhao Chen, Tianxiang Nan, Wen Li, Xinyu Liu, Guisheng Zhang, Mengke Song, Xiaomin Yu

China University of Petroleum (East China), The Hong Kong University of Science and Technology (Guangzhou), China University of Petroleum (East China) Qingdao China, The Hong Kong University of Science and Technology (Guangzhou) Guangzhou China

2026-07-14视觉感知

本文针对弱监督视频异常检测中只有视频级标签、场景外观与动作异常易纠缠的问题,提出 SESAD,将异常判断改为对片段级视觉证据的结构化选择:先构造多视角语义证据,再用场景和动作查询抑制场景偏置,并以正常/异常双原型的几何关系做判别。在 UBnormal、ShanghaiTech、UCF-Crime 上分别达到 67.92、97.99、88.46 AUC,显示其稳定性与效率优势。

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation Figure 1
2026-07-14cs.CV

InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation

Yichen Peng, Jyun-Ting Song, Chen-Chieh Liao, Kris Kitani, Hideki Koike, Erwin Wu

2026-07-14视觉语言数据集/基准

人宠交互建模受限于缺少同步、多模态且含双方3D运动的数据,难以学习跨物种的时序响应。InterPet4D用12视角、第一视角和音频采集23人与13只狗的6.8M帧,并提出基于MotionGPT、PetVAE和模态感知注意力的InterPetMoGen生成狗的3D反应;实验中FID为11.21,优于Seq2Seq和DiT基线,但增益可能主要来自数据规模与标注完整性。

Geometry-aware Gaussian Prior and Axial Attention for Cervical Cytology Image Classification Figure 1
2026-07-14cs.CV

Geometry-aware Gaussian Prior and Axial Attention for Cervical Cytology Image Classification

Yating Li, Cheng Ye, Nenan Lyu, Weidong Chen, Zhendong Mao

School of Cyber Science and Technology, University of Science and Technology of China, Hefei 230026, China, School of Information Science and Technology, University of Science and Technology of China, Hefei 230026, China

2026-07-14视觉感知三维

面向宫颈癌筛查中细胞形态差异细微、类别相似且现有 CNN/注意力模型缺少结构约束的问题,论文用 CLIP 语义特征驱动几何感知高斯专家,生成横纵轴先验并嵌入轴向自注意力,以强化核排列和细胞空间组织建模。在 Mendeley 液基细胞学与 SIPaKMeD 数据集上分别达到 99.48% 和 96.08% 准确率,并通过可视化显示先验更关注诊断相关区域。

What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks Figure 1
2026-07-14cs.CV

What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

Guanhua Ye, Niu Jingbin, Yan Li, Meiyu Liang, Zhe Xue, Yingxia Shao, Yawen Li

Beijing University of Posts and Telecommunications, Beijing University of Posts and Telecommunications Beijing China

2026-07-14视觉语言数据集/基准

这篇论文关注短答案 VQA 分数到底是在衡量语义正确性,还是衡量答案是否符合评测器偏好的表面格式。作者提出“答案契约”视角,用人工验证的语义裁判审计六个模型、六个基准中的官方错误,发现文本密集任务中最高约一半错误其实语义可接受,且抽取式、多片段答案比数值答案更不稳定;温和改写提示也会造成 6–23% 的题目判定翻转,说明官方分数需配合语义审计和答案类型诊断解读。

Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset Figure 1
2026-07-14cs.CV

Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset

Zhiyan Zhang, Peipei Song, Jinpeng Hu, Jingyang Jia, Xun Yang, Xiaojun Chang

2026-07-14视觉感知数据集/基准

本文针对视频情感分析常被简化为整段静态分类、难以刻画观众情绪随事件连续变化的问题,提出 DAR 基准,将任务拆为情感转折分割、27类细粒度情绪识别和基于视觉证据的因果解释。其核心价值在于把情绪理解从角色表情识别推进到观众中心的动态推理,并提供事件对齐标注与推理链。实验显示,现有通用和情感专用 MLLM 在时间边界与因果一致性上均不足,DAR-R1 通过 SFT 加 GRPO 在 mIoU、情绪准确率和人工评分上取得最佳结果,但增益可能主要来自数据与任务定制训练。

CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding Figure 1
2026-07-14cs.CV

CoSAG: Compact Semantic Anchor Gaussians via Training-Free Rate-Distortion Coding

Yuang Jia, Jinlong Wang, Junhong Lin, Ruiting Dai, Wei Gao

2026-07-14三维

CoSAG针对开放词汇3D Gaussian语义场中逐高斯存储CLIP特征导致场景动辄GB级、难以部署的问题,将构建与存储解耦:用闭式透射率加权提升和空间语义锚点免训练构建语义绑定,再把逐高斯锚点绑定视为率失真编码问题进行空间预测熵编码。实验称其在LERF、3D-OVS、Replica等2D渲染、3D选择和密集LSeg协议上达到或超过现有方法,并把存储压到亚MB级,相比LangSplatV2缩小37至76倍。

PhenoEmbed: Self-Supervised Multispectral UAV Time-Series Embeddings for Individual Tree Crown Phenology Figure 1
2026-07-14cs.CV

PhenoEmbed: Self-Supervised Multispectral UAV Time-Series Embeddings for Individual Tree Crown Phenology

Taimur Khan

Helmholtz Centre for Environmental Research - UFZ

2026-07-14视觉感知

论文针对单木树冠在季节变化中光谱、纹理和边界显著漂移,导致单时相监测模型脆弱的问题,提出 PhenoEmbed:以分割树冠多边形为时间锚点,从18期无人机多光谱序列中自监督学习每棵树的256维物候表征,结合对比学习与掩码重建。结果显示嵌入空间具有较紧凑的近邻结构,PCA前两维解释25.1%方差、top-1余弦相似度中位数0.946,优于手工时序特征和均值池化基线;但是否提升下游分割仍文中未充分说明。

ScratNet: A Swin-Based Multi-Scale Dilated Network with Precision Refinement for Semiconductor Scratch Segmentation Figure 1
2026-07-14cs.CV

ScratNet: A Swin-Based Multi-Scale Dilated Network with Precision Refinement for Semiconductor Scratch Segmentation

Sachin Ranjan, Hoon Kim

2026-07-14视觉感知

这篇论文面向半导体制造中低对比、形态细长且尺度变化大的表面划痕分割问题,提出 ScratNet:以改造的 Swin Transformer 为骨干,结合多尺度空洞聚合、低层细节回注和各向异性卷积边界精修,以同时保留全局上下文和细粒度边缘。实验称其在半导体划痕数据集上优于现有方法,尤其改善细薄、不规则缺陷的像素级分割,但具体增益来源需结合完整消融进一步判断。

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning Figure 1
2026-07-14cs.LG

PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning

Wenyuan Wang, Lianyu Hu, Hao Wang, Yang Liu

2026-07-14视觉感知

这篇论文针对视频语言模型在物体永久性、接触、支撑和因果动态等物理合理性判断上容易受“常见世界”先验误导的问题,提出无需微调的 PhysMRV:把训练视频组织成场景描述、物理事件图和规则线索构成的层级记忆库,并在推理时按物理结构检索相似先例来辅助验证。实验显示其在 ImplausiBench、IntPhys2 和 GRASP Level 2 上相较直接提示整体提升,但不同骨干收益不均,校准缺口仍未完全解决。

BiLoG-Net: A Bi-Context Location-Guided Network for Breast Mass Segmentation and Malignancy Classification in Mammography Figure 1
2026-07-14cs.CV

BiLoG-Net: A Bi-Context Location-Guided Network for Breast Mass Segmentation and Malignancy Classification in Mammography

Abu Fatema Mohammad Abdun Noor, Md Imam Ahasan, Md Samiul Ahasan, Kah Ong Michael Goh, S M Hasan Mahmud, Raihana Zannat

2026-07-14视觉感知

针对乳腺钼靶中肿块边界模糊、密度差异小导致分割与良恶性判断易相互误差传播的问题,BiLoG-Net将像素级分割和图像级分类做成端到端多任务框架,用双上下文位置引导、全局/局部增强和分割引导注意力联合建模病灶位置与边界细节。在CBIS-DDSM和INBreast上分别报告Dice 94.20%/93.10%、准确率95.20%/93.60%、AUC 97.10%/96.00%,但增益来源是否来自结构设计而非训练设置或数据处理,文中仍需更充分说明。

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation Figure 1
2026-07-14cs.CV

EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation

Dexiang Hong, Yijie Guo, Weidong Chen, Xinyan Liu, Zixuan Zou, Zhendong Mao, Yongdong Zhang

University of Science and Technology of China, Harbin Institute of Technology, WeiHai, University of Science and Technology of China HeFei, China, Harbin Institute of Technology, WeiHai WeiHai, China

2026-07-14视觉感知

这篇论文针对情感艺术图像生成中测试阶段缺少细粒度情感与视觉属性的问题,提出 EmoStyle:先由 LLM 从提示词推断效价-唤醒、主导情绪、疗愈标签和画幅,再用 AdaLN 将情感向量注入去噪网络,并为不同艺术风格训练 LoRA 专家,最后用 VLM 对候选图按内容、风格、情感和质量重排。实验显示该框架提升 EmoArt 验证集的对齐与质量,并在 AffectiveArt Challenge 2026 Track 1 获第一名。

REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation Figure 1
2026-07-14cs.CV

REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation

Li Guo, Anas M. Tahir, Z. Jane Wang

2026-07-14强化学习

这篇论文针对胸片报告生成中强化学习训练不稳定、固定 KL 约束限制探索且静态参考策略逐渐失效的问题,提出 REVA-PO:按响应质量和参考策略熵动态调节 KL 权重,并周期性回退到验证集最佳策略以重置正则压力。方法还结合预训练 LVLM、分类器引导 SFT 与 RL。MIMIC-CXR 和 IU-Xray 上报告 BLEU-4 分别提升 5.1% 和 3.6%,CheXpert F1、RadGraph F1 也有提升,但奖励主要依赖 BLEU-4,临床增益来源仍需谨慎解读。

FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion Figure 1
2026-07-14cs.CV

FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion

Yuang Meng, Chenyang Wu, Xianshun Liu, Chun-Le Guo, Zichen Liang, Lina Lei, Jie Liang, Hui Zeng, Chongyi Li, Lei Zhang

2026-07-14生成模型

FlowPainter针对扩散式光流需从噪声重建整幅稠密光流、在简单区域计算负担大且训练不稳的问题,提出先用轻量置信网络估计粗光流和像素置信度,再把高置信区域作为软修复先验并用衰减残差引导扩散细化。文中在Sintel、KITTI和Spring上报告了较强精度和更高收敛效率,尤其在困难划分上有增益。

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues Figure 1
2026-07-14cs.CV

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues

Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang

University of Science and Technology of China, Hefei University of Technology, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Anhui University, United Arab Emirates University

2026-07-14视觉感知

本文针对凝视目标估计中多分支方法标注负担重、简化模型又易受低层显著性误导的问题,提出用 LVLM 生成场景文本线索,将凝视推断显式转为语义意图引导的跨模态融合。TextGaze 结合冻结视觉编码器、层级文本监督和 Transformer 融合头,同时预测热图与视野内外状态;在四个主流数据集上取得有竞争力表现,并在无额外微调的跨数据集测试中显示较强泛化。

WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding Figure 1
2026-07-14cs.CV

WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding

Xianzhi Ma, Shujun Wang, Xiaohan Li, Hao Liu, Changhua Pei, Jianhui li

School of Frontier Sciences, Nanjing University, Computer Network Information Center, Chinese Academy of Sciences, School of Frontier Sciences, Nanjing University Suzhou China, Computer Network Information Center, Chinese Academy of Sciences Beijing China

2026-07-14视觉感知

超高分辨率遥感图像要求模型同时保留全局布局和稀疏局部细节,而单纯升分辨率或多轮裁剪易带来细节丢失、延迟和空间关系断裂。WeaveEarth的核心洞察是“组织证据”比扩大视觉访问更关键:先在全局约束下选取低冗余的最小支持证据集,再把局部证据、空间元数据和拓扑关系编成统一推理界面。实验显示其在多个UHR遥感基准和冻结VLM骨干上稳定优于强基线,优势主要来自证据选择与结构化组织。

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence Figure 1
2026-07-14cs.CV

DynaFilter: Cloud-driven Dynamic Filtering for Satellite Edge Intelligence

Ziyang Zhang, Jie Liu, Luca Mottola

Harbin Institute of Technology, Harbin Institute of Technology Shenzhen, China

2026-07-14视觉感知

DynaFilter面向卫星边缘智能中带宽极低、连接间歇且云端查询会变化的问题,避免边缘端完整解压、推理或上传全部压缩数据。其核心是把云端语义查询映射到JPEG的DC/AC特征和视频运动向量,在压缩域筛选RoI。实验显示图像解码与推理数据量降低1.6至7.1倍,视频节省92.0%带宽,能耗下降43.1%至88.6%,推理延迟提升1.6至3.0倍。

LFD: Enabling Real-World Lensless Face Recognition with a Large-Scale Dataset Figure 1
2026-07-14cs.CV

LFD: Enabling Real-World Lensless Face Recognition with a Large-Scale Dataset

Junho Kim, Salman S. Khan, Sara Wan, Tomi Kuye, Ashok Veeraraghavan

J. Kim, S.S. Khan, S. Wan, T. Kuye, A. Veeraraghavan are with the Department of Electrical and Computer Engineering, Rice University, Houston, TX, 77005.

2026-07-14视觉感知强化学习数据集/基准

本文针对无透镜相机在人脸识别中体积小、成本低但真实数据和伪影建模不足的问题,构建 LFD 数据集,覆盖 21080 组无透镜原始测量、重建图像和标准图像,并包含室内外、多光照、多距离及三类设备。实验表明,基于该数据训练的识别模型能学习跨掩膜和跨原型共享特征,提升真实无透镜人脸识别的可评测性与泛化分析,但具体性能增益来源可能主要来自 scaling / data。

EMBRACE: A Multi-task Framework for Comprehensive Quality Assessment in Cleavage-stage Embryo Figure 1
2026-07-14cs.CV

EMBRACE: A Multi-task Framework for Comprehensive Quality Assessment in Cleavage-stage Embryo

Anwar Hussain Sofi, Jung-Hua Wang, Ming-Jer Chen, Tsung-Hsien Lee, Yu-Chiao Yi, Ming-Kuan Lin, Yi-Chung Lai

a International Master Program in Applied Artificial Intelligence, National Taiwan Ocean University, Keelung, 202301, Taiwan, b AI Research Center, National Taiwan Ocean University, Keelung 20224, Taiwan, d Department of Obstetrics and Gynecology, Lee Women's Hospital, Taichung 40652, Taiwan, e Department of Obstetrics and Gynecology, Chung Shan Medical University Hospital, Taichung 40201, Taiwan, f Department of Obstetrics and Gynecology, Taichung Veterans General Hospital, Taichung 407219, Taiwan, Embryo assessment remains a central decision point in In Vitro Fertilization (IVF), where laboratory, biological, laboratory, and patient-specific factors, morphology-based assessment remains clinically, [13]. However, many existing AI approaches remain centered on image-level classification or single-

2026-07-14视觉感知

该文针对卵裂期胚胎评估中碎片、发育阶段和卵裂球对称性需联合判断且人工标注易受主观影响的问题,提出 EMBRACE 多任务框架,用共享 ResNet-50、多尺度特征融合、分割解码器和分类头同时输出碎片掩码、t2/t4 阶段与对称性等级。在 9137 张图像上,测试集碎片分割 Dice 为 0.781、IoU 为 0.677,阶段分类准确率 0.995,对称性分级 macro-F1 为 0.907;但外部和前瞻验证仍未完成。

CVKD-UDA: Cross-View Knowledge Distillation for 3D Unsupervised Domain Adaptive Segmentation Figure 1
2026-07-14cs.CV

CVKD-UDA: Cross-View Knowledge Distillation for 3D Unsupervised Domain Adaptive Segmentation

Zhimin Yuan, Ming Cheng, Shangshu Yu, Wen Li, Dunqiang Liu, Xin Huang, Cheng Wang

2026-07-14视觉感知三维

这篇论文针对3D点云无监督域适应分割中自训练依赖高质量预热模型的问题,指出体素大小会同时影响跨域相似性与几何判别性。CVKD-UDA通过标准视图和压缩视图进行跨视图知识蒸馏,并用D-Adapter、辅助分类器和熵正则减轻压缩视图带来的细节损失。实验显示该预热策略在两个3D UDA基准上能稳定提升后续自训练效果,并优于对抗式预热方法。

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation Figure 1
2026-07-14cs.CV

Label-Free Target-Domain Adaptation for Unconstrained Event-Image Feature Matching via Dual-Stage Distillation

Zhonghua Yi, Hao Shi, Qi Jiang, Yufan Zhang, Kailun Yang, Kaiwei Wang

Zhejiang University, 2 Hunan University, 3 National University of Defense Technology, 4 Ant Group

2026-07-14视觉感知

这篇论文针对事件相机与普通图像在真实多传感器系统中缺少匹配标注、相机又不严格对齐的问题,提出先用大规模数据做无标签蒸馏预训练,再用极线几何置信度筛选可靠匹配进行自蒸馏的两阶段方法。其核心价值在于把适配从对齐硬件和人工标签中解耦;在 MVSEC 与新构建的 TUM-VIE 跨模态位姿评估上达到 SOTA,自蒸馏相对零样本模型最高带来 21.9% 和 16.6% 提升。

FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness Figure 1
2026-07-14cs.CV

FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness

Shunsuke Yokokawa, Hironori Kasahara

2026-07-14视觉感知

FlashBEV针对自动驾驶BEV感知中Sampling-VT在高分辨率、长距离和多高度采样下内存/延迟随中间张量急剧膨胀的问题,指出其本质是可独立累加的gather-reduction,并以融合的IO-aware GPU执行替代张量化实现,在保持算子输出精确等价的同时消除高度/相机中间张量。实验报告峰值显存降低超过一个数量级,结论中给出37倍内存下降和5.2倍前向加速。

Error Aware Distribution Prediction for Lightweight Implicit Neural Representations Figure 1
2026-07-14cs.LG

Error Aware Distribution Prediction for Lightweight Implicit Neural Representations

Zhimin Li, Jake D. Balla, Joshua A. Levine

Vanderbilt University, University of Arizona

2026-07-14视觉感知

这篇论文针对隐式神经表示在压缩科学体数据时难以定位局部重建误差的问题,提出将连续值回归离散成分类预测,用输出分布的方差等不确定性指标刻画误差,而不依赖高开销集成或高斯假设。实验显示分类式 INR 通常保持较高 PSNR,并在部分数据上比异方差、证据回归更贴近真实误差场,但误差感知优势与数据特性相关,机理文中未充分说明。

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning Figure 1
2026-07-14cs.CV

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

Imperial College London, Tsinghua University

2026-07-14视觉语言

这篇论文针对统一多模态模型在推理中频繁自生成图像步骤的问题:这些视觉中间结果并非总有帮助,约三成可能误导后续推理且带来高开销。核心洞察是利用早期扩散过程中的“生成意图”和“视觉忠实度”信号,在图像生成完成前判断是否应中止。提出的 AdaViG 无需训练、可插拔,在多个基准上最高提升 5.7% 准确率,同时减少 25.0%–91.0% 视觉生成 FLOPs 和 15.4%–45.6% 延迟。

UniPose9D: Universal Category-Agnostic Object Pose Estimation Figure 1
2026-07-14cs.CV

UniPose9D: Universal Category-Agnostic Object Pose Estimation

Yang You, Yi Du, Cole Harrison, Leonidas Guibas

Stanford University

2026-07-14三维

UniPose9D针对现有6D/9D姿态方法依赖类别标签、CAD模型、均值形状或参考视图、难以迁移到新物体的问题,提出单一类别无关模型,从带掩码的RGB-D或RGB加预测深度中估计旋转、平移和真实尺寸。核心做法是用点对采样结合DINOv2与PointNet预测NOCS对应,并通过自适应N-hop Kabsch-Umeyama和flow matching处理尺度与对称歧义。六个数据集实验显示其可匹配或超过专用方法,并能泛化到未见类别和野外场景;但增益可能部分来自多数据集训练与基础特征scaling。

Banshee: Target Switch Attacks on Gimbal-Stabilized Visual Tracking Systems via Acoustic Injection Figure 1
2026-07-14cs.CV

Banshee: Target Switch Attacks on Gimbal-Stabilized Visual Tracking Systems via Acoustic Injection

Jiarui Li, Joseph Brewington, Qingzhao Zhang, Z. Morley Mao

2026-07-14视觉感知

本文关注云台稳定视觉跟踪在无人机跟随中的跨域脆弱性:已有声学攻击多停留在传感器扰动,未说明对真实跟踪任务的影响。Banshee通过离线刻画声波到云台运动的黑盒映射,并在线优化声学波形,诱导带方向偏置的视角漂移,使跟踪器切换目标或丢失目标。实验在两类商用云台和五种跟踪器仿真中达到93.6%攻击成功率,真实台架与飞行黑盒测试总体成功率为95.5%。

Do Transformer Temporal Heads and Post-Pooling Motion Gates Help CorrNet-based CSLR? An Empirical Study Figure 1
2026-07-14cs.CV

Do Transformer Temporal Heads and Post-Pooling Motion Gates Help CorrNet-based CSLR? An Empirical Study

Lisi Wang, Zhidong Xiao, Jianjun Peng

2026-07-14视觉感知

论文以 CorrNet 连续手语识别为基线,检验两个看似自然的增强是否仍有价值:用 Transformer 替代 BiLSTM 时序头,以及在时序池化后用 MotionGate 注入运动差分。核心洞察是 CorrNet 已在视觉编码阶段吸收帧间相关性,后续显式运动补偿可能冗余。PHOENIX-2014 实验显示两者均未降低 WER,MotionGate 还退化为弱的近恒等残差,额外开销缺乏收益。

Bridging the Catalog-to-Real Gap: Scalable Product Recognition via Multi-Stage Contrastive Learning Figure 1
2026-07-14cs.CV

Bridging the Catalog-to-Real Gap: Scalable Product Recognition via Multi-Stage Contrastive Learning

Anyi Zhang, Joy Mazumder, Kiril Lomakin

2026-07-14视觉感知

面向零售场景中海量 SKU、包装频繁变化和店内图像噪声带来的识别瓶颈,论文将商品识别改写为店内裁剪图到目录图的跨域嵌入检索。核心是 Cat2Real 多阶段对比学习,用商品级和图像级相似度进行难负样本挖掘与正样本选择,微调 DINO 系列骨干。内部评测中 Cat2Real-DINOv3-384 达到 Top-1 80.73%、Top-5 94.70%,显著高于通用 DINO 和商业嵌入基线,并展示对未见商品和类别的零样本泛化。

ShapKO: Shapley-Adaptive Modality Knockout for Robust Multimodal Learning Figure 1
2026-07-14cs.CV

ShapKO: Shapley-Adaptive Modality Knockout for Robust Multimodal Learning

Nusrat Binta Nizam, Fengbei Liu, Sunwoo Kwak, Minh Nguyen, Ruining Deng, Mert R. Sabuncu

2026-07-14视觉语言安全鲁棒

临床多模态模型在检查缺失或某一模态过强时容易退化,ShapKO的核心思路是用验证集上各模态子集的Shapley边际贡献动态调整训练期 knockout 概率,更频繁屏蔽主导模态以逼迫模型学习互补信息。三类医学任务中,该方法在缺模态推理下通常优于固定 knockout、OGM-GE 和常规训练,同时保持全模态性能,并提供可解释的屏蔽率轨迹。

A Dual-Stream Challenge-Response Protocol for Ocular Liveness Verification Figure 1
2026-07-14cs.CV

A Dual-Stream Challenge-Response Protocol for Ocular Liveness Verification

Ismail Kably

2026-07-14视觉感知

针对虹膜/眼部识别中视频回放和实时深伪可分别伪造单一凝视或瞳孔反射的问题,论文提出空间轨迹与亮度同步随机变化的双流挑战响应协议,用同步矩阵联合评估平滑追踪和瞳孔收缩的生物延迟耦合。结果主要来自基于文献延迟分布的蒙特卡洛仿真,显示真体与回放、机械及存在渲染延迟的深伪在理论上可分离,多轮挑战可降低深伪通过率;但尚缺人体实验验证。

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data Figure 1
2026-07-14cs.CV

Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data

Valentin Gabeff, Baptiste Maquignaz, Jennifer Shan, Sepideh Mamooler, Gencer Sumbul, Blair Costelloe, Devis Tuia, Alexander Mathis

2026-07-14视觉感知

针对相机陷阱视频人工检索和细粒度行为标注成本高、现有视频语言模型缺乏生态场景时空理解的问题,论文构建了首个面向该数据的文本到视频检索基准 Prompting-MammAlps,并用动作定位模型生成结构化描述,再由受限函数库约束的 LLM 代码代理解析查询以提升可解释性、降低幻觉。该方法在135个查询和775个测试视频上取得34% set-based F1,高于最佳零样本 VLM 的18%,但瓶颈主要仍在视觉感知质量。

Neural Posterior Estimation for Inferring Weak Lensing Shear Figure 1
2026-07-14astro-ph.IM

Neural Posterior Estimation for Inferring Weak Lensing Shear

Tim White, Dingrui Tao, Camille Avestruz, Jeffrey Regier, the LSST Dark Energy Science Collaboration

Department of Statistics, University of Michigan, Department of Physics, University of Michigan

2026-07-14视觉感知

弱引力透镜剪切估计受星系混叠、PSF变化、噪声和探测器伪影影响,传统多阶段校准难以统一传播不确定性。本文用神经后验估计将检测、去混叠、测量和校准合并为从模拟多波段图像到剪切后验的一次摊销推断。在LSST式常剪切模拟中,模型在逐步加入复杂观测效应后仍给出较准确且校准良好的两分量后验,但有效性依赖模拟器与真实数据分布足够一致。

Exploring Agentic Workflows for Generating High Quality Math Visual Aids Figure 1
2026-07-14cs.AI

Exploring Agentic Workflows for Generating High Quality Math Visual Aids

Rizwaan Malik, Ashna Khetan, Isabel Sieh, Samin Khan

Stanford Graduate School of Education, Department of Computer Science

2026-07-14生成模型

本文针对 K-12 数学图示生成中 LLM 即使有详细描述仍常出错的问题,提出由 LLM 生成质量检查问题、VLM 按问题审查图像并反馈再生成的 agentic 工作流。探索性实验显示该闭环可提升图示可靠性与教学适配性,但失败主要来自 QA 覆盖不全、空间关系和计数判断薄弱,增益幅度与稳定性文中未充分说明。

Reliability-Aware Ensemble Classification Under Class Imbalance: A Calibration Study on Liquid-Based Cervical Cytology Figure 1
2026-07-14cs.CV

Reliability-Aware Ensemble Classification Under Class Imbalance: A Calibration Study on Liquid-Based Cervical Cytology

Nisreen Albzour, Sarah S. Lam

School of Systems Science and Industrial Engineering, Binghamton University, Binghamton, NY 13902, USA, taxonomy into a binary Normal-versus-Abnormal task to reconcile it with a differently-labeled training, of cervical cytology benchmarks: DCCL provides a substantially larger Bethesda-labeled resource, Coskun et al. combine three public repositories with a proprietary multi-center whole-slide cohort to study, scanner-induced domain shift in cell-level LBC classification, harmonizing labels into four Bethesda

2026-07-14视觉感知

这篇论文针对液基宫颈细胞学数据在真实场景中样本少、类别不均衡且模型置信度未必可靠的问题,保留四分类 Bethesda 标签,在 Mendeley LBC 上比较轻量模型与软投票集成,并用独立校准集做温度缩放。结果显示,校准显著改善 ECE、Brier 分数和 NLL,但几乎不改变准确率、宏 F1 和 AUROC;集成规模相较最佳单模型没有稳定可靠性增益,错误主要集中在 HSIL 与 SCC 之间,结论受数据集规模较小限制。

Does YOLO26 Truly Offer Advantages Over Its Predecessors for Edge Deployment? A Benchmark Study in Aquaculture Figure 1
2026-07-14cs.CV

Does YOLO26 Truly Offer Advantages Over Its Predecessors for Edge Deployment? A Benchmark Study in Aquaculture

Rakesh Ranjan, Gajanan S. Kothawade, Kata Sharrer, Scott Tsukuda, Christopher Good

The Conservation Fund Freshwater Institute, Shepherdstown, WV, 25443, architectural generation on final mortality detection accuracy when sufficient training data are available., training data availability, target hardware, and inference requirements collectively inform model selection, accessible only through costly, labor-intensive manual observations.

2026-07-14数据集/基准

这篇论文针对水产养殖中鱼类死亡检测的边缘部署需求,系统比较 YOLO26 与 YOLOv5u、YOLOv8、YOLO11 在不同模型尺度、数据量和硬件上的表现。核心洞察是新架构并不必然带来综合优势:全量数据下各模型 mAP50 仅差 1.04 个百分点,YOLOv8 数据效率最好,400 张训练图即可达 90% mAP50;但在 Raspberry Pi 5 上 YOLO26n 推理最快,达 7.51 FPS,说明选型应由数据规模和部署硬件共同决定。

A Strong Balanced-Softmax Classifier-Retraining Baseline for Long-Tailed Recognition Figure 1
2026-07-14cs.LG

A Strong Balanced-Softmax Classifier-Retraining Baseline for Long-Tailed Recognition

Juan Terven, Diana Margarita Córdova Esparza, Julio Alejandro Romero Gonzalez, Edgar Arturo Chávez Urbiola, Francisco Javier Willars Rodriguez, Juan Bautista Hurtado Ramos, Alfonso Ramirez Pedraza

2026-07-14视觉感知

这篇论文关注长尾视觉识别中头部类别挤压尾部类别的问题,检验在 Balanced Softmax 已训练好表征后,仅重训分类器还能带来多少收益。核心洞察是两阶段 BS-cRT 无需额外原型或合成样本,就能稳定提升少样本类别表现;在 CIFAR、ImageNet-LT、Places-LT 上 Few-shot 准确率均有提升。同时,CBRM 边界探针的负结果表明,合成边界监督若受头部负类牵引,可能削弱尾类恢复。

Slide-Level Active Learning Reduces Annotation Burden in H&E images Figure 1
2026-07-14eess.IV

Slide-Level Active Learning Reduces Annotation Burden in H&E images

Mahsa Vali, Zhilong Weng, Noémie Moreaua, Yuri Tolkach, Katarzyna Bozek

2026-07-14视觉感知

针对全切片病理分割依赖昂贵像素级标注的问题,论文将主动学习从补丁选择推进到患者/切片级流程,提出 SHAL:只在前景组织估计不确定性,随学习阶段融合熵与 MC dropout 认知不确定性,并对少数诊断相关类别加权。TCGA 结直肠癌实验中,SHAL 用 50/190 张切片即达到 Dice≥0.80,满预算 Macro Dice 为 0.846,且在五个外部队列上取得最高平均外部 Macro Dice FG 0.815 和较小泛化差距。

Tracking Intermittent Particles with Self-Learned Visual Features Figure 1
2026-07-14eess.IV

Tracking Intermittent Particles with Self-Learned Visual Features

Raphael Reme (IP Paris, BIA, IDS, IMAGES), Victor Piriou (BIA), Alison Hanson, Rafael Yuste, Alasdair Newson (IP Paris, Elsa Angelini (IP Paris, Jean-Christophe Olivo-Marin (BIA), Thibault Lagache (BIA)

‡ Department of Biological Sciences, Columbia University, New-York, U.S.A., ratio (SNR). Therefore, elaborate tracking algorithms have been de-, that does not require human labeling, but only manual definition of

2026-07-14视觉感知

这篇论文针对荧光时序成像中粒子因遮挡、低信噪比或间歇发光而产生断裂轨迹的问题,提出用自监督 CNN 从粒子图像块学习可区分视觉特征,并与带运动校正的位置代价融合,通过全局距离最小化缝合 tracklet。实验在 Hydra 神经元序列上显示,该方法保持较高缝合精度,并将既有算法错误约减半。

Robustness and Stability Analysis of Differentiable Shift-Variant FBP for Cone-Beam CT under Challenging Acquisition Settings Figure 1
2026-07-14eess.IV

Robustness and Stability Analysis of Differentiable Shift-Variant FBP for Cone-Beam CT under Challenging Acquisition Settings

Chengze Ye, Linda-Sophie Schneider, Yipeng Sun, Mareike Thies, Siyuan Mei, Paula Andrea Pérez-Toro, Siming Bayer, Andreas Maier

2026-07-14安全鲁棒

针对机器人 C 臂 CBCT 中非圆形、稀疏和多中心轨迹带来的重建不稳定与计算开销问题,论文系统评估可微 shift-variant FBP,而非提出新架构。核心洞察是重建质量对轨迹顺序和连续性不敏感,更受采样点空间分布影响;在中等稀疏视角下该方法质量接近迭代重建且计算快一个数量级,但严重欠采样时因缺少迭代数据一致性会明显退化,并可无改动适配 Lissajous-saddle 多等中心轨迹。

TDSal: Task-Based Top-Down Saliency Prediction Model Figure 1
2026-07-14cs.CV

TDSal: Task-Based Top-Down Saliency Prediction Model

Can Mizrakli, Tolga K. Capin

2026-07-14视觉感知

这篇论文针对传统显著性模型多按自由观看预测、难以反映任务目标改变注视的问题,提出 TDSal:用 YOLOv5su 提取空间特征,Sentence-BERT 编码自然语言任务,再通过浅层 Transformer 融合生成任务条件显著图。实验用七类指标和可视化对比 TGSal、SalClassNet,显示显式任务语义有助于目标导向注视对齐;但具体优势幅度和增益来源在给定文本中未充分说明。

Towards Objective Dysgraphia Detection: A Multi-Branch Deep Learning Approach for Online Handwriting Analysis Figure 1
2026-07-14cs.CV

Towards Objective Dysgraphia Detection: A Multi-Branch Deep Learning Approach for Online Handwriting Analysis

Lydia Ouhib (LIASD), Yassine Ouzar (LIASD), Zoé Pinseel, Stéphane Bouilland, Mehdi Ammi (LIASD)

LIASD Laboratory, University of Paris 8, Saint-Denis, France, Centre Jacques Calv´e, Fondation Hopale, Berck, France, is prevalent among school-age children. It affects handwriting, rately and jointly using the publicly available DiaGraMo dataset, Motor coordination disorder affects about 5–6% of school-, new publicly available DiaGraMo dataset., is currently the only publicly available dataset that provides, copying. All available tasks per participant were retained and

2026-07-14视觉感知

该文针对儿童书写障碍诊断依赖临床观察、主观且耗时的问题,利用数位板在线书写轨迹捕捉运动学信息。核心做法是把手工运动特征、MOMENT时序嵌入与GAF/CWT图像表征多分支融合,在DiaGraMo公开数据集上比较单模态与融合方案;结果显示GAF、MOMENT和手工运动特征的组合优于各单一表示及其他融合方式。

Memory-Conditioned Tool Calling for Camera-First Visual Agents Figure 1
2026-07-14cs.CV

Memory-Conditioned Tool Calling for Camera-First Visual Agents

Xiaofan Wu, Xi Zeng, Miaoxia Chen, Peishan Chen, Shuyan Li, Jiyun Yao, Hanyong Zhong, Jiahao Zhu (Chance AI)

2026-07-14视觉感知

这篇论文关注纯拍照输入时,视觉代理即使识别出物体,也难以知道该替用户查什么。作者提出把个人视觉记忆分为画像、短期关注和观察三层,并在每轮条件化 LLM 的工具选择与参数生成,另设计冲突感知写回。800 张图的合成记忆消融显示,去掉完整记忆后工具查询相关性从 4.21 降至 3.74,端到端效用从 0.842 降至 0.760;但实验未验证真实多会话写回,增益主要限于固定合成记忆条件。

Performance Benchmarking and Optimisation of Clustering Algorithms for Local and Non-Local Similarity Measure in Medical Image Analysis Figure 1
2026-07-14eess.IV

Performance Benchmarking and Optimisation of Clustering Algorithms for Local and Non-Local Similarity Measure in Medical Image Analysis

Sisipho Hamlomo, Marcellin Atemkeng

2026-07-14视觉感知数据集/基准

本文针对医学图像压缩中全局低秩近似易丢失局部诊断细节的问题,系统比较五种用于非局部相似 patch 分组的聚类算法,并用随机搜索调参。结果显示,k-means 与二分 k-means整体指标较高但簇内方差偏大;MRI和超声更适合凝聚层次聚类,X光中 mini-batch k-means在质量与紧凑性间更均衡,BIRCH表现较弱。

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging Figure 1
2026-07-14cs.RO

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

2026-07-14视觉语言视觉感知

针对现有 VLA 将动作生成简化为自回归下一 token 预测、难以显式建模长时序动作结构的问题,TS-Mask VLA 将连续动作离散为时间×维度的二维 token 网格,并用带 Bridge Attention 的离散扩散动作专家承接 VLM 多层条件信息,通过时空二维遮蔽学习跨时间依赖和动作维度耦合。实验中,0.5B 模型在 LIBERO 达到 95.7% 平均成功率,在 CALVIN 获得 4.19 平均序列长度,并优于多种更大 VLA 基线。

RASR: Range-Aware Scale Recovery for Metric UAV Navigation Figure 1
2026-07-14cs.RO

RASR: Range-Aware Scale Recovery for Metric UAV Navigation

Hongtao Liang, Xinyu Shao, Chenxu Wang, Yiyao Wan, Jiahuan Ji, Fangwei Ye, Fuhui Zhou, Qihui Wu

College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics, China, Shenzhen International Graduate School, Tsinghua University, China, 3 Noah Ark Lab, Huawei, China, College of Automation Engineering, Nanjing University of Aeronautics and Astronautics, China, College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics, China, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics, China Nanjing and Shenzhen China

2026-07-14机器人

本文面向 GNSS 受限下无人机最后一段导航中“图像对到可执行距离/航向命令”的尺度不准问题。RASR 的核心是把冻结 MASt3R 式双目几何压缩为描述子,先做全局尺度恢复,再用按距离分桶的残差校准和命令网格对齐处理 PairUAV 的相对误差偏置。结果显示全局校准去除主要距离误差,分桶修正进一步提升官方在线分数至 0.003189。

CHM-Net: Center Heatmap-driven Macro-Micro Modeling Network for MRI-based Microbial Density Stratification Figure 1
2026-07-14eess.IV

CHM-Net: Center Heatmap-driven Macro-Micro Modeling Network for MRI-based Microbial Density Stratification

Jiaming Liang, Haolin Chen, Tingting Li, Bowen Yu, Qianyan Long, Tinghe Zhang, Xi Zhong, Xiaowei Hu, Xiaoqi Sheng, Hongmin Cai

School of Computer Science and Engineering, South China University of Technology, School of Future Technology, Department of Medical Imaging, Affiliated Cancer Hospital, Guangzhou Medical University

2026-07-14视觉感知

这篇论文瞄准术前无创评估肿瘤微生物密度的问题,将多模态 MRI 微生物密度分层定义为患者级分类任务。CHM-Net 的关键思路是用中心热图定位小病灶/弱响应区域,再以 ROI 微观特征和全局宏观语义做 MIL 融合,缓解证据细微且分散的问题。在新建 GBNPC 2026 数据集上,相比最强基线取得 12.06% ACC 绝对提升,并在两个 3D 医学分类数据集上做了辅助验证。

Detangled: A Framework for Creating, Editing, and Inferencing Feature Rich Hair Strands Figure 1
2026-07-14cs.CV

Detangled: A Framework for Creating, Editing, and Inferencing Feature Rich Hair Strands

Sarah Jobalia, Yitong Deng, Carolyn Smith, Ronald Fedkiw

Stanford University, Stanford University Stanford California USA

2026-07-14视觉感知

本文针对数字角色中卷发、非洲质感头发难以建模和编辑的问题,将“发丝纹理”与整体发型方向解耦,提出五维纹理参数、中心线/规范纹理空间和受参数标注网络监督的扩散生成流程。实验展示其可在保持原有发型引导线的同时进行纹理迁移、按参数或少量参考发丝生成多类头发,但量化对比和增益来源文中未充分说明。

Calibrated Hybrid CNN-Transformer for Retinal OCT Classification Figure 1
2026-07-14eess.IV

Calibrated Hybrid CNN-Transformer for Retinal OCT Classification

Animesh Kumar

2026-07-14视觉感知

针对OCT筛查中“高准确但置信度不可信”的临床风险,论文将EfficientNetV2与Transformer特征编码结合XGBoost分类头,并加入温度校准、Mahalanobis OOD拒识和MC Dropout不确定性标记。其在Kermany四分类OCT上达到95.43%±0.27%准确率,校准误差降至ECE 0.0024,少数类drusen F1为0.84,但跨设备泛化仍未验证。

A Unified Model for Highly Accurate ECG-Free Dynamic Coronary Roadmapping Using Spatio-Temporal Transformers Figure 1
2026-07-14eess.IV

A Unified Model for Highly Accurate ECG-Free Dynamic Coronary Roadmapping Using Spatio-Temporal Transformers

Saahil Islam, Sebastian Piat, Venkatesh N. Murthy, Serkan Cimen, Puneet Sharma, Andreas Maier, Florin C. Ghesu

2026-07-14视觉感知

这篇论文面向 PCI 中动态冠脉路线图对造影剂、辐射和 ECG 同步的依赖,提出一个统一的时空 Transformer 框架,同时做心动相位匹配与导管尖端跟踪。核心做法是利用 1600 万帧预训练编码器,并用 ECG R 峰检测和伪导管尖端标签作辅助任务,再通过多数投票提升时序稳健性。临床 X 线数据评估显示其相位错配和导管跟踪误差较低,达到实时 DRM 所需精度。

MVMGNN;Multi-View Masked Graph Neural Network for Alzheimer's Disease Diagnosis using Structural MRI Figure 1
2026-07-14cs.CV

MVMGNN;Multi-View Masked Graph Neural Network for Alzheimer's Disease Diagnosis using Structural MRI

Ni Yao, Zhenxu Wang, Danyang Sun, Chuang Han, Yanting Li, Jiaofen Nan, Fubao Zhu, Chen Zhao, Weihua Zhou

School of Computer Science and Technology, Zhengzhou University of Light Industry, Zhengzhou, Department of Computer Science, Kennesaw State University Marietta, GA, USA, Department of Applied Computing, Michigan Technological University, Houghton, MI, USA, Center for Biocomputing and Digital Health, Institute of Computing and Cybersystems, and Health, Research Institute, Michigan Technological University, Houghton, MI, USA, Mailing address: School of Computer Science and Technology, Zhengzhou University of Light, implementation is publicly available at https://github.com/chenzhao2023/MVMGNN_AD

2026-07-14视觉感知

针对结构 MRI 阿尔茨海默病诊断中单一脑图难以同时表达解剖邻近与形态相似、且多视图易引入冗余特征和噪声连接的问题,论文提出 MVMGNN:以脑区放射组学特征为节点,构建空间邻近和特征相似两类图,并用节点-边联合掩码与患者级门控融合选择有效信息。ADNI 实验显示其在 AD 分类上优于多种基线,解释性分析还能定位相关脑区,但具体增益来源仍需结合消融细节判断。

Adversarially Guided Diffusion for LiDAR Range Image Synthesis Figure 1
2026-07-14cs.CV

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

2026-07-14视觉感知生成模型

面向自动驾驶中 LiDAR 语义分割易被攻击且错误会传导到规划的问题,论文把攻击从固定输入的范数约束扰动转向 2D range image 上的无约束生成:在潜扩散反向采样中注入逐像素分割损失梯度,使生成样本保持 LiDAR 场景结构同时诱导分割错误。SemanticKITTI 上对 RangeNet++ 与 CENet 的实验显示,攻击强度可调、具备跨架构迁移性,并相较 FGSM、SegPGD 呈现不同的真实性与攻击效果权衡。

Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models Figure 1
2026-07-14cs.CV

Lifelong Representations: A Survey on Continual Self-Supervised Learning for Vision Models

Sergi Masip, Alicja Dobrzeniecka, Jonathan Swinnen, Joachim Collin, Bartłomiej Twardowski, Szymon Łukasik, Tinne Tuytelaars

2026-07-14视觉感知

面向机器人等长期部署场景,论文指出视觉模型需要在无标注数据流中持续适应而不遗忘旧知识。其贡献是系统梳理持续自监督学习的评测协议、遗忘机理与方法 taxonomy,强调自监督目标因任务无关表征和更平滑损失面而更抗遗忘。主要结论是现有研究仍偏小规模,蒸馏、回放、正则、架构扩展、模型合并和目标改造各有稳定性-可塑性取舍,扩展到基础模型级持续预训练仍文中未充分解决。

Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion Figure 1
2026-07-14cs.CV

Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion

Yongseong Park, Joeun Kim, HoEun Kim, Young-Sik Kim

Department of EECS, Department of AI, Department of EECS, Department of AI

2026-07-14生成模型规划控制

本文针对真实图像扩散反演中重建质量、计算与缓存成本难以兼顾的问题,指出有效反演依赖“轨迹绑定”的前向噪声锚点与训练好的 score prior,而非单纯代数恒等;同时发现全维 int8 逐元素压缩比低维子空间摘要更可靠。基于此提出无需训练的 NARC,只存单个噪声锚并按噪声水平混合校正,在 PIE-Bench++/SD1.5 上较 PnP DirectInv 提升 3.24 dB PSNR,缓存约少 400 倍,并在 SDXL 上显示可迁移性。

Towards Real-World Wearable Motion Reconstruction Figure 1
2026-07-14cs.CV

Towards Real-World Wearable Motion Reconstruction

Andrea Boscolo Camiletto, Rishabh Dabral, Eduardo Alvarado, Thabo Beeler, Marc Habermann, Christian Theobalt

2026-07-14强化学习三维

本文针对真实场景中用户只佩戴部分消费级设备、固定传感器配置难以泛化的问题,构建了同步手机、手表、智能鞋垫与VR头显及3D真值的大规模多模态数据集,并提出可从任意传感器子集重建全身运动的WHIP生成模型。实验系统比较了模态互补性,显示HMD单设备表现强,鞋垫与手表等组合能带来更稳健、物理上更合理的重建,但低延迟端侧部署仍未充分说明。

A Generalized Deep Non-negative Matrix Factorization Approach for SAR Automatic Target Recognition Figure 1
2026-07-14cs.CV

A Generalized Deep Non-negative Matrix Factorization Approach for SAR Automatic Target Recognition

Yunhong Zhang, Changjie Cao, Zhongli Zhou, Bingli Liu, Zongjie Cao, Zongyong Cui, Ying Yang

2026-07-14视觉感知

针对SAR自动目标识别中CNN特征不透明、传统DNMF逐层分解易陷入局部最优并累积误差的问题,论文提出G-DNMF,从全局优化角度用拉格朗日乘子推导联合更新规则,并指出编码矩阵型和混合矩阵型DNMF都是其特例。实验在MSTAR和OpenSARship上展示了可解释的加性多层特征与重建效果,识别稳定性和性能优于既有DNMF变体。

Time Imprint: Learning Time-Aware Representations in Multi-Modal Knowledge Graphs Figure 1
2026-07-14cs.CV

Time Imprint: Learning Time-Aware Representations in Multi-Modal Knowledge Graphs

Pengyu Zhang, Klim Zaporojets, Congfeng Cao, Jia-Hong Huang, Paul Groth

University of Amsterdam, Aarhus University, University of Amsterdam Amsterdam The Netherlands, Aarhus University Aarhus Denmark

2026-07-14视觉感知

针对多模态知识图谱中图像和文本相似实体难以区分的问题,Time Imprint 将时间从三元组条件提升为实体级模态,通过时间-文本-图像三视角对比学习对齐稀疏时间语义,并用时间戳子集选择与注意力池化缓解多时间戳噪声。三项基准显示其链路预测 Hits@1 最高提升 6.07%,在最易混淆 1% 样本上提升最高 58%。

Low-Power License Plate Detection and Recognition on a RISC-V Multi-Core MCU-Based Vision System Figure 1
2026-07-14cs.CV

Low-Power License Plate Detection and Recognition on a RISC-V Multi-Core MCU-Based Vision System

Lorenzo Lamberti, Manuele Rusci, Marco Fariselli, Francesco Paci, Luca Benini

2026-07-14视觉感知

针对车牌识别通常依赖高功耗嵌入式平台、难以作为电池供电常开传感器的问题,论文将车牌检测与字符识别拆成 SSDlite-MobileNetV2 和 LPRNet 两级,并围绕 GAP8 多核 RISC-V MCU 的内存、算力和能耗约束做压缩与部署优化。系统在公开数据上检测 mAP 为 38.9%、识别率超过 99.13%,实测可识别极小车牌裁剪,在 117 mW 下达到 1.09 FPS,较 Raspberry Pi3 方案能效提升 73 倍。

Knowledge-Constrained Shape Optimization with a Mixture-of-Experts Neural Operator for High-Confidence Design Figure 1
2026-07-14cs.CV

Knowledge-Constrained Shape Optimization with a Mixture-of-Experts Neural Operator for High-Confidence Design

Wenhao Fan, Yuanwei Bin, Jianghan Gu, Wenfa Luo, Jiao Xiang, Yuntian Chen, Shiyi Chen

School of Ocean and Civil Engineering, Shanghai Jiao Tong University, Shanghai 200240, China, Eastern Institute of Technology, Ningbo, Ningbo 315200, Zhejiang, China, TenFong Technology Co., Ltd., Shenzhen 518000, Guangdong, China, IM Motors Technology Co., Ltd., Shanghai 201210, China

2026-07-14优化算法

本文针对工业形状优化中工程约束依赖人工设定、代理模型在异构几何和分布外搜索中不可靠的问题,提出将知识约束转成DFFD可编辑区域与变形边界,并用MoE神经算子结合Mahalanobis不确定性触发CFD补样。车身气动实验中MAPE降至1.16%,趋势预测达94.34%,CFD验证阻力降低约4%至10%。

ReflectWorld-MM: An Entity-Oriented Multi-Media Memory System for Open-Ended Video Streams Figure 1
2026-07-14cs.CV

ReflectWorld-MM: An Entity-Oriented Multi-Media Memory System for Open-Ended Video Streams

Xiaokang Ma, Yifan Sun, Zhihong Jin, Jie Gu, Yudong Luo, Shenyi Shao, Chu Tang, Jingmin Chen, Li Pu

2026-07-14视觉感知强化学习

面向持续视频流中的机器人/助手记忆问题,本文指出按帧或上下文缓存组织的长视频记忆难以追踪反复出现的实体。ReflectWorld-MM 将感知前端、实体解析、多尺度情景记忆、可演化语义记忆和程序记忆结合为外部服务,使过去经验参与当前感知。实验在六个长视频与终身记忆基准上均取得最高准确率,实体相关任务增益更明显,但绝对表现仍未解决 M3-bench。

RSLoRA: Training-free Rank Allocation for LoRA via Representational Sensitivity Probing Figure 1
2026-07-14cs.CV

RSLoRA: Training-free Rank Allocation for LoRA via Representational Sensitivity Probing

Jiaqi Liu, Haidong Kang, Qihui Zhao, Guo Yu

School of Computer Science and Technology, Dalian University of Technology, Hebei Key Laboratory of Marine Perception Network and Data Processing, Northeastern University, School of Computer and Communication Engineering, Institute of Intelligent Manufacturing, Nanjing Tech University

2026-07-14视觉感知

针对 LoRA 统一 rank 分配忽视层间功能差异、动态分配又训练开销高的问题,RSLoRA 用结构化低秩噪声做前向“虚拟适配”,以 Effective Rank 和 Fréchet Distance 衡量表示流形位移,从而把更高 rank 分给敏感模块。论文报告其在主流基准上优于 AdaLoRA、GoRA 等,且无需反向梯度和迭代调整。

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization Figure 1
2026-07-14cs.CV

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

2026-07-14视觉感知

这篇论文针对宽场钙成像长期依赖单会话/单被试建模、难以跨动物复用的问题,提出 WiCAT:先将不同被试数据配准到 Allen 脑图谱,再用图谱对齐的时空 patch token、全局空间嵌入和 MAE 预训练学习共享表征。实验显示,该模型在多数据集迁移中优于若干基线,并可在未见被试上进行零样本连续行为解码和留出脑区重建。

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis Figure 1
2026-07-14cs.CV

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

2026-07-14生成模型

本文针对扩散模型在早期去噪中容易因内部特征波动产生伪影和幻觉的问题,提出从 U-Net h-space 与 Transformer 深层自注意力 latent 监测异常的 DUNE。核心洞察是伪影相关动态集中在早期深层低噪 latent,可用 EMA 检测并按骨干网络抑制,无需训练。实验称其在多种骨干上提升保真度、减少幻觉并保持语义一致,但阈值和抑制系数仍需少量调参。

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles Figure 1
2026-07-14cs.AI

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles

Joshua Kofi Asamoah, Blessing Agyei Kyem, Eugene Denteh, Armstrong Aboah

2026-07-14规划控制

面向自动驾驶规划中单车道变换预测难以刻画多车相互影响的问题,论文将局部交通场景建成动态交互图,用图注意力同时预测每辆车的变道意图和轨迹,并以意图引导解码和场景一致性约束减少不协调未来。在 NGSIM I-80、US-101 和 highD 上,DSiGAT 的意图准确率约 90%,轨迹 RMSE 相比最强基线最高降低 52.94%,碰撞率和联合位移误差也更低。

From ML Predictions to Informed Diagnostic Assistance Using the Toulmin Model of Argumentation Figure 1
2026-07-14cs.AI

From ML Predictions to Informed Diagnostic Assistance Using the Toulmin Model of Argumentation

Anca Marginean, Adrian Groza

Technical University of Cluj-Napoca, Romania

2026-07-14视觉感知

本文针对医学影像 ML 诊断只给结论、难以让临床专家审查的问题,将 OCT 视网膜诊断拆成 Toulmin 论证结构:YOLOE 提取生物标志物作证据,MedGemma 解释证据到诊断的依据,MedSigLip 检索相似病例作反驳。实验覆盖 AMD 判别与分期,结果表明该框架能暴露 PED 与 drusen 混淆等模型局限,但具体诊断性能增益文中未充分说明。

2026-07-13

77 篇
PanoWorld: Real-World Panoramic Generation Figure 1
2026-07-13cs.CV

PanoWorld: Real-World Panoramic Generation

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

Institute of Automation Chinese Academy, Tsinghua University, Wuhan University

2026-07-13强化学习

PanoWorld针对全景世界模型在长时序生成中易出现几何、光照和记忆错位的问题,利用ERP全景表示的旋转等变性,将旋转视作隐式几何变换、显式建模平移,并引入DPRC与GMA增强轨迹控制和长期一致性。作者还构建含真实无人机与仿真片段的World360基准,实验显示其在场景保持和结构一致性上显著优于对比方法。

Scalable Visual Pretraining for Language Intelligence Figure 1
2026-07-13cs.CV

Scalable Visual Pretraining for Language Intelligence

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

Scalable Visual Pretraining for Language, Shanghai Artificial Intelligence Laboratory, University of Science and Technology of China, Zhejiang University, Shanghai Jiao Tong University, Pretraining is a scalable learner for foundation model intelligence. To this end, we conduct a systematic study, outperforms text-only pretraining, offering an efficient pathway to scalable language intelligence., representational forms whose visual cues make certain relations directly available for inference [1, 2, 15, 38]., Scalable Visual Pretraining for Language Intelligence, strengthens cross-modal alignment, establishing VP as a scalable pathway for learning both language and visual, as an effective, efficient, and scalable alternative to text-only pretraining.

2026-07-13视觉感知

论文针对科学文档被转成纯文本后丢失图表、公式排版和页面结构的问题,提出直接在渲染页面视觉 patch 上做自回归 next-latent 预训练的 VP。作者在相同文档来源下对比文本预训练,显示 VP 在多种 Qwen、Llama 骨干和科学推理基准上稳定更优,并以约 25% token 预算取得超过 TP 的效果,同时改善跨模态对齐。

OpenLongTail: Generative Scaling of Long-Tail Driving Data Figure 1
2026-07-13cs.CV

OpenLongTail: Generative Scaling of Long-Tail Driving Data

Lulin Liu, Nuo Chen, Yan Wang, Bangya Liu, Wenyan Cong, Hezhen Hu, Boris Ivanovic, Hao Wang, Ziyao Zeng, Xinyu Gong, Yang Zhou, Zixiang Xiong, Dilin Wang, Zhangyang Wang, Weisong Shi, Ruohan Zhang, Marco Pavone, Zhiwen Fan

2026-07-13生成模型

OpenLongTail针对长尾自动驾驶事件稀缺且多来自单目/异构视频、难以直接训练VLA策略的问题,提出生成式数据引擎:先恢复尺度化自车轨迹,再用Plücker射线、时序深度warp和跨视角记忆合成目标相机阵列的缺失视角。实验显示,合成数据能提升AlpaSim闭环长尾鲁棒性,并改善视角一致性与轨迹恢复;但部分收益可能主要来自scaling / data。

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models Figure 1
2026-07-13cs.CV

Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models

Shravan Murlidaran, Miguel P. Eckstein

2026-07-13视觉语言视觉感知

论文针对传统 VLM 评测多依赖 MS-COCO 等简单场景、难以暴露复杂社会行为理解错误的问题,构建 CSB 数据集并按检测、识别、幻觉、场景理解和空间依赖五类错误追踪 2017-2025 年模型演进。结果显示,MLLM 在复杂场景描述上已接近高水平人类并缩小与简单场景的差距,多数错误显著减少,但空间依赖仍残留,具体增益可能主要来自 scaling / data。

Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks Figure 1
2026-07-13cs.CV

Revisiting Euler-Angle Regression with Kolmogorov-Arnold Networks

Yangting Sun, Zijun Cui, Yufei Zhang

Michigan State University

2026-07-13视觉感知

这篇论文针对机器人、人体等关节空间中欧拉角有明确范围约束、但直接回归易受周期不连续和万向节锁影响的问题,主张不再一味使用6D旋转表示,而是把范围感知的欧拉角建模与KAN结合,利用其边上可学习一元函数匹配有界角度下近似可加的回归结构。实验覆盖受控旋转、物体姿态、机器人和人体逆运动学,报告了精度、收敛和效率提升,但具体增益中架构与约束各自贡献仍需看消融细节。

The Effects of Synthetic Data and Label Distribution on Canola Branch Counting Figure 1
2026-07-13cs.CV

The Effects of Synthetic Data and Label Distribution on Canola Branch Counting

Amirsalar Darvishpour, Mikolaj Cieslak, Adam Runions

Department of Computer Science, University of Calgary

2026-07-13视觉感知

这篇论文针对植物表型中真实标注昂贵、合成数据又受域差距影响的问题,系统拆解油菜分枝计数中合成/真实比例与标签分布的作用。核心洞察是合成数据并非越多越好,标签分布匹配和适度平滑比单纯扩量更关键;1:5–1:22 的合成比例普遍优于仅用真实数据,最佳 1:7 将误差降 7.6%,而对真实标签分布做高斯平滑取得最低 abs. diff. 0.912,较基线提升 14.7%。

4DR360: State Reasoning for Joint 3D Detection and Occupancy Prediction in 4D Radar-Camera Full-Scene Perception Figure 1
2026-07-13cs.CV

4DR360: State Reasoning for Joint 3D Detection and Occupancy Prediction in 4D Radar-Camera Full-Scene Perception

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Songkai Wang, Siyuan Cao, Hui-liang Shen

2026-07-13视觉感知三维

该文针对4D毫米波雷达回波稀疏、现有雷达-相机方法偏重检测且占用预测与检测交互不足的问题,提出4DR360,将语义占用建模为可跨阶段传播的场景状态,并用SBE增强当前BEV、DTF利用多普勒信息保留时序证据。论文还为ManTruckScenes生成占用标签并与OmniHD-Scenes统一评测;结果宣称覆盖精度、鲁棒性、消融与效率,但具体增益幅度在给定文本中未充分说明。

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing Figure 1
2026-07-13cs.CV

Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing

Mohammad Dabaja, Turgay Celik

Both authors are affiliated with the Department of ICT

2026-07-13视觉感知

本文针对 SAM 3 在遥感俯视图像中是否能免训练泛化的问题,评估其在场景分类、检测和实例分割上的零样本/一样本能力。核心做法是把 presence head 改作零样本分类器,并通过五种文本、视觉提示配置诊断多模态解码器。结果显示视觉提示能较好对齐遥感几何,文本提示反而带入地面视角语义偏差;分割的调和均值较高但小目标分辨率和俯视语义盲区仍是主要瓶颈。

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation Figure 1
2026-07-13cs.CV

Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation

Mingyang Huang, Peng Zhang, Li Hu, Guangyuan Wang, Bang Zhang

2026-07-13视觉感知

该文针对音乐到舞蹈视频在超过十几秒后易漂移、身份不稳和动作重复的问题,提出将全曲级关键帧规划与局部时序细化分离的层级框架,并用时间映射 RoPE、自适应帧率、光流损失和运动速度控制强化节奏对齐与运动连续性。实验称可生成超过一分钟的 720p/30fps 舞蹈视频,并在五类舞种上保持较好稳定性与多样性;具体增益中 scaling / data 的作用文中未充分说明。

TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models Figure 1
2026-07-13cs.CV

TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models

Tianyou Jiang, Ziyu Zhou

2026-07-13视觉语言视觉感知

针对医学视觉语言模型在医院、设备和人群变化下零样本性能下降,以及极少样本微调不稳定的问题,TCLA用少量支持样本构建类别级、层自适应原型,并以闭式残差映射直接校正logit,无需训练参数。九个涵盖X光、超声、MRI、CT和病理的数据集上,它多数设置提升OOD平衡准确率,并常优于训练式适配方法。

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs Figure 1
2026-07-13cs.CV

The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs

Ahmed Oumar El-Shangiti, Abzal Nurgazy, Hilal AlQuabeh, Nikolai Rozanov, Kentaro Inui

DataBayt.AI Labs, Imperial College London

2026-07-13视觉语言

这篇论文关注VLM在基础计数上常答错的问题,动机不是再做行为评测,而是追问正确数量是否已存在于内部表示中。作者用多种探针分别读取真实计数、模型输出和错误风险,并用SVCCA与激活 steering 发现:正确计数常被编码,但与最终语言输出的读出方向错位。基于内部错误检测的选择性重提示无需更新参数,最高带来15.6个百分点计数准确率提升;但实验主要限于8B以内模型、两个VLM家族和1到9计数范围。

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts Figure 1
2026-07-13cs.CV

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

2026-07-13视觉语言视觉感知三维

现有病理基础模型常按视觉、视觉语言或整张切片任务各自训练,能力分散且难以覆盖完整临床场景。ALICE的核心做法是用多阶段聚合蒸馏,将8个不同尺度和模态的专家模型依次压入统一骨干,整合局部形态、语言语义和切片级上下文。在21类场景、96个任务、48个数据源上,其平均排名均优于任务匹配模型;但增益中数据规模与教师选择的贡献仍需更细拆分。

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference Figure 1
2026-07-13cs.CV

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, Tengjiao He

Department of Electrical and Systems Engineering, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, College of Information Science and Technology, Department of Electrical and Systems Engineering University of Pennsylvania Philadelphia PA USA, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences Shenzhen China, College of Information Science and Technology Jinan University Guangzhou China

2026-07-13视觉语言

本文关注具身机器人等边缘场景中 VLM 推理能耗被低估的问题,系统测量多模型、多分辨率和两类硬件后指出,能耗瓶颈主要不在视觉编码而在自回归解码。结果显示平均功率几乎是模型固有常数,输出 token 单位耗时比输入 token 高 11–39 倍,decode 占总能耗 86–97%;即使删光视觉 token,固定 token 模型最多省约 10%,而控制输出长度最高可省 97%。

DGSfM: Depth-Guided Scale-Aware Global Structure-from-Motion Figure 1
2026-07-13cs.CV

DGSfM: Depth-Guided Scale-Aware Global Structure-from-Motion

Sithu Aung, Viktor Kocur, Yaqing Ding, Torsten Sattler, Zuzana Kukelova

2026-07-13视觉感知

DGSfM针对全局SfM依赖尺度不确定的对极几何、易受错误视图边和弱基线影响的问题,将单目深度作为先验注入相对位姿、视图图/匹配过滤、全局尺度平均和相机点云初始化,而最终仍由多视图优化约束。实验在ETH3D和IMC2021上较COLMAP、GLOMAP及部分稠密SfM基线稳定提升位姿精度;但效果仍依赖单目深度质量,深度失准时的鲁棒性文中主要留作未来工作。

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility Figure 1
2026-07-13cs.CV

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari

University of Padova Fondazione Bruno Kessler (FBK)

2026-07-13强化学习

面向机器人定位与三维重建中稀疏视角、低重叠导致匹配和位姿估计失效的问题,论文探测冻结 VGGT 的层级表征,发现晚层尤其 L17 承担共可见性判别,并提出仅训练约 750 万参数的层级 MoE 头 Co-VGGT 从 RGB 预测共可见概率。其在 Co-VisiON 上较既有方法提升超过 25% pairwise、约 10% multiview,且校准良好,可作为 SfM/SLAM 可见图边权。

SigLIP-HD by Fine-to-Coarse Supervision Figure 1
2026-07-13cs.CV

SigLIP-HD by Fine-to-Coarse Supervision

Lihe Yang, Zhen Zhao, Hengshuang Zhao

The University of Hong Kong, Shanghai AI Laboratory

2026-07-13视觉感知

这篇论文针对 MLLM 依赖高分辨率输入提升细粒度感知却带来多次前向、更多视觉 token 和后处理成本的问题,提出 SigLIP-HD:用高分辨率或多尺度图像的细粒度特征监督中等分辨率图像的粗特征,在不改结构和推理预算的情况下微调 SigLIP 2。实验显示其在多类 MLLM 基准上优于基线,提升在 OCR、文档和图表相关任务上更明显。

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation Figure 1
2026-07-13cs.CV

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen

2026-07-13视觉感知

本文针对文本引导医学分割中语言融合模块与视觉/文本骨干强绑定、换骨干就需重设结构的问题,提出 BTHA:以形状保持的特征接口和 SAGSG 门控适配器注入文本语义,并用全局对齐、粗定位、边界细化的层级监督稳定训练。实验覆盖多种卷积/Transformer视觉骨干、不同语言编码器和四个公开数据集,显示其可复用并能在较小计算开销下提升强基线。

Foveation-Guided Dynamic Token Selection for Robust and Efficient Vision Transformers Figure 1
2026-07-13cs.CV

Foveation-Guided Dynamic Token Selection for Robust and Efficient Vision Transformers

Ibrahim Batuhan Akkaya, Kishaan Jeeveswaran, Bahram Zonooz, Elahe Arani

2026-07-13视觉感知安全鲁棒

这篇论文针对ViT计算开销高、在噪声和对抗扰动下鲁棒性不足的问题,借鉴人类视觉的中央凹采样与注视机制,提出FDT:在每个Transformer块内用多尺度foveation生成特征,并由fixation模块动态选择需处理的token,避免多次顺序注视推理。ImageNet100上,50%注视预算下较DeiT-S准确率从80.9%升至81.9%,MAC减少34.57%,并报告对抗、捷径和自然腐蚀鲁棒性提升;但文中也承认MAC下降不必然转化为实际延迟收益。

Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation Figure 1
2026-07-13cs.CV

Hydra++: Real-Time Hierarchical 3D Scene Graph Construction With Object-Level Shape Estimation

Hyungtae Lim, Nathan Hughes, Xihang Yu, Ruihan Xu, Yun Chang, Jingnan Shi, Rajat Talak, Luca Carlone

H. Lim, N. Hughes, X. Yu, R. Xu, Y. Chang, J. Shi, and L. Carlone are with the Laboratory for, Information & Decision Systems, Massachusetts Institute of Technology, Cambridge, MA, USA

2026-07-13三维

Hydra++针对现有3D场景图仅用点云、包围盒或类别模板粗略表示物体几何,难以支撑接触推理、模型化操作和室外大尺度重建的问题,将类别无关的物体形状估计器接入层级场景图,并用重投影掩码一致性检查过滤退化预测;其CRISP配置可在线运行,SAM3D用于分析泛化与延迟取舍。仿真和真实校园实验显示,该系统提升了物体级与场景级重建质量。

Robustifying Vision-Language Models via Test-Time Prompt Adaptation Figure 1
2026-07-13cs.CV

Robustifying Vision-Language Models via Test-Time Prompt Adaptation

Xingyu Zhu, Huanshen Wu, Shuo Wang, Beier Zhu, Jiannan Ge, Jiaheng Zhang, Long Chen

2026-07-13视觉语言视觉感知安全鲁棒

这篇论文针对 CLIP 等视觉语言模型在对抗扰动下零样本性能急剧下降的问题,指出现有测试时提示适配过度依赖单样本置信度,难以识别“高置信错误”。核心思路是利用增强视图中仍保留的语义分布结构,用最优传输对齐视觉增强分布与文本原型,并通过动态缓存在线积累可靠线索。实验显示 RITA 在多数据集、攻击和骨干上提升对抗鲁棒性,同时基本保持干净样本精度。

Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification Figure 1
2026-07-13cs.CV

Parameter-Efficient Vision-Language Adaptation with Continuous Metadata Conditioning for Animal Re-Identification

Anil Osman Tur, Tonje Knutsen Sordalen, Kim Tallaksen Halvorsen, Cigdem Beyan

2026-07-13视觉语言视觉感知

这篇论文针对长期动物重识别中个体外观随生长、季节和时间发生漂移的问题,提出在冻结 CLIP 基础上用 LoRA、可学习提示和跨模态对齐进行参数高效适配,并把年份、体长等连续元数据直接注入训练期提示表示,而非离散成文本标签。实验覆盖七年鱼类数据和多个野生动物基准,在闭集、开集和时间感知协议下均有提升,且推理时仍只需视觉特征。

Multimodal Scenario Similarity Search for Autonomous Driving Figure 1
2026-07-13cs.CV

Multimodal Scenario Similarity Search for Autonomous Driving

Tamás Matuszka, András Tamásy, Balázs Szolár

2026-07-13视觉语言

面向自动驾驶海量路测数据中相似场景难检索的问题,本文在统一流程中比较并融合视频外观表征与轨迹表征,提出基于周车运动显式匹配的 Exo-Trajectory 和对比学习的 ScenarioFormer。实验显示,轨迹方法更适合 cut-in、转弯、排队等运动事件,视觉嵌入依赖外观线索,两者融合取得最佳检索效果。

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition Figure 1
2026-07-13cs.CV

SVF-CR: Synchronized Visual-Facial Cross-Refinement for Multimodal Ambivalence and Hesitancy Recognition

Hyein Park, Namho Kim, Junhwa Kim

Dept. of AI Software Convergence, Konyang University, 2 Korean Broadcasting System (KBS)

2026-07-13视觉语言视觉感知

该文面向视频中犹豫与矛盾态度识别,动机是这类状态常由语言、语音、全局场景与局部面部的时序不一致共同体现,简单拼接模态不足。核心做法是将全视频与人脸片段按同一时间划分同步建模,用双向跨注意力先互相细化,再以一致性和差异特征构造视觉-面部证据,并在最终阶段与文本、音频成对融合。在 BAH 公共评测上 macro-F1 达 0.7156,消融显示同步视觉-面部证据和双向细化带来增益。

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation Figure 1
2026-07-13cs.CV

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation

Seungyong Lee, Hyun Jun Jang, Sangoh Kim, Sungjoon Park

2026-07-13视觉感知强化学习规划控制

现有虚拟试衣虽能保持真实感和服装细节,但难以控制衣物松紧、穿法和身体上的精确位置。CtrlVTON将试衣重构为图像编辑,并用分割掩码提供像素级布局控制;同时提出VIP-Seg/VIP-SAM,用参考服装图在真人图中定位同一实例。实验称VIP-SAM与CtrlVTON均达到SOTA,且CtrlVTON在遵循用户布局上明显优于强商业编辑模型,同时保持相近服装保真度。

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution Figure 1
2026-07-13cs.CV

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang

College of Electronic Science and Engineering, Jilin University, Changchun China

2026-07-13视觉感知

本文针对文本引导超分辨率依赖人工描述、易受错误语义先验影响的问题,提出 Simon-SR:先用冻结 CLIP 和对比提示学习从未标注图像中学习语义提示,再通过空间自适应仿射调制进行文本-图像融合。实验在 CUB、DIV2K、COCO2017 的多倍率设置下优于若干基线,最高提升 0.50 dB PSNR、0.0133 SSIM、0.0695 LPIPS,但代码尚未发布。

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition Figure 1
2026-07-13cs.CV

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition

Raza Yunus, Benjamin Ummenhofer, Jan Eric Lenssen, Eddy Ilg

2026-07-13视觉感知

这篇论文针对逆渲染中材质与光照容易相互混淆、影响重光照和增强现实的问题,提出利用刚体物体运动带来的多样表面-光照交互来增强约束,而非依赖多光源采集或强先验。方法将手持物体跟踪、NeuS/3D Gaussian重建与物理渲染式材质优化结合成4D逆渲染流程。合成实验显示,姿态变化越丰富,反照率与光照分解越准确;真实RGB手持视频上也展示了可行性,但手部遮挡和近场复杂光照仍未充分解决。

From Classification to Localization and Clinical Validation: Large-Scale Development of a Deep Learning System for Thoracic Disease Detection on Chest Radiographs in Thailand Figure 1
2026-07-13cs.CV

From Classification to Localization and Clinical Validation: Large-Scale Development of a Deep Learning System for Thoracic Disease Detection on Chest Radiographs in Thailand

Isarun Chamveha, Tretap Promwiset, Napat Wanchaitanawong, Trongtum Tongdee, Pairash Saiviroonporn, Warasinee Chaisangmongkon

Perceptra Co., Ltd., Bangkok, Thailand, Radiology Department, Faculty of Medicine Siriraj Hospital, Mahidol University, Bangkok, Thailand, Institute of Field Robotics, King Mongkut’s University of Technology Thonburi, Bangkok, Thailand

2026-07-13视觉感知

针对泰国及东南亚胸片阅片资源不足、外部模型跨人群泛化不稳的问题,论文构建 Inspectra CXR v5,将 DenseNet-121、ACM 与 PCAM 结合,在同一模型中输出多病种分类分数和弱监督病灶热图。模型以 87.5 万张本地胸片训练,在院内测试 AUROC 0.994、13 家医院外部集 AUROC 0.970,定位 LLF 77.9%,并在放射科医生可用性评估中取得较高一致性。

TextileNet: Towards Zero-shot Text-style Segmentation of Manuscripts Figure 1
2026-07-13cs.CV

TextileNet: Towards Zero-shot Text-style Segmentation of Manuscripts

Anguelos Nicolaou, Antonella Ambrosio, Desiree Di Donato, Georg Vogeler

2026-07-13视觉感知

论文针对历史手稿中标注稀缺、书写者集合开放和图像退化导致的落地困难,提出仅用合成数据训练的全卷积多任务 TextileNet,生成像素级纹理嵌入并零样本迁移到古文书分析;同时设计80题古文字视觉测验建立人类基线。结果显示该嵌入可用于亚词粒度的书写手与性别检索,但也表明从笔迹判断性别需谨慎,增益边界仍需更多实证说明。

Letter Lemmatization: One-to-one and Banded RNNs for Reversing Character-Set Simplification and Abbreviation in Medieval Text Figure 1
2026-07-13cs.CL

Letter Lemmatization: One-to-one and Banded RNNs for Reversing Character-Set Simplification and Abbreviation in Medieval Text

Anguelos Nicolaou, Maria Pia Tiseo, Tamas Kovacs, Nicolas Renet, Georg Vogeler

2026-07-13视觉感知

论文关注中世纪文献数字化中字符集过大、转写规范不一和缩写展开给 HTR 训练、检索与跨语料整合带来的困难。核心做法是把字符集简化映射作为可插拔层,提出 letter lemmatization 自动对齐字符集,并用一对一 RNN 自监督反推被简化的信息;对非一对一的缩写展开,则以 Banded RNN 建模插入删除。结果显示,一对一模型在仅 20 行文本下可恢复约一半 CER,并能改进 HTR 后校正;Banded RNN 可用于意大利中世纪契约缩写展开,但需更多数据且受带宽设定限制。

Rethinking Monocular Depth Embedding for Generalized Stereo Matching Figure 1
2026-07-13cs.CV

Rethinking Monocular Depth Embedding for Generalized Stereo Matching

Libo Lin, Shuangli Du, Minghua Zhao, Zhenzhen You, Shun Lv, Yiguang Liu

2026-07-13视觉感知

该文针对立体匹配在弱纹理、遮挡和跨域场景中易失效的问题,重新审视单目深度先验的用法:不做尺度硬对齐,而是以软约束方式将 Depth Anything V2 深度融合进特征提取,并用深度梯度引导 GRU 迭代,同时用边缘感知损失缓解增强带来的边界模糊。实验称在 KITTI、Middlebury、ETH3D、DrivingStereo 上取得零样本 SOTA,且模型约 11.23M 参数。

REMIND: RE-Identification with Memory for INDoor Navigation Figure 1
2026-07-13cs.CV

REMIND: RE-Identification with Memory for INDoor Navigation

Pablo Diaz-Pereda, Alejandro Rodriguez-Ramos, David Perez-Saura, Pascual Campoy

2026-07-13机器人

REMIND面向室内机器人重访场景中“物体长时间消失后再识别”的问题,指出传统MOT、Re-ID和VOS难以同时处理通用物体、长期记忆和全局身份一致性。方法用冻结DINOv3特征、双库多原型外观记忆、部件/背景描述和邻居上下文推理,再通过匈牙利匹配做联合分配,无需位姿或深度。在自建室内数据集上IDF1达90.35%,显著超过DAM4SAM和MASA;ScanNet++多数设置也取得最高IDF1。

Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval Figure 1
2026-07-13cs.CV

Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval

Junmyeong Lee, Chan Hur, ChangSu Choi, Sukmin Cho, Fitsum Gaim, Eui Jun Hwang, Hoyun Song, KyungTae Lim

School of Computing 1, Graduate School of Culture Technology 2, InnoCORE PRISM-AI Center 3, Korea Advanced Institute of Science and Technology 1 , 2 , 3, ETRI Medical Informatics Laboratory 4

2026-07-13视觉感知

这篇论文针对手语检索在细粒度场景下难以区分视觉相近手势的问题,指出瓶颈不在模型容量,而在对比学习中的难负样本分布与真实视觉混淆不匹配。作者提出 SAN,用手语嵌入空间中的视觉可混淆性而非文本语义相似性来挖掘难负样本。PHOENIX-2014T 实验显示其提升细粒度检索,同时基本保持粗粒度性能,但跨数据集泛化文中未充分说明。

AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration Figure 1
2026-07-13cs.CV

AnythingReality: Robust Online Gaussian Splatting SLAM for Open-Vocabulary VR Scene Exploration

Timofei Kozlov, Dmitrii Maliukov, Andrey Marchenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology, Moscow, Moscow, Russian Federation, NLP Research Center, Moscow, Russian Federation

2026-07-13三维安全鲁棒

针对在线三维重建依赖干净深度、外部位姿且交互性弱的问题,AnythingReality 将 ORB-SLAM3 位姿、Gaussian-plus-SDF 在线建图、WebXR/VR 串流和语音驱动 VLM 语义查询整合为闭环系统,并用深度置信度约束高斯生成以适应噪声 RGB-D。实验显示其在自采数据和 TUM-RGBD 上相较在线 3DGS 基线提升 PSNR/SSIM、降低 LPIPS,同时保持相近或更高帧率,VLM 物体识别率为 88%。

All you need is SAMPAT Figure 1
2026-07-13cs.LG

All you need is SAMPAT

Jayadeva, Madhur Aswani

Department of Electrical Engineering, Indian Institute of Technology, Delhi

2026-07-13视觉感知

论文针对深度模型在科学数据分析中难解释的问题,提出 SAMPAT:用对数、指数和多项式组合构成三层网络,使近似函数可写成紧凑代数表达式并可求导。作者声称其可逼近任意光滑函数,受限连接还能表示多项式、三角/有理函数和高斯混合;在合成与基准数据上表现有竞争力且表达更简单,但具体增益来源可能主要来自模型族选择与 scaling。

Glob3R: Global Structure-from-Motion with 3D Foundation Models Figure 1
2026-07-13cs.CV

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan

The Hong Kong University of Science and Technology, Tongyi Lab, Alibaba Group, Nanjing University, Fudan University

2026-07-13三维

Glob3R针对3D基础模型前馈重建在长序列和无序图集上精度不足、分块拼接易漂移的问题,将Pi3X预测的姿态、点图与置信度转化为可优化约束:通过轻量密集匹配头生成跨视图warp并提取可靠轨迹,再用关键帧滑窗关联、全局运动平均和BA统一优化。实验显示其在室内外、KITTI、ETH3D和新视角合成中提升姿态与几何精度,PSNR较前馈基线高2–3 dB,轨迹RMSE降低10%–50%。

Joint-Embedding Predictive Architecture for Solar PV Panel Fault Classification Figure 1
2026-07-13eess.IV

Joint-Embedding Predictive Architecture for Solar PV Panel Fault Classification

Seyyedhamid Azimidokht, Mehdi Monemi, Abdelhak Kharbouch, Farid Hamzehaghdam, Mehdi Rasti, Jamshid Aghaei, Emil Kurvinen

2026-07-13视觉感知

面向大规模光伏巡检中红外热像故障类别细微、样本不均衡且人工判读难扩展的问题,论文提出 JEFFNet,将 JEPA 自监督 ViT 语义表征与 EfficientNetV2-S 监督卷积特征融合。结果显示其在 PVF-10 十分类达到 94.33% 准确率、93.21 F1,在 ISM 十二分类 F1 为 72.60,并以约 47.2% 更少参数接近或超过强基线。

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation Figure 1
2026-07-13cs.CV

YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation

Jaekyun Ko, Byung Wan Lim, Soomin Lee, Dongjin Kim, Tae Hyun Kim

2026-07-13视觉感知强化学习

真实 sRGB 去噪受 ISP 非线性和成对干净/噪声数据采集成本限制,现有噪声建模常依赖干净图或相机元数据。YeTI 的核心思路是仅用同一场景两张噪声图训练,通过重建自编码器分离结构与噪声潜变量,再用一步条件扩散 Transformer 生成信号相关噪声。实验在 SIDD、SIDD+、MAI2021、SID 和 DND 上显示其合成噪声可提升下游真实去噪表现。

HiHR: Hierarchical Hyperbolic Representation for Aerial-Ground Person Re-Identification Figure 1
2026-07-13cs.CV

HiHR: Hierarchical Hyperbolic Representation for Aerial-Ground Person Re-Identification

Qiwei Yang, Pingping Zhang

2026-07-13视觉感知

该文针对航拍-地面行人重识别中直接跨视角对齐容易抹去视角特有线索的问题,提出 HiHR:先用视觉-文本编码器提取多粒度特征,再以文本引导融合,并在双曲空间构建粗到细层级,兼顾身份可分性、跨视角一致性和视角特异细节。四个 AG-ReID 基准实验显示其达到有竞争力或最优表现,但具体增益中各模块贡献仍需结合消融判断。

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models Figure 1
2026-07-13cs.CV

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang

2026-07-13强化学习

这篇论文针对动作条件世界模型依赖大量机器人动作标注、而潜动作模型又容易把背景和无关物体混入动作表示的问题,提出 CD-LAM:用具身中心重建、动作中心对比学习和潜空间校准来去除动作无关偏差,并通过三阶段微调连接到可执行机器人动作。实验显示其在 2B/14B 骨干上降低动作跟随误差、提升视觉保真和鲁棒性,14B 模型以少 12 倍以上的适配更新达到 DreamDojo 水平并在最终检查点超过它。

TSR-Ego: Temporally Guided Stereo Refinement Framework for Egocentric 3D Human Pose Estimation Figure 1
2026-07-13cs.CV

TSR-Ego: Temporally Guided Stereo Refinement Framework for Egocentric 3D Human Pose Estimation

Md Mushfiqur Azam, John Quarles, Kevin Desai

2026-07-13三维

TSR-Ego针对头戴双目鱼眼视角中遮挡、截断和单帧立体线索不可靠的问题,将因果时间信息提前注入稠密双目特征,并在单阶段解码器中结合时间自注意、关节自注意和投影引导的可变形双目交叉注意来细化3D关节查询。在UnrealEgo2和UnrealEgo-RW上取得优于既有方法的结果,真实序列增益更明显,但仍依赖同步标定双目输入,严重遮挡下远端关节仍困难。

What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks Figure 1
2026-07-13cs.CV

What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks

Magdalena Trędowicz, Łukasz Struski, Arkadiusz Lewicki, Karolina Pachota, Andrzej Grudzień, Mateusz Jagła, Jacek Tabor

Jagiellonian University, University of Information Technology, Medical College

2026-07-13视觉感知

针对梯度显著图只能衡量敏感性、难以回答“哪些像素足以维持模型行为”的问题,SEAMS将解释改写为保真优化:在冻结模型上学习紧凑软掩码,并用查询图像生成的三路合成替换被移除区域,无需外部干扰数据或架构专用规则。ViT、ConvNeXt和DINOv2实验显示其可通过更换保留目标生成类别、CLS和token级解释,掩码稳定且插入/删除指标有竞争力,但计算开销较高。

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing Figure 1
2026-07-13cs.CV

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

VCIP, CS, Nankai University, AAIS, Nankai University

2026-07-13视觉感知

本文针对RGB-Event密集解析中双编码器计算冗余、异步传感导致的几何视差与跨谱混叠问题,提出统一骨干Evita,在每层嵌入视差校正、频域谐波纹理传递和事件驱动全局路由,并配合N-ImageNetV2与随机事件表示混合预训练。实验称其在DELIVER、DDD17、DSEC上刷新指标,并在精度-延迟权衡上优于既有方法。

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation Figure 1
2026-07-13cs.AI

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Cha, Zheming Wang, Liya Li, Wei Wei, Haoyuan Hu, Jun Xu

JD Health International Inc., Shanghai Jiao Tong University, National University of Singapore, University of North Carolina Chapel Hill, University of Pennsylvania, real-world multimodal cases spanning 64 clinical departments. We evaluate 19 general-purpose and, available on Hugging Face at https://huggingface.co/datasets/jdh-algo/MedRealMM., †Work done during the internship at JD Health International Inc., laboratory reports, prescriptions, or imaging results in the context of the evolving dialogue. Third, physician responses

2026-07-13视觉语言强化学习数据集/基准

针对现有医疗大模型评测多依赖合成对话、选择题或纯文本病例,难以反映真实线上问诊风险,MedRealMM从京东健康脱敏问诊中抽取含图文上下文的临床挑战点,并用医生迭代修订的个案rubric评估下一回复。结果显示图像信息可显著提升前沿模型表现,但所有模型仍低于真实医生,主要差距在于更容易触发不安全、无依据或矛盾的负向标准。

Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy Figure 1
2026-07-13cs.CV

Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy

Shaoteng Zhang, Weiwei Cao, Wanxing Chang, Yutong Xie, Kai Cao, Zaiyi Liu, Yu Shi, Tingbo Liang, Qi Zhang, Ling Zhang, Yong Xia, Jianpeng Zhang

DAMO Academy, Alibaba Group, Hupan Lab, Department of Radiology, Ningbo No. 2 Hospital, Ningbo, Zhejiang, China, Department of Radiology, Guangdong Provincial People’s Hospital, Guangzhou, China, Department of Radiology, Shanghai Institution of Pancreatic Disease, Shanghai, China, Department of Radiology, Shengjing Hospital of China Medical University, Shenyang, China, The First Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, Zhejiang, China, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates

2026-07-13视觉感知

针对医学影像中通用视觉语言模型覆盖广但定位和细粒度诊断不足、专科模型性能强却难泛化的问题,SuG将解剖、类别特异和类别无关病灶分割先验注入视觉语言对齐,并用病灶掩码校准文本条件注意力。实验覆盖胸腹部CT多基准,报告在广泛疾病诊断上达到SOTA,并在若干肿瘤任务超过专科模型,同时提升未标注病灶的定位泛化。

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation Figure 1
2026-07-13cs.CV

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao

Tsinghua University, Beijing Normal University

2026-07-13视觉感知生成模型

本文针对少步文本生成图像中 CFG 蒸馏仍采用固定指导强度和盲目采样监督时刻的问题,认为生成过程本质上是熵逐步降低的动态过程。IB-Flow 用信息瓶颈视角重写蒸馏,依据局部向量场范数自适应选择注入目标,并随 SNR 衰减调节指导强度,以减少过度条件化。实验声称在 2-step 生成下提升结构、纹理和色彩保真度,达到 SOTA。

VTaMo: Video-Text Alignment Model for Sign Language Translation Figure 1
2026-07-13cs.CV

VTaMo: Video-Text Alignment Model for Sign Language Translation

Junyi Hu, Zhewen He, Haomian Huang, Aoxiang Yang, Yi Fang

2026-07-13视觉感知

VTaMo针对无 gloss 手语翻译中视频时序与目标文本词序不一致、解码器只能隐式学习跨模态对齐的问题,显式引入多粒度视频-文本对齐:用带空 token 的最优传输建模帧到内容词伪 gloss 的局部对应,并结合全局嵌入空间校准和位置对齐对比学习。论文在 Phoenix-2014T、CSL-Daily、How2Sign、OpenASL 上报告达到 gloss-free 设置下的 SOTA,消融显示三类对齐损失均有贡献。

4D Human-Scene Reconstruction from Low-Overlap Captures Figure 1
2026-07-13cs.CV

4D Human-Scene Reconstruction from Low-Overlap Captures

Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park

Seoul National University, Seoul National University Seoul Republic of Korea

2026-07-13强化学习三维

本文针对少量、低重叠相机下的野外多人4D人体场景重建,指出联合建模会让背景缺失与人体误差相互纠缠,而纯视频扩散又难保人体几何一致。StudioRecon将背景与人体解耦:用相机可控视频扩散合成大量新视角监督背景高斯,用跨视角身份关联、关键点三角化和SMPL先验初始化人体,再以运动自适应一致性注入做递归增强。实验在四个真实数据集上取得更好的新视角合成效果,并展示轨迹渲染和换人应用。

Event Burst Trigger: An Availability Backdoor Attack on Event-Based SNN Object Detection Figure 1
2026-07-13cs.CV

Event Burst Trigger: An Availability Backdoor Attack on Event-Based SNN Object Detection

Jaesun Baek, Chanwook Lee, Eun-Kyu Lee

2026-07-13视觉感知

面向自动驾驶、机器人等边缘实时视觉场景,论文指出事件相机与SNN检测虽节能低延迟,但可用性安全被低估。作者提出Event Burst Trigger,在仅投毒训练数据且不改模型/推理流程的条件下,用时间集中的事件突发诱发大量虚假候选框,放大NMS后处理开销。SpikeYOLO实验显示mAP@0.5下降小于0.099,而NMS延迟最高增加38倍,边缘平台上还会抬高基线资源占用、压缩调度余量,STRIP难以可靠识别。

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms Figure 1
2026-07-13cs.CV

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

2026-07-13视觉感知数据集/基准

论文针对可见光视频异常检测在强光照变化、快速运动和复杂背景下易失效的问题,引入事件相机的高时间分辨率运动线索,并发布真实可见光-事件数据集 TJUTCM Pha。方法上通过视频、事件流与文本的对比预训练学习统一表征,再用自适应融合平衡空间语义与时间动态;实验显示 E-VAD 在新数据集和基准上优于既有方法,但具体增益中数据规模与模型设计的贡献仍需进一步拆分。

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification Figure 1
2026-07-13cs.CV

Integrating Large Language Models and Graph Convolutional Networks for Semi-Supervised Image Classification

Camila Piscioneri Magalhães, Lucas Pascotti Valem

2026-07-13视觉感知

针对图卷积网络用于半监督图像分类时缺少天然图结构、视觉特征近邻易引入语义噪声的问题,本文用BLIP生成图像描述,再由LLM为kNN或互近邻图中的候选边打语义相似度并按阈值剪枝。Corel5k实验显示,该语义图精炼在kNN图和部分视觉骨干上能提升分类准确率,但对已较强的图收益有限,增益来源仍需更多数据集和参数分析验证。

Equivariant Filter for High Performance Image Tracking using an Event Camera Figure 1
2026-07-13cs.CV

Equivariant Filter for High Performance Image Tracking using an Event Camera

Angus Apps, Yixiao Ge, Timothy L. Molloy, Robert Mahony

School of Engineering, Australian National University

2026-07-13视觉感知

面向高速机器人/车辆视觉中传统帧式图像跟踪难以处理大光流、且事件特征轨迹存在时间相关的问题,论文将 AEB 事件 blob 跟踪器与基于 SE(2) 对称性的等变滤波级联,并用等效测量去相关化特征位置输入。在一般运动和快速旋转数据上,该方法相较直接优化和协方差交集给出更平滑、低方差的位姿与速度估计,可跟踪约 7000 像素/秒的图像平面运动。

Beyond Metadata: CAPRA for Hidden Subgroup Analysis under Missing Metadata in Medical Imaging Figure 1
2026-07-13eess.IV

Beyond Metadata: CAPRA for Hidden Subgroup Analysis under Missing Metadata in Medical Imaging

Yawen Li, Yan Li, Zhe Xue, Yingxia Shao, Meiyu Liang, Guanhua Ye

Beijing University of Posts and Telecommunications, Beijing University of Posts and Telecommunications Beijing China

2026-07-13视觉感知

针对医学影像部署时人口学、设备和图像质量等元数据缺失导致亚群失效被总体指标掩盖的问题,论文提出 CAPRA:用图像推断可解释的代理语义轴,并在少量有元数据样本上校准后形成可复用的亚群审计接口。实验覆盖眼底、皮肤镜和胸片,显示其能发现元数据切片遗漏的差异,在外部手持眼底数据迁移下仍有信息量,并可提升部分鲁棒学习器的最差组表现,但下游增益具有明显领域依赖。

A Coreset Selection Framework with Ensemble Aggregation for Image Classification Figure 1
2026-07-13cs.CV

A Coreset Selection Framework with Ensemble Aggregation for Image Classification

Pedro Rocha Dantas, Lucas Pascotti Valem

2026-07-13视觉感知

针对大规模图像分类训练的时间与显存压力,论文把核心集选择与多次独立采样的集成预测结合,提出按样本到类别中心距离分层抽样的 SCOSS,并加入类均衡等变体以覆盖完整分数分布。实验显示,SCOSS 尤其是 SCOSS-B 在 SGC 上常取得最好或接近最好结果,20% 数据可显著降低 CIFAR-10 训练成本,但在 CUB-200 上存在明显精度损失。

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models Figure 1
2026-07-13cs.CV

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

2026-07-13生成模型

这篇论文针对音视频生成模型中“画面与声音是否因果同步”难以自动评估的问题,指出传统时间偏移或相似度指标默认内容结构正确,无法处理幻觉音效、缺失声音等生成式错误。其核心做法是用含人类成对偏好的 SynthSync 数据集训练带连续评分头的 Omni-LLM,并用 R-GRPO 强化全局排序一致性。实验称该无参考指标与人类偏好对齐达到 SOTA,并用于建立 SyncBench;具体增益中数据、模型适配与强化训练各自贡献仍需看消融细节。

DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes Figure 1
2026-07-13cs.CV

DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes

Chunggi Lee, Seonwook Park, Wanhua Li, Umar Iqbal, Hanspeter Pfister

2026-07-13视觉感知

针对多人视频中遮挡、进出场和多阶段检测-重建-关联带来的身份漂移与延迟,DETRAM将人体检测、跟踪和3D网格恢复统一到单个Transformer解码器中,用跨帧保持身份的检测、跟踪与提示查询同时处理自动发现和用户指定目标。实验在PoseTrack21、3DPW、BEDLAM、MuPoTS-3D上取得领先或有竞争力的跟踪与重建结果,并支持提示式多人跟踪。

Subtoken Vision Transformer for Fine-grained Recognition Figure 1
2026-07-13cs.CV

Subtoken Vision Transformer for Fine-grained Recognition

Jie Zhu, Ivy Zhang, Minchul Kim, Xiaoming Liu

2026-07-13视觉感知

这篇论文针对标准 ViT 将每个图像 patch 压成单一 token、难以保留细粒度局部差异的问题,提出 SubViT:只对注意力判定为关键的少量 patch 细分为多个 subtoken,同时保留原 token 序列。其两阶段训练先用随机注意力头探索区域,再用特征退化信号蒸馏出轻量路由器,避免推理时额外 attention 前向。在 CUB、Aircraft、Cars 的 GCD 设置中,DINOv2 新类平均准确率由 81.3% 提升到 84.7%,仅增加 0.50 ms 延迟和 3.4% FLOPs。

REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation Figure 1
2026-07-13cs.CV

REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee, Uma Mahesh

2026-07-13视觉感知

REBASE针对训练-free一示例分割中“参考图与查询图共享背景会抬高非目标相似度、误导SAM提示”的问题,提出从参考图背景特征估计低秩子空间,并将参考与查询DINO特征投影到其正交补以去除场景上下文偏置,再用相似度加权的最远点采样生成多点提示和稠密先验。在ISIC、X-Ray、FSS-1000、PACO-Part等基准上取得训练-free方法领先结果,PASCAL-Part为次优。

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation Figure 1
2026-07-13cs.CV

Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation

Artheme Gauthier-Villar, Guodong Ding, Angela Yao

2026-07-13视觉感知规划控制数据集/基准

这篇论文针对长视频时序动作分割数据集存储与训练成本高、现有 cVAE 反演式压缩计算昂贵且易过平滑的问题,提出用 DDIM 的确定性映射把动作片段表示为潜空间连续轨迹,并以少量自适应锚点按重建难度分配容量。实验称其在多个 TAS 基准优于既有压缩方法,在 Breakfast 上以 2.4% 压缩率接近真实数据训练性能,最低可用 1.4% 存储。

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models Figure 1
2026-07-13cs.CV

GeoTrace: Geometry-Aware Trajectory Token Compression for Video Large Language Models

Guohuan Xie, Mengqi Lei, Chuan Shi, Wei Bao, Yue Gao, Siqi Li

BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University, Yangtze Delta Region Institute, Tsinghua University, Beijing University of Posts and Telecommunications, Beijing, China, representation for efficient and robust Video LLM inference. Code is available at, compacting non-skeleton information under explicit temporal and spatial constraints. It centers on two

2026-07-13视觉感知规划控制

GeoTrace针对视频大模型推理中视觉token过多、逐帧显著性选择易偏向局部目标且启发式合并会丢失时序证据的问题,提出免训练的几何感知压缩:用CFPA保留覆盖全局语义的骨架token,用TCRC按一对一时序轨迹凝聚残差事件token。实验覆盖4个Video LLM和4个基准,在LLaVA-OneVision仅保留10%视觉token时仍保持99.1%原始性能,并降低12.99倍TFLOPs。

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method Figure 1
2026-07-13cs.CV

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method

Tianpeng Liu, Xinhua Jiang, Li Liu, Qinmu Shen, Siwei Tang, Zhen Liu, Yongxiang Liu

advance research in the UGAOD field. The dataset and code are soon available at https://github.com/Leo000ooo/LUDO dataset., Foundation of National University of Defense Technology under Grant JS2023-03., All the authors are with the College of Electronic Science and Technology, National, University of Defense Technology, Changsha, 410073, China.

2026-07-13视觉感知数据集/基准

针对无人机目标检测中遮挡和目标像素稀少、且缺少真实交互式AOD基准的问题,论文构建ATRNet-LUDO大规模实景多视角车辆数据集,并引入带AOD先验的JEPA世界模型改进策略表征。实验显示主动观测较被动感知识别率提升约20个百分点,AOD-JEPA在相近移动代价下较DRL基线再提升2–3个百分点。

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents Figure 1
2026-07-13cs.CV

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi

2026-07-13数据集/基准

该文针对现有文档理解基准常可被 OCR 或结构化文本绕过、难以检验真实视觉 grounding 的问题,提出面向地图文档的 OmniMapBench,覆盖 9 类地图、1603 张图和 2096 个手工标注问答,并用 VDI 衡量任务对图像的不可替代依赖。实验评测 25 个 LVLM,最佳模型仅达 75.03% 准确率,且 VDI 高于既有基准,说明地图场景仍暴露出显著的视觉中心推理短板。

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning Figure 1
2026-07-13cs.CV

Probing Diffusion Denoising Dynamics for Contrastive Representation Learning

Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li

Australian National University, 2 CSIRO Data61, 3 Amazon

2026-07-13生成模型

这篇论文针对自监督表征学习中识别鲁棒性、生成质量与训练成本难以兼顾的问题,提出 D3CL:把扩散模型不同去噪时间步的噪声潜变量视为同一图像的随机视图,在冻结 Stable Diffusion 主干的基础上用 LoRA 注入对比学习目标,并与去噪重建联合优化。实验显示其在 ImageNet-1K 达到 80.1% 线性探测准确率,同时保持 256×256 无条件生成 FID 5.56,说明噪声层级对比约束可改善判别表征而不明显牺牲生成能力。

On Locality and Length Generalization in Visual Reasoning Figure 1
2026-07-13cs.CV

On Locality and Length Generalization in Visual Reasoning

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-07-13学习理论

本文从人类以局部注视序列处理视觉信息的事实出发,质疑全局一次性视觉编码是否削弱长度外推能力。作者构造视觉奇偶、状态机、召回和真实图表求根任务,指出全局模型易学到随长度失效的捷径;只有递归处理结合严格局部感知,才能在需要状态跟踪的任务上更稳定地泛化,且收益并非单纯来自更多视觉 token。

STEAM: Stable Self-Training with Elastic Matching and Adaptive Purification Figure 1
2026-07-13cs.CV

STEAM: Stable Self-Training with Elastic Matching and Adaptive Purification

Shaoxiang Wang, Kejia Zhang, Haiwei Pan, Lan Zhang

2026-07-13视觉感知

本文针对无人机-卫星跨视角地理定位中标注配对昂贵、无监督方法易受生成域偏差和伪标签噪声累积影响的问题,提出直接在真实图像上端到端自训练的 STEAM。其核心是用稳定空间感知特征、弹性双向匹配和自适应伪标签净化来提升配对覆盖与可靠性;在 University-1652 和 SUES-200 上达到无监督 SOTA,并接近监督方法表现。

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models Figure 1
2026-07-13cs.CV

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

Yuncheng Yang, Feiyang Ye, Shixian Luo, Yinna Zhu, Lianlei Shan, Wangcai Zhao, Kuo Zhang, Yan Chen, Yong Wu, Yan Xie

LiAuto Inc.

2026-07-13视觉语言视觉感知

针对同构 VLM 在长上下文和硬件约束下推理开销高、手工异构结构难以适配设备的问题,MOSAIC 将线性注意力、稀疏算子和低秩模块纳入逐层搜索空间,并用多目标 MIP 在延迟约束下选择结构,再通过两阶段蒸馏恢复能力。基于 Qwen3-VL-4B 的 MOSAIC-4B 在多项基准上接近原模型,训练成本低于原始 2%,预填充加速 1.76 倍、解码加速 2.54 倍。

Video Generation Models are General-Purpose Vision Learners Figure 1
2026-07-13cs.CV

Video Generation Models are General-Purpose Vision Learners

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

2026-07-13视觉感知三维

论文从视觉仍依赖任务专用模型的现状出发,主张大规模文本到视频生成可充当类似 NLP next-token prediction 的通用预训练目标。核心洞察是视频扩散骨干已学习时空、3D 与语言对齐先验,GenCeption 将其改造成文本指令驱动的前馈多任务感知模型。实验显示其在深度、法线、相机位姿、指代表达分割和 3D 关键点等任务上接近或超过专用模型,并以更少微调数据展现初步 scaling 与跨合成到真实、跨类别泛化能力。

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes Figure 1
2026-07-13cs.CV

C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes

Francis Fernandez, Arash Jahangiri, Salimeh Sekeh

San Diego State University

2026-07-13视觉语言视觉感知

该文针对安全感知中少数类样本稀缺、传统长尾检测依赖标注的问题,提出 C-GAP:不更新开放词汇检测器权重,而以场景描述与类别数量组成复合提示,并用检测到的少数类 AP@0.5 反馈迭代改写每图提示。实验覆盖多种骨干和数据集,少数类 AP@0.5 在 10/12 配置提升,COCO 上相对复合提示基线提升约 81%。

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs Figure 1
2026-07-13cs.CV

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

2026-07-13视觉语言强化学习数据集/基准

这篇论文针对现有 VLM 评测多停留在单视角或相机中心推理、难以检验机器人装配等任务所需的全局三维表征能力,提出 MultiView-Bench,要求模型把多视角 RGB 观察融合到固定世界坐标系中。实验显示前沿 VLM 在单图 2D 关系上较强,但在 3D 空间关系、多视角聚合、非常规坐标轴和外观变化下明显失稳;作者进一步用 ViewNavigator 主动选视角并融合证据,使多种基座模型显著提升,完整代理约提升 3-5 倍。

SplatCtrl: Perception-Action Coupling via Gaussian Scene Representations and Reactive Robot Control Figure 1
2026-07-13cs.RO

SplatCtrl: Perception-Action Coupling via Gaussian Scene Representations and Reactive Robot Control

Siddarth Jain, Ho Jin Choi

Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA.

2026-07-13机器人强化学习规划控制三维

面向非结构化、动态工作空间中机械臂难以及时感知并避障的问题,SplatCtrl将RGB-D驱动的3D Gaussian场景重建与反应式控制闭环耦合:用体素过滤和动态高斯重定位更新场景,并从各向同性高斯构造连续SDF/碰撞概率,再接入控制屏障函数。实验覆盖仿真、实体机器人和人机共享空间,显示其可在未知变化环境中同步重建并生成6-DoF无碰运动。

Is sub-metre resolution necessary for cocoa mapping? A landscape-stratified evaluation of very high resolution imagery, decametric Earth Observation inputs, and operational products in Cote d'Ivoire Figure 1
2026-07-13cs.CV

Is sub-metre resolution necessary for cocoa mapping? A landscape-stratified evaluation of very high resolution imagery, decametric Earth Observation inputs, and operational products in Cote d'Ivoire

Kasimir Orlowski, Filip Sabo, Michele Meroni, Astrid Verhegghen, Mariana Belgiu, Felix Rembold

Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente, European Commission, Joint Research Centre (JRC), Via Enrico Fermi, 2749, 21027, Flemish Institute for Technological Research (VITO), Boeretang 200, 2400 Mol, four publicly available cocoa mapping products. Performance was evaluated through a, a scalable alternative for large-area mapping.

2026-07-13视觉感知数据集/基准

为支撑科特迪瓦可可种植的毁林监管与供应链溯源,论文按树冠密度和景观破碎度分层评估0.5米Pléiades、10米Sentinel-2、TESSERA/AEF嵌入及现有产品。核心洞察是亚米级影像优势并非均匀存在,而是在破碎或极端树冠条件下更明显;VHR模型F1达0.92且各分层均超0.90,TESSERA为最佳十米级方案F1为0.86,说明定向采购VHR适合复杂景观,基础模型嵌入则更适合大范围可扩展制图。

Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images Figure 1
2026-07-13cs.CV

Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images

Matthias Tangemann, Benjamin Lo, Zygmunt Pizlo, Kaleem Siddiqi, Dirk B. Walther, Sven Dickinson

University of Toronto, Vector Institute, McGill University

2026-07-13视觉感知

这篇论文关注 ViT 的分割/物体组织能力是否来自类似人类格式塔的形状线索,而非语义或纹理捷径。作者在25个冻结预训练 ViT 上训练线性探针,并用自然图像与隔离包围性、凸性、对称性的合成刺激做跨域检验。结果显示包围性和凸性被稳定编码,部分模型可从自然图像零样本泛化到合成刺激;对称性只在均匀颜色区域较明显,且图地信息主要出现在中间层。

HAT Super-Resolution and a PARSeq+CLIP4STR Voting Ensemble for Extreme In-the-Wild License Plate Recognition Figure 1
2026-07-13cs.CV

HAT Super-Resolution and a PARSeq+CLIP4STR Voting Ensemble for Extreme In-the-Wild License Plate Recognition

Karthik Sivarama Krishnan, Koushik Sivarama Krishnan

2026-07-13视觉感知

该文面向极端低清、运动模糊和遮挡条件下的车牌识别,核心判断是瓶颈在字符可读性而非OCR解码器容量。方法用多帧对齐融合与HAT 4倍超分恢复笔画,再结合PARSeq和CLIP4STR按置信度投票,并利用评分规则在低置信字符上弃权。公开验证从无超分7.27 wECR提升到9.73,超分贡献最大,推理约1.7秒/序列。

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting Figure 1
2026-07-13cs.CV

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

Chenjian Gao, Linning Xu, Tianfan Xue

2026-07-13规划控制

这篇工作针对室内场景重光照中“可精确放置三维光源”与“保持真实材质光照先验、多视角一致性”难以兼得的问题,提出 Lume-Palette:先用文本提示从预训练扩散模型蒸馏规范方向的 illumination palettes,再基于粗几何和接收端光照条件进行投射,并用非对称多视角条件降低计算量。实验显示其在合成与真实场景中能生成更自然、空间对齐且跨视角一致的重光照结果,但几何误差和复杂反射仍是限制。

Secure-by-Disguise: A Systematic Evaluation of Image Disguising for Confidential Medical Image Modeling Figure 1
2026-07-13cs.CV

Secure-by-Disguise: A Systematic Evaluation of Image Disguising for Confidential Medical Image Modeling

Jason Rojas, Jiajie He, Yash Patel, Yuechun Gu, Zeyun Yu, Keke Chen

aUniversity of Maryland, Baltimore County, 1000 Hilltop, bLawrence Technological University, 21000 West Ten Mile, cUniversity of Wisconsin, Milwaukee, 3203 N. Downer, tructures that provide scalable storage and high-performance computational

2026-07-13视觉感知数据集/基准

面向医疗影像上云训练中的隐私泄露风险,本文系统评估图像伪装作为轻量级隐私增强技术的可用性,而非只在自然图像分类上验证。研究对 DisguisedNets、NeuraCrypt 在四个医学数据集、分类与分割任务中统一比较,发现伪装方法对分类仍较实用,但在语义分割中明显损失细粒度空间信息;RMT 在性能、效率和抗重建攻击间最均衡,AES 伪装则显著伤害效用。

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing Figure 1
2026-07-13cs.CV

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji

University of North Carolina at Charlotte

2026-07-13视觉语言

论文针对训练时有多种传感模态、部署时只能用单一模态的“特权模态”场景,指出常规 MLLM 只做共享对齐难以转移辅助模态信息。MoP 通过中间层探针分离模态特有与通用表示,并用解耦损失和交错批训练防止探针塌缩。在 ADL 与音乐理解的 8 个任务、4 种模态上,相比强基线最高取得 65% 相对提升。

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference Figure 1
2026-07-13cs.CV

StereoSplat+: Feed-Forward Stereo Gaussian Splatting with Diffusion-Assisted Progressive Inference

Zihua Liu, Masatoshi Okutomi

Department of systems and Control Engineering, Institute of Science Tokyo, Japan.

2026-07-13生成模型三维

面向机器人和端侧 AR 中只有单个双目相机、不能依赖未来多视角的场景重建,StereoSplat+ 将输入数不变的前馈 3DGS 估计器与一次“渲染-扩散增强-回灌”的渐进推理结合,用代价体和三平面 3D 分支共同补足遮挡与视野外几何。在 KITTI-360 上,其新视角渲染和深度指标优于现有前馈 3DGS,尤其在遮挡区域和大视角外推下更明显。

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement Figure 1
2026-07-13cs.GR

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

Institute of Material Systems Modeling, Institute of Material and Process Design, German Research Center for Artificial Intelligence

2026-07-13视觉语言三维

这篇论文关注有限元体网格自适应细化中过度依赖 PDE 求解器或大量仿真数据的问题,提出 GReFEM:用现成多模态大模型在物理提示下从多视角 CAD 图像定位应力关键区域,并通过 orthoViews 和网格化区域定位投回 3D 作为细化锚点。实验显示,零样本 MLLM 相比匹配预算的几何启发式能更高精度地锁定应力相关特征,但像素级定位仍不稳定,主要价值更像是语义辅助而非完整求解替代。

2026-07-10

87 篇
Wat3R: Underwater 3D Geometry Learning without Annotations Figure 1
2026-07-10cs.CV

Wat3R: Underwater 3D Geometry Learning without Annotations

Jiangwei Ren, Xingyu Jiang, Zijie Song, Wei Xu, Hongkai Lin, Dingkang Liang, Xiang Bai

2026-07-10三维

水下三维重建受光衰减、散射和高质量几何标注稀缺限制,陆地训练的前馈模型直接迁移效果差。Wat3R以VGGT为基础,结合模拟水下退化的有标陆地数据与无标真实水下视频,通过教师-学生训练和跨视角一致性损失补偿退化视图信息,并构建含深度与位姿标注的Water3D评测集。实验显示其在水下多视深度估计和点云重建上优于现有方法。

ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device Figure 1
2026-07-10cs.CV

ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device

Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia

2026-07-10视觉感知

针对基础深度模型零样本能力强但难以上边缘设备、轻量模型又易受域偏移影响的问题,ZipDepth用Depth Anything v2-Large在1400万级多域数据上蒸馏,并设计可重参数化编码器-解码器与硬件自适应凸上采样。6.1M参数模型在5个零样本基准和9类硬件上取得轻量模型中较优的精度、速度与能耗折中,Jetson Orin NX上可实时运行。

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models Figure 1
2026-07-10cs.CV

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

National Yang Ming Chiao Tung University, National Yang Ming Chiao Tung University Taiwan

2026-07-10视觉感知生成模型三维

事件相机在高速、高动态范围场景中有优势,但稀疏事件流难以恢复清晰且长期稳定的视频。LongE2V将预训练视频扩散模型改造成事件条件生成框架,统一处理重建、预测和插帧,并用自回归展开、上下文切换、重编码对齐和事件体素密度增强抑制漂移与错位。实验称其在真实基准上三项任务均优于现有方法,尤其改善感知质量、时间一致性和零样本泛化。

Geometry and Gradient-based Partitioning for Panoramic Outdoor Reconstruction Figure 1
2026-07-10cs.CV

Geometry and Gradient-based Partitioning for Panoramic Outdoor Reconstruction

Weijian Chen, Weibo Yao, Yuhang Zhang, Xiaolin Tang, Guo Wang, Weijun Zhang, Xitong Gao, Yihao Chen, Hongde Qin, Lu Qi

Insta360 Research, 2 Sun Yat-sen University, 3 South China University of Technology, University of Chinese Academy of Sciences, Harbin Engineering University, Wuhan University

2026-07-10优化算法三维

本文针对全景图像用于大规模户外3DGS重建时“处处可见”导致传统按视锥分块失效、训练退化为全局优化的问题,提出PanoLOG与G2PS:先用天空球和单目深度建立粗几何,再依据视差不确定性扩展边界、用梯度重要性分配相机到局部块。作者还构建Pano360基准,实验显示其在多场景PSNR/SSIM/LPIPS上优于现有方法,并保持可并行的块级训练和较小模型规模。

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators Figure 1
2026-07-10cs.CV

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen

City University of Hong Kong

2026-07-10视觉感知强化学习

针对少步自回归视频生成在长序列展开中误差累积、运动变弱的问题,OPSD-V将真实长视频作为训练时的特权时序上下文,在学生自身推理轨迹上构造带更干净KV缓存的教师监督,且不改变采样步数和推理缓存机制。该方法在Self-Forcing与LongLive上提升视觉质量、运动动态和VBenchLong,用户偏好率达66.0%。

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining Figure 1
2026-07-10cs.CV

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

Tsinghua University, Beihang University, Wuhan University

2026-07-10视觉感知

全景图生成在 ERP 投影下易出现纬度畸变和首尾不连续,且缺少高质量上下文编辑数据。Canvas360 的核心是用 RGB-深度并行预训练、速度环形 padding 和相似度约束注入球面几何先验,再用 100 万样本统一微调修复、外扩、风格迁移和编辑任务。实验显示其在 FAED、边界一致性和视觉保真度上优于或接近现有方法,但部分增益可能主要来自 scaling / data。

OpenCoF: Learning to Reason Through Video Generation Figure 1
2026-07-10cs.CV

OpenCoF: Learning to Reason Through Video Generation

Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li

2026-07-10视觉感知

本文针对现有视频生成模型虽能生成逼真动态,却缺少面向时序推理的监督和结构设计这一问题,提出 OpenCoF:构建含 1.7 万视频、11 类任务的数据集,并在 Wan2.2-I2V-A14B 上微调得到 Wan-CoF,同时探索视觉/文本推理 token 来显式组织中间推理状态。结果显示模型在四个外部视频推理基准上相对基线有明显提升,但增益可能主要来自 data,结构性 token 的独立贡献仍需更多消融支撑。

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding Figure 1
2026-07-10cs.AI

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

University of Colorado Colorado Springs, University of Michigan, University of Notre Dame

2026-07-10视觉语言视觉感知数据集/基准

针对自动驾驶中事故、险情等低频高风险场景难以用常规感知基准评估的问题,本文提出 AUTOPILOT-VQA:以600余段行车记录仪视频和6000余个结构化问答覆盖天气、道路、涉事主体、责任和碰撞位置等维度,并通过 Kaggle 统一评测。主要结果表明,现有视觉语言模型在情境理解和安全关键推理上仍有明显不足,具体性能增益与模型差异文中未充分说明。

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation Figure 1
2026-07-10cs.GR

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

2026-07-10生成模型

ARDY针对交互式动画与仿人机器人中“实时生成”和“可控性”难兼得的问题,提出显式根运动加潜在身体表征的混合表示,并用两阶段自回归扩散 Transformer 结合可变历史上下文处理文本、关键帧、轨迹和稀疏关节约束。实验在 HumanML3D 与 Bones Rigplay 上显示其运动质量和约束跟随较强,4 步扩散平均延迟约 33 ms,但部分优势可能受大规模高质量数据影响。

WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps Figure 1
2026-07-10cs.CV

WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps

Tomasz Stanczyk, Yuan Gao, Hardik Agarwal, Seongroo Yoon, Tiantao Zhang, Vincent Calcagno, Francois Bremond

2026-07-10视觉感知数据集/基准

这篇论文针对现有 MOT 基准多为短视频、难以检验长期身份保持的问题,提出 WaspMOT:以赤眼蜂受控实验视频构成长时闭集多目标跟踪基准,并提供 MOTChallenge 标注与 oracle detections 以隔离关联能力。作者评测 ByteTrack、BoT-SORT、C-BIoU、OC-SORT 和 McByte,发现即使使用完美检测仍普遍出现严重轨迹碎片;简单空间 tracklet 拼接可稳定提升,说明长期关联仍有明显改进空间。

Pose-to-Biomechanics: Bridging 3D Human Pose Estimation and Biomechanical Attribute Prediction Figure 1
2026-07-10cs.CV

Pose-to-Biomechanics: Bridging 3D Human Pose Estimation and Biomechanical Attribute Prediction

Ayda Eghbalian, Kevin Desai

2026-07-10三维

这篇论文针对3D姿态估计只优化关节点几何误差、难以服务康复和运动分析中的力矩、地反力、肌肉激活等需求,提出可接在任意17关节3D姿态估计器后的轻量时序Transformer BioModule。其核心是用对齐的Human3.6M与Human3.6Mplus监督,从姿态序列学习运动学、动力学和神经肌肉属性,并在七种上游估计器上评测误差传播。结果显示生物力学预测可由姿态序列学习,但对上游姿态的解剖合理性和时序一致性敏感,受控数据外泛化仍文中未充分说明。

LTM: Large-scale Terrain Model for Wildfire-prone Landscapes Figure 1
2026-07-10cs.CV

LTM: Large-scale Terrain Model for Wildfire-prone Landscapes

Xiao Fu, Yue Hu, Meida Chen, Peter Anthony Beerel, Barath Raghavan

2026-07-10视觉感知

面向野火高风险区域,论文关注传统 LiDAR 更新慢、图像重建在植被低纹理和视角重叠不足下失效的问题。LTM 将过时 DEM 作为几何先验,用基于物理射线追踪的图像像素到 DEM 栅格像素对齐替代特征匹配,并结合单目深度更新地形/燃料图。实验依托真实区域模拟器,报告在深度精度和计算效率上优于现有方法且接近实时,但真实部署泛化仍需更多说明。

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales Figure 1
2026-07-10cs.CV

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Wei Lu

2026-07-10视觉感知数据集/基准

针对现有深伪视频基准偏重换脸或整体生成、难覆盖人-物/人-人交互与多模态一致性的问题,HumanForge构建了1.8万余段人中心伪造视频,并用Gen2Anno多智能体流程结合生成来源与视觉检查生成对比式omni标注。实验显示传统检测器和LMM在零样本泛化、细粒度定位与解释上仍明显受限,但具体性能增益来源文中未充分说明。

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation Figure 1
2026-07-10cs.CV

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

Ruiqi Shen, Chang Liu, Henghui Ding

2026-07-10视觉感知

SAM-MT针对SAM2等视频分割方法在多目标场景中需按目标重复推理、延迟随目标数增长的问题,将全局上下文共享表示与每个目标的轻量查询并行建模,并用解耦 masked attention、查询式稀疏记忆和重叠约束保持身份区分与遮挡鲁棒性。实验显示其在六个VOS基准上保持接近SAM2.1-B+的精度,10目标拥挤场景仍达36+ FPS,相比SAM2.1-B+约6倍加速。

Multi-Resolution Feature Stem for Diabetic Retinopathy lesion segmentation Figure 1
2026-07-10cs.CV

Multi-Resolution Feature Stem for Diabetic Retinopathy lesion segmentation

Indranil Dutta, Taehee Jeong

This work was supported in part by a Mobilint Grant awarded to San Jose State University. (Corresponding author: Taehee Jeong)

2026-07-10视觉感知

本文关注糖尿病视网膜病变中不同病灶尺度差异导致的分割分辨率冲突:小型微动脉瘤需要高分辨率,而较大出血在高分辨率下反而可能退化。作者系统比较多种架构在512与1024输入下的表现,并提出接入UNet++的多分辨率Feature Stem,用1024、512、256尺度并行融合。结果显示该设计能缓解单一分辨率取舍,在保持细节的同时保留上下文,但具体增益幅度文中片段未充分说明。

Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection Figure 1
2026-07-10cs.CV

Do Transformations Reveal the Truth? Generative Residual Learning for Generalized AI-Generated Image Detection

Kutub Uddin, Nusrat Tasnim, Awais Khan, Mohammad Umar Farooq, Khalid Malik

University of Michigan, Korea Aerospace University

2026-07-10视觉感知生成模型

针对AI生成图像检测在未见生成器上泛化差的问题,论文提出“生成残差”视角:比较原图经二次生成式变换后的关系差异,而非只看单图特征。GenRes用神经张量网络建模原图与变换图的双线性交互,GenRes++再用注意力融合多种变换;在UniversalFakeDetect的19个未见生成模型上达到95.7% mACC和99.1% mAP,但计算开销较大。

Native Video-Action Pretraining for Generalizable Robot Control Figure 1
2026-07-10cs.RO

Native Video-Action Pretraining for Generalizable Robot Control

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

2026-07-10机器人视觉感知规划控制

论文认为把通用视频生成模型改造成机器人控制器会带来表征偏外观、双向预训练与因果控制不匹配、推理过慢等问题,因此提出 LingBot-VA 2.0:用语义视觉-动作 tokenizer 对齐状态与潜在动作,从头训练因果 DiT,并结合稀疏 MoE、多步未来预测和异步 Foresight Reasoning。实验称其可用 10–15 条示范完成少样本泛化、部分任务零样本执行,并在真实机器人上实现最高 225 Hz 闭环异步控制。

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities Figure 1
2026-07-10cs.CV

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

Weiduo Liao, Yunqiao Yang, Ying Wei

Zhejiang University, Nanyang Technological University

2026-07-10视觉感知

论文针对视觉语言模型中普通稀疏自编码器学到的概念常跨区域碎片化、跨模态不一致的问题,提出 S2AE:用 Transformer 注意力相似性与空间邻近性聚合图像 patch,并加入组内一致、组间互斥的结构化稀疏正则。实验在 Qwen2.5-VL-7B-Instruct 上显示,语义对齐 mIoU 平均提升 6.06%,表示更稀疏且重构解释方差超过 99%,跨模态一致性和单义性也有小幅提升。

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Figure 1
2026-07-10cs.CV

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

Wuhan University, Wuhan University of Technology, Nanyang Technological University, The Hong Kong University of Science and Technology, Corresponding author. Work done by Yiyang Fang during internship at Xiaomi Inc.

2026-07-10强化学习

这篇论文针对多模态模型在混合任务中一律先思考再回答带来的 token、时延浪费,以及强化学习训练中易坍缩为总是思考或总是直答的问题。Switch-Reasoner 将“思考”建模为可调用的虚拟工具,并用全局模式平衡与样本级路由监督稳定 GRPO 训练。11 个多模态任务实验显示,它能减少不必要推理,同时保持竞争性性能,改善准确率与效率权衡。

VocaDet: Sample-Driven Open-Vocabulary Object Detection and Segmentation via Visual Tokenization and Vector Database Retrieval Figure 1
2026-07-10cs.CV

VocaDet: Sample-Driven Open-Vocabulary Object Detection and Segmentation via Visual Tokenization and Vector Database Retrieval

ZhiXin Sun

2026-07-10视觉感知

VocaDet针对开放词表检测/分割在大规模、持续扩展样本库下依赖文本提示或昂贵匹配而难以部署的问题,提出用DINOv3特征聚类成多粒度视觉词,并结合去位置偏置表示、空间拓扑与正负样本向量库检索来完成定位和分割。UA-DETRAC实验显示其无需常规检测器训练即可获得有效检测能力,但文中未充分说明相对基线的具体增益与主要来源。

Whareformer: Learning to Track What is Where in Long Egocentric Videos Figure 1
2026-07-10cs.CV

Whareformer: Learning to Track What is Where in Long Egocentric Videos

Jacob Chalk, Saptarshi Sinha, Dima Damen, Yannis Kalantidis, Diane Larlus

2026-07-10视觉感知

这篇论文面向第一视角长视频中的物体永久性问题:机器人或可穿戴智能体需要在物体离开视野、被遮挡或外观因操作改变后仍知道“什么在哪里”。Whareformer用可更新轨迹记忆和Transformer关联模块联合建模外观与3D位置,并用New Track token学习何时新建轨迹。模型仅用56段EPIC-KITCHENS视频训练,却在EPIC、IT3DEgo和HD-EPIC共260段长视频上超过依赖手工阈值的既有方法。

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH Figure 1
2026-07-10cs.CV

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

Sophia Lichtenberg, Albert Gatt, Judith Masthoff

Utrecht University

2026-07-10视觉感知

针对文生图偏见评测长期忽视残障表征的问题,论文提出 INCLUDE-BENCH,以多类残障功能组、静态/动态情境和交叉人口属性构造 11.9 万张生成图,评估 17 个模型。结果显示,残障提示显著压缩视觉多样性,移动障碍和泛化残障几乎被轮椅主导,盲、聋等类别也依赖固定符号;更高文本对齐常伴随更强刻板化,并呈现年龄、种族、性别和能力判断上的系统偏斜。

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues? Figure 1
2026-07-10cs.CV

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato, Dima Damen

2026-07-10视觉感知

本文针对第一人称视频语言模型在手-物交互识别中依赖手形、物体或场景捷径的问题,提出手/物区域掩码训练与HOI动态感知解码器,分别强化手部操作和物体状态变化表征;同时构建CI-HOI与DEHOI,用修复视频隔离两类线索。实验显示该方法在DEHOI、常规动作识别、物体状态识别及机器人操作动作识别上均优于既有模型。

Systematic Evaluation of Learning Rate Scheduling Strategies Across Heterogeneous Architectures Figure 1
2026-07-10cs.LG

Systematic Evaluation of Learning Rate Scheduling Strategies Across Heterogeneous Architectures

Hafsa Mateen, Radu Timofte, Dmitry Ignatov

Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany

2026-07-10数据集/基准

论文针对学习率调度常被当作次要超参、缺少跨架构系统比较的问题,在 LEMUR 中对30种卷积与Transformer架构注入25类PyTorch调度配置,形成3938个CIFAR-10五轮训练变体。核心洞察是调度器收益强依赖架构,CosineAnnealingWarmRestarts与CyclicLR整体优于基础衰减;最佳Top-1为86.45%,237个变体超过80%。

CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction Figure 1
2026-07-10cs.CV

CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction

Sofie Allgöwer, Mikael Johansson, Andreas Hallqvist, Jonas Andersson, Åse Johnsson, Ida Häggström, Jennifer Alvén

2026-07-10视觉语言

本文面向肺癌生存预测中影像、临床变量与可靠结局数据稀缺的问题,探索将胸部 CT 视觉语言基础模型 CT-CLIP 作为特征提取器:把 CT 体数据与模板化临床文本分别编码后接 DeepSurv 生存头,并比较冻结、全量微调和 LoRA。结果显示,冻结 CT-CLIP 加轻量生存头优于临床基线,且与其他多模态专用模型相当或更好,可形成有临床意义的高低风险分层。

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing Figure 1
2026-07-10cs.CV

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

Peking University, Work done during an internship at WeChat Vision, Tencent Inc.

2026-07-10视觉语言

这篇论文针对长程多模态对话中历史图像反复塞入上下文带来的视觉 token 膨胀和跨轮引用不稳问题,提出把视觉信息外置为情景视觉记忆,并用感知抽象、认知检索和执行控制模块按需召回。作者还用程序化场景生成带检索标注的数据并构建 M2CA-Bench;8B 模型在 20 轮会话中达到 91.4% 检索准确率,超过 32B 基线 8.2 个百分点,单轮推理时间约减半。

VEGAS: Human-Aligned Video Caption Evaluation via Gaze Figure 1
2026-07-10cs.CV

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

The University of Texas at Austin

2026-07-10视觉语言视觉感知数据集/基准

这篇论文针对通用视频字幕常忽略个体观看注意力、影响检索和交互的问题,提出VEGAS:用测试时眼动信号和VLM条件概率构造跨模态信息论评分,并通过拒绝采样在候选字幕中选择更贴合注视对象的描述,无需重训模型。作者还整理了同步视频、眼动和人工字幕的数据集。结果显示在AEA自我中心场景中SBERT相似度显著提升0.0856,检索mAP在rank 1/5/10分别提升1.14%、2.48%、2.46%;但在SlideVQA增益较小且不显著,说明效果依赖注意力是否能直接指向具体语义。

Predicting Viticulture Potential through an Ensemble of U-Net and a Geospatial Foundation Model Figure 1
2026-07-10cs.CV

Predicting Viticulture Potential through an Ensemble of U-Net and a Geospatial Foundation Model

Jorge Ignacio Perez, Hwaai Kang Kee, Lucas Rassbach

Georgia Institute of Technology, North Ave NW, Atlanta, GA 30332

2026-07-10视觉感知

为降低葡萄种植适宜性评估对实地调查的依赖,论文用法国南部 Sentinel-2 多时相多光谱影像做像素级潜力预测。核心做法是将34个时相堆叠给 U-Net,并与季节聚合后微调的 Prithvi-EO-2.0 做加权 logit 集成;一个有意思的洞察是显式时序模型未优于通道堆叠。最终在 ImageCLEF AI4Agri 子任务中 ±1 准确率 68.32,7队第2,但泛化差距和集成增益来源仍未充分说明。

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models Figure 1
2026-07-10cs.CV

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

Huazhong University of Science and Technology, MiLM Plus, Xiaomi Inc.

2026-07-10视觉语言

针对统一多模态模型在交错推理中反复生成完整中间图像、视觉 token 冗余且监督被无关内容稀释的问题,DeltaV 将视觉推理改写为状态更新建模,用紧凑更新 token 表示关键变化,并用 TSIM Router 按变化幅度分配预算;同时构建 StructCoT 数据集。实验显示其平均减少 55.6% 新生成视觉 token,推理较全图生成提升 3.3%,但部分增益可能来自更大规模数据。

Track2Map: Online Deformable SLAM with Motion-Aware Pose Optimization in Robotic Surgery Figure 1
2026-07-10cs.CV

Track2Map: Online Deformable SLAM with Motion-Aware Pose Optimization in Robotic Surgery

Tianyi Song, Sierra Bonilla, Xinwei Ju, Evangelos Mazomenos, Danail Stoyanov, Adam Schmidt, Omid Mohareri, Sophia Bano, Francisco Vasconcelos

2026-07-10机器人优化算法三维

这篇工作针对手术场景中软组织形变、器械遮挡及相机位姿先验缺失或噪声导致的在线三维重建不稳定问题,提出 Track2Map:用密集 2D 轨迹提升到 3D 锚点来初始化形变,并通过运动感知的位姿门控区分相机运动与组织形变,避免静止内窥镜阶段的轨迹漂移。StereoMIS 实验显示,其在重建质量和相机轨迹估计上优于相关 SLAM 与依赖位姿先验的非 SLAM 方法。

Swapping Faces, Saving Features: A Dual-Purpose Pipeline for Pedestrian Privacy in ITS Figure 1
2026-07-10cs.CV

Swapping Faces, Saving Features: A Dual-Purpose Pipeline for Pedestrian Privacy in ITS

Roba H. Farouk, Catherine M. Elias

*This work was not supported by any organization 1 C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt

2026-07-10三维

面向自动驾驶/ITS行人数据集在隐私保护与训练可用性之间的冲突,论文提出含行人检测、SCRFD人脸检测、CodeFormer增强、换脸与融合的五阶段流程,并针对Egy-DRiVeS中低清、遮挡、戴面纱等街景情况测试Roop与Ghost-v2。结果显示增强步骤能改善换脸质量,Roop在表情、姿态、结构保留和复杂场景鲁棒性上优于Ghost-v2,但Ghost-v2身份相似度更低。

HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations Figure 1
2026-07-10cs.GR

HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations

YaQiao Dai, Renjiao Yi, Zhirui Gao, Wei Chen, Kai Xu, Chenyang Zhu

2026-07-10三维

本文针对物理仿真用三维重建中“先提表面、再四面体化”易出错,以及 TetSphere 生成离散网格、拓扑难自适应的问题,提出将高斯球与四面体单元耦合的 HoloTetSphere,通过边连接估计连续透明度场并可微剪枝,再结合交替几何优化和两阶段平滑生成连通一致的四面体网格。实验显示其在几何精度、渲染质量和仿真可用性上优于现有方法,但具体增益对各模块的依赖仍需看消融细节。

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation Figure 1
2026-07-10cs.CV

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

Virginia Commonwealth University, King’s College London, University at Buffalo, Harvard Medical School

2026-07-10视觉感知

这篇论文针对内窥镜场景中标注稀缺、器械与组织细粒度属性难以由通用视觉语言模型捕捉的问题,构建 ReferEndoscopy 大规模指代表达分割基准,并提出 AR-ERIS,通过属性检索、频率分解与专家混合融合边界、形状和纹理线索。实验称其在该基准上优于多种基线,并能泛化到开放词汇、未见类别及模拟/真实内窥镜数据,但具体增益中数据规模贡献可能较大。

Classical versus Deep Mirror-Symmetry Scoring: A Benchmark of Thirteen Methods Figure 1
2026-07-10cs.CV

Classical versus Deep Mirror-Symmetry Scoring: A Benchmark of Thirteen Methods

Maximilian Woehrer

2026-07-10数据集/基准

这篇论文针对镜像对称“打分”方法缺少统一、统计可靠比较的问题,构建了涵盖13种经典与冻结深度特征方法的基准,并用同一表示-比较-聚合框架和显著性检验评估。核心洞察是有效判别主要来自中尺度、无符号的方向特征;深度骨干在部分协议上最佳,但调好的HOG仅小幅落后、与CNN滤波方法难区分,且CPU上快约300倍,说明现有冻结深度特征相对经典描述子的实际增益有限。

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving Figure 1
2026-07-10cs.CV

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

2026-07-10视觉语言视觉感知强化学习

针对现有自动驾驶 VLA 多停留在被动反应、缺少 3D 空间认知和连续未来推演的问题,WCog-VLA 将语义层的世界状态/博弈式推理与生成层的多智能体轨迹扩散模型 ADDT 结合,并用 8.5 万条 Game-CoT 数据监督社交决策;在 NAVSIM 上报告 PDMS 92.9 的 SOTA 成绩,但具体增益在多模块与数据之间的拆分仍需看消融。

Texture Representations in Deep Vision Models: Comparing CNNs, Vision Transformers, and Human Perception Figure 1
2026-07-10cs.CV

Texture Representations in Deep Vision Models: Comparing CNNs, Vision Transformers, and Human Perception

Ludovica de Paolis, Marco Baroni, Alessandro Laio, Eugenio Piasini

Department of Neuroscience, International School for Advanced Studies (SISSA), Department of Language and Translation Sciences, Pompeu Fabra University, Department of Data Science

2026-07-10视觉感知

这篇论文质疑以物体识别为中心的视觉模型评估是否能解释纹理知觉,转而比较 CNN、三类 ViT 与人类心理物理数据在不同复杂度纹理上的表征关系。核心洞察是,纹理表征差异可能主要由架构而非任务目标决定:ViT 之间表征更一致,并能跨合成与自然纹理保持相似结构;VGG-19 与 ViT 差异明显。实验显示,人类纹理辨别表现更接近 ViT 表征,说明 ViT 可能比传统 CNN 更适合作为人类纹理知觉模型。

ARGUS: Accelerated, Robust, General, and Unsupervised Cell Tracking Solutions Figure 1
2026-07-10cs.CV

ARGUS: Accelerated, Robust, General, and Unsupervised Cell Tracking Solutions

Noah Jaitner, Kandice Tanner, Ingolf Sack, Hossein S. Aghamiry

Department of Radiology, Charité – Universitätsmedizin Berlin, 10117 Berlin, Germany, Laboratory of Cell Biology, Center for Cancer Research, National Cancer Institute, National Institutes of Health, Bethesda, MD, USA

2026-07-10视觉感知安全鲁棒

针对活细胞延时显微图像中噪声、形变、遮挡及分裂导致的细胞跟踪困难,ARGUS用自适应检测、Farneback稠密光流预测、逐帧线性分配和短时轨迹片段重连构成无需训练的两阶段框架,以降低全局优化成本。在CTC数据集上检测准确率0.905–0.971、跟踪准确率0.897–0.964,运行时间在1分钟内;但复杂分裂和长遮挡场景的增益来源仍需更多消融说明。

Enhancing the KidSat Model: Integrating Geographical Encoding and Data Quality Assessment for Childhood Poverty Prediction Figure 1
2026-07-10cs.CV

Enhancing the KidSat Model: Integrating Geographical Encoding and Data Quality Assessment for Childhood Poverty Prediction

Hou Hin Ip, Ka Nam Lam, Joshua Man Yu Ng, Makkunda Sharma, Seth Flaxman, Codie Gerlach-Wood, H Juliette T Unwin

School of Mathematics, University of Bristol, Department of Computer Science, University of Oxford

2026-07-10视觉感知

本文针对 KidSat 用卫星图像预测儿童贫困时监督信号稀疏、图像受云层或损坏污染、且缺少显式空间结构的问题,重新聚合 DHS 特征并加入城乡/财富变量,设计两阶段图像质量筛选,再将 DINOv2 视觉表征与球谐地理编码融合。实验显示 MAE 从 0.2167 降至 0.1759,扩展到 33 个非洲国家后最佳 MAE 为 0.1658;SH 稳定带来增益,复杂的 SH+SIREN 反而需更谨慎设计。

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies Figure 1
2026-07-10cs.CV

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

2026-07-10生成模型

这篇论文针对神经退行性疾病 MRI 年度变化极弱、直接生成未来影像易被静态个体解剖和扫描噪声主导的问题,提出将疾病进展建模为语义潜空间中的 Latent Drift:预测当前与未来表示的残差,并用有限标量量化过滤微小扰动。实验显示其在纵向 3D 脑 MRI 预测中优于扩散模型和自回归 Transformer 基线,提升生成保真度及临床相关指标。

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery Figure 1
2026-07-10cs.CV

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

2026-07-10视觉语言视觉感知数据集/基准

针对无人机真实任务中仅用文本、单目标指代表达难以处理参考图像、目标缺失和多实例的问题,论文提出 Universal Referring 任务,并构建 UniRef-UAV 基准,覆盖文本、图像及图文查询和可变目标数。其 UAV-URNet 以共享查询空间和集合预测作为基线,实验显示相比通用多模态大模型更轻量、可复现,且在无目标判别与跨域视觉查询分析上更稳定。

On the Design of Mixture-of-Experts for Dynamic Gaussian Splatting Figure 1
2026-07-10cs.CV

On the Design of Mixture-of-Experts for Dynamic Gaussian Splatting

In-Hwan Jin, Hyeongju Mun, Joonsoo Kim, Kugjin Yun, Kyeongbo Kong

2026-07-10三维

该文针对动态3D Gaussian Splatting在场景、空间区域和时间上对单一形变先验依赖过强的问题,提出从MoE角度组合多种形变专家,并比较联合优化共享 canonical 表示的 MoDE 与独立训练后路由融合的 MoE-GS。结果显示,多形变建模可在重建质量、稳定性和效率之间形成不同取舍,但具体增益幅度需结合实验表格判断。

HSA: Hierarchical Slot Attention for Multi-granularity Scene-Decomposition Figure 1
2026-07-10cs.CV

HSA: Hierarchical Slot Attention for Multi-granularity Scene-Decomposition

Neelu Madan, Rongzhen Zhao, Andreas Mogelmose, Juho Kannala, Joni Pajarinen, Graham W. Taylor, Thomas B. Moeslund

Aalborg University, Denmark, Pioneer Centre for AI, Denmark, Aalto University, Finland, University of Guelph, Canada, Vector Institute, Canada

2026-07-10视觉感知

论文针对现有 Slot Attention 只能做单一粒度、且主要按外观而非语义分解场景的问题,提出 HSA:在共享图像特征上并行学习前景/背景、类别和实例三层 slot,并用 10% 标注与层级对齐损失约束跨层一致性。COCO 与 Pascal VOC 实验显示,单模型在三种粒度上均显著优于最强平坦基线,COCO 的 ARI 最高分别提升 41.5、14.6 和 10.4。

SkelGen4D: Weakly-Supervised Skeleton-Based 4D Generation for Text-Driven Mesh Animation Figure 1
2026-07-10cs.CV

SkelGen4D: Weakly-Supervised Skeleton-Based 4D Generation for Text-Driven Mesh Animation

Hao Feng, Zhi Zuo, Jia-Hui Pan, Ka-Hei Hui, Zhengzhe Liu, Dian Zhang, Haoran Xie, Bin Sheng, Jingyu Hu

2026-07-10视觉感知

SkelGen4D针对文本驱动4D网格动画难以兼顾时序一致性、可编辑性与工业骨骼流程的问题,提出弱监督两阶段方案:先从原始网格动画拟合时序一致的伪骨骼,再训练前馈文本条件骨骼运动生成器,并用Motion-GRPO约束平滑性、多样性和骨长一致性。在Truebones Zoo与Diffusion4D上,其效果接近或超过需逐帧骨骼标注的监督方法,并优于视频驱动基线。

Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion Figure 1
2026-07-10cs.CV

Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

Abdullah Al Shafi, Sumaiya Rahim Suma

2026-07-10生成模型

本文针对 classifier-free guidance 扩散模型量化部署中被忽视的双分支结构,指出仅按 guidance gap 校准会留下无条件分支漂移的零空间,导致诊断指标好但生成质量差。作者提出 GAMP,直接以 guided prediction 误差做校准和逐层混合精度分配;在 CIFAR-10/T4 上显示 CFG 约有 1.99× 隐性延迟,普通 ORT INT8 反而慢 147×,GAMP 在相同平均精度下较均匀方案 FID 改善 49%,但实验规模仍限于小模型与 32×32 数据。

TVTA: Trajectory-Aware Viseme-Guided Temporal Aggregation for Event-Based Lip Reading Figure 1
2026-07-10cs.CV

TVTA: Trajectory-Aware Viseme-Guided Temporal Aggregation for Event-Based Lip Reading

Jingrong Zheng, Hongwei Ren, Xiangqian Wu

Harbin Institute of Technology, Harbin Institute of Technology Harbin China

2026-07-10规划控制

本文针对事件相机唇读中先做空间压缩会削弱局部唇部运动轨迹、仅靠词级分类难以约束发音过程的问题,提出先在每个空间位置建模时间演化的 TDA,并用带 CTC 的 VGA 引入 viseme 序列监督,再结合 EMA 师生一致性增强扰动鲁棒性。在 DVS-Lip 上的实验和消融显示三部分均带来性能贡献,定性结果表明模型学到一定发音结构。

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction Figure 1
2026-07-10cs.AI

Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction

Sophia Koehler, Antonia Wüst, Inga Ibs, Wasu Top Piriyakulkij, Wolfgang Stammer, Constantin Rothkopf, Kevin Ellis, Kristian Kersting

AIML Lab, TU Darmstadt, Hessian Center for AI (hessian.AI), Centre for Cognitive Science, TU Darmstadt, Cornell University, Max Planck Institute for Informatics, SIC, German Center for AI (DFKI)

2026-07-10强化学习

这篇论文针对现有视觉归纳基准多为被动推理、缺少主动实验的问题,提出 ZendoWorld,让智能体在 3D 视觉场景中通过提出新场景来归纳隐藏逻辑规则。核心洞察是标签预测准确率不等于规则恢复能力,感知与归纳会分别成为瓶颈。实验显示,VLM、贝叶斯、VLP 等方法均难以可靠完成完整交互闭环,VLM 生成的实验信息量低;符号输入能提升表现但仍明显落后于 Oracle 和人类,复杂规则上的归纳差距尤为突出。

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer Figure 1
2026-07-10cs.CV

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

Honor Device Co., Ltd.

2026-07-10视觉语言三维

针对写实风格迁移中预训练编码器易混入语义、造成结构伪影,以及点级 3D LUT 忽视色域拓扑导致色带和视频闪烁的问题,论文提出 StatLUT:用 Lab 空间直方图等空间无关统计特征替代图像编码器,并以 Seq2Seq Transformer 生成平滑 3D LUT,同时用轻量 DiT 从文本合成统计特征实现文本控色。实验称其在标准基准的视觉质量和定量指标上优于现有方法。

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression Figure 1
2026-07-10cs.CV

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma

Chris Xing TIAN, Rongqun LIN, and Xiandong MENG are with Peng Cheng Laboratory, Shenzhen, China., Chengkai WU, Kecheng CHEN, and Haoliang LI are with the Department of Electrical Engineering, City University of Hong Kong, Hong Kong SAR., Ziyu WANG and Shiqi WANG are with the Department of Computer Science, City University of Hong Kong, Hong Kong SAR., Siwei MA is with the School of Computer Science, Peking University, Beijing, China.

2026-07-10视觉感知

这篇论文针对现有 LLM 无损图像压缩把像素转成文本后依赖 tokenizer、数值 token 和词表 logits 的问题,提出 LUMI:绕过文本分词,将像素强度、通道与局部二维位置直接嵌入冻结 LLM 的连续空间,并用 256 类像素头配合算术编码。实验覆盖 LLaMA、Qwen、Gemma 及自然、医学、遥感图像,显示其在不同 tokenizer 家族间接口统一,压缩率具竞争力且跨域鲁棒性优于 tokenizer 型基线。

Benchmark Evaluation of Feredated Learning on Multi-organ Images Figure 1
2026-07-10cs.CV

Benchmark Evaluation of Feredated Learning on Multi-organ Images

Junbin Mao, Xu Tian, Jianchun Zhu, Ludi Li, Jin Liu

Hunan Provincial Key Laboratory on Bioinformatics, School of Computer Science and Engineering, Central South University, Changsha 410083, China, Xinjiang Engineering Research Center of Big Data and Intelligent Software, School of software, Xinjiang University, Urumqi, 830008, China

2026-07-10视觉感知生成模型数据集/基准

本文针对医疗影像联邦学习因隐私约束、跨机构器官与模态差异大而缺少统一评测的问题,提出 MobenFL 基准,整合 20 种近年联邦学习算法和 22 个覆盖 12 类器官的多模态医学影像数据集,并把准确性、效率、隐私保护及疾病、设备、模态差异纳入评估。主要结果是提供了比 FedCBD、Flamby 覆盖更广的评测框架,但具体算法性能排序和增益来源在给定片段中未充分说明。

Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks Figure 1
2026-07-10cs.CV

Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks

Aisha Urooj, Zain Ul Abdien, Neelu Madan

2026-07-10视觉感知数据集/基准

这篇论文针对结肠镜息肉分割中“排行榜进步”是否可信的问题,审计2015至2026年27篇论文,指出HD95等边界指标缺失、训练/测试划分混乱、几乎不做显著性检验。作者用统一评分器重评5个模型,发现Dice会掩盖边界和召回失败,最优模型会随指标和随机划分改变,OOD测试下所有模型显著退化,并提出PSRC报告清单。

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation Figure 1
2026-07-10cs.CV

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation

Hyeonseop Song, Seokhun Choi, Hoseok Do

2026-07-10视觉感知

本文针对大词表实例分割中长尾类别标注稀缺、T2I 伪标签噪声大和复制粘贴缺乏上下文真实感的问题,提出结合 T2I 场景多样性与上下文感知 I2I 编辑的合成数据框架,并用教师-学生筛选标签、VRAIN 对稀有类进行“放置-验证”增强。在 LVIS 上整体 AP 最高提升 4.0,稀有类 AP 最高提升 9.5,说明收益主要来自更可靠且更贴近真实场景的合成监督。

Unpaired Joint Distribution Modeling via Multi-Scale Image Representations Figure 1
2026-07-10cs.CV

Unpaired Joint Distribution Modeling via Multi-Scale Image Representations

Yihang Zou, Hui Zhang, Zuowei Shen, Chenglong Bao

2026-07-10视觉感知

针对成对 clean/noisy 数据难以获得、仅凭边缘分布学习联合分布又高度不适定的问题,论文提出 LUD-MSR:用潜变量概率图模型和 ELBO 从非配对数据建模,并以多尺度图像表示在粗尺度内容一致性与细节保留之间取舍。实验显示其可生成更真实伪配对样本,在真实图像去噪和 cryo-EM 去噪基准上优于既有噪声建模方法。

Dive Into the Implicit Biases of Low-rank Vision-language Alignment Figure 1
2026-07-10cs.CV

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

2026-07-10视觉语言视觉感知

论文针对视觉语言模型对齐阶段是否必须全参数更新这一惯例,考察在 LLM 侧使用 LoRA、LoHa、LoKr 等低秩适配的影响。核心洞察是低秩对齐带有保守、结构保持的隐式偏置,可缓解全参数对齐破坏视觉 token 线性可分性的 LS-curse,并偏向平坦、抗扰动子空间。实验覆盖多模型规模、编码器和百余配置,显示其在降低训练成本的同时,多数感知、推理与幻觉指标优于全参数对齐。

Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark Figure 1
2026-07-10cs.CV

Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark

Qishun Wang, Yapeng Li, Bin Luo, Zhengzheng Tu, Chenglong Li

2026-07-10视觉感知数据集/基准

针对RGBT视频目标检测中可见光与热红外帧常有空间错位、现有基准规模和场景单一的问题,论文提出DHNet:先用PSAM做局部块级对齐,再用双超图分别建模跨模态空间相关与相邻帧时序相关进行融合;同时发布DVT-VOD1000大规模无人机RGBT视频基准。实验称其在VT-VOD50和新数据集上达到SOTA,但模型增益与数据规模提升的贡献需进一步区分。

Leveraging Color Naming for Image Enhancement Figure 1
2026-07-10cs.CV

Leveraging Color Naming for Image Enhancement

David Serrano-Lozano, Luis Herranz, Michael S. Brown, Javier Vazquez-Corral

2026-07-10视觉感知

针对自动图像增强难解释、难按用户偏好微调的问题,论文提出 NamedCurves+:先用骨干网络标准化图像,再按颜色命名分解为若干颜色概率图,并为每类颜色学习可编辑的全局色调曲线,最后用 transformer 融合以处理局部上下文和减轻边界伪影。在修图、色调映射和曝光校正基准上,方法报告优于现有模型,同时保留按颜色曲线交互调整的能力。

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action Figure 1
2026-07-10cs.CV

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Mohamed bin Zayed University of Artificial Intelligence, ing are both crucial for scalable VLA. Our code is available, Considering that most available embodied demonstra-

2026-07-10视觉语言视觉感知

这篇论文针对现有 VLA 模型把视觉 token 等同处理、依赖人工选择的深度/分割等线索,导致动态场景中难以抓住任务关键证据的问题,提出 LEEVLA:用 DGDP 在潜在特征中自动定位空间变化且与指令语义一致的区域,再用 SFFG 建模这些区域的结构化演化,并通过互邻域对比损失约束拓扑一致性。实验称其在多个 VLA 基准上持续优于已有方法,说明显式任务相关注意与潜空间演化推理带来收益。

Attention-Based Segmentation of WMHs and Differentiation of Vascular vs. Demyelinating Lesions Figure 1
2026-07-10cs.CV

Attention-Based Segmentation of WMHs and Differentiation of Vascular vs. Demyelinating Lesions

Aina Tur-Serrano, Gabriel Moyà-Alcover, Francisco J. Perales López

2026-07-10视觉感知

该文针对FLAIR中血管性与脱髓鞘性白质高信号外观相近、人工勾画耗时且鉴别困难的问题,采用注意力分割加形态特征分类的两阶段流程,比较Attention U-Net、BAM、CBAM及2D、patch、2.5D训练策略。结果显示,Attention U-Net+BAM+CBAM在2D切片上分割最好,Dice约0.7155;patch设置下Attention U-Net较优。分类部分仅表明方向可行,仍需更大临床队列验证。

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions Figure 1
2026-07-10cs.CV

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

The University of Texas at Dallas, USA, LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS), McGill - ÉTS - MILA - CNRS - Université Paris-Saclay - CentraleSupélec, Tulane University, USA, Nanyang Technological University, Singapore, Hanyang University, South Korea

2026-07-10视觉感知数据集/基准

这篇综述聚焦视觉模型部署中持续分布漂移导致的性能退化,尤其是源知识遗忘与伪标签误差累积。文章将持续测试时自适应形式化,并按优化策略、参数高效方法和架构方法建立层级分类,汇总主流基准与实验对比。主要结果是给出CTTA评测协议、方法版图和局限分析,指出基础模型、黑盒系统与长期稳定适应仍是关键方向。

ProsMAE: Multi-Source MAE Pretraining for ISUP Grade Classification Figure 1
2026-07-10cs.CV

ProsMAE: Multi-Source MAE Pretraining for ISUP Grade Classification

Anna Jung, Kyeonghun Kim, Youngung Han, Eunseob Choi, Jiwon Yang, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

Seoul National University

2026-07-10视觉感知

该文针对全切片病理图像标注稀缺、染色与扫描域差异导致 ISUP 分级模型泛化不足的问题,提出用 PANDA、CAMELYON17、BRACS 多源切片进行 MAE 自监督预训练,再以冻结编码器和线性头做前列腺 ISUP 六分类。结果显示,多源预训练在单一 disjoint PANDA 划分上将最佳 QWK 从 PANDA-only 的 0.3757 提升到 0.4734,但外部队列与重复划分验证不足,增益可能主要来自 data。

SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation Figure 1
2026-07-10cs.CL

SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation

Wangyu Wu, Xiaojian Lin, Rong Fu, Zaiyang Yu, Xuhang Chen, Wenjun Yu, Zhenhong Chen

The University of Liverpool, University of Macau, University of Chinese Academy of Sciences 4 Tsinghua University, Shanghai University of International Business and Economics, Huizhou University

2026-07-10视觉感知

这篇论文针对Text-to-SQL中大模型推理成本高、难以在资源受限场景部署的问题,提出SQuaD-SQL:用LLM通过定制提示生成结构化合成监督,再以LoRA等参数高效微调小模型,并加入面向领域的合成数据适配。WikiSQL实验显示,1.5B级Qwen学生模型测试执行准确率达86.9%,接近更大模型且推理更快、显存更低;但结果主要集中在WikiSQL,跨复杂数据库泛化仍需进一步验证。

Unified Face Attack Detection via Fine-Grained Semantic Guidance Figure 1
2026-07-10cs.CV

Unified Face Attack Detection via Fine-Grained Semantic Guidance

Ning Jiang, Shijie Yu, Dingheng Zeng, Haiyang Yi, Yanhong Liu, Haifeng Shen, Ying Li

2026-07-10视觉感知

针对人脸识别面临深伪、对抗与重放等多类攻击且现有数据缺少细粒度伪造线索描述的问题,论文为 MS-UFAD 的 800 万级攻击图像生成逐图文本标注,并提出 DAF-Net 通过视觉-文本双分支、SFAM 聚合与全局/细粒度对齐学习伪造表征;实验显示其优于纯视觉和粗粒度文本方法,但增益可能部分来自更大规模数据与标注增强。

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio Figure 1
2026-07-10cs.CV

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

2026-07-10视觉感知学习理论

论文关注视频基础模型在接入机器人动作学习后丢失组合泛化能力的 VAG gap。作者提出 Temporal Ratio,用动作头对未来潜变量相对当前帧的注意力占比解释何时依赖预测 rollout,并据此做推理时自适应 guidance。结果显示该指标能预测 ID-OOD 差距,在 LIBERO 和真实双臂任务上提升 OOD 成功率且基本保持 ID 表现。

VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness Figure 1
2026-07-10cs.CV

VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

Iulia-Maria Udrea, Alexandra Diaconu, Bogdan Alexe

Department of Computer Science, University of Bucharest

2026-07-10视觉语言视觉感知数据集/基准安全鲁棒

针对罗马尼亚语唇读缺少大规模连续语音数据、且难以区分标注质量与数据规模作用的问题,论文构建VSRo-200:200小时播客视频均含ASR伪标签,其中100小时有人类转写,并设置OOD与噪声AVSR评测。结果显示同规模下人工标注略优,但伪标签可通过扩展到200小时降低WER;域外泛化仍明显退化,多模态融合在噪声下优于纯音频。

EVIS: A Physics-Grounded Event Camera Plugin for NVIDIA Isaac Sim Figure 1
2026-07-10cs.CV

EVIS: A Physics-Grounded Event Camera Plugin for NVIDIA Isaac Sim

Linli Shi, Ruijun Zhang, Ziyun Wang

Johns Hopkins University

2026-07-10视觉感知

面向事件相机机器人数据稀缺、标注昂贵且现有视频转事件仿真缺乏物理一致性的问题,EVIS把对数亮度触发的逐像素异步事件模型直接接入 Isaac Sim/Isaac Lab,并用运动向量插值降低高频渲染成本。实验显示,生成事件可被 E2VID、E-RAFT、Match-Any-Events 等预训练模型直接使用,30×8 配置在单 RTX 5090 上达到约 1.2 倍实时,但插值越激进重建误差越高。

No Figure
2026-07-10quant-ph

Equivariant Quantum Clustering with Differential Privacy: Parameter-Efficient Privacy-Preserving Analysis Across Heterogeneous Sensitive Datasets

B. M. Taslimul Haq, Md Arifur Rahman, Tawfiq Al Islam Foysal, Abdullah Al Noman, Abir Ahmed

B. M. Taslimul Haque, Department of Information Systems, Central Michigan University, Author Affiliation: 1Department of Information Systems, Central Michigan University, Department of Computer and Information Sciences, Trine University, Angola, IN , USA., Department of Computer Science and Engineering, American International, University–Bangladesh (AIUB), Dhaka , Bangladesh., Department of Information Systems, Wilmington University, New Castle, DE , USA., Department of Information Technology, Washington University of Science and Technology, multi-party computation protocols enable collaborative, coming, evaluated rigorously on the simulators available

2026-07-10数据集/基准

这篇论文关注敏感数据聚类在准确性与隐私泄露之间的冲突,提出将p4m等变参数共享量子聚类与全流程差分隐私组合的EQC框架。实验覆盖网络入侵、内部威胁和合成临床数据;NSL-KDD上准确率达79.3%,成员推断成功率降至38.3%。消融显示主要增益来自参数减少和隐私噪声,而非明确的量子效应。

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion Figure 1
2026-07-10cs.CV

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion

Jing Wang, Haoran Xiong, Zihao Yan, Minglun Gong, Hui Huang

2026-07-10生成模型三维

GRE-Diff针对户型平面生成中约束控制难、局部编辑易破坏整体一致性、离散顶点表示不稳定的问题,将每个房间表示为空间高斯分布,用连续的Gaussian Room Embedding引导扩散模型,并结合语义与几何双路径条件实现生成和编辑统一。RPLAN实验显示其能生成更符合约束、结构连贯且可编辑的多边形布局,但具体增益相对各模块的来源仍需消融进一步确认。

Mixture of Enhanced-View Experts for Multi-Query Vehicle ReID and A Large-Scale Benchmark Figure 1
2026-07-10cs.CV

Mixture of Enhanced-View Experts for Multi-Query Vehicle ReID and A Large-Scale Benchmark

Aihua Zheng, Jie Zhen, Chenglong Li, Jiaxiang Wang, Jin Tang

This research is supported in part by the National Natural Science Foundation of China under Grants 62372003 and 62376004, the University Synergy, and 2208085J18, and the Open Research Project of the Anhui Provincial Key Laboratory of Security Artificial Intelligence under Grant SAI202401. (* The

2026-07-10数据集/基准

这篇论文针对多查询车辆重识别中多视角信息常被简单平均或静态加权、难以建模跨视角关系的问题,提出 CAFNet/EV-MoE:先用 VFEM 增强各视角特征,再由带门控的动态多视角专家融合,并用 MAL 对齐多查询与单图特征。作者还构建 LCRI-1K 大规模基准;实验称该方法在复杂视角偏差下更稳健,但具体增益来源是否部分来自新数据规模仍需结合完整实验判断。

ConRad: Efficient Conformal Prediction for Radiomics Figure 1
2026-07-10eess.IV

ConRad: Efficient Conformal Prediction for Radiomics

Matt Y. Cheung, Ashok Veeraraghavan, Guha Balakrishnan

Department of Electrical & Computer Engineering, Rice University

2026-07-10视觉感知

医学影像中放射组学特征常由预测分割掩码计算,若分割模型过度自信,会低估下游测量不确定性。ConRad 的核心思路是把掩码几何、图像强度、预测特征和边界不确定性作为测试时协变量,用 conformalized quantile regression 生成自适应区间并保留覆盖保证。五个 2D 数据集、171 个特征上的实验显示,其区间效率优于 split CP 和 CQR 基线且覆盖率接近标称,消融表明主要增益来自边界不确定性特征。

LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection Figure 1
2026-07-10cs.CV

LDFE: Laplacian Decoupled Feature Enhancement Block for Dual-Stream CNN-based RGB-IR Object Detection

Wenhao Dong, Xiaoyan Luo, Linlin Yang, Haodong Zhu, Xiaorong Shi, Guodong Guo, Baochang Zhang

2026-07-10视觉感知

这篇论文面向低照度、恶劣天气下 RGB-IR 目标检测中特征融合易受模态噪声、全局与局部信息难兼顾的问题,提出 LDFE 模块:用拉普拉斯金字塔将双流 CNN 特征拆成全局与局部,再分别用状态空间增强和卷积相关增强做去噪与融合,最后重构特征。实验在六个 RGB-IR 数据集和多种 CNN 骨干上超过现有方法,平均 mAP 提升约 3.83%,但具体增益中各子模块贡献仍需结合消融判断。

UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation Figure 1
2026-07-10cs.CV

UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun

2026-07-10视觉感知

这篇论文针对无人机视频感知仍多停留在固定类别框级跟踪、难以支持开放词汇查询和实例级时序分割的问题,提出 UAV-OVVIS 任务,并用免训练的 AeroTrack 将开放词汇检测、短片段掩码传播和跨片段身份统一串联起来。作者还构建含 9 类、8279 条轨迹的 AeroVIS 基准;实验显示该框架在无人机场景优于通用 VIS 方法,并具备一定开放词汇泛化能力。

Post-Training in End-to-End Autonomous Driving Figure 1
2026-07-10cs.CV

Post-Training in End-to-End Autonomous Driving

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

2026-07-10视觉感知

端到端自动驾驶仅靠离线模仿学习难以处理闭环误差累积、稀缺恢复行为以及安全舒适等长程目标。本文将“后训练”明确为模仿学习之后的独立阶段,按监督来源统一梳理蒸馏、偏好对齐、强化学习和测试时优化四类方法,并总结评估饱和、闭环指标粗糙、实车验证不足和推理成本等问题;作为综述,文中未充分说明具体性能增益。

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts Figure 1
2026-07-10cs.CV

APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts

Emily Jin, Joy Hsu, Yiqing Xu, Weiyu Liu, Nick Haber, Jiajun Wu

Stanford University

2026-07-10视觉语言视觉感知强化学习规划控制

APIVOT针对长时程机器人操作中语义计划可行但空间上会碰撞或无处放置的问题,将语言推理与“想象未来状态”的视觉思维交替放入VLM规划过程,并用三阶段SFT学习何时调用视觉。KitchenWorlds实验显示其平均成功率达0.419,较最佳基线提升8.1个百分点,在空间约束更强时优势更大,同时以自适应选模态保留91%性能并减少39% token。

SAGA: Stable Acceleration Guidance for Autoregressive Video Generation Figure 1
2026-07-10cs.CV

SAGA: Stable Acceleration Guidance for Autoregressive Video Generation

Thanh-Nhan Vo, Trong-Thuan Nguyen, Trung-Hoang Le, Tam V. Nguyen, Minh-Triet Tran

2026-07-10视觉感知

论文针对自回归视频扩散在长时滚动中反复复用潜变量导致闪烁、抖动和结构漂移的问题,指出离散潜变量加速度会放大高频时序扰动,并据此提出无需训练的 SAGA:用有限窗口 Slepian 投影做加速度频域引导,配合结构化噪声初始化抑制短程相关。实验显示其在多种自回归扩散模型上提升时序质量,Self-Forcing 的 Temporal Quality 从 97.30 升至 97.91,且基本保持图像质量。

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting Figure 1
2026-07-10cs.CV

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

Carnegie Mellon University, University of Toronto

2026-07-10视觉感知生成模型规划控制

视频重光照需要同时保证物理可控性和长时序一致性,但纯逆渲染易受几何/材质估计噪声影响,端到端扩散又难精确遵循光照目标。LightCrafter的核心洞察是先用逆渲染与PBR把目标光照“烘焙”成代理视频,再让CogVideoX式视频扩散模型只做伪影修正和真实感增强。实验显示其在合成与真实重光照基准上优于现有方法,并提升长视频稳定性;不过增益部分可能来自artifact-matched数据构建与模型微调规模。

FedTR: Federated Learning Framework with Transfer Learning for Industrial Visual Inspection Figure 1
2026-07-10cs.CV

FedTR: Federated Learning Framework with Transfer Learning for Industrial Visual Inspection

Vikash Sathiamoorthy, Shuo Huai, Hao Kong, Di Liu, Wendy Yong Yi Loy, Christian Makaya, Daren Ho, Ravi Subramaniam, Qian Lin, Weichen Liu

HP-NTU Digital Manufacturing Corporate Lab, Nanyang Technological University, Singapore, School of Computer Science and Engineering, Nanyang Technological University, Singapore, Department of Computer Science, Norwegian University of Science and Technology, Norway, HP Inc., Palo Alto, California, USA

2026-07-10视觉感知

面向工业视觉检测中跨工厂数据受隐私约束且样本有限的问题,FedTR将公开数据预训练、迁移微调与联邦平均结合,用于墨盒标签缺陷的端到端文字检测与识别。实验在同质和异质私有数据上分别达到95.5%和94.2%的词级识别准确率,性能接近集中式训练;但具体增益中迁移学习、联邦聚合与数据相似性的贡献区分仍不充分。

LOGOS: Language-guided Oriented Object Detection in Aerial Scenes Figure 1
2026-07-10cs.CV

LOGOS: Language-guided Oriented Object Detection in Aerial Scenes

Trong-Thuan Nguyen, Minh-Triet Tran

2026-07-10视觉感知

LOGOS面向航拍/遥感场景中目标朝向多变、密集分布和背景杂乱导致的旋转框检测困难,提出用文本提示调制Transformer检测查询,并结合文本感知交叉注意力,使模型按指定类别聚焦相关目标、减少固定查询和方向歧义带来的冗余。论文在DOTA数据集上报告mAP优于现有方法,尤其在密集和旋转目标场景表现更好,但具体增益来源仍需看消融是否充分支撑。

Beyond Thermal Imaging: Inferring Thermophysical Properties from Time-Resolved Thermal Observations Figure 1
2026-07-10cs.CV

Beyond Thermal Imaging: Inferring Thermophysical Properties from Time-Resolved Thermal Observations

Chenghao Xu, Malcolm Mielle, Olga Fink

2026-07-10视觉感知

这篇论文针对热成像只能重建温度外观、难以反推出材料热物性的瓶颈,提出 ThermoField:把时序热图视为热传导过程观测,用神经场表示空间变化的热扩散率和边界换热系数,并通过可微热传导仿真约束几何与物性。实验表明其可联合重建三维几何、估计热物性场,并在未见环境条件下预测温度演化,但可辨识性仍依赖足够的热激励和温度梯度。

Evaluating the Effect of Frame Rate in Sequence-Based Classification of Autism-Related Self-Stimulatory Hand Idiosyncrasies Figure 1
2026-07-10cs.AI

Evaluating the Effect of Frame Rate in Sequence-Based Classification of Autism-Related Self-Stimulatory Hand Idiosyncrasies

Raunak Mondal, Peter Washington

School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA, Department of Information and Computer Sciences, University of Hawai‘i at Mānoa, Honolulu, HI, USA

2026-07-10视觉感知

针对自闭症相关自我刺激手部行为视频筛查中数据少、时序建模和采样率选择不明确的问题,论文在SSBD数据集上比较LSTM/GRU的姿态序列分类,并系统考察I3D迁移学习中的增强策略。核心发现是每15帧采样能兼顾噪声抑制与时序信息,GRU最高达98.75%、LSTM达97.5%,明显高于既有CNN基线;但三分类增强实验准确率仅约48.78%,且数据规模小,泛化可靠性仍文中未充分说明。

Adversarial Decoys: Misdirecting Attention-Based Defenses in ViT Figure 1
2026-07-10cs.CV

Adversarial Decoys: Misdirecting Attention-Based Defenses in ViT

Giulia Marchiori Pietrosanti, Giulio Rossolini, Giorgio Buttazzo

Department of Excellence in Robotics and AI, Sant’Anna School of Advanced Study, Italy

2026-07-10视觉感知

针对ViT中依赖高注意力定位对抗补丁的测试时防御,论文指出注意力本身可被操控:攻击者可将误分类补丁与独立优化的“诱饵”补丁解耦,让诱饵在多层注意力排序中压过真实攻击区域,从而吸引防御掩码。ImageNet上多种ViT和局部攻击实验显示,该方法能降低防御对真实对抗区域的覆盖,同时保留相当攻击效果,暴露了以注意力幅值判断威胁相关性的局限。

3D Reconstruction of deciduous Trees using low-cost UAV- and Crane-based Photogrammetry for Monitoring Shoot Elongation across entire Canopies Figure 1
2026-07-10cs.CV

3D Reconstruction of deciduous Trees using low-cost UAV- and Crane-based Photogrammetry for Monitoring Shoot Elongation across entire Canopies

Stephan Nebiker, Micha Tschanz, Nando Amport, Frederik Baumgarten

Institute of Geomatics, FHNW University of Applied Sciences and Arts Northwestern Switzerland, 4132 Muttenz, Switzerland –, The park at the campus of FHNW (University of Applied, forest laboratory in Hölstein, BL, this additional recording

2026-07-10三维

针对树木径向生长易监测、冠层尺度嫩梢伸长难以连续量化的问题,本文将低成本无人机摄影测量与塔吊多相机系统用于落叶树全季节三维重建,并引入3D打印真值枝条评估细枝可重建性。结果显示,低于250克的消费级无人机可达到整树5–6毫米三维点精度,重建完整度约92%–98%,但实际从点云稳定提取全树骨架和长期伸长量仍处于初步阶段。

Time-to-Collision Based Dynamic Obstacle Avoidance Using Pretrained Vision Models for Robots in Unstructured Environments Figure 1
2026-07-10cs.RO

Time-to-Collision Based Dynamic Obstacle Avoidance Using Pretrained Vision Models for Robots in Unstructured Environments

Erik Jagnandan, Mulugeta Haile, Gregory Barber, Pratik Chaudhari

2026-07-10机器人视觉感知

面向非结构化户外环境中动态障碍难以依赖大规模机器人数据或仿真策略的问题,论文将预训练单目深度 UniDepth、SuperPoint/SuperGlue 长序列匹配和束调整结合,显式估计关键点 3D 运动并按 TTC 选择避障方向。在 M3ED 实测数据上,TTC<1 秒帧检测精度 0.49、召回 0.38,真阳性中避让方向正确率 84%,覆盖 22 个障碍中的 20 个,但整体检测性能仍有限。

GIRAF: Towards Generalizable Human Interactions with Articulated Objects Figure 1
2026-07-10cs.CV

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

2026-07-10视觉感知

GIRAF瞄准机器人与虚拟代理中“人先走近再操作”铰接物体的长时序动作生成问题,弥补既有方法偏静态物体、手部局部或默认已接触的限制。其核心是文本条件扩散模型,结合物体中心接触表示、混合域训练、FiLM 条件和接触驱动增强来同时建模行走、手物接触与关节运动。实验显示其在 ParaHome 上较基线生成更合理的全身交互,并能泛化到未见物体位置,但对未见关节机制和复杂地形仍有限。

False Confidence: Automated Labels Confound Fairness Audits in Cervical Spine Segmentation Figure 1
2026-07-10eess.IV

False Confidence: Automated Labels Confound Fairness Audits in Cervical Spine Segmentation

Linus Juni, Aasa Feragen, Aditya Parikh

2026-07-10视觉感知

本文关注颈椎 MRI 自动分割在临床使用前缺少公平性审计的问题,指出混用专家金标与机器银标会让评估尺子本身带偏。核心洞察是银标若与被测模型共享金标来源,会高估约 8 个 Dice 点并压缩组内方差,制造年龄差异显著的“虚假置信”;在专家标签上,模型在性别、种族、年龄维度总体未显示实质不公平。

DreamCharacter-1: From 3D Generative Foundation Models to Product-Ready Character Generation Figure 1
2026-07-10cs.CV

DreamCharacter-1: From 3D Generative Foundation Models to Product-Ready Character Generation

Weizhe Liu, Yunjie Wu, Xiangqian Shu, Guangwei Wang, Xiangyu Xu, Peng Li, Yujie Li, Hengkai Guo

2026-07-10生成模型三维

面向游戏、虚拟人等场景中现有3D生成模型难以产出可绑定、细节充分且纹理一致的角色资产,DreamCharacter-1选择在预训练3D基础模型上做后适配,而非重训大模型;其关键在几何偏好优化、粗到细SDF生成、高分辨率纹理补全与推理加速的组合。实验和用户评测显示其在感知质量、结构鲁棒性和速度上优于多种角色生成基线,但各模块独立增益与数据规模影响仍需更多消融支撑。

SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept Figure 1
2026-07-10cs.RO

SASGeo: Stability-Aware Semantic Map Localization for GNSS-Denied UAVs -- A Framework and Synthetic Proof of Concept

Natalia Trukhina, Vadim Vashkelis

2026-07-10视觉感知

SASGeo面向GNSS受限无人机中VIO漂移需要绝对校正的问题,主张用道路、建筑、水系等更稳定的语义几何,而非易变外观来做跨视角定位;其创新在于把栅格语义对齐、对象关系图、稳定性/独特性权重和可拒绝的完整性判决合在统一评分中。合成220次试验中,全局语义描述子Recall@1为58.6%,空间语义匹配达94.5–95.5%,但尚未验证真实飞行,且各模块单独增益来源不清。

ReCoLoRA: Spectrum-Aware Recursive Consolidation for Continual LLM Fine-Tuning Figure 1
2026-07-10cs.LG

ReCoLoRA: Spectrum-Aware Recursive Consolidation for Continual LLM Fine-Tuning

Wentao Lu

2026-07-10视觉感知

本文针对连续微调中 LoRA 低秩更新叠加在固定基座上、易被新任务覆盖的问题,提出 ReCoLoRA:用权重谱和 elbow 准则选择各层有效秩,先适配主子空间,再通过递归重分解把已学任务合并进慢速主成分并开启新适配器。六任务 GLUE 上,四个 7–8B 模型中三者最终平均分优于 LoRA、PiSSA、AdaLoRA、DoRA,且训练参数更少;但优势对骨干敏感,TaskBank 的零遗忘依赖 oracle 路由。

Who Gets Missed in the Tail? Thresholded Subgroup Underdiagnosis in Long-Tailed Chest X-ray Classification Figure 1
2026-07-10cs.LG

Who Gets Missed in the Tail? Thresholded Subgroup Underdiagnosis in Long-Tailed Chest X-ray Classification

Ha-Hieu Pham, Hai-Dang Nguyen, Dang P. M. Cao, Thanh-Huy Nguyen, Min Xu, Trung-Nghia Le, Ulas Bagci, Huy-Hieu Pham

2026-07-10视觉感知

这篇论文关注胸片长尾多标签分类在部署阈值化后“谁被漏诊”:即使排序指标尚可,罕见病灶在特定性别、年龄、种族或保险子群中仍可能低于阈值。作者将审计单元定义为类别-子群阳性样本,并用诊断阶梯分离类别重加权、子群加权、GroupDRO与阈值选择的影响。结果显示,尾部感知阈值显著降低VinDr和MIMIC上的尾部FNR及最差子群FNR,但MIMIC残余漏诊率仍高,说明公平性取决于病灶、子群和操作点的共同作用。

2026-07-08

120 篇
ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation Figure 1
2026-07-08cs.CV

ELSA3D: Elastic Semantic Anchoring for Unified 3D Understanding and Generation

Tianjiao Yu, Xinzhuo Li, Yifan Shen, Onkar Susladkar, Yuanzhe Liu, Xiaona Zhou, Ismini Lourentzou

University of Illinois Urbana-Champaign

2026-07-08三维

ELSA3D针对统一三维模型中文本与几何仅靠扁平自注意力隐式交互、难以兼顾全局结构和局部细节的问题,提出尺度感知八叉树表示与可弹性路由的Anchor Tokens,将选中的语义线索绑定到相应几何尺度再回写统一序列。实验显示其在图像到三维、文本到三维和三维描述上优于最强统一基线,并相对非弹性版本将FLOPs和延迟约减半。

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation Figure 1
2026-07-08cs.RO

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

2026-07-08机器人三维

针对现有VLA在真实操作中缺少稳定三维几何理解、且难以同时建模场景动态与连续动作的问题,Lift3D-VLA将点云与预训练2D位置嵌入对齐,直接复用2D VLA编码三维输入,并用GC-MAE预测当前与未来几何,再由LLM多层生成动作块。在22个仿真和8个真实任务上优于既有VLA,MetaWorld、RLBench平均成功率分别提升10.8%和11.1%,真实基线提升4个百分点。

Vision as Unified Multimodal Generation Figure 1
2026-07-08cs.CV

Vision as Unified Multimodal Generation

Xiaoyang Han, Jianhua Li, Kewang Deng, Zukai Chen, Xuanke Shi, Sihan Wang, Boxuan Li, Linyan Wang, Siyi Xie, Xin You, Jinsheng Quan, Zhongang Cai, Haiwen Diao, Ziwei Liu, Lei Yang, Dahua Lin, Quan Wang

Nanyang Technological University, The Chinese University of Hong Kong, Peking University, Shanghai Jiao Tong University, Zhejiang University

2026-07-08视觉语言视觉感知

这篇论文针对视觉任务长期依赖检测、分割、深度、几何等专用结构的问题,提出把各类视觉标注统一转成文本、图像或混合形式的生成目标,并训练单一 UMM SenseNova-Vision,无需任务专用头。结果显示其在结构化理解、 dense 几何预测、分割和多视角几何上接近或匹配专用系统,还能按语言组合类别、颜色、区域等条件;但增益可能主要来自数据构造与模型规模,消融中对来源区分仍需谨慎看待。

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation Figure 1
2026-07-08cs.CV

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell

University of Toronto 2 Vector Institute

2026-07-08视觉感知三维

这篇论文针对单目视频中6-DoF位姿跟踪依赖CAD模型、深度、分割或特征且难处理无纹理、反光、透明和形变表面的问题,提出将跟踪改写为视频到视频翻译:用微调的视频扩散模型把查询像素的局部运动转成已知彩色多面体的代理视频,再用经典位姿求解器恢复轨迹。实验称在仅用合成数据微调、无需额外输入下达到SOTA,并可扩展到人脸、相机位姿和野外视频;但绝对位姿与长序列仍受模型生成长度和约束限制。

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models Figure 1
2026-07-08cs.CV

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li, Pengtao Xie

2026-07-08视觉感知

论文针对将文生图模型用于深度、法线、抠图、分割等稠密预测时仍沿用目标侧 VAE 解码的问题,指出这会把像素级任务误当作图像生成。ReChannel 保留 VAE 编码输入和冻结 DiT,用 LoRA 适配后以仅约 33K 参数的 token-local 线性头直接读出像素场。实验覆盖六类任务,在无 trimap 抠图、KITTI 深度和指代表达分割上达到新 SOTA,并较编辑式潜空间解码快最高 2.48 倍。

MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation Figure 1
2026-07-08cs.CV

MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation

Jiaju Han, Ma Yaqi, Yahui Chai, Xuemeng Sun, Xin Li, Qike Zhang, Yingying Zhao, Xiang Chen, Luwei Yang, Chengyin Hu, Jiahuan Long

2026-07-08视觉语言视觉感知

针对遥感视觉语言模型长期偏向 RGB、难以描述红外中的灰度结构与目标背景对比,MonoIR-RS 构建了仅面向红外的合成图文数据与评测,并将文本监督改写为 IR-aware 表达。实验表明,合成红外比灰度转换更接近真实热红外;微调 CLIP 带来最高 +12.8 平均召回增益,VLM 的红外线索覆盖率提升到 100%,但收益可能主要来自 data 与任务化适配。

Unsupervised Domain Adaptation for Calcification Classification in Mammography Across Multi-Site Datasets Figure 1
2026-07-08cs.CV

Unsupervised Domain Adaptation for Calcification Classification in Mammography Across Multi-Site Datasets

Xuan Liu, Derek L. Nguyen, Emily C. Barre, Jennifer Thomas, Thomas Lynch, Jeffrey R. Marks, E. Shelley Hwang, Marc D. Ryser, Joseph Y. Lo, Lars J. Grimm

2026-07-08数据集/基准

多中心乳腺钼靶数据中,设备厂商、成像技术和机构差异会削弱钙化良恶性分类模型的泛化。论文用 AdaIN/CycleGAN 做无监督风格迁移,生成面向不同厂商和 FFDM/合成2D技术的训练样本,再以 Swin Transformer V2 分类;在 EMBED 和 Duke 外部集上 AUC 分别由 0.68 提升到 0.72、0.73,说明输入级域适应有助于缓解跨站点偏移,但增益幅度有限且可能受额外数据影响。

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models Figure 1
2026-07-08cs.CV

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He

University of Oxford, Simon Fraser University

2026-07-08视觉语言三维

针对现有 3D-LLM 多局限于单房间、难以在真实家庭多房间环境中定位相关空间并进行跨房间推理的问题,CAIRN 将场景建成含物体关系与房间连通性的层次 3D 图,用房间 token、图网络、拓扑约束注意力和几何偏置引导信息流。作者同时提出 CAIRN-MR 基准,结果显示其在多房间 grounding、captioning 与问答任务上显著优于既有 3D-LLM,并保持单房间基准竞争力。

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment Figure 1
2026-07-08cs.AI

Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment

Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank Wang

National Taiwan University, The University of California, Merced

2026-07-08学习理论

这篇论文针对交互式物理推理中 VLM 容易产生不符合物理现实的 CoT、且推理与动作脱节的问题,提出 VAORA 奖励设计:分别用视觉对齐约束动作无关的场景理解,用视觉-动作对齐约束动作导致的结果,并以专家代理估计稠密成功概率稳定训练。实验显示其在 PHYRE 未见任务上优于 DQN 专家,并能零样本迁移到 Virtual Tool,在 Craft VQA 上也提升物理理解。

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation Figure 1
2026-07-08cs.CV

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

Shanghai Jiao Tong University, Yinwang Intelligent Technology Co., Ltd., Fudan University, Shanghai Artificial Intelligence Laboratory, University of Science and Technology of China, Georgia Institute of Technology

2026-07-08三维

这篇论文针对端到端自动驾驶评测中“真实视觉”和“闭环交互”难以兼得的问题,提出 Point as Skeleton:用离线累积的点云骨架把前景、背景资产解耦,并投影为彩色点与模板深度条件,配合 Reset-and-Roll 避免滚动扩散把未来条件泄漏到已提交状态中。nuScenes 与 nuPlan 实验显示,该方法在闭环自回归生成中提升了视觉质量和几何对齐,但具体泛化边界仍有待更多场景验证。

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models Figure 1
2026-07-08cs.CV

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

2026-07-08视觉语言视觉感知生成模型

红外遥感 VLM 正进入安防、灾害监测等高风险场景,但其对物理可解释扰动的鲁棒性缺乏评估。本文提出 AirflowAttack,用轻量生成器合成输入无关的热气流湍流扰动,在单个代理 CLIP 上优化后可跨模型迁移;在五个 CLIP 骨干上平均 ASR 达 48.5%,高于红外物理基线,并使六个 VLM 的场景分类准确率最高相对下降 38.2%,还会诱发将扰动误解为真实热证据的置信幻觉。

Assessing the Operational Impact of Poisoning Attacks over Augmented 3D Point Cloud Public Datasets for Connected and Autonomous Vehicles Figure 1
2026-07-08cs.CR

Assessing the Operational Impact of Poisoning Attacks over Augmented 3D Point Cloud Public Datasets for Connected and Autonomous Vehicles

Marwan Lazrag, Badis Hammi, Lorena Gonzalez-Manzano, Joaquin Garcia-Alfaro

2026-07-08数据集/基准三维

面向自动驾驶中依赖公开三维点云和数据增强构建仿真/训练数据的安全风险,论文聚焦投毒样本在GAN增强流程中的传播问题。核心洞察是,增强并不必然“净化”数据,反而可能复制或放大嵌入的后门与扰动。实验表明,投毒可穿透增强过程并影响下游通用分类器决策,但具体攻击强度与场景覆盖的外推范围仍需谨慎看待。

Mitigating Domain Shift in Conditioned Floor Plan Generation: Synthetic Pre-training for Data-Efficient Adaptation Figure 1
2026-07-08cs.CV

Mitigating Domain Shift in Conditioned Floor Plan Generation: Synthetic Pre-training for Data-Efficient Adaptation

Matthieu Ospici, Arnaud Gueze, Luc Bourrat, Adrien Bernhardt

2026-07-08视觉感知

本文关注条件式户型生成在不同数据集间迁移时的域偏移问题:现有模型往往学到特定地区或采集流程的几何规律,跨域性能可下降一个数量级。核心做法是用刻意“不真实”但满足无重叠、门位置和连通图约束的程序化合成户型预训练,迫使模型学习空间组装规则。实验覆盖 RPLAN、MagicPlan、Swiss Dwellings 和两类生成范式,显示该预训练显著提升零样本迁移与低数据微调,低数据场景较真实初始化最高提升约 40%,但与充分域内训练仍有差距。

Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation Figure 1
2026-07-08cs.CV

Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

2026-07-08视觉感知

这篇论文针对长视频多镜头生成中身份、场景和事件因果随时间漂移的问题,提出 PACR-Video:冻结文本到视频扩散骨干,仅用低秩时序适配器、镜头角色提示和递归提示库来路由历史上下文。核心洞察是把跨镜头记忆压缩为实体、地点、动作和风格提示,并按叙事依赖门控注入适配器。实验称其在六个基准上优于多类长视频生成基线,提升质量、语义对齐、身份一致性和转场连贯性。

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation Figure 1
2026-07-08cs.CV

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation

Linlin Zhang, Neema Jakisa Owor, Xiang Yu, Abby Watts, Yaw Adu-Gyamfi

Department of Civil and Environmental Engineering, University of Missouri- Columbia, Columbia, MO, USA, 65201, Federal Highway Administration (FHWA) notes are subjective, labor-intensive and pose safety concerns, while

2026-07-08视觉语言数据集/基准

针对交通标志巡检依赖人工、夜间逆反射仪成本高且昼夜指标割裂的问题,论文提出将微调VLM用于白天可读性、颜色、表面形状和遮挡评估,并结合LiDAR逆反射估计生成SCI。实验中LLaVA、Qwen优于InternVL,余弦相似度约0.67-0.76;在462块标志中识别出68块需立即更换。

EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage Figure 1
2026-07-08cs.CV

EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage

Max Gonzalez Saez-Diez, Jihoon Chung, Adam D. Wolsky, Gregory Lanzalotto, Dean Knox, Jonathan Mummolo, Brandon M. Stewart, Olga Russakovsky

2026-07-08视觉感知数据集/基准

针对警用执法记录仪视频在快速运动、遮挡和高风险事件中难以可靠理解的问题,EgoPolice构建真实警民互动数据集,并以秒级动作标注支持分类与多选问答评测。其核心价值在于把第一视角视频理解引入执法监督场景,揭示即便Gemini 2.5 Pro等强模型也难以准确识别“武器出现”等关键动作。

Verification of Dynamic Holographic Behavior in Identity Documents Figure 1
2026-07-08cs.CV

Verification of Dynamic Holographic Behavior in Identity Documents

Glen Pouliquen (1 and 2), Joseph Chazalon (2), Guillaume Chiron (1), Thierry Géraud (2), Ahmad Montaser Awal (1) ((1) IDnow Research Center, France, (2) EPITA Research Lab (LRE), France)

2026-07-08视觉感知

面向远程身份核验中手机视频难以自动验证证件全息防伪的问题,论文指出现有方法多能识别静态伪造,却缺少真实动态攻击评测且难泛化。作者发布 MIDV-DynAttack,加入 1200 个静态与动态攻击视频,并提出利用背景估计/抑制和伪标签学习全息外观与动态行为的验证方法。实验显示该方法在未用动态攻击训练的情况下达到新的最佳表现,基准也暴露了既有方法对动态攻击的不足。

Andha-Dhun: A First Look at Audio Descriptions in Hindi Figure 1
2026-07-08cs.CV

Andha-Dhun: A First Look at Audio Descriptions in Hindi

Ritabrata Chakraborty, Divy Kala, Nisheeth Bhooshan Gupta, Ganji Sreeram, Pailla Balakrishna Reddy, Makarand Tapaswi

2026-07-08视觉感知

面对印度电影无障碍法规推进但印地语音频描述资源和生成研究缺位的问题,本文构建了首个含8部长片、5870句人工印地语AD的Andha-Dhun数据集,并比较从英文密集视频描述直接生成与翻译英文AD两条路径。结果显示,机器翻译虽能保留大意,却引入伪影、压缩表达多样性,尤其难以处理文化特定项;人工印地语AD在文化适配和CSI消解率上明显更好,说明目标受众可理解性比逐字忠实更关键。

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders Figure 1
2026-07-08cs.CV

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

2026-07-08视觉语言

本文关注图像编辑中 VLM 单独能定位目标、作为扩散模型条件编码器却常失准的矛盾。作者提出 Analysis-by-Proxy,用轻量 Q-Former 探测单次前向的中间表征,发现定位信号集中在少数语义 token 和动态变化的中间层,而非常用最终层。实验显示 VLM 自回归框选准确率 89.0%,编辑管线仅 57.5%;将代理预测框作为显式空间条件后,复杂多目标编辑定位明显改善。

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation Figure 1
2026-07-08cs.CV

PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation

Yuhang Wu, Shuxiang Zhang, Wee Hian Ching, Chi Zhang, Miao Liu

2026-07-08视觉感知数据集/基准

论文针对现有文生图模型能遵循显式提示、却难以捕捉用户隐式审美偏好的问题,提出 PIPBench 作为包含用户画像的个性化图像生成评测框架。其核心创新是用心理与人口统计维度设计真实用户采集,并构造可扩展的合成代理数据,将画像与偏好图像共同纳入评测。实验比较了代表性方法,显示现有方法在利用画像和历史偏好对齐个体审美上仍有明显不足。

WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation Figure 1
2026-07-08cs.RO

WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation

Wongyun Yu, Youngwoon Kim, Minsu Cho

2026-07-08机器人规划控制

这篇论文针对人-物交互重定向中“手指姿态跟得准但接触力不对、操作仍失败”的问题,提出 WristMimic:用运动学目标约束身体和手腕,把接触丰富的手指交给物体轨迹与接触结果来学习。核心洞察是手腕既较少直接接触、又决定手指可达的抓取 affordance,因此通过手腕重置边界和奖励优先级可替代密集手指监督。实验显示其在多数据集和不同手型上达到或超过全手指监督方法,但细粒度手内操作与跨场景泛化仍受限。

TILDE: TILt-based Distributional Erasure for Concept Unlearning Figure 1
2026-07-08cs.LG

TILDE: TILt-based Distributional Erasure for Concept Unlearning

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

Indian Institute of Technology Hyderabad

2026-07-08视觉感知

针对文本到图像扩散模型的概念遗忘,论文指出现有擦除方法常能压低目标概念,却未定义遗忘后分布应落在哪里,因而容易损伤相邻良性概念或造成多样性坍缩。TILDE将问题表述为带遗忘约束的最小偏离分布对齐,用能量倾斜和残差GFlowNet学习相对预训练模型的分数修正。实验覆盖物体、艺术风格和角色,显示其在遗忘强度、保留质量及FID、FADE等分布指标上优于多种基线。

XRFormer: Multiscale Tokenization for XRF Representation Learning Figure 1
2026-07-08cs.CV

XRFormer: Multiscale Tokenization for XRF Representation Learning

Sofiane Daimellah, Sylvie Le Hégarat-Mascle, Clotilde Boust

2026-07-08视觉感知

针对XRF光谱中尖锐元素峰、宽背景结构和长程依赖难以被普通1D-CNN或通用Transformer同时建模的问题,XRFormer在自注意力前加入多尺度卷积tokenizer,以较低token数编码局部与多分辨率信息,并结合MSM与峰存在预测自监督预训练。在颜料识别上优于ViT、SpectralFormer和1D-CNN,解混结果接近更大参数的SpectralFormer且参数更省;PPP增益依赖峰显著性调参。

HoloCount: A Holistic Visual Counting Benchmark for MLLMs Figure 1
2026-07-08cs.CV

HoloCount: A Holistic Visual Counting Benchmark for MLLMs

Jinhong Deng, Limeng Qiao, Guanglu Wan

2026-07-08数据集/基准

这篇论文针对多模态大模型在视觉计数中易出现数值幻觉、现有基准多停留在简单感知的问题,提出 HoloCount 基准,用语义计数、分析计数和鲁棒性测试三层 taxonomy 覆盖 2480 个 QA、20 类细粒度任务和 1481 个视觉概念。对 20 多个主流 MLLM 的评测显示,即使强模型也会在空间/集合推理、高密度、遮挡和语言偏置等场景下明显退化,说明当前瓶颈不只是识别目标,还在可靠 grounding 与逻辑计数能力。

Temporal Modeling of Optically Variable Devices in Identity Documents Figure 1
2026-07-08cs.CV

Temporal Modeling of Optically Variable Devices in Identity Documents

Glen Pouliquen (1 and 2), Joseph Chazalon (2), Guillaume Chiron (1), Oriol Ramos Terrades (3), Thierry Géraud (2), Ahmad Montaser Awal (1) ((1) IDnow Research Center, France, (2) EPITA Research Lab (LRE), (3) Computer Vision Center (CVC), Spain)

2026-07-08视觉感知

这篇论文面向远程身份核验中透明 OVD/全息防伪特征难以在无控自拍视频里可靠验证的问题,指出逐帧检测会忽略其随视角变化的动态行为且攻击样本难以收集。作者提出基于合成扰动序列的判别式 span 分类器和用嵌入重建误差做异常分数的 masked sequence model,在无需攻击样本的自监督训练下,在 MIDV-Holo 与 MIDV-DynAttack 上超过既有方法,表明时序建模对抵御动态伪造是关键。

What Images Cannot Say: Language-Guided Olfactory Representation Learning Figure 1
2026-07-08cs.CV

What Images Cannot Say: Language-Guided Olfactory Representation Learning

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

2026-07-08视觉感知

这篇论文针对图像难以表达气味来源、电子鼻信号又常混合场景外环境因素的问题,提出用 VLM 生成物体、上下文和可推断气味描述,把语言作为视觉与嗅觉之间的语义桥。SCENT 将电子鼻信号对齐到图文共享空间,并用语言引导分解物体气味与环境贡献;在 New York Smells 上提升 smell-to-image 和 smell-to-text 检索,且表示更可解释。

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration Figure 1
2026-07-08cs.CV

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration

Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao

2026-07-08视觉感知生成模型

本文面向严重退化视频人脸修复中细节锐度与跨帧稳定难以兼顾的问题,提出 FADRA:在冻结的文本到视频扩散先验上加入 LoRA 与低质像素对齐融合,并用反复残差适配头在每个流匹配步骤重新利用低质线索,同时以频率感知损失约束易抖动的关键频段。实验显示其在人脸结构、身份保持和时间一致性上优于现有方法,减少闪烁伪影。

Learning to Throw Objects Safely in Multi-Obstacle Environments Figure 1
2026-07-08cs.RO

Learning to Throw Objects Safely in Multi-Obstacle Environments

Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei

2026-07-08安全鲁棒

面向仓储分拣等需要快速越距放置的场景,论文把有多障碍物的机器人投掷建模为安全强化学习问题,避免以往 TossingBot 等主要假设无障碍环境。核心做法是用固定网格的势场状态表示同时编码目标篮吸引和障碍排斥,并用动觉示教初始化安全投掷核,再由 SAC/DDPG/TD3 优化。实验显示势场表示比显式障碍状态更能扩展到未见障碍配置,其中 SAC 最稳定,真实机器人在杂乱场景和未见物体上最高达到 90% 成功率。

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery Figure 1
2026-07-08cs.CV

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

2026-07-08视觉感知

论文关注数字博物馆中 VLM 解读古希腊陶器时易受弱检索源、证据缺失和幻觉影响的问题。VaseMuseum 将 2D/3D 展品交互、VaseAgent 多模态推理、权威知识检索、来源筛选与回答级证据校验结合,并用无需训练的 GRPO 式候选选择提升引用和不确定性表达。仿真博物馆实验显示,其相较带搜索的 VLM 基线提高引用有效性,降低知识密集问题幻觉,并在证据含混时给出更中性的回答。

Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement Figure 1
2026-07-08cs.RO

Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement

Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki

Institute of Science Tokyo

2026-07-08视觉语言视觉感知

面向流匹配式 VLA 在实时机器人控制中因动作头迭代去噪导致延迟过高的问题,论文提出无需训练的 ActionCache:用多模态键缓存过往中间动作,并在相似视觉、语言和任务上下文中检索作为 warm-start,再少步细化生成动作。实验覆盖仿真与真实环境,在保持较高成功率的低延迟设置下,π0.5 和 GR00T-N1.6 的动作头最高分别加速 11.75 倍和 34.43 倍。

TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring Figure 1
2026-07-08cs.CV

TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring

Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Gaby Maroun, Fadi Dornaika, Cosimo Distante

2026-07-08安全鲁棒

这篇论文针对胸部 CT/DR 肺部严重程度评分依赖人工、且既有回归模型多只用影像外观的问题,提出 TMF-RSE,将 DINOv3 图像特征、SAM 肺掩膜结构先验和 LLaVA-Med 分区语义提示做三模态融合,并用 evidential regression 输出不确定性。实验在 Per-COVID-19 CT 与 RALO 上优于若干 Transformer 基线,报告 Per-COVID-19 验证集 MAE 4.02、PC 0.9629,RALO geographic extent MAE 0.339、PC 0.973;但外部医院和非 COVID 泛化仍文中未充分说明。

Generalized Synthetic Image Detection with Enhanced RGB-Noise Representation Learning Figure 1
2026-07-08cs.CV

Generalized Synthetic Image Detection with Enhanced RGB-Noise Representation Learning

Zhen Li, Gang Cao, Tian Zhang, Lifang Yu, Shaowei Weng

2026-07-08视觉感知

针对现有合成图像检测器在未知生成模型和压缩、模糊等退化下泛化不足的问题,论文提出 RNSIDNet:用 CLIP 提取的 RGB 语义通过 FiLM 动态调制 Bayar 卷积捕获的噪声特征,并以难样本感知对比学习扩大真假图像特征间隔。实验覆盖八个公开数据集,报告达到 SOTA,并兼顾鲁棒性与参数效率;但具体增益中模型结构、训练策略和新建 AMSID 数据的贡献仍需消融支撑。

OrchardBench: A Physically-Grounded, GPU-Parallel Apple-Orchard Simulation Benchmark for Agricultural Robotics Figure 1
2026-07-08cs.RO

OrchardBench: A Physically-Grounded, GPU-Parallel Apple-Orchard Simulation Benchmark for Agricultural Robotics

Humphrey Munn

2026-07-08机器人数据集/基准

针对果园采摘实地试验昂贵、不可复现且易损伤植株的问题,OrchardBench将苹果树建成GPU并行的物理仿真基准:L-system生成树体,枝条按梁理论弯曲并可断裂,果实可受力脱落,叶层可控遮挡,并配套移动机械臂闭环采摘任务与损伤指标。实验显示解析基线仅成功采摘约八分之一可达果实、检测后成功率约40%,主要瓶颈在遮挡感知和内上层冠层操作;但文中未做真实机器人验证,结果更适合作为仿真内相对比较。

Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair Figure 1
2026-07-08cs.CV

Bridging Diffusion Pruning and Step Distillation with Teacher-Aligned Repair

Jincheng Ying, Li Wenlin, Minghui Xu, Yinhao Xiao

School of Big Data and Artificial Intelligence, Guangdong University of Finance and Economics, School of Computer Science, Shandong University, GDUFE-UCM Joint Institute

2026-07-08生成模型

本文针对扩散模型压缩中“剪枝减网络”和“步数蒸馏减采样”相互脱节的问题,指出剪枝后直接做一步 SiDA 蒸馏会因学生与教师去噪场错位而失效。核心做法是在两者之间加入短暂的教师对齐修复,用噪声真实图像 latent 将剪枝模型拉回可蒸馏区域。ImageNet-512 上,20% 剪枝模型以 98.826M 参数和 1 次网络评估达到 FID 3.12,优于 63 步 EDM2-XS 的 3.53;30% 剪枝仍达 FID 4.26。

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models Figure 1
2026-07-08cs.AI

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

Franz Motzkus, Sebastian Bernhard

Franz Motzkus is with AUMOVIO, Germany, and with the Department of Applied Computer Science, University of Bamberg, Germany.

2026-07-08视觉感知

本文针对端到端自动驾驶模型缺乏透明接口、难以定位错误行为的问题,将稀疏自编码器式字典学习作为事后可解释层接入潜在特征,把轨迹评分分解为可理解概念并分析其因果影响。实验显示,抑制与错误行为相关的概念可在无需重训练的情况下改善碰撞规避、可行驶区域和红灯合规等指标,但具体增益在不同场景中的稳定性仍需进一步验证。

Synthetic-to-Real Translation for Class-Agnostic Motion Prediction Figure 1
2026-07-08cs.CV

Synthetic-to-Real Translation for Class-Agnostic Motion Prediction

Yizheng Wu, Hongwei Fan, Kewei Wang, Ruibo Li, Xingyi Li, Xiao Song, Zhe Wang, Chenjing Ding, Dongliang Wang, Zhiguo Cao, Guosheng Lin

Yizheng Wu, Kewei Wang, and Xingyi Li are with the Key Laboratory, Ruibo Li, Guosheng Lin is with Nanyang Technological University, Singapore 639798, Singapore.

2026-07-08视觉感知

这篇论文针对真实4D LiDAR运动标注昂贵、合成到真实迁移易因域差导致伪标签抖动和同物体运动不一致的问题,提出SR-Motion:联合预测运动与objectness先验,并用二者一致性筛除噪声、平滑伪标签;同时构建Motion4D合成数据集。实验称其能缩小合成到真实差距,在真实场景上优于朴素回归和直接教师学生迁移。

Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification Figure 1
2026-07-08cs.CV

Token-Based Dual-view Fusion and Adaptation of Large Vision Models for Breast Cancer Classification

Aysan Ghayouri Pirsoltan, Shima Babakordi, Mohammad Reza Mohammadi

2026-07-08视觉感知

针对乳腺钼靶诊断中 CC/MLO 双视角信息难以在多层级稳定交互的问题,论文提出在冻结 ViT 中结合共享视觉提示与专用融合 token,通过双向交叉注意力在多个深度传递跨视角信息,而非直接拼接特征。VinDr-Mammo 和 CMMD 实验显示其优于线性探测、仅提示调优和常规融合,BI-RADS 任务达 50.40% F1、0.8090 AUC,二分类较双视角基线提升 0.10 AUC。

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation Figure 1
2026-07-08cs.SE

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

The Hong Kong University of Science and Technology (Guangzhou), The Hong Kong University of Science and Technology

2026-07-08数据集/基准

UI2App针对截图生成网页评测长期偏重“像不像”、忽视“能不能用”的问题,提出首个面向静态截图交互推断的基准:45组多路由、状态一致截图,并用EXEC/NRS/VFS/IIS评估可运行性、导航、视觉和交互。六个前沿VLM结果显示视觉还原与交互实现明显脱钩,最高IIS仅39.3,跨页面状态尤其薄弱。

Visual graphs for image classification: does the structure affect performance? Figure 1
2026-07-08cs.CV

Visual graphs for image classification: does the structure affect performance?

Alessandra Ibba

2026-07-08视觉感知

针对CNN/ViT难以显式保留图像中的空间、拓扑和语义关系,论文在固定三层GCN下系统比较像素、超像素、兴趣点及KNN/RAG等视觉图构建方式。核心洞察是图拓扑和结构复杂度会显著影响分类表现,而节点/边嵌入选择整体影响较小;结果强调性能差异很大程度来自图构建及其前处理流程。

AlayaWorld: Long-Horizon and Playable Video World Generation Figure 1
2026-07-08cs.CV

AlayaWorld: Long-Horizon and Playable Video World Generation

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

Alaya Lab

2026-07-08视觉感知强化学习

针对传统游戏/机器人仿真环境制作成本高、难以在线扩展的问题,AlayaWorld把可交互世界建模为动作条件的视频自回归生成,并整合DiT、相机控制、3D缓存、历史压缩、误差库和少步蒸馏,以同时处理控制、一致性、长时稳定和实时性。文中主要结果是给出全栈开源框架、可复现实验与评测工具,并展示跨游戏、真实和合成场景的实时可玩生成;但完整技术细节和定量实验尚未充分说明。

Straight-Path Flow Matching for Incomplete Multi-View Clustering Figure 1
2026-07-08cs.CV

Straight-Path Flow Matching for Incomplete Multi-View Clustering

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

School of Software Engineering, Huazhong University of Science and Technology, Australian Institute for Machine Learning, Adelaide University, Adelaide, Australia, University of Auckland, Auckland, New Zealand, University of New South Wales, Sydney, Australia, Communication University of China, Beijing, China, i.e., not all views are consistently available for each sample. Compared to the

2026-07-08生成模型

本文针对不完整多视图聚类中缺失视图恢复与聚类目标不一致的问题,指出扩散式从类无关噪声出发的随机去噪轨迹容易破坏簇结构。核心创新是用观测视图与缺失视图潜表示之间的直线路径流匹配,学习确定性 ODE 传输,并结合簇级对比与熵对齐约束跨视图一致性。实验称在标准 IMVC 基准上达到 SOTA,但具体增益来源仍需看消融细节。

MAC-XA: Multi-view Anatomy-Correspondence Fusion for Coronary Stenosis Reporting from X-ray Angiography Figure 1
2026-07-08cs.CV

MAC-XA: Multi-view Anatomy-Correspondence Fusion for Coronary Stenosis Reporting from X-ray Angiography

Chen Jia, Baochang Zhang, Fatia Kusuma Dewi, Amir Yousefi, Heribert Schunkert, Reza Ghotbi, Nassir Navab

2026-07-08视觉感知

本文针对冠脉造影单视角易受重叠、缩短和分叉混淆影响,导致狭窄定位与分级不稳的问题,将多视角报告生成重写为受解剖对应约束的融合任务。核心做法是用可控合成造影从3D几何生成patch级跨视角对应监督,并在真实图像中用该对应矩阵先对齐辅助视角特征再融合。实验显示其在合成数据和50例真实病例零样本迁移中,相比单视角和常规多视角注意力方法提升对应一致性及结构化报告指标。

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection Figure 1
2026-07-08cs.CV

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

Department of Computer Science, Shri Guru Buddhi Swami College, School of Computational Science, Swami Ramanand Tirtha Marathwada University

2026-07-08视觉感知数据集/基准

针对商业API、零样本视觉语言模型和开源检测器长期各自评测、难以横向比较的问题,论文提出VendorBench-100:用100张刻意困难且类别不均衡的深伪图像基准、统一输出格式和MCC/ROC-AUC双指标评估36个模型。主要洞察是排名能力与默认阈值决策质量常不一致;结果显示商业API中位表现最好,视觉LLM居中,开源方法整体较弱但个别模型可接近或超过部分LLM。

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution Figure 1
2026-07-08cs.CV

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

Lihua Wei, Huatong Gao, Jia Gong, Zhiyu Tan, Hao Li, Jun Liu, Zhihua Ren

2026-07-08视觉感知

本文针对MRI超分中常把低分辨率输入视为固定起点的问题,强调分辨率与SNR受采集物理耦合,低分辨率图像未必是最优观测。方法将2D Gaussian Splatting改造成坐标式、分辨率无关重建,并加入解剖/成像系统先验、物理约束信号模型和仿真到真实的元学习。实验称在动态分辨率数据和常规基准上达到SOTA,但具体增益来源仍需结合消融进一步判断。

WING: A Window-Prior-Based Generative Network with Gated Inception for Cross-Modality CT Synthesis Figure 1
2026-07-08cs.CV

WING: A Window-Prior-Based Generative Network with Gated Inception for Cross-Modality CT Synthesis

Siyuan Mei, Yan Xia, Yipeng Sun, Siming Bayer, Zirong Li, Chengze Ye, Daiqi Liu, Fuxin Fan, Yixing Huang, Andreas Maier

2026-07-08生成模型

这篇论文针对MRI/CBCT生成合成CT时,HU值动态范围大、长尾结构易被全局回归抹平的问题,提出把目标拆成肺、软组织、骨等CT窗位表示,再由Gated Inception生成器、软融合与细化Transformer联合重建全范围CT。实验显示WING在MRI-to-CT和CBCT-to-CT基准上优于既有方法,并能用单一紧凑模型支持多解剖部位合成。

EeveeDark: A Binary Neural Framework for Low-Light Video Enhancement via Event-Guided Sensor-Level Fusion Figure 1
2026-07-08cs.CV

EeveeDark: A Binary Neural Framework for Low-Light Video Enhancement via Event-Guided Sensor-Level Fusion

Onur Eker, Erkut Erdem, Aykut Erdem

2026-07-08视觉感知

低照度视频增强在机器人感知中既要恢复颜色、细节和时序一致性,又受嵌入式算力限制。EeveeDark的核心思路是把传感器级RAW的空间信息与事件流的高时间分辨率结合,并用二值网络、轻量融合和事件引导跳连门控降低开销。实验显示其明显优于既有二值方法,并在接近全精度模型效果的同时提供更好的效率权衡。

MoWorld: A Flash World Model Figure 1
2026-07-08cs.CV

MoWorld: A Flash World Model

Team Moxin, Deyi Ji, Tianrun Chen, Xin Zhang, Jiale Yang, Qi Zhu, An Zhao, Zihao Xie, Han Wang, Xuanyi Liu, Yixiang Zhou, Pei Liu, Yi Tan, Cheng Chen, Dayi Zhu, Mingyu Wei, Hanjie Xu, Jun Liao, Siqi Li, Lingyu Lu, Hongye Fang, Hongming Tan, Youjiang Zhu, Taiyu Zhang, Zejian Li, Chaotao Ding, Lanyun Zhu, Yunhe Pan, Lingyun Sun

2026-07-08强化学习

MoWorld针对世界模型难以在具身智能、自动驾驶等闭环场景中实时交互的问题,强调不再单纯扩大模型,而是做数据、训练、蒸馏、推理和NPU部署的协同优化。其核心是3D原生几何一致数据引擎、课程式跨帧预训练、去噪步蒸馏与混合精度并行推理;报告可达50 FPS,推理成本为已有世界模型的30%-50%,但部分增益可能主要来自data与系统工程,消融归因仍需谨慎。

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition Figure 1
2026-07-08cs.CV

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

School of Information Science and Technology, Northwest University, Xi’an, Shaanxi, China, Laboratory of Intelligent Information Processing, Institute of Computing Technology, Beijing, China

2026-07-08视觉语言视觉感知

面向细粒度识别中CLIP难以区分相近类别、少样本标注成本高的问题,论文提出SCPT,把类别间语义关系显式编码进文本提示,并用语义凝聚损失压制冗余监督、突出判别成分。实验覆盖14个细粒度基准,报告在少样本和base-to-novel泛化设置下均超过既有提示调优方法。

Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability Figure 1
2026-07-08cs.CV

Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability

Runfeng Qu, Pia K Bideau, Ole Hall, Julie Ouerfelli-Ethier, Klaus Obermayer, Olaf Hellwich

2026-07-08视觉感知

本文关注场景图生成中检测器式与查询式方法行为差异未被拆解的问题,提出以“检测器条件可达性”划分可检测与不可检测三元组,发现前者擅长检测器覆盖关系,后者能补足不可达关系但会损失可达关系表现。基于此设计 Dual-SGG,用双查询在统一解码器中融合两类推理,在 Visual Genome、Open Images v6 和 GQA-200 上提升整体性能。

MobileWan: Closing the Quality Gap for Mobile Video Diffusion Figure 1
2026-07-08cs.CV

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

2026-07-08视觉感知生成模型

移动端视频扩散模型通常因内存、注意力复杂度和解码开销被迫缩小到低参数量,导致质量落后于服务器模型。MobileWan的核心洞察是无需从小模型出发,而是将Wan2.2-5B通过分块自回归的循环蒸馏、因果线性注意力、可学习注意力头剪枝、步数蒸馏和VAE解码优化改造成可在手机上运行的系统。结果是在商用移动设备上生成5秒、480×832、16FPS视频,端到端约20秒,VBench达到83.79。

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control Figure 1
2026-07-08cs.CV

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control

Junha Kim, Hyunjoon Park, Donghyeon Cho

Hanyang University, Seoul, Republic of Korea

2026-07-08规划控制

本文针对高分辨率艺术图像外扩中逐步生成易累积结构错误、文本提示难以精确控制布局且推理慢的问题,提出先生成低分辨率全局蓝图、再并行合成局部高分辨率补丁的两阶段扩散框架,并用边界框布局条件控制扩展区域内容。实验称在大规模艺术数据上提升视觉质量和语义一致性,推理最高约加速2.4倍。

Enhanced Seam Segmentation for Automated Welding Robot in Construction Through Transfer Learning: Addressing Limitations of Bilateral Segmentation Network Figure 1
2026-07-08cs.CV

Enhanced Seam Segmentation for Automated Welding Robot in Construction Through Transfer Learning: Addressing Limitations of Bilateral Segmentation Network

Keonvin Park, Yong Ann Voeurn, Hyeokjun Kweon, Doyun Lee

Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, 08826, Republic of Korea, Department of Civil Engineering and Construction, Georgia Southern University, Statesboro, GA 30460, USA, The Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University, Seoul, 06974, Republic of Korea

2026-07-08机器人视觉感知模仿学习

面向建筑场景机器人焊接中金属反光、强光照和细窄焊缝导致的分割断裂问题,论文不改动 BiSeNetV2 结构,而是用迁移学习与 CE-Lovász 混合损失提升学习稳定性和焊缝连续性。结果显示 Joint IoU 达 81.76%、mIoU 达 90.73%,较 OHEM 基线 Joint IoU 提升 22.36 个百分点,并在相同计算量和速度下恢复 96.33% 的严重零 IoU 失败案例。

RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image Retrieval Figure 1
2026-07-08cs.CV

RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image Retrieval

Junsong Wang, Weiqing Min, Guorui Sheng, Tao Yao, Lili Wang, Shuqiang Jiang

College of Computer Science and Artificial Intelligence, Ludong University, Institute of Computing Technology, Chinese Academy of Sciences, University of Chinese Academy of Sciences, College of Computer Science and Artificial Intelligence, Ludong University Yantai China, Institute of Computing Technology, Chinese Academy of Sciences Beijing China, University of Chinese Academy of Sciences Beijing China

2026-07-08视觉感知

面向大规模细粒度食物图像检索,论文指出现有哈希方法难以同时处理相似菜品的局部关系、频率噪声和多层语义融合。RFHNet以级联层次哈希为框架,结合细粒度关系建模、 multi-frequency 调制融合和层次语义协同生成二值码;在6个食物数据集上,相比已有哈希方法12-bit mAP提升4.44%至17.20%,但增益主要来自各模块协同的具体占比仍需看消融细节。

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing Figure 1
2026-07-08cs.CV

Tuning-Free Latent Diffusion Models for Ultrahigh-Resolution Image Editing

Wanglong Lu, Lingming Su, Kaijie Shi, Minglun Gong, Xiaogang Jin, Hanli Zhao, Xianta Jiang

2026-07-08视觉感知生成模型

面向手机等设备产生的 8K 级真实图像,现有扩散编辑受限于低分辨率训练、显存和后处理超分带来的细节损失。论文提出 UltraDiffEdit,在不微调 LDM 的情况下用多尺度渐进编辑、多 patch 编码、全局-局部一致去噪和混合 patch 采样来保留未编辑区域并减轻边界伪影。实验称其可在单张 RTX 3090 上处理最高 8K 图像,较现有方法在细节和一致性上更好。

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models Figure 1
2026-07-08cs.CV

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

2026-07-08视觉感知

本文针对文生图安全防护中“视觉同义词”越狱问题:攻击者用文本上无害、但视觉上会收敛到暴力或裸露概念的提示绕过过滤。核心洞察是显式危险提示与 VSA 在生成过程中会汇入少数语义注入注意力头,Aegis 因而在推理时只对这些头做相似度感知排斥。实验称其在 SD1.4 上将域内暴力/裸露 VSA 的 ASR 降至 0.00/0.03,域外攻击 ASR 不高于 0.09,并较好保留正常生成质量。

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation Figure 1
2026-07-08cs.CV

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

2026-07-08数据集/基准

针对现有 Web agent 基准规模小、领域覆盖窄且常把“到达页面”误当作任务完成的问题,WebRetriever 构建了覆盖 800 个真实网站、1550 个任务的大规模在线评测,并提出结合多源交互上下文的 NavEval 及三类协议。实验显示 NavEval 与人工判断一致率约 90%,且不同协议下性能差异明显,说明导航成功不足以预测真实端到端效果。

RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations Figure 1
2026-07-08cs.CV

RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations

Woo Jae Kim, Kyle Min, Suhyeon Ha, Joonsung Jeon, Sung-eui Yoon

2026-07-08安全鲁棒

这篇论文针对多扰动对抗训练中不同威胁共享单一路径导致鲁棒性相互牵制的问题,提出 RoME:用共享主干承载威胁共性特征,以低秩专家学习威胁特异信息,并通过局部/全局双尺度门控与威胁引导的路由多样化避免 MoE 的威胁无关路由。实验称其在 CIFAR-10、ImageNet-100/1K 上提升 union robustness、自然精度,并改善未见威胁鲁棒性。

EcoVision: AI-Powered Drone Imaging for Salt Marsh Vegetation Monitoring and Dominance Mapping Figure 1
2026-07-08cs.CV

EcoVision: AI-Powered Drone Imaging for Salt Marsh Vegetation Monitoring and Dominance Mapping

Innocent Onyenonachi, Peter J. Lawerance, Nadia Kanwal

2026-07-08视觉感知

盐沼植被人工样方调查成本高、主观性强,卫星又难到物种尺度,本文用低空无人机 RGB 图像构建 EcoVision:先以 SegFormer 做植被语义分割,再用连通域和 ConvNeXt 做物种级分类,并汇总为 2×2 米优势度网格。面向两类盐生草,分割 mIoU 约 0.56、像素准确率约 0.96,目标级分类 F1 约 0.99;优势度与实地样方平均差异低于 8%,但泛化范围仍主要限于文中场景。

PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet Figure 1
2026-07-08cs.CV

PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

Xiaopei Wu, Chenshu Hou, Liang Peng, Dan Xu, Binbin Lin, Xiaoshui Huang, Yuenan Hou, Yu Li, Wenxiao Wang, Haifeng Liu, Deng Cai, Wanli Ouyang

SH AI Lab 2 ZJU 3 HKUST 4 SJTU

2026-07-08视觉语言三维

PVCap针对3D密集描述中空间布局增强不足、骨干与检测头表达偏弱的问题,提出用PseudoCap随机重组实例生成伪场景,并借助教师-学生模型产生筛选后的伪描述标签;同时设计基于体素特征的VoxelCapNet适配描述头。实验在ScanRefer和Nr3D上分别将CIDEr@0.5IoU较SOTA提升11.41%和13.99%,但增益可能部分来自data scaling。

MSA-DCNN: A Data-Efficient Multi-Scale Deformable CNN for Medical Image Classification Figure 1
2026-07-08cs.CV

MSA-DCNN: A Data-Efficient Multi-Scale Deformable CNN for Medical Image Classification

Hamza Hussaini, Shahana Bano, Eyad Elyan, Carlos Francisco Moreno-García

2026-07-08视觉感知

针对医学图像中病灶形态尺度变化大、标注稀缺且普通 CNN 固定采样难以捕捉细粒度结构的问题,MSA-DCNN 将多尺度可变形卷积、尺度内通道/空间注意力、跨尺度注意力融合和辅助自蒸馏放入同一训练框架。实验在 PBC、C-NMC、ISIC-2020 及外部白血病集上显示,其以更少参数取得较强的准确率、F1 和二分类 AUC,低标注和分布偏移下仍优于多类 CNN、ViT 与半监督基线。

Why does Deep Learning Improve Visual SLAM? Figure 1
2026-07-08cs.CV

Why does Deep Learning Improve Visual SLAM?

Giovanni Cioffi, Davide Scaramuzza

The authors are with the Robotics and Perception Group, Department of Informatics, University of Zurich, Switzerland, https://rpg.ifi.uzh.ch .

2026-07-08视觉感知

本文针对深度学习为何提升视觉 SLAM 鲁棒性这一未解问题,控制性地将 DROID-SLAM 的学习光流匹配与不确定性估计接入 ORB-SLAM3,而保留经典几何后端。结果显示,性能提升主要来自学习型 2D 数据关联和残差加权不确定性,而非循环架构;ORB-SLAM3-OF-U 在 TartanAir 接近深度方法,并在 UZH-FPV 等分布外、高速和退化视觉场景中表现更强。

KOAL: Knowledge-Driven Prostate Cancer Grading with Ordinal-Aware Learning Figure 1
2026-07-08cs.CV

KOAL: Knowledge-Driven Prostate Cancer Grading with Ordinal-Aware Learning

Zheng Guo, Jiaqi Cui, Haocheng Xiong, Jize Han, Bo Liu, Qianwen Zhang, Rui Chen, Yan Wang

School of Computer Science, Sichuan University, China, Shanghai Changhai Hospital, Naval Medical University, China, Renji Hospital, Shanghai Jiao Tong University School of Medicine, China, methods. Code is available at: https://github.com/Gother-GZ/KOAL., ture engineering, which are labor-intensive and exhibit limited generalization capabili-, ties across different centers. More recently, deep learning (DL) techniques have been, model GGG as flat categorical labels or, at best, as a single ordinal variable. Although

2026-07-08视觉感知

本文针对前列腺癌 GGG 分级过度依赖 mpMRI、忽略 PSA/年龄与放射报告知识,且把等级当作扁平标签的问题,提出 KOAL:用临床变量调制影像特征,用 LLM 从训练报告和指南构建等级语义原型,并显式建模主/次 Gleason 模式后映射到 GGG。在 PI-CAI 与院内数据上优于现有方法,但具体增益中知识引入与结构约束的相对贡献需看消融细节。

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models Figure 1
2026-07-08cs.CV

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

2026-07-08视觉感知

论文针对房地产平台中问卷 PDF 蕴含法律状态、房屋状况和能源供应等关键信息却难以结构化的问题,提出先按文档形态分类,再用 DeepSeek R1 按固定 schema 抽取 35 个属性的端到端流程。其主要价值在于把异构真实平台文档接入批处理管线,而非训练新模型;在 3965 份文档中对 2781 份可处理文本实现全部抽取,形成 2766 条记录,并通过相似度匹配和聚类验证可用性。

OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations Figure 1
2026-07-08cs.CV

OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations

Jun Wei, Xinchang Liu, Yu Liu, Chuhua Yang, Shuhui Wang, Hui Huang

2026-07-08视觉感知学习理论

针对医学病灶分割中像素级标注成本高、普通框又难表达细长或倾斜病灶的问题,OBBSeg用有向框作为介于弱监督与全监督之间的标注形式,并通过可微的Mask-to-OBB损失减弱矩形框偏置,再结合提示引导的PAFE、DBFE增强前景表征。实验覆盖13个数据集和5种模态,结果显示其优于现有弱监督方法,部分性能接近全监督分割。

Unlearnable Faces: Privacy Protection Surviving Extraction Pipeline Figure 1
2026-07-08cs.CV

Unlearnable Faces: Privacy Protection Surviving Extraction Pipeline

Byunghoon Oh, Sunghwan Park, Jaewoo Lee

2026-07-08视觉感知

这篇论文针对人脸隐私保护中一个现实失效点:现有 unlearnable perturbation 在上传图像上生成,但攻击者训练前会裁剪并缩放人脸,导致噪声被裁掉或低通滤除。作者提出 LPID,将人脸提取流程显式纳入优化,只在裁剪区域内生成并让扰动能量落在缩放后仍保留的频段。实验显示,在未见身份和 crop+resize 攻击管线下,LPID 将攻击者准确率压到 10% 以下,同时保持 32.7 dB PSNR 和 0.161 LPIPS 的视觉隐蔽性。

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation Figure 1
2026-07-08cs.CV

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

2026-07-08视觉感知强化学习规划控制

针对人-物交互视频生成依赖逐帧姿态等密集时序控制、标注成本高且易导致动作僵硬的问题,SparseCtrl-HOI改用少量指定时刻关键帧控制;其核心在于用TiRoPE对齐关键帧时间位置,并通过MLLM提取手物变化的高层运动先验注入DiT,生成中间过渡。实验称该方法在电商直播场景中降低标注开销,并提升交互一致性和运动自然度。

SpecTrack: Spectral Prompt Guided Adaptive Experts for Multispectral Object Tracking Figure 1
2026-07-08cs.CV

SpecTrack: Spectral Prompt Guided Adaptive Experts for Multispectral Object Tracking

Xingyu Tan, Yunrong Qin, Mengjie Hu

aBeijing University of Posts and Telecommunications, China, .3% AO. The source code will be available at https://github.com/Star-Swift/SpecTrack.

2026-07-08视觉感知

SpecTrack针对多/高光谱跟踪中不同帧、不同目标状态的歧义程度差异,认为固定容量的光谱-空间建模会浪费或不足。其核心是用光谱提示路由器按搜索区域选择容量递增的SAMoE专家,并用共享全局专家稳定稀疏路由。实验在MUST、MSITrack、HOTC20上取得有竞争力的AUC,B224在MUST达62.4% AUC且43.7 FPS,L384偏向精度。

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention Figure 1
2026-07-08cs.CV

Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention

Daniel Shalam, Emanuel Ben Baruch, Avi Ben Cohen, Tal Remez

2026-07-08视觉语言三维

这篇论文针对多模态大模型做目标框、视频/音频时间窗定位时高比例幻觉且 token 概率难以反映可信度的问题,提出无需训练的 MTLA:只统计预测区域内、跨坐标与标签等多 token 的注意力质量。实验显示其在多模型和三种模态上提升幻觉检测 AUROC,并将 8B 开源模型零样本 COCO AP 从 20.4 提至 37.0。

Decoupled Single-Mask Annotation Noise Detection via Cross-Sectional Patch Self-Consistency Figure 1
2026-07-08cs.CV

Decoupled Single-Mask Annotation Noise Detection via Cross-Sectional Patch Self-Consistency

Yinheng Zhu, Xiaowei Xu

2026-07-08视觉感知

论文针对血管 CT 数据常只有单次标注、局部噪声难以审计的问题,提出不依赖训练过程的单掩膜噪声检测框架。核心洞察是管状结构在中心线正交截面上具有跨位置、跨个体的外观复现性,近似图像 patch 应对应一致掩膜;若相似 patch 的掩膜差异显著,则可定位可追溯的可疑标注。ImageCAS 实验显示,该质量图用于加权训练使 CPR-DSC 提升 1.4%、HD-95 降低 4.1%,并揭示横向和斜向血管标注错误率约为轴向结构的 5.1 倍。

NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation Figure 1
2026-07-08cs.CV

NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation

Shuheng Zhang, Feng Wu

2026-07-08视觉感知三维安全鲁棒

NegROI面向交互式三维点云分割中少量点击下边界模糊、复杂背景误检和跨数据集密度尺度变化导致的鲁棒性下降问题。方法将当前点击附近的局部ROI提升到细粒度体素网格做多分辨率细化,并用不确定性选择待细化区域;同时通过场景条件负提示建模难背景,配合多样性正则和边界感知硬负样本挖掘抑制误检。在ScanNet、S3DIS和KITTI实验中,论文报告其点击效率、误检控制和跨数据集鲁棒性均优于现有基线。

CMDR: Contextual Multimodal Document Retrieval Figure 1
2026-07-08cs.IR

CMDR: Contextual Multimodal Document Retrieval

Ryota Tanaka, Taku Hasegawa, Kyosuke Nishida

2026-07-08视觉语言

这篇论文针对多模态文档检索中过度依赖单页词面或语义匹配的问题,指出长文档查询常需要跨页上下文才能定位相关页面。作者提出 CMDR-Bench,并设计联合编码多页、再拆分生成页级表示的 CMDR-Embed,同时用上下文多模态对比学习和同文档硬负例缓解页间信息泄漏。实验显示其显著优于非上下文化嵌入,说明跨页上下文建模对文档检索有效。

Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning Figure 1
2026-07-08cs.CV

Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning

Ziyi Chen, Haoyan Shi, Sunhan Xu, Congyan Lang

School of Computer Science and Technology, Beijing Jiaotong University, Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)

2026-07-08视觉感知

论文针对组合零样本学习中属性与对象强依赖但易被独立预测或单向条件建模割裂的问题,提出 PRPC:把识别改写为多步问答式推理,让对象和属性在循环中相互校正,并用 GRPO 式强化学习约束中间步骤。实验称在三个 CZSL 基准达到 SOTA,表明收益主要来自双向纠错降低早期误差传播。

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails Figure 1
2026-07-08cs.CV

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li

Fudan University, Tongji University, The Chinese University of Hong Kong, University of Chicago, University of Illinois, Urbana-Champaign

2026-07-08视觉感知强化学习数据集/基准

本文针对图像安全护栏在真实部署中需随产品、地区或人群政策变化而改变判定的问题,指出固定标签基准难以评估“同图不同策”的适应能力。作者构建含28类政策变体的PolicyShiftBench,并提出结合随机化政策SFT与边界成对适配的PolicyShiftGuard。实验显示现有VLM和护栏在政策切换下脆弱,7B模型在该基准达76.9 Avg. F1和72.1 PSS,并能迁移到外部安全基准。

GaussFusion: Towards Multimodal 3D Gaussian Pretraining Figure 1
2026-07-08cs.CV

GaussFusion: Towards Multimodal 3D Gaussian Pretraining

Zhixuan You, Jihua Zhu, Yiding Sun, Zihao Guo, Haozhe Cheng, Dongxu Zhang, Lin Chen, Hainan Luo

2026-07-08视觉语言三维

本文针对现有3D Gaussian预训练主要依赖属性重建、语义监督不足的问题,提出GaussFusion,将图像与文本特征通过跨模态对齐融入遮蔽Gaussian建模,并用基于显著性的多尺度洞状遮蔽选择更有结构和语义价值的区域。实验显示其在下游3D识别任务上优于Gaussian-MAE,ModelNet40提升0.61%,ScanObjectNN提升3.85%,但具体增益中多模态监督与遮蔽策略各自贡献仍需结合消融判断。

Few-Medoids: An Embarrassingly Simple Coreset Selection Method for Few-Shot Knowledge Distillation Figure 1
2026-07-08cs.CV

Few-Medoids: An Embarrassingly Simple Coreset Selection Method for Few-Shot Knowledge Distillation

Cemil-Andrei Dilmac, Florinel-Alin Croitoru, Radu Tudor Ionescu

Department of Computer Science, University of Bucharest, 15G Iuliu Maniu, Bucharest 061075, Romania

2026-07-08视觉感知

这篇论文关注少样本知识蒸馏中如何用极小训练子集降低学生模型训练成本,因为既有 coreset 策略常难超过随机采样。作者提出 Few-Medoids:在教师模型特征空间内按类别选择最接近类中心、平均距离最小的样本,强调代表性而非复杂启发式。四个图像分类数据集和三组 CNN/Transformer 教师-学生组合上,该方法稳定优于随机、herding 与 k-center Greedy,可作为蒸馏场景的简单基线替代方案。

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context Figure 1
2026-07-08cs.CV

Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context

Suneeta Mall, Vladimir Nekrasov, Ashnil Kumar, Sajith Karunasena, Aiden Nibali, Alix Bird, Mateo Diaz Shine, Jarrel Seah

2026-07-08视觉感知

针对影像需求增长与放射科报告产能不足,论文提出 Harrison.Rad 1.5:一个面向平片与乳腺等多模态放射场景的基础模型,可融合图像、既往检查和临床文本生成报告。其核心在于三阶段训练与面向 Findings-Diagnosis 的临床一致性评估;结果显示其在模拟 FRCR、RadBench、ReXGradient 及内部多部位数据上领先,并是唯一达到模拟 FRCR 通过线的系统,但临床可用性仍需进一步验证。

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation Figure 1
2026-07-08cs.RO

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation

Paul Koch. Adem Karakurt, André Sers

back-projects these labels onto 100 real-world scenes. The, following in laboratory settings, positive labels are actionable. 3) Real↔Sim bidirectional, validated labels are back-projected onto all real camera, tools are packaged as Docker containers, enabling any lab, scalable, open, containerized generation system enabling, tions: grasping labels, robot reachability, and physical ob-

2026-07-08数据集/基准三维

针对现有抓取数据集难以同时提供真实 RGB-D、可执行 6-DoF 抓取标签和 sim-to-real 对齐的问题,GraspIT 用 Isaac Sim 中 Franka 机械臂进行轨迹可达性过滤和四阶段滑移测试,并通过 Real↔Sim 配准把仿真标签回投到真实场景。首版包含约 31.6 万帧、2.3M 抓取候选和 7.4k 物体,其中 82.94% 为好抓取,17.06% 形成带物理失败模式的负样本。

AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring Figure 1
2026-07-08cs.CV

AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

Younggun Kim, Taeheon Kim, Youngseo Kim, Seunghee Park

2026-07-08视觉语言视觉感知

面向真实工地远距离监控,现有施工 VLM 依赖单张全局图像微调,难以兼顾小目标细节、低分辨率输入可靠性与推理成本。AVA-VLM 的核心是让模型先看低分辨率全局图,再按需选择高分辨率局部裁剪,并用区域感知 CoT 学习何时、何处、如何细看。实验显示其在长距离和降分辨率场景下更稳,同时显著减少视觉 token 用量。

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning Figure 1
2026-07-08cs.CV

Breaking Spurious Correlations via Generative Randomization and Cross-Variant Self-Supervised Learning

Suraj Yadav, Anjaneya Sharma, Siddharth Yadav

Indraprastha Institute of Information Technology Delhi

2026-07-08生成模型

这篇论文针对视觉模型在分布偏移下依赖背景等伪相关的问题,提出先用 Grounding DINO/SAM 分割前景,再用扩散补全生成多背景变体,并把同一物体的不同背景版本作为对比学习正样本来学习背景不变表征,之后结合 ERM warm-up 与 GroupDRO 微调。在 Waterbirds、MetaShift、NICO++ 上分别达到 92.5%、81.7%、87.4% 的 worst-group 准确率,但效果仍可能受生成样本质量和多样性影响。

Realistic Compound-Lens Defocus Blur Synthesis Figure 1
2026-07-08cs.CV

Realistic Compound-Lens Defocus Blur Synthesis

Yunkyu Lee, Woohyeok Kim, Sunghyun Cho

2026-07-08视觉感知

论文针对散焦去模糊模型跨相机、跨镜头泛化差的问题,指出现有真实数据难扩展且有配准、曝光和残余模糊偏差,合成数据又缺少真实光学与成像链路。作者用 Debye CZT 波光学 PSF、深度分层遮挡处理和线性空间 ISP 仿真生成 CLDefocus 数据集。实验显示,用该数据训练的模型在多个真实散焦基准上跨设备泛化更好,但增益可能主要来自更大规模和更多镜头多样性。

Complementary Roles of Image Classification and Vessel Segmentation in AI-Based Screening for Retinopathy of Prematurity Plus Disease in a Kenyan Preterm Cohort Figure 1
2026-07-08cs.CV

Complementary Roles of Image Classification and Vessel Segmentation in AI-Based Screening for Retinopathy of Prematurity Plus Disease in a Kenyan Preterm Cohort

Fred Mutisya, Oscar Onyango, Sarah Sitati, Syokau Ilovi, Aeesha NJ Malik, Brenda W'mosi, Brian Makini, Jalemba Aluuvala, Josiah Onyango, Rachael Kanguha Mmene, Steven Wanyee

: Center for Health AI Research, Innovation & Implementation | 2: College of Ophthalmology of Eastern Central and Southern, Africa | 3:Kenyatta National Hospital | 4: University of Nairobi | 5: London School of Hygiene & Tropical Medicine | 6: EyeSHA, division of labour: at their natural operating points the RGB image classifiers were highly, one of the leading causes of preventable childhood blindness worldwide(American Academy of

2026-07-08视觉感知

本文针对肯尼亚早产儿 ROP 筛查中 plus disease 诊断主观、专家稀缺且现有模型缺少非洲验证的问题,比较分类、分割、多任务和 MIL 等 11 种方案。核心洞察是图像分类更敏感但易过度转诊,血管分割更特异;二者集成后平衡准确率达 0.803,优于单一视觉分类器。

TRIG: Trajectory-Rig Decoupled Metric Geometry Learning Figure 1
2026-07-08cs.CV

TRIG: Trajectory-Rig Decoupled Metric Geometry Learning

Lizhou Liao, Wentao Xu, Handong Wang, Lirong Yang, Shuai Yang, Weiwei Liu, Chang Huang

2026-07-08规划控制

TRIG面向多相机自动驾驶中度量几何和自车运动估计的尺度歧义问题,核心洞察是将相机位姿拆成随时间变化的自车轨迹与静态相机rig拓扑,并分别编码、监督,再用稀疏时空注意力降低跨帧跨相机推理成本。实验覆盖五个驾驶基准,报告在位姿估计、度量深度和三维重建上达到SOTA,但具体增益中数据规模与VGGT/DINO骨干贡献仍需看消融细节。

Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning Figure 1
2026-07-08cs.CV

Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning

Yake Wei, Yuan Wang, Fengyun Rao, Jing Lyu, Di Hu

2026-07-08视觉语言视觉感知

这篇论文针对多模态大模型“看图思考”中常用框选放大的粗粒度问题:矩形框会引入背景噪声、重叠物体干扰和额外 token 消耗。作者提出 SegAnswer,用像素级分割掩码替代边界框作为中间视觉定位步骤,并保留原图位置索引以更好对齐视觉 token 的空间编码。实验显示其在高分辨率感知、通用感知、幻觉评测及 RefCOCO 系列分割任务上均有稳定提升。

DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction Figure 1
2026-07-08cs.CV

DeSeG: Decoupling Semantic Intent and Geometric Constraints for Physically Plausible Human-Scene Interaction

Jiakun Li, Zhe Li, Wenqiang Wu, Zheng Chang, Mingqi Gao, Jinyu Yang, Feng Zheng

Southern University of Science and Technology, Harbin Institute of Technology, Shenzhen, University of Sheffield

2026-07-08优化算法

DeSeG针对人-场景交互生成中语义意图容易被目标位置等几何线索覆盖、并导致穿模等物理幻觉的问题,提出将语义规划与几何执行分离:先用残差语义规划器把文本和规范化目标体素压缩为意图潜变量,再在扩散执行器中加入可微排斥势场约束碰撞。实验显示其在Lingo等数据集上提升语义一致性,并将平均场景穿透降低约47%。

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective Figure 1
2026-07-08cs.CV

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

2026-07-08数据集/基准安全鲁棒

本文关注阴影、反光、轮胎痕等自然环境“视觉错觉”对自动驾驶车道感知的安全影响,指出这类局部且像车道标记的干扰不同于常见天气噪声。核心贡献是构建 LanEvil++ 基准,用 CARLA 覆盖14类错觉,并同时评估传统车道检测与自动驾驶视觉语言模型。实验显示错觉显著降低车道检测 Accuracy 和 F1,阴影最具破坏性,闭环仿真还会诱发错误驾驶决策;MIDA 通过困难样本训练带来一定鲁棒性提升。

FORGE: Towards Functional Tool-Use Generalization via Keypoint Trajectory Reasoning Figure 1
2026-07-08cs.RO

FORGE: Towards Functional Tool-Use Generalization via Keypoint Trajectory Reasoning

Chuhao Zhou, Liquan Wang, Shuxin Cao, Xiangyu Chen, Yuxuan Hu, Boyu Ma, Animesh Garg, Jianfei Yang

2026-07-08规划控制学习理论

这篇论文瞄准机器人换用陌生工具完成同一功能时的失效问题,指出难点不只是外观泛化,而是功能相似并不对应相同动作。核心做法是把“功能推理”和“动作执行”解耦,用2D关键点轨迹作为中间表示,先从无动作数据预测接触与运动计划,再用少量示教落地到控制。在七种工具的敲击基准和真实实验中,FORGE相对现有方法在未见工具上取得超过2倍的平均成功率提升。

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding Figure 1
2026-07-08cs.CV

LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding

Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith

♠Paul G. Allen School of Computer Science & Engineering, University of Washington, ♣Allen Institute for AI

2026-07-08视觉语言视觉感知

针对乐谱识别中整页端到端模型难以处理长文档、且常忽略标题与注释等嵌入文本的问题,Legato 2 将页面先按乐谱系统分割,再用自回归视觉语言模型结合前文逐系统转写,并转换为标准 ABC。实验显示其在多数据集 OMR、长文档识别和乐谱问答辅助上超过既有方法。

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator Figure 1
2026-07-08cs.CV

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

National University of Singapore, 2 HKUST

2026-07-08机器人视觉感知生成模型

Image2Sim针对具身导航缺少可规模化、逼真且具物理约束训练环境的问题,提出将3D空间锚定与照片级观测生成解耦:用前馈特征高斯快速建场景,再用几何感知一步像素流渲染全景RGB-D,并自动生成可执行轨迹与语言指令。论文称其构建近2万交互场景、合成超1000万样本,训练出的导航模型在基准和真实零样本迁移中均有明显提升;具体增益可能主要来自scaling / data。

Optimized Adaptive Loop Filter in Versatile Video Coding Figure 1
2026-07-08cs.CV

Optimized Adaptive Loop Filter in Versatile Video Coding

Meng Xuewei, Zhang Jiaqi, Jia Chuanmin, Zhang Xinfeng, Wang Shanshe, Ma Siwei

∗ Institute of Digital Media, † Key Laboratory of Intelligent Information Processing, Peking University, Institute of Computing Technology

2026-07-08视觉感知

本文针对 VVC 中自适应环路滤波 ALF 在编码端参数训练复杂、GALF 与 CCALF 难并行、CCALF 多次访问外部图像缓冲不利于实时软硬件实现的问题,提出优化框架:并行化 GALF/CCALF,按内容自适应简化 GALF 参数决策,并用失真估计实现 one-pass CCALF。相对 VTM-8.0,图像缓冲访问由最多 152 次降至 1 次,ALF 模块约节省 25% 时间,编码性能变化很小。

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions Figure 1
2026-07-08cs.CV

ARMS: Anchor-Relational Motion Streaming for Seamless Solo-Social Motion Transitions

Huakun Liu, Qing Yu, Kent Fujiwara, Hideaki Uchiyama, Kiyoshi Kiyokawa

Nara Institute of Science and Technology, Ikoma, Japan LY Corporation, Tokyo, Japan

2026-07-08视觉感知

ARMS针对文本驱动人体运动生成中固定片段、固定人数设定难以处理独行动作与双人互动连续切换的问题,提出Anchor-Relational流式框架,用伙伴参考的相对位移和模式感知关系门控解耦个体时序与人际对齐,在因果扩散中逐段生成。实验显示其在长时程过渡平滑性和社会一致性上优于互动基线,并在双人交互基准上保持竞争力。

SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs Figure 1
2026-07-08cs.CV

SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs

Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi, Hossein Kashiani, Xiaolong Ma, Fatemeh Afghah

2026-07-08视觉语言

本文针对VLM提示学习中“见过类别精度高、未见类别泛化差”的优化矛盾,提出SAMPLe,将锐度感知最小化改造成可插拔提示优化器,并在每步根据局部曲率与梯度关系自适应平衡低训练损失和寻找平坦极小值。作者将其接入CoOp、CoCoOp、MaPLe、TCP、Co-Prompt等框架,实验显示相对SAM、F-SAM、SAGM等优化器在多种设置下更稳定提升泛化与性能。

Association Restoration Test: Revealing Restorable Shortcuts after Unlearning Figure 1
2026-07-08cs.CV

Association Restoration Test: Revealing Restorable Shortcuts after Unlearning

Amy Lu, Changxiu Ji

2026-07-08视觉感知

这篇论文针对关联遗忘评估中的盲区:现有最坏组准确率或线性探针只能说明模型当前是否出错、特征是否可读,却不能判断标签—属性捷径还能否被原分类头重新利用。作者提出 ART,通过估计类条件关联方向并放大残余捷径分量来测试功能性可恢复性。实验显示,在 Waterbirds、CelebA、SpuCoDogs 和 ISIC 扩展上,输出鲁棒性、特征可读性与捷径可恢复性经常不一致,一些方法只是解耦分类头,另一些仍留下可被 ART 激活的关联。

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models Figure 1
2026-07-08cs.CV

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

2026-07-08视觉语言

这篇论文针对多模态大模型在复杂场景中依赖局部裁剪、忽视物体关系而导致细粒度视觉推理低效的问题,提出 SaGe:先把图文数据转成含层级实体、属性、空间深度和多类关系的场景图,再用 12 万条图采样推理数据做监督微调,并用节点相关性与定位奖励进行强化训练。实验称其在八个视觉密集基准上稳定提升,但具体增益中数据构造与训练规模的贡献仍需进一步拆分说明。

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models Figure 1
2026-07-08cs.LG

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models

Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li

2026-07-08生成模型

大规模扩散模型在定制、强化学习对齐和蒸馏等后训练中仍受显存与速度瓶颈限制,LoRA/QLoRA只能部分缓解。FourTune将权重、激活和梯度统一推进到4-bit计算,并用三分支结构中的冻结数值稳定器隔离量化敏感异常值,配合块量化和融合kernel降低反传开销。在FLUX.1-dev等任务上,其生成质量接近BF16 LoRA,显存降低最高2.25倍、吞吐提升最高2.27倍。

IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction Figure 1
2026-07-08cs.RO

IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction

Honglin Wang, Shiyao Pan, Yun-Fu Liu

2026-07-08强化学习规划控制

这篇论文针对自动驾驶多智能体轨迹预测中“预测式方法易模式坍缩、锚点式方法精度受限”的矛盾,提出 mode-world 加权回归损失,并用分段循环的迭代解码器直接预测坐标、逐轮利用上一轮轨迹信息修正结果。在 Argoverse 2 多智能体预测榜上,IMR 的综合指标达到第一,但单智能体结果相对领先幅度有限。

LLM-Driven Neural Network Generation with Same-Family Architecture Guidance: Disentangling Transfer and Adaptation Figure 1
2026-07-08cs.LG

LLM-Driven Neural Network Generation with Same-Family Architecture Guidance: Disentangling Transfer and Adaptation

Kabir Dev Paul Baghel, Radu Timofte, Dmitry Ignatov

Computer Vision Lab, CAIDAS, University of Würzburg, Germany

2026-07-08视觉感知

本文针对 LLM 直接生成神经网络修改常出现无效或劣化的问题,研究强同族源模型能否帮助改进弱目标模型。核心做法是把源模型作为受控候选生成条件,并用非源基线与 hp_copy 消融区分简单配方复制和适配。结果显示,CIFAR-10 与 SVHN AlexNet 上源引导候选显著优于非源候选,主要增益来自超参数和数据变换迁移,但效果依赖数据集、模型家族和 LLM。

Robust Face Super-Resolution and Recognition Through Multi-Feature Aggregation in Diffusion Models Figure 1
2026-07-08cs.CV

Robust Face Super-Resolution and Recognition Through Multi-Feature Aggregation in Diffusion Models

Marcelo dos Santos, Rayson Laroca, João Carlos Raposo Neves, David Menotti

2026-07-08视觉感知生成模型安全鲁棒

面向监控场景中低分辨率、姿态光照变化和遮挡导致的人脸识别失效,论文提出 FASR++:从同一身份的多张低质图像提取并聚合特征,再将合并表征与参考低分辨率图像一起条件化到 SDE 扩散超分模型中,以减少身份扭曲且不依赖显式软属性或分类器梯度引导。作者在 CelebA 和 Quis-Campi 上报告其在验证、识别以及 PSNR、SSIM、LPIPS 等图像质量指标上优于基线和 SOTA。

Clustered Codebook Quantization for 2D Gaussian-based Image Compression Figure 1
2026-07-08cs.CV

Clustered Codebook Quantization for 2D Gaussian-based Image Compression

Runze Cheng, Yicheng Zhan, Josef Spjut, Kaan Akşit

University College London, University College London London UK

2026-07-08视觉感知三维

该文针对2D Gaussian图像表示中每个primitive含多组浮点参数、在高保真压缩时码率偏高的问题,提出CGVQ:先按旋转、尺度和颜色相似性用K-Means把Gaussian分成低方差簇,再为位置、旋转尺度和颜色训练簇内专用码本。实验显示在接近视觉质量下相对GaussianImage可降低约20% bpp;但论文篇幅较短,簇数选择与不同码本对增益的具体贡献文中未充分说明。

REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles Figure 1
2026-07-08cs.CV

REVIVE: A Multi-Modal Framework for Vandalism Detection and Recovery in Autonomous Vehicles

Abdullah Tariq Choudhry, Tapadhir Das

University of the Pacific

2026-07-08视觉感知

针对自动驾驶摄像头易受喷漆、贴纸、泥污等物理遮挡破坏且现有方法多停留在检测或传感器冗余的问题,REVIVE将遮挡检测、类型识别、U-Net定位与按类型选择的修复策略串联起来,并强调生成式修复不应阻塞实时感知。实验显示,未修复遮挡使YOLOv8l召回降至0.588;在有对齐干净参考帧的理想条件下,像素替换可恢复到0.967,但这是上界而非通用部署方案,质量门控可避免修复结果进一步伤害检测。

VEIL: How Visual Encoding Hijacking Induces Bias In Vision Models Figure 1
2026-07-08cs.CV

VEIL: How Visual Encoding Hijacking Induces Bias In Vision Models

Suranjana Sooraj, Xuyang Chen, Madhumitha Venkatesan, Dongyu Liu

University of California, Davis

2026-07-08视觉感知

这篇论文关注将时间序列渲染成图表后交给 CNN 分类时,模型究竟学习时序结构还是图表样式带来的视觉线索。作者提出 VEIL,用表示相似性、跨编码迁移、Grad-CAM 归因和扰动测试诊断“视觉编码劫持”。在 31 个 UCR 数据集、四类图表编码上的结果显示,复杂任务中不同编码会产生明显不同的特征空间和较弱迁移,注意力引导只在编码敏感信号一致时有帮助。

Recovering Cloud Microstructures with Cascaded Diffusion Inversion Figure 1
2026-07-08cs.CV

Recovering Cloud Microstructures with Cascaded Diffusion Inversion

Hanan Gani, Guy Pulik, Daniel Rosenfeld, Duncan Watson-Parris, Salman Khan

Mohamed Bin Zayed University of Artificial Intelligence, Hebrew University of Jerusalem, University of California, San Diego

2026-07-08生成模型

这篇论文针对气象卫星在时间分辨率与空间分辨率之间的取舍,试图从低分辨率多光谱云图恢复对云播种等任务有用的细尺度云微结构。核心做法是级联两阶段扩散反演:先用真实跨传感器配对数据学习对齐和退化鲁棒性,再用高分辨率图像的自监督降采样强化纹理与结构恢复。实验称其在重建精度和视觉质量上优于 transformer 与扩散基线,消融显示两阶段分别贡献粗结构一致性和细节真实感。

Taxlifier: Leveraging Disease Taxonomy for Enhanced Multi-Label Classification in Chest Radiography Figure 1
2026-07-08cs.CV

Taxlifier: Leveraging Disease Taxonomy for Enhanced Multi-Label Classification in Chest Radiography

Mohammad S. Majdi, Jeffrey J. Rodriguez

Multi-Label Classification in Chest Radiography, aDept. of Electrical and Computer Engineering, The University of Arizona, Tucson, 85721, AZ, USA, this study, we propose two novel hierarchical multi-label classification techniques, namely the, put for clinical decision support. Our findings highlight the potential of hierarchical multi-label, Keywords: Chest X-ray, multi-label classification, hierarchical classification, computer-aided, their training necessitates vast amounts of labeled data, which can be both expensive and time-, of common thoracic diseases. Furthermore, conventional multi-label classification methods are, primarily designed for single-label predictions and struggle with capturing intricate label rela-, label independently, ignoring potential dependencies between labels. This can lead to subopti-

2026-07-08视觉感知

这篇论文针对胸片多标签诊断中病灶视觉相似、标签依赖被平面分类忽略、低层少样本易受负类偏置影响的问题,引入疾病层级 taxonomy:一类方法把父子关系写入训练损失,另一类在无需重训时按父类调整 logits。作者在 CheXpert、PADCHEST、NIH 上报告相对基线的准确率、AUC、F1 均有明显提升,logit 法最高分别约提升 12%、13%、24%,但具体增益在多大程度来自层级约束而非数据与实现细节仍需谨慎解读。

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring Figure 1
2026-07-08cs.CV

Cross-Contextual Vision-Language Adaptation with LoRA for Personalized Severe Adverse Event Detection in Clinical Wound Monitoring

Aditi Naiknaware, Jian Sun, Aminreza Khandan, Shengyang Huang, Sean Dow, Bijan Najafi, Salimeh Sekeh

San Diego State University, University of California, Los Angeles, University of California, Davis

2026-07-08视觉语言视觉感知

针对糖尿病足等伤口随访中严重不良事件少见、个体化且仅靠图像难以识别的问题,论文将其建模为时序 OOD 检测;核心是冻结 BiomedCLIP 上的双流 LoRA 与跨上下文融合,把临床信息、伤口描述和图像对齐,并加入多信号 SAE 分数与时间漂移约束。SmartBoot 纵向数据上优于单流和单模态 OOD 基线,但数据集较单一,泛化仍需验证。

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension Figure 1
2026-07-08cs.CL

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

2026-07-08数据集/基准

孟加拉语表单理解缺少高质量基准,限制了政务、银行等场景的文档结构分析与关键信息抽取。BaFCo收集200份复杂孟加拉国政府多页表单,提供26类细粒度实体、关系标注和KIE键值对,并评测多款MLLM。结果显示当前模型细粒度定位能力仍弱,Gemini 3 Pro整体最好,但DLA mAP仍较低。

Patch Knowledge Transfer for Efficient AI-Generated Image Quality Assessment Figure 1
2026-07-08cs.CV

Patch Knowledge Transfer for Efficient AI-Generated Image Quality Assessment

Jiquan Yuan

2026-07-08视觉感知

针对 AI 生成图像质检中“多 patch 精细建模成本高、全图缩放推理快但精度低”的矛盾,论文提出 PKT:用局部-全局教师模型指导仅做全局处理的学生模型,并在特征层与输出分布层做知识迁移。四个 AIGIQA 数据集实验显示,学生在接近教师性能的同时将 FLOPs 降低 67.7%,且相对全局基线有小幅 SRCC/PLCC 提升。

SSA-3DGS: Unsupervised Removal of Screen-Space Artifacts for 3D Gaussian Splatting Figure 1
2026-07-08cs.GR

SSA-3DGS: Unsupervised Removal of Screen-Space Artifacts for 3D Gaussian Splatting

Kristof Overdulve, Lode Jorissen, Nick Michiels

Digital Future Lab, Flanders Make, Hasselt University

2026-07-08三维

这篇工作针对3DGS在真实采集遇到水印、镜头污渍、手指遮挡等固定于图像平面的伪影时,会把它们错误烘进三维场景形成漂浮物的问题。核心思路是利用多视角运动视差,把场景建模为3D高斯与共享可学习半透明2D覆盖层的联合组合,并用稀疏与TV正则限制覆盖层只解释必要伪影。在合成污染和自采真实数据上,相比直接用污染图训练3DGS,最高提升约9 dB PSNR,并能分离出伪影层。

Hierarchical Classification via Cascading Feature Elimination: Application to Human Phenotype Ontology-Aligned Facial Phenotyping (FaceMesh2HPO) Figure 1
2026-07-08cs.CV

Hierarchical Classification via Cascading Feature Elimination: Application to Human Phenotype Ontology-Aligned Facial Phenotyping (FaceMesh2HPO)

Fabio Hellmann, Alexander Hustinx, Benjamin D. Solomon, GestaltMatcher Database Consortium, Tzung-Chien Hsieh, Peter Krawitz, Elisabeth André

2026-07-08视觉感知

针对现有面部遗传病识别多直接输出综合征、缺少可解释表型描述的问题,FaceMesh2HPO将2D人脸转为478点3D网格,并沿HPO层级训练级联PointNet,通过特征点消除学习各表型相关区域。最佳配置在交叉验证中平均AUROC为0.750±0.042,父节点和近根表型优于细粒度叶节点;外部测试显示对部分未见综合征可迁移,但泛化差异明显,稀有标签仍是主要瓶颈。

Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction Figure 1
2026-07-08cs.CV

Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction

Gregor Kobsik, Tim Elsner, Leif Kobbelt

2026-07-08视觉感知生成模型

论文针对3D形状抽象在机器人抓取、碰撞检测和场景理解中既要语义分解又要几何拟合的问题,提出无需训练的流程:用多视角渲染让VLM识别部件,再由生成图像模型绘制彩色分割并回投到3D,最后为每个部件拟合超二次曲面。核心洞察是把2D生成模型的部件理解与经典优化解耦结合。在HumanPrim和Toys4K上,该方法以平均5–9个 primitives 取得最低Chamfer距离;消融显示当前瓶颈主要在生成分割质量。

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory Figure 1
2026-07-08cs.RO

GEM-Occ: From Visual Geometry Evidence to Embodied Semantic Occupancy Memory

Hu Zhu, Bohan Li, Xianda Guo, Hongsi Liu, Baorui Peng, Mingqi Yuan, Xin Jin, Wenjun Zeng, Chang Wen Chen

The Hong Kong Polytechnic University, Eastern Institute of Technology, Shanghai Jiao Tong University, Wuhan University, The University of Hong Kong, Georgia Institute of Technology

2026-07-08视觉感知

论文针对室内具身智能中长期语义占据建图仍停留在单帧或房间尺度的问题,提出 HIOcc 统一 ScanNet、ScanNet++ 与 Matterport3D 的层级评测,并用 GEM-Occ 将局部几何预测转为语义高斯与自由空间射线证据,进行可见性和不确定性感知的因果融合。实验显示其在局部预测、在线稳定性、自由空间推理、重访一致性和楼宇级扩展性上优于既有基线。

Multi-Teacher Contrastive Distillation for Edge-Efficient Pathology Foundation Models Figure 1
2026-07-08cs.CV

Multi-Teacher Contrastive Distillation for Edge-Efficient Pathology Foundation Models

Tim Lenz, Maurice Heide, Marco Gustav, Nic G. Reitsam, Jakob Nikolas Kather

2026-07-08视觉感知

本文针对病理基础模型参数大、推理成本高、难以在科室本地或边缘设备部署的问题,提出 MuCoDi:用 Virchow2、UNI2、H-Optimus-1 的缓存特征作为多教师信号,通过对比蒸馏训练 MobileOne/RepViT 学生编码器。结果显示,RepViT 学生在外部 AUROC 上接近最佳教师,R1.0 仅 6.4M 参数仍达 70.9%,亚百万参数模型在树莓派上最高提速 605 倍但保留约 66.5–66.9% AUROC。

$\mathbfλ$-VAE: Variance Equalization for Posterior Collapse Figure 1
2026-07-08cs.LG

$\mathbfλ$-VAE: Variance Equalization for Posterior Collapse

Girum Demisse

Microsoft African Development Center

2026-07-08生成模型

这篇论文针对 VAE 训练中潜变量被解码器忽略的后验坍塌问题,指出其根源是重构梯度与 KL 压力失衡,以及采样噪声造成的信息缺口。作者提出 λ-VAE,在重参数化中按维度用 σ^λ 缩放噪声、但 KL 仍按原方差计算,以实现方差均衡。实验显示其在 MNIST、Omniglot、CIFAR-10、CelebA-64 上减少坍塌维度,并将信息容量最高提升 2.8 倍、CIFAR-10 BPD 改善 0.33。

Rendering-Aware Bayesian 3D Gaussian Splatting with Native Uncertainty and Adaptive Complexity Control Figure 1
2026-07-08cs.CV

Rendering-Aware Bayesian 3D Gaussian Splatting with Native Uncertainty and Adaptive Complexity Control

Gaoxiang Jia, Vikram Appia, Junzhou Huang, Xinlei Wang

Advanced Micro Devices, Inc., University of Texas at Arlington

2026-07-08规划控制三维安全鲁棒

这篇论文针对标准 3D Gaussian Splatting 只给点估计、难以表达几何不确定性和控制模型复杂度的问题,将渲染器导出的统计量接入 NIW 后验,并用可选 DP 信号辅助复杂度调节;通过后验几何重渲染得到像素不确定性,用于主动选视角。实验中 16 到 32 视角任务较三成员 ensemble 提升 0.453 dB PSNR、降低 0.0146 LPIPS,覆盖率校准误差也显著更低,但常规重建增益仅约 0.030 dB,主要价值在决策型采集与不确定性估计。

Statistical Adversaries: Natural Backdoor-like Features in Vision Datasets Figure 1
2026-07-08cs.CV

Statistical Adversaries: Natural Backdoor-like Features in Vision Datasets

Paul K. Mandal, Pavan Reddy, Tristan Malatynski

2026-07-08视觉感知数据集/基准

这篇论文关注普通视觉数据集中是否天然存在类似后门触发器的统计结构,而非依赖投毒或针对模型优化的攻击。作者从 ImageNet 类条件频域与白化统计构造“statistical adversaries”,并用多种匹配控制排除随机相关。结果显示这些方向可跨 CNN 与 Transformer 提高目标类假阳性、logit 和排名,但主要不是稳定的 top-1 接管,增益部分可能来自频谱匹配结构。

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory Figure 1
2026-07-08cs.CV

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan

Nanjing University

2026-07-08视觉感知

这篇论文针对长视频智能体依赖多轮推理、检索和工具调用而带来的高延迟与高显存问题,认为根因在于缺少持续的全局上下文以及查询与记忆表示不对齐。Light-Omni 用“全局状态+潜在状态”替代侦探式推理:前者通过异步层次合并压缩长期多模态记忆,后者在该上下文条件下直接产生动作和检索嵌入。实验称其相较 M3-Agent 平均准确率提升 2.4%,速度提升 12.1 倍,GPU 显存效率提升 2.6 倍。

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM Figure 1
2026-07-08cs.CV

Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM

Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

Mohamed bin Zayed University of Artificial Intelligence, The Hong Kong Polytechnic University, Linköping University

2026-07-08视觉语言三维

这篇论文针对机器人、AR 等场景中3D对话只会回答但难以验证、或能定位却不能给出真实尺度测量的问题,提出 Ground3D-LMM:把点云特征与文本、可选图像一同作为 LMM 输入,并通过 <SEG> 触发点级掩码,实现对象/部件级、多对象的度量化空间对话。作者还构建约250万问答的 Ground3D 数据集并定义3D Grounded Measurement任务;实验显示其在 Ground3D、Reason3D、ScanRefer 等任务上优于相关3D推理与分割基线。

Binocular Gaze Estimation with Single Camera and Single Light Source Figure 1
2026-07-08cs.CV

Binocular Gaze Estimation with Single Camera and Single Light Source

Tongbing Huang, Yang Fu, Yunfei Wang, Zhaocan Wang

Invensun Technology Co.Ltd., University of Science and Technology Beijing, assuming two light sources are available. A new normalization, available due to the obstruction of eyelids., combat the loss of the second glint, 1) the cornea curvature centers, which is well explained by [4]. The classic method is not elaborated, from cornea radius center C. The nodal point of camera, with focal, curvature center C, giving us equation 2., pupil center is close to but different from the actural pupil, center allowing for the refraction of optic path on cornea

2026-07-08视觉感知

面向移动设备等受前置空间和功耗限制的眼动追踪场景,论文试图把传统自由头动凝视估计所需的双光源降为单光源。核心做法是构造相机对称位置的“虚拟光源/虚拟亮斑”,利用双眼瞳距与亮斑间距的几何约束估计缺失亮斑,再接入多项式回归,并提出以IPD平方等价归一化。实验显示单光源方案精度可接受,但相比真实双光源存在退化。

A Task-Driven Evaluation of UAV Detection and Tracking under Synthetic Fog Figure 1
2026-07-08cs.CV

A Task-Driven Evaluation of UAV Detection and Tracking under Synthetic Fog

Amir Pouladi, Vesal Ahsani, Haijun Li, Homayoun Najjaran, Afzal Suleman

Center for Aerospace Research (CfAR), University of Victoria, Advanced Control and Intelligent Systems (ACIS) Lab, University of Victoria

2026-07-08视觉感知数据集/基准

针对雾天中小型无人机在远距、天空背景下难以稳定检测与跟踪的问题,论文构建了从单目深度合成雾、图像去雾到检测和 tracking-by-detection 的任务级评测流程,并比较干净训练、含雾训练与测试时复原的作用。结果显示,雾主要通过漏检显著拉低检测和跟踪性能;含雾训练带来更稳定的鲁棒性,去雾只在检测器未见过雾数据时更有帮助,说明图像复原指标不能直接代表下游感知收益。

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration Figure 1
2026-07-08cs.CV

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)

2026-07-08视觉感知

这篇论文针对复杂图像创作/编辑往往需要生成、定位、分割、合成、OCR和增强等多工具串联的问题,将其建模为带中间视觉状态和资产管理的轨迹学习任务。核心贡献是构建 CanvasCraft 数据集,并用 SFT+GRPO 训练 CanvasAgent 编排异构视觉工具,奖励同时约束最终图像质量与执行过程。实验称其在自动和人工评测中提升最终效果与轨迹可靠性,但具体增益有多少来自数据规模、工具集合或强化学习仍需细读验证。

BitFair: A 12nm Bit-Serial CNN Accelerator with Learnable Early Termination and Adaptive Bit Ordering for Ultra-Low-Power XR Vision Figure 1
2026-07-08cs.AR

BitFair: A 12nm Bit-Serial CNN Accelerator with Learnable Early Termination and Adaptive Bit Ordering for Ultra-Low-Power XR Vision

Ang Li, Chang Gao

2026-07-08视觉感知强化学习

面向XR眼镜等常开视觉任务的毫瓦级功耗和毫秒级时延约束,BitFair在比特串行CNN加速器中引入可学习的逐层早停阈值,并用自适应比特顺序优先处理更有判别力的位,以减少ReLU最终为零时的冗余计算。12nm实现面积0.34 mm²、片上存储104 KB,达到0.12–1.55 ms时延、0.8–13.7 mW功耗和最高117.0 BTOPS/W,在DVS128 Gesture与N-MNIST上取得96.5%和97.7%准确率,相比既有XR视觉芯片能效提升4.0–22.1倍。

Abductive Corroboration of Probabilistic AI Models for Forensic Synthetic Media Detection Figure 1
2026-07-08cs.CR

Abductive Corroboration of Probabilistic AI Models for Forensic Synthetic Media Detection

Junade Ali

2026-07-08视觉感知

面向司法取证中合成媒体检测的误报风险,本文不把单一概率分类器当作决定性证据,而是用溯因式交叉印证组合多个检测信号,并评估 OpenAI SynthID 在生成图像中的实际部署。结果显示,多模型相互佐证能以较小真阳性召回损失显著压低假阳性,同时揭示不同检测方法的互补性;具体增益来源仍需结合模型独立性进一步说明。

2026-07-07

389 篇
From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model Figure 1
2026-07-07cs.CV

From Fixed to Free Cameras: Calibration-Free View-Robust Vision-Language-Action Model

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

Nanyang Technological University, DAMO Academy, Alibaba Group, HuPan Lab

2026-07-07视觉语言视觉感知安全鲁棒

针对VLA在训练相机视角稍变就失效、而现有鲁棒方法又依赖已知外参的问题,本文提出CamVLA:从单目RGB和语言指令同时预测相机坐标系下的末端动作与6-DoF手眼矩阵,再用确定性几何变换转到机器人基座坐标。仿真和真实机器人实验显示,其在未见相机配置下较π0、GR00T等基线取得更高成功率,但极端视角和高精度任务仍受手眼回归误差限制。

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion Figure 1
2026-07-07cs.CV

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi

Visual Geometry Group, University of Oxford

2026-07-07生成模型三维

针对现有文本到三维方法多停留在单物体或拼块式场景、容易出现网格痕迹和全局不连贯的问题,SynCity 3000 将二维模板生成与三维重建解耦:先用重叠窗口扩散生成可控的 dimetric 场景图,再将 TRELLIS 微调为可卷积滑窗推理,并用程序化合成数据弥补场景训练数据不足。实验显示其在多种提示和布局下生成更大、更连贯且细节更丰富的 3D Gaussian Splat 场景,优于 SynCity 等基线。

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models Figure 1
2026-07-07cs.RO

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

2026-07-07强化学习数据集/基准

面向可变形物体操作中动力学难预测、真实多模态数据不足的问题,Deform360 构建了含198类日常物体、1980段交互、41视角与双手触觉夹爪的视觉-触觉数据集,并用无标记3D跟踪生成几何/粒子标注。实验将接触预测、2D视频世界模型与3D粒子模型、MPC规划放在同一基准下比较,显示3D模型在低数据下受益于结构先验,而2D模型在大数据下泛化更强,部分优势可能主要来自 scaling/data。

InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics Figure 1
2026-07-07cs.CV

InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics

Erich Liang, Caleb Kha-Uong, Chinmaya Saran, Sreemanti Dey, David W. Liu, Junhan Ouyang, Benjamin Zhou, Jia Deng

2026-07-07视觉感知

该文针对真实视频中变焦、对焦导致相机内参随帧变化、进而破坏3D重建和机器人视觉假设的问题,提出InFlux++数据套件:用程序生成的Synth提供44.1万帧动态内参及部分深度/位姿/法线标注,并用Real扩展到51.4万帧更复杂真实场景与运动。实验显示,用Synth微调AnyCalib可在InFlux++ Real和InFlux上提升焦距估计,说明收益可能主要来自更大规模、更丰富的数据监督。

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation Figure 1
2026-07-07cs.CV

Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation

Haozhe Wang, Weijia Feng, Jinpeng Yu, Che Liu, Ping Nie, Fangzhen Lin, Jiaming Liu, Ruihua Huang, Jimmy Lin, Wenhu Chen, Cong Wei

Hong Kong University of Science and Technology 2 University of Waterloo, Qwen Applications 4 Imperial College London

2026-07-07学习理论

本文针对图像生成器在新实体、长尾文化与训练截止后事件上“会画但不知道”的世界知识瓶颈,指出盲目搜索会引入噪声,关键在于发现随生成器能力变化的知识边界。作者构建 SearchGen-20K/Bench,并提出门控-过滤-整合的搜索推理器与生成器协同训练;结果显示开放生成器在该基准仅得21–28分,而自适应搜索相较无搜索和盲搜取得单调提升。

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation Figure 1
2026-07-07cs.RO

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

Tsinghua University, Shanghai AI Laboratory, Peking University

2026-07-07机器人

长程机器人操作中,端到端 VLA 容易因缺少进度记忆而重复或漂移,传统分层方法又存在规划语义与执行运动学脱节。Cortex 的核心是用 32 类可执行技能原语、语义记忆和可达性约束把 VLM 规划与 VLA 执行双向对齐,并结合大规模视频标注与仿真数据训练。实验显示其在 Libero-long 和 RoboTwin 分别提升 3.1% 与 4.1%,且能零样本完成部分真实多阶段任务,但增益可能部分来自数据规模与接口工程。

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing Figure 1
2026-07-07cs.CV

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

2026-07-07视觉感知

这篇论文针对现有方法只能做长单视角或短多视角视频、难以同时保持长时序与跨视角几何一致的问题,提出 MV-Forcing:用自回归 4D/3D 重建模型在已生成视角和下一视角之间渲染几何先验,并结合联合去噪、DMD 与时空 Self-Forcing 缓解推理漂移。实验表明其在合成和真实数据上可生成任意时长、任意视角数的动态场景多视角视频,并比单视角长视频或短多视角基线更能维持相机与几何一致性。

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space Figure 1
2026-07-07cs.CV

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

Nanyang Technological University

2026-07-07强化学习三维

针对三维重建依赖像素回归、三维生成依赖潜空间扩散而难以统一且会损失细节的问题,PixWorld将两者改写为像素空间扩散:直接在多视角渲染图上做流匹配,端到端监督像素对齐3D Gaussian,并加入基于3D基础模型特征的几何感知损失。实验显示其生成优于既有潜空间方法,重建性能接近或匹配SOTA。

ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction Figure 1
2026-07-07cs.CV

ReCal3R: Reliability-Calibrated Learning Rates for Streaming 3D Reconstruction

Xinze Li, Yiyuan Wang, Pengxu Chen, Wentao Fan, Weifeng Su, Weisi Lin, Wentao Cheng

Beijing Normal-Hong Kong Baptist University, Hong Kong Baptist University, Jilin University, Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science, Nanyang Technological University

2026-07-07三维

面向机器人、AR/VR 等长时在线感知,论文指出 CUT3R 类紧凑循环状态会在反复写入中被噪声观测污染,导致历史几何漂移。ReCal3R 的核心是先由 token 对齐、重建残差和近期更新压力得到候选学习率,再用状态 token 自身可靠性进行校准,避免不可靠记忆被激进改写;该规则无需训练、可直接叠加到 CUT3R。实验显示其在长序列位姿、深度和重建上更稳定,ScanNet 1000 帧 ATE 相比 CUT3R 降低 3.7 倍,运行时间和显存基本相当。

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation Figure 1
2026-07-07cs.CV

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

Jingyi Lu, Kai Han

2026-07-07视觉感知

这篇论文针对单目视频转立体视频中遮挡显露区域难以补全、训练数据依赖稀缺真实双目或有域差合成数据的问题,提出几何互易定理:在最近邻 DIBR 下,目标视图的补洞掩码等价于反向 warp 时丢失的像素,从而可用任意单目视频解析构造自监督训练数据。实验称其在训练自由和监督方法之上取得更好质量与一致性,但具体增益仍可能部分来自更大规模真实数据。

Multiplayer Interactive World Models with Representation Autoencoders Figure 1
2026-07-07cs.CV

Multiplayer Interactive World Models with Representation Autoencoders

Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez

tightly coupled dynamics. Trained on 10,000 hours of gameplay collected with publicly available bots, Once learned, the world model can act as a controllable simulator (Ha and Schmidhuber, 2018

2026-07-07强化学习

这篇论文针对多智能体场景中单玩家世界模型无法显式控制其他参与者、难以用于自博弈和反事实评估的问题,提出 MIRA:在表示自编码器潜空间中,以四名玩家的视角和动作流共同条件化的扩散世界模型。其关键洞察是多视角与多动作流能减少未来不确定性并帮助正确归因交互。模型用 1 万小时 Rocket League 数据训练,5B 参数可在单张 B200 上实时生成 20fps 四人比赛,长程 rollout 在 5 分钟评测内保持稳定,并开源数据、代码与演示。

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis Figure 1
2026-07-07cs.CV

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

Xianhao Chen, Jiarui Hu, Yuanbo Yang, Xiyu Zhang, Tengyue Wang, Hujun Bao, Guofeng Zhang, Zhaopeng Cui

2026-07-07三维

这篇论文针对开放词汇3D场景理解中物体常被孤立识别、缺少关系上下文的问题,提出 RelGraphOV:从多视角观测自动构建3D场景图,用视觉语言推理补全关系并过滤几何不合理边,再通过双流门控GAT分别处理密集几何特征与CLIP语义特征,降低特征干扰。实验显示其在 ScanNetV2、ScanNet200 及 ScanNet++、Replica 零样本评测中优于多种基线,说明关系上下文对长尾和跨域类别识别有实际增益。

WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images Figure 1
2026-07-07cs.CV

WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images

Xiyu Zhang, Jingyu Zhuang, Hongjia Zhai, Zizheng Yan, Jinwei Chen, Guofeng Zhang, Qingnan Fan

2026-07-07视觉感知三维

面向互联网图像常见的光照、天气和曝光不一致问题,WildSplat试图摆脱传统NeRF/3DGS依赖已知位姿、密集视图和逐场景优化的限制。其核心是双分支前馈3D高斯框架:几何分支联合估计位姿并提取外观不变结构,外观分支用参考图经预调制交叉注意力注入目标风格,并用多参考训练减弱几何与外观纠缠。实验显示其在稀疏、无位姿in-the-wild新视角合成和外观编辑上优于优化式与前馈基线。

CenSynCMB: Centre Maps and Physics-Guided Synthesis for Microbleed Detection Figure 1
2026-07-07cs.CV

CenSynCMB: Centre Maps and Physics-Guided Synthesis for Microbleed Detection

Lucas He, Hanyuan Zhang, Krinos Li, Adama Fatima Saccoh, Silvia Ingala, Rafael Rehwald, Marleen de Bruijne, Frederik Barkhof, Rhodri Davies, Carole H. Sudre

2026-07-07视觉感知

这篇工作面向脑微出血在大规模 MRI 队列中难以自动检出的痛点:病灶小而稀疏,且易与血管、钙化样低信号和伪影混淆。CenSynCMB 将 3D Attention U-Net 与中心图监督、假阴性重加权及物理引导的正例/困难负例合成结合,使训练目标更贴近质心级检测并显式学习相似干扰物。在 VALDO 上病灶级 F1 达 74.3%,在外部 AIBL SWI 上召回率 88.5%、F1 65.0%,但个体负荷估计仍需队列校准和假阳性控制。

Steering Optimisation Trajectories in Diffusion Representation Learning Figure 1
2026-07-07cs.CV

Steering Optimisation Trajectories in Diffusion Representation Learning

Rajat Rasal, Avinash Kori, Tian Xia, Ben Glocker

Imperial College London

2026-07-07生成模型

本文关注扩散自编码器在重建质量相近时却学到差异很大的潜在表示这一问题,指出关键在早期优化轨迹会落入“重建优先”或“解耦渐进”两种机制。作者提出 SteeringDRL,通过门控残差 U-Net 限制捷径通路,并用 log-SNR 噪声暴露课程调控训练早期动态。实验显示其在属性解耦与目标中心空间解耦任务上提升表示和分割质量,并降低随机种子敏感性。

Topological Shape Representation for Aneurysm -- Bifurcation Detection Figure 1
2026-07-07cs.CV

Topological Shape Representation for Aneurysm -- Bifurcation Detection

Akshay Gokhale (1), Mansi Dhamne (1) ((1) Sardar Patel Institute of Technology, Mumbai)

Sardar Patel Institute of Technology

2026-07-07视觉感知

本文针对CTA动脉瘤检测中CNN易把小型囊状动脉瘤误判为健康血管分叉、导致高假阳性的问题,提出作为下游假阳性过滤器的方向性拓扑形状表示SECT,用全局3D几何不变量替代局部强度纹理。其在RSNA 2025分层CTA补丁上AUC达0.943,明显优于PI/PL等非方向持久同调表示;在<3 mm病例和跨扫描仪留一验证中仍保持较高AUC与敏感性。

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation Figure 1
2026-07-07cs.CV

Deep Learning for Semen Analysis in Male Infertility: Computer Vision, Multimodal Fusion, and Clinical Translation

Runwei Guan, Shaofeng Liang, Jiacheng Weng, Xiaoyi Gu, Jia Weng, Daizong Liu, Duo Pan, Qingxin Zhang, Xiao Liang, Weiping Ding, Suoyu Zhu, Ming Yuan, Yanhua Fei

2026-07-07视觉语言视觉感知

针对传统精液分析依赖人工、中心间差异大且难以整合形态、运动、DNA完整性和临床信息的问题,本文综述深度学习在检测计数、跟踪活力、分割、形态缺陷与功能评估中的进展,并将核心洞察提升为多模态融合与可信临床转化框架。主要结果是梳理数据集、指标和部署障碍,提出从标准化、多中心验证到监管和上市后监测的分阶段路线图,而非报告单一模型性能增益。

Air Quality Downscaling with Station-Guided Pseudo-Supervision Figure 1
2026-07-07cs.LG

Air Quality Downscaling with Station-Guided Pseudo-Supervision

Guorun Wang, Simone Foti, Andreas D. Demou, Leonidas Kotoulas, Theodoros Christoudias, Alexandros Koliousis, Mihalis Nicolaou, Stefanos Zafeiriou

2026-07-07视觉感知

针对CAMS等大气场分辨率粗、且与稀疏地面站点观测空间支撑不匹配的问题,论文将欧洲PM2.5估计表述为单时刻的联合下采样与偏差校正任务。核心做法是用OpenAQ站点观测经高斯核传播生成伪监督,并结合人类活动、土地覆盖、地形、AOD和风场等多源信息训练多尺度SegFormer。实验显示STARQ能从约40 km提升到约1 km,恢复更细空间结构,并在未见时间和站点上优于CAMS与S-MESH。

ChatImage: Navigating Long-Form LLM Answers through Interactive Images Figure 1
2026-07-07cs.CV

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

Wencan Jiang, Jiangning Zhang, Yong Liu

2026-07-07视觉感知

ChatImage针对长篇LLM回答以线性文本呈现、难以定位与回访细节的问题,将回答结构化为视觉模块并生成图像,再通过渲染后的视觉 grounding 而非预设坐标放置可点击热点,支持区域解释和局部追问。论文给出参考实现与30题基准,报告交互闭环完成、严格视觉对齐门控和SAM掩码完整性诊断,但具体量化增益文中未充分说明。

Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models Figure 1
2026-07-07cs.CV

Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models

Parth Upman, Nishita Jain, Shreyank N Gowda

2026-07-07生成模型

这篇论文针对扩散模型概念擦除中“删目标也伤相近概念”的问题,指出既有 value-space 方法把目标身份与共享视觉结构混在同一方向上移除。作者提出 CARE,用保留概念锚点的协方差估计保留子空间感知的擦除方向,并以闭式算子直接作用于交叉注意力 value,无需微调。实验显示其在实例、风格和名人概念擦除中能保持相近非目标概念更稳定,同时维持相当的擦除效果。

Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models Figure 1
2026-07-07cs.CV

Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models

Jaeyoung Kim, Eunseok Kim, Dongsuk Jang

2026-07-07视觉语言视觉感知

本文追问双曲视觉语言模型的层级能力是否真由几何机制产生,而非普通对齐或监督带来的表象增益。作者提出以无量纲工作点、径向排序、蕴含锥活性和遍历鲁棒性为核心的审计框架,检查 MERU、HyCoCLIP、PHyCLIP。结果显示已发布模型多处于近欧式区域,曲率和锥机制基本未被有效使用,所谓层级相关性主要由角度相似或数据监督解释。

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments Figure 1
2026-07-07cs.CV

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

Indian Institute of Technology Bhilai

2026-07-07视觉语言视觉感知强化学习

论文针对现有视频评测多停留在清晰、受控或模拟场景,难以反映真实钢厂 CCTV 中远距离、粉尘、遮挡和多人并行动作的问题,提出 SteelBench:含 149 小时素材筛出的 1,345 段密集标注工业监控片段,并引入标注来源审计以识别 VLM 预填标签带来的评测偏差。结果显示,未审计的同族模型标签可高估准确率达 17 个百分点,9 个 VLM 最佳动作准确率仅 42.6%,显著低于 84.6% 的人类基准,且安全判断仍大量出错。

Learning Probabilistic Embeddings for Unsupervised Action Segmentation Figure 1
2026-07-07cs.CV

Learning Probabilistic Embeddings for Unsupervised Action Segmentation

Shuai Li, Duc Manh Vu, Juergen Gall

University of Bonn, Germany Lamarr Institute for Machine Learning and Artificial Intelligence, Germany

2026-07-07视觉感知

本文针对无监督长视频动作分割中,基于最优传输生成伪标签的确定性帧嵌入容易过拟合错误伪标签并陷入局部最优的问题,提出用高斯分布建模帧级概率嵌入,并在采样特征上进行OT伪标签估计。方法可嵌入ASOT、VASOT等框架,在Breakfast、50Salads等四个基准上稳定提升,MoF最高增20.7%、F1最高增19.0%,显示不确定性建模对分割鲁棒性有实际贡献。

FlowMark: Mask-Guided Video Watermarking Figure 1
2026-07-07cs.CV

FlowMark: Mask-Guided Video Watermarking

Vishal Asnani, Shruti Agarwal, John Collomosse

2026-07-07视觉感知生成模型

生成视频普及使仅靠可移除元数据难以支撑溯源,视频水印又易受压缩、平台转码和时序编辑影响并产生闪烁。FlowMark的关键在于用轻量Mask Predictor自动选择内容/运动感知的嵌入区域,结合暗区残差调制、时序一致性约束和分阶段噪声训练,在保持高感知质量的同时提升鲁棒性。实验显示其可嵌入128-bit逐帧信息,最高约50.08 dB PSNR,并在社交平台重编码和帧交换、插删、重采样等编辑下保持较可靠恢复。

Shifting from Discrete to Continuous Reference Data: QSM-Derived Horizontal Tree Biomass Distribution for Deep Learning Biomass Estimation Figure 1
2026-07-07cs.CV

Shifting from Discrete to Continuous Reference Data: QSM-Derived Horizontal Tree Biomass Distribution for Deep Learning Biomass Estimation

Nils Griese, Christoph Kleinn, Nils Nölke

Department of Forest Inventory and Remote Sensing, University of Göttingen, Göttingen, Germany, However, they are labor-intensive and costly, which, center point of the plot. However, this ignores the actual, dataset37. The dataset includes 3,386 species-labeled, were filtered using the validation labels provided with

2026-07-07视觉感知

这篇论文针对 LiDAR 生物量估计中传统样地级清查标签易受边界效应影响、尤其小样地噪声大的问题,将 QSM 推导的水平生物量分布作为连续监督信号,并用稀疏 3D U-Net 从 ULS 点云预测生物量图。实验显示,QSM/HBD 参考在小样地上明显优于传统 FI 聚合标签;100 m² 样地中 HBD 使 RRMSE 降低 16.84±4.37%,R² 提高 0.22±0.05,说明增益主要来自更合理的空间化参考数据。

Repurposing CLIP to Localize at Pixel Level Figure 1
2026-07-07cs.CV

Repurposing CLIP to Localize at Pixel Level

Jiaxiang Fang, Shiqiang Ma, Jing Wang, Siyu Chen, Fei Guo, Shengfeng He

2026-07-07视觉感知

这篇论文针对 CLIP 具备开放词汇图像级定位能力、但受全局特征偏置影响难以直接用于像素级分割的问题,提出 CLIPix:从 CLIP 分类过程和视觉-语言 logits 回溯类别相关响应,将其转化为定位线索,并用抗噪校正与定位嵌入缓解伪响应、补充细节。实验在 PASCAL 和 COCO 上报告优于已有方法,说明无需依赖闭集分割器也能较好保持 CLIP 泛化性。

Vision Pretraining for Dense Spatial Perception Figure 1
2026-07-07cs.CV

Vision Pretraining for Dense Spatial Perception

Zelin Fu, Bin Tan, Changjiang Sun, Shaohui Liu, Kecheng Zheng, Yinghao Xu, Xing Zhu, Yujun Shen, Nan Xue

2026-07-07视觉感知

这篇论文针对现有视觉基础模型偏重语义不变性、削弱精细空间感知的问题,将边界和形状不连续从下游输出提升为自监督预训练信号。其核心是 masked boundary modeling:由教师在线发现边界 token,并强制学生在遮挡视图中重建,同时用分类化边界场稳定训练。结果显示,1B LingBot-Vision 在深度、分割、视频跟踪等密集任务上可匹敌或超过更大的 DINOv3,并推动 LingBot-Depth 2.0 在 14 个深度补全基准取得领先;但部分增益可能主要来自 scaling / data。

GUSH3R: Everyone Everywhere All at Once as Gaussians Figure 1
2026-07-07cs.CV

GUSH3R: Everyone Everywhere All at Once as Gaussians

Keito Abe, Kaede Shiohara, Takashi Otonari, Toshihiko Yamasaki

The University of Tokyo

2026-07-07三维

GUSH3R面向单目视频中的动态人—场景重建,针对现有前馈方法难以同时处理非刚性人体与照片级可渲染表示的问题,将人体先验、几何先验与SMPL-X结合,统一提升为静态场景和动态人体的3D Gaussian表示。实验显示其在新视角合成质量上接近优化式和分解式基线,同时显著降低推理开销,但具体增益中各模块贡献仍需结合消融判断。

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication Figure 1
2026-07-07cs.CV

A Multimodal Reasoning Typology for Grounding Chart-Image Coherence in Science Communication

Avina Nakarmi, Sohom Sen, Xun Song, Sreyashi Samaddar, Aritra Dasgupta

Department of Data Science, New Jersey Institute of Technology, Department of Electrical & Computer Engineering, Department of Computer Science, Department of Biology, Brooklyn College

2026-07-07视觉语言视觉感知

本文关注科学论文中图表、图像与说明文字如何共同承载结论这一常被忽略的问题。核心创新是从创伤性脑损伤论文中归纳出R1到R5的多模态推理缺口类型学,用“共同基础”解释读者所需的解释负担。基于79篇论文、人工验证的57组图文关系及VLM描述评判实验,结果显示该层级能预测专家与非专家理解何时一致或分歧。

Probing Geospatial SSL Representations with Environmental Signals Figure 1
2026-07-07cs.CV

Probing Geospatial SSL Representations with Environmental Signals

Rohita Mocharla, Vishal M. Patel

Johns Hopkins Applied Physics Laboratory, Johns Hopkins University

2026-07-07视觉感知

本文针对地理空间自监督模型只靠下游任务评测难以解释表征内容的问题,提出用共址 ERA5 环境变量探测与表征几何指标联合评估。结果显示,DINO、MAE、MoCo 即使下游表现相近,也编码不同程度的环境信号;ERA5 线性可解码性与农业、灾害等环境相关任务表现更相关,而与分布外鲁棒性的关系较弱。

An event-driven framework for fly-inspired visual motion detection Figure 1
2026-07-07cs.CV

An event-driven framework for fly-inspired visual motion detection

Qinbing Fu, Jingyu Huang, Yan Xie, Jigen Peng, Yuchao Tang

2026-07-07视觉感知

针对事件相机虽低延迟、高动态范围但易受噪声影响,且与生物启发运动模型结合不足的问题,论文将 HATS 时间表面编码接入果蝇视叶启发的免训练前馈网络,并加入自底向上注意力抑制背景运动。在 DAVIS 车辆序列中,该框架相比帧式基线在白天和低照夜间都给出更稳定的运动方向响应,也能与对比最大化方法一致识别主导右向运动。

Causal-RetiGraph: Cross-Cohort Retinal Support and Same-Subject Pathway Analysis for Diabetic Retinopathy Figure 1
2026-07-07cs.CV

Causal-RetiGraph: Cross-Cohort Retinal Support and Same-Subject Pathway Analysis for Diabetic Retinopathy

Inam Ullah, Imran Razzak, Shoaib Jameel

2026-07-07视觉感知

针对糖尿病视网膜病变中“影像分级准确但难解释其与全身微血管通路关系”的问题,论文提出 Causal-RetiGraph,将血管、病灶、图像嵌入与 AutoMorph 生物标志物融合为可解释视网膜图表型,并用 NHANES 区分跨队列支持与同受试者通路分析。模型二分类准确率 0.9055、AUROC 0.9711,分级 QWK 0.8312,并指向糖代谢-肾脏和糖代谢-血流动力学通路。

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving Figure 1
2026-07-07cs.RO

VLM-CASE: Vision-Language Model Enabled Context-Adaptive Safety Envelopes for Anticipatory Safe Autonomous Driving

Tianjia Yang, Ke Li, Ruwen Qin, Xianbiao Hu

2026-07-07视觉语言视觉感知安全鲁棒

面向雨雪、夜间等恶劣工况下自动驾驶既“看不清”又“控不住”的问题,VLM-CASE用经LoRA微调的视觉语言模型从前视图像识别路面与能见度,并将其转化为自适应安全包络,而非只调控制决策;该包络把RSS安全约束与摩擦预算结合,联动限制制动和转向,异步接入MPC以避免阻塞实时控制。CARLA闭环实验中,VLM-CASE-MPC完成全部试验,优于固定包络MPC、普通MPC和VLM-MPC,消融显示摩擦与能见度自适应贡献互补。

FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection Figure 1
2026-07-07cs.CV

FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small Object Detection

Aiwen Liu, Chengguang Zhu, Gang Wang, Dandan Zhu, Haodong Lin, Yan Wang, Huiyu Zhou, Zhiyi Pan

2026-07-07视觉感知

该文针对小目标在多尺度聚合和下采样中易丢失高频细节、产生频域混叠的问题,提出 FSDC-DETR,将空间表征与频域表征显式协同建模;其核心在于双分支频空自适应融合、编码器内频空跨尺度交互,以及基于可学习小波的动态下采样来保留高频信息。在 VisDrone-DET2019 和 AITODv2 上分别提升 AP 6.4/6.6,小目标 AP 提升 6.8/6.9。

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning Figure 1
2026-07-07cs.CV

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

Mingqi Gao, Hongyuan Dong, Yifei Chen, Zhisheng Zhong, Zheng Ruan, Wenjin Hou, Yu Chen, Han Hu, Yansong Tang

Tsinghua Shenzhen International Graduate School, Tsinghua University, University of Chinese Academy of Sciences, LLM Department, Tencent

2026-07-07视觉语言视觉感知强化学习

本文针对密集视频描述中强化学习奖励难设计的问题:整体打分易被风格投机利用,参考文本匹配又过于僵硬。作者提出 CuRe,将描述拆成按视觉类别组织的原子 claim,并用参考 claim 作显著性锚点、视觉验证作事实依据,对参考外但可见的细节给有限奖励。结合 GRPO 后,30B-A3B captioner 在描述准确性、完整性、重描述和 caption-to-QA 评测上优于同规模模型,并超过部分更大开源基线。

Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection Figure 1
2026-07-07cs.CV

Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection

Peng Zhang, Tingfa Xu, Shuaihao Han, Jianan Li

2026-07-07视觉感知

针对多光谱检测中光谱维度被离散处理、金字塔各层光谱/空间线索可靠性变化以及旋转目标缺少显式几何先验的问题,FressDet将连续有序的光谱隐式重采样、可靠性自适应的谱空融合和无参数复制的方向感知头统一到全旋转等变框架中。三组公开基准显示其达到SOTA,并较前一最佳方法减少约93%参数,在旋转扰动下鲁棒性更强。

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation Figure 1
2026-07-07cs.CV

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

University of Twente, University of Cambridge, University of Bath

2026-07-07视觉感知

针对自动驾驶世界动作模型中视频预测与轨迹生成分离、导致动态先验难以迁移到规划的问题,UNIVERSE用单个带掩码调制的DiT共同去噪未来视频潜变量和自车轨迹,并用模态解耦可见性掩码阻断未来视频与轨迹互看,从而兼顾共享参数学习与轨迹单独推理。其在NAVSIM达91.0 PDMS,优于Two-DiT的89.6,并在nuScenes、Bench2Drive零样本测试中降低L2误差和碰撞率,轨迹-only推理提速4.3倍。

ASSEMCAD: Production-Ready CAD Assembly Generation from Natural Language Figure 1
2026-07-07cs.AI

ASSEMCAD: Production-Ready CAD Assembly Generation from Natural Language

Yurui Dong, Shu Zou, Siqi Li, Nianchen Deng, Hongbin Zhou, Xuemeng Yang, Pinlong Cai, Licheng Wen, Xinyu Cai, Botian Shi

2026-07-07视觉感知

这篇论文针对自然语言到CAD仍多停留在单零件或静态几何、难以生成可执行机械装配的问题,提出AssemCAD:先用带工程公理的装配规格表达零件、几何端口和配合关系,再通过端口/配合库、按需参数化部件合成与确定性几何验证生成装配。实验称其在AssemBench上相比代码中心基线显著提升装配结构保持和物理有效性,并能跨不同基础模型泛化。

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies Figure 1
2026-07-07cs.CV

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk

2026-07-07机器人视觉语言视觉感知

这篇论文针对 VLA 导航在复杂视觉场景中易受干扰、难以判断可通行区域的问题,评估一种无需重训的语义分割视觉 grounding:用 SegFormer 将可通行区域标绿、不可通行区域标红,并比较仅增强观测与同时增强目标两种设置。在 OmniVLA 与 Grand Tour 数据集上,该方法使最远路点平均误差下降 27%–44%,长指令收益更明显,但对图像目标帮助有限;归一化分析显示增益更多来自缩短预测轨迹、类似路径长度正则化,而非真正提升单位距离推理能力。

Semantic Video Communication via Multi-Scale Convolution and Dynamic Routing for Next-Generation Networks Figure 1
2026-07-07cs.CV

Semantic Video Communication via Multi-Scale Convolution and Dynamic Routing for Next-Generation Networks

Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu

2026-07-07视觉感知

面向下一代网络中视频流量过高、边缘设备难以传输完整视频的问题,论文把语义视频通信转化为视频—文本时序定位:用多尺度一维时序卷积以 O(T) 复杂度建模不同粒度动作,再用胶囊动态路由处理非单调、多对多的片段—查询对齐,并联合优化边界回归、跨模态对齐和胶囊多样性。在 ActivityNet Captions 上报告 Recall@0.5 为 42.9%、mIoU 为 41.1%,同时强调计算效率适合边缘部署。

Be Indiscrete: The Benefits of Learning Continuous Spine Degeneration Severity Scores Figure 1
2026-07-07cs.CV

Be Indiscrete: The Benefits of Learning Continuous Spine Degeneration Severity Scores

Maria Monzon, Andrew Zisserman, Robin Y. Park, Catherine R. Jutzeler, Amir Jamaludin

2026-07-07视觉感知

本文针对腰椎 MRI 退变本质连续、却常被硬切成离散等级的问题,提出 SpineRankNet,用成对排序损失学习 0–10 连续严重度分数,再映射回临床等级。结果显示其在 11 个 Genodisc 分级任务上保持接近分类模型的判别能力,同时提升 QWK、降低 MAE,尤其减少跨远等级误判;但外部队列和纵向临床效用仍文中未充分验证。

TimeThink: Reasoning with Time for Video LLMs Figure 1
2026-07-07cs.CV

TimeThink: Reasoning with Time for Video LLMs

Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing Liu

2026-07-07视觉感知

这篇论文针对长视频推理中模型只凭最终答案奖励学习、难以定位关键时间证据的问题,提出 TimeThink:把推理拆成带时间区间引用的“时间线索步骤”,并用逐步时间过程奖励结合最终结果奖励进行强化学习。作者还构建 TimeThink-RFT-20K 自动证据段数据集;实验称其在视频推理、时间定位和通用视频理解基准上均提升表现,并在开源视频 RL 模型中达到较优结果。

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement Figure 1
2026-07-07cs.CV

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement

Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao, Bo-Kai Ruan, Hong-Han Shuai

2026-07-07视觉感知

本文针对文本到图像模型在“罕见属性—对象”组合中易遗漏属性或语义漂移的问题,提出无需训练的 RADIANCE,将扩散采样视为闭环反馈:用 CLIP 监测中间潜变量中的对象与属性显现,再通过正负 IP-Adapter scaling 动态增强弱概念、抑制强概念,并扩展到多对象场景。RareBench 和 T2I-CompBench 结果显示其提升组合对齐、罕见属性保真度与感知质量,但整体空间布局仍受骨干模型先验限制。

LangLoc: "Tell Me What You See" Figure 1
2026-07-07cs.CV

LangLoc: "Tell Me What You See"

Shaurya Kishore Panwar, Roham Zendehdel Nobari, Shirley Feng Yi Lau, Abu Bakr Rahman Shaik, Manuel Günther, Marc Pollefeys, Daniel Barath

2026-07-07视觉感知

LangLoc针对室内定位依赖图像带来的带宽、隐私和取景限制,探索仅用自然语言描述恢复已知3D环境中的位置与朝向。其核心是先用融合CLIP语义的双分支GATv2做场景检索,再以物体可见性射线投影在地面网格上评分,并通过贝叶斯是/否对话消除歧义。实验显示检索Top-1较既有方法提升约8个百分点,细粒度定位中位误差约0.95米,对话后在ScanNet上可降至厘米级。

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing Figure 1
2026-07-07cs.CV

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

Tao Jin, Li Xiao

2026-07-07视觉感知

本文针对文本引导视频编辑中“改得动”与时序一致性难以兼得的问题,提出一站式微调框架 EquiEdit:用带四向时序感知扫描的 Temporal Mamba 建模跨帧关系,并通过傅里叶域约束的噪声注入提升可编辑性同时保留结构。实验与消融显示其在一致性、文本对齐和输入保真之间取得更好平衡,但具体增益幅度依赖文中基准设置。

RUFNet: Query-Guided Support Mask Refinement and Uncertainty Fusion based on Hybrid Mamba for Few-Shot Brain Tumor Segmentation Figure 1
2026-07-07cs.CV

RUFNet: Query-Guided Support Mask Refinement and Uncertainty Fusion based on Hybrid Mamba for Few-Shot Brain Tumor Segmentation

Dongyi He, Xiangkai Wang, Binbing Xu, Bin Jiang, Hongjie Yan, Weixiang Liu, Wai Ting Siok, Nizhuan Wang

Department of Language Science and Technology, The Hong Kong Polytechnic University, Hong Kong SAR, China, School of Artificial Intelligence, Chongqing University of Technology, Chongqing, China, Affiliated Lianyungang Hospital of Xuzhou Medical University, Lianyungang, China, College of Mechatronics and Control Engineering, Shenzhen University, Shenzhen, China

2026-07-07视觉感知安全鲁棒

该文针对少样本脑肿瘤分割中支持掩码噪声、跨患者差异和缺少像素级置信度的问题,提出 RUFNet:用 Hybrid Mamba 低成本建模支持-查询长程依赖,并以查询引导细化支持掩码,再用不确定性后验融合调节模糊区域预测。在 BraTS 2020 上,1-shot/5-shot Dice 达 84.3%/86.1%,优于对比方法。

Beyond Modality Fusion: Deep Ensembles for Multimodal Classification Figure 1
2026-07-07cs.LG

Beyond Modality Fusion: Deep Ensembles for Multimodal Classification

Ilya Burenko, Dmitry Vetrov

Constructor University

2026-07-07视觉语言

针对多模态分类中强弱模态不均衡会使后期融合反而弱于最佳单模态的问题,论文提出不显式做模态融合,而是训练单模态深度集成,并给出按模态分配模型数量的启发式。结果显示在相同参数量下,该方法持续优于多种处理不均衡的后期/中期融合和混合方法;极端不均衡、小集成时只用强模态更好,规模增大后弱模态才带来收益。

Comparison of Loss Functions for Robust Deep Learning-based Echocardiography Segmentation when Learning with Partially Labelled Data from Multiple Domains Figure 1
2026-07-07cs.CV

Comparison of Loss Functions for Robust Deep Learning-based Echocardiography Segmentation when Learning with Partially Labelled Data from Multiple Domains

Iman Islam, Esther Puyol-Antón, Bram Ruijsink, Andrew J. Reader, Andrew P. King

2026-07-07视觉感知安全鲁棒

针对多来源超声心动图数据常存在结构标注不完整、直接合并训练会产生前景/背景监督冲突的问题,论文系统比较 aCCE、marginal loss 与 aBCE 在部分标注分割中的鲁棒性。核心洞察是损失函数选择取决于域偏移和缺失标签数量:同域内三者均接近全标注训练;跨域且单标签缺失时 aBCE 与 marginal 更稳,多标签缺失时 marginal loss 表现最佳。

Unsupervised Pixel-Level Semantic Left-Right Understanding of In-the-Wild Images Figure 1
2026-07-07cs.CV

Unsupervised Pixel-Level Semantic Left-Right Understanding of In-the-Wild Images

Weikang Wang, Tobias Weißberg, Florian Bernard

2026-07-07视觉感知

这篇论文针对单目野外图像中因缺少3D信息、遮挡、姿态变化和局部可见而难以做像素级语义左右判断的问题,提出Pix2LR无监督框架:把3D形状上的逐顶点左右语义迁移到图像训练中,并结合有限类别3D数据与更广泛图像数据,通过逐顶点预测聚合保持一致性。结果显示其在渲染和真实图像上优于现有方法,并能泛化到汽车、火车等未见类别。

Geometry-aware Depth-guided Representation Learning for Structure-preserving Low-light Image Enhancement Figure 1
2026-07-07cs.CV

Geometry-aware Depth-guided Representation Learning for Structure-preserving Low-light Image Enhancement

Fang Gao, Jiongkai Qin, Jiabao Wang, Jingfeng Tang, Ming Cheng, Hanbo Zheng, Qingbao Huang, Cheng Wu

a School of Electrical Engineering, Guangxi University, Nanning, Guangxi 530004, China, b School of Rail Transportation, Soochow University, Suzhou, Jiangsu 215500, China

2026-07-07视觉感知

低照度增强常提升亮度却破坏边缘、纹理和场景结构,影响后续视觉感知。本文将LLIE视为几何一致的表征恢复问题,提出DMSA-Net:先用Retinex分解获得较抗光照的反射分量以估计深度,再在编码器中以多尺度深度注意力融合几何与外观特征,并构建LOL-D数据集。实验称其在多个基准上提升复原质量和结构保持,但具体增益中深度先验与数据扩展的贡献仍需进一步拆分说明。

Virtual Category-Guided Continual Generalized Category Discovery Figure 1
2026-07-07cs.CV

Virtual Category-Guided Continual Generalized Category Discovery

Jiahui Xiong, Qiuxia Lai, Hongsong Wang

2026-07-07视觉感知

面向机器人等开放环境中的持续视觉感知,本文关注无标注数据流里旧类、新类与边界样本混杂导致伪标签误差累积的问题。核心做法是把不确定样本暂放入临时“虚拟类别”,避免过早硬分配,并结合扩展邻域对比学习拉开新旧类别表征间隔。实验在 CIFAR-100、Tiny ImageNet 和 ImageNet-100 上优于现有 C-GCD 方法,表现为更好的整体识别、未知类发现和遗忘缓解。

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control Figure 1
2026-07-07cs.LG

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control

Ruslan Rakhimov, George Bredis, Yuriy Maksyuta, Daniil Gavrilov

2026-07-07生成模型规划控制

Qantara针对像素控制中JEPA世界模型训练时被迫绑定规划或行为克隆范式的问题,提出在状态轴用Brownian bridge、动作轴用flow matching,并把噪声采样集中到推理会查询的边与角,使单个约2100万参数checkpoint可同时做潜变量规划、动作采样和视频-逆动力学。实验在LeWM suite平均达91.2 SR,OGBench-Cube较DINO-WM高7.7 SR,低成本BC/逆动力学路径也在Push-T和Cube取得较强成功率。

MemPose: Category-level Object Pose Estimation with Memory Figure 1
2026-07-07cs.CV

MemPose: Category-level Object Pose Estimation with Memory

Xiao Lin, Minghao Zhu, Yun Peng, Liuyi Wang, Qiyi Wang, Chengju Liu, Qijun Chen

2026-07-07三维

MemPose针对类别级物体位姿估计中过度依赖固定形状先验或静态网络参数、难以覆盖类内差异的问题,提出把几何经验显式存入可动态更新的外部记忆。其核心是用记忆缓冲区保存历史实例的结构特征,并通过相似性token合并与注意力检索,将相关类别级几何信息融合到当前RGB-D关键点表示中以预测9-DoF位姿。实验在REAL275、CAMERA25、Housecat6D和Wild6D上优于既有方法;与AG-Pose相比参数和速度开销很小,替换为同参MLP后性能下降,说明增益主要来自记忆机制。

UniSpine-GS: An Efficient Physics-Aware Gaussian Framework for Cross-Modality Multi-view Spine Image Synthesis Figure 1
2026-07-07cs.CV

UniSpine-GS: An Efficient Physics-Aware Gaussian Framework for Cross-Modality Multi-view Spine Image Synthesis

Qiuhua Chen, Changning Yu, Na Huang, Chao Sun, Bo Du

2026-07-07视觉感知三维

针对三维脊柱评估依赖昂贵设备、跨X射线/超声模态外观差异导致多视图一致性差的问题,UniSpine-GS用显式3D高斯结合可微DRR前向算子学习几何感知表示,并用SPWM重加权突出椎骨边界与纹理区域。在CTSpine3D和新建FeSpine3D上,其多项指标优于现有方法,但超声物理仅采用投影代理,真实声学建模能力文中未充分说明。

Efficient Perception in Automotive Detection and Tracking Using Neuromorphic Computing Figure 1
2026-07-07cs.CV

Efficient Perception in Automotive Detection and Tracking Using Neuromorphic Computing

Manish Kolachalam, Rani Malhotra

Applied Research Center for Autonomous Machines, Infosys Center for Emerging Technologies, Bangalore

2026-07-07视觉感知

面向自动驾驶边缘感知的高算力与能耗压力,本文将脉冲神经网络与 SpikeYOLO 迁移学习用于真实车载多目标检测与跟踪,核心洞察是事件驱动的 SNN 有望在保持精度的同时适配神经形态硬件。实验在 KITTI 上检测 mAP 达 0.937、BDD100K MOT2020 达 0.771,跟踪 HOTA 分别为 0.701 和 0.445,显示其已接近传统 ANN 基线,但能效收益尚未在专用硬件上实测。

Graph Representation Learning of Longitudinal Medical Imaging Trajectories for Treatment Response Prediction Figure 1
2026-07-07cs.CV

Graph Representation Learning of Longitudinal Medical Imaging Trajectories for Treatment Response Prediction

Johannes Kiechle, Richard Osuala, Daniel M. Lang, Stefan M. Fischer, Ivana Janíčková, Karim Lekadir, Julia A. Schnabel, Jan C. Peeken

2026-07-07视觉感知

针对乳腺癌新辅助化疗中仅靠单时点影像难以捕捉疗效演变的问题,论文将多时点3D DCE-MRI特征组织为有向无环图,用GraphSAGE建模时间关系,并设计响应感知的群体对齐、患者去相关和时间一致性自监督目标。在585例ISPY-2数据上,该方法较视觉与自监督基线在多项pCR分类指标上更优,消融也支持GNN关系建模和各损失项的贡献。

3DMPE: 3D Multi-Perspective Embedding Figure 1
2026-07-07cs.CV

3DMPE: 3D Multi-Perspective Embedding

Vahan Huroyan, Md Rahat-uz-Zaman, Stephen Kobourov

2026-07-07三维

这篇论文针对多视角2D观测中常见的遮挡、缺点和距离信息不完整问题,研究在已知跨视角点对应与可见性后如何恢复一致的3D点云。核心做法是将多视角同步嵌入扩展为3DMPE,用显式可见性约束处理缺失点,并支持已知或联合估计投影。ShapeNet和Pix3D实验显示,在多数点能被多个视角看到时重建较准确,但方法依赖可靠对应关系,尚非端到端图像重建。

ProCon: Projection-Consistency Memory for Training-Free Anomaly Detection Figure 1
2026-07-07cs.CV

ProCon: Projection-Consistency Memory for Training-Free Anomaly Detection

Joongwon Chae, Lihui Luo, Yang Liu, Dongmei Yu, Peiwu Qin, Runming Wang, Ilmoon Chae

2026-07-07视觉感知

ProCon针对记忆库异常检测中过度依赖最近邻匹配、易把缺陷误判为正常的问题,提出将正常记忆从查表器改为无训练的软投影算子:用局部正常邻域重构测试patch,并以投影残差作为异常证据,再通过多种子记忆中位数和多层DINOv2残差共识稳定结果。其在MVTec-AD、VisA、Real-IAD上取得99.8%、99.2%、93.2%图像AUROC,并通过消融表明增益主要来自软投影残差与共识机制,而非单纯扩大记忆库。

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better Figure 1
2026-07-07cs.CV

HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better

Gengluo Li, Xingyu Wan, Shangpin Peng, Weinong Wang, Hao Feng, Yongkun Du, Binghong Wu, Zheng Ruan, Zhiqiong Lu, Liang Wu, Pengyuan Lyu, Huawen Shen, Zibin Lin, Shijing Hu, Jieneng Yang, Hongbing Wen, Guanghua Yu, Hong Liu, Bochao Wang, Can Ma, Han Hu, Chengquan Zhang, Yu Zhou

Institute of Information Engineering, Chinese Academy of Sciences, Large Language Model Department, Tencent, Nankai University

2026-07-07视觉语言

面向真实 OCR 不止文档转 Markdown、且长结构化输出解码慢的问题,HunyuanOCR-1.5在保持轻量端到端架构基本不变的基础上,引入 DFlash 投机解码加速,并用 Agentic Data Flow 针对低资源、多图问答、古文字、表格图表等短板构造数据,配合4K输入、128K上下文和训练配方升级。结果显示其在 Transformers/vLLM 下分别获得6.37×/2.14×推理加速,并在 OmniDocBench v1.6及多类长尾 OCR 任务上达到领先表现;部分能力增益可能主要来自 data 与训练扩展。

Unsupervised Detection of Underground Tunnels in Ground-Penetrating Radar Using Depth-Restricted Reconstruction Scoring Figure 1
2026-07-07cs.CV

Unsupervised Detection of Underground Tunnels in Ground-Penetrating Radar Using Depth-Restricted Reconstruction Scoring

Muhammad Junaid, Shoab A. Khan, Nisar Ahmed

2026-07-07视觉感知三维

面向油气管线下方非法隧道难以及早发现、且真实隧道标注稀缺的问题,本文用仅由正常GPR雷达图训练的去噪卷积自编码器做无监督异常检测;关键洞察是不要全图平均重建误差,而是在隧道物理可能出现的深度带内取top-k误差。该深度受限评分将AUC由0.986提高到0.994,漏检从634个隧道窗口中的74个降至17个,最终在1600个野外窗口上达到F1 0.975、召回0.973。

EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization Figure 1
2026-07-07cs.CV

EventCoT: Event-centric Video Chain-of-thought for Reasoning Temporal Localization

Youngkil Song, Yoonjae Baek, Dongwon Kim, Inho Kim, Dongkeun Kim, Suha Kwak

Pohang University of Science and Technology, Pohang, South Korea, Korea Advanced Institute of Science and Technology, Daejeon, South Korea, Handong Global University, Pohang, South Korea

2026-07-07视觉感知

针对视频问答中推理答案与支持时间段需同时生成、而均匀采样带来冗余且离散时间 token 会纠缠定位与生成的问题,EventCoT 将视频先压缩为事件 token,按问题选择相关事件,再用占位符与视觉嵌入匹配来定位起止时间。在 ActivityNet-RTL 上取得 SOTA,并在 ReXTime 上有较强零样本表现,同时显著减少视觉 token 和推理开销。

PAGE: Towards Practical Human-level Gaze Target Estimation Figure 1
2026-07-07cs.CV

PAGE: Towards Practical Human-level Gaze Target Estimation

Zhoutong Ye, Chengwen Zhang, Zhaibin Cui, Mingze Sun, Jiaqi Liu, Xiangwu Li, Qingyang Wan, Chang Liu, Xutong Wang, Huan-ang Gao, Yu Mei, Chun Yu, Yuanchun Shi

Tsinghua University 2 Jinan University † Corresponding Author ∗ Equal Contribution

2026-07-07视觉感知

这篇论文针对凝视目标估计在机器人和人机交互中需要同时理解场景语义与头部/眼部空间线索、现有模型仍低于人类的问题,提出 PaGE:用场景-头部交互模块以交叉注意力显式融合双分支特征,并结合冻结骨干训练、全模型微调和大规模无标注特征蒸馏。结果显示其在 GazeFollow、VAT、ChildPlay 等任务上达到 SOTA,9 项指标中 7 项超过人类,学生模型以约 10% FLOPs 保留多数性能,具备部署潜力。

TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving Figure 1
2026-07-07cs.CV

TGRIP: A Text-Guided Approach to Vehicle Instance Prediction in Autonomous Driving

Miguel Antunes-García, Santiago Montiel-Marín, Fabio Sánchez-García, Rodrigo Gutiérrez-Moreno, Rafael Barea, Luis M. Bergasa

2026-07-07视觉感知

针对BEV端到端车辆实例预测过度依赖占用、光流等几何监督、难以区分交互场景中不同车辆语义的问题,TGRIP用视觉语言基础模型从多相机图像生成语义增强BEV图,作为训练期教师监督注入时空表示。论文称这是将开放词汇语义引导用于未来实例预测的早期尝试,并在nuScenes上超过现有方法,显示语义先验有助于实例关联和运动预测。

Hybrid Deep Learning for Traceability and Classification of Industrial Slate Tiles Figure 1
2026-07-07cs.CV

Hybrid Deep Learning for Traceability and Classification of Industrial Slate Tiles

Soren Antebi, Stefan Eickeler, Sandra Halscheidt, Rene Schmitz, Michael Muellers, Dirk Hecker, Rafet Sifa

2026-07-07视觉感知

面向板岩瓦生产中人工判别矿源和单片追踪成本高、易受自然纹理差异影响的问题,论文将 XFeat+LightGlue 的局部匹配分支与 MobileNetV3 分类分支融合,兼顾实例重识别和产地分类。新建 2610 张工业图像数据集上,匹配 AUC 较 XFeat 提升约 15.4%,分类准确率较标准 MobileNetV3 提升 10.9%。

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models Figure 1
2026-07-07cs.CV

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models

Marian Lupascu, Sebastian Ripa, Mihai Trascau, Mariana-Iuliana Georgescu, Ionut Mironica

2026-07-07生成模型

多主体个性化扩散生成的难点在于多个独立 LoRA 合并到同一权重空间时会产生身份混淆和风格串扰。LILAC 的核心洞察是改用分层合成:推理时按顺序生成主体,每次只启用一个概念 LoRA,并以上一步冻结合成为条件,从结构上避免参数级干扰且无需联合训练。实验在 Orthogonal Adaptation 协议下,Qwen-Image-Edit+Layered 配置的 ArcFace 检测率达 0.861,高于原设定 0.745,但代价是随主体数线性增加采样时间,复杂接触遮挡仍受限。

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation Figure 1
2026-07-07cs.CV

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu

2026-07-07视觉感知

DGSeg面向复杂语言指令下的推理分割,动机是现有MLLM把推理压缩成点、框等稀疏提示时易引入歧义,影响机器人/具身场景所需的精确定位。其核心洞察是将语义“是什么”和空间“在哪里”分支解耦,再用动态门控按像素融合并抑制噪声提示。实验显示其在多个指代表达与推理分割基准优于强基线,在ReasonSeg验证/测试集达到69.6%和67.3% gIoU。

SLAM: Structured and Localized Analytic Manifold Adaptation for Lifelong VPR Figure 1
2026-07-07cs.RO

SLAM: Structured and Localized Analytic Manifold Adaptation for Lifelong VPR

Kenta Tsukahara, Kanji Tanaka, Rai Hisada

2026-07-07视觉感知

面向长期部署中的视觉地点识别,论文针对连续新环境带来的灾难性遗忘、噪声过拟合和多模态分布漂移,提出 SLAM:把解析增量学习与状态估计类比,结合 Unscented 扰动平滑、GMM 局部拓扑划分和 H∞ 鲁棒界的闭式递归更新。NCLT 10 任务、100 类实验显示,U+G 组合取得最高 27.5% 准确率;完整 H∞ 版本略低但提供精度—鲁棒性权衡。

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting Figure 1
2026-07-07cs.CV

DeGenseGS: Geometrically and Semantically Decoupled Surgical Scene Understanding in 4D Gaussian Splatting

Yimo Wang, Bin Kang, Shuojue Yang, Yueming Jin

2026-07-07三维

面向自主手术中动态解剖既要4D重建又要可文本查询语义的问题,DeGenseGS指出现有4DGS把语义特征与几何形变刚性绑定,易在烧灼等外观突变场景引入虚假几何扭曲。其用HexPlane共享运动潜变量但分支解码几何与语义,并结合栅格化原生语义提取和角度对齐蒸馏;在CholecSeg8k与EndoVis18上报告达到SOTA,提升几何完整性和语义-解剖对齐。

Continual Model Merging with Test-Time Adaptation for Whole-Slide Image Analysis Figure 1
2026-07-07cs.CV

Continual Model Merging with Test-Time Adaptation for Whole-Slide Image Analysis

Duc-Thanh Le, Doanh C. Bui, Maï K. Nguyen, Khang Nguyen

2026-07-07视觉感知

针对WSI癌症分类中任务持续增加、历史切片难以保存且微调易遗忘的问题,论文将AdaMerging、AdaRank、Hi-Vec等测试时自适应模型合并方法系统迁移到无回放持续学习场景,并在六个TCGA队列评测。结果显示,该思路能提升当前任务表现并在部分设置中优于传统持续学习的知识保持,但对任务顺序和仅依赖当前无标签测试分布的适应非常敏感。

FM-ChangeNet: Learning Change through Pathwise Feature Transport Figure 1
2026-07-07cs.AI

FM-ChangeNet: Learning Change through Pathwise Feature Transport

Roie Kazoom, George Leifman, Genady Beryozkin

2026-07-07视觉感知

针对遥感双时相变化检测中端点特征差分容易混淆光照、错位与真实结构变化的问题,FM-ChangeNet 将变化建模为特征空间中的连续传输路径,并用时间条件速度场监督中间状态;速度幅值同时作为可解释的局部变化线索。结合跨时相对齐和多尺度解码后,文中报告其在遥感基准上达到最优或竞争性能,但对强分布偏移和大规模效率的验证仍不足。

MergeSurv: Merging-Based Continual Learning for Survival Analysis on Whole-Slide Images Figure 1
2026-07-07cs.CV

MergeSurv: Merging-Based Continual Learning for Survival Analysis on Whole-Slide Images

Vu Minh Tran, Doanh C. Bui, Maï K. Nguyen, Khang Nguyen

2026-07-07视觉感知

针对全切片病理图像生存预测在新增癌种/队列时需反复训练、存储成本高且有隐私风险的问题,MergeSurv将各任务上微调的TITAN病理基础模型参数顺序合并为统一模型,并比较单头OFA与多专家投票VEA推理。四个TCGA队列实验显示,其较朴素微调、正则化和回放式持续学习能降低灾难性遗忘,VEA风险分层表现更稳。

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery Figure 1
2026-07-07cs.RO

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

Zhiyuan Lu, Kanji Tanaka

2026-07-07机器人视觉感知规划控制优化算法

本文针对热红外视觉地点识别在未建图/OOD场景中“高置信误匹配”会污染SLAM后端的问题,提出TAO:将多假设时序验证压缩为批量SE(2) Procrustes对齐和一次SVD,避免MHT树扩展开销。结果显示其在5米微尺度难以区分一致性幻觉,但在10米级大范围失配中AUC最高0.991,可作为有边界的轻量故障过滤器。

DriftST: One-Step Generative Inference of Spatial Transcriptomics from H\&E Histology Figure 1
2026-07-07cs.CV

DriftST: One-Step Generative Inference of Spatial Transcriptomics from H\&E Histology

Yuhang Yang, Yonggan Bu, Shengyuan Zhou, Yiming Luo, Kai Zhang

University of Science and Technology of China, Hefei, China, Peking University Cancer Hospital, Beijing, China

2026-07-07生成模型

DriftST针对空间转录组成本高、H&E到基因表达预测中回归过平滑而生成模型推理慢的问题,提出Cellular Drifting以一步生成表达分布,并用STransformer建模基因共表达依赖与基因重要性差异。文中称其可统一处理spot级和cell级数据,并在多组织、多平台实验中达到SOTA;但摘要片段未充分说明具体增益幅度与数据规模影响。

SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction Figure 1
2026-07-07cs.CV

SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction

Pin Tang, Zhongdao Wang, Guoqing Wang, Xiangxuan Ren, Chao Ma

2026-07-07视觉感知

面向自动驾驶的视觉 3D 语义占据预测,论文针对稠密体素计算冗余、BEV/TPV 损失细粒度结构,以及既有稀疏方法将几何补全与语义分类耦合导致空区域激活过多的问题,提出 SparseOcc++。核心做法是用稀疏锚点上的 Scene Completion Field 将场景补全改写为边界距离回归,并通过正交分解、离散学习和几何引导传播,只在几何确认区域做语义预测。实验称其在 nuScenes 上 IoU 较 SparseOcc 提升 2.3% 且快 3.9 倍,在 SemanticKITTI 上较 OccFormer 快 5.9 倍。

When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions Figure 1
2026-07-07cs.CV

When Does High-CFG Diffusion Inversion Fail? A Controlled Study of Prompt--Latent Interactions

Yan Zeng, Yusuke Hosoya, Huyen T. T. Tran, Takayuki Okatani

2026-07-07生成模型规划控制

本文关注图像编辑中高 CFG 生成轨迹为何难以被反演:低 CFG 反演虽常用,却会与高 CFG 编辑产生轨迹错配。作者在已知初始 latent 与去噪轨迹的受控生成—反演—重建实验中发现,提示词存在易、难和依赖 prompt–latent 配对的中间三类;提出“prompt pressure”解释粗粒度难度但不足以预测中间失败。局部不稳定步降低 guidance 的轨迹一致性干预能改善重建和 Prompt-to-Prompt 编辑,说明失败更依赖局部轨迹而非单一提示词或种子因素。

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards Figure 1
2026-07-07cs.SE

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che

Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China

2026-07-07视觉语言

这篇论文针对现有可视化生成多停留在静态图表、难以评估模型主动理解交互式仪表盘的问题,提出 Dashboard2Code 任务与 DashboardMimic 基准,要求模型通过点击、筛选等探索反馈生成可复现视觉和交互逻辑的 Dash 代码,并结合语义分析与动态交互测试自动评估。实验显示,最强闭源模型在复杂仪表盘上仍明显退化,开源模型差距更大,瓶颈主要在主动探索、细粒度视觉细节和复杂回调逻辑复现。

Reference-Induced Consensus for Selective Posed-Reference Visual Localization Figure 1
2026-07-07cs.CV

Reference-Induced Consensus for Selective Posed-Reference Visual Localization

Wonseok Kang, Jaehyun Kim, Jeongmin Lee, Tae-Wan Kim

2026-07-07三维

这篇工作针对视觉定位中“给错姿态比不返回更危险”的问题,提出 RIC-Loc:用已知位姿参考图和冻结 VGGT 生成每个参考诱导的查询位姿假设,再做鲁棒共识,并保留假设分歧与轨迹条件协方差作为拒识置信度。结果显示其无需场景训练、SfM 点图或 PnP,室内精度可接近结构化定位,且失败检测 AUROC 明显优于检索分数间隔,低纹理场景中协方差分数更有效。

Learning Probabilistic Prompt for Continual Learning Figure 1
2026-07-07cs.CV

Learning Probabilistic Prompt for Continual Learning

Hyekang Park, Sanghoon Lee, Geon Lee, Jongyoun Noh, Bumsub Ham

2026-07-07视觉感知

本文针对基于提示的持续学习中“prompt collapse”问题:固定提示向量会彼此趋同,难以覆盖任务内与任务间多样视觉分布。作者将每个提示建模为概率分布,并用混合分布采样多样提示,同时加入分布正则以稳定跨任务更新。实验在 ImageNet-R、CIFAR-100、CUB-200 上提升 FAA/CAA,消融显示概率化、混合建模与正则项均有贡献。

Hierarchical Scaffolding Enables Human-Like Cognitive Selectivity under Data Scarcity Figure 1
2026-07-07cs.LG

Hierarchical Scaffolding Enables Human-Like Cognitive Selectivity under Data Scarcity

Juhyoung Park, Jaehyuk Bae, Hyeonbo Yang, Se-Bum Paik

School of Computing, Department of Brain and Cognitive Sciences, Korea Advanced Institute of Science and Technology, Daejeon, Republic of Korea

2026-07-07视觉感知

针对小样本视觉识别中平面标签难以同时学习粗粒度语义与细粒度差异的问题,论文提出 SCALA,将类别标签显式组织为从粗到细的层级脚手架,并通过聚合细类 logits 进行阶段式监督。实验显示该方法在数据稀缺下提升分类准确率,使表征更紧凑可分,且增强对未见类别的高层泛化与新类适应;但具体增益对人工层级设计的依赖仍需进一步验证。

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification Figure 1
2026-07-07cs.CV

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Chuanyue Chen, Haiyang Yan, Ye Yuan, Jing Liu, Hua Han

2026-07-07视觉感知

针对大规模电镜连接组重建中过分割导致的高昂人工校对成本,Probe-EM将神经元追踪改写为从用户种子段出发的局部检索问题,用骨架端点引导启发式空间搜索,并结合基于NeuroSAM 2的免训练维度感知语义验证处理片内与片间断裂。实验称其优于监督式基线,并将人工校对时间减少33.4%。

Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data? Figure 1
2026-07-07cs.CV

Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?

Xin Chen, Dongliang Xu, Cunhao Zhu, Xudong Luo, Haoyang Lyu, Xiaoxiao Sun, Serena Yeung-Levy, Yue Yao

Shandong University, Stanford University

2026-07-07视觉语言

论文指出医疗 VLM 评测常默认输入已被清洗,但真实临床数据往往分散在异构文件、标注和元数据中,前置标准化才是缺失环节。作者构建 MDS-Bench,将原始数据夹到图像-JSON 的源对齐转换作为任务,覆盖 1939 个样本和多种模态/任务,并用 11 项指标评估。实验显示最佳 Gemini 3 Flash 端到端成功率仅 48.6%,说明瓶颈主要在内容忠实、语义对齐和全流程一致性,而非单纯 schema 生成。

From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation Figure 1
2026-07-07cs.CV

From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation

Baixuan Zhao, Xinyu Zhang, Huayu Zheng, Shuaicheng Liu, Xiongkuo Min, Guangtao Zhai, Xiaohong Liu

Shanghai Jiao Tong University, Shanghai, China, Shanghai Innovation Institute, Shanghai, China, University of Electronic Science and Technology of China, Chengdu, Sichuan, China

2026-07-07视觉感知优化算法

针对可控图像生成中参考条件只前馈注入、缺少误差校正而导致身份、姿态或深度漂移的问题,论文把生成过程改写为测试时闭环跟踪:复用预训练模块作编码器和传感器,用改进 PID 迭代更新潜在控制信号,无需训练且可包裹现有扩散管线。实验在身份保持、姿态和深度控制上优于计算量匹配的开环基线,最高带来 25.36% 人脸相似度增益,并分别降低 27.71% 姿态误差和 28.50% 深度误差。

A Reliable Context-Aware and Temporal Planning Framework for Autonomous Driving Figure 1
2026-07-07cs.RO

A Reliable Context-Aware and Temporal Planning Framework for Autonomous Driving

Argho Dey, Yunfei Yin, Swachha Ray, Md Minhazul Islam, Zheng Yuan, Sijing Xiong, Hongyu Liu, Zhiqiu Huang

Funding of SUGON Industrial Control and Security Center under Grant CUIT-, Sijing Xiong, Hongyu Liu, and Zhiqiu Huang are with the College of Computer, Science, Chongqing University, Chongqing 400044

2026-07-07规划控制

该文针对端到端自动驾驶在遮挡、模糊、光照变化和噪声下盲目融合历史 BEV 特征导致规划不稳的问题,提出 RCT-AD:用可靠性评分与质量门控 FILO 记忆保留可信上下文、重建退化观测,并结合 LSTM 时序轨迹规划和检测/分割语义约束。nuScenes 上报告 NDS 61.5、mAP 52.9、mIoU 52.3,称在感知、预测与规划上优于近期基线且效率具备实时性。

TubeLite: Lightweight Multi-Actor Spatio-Temporal Action Detection Figure 1
2026-07-07cs.CV

TubeLite: Lightweight Multi-Actor Spatio-Temporal Action Detection

Ali Soltaninezhad, Melissa Cote, Alejandro Rico Espinosa, Tunai Porto Marques, Alexandra Branzan Albu

2026-07-07视觉感知

TubeLite针对时空动作检测中帧级检测易抖动、动作管断裂且重型Transformer或光流方案成本高的问题,强调稳定演员管而非堆叠全局时空计算。其核心是用轻量ConvNeXt/CenterNet检测、带运动线索的高斯ROI令牌化、演员级GRU传播和边界感知时序头共同约束空间与语义一致性。在MultiSports和UCF101-24上,Video-mAP@0.5分别较最佳对比方法提升4.5和7.1个百分点,同时参数量和FLOPs更低。

Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models Figure 1
2026-07-07cs.CV

Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models

Khang Nhat Hoang Vo, Artem Vazhentsev, Artem Shelmanov, Timothy Baldwin, Yova Kementchedjhieva

The University of Melbourne, • We construct a scalable labeling procedure, -label and post-generation alternatives., classifier to label images with distinct degradation

2026-07-07视觉语言视觉感知

这篇论文关注知识密集型视觉问答中 VLM 出错后“看不见、认不出,还是不知道”的归因问题,动机是单纯拒答或二分类可靠性无法指导修复。作者提出归因树与可扩展标注流程,将错误拆成视觉证据、实体识别、事实回忆和缺失知识等来源,并用生成前内部表征预测失败类型。结果显示,识别相关错误更依赖视觉 token 表征,实体已识别后的事实错误更依赖提示条件 hidden states,且可在解码前路由到图像修复、识别辅助或检索等干预。

AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer Figure 1
2026-07-07cs.CV

AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer

Yongwen Lai, Chaoqun Wang

School of Artificial Intelligence, South China Normal University, Guangzhou, China, Corresponding author.School of Artificial Intelligence, South China Normal University, Guangzhou, China

2026-07-07视觉感知

本文针对图像引导风格迁移中双 LoRA 难以解耦内容与风格、融合系数敏感且推理控制不稳定的问题,提出 AnyStyle:只微调一个用于捕获风格的 LoRA,并在推理时利用预训练模型内部注意力提取内容图的免训练结构引导。作者的核心洞察是内容保持不必依赖专门的 content LoRA,后者反而增加开销并降低结构保真。实验显示该方法在定量指标上具竞争力,并在感知质量、内容保持与风格一致性上优于多适配器融合方案。

ICME 2026 Grand Challenge on Cross-Scenario Defect Detection and Fine-Grained Severity Grading for High-Precision Manufacturing Figure 1
2026-07-07cs.CV

ICME 2026 Grand Challenge on Cross-Scenario Defect Detection and Fine-Grained Severity Grading for High-Precision Manufacturing

Wei Sun, Weixia Zhang, Linhan Cao, Mingkai Lu, Xiongkuo Min, Xiaoping Zhang, Patrick Le Callet, Guangtao Zhai, Hongxing Chen, Wenqi Wu, Zhenhao Hu, Shanshan Lin, Guanjie Huang, Kai Xie, Rui Xin, Zilong Zhao, Runmin Cong, Ningjing Li, Siqi Ma, Yi Jin Ong, Tianfei Zhou, Shunzhou Wang, Zhiyang Chen, Hao Fang, Chen Zhang, Tze-Hsiang Tang, Dikai Li, Xianjin Wu, Avinash Kumar Sharma, Zhaoyang Wang, Haiyong Chen, Binyi Su, Atik Shahariar

2026-07-07视觉感知

面向高精制造中跨产线泛化差和缺陷严重度被忽视的问题,论文组织 IDA 2026 挑战赛,将晶圆显微缺陷检测拆成跨场景定位分类与四级严重度评估两条赛道,并构建含七类缺陷、实例标注与等级标签的数据集。结果显示该基准吸引 86 名注册参与者、130 次提交,最终有效评测中 Track 1 最优综合分 0.806,证明跨域检测与风险分级仍是工业视觉落地的关键瓶颈。

Video Generation Models Are Inherent Lighting Estimators Figure 1
2026-07-07cs.CV

Video Generation Models Are Inherent Lighting Estimators

Ziqi Cai, Shuchen Weng, Kaiqi Liu, Zifeng Wang, Zhiquan Zhang, Minggui Teng, Han Jiang, Boxin Shi

2026-07-07视觉感知

本文针对单目野外视频中动态 HDR 环境光难以恢复的问题,提出 V-LITE:把光照估计改写为在视频中补全虚拟镀铬球的 inpainting 任务,利用视频扩散模型的时空生成先验推断反射,并通过 HDR-aware VAE 与 LoRA 微调适配 HDR 表示。实验显示其能生成时间一致的 HDR 环境图,用于虚拟物体插入等渲染任务,但具体增益中模型先验、HDR 适配与新数据集的相对贡献仍需进一步拆分说明。

GlaKG: A Biomarker-Centric Fundus Knowledge Graph for Explainable Glaucoma Diagnosis and Risk Assessment Figure 1
2026-07-07cs.CV

GlaKG: A Biomarker-Centric Fundus Knowledge Graph for Explainable Glaucoma Diagnosis and Risk Assessment

Cheng Huang, Jia Zhang, Yi Jiang, Yang Liu, Karanjit Kooner, Yadi Liu, Tsengdar Lee, Yang Xie, Wenqi Shi, Guanghua Xiao

2026-07-07安全鲁棒

针对青光眼筛查模型难以解释、临床规则未被显式利用的问题,GlaKG将眼底结构生物标志物、ISNT/CDR等规则和ResNet50图像特征分离建模,并用后处理融合生成可追溯推理链。实验在AI标注数据上达到二分类F1 0.9953、四级风险准确率0.930,但作者也说明标志物与标签高度相关,结果更像结构化标志物条件下的上界而非无泄漏图像性能。

DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval Figure 1
2026-07-07cs.CV

DiCE-CIR: Direct Composition Learning for Efficient Zero-Shot Composed Image Retrieval

Gwang-Ho Na, Ho-Joong Kim, Seong-Whan Lee

2026-07-07视觉感知三维

DiCE-CIR针对零样本组合图像检索中伪词投影方法训练链路长、需重编码且训练目标与推理检索不一致的问题,改为直接组合参考图像表征与编辑文本来预测查询表示,并用LLM从大规模图文对自动构造组合监督。实验显示其在CIRCO达到SOTA、在CIRR具竞争力,同时训练效率显著提升;但收益可能部分来自数据构造与规模化监督。

Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving Figure 1
2026-07-07cs.CV

Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving

Guoqing Wang, Pin Tang, Xiangxuan Ren, Liping Hou, Chao Ma

2026-07-07三维

面向自动驾驶稀疏、低重叠视角下的3D重建,论文指出全局体素高斯补全虽能处理遮挡但大量计算浪费在道路、天空等确定区域。FocusGS的核心洞察是只在深度不连续和遮挡边界等几何歧义流形上初始化并优化连续高斯查询,实现定向结构补全。实验称其在nuScenes等基准上保持或提升重建质量,同时高斯数量减少约74%、渲染时间降低约34%。

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising Figure 1
2026-07-07cs.CV

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

University of Science and Technology of China, University of Electronic Science and Technology of China, Fudan University, Georgia Institute of Technology, Shanghai Jiao Tong University

2026-07-07视觉感知

针对视频扩散模型画质强但长程物理一致性不足、现有光流联合训练又会忽略实体角色并引入容量冲突和推理误差累积的问题,论文提出 VPT 微调框架:用角色感知信号区分施动者、受控物、被动物体和背景,并通过模态解耦去噪、辅助损失衰减与跨步自引导让物理先验成为软约束。实验显示其在 Wan2.1-T2V-1.3B 上提升 VideoPhy 的 SA/PC,并在 VideoPhy-2 保持一致增益,同时尽量保留视觉质量。

Learning Flexible Generalization in Video Quality Assessment by Bringing Device and Viewing Condition Distributions Figure 1
2026-07-07cs.CV

Learning Flexible Generalization in Video Quality Assessment by Bringing Device and Viewing Condition Distributions

Nikolay Safonov, Dmitriy S. Vatolin

2026-07-07视觉感知学习理论

这篇论文针对现有视频质量评估默认单一观看环境、难以适配真实移动端设备差异的问题,构建了覆盖300余台Android设备、含亮度/环境光/屏幕属性等元数据的大规模成对主观数据集,并用条件化的投票聚合与模型适配方法学习设备相关质量分数。结果显示,引入设备和观看条件可提升排序一致性与跨场景预测鲁棒性,但具体增益在多大程度来自数据规模仍需进一步拆分说明。

Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension Figure 1
2026-07-07cs.CV

Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension

Lian Xu, Mohammed Bennamoun, Farid Boussaid, Hamid Laga, Yulan Guo, Dan Xu

2026-07-07视觉感知

本文针对弱监督指代表达理解中仅依赖单一 anchor 表征、难以显式对齐语言中属性与关系结构的问题,提出 SVCR:将视觉空间拆为一元对象表示和成对关系表示,并用组合式对齐分别匹配名词主体与整句关系语义。在 RefCOCO、RefCOCO+、RefCOCOg 上取得 SOTA,说明显式结构化视觉表征能改善复杂关系描述的定位。

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving Figure 1
2026-07-07cs.CV

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

2026-07-07视觉语言视觉感知

PixelPilot针对自动驾驶VLA直接从2D图像回归3D轨迹时与相机参数强耦合、难以混合多源数据且易依赖自车状态而非视觉理解的问题,提出“2D图像平面规划、推理时再按标定提升到3D”的解耦范式,并用带中间密集奖励的GRPO强化感知到规划的因果链。实验称其在开环和闭环评测中达到SOTA,优势主要来自更易扩展的异构数据训练和更强视觉推理。

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis Figure 1
2026-07-07cs.CV

Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis

Zhipeng Xu, Zulong Chen, Qing Liu, Junhao Ji, Jinxin Hu, Yipeng Yu, Jianqiang Wan, Jun Tang, Zhao Li

♢ Taobao and Tmall Group, Alibaba ♣ Zhejiang University

2026-07-07视觉语言

面向企业文档 KIE 中小型本地多模态模型缺少高质量监督、依赖云端大模型成本高的问题,论文提出 Sayre:从少量样例学习类别内容与版式规律,自动生成文档- schema-标注三元组,并将真实失败案例扩展为困难样本。实验显示其在受限与开放类别 KIE 上持续提升 Qwen3-VL,尤其利好小模型和开放场景;错误分析表明改进主要来自更好的 schema 对齐与复杂版式字段抽取。

Aperture-aware Dispersion 5-D Light-field Imaging Spectrometer Figure 1
2026-07-07cs.CV

Aperture-aware Dispersion 5-D Light-field Imaging Spectrometer

Chenglong Huang, Tao Lv, Jianing Yang, Chongde Zi, Linsen Chen, Xun Cao

2026-07-07视觉感知

针对5D光谱光场成像中相机阵列笨重、单探测器又常以空间分辨率换角度/光谱信息的问题,论文提出ADLIS:在孔径面用低成本石英双折射相位板进行角度-光谱联合编码,并与重建网络端到端优化,使每个像素融合所有视角信息。仿真和真实原型实验显示其在保持2448×2048全空间分辨率下重建3×3视角光谱光场,SIE达100%,且较彩色编码方案有更高PSNR和抗噪性。

Hierarchical Evidence-Driven Reasoning for Long Document Understanding Figure 1
2026-07-07cs.CV

Hierarchical Evidence-Driven Reasoning for Long Document Understanding

Junyu Xiong, Yonghui Wang, Rongjian Gu, Chenyu Liu, Bing Yin, Wengang Zhou, Houqiang Li

University of Science and Technology of China

2026-07-07视觉感知

这篇论文针对长文档多模态 RAG 中“相似但无答案”的干扰页和一次检索失败导致级联错误的问题,提出 HiEvi-RAG:先分解复杂问题,再粗检索页面,并用经 GRPO 训练的 EviAgent 做跨页证据验证,最后通过显式记忆进行多轮生成。四个基准上相较最强已报告基线平均准确率提升 8.05%,但具体增益在多大程度来自验证器训练、流程设计或底座能力仍需更多拆解。

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation Figure 1
2026-07-07cs.GR

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation

Veeramanohar Avudaiappan, Ritwik Murali

Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham, Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham, Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham India, Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham India

2026-07-07优化算法

针对现有视觉语言模型以像素方式编辑海报时难以满足对齐、重叠、可读性和字体等硬约束的问题,StructuredEdit将设计编辑转为结构化图层参数补丁预测,并用可微光栅化把像素级约束损失反传进微调。结合12.5万条人机筛选编辑数据,系统约束满足率达89%,高于GPT-4V的52%,元素IoU为0.82,字体Top-1准确率76%,用户研究中编辑时间减少33%、返工轮次减少44%。

Integrated Forward-Inverse Network for Lensless Image Reconstruction Figure 1
2026-07-07cs.CV

Integrated Forward-Inverse Network for Lensless Image Reconstruction

Donggeon Bae, Jaewoo Jung, Yong Guk Kang, Kyung Chul Lee, Taeyoung Kim, Jongho Kim, Sangjun Byun, Joonsik Park, Seung Ah Lee

2026-07-07视觉感知三维

本文针对无透镜成像中大范围 PSF 导致观测高度混叠、反演病态且易受标定误差影响的问题,提出 IFIN:在编码器—解码器各尺度交替引入可微前向投影与可学习逆更新,并联合学习空间变化 PSF,使测量域与图像域持续互相校验。实验显示其在 DiffuserCam、WiderCam 和 MultiWienerNet 三个基准上分别提升 PSNR 1.63、0.65、2.58 dB,并在去模糊和内联全息重建中保持竞争力。

G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement Figure 1
2026-07-07cs.CV

G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement

Meng Du, Hongchang Chen, Ran Li, Junjie Zhang, Qi Ouyang, Shuxin Liu

2026-07-07视觉感知

本文针对生成视频检测在未见生成器上易因学习生成器指纹、风格等捷径而失效的问题,提出 G2VD:用 VAE 重构结合频域/像素对齐构造反事实样本,并以双分支因果解耦和 HSIC 约束分离伪造因果线索与域偏置。四个公开数据集上跨域表现优于匹配骨干,在 GenVidBench 中准确率超过 90%、AUC 接近 0.95,且仅用 10% 训练数据。

CompressedVQA-AEV: Full-Reference and No-Reference Quality Assessment Models for Asymmetric Encoded Videos Figure 1
2026-07-07eess.IV

CompressedVQA-AEV: Full-Reference and No-Reference Quality Assessment Models for Asymmetric Encoded Videos

Wei Sun, Xingwei Liu, Dandan Zhu, Xiangyang Zhu, Weixia Zhang, Guangtao Zhai

East China Normal University, 2 Shanghai Jiao Tong University, Shanghai Artificial Intelligence Laboratory

2026-07-07视觉感知

针对 ROI/非对称编码视频中不同区域失真不均、传统 VMAF 等指标可靠性不足的问题,本文分别构建全参考与无参考 VQA 模型:前者用 Swin-B 多阶段特征计算纹理/结构相似度,后者融合 SigLIP2 与 Swin-B 帧级表征并做跨折集成。在 QoMEX 挑战中,全参考赛道第一、无参考赛道第四;但报告性质较强,性能增益中集成与预训练 scaling 的贡献占比文中未充分说明。

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval Figure 1
2026-07-07cs.IR

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

2026-07-07视觉语言视觉感知

本文针对多向量视觉语言检索中图像 token 过多导致存储和 MaxSim 评分昂贵、而简单剪枝/合并又会丢失对象级证据的问题,提出 SaMer:用训练期对象标注作为合并先验,抑制跨实例混合,推理时无需框或检测器,仅适配投影层。结果显示在 K=64 时移除超 93% 图像 token、ColPali 存储降 16.09 倍,并在 Flickr30K、MSCOCO 的 R@1 上提升且短语级 grounding 更强。

LCPNet: Latent Consistent Proximal Unfolding Network for Infrared Small Target Detection Figure 1
2026-07-07cs.CV

LCPNet: Latent Consistent Proximal Unfolding Network for Infrared Small Target Detection

Tianfang Zhang, Fengyi Wu, Lei Li, Chang Liu, Zhenming Peng, Huaping Zhang, Xiangyang Ji

2026-07-07视觉感知

针对红外小目标在复杂背景中像素少、易被云边缘和噪声诱发虚警的问题,LCPNet把低秩-稀疏分解从图像域搬到潜表示中展开,保持物理约束同时减少反复压缩;其LCP求解器直接沿历史潜变量演化,并用共享优化记忆协调背景、目标和噪声更新。四个公开基准上报告优于现有方法,兼具较低虚警和较好效率,但具体增益中架构设计与训练规模的贡献仍需进一步拆分。

Displacement Preserving Relational Distillation for Robust Medical Segmentation Figure 1
2026-07-07cs.CV

Displacement Preserving Relational Distillation for Robust Medical Segmentation

Zhicheng Ding, Xinyu Chu, Jung Im Choi, Qing Tian, Tianyu Shi, Xiaoqian Jiang, Lijing Zhu, Qizhen Lan

2026-07-07视觉感知安全鲁棒

这篇论文针对3D医学分割中大模型计算开销高、跨设备成像漂移和背景体素淹没蒸馏信号的问题,提出DPRD:不直接匹配体素特征,而是在ROI掩蔽的病例级嵌入上对齐教师与学生的成对位移向量,并做尺度归一化以保留解剖关系。实验显示其在ISLES和AMOS上优于Logits KD、FitNet、RKD、CIRKD,AMOS Dice达85.46%,以约5%参数和3% FLOPs接近或超过MedNeXt教师并降低边界误差。

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models Figure 1
2026-07-07cs.CV

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

University of Turin, Italy, Eindhoven University of Technology, The Netherlands

2026-07-07视觉语言视觉感知强化学习

这篇论文针对 VLM 推理中视觉 token 数量过多导致的延迟和显存瓶颈,提出 TORINO:用预训练稀疏自编码器把图像 patch 投到可解释概念空间,按共享概念激活分组后剪枝或合并,实现随图像复杂度自适应压缩且无需微调。实验在 LLaVA-1.5 7B/13B 的九个基准上显示,中等压缩区间优于注意力或相似度方法,约 62% 减 token 时保留 98.7% 相对分数,约 78% 时仍有 97.1%;极端压缩下略逊于 PruneSID。

RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather Figure 1
2026-07-07cs.CV

RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather

Heejun Park, Jaeseok Jeong, Kuk-Jin Yoon

2026-07-07视觉感知三维安全鲁棒

恶劣天气下 LiDAR 与 4D RADAR 回波会变稀疏,而相机虽能补充语义也会被雨雪局部污染。RAF 的核心是显式监督逐像素可靠性图,并用 CALM 缓解跨模态投影误差,在冻结既有 LiDAR-RADAR 主干的基础上做模块化融合。K-Radar 与 VoD 实验显示其相对基线最高提升 +6.5 APBEV、+7.4 AP3D。

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding Figure 1
2026-07-07cs.CV

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

Wei Ao, Lan Wang, Vishnu Naresh Boddeti

2026-07-07视觉感知

长视频理解中,VLM容易被与问题无关的片段干扰,简单增加帧数又带来高开销。QSVideo的核心是把任意问题改写为适合检索的查询,并按物体、动作、位置估计帧相关性,再在检索时同时约束相关性、多样性和时间覆盖,分别适配长视频与流式视频。实验显示,在8/16/32帧预算下,它在StreamingBench达到强结果,并在LVBench相对骨干VLM提升约6.9–7.1个百分点。

Explainable Novel Category Discovery in Semantic Concept Space Figure 1
2026-07-07cs.CV

Explainable Novel Category Discovery in Semantic Concept Space

Ifrat Ikhtear Uddin, Yang Zhou, KC Santosh, Longwei Wang

Department of Computer Science, University of South Dakota, USA, Department of Computer Science and Software Engineering, Auburn University, USA

2026-07-07视觉感知

针对新类别发现虽能聚类未知类却难解释“为何成类”的问题,论文提出 xNCD,将表示学习、伪标签与分类约束放到语义概念空间中,通过视觉语言先验学习无标注概念瓶颈,使簇级和样本级证据可读。实验在 CIFAR-10 接近 UNO,在 CIFAR-100 从 73.2% 提升到 76.45%,并提供同类方法缺少的可解释性。

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models Figure 1
2026-07-07cs.RO

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

Soft Robotic Lab, Department of Mechanical and Process Engineering

2026-07-07视觉感知强化学习规划控制

面向灵巧手世界模型中23自由度动作维度高、真实数据稀缺且指物接触易被视频模型模糊的问题,论文将像素预测拆成“掩码动力学+RGB渲染”:先在分割掩码空间用50小时仿真预训练并以少于2.5小时真实演示微调,再用ControlNet-SVD渲染外观。实验显示该桥接显著提升逐自由度可控性,ID从0.68升至0.95、OOD从0.51升至0.87,优于单体RGB基线的细粒度动作响应。

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining Figure 1
2026-07-07cs.CV

CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining

Jingyu Song, Yi Liu, Katherine A. Skinner

2026-07-07强化学习

该文针对自动驾驶中相机-雷达方案成本低但多依赖任务监督、可迁移表征不足的问题,提出CRISP:用历史多视角图像和雷达扫描预测未来LiDAR点云,在预训练阶段借助LiDAR特权监督学习时空BEV骨干,部署时仍只需相机和雷达。其关键在于强化雷达编码、雷达增强时序注意力和带门控的多模态渲染,以利用距离与多普勒运动线索。nuScenes结果显示,CRISP提升长时域点云预测,并迁移到检测、跟踪、地图、运动预测、占据和规划等任务。

SceneFrom3D: Geometry-Conditioned Outdoor 3D Scene Generation via View Scheduling with Object-Level Control Figure 1
2026-07-07cs.GR

SceneFrom3D: Geometry-Conditioned Outdoor 3D Scene Generation via View Scheduling with Object-Level Control

Geonung Kim, Jeongeun Park, Nuri Ryu, Di Liu, Sunghyun Cho

Meta Reality Labs, Meta Reality Labs United States of America

2026-07-07规划控制三维

面向户外几何条件三维场景生成,论文针对大尺度、无边界几何中相机视角难以人工规划的问题,提出 SceneFrom3D:从输入几何自动构建含锚点视角、插值轨迹和生成顺序的有向生成图,并加入对象级外观图像与几何贴合强度控制。实验显示其在复杂户外场景中生成更高质量的 3DGS,且支持对象外观与几何遵循度调节。

A non-invasive video-based method for individual identification of wildlife using gait dynamics Figure 1
2026-07-07cs.CV

A non-invasive video-based method for individual identification of wildlife using gait dynamics

Muhammad Aamir, Matthew Wijers, Sangyun Shin, Andrew Loveridge, Andrew Markham

2026-07-07视觉感知

针对野外个体识别依赖项圈、标记等侵入式手段且难以规模化的问题,论文提出用视频步态作为动物“行为生物特征”:先以 SAM3 分割动物轮廓,再用 ResNet18 与 VideoPrism 学习空间形态和时序运动嵌入,并用余弦相似度聚类。多物种实验显示同一个体相似度约 0.91–0.99、跨个体多低于 0.80,平均轮廓系数 0.78,但数据规模与泛化边界文中未充分说明。

Geographic Diversity Beats Data Volume for Cross-Domain Generalization in Zero-Label JEPA Driving World Models Figure 1
2026-07-07cs.CV

Geographic Diversity Beats Data Volume for Cross-Domain Generalization in Zero-Label JEPA Driving World Models

Santosh Jaiswal

2026-07-07强化学习学习理论

这篇论文关注自动驾驶世界模型在跨城市、跨数据集时是否仍能用无标签“惊讶分数”刻画场景复杂度。作者用JEPA潜在预测模型做受控迁移实验,核心洞察是地理多样性比单纯扩大同域数据量更关键:在同为6.3万场景时,混合nuPlan与AV2训练使AV2验证集平均惊讶分数较nuPlan-only下降16.5%,且优于20万AV2-only单域训练。

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization Figure 1
2026-07-07cs.CV

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

Cangjin Qiu, Quan Zhang, Dan Jiang, Ke Zhang

2026-07-07视觉感知

本文针对音视频伪造定位中 Transformer 计算开销大、通道拼接难处理异步伪造且易受高频噪声干扰的问题,提出 UniSkip-Mamba。核心洞察是伪造判别信息主要集中在 0–0.15 低中频,因而用统一音视频序列保留跨模态相位关系,并通过 Skip-Scanning/Group-Scan-Merge 做频率感知正则。实验在 LAV-DF 和 AV-Deepfake1M 上达到 63.4% AP@0.95、63.58% mAP,并报告约 6 倍推理加速。

Enhancing Facial Expression Recognition in Head-Mounted Displays with Synthetic Data Figure 1
2026-07-07cs.CV

Enhancing Facial Expression Recognition in Head-Mounted Displays with Synthetic Data

Jianing Deng, Qiang Zhou, Jingtong Hu

University of Pittsburgh

2026-07-07视觉感知

本文针对头显内置相机视角下表情识别数据稀缺、正脸数据难以直接迁移的问题,提出 SynHMC:先从正脸图像重建带纹理 3D 人脸,再用可配置虚拟头显相机渲染 HMC 视角,并用 TSAN 在纹理空间校正采样误差以保留皱纹等细粒度表情线索。实验显示,用合成数据训练的模型在模拟和真实 HMC 数据上优于直接使用现有数据训练,并在不同相机配置间泛化更好。

LeukocyteCount: Automatic Identification and Counting for leukocytes using Deep Learning Figure 1
2026-07-07cs.LG

LeukocyteCount: Automatic Identification and Counting for leukocytes using Deep Learning

Ahmed M. Sayed (1), Sondos A. Refaat (1), Abdallah M. Mostafa (1), Mariam S. El-Rahmany (1), Ensaf Hussein Mohamed (1 and 2) ((1) Faculty of Computers and Artificial Intelligence, Helwan University, Cairo, Egypt, (2) School of Information Technology and Computer Science (ITCS), Nile University, Giza, Egypt)

2026-07-07视觉感知

针对白细胞人工计数耗时且易受主观误差影响的问题,论文提出三阶段混合流程:先用YOLOv5检测血细胞并统计,再以微调的MobileNetV2提取白细胞特征,最后用逻辑回归分类四类WBC。作者在BCCD数据集上报告WBC检测准确率98%、分类准确率99.04%,RBC检测F1达99.73%;但泛化到真实临床多中心样本的证据文中未充分说明。

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction Figure 1
2026-07-07cs.CV

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

Nikos Athanasiou, Ilya A. Petrov, Angela Yao, Shugao Ma, Eric Sauser, Edoardo Remelli, Shreyas Hampali, Johannes Schönberger, Fadime Sener, Bugra Tekin

2026-07-07三维

这篇论文针对 CLIP/VLM 特征可被扩散模型反演出原图、从而泄露人脸和场景隐私的问题,提出 TrustCLIP:在冻结视觉编码器与下游模块之间加入轻量投影,并把特征条件生成器作为显式对手进行对抗训练。其核心洞察是重建所需的细粒度身份/纹理信息与分类、VQA 所需语义并不完全重合。实验显示,该方法能显著降低生成式反演保真度,同时在分类和 LLaVA 类多模态任务上基本保持性能;但评估主要围绕 CLIP 与 IP-Adapter,跨编码器泛化仍需验证。

PulmoSight-XAI: An Explainable Multi-View Attention Ensemble with Gradient Boosting Meta-Learning for Multi-Label Chest X-Ray Classification Figure 1
2026-07-07cs.CV

PulmoSight-XAI: An Explainable Multi-View Attention Ensemble with Gradient Boosting Meta-Learning for Multi-Label Chest X-Ray Classification

Moshiur Rahman, Shafqat Alam, Tasnia Binte Mamun

Department of Biomedical Engineering, Bangladesh University of Engineering and Technology (BUET)

2026-07-07优化算法

本文针对胸片多标签诊断中的类别不均衡、共病标签混杂以及全局池化丢失局部病灶线索问题,提出按正侧位分别训练的多CNN集成框架,引入多尺度特征融合、CBAM注意力、ASL与自适应Focal混合损失,并用TTA、不确定性特征和XGBoost/LightGBM/CatBoost分层堆叠替代简单平均。在CheXpert风格数据上,正位和侧位宏平均AUROC分别达0.9319和0.9154,解释性热图显示较好的解剖一致性,但具体增益在各组件间的归因仍需看消融是否充分。

EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration Figure 1
2026-07-07cs.CV

EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration

Shen Shen, Quan Zhang, Dan Jiang, Ke Zhang

Soochow University, Tsinghua University, Soochow University Suzhou China, Tsinghua University Beijing China

2026-07-07视觉语言学习理论

针对长视频中伪造片段稀疏、音画线索弱且边界难以精确定位的问题,EVAS从早期就进行多阶段音视频协同交互,以捕捉微小同步异常,并用边界感知细化与无效帧掩码减少级联误差;同时以HourglassFFN降低开销。实验称其在LAV-DF、AV-Deepfake1M和TVIL上取得平均定位精度与召回率的领先结果,但具体增益来源仍需结合消融进一步判断。

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models Figure 1
2026-07-07cs.CV

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli

2026-07-07生成模型

本文针对扩散文生图推理期扩展中常用 NFE 指标忽略验证器开销、导致方法效率排序失真的问题,提出 Flash-BoN:用时间步截断、层跳过和激活代理快速生成大量草稿,再经多阶段验证选择候选并全质量精修。结果显示在固定真实耗时下优于引导搜索和普通 BoN,跨模型与基准提升随规模增大,并可叠加反思式提示优化。

Spatial Graph Representation and Morphometric Analysis of the Pulmonary Vascular Tree From Computed Tomography Using Multi-Scale Hessian-Based Filter Fusion and TEASAR Skeletonization Figure 1
2026-07-07cs.CV

Spatial Graph Representation and Morphometric Analysis of the Pulmonary Vascular Tree From Computed Tomography Using Multi-Scale Hessian-Based Filter Fusion and TEASAR Skeletonization

Piotr Mackiewicz, Jakub Kołyska, Radoslaw Roszczyk

Warsaw University of Technology, refinement. Vascular centerlines are then extracted with the, cessed independently for each lung. Centerline extraction is, around each accepted path, producing a loop-free centerline, strongly favoring centerline routes. The invalidation radius

2026-07-07视觉感知

这篇论文针对临床 CT 中肺血管尺度跨度大、噪声和分辨率限制导致形态量化困难的问题,提出无需训练的可解释重建流程:融合多尺度 Frangi/Sato Hessian 血管增强,并用 TEASAR 提取左右肺血管图。单例低分辨率 CT 上,融合图节点和分叉多于单滤波器,体积分形维数约 2.26、Murray 指数和 Horton 比总体落在文献合理范围;但验证仅基于一例, distal 血管截断明显,泛化性文中未充分说明。

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation Figure 1
2026-07-07cs.CV

CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation

Ke Li, Kaidi Liang, Yuxin Ding, Debojyoti Biswas, Xianbiao Hu, Ruwen Qin

Stony Brook University, Stony Brook, NY 11794, USA Pennsylvania State University, University Park, PA 16802, USA

2026-07-07生成模型安全鲁棒

面向自动驾驶闭环仿真中稀有且高风险的碰撞场景难以可控生成的问题,CCFM将场景生成改写为带硬碰撞约束的流匹配采样:先启发式选择最可行的对抗车辆与碰撞类型,再用接触点、航向和严重度约束及Gauss-Newton流形投影保证可解释控制。实验在nuScenes和nuPlan上分别达到最高46.4%和83.1%碰撞率,同时保持较真实驾驶行为。

Fields of the Planet: Field Boundary Mapping Beyond 10m Figure 1
2026-07-07cs.CV

Fields of the Planet: Field Boundary Mapping Beyond 10m

Isaac Corley, Caleb Robinson, Jennifer Marcus, Hannah Kerner

Microsoft AI for Good Research Lab, Arizona State University

2026-07-07学习理论

小农地块常只有几十米宽,10米 Sentinel-2 会把相邻田块栅格化成连通斑块,限制边界恢复。本文构建与 FTW 对齐的 3米 PlanetScope 数据集 FTP,并强调以矢量化后的地块恢复而非像素重叠评估。相同模型下,PQ 从 21.0 提升到 35.5,小于0.5公顷地块 PQ 从 5.8 到 15.7,匹配边界误差由18.6米降至7.4米。

Wan-Streamer v0.2: Higher Resolution, Same Latency Figure 1
2026-07-07cs.CV

Wan-Streamer v0.2: Higher Resolution, Same Latency

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

2026-07-07视觉感知

这篇论文针对实时音视频交互中高分辨率输出会拉高延迟的问题,在保持 Wan-Streamer v0.1 原生流式因果建模不变的前提下,将视频从 192×336 提升到 640×368。核心做法是把低延迟感知、状态更新和解码保留在单 GPU thinker 中,将高成本视频 latent 生成迁移到多 GPU Ulysses 式上下文并行 performer,并用预分片 K/V cache 降低通信负担。结果是在 25 FPS 下仍维持约 200 ms 模型侧延迟、约 550 ms 远程交互延迟,同时支持更清晰的近景与可读姿态、手部和场景的中景数字人。

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog Figure 1
2026-07-07cs.CV

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu

National University of Singapore, Nanyang Technological University, Tsinghua University, Peking University, Shanghai Jiao Tong University, Westlake University

2026-07-07视觉感知

这篇论文针对论文录用后制作海报、讲解视频和博客仍高度依赖人工的问题,提出将“传播最后一公里”视为可组合的技能系统:先用 Paper2Assets 统一抽取论文资产,再生成可在 PowerPoint/Word 中继续编辑的海报、视频和双语博客,并由 Paper2Reel 对齐为交互式页面。结果显示,其海报在 Paper2Poster 基准上优于既有自动系统和单轮前沿 LLM,整体胜率达 84%–93%,但视频与博客收益更多以能力审计呈现。

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies Figure 1
2026-07-07cs.RO

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies

Tianxing Chen, Yue Chen, Zixuan Li, Junyuan Tang, Kailun Su, Weijie Wan, Baijun Chen, Haoran Lu, Haowen Yan, Honghao Su, Zhiyang Dou, Kaixuan Wang, Dandan Zhang, Yunze Liu, Yan Qin, Qiwei Liang, Qiwei Wu, Zijian Lin, Wenwei Lin, Yuran Wang, Minghua He, Tianshu Wu, Ruihai Wu, Jingquan Zhou, Kai-Chong Lei, Haibao Yu, Yuanfeng Ji, Weiyang Jin, Guanyu Lin, Xiaofan Li, Qi Xiong, Renjing Xu, Zhongyu Li, Wenhao Chai, Enze Xie, Ziwei Wang, Yao Mu, Hao Dong, Wojciech Matusik, Mingyu Ding, Wenbo Ding, Ping Luo, Masayoshi Tomizuka

2026-07-07机器人数据集/基准

针对现有机器人操作基准任务偏短、能力覆盖窄且仿真与真实评测割裂的问题,RoboDojo构建了统一的仿真—真实评测体系:42个仿真任务覆盖泛化、记忆、精度、长程执行和开放词汇指令,18个真实任务通过标准化硬件、重置流程和远程RealEval提升可复现性,并用XPolicyLab接入30个策略建立排行榜;结果主要给出系统性能力诊断,具体性能增益来源文中未充分说明。

On Pairwise Quantile Regression -- Statistical Guarantees and Applications Figure 1
2026-07-07stat.ML

On Pairwise Quantile Regression -- Statistical Guarantees and Applications

Romain Thérézien, Stephan Clémençon, Fantin Girard, Hamza El-Abdouni

2026-07-07视觉感知

针对均值回归难以刻画高离散相似度分布的问题,论文将分位数回归扩展到成对样本,用基于 U 统计量的 pairwise pinball loss 学习条件相似度分位数,并给出泛化界与温和条件下 O(1/n) 快速率。仿真验证理论趋势,面部识别实验显示该方法可揭示年龄差、图像质量、发长等因素对高置信相似度错误的影响。

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning Figure 1
2026-07-07cs.CL

UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

Niu Lian, Alan Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Yaowei Wang, Shu-Tao Xia, Jinpeng Wang

2026-07-07强化学习

论文针对跨桌面与移动端 GUI 智能体在持续学习中易混淆平台操作习惯、遗忘既有能力且缺少高质量轨迹的问题,构建 Uni-GUI 数据集,并提出按环境路由到平台专属教师的 on-policy 多教师蒸馏,使共享策略保留平台行为先验。实验在 OSWorld、MobileWorld 上成功率达 38.2% 和 12.0%,相对基座提升 12.7% 与 55.8%。

Transferability Between Understanding and Generation in Unified Multimodal Models Figure 1
2026-07-07cs.CV

Transferability Between Understanding and Generation in Unified Multimodal Models

Jiwon Kang, Heeji Yoon, Jaewoo Jung, Jaewon Min, Minkyeong Jeon, Biyeon Hwang, Sangwon Jung, Seungryong Kim

2026-07-07视觉语言

本文关注统一多模态模型中图像理解与生成是否真正共享能力,而非只看综合榜单增益。核心洞察是用“同一能力跨任务迁移”作为可控分析信号,发现迁移强弱高度依赖架构:共享 Transformer 主干与统一视觉编码器更容易产生迁移,松耦合设计较弱。实验显示,在计数、空间关系和文字相关任务上,先训练理解能力可提升对应生成能力,并较直接生成微调更少破坏视觉质量。

MambaRefine-CD: MambaVision with Region-Boundary Temporal Refinement Figure 1
2026-07-07eess.IV

MambaRefine-CD: MambaVision with Region-Boundary Temporal Refinement

Dineth Perera, Thaariq Firdous, Oshadha Samarakoon, Roshan Godaliyadda, Parakrama Ekanayake, Vijitha Herath

University of Peradeniya

2026-07-07视觉感知学习理论

这篇论文针对遥感二值变化检测中“区域能检出但边界易偏移、破碎或过平滑”的问题,提出基于共享 MambaVision 编码器的 MambaRefine-CD。其关键思路不是单纯扩大骨干,而是用 D-RBI 同时利用配对特征、绝对差和有符号差,并分离区域流与 Sobel 条件边界流,再用受限残差头只在边界附近修正粗预测。在 DSIFN-CD 和 WHU-CD 上,文中报告变化类 F1 与 IoU 表现较强,消融显示有符号时序证据和区域—边界细化流程均有贡献。

The Good, the Bad, and the Brittle: Benchmarking Robustness and Generalisation of Histopathology Foundation Models Figure 1
2026-07-07cs.CV

The Good, the Bad, and the Brittle: Benchmarking Robustness and Generalisation of Histopathology Foundation Models

Dhyey Yajnik, Amina Asif, Fayyaz Minhas

2026-07-07数据集/基准安全鲁棒

本文关注病理基础模型在真实临床扰动和跨中心分布偏移下是否可靠,而非仅看常规测试集精度。作者用REET构造11类染色、压缩、模糊、几何等扰动,并结合NR-Kfold制造特征空间不相似划分,提出PPI汇总鲁棒性。结果显示PFM整体强于ResNet,但相似性被打破时性能下降且波动增大;更大的模型并不总更稳,中等规模UNI2、Virchow-2等已接近或超过巨型模型,提示后续增益可能主要来自数据质量、多模态和域对齐而非单纯scaling。

Event Detection in Videos: A Framework for the Development of New Methods Figure 1
2026-07-07cs.CV

Event Detection in Videos: A Framework for the Development of New Methods

Anastasia Zakharova, Thierry Bouwmans, Anthony Cioppa, Adrien Deliège, Antonio Greco, Anaïs Halin, Kamil Jeziorek, Meghna Kapoor, Tomasz Kryjak, Islam Osman, Sébastien Piérard, Carlo Sansone, Mohamed S. Shehata, Renaud Vandeghen, Marc Van Droogenbroeck, Bruno Vento

2026-07-07视觉感知

这篇论文针对视频事件检测中事件定义含糊、数据集异构和评测不严导致方法难以公平比较的问题,提出以数据集、性能评估和部署场景为三支柱的开发框架;核心在于按采集环境分层组织视频并用标签描述内容与困难,同时引入FSD真实数据和SUC合成数据及概率化评测流程。主要结果是形成一套可用于方法定位、数据选择和场景化比较的规范,但文中未充分说明相对现有方法的量化增益。

HASSL: Hierarchy-Aware Self-Supervised Learning Framework for Single Cell Microscopy Figure 1
2026-07-07cs.CV

HASSL: Hierarchy-Aware Self-Supervised Learning Framework for Single Cell Microscopy

Julius Riel, Vishwa Mohan Singh, Sai Anirudh Aryasomayajula, Anuun Chinbat, Hannes Leonhard, Moritz Ladenburger, Frederik Alexander, Vishisht Choudhary, Fabio Laredo, Giacomo Masserdotti, Thorben Prein, Carsten Marr, Amirhossein Kardoost

2026-07-07视觉感知

该文针对单细胞显微图像中SSL表征易被成像模态、批次等粗粒度因素主导、掩盖细胞形态细分结构的问题,提出HASSL:用分割掩码教师增强形态感知,并以HDBSCAN层级聚类构造无标签对比目标,约束父子簇与相近亚型边界。在20个数据集、239万细胞上,相比基线提升Top-K检索约2.8%,深层级Top-9检索提升6.3%,药物扰动分类F1提升7.8%。

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach Figure 1
2026-07-07cs.CV

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

FST and ICI, University of Macau

2026-07-07机器人生成模型

本文瞄准无人机最后10米内因GNSS精度不足、尺度歧义和角度周期性导致的精细对准难题,提出DreamNav:先用正余弦参数化稳定回归航向与距离,再借助预训练世界模型生成候选动作后的视觉结果,以目标图像一致性做扩散式精修。作者同时构建PairUAV大规模评测集;实验显示其在未见场景中较视觉伺服和基础模型基线有更低角度、距离误差和更好成功率,但增益可能部分来自数据规模。

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation Figure 1
2026-07-07cs.CV

IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation

Hao Wei, Wenjin Qi, Dasen Dai, Minqing Zhang, Wu Yuan

2026-07-07视觉语言视觉感知

针对眼表疾病筛查中外眼照片数据稀缺、通用视觉语言模型缺乏解剖定位和临床推理的问题,IRIS构建IRIS-120K数据集,并用Topic Finding Tree把病灶与10类眼部区域层级绑定,结合面向医生、患者和学生的场景式VQA生成注入临床先验。论文称4B模型在相关评测中超过最高34B的通用及医学VLM,说明收益可能主要来自结构化数据与知识注入而非参数规模。

How to Build Digital Humans? From Priors to Photorealistic Avatars Figure 1
2026-07-07cs.GR

How to Build Digital Humans? From Priors to Photorealistic Avatars

Wojciech Zielonka, Tobias Kirschstein, Timo Bolkart, Simon Giebenhain, Vanessa Sklyarova, Xiang Deng, Donglai Xiang, Shunsuke Saito, Yebin Liu, Matthias Niessner, Justus Thies

Technical University of Munich, Tsinghua University, Max Planck Institute for Intelligent Systems, Technical University of Darmstadt, This state-of-the-art report provides an overview of controllable 3D human avatar creation. We describe current 3D avatar, (VR/AR, telepresence, online collaboration), people need human-, centered representations that preserve identity, expression, and so-, to 2025, as well as preprints available on arXiv. The papers, of-the-art report lies on reconstructing controllable human avatars, art reports on controllable video generation [MFH∗25], as well as

2026-07-07视觉感知

面向VR/AR、远程协作和具身AI中对可控、视角一致数字人的需求,本文将3D数字人构建归纳为先验学习、个性化建模与动画驱动流程,重点梳理前两阶段。核心洞察是用统一头像系统定义和按身体区域、表示、先验、输入与控制信号组织分类,覆盖头部、头发、手、服装到全身整合。主要结果是一份2021—2025年相关工作的系统路线图,并指出效率、行为建模、空间感知与伦理风险仍未解决。

Agent-driven Long-tail Simulation for Autonomous Driving Figure 1
2026-07-07cs.RO

Agent-driven Long-tail Simulation for Autonomous Driving

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

\phantom{}{}^{1} IIIS, Tsinghua University

2026-07-07视觉感知

针对自动驾驶闭环评测中回放与规则智能体交互性弱、难覆盖长尾行为的问题,论文提出由遵循语言指令的LLM道路参与者驱动仿真,并用结构化动作接口约束其物理可行性;同时构建SemanticPlan,在真实nuPlan场景中加入多智能体语义任务。实验显示现有规划器在这些长尾交互场景下仍难稳定安全完成任务。

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization Figure 1
2026-07-07cs.CV

Framework and Multi-modal Dataset for Roadwork Zone Detection and Geo-localization

Zhiran Yan, Yutong Xin, S Shyam Shenoi, Rui Song, Gordon Elger

Institute of Innovative Mobility (IIMo), Technical University Ingolstadt of Applied Sciences, Ingolstadt, 85049, Germany., Fraunhofer Institute for Transportation and Infrastructure Systems IVI, Ingolstadt, 85051, Germany., Technical University of Munich, Garching, 85748, Germany.

2026-07-07视觉感知数据集/基准

针对自动驾驶高精地图难以及时反映临时道路施工区的问题,论文发布RZDG多模态数据集,覆盖真实与CARLA仿真场景,含相机、LiDAR、GPS/IMU及分割、3D框和全局坐标标注,并基于AB3DMOT构建检测与地理定位流水线。以1米内为真阳性,真实/仿真数据F1分别为0.597/0.665,召回较高但精度仍有限。

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment Figure 1
2026-07-07cs.CV

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

2026-07-07视觉语言视觉感知

Aura针对参考图驱动视频中身份漂移、多主体绑定错误与“复制粘贴”伪影问题,提出以VLM语义特征对齐DiT的统一框架:用导演级密集字幕、T5/Qwen2.5-VL双分支注入、两阶段/课程式对齐、主体感知RoPE与类别token强化多参考区分,并配合AIGC数据管线和Progressive-APG推理。实验称其在单主体与多元素生成上达到SOTA,但具体增益中数据规模与模型设计的相对贡献仍可能不完全清晰。

SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation Figure 1
2026-07-07cs.LG

SAD-LoRA: Spectral Alignment for Low-Rank Knowledge Distillation

Omer Tariq, Syed Muhammad Raza, Jeongbae Son

2026-07-07视觉感知

论文针对 LoRA 知识蒸馏中仅优化输出可能导致低秩适配器子空间偏离教师更新、浪费秩预算的问题,提出 SAD-LoRA:从数据加权的教师更新中提取目标奇异子空间,并用主角度损失在训练中持续对齐。作者还给出误差分解,区分子空间错位、系数不匹配和不可约残差;合成实验显示错位项几乎被消除,GLUE 上在低秩设置提升秩效率,尤其 STS-B、CoLA 较明显。

Road-Aware Anomaly Segmentation with Query-Guided Polygons and CLIP in Autonomous Driving Figure 1
2026-07-07cs.CV

Road-Aware Anomaly Segmentation with Query-Guided Polygons and CLIP in Autonomous Driving

Zhiran Yan, Gordon Elger

Institute of Innovative Mobility (IIMo), Technical University Ingolstadt, Fraunhofer Institute for Transportation and Infrastructure Systems IVI, Ingolstadt, 85051, Germany.

2026-07-07视觉感知

面向自动驾驶开放道路中未知障碍易被闭集语义分割漏检的问题,本文提出无需重训练和OOD数据的后处理框架:利用Mask2Former查询置信度构建道路多边形先验,在可行驶区域内找缺口候选,再用CLIP零样本提示过滤语义上合理的ID目标。其在Fishyscapes、SMIYC、RoadAnomaly上整体优于训练自由基线Maskomaly,并在Fishyscapes LostAndFound取得最高AP。

AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation Figure 1
2026-07-07cs.CV

AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation

Qizhe Wei, Yingping Liang, Shaodi You, Ying Fu

2026-07-07生成模型

AquaStereo针对水下双目匹配中真实标注稀缺、散射与浑浊导致左右一致性和纹理特征失效的问题,提出用深度条件扩散生成保持几何一致的水下立体对,并结合物理提示池、左右一致性约束、跨域自蒸馏和感知增强特征来缩小陆地到水下域差。实验显示其在困难水下场景的鲁棒性与零样泛化优于现有训练策略,但具体增益中生成数据、蒸馏和特征增强的相对贡献仍需看消融。

EMPURPLE: A Free Lunch for Diffusion Distillation based on the Information Bottleneck Figure 1
2026-07-07cs.CV

EMPURPLE: A Free Lunch for Diffusion Distillation based on the Information Bottleneck

Zilai Li, Lujia Bai

2026-07-07生成模型

本文针对扩散蒸馏虽能减少采样步数却常损害 FID 和覆盖度的问题,指出早期强行预测高细节潜变量会放大学习难度与训练—推理分布错配。EMPURPLE 无需训练,缓存并复用原始模型的中间噪声潜变量,使蒸馏采样从更接近分布内的状态开始;在 DMD2、Hyper-SD、FlashSD、SDXL-Lightning 上报告 FID 提升 7%–20%,但 CLIP 分数略降。

AdaptiveSplat:Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction Figure 1
2026-07-07cs.CV

AdaptiveSplat:Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction

Badrinath Singhal, Srihari K G, Sreehari Iyer, Ankit Dhiman, Venkatesh Babu Radhakrishnan

2026-07-07规划控制三维

AdaptiveSplat针对前馈3D重建中像素对齐高斯数量冗余、直接剪枝易产生空洞和伪影的问题,提出按局部纹理复杂度分配高斯预算:低纹理区域更激进剪枝,高频细节区域保留更多,并用自适应高斯头重预测保留基元属性以补偿稀疏化。实验覆盖RE10K、ACID、DL3DV、Tanks and Temples和DTU,表明其在可控减少高斯数量时较好维持重建质量。

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation Figure 1
2026-07-07cs.CV

Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation

Weihao Yan, Yeqiang Qian, Yi Dong, Ming Yang

2026-07-07视觉感知

针对半监督医学分割在低标注比例下随机抽样易造成代表性偏差、伪标签噪声放大的问题,论文把标注/未标注划分视为分布对齐任务:先用视觉基础模型特征和 Density-K-Center 选择更具代表性的标注锚点,再用带前景/背景记忆库的 MCP 进行渐进式 Copy-Paste 对齐。六个2D/3D数据集实验显示其在1/16等极低标注场景下优于多种SSMIS方法,推理阶段无额外开销。

HeartVolMesh: Cardiac Volumetric Mesh Reconstruction via Covariance-Guided Graph Deformation Figure 1
2026-07-07cs.CV

HeartVolMesh: Cardiac Volumetric Mesh Reconstruction via Covariance-Guided Graph Deformation

Fengming Lin, Arezoo Zakeri, Haoran Dou, Zherui Zhou, Shaokun Lan, Jinming Duan, Alejandro Frangi

2026-07-07三维

本文针对心脏数字孪生中“分割后四面体化”易丢失薄壁细节、且跨病例网格对应性差的问题,提出 HeartVolMesh:用 3D CNN-GNN 将模板顶点建模为带各向异性协方差的高斯核,并以协方差感知 NLL 监督变形;再通过模板四面体网格到重建表面的配准和形变传播生成体网格。实验显示其相较变形式基线提升表面精度和体网格质量,并保持 24 个心脏结构的对应关系。

Hierarchical Multi-to-Single-Modal Knowledge Distillation for Disruption Prediction in EAST Figure 1
2026-07-07cs.CV

Hierarchical Multi-to-Single-Modal Knowledge Distillation for Disruption Prediction in EAST

Qiang Chen, Xiao Wang, Hao Si, Qingquan Yang, Meiwen Chen, Jianhua Yang, Xiaofeng Han, Yunhu Jia, Ran Chen, Liang Wang, Jin Tang, Guosheng Xu

School of Computer Science and Technology, Anhui University, Hefei 230031, China, Institute of Plasma Physics, Chinese Academy of Sciences, Hefei 230031, China, State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei 230039, China

2026-07-07视觉感知

这篇论文针对 EAST 托卡马克破裂预测中多模态模型精度高但推理成本重的问题,提出训练阶段融合可见光图像与时序诊断信号、推理阶段仅保留时序学生模型的分层多到单模态蒸馏框架,并在图结构、表征和决策层传递知识。结果显示,学生模型在 640 炮数据上保持 91.66% TPR、97.88% AUC,推理仅 3.75 ms,同时相较教师模型加速 2.16 倍并显著减少 FLOPs 与参数量。

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects Figure 1
2026-07-07cs.RO

SoftVTBench: A Safety-Aware Visuo-Tactile Benchmark for Physically Constrained Robotic Manipulation of Deformable Objects

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

2026-07-07机器人数据集/基准安全鲁棒

SoftVTBench针对柔性物体操作中“完成任务但接触不安全”的评测缺口,构建Isaac Sim/FEM驱动的视触觉基准,将Goal Success与无掉落、低形变约束下的Safety Success分开统计。实验显示仅看成功率会高估策略表现;加入触觉后,柔性物体任务安全成功率如21.4%提升到35.6%,且形变更小。

Topology-Driven Transferability Estimation for 3D Medical Vision Foundation Models Figure 1
2026-07-07cs.CV

Topology-Driven Transferability Estimation for 3D Medical Vision Foundation Models

Jiaqi Tang, Shaoyang Zhang, Fandong Zhang, Shu Zhang, Yang Liu, Qingchao Chen

National Institute of Health Data Science, Peking University, Beijing, China, Institute of Medical Technology, Peking University, Beijing, China, Deepwise Co., Ltd., State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China, Wangxuan Institute of Computer Technology, Peking University, Beijing, China

2026-07-07视觉感知三维

针对3D医学视觉基础模型下游分割任务中模型选择依赖逐一微调、代价高且现有迁移性指标忽视体素空间结构的问题,本文提出基于最小生成树的非参数拓扑估计框架,用特征图与语义标签图的对齐来评估可迁移性,并以LBTC刻画局部边界泄漏、GRTD刻画全局解剖布局,再用任务自适应门控融合。作者还论证随机初始化解码器可作为保持拓扑的空间投影以稳定全局评估。在覆盖11.4万3D医学体数据和多解剖/模态分割任务的实验中,该方法较最佳基线加权Kendall’s τ提高0.36,并将评估加速56倍。

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving Figure 1
2026-07-07cs.CV

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

Zhaohong Liu, Hao Ye, Xianlin Zhang, Mengshi Qi

2026-07-07视觉语言强化学习

面向自动驾驶 VLM 中 SFT 易产生推理幻觉、CoT/工具调用又难实时部署的问题,论文提出 CritiqueDriveVLM:先用多维验证器引导多轮强化学习训练高精度 Teacher,再将其收敛推理状态蒸馏到 Student 的隐空间,实现无 CoT 快速决策。在 DriveLMM-o1 上,MCQ 从 55.54% 提升到 76.54%,Student 平均仅生成 28 tokens,延迟由 3482 ms 降至 416 ms。

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering Figure 1
2026-07-07cs.CV

SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering

Kai Tang, Jinhao You, Bohua Zhang, Yichen Guo, Yiding Sun, Dongxu Zhang, Chenxi Li, Xiande Huang, Shanghang Zhang

2026-07-07视觉语言视觉感知

针对大视觉语言模型常因冗余、噪声视觉 token 被送入解码器而产生幻觉的问题,SeeMe 将传统特征工程思想用于视觉 token 处理,采用先按跨模态注意力筛选、再语义合并、最后结合语言上下文重选的免训练流程,在不改模型结构和不再训练的情况下,在 MME、POPE、AMBER 及四个 LVLM 上稳定降低幻觉并提升输出一致性。

FedProIn: Mitigating Client Drift for Learnable Prototypes in Federated Medical Imaging Figure 1
2026-07-07eess.IV

FedProIn: Mitigating Client Drift for Learnable Prototypes in Federated Medical Imaging

Harsh Kumar, Tarun Kumar Garg, Vaanathi Sundaresan

2026-07-07视觉感知

针对医疗联邦学习中因扫描设备、协议和人群差异导致的非 IID 客户端漂移,FedProIn 将类别原型设为可学习的多原型参数,并把漂移拆成特征漂移与原型漂移,分别用特征发散损失和原型对比损失约束,再用归一化影响力聚合削弱偏置客户端更新。在 HAM10000 与 Matek-19 上,IID/非 IID 准确率分别达 83.5/81.1% 和 96.2/95.8%,优于对比方法。

Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset Figure 1
2026-07-07cs.CV

Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset

Junyu Lou, Kai Chen, Weiyi You, Hui Zeng, Lei Zhang, Shuhang Gu

2026-07-07数据集/基准

针对 Live Photo 中高质量封面照与低质量视频帧由不同成像流水线造成的分辨率、色彩和动态范围落差,论文提出 LPRE 任务:用原封面作结构/颜色参考、邻近视频帧作时序线索来增强用户重选帧。其核心贡献是构建含 2042 个真实 Live Photos 的 Live2K 数据集,并给出融合多帧、引导色彩增强和超分的一阶段基线;实验表明该基线在重选封面增强上有效,为该新任务建立首个基准。

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus Figure 1
2026-07-07cs.CV

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

Waikit Xiu, Qiang Lu, Zian Wang, Xinjie Yang, Zhiwei Chen, Chen Sun, Xiying Li

The University of Hong Kong, Sun Yat-Sen University, The Hong Kong University of Science and Technology (Guangzhou)

2026-07-07数据集/基准

该文针对交通场景中小标志、路面标记等关键局部证据易被背景淹没的问题,指出现有VQA基准难暴露这种“关键证据稀释”。作者构建FGTR-Bench,并在Qwen3-VL-4B上加入查询引导的TG-SOF稀疏视觉token增强,无需外部检测器。结果显示TSR-MLLM在FGTR-Bench达74.1%,较最强4B基线提升2.1点,并在证据局部任务上增益更明显。

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding Figure 1
2026-07-07cs.CV

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

Yinsheng Yao, Yan Liu, Chen Ye

2026-07-07数据集/基准

这篇论文针对历史书法风格理解中多模态混杂与标签过粗的问题,提出 HCSU 数据集与基准,收集 10 个朝代、49 位书家的 39,307 张字图,并区分墨迹、碑拓和野外图像,同时加入专家层级审美描述。其核心洞察是书法风格识别不能只靠字形或书家标签,而要将内容与笔法、结体、墨色等细粒度视觉证据解耦。实验显示现有 LVLM 虽具备一定书法知识,但仍易受字形、文本和来源线索干扰,难以把审美判断可靠落到笔触证据上。

Binary Iterative Method for Non-targeted Adversarial Attack Figure 1
2026-07-07cs.LG

Binary Iterative Method for Non-targeted Adversarial Attack

Naman Goyal, Milan Chaudhari

2026-07-07视觉感知

本文针对非定向对抗攻击中步长与扰动搜索难以优化的问题,提出 Binary Iterative Method,在 BIM 基础上用二分/分治思想动态缩小迭代步长,以近似寻找局部最优扰动。实验在 ImageNet 随机 1000 张图和 Inception、ResNet 等预训练分类器上比较 FGSM、BIM、VAM,报告该方法能更高置信度诱导误分类,并将真实类别概率降至接近 0;但其理论收敛性与增益来源文中未充分说明。

Real-Time LiDAR Gaussian Splatting SLAM Figure 1
2026-07-07cs.CV

Real-Time LiDAR Gaussian Splatting SLAM

Seungjun Tak, Yewon Jeon, Jaeik Hwang, SukMin Hwang, Seongbo Ha, Hyeonwoo Yu

2026-07-07三维

这篇论文针对传统 LiDAR SLAM 地图稀疏、3D Gaussian Splatting 在线建图易膨胀且误差会长期反馈的问题,提出将 G-ICP 跟踪与球面 2D 高斯稠密建图紧耦合:复用局部协方差初始化尺度和法向,并用几何复杂度做剪枝/增密,同时把可靠性线索反馈给配准。结果在 Newer College 上以纯在线轨迹达到 86.78% F-score 和超过 20 FPS,并在 KITTI、Oxford Spires 等数据上显示较好的稳定性与可扩展性。

FRFDet: Efficient UAV Small Object Detection with Symmetric Sampling and Scalable Fusion Figure 1
2026-07-07cs.CV

FRFDet: Efficient UAV Small Object Detection with Symmetric Sampling and Scalable Fusion

Yunzhong Si, Huiying Xu, Xinzhong Zhu, Yang Liu, Yao Dong, Wenhao Zhang, Hongbo Li

2026-07-07视觉感知

面向无人机图像中小目标易被下采样淹没、背景冗余强且多尺度语义错位的问题,FRFDet在轻量单阶段检测器中引入对称的IBS采样以保留细节并重建空间一致性,同时用SFRCF按模型规模选择乘法或加法跨组融合。实验覆盖VisDrone、UAVDT、HazyDet和MS COCO,显示其在轻量检测器中以较低参数量、计算量和延迟取得领先精度,适合机载实时感知。

SOV-CAD: Stepwise Orthographic Views Guided CAD Modeling Sequence Reconstruction Figure 1
2026-07-07cs.CV

SOV-CAD: Stepwise Orthographic Views Guided CAD Modeling Sequence Reconstruction

Zhaopeng Feng, Chen Zhi, Xuhong Zhang, Zhengwen Feng, Xinkui Zhao

2026-07-07三维

SOV-CAD针对现有CAD重建方法一次性生成完整建模序列、缺少中间反馈而难以保留可编辑设计意图的问题,将CAD恢复建模为逐步决策过程。其核心是在每一步引入目标与当前模型的三视图正投影、活动草图和几何一致性奖励,并用离线强化学习的Decision Transformer预测后续操作。实验称其在CAD序列重建上优于已有方法且数据效率更高,但具体增益中各视觉监督与RL设计的独立贡献仍需结合消融判断。

GlacierCastAI: Predicting Glacier Retreat from Multi-Modal Satellite Imagery and Climate Signals Figure 1
2026-07-07cs.LG

GlacierCastAI: Predicting Glacier Retreat from Multi-Modal Satellite Imagery and Climate Signals

Arunkumar Ramachandran

2026-07-07视觉感知

这篇论文针对现有冰川遥感多停留在“当前边界制图”、难以提前预警退缩的问题,将任务改写为多模态时空预测:融合多时相 Landsat、ERA5 季节气候和 DEM,并用 ResNet50、ConvLSTM 与气候交叉注意力建模。结果显示,加入 ERA5 后 IoU 从 0.326 提升到 0.337,深度模型明显优于持久性和线性趋势基线;气候-only MLP 已接近影像模型表现,提示退缩信号可能先体现在气候变量中,但单次训练和小冰川表现差使结论仍需更多验证。

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics Figure 1
2026-07-07cs.LG

DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics

Silin Gao, Hao Zhao, Zeming Chen, Sepideh Mamooler, Antara Raaghavi Bhattacharya, Qiyu Wu, Hiromi Wakaki, Yuki Mitsufuji, Li Mi, Syrielle Montariol, Antoine Bosselut

2026-07-07强化学习

本文针对多模态大模型难以稳定理解视频/多图中的层级视觉动态,提出 DynaVieW:用视频关键帧作为状态、层级 JSON 描述作为转移,联合学习转移预测与下一状态生成,并结合混合专家、跨专家选择注意力和 schema token 重加权损失。实验显示其在视觉叙事生成中提升跨场景一致性与可控性,在 LEGO 世界模拟上也优于 BAGEL,说明显式建模状态—转移有助于减少长程生成误差。

The Multipath Blind Spot: $K$-Agnostic Robust Calibration for Sparse-Anchor Metric Depth from Frozen Foundations Figure 1
2026-07-07cs.CV

The Multipath Blind Spot: $K$-Agnostic Robust Calibration for Sparse-Anchor Metric Depth from Frozen Foundations

Sohag Roy, Rajesh Misra, Swami Shastravidyananda, Tamal Maharaj

The authors are with the Department of Computer Science, Ramakrishna Mission Vivekananda Educational and Research Institute (RKMVERI)

2026-07-07安全鲁棒

这篇论文针对单目深度基础模型用少量测距锚点恢复绝对尺度时默认锚点干净的问题,指出真实 ToF/LiDAR 的多径、混合像素等“有值但错误”离群点会使 VI-Depth 等校准方法失效。核心做法 MRAC 不训练新参数,而是用基础模型相对深度与锚点之间的 Theil–Sen 鲁棒拟合和 MAD 门控先剔除不一致锚点,再调用原校准头。实验在 320 个鲁棒性设置中显示其相对同骨干控制赢得 84% 单元,并将 KITTI 多径 AbsRel 从 0.489 降至 0.151。

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion Figure 1
2026-07-07cs.CV

Sparse4D-Radar: An Efficient and Robust Framework for Surround-View 3D Object Detection via 4D Radar-Camera Fusion

Fuyuan Ai, Yuchen Tan, Jiehui Chen, Zhiwei Xu, Chunyi Song

2026-07-07视觉感知三维安全鲁棒

该文针对现有4D雷达-相机融合多停留在前视、扩展到360°又计算开销过高的问题,提出Sparse4D-Radar,用稀疏查询框架结合可变形融合对齐雷达空间线索与图像语义,并用速度一致性采样抑制鬼影噪声、自适应模态门控调节传感器可靠性。在OmniHD-Scenes上,Base达47.01% mAP、57.25% ODS和11.5 FPS,Acc提升到47.57% mAP、58.35% ODS,在恶劣场景也保持较强鲁棒性。

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering Figure 1
2026-07-07cs.CV

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

National Tsing Hua University, Industrial Technology Research Institute ITRI, University of Toronto

2026-07-07三维

针对3D问答需要多视角输入、推理时视觉token和显存成本高,且既有帧选择/压缩多依赖离线全序列预处理的问题,论文提出无需训练的在线几何感知token剪枝:用深度和相机位姿把逐帧RGB-D投到共享体素空间,识别跨帧重叠区域并在进入VLM前删去冗余图像token。方法接入Qwen2.5-VL-7B和Qwen3-VL-8B,在ScanQA、SQA3D、OpenEQA-HM3D上最多减少约50% token,并报告LLM-Match最高提升+5.1。

Enhancing Implicit Neural Representations with Image Feature Embedding for Unsupervised Cardiac Cine MRI Reconstruction Figure 1
2026-07-07cs.CV

Enhancing Implicit Neural Representations with Image Feature Embedding for Unsupervised Cardiac Cine MRI Reconstruction

Donghang Lyu, Marius Staring, Yiming Dong, Keupp Jochen, Hildo J. Lamb, Mariya Doneva

Division of Image Processing, Department of Radiology, Leiden University, Center, Department of Radiology, Leiden University

2026-07-07视觉感知三维

针对心脏电影 MRI 高倍欠采样下缺少全采样监督数据、传统 k 空间 INR 难以建模全局分布且易引入伪影的问题,论文提出图像域双分支 I-FP-INR,用坐标分支结合零填充图像提取的特征嵌入,并通过交替推理阶段逐步细化输入特征。在 CMRxRecon2024 和院内数据上,方法在 4×、8×及多种采样掩码下较基线稳定提升重建质量。

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes Figure 1
2026-07-07cs.CV

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

2026-07-07视觉语言视觉感知强化学习

这篇论文针对长期运行机器人在动态环境中不能只靠事后观测更新地图的问题,提出用场景上下文主动预测物体在原位持续存在的概率。核心洞察是同类物体的持久性取决于用途和场景,PreSIST以VLM生成实例级生存先验,并用视觉模型蒸馏以便部署,再与概率持久性滤波结合。作者在新标注的开放场景数据集上显示,PreSIST-Lang和PreSIST-Vis优于同等效率基线。

SiamJEPA: On the Role of Siamese Student Encoders in JEPA Figure 1
2026-07-07cs.CV

SiamJEPA: On the Role of Siamese Student Encoders in JEPA

Makoto Yamada

Okinawa Institute of Science and Technology

2026-07-07视觉感知

本文针对现有 JEPA 多采用单学生编码器、暹罗学生编码器作用缺乏系统验证的问题,提出 SiamJEPA:用两路独立掩码视图和 EMA 教师在潜空间做预测,并用可调正则项统一单编码器情形。ImageNet 线性探测显示,暹罗结构更像有效归纳偏置/正则器,可提升表征可分性、加速早期收敛,在有限训练预算下优于单编码器 JEPA 变体和更长训练的 MAE。

Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology Figure 1
2026-07-07cs.CV

Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology

Han Li, Jingsong Liu, Ayako Ura, Junlin Hou, Zhengyang Xu, Azar Kazemi, Oskar Thaeter, Christian Grashei, Fabian Gülhan, Reza Nasirigerdeh, Xun Ma, Rui Yan, Hao Chen, S. Kevin Zhou, Nassir Navab, Carolin Mogler, Peter Schüffler

Institute of Pathology, Technical University of Munich, Munich, Germany, Computer Aided Medical Procedures (CAMP), Technical University of Munich, Munich, Germany, Munich Center for Machine Learning (MCML), Munich, Germany, Department of Human Pathology, Juntendo University Graduate School of Medicine, Tokyo, Japan, The Hong Kong University of Science and Technology, Hong Kong, China, Munich Data Science Institute (MDSI), Munich, Germany, School of Biomedical Engineering, University of Science and Technology of China, Hefei, China

2026-07-07视觉语言视觉感知

面向多模态计算病理中缺少真实全切片图像与诊断报告配对数据的问题,本文发布 TUM-Uteria 数据集,将子宫病理 WSI 与病例级、切片级报告系统对齐,并通过翻译校正、匿名化、LLM 辅助抽取和病理专家多阶段质控建立配对。数据包含 216 个临床病例、455 个切片级 WSI-报告对,覆盖常规诊疗中的良恶性及炎症等病变,可用于 WSI 分析、视觉语言建模和自动报告生成。

SAGE: Synchronized Action-Gaze Recognition and Anticipation for Human Behavior Understanding Figure 1
2026-07-07cs.CV

SAGE: Synchronized Action-Gaze Recognition and Anticipation for Human Behavior Understanding

Chenyi Kuang, Nakul Agarwal

2026-07-07视觉感知

这篇论文针对现有方法将人-物交互、注视识别与未来预测割裂建模的问题,提出 SAGE,用 gaze-conditioned 空间注意力和时间预测模块在同一 Transformer 框架中联合识别并预测动作与注视,且兼容第一、第三人称视角。作者还构建 Exo-Cook 以补足第三人称联合评测空白;在 VidHOI、EGTEA Gaze+ 和 Exo-Cook 上,联合建模整体达到或超过多种专用模型。

Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers Figure 1
2026-07-07cs.CV

Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers

Shuyang Xiang, Hao Guan

Institute of Software, Chinese Academy of Sciences.

2026-07-07视觉感知规划控制

这篇论文质疑中文语言模型必须依赖离散 token 嵌入的默认做法,改用整段汉字序列的栅格字形图像作为输入,并在共享解码器、训练目标和数据流程的双分支框架中控制比较。核心洞察是,汉字的二维空间布局、笔画与部首结构可由 ResNet+浅层 ViT 的视觉编码器转化为有效语言表示。实验中视觉模型在多个解码器上优于索引嵌入,峰值 Acc@1 为 0.429 对 0.355,约提升 21%,且收敛更快、对中等字符扰动更稳健;但英文实验未复现该优势,说明结论可能主要限于汉字等表意文字场景。

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image Figure 1
2026-07-07cs.CV

InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image

Gwanhyeong Koo, Hyunsu Kim, Youngji Kim, Taejae Lee, Siwoo Lim, Sunjae Yoon, Suyong Yeon, Chang D. Yoo

2026-07-07视觉感知三维

这篇工作针对单图到3D方法只生成物体、缺少墙地等结构布局而导致室内场景漂浮和错位的问题,改用360° ERP全景作为输入,并以深度反投影先验、视角选择交叉注意力和全局-局部混合注意力分阶段生成结构、资产与纹理。作者还构建ERP-FRONT配对数据集;实验显示其在3D几何与2D渲染指标上优于现有方法,并可泛化到真实全景数据。

BanglaMemeEvidence: A Multimodal Benchmark Dataset for Explanatory Evidence Detection in Bengali Memes Figure 1
2026-07-07cs.CL

BanglaMemeEvidence: A Multimodal Benchmark Dataset for Explanatory Evidence Detection in Bengali Memes

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Pronay Debnath, Asif Iftekher Fahim, Faisal Muhammad Shah

2026-07-07视觉语言视觉感知数据集/基准

针对孟加拉语表情包常依赖社会、政治和文化背景、现有多模态研究多停留在情感或有害性分类的问题,论文提出 MemeEvidenceDetect 任务,并构建含 2917 个表情包、OCR、上下文、证据句和三级相关性标注的 BanglaMemeEvidence 基准;同时给出融合文本与视觉特征的 BengaliMemeEvidenceNet,实验 F1 达 0.74,但模型增益相对数据与融合设计的来源文中未充分说明。

Scalable Semantic Steering of Embedding Projections Figure 1
2026-07-07cs.HC

Scalable Semantic Steering of Embedding Projections

Wei Liu, Eric Krokos, Kirsten Whitley, Rebecca Faust, Chris North

Department of Defense, Tulane University

2026-07-07视觉感知

低维嵌入投影常难符合分析者想看的语义结构,而逐项调用 LLM 做语义 steering 成本随数据量线性增长。本文的关键洞察是把意图建模从单个样本移到用户分组:一次 LLM 生成组级语义画像,并与种子中心融合成混合原型,再用嵌入空间软分配和重投影传播意图。在 5K LitCovid 文本上,其全局对齐接近逐项 LLM 方法,但调用量降到常数级、成本降低超三数量级;图像案例表明该机制也可迁移到多模态嵌入。

DS-SAC: Density Search for Sample Consensus Figure 1
2026-07-07cs.CV

DS-SAC: Density Search for Sample Consensus

Suraj Thapa, Muhammad Aminul Islam

\orgdiv Tagliatela College of Engineering, \orgname University of New Haven, \orgaddress \street 300 Boston Post Rd, \city West Haven, \postcode 06516, \state CT, \country USA

2026-07-07视觉感知

本文针对RANSAC类几何模型估计在高外点率下依赖随机最小采样、迭代开销大的问题,提出DS-SAC:先用全部点初始化模型,再通过残差空间的前向/后向密度搜索与带符号残差递归划分,确定性寻找高一致性区域。实验覆盖单应、基础矩阵和本质矩阵估计,显示其相较RANSAC、MAGSAC、LO-RANSAC、GC-RANSAC通常取得更高AUC、相当或更低位姿误差,并提升运行速度。

Reward Lightning: Fast Video Generation via Homologous Preference Distillation Figure 1
2026-07-07cs.CV

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

2026-07-07视觉感知强化学习

视频扩散模型的少步蒸馏常会破坏人类偏好,而把像素奖励与潜空间蒸馏硬拼又会带来梯度冲突。Reward Lightning 的核心洞察是让偏好对齐和蒸馏在同一潜特征与共享奖励骨干上“同源”优化,并用 LRM 与 HPD 联合训练。实验显示 LRM 偏好准确率较像素/潜空间基线高 11.0%/14.7%,1–4 步生成下 VBench 平均提升 2.1%,文本对齐、运动和视觉质量领先。

Cross-Modal Fusion of OCT and OCT angiography enface for Improved Diagnostics of Diabetic Retinopathy Figure 1
2026-07-07eess.IV

Cross-Modal Fusion of OCT and OCT angiography enface for Improved Diagnostics of Diabetic Retinopathy

Rashadul Hasan Badhon, Atalie Carina Thompson, Jennifer I. Lim, Theodore Leng, Minhaj Nur Alam

Most of the commercially available devices produce OCT slices and OCTA enface. Not to mention that OCTA, requires additional expensive hardware which is not always affordable or available at the local clinics. Hence, for, additional vascular information present in OCTA, combining it with the already available OCT, disease prognosis

2026-07-07视觉感知

该文针对糖尿病视网膜病变筛查中单用OCT缺少血管信息、OCTA硬件成本较高的问题,提出用双向跨模态注意力融合OCT B-scan与单通道enface OCTA,并进一步评估由OCT生成的翻译OCTA。结果显示,在OCT500与UIC的同域、合并和跨域设置中,融合方法整体优于ConvNeXt V2的OCT单模态基线,翻译OCTA在多数场景接近或超过真实OCTA,尤其提升敏感性与跨数据集泛化。

TESSERA v2: Scaling Pixel-wise Earth Foundation Models Figure 1
2026-07-07cs.CV

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, Mark Elvers, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, Andrew Blake, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

University of Cambridge, dClimate Labs

2026-07-07视觉感知

这篇工作针对地球观测基础模型预训练预算如何分配不清的问题,做了395次受控缩放实验,指出预训练损失几乎不能预测下游效果,应按下游任务选择模型,并将算力主要投向编码器和数据规模、固定投影头。基于该规则训练大教师并蒸馏为可部署学生模型,21M参数版本在29项任务上超过多种开放和闭源基线,16维前缀以1/8存储保留约92%性能。

A Large-Scale Dataset and a New Method for RemoteSensing Traffic Object Segmentation Figure 1
2026-07-07cs.CV

A Large-Scale Dataset and a New Method for RemoteSensing Traffic Object Segmentation

Zhigang Yang, Huiguang Yao, Linmao Tian, Qiang Li, Qi Wang

2026-07-07视觉感知数据集/基准

针对遥感交通目标分割中类别覆盖少、场景单一且影像过旧的问题,论文构建了 NWPU-Traffic 数据集,覆盖49城7国的汽车、飞机、船舶和火车,并给出实例级标注与基准;方法上引入空间-通道保持的多尺度特征交互和自适应局部-全局解码器,以缓解尺度变化和边界模糊。实验和消融表明该框架优于多种常用分割网络,但具体增益中数据扩展与模型设计的相对贡献仍需结合完整结果判断。

EgoInertia-MI: A Multimodal Egocentric Vision and IMU Benchmark for Motor Impairment Assessment Figure 1
2026-07-07cs.CV

EgoInertia-MI: A Multimodal Egocentric Vision and IMU Benchmark for Motor Impairment Assessment

Fatemah Alhamdoosh, Pietro Pala, Abduallah Mohamed, DK Arvind

2026-07-07视觉语言视觉感知数据集/基准

这篇论文针对临床运动障碍评估间歇性强、第三人称视频隐私和场景约束大的问题,提出 EgoInertia-MI,将胸前第一视角视频与可穿戴 IMU 同步采集,覆盖19类上下肢活动和无、轻、重三档模拟障碍,并设定动作识别与严重程度估计基准。结果显示第一视角视频本身已有有效线索,多模态融合最好,严重程度估计 Macro-F1 为0.78,动作识别为0.93;但数据来自健康志愿者模拟,临床泛化仍需验证。

GLOW-FDG: Generalized cancer LesiOn Whole-body segmentation model for $^{18}$F-FDG-PET/CT Figure 1
2026-07-07eess.IV

GLOW-FDG: Generalized cancer LesiOn Whole-body segmentation model for $^{18}$F-FDG-PET/CT

Maksym Fritsak, Maximilian Rokuss, Hubert S. Gabryś, Yannick Kirchhoff, Benjamin Hamm, Sebastian M. Christ, Nicolas Martz, Isabelle Opitz, Rolf Stahel, Martin Hüllner, Matthias Guckenberger, Klaus Maier-Hein, Stephanie Tanadini-Lang

2026-07-07视觉感知

针对全身FDG-PET/CT肿瘤病灶手工勾画耗时且跨癌种泛化差的问题,GLOW-FDG用1563例多癌种数据训练开源分割模型,并结合PET/CT错位增强、器官多任务监督和损失调整来降低假阳性。其在185例外部多机构扫描上,跨乳腺癌、肺癌、头颈癌和黑色素瘤的检测F1普遍优于AutoPET等公开模型,肿瘤负荷与TLG量化也较稳健,表现接近专家间差异。

NavEYE: Vision-Centered Multi-Sensor Fusion-Based Situational Awareness System for Intelligent Surface Vehicles Figure 1
2026-07-07cs.CV

NavEYE: Vision-Centered Multi-Sensor Fusion-Based Situational Awareness System for Intelligent Surface Vehicles

Ryan Wen Liua, Junxiong Lianga, Haoyu Wanga, Mengwei Baoa

2026-07-07视觉感知

面向智能水面航行器在复杂海况中依赖单一传感器易丢失身份、距离或语义信息的问题,NavEYE以视觉为中心融合AIS、雷达与相机,提出AIS-雷达多约束关联、距离自适应加权与时效衰减拼接,并用方位和距离双约束完成视觉跨模态关联。实船多源数据实验显示,其在轨迹连续性、关联精度和态势展示上优于对比方法,但具体泛化边界仍需更多场景验证。

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning Figure 1
2026-07-07cs.CV

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

Siru Jiang, Jian Liang, Ran He, Tieniu Tan

2026-07-07视觉感知

这篇论文针对 CLIP 测试时提示调优在分布偏移下依赖多视图增强、且优化与推理目标不一致的问题,指出 TPT 的熵最小化可视为从自生成伪标签学习。作者提出 USE,在优化和推理阶段都用自集成策略自适应强调原始/弱增强视图,并融合强增强以获得更可靠预测;实验显示 SE 可作为免优化 TTA 方法提升性能,USE 在多数据集上优于对应基线,且 SE 接入其他 TTA 方法也带来稳定增益。

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models Figure 1
2026-07-07cs.CV

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

2026-07-07视觉感知生成模型规划控制

本文针对条件扩散生成中任务专用设计泛化差、推理时损失引导把高维条件压成标量而造成信息瓶颈和轨迹误差累积的问题,提出无需训练的 DICT:在早期去噪注入加噪条件信号以保留空间细节,并用相邻去噪状态的对比轨迹目标约束逐步改进。实验覆盖风格迁移、超分和去模糊,报告相较任务专用与损失引导基线在保真度和感知质量上有稳定提升。

BAT3R: Bootstrapping Articulated 3D Reconstruction from 2D Image Collections Figure 1
2026-07-07cs.CV

BAT3R: Bootstrapping Articulated 3D Reconstruction from 2D Image Collections

Jakub Zadrozny, Oisin Mac Aodha, Hakan Bilen

University of Edinburgh

2026-07-07视觉感知三维

BAT3R针对铰接/可变形物体三维重建高度依赖人工制作多姿态3D资产的问题,提出只用每类一个带骨架的标准姿态网格和未标注2D图像集来启动训练。其关键思路是先用标准姿态渲染训练弱预测器,再反复从点图预测中拟合相机与关节姿态,生成更丰富的合成监督数据。实验显示,在四足动物等类别上可接近依赖人工铰接数据的DualPM表现,但具体增益在多大程度来自迭代数据扩充仍需结合完整实验细节判断。

SGF-CDNet: A Consistency-Discrepancy Graph Network over Semantic-Geometric Fused Nodes for Face Forgery Detection Figure 1
2026-07-07cs.CV

SGF-CDNet: A Consistency-Discrepancy Graph Network over Semantic-Geometric Fused Nodes for Face Forgery Detection

Jiayao Jiang, Bin Liu, Nenghai Yu

School of Cyber Science and Technology, University of Science and Technology of China, China, Anhui Province Key Laboratory of Digital Security, China

2026-07-07视觉感知

针对深伪人脸在局部伪迹不明显时仍会破坏五官区域协调性的现象,论文提出 SGF-CDNet:先融合人脸解析的语义区域与关键点几何信息构造图节点,再用一致性/差异性双路径 GNN 同时建模自然结构规律和伪造引入的冲突关系,并将图推理结果门控回多尺度特征。文中称其在公开数据集上优于现有方法,消融实验支持语义-几何融合与双路径推理的有效性。

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization Figure 1
2026-07-07cs.CV

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization

Nitzan Hodos, Roy Amoyal, Lior Fritz, Ianir Ideses, Sagie Benaim, Netalee Efrat

Technion, Israel Institute of Technology, Ben Gurion University, Hebrew University of Jerusalem

2026-07-07优化算法

针对3DGS在训练相机之外的近距离渲染易模糊、扩散增强又因目标与参考视图尺度不一致而拷贝错误纹理的问题,MACRO指出VAE/U-Net特征不具尺度不变性且无法在潜空间修正,因而利用场景深度将近景分解为多平面,在图像空间裁剪缩放参考图并用深度感知注意力匹配尺度。方法无需训练或改结构,在两个新近景基准上取得最佳感知指标,并保持有竞争力的重建分数。

SharpSplat: Edge-Regularized 3D Gaussian Splatting for High Fidelity Urban Building Reconstruction from UAV images Figure 1
2026-07-07cs.CV

SharpSplat: Edge-Regularized 3D Gaussian Splatting for High Fidelity Urban Building Reconstruction from UAV images

Porus Vaid, Shivam Chopra, Vaibhav Kumar

2026-07-07视觉感知三维

这篇工作针对无人机图像重建城市建筑时,标准 3DGS 容易把立面、屋顶角点和建筑边界抹平的问题,提出用 SAM3 文本分割得到建筑掩码,再结合 Sobel 边缘提取构造语义边缘监督,在训练中对齐渲染梯度与真实建筑边缘,而不改动 3DGS 架构。实验覆盖校园、密集城区和住宅数据,显示边缘清晰度提升且适应多类建筑,但效果依赖 SAM3 分割质量,损失权重仍需按场景调参。

GeoSelect: Spatial-Program Execution for Training-Free Referring Remote Sensing Image Segmentation Figure 1
2026-07-07cs.CV

GeoSelect: Spatial-Program Execution for Training-Free Referring Remote Sensing Image Segmentation

Yuhang Jiang, Guohui Deng, Miaozhong Xu, Chao Ruan, Jinling Zhao, Linsheng Huang

Yuhang Jiang, Guohui Deng, Chao Ruan, Jinling Zhao, and Linsheng Huang are with the School of, Internet, Anhui University, Hefei, China. Guohui Deng is also with the National Engineering, Research Center for Agro-Ecological Big Data Analysis & Application, Anhui University, Hefei, China.Miaozhong Xu is with the State Key Laboratory of Information Engineering in Surveying

2026-07-07视觉感知

针对遥感指代表达分割中同类目标拥挤、空间/比较/序关系难以由隐式视觉语言匹配可靠解析的问题,GeoSelect将自然语言转成可检查的类型化空间程序,并用几何场与集合/排序算子显式执行选择,无需指代表达监督。其在RRSIS-D与RISBench上分别达到58.86和55.27 mIoU,显著超过既有训练免费方法;消融显示主要增益来自显式空间执行而非骨干模型。

Ghosts Beneath Textures: Texture-Relation Cues for Cross-Paradigm AI-Generated Image Detection Figure 1
2026-07-07cs.CV

Ghosts Beneath Textures: Texture-Relation Cues for Cross-Paradigm AI-Generated Image Detection

Haoyu Wang, Yiming Qin, Zhongjie Ba, Ziping Dong, Jishen Zeng, Peng Cheng, Kui Ren

2026-07-07视觉感知

本文针对现有 AI 图像检测器多在文生图/噪声生成范式下验证、难以迁移到图像条件生成的问题,构建 ConImageGen 跨范式基准,并指出可泛化线索不在显式伪影本身,而在与语义弱相关的局部—全局纹理关系。基于此提出 DTS-Det,通过纹理关系编码与注意机制提升检测泛化性,在 ConImageGen 达到 99.6% 准确率,并在 PicoBanana、RAID 及攻击场景下优于基线。

PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur Figure 1
2026-07-07cs.CV

PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur

Gopi Raju Matta, Reddypalli Trisha, Vemunuri Divya Madhuri, Kaushik Mitra

2026-07-07三维安全鲁棒

PRISM3D面向机器人和手持成像中极端运动模糊导致SfM失效、进而难以重建3D场景的问题。其关键洞察是把深度SfM提供的稀疏全局拓扑、MCMC概率化高斯增密,以及连续Bézier相机轨迹的物理成像模型耦合起来,并扩展到事件相机辅助的PRISM3D-E。实验显示该RGB管线及多模态版本在强模糊重建中优于既有方法,但动态场景能力仍文中未充分说明。

CogRad: A Cognitively-Inspired Multi-Agent Framework for Radiology Report Generation Figure 1
2026-07-07cs.CV

CogRad: A Cognitively-Inspired Multi-Agent Framework for Radiology Report Generation

Saif Ur Rehman Khan, Hasaan Maqsood, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

2026-07-07视觉感知

本文针对放射报告生成中常见的单次前向生成缺乏图像核验、易遗漏或幻觉的问题,提出模拟放射科医生读片流程的 CogRad:由 Scout、Investigator、Writer、Verifier 四类智能体依次完成全局筛查、可疑区域细查、LLM 报告生成与逐句视觉蕴含验证,并可重生成弱 grounding 句子。在 CheXpert Plus 与 IU X-Ray 上,BLEU-4/CIDEr 等指标优于对比方法,并结合 RadGraph、CheXbert、幻觉分析和可视化评估临床一致性。

ContiStain: Cross-Domain Relation-Preserving Distillation for Continual Multi-Domain Virtual IHC Staining Figure 1
2026-07-07cs.CV

ContiStain: Cross-Domain Relation-Preserving Distillation for Continual Multi-Domain Virtual IHC Staining

Fuqiang Chen, Yifeng Wang, Hongpeng Wang, Yongbing Zhang

2026-07-07视觉感知

这篇论文针对临床中新增 IHC 生物标志物按时间陆续到来时,统一虚拟染色模型微调会遗忘旧标志物的问题。核心思路不是只约束输出,而是在 MoE 构造的域感知潜空间中保持跨标志物 token 相似关系,从而减少表示漂移。四域 MIST 连续染色实验中,相比顺序微调 FID 和 ConchFID 分别降低 11.1 和 60.9,说明其主要收益来自跨域结构关系蒸馏带来的稳定性。

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts Figure 1
2026-07-07cs.CV

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud

Eötvös Loránd University, King Fahd University of Petroleum and Minerals

2026-07-07视觉感知

针对中世纪拉丁手稿中缩写、连字和纸张退化导致通用 VLM 难以直接识别与翻译的问题,论文构建从图像到译文的评测框架,并发布含 1383 条图像、转写和专家译文的 IPC 数据集。核心洞察是领域专用 OCR 的古文字先验比模型规模更关键:小型 TrOCR 类模型 CER 可比大型通用 OCR/VLM 低最高 4.3 倍;同时,最简单的专用 OCR 接 VLM 管线反而优于加入 RAG 或纠错的复杂方案,后者受提示饱和和错误传播影响。

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation Figure 1
2026-07-07cs.CV

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

K. N. Toosi University of Technology, Tehran, Iran, Amirkabir University of Technology, Tehran, Iran, The University of Tokyo, Tokyo, Japan

2026-07-07生成模型数据集/基准

本文关注扩散模型被用作零样本分类器后,其决策依据仍不透明的问题。作者提出 ASOB-Bench,从属性绑定、尺寸/词序偏置和背景依赖三类机制性探针评估重建误差打分,并结合误差热图与 U-Net 交叉注意力定位原因。结果显示,扩散分类器比 OpenCLIP 更少属性错绑,但更容易受大物体、提示词顺序和背景捷径影响,说明其偏置结构与传统视觉语言模型明显不同。

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering Figure 1
2026-07-07cs.CV

Q-TriM: Question-Guided Tri-Modal Attention for Audio-Visual Question Answering

SungHun Kim, SeungJun Baek

Korea University

2026-07-07视觉感知

针对音视频问答中深层串行跨模态注意力可能逐层丢失细粒度线索、累积融合误差的问题,Q-TriM将文本、视频、音频的交互改为浅层并行融合:在问题条件下构造音视频联合分布,推导出Query、Key、Value可来自不同模态的Tri-Modal Attention,并配合问题引导的token过滤与模态混合。实验称其在三个AVQA基准达到SOTA,尤其在MUSIC-AVQA-R上有明显提升,显示较强鲁棒性。

FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction Figure 1
2026-07-07cs.CV

FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction

Dubing Chen, Huan Zheng, Tianyi Yan, Yucheng Zhou, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen

2026-07-07三维

本文针对视觉三维占据预测中传统相机射线投影感受野局部、依赖精确外参的问题,将2D到3D视角变换重新表述为全局稠密路由,并用分解式张量收缩实现可计算的全局混合;同时以FDR负责宏观拓扑、LSS保留局部几何精度,缓解分辨率与上下文冲突。在Occ3D-nuScenes和Occ3D-Waymo上取得SOTA,并在无外参设定下表现出更强结构鲁棒性。

TRISTAR: Triple-Signal Stair Recognition and Vision-Only Indoor Navigation for Search-and-Rescue Micro-UAVs Figure 1
2026-07-07cs.CV

TRISTAR: Triple-Signal Stair Recognition and Vision-Only Indoor Navigation for Search-and-Rescue Micro-UAVs

Octavian Gîngu, Stelian Spînu

International Student Conference, Military Technical Academy, Bucharest, Romania.

2026-07-07机器人视觉感知

面向GNSS缺失、昂贵测距硬件不易部署的室内搜救场景,论文把低成本DJI Tello的单目视频尽量转化为导航信号:用Depth Anything V2做深度校准,结合几何开门检测、OCR和目标/危险识别,并提出TRISTAR融合Sobel结构、Gabor纹理和单目深度识别楼梯。真实楼内飞行显示,深度相对误差由27.4%降至10%以内,门检测F1达0.91,融合式楼梯识别较单一信号更稳,但低光、反光和玻璃仍是主要限制。

Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection Figure 1
2026-07-07cs.CV

Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection

Runzhi Deng, Yundi Hu, Yiming Zhong, Zhao Wang, Xixi Liu, Hongsong Wang, Caifeng Shan, Fang Zhao

2026-07-07视觉语言视觉感知

面向冷启动工业质检中缺陷样本少、细小异常难看清且文本规范难落到像素证据的问题,论文提出无需训练的 GLLS:用 PVLA 组织规格与正常参考,并将 SAM 3 支撑的全局逻辑检查与 MCTS 预算化局部搜索结合,使大模型按可追溯证据审计图像。实验称其在 MMAD-QA 及 MPDD、DTD、DAGM 等数据集上优于匹配和通用基线,主要结果强调性能提升与诊断链可验证性。

TestMate: Test-Time Domain Adaptation Aided by Lightweight Vision Foundation Model Figure 1
2026-07-07cs.CV

TestMate: Test-Time Domain Adaptation Aided by Lightweight Vision Foundation Model

Dimitrios Fotiou, Vasileios Mygdalis, Ioannis Pitas

Aristotle University of Thessaloniki

2026-07-07视觉感知

针对语义分割在测试时域适应中需实时处理无标签流数据、且现有熵最小化易遗忘、记忆库收敛慢的问题,TestMate用轻量级视觉基础模型生成多尺度掩码,并以无需反传和参数的尺寸排序竞争融合来细化小目标与边界。文中称其可首帧生效,并在两个基准的TTDA、SFDA和online-TTDA设置下达到或提升SOTA表现。

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation Figure 1
2026-07-07cs.CV

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng

Shanghai Jiao Tong University, Nankai University

2026-07-07视觉感知生成模型

CineMobile针对手机端图生视频中DiT模型过大、去噪步数多而难以生成电影化运镜的问题,选择将任务收窄到子弹时间、滑动变焦和慢动作等结构化运动。其核心是对Wan系I2V DiT做蒸馏引导的结构化剪枝、4步扩散蒸馏结合GRPO强化学习细化,并用FFN 4-bit/其余8-bit混合量化压到1GB内。实验显示其相对Wan2.1教师模型约40倍加速,49帧480p在H200上单步0.6秒、天玑8400平台单步约20秒,VBench与人工评价保持接近教师的视觉质量和一致性。

Foundations of Equivariant Deep Learning: Unifying Graph and Sheaf Neural Networks Figure 1
2026-07-07cs.LG

Foundations of Equivariant Deep Learning: Unifying Graph and Sheaf Neural Networks

Yoshihiro Maruyama

2026-07-07视觉感知

论文针对图、单纯复形、胞腔复形等数据中仅靠群或置换等变性难以表达层级关联的问题,提出以偏序集/面偏序上的等变向量丛来统一图消息传递与sheaf神经网络的OENN框架。核心创新是刻画所有线性序等变映射,并构造保持稳定子作用的非线性层与成对轨道聚合。主要结果包括证明连续序等变映射的通用逼近定理,并指出普通匿名消息传递一般不具备普适性,sheaf网络情形下的UAT也是新增理论结果。

Probabilistic Robustness in Medical Image Classification Figure 1
2026-07-07cs.CV

Probabilistic Robustness in Medical Image Classification

Yi Zhang, Siddartha Khastgir, Xingyu Zhao

2026-07-07视觉感知安全鲁棒

面向医疗影像分类在临床安全场景中受自然扰动影响而可能误诊的问题,论文将鲁棒性评估从最坏情况对抗样本转向概率鲁棒性,构建了适配医学图像的自然腐蚀测试,并在 MedMNIST v2/PathMNIST 上评估 ResNet-18/50。结果显示两者虽有较高干净 ACC/AUC,但在亮度、散焦和运动模糊下 PR 明显下降,且更高干净性能不必然带来更强鲁棒性。

InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection Figure 1
2026-07-07cs.CV

InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection

Zichao Feng, Haodong Zhu, Jingying Yang, Sheng Xu, Yangyang Ren, Yuguang Yang, Xuhui Liu, Juan Zhang, Tian Wang, Linlin Yang, Baochang Zhang

2026-07-07视觉感知

InfraNet针对低光、恶劣天气下RGB模态易退化、传统RGB-IR融合反而把噪声注入红外特征的问题,提出以红外为主的质量感知框架:训练时用QualGate按任务相关可靠性调节RGB指导,抑制负迁移并补偿IR特征,同时支持IR-only或RGB-IR部署。其在LLVIP、FLIR-Aligned、M3FD和DroneVehicle上取得有竞争力或更优检测精度,尤其强调IR-only推理的效率与鲁棒性。

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation Figure 1
2026-07-07cs.RO

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

Australian Institute for Machine Learning, Adelaide University, Fudan University, Swiss Federal Institute of

2026-07-07机器人视觉语言视觉感知

本文指出现有VLN评测只要求到达目标3米范围,忽略朝向与目标可见性,导致“到区域”不等于能定位实例。作者提出Last-3-Meter Grounding Gap、ONS/GS/OracleGS指标,以及可插拔REALM模块和REVERIE-AIM短程数据集,用可见性感知停止细化最后接近阶段。在四类VLN骨干上,REALM显著提升实例邻近与最终视角可见性,如ETPNav-ZS的ONS@0.1m翻倍,实机实验也显示成功率提升。

G$^2$TAM: Geometry Grounded Track Anything Model Figure 1
2026-07-07cs.CV

G$^2$TAM: Geometry Grounded Track Anything Model

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu

2026-07-07视觉感知

G²TAM针对现有视频分割依赖外观记忆、在大视角变化和长遮挡下易丢失身份的问题,提出把空间对齐的几何表征作为隐式记忆,并用跨模态空间编码器将点框或文本提示融入同一几何语义空间,实现重建与实例一致掩码联合预测。论文还构建InsTrack/PIST基准,报告实例空间跟踪达74.3 S-mIoU,显著高于SAM2的47.6,并提升跨视角一致性与视频目标分割表现。

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective Figure 1
2026-07-07cs.CV

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang

2026-07-07视觉感知

针对ViT深度剪枝虽更易带来真实加速却常导致精度难恢复的问题,论文指出瓶颈不只是剪枝粒度粗,而是忽视注意力层、激活层等异构层的梯度尺度差异与恢复不对称;提出HetDPT,通过剪除FFN中的激活函数以避免维度不匹配,并用两阶段预算分配和重要性估计处理异构性。在ImageNet、CIFAR、COCO、ADE20K上,HetDPT在DeiT-B上约1.58倍加速且保持精度,结合宽度剪枝的HetDPT+将极端压缩加速从4.24倍提升到5.19倍且近乎无损。

City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion Figure 1
2026-07-07cs.CV

City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion

Liang Han, Wenyuan Zhang, Junsheng Zhou, Yu-Shen Liu, Zhizhong Han

2026-07-07三维

面向城市级多视角表面重建,论文针对3DGS在大场景中受空间分块边界、遮挡、显存与稀疏点云缺洞影响而几何不稳的问题,提出按相机朝向为主、位置为辅的视角分组,使重叠更高的视图共同优化深度,并用场景补全修复初始点云缺失区域。在GauU-Scene、MatrixCity和UrbanScene3D上,其表面重建质量优于现有大规模方法。

Self-Improving Diffusion Classifiers with Minority Preference Optimization Figure 1
2026-07-07cs.CV

Self-Improving Diffusion Classifiers with Minority Preference Optimization

Hyunsoo Kim, Jungmyung Wi, Soobin Um, Donghyun Kim, Suhyun Kim

2026-07-07生成模型优化算法

论文关注扩散分类器在零样本识别中偏向高密度多数样本、低密度少数概念识别较差的问题,提出 MiPO:仅用任意文本提示生成候选样本,以少数偏好奖励配合 LoRA 与 GRPO 微调扩散模型,扩大少数区域的生成覆盖并转化为感知能力提升。实验在 CIFAR10、CIFAR10-C、ImageNet-Tiny、Caltech、SUN09 等数据集上总体提升,最高约 3.8%,少数样本收益更明显。

GALOSH: Blind, Training-Free Denoising of Raw Bayer and sRGB Images by Parallel-Friendly Local Shrinkage Figure 1
2026-07-07eess.IV

GALOSH: Blind, Training-Free Denoising of Raw Bayer and sRGB Images by Parallel-Friendly Local Shrinkage

Yoshiro Sato

2026-07-07视觉感知

这篇论文针对 BM3D/NLM 依赖内容搜索、难并行且需噪声先验,以及深度去噪依赖训练域和 GPU 的问题,提出 GALOSH:用单图盲估计 Poisson-Gaussian 噪声、GAT 稳定方差、局部 Walsh-Hadamard 两阶段亮度收缩和亮度引导色度回归,完全去除搜索并统一处理 raw Bayer 与 sRGB。实验显示其在 SIDD、RawNIND 等真实噪声基准上优于测试的盲训练无关方法,甚至超过给定 oracle 噪声的经典基线;速度较深度基线快 7–650 倍,并可在 CPU 与 INT16 定点实现中实际运行。

Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors Figure 1
2026-07-07cs.CV

Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors

Liang Han, Bangcai Wei, Junsheng Zhou, Yu-Shen Liu, Zhizhong Han

2026-07-07三维

这篇论文针对稀疏视角下3DGS虽能高效渲染但几何线索不足、离散高斯易导致深度错误和表面破碎的问题,提出以多视图几何与光度一致性筛选高置信深度,再借助法线先验向低置信区域传播深度约束,并用异常深度边缘感知平滑抑制不连续。实验在DTU和Tanks-and-Temples上显示其稀疏视角表面重建优于现有方法。

Deep Learning-Based Characterization of Detonation-Cell Size Distributions in Soot-Foil Records Figure 1
2026-07-07eess.IV

Deep Learning-Based Characterization of Detonation-Cell Size Distributions in Soot-Foil Records

Mingyang Bu, Robson A. Schneider, Karl P. Chatelain, Mhedine Alicherif, Yingchen Shi, Andrés Z. Mendiburu, Deanna A. Lacoste, Bing Wang

School of Aerospace Engineering, Tsinghua University, Beijing 100084, China., Mechanical Engineering Department, Federal University of Rio Grande do Sul, Abdullah University of Science and Technology (KAUST), Thuwal, 23955-6900, Institute for Aero Engine, Tsinghua University, Beijing 100084, China.

2026-07-07视觉感知

针对爆轰烟熏箔细胞尺寸人工测量耗时且在噪声、边界模糊和重叠条件下易失准的问题,论文将 Mask R-CNN 实例分割与仿真/实验异构数据、迁移学习结合,用于单个细胞的像素级识别和高阶几何统计。结果显示平均尺寸与人工测量误差在规则工况低于 2%、不规则工况低于 3.5%,并可追踪传播方向上的尺寸演化及 RI、偏转角标准差等规律性指标。

GeoSAM-Lite: A Lightweight Foundation Model for Onboard Remote Sensing Segmentation Figure 1
2026-07-07cs.CV

GeoSAM-Lite: A Lightweight Foundation Model for Onboard Remote Sensing Segmentation

Yongcong Wang, Jie Zhang, Rui Jiang, Xubing Yang, Ting Yun, Li Zhang

2026-07-07视觉感知

这篇论文针对 SAM 等基础分割模型难以上星载、机载部署,以及自然图像到遥感图像存在域偏移的问题,提出 GeoSAM-Lite。其核心是先用遥感专家模型 RSAM-Seg 进行 Geo-Init 蒸馏和遮蔽特征对齐,再通过空间与频域特征融合层恢复轻量骨干丢失的边界细节。实验主要在云检测等遥感分割场景中验证,报告称相对 RSAM-Seg 参数减少 92.8%,同时保持有竞争力的精度。

Exploring SAM Supervision for Fine-Grained UAV Target Segmentation under Data Scarcity Figure 1
2026-07-07cs.CV

Exploring SAM Supervision for Fine-Grained UAV Target Segmentation under Data Scarcity

Le-Anh Tran

2026-07-07视觉感知

面向小目标、背景杂乱且像素标注稀缺的无人机目标分割,论文把 SAM3 用作离线伪标注源,而非直接部署大模型;核心做法是先用文本提示生成粗掩码,再裁剪候选区域二次分割以细化边界,并训练轻量 IPS-Seg。实验表明,两阶段伪标注能稳定提升低标注场景表现,IPS-Seg 在精度、参数量与计算量之间取得较好折中。

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation Figure 1
2026-07-07cs.CV

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

Haruumi Omoto, Tadahiro Taniguchi

2026-07-07视觉感知生成模型

论文关注涌现语言是否真正保留视觉输入信息这一评估难题,指出现有概念、字幕、结构相关或任务成功率指标都只是代理。EmCom-Diffusion通过用涌现消息微调文本到图像扩散模型,再比较生成图与原图的感知相似度来直接衡量“视觉反映”。在MS-COCO指称游戏中,该方法能区分真实消息与随机/固定基线,并揭示CBM、翻译、TopSim和R@1会漏判或误判的视觉内容。

Triple-Phase Multimodal Knowledge Aggregation Framework for Microbial Keratitis Subtype Diagnosis on Slit-Lamp Photography Figure 1
2026-07-07q-bio.QM

Triple-Phase Multimodal Knowledge Aggregation Framework for Microbial Keratitis Subtype Diagnosis on Slit-Lamp Photography

Yiqing Wang, Maria A. Woodward, Ziyun Yang, N. Venkatesh Prajna, Chunming He, Leslie M. Niziol, Mercy Pawar, Ming-Chen Lu, Guillermo Amescua, Rachel Wozniak, Sejal Amin, Abinaya Krishnan, Prabhleen Kochar, Sina Farsiu

Department of Biomedical Engineering, Duke University, Durham, NC, USA., Kellogg Eye Center, Department of Ophthalmology and Visual Sciences, University of Michigan, Department of Cornea and Refractive Surgery Services, Aravind Eye Care System, Madurai, Bascom Palmer Eye Institute, Department of Ophthalmology, University of Miami Miller School, Flaum Eye Institute, Department of Ophthalmology, University of Rochester Medical Center, Department of Ophthalmology, Henry Ford Hospital, Detroit, MI, USA., Duke Eye Center, Duke University School of Medicine, Durham, NC, USA., framework on a multicenter dataset of 1,645 patients and 17,158 images from India and the United, code will be released and dataset access will be provided subject to University of Michigan data-, are unavailable. The inability to pinpoint the causative organism often leads to non-specific and, clinical applicability, as they are typically developed using data from a single medical center, and, center data for training18,23 may lead to overly optimistic performance estimates, as it can introduce

2026-07-07视觉语言

微生物性角膜炎亟需比培养/PCR更快的病原分型工具,以指导细菌或真菌感染用药。本文提出三阶段多模态框架:先用同一患者不同裂隙灯照明图像做跨模态对比学习,再分别微调蓝光、巩膜散射、白光模型,最后融合图像嵌入与临床元数据,并用分中心评估揭示 pooled 指标偏乐观。其在1645名患者、17158张图像上达到85.84%准确率、84.46%平均F1和0.885 AUC。

Attending to Multimodal Generation One Token at a Time Figure 1
2026-07-07cs.CV

Attending to Multimodal Generation One Token at a Time

Varun Gupta, Vineet Gandhi, Makarand Tapaswi

2026-07-07视觉语言

本文关注多模态大模型生成时“何时”调用视觉、文本、指令与已生成内容这一较少被解释的问题。作者提出 OTaT,按输出 token 追踪并干预注意力流,发现视觉答案处图像注意力峰值、任务切换时回看指令、后续生成更依赖历史输出;阻断验证其因果作用,定向增强相关模态注意力可提升多模态任务表现。

ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics Figure 1
2026-07-07cs.CV

ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics

Zanwei Zhou, Jiazhong Cen, Jiemin Fang, Yumeng He, Chen Yang, Sikuang Li, Fanpeng Meng, Zhikuan Bao, Wei Shen, Qi Tian

Shanghai Jiao Tong University, Huawei Inc.

2026-07-07视觉感知规划控制

论文针对文本提示难以精确约束复杂运动和交互的问题,提出“代理视频”作为动态载体:用仿真或真实粗视频提供运动线索,文本负责外观与场景生成。ProxyUp无需训练,通过ODE反演、区域潜变量加噪和随机流松弛,在保留关键运动的同时缓解潜空间拼接带来的分布错配与前景背景耦合不足。实验显示其在仿真和真实代理上,相比视频编辑与运动迁移基线提升了动态一致性和文本对齐。

Leveraging Pathology Co-occurrence for Test-Time Adaptation in Chest X-Ray Diagnosis Figure 1
2026-07-07cs.CV

Leveraging Pathology Co-occurrence for Test-Time Adaptation in Chest X-Ray Diagnosis

Woojin Jeong, Yujin Choi, Dongbin Kim, Soyeon Park, Jaewook Lee

2026-07-07视觉感知

这篇论文针对胸片模型跨医院部署时因设备、协议和人群差异导致性能下降的问题,指出常规测试时自适应忽略多标签疾病共现关系,可能放大不可靠预测。作者提出 CoWA,从目标域预测中在线估计病灶共现矩阵,并用结构一致性为样本加权做熵最小化。实验在 MIMIC-CXR、CheXpert、VinDr-CXR、NIH 等跨域设置中显示,CoWA 相比 AdaBN、TENT、EATA、RoTTA 等基线总体更稳,尤其减少低患病率类别的严重退化。

IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance Figure 1
2026-07-07cs.CV

IPDiff: Diffusion-driven ORSI Salient Object Detection with Information Reconstruction and Multi-Prior Guidance

Gongyang Li, Zhen Bai, Runmin Cong, Dan Zeng, Weisi Lin, Xiao-Ping Zhang

2026-07-07视觉感知生成模型三维

针对光学遥感显著目标检测中一次性静态推理难以修正错误掩码的问题,IPDiff将任务改写为条件扩散生成:先用信息重构注意力提取位置、细节与语义多重先验,再在去噪网络中随时间步迭代优化显著图,并以空域/谱域混合损失训练。作者在ORSSD、EORSSD和ORSI-4199上对比46种方法取得最佳结果,但计算开销与增益中各先验贡献仍需结合消融判断。

Phase-Preserving Trimodal Transformer for Tropical Forest Biomass Estimation Using Optical and PolInSAR Data Figure 1
2026-07-07cs.LG

Phase-Preserving Trimodal Transformer for Tropical Forest Biomass Estimation Using Optical and PolInSAR Data

Luiz Felipe Parente Santiago (1 and 2), Rosiane Rodrigues de Freitas (1), Daniel Rodrigues dos Santos (3), Felipe Ferrari (3) ((1) Institute of Computing (IComp), Federal University of Amazonas (UFAM), Manaus, Brazil, (2) Brazilian Army Research Institute in the Amazon (IPEAM), (3) Military Institute of Engineering (IME), Rio de Janeiro, Brazil)

Institute of Computing (IComp), Federal University of Amazonas (UFAM), Manaus, Brazil, Brazilian Army Research Institute in the Amazon (IPEAM), Manaus, Brazil, Military Institute of Engineering (IME), Rio de Janeiro, Brazil

2026-07-07视觉感知

针对热带成熟森林中光学影像受云遮挡、SAR 在高生物量区信号饱和导致地上生物量估计不准的问题,论文提出 TCCT,将 Landsat-5 与 P/L 波段复值 PolInSAR 融合,用复值编码保留相位相干性,并以协同注意力按像素调节传感器权重。实验中经交叉验证和局部微调,CHM RMSE 达 3.78 m,密林 AGB rRMSE 为 4.51%,优于 RF、CNN 和 ViT 基线。

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models Figure 1
2026-07-07cs.CV

From Geometric Labels to Semantic Understanding of Indoor Building Components Using Multimodal Large Language Models

Shuju Jing, Chao Yin

From Geometric Labels to Semantic Understanding of Indoor Building, aSchool of Qilu Transportation, Shandong University, Jinan, 250002, China, bGuangzhou Institute of Geography, Guangdong Academy of Sciences, 100 Xianlie Middle, crete labels without explaining component functions or natural language interactions. This paper, proposes Building-MLLM, a point cloud-centered multimodal large language model (MLLM) for, whose outputs are usually limited to discrete class labels and therefore cannot provide engineers, alizing this capability would facilitate language-centered human–computer interaction, knowledge, indoor building component point clouds, and to promote a transition from geometry-based labels

2026-07-07视觉语言

面向设施运维中点云模型只能给出离散类别、难以支持工程问答的问题,论文提出 Building-MLLM,将室内建筑构件点云与指令式语言建模结合,并通过点信息增强、几何保持正则、固定领域前缀和多维 LoRA 缓解专业域语义集中与几何退化;同时构建含 4198 个对象、37782 条指令的合成数据集。实验在识别、描述和工程 QA 上分别达到 88.00%、65.10%、68.14%,显示其可从几何标签推进到语言化构件理解。

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation Figure 1
2026-07-07cs.CV

ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation

Ahmed Abul Hasanaath, Bicheng Xu, Mir Rayat Imtiaz Hossain, Leonid Sigal, Hamzah Luqman

2026-07-07视觉语言三维

这篇论文针对无 gloss 手语翻译中标注昂贵、仅用 RGB 或弱融合难以捕捉手部/身体/面部细粒度线索的问题,提出 ViPo-MLLM:用 USTM 提取时空视觉特征、OpenPose 提取姿态特征,并通过模态内时序建模与跨模态注意力融合后接入 LLM。实验在 PHOENIX14T 和 CSL-Daily 上报告达到新的 SOTA,并接近部分 gloss-based 方法,说明姿态线索和显式跨模态时序交互是主要增益来源。

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation Figure 1
2026-07-07cs.CV

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

Enshuo Hsu, Jin Zhou, Kirk Roberts

McWilliams School of Biomedical Informatics, University of Texas Health Science Center, Enterprise Development & Integration, University of Texas MD Anderson Cancer Center, laboratory reports and manually filled forms, there are few publicly available datasets for, we release a publicly available, realistic-, The dataset and documentation are available, to 2018, a single clinical department, single type of laboratory test 3. The high-, laboratory reports, 3) manually filled forms, laboratory reports 3,8. OCR engines often fail, external lab or pathology reports 2. OCR

2026-07-07视觉感知数据集/基准

临床 EHR 中大量扫描件因手写、表格、低质扫描和旋转等伪影难以被 OCR 稳定解析,而现有公开医疗 OCR 数据集多模板单一且缺少真实扫描挑战。ClinOCR-Bench 用合成但 PHI-free 的方式构建 384 张、6 类伪影、12 类文档和 16 个模板的基准,并设计模板感知 one-shot 划分;测试集 328 张可给出较窄 WER 置信区间,支持开源与专有 VLM/OCR 系统评测,但具体模型增益文中未充分说明。

Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs Figure 1
2026-07-07cs.CV

Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs

Anas Zafar, Leema Krishna Murali, Siddhant Bharadwaj, Ashish Vashist, Jia Wu

The University of Texas MD Anderson Cancer Center, Eisai Inc., Cohere Labs Community

2026-07-07视觉语言视觉感知

这篇论文针对医学视觉语言模型“高准确率但未必看图”的风险,提出用空白、打乱、无图和 CLIP 硬负样本替换图像的反事实评估,并设计 VRS、VHR 等指标量化视觉依赖。进一步用 CGO 训练 CORAL,惩罚硬负图像下答案不变。结果显示医学任务中换图仅造成很小性能下降,暴露强文本捷径;CORAL 相比 Qwen2.5-VL-7B 准确率提升 6.7pp、VHR 降低 8.0pp,但训练/评测重叠等限制仍需注意。

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing Figure 1
2026-07-07cs.CV

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

Ayush Prasad, Swarnalee Mazumder

2026-07-07视觉语言数据集/基准

Moonstone针对月球遥感数据分散、模态覆盖不均且缺少统一评测的问题,构建28通道全球预训练数据与六项下游基准,并提出按物理模态分组的MG-MAE,通过缺失模态注意力掩码、覆盖自适应遮蔽和光谱连续性约束处理月球数据的稀疏异质性。实验显示其在地质分类、成分回归、撞击坑分割等任务上均优于从零训练、ImageNet和地球观测预训练基线,最大提升达地质分类+16.2%和撞击坑mIoU+14.7。

Model Confidence-Guided Multi-Image Fusion of Fundus Images for Diabetic Retinopathy Diagnosis Figure 1
2026-07-07eess.IV

Model Confidence-Guided Multi-Image Fusion of Fundus Images for Diabetic Retinopathy Diagnosis

Ananya Raghu, Anisha Raghu, Alice S. Tang, Yannis M. Paulus, Tyson N. Kim, Tomiko T. Oskotsky

Massachusetts Institute of Technology, Cambridge, MA, USA, Wilmer Eye Institute, Department of Ophthalmology, Johns Hopkins University, Baltimore, MD, Department of Biomedical Engineering, Johns Hopkins University, Baltimore, MD, USA, Bakar Computational Health Sciences Institute, University of California San Francisco, San, Department of Ophthalmology, University of California San Francisco, San Francisco, CA, USA, Division of Clinical Informatics and Digital Transformation, University of California San

2026-07-07视觉感知

面向低资源场景中的糖尿病视网膜病变早筛,论文指出人工图像质量标签与诊断可靠性关联较弱,提出用模型置信度替代显式质控,并融合多张眼底图像形成患者级预测、低置信时提示重拍。在 mBRSET 和 BRSET 上,70% 覆盖率下平衡准确率达 91% 和 97%,较质量级联约提升 12% 和 6%;50% 覆盖率下敏感性也升至 94% 和 96%。

Probing Identity-Specific Motion Signatures: A Controlled Diagnostic Study Figure 1
2026-07-07cs.CV

Probing Identity-Specific Motion Signatures: A Controlled Diagnostic Study

Yingtie Lei, Fangxun Liu, Baicheng Wu, Colin Lee, Ziheng Zhang, Junke Yang, Zhiyuan Tao, Xuyan Huang, Shuheng Wang, William Koran, Kyle Park, Elijah H Buckwalter, Cheng-Hsuan Chiang, Tejas Naik, Daniel Yi, Wei-Lun Chao

The Ohio State University, Boston University, tion cues are available., mation available to silhouettes and skeletons, this contrast

2026-07-07规划控制

本文关注身份识别中视频模型究竟依赖外观还是个体运动模式这一诊断问题,构建 BALLER120 自由投篮基准,用同一多阶段动作和轮廓/骨架输入压制球衣、脸部等静态捷径。结果显示,RGB 模型虽准确但易看外观,外观被抑制后仍有竞争性识别率,并更能关注脚步、肘部等稳定微运动,对外观变化更鲁棒。

RADIO1D: Elastic Representations for Condensed Vision Modeling Figure 1
2026-07-07cs.CV

RADIO1D: Elastic Representations for Condensed Vision Modeling

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

2026-07-07视觉感知

论文针对 VLM 视觉编码器通常依赖固定二维 patch token、计算开销高且未必保留空间结构的问题,指出微调会使特征更抽象、空间一致性下降,而少数全局 token 已能承担图像摘要功能。RADIO1D 以多教师蒸馏和训练期自编码器将图像压缩为可变长度一维 token,并让早期 token 优先承载全局语义。实验显示其在低 token 数下仍能保持场景理解和组合检索能力,接入 Nemotron VL 后在多模态基准上以更低开销取得有竞争力甚至更好的精度,但 OCR 等细粒度任务仍需要较高 token 预算。

A Vision Based System for Guided and Collaborative Reconstruction of Fragmented Documents Figure 1
2026-07-07cs.CV

A Vision Based System for Guided and Collaborative Reconstruction of Fragmented Documents

Oliver Krumpek, Diana Leo

2026-07-07视觉感知三维

面向文化遗产中破损纸质文档的高重复、低损伤重建需求,论文构建了相机感知、投影引导与协作机器人结合的辅助系统,并设计可手持或装在机器人末端的真空吸附工具。系统支持人工按视觉提示摆放或由机器人自动定位;实验比较 SIFT、SuperPoint+SuperGlue 与 SE2-LoFTR,显示后者在旋转、尺度和损伤条件下更稳健,吸附件对 8cm² 碎片达到 0.57mm 重复定位精度。

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning Figure 1
2026-07-07cs.CV

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

Yuening Cai, Junwei Zhou, Youran Qu, Yu-Wing Tai

Department of Computer Science, Dartmouth College

2026-07-07数据集/基准三维

本文针对现有VLM空间评测多依赖问答、难以检验全局一致3D布局的问题,提出IDEAL-Bench与IDEAL-Scenes:让模型从单张室内图像预测所有可见物体的类别、位置、尺度和朝向,并结合数值指标与重渲染感知比较评估。对15个VLM的结果显示任务仍远未解决,最佳仅62.1/100,模型普遍能识别物体但几何回归薄弱,说明当前能力更偏“描述场景”而非精确测量空间。

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers Figure 1
2026-07-07cs.CV

SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers

Jianing Deng, Yuanzhe Li, Jialu Wang, Song Wang, Tianlong Chen, Huanrui Yang, Jingtong Hu

2026-07-07三维

SAF3R针对前馈式三维重建 Transformer 在长序列中跨视角全局注意力计算呈二次增长、限制实时部署的问题,指出不同层和注意力头的全局注意力高度异质、动态且稀疏。其核心是训练无关的动态稀疏注意力框架,通过离线逐头画像选择稀疏模式,并在推理时用轻量近似与索引缓存自适应更新 Top-K 等模式。实验显示其在保持相机位姿估计和点云重建质量的同时,在长序列上最高实现约 7 倍端到端加速。

A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning Figure 1
2026-07-07cs.CV

A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning

Sushant Dagaji Desale, Rahul Mishra, Ashutosh Kumar Sinha

Indian Institute of Technology Patna

2026-07-07强化学习安全鲁棒

针对CLIP等视觉语言模型在无监督域适应中易受PGD扰动、伪标签噪声会放大跨域错配的问题,论文提出SFT+RL:先在有标注源域做对抗微调并仅部分解冻投影层,再用递减置信阈值筛选目标域伪标签,形成跨模态课程式自训练。OfficeHome、PACS、VisDA上报告平均干净准确率提升10.2%、鲁棒性提升15.8%,但“RL”相对普通自训练的独立增益来源仍不够清晰。

Token-Based Affordance Grounding with Large Vision-Language Models Figure 1
2026-07-07cs.CV

Token-Based Affordance Grounding with Large Vision-Language Models

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang

2026-07-07视觉语言视觉感知

这篇论文针对弱监督可供性定位在多动作共现、相似动作区分上易混淆的问题,提出 TokAG:不训练新模型,而是从大视觉语言模型输出 token 的跨注意力中筛选最聚焦目标物体的 token,并聚合层/头得到动作相关热图。实验显示其零样本方法在 AGD20K unseen 上 NSS 提升 10.7%,在 HICO-IIF 上提升 29.7%,但失败分析表明主要瓶颈仍是 token 选择。

An Interpretable Deep Learning Framework for Discovery and Clinical Validation of Deep Radiomic Signatures in Tumor Classification Figure 1
2026-07-07eess.IV

An Interpretable Deep Learning Framework for Discovery and Clinical Validation of Deep Radiomic Signatures in Tumor Classification

Chengkun Sun, Jinqian Pan, Renjie Liang, Zhengkang Fan, Xin Miao, Yi Guo, Mei Liu, Muxuan Liang, Russell Terry, Jie Xu

* Department of Health Outcomes and Biomedical Informatics, University of, Department of Biostatistics, MD Anderson Cancer Center, Houston, 77030, Department of Urology, University of Florida, Gainesville, 32611, FL, USA, scalable clinical decision-support systems [13]. Traditionally, tumor characterization has

2026-07-07视觉感知

针对深度学习肿瘤影像分类虽准确但缺乏可解释生物标志物的问题,本文把分割、Grad-CAM 注意区域、互信息自适应阈值和放射组学/SHAP 串成统一流程,将模型关注的局部肿瘤区域转化为可量化深度放射组学签名。作者在乳腺超声、肾脏 CT、脑肿瘤及私有肾 CT 队列上验证,报告其相较全肿瘤放射组学有更好区分性能和解释性,但具体增益来源仍需更多消融支撑。

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models Figure 1
2026-07-07cs.CV

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

Ryosei Tamura, Andrew Shin

Keio University

2026-07-07视觉语言视觉感知

针对现有事故理解多依赖路侧/卫星视角、难以刻画驾驶员实际可见信息的问题,本文把行车记录仪事故视频建模为多主体责任比例估计任务,并用 LLM 辅助生成责任分布标签,比较原始帧、分割增强与文本输入下的多模态大模型微调。实验给出该任务首个基准,显示 MLLM 能完成受约束的责任分配推理,但标签并非法定真值,可靠性仍取决于自动标注质量。

Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics Figure 1
2026-07-07cs.CV

Vision Non-Causal Trapezoidal Mamba: Eliminating Directional Scanning in Vision SSMs with Second-Order Dynamics

Anvitha Ramachandran, Dhruv Parikh, Haoyang Fan, Rajgopal Kannan, Viktor Prasanna

University of Southern California

2026-07-07视觉感知

这篇论文针对视觉 SSM 将图像强行串行扫描带来的方向偏置、旋转/翻转敏感和多次扫描延迟问题,提出 VNCT:把 Mamba-3 的二阶指数-梯形动力学改写为非因果全局聚合,并用低秩 MIMO 同时建模空间与通道交互。实验显示其在 ImageNet、COCO、ADE20K 上优于扫描式 SSM 和一阶非因果 VSSD,单图延迟更低或相当,且 Boundary IoU 最高提升 3.7 点。

PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition Figure 1
2026-07-07cs.CV

PLGSA-Transformer: Periocular Landmark-Guided Attention with Occlusion-Adaptive Cosine Thresholding for Cross-Modal Masked and Unmasked Face Recognition

Dana A Abdullah

Faculty of Engineering and Computer Science, Qaiwan International University, Sulaymaniyah, KRG, Iraq., Department of Information and Communication Technology Center (ICTC)-System Information, Ministry of Higher, regions are occluded, creating a fundamental gap between laboratory performance and real-, decision boundaries, yields a robust and scalable solution for cross-modal masked and

2026-07-07视觉感知

针对口罩遮挡使传统人脸识别阈值固定、下半脸特征缺失的问题,论文提出 PLGSA-Transformer:用 MediaPipe 眼周/眉额关键点热图引导 EfficientNetB3 注意力,再接入轻量 Transformer 建模全局关系,并按预测遮挡程度自适应调整余弦阈值。在858张混合来源图像上报告97.22%验证准确率和1.0000 AUC,但数据规模较小,泛化增益来源仍需更充分说明。

When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures Figure 1
2026-07-07cs.LG

When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures

Mojtaba Faramarzi, Alex Lamb, Irina Rish

University of Montreal, Canada, Mila - Quebec AI Institute, Tsinghua University

2026-07-07视觉感知

这篇论文关注扩散与视觉模型中间表征被几何扰动后为何有时稳定、有时失配的问题。作者把水平、垂直和对角翻转作为隐藏状态干预,提出“几何一致性”原则,并用 SCS、AMS、Drift 等诊断 UNet、ViT、DiT。结果显示,在 Stable Diffusion 2.1 U-Net 等实验中,一致干预可提升特征稳定性并大体保持图像质量,不一致干预会产生可预测的架构相关漂移。

Motion Estimation Techniques for Volumetric Video Attribute Compression Figure 1
2026-07-07eess.IV

Motion Estimation Techniques for Volumetric Video Attribute Compression

Haoran Hong, Eduardo Pavez, Antonio Ortega, Ryosuke Watanabe, Keisuke Nonaka

Haoran Hong, Eduardo Pavez and Antonio Ortega are with the University of Southern California, 3740 McClintock Ave.

2026-07-07视觉感知

这篇论文针对动态实体点云中颜色等属性的时间冗余难以被G-PCC充分利用的问题,提出体素域属性帧间编码:用颜色与几何联合匹配的图正则整数运动估计保持块间运动平滑,再用无需显式插值的分数体素估计提升精度。实验在MPEG点云数据上显示,损失几何条件下相对G-PCC、GeS-TM和V-PCC平均节码约55.3%、42.3%和16.5%。

EPRA U-Net: An Efficient Pyramid Residual Attention Framework for Accurate Infarct Segmentation in Diffusion-Weighted MRI Figure 1
2026-07-07cs.CV

EPRA U-Net: An Efficient Pyramid Residual Attention Framework for Accurate Infarct Segmentation in Diffusion-Weighted MRI

Hasan Ulutas, Muhammet Emin Sahin, Mustafa Fatih Erkoc, Esra Yuce, Turker Tuncer, Sengul Dogan, Serkan Kiranyaz

Yozgat Bozok University, Department of Computer Engineering, Yozgat, Turkey, Izmir Bakircay University, Department of Computer Engineering, Izmir, Turkey, Queen Mary’s Digital Environment Research Institute (DERI), London, UK, Yozgat Bozok University, Department of Radiology, Faculty of Medicine, Yozgat, Turkey, Firat University, Department of Digital Forensics Engineering, Technology Faculty, Elazig, Turkey, Qatar University, Department of Electrical Engineering, Doha, Qatar, state-of-the-art models, specifically UNet++, DeepLabV3+, and TransUNet. The experimental results suggest that, when compared with UNet++, DeepLabV3+, and TransUNet, respectively. Additionally, a comprehensive, DeepLabv3+, Atrous Spatial Pyramid Pooling (ASPP) provided receptive field extension using dilated

2026-07-07视觉感知生成模型

针对 DWI 脑梗死灶人工勾画耗时且小病灶易漏检的问题,论文提出 EPRA U-Net,将 EfficientNet 编码器、R2 模块、ASPP 多尺度上下文和双注意力结合,并用偏重召回的 Tversky loss 训练。在 167 名患者、4895 张切片上,相比 UNet++、DeepLabV3+、TransUNet 取得更高 Dice/IoU,漏检率分别降低 16%、25%、29%,但数据为院内集,泛化性仍需外部验证。

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection Figure 1
2026-07-07cs.CV

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Jianfei Cai, Abhinav Dhall

Monash University, The University of Queensland, detection and human-centered explanation. XPlainVerse comprises one million real, support scalable research on trustworthy, interpretable models., in scale [6, 9–11] is that scaling reasoning annotation automatically introduces substantial label, User needs further compound the problem. Research in human-centered XAI shows that different

2026-07-07视觉感知数据集/基准

针对深伪检测中“能判别但解释不落地”的问题,XPlainVerse构建了百万级可解释基准:用12类生成/编辑模型产生伪造图像,并通过Edit-Check过滤编辑不匹配样本,同时提供面向专家与普通用户的双层解释和EntityScore、EvidenceScore评估。结果显示零样本模型表现较弱,微调后对未见生成器泛化仍有限,表面语义指标会掩盖视觉证据不充分的问题,改进可能主要来自scaling / data。

Latent Clarity: Bridging World-Model Kinematics to Semantic Manifolds for Video Anomaly Anticipation Figure 1
2026-07-07cs.CV

Latent Clarity: Bridging World-Model Kinematics to Semantic Manifolds for Video Anomaly Anticipation

Abu Anas Ibn Samad

2026-07-07视觉感知强化学习

针对视频异常检测常依赖MIL事后给出无语义分数的问题,论文提出PULS:用KSD Bridge将V-JEPA2运动潜变量蒸馏到Qwen语义球面,并用ASP利用“未来潜变量更清晰”的洞察做提前预测。实验称无需MIL在UCF-Crime达0.8994 AUROC、XD-Violence达0.8162,零样本VQA较观测基线提升9.6个百分点,提前0.5秒有8.9个百分点优势;但结果主要来自单篇预印本设定,独立复现仍待验证。

iVISION-2DCD: A Long-Term Change Detection Dataset for Large-Scale Outdoor Construction Monitoring Figure 1
2026-07-07cs.CV

iVISION-2DCD: A Long-Term Change Detection Dataset for Large-Scale Outdoor Construction Monitoring

Dayou Mao, Yuchen Lin, Ashkan Ebadi, John Zelek, Alexander Wong, Yuhao Chen

University of Waterloo, Waterloo, ON, Canada

2026-07-07视觉感知数据集/基准

面向大型户外工地长期进度监测,论文指出现有2D变化检测数据缺少长时序、多视角和真实施工复杂性。iVISION-2DCD利用无人机RGB/LiDAR采集的密集点云进行新视角合成,生成双时相对齐图像与半自动变化标注,覆盖一年、50余次采集和32.3K平方米场地。基准实验显示现有2DCD方法在该数据上仍面临明显挑战,主要贡献可能来自数据规模与场景复杂度。

Perceptual Flow Matching for Few-Step Generative Modeling Figure 1
2026-07-07cs.CV

Perceptual Flow Matching for Few-Step Generative Modeling

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

Joy Future Academy, Fudan University, Tsinghua University

2026-07-07生成模型

针对流匹配生成模型推理需数十步、部署成本高的问题,论文提出 PFM:不再在 VAE 潜空间回归速度,而是在解码样本的预训练感知特征空间中监督流匹配。其核心洞察是感知空间会把高噪声下的均值化回归转向更接近数据流形的模式选择,从而适合粗步长积分。实验显示在图像生成、编辑和视频生成中可将采样降至 4–8 步,COCO 8 步结果达到 FID 33.93、CLIP 31.70,并较蒸馏方法减少伪影。

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models Figure 1
2026-07-07cs.LG

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models

Ron Levi, Michael Elad

Department of Computer Science

2026-07-07生成模型三维

本文针对 BBDM 在图像复原/线性逆问题中桥接 schedule 多依赖启发式、缺少可解释设计准则的问题,提出以高斯混合先验分析反向动力学,并用固定组件标签的 surrogate 得到可解析重建律。核心洞察是 schedule 本质上塑造后验协方差,MSE 与 Wasserstein 目标对应失真和感知质量且存在内在权衡;在 MoG 仿真与 FFHQ 修复、去模糊、超分任务中,所设计的通用 schedule 与理论趋势一致并带来可用的质量取舍。

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model Figure 1
2026-07-07cs.CV

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

2026-07-07视觉感知生成模型

这篇论文针对视频生成中双向扩散质量高但慢、自回归高效但易漂移的问题,提出 Flex-Forcing,将因果与非因果生成视为可调推理维度。核心是沿时间帧与去噪步联合做 flexible chunking,并用表示对齐缓解不同噪声上下文差异,使单一模型可在双向、自回归和混合模式间切换。实验显示其在多项视频基准上相较刚性调度和 Self-Forcing 获得更好的质量—速度折中、长视频稳定性和更快推理。

Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation Figure 1
2026-07-07cs.CV

Towards Standardized Light Field Quality Assessment: Hybrid Subjective Benchmarking and Objective Metric Evaluation

Saeed Mahmoudpour, Mylene C. Q. Farias, Gi-Mun Um, Myllena A. Prado, Ismael Seidel, Leonardo de Sousa Marques, Leonardo Andrade, Shengyang Zhao, Carla L Pagliari

2026-07-07数据集/基准

面向 JPEG Pleno 等标准化场景,论文针对光场压缩/重建质量评估缺少可复现主观基准与稳健客观指标的问题,构建包含编码、视图合成和重建失真的评测流程,并用“参考锚定评分+模糊区间成对比较”的混合主观方法细化标注。结果显示,现有指标在纯编码失真上相关性较好,但遇到视图合成类失真时明显退化,提示未来光场质量指标需更重视跨视图池化与角度一致性。

Learning to Generate Multiple Objects from Dense and Occluded Layouts Figure 1
2026-07-07cs.CV

Learning to Generate Multiple Objects from Dense and Occluded Layouts

Bach-Hoang Ngo, Si-Tri Ngo, Hieu Le, Trung-Nghia Le

University of Science, Ho Chi Minh City, Vietnam

2026-07-07视觉感知

本文关注文本到图像模型在密集、遮挡布局中常把多个实例融合、导致计数错误的问题,指出根因是重叠区域注意力串扰与遮挡实例监督不足。方法用布局感知注意力维护实例归属,并以AIBL按非模态/可见面积比重加权损失。作者构建OverlapDepth-45K评测,报告相对布局基线RMSE从9.26降至5.99,同时基本保持图像质量。

PhysMirror: Physics-Aware Mirror Object Generation Figure 1
2026-07-07cs.CV

PhysMirror: Physics-Aware Mirror Object Generation

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

2026-07-07视觉感知

PhysMirror瞄准扩散模型生成镜面场景时常出现缺反射、姿态错配等几何幻觉,影响机器人感知训练数据可靠性。其核心做法是先由文本生成3D物体并构建显式镜面场景,再渲染深度、分割等条件图约束T2I生成,同时提出无需参考标注的MCS评估投影一致性。在MirrOB基准上,方法相较FLUX.1-dev、SDXL等提升反射准确性和物理真实感,并保持较好的文本语义对齐。

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling Figure 1
2026-07-07cs.CV

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

2026-07-07视觉语言视觉感知强化学习

论文针对现有世界模型偏视觉动态、VLA模型偏动作预测而缺少统一建模的问题,提出基于BAGEL的WorldBagel,将视觉、语言、动作与未来帧生成放入共享自回归框架,并用傅里叶动作tokenizer/decoder和序列计划训练对齐连续控制。LIBERO、Language Table和Franka实验显示,其多任务操作表现优于任务专用基线,动作表征更结构化,在动作分布变化下预测更稳定,但具体增益中数据重加权与模型统一各自贡献仍需进一步拆分。

Handwriting Trajectory Recovery with Diffusion Models Figure 1
2026-07-07cs.CV

Handwriting Trajectory Recovery with Diffusion Models

Hiroki Nagamatsu, Shoji Toyota, Seiichi Uchida

2026-07-07生成模型规划控制

本文针对离线手写图像难以还原真实书写顺序的问题,将笔迹恢复建模为图像条件的一维轨迹扩散生成,并用多尺度条件逐步注入从全局字形到局部笔画的证据。实验在 CASIA-OLHWDB 上相较 PEN-Net、Cross-VAE 改善 DTW/LDTW 与 AIoU,且显示训练类别增多会提升未见汉字与部分拉丁字母的笔顺恢复,增益可能主要来自更大规模数据带来的书写规律学习。

Efficient bias mitigation in T2I diffusion models using Concept Graphs Figure 1
2026-07-07cs.AI

Efficient bias mitigation in T2I diffusion models using Concept Graphs

Mansi, Avinash Kori, Francesco Leofante

Department of Computing, Imperial College London

2026-07-07生成模型

本文针对文生图扩散模型中偏见被编码为文本编码器与去噪器之间结构性概念关联的问题,指出单独修正一侧会带来语义崩塌或残余偏见。核心创新是 CO-ALIGN:抽取并对齐两部分内部概念图,使弱代表属性与目标概念关系更均衡。实验称其较现有方法公平性提升 30%,FID 改善 11.4,语义不一致输出减少 88%,并提升概念遗忘的鲁棒性。

TemporalGS: Training-Free Plug-and-Play Acceleration for 3D Gaussian Splatting Rendering via Temporal Priors Figure 1
2026-07-07cs.CV

TemporalGS: Training-Free Plug-and-Play Acceleration for 3D Gaussian Splatting Rendering via Temporal Priors

Yuhongze Zhou, Zihao Yang, Xinxin Zuo, Juwei Lu

2026-07-07三维

TemporalGS针对3D Gaussian Splatting在大规模场景中高帧率、低延迟渲染仍受预处理、排序和光栅化开销限制的问题,利用相邻帧贡献高斯高度重叠的时间先验,引入几何/外观缓冲、时序动态剔除与选择性tile渲染,无需再训练或后处理即可即插即用加速。实验显示其在多种3DGS管线中最高约1.48倍提速,并保持接近原始渲染质量;但快速相机运动下帧间相似性不足,可能导致误差累积和闪烁。

Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History Figure 1
2026-07-07cs.CV

Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History

Chih-Ting Liao, Xin Cao

University of New South Wales

2026-07-07视觉感知

这篇论文针对“给VLA加记忆”前缺少诊断的问题,审计冻结视觉语言动作模型如何编码和调用历史帧。作者用逐层线性探针与激活互换干预区分“可解码的过去”和“真正独立的过去信息”,发现历史内容虽在各层可读出,但几乎只是当前帧的冗余副本;只有在当前画面近乎完全缺失时才被因果用于动作,且中层后读出被切断。不同架构编码相似,却呈现fallback与standing两种部署/可控性模式,提示有效记忆应注入过去独有信息。

Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources Figure 1
2026-07-07cs.CV

Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources

Chih-Ting Liao, Xin Cao

University of New South Wales

2026-07-07视觉语言视觉感知

这篇论文关注 VLM 在阅读新闻截图时是否依据内容证据,还是被媒体品牌身份牵引。作者提出 CueTrust 和 Source-Override Index,系统比较七个 VLM、五类来源线索,并进一步用探针、激活替换和 SAE 将“品牌即记忆”的可信度先验定位到约第 19–21 层。结果显示,媒体名、Logo 或域名会显著覆盖文章内容,可信度变化与专业媒体评级高度相关,定向 steering 可将覆盖效应降低约 41%。

Pathways of Visual Information Flow in Vision-Language Models Figure 1
2026-07-07cs.CV

Pathways of Visual Information Flow in Vision-Language Models

Israfel Salazar, Stella Frank, Dan Oneata, Desmond Elliott, Constanza Fierro

University of Copenhagen, Technical University of Denmark

2026-07-07视觉语言视觉感知生成模型

论文关注视觉语言模型在生成答案时如何把图像信息传入语言模型这一可解释性问题。作者用因果 patching、注意力 knockout 和反事实样本区分模型“实际使用”与“可被迫使用”的信息通路,提出直接读取图像 token 与经查询文本中介两类路径。结果显示路径选择随任务、数据分布和提示变化:识别多走直接路径,空间关系多走文本中介,且直接路径受扰时模型可切换到中介路径维持性能,提示常规消融可能误判机制。

Efficient Decentralized Multi-task Dataset Valuation via Model Merging Figure 1
2026-07-07cs.CL

Efficient Decentralized Multi-task Dataset Valuation via Model Merging

Mohammadsajad Alipour, Mohammad Mohammadi Amiri

Department of Computer Science, Rensselaer Polytechnic Institute

2026-07-07数据集/基准

针对多数据卖方场景中传统 Shapley 或重训练式估值计算昂贵、依赖集中数据且多局限于单任务的问题,论文提出 DMVM:用共享初始化下各卖方微调模型的任务向量合并来近似多任务联合训练效用,并结合安全聚合避免暴露数据和模型参数。理论上给出与真实多任务边际贡献的误差界,实验在视觉和 NLP 任务上显示估值较稳定且显著降低重训练成本。

GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth Figure 1
2026-07-07cs.CV

GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth

Joaquin Gajardo, Michele Volpi, Marko Mihajlovic, Siyu Tang, Lukas Roth, Sergey Prokudin

2026-07-07视觉感知

本文面向稀疏纵向3D点云中的植物生长建模问题,动机是传统动态重建难以处理叶片等器官异步生长、拓扑变化和缺失对应关系。GrowFields将植物按器官分解并规范化到各自坐标系,用共享的连续神经形变场结合器官潜变量建模4D轨迹。实验在四类植物上显示,其在几何拟合、叶尖跟踪、时间一致性和形态保真度上优于多种现有表示。

Beyond Post-Quantization: Native Hash Learning with a Dedicated HASH Token Figure 1
2026-07-07cs.CV

Beyond Post-Quantization: Native Hash Learning with a Dedicated HASH Token

Xinze Liu, Ding Wang, Hengjie Zhu, Dayan Wu

2026-07-07视觉感知

本文针对深度哈希中先学连续特征、再末端量化成二值码导致的特征空间与汉明空间不一致问题,提出 HashViT:在 ViT 内加入专用 HASH token,并拆分为 Hash Register 与 Semantic Workspace,再用轻量 HRA 逐层细化二值寄存器。实验显示其在三个图像检索基准上达到 SOTA 或有竞争力表现,同时保持紧凑汉明码效率。

From General Actions to Domain-Specific Monitoring: Prior-Adaptive Transfer for Skeleton-Based Action Recognition Figure 1
2026-07-07cs.CV

From General Actions to Domain-Specific Monitoring: Prior-Adaptive Transfer for Skeleton-Based Action Recognition

Hao Wang, Di Yang, Jiangtao Wang

2026-07-07视觉感知

本文针对骨架动作识别模型从通用动作迁移到医疗监测等小样本领域时,易保留无关运动先验、增加干扰和计算成本的问题,提出 PATS:在 AlphaPose/InfoGCN 管线基础上,用迭代块剪枝与补偿微调将模型压缩视为任务相关先验选择。实验在阿尔茨海默检测和跌倒检测上优于既有方法,并同时降低参数量与推理延迟,但具体增益在多大程度来自剪枝准则而非微调策略仍需更多说明。

LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning Figure 1
2026-07-07cs.CV

LBTCap: A Lightweight Bilateral Transformer for Real-Time Remote Sensing Image Change Captioning

Licheng Zhang, Siew-Kei Lam, Naveed Akhtar

2026-07-07视觉语言视觉感知

面向遥感变化描述在城市规划、灾害响应等场景中的实时部署需求,LBTCap将轻量化作为主要目标,提出双边Transformer注意力:两期图像分别生成查询和键、拼接形成值,并用可学习双边权重融合注意力图,避免固定差分偏置。实验显示其在LEVIR-CC和Dubai-CC上接近或匹配SOTA精度,同时参数更少、推理更快;但效率增益很大一部分来自截断骨干和分组查询注意力。

Piecewise Dynamic Diffusion Regularization for Reconstruction of Cardiac Cine MRI Figure 1
2026-07-07eess.IV

Piecewise Dynamic Diffusion Regularization for Reconstruction of Cardiac Cine MRI

Florian Fürnrohr, Reinhard Heckel

2026-07-07生成模型三维

本文针对自由呼吸实时心脏 cine MRI 中每帧采样极少、运动强且长序列难以用扩散先验重建的问题,提出 PDDR:把学习自门控 cine 数据的时空扩散模型嵌入变分重建,并以分段方式对长视频正则化,从而兼顾解剖先验、心动时序和计算开销。回顾加速、模拟与前瞻实时实验显示,其质量优于或匹配 L+S、FMLP、T-DIP、DPS、dSTDM,并将相对 DPS 的运行时间和显存显著降低。

Defending from GeoLocalization through Adversarial Road Trips Figure 1
2026-07-07cs.CV

Defending from GeoLocalization through Adversarial Road Trips

Niccolò Niccoli, Federico Becattini, Lorenzo Seidenari

2026-07-07视觉感知

本文针对图像地理定位模型可从单张照片推断位置带来的隐私与安全风险,提出 RoadTrip Attack:不直接把图像推向目标地点,而是利用地理空间结构,用 beam search 选择一串中间“诱饵地点”逐步优化扰动。实验显示,该方法在白盒与黑盒迁移设置下均优于 PGD、FGSM、C&W 和 GeoShield,尤其在低扰动预算下能以更不显眼的噪声显著提高攻击成功率。

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout Figure 1
2026-07-07cs.CV

OmniLayout: A Schematic-Coupled Multimodal Benchmark for Constraint-Aware Geometric Reasoning in PCB Layout

Taiting Lu, Kaiyuan Lin, Mingjia Wang, Haolin Ye, Runze Liu, Yuxin Tian, Vahe Melkonyan, Haoyu Wang, Muchuan Wang, Chufan Hong, Yifan Yang, Sung-Liang Chen, Yi-Chao Chen, Yicheng Jin, Mahanth Gowda

Pennsylvania State University, Shanghai Jiao Tong University, Binghamton University

2026-07-07视觉语言优化算法数据集/基准

针对现有多模态模型在密集 PCB 元件摆放中难以同时满足几何、布线与电气约束的问题,OmniLayout 构建了首个原理图耦合的真实 PCB 布局基准,含 1681 个工业级设计,并设置几何合法性、可布线性、电气功能与工具增强推理任务。实验显示当前 LMM 仍频繁产生重叠、布线优化差且连接功能保持不稳定。

A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms Figure 1
2026-07-07cs.CV

A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms

Patrick Mu Haojie

2026-07-07生成模型

本文针对少步蒸馏扩散模型常被单一 FID/CLIP 指标概括、难以定位质量差异来源的问题,提出训练无关的可分解探针,在提示、潜变量和 score 三层注入受控扰动并计算选择性比值。实验覆盖 23 个文生图模型,发现提示层主要是 sanity check,潜变量层几乎可二分类识别 rectified-flow,且经 ADD 蒸馏仍保留;score 层则反映蒸馏目标差异,如 4 步 ADD-vs-rest 对比和轨迹 rollout 的早期强度峰。

Semantic Segmentation-Driven Image-Level Diagnosis of Liver Cancers in Hematoxylin and Eosin Histopathology Images Figure 1
2026-07-07cs.CV

Semantic Segmentation-Driven Image-Level Diagnosis of Liver Cancers in Hematoxylin and Eosin Histopathology Images

Ivica Kopriva, Dario Sitnik, Arijana Pacic, Karolina Krstanac, Irena Veliki Dalic, Marijana Popovic Hadzija

aDivision of Computing and Data Science, Ruđer Bošković Institute, Bijenička cesta 54, cDepartment of Pathology and Cytology, Dubrava University Hospital, Avenija Gojka Šuška, dClinical Division for Pathology and Cytology, Clinical Hospital Center Zagreb, Kišpatićeva, eDivision of Molecular Medicine, Ruđer Bošković Institute, Bijenička cesta 54, 10000, level label in the segmentation output. To ensure clinical relevance, we adopt the nnU-Net, architecture and train it on a publicly available dataset collected in our study with pixel-level, majority voting with at least two out of four pathologists had to agree on cancer label. Inter-, available

2026-07-07视觉感知

针对 H&E 肝癌切片受染色/扫描差异和像素标注噪声影响、三类肝癌自动鉴别研究不足的问题,论文将 nnU-Net 语义分割结果按主导像素标签聚合为图像级诊断,并结合染色归一化。其在 HCC、CCA、CMA 五折交叉验证中平衡准确率达 0.975、0.950、1.000,外部术中 CMA 样本达 0.947,显示较补丁级分类更稳健。

Learning to Suppress SPAD-based LiDAR Flare Figure 1
2026-07-07cs.CV

Learning to Suppress SPAD-based LiDAR Flare

Xuanya Zhu, Linghao Shen

Work done during an internship at Advanced Technology Center, Sony (China) Ltd.

2026-07-07视觉感知

这篇论文针对 SPAD LiDAR 在强反射或 pile-up 下产生 flare、导致点云虚假结构和测距失真的问题,将抑制任务改写为语义分割。核心洞察是常规流程只保留第一回波会丢失可区分 flare 的第二回波信息,因此提出 PILF,把第一/第二回波与环境光作为多模态输入并融合几何、光度线索。在 FLARE 真实场景数据上,PILF 优于多种分割基线,最高达到 79.32% mIoU。

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance Figure 1
2026-07-07cs.CV

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

Mengzhang Li, Yuan Yao

Shanghai Qizhi Institute, College of AI, Tsinghua University

2026-07-07视觉感知

OpenGlass针对云端多模态视觉助手在盲低视力场景中延迟高、隐私暴露大,而眼镜端算力不足的问题,提出“眼镜感知、近端设备计算”的本地优先架构,并用流式生成到语音缩短首响时间、用安全拒答和日志降低幻觉风险。实测ESP32 Wi-Fi采集下,缩放图像首音频中位延迟993ms,原始720p为1625ms,分别有97.5%和93.3%试验低于2秒。

Fast 3D Foundation Model Initialized Gaussian Splatting Figure 1
2026-07-07cs.CV

Fast 3D Foundation Model Initialized Gaussian Splatting

Anurag Dalal, Daniel Hagen, Kjell G. Robbersmyr, Kristian Muri Knausgård

2026-07-07三维

该文针对传统3DGS依赖COLMAP等SfM导致耗时高、低纹理或稀疏视角下不稳的问题,提出用VGGT-X等3D基础模型初始化相机位姿、深度和点云,并结合3R-GS式位姿—高斯联合优化、MLP位姿细化与深度引导损失。实验在Mip-NeRF 360、Tanks and Temples和RobustNeRF上达到23.61 dB PSNR、0.19 LPIPS,单场景约3分钟完成训练,但高畸变广角相机场景仍表现受限。

Seeing Through WiFi: Lightweight Human Pose Estimation with Dynamic Kernel Attention Figure 1
2026-07-07cs.CV

Seeing Through WiFi: Lightweight Human Pose Estimation with Dynamic Kernel Attention

Toan D. Gian, Van-Dinh Nguyen, Vo Phi Son, Nhan Thanh Nguyen, Dinh Thai Hoang, Diep N. Nguyen, Nguyen Cong Luong, Symeon Chatzinotas

2026-07-07三维

这篇论文针对摄像头隐私、可穿戴不便以及现有 WiFi 姿态估计硬件/模型过重的问题,提出 WiLHPE:训练时用视觉教师生成姿态监督,测试时仅用原始 CSI,并以通道-频率动态卷积和注意力提升高维 WiFi 特征利用效率。实验在 MM-Fi 与 WiPose 上分别达到 PCK50 85.96% 和 94.27%,噪声下仍约 80%,但真实开放环境泛化仍需更多验证。

BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception Figure 1
2026-07-07cs.CV

BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception

Geng Li, Yuxin Peng

2026-07-07视觉语言

这篇论文针对超高分辨率、杂乱场景中小目标细粒度感知困难的问题,指出现有视觉搜索要么无先验而低效,要么依赖静态先验且难以纠偏。BVS 将搜索建模为连续空间-尺度流形上的贝叶斯优化,用 MLLM 早停注意力 rollout 构造含推理信息的先验,再结合尺度感知非平稳核与 GP-UCB 迭代更新后验。实验显示其在精度与效率权衡上优于现有方法,并给出次线性 regret 理论保证。

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers Figure 1
2026-07-07cs.CV

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

Fudan University, East China University of Science and Technology, Fudan University Shanghai China, East China University of Science and Technology Shanghai China

2026-07-07视觉感知生成模型

针对文本到图像 MM-DiT 在普通提示下仍会放大性别、种族等刻板偏见、且既有 U-Net 去偏方法难迁移的问题,论文通过机制分析指出偏见集中在少量“语义绑定枢纽”层,并呈早中晚阶段传播;据此提出 FairFlow,在推理时仅向这些枢纽注入属性特定公平方向。FLUX.1-dev 和 SD3 实验显示其可改善人口属性多样性,同时基本保持语义一致性、图像质量与低开销。

Rethinking Brain Decoding with CLIP: The Role of Adversarial Robustness Figure 1
2026-07-07cs.CV

Rethinking Brain Decoding with CLIP: The Role of Adversarial Robustness

Byeongseo Bok, Futa Waseda, Jun Liu, Isao Echizen

The Graduate University for Advanced Studies (SOKENDAI), Kanagawa, Japan, National Institute of Informatics, Tokyo, Japan, The University of Tokyo, Tokyo, Japan

2026-07-07安全鲁棒

本文关注 fMRI 脑解码中直接对齐标准 CLIP 表征效果受限的问题,核心洞察是把“目标表征是否具备对抗鲁棒性”作为选择准则,而非改解码器或生成器。作者固定线性 fMRI 解码器,仅替换为 FARE、TeCoA 等鲁棒 CLIP,在 NSD 与 GOD 上提升图像检索、零样本分类及 Pearson、余弦、RSA 等对齐指标;归因分析显示鲁棒模型使用的视觉线索更集中且不同于标准 CLIP,但增益是否完全来自鲁棒性仍需更多消融支持。

DistillH-Mamba: A Hypergraph-Mamba-Based Knowledge Distillation Model for Efficient Impact Fall Detection Figure 1
2026-07-07cs.CV

DistillH-Mamba: A Hypergraph-Mamba-Based Knowledge Distillation Model for Efficient Impact Fall Detection

Tresor Y. Koffi, Youssef Mourchid, Mohammed Hindawi, Yohan Dupuis

2026-07-07视觉感知

本文针对跌倒事件中“触地冲击瞬间”难以准确且实时识别的问题,提出 DistillH-Mamba:用双重超图建模多关节高阶关系,并结合 Mamba 线性时序建模与关系知识蒸馏压缩学生模型。其在 UP-Fall 与 UMAFall 骨架数据上报告 97.38% 冲击检测准确率,较教师模型推理时间降低 73.8%,但真实老人自然场景验证仍未充分说明。

CuBAS: Information Geometric Curvature-Based Adaptive Sampling for Supervised Classification Figure 1
2026-07-07cs.LG

CuBAS: Information Geometric Curvature-Based Adaptive Sampling for Supervised Classification

Alexandre L. M. Levada

Federal University of São Carlos

2026-07-07视觉感知

该文针对监督分类中训练样本冗余、边界样本难以识别的问题,提出 CuBAS:把带标签数据构成 kNN 图,并用 Potts MRF 下 Fisher 信息一二阶比值估计局部曲率,以同时抽取低曲率原型点和高曲率决策边界点。实验报告在多类表格、图像、生物数据上优于随机与不确定性采样,低预算下提升明显,但数据集数量表述前后不完全一致。

Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning Figure 1
2026-07-07cs.CV

Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning

Chengzhen Yu, Canran Xiao, Siyuan Ma, Yang Liu

Nanyang Technological University (NTU), Shenzhen Campus of Sun Yat-sen University

2026-07-07视觉语言视觉感知优化算法安全鲁棒

针对自然图文监督中描述常常不完整、导致视觉语言模型对改写和遗漏细节过度自信的问题,论文提出 TPC:把多视角 caption 视为部分约束,提取共享语义核心、抑制“未说出”残差,并用视角分歧调节对比学习置信度。实验显示其在 ImageNet clean/robust、Avg-14 迁移以及 LLaVA 下 POPE、OKVQA 上均有提升,但具体增益与数据构造的关系仍需进一步核验。

A Multi-Task Deep Learning Framework for Real-Time Intelligent Video Surveillance with Temporal Event Validation Figure 1
2026-07-07cs.CV

A Multi-Task Deep Learning Framework for Real-Time Intelligent Video Surveillance with Temporal Event Validation

Estera Dumitru, Stelian Spînu

2026-07-07视觉感知

针对多路监控视频超出人工值守能力、商业系统封闭难调的问题,论文将人脸授权、车牌、武器、火烟和行为识别整合到共享 GPU 的实时多任务管线,并用多帧确认、置信度投票和级联过滤把帧级检测转为事件。其亮点在于补充武器检测器和自建破坏行为数据集;结果显示武器 mAP@0.5 达 0.947,行为识别 94.33%,火烟误报率由 52% 降至 4%,车牌视频精确匹配由 66.7% 升至 81.8%,单帧延迟低于 100 ms。

Vidu S1: A Real-Time Interactive Video Generation Model Figure 1
2026-07-07cs.CV

Vidu S1: A Real-Time Interactive Video Generation Model

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

Tsinghua University, Shengshu Technology, requirements. A playable online demo is available at https://vidu.com/vidu-stream.

2026-07-07视觉感知

论文瞄准离线视频生成无法实时响应用户、长时自回归易漂移且部署成本高的问题,提出 Vidu S1:将语音作为显式未来控制信号,并结合流式生成、数据过滤流程与 TurboDiffusion/TurboServe 推理服务栈,实现可持续交互的数字角色视频。实验称其在 540p 下可达 42 FPS,并在 Vidu-StreamBench 与 HDTF 上取得最佳 CSIM、Sync-D、DOVER;但具体增益在模型、数据和系统优化间的拆分文中未充分说明。

ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion Figure 1
2026-07-07cs.CV

ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion

Yao Liu, Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Yabin Peng, Huipeng Lin, Lei Zhang, Jufeng Yang

2026-07-07数据集/基准

这篇论文针对动态场景多曝光融合中缺少可靠基准、运动易产生鬼影的问题,构建了含1738组曝光序列和专家筛选GT的ExpoMotion数据集;方法上提出HOP,将曝光预对齐与鬼影过滤解耦,用全局照明先验校正亮度差异,并以Householder正交注意力把错位伪影视作可投影剔除的扰动。实验显示该基准提升泛化评测能力,HOP在定量指标和感知质量上优于现有方法。

Observable- and Positional-Encoding-Dependent Symmetry Readout from Neural Network Weights Figure 1
2026-07-07cs.LG

Observable- and Positional-Encoding-Dependent Symmetry Readout from Neural Network Weights

Naoya Chiba, Satoshi Sugiyama, Yuki Uranishi

D3 Center, The Unversity of Osaka

2026-07-07视觉感知

本文追问非等变神经场的几何对称性能否从训练权重中事后读出,核心洞察是可见的不是目标函数真实对称群,而是由位置编码、权重与Gram等读出观测共同限制的“可观测对称集”。作者给出精确可观测层级,并在2D SDF MLP实验中验证:DyadicAxisPE更易读出D4、抑制D3,TriAxisPE改变D3/D6响应,随机傅里叶特征主要呈现π旋转响应。

SNR-Adaptive Unified Diffusion for Multi-Task Medical Image Segmentation Figure 1
2026-07-07cs.CV

SNR-Adaptive Unified Diffusion for Multi-Task Medical Image Segmentation

Jiahao Liu, Hang Wei, Shuai Wu

School of Telecommunications Engineering, Xidian University, School of Computer Science and Technology, Xidian University

2026-07-07视觉感知生成模型

本文针对心脏医学图像分割中不同数据集、模态和标注语义导致的“一任务一模型”成本高与联合训练负迁移问题,提出 UniT-Diff:用 11 通道任务隔离标签空间消除语义冲突,并通过随扩散步 SNR 调节任务 token、按任务类型丢弃条件来平衡 UDA 与 DG 的需求。在 LA、MMWHS、MNMS 三项任务上,单一参数模型分别较独立 DiffVNet 提升 0.87%、1.77%、0.88%,但动态通道路由等限制仍待解决。

Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification Figure 1
2026-07-07cs.LG

Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification

Nicolas Sournac, Ahmed Baha Ben Jmaa, Bertrand Braeckeveldt

Multitel Research & Innovation Center, Artificial Intelligence Department, Belgium, TRAIL – Trusted AI Labs, Belgium, ial training methods. Our source code is publicly available at https://

2026-07-07安全鲁棒

这篇论文关注安全场景中“抗攻击但不知何时拒答”的风险,指出常规对抗训练虽提升鲁棒精度,却可能破坏不确定性排序,导致选择性分类失效。作者提出 EV-AT,用 Dirichlet 证据分布建模预测,并在对抗样本间对齐 log-Dirichlet 参数。实验在干净、AutoAttack 与常见腐蚀设置下显示,其将鲁棒性—不确定性 Pareto 前沿推向优于多种对抗训练基线的位置。

Attention-Guided Efficientnet Architecture For Precise Criminal Identification in Surveillance Images Figure 1
2026-07-07cs.CV

Attention-Guided Efficientnet Architecture For Precise Criminal Identification in Surveillance Images

Savitha N J, Lata B T

Research Scholar, Department of Computer Science and Engineering, University Visvesvaraya, College of Engineering (UVCE), Bangalore University, CMR Institute of Technology, Bengaluru, Department of Computer Science and Engineering, University Visvesvaraya College of, Engineering (UVCE), Bangalore University, Bengaluru, India, experimentally evaluated using the Labeled Faces in the Wild (LFW) and SCFace datasets., The proposed framework is experimentally evaluated using the Labeled Faces in the Wild (LFW)

2026-07-07视觉感知

面向监控图像低分辨率、模糊、遮挡和光照变化导致的人脸识别不稳问题,论文将 EfficientNet-B0 与 CBAM 注意力、多尺度特征融合及 Softmax-Triplet 损失结合,用于强化局部纹理与身份语义表征。在 LFW 和 SCFace 上报告 98.2% 准确率、0.99 ROC-AUC,优于多种 CNN 基线;但摘要外对数据划分与泛化验证细节有限,增益来源仍需谨慎判断。

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection Figure 1
2026-07-07cs.CV

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

2026-07-07视觉感知安全鲁棒

面向全场景生成视频在暴力、谣言等社会风险语境下更难靠低层伪迹判别的问题,SafeGuard将分层感知取证工具与自反思语义验证器组成多智能体闭环,用显式证据链同时检查物理可行性、结构一致性与社会逻辑。论文还构建20K规模SafeVid基准;实验称在SafeVid准确率提升18.7%,并在四个公开视频检测基准上优于既有方法。

PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation Figure 1
2026-07-07cs.CV

PixCon: Clean-Positive Contrastive Learning for Foundation-Model Semi-Supervised Segmentation

Ebenezer Tarubinga

2026-07-07视觉感知

论文指出在 DINOv2 等基础模型用于半监督语义分割后,伪标签阈值已能得到较干净样本,瓶颈转向像素嵌入空间的类别结构。PixCon 只把有标注且被学生模型判对的像素写入类别记忆库,构造零污染正样本对,并用梯度分析解释错误正样本的影响。实验在 Pascal VOC、Cityscapes、ADE20K 上与 UniMatch V2 持平或略优,Pascal 1/8 三种子均提升,约 +0.2 mIoU,且无推理开销;但作者也承认主要增益可能来自正确性筛选带来的正样本监督,而非污染移除本身。

Lightweight Polyp Segmentation via a Gain-Aware Prediction-Space Recursive Controller Figure 1
2026-07-07cs.CV

Lightweight Polyp Segmentation via a Gain-Aware Prediction-Space Recursive Controller

Jiachi Zhang, Zhuoyu Wu, Quanjun Wang, Wenhui Ou, Wenqi Fang

Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China, CyPhi( Ψ ​ Φ \Psi\Phi ) AI Research Lab, School of IT, Monash University Malaysia, South China University of Technology, Guangzhou, China, Department of Electronic & Computer Engineering, The Hong Kong University of Science and Technology

2026-07-07视觉感知规划控制

针对轻量息肉分割常靠更强编码器、复杂解码器或重型细化分支提升而难以归因的问题,论文把细化转为预测空间递归控制:在固定迭代预算内基于logits差异与不确定性更新增益感知状态,并施加残差校正。七种轻量骨干、Kvasir训练及三组迁移测试显示源域Dice/IoU普遍提升,跨域收益有选择性,参数和GMACs几乎不增。

RIGS-Refiner: Risk-Guided Recursive Refinement in Prediction Space for Colonoscopy Polyp Segmentation Figure 1
2026-07-07cs.CV

RIGS-Refiner: Risk-Guided Recursive Refinement in Prediction Space for Colonoscopy Polyp Segmentation

Jiachi Zhang, Zhuoyu Wu, Wenqi Fang

Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China, South China University of Technology, Guangzhou, China, CyPhi( Ψ ​ Φ \Psi\Phi ) AI Research Lab, School of IT, Monash University Malaysia

2026-07-07视觉感知安全鲁棒

本文针对结肠镜息肉分割中“整体预测已可用、错误集中在边界和局部难例”的场景,提出 RIGS-Refiner:在冻结主模型输出的预测空间内,用图像先验、预测可靠性线索和风险引导的递归残差写回做轻量后处理,而非重新解码整幅掩码。实验在 PraNet 与 SegFormer-B0、Kvasir/ClinicDB/ColonDB/ETIS 上均带来一致改进,仅增加 519 个参数和 0.631 GFLOPs,显示其优势主要在低开销局部修正与部署友好性。

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models Figure 1
2026-07-07cs.LG

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, University of Limerick

2026-07-07视觉感知

OmniFocus针对全模态大模型处理长音视频时 token 数量过大、推理成本高的问题,指出单一音频或视频引导压缩会造成模态偏置并忽略查询相关证据的时间局部性。其核心是在无需训练的情况下分别估计音频与视频块对查询的重要性,再结合跨模态关联和模态内峰值保留关键信息。基于 Qwen2.5-Omni 的四个音视频基准实验显示,在 25% token 保留率下仍保持较好性能,DailyOmni 上达到 59.40 准确率并带来约 1.38× prefill 加速。

Text-to-Image Generation for Projector-Camera System Registration Figure 1
2026-07-07cs.CV

Text-to-Image Generation for Projector-Camera System Registration

Xinyu Chen, Yuqi Li, Jiabao Li, Pinyan Tang, Chong Wang, Aditi Majumder

Ningbo University, University of California, Irvine, Ningbo University Ningbo China, University of California, Irvine United States

2026-07-07视觉感知

该文针对投影-相机注册中结构光需多帧且破坏观看体验、普通自然图像特征分布不足的问题,提出由文本生成单张语义自然但局部特征丰富的投影图,并训练网络从投影/相机图像对预测像素对应关系。方法用合成数据模拟几何与光照扰动,实验显示在多种配置下提升注册精度,并在用户研究中改善自然性与可用性。

CURE: Controllable Unified Image Restoration for Complex Degradations Figure 1
2026-07-07cs.CV

CURE: Controllable Unified Image Restoration for Complex Degradations

Boseong Kim, Donghyeon Cho

Department of Computer Science, Hanyang University, Seoul, South Korea, Corresponding author.Department of Computer Science, Hanyang University, Seoul, South Korea

2026-07-07视觉感知规划控制

针对真实视觉系统中雨、雪、雾、低照等复合退化相互耦合、难以按需去除的问题,CURE不改网络结构,而通过身份嵌入、比例控制、中间监督和置换不变损失训练可解耦表征,使用户能选择性或连续调节各类退化的恢复强度。实验称其在复合退化基准上达到SOTA,并提升顺序无关性与可控性。

Natural Language Camera Movement Understanding Figure 1
2026-07-07cs.CV

Natural Language Camera Movement Understanding

Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong

2026-07-07视觉感知

为解决视频生成中镜头运动提示的训练数据筛选与结果评测需求,论文将自然语言镜头运动理解单独定义为任务,提出覆盖17类运动的两级电影学 taxonomy,并构建含真实与合成视频的原子化基准及多源增强训练集。实验揭示现有VLM常混淆平移/旋转、方向、变焦/推拉和物体/相机运动;微调Qwen3-VL-8B在真实、合成基准上分别较Gemini 3.1 Pro相对提升10%和11%,但仍明显落后人类。

OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras Figure 1
2026-07-07cs.CV

OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras

Chaesong Park, Jihyeon Hwang, Muyeol Sung, Jongwoo Lim

2026-07-07视觉感知

OmniDS针对多鱼眼相机做360°深度时,宽基线遮挡和自遮挡会让固定ERP投影下的跨视角特征互相冲突,尤其影响薄结构和边界。其核心是用CNN几何细节与冻结DINOv3语义先验组成双流表示,并通过学习视角权重、可变形跨注意力和多视角共识体替代刚性聚合。实验称在OmniThings、OmniHouse、Sunny等基准达到SOTA,蒸馏到MobileNet后仍保持接近精度并约10 FPS,但评测主要限于合成数据和固定四相机配置。

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning Figure 1
2026-07-07cs.CV

$C^3$ASD: Multi-Level Consistency-Driven Representation Learning

Jin Hong, Jisoo Park, Junseok Kwon

2026-07-07视觉感知

这篇论文针对主动说话人检测在噪声、遮挡及音视频同时退化时易失效的问题,指出现有融合模型缺少显式一致性约束,容易学习模态特定捷径。C³ASD通过说话帧音视频嵌入对齐、模态内说话/非说话聚类分离,以及多/单模态预测蒸馏来正则化表示。实验称其在AVA-ActiveSpeaker和WASD的多类退化设置下提升鲁棒性,且无需额外标注或腐化训练数据。

MambaLIE: Scene Light Intensity-Boosted Low-Light Image Enhancement with State Space Model Figure 1
2026-07-07cs.CV

MambaLIE: Scene Light Intensity-Boosted Low-Light Image Enhancement with State Space Model

Wanshu Fan, Xiangyu Li, Cong Wang, Kin-man Lam, Xin Yang, Haiyan Zhang, Dongsheng Zhou

2026-07-07视觉感知

低照度图像会削弱移动拍摄、监控及下游视觉任务,而CNN难建模全局光照、Transformer成本较高。MambaLIE用场景光强先验与输入门控引导增强,并在LESSM中结合双向状态空间分支和局部增强分支,以线性复杂度兼顾全局照明与细节恢复。实验称其在4个合成和5个真实基准上较CNN/Transformer方法在精度、速度和模型规模上更优,适合资源受限部署。

HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion Figure 1
2026-07-07cs.CV

HyperVAttention: Efficient Sparse Attention with Spatio-Temporal Clustering for Video Diffusion

Dongyeun Lee, Amir Zandieh, Vahab Mirrokni, Junmo Kim, Insu Han

2026-07-07视觉感知生成模型

视频扩散 Transformer 的长视频生成受全局时空自注意力二次复杂度限制,已有聚类稀疏注意力又被聚类开销和 GPU CTA 利用率不足拖慢。HyperVAttention 通过 3D 局部窗口聚类、跨去噪步的混合更新,以及面向硬件 tile 的簇合并,减少冗余计算并填充空闲执行容量。在文本到视频实验中,它相对既有免训练稀疏注意力取得更优速度—质量折中,端到端延迟最高降低约 2.13 倍且保真度更好。

PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark Figure 1
2026-07-07cs.CV

PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark

Tianyi Yang, Dawei Fu, Youpeng Wu, Zixun Kou, Linrui Chen, Ruobing Jiang, Zijian Wang, Qiang Li

School of Physics, Peking University

2026-07-07数据集/基准

这篇论文针对科学海报生成中难以审计模型是否遵守版式、可读性和不伪造科学图表的问题,提出 PosterHarness:用“先占位、后确定性替换”的合同把视觉设计与真实图表来源分离,并记录失败类型。在 12 篇论文试验中,占位约束将 VLM 计数的合成科学图从 34 降到 0;相比 Paper2Poster,它画面分辨率、更少留白和视觉偏好更好,但信息保留略低且速度更慢。

REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling Figure 1
2026-07-07cs.CV

REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling

Huazhong Zhang, Xiaowen Fu, Yang Zhang, Linlin Shen, Jinbao Wang

Shenzhen University, Shenzhen, China, Corresponding author.Shenzhen University, Shenzhen, China

2026-07-07视觉感知强化学习

针对开放世界目标检测依赖样本回放带来的隐私、存储和持续学习负担,REAL-OW尝试完全无回放训练:用LoRA式通用/专用适配器分离跨任务表征与任务知识,并以双阶段objectness建模和CG-NLL缓解特征漂移、维持已知/未知边界。实验称其在检测精度和未知发现上超过多种回放方法,但具体增益在多大程度来自适配器结构仍需更多消融支撑。

CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training Figure 1
2026-07-07cs.CV

CONFLUX: A Latent Diusion Model for 3D Chest-CT Synthesis with RL Post-Training

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

2026-07-07强化学习三维

为解决3D胸部CT生成中“逼真但不一定符合指定病灶”的问题,CONFLUX用3D VAE压缩体数据、潜空间rectified-flow Transformer按18类异常及人口学/扫描元数据条件生成,并以GRPO按分类器反馈后训练强化属性一致性。实验在CT-RATE上优于MAISI和GenerateCT,三平面FID为32.3,独立判别器显示RL消除了相对真实扫描可靠性差距的47%,但奖励依赖NLP标签与分类器,临床真实性仍需谨慎解读。

VISTA: Auditing Semantic Divergence in Vision-Language Models Figure 1
2026-07-07cs.CV

VISTA: Auditing Semantic Divergence in Vision-Language Models

Junchi Liao, Jiawen Deng, Fuji Ren

University of Electronic Science and Technology of China

2026-07-07视觉语言视觉感知

这篇论文关注视觉语言模型在遇到人口特征、品牌标识或意识形态符号等视觉概念时,可能产生同一模型内高度一致、却与同伴模型明显不同的语义偏向。作者提出黑盒审计框架 VISTA,用多图多提示查询、双向蕴含聚类、语义熵与分布差异联合打分来定位模型特异异常。实验中,小规模偏置微调能被检出;对6个VLM、19类主题审计发现142个高疑似案例,并揭示视觉模态中特有的选择性拒答现象。

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video Figure 1
2026-07-07cs.CV

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W.H. Lau

2026-07-07视觉感知

本文关注多模态大模型能否从离线视频理解走向实时“程序教练”,在用户执行任务时监控、发现错误并纠正。GuideMe 构建了首个多领域流式闭环指导基准,覆盖烹饪、物体操作、日常指导和健身,并用时间语义匹配、干预行为分类与 LLM 评审评估模型。实验显示现有模型会给步骤说明,但在错误检测和纠偏反馈上明显失效,尚不能可靠完成 instruct-observe-correct 循环。

Cross-device Collaborative Test-time Adaptation with Zeroth-order Optimization and Model Merging Figure 1
2026-07-07cs.CV

Cross-device Collaborative Test-time Adaptation with Zeroth-order Optimization and Model Merging

Yu Mitsuzumi, Akisato Kimura, Yasuhiro Fujiwara, Hisashi Kashima

{}^{\text{1}} NTT, Inc., {}^{\text{2}} Kyoto University

2026-07-07优化算法

针对边缘设备在测试时自适应中难以承受反向传播内存开销的问题,论文在跨设备协作框架下把零阶优化与模型合并结合起来,只优化少量合并系数而非全模型参数,并通过权重裁剪与低秩近似减少无效和冗余信息。实验在多种图像腐蚀与风格迁移基准上显示,该方法显著降低内存占用,同时提升普通和量化模型的适应精度。

RePos: Relative-to-Absolute Output Factorization for Cross-Environment WiFi-Based 3D Human Pose Estimation Figure 1
2026-07-07cs.CV

RePos: Relative-to-Absolute Output Factorization for Cross-Environment WiFi-Based 3D Human Pose Estimation

Zhangcheng Hou, Tomoaki Ohtsuki

2026-07-07三维

该文针对 WiFi CSI 三维人体姿态在跨房间部署时易把身体结构与环境位置线索纠缠、导致泛化差的问题,提出 RePos 将输出分解为根相对姿态与根位置两支:前者用身体部位潜变量和骨架图注意力建模,后者用仅基于幅度的 ASPN 做粗定位。结果显示 RePos-D 在单环境 Person-in-WiFi-3D 达 86.9mm MPJPE,而跨环境 MM-Fi 上 RePos 将 MPJPE 降至 254.4–296.1mm,较 WiFi 基线降低约 10–21%。

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation Figure 1
2026-07-07cs.CV

Awakening Diffusion Transformers: Eliciting Stronger Generation and Understanding via Massive Activation Modulation

Chaofan Gan, Zicheng Zhao, Yuanpeng Tu, Xi Chen, Ziran Qin, Tieyuan Chen, Supavadee Aramvith, Mehrtash Harandi, Weiyao Lin

2026-07-07生成模型

论文针对扩散 Transformer 中“大激活”机制尚不清楚的问题,发现其跨空间 token 分布但集中于少数固定通道,并主要受去噪时间步和 AdaLN 调制影响。作者据此提出免训练 EMA:生成时通过抑制 MA 构造缺细节反事实分支来增强纹理,理解时用 MREP 降低方向支配并保留空间线索。实验显示其在图像/视频生成、局部细化和密集理解任务上均有提升。

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning Figure 1
2026-07-07cs.CV

Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning

Wenzheng Zeng, Siyi Jiao, Chen Gao, Hwee Tou Ng, Mike Zheng Shou

National University of Singapore, Singapore

2026-07-07视觉语言视觉感知

这篇论文针对密集视频字幕中 Video-LLM 逐 token 自回归解码在长视频、多事件场景下延迟高的问题,提出 PadCaptioner:先用潜在全局事件 token 学习事件级结构和跨事件因果,再将不同事件的字幕子链并行解码、事件内仍保持顺序生成。实验显示其在全模态事件定位与字幕质量上超过既有方法,并报告约 3.8 倍实际解码加速。

Overloading Large Vision-Language Models for Jailbreaking Figure 1
2026-07-07cs.CV

Overloading Large Vision-Language Models for Jailbreaking

Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

National University of Singapore, Hangzhou International Innovation Institute, Beihang University

2026-07-07视觉语言视觉感知强化学习

针对现有视觉语言模型越狱多依赖短文本或 OOD 图像、跨架构迁移性减弱的问题,论文提出“信息过载”视角:用长文本规则、图像排版文字和递归布局提升跨模态处理负担,从而削弱拒答机制。实验覆盖开源与 Gemini、GPT-4.1 等商业 LVLM,报告平均 ASR 分别达 88.6% 和 84.0%,且在黑盒迁移中仍保持较高成功率,提示复杂多模态输入是实际部署中的安全风险。

Incentivizing Vision Language Models to Search for Long Video Question Answering Figure 1
2026-07-07cs.CV

Incentivizing Vision Language Models to Search for Long Video Question Answering

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

The University of Texas at Austin, Austin, TX, USA

2026-07-07视觉感知

长视频问答中,均匀抽帧容易错过与问题相关的稀疏片段,且仅用最终答案监督难以训练模型主动找证据。论文提出 VSeek,将视觉语言模型改造成多轮自然语言视频搜索代理,并用 VETL 把问题编译为含视觉原语与时序关系的“可验证清单”,作为强化学习的密集奖励。实验显示,相比基座模型,Pass@1 最高提升 8%,Pass@4 提升 15%。

ReLo-IRR: Reflection-Guided LoRA Framework for Image Reflection Removal Figure 1
2026-07-07cs.CV

ReLo-IRR: Reflection-Guided LoRA Framework for Image Reflection Removal

Chaoqun Wang, Yuehuan Wei, Haoxiang Cao, Shaobo Min

2026-07-07视觉感知

这篇工作针对单图去反射中扩散模型“同一强度处理所有图像”的问题:强反射易残留、弱反射易损细节。ReLo-IRR的核心是用轻量反射强度估计器生成图像级先验,并与时间步嵌入联合调制LoRA,使修复强度随反射程度和去噪阶段变化。实验声称在多个挑战基准上优于现有方法并具备更好泛化,但具体增益中模型规模与数据因素仍需进一步拆分验证。

MORE: A Multilingual Document Parsing Benchmark and Evaluation Figure 1
2026-07-07cs.CV

MORE: A Multilingual Document Parsing Benchmark and Evaluation

Long Xu, Binghong Wu, Tinghao Yu, Hao Feng, Zhenyu Huang, Haoqing Jiang, Yunhao Wang, Shuo Huang, Feng Zhang

2026-07-07数据集/基准

这篇论文针对多语种文档解析评测长期偏向英中、难以验证长尾语言能力的问题,提出 MORE 基准:从真实 PDF 构建覆盖 149 种语言、含文本/公式/表格/代码/目录/阅读顺序等结构标注的数据集,并用模型辅助加人工精修保证标注。实验评测多种先进 VLM/OCR 模型,给出长尾语言基线并显示不同语言上赢家分散,说明现有模型的“多语支持”仍需细粒度实证检验。

Pooling-Based Context Modeling for Convolution-Free Deep Image Prior Figure 1
2026-07-07cs.CV

Pooling-Based Context Modeling for Convolution-Free Deep Image Prior

Gihyun Kim, Jong-Seok Lee

2026-07-07视觉感知

针对传统 Deep Image Prior 依赖过参数卷积结构、优化中易拟合噪声的问题,本文提出无卷积的 Pool-DIP,用多尺度局部对比池化在少参数下建模邻域上下文。实验显示其在合成与真实去噪数据上达到有竞争力表现,参数量较近期 DIP 架构减少约 32%,并通过频谱分析说明其可抑制错误高频增长,且可迁移到超分辨率和修复任务。

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding Figure 1
2026-07-07cs.CV

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

Computer Network Information Center, Chinese Academy of Sciences, University of Chinese Academy of Sciences, University of Manchester, Institute of Metal Research, China University of Geosciences

2026-07-07数据集/基准

论文针对现有科学 VLM 基准难以检验材料相图这类高语义密度、需热力学机制推理的复杂图像理解问题,提出 MatPhaseBench:从 3681 篇材料论文中筛选 200 个经人工校验的相图-文本样本,覆盖 189 个材料体系,并通过直接与关联匹配保留更完整语境。对 13 个 VLM 的评测显示,最佳模型 BERTScore Recall 仅 0.407,模型多停留在表层识别,缺乏相边界、相变路径和机理层面的专家推理能力。

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection Figure 1
2026-07-07cs.CV

CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection

Wen Dong, Zhao Wang, Shuangqing Zhang, Kai Sun, Ben Li, Guo-Sen Xie, Caifeng Shan, Fang Zhao

2026-07-07视觉语言视觉感知

面向工业与医疗等异常检测任务持续涌现、全量重训成本高且旧数据受限的问题,CL-Anomaly 将 MLLM 的持续学习引入异常检测,用任务私有 PrivLoRA 隔离异质异常知识,同时以层自适应共享专家和动量式知识迁移保留各层关键专家,缓解共享冲突与纯隔离无迁移的矛盾;在类别增量、跨域、跨模态三类场景中均优于现有方法并减轻遗忘。

Modeling the Impact of Visual Brand Language on Attention, Object Recognition, and Memory Retrieval Figure 1
2026-07-07q-bio.NC

Modeling the Impact of Visual Brand Language on Attention, Object Recognition, and Memory Retrieval

Rachel F. Heaton, John E. Hummel

University of Illinois Urbana-Champaign, information explicitly available independent of the other properties of the object [11

2026-07-07视觉感知

本文关注视觉品牌语言是否会占用认知资源、干扰人对物体功能的识别与使用理解。作者将品牌线索显式加入基于 JIM 物体识别与 LISA 类比推理的认知模型,模拟注意分配、功能类别识别和记忆检索过程。结果显示,品牌信息会优先捕获注意并延缓功能识别,且品牌越强影响越大,即使熟悉物体也可能持续造成分心。

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning Figure 1
2026-07-07cs.CV

VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning

Zhenkun Gao, Yicheng Bao, Jinlong Peng, Xueheng Li, Theo Huang, Bangwei Liu, Kunquan Li, Zhenye Gan, Tao Hu, Chengjun Xie, Mingqian Yang, Xuanhua He, Zhizhong Zhang, Xin Tan, Chengjie Wang, Yuan Xie

2026-07-07视觉感知强化学习

该文针对视频问答从封闭视频理解走向开放网页取证时,现有方法难以同时保留时序线索、局部视觉细节与外部检索证据的问题,提出 VideoSearcher:用选帧、定位、放大、网页/图像搜索等工具组成闭环推理轨迹,并以 BiSPO 将答案正确性与工具调用策略分支优化。作者还构建 VideoSearch-QA,实验显示其在 VideoDR、VSQA 及多模态搜索/视频理解基准上优于开源智能体基线。

STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation Figure 1
2026-07-07cs.CV

STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation

Syed Ariff Syed Hesham, Yun Liu, Guolei Sun, Jing Yang, Henghui Ding, Xue Geng, Xudong Jiang

2026-07-07视觉感知

STAC针对长视频推理分割中密集时空token导致注意力成本过高、压缩又常在缺乏上下文的编码特征上过早决策的问题,利用SSM线性递归先形成可感知冗余的时空表征,再以解耦的双向空间扫描和因果时间扫描结合层级自适应压缩,并让分割目标反向约束保留策略。文中报告在零样本、可流式设置下减少约85% token、带来1.8倍加速,同时超过无压缩基线。

R3D: Quantitative 3D Spatial Reasoning for Egocentric Wearables Figure 1
2026-07-07cs.CV

R3D: Quantitative 3D Spatial Reasoning for Egocentric Wearables

Maxwell Horton, Wei Lu, Quan Tran, Yury Astashonok, Kirmani Ahmed, Babak Damavandi, Anuj Kumar, Xiao Zhang, Seungwhan Moon

Meta Reality Labs

2026-07-07三维

面向具备 RGB-D 与位姿的可穿戴助手,论文指出现有基准缺少自然第一视角视频中的定量三维问答。作者构建含 57 段 ADT 视频、3033 个距离/体积/比较问题的 R3D-Bench,并提出无需训练的 R3D:用 SAM3/SAM3D 分割并提升到三维场景,再让 LLM 调用空间工具推理。R3D+Qwen3-VL 235B 达到 73.5% 平均相对准确率,高于 CuTR+Tools 的 61.9% 和 Gemini 3 Flash 的 46.5%。

Harmonic-Aware Transformer for Real-Time Catheter Localization in Interventional Procedures of Magnetic Particle Imaging Figure 1
2026-07-07cs.AI

Harmonic-Aware Transformer for Real-Time Catheter Localization in Interventional Procedures of Magnetic Particle Imaging

Abuobaida M. Khair, Wenjing Jiang, Xiaoli Yang, Moritz Wildgruber, Xiaopeng Ma

School of Control Science and Engineering, Shandong University, Jinan 250061, China, Department of Medical Physics, Al-Neelain University, Khartoum, Sudan, Weifang Xinli Superconducting Magnet Technology Co., Ltd, Weifang 261005, China, Department of Radiology, University Hospital, LMU Munich, Munich 81337, Germany, potential of harmonic-aware transformer models as efficient and scalable solutions for, MPI and force control, while Griese et al (2017) localized fiducial markers using center-of-mass, estimation.Herz et al (2018) enabled real-time visualization of labeled guidewires and balloons, and

2026-07-07视觉感知

面向介入式磁粒子成像中导管尖端需低延迟、无辐射定位的问题,论文将任务从图像重建改为由原始MPI电压信号直接回归3D坐标,并通过提取第2–8次驱动场谐波提升信噪比,再用Transformer建模三轴频域时空相关。模拟训练、真实体外数据测试显示其在多种运动下达到亚毫米误差,MAE约0.165–0.655 mm,推理延迟0.55 ms/帧,支持实时跟踪。

See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition Figure 1
2026-07-07cs.CV

See the Emotion: A Facial Emoji Proxy Modeling for EEG Emotion Recognition

Jingjing Hu, Guo Dan, Haofan Cheng, Ying Zeng, Zhan Si, Jinxing Zhou, Meng Wang

2026-07-07视觉感知

针对 EEG 情感识别虽准确但难解释的问题,论文将解释从通道/时间点归因转向“行为可视化”,提出把 EEG 翻译为去身份化面部 emoji 的 Facial Emoji Proxy Modeling。其 FMENet 建模与表情相关的空间协同和多尺度时序,FELB 用 emoji 重建约束情感表征。实验称在 EAV、MMER 上达到 EEG-only 最优,并能生成语义一致的动态表情,零样本 SEED 也有一定迁移性。

Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models Figure 1
2026-07-07cs.CV

Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models

Hulingxiao He, Zhi Tan, Yuxin Peng

2026-07-07视觉语言

论文针对大多模态模型微调时只依赖语言建模损失、缺少显式层级分类知识而导致层级视觉识别不一致的问题,提出无需新增可学习参数的 HiR² 正则化:用文本引导从中间表征构建粗到细视觉树,并结合 Lorentz 双曲蕴含损失与角度分散损失同时约束父子关系和相近类别区分。实验显示该方法在 Qwen、InternVL、LLaVA 等模型及 SFT/DFT 设置下,于 iNat21、CUB 等层级数据集上带来一致提升。

Holo-Captioning: Toward the Text Equivalent of 3D Scenes Figure 1
2026-07-07cs.CV

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

Kun-Yu Lin, Chengke Bu, Zhenguo Li, Kai Han

2026-07-07视觉语言三维

现有3D场景描述多停留在粗粒度物体标注,难以支撑机器人导航与操作所需的细致空间理解。论文提出holo-captioning,将三维场景转为含语义、位置、属性和关系的结构化文本,并构建HoloEngine/HoloScan、HoloScore与实例解耦的HoloScribe。结果显示其优于3D dense captioner和3D LLM,在MultiScan零样本检测及移动机器人目标导航中也取得更高表现。

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space Figure 1
2026-07-07cs.CV

ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space

Peiming Li, Yifan Wang, Xiaotian Zhang, Zhiyuan Hu, Shiyu Li, Zheng Wei, Yang Tang

2026-07-07视觉感知

ProLaViT针对多模态大模型在复杂视觉推理中依赖文本CoT易丢失空间细节、显式生成又成本高的问题,提出在结构化连续潜空间中逐步形成“视觉思维”。其核心是用模型自身视觉编码器进行内生自蒸馏,并以程序合成轨迹训练粗到细和辩证推理链,再用距离加权多样性损失抑制潜表示坍缩。实验称其在视觉中心基准上优于基线,兼顾准确率、可解释性和效率,但具体增益来源仍需看完整实验拆解。

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement Figure 1
2026-07-07cs.CR

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

The Pennsylvania State University, University of Sheffield

2026-07-07数据集/基准

论文关注多模态大模型遗忘中的现实隐私场景:私人目标常与公众人物、地标等公共信息同图纠缠,现有基准难评估“忘私不伤公”。PPE-Bench将待遗忘个体与需保留的公共上下文放入同一图像,并设置遗忘、保留和相邻公共信息评测。实验显示现有遗忘方法虽能降低隐私泄露,却会显著损害相邻公共知识,且公共信息微调后私有知识可能重新出现。

SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness Figure 1
2026-07-07cs.CV

SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch-Level Incoherence and Temporal Roughness

Jongyeop Hyun, Hyounghun Kim

2026-07-07视觉感知

面向真实平台中“误杀真实视频”代价很高的场景,论文指出AUROC不足以反映超低FPR下的检测能力。SPLIT无需训练,直接在冻结视觉编码器的patch token上度量两步时间粗糙度和局部空间运动不一致性,以保留局部篡改证据。在FakeParts、GenVideo和ViF-Bench上,它在FPR=0.1%等严格阈值下取得最高假视频召回,并对后处理保持稳健。

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras Figure 1
2026-07-07cs.CV

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras

Juwei Shen, Yujie Wu, Changwen Chen

Department of Computing, FCMS, The Hong Kong Polytechnic University, at quadratic cost, restricting scalability for high-frequency, dependencies, achieving scalable and stable 3D tracking

2026-07-07视觉感知三维

这篇论文针对事件相机三维特征跟踪中稀疏噪声事件流难以长程建模、Transformer 代价过高的问题,提出首个基于 Mamba 状态空间模型的 E-TraMamba,以线性复杂度融合事件局部补丁、相关图、位置与深度/视差信息,并用轻量仿射预测提升遮挡和模糊下稳定性。作者还构建 EvD-PointOdyssey 数据集;实验显示其在严格 0.1m 阈值下特征寿命超过基线 2 倍,跟踪比例更高、RMSE 更低。

Cancelable Biometric Template Protection Based on Multi-Instance Fusion: A Contralateral Iris Approach Figure 1
2026-07-07cs.CV

Cancelable Biometric Template Protection Based on Multi-Instance Fusion: A Contralateral Iris Approach

Jittarin Chaivong, Nicha Vikromrotjananan, Teekatat Piriyapittaya, Waree Kongprawechnon, Suradej Duangpummet

\IEEEauthorblockA \IEEEauthorrefmark 1 Sirindhorn International Institute of Technology , Thammasat University, Thailand

2026-07-07视觉感知

这篇论文针对虹膜模板一旦泄露难以重置、而现有可撤销方案常依赖外部 token 的风险,提出无 token 的双眼虹膜保护方法:每眼三次注册样本多数投票融合,选取稳定 ROI 后用盐置乱左右虹膜码,再通过异侧 XOR 生成单一受保护模板。其关键洞察是左右虹膜统计独立,可同时提高攻击门槛和匹配鲁棒性;在多个 CASIA 数据集上 EER 为 0.36% 至 10.80%,整体优于未保护基线,但跨设备场景仍明显退化。

Prior Bias in Vision Language Models on UML Diagram Interpretation Figure 1
2026-07-07cs.CV

Prior Bias in Vision Language Models on UML Diagram Interpretation

Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio Mastropaolo

is available at https://anonymous.4open., opaque labels, separating knowledge priors from, VLMs can read UML labels but report uneven re-

2026-07-07视觉感知

这篇论文关注 VLM 在软件工程图形理解中是否真正读取 UML 箭头,而非依赖类名常识先验。作者构造了成对的受控 UML 基准,仅翻转关系箭头并保持名称与布局不变,以隔离视觉证据和知识先验。结果显示,开源模型在箭头反转后关系方向准确率平均下降 33.48%,三类图下降 45.28%;GPT-5.4 系列虽缓解两类场景错误,但在更复杂图中仍有明显先验覆盖视觉的问题。

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation Figure 1
2026-07-07cs.RO

Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation

Jin Yang, Ping Wei, Nanning Zheng

National Key Laboratory of Human-Machine Hybrid

2026-07-07机器人

多视角机器人操作虽高效,但视图冗余、遮挡和视角依赖会造成注意力漂移。论文借鉴差分放大器提出 AmpAttention,用差分/共模建模与 CMRR 损失抑制噪声,并在 RVAF 中分别做视内与视间融合,RVAF++进一步接入 SAM2 视觉先验。结果显示其在 18 个 RLBench 任务上平均成功率优于既有方法且训练时间减少约 33.3%,高精度插桩任务达 91%,并展示了少量真实示教下的泛化与鲁棒性。

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving Figure 1
2026-07-07cs.RO

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

2026-07-07强化学习

CLEAR针对端到端自动驾驶中模仿学习“开环训练、闭环部署”带来的分布偏移,提出在预训练VLA航点先验周围学习残差航点策略,并用PPO进行闭环强化学习微调;同时将CARLA仿真与VLA学习器部署在异构计算组以扩大并行环境规模。论文报告其在CARLA longest6 v2、Bench2Drive及nuScenes上取得领先或有竞争力结果,增益可能部分来自大规模闭环采样与训练规模。

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models Figure 1
2026-07-07cs.CR

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

2026-07-07机器人视觉语言视觉感知

论文关注云边协同部署大视觉语言模型时,视觉 token 需经通信链路上传云端所暴露的中间表示攻击面。作者提出黑盒中间人场景下的 VTM-Attack,比较置换、掩码、高斯扰动、符号翻转,并用自注意力破坏与范数正则选择脆弱 token。实验覆盖 6 个 3B–72B 模型和 4 类基准,显示仅操纵 10% 视觉 token 即可使准确率最高下降 88.31%,提示机器人等边缘视觉感知系统需保护 token 传输链路。

Conversational Human Audio-visual Talking Dialogue Generation Figure 1
2026-07-07cs.CV

Conversational Human Audio-visual Talking Dialogue Generation

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

2026-07-07视觉感知

针对真实双人音视频对话数据采集成本高、隐私伦理敏感且多样性不足的问题,本文提出 DIADG 任务与 CHAT 框架,从单一文本提示生成成对语音、人脸身份与相互响应的表情行为,并通过音频与面部交互细化提升同步和互动性。实验显示其在客观指标和用户研究中优于相关 talking-face/反应生成方法,合成的 CHAT-AVD-50k 还可预训练下游交互头部生成模型并提升 REACT 2024 表现。

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation Figure 1
2026-07-07cs.CV

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

2026-07-07视觉感知强化学习规划控制三维

该文针对视频扩散模型难以同时精确控制物体运动与相机运动的问题,提出 UniCaMo:不在生成中后期加控制分支,而是直接构造带三维约束的初始噪声,用稀疏 3D 点轨迹局部扭曲物体噪声,并用球面噪声为相机运动中新显露区域提供一致采样。方法无需改动主干,仅配合轻量 LoRA,在 MoveBench 等基准上提升运动可控性与视频质量。

Biomechanics-aware Multi-view Markerless Motion Capture of Dexterous Hand Movements Figure 1
2026-07-07cs.CV

Biomechanics-aware Multi-view Markerless Motion Capture of Dexterous Hand Movements

Pouyan Firouzabadi, J.D. Peiffer, Kunal Shah, Anton Sobinov, Lee E. Miller, R. James Cotton, Wendy M. Murray

end method suggests that it is more effective in utilizing the available, vision and pose estimation to algorithmically label anatomical, “This work was supported by Northwestern University (NIH R01, NS131953), the Restore Center P2C (NIH P2CHD101913), and the Research, Accelerator Program of the Shirley Ryan AbilityLab”., Biomedical Engineering Department, Northwestern University, Chicago, Shirley Ryan AbilityLab, Chicago, IL, US, Department of Organismal Biology and Anatomy, University of Chicago, Department of Physical Medicine and Rehabilitation, Northwestern, University, Evanston, IL., [3], [4], [5], [6], [7]. MMC uses these digital labels, referred to, landmarks of interest can be labeled inconsistently across

2026-07-07强化学习

该文针对无标记运动捕捉在灵巧手部动作中易受关键点误检、遮挡和解剖约束不一致影响的问题,比较端到端生物力学模型优化与传统“2D关键点三角化后逆运动学”流程。核心洞察是将模型缩放、姿态和运动轨迹放入同一可微优化环节,可更充分利用多视角2D信息。实验在6名受试者、121段含手势与物体操作的视频上显示,该方法全部收敛,而两阶段法约15%失败,并产生更合理、抗遮挡更强的手部运动学结果。

Pretreatment MRI reveals a latent, molecular-subtype-independent structural phenotype that organizes treatment trajectories and recurrence risk Figure 1
2026-07-07eess.IV

Pretreatment MRI reveals a latent, molecular-subtype-independent structural phenotype that organizes treatment trajectories and recurrence risk

Dattatreya Kantha, Murray H. Loew

Affiliation: ¹ Medical Imaging & Image Analysis Laboratory, Department of Biomedical Engineering, George Washington, University, Science and Engineering Hall, 800 22nd St., NW, Suite 5000, Washington, DC 20052, USA, size-adjusted ρ = −0.262), a volumetric deception invisible to endpoint labels. External analyses in UCSF, I-SPY1, commensurability assessment showed why feature-name matching is insufficient: the same label can fail, transport, different structural histories into the same favourable label: one tumour may enter therapy with organised, low-, structure organising how tumours move through treatment, independent of any outcome label. Discovering that, invisible to endpoint labels. (6) We test, across three external cohorts — UCSF, I-SPY1, and Duke — where the, all modelling decisions were finalized. No outcome labels were used during manifold construction.

2026-07-07生成模型安全鲁棒

论文针对乳腺癌新辅助治疗中“肿瘤缩小不等于结构性好转”的问题,提出用治疗前 DCE-MRI 构建无结局监督的纵向影像流形,挖掘独立于分子分型的结构表型。核心发现是基线结构熵能恢复临床与基因组变量无法解释的主要响应轴,并在治疗中保持稳定;外部队列显示其与复发风险有关,但跨队列有效性依赖特征表示是否可比。

Signal from Space: Detecting Schools and Towers to Bridge the Digital Divide Figure 1
2026-07-07cs.CV

Signal from Space: Detecting Schools and Towers to Bridge the Digital Divide

Zakarya Elmimouni, Sandor Farkas, Fares Fourati, Vladimir Daigele, Walid Mathlouthi, Mohamed-Slim Alouini

2026-07-07视觉感知

面向发展中地区学校联网规划中学校位置和通信基础设施数据稀缺、噪声大的问题,本文用高分辨率卫星图像和迁移学习同时检测学校与蜂窝塔,并结合 ITU CPP 的地形感知视距分析评估可连接性。在莱索托实验中,微调后的学校检测器 mAP@50 达 0.913、召回率 0.951,明显优于零样本模型,可用于区分潜在可连接与难连接学校。

Provable Pruning for Efficient 3D Gaussian Splatting via Coresets Figure 1
2026-07-07cs.CV

Provable Pruning for Efficient 3D Gaussian Splatting via Coresets

Waseem Mousa, Alaa Maalouf

Department of Computer Science, University of Haifa

2026-07-07三维

针对3D Gaussian Splatting 场景动辄包含数百万高斯、现有剪枝多依赖启发式和后续微调的问题,论文从 coreset 角度给出一个关键界限:无限制查询下不存在非平凡乘法保证,但在给定渲染分辨率或代表视角集合时,可按敏感度采样构造带权子集,并在稳定透射等假设下转化为渲染保证。实验显示该方法在无微调或极短微调、尤其高压缩率场景下优于常见剪枝启发式。

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs Figure 1
2026-07-07cs.CV

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai

2026-07-07视觉感知

针对胸片随访报告需同时判断多处病灶的变化方向并定位区域、而既有方法常缺少时序或空间 grounding 的问题,GRCD清洗Chest ImaGenome/MIMIC-CXR时间配对数据,并用区域级变化token结合空间前缀与门控交叉注意力生成多发现报告。结果显示其在BLEU-4、CheXbert F1、RadGraph F1及变化检测上优于TRACE等基线,但收益也部分依赖严格数据清洗。

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models Figure 1
2026-07-07cs.CV

Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models

Stanislav Panev, Minhyek Jeon, Vaishnavi Khindkar, Ahish Deshpande, Celso M de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre

2026-07-07视觉感知生成模型

这篇论文针对航拍车辆检测中真实数据场景偏斜、弱点难以被总体指标暴露的问题,提出用基础图像生成模型构造可控的合成诊断集,通过文本生成、属性编辑与多模态属性校验隔离场景、季节、天气等因素。实验显示,合成集上的分场景性能趋势能对应真实数据中的失效模式,并据此补充少量弱类真实样本,最高带来约13% AP50提升。

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space Figure 1
2026-07-07cs.CV

Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space

Zhibing Li, Amogh Gupta, Behnoosh Parsa, Dan Casas

2026-07-07生成模型规划控制三维

这篇论文针对新视角生成难以按物体全局坐标精确控制相机姿态的问题,将任务改写为基于图像编辑模型的 NOCS 绝对位姿条件生成:用 Plücker raymap 相机 token、区域注意力和文本定义的规范朝向共同消解坐标歧义。实验显示,该方法可从单张或少量无位姿图像生成朝向一致、细节质量较高的新视角,并优于相对位姿或三维生成基线。

RayTun3R: Online Camera Adaptation in 3D Foundation Models Figure 1
2026-07-07cs.CV

RayTun3R: Online Camera Adaptation in 3D Foundation Models

Daniil Sinitsyn, Nikita Araslanov, Daniel Cremers

Munich Center for Machine Learning, University of Oxford

2026-07-07三维

本文针对 DUSt3R、VGGT、Depth Anything 3 等三维基础模型在鱼眼相机上因针孔相机位置编码偏置而深度和位姿退化的问题,提出 RayTun3R:冻结主干,仅在线学习与 token 位置和相机射线相关的轻量 PE/RoPE 残差,并配合无参数的网格与分块校正。其只需约 1.08 万参数、短序列自监督适配,推理几乎无额外开销,在多种 110°–200° 鱼眼数据上将旋转误差相对未适配模型降低约 2–12 倍,并优于 LoRA、CalTok 等基线。

When Does Resolution Help a Frozen Backbone? Global Attention at Resolution Predicts Scalable Adaptation for Camouflaged and Marine Animal Segmentation Figure 1
2026-07-07cs.CV

When Does Resolution Help a Frozen Backbone? Global Attention at Resolution Predicts Scalable Adaptation for Camouflaged and Marine Animal Segmentation

Tyler Rust, Chandra Kambhamettu

University of Delaware, University of South Florida

2026-07-07视觉感知

本文关注冻结视觉基础模型在伪装与海洋动物细粒度分割中何时能从更高输入分辨率获益。核心洞察是,低秩适配能否随分辨率扩展,主要取决于骨干是否在高分辨率 token 上执行全局注意力,而非模型规模或预训练来源;SALT 固定管线下,各向同性 ViT 持续提升,层级骨干约在 512px 饱和,并在 MAS3K 等海洋分割基准取得新的最优结果。

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining Figure 1
2026-07-07cs.CV

VLRC: Vision-Language Reprojection Consistency as a scalable signal for better feed-forward 3D pretraining

Marwane Hariat, David Filliat, Antoine Manzanera

2026-07-07视觉语言视觉感知三维

本文针对前馈3D预训练依赖昂贵几何标注或易受光照、纹理影响的光度自监督这一瓶颈,提出VLRC:用冻结视觉语言模型的密集特征做跨视角重投影一致性约束,把语义不一致转化为可扩展训练信号。该目标无需额外3D标注,可接入SS3D及VGGT/SelfEvo式无标注适配,在室内外基准上提升深度、相机估计和重建精度,并改善零样本开放词汇3D语义分割。

Aircraft Detection in Satellite Imagery using Deep Learning Object Detectors Figure 1
2026-07-07cs.CV

Aircraft Detection in Satellite Imagery using Deep Learning Object Detectors

Mujahir Hussain Abbasi (Department of Information Technology Maulana Abul Kalam Azad University of Technology, Kolkata, West Bengal, India), S. Beghin (Bose School of Computational and Physical Sciences Kristu Jayanti, Bengaluru, Karnataka), A. T. R. Krishna Priya (AB Technologies Nagercoil, Kanyakumari, Tamil Nadu, P. Jamuna (Department of Electrical and Electronics Engineering Nandha Engineering College, Erode, G. Anandhakumari (Department of Physics Erode Sengunthar Engineering College, Perundurai, S. Jaanaa Rubavathy (Department of Electrical and Electronics Engineering Saveetha School of Engineering, Saveetha University, Chennai

Department of Information Technology, Maulana Abul Kalam Azad University of, School of Computational and Physical, Kristu Jayanti (Deemed to be University), Department of Electrical and Electronics, Nandha Engineering College, Department of Physics, Erode Sengunthar Engineering College, Saveetha School of Engineering, Saveetha, Institute of Medical and Technical Sciences, Saveetha University

2026-07-07视觉感知

面向卫星图像中飞机目标小、背景复杂、光照和噪声变化大的检测难题,论文将 Gabor 滤波增强、归一化预处理与 YOLOv11 检测器串联,用以突出机翼/机身纹理并提升鲁棒性。在 Aircraft Detection 数据集上报告 mAP@50 为95%、Precision 97%、Recall 85%、F1 91%,高于列举的 YOLOv5/YOLOv7 Tiny;但数据集规模较小,YOLOv11改动细节和增益来源未充分说明。

Property-Constrained 3D Porous Media Reconstruction from 2D Images via Conditional Generative Adversarial Networks Figure 1
2026-07-07cs.CV

Property-Constrained 3D Porous Media Reconstruction from 2D Images via Conditional Generative Adversarial Networks

Ali Sadeghkhani, Brandon Bennett, Arash Rabbani

School of Computer Science, University of Leeds, Leeds, UK

2026-07-07视觉感知生成模型三维

针对微 CT 等三维孔隙成像成本高、样本少,而二维薄片难以直接约束三维孔网的问题,本文提出仅用二维图像训练的属性条件 cGAN:3D 生成器按目标孔隙度生成体数据,2D 判别器通过多轴切片学习结构一致性,并用 U-Net 提取孔隙度标签。在两类碳酸盐样本上,模型能复现硬石膏夹杂和细晶纹理,孔隙度控制达到 R²=0.93,MAE 为 0.019/0.010。

An Automated Multimodal Glaucoma Detection Framework Using ViT and a Stacking-Based Ensemble Figure 1
2026-07-07cs.CV

An Automated Multimodal Glaucoma Detection Framework Using ViT and a Stacking-Based Ensemble

Ishrat Jahan, Muhammad E.H Chowdhury, Murugappan Murugappan, Kanchon Kanti Podder, Tawsifur Rahman, Shrestha Datta, Md Sakib Abrar Hossain, Md Mosarrof Hossen, Yosra Magdi Salih Mekki, Sanjiban Sekhar Roy

Department of Computer Science and Engineering, Shahjalal University of Science and Technology, Department of Electrical Engineering, Qatar University, Doha, Qatar, Department of Electronics and Communication Engineering, Kuwait College of Science and, Department of Interdisciplinary Engineering, Kennesaw State University, United States, Department of Biomedical Engineering, School of Medicine, Johns Hopkins University, United, Department of Bioinformatics University of Regina, Canada, Department of Biomedical Engineering, University of Oxford, United Kingdom, Department of Computer Science and Engineering, Vellore Institute of Technology, India, interpretation, limiting their scalability for large-scale screening. In this study, glaucoma detection is, employed to optimize performance. Experiments conducted on the publicly available PAPILA dataset

2026-07-07视觉语言视觉感知

青光眼早筛依赖专家判读且难以规模化,本文将眼底图像与临床指标联合建模:用 ViT 提取视觉特征,再以传统分类器和三模型 stacking 集成完成样本级与患者级诊断。PAPILA 上多模态样本级准确率 97.47%、F1 97.50%,患者级准确率与 F1 均为 98.97%,并实现网页端筛查系统;但相对单模态的具体增益来源仍需结合消融细节判断。

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval Figure 1
2026-07-07cs.CV

S-EMBER: A Large-Scale Benchmark for Streaming Egocentric Memory Retrieval

Xiaodong Wang, Xuanyi Zhao, Pedro Rodriguez, Devendra Singh Sachan, Barlas Oguz, Seungwhan Moon, Shang-Wen Li, Gargi Ghosh, Xin Dong, Wen-Tau Yih

2026-07-07数据集/基准

面向智能眼镜等可穿戴设备中的长期第一视角记忆检索,S-EMBER将传统离线VideoQA改为流式、因果触发的情景记忆评测,提供388小时真实眼镜视频、9448个带人工时间证据的问答及多粒度答案。实验显示,大模型语义回答随规模提升,但时间定位几乎不随参数、分辨率或帧密度改善,并随记忆间隔拉长明显衰减,揭示当前多模态模型的时间索引瓶颈。

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos Figure 1
2026-07-07cs.CV

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

Ogmen Robotics Inc., Massachusetts, USA, Georgia Institute of Technology, Atlanta, USA, in MLLMs. To create this dataset, we propose a scalable, VLM/LLM-powered, links to the dataset and evaluation suite, is available here., evaluations remain predominantly human-centric, with tasks and data centered on human actions, beyond short, isolated clips or single-label classification toward fine-grained, multi-hop reasoning, • We present a scalable dataset generation pipeline that leverages VLMs and LLMs to auto-

2026-07-07视觉语言视觉感知

面向家庭机器人、宠物安全与伴侣系统,论文指出现有视频多模态评测过于以人为中心,难以衡量模型对犬类姿态、互动和长时序行为的理解。K9-Bench用907段真实犬类视频构建4744个跨5类任务的问答,并提出VLM/LLM自动挖掘、生成与去偏流程。实验显示闭源模型优于开源模型,但前沿MLLM仍难以处理细微姿态线索和长程组合推理,通用CoT增益有限。

EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions Figure 1
2026-07-07cs.CV

EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions

Haoran Wang, Mohit Mendiratta, Christian Theobalt, Adam Kortylewski

2026-07-07三维

论文瞄准文本控制三维表情时身份、纹理与表情纠缠、细粒度语言缺少对应3D参数的问题,将生成改写为3DMM表情空间中的回归任务。其核心是构建含显式面部细节与隐式情境描述的Txt2Emote数据集,并用带<Expr>标记的MLLM解码表情参数;结果显示在情绪识别和主观表现力上优于CLIP/扩散基线,但增益可能主要来自数据与多模态监督。

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots Figure 1
2026-07-07cs.RO

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

CoLab, Beihang University

2026-07-07机器人

论文针对具身策略训练框架逐渐成熟、但真实机器人部署仍依赖零散脚本的问题,提出 EVA-Client 作为模型无关的客户端层,把机器人接入、实时推理调度、调试、数据采集与物理评测统一起来。其核心在于解耦信号源、机器人后端和传输中间件,并将同步/异步执行、时间集成和 Real-Time Chunking 放到同一配置接口下比较;结果显示它可支持多种机械臂与工作流,使每次评测同时产出可回流训练的数据,但文中更像系统报告,量化性能增益与来源未充分说明。

BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models Figure 1
2026-07-07cs.CV

BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models

Aryan Pandit

2026-07-07生成模型

本文针对扩散生成图像难以溯源、现有像素域或单一潜空间水印易被再生成和失真削弱的问题,提出 BiSLW:将扩散 latent 按低频语义与高频纹理分解,在双频带中用学习式编码器嵌入同一身份水印,并用跨频带一致性约束和双解码器恢复。实验称其相比既有 latent 水印方法 PSNR 提升超过 3 dB,在再生成、压缩和几何扰动下仍保持接近完美比特准确率,且额外开销很小。

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data Figure 1
2026-07-07cs.CV

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann

Connectomics Lab, Department of Radiology, Lausanne University Hospital (CHUV), Lausanne, Switzerland, University of Lausanne (UNIL), Lausanne, Switzerland

2026-07-07机器人

本文针对神经影像流程中体数据、皮层表面、纤维束和连接矩阵被不同工具割裂、重复胶水代码多且易出错的问题,提出 CLABTOOLKIT,将分区、表面、注释分区、纤维束和连接组封装为可互操作 Python 对象,并整合 BIDS、FreeSurfer、扩散 MRI、形态测量和 GPU 可视化等模块。主要结果是形成含 19 个模块、13 个类、234 个方法和 207 个函数的开源工具包,可跨 NIfTI、GIFTI、TCK/TRK 等格式完成常规处理与导出;论文侧重软件架构与用例,未充分说明相对现有工具的定量效率或可靠性增益。

Federated Learning for Object Detection: Enabling Collaborative Drone Learning Without Centralizing Data Figure 1
2026-07-07cs.LG

Federated Learning for Object Detection: Enabling Collaborative Drone Learning Without Centralizing Data

Daniel M. Jimenez-Gutierrez, Enrique Zuazua, Georgios Kellaris, Joaquin del Rio, Oleksii Sliusarenko, Xabi Uribe-Etxebarria

2026-07-07视觉感知

本文面向无人机视觉中原始航拍数据难以集中汇聚的隐私、带宽与治理约束,评估用联邦学习训练目标检测器是否能替代集中式多机训练。其核心不是提出新检测器,而是在 KIIT-MiTA 的非 IID 四节点设置下比较单机、集中式与联邦 YOLO nano 模型。结果显示联邦训练接近集中式,并较单机显著提升,最佳 YOLO26 nano 在 mAP@0.50 和 mAP@0.50:0.95 上相对增益为 52.89% 和 67.80%,但增益可能主要来自跨节点数据规模与多样性。

SE-UNet: Singular Equivariant Imaging for Real-World Constrained Generation Figure 1
2026-07-07cs.CV

SE-UNet: Singular Equivariant Imaging for Real-World Constrained Generation

Kanishk Awadhiya

2026-07-07强化学习

本文针对扩散模型在真实逆问题中依赖大规模训练数据、难以满足物理约束的问题,提出 SE-UNet,将生成过程改写为零样本优化,并在 U-Net 中加入奇异值门控与 D4 旋转/翻转等变自监督,以抑制噪声过拟合并增强几何一致性。在 CIFAR-10 80% 缺失像素修复中,方法达到 25.34 dB PSNR、0.82 SSIM,较 DIP 高约 4 dB,但验证主要限于小规模图像修复,泛化到更复杂真实场景文中未充分说明。

Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers Figure 1
2026-07-07cs.CV

Fusion: A Framework for Unified Sequential Token AdaptatIon in VisiOn TraNsformers

Aravind Pradeep, Samira Nazari, Mahdi Taheri, Christian Herglotz

Brandenburg University of Technology Cottbus-Senftenberg, Germany, University of Zanjan, Iran, Humboldt University, Berlin, Germany, Tallinn University of Technology, Tallinn, Estonia

2026-07-07视觉感知

这篇论文针对 ViT 对所有图像 token 近乎等量计算、而简单叠加剪枝/合并/早退会相互干扰的问题,提出按“先合并、再判断早退、最后对继续样本剪枝”的 Fusion 顺序框架,并用轻量路由器按输入调节合并强度、推理时切换精度-延迟档位。实验称其在 ImageNet-1k 等数据集上以 DeiT-S/ViT-Tiny 达到或优于同类自适应方法,校准误差最高降约 4 倍、能耗降 48%。

Privacy-Preserving Industrial Ergonomics: mmWave-Based Automated REBA Scoring and Pose Estimation Figure 1
2026-07-07cs.CV

Privacy-Preserving Industrial Ergonomics: mmWave-Based Automated REBA Scoring and Pose Estimation

Xuhan Zhang, Zhuangzhuang Dai, Luis J. Mans, Victor Chang

2026-07-07三维

这篇论文面向工业场景中人工 REBA 评估成本高、视觉方案有隐私与遮挡光照问题的痛点,提出用毫米波雷达点云端到端估计 3D 骨架并回归 REBA 风险分数。核心思路是将姿态重建作为可解释的生物力学中间层,并用关节约束、时间平滑和高风险样本过采样缓解雷达点云稀疏与类别不均衡。MMFi 实验中分类准确率为 77.78%,推理延迟 5.70 ms,高风险 REBA MAE 达 0.93,优于直接回归和两阶段管线;但评估数据和真实工业动作覆盖仍有限。

Latent Visual Cache for Video Reasoning Figure 1
2026-07-07cs.CV

Latent Visual Cache for Video Reasoning

Yongheng Zhang, Zhipeng Xu, Hao Wu, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

Tencent Youtu Lab, Tsinghua University, University of Illinois at Chicago

2026-07-07视觉感知

本文针对视频大模型在长链生成中逐渐脱离视觉证据的 Visual Anchoring Decay 问题,提出在解码器内加入 Latent Video Cache,用潜在缓存持续保存关键时空语义,并通过对比式缓存对齐与视觉约束 GRPO 训练。基于 Qwen3.5-9B 的实验显示,其在六个视频理解与推理基准上优于 CoT 和 SFT+GRPO,尤其长视频与强 grounding 任务提升更明显,且回答更短。

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation Figure 1
2026-07-07cs.CV

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

Chongkei Chang, Zhidong Deng

2026-07-07机器人强化学习

本文针对现有 VLA 多面向静态目标、难以在不破坏预训练能力的情况下处理独立运动物体的问题,提出冻结基座 VLA、以其动作 chunk 作为语义条件,再结合多视角历史和本体状态由流匹配 DiT 重生成拦截轨迹的 DynaWM。其洞察是不同 VLA 的输出动作共享物理含义,可作为跨模型世界模型接口;在 DynaGrasp-32 上对 8 类基座检查点均提升成功率,细调模型增益 1.88%–45.31%,粗调模型增益 26.13%–44.06%。

CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning Figure 1
2026-07-07cs.CV

CV-DCLR: Causal-Visual Dynamic Label Refinement for Robust Zero-Shot Learning

Can Wang, Jiangnan Li, Mingyu Li, Yining Song, Kangrui Ren, Min Gan, Jinfu Fan

School of Computer Science and Technology, Qingdao University, School of Software Engineering, Tongji University, School of Computer Science and Technology, Qingdao University Qingdao China, School of Software Engineering, Tongji University Shanghai China

2026-07-07安全鲁棒

本文针对零样本学习中视觉相似类别导致的语义纠缠问题,指出单纯最大化视觉—语义相关性会放大狼/哈士奇等混淆类的伪相关。CV-DCLR用视觉似然流找候选,再以反事实遮蔽原型估计结构必要性,并通过自适应门控融合两路信号。实验在CUB、SUN、AWA2及语义纠缠注入设置下显示,其在高歧义场景较现有方法更稳健,但具体增益是否依赖构造的干扰协议仍需结合完整实验细节判断。

Evaluating Agentic Harness Systems for Autonomous Computational Pathology Figure 1
2026-07-07cs.CV

Evaluating Agentic Harness Systems for Autonomous Computational Pathology

Jie Lin, Zongyi Chen, Qiaoling Zheng, Liuyi Wang, Hengyi Jiang, Jiabao Chen, Xiang Liu, Yinghong Yang, Liansheng Wang

2026-07-07视觉感知

本文针对计算病理中“报告看似完整但流程证据不足”的评估缺口,提出 ACP-Bench,将病理任务拆解为可审计的规划、工具执行、诊断结果、证据绑定与临床边界对齐。其评测 41 个任务、9 个模型和 3 类 harness 共 369 条轨迹,发现系统已能较好启动任务和生成诊断文本,但工具执行、结果绑定和反思修正薄弱,仅 10 条达到形式化通过阈值,临床过度声称与证据不足仍常见。

CIPHER: Causal Intervention Pathways for Healthcare Equity and Robustness Figure 1
2026-07-07cs.CV

CIPHER: Causal Intervention Pathways for Healthcare Equity and Robustness

Xinyu Jia, Weidong Guo, Wangyuan Zhao, Yi Guo, Zeju Li, Yuanyuan Wang

2026-07-07安全鲁棒

医疗影像模型常在性别、种族等敏感亚群上出现公平性与分布外鲁棒性缺口。CIPHER 的核心是用结构因果模型把敏感属性影响图像的机制拆成四条路径,并用带 classifier-free guidance 与 null-text inversion 的扩散生成进行全路径干预和反事实增强。在胸片与皮肤镜任务中,相比疾病条件合成基线,最差群体差距平均降低 35.8%,同时提升总体诊断准确率。

An automated method of identifying incorrectly labelled images based on the sequences of loss functions of deep learning networks Figure 1
2026-07-07cs.CV

An automated method of identifying incorrectly labelled images based on the sequences of loss functions of deep learning networks

Zhipeng Zhang, Wenhui Shou, Wengting Ma, Dongjia Xing, Qingqing Xu, Li-Qun Xu, Qingxia Fan, Ling Xu

An automated method of identifying incorrectly labelled, China Mobile Research Institute, Beijing 100032, China, tasks. Since the labelled medical images are the foundation of the training, vali-, dation, and test of deep learning classification models, the quality of labelling, estimated that up to ten percent of manually labelled medical images may be in-, correctly labelled. In this paper, by utilizing the sequences of loss functions of, tomated method of identifying incorrectly labelled medical images was pro-, posed. For those identified images, their labels could be further reviewed and, of labelled medical image datasets, as well as the performance of the deep, accurately identify the incorrectly labelled samples from the whole labelled da-, gold-standard labels (5394 non- referable diabetic retinopathy samples and, referable diabetic retinopathy samples), the labels of a small part (6%

2026-07-07视觉感知

针对医学图像人工标注中常见的漏判、边界模糊和主观差异问题,论文提出利用样本在多轮训练中的损失函数序列来刻画异常标注:错标样本往往不呈现正常下降趋势,再用特征提取与聚类筛出待复核图像。在糖尿病视网膜病变眼底数据上,方法找回75.31%的人工翻转错标,仅误报4.85%正确样本;复核9.1%数据后,模型准确率由95.93%升至96.50%,接近无错标训练的96.57%。

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation Figure 1
2026-07-07cs.CV

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

Jaehyun Jang, Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Mark A. Hasegawa-Johnson, Chang D. Yoo

2026-07-07视觉语言

这篇论文针对多模态大模型压缩中仅蒸馏输出分布难以传递视觉 grounding 的问题,指出真正与下游性能相关的是生成阶段的 response-to-vision 注意力,而非以往常用的 prompt-to-vision 注意力。作者提出 TRAG,按响应 token 提取师生视觉注意力,并依据教师注意力熵自适应混合正反向 KL,使不同 token 分别偏向覆盖或精确聚焦。多基准实验显示其较既有蒸馏方法取得更好性能和注意力一致性。

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation Figure 1
2026-07-07cs.CV

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

Beijing University of Posts and Telecommunications, Beijing Key Laboratory of Network System and Network Culture, Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism, Zhongguancun Academy, Beijing, China

2026-07-07视觉语言强化学习

针对多模态推理中现有 OPD 按任务或样本静态选择单一教师、难以同时覆盖视觉定位与抽象推理的问题,H-OPD 将异构视觉语言教师和纯文本教师放到同一学生轨迹上,并通过图像转文本描述与基于预测熵的 token 级置信仲裁动态分配监督。实验覆盖 11 个多模态推理基准,显示其相较标准 OPD 和 GRPO 取得更高准确率与更好 token 效率,消融与可视化也支持两类教师存在互补分工。

CPR: Chained Perceptual Refinement for Coarse-to-Fine Medical Image Classification Figure 1
2026-07-07cs.CV

CPR: Chained Perceptual Refinement for Coarse-to-Fine Medical Image Classification

Si-Yuan Lu, Hanruo Zhu, Ziquan Zhu, Gaojie Jin, Zeyu Fu, Lu Yin, Ke Li, Lu Liu, Tianjin Huang

2026-07-07视觉感知

高分辨率医学图像的诊断线索细小且稀疏,直接全图处理代价高、下采样又易丢失细节。CPR将分类建模为由全局到局部的序贯感知细化过程,在固定骨干输入尺寸下动态预测裁剪位置与尺度,并把原图高分辨率证据逐步融合到全局状态中。五个数据集和多种骨干上的结果显示,其较现有固定分辨率、多尺度与AdaptiveNN基线最高提升2.27%,同等精度下GFLOPs最多降低19.6倍。

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning Figure 1
2026-07-07cs.CV

Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning

Yixin Ji, Fanghua Ye, Juntao Li, Bo Zhao, Zexuan Qiu, Zhaopeng Tu, Liefeng Bo, Min Zhang

Soochow University, Tencent Hunyuan Multimodal Department

2026-07-07视觉感知

这篇论文针对在线长视频理解中“记不下、找不准、难以做多跳因果推理”的问题,提出 Homer:用感知缓冲、实体图和带时序/因果边的事件图分层组织视频记忆,再由带验证纠错与自进化技能的 agent 多轮检索证据。实验显示其在 M3-Bench-robot、M3-Bench-web 和 Video-MME-Long 上较此前最佳 agent 方法分别提升 5.5、10.8 和 4.4 分,表明收益主要来自结构化记忆与检索推理机制。

Reliability-Aware CT-MRI Registration: A Quality Engineering Framework with Stability Analysis and Risk Classification Figure 1
2026-07-07cs.CV

Reliability-Aware CT-MRI Registration: A Quality Engineering Framework with Stability Analysis and Risk Classification

Nisreen Albzour

School of Systems Science and Industrial Engineering, Binghamton University, Binghamton, NY, registration is itself an estimation problem with no ground truth available at deployment time, and

2026-07-07安全鲁棒

这篇论文针对 CT–MRI 配准在临床部署中缺少逐例可靠性信号的问题,提出把质量提升、Dice 重叠、重复初始化稳定性和正反向一致性合成为可靠性分数,并用训练集阈值划分绿/黄/红风险。结果显示仿射配准优于刚性配准,绿色自动接受比例为 44% 对 33%,可靠性筛选后各指标均优于未筛选方法;但样本仅 18 例,阈值仍属统计验证而非临床验证。

RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation Figure 1
2026-07-07cs.CV

RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

Yaofu Liu, Wanli Lan, Jinxi Li, Binhang Yuan, Harry Yang

2026-07-07视觉感知

该文面向3D RoPE视频DiT中长序列注意力的INT4加速瓶颈,指出现有量化忽视RoPE导致的Q/K离群分布变化,以及非负注意力概率用对称量化会浪费一半动态范围。RotateAttention通过可并入RoPE或低开销的旋转抑制Q/K离群,并用固定scale与zero-point优化P矩阵量化,辅以敏感层/步的FP16回退;实验称视频质量接近全精度,同时端到端最高加速1.68倍、核级加速2.2倍。

Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report Figure 1
2026-07-07cs.CV

Evaluating Intellectual Property Guardrails of Generative Image Models: A Technical Report

Austin T. Hoag, Apostolos Modas, Yunhao Ba, Julienne M. LaChance, Jinru Xue, Wiebke Hutiri, Jan Simson, Tiffany Georgievski, Alex Towli, Joseph Smith, Yuki Mitsufuji, Alice Xiang

2026-07-07视觉感知生成模型

本文针对生成图像模型可能复现角色、名人肖像和商业标志等受保护 IP 的风险,构建覆盖多类实体与直接/间接提示的基准,并用自动化 VLM 判别流程评估 14 个文生图系统的 IP 护栏。核心洞察是护栏触发高度不均:私有模型虽均有不同程度拒绝,但类别、提示是否点名和实体属性会显著影响结果;商业标志最少被拒且最易生成,所有被测模型在 2026 年 3 月仍能生成可识别 IP。

Classroom Behavior Monitoring with YOLO An Empirical Study in Higher Education Settings Figure 1
2026-07-07cs.CV

Classroom Behavior Monitoring with YOLO An Empirical Study in Higher Education Settings

Sinh Vu Trong, Dung Nguyen Manh, Hieu Hoang Minh, Hieu Pham Trung, Thu Pham Ha, Nhu Le Hoang

subjective and lack scalability. This study introduces a real-world dataset of classroom, videos collected at the Banking Academy of Vietnam (BAV-Classroom dataset), annotated, interpretation, which can lead to bias and limit the scalability of its application [2]. To address, behaviors to be monitored in the classroom, which serve as the basis for object labels in the, . We provide initial recommendations for the Banking Academy of Vietnam on the potential, departments can refine teaching strategies, enhance student management, and better address, Data collection and labeling

2026-07-07视觉感知

本文针对高校课堂观察依赖人工、主观且难以规模化的问题,采集越南银行学院真实课堂摄像头数据,构建含9类学习/分心/中性行为标注的BAV-Classroom数据集,并比较多种视觉检测模型。结果显示YOLOv11表现最佳,且课堂后段学生专注度明显下降,说明基于摄像头的自动化课堂质量监测具备可行性。

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models Figure 1
2026-07-07cs.CV

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

2026-07-07视觉语言视觉感知

这篇论文关注视觉语言模型在少样本上下文中不仅要识别任务,还要随应用要求调整判定标准的问题。作者提出 CC-ICL 设置、Criterion Sensitivity/Invariance 指标和多域 CC-Bench,揭示现有模型普遍存在“刚性边界”偏差:能保持部分不变样本一致,却难按上下文改变临界判断。简单多标准训练显著提升 7B 模型的标准敏感性,并在若干领域超过闭源模型。

Symmetry-Structured Neural Completion of Islamic Geometric Patterns from Sparse Control Geometry Figure 1
2026-07-07cs.CV

Symmetry-Structured Neural Completion of Islamic Geometric Patterns from Sparse Control Geometry

Hassan Ugail, Irfan Mehmood

Centre for Visual Computing and Intelligent Systems, University of Bradford

2026-07-07规划控制

本文关注伊斯兰几何纹样补全中“看起来对称”但无法保证严格有效的问题,将旋转对称、锚点和候选边轨道作为显式几何知识嵌入图神经补全,而非完全交给数据学习。核心洞察是学习负责预测 plausibility,轨道约束或投影负责保证结构合法。实验在程序生成图案上显示,结构化解码在干净输入下几乎不损失边级保真度,在缺失控制几何时仍保持零对称违规;但结果未用历史语料验证,风格泛化仍受限。

Additive Causal Construction for Transferable and Reconfigurable Cross-System Learning in Multi-Source Image Fusion Figure 1
2026-07-07cs.CV

Additive Causal Construction for Transferable and Reconfigurable Cross-System Learning in Multi-Source Image Fusion

Zhizhong Fu, Wei Zhou, Zhaoyang Jiang, Yulong Lin, Yifu Hou, Xiaorong Ding, Qiang Yan, Yifan Chen

2026-07-07视觉感知

本文针对多源图像融合在跨中心、跨区域等机制异质场景下易出现跨系统差异和纠缠、导致 OOD 退化的问题,提出 ACC 框架,将融合视为可重构的因果结构构造:用干预一致性建立共享因果锚点,并用结构不确定性门控不可靠路径。其实例 ACC-CRL 在 ColorMNIST 与多中心 MVI 预测中提升 OOD 泛化且基本保持 ID 表现,但具体增益相对各模块的来源仍需更多消融支撑。

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation Figure 1
2026-07-07cs.CV

Dual-Adaptive SAM3: Hierarchical Routing over Low-Rank Expert Layers for Parameter-Efficient Medical Image Segmentation

Ying Chen, Jinyue Li, Kun Wang, Qiankun Li, Yang Liu

2026-07-07视觉感知

这篇论文针对 SAM3 直接用于医学分割时全量微调成本高、普通 MoE 参数和显存开销大的问题,提出 DA-SAM3:在融合模块中用层级化低秩专家替换部分 FFN,并通过视觉-文本联合的动态路由按输入选择专家,实现从粗对齐到语义识别再到边界细化的适配。实验称在多个公开医学分割基准上优于全量微调和标准 MoE,较现有方法约提升 5%,同时将 MoE 参数开销降低 80% 以上。

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift Figure 1
2026-07-07cs.CV

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

Karim Mardhani

University of Colorado Boulder

2026-07-07数据集/基准安全鲁棒

这篇论文关注糖尿病视网膜病变筛查中比总体准确率更关键的漏诊风险与人工复核负担,采用冻结 RETFound 特征,仅比较最后一层的 softmax、温度缩放、贝叶斯、Laplace 与 SNGP 式不确定性头。结果显示,APTOS 上不确定性感知与选择性转诊可在约拒诊 20% 样本时将已接收病例漏诊降为零,但阈值调整也能以高假阳性代价减少漏诊,增益并非贝叶斯独有;DDR 外部验证中效果减弱,APTOS 训练的 SNGP 迁移较差,说明需显式评估安全性–覆盖率权衡和数据集偏移。

MAGE: View-guided Point Cloud Completion with Efficient Modality Alignment and Adaptive Geometry Enhancement Figure 1
2026-07-07cs.CV

MAGE: View-guided Point Cloud Completion with Efficient Modality Alignment and Adaptive Geometry Enhancement

Weize Quan, Zhengwei Wu, Kai Wang, Dong-Ming Yan

2026-07-07三维

MAGE针对单视图图像引导的点云补全过程中跨模态对齐弱、几何细节易被注意力平滑的问题,提出共享ViT与跨模态重建监督来约束图像和点云进入一致的几何潜空间,并结合锚点细化、图像交叉注意力和自适应几何自注意力同时建模局部邻域与全局结构。实验称其在合成和真实数据上优于XMFnet、EGIInet等方法,尤其改善完整形状与细薄结构恢复。

Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose Figure 1
2026-07-07cs.CV

Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose

Mohammadreza Jamalifard, Yaxiong Lei, Parastoo Azizinezhad, Javier Andreu-Perez

2026-07-07三维

本文关注凝视与头姿等三维视觉输出的保形预测可靠性:这些输出位于球面或 SO(3),若用 yaw–pitch/Euler 等平面坐标残差打分,会在极点或万向节锁附近产生几何畸变。论文的核心洞察是失效来自坐标图形状而非尺度,标量自适应阈值无法修正;用黎曼体积密度可诊断风险,用坐标无关的测地打分可直接替代。四个数据集上,名义 90% 覆盖在奇异区域降至约 39%–58%,而测地打分基本恢复覆盖且无需重训、开销很小。

From Raw Segmentations to Simulation-Ready Cardiac Meshes: An Automated Framework for Anatomical Reconstruction and Virtual Cohort Generation Figure 1
2026-07-07cs.CV

From Raw Segmentations to Simulation-Ready Cardiac Meshes: An Automated Framework for Anatomical Reconstruction and Virtual Cohort Generation

Francesco Fabbri, Martino Andrea Scarpolini, Paolo Ciancarella, Francesco Tudisco, Roberto Verzicco, Alessandro Ricci, Francesco Viola

2026-07-07视觉感知三维

这篇论文针对医学图像分割结果常含孔洞、断裂和拓扑错误,难以直接用于心脏多物理仿真的问题,提出从CT分割到仿真可用心脏网格的半自动流程。核心做法是用高质量模板进行基于Chamfer距离的多腔室非刚性配准,在贴合个体解剖的同时强制保持水密、同拓扑和点对应关系。作者在58例健康心脏CT上验证,并进一步构建统计形状模型与合成虚拟队列,展示其可支持不确定性分析和大规模体内仿真研究。

Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration Figure 1
2026-07-07cs.CV

Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration

Yiran Xiao, George Legrady

University of California, Santa Barbara

2026-07-07生成模型

这篇论文针对文本到图像扩散模型中语义结构何时形成、注意力如何在空间中迁移难以解释的问题,提出基于 DAAM 的逐步去噪注意力可视分析框架,将 token 级跨注意力轨迹、阶段划分、集中度、重叠与差分竞争视图联动展示。在 60 个结构化提示词和 Stable Diffusion v1.5 案例中,作者观察到语义定位稳定化、token 共享或分离空间等可解释模式,但结果主要是案例与试点证据,非严格统计评测。

Entropy-Coded MS-VQ-VAE with Learned Priors for Ultra-Low Bitrate Video Compression Figure 1
2026-07-07cs.CV

Entropy-Coded MS-VQ-VAE with Learned Priors for Ultra-Low Bitrate Video Compression

Manikanta Kotthapalli, Banafsheh Rekabdar

Portland State University, Portland State University Department of Computer Science Portland OR USA

2026-07-07视觉感知生成模型

这篇论文针对连续潜变量视频 codec 在 0.1 bpp 以下缺少稳定率控信号、难以保持语义质量的问题,提出用多尺度 VQ-VAE 的离散码本大小作为硬信息上限,并用自回归先验做熵编码;关键洞察是码本索引呈幂律分布,EMA 更新和 dead-code 重启可避免小码本崩塌。在 UCF101 64×64 视频上,模型达到 0.043–0.064 bpp,比 H.264/H.265 实用下限低数倍,且在 LPIPS 上优于 H.265 CRF36,但评估仍限于低分辨率和少量传统 codec 对比。

Double-Helix Active Geometry: LiDAR-Anchored Multi-View Depth with Selective Abstention Figure 1
2026-07-07cs.CV

Double-Helix Active Geometry: LiDAR-Anchored Multi-View Depth with Selective Abstention

Jinwen Wen

2026-07-07视觉感知

这篇论文针对移动设备/机器人短距 LiDAR 量程有限、远处或反光表面常缺深度的问题,提出 DH-Active:把近场 LiDAR 回波当作“米尺度尺子”来估计两视图位姿,再对可跟踪的远场点三角化,并用视差/重投影门控主动放弃不可靠估计。结果显示其 CPU 核心前端约 1.11 ms、零训练参数,在受控 ARKitScenes 远场协议中达到 64.2% 覆盖率和 13.4% 相对误差,但精度仍不及经尺度对齐的大模型。

Inpainting U-Net for seamless pedestrian-level wind prediction across urban morphologies Figure 1
2026-07-07cs.CV

Inpainting U-Net for seamless pedestrian-level wind prediction across urban morphologies

Jingzi Huang, Claire E. Heaney, Tao Li, Xinzhe Li, Graham O. Hughes, Maarten van Reeuwijk

2026-07-07视觉感知

面向城市设计中行人高度风场快速评估的需求,论文针对LES/CFD成本高、patch式U-Net拼接易产生边界不连续的问题,提出两阶段框架:先由M1按建筑高度与来流信息逐块预测,再用带邻域上下文的inpainting U-Net M2迭代修补全场。结果显示该方法能较好恢复平均风速和空间变化,并显著减弱拼接伪影,但高风速峰值仍被低估。

How many labels do you need? A decision framework for cross-habitat marine species recognition Figure 1
2026-07-07cs.CV

How many labels do you need? A decision framework for cross-habitat marine species recognition

Alzayat Saleh, Mostafa Rahimi Azghadi

College of Science and Engineering, James Cook University, Townsville, QLD, Australia, Centre for AI and Data Science Innovation, James Cook University, Townsville, QLD, Australia

2026-07-07视觉感知

针对海洋生态监测中跨地点部署自动物种识别需大量重标注、却缺少标注预算依据的问题,论文构建跨三大洋五个海洋数据集的评测框架,比较基础模型与多种适配策略。核心洞察是冻结的 DINOv2 线性探针比全量微调 CNN 更少依赖栖息地捷径,能学习更稳健的物种诊断特征;结果显示每个物种仅需约 10–20 张目标地点标注图像即可达到可靠识别,显著降低标注成本。

Do Diabetic Foot Ulcer Segmentation Models Generalize? A Cross-Dataset Benchmark of CNN and Transformer Architectures Figure 1
2026-07-07cs.CV

Do Diabetic Foot Ulcer Segmentation Models Generalize? A Cross-Dataset Benchmark of CNN and Transformer Architectures

Abderrahmane Benfatah

2026-07-07视觉感知数据集/基准

针对糖尿病足溃疡分割模型常在同源数据上报高分、但跨医院泛化未知的问题,本文在去泄漏的数据审计后,用统一协议比较 U-Net、DeepLabV3+ 与 SegFormer-B2。结果显示三者域内 Dice 接近 0.80–0.83,但外部数据显著下降;SegFormer-B2 在 DFUC2022 和 Medetec 上均最佳,且灾难失败更少,提示架构家族比模型复杂度更影响跨数据集鲁棒性。

Reliability-Aware Monocular Depth Supervision for Sparse-View Neural Reconstruction Figure 1
2026-07-07cs.CV

Reliability-Aware Monocular Depth Supervision for Sparse-View Neural Reconstruction

Wei-Teng Chu, Yashasvini Gopalan, Changju Yuan

Stanford University

2026-07-07视觉感知三维

面向自动驾驶等前向稀疏视角场景,论文关注单目深度先验虽能补几何约束但区域可靠性不均的问题。其核心做法是将 Depth Anything V2 预测经尺度平移对齐后,仅在 RGB-only 基线光度误差较低的区域施加深度监督。结果显示该策略对 Splatfacto 更有效,KITTISeq02 上 PSNR 从 14.903 提升到 15.932、RMSE 从 0.542 降到 0.100;对 Mip-NeRF-360 增益弱且不稳,强多视角场景还可能牺牲渲染质量。

Interpretable machine learning predicts Parkinson's disease severity using motion-corrected QSM MRI and multiband multiecho fMRI features Figure 1
2026-07-07cs.CV

Interpretable machine learning predicts Parkinson's disease severity using motion-corrected QSM MRI and multiband multiecho fMRI features

Aixa X. Andrade

Lyda Hill Department of Bioinformatics, Department of Biomedical Engineering, University of Texas Southwestern Medical Center, Dallas, Texas, USA

2026-07-07视觉感知

本文针对帕金森运动严重度仅靠临床量表难以反映脑部病理差异的问题,将运动校正 QSM 与多带多回波静息态 fMRI 的 ReHo 特征结合,并用可解释机器学习比较多种特征组合。结果显示影像特征本身有预测信号,完整 fMRI+QSM+临床变量可解释 45.4% 方差;精选 QSM+临床变量在 ±5 分内预测达 75%,SHAP 指向小脑、丘脑、纹状体等合理脑区,但样本仅 28 人,泛化仍需验证。

DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences Figure 1
2026-07-07cs.CV

DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences

Yankai Yang, Yancheng Long, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

2026-07-07视觉感知

这篇论文针对 Video MLLM 擅长全局语义却常漏掉短时、小区域差异的问题,提出 DeltaVid:把相似视频“找不同”转化为可验证代理训练信号,并用可控扰动构造 DeltaVid-10K/Bench,联合 Grounding 与 MCQ 奖励学习时间边界和空间证据。实验显示其在跨视频差异理解上优于同尺度与更大基线,并能迁移提升多个通用视频理解基准,但自然语义差异仍是局限。

Learning 3D Affordances for Blade Insertion in Cluttered Stowing Figure 1
2026-07-07cs.CV

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal

2026-07-07三维

这篇论文针对仓储机器人在杂乱软箱中插入刚性 blade 时,传统用 SE(3) 位姿分布学习会被单一示教策略限制、难以发现其他可行空隙的问题。核心洞察是把 blade 可供性视为三维自由空间中的占据区域,用 3D occupancy masked autoencoder 从场景几何重建 blade 占据,再后处理成位姿。10K 真实生产数据上,VulcanVoxel 的 top-5 覆盖率达 0.89,高于最佳位姿基线 0.71,RGB 蒸馏模型可在 30ms 推理。

Direct Time-of-Flight Measurement Accuracy Improvement With Perimeter-Gated SPADs Figure 1
2026-07-07cs.CV

Direct Time-of-Flight Measurement Accuracy Improvement With Perimeter-Gated SPADs

Md Sakibur Sajal, Hunter Guthrie, Zexi Liu, Marc Dandin

Department of Electrical and Computer Engineering, Carnegie Mellon University

2026-07-07视觉感知

这篇论文面向直接飞行时间测距中由SPAD暗噪声引起的检测抖动问题,指出在低回波或低重复次数下探测器噪声会主导测距不确定性。作者将周边栅控SPAD与片上计数式TDC结合,建立系统、线路和器件级抖动估计框架,并实测不同栅压影响。结果显示周边栅控可降低暗噪声概率,从而在自由运行和时间门控模式下提升dToF直方图峰值稳定性与测量精度。

iFLYTEK-Embodied-Omni Technical Report Figure 1
2026-07-07cs.AI

iFLYTEK-Embodied-Omni Technical Report

Yuan Zhang, Jingfei Ni, Guanchen Lu, Shiqi Zhang, Qingshan Xu, Chi Liu, Xin Nie, Wenjie Xu, Lin Gao, Zhiyuan Cheng, Mingxin Zhou, Jiajia Wu, Diyuan Liu, Jia Pan, Chao Ji

iFLYTEK, 2LindenBot, 3University of Science and Technology of China, self-attention. This design establishes brain–cerebellum collaboration: the vision-language model, Clean and 89.0% Rand, demonstrating the strong capabilities of the brain–cerebrum collaborativ, capabilities of the brain–cerebrum collaborative architecture in multi-stage planning, future-state anticipation, • We establish a brain–cerebellum collaborative architecture within the unified model. The VLM and

2026-07-07视觉感知

面向长程机器人操作中语义理解、世界动态预测与动作生成割裂的问题,论文提出 iFLYTEK-Embodied-Omni,将 VLM、视频生成模型和动作生成模型以共享多模态自注意力连接成“脑—小脑”架构,并用多源数据与四阶段训练对齐。其在 zero-shot LIBERO-Plus 达到 89.6% 成功率,在 RoboTwin 2.0 Clean/Rand 达到 93.68%/93.16%,但部分增益可能主要来自 scaling / data。

MedMambaLite: Hardware-Aware Mamba for Medical Image Classification Figure 1
2026-07-07eess.IV

MedMambaLite: Hardware-Aware Mamba for Medical Image Classification

Romina Aalishah, Mozhgan Navardi, Tinoosh Mohsenin

Department of Electrical and Computer Engineering, Johns Hopkins University, Baltimore, MD, USA

2026-07-07视觉感知

面向边缘医疗设备实时图像分类的算力、内存与能耗约束,MedMambaLite从MedMamba出发重构轻量Mamba结构:用Lite-Conv-SSM分支同时建模局部与长程特征,并在LiteSS2D中共享多方向扫描参数,再通过知识蒸馏压缩学生模型。实验称其在10个MedMNIST数据集达94.5%总体准确率,参数较MedMamba减少22.8倍,在Jetson Orin Nano上达到35.6 GOPS/J、能效提升63%。

2026-07-03

155 篇
WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory Figure 1
2026-07-03cs.CV

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

2026-07-03强化学习规划控制

WorldDirector针对现有视频世界模型在物体离开视野后易冻结、消失或身份漂移的问题,将动态物体运动规划与像素生成解耦:由LLM编排3D物体与相机轨迹,再投影为2D条件,并结合外观绑定与空间注意力维持身份一致。实验显示其能生成更长、更可控的多实体动态场景,并在长时间遮挡后保持物体位置演化和外观稳定。

Alignment Is All You Need For X-to-4D Generation Figure 1
2026-07-03cs.CV

Alignment Is All You Need For X-to-4D Generation

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

2026-07-03视觉感知

针对现有4D生成多依赖单一输入、难以同时保证运动真实与几何一致的问题,论文提出Align4D,将任意模态输入先转为视频-3D对,再通过对象距离对齐、运动-几何联合对齐和异步优化来统一视频运动先验与3D结构先验。实验在X4D与Consistent4D上显示其生成质量和一致性优于对比方法,但效果部分依赖预训练视频与3D生成模型。

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation Figure 1
2026-07-03cs.CV

PointDiT: Pixel-Space Diffusion for Monocular Geometry Estimation

Haofei Xu, Rundi Wu, Philipp Henzler, Nikolai Kalischek, Michael Oechsle, Fabian Manhardt, Marc Pollefeys, Andreas Geiger, Federico Tombari, Michael Niemeyer

2026-07-03生成模型

本文针对单目点图估计中确定性回归易过平滑、潜空间扩散受 VAE 压缩损失限制的问题,提出直接在原始 3D point map 像素空间训练的 PointDiT:用朴素 ViT 做扩散骨干,并以 DINOv3 图像 token 条件化,采用 x-prediction 避免点图 tokenizer。实验显示其在保持结构更简单的同时优于潜空间扩散和复杂混合回归模型,尤其能恢复更锐利的几何边界、细薄结构,并在透明物体等歧义区域更稳健。

From SRA to Self-Flow: Data Augmentation or Self-Supervision? Figure 1
2026-07-03cs.CV

From SRA to Self-Flow: Data Augmentation or Self-Supervision?

Dengyang Jiang, Mengmeng Wang, Harry Yang, Jingdong Wang

The Hong Kong University of Science and Technology, Zhejiang University of Technology, Baidu Inc.

2026-07-03视觉感知生成模型

本文针对 SRA 到 Self-Flow 的性能提升机制展开质疑:增益是否真来自不同噪声 token 间的自监督交互并不清楚。作者提出 Attention Separation,在保留双时间步输入的同时阻断跨噪声注意力,发现性能不降反升,说明提升可能主要来自噪声维度的数据增强;结合双时间步与注意力分离后,在 ImageNet 256/512 生成上优于多数自对齐基线,并接近或匹敌外部编码器对齐方法。

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas Figure 1
2026-07-03cs.CL

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

2026-07-03视觉感知

长篇电视剧中说话人识别常受角色众多、短句声纹不稳、离屏发声和称谓关系影响,论文据此构建含532K对白的DramaSR-532K,并将任务从单纯声纹匹配扩展为融合语音、画面描述和人物关系的推理式归因。DramaSR-LRM用工具调用和SFT/RL细化标签,在11部剧上将基线准确率由85.49%提升至87.79%,极短对白增益达9.20%,但部分收益可能也来自数据与工具链规模。

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots Figure 1
2026-07-03cs.RO

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Ling Xu, Chuyu Han, Borui Li, Hao Wu, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

Southeast University, Nanjing University, Institute for AI Industry Research (AIR), Tsinghua University

2026-07-03机器人

这篇论文针对具身模型落地时依赖模型专属 Python 栈、后端假设和机器人胶水代码的问题,提出 C++ 推理运行时 Embodied.cpp,洞察是 VLA 与 WAM 可抽象为共享执行路径,并将差异收敛到可插拔头部、预测模块和 I/O 适配。系统支持多速率闭环执行、面向 batch-1 低延迟的融合推理及异构后端抽象;在 HY-VLA、pi0.5 上分别达到 100.0% 和 91.0% 任务成功率,WAM 块内存从 312.2 MiB 降至 88.1 MiB。

Seek to Segment: Active Perception for Panoramic Referring Segmentation Figure 1
2026-07-03cs.CV

Seek to Segment: Active Perception for Panoramic Referring Segmentation

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

Fudan University, China

2026-07-03视觉感知

这篇论文针对现有指代表达分割只能处理固定视角图像、难以服务具身智能在360度环境中主动找物的问题,提出APRS任务与基准,并设计带EgoSphere空间视觉记忆的PanoSeeker,使VLM能整合连续局部观测、规划非冗余搜索并在发现目标后对齐视角完成分割。作者还构建专家轨迹数据并用SFT与RL优化探索效率;实验显示其在新基准上搜索效率和分割精度均优于改造后的现有方法。

Towards Robustness against Typographic Attack with Training-free Concept Localization Figure 1
2026-07-03cs.CV

Towards Robustness against Typographic Attack with Training-free Concept Localization

Bohan Liu, Wenqian Ye, Guangzhi Xiong, Zhenghao He, Sanchit Sinha, Aidong Zhang

2026-07-03安全鲁棒

针对CLIP/LVLM视觉编码器容易被图像中文字误导的Typographic Attack问题,论文提出无需训练的概念定位方法:在ViT多头注意力子空间中随机采样概念方向,并用梯度归因排序找出偏向词义的“有害电路”。随后通过测试时注意力重加权或消融这些电路提升鲁棒性;实验显示其在CLIP目标分类和RIO-Bench上多种LVLM的受干扰VQA中优于既有监督与免训练防御。

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning Figure 1
2026-07-03cs.CL

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

Liyan Tang, Fangcong Yin, Greg Durrett

♠ The University of Texas at Austin ♢ New York University

2026-07-03视觉语言视觉感知强化学习

这篇论文针对视觉语言模型在自我反思时常忽视视觉证据、难以在分布外图像中纠错的问题,提出 VRRL 强化学习框架:通过随机遮蔽轨迹前缀和从失败经验缓冲区 roll-in,专门训练模型从错误中基于视觉反馈恢复。实验覆盖表格/图表视觉定位与空间导航,显示其相较零样本、SFT、标准 RL 和反思微调基线显著提升 OOD 准确率。

GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training Figure 1
2026-07-03cs.CV

GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training

Yejun Zhang, Xinjue Wang, Zihan Wang, Esa Rahtu, Juho Kannala

2026-07-03视觉感知

GeoMix针对无描述子视觉定位虽省存储、利隐私和地图维护却精度不足的问题,指出瓶颈在几何匹配判别性不够。方法用方向/距离嵌入强化局部几何,以可学习全局上下文节点缓解重复结构歧义,并利用无描述子空间的探测器无关性做多探测器 Mix-Training。实验在四个基准上刷新无描述子方法,75分位旋转误差降89%、平移误差最高降90%,但与描述子方法仍有差距。

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning Figure 1
2026-07-03cs.CV

Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning

Xuehui Wang, Xuankun Yang, Wei Shen

Shanghai Jiao Tong University, Shanghai, China, Codes: https://github.com/SJTU-DeepVisionLab/EADP

2026-07-03视觉感知

这篇论文针对VLM在高分辨率视觉输入下视觉token过多、剪枝易丢失细粒度线索的问题,指出瓶颈来自文本噪声的分散相似度和Top-K选择的局部冗余。EADP用熵过滤高噪声文本token,并将选择建模为带空间先验的子模优化,以获得更完整的视觉覆盖;实验称在严格token预算下提升准确率-效率权衡,并在多模态基准上达到SoTA。

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$ Figure 1
2026-07-03cs.CV

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

Zhejiang University, Central China Normal University

2026-07-03视觉感知

这篇论文针对全景主动视觉搜索中 MLLM 难以处理极区畸变、边界连续性和局部视角初始化导致的短视探索问题,提出 EAGLE-360 的全局到局部框架:先利用完整 360° 场景估计目标方位,再通过投影工具迭代收缩视野,并用 RoPE Rolling 建模环绕拓扑。作者还构建 1.4 万张 4K 全景和多轮 CoT 数据,结合 SFT 与 GRPO 训练;实验显示其在自建基准上准确率达 64.44%,较基座模型近 8 倍提升,并在 H*Bench 上有较好零样本迁移。

Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment Figure 1
2026-07-03cs.CV

Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment

Ziyao Wang, Maonan Wang, Yucheng He, Xianping Ma, Ziyi Wang, Hongyang Zhang, Yirong Cheng, Man-on Pun

2026-07-03生成模型

这篇论文针对遥感去云方法偏重视觉逼真、却可能破坏下游语义解释的问题,提出 GACR:用以含云观测为锚点的残差流替代纯噪声生成起点,并借助 VFM 语义先验约束地理上下文一致性。实验覆盖 6 个去云数据集和 12 个下游任务,报告最高约 3.3 dB PSNR、3.1 mIoU 提升及约 5 倍更快收敛,但具体增益中 VFM 与数据构造贡献仍需进一步拆分说明。

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers Figure 1
2026-07-03cs.CV

OrbitQuant: Data-Agnostic Quantization for Image and Video Diffusion Transformers

Donghyun Lee, Jitesh Chavan, Duy Nguyen, Sam Huang, Liming Jiang, Priyadarshini Panda, Timo Mertens, Saurabh Shukla

Cantina Labs, 2 University of Southern California, 3 University of Illinois Urbana-Champaign, Work done during an internship at Cantina Labs.

2026-07-03视觉感知生成模型

本文针对扩散 Transformer 推理中多步采样昂贵、激活随时间步和提示漂移导致 PTQ 需反复校准的问题,提出 OrbitQuant:用随机置换块 Hadamard 旋转把归一化权重与激活映射到固定边际分布,并用共享 Lloyd–Max 码本完成无数据量化。该方法在 FLUX.1、Z-Image-Turbo、Wan 2.1、CogVideoX 上低比特 PTQ 达到领先结果,且在 W2A4 下仍保持可用生成质量。

MARVEL: Margin-Aware Robust von Mises-Fischer Expert Learning for Long-Tailed Out-of-Distribution Detection Figure 1
2026-07-03cs.CV

MARVEL: Margin-Aware Robust von Mises-Fischer Expert Learning for Long-Tailed Out-of-Distribution Detection

A.S. Anudeep, Vaanathi Sundaresan

2026-07-03视觉感知安全鲁棒

面向医疗影像中长尾类别与未知分布样本并存的安全诊断问题,MARVEL认为尾类易与OOD混淆,提出非线性vMF分类器、按头/均衡/尾先验分工的margin-aware多专家,以及显式区分ID/OOD的异常专家。在RFMiD、ISIC2019和NCTCRC上,平均FPR95较强基线分别降低8.45%、13.02%和36.90%,并通过消融支持各模块贡献。

Self-Auditing Residual Drifting for Pathology-Preserving Accelerated Knee MRI Figure 1
2026-07-03eess.IV

Self-Auditing Residual Drifting for Pathology-Preserving Accelerated Knee MRI

Qing Lyu, Jianxu Wang, Mohammad Kawas, Ge Wang, Christopher T. Whitlow

the Department of Biomedical Engineering, Rensselaer Polytechnic Institute, Troy, NY

2026-07-03视觉感知

针对加速膝关节 MRI 重建易模糊小病灶、全局指标难发现失败的问题,本文提出 SA-RDM-DC,将残差生成漂移、双域残差校正、硬 k-space 数据一致性与自审计误差/风险预测结合。实验在 fastMRI 多加速率上取得最高 SSIM、亚秒级推理,并在病灶区域保真和半月板预测稳定性上优于多类基线;跨协议 SKM-TEA 中审计信号仅部分迁移,仍需重新校准。

Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs Figure 1
2026-07-03cs.CV

Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs

Francesca Pistilli, Simone Alberto Peirone, Giuseppe Averta

2026-07-03视觉感知

论文针对第一视角视频中动作如何改变环境难以被隐式视觉特征解释的问题,主张用可编辑的时空场景图显式建模人—物关系演化。其核心贡献是构建 SG-Ego 标注集,提出 GLEN 进行图—语言对齐与动作条件图编辑预测,并定义 A-GEF 任务。实验显示该表示在 EgoMCQ、EgoCVR 等检索任务接近或优于视频基线,在 EXPLORE-Bench 和 A-GEF 等推理任务表现突出,但具体增益中数据标注规模的贡献仍需区分。

Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing Figure 1
2026-07-03cs.CV

Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing

Anqi Tang, Wenhao Sun, Zhaoqiang Liu

2026-07-03视觉感知

本文针对 FlowEdit 等无反演图像编辑在高噪声早期容易被流形寻优主导、全局颜色/属性变化不足的问题,提出同点语义探测并用 Haar 小波只提取低频语义补偿,在早期增强目标提示方向、抑制高频扰动。实验称其在定量指标、用户研究和频域分析中提升全局编辑一致性,同时较好保持背景结构。

LIME: Learning Intent-aware Camera Motion from Egocentric Video Figure 1
2026-07-03cs.RO

LIME: Learning Intent-aware Camera Motion from Egocentric Video

Boyang Sun, Jiajie Li, Yung-Hsu Yang, Chenyangguang Zhang, Tim Engelbracht, Sunghwan Hong, Cesar Cadena, Marc Pollefeys, Hermann Blum

University of Bonn

2026-07-03视觉感知

这篇论文针对机器人在操作或问答前常需先调整视角、但现有 VLN/VLA 多把相机运动附属于导航或执行的问题,提出将语言条件相机运动作为独立能力。LIME 从人类第一视角视频中挖掘意图、观测增益描述与相对 SE(3) 位姿监督,用 VLM 生成观测增益并以 flow-matching 预测多模态目标视角。在视角预测、下游具身任务和 Spot 实机中,模型优于多类基线并能支持遮挡揭示、目标接近和视角切换。

Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments Figure 1
2026-07-03cs.AI

Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments

Xianhui Meng, Zirui Song, Yuchen Zhang, Li Zhang, Yongxuan Lv, Xiuying Chen, Kun Wang, Yan Luo, Kai Chen, Hangjun Ye, Long Chen, Jun Liu, Xiaoshuai Hao

2026-07-03三维

本文针对现有文本驱动3D室内生成过度依赖曼哈顿假设、难以处理斜墙与不规则边界导致碰撞和语义布局失配的问题,提出SPG-Layout:用物体-边界、物体-物体统计空间先验作为强化学习奖励,并采用先放大件家具的层次化布局策略。作者还构建500个非曼哈顿场景基准,实验显示其在曼哈顿与非曼哈顿环境中均优于现有方法,主要提升体现在物理可行性和布局一致性。

Object-centric LeJEPA Figure 1
2026-07-03cs.CV

Object-centric LeJEPA

Jakob Geusen, Ender Konukoglu

2026-07-03视觉感知

这篇论文针对图像级自监督预训练数据需求大、随机裁剪会混淆不同物体的问题,提出用训练时的廉价 SAM 掩码把 LeJEPA 从整图对齐改为物体级对齐,并加入同图物体互为负样本的实例分离损失。实验显示,在 COCO 10–100% 数据和两种模型规模下,Object-centric LeJEPA 在 DAVIS 跟踪、ImageNet 分类、ADE20k 分割和 NAVI 重识别上优于图像级 LeJEPA,且约用 10% 数据达到其全量表现。

ACID: Action Consistency via Inverse Dynamics for Planning with World Models Figure 1
2026-07-03cs.RO

ACID: Action Consistency via Inverse Dynamics for Planning with World Models

Gawon Seo, Dongwon Kim, Suha Kwak

2026-07-03强化学习规划控制

本文针对动作条件世界模型在决策时规划中只看终点相似度、忽略中间转移是否可由候选动作真实实现的问题,提出 ACID:用逆动力学模型反推每步预测转移对应动作,并将其与原动作的循环一致性残差加入规划代价。该方法不改动世界模型,作为决策时验证器适配多类模型;在四种世界模型和六个操控、导航任务上稳定提升规划效果,并以更少规划计算达到基线精度。

Show Me Examples: Inferring Visual Concepts from Image Sets Figure 1
2026-07-03cs.CV

Show Me Examples: Inferring Visual Concepts from Image Sets

Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Angel Bautista, Josh Susskind, Björn Ommer

2026-07-03视觉感知

本文关注现有视觉语言模型虽能执行文本指令,却难以仅凭一组图像样例推断共同视觉概念的问题。作者提出 VICIS 任务,并用 ImageNet/WordNet 等弱监督分组构造训练样本,学习从上下文图像集抽取概念并约束查询图像生成。实验显示该模型在合成与真实层级数据上比通用 VLM 和任务基线更准确、多样,并能泛化到未见类别和草图模态。

Transformer Geometry Observatory TGO-II: Representational Similarity Observatory Figure 1
2026-07-03cs.CV

Transformer Geometry Observatory TGO-II: Representational Similarity Observatory

Kaustubh Kapil, Kishor P. Upla

2026-07-03视觉感知

这篇论文针对ViT训练过程中内部表征几何如何演化这一少被直接刻画的问题,提出TGO-II观测框架,用CKA、SVCCA、TwoNN-ID和token协方差分析层间相似性、流形复杂度与token耦合。结果显示训练中层间表征相似性下降、内在维度先升后稳,但token间强耦合持续存在,说明复杂度增长更可能来自高耦合token系统上的更丰富变换,而非逐步token独立。

Representation Distribution Matching for One-Step Visual Generation Figure 1
2026-07-03cs.CV

Representation Distribution Matching for One-Step Visual Generation

Lan Feng, Wuyang Li, Eloi Zablocki, Matthieu Cord, Alexandre Alahi

2026-07-03视觉感知

这篇论文针对一步图像生成质量不足、依赖教师或多步采样的问题,将其统一为冻结编码器特征空间中的表示分布匹配。核心洞察是MMD并非无效,而是需要全数据Nyström参考、大批量生成样本、联合图文匹配,并用多编码器约束避免单一表示被“刷分”。所得iRDM在ImageNet一步生成上达到SWr14 1.30,并将四步FLUX.2后训练为一步模型,在GenEval和PickScore上反超原四步版本。

Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis Figure 1
2026-07-03cs.CV

Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis

Federico Lincetto, Gianluca Agresti, Mattia Rossi, Piergiorgio Sartor, Pietro Zanuttigh

MEDIA Lab, University of Padova, Padova, Italy

2026-07-03视觉语言

这篇论文针对多光谱、近红外和偏振新视角合成依赖昂贵传感器与逐场景标定采集的问题,提出 SPoILeR:先在多场景多模态数据上学习共享潜空间和各模态解码器,再用仅 RGB 或少量模态的新场景微调来补全缺失辐射信息,并用专门正则保持跨模态知识。实验表明,即使目标场景没有对应传感器输入,也能生成多视角一致的红外、偏振和多光谱结果。

VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval Figure 1
2026-07-03cs.CV

VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval

Cristian-Gabriel Florea, Stelian Spînu

International Student Conference, Military Technical Academy, Bucharest, Romania.The source code and documentation are publicly available at

2026-07-03视觉语言视觉感知

VisionAId面向视障用户在避障、找个人物品、认人和识别现金时对联网服务或专用硬件的依赖,提出离线优先的安卓多模态助手。其核心是将深度估计、分割、视觉/人脸嵌入和纸币检测等模型本地化,并用少样本流程学习用户私人物品,再结合AR、空间音频和触觉引导检索。实验显示,深度模型INT8量化后延迟由约1200 ms降至491 ms,罗马尼亚纸币检测mAP@50达0.986,3米内深度校准误差低于1 cm。

GAP-GDRNet: Geometry-Aware Monocular Visual Pose Sensing on a Single-Target Synthetic Spacecraft Dataset Figure 1
2026-07-03cs.CV

GAP-GDRNet: Geometry-Aware Monocular Visual Pose Sensing on a Single-Target Synthetic Spacecraft Dataset

Yonglong Zhang, Yang Liu

2026-07-03数据集/基准三维

这篇论文面向非合作航天器单目6D位姿估计中弱纹理、细长结构、光照变化和遮挡导致几何证据稀疏的问题,在GDR-Net框架中加入AFR以同时强化全局结构与局部轮廓/弱纹理线索,并在Patch-PnP中加入PGSA建模几何patch关系。其单目标合成航天器数据集由Blender生成密集监督;结果显示旋转误差1.96°、平移误差0.0165 m、ADD@0.02 m为95.16%,较复现GDR-Net提升3.88个百分点,推理约35.97 FPS,但真实航天器泛化未充分说明。

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection Figure 1
2026-07-03cs.RO

The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection

Jincheng Tang, Yilong Zhu, Zhengyuan Xie, Jiang-Jiang Liu, Jiaxing Zhang

2026-07-03学习理论

本文针对VLA机器人策略在相机姿态或物体布局轻微变化下易失效的问题,指出关键不是视角数量不足,而是模型学到相机-基座、相机-物体和物体位置的捷径相关。作者用双臂系统让一臂充当移动环境相机,比较固定、多固定和连续移动视角,并提出静态多视角与动态视角混合的数据采集策略。实验显示该策略比单纯增加静态视角更能提升未见相机位姿和物体配置下的泛化,且对ACT、Diffusion、Pi0、Gr00t等模型均有效。

NEvo: Neural-Guided Evolutionary Video Synthesis for Dynamic Visual Selectivity Figure 1
2026-07-03cs.CV

NEvo: Neural-Guided Evolutionary Video Synthesis for Dynamic Visual Selectivity

Yingtian Tang, Sogand Salehi, Ming Zhou, Amir Zamir, Leyla Isik, Martin Schrimpf

Johns Hopkins University

2026-07-03视觉感知

这篇论文针对以往脑编码与最优刺激合成多停留在静态图像、难以解释动态视觉选择性的问题,提出 NEvo:用动态脑编码模型评估视频对目标皮层 ROI 的预测激活,并在可解释的语义、运动和事件提示空间中做进化搜索。结果显示,合成视频在腹侧、背侧和外侧视觉通路中超过手工 localizer 与检索基线,恢复已知选择性,并揭示外侧通路从运动到社会互动特征的复杂度梯度。

InvSplat: Inverse Feed-Forward Scene Splatting Figure 1
2026-07-03cs.CV

InvSplat: Inverse Feed-Forward Scene Splatting

Polina Karpikova, Wenjing Bian, Haofei Xu, Hendrik Lensch, Andreas Geiger

2026-07-03视觉感知

InvSplat针对逆渲染中优化法逐场景拟合昂贵、2D前馈/扩散方法多视角不一致且难以稳定新视角渲染的问题,提出从有位姿多视图一次前向预测带法线、透明度、反照率、金属度和粗糙度的3D高斯表示,将材质估计先验并入3D重建骨干。实验显示其在合成与真实数据上提升多视角一致性、材质恢复和新视角渲染稳定性,并支持基于物理的重光照。

Search-based Testing of Vision Language Models for In-Car Scene Understanding Figure 1
2026-07-03cs.CV

Search-based Testing of Vision Language Models for In-Car Scene Understanding

Lev Sorokin, Chen Yang, Ken E. Friedl, Andrea Stocco

BMW Group, Technical University of Munich, Technical University of Munich, Technical University of Munich, fortiss GmbH, BMW Group, Technical University of Munich Munich Germany, Technical University of Munich Munich Germany, Technical University of Munich, fortiss GmbH Munich Germany

2026-07-03视觉感知

面向座舱监控中VLM可能误判驾驶员状态、物体与安全事件且真实数据难获取的问题,本文提出ISU-Test:用可控渲染参数化人物、物体、座椅安全带和光照,并以搜索优化主动寻找失败场景,同时为VQA和开放式caption设计适配的fitness与oracle。实验覆盖工业原型和开源VLM,相比随机生成最高带来10倍失败率、3.6倍失败覆盖提升。

Dual-Selective Network for Domain-Incremental Change Detection Figure 1
2026-07-03cs.CV

Dual-Selective Network for Domain-Incremental Change Detection

Yuzhi He, Junxi Huang, Haorui Wu, Jiahui Qu

2026-07-03视觉感知

本文针对域增量变化检测中“标签空间固定、地理域持续漂移”导致的灾难性遗忘与空间表征混淆,提出基于视觉状态空间模型的 DSINet:用选择性空间状态单元过滤域特有噪声、保留通用变化结构,并以浓度平衡蒸馏稳定跨域知识迁移。实验称其在长域序列上能更好保留历史知识、保持边界清晰,同时维持线性计算效率。

Real-Time Visual Intelligence on Low-Cost UAVs: A Modular Approach for Tracking, Scanning, and Navigation Figure 1
2026-07-03cs.RO

Real-Time Visual Intelligence on Low-Cost UAVs: A Modular Approach for Tracking, Scanning, and Navigation

Andrei-Marian Ungureanu, Stelian Spînu

A. M. UNGUREANU is with the Military Technical Academy “Ferdinand, S. SPÎNU is with the Military Technical Academy “Ferdinand I”, AI models and tangible applications, offering a scalable, publicly available at the following GitHub repository:, keeping the person centered within the video frame, even as, center of the image. As shown in Fig. 1, when the detected, face is outside the center zone, this positional offset is used, Figure 1. Face outside the center zone

2026-07-03机器人视觉感知

面向低成本无人机在室内、GPS 受限等场景中难以实时感知与自主控制的问题,本文基于 DJI Tello 构建模块化视觉系统,将 YuNet 人脸检测、FaceNet 识别、单目深度估计与 PID 控制、网页监控界面集成。实验展示了跟随人物、室内扫描和虚拟传感器循线等功能可在受限硬件上运行,但量化对比与鲁棒性边界文中未充分说明。

Optimizing Visual Generative Models via Distribution-wise Rewards Figure 1
2026-07-03cs.LG

Optimizing Visual Generative Models via Distribution-wise Rewards

Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang

2026-07-03生成模型强化学习

本文针对视觉生成模型中样本级奖励易导致 reward hacking、模式坍塌和伪影的问题,提出用 FID 等分布级奖励进行强化学习微调,并用 subset-replace 降低估计成本、为 rollout 提供密集信号;同时将奖励用于搜索 post-hoc 模型合并系数以缓解 SDE 训练与 ODE 推理不一致。实验显示 SiT 的 FID-50K 从 8.30 降至 5.77,EDM2 从 3.74 降至 3.52,且定性结果表明画质提升同时保持多样性。

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing Figure 1
2026-07-03cs.CV

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

Zhaokai Wang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Yiguo He, Mohan Zhang, Leyao Gu, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Xuanhe Zhou, Zhihang Zhong, Junchi Yan, Xue Yang

2026-07-03数据集/基准

本文针对现有生成/编辑模型在公式、图表、分子结构等知识密集型学术视觉中易出现符号、结构和空间关系错误的问题,构建 DisciplineGen-1M:覆盖十个学科、含 120 万样本的生成与编辑数据集,并结合矢量渲染、OCR 编辑、程序合成和大规模过滤提供结构化监督。基于该数据训练的 Qwen 系模型在 GenExam、GRADE 上优于开源基线,并在 WISE、RISE 显示迁移收益,但增益可能主要来自 scaling / data。

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval Figure 1
2026-07-03cs.CV

FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval

Zhenqi He, Ziqi Jiang, Yuanpei Liu, Yanghao Wang, Teng Wang, Long Chen

2026-07-03视觉感知生成模型三维

针对零样本组合图像检索中,文本反演把参考图压缩成少量伪词、易丢失细粒度视觉语义且训练开销大的问题,FlowCIR将图文组合改写为VLM嵌入空间中的条件语义传输,用流匹配学习轻量速度场,把指令表示在参考图条件下推向目标查询嵌入;同时用推理期多负向引导缓解CLIP对否定/移除语义混淆。实验显示其在CIRR、CIRCO等基准上取得有竞争力或更强结果,并可约单卡一小时训练完成。

AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition Figure 1
2026-07-03cs.CV

AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition

Haiyang Li, Yuming Fu, Qun Song, Hongchao Liao, Jing Chen, Mounim A.EI-Yacoubi, Xin Jin

H. Liao is with the Guangzhou College of Applied Science and Technology, Guangzhou, Guangdong Province, China.

2026-07-03视觉感知数据集/基准

针对静脉识别小样本与成像变化下常直接套用自然图像增强、可能破坏血管拓扑的问题,AGVBench构建面向可靠性的增强基准,统一评测30种方法、5个掌/指静脉数据集和7类骨干,并纳入校准、腐蚀、对抗、遮挡与效率等维度。结果显示MixUp、PuzzleMix等多图混合通常提升识别性能,但校准差且对抗脆弱;强几何变换常损害性能,说明仅看准确率不足。

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models Figure 1
2026-07-03cs.CV

AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models

Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma

Keio University, Keio AI Research Center, Keio University School of Medicine

2026-07-03视觉语言视觉感知数据集/基准

这篇论文针对现有视频时空定位评测过度依赖日常场景零样本测试、难以反映专业领域部署的问题,提出 AnyGroundBench:覆盖动物、工业、体育、手术和公共安全五类场景,包含专门训练子集与高密度时空框标注,用于评估领域适应能力。对15个VLM的实验显示,当前模型在专业域零样本和ICL适应下均表现不足,主要瓶颈在空间定位,少样本示例对时序有时有益但对定位精度不稳定。

ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection Figure 1
2026-07-03cs.CV

ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection

Ningning Han, Lei Fan, Jia Guo, Yunkang Cao, Xiu Su, Feng Cao, Donglin Di, Tonghua Su

2026-07-03视觉感知

本文针对工业异常检测冷启动中正常样本覆盖不足、少量缺陷又易导致监督方法过拟合的问题,提出可插入重建式基线的 ArcAD。其关键做法是在超球面上用 Sinkhorn 原型建模压紧正常簇,并结合受原型约束的伪异常与真实缺陷进行对比校准,从而收紧正常边界。实验覆盖 MVTec-AD、VisA、Real-IAD 和 MANTA,在单类与多类冷启动设置下均优于多种监督和无监督基线。

When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression Figure 1
2026-07-03cs.CV

When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression

Tien-Phat Nguyen, Ngai-Man Cheung

2026-07-03视觉感知安全鲁棒

这篇论文关注 ViT 语义分割在高压缩部署时的可靠性问题,指出仅看低中等压缩和干净精度会掩盖鲁棒性风险。作者在匹配 FLOPs 下统一比较 token 压缩与结构剪枝,并纳入 ADE20K/Cityscapes 及腐蚀版本;结果显示 token 压缩轻度有效但高压缩下精度和鲁棒性急剧下降,结构剪枝退化更平滑,适度剪枝后再合并 token 可在高压缩预算下取得更好的精度-鲁棒性折中。

Efficient Waste Sorting for Circular Economy: A Confidence-guided comparison between One-Vs-All and One-Vs-Rest Classification Strategies with Human-in-the-Loop for Automated Waste Sorting Figure 1
2026-07-03cs.CV

Efficient Waste Sorting for Circular Economy: A Confidence-guided comparison between One-Vs-All and One-Vs-Rest Classification Strategies with Human-in-the-Loop for Automated Waste Sorting

Mohammed Fahad Ali, Dominique Briechle, Marit Briechle-Mathiszig, Tobias Geger, Andreas Rausch

2026-07-03视觉感知

论文面向德国市政垃圾分类规则差异大、居民易误投的问题,比较可配置废弃物识别中 OvA 与 OvR 两种分类策略,并用置信度阈值把不确定样本交给人工复核。结果显示 OvA 总体准确率略高、少错 5 张图,但 OvR 更能定位高风险样本:复核不足 10% 样本可覆盖 80% 以上误分类,体现其在人机协同和规则适配上的实用价值。

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation Figure 1
2026-07-03cs.CV

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

AIM for Health Lab, Monash University

2026-07-03视觉感知

这篇论文针对电商服装中用户想查看领口、袖口、面料纹理等局部细节而现有生成/编辑方法缺少自由聚焦能力的问题,定义Fashion Detail Generation并构建FDBench。核心做法是用DINOv3视图桥接教师完成框选参考图与细节图的语义对齐,再蒸馏到MMDiT双分支,并用一致性奖励RL强化身份保持。实验显示DetailAnywhere在自动指标和人工评测上优于开源基线,接近专有模型,但跨品类泛化仍未充分说明。

MedSaab-US: A Backpropagation-Free Multi-Scale Wavelet-Saab Framework for Thyroid Nodule Segmentation in Ultrasound Images Figure 1
2026-07-03cs.CV

MedSaab-US: A Backpropagation-Free Multi-Scale Wavelet-Saab Framework for Thyroid Nodule Segmentation in Ultrasound Images

Mohammad Amanour Rahman

2026-07-03视觉感知

本文针对深度模型在甲状腺超声结节分割中参数多、依赖 GPU 反向传播且可解释性弱的问题,提出 MedSaab-US:用多级小波分解结合多尺度 Saab 解析特征、LAG 选特征,再由 XGBoost 做像素分类。其价值在于提供一个无反传、轻量且 CPU 可运行的非深度学习基线;但在 TN3K 上 Dice 仅 0.4784,明显低于主流深度方法,主要结果更偏向部署友好与可解释探索,而非精度领先。

RadiomicNet: A Hybrid Radiomics-Guided Lightweight Architecture for Interpretable Medical Image Segmentation Figure 1
2026-07-03cs.CV

RadiomicNet: A Hybrid Radiomics-Guided Lightweight Architecture for Interpretable Medical Image Segmentation

Mohammad Amanour Rahman

2026-07-03视觉感知

这篇论文针对医学图像分割中模型庞大、决策难解释和校准不足的问题,提出 RadiomicNet:用 MobileNetV2 编解码器结合手工放射组学特征,并通过 RAG 将 GLCM、LBP 等纹理线索注入跳连注意力,同时用一致性损失约束纹理复杂度与不确定性。实验在 BUSI 和 Kvasir-SEG 上分别达到 0.763、0.854 DSC,较 U-KAN 小幅提升且仅 3.27M 参数,但增益幅度不大,仍需关注数据划分与实现细节。

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs Figure 1
2026-07-03cs.CV

Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs

Altay Toktassyn, Jurn-Gyu Park

A. Toktassyn and J. G. Park are with the Department of Computer Science, Nazarbayev University, Astana 010000, Kazakhstan

2026-07-03视觉语言视觉感知

面向2–8GB显存消费级GPU/边缘设备上视觉模型微调易OOM且能耗受限的问题,本文系统比较ViT/TinyViT与Vim/MambaVision上的Full FT、LoRA、AdaLoRA、QLoRA、BitFit,并提出按运行时显存预算选择性重计算的自适应checkpointing及部署感知NetScore指标。结果显示QLoRA、BitFit以1–2%精度损失换来20–30%能耗下降,自适应checkpointing降峰值显存43–79%但增加9–30%能耗;DINOv2在CIFAR-100上以更低能耗超过微调模型,小型自回归VLM不具竞争力。

Patient-Specific Articulated Digital Twins from a Single Full-Body CT Scan Figure 1
2026-07-03cs.CV

Patient-Specific Articulated Digital Twins from a Single Full-Body CT Scan

Han Zhang, Boyang Zhao, Mathias Unberath

2026-07-03视觉感知

针对单次 CT 重建只能保持扫描姿态、难以模拟患者重新摆位后 X 光外观的问题,本文将 SMPL 作为运动学骨架,绑定 CT 分割出的骨骼和器官,构建可关节化的个体数字孪生。三例全身 CT 上,骨架拟合 Chamfer 距离为 15.8±4.0 mm,骨骼包围率约 95.9%,重组 DRR 的 SSIM 为 0.872,未见姿态下仍保持约 94.4% 骨骼包围率,但验证规模较小且软组织变形建模有限。

SAMoR: Motion Modelling for Articulated Objects of Any Skeleton and Topology Figure 1
2026-07-03cs.CV

SAMoR: Motion Modelling for Articulated Objects of Any Skeleton and Topology

Yuhao Zhang, Gerard Pons-Moll, Tolga Birdal

Imperial College London, University of Tübingen, Tübingen AI Center

2026-07-03视觉感知

针对现有运动生成多绑定固定人体骨架、难以在不同关节数和拓扑间共享表示的问题,SAMoR将跨物种/角色的对应关系提升到“功能关节组”层面,用图Transformer融合关节运动、骨架结构和关节名,并压缩为8个共享部件token及离散码本。注意力监督和关节名dropout缓解查询坍缩与标签依赖。实验显示其在未见骨架跨拓扑重建上达到2.75×10^-2 normalized MPJPE,较最强可变关节tokenizer低5.8倍,并支持运动迁移、文本生成和局部编辑。

Predicting Early Stages Of Alzheimer's Disease And Identifying Key Biomarkers Using Deep Artificial Neural Network And Ensemble Of Machine Learning Methodologies Figure 1
2026-07-03cs.LG

Predicting Early Stages Of Alzheimer's Disease And Identifying Key Biomarkers Using Deep Artificial Neural Network And Ensemble Of Machine Learning Methodologies

Debopriya Ghosh

dementia. At present, no drugs are available to prevent this disease, but some symptom-delaying, drugs are available that can slow the disease's progression to some extent. Therefore, an

2026-07-03强化学习

这项研究面向阿尔茨海默病早期症状易被误判、干预窗口有限的问题,使用ADNI临床、神经心理与影像指标构建自动分期诊断流程。其核心在于将迭代缺失值填补、SVM-SMOTE类平衡、多种特征选择与Stacking集成及ANN对比结合,同时尝试提取关键生物标志物。文中说明以precision、recall、F1和AUC-ROC比较模型,但具体最优数值与增益来源未充分说明,可能主要来自预处理、特征筛选和数据划分。

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting Figure 1
2026-07-03cs.CV

AdaCount: Training-Free Similarity-Guided Spatial and Feature Adaptation for Zero-Shot Object Counting

Muhammad Ibraheem Siddiqui, Muhammad Haris Khan

Mohamed Bin Zayed University of Artificial Intelligence

2026-07-03视觉感知

AdaCount针对SAM3在密集小目标零样本计数中因分辨率不足和目标区域关注不够而漏检的问题,提出无需训练的相似度引导适配:先用原型相似图定位目标相关区域,再同时进行空间扭曲以重分配图像分辨率、特征调制以增强目标表征。相比依赖多次分块推理的SAM3Count,它仅需两次SAM3推理,并在六个计数基准上达到训练自由ZOC方法的新SOTA。

AbsoluteDegradation: A Physics-Inspired Synthetic Film-Degradation Pipeline and Archival Film Restoration Benchmark Figure 1
2026-07-03cs.CV

AbsoluteDegradation: A Physics-Inspired Synthetic Film-Degradation Pipeline and Archival Film Restoration Benchmark

Mikołaj Jastrzębski, Dawid Glinkowski, Dawid Zieliński, Daniel Borkowski, Wojciech Kozłowski, Kamil Adamczewski

Wrocław University of Science and Technology

2026-07-03数据集/基准

针对老电影修复缺少真实成对数据和统一评测的问题,论文提出 AbsoluteDegradation:按模拟胶片到数字化链路组合信号相关蓝噪声颗粒、参数化划痕、gate-weave 抖动等时序一致退化,并发布 81,576 帧真实档案胶片基准。实验显示,用该合成管线训练的多种模型在真实素材上泛化更好,同时基准揭示常用无参考指标会偏好过平滑或不真实的幻觉修复。

Population-Scale Segmentation of Penile Tissue in DIXON MRI using Deep Learning for Quantitative Phenotyping in Male Reproductive Health Figure 1
2026-07-03eess.IV

Population-Scale Segmentation of Penile Tissue in DIXON MRI using Deep Learning for Quantitative Phenotyping in Male Reproductive Health

Jan Ernsting, Gunnar Paul Kordes, Nils Johannaber, Lynn Ogoniak, Wolfgang Roll, Tim Hahn, Alexander Siegfried Busch, Benjamin Risse

University of Münster

2026-07-03视觉感知

针对传统阴茎长度/周径测量难以标准化且无法覆盖内部组织的问题,本文将多通道 DIXON MRI 中的全阴茎组织分割建模为可规模化表型提取任务,构建专家标注数据和双专家测试集并优化 3D nnU-Net。模型在独立测试集达到 Dice 0.92、Hausdorff 3.58,并部署到 34,412 名 UK Biobank 参与者,纵向复测相关 r=0.87。

X-Splat: Gaussian Splatting for 3D CBCT Generation from Single Panoramic Radiograph Figure 1
2026-07-03cs.CV

X-Splat: Gaussian Splatting for 3D CBCT Generation from Single Panoramic Radiograph

Tomasz Szczepański, Szymon Płotka, Michal K. Grzeszczyk, Tomasz Trzciński, Arkadiusz Sitek

Sano Centre for Computational Medicine, Poland, Jagiellonian University, Poland, Warsaw University of Technology, Poland, Research Institute IDEAS, Poland, Harvard Medical School, USA

2026-07-03三维

针对单张全景牙片生成3D CBCT高度欠定、易产生平滑或解剖幻觉的问题,X-Splat把已知全景成像射线作为几何脚手架,在射线路径上初始化可学习各向异性3D高斯,并用Beer–Lambert重投影、多视角DRR监督和轻量残差细化约束体生成。实验显示其优于NeRF和GAN基线,更好恢复牙根、皮质边界、牙槽结构及下颌管;但训练依赖合成PXR–CBCT配对,真实域泛化仍需进一步验证。

WBMM: Windowed Batch Matrix Multiplication for Efficient Large Receptive Field Convolution Figure 1
2026-07-03cs.CV

WBMM: Windowed Batch Matrix Multiplication for Efficient Large Receptive Field Convolution

Wan Song, Wei Zhou, Rui Wang, Jun Yu, Toru Kurihara, Jiajia Xu, Shu Zhan

2026-07-03视觉感知

这篇论文针对大核深度卷积随核尺寸增大而因离散 gather 访存变慢、且 LKA 在大特征图上失效的问题,提出 WBMM:把输入切成连续窗口,用相对位置表构造通道权重矩阵,再用批量矩阵乘法计算,从“遍历数据”转为“遍历参数”。结果显示其在 14×14 窗口下速度可超过 5×5 深度卷积且感受野更大,并在 ImageNet、COCO、ADE20K 上取得相近或更高精度与 1.31–1.88× 训练加速。

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension Figure 1
2026-07-03cs.CV

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

2026-07-03视觉感知数据集/基准

针对现有第一视角 Video REC 基准多为短片段、目标密集且交互简单,LongEgoRefer 用 Ego4D 长视频与 EgoTracks 标注构建平均 45 分钟、1498 条描述的长程指代表达基准,强调稀疏目标、复杂人-物交互和更细粒度语言消歧。实验显示滑窗式现有模型缺乏全局时序理解,两阶段 VLM+Grounded SAM2 又受时间定位误差传播限制,即使强闭源模型表现也仍有限。

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors Figure 1
2026-07-03cs.CV

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

School of Integrated Circuits, Wuxi Vocational College of Science and Technology, School of Advanced Technology, Xi’an Jiaotong-Liverpool University, Shanghai Gem Science and Technology Co., Ltd., Department of Oncology, Shanghai Medical College, Fudan University, Department of Medical Ultrasound, Fudan University Shanghai Cancer Center

2026-07-03视觉语言

针对乳腺纤维腺瘤与叶状肿瘤在B超中高度相似、术前易误判的问题,论文构建了含910例病理确认病例的FAPT-M多模态数据集,并融合超声图像、诊断文本和临床变量,通过临床条件调制与跨模态Transformer增强细粒度判别;五折验证达到77.64%准确率、73.38% F1和89.74% AUC,优于多类CNN、Transformer和视觉语言基线。

TCG-AR: Real-Time Multi-View Augmented Reality for Trading Card Game Streaming Figure 1
2026-07-03cs.CV

TCG-AR: Real-Time Multi-View Augmented Reality for Trading Card Game Streaming

Anthony Cioppa, Antoine Verdonck, Maxim Henry, Marc Van Droogenbroeck, Raphaël La Rocca

Equal contributions. Code: https://github.com/ULiege-VIULab/tcg-ar

2026-07-03视觉感知

面向线上集换式卡牌直播画面扁平、现有 AR 方案依赖芯片或专用桌面的痛点,TCG-AR 用普通 RGB 多视角相机完成卡牌检测、朝向估计、身份识别与跨视角注册,并用自动合成数据训练以减少人工标注。论文在真实宝可梦卡牌数据上评估 Sim2Real 与吞吐,显示检测和 ArcFace 识别可支撑实时增强直播,但自动配准、遮挡下时序跟踪和 2D 渲染仍是主要限制。

ESC: Emotional Self-Correction for Reliable Vision-Language Models Figure 1
2026-07-03cs.CV

ESC: Emotional Self-Correction for Reliable Vision-Language Models

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

2026-07-03视觉语言视觉感知

这篇论文针对视觉语言模型在幻觉、安全与多模态推理中易给出不可靠答案、而现有自纠错常需后训练或复杂反馈的问题,提出ESC:用外部验证器识别可疑初答,并在推理时注入情绪化反馈促使模型放慢、反思并修正。核心洞察是情绪可作为触发潜在自纠错能力的控制信号。实验显示ESC在安全、幻觉、视觉感知和推理基准上稳定提升可靠性,同时基本保持模型通用能力。

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction Figure 1
2026-07-03cs.CV

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

2026-07-03视觉感知

本文针对传统扫视路径模型依赖手工几何先验、难以灵活加入任务或个体条件的问题,将人眼注视坐标离散为自回归 token,用 LoRA 微调视觉语言模型生成扫描序列,并把信息增益与下一 token 似然直接对齐。结果显示 DeepGaze3.5-VL 在 MIT1003 达到 2.18 bits IG,较匹配骨干的 DeepGaze III 提升 46%,且可通过提示建模个体、任务和注视时长干预。

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control Figure 1
2026-07-03cs.CV

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

Tsinghua University, Chinese University of Hong Kong

2026-07-03视觉感知强化学习规划控制

HandsOnWorld针对第一视角视频生成中“手部可控但训练数据受限”的问题:精细3D手标注通常依赖多视角或动捕,导致方法局限在桌面/实验室场景。论文用单目重建从野外自我中心视频中筛出主角手轨迹,构建EgoVid-Pro,并提出Plücker Hand Map在世界坐标中同时表达相机与手表面射线,以解耦大幅头部运动和手部动作。实验显示其在重建保真度、控制精度和跨日常场景泛化上优于既有手控生成方法。

Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving Figure 1
2026-07-03cs.CV

Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving

Adwait Chandorkar, Kai Krink, Yerdana Maulenbay, Hasan Tercan, Tobias Meisen

2026-07-03视觉感知三维安全鲁棒

本文针对自动驾驶中 LiDAR 3D 检测“干净数据精度高但对抗鲁棒性未知”的问题,提出不只看 mAP 的综合评测框架,将点云密度、点云定位与误分类、框定位误差、距自车距离等因素分开分析。实验覆盖 nuScenes、Waymo、现代与传统检测器及多种 LiDAR 专用攻击,发现新一代模型并未显著摆脱脆弱性:高容量体素模型更易受结构化坐标扰动影响,非 anchor 检测头鲁棒性较差,说明现有架构改进主要提升常规精度而非安全鲁棒性。

Beyond the Performance Illusion: Structure-Aware Stratified Partitioning and Curriculum Distributionally Robust Optimization for Spatially Correlated Domains Figure 1
2026-07-03cs.LG

Beyond the Performance Illusion: Structure-Aware Stratified Partitioning and Curriculum Distributionally Robust Optimization for Spatially Correlated Domains

Prathamesh Patil, Arpit Jain, Aswanth Krishnan

QpiAI India Pvt. Ltd.

2026-07-03优化算法安全鲁棒

这篇论文针对空间/时间相关数据中随机划分会造成近重复样本泄漏、并掩盖少数子群失败的问题,提出将评测划分与训练联合处理:SASP在保持类别均衡的同时构造结构上更独立的验证集,CDRO再以课程式鲁棒优化稳定困难子群训练。实验称在航拍、农业和医学影像基准上可降低虚高性能、改善泛化与置信校准,但具体增益来源仍需结合实现细节判断。

Embracing Intra-Class Heterogeneity for Semi-Supervised Medical Image Segmentation: From Diversity to Precision Figure 1
2026-07-03cs.CV

Embracing Intra-Class Heterogeneity for Semi-Supervised Medical Image Segmentation: From Diversity to Precision

Yuqi Liu, Yufei Chen, Wei Fu, Xiaodong Yue, Shuo Li

2026-07-03视觉感知

针对半监督医学图像分割中标注稀缺且同一解剖结构存在强烈类内强度异质性的问题,论文提出 MPCL:用与强度分布对齐的多原型生成刻画亮/灰/暗等子区域,再通过原型空间优化和双分支知识对齐把异质性知识传给分割网络。三组异质性医学数据实验显示其优于现有方法,尤其在极少标注场景下更明显。

PWM-ArtGen: Part World Model for Articulated Object Generation Figure 1
2026-07-03cs.CV

PWM-ArtGen: Part World Model for Articulated Object Generation

Wentao Zheng, Ancong Wu

2026-07-03强化学习

本文面向单张静态图像难以可靠推断铰接物体运动结构的问题,指出视觉动态与关节参数应联合建模而非分步估计。PWM-ArtGen 将动作扩散与图像扩散耦合为部件世界模型,并用独立扩散步支持无标注视觉分支共训练,同时引入视觉动态正则和 19.7k photorealistic 图像对数据。实验称其在静止状态生成和零样本 OOD 物体上优于基线,但部分增益可能主要来自 data scaling。

Hierarchical Anti-Aesthetics: Protecting Facial Privacy against Customized Diffusion Models Figure 1
2026-07-03cs.CV

Hierarchical Anti-Aesthetics: Protecting Facial Privacy against Customized Diffusion Models

Songping Wang, Yueming Lyu, Shiqi Liu, Chen Zhao, Ziyuan Chen, Ning Li, Jing Dong, Caifeng Shan

2026-07-03生成模型

针对个性化扩散模型可被少量人脸图像恶意微调并生成深伪内容的问题,论文从“审美偏好”切入,提出 HAA:同时用全局反审美奖励降低整体生成质量、用局部反审美损失破坏脸部细节与身份线索。实验称其在多数据集和生成模型上比 Mist、ASPL、CAAT 等方法更能去除身份并减少隐私泄露。

ComplexMimic: Human-Scene Interaction Imitation in Complex 3D Environments Figure 1
2026-07-03cs.CV

ComplexMimic: Human-Scene Interaction Imitation in Complex 3D Environments

Lu Pan, Hongwei Zhao

2026-07-03模仿学习三维

这篇论文针对复杂三维场景中人形体模仿既要贴合 MoCap 轨迹又要避免碰撞的矛盾,指出早停阈值会形成可行性—忠实度权衡。ComplexMimic 先训练追踪专家与场景交互专家,再用难度感知蒸馏统一策略,按失败统计优先学习困难轨迹。在 TRUMANS、LINGO 和 GIMO 等数据集上,相比基线提升成功率并降低全局 MPJPE,显示复杂 HSI 下更好的泛化与物理可行性。

Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition Figure 1
2026-07-03cs.CV

Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition

Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu

-20 November 2025, Ahmadu Bello University, Zaria, Nigeria, department of Mechatronics, Bayero University Kano(BUK)., School of Computer Science and, department of Petroleum, Aliko Dangote University of, This paradigm is labor-intensive, time-consuming and also

2026-07-03视觉语言视觉感知

针对尼日利亚车牌识别中 YOLO+OCR 依赖标注、训练和多阶段部署且在低清晰度、遮挡、角度复杂场景下不稳的问题,论文将 VLM 作为零样本、一提示完成检测与字符读取的替代方案,在 88 张真实困难图像上比较五个模型。以 CER 衡量,Gemini 2.0 Flash Exp 与 Qwen2.5-VL-7B-Instruct 明显优于 GPT-4o、Claude 4 Sonnet 和 Llama 3.2 Vision 90B,但数据规模较小,泛化结论仍需谨慎。

Spatio-Temporal and Clinical Conditioning for Fine-Grained Radiology Report Retrieval Figure 1
2026-07-03cs.CV

Spatio-Temporal and Clinical Conditioning for Fine-Grained Radiology Report Retrieval

P. Sloan, E. Simpson, M. Mirmehdi

2026-07-03视觉感知

针对检索式放射报告生成依赖整份相似报告、缺少解剖定位、忽略既往影像和临床指征的问题,论文提出 STAR3:用检测器提取胸片解剖区域,在当前/既往检查的区域变化与临床指征条件下检索句子,并以半监督对比学习和解剖 dropout 约束检索空间。MIMIC-CXR 实验显示其在检索、NLP 与临床指标上优于现有检索基线,消融支持时空与临床条件化的贡献。

UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset Figure 1
2026-07-03cs.CV

UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset

Yi Wang, Fan Wang, Prabin Gyawali, Ziyang Xu, Anna Klimkowska, Yixiong Jing, Wanru Yang, Filip Biljecki, Christoph Holst, Benjamin Busam, Brian Sheil, Olaf Wysocki

2026-07-03视觉感知强化学习数据集/基准

面向语义数字孪生和城市三维理解,现有立面分割数据集地域窄、语义不统一且精度不足,限制跨域泛化评估。UnderOneFacade 提供跨洲厘米级三维立面点云、统一分层建筑语义与 27 亿标注点,并系统评测点、图和 Transformer 方法。结果显示细粒度 LoFG3 最佳仅约 33 mIoU,说明当前模型对长尾小构件和跨地区风格迁移仍明显不足,增益可能主要来自 scaling / data。

Mirror Illusion Art Figure 1
2026-07-03cs.CV

Mirror Illusion Art

Xiaopei Zhu, Zeyuan Li, Jun Zhu, Xiaolin Hu

Department of Computer Science and Technology, BNRist, Tsinghua University, Huazhong University of Science and Technology, IDG/McGovern Institute for Brain Research, Tsinghua University, Chinese Institute for Brain Research (CIBR)

2026-07-03视觉感知

这篇论文面向镜面错觉艺术的自动化设计:传统拓扑或阴影方法依赖人工、通常只优化形状,难以得到平滑且可打印的彩色物体。作者提出 AutoMIA,将正面与镜中两张目标图反求为同时含几何和纹理的 3D 对象,并用 PAC、PWA、IVP、SCD 分别抑制表面噪声、背景噪声、内部断裂和形色失衡。实验展示其能生成字母、汉字、图标等多类实物作品,单 RTX 3090 平均约 76 秒、2.6GB 内存完成设计。

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models Figure 1
2026-07-03cs.CL

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

Department of Classical Philology and Italian Studies, University of Bologna, Bologna, Italy, Villa i Tatti – The Harvard University Center for Italian Renaissance Studies, Firenze, Italy, Center for Computational and Digital Humanities, University of Copenhagen, Copenhagen, Denmark

2026-07-03数据集/基准

针对通用基准难以诊断单一学科能力、艺术史评测多依赖合成题的问题,EduArt构建了871道来自真实教学与AP考试的双语多格式题,评估12个多模态LLM。结果显示基准区分度较强,但多选题已接近饱和;开放补全、错误识别等生成/操作型题显著拉开差距,说明艺术史知识与可部署能力并不等同,要求解释还常使准确率下降。

A Stereo Visual SLAM System Using Object-Level Motion Estimation and Geometric Filtering Based on Cross Disparity Figure 1
2026-07-03cs.RO

A Stereo Visual SLAM System Using Object-Level Motion Estimation and Geometric Filtering Based on Cross Disparity

Sujan Kumar Dhali, Bhaskar Dasgupta

S. K. Dhali is with Department of Mechanical Engineering, Indian Institute of Technology Kanpur, Kanpur 208016, India

2026-07-03视觉感知

针对动态场景中传统视觉 SLAM 依赖静态世界假设、易受运动物体干扰的问题,论文提出基于 ORB-SLAM2 的 OCD SLAM:一方面用 SMOKE 3D 检测与卡尔曼跟踪做对象级运动分类,另一方面引入“交叉视差”从时序与双目不一致中筛除漏检的动态特征并加权静态点。KITTI Odometry 与 Raw 实验显示其轨迹精度优于 ORB-SLAM2 和多种动态 SLAM,消融表明交叉视差能补足仅靠目标检测的缺口。

Training-free Controllable Human Motion Generation under Heterogeneous Constraints Figure 1
2026-07-03cs.CV

Training-free Controllable Human Motion Generation under Heterogeneous Constraints

Xiaofei Hui, Bo Yan, Haoxuan Qu, Hossein Rahmani, Jun Liu

2026-07-03规划控制优化算法

本文针对现有免训练运动控制方法依赖可微目标、难以处理安全规则、仿真可行性等稀疏或黑盒约束的问题,提出 MIC,将扩散式人体运动生成视为随机控制过程,用统一的逐步控制律接入目标型与判据型约束,并通过反馈调节与控制分配协调多约束强弱和作用范围。实验显示其在多类异构约束场景下能提升约束满足度并保持运动自然性。

Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention Figure 1
2026-07-03cs.CV

Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention

Weichen Zhou, Yawen Zou, Chunzhi Gu, Ran Dong, Haoran Xie, Chao Zhang

2026-07-03视觉感知

本文关注自监督 ViT 虽具备单目几何能力却难解释其特征如何组织的问题,提出对收敛线性探针权重做 SVD 的受控子空间干预,用低秩任务子空间分析几何信号可读性。结果显示 DINOv2 将几何更集中地编码在线性可取的低秩方向,MAE 更分散且依赖更大空间上下文;几何精度在中层达到峰值,末层随语义抽象增强而下降。

Liquid Latent State Dynamics for Interpretable Turbofan Degradation Modeling Figure 1
2026-07-03cs.LG

Liquid Latent State Dynamics for Interpretable Turbofan Degradation Modeling

Weizhi Nie, Weijie Wang, Yuting Su

Tianjin University

2026-07-03视觉感知

针对涡扇发动机预测维护中传感器变化同时混合退化与工况、隐藏状态难解释的问题,论文将液态神经网络作为潜在动力学转移,并把状态拆成退化与工况两部分,用RUL、单调风险和去相关约束塑造可检查的健康轨迹。在C-MAPSS四个子集上,传感器预测RMSE由GRU的0.2438降至0.2266,多工况场景收益更明显,但直接RUL回归仍弱于GRU,说明其价值主要在可解释退化世界模型而非寿命标定。

Do Newer Lightweight CNNs Perform Better Under Resource Constraints? A Controlled Multigenerational Study of Architecture, Initialization, Training Budget, and Efficiency Figure 1
2026-07-03cs.LG

Do Newer Lightweight CNNs Perform Better Under Resource Constraints? A Controlled Multigenerational Study of Architecture, Initialization, Training Budget, and Efficiency

Tasnim Shahriar

2026-07-03规划控制优化算法

这篇论文关注轻量 CNN 在真实资源约束下是否“越新越好”,用统一下游训练、评估和延迟/内存测量比较九个跨代模型,并用 Pareto 前沿分析精度-资源权衡。结果显示新架构只带来选择性增益:EfficientNetV2-S 领先 CIFAR,RepViT-M1.0 领先 Tiny ImageNet,但 EfficientNet-B0 是最稳定的中等预算选择,严苛资源下 MobileNetV3-Small 反而优于 MobileNetV4-Conv-S。

Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment Figure 1
2026-07-03cs.CV

Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment

Shuyao Li, Chuanxing Geng, Heyang Sun, Qiang Zhou, Jingjing Gu

2026-07-03视觉感知生成模型三维安全鲁棒

论文针对自动驾驶三维检测在未见天气类型与强度下显著退化的问题,指出现有 LiDAR-4D 雷达融合仍依赖闭集天气假设。其核心是 DCDA:用 4D 雷达条件扩散将受损 LiDAR BEV 特征拉回晴天特征流形,并以冻结晴天检测器和天气对抗判别器分别约束检测语义与分布一致性,无需天气标签或成对数据。在 K-Radar 开放天气基准上,相比较强基线在类型、强度及组合开放设置下分别提升约 5.2、3.0、1.8 个 3D AP 百分点。

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding Figure 1
2026-07-03cs.CV

MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding

Wenda Wang, Yihan Tong, Yuwei Hu, Zhewei Wei

Renmin University of China

2026-07-03视觉语言视觉感知

这篇论文针对分子图像中视觉 token 难以保留原子—化学键拓扑、导致 VLM 在 SMILES 识别和性质推理上弱于专用工具的问题,提出 MolSight:用 SVG 作为结构监督,并通过拓扑模块注入键邻接关系、 grounding 模块对齐视觉与符号语义。实验称其在四类化学视觉理解任务上超过通用 VLM、分子 VLM 和部分 OCSR 工具,但具体增益与数据规模的关系仍需结合完整实验细节判断。

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing Figure 1
2026-07-03cs.AI

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li

2026-07-03视觉语言学习理论

论文针对在线多模态知识编辑中“改对原样本”却不能控制传播边界的问题,指出可靠编辑仍可能对同义跨模态输入欠泛化或向无关输入泄漏。作者提出 ScopeEdit,将更新拆为模态局部吸收分支与证据门控共享泛化分支,并用正交低秩空间和递归预条件保持在线开销。实验显示其在多基准、长编辑流和不同 MLLM 上改善域内跨模态迁移与域外局部性权衡,同时维持可靠性、稳定性和效率。

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias Figure 1
2026-07-03cs.CV

Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias

Sofiane Ouaari, Kevin Vorwalder, Nico Pfeifer

2026-07-03视觉语言视觉感知数据集/基准

本文关注VLM被用于医学图像质量自动评估时的可靠性问题:临床部署不仅要求识别退化图像,还要避免提示中的机构、设备和人口学信息影响判断。作者在MediMeta-C上零样本评测16个VLM、7类模态和多级腐蚀,并结合嵌入空间位移分析失效模式。结果显示像素化使评分平均下降20.58%,亮度影响很小;同族模型相关性较高但仍会给腐蚀图像加分,机构声望可使评分升高17.15%、设备老化使评分降低14.7%,说明当前VLM质量评估仍受隐私变换和文本偏置显著干扰。

NeoMap: Training-free Novel-View Synthesis from Single Images and Videos Figure 1
2026-07-03cs.CV

NeoMap: Training-free Novel-View Synthesis from Single Images and Videos

Jinxi Li, Tianyi Zhang, Yafei Yang, Zihui Zhang, Peng Huang, Koon Wing Macgyver Lin, Bo Yang

2026-07-03视觉感知

NeoMap针对单图或单目视频新视角合成中遮挡、深度歧义以及现有相机条件微调/硬引导易产生伪影的问题,提出无需训练的思路:预训练视频模型的数据流形中已包含可行的新视角解,关键是搜索对应初始噪声。方法通过深度 warping 构造几何先验,并在锚定流形投影与像素约束投影间迭代,兼顾语义补全和视角对齐。实验称其在 Tanks-and-Temples、LLFF、DAVIS 上超过现有方法,提升生成保真度并保持较强几何一致性。

Personalized 4D Whole-Heart Mesh Reconstruction from Cine MRI via Multi-Scale Temporal Modeling and Differentiable Contour Rendering Figure 1
2026-07-03cs.CV

Personalized 4D Whole-Heart Mesh Reconstruction from Cine MRI via Multi-Scale Temporal Modeling and Differentiable Contour Rendering

Xiaoyue Liu, Dongcheng Cang, Xiaohan Yuan, Mark YY Chan, Ching-Hui Sia, Lei Li

Department of Biomedical Engineering, National University of Singapore, Singapore, School of Automation, Southeast University, Nanjing, China, Department of Medicine, National University of Singapore, Singapore, Department of Cardiology, National University Heart Centre Singapore, Singapore

2026-07-03三维

该文面向稀疏 cine MRI 难以生成可用于心脏数字孪生的动态全心网格这一问题,提出端到端图像到网格框架,以 Beer-Lambert 启发的可微轮廓渲染约束多视角2D轮廓,并用多尺度时间建模同时保持全周期运动与帧间平滑。实验报告全心 MAE 为 1.68±0.31 mm、运动抖动 0.77±0.17 mm/frame³,优于对比方法,并展示了电生理仿真的可行性,但仍依赖较准确分割且泛化病种有限。

LiZAD: A Lightweight Zero-Shot Anomaly Detection Framework for Industrial Manufacturing Figure 1
2026-07-03cs.CV

LiZAD: A Lightweight Zero-Shot Anomaly Detection Framework for Industrial Manufacturing

Uzair Khan, Luigi Capogrosso, Muhammad Aqeel, Francesco Setti, Michele Magno, Marco Cristani

2026-07-03视觉感知

LiZAD面向产线频繁换型、难以为每类产品采集标注数据且边缘设备算力受限的问题,将DINOv3的密集空间视觉特征与MobileCLIP2的轻量文本嵌入通过低内存投影头对齐,用于零样本缺陷检测与定位。在VisA、BTAD、MPDD、MVTec-AD上相较六个ZSAD方法平均降内存61.5%、参数74.6%、延迟加速3.02倍,P-AUROC仅较最佳基线低6.4%,并在Jetson与真实产线验证部署。

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation Figure 1
2026-07-03cs.RO

PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation

Peng Yun, Shouwang Huang, Hao Li, Jinxi Li, Jianan Wang, Bo Yang

2026-07-03机器人强化学习三维

面向高速运动目标和开放三维场景中的动态操作,PhysMani指出现有VLA/视频世界模型缺少显式3D几何、物理一致预测且延迟偏高。其核心是用在线优化的无散度3D Gaussian速度场预测未来动力学,并通过可学习token交叉注意力注入策略网络。在16任务PhysMani-Bench及真实机器人实验中,成功率和效率均优于3D策略与VLA基线。

Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction Figure 1
2026-07-03cs.CV

Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction

Feng Li, Chaokun Zhang, Gong Chen

2026-07-03三维

这篇论文针对协同3D语义占用预测中细粒度体素特征难以在带宽受限V2X场景传输的问题,提出VQSOP:利用场景稀疏性只量化并传输关键信息区域的码本索引,再用双分支自适应空间细化融合局部几何细节与全局语义上下文。实验显示其在单车和协同设置下均超过现有方法,协同mIoU提升4.10%、IoU提升0.92%,通信量最高降低82倍。

Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots Figure 1
2026-07-03cs.CV

Robust Image Processing Techniques for Construction Environment Monitoring Using Underwater Robots

Seunghee Yun, Geonmo Yang, Juhui Lee, Changbeom Park, Jeahyung Choi, Younggun Cho

Journal of Institute of Control, Robotics and Systems (20xx) 30(x):000-000, Department of Electrical and Computer Engineering, Inha University, Hyundai Engineering & Construction Co., Ltd, Department of Electrical and Electronic Engineering, Inha University, ※ This research was supported by the Korea Heritage Service and the National Research Institute of Cultural Heritage in 2026 (Project No.: RS-2026-25518173), by the, Institute of Information & Communications Technology Planning & Evaluation (IITP) grant funded by the Korea government (MSIT) (No. 2022-0-00448/RS-2022-, underwater working environments and the controllability of the data

2026-07-03机器人视觉感知安全鲁棒

面向水下机器人在近海施工监测中图像受前向散射、海雪颗粒和低对比度影响的问题,论文将深度相关模糊与真实颗粒分布分阶段合成,并在不改 Joint-ID 架构下用更贴近实海的合成数据重训,再配合轻量后处理。韩国沿海实采数据上视觉质量和 UIQM 均有提升,说明收益主要来自更真实、可控的数据退化建模。

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports Figure 1
2026-07-03cs.CV

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

2026-07-03视觉语言视觉感知强化学习

针对超声 LVLM 常停留在单图或单器官、难匹配真实检查流程的问题,本文提出把多张检查图像与长篇临床报告按 examination-level 对齐,构建约 150 万例、1770 万张图像的数据集,并仅用 LoRA 微调标准 LVLM。结果显示 LUMI 在报告生成与临床 F1 等指标上优于通用和医学模型,增益可能主要来自大规模超声数据与临床一致的数据组织。

Population-Based Multi-Objective Training of Discriminators for Semi-Supervised GANs Figure 1
2026-07-03cs.LG

Population-Based Multi-Objective Training of Discriminators for Semi-Supervised GANs

Francisco Sedeño, Francisco Chicano, Jamal Toutouh

2026-07-03生成模型

针对半监督 GAN 中判别器同时承担分类与真假判别、单一加权损失易导致训练不稳的问题,论文将判别器训练改写为监督/无监督双目标优化,并用种群与 Pareto 选择保留不同权衡解。MNIST 少标签实验显示其较 SSL-GAN、CE-SSL-GAN 更稳,μ=1 也有显著增益,精英变体分类准确率最高,但验证范围仍较窄。

SFKD: Spatial--Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction Figure 1
2026-07-03cs.CV

SFKD: Spatial--Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction

Cuipeng Wang, Haipeng Wang

Key Laboratory for Information Science of Electromagnetic Waves, Ministry of Education, Fudan University, Shanghai, China, Discipline and Technology Center of Microwave Vision Intelligent Sensing, Fudan University, Shanghai, China, Corresponding author.Key Laboratory for Information Science of Electromagnetic Waves

2026-07-03视觉感知

SFKD针对异构教师—学生模型因归纳偏置不同导致特征空间分布不一致、传统蒸馏常削弱空间信息的问题,提出用多级离散小波分解拆分低频结构语义与高频局部细节,再经双流双阶段模块细化学生子带,并用高斯滤波频域损失做全局能量对齐。实验显示其在多种同构与异构蒸馏设置下优于已有方法,且异构Swin-T教师蒸馏ResNet18可超过同构ResNet34教师。

Rethinking Post-Hoc Calibration in Semantic Segmentation Figure 1
2026-07-03cs.CV

Rethinking Post-Hoc Calibration in Semantic Segmentation

Tristan Kirscher (ICube), Kim-Celine Kahl (DKFZ), Balint Kovacs (DKFZ), Maximilian R. Rokuss (DKFZ), Klaus Maier-Hein (DKFZ), Xavier Coubez, Philippe Meyer (ICube), Sylvain Faisan (ICube)

ICube Laboratory, CNRS UMR 7357, University of Strasbourg, Strasbourg, France, German Cancer Research Center (DKFZ), Division of Medical Image Computing, Heidelberg, Germany, Faculty of Mathematics and Computer Science, University of Heidelberg, Germany, Medical Faculty Heidelberg, Heidelberg University, Heidelberg, Germany, Pattern Analysis and Learning Group, Dept. of Radiation Oncology, Heidelberg University Hospital, Germany

2026-07-03视觉感知

这篇论文关注语义分割后验校准中被忽视的结构问题:logit 加常数不改变 softmax,却会让部分校准器输出不一致;同时交叉熵校准可能改变 argmax,损害 Dice。作者提出平移不变校准与保持决策的类条件仿射校准框架。实验覆盖自然图像、医学分割及协变量偏移,显示 TI 变体通常改善校准指标,决策保持约束可避免分割性能下降并保留较强校准效果。

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation Figure 1
2026-07-03cs.CV

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation

Fengchen He, Hao Xu, Dayang Zhao, Tingwei Quan, Shaoqun Zeng

2026-07-03视觉感知

论文针对双像素深度估计中基线极小导致弱视差区域纹理缺失、低对比或下采样时结构崩坏的问题,提出 FoundDP:用 DP 网络保留度量尺度,再引入单目深度基础模型的 ViT 全局结构先验,并通过散焦模糊下的 ViT 特征对齐稳定引导。实验显示其在合成与真实 DP 基准、弱视差区域和下采样鲁棒性上均优于既有 DP 方法,结构一致性和度量精度提升更明显。

Diversity-aware View Partitioning for Scalable VGGT Figure 1
2026-07-03cs.CV

Diversity-aware View Partitioning for Scalable VGGT

Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu cho, Jeany Son

2026-07-03视觉感知

这篇论文针对 VGGT 在多视角数量增大时因全局注意力开销和视角冗余导致重建反而变差的问题,指出关键不只是处理更多图像,而是组织更有几何互补性的视角。方法无需训练,通过视觉差异与近似空间分散度做图划分,并用少量种子帧的软位姿传播估计空间关系,将输入拆成多样且均衡的块。实验显示其在相机位姿、深度和三维重建上优于 vanilla VGGT 及若干高效变体,同时降低显存和推理延迟。

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models Figure 1
2026-07-03cs.CV

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han

State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Mohamed bin Zayed University of Artificial Intelligence, Shanghai Jiao Tong University

2026-07-03视觉语言视觉感知

针对大视觉语言模型在边缘设备部署时内存与延迟过高、现有二值化忽视层间和模态间权重重要性差异的问题,SAB-LVLM用文本/视觉校准数据构建Hessian并生成空间显著性图,将跨模态显著性作为量化误差重加权项,再交替更新二值权重;在约1-bit约束下,其在多项LVLM基准上优于已有二值PTQ方法。

Descriptor: LYNRED Mobility Dataset Multimodal Detection Subset (LYNRED-MDS) Figure 1
2026-07-03cs.CV

Descriptor: LYNRED Mobility Dataset Multimodal Detection Subset (LYNRED-MDS)

Loïc Arbez (Thoth), Jessy Matias, Xavier Brenière, Jocelyn Chanussot (Thoth), Ronald Phlypo (GIPSA-VIBS)

INRIA center at University Grenoble Alpes, 38330 Montbonnot-Saint-Martin, France, Univ Grenoble Alpes, CNRS, Grenoble INP, GIPSA-lab, 38000 Grenoble, France, imaging. While available RGB-infrared datasets such as FLIR ADAS and LLVIP are good benchmarks, Published in 2015 by the Korean Advanced Institute of

2026-07-03视觉语言视觉感知数据集/基准

面向夜间、雾天等低能见度下ADAS对远距离行人/弱势道路使用者的提前检测需求,论文发布LYNRED-MDS:4000对法国格勒诺布尔周边采集的RGB-红外图像,覆盖城市、乡村、山地和多天气光照,并提供独立标注、遮挡标签及COCO格式。YOLOv8n跨数据集热红外实验显示其对行人检测有较好泛化潜力,但结论仍主要基于单一模型与有限指标。

QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers Figure 1
2026-07-03cs.CV

QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers

Kyobin Choo, Youngmin Kim, Hyunkyung Han, Geunrip Park, Chanyoung Kim, Sunyoung Jung, Seong Jae Hwang

2026-07-03视觉感知生成模型规划控制

针对视频 DiT 主要依赖文本提示、难以精确控制物体或相机运动的问题,QWERTY 提出无需训练的推理时控制:只扭曲查询中的帧不变语义子空间,并用语义-时间通道分解避免 RoPE 带来的帧间不一致,再以扭曲查询产生的噪声做潜变量自引导。实验显示其在近期图像到视频 DiT 上优于现有免训练方法,效果接近需微调的控制方法。

DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability Figure 1
2026-07-03cs.RO

DL-SLAM: Enabling High-Fidelity Gaussian Splatting SLAM in Dynamic Environments based on Dual-Level Probability

Ziheng Xu, Qingfeng Li, Xuefeng Liu, Chen Chen, Jianwei Niu

2026-07-03三维

DL-SLAM针对动态场景中3DGS SLAM要么粗暴剔除动态类、要么把暂时静止物体错误融入地图的问题,提出像素级与对象级联动的双层动态概率框架:用语义与光流估计像素概率辅助跟踪,再提升到3D按实例聚合并剪除动态高斯,同时由净化静态地图反向修正概率。实验称在三类动态数据集上跟踪精度最高提升13%,并生成更少伪影的语义静态地图。

Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction Figure 1
2026-07-03cs.CV

Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction

Clémentine Grethen, Florient Chouteau, Géraldine Morin, Simone Gasparini

2026-07-03三维

针对月面探测中算力、功耗和时延受限而大型三维基础模型难以上机的问题,论文将经月球数据微调的 MASt3R 教师蒸馏为轻量学生,并提出用 SVD 投影初始化压缩解码器、结合特征级监督的方案。实验显示 ViT 学生可将参数量压缩约 4.4–7.3 倍、推理约提速 2 倍,最佳模型 Chamfer 误差仅比教师高约 15%,且优于直接用稀疏真值训练的基线;同时提示保留编码器能力比维持大解码器更关键,CNN 学生表现较弱但可能受预训练差异影响。

C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation Figure 1
2026-07-03cs.CV

C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation

Jinlong Wang, Xun Huang, Qiming Xia, Shijia Zhao, Chenglu Wen

2026-07-03视觉感知三维

论文针对单车 LiDAR 3D 检测受遮挡和视角限制、协同感知又有通信与位姿误差的问题,提出 C2E 思路:训练时用多智能体协同模型作为多教师,将知识蒸馏到仅用自车输入的学生模型。其 M2S 框架结合多层特征增强、辅助点云重建和多教师对比蒸馏来缓解单/多车域差异。在 V2XSet、V2V4Real、DAIR-V2X 上可为多种检测器带来最高 8.64% 3D mAP 提升,推理阶段不增加通信成本。

Rethinking Conditional Generation for Underwater Salient Object Detection Figure 1
2026-07-03cs.CV

Rethinking Conditional Generation for Underwater Salient Object Detection

Hua Li, Yongjie Weng, Yutong Li, Zhiyuan Li, Runmin Cong, Sam Kwong

(Corresponding author: Runmin Cong.)Hua Li, Yongjie Weng, Yutong Li, and Zhiyuan Li are with the School of Computer Science and Technology, Hainan University, Haikou 570228, China

2026-07-03视觉感知

针对水下机器人感知中显著目标易受低对比度、色偏和散射模糊影响的问题,论文指出扩散式USOD的关键不只是生成掩码,而是条件特征可靠性。DCGNet用多粒度结构、伪深度物理先验和空间高斯先验先净化并约束条件特征,再由轻量DiT随时间步细化。多数据集实验称其优于现有SOTA,但具体增益在多模块间的归因仍需看消融细节。

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models Figure 1
2026-07-03cs.CV

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

2026-07-03视觉语言数据集/基准

针对多模态基准长期静态化导致的时效过期、训练污染和维护成本高问题,MMBench-Live将基准更新建模为任务引导的数据构建:从原MMBench抽取任务层级与视觉模式,结合反馈控制的实时数据获取和带可执行推理验证的QA生成,以尽量保持跨版本可比性。实例化后生成5.9K条新样本,人工答案正确率96.06%,单次更新约1–2小时、成本约30美元,并在开放VLM评测中保持模型排序稳定、语义分布对齐且记忆污染信号更弱。

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation Figure 1
2026-07-03cs.CV

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

Duy Cao, Phong Nguyen-Ha

Qualcomm AI Research 1 1 1 Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-07-03生成模型三维

PixGS针对现有3DGS生成依赖多阶段重建或潜空间扩散、易累积视角不一致与压缩伪影的问题,改用像素空间扩散直接在高斯属性张量上去噪,并结合深度、法线与LoG高频监督及三阶段训练。实验称其优于现有方法,同时在单张A100上约1秒生成,但具体增益中各监督与数据规模的贡献仍需结合消融判断。

SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video Figure 1
2026-07-03cs.CV

SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video

Weili Guan, Haoyu Zhang, Meng Liu, Qianlong Xiang, Yaowei Wang, Liqiang Nie

2026-07-03视觉感知三维

该文面向机器人导航与具身交互中从扫描视频进行三维空间推理的需求,指出现有VLM受限于2D观测不确定、数据稀缺、长视频输入不足和仅重坐标的偏置优化。SpaceEra++在原有合成QA与结构化CoT基础上,引入兼顾空间覆盖和物体语义的ScenePick采帧,以及联合绝对坐标与相对关系约束的SpaceAlign强化学习。多基准实验显示其相对强基线稳定提升,消融支持各组件具有独立且互补贡献。

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design Figure 1
2026-07-03cs.CV

LLM-Empowered Multimodal Fusion Framework for Autonomous Driving: Semantic Enhancement and Channel-Adaptive Design

Wen Wang, Yaping Sun, Yejun He, Hao Chen, Zhiyong Chen, Xiaodong Xu, Nan Ma, Shuguang Cui

2026-07-03视觉语言

这篇论文针对协同自动驾驶中外部雷达经 V2X 链路传输后质量随遮挡、噪声和 SNR 波动而变化、传统固定融合易失效的问题,提出 LM-SCIP:用链路指标生成 Channel Prompt,经 CASM 门控雷达特征,并由 LoRA 调优 LLM 与 H-MoE 在语义层动态分配视觉与雷达信任。实验在 nuScenes 和 VIRAT 上显示定位、预测均有收益,如 nuScenes 相比纯视觉定位 RMSE 降低 40.0%,但真实部署与增益在多大程度来自 LLM 推理仍需进一步验证。

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation Figure 1
2026-07-03cs.CV

JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation

Mingyeong Song, Jungbin Cho, Jisoo Kim, Ananya Bal, Kartik Sharma, Youngjae Yu, Laszlo A. Jeni, Junhyug Noh

2026-07-03视觉感知

本文针对文本驱动手-物交互生成中接触误差导致的悬空、穿模和抓握不稳问题,提出 JointHOI:在单阶段扩散模型中把动态、距离型接触图作为“内在模态”与双手和物体运动联合生成,并在推理时用 Contact Inner Guidance 约束预测接触与几何接触一致。GRAB 和 ARCTIC 实验显示其在文本一致性、运动自然度和物理合理性上优于多阶段或隐式交互基线。

ProCal: Inference-Time Proposal Calibration for Open-Vocabulary Object Detection Figure 1
2026-07-03cs.CV

ProCal: Inference-Time Proposal Calibration for Open-Vocabulary Object Detection

Jae-Ryung Hong, Ho-Joong Kim, Seong-Whan Lee

2026-07-03视觉感知

这篇论文针对开放词汇检测中两阶段检测器偏向基类、常把新类目标排到背景或低质量框之后的问题,提出推理时的 ProCal 校准。核心洞察是冻结 VLM 的类别无关提示能提供前景定位与背景抑制信号,并据此重排新类 proposal,无需再训练。实验中在 CLIPSelf ViT-L/14 上使 OV-LVIS 新类 APr 提升 2.5,分析显示主要改善来自抑制背景误激活和提升真新类框排序。

DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM Figure 1
2026-07-03cs.CV

DL-VINS-Factory: A Modular Framework for Learned Visual Front-Ends in Visual-Inertial SLAM

Shoon Kit Lim, Melissa Jia Ying Chong, Ting Yang Ling

University of Southampton Malaysia, Iskandar Puteri, Johor, Malaysia

2026-07-03视觉感知

本文针对学习型视觉前端在紧耦合 VI-SLAM 中难以公平比较、回环又常依赖特定 BoW 词典的问题,提出 DL-VINS-Factory,将 ALIKED、RaCo、SuperPoint、XFeat 与 LK 或 LightGlue 模块化接入同一 VINS-Fusion/Ceres 后端,并用 AnyLoc DINOv2-VLAD 做前端无关回环。实验显示学习特征可在 Jetson 上实时运行,但并非总优于经典跟踪:ALIKED+LG 在 EuRoC、NTU-VIRAL 有 5%–12% ATE 改善,植物园场景中 LK 仍更稳,AnyLoc 有效回环数约为 BRIEF+DBoW2 的 2–7 倍。

ProSAC-CT: Progressive Spectral-Anatomical Co-Guided Multi-Stage Diffusion Model for Low-Dose CT Denoising Figure 1
2026-07-03cs.CV

ProSAC-CT: Progressive Spectral-Anatomical Co-Guided Multi-Stage Diffusion Model for Low-Dose CT Denoising

Xuepeng Liu, Zetong Liu, Renyiming Li, Yan Li, Ruiyu Li, Ruili Li, Jiayi Ding, Eichi Takaya

2026-07-03生成模型

低剂量CT虽能降低辐射,但噪声、条纹伪影和纹理退化会削弱解剖边界,现有扩散去噪又常缺少结构引导并把反向过程视为均一轨迹。ProSAC-CT的核心是在扩散框架中联合解剖先验、频域分解和按时间步分段的解码器,让不同阶段分别侧重全局结构、边界与细节恢复。文中在四个LDCT退化基准及Mayo-2020下游解剖区域分类上优于CNN、GAN、Transformer和扩散基线,显示其不仅提升图像指标,也更保留任务相关结构信息。

The Turning Point of 3D Plant Phenotyping: 3D Foundation Models Enable Minute-to-Second Cross-Crop Reconstruction and Beyond Figure 1
2026-07-03cs.CV

The Turning Point of 3D Plant Phenotyping: 3D Foundation Models Enable Minute-to-Second Cross-Crop Reconstruction and Beyond

Hanyue Jia, Wei Zhou, Wenbo Zhou, Yanan Li, Hao Lu, Tingting Wu

2026-07-03三维

面向低成本、高通量三维植物表型中多视角采集繁琐、COLMAP/SfM 初始化脆弱且耗时的问题,本文用 3D 基础模型做前馈几何恢复,并结合几何约束 3DGS、少视角迭代视图合成、2D 到 3D 语义迁移与尺度恢复,形成跨作物测量流程。在 26 个手机采集序列上,平均重建时间由 6.52 分钟降至 1.58 秒,同时保持较高重建质量和表型精度。

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding Figure 1
2026-07-03cs.CV

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

2026-07-03视觉感知数据集/基准

这篇论文针对医学视频模型只评“答对没”、少评“何时该答”的落地缺口,提出 MedStreamBench:整合 22 个医学视频/序列数据集和 5,419 个 QA,按回顾、当前、未来、主动预警四类时间任务限制证据窗口,考察回答、延迟、不确定与告警时机。实验显示,现有通用和医学视觉语言模型在离线识别之外,进入流式和主动场景后性能明显下降,说明时间约束下的临床决策能力仍不足。

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing Figure 1
2026-07-03cs.CV

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

2026-07-03视觉感知生成模型强化学习

针对真实雾天图像中非均匀、多重散射使传统大气散射模型易残雾和偏色、且真实成对数据稀缺的问题,论文将辐射传输方程的扩散-吸收结构引入流匹配,约束去雾轨迹,并用视觉语言模型构建5万对P-HAZE数据。实验称仅用该数据训练即可在五个真实去雾基准上取得领先表现,减少残雾与色漂,但增益可能同时来自模型先验与数据规模。

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation Figure 1
2026-07-03cs.CV

InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation

Qing Yu, Kent Fujiwara

2026-07-03生成模型

面向文本驱动的双人交互生成,论文针对全序列双向扩散缺乏因果性、难以流式长程生成,以及自回归方法易漂移的问题,提出 InterCMDM:在时序 VAE 潜空间中按块扩散,并用双流因果 DiT 与多任务注意力掩码统一建模个人时间因果和跨人协同,可通过掩码控制同步、反应和主从等关系。在 InterHuman 与 Inter-X 上报告达到 SOTA,提升文本对齐、真实感和长程连续性。

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA Figure 1
2026-07-03cs.CV

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

Minkuk Kim, Suyong Yun, Young Tae Kim, Jinyoung Moon, Jinwoo Choi, Seong Tae Kim

Kyung Hee University, Republic of Korea, Electronics and Telecommunications Research Institute (ETRI), Republic of Korea, ments in medium and long video regimes. The code is available at

2026-07-03视觉感知

长视频问答受固定视觉 token 预算限制,均匀采样容易漏掉关键证据,单纯图文相似度也难处理隐含线索。ReQuest 的核心是用 MLLM 响应蒸馏轻量级问题感知帧选择器,并在模型不确定时触发再思考检索,再用自适应 NMS 保持时间多样性。实验显示其在 Video-MME、MLVU、LongVideoBench 上稳定提升,尤其利于中长视频,且无需微调底层 MLLM。

Quantum-Inspired Vision: Leveraging Wave-Particle Duality for Low-Illumination Enhancement Figure 1
2026-07-03eess.IV

Quantum-Inspired Vision: Leveraging Wave-Particle Duality for Low-Illumination Enhancement

Yiquan Gao

2026-07-03视觉感知

低照度增强常把光照不确定性当作固定标签,容易过曝、欠曝并受噪声标签放大偏差。本文把 DRU 解释为“波函数—叠加—测量坍缩”的概率框架,用状态概率加权损失来校准样本贡献,并提出 BRISQUE/NIMA 统一分析指标。实验在 ASD 及噪声版本上显示 DRU 变体优于确定性模型、噪声下更稳,但量化增益主要依赖既有 DRU 与有限对比设置,泛化性文中未充分说明。

Beyond Pixel Diffs: Benchmarking Image Change Captioning for Web UI Visual Regression Testing Figure 1
2026-07-03cs.CV

Beyond Pixel Diffs: Benchmarking Image Change Captioning for Web UI Visual Regression Testing

Licheng Zhang, Bach Le, Pengtao Zhao, Naveed Akhtar

2026-07-03视觉语言视觉感知数据集/基准

这篇论文针对 Web UI 视觉回归测试中过度依赖像素差分、误报多且缺少可解释描述的问题,提出 Web UI Image Change Captioning 任务,并构建 WUICC-bench:用 LLM 控制 HTML 单原子变更,覆盖 37 类规则,得到 9906 个经人工验证的图像对与变化描述。实验显示,现有 IDC 与通用 LLM 在文本密集、布局细粒度的 UI 场景仍明显吃力,但训练式方法已能比像素比较更有选择地抑制非语义噪声。

Consistent Scene Understanding in 3D Gaussian Splatting via Multi-Cue Mask Refinement Figure 1
2026-07-03cs.CV

Consistent Scene Understanding in 3D Gaussian Splatting via Multi-Cue Mask Refinement

Hyunjoon Park, Donghyeon Cho

2026-07-03三维

这篇论文针对SAM等2D分割先验在3DGS中常出现的过分割、跨视角身份不一致问题,提出用DINOv2语义、单目深度和LoG边缘共同约束的掩码合并,并通过跨视角匹配与多视图投票把稳定ID提升到高斯基元。实验在LERF、Replica和真实场景中显示,其能减少错误碎片与ID漂移,提升实例分割一致性,同时基本保持3DGS的照片级重建质量。

LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression Figure 1
2026-07-03cs.CV

LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression

Bowen Yuan, Zijian Wang, Yadan Luo, Shijie Wang, Zi Huang

2026-07-03视觉语言

本文针对LVLM长链视觉推理中的“视觉遗忘”:模型生成越久越偏离图像证据。核心洞察是问题不只发生在后期注意力衰减,还源于早期视觉 grounding 受损,以及注意力集中到无关的视觉 sink token。LASER在GRPO后训练中加入视觉保持与sink抑制奖励,调控注意力轨迹和分布;八个基准上优于强基线,视觉推理与感知分别提升1.9%和5.7%。

Structure-Aware Gaussian Splatting for Large-Scale Scene Reconstruction Figure 1
2026-07-03cs.CV

Structure-Aware Gaussian Splatting for Large-Scale Scene Reconstruction

Weiyi Xue, Fan Lu, Chi Zhang, Tianhang Wang, Sanqing Qu, Zehan Zheng, Boyuan Zheng, Junqiao Zhao, Guang Chen

Tongji University, 2 Shanghai Innovation Institute, 3 Shanghai Westwell Technology Co., Ltd, Beijing University of Technology, Johns Hopkins University

2026-07-03三维

这篇论文针对大规模场景中 3D Gaussian Splatting 在稀疏观测区域易过度增密、产生冗余与 floaters 的问题,提出从信号结构恢复角度统一调度图像分辨率与高斯增密:用场景频率收敛判断何时升分辨率,并用球约束高斯保留点云结构先验。实验称在多个基准上提升约 0.9 dB PSNR,并实现每块约 1.5× 训练加速。

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning Figure 1
2026-07-03cs.CV

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning

Xuanhua He, Jiaxin Xie, Mingzhe Zheng, Qifeng Chen

2026-07-03视觉感知生成模型

ICDepth针对视频深度估计中时序一致性、几何精度与跨域泛化难以兼顾的问题,将预训练文生视频DiT通过上下文条件化迁移到深度预测;其关键在于用SAND-Attention阻断噪声深度对RGB条件的反向污染,并用DINOv2与分辨率先验补足几何和尺度感知。模型仅用0.8M帧训练,却在多项基准达到SOTA,并展示较强零样本泛化与1080p适配能力。

HistoSeg++: Delving deeper with attention and multiscale feature fusion for biomarker segmentation Figure 1
2026-07-03cs.CV

HistoSeg++: Delving deeper with attention and multiscale feature fusion for biomarker segmentation

Saad Wazir, Rao Faizan, Daeyoung Kim

School of Computing, KAIST, Kyung Hee University (Global Campus), School of Computing, KAIST Daejeon Republic of Korea, Kyung Hee University (Global Campus) Yongin-si Republic of Korea

2026-07-03视觉感知

针对生物标志物医学图像分割中尺度差异大、边界模糊且跨数据集泛化不足的问题,HistoSeg++在Nested-UNet框架中嵌入内外注意力、SE通道重标定与边缘感知损失,以强化多尺度上下文融合和上采样聚焦。在MoNuSeg、DSB和电镜数据集上,其IoU/Dice总体优于多种UNet及Transformer基线,但部分边界指标并非最优,增益主要归因于结构组合。

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning Figure 1
2026-07-03cs.CV

Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning

Chen Zhao, Jiajun Ma, Qilong Huang, Tiehan Fan, Hongyu Li, Zhuoliang Kang, Xiaoming Wei, Jian Yang, Ying Tai

2026-07-03视觉语言视觉感知

这篇论文针对音视频字幕中常见的“声音与画面各说各话”和时序因果错配问题,提出 TCA-Captioner:用 Observer-Checker-Corrector 迭代生成更可靠的对齐训练数据,并构建高密度人类交互数据与 TCA-Bench 解耦评测音画绑定和时间关系。实验显示其在同步、连贯的音视频叙述上优于现有模型,但具体增益有多少来自数据规模与标注流程仍需进一步拆分说明。

Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis Figure 1
2026-07-03cs.CV

Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis

Yuankun Yang, Yi Wei, Wenyang Zhou, Li Zhang

2026-07-03三维

本文针对单目动态场景重建只能在已观测轨迹内插值、难以补全大视角未见区域的问题,提出 PanoGaussian:先用全景坐标和渐进扩展约束视频生成的相机轨迹,再将生成视图蒸馏到动态 Gaussian 表示,以缓解全景投影对运动物体的形变。实验显示其在大视角变化下比现有动态重建和相机条件视频生成方法更能保持几何一致性,但仍依赖扩散先验和逐场景优化。

Teaching Vision-Language-Action Models What to See and Where to Look Figure 1
2026-07-03cs.CV

Teaching Vision-Language-Action Models What to See and Where to Look

Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao

School of Electronic Information Engineering, Beihang University, National College for Excellent Engineers, Beihang University, Institute for AI Industry Research (AIR), Tsinghua University, State Key Laboratory of Media Convergence and Communication, Communication University of China, School of Computer Science and Engineering, Beihang University, School of Cyber Science and Technology, Beihang University, School of Artificial Intelligence, Beihang University, the-art performance on NAVSIM and nuScenes. Our code is available at:, modules. While this structure offers interpretability and controllability, it suffers

2026-07-03视觉语言视觉感知

这篇论文针对自动驾驶 VLA 过度依赖 VQA/CoT 文本监督、注意力缺少空间落点的问题,提出 DriveTeach-VLA:用驾驶感知视觉蒸馏让编码器学会关注关键交通对象,再用投影到图像平面的 2D 轨迹提示引导规划器“看向”可行驶区域,并结合 SFT 与 GRPO 训练。实验称其在 NAVSIM 和 nuScenes 上达到 SOTA,消融也支持视觉空间提示对轨迹预测的贡献,但双模型设计带来额外运行开销。

Domain Generalization via Text-Anchored Information Bottleneck Figure 1
2026-07-03cs.CV

Domain Generalization via Text-Anchored Information Bottleneck

Eunyi Lyou, Yunjeong Choi, Junho Lee, Joonseok Lee

2026-07-03学习理论

这篇论文针对域泛化中视觉模型在新环境下容易学习训练域伪相关的问题,质疑保留 CLIP 等视觉表征一定提升鲁棒性的假设。作者提出以文本嵌入作为稳定语义锚点,并用类条件信息瓶颈约束图像特征,只保留跨模态共享的核心语义、抑制风格等域特异信息。实验称在多种 DG 基准和骨干上达到 SOTA,并显示更清晰的类别分离,但固定文本锚点的上下文不足与数据泄漏影响仍被作者列为限制。

Plug-and-Play Volumetric Reconstruction for Compressive Sensing Light-Sheet Microscopy Figure 1
2026-07-03cs.CV

Plug-and-Play Volumetric Reconstruction for Compressive Sensing Light-Sheet Microscopy

Jianqing Jia, Yi Gong, Xinyuan Zhang, Jichen Chai, Yichen Ding, Yifei Lou

School of Data and Information Sciences, The University of North Carolina at Chapel Hill, Chapel Hill, NC 27599, USA ()., Department of Mathematics, The University of North Carolina at Chapel Hill, Chapel Hill, NC 27599, USA (). Jia and Gong contributed equally to this work., Department of Bioengineering, The University of Texas at Dallas, Richardson, TX 75080, USA (, , )., Department of Mathematics, School of Data and Information Sciences, The University of North Carolina at Chapel Hill, Chapel Hill, NC 27599, USA ().

2026-07-03三维

这篇论文面向压缩感知光片显微中多轴向切片被单次曝光混合后难以重建的问题,提出可插拔 PnP-ADMM 体重建框架,并在逐切片模型上加入轴向耦合以利用相邻切片相关性;同时用 Woodbury 更新和 Gauss-Seidel 去噪提升计算效率。作者给出弱凸先验下的子序列收敛分析,并在合成与真实斑马鱼心脏数据上显示可恢复细胞结构、轴向连续性优于逐切片方案。

Boosting Ultrasound Image Classification via Attribute-Guided Dual-Branch Framework Figure 1
2026-07-03cs.CV

Boosting Ultrasound Image Classification via Attribute-Guided Dual-Branch Framework

Bo Zhao, Yapeng Li, Juhua Liu, Bo Du

2026-07-03视觉感知

针对超声分类中黑箱模型易受噪声、设备差异影响且缺乏临床可解释性的问题,论文提出可插拔的 AttrGuide 双分支框架:在原分类分支外,引入由 CLIP 文本属性原型和类别-属性矩阵构成的医学先验分支,并用自适应决策融合校正预测。多项超声任务显示其可接入不同骨干和 SOTA 方法,带来稳定精度提升与可解释属性证据,额外训练开销低于 5%。

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling Figure 1
2026-07-03cs.CV

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin

State Key Laboratory of Complex & Critical Software Environment, Beihang University, School of Computer Science and Engineering, Beihang University, Nanyang Technological University, State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, University of Chinese Academy of Sciences, University of Science and Technology of China, School of Artificial Intelligence, Beihang University

2026-07-03生成模型

本文针对文本到图像流匹配/扩散模型推理昂贵、现有免训练多分辨率方法易因潜空间上采样产生模糊和伪影的问题,提出 MrFlow:先低分辨率快速生成结构,再在像素空间用轻量 GAN 超分辨率放大,注入低强度噪声以重采样高频细节,最后少步高分辨率精修。实验在 FLUX.1-dev 和 Qwen-Image 上显示,其可实现约 10× 端到端加速且 OneIG 损失控制在 1% 内,并可与时间步蒸馏叠加达到约 25×。

Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images Figure 1
2026-07-03cs.CV

Bridging 3D Gaussians and Semantic Occupancy for Comprehensive Open-Vocabulary Scene Understanding from Unposed Images

Hu Zhu, Bohan Li, Xianda Guo, Yanlun Peng, Zheng Zhu, Xin Jin, Wenjun Zeng, Chang Wen Chen

Yanlun Peng is with Great Wall Motor, China. Zheng Zhu is with Tsinghua University, Beijing, China.

2026-07-03视觉感知三维

这篇论文针对稀疏、无位姿图像下的三维场景理解:现有语义 3D Gaussian 多靠图像空间监督,能渲染但难约束未观测区域的空闲/占用结构。COVScene 的核心是把语义高斯在训练图中可微提升为稠密语义占用场,用体素正则反向约束透明度、几何和语义特征,并结合几何蒸馏与占用熵约束。在 ScanNet/ScanNet++ 上,它保持相近渲染质量,同时提升开放词汇分割和无体素标注的语义占用预测。

DRDN: Decoupled Representation Dynamic Network for From-Scratch ViT Class-Incremental Learning Figure 1
2026-07-03cs.CV

DRDN: Decoupled Representation Dynamic Network for From-Scratch ViT Class-Incremental Learning

Bingchen Huang, Yifu Chen, Zhiling Wang, Yuanchao Du

2026-07-03视觉感知

本文针对从零训练 ViT 的类增量学习中,动态扩展方法虽能保护任务特定知识、却易产生跨任务混淆并弱化共享骨干表示的问题。DRDN 的核心洞察是解耦优化路径:用持续 MIM 仅更新骨干以维持通用视觉结构,同时在各层扩展隔离注意力的任务 token。实验显示其在 CIFAR100-B0 10 步达 77.19% 平均准确率,优于 DKT 1.36 点、DyTox 3.53 点,且无推理开销。

Online Segment 3D Gaussians via Launching Virtual Drones Figure 1
2026-07-03cs.CV

Online Segment 3D Gaussians via Launching Virtual Drones

Liwei Liao, Rongjie Wang, Ronggang Wang

2026-07-03三维

本文针对交互式 3D Gaussian 分割在新场景中需预处理多视角掩码、提升或蒸馏特征而难以在线使用的问题,提出 SAGO:把分割过程类比为虚拟无人机的 Next-Best-View 规划,在 Markov 状态中逐步渲染新视角、调用 2D 分割并裁剪背景 Gaussians。实验显示其无需场景级 setup,单次交互约 0.3–1 秒,较既有 setup-free 方法快 50 倍以上,同时保持或超过部分离线方法的分割质量。

Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots Figure 1
2026-07-03cs.CV

Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots

Jeongwan On, Muhammad Salman Ali, Muneeb A. Khan, Sunwoo Park, Inwoong Moon, Hyung Jin Chang, Jaekwang Kim, Seong Jong Ha, Seungryul Baek

2026-07-03视觉感知三维

该文针对真实视频中频繁切镜导致多人体三维网格轨迹断裂、身份混淆和相机位姿不连续的问题,提出 Multi-THuMBS:用 VGGT 等三维场景先验在切镜边界构建共享 3D 空间,将相邻镜头的人体网格对齐,并结合外观、姿态与三维距离做重识别,再通过全局平滑和跨相机重投影约束维持一致轨迹。实验显示其在多基准上提升人体网格恢复、相机估计和身份跟踪表现。

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment Figure 1
2026-07-03cs.CV

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

2026-07-03视觉语言视觉感知生成模型

这篇论文针对VLA预训练中架构、数据和评测不统一导致范式难比较的问题,提出VLAFlow作为受控训练框架,在同一π0式结构、14维动作空间和约5000小时异构机器人数据上比较动作预测、语言协同训练、未来潜特征对齐及其组合。核心洞察是语言意图与未来状态表征可作为“元动作”中间约束,缓解异构动作监督的不稳定。实验显示动作-only预训练易负迁移,而MindLWPI在LIBERO、LIBERO-Plus和SimplerEnv上整体迁移最稳。

MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting Figure 1
2026-07-03cs.CV

MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting

Jianwei Hu, Tingxuan Huang, Hengyu Zhou, Ningna Wang, Xiaohu Guo Jinshan Lai, Bin Wang

2026-07-03三维

MVFusion-GS针对动态3D Gaussian Splatting中形变网络缺乏显式运动感知的问题:弱运动或短暂前景易被误分到静态分支,污染背景并削弱前景重建。其核心是在形变特征中注入跨时间的高斯运动方差统计,并用邻近时刻的Transformer注意力建模局部时序一致性。实验显示该插件式设计在动态场景重建和去干扰静态背景重建上均取得SOTA或稳定提升,但在复杂遮挡和初始形变欠拟合时仍可能残留伪静态伪影。

Mind the Gap: Standard 3DGS Evaluation Primarily Measures Near-Trajectory Interpolation Figure 1
2026-07-03cs.CV

Mind the Gap: Standard 3DGS Evaluation Primarily Measures Near-Trajectory Interpolation

Gaoxiang Jia, Vikram Appia

Advanced Micro Devices, Inc.

2026-07-03规划控制数据集/基准三维

这篇论文针对3DGS常用每隔N帧留一帧的评测协议提出质疑:该设置多在相邻训练视角之间插值,不能代表机器人、仿真或AR中需要的空间泛化。作者设计训练图像数量匹配的插值/扇区外推对照,并在16个场景、多种3DGS与NeRF表示上发现3–12 dB的稳定差距,甚至可改变方法排名;视角到最近训练视角的角距离可作为零成本诊断和采集规划信号。

Boosting Infrared Small Target Detection via Logit-Domain Contrast and Adaptive Shape Refinement Figure 1
2026-07-03cs.CV

Boosting Infrared Small Target Detection via Logit-Domain Contrast and Adaptive Shape Refinement

Handong Zeng, Zhengeng Yang, Shuai Zhang, Shikai Chen, Hongshan Yu

2026-07-03视觉感知

本文针对红外小目标检测中弱目标与强杂波在概率域难以拉开、以及热扩散导致边界光晕的问题,提出在训练损失而非推理网络上改造监督:用logit域目标-困难背景成对间隔约束增强可分性,并以自适应环形边界惩罚和假警焦点损失压制光晕与高置信误报。基于MSHNet的实验显示,在IRSTD-1k和NUDT-SIRST上提升IoU与检测率、降低虚警,且不增加推理开销。

Hidden-Shot: Towards One-Shot Task Generalization for Low-Level Vision Generalist Models Figure 1
2026-07-03cs.CV

Hidden-Shot: Towards One-Shot Task Generalization for Low-Level Vision Generalist Models

Shao-Jun Xia, Xianzheng Ma, Zichong Meng

2026-07-03视觉感知学习理论

论文针对低层视觉通用模型在未见任务上一/少样本泛化缺乏系统验证的问题,提出 Hidden-Shot:从示例中提取隐式视觉任务信息,结合全局任务感知文本提示,并以轻量方式注入解码器以适配新任务。作者还设计 C/U 评测框架,在 3C4U 与 3C7U 设置的七/十个数据集上优于现有通用模型,同时基本保持已见任务性能。

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task Figure 1
2026-07-03cs.CV

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

2026-07-03视觉语言

本文针对VLM深度评测中视觉线索与语言偏置难以区分的问题,构建O3-D奇异项深度排序任务,通过可控合成/真实场景隔离9类图像深度线索,并用指代表达清晰度和新指标衡量语言影响。12个模型在37K图像、147K问答上准确率仅47%–56%、均未超越机会水平,且答案呈强语言偏置,CoT和ICL也无明显改善。

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation Figure 1
2026-07-03cs.CV

Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation

Yeonghwan Song, Chanhui Lee, Jinsoo Park, Jeany Son

2026-07-03视觉感知

这篇论文针对公开图片可被文本引导 I2V 模型随意动画化所带来的版权与隐私风险,提出 Anti-Prompt:在图片中加入不可察觉扰动,利用模型对文本引导的依赖,削弱去噪中的文本条件交互并增强视觉路径,使生成视频出现主体、结构和时序失真。实验覆盖全注意力与交叉注意力架构,显示其在保护效果、不可感知性、效率和跨模型迁移上优于 I2VGuard,并引入 Video-LLM 辅助评估来定位失败模式。

Boundary-Aware Quantization: Finite-Scale Decision Geometry of Neural Classifiers Figure 1
2026-07-03math.OC

Boundary-Aware Quantization: Finite-Scale Decision Geometry of Neural Classifiers

O.M. Kiselev

2026-07-03学习理论

论文关注神经网络量化部署中仅看准确率会掩盖决策边界漂移的问题,提出用有限尺度的边界审计指标,如局部边界位移、切片边界 Jaccard、多类交汇点和低 margin 区翻转,来决定量化停止。实验显示,8/6/4 bit 量化可在准确率几乎不变时显著改变边界;边界感知停止在 digits、MNIST、Fashion-MNIST 和 CIFAR-10 上降低翻转率与边界差异,但固定比特边界正则在低比特下增益有限。

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering Figure 1
2026-07-03cs.CV

A Cost-Aware, Paired Protocol for Auditing Dynamic Tool Synthesis in Agentic Video Question Answering

Aseel Mohamed, Rama AlHamidi, Mohamed Rayan Barhdadi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

Texas A&M University, Hamad Bin Khalifa University

2026-07-03视觉感知

这篇论文针对智能体 VideoQA 中工具库固定、重复流程每题都要重建且单看准确率无法衡量推理代价的问题,提出成本感知的配对审计协议,并以 Dynamic-SAGE 离线合成、验证和复用组合工具作为测试床。结果显示其在 SAGE-Bench 上准确率提升约 7.5 个百分点,推理轮次和可见工具调用降约 28%,但 token 用量和费用分别上升 34% 与 26%,说明工具合成带来的是成本结构迁移而非全面降本。

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection Figure 1
2026-07-03cs.CR

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

Indian Institute of Information Technology Dharwad (IIIT Dharwad), SAFE Center, Norwegian University of Science and Technology (NTNU), Indian Institute of Information Technology Dharwad (IIIT Dharwad) India, SAFE Center, Norwegian University of Science and Technology (NTNU) Gjшvik Norway

2026-07-03视觉感知

针对生成式 AI 让低门槛、高逼真身份证件伪造快速扩散,而现有检测基准难以覆盖真实攻击面的动机,本文系统统一了实体展示攻击、数字注入攻击与 GenAI 合成伪造的威胁模型,并审视 2019–2025 数据集的 Reality Gap。主要结果显示,非拉丁文字修补存在 SDGI 等可利用失真,且最强公开模型在未见合成证件零样本测试中 APCER 仍高于 25%,跨域泛化明显不足。

How Much Future Helps? A Controlled Study of Future-Privileged Supervision for Causal Egocentric Gaze Estimation Figure 1
2026-07-03cs.CV

How Much Future Helps? A Controlled Study of Future-Privileged Supervision for Causal Egocentric Gaze Estimation

Jia Li, Wenjie Zhao, Fnu Atisri, Sanskriti Aripineni, Shijian Deng, Jon E. Froehlich, Yuhang Zhao, Yapeng Tian

The University of Texas at Dallas, University of Washington, University of Wisconsin–Madison

2026-07-03视觉感知规划控制

这篇论文针对第一视角凝视估计中“离线模型可看未来帧、真实系统必须因果在线”的错配,设计训练期可调未来视野、推理期丢弃的未来特权分支,以隔离未来信息的作用。实验表明,未来监督能提升轻量因果模型,但收益并非随视野增长单调增加,而是在约1.7–3.3秒内达到最佳,EGTEA Gaze+和Ego4D的F1分别由44.7升至45.9、40.7升至42.7。

Sign in the Air to Unlock: An Interface for authentication in Virtual and Augmented Reality Powered by Point-Voxel Cross-Attention Network Figure 1
2026-07-03cs.CV

Sign in the Air to Unlock: An Interface for authentication in Virtual and Augmented Reality Powered by Point-Voxel Cross-Attention Network

Neda Abdolrahimi, Thiru Siddharth, Frank Sicongchen, Vir V Phoha

NEDA ABDOLRAHIMI∗, Syracuse University, USA, THIRU SIDDHARTH, Syracuse University, USA, FRANK SICONG CHEN, Syracuse University, USA, VIR V PHOHA, Syracuse University, USA, • Human-centered computing →Mixed / augmented reality, facilitate system entry and interaction in an integrated, user-centered manner. Unlike camera-based approaches, our

2026-07-03视觉感知

面向共享式 VR/AR 头显中密码、PIN 或外部设备登录会打断沉浸体验的问题,论文提出“空中签名”认证界面,并用 PV-Net 将轨迹的点级局部运动与体素级全局结构通过交叉注意力融合。实验在 DeepAirSig 上达到 2.5% EER,较基线错误率降 54.5%,在自采 Meta Quest 2 的 ImmAirSig 上分类准确率为 76%,但沉浸场景下握持、朝向和空间漂移仍带来性能波动。

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering Figure 1
2026-07-03cs.CL

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

2026-07-03视觉语言

长文档问答中,答案若不能精确回溯到文本、图像或二者组合证据,会削弱可信度与安全性。本文提出 MultAttnAttrib,不经训练地利用模型预填充阶段的注意力头、跨模态检索头筛选与阈值校准,在单次前向中定位证据,并构建 MultAttrEval 评测细粒度多模态归因。实验显示其优于多种提示、caption 与 RAG 基线,接近 GPT-5.4,同时延迟约为同骨干提示法的七分之一。

Beyond Heatmaps: Unsupervised Concept-Graph Reasoning for Interpretable Visual Explanation Figure 1
2026-07-03cs.CV

Beyond Heatmaps: Unsupervised Concept-Graph Reasoning for Interpretable Visual Explanation

Md Mohasin Hossain (1 and 2), Anar Amirli (4), Robert Leist (1), Md Abdul Kadir (1 and 3), Daniel Sonntag (1 and 3) ((1) German Research Center for Artificial Intelligence (DFKI), Saarbrücken, Germany, (2) Saarland University, (3) Oldenburg University, Oldenburg, (4) BEGO GmbH & Co. KG, Bremen, Germany)

Work performed while affiliated with Saarland University., German Research Center for Artificial Intelligence (DFKI), Saarbrücken, Germany, Saarland University, Saarbrücken, Germany, Oldenburg University, Oldenburg, Germany

2026-07-03视觉感知

论文针对热力图只给位置、传统概念瓶颈依赖人工概念且缺少空间落地和概念关系建模的问题,提出 G-CBM:用 NMF 无监督发现视觉概念,将图像区域匹配到概念节点,并用 GAT 推理概念间依赖,同时通过阈值过滤弱证据。实验覆盖 ImageNet 与三类皮肤镜数据,较 ResNet-50 平均 AUC 相对提升 3.7%,PH2 仅用 2/10 个概念达 0.96 AUC,删除/插入实验显示概念排序与预测较一致。

NeuroBridge: Bridging Multi-Task MRI Knowledge for Neurodegenerative Disease Diagnosis Figure 1
2026-07-03cs.LG

NeuroBridge: Bridging Multi-Task MRI Knowledge for Neurodegenerative Disease Diagnosis

Mengyu Li, Guoyao Shen, Chad W. Farris, Xin Zhang

Department of Mechanical Engineering, Boston University, Boston, MA 02215, The Photonics Center, Boston University, Boston, MA 02215, United States, Rafik B. Hariri Institute for Computing and Computational Science & Engineering, Boston University, Boston, MA, 02215, United States, Department of Radiology, Boston University Chobanian & Avedisian School of, Department of Radiology, Boston Medical Center, Boston, MA 02118, United States, Department of Electrical and Computer Engineering, Boston University, Boston, MA, Department of Biomedical Engineering, Boston University, Boston, MA 02215, Division of Materials Science and Engineering, Boston University, Boston, MA, Prof. Xin Zhang, Department of Mechanical Engineering, Boston University, Boston, Dr. Chad Farris, Department of Radiology, Boston University Chobanian & Avedisian, School of Medicine, Boston, MA 02118, United States

2026-07-03生成模型

针对 AD、MCI 等神经退行性疾病在 MRI 上结构改变细微且异质、单任务模型难以整合临床多线索的问题,NeuroBridge 将大规模 MAE 自监督预训练与海马分割、海马萎缩分类和重建任务结合,并用门控融合形成统一诊断表征。在 ADNI/OASIS 上其 AD vs CN 准确率达 88.17%/82.78%,对 MCI 和混合诊断任务增益更明显,并展示了跨队列泛化与概率化机会筛查潜力。

Computer Vision for Wildlife Monitoring: Detecting Brown Howler Monkeys using YOLO Figure 1
2026-07-03cs.CV

Computer Vision for Wildlife Monitoring: Detecting Brown Howler Monkeys using YOLO

Gabriel Ferri Schneider, Guido Luis Glufke Mainardi, Paulo Ricardo Knob, Patrícia Dias, Márcia Jardim, Júlio César Bicca-Marques, Soraia Raupp Musse

2026-07-03视觉感知

为降低树冠桥相机陷阱监测中大量误触发视频的人工筛查成本,论文将真实棕吼猴影像与 Unity 生成的合成数据混合,用 YOLOv10 微调检测模型,并比较不同比例辅助数据的作用。核心洞察是合成数据可缓解野生动物标注数据瓶颈,但给定文本未展示完整实验数值,主要结果和增益幅度文中未充分说明。

Rethinking Generic Object Tracking Toward Human-Level Perceptual Intelligence Figure 1
2026-07-03cs.CV

Rethinking Generic Object Tracking Toward Human-Level Perceptual Intelligence

Shih-Fang Chen

2026-07-03视觉感知

本文针对通用目标跟踪在开放类别、遮挡、干扰物和场景突变下难以稳定在线适应的问题,主张向人类视觉的连续感知靠拢。核心创新是结合基础模型自动视觉提示、面向测试时的在线适应学习,以及融合几何与语义的跨模态在线模型编辑,以增强目标判别、遮挡感知和空间推理。论文称这些机制提升了复杂动态视频中的泛化与鲁棒跟踪能力,但具体实验增益与来源在给定文本中未充分说明。

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation Figure 1
2026-07-03cs.CV

MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation

Zhihan Chen, Yuhuan Zhao, Yijie Zhu, Xinyu Yao, Mengcong Ren, Suwen Wang, Qiuyang Yin, Yuchen Sun, Qin Wang, Lu Xin

University of California, Los Angeles, University of Southern California, DeerLab LLC, Carnegie Mellon University, Clemson University, San Jose State University, University of Illinois at Urbana-Champaign

2026-07-03视觉感知数据集/基准

该文关注多主体个性化图像生成中的“绑定”失败:模型常漏掉主体、混淆外观或把交互关系分配错,而传统 CLIP/DINO 或偏好指标随主体数增加接近随机。MIBE 将基准 MIB 与评估器 MIE 结合,用分层多主体交互任务、60K VLM 银标和 4K 人类金标训练参考条件评估器,并显式诊断存在、外观、交互错误。结果显示 MIE 在金标上与人类偏好达到 0.922 配对准确率,未见生成器也有 0.884,说明收益主要来自带诊断标签的数据与参考条件评估设计。

MapDreamer: Aerial Imagery Conditioned Latent Diffusion for Lane-Level Map Generation Figure 1
2026-07-03cs.CV

MapDreamer: Aerial Imagery Conditioned Latent Diffusion for Lane-Level Map Generation

Julian Brandes, Philipp Crocoll, Wolfram Burgard

2026-07-03视觉感知生成模型

面向自动驾驶高精地图制作成本高、航拍图到车道级拓扑图转换困难的问题,MapDreamer 将车道中心线及连接关系压缩到 VAE 潜空间,并用航拍特征条件化的 Transformer 扩散模型生成图结构;车道数量模块、ghost latents 与滑窗拼接用于处理可变车道数和城市级连续性。在 UrbanLaneGraph/Argoverse 2 实验中,其几何精度和拓扑连通性优于非生成式基线。

Multi-modal Rail Crossing Safety Analysis Figure 1
2026-07-03cs.LG

Multi-modal Rail Crossing Safety Analysis

Paimon Goulart, Chansong Lim, Nícolas Roque dos Santos, Yue Dong, Sheldon Peterson, Jia Chen, Evangelos E. Papalexakis

University of California, Riverside, University of California, Riverside Riverside California USA

2026-07-03安全鲁棒

针对铁路平交道口风险评估依赖结构化统计变量、难覆盖驾驶员视角视觉隐患的问题,论文提出结合街景图像序列、FRA事故记录与官方APS评分的多模态VLM流程,并加入风险分组路由与LoRA微调。结果显示其高低风险分类macro F1为0.757,连续安全分数预测RMSE为0.078、相关性0.492,且能在雨夜等增强场景中识别部分可视风险因素。

Spatial-Temporal Expert Learning for Video-based Person Re-identification Figure 1
2026-07-03cs.CV

Spatial-Temporal Expert Learning for Video-based Person Re-identification

Xiaofei Hui, Pengfei Wang, Evan Ling, Dezhao Huang, Keng Teck Ma, Minhoe Hur, Jun Liu

2026-07-03视觉感知

针对视频行人重识别中外观相似身份难以仅靠全局特征区分的问题,论文提出输入感知、可扩展的专家模块:相似样本动态激活同一类专家以学习局部细粒度差异,并在专家内按通道选择空间或时间线索,从而适配鞋、包、发型或步态等判别信息。方法在 MARS 和 LS-VID 两个大规模数据集上取得突出性能,但摘要片段未给出具体数值增益。

KathaTrace: Diagnosing Semantic Trajectory Collapse in Generated Visual Narratives Figure 1
2026-07-03cs.CV

KathaTrace: Diagnosing Semantic Trajectory Collapse in Generated Visual Narratives

Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv Ramnath

Ramaiah Institute of Technology, The Ohio State University

2026-07-03规划控制

这篇论文针对视觉故事生成中“画面连贯但转场语义丢失”的问题,提出 KathaTrace 以文本、图像和联合证据评估转场可恢复性,并用 STG 衡量可视化造成的语义轨迹塌缩。作者构建 KathaBench-25K,覆盖 5000 个经典叙事和近 2.9 万个问答;实验显示多种生成器仍有显著 STG(约 23.5±1.3),Semantic Compass 可将其降至 21.4,说明转场级规划与修复比单纯提升画质更关键。

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection Figure 1
2026-07-03cs.CV

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

Haoyuan Zhang, Xiangyu Zhu, Li Gao, Ajian Liu, Siran Peng, Zhen Lei

Haoyuan Zhang is with the School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China, the School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China, the Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China

2026-07-03视觉感知

本文针对人脸呈现攻击检测在传感器、光照和攻击材料变化下泛化差的问题,指出现有 CLIP 式方法仅用类别监督学习提示,容易贴合域内伪迹而非可迁移攻击线索。CPG-PAD 的核心是用 XAI 从预训练 VLM 中发现与 PAD 相关的视觉概念,并以概念热图监督提示学习,通过 VCE、PCI 和 VPD 将模型内部概念注入 prompt 空间。实验覆盖 9 个基准,在多源、少源和单源跨域设置下均达到或超过 SOTA,且消融显示概念映射与视觉-提示交互带来主要增益。

AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting Figure 1
2026-07-03cs.CV

AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting

Dexu Zhu, Jiangnan Shao, Xiaofeng Wang, Junxian Duan, Jie Cao, Zheng Zhu, Huaibo Huang

2026-07-03三维

本文针对低质量 3D Gaussian Splatting 资产常见的细节缺失、纹理噪声,以及现有 2D 超分再重建流程带来的多视角不一致、耗时和依赖原始图像问题,提出直接在 3DGS 结构上工作的 AnchorSplat。其关键是用点锚机制将新细节限制在局部几何附近,并以单次乘法生成替代迭代增密。实验在新建 3DGS-SR 基准上达到 SOTA,吞吐最高较优化法快 10^5 倍,并能零样本增强生成资产和真实扫描。

Benchmarking Federated Learning and Knowledge Distillation for Point Cloud Classification Figure 1
2026-07-03cs.GR

Benchmarking Federated Learning and Knowledge Distillation for Point Cloud Classification

Aizierjiang Aiersilan

University of Macau

2026-07-03数据集/基准三维

面向隐私敏感且算力受限的三维点云部署,论文构建了联邦学习与知识蒸馏联合基准,覆盖13种FL算法、10种KD目标及完整组合。结果显示极端非IID标签偏斜下FL显著退化且无通用最优;KD可将学生模型缩小约74.5%、推理约加速一倍。但含硬标签交叉熵的蒸馏会掩盖崩溃教师的失败,学生高精度主要来自代理标签,因此作者建议采用无标签蒸馏评估FL-KD。

2026-07-02

160 篇
Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models Figure 1
2026-07-02cs.CV

Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models

Yue Han, Chong Li, Zhening Liu, Cong Huang, Fang Deng, Yong Liu, Fangyun Wei, Yan Lu

2026-07-02视觉感知生成模型三维

Ink3D针对现有3D生成模型几何已较成熟、但受限于高质量3D纹理数据稀缺而难以还原文字、织物和高频装饰等复杂外观的问题,将几何与纹理解耦:先生成白模,再用条件视频模型生成水平与垂直360度环绕视图,并通过TextureOptimizer把密集多视角观测稳健烘焙到几何上。文中结果显示,其纹理细节、覆盖完整性和跨视角一致性优于稀疏多视图方案,但增益可能主要来自大规模视频先验与更密集视角覆盖。

Linkify: Learning from Interface-Augmented Assembly Graphs Figure 1
2026-07-02cs.CV

Linkify: Learning from Interface-Augmented Assembly Graphs

Anushrut Jignasu, Daniele Grandi

Iowa State University, Iowa State University USA

2026-07-02视觉感知

这篇论文针对CAD装配中现有零件检索多依赖整体形状或文本、难以回答“此处应放什么零件”的问题,提出将零件接触界面显式编码到装配图边上的 Linkify。其核心洞察是功能约束主要体现在局部接触几何,而非单个零件形状;作者重算 Fusion 360 装配接触并用 GATv2 做遮挡零件预测。结果显示其在Top-K与F1上优于非图基线,消融表明准确接触、边属性和动态注意力均有贡献,但绝对Top-1仍较低。

World from Motion: Generative Dynamic Gaussian Reconstruction from Monocular Video Figure 1
2026-07-02cs.CV

World from Motion: Generative Dynamic Gaussian Reconstruction from Monocular Video

Liyuan Zhu, Shengyu Huang, Amrita Mazumdar, Tianye Li, Zan Gojcic, Gordon Wetzstein, Iro Armeni, Shalini De Mello, Alex Trevithick

Stanford University

2026-07-02视觉感知生成模型强化学习三维

单目视频4D重建常在几何一致性与生成补全之间取舍,尤其难恢复未观测动态区域。World from Motion的核心洞察是把动态3D Gaussian作为可微世界表示,渲染外观、几何和3D运动等密集条件来约束视频生成,再将新视角与新运动蒸馏回统一3DGS。文中报告其在DyCheck感知质量和运动估计上达到新SOTA,并能泛化到大视角变化的野外视频。

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning Figure 1
2026-07-02cs.CV

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

Zhejiang University

2026-07-02视觉感知

这篇论文针对高分辨率图像中细小关键线索难以定位、导致细粒度视觉推理失败的问题,提出 P2R 将“看哪里”的感知与“如何答”的推理解耦:先生成相关框和裁剪区域,再基于标注图推理,并用 PRA-GRPO 在仅有最终答案监督下交替优化两种角色。基于 Qwen3-VL,P2R 在 V-Star、HR-Bench-4K/8K 上显著超过对应骨干,4B 模型分别达到 93.2%、81.9%、80.5%。

High-dimensional Embedding Prior for Noisy K-space Domain MRIReconstruction Figure 1
2026-07-02cs.CV

High-dimensional Embedding Prior for Noisy K-space Domain MRIReconstruction

Yu Guan, Tianjia Huang, Qinrong Cai, Qiuyun Fan, Dong Liang, Qiegen Liu

2026-07-02三维

该文针对实际 MRI 加速采集中欠采样与噪声共同导致的 k-space 重建不稳定问题,指出扩散式重建不应只改采样器或数据一致性,还应改造变量表示;提出 HEP 高维嵌入先验,将 k-space 提升到更具表达力的表示空间,并可即插即用接入多种扩散逆问题求解器。实验覆盖不同噪声、欠采样率和轨迹,在院内与公开数据上均提升重建质量,高噪声场景增益最大。

Structured 4D Latent Predictive Model for Robot Planning Figure 1
2026-07-02cs.RO

Structured 4D Latent Predictive Model for Robot Planning

Zhiyi Li, Peilin Wu, Xiaoshen Han, Ruojin Cai, Yilun Du

2026-07-02机器人规划控制

这篇论文针对视频式机器人规划缺乏三维几何一致性、在遮挡和视角变化下易失效的问题,提出在稀疏体素结构化3D潜空间中预测随时间演化的4D场景,并用文本指令条件化生成未来三维目标,再由目标条件逆动力学转成动作。实验显示其相较视频规划器具备更好的多视角一致性和3D一致性,在复杂操作、视觉变化泛化及真实机器人任务上表现更优。

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation Figure 1
2026-07-02cs.CV

EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation

Tatiana Gaintseva, Akshit Achara, Gregory Slabaugh, Jiankang Deng, Ismail Elezi

Gregory Slabaugh

2026-07-02视觉感知

针对文生图模型在“护士”“CEO”等中性职业提示下放大性别、种族、年龄偏差的问题,EquiSteer将去偏从训练或批量约束转向推理期交叉注意力激活控制:用对比提示预计算属性 steering 向量,并通过提示感知门控保留显式属性提示,对中性提示先正交移除既有属性信号再注入目标属性。在SD-1.5、SD-2.1、SDXL和SANA上,平均公平性差距最高降低87%,且图像质量与文本对齐影响较小。

Relation-Centric Open-Vocabulary 3D Gaussian Segmentation Figure 1
2026-07-02cs.CV

Relation-Centric Open-Vocabulary 3D Gaussian Segmentation

Eunsung Cha, Hyunjoon Lee, Jaesik Park

Seoul National University, Republic of Korea

2026-07-02视觉感知三维

本文针对开放词汇 3D Gaussian 分割中语言查询灵活性与实例边界一致性难以兼顾的问题,提出 PairGS,将分割转化为高斯之间的成对关系建模。其洞察是 3DGS 的视角贡献、可见性与多视图掩码已包含同实例亲和信息,可用两阶段稀疏图构建和 TreeDBSCAN 形成层级聚类,支持多粒度查询。实验称在相关基准达到 SOTA,快速版较优化实例特征方法快 50 倍。

SD-RouteFusion: Ego-Trajectory Prediction with SD-Map Route Conditioning Figure 1
2026-07-02cs.CV

SD-RouteFusion: Ego-Trajectory Prediction with SD-Map Route Conditioning

Sviatoslav Voloshyn, Bruno K. W. Martens, Wangxin Liu, Jakob Vinkås, Junsheng Fu

2026-07-02规划控制

这篇工作针对自动驾驶自车轨迹预测中过度依赖昂贵 HD 地图、难以规模化部署的问题,提出用可广泛获得的 SD 地图导航路线作为长时域意图先验,并与前视相机和车辆运动学端到端融合。核心设计是路线主导与图像主导的双假设加门控分类器,使路线可靠时利用其消歧,路线错误或视觉不确定时保持鲁棒。在 48 万真实驾驶场景上,SD 路线条件带来 10.5% ADE 降低,完整融合在 8 秒预测上降低 16.9%。

Towards Metric-Agnostic Trajectory Forecasting Figure 1
2026-07-02cs.CV

Towards Metric-Agnostic Trajectory Forecasting

Markus Knoche, Daan de Geus, Bastian Leibe

2026-07-02规划控制

本文针对轨迹预测模型过度绑定 Argoverse、Waymo 等评测指标的问题,主张先用与指标无关的概率目标学习校准的预测分布,再通过 TraDiE 后处理策略按 minFDE、soft mAP、miss rate 等指标抽取 K 条轨迹。作者将 DONUT 改为 NLL 训练的 DONUT-NLL,并比较不同位置分布,结果在 Waymo 多项指标达到 SOTA,同时显示单一模型可适配多种指标,但推理开销增加且 Argoverse 泛化仍有限。

Autonomous Scientific Discovery via Iterative Meta-Reflection Figure 1
2026-07-02cs.CV

Autonomous Scientific Discovery via Iterative Meta-Reflection

Bingchen Zhao, Sara Beery, Oisin Mac Aodha

University of Edinburgh, Massachusetts Institute of Technology

2026-07-02视觉感知

这篇论文针对现有自动科学发现系统依赖预设问题、搜索空间受限且缺少跨发现反思的问题,提出 DiscoPER:让 LLM 生成可执行统计分析,并用 Propose-Evaluate-Reflect 循环把已验证/被拒发现作为“经验数据”进行二阶反思,继续引导开放式多模态探索。在 iNatDisco 生态 benchmark 上恢复 8/9 个已知模式,假设支持率 72.7%,优于因果发现和 LLM 基线;消融显示反思与更多数据均有增益。

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models Figure 1
2026-07-02cs.CV

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

Jiale Li, Sihan Chen, Mengyuan Liu

Xiamen University, South China University of Technology, Peking University, Xiamen University Xiamen China, South China University of Technology Guangzhou China, Peking University Beijing China

2026-07-02视觉感知数据集/基准

这篇论文针对 VideoLLM 容易把未出现的人体动作“脑补”出来的问题,提出 MoHallBench 专门评测运动幻觉,而非仅看物体幻觉或粗粒度动作识别。其创新在于把误判来源拆成共现先验、顺序推断和相似动作混淆,并构造 11306 个视频、40493 个问答及双向提问指标以抑制肯定偏置。实验显示,动作识别强不等于抗幻觉强,尤其在截断视频引发的顺序推断场景中,模型最容易根据部分线索过度推断结果。

CPDDNet: Color-Polarization Denoising and Demosaicking Network Figure 1
2026-07-02cs.CV

CPDDNet: Color-Polarization Denoising and Demosaicking Network

Qihang Zhang, Yusuke Monno, Masayuki Tanaka, Masatoshi Okutomi

2026-07-02视觉感知

本文针对彩色偏振滤波阵列在低光、短曝光下同时存在噪声和马赛克缺失的问题,指出传统先去噪后去马赛克或相反的串联流程会传播噪声或抹平结构。CPDDNet以DN-to-DM为主干,引入特征融合模块,把原始带噪CPFA特征与去噪特征在去马赛克阶段桥接起来,以减少信息损失。实验证明其在真实数据集上提升图像质量和偏振参数精度,优于现有基线与分离式方法。

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models Figure 1
2026-07-02cs.CV

LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models

Arpita Nema, Hanwei Zhu, Xi Zhang, Weisi Lin

2026-07-02视觉语言视觉感知数据集/基准

长视频质量理解需要模型在较长时间内追踪画质退化、时序一致性和累积失真,但现有基准多停留在短片段。LongVQUBench构建1200余公开视频和1500个问答,按局部、跨事件、全局三层评估,并加入稀疏“针尖”失真检测。对14个LVLM的零样本实验显示,视频越长、推理层级越深性能越明显下降,暴露其长程时序整合和失真归因能力不足。

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation Figure 1
2026-07-02cs.RO

Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation

Chi Zhang, Penglin Cai, Ziheng Xi, Haoqi Yuan, Hao Luo, Wanpeng Zhang, Sipeng Zheng, Chaoyi Xu, Zongqing Lu

Peking University, Tsinghua University

2026-07-02机器人

针对机器人触觉数据难采集、现有 VLA 多依赖视觉而难处理接触密集操作的问题,本文提出 H-Tac 人类第一视角触觉-动作数据集,并用统一触觉/动作空间进行 TTP 预训练与机器人后训练,引入触觉专家预测未来触觉以建模接触动力学。仿真和真实机器人实验显示其优于无预训练或无触觉基线,在精细操作、泛化和跨形态迁移上更稳健,但具体增益中数据规模贡献可能较大。

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision Figure 1
2026-07-02cs.CV

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

Dianyu Wang, Yidan Zhang, Peirong Zhang, Xuyang Li, Xiaoxuan Liu, Lei Wang

This work was supported in part by Key Program of Chinese Academy of Sciences under Grant KGFZD-145-25-38 and RCJJ-145-24-13

2026-07-02视觉语言视觉感知

针对遥感视觉定位中目标小、干扰物多且查询依赖参考物和空间关系的问题,GeoSearcher不再一次性生成框,而是把已验证参考物坐标作为锚点,引导模型逐步缩小搜索区域;并通过ACR-SFT与带过程奖励和样本选择的PF-GRPO监督推理过程。实验显示其在DIOR-RSVG、OPT-RSVG和VRS-Bench上超过现有方法,尤其利于多线索小目标定位。

GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models Figure 1
2026-07-02cs.CV

GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models

Hongkuan Zhou, Tristan Rehm, Nadeem Nazer, Lavdim Halilaj, Jingcheng Wu, Steffen Staab

Institute for Artificial Intelligence University of Stuttgart, Stuttgart, Germany, Otto-von-Guericke-University Magdeburg, Magdeburg, Germany, University of Southampton, Southampton, UK

2026-07-02视觉语言视觉感知

论文针对工业质检中“是否异常、在哪、何种缺陷、为何异常”难以由单一模型同时回答的问题,提出 GenAU,在指令式 VLM 中加入 [SEG_defect]/[SEG_normal] 作为语言锚点,将解码隐藏状态与多尺度视觉特征对齐生成异常图,并联合文本与分割训练。跨数据集实验显示其在 VisA、Real-IAD 的零样本图像级检测优于多数 CLIP 基线,同时具备多类型识别和缺陷解释能力,但分割仍未超过专用 CLIP 方法,存在推理能力与定位性能的权衡。

EchoRisk: A Multicentre Echocardiography Dataset and Benchmark for Cardio-Oncology Figure 1
2026-07-02cs.CV

EchoRisk: A Multicentre Echocardiography Dataset and Benchmark for Cardio-Oncology

Grigorios Kalliatakis, Georgia Karanasiou, Georgios Manikis, Manolis Tsiknakis, Dimitrios Fotiadis, Dorothea Tsekoura, Kalliopi Keramida, Vasileios Bouratzis, Lampros Lakkas, Katerina Naka, Andri Papakonstantinou, Anastasia Constantinidou, Kostas Marias

2026-07-02数据集/基准安全鲁棒

针对乳腺癌治疗相关心脏毒性难以及早从常规超声中自动分层的问题,EchoRisk提供首个多中心、纵向且带明确心毒性标签的超声心动图数据集与MICCAI 2026基准,覆盖LVEF估计、纵向左室功能障碍分类和治疗前风险预测三项任务。R(2+1)D+LSTM基线在功能评估和障碍分类上表现较强,但仅凭治疗前视频预测未来心毒性仍是主要瓶颈。

Reading Order Inference for Complex Document Layouts Figure 1
2026-07-02cs.CL

Reading Order Inference for Complex Document Layouts

Iddo Hakim, Sharva Gogawale, Omer Ventura, Gal Grudka, Daria Vasyutinsky-Shapira, Berat Kurar-Barakat, Nachum Dershowitz

2026-07-02视觉感知

复杂历史文档常含多条交织阅读流,几何邻近难以判定真实顺序。本文将 OCR 行建成候选转移图,用轻量语言模型的连贯性信号为边打分,并以最大后悔规则求受度约束的路径覆盖,避免贪心“抢边”。在 Glossa 环绕布局上继承边准确率约 95%(XY-cut 50%),OmniDocBench 多栏子集达 88%,优于 XY-cut 和迁移不佳的 LayoutReader。

SuperFlex: Deformable Superquadrics for Point Cloud Decomposition Figure 1
2026-07-02cs.CV

SuperFlex: Deformable Superquadrics for Point Cloud Decomposition

Gabriel Tavernini, Elisabetta Fedele, Tiago Novello, Leonidas Guibas, Marc Pollefeys, Francis Engelmann

2026-07-02三维

SuperFlex针对超二次曲面分解在三维物体表示中虽紧凑可解释、但重建精度不足、只能表达刚性对称部件且难处理真实遮挡点云的问题,提出新的训练损失,并将弯曲与锥化变形纳入学习式超二次曲面预测,再用高质量完整分解监督部分点云输入。实验在ShapeNet和Aria合成环境上显示,其相较优化式与学习式基线显著提升重建精度,同时保持少量参数的紧凑表示,并能从部分观测恢复较完整的原语结构。

Foundation Models vs. Radiomics for Lung Computed Tomography: A Benchmark of Feature Extractors, Classification Heads, and Segmentation Choices Figure 1
2026-07-02cs.CV

Foundation Models vs. Radiomics for Lung Computed Tomography: A Benchmark of Feature Extractors, Classification Heads, and Segmentation Choices

Nils Neukirch, Martin Maurer, Nils Strodthoff

2026-07-02视觉感知数据集/基准

这篇论文针对肺部 CT 中放射组学与基础模型比较常被固定分割、分类头且缺少外部验证的问题,构建了覆盖特征提取器、分类头、分割方案和多任务的因子化基准。结果显示关键因素随任务变化:体积和分期主要受分割影响,生存、组织学和年龄更依赖分类头;放射组学在体积、分期和生存上仍有竞争力,Curia 系列在部分任务接近最优,DINOv3略弱,默认推荐为肿瘤分割下 Curia+CatBoost。

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution Figure 1
2026-07-02cs.CV

AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution

Geunhyuk Youk, Jeonghyeok Do, Dayeon Kim, Jihyong Oh, Munchurl Kim

2026-07-02视觉感知生成模型

针对扩散视频超分多固定倍率、任意尺度方法在大倍率下过平滑且易闪烁的问题,AVSR-Diff将低分辨率潜空间去噪与连续坐标渲染解耦,用TGFR对齐跨帧扩散先验,并以SAFR按目标尺度调制频率细节。实验显示其在多尺度上兼顾高频纹理与时间稳定性,优于任意尺度基线,且在4×上超过部分固定尺度生成式方法。

QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding Figure 1
2026-07-02cs.CV

QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding

Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian

2026-07-02视觉感知

长视频送入 Video-LLM 时受冗余帧和 token 预算限制,均匀采样或只看查询相似度容易漏掉关键片段或选到重复内容。QCA 的核心是同时利用查询相关性与内容偏离度,先按时间段估计信息贡献并自适应分配帧预算,再在段内以最相关帧为锚点贪心选择兼具相关性和多样性的关键帧,且无需额外训练。实验显示其在 LongVideoBench、Video-MME 等基准上优于多种采样策略,并在 LLaVA-Video、Qwen3-VL 上带来约 4%–4.78% 平均增益。

Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization Figure 1
2026-07-02cs.CV

Privacy-Preserving Depth-Only Open-Vocabulary 3D Semantic Segmentation Via Uncertainty-Guided Test-Time Optimization

Xuying Huang, Sicong Pan, Maren Bennewitz

2026-07-02视觉感知优化算法三维安全鲁棒

这篇论文面向室内机器人在家庭、医院等隐私敏感场景中的开放词汇3D语义分割,指出依赖RGB会泄露视觉信息,而仅用深度几何又会显著增加语义不确定性。作者提出UTTO,在测试时用增强一致性估计逐点不确定性,只优化类别分布,并结合文本去偏与特征语义一致性先验,保留稳定区域、细化不可靠区域。ScanNet20/40/200实验显示其在无RGB、无额外训练条件下稳定优于代表性基线。

TRCGL-Net: A Long-Tailed Multi-Label Chest X-Ray Classification Framework with Generative Data Augmentation and Label Co-Occurrence Modeling Figure 1
2026-07-02cs.CV

TRCGL-Net: A Long-Tailed Multi-Label Chest X-Ray Classification Framework with Generative Data Augmentation and Label Co-Occurrence Modeling

Tong Shao, Hongshun Ling, Li Zhang, Jinjing Wu, Junke Wang, Yuan Gao, Fang Wang

2026-07-02生成模型

这篇论文针对胸片多标签分类中的极端长尾问题:稀有病灶样本少、特征易被解剖背景淹没,且标签共现建模常被高频类别主导。TRCGL-Net用文本引导条件扩散生成尾类样本,并结合通道/类别注意力与标签共现GCN增强尾类表征。在PadChest上尾类mAP达0.4904、整体mAP 0.4408、mAUC 0.8989,但主要增益可能较多来自生成式数据扩增。

QuaMoE-DRF: Proactive Beam and Rate Adaptation via Multimodal Dynamic Radio Map Forecasting in ISAC Networks Figure 1
2026-07-02cs.IT

QuaMoE-DRF: Proactive Beam and Rate Adaptation via Multimodal Dynamic Radio Map Forecasting in ISAC Networks

Zhihan Zeng, Kaihe Wang, Zhongpei Zhang, Chongwen Huang

Engineering, Zhejiang University, Hangzhou 310027, China, Provincial Key Laboratory of Multi-Modal Communication Networks and, and also with the National Key Laboratory

2026-07-02视觉语言

面向6G ISAC中车辆等移动遮挡导致的毫米波链路突变,论文认为单纯预测波束索引会丢失SINR裕量、MCS阈值和基站备选信息,提出以未来beam-SINR场为中间表征的QuaMoE-DRF,并用质量感知MoE融合静态几何、运动事件、结构化感知和无线历史。在动态多基站城市基准上,有效率达402.5 Mbps、 outage为0.0417,相比最强基线速率提升5.67%、中断降低8.35%;但验证主要依赖简化阻塞/路径损耗仿真标签。

Slope-Guided Mamba and Angular-Refined Transformer for Light Field Super-Resolution Figure 1
2026-07-02cs.CV

Slope-Guided Mamba and Angular-Refined Transformer for Light Field Super-Resolution

Li Jin, Jian Huang, Junde Lu, Shuai Wang, Hao Sheng, Jie Wu

2026-07-02视觉感知

本文针对光场超分中空间—角度建模割裂、Mamba规则扫描与EPI斜线几何不匹配的问题,提出SMART混合网络:用角度调制空间注意力增强跨视角约束,并以估计EPI斜率引导Mamba沿几何一致轨迹聚合特征。五个基准上达到SOTA,PSNR较既有方法提升0.42 dB,伪影更少。

GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting Figure 1
2026-07-02cs.CV

GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting

Haijie Yang, Zhenyu Zhang, Yixuan Dong, Jianjun Qian, Jian Yang

2026-07-02三维

这篇论文针对情感说话头在唇形同步、表情强度可控与实时性之间难以兼顾的问题,将生成过程拆成“中性说话空间+情感残差形变”:先用 GaussianBlendshapes 建立身份相关的高保真中性 3D Gaussian 表示,再融合网格位移、音频、情感类别和强度,通过空间-音频-情感注意力预测 Gaussian 属性偏移。实验显示其在视频质量、唇同步、情感强度控制和实时渲染上优于或接近近期方法。

Learning Cardiac Motion Priors for Implicit Neural Representations Figure 1
2026-07-02cs.CV

Learning Cardiac Motion Priors for Implicit Neural Representations

Andrew Bell, George Webber, Andrew P King, Steffen E Petersen, Muhummad Sohaib Nazir, Alistair Young

2026-07-02视觉感知

针对每个病例单独优化心脏运动 INR 耗时且易受初始化轨迹影响的问题,本文系统比较了群体先验、权重平均共识先验、auto-decoder 与元学习四类心脏运动先验。结果显示,学习先验在少步适配中均显著优于随机初始化,将平均位移误差由 3.45 mm 降至 1.66–1.85 mm;auto-decoder 更快恢复大形变,元学习在 50 步适配中保持最佳优化轨迹。

Dataset Biases and Shortcut Learning in Motion-Based AI-Generated Video Detection Figure 1
2026-07-02cs.CV

Dataset Biases and Shortcut Learning in Motion-Based AI-Generated Video Detection

Joren Michels, Lode Jorissen, Nick Michiels

Digital Future Lab, Flanders Make, Hasselt University

2026-07-02视觉感知数据集/基准

针对通用 AI 生成视频检测日益依赖运动线索的问题,本文重新评估 D3、ReStraV、Over-Coherence、NSG-VD 等运动型检测器,核心洞察是其高分很大程度来自采样、预处理和数据集运动分布偏差,而非稳健捕捉生成视频本质缺陷。作者通过去偏、时间重平衡和简单空间增强发现,多数方法性能降至接近随机或显著退化;相比之下,频域检测器 WaveRep 在多数据集上更稳定,提示未来基准需更重视无偏数据与评测协议。

Post-Training Pruning for Diffusion Transformers Figure 1
2026-07-02cs.CV

Post-Training Pruning for Diffusion Transformers

Chengzhi Hu, Xuewen Liu, Jing Zhang, Mengjuan Chen, Zhikai Li, Qingyi Gu

2026-07-02生成模型

本文针对 DiT 图像生成模型推理成本高、现有 LLM 剪枝准则迁移后因权重尺度更大而误判重要性的痛点,提出 DiT-Pruning:用能量视角重新平衡权重与激活的显著性,并依据二维权重空间中的聚类结构自适应选择层级/通道级剪枝粒度。实验显示其在高稀疏率下更能保持生成质量,FLUX.1-dev 在 MJHQ 512×512、50% 稀疏时 CLIP 分数仅下降 0.001。

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images Figure 1
2026-07-02cs.CV

GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images

Zipeng Guo, Xiaoan Liu, Lichen Ma, Cheng Wang, Yu He, Xiaolong Fu, Jingling Fu, Xinyuan Shan, Shaojie Guo, Luohang Liu, Junshi Huang, Yan Li

Wuhan University, Xi’an Jiaotong University, Sun Yat-sen University

2026-07-02视觉感知

面向电商图像中贴纸、标签、Logo 等局部元素的多步编辑需求,论文指出一次性编辑器容易把意图理解、区域定位和生成混在一起,导致漏改或误改。GMO-E²DIT 将任务改写为可审计的多操作完成过程:VLM 先生成带区域与操作类型的编辑议程,再由掩码条件编辑器执行,并用反思循环判断成功、继续或回滚。作者还构建数据流水线和 EComEditBench;实验显示其在指令遵循、区域保真和未编辑区域保持上优于开源及部分闭源基线。

Condensing Large-Scale Datasets Directly with Minimal Information Loss Figure 1
2026-07-02cs.CV

Condensing Large-Scale Datasets Directly with Minimal Information Loss

Xinyi Shang, Peng Sun, Bei Shi, Zixuan Wang, Tao Lin

2026-07-02数据集/基准

针对大规模数据集蒸馏中 Squeeze-Recover-Relabel 流程计算开销高、跨架构泛化弱的问题,论文指出根因是数据到模型再回到图像的双重压缩造成信息损失与分布偏移,使重标注不再可靠。作者提出 CIM,直接度量并最小化真实与合成数据的信息差以保持分布对齐;在 ImageNet-1K、IPC=10 上用单张 RTX-4090 约 80 分钟蒸馏,ResNet-18 Top-1 达 48.7%,较 NRR-DD 和 DELT 分别高 2.6 和 2.9 个百分点。

MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization Figure 1
2026-07-02cs.CV

MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization

Jingchen Ni, Cangjin Yu, Dan Jiang, Quan Zhang, Keyu Lv, Shannan Yan, Linyue Pan, Ke Zhang, Chun Yuan

2026-07-02视觉感知

针对长视频时序伪造定位中 CNN 难建模全局、Transformer 成本高、线性模型又易忽略突变边界的问题,MG-RWKV 将双向 RWKV 用于全序列线性建模,并用多粒度 MoE 选择显式时间感受野、用跨粒度一致性抑制真实片段误报。在 Lav-DF、TVIL、Psynd 等数据集取得 SOTA,Lav-DF mAP 为 87.29%,严格边界指标提升明显且计算复杂度保持 O(T)。

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors Figure 1
2026-07-02cs.CV

DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors

Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha, Dooyoung Kim, Eunjae Shin, Benjamin Busam, Woontack Woo

2026-07-02强化学习三维

DeWorldSG针对RGB-D序列生成3D语义场景图时物体几何不稳定、逐帧关系推理易漏边的问题,将物体表示为由深度过滤得到的实例级概率3D高斯节点,并跨帧聚合关系证据,引入V-JEPA 2世界模型先验补全上下文关系。在3DSSG和ReplicaSSG上取得SOTA,较既有方法三元组召回提升77.4%、谓词召回提升23.2%,显示其对机器人操作和AR场景理解更可靠。

Geometry-Aware Cross-Height Channel Knowledge Map Prediction for UAV-Assisted Communications With Uncertainty-Guided 3D Sensing Figure 1
2026-07-02cs.CV

Geometry-Aware Cross-Height Channel Knowledge Map Prediction for UAV-Assisted Communications With Uncertainty-Guided 3D Sensing

Zhihan Zeng, Amir Hussain, Yue Xiu, Phee Lep Yeoh, Lu Chen, Zhongpei Zhang, Guan Gui

2026-07-02三维安全鲁棒

面向无人机在陌生城市中只能稀疏测量少数高度、却需推断未测高度信道图的需求,论文将问题明确为高度条件化的跨高度 CKM 预测。核心做法是用 FPN-Transformer 融合城市几何先验、多高度稀疏观测与目标高度描述,并加入不确定性头指导带运动和安全约束的在线感知。实验显示其在未见场景零样本 RMSE 为 5.347 dB,优于 3D-RadioDiff 的 6.937 dB;10-shot 适配降至 3.518 dB,主动感知预算 40 时降至 4.79 dB。

Beyond Pixel Overlap: A Framework for Decomposing Segmentation Evaluation Metrics Figure 1
2026-07-02cs.CV

Beyond Pixel Overlap: A Framework for Decomposing Segmentation Evaluation Metrics

Youwei Pang, Xiaoqi Zhao

Nanyang Technological University

2026-07-02视觉感知强化学习数据集/基准

针对二值目标分割中 IoU、像素误差等指标难以解释结构、边界、目标尺寸公平性和任务语义差异的问题,本文将评价指标拆成预测表示、目标提取、目标匹配、得分计算和结果报告五个阶段。核心洞察是把指标视为模块组合而非孤立公式,从而显式暴露阈值、粒度、匹配和聚合假设。主要结果是用该框架梳理多类代表性指标,说明新指标往往是在特定阶段修补旧协议局限,并给出更可复现、任务感知的评价设计空间。

Improving Sparse-View 3DGS Generalization via Flat Minima Optimization Figure 1
2026-07-02cs.CV

Improving Sparse-View 3DGS Generalization via Flat Minima Optimization

Kangmin Seo, Sangeek Hyun, MinKyu Lee, Jae-Pil Heo

2026-07-02优化算法学习理论三维

本文针对稀疏视角下 3D Gaussian Splatting 易过拟合输入图像、 novel view 泛化差的问题,将其解释为落入对参数扰动敏感的尖锐极小值,并把平坦极小值优化引入 3DGS。核心做法是按高斯各向异性尺度进行随机位置扰动,配合训练进度调度和非位置参数周期性重初始化,以在不改网络结构和不依赖外部先验的情况下增强鲁棒性。实验在 LLFF、Mip-NeRF360 及附录多个数据集上显示 PSNR/SSIM/LPIPS 多数提升,重建更稳定清晰,但高视角数场景增益会减弱。

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping Figure 1
2026-07-02cs.CV

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

Xudong Li, Mengdan Zhang, Peixian Chen, Jiaxi Tan, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Xing Sun, Rongrong Ji

Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China, Tencent Youtu Lab, Beijing Institute of Technology

2026-07-02视觉感知

本文针对MLLM在空间问答中常因系统坐标与问题指定的相机、物体或方向自我视角不一致而累积推理错误的问题,提出OmniView-Space:用多视角空间映射生成查询对齐的BEV认知图和文本空间图,并通过工具调用策略与认知图蒸馏让模型学会选择锚点、重建自我视角证据。实验显示其在单图和多图空间推理基准上达到SOTA,蒸馏版还能减少对外部几何流水线的依赖。

EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection Figure 1
2026-07-02cs.CV

EFlow: Learning Evidence Flow for Long-Video Reasoning with Adaptive Reflection

Wenhao Zhang, Kuanwei Lin, Xuyi Yang, Wei Gao, Ge Li

School of Electronic and Computer Engineering, Peking University, The Hong Kong University of Science and Technology

2026-07-02视觉感知生成模型

长视频推理的瓶颈在于模型常先形成答案假设再去裁剪证据,导致“过早语义承诺”和错误定位。EFlow的核心是把时间定位与答案推理解耦:先用T-CoT检索证据片段,再用R-CoT推理,并以低置信度logit margin触发全视频重读。基于Qwen3-VL经SFT、RL和RFT训练后,在VideoMME、LVBench、LongVideoBench、NextGQA等五个基准上均提升,说明显式证据流能改善长视频推理稳定性。

TrajLoc: Trajectory-Attention Localization for Multi-Object Motion Control Figure 1
2026-07-02cs.CV

TrajLoc: Trajectory-Attention Localization for Multi-Object Motion Control

Omer Sela, Inbar Huberman-Spiegelglas, Michael Rotman, Sagie Benaim, Avi Ben-Cohen

Tel Aviv University

2026-07-02规划控制

TrajLoc针对多目标视频生成中轨迹交叉、遮挡导致身份混淆和运动漂移的问题,认为稀疏轨迹无需扩展成密集控制张量,而可直接注入注意力与文本条件空间:用目标位置高斯热图替换每个对象 token 的交叉注意力权重,并以专用 token 编码轨迹、深度和首帧外观。在六个数据集、最多20个对象及两类骨干上,较最强基线平均提升4.3 dB PSNR,并将轨迹终点误差降低51%。

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment Figure 1
2026-07-02cs.CV

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

2026-07-02视觉感知

这篇论文针对 CLIP 式视频文本预训练在长视频中容易出现的时间错位与语义纠缠问题,指出帧级视觉细节与文本概念之间本身是稀疏且非对称相关的。MoVA 将对齐建模为潜变量识别问题,并引入文本侧帧感知概念选择与视频侧文本相关概念解耦的双非对称投影,在帧级做模块化对比学习。实验显示其在长短视频检索、文本到视频生成和概念可视化等任务上优于现有方法。

Mirror-Fusion Attention for Reflection-Aware Self-Supervised Representation Learning Figure 1
2026-07-02cs.CV

Mirror-Fusion Attention for Reflection-Aware Self-Supervised Representation Learning

Ruixin Li, Jin Liu, Yuling Shi, Stefano Lodi

2026-07-02视觉感知

这篇论文针对标准自监督学习把翻转当作不变增强、可能抹平医学影像和人脸中有用左右差异的问题,提出 MFASSL:在 ViT 预训练中构造镜像配对视图,用轻量 Mirror-Fusion Attention 在对应 token 间自适应交互,并加入反射一致性与中层对齐损失。实验在 CheXpert、BraTS、CelebA-HQ、WFLW 上相较 MoCo-v3、DINO、MAE 和若干等变 SSL 提升下游性能、校准与反射鲁棒性,额外参数约 2.7%。

Rethinking Multi-Label Image Classification With Deep Learning: Taxonomy, Challenge, and Outlook Figure 1
2026-07-02cs.CV

Rethinking Multi-Label Image Classification With Deep Learning: Taxonomy, Challenge, and Outlook

Xuelin Zhu, Xiu-Shen Wei, Jiawei Ge, Shuai Xu, Bing Wang

2026-07-02视觉感知

这篇综述针对多标签图像分类在深度学习时代文献分散、旧有综述停留在统计学习阶段的问题,系统梳理问题定义、数据集、骨干与指标,并提出按区域、标签、架构、表征、学习和数据六类组织的方法谱系。核心洞察是将MLIC中的视觉区域、标签语义与数据偏差视为相互制衡的学习博弈;主要结果是总结近十年方法演进、开放挑战及VLP/LLM背景下的未来方向,而非提出新的模型性能增益。

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences Figure 1
2026-07-02cs.CV

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Zhenjia Li, Jinrang Jia, Yifeng Shi

Ke Holdings Inc.

2026-07-02强化学习三维

针对单张室内全景图只能原地环视、难以支持自由走动的问题,Pano2World将场景扩展改写为多目标位姿的联合生成:先构建粗3DGS代理并渲染几何引导全景,再用带View-Aware Attention Routing的PanoDiT联合补全多视图,并通过Latent Feature Adapter直接把扩散隐特征转为3D高斯场景。实验显示其在多位置全景新视角合成中优于迭代补全和视频到3D流程,同时提升一致性与生成效率。

Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns Figure 1
2026-07-02cs.CV

Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns

Andrea Sanchietti, Riccardo Marin, Bharat Lal Bhatnagar, Yuanlu Xu, Gerard Pons-Moll

2026-07-02三维

服装建模既需要三维几何的拓扑灵活性,又需要二维纸样的可制造语义,但传统二者转换依赖慢且难端到端优化的物理仿真。本文提出 StEm-Net,用 BoxMesh 将纸样面片放入规范三维配置,并借助预训练 3D 基础模型学习 3D 服装与 2D 纸样共享潜空间,实现无仿真、可微的双向映射。实验在两个数据集上用于三维点云到纸样预测,相比最接近方法最高降低约 15% 误差,并支持测试时适配和纸样编辑传播到三维服装;但细节服饰、多层材料等仍受数据稀缺限制。

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization Figure 1
2026-07-02cs.CV

Training-Free Debiasing of Diffusion Models via CLIP-Guided Denoising Optimization

Dain Kim, Jinseo Kim, Sungyong Baik

Dept. of Artificial Intelligence, Hanyang University, South Korea, Dept. of Data Science, Hanyang University, South Korea

2026-07-02生成模型优化算法

本文针对文本到图像扩散模型在中性职业提示下仍产生性别、种族刻板偏差的问题,提出无需训练的 TES:在采样过程中直接优化条件文本嵌入,先在早期去噪阶段校准全局生成方向,再用 CLIP 对中间干净图估计进行反馈细化。Stable Diffusion 实验显示,该方法较现有训练免费基线更能降低人口属性偏差,同时基本保持图像质量与语义一致性。

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration Figure 1
2026-07-02cs.CV

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

Ziyu Ma, Shidong Yang, Yuxiang Ji, Yiming Hu, Tongwen Huang, Yong Wang, Jianfei Cai, Xiangxiang Chu

2026-07-02视觉感知

本文针对高分辨率图像在多模态大模型中被整体缩放后细节丢失、几何切块又会割裂目标并引入背景干扰的问题,提出训练无关、模型无关的 HEE。核心洞察是裁剪收益很大程度来自去除背景而非单纯放大目标,因此用冻结检测器按实体构建层级搜索,结合双重评分与置信度回溯。实验在 Visual Probe、HR-Bench 和 MME-RealWorld 上优于 ZoomEye、RAP,并在 Qwen2.5-VL、LLaVA-OneVision 等模型上提升准确率且降低开销。

Spotted: Location-informed Reidentification of Hyenas and Leopards in Camera Trap Surveys Figure 1
2026-07-02cs.CV

Spotted: Location-informed Reidentification of Hyenas and Leopards in Camera Trap Surveys

Halil Sina Kelebek, Julia Hindel, Kobus Hoffman, Lauren Hoffman, Andrew Loveridge, Bob Mandinyenya, Kudakwashe Ncube, Justin Seymour-Smith, Andrea Sibanda, Abhinav Valada, Matthew Wijers, Daniele De Martini

Oxford Robotics Institute, University of Oxford, Oxford, UK, Department of Computer Science, University of Freiburg, Germany, Wildlife Conservation Research Unit, Department of Biology, University of Oxford, Oxford, UK, Oxford e-Research Centre, University of Oxford, Oxford, UK

2026-07-02视觉感知

相机陷阱中的动物重识别受低画质、视角光照变化和个体样本不均衡影响,纯视觉模型难以支撑全自动生态监测。Spotted 的核心洞察是利用相机位置与时间戳构造基于最低移动速度的时空可行性先验,并将其用于伪监督适配视觉特征、融合匹配分数和主动抽样人工复核。三套鬣狗与豹数据集上,top-5 准确率较最佳基线提升 2–9 个百分点,并在等效正匹配下最多减少 69 个百分点的人工查询。

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction Figure 1
2026-07-02cs.CV

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He, Patrick Pang, Yue Sun, Ning Mao, Tao Tan, Ritse Mann

2026-07-02视觉感知

这篇论文针对乳腺癌新辅助化疗前pCR预测中多模态关系建模不足、跨中心MRI协议偏差和解释性弱的问题,提出ClinRAG-GRAPH:用临床先验构建患者内图,以关系感知GCN融合DCE-MRI、临床变量和病理标志物,并结合域对抗学习与LLM驱动的相似病例子图RAG。多中心验证显示其内部测试AUC为0.815,两个外部测试集为0.774/0.712,说明跨中心鲁棒性有所提升,但RAG与对抗分支的独立增益仍需看消融细节确认。

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives Figure 1
2026-07-02cs.CV

LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives

Lukas Kuhn, Giuseppe Serra, Randall Balestriero, Florian Buettner

2026-07-02视觉语言视觉感知

这篇论文针对视觉语言编码器从零样本分类转向机器人、VLM 与密集预测中冻结视觉骨干的现实需求,指出传统对比学习主要优化 pooled 对齐,未必产出优质 patch 级特征。LeVLJEPA 用跨模态预测、stop-gradient 与单模态 SIGReg 替代负样本和温度项,在 CC12M/Datacomp-L 上保持线性探测接近 CLIP/SigLIP,虽大规模零样本较弱,但在语义分割及 GQA、VQAv2、POPE 冻结骨干评测中更强。

SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference Figure 1
2026-07-02cs.CV

SpiralFovea: Input-Adaptive Foveated Tokenization as a Third Lever of Resource-Adaptive Inference

Kyan Mahajan, Mohammad Saqlain

2026-07-02视觉感知

论文指出现有自适应推理多在网络深度或注意力上省算力,却仍先生成固定 ViT 网格 token。SpiralFovea 将输入 token 集合本身作为第三杠杆,用无参数局部熵找热点并生成多尺度螺旋式 foveated patch,在进入冻结骨干前丢弃低信息区域。四个细粒度基准上其以约60%更少输入 token 获得+1.7至+2.1个百分点精度、每层注意力 FLOPs 降84%、吞吐提升18–29%,但优势主要集中在全图位置先验较弱的自监督骨干。

Soft Mixture-of-Recursions: Going Deeper with Recursive Vision Transformers Figure 1
2026-07-02cs.CV

Soft Mixture-of-Recursions: Going Deeper with Recursive Vision Transformers

Sang In Lee, Jihun Park

Chungnam National University

2026-07-02视觉感知

这篇论文针对ViT靠堆叠独立层扩容带来的参数与计算成本,提出用递归共享模块增加有效深度,并用SoftMoR按token学习权重融合所有递归步输出,避免只取最终层或硬选择深度导致中间表征浪费。SR-ViT在分类、检测、分割上随递归深度稳定提升,ImageNet-1K中T=1到4使SR-ViT-S从79.83%升至82.48%,仅增加1.7M参数。

Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization Figure 1
2026-07-02cs.CV

Decoupled Guidance: Disentangling Subject and Context Pathways in Text-to-Image Personalization

Seongmin Kim, Kyucheol Shin, Heesun Jung, Jinseo Kim, Sungyong Baik

Dept. of Artificial Intelligence, Hanyang University, South Korea, Dept. of Data Science, Hanyang University, South Korea

2026-07-02视觉感知

本文针对文本到图像个性化中主体保真与场景可编辑性相互牵制的问题,指出根因是主体身份和上下文共用同一条件通路并竞争注意力资源,导致 attention collapse。作者提出 DeGu,将主体与场景拆成独立引导流,并用 CAE、DGM 与 TCAM 做空间融合;实验显示其可插入多类个性化方法和 SD/DiT 骨干,在不改模型权重的情况下提升整体表现,并支持推理时调节保真—可编辑性平衡。

GKDT: General Keypoint Detection Transformer Figure 1
2026-07-02cs.CV

GKDT: General Keypoint Detection Transformer

Changsheng Lu, Yuxin Chen, Haokun Gui, Rong Wang, Jie Yang, Harry Yang, Anton van den Hengel, Jiaya Jia

Hong Kong University of Science and Technology, Hong Kong, China

2026-07-02视觉感知

本文针对现有关键点检测模型多为封闭类别、难以迁移到机器人等开放场景的问题,构建含29个数据源、130万实例的统一数据集MegaKPT,并提出基于DINOv3的GKDT,用视觉/文本提示生成关键点卷积核进行非参数检测。22个测试集上,多数类别PCK@0.1超过90%,但效果可能主要来自大规模数据与基础模型scaling。

FrameONE: Hierarchical Motion Modeling for Universal Multi-View Echocardiographic Keyframe Detection Figure 1
2026-07-02cs.CV

FrameONE: Hierarchical Motion Modeling for Universal Multi-View Echocardiographic Keyframe Detection

Rusi Chen, Yuhao Huang, Hongyuan Zhang, Chao Tian, Shunan Ji, Yuhan Zhang, Dong Ni

2026-07-02视觉感知

这篇论文针对超声心动图ES/ED关键帧检测长期依赖单视图设计、额外标注或光流等重视觉建模的问题,提出FrameONE用分层运动建模统一处理A4C、A2C、PLAX、PSAX四种视图:视图内多任务学习抑制外观偏差,视图间模块将共享心动节律与视图特异运动解耦。在25,872段视频上的实验显示其多数指标优于既有方法,并具备较强跨视图泛化能力。

Active Learning for Cascaded Object Detection: Balancing Coverage and Uncertainty in Table Extraction Pipelines Figure 1
2026-07-02cs.CV

Active Learning for Cascaded Object Detection: Balancing Coverage and Uncertainty in Table Extraction Pipelines

Eliott Thomas, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier

2026-07-02视觉感知安全鲁棒

面向业务文档表格抽取中 TD→TSR 级联标注昂贵且误差会下游传播的问题,本文将平衡覆盖与不确定性的 UHerding 首次改造到双阶段检测流程,并提出 RankFusion 与 CAPA 显式利用检测、结构两类表征及阶段瓶颈信号。四个数据集、71–500 文档预算实验显示 UHerding 已优于基线;RankFusion 期望收益更高但方差较大,CAPA 在四个数据集中三个超过标准 UHerding,说明主动学习策略选择主要受流水线瓶颈位置影响。

GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception Figure 1
2026-07-02cs.CV

GaussianFusion: Unified 3D Gaussian Representation for Multi-Modal Fusion Perception

Xiao Zhao, Chang Liu, Mingxu Zhu, Zheyuan Zhang, Linna Song, Qingliang Luo, Chufan Guo, Kuifeng Su

Tencent, Autonomous Driving Lab

2026-07-02三维

这篇论文针对自动驾驶多模态感知中 BEV 离散网格易丢失细节、跨模态对齐和交互受限的问题,提出用连续 3D Gaussian 作为统一表征,在量化到 BEV/体素前完成相机与 LiDAR 特征融合。核心设计包括前向投影的高斯初始化、共享跨模态高斯编码器和高斯混合融合,使不确定性与边界细节可被迭代建模。nuScenes 上较 BEVFusion 提升 2.6 NDS,占用预测较 GaussFormer 提升 1.55 mIoU,并以更少高斯获得显著加速。

Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation Figure 1
2026-07-02cs.CV

Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation

Le Ou, Xiliang Zhu, Huanwen Liang, Wenxiong Pan, Yuhao Huang, Yuxiang Deng, Xuan Sheng, Hong Yin, Juhua Xiao, Xin Zhou, Dong Ni

2026-07-02视觉感知

本文针对临产前胎儿体重估计依赖标准切面和熟练超声操作者的问题,改用盲扫超声视频,并以胎儿视觉语言基础模型按解剖先验筛选关键帧,再用冗余感知压缩与注意力回归聚合信息。其核心价值在于把标准平面检测弱化为解剖相关帧选择,在839名患者前瞻数据上达到161.3g MAE,10%误差内占90.23%,优于Hadlock和多种对比方法。

Prototype Memory-Guided Training-Free Anomaly Classification and Localization in Prenatal Ultrasound Figure 1
2026-07-02cs.CV

Prototype Memory-Guided Training-Free Anomaly Classification and Localization in Prenatal Ultrasound

Huanwen Liang, Yuhao Huang, Xiliang Zhu, Yuanji Zhang, Xuedong Deng, Xinru Gao, Guowei Tao, Yuhan Zhang, Dong Ni

2026-07-02视觉感知

针对产前超声异常样本稀缺、类别异质且临床难以为新病种反复微调的问题,论文提出基于DINOv3视觉基础模型的免训练少样本框架,用类级与病灶级多粒度原型记忆库进行分类,并通过原型驱动软合并定位异常区域、再用类别一致性细化预测。在含1,149例、2,357张图像、9类异常的多中心数据上优于对比方法,但临床泛化验证仍文中未充分说明。

Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation Figure 1
2026-07-02cs.CV

Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation

Zhaowen Zhu, Li Zhang, Yujie Chen, Tian Zhang, Yingjie Wang, Mingxia Zhan

2026-07-02安全鲁棒

这篇论文针对自动驾驶中自监督单目深度估计在动态交通场景易失效、轻量模型又难保边界细节的问题,提出 FlexDepth 系列:用尺度驱动解码器按模型规模选择融合组件,并通过静态/动态两阶段解耦训练分别评估背景与运动物体置信度。实验称其在 KITTI 等驾驶基准上无需辅助信息达到同尺度 SOTA,Flex-Nano 仅 0.7 GFLOPs、移动端 37.6 FPS,但具体增益中 scaling 与训练策略的相对贡献仍需看消融。

ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition Figure 1
2026-07-02cs.CV

ConRTF: Edge-Constrained Boundary Distribution Refinement for Realtime TransFormer Table Structure Recognition

Eliott Thomas, Tri-Cong Pham, Mickael Coustaty, Aurelie Joseph, Gaspar Deloin, Vincent Poulain d'Andecy, Jean-Marc Ogier, Antoine Doucet

2026-07-02视觉感知学习理论

该文针对表格结构识别中行列边界微小误差会放大为单元格归属错误的问题,认为通用检测器忽略了行、列边界重要性不对称。ConRTF在D-FINE式分布边界细化上加入训练期EFL损失,强化行的水平边、列的垂直边且不增加推理开销。在PubTables-1M和两个私有集上,相比优化基线及RT-DETRv2、YOLOv10/11等实时检测器稳定提升,最高约+1.6 GriTS,并在2k–3k标注表格下仍保持较好效果。

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization Figure 1
2026-07-02cs.CV

AV-SyncBench: Decoupled Benchmarking of Temporal and Semantic Audio-Visual Synchronization

Tianhong Zhou, Mingyang Han, Boyu Li, Yuxuan Jiang, Jiaxin Ye, Dongxiao Wang, Haoxiang Shi, Kunpeng Wang, Jun Song, Cheng Yu, Bo Zheng

Tsinghua University, Beijing, China, Fudan University, Shanghai, China

2026-07-02数据集/基准

现有音视频特征评测常把语义匹配与时间同步混在一起,难以判断模型究竟擅长哪一维。AV-SyncBench用野外视频构建3269段、38390个样本,将全局偏移、局部抖动、变速等时间扰动,与音色/声源替换等保持节奏的语义扰动解耦评测。论文评测5类代表模型,显示不同模型在语义一致性和细粒度时间敏感性上存在明显取舍,具体增益来源文中未充分说明。

Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach Figure 1
2026-07-02cs.CV

Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach

Yingjie Dai, Tianyang Xu, Yanglin Deng, Xiao-Jun Wu, Josef Kittler

2026-07-02视觉感知

这篇论文针对机器人、穿戴和拥挤监控等场景中视野受限导致骨架关节大量缺失的问题,提出 PartialVisGraph:用可学习虚拟超边建模多关节高阶关系,并在样本自适应 Transformer 中加入可见性先验以抑制不可见关节干扰。在 NTU RGB+D 60/120 的受限 FoV 模拟评测中,方法在严重视野受限子集上较强基线最高提升 68.8%,完整视野下也保持优势。

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption Figure 1
2026-07-02cs.CV

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

2026-07-02视觉感知

这篇论文针对自回归长视频生成中 KV cache 随历史线性增长、导致显存与吞吐瓶颈的问题,提出 ISPA:不再简单丢弃历史 token,而是在短暂预热后将全局与局部注意力差异通过闭式最小二乘吸收到实例特定的权重调制中,使部分层转为局部注意力。实验覆盖 1.3B 到 14B 模型,最多移除 50% KV cache,视觉质量近乎无损,并结合 W8A8 量化达到 1.86× 推理加速。

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark Figure 1
2026-07-02cs.CV

Creating Impactful Autonomous Driving Datasets: A Strategic Guide from Research Gap to Benchmark

Richard Schwarzkopf, Jonas Merkert, Frank Bieder, Annika Bätz, Alexander Blumberg, Carlos Fernandez, Felix Hauser, Fabian Immel, Christian Kinzig, Hendrik Königshof, Fabian Konstantinidis, Martin Lauer, Willi Poh, Nils Rack, Kevin Rösch, Yinzhe Shen, Marlon Steiner, Gleb Stepanov, Dominik Strutz, Ömer Şahin Taş, Julian Truetsch, Kaiwen Wang, Royden Wagner, Jan-Hendrik Pauls, Christoph Stiller

2026-07-02数据集/基准

这篇论文针对自动驾驶数据集建设常停留在“收了什么”而缺少“为何这样设计”的问题,提出先诊断研究受限于训练数据还是评测能力,再选择能闭合缺口的最低成本数据操作,将重新标注、合并、合成置于新采集之前。作者用既有数据集演化和 KITScenes 案例说明该框架可指导传感器、标注与规模取舍,主要结果是形成一套面向中小团队的基准设计策略,而非报告新模型性能提升。

Imprint: Online Memory Compression for Long-Horizon Egocentric QA Figure 1
2026-07-02cs.CV

Imprint: Online Memory Compression for Long-Horizon Egocentric QA

Kousik Das, Debaditya Roy

2026-07-02视觉感知

针对长时程第一视角问答中,层级文本摘要会抹平重复交互、难以跨天聚合证据的问题,Imprint 将记忆建模为在线压缩而非事后总结:把观察解析为人-动作-物体-时间的交互记录,并按复现、近因和独特性选择性巩固为可检索记忆。在 EgoLifeQA 七天场景中,相同 LLM 下准确率由 31.0% 提升到 35.8%,证据扎实回答增加 6 倍,同时内存降 2.3 倍、检索延迟降 11.8 倍。

LUMA: Benchmarking Segmentation via a Lightweight Universal Mask Adapter Figure 1
2026-07-02cs.CV

LUMA: Benchmarking Segmentation via a Lightweight Universal Mask Adapter

Tobias Christian Nauen, Anosh Billimoria, Federico Raue, Stanislav Frolov, Brian B. Moser, Andreas Dengel

RPTU University Kaiserslautern-Landau, Kaiserslautern, Germany, German Research Center for Artificial Intelligence (DFKI), Kaiserslautern, Germany

2026-07-02视觉感知数据集/基准

这篇论文针对分割骨干比较常被解码器、训练配方和预训练差异混淆的问题,提出轻量通用掩码适配器 LUMA,用外部低成本交叉注意力让查询读取任意骨干特征,从而固定同一分割头公平评测。结果显示 LUMA 以更低或相近成本匹配 EoMT,并在 20 个骨干、11 种预训练上发现所谓高效 token mixer 并未带来吞吐优势,普通 ViT 仍在 Pareto 前沿,分割质量更多由预训练目标和规模决定。

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model Figure 1
2026-07-02cs.CV

ABot-M0.5: Unified Mobility-and-Manipulation World Action Model

Ronghan Chen, Yandan Yang, Zuojin Tang, Dongjie Huo, Tong Lin, Haoning Wu, Haoyun Liu, Yuzhi Chen, Lulu Zheng, Botai Yuan, Tianlun Li, Mingxin Wang, Dekang Qi, Bin Hu, Wei Mei, Yuze Xuan, Haolong Yang, Yanqing Zhu, Mu Xu, Zhiheng Ma, Xinyuan Chang

AMAP CV Lab

2026-07-02机器人强化学习

ABot-M0.5针对移动操作中视频世界模型粒度粗、导航与机械臂动作耦合、训练条件与自回归部署不一致的问题,提出视频→潜在动作→控制的中间表示、双层Mixture-of-Transformers解耦不同动作子空间,并用Dream Forcing让逆动力学在自生成视频上训练。实验显示其在长时程移动操作成功率和细粒度控制精度上优于已有方法,但具体增益仍需结合消融判断。

DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding Figure 1
2026-07-02cs.CV

DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding

Zhengbo Zhang, Mark He Huang, Zhigang Tu, Ming-Hsuan Yang

2026-07-02视觉语言视觉感知

零样本视频时序定位中,逐帧图文匹配难处理包含先后顺序、因果关系的复杂事件。DART的核心洞察是用查询条件DPP同时选取相关且多样的关键帧,并以谱熵估计难度:简单查询走快速直接预测,复杂查询走带事件分析、帧角色标注和边界抽取的结构化推理。在Charades-STA与ActivityNet Captions的IID和多种OOD设置下,DART达到零样本SOTA,mIoU最高提升约3.5点且用帧数少7倍以上。

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts Figure 1
2026-07-02cs.RO

Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts

Taewook Kang, Taeheon Kim, Donghyun Shin, Jonghyun Choi

2026-07-02视觉感知

论文关注VLA模型在相机位姿、传感器标定或机器人本体变化后性能骤降且目标域示教昂贵的问题。核心洞察是一次微调产生的权重更新中,任务方向与域方向近似可加分解;DART通过源/目标一次示教更新向量做类比式权重运算,并用子空间过滤与缩放抑制噪声,提取可迁移的域向量。实验显示其在仿真和真实场景、视觉与本体迁移的一次适配中优于既有方法,但具体增益对scaling的依赖仍需更多消融支撑。

Linguistic Relative Policy Optimization for Video Anomaly Reasoning Figure 1
2026-07-02cs.CV

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

2026-07-02视觉感知强化学习优化算法

本文针对视频异常检测中指令微调依赖大量细粒度标注、免训练方法又依赖专家规则的问题,提出 LRPO:不更新模型参数,而从多条推理轨迹的相对奖励中提炼可语言化的异常经验,并结合通用经验与场景经验注入上下文,引导模型按人类风险偏好和时间证据推理。在 XD-Violence、UCF-Crime、UBnormal 上,该方法在 tuning-free 设置下超过现有方法。

Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold Figure 1
2026-07-02cs.CV

Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold

Yunsung Lee, Hyeongmin Lee

2026-07-02生成模型

本文关注免训练扩散引导在强引导下易偏离数据流形的问题,指出关键不只在引导算法,而在扩散模型的预测目标:ε/v 预测需从噪声态反推干净图像并放大误差,x 预测则直接给出干净图像。作者用误差放大理论、Child FID 与细粒度鸟类基准验证该层级,结果显示 x 预测在同等分类有效性下 C-FID 更好,并能显著减少崩坏和模式集中。

Uncertainty-aware tree height change regression Figure 1
2026-07-02cs.CV

Uncertainty-aware tree height change regression

Max Gaber, Dimitri Gominski, Jaime C. Revenga, Stefan Oehmcke, Rasmus Fensholt, Martin Brandt

2026-07-02安全鲁棒

论文针对森林冠层高度变化常被简化为二分类、且忽略标注不确定性的问题,提出 CHC 数据集与“不确定性感知变化回归”任务:用西班牙 2018/2023 年机载 LiDAR 构建 3 m 连续高度增减标签和像素级不确定性,并配对 6 年 PlanetScope 时序影像。实验用于评测地理基础模型,表明该基准能暴露连续树高变化估计中的时序推理、跨传感器迁移和噪声标签鲁棒性挑战;具体性能增益和最优模型结论在给定文本中未充分说明。

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization Figure 1
2026-07-02cs.CV

Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization

Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao

2026-07-02视觉感知强化学习优化算法

针对视频异常理解中异常线索稀疏、固定采样易漏证据且弱监督难以学习取证策略的问题,论文将任务改写为闭环序列决策,提出 Anom-π 交替执行思考、回溯/扩展/细采样和终止,并用 AEI 引导的 iDPO 做轨迹级偏好优化。实验称 2B 模型在多数据集复杂场景中优于更大规模 VAU 方法,但具体增益与数据、工具设计的关系仍需细看。

Identifying Latent Concepts and Structures for Generalized Category Discovery Figure 1
2026-07-02cs.CV

Identifying Latent Concepts and Structures for Generalized Category Discovery

Boyang Dai, Chaoqi Chen, Yizhou Yu

2026-07-02视觉感知

论文针对广义类别发现中过度依赖聚类头、而忽视视觉骨干输出高秩且纠缠的 token 表征这一瓶颈,提出可插入骨干与发现头之间的 CPF-GCD,用有限可学习视觉原语及其空间分配场重写 patch token,使已知与未知类别都表现为共享原语的组合模式。实验显示该模块在多类 GCD 基线和数据集上稳定提升已知/新类识别、类别数估计且计算开销较小。

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication Figure 1
2026-07-02cs.CV

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication

Bolutife Atoki (imagine, LIRIS), Iuliia Tkachenko (imagine, Bertrand Kerautret (imagine, Carlos Crispim-Junior (imagine

critical scalability limitation, as each requires training separate models per printer type, making them impractical for production, may be unavailable and cannot anticipate evolving attacks. These limitations motivate reconceptualizing CDP authentication, for multi-class evaluation. Our implementation and models are available at our public repository 2, Repository URL is available at https://gitlab.liris.cnrs.fr/anr-trustit/cdp-multiclass-normality.git

2026-07-02视觉感知生成模型

针对多打印设备场景下 CDP 真伪样本外观极其相似、传统相似度或单类生成模型难以扩展的问题,论文将认证重构为多类正常性 OOD 检测:仅用真实样本训练一个类条件 ControlNet,并用双模板遮蔽只评估被隐藏像素的重建误差,以弱化二值结构捷径、突出 P&D 签名差异。在 Indigo 1×1 Base 上,该方法优于传统和改造的生成式基线,且不依赖伪造样本训练或阈值校准。

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap Figure 1
2026-07-02cs.CV

Retrieved Images as Visual Thought: Training-Free Multimodal In-Context Learning for the Open-vs-Closed Gap

Bingchen Huang, Zhiling Wang, Yifu Chen, Yuanchao Du

2026-07-02视觉语言视觉感知

论文针对“用图像思考”方法依赖工具、代码生成或训练成本高的问题,提出免训练的 ReVisIT:把检索到的带标签示例图像作为视觉思维单元,以多轮上下文注入并结合结构化定义做预测。结果显示,Qwen3-VL-30B 在 VL-ICL 4-shot 达 98.5%,接近 72B SOTA;在 Bongard 与 MAAC-Bench 也有明显增益,消融表明主要收益来自高质量检索与多轮示例格式。

Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs Figure 1
2026-07-02cs.CV

Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs

Chahan Vidal-Gorène (CJM, LIPN), Nadi Tomeh (LIPN), Victoria Khurshudyan (Inalco, SeDyL)

Laboratoire d’Informatique Paris Nord

2026-07-02三维

针对历史亚美尼亚报纸多栏、跨页续文和低资源语言导致的阅读顺序重建困难,论文构建66页标注数据集,并将语义区域检测与生成式LLM结合,用作人工标注加速而非生产流水线。实验显示该混合方法在单页与跨页任务中误差最低,相比最强几何基线Kendall τ最多降低76%,且在预测框和噪声OCR下仍较稳健。

GADA: Geometry-Aware Deformable Aggregation for Image-Based Gaussian Splatting Figure 1
2026-07-02cs.CV

GADA: Geometry-Aware Deformable Aggregation for Image-Based Gaussian Splatting

Siwoo Lim, Sunjae Yoon, Gwanhyeong Koo, Chang D. Yoo

2026-07-02视觉感知三维

这篇论文针对基于图像变形的 3D Gaussian Splatting 受几何不确定性影响、在细结构和高频区域产生像素错位与模糊的问题,提出 GADA:将被可见性阈值丢弃的像素视为局部位移的有效线索,通过可学习的几何感知 deformable offset 迭代对齐,并用置信度加权融合多视角证据。实验显示其能保留更多有效像素、恢复更锐利细节,并相比既有变形式 GS 方法取得更好质量和 2.13 倍 FPS。

Active Spatial Guidance: Eliminating Injected Positional Mechanisms in Vision Transformers Figure 1
2026-07-02cs.CV

Active Spatial Guidance: Eliminating Injected Positional Mechanisms in Vision Transformers

Cong Liu, Xiaofang Li, Simon X. Yang

2026-07-02视觉感知

论文针对ViT依赖显式位置编码而在分辨率迁移和密集预测中受限的问题,提出Active Spatial Guidance:训练时去掉位置注入,仅用辅助头让最终patch token回归二维坐标,推理时移除该头。实验显示其在ImageNet-100、ADE20K和Hypersim上优于无位置编码基线,并可超过AbsPE、RoPE等强基线,同时提升分辨率鲁棒性。

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization Figure 1
2026-07-02cs.CV

EPO: Boosting 3D Foundation Models with Edge-based Pose Optimization

Mattia D'Urso, Christian Sormann, Mattia Rossi, Friedrich Fraundorfer

Graz University of Technology

2026-07-02优化算法三维

这篇论文针对3D基础模型虽能快速生成SfM重建、但几何精度弱于传统BA且后处理需重建特征轨迹的问题,提出EPO:用2D边缘图与距离变换构造可微重投影损失,直接优化相机位姿和半稠密深度,绕开显式匹配与track。实验覆盖TerraSky3D、ScanNet++、Mip-NeRF 360等,显示其精度可持平或超过BA式细化,同时显著降低时间和显存,因而可在消费级硬件运行。

Caption Bottleneck Models Figure 1
2026-07-02cs.CV

Caption Bottleneck Models

Seref Baris Cagliyan, Umut Ozdemir, Merve Tapli, Emre Akbas

2026-07-02视觉语言

这篇论文针对概念瓶颈模型中概念集难以预先定义、且软瓶颈易发生信息泄漏的问题,提出用冻结多模态大模型生成多样化图像描述,再仅基于文本训练分类器的 Caption Bottleneck。其关键洞察是把瓶颈从固定概念向量换成自然语言,并通过类别词审查和后验文本分析自动抽取数据相关概念。实验称在细粒度与粗粒度识别上保持有竞争力的准确率,同时提升解释的可控性与无预定义概念依赖。

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure Figure 1
2026-07-02cs.CV

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

Zijian Dong, Yi Lin, Ji Fang, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

2026-07-02视觉感知

针对NODDI脑微结构三类图谱在融合时易混淆各自生物物理含义的问题,BrainFIBRE在5.6万名UK Biobank样本上预训练,并用自监督部分信息分解与反事实模态丢弃/交换,让MoE区分独有、冗余和协同信息。实验显示其在脑龄、性别、脑血管/神经退行性标志物和认知预测上优于对比方法,并给出可解释的微结构交互模式。

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes Figure 1
2026-07-02cs.CV

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

Jihyeok Jung (1), Jeewu Lee (2), Sanghyeop Kim (2), Chanhee Han (3), Seong Joon Oh (1) ((1) KAIST AI, (2) Sogang University, (3) Ministry of Science and ICT)

Sogang University

2026-07-02数据集/基准

这篇论文针对现有第一视角基准常依赖可见身体线索、难以单独评估自我中心视角理解的问题,提出 EgoGapBench,将“自我中心动作选择”从第一视角图像理解中分离出来,在无身体线索的多智能体场景中用不可复制的他人动作作为干扰项。实验显示,人类表现稳定,而开源和闭源 MLLM 明显落后,且常复制可见他人的动作;常规自我中心数据微调不能弥合差距,专门数据微调虽有提升但仍未达人体水平。

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation Figure 1
2026-07-02cs.CV

ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation

Yu-Hsiang Chen, Wei-Jer Chang, Yi-Ting Chen, Masayoshi Tomizuka

2026-07-02规划控制

面向自动驾驶测试中对可控、反事实交通场景的需求,ECoSim关注现有方法依赖大规模配对标注和重复训练的问题。其核心是在冻结扩散或自回归交通生成模型的基础上,用身份初始化的 FiLM 轻量适配器注入轨迹草图、行为潜变量和文本控制,并通过上下文感知条件迁移生成长尾场景。在 WOSAC 闭环评测中,方法用不足 1% 配对数据将控制误差最高降低 83%,Meta 分数提升约 0.02–0.03,同时保持较好的真实感与安全性。

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine Figure 1
2026-07-02cs.CV

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

2026-07-02视觉感知

本文针对推理分割中视觉感知与语言推理被端到端黑箱耦合、难解释且依赖人工标注的问题,提出 GEAR-Seg:先用 SAM 2 生成区域,再由 DAM 将每个 mask 转成属性化文本,最后交给 LLM 做显式逻辑推断。该框架在零样本推理/指代表达分割上表现有竞争力,并作为数据引擎生成 GEAR-131K;蒸馏实验显示,仅用自动数据训练的学生模型可接近人工标注上界,但部分增益可能主要来自 scaling / data。

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition Figure 1
2026-07-02cs.LG

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition

Zhiqi Li, Wen Zhang, Bo Zhu

2026-07-02生成模型强化学习

本文针对少步 flow-map 生成器(如 MeanFlow、sCM)虽推理快但确定性强、难以用需随机轨迹和似然比的 RL 后训练对齐的问题,提出 Flow-Map GRPO。核心是 ASFMC:用锚点条件重采样在长程 flow map 层面引入随机性,同时保持原概率路径,并推导单时刻/双时刻形式的 GRPO 目标。实验在少步 FLUX 文生图模型上显示,相比预训练检查点在奖励、感知和任务指标上均有提升。

NoPA: Non-Parametric Online 3D Scene Graph Generation Figure 1
2026-07-02cs.CV

NoPA: Non-Parametric Online 3D Scene Graph Generation

Qi Xun Yeo, Seungjun Lee, Yan Li, Gim Hee Lee

2026-07-02三维

NoPA面向流式RGB-D下的在线3D场景图生成,动机是避免SLAM/点云重建开销,同时修正FROSS用单高斯表示物体导致几何细节丢失、跨视角合并不稳的问题。其核心是用固定粒子集刻画非参数物体分布,并以KDE上的MMD做候选合并,再按高亲和对象传播关系以补边。实验称在多个在线3D SSG基准上优于现有方法,且基本保持实时推理速度。

SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation Figure 1
2026-07-02cs.CV

SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation

Kyuwon Kim, Sunjae Yoon, Chang D. Yoo

2026-07-02数据集/基准三维

这篇论文针对单张手绘角色经3D重建与投影生成动画时,在新视角下容易出现轮廓缺失、斑点和时序不稳的问题,指出逐样本2D对齐会过拟合正面输入视角。核心贡献是构建SPECSIA-15K成对风格化数据集,并训练轻量级DraViE后处理模块,用数据级先验修复投影伪影。实验显示其在新视角保真度和时间一致性上优于DSU、OSF等基线,且单角色适配成本更低。

Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration Figure 1
2026-07-02cs.CV

Restore3D: Breathing Life into Broken Objects with Shape and Texture Restoration

Xiaolong Shen, Zongxin Yang, Yi Yang

2026-07-02三维

本文针对破损三维物体修复中只补几何、忽略纹理且容易改动完好区域的问题,提出 Restore3D:用自动合成的破损-完整配对数据训练多视图修复框架,并通过 Mask Self-Perceiver 与深度感知掩码校正自动定位应补区域,再结合图像增强和粗到细重建恢复带纹理网格。实验在合成与真实破损物体上显示,其多视图修复一致性和纹理网格质量优于多类修补、补全和重建基线。

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning Figure 1
2026-07-02cs.CV

Cross4D-JEPA: Dense Cross-modal Correspondence Distillation for 4D Point Cloud Representation Learning

Trung Thanh Nguyen, Hai Nguyen-Truong, Tu Vo, Hoang M. Truong, Tuan-Anh Vu

Nagoya University, Japan, Northeastern University, USA, KC Machine Learning Lab, Korea, University of Science, Vietnam National University Ho Chi Minh City, Vietnam, University of California, Los Angeles, USA

2026-07-02三维

面向机器人与具身感知中的动态4D点云,论文关注密集标注昂贵且现有自监督多局限于点云内部、跨模态方法又只用全局视频嵌入的问题。Cross4D-JEPA通过渲染建立遮挡感知的2D补丁到3D点的密集对应,将冻结DINOv2或V-JEPA2的特征逐点蒸馏到4D点编码器,无需掩码、负样本或解码器。四个基准上其优于内模态和全局跨模态基线,并提升迁移与标签效率;分析认为主要增益来自逐点对应粒度,而非教师模态。

AnF-DiffPET: Anatomy- and Frequency-Guided Diffusion for PET/CT Denoising Figure 1
2026-07-02cs.CV

AnF-DiffPET: Anatomy- and Frequency-Guided Diffusion for PET/CT Denoising

Xuepeng Liu, Ruili Li, Zetong Liu, Renyiming Li, Yan Li, Yin Dai, Chao Li, Yueyang Teng

2026-07-02生成模型

针对低剂量或短采集 PET 噪声强、摄取量化不稳定的问题,AnF-DiffPET 将配准 CT 解剖先验和频域约束引入扩散去噪,通过 AFG、MSCTR 与 FCHM 减少结构漂移和噪声频率传播。四个 PET/CT 数据集上相较 CNN、GAN、Transformer 和扩散基线提升图像保真、解剖一致性与定量保真,但代码与模型尚待接收后发布。

Closed-loop coupling of personalised and foundation models for real-time treatment guidance with MRI Figure 1
2026-07-02cs.CV

Closed-loop coupling of personalised and foundation models for real-time treatment guidance with MRI

James Grover, Emily A. Hewson, Andrew Phair, Michael Ferraro, Hilary L. Byrne, Paul Keall, Michael G. Jameson, David E.J. Waddington

Image X Institute, Sydney School of Health Sciences, Faculty of Medicine and Health, The University, School of Clinical Medicine, Medicine & Health, University of New South Wales, Sydney, Australia, Centre for Medical Radiation Physics, School of Mathematics and Physics, University of Wollongong, centres

2026-07-02视觉感知

本文针对 MRI 引导治疗中 300–400 ms 成像延迟导致的解剖位置错配问题,提出将患者个体化时序预测模型与基础分割模型闭环耦合:CAFOP 预测未来多平面 MRI,MedSAM2 实时分割反馈并在线更新预测器。数字体模和临床 MRI-linac 数据显示,400 ms 预测下该方法优于 ConvLSTM、SwinLSTM、SimVP,并降低病灶跟踪误差与剂量学 gamma 失败率。

Prior-Anchored Debiasing for Long-Tailed Multi-Organ Pathology Report Generation Figure 1
2026-07-02cs.CV

Prior-Anchored Debiasing for Long-Tailed Multi-Organ Pathology Report Generation

Feng Yang, Jie Liu, Yubo Pang, Peilin Chen, Xinheng Lyu, Shiqi Wang, Howard Leung, Ping Chen

2026-07-02生成模型

本文关注多器官病理报告生成中器官类别长尾导致的头部器官偏置:视觉编码器忽视尾部器官判别线索,文本解码器套用头部器官叙述。作者提出 PriOrGen,以视觉原型锚定瓶颈筛选诊断相关 WSI patch,并用器官级元报告库提供文本先验。ML-Path 实验显示整体及头、中、尾类均优于基线,尾类提升最明显,消融支持两模块分别缓解视觉与解码偏置。

Robust 3D Alignment of Generative Reconstructions via Partial Monocular Observations Figure 1
2026-07-02cs.CV

Robust 3D Alignment of Generative Reconstructions via Partial Monocular Observations

Yuchen Zhang, Luanyuan Dai, Yiwei Wang, Xiwei Xu, Jianing Zhang, Johnny.r.zhang, Xianhui Meng, Yanbiao Ma, Jiayi Ma, Xiaoshuai Hao

2026-07-02生成模型三维安全鲁棒

面向机器人操作中单目观测稀疏、噪声大,而生成式三维重建缺少真实尺度并可能产生幻觉几何的问题,论文提出免训练的 Sim(3) 对齐框架,显式估计尺度与位姿,结合几何感知描述子粗到细初始化、闭式细化和幻觉过滤。作者还构建 GenPMOAlign–Where2Place 基准,实验显示其在极端部分观测下较传统配准和学习式方法更稳定准确。

HieDG: A Hierarchical Discrete Geometry-Guided Framework for Multi-Animal Tracking Figure 1
2026-07-02cs.CV

HieDG: A Hierarchical Discrete Geometry-Guided Framework for Multi-Animal Tracking

Chenxun Deng, Zhongde Zhang, Ye Yuan, Chengyang Zhang, Yifan Zhang, Bohao Chen, Hongying Yan, Hang Zhou, Hua Han, Xi Chen

2026-07-02视觉感知

针对多动物跟踪中同类外观相近、密集遮挡和运动不规则导致身份关联不稳的问题,HieDG的核心洞察是连续几何特征在注意力中会放大微小扰动,因此用两级残差码本将位置、尺度、速度离散化为稳定几何 token,并融入查询式跟踪器。实验在 AnimalTrack、BFT、BuckTales 上提升 HOTA、AssA、IDF1,在 DanceTrack、SportsMOT 上也具备一定泛化性。

GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models Figure 1
2026-07-02cs.CV

GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models

Sai Karthikey Pentapati, Shashank Gupta, Rajesh Sureddi, Yuezhi Yang, Alan C. Bovik, Qixing Huang

2026-07-02生成模型

针对逐个形状做球面参数化会在相似 genus-0 形状间产生不一致映射的问题,GenSP 将参数化转化为学习从单位球到形状集合的连续生成变形,并用中间形状扩充、潜空间生成树传播对应关系和变形正则来初始化与约束模型。在 ShapeNet 实验中,相比现有球面参数化方法同时降低几何畸变并提升跨形状一致性。

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos Figure 1
2026-07-02cs.CV

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

Zhejiang University, Tongji University, The University of Tokyo

2026-07-02视觉语言数据集/基准

这篇论文针对现有VLM空间推理基准多停留在“看见什么说什么”、缺少物体级反事实操作评测的问题,提出MindEdit-Bench:用三张野外手机室内照片重建物体中心3D场景图,并设计包含空间编辑与跨视角可见性编辑的六类任务。结果显示15个VLM在1003道人审题上仅8%–31%,显著低于人类81%–97%,暴露其难以稳定维护和操纵3D场景表征。

PAPA: Online Personalized Active Preference Alignment Figure 1
2026-07-02cs.LG

PAPA: Online Personalized Active Preference Alignment

Anindya Sarkar, Nasik Muhammad Nafi, Isaac Lyngaas, Muralikrishnan Gopalakrishnan Meena, Yevgeniy Vorobeychik

Washington University in St. Louis, Oak Ridge National Laboratory

2026-07-02视觉感知

PAPA关注个性化推荐、图像生成等场景中用户偏好稀缺且需在线获取的问题,目标是在不训练独立奖励模型的情况下对扩散模型做偏好对齐。其核心是用实时反馈直接优化生成分布,并以变分推断视角设计反馈高效的探索—利用机制;进一步提出EPAPA,通过低噪声阶段复用预训练模型、剪枝式微调降低计算。实验显示其在类别条件和细粒度偏好任务上比既有方法更快适配,并能较好保持样本质量与多样性。

Predicting Lethal Outcome (Cause) And Understanding Key Biomarkers Linked With Acute Myocardial Infarction Using Deep Artificial Neural Network And Ensemble Of Machine Learning Methodologies Figure 1
2026-07-02eess.IV

Predicting Lethal Outcome (Cause) And Understanding Key Biomarkers Linked With Acute Myocardial Infarction Using Deep Artificial Neural Network And Ensemble Of Machine Learning Methodologies

Sagnik Ghosh

2026-07-02视觉感知

针对急性心肌梗死致死风险早期识别依赖医生经验、耗时且一致性不足的问题,本文构建了包含缺失值填补、类别不平衡处理、特征选择、集成学习与 ANN 的自动化预测流程,并试图从筛选特征中解释关键生物标志物。主要结果是用精确率、召回率等指标比较多类模型以支持临床筛选,但具体性能数值和相对增益在给定文本中未充分说明,增益来源可能主要来自 scaling / data。

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning Figure 1
2026-07-02cs.CV

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

Yuan Qing, Chengzhi Mao, Boqing Gong

2026-07-02视觉感知

本文针对视觉指令微调常用多轮训练、而基准多为单轮评测的不匹配,指出模型会出现视觉注意衰减和上下文过拟合。StochasT 随机改变同图问答的轮深组合,在不丢数据、几乎不增算力的情况下扩展上下文分布,并用 Balanced Latin Square 评估上下文鲁棒性。实验在 LLaVA 与 Qwen2.5-VL 上显示,其单轮和多轮表现均优于标准 multiT,平均带来约 3%–9% 增益。

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning Figure 1
2026-07-02cs.CV

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu

Shanghai Jiao Tong University

2026-07-02视觉语言

这篇论文针对多模态大模型在复杂视觉推理中被离散语言链路限制、以及连续潜变量训练时后验可偷看答案导致训练—推理不匹配的问题,提出 AMVL:用前向 KL 让先验学习后验推理状态,同时用反向 KL 约束后验远离推理不可用区域。实验称其在 BLINK 等复杂多模态基准上优于离散和潜变量推理基线,平均提升 +10.83,单项最高 +32.00。

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement Figure 1
2026-07-02cs.CV

VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement

Seohyun Lee, Seoung Choi, Dohwan Ko, Jongha Kim, Hyunwoo J. Kim

2026-07-02视觉感知

这篇论文针对大规模视频库中“先检索、再理解”的割裂流程:一旦首轮检索失败,后续时间定位也会失效。VideoSearch-R1把视频搜索引擎纳入多轮智能体循环,并用连续潜空间的软查询细化替代文本改写,通过GRPO以检索和下游任务奖励联合训练。在ActivityNet-FIG、Charades-FIG、DiDeMo-FIG的VCMR任务上提升视频检索与时刻定位表现,并显示软查询比显式改写更省生成token。

Information-Regularized Attention for Visual-Centric Reasoning Figure 1
2026-07-02cs.CV

Information-Regularized Attention for Visual-Centric Reasoning

Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan

2026-07-02视觉感知

该文针对视觉语言模型在指令微调后仍易物体幻觉、视觉 grounding 弱和遗忘的问题,认为根因是视觉表征只被 next-token 目标被动优化。作者提出 Information-Regularized Attention,在中间层以随机、信息瓶颈式噪声调控注入的视觉信息,而非只改注意力权重。实验显示 IRA 可改善下游表现、降低 attention sink,并使层间表征曲率更平滑;但验证规模仅到 8B,更大模型结论文中未充分说明。

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding Figure 1
2026-07-02cs.CV

HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding

Ji Ha Jang, Hayeon Kim, Chulwon Lee, Junghun James Kim, Se Young Chun

Seoul National University, Republic of Korea

2026-07-02安全鲁棒

针对 CLIP 在超过 77 token 的长文本中对句序变化、删词和摘要扰动过于敏感的问题,HyFL-CLIP 将预训练 CLIP 的欧氏图文对齐蒸馏到双曲空间,用跨流形相似度蒸馏、测地对比学习和双曲蕴含损失显式建模长描述与短语成分、图像之间的层级/部分-整体关系。实验显示其在长上下文跨模态检索、扰动鲁棒性、模态内检索和短文本检索上优于已有长文本 CLIP 方法,扰动场景最高提升 19.5%,并可接入 SDXL。

EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction Figure 1
2026-07-02cs.CV

EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

Qiyan Luo, Yingdong Pi, Lekang Wen, Jie Yang, Xiaoyu Wang, Haiming Zhang, Mi Wang

2026-07-02三维

这篇论文针对卫星多视角重建中透视相机先验与轨道推扫成像几何不匹配、且多时相视图质量差异大的问题,提出 EO-VGGT:先用几何-辐射一致性筛选视图,再把 RFM/RPC 推导的像素级传感器射线编码为几何 token,并通过轻量适配器注入冻结 VGGT。US3D 实验显示其在保持稠密覆盖的同时,相比最强替代方法 MAE 降低 18.0%、P95 绝对残差降低 18.6%,说明显式轨道几何条件化是关键增益来源。

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble Figure 1
2026-07-02cs.CV

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

East China Normal University, 2 Shanghai Jiao Tong University

2026-07-02视觉语言视觉感知

针对低空无人机图像中视角多变、小目标和背景干扰导致传统无参考质量评价难以只靠全局分数建模的问题,本文将目标与背景质量作为辅助任务,并集成 SigLIP2 多任务视觉回归器与 LoRA 微调的 Qwen3.5-9B 多模态回归器,利用空间退化特征与语义感知的互补性。方法在 ICME 2026 Drone-IQA 挑战中取得第 2 名,但各组件和集成带来的独立增益文中未充分说明。

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment Figure 1
2026-07-02cs.CV

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

Binghamton University, Harvard Medical School

2026-07-02视觉感知

MindAU关注从被动“看见什么”的脑解码转向用EEG驱动可控面部动作编辑,动机是为细粒度表情控制和潜在辅助表达建立脑信号到AU的映射。其核心在于用AU感知EEG编码、双流流形对齐,将噪声EEG同时对齐到AU文本语义和去身份化视觉位移轨迹,再接入扩散编辑器保持身份。文中构建E-CAFE基准,并报告相对EEG生图与文本管线基线更好,但临床有效性和多AU动态场景仍未充分说明。

MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation Figure 1
2026-07-02cs.CV

MedCAGD: Context-Aware Gated Decoder for Efficient Medical Image Segmentation

Saad Wazir, Patrick Dominique Vibild, Dinh Phu Tran, Seongah Kim, Daeyoung Kim

2026-07-02视觉感知

论文动机是,在强预训练编码器已较成熟的情况下,医学分割误差仍常来自解码阶段的跨尺度错位、上下文整合不足和边界保持不稳。MedCAGD将改进重点放在解码器,引入多尺度通道重校准、带空间竞争的门控跳连融合,以及向中间解码层注入全局编码器语义的上下文聚合机制。实验覆盖11个医学分割基准,报告其相对CNN、Transformer、Mamba、SAM及近期解码器基线取得稳定提升,同时保持约30.6M参数、5.0GFLOPs的实用复杂度。

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models Figure 1
2026-07-02cs.CV

The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models

Adeel Yousaf, Soumik Ghosh, James Beetham, Amrit Singh Bedi, Mubarak Shah

2026-07-02视觉感知生成模型安全鲁棒

本文指出文本到图像扩散模型的安全对齐看似兼顾效用,主要是因为FID、CLIPScore等粗粒度指标掩盖了计数、属性和关系等细粒度语义退化。作者将问题归因于文本编码器嵌入空间的“语义塌缩”,并提出SAGE以保持嵌入分布和局部相似结构;实验显示其在维持安全性的同时,TIFA较既有最优提升约5.0%。

DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving Figure 1
2026-07-02cs.CV

DriveVer: Lightweight Trajectory Evaluator as Test-Time Verifier for Autonomous Driving

Chong He, Yuechen Luo, Fang Li, Shaoqing Xu, Fuxi Wen

Tsinghua University, University of Macau*Equal contribution. ✉ Corresponding author.

2026-07-02规划控制

针对端到端自动驾驶规划器“一次生成即执行”、难以在推理时发现并修正不安全轨迹的问题,DriveVer提出轻量级测试时验证器:基于NAVSIM构造条件聚类的轨迹监督数据,融合候选轨迹、多视角视觉和自车运动状态,同时输出安全评分与几何修正。实验显示其可作为34M参数的即插即用模块提升多种基础规划模型表现,并保持较小推理开销。

MalariAI: A Label-Resilient Decoupled Framework for Universal Cell Segmentation and Explainable Stage Classification in Dense Malaria Blood Smears Figure 1
2026-07-02eess.IV

MalariAI: A Label-Resilient Decoupled Framework for Universal Cell Segmentation and Explainable Stage Classification in Dense Malaria Blood Smears

Kaysarul Anas Apurba, Md Hasibul Hasan, Mohammed Ali, Tanzilur Rahman

Department of Electrical and Computer Engineering, North South University, Dhaka 1229, Bangladesh, Department of Computer Science and Engineering, International University of Business Agriculture and Technology (IUBAT)

2026-07-02视觉感知

面向资源受限地区疟疾血涂片诊断,论文指出端到端检测受漏标、密集细胞 NMS 抑制和缺少逐细胞证据限制。MalariAI 将细胞定位与分期分类解耦:先用无需标注的距离变换分水岭分割整幅图,再用 EfficientNet-B0+Focal Loss 分类并生成 Grad-CAM++。在 BBBC041 上定位召回 75.95%,分类准确率 98.36%,稀有阶段表现优于 Faster R-CNN 基线。

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers Figure 1
2026-07-02cs.CV

Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers

Jaeah Lee, Hyunjin Kim, Jaewoong Cho, Gihyun Kwon

2026-07-02视觉感知生成模型

这篇论文针对图像到3D形状生成中DiT骨干模型过大、难以部署的问题,指出2D扩散压缩方法会破坏几何一致性。其核心是用点云EMD逐层评估“vitality”,区分双块与单块的重要性,再指导结构化剪枝、混合精度量化和选择性微调。实验在Step1X-3D、Hunyuan3D等模型上最多压缩约66%,形状保真度仅小幅下降。

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval Figure 1
2026-07-02cs.IR

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

2026-07-02视觉感知

这篇论文针对无监督跨模态哈希在图文配对稀缺时易过拟合、难泛化到未见类别的问题,提出 APKH:借助 CLIP 的属性先验,用提示学习生成属性核并以 RBF 核响应替代传统双流哈希映射,同时用核平滑对比对齐把少量配对样本建模为连续分布。实验称其在四个数据集的数据受限、seen-to-unseen 检索设置下优于现有哈希方法。

Radial Interaction Tomography: Recognizing Non-Transitive Evolutionary Games from One Range-Expansion Image Figure 1
2026-07-02cs.CV

Radial Interaction Tomography: Recognizing Non-Transitive Evolutionary Games from One Range-Expansion Image

Faruk Alpay, Baris Basaran

Department of Computer Engineering, Bahçeşehir University, Istanbul, Türkiye

2026-07-02视觉感知

针对单张微生物扩张终点图像能否识别非传递竞争这一问题,论文把彩色扇区边界视为径向沉积时间中的几何信号,提出从对数极坐标边界流恢复成对交互历史,并用图分解区分标量适应度层级与循环残差。主要结果包括可观测性与不可辨识边界、四类型完全接触需至少八条边界的设计定理,以及确定性像素级基准中对循环相互作用的检测;但生物机制和真实物理时间仍需额外校准。

LIST3R: Long-sequence Instance-aware 3D Reconstruction Figure 1
2026-07-02cs.CV

LIST3R: Long-sequence Instance-aware 3D Reconstruction

Jing Gao, Wei Wang, Feiran Wang, Yan Yan

Beijing Jiaotong University, University of Illinois Chicago

2026-07-02三维

长序列三维重建容易因分段处理或流式记忆而丢失远距离关联,导致回环和全局一致性不稳。LIST3R的核心洞察是把可识别物体实例作为持久锚点,为每个子序列建立局部实例库,并用语义与几何证据匹配重访区域、约束片段对齐,最终合并为全局3D实例库。实验显示其在长序列基准上提升相机轨迹精度和点云重建质量,说明稳定实例锚点能有效补足纯几何或隐式记忆方法的长期关联能力。

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval Figure 1
2026-07-02cs.CV

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

Jingjing Zhang, Lei Zhang, Zheren Fu, Zhendong Mao

2026-07-02视觉感知三维

本文针对零样本组合图像检索中现有代理任务只适配固定组合规则、难以学习细粒度语义修改的问题,提出 FoCo 将组合过程拆为“先聚焦、再补全”:用局部 caption 引导视觉聚合,再结合上下文完成目标语义,并配合跨实例对比学习抑制捷径。实验称其在四个 ZS-CIR 基准上达到 SOTA 且泛化更好,但具体增益中 caption 分解与训练目标的相对贡献仍需消融进一步说明。

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts Figure 1
2026-07-02cs.CV

MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

Nuoyan Zhou, Zhijun Tu, Lei Yu, Kun Cheng, Jie Hu, Nannan Wang, Xinghao Chen

2026-07-02视觉感知

MEPA针对VAR在多尺度生成中共用Transformer导致尺度间优化冲突、早期语义错误会沿粗到细过程放大的问题,提出尺度感知的token路由MoE以分离不同尺度表征学习,并用自监督特征和残差聚合加强早期语义对齐。ImageNet 256×256上,它在更小参数量、约一半训练轮数下取得优于dense VAR的FID,单轮训练开销仅小幅增加,但推理时间有所上升。

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions Figure 1
2026-07-02cs.CV

SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions

Siyuan Yao, Ziqi Wang, Ruiqi Yu, Junqi Huang, Wenqi Ren, Xiaochun Cao

2026-07-02视觉感知

这篇论文针对恶劣天气下视觉目标跟踪的域偏移问题,指出现有自适应方法依赖源域视频,在隐私、存储或带宽受限场景不现实。SFDATrack只用无标注目标域数据,通过mean-teacher框架、Dual Interactive Mamba提取抗天气扰动的目标token,并用超球面原型投影同时约束域特有与域不变表征。实验称其在多个跟踪基准上优于现有方法,但具体增益的分项来源仍需结合完整消融判断。

Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models Figure 1
2026-07-02cs.CV

Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models

Kensuke Nakamura, Byung-Woo Hong

Artificial Intelligence Department, Chung-Ang University, Seoul, 06974, Korea

2026-07-02视觉语言视觉感知

这篇论文针对 IPLoc 默认查询图中一定存在目标、因而在检索和视频 grounding 等场景易产生假阳性的问题,提出 POIL 任务,要求既定位参考实例又能拒绝负样本。核心方法 IPLoc-ID 将先生成候选框、再通过自提问进行实例级 Yes/No 验证串成同一自回归序列,并构建含正负样本的数据集。实验显示其显著压低负查询误检,同时保持接近 IPLoc 的定位性能。

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images Figure 1
2026-07-02cs.CV

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

2026-07-02视觉语言视觉感知

本文针对无人机航拍图像与通用视觉语言检测器预训练数据之间的视角、尺度和背景占比差异,指出常规低秩 PEFT 难以适配小目标、强背景噪声场景。DroneFINE 通过前景感知的 HyperAdapter 动态生成多路径卷积,并用 SemanticGate 借助背景词表抑制无关区域响应。在 VisDrone、UAVDT 上,其性能显著优于现有 PEFT,接近全量微调且微调参数更少。

CORGI: Consistency-Aware 3D Dog Reconstruction from a Single Image in the Wild Figure 1
2026-07-02cs.CV

CORGI: Consistency-Aware 3D Dog Reconstruction from a Single Image in the Wild

Yuxiao Wu, Weile Li, Boyi Zhu, Yumeng Liu, Youcheng Cai, Ligang Liu

2026-07-02视觉感知三维

针对野外单张狗图像难以获得多视角和3D监督、生成视角又常不一致的问题,CORGI采用“生成再重建”思路:先用CDOG规范姿态并合成360度伪多视角,再以D-SMAL约束的可变形3DGS显式吸收视角误差,最后用变形条件扩散修复细节。实验显示其在多犬种上优于现有方法,可生成几何较准、外观连贯且可动画的3D资产。

Typography-Based Monocular Distance Estimation for Advanced Driver-Assistance Systems Figure 1
2026-07-02cs.CV

Typography-Based Monocular Distance Estimation for Advanced Driver-Assistance Systems

Manognya Lokesh Reddy, Zheng Liu

University of Michigan-Dearborn

2026-07-02视觉感知

面向ADAS中低成本、冗余的前车测距需求,论文提出利用美国车牌字符高度、笔画宽度、字符间距和安装孔等受法规约束的“印刷尺度”,从单目相机恢复距离,并结合州别识别、姿态校正、深度网络与卡尔曼平滑。58段实车/停车数据中检测率约99%,通道一致性误差约1.12%,报告中位不确定度0.128 m,但缺少逐帧外部真值,绝对精度仍需受控实验验证。

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail Figure 1
2026-07-02cs.CV

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

retail scenes: when synchronized egocentric and exocentric video of the same activity are available, arranging, weighing and labelling produce, carrying crates, pushing supply carts, scanning items at the

2026-07-02视觉感知强化学习

该文针对通用视频世界模型在零售等具身部署场景中易偏离领域视觉与行为规律的问题,构建含3.2万段同步第一/第三人称店员作业视频的 RetailSMV,并以 LoRA 控制比较视角数据。结果显示,三种适配均优于基座模型,但仅用第三人称数据训练在7项指标中6项不弱于混合训练,且在 LPIPS、PSNR、DreamSim 上显著更好,提示增益主要来自更稳定的外部视角而非简单数据量扩张。

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs Figure 1
2026-07-02cs.CV

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

2026-07-02视觉感知

面向边缘机器人触觉推理,小型多模态 LLM 在接入触觉时容易牺牲原有视觉语言能力。Splash 的核心做法是用视觉相对重要性评估参数,将关键子空间冻结为锚点,只更新“休眠”子空间和轻量触觉前端,从而以单阶段训练完成触觉对齐。实验在 SSVTP、TVL、TacQuad 上达到 SOTA,3B 模型超过部分 7B 方法,并在通用 VL 基准上基本保持原能力。

Learning When to Listen: Gated Affect Fusion for Human Motion Prediction Figure 1
2026-07-02cs.CV

Learning When to Listen: Gated Affect Fusion for Human Motion Prediction

Jingni Huang

University of Oxford

2026-07-02视觉感知

这篇论文关注真实视频中人体运动预测是否应引入面部情感线索:表情可能预示交流意图,但也容易带来噪声。作者提出 Gated Affect Transformer,用可学习门控在姿态轨迹与 HSEmotion 情感特征间动态调节信息流。实验显示,简单拼接情感会低于纯姿态基线,而门控能抑制随机或错配情感噪声;情感增益主要局限于短中期预测,长期运动仍由运动学连续性主导。

Rosetta: Composable Native Multimodal Pretraining Figure 1
2026-07-02cs.CV

Rosetta: Composable Native Multimodal Pretraining

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

2026-07-02视觉语言

Rosetta针对统一多模态预训练中连续图像生成梯度会覆盖离散语言/视觉理解能力的问题,提出可组合专家结构:共享全局专家保留基础语义,模态专属专家负责扩展,并用MAOP借优化器动量投影冲突梯度以避免额外显存。实验在同等活跃参数下显示,相比MoE/MoT可显著缓解灾难性遗忘,同时提升图像生成与跨模态协同。

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization Figure 1
2026-07-02cs.CV

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

Work primarily done during an internship at Dolby Laboratories.

2026-07-02视觉感知

这篇论文面向流式视频中的时序动作定位:真实应用既不能等待完整视频,又难以获得精确起止边界标注。作者提出POTAL设定,并用离线点监督教师向在线学生蒸馏伪片段、帧级激活和未来窗口线索,同时加入点标注监督与actionness校准解码。五个数据集上相对强基线持续提升,说明点标注也可支撑较可靠的在线定位。

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models Figure 1
2026-07-02cs.RO

What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models

Amirhosein Chahe, Tyler Naes, Jovin D'sa, Faizan M. Tariq, Sangjae Bae, Lifeng Zhou, David Isele

Honda Research Institute (HRI), San Jose, CA 95134, USA., Drexel University, Philadelphia, PA 19104, USA., prompt (center left) containing the ground-truth agent class and task instructions. GPT-5 operates as a semantic annotator

2026-07-02视觉语言视觉感知规划控制

针对自动驾驶中过度保守地处理所有遮挡、或盲目补全隐藏区域的问题,论文用规划 KL 散度衡量隐藏体对自车轨迹的影响,筛选规划关键遮挡体,并借助 GPT-5 生成结构化语义标注来训练 VLM。nuScenes 实验显示,PKL 引导数据微调显著提升各类模型,数据选择较随机采样约提升 30%,小模型微调后可超过更大的零样本模型。

AEGIS: A Multi-Task Joint-Embedding Predictive Architecture for Mammography Figure 1
2026-07-02cs.CV

AEGIS: A Multi-Task Joint-Embedding Predictive Architecture for Mammography

Scott Chase Waggener, Sai Karthik Navuluru, Lakshman Tamil

Department of Electrical and Computer Engineering, University of Texas at Dallas, effective path to leverage abundant unlabeled clinical data [18].

2026-07-02视觉感知

针对乳腺筛查中癌症分诊与乳腺密度评估依赖放射科医生且一致性有限的问题,AEGIS将JEPA自监督预训练引入高分辨率乳腺X光ViT,并用多任务头联合处理分诊、病灶检测和密度分类。其ViT-L在785例测试集上分诊AUC达0.949,集成后0.952;二分类密度AUC为0.953,VinDr-Mammo零样本AUC为0.871,但部分增益可能主要来自模型规模和数据。

MVDGC: Joint 3D and 2D Multi-view Pedestrian Detection via Dual Geometric Constraints Figure 1
2026-07-02cs.CV

MVDGC: Joint 3D and 2D Multi-view Pedestrian Detection via Dual Geometric Constraints

Thinh Phan, Hao Vo, Khoa Vo, Thanh Ngo, Cuong Pham, Ngan Le

AICV Lab, EECS Department, University of Arkansas, University of Information Technology, Posts and Telecommunications Institute of Technology (PTIT), Vietnam

2026-07-02视觉感知优化算法三维

这篇论文针对多视角行人检测中 BEV 投影带来的几何畸变、密集遮挡下定位模糊,以及 2D 框与地面点关系未被联合利用的问题,提出 MVDGC:用稀疏 3D 垂直圆柱查询表示行人,通过相机投影直接从原始多视角图像特征采样,并把 BEV 位置与各视角 2D 框统一为圆柱位置和形状细化。实验显示其在 WildTrack、MultiViewX 上达到 SOTA,在 GMVD 上取得最高 MODP 和 precision,表明对未见相机布局也有一定泛化性。

Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification Figure 1
2026-07-02cs.CV

Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification

Afshar Shamsi, Xiao-Yu Guo, Hamid Alinejad-Rokny, Arash Mohammadi, Damien Teney, Ehsan Abbasnejad

2026-07-02视觉感知

这篇论文针对无标签测试时自适应中熵最小化欠约束的问题:多个低熵更新可能对应不同且不可靠的决策边界。作者将 TTA 视为多假设后验探索,维护多个只更新归一化参数的粒子,并在输出、参数、优化器和输入层面做多样化后聚合预测。实验在 ImageNet-C 等混合扰动、单样本批量和标签偏移场景下较 Tent、SAR、DeYO 稳定提升约 1–4%。

Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring Figure 1
2026-07-02cs.CV

Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring

Samira Malek, Haichuan Zhang, Chul Lee, Vishal Monga

2026-07-02视觉感知

针对传统去模糊多在图像域直接复原、对相位中结构信息利用不足的问题,论文将模糊观测分解为幅度与相位,推导二者的 LMMSE 估计并展开为端到端可训练的 UPADNet。实验称其在 GoPro、RealBlur、COCO 上优于多种深度与展开网络,且在高噪声和少数据训练场景增益更明显。

LV-ROVER: Multi-Stream Tesseract Voting for Maltese Paragraph OCR Figure 1
2026-07-02cs.CL

LV-ROVER: Multi-Stream Tesseract Voting for Maltese Paragraph OCR

Adam Darmanin

2026-07-02视觉感知

本文面向马耳他语档案 OCR 标注数据极少、变音符和连字符易混淆的问题,提出合成段落训练管线与 5 路 Tesseract LV-ROVER 投票,并用双 CER 区分识别增益和标签规范化收益。在 422 段基准上,识别本身将 CER 从 0.0234 降至 0.01317,完整后处理后降至 0.00700;但作者也指出 70% 降幅部分来自标点和标签约定对齐。

Does Your ViT Still Need U-Net for Segmentation? Figure 1
2026-07-02cs.CV

Does Your ViT Still Need U-Net for Segmentation?

Xin Li, Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Yanxi Chen, Yujian Xiong, Hao Wang, Oana M. Dumitrascu, Yalin Wang

Arizona State University, Tempe, AZ, USA, Clemson University, Clemson, SC, USA

2026-07-02视觉感知

本文针对医学分割中 ViT 仍沿用 U-Net 解码器的惯性,考察强预训练 ViT 是否已足以直接做 dense prediction。作者提出 EoSeg,用查询式 encoder-only 结构、跨层查询建模与可学习块融合替代传统解码器。七个 CT、MRI、病理、内镜和皮肤镜数据集上取得有竞争力结果,如 Synapse mDice 85.50%、ACDC 91.73%、GlaS 93.27%,但部分增益可能主要来自更强预训练与 scaling。

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards Figure 1
2026-07-02cs.CV

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

Seoul National University

2026-07-02视觉语言视觉感知数据集/基准安全鲁棒

这篇论文针对具身机器人运行时安全守卫的评测缺口:现有二分类基准难区分漏检真实风险与对可疑但安全场景的过度干预。作者提出 EgoSafetyBench,用第一视角视频、半秒级标注、情境四分类与误导性场景文字双轴评测,并用对比梯控制单一关键线索。十个 VLM 的结果显示,模型能判断视频含危险,却常定位不到具体危险时刻;误导文字会使部分开源模型漏检、使强闭源模型过度报警,说明表面鲁棒性并不等于物理安全推理。

Trust the Prior (or Not): Uncertainty-Aware Abdominal Aortic Aneurysm Segmentation Figure 1
2026-07-02cs.CV

Trust the Prior (or Not): Uncertainty-Aware Abdominal Aortic Aneurysm Segmentation

Erich Robbi, Daniele Ravanelli, Andrea Passerini

Department of Computer Science, University of Trento

2026-07-02视觉感知安全鲁棒

这篇论文面向腹主动脉瘤 CTA 中血栓边界低对比、跨中心扫描协议导致分布偏移的问题,提出患者级强度归一化与不确定性门控解剖注意力:只在先验可信时利用管腔、钙化等空间线索,低置信时回退到图像特征。实验称在同分布测试集达到 SOTA,并在多中心 OOD 数据上明显优于现有方法,同时可分解视觉与解剖证据以增强可解释性。

HydraCollab: Adaptive Collaborative-Perception for Distributed Autonomous Systems Figure 1
2026-07-02cs.RO

HydraCollab: Adaptive Collaborative-Perception for Distributed Autonomous Systems

Luke Chen, Cheng-Ju Wu, David R. Martin, Qilin Ye, Pramod Khargonekar, Mohammad Abdullah Al Faruque

Department of Electrical Engineering and Computer Science, University of California, Irvine, USA.

2026-07-02视觉感知

HydraCollab面向多机器人协同感知中精度与通信带宽的矛盾,指出盲目融合所有传感器或在所有区域做中间特征通信会引入噪声和浪费带宽。其核心是用协作感知相关的传感器门控选择可靠特征,并依据空间置信图在重叠高置信区域做中间协作、其余区域转向后期结果协作。V2X-R、V2X-Radar和UAV3D-mini实验显示,相比Where2comm仅用41%和26%带宽仍分别提升0.78%和0.75%。

VOCA: Visual Odometry with Codec Awareness Figure 1
2026-07-02cs.CV

VOCA: Visual Odometry with Codec Awareness

Nouri Alexander Hilscher, Mateo de Mayo, Dominik Muhle, Christoph Otten genannt Hermes, Daniel Cremers

2026-07-02视觉感知

这篇论文针对实际机器人/空间计算中视频常被 H.264 等编码压缩、而传统 VO/SLAM 多假设未压缩图像导致跟踪退化的问题,提出 VOCA:在 Basalt 式因果双目视觉里程计中显式利用编码器运动向量等 codec 信息,为稀疏光流前端提供更好的初始化。实验显示,在最高约 100 倍压缩的视频流上,VOCA 相比 Basalt、ORB-SLAM3、OKVIS2 等获得更稳定轨迹,并在因果 VO 的相对/绝对轨迹误差和效率上达到领先结果。

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation Figure 1
2026-07-02cs.CV

DriftScope: Measuring The Hidden Effects of Diffusion Model Adaptation

Héctor Laria, Yiping Han, Julian D. Santamaria, Kai Wang, Bogdan Raducanu, Joost van de Weijer, Alexandra Gomez-Villa

2026-07-02生成模型

本文关注扩散模型在 DreamBooth 定制或概念遗忘后,标准 FID/KID 只看整体质量而掩盖无关概念受损的问题。核心洞察是权重级适配会产生系统性“隐性漂移”,并提出 DriftScope,通过比较两个检查点的交叉注意力差异,为提示词中的 token 排序定位受影响概念。实验用稀疏自编码器和零样本分类显示,整体指标近乎不变时,特定类别准确率最高可降 18.9 个点,且漂移会扩散到非目标概念。

PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment Figure 1
2026-07-02cs.CV

PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment

Aymeric Fleith, Julian Zirbel, Daniel Cremers, Niclas Zeller

Technical University of Munich, Munich, Germany, Karlsruhe University of Applied Sciences, Karlsruhe, Germany

2026-07-02视觉感知

这篇论文针对单目视觉里绝对尺度不可观、而传统深度传感或双目受基线和量程限制的问题,利用聚焦光场相机同时记录空间与角度信息。PRISM-VO的关键在于把光场投影模型直接嵌入前端跟踪和滑窗光度束调整,联合优化位姿与逆深度,并用单帧微图像视差提供尺度先验、时序多视图约束抑制漂移。实验显示其在室内外序列上优于既有光场VO,并接近或超过部分优化式和学习式单目方法,同时能稳定恢复米制尺度。

Steal the Patch Size: Adversarially Manipulate Vision-Language Models Figure 1
2026-07-02cs.CV

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

2026-07-02视觉语言视觉感知

针对黑盒视觉语言模型隐藏的视觉 tokenizer 与预处理配置可能影响鲁棒性却不透明的问题,论文发现 ViT patchification 会在网格边界与隐含 patch 网格对齐时造成周期性计数崩溃,并将其作为任务级侧信道来反推 patch size、动态/固定分辨率策略和目标 resize 分辨率。实验在 Qwen-VL、GPT、Claude 等模型上能较稳定恢复相关参数,并进一步提升预处理感知的迁移攻击与模型定向对抗操控效果。

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting Figure 1
2026-07-02cs.CL

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

2026-07-02数据集/基准

本文针对知识型 VQA 基准中“答对即代表知识推理”的评估假设提出质疑,指出 InfoSeek、E-VQA 等存在答案与证据不一致、问题约束不足、图像场景过于单实体化等缺陷。核心贡献是给出审计修复流程,并构造多实体干扰增强来检验真实视觉 grounding 与检索推理能力。重评显示,修复数据会改变模型排名,增强后检索召回和端到端准确率显著下降,说明现有成绩可能高估了模型能力。

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video Figure 1
2026-07-02cs.CV

Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video

Siyuan Li, Weiying Chen, Yilin Wang, Xinxin Zuo, Xingyu Li, Li Cheng

2026-07-02视觉感知三维

本文针对单目野外视频中动物种类差异大、关节运动复杂且可靠模板缺乏的问题,提出基于3D Gaussian Splatting的渐进式测试时优化框架。核心洞察是粗糙形状先验若配合姿态与非刚性形变解耦即可持续修正;方法用对称感知时序编码缓解相机漂移,并以可学习部件锚点和蒙皮场联通姿态估计与局部形变。实验显示其在多物种场景下较基线提升几何精度、时序一致性和视觉保真度。

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning Figure 1
2026-07-02cs.RO

3D Point World Models: Point Completion Enables More Accurate Dynamics Learning

Skand Peri, Hung Nguyen, Chanho Kim, Li Fuxin, Stefan Lee

Oregon State University

2026-07-02强化学习三维

这篇论文针对视频或局部点云世界模型在遮挡场景中几何不一致、长时域滚动误差累积的问题,提出先从单视角 RGB-D 补全物体点云,再在完整 3D 几何上学习动作条件动力学的 3DPWM。核心洞察是完整点云能让模型更稳定地推理重心、接触和代价函数。实验显示其在多种桌面操作与不同机器人上支持 100–300+ 步滚动、开闭环规划、未见任务适应和仿真到真实迁移,但失败仍受分割、点云补全和规划延迟影响。

A Mechanism-Driven Theory of Phase Transitions in Active Learning Figure 1
2026-07-02cs.CV

A Mechanism-Driven Theory of Phase Transitions in Active Learning

Julia Machnio, Mads Nielsen, Mostafa Mehdipour Ghazi

2026-07-02学习理论

本文针对主动学习中“早中晚预算”依赖经验标签数、难以跨数据集和模型泛化的问题,提出用主导泛化机制的切换来解释阶段变化。其核心洞察是将风险分解中的经验风险、分布偏差、模型复杂度和置信项视为随标注过程动态竞争的瓶颈,并用代理指标与分段回归识别数据驱动、过渡、模型驱动三阶段。实验显示代表性、覆盖性和不确定性策略分别在不同阶段更有效,且自监督表征会使阶段转移提前。

MG-SpaIR: Multi-grade Sparse-guided Implicit Representation for Training-Data-Free Image Restoration Figure 1
2026-07-02cs.CV

MG-SpaIR: Multi-grade Sparse-guided Implicit Representation for Training-Data-Free Image Restoration

Jianmin Liao, Lei Huang, Ronglong Fang, Ashley Prater-Bennette, Lixin Shen, Yuesheng Xu

2026-07-02视觉感知

针对单张观测同时受模糊、降采样、噪声和缺失像素破坏时,纯 INR 容易受频谱偏置限制并产生振铃、棋盘格等伪影的问题,MG-SpaIR 将多级粗到细残差隐式表示与高分辨率图像域的 ℓ0 型稀疏近端正则结合,并用交替优化求解且给出收敛分析。实验显示其在混合退化恢复中稳定优于 DIP 等无需训练数据的基线,但具体增益在不同退化和正则项间的来源仍需结合完整消融判断。

A Synthetic-Driven Vision System for Assembly Step Recognition Figure 1
2026-07-02cs.CV

A Synthetic-Driven Vision System for Assembly Step Recognition

Hui Zhang, Xuanang Lei, Rui Wang, Julian Ferchow, Mirko Meboldt

2026-07-02视觉感知

面向高混合低批量装配中真实数据采集和标注成本高、人工操作差异与遮挡严重的问题,论文提出用CAD模型和步骤描述自动生成装配序列:结合物理手物交互运动、域随机化真实感渲染和YOLO检测加时序规则做步骤识别。系统仅用合成数据训练,在真空泵真实装配上达到92.4%准确率,并展示可在约一小时内迁移到新任务,但复杂灵巧动作和细粒度姿态错误仍受限。

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners Figure 1
2026-07-02cs.CV

Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners

Yunhan Wang, Eshika Khandelwal, Edson Araujo, Walid Bousselham, Nina Shvetsova, Hilde Kuehne

2026-07-02视觉语言三维

这篇论文关注现成多模态大模型在少样本图像分类中难以真正利用支持样本、容易依赖类别语义先验的问题。作者提出 DeCoDe,将多类分类拆成查询图与支持图的二元同类判断,用“Yes” token 的 logit 排序决策,并可加入数据域提示。实验覆盖标准与新构建的域外数据集,在匿名标签设置下仍显著优于常规上下文提示和多种免训练基线,说明成对视觉比较比直接读类别名更能激发少样本适应能力。

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing Figure 1
2026-07-02cs.CV

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

2026-07-02视觉感知

这篇论文针对开放词汇视频实例分割在移动端实时运行的瓶颈:特征增强器和对象解码器随帧执行成本过高。SegFS 的关键洞察是骨干特征已含足够定位信息,因此只在稀疏关键帧用慢路径提取开放词汇实例语义,并投影回特征空间,快路径在后续帧轻量重定位和分割。实验显示其相对 MOBIUS-Mini-M 最高降低 14× 延迟,摊销帧率超过 30 FPS,同时标准基准 AP 损失控制在约 1 以内。

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking Figure 1
2026-07-02cs.CV

PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang

Wuhan University

2026-07-02视觉感知

PixelEyes针对多轮视觉搜索中同一MLLM同时推理与定位导致小目标找不准、轨迹冗长和“看见但没认出”的问题,将高层推理与SAMTok等专用分割感知工具解耦,并用掩码裁剪、语义区域BFS和可切换工具减少无效深挖;作者还构建PixelEyes-6K和零提示Pinpoint-Bench。实验显示其在多个视觉搜索基准上较既有主动感知代理取得更高准确率与更少交互轮次。

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition Figure 1
2026-07-02cs.CV

Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition

Zhiyao Shu, Jiacheng Yang, Yang Lu, Waishan Qiu, Chuan Li, Da Chen

2026-07-02视觉感知

本文关注城市视觉地点识别中被忽视的地理长尾:街景数据更偏向主干道和热门区域,导致模型在低访问、但常是机器人巡逻等应用重点的区域失效。作者提出模型无关的 DAPR,通过低访问偏置损失重平衡头尾类梯度,并在分类-检索流程中用多尺度分布距离补偿类内紧致度差异。SF-XL 上较混合检索基线 R@1 提升 18.3%/6.7%,且在 MSLS、Pitts30k 和多种 VPR 方法上有一致增益。

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence Figure 1
2026-07-02cs.CV

Synergistic Perception-Reasoning Governance: Grounding Medical MLLMs with Verifiable Anatomical Evidence

Rui Hao, Qiankun Li, Junyuan Mao, Linghao Meng, Dirui Xie, Dayu Tan, Zhigang Zeng

2026-07-02视觉语言

针对医学多模态大模型在VQA和报告生成中容易给出与影像证据不一致结论的问题,论文提出无需训练的SPRG框架:用MedSAM提取ROI解剖先验,一方面调制视觉token激活,另一方面把区域坐标与标签写入文本提示,并由任务路由器选择干预方式。跨2类任务、5个数据集和6个MLLM评测显示,闭式准确率最高提升约6%,开放式幻觉最多降低约35%。

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction Figure 1
2026-07-02cs.CV

Joint Medical Image Enhancement and Segmentation with Diffusion-based Symbiotic Information Interaction

Ying Chen, Jinyue Li, Qiankun Li

Shenzhen Research Institute, The Chinese University of Hong Kong, University of Science and Technology of China, Imperial Global Singapore, Imperial College London

2026-07-02视觉感知生成模型

针对低质 MRI、CT、超声图像中增强与分割被割裂处理、语义结构难以同时保真的问题,论文提出 DiSIINet:以 DDIM 构建增强与分割双分支,并通过 SII 交叉注意力在反扩散过程中双向交换特征,使两任务迭代互助。多模态医学数据实验显示其优于顺序式或独立处理方案。

Enhancing Oracle Bone Inscription Recognition via Multi-Scale Layer Attention Figure 1
2026-07-02cs.CV

Enhancing Oracle Bone Inscription Recognition via Multi-Scale Layer Attention

Chaowen Yan, Kaishen Wang, Yong Wang, Jianlong Xiong, Tao He

2026-07-02视觉感知

针对甲骨文形态残缺、笔画细微差异难以由常规注意力捕捉的问题,论文提出多尺度层注意力 MSLA,指出现有层注意力跨层 token 过少是瓶颈,并用全局/局部多尺度 token 与逐层累积增强跨层交互。实验称其在大规模甲骨文数据集上优于多种注意力机制且保持计算效率,但具体增益来源仍需结合完整消融判断。

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double Figure 1
2026-07-02cs.MM

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

Adam Cole, Mick Grierson

University of the Arts London, [15]. These systems enable controllable pipelines via text-to-video

2026-07-02视觉感知

本文动机是借《迷魂记》本身关于“重构理想形象”的主题,检验生成式视频模型是否内化了经典电影的视觉规范。其创新在于仅用原片2.78%关键帧驱动14B扩散模型做全片首尾帧插值,并以原片与“预测阴影”的偏差作为审美与计算分析对象。结果显示73.1%帧仍可辨认为合理《迷魂记》重构,仅3.6%严重失败,但情感、对白和异常段落仍暴露模型局限。

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration Figure 1
2026-07-02cs.RO

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration

Xinghao Zhu, Zixi Liu, Shalin Jain, Chenran Li, Milad Noori, Huihua Zhao, John Welsh, Michael Andres Lin, Wei Liu, Tingwu Wang, Xingye Da, Zhengyi Luo, Vishal Kulkarni, Naema Bhatti, Yuke Zhu, Linxi Fan, Bowen Wen, Danfei Xu, Soha Pouya, Yan Chang

2026-07-02机器人模仿学习

针对人类示范难以直接迁移到灵巧手、接触位置匹配易受形态差异影响的问题,CHORD把人和机器人的接触统一到以物体为中心的力/力矩扳手空间,用“能诱导的物体运动”来指导强化学习。论文构建4739个双手任务基准,在1831个任务上平均成功率82.12%,全身操作达90.77%,并展示了仿真到真实机器人的迁移。

Towards an automated AI-based framework for floor plan compliance checks for residential buildings Figure 1
2026-07-02cs.CY

Towards an automated AI-based framework for floor plan compliance checks for residential buildings

Subash Gautam, Debaditya Acharya, Alexandra Kleeman, Sarah Foster

aSchool of Global Urban and Social Studies, RMIT University, Melbourne, Australia, bDepartment of Mathematical and Geospatial Sciences, RMIT University, Melbourne, Australia, evolving policies limit scalability for large-scale assessments across thousands of apartments. Existing automated, framework offers a scalable, consistent, and transparent approach to automated compliance checking across jurisdic-, guidance on minimum design quality standards for apartments (NSW Department of Planning and Environment, (Apartments) in 2019 (updated in 2024) (State of Victoria Department of Environment Land Water and Planning, WA Department of Planning Lands and Heritage, 2024)., codes, which are typically available as texts describing the design standards. A relevant example is the High Life, assessing policy implementation has been highly labour- and time-intensive, relying on manual interpretation and, efficiency, consistency, and scalability. The floor plans are often distributed and archived as raster images in PDF, Motivated by the widespread availability of floorplan images, image-based approaches have gained popularity., some may include well-labelled text indicating functional areas or furniture locations, whereas others may lack this

2026-07-02视觉感知

该文针对澳大利亚公寓设计合规审查依赖人工量测、难以随政策更新扩展的问题,提出将楼层平面图视觉解析、建筑图结构表示与LLM规则引擎结合的多单元住宅审查框架。核心洞察是把文本规范转成可解释规则,并用房间、墙体、符号及拓扑关系支撑自动判定;但论文主要是概念性方案,实证性能和相对人工流程的量化增益文中未充分说明。

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions Figure 1
2026-07-02cs.HC

Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions

Meng Chen, Akhil Iyer, Amy Pavel

The University of Texas at Austin, University of California, Berkeley, The University of Texas at Austin Austin Texas USA, University of California, Berkeley Berkeley California USA

2026-07-02视觉感知

这篇论文关注盲人和低视力用户难以核验 MLLM 图像描述错误的问题,提出通过系统呈现多次生成结果中的一致、分歧和独有信息来校准信任,而非依赖不可得的模型置信度。原型包含多描述列表、变异感知描述和变异摘要;15 名用户研究显示,该方法使识别不可靠陈述能力较单一描述提升 4.9 倍,并降低了对模型回答的过度信任。

2026-07-01

169 篇
FaceMoE: Mixture of Experts for Low-Resolution Face Recognition Figure 1
2026-07-01cs.CV

FaceMoE: Mixture of Experts for Low-Resolution Face Recognition

Kartik Narayan, Vishal M. Patel

2026-07-01视觉感知

低分辨率人脸识别受探针图像退化、HR图库与LR探针域差异及微调遗忘影响,单一编码器难以兼顾两域。FaceMoE将Transformer中的FFN替换为稀疏激活的多专家,并用top-k路由按分辨率和面部语义区域分配token,以保留预训练知识并提取更稳健特征。文中在11个HR、混合质量和LR数据集上报告优于现有方法。

GEAR: Guided End-to-End AutoRegression for Image Synthesis Figure 1
2026-07-01cs.CV

GEAR: Guided End-to-End AutoRegression for Image Synthesis

Bin Lin, Zheyuan Liu, Chenguo Lin, Sixiang Chen, Yunyang Ge, Yunlong Lin, Jianwei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Li Yuan

2026-07-01视觉感知

本文针对视觉生成中“先训 tokenizer、再冻结训练生成器”导致离散潜空间未必易于自回归建模的问题,提出 GEAR:用硬分支保持真实 VQ token 的下一词预测训练,用可微软分支仅通过表征对齐反向引导 tokenizer,避免 STE 端到端训练造成码本坍塌。结果显示其在 ImageNet 上相对 LlamaGen-REPA 最高可加速约 10 倍 gFID 收敛,并在不同模型规模、VQVAE/LFQ/IBQ 量化器和文生图设置中保持改进。

PointSplat: Compact Gaussian Splatting via Human-Centric Prediction Figure 1
2026-07-01cs.CV

PointSplat: Compact Gaussian Splatting via Human-Centric Prediction

Yujie Guo, Yudong Jin, Lingteng Qiu, Zehong Shen, Zhen Xu, Jing Zhang, Xianchao Shen, Hujun Bao, Sida Peng, Xiaowei Zhou

2026-07-01三维

面向沉浸式直播/全息通信中带宽和算力受限的实时人体三维重建,PointSplat指出逐视角预测会重复编码同一人体,造成高斯数量和传输冗余;其改为在人体中心的3D点集上预测高斯,结合粗几何代理、光线投射删去内部点并建立2D-3D对应,再用Point-Image Transformer融合外观与几何。实验显示其在多个人体数据集上以约三分之一高斯数量取得更好的新视角质量,并对视角数和分辨率变化更稳健。

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE Figure 1
2026-07-01cs.CV

SpheRoPE: Zero-Shot Optimization-Free 360 Panorama Generation with Spherical RoPE

Or Hirschorn, Aaron Olender, Eli Alshan, Ianir Ideses, Lior Fritz, Sagie Benaim

Tel-Aviv University, Hebrew University of Jerusalem

2026-07-01优化算法

针对VR与机器人仿真等场景需要无缝360°环境、而现有方法依赖全景数据微调或慢速推理优化的问题,SpheRoPE的关键洞察是预训练DiT已有部分全景先验,只需在推理时把RoPE改为球面几何编码,并用语义畸变CFG约束ERP拓扑。实验显示其在Flux、LTX等图像/视频骨干上无需训练即可获得更好的接缝一致性、人类偏好和多项竞争性指标。

FLORA: A deep learning approach to predict forest attributes from heterogeneous LiDAR data Figure 1
2026-07-01cs.CV

FLORA: A deep learning approach to predict forest attributes from heterogeneous LiDAR data

Emilie Vautier, Clément Mallet, Cédric Vega

2026-07-01视觉感知

针对国家尺度森林清查中 LiDAR 采集季节、传感器与飞行条件不一致导致模型难迁移的问题,FLORA 用八叉树点云骨干直接学习三维结构,并通过后融合门控引入生态与时空变量。法国 32052 个样地实验显示,多季节联合训练比季节专用模型更稳健;辅助变量总体增益有限但利于树种体积分解,优势高 R²约0.88、总蓄积 R²约0.74。

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers Figure 1
2026-07-01cs.CV

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran

University of Wisconsin–Madison, Johns Hopkins University, Rutgers University, † Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-07-01生成模型

针对一阶扩散蒸馏默认师生共享潜空间、因分辨率和 VAE 不匹配而难以把 SD3.5/Flux 等大教师迁移到 SD1.5 等轻量学生的问题,论文提出 Cross-Space Distillation,并用轻量 Bridge 将学生 latent 对齐到教师空间,无需改学生骨干。实验显示 SD1.5 的 HPSv3 从 5.4 提升到 9.4,同时保持一阶推理和部署兼容性。

Automated Background Swapping for Robustness against Spurious Backgrounds Figure 1
2026-07-01cs.CV

Automated Background Swapping for Robustness against Spurious Backgrounds

Cesar Roder, Kajetan Schweighofer

Johannes Kepler University Linz, Austria, Cognizant AI Lab, USA, Work partly done while at Johannes Kepler University Linz, Austria

2026-07-01安全鲁棒

这篇论文针对图像分类模型容易把类别与背景的伪相关当作捷径、在背景分布变化时失效的问题,提出 AutoBackSwap:用少量块级前景标注训练辅助分割器,补全背景后随机重组前景与背景做数据增强。核心洞察是无需训练集中出现打破伪相关的样本,也能通过自动背景交换削弱背景依赖;实验显示在多种含伪背景基准上优于既有方法,且几百个标注样本和简单补全策略已基本够用。

CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation Figure 1
2026-07-01cs.LG

CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation

Sanghyuk Chun, William Yang, Amaya Dharmasiri, Olga Russakovsky

Princeton University

2026-07-01视觉语言安全鲁棒

本文针对多模态大模型在开放式视觉语言任务中难以可靠估计“不知道什么”的问题,指出不确定性既来自提示/任务定义的答案空间,也来自输入与多个可行答案的语义匹配。CoMet引入匹配变量,将不确定性分解为上下文项和多重性项,并用轻量后置模块在推理时免生成、免采样地估计。实验覆盖开放式VQA、幻觉检测和多选VQA,显示其较现有置信度与采样式方法更稳定且高效。

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts Figure 1
2026-07-01cs.CV

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

2026-07-01视觉感知

这篇论文针对多模态大模型使用文本 CoT 推理时延迟高、长链条易累积错误的问题,提出 CoLT:将中间推理压缩为少量连续“潜在思维”步骤,并用轻量外部解码器做前向/后向逐步监督,再配合内部转移监督稳定训练;推理时移除监督模块以保效率。八个多模态基准上,CoLT 优于 CODI、SIM-CoT 等潜在推理方法,并相较文本 CoT 将总体推理时间降至约 1/10、文本解码时间降至约 1/22。

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs Figure 1
2026-07-01cs.CV

ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

Yuhao Wang, Mu Qiao, Haiwen Diao, Yunzhi Zhuge, Pingping Zhang, Xindong Zhang, Lei Zhang, Huchuan Lu

2026-07-01视觉感知

针对多模态大模型视觉 token 过长导致推理成本高、现有训练无关剪枝会削弱视觉注意力的问题,ERA指出“Attention Logit Collapse”源于用单个中心近似簇内累计注意力,并用头级熵选择锚点、回收被剪 token、向注意力 logit 注入偏置来校正分布。实验覆盖单图、多图和视频,在多种 MLLM 与 vLLM 部署中保持性能并降低 FLOPs、延迟、prefill 与缓存开销。

LUNA: Learning Universal 3D Human Animation Beyond Skinning Figure 1
2026-07-01cs.CV

LUNA: Learning Universal 3D Human Animation Beyond Skinning

Peng Li, Rawal Khirodkar, Junxuan Li, Yuan Dong, Chen Cao, Yuan Liu, Wenhan Luo, Yike Guo, Shunsuke Saito

2026-07-01三维

LUNA针对单目三维人体动画仍依赖LBS和参数化人体模型、易受拟合误差与姿态抖动影响的问题,提出直接从RGB图、2D关键点、草图或跨身份角色等2D驱动信号预测3D Gaussian形变的无LBS框架。其关键在于用Transformer解耦全局刚体运动与局部非刚性动态,并以LBS教师作软结构先验结合未标注视频训练。实验显示其在视觉质量上接近LBS方法,同时具备更自然运动、较少抖动和零样本跨身份驱动能力。

Planar-SfM: Camera Pose Estimation via Homography Graph Embeddings Figure 1
2026-07-01cs.CV

Planar-SfM: Camera Pose Estimation via Homography Graph Embeddings

Gabi Pragier, Matan Karklinsky, David Ungarish, Avi Ben-Cohen

2026-07-01三维

这篇论文针对传统 SfM 在单一或强平面场景中因极线几何退化而难以估计相机位姿的问题,提出将平面从“退化源”转为几何约束来源:由多对图像的单应性分解生成位姿图,再用基于几何与视觉一致性的谱嵌入筛除不可靠边,并抽取一致生成树恢复位姿。实验显示其在篮球场等平面主导场景显著优于既有方法,在 IMC Phototourism 等一般户外场景也达到或超过当前方法。

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments Figure 1
2026-07-01cs.MA

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

Fudan University, Shanghai Innovation Institute, The Chinese University of Hong Kong

2026-07-01视觉语言

论文针对现有具身多智能体评测多依赖文本或符号状态、难以刻画视觉观察下协作机制的问题,提出 MECoBench,在 VirtualHome 中覆盖多类家务任务、并行/顺序结构、1–5 个智能体及集中/去中心化等模式。实验显示,协作通常提升完成率,但团队扩大后因协调开销呈倒 U 型;通信是主要增益来源,且在噪声先验和探索条件下能增强鲁棒性。

AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer Figure 1
2026-07-01cs.CV

AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer

Xinyu Hou, Xiaoming Li, Zongsheng Yue, Chen Change Loy

S-Lab, College of Computing & Data Science, Nanyang Technological University

2026-07-01视觉感知

本文针对单张照片后期景深/焦外编辑常受限于全清晰输入、强制去模糊会丢失源图虚化线索的问题,提出 AnyBokeh:用有符号 CoC 与视差估计源图“光学指纹”,再迁移到目标焦距/光圈,并以源/目标 CoC 双条件生成相对虚化变化。实验显示其在任意到任意虚化、全清晰转虚化和离焦去模糊上更可控,且减少全清晰重建与测试时标定依赖。

DEMUN: Fast and accurate discovery of music notation in very large collections Figure 1
2026-07-01cs.DL

DEMUN: Fast and accurate discovery of music notation in very large collections

Vojtěch Dvořák, Filip Bím, Jiří Mayer, Martina Dvořáková, Markéta Herzanová Vlková, Pavel Pecina, Petr Žabička, Jan Hajič jr

2026-07-01视觉感知

这篇论文针对大型图书馆中未被元数据标注的乐谱页难以被 OMR 系统发现的问题,提出 DEMUN:用两阶段轻量图像分类先快速预筛、再精筛,以适应数千万页规模和极低阳性率场景。系统将网络与计算负载显著降低,在摩拉维亚图书馆 400 万张图像测试中发现约 1500 页乐谱,假阳性率为 0.015%,并估计全馆仍有 2–3 万页相关材料可挖掘。

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration Figure 1
2026-07-01cs.CV

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujing Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni

2026-07-01视觉感知强化学习规划控制

论文针对视频生成在专业制作中难以精确控制几何、动作、镜头和光照、反复抽卡成本高的问题,提出 World Narrative Model:先由协同智能体把文本、参考视频等转成可编辑的 3D+T 物理叙事蓝图,再驱动冻结或轻量适配的视频模型渲染。实验称该范式能显著减少随机试错,使空间布局、角色运动和摄影更贴合创作者意图,但具体增益来源仍需更多独立验证。

FlexViT: A Flexible FPGA-based Accelerator for Edge Vision Transformers Figure 1
2026-07-01cs.AR

FlexViT: A Flexible FPGA-based Accelerator for Edge Vision Transformers

Hubert Dymarkowski, Xingjian Fu, Rappy Saha, Jude Haris, José Cano

School of Computing Science, University of Glasgow, Scotland, UK

2026-07-01视觉感知

面向边缘设备部署标准与混合 ViT 时,FC/卷积混合、张量形状变化大和 FPGA 资源受限会削弱固定加速器效率。FlexViT 将 FC 与卷积经运行时 im2col 统一映射到 INT8 GEMM 引擎,并用可重构双模式数据流和深度优先分块减少片外部分和传输。在 PYNQ-Z2 上,其卸载层加速 1.77–2.74 倍,端到端最高较 CPU 提升 1.40 倍。

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs Figure 1
2026-07-01cs.CV

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs

Haojian Huang, Harold Haodong Chen, Meng Luo, Junjia Du, Shanqing Xu, Ziheng Chen, Yanxiang Huang, Yinchuan Li, Ying-Cong Chen

The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China, The Hong Kong Polytechnic University, Hong Kong SAR, China, National University of Singapore, Singapore, Nanyang Technological University, Singapore, Huazhong University of Science and Technology, Wuhan, China, University of Illinois Urbana-Champaign, Urbana, IL, United States, code and data are available at the project page., is labor-intensive, as fixed storylines and spatio-temporal dependencies require

2026-07-01视觉感知规划控制数据集/基准

针对现有视频幻觉评测常把语言诱导、背景变化与前景语义混在一起的问题,本文提出 PairFlow,用生成式流程构造背景高度一致、前景语义相反的视频对,并发布 VidPair-Halluc,含 1K 对视频和 11K 个时空问答,覆盖 10 类语义。实验显示主流大视频模型及现有缓解方法在这种受控细粒度设置下仍明显不稳,说明错误更可能来自真实视觉 grounding 不足。

InstanceControl: Controllable Complex Image Generation without Instance Labeling Figure 1
2026-07-01cs.CV

InstanceControl: Controllable Complex Image Generation without Instance Labeling

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

2026-07-01视觉感知规划控制

本文针对 ControlNet 类方法在复杂多实例场景中容易把属性分配到错误对象、而现有改进依赖人工实例标注的问题,提出 InstanceControl。其核心洞察是失败主要来自文本实例与视觉条件区域无法自动对齐,因此引入 VLM 解析实例描述并预测对应掩码,再在生成过程中用自适应掩码细化修正噪声。实验在边缘、深度、HED 等条件上优于 FLUX ControlNet 及多种需标注方法,显示更好的实例级保真与控制精度。

MVP-Nav: Multi-layer Value Map Planner Navigator Figure 1
2026-07-01cs.RO

MVP-Nav: Multi-layer Value Map Planner Navigator

Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao Lu

Shanghai Jiao Tong University

2026-07-01视觉感知

MVP-Nav面向无深度传感器的零样本目标导航,针对RGB-only方法容易语义可行但物理不安全的问题,利用3D基础模型把2D语义实例重投影为3D有向包围盒,并以全局空间语义列表和多层价值图统一语义优先级与几何占据约束。实验称其在零样本ObjectNav基准上显著优于现有depth-free方法,说明结构化物理先验可部分弥补缺失深度信息。

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation Figure 1
2026-07-01cs.CV

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang

2026-07-01视觉感知规划控制

面向自动驾驶仿真中构造长尾风险场景,DriveWeaver针对传统插入车辆依赖3D资产、易出现光照风格不一致且难规模化的问题,将车辆插入改写为点云条件视频修复:用点云渲染提供几何约束,并通过全局到局部层级生成保持长时身份一致,再蒸馏为3D Gaussian以支持实时渲染。实验在Waymo和PandaSet上显示其相较基线提升视觉真实感与几何一致性。

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference Figure 1
2026-07-01cs.CV

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu

Tsinghua Shenzhen International Graduate School, Shenzhen, China, Sun Yat-sen University, Zhuhai, China, National Supercomputing Center in Shenzhen, Shenzhen, China, Tsinghua University, Beijing, China

2026-07-01视觉语言

针对多模态大模型高分辨率视觉 token 使推理预填充开销上升的问题,论文指出后层视觉状态虽仍大幅更新,却常难以影响答案表征,存在“答案静默”冗余;据此将层内 attention 与 FFN 分开评估并按算子跳过冗余视觉计算,同时保留完整视觉序列。三类 MLLM、10 个 VQA 基准上,Qwen3-VL 可降 33.7% TFLOPs,保持约 99.5% 原模型性能。

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception Figure 1
2026-07-01cs.CV

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

2026-07-01数据集/基准

面向路侧协同感知中 LiDAR 分辨率、距离导致点云稀疏且现有数据集难以隔离评估的问题,RESOLVE 提供真实路口同步相机与三档分辨率 LiDAR 数据、22 万个 3D 标注及检测/跟踪基准。其核心价值在于控制环境变量比较单模态与融合模型,实验显示相机-LiDAR 融合可在低分辨率或远距离稀疏点云下部分补偿性能下降,但场景仍限于单一路口。

Harnessing Textual Refusal Directions for Multimodal Safety Figure 1
2026-07-01cs.AI

Harnessing Textual Refusal Directions for Multimodal Safety

Moreno D'Incà, Massimiliano Mancini, Nicu Sebe

University of Trento

2026-07-01视觉语言安全鲁棒

针对多模态大模型难以收集不安全图像/视频数据、主要依赖语言骨干安全性的瓶颈,本文发现文本拒答方向可跨模态迁移,但受层选择、强度和模态错位影响;提出免训练的 MARS,通过激活重居中、信任域内自适应 steering 与层选择增强拒答。五个模型和多类安全、效用、视频 jailbreak 基准上,MARS 在保持效用的同时稳定提升安全性,如 Qwen3-VL 视频拒答率提升 59.4%。

SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving Figure 1
2026-07-01cs.CV

SENSE-VAD: Sentient and Semantic Video Anomaly Detection for Autonomous Driving

Nghia T. Nguyen, Lokman Bekit, Yasin Yilmaz

University of South Florida, tated with per-frame binary labels. A key design principle, publicly available.1, with a child near an elementary school [36]. The pattern, labels, yielding 108 annotated clips in total (Table 4)., mark with per-frame labels, built across three CARLA, supervised methods exploit video-level anomaly labels un-, vised methods derive pseudo-labels from feature statistics, is a surveillance dataset recorded at a university crosswalk, error, or crime-category labels rather than social context.

2026-07-01视觉感知

面向自动驾驶中“危险来自社会关系而非运动异常”的长尾场景,SENSE-VAD构建了首个以社会复杂异常为核心的合成VAD基准:用CARLA/UE生成15类、6大类、54万帧逐帧标注视频,并加入真实片段检验迁移。对11种现有方法的评测显示最高帧级AUC仅57.2%,说明依赖轨迹、外观或通用VLM推理的检测器仍难识别这类关系型风险。

Towards Voxel Spacing Consistency for Medical Image Segmentation Figure 1
2026-07-01cs.CV

Towards Voxel Spacing Consistency for Medical Image Segmentation

Xin You, Runze Yang, Minghui Zhang, Hanxiao Zhang, Han Li, Yi Yu, Jie Yang, Nassir Navab, Yun Gu

Park Oriental Huaxia Cardiovascular Health Research Institute (GUSU2023002). (Corresponding authors: Yun Gu, Yi Yu.)X. You, R. Yang, M. Zhang, H. Zhang, J. Yang and Y. Gu are with the Institute of Medical Robotics, Shanghai Jiao Tong University

2026-07-01视觉感知

论文关注医学体数据分割中常被当作预处理细节的轴向体素间距不一致问题,指出线性重采样难以处理层间形变和语义边界。作者提出 Consispace,将 ODE 层间连续插值、预训练视觉特征构建的层内语义相关性与 INR 任意尺度重采样结合,使重采样更贴合解剖与类别结构。多数据集实验显示其重建质量、层间平滑性和作为 nnU-Net、Swin UNETR、MedSAM-2 预处理时的分割表现均优于标准线性插值。

Real-Time Source-Free Object Detection Figure 1
2026-07-01cs.CV

Real-Time Source-Free Object Detection

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan

2026-07-01视觉感知

面向自动驾驶、监控和机器人等实时场景,论文指出现有无源域目标检测多依赖重型检测器,难以兼顾延迟和模型大小。作者基于 YOLOv10 提出 RT-SFOD,用双头伪标签融合提升召回并抑制噪声,用多尺度表示多样化缓解域偏移下特征退化;模块仅训练时使用。实验称在多域偏移基准上较前沿方法提升 1.4–3.5% mAP,吞吐约高 1.3 倍、参数约少一半。

PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving Figure 1
2026-07-01cs.CV

PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving

Kyuhwan Yeon, Benjamin Ramtoula, Daniele De Martini

Mobile Robotics Group, University of Oxford, United Kingdom, selves become unreliable. Our project page is available at https://ori-, due to its scalability and conceptual simplicity, directly mapping raw sensor ob-

2026-07-01视觉感知

这篇论文针对端到端自动驾驶过度依赖瞬时车载感知、缺乏类似人类驾驶记忆的前瞻性这一问题,提出将沿规划路线离线采集的街景视觉嵌入作为地理空间视觉先验,并通过双记忆与自适应门控模块注入现有规划器,在先验错配时可回退。NAVSIM-v2结果显示,该方法能稳定提升多种端到端基线,并在传感器退化场景下增强鲁棒性。

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning Figure 1
2026-07-01cs.CV

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang

Korea University, Kyung Hee University, Hanyang University College of Medicine

2026-07-01视觉语言强化学习

本文针对医疗多模态 VQA 中只按最终答案给奖励导致的稀疏信用分配问题,指出早期推理错误会持续放大并造成失败级联。作者提出 MRPO,在 GRPO 框架中引入逐步推理奖励,并对最终答错样本的更早无效步骤施加指数级更强惩罚。实验显示其在三个 MLLM 骨干上优于 GRPO 和 GDPO,Qwen3-VL-8B 还超过 HuatuoGPT-Vision-34B 2.79 分,早期失败率从 64.0% 降至 13.0%。

Absorption-Feature-Guided Distance-Decoupled Estimation and Band Selection for LWIR Hyperspectral Passive Ranging Figure 1
2026-07-01cs.CV

Absorption-Feature-Guided Distance-Decoupled Estimation and Band Selection for LWIR Hyperspectral Passive Ranging

Shuo Liu, Chen Fan, Zhihe Chen, Xiaolin Huang, Lilian Zhang

2026-07-01视觉感知

针对长波红外高光谱被动测距中距离吸收特征与温度、发射率、路径辐射强耦合且全波段联合优化昂贵的问题,论文提出ADER:用B样条平滑发射率抑制对尖锐大气吸收的过拟合,并按臭氧吸收线索区分发射/反射主导像素,再结合面向距离Fisher信息的贪心选带。真实场景中其全波段和20波段结果均与LiDAR结构一致,较公开全波段方法精度更好且约快两个数量级。

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior Figure 1
2026-07-01cs.CV

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu

2026-07-01生成模型

本文针对车道拓扑推理中“先检测再关联”导致的端点不一致和遮挡下漏检问题,提出 TopoGPT:将车道图序列化为离散 token,用 330 万地图场景预训练自回归模型学习道路几何先验,再通过感知适配器迁移到多视角图像 BEV 特征。OpenLane-V2 上相较既有方法车道级平均提升 6.4、点级平均提升 11.6,生成的车道图更连续完整,但自回归解码带来延迟和误差累积风险。

MuSViT: A Foundation Vision Model for Sheet Music Representation Figure 1
2026-07-01cs.CV

MuSViT: A Foundation Vision Model for Sheet Music Representation

Carlos Penarrubia, Antonio Rios-Vila, Eliseo Fuentes-Martinez, Juan C. Martinez-Sevilla, Francisco J. Castellanos, María Alfaro-Contreras, Jorge Calvo-Zaragoza

2026-07-01视觉感知

针对海量乐谱仍停留在图像、传统 OMR 难以跨版式和噪声泛化的问题,MuSViT 将乐谱视为具有符号结构的专门视觉域,用 970 万页 IMSLP 乐谱通过 MAE 和“合成预热到真实数据”的课程训练 ViT。结果显示,其冻结特征优于通用视觉编码器,微调后在四类乐谱识别、检测和难度分类任务上总体达到或超过专门方法,并且嵌入空间更贴近音乐转写内容。

Self-Supervised Temporal Regularization for Landmark-Based Cardiac Segmentation with Automatic AHA Regional Mapping Figure 1
2026-07-01cs.CV

Self-Supervised Temporal Regularization for Landmark-Based Cardiac Segmentation with Automatic AHA Regional Mapping

David Montalvo-García, Nicolás Gaggion, María J. Ledesma-Carbayo, Enzo Ferrante

2026-07-01视觉感知

这篇论文针对基于 landmark 的心脏超声分割逐帧处理导致的边界抖动和运动不连续问题,在已学习解剖对应关系的图模型上加入后训练自监督时间正则,通过惩罚相邻帧速度与加速度突变提升时序一致性,并利用 landmark 自动映射到 AHA 17 分区。CAMUS 验证显示该组合可支持更稳定的分割、运动估计和区域性异常分析,但具体定量增益幅度文中片段未充分说明。

SpikeLogBERT: Energy-Efficient Log Parsing Using Spiking Transformer Networks Figure 1
2026-07-01cs.CV

SpikeLogBERT: Energy-Efficient Log Parsing Using Spiking Transformer Networks

Thuan Bui, Duong Do, Tung Vu, Duc-Tho Mai, Cong-Kha Pham

Swinburne Vietnam, FPT University, Posts and Telecommunications Institute of Technology, Academy of Cryptography Techniques, The University of Electro-Communications

2026-07-01视觉感知

该文针对持续日志解析中神经模型计算与能耗偏高的问题,提出用脉冲 Transformer 结合 BERT 教师蒸馏来保留日志语义表示,同时利用稀疏脉冲降低推理操作量。实验仅在 HDFS 日志集上报告,SpikeLogBERT 达到 99.997% 解析准确率,理论 45nm CMOS 能耗约 0.82 mJ,相比 ANN 基线最高低 62.6 倍;但评估范围较窄,实际硬件增益仍需进一步验证。

Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation Figure 1
2026-07-01cs.CV

Mesh BDF: Barycentric Dominance Field for 3D Native Mesh Generation

Gaochao Song, Haohan Weng, Luo Zhang, Zibo Zhao, Shenghua Gao

HKU, 2 Shenzhen Loop Area Institute, 3 Tencent Hunyuan 3D, 4 NTU

2026-07-01三维

这篇论文针对自回归原生网格生成受序列长度、顶点量化和材质属性支持限制的问题,提出将三角面片上的最大重心坐标定义为 Barycentric Dominance Field,把离散拓扑转成类似纹理的连续表面信号,从而可直接接入现有 3D VAE/扩散框架并与 PBR 纹理统一生成。实验称其相比自回归方法在网格质量、可扩展性和鲁棒性上更好,但具体增益中 scaling / data 的贡献仍需进一步辨析。

NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics Figure 1
2026-07-01cs.GR

NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics

Jingye Qiu, Shizhe Zhou

2026-07-01视觉感知

这篇论文针对现有可微矢量渲染多局限于 Bézier/B 样条、难以支持 CAD 中常用 NURBS 及其有理权重和非均匀节点的问题,提出将 NURBS 曲线与闭合区域表示为连续高斯场,并用 splatting 实现稳定可微渲染。实验显示其在书法重建、emoji 矢量化和长样条抽象中优于 DiffVG/LIVE 等基线,重建质量更高且通常更快,但区域填充策略仍偏启发式。

Estimating Velocity of Spheres from Rolling-Shutter Image(s) Figure 1
2026-07-01cs.CV

Estimating Velocity of Spheres from Rolling-Shutter Image(s)

Wenjie Xue, Jun Yang, Jingmin Wang, Limin Shang

2026-07-01视觉感知

这篇论文针对高速球体速度与旋转估计依赖高速全局快门、事件相机或雷达的问题,反过来把普通滚动快门相机的畸变当作时间线索。核心做法是将图像特征反投影为3D射线,并利用球体几何把平移和角速度解耦为两阶段优化,减少对显式2D-3D对应和纹理的依赖。实验覆盖仿真与真实高尔夫发射监测原型,显示在高速条件下可较稳定地恢复运动参数。

JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering Figure 1
2026-07-01cs.CV

JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering

Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu

Ruifei Zhu is with Chang Guang Satellite Technology Co., Ltd. (CGSTL), Ouqiao Ma is with the College of Communications, Engineering, Army Engineering University of PLA, Nanjing 210007

2026-07-01视觉语言数据集/基准

这篇论文针对遥感变化检测只给出像素级“哪里变了”、缺少“变成什么/为何变化”的语义缺口,将 JL1-CD 扩展为统一包含二值变化掩码、变化描述和变化问答的多任务基准。核心创新在于用多模态 LLM 生成、视觉证据判别与专家复核构建 17,021 条 caption 和 20,060 个八类 QA。主要结果是发布覆盖 5,000 对吉林一号双时相影像的 JL1-CC&QA 数据集;模型增益未充分说明,贡献主要来自数据与标注体系。

Rhythm-Structured Predictive Learning for Remote Photoplethysmography Figure 1
2026-07-01cs.CV

Rhythm-Structured Predictive Learning for Remote Photoplethysmography

Ba-Thinh Nguyen, Huu-Dung Nguyen, Thi-Duyen Ngo, Thanh-Ha Le

VNU University of Engineering and Technology, Hanoi, Vietnam

2026-07-01视觉感知

本文针对自监督 rPPG 容易学到人脸外观、Mamba 时序建模只按时间扫描而忽略脉搏准周期结构的问题,提出 RhythmJEPA:用联合嵌入预测替代像素重建,并通过 CRSP 解码潜在生理相位、DOM 同时按时间与节律状态扫描,配合轻量 SPM 提取脉搏敏感 token。在 PURE、UBFC-rPPG、MMPD 上取得相对代表方法有竞争力的结果,但具体增益幅度和来源需结合完整实验表进一步判断。

MemLearner: Learning to Query Context memory for Video World Models Figure 1
2026-07-01cs.CV

MemLearner: Learning to Query Context memory for Video World Models

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

2026-07-01视觉感知强化学习

MemLearner针对视频世界模型长时生成中因上下文窗口有限导致的场景遗忘与不一致问题,指出基于视场重叠或点云匹配的规则检索难以处理遮挡和动态物体。其核心是引入查询 token,让生成模型自身在上下文、查询与预测 token 间学习自适应取用历史记忆,并结合含遮挡/动态物体的渲染数据与真实视频联合训练。实验显示其在场景一致性和记忆能力上优于既有方法,尤其在复杂遮挡和动态场景中更明显。

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization Figure 1
2026-07-01cs.CV

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

The Chinese University of Hong Kong, Shanghai Artificial Intelligence Laboratory

2026-07-01强化学习优化算法

UniCoder针对视觉到代码任务中SFT难以实现像素级对齐、RL奖励过粗且探索易停滞的问题,提出统一强化学习框架:用辅助LLM解析代码中的颜色、坐标等符号属性以构造细粒度奖励,并在低表现rollout中注入参考代码引导优化。实验覆盖图表、SVG、网页和屏幕基准,8B模型超过开源基线并接近闭源模型,但具体增益在多大程度来自数据或训练规模仍需进一步拆分说明。

Semantic-Aware Multiple Access via Spatial Redundancy Exploitation for Uplink-Dominant 6G Use Cases Figure 1
2026-07-01cs.NI

Semantic-Aware Multiple Access via Spatial Redundancy Exploitation for Uplink-Dominant 6G Use Cases

Hamidreza Mazandarani, Masoud Shokrnezhad, Tarik Taleb, Onur Günlü

2026-07-01视觉感知

面向车联网等上行占优的 6G 视觉业务,论文指出现有语义通信多按用户独立选取内容,忽略相邻车辆视野重叠带来的跨用户冗余。其核心做法是把多址接入改写为感知与传输联合控制:车辆先经 V2V 交换部分图像块估计空间冗余,再只向基站上传语义重要且非冗余的块,并借助邻车视角重建。仿真显示,在密集城市场景中,高保真重建用户比例提升,但具体绝对增益和重建模型细节仍文中未充分说明。

WIDER-FAIR: An Annotated Version of the WIDER-FACE Dataset for Fairness Evaluation Figure 1
2026-07-01cs.CV

WIDER-FAIR: An Annotated Version of the WIDER-FACE Dataset for Fairness Evaluation

Maxime Moussi, Benoît Ronval, Siegfried Nijssen, Félicien Schiltz

2026-07-01数据集/基准

面向人脸检测落地中的群体公平性评估,论文指出现有基准缺少敏感属性标注,因而在 WIDER-FACE 子集上人工补充感知族裔与性别标签,形成 WIDER-FAIR。作者用嵌入、KNN 与 t-SNE 检查标注一致性,并以 YOLOv5 做消融,发现黑人面孔检测性能更低,且移除该群体训练会带来最大的公平性差距。

Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints Figure 1
2026-07-01cs.CV

Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints

Jungkon Kim, Cheolseung Jung, Jong-Min Choi, Juseong Lee

Samsung Electronics, AI Platform Center

2026-07-01优化算法

本文针对换脸深伪中未经授权的身份操纵,指出现有对抗保护常用固定/随机目标且扰动覆盖过广,难以在换脸模型的身份—风格解耦下保留有效信号。Phantom通过自适应合成“身份偏移但属性保持”的目标来约束潜空间方向,并用语义人脸掩码限制扰动区域。实验显示其在UniFace、INSwapper、SimSwap的dodging保护成功率分别提升27.8%、25.6%、16.6%,最高达98.2%,同时改善感知质量。

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models Figure 1
2026-07-01cs.CV

Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models

Enrico Cassano, Riccardo Renzulli, Rayyan Ahmed, Marco Grangetto, Stephan Alaniz

2026-07-01生成模型

本文针对扩散模型概念遗忘中 SAE 可解释但直接操控易失真的问题,指出稀疏/单义特征更适合作为检测器而非控制旋钮。作者提出 PER:用 SAE 定位含目标概念的图像区域,再以同一特征图中的无概念 patch embedding 替换,保持激活分布。结果在 UnlearnCanvas 对象遗忘平均达 95.33%,较 SAE 类 SOTA 提升 3.82%,并减少伪影与调参成本。

Intrinsically Stable Spiking Neural Networks: Overcoming the Performance Barrier in the Absence of Batch Normalization Figure 1
2026-07-01cs.CV

Intrinsically Stable Spiking Neural Networks: Overcoming the Performance Barrier in the Absence of Batch Normalization

Ruichen Ma, Xiaoyang Zhang, Jian Bai, Guanchao Qiao, Liwei Meng, Ning Ning, Yang Liu, Shaogang Hu

University of Electronic Science and Technology of China (UESTC) Beijing Institute of Remote-Sensing Equipment Shenzhen Institute for Advanced Study, UESTC

2026-07-01视觉感知

这篇论文针对深层脉冲神经网络依赖动态批归一化、从而削弱神经形态硬件加法式推理优势的问题,指出无归一化训练失败的关键在于灾难性发放率衰减。作者提出 IS-SNN,用拓扑感知权重标准化和改造残差连接维持信号稳态,并将标准化离线折叠进静态权重。实验显示其在 VGG、ResNet 和 Transformer SNN 上接近或超过动态 BN,ImageNet 达 68.05%,且 FPGA 神经元 LUT 消耗降低 96.4%。

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization Figure 1
2026-07-01cs.RO

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization

Jingbo He, Michael Färber, Roberto Calandra

LASR Lab, TU Dresden, Project page: https://faerber-lab.github.io/RCT/, Code: https://github.com/faerber-lab/RCT

2026-07-01机器人视觉语言视觉感知学习理论数据集/基准

面向机器人在开放环境中触摸未见材料时的泛化问题,论文提出RCT触觉-视觉-语言数据集,保留完整机器人按压接触序列而非打散帧,并据此揭示随机帧划分会引入近重复泄漏。实验显示去除接触序列重叠使触觉到文本Recall@1下降17.7个百分点,进一步留出材料后仅为25.1±6.1%,说明新材料触觉泛化仍是关键瓶颈。

Semantic Occupancy Prediction with Dual Range-Voxel Representation Figure 1
2026-07-01cs.CV

Semantic Occupancy Prediction with Dual Range-Voxel Representation

Sitao Chen, Zhuangwei Zhuang, Hui Luo, Lizhao Liu, Qingyao Wu, Mingkui Tan

2026-07-01视觉感知

这篇论文针对激光雷达语义占据预测依赖多帧点云带来的计算开销和位姿噪声问题,提出用单帧点云同时构建 range-view 的紧凑上下文与 voxel-view 的几何结构,并通过双向 range-voxel 融合互补语义和空间信息。在 nuScenes-Occupancy、SemanticKITTI、SemanticPOSS 上验证有效,尤其单帧方法相较多帧基线在 nuScenes 上 mIoU 提升 5.4%,速度提升 2.1 倍。

Histogram-constrained Image Generation Figure 1
2026-07-01cs.CV

Histogram-constrained Image Generation

Haoming Liu, Yuanhe Guo, Yijia Cao, Shenji Wan, Hongyi Wen

2026-07-01视觉感知

这篇论文针对扩散生成中“文本控制过粗、ControlNet 等结构控制过细”的空档,提出 HIG:在采样过程中用最优传输把中间图像精确匹配到用户指定的颜色或潜变量直方图。方法无需训练、可与现有控制模块组合,实验展示了精确颜色分布控制、潜变量直方图约束和高容量信息嵌入,同时保持较好视觉质量;但信息隐藏也带来潜在滥用风险。

ShellMaker: Language-Guided Exterior Completion under Structural Constraints Figure 1
2026-07-01cs.CV

ShellMaker: Language-Guided Exterior Completion under Structural Constraints

Ruiqi Xu, Daniel Aliaga

2026-07-01优化算法

ShellMaker瞄准室内生成器只产出墙体与开口、缺少可用建筑外立面的断点,强调外观生成必须严格保持足迹、墙边界和门窗语义。其核心做法是把脚手架约束、参数化屋顶、LLM部件级提示、墙顶材质联合检索与几何感知装配串联起来,在不改动结构的前提下补全带PBR材质的外立面。实验覆盖200多个脚手架、500多种纹理和60个风格提示,相比检索式和无约束生成基线提升了建筑一致性、材质协调性与约束满足度。

Practical High-Fidelity Novel-View Synthesis of Mounted Lepidoptera Figure 1
2026-07-01cs.GR

Practical High-Fidelity Novel-View Synthesis of Mounted Lepidoptera

Kristof Overdulve, Lode Jorissen, Nick Michiels

Digital Future Lab, Flanders Make, Hasselt University

2026-07-01视觉感知

针对钉装蝴蝶等脆弱标本难以在微距浅景深下拍清细节、且无法直接拍摄腹面的数字化难题,论文提出结合手持焦点堆叠、非接触一表面镜采集和免分割镜面感知 3D Gaussian Splatting 的端到端流程。其核心洞察是先获得全清晰多视图并用点云对称性估计镜面,再统一重建真实与镜中腹面;在四个标本上得到可全方位浏览的照片级模型,并显示焦点堆叠优于直接用景深感知 3DGS 处理严重离焦输入。

REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction Figure 1
2026-07-01cs.CV

REDI: Corpus Aware Patch Ranking for DINOv3 Token Reduction

Chanjong Im, Sebastian Diem, Thomas Mandl

University of Magdeburg, University of Hildesheim

2026-07-01视觉感知

这篇论文针对 ViT token 裁剪中“固定预算该保留哪些 patch”的问题,把 DINOv3 最终层 patch 聚类成视觉词,并用类别条件 TF-IDF 与图像自身注意力相乘来排序,再通过保留、合并、压缩分配 token。实验在 ImageNet-1K 上将序列从 201 降到 107,Top-1 达 84.706%,高于 dense 基线 83.514% 和单独注意力/TF-IDF;但方法依赖真值类别和 dense attention,更像离线监督参考而非直接部署方案。

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models Figure 1
2026-07-01cs.CV

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yong Li, Baoquan Chen

AMAP CV Lab, Alibaba Group, Nanjing University, Tsinghua University, Peking University

2026-07-01强化学习数据集/基准

WorldRoamBench针对交互式世界模型在长时间开放探索中易出现动作漂移、画面退化、物理违背和重访失忆的问题,提出覆盖动作、视觉、物理、记忆四维的基准:用逐帧按键指标、分段漂移、可控性门控物理评估和轨迹解耦记忆测试揭示短片段/轨迹级评测的盲区。600+用例、10余个开闭源模型结果显示暂无模型能稳定兼顾各维度,即使最佳模型也仅达中等水平。

SAMBA: A Scatter-Guided Masked Bidirectional Mamba Foundation Model for SAR Target Recognition Figure 1
2026-07-01cs.CV

SAMBA: A Scatter-Guided Masked Bidirectional Mamba Foundation Model for SAR Target Recognition

Ke Wang, Xiaoyi Pan, Zhaoyu Gu, Xiaofeng Ai, Zhiming Xu, Feng Zhao, Shunping Xiao

2026-07-01视觉感知

这篇论文针对 SAR 目标识别中标注稀缺、Transformer 预训练计算开销高且通用遮罩忽视电磁散射先验的问题,提出 SAMBA:用线性复杂度双向 Mamba 编码器、散射引导的层级 MAE 遮罩和 SpatialMix 融合模块进行自监督预训练。实验称其在七个分类与检测数据集上多数指标达到 SOTA,并以更少参数提升少样本迁移能力。

Sparsity-Inducing Divergence Losses for Biometric Verification Figure 1
2026-07-01cs.CV

Sparsity-Inducing Divergence Losses for Biometric Verification

Dimitrios Koutsianos, Ladislav Mošner, Yannis Panagakis, Themos Stafylakis

2026-07-01视觉感知

本文针对 CosFace、ArcFace 等几何 margin 难以自然扩展到 α-divergence 稀疏概率框架的问题,提出 Q-Margin:不再改 logits,而是通过下调目标类参考测度来引入概率化 margin,并在 α→1 时退化为 CosFace。实验在 IJB-B/IJB-C、VoxCeleb 上显示其相对 ArcFace/CosFace 在低 FAR 场景更稳,且稀疏后验有助于大规模身份训练的精确与省内存计算。

DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments Figure 1
2026-07-01cs.RO

DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments

Wen Jiang, Hanfang Liang, Li Wang, Kangyao Huang, Wang Xu, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hongwei Duan, Bin Xu, Xiangyang Ji, Huaping Liu

2026-07-01机器人视觉语言视觉感知规划控制

DynFly关注UAV视觉语言导航中“语义决策到可执行飞行”之间的运动接口缺口:现有方法多输出离散动作或稀疏航点,难以保证轨迹连续性与动力学可跟踪性。其核心是在保留原VLN推理管线的基础上,用B样条控制点表示轨迹,并以Spline-DiT和flow matching生成连续3D轨迹,同时加入速度、加速度、朝向和目标对齐监督。OpenUAV实验显示其同时提升导航指标和轨迹质量,在Test Unseen Full上较强基线提高NDTW 4.69、SDTW 2.40、SR 2.14点,并降低NE 4.51米。

Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning Figure 1
2026-07-01cs.CV

Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning

Yuxiang Xie, Qi Lv, Jianming Xing, Zijian Hong, Xiang Deng, Weili Guan, Liqiang Nie

Harbin Institute of Technology, Shenzhen, 2 Ruoyu Technology

2026-07-01视觉感知

本文针对具身任务中视觉语言模型空间推理不足、且常混淆相机中心与物体中心参照系的问题,提出 RoboSpatialBrain:按任务选择性触发 <think> 与后置提示,仅用于需要推理的空位与尺寸兼容判断,并用显式参照系重定向处理方向歧义。实验显示该策略在 RoboSpatial-Home 上取得 80.9% 总成功率并获挑战第一,其中兼容任务由 40.0% 提升到 83.8%;微调虽在弱提示下有益,但与最佳提示组合叠加反而下降。

LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization Figure 1
2026-07-01cs.CV

LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization

Md Raqib Khan, Santosh Kumar Vipparthi, Subrahmanyam Murala

CVPR Lab, Trinity College Dublin, The University of Dublin, Dublin, Ireland CVPR Lab, Indian Institute of Technology Ropar, Rupnagar, Punjab, India

2026-07-01视觉感知

LiteMatch针对立体匹配中早期特征匹配和代价体不稳定导致依赖重型3D卷积、迭代细化或大模型先验的问题,主张从源头稳定代价分布。方法结合跨视图对应编码器与FFT高频编码器,并用CVC-Loss约束视差概率更尖锐单峰,再配轻量细化模块。实验显示其在3.36M至9.58M参数下,在Scene Flow、KITTI、Middlebury、ETH3D和DrivingStereo上取得有竞争力的EPE/D1与较强零样本跨域泛化。

PrISM-IQA: Image Quality Assessment Made Practical for Smartphone Photography Figure 1
2026-07-01cs.CV

PrISM-IQA: Image Quality Assessment Made Practical for Smartphone Photography

Shuyan Zhai, Jiaqi He, Weixia Zhang, Liang Wang, Zhenjie Lee, Zufeng Zhang, Kede Ma

Department of Computer Science, City University of Hong Kong, School of Computer Science, Institute of AI, Shanghai Jiao Tong University, OPPO Research Institute, School of Vehicle and Mobility, Tsinghua University

2026-07-01视觉感知

针对传统手机图像质量评估只给单一 MOS、难以指导 ISP 调参的问题,PrISM-IQA 将任务改为 53 类 ISP 相关缺陷的有序严重度诊断,并用累积序数编码结合结构化推理约束标签的层级与互斥关系。实验在重标注 SPAQ 和专家数据上显示其能做细粒度缺陷识别,线性探测表明表征仍保留整体感知质量信息,并可为 OpenISP 调参提供可操作反馈。

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation Figure 1
2026-07-01cs.CV

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

Francisco S. Neves, Pedro N. Pereira, Raul D.S.G. Campilho, Andry M. Pinto

2026-07-01视觉语言安全鲁棒

面向海上风电、油气平台巡检中无人机受电量限制且难以在浪涌甲板安全降落的问题,论文提出将USV主动稳平台与UAV自主进近解耦的双智能体框架:SAC控制3-RPU甲板补偿波浪,多模态RL融合视觉、热成像和LiDAR应对感知遮挡。高保真仿真15次试验实现100%降落成功,平均稳态效率87.8%,粗海况下96%时间保持甲板水平误差小于1°;但真实海试验证仍未充分说明。

What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States Figure 1
2026-07-01cs.CV

What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

Chen Liu, Ling Chen, Hanzhang Zhou, Xu Zhang, Quyu Kong, Panrong Tong, Wenhao Wang, Xin Yu, Steven Hoi, Yue Wang

2026-07-01视觉感知

这篇论文针对长程移动 GUI 任务中传统记忆只保存历史、难以判断数据当前角色而导致漏做、重复或越界操作的问题,提出 ATMem,将任务相关值、来源、约束和完成状态维护为可更新的执行状态,并用 STR-GRPO 学习何时使用记忆。实验显示 ATMem-UI 在 AndroidWorld、MobileWorld 和 DataScope 上提升长程执行,8B 模型在 AndroidWorld 达到 76.6% 成功率,超过更大或同规模基线。

Learning Structurally Consistent Representations for Multi-View Radar Semantic Segmentation Figure 1
2026-07-01cs.CV

Learning Structurally Consistent Representations for Multi-View Radar Semantic Segmentation

Ali Zia, Muhammad Umer Ramzan, Abdelwahed Khamis, Usman Ali, Abdul Rehman

2026-07-01视觉感知

本文针对雷达语义分割中回波稀疏、噪声大且多视图密度不一致的问题,提出 HyperRadar:用可学习超图建模同一物体多回波的高阶关系,并以非平衡最优传输做无对应跨视图对齐,再用注意力融合 RA/RD/AD 特征。在 CARRADA 与 RADIal 上分别达到 63.8% 和 83.4% mIoU,较此前最佳提升 1.7 和 2.3 点。

Preserve the Hard, Regenerate the Rest: Uncertainty-Guided Synthetic Training Data Augmentation with Diffusion Models Figure 1
2026-07-01cs.CV

Preserve the Hard, Regenerate the Rest: Uncertainty-Guided Synthetic Training Data Augmentation with Diffusion Models

Nikolai Röhrich, Julian Gleißner, Ahmed H. A. Ibrahim, Silvan Mertes, Tobias Huber

Zuse School of Excellence in Reliable AI

2026-07-01生成模型安全鲁棒

针对语义分割中稀有类别、小目标和复杂场景标注稀缺的问题,论文指出扩散增强不应按前景/背景粗分,而应保留当前模型最不确定的语义区域,仅重绘其余上下文,并只在原始保留像素上计算损失,从结构上避免标签错配。该方法无需额外控制模型,在 UAVID、Cityscapes、BDD100K 上分别带来 +3.68、+2.64、+1.57 mIoU,收益集中于公交、火车、航拍车辆等困难类别。

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning Figure 1
2026-07-01cs.CV

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

Kaitao Chen, Weiqian Zhao, Jiamin Wu, Qihao Zheng, Shangquan Sun, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

2026-07-01视觉语言强化学习

本文针对医学图像中有效视觉证据稀疏、密集视觉 token 易带来计算冗余和干扰的问题,提出 ViToS 双流强化学习框架,将视觉 token 剪枝建模为受 grounding 引导的策略选择,并用定位分支与稀疏推理分支的交叉反馈顺序优化缓解共享策略训练冲突。在七个医学基准上,方法将视觉 token 降至原序列的 77%,同时在 Lingshu-7B 和 HuatuoGPT-Vision-7B 上取得约 108.27% 与 104.16% 的相对性能。

DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers Figure 1
2026-07-01cs.CV

DPPE: Rethinking Camera-Based Positional Encoding for Scaling Multi-View Transformers

Shun Kenney, Teppei Suzuki

Keio University

2026-07-01视觉感知

本文针对多视角 Transformer 在放大新视角合成训练时,PRoPE 等相机位置编码后期性能停滞的问题,指出根因可能在于 value 中旋转与平移被耦合到同一维度,导致二者难以独立识别。作者提出 DPPE,将旋转和平移显式解耦并按几何角色注入 Q/K/V。实验显示其在长程训练中更稳定,并在视角数量外推、zoom-in 等场景优于 PRoPE,但简单相机轨迹数据上增益有限。

Localized Conformal Prediction for Image Classification with Vision-Language Models Figure 1
2026-07-01cs.CV

Localized Conformal Prediction for Image Classification with Vision-Language Models

Clément Fuchs, Tim Bary, Benoît Macq

2026-07-01视觉语言视觉感知

这篇论文针对传统保形预测只保证总体覆盖、难以照顾图像分类中局部样本差异的问题,将局部保形预测引入视觉语言模型分类。核心发现是直接用视觉特征余弦相似度加权并不能优于非局部基线,需对相似度做 sigmoid 式非线性变换并用校准集调参。九个自然图像数据集和多种 CLIP 骨干实验显示,该方法在保持边际覆盖保证的同时,能稳定、常显著地减小预测集合大小,但覆盖差距改善有限。

Temperature Field Reconstruction of Tungsten Monoblock Divertor on EAST using Physics-aware Neural Operator Transformer Figure 1
2026-07-01cs.CV

Temperature Field Reconstruction of Tungsten Monoblock Divertor on EAST using Physics-aware Neural Operator Transformer

Zikang Yan, Xiao Wang, Qingquan Yang, Zhendong Yang, Gaoting Chen, Zehua Chen, Bo Jiang, Jin Tang, Guosheng Xu

2026-07-01三维

面向 EAST 偏滤器在高热负荷下需实时重建钨单块三维温度场、而 FEM 计算过慢的问题,论文提出 PNOT,将边界热流建成结构化图,用图注意力和物理感知神经算子刻画局部/全局热扩散关系,并以 Sobolev 梯度约束增强物理一致性。基于有限元数据的实验显示,其较现有神经算子降低重建误差、保持温度梯度,并在未见工况上有更好泛化。

Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning Figure 1
2026-07-01cs.CV

Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning

Xu Yan, Huiqun Wang, Chen Wang, Lei Ren, Di Huang

2026-07-01三维安全鲁棒

本文针对3D点云MAE中解码器可直接利用掩码位置坐标进行重建的“位置泄漏”问题,指出现有方法会过度依赖位置嵌入而削弱编码器语义表征。作者提出MPL-MAE,通过重校准位置嵌入抑制绝对坐标信号并保留拓扑结构,再用门控接口动态控制位置注入。实验显示其在ModelNet40、ScanObjectNN等下游任务和噪声扰动下取得更好或更稳健表现,消融表明收益主要来自降低位置依赖。

AugSplat: Radiance Field-Informed Gaussian Splatting for Sparse-View Settings Figure 1
2026-07-01cs.CV

AugSplat: Radiance Field-Informed Gaussian Splatting for Sparse-View Settings

Lorenzo Lazzaroni, Riccardo Bollati, Daniel Barath, Michael Niemeyer, Keisuke Tateno

2026-07-01三维

AugSplat针对稀疏视角下3D Gaussian Splatting依赖初始几何、易因点云缺失而退化的问题,提出先用NeRF在少量输入上生成邻近合成视角,再作为辅助监督训练GS的思路,并比较先合成后真实的Staged与真实/合成联合且衰减权重的Dual策略。在mip-NeRF 360稀疏视角实验中,两者均优于标准GS,Staged平均效果最好且保持实时渲染,但方法依赖NeRF先验质量并增加训练复杂度。

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation Figure 1
2026-07-01cs.CV

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

Central South University, The Hong Kong University of Science and Technology

2026-07-01视觉感知

该文关注富文本图像生成中训练数据难以同时保证视觉质量、文字可读性、语义对齐和布局一致的问题,指出传统“爬取—过滤—冻结”流程会浪费被拒样本中的失败信号。DataEvolver 将数据构建改为反馈驱动的多智能体闭环,由检索、验证、批评和生成模块把 OCR 错误、语义错配等拒绝原因转化为下一轮策略和定向补全。在相同数据预算下,其构建的数据用于 PixArt-α 微调时,在 TextScenesHQ 和 LongTextBench 上相较最强基线 OCR-F1 分别提升 85.3% 和 35.3%,且迁移到 Show-o2 仍有效。

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes Figure 1
2026-07-01cs.CV

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

Kartik Bali, Roland Aydin

2026-07-01视觉感知

这篇论文针对 CAD/机器人场景中用自然语言精确定位网格面、边等几何实体的问题,指出难点不只是分割,而是目标在不同视角下可见性差异很大。MV-GEL 的核心是用 GELviews 按提示选择最“可解释”的视角,再由 VLM 分割并通过射线投回网格。实验显示相较普通多视角基线,面级 IoU 最高提升 1.7 倍、边级 F1 提升超过 4.5 倍,尤其改善细薄和视角敏感结构。

Distortion-Corrected Diffusion MRI Using Rotated-View EPI and Joint Field-Map/Image Estimation with Gaussian Primitives Figure 1
2026-07-01eess.IV

Distortion-Corrected Diffusion MRI Using Rotated-View EPI and Joint Field-Map/Image Estimation with Gaussian Primitives

Wenqi Huang, Zhitao Li, Nan Wang, Yimeng Lin, Mengze Gao, Yurui Qian, Sevgi Gokce Kafali, Xiaozhi Cao, Kawin Setsompop, Daniel Rueckert, Congyu Liao

This work was supported in part by the European Research Council (884622), the National Institutes of Health (R01MH116173, R01HD114719, K99EB035178) and TUM Graduate School

2026-07-01视觉感知生成模型三维

针对扩散/功能 MRI 中 EPI 因 B0 场不均产生几何畸变、且传统“先重建再校正”会在高加速和高 b 值下放大伪影的问题,论文提出旋转视角 EPI,并用高斯基元在 k 空间联合估计无畸变图像、场图和逐 shot 相位。体内脑扩散实验显示,该方法相对 TOPUP、BUDA 和哈希网格 INR 在脑边界对齐上更接近结构像,低信噪比高加速场景收益最大,同时细节和噪声表现更稳。

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing Figure 1
2026-07-01cs.IR

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

2026-07-01视觉感知

该文针对无监督跨模态哈希在少量图文对下容易依赖大规模配对数据、且只把 CLIP 当特征抽取器的问题,提出 GNAH,将 CLIP 连续语义结构迁移到二值汉明空间:用原型锚点保持全局语义,用随机邻域对齐缓解稀疏配对导致的过拟合。实验称其在数据受限设置下优于现有无监督方法,并接近部分监督方法,但具体增益是否主要来自 CLIP 先验仍需结合消融判断。

PRISM: Latent Composition Consistency for Single-Image Reflection Removal Figure 1
2026-07-01cs.CV

PRISM: Latent Composition Consistency for Single-Image Reflection Removal

Junseong Shin, Tae Hyun Kim

2026-07-01视觉感知

针对单图去反射在 sRGB 像素空间中层间纠缠、加性假设不可靠而泛化受限的问题,PRISM 将分解转到预训练 FLUX VAE 潜空间,利用传输与反射低相干的洞察,把任务建模为潜空间近似线性分离,并用流匹配单次前向恢复两层;LCC 通过跨样本反射潜变量交换约束组合一致性,LCS 用局部对比学习促进层语义分离。文中称其在六个基准上显著优于现有方法,并具备较好的野外图像泛化能力。

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search Figure 1
2026-07-01cs.CV

SimpleSearch-VL: A Simple Recipe for Multimodal Agentic Deep Search

Ming Dai, Zhihong Lu, Jinjie Gu, Jiedong Zhuang, Yefeng Liu, Wankou Yang, Jian Wang, Chunhua Shen

Southeast University

2026-07-01视觉语言

本文针对多模态深度搜索代理在训练 rollout 长尾、证据易错配、工具链复杂上的痛点,提出 SimpleSearch-VL:用因子化自适应 rollout 将采样预算转向仍缺少奖励对比的难例,并通过缩略图感知的反向图搜和网页自总结显式验证证据。仅用 5K SFT 轨迹和 2K RL 数据,8B/30B-A3B 相比 Qwen3-VL agentic 基线平均提升 15.8/16.0 分,30B-A3B 接近 agentic Gemini-3-Pro。

Fully Automated High-Precision Segmentation of Retinal Atrophy and Ellipsoid Zone Thickness in OCT: A Reliable Tool for Real-World GA Monitoring Figure 1
2026-07-01cs.CV

Fully Automated High-Precision Segmentation of Retinal Atrophy and Ellipsoid Zone Thickness in OCT: A Reliable Tool for Real-World GA Monitoring

Wolf-Dieter Vogl, Hlynur Skulason, Oliver Leingang, Ursula Schmidt-Erfurth, Amir Sadeghipour, Ariadne Whitby

Laboratory of Opthalmic Image Analysis (OPTIMA), Medical University of, Manual segmentation of GA lesions and the quantification of EZ integrity are labor-

2026-07-01视觉感知强化学习

针对GA/AMD随访中RPE萎缩与EZ完整性人工标注耗时且泛化到真实临床数据困难的问题,本文用三个专门的CNN语义分割模型联合估计RPE缺失、EZ边界/中断和Bruch膜,并在覆盖多阶段AMD的SD-OCT数据上训练验证。结果显示RPE/EZ缺失Dice为0.88/0.87,面积相关性>0.99,EZ厚度平均偏差2.15µm、重复性ICC>0.98,说明主要价值在稳定自动量化外层光感受器退化与RPE损伤。

HVPNet: A Bio-Inspired Network for General Salient and Camouflaged Object Detection Figure 1
2026-07-01cs.CV

HVPNet: A Bio-Inspired Network for General Salient and Camouflaged Object Detection

Jiawei Xu, Qiangqiang Zhou, Zhouping Li, Yanjiao Shi, Yugen Yi, Jiacong Yu

2026-07-01视觉感知

本文针对显著目标与伪装目标检测中“重骨干、重融合、重解码”带来的冗余与高开销,提出受人类视觉过程启发的 HVPNet。其核心是用视网膜式分层整合模块按特征层级进行轻量融合,并用皮层式解码器区分高、低层视觉处理。实验覆盖四类模态、七项任务和 22 个数据集,显示其在保持竞争性精度的同时显著降低参数量与 FLOPs,增益主要来自轻量骨干、RIM 与解码器的协同设计。

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation Figure 1
2026-07-01cs.CV

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang

Baidu Inc.

2026-07-01视觉感知

DrivingDepth针对自动驾驶深度估计中视觉基础模型几何连续但无尺度、投影LiDAR有尺度却稀疏噪声大的矛盾,不再重生成深度,而是冻结DepthAnything3,把LiDAR作为稀疏几何提示学习逐像素残差尺度校正,并用置信度与法向正则抑制错误锚点。在nuScenes四帧环视输入上,AbsRel为11.19、EdgeCR为5.741,优于MapAnything的11.99/1.914,显示其同时改善尺度精度和几何一致性。

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution Figure 1
2026-07-01cs.AI

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

2026-07-01视觉感知

这篇论文针对自治科研代理在实验失败后常把日志压缩成一次自由反思、导致局部试错或粗暴转向的问题,提出 SAGE 与多假设失败归因机制:先生成并评分多个有证据支撑的失败原因,再按根因路由到假设、实验设计或实现层修复,并用数值 grounding 抑制虚构结果。在 12 个跨域主题上,SAGE 将可产出指标的比例由 42% 提升到 92%,artifact 质量从 5.00 提至 6.75/10,并在盲评中略高于 AI-Scientist-v2。

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs Figure 1
2026-07-01cs.CV

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

Deniz Bickici, Michael Pabst, Shohei Mori, Dieter Schmalstieg

2026-07-01视觉语言视觉感知三维

本文针对开放词汇3D场景图常需“先重建、后语义增强”而探索中不可查询的问题,提出ThinkGraphs:用概率体素骨干增量维持对象身份,并让Critic与Description等VLM代理异步执行语义闭环、属性补全和多目标帧调度。结果在ScanNet、Replica语义分割上达到或超过现有方法,并在Sr3D+、Nr3D、ScanRefer视觉定位上较SOTA提升15.3至18.8 A@0.25。

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience Figure 1
2026-07-01cs.CV

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

Information Research Institute, Chinese Academy of Sciences, Beijing, Sciences, Beijing 100190, China, and with the Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information, Research Institute, Chinese Academy of Sciences, Beijing 100190, China, Academy of Sciences, Beijing 100190, China, and with the Key Laboratory of

2026-07-01学习理论

面向无人机在复杂城市中受遮挡、视角畸变且缺少显式几何建模的问题,论文提出受双视觉通路启发的 SatAgent,将卫星全局语义先验与无人机局部三维几何线索对齐到统一 BEV 空间,并用多视角一致性约束提升尺度和视角鲁棒性;同时构建 SatAgent-SR130K 数据集,实验称相较通用基础模型和专用空间推理模型分别提升 25.91% 和 11.69%,优势主要体现在复杂几何关系推理。

Towards a foundational model for recognising diastematic Gregorian notation Figure 1
2026-07-01cs.CV

Towards a foundational model for recognising diastematic Gregorian notation

Daniel Kurek, Jan Hajič jr

Institute of Formal and Applied Linguistics, Charles University, Prague, Czechia, 24], with some success. However, the available datasets are split across many, pitches, and their alignment to text (usually expressed in terms of syllable and, are available via HuggingFace (upon request).2

2026-07-01视觉感知

格里高利圣咏手稿规模庞大,但现有 OMR 数据集采用不同转写编码,难以合并训练。本文将四个端到端识别数据集统一到基于 S-GABC 的公共编码,并清理近重复样本,支持共享预训练与微调。结果显示,共享模型及其 8 倍梯度累积版本在四个数据集上整体达到或超过既有最优,说明增益可能主要来自 encoding harmonization 与合并数据带来的跨域多样性。

Revising RVL-CDIP: Quantifying Errors and Test-Train Overlap Figure 1
2026-07-01cs.CL

Revising RVL-CDIP: Quantifying Errors and Test-Train Overlap

Stefan Larson, Attila Nagy, Sam Desai, Cyrus Desai, Nicole C. Lima, Yixin Yuan, Siddharth Betala, Kaushal K. Prajapati, Jamiu T. Suleiman, Sharad Duwal, Kevin Leach

Vanderbilt University, University of Michigan

2026-07-01强化学习

论文针对文档分类基准 RVL-CDIP 被长期用于报告高准确率但可能存在标签错误与测试/训练泄漏的问题,进行全量基准审计而非提出新模型。作者人工复核 40 万文档并检测近重复,发现约 12% 标签错误、测试集中约 35% 与训练集重复;清洗标签会提升分类与 OOD 泛化,去除重复则降低原测试准确率,说明既有分数可能被数据质量问题显著扭曲。

Temporal Training Strategies for Left Atrium and Left Atrial Appendage Segmentation in Dynamic Contrast 4DCT Figure 1
2026-07-01cs.CV

Temporal Training Strategies for Left Atrium and Left Atrial Appendage Segmentation in Dynamic Contrast 4DCT

David Montalvo-García, Lauren Severance, Elliot R. McVeigh, María J. Ledesma-Carbayo

Department of Bioengineering, University of California San Diego, La Jolla, CA, USA, Division of Cardiovascular Medicine, University of California San Diego, La Jolla, CA, USA, Department of Radiology, University of California San Diego, La Jolla, CA, USA

2026-07-01视觉感知

面向房颤患者左心房及左心耳血流淤滞评估,论文关注动态增强4DCT中跨时间帧分割受对比剂变化和单帧标注传播噪声影响的问题。其核心洞察是比较不同时间训练集设计及nnUNet前景归一化:全27帧训练在早期低对比阶段最稳,生理选择少量帧在充盈后性能接近全帧,完整数据归一化可改善低对比表现但不能完全替代真实低对比样本。

No Prompt, No Leaks: A Robust Generative Steganography Framework via Prompt-Free Diffusion Figure 1
2026-07-01cs.CV

No Prompt, No Leaks: A Robust Generative Steganography Framework via Prompt-Free Diffusion

Jingwen Cai, Fen Xiao, Shuhua Deng, Xieping Gao

Jingwen Cai, Fen Xiao and Shuhua Deng are with the MOE Key Laboratory of Intelligent Computing and Information Processing, Xiangtan University, Xiangtan 411105

2026-07-01生成模型安全鲁棒

针对扩散生成隐写依赖文本提示带来的提示泄露、语义不稳定和传输扰动下恢复失败问题,论文提出无提示扩散框架:用CACM建立秘密图像到潜变量的确定性双射,并引入ViT提取的风格语义先验及预测-校正反演稳定轨迹。实验显示其在隐写图像真实感、抗隐写分析、秘密图像重建以及高斯噪声/JPEG退化下的恢复质量上优于多种传统与生成式基线。

Temporal Preservation over Processing: Diagnosing and Designing Spatiotemporal Single-Stage Video Detectors Figure 1
2026-07-01cs.CV

Temporal Preservation over Processing: Diagnosing and Designing Spatiotemporal Single-Stage Video Detectors

Karam Tomotaki-Dawoud, Anna Hilsmann, Peter Eisert, Sebastian Bosse

2026-07-01视觉感知

这篇论文针对单阶段视频检测器“看似利用多帧、实则依赖关键单帧”的评估盲区,提出TemporalLens扰动诊断框架,并设计基于YOLOv8的YOLO-3D。核心洞察是保留骨干网络中的时间深度比复杂时序模块更关键;在UCF101-24上32帧设置平均提升3.7个百分点mAP@50,且3D模型在遮挡目标帧时能从早期帧恢复预测,而堆叠2D模型明显崩溃。

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity? Figure 1
2026-07-01cs.CV

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

Ta Duc Huy, Trang Nguyen, Townim Chowdhury, Ankit Yadav, Minh-Son To, Zhibin Liao, Johan W. Verjans, Vu Minh Hieu Phan

2026-07-01视觉感知

这篇论文关注 VLM 在视觉证据含糊时仍给出高置信错误答案的问题,指出传统语义熵依赖采样输出多样性,容易被过度自信的视觉表征压低不确定性,而文本扰动又会混入提示敏感性。作者提出 Visual Semantic Entropy,仅扰动图像、固定问题,并将回答聚成语义原型后计算加权离散度。实验覆盖 5 个 VLM 和 5 个 VQA 基准,显示 VSE 更能捕捉视觉歧义,在不确定性估计上优于文本或图文联合扰动方法。

Resolving superposition in AI for interpretability and cross-modal alignment in patient-neuronal images Figure 1
2026-07-01cs.LG

Resolving superposition in AI for interpretability and cross-modal alignment in patient-neuronal images

Jisung Park, Seohyeon Kang, Daeun Yoo, Eunsu Lee, Seoin Cho, Wooyeop Choi, Ian Choi, James R. Evan, Daesoo Kim, Sonia Gandhi, Minee L. Choi

KAIST, 2 Konyang University, 3 Chang Gung University, UCL Queen Square Institute of Neurology & The Francis Crick Institute

2026-07-01视觉感知

本文针对生物图像模型中概念超位置既削弱可解释性、又扭曲潜空间几何的问题,提出用稀疏自编码器将 CNN 表征解缠为更单义的细胞状态向量,并将单细胞 RNA 分析工具迁移到图像域。作者在帕金森患者来源神经元高内涵图像上显示,SAE 可提升拓扑保真度,并通过 GW-map 与真实 scRNA-seq 无监督对齐,重建钙信号-AIS scaffold 等病理层级通路。

One Video, One World: Turning Monocular Video into Physical 4D Scenes Figure 1
2026-07-01cs.CV

One Video, One World: Turning Monocular Video into Physical 4D Scenes

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

2026-07-01视觉感知强化学习

本文针对现有4D重建“能渲染但难仿真”的问题,提出训练-free的OVOW,从单目视频中分解实例、重建水密网格、恢复尺度与6DoF轨迹,并用直接顶点形变统一表示刚体和非刚体运动,避免类别先验和骨架绑定。实验在静态与4D合成基准上显示其布局、几何、光度和语义误差优于基线,视频处理速度快一到两个数量级,物理仿真也验证了稳定性。

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs Figure 1
2026-07-01cs.CV

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

2026-07-01视觉语言

这篇论文针对多模态大模型视觉投影器在固定 token 预算下常用单一全局重采样、易稀释小目标和局部细节的问题,提出 MS-Resampler:用带空间范围先验的多个 Scoped Resampler 分支分别聚合局部到全局信息,再自适应融合为视觉 token。文中在十个公开多模态基准上报告相较单范围重采样器有稳定提升,且额外计算开销很小。

MAPE: Defending Against Transferable Adversarial Attacks Using Multi-Source Adversarial Perturbations Elimination Figure 1
2026-07-01cs.CV

MAPE: Defending Against Transferable Adversarial Attacks Using Multi-Source Adversarial Perturbations Elimination

Xinlei Liu, Jichao Xie, Tao Hu, Peng Yi, Yuxiang Hu, Shumin Huo, Zhen Zhang

2026-07-01视觉感知

这篇论文针对无需查询目标模型、隐蔽性更强的可迁移对抗攻击,提出在分类器前外挂去扰动模型 MAPE。其核心是用带通道注意力的 U-Net 学习从对抗样本中恢复干净输入,并通过 PPSA 按模型差异与负动量调度多源预训练模型,增加训练扰动多样性。实验中在 ResNet-34 黑盒目标上,CIFAR-10 平均防御率超过 95.1%,Mini-ImageNet 超过 71.5%,但对自适应攻击的效果仍需进一步验证。

Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization Figure 1
2026-07-01cs.CV

Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization

Yannan Chen, Wenqiang Wang, Ruoyu Chen, Jiancheng Wang, Mingbo Yang, Yaowei Wang, Wei Wang, Xiaochun Cao

2026-07-01视觉感知优化算法

这篇论文针对无监督域自适应目标检测中伪标签同时存在分类错误、定位错误及二者叠加,导致自训练性能受限且CST直接用于检测不稳定的问题,提出DSBCO:在Mean Teacher框架上把循环自训练扩展到分类与回归双流,并用回归归一化抑制坐标尺度带来的损失爆炸。实验覆盖四类跨域检测场景,在FCOS系方法上优于既有方法,相比HT在恶劣天气等场景取得最高14.3%的提升。

Evidence Triangulation for Multimodal Fact-Checking in the Wild Figure 1
2026-07-01cs.MM

Evidence Triangulation for Multimodal Fact-Checking in the Wild

Stefanos-Iordanis Papadopoulos, Zacharias Chrysidis, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

Information Technologies Institute, Centre for Research & Technology, Hellas, Greece, Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki, Greece

2026-07-01视觉语言

针对多模态事实核查过度依赖合成/策展数据、难以处理真实社媒图文与外部证据细粒度关系的问题,论文构建了基于 X 社区注释与 VLM 检索新闻证据的 X-POSE,并提出 TRENT,用三路交叉注意力分别建模文本-证据、图像-证据和图文对齐,再以关系融合捕捉蕴含/矛盾。实验显示 TRENT 优于专用模型和商业 VLM,消融表明证据质量与三角化融合均有贡献。

Language-Assisted Super-Resolution from Real-World Low-Resolution Patches Figure 1
2026-07-01cs.CV

Language-Assisted Super-Resolution from Real-World Low-Resolution Patches

Joonkyu Park, Kyoung Mu Lee

Dept. of ECE&ASRI, 2 IPAI, Seoul National University

2026-07-01强化学习

真实低分辨率图像难以获得成对 HR 监督,合成退化又泛化不足;本文的关键洞察是同一高质量图像中远近景可自然形成非配对 LR/HR patch,并用深度估计提取。LA-SR 将非配对超分转为视觉-语言空间对齐,通过内容与质量文本损失约束语义保真和高质感生成,在多类自然图像基准上报告了更好的感知指标与视觉效果。

RCL-Mamba: A Dual-domain State Space Model for Measurement-oriented Image Restoration in Rotational Sparse-View Scanning Computed Laminography Figure 1
2026-07-01cs.CV

RCL-Mamba: A Dual-domain State Space Model for Measurement-oriented Image Restoration in Rotational Sparse-View Scanning Computed Laminography

Xuyang Duan, Genyuan Zhang, Zhenjiang Dong, Chuandong Tan, Zihao Wang, Junyao Wang, Fenglin Liu

a Key Laboratory of Optoelectronic Technology and Systems, Ministry of Education, Chongqing University, Chongqing, 400044, b Engineering Research Center of Industrial CT Nondestructive Testing, Ministry of Education, Chongqing University, Chongqing

2026-07-01视觉感知

面向PCB等大平板构件的高速RCL无损检测,连续稀疏视角会同时带来投影域旋转模糊和重建域稀疏伪影,影响结构测量。RCL-Mamba按成像物理顺序做投影—图像双域级联恢复,并用Mamba-CNN双分支兼顾长程非均匀模糊建模与局部边缘细节。仿真和真实PCB实验显示其在去模糊、伪影抑制和线轮廓结构保持上优于基线,并将扫描视角从512降至64,约提升8倍效率。

Patient-Level Elbow Abnormality Detection: Leakage-Aware Evaluation of Learned Preprocessing, Calibration, and Triage-Oriented Operating Points Figure 1
2026-07-01cs.CV

Patient-Level Elbow Abnormality Detection: Leakage-Aware Evaluation of Learned Preprocessing, Calibration, and Triage-Oriented Operating Points

Ahmed Sallam, Ahmet Kaplan

2026-07-01视觉感知数据集/基准

针对骨科急诊分诊中肘部X光异常检测容易因患者级数据泄漏和概率不可靠而高估性能的问题,本文在MURA肘部子集上固定DenseNet121,系统比较原图、CLAHE、多通道表示及DnCNN学习式预处理,并同时评估AUROC、PR-AUC、校准和高特异性工作点。结果显示,各预处理的判别增益有限且依配置变化,原图基线始终有竞争力;DnCNN可在原图和多通道输入下降低ECE/Brier,但CLAHE+D nCNN未带来稳定校准收益,增益来源不清。

Bridging Video Understanding and Generation in a Unified Framework Figure 1
2026-07-01cs.CV

Bridging Video Understanding and Generation in a Unified Framework

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

2026-07-01视觉感知

该文针对视频理解依赖紧凑语义表示、视频生成需要高密度时空细节这一割裂问题,提出 Vega 统一框架:用共享离散视觉/文本词表连接两类任务,让自回归模块预测关键帧语义 token,再由扩散解码器渲染高保真视频,并以双流 token 选择压缩理解输入。实验显示其在 VBench 生成和 VideoMME 理解上均有较强表现,但当前规模受算力限制。

Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation Figure 1
2026-07-01cs.CV

Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation

Hyunsoo Lee, Inwoo Hwang, Young Min Kim

2026-07-01生成模型

本文针对扩散模型在补全、外扩、3D纹理等部分观测生成任务中需反复训练或仅靠启发式同步导致全局不一致的问题,提出训练无关的 ALM,在反向扩散中对未观测区域进行显式基于 score 的似然最大化,并用一步加速近似降低迭代开销。实验覆盖图像、人体运动、网格纹理和视频,显示其相对同步方法及部分训练式基线取得更一致、更高质量的结果。

Wavelet-Optimized Pseudo-3D Accelerated Diffusion Model for Truncated Computed Laminography Figure 1
2026-07-01cs.CV

Wavelet-Optimized Pseudo-3D Accelerated Diffusion Model for Truncated Computed Laminography

Genyuan Zhang, Junyao Wang, Chuandong Tan, Fenglin Liu, Yongning Zhou

2026-07-01生成模型三维

针对计算层析成像中探测器视场不足导致投影截断、重建伪影和有效成像范围受限的问题,论文提出CL-DM:先分析完整/不完整/无数据区域,将目标扩展到可恢复的不完整区域,再用2D扩散切片聚合结合3D MBIR保证数据一致性,并引入z向小波正则、平移不变机制和3D快速采样。仿真与真实实验显示其能更好抑制截断伪影、恢复连续三维结构并提升推理效率。

Deep Spectral Models for Robust Dental Shape Generation Figure 1
2026-07-01cs.CV

Deep Spectral Models for Robust Dental Shape Generation

Tibor Kubík, François Guibault, Michal Španěl, Hervé Lombaert

2026-07-01安全鲁棒

面向数字牙科中小样本、高分辨率且网格连接不一致的牙冠建模难题,论文提出 ToothForge:用同步的 Laplace-Beltrami 谱系数学习低维生成流形,以绕开空间坐标模型的维度压力和特征基不稳定。实验和消融显示,谱同步是高保真重建的关键,纯谱域正则已足够;在多牙类、不同截断模态下,其重建与生成质量达到或超过 PCA、点式 VAE/扩散基线,同时保持紧凑性与几何可解释性。

Editing Everything Everywhere All at Once Figure 1
2026-07-01cs.CV

Editing Everything Everywhere All at Once

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

2026-07-01视觉感知

针对多对象图像编辑中多条指令相互干扰、属性泄漏且顺序编辑效率低的问题,MICE在无需训练的情况下改写MMDiT联合注意力的加性偏置,利用分割掩码区分实例内、邻域和跨实例 token 交互,以兼顾属性绑定与整体协调。在LoMOE-Bench及更复杂的MICE-Bench上,它较多分支、潜变量优化和注意力正则基线更能保持背景并遵循局部编辑指令。

CLIMB: Centroid-Based Hierarchical Memory for Online Continual Self-Supervised Learning Figure 1
2026-07-01cs.CV

CLIMB: Centroid-Based Hierarchical Memory for Online Continual Self-Supervised Learning

Julien Lefebvre, Stefan Duffner, Mathieu Lefort

2026-07-01视觉感知

CLIMB面向在线连续自监督学习中无标签数据流、未知任务边界和有限记忆下的灾难性遗忘问题。其核心是用严格容量受限的层次化质心记忆组织历史样本,并结合重放样本上的知识蒸馏,以同时保持潜在空间覆盖和抑制表示漂移。在Split CIFAR-100、Split ImageNet-100及不规则任务分布协议上,文中报告其优于现有OCSSL方法,且消融显示质心记忆与蒸馏组合带来主要增益。

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents Figure 1
2026-07-01cs.CV

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

Stanford University, Stanford, CA 94305, USA, Tsinghua University, Beijing, 100084, China

2026-07-01视觉感知

这篇论文针对计算机使用智能体训练中只利用成功轨迹、丢弃失败轨迹的低效问题,提出在推理时让 LLM 分析失败模式并生成经人工轻量验证的代码补丁,将失败转化为行为改进。其洞察是失败可揭示 grounding、能力、知识和重复循环等缺陷,并对应引入视觉搜索、终端执行、知识支持和重复警告。在 OSWorld 上,OpenCUA-72B 成功率由 42.3% 提升到 48.9%,无需额外训练但有一定推理开销。

WarpHammer: Densifying Scene Warps with 3D Object Priors for Extreme View Synthesis Figure 1
2026-07-01cs.CV

WarpHammer: Densifying Scene Warps with 3D Object Priors for Extreme View Synthesis

Michael Green, Gavriel Habib, Dvir Samuel, Tal Berkovitz Shalev, Issar Tzachor, Rami Ben-Ari, Or Litany

2026-07-01三维

WarpHammer针对投影条件新视角合成在大角度绕物体运动时点云 warp 变稀疏、前景缺面并泄漏背景,导致相机线索和外观约束同时失效的问题。其核心是用对象级3D生成先验补全显式物体几何,并将几何与外观解耦,还可融合无位姿的外部物体参考图作为结构证据。实验在五个基准上显示,相比GEN3C等强基线,单视图PSNR最高提升4.2dB、旋转误差降低约50%,辅助视图设置也接近使用真值位姿的多视图基线。

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning Figure 1
2026-07-01cs.CV

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

University of New South Wales, National University of Singapore

2026-07-01视觉语言视觉感知

本文针对VLM空间推理中“线性可解码是否等于视觉落地”的常见推断提出质疑,核心创新是用灰图替换的一步视觉消融仲裁器检验行为是否依赖图像。结果显示,14个VLM中水平轴通常真实落地,垂直轴多是语言/方向先验,深度轴则常出现“看见但符号用反”的倒置,说明探针和steering会高估潜在知识的视觉 grounding。

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition Figure 1
2026-07-01cs.CV

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

2026-07-01视觉感知

本文面向长视频中隐性情绪线索弱、稀疏且少样本标注不足的问题,提出偏移感知的多模态时序框架,将骨架、表情、视觉基础模型、X-CLIP与Gemini语义先验结合,并用Base-Offset交叉注意力和MIL池化捕捉瞬时微动作。方法在EI-MIGA-IJCAI挑战Track 3取得0.76923测试准确率第一,同时指出DINO类通用视觉特征在微动态任务中可能发生表征坍缩,部分提升存在伪泛化与记忆风险。

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space Figure 1
2026-07-01cs.CV

HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space

Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy

2026-07-01视觉感知

这篇论文针对手术视频语言预训练把阶段、步骤、动作等层级知识压成平面嵌入的问题,提出在 Lorentz 双曲空间中对齐视频与文本,并用几何感知对比损失降低结构性假负例、用锥形蕴含约束父子节点一致性。实验在 Cholec80、AutoLaparo 和 MultiBypass140 上显示,零样本与少样本阶段识别均有稳定提升,尤其面向跨流程、跨中心泛化。

UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables Figure 1
2026-07-01cs.CV

UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables

Yibing Zhang, Xunpeng Yi, Qinglong Yan, Yeda Wang, Han Xu, Jiayi Ma

2026-07-01视觉感知

面向超高清多焦点图像融合,论文指出现有方法受限于低分辨率数据、模型未适配UHD尺度和部署成本高。作者构建1950对4K近/远焦图像的UHD-MFF数据集,并提出UMF-LUT,用低分辨率C-LUT做区域级焦点决策、高分辨率D-LUT以拉普拉斯线索补边缘细节,避免全分辨率卷积开销。实验显示其在视觉质量和指标上优于SOTA,并可实时处理4K、具备手机部署潜力。

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving Figure 1
2026-07-01cs.CV

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

2026-07-01视觉感知

ForgeDrive针对自动驾驶世界模型中“先想象再行动”易把视觉生成误差传给规划的问题,提出自回归扩散框架,将未来分解为逐步的图像—动作对,并用双向跨条件训练让动作与视觉互相约束。其关键洞察是推理时先生成动作再生成未来画面,可用较稳定的动作纠正视觉想象。NAVSIM实验显示,该模型在无后训练策略下同时支持仿真、规划和视觉里程计,并优于多种强规划器。

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization Figure 1
2026-07-01cs.CV

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

2026-07-01数据集/基准

针对现有协同自动驾驶数据集忽视真实 C-V2X 带宽动态、异构传感器和多智能体扩展的问题,CooperScene 构建了含三车一路侧单元的多模态基准,并同步记录吞吐、时延、丢包等通信特征。数据覆盖路口、匝道和停车场,提供 59K 帧、344K 个全局一致 3D 标注;基准显示不少协同感知方法的通信需求远超现有 C-V2X 能力,部署瓶颈不只在感知精度。

AA: A Multi-view Multimodal Dataset for Screen-based Gaze Estimation Figure 1
2026-07-01cs.CV

AA: A Multi-view Multimodal Dataset for Screen-based Gaze Estimation

Chang Liu, Jiaqi Liu, Zhoutong Ye, Xinjie Shen, Chun Yu, Yuanchun Shi

Tsinghua University 2 Georgia Institute of Technology † Corresponding Author

2026-07-01视觉语言数据集/基准

针对现有屏幕注视数据多依赖单一正面摄像头、难以覆盖视角变化和遮挡的问题,AA构建了一个多视角多模态数据集:用8个屏幕边框相机和2个侧视相机同步采集人脸,并通过透视变换将侧视画面与屏幕坐标标注对齐,同时提供全图、人脸和双眼裁剪及按受试者划分的评测协议。数据包含24名参与者、288个屏幕目标和屏外负样本,约324万原始图像、1296万处理裁剪;论文主要贡献是数据与流程标准化,未报告模型精度增益,实际性能收益文中未充分说明。

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation Figure 1
2026-07-01cs.CV

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

2026-07-01三维

AC3S针对扩散生成合成数据中“3D姿态可控但画面失真”的矛盾,认为CAD边缘等视觉提示直接注入ControlNet会过度约束生成先验。其核心是自监督视觉提示调制器,按样本动态衰减ControlNet强度,并用多智能体VLM生成与几何一致的3D感知文本提示。实验显示相比基线FID提升15.95,使用其百万级合成数据微调可带来最高约7%准确率增益,但部分收益可能主要来自scaling / data。

ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling Figure 1
2026-07-01cs.CV

ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling

Konstantinos Georgiou, Maofeng Tang, Hairong Qi

2026-07-01视觉感知

本文针对多目标掩码图像建模中全局损失权重无法适配不同图像区域的问题,提出用 Soft-MoE 的 patch 级 dispatch 权重直接路由各类损失,并让损失梯度反向影响路由器以形成内容相关专门化。实验显示该机制在 ImageNet-1K 上提升 k-NN、线性探测与微调表现,线性探测达 80.6%、微调达 85.3%,下游配合冻结路由、专家 dropout 等策略后可弥合 ADE20K 分割差距。

Distilling Temporal Coherence into 2D Networks for Transrectal Ultrasound Prostate Video Segmentation Figure 1
2026-07-01cs.CV

Distilling Temporal Coherence into 2D Networks for Transrectal Ultrasound Prostate Video Segmentation

Dong Yeong Kim, JunGyu Lee, Jaewon Choi, June Young Seo, Myeongseop Kim, Jinwook Choi, Taek Min Kim, Young-Gon Kim

2026-07-01视觉感知

针对经直肠超声前列腺视频分割中2D模型逐帧抖动、3D模型延迟过高的问题,论文将时间一致性只在训练期蒸馏进2D网络。核心洞察是前列腺几何较稳定而周围声学背景易波动,因此用光流残差加权的时间一致性损失抑制不可靠区域,并结合双尺度原型对齐与伪标签/师生蒸馏减少逐帧标注需求。在新建TRUS-V和SUN-SEG上,方法报告了实时速度下更高分割精度和时间稳定性。

Learning to Deny: Action Denial in Multimodal Large Language Models Figure 1
2026-07-01cs.CV

Learning to Deny: Action Denial in Multimodal Large Language Models

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

2026-07-01视觉语言

这篇论文关注多模态大模型在视频动作识别中“会确认、不会否认”的问题:当人物、物体和场景强烈暗示某动作但关键运动缺失时,模型仍倾向于给出肯定判断。作者构建UCF101-AD,将正例与上下文相近的动作否认负例配对,并评测20个MLLM,发现许多模型在原UCF101超过85%,在否认集跌至50%以下。CausalAct用自然语言因果图提示/微调检查动作前提,能降低误报,说明动作否认可被学习。

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents Figure 1
2026-07-01cs.AI

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

2026-07-01数据集/基准

医疗智能体评测仍多停留在静态问答或单一任务,难以反映真实临床流程中的多步工具使用与多模态数据处理。HealthAgentBench 将54个任务封装为7类可执行医疗环境,覆盖影像、病理、临床试验匹配和EHR等,并用专家标签或人类表现做二元成功判定。实验显示前沿智能体整体成功率仍低,最强的 Codex GPT-5.5 约42%,医学影像、大搜索空间和组合推理仍是主要瓶颈。

GaussianMap: Learning Gaussian Representation for Multi-Sensor Online HD Map Construction Figure 1
2026-07-01cs.CV

GaussianMap: Learning Gaussian Representation for Multi-Sensor Online HD Map Construction

Hongyu Lyu, Julie Stephany Berrio Perez, Mao Shan, Stewart Worrall

2026-07-01三维

针对在线 HD 地图构建中固定网格 BEV 对稀疏地图元素分配冗余、难以保留精细几何的问题,GaussianMap 将场景表示为 BEV 平面上的自适应高斯基元,并用前馈编码器通过高斯自注意力、相机注意力和可选 LiDAR 注意力逐步细化后再 splat 成 BEV 特征。nuScenes 与 Argoverse 2 实验显示其在纯相机和相机-LiDAR 融合设置下达到当时 SOTA。

HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection Figure 1
2026-07-01cs.CV

HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection

Jiyong Boo, Byeongin Joung, Hyemin Yang, Kuk-Jin Yoon

2026-07-01视觉感知三维

该文针对单目3D车道检测中平地BEV假设会在起伏道路上产生几何错位、稀疏坡度锚点难以精确估计高度的问题,提出在密集3D体中用高度对齐SDF隐式建模路面,并通过可微渲染生成高度图和表面对齐特征;同时用车道存在热图构造语义位置编码引导查询。OpenLane实验显示其在3D车道检测和高度估计上达到SOTA。

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding Figure 1
2026-07-01cs.CV

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

2026-07-01视觉感知

针对甲骨文智能处理长期停留在单字识别、难以评估整句卜辞结构理解的问题,论文提出 S-OBI 基准:用专家校订的 95 条拓片和干净字形替换合成标准化句级图像,并设计语义匹配、语义槽抽取与上下文推理任务。10 个主流 MLLM 测试显示最佳总体仅 33.5%,模型常依赖粗粒度格式规律,难以恢复标点、语义角色和遮挡字,说明句级古文字理解仍受单字视觉识别瓶颈制约。

Seeing Through the Weights: Privacy Leakage in Scene Coordinate Regression Figure 1
2026-07-01cs.CV

Seeing Through the Weights: Privacy Leakage in Scene Coordinate Regression

Oleksii Nasypanyi, Jaemin Cho, Utku Ozbulak, Byungkon Kang, Francois Rameau

2026-07-01视觉感知

这篇论文针对视觉定位中“场景坐标回归模型只存权重因而天然隐私”的假设,指出机器人、AR或室内导航部署在私密空间时仍可能泄露环境信息。作者提出仅用无关代理图像反复查询SCR模型的攻击,通过预测稳定性筛选可靠3D点,并在灰盒/白盒下进一步优化特征、反演外观。实验显示室内外训练场景可被重建出高保真几何和可辨识布局,说明SCR权重本身携带可提取的隐私风险。

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving Figure 1
2026-07-01cs.CV

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

Anh Dung Dinh, Simon Khan, Flora Salim

School of Computer Science and Engineering, Air Force Research Laboratory

2026-07-01视觉语言视觉感知

针对自动驾驶VLA规划器中链式因果推理自回归生成成为主要延迟瓶颈的问题,论文将推理拆成依赖轨迹历史的快速常规推理器与保留视觉注意力的目标模型,并用投机解码协同验证;关键创新是FlatRoPE引导草稿模型关注轨迹历史,以及AARL用动作质量奖励和静态KL锚后训练。实验在Alpamayo-R1上提升接受长度,报告约3.5–4.3倍理论加速,常规路径可覆盖约80%的CoC token。

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning Figure 1
2026-07-01cs.CV

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

Hongyi Lin, Yang Liu, Jinhua Zhao, Xiaobo Qu

School of Vehicle and Mobility, Tsinghua University, Beijing, China, Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA, USA

2026-07-01视觉感知

本文针对具身智能中基础模型直接回归检测框、轨迹或分割掩码时几何精度不足的问题,提出让专用模型先生成有效候选、再由视觉语言模型做选择/验证等代理推理的FAT/ProxySelect框架。实验覆盖2D/3D检测、轨迹预测和语义分割,显示其能稳定提升专用基线,并以更低计算成本优于直接用基础模型回归。

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding Figure 1
2026-07-01cs.CV

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

Knovel Engineering Lab, University of Toronto, Vector Institute, ELLIS Institute, Max Planck Institute

2026-07-01视觉语言三维

PruneGround 针对现有 3D 视觉定位模型在整场景中推理导致候选冗余、歧义和计算开销高的问题,提出“先剪枝再定位”的即插即用框架:用冻结 VLM 从多视角图像中筛出语言相关空间区域,并重写复杂描述为更明确的目标—锚点关系,再微调空间 LLM 在裁剪点云内生成目标定位。实验显示其在 ScanRefer 全部设置及 Nr3D/Sr3D 10 项中的 9 项达到 SOTA,但具体增益在剪枝、描述改写与 LLM 适配之间的贡献仍需看消融细节确认。

WaterGen: Decoupling Scene and Medium in Underwater Image Generation Figure 1
2026-07-01cs.CV

WaterGen: Decoupling Scene and Medium in Underwater Image Generation

Jiayi Wu, Tianfu Wang, Tianyi Xiong, Dehao Yuan, Xiaomin Lin, Md Jahidul Islam, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos

2026-07-01视觉感知

水下视觉缺少大规模、多样且带可靠标注的数据,限制恢复、分割等任务。WaterGen的核心是把“场景内容生成”和“水体介质退化”在潜扩散框架中解耦:先学习无退化的水下场景潜表示,再用受物理参数控制的多尺度解码加入衰减和散射,从而在不改变结构的情况下调节水况。论文显示其合成数据能提升水下图像恢复和语义分割表现,但具体增益仍可能部分来自 scaling / data。

FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics Figure 1
2026-07-01cs.CV

FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics

Junghwan Park

2026-07-01视觉感知

针对遥感少样本分割中标注稀缺、跨域训练易失效且原型方法会抹平多模态类别结构的问题,FROST不再学习分割器,而是在冻结DINOv3特征上把前景/背景建模为球面点云分布,用非参数密度比和由支持集确定的阈值、带宽完成判别。实验覆盖17个遥感基准,单样本已领先约5.6 mIoU,支持样本增加时优势扩大;局限是依赖代表性支持样本和骨干特征质量。

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration Figure 1
2026-07-01cs.CV

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

Gabriel Clinger

The George Washington University

2026-07-01视觉感知

本文针对RGB-D场景分类中早期融合过早纠缠、晚期融合缺少特征提取阶段交互的问题,提出三流MSNN架构LINet,用LIConv2d在每层激活前连续整合RGB与深度信号,并指出桥接权重的Kaiming初始化会破坏梯度,需用1/N常数初始化和渐进模态dropout稳定训练。SUN RGB-D上从零训练达到45.2%平均类别准确率,ScanNet预训练后升至49.6%。

SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos Figure 1
2026-07-01cs.CV

SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos

Björn Braun, Christian Holz

2026-07-01视觉感知三维

面向 AR 教练等场景,论文关注连续 ego-exo 视频中不仅要定位技能动作,还要判断执行好坏的问题。作者发现现有时序动作检测模型评分近随机,提出 SkillSpotter,以自适应时间抑制、门控 3D 姿态融合和双向跨视角注意力联合建模。其在 Ego-Exo4D 上将类特定 mAP 从 12.40 提至 21.82,平衡准确率从 55.99% 提至 60.40%,并在 HoloAssist 上表现出一定泛化。

WildProp: Visual Estimation of Wildlife Body Proportions at Scale Figure 1
2026-07-01cs.CV

WildProp: Visual Estimation of Wildlife Body Proportions at Scale

Mustafa Chasmai, Aaron Sun, Subhransu Maji

2026-07-01视觉感知

针对传统野生动物形态测量依赖标本处理或受控拍摄、难以扩展的问题,WildProp将体比例估计转化为检索驱动的对应匹配:只需一张用户标注的标准姿态图,先用基础模型做姿态感知检索,再进行密集局部匹配、几何过滤和稳健聚合。其核心洞察是海量自然图像中存在足够多近标准姿态样本,可绕开任意视角重建难题;在鸟类和两栖数据集上,中位相对误差约为10–20%。

JacobianAvatar: Temporally Consistent Semi-rigid Avatar Reconstruction from a Monocular Video Figure 1
2026-07-01cs.CV

JacobianAvatar: Temporally Consistent Semi-rigid Avatar Reconstruction from a Monocular Video

Changyeon Won, Min-Gyu Park, Seonghwan Park, Ju Hong Yoon, Hae-Gon Jeon

2026-07-01视觉感知三维

该文面向单目视频重建可驱动真人化身时的自遮挡、不可见表面与衣物动态不稳定问题,提出以层级神经 Jacobian 场建模半刚性形变,并结合带约束的 Poisson 求解、SDF Jacobian 正则和形变引导残差光流损失来抑制边界伪影、补全腋下/大腿等遮挡区域并约束时序一致性。实验显示其在基准与野外视频上较现有方法获得更稳定的几何和渲染效果,但宽松服装与面部表情仍未充分解决。

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving Figure 1
2026-07-01cs.CV

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

2026-07-01学习理论

面向自动驾驶中长时域、多视角场景生成易漂移且依赖 HD/BEV 先验的问题,InfiniVerse 从单帧多视角输入重建显式 3D occupancy,并沿任意轨迹自回归扩展,再用视频扩散生成外观;其关键在于将生成视频反投影回 3D,形成 sketch-and-refine 闭环以约束几何与视觉一致性。在 Waymo 和 nuScenes 上报告 FID 6.4、FVD 67.97,长时稳定性和生成质量优于既有方法。

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis Figure 1
2026-07-01cs.CV

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

2026-07-01视觉感知

这篇论文针对 WSI 病理诊断中常见的“扁平分类”问题:模型忽略诊断标签本身的粗到细层级关系,生成式 VLM 还可能出现父子类别不一致或分类幻觉。TaxoMIL 将 MIL 诊断改写为受临床 taxonomy 约束的多粒度文本生成,用双头 Transformer 分别生成粗、细诊断,并通过层级目标约束标签嵌入和切片表征。三套 WSI 数据集上优于 MIL 分类器和生成式方法,但具体增益中 taxonomy 约束与生成框架各自贡献仍需看消融细节。

Seeing Through Multiple Views: Parameter-Efficient Fine-Tuning via Selective Neurons for Consistent Radiology Report Generation Figure 1
2026-07-01cs.CV

Seeing Through Multiple Views: Parameter-Efficient Fine-Tuning via Selective Neurons for Consistent Radiology Report Generation

Yucheng Chen, Jinjing Zhu, Yang Yu, Yufei Shi, Hane Naghshbandi, Jinhua Liu, Angela S. Koh, Fang Fen, Kian Eng Ong, Si Yong Yeo

2026-07-01视觉感知

本文针对多视角胸片报告生成中,简单特征融合易产生前位与侧位诊断不一致的问题,提出 View-PNDF:先在 Transformer 解码器中检测并验证视角相关“模式神经元”,再只微调这些神经元以保留通用表征,并用 LLM 汇总分视角报告。实验称其在两个医学 RRG 基准上提升视角特异报告质量,同时维持通用视角性能并降低微调成本。

PiLoT v2: Pixel-to-Orthogonal Map Alignment for Free-view UAV Geo-localization Figure 1
2026-07-01cs.CV

PiLoT v2: Pixel-to-Orthogonal Map Alignment for Free-view UAV Geo-localization

Xinyi Liu, Xiaoya Cheng, Rouwan Wu, Zhaochen Wang, Shen Yan, Maojun Zhang, Yu Liu

National University of Defense Technology

2026-07-01视觉感知

本文面向 GNSS 受限下无人机实时无漂移定位,针对 PiLoT 依赖大规模 3D 网格与在线渲染、难以端侧部署的问题,提出用 TDOM/DSM 正射地图裁剪替代 3D 渲染,并通过跨视角特征注册网络、几何标注数据及重力/单点测距先验嵌入 LM 位姿优化来缩小斜视图与正射图差异。实验显示其在合成、真实和长期序列上达到实时定位,精度可比或超过 3D 网格方法,同时显著降低存储与计算成本。

Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving Figure 1
2026-07-01cs.CV

Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving

Geonho Bang, Geunju Baek, Dongyoung Lee, Wonjun Jeong, Jun Won Choi

2026-07-01三维

Horizon3D面向高速自动驾驶中150米以上目标稀疏、运动快导致雷达相机融合困难的问题,提出以关键点初始化高斯基元并结合稀疏BEV特征的混合表示,再用双路径时序融合同时累积场景信息和建模单体运动。在TruckScenes验证集上,相比此前最佳雷达相机方法提升3.0 NDS和1.6 mAP,并保持较有竞争力的推理速度。

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation Figure 1
2026-07-01cs.CV

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

2026-07-01视觉感知生成模型

面向临床可及的 NIRII 到高分辨 2PF 血管图像转换,论文指出现有方法只约束最终图像,容易产生断裂或伪分支。其核心是把血管拓扑视为生成轨迹中的不变量,在 Brownian-bridge 扩散中用结构梯度正交约束和时间加权损失限制流场,并用原型引导结构细化缓解训练与推理结构差异。在 NIRII–2PF 与眼底数据上,相比现有方法提升结构保真和视觉质量,PSNR 最高达 24.96 dB 与 24.83 dB。

Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer Figure 1
2026-07-01cs.CV

Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer

Bo Wei, Xianhui Lin, Yi Dong, Zhongzhong Li, Zonghui Li, Zirui Wang, Jiachen Yang, Xing Liu, Hong Gu, Xiaoming Li, Wangmeng Zuo

Harbin Institute of Technology, Nanjing University, vivo BlueImage Lab, vivo Mobile Communication Co., Ltd, though the ideal transfer target is unavailable, the real reference itself provides

2026-07-01视觉感知

这篇论文针对妆容迁移缺少真实成对监督、现有方法受伪目标伪影和身份漂移限制的问题,提出 ART 两阶段 DiT:先用伪目标学习语义对齐,再通过“现实锚定”循环从卸妆后的参考图重建真实参考妆容,让梯度反向约束迁移结果携带细粒度妆容细节,并用受控噪声瓶颈稳定训练。作者还构建 2K 分辨率 MF2K 数据集;实验显示其在复杂妆容、遮挡和跨性别场景下提升妆容保真、背景稳定与身份保持。

Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation Figure 1
2026-07-01cs.CV

Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation

Baiqin Wang, Sen Chen, Jiankuo Zhao, Xiangyu Liu, Zhen Lei, Xiangyu Zhu

2026-07-01视觉感知

面向多人、多轮对话式 talking face 生成,论文指出现有方法难以同时兼顾角色切换灵活性、听说反馈自然性与实时效率。InterTalk 以运动建模替代重型视频生成,引入响应上下文编码、交互运动生成、跨参与者反馈迭代细化,并将唇形、眨眼、头姿等面部运动解耦以便定向增强;同时构建多人对话数据并用 3D 人脸增强扩充监督。实验称其在交互质量上优于现有方法,并能以 30 FPS 实时生成。

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction Figure 1
2026-07-01cs.CV

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang

2026-07-01三维

CasaMaestro针对家庭具身智能中住宅级三维重建昂贵、针孔相机覆盖低且长序列易漂移的问题,改用20至50张稀疏全景图,采用DINOv2骨干同时预测度量深度和相机位姿,并加入轻量全景位姿解码器与ERP重映射数据增强。实验称其在真实和合成场景的AUC30分别提升84%和119%,未见其对不同数据规模贡献的充分拆分。

Accelerating Merge with Motion Vector Difference via Filter Difference Analysis for VVenC Figure 1
2026-07-01eess.IV

Accelerating Merge with Motion Vector Difference via Filter Difference Analysis for VVenC

Xinmin Feng, Shengyang Xu, Jianhua Chen, Li Li, Dong Liu, Feng Wu

2026-07-01视觉感知

这篇论文针对 VVenC 中 MMVD 逐方向、逐距离穷举搜索带来的编码复杂度,提出用分数像素插值滤波器差分来预判候选收益:将 8-tap 滤波近似为 2-tap,并利用参考块空间梯度与常规 merge 残差的内积判断可跳过方向,同时处理整数采样支撑偏移和二维可分离滤波。实验显示,在 fast 预设下平均 MMVD 搜索比例由 21.07% 降至 11.05%,效率-复杂度指标 η 由 11.79 降至 7.10。

Fleet: Few Shots Lead Effective AI-generated Image Detection Figure 1
2026-07-01cs.CV

Fleet: Few Shots Lead Effective AI-generated Image Detection

Jiaan Wang, Sirui Liu, Yu Li, Kaiyuan Yang, Juan Cao, Sheng Tang

2026-07-01视觉感知

针对现有 AIGI 检测器依赖“静态伪影”而在 SD3、Nano Banana Pro 等新生成器上失效的问题,Fleet 将任务转向少样本动态适配,通过解耦子空间与 avoidance routing 把新 AI 样本从真实图像主导路径中分流到伪造子空间,并构建含 64 个模型、36 万图像的 Treasure 基准;实验显示在 Doubao Seedream 4.0 上仅用 10-shot 可将准确率由 20.4% 提升到 73.1%。

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images Figure 1
2026-07-01cs.CV

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

2026-07-01视觉感知

AnyMatch针对跨模态图像匹配缺少大规模、几何精确训练数据的问题,提出从普通单视图图像出发,结合单目深度、显式3D重投影、扩散补全和跨模态翻译生成多视角多模态配对及标注。其关键洞察是用可规模化的单图资源替代昂贵多传感器采集,并避免SfM-MVS误差累积。基于Any-syn微调LoFTR、EDM、RoMa等模型后,在多模态匹配基准上取得明显提升,但增益可能主要来自scaling/data。

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation Figure 1
2026-07-01cs.CV

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

Bing Wu, Zuyao Chen, Changwen Chen

2026-07-01机器人规划控制三维

这篇论文针对零样本语义导航中仅依赖局部观测和贪心搜索导致远距离探索低效的问题,提出在线增量构建层次化3D场景图,将对象、区域单元和大区组织成全局语义拓扑,并在其上融合LLM先验与探索证据做信念规划,通过HSG模拟器和POUCT评估宏动作长期收益。实验显示其在多任务、多数据集上优于现有方法,远距离场景SR和SPL平均提升9.4%和5.0%。

Hybrid Unet-Transformer Model for Generating Stress and Strain Fields from Composite Geometrics Figure 1
2026-07-01cs.CV

Hybrid Unet-Transformer Model for Generating Stress and Strain Fields from Composite Geometrics

Shrey Patel

2026-07-01视觉感知

本文针对复合材料微结构设计中 FEM 逐例仿真耗时过高的问题,用混合 UNet-Transformer 直接从几何图像生成应力/应变场,核心在于用卷积编码局部结构、Transformer 建模全局空间关系,并用 Grad-CAM 检查物理关注区域。结果显示多数子数据集精度较高,最佳 R² 达 0.9991、SSIM 达 0.9936,推理低于 1 秒;但在稀疏、不规则方格结构和尖锐应力不连续处明显平滑,S11 仅 R² 0.7735。

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering Figure 1
2026-07-01cs.CV

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

Jingwang Ling, Lifan Wu, Feng Xu, Shuang Zhao

2026-07-01生成模型

这篇论文针对物理逆渲染中材料与光照强耦合、易把阴影和高光“烘焙”进材质的问题,提出不把扩散模型预测当作直接监督,而将 DiffusionRenderer 的 G-buffer 预测转化为表面相似性核,只在预测近似恒定的区域约束优化材质一致性,同时保留渲染方程拟合输入图像的自由度。该端到端流程联合恢复几何、空间变化材质和照明,在 Synthetic4Relight、Stanford-ORB 与 DTC-Synthetic 上较 Neural-PBIR、MaterialFusion 等提升重建与重光照质量,但依赖扩散预测的局部一致性,失效时可能过度平滑。

Online TT-ALS for Streaming Tensor Decomposition with Incremental Orthogonalization Figure 1
2026-07-01math.NA

Online TT-ALS for Streaming Tensor Decomposition with Incremental Orthogonalization

Hiroki Takeda, Yuto Miyatake, Daisuke Furihata

Department of Pure and Applied Mathematics, The University of Osaka, Japan, D3 Center, The University of Osaka, Japan

2026-07-01视觉感知

面向视频、传感等连续高维数据,批处理 TT 分解精度高但易耗尽内存,现有在线方法又因缺少正交约束而不稳定。论文提出 Online TT-ALS,在流式更新中逐步施加正交规范并精确求解局部核心张量,使单次 sweep 的秩依赖由二次降为线性。实验显示其在重构误差和感知视频质量上优于在线 TT 基线,并相较部分深度流式表示快数个数量级。

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs Figure 1
2026-07-01cs.CV

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

2026-07-01视觉感知

这篇论文针对多模态大模型生成中逐步脱离图像依据而产生幻觉的问题,指出其内部信号是文本到图像跨注意力在解码后期漂移、变散或受位置偏置影响。ADAPT用早期较可靠的跨注意力构造视觉锚点,并在推理时在线纠偏,同时通过视觉注意力引导的DPO强化基于图像的偏好。实验显示该框架在多种幻觉基准和主流骨干上降低约40%–60%幻觉率,且基本保持通用多模态能力。

Learning Video Dynamics with Predictive Differentiable Rendering Figure 1
2026-07-01cs.CV

Learning Video Dynamics with Predictive Differentiable Rendering

Yujin Tang, Tian Zhou, Xin Lin, Cheng Tan, Yifan Hu, Rong Jin, SouYoung Jin, Liang Sun

2026-07-01视觉感知

这篇论文针对确定性视频预测在离散像素空间用 MSE 训练时易产生模糊、细节丢失的问题,提出 PDR:在现有像素预测器后接轻量 PredGS,将预测转为连续 2D 高斯参数并用 CUDA 可微渲染器 predgsplat 重建,可支持任意通道并结合 L1+SSIM 训练。实验在交通、天气与人体视频基准上显示,PDR 以很小参数和 FLOPs 增量提升细节与精度,如 TaxiBJ/WeatherBench 降低 MSE,KTH/Human3.6M 降低感知误差。

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive Figure 1
2026-07-01cs.CV

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs

2026-07-01视觉感知规划控制

卫星图像生成常需把道路、建筑等矢量地理标注转成栅格或稀疏提示,既损失几何关系又增加标注与流程成本。TerraDiT-Ω的关键在于直接统一接收多边形、折线、框和点,并用Geometry-Aware Local Attention把不同 primitive 的显式几何注入扩散Transformer。实验显示其在多种控制格式下优于稠密/稀疏基线,且用同一模型生成合成数据可提升分割、检测、道路图提取和场景分类。

WarpI2I: Image Warping for Image-to-Image Translation Figure 1
2026-07-01cs.CV

WarpI2I: Image Warping for Image-to-Image Translation

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

Carnegie Mellon University

2026-07-01视觉感知

本文针对轻量潜扩散图像到图像翻译在编码压缩后易丢失人脸、小物体等细节的问题,提出在编码前按显著区域进行内容感知 warp、生成后再 unwarp 的框架,用空间重分配替代提高 latent 分辨率,并配套 FLUX 外扩生成成对重光照数据。实验显示其在人像重光照、驾驶场景重光照及时段/天气翻译中提升结构保持、光照一致性和图像质量,额外开销约 3ms 且无需改模型结构。

Dual Sparse Aggregation Transformer for Multispectral Object Detection Figure 1
2026-07-01cs.CV

Dual Sparse Aggregation Transformer for Multispectral Object Detection

Wencong Wu, Xiuwei Zhang, Hanlin Yin, Hongxi Zhang, Yanning Zhang

2026-07-01视觉感知

本文针对多光谱目标检测中可见光与红外互补信息融合不足的问题,指出现有 Transformer 用全部 token 做跨模态注意力会引入无关区域交互。DSAFormer 通过空间与通道双稀疏交叉注意力保留高相似关系,并结合多尺度特征精炼和可学习加权融合抑制冗余。在 MFAD、FLIR、M3FD、LLVIP 四个数据集上优于已有方法,但具体增益中各模块贡献需结合消融进一步判断。

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos Figure 1
2026-07-01cs.CV

Dense Structural Priors for Sparse Functional Landmark Localization in Surgical Videos

Chenyan Jing, Hao Ding, Lalithkumar Seenivasan, Jacob M. Delgado López, Mathias Unberath

2026-07-01视觉感知

本文针对手术视频中工具尖端与锚点等功能性地标难以在遮挡、烟雾和多器械场景下精确定位的问题,提出用粗定位结果提示 SAM 3 生成非真值器械掩码,并将其作为中间结构先验而非直接热图目标来细化预测。实验覆盖 60 段视频、7867 个片段,在无需人工像素级掩码训练的条件下,tip/anchor 总体 F1 达 72.4%/58.0%,并显示直接加入掩码目标会偏向宽泛工具区域。

Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit Figure 1
2026-07-01cs.CV

Auditing Generalization in AI-Generated Video Detection: A Six-Control Protocol and the VidAudit Toolkit

Mert Onur Cakiroglu, Zhihe Lu, Mehmet Dalkilic, Hasan Kurban

Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington, College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar

2026-07-01视觉感知规划控制学习理论

针对 AI 生成视频检测榜单可能被片长、编码或数据集身份等混杂因素虚高的问题,论文提出包含重编码、泄漏审计、真实样本一致性、统一训练、多种子置信区间和跨数据集测试的六控制协议,并发布 VidAudit。结果显示,片长分类器从 AUC 0.998 跌至 0.529,CLIP 暴露数据集偏置,WaveRep 在审计后仍达 OOD AUC 0.996;同时 0.1% FPR 下高 AUC 方法召回骤降,说明单一 AUC 不足以衡量泛化。

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising Figure 1
2026-07-01cs.CV

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati

University of Toronto, Vector Institute, KITE Research Institute, Queen’s University

2026-07-01视觉感知

这篇论文针对高分辨率照片马赛克生成中“远看要有整体图像、近看每块又要像独立照片”且计算成本高的问题,提出无需训练的 PhotoQuilt:先低分辨率确定全局布局,再在潜空间放大并重新加噪,随后按固定 tile 分块去噪,使局部各自成像同时共享全局结构。实验显示其在全局一致性和局部真实感上优于现有基线,并通过分块生成避免随画布尺寸出现二次注意力开销。

Learning Where to Look: A Reinforcement Learning Framework for Robust Micro-Ultrasound Prostate Cancer Detection Figure 1
2026-07-01cs.CV

Learning Where to Look: A Reinforcement Learning Framework for Robust Micro-Ultrasound Prostate Cancer Detection

Mohammad Mahdi Abootorabi, Sina Namazi, Armin Saadat, Lyuyang Wang, Obed Dzikunu, Paul F. R. Wilson, Zhuoxin Guo, Brian Wodlinger, Parvin Mousavi, Purang Abolmaesumi

The University of British Columbia, Vancouver, BC, Canada, Queen’s University, Kingston, ON, Canada, Vector Institute, Toronto, ON, Canada, ularization to mitigate weak-label noise and encourage sharp localization., evidence alongside quantitative risk predictions. Code is available at:, A central barrier is supervision. In routine biopsy, pathology is available, only at the core level: each acquired core provides a global cancer label, grade, (FM) adaptations that mitigate weak labels and domain shift via self-supervision, labels, where fine-tuning large decoders can amplify spurious regions and de-, sparse, weak core-level labels. On a multi-center retrospective µUS cohort of, We utilized a private multi-center µUS dataset of 6,607 biopsy cores from 693 pa-

2026-07-01视觉感知强化学习安全鲁棒

该文针对微超声前列腺癌识别依赖医生经验、弱标签稀疏且噪声大、类别极不平衡的问题,提出 Prost-RL:在基础模型编码器—解码器中加入轻量强化学习空间策略,先学习“看哪里”,再用注意力软提示进行热图定位和图像级分类,并用 APO 与抗噪损失稳定训练。多中心 6607 个活检核心上,核心级 AUROC 达 79.0,80% 特异性下敏感度 64.6%,较最强基线提升 2.1 AUROC 和 4.5 个敏感度点。

No Adaptation Without Observation: Observability-Constrained Test-Time Prompt Tuning for LiDAR Semantic Segmentation Figure 1
2026-07-01cs.CV

No Adaptation Without Observation: Observability-Constrained Test-Time Prompt Tuning for LiDAR Semantic Segmentation

Linlian Jiang, Wentao Ju, Sadman Rakib Pinon, Jianwei Xian, Zhixiang Chi, Xinxin Zuo, Yang Wang

Concordia University, Mila – Quebec AI Institute, University of Toronto, line using pseudo-label supervision, but directly apply-, Because pseudo-label reliability is spatially heteroscedas-, ditional annotations. Code is available at our project page., LiDAR semantic segmentation assigns semantic labels to, model parameters online using pseudo-label supervision., scene, implicitly assuming that pseudo-labels across spa-, eroscedastic, and pseudo-label reliability becomes spatially, neous pseudo-label supervision, we propose a geometry-, ference without labeled targets, allowing pre-trained mod-

2026-07-01视觉感知

这篇论文针对 LiDAR 语义分割在部署环境变化下难以依赖标注重训、而常规测试时自适应会被稀疏、遮挡等低可靠伪标签扰乱的问题,提出“无观测不自适应”的约束:用光束终止与邻域支撑估计空间可观测性,只在冻结骨干中的轻量 prompt 适配器上进行受门控更新,并用时间平滑原型对齐稳定语义证据。实验称其在标准 LiDAR 基准上提升了适应稳定性和分割性能,且无需额外标注。

GRAPE: Graph-Augmented Prototype Explanations for Interactive Medical Image Diagnosis Figure 1
2026-07-01cs.CV

GRAPE: Graph-Augmented Prototype Explanations for Interactive Medical Image Diagnosis

Rasul Khanbayov, Hasan Kurban

Hamad Bin Khalifa University, ing inside a doctor-drawn region conflicts with the claimed label, catching 85%, clinical text, allowing a new finding to be added from a single labeled image, co-occurrence graph from training labels and refines prototype similarity scores via two, from a single labeled image without modifying any other component., corpus-derived label co-occurrence. GRAPE uses training-label statistics with prototype-similarity

2026-07-01视觉感知

GRAPE面向原型式医学影像诊断的三类落地问题:病灶概念被独立建模、医生框选反馈可能放大错误、新增发现需重训。其核心是在原型相似度上加入标签共现图注意力,并用区域内概念匹配检查拦截可疑交互,再以BioViL-T文本锚支持开放词表原型扩展。实验称在TBX11K上较原型基线提升13.8个宏F1百分点,错误标注检出率85%,定位优于端到端基线且仅增加约1ms延迟。

Knowledge-Driven Dimension Estimation from a Single Image -3D Asset Generation Technology for Digital Twin Construction Figure 1
2026-07-01cs.CV

Knowledge-Driven Dimension Estimation from a Single Image -3D Asset Generation Technology for Digital Twin Construction

Hidenori Sakaniwa, Akihito Akai, Akihiko Hyodo

Data & Knowledge Management Research Department, Digital Infrastructure Innovation Center, Research &, Development Group, Hitachi, Ltd., 1-280, Higashi-koigakubo, Kokubunji-shi, Tokyo, 185-8601, Japan, dimensional information is unavailable or point cloud data, insufficient research focusing on scalability., focus on recognizing the location and class labels of, single image if sufficient geometric features are available, available. However, these methods are not applicable, one image of the object is available., labels to each region. The components to be annotated

2026-07-01视觉感知三维

面向自动驾驶数字孪生中高架交通标志尺度不准会影响车载相机验证的问题,论文提出从单张图像分解标志板、支柱、箭头等部件,并结合部件目录、设计规则和几何关系传播尺度,再重建可编辑3D资产。实验显示部件检测精度约80%以上,能生成更接近真实尺寸的资产;但定量仿真增益和大规模真实数据评估文中未充分说明。

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning Figure 1
2026-07-01cs.CV

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning

Brent A. Griffin, Jason J. Corso

The Label Imitation Game: Turing Test Network, for Zero-Shot Pseudo-Label Pruning, University of Michigan, Abstract. Foundation model pseudo-labeling—labeling data strictly via, these errors, we introduce the Turing-inspired Label Imitation Game, (LIG), a framework that formalizes pseudo-label pruning as an adversar-, ial interrogation. Rather than filtering labels via isolated thresholds, we, “judge” that evaluates candidate pseudo-labels within a dataset-wide con-, robustness, consistently enhancing label accuracy for three state-of-the-, datasets can effectively prune complex object detection pseudo-labels., and code are available at https://github.com/voxel51/ttn., Keywords: Pseudo-labeling · Label Pruning · Zero-Shot Task Transfer ·

2026-07-01模仿学习

本文针对基础视觉语言模型零样本伪标注中高置信幻觉难以靠阈值过滤的问题,提出 Label Imitation Game,将伪标签裁剪表述为“评审”对候选标签的对抗式辨别,并用轻量 Transformer TTN 在数据集级上下文中判断语义与空间一致性。实验显示,TTN 无需改动原模型或人工监督,可跨四个数据集提升三类 VLM 伪标签质量;仅用分类数据训练也能迁移到检测伪标签裁剪,困难类别 F1 提升 28%,任务微调后达 44%,并帮助下游检测器恢复部分类别零召回。

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation Figure 1
2026-07-01cs.CV

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

Juncheng Ma, Yuxuan Du, Yanan Sun, Zhening Xing, Changlin Li, Zhenyu Tang, Bo Li, Peng-Tao Jiang, Li Yuan, Daquan Zhou, Yonghong Tian

2026-07-01视觉感知

针对音频驱动肖像动画中 DiT 推理延迟高、通用扩散缓存易破坏唇形同步或占用显存过大的问题,SyncCache 利用人像区域高频、背景低频以及音频模块轻量但关键的非对称动态:用人体掩码增强缓存误差探测,缓存稳定的跨块残差以跳过重视觉计算,同时持续重算音频块,并用离线动态规划按显存预算选择缓存边界。实验显示其在 HunyuanVideo-Avatar 和 Wan-S2V 上分别最高加速 4.12×、3.75×,同时基本保持视觉质量和音频对齐。

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation Figure 1
2026-07-01cs.CV

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen

2026-07-01视觉感知

针对现有音视频生成常用双分支、分模态 tokenizer 带来的表示鸿沟、同步偏差与计算开销,AVTok 将音频和视频共同压缩到统一 1D 离散潜空间,并用共享编解码器、模态特定查询和 VFAL 分层训练缓解信息密度不平衡。实验显示其在音视频重建上接近或优于单模态强基线,并可支持音生视频、视频生音和联合生成。

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping Figure 1
2026-07-01cs.CV

GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping

Annika Thomas, Mason Peterson, Jonathan P. How

2026-07-01机器人三维

GaussLite针对在线3DGS机器人建图在有限算力下仍均匀分配高斯容量、浪费在任务无关区域的问题,提出由自然语言任务驱动的“视觉凹区”式表示分配:用LLM解析目标与锚点,结合开放词汇检测、分割和3D空间过滤生成相关性掩码,并按相关性调控播种密度、梯度与尺度。结果显示在4Hz实时、同等高斯预算下,Replica和真实场景ROI PSNR分别提升2.72dB和2.23dB,多机器人融合仅共享约7.08%地图仍优于拼接3.42dB。

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations Figure 1
2026-07-01cs.RO

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations

Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu, Mohammad Abdullah Al Faruque

University of California, Irvine, CA, USA

2026-07-01生成模型安全鲁棒

这篇论文关注生成式端到端自动驾驶规划器的安全鲁棒性:许多扩散式或词表式规划器最终都依赖评分头从固定候选轨迹中选最高分,且缺少后置安全过滤。作者提出 Derail,用面向碰撞、越界和急刹等行为级目标的扰动劫持评分头,使安全候选翻转为危险轨迹;在四个 NAVSIM 生成式规划器上攻击成功率达 100%,碰撞率升至 25.8%–60.4%,优于通用损失最大化和特征偏移攻击。

Simple Supervision Is Hard to Beat: A Bitter Lesson from Sparse Target Labels in Domain-Adaptive Object Detection Figure 1
2026-07-01cs.CV

Simple Supervision Is Hard to Beat: A Bitter Lesson from Sparse Target Labels in Domain-Adaptive Object Detection

Lijun Zhang, Ruinian Xu, Mudit Agrawal

A Bitter Lesson from Sparse Target Labels in, trained detector to an unlabeled target domain, typically through teacher-, student self-training with pseudo-labels. We revisit this setting when a, small, uniformly sampled subset of target images is labeled. We intro-, leaving the original unlabeled adaptation branch unchanged. Across eval-, ple adaptation tasks, and target-label budgets from 1% to 10%, RTSM, unlabeled self-training. To this end, we evaluate ten sparse-label feed-, back plugins covering pseudo-label selection, object completion, and op-, RTSM. These results reveal a bitter lesson for sparse-label SFDA-OD:, effective anchor for sparse-label SFDA-OD., a labeled source domain [2, 21]. Source-free domain adaptive object detection, unlabeled target domain without accessing the source data [8].

2026-07-01视觉感知

这篇论文关注源数据不可用的域自适应目标检测中,少量目标域标注究竟应如何使用。作者提出并强调一个简单基线RTSM:将随机抽取的1%至10%目标域标注直接作为监督损失混入原有自训练流程。系统实验显示,RTSM在多种SFDA-OD方法、检测器和迁移任务上稳定提升1.7至18.3 AP50,而利用这些标注去调控伪标签选择、目标补全或优化过程的十类插件增益有限且依赖方法,说明稀疏标注最可靠的价值仍主要来自直接监督。

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings Figure 1
2026-07-01cs.CV

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

Division of Vehicular Systems, Linköping University, Linköping, Sweden, Department of Automatic Control, Lund University, Lund, Sweden, Abstract. The growing availability of trajectory datasets has fueled, driven by advances in deep-learning methods, increased availability of trajectory, this could be applied to trajectory prediction by pooling all available data., all available data., Implementations are available at https://github.com/westny/transferatlas.

2026-07-01规划控制

针对轨迹预测模型跨数据集泛化不稳定、盲目合并数据可能带来无关或低质样本的问题,论文提出把场景映射到共享潜在空间,并用数据集分布的 KL 散度估计有方向的可迁移性。其核心洞察是潜在行为结构比表层统计更能预示迁移效果;在 24 个数据集、552 个迁移对上,该指标与零样本和微调性能强相关,并揭示了一些低关注数据集可作为有效预训练来源。

Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking Figure 1
2026-07-01cs.CV

Streaming Gaussian Encoding for 4D Panoptic Occupancy Tracking

Maximilian Luz, Thomas Nürnberg, Yakov Miron, Abhinav Valada

This work was funded by the Bosch Research collaboration on AI-driven automated driving., Department of Computer Science, University of Freiburg, Germany. 2 Bosch Research, Robert Bosch GmbH, Germany. 3 University of Haifa, Israel

2026-07-01视觉感知三维

这篇论文针对相机式4D全景占据跟踪中体素特征每帧重算、遮挡和静态结构下时序几何一致性不足的问题,提出流式高斯编码器:用固定预算的潜在高斯查询维护跨帧场景状态,经自车运动补偿传播,并以深度监督塑造不透明度作为可见性代理,累计置信度来保留稳定结构、刷新失效查询。该方法可嵌入现有mask式4D-POT管线,在Occ3D扩展nuScenes和Waymo上取得新的相机式4D-POT最优结果,并称几乎不增加推理开销。

LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents Figure 1
2026-07-01cs.OS

LUMOS: A Semantic Operating-System Layer for Accessibility-Grounded AI Agents

Yogeswar Reddy Thota

2026-07-01视觉感知

论文针对桌面智能体过度依赖截图、OCR和坐标点击导致的高成本与脆弱性,提出 LUMOS 作为操作系统语义层,将 UI Automation、DOM 与无障碍树转成含稳定 ID、角色、名称、边界和动作的语义蓝图,并用可见 UI 的受限 observe-act 循环执行操作。主要结果更偏架构与原型论证:它展示了现有 OS 语义可降低对视觉感知的依赖,但复杂任务评测和量化增益文中未充分说明。

DANTE-W: Diffuse Albedo Neural Texturing in the Wild Figure 1
2026-07-01cs.GR

DANTE-W: Diffuse Albedo Neural Texturing in the Wild

Guangyu Wang, Tianheng Lu, Ruqi Huang, Lu Fang

Tsinghua University, Beijing 100084, China

2026-07-01视觉感知

DANTE-W针对传统网格贴图把光照与阴影烘进纹理、导致野外大场景重光照失真的问题,将扩散模型给出的视角空间反照率先验融合到3D一致的神经纹理中,并用频率分解的物理神经渲染从原图补回高频细节、分离低频光照。在自建GigaLit基准上,其反照率恢复与重光照PSNR、LPIPS均明显优于扩散式渲染基线。

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation Figure 1
2026-07-01cs.GR

PolyFlow: Continuous Topology Embedding Flow Matching for Artist-style Mesh Generation

Chunshi Wang, Haohan Weng, Junliang Ye, Biwen Lei, Yang Li, Zibo Zhao, Zeqiang Lai, Kaiyi Zhang, Yunhan Yang, Zhuo Chen, Chunchao Guo, Yawei Luo

controllable in resolution. Retopology remains one of the most time-consuming steps in 3D

2026-07-01生成模型

PolyFlow针对自回归网格生成虽能产生艺术化拓扑但解码慢、连续扩散/flow难处理离散连接的问题,提出将顶点位置、法线与可由时空距离恢复邻接关系的连续拓扑嵌入统一成流匹配状态,并用Transformer并行去噪生成。文中称其可按指定顶点数在数秒内生成干净拓扑,在Toys4K上Chamfer与Hausdorff距离优于自回归基线。

Cross-Modal Hierarchical Fusion for from Multi-Sensor Ground Observation Figure 1
2026-07-01cs.CV

Cross-Modal Hierarchical Fusion for from Multi-Sensor Ground Observation

Xinze Zhang

University of Southern California, Los Angeles, CA 90007, USA, problem, largely because the available measurements are het-

2026-07-01视觉感知

该文针对地基多传感器观测中相机缺深度、雷达/云高仪覆盖窄导致云微物理场难以三维重建的问题,提出 AtmoFuseNet:用分层跨模态注意力融合多视角图像与垂直廓线,再以条件变分和可微前向模型约束重建,并用3D相关体估计逐体素风场。在半干旱站点和合成数据上,LWC MAE约0.02–0.03 g/m³、风速MAE 1.18 m/s,较基线更优,但跨气候场景泛化仍文中未充分说明。

2026-06-30

304 篇
Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors Figure 1
2026-06-30cs.CV

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel

2026-06-30视觉感知三维

这篇论文针对3D Gaussian Splatting开放词汇理解仍依赖CLIP特征、难处理复杂指代表达的问题,提出GaussDet:先将高斯分成3D实例组,再利用多视角2D开放词汇/指代表达检测器投票,形成视图聚合语义分布以抑制错误分组噪声。实验在LeRF-OVS、ScanNet和Ref-LeRF上优于既有方法,零样本指代表达mIoU提升16.7个百分点。

GROW$^2$: Grounding Which and Where for Robot Tool Use Figure 1
2026-06-30cs.RO

GROW$^2$: Grounding Which and Where for Robot Tool Use

Yuhong Deng, Yuyao Liu, David Hsu

National University of Singapore, Massachusetts Institute of Technology

2026-06-30机器人视觉语言

这篇论文面向机器人在开放场景中“临时找工具并知道用哪里”的问题,避免假设工具已给定或依赖大规模端到端标注。GROW²的关键洞察是用物体部件连接语义功能与几何区域:先由VLM选择工具和相关部件,再用视觉基础模型从单视角RGB-D重建并融合出3D可供性区域。实验显示其在可供性预测、开放类别泛化以及仿真和真实Franka工具使用中均优于基线,但失败仍主要来自VLM选错工具/部件与模型推理延迟。

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding Figure 1
2026-06-30cs.CV

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond

2026-06-30视觉感知

面部表情视频中的细微肌肉变化常被头动、相机运动等全局动态淹没,通用视频 ViT 对此不够敏感。论文提出 MiRA,在不增加可训练参数的情况下,利用自注意力中的帧级置信度与帧内集中度重分配注意力,并给出兼容 FlashAttention 的 flashLite 近似。实验显示其在多个视频 FER 基准上相对强 ViT 基线稳定提升,但具体增益来源仍可能与 attention scaling 及预训练设置有关。

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image Figure 1
2026-06-30cs.CV

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image

Mohamed el amine boudjoghra, Ivan Laptev, Angela Dai

Technical University of Munich, Mohamed Bin Zayed University of Artificial Intelligence

2026-06-30视觉感知三维

面向机器人仿真、具身 AI 和虚拟环境中可交互物体难以从单图或文本恢复完整结构的问题,UnfoldArt 将 VLM 的语义/部件推理与冻结视频生成先验组织成两轮代理辩论,用全局-局部分歧和生成运动视频校正关节类型、轴与枢轴,并借运动条件视频补全被遮挡内部几何。结果是可生成带外形、内部结构和运动一致状态的 URDF 式铰接 3D 物体;但片段中定量实验与相对增益来源未充分说明。

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing Figure 1
2026-06-30cs.CV

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

2026-06-30视觉感知数据集/基准

现有指令式视频编辑数据多停留在单一外观修改,难以覆盖真实创作中的结构变化和多任务组合。Goku的核心贡献是构建200万公开视频编辑对,覆盖主体/相机运动、参考引导与2–5项组合编辑,并用分解式合成流程和Gemini过滤保证语义、时序与真实感;同时提出MLLM文本编码加掩码分支的Goku-Edit,以及含1000例、7项指标的Goku-Bench。实验显示其在指令跟随上较开源模型最高提升约8%,但增益可能主要来自数据规模与任务覆盖扩展。

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation Figure 1
2026-06-30cs.CV

Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation

Siddhant Bansal, Zhifan Zhu, Shashank Tripathi, Jiahe Zhao, Michael J. Black, Dima Damen

2026-06-30三维

本文针对野外第一视角 RGB 中手-物体三维姿态受遮挡、接触歧义和监督稀缺限制的问题,提出 EPIC-Contact 数据集,用双向三维接触标注优化得到手物体网格,并设计 HOPformer 以手部先验通过交叉注意力增强物体特征、单次预测双手与物体姿态。实验显示其在 ARCTIC 成功率达 82.4%、较 SOTA 提升 6.2 点,在 EPIC-Contact 上成功率近乎翻倍且接触偏差降低 75%。

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities Figure 1
2026-06-30cs.CV

Learning from Reliable Latent Prompts for Visual Recognition with Missing Modalities

Taixi Chen, Nancy Guo

School of Computing, State University of New York at Binghamton

2026-06-30视觉感知

面向现实视觉识别中图文等模态缺失导致跨模态对齐失稳的问题,论文指出依赖实例特征生成动态提示会在高缺失率下放大偏置,提出LLP:用与输入解耦的模态特定潜在锚点和双路径交叉注意生成提示,以稳定先验补偿缺失语义。作者在三个基准和最高90%缺失率场景下报告优于现有方法,消融支持潜在锚点设计的贡献。

APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms Figure 1
2026-06-30cs.CV

APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms

Juntao Jiang, Jinsheng Bai, Linxuan Fan, Yali Bi, Jiangning Zhang, Yong Liu

2026-06-30视觉感知

针对现有医学分割框架难以同时支持新型高效架构、现代训练范式和基础模型集成的问题,APRIL-MedSeg提出YAML驱动的模块化2D分割工具箱,将网络拆为编码器、解码器、跳连和瓶颈等可注册组件,并统一半监督、域适应、蒸馏、弱监督和文本引导等范式。文中主要结果是提供130种架构、177个编码器、97种方法、917个配置及数据增强、部署、集成等基础设施;但论文更偏系统描述,实际性能增益来源文中未充分说明。

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization Figure 1
2026-06-30cs.CV

Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization

Liyao Wang, Ruipu Wu, Haojun Xu, Lei Shi, Linjiang Huang, Si Liu

2026-06-30视觉感知

本文针对跨视角目标地理定位长期依赖2D外观匹配、缺少几何标注和真实视场数据的问题,构建含22万余地面/无人机-卫星建筑配对、提示与相机位姿的CMA-Loc,并提出基于π³三维先验的单阶段GAGeo,同时预测框、掩码和位姿;以卫星为锚的对比学习支持无三元组的地面到无人机零样本定位,实验在检测、分割和跨域泛化上显著优于现有方法,但增益可能部分来自数据规模。

The Human Creativity Benchmark Figure 1
2026-06-30cs.AI

The Human Creativity Benchmark

Aspen Hopkins, Allison Nulty, Alexandria Minetti, Anoop Pakki, Angad Singh

Massachusetts Institute of Technology, Massachusetts Institute of Technology New York, NY

2026-06-30数据集/基准

论文针对创意类 AI 评测常把专家分歧当作噪声的问题,提出 Human Creativity Benchmark,将创意评价拆成“收敛”的专业共识与“发散”的审美偏好,并在五类创意任务、三个工作阶段收集约 1.5 万条专业判断。结果显示,技术正确性、层级等维度更易形成共识,而审美方向和概念风险更依赖个人品味;没有模型在所有阶段都占优,单一质量分数会掩盖模型应稳定优化与保持可控多样性的差异。

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics Figure 1
2026-06-30cs.CV

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen

2026-06-30视觉感知

EcoVideo针对DiT视频生成逐帧迭代去噪带来的高延迟,以及既有云边协同按去噪步骤静态切分、忽视帧间冗余和系统波动的问题,提出用早期自注意力熵无训练估计帧级信息密度,只让云端大模型生成高熵关键帧,边缘小模型借助运动感知插值与细化补全低熵帧,并随带宽和算力动态调整预算。实验在Wan与CogVideoX等模型上显示质量效率权衡更好,低带宽、边缘算力受限时端到端最高加速2.9倍。

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision Figure 1
2026-06-30cs.RO

Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision

Haoyang Li, Guanlin Li, Youhe Feng, Chen Zhao, Zhuoran Wang, Yang Li, Qizhe Wei, Shifeng Bao, Haitao Shen, Yihan Zhao, Tong Yang, Jing Zhang

Renmin University of China

2026-06-30视觉语言视觉感知

本文针对跨机器人本体训练中低层状态/动作空间难以语义对齐的问题,提出用密集具身思维链监督让VLM学习共享的感知、任务进度、规划与子任务表示,并以DiT动作专家生成连续动作;推理时通过注意力掩码跳过ECoT生成。ZR-0在约6000万帧数据上预训练,在单臂、双臂、人形仿真及xArm实机实验中均表现较强,但具体增益可能也来自数据规模与标注密度。

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors Figure 1
2026-06-30cs.CV

StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors

Wenhao Yuan, Yiyuan Ge, Deli Cai

2026-06-30三维

StereoGS针对稀疏视角下3D Gaussian Splatting因几何约束不足而过拟合的问题,核心是用虚拟双目对和基础立体模型提供具有绝对尺度、跨视角一致的深度监督,并结合多视图深度初始化与梯度感知透明度衰减来减少冗余高斯。实验覆盖LLFF、DTU、Mip-NeRF360和Blender,报告在稀疏视角新视角合成中达到SOTA,且推理阶段无额外开销。

Learning from Mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving Figure 1
2026-06-30cs.RO

Learning from Mistakes: Rollout-Retrieval Lifelong Policy Learning for Autonomous Driving

Cheng Gong, Haoyang Wang, Chao Lu, Zirui Li, Jianwei Gong

2026-06-30强化学习

论文针对自动驾驶策略在长尾闭环场景中会反复暴露新错误、但传统模仿学习难以利用这些失败经验的问题,提出 R2LPL:从策略自身 rollout 中筛选可恢复的错误状态,检索可行纠正目标,并用回放式终身学习避免遗忘。nuPlan 大规模闭环实验显示,少量迭代即可把中等性能规划器提升到学习式方法 SOTA,尤其在 Test14-hard 等困难长尾场景增益明显。

Orca: The World is in Your Mind Figure 1
2026-06-30cs.CV

Orca: The World is in Your Mind

Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang

Beijing Academy of Artificial Intelligence

2026-06-30强化学习

Orca针对单一 next-token/frame/action 目标难以支撑通用具身智能的问题,将世界学习表述为 next-state prediction:用视频自监督学习稠密自然状态转移,用语言事件和 VQA 学习稀疏语义转移,并以统一潜空间连接文本、图像和动作读出。论文用 12.5 万小时视频与 1.6 亿事件标注预训练,冻结骨干后仅训练轻量解码器,结果显示随模型和数据扩展读出能力提升,并在同规模下优于专用基线;但具体增益可能主要来自 scaling / data。

$μ$Flow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors Figure 1
2026-06-30cs.CV

$μ$Flow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors

Orazio Pontorno, Mattia Litrico, Luca Guarnera, Mario Valerio Giuffrida, Sebastiano Battiato

2026-06-30视觉感知生成模型

针对深度伪造检测器容易记住已见生成器痕迹、跨 GAN 与扩散模型泛化不足的问题,µFlow 将任务改为仅用真实人脸训练的一类检测。其核心洞察是多图平均会放大生成模型的稳定痕迹,因此用平均图像特征构造更可分的分布,并用归一化流把单图特征对齐到该空间,以似然区分真伪。在 FFHQ 训练、CelebA-HQ 与 WILD 未见生成器测试中,方法显著优于既有检测器,但局限于人脸场景。

HASTE: A Framework for Training-Free, Dynamic, and Steerable Compression of Pre-Trained Convolutional Neural Networks Figure 1
2026-06-30cs.CV

HASTE: A Framework for Training-Free, Dynamic, and Steerable Compression of Pre-Trained Convolutional Neural Networks

Lukas Meiner, Jens Mehnert, Alexandru Paul Condurache

2026-06-30视觉感知

HASTE面向预训练CNN在边缘设备上部署时计算成本高、传统剪枝常需训练或微调且依赖数据的问题,提出可替换卷积模块:推理时用局部敏感哈希按patch识别并合并冗余通道,同时压缩特征与滤波器通道,并用单一超参调节压缩强度。在CIFAR-10和ImageNet多架构实验中,ResNet34在CIFAR-10上可降46.2% FLOPs且精度仅降1.25%,但实际延迟收益与硬件实现效率仍需进一步验证。

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement Figure 1
2026-06-30cs.CV

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

2026-06-30视觉感知规划控制三维

这篇论文针对现有人体图像动画在真实三维场景中难以同时控制人物轨迹与相机运动、易出现悬浮或穿地的问题,提出 3STC-HIA:将动作与重建点云对齐,用地面自适应三维重定向根据地形调整高度和朝向,并通过可见场景掩码的潜空间融合注入几何先验以稳定视角变化。在 RealisDance-Val 和 Trajectory100 上,相比现有方法提升背景一致性、运动平滑度和美学质量,并降低轨迹平移误差。

High-Resolution Flood Mapping With Sentinel-1 and Sentinel-2 via Misalignment-Robust Cross-Sensor Learning and Generative Despeckling Figure 1
2026-06-30cs.CV

High-Resolution Flood Mapping With Sentinel-1 and Sentinel-2 via Misalignment-Robust Cross-Sensor Learning and Generative Despeckling

David Ma, Jeremy Feinstein, Shreya Pandit, Arkaprabha Ganguli, Eugene Yan

2026-06-30生成模型安全鲁棒

针对洪水制图中光学影像受云影和城市干扰、SAR受斑点噪声与跨传感器配准误差影响的问题,论文构建覆盖美国本土的10米级S1/S2水体数据集,并用位移不变损失缓解标签错位、用CVAE生成式去斑保留洪水结构。在UNet/UNet++实验中,S2最高AUPRC达0.956,SAR侧相对传统滤波取得显著提升。

On the Faithfulness of Post-Hoc Concept Bottleneck Models Figure 1
2026-06-30cs.CV

On the Faithfulness of Post-Hoc Concept Bottleneck Models

Laines Schmalwasser, Jan Blunk, Niklas Penzel, Julia Niebling, Joachim Denzler

2026-06-30视觉感知

论文针对事后概念瓶颈模型常以分类准确率证明可解释性的做法提出质疑:随机概念投影也能取得竞争性精度,说明高性能不等于概念忠实。作者从投影本身分析两类失真来源,即辅助概念数据的协变量偏移和视觉语言模型伪标签的系统性噪声,并给出误差界与新评估指标。在 CUB、CIFAR 和合成数据上,这些指标能发现准确率掩盖的不忠实现象。

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration Figure 1
2026-06-30cs.CV

RBE-Flow: Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration

Mengzhu Ding, Xin Song, Xiaoke Ding, Hongwei Ding, Xuecong Liu

2026-06-30生成模型

针对光学-SAR、可见光-红外等跨模态配准中辐射差异和形变导致的非凸、易误匹配问题,RBE-Flow把稠密光流估计建模为特征流形上的循环贝叶斯估计:RMO用特征度量最小二乘产生带不确定性的观测,UAPU再用sigma点后验融合并反向调节下一步阻尼。实验在OSdataset、WHU-OPT-SAR和RoadScene上报告优于现有方法,尤其提升严格亚像素指标。

PGE-SAM: Prompt-Guided Feature Enhancement for Interactive Segmentation under Degradation Figure 1
2026-06-30cs.CV

PGE-SAM: Prompt-Guided Feature Enhancement for Interactive Segmentation under Degradation

Tuan-Duc Nguyen, Anh-Tuan Mai, Duc-Trong Le

FPT Software AI Center VNU University of Engineering and Technology

2026-06-30视觉感知

这篇论文针对 SAM 在噪声、模糊、压缩及医学成像伪影下交互式分割明显退化的问题,指出已有方法全局修复特征且忽略多轮提示。PGE-SAM 用提示与上一轮掩码生成空间引导,只强化目标区域,并结合多尺度低层特征与前景重建损失;同时构建退化医学分割基准 DM-Seg。实验显示其在医学和自然图像多种退化强度下优于 RobustSAM、GleSAM 等,并以更少新增参数保持干净图像泛化。

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking Figure 1
2026-06-30cs.CV

PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking

Kai Luo, Fei Teng, Mengfei Duan, Wanjun Jia, Xu Wang, Hao Shi, Kunyu Peng, Zhiyong Li, Kailun Yang

2026-06-30视觉感知

这篇论文针对多目标跟踪对逐帧框标注依赖过重、难以扩展到拥挤或具身场景的问题,提出点监督 PS-MOT。核心思路是用点种子经 TFP 生成时序一致伪标签,PEWA 从频域补足边界线索,UGL 以不确定性建模缓解伪标签噪声。实验覆盖 DanceTrack、EmboTrack、SportsMOT、JRDB,显示其在点监督设定下达到新 SOTA,并将人工标注时间约降 64%。

FR-DETR: Frequency and Recurrent Feature Refinement for Robust Object Detection under Adverse Weather Figure 1
2026-06-30cs.CV

FR-DETR: Frequency and Recurrent Feature Refinement for Robust Object Detection under Adverse Weather

Tuan-Duc Nguyen, Duc-Trong Le

FPT Software AI Center, VNU University of Engineering and Technology

2026-06-30视觉感知安全鲁棒

本文针对雾、雨、雪等恶劣天气下目标检测因图像退化和域偏移而失效的问题,指出先增强图像再检测会重复提取特征、计算开销大且与检测目标不对齐。FR-DETR将增强迁移到检测器特征空间,在RT-DETR中加入频率细化模块分离重加权高低频线索,并用递归聚焦细化模块依据粗预测迭代强化候选区域。实验称其在多基准上较增强式方案取得更高检测精度且显著提升效率。

Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance Figure 1
2026-06-30cs.CV

Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance

Wenjie Qian, Bin Yang, Xiao Wang, Wenke Huang, Ling Mei, Xin Xu, Mang Ye

a School of Computer Science and Technology, Wuhan University of Science and Technology, b School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, c Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology

2026-06-30视觉感知安全鲁棒

面向真实监控中高低分辨率图像混杂导致的文本行人检索失效,论文将问题归纳为低清视觉证据不可靠和排序分布漂移两类,并提出 CRST:用分辨率条件推理抑制受损 token、文本引导细化补回语义线索,再以高分辨率邻域结构约束低分辨率排序。三大 TIPR 数据集上,Ultra-LR 的 Rank-1 和 mAP 平均提升 5.7% 与 5.3%,且基本不牺牲高分辨率性能。

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform Figure 1
2026-06-30cs.RO

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

Mathilde Hochedel, Marc Lalonde

2026-06-30视觉语言视觉感知强化学习

本文动机是检验开放式视觉-语言-动作模型能否从基准环境迁移到真实UR5e机械臂。作者搭建了采集、RLDS转换、微调与部署流程,并比较OpenVLA/OpenVLA-OFT的实机表现。主要洞察是瓶颈不只在模型能力,而在动作语义、坐标系、时序对齐、图像预处理和数据覆盖等系统一致性;结果显示离线指标虽有希望,但闭环实机执行仍不稳定。

Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes Figure 1
2026-06-30cs.CV

Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes

Sicheng Yu, Dongxu Shen, Beizhen Zhao, Guanzhi Ding, Hao Wang

2026-06-30三维安全鲁棒

本文针对单目 3D Gaussian SLAM 在公里级户外场景中易漂移、显存随轨迹膨胀的问题,提出 KiloGS-SLAM:用运动自适应三层跟踪在 Essential、PnP 与按需基础模型间切换,并以生命周期管理的高斯初始化、分块多视图增删控制冗余。实验覆盖 Waymo、KITTI、KITTI-360,显示其在单 GPU 上可处理超万帧序列,并取得更好的位姿精度与渲染质量。

OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model Figure 1
2026-06-30cs.CV

OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model

Junjie Cheng, Ruiqi Song, Ye Wu, Nanxing Zeng, Ximiao Li, Yunfeng Ai

2026-06-30强化学习

OWMDrive针对端到端自动驾驶常只依赖当前/历史静态表征、在遮挡和突发事件下规划不稳或保守的问题,引入4D占用世界模型预测多步未来3D占用,并将其作为条件先验指导扩散式轨迹生成,再用强化学习优化轨迹质量与稳定性。开放环和闭环实验显示,该方法提升了规划可靠性与安全性,尤其在部分可观测和复杂交互场景中更明显;但性能仍依赖世界模型预测精度,长尾不确定场景下误差传播风险文中也承认存在。

Beyond Point Estimates for Glaucoma Visual Field Forecasting with Diffusion Models Figure 1
2026-06-30cs.CV

Beyond Point Estimates for Glaucoma Visual Field Forecasting with Diffusion Models

Marta Colmenar Herrera, Pablo Márquez Neila, Şerife Seda Kucur Ergünay, Martin S. Zinkernagel, Raphael Sznitman

2026-06-30生成模型

青光眼视野进展受个体差异、治疗和测量噪声影响,同样历史可能对应多种未来,单点预测容易掩盖风险。本文将视野预测改写为条件分布建模,用带时间与空间位置编码的条件扩散模型从不规则纵向检查中采样多个未来视野。两套独立队列实验显示,其分布校准较好;取均值作点预测时也优于线性临床基线和既有学习方法。

SA-Homo: Scale Adaptive Homography Estimation for Scale Variation Scenarios Figure 1
2026-06-30cs.CV

SA-Homo: Scale Adaptive Homography Estimation for Scale Variation Scenarios

Shangxuan Xie, Haifeng Wu, Yuhang Wang, Huarong Jia, Wen Li

Huarong Jia is with Beijing Institute of

2026-06-30视觉感知

本文针对尺度差异场景下单应性估计易因大位移、局部外观不一致和外点匹配而退化的问题,提出 SA-Homo:先用较重的 SDBM 结合多尺度线性注意力与跨尺度全局相似矩阵做初始尺度对齐,并用 RANSAC 抑制外点,再由轻量 IHERM 基于局部相关迭代精修。实验称其在 MSCOCO、RGB-NIR 及新建高分辨率多模态卫星 HMSA 数据集上优于现有方法,且在最高 8× 尺度差异下仍保持较高精度。

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization Figure 1
2026-06-30cs.CV

SADL: What to Ignore? A Benchmark for Subject-Aware Distractor Localization

Cao-Tri Nguyen, Nguyen-Khoa Luong, Vinh-Tiep Nguyen, Minh-Triet Tran

University of Science, Vietnam National University Ho Chi Minh City, University of Information Technology, John Von Neumann Institute, Vietnam National University Ho Chi Minh City Ho Chi Minh City Vietnam

2026-06-30数据集/基准

这篇论文针对照片编辑中“删什么”仍需人工判断的问题,指出干扰物应随用户指定主体而变化,不能只靠通用显著性或开放词表检测。作者提出主体感知干扰物定位任务和 SADL 基准,含 1000 张照片、1800 个主体案例及硬负例,并用五类纳入因素、三类排除规则诊断 VLM。结果显示模型会识别潜在干扰物,但常过度触发排除规则而漏掉真干扰物,开放检测还明显受空间 grounding 限制。

RenderFormer++: Scalable and Physically Grounded Feed-Forward Neural Rendering Figure 1
2026-06-30cs.GR

RenderFormer++: Scalable and Physically Grounded Feed-Forward Neural Rendering

Huangsheng Du, Haoran Zhu, Youcheng Cai, Jinyang Meng, Ligang Liu

University of Science and Technology of China, University of Science and Technology of China Hefei China

2026-06-30视觉感知

本文针对基于 Transformer 的前馈神经渲染在三角网格全局光照中物理一致性不足、三角级注意力难以扩展的问题,提出 RenderFormer++:用 PITG 将渲染方程偏置和传输一致性损失注入注意力,并用 HOCT 把三角特征聚合为对象级 token 以降低开销。实验声称在复杂大场景上获得更稳定、可泛化且更高效的全局光照结果,但具体增益来源仍可能受模型规模与数据设置影响。

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning Figure 1
2026-06-30cs.CV

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

Haocong He, Chenfei Liao, Zichen Wen, Zihao Dongfang, Xu Zheng, Bin Ren, Chang Su, Zixin Zhang, Harold Haodong Chen, Hongfei Zhang, Weijia Li, Kailun Yang, Conghui He, Xuming Hu, Nicu Sebe, Linfeng Zhang

2026-06-30数据集/基准

OmniCoT针对现有全景推理基准多停留在局部线索和少步问题、难以检验具身场景中360°全局理解的不足,构建了含评测集、真实子集和带逐步CoT训练集的全景空间推理套件,并以See-Locate-Move组织多跳任务。实验显示,当前MLLM在答案正确率和推理质量上仍有明显短板,真实全景子集暴露出较大Sim-to-Real差距;OmniCoT-R1通过SFT与GRPO提供了更强基线,但具体增益可能部分来自数据与训练规模。

FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification Figure 1
2026-06-30cs.LG

FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification

Zheming Fu, Ruizhe He, Wei Shang, Xiaoxiao Ma, Lei Wang, Chang Liu, Siming Fu

Beihang University, 2 Joy Future Academy, 3 Zhongguancun Academy, 4 Zhejiang University, University of Science and Technology of China, Labs et al., 2024

2026-06-30生成模型

这篇论文针对连续流/扩散生成模型做在线强化学习时轨迹似然不可 tractable、SDE 近似带来训练-推理不一致且依赖 CFG 的问题,提出 FlowAWR:从 KL 约束最优策略推导最优速度场,把策略优化转为按组内优势加权的速度场回归。实验在 SD3.5-Medium 上显示其单奖励收敛较 DiffusionNFT 快 2–5 倍,并在多奖励约束下保持较稳定质量。

Set-Inclusive Uncertainty Modeling for Robust Brain Tumor Segmentation Figure 1
2026-06-30cs.CV

Set-Inclusive Uncertainty Modeling for Robust Brain Tumor Segmentation

Seunghun Baek, Jihwan Park, Jaeyoon Sim, Hoseok Lee, Seungjoo Lee, Won Hwa Kim

2026-06-30视觉感知安全鲁棒

针对临床多模态 MRI 常因缺失序列而使脑肿瘤分割过度依赖不可靠“补全”特征的问题,本文将不同模态组合的表征建模为高斯分布,用均值承载任务信息、方差刻画缺失证据的不确定性,并利用子集—超集层级约束让缺失越多不确定性越高。在 BraTS 2018/2020 多种缺模态场景中,方法相较 RFNet、M3AE、DC-Seg 等基线取得更稳健的分割表现。

MUSE: Unlocking Timestep as Native Task Steering for One-Step Dense Prediction Figure 1
2026-06-30cs.CV

MUSE: Unlocking Timestep as Native Task Steering for One-Step Dense Prediction

Shuo Zhou, Zhaoxin Li, Xiujuan Chai

2026-06-30视觉感知

面向单目深度与法线等密集预测的统一建模,MUSE关注现有扩散多任务方法依赖额外适配器、专家或任务 token 带来的冗余。其核心洞察是:一步扩散中固定的 timestep 嵌入可直接作为无参数任务开关,用不同离散时间步引导共享 U-Net/DiT 投向不同任务流形。实验覆盖10个数据集,显示在深度和法线估计上具竞争力,并支持流形解耦解释。

CouCE: A Unified Causal Framework for Debiased Deep Metric Learning Figure 1
2026-06-30cs.CV

CouCE: A Unified Causal Framework for Debiased Deep Metric Learning

Xin Yuan, Zhenyang Niu, Meiqi Wan, Huilin Zhu, Xin Xu, Kui Jiang

Wuhan University of Science and Technology, Harbin Institute of Technology, Wuhan University of Science and Technology Wuhan China, Harbin Institute of Technology Harbin China

2026-06-30视觉感知

本文针对深度度量学习在零样本检索中易依赖背景共现、姿态光照等捷径的问题,提出 CouCE 因果框架,将背景虚假相关与前景非语义扰动区分为两类混杂,并用 ODBA 字典正交调整和 MSRCI 多尺度傅里叶干预联合去偏。其可接入代理损失且推理无结构开销,在 CUB、Cars 和 SOP 上报告达到 SOTA,但具体增益对各模块与训练开销的归因仍需结合消融判断。

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control Figure 1
2026-06-30cs.RO

ReactiveBFM: Reactive Closed-Loop Motion Planning Towards Universal Humanoid Whole-Body Control

Xiao Chen, Weishuai Zeng, Xiaojie Niu, Zirui Wang, Jianan Li, Huayi Wang, Furui Xu, Jiahe Chen, Weixiang Zhong, Lihe Ding, Kailin Li, Jiangmiao Pang, Tai Wang, Tianfan Xue, Jingbo Wang

The Chinese University of Hong Kong, Shanghai AI Laboratory

2026-06-30机器人规划控制

本文针对人形机器人 BFM 只能跟踪预定义参考、难以应对扰动和任务变化的问题,提出 ReactiveBFM,将自回归运动扩散规划器与全身控制器闭环耦合。关键在于用 scheduled prefix sampling 让规划器从带误差的真实状态中学习恢复,并用异步重规划与轨迹分块缓解生成和控制频率不匹配。Unitree G1 实机实现零样本移动目标到达 90% 成功率,仿真扰动基准达 93.1% 成功率、2.0% 跌倒率。

On the Vulnerability of Parameter-Level Defenses to Model Merging Figure 1
2026-06-30cs.LG

On the Vulnerability of Parameter-Level Defenses to Model Merging

Kuangpu Guo, Qingyan Zheng, Jian Liang, Yongcan Yu, Zilei Wang, Ran He, Tieniu Tan

University of Science and Technology of China, NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences, School of Artificial Intelligence, University of Chinese Academy of Sciences, Nanjing University, ARF effectively defeats the proposed attack. Our code is available at, adversaries can effortlessly aggregate publicly available checkpoints to inherit

2026-06-30视觉感知

针对模型合并让“搭便车者”可未经授权复用专用模型能力的问题,论文指出现有参数级防御依赖线性变换,但受保护任务向量相对预训练权重小两到三个数量级,模型仍被公共预训练锚点主导;据此提出 AGA,通过最小二乘与匈牙利算法解析恢复变换。跨视觉与 NLP 实验显示,AGA 可绕过单一和组合防御,合并性能最高恢复到未保护模型的 97%,并提出 ARF 作为缓解方案。

Residual-Guided Expert Specialization for Incomplete Multimodal Learning Figure 1
2026-06-30cs.CV

Residual-Guided Expert Specialization for Incomplete Multimodal Learning

Seunghun Baek, Jihwan Park, Jaeyoon Sim, Minjae Jeong, Hoseok Lee, Won Hwa Kim

2026-06-30视觉语言

这篇论文针对推理阶段模态缺失导致多模态表征系统性偏离的问题,提出 MARS:训练时用完整与不完整输入表征之差作为“残差信号”指导 MoE 专家分工,并让仅看不完整特征的路由器模仿该决策;同时用差异感知噪声和采样缓解训练/测试路由落差。实验覆盖分类与分割数据集,报告在多种缺失组合下优于 DMRNet、MoMKE、SimMLM 等基线且计算开销较低。

FastPano3D: Feed-Forward Indoor Panoramic 3D Reconstruction from a Single Image Figure 1
2026-06-30cs.CV

FastPano3D: Feed-Forward Indoor Panoramic 3D Reconstruction from a Single Image

Jianqiang Li, Liumei Zhang, Wenjia Guo, Tianlong Feng, Yongzhi Liao, Di Lu, Hanchi Ren, Jingjing Deng

2026-06-30视觉感知三维

针对单张室内全景图重建通常依赖多视角或逐场景优化、难以快速部署的问题,FastPano3D将ERP畸变感知的轻量编码器、自适应高斯采样、点云引导几何细化与cubemap渲染结合,直接前馈生成可渲染3D Gaussian场景。实验称其在数秒内完成重建,相比Pano2Room最高提速156倍且参数约减半,渲染质量接近NeRF/3DGS方法,但具体泛化范围仍需更多验证。

FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Sparse Portrait Images Figure 1
2026-06-30cs.CV

FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Sparse Portrait Images

Jianjiang Yao, Ke Xian, Renxiang Dai, Robert Caiming Qiu

2026-06-30视觉感知三维

面向单张或少量肖像下4D头部数字人难以兼顾身份一致性、可驱动性与效率的问题,FFAvatar用Transformer交替注意力聚合可变视角并解耦身份、表情和视角,在FLAME先验上构建统一canonical高斯场,再以稀疏到稠密UV表示补细节,并加入运动细化模块。实验显示其能增量利用更多参考图,生成更高保真、可控且跨表情视角更稳定的头像。

Early Cue Precision Shapes Visual Shortcut Learning in Controlled Cue-Manipulation Benchmarks Figure 1
2026-06-30cs.CV

Early Cue Precision Shapes Visual Shortcut Learning in Controlled Cue-Manipulation Benchmarks

Chanho Park, Woochan Lee, Janyeong Oh, Geongho Gong, Minshu Kim, Yeachan Kwak, Seongim Choi

Gwangju Institute of Science and Technology, Gwangju, Republic of Korea

2026-06-30机器人强化学习规划控制数据集/基准

这篇论文关注视觉模型在匹配分布上准确、却在纹理与目标冲突时依赖捷径的问题,核心洞察是早期低层线索的标签可靠性比单纯输入退化更决定后续纹理偏置。作者通过合成形状-纹理、序列数字、冻结表征和 CIFAR-10 纹理覆盖基准操控 cue precision,发现 cue 越早越可靠,冲突准确率显著下降、纹理选择率上升;即使先低精度训练,后续捷径丰富微调也会迅速抹除收益。

A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP Figure 1
2026-06-30cs.CV

A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP

Hodaya Krakover, Meir Yossef Levi, Eyal Gofer, Guy Gilboa

2026-06-30视觉感知

针对现有对抗样本检测常依赖攻击类型、对抗数据或目标分类器的问题,本文提出 A4D:利用 CLIP 对细微非语义扰动敏感且嵌入偏移具有方向性的现象,将图像与一组噪声/篡改提示词的相似度经标准化与 PCA 聚合成检测分数。实验覆盖多种攻击、数据集和分类器,在攻击与架构无关的零样本黑盒设置下取得 SOTA 检测表现。

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception Figure 1
2026-06-30cs.CV

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

The Hong Kong University of Science and Technology, DAMO Academy, Alibaba Group, Zhejiang, China, Hupan Lab, Zhejiang Province, Zhejiang University, Zhejiang, China, Tsinghua University, The Chinese University of Hong Kong, Zeekr Automobile R&D Co., Ltd.

2026-06-30生成模型

UniGP针对扩散模型中可控生成与深度/法线等密集感知长期分开建模、难以互相利用先验的问题,在MMDiT上仅复制图像分支形成DUGP,并用统一数据与二值损失联合训练异构任务。结果显示其在统一模型中同时支持图像-几何联合生成、条件生成和密集预测,优于既有统一方法并接近专用模型;但参数与推理开销明显增加。

Optimizing Image Preparation and Compression for Face Recognition within 1024 Bytes Figure 1
2026-06-30cs.CV

Optimizing Image Preparation and Compression for Face Recognition within 1024 Bytes

Paul Andreas, Torsten Schlett, Christoph Busch

Department of Computer Science, Hochschule Darmstadt, Schöfferstraße 3, 64295, Darmstadt, Germany

2026-06-30视觉感知

这篇论文面向临时旅行证件无法使用 RFID、需把 ICAO 人脸照塞进 2D 条码的场景,研究如何在 1024 字节内兼顾压缩与人脸识别。其核心不是只比较格式,而是联合优化分辨率、灰度/彩色、平滑等预处理和 JPEG AI、AVIF、WebP 等编码参数。结果显示 JPEG AI 综合最好,AVIF/WebP 接近;高质量正脸比对中灰度有利,低质量探针则保留颜色更稳,强压缩造成的识别损失相对较小。

BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language Figure 1
2026-06-30cs.CV

BrainJanus: A Unified Model for Understanding and Generation across Brain, Vision, and Language

Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin Wu

2026-06-30视觉感知

这篇论文针对脑编码与脑解码长期被拆成单向任务、且过度依赖 CLIP/扩散模型等外部先验的问题,提出 BrainJanus:用统一脑 tokenizer 将连续 fMRI 动态离散化,并与视觉、语言 token 对齐到共享 Omni 空间,再用自回归 Transformer 做图像/文本到脑信号及脑信号到图像/文本的任意转换。实验显示其在多类编码、解码基准上优于任务专用模型,并具备零样本泛化和可解释皮层拓扑,但具体增益中 scaling / data 贡献仍需进一步拆分。

Real-Time Underwater Image Enhancement via Frequency-Guided Dual-Path Attention Figure 1
2026-06-30cs.CV

Real-Time Underwater Image Enhancement via Frequency-Guided Dual-Path Attention

Leshen Zhang, Ao Li, Ce Zhu

2026-06-30视觉感知

面向AUV和嵌入式水下视觉对低时延、小模型的需求,论文指出现有重参数化轻量CNN虽快但缺少频域感知,难以处理吸收与散射造成的颜色和纹理退化。方法在训练中用可折叠的固定DCT方向先验增强卷积频谱表达,并用FFT幅值构造双路径注意力进行轻量调制;在UIEB上以4.23K参数达到600+ FPS,并声称优于更大模型。

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment Figure 1
2026-06-30cs.CV

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment

Alia Tarek, Hamsa Saberr, Hamza Elghonemy, Youssef Afify, Tamer Basha, Omair Shahzad Bhatti, Abdulrahman M. Selim, Hasan Md Tusfiqur Alam Daniel Sonntag

Department of Biomedical and Healthcare Data Engineering, Faculty of Engineering, Cairo University, Giza, Egypt, German Research Center for Artificial Intelligence (DFKI), Saarbrücken, Germany, University of Oldenburg, Oldenburg, Germany

2026-06-30三维

针对胶质母细胞瘤纵向 MRI 疗效评估中需按 RANO 比较细微时序变化、而黑箱模型难以核查的问题,TRACE 将三维孪生视觉编码器与概念瓶颈结合,把肿瘤测量、百分比变化、阈值和新病灶等组织成可干预的 RANO 有向概念图。其在 LUMIERE 五折验证中取得 4 类 macro F1 0.4769、进展二分类 macro F1 0.7085,优于概念瓶颈基线但仍受小样本和类别不平衡限制。

A Point Cloud Transformer for Remote Monitoring and Automated Assessment of Physical Rehabilitation Exercises Figure 1
2026-06-30cs.CV

A Point Cloud Transformer for Remote Monitoring and Automated Assessment of Physical Rehabilitation Exercises

Kazi Rafat, Md. Ismail Hossain, M M Lutfe Elahi, Sifat Momen, Fuad Rahman, Nabeel Mohammed, Shafin Rahman

Department of Electrical and Computer Engineering, North South University, Dhaka, Bangladesh

2026-06-30三维

针对居家康复训练缺少专家监督、人工评估成本高且既有骨架建模易丢失关键时空关系的问题,论文将RGBD关节序列视作三维点云,引入曲线式点云聚合增强关节几何与位置特征,并用轴向注意力降低Transformer建模成本、突出关键关节。实验在Kimore、UI-PRMD和IRDS上报告优于现有方法,同时强调模型较小、推理较快,适合远程自动评分场景。

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction Figure 1
2026-06-30cs.CV

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

Nanyang Technological University, Shanghai Jiao Tong University

2026-06-30视觉感知生成模型三维

本文针对第一视角视频中双手在遮挡和交互下难以稳定重建的问题,提出 ViDiHand:将预训练视频扩散模型的时空、几何和遮挡先验,通过手部覆盖渲染任务适配为手感知特征,再用双分支解码器恢复公尺度 4D 手姿态。方法无需检测器、补帧器或测试时优化,在 ARCTIC、HOT3D、HOI4D 上显著优于既有方法,尤其提升遮挡场景下的检测稳定性、运动平滑性和姿态精度。

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model Figure 1
2026-06-30cs.LG

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

Daniyel Ayupov, Artur Markov-Tsoy

2026-06-30强化学习规划控制

本文关注实时可控世界模型在算力、延迟与长程一致性之间的取舍,目标是在消费级 GPU 上实现可交互预览。核心做法是改造 LongLive/Wan 自回归视频先验,加入 Matrix-Game 风格残差动作通路,并用多模态前缀初始化闭环生成。系统支持键鼠控制、文本/图像/视频进入、中途改提示和第一/第三人称视角,480p 下单 RTX 4090 可达 14–15 FPS;但持久空间记忆、重访一致性和精确物理控制仍不足。

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context Figure 1
2026-06-30cs.CV

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

Xiaoqian Shen, Mohamed Elhoseiny

2026-06-30视觉感知

VisReflect针对高分辨率图像和长视频中视觉 token 过多导致的注意力沉降、细粒度目标或关键片段难以定位问题,提出不再生成离散框/时间段并二次裁剪,而是在潜空间生成与问题相关的视觉反思表示,引导模型单次前向重聚焦相关区域或帧。实验在BLINK、HRBench、VideoMME等基准上较基线提升图像4.1%、视频1.8%,并较缩放式方法降低约44%视频推理时间。

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment Figure 1
2026-06-30cs.CV

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar

The University of Melbourne, Australia

2026-06-30视觉感知

本文针对文生图模型在地球、蒙娜丽莎等“唯一形态”对象上容易被既有视觉先验压制、难以遵循反事实提示的问题,指出最终文本嵌入会丢失中间层仍保留的概念信息,并提出无需训练的 IR-guided diffusion,在早期去噪注入文本编码器中间表示。作者还构建 OAO-AttackBench,实验显示在四个基准上最高提升 19.1 个百分点 VQAScore,同时基本保持图像质量和人类偏好。

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation Figure 1
2026-06-30cs.CV

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

Shihao Zhang, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

2026-06-30视觉感知强化学习

该文针对文本生成视频后训练依赖人工偏好或外部奖励模型、成本高且难改善局部细节的问题,提出将高质量 SFT 数据的时空 patch 流形视为内生奖励。其核心是 Shell-LCC:在 LCC 基础上避免均值回归,把高维数据高密度区域建模为各向同性壳面,并用点到流形的可微几何约束指导生成。实验称该方法在专有和开源 T2V 模型上提升真实感与高频细节,减少过平滑和运动模糊,且不牺牲语义对齐与时序一致性。

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation Figure 1
2026-06-30cs.CV

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

University of Liverpool, UK, University of Michigan, USA, University of Twente, NL, University of Bath, UK

2026-06-30视觉感知

这篇论文针对遥感指代表达分割中全量微调开销大、易破坏预训练表征且难以处理航拍尺度变化的问题,提出 S4ECA 参数高效框架:用文本适配器提炼语义代理,并以语言引导的多尺度与空间选择筛除冗余背景、强化跨模态对齐。实验称在 RRSIS-D 和 RefSegRS 上仅更新 2.4% 骨干参数即可达到 SOTA,主要贡献在效率与复杂航拍场景定位精度。

From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA Figure 1
2026-06-30cs.CV

From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim, Zeynep Akata

2026-06-30视觉感知

这篇论文针对交通事故 VideoQA 中“高准确率未必使用视觉证据”的评测失真问题,提出 Blind Gap、Visual Gain 和实例级 Shortcut Score 来审计并过滤文本捷径题。结果显示多个 VLM 在无视频时仍表现接近甚至更好,MM-AU 加入视频反而降分;过滤后子集降低文本可解性、提升视觉增益,说明安全关键 VideoQA 需评估视觉依赖而非只看准确率。

Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion Figure 1
2026-06-30cs.CV

Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion

Chao Tian, Zikun Zhou, Chao Yang, Guoqing Zhu, Zhenyu He

2026-06-30视觉感知

针对RGB-T检测常用双主干与全图密集跨模态融合导致计算量过高的问题,论文提出SFEDet:先用轻量单模态检测器高召回筛出候选区域,再仅在稀疏RoI上做跨模态融合、误检过滤与框回归细化,并用Rolling Convolution和去噪训练提升效率与鲁棒性。实验在FLIR、M3FD、LLVIP上显示其以更少参数和更低计算成本取得有竞争力的精度,且对高分辨率图像更具扩展性。

A Multi Center Breast FNAC Whole-Slide Cytology Dataset for AI-Assisted Patch-Wise Classification Using C1 to C5 Reporting Categories Figure 1
2026-06-30cs.CV

A Multi Center Breast FNAC Whole-Slide Cytology Dataset for AI-Assisted Patch-Wise Classification Using C1 to C5 Reporting Categories

Garima Jain, Abhijeet Patil, Surabhi Jain, Sanghamitra Pati, Amit Sethi, Sandeep Mathur, Pulkit Verma, Nishi Halduniya, Jatin Kashyap, Sharat Kumar, Simmi Kharb, Sunita Singh, Sucheta Devi Khuraijam, Sushma Khuraijam, Ratan Konjengbam, Arvind Kumar, Deepali Tirkey, Saurav Banerjee, Shivani Kalhan, Rakesh Kumar Gupta, Ranjana Solanki, Deepika Hemranjani, Shashank Nath Singh, Uma Handa, Manveen Kaur, B. G. Malathi, Yogender P., Niraj Kumari, Shruti Gupta, Indu R. Nair, Vidya C., Basumitra Das, Sunil Kumar Komanapalli, Ravindra Karle, Tanaya Kulkarni, Vandana Raphael, Biswajit Dey, Vaishali Gaikwad, Nilam Adhav

Indian Council of Medical Research-National Institute for Research in Digital Health & Data Science, New Delhi, Department of Electrical Engineering, Indian Institute of Technology Bombay, Mumbai, Department of Pathology, All India Institute of Medical Sciences, New Delhi, Department of Biochemistry, Pt. B.D. Sharma Post Graduate Institute of Medical Sciences, Rohtak, Department of Pathology, Pt. B.D. Sharma Post Graduate Institute of Medical Sciences, Rohtak, Department of Pathology, Regional Institute of Medical Sciences, Imphal, Department of Pathology, Rajendra Institute of Medical Sciences, Ranchi, Government Institute of Medical Sciences, Greater Noida, Department of Pathology, Sawai Man Singh Medical College, Jaipur, Department of Otorhinolaryngology, Sawai Man Singh Medical College, Jaipur, Department of Pathology, Government Medical College and Hospital, Chandigarh, Department of Pathology, Mandya Institute of Medical Sciences, Mandya

2026-06-30数据集/基准

这篇论文面向乳腺细针穿刺细胞学中缺少多中心、可复现 C1–C5 分级基准的问题,发布来自印度多家医疗中心的全玻片数据集:321 名患者、470 张 WSI、7398 个专家核验 patch,并提供 GeoJSON 标注、元数据与复用代码。其主要贡献在于把原始 WSI 与 patch 标签同时开放,支持从局部分类到后续切片级辅助诊断的研究;但论文重点是数据资源建设,未报告模型性能增益。

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation Figure 1
2026-06-30cs.CV

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

Filippo Ruffini, Marco Salmé, Rosa Sicilia, Valerio Guarrasi, Paolo Soda

Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University, Umeå, Sweden, UniCamillus-Saint Camillus International University of Health Sciences, Rome, Italy

2026-06-30视觉感知数据集/基准

现有放射报告生成评测多看文本相似度或整体临床正确性,难以判断诊断是否真正来自影像证据。ShoViR用带病灶框的MIMIC-CXR和PadChest-GR构造区域遮挡基准,区分证据被遮后仍报病的直接捷径与依赖共现病灶的上下文捷径。对8个VLM的评测显示,所有模型都有明显捷径行为,且报告质量高不等于空间 grounding 可靠。

Few-Shot Domain Incremental Learning via Continual Vision-Language Consolidation Figure 1
2026-06-30cs.CV

Few-Shot Domain Incremental Learning via Continual Vision-Language Consolidation

Naeem Paeedeh, Mahardhika Pratama, Wolfgang Mayer, Mukesh Prasad, Weiping Ding, Yew-Soon Ong

School of Computer Science and IT, Adelaide University, Australia., Faculty of Engineering and IT, University of Technology Sydney (UTS), Australia, School of Artificial Intelligence and Computer Science, Nantong University, China, College of Computing and Data Science, Nanyang Technological University, Singapore

2026-06-30视觉语言视觉感知

论文针对域增量学习在新域样本极少时易过拟合和遗忘的问题,提出 FSDIL 设置与 CVLC 方法:在 CLIP 视觉/文本编码器中加入参数高效的双合并投影,并用基域潜空间预留、共享/域特定组件、多模板同义词文本原型及原型校正来兼顾迁移与稳定。实验显示其在 CDDB、CORe50 等基准上较已有方法最高提升约 16%,但具体增益在不同模块间的来源仍需结合消融细看。

DrivenMorph: Bridging Attention Mechanism and Variational Image Registration via Difference Modeling Figure 1
2026-06-30cs.CV

DrivenMorph: Bridging Attention Mechanism and Variational Image Registration via Difference Modeling

Mingke Li, Jianping Zhang, Jinqiu Deng

and in part by the Project of Scientific Research Fund of the Hunan Provincial Science and Technology Department (grant number 2023GK2029)

2026-06-30视觉感知

这篇论文针对深度医学图像配准中精度与可解释性、形变可控性难以兼顾的问题,借鉴经典 Demons 变分配准,将双流特征差异显式建模为“驱动力”,再通过结合交叉注意力与自注意力的 Neural Demons Layer 生成平滑形变场,从而把差异建模与形变解码解耦。实验在多个 3D 脑 MRI 数据集上优于学习式和优化式基线,并用可视化与统计分析表明驱动力与实际形变模式较一致。

HiRes: A Hierarchical Cascaded Method for Resistor Value Identification Figure 1
2026-06-30cs.CV

HiRes: A Hierarchical Cascaded Method for Resistor Value Identification

Rama Y. AlHamidi, Aseel A. Mohamed, Mustafa A. Eltayeb, Osama Hasoneh, Mohammad Shaqfeh

2026-06-30视觉感知

本文面向非受控场景中电阻色环易受光照、姿态、背景和相邻色带干扰而难以自动读值的问题,提出 HiRes 级联流程:先用 YOLOv8n 定位电阻,再以 UNet++ 分割色带,并沿主轴投影排序解码,加入保留间隙的色带分离和 E24 校验。实验在真实图像上取得检测 mAP50 0.9906、分割 mIoU 0.8444、端到端准确率 85.8%,优于 CVResist 和多模态大模型。

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models Figure 1
2026-06-30cs.CV

Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models

Kai Jiang, Ruishu Zhu, Siqi Huang, Hongyuan Zhang, Xuelong Li

School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Institute of Artificial Intelligence, China Telecom (TeleAI), Fudan University, The University of Hong Kong

2026-06-30视觉语言

这篇论文针对多模态大模型在细粒度视觉问答和定位中被大量无关图像 token 稀释关键证据的问题,提出 Lens:用临时 Lens Evidence Token 按问题评估视觉 token 相关性,并对低相关 token 注入自适应潜在噪声,而非剪枝或增加推理轨迹。实验显示其在多数 VQA 数据集提升 2.4–6.4 分、定位任务提升 4.1–6.4 分,说明清理视觉证据本身可直接改善推理。

A Dual-domain Refinement Network with FBP-based Jacobian Learning for Sparse-view Dual-Energy CT Material Decomposition Figure 1
2026-06-30cs.CV

A Dual-domain Refinement Network with FBP-based Jacobian Learning for Sparse-view Dual-Energy CT Material Decomposition

Qian Liu, Xiaohong Fan, Ke Chen, Chong Chen, Shuaikang Wang, Jianping Zhang

2026-06-30视觉感知

面向稀疏视角双能 CT 中低剂量采集导致的非线性、病态材料分解问题,论文将任务写成带稀疏正则的非线性最小二乘,并展开为 DECT-DRNet:用 FBP+U-Net 学习近似伴随 Jacobian,再以图像域与傅里叶域残差块联合抑制全局伪影和局部噪声。在 60 视角下,乳腺与腹部 CT 数据集相对传统分解方法分别提升 3.23 dB 和 2.01 dB PSNR。

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation Figure 1
2026-06-30cs.CV

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

Wentao Qu, Qi Zhang, Chenxu Wang, Guofeng Mei, Yongfei Liu, Xiaoshui Huang, Gim Hee Lee, Liang Xiao

2026-06-30生成模型

本文针对 Text-LiDAR 数据稀缺导致扩散模型生成场景过平滑、可控性弱的问题,提出 T2LDM++:用自条件表示引导在训练中以重建特征约束去噪网络,并构建超 10 万样本的 Text-LiDAR 基准和可控性指标,还加入方向位置先验与多条件控制。结果显示其能生成更真实、细节更丰富且支持多种条件的 LiDAR 场景,但部分增益可能来自新数据规模与标注构造。

FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars Figure 1
2026-06-30cs.AI

FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars

Habin Lim, Jae-Ho Lee, Hah Min Lew, Ji-Su Kang, Gyeong-Moon Park

Korea University, available audio rather than jointly generating speech and motion online. To bridge

2026-06-30视觉感知

FacePlex针对现有系统要么只能全双工语音、要么只能离线由音频驱动表情的问题,提出全双工联合语音-面部运动生成任务。其核心是用Rolling Flow Matching在流式队列中逐步细化并提交面部帧,再用Rolling Cross-Attention对齐滚动语音与运动上下文。实验、消融和用户研究显示,该方法在在线约束下同时生成语音与面部动作,并提升唇形同步、运动保真度和感知对话质量。

Hyper-Network Neural Functional Maps for Unsupervised Robust 3D Shape Matching Figure 1
2026-06-30cs.CV

Hyper-Network Neural Functional Maps for Unsupervised Robust 3D Shape Matching

Dongliang Cao, Florian Bernard

University of Bonn

2026-06-30三维安全鲁棒

这篇论文针对非刚性三维形状匹配在局部缺失、拓扑噪声和原始点云下失效的问题,指出线性功能映射难以对齐受强内在形变影响的截断谱基。方法用超网络根据标准功能映射动态预测带跳连的 MLP,形成非线性神经功能映射,并以无监督谱对齐损失训练。实验显示其可接入现有无监督深度功能映射流程,在困难场景中显著提升匹配精度。

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation Figure 1
2026-06-30cs.CV

SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation

Zhiyuan Ma, Zhengfeng Shi, Yuning An, Peize Li, Jiabao Wei, Ruijie Li, Junhao Xiao, Jianjun Li, Bowen Zhou

2026-06-30视觉感知数据集/基准

本文针对通用文生图模型在科研图像中“看起来合理但违背拓扑、因果或物理规律”的问题,提出 SciIR:用符号三元组将科学图像推理拆为实体结构、科学过程和科学规律,并构建含 8 万余图文对与 Sci-RCoT 标注的 SciIR-82k,以及原子检查表式 SciIR-Bench。实验显示现有模型科学推理明显不足,微调得到的 Qwen-Image-SciIR 将基准得分由 35% 提升到 43%,但增益可能主要来自数据与领域微调。

LETT-NeXt: A Lightweight RECIST-Guided Model for 3D CT Lesion Segmentation Figure 1
2026-06-30cs.CV

LETT-NeXt: A Lightweight RECIST-Guided Model for 3D CT Lesion Segmentation

Sebastian Aas, Elias Stenhede, Arian Ranjbar

2026-06-30视觉感知三维

该文针对RECIST二维径线难以表达肿瘤三维范围、而完整3D标注成本高的问题,提出LETT-NeXt:以RECIST中心裁剪CT区域,将径线和端点编码为提示通道,配合轻量MedNeXt-v2、组件筛选与AutoZoom推理生成病灶掩膜。结果显示隐藏测试DSC为73.9、NSD为67.3,CPU单例约6.9秒、峰值3.6GB;误差仍集中在边界与病灶范围,外部泛化文中未充分说明。

SIR: Structured Image Representations for Explainable Robot Learning Figure 1
2026-06-30cs.RO

SIR: Structured Image Representations for Explainable Robot Learning

Paul Mattes, Jan Schwab, Jens Bosch, Nils Blank, Maximilian Xiling Li, Minh-Trung Tang, Moritz Haberland, Rudolf Lioutikov

Intuitive Robots Lab, Karlsruhe Institute of Technology, Germany 2Robotics Institute Germany, ject labels), geometric cues (e.g., bounding boxes and point, Label, (e.g., symbolic labels, geometric cues, or visual features) af-

2026-06-30机器人视觉感知

这篇论文针对视觉嵌入式机器人策略缺乏显式结构、易受干扰且难解释的问题,提出 SIR:先由图像特征构建全连接场景图,再端到端学习稀疏化为任务相关子图,并用 GNN 作为动作生成器输入。RoboCasa 上稀疏图策略平均成功率 19.5%,高于图像基线 14.81%,且子图可暴露模型关注的干扰物、遗漏关键物体及数据集偏置。

CylindTrack: Depth-Aware Cylindrical Motion Modeling for Panoramic Multi-Object Tracking Figure 1
2026-06-30cs.CV

CylindTrack: Depth-Aware Cylindrical Motion Modeling for Panoramic Multi-Object Tracking

Buyin Deng, Kai Luo, Lingxin Huang, Xinqi Liu, Fei Cheng, Hang Zheng, Liming Yin, Kailun Yang

2026-06-30视觉感知

这篇论文针对全景相机多目标跟踪中水平边界周期性、遮挡和单帧深度不稳定导致的身份断裂问题,提出 CylindTrack:用轨迹级深度时序建模稳定几何线索,并将水平运动提升到连续角度/柱面状态以处理 0°/360°接缝关联。实验在 QuadTrack 和 JRDB 上提升 HOTA、IDF1 与 AssA,同时保持约 28.56/21.34 FPS,说明收益主要来自深度一致性与全景拓扑建模的结合。

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding Figure 1
2026-06-30cs.CV

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

Chen Liu, Ling Chen, Hanzhang Zhou, Liangyu Chen, Chenglin Cai, Xin Yu, Steven Hoi, Yue Wang

2026-06-30视觉语言

这篇论文针对 GUI grounding 中“已在中间层找到目标区域,却在自回归坐标解码时丢失证据”的 Region-to-Point Gap,提出 InnerZoom:在单次前向中提取、压缩并跨层维护目标区域证据,再注入后续解码层指导点击坐标生成,替代 ZoomIn 的裁剪后二次推理。实验显示 InnerZoom-4B 在多个 GUI grounding 基准上达到 SOTA,相比同配置 SFT+RL 平均提升 5.3 点,并较两阶段 ZoomIn 平均高 1.3 点,同时最多降低 31.8% 延迟和约 29% TFLOPs。

Clinical Risk-Aware Multi-Level Grading for Coronary Artery Stenosis through Curved Feature Reconstruction Figure 1
2026-06-30cs.CV

Clinical Risk-Aware Multi-Level Grading for Coronary Artery Stenosis through Curved Feature Reconstruction

Shishuang Zhao, Hongtai Li, Junjie Hou, Yuhang Liu

Yizhun Medical AI Co., Ltd, The First Hospital of China Medical University

2026-06-30三维安全鲁棒

这篇论文面向冠脉狭窄五级分级,动机是单用CCTA难处理弯曲血管、单用3D SCPR又会引入形变,且传统分类/回归未区分跨越临床风险边界的错误。核心做法是用血管中心线先验进行曲面特征重建,对齐融合CCTA与3D SCPR特征,并用临床风险感知损失强调1/2级与3/4/5级边界。在院内数据上,方法优于既有方案,消融也支持CFR与CR Loss的贡献,但泛化到外部数据仍文中未充分说明。

Neural Subspace Reallocation: Continual Learning as Retrieval-Based Subspace Memory Management Figure 1
2026-06-30cs.LG

Neural Subspace Reallocation: Continual Learning as Retrieval-Based Subspace Memory Management

Byeong Hoon Yoon

ing the rest available. Synaptic consolidation: dur-, ing rest, labile memories are compressed into stable

2026-06-30视觉感知

本文针对持续学习中固定容量模型易遗忘、遇到重复任务需重学的问题,将 LoRA 子空间视为可压缩和检索的记忆单元:任务后用 SVD 压缩并存入 TaskKnowledgeBank,再按相似度召回以热启动和重分配子空间。关键洞察是历史记忆而非复杂分配策略决定效果;实验显示 Bank 使循环任务恢复约快 10 倍,NSR-Sim 可匹配或优于 RL 控制器,并在 Split-CIFAR-100 与 5-Datasets 上降低遗忘。

Emergence of a Shared Canonical Object Frame from In-the-Wild Videos Figure 1
2026-06-30cs.CV

Emergence of a Shared Canonical Object Frame from In-the-Wild Videos

Tom Fischer, Martin Sundermeyer, Adam Kortylewski, Eddy Ilg

University of Technology Nuremberg, CISPA Helmholtz Center for Information Security

2026-06-30视觉感知

这篇论文针对跨实例/跨类别物体姿态需要共享规范坐标系、但传统依赖 CAD 对齐或人工姿态标注难以扩展的问题,提出让大量野外物体视频经由同一个粗 canonical mesh 几何瓶颈学习像素到网格的稠密对应,并用 SfM 位姿估计序列级对齐,使共同坐标系在自监督中涌现。方法在约 16 万视频上训练,无类别条件和规范姿态标签,在多项类别级姿态估计基准上达到接近有监督方法的精度,但对对称物体的方向歧义仍有限。

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation Figure 1
2026-06-30cs.CV

Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation

Chonghuinan Wang, Zhikai Chen, Chunwei Wang, Yecong Wan, Junwei Yang, Zhixin Wang, Wei Zhang, Jiaqi Xu, Renjing Pei, Xiaohe Wu, Fan Li, Wangmeng Zuo

2026-06-30视觉语言视觉感知强化学习

针对统一多模态模型虽能生成图文但难以在任意顺序下稳定产出自由交错图文序列、且缺少专门评测的问题,ILLUME-X从数据、训练和评估三方面改进:构建约10万高质量交错样本,采用渐进式训练与自适应目标处理变长多模态 token,并提出ILScore衡量跨模态连续性与单模态质量。实验显示其在风格迁移、图像分解和故事生成等交错生成任务上优于既有统一模型;但具体增益可能主要来自数据构建与训练流程,消融细节若不足则增益来源仍需谨慎判断。

Bridging the Gap Between Image Restoration and Navigational Safety in Hazy Conditions: A New Visibility Estimation Metric for Maritime Surveillance Figure 1
2026-06-30cs.CV

Bridging the Gap Between Image Restoration and Navigational Safety in Hazy Conditions: A New Visibility Estimation Metric for Maritime Surveillance

Wentao Feng, Guobei Peng, Wengang Mao, Ryan Wen Liu

Sanya Science and Education Innovation Park, Wuhan University of Technology, Sanya 572000, China, School of Navigation, Wuhan University of Technology, Wuhan 430063, China, State Key Laboratory of Maritime Technology and Safety, Wuhan University of Technology, Wuhan 430063, China, Department of Mechanics and Maritime Sciences, Chalmers University of Technology, Göteborg 41296, Sweden

2026-06-30机器人视觉感知安全鲁棒

本文针对海雾下去雾算法虽提升观感、却难对应航行安全可见距离的问题,提出以目标检测性能为中介的可见度评估指标,并用 Unity3D 构建含成对清晰/雾图和距离标注的 MSVD 数据集。实验比较六种去雾方法,显示传统 IQA 难反映有效观测距离,而新指标可较可靠估计可见距离,支持安全限制与通航效率的权衡。

Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes Figure 1
2026-06-30cs.CV

Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes

Xi Li, Linyuan Li, Yan Wu, Tong Rao, Kai Zhang, Xinchen Hui, Cihui Pan

2026-06-30三维

本文针对全景图像的度量级前馈三维重建缺少大规模RGB-D训练数据、且稀疏无序采集易因参考视角选择不当产生位姿漂移的问题,提出Realsee3D数据集与Argus模型。核心做法是用可学习共视关系选择几何上更稳健的世界坐标锚点,并将全景像素到世界坐标映射分解为多步监督以增强几何一致性。实验显示其在Realsee3D上于相机位姿、深度和点云重建均优于现有前馈方法,但增益可能主要来自数据规模与专门全景训练。

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation Figure 1
2026-06-30cs.CV

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu

2026-06-30强化学习

面向相机控制的交互式世界探索,论文认为逐帧视频潜变量滚动会把状态转移与高频渲染耦合,导致长程一致性和重访稳定性下降。其核心是把滚动变量改为固定长度、可渲染的神经隐式场景 NIS,并用 VAE 学场景 token、DiT 按轨迹和几何检索历史生成下一状态。实验在 Re10K、DL3DV 上显示较好的长程位姿/重访一致性与推理效率,但范围限于静态场景。

Consensus Clustering of Free-Viewing Gaze Data: New Insights into Human-Information Interaction Figure 1
2026-06-30cs.CV

Consensus Clustering of Free-Viewing Gaze Data: New Insights into Human-Information Interaction

Beryl Gnanaraj, Jaya Sreevalsan-Nair, Saqib Alam Ansari, Maanasa Rajaraman

Graphics-Visualization-Computing Lab, International Institute of Information Technology Bangalore, Karnataka 560100, India., PSG College of Technology, Coimbatore, Tamin Nadu, India.

2026-06-30视觉感知

针对自由观看眼动数据中用户行为与图像刺激交互关系缺乏系统分析的问题,本文提出 EnsembleGaze,用固定注视特征统计描述、共关联矩阵与共识投票整合多种聚类,并进一步比较共识子空间聚类和谱双聚类。结果显示,图像刺激分组在方法间较稳定,呈现环境式与焦点式观看差异;用户分组则明显依赖图像语境,MIT1003 与 EMOd 表现出不同模式。

CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion Figure 1
2026-06-30cs.CV

CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion

Pan Wang, Yihao Hu, Xiujin Liu

2026-06-30视觉感知

针对盲去模糊中空间变化退化难建模、语义边界与真实纹理易被混淆的问题,CogSENet将恢复过程改为语义对齐的动态重建:用语义路由的状态空间扫描建模长程依赖,以小波高低频分解显式融合结构与细节,并结合连续模糊场和CLIP先验调制深层特征。实验显示其在去模糊质量和结构保真度上优于多种SOTA且参数更少,并可迁移到去雾、去雨和降噪任务。

Cross-Modal Iteration Distillation for Robust IHD Screening: The IDNet Framework and A New Benchmark Figure 1
2026-06-30cs.CV

Cross-Modal Iteration Distillation for Robust IHD Screening: The IDNet Framework and A New Benchmark

Yongchang Gao, Junjie Pang, Shuaiyu Yang, Yusheng Yang, Xichao Jia, Shaojie Li, Hongfei Zhang, Jia Mu

2026-06-30数据集/基准安全鲁棒

本文面向低成本缺血性心脏病筛查,针对眼底图像与少量临床变量难融合、公开基准不足的问题,提出IDNet:用滑窗MIL提取双眼眼底特征,并以可学习查询的CDA顺序蒸馏左右眼和临床信息。作者还构建UK Biobank基准,IDNet优于单模态和常见多模态基线,外部队列AUC达0.8965,但部分增益可能来自数据质量与高分辨率成像。

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs Figure 1
2026-06-30cs.CV

MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs

Yuxuan Fan, Gyusik Seo, Jing Hao, Jaemin Cho, Mohit Bansal, Jaehong Yoon

The University of Hong Kong, Johns Hopkins University

2026-06-30数据集/基准

MuseBench针对现有多模态大模型评测偏重“看见什么”、缺少“为何这样表达”的问题,构建面向影视、静态视觉、舞台表演和游戏艺术的意图级视听艺术理解基准。其创新在于从视频 essay 中抽取专家解读,结合单选与可变多选、对抗干扰项和机会校正/集合式评分来刻画多重合理解释。28个MLLM零样本评测中最佳仅48.29%,显著低于专家87.18%,且在游戏艺术与多选召回上短板明显,说明瓶颈更像艺术语汇和文化先验不足,而非关键帧定位。

IBRSteG: Learning a Generalizable Steganography Framework for 3D Gaussian Splatting Figure 1
2026-06-30cs.CV

IBRSteG: Learning a Generalizable Steganography Framework for 3D Gaussian Splatting

Fanye Kong, Hongyu Xia, Yu Zheng, Boyang Gong, Jie Zhou, Jiwen Lu

2026-06-30生成模型三维

面向3DGS资产公开传输中秘密场景易被拦截、现有方法需按场景优化且泛化差的问题,IBRSteG将3D隐写建模为前馈高斯属性嵌入:用GAS在结构化GAM上把秘密场景属性注入封面场景,避免逐场景微调。实验覆盖DyNeRF、ENeRF、DTU和THuman_MV,显示其在视觉质量、嵌入容量和抗隐写分析安全性上优于既有3DGS隐写方法,但大规模复杂场景表现受底层重建骨干限制。

Uncertainty Estimation in Pathology Foundation Models via Deep Mutual Learning Figure 1
2026-06-30cs.CV

Uncertainty Estimation in Pathology Foundation Models via Deep Mutual Learning

Gbègninougbo Aurel Davy Tchokponhoue, Sevda Öğüt, Ali Idri, Dorina Thanou, Pascal Frossard

2026-06-30安全鲁棒

病理基础模型虽能迁移到全切片分析,但缺少可信置信度且不同模型在任务间表现不稳定。论文提出 DICE,将多个冻结 PFM 作为专家集成,用深度互学习和 Gramian 约束对齐,使残余分歧成为不确定性信号,并给出上界解释。实验在 PANDA、CAMELYON16/17 上显示,其能更好标记易错与 OOD 样本,同时保持或提升分类、校准和弱监督病灶定位表现。

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data Figure 1
2026-06-30cs.CV

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

2026-06-30视觉语言视觉感知

针对现有舞蹈视频生成难以同时保证音乐对齐、动作表现力和视觉质量的问题,OmniDance一方面构建含30万片段、400小时以上的CIPE-Dance互联网数据集,另一方面在TI2V视频基础模型中以分层音乐交叉注意力、由易到难课程学习和模态专门CFG注入音乐条件。实验显示其在文本、音乐及二者联合驱动生成上均优于既有方法,但增益可能主要来自数据规模与框架协同。

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting Figure 1
2026-06-30cs.CV

Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting

Xiaobiao Du, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Xin Yu

2026-06-30强化学习三维

这篇论文针对移动端部署 3D Gaussian Splatting 时高阶球谐带来的存储、带宽和推理开销,以及单视角稠密化产生冗余高斯的问题,提出 Flux-GS:用蒙特卡洛镜面能量聚合将三阶辐射残差压缩到低阶表示,并用属性条件 SH 增强在推理前烘焙细节,同时采用多视角 alpha 引导稠密化与剪枝。实验显示其在接近 3DGS/Mobile-GS 画质下减少参数和高斯数量,并在 Snapdragon 8 Gen 3 与 WebGL 场景中提升移动端帧率。

Shell-Supervised Gaussian Splatting for Urban Real-to-Sim Reconstruction Figure 1
2026-06-30cs.CV

Shell-Supervised Gaussian Splatting for Urban Real-to-Sim Reconstruction

Yuan Yang, Peijun Lu, Fangzhou Lu, Sai Fan, Siqi Yan, Chenyuan Zhang, Haobo Liang, Yichen Wang

Hong Kong Center for Construction Robotics, Tsinghua University

2026-06-30三维

面向具身智能的真实到仿真重建,论文指出城市近景立面虽可被3DGS逼真渲染,但玻璃、反射和弱纹理会导致几何不稳定,影响碰撞与导航。其核心做法是将轻量外立面结构壳对齐到视频重建坐标系,渲染深度、法线和有效掩码,并用掩码门控损失监督Gaussian优化,只约束壳支持区域。实验在匿名立面序列上显示,相比纯照片、单目先验和2DGS,立面朝向与可见表面点云一致性更好,RGB渲染质量基本保持;但未验证下游仿真或导航效果。

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy Figure 1
2026-06-30cs.CV

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

2026-06-30生成模型

体显微成像常因轴向分辨率低而产生结构失真,自监督 ASR 又在过平滑、扩散幻觉和推理慢之间摇摆。SkelEM 的关键洞察是先用冻结拓扑网络提供确定性结构骨架,再用与其训练信号解耦的扩散精修器补高频细节,并借真实稀疏切片的循环一致性提取残差先验,将反向扩散截断到不超过 5 步。实验显示其在公开数据和新 BRAVE-ASR 跨仪器基准上取得较好的保真-感知折中、领先的膜分割下游表现,并能零样本迁移到不同显微模态。

GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising Figure 1
2026-06-30cs.CV

GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising

Yi He, Jiangming Wang, Xinyu Wang, Mark Fong, Songchun Zhang, Yuxuan Xue, Hai-Tao Zheng, Yue Ma

Shenzhen International Graduate School, Tsinghua University, Pengcheng Laboratory, Sun Yat-sen University, Peking University, University of Tübingen

2026-06-30视觉感知

GeoEdit针对单张照片中物体平移、旋转、缩放时易破坏透视、产生残影和背景模糊的问题,将编辑先提升到3D中完成物体与场景解耦、配准和渲染,再用双分支去噪在前景注入方差匹配的几何约束、让背景自由生成。文中在GeoEditBench及人类/VLM评测中显示,其几何准确性、身份保持和背景质量均优于现有2D编辑与部分3D感知方法。

SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset Figure 1
2026-06-30cs.CV

SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset

Ariel Gjaci, Antonio Sgorbissa, Vittorio Murino

2026-06-30数据集/基准

针对共语手势生成常忽视文化差异、且文化效果可能被说话人个人风格混淆的问题,SICAGE将每位说话人视为域,用对抗学习或Fishr学习说话人无关但保留文化判别力的音频/文本嵌入,并接入实时扩散生成器ALaDiT。作者还构建106小时、764人的TED4C-L数据集;实验显示在说话人不重合设置下,方法提升动作真实感、多样性、节拍同步、语义相关性和文化一致性。

Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation Figure 1
2026-06-30cs.CV

Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation

Shuitsu Koyama, Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Daichi Yashima, Komei Sugiura

Keio University

2026-06-30视觉语言视觉感知数据集/基准

本文针对图像/视频字幕自动评测与人工判断不一致的问题,指出 LLM-as-a-Judge 用大词表 LM head 预测少量序数分数会引入无关 token 噪声。Rigel 通过自蒸馏得到任务专用评分头,再用人工评分微调骨干,并构建 Vid-Lepus 数据集;多基准上相关性优于现有指标,ActivityNet-Fact 无参考设置提升超过 10 点。

A multi-architecture study of specificity refinement and false-positive mechanism analysis in prostate MRI Figure 1
2026-06-30eess.IV

A multi-architecture study of specificity refinement and false-positive mechanism analysis in prostate MRI

Yongbo Shu, Kewen Chen, Yifeng Yuan, Zirui Xin, Luo Lei, Yang Yang, Xi Chen, Aijing Luo

(1) The Second Xiangya Hospital of Central South University, Changsha, Hunan 410011, China, (2) School of Life Sciences, Central South University, Changsha, Hunan 410013, China, (3) Hunan Provincial Key Laboratory of Medical Information Research (Central South University), (4) Hunan Provincial Clinical Medical Research Center for Cardiovascular Intelligent Medicine, both analyses on Prostate158 [5] and report what works, where center-specific effects limit the claim, This study analyzed de-identified multiparametric prostate MRI from two publicly available, in-

2026-06-30视觉感知

这篇论文针对前列腺 MRI AI 检测高敏感度下假阳性难以处理的问题,分析其是否源于模型伪影,并尝试在冻结检测骨干后加轻量后处理头提升特异性。核心洞察是假阳性在证据表征和 T2/ADC 原始对比上更像真癌灶而非良性组织,跨五种架构均复现,可能主要来自数据层面的影像相似性;轻量 refinement 在 PI-CAI fold-0 将特异性提升 17.2% 且保持敏感度,但五折结果有条件性,外部集增益不明显。

Learning Efficient 4D Gaussian Representations from Monocular Videos with Flow Splatting Figure 1
2026-06-30cs.CV

Learning Efficient 4D Gaussian Representations from Monocular Videos with Flow Splatting

Shengjun Zhang, Jinzhao Li, Xin Fei, Yueqi Duan

Tsinghua University, National University of Singapore

2026-06-30视觉感知生成模型三维

这篇工作针对单目视频动态三维重建中训练慢、渲染慢、4D 表示易退化为逐帧重建的问题,提出 Flow Splatting:从带时变均值和协方差的 4D Gaussian 中构造速度场,并将其 splat 成光流作为稠密运动监督,同时加入初始化与速度一致性约束。实验显示其在 DAVIS、NVIDIA 动态场景上相较已有方法取得更高图像质量、更短训练时间和更快渲染速度。

Variance Reduction on the Camera Axis: Multi-View Score Distillation for 3D Figure 1
2026-06-30cs.CV

Variance Reduction on the Camera Axis: Multi-View Score Distillation for 3D

Marian Lupascu, Mihai Sorin Stupariu, Ionut Mironica

Department of Computer Science, University of Bucharest, Romania

2026-06-30三维

本文针对文本到3D得分蒸馏中单视角梯度方差大、收敛慢且易产生 Janus 视角不一致的问题,提出 MV-SDI:在不重训2D扩散先验、不增加峰值显存的前提下,每步聚合多组反向对跖相机视角梯度,把问题视为相机轴采样方差缩减。43提示基准上,固定1万次UNet调用时 K=2 将 R-Precision 从74.8%提升到83.8%,CLIP从0.297到0.312,并将优化步数减半。

Explainability-Aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors Figure 1
2026-06-30cs.CV

Explainability-Aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors

Chengzeng You, Binbin Xu, Soteris Demetriou

2026-06-30三维

本文关注自动驾驶中 LiDAR 三维检测器为何容易被少量空间扰动击穿。作者用 SALL 聚合 Integrated Gradients,构造跨场景、类别级的通用显著性图,并据此提出 EFA 只攻击最关键视锥。KITTI、nuScenes 上对 PointPillars、SECOND 的实验显示,EFA 可使召回下降超过 15 个百分点,同时比非显著性感知基线少扰动 25%–50% 视锥,揭示检测证据集中带来的结构性脆弱性。

Exploiting Local Flatness for Efficient Out-of-Distribution Detection Figure 1
2026-06-30cs.LG

Exploiting Local Flatness for Efficient Out-of-Distribution Detection

Seonghwan Park, Hyunji Jung, Dongyeop Lee, Namhoon Lee

Korea Electronics Technology Institute (KETI), Pohang University of Science and Technology (POSTECH), data, i.e., samples drawn from distributions whose label sets are disjoint from those, modern deep networks. Although several scalable approximations have been proposed

2026-06-30视觉感知

这篇论文针对后验式 OOD 检测中曲率方法计算代价高、且缺少对 ID/OOD 平坦性差异验证的问题,系统观察到 OOD 样本的 Hessian 曲率更大且分布偏移越强差距越明显。作者据此提出 FOLD,用特征 Hessian 与部分特征归一化放大可分性,并用 AUTOFOLD 通过 ID logit masking 自监督调参;实验显示平均 AUROC 提升 1.63%、FPR95 降低 2.30%,计算开销接近一次前向传播。

Scene-aware Prediction of Diverse Human Movement Goals Figure 1
2026-06-30cs.CV

Scene-aware Prediction of Diverse Human Movement Goals

Qiaoyue Yang, Amadeus Weber, Magnus Jung, Ayoub AI-Hamadi, Sven Wachsmuth

2026-06-30视觉感知

面向机器人协作与导航中需要提前避让/配合人的需求,本文关注仅凭当前RGB场景和人体姿态预测人可能走向何处。核心做法是用CVAE建模目标的不确定性,通过潜空间采样生成多个场景一致的未来目标热图/区域,而非依赖语义地图或只预测交互物体。实验在GTA-IM与PROX上显示其多目标样本优于确定性基线,并具备跨场景泛化;但有效采样仍未完全受控。

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation Figure 1
2026-06-30cs.RO

Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation

Shengqi Xu, Guojin Zhong, Yang Liu, Fanjie Wang, Hu Luo, Hanyu Zhou, Weiyao Zhang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI, 3NeoteAI, School of Computing, National University of Singapore

2026-06-30强化学习

面向精密插入、擦拭等接触丰富操作,论文指出光学触觉的原始图像和累计光流难区分“接触/释放”等细粒度状态。核心洞察是瞬时运动与累计运动的方向相关性可显式表征接触状态与力度,并将其作为TMC表示,结合Mixture-of-Transformers构建保留模态特性的视觉-触觉策略。四个真实操作任务及消融显示,该方法较常见触觉表示和融合方式更稳健,但极端视觉扰动和物体位置变化下泛化仍有限。

Latent-CURE for Breast Cancer Diagnosis Figure 1
2026-06-30cs.CV

Latent-CURE for Breast Cancer Diagnosis

Weiyi Zhao, Xiaoyu Tan, Lu Gan, Liang Liu, Xihe Qiu

2026-06-30视觉感知

针对乳腺超声多模态大模型在良恶性样本失衡下易走捷径、缺乏临床推理的问题,Latent-CURE把开放生成改为潜空间检索,并按BI-RADS描述符构建隐式CoT,再用Dual-ASL保护罕见恶性特征。实验显示其准确率93.78%、特异性97.16%、MCC 87.07%,优于多种LMM和消融基线。

DCGrasp: Distance-aware Controllable Grasp Generation Figure 1
2026-06-30cs.CV

DCGrasp: Distance-aware Controllable Grasp Generation

Hiroyasu Akada, Jesús Pérez, Emre Aksan, Vasileios Choutas, Cristian Romero, Alberto Garcia-Garcia, Vladislav Golyanik, Christian Theobalt, Thabo Beeler

Max Planck Institute for Informatics, SIC

2026-06-30规划控制

面向机器人抓取、AR/VR 等场景中对可控性和跨物体泛化的需求,DCGrasp 将手—物交互抽象为近接触区域的带符号距离 Profile,并用距离感知权重弱化无关远距离区域;再由 Diffusion Transformer 联合生成目标 Profile 与初始手姿,并通过能量优化细化接触。实验显示其在未见物体、尺度变化和极端手形下保持低穿透、稳定接触,并能较准确跟随方向与根距离控制信号。

H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning Figure 1
2026-06-30cs.CV

H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

Eric Peh, Debaditya Roy, Basura Fernando

Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore, Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore, Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur, India, College of Computing and Data Science, Nanyang Technological University, Singapore

2026-06-30强化学习

这篇论文针对VLM在视觉问答中虽答对却可能依赖捷径、缺乏可验证视觉证据的问题,提出将推理拆成“子问题—子答案—证据框”三元组,并用匈牙利匹配构造置换不变的H-GRPO奖励,避免固定步骤顺序惩罚合理推理。实验显示该方法在定位和空间推理任务、RoboSpatial等OOD基准上提升鲁棒性与可解释性,但在知识密集任务上增益有限,说明过程级 grounding 不能替代模型本身知识能力。

Traffic-CBM: A Structurally Interpretable Multimodal Framework for Encrypted Traffic Classification Figure 1
2026-06-30cs.CV

Traffic-CBM: A Structurally Interpretable Multimodal Framework for Encrypted Traffic Classification

Honglei Jin, Wenshuo Chen, Shaofeng Liang, Haozhe Jia, Menshuo Zhao, Shuxu Jin, Songning Lai, Yutao Yue

Shandong University, Shandong University Qingdao China

2026-06-30视觉语言

针对加密流量分类中多模态特征被黑箱融合、难以判断模型依赖何种证据的问题,Traffic-CBM 将流统计、时序子空间和字节模式组织为层级概念空间,并区分包内与跨包字节概念。实验显示其在六个基准上取得较均衡的 Macro-F1、跨数据集稳定性和模型规模,同时提供概念贡献、交互与充分性分析;但具体相对增益幅度在片段中未充分说明。

StrucTab: A Structured Optimization Framework for Table Parsing Figure 1
2026-06-30cs.CV

StrucTab: A Structured Optimization Framework for Table Parsing

Gengluo Li, Shangpin Peng, Chengquan Zhang, Binghong Wu, Hao Feng, Weinong Wang, Pengyuan Lyu, Huawen Shen, Xingyu Wan, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

2026-06-30优化算法

针对现有 VLM 表格解析过度依赖最终序列监督、缺少显式结构推理且 RL 奖励不稳定的问题,StrucTab 将解析拆为行列计数、合并单元格分析与 HTML 生成等步骤,并用 Uni-TabRL 的有效性、结构、内容分解奖励优化。论文还构建 TableVerse-5K,实验显示其在公开基准和该新基准上均达到或超过现有方法。

LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion Figure 1
2026-06-30cs.CV

LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion

Tianyi Zhang, Wei Shan, Yuan Zong, Tianhua Qi, Wenming Zheng

2026-06-30视觉语言视觉感知

本文针对异步视频面试中仅用文本会忽略非语言线索、用整脸或稀疏帧又易丢失表情时序的问题,提出将面部动作单元序列转成可解释文本,再与回答文本经 LLM 语义融合,并用轻量回归头预测人格分数。AVI-6 实验显示其相较多数基线降低误差、提高与人工评分的相关性,说明 AU 语义能补充受访者文本信息。

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders Figure 1
2026-06-30cs.LG

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

Chungpa Lee, Jihoon Kwon, Kyle Min, Jy-yong Sohn

which limits their interpretability and controllabil-, *Equal contribution 1Yonsei University, Korea 2Seoul National, University, Korea 3Oracle, USA. Correspondence to: Jy-yong

2026-06-30视觉感知

本文关注视觉语言模型联合嵌入中,稀疏自编码器为何会把同一概念在图像和文本中分到不同潜变量。核心洞察是“跨模态特征异质性”:语义对应不等于方向一致,强行对齐激活会损害重构。作者改为分别训练图像/文本 SAE,再用共激活后验匹配特征,在多种 VLM 与 MS-COCO 上提升重构、跨模态检索和概念 steering。

Building artificial intelligence virtual tissue (AIVT) for tissue state representation, feature prediction, and dynamic simulation Figure 1
2026-06-30cs.CV

Building artificial intelligence virtual tissue (AIVT) for tissue state representation, feature prediction, and dynamic simulation

Qiqi Lu, Qianjin Feng, Shaoqun Zeng, Shenghua Cheng

School of Biomedical Engineering, Southern Medical University, Guangzhou, China., Guangdong Provincial Key Laboratory of Medical Image Processing, Southern Medical University, Guangdong Province Engineering Laboratory for Medical Imaging and Diagnostic Technology, Southern, Medical University, Guangzhou, China., MOE Key Laboratory for Biomedical Photonics, Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology, Wuhan, China.

2026-06-30视觉感知

为克服传统规则化组织模型难以刻画空间多模态、多尺度组织复杂性的局限,论文提出人工智能虚拟组织 AIVT:以潜在组织状态空间统一表示分子、形态与空间结构,并保持可解码、可操控。其主要结果是系统界定四个基本假设和三类能力,包括组织状态分析、跨模态特征预测及发育、疾病和扰动下的时空动态模拟;但文中以概念框架为主,实证性能与增益来源未充分说明。

IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation Figure 1
2026-06-30cs.CV

IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation

Chaoyi Shi, Shanshan Zhang, Jian Yang

PCA Lab, School of Computer Science and Engineering, Nanjing University of, PCA Lab, School of Intelligence Science and Technology, Nanjing University

2026-06-30视觉感知

本文针对定制人像生成中真实身份被复现带来的隐私与合规风险,研究按用户请求“遗忘”特定身份的问题。核心思路是不微调整个扩散模型,而只更新图像编码器,并通过 Face-Swap 对离线定位身份相关特征维度,仅在这些维度做局部扰动,以避免全局特征扰动损害保留身份的生成质量。实验显示 IREU 在 CelebA-HQ 上比基线和相关身份遗忘方法更好地压制目标身份,同时保持其他身份保真度,且遗忘后的编码器可迁移到共享编码器的不同 CPG 管线。

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving Figure 1
2026-06-30cs.CV

LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving

Chen Yang, Yuhao Wei, Ze Xu, Ziheng Zou, Shuang Liang, Delin Ouyang, Lingfeng Qi, Jie Li, Guofa Li

Chongqing University, be made publicly available.

2026-06-30视觉语言视觉感知强化学习规划控制

LWDrive针对VLM直接输出轨迹几何精度不足、缺少未来动态和多视角约束的问题,将VLM轨迹视为意图级粗规划,而非最终控制结果;其核心是用未来帧生成监督增强层级隐藏状态,再通过FCP结合多层VLM特征、历史状态与BEV信息逐步细化候选轨迹。论文在NAVSIM/NAVSIM-v2上分别达到92.0和89.6,但相对增益的具体来源仍需更多消融支撑。

SUMO: Segment and Track Any Motion with Nonlinear State Space Models Figure 1
2026-06-30cs.CV

SUMO: Segment and Track Any Motion with Nonlinear State Space Models

Kexin Tian, Sixu Li, Keshu Wu, Yang Zhou, Zhengzhong Tu

Texas A&M University

2026-06-30视觉感知

这篇论文针对 VOT 与运动目标分割在遮挡、形变和突变运动下仅依赖视觉线索易失稳的问题,将 SAM2 式视频分割与受机器人学启发的非线性状态空间模型结合。核心是提出 Selective Unscented Filter,在无显式传感器观测时融合动力学预测与掩码解码结果,并用联合评分和记忆帧筛选维持时序一致性。实验称 SUMO 在 VOT 和 MOS 多个基准上达到 SOTA,但具体增益来源仍需结合消融细节判断。

RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs Figure 1
2026-06-30cs.CV

RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs

Yeeun Seong, Doyi Kim, Minseok Seo, Changick Kim

2026-06-30视觉感知

这篇论文针对降水预报中固定离散时间步难以兼顾高时间分辨率、长期一致性与计算成本的问题,将雷达降水演化建模为潜空间连续时间动力系统。RainODE用Latent Neural ODE捕捉大尺度平流运动,并以Brownian Bridge随机源模块补偿局地增长、衰减等非平流细节。实验在SEVIR和新RAPID数据集上显示,其在多种时间间隔、降水强度和最长6小时预报中取得更稳定且更清晰的结果。

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction Figure 1
2026-06-30cs.CV

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

Harbin Institute of Technology (Shenzhen)

2026-06-30视觉感知

本文针对具身智能中“语言指令到像素点”的视觉指向问题,指出现有 VLM 在可控方向、计数和一次性坐标预测上受数据与状态传播限制。核心做法是用智能体合成语义与锚点相对数据,结合 AttnRes 跨层注意力和 ABC 视觉化坐标纠正,并按类别路由专家模型。系统在 PointArena 2026 达到 77.2% 总准确率、排名第二,但计数和可控指向仍有明显空间。

See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs Figure 1
2026-06-30cs.CV

See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs

Yuqing Lei, Wenbo Lyu, Yingjun Du, Xiantong Zhen, Cees G.M. Snoek, Ling Shao

University of Chinese Academy of Sciences, University of Amsterdam, United Imaging Healthcare Co., Ltd., small tilts. Code is available at https://github.com/Iris1946/CAI.

2026-06-30视觉语言

本文针对 LVLM 在生成中因语言先验压过视觉证据而产生对象幻觉的问题,提出训练无关的 CAI:先用早层表示估计每个 token 该看图像的哪些区域,再只在深层、高熵的不确定 token 上轻量调整注意力,避免全局增强视觉带来的干扰。实验覆盖 LLaVA、InstructBLIP、Qwen-VL 与多项幻觉基准,显示 CAI 在无需对比解码时已稳定优于常规推理和均匀增强方法,加入对比解码还能进一步提升,但对低熵的“自信幻觉”仍可能失效。

Bricker to BRACE: A Bracket Exposure RAW Dataset and Restoration Model for Flicker-Banding Figure 1
2026-06-30cs.CV

Bricker to BRACE: A Bracket Exposure RAW Dataset and Restoration Model for Flicker-Banding

Zihan Zhou, Libo Zhu, Jue Gong, Zhiyi Zhou, Jiezhang Cao, Yong Guo, Yulun Zhang

Shanghai Jiao Tong University

2026-06-30数据集/基准

这篇论文针对手机拍摄屏幕时滚动快门与显示调光耦合导致的闪烁条纹,指出单帧方法难以区分真实纹理与伪影,而不同曝光下条纹形态会变化、内容相对稳定。作者构建合成与真实多曝光 RAW 数据集 Bricker,并提出结合频率先验与跨曝光空间注意力融合的 BRACE,同时引入 SFC 指标;实验显示其在合成和真实基准上优于既有方法,主要价值在于把闪烁条纹去除从单帧建模推进到多曝光 RAW 恢复范式。

Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets Figure 1
2026-06-30cs.CV

Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets

Kaifeng Chen, Lechao Cheng, Jiyang Li, Shengeng Tang, Fan Zhang, Yantao Pan, Yaxiong Wang, Tuanrui Hui, Zhun Zhong

Hefei University of Technology, Jianghuai Advance Technology Center, Anhui Provincial Key Laboratory of Humanoid Robots, Kaiyang Laboratory, Chery, Zhejiang University of Technology, label remedies (sample selection, loss weighting, label correction) tightly, noise and preserves transferable knowledge without relabeling or clean, representations under noisy supervision. The framework is robust, label-, Keywords: Dataset Distillation · Learning with Noisy Labels · Trajec-, which severely limits their reliability in real-world noisy-label environments., tional noisy-label learning techniques—such as sample selection [23, 28, 51], loss, weighting [24, 45], and label correction [30, 33]—attempt to identify and mitigate

2026-06-30规划控制安全鲁棒

本文针对噪声标签下数据集蒸馏容易把错误关联一并压缩、导致小型合成集鲁棒性下降的问题,提出轨迹匹配式鲁棒蒸馏框架:用SGR结合遗忘模式与KNN邻域一致性重加权教师轨迹,再用TIAT从教师中间动态提取辅助目标补充监督。实验称在对称、非对称和真实噪声设置下均优于现有DD基线,且无需重标注或干净子集。

HomeDiffusion: Zero-Shot Object Customization with Multi-View Representation Learning for Indoor Scenes Figure 1
2026-06-30cs.CV

HomeDiffusion: Zero-Shot Object Customization with Multi-View Representation Learning for Indoor Scenes

Guoqiu Li, Jin Song, Yiyun Fei

2026-06-30生成模型

针对室内电商家具等对象定制中单视角参考难以保持非对称物体细节与场景透视一致的问题,HomeDiffusion用多视角家具/室内数据学习对象表示,结合HD视觉编码器、MORL与BOCL,并在潜空间做像素对齐交叉注意力以保真细节;在自建ZOC-Indoor-Eval和Viton-HD上优于多种零样本/少样本方法,但具体增益与数据规模的关系仍需进一步辨析。

Learning Cross-view Correspondences for Geo-localization on Planetary Surfaces Figure 1
2026-06-30cs.CV

Learning Cross-view Correspondences for Geo-localization on Planetary Surfaces

Hong Minh Nguyen, Marcus Märtens, Tat-Jun Chin

AI for Space Group, Adelaide University, Australia

2026-06-30视觉感知

针对行星表面无 GNSS 且里程计会漂移的问题,论文把地面全景与轨道俯视图匹配建模为跨视角检索,并用 PANGU 基于月球高程模型构建 10438 个合成全景及一对一/瓦片式基准。实验从零训练 TransGeo,显示学习式方法可在模拟月面学到有效对应;但邻近瓦片区分仍难,光照方位变化会显著降准确率,真实图像迁移仍文中未充分说明。

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis Figure 1
2026-06-30cs.CV

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov

2026-06-30视觉感知生成模型

该文针对掩码离散扩散在高分辨率文生图中缺乏已生成 token 自纠错能力、且大码本训练信号稀疏的问题,提出 NLD-Image:在训练与采样中加入 token editing,使已解码 token 可被迭代修正,并用分组交叉熵为嵌入空间邻近码字提供辅助监督,另实现融合算子降低显存。实验显示其在 1024px 文生图上达到 GenEval 0.90、DPG 86.9、HPSv3 10.76,GCE 在 ImageNet256 消融中优于 CE/SNCE。

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning Figure 1
2026-06-30cs.CV

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Kening Zheng, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

HKUST (GZ), 2HKUST, 3OPPO AI Center, 4UIC, while preserving the standard GRPO learning signal when no valid consistent pair is available.

2026-06-30视觉语言安全鲁棒

这篇论文针对多模态大模型在RLVR/GRPO训练中只奖励单视图正确性、忽略等价视觉变换下答案稳定性的问题,提出ConsistRoll:把原图与语义不变变换图放入同一rollout组,并仅在两视图答案均正确且一致时给予联合奖励,从而把跨视图一致性变成在线信用分配信号。实验在14个数学逻辑、通用理解和幻觉评测上验证,Qwen2.5-VL 3B/7B及GRPO、Hint-GRPO设置下均有稳定增益。

Rethinking Forgery Attacks on Semantic Watermarks in Black-Box Settings: A Geometric Distortion Perspective Figure 1
2026-06-30cs.CR

Rethinking Forgery Attacks on Semantic Watermarks in Black-Box Settings: A Geometric Distortion Perspective

Cheng-Yi Lee, Yichi Zhang, Yuchen Yang, Chun-Shien Lu, Jun-Cheng Chen

Midjourney, Inc., 2025)., State University, PA, US. Correspondence to: Jun-Cheng Chen

2026-06-30视觉感知

本文针对语义水印在黑盒伪造攻击下为何成功或失败缺乏理论解释的问题,将攻击建模为潜空间中的率失真权衡,指出代理模型与目标模型不匹配会产生不可消除的失真下界;关键洞察是伪造痕迹并非随机噪声,而是潜流形上的全局漂移与局部形变。基于此,作者提出不依赖具体水印方案的预验证检测方法,实验显示其在多种黑盒伪造场景中能有效区分伪造样本,并保持对常见图像扰动的鲁棒性。

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation Figure 1
2026-06-30cs.CV

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

OPPO AI Center

2026-06-30视觉语言优化算法

本文针对多模态大模型在视觉证据弱或反常时更信语言先验而产生幻觉的问题,提出OPPO:利用模型注意力定位与强化查询相关区域,构造强、锚定、弱证据的有序视觉偏好链,并加入span/token级正则,使可信答案的偏好随证据强度变化。实验称其在幻觉与通用基准上优于DPO等方法,但具体增益与数据构造细节仍需进一步验证。

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling Figure 1
2026-06-30cs.CV

Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling

Yoonseok Choi, Chaeyoung Oh, Hyunjun Choi, Seokin Seo, Kee-Eung Kim

†Work done while at KAIST. 1Kim Jaechul Graduate School of, AI, KAIST, Daejeon, Republic of Korea 2Center for Humanoid, ), where labels are discrete and unambiguous, it is less

2026-06-30生成模型安全鲁棒

本文针对文本到图像扩散模型在对抗提示下仍会生成裸露、暴力或特定风格等禁用概念的问题,指出固定负提示容易在安全性与保真度间失衡,而后验动态引导在开放词表场景不稳定。作者提出训练无关的 CRG,从扩散过程中的噪声预测与一步 clean 预测估计目标概念存在度,并用闭式约束更新自适应调节负引导强度。红队实验显示其降低攻击成功率,同时较好保持正常提示的图像质量,并可迁移到艺术家风格和暴力等移除目标。

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras Figure 1
2026-06-30cs.CV

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras

Yipeng Zhu, Huajian Huang, Tristan Braud, Sai-Kit Yeung

2026-06-30三维

这篇论文针对现有 3DGS 在透视、鱼眼、全景等相机间依赖专用投影与光栅化、导致采样不均和跨相机泛化差的问题,提出在单位球面上用 HEALPix 等面积网格统一表示并直接进行高斯 splatting,同时推导球面域前向/反向传播并设计 HEALPix-aware SSIM。实验显示其在多种相机模型下提升球面重建指标和跨相机一致性,同时保持较有竞争力的平面渲染质量。

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments Figure 1
2026-06-30cs.CV

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

Yirum Kim, Ue-Hwan Kim

2026-06-30强化学习三维

这篇论文针对现有开放词汇3D场景图偏物体级、难以支持机器人精细交互的问题,提出OP3DSG,将物体、可交互部件、空间/功能关系与可供性统一到同一图中。核心做法是用物体-部件知识约束候选检测,结合多视角细粒度3D融合,并以几何先验约束LLM关系 refinement,降低穷举推理和幻觉。作者还构建UniGraph3D基准,实验显示其在部件 grounding、多层关系预测及语言查询、导航、任务规划等下游任务中优于已有方法。

FalconTrack: Photorealistic Auto-Labeled Perception and Physics-Aware Vision-Based Aerial Tracking Figure 1
2026-06-30cs.RO

FalconTrack: Photorealistic Auto-Labeled Perception and Physics-Aware Vision-Based Aerial Tracking

Yan Miao, Karteek Gandiboyina, Noah Giles, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Sayan Mitra

2026-06-30视觉感知

FalconTrack面向GPS受限场景中无人机仅靠视觉稳定跟踪多类目标的难题,关键在于用Gaussian Splatting从短视频自动生成逼真且带mask、类别和6-DoF位姿的训练数据,并将多头感知与类别条件动力学EKF结合。实验显示其约20分钟生成1万张标注图,零样本实机类别准确率达96–100%,机载约25Hz闭环跟踪在F1-tenth和门目标上成功率100%,优于仅按mask中心跟踪的基线。

Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration Figure 1
2026-06-30cs.CV

Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration

Jaewon Lee, Mangyu Kong, Euntai Kim

2026-06-30三维

面向大规模机器人建图和长期地图维护中多个独立 3DGS 场景难以对齐、直接合并易产生空洞和漂浮物的问题,Graph-GSReg 将 3DGS 渲染与几何语义信息抽象为 3D 场景图,把配准转化为图匹配并用最大团筛除错误对应,再以自监督测试时优化细化合并后的高斯。文中在真实与合成基准上展示了有竞争力的配准精度和更好的合并场景渲染质量。

UrbanCDNet: Appearance-Robust and Boundary-Aware Bitemporal Change Detection for Korean Urban Building Monitoring Figure 1
2026-06-30cs.CV

UrbanCDNet: Appearance-Robust and Boundary-Aware Bitemporal Change Detection for Korean Urban Building Monitoring

Abdirashid Omar, Jonghyuk Park

Department of Data Science, Graduate School of Kookmin University

2026-06-30视觉感知学习理论安全鲁棒

针对韩国城市双时相航拍中建筑变化稀疏、光照外观差异大且需贴合建筑边界的问题,UrbanCDNet采用孪生CNN,将多线索归一化时序比较、中尺度对齐差分、轻量上下文校准与训练期边界监督结合。其在修正AIHub基准上取得0.7511 F1、0.6014 IoU,优于Siamese U-Net和ChangeFormer,增益主要体现在稀疏变化、高光度差和边界定位场景。

TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging Figure 1
2026-06-30cs.CV

TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging

Guangyu Meng, Pengfei Gu, Xueyang Li, Yiyu Shi, Erin Wolf Chambers, Danny Z. Chen

Dept. of Computer Science and Engineering, University of Notre Dame, Notre, Dept. of Computer Science, The University of Texas Rio Grande Valley, Edinburg

2026-06-30视觉感知

医学图像中的拓扑特征依赖描述子选择,现有做法常固定单一描述子,难以适配不同形态且需要专家反复试错。TopoAgent将LLM代理的感知、推理、工具调用与反思闭环用于自动选择并配置拓扑描述子,并用26个数据集蒸馏经验和构建TopoBenchmark。实验报告平均平衡准确率68.21%,较最强基线高9.32%,也明显优于同工具的通用LLM。

MR-IQA: A Unified Margin View of Regression and Ranking for Blind Image Quality Assessment Figure 1
2026-06-30cs.CV

MR-IQA: A Unified Margin View of Regression and Ranking for Blind Image Quality Assessment

Yuan Li, Youyuan Lin, Zitang Sun, Yung-Hao Yang, Kiyofumi Miyoshi, Chenhui Chu, Shin'ya Nishida

Graduate School of Informatics, Kyoto University

2026-06-30视觉感知

针对盲图像质量评价中回归重绝对分数、排序重相对偏好但二者关系缺乏解释的问题,论文提出“质量边际”视角,指出两类监督本质上都在拟合成对质量差,并据此设计基于强化学习的 MR-IQA,直接奖励预测分数差与 MOS 差的一致性。六个 BIQA 基准和受控对比显示,其平均 PLCC/SRCC 优于回归或排序式 RL 基线,但泛化到其他模型族仍文中未充分说明。

LEIQ-Assessor: Multi-dimensional Quality Assessment of Low-light Enhanced Images via Multi-task Learning Figure 1
2026-06-30cs.CV

LEIQ-Assessor: Multi-dimensional Quality Assessment of Low-light Enhanced Images via Multi-task Learning

Wei Sun, Yanwei Jiang, Dandan Zhu, Jinqiu Sang, Jikai Xu, Weixia Zhang, Guangtao Zhai

East China Normal University, 2 Shanghai Jiao Tong University

2026-06-30视觉感知

低光增强虽提升可见度,却常引入噪声放大、偏色、结构破坏和过曝,单一质量分数难以诊断问题。LEIQ-Assessor的核心是用SigLIP2 ViT共享表征,并以多任务方式同时预测MOS及亮度、色彩、噪声、曝光、自然度、内容恢复六项属性,用PLCC损失利用属性相关性。实验显示其在MLE基准上优于现有无参考IQA和手工指标,并获QoMEX 2026挑战赛第二名。

HTC-SGA Former: A Hybrid Transformer-CNN Network with Self-Guided Attention and a New Boundary-Weighted Adaptive Loss for Coronary DSA Vessel Segmentation Figure 1
2026-06-30cs.CV

HTC-SGA Former: A Hybrid Transformer-CNN Network with Self-Guided Attention and a New Boundary-Weighted Adaptive Loss for Coronary DSA Vessel Segmentation

Rayan Merghani Ahmed, Marwa Omer Mohammed Omer, Mohamed Elmanna, Shijie Li, Bin Li, Shoujun Zhoua

2026-06-30视觉感知学习理论

针对冠脉 DSA 中低对比细小血管、边界模糊和前景-背景极不均衡导致的断裂分割问题,本文提出轻量 HTC-SGA Former,用 CNN 编码局部形态、Transformer 解码全局上下文,并以 MS-GLWA、SGFA 和边界加权自适应损失强化弱血管与边界。私有左右冠脉数据上优于 14 种方法,且仅 0.81M 参数;但数据私有,泛化性仍需外部验证。

ScaleAware-JEPA: Latent Representation for Discovery in Multiscale Physical Fields Figure 1
2026-06-30cs.LG

ScaleAware-JEPA: Latent Representation for Discovery in Multiscale Physical Fields

Guang-Xing Li

2026-06-30视觉感知

本文针对连续物理场中结构跨尺度组织、但传统自监督固定图像 patch 预测与物理尺度不匹配的问题,提出 ScaleAware-JEPA:先用 CDD 分解出像素对齐的尺度成分,再让 JEPA 的掩码和预测上下文随扩散尺度变化。实验覆盖 MHD 湍流、星际分子气体和城市夜光,结果显示其可生成可回映到空间形态的稠密潜表示图谱,无需标签或预设分割规则。

AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World Figure 1
2026-06-30cs.CV

AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World

Zhongqiang Song, Guanying Chen, Yuqi Zhang, Yin Zou, Chuanyu Fu, Zhiyuan Yuan, Chuan Huang, Shuguang Cui, Xiaochun Cao

Sun Yat-sen University, Shenzhen Campus, Corresponding author. 1 Sun Yat-sen University, Shenzhen Campus

2026-06-30强化学习数据集/基准

这篇论文针对现有单目度量深度模型从街景/室内迁移到无人机航拍时尺度与视角域差明显的问题,提出 AerialMetric 基准:结合真实倾斜摄影、可控采集、合成场景和野外图像,提供约 52K 真实与 16K 合成深度对,并系统拆解俯仰、航高和 FOV 影响。实验显示主流模型在航拍场景鲁棒性不足,而用该数据微调后可显著提升航拍度量深度表现,增益可能主要来自更匹配的数据覆盖与监督。

Accurate Recognition of Pneumonia and COVID-19 by Geometric Shape Normalization of Lung Region using Automatic Landmark Detection and Piecewise Affine Warping Figure 1
2026-06-30cs.CV

Accurate Recognition of Pneumonia and COVID-19 by Geometric Shape Normalization of Lung Region using Automatic Landmark Detection and Piecewise Affine Warping

Salvador E. Ayala-Raggi, Rafael Alejandro Cruz-Ovando, Lauro Reyes-Cocoletzi, Aldrin Barreto-Flores

2026-06-30视觉感知

针对胸片肺炎/COVID-19识别易受体位、尺度和设备伪影影响的问题,论文用ResNet-18自动检测15个肺部标志点,并通过Procrustes标准形、Delaunay网格和分片仿射形变将肺区几何归一化,再分类。标志点平均误差3.61像素,归一化模型在COVID-19 Radiography Database上达98.60±0.26%准确率、98.00%宏F1;虽低于原图模型,但Grad-CAM和裁剪实验表明原图优势可能来自采集伪影,归一化相对更抗伪相关。

UniVAD v2: Unified Visual Anomaly Detection via Support-Conditioned Boundary Construction Figure 1
2026-06-30cs.CV

UniVAD v2: Unified Visual Anomaly Detection via Support-Conditioned Boundary Construction

Zhaopeng Gu, Bingke Zhu, Zhaowen Li, Guibo Zhu, Yingying Chen, Ming Tang, Peng Su, Jinqiao Wang

2026-06-30视觉感知学习理论

本文针对统一视觉异常检测在少样本迁移时难以为未见类别设定可靠、可调决策边界的问题,提出由正常支持集和可选异常参考共同构造边界的 UniVAD v2。其核心在于用最优传输关系建模补足局部检索的全局匹配能力,并自适应融合两类正常侧证据,再用异常参考提供拒绝侧约束。六个跨域数据集上,1N-shot 平均图像 AUC 从 UniVAD 的 83.0% 提升到 84.5%,加入 1 个异常样本后达 85.7%。

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots Figure 1
2026-06-30cs.AI

GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots

Sunqi Fan, Lingshan Chen, Runqi Yin, Qingle Liu, Yongming Rao, Meng-Hao Guo, Shi-Min Hu

2026-06-30视觉感知

针对 GUI 智能体依赖昂贵人工标注、视觉定位和跨设备泛化不足的问题,GUICrafter 将大量未标注网页与移动截图中的可交互信号转化为元任务,并用两阶段课程式 RLVR 先弱监督预训练、再少量高质量数据校准。实验显示其仅用约 UI-TARS 0.1% 的数据即可达到相当或更优表现,并在 Mind2Web、ScreenSpot-Pro、AndroidControl 等基准上超过同规模 GUI-R1。

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift Figure 1
2026-06-30cs.CV

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

Dipesh Tharu Mahato, Rachel Ren

New York University

2026-06-30强化学习

这篇论文针对视觉分布偏移下 VLA 机器人策略失败难以及时诊断的问题,研究固定 OpenVLA 的内部前馈激活是否已包含临近失败信号。其核心洞察是,不重训策略,仅用轻量线性监测器即可从特定层读出风险;在 LIBERO 遮挡实验中成功率由 57% 降至 17%,第 16 层 logistic probe 预测 15 步内失败达到 AUROC 0.972、AUPRC 0.352,并对相机抖动有有限迁移,但因未证明因果机制、任务外泛化或恢复策略,结论仍限于受控诊断场景。

MF-UAVPose6D: A Model-Free Monocular 6-DoF Pose Estimation Framework for Fixed-Wing UAVs Figure 1
2026-06-30cs.CV

MF-UAVPose6D: A Model-Free Monocular 6-DoF Pose Estimation Framework for Fixed-Wing UAVs

Juanqin Liu, Leonardo Plotegher, Eloy Roura, Shaoming He

2026-06-30三维

面向远距离、非合作固定翼无人机缺少 CAD 模型和关键点先验的问题,论文提出 MF-UAVPose6D,仅用单目 RGB 与相机内参,通过中心热图定位、视线先验建模、动态拓扑采样和位姿解耦解码来缓解小目标结构弱、深度与姿态耦合的困难;同时构建合成 FW-UAV6DPose 数据集,实验显示其在旋转、深度恢复和联合 6DoF 评估上优于对比方法且推理较高效。

Progressive Self-Supervised Learning with Individualized Community Assignment for Brain Network Analysis Figure 1
2026-06-30cs.CV

Progressive Self-Supervised Learning with Individualized Community Assignment for Brain Network Analysis

Hairui Chen, Yanwu Yang, Jianfeng Cao, Hanyang Peng, Chenfei Ye, Ting Ma

2026-06-30视觉感知

该文针对fMRI脑网络自监督学习常忽视个体化功能社区差异的问题,提出BrainPICM:用渐进式非平衡最优传输估计ROI到社区的软分配与置信度,并据此从高置信到低置信区域进行课程式遮蔽,同时提取相对群体模板的社区偏移特征。结果显示其在ABIDE-I、ADHD-200、ADNI三类诊断任务上优于多种监督和自监督基线,但具体增益中各模块贡献仍需结合消融细看。

PoseShield: Neural Collision Fields for Human Self-Collision Resolution Figure 1
2026-06-30cs.CV

PoseShield: Neural Collision Fields for Human Self-Collision Resolution

Zhengyuan Li, Zeyun Deng, Yifan Shen, Liangyan Gui, Miaolan Xie, Joseph Campbell, Xifeng Gao, Kui Wu, Zherong Pan, Aniket Bera

2026-06-30三维

这篇论文针对 SMPL 姿态估计与动作生成中常见的自穿透问题,提出 PoseShield:在低维姿态空间学习神经碰撞约束,并用 Eikonal 正则保证碰撞边界附近梯度不消失,从而让 SLSQP 等约束优化更稳定。方法可作为无需重训生成器的后处理模块扩展到动作序列;在新建 HwC/相关基准上报告 95.8% 修复成功率,优于已有网格空间或启发式惩罚方法。

Evolutionary Hyperparameter Optimization to Find Lightweight CNN Models for Autonomous Steering Figure 1
2026-06-30cs.NE

Evolutionary Hyperparameter Optimization to Find Lightweight CNN Models for Autonomous Steering

Devson Butani, Ryan Kaddis, Chan-Jin Chung

2026-06-30优化算法

面向车载算力受限且标注数据很少的自动转向场景,论文用带 1/5 成功规则的(N+M)进化策略自动搜索 CNN/DNN 架构与超参数,试图直接得到小模型而非依赖蒸馏。实验基于 LTU ACTor 采集的 2957 张图像,结果表明可在显著压缩模型规模的同时保持有竞争力的转向角预测精度,但泛化到更复杂天气和道路条件仍文中未充分说明。

Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature Figure 1
2026-06-30cs.CV

Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature

Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari

Mehta Family School of Data Science and Artificial Intelligence, Indian Institute of Technology Roorkee, Uttarakhand, India-247667, Department of Metallurgical and Materials Engineering

2026-06-30视觉语言数据集/基准

材料科学论文中的复合图长期难以被可靠转化为图文训练数据,限制了科学视觉语言模型。本文提出 MatMMExtract,将开放获取论文中的图、caption 与正文引用解析后,先做面板级拆分,再用材料学分类体系约束 LLM 生成子标题、类别和摘要,构建 MatSciFig。结果得到 39.2 万个面板级图文对;MaterialScope 上 YOLO12-m 的 mAP50 达 0.9227,检索基线较零样本 CLIP 的 R@1 提升 4.4 倍。

No Figure
2026-06-30cs.CV

Benchmarking Geospatial Foundation Models for Agriculture Applications

Zhuocheng Shang, Sanmay Das, Ahmed Eldawy

University of California, Riverside, University of California, Riverside Riverside USA

2026-06-30数据集/基准

这篇论文针对农业遥感中“地理泛化是否可靠”的问题,构建了一个跨美国四州、训练/验证/测试区域严格分离的基准,评估 Prithvi、SpectralGPT 和 SatMAE 在作物分割与变化检测上的迁移能力。核心洞察是现有 GeoFM 在区域分布偏移下并不稳健,常只预测主流作物、漏检稀有类别;同时统一输入格式会不均等地影响不同模型,使架构优劣比较更复杂。

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition Figure 1
2026-06-30eess.AS

VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition

Piyush Arora, Navlika Singh, Umberto Cappellazzo, Stavros Petridis, Maja Pantic

♡Imperial College London, UK, Our code is available at, such as AV-HuBERT [5, 6] and large-scale automatic labeling

2026-06-30视觉感知安全鲁棒

这篇论文针对LLM式音视频语音识别在干净语音上表现好、但LLM主干缺少抗噪表示约束的问题,提出在选定LLM层插入变分信息瓶颈,仅压缩音频隐状态以过滤噪声扰动,同时保留视觉唇动与文本上下文。实验在LRS2与多种MUSAN噪声/SNR下显示,相比Llama-AVSR可降低WER,低SNR和极端噪声下收益更明显,且基本不牺牲干净语音表现。

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models Figure 1
2026-06-30cs.CV

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang

University of Michigan, Ann Arbor, MI, USA, Carnegie Mellon University, Pittsburgh, PA, USA, New York University, New York, NY, USA, Vanderbilt University, Nashville, TN, USA, depth label into a layer convention shaped by annotation, dataset construction, derived labels may emphasize different physical layers: ultrasound can return the, scene (Fig. 1a). Synthetic labels also encode renderer choices for ray termination

2026-06-30视觉感知

论文指出,透明/分层场景中单目深度的一像素一深度假设会把多种几何有效表面压成数据集约定,影响机器人空间理解。其核心是提出 MD-3k 双层序关系基准,显式度量模型偏好的前景玻璃或背景层,并用无需训练的拉普拉斯视觉提示探测冻结模型是否能切换深度假设。结果显示主流深度基础模型层偏好差异明显,部分模型可被 LVP 调制,DAv2-L 的 RGB/LVP 组合达到 75.5% ML-SRA。

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis Figure 1
2026-06-30cs.CV

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du

School of Computer Science, Wuhan University, Wuhan, China, Institute of Artificial Intelligence, Wuhan University, Wuhan, China, Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China, National Engineering Research Center for Multimedia Software, Wuhan University, Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China, propose SonoCLIP, the first million-scale region-controllable fetal ultra-, global–local contrastive representation learning. To support scalable re-, standard planes for large-scale pretraining. Extensive cross-center evalu-, controllable and clinically oriented foundation model for fetal ultrasound, analysis. Our code and data are available at: https://github.com/Harrison-, Region-Controllable Learning · Contrastive Alignment.

2026-06-30视觉语言视觉感知

胎儿超声受散斑噪声、采集差异和细微解剖边界影响,单纯全局 CLIP 对齐容易忽略临床关键局部结构。SonoCLIP 将分割掩码作为额外视觉通道,引入区域可控的图文预训练,并用 sigmoid 成对对比损失支撑大规模区域-文本监督;在 1.44M 张、24 标准切面数据上训练后,跨中心零样本 Top-1 从 FetalCLIP 的 39.78% 提升到无掩码 58.38%、有掩码 85.01%,但部分增益可能主要来自 scaling / data。

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models Figure 1
2026-06-30cs.CV

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

Northeastern University, Boston, USA, EmbodyX Inc., USA, Zhejiang University, China, Code is available at https://github.com/rchowdhubnor/ScAle.git.

2026-06-30视觉感知

这篇论文针对VLM在几何关系、导航和地图理解等空间推理上表现薄弱、而常规PEFT需大量参数的问题,提出ScAle:冻结主干,仅学习少量有界标量,对末token的注意力头及MLP激活进行缩放,以重加权空间相关表示。实验在SpatialEval、What’sUp及真实VQA上显示,约1K可训练参数即可带来最高134.1%相对准确率提升,并基本保持非空间VQA能力;但具体增益中有多少来自scaling机制与训练数据,文中仍未充分说明。

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET Figure 1
2026-06-30cs.CV

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

The Chinese University of Hong Kong, HKSAR, TReNDS Center (Georgia State, Georgia Tech, Emory), Atlanta, USA, ShanghaiTech University, Shanghai, P.R.China, University of California, Berkeley, USA, University of Texas Health Science Center at Houston, USA, Nanyang Technological University, Singapore, cal signals available in PET. A natural question is

2026-06-30视觉感知

该文针对现有3D脑影像基础模型把PET当作普通体数据、忽略区域代谢结构的问题,提出ReMAP-PET,用120脑区SUVR监督部分微调的MedicalNet 3D ResNet-50,并结合SUVR回归与PET-SUVR对比学习,将PET表征约束到可解释的代谢空间。结果显示其在1015对PET-SUVR样本上达到0.070 SUVR MAE和77.8% PET→SUVR Recall@1,并可进一步对齐临床文本、支持报告生成和下游诊断/认知线性探测。

Reliability-Prioritized Fine-Grained Generation in Multimodal Large Figure 1
2026-06-30cs.CV

Reliability-Prioritized Fine-Grained Generation in Multimodal Large

Xiaomeng Fan, Wu Wei, Yuwei Wu, Zhi Gao, Shiyu Luo, Mingyang Gao, Haoyu Zhao, Zhenxin Diao, Yuxuan Ba, Lijia Feng, Yunde Jia, Mehrtash Harandi

Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology, Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University, Department of Electrical and Computer System Engineering, Monash University, Code and data are available here., labelthat is not actually correct., coarse-to-fine hierarchical labels.

2026-06-30视觉语言

这篇论文针对多模态大模型在细粒度视觉描述中“越具体越易错”的问题,提出应优先生成图像可靠支持的最细描述,而非盲目追求细节。作者构建含多物体、层级标签的 GRANFACT,并设计层级感知评测与 RP-DPO,通过惩罚不可靠细粒度断言、奖励可靠具体性来优化模型。实验显示该方法能在保持可靠性的同时提升细粒度生成,但评测集规模和领域覆盖仍有限。

GarmentZoom: Generating Zoomable Images from Garment Listings Figure 1
2026-06-30cs.CV

GarmentZoom: Generating Zoomable Images from Garment Listings

Renjie Zhao, Jingwei Ma, Huy Huynh Cao, Brian Curless, Steven M. Seitz, Ira Kemelmacher-Shlizerman

University of Washington

2026-06-30视觉感知

GarmentZoom针对电商服装图只能在全身视图与局部特写间切换、难以连续查看细节的问题,提出用未对齐特写作为纹理参考来增强全身图的生成式超分辨方案。其核心在于构建真实商品图的可变尺度监督,并用参考条件LoRA在无需空间对齐和单样本微调的情况下适配3–20×缩放。实验显示该方法在10×及最高16×放大下相较基线显著降低LPIPS、DISTS和LSD,质量接近逐例微调但训练成本更低。

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos Figure 1
2026-06-30cs.CV

MotionAtlas: Detailed Region Captioning for Motion-Centric Videos

Weisong Liu, Haochen Wang, Kuan Gao, Yuhao Wang, Yikang Zhou, Zhongwei Ren, Jacky Mai, Anna Wang, Yanwei Li, Jason Li, Zhaoxiang Zhang

Institute of Automation, Chinese Academy of Sciences, Shanghai Jiao Tong University 3Nanyang Technological University, Peking University 5Wuhan University 6Beijing Jiaotong University, benchmark, (2) a scalable, high-quality pipeline to construct training, Second, we design a rigorous and scalable data pipeline that leverages, the red shirt while retreating from the center

2026-06-30视觉语言视觉感知

这篇论文针对现有视频多模态模型难以精细理解局部运动、且全局运动描述难以可靠评测的问题,提出以时空掩码限定目标区域的 MotionAtlas。其核心是结合人工标注的 MotionAtlas-Bench、带自举 refinement 的 159k 区域运动描述数据和定制训练配比,以减少视觉干扰与细粒度幻觉。实验显示,MotionAtlas 在多个运动理解基准上稳定优于 Qwen3-VL 等基线,其中 4B 模型平均提升约 5.2 个百分点。

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views Figure 1
2026-06-30cs.CV

Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views

Mijin Yoo, In Cho, Subin Jeon, Jiwoo Lee, Eunbyung Park, Seon Joo Kim

Yonsei University, Seoul National University

2026-06-30三维

针对前馈三维重建常输出无结构点或高斯、对象级信息需事后聚合的问题,论文将场景直接表示为实例化3D token组:实例token负责对象身份与范围,anchor token生成局部几何外观并解码为高斯。该表示用2D可微渲染联合重建与分割监督学习,无需3D标注;在类别无关实例分割上超过逐场景优化基线,视图合成保持竞争力,并支持对象级编辑与开放词汇检索。

Benchmark AUC Is Not Deployable Reliability: A Cross-Dataset Audit of Off-the-Shelf Features for Surveillance Video Anomaly Detection Figure 1
2026-06-30cs.CV

Benchmark AUC Is Not Deployable Reliability: A Cross-Dataset Audit of Off-the-Shelf Features for Surveillance Video Anomaly Detection

Mohammadreza Rashidi

Department of Computer Science, AI and Media Analysis Lab, that the benchmark numbers quoted for surveillance anomaly detection describe a calibrated laboratory setting and, anomaly labels, which is what makes unsupervised normality modelling and frame-level evaluation possible., A separate, weakly supervised paradigm instead trains on video-level normal and anomalous labels [10], Most VAD papers report same-dataset AUC. This number measures a calibrated, same-camera laboratory setting., A. Datasets and labels, each test frame carries a binary label, positive if it contains any annotated, We read labels directly from these files. The ShanghaiTech training and test splits are large, so we build its normality

2026-06-30视觉感知数据集/基准

这篇论文针对监控视频异常检测常用同数据集 AUC 难以代表真实部署的问题,做了一个跨数据集审计而非提出新检测器:用 CLIP、DINOv2 等冻结特征和简单 kNN/马氏距离正常性模型,在四个基准间交叉测试。结果显示同数据集平均 AUC 为 0.704,但跨数据集仅 0.499 接近随机,DINOv2 还出现最大跌幅,且误报率高到不可用,说明现有基准显著高估了部署可靠性。

Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance Figure 1
2026-06-30cs.CV

Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance

Mohammadreza Rashidi

Department of Computer Science, AI and Media Analysis Lab, • A real-world generalization audit on five public, third-person phone videos using a label-free detection-volume

2026-06-30视觉感知数据集/基准

本文关注肩窥视频中从手指动作推断手机按键的安全风险,评估一个无需训练的 BEHINT 多模态触碰检测管线,将 MediaPipe 手部关键点、肤色、帧差运动和边缘线索映射到键盘布局。核心洞察是经典滤波融合并未带来可靠虚拟键盘记录:在单个标定片段上综合 F1 仅 16.7%、序列相似度 3.0%,到真实公开视频中还会因肤色滤波把整只手当作触点而严重过报。

Learning Where and When: Patch-Based Spatiotemporal Localization in Weakly Supervised Video Anomaly Detection Figure 1
2026-06-30cs.CV

Learning Where and When: Patch-Based Spatiotemporal Localization in Weakly Supervised Video Anomaly Detection

Hamza Karim, Nghia Nguyen, Lokman Bekit, Yasin Yilmaz

University of South Florida, els are trained using only coarse labels such as video-level, tection, where only video-level labels are available during, tiotemporal tube localization, using only video-level labels., annotations are available only for UCF-Crime and Shang-

2026-06-30视觉感知

这篇论文针对弱监督视频异常检测只判断“何时异常”、难以解释“异常在画面何处”的问题,将 MIL 从时间片段扩展到 7×7 patch 级时空网格,并用邻近感知 Top-k 选择聚合时空相邻的高分区域,在无框监督训练下生成细粒度异常热图。作者称其在多个基准上超过现有方法,并额外发布 XD-Violence 与 UBnormal 测试集框标注;但具体增益相对来自 patch 建模、损失设计还是新标注评测,需看完整实验拆分。

Rectifying Mask via Entropy for Distractor-Free 3DGS in Ambiguous Scenarios Figure 1
2026-06-30cs.CV

Rectifying Mask via Entropy for Distractor-Free 3DGS in Ambiguous Scenarios

Wongi Park, Jiyeon Lim, Minjae Lee, Myeongseok Nam, Seongjun Choi, Jungwoo Kim, Soomok Lee, William J. Beksi, SangHyun Lee

Georgia Institute of Technology, Yonsei University, Seoul National University, Kennesaw State University, University of Texas at Arlington

2026-06-30三维

本文关注真实场景 3DGS 中动态物体、遮挡或外观变化与静态背景颜色/语义相近时,传统光度残差或语义特征难以生成可靠 transient mask、还会误导高斯密度控制的问题。RefineSplat 的核心洞察是利用熵信号结合实例掩码识别这些模糊干扰物,并用熵感知的位置梯度调节密度控制以减少高斯错位。作者还构建了含 18 个室内外场景的 Ambiguous wild 数据集,实验显示其在多数据集上优于现有方法,实现更干净的新视角合成。

VCS-SLAM: Geometry-Validated Semantic Evidence Fusion for 3D Gaussian SLAM Figure 1
2026-06-30cs.CV

VCS-SLAM: Geometry-Validated Semantic Evidence Fusion for 3D Gaussian SLAM

Raman Jha, Shuaihang Yuan, Yi Fang

2026-06-30三维

这篇论文针对语义3D Gaussian SLAM中把每帧2D语义标签等权融合的问题:遮挡、无几何支撑的边界和射线歧义会把错误语义固化进全局地图。VCS-SLAM的核心是先用可见性一致性、表面支撑边界证据和冲突感知不确定性评估观测可靠性,再加权优化语义高斯。Replica上语义一致性、边界保持和重建质量提升,ScanNet上跟踪性能保持竞争力,但具体增益幅度需看完整实验。

The Calibrated Deepfake Trust Score (CDTS): Competence-Coupled Trust Degradation Across Deepfake Detectors Figure 1
2026-06-30cs.CR

The Calibrated Deepfake Trust Score (CDTS): Competence-Coupled Trust Degradation Across Deepfake Detectors

Md Anas Biswas

School of Computing, University of Portsmouth, Portsmouth, United Kingdom, coupling flags (its error tracks competence at r = −0.98), and competence is estimable without labels, so a, label-free monitor flags calibration risk on unseen generators and routing source-batches on a reference-free, label-free competence monitor that drives a zero-trust routing policy. The equity audit and explanation-faithfulness analysis are, the coupling and label-free, errors propagate silently: a confidently mislabelled asset is never escalated for review. The reliability of the, without labels), not discriminate in it (degrade evenly across subgroups), and route around it (feed a, and augments it with a label-free competence estimate and a routing policy. Treating the instrument, rather

2026-06-30视觉感知

本文针对深伪检测器在审核、溯源等流程中被当作“可信度概率”使用而非仅作分类器的问题,提出 CDTS 包装器,将任意检测器输出校准为信任分数,并加入无标签能力监测与路由。核心洞察是校准、解释忠实度和公平性退化主要由检测能力下降共同驱动,而非生成器时间演进;32 个配置中能力与校准误差强相关,并在 CNN 与 CLIP ViT、跨数据集和未见生成器上复现,无标签熵信号可提前标记高校准风险。

MAVIN: Multi-Shot Audio-Visual Generation with Narrative Control Figure 1
2026-06-30cs.CV

MAVIN: Multi-Shot Audio-Visual Generation with Narrative Control

Kaiqi Liu, Yunyao Mao, Ziqi Cai, Zheng Geng, Jing Wang, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Shuchen Weng, Boxin Shi

2026-06-30规划控制

MAVIN面向多镜头影视生成中音画事件难按时间线对齐、角色外观与声线难持续控制、脚本缺少音频线索的问题,基于OVI引入边界感知注意力、ID感知传播和多智能体分层脚本生成,并构建含80万训练样本与1千人工验证样本的MAVINSet;实验显示其在质量、语义、音画同步和多镜头一致性指标上优于现有联合或级联方法,但实际应用仍限于15秒和最多3个定制角色。

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation Figure 1
2026-06-30cs.CV

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

Korea Advanced Institute of Science and Technology (KAIST), Republic of Korea, Electronics and Telecommunications Research Institute (ETRI), Republic of Korea, large paired image–text datasets and scalable contrastive objectives, amplified, scalability

2026-06-30视觉语言视觉感知数据集/基准

这篇论文针对视觉语言数据集蒸馏中全维欧氏对齐过强的问题:图文相关性往往低秩,语义共享只集中在部分方向。作者提出 RAHA,将表示提升到双曲空间,并显式分解共享 range 与残差子空间,只在主语义方向做测地对齐、对残差做正则以保留模态私有信息。实验显示在固定预算下跨模态检索有竞争力,迁移与鲁棒性指标有所改善。

CellDETR: A Detection-Guided Framework for Scalable Cell Representation Learning from Histopathology Images Figure 1
2026-06-30cs.CV

CellDETR: A Detection-Guided Framework for Scalable Cell Representation Learning from Histopathology Images

Shikang Zhang, Guojun Li, Yicong Mao, Chulin Sha

Scalable Cell Representation Learning from, Zhejiang University of Technology, Tianjin University, Hangzhou Institute of Medicine, Chinese Academy of Sciences, a detection-guided framework built on Deformable DETR for scalable cell rep-, learning design, we build a CellDETR-based pretraining model for scalable cell, representation learning from unlabeled WSIs, which improves downstream cell, relevance of the learned cell embeddings. Together, CellDETR provides a scalable, [4] have been developed using large-scale unlabeled whole-slide images (WSIs). These models, data availability. High quality cell-level annotations remain limited, and existing manually annotated, states. The second challenge associates with model design. Currently, most label-free self-supervised, representations from WSIs that are transferable across datasets and scalable through large pretrain

2026-06-30视觉感知

这篇论文针对病理基础模型多停留在 patch/slide 表征、难以支持细胞级解释的问题,提出基于 Deformable DETR 的 CellDETR:先检测可变数量细胞核,再用位置特征解耦和框约束注意力提取细胞嵌入,并扩展到对比式自监督和 Xenium 空间转录组标签预训练。结果显示其在 PanNuke 细胞分类/检测上优于现有方法,预训练进一步提升下游表现并具备跨数据集迁移能力,但部分增益可能来自预训练数据与监督信号。

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein Figure 1
2026-06-30cs.CV

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

Hong-Han Wang, Yuntao Wang, Hu Ding

University of Science and Technology of China, Hefei, China, “sitting requires the center of gravity above the support surface” or “Huskies dif-

2026-06-30视觉感知

论文针对多模态大模型中“视觉 token 语义对齐了、但概念间关系未迁移”的问题,提出 MIRROR:利用交叉注意力作为文本—视觉耦合,将语言表征中的关系几何通过半逆 Gromov–Wasserstein 正则映射到视觉空间,并给出闭式解与高效计算策略。实验显示其提升关系一致性和多层次视觉关系推理,同时基本保持通用视觉语言任务表现且无额外推理开销。

From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs Figure 1
2026-06-30cs.CV

From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs

Arjun Majumdar, Raphael Braun, Andreas Engelhardt, Hendrik PA. Lensch

2026-06-30视觉感知

这篇论文针对次表面散射采集成本高、传统逐点或OLAT测量需大量图像的问题,提出用每视角仅8张高频PSP结构光图像进行自监督预训练,学习可迁移的SSS表征;其关键在于面向PSP的物理感知增强、SimSiam编码器预训练,以及针对偏斜各向异性footprint的专用损失和轻量解码器。实验显示方法能在未见物体、材质和视角上重建较高保真的散射footprint并用于重光照,显著减少采集量,但相机—投影仪配置依赖和局部patch半径限制仍存在。

Resonant Brane Splatting for Arbitrary-Scale Super-Resolution Figure 1
2026-06-30cs.CV

Resonant Brane Splatting for Arbitrary-Scale Super-Resolution

Giulio Federico, Giuseppe Amato, Claudio Gennaro, Fabio Carrara, Marco Di Benedetto

University of Pisa, Italy, and collaboration of numerous overlapping splats.

2026-06-30视觉感知

本文针对任意尺度超分中隐式解码逐像素查询慢、标准2D高斯样条又因低通且单色而需大量重叠来表达边缘纹理的问题,提出RBS:在高斯包络内加入Gaussian-Hermite内部模态,并为每个模态预测颜色系数,使单个Brane可表达局部对比、高频纹理与多色结构;同时用基于量子转折点的可微CUDA光栅器裁剪无效区域。实验称其在标准ASR基准上优于隐式和GS基线,并取得更好的速度—质量折中。

The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training Figure 1
2026-06-30cs.CV

The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training

Tuo Chen, Minjing Dong, Benlei Cui, Jian Liu, Jie Gui

Southeast University, City University of Hong Kong, Purple Mountain Laboratories, box setting because they often require access to labels, attack patterns, or training, across multiple attacks. Code is available here., cious samples into unlabeled training data or by modifying model weights [5, 27]. The compromised, coders, only a few operate in a fully black-box setting. Some studies construct pseudo-labels and, applies to a closed and finite label space. Other methods restrict the defense scope to specific types, without any downstream labels and without access to poisoned samples. We train this energy with

2026-06-30视觉感知

这篇论文针对自监督视觉编码器在大规模预训练后易被后门污染、而现有防御常依赖标签、触发器或训练过程的问题,提出用独立大模型表征应收敛到同一“现实”的洞察作为黑盒测试时安全信号。方法以源编码器和多个可信参考编码器的表征兼容性构建条件能量模型,用 NCE 做检测、去噪 score matching 做表征净化,并给出能量差与互信息相关的理论解释。实验覆盖多种 SSL 编码器和 10 余类攻击,报告在检测与净化上均提升鲁棒性且基本保持干净样本性能。

Miti360: A Comprehensive Dataset for Improved Reforestation Monitoring Figure 1
2026-06-30cs.CV

Miti360: A Comprehensive Dataset for Improved Reforestation Monitoring

Cedric Kiplimo, Samuel Mbatia, Ciira wa Maina, Arthur Sichangi, Dennis Gitundu

Centre for Data Science and Artificial Intelligence (DSAIL), Dedan Kimathi University of Technology, Nyeri, Kenya, Institute of Geomatics, GIS and Remote Sensing (IGGReS), Dedan Kimathi University of Technology, Nyeri, Kenya

2026-06-30数据集/基准

针对非洲可用于机器学习的森林/再造林数据稀缺问题,Miti360在肯尼亚Kieni Forest 770公顷再造林区采集并整理无人机正射影像与树冠框标注、地面单目/双目图像、树种与生物物理参数、GPS及多年天气数据,支持个体树监测、生长建模和森林数字孪生。技术验证显示,该数据可跨三年追踪树冠,并使DeepForest微调后的框精度提升12%、召回提升69%,增益可能主要来自本地化数据适配。

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction Figure 1
2026-06-30cs.CV

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

2026-06-30视觉感知

这篇论文针对现有 VideoQA 评测偏重浅层感知、难以衡量模型从教程视频迁移程序性知识的问题,提出 VG-GUI-Bench 连接视频问答与视频引导 GUI 任务,并将关键瓶颈归结为任务相关时序信息选择。其 TASKER 以任务相关性和场景动态联合搜索关键帧,在训练-free 设置下提升帧效率与准确率,在 EgoSchema fullset 和 NExT-QA 上分别超过最佳基线 2.0% 与 1.8%。

EvLIR: Learning Illumination Residuals from Ordered Events for Low-Light Image Enhancement Figure 1
2026-06-30cs.CV

EvLIR: Learning Illumination Residuals from Ordered Events for Low-Light Image Enhancement

Haoxian Zhou, Chuanzhi Xu, Langyi Chen, Pengfei Ye, Haodong Chen, Qiang Qu, Ali Anaissi, Weidong Cai

The University of Sydney, Massachusetts Institute of Technology

2026-06-30视觉感知

针对极低照度下单帧图像结构缺失、噪声放大,而既有事件辅助方法常把事件体素当作静态特征的问题,EvLIR保留事件时间 bin 顺序,用轻量 ConvGRU 的 TERM 学习有界照明残差,引导 Retinex 式照明估计与图像-事件融合恢复。在 SDE、SDSD 室内外基准上,文中报告其在 12 个数据集-指标组合中 11 个最佳,平均达到 25.63 dB PSNR、28.30 dB PSNR* 和 0.827 SSIM。

Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors Figure 1
2026-06-30cs.CV

Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors

Guanyu Lu, Fang Zhou, Cheqing Jin

East China Normal University, Shanghai, China, handling sensitive patient scans in collaborative diagnostics, human expertise and task-specific prompt design, which restricts model scalabil-

2026-06-30视觉感知安全鲁棒

本文关注零样本异常检测在辅助异常样本类型有限时的鲁棒性问题,指出现有 CLIP/VLM 提示调优易过拟合少数异常模式且视觉特征受物体语义干扰。DIVE 通过浅层与深层文本嵌入注入抽象通用异常概念,并用解耦机制分离异常状态与物体语义;同时提出惩罚误检和过分割的 RCPRO 指标。十二个数据集上,在有限异常先验设置下相对 SOTA 分类和分割指标最高分别提升 28.5% 与 47.0%。

Bit-ViP: Leveraging Bit-planes to Preserve Visual Privacy in Images through Obfuscation Figure 1
2026-06-30cs.CV

Bit-ViP: Leveraging Bit-planes to Preserve Visual Privacy in Images through Obfuscation

Vishesh Kumar Tanwar, Ashish Gupta, Sanjay Madria, Sajal K. Das

2026-06-30视觉感知

面向监控、社交媒体等视觉数据上云带来的身份隐私泄露问题,Bit-ViP 将图像划分为块并在比特平面引入混沌扰动,再结合差分隐私噪声,使图像难以逆向恢复但仍可用于识别训练。作者在 UCF101、HMDB51 上评估,报告其在重建、像素频率、熵和相关性攻击下较既有混淆方案更安全,同时识别精度损失较小。

Can Machines Really See Objects in Images? A Study Based on Syntactic Distance and Visual Self-Referential Instances Figure 1
2026-06-30cs.CV

Can Machines Really See Objects in Images? A Study Based on Syntactic Distance and Visual Self-Referential Instances

Xingyu Peng, Junran Wu, Yue Hou, Zhongliang Qiao, Jiaheng Liu, Shangzhe Li, Jichang Zhao, Wenjun Wu, Xianglong Liu, Yongxin Tong, Li Dong, Ke Xu

SKLCCSE, Beihang University, Nanjing University, Central University of Finance and Economics

2026-06-30视觉感知

论文追问视觉模型高准确率是否等于真正“看见”对象,针对依赖局部纹理捷径的局限,提出以句法距离刻画类别可分性,并构造噪声中闭合方框与单像素破损方框的零句法距离自指任务。实验显示 ResNet 与 ViT 在图像尺度超过临界点后准确率坍塌到随机猜测,更多数据和更大模型只延后坍塌,说明当前架构在全局概念识别上存在结构边界。

FiRe: Frequency Reparameterization as a Preconditioner for Periodic Implicit Neural Representations Figure 1
2026-06-30cs.CV

FiRe: Frequency Reparameterization as a Preconditioner for Periodic Implicit Neural Representations

Harinandan Shukla, Rajarshi Verma, Jitin Singla

Department of Computer Science and Engineering, IIT Roorkee, Department of Biosciences and Bioengineering, IIT Roorkee

2026-06-30视觉感知

针对 SIREN/FINER 等周期隐式神经表示给所有神经元使用同一全局频率、难以高效匹配局部高频细节的问题,FiRe 用低秩、输入相关的门控重参数化每个神经元频率,并从 NTK 角度解释其作为隐式预条件器改善初始化优化条件。实验在 2D 图像拟合中显示,参数和实际频率匹配下早期训练 PSNR 最高约提升 1 dB,高频恢复更快;但增益随分辨率和训练时间下降,充分收敛后不具备渐近优势。

Learning to Adaptively Allocate Gaussians for Arbitrary-Scale Image Super-Resolution Figure 1
2026-06-30cs.CV

Learning to Adaptively Allocate Gaussians for Arbitrary-Scale Image Super-Resolution

Giulio Federico, Giuseppe Amato, Claudio Gennaro, Fabio Carrara, Marco Di Benedetto

GIULIO FEDERICO∗, University of Pisa, Italy and ISTI-CNR, Italy, target is unavailable during inference. Therefore, the network must au-

2026-06-30视觉感知三维

本文针对任意尺度超分中固定倍率插值失真、逐像素隐式查询开销大、现有高斯方法均匀分配资源的问题,提出 QuADA-GS:用神经路由按局部复杂度自适应分配全局高斯预算,并以四叉树式非规则拓扑和 O(1) 邻域查找的 HPC 协调特征。实验显示其在多尺度尤其纹理丰富场景取得领先重建与感知指标,推理较刚性 GSASR 更快,但为换取细节通常占用更多显存。

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation Figure 1
2026-06-30cs.CV

NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation

Cheng Wan, Yongsen Mao, Wenzheng Wu, Yuxuan Xie, Chucheng Xiang, Runze Wang, Xiang Zhang, Zhongyuan Liu, Rushi Dai, Yuan Liu

2026-06-30三维

这篇论文针对现有 LLM 3D 布局代理把资产和场景转成文本或图像而丢失几何细节、输出坐标又易出现“数值盲”的问题,提出 NaLA:直接将房间边界与物体点云编码为 LLM 前缀 token,并用离散姿态锚点加连续残差的粗到细机制生成位置和朝向。实验显示其在语义一致性、美观性、复杂/不规则场景鲁棒性和推理效率上优于既有布局代理,消融也支持各模块有效。

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model Figure 1
2026-06-30cs.CV

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

2026-06-30视觉语言视觉感知安全鲁棒

本文针对VLA在低照度、近黑暗等真实操作场景中RGB观测退化导致动作预测不稳的问题,引入事件相机作为抗光照、敏感运动的补充信号。核心洞察是事件信息不应直接混入全局语义 token,而应通过动作查询、门控交叉注意力路由到动作表征,以保留预训练RGB-语言先验。仿真、LIBERO-Cross和Franka实机结果显示,该接口在正常光照下基本保持性能,并显著提升低光鲁棒性。

DR-GS: Physically-Based Deformable and Relightable 2D Gaussians Figure 1
2026-06-30cs.CV

DR-GS: Physically-Based Deformable and Relightable 2D Gaussians

Jiaxin Li, Tong Wu, Yi Wei, Tailin Wu, Li Zhang

Shanghai Innovation Institute, China, Zhejiang University, China, Department of Artificial Intelligence, Westlake University, China, School of Data Science, Fudan University, China, Central Media Technology Institute, Huawei, China, changes via decoupled geometry, lighting, and materials. The project page is available

2026-06-30三维

DR-GS针对可变形高斯表示把光照烘焙进颜色、导致形变和重光照下外观不物理且材质难编辑的问题,提出解耦几何、光照与材质的2D Gaussian框架,结合逆渲染、MIS蒙特卡洛渲染、网格射线追踪与粒子/网格驱动形变。实验显示其在静态重建、动态形变和重光照中能更好保留阴影、反射与高光,并支持后期材质编辑。

SAD-GS: Learning Reliable 3D Semantic Gaussian Fields via Dynamic Geo-Semantic Anchoring Figure 1
2026-06-30cs.CV

SAD-GS: Learning Reliable 3D Semantic Gaussian Fields via Dynamic Geo-Semantic Anchoring

Yufei Zhang, Chenlu Zhan, Gaoang Wang, Hongwei Wang

Zhejiang University

2026-06-30三维

SAD-GS关注开放词表3D Gaussian语义场中多视角2D监督不可靠的问题:同一物体的视觉特征随视角漂移,跟踪掩码又会泄漏或换ID。其核心是把语义身份与空间分配解耦,先用共识文本锚稳定语义,再用几何-语义反馈三门控过滤伪标签。实验在LERF-OVS、3D-OVS和Mip-NeRF360上提升定位与分割,并指出主要增益来自语义锚稳定,GSFL在重叠或锚歧义场景受限。

L2D2-GS: Learning to Densify for Feedforward Dynamic Gaussian Scene Reconstruction Figure 1
2026-06-30cs.CV

L2D2-GS: Learning to Densify for Feedforward Dynamic Gaussian Scene Reconstruction

Zetian Song, Chenming Wu, Junnan Liu, Chitian Sun, Liangliang He, Hangjun Ye, Jiaqi Zhang, Siwei Ma, Wen Gao

2026-06-30三维

面向自动驾驶仿真中的动态城市场景重建,L2D2-GS针对传统3DGS逐场优化慢、前馈方法高分辨率显存大且多视角融合不稳的问题,将一次性回归改为“前馈预测+迭代优化+自适应增密”。其关键在于用重建增益自监督训练增密策略,并以几何重参数化抑制早期退化;在PandaSet和Waymo上报告了更高重建质量、较强零样本泛化且使用更少高斯基元。

SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers Figure 1
2026-06-30cs.CV

SAFE-DiT: Semantics-Aware Fast-path Execution for High-Resolution Diffusion Transformers

Xuanhua Yin, Yuxuan Jia, Chuanzhi Xu, Weidong Cai

School of Computer Science, The University of Sydney, Australia

2026-06-30生成模型安全鲁棒

本文针对高分辨率 DiT 推理中空间自适应常用注意力 mask 反而触发慢速 SDPA 路径的问题,提出 SAFE-DiT:只消除经语义判定为等价的图像自注意力冗余 mask,保留文本等有效 mask,并用提示条件分区、敏感区域更新和周期刷新实现无 mask 调度。在 Lumina-Next 上,方法在 1024²/2560² 分别达 2.69×/5.09× 端到端加速,显存从 94.1GB 降至 27.9GB,且视觉质量与密集快路径基线接近。

Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking Figure 1
2026-06-30cs.CV

Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking

Xiao Wang, Liye Jin, Dan Xu, Yuehang Li, Lan Chen, Yaowei Wang, Yonghong Tian, Jin Tang

elaborately-designed modules into the baseline framework, our, with the School of Computer Science and Technology, Anhui Univer-, • Lan Chen is with the School of Electronic and Information Engineering, • Yaowei Wang is with Harbin Institute of Technology, Shenzhen, China, • Yonghong Tian is with Peng Cheng Laboratory, Shenzhen, China, School, of Computer Science, Peking University, China, Shenzhen Graduate School

2026-06-30视觉语言视觉感知安全鲁棒

这篇论文针对视觉语言跟踪中静态或整体生成式文本更新易导致目标身份被改写、背景干扰和幻觉描述的问题,提出先用依存解析把语言规格拆成目标、概念与背景,再借助 Qwen-VL 做组件感知的动态更新,并保持目标身份稳定。实验在 TNL2K、LaSOT、TNLLT、OTB-LANG 上显示相对基线有一致提升,说明结构化文本演化能缓解语义-视觉错配。

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs Figure 1
2026-06-30cs.CV

Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs

Junzhou Chen, Jindong Wang, Gang Zhou

J. Chen and G. Zhou are with the Department of Computer Science, and, J. Wang is with the Department of Data Science

2026-06-30机器人视觉语言

这篇论文针对机器人 VLM/VLA 在高分辨率、多帧视觉输入下 token 数量过大、难以实时闭环控制的问题,提出无需训练的 ST-Merge,在视觉编码器浅层引入三维时空坐标、多队列匹配、加权聚合与合并后位置校正,以尽早压缩冗余 token 并保持几何一致性。实验显示其在 Qwen2.5-VL 视频问答中约 2 倍加速且精度仅降 1%,在 π0.5 的 1024×1024 VLA 设置下达 8.3 倍加速并保持基线成功率。

W4A4 Quantization for Inference on Wan2.2-I2V-A14B Figure 1
2026-06-30cs.CV

W4A4 Quantization for Inference on Wan2.2-I2V-A14B

Yidong Chen, Chengyu Shi, Jiahao Liu

∗Tsinghua University

2026-06-30视觉感知

本文面向 Wan2.2-I2V-A14B 视频生成推理中 W4A4 量化带来的显存与计算压力,指出 FFN 激活长尾离群值是直接 4bit 舍入的主要误差源。方法将 SmoothQuant 通道平滑、MixQ 式静态离群列高精度分支与分块 HiF4 打包结合,在多数 VBench I2V 指标上距 FP16 约 2–3.5%,并优于约整体下降 5% 的原生 HiFloat4 基线。

Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning Figure 1
2026-06-30cs.CV

Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning

Jiajie Mi, Xinyu Liu, Mengke Song, Chenglizhao Chen

Qingdao Institute of Software & School of Computer Science and Technology, China, University of Petroleum (East China), China, Shandong Key Laboratory of Intelligent Oil & Gas Industrial Software, China

2026-06-30视觉感知

这篇论文针对凝视目标估计常被简化为像素级热图回归、难以稳定表示“看的是哪个物体”的问题,提出对象语义驱动的两阶段层级推理框架:先建模候选凝视物体,再结合多尺度特征融合与头姿/视线几何约束做精细定位。在 GazeFollow、VideoAttentionTarget、ChildPlay 和 GOO-Real 上分别达到 0.961、0.948、0.987、0.977 AUC,且模型仅 7.1M 参数。

HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video Figure 1
2026-06-30cs.CV

HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video

Yiming Jiang, Hanzhang Tu, Wenfeng Song, Siyou Lin, Liang An, Shuai Li, Aimin Hao, Yebin Liu

Y.Jiang—Work done during an internship at Tsinghua University.

2026-06-30视觉感知三维

HiReFF面向全息通信和AR/VR中未标定稀疏多视角人体视频难以兼顾时序流式重建、前景干净性和高分辨率渲染的问题。方法以VGGT先验预测相机和深度,加入尺度同步相机校准、多视角监督下的高斯级前景掩码,以及在0.5K骨干上注入外观特征的高分辨率side-tuning,实现四个90°未标定视角到2K 360°人体高斯重建;实验报告在单张RTX 4090上3.01 FPS,训练显存较0.5K仅增加34%,并优于现有高分辨率流式体视频方法。

RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction Figure 1
2026-06-30cs.CV

RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction

Aymen Mir, Riza Alp Guler, Jian Wang, Peter Wonka, Bing Zhou, Gerard Pons-Moll

Tübingen AI Center, University of Tübingen, Germany, Max Planck Institute for Informatics, Saarland Informatics Campus, Germany, Imperial College London, UK, King Abdullah University of Science and Technology (KAUST), Saudi Arabia, Snap Inc., USA, *Work partly done as intern at Snap Inc., is available at https://miraymen.github.io/raga/.

2026-06-30三维

RAGA针对3DGS头像插入真实3DGS场景时缺少物理合理阴影、导致人与环境脱离的问题,提出完全在高斯空间中的实时阴影投射:沿光线对遮挡高斯做精确线积分并按理论最大值归一化,以区别掠过和穿透遮挡,同时用稳定的各向同性头像代理降低动态衣物形变带来的闪烁。实验在单人、多人和人-物交互场景中优于改造版3DGRT与RaySplat,阴影更接近伪GT、时序一致性更好,并借助CUDA/OptiX达到约50 FPS。

FDM-MFVT: Few-step Sampling Diffusion Model for Mask-Free Virtual Try-On Figure 1
2026-06-30cs.CV

FDM-MFVT: Few-step Sampling Diffusion Model for Mask-Free Virtual Try-On

Jiaxin Liu, Xiaoye Liang, Lai Jiang, Mai Xu, Jun Liu

School of Electronic Information Engineering, Beihang University, Beijing, China, Zhongguancun Academy, Beijing, China, State Key Laboratory of Virtual Reality Technology and Systems, Beihang, University, Beijing, China, Limited availability of mask-free paired datasets, restricting the development of

2026-06-30生成模型

这篇论文针对扩散式虚拟试衣推理步数多、依赖服装/人体掩码和辅助编码器、缺少无掩码配对数据的问题,提出 FDM-MFVT:用服装感知噪声优化为少步采样提供更好初始状态,并用指令驱动模块仅从人物与服装图生成结果,同时构建 3 万对 MFVT 数据集。实验显示其在 6 步下已接近或超过基线 30 步表现,并在多项指标上优于无掩码和有掩码方法,但数据由预训练试衣模型合成,增益可能部分来自数据构造。

D$^{2}$R$^{2}$OSR: Degradation-Disentangled Representation for Real-World Omnidirectional Image Super-Resolution Figure 1
2026-06-30cs.CV

D$^{2}$R$^{2}$OSR: Degradation-Disentangled Representation for Real-World Omnidirectional Image Super-Resolution

Hongyu An, Xinfeng Zhang, Xu Fan, Shijie Zhao, Li Zhang, Ruiqin Xiong

School of Computer Science and Technology, University of Chinese Academy of, ByteDance Inc., Shenzhen, China, School of Computer Science, Peking University, Beijing, China

2026-06-30视觉感知强化学习

面向VR/全景视觉中低分辨率ODI受鱼眼成像、ERP投影、压缩噪声等混合退化影响的问题,D2R2OSR的核心洞察是将纬度相关几何失真与盲像素退化解耦,并以PPR视角分支结合ERP分支和DSM分别建模补偿。实验称其在真实全景超分上达到SOTA,视觉质量更好且计算效率适合低资源部署。

MirrorPPR: Exemplar-Based Portrait Photo Retouching Figure 1
2026-06-30cs.CV

MirrorPPR: Exemplar-Based Portrait Photo Retouching

Zhihong Liu, Zheng Li, Jiachun Jin, Siqi Kou, Yitao Jian, Fengpei Yu, Zhijie Deng

2026-06-30视觉感知

论文针对文本指令难以精确描述人像五官与身形的细微结构修图问题,提出以“前后对比样例”传达修图意图的 MirrorPPR。其核心是从样例对中提取局部变形操作,并通过连接器与 LoRA 注入预训练 DiT;同时用同步空间增强构造严格对齐训练对,并发布 4700 万级数据集支撑课程学习。实验显示其在修图质量和身份保持上优于现有基线,但增益可能主要来自大规模数据与任务对齐设计。

Occlusion-Robust Multi-Object Decoupling for Physics-Based Interaction Figure 1
2026-06-30cs.CV

Occlusion-Robust Multi-Object Decoupling for Physics-Based Interaction

Xin Dong, Wenfeng Deng, Yansong Tang

Shenzhen International Graduate School, Tsinghua University 2Pengcheng Laboratory, (MLP) is trained to predict the segmentation label for each, Gaussian point based on this feature. This labeling facilitates

2026-06-30安全鲁棒

这篇工作针对机器人操作/交互场景中多物体因遮挡和视角稀疏而难以无损分离的问题,将多物体解耦重写为稀疏视角3D重建任务。其核心是以3D Gaussian为表示,用SAM2得到粗实例划分,再用联合2D/3D SDS扩散先验和物体内外相似性几何正则补全被遮挡的形状与纹理。实验显示MF-MOD无需手工mask即可生成更完整、可用于MPM物理仿真的多物体模型,但多物体顺序处理带来计算开销,光照导致的颜色差异仍未解决。

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision Figure 1
2026-06-30cs.CV

Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision

Dacheng Qi, Chenyu Wang, Jingwei Xu, Yi Ma, Shenghua Gao

The University of Hong Kong, Hong Kong SAR, Shenzhen Loop Area Institute, Shenzhen, China, Monash University, Melbourne, Australia, University of California, Berkeley, USA, for precision-critical engineering applications. Our code is available at

2026-06-30视觉感知

这篇论文针对现有 CAD 生成过度依赖视觉相似度、且命令序列量化参数会破坏工业所需尺寸精度的问题,提出 Pointer-CAD v2:先生成带单位和尺度的结构化设计计划,再用参数字典与指针机制构建命令序列,直接复用连续数值以避免离散化误差。作者还构建带计划标注的数据集,并提出顶点、边、面三级几何精度指标;实验显示其在参数准确性和尺寸一致性上优于基线。

Beyond Trajectory Matching: Reflow with Marginal Distribution Alignment Figure 1
2026-06-30cs.LG

Beyond Trajectory Matching: Reflow with Marginal Distribution Alignment

Chen Wang, Peiran Yun, Pan Xie, Ke Deng

Department of Statistics and Data Science, Tsinghua University, Department of Computer Science and Technology, Tsinghua University

2026-06-30生成模型规划控制

本文针对扩散/连续流模型少步采样中 reflow 蒸馏只匹配轨迹、却可能无法确定学生模型端点边缘分布的问题,指出相同轨迹误差可产生不同生成分布。其核心是在 vanilla reflow 与 PeRFlow 中加入边缘分布对齐正则,通过学生 ODE 的 log-density 跟踪和冻结教师 score 计算,无需额外网络,并给出总变差望远镜界。实验显示在 SD 1.5、SDXL 等骨干上可提升少步生成质量。

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving Figure 1
2026-06-30cs.CV

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

2026-06-30视觉感知

该文针对自动驾驶中合成数据虽有精确标注、真实风格图却无像素标签的实际不对称,指出现有扩散式风格迁移依赖双侧语义会带来高标注成本或语义污染。作者提出 ASTAD 任务与免训练两阶段 ASTModel,先从无标注真实图提取粗语义先验,再在去噪中动态细化并按类别注入风格。实验显示其在下游感知效用和结构保真度上优于现有方法,并带来约 3.2 倍推理加速。

ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation Figure 1
2026-06-30cs.CV

ScaleErasure: Inference-Time Minimal Intervention for Precise Concept Erasure in Next-Scale Autoregressive Image Generation

Cong Wang, Haiyu Wu, Zhiwei Jiang, Zifeng Cheng, Fei Shen, Yafeng Yin, Qing Gu

2026-06-30视觉感知

本文关注下一尺度自回归图像生成中的概念擦除:早期低分辨率尺度把不安全语义与背景等无关语义压缩到同一 token,直接干预易漏擦或损伤生成能力。ScaleErasure 在推理时增加不安全/安全概念两次前向,并从尺度、token、bit 通道三维选择最相关 logits 进行最小引导。实验显示其较改造基线擦除更精确,同时较好保持通用生成质量。

Enhancing Part-Level Point Grounding for Any Open-Source MLLMs Figure 1
2026-06-30cs.CV

Enhancing Part-Level Point Grounding for Any Open-Source MLLMs

Jin-Cheng Jhang, Fu-En Wang, Xin Yang, Nan Qiao, Lu Xia, Min Sun, Cheng-Hao Kuo

National Tsing Hua University

2026-06-30视觉语言

本文针对现有多模态大模型虽能做物体级定位、却难以精确定位把手、衣领等部件级操作点的问题,提出在冻结原模型参数的前提下利用中间层注意力:通过 Q-Synth 合成与文本目标相关的查询,再由 A2P 解码为点热图,并用 SDF 惩罚增强空间约束。实验显示该框架可接入多种开源 MLLM,在多个数据集上稳定提升部件级点定位精度,同时尽量保留原有推理与对话能力。

Nonlinear mixture model motivated subspace clustering Figure 1
2026-06-30cs.LG

Nonlinear mixture model motivated subspace clustering

Ivica Kopriva

MATLAB implementation of the proposed method is, available at https://github.com/ikopriva/NMMSC., Laplacian constructed from W to assign labels to data.

2026-06-30视觉感知

针对子空间聚类中自表示矩阵后处理依赖未知子空间维度的问题,论文从盲源分离中的非线性混合模型出发,用有限阶泰勒展开推导其与线性子空间并模型的等价关系,指出平滑阶数K对应子空间维度d,且与锚点数、表示稀疏度相联。实验在六个图像/数字基准和五类算法上验证了由该关系估计的维度范围能指导IPD后处理并提升聚类表现,但具体增益仍可能受数据集与既有算法设置影响。

Confidence-feedback-weighted graph matching network: online-offline laser-induced damage site matching under complex interference Figure 1
2026-06-30cs.CV

Confidence-feedback-weighted graph matching network: online-offline laser-induced damage site matching under complex interference

Yueyue Han, Guanhua Chen, Hangcheng Dong, Kang Zhang, Fengdong Chen, Zhitao Peng, Fa Zeng, Qihua Zhu, Guodong Liu

School of Instrumentation Science and Engineering, Harbin Institute of Technology, Harbin 150001, China, Research Center of Laser Fusion, China Academy of Engineering Physics, Mianyang 621900, China, high-quality labels for training online damage recognition

2026-06-30视觉感知

面向高功率激光装置中在线检测伪损伤点干扰真实损伤判定的问题,论文将损伤质心构成图,仅用坐标进行在线—离线匹配。核心做法是从多轮匹配分数估计节点可匹配置信度,并反馈为边特征聚合权重,以抑制无对应干扰点传播;同时加入几何一致性约束和难例挖掘损失。Complex-Scene 数据集上 F1 达 96.36%,平均每对图像 0.7248 秒。

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for Medical Vision-Language Model Routing on Real Lung CT Figure 1
2026-06-30cs.CV

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for Medical Vision-Language Model Routing on Real Lung CT

Fakrul Islam Tushar

When Does Synthetic CT Transfer? A Label-Free Donor/Host Diagnostic for, Department of Radiology and Imaging Sciences, University of Arizona, if it survives the move to real data, yet the real labels that, ask whether transfer can be predicted in advance, label-, names that boundary before any real label., the finding that transfer itself is predictable, label-free, from, medical images supply exact labels, controlled interven-, on real CT, and the real labels that would confirm this are, tion method: can we know, label-free and in advance, which, ing only the synthetic calibration surface and its free labels, this decomposition flags transfer risk before any real label, ing and no target labels.

2026-06-30视觉语言视觉感知

论文针对合成CT评测难以确认能否迁移到真实CT、而真实标签稀缺的问题,提出无标签的 donor/host 诊断:由结节本身决定的能力更可能迁移,依赖周围解剖的能力风险更高。基于合成CT校准五个VLM的 TrialCouncil 仅做选择、融合或拒答;在七个真实肺CT数据集上,结节存在与大小排序高度迁移(R²≥0.96),肺叶定位不迁移,验证了该边界判断。

Again-Pose: Anchor-Guided Adaptive Inter-Frame Motion Cues Propagating for High-quality Human Pose Reconstruction Figure 1
2026-06-30cs.CV

Again-Pose: Anchor-Guided Adaptive Inter-Frame Motion Cues Propagating for High-quality Human Pose Reconstruction

Shuaikang Zhu, Yiding Sun, Yang Yang

School of Electronic and Information Engineering, Xi’an Jiaotong University, School of Software Engineering, Xi’an Jiaotong University

2026-06-30三维

Again-Pose针对高速运动、遮挡和模糊导致视频3D人体重建特征坍塌的问题,指出隐式时序注意力会把噪声一并聚合;其核心是先筛选清晰锚帧,再用双路径运动建模和差异加权融合,把可靠运动线索传播到退化帧中完成“补全”。实验称其在Human3.6M、3DPW、PoseTrack及FineDiving上优于现有方法,尤其提升极端运动下的鲁棒性和时序稳定性。

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study Figure 1
2026-06-30cs.CL

Can OCR-VLMs Read Devanagari? A Stress-Test Benchmark and Post-Correction Study

Aditya Pratap Singh

2026-06-30视觉语言数据集/基准

这篇论文针对英文/中文OCR基准无法反映印地文天城文表现的问题,构建多字体、多退化条件及真实扫描的Devanagari压力测试,评估10类OCR/VLM系统,并提出用中位数和灾难率刻画重复崩溃。结果显示干净合成文本几乎拉不开差距,但真实扫描使多数系统大幅下滑;DeepSeek-OCR等专用OCR-VLM在退化下有罕见灾难性重复,Qwen3-VL-8B反而优于GPT-5.5并接近强闭源模型,ByT5后纠错仅在匹配同一引擎误差分布时小幅有效。

Zero-Gated Language-conditioned Human Motion Prediction Figure 1
2026-06-30cs.CV

Zero-Gated Language-conditioned Human Motion Prediction

Guanhui Qiao, Lu Zhou, Ding Jiang, Jinqiao Wang

a Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China, b School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 100049, China, d Peng Cheng Laboratory, Shenzhen 518066, China

2026-06-30视觉感知

这篇论文针对仅依赖姿态历史的3D人体运动预测缺少高层语义的问题,提出ZGL:先用VLM为已观测骨架生成一句描述,再经冻结CLIP-L投影为少量条件token,通过零初始化门控的跨注意力适配器注入DCT时空Transformer,使模型初始等同于无文本基线、只在有益时利用语言。实验显示其在Human3.6M整体MPJPE优于多种基线,并在CMU-Mocap上保持竞争力。

DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution Figure 1
2026-06-30cs.CV

DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution

Yingwei Tang, Chen Yan, Wendi Liu, Qiang Hu, Xiaoyun Zhang

2026-06-30视觉感知生成模型规划控制

本文针对生成式人脸视频超分将任务当作完整扩散生成导致采样昂贵、保真度不足的问题,提出动态轨迹初始化DTI,把恢复过程改为由低质输入损伤程度驱动的定向修复;通过视觉特征增强注入DiT,并用SNR对齐训练判别式引导器选择起始噪声分布。实验称在多基准和多指标上达到SOTA,同时降低推理步数并改善保真-感知折中,但DG泛化与预训练替代方案文中仍未充分说明。

Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection Figure 1
2026-06-30cs.CV

Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection

Ali Balapour, Faraz Hach

University of British Columbia, Vancouver, V6T 1Z4 BC, Canada, Vancouver Prostate Centre, M.H. Mohseni Institute of Urologic Sciences, Department of Urologic Sciences, The University of British Columbia, Vancouver, uses a center-conditioned parametric deformation model defined in local, Code is available at github.com/vpc-ccg/AF3AD., unsupervised setting, where only normal samples are available during training

2026-06-30视觉感知三维

该文针对无监督3D异常检测中真实缺陷稀缺、现有伪异常形态单一的问题,提出AF3AD:用局部PCA坐标、核函数衰减、各向异性、方向门控及法向/切向位移组合生成多类可控几何缺陷。它可接入偏移预测和重建式检测器,在AnomalyShapeNet与Real3D-AD上将对象级O-AUROC提升到91.5%和85.2%,较此前最好结果高5.5和7.1点;但对材质类或高频细裂纹覆盖有限。

Articulating then Matching: Zero-Shot Shape Matching for Uncurated Data Figure 1
2026-06-30cs.CV

Articulating then Matching: Zero-Shot Shape Matching for Uncurated Data

Qilong Liu, Qinfeng Xiao, Chenyuan Yi, Liying Zhang, Kit-lun Yick

Hong Kong Polytechnic University, HK SAR, need for task-specific correspondence training. (2) Scalability to uncurated raw scans: ATM scales robustly to real-world

2026-06-30视觉感知

这篇论文面向真实场景中高分辨率、拓扑损坏且表示形式多样的 3D 形状密集匹配问题,提出 ATM:先用多视角渲染结合视觉基础模型和参数化形状先验,在测试时优化到共享规范空间,再做谱细化匹配,从而绕开对网格连通性的依赖和类别训练数据需求。实验显示其在 TOPKIDS、SMAL 等非等距基准上平均测地误差为 2.4、3.8,并能处理最高约 20 万顶点的原始扫描及 mesh、点云、3DGS。

A Self-Supervised Learning Framework for Video Encoding Complexity Clustering Figure 1
2026-06-30eess.IV

A Self-Supervised Learning Framework for Video Encoding Complexity Clustering

Krishna Srikar Durbha, Hassene Tmar, Ping-Hao Wu, Ioannis Katsavounidis, Alan C. Bovik

The University of Texas at Austin, Meta Platforms, Inc., University of Colorado at Boulder

2026-06-30视觉感知

面向自适应视频流中逐视频构建率失真曲线成本高的问题,论文指出语义类别和常规 IQA/VQA 表征都难以刻画编码复杂度,提出 CECL 用视频受压缩后的“回声”作为自监督对比信号,学习低层时空退化相关表征。实验称其优于现有视觉编码器,并相对固定码率梯带来码率与质量收益,但具体增益大小和来源在给定片段中未充分说明。

Spatially Localized Image Degradation Embeddings for Image Quality Assessment Figure 1
2026-06-30cs.CV

Spatially Localized Image Degradation Embeddings for Image Quality Assessment

Krishna Srikar Durbha, Hassene Tmar, Ping-Hao Wu, Ioannis Katsavounidis, Alan C. Bovik

The University of Texas at Austin, Meta Platforms, Inc., University of Colorado Boulder, based architectures. However, the scalability of these fully supervised models is constrained by their

2026-06-30视觉感知

这篇论文针对无参考图像质量评估中自监督模型只见过全局合成退化、因而对局部和共存伪影不敏感的问题,先用受控线性探针揭示现有编码器的空间盲点,再提出 SLIDE-IQA:在双分支 ViT 的对比预训练中加入空间有界退化,并用阈值有界排除机制处理退化类型与尺度冲突。实验显示,该方法在局部复杂退化检测上明显更敏感,同时在标准 NR-IQA 基准上保持与现有 SSL 方法相当的表现。

GPC: Large-Scale Generative Pretraining for Transferable Motor Control Figure 1
2026-06-30cs.CV

GPC: Large-Scale Generative Pretraining for Transferable Motor Control

Yi Shi, Yifeng Jiang, Chen Tessler, Xue Bin Peng

Simon Fraser University, Simon Fraser University Burnaby British Columbia Canada

2026-06-30生成模型规划控制

本文针对物理角色控制中技能难以大规模复用、连续潜空间易漂移且VQ式离散化训练复杂的问题,提出GPC:用FSQ学习离散运动词表,再以GPT式自回归模型做下一token控制生成,并通过PEFT适配下游任务。模型在600小时以上动作数据上训练,运动复现成功率达99.98%,还能表现出扰动响应和跌倒恢复等自然行为;不过效果增益可能主要来自scaling / data与离散建模的共同作用。

CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection Figure 1
2026-06-30cs.CV

CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection

Yu Li, Yuenan Hou, Yingmei Wei, Jiangming Chen, Yanming Guo

aLaboratory for Big Data and Decision, National University of Defense Technology, Changsha, Hunan, China, bShanghai AI Laboratory, Shanghai, Shanghai, China, tion to achieve efficient and stable multimodal collaboration. Specifically, we design a shallow-to-deep information, Codes will be available upon publication.

2026-06-30视觉感知

面向自动驾驶和具身感知中低光、运动模糊等场景,论文指出RGB与事件流的异构性会使单阶段或统一融合产生噪声放大与冗余特征。CMTFormer的核心是按浅中深语义层级设计不同交互:低层轻量对齐,中层用RGB纹理与事件边缘双向增强,深层以可学习权重自适应融合,并加入空间先验改善定位。在DSEC-Detection和PKU-DAVIS-SOD上,方法在单模态和多模态设置下均超过已有检测器,但具体增益对各模块与训练配置的依赖仍需结合完整实验细节判断。

Beyond Backscatter: AlphaEarth Land-Cover Priors for Rapid SAR Flood Segmentation Across Foundation Backbones Figure 1
2026-06-30cs.CV

Beyond Backscatter: AlphaEarth Land-Cover Priors for Rapid SAR Flood Segmentation Across Foundation Backbones

Sanjay Thasma, Yu-Hsuan Ho, Ali Mostafavi

matched pre-event acquisition is unavailable. Using the CONUS, S. Thasma is with the Department of Computer Science and Engineering, Y.-H. Ho and A. Mostafavi are with the Urban Resilience.AI Lab, Department, University, College, models and large embedding products become available for, meaningful and globally available prior on local topography, the post-event scene alone [15], and label-scarce variants of, as confidence-filtered pseudo-labeling [16]. However, it loses, ing a hybrid labeling strategy that combines semi-automatic, data, featuring labels created entirely through manual photo

2026-06-30视觉感知

针对灾后快速制图中光学影像受云遮挡、单时相 SAR 难区分新增洪水与永久水体的问题,论文把洪水分割视为 SAR 观测与稳定地表先验的对齐任务,系统比较 DEM 与 AlphaEarth 土地覆盖嵌入在多种 CNN/ViT 骨干上的作用。结果显示两类先验均优于 SAR-only;AlphaEarth 在更难的 Florence 事件上全面超过 DEM 并取得最佳 IoU,而 DEM 在 Louisiana 更稳且表现竞争,说明学习型与物理先验互补。

When Stopping Fails: Rethinking Minimal Risk Conditions through Human-Interactive Autonomous Driving for Safe Transportation Systems Figure 1
2026-06-30cs.RO

When Stopping Fails: Rethinking Minimal Risk Conditions through Human-Interactive Autonomous Driving for Safe Transportation Systems

Yash Tandon, Giovanni Tapia Lopez, Marcus Blennemann, Mohan Trivedi, Ross Greer

2026-06-30安全鲁棒

本文针对自动驾驶“遇不确定就停车”的最小风险条件在真实城市中可能阻塞急救、交通与无障碍出行的问题,梳理公开事故并按感知、规划、控制缺口归类。核心洞察是安全不应只等同于避撞或静止,而需理解人类权威、多模态指令和社会化交通规则;结果指出应引入人机交互感知、语言/无障碍规划及远程协助控制,推动从被动停车转向协作式自主。

A Deep Multiscale Neural Network for Accurate Neurological Disorder Detection from MRI Scans and Real-Time Web Deployment Figure 1
2026-06-30cs.CV

A Deep Multiscale Neural Network for Accurate Neurological Disorder Detection from MRI Scans and Real-Time Web Deployment

Ali Fatahi, Hoda Zamani, Mohammad H. Nadimi-Shahraki

Department of Computer Engineering, Na.C., Islamic Azad University, Najafabad, 8514143131, Iran, Big Data Research Center, Na. C., Islamic Azad University, Najafabad, 8514143131, Iran, International Graduate School of Artificial Intelligence, National Yunlin University of Science and

2026-06-30视觉感知

针对现有MRI神经疾病识别模型多偏向二分类、难以区分多病种细微解剖差异的问题,论文提出End-Net:以24层卷积和21个优化Inception模块进行多尺度特征提取,并用WGAN-GP过采样与欠采样缓解类别不平衡。实验称其在阿尔茨海默病、脑肿瘤、多发性硬化和健康对照的多分类上优于多种CNN基线,并部署为实时网页推理系统;但具体增益中模型结构与数据平衡策略的贡献边界仍需细看。

BTI-Net: Bidirectional Decoder-Level Task Interaction via Uncertainty-Aware Gating for Multi-Task Medical Image Analysis Figure 1
2026-06-30cs.CV

BTI-Net: Bidirectional Decoder-Level Task Interaction via Uncertainty-Aware Gating for Multi-Task Medical Image Analysis

Abdullah Al Shafi, Md Kawsar Mahmud Khan Zunayed, Safin Ahmmed, Sk Imran Hossain, Engelbert Mephu Nguifo

Khulna University of Engineering & Technology, Bangladesh, University Clermont Auvergne, France, Evaluated on three publicly available benchmarks span-

2026-06-30视觉感知安全鲁棒

针对医学图像多任务中共享编码器后分割与分类解码器相互隔离、边界线索和语义先验难以互补的问题,BTI-Net在各解码层引入双向任务交互,并用不确定性代理门控按样本和层级调节交换强度。三类医学数据集上同时提升分割IoU和分类准确率,消融显示自适应门控较固定交互带来+2.36 IoU,分类最高较强基线提升+2.26个百分点。

TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation Figure 1
2026-06-30cs.CV

TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

Zhi Tu, Liangkun Niu, Tianyi Zhang

Purdue University

2026-06-30视觉感知

TrafficAlign针对现有LLM生成自动驾驶交通场景时缺乏真实交通分布、地域特征和多样性的问题,提出从真实驾驶视频自动合成场景、用DSL做有效性校验并反馈修正,再用验证后的场景对LLM进行对齐微调的流程。实验显示,其生成场景在SafeBench上比最强基线多发现最高10.8%的碰撞,用于微调PPO、SAC、TD3后碰撞率较原模型最高下降36.1%,且在多地区定性分析中更接近真实交通分布。

HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers Figure 1
2026-06-30cs.CV

HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers

Jing Yang, Mayoore Jaiswal, Zian Wang, Steven Zeng, Rochelle Pereira, Yajie Zhao, Jianyuan Min

University of Southern California, Abstract. Diffusion-based video relighting enables controllable relighting from, a relit prompt anchor from a controllable generative model, which establishes, at https://research.nvidia.com/labs/sil/projects/horizonrelight/., making controllable relighting possible from a single input video [12,19]. In particular

2026-06-30视觉感知生成模型

针对长视频重光照中扩散模型只能按短片段滑窗推理、易在片段边界产生闪烁和外观漂移的问题,HorizonRelight将任务改写为目标域潜变量的连续传播:跨片段传递重光照潜状态,并用遮蔽自条件训练模型从不完整上下文续写,同时以生成模型给出的重光照锚点热启动首段。实验证明其在野外长视频和合成评测上显著降低边界不一致,G-buffer与最终重光照MSE均优于DiffusionRenderer,但极长链路下仍会损失细节。

From Fog Chamber to Aircraft Window: Pixel-Registered Imaging and Synthetic Fine-Tuning Enable Cross-Domain Defogging Figure 1
2026-06-30cs.CV

From Fog Chamber to Aircraft Window: Pixel-Registered Imaging and Synthetic Fine-Tuning Enable Cross-Domain Defogging

Alexander Ingold, Sabina D. Menon, Manya Yellepeddy, Alec Ikei, John D. Hodges, Jordan Baker, Syed N. Qadri, Rajesh Menon

Department of Electrical and Computer Engineering, University of Utah, Salt Lake City, UT 84112, USA, U.S. Naval Research Laboratory Remote Sensing Division, Washington DC 20375, USA., Abstract: A deep defogging pipeline pretrained on controlled laboratory fog and fine-tuned

2026-06-30视觉感知

针对去雾模型在合成数据、特定相机和场景间迁移差的问题,本文不提新架构,而是构建单相机雾室的5495组像素级配准雾/清图像,结合成对Laplacian难度指标与域随机合成雾微调。结果显示NAFNet在留出集达24.33dB/0.7912 SSIM,并能零目标训练迁移到自由流动雾和飞机舷窗iPhone视频,NIQE由6.22降至4.97,增益可能主要来自数据与训练域覆盖。

Complete virtual unwrapping and reading of a rolled Herculaneum papyrus Figure 1
2026-06-30eess.IV

Complete virtual unwrapping and reading of a rolled Herculaneum papyrus

Giorgio Angelotti, Stephen Parsons, Federica Nicolardi, Youssef Nader, Sean Johnson, David Josey, Paul Henderson, Hendrik Schilling, Johannes Rudolph, Forrest McDonald, Elian Rafael Dal Prá, Paul Tafforeau, Alessandro Mirone, Clifford Seth Parker, Jan Paul Posma, Benjamin Kyles, Claudio Vergara, Alessia Lavorante, Rossella Villa, Maria Chiara Robustelli, Marzia D'Angelo, Gianluca Del Mastro, Michael McOsker, Kilian Fleischer, Christy Chapman, Nat Friedman, William Brent Seales

EduceLab, University of, University of Glasgow, Glasgow, UK, University College London, London, UK, yond isolated demonstrations towards a scalable framework for systematic recovery of, team, academic collaborators and an online distributed community of contributors. That, of competition and collaboration. The 2023 Grand Prize established multi-column reading

2026-06-30视觉感知

这篇论文针对赫库兰尼姆碳化卷轴无法物理展开而长期不可读的问题,构建了从同步辐射相衬 µCT、三维层面重建、虚拟展开到机器学习墨迹增强和纸草学审读的端到端流程。核心进展不是局部识字,而是在明确覆盖与审读标准下完整展开并读取 PHerc.1667,同时在 PHerc. Paris 4 中实现可直接验证的三维墨迹分割,并将 PHerc.139 识别为 Philodemus《论诸神》第八卷。

Low-cost concept-based localized explanations: How far can we get with training-free approaches? Figure 1
2026-06-30cs.AI

Low-cost concept-based localized explanations: How far can we get with training-free approaches?

Darian Fernández-Gutiérrez, Rafael Bello, Marilyn Bello, Natalia Díaz-Rodríguez

assigning labels to bounding-box regions at both object and, large label spaces. Experiments with four MLLMs (7B–32B), tations are often unavailable, so explanations usually remain, Dept. of Computer Science, Central University ”Marta Abreu” of Las, Dept. of Computer Science and Artificial Intelligence, University of, assign semantic labels to localized regions under strict zero-, (bounding box) along with a closed set of candidate labels, small- and mid-scale MLLMs to assign semantic labels, semantic labels to image regions without task-specific fine-, Fine-grained labeling by concept-level naming, cepts are already available but do not address the challenge, of automatically obtaining concept labels at either the object

2026-06-30视觉感知

针对概念式可解释 AI 缺少细粒度区域标注、难以低成本验证的问题,本文评估中小型多模态大模型在零训练条件下为框选区域命名概念的能力,提出闭集 CoNa 与面向大标签空间的 Open-CoNa 协议。实验覆盖 PASCAL-Part、ADE20K、LIP 和 4 个 7B–32B 模型,对象级准确率约 62%–88%,说明其可辅助半自动概念标注,但部件级、幻觉和大词表场景仍是主要限制。

Flow Matching in Feature Space for Stochastic World Modeling Figure 1
2026-06-30cs.CV

Flow Matching in Feature Space for Stochastic World Modeling

Francois Porcher, Nicolas Carion, Karteek Alahari, Shizhe Chen

2026-06-30生成模型强化学习

本文针对视觉世界模型难以同时表达多模态未来和保留感知语义的问题,提出 FlowWM:直接在 DINOv3 等高维预训练特征空间中做 flow matching,并通过架构、时间步调度及可微一步投影加入时序一致性和任务监督。实验在合成随机场景与 Waymo 衍生 FuturePerception 上显示,其相较确定性预测器及 VAE/特征扩散基线提升感知性能、模式覆盖和长时域鲁棒性。

Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection Figure 1
2026-06-30cs.CV

Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection

Yang Guo, Zihan Yang, Feifei Kou, Yulan Hu, Ran Zhang, Siyuan Yao

Shenzhen Campus of Sun Yat-sen University, Beijing University of Posts and Telecommunications, Beijing, China, Hangzhou International Innovation Institute, Beihang University, Hangzhou, China, Renmin University of China, ing state-of-the-art methods by a large margin. Our code is available at

2026-06-30视觉感知

本文针对小目标像素少、易被多频段背景干扰且同类目标语义关系利用不足的问题,提出 SFDNet:用自适应频谱解耦将特征分为低/中/高频并按频段建模、重加权以抑制干扰,同时通过类级原型蒸馏约束同类小目标表征更紧凑。多项小目标检测基准实验显示其相较现有方法取得明显性能提升,但具体增益是否部分来自骨干或训练配置仍需结合完整消融判断。

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification Figure 1
2026-06-30cs.CV

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

Tsinghua University, tracking, and video-language reasoning, making it a natural benchmark for language-controllable

2026-06-30视觉语言视觉感知强化学习

这篇论文针对长视频时空定位中逐帧调用多模态大模型代价高、轨迹易抖动的问题,将推理单位从帧改为秒,并用跨秒平滑保持连续性;训练上结合CPT、带真值坐标替换的推理式SFT,以及基于tIoU+mvIoU验证器的强化学习。实验在VidSTG和HC-STVG及多FPS设置下显示,其在计算效率与定位质量之间取得更稳健折中。

Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis Figure 1
2026-06-30cs.CV

Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis

Chenghao Qian, Nedko Savov, Lingdong Kong, Yeying Jin, Rui Song, Wenjing Li, Zhun Zhong, Jiaqi Ma, Gustav Markkula, Luc Van Gool

University of Leeds, UK, INSAIT, Sofia University “St. Kliment Ohridski”, National University of Singapore, Singapore, University of California, Los Angeles, USA, Hefei University of Technology, China

2026-06-30视觉感知

本文针对现有天气视频合成依赖文本提示、难以生成高密度雨雪和可控粒子动态的问题,提出将语义外观锚定、物理粒子模拟与几何深度约束拆成三类条件信号,去激活预训练视频编辑器中的天气先验。实验显示其能生成更多样且时空一致的雨雪效果,并使自动驾驶语义分割在极端天气下最高提升14.5% mIoU。

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers Figure 1
2026-06-30cs.CV

Mural: Transferring LLM knowledge to image generation via Mixture-of-Transformers

Achin Jain, Jie An, Siddharth Chaudhary, Davide Modolo

2026-06-30视觉感知

本文关注在不更新大语言模型、且仅使用常规图文对训练时,LLM知识能否真正迁移到文生图。Mural将冻结的推理型LLM与扩散生成分支用MoT共享注意力连接,核心洞察是共享注意力可作为知识接口。实验相对同配方dense基线提升,并在GenEval 0.85、DPG-Bench 86.75、WISE 0.66上表现较强,还出现跨语言、颜色约束、emoji/ASCII到场景及世界知识生成等未显式监督能力。

SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization Figure 1
2026-06-30cs.CV

SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization

Jamie Menjay Lin, Jisoo Jeong, Hong Cai, Kai Wang, Fatih Porikli

Qualcomm Technologies, Inc., † Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc., relying solely on labeled synthetic data for optical flow esti-, mation. These approaches aim to leverage unlabeled target-, domain data and small amounts of labeled real-world data, ate augmented, unlabeled image pairs to support semi-, interference and its predictions are compared against the self-supervised labels predicted by the teacher to create the self-supervised loss., the need for real or pseudo optical flow labels, as well as, main shift and label scarcity in open-world scenarios., \lab e l {eq:di s tractflo w_l s elf} \begin {split}, ground truth labels, and a real-world dataset DNGT without

2026-06-30生成模型学习理论

针对光流模型依赖合成标注训练、部署到真实开放场景时域偏移明显的问题,SciFlow提出一种与网络无关的自监督微调策略:把无标注开放世界图像作为语义干扰混入合成帧,并用教师-学生、EMA与几何一致性/置信掩码约束学生预测接近干净样本上的教师伪标签。实验显示该方法在无需真实光流真值的情况下提升KITTI等跨域表现,并改善野外样本鲁棒性;但具体增益中各组件贡献仍需消融进一步厘清。

Learning from Acquisition: Metadata-driven Multimodal Pre-training for Cardiac MRI Figure 1
2026-06-30cs.CV

Learning from Acquisition: Metadata-driven Multimodal Pre-training for Cardiac MRI

Xueyi Fu, Liwei Hu, Zi Wang, Guang Yang

Department of Surgery & Cancer, Imperial College London, London, UK, Bioengineering Department and Imperial-X, Imperial College London, London, UK, National Heart and Lung Institute, Imperial College London, London, UK, Cardiovascular Research Centre, Royal Brompton Hospital, London, UK, School of Biomedical Engineering & Imaging Sciences, King’s College London, primarily on image-only pre-training and leave this naturally available, Their application to CMR is limited by the availability of paired clinical reports

2026-06-30视觉语言

这篇论文针对心脏 MRI 基础模型多依赖图像自监督、忽略扫描过程中天然产生的结构化元数据的问题,提出 MetaCLIP-CMR:把模态、解剖视角、厂商、场强和机型转成文本,用带软标签的 CLIP 式对比学习对齐图像序列与元数据语义。结果显示其在模态和 cine 视角分类上达到 86.8% 与 86.5%,并在 ACDC、M&Ms 短轴分割的全量和 20% 微调设置中优于 ImageNet 与掩码重建初始化;相较大规模图像预训练模型,用不到 1% 的预训练图像量取得接近分割表现。

Evidence-Based Text-Conditioned 3D CT Synthesis for Ovarian Cancer Figure 1
2026-06-30cs.CV

Evidence-Based Text-Conditioned 3D CT Synthesis for Ovarian Cancer

Francesca Pia Panaccione, Eugenio Lomurno, Francesca Fati, Carlotta Pecchiari, Marina Rosanu, Luigi De Vitis, Lucia Ribero, Gabriella Schivardi, Giovanni Damiano Aletti, Nicoletta Colombo, Maria Francesca Spadea, Francesco Multinu, Matteo Matteucci, Elena De Momi

AIRLab, Politecnico di Milano, Milan, Italy, NEARLab, Politecnico di Milano, Milan, Italy, Karlsruhe Institute of Technology, Karlsruhe, Germany, descriptors and routinely available clinical metadata, without accessing any original radiology report, and uses these, available at https://github.com/francescapia/OvESyn., status, are intentionally kept minimal: routinely available

2026-06-30三维

卵巢癌术前 CT 数据稀缺且报告不标准,限制了可控三维合成数据的构建。论文提出 OvESyn,从自动分割得到的影像特征和 FIGO、腹水等临床元数据生成结构化文本,再条件化潜扩散模型,而非依赖配对放射报告。实验表明,生成器微调是跨越胸部到腹盆腔域差异的关键,完整模型取得最佳分布与强度保真度,FID2.5D 为 29.35、Precision 为 0.671。

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution Figure 1
2026-06-30cs.CV

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

Institute of Software, Chinese Academy of Sciences, Beijing, China, University of Chinese Academy of Sciences, Beijing, China, School of Life Sciences, Tsinghua University, Beijing, China, Intelligent Science & Technology Academy of CASIC, Beijing, China

2026-06-30视觉感知规划控制

本文针对真实图像复原中多种退化耦合、工具调用顺序敏感的问题,指出现有智能体过度依赖贪心搜索且会遗忘已探索轨迹。SEAR 将复原建模为序贯决策,结合慢速的剪枝感知 MCTS 规划与快速的情景记忆执行,用无参考奖励和 MLLM 竞赛约束感知质量。实验称其在合成与真实基准上取得更好的感知和定量表现,但具体增益中规划、记忆与工具库各自贡献仍需看消融细节。

Character Recognition of Nepali Number Plate Figure 1
2026-06-30cs.CV

Character Recognition of Nepali Number Plate

Satyasa Khadka, Sandhya Baral, Sudip Tiwari, Sharad Kumar Ghimire

Pulchowk Campus, Institute of Engineering, Lalitpur, Nepal1, available data sets were used that incorporate diverse lighting, fonts, and, formance under real-world conditions and providing a scalable solution, This work utilizes two publicly available datasets from Kaggle, specifically tai-

2026-06-30视觉感知

针对尼泊尔车牌使用天城文、版式多行且字体和间距不统一,通用拉丁字符 ANPR 难以适配的问题,本文构建了车牌检测、字符检测与识别的级联流程:用 YOLO/YOLOv8 定位车牌和字符,再用 CNN 识别 34 类天城文字符,并通过增强及少量外部凸字牌数据补足鲁棒性。系统在公开数据集上报告最高约 93% 识别准确率,凸字牌验证准确率约 88%,但跨国家凸字数据带来的增益来源仍未充分说明。

ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images Figure 1
2026-06-30cs.CV

ExACT: Exemplar-Driven Calibrated Refinement for Training-Free Visual Grounding in Remote Sensing Images

Zixiao Zhang, Lingling Li, Pei He, Xu Liu, Licheng Jiao

Xidian University

2026-06-30视觉语言视觉感知

这篇论文针对遥感视觉定位中仅靠文本提示容易产生语义歧义、背景高响应和边界漂移的问题,提出训练自由的 ExACT:用一张视觉示例提供细粒度结构约束,结合 VEC 校准冻结 MLLM 的粗注意力先验,再由 SAR 生成正负几何提示驱动 SAM 分割。实验显示其优于现有训练自由和弱监督方法,消融中 SAR、视觉语义融合与视觉校准均带来明显增益,1-shot 已接近多示例效果。

What Color is the Sky (for a non-human) ? Figure 1
2026-06-30cs.CV

What Color is the Sky (for a non-human) ?

Yair Weiss, Ofer Springer

School of Computer Science and Engineering and Edmond and Lili Safra Center for, School of Computer Science and Engineering, Hebrew Univesity of Jerusalem ∗E-mail:

2026-06-30视觉感知

论文追问“天空为何是蓝色”在非人视觉系统中是否仍成立,动机是把物理光谱与观察者光感受器响应区分开。作者提出用任意物种的光谱敏感函数搜索与天空光同色异谱的单色光/白光混合,从而定义主导波长。结果显示,人类约对应蓝光,但蜜蜂、壁虎、鸡等物种的匹配波长可落在约400–480nm,合成系统甚至更宽,说明天空“颜色”主要由感受器决定而非仅由瑞利散射决定。

Projection-based coupling of infrared thermography and stereocorrelation-based digital image correlation Figure 1
2026-06-30cs.CV

Projection-based coupling of infrared thermography and stereocorrelation-based digital image correlation

Jendrik-Alexander Tröger, Lutz Müller-Lohse, Stefan Hartmann

Institute of Applied Mechanics, Clausthal University of Technology

2026-06-30视觉感知

论文面向实验固体力学中 3D-DIC 位移点云与红外热像二维温度难以统一到同一拉格朗日材料点的问题,提出用针孔相机投影矩阵把独立标定的工业 DIC 与 IRT 系统外部耦合,并用时空 RBF 插值求曲面温度梯度和温度率。圆柱半壳与拉扭管实验显示,该方法能在曲面材料点上重建温度场和梯度;温度率结果受红外噪声限制,需进一步平滑或回归处理。

On Test-Time Scaling for Vision-Language Models Figure 1
2026-06-30cs.CV

On Test-Time Scaling for Vision-Language Models

Fawaz Sammani, Tzoulio Chamiti, Nikos Deligiannis

ETRO Department, Vrije Universiteit Brussel, Belgium

2026-06-30视觉语言视觉感知

这篇论文针对LLM测试时扩展方法能否直接迁移到视觉语言模型的问题,系统比较九种推理、采样、聚合与自修正策略在多模型、多基准上的表现。核心洞察是,额外推理计算并非越多越好:小而强的LVLM在推理任务上收益最大,可接近或超过大模型基线,但感知任务会因过度思考而退化;注意力分析还显示视觉信息主要在推理链早期被编码,随后转为文本内推理。

HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector Figure 1
2026-06-30cs.CV

HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector

Bo Ma

Auckland University of Technology, the wrong box or label. We argue this is a binding failure: in, return wrong labels or imprecise boxes. We call this the see-, lations, and hypotheses—centered on reasoning and refer-

2026-06-30视觉语言

本文针对推理式视觉定位中 VLM“看对但说错”、检测器又缺乏意图推理的问题,将定位交给冻结的开放词汇检测器,把语言模型产生的指代表征通过轻量 alignment hook 与区域表征绑定,并用感知一致性 veto 抑制无区域支撑的命名。在 RefCOCO 系列和 POPE 上,仅训练 hook 相比未训练跨空间匹配提升 50–90 倍,POPE 准确率升至 0.66–0.76,幻觉显著下降;但绝对定位仍受 proposal recall 限制。

EpiSAM: Character Segmentation in Challenging Stone Inscriptions Figure 1
2026-06-30cs.CV

EpiSAM: Character Segmentation in Challenging Stone Inscriptions

Arnav Sharma, Pratyush Jena, Amal Joseph, Ravi Kiran Sarvadevabhatla

Center for Visual Information Technology, International Institute of Information

2026-06-30视觉感知

石刻铭文因侵蚀、低对比和复杂连字而难以用常规文档 OCR 处理,EpiSAM 将问题前移到字符级实例分割,并在 SAM 式提示分割中显式联合预测目标字符及相邻字符,以邻域上下文缓解边界歧义。论文还补充了字符多边形标注数据集;实验显示其较基线分割精度更高,并具备一定跨脚本、跨风格零样本泛化能力。

Personalizing MLLMs via Reinforced Multimodal Reference Game Figure 1
2026-06-30cs.CV

Personalizing MLLMs via Reinforced Multimodal Reference Game

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

University of Trento, Trento, Italy

2026-06-30视觉语言

这篇论文针对 MLLM 个性化中概念描述常混入状态、背景等干扰信息的问题,提出将个性化识别重构为多模态 reference game:同一模型扮演 speaker 与 listener,在 hard positives 和 hard negatives 构成的对比场景中,用可验证胜负奖励经 GRPO 训练生成更具区分性且相对不变的概念描述。实验显示 RRG 在 Yo’LLaVA、MyVLM、PerVA 的 captioning 与 VQA 个性化任务上优于描述式方法和已有 RL 个性化框架,并能泛化到未见领域。

DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming Figure 1
2026-06-30cs.CV

DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming

Zhihui Ke, Yuyang Liu, Xiaobo Zhou, Tie Qiu

2026-06-30视觉感知

DLGStream针对3DGS自由视点视频难以同时满足低码率、高帧率与开放词汇交互的问题,将动态语言特征与高斯属性一起流式传输。其关键洞察是颜色与语言特征共享不透明度会相互干扰,因此引入双不透明度,并用时间特征插值的变形场压缩时序冗余、支持帧插值。实验显示其在开放词汇分割上mIOU提升约9%,保持较好重建质量,平均帧大小约43KB。

Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video Figure 1
2026-06-30cs.CV

Ground4D: Consistency-Aware 4D Reconstruction from Monocular Video

Qing Zhao, Weijian Deng, Pengxu Wei, Liang Lin

Qing Zhao, Pengxu Wei, and Liang Lin are with the School of Com-, puter Science and Engineering, Sun Yat-sen University, China. (e-mail:, Weijian Deng is with the Tsinghua Shenzhen International Graduate School

2026-06-30视觉感知三维

Ground4D针对单目动态4D重建中“渲染质量高但几何易漂移、基础模型几何稳但不适合真实感渲染”的矛盾,先用VGGT免训练恢复一致几何与相机位姿初始化动态高斯,再在观测和虚拟视角用同源几何深度约束细化。实验显示其同时提升几何重建精度和动态新视角合成质量,但长视频计算开销仍是限制。

RefGlass-GS: A UAV-Enabled Fusion Framework for Photorealistic, Semantic and Interactive Digitization of Reflective Glass Facades via Gaussian Splatting Figure 1
2026-06-30cs.CV

RefGlass-GS: A UAV-Enabled Fusion Framework for Photorealistic, Semantic and Interactive Digitization of Reflective Glass Facades via Gaussian Splatting

Zhenyu Liang, Xiao Zhang, Boyu Wang, Zhaolun Liang, Ang Li, Jeff Chak Fu Chan, Mingzhu Wang, Jack C.P. Cheng

a Department of Civil and Environmental Engineering, The Hong Kong University of Science and, b Department of Civil and Environmental Engineering, University of Maryland, College Park, Maryland, c Department of the Built Environment, National University of Singapore, Singapore, d Department of Architecture and Civil Engineering, City University of Hong Kong, Hong Kong, China

2026-06-30三维

针对玻璃幕墙反射导致摄影测量/激光重建失真、纹理视角依赖强且难以按面板语义管理的问题,RefGlass-GS把无人机视点规划、基于结构先验的单块玻璃分割、带Reflection MLP的延迟着色GS和对象化数据组织串成端到端流程。真实幕墙实验显示,分割mIoU较SOTA提升0.1927,视点规划使PSNR提升13.15 dB,反射建模较GS基线平均提升5.08 dB。

CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video Figure 1
2026-06-30cs.CV

CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video

Jerrin Bright, John Zelek

Vision and Image Processing Lab, University of Waterloo, Canada

2026-06-30视觉感知三维

这篇论文针对单目视频中人体、被操作物体与背景运动模型不同却共享像素,导致动态重建易发生运动/几何串扰的问题,提出 CoGS:将场景拆成人体、刚体物体和静态背景三条 Gaussian Splatting 分支,并用可见性锚定、物体轮廓/运动约束与六阶段优化逐步融合。实验在 HOSNeRF 和 NeuMan 上显示其提升全帧、人像及人-物重建质量,尤其有利于遮挡和弱观测区域。

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models Figure 1
2026-06-30cs.CV

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

2026-06-30强化学习

ViPSim针对具身世界模型在长时序预测中因低维动作与高维视频缺乏几何对应而产生轨迹漂移、接触不一致的问题,提出视觉空间与参数空间协同:前者用末端位姿投影、相机、深度几何和机器人形态掩码提供像素级约束,后者注入动作序列与相机矩阵提供数值驱动。实验显示该方法可跨生成骨干提升轨迹一致性,并在布料等可变形物体、OOD与跨本体场景中保持较稳健表现。

PSP: Harnessing Position and Shape Priors for Cross-Domain Few-Shot Medical Image Segmentation Figure 1
2026-06-30cs.CV

PSP: Harnessing Position and Shape Priors for Cross-Domain Few-Shot Medical Image Segmentation

Bin Xu, Yazhou Zhu, Haofeng Zhang

School of Computer Science and Engineering, Nanjing University of Science and, ods. Code is available at https://github.com/xubin471/PSP.

2026-06-30视觉感知

这篇论文针对少样本医学分割在 MRI、CT 等跨模态场景中因纹理差异导致性能崩塌的问题,提出利用器官位置与几何形状在不同域中相对稳定的先验。PSP 通过位置坐标嵌入、形状原型调制和混合原型预测,减少对域特定纹理的依赖并校准支持/查询特征分布。文中在腹部和心脏公开数据集上报告优于现有方法,但摘要未给出具体数值。

Virtual Ring Try-On Figure 1
2026-06-30cs.CV

Virtual Ring Try-On

Vishnu D. Burkhawala, Zankhana J. Barad, Harshadkumar B. Prajapati, Vipul K. Dabhi

Department of Information Technology, Dharmsinh Desai University

2026-06-30视觉感知

面向线上珠宝购物中试戴不真实、AR/生成式方案依赖高端硬件的问题,本文提出用 MediaPipe 定位手部、YOLOv8 分割戒指,再以向量几何完成旋转、缩放和 alpha 融合的轻量流程。其核心洞察是保留原手部图像并只做角度感知的局部合成,可避免手部被重绘或戒指漂浮;结果显示系统可在普通移动端生成贴合手指的戒指效果,但文中未充分说明量化评测和用户研究。

BREIT: A Framework for Brain Stroke Reconstruction using Multi-Frequency 3D EIT Figure 1
2026-06-30cs.CV

BREIT: A Framework for Brain Stroke Reconstruction using Multi-Frequency 3D EIT

Djahid Abdelmoumene, Ishak Ayad, Maï K. Nguyen, Christian Daveau

ETIS (UMR 8051), CY Cergy Paris University, ENSEA, CNRS, Cergy France, AGM (UMR 8088), CY Cergy Paris University, CNRS, Cergy, France, Paris-Saclay University, CentraleSupélec, Inria, CVN, Gif-sur-Yvette, France, parable CC across noise settings. Code and data are publicly available, and often unavailable for pre-hospital, bedside, or resource-limited use [32]. In

2026-06-30三维

本文针对卒中场景中三维多频 EIT 缺少成对真值数据、仿真与评测流程不统一的问题,提出 BREIT,将 CT/MRI 转为频率相关导纳体、配套 3D CEM 正问题求解器和非均匀电极 3D D-bar 工具,并在此上构建 dFNO-bar 学习散射数据到电导率的映射。合成 UCLH 匹配数据上,其脑区 SSIM 高于 D-bar、Deep D-bar 和 Gauss–Newton,CC 相近,但临床泛化仍待验证。

Stochastic Optimal Control Sampling for Diffusion Inverse Problems Figure 1
2026-06-30cs.CV

Stochastic Optimal Control Sampling for Diffusion Inverse Problems

Jie Zhang, Youmei Qiu, Hanling Tian, Jingyuan Zhang, Xiang Yin, Xiaolin Huang

School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute, of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China, inverse problems. The key is to controllably steer the sampling trajec-, available at https://github.com/zjqwq01/SOCS-DIP.

2026-06-30生成模型规划控制

本文针对扩散模型求解图像逆问题时“既要满足观测约束、又不能破坏生成先验”的矛盾,将去噪采样视为随机最优控制过程。核心创新是避免全轨迹 iLQR 优化,推导逐步闭式控制更新,把测量一致的干净估计拉回去噪流形,并通过可调控制强度限制过度干预。实验覆盖多类逆问题、VE/VP-SDE 及潜空间扩散/Flow Matching,显示在重建一致性、视觉质量和定量指标上优于多种采样基线。

Multimodal Graph RAG for Long-range Visually Rich Document Understanding Figure 1
2026-06-30cs.IR

Multimodal Graph RAG for Long-range Visually Rich Document Understanding

Yi-Cheng Wang, Chu-Song Chen

Department of Computer Science and Information Engineering, National Taiwan University, FinTech Center, National Taiwan University, Our code is available on https://github.com/AI-, Application-and-Integration-Lab/KG4VD.

2026-06-30视觉语言

论文针对长篇视觉丰富文档中,页级多模态检索难以回答跨页、全局 VQA 的问题,提出 KG4VD:自适应地从文本、图像与版面区域构建可复用多模态知识图,并以页面锚定结合查询自适应 PPR 扩展降低图检索噪声。作者还构建含参考摘要和支撑事实的 DLVQA,用于评估忠实性、完整性与简洁性;实验显示其在多跳 QA/VQA 和 DLVQA 上优于 MMRAG 与图 RAG 基线。

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving Figure 1
2026-06-30cs.CV

X-Mind: Efficient Visual Chain-of-Thought via Predictive World Model for End-to-End Driving

Bohao Zhao, Chengrui Wei, Guangfeng Jiang, Ruixin Liu, Xuejie Lv, Liu Liang, Sutao Deng, Xiuyang Fan, Pengkun Zheng, Jinyun Zhou, Rui Guo, Hanpeng Liu, Yutong Zheng, Yi Guo, Xinlong Zheng, Qingyu Luo, Zhuangzhuang Ding, Yu Zhang, Hang Zhang, Xianming Liu

PWM Team, XPeng Inc.

2026-06-30强化学习

针对端到端自动驾驶VLA模型多依赖即时感知、缺少预测未来能力的问题,X-Mind将预测世界模型内化为视觉思维链:用融合BEV布局、导航意图和交通规则的抽象草图替代密集视频预测,并以DC-AE压缩到96个token,再用循环块扩散在一次前向中完成未来 rollout。文中称其在大规模真实数据上取得有竞争力的驾驶表现和低延迟部署潜力,但具体增益来源仍需更多消融支撑。

A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models Figure 1
2026-06-30cs.CV

A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models

Nuo Chen, Lulin Liu, Zihao Li, Ziyao Zeng, Zihao Zhu, Wenyan Cong, Junyuan Hong, Yunhao Yang, Zhengzhong Tu, Yan Wang, Boris Ivanovic, Marco Pavone, Zhangyang Wang, Yang Zhou, Zhiwen Fan

2026-06-30强化学习数据集/基准

本文针对自动驾驶世界模型常以视觉质量掩盖物理错误的问题,提出 CrashTwin 基准:用 25K 合成碰撞与 12K 真实事故视频,结合免标定重建,从单目 rollout 提取轨迹、速度等 3D 物理量,并评估时空一致性、动量/能量守恒和世界动态完整性。实验显示,现有高感知质量模型在复杂碰撞中仍有明显物理违规,物理指标也比传统视觉指标更贴近人类对真实感的判断。

BLUE: A Stale-Pixel Optical-Flow Compositor for Entropy-Efficient Surveillance Video Encoding Figure 1
2026-06-30eess.IV

BLUE: A Stale-Pixel Optical-Flow Compositor for Entropy-Efficient Surveillance Video Encoding

Shubham Baid, Akash James, Sahil Chachra, Nishant Sinha, Kunal Kislay

KGrpah AI Solutions Pvt. Ltd., Bangalore, India. 560016

2026-06-30视觉感知生成模型

面向固定摄像头监控视频中大量比特反复编码静态背景的问题,BLUE在编码前用光流运动掩码保留前景、以持久种子帧替换背景像素,使标准H.264/H.265更易产生SKIP块且无需改码流或解码器。在VIRAT 308段评测中,CRF28下平均减小文件34.6%/39.4%,前景PSNR在60.7%片段持平或提升,但全帧VMAF中位下降6.75–8.59,需用质量门控选择性启用。

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution Figure 1
2026-06-30cs.CV

FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution

Minh Son Hoang, Dinh Phu Tran, Quyen Nguyen Duc, Dam Hoang Phuong, Daeyoung Kim

School of Computing, KAIST, Republic of Korea

2026-06-30视觉感知强化学习

这篇论文针对真实图像超分中保真度与感知质量难兼顾、且退化类型多样的问题,提出 FreqOrtho-SR:用 FFT 频域退化特征为不同 LoRA 专家路由,并通过正交梯度投影把语义增强更新限制在像素保真子空间的零空间中,减少目标冲突。实验显示其在多个基准上取得有竞争力的整体表现,在单步扩散推理下保持较好的保真—感知权衡。

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation Figure 1
2026-06-30cs.CV

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

aCollege of Computer Science and Electronic Engineering, Hunan University, China, bGuangxi Minzu University, China, cNational University of Defense Technology, China, performance. Code is available at https://github.com/user-jinhong/, rather than static object labeling. This makes ICCS more challeng-

2026-06-30视觉语言视觉感知

传统图像变化描述只给文字,容易因目标或颜色歧义而缺少可定位性;本文提出 ICCS 任务,并用 CCRC 双链框架先通过变化感知注意力生成结构化描述与可分割判断,再在需要时利用语义先验细化像素级掩码。作者还为两个基准补充分割标注,实验称在合成与真实变化数据上同时提升描述和分割表现,达到 SOTA。

Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation Figure 1
2026-06-30cs.CV

Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation

Yishu Zhang, Shushan Wu, Zhenzhong Zhang, Didong Li, Huaxiu Yao, Yun Li, Iain Carmichael, Katherine A. Hoadley, Hongtu Zhu, Di Wu, Daiwei Zhang

University of North Carolina at Chapel Hill, labs and devices in high-stake medical settings [3, 44]. For, main labels from multiple sites to enforce invariance. Re-, state, which is not available for frontier proprietary models., stantially larger visual-token capacity than is available in, scalable by enabling the selection of a manageable subset

2026-06-30安全鲁棒

这篇论文针对病理基础模型易把染色、扫描仪和机构来源等批次效应编码进特征、导致跨中心泛化和安全性下降的问题,提出 GLMP:先用多模态大模型把切片块转成强调细胞形态与组织结构、过滤颜色亮度等伪影的文本,再由文本编码器生成数值嵌入。实验表明其相较常规 PFM 更弱化 TSI 信号、保留生物差异,在下游分析中获得更稳健的跨机构表示。

LogiCo: A Unified Framework for Logical and Structural Anomaly Detection Figure 1
2026-06-30cs.CV

LogiCo: A Unified Framework for Logical and Structural Anomaly Detection

Ximiao Zhang, Min Xu, Xiuzhuang Zhou

School of Intelligent Engineering and Automation, Beijing University of Posts and, College of Information and Engineering, Capital Normal University, Beijing, China, crete component-level feature space and performs collaborative feature, The code is available at https://github.com/cnulab/LogiCo.

2026-06-30视觉感知

这篇论文针对工业视觉中结构缺陷与逻辑异常难以统一检测的问题,指出单纯局部建模缺少长程约束,而全局语义分支又牺牲细粒度定位。LogiCo用组件级离散特征重建来表达部件间逻辑关系,并结合补丁级结构重建与分割图判别器处理数量异常。在MVTec-LOCO、MVTec-AD、VisA和Real-IAD上取得逻辑与结构异常检测的SOTA或可比结果。

SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending Figure 1
2026-06-30cs.CV

SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending

Haoran Bai, Xiaoxu Chen, Xiaoyu Liu, Zongsheng Yue, Sibin Deng, Wangmeng Zuo, Ying Chen

Harbin Institute of Technology, Xi’an Jiaotong University

2026-06-30视觉感知生成模型规划控制

这篇论文针对扩散式视频修复依赖数十步去噪、而单步蒸馏又容易丢失纹理和时序稳定性的矛盾,提出用辅助预测器跳过早期低 SNR 阶段,并用 SNR 感知轨迹混合缓解预测器与去噪器联合训练时的训练—推理不一致;同时引入 DDC 特征一致性损失提升初始预测质量。实验显示 SATB-VR 在不超过 5 步推理下,可在合成、真实和 AIGC 视频修复基准上达到或超过若干 50 步方法。

Predicting Metastatic Risk from Primary Tissue Architecture via Distance-Aware Spatial Modeling Figure 1
2026-06-30cs.CV

Predicting Metastatic Risk from Primary Tissue Architecture via Distance-Aware Spatial Modeling

Sandesh Pokhrel, Hamid Manoochehri, Bodong Zhang, Beatrice S Knudsen, Tolga Tasdizen

Department of Electrical and Computer Engineering, University of Utah, Scientific Computing and Imaging Institute, University of Utah, Department of Pathology, University of Utah, to predict a slide-level label. While effective for tasks where the mere presence of

2026-06-30安全鲁棒

这篇论文针对传统WSI多实例学习把切片视为无序patch、难以刻画转移风险所依赖的肿瘤-微环境空间结构的问题,提出DTMf-MIL:先用K-means或CONCH形成表型区域,再以SDF、RBF、多尺度边界梯度和局部统计量显式编码patch到各组织表型的距离关系。结果显示其在VA前列腺转移风险预测上优于现有MIL方法,并在PANDA、Camelyon16和TCGA-NSCLC等任务中带来一致提升。

BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production Figure 1
2026-06-30cs.CV

BackTranslation2.0 -- A Linguistically Motivated Metric to Assess Sign Language Production

Oliver Cory, Maksym Ivashechkin, Karahan Sahin, Oline Ranum, Jianhe Low, Edward Fish, Anton Pelykh, Ozge Mercanoglu Sincan, Richard Bowden

Centre for Vision, Speech and Signal Processing, University of Surrey, Guildford, UK, same quality dimensions, following a protocol developed in collabora-, expert annotation is expensive and time-intensive, limiting scalability [11].

2026-06-30视觉感知

针对手语生成评测长期依赖回译、与聋人评审相关性弱的问题,本文提出 BackTranslation2.0:用确定性 agentic 流水线整合语法、音系、运动流畅度和视觉保真度工具,并由 LLM 做跨工具一致性核查后加权评分。作者构建带人工多维评分的 BSL 数据集,并与六类基线比较,结果显示该指标在各维度上更接近人类判断,强调评测应显式建模手语语言学结构而非只比文本回译。

SemDynReg: Semantics-Guided Deformation Regularization for Dynamic 3D Gaussian Splatting Figure 1
2026-06-30cs.CV

SemDynReg: Semantics-Guided Deformation Regularization for Dynamic 3D Gaussian Splatting

Ruitao Chen, Mozhang Guo, Jinge Li

2026-06-30三维

这篇论文针对动态 3DGS 依赖物体无关形变场、易导致同一物体内高斯形变不一致和跨物体耦合的问题,引入由 SAM/CLIP 语义和对象字典构建的 object-ID 图,并对每个对象像素贡献最大的 top-k 高斯在位置、尺度、旋转上施加一致性正则。实验主要在两组自动驾驶动态场景中验证,车辆边界和细节更稳定,平均 PSNR/SSIM 提升、LPIPS 下降,但场景规模较小,泛化性文中未充分说明。

FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration Figure 1
2026-06-30cs.CV

FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration

Thiru Thillai Nadarasar Bahavan, Sachith Seneviratne, Saman Halgamuge

FedLAS: Feature-Modulated Bidirectional Label, The University of Melbourne, Parkville, Australia, correct predictions or under-confident correct predictions. Label smooth-, ground-truth label to the remaining classes. LS, including Margin-based, propose FeDLaS: Feature-Modulated Bidirectional Label Smoothing, a, plug-and-play algorithm for label smoothing-based losses. In FeDLaS, Keywords: Network Calibration · Uncertainty Estimation · Label Smooth-, bels. The use of one-hot encoded labels (Fig. 1(a)) encourages the models to, exhibit overconfidence, even when predictions are incorrect [10]. Label smooth-, training by redistributing the probability mass from the ground-truth label to, calibration methods are implicitly sample-adaptive variants of label smoothing, troduce NCI, a label-free indicator leveraging hidden-layer feature norms.

2026-06-30视觉感知

这篇论文针对常规标签平滑只按固定规则缓解过置信、难以处理欠置信和训练动态变化的问题,提出 FeDLaS:用隐藏层特征范数作为置信指示,并结合双向校准门控逐样本调节平滑强度。实验覆盖 CIFAR、Tiny-ImageNet 和细粒度高分辨率数据集,结果显示其在基本保持 Top-1 准确率的同时降低 ECE 与 Adaptive ECE。

Obliviate: Erasing Concepts from Autoregressive Image Generation Models Figure 1
2026-06-30cs.CV

Obliviate: Erasing Concepts from Autoregressive Image Generation Models

Hossein Shakibania, Jonas Henry Grebe, Tobias Braun, Ege Aktemur, Saleh Aslani, Mehmet Görkem Yiğit, Marcus Rohrbach

2026-06-30视觉感知

自回归文生图模型正被用于统一多模态生成,但扩散模型中较成熟的概念擦除方法难以直接迁移,带来安全缺口。Obliviate 的关键在于用对齐视觉前缀构造稳定的伪无条件分支,并以 KL 监督整段自回归轨迹上的视觉 token 分布,从而避免单步或未对齐更新破坏生成能力。实验覆盖 Liquid、Emu3-Gen、Janus-Pro,在裸露、血腥和品牌擦除上优于现有替代方法,RAB 裸露检出率从 91.58 降至 3.15,同时保持总体效用。

AEGIR: Modeling Area Emitters for Indoor Inverse Rendering using Gaussian Splatting Figure 1
2026-06-30cs.CV

AEGIR: Modeling Area Emitters for Indoor Inverse Rendering using Gaussian Splatting

Mohamed Shawky Sabae, Philipp Langsteiner, Jan-Niklas Dihlmann, Hendrik Lensch

University of Tübingen

2026-06-30三维

AEGIR针对室内逆渲染中环境光图、点光源或隐式光场难以表达近距离真实灯具面积、导致衰减和软阴影错误的问题,在Gaussian Splatting中显式引入可优化的局部面积发光体,并用各向异性尺度、Super-Gaussian角度衰减、可微延迟渲染和正则约束联合恢复几何、PBR材质与光照。实验显示该建模提升了光照重建,并改善新视角合成、可控重照明和虚拟物体插入,尤其适合复杂局部照明场景。

Physics-Grounded Disentangled Flow Modeling for Brain Disease Progression Trajectory Figure 1
2026-06-30cs.CV

Physics-Grounded Disentangled Flow Modeling for Brain Disease Progression Trajectory

Jun Wang, Peirong Liu

Department of Electrical and Computer Engineering, Data Science and AI Institute, Johns Hopkins University, publicly available at https://github.com/jhuldr/PDF.

2026-06-30生成模型规划控制

针对纵向脑部病灶预测中常见的端到端图像翻译难以区分结构形变与信号变化、物理一致性不足的问题,论文提出 PDF,将病程轨迹拆成形态演化和强度演化两条 flow matching,并用 Fisher-KPP 启发的扩散-反应-平流 PDE 正则约束形态速度场。三组公开纵向 MRI 数据上取得优于既有方法的预测表现,并显示更合理的病灶结构演化。

Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation Figure 1
2026-06-30eess.IV

Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation

Mudit Agarwal, Amit D. Bhrany

University of Washington, Department of Otolaryngology–Head and Neck Surgery, University of Washington School of Medicine, et al., 2021] unavailable in standard clinics, and full-face diffusion models drift identity across

2026-06-30生成模型数据集/基准三维

针对鼻整形术前沟通中3D设备昂贵、2D草图不真实且全脸生成易漂移身份的问题,Envisage用单张正脸照、手术区域掩膜、深度条件FLUX填充和硬合成,只改鼻部并保留非手术区域;同时提出按掩膜分解的SurgicalScore,指出全脸ArcFace会被复制像素混淆。在211例评测中其ArcFace负差最小、SurgicalScore最高,但所有方法仍未相对术前输入取得正ArcFace增益,说明局部手术编辑更应看区域保真度。

SIGNET: Motion-Level Knowledge Transfer for Cross-Language Sign Language Translation Figure 1
2026-06-30cs.CV

SIGNET: Motion-Level Knowledge Transfer for Cross-Language Sign Language Translation

Sobhan Asasi, Ozge Mercanoglu Sincan, Richard Bowden

CVSSP, University of Surrey, United Kingdom, training data and computation, limiting scalability and making it difficult for

2026-06-30视觉感知

这篇论文针对手语翻译模型常被限定在单一语种/数据集、难以复用跨语种运动知识的问题,提出 SIGNET:把在 ASL、BSL、CSL 等数据上预训练的骨架式手语骨干冻结为视觉专家,用手部先验和门控融合按输入选择专家,并用低秩残差与对比对齐适配新语种。实验称其在 How2Sign、Phoenix14T、CSL-Daily、MeineDGS 上达到最佳翻译表现,并在 WLASL 识别上超过既有方法。

Meshtryoshka: Differentiable Rendering of Real-World Scenes via Mesh Rasterization Figure 1
2026-06-30cs.CV

Meshtryoshka: Differentiable Rendering of Real-World Scenes via Mesh Rasterization

David Charatan, Daniel Xu, Richard Szeliski, George Kopanas, Vincent Sitzmann

Massachusetts Institute of Technology, University of Washington, Massachusetts Institute of Technology Cambridge Massachusetts United States, University of Washington Seattle Washington United States

2026-06-30强化学习

这篇论文针对可微渲染长期依赖体表示或专用渲染器、难以直接产出可移植网格的问题,提出 Meshtryoshka:从 SDF 每步提取多层嵌套网格壳,用普通三角光栅器分别渲染并 alpha 合成,梯度经透明度回传到 SDF 而非顶点位置。结果显示其在物体场景接近表面法,并能扩展到无界真实场景,视图合成质量接近非网格 SOTA,但训练较慢、三角形数量大且会出现浮游伪影。

IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion Figure 1
2026-06-30cs.CV

IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion

Lizhou Lin, Songpengcheng Xia, Zengyuan Lai, Lan Sun, Jiarui Yang, Ling Pei

Shanghai Jiao Tong University, human–robot collaboration [4, 6, 19, 33, 35, 40, 41]. While, sensors, limiting scalability. A key milestone was sparse, raise privacy and scalability concerns in real-world deploy-

2026-06-30视觉感知

这篇论文针对视觉式人-物交互捕捉易受遮挡、传统稀疏 IMU 又只估人体不估物体的问题,提出 IMU-HOI:在人体和物体上贴 IMU,先从惯性流估计手-物接触概率,再用接触门控在手部正运动学与物体 IMU 积分之间融合,同时优化人体姿态和根平移。实验称其在三个 HOI 基准上降低物体平移与交互误差,并可插入现有稀疏 IMU 姿态骨干;但复杂滑动、多接触和可变形物体仍未充分处理。

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation Figure 1
2026-06-30cs.CV

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

University of California, Berkeley, settings. Code and data are available at anya-ji.github.io/animation2code-website.

2026-06-30视觉感知

这篇论文针对现有视觉语言模型在静态图像到代码任务表现较好、但是否真正理解视频运动仍不清楚的问题,提出 Animation2Code:用 1069 个网页动画视频及其 HTML/CSS/JavaScript 代码评测视频到可执行动画代码的反渲染能力,并用外观相似度与时序相似度分离衡量视觉还原和运动对齐。实验显示,多种强模型代码可执行率接近满分、外观相似度最高 0.84,但时序相似度最高仅 0.31,微调和迭代修正也未显著弥合运动推理缺口。

SatSplat: Geometrically-Accurate Gaussian Splatting for Satellite Imagery Figure 1
2026-06-30cs.CV

SatSplat: Geometrically-Accurate Gaussian Splatting for Satellite Imagery

Shuang Song, Jiyong Kim, Rongjun Qin

The Ohio State University, The project page is available at https://gdaosu., commonly available in satellite imaging. We evaluate the

2026-06-30视觉感知三维

SatSplat针对多时相高分辨率卫星影像中光照变化、阴影和初始相机误差导致3DGS几何不稳的问题,将2D Gaussian Splatting改写到仿射卫星相机下,并联合在线相机校正、几何阴影映射、逐相机颜色校正和DSM感知初始化。文中在DFC2019与IARPA2016评测中报告其几何精度优于既有3DGS基线,在处理后的DFC2019上MAE降低11.93%、峰值显存降低31%。

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG Figure 1
2026-06-30cs.CV

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG

Deep Ghosal, Ishani Sen, Wazib Ansar, Amlan Chakrabarti

A.K. Choudhury School of Information Technology, University of Calcutta, inherently subjective and unscalable, or basic computer vision (CV) systems limited to quantitative, tracking and actionable coaching insights, offering a scalable, objective solution for national talent, identification and performance assessment faces a critical bottleneck: scalability versus depth. Organizations such, approach is inherently subjective, labor-intensive, and prone to “observer fatigue,” leading to inconsistencies where, effectively democratizing elite-level sports analytics for scalable, mass-population testing.

2026-06-30视觉语言

本文针对大规模运动员选拔中人工评估主观且难扩展、传统视觉系统只会计数的问题,提出由LangGraph编排的VLM+MediaPipe多智能体框架,将动作几何量化、疲劳/姿态退化等语义判断、LLM自校验与ChromaDB RAG检索结合。实验称3×3 Smart Grid将多模态视频处理开销降低超88%,并把原始生物力学记录转化为可自然语言查询的教练洞察,但具体精度增益与对比细节文中片段未充分说明。

KM-Speaker: Keypoint-Based Style Control for High-Quality Speech-Driven 3D Facial Animation and Dialogue Localization Figure 1
2026-06-30cs.CV

KM-Speaker: Keypoint-Based Style Control for High-Quality Speech-Driven 3D Facial Animation and Dialogue Localization

Arthur Josi, Emeline Got, Abdallah Dib, Luiz Gustavo Hafemann, Rafael M. O. Cruz

2026-06-30规划控制三维

面向影视和游戏中语音驱动三维面部动画难以同时保证真实感与可控性的问题,KM-Speaker用参考表演的稀疏关键点提供全局风格和逐帧上半脸时序控制,并通过流模型、唇部音频驱动/上脸关键点驱动解耦及模态 dropout 保持整脸一致性。实验和用户研究显示,其在高质量小数据设定下优于现有方法,提升唇同步、风格贴合和配音式对白本地化效果。

DataComp-VLM: Improved Open Datasets for Vision-Language Models Figure 1
2026-06-30cs.CV

DataComp-VLM: Improved Open Datasets for Vision-Language Models

Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy

2026-06-30视觉语言视觉感知数据集/基准

这篇论文针对自回归视觉语言模型训练中数据配方不可复现、难以公平比较的问题,提出 DCVLM:汇集160个开放数据源、6T多模态 token,并固定模型与训练流程来评估过滤、混合、采样等策略。核心洞察是,在已被上游清洗的数据池中,继续质量过滤收益有限,数据类型配比尤其指令数据占比更关键。其 DCVLM-Baseline 在8B模型、200B token下达到63.6%,较 FineVision 提高5.4个百分点。

MammoFlow: Multiview Mammogram Synthesis with Anatomically Consistent Flow Matching Figure 1
2026-06-30cs.CV

MammoFlow: Multiview Mammogram Synthesis with Anatomically Consistent Flow Matching

Yuexi Du, Leya Barrientos, Laura Sheiman, John Lewin, Hemant D. Tagare, Nicha C. Dvornek

Department of Biomedical Engineering, Yale University, Department of Radiology & Biomedical Imaging, Yale University

2026-06-30生成模型

针对乳腺钼靶双视图数据稀缺且类别不均衡、单视图生成难以保持临床所需跨视图一致性的问题,MammoFlow将CC/MLO来自同一3D乳腺体积的AP轴组织分布守恒作为约束,在预训练flow matching模型中加入仿射对齐搜索和基于EMD的像素级自一致损失。结果显示其生成质量和放射科评估优于对比方法,并使下游分类AUC提升约5%,但2D仿射近似复杂3D压迫仍是限制。

The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks Figure 1
2026-06-30cs.RO

The Speedup Paradox: Rethinking Inference Speed-Quality Trade-off in Embodied Tasks

Yujin Wang, Junli Chen, Yixuan Li, Shunan Dong, Huazhong Yang, Yongpan Liu, Hongyang Jia

Tsinghua University

2026-06-30视觉感知

本文针对具身模型推理优化常只看单步延迟、忽略闭环执行的问题,提出 TISED 框架,把有损轻量化对每步耗时、rollout 步数、动作滞后和硬件算力的影响分解分析。结果显示,静态任务中单步更快反而可能拉长总完成时间,动态任务中适度降质因观测更新更及时可提升成功率,且最佳轻量化强度会随部署硬件漂移。

Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty Figure 1
2026-06-30cs.CV

Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty

Xiao Song, Haonan Qin, Zhaoxu Zhang, Jiong Zhang, Yuqi Fang, Caifeng Shan

School of Intelligent Science and Technology, Nanjing University, Suzhou, China, National Institute of Healthcare Data Science at Nanjing University, Nanjing, University, Nanjing, China, School of Biomedical Engineering, Nanjing University, Suzhou, China, cross-model transferability. Code and dataset are available at https:

2026-06-30视觉语言安全鲁棒

临床 LVLM 容易生成影像中无依据的病灶、部位或属性,且黑盒模型难用内部不确定性审计。本文将幻觉检测转化为视觉证据对齐:抽取回答实体,用医学适配的 Qwen-VL 定位,并构造反事实实体,通过事实/反事实框的置信度与重叠估计不确定性。多模态医学影像和多 LVLM 实验显示,该方法优于近期基线,同时给出可解释定位证据和较好的跨模型迁移性。

CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection Figure 1
2026-06-30cs.CV

CLEAR-MoE: Shared-Basis Expert Extraction from Frozen Vision Transformers via Calibration-Driven Layer Selection

Md Irtiza Hossain, Humaira Ayesha, Junaid Ahmed Sifat

Brac University, by cluster labels, are made about data-center GPUs, distributed setups, or larger, gradient access and sufficient unlabelled data., lightweight routers are fitted on k-means labels

2026-06-30视觉感知

这篇论文针对已有预训练 ViT 难以低成本改造成视觉 MoE 的问题,提出 CLEAR-MoE:用校准数据按稀疏性、可聚类性和敏感度选择 FFN 层,再以共享 SVD 基底加残差专家替换部分层。核心洞察是保精度主要来自共享基底而非路由质量;在 Imagenette 多个 DeiT/ViT 上精度几乎不降,但 GTX 960 上因路由与搬运开销反而慢 1.3–1.7 倍。

Anatomy-Grounded Synthetic Coronary Angiography for Geometry-Informed Multi-View Matching Figure 1
2026-06-30eess.IV

Anatomy-Grounded Synthetic Coronary Angiography for Geometry-Informed Multi-View Matching

In Kyu Lee, Sumin Seo, Jaesik Min

Medipixel, Inc., Seoul, Republic of Korea, University of California San Diego, La Jolla, USA, erates dense, highly accurate 3D-to-2D projection labels by simulating, provides 2D correspondence labels with paired images, allowing human-, ⋆Equal contribution. † Work performed while affiliated with Medipixel, Inc., annotation, which is expensive and yields only sparse labeling. Moreover, due to, labels, entirely eliminating the need for manual annotation., grounded CT-derived DRR dataset with dense 3D-2D correspondence labels

2026-06-30视觉感知

这篇论文针对冠脉造影多视角匹配缺少可规模化真值、影响3D重建与介入导航的问题,提出从患者CCTA生成解剖一致的DRR,并自动给出密集3D-2D对应标签;在此基础上设计GIMM,将C臂视角先验用于粗匹配、极线约束用于细匹配。实验在自建CT衍生基准上以2D/3D误差评估,显示优于多种深度匹配基线,但真实临床数据仍缺少严格定量验证。

DeVAR: Low-Dose CT Denoising via Visual Autoregressive Modeling Figure 1
2026-06-30eess.IV

DeVAR: Low-Dose CT Denoising via Visual Autoregressive Modeling

Xizhuo Zhang, Yannian Gu, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

Shanghai Jiao Tong University, China, Shanghai Innovation Institute, China, and scalability. Inspired by the success of next-scale prediction, we explore the

2026-06-30视觉感知

针对低剂量 CT 在降辐射同时易产生噪声、伪影且细微解剖结构难以保留的问题,DeVAR 将视觉自回归的逐尺度生成引入去噪:用 LDCT 前缀 token 提供全局上下文,预测 NDCT 离散 token,并以残差细化器和双潜变量混合训练弥补量化损失。两套公开数据集结果显示其在 PSNR、SSIM、RMSE 和视觉细节上优于多类现有方法,消融也支持残差细化与混合解码的贡献。

Establishing the Minimal Clinically Important Difference (MCID) for Smartphone-Derived Gait Measures in Multiple Sclerosis Figure 1
2026-06-30q-bio.QM

Establishing the Minimal Clinically Important Difference (MCID) for Smartphone-Derived Gait Measures in Multiple Sclerosis

Mike D Rinderknecht, Bernhard Fehlmann, Dimitar Stanev, Cedric Simillion, Ernst Bos, Letizia Leocani, Agne Kazlauskaite, Gary Cutter, Helmut Butzkueven, Licinio Craveiro

a F.Hoffmann-La Roche Ltd., Basel, Switzerland, b Faculty of Medicine, University Vita-Salute San Raffaele, Milan, Italy, c Scientific Institute IRCCS San Raffaele, Milan, Italy, d Department of Biostatistics, University of Alabama at Birmingham, Birmingham, AL, USA, e Department of Neuroscience, School for Translational Medicine, Monash University, f Department of Neurology, Alfred Health, Melbourne, Australia, mean [SD] EDSS: 4.8 [1.4]) had digital gait data available at baseline and Week 96.

2026-06-30视觉感知

多发性硬化患者的远程步态监测要区分日常波动与真实进展,关键缺口是手机步态指标缺少临床可解释阈值。本文利用 CONSONANCE 研究中 243 名进展型 MS 患者的每日手机 2 分钟步行测试,并以 T25FW、EDSS、步行量表等为锚点估计 MCID。结果给出步速下降 0.16 m/s、步长下降 0.07 m、总步数减少 28、步行距离减少 24 m 等阈值,为数字步态终点进入临床试验和随访提供了可操作标尺。

Measured-Subspace Consistency: A Plug-and-Play Operator for Diffusion Posterior Sampling in Accelerated MRI Reconstruction Figure 1
2026-06-30eess.IV

Measured-Subspace Consistency: A Plug-and-Play Operator for Diffusion Posterior Sampling in Accelerated MRI Reconstruction

Junhyeok Lee, Kyu Sung Choi

Interdisciplinary Program in Cancer Biology, Seoul National University College of Medicine, Department of Radiology, Seoul National University College of Medicine, Seoul National University Hospital, Healthcare AI Research Institute, Seoul National University Hospital

2026-06-30生成模型三维

本文关注加速 MRI 扩散后验采样中的“已测子空间泄漏”:模型虽能重建好图像,却在扫描仪已采集的 k-space 系数上产生不应有的不确定性。作者提出 MSD/USD 指标诊断该问题,并用无需训练的 MSC 末端一致性锁将样本差异限制到未测子空间。六种采样器、脑/膝数据及跨解剖实验显示,MSC 对 Soft 采样器显著降低已测子空间离散度,DPS 中位降幅 16.5 倍且最高约 29 倍,同时基本保持未测多样性与 PSNR/SSIM。

A Zero-Shot Deep Image Prior Framework for Denoising and Deconvolution in Fluorescence Microscopy Figure 1
2026-06-30eess.IV

A Zero-Shot Deep Image Prior Framework for Denoising and Deconvolution in Fluorescence Microscopy

Xiangyu Qian, Jing Liu, Yunqing Tang, Luru Dai, Qiushi Li

Wenzhou Key Laboratory of Biomedical Imaging, Zhejiang Key Laboratory of Soft Matter Biomedical, Materials, Wenzhou Institute, University of Chinese Academy of Sciences, Wenzhou, Zhejiang 325000, China, Postgraduate Training Base Alliance of Wenzhou Medical University, Wenzhou, Zhejiang 325035, China, To mitigate the reliance on clean ground-truth data, increasing attention has been devoted to label-free image restoration, microscopy, where clean references are often unavailable. However, directly applying DIP remains challenging because the, SRDTrans [27], ZS-DeconvNet [16], SN2N [17], and FAST [28] further demonstrate the potential of label-free denoising.

2026-06-30视觉感知

针对荧光显微图像常同时受低光子噪声与PSF模糊影响、而监督复原又难获得配对真值的问题,论文提出零样本分阶段DIP框架SDIP:先用aSeqDIP去噪,再做小波背景校正,并以Richardson–Lucy结果作为物理引导约束稳定DIP反卷积。BioSR多结构实验显示其在多数细胞结构上提升SNR、分辨率和PSNR/SSIM,伪影少于RL和稀疏反卷积,但紧凑结构上稀疏先验仍有优势。

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators Figure 1
2026-06-30cs.CV

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

2026-06-30视觉感知

针对文本到图像模型依赖云端算力、难以在移动端离线部署且中文语义支持不足的问题,JuZhou 1.0 采用约0.387B参数轻量生成骨干、Rectified Flow与DMD2蒸馏,将推理压缩到4步,并用900万中文图文对齐数据及曙光K100完成训练。结果显示其28步基座GenEval达0.69,4步分支在手机约1.6秒运行,证明小模型可兼顾中文生成、隐私和端侧效率。

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentatio Figure 1
2026-06-30cs.CV

MedDiffuseMix: Preserving Diagnostic Evidence with Saliency-Aware Diffusion Medical Image Data Augmentatio

Teerath Kumar, Raja Vavekanand, Muhammad Turab

School of Computing, Atlantic Technological University, Letterkenny, Ireland., Department of Information Technology, Benazir Bhutto Shaheed University Lyari, School of Computing, Dublin City University, Dublin, Ireland., Limited data availability, class imbalance, and domain variability remain major barriers to reliable, introduce label-inconsistent content. This paper proposes MedDiffuseMix, a saliency-guided diffusion, labelled data collection is constrained by patient, to label-relevant evidence., to address limited labelled data and class imbal-, are usually label-agnostic and anatomy-agnostic., isation by combining images, features, or labels

2026-06-30视觉感知生成模型

这篇论文针对医学影像小样本、类别不平衡下常规增强易破坏病灶证据、生成增强又可能引入标签不一致的问题,提出 MedDiffuseMix:用分类器显著图保护高诊断区域,只在低显著背景中做扩散混合,并用自适应强度、边界平滑和注意力保持约束过滤不可靠样本。在四个放射与病理数据集上,相比 Mixup、SaliencyMix、GenMix 和扩散增强基线提升 accuracy、F1 与 AUROC,消融显示收益主要来自显著性引导和保持约束。

DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent Figure 1
2026-06-30cs.CV

DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent

Jia-Wei Liao, Li-Xuan Peng, Mei-Heng Yueh, Min Sun, Cheng-Fu Chou, Jun-Cheng Chen

National Taiwan University, National Tsing Hua University, National Taiwan Normal University, Research Center for Information Technology Innovation, Academia Sinica

2026-06-30生成模型优化算法

本文针对推理时扩散引导中外部梯度容易破坏逐步高斯潜变量分布、导致样本质量下降的问题,提出 DiffRGD。核心洞察是利用 DDIM 每步潜变量的各向同性高斯结构,通过极分解构造分布诱导的球面流形约束,并用黎曼梯度下降求解每步受限优化。实验显示其在图像修复和条件生成任务中多数指标优于 DPS、MPGD 等方法,同时保持免训练、可插拔特性。

AEGIS: A Semantic GAN and Evidential Learning Frameworkfor Robust Adversarial Detection in Vision Sensors Figure 1
2026-06-30cs.CV

AEGIS: A Semantic GAN and Evidential Learning Frameworkfor Robust Adversarial Detection in Vision Sensors

Maher Boughdiri, Mounira Msahli, Albert Bifet

2026-06-30视觉感知生成模型安全鲁棒

面向视觉传感器中对抗样本会导致安全关键识别失误的问题,AEGIS将语义一致性筛查、测试时增强下的预测/特征不稳定性度量,与基于Dirichlet证据学习的不确定性估计串联,用于覆盖像素扰动、补丁、功能和几何攻击。在Tiny ImageNet六类场景中取得AUROC 92.1%、AUPRC 90.2%、准确率90.7%,优于softmax检测器,但泛化到更真实机器人闭环场景仍需验证。

RSGPNet: Geometric Prompting for Remote Sensing Open-Vocabulary Semantic Segmentation Figure 1
2026-06-30cs.CV

RSGPNet: Geometric Prompting for Remote Sensing Open-Vocabulary Semantic Segmentation

Shanwen Wang, Xin Sun, Sirui Wang, Xiao Xiang Zhu

sion task that assigns a semantic label to every pixel in, - International Collaborative Research, Macao SAR (0001/2025/AIJ), Science, Observation, Technical University of Munich (TUM), Germany and also with, the Munich Center for Machine Learning, Munich, Germany., beyond the closed set of training labels [7]–[11]. OVSS mod-

2026-06-30视觉感知

RSGPNet针对遥感开放词汇语义分割中CLIP类方法局部边界不稳、细粒度区域难以对齐的问题,提出免训练的几何提示流程:先由文本生成粗掩码,再把高置信区域转为框提示重新分割,并用粗到细一致性校验抑制错误提示扩散。实验称其在多个遥感数据集上优于OVRS、RSCLIP、SegEarth-OV等方法,尤其改善复杂边界和局部区域分割。

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models Figure 1
2026-06-30cs.LG

Can AI Draw Science? A Benchmark for Evaluating Scientific Figure Generation by Text-to-Image and Multimodal Models

Davie Chen

2026-06-30视觉语言视觉感知数据集/基准

这篇论文针对通用文生图基准难以衡量科学图可用性的问题,提出 SciDraw-Bench:以任务规格而非参考图评测标签、实体关系、结构与学科绘图惯例。试验显示,领域专用 SciDraw AI 在各图型和维度上优于通用文生图模型,优势主要在语义正确性和惯例遵循;但文字保真仍是所有系统的短板,人工验证仍未完成。

Enhancing Layer Interaction Using Key-Correlated Layer Attention Figure 1
2026-06-30cs.CV

Enhancing Layer Interaction Using Key-Correlated Layer Attention

Jianlong Xiong, ChuanBo Xie, Le Yu, Quansong He, Tao He

The code is publicly available at: https://github.com/bgx666/, the College of Computer Science, Sichuan University, Chengdu, 610065, China. ChuanBo Xie is also with the Department of Ultrasound, Zigong

2026-06-30视觉感知

这篇论文针对层注意力在深层网络中计算随深度二次增长、需缓存历史层且现有 RLA/线性化方法要么更新静态、要么削弱远程跨层依赖的问题,提出 Key-Correlated Layer Attention。核心洞察是不同层的 Key 表征方向高度相关,据此线性近似 Key 并设计 softmax 近似,使其在固定空间和线性复杂度下保持动态更新。实验覆盖图像分类、目标检测和医学分割,显示 KCLA 在精度、显存和计算量之间取得更优折中。

DCSNet: Multiscale Feature Aggregation for Small Medical Object Segmentation with Detection-guided Hierarchical Cropping Figure 1
2026-06-30cs.CV

DCSNet: Multiscale Feature Aggregation for Small Medical Object Segmentation with Detection-guided Hierarchical Cropping

Shanfeng Zhang, Bo Gou, Yue Cao, Lei Zhang, Zhang Yi, Tao He

aCollege of Computer Science, Sichuan University, 610065, Chengdu, China, bSchool of Artificial Intelligence, Sichuan University, 610065, Chengdu, China, cThe First Affiliated Hospital of Chengdu Medical College, School of Clinical Medicine, Chengdu Medical, College, 610065, Chengdu, China

2026-06-30视觉感知

这篇论文针对医学图像中小目标占比低、边界模糊导致全局分割模型漏检和轮廓退化的问题,提出 DCSNet:先用检测引导的层级裁剪把任务收缩到目标区域,再在裁剪特征内做多尺度聚合与像素自适应融合,以兼顾语义上下文和细边界。文中称其在三个医学数据集上优于现有方法,尤其提升边界精度。

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs Figure 1
2026-06-30cs.CV

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

Yunhun Nam, Jongheon Jeong

Korea University, of our framework in enhancing the model’s visual capabilities. Code is available at

2026-06-30视觉语言视觉感知

这篇论文针对 VLM 在图像描述中受语言先验驱动而产生幻觉的问题,指出偏好对构造同时存在偏离策略分布和视觉信息利用不足两类缺陷。作者提出 ViPSy:先用自生成描述合成语义相近图像并提取反复出现的对象级视觉线索,再用该线索条件化模型自身 rollout 构造 DPO 偏好对。实验显示其在 AMBER、Object HalBench 上较前 SOTA 分别降低幻觉率 35.7% 和 24.5%,并提升 MMStar、MMVP、CV-Bench 及视觉编码器探测结果。

Meta-learning as a principle for human-like visual representations Figure 1
2026-06-30cs.CV

Meta-learning as a principle for human-like visual representations

Can Demircan, Marcel Binz, Alireza Modirshanechi, Eric Schulz

Max Planck Institute for Biological Cybernetics, T¨ubingen, Germany

2026-06-30视觉感知

这篇论文试图解释为何人类视觉表征能灵活服务于新任务,而不只是追求固定目标。作者用 SAE 从预训练模型中生成高层语义任务,并让因果 Transformer 在少样本情境中元学习这些任务,从而线性重塑冻结视觉特征。结果显示,元学习表征比原始编码器更能预测人类相似性判断、语义规则学习和高级视觉皮层反应,且行为增益依赖解耦的高层概念任务,说明“学会快速学习新语义关系”本身可能是人类式视觉表征的重要组织压力。

Semantic-Aware Generative Image Transmission for Resource-Constrained Visual IoT Systems Figure 1
2026-06-30cs.CV

Semantic-Aware Generative Image Transmission for Resource-Constrained Visual IoT Systems

Chenyang Zhang, Changwang Liu, Jinqi Zhu, Jiayi Chang, Yuxuan Wang, Shuqing He, Jia Guo

C. Zhang, C. Liu, J. Zhu J. Chang, Y. Wang and J. Guo,are with the School, of Computer and Information Engineering, Tianjin Normal University, Tian-, S. He is School of Information Science and Engineering, Linyi University, available

2026-06-30视觉感知生成模型

面向带宽和能耗受限的视觉 IoT,论文关注如何只上传对感知任务关键的图像证据,而非完整压缩图像。其核心做法是在 VQ token 网格上融合可恢复性、局部结构复杂度与实例语义重要性,选择少量关键 token 发送,并由 MaskGIT 在边缘端补全。实验显示该方法在 Kodak、VisDrone 及 AWGN/Rayleigh 信道下提供更低码率的质量折中,0.074 bpp 时仅用 DeepJSCC/WITT 约 44.6% 比特仍达 29.9 dB,且较随机掩码更保留检测相关目标。

CLOSER-VLN: Closed-Loop Self-Verified Retrieval-Augmented Reasoning for Aerial Vision-Language Navigation Figure 1
2026-06-30cs.CV

CLOSER-VLN: Closed-Loop Self-Verified Retrieval-Augmented Reasoning for Aerial Vision-Language Navigation

Shaoxuan Li, Xiangyu Dong, Xiaoguang Ma, Junfeng Chen, Haoran Zhao, Yaoming Zhou

actions based on available information, a multidimensional action, School, University, Northeastern University, Shenyang 110819, China., Shaoxuan Li and Xiaoguang Ma are also with the College of Information, Science and Engineering, Northeastern University, Shenyang 110819, China., Haoran Zhao and Yaoming Zhou are with the School of Aeronautic, Science and Engineering, Beihang University, Beijing 100191, China (e-mail:, expand the context available to the model, but it cannot directly, components work collaboratively, allowing the system to

2026-06-30机器人视觉语言视觉感知

这篇论文针对空中视觉语言导航中大模型“先预测再执行”的开环脆弱性:单步小错会在长航程中放大并导致目标丢失。核心思路是在执行前加入闭环自验证,先由层级推理器生成动作,再用多维验证器检查指令、视觉与路径一致性,失败时才触发多模态检索并修正动作。CityNav 测试未见场景上达到 32.01% SR、21.28% SPL,说明预执行纠错对可靠性有实际帮助。

RadarTwin: Scene-Specific mmWave Radar Simulation and Learning for Mobile Indoor Perception Figure 1
2026-06-30cs.CV

RadarTwin: Scene-Specific mmWave Radar Simulation and Learning for Mobile Indoor Perception

Emily Bejerano, Federico Tondolo, Devang Gupta, Aaron Mano Cherian, Taeyoo Kim, Ayaan Qayyum, Xiaofan Yu, Xiaofan Jiang

Columbia University, University of California, Merced, no real radar labels, and a few labeled examples raise this to 95.3%, and collecting labeled radar data for every new space, object set, CAD scenes and material labels, synthesize scenes without corre-, face materials. These material labels are mapped to electromagnetic, recognizes real objects with no real radar labels, and a few labeled

2026-06-30视觉感知

室内毫米波雷达感知受真实标注数据稀缺、场景多径和材质差异影响,跨环境泛化困难。RadarTwin的核心思路是把手机/机器人等获得的3D场景重建转成雷达数字孪生:用视觉语言模型推断表面材质并映射电磁属性,再用多次反射射线追踪合成原始FMCW雷达数据。实验证明仿真能保留形状与材质判别特征,多径建模是缩小 sim-to-real gap 的关键;仅用仿真训练已达机会水平2.5倍,少量真实标签可将12类识别提升到95.3%。

JASPR: Joint Spatial Representation learning of histology and spatial genomics for improved virtual genomic screening and clinical prognostication Figure 1
2026-06-30cs.CV

JASPR: Joint Spatial Representation learning of histology and spatial genomics for improved virtual genomic screening and clinical prognostication

Marija Pizurica, Eric Zimmermann, Neil Tenenholtz, James Hall, Olivier Gevaert, Ava P. Amini, Lorin Crawford, Kristen A. Severson

Stanford University, CA, United States, flows has transformed these images into a scalable data, structure and is readily available, while the latter resolves, labels, data may be available at either bulk or spatial res-, approaches are limited by irreducible label noise due to the

2026-06-30视觉感知

这篇论文针对病理 HE 图像易得但空间转录组昂贵、现有方法又常忽略组织与基因表达的空间依赖这一问题,提出 JASPR:用 MAE 式跨模态重建在 HE 与 ST 网格上联合预训练,共享注意力捕捉通用空间结构,并用模态专家保留形态和基因特异信息。作者在乳腺癌数据上验证,其表示能提升基于 HE 的 9,248 个基因空间表达预测,并对临床预后任务有额外价值。

GPU-Accelerated Inverse Structural Anastylosis from Block Collapse Dynamics Figure 1
2026-06-30cs.CV

GPU-Accelerated Inverse Structural Anastylosis from Block Collapse Dynamics

L.A. Muñoz

Computational Robotics Lab, School of Engineering and Sciences, ologist judgement and manual block-by-block correspondence, a process that is both labour-intensive, predicts block removal count, per-position removal probabilities, centre-of-mass imbalance, and Ziglar

2026-06-30视觉感知

本文瞄准倒塌文物石块复原中依赖人工经验、组合空间巨大的难题,用积木塔作为可控代理,将形态复原表述为从倒塌图像反推原始结构的逆问题。核心创新是把GPU刚体仿真、Ziglar摩擦/力矩阈值与注入摩擦条件的双流ResNet结合,联合预测移除数量、位置概率、质心失衡和力矩风险,并生成反向重建视频。实验覆盖450次仿真及三档摩擦,显示模型可学习与摩擦和稳定性相关的结构线索,但量化精度和相对基线增益文中未充分说明。

Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports Figure 1
2026-06-30cs.CV

Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports

Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge, Olivier Gevaert

Department of Electrical Engineering, Stanford University, Stanford, CA, USA, Department of Biomedical Data Science, Stanford University School of Medicine, Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent, University, Ghent, Belgium, publicly available chest X-ray dataset across several vision–language generators

2026-06-30视觉感知

这篇论文针对胸片报告生成常忽略随访语境的问题:真实放射科报告更关心相较上次检查的变化,而非单张图像的孤立描述。作者提出无需训练的 transition-aware best-of-N,在候选报告选择阶段把“既往→当前”报告转成句向量集合间的方向性转移向量,并与训练集中真实转移库匹配打分。实验覆盖三种生成器和三类提示,整体优于随机选择,增益在更强调变化的 Impression 部分最明显。

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning Figure 1
2026-06-30cs.CV

RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning

Jiasheng Wang, Tanun Jitwatcharakomol, Piyawadee Jongpradubgiat, Simeng Zhu

Division of Hematology, The Ohio State University Comprehensive Cancer Center, Department of Radiology, Mahidol University, Bangkok, Thailand, Department of Radiology, Mettapracharak Hospital, Thailand, Department of Radiation Oncology, The Ohio State University Comprehensive, Cancer Center, Columbus, OH, USA, available at: https://github.com/jwang-580/RADIANT-PET.

2026-06-30视觉感知强化学习

PET/CT病灶分割常被生理摄取、炎症和伪影干扰,纯图像模型缺少临床判别推理。RADIANT-PET先用高敏阈值或HS-UNet生成候选,再把摄取强度、形态、器官关系和可选报告转成结构化文本,由LLM判别真假病灶,并用GRPO强化学习优化局部模型。AutoPET与OSU测试显示,其较nnUNet等基线提升DSC、PPV并降低MTV误差,报告条件下效果最好。

Few-class Fidelity: Evaluating Explanations of Real-conditions CNN classifiers with Optimized Perturbations Figure 1
2026-06-30cs.CV

Few-class Fidelity: Evaluating Explanations of Real-conditions CNN classifiers with Optimized Perturbations

Wistan Marchadour, Pedro Soto Vega, Franck Vermet, Mathieu Hatt

modalities and number of classes, and present the resulting rankings of a subset of currently available XAI methods.

2026-06-30视觉感知

本文针对真实少类别分类任务中 XAI 保真度评估易受 OoD 扰动和类别不确定性不足影响的问题,重新定义 Few-class Fidelity,并用优化扰动生成更贴近分布且能诱发模型不确定性的样本。实验覆盖 ImageNet 车辆与 CT 对比剂任务,显示不同领域、数据整理和解释方法会显著改变排序:ImageNet 中 EG 配合 SmoothGrad 表现较好,医学任务中 XRAI 或 GradCAM 更占优。

Automated Quality Assessment of Geospatial Vector Data: A GeoAI Approach using Spatial Representation Learning Figure 1
2026-06-30cs.CV

Automated Quality Assessment of Geospatial Vector Data: A GeoAI Approach using Spatial Representation Learning

Hao Li, Chen Chu, Filip Biljecki, Cyrus Shahabi, Wenwen Li

a Department of Geography, National University of Singapore, Singapore, bUniversity of, cDepartment of Architecture, National University of Singapore, dDepartment of Real Estate, National University of Singapore, Singapore, eSchool, of Geographical Sciences and Urban Planning, Arizona State University, USA, (SRL). Specifically, Topo4Vec relax the labor-intensive manual annotation process, from Topo4Vec shed a promising light into a scalable and autonomous GeoAI ap-, made openly available in https://figshare.com/s/612148eeb4bccadbd715.

2026-06-30视觉感知

面对大规模矢量地图中建筑重叠、道路悬挂等拓扑错误,传统规则方法难以适应不同城市形态且标注成本高。论文提出 Topo4Vec,用错误模拟替代大量人工标注,并以空间表征学习和对比学习直接编码原生线、面几何,在潜空间区分异常与正常结构。三城实验中,建筑重叠检测最高准确率达 0.99,但道路 overshoot/undershoot 仅约 0.60,说明方法对面状错误更稳健,跨形态泛化仍有限。

SoccerNet 2026 Player-Centric Ball Action Spotting: Per-Player Attention with Agreement-Based Ensembling Figure 1
2026-06-30cs.CV

SoccerNet 2026 Player-Centric Ball Action Spotting: Per-Player Attention with Agreement-Based Ensembling

Faisal Altawijri, Ismail Mathkour

cluster center, sorted by score descending. (3) For each cluster

2026-06-30视觉感知

该文面向 SoccerNet 球员中心的足球动作定位,动机是基线难以同时利用单个球员的时序演化、场上多人空间关系,并抑制事件误检。方法在 TAAD 中加入时间 Transformer,在 DST 编码器前引入先空间后时间的逐球员注意力,并用基于多模型一致性的事件融合,铲球类作单模型保留例外。结果显示验证 Macro-F1 从 0.541 提升到 0.609,挑战集达到 58.94。

Data Provenance for Image Auto-Regressive Generation Figure 1
2026-06-30cs.CV

Data Provenance for Image Auto-Regressive Generation

Bihe Zhao, Louis Kerner, Michel Meintz, Tameem Bakr, Franziska Boenisch, Adam Dziedzic

CISPA Helmholtz Center for Information Security, available at https://github.com/sprintml/DataProvenanceIAR.

2026-06-30视觉感知

针对自回归图像生成模型产物难以溯源、既有水印需预先嵌入且不适用于已发布无标记内容的问题,本文利用离散 token codebook 量化会留下模型特异伪迹这一洞察,提出后验溯源框架,结合 QuantLoss、逆解码器增强和 EncLoss 等信号判断图像是否由某个 IAR 生成。实验覆盖 VAR、RAR、LlamaGen、Infinity 等模型,报告在 1% FPR 下接近 100% TPR,并在常见后处理下优于基线。

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture Figure 1
2026-06-30cs.CV

Zero-Label Driving Scenario Complexity Detection via Joint Embedding Predictive Architecture

Santosh Jaiswal

Zero-Label Driving Scenario Complexity Detection, Identifying complex and safety-critical driving scenarios in large unlabelled datasets is an important, scenario. We ask whether a model can discover scenario complexity on its own, with no labels at any stage., access to any ground-truth labels during training or evaluation setup, the model assigns significantly, require labelled training data, which is expensive to collect and biased by the label taxonomy. Human, • We demonstrate that a JEPA model trained on structured driving agent data with no labels produces, labels.

2026-06-30视觉感知

这篇论文面向自动驾驶数据中复杂/安全关键场景难以无标注筛选的问题,提出用结构化智能体状态训练最小 JEPA 世界模型,并以未来潜表示预测误差作为零标签复杂度分数。其洞察是“模型意外”可近似人类驾驶难度;在 nuPlan mini 上,高分集中于无保护转弯、人行横道和行人接近,低分对应车道跟随/静止交通,异常检测 AP 为 0.512,高于 0.436 基线。

Memory-Augmented LSTM Autoencoder for Unsupervised Activity Recognition with IMU Sensor Fusion Figure 1
2026-06-30cs.CV

Memory-Augmented LSTM Autoencoder for Unsupervised Activity Recognition with IMU Sensor Fusion

Saeid Arabzadeh, Farshad Almasganj, Mohammad Mahdi Ahmadi

such as the reliance on large volumes of labeled data, the complexity of fusing information from multiple sensors, and the limited, are especially pronounced in real-world scenarios where sensor data is noisy, activities overlap, and precise labeling is often unavailable., (LSTM-AE), which incorporates historical motion patterns without requiring any activity labels., difficulty of labeling data, scarcity of data across diverse activities, and the high similarity between different movement patterns, 2 and 3 is with the Faculty of Biomedical Engineering, Amirkabir University of Technology (Tehran Polytechnic), Tehran, Iran, training. Their performance also depends on careful layer tuning and accurate labeling, which hinders generalization on real-world, of static features, and (2) updating those features using previously observed data, when available., address several key challenges: the scarcity of labeled data required for training deep supervised models, the need for effective

2026-06-30视觉感知

针对多传感器 IMU 活动识别依赖标注、短窗口下难以同时建模空间融合与时间依赖的问题,论文提出无监督的记忆增强自编码框架:先用堆叠自编码器做传感器内/间静态特征融合,再以序列到序列 LSTM-AE 引入历史运动模式。作者在 DaLiAc 与 PAMAP2 上报告 96.6% 和 98.4% 准确率,并称特征可分性提升最高 9%,但结果仍依赖后续分类评估,真实无监督部署收益需谨慎看待。

GeoISF: Instance Semantic Forest Inspired Large-Scale Cross-View Geo-Localization via Ground LiDAR-to-Satellite Image Figure 1
2026-06-30cs.CV

GeoISF: Instance Semantic Forest Inspired Large-Scale Cross-View Geo-Localization via Ground LiDAR-to-Satellite Image

Di Hu, Xia Yuan, Chunxia Zhao

open-source resource available online for the broader research, Di Hu, Xia Yuan, and Chunxia Zhao are with the School of Computer, Science and Engineering, Nanjing University of Science and Technology, This research was funded by NingXia Academy of Agriculture and, aligning it with structured semantic labels. It allows for a, the relationship among a set of words. With the available, relatedness information between each scene object’s label and, the corresponding 3D scene’s label. Furthermore, they also, textual labels derived from scene semantics within a single, The process commences by transforming the textual labels

2026-06-30视觉感知

GeoISF瞄准大范围卫星图中用地面激光雷达点云定位的难题,核心动机是现有LiDAR-to-image方法受跨模态差距和语义对齐不足限制。方法用WordNet构建实例语义森林,将多帧点云的几何实例语义与卫星图块文本描述作为共享中介,并通过语义蒸馏筛除不匹配区域。KITTI实验报告其R@10较并行LiDAR-to-image基线提升13.22倍,但具体增益来源仍需更多消融支撑。

UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval Figure 1
2026-06-30cs.IR

UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval

Yini Huang, Wenlong Zhang

The Hong Kong University of Science and Technology (Guangzhou), Guangdong, China, Southern Medical University, Guangdong, China, fewer labeled data, which in turn boosted the performance

2026-06-30安全鲁棒

这篇论文针对多模态检索中视觉与文本仅靠拼接后自注意力进行隐式融合、语义对齐不足的问题,提出 UniCA:在拼接前加入双向跨注意力促进图文 token 显式交互,并用 Positive Similarity Loss 拉近查询与正样本的绝对语义距离,同时构建 10% 轻量训练集 UMR-S10。WebQA 实验显示其在 Hybrid 与 Image-Text 任务上优于 VISTA 基线,Hybrid 的 Recall@5、Recall@10、MRR@1 最高分别提升 4.09%、3.28%、3.96%。

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation Figure 1
2026-06-30cs.IR

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

Princeton University, Renmin University of China, code is available at https://github.com/StarTrail-org/PixelRAG., AP News, and BBC. While scalable data collection is non-trivial, we build a pipeline that first

2026-06-30视觉感知

本文针对网页 RAG 依赖 HTML 解析、线性化后丢失版式与表格等视觉结构的问题,提出直接以网页截图做检索和阅读的 PIXELRAG:渲染网页、建立视觉索引,并将截图块送入 VLM,避免文本抽取链路。其在 3000 万 Wikipedia 截图片上扩展,并在 NQ、SimpleQA、MMSearch、LiveVQA、MoNaCo 等任务上超过文本 RAG,最高提升 18.1%,低分辨率压缩还可约降 3 倍 token 成本。

MSA-UNet3+: Multi-Scale Attention UNet3+ with New Supervised Prototypical Contrastive Loss for Coronary DSA Image Segmentation Figure 1
2026-06-30eess.IV

MSA-UNet3+: Multi-Scale Attention UNet3+ with New Supervised Prototypical Contrastive Loss for Coronary DSA Image Segmentation

Rayan Merghani Ahmed, Adnan Iltaf, Mohamed Elmanna, Gang Zhao, Hongliang Li, Yue Du, Bin Li, Shoujun Zhou

aShenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences (CAS), Shenzhen, 518055, China, bUniversity of Chinese Academy of Sciences (UCAS), Beijing, 101408, China, cDepartment of Biomedical Engineering and Systems, Faculty of Engineering, Cairo University, Cairo, 12613, Egypt, dThe Neurosurgery Department, General Hospital of Southern Theater Command, Guangzhou, 510000, China, eThe Department of Biomedical Engineering, Air Force Hospital of Southern Theater Command of PLA, SMAU-Net struggles with class imbalance and fine vessel segmentation. Zhang et al. [12] proposed a Centerline-, Supervision Multi-Task Learning Network, improving U-Net with a Channel Attention Skip module and a Centerline

2026-06-30视觉感知

面向冠脉 DSA 中细小血管低对比、背景结构复杂和前景/背景极不均衡导致的分割困难,论文提出 MSA-UNet3+,在 UNet3+ 中加入多尺度注意力编码器、空洞瓶颈和上下文注意力融合,并用监督原型对比损失约束编码特征,重点推开接近血管原型的难背景样本。私有冠脉 DSA 数据集上其 Dice、F1 最高且 ASD/ACD 更低,但泛化性受私有数据限制。

2026-06-29

105 篇
DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand Figure 1
2026-06-29cs.RO

DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

Dihong Huang, Zhenyu Wei, Zhuxiu Xu, Yunchao Yao, Sikai Li, Mingyu Ding

University of North Carolina at Chapel Hill

2026-06-29机器人三维

这篇论文针对灵巧手多任务操作中“保持已有抓取”和“执行新交互”争用同一手指动作空间的问题,提出 DexCompose:先用释放测试识别维持第一技能所必需的手指,再通过显式手指动作归属和双残差模块组合两个冻结的单任务策略。其核心洞察是把空闲手指自由度视为可复用资源,从而减少策略串联中的破坏性干扰。在 16 个复合任务上,方法达到 77.4% 平均成功率,较直接串联和最强基线分别提升 74.3% 与 15.8%。

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception Figure 1
2026-06-29cs.CV

PerceptionRubrics: Calibrating Multimodal Evaluation to Human Perception

Yana Wei, Hongbo Peng, Yanlin Lai, Liang Zhao, Kangheng Lin, En Yu, Keyu Lv, Han Zhou, Yin Tang, Haodong Li, Mitt Huang, Hangyu Guo, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Vishal M. Patel

2026-06-29视觉语言数据集/基准

针对多模态感知榜单高分但真实场景仍脆弱的问题,PerceptionRubrics将图像描述评测改造成原子化审计:用1038张高信息密度图像、循环互评生成的黄金描述和1.2万余条Must-Right/Easy-Wrong准则,并以门控评分惩罚关键事实错误。实验显示其更贴近人类偏好,揭示模型会通过零散事实检查却失败于组合约束,且开源前沿相对闭源仍有约8%感知差距。

StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views Figure 1
2026-06-29cs.CV

StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views

Jia-Chen Zhao, Beiqi Chen, Xinyang Chen, Guangcong Wang, Liqiang Nie

Harbin Institute of Technology (Shenzhen), Great Bay University, Guangzhou CloudButterfly Technology Co., Ltd., Code available in: https://github.com/J-C-Zhao/StructSplat

2026-06-29三维

StructSplat针对稀疏未标定视图中依赖SfM/逐场景优化、几何与外观耦合导致泛化和纹理质量受限的问题,提出前馈式3D Gaussian框架,将几何、语义和纹理分工建模,并用像素对齐特征注入提升细节、相机对齐避免目标视图信息泄漏。实验显示其在DL3DV达28.045 PSNR,较AnySplat高5.67 dB,跨数据集在ACID和RealEstate10K也分别提升1.94/1.72 dB。

Learning Topology-Aware Representations via Test-Time Adaptation for Anomaly Segmentation Figure 1
2026-06-29cs.CV

Learning Topology-Aware Representations via Test-Time Adaptation for Anomaly Segmentation

Ali Zia, Usman Ali, Abdul Rehman, Umer Ramzan, Kang Han, Muhammad Faheem, Shahnawaz Qureshi, Wei Xiang

for Artificial Intelligence Pak-Austria Fachhochschule Institute of Applied

2026-06-29视觉感知

针对异常分割在测试时分布偏移下依赖像素阈值、难保持缺陷连通结构的问题,论文提出 TopoTTA:从异常分数图构建 cubical complex,并用多级持久同调滤波生成拓扑伪标签,监督轻量测试时分类器而不更新骨干。实验覆盖 2D/3D 六个基准,报告平均 F1 提升约 15%,复杂几何或结构异常上收益更明显。

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning Figure 1
2026-06-29cs.CV

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

2026-06-29视觉语言视觉感知

这篇论文针对遥感双时相图像变化描述中数据稀缺、传统小模型难以细粒度理解真实变化的问题,提出面向 RSICC 的大视觉语言模型后训练框架 RSICCLLM。其核心在于用变化掩码引导生成指令数据 RSICI,并通过差异感知 SFT 与双负样本偏好优化 DNPO 强化时序差异建模。实验称 7B 模型在多项指标上超过更大模型,但部分增益可能主要来自 data 与任务化后训练。

Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching Figure 1
2026-06-29cs.CV

Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching

Guanbo Huang, Jingjia Mao, Fanding Huang, Fengkai Liu, Xiangyang Luo, Yaoyuan Liang, Jiasheng Lu, Xiaoe Wang, Pei Liu, Ruiliu Fu, Ruqi Huang, Shao-Lun Huang

2026-06-29生成模型

论文针对 Flow Matching 训练时沿理想路径学习、推理时误差逐步累积导致的 exposure bias,提出将偏差本身作为自校正信号。DEFAR 通过单步推理模拟暴露漂移,用 ADR 学习把偏离状态拉回目标方向,并用 FC 借助偏差中的低频信息补偿高噪声阶段结构缺失。实验在 CIFAR-10、CelebA-64 与 ImageNet-256/512 上较 SiT、IP、SDSS/MDSS 等基线提升 FID/IS,并展示一定的尺度、架构和采样步数鲁棒性。

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration Figure 1
2026-06-29cs.CV

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

2026-06-29视觉感知

HAT-4D针对单目公开视频中多物体交互难以4D重建的问题,试图替代昂贵多相机采集并服务具身AI数据扩展。其核心是用VLM代理构建交互知识图,再结合多级人类反馈协调3D生成、空间组合与4D传播,以处理遮挡、深度歧义和长期一致性。论文同时提出MVOIK-4D基准;实验称多数物理合理性和时序一致性指标达到SOTA,少量人工反馈可提升重建,生成数据微调也能改善基线。

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior Figure 1
2026-06-29cs.LG

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

Qinhong Zhou, Chuang Gan, Anoop Cherian

2026-06-29视觉感知

这篇论文针对部分可观测多智能体任务中,LLM 代理常与伙伴行为和环境状态不一致的问题,提出 LLawCo:从失败轨迹中归纳“合作法则”,再通过监督微调写入推理链,使策略更可解释、可控且可自我改进。作者还构建 PARTNR-Dialog 基准;在四种 LLM 上,相比开源通信式代理,成功率在 PARTNR-Dialog 平均提升 4.5%,在 TDW-MAT 提升 6.8%。

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography Figure 1
2026-06-29cs.CV

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

2026-06-29视觉感知

该文针对超声心动图需跨多个视角整合证据、现有模型缺少可解释诊断推理和直接生成报告的问题,提出 EchoSonar-R:将冻结的视频时空编码器与结构感知心脏检测器结合,把全局运动与解剖区域线索送入语言模型,并用 SFT 加 GRPO 同时优化多标签分类和报告生成。实验显示其在私有多视图数据集宏平衡准确率较最强基线提升 17.1%,在 MIMICEchoQA 提升 6.1%,报告临床一致性 GREEN 得分为 0.800。

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales Figure 1
2026-06-29eess.IV

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales

Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull

2026-06-29视觉感知

针对现有神经视频编码难以同时保持低复杂度、宽码率可扩展性和高压缩效率的问题,论文提出 INR 编码器 NVRC++:用轻量网络结合多尺度高分辨率特征网格、分层式优化与多先验熵模型,把表示能力更多放到网格而非解码网络中。实验显示其在四档固定复杂度下覆盖宽质量范围,实时解码,相比 NVRC 最高快 7.6 倍且压缩性能相近或更优。

Toward Robust In-Context Segmentation via Concept Guidance Figure 1
2026-06-29cs.CV

Toward Robust In-Context Segmentation via Concept Guidance

Zhigang Chen, Xiawu Zheng, Rongrong Ji

Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of, China, Xiamen University, 361005, P.R. China, mainly focus on selecting the best prompt from an available pool of candidate references. However, such a

2026-06-29视觉感知安全鲁棒

本文针对 in-context segmentation 对参考样本高度敏感、同一查询在不同参考下结果波动大的问题,提出 CG-ICS:先用 MLLM 从参考图与掩码生成候选语义概念,再由 SAM3 打分并通过树搜索筛选可靠文本提示,同时引入查询侧视觉 exemplar 做空间定位。实验显示其在四个 ICS 基准和鲁棒评测中提升精度,并显著降低参考选择带来的方差,使训练-free 分割更稳定。

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading Figure 1
2026-06-29cs.CV

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

Beihang University, China 2 Great Wall Motors, China, Nanjing University, China, Wuhan University, China, Zhejiang University, China, AIR, Tsinghua University, China, lighting and collaboratively synthesize pixel-aligned PBR maps (Albedo

2026-06-29生成模型三维

这篇论文针对单张野外人脸难以重建可重光照高保真 PBR 头像的问题,核心思路是在 UV 空间用级联 LoRA 调用同一预训练扩散先验,依次完成纹理补全、去光照和材质分解,并用跨材质注意力与 UV 空间可微 BRDF 着色约束减少遮挡和烘焙光照伪影。实验称仅用少于 100 个真实 3D 扫描即可生成 4K 几何与多通道材质,重光照真实感和泛化优于现有方法。

Differentiable design of the PIAA-ZWFS: a flexible wavefront sensor that approaches the fundamental limit Figure 1
2026-06-29astro-ph.IM

Differentiable design of the PIAA-ZWFS: a flexible wavefront sensor that approaches the fundamental limit

A. K. Taras, S. Y. Haffert, L. Desdoigts

2026-06-29视觉感知

为让极端自适应光学在更暗目标或更高速闭环下接近光子噪声极限,论文提出 PIAA-ZWFS:用无损 PIAA 光瞳整形把星光集中到焦平面,并用可微仿真/Fisher 信息优化多级相位掩膜与透镜。仿真显示其在孔径、带宽、光子数和扩展星源变化下接近基本灵敏度极限,典型光子受限场景较传统 ZWFS 将差距缩小约 10 倍,且未牺牲动态范围。

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots Figure 1
2026-06-29cs.RO

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

2026-06-29机器人

本文针对人类操作数据便宜但难以迁移到双臂夹爪机器人的问题,指出人手姿态噪声和接触方式差异使6DoF旋转信号不可靠,提出以头戴相机坐标下的相对腕部平移作为人机共享的桥接动作,并用交错动作token与注意力mask统一不同动作成分。实验显示,该表示比 noisy 6DoF 人类动作更能迁移到多种双臂任务,且随大规模人类预训练和少量机器人后训练提升,但对需要精细旋转的任务仍受限。

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation Figure 1
2026-06-29cs.CV

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou

Peking University

2026-06-29机器人强化学习

本文针对机器人视频世界模型在接触操作中常出现轨迹不连续、物体穿透和交互关系错误的问题,提出 PhysisForcing:先定位机械臂、物体、接触和运动区域,再用点轨迹约束 DiT 特征的局部运动,并用冻结视频理解编码器对齐区域间语义关系。实验显示其在 R-Bench、PAI-Bench、EZS-Bench 上提升物理合理性,并将 WorldArena 闭环成功率从 16.0% 提高到 24.0%。

Higher-Order Fourier Neural Operator: Explicit Mode Mixer for Nonlinear PDEs Figure 1
2026-06-29cs.CE

Higher-Order Fourier Neural Operator: Explicit Mode Mixer for Nonlinear PDEs

Alex Colagrande, Paul Caillon, Eva Feillet, Alexandre Allauzen

]. Since closed-form solutions are rarely available, these problems typically require numerical

2026-06-29视觉感知

这篇论文针对传统 FNO 在频域中主要对各傅里叶模态独立调制、难以显式表达非线性 PDE 中模态相互作用的问题,提出 Higher-Order Spectral Convolution,在保留傅里叶截断与 FFT 效率的同时进行 n 线性模态混合,并可扩展到球面等几何。实验显示 HO-FNO 在标准 PDE 基准上稳定优于其他谱神经算子,在高非线性任务如多项式强迫 Poisson 方程中收益更明显,单层模型可超过多层 FNO。

BiDeMem: Bidirectional Degradation Memory for Explainable Image Restoration Figure 1
2026-06-29cs.CV

BiDeMem: Bidirectional Degradation Memory for Explainable Image Restoration

Xinrui Wu, Lichen Huang

University of Electronic Science and Technology of China

2026-06-29视觉感知

针对图像复原中退化条件常只以 PSNR 间接验证、难判断是否真具语义先验的问题,BiDeMem 将退化记忆设计为可干预对象:由特征与输入统计检索 top-k 记忆槽,同一槽身份同时用于推理复原和训练期反向退化解释。基于 NAFNet 的多退化实验中,BiRank 达到 29.7529 dB/0.8865,并较校正头、稠密先验和全局先验控制高约 0.26–0.28 dB;错误先验敏感性也显著增强,说明收益不只是额外容量,但外部骨干泛化仍属文中限定范围。

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training Figure 1
2026-06-29cs.CV

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum

National Clinical Research Center for Mental Disorders, National Center for Mental Disorders

2026-06-29视觉语言视觉感知

本文针对针灸、推拿等中医康复训练中手部遮挡严重、手—物交互细节难以由单视角骨架数据刻画的问题,提出CME-AQA框架,将视觉与姿态特征注意力融合,并用第一/第三人称双视角训练、单视角推理提升鲁棒性;同时构建两个61人双视角数据集。实验在针深、快速进针等评分上较强基线加权F1相对提升超过10%,定量指标误差也有所降低,并在CPR数据上显示一定迁移性。

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal Figure 1
2026-06-29cs.CV

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

Shanghai Jiao Tong University, Tsinghua University, Xidian University, Tongji University, University of Electronic Science and Technology of China

2026-06-29生成模型

OSOR针对真实物体移除中阴影/反射等非局部影响、用户掩码不准以及扩散模型推理慢的问题,将移除建模为单步潜空间修复;通过占用率引导判别器强化边界监督、轻量alpha head自动修正移除区域,并用SAVP筛选构建28万对CORNE数据。实验显示其在6个基准上感知质量优于多步扩散基线,推理加速约4到30倍。

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses Figure 1
2026-06-29cs.CV

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

Pragati Shuddhodhan Meshram, Varun Chandrasekaran

Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign

2026-06-29生成模型

这篇论文针对生成图像溯源中仅看输出图像难区分相似扩散模型、共享自编码器时反演信号失效的问题,提出 SDS:用频率受控扰动探测去噪器在不同空间频带间的能量耦合,把去噪响应的谱几何作为模型指纹。该方法无需改模型、反演或优化,仅用前向传播;在 8 个扩散模型闭集归因上约 99.9% 准确率,跨域提示仍达 96.2%。

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement Figure 1
2026-06-29cs.CV

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

2026-06-29安全鲁棒

本文针对视频式远程生理测量在光照、肤色和运动变化下不稳、而测试时部署雷达不现实的问题,提出只在训练阶段使用RF雷达教师的跨模态蒸馏。核心洞察是RGB与RF时域形态不同但频域共享生理节律,因此在频谱上约束主峰、背景噪声和形态锐度,并用元学习策略网络按样本选择蒸馏强度以减少负迁移。实验称在困难与跨数据集场景中较单模态基线MAE提升81%、相关性提升21%。

STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition Figure 1
2026-06-29cs.CV

STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition

Nandani Sharma, Varun Sharma, Dinesh Singh

2026-06-29视觉感知

本文针对微表情动作短暂、幅度弱且跨数据集泛化差的问题,提出 STAG 将光流筛选、ROI 图注意力、全序列 Transformer 与 AU 引导的动态连接结合,并用双向交叉注意力同步建模“哪里动”和“何时动”。在 CASME II、4DME、DFME、NaME、SAMM、SMIC-HS 等数据集上,作者报告其在准确性、鲁棒性、可解释性和计算效率上均优于对比方法。

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts Figure 1
2026-06-29cs.CV

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-pui Chau, Yi Wang

2026-06-29视觉感知

本文针对场景文字检测在跨域语言、拍摄场景变化以及雨雾、低照、过曝、低分辨率等退化下鲁棒性不足的问题,提出 TextDS:用 SAM2 与 DINOv3 双编码器替代大规模文字专用预训练,并通过 SWLoRA 动态逐步低秩适配和 CSF 共享子空间融合对齐特征。实验显示其仅需 4.9M 可训练参数,在多域与退化数据上保持有竞争力的检测性能。

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures Figure 1
2026-06-29cs.CV

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

School of Computer Science and Technology, East China Normal University, Institute of Trustworthy Embodied AI, Fudan University

2026-06-29三维

ReScene面向具身智能中从随手拍室内多视角视频生成可仿真三维场景的瓶颈,指出关键不在单物体重建,而在跨视角关系融合与物理合理装配。其用HierView按语义一致性和3D覆盖度选视角,并将VLM关系、几何与房间先验融合成场景图。ScanNet实验显示CD降17%、LPIPS降26%,且比既有多视角方法最高快10倍,还可生成具身VQA数据提升开源VLM空间推理。

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration Figure 1
2026-06-29cs.CV

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

2026-06-29视觉语言

本文针对现有多模态大模型评测偏重单视角、难以衡量空地协作中几何一致性的问题,提出 AirGroundBench:用同步 UAV–UGV 双视角、跨视角身份与2D/3D度量标注,同时评测静态VQA和闭环导航。结果显示,双视角虽优于单视角,但13个模型在跨视角对齐、坐标变换推理和VLN中明显落后于人类,瓶颈主要在稳定的几何空间表征而非单纯视觉识别。

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution Figure 1
2026-06-29cs.CV

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba

2026-06-29生成模型

本文关注卫星超分中“合成退化训练、真实跨传感器测试”的落差:Sentinel-2 到 PlanetScope 并不存在天然配对,导致扩散SR在真实传感器差异下失效。论文构建时空几何对齐数据集,评测五类扩散模型,并提出基于Sentinel-2自监督特征的 LPIPS Sat。主要发现是合成训练模型在真实配对上显著退化,而直接用真实跨传感器数据训练也存在优化困难,说明当前方法需把超分辨率与域适应更明确地解耦。

MLVC: Multi-platform Learned Video Codec for Real-World Deployment Figure 1
2026-06-29eess.IV

MLVC: Multi-platform Learned Video Codec for Real-World Deployment

Tanel Pärnamaa, Martin Lumiste, Ardi Loot, Evgenii Indenbom, Andrei Znobishchev, Ando Saabas

2026-06-29视觉感知强化学习

这篇论文针对神经视频编码难以在真实异构设备部署的问题:跨平台数值差异会破坏熵解码,且算力成本高。MLVC的核心做法是在超先验中显式传输压缩后的尺度索引,以牺牲少量码率换取硬件一致性,并用门控记忆、ReGLU、长期参考恢复和感知训练补回效率。实验显示其在VCD视频会议基准上相对硬件HEVC取得超过70%的MOS BD-rate改进,并在Apple、Intel、Qualcomm NPU上实现约100 FPS编解码。

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation Figure 1
2026-06-29cs.CV

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

2026-06-29视觉感知

EMOSH针对人体动画中2D姿态易泄露驱动者体型、3D先验又难表达表情和手势的矛盾,引入可分离形体与姿态的EHM表示,并配合置信感知运动跟踪、粗到细的网格与关键点混合注入,以及空间对齐条件来减小训练/推理域差。实验显示其在自驱动和跨驱动场景中较既有方法更能保持身份与体型,同时生成更细致的表情和手势。

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL Figure 1
2026-06-29cs.CV

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyun Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

2026-06-29视觉感知强化学习

本文针对自回归视频生成按块生成时难以明确“当前该发生什么”、步骤提示切换又易滞后或语义混叠的问题,提出 TempAct:用 LLM 规划器生成可执行的时序分解,并通过规划组/执行组的层级强化学习同时优化计划质量与提示切换执行。实验在 Self-Forcing 和 LongLive 上提升 Temporal-Following Score,并基本保持视觉质量。

Curriculum-guided Change Detection Training: Toward Accurate Serac Fall Monitoring Figure 1
2026-06-29cs.CV

Curriculum-guided Change Detection Training: Toward Accurate Serac Fall Monitoring

Arthur Dérédel, Carlos Crispim-Junior, Pierre Lemaire, Johan Berthet, Laure Tougne Rodet

2026-06-29视觉感知

这篇论文针对冰塔崩落监测中的变化检测训练问题:多时相户外图像常因太阳角度、阴影和外观差异产生伪变化,均匀采样会带来噪声梯度。作者将课程学习引入变化检测,用太阳角差SAG和SSIM衡量样本难度,逐步加入更难样本;在SeracFallDet上,像素级和目标级方法均较常规训练稳定提升,并减少误检与重复检测。

HumanMoveVQA: Can Video MLLMs reason about human movement in videos? Figure 1
2026-06-29cs.CV

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

2026-06-29视觉感知

本文针对视频 MLLM 常把人体运动压缩成动作标签、难以理解空间轨迹和朝向变化的问题,提出 HumanMoveVQA 基准:以首帧锚定的世界坐标系重建 3D 人体运动轨迹,并生成 1 万余个覆盖存在、排序、比较、计数、轨迹可达性等类别的问答。实验显示闭源模型在零样本轨迹推理上接近机会水平,而用该数据微调 Qwen3-VL 8B 可将机会归一化得分约从 14.3 提升到 43.0,说明能力缺口主要可由针对性的世界一致监督缓解。

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search Figure 1
2026-06-29cs.CV

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

Xirui Teng, Nan Xi, Junsong Yuan

2026-06-29生成模型强化学习

本文针对动作质量评估中“只给分、不解释”的黑箱问题,将细粒度技能视频的判断过程建模为潜在空间中的扩散式逐步推理,并用关键点引导的蒙特卡洛树搜索寻找对最终评分最关键的时空推理轨迹。该方法在多个体育与手术数据集上取得有竞争力或更好的评分表现,同时输出随时间变化的关键点注意与推理路径,但具体性能增益相对扩散建模、MCTS 与关键点先验的来源仍需进一步拆解。

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation Figure 1
2026-06-29cs.CV

Parallel Rollout Approximation for Pixel-Space Autoregressive Image Generation

Jiayi Xu, Di He, Guolin Ke

Peking University

2026-06-29视觉感知

本文针对像素空间自回归图像生成中“高维像素块难预测”和教师强制导致的训练—推理不一致问题,提出 PRA:先生成低维中间状态再解码回像素,并用同一路径并行构造近似 rollout 的像素输入,避免昂贵的顺序采样。在 ImageNet-1K 256×256 上,135M 模型 FID 2.58 已超过既有十亿级像素 AR,511M 模型达 1.94,并提升线性探测精度。

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering Figure 1
2026-06-29cs.CV

ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering

ZhengXian Wu, Hangrui Xu, Kai Shi, Zhuohong Chen, Yunyao Yu, Chuanrui Zhang, Zirui Liao, Jun Yang, Zhenyu Yang, Haonan Lu, Haoqian Wang

2026-06-29视觉语言

ProMSA针对知识型视觉问答中固定RAG流程无法按问题状态调整检索、纠错和构建多跳证据的问题,将模型设计为有工具预算的渐进式多模态搜索代理,可在图像检索、文本检索与停止回答间迭代决策,并用去重避免重复证据。训练上先用拒绝采样SFT学习工具格式,再用按生成长度和工具深度归一化的TN-GSPO稳定优化搜索策略;在E-VQA和InfoSeek上,相比强RAG与代理基线取得更高检索和端到端准确率。

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control Figure 1
2026-06-29cs.CV

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

Haoyuan Wang, Yabo Chen, Haibin Huang, Chi Zhang, Xuelong Li

2026-06-29视觉感知强化学习规划控制

本文面向长时域可控世界模型中人运动与相机轨迹相互干扰、误差累积导致视频漂移的问题,提出基于MMPL的自回归框架,通过人/相机控制解耦训练、Fast-Slow Memory稳定后训练,以及timestep感知SMPL投影和Motion-CFG提升动作对齐。实验显示其在长视频稳定性、人体动作精度、多人物控制和相机探索一致性上优于对比方法,但增益可能也受新构建的大规模标注数据影响。

Understanding How MLLMs Describe Artworks Using Token Activation Maps Figure 1
2026-06-29cs.CV

Understanding How MLLMs Describe Artworks Using Token Activation Maps

Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi, Eva Cetinic, Gennaro Vessio, Giovanna Castellano

Department of Computer Science, University of Bari Aldo Moro, University of Zurich

2026-06-29视觉感知

这篇论文关注多模态大模型在描述艺术品时是否真正依据画面,而非依赖语言先验。作者用 Token Activation Map 将生成文本逐 token 对应到图像热区,比较物体、风格、元数据、图像志符号和情感表达的 grounding 差异。结果显示具体物体更局部,风格、情绪和作品名等更分散;模型能尝试识别作者和作品,但作者归因优于标题预测,标题幻觉更明显。

Controllable Histopathology Image Synthesis with Training-free Structural Initialization and Textural Modulation Figure 1
2026-06-29cs.CV

Controllable Histopathology Image Synthesis with Training-free Structural Initialization and Textural Modulation

Yuheng Qiu, Jingyi Luo, Chenfei Ye, Ting Ma, Jianfeng Cao

2026-06-29视觉感知规划控制

针对病理图像标注昂贵、现有合成方法仍依赖成对或少量标注约束的问题,CHIS把已在无标注病理图像上训练的扩散模型作为冻结骨干,通过先验细胞掩码的频域相位初始化控制结构,再用小波层级调制粗细纹理以保持参考组织风格。实验显示其在生成保真度、掩码结构一致性和下游分割性能上优于对比方法,但具体增益在不同模块间的贡献仍需看消融细节。

Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing Figure 1
2026-06-29cs.AI

Verifiable Geometry Problem Solving: Solver-Driven Autoformalization and Theorem Proposing

Can Li, Ting Zhang, Junbo Zhao, Hua Huang

Beijing Normal University

2026-06-29优化算法

本文针对几何题求解中自动形式化与下游求解器脱节、固定定理库易陷入推理停滞的问题,提出 SD-GPS:用求解器反馈训练多模态形式化器,并让神经代理只提出经符号验证的局部引理。实验在 Geometry3K 与 PGPS9K 的完形、选择和跨模态引用设置下均优于多模态大模型、神经及神经符号基线,说明将感知输出闭环到可执行证明能提升可验证推理。

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design Figure 1
2026-06-29cs.CV

Home3D 1.0: A High-Fidelity Image-to-3D Asset Generation System for Interior Design

Yiyun Fei, Guoqiu Li, Jin Song, Chuqiao Wu, Delong Wu, Hong Wu, Ziru Zeng, Haohui Chen, YinDong Kong, Jing Li, Qi Wu, Feng Zhang

2026-06-29视觉感知三维

面向室内设计和电商,论文指出单图三维生成不能只“像某类家具”,还需保持具体商品的形体、纹理、PBR材质与可编辑材料分区。Home3D 1.0将任务拆成几何、纹理、材质和部件四阶段:用粗到细latent SDF/DiT重建水密网格,用多视图反投影与3D纹理场补全外观,并通过MatWeaver分割、检索式PBR烘焙和多头SDF部件生成支持材料级编辑。实验按模块评估,几何在家具基准上优于对比系统,如CD 0.4936、F1@0.01为0.6329;但整体系统增益中私有高质量数据与工程化scaling的贡献文中未充分说明。

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding Figure 1
2026-06-29cs.CV

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

2026-06-29视觉感知

长视频多模态模型的自反思常因缺少外部证据而陷入“盲目自信”,甚至把正确答案改错。Reflect-R1将纠错拆成直觉、证据验证和仲裁三阶段,主动检索关键帧并用SD-GRPO分阶段优化,配套12万样本训练数据;在VideoMME、LongVideoBench、MLVU等基准达到SOTA,并提升真实纠错率。

Every Step of the Way: Video-based Parkinsonian Turning Step Counting Figure 1
2026-06-29cs.CV

Every Step of the Way: Video-based Parkinsonian Turning Step Counting

Qiushuo Cheng, Jingjing Liu, Catherine Morgan, Alan Whone, Majid Mirmehdi

2026-06-29视觉感知

这篇论文针对帕金森患者转身步数难以用人工量表或可穿戴设备稳定、便捷测量的问题,提出被动视频式粗到细计数框架:先由3D人体网格生成足部运动信号做初估,再用网格与光流的跨注意力融合捕捉拖步、碎步等细微动态,并以MIL适配不同视频长度。在PD-FOG和家庭Turn-REMAP数据上优于视觉计数和IMU基线,绝对误差由37.7降至15.9。

There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion Figure 1
2026-06-29cs.CV

There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion

Lishen Qu, Yao Liu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang

Nankai International Advanced Research Institute (SHENZHEN·FUTIAN), Peng Cheng Laboratory, College of Computer Science, Nankai University, The Hong Kong Polytechnic University, OPPO Research Institute

2026-06-29视觉感知

本文针对多曝光融合模型通常绑定固定输入帧数、部署时需为不同曝光策略训练多套模型的问题,提出 FreeMEF:先用循环状态空间模块按序聚合任意数量曝光帧,再以全局特征引导基准帧,并通过极值感知混合注意力缓解饱和区域的“相似性悖论”。在三个基准数据集上,方法在定量指标和视觉质量上优于现有方法。

Long-Term Prediction of Local and Global Human Motion with Occlusion Recovery Figure 1
2026-06-29cs.CV

Long-Term Prediction of Local and Global Human Motion with Occlusion Recovery

Qiaoyue Yang, Sven Heutger, Christopher Niemann, Magnus Jung, Ayoub Al-Hamadi, Sven Wachsmuth

This work was done while S. Heutger was with Bielefeld University.

2026-06-29视觉感知

面向机器人协作、自动驾驶等需要提前理解人类动作的场景,论文指出自回归姿态预测易在长时域累积误差且难处理遮挡。其核心是用非自回归时空 Transformer 同时预测局部关节姿态与全局空间运动,并以可学习 token 恢复缺失关节、支持变长历史输入。文中称通过定量、定性和消融验证有效,但具体增益幅度在给定文本中未充分说明。

A Multi-Attribute Latent Space for Visual Analysis of Watches Figure 1
2026-06-29cs.CV

A Multi-Attribute Latent Space for Visual Analysis of Watches

Kai Lawonn, Tobias Günther, Monique Meuschke

with a Vision Transformer, colors are represented through a shared CIELAB reference palette, and dial structure is described with, and novices. The results suggest that the system supports discovery and comparison, while also revealing limitations in scalability, simple projection of all available features is problematic because watch, remains available as interactive filters. To construct the attributes, we, describe color with a shared CIELAB reference palette, and describe, • Kai Lawonn is with Leipzig University and ScaDS.AI Dresden/Leipzig., • Monique Meuschke is with Otto von Guericke University of Magdeburg., neous attributes and combine them using user-controllable weights. We, differs in two ways: the collection combines semantic type labels with, keeps filtering and details available to compensate for the ambiguity of, size [33], and GPU implementations improve scalability [7,23]. Re-, lar guiding role, but it is derived from class labels and decays during

2026-06-29视觉感知

本文针对手表电商/目录检索只能按元数据筛选、难以支持风格探索和相似款比较的问题,提出将表盘颜色、表盘结构与手表类型拆分建模的多属性潜空间。方法用 U-Net、ViT、CIELAB 与 HOG 提取属性,并扩展 UMAP 以融合属性图和类别约束布局,配合交互式地图检索。实验含参数、运行时与小规模专家/新手试用,显示有助于发现和比较,但可扩展性与以图搜图有效性仍文中未充分说明。

OrthoTryOn: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation Figure 1
2026-06-29cs.CV

OrthoTryOn: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation

Zhaotong Yang, Ying Tai, Jiahui Zhan, Yu Zheng, Jianjun Qian, Jian Yang

2026-06-29视觉感知

这篇论文针对统一服装生成中虚拟试穿、服装重建、姿态迁移等任务共享 LoRA 时出现的梯度冲突和负迁移问题,提出在 LoRA 瓶颈中加入任务特定正交旋转的 OSP,以几何去相关方式稳定联合训练,并用基于 Fisher 信息的 FNG 在推理时抑制易混任务干扰。实验显示其避免朴素多任务训练退化,在多个基准上超过独立任务模型且可迁移到不同扩散骨干。

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion Figure 1
2026-06-29cs.CV

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

2026-06-29数据集/基准

针对现有无人机基准偏重图像识别、单视角理解且难以评估低空场景中的3D空间推理、跨视角协作和运动理解,SpatialUAV构建了含4331个真实样本、14类任务的统一视觉-问题-答案基准,覆盖航拍-航拍、航拍-地面协作及多种输出格式。对18个代表性VLM的评测显示,当前模型与人类水平仍有明显差距,瓶颈集中在跨视角关联、结构化定位、几何推理和时序视角变化理解。

A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of $\mathrm{O}(2)$ Figure 1
2026-06-29cs.CV

A Unified Framework for Vision Transformers Equivariant to Discrete Subgroups of $\mathrm{O}(2)$

T\=ıkun Ông, Georg Bökman

University of Amsterdam

2026-06-29视觉感知

本文针对标准 ViT 缺少旋转、翻转等平面对称归纳偏置的问题,提出面向 O(2) 任意离散子群的等变 ViT 统一框架,把既有翻转和 D4 等变模型纳入同一表示论构造,并证明子群间模型类嵌入及单头等变注意力的表达性不弱于相应等变普通注意力。实验在低数据 PatternNet 上显示等变性可提升识别率,但大群未必更好,增益可能主要来自 data-scarce 场景。

ScaLe-INR: Scale and Learn Implicit Neural Representations Figure 1
2026-06-29cs.CV

ScaLe-INR: Scale and Learn Implicit Neural Representations

Buwaneka Epakanda, Athulya Ratnayake, Pandula Thennakoon, Mario De Silva, Avishka Ranasinghe, Roshan Godaliyadda, Parakrama Ekanayake

2026-06-29视觉感知

ScaLe-INR针对隐式神经表示在多尺度信号中易受频谱偏置和高低频串扰影响的问题,提出用傅里叶反向缩放思想对坐标做方向性缩放,并以多分支结构分别建模低频结构与方向/联合高频细节,再通过置信融合和边缘引导损失约束分支分工。实验称其在图像重建、去噪、音频和3D重建上超过既有方法,如图像重建提升5.16 dB、去噪提升0.65 dB,但部分增益来源可能主要来自scaling与分支融合设计。

Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modeling Figure 1
2026-06-29cs.CV

Hippocampus-DETR: An Explicit Memory Object Detection Framework Based on Hippocampus Modeling

Zhaoning Shi, Bo Ma, Hao Xu, Zepeng Yang, Bo Liang

((1) Beijing institute of Technology), task robustness. The project is available at https://github.com/2186cloud/hipnet.

2026-06-29视觉感知

该文针对DETR类检测器缺少显式记忆、在遮挡和少样本场景中学习效率受限的问题,提出将仿海马结构的HipNet嵌入DETR,分别模拟EC、DG、CA3、CA1和下托,实现模式分离、补全、筛选与整合。实验称其在COCO检测上优于主流方法,并在少样本分类、多模态特征构建和图像修复中表现出更好泛化与数据效率,但具体增益相对结构复杂度的来源仍需进一步验证。

CSD: Content-aware Speculative Decoding for Efficient Image Generation Figure 1
2026-06-29cs.CV

CSD: Content-aware Speculative Decoding for Efficient Image Generation

Mingcheng Wang, Junbo Qiao, Yunchen Li, Lingfu Jiang, Wei Li, Jie Hu, Jiao Xie, Zhou Yu, Xinghao Chen, Guixu Zhang, Shaohui Lin

2026-06-29视觉感知

本文针对自回归图像生成逐 token 解码慢、现有推测解码在图像中接受率低且不感知内容的问题,提出 CSD:用目标模型熵识别平滑/低细节区域并放宽候选 token 接受概率,同时用最优重采样和基于 TV 距离的分布对齐过滤器控制质量偏移。在 Lumina-mGPT 与 Janus-Pro 上,CSD 相比普通 AR 和 SJD/GSD 进一步降低延迟,例如 Janus-Pro 可达约 4.33×加速且 CLIP 下降很小。

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning Figure 1
2026-06-29cs.CV

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

Colab, Beihang University

2026-06-29视觉感知规划控制数据集/基准

这篇论文针对现有视频基准把时序逻辑能力与场景复杂度、静态识别混在一起的问题,提出可控诊断基准 Video-MME-Logical,将视频推理拆成状态跟踪、顺序计数、时序排序、动态空间关系和结构组合等操作,并用程序生成控制难度与中间状态验证。实验显示强 MLLM 与人类仍有明显差距,500K 样本监督微调虽提升到约 40% 准确率,但增益有限,说明单纯扩大数据仍难解决长时程逻辑推理。

Scalable and Differentiable Point-Cloud Registration Using Maximum Mean Discrepancy Figure 1
2026-06-29cs.CV

Scalable and Differentiable Point-Cloud Registration Using Maximum Mean Discrepancy

Rixon Crane, Fahira Afzal Maken, Nicholas Lawrance, Stanislav Funiak, Kasra Khosoussi, Ming Xu, Russell Tsuchida

2026-06-29视觉感知

针对机器人/自动驾驶中点云配准需同时具备可扩展、抗噪和可微的问题,论文提出 MMD-Reg:用最大均值差异刻画两点云分布差异,并以随机傅里叶特征把目标降为线性复杂度,再通过隐函数定理嵌入神经网络训练。实验显示其在合成、户外及 ModelNet40 部分重叠场景中兼具较快推理和有竞争力精度,但仍定位为依赖粗初始化的局部配准方法。

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation Figure 1
2026-06-29cs.CV

Text as Illumination: Spatial Contrastive Retinex Learning for Language-guided Medical Image Segmentation

Jian Shi, Cheng Zhen, Pingping Zhang, Rui Xu, Yanan Lv, Yili Ma, Huan Bi, Haojie Li, Huchuan Lu

2026-06-29视觉感知

针对语言引导医学图像分割中文本与像素预测容易语义错配的问题,论文提出 TIRNet,将文本嵌入视作 Retinex 式“语义照明”,在各解码层用正负照明图强化目标、抑制背景,并以多尺度照明监督约束前景对齐和背景抑制。实验在 MosMedData+ 与 QaTa-COV19 上优于既有 LMIS 方法,但具体增益中各模块贡献仍依赖消融结果判断。

Improving Adversarial Robustness via Activation Amplification and Attenuation Figure 1
2026-06-29cs.CV

Improving Adversarial Robustness via Activation Amplification and Attenuation

Taïga Gonçalves, Yongsong Huang, Tomo Miyazaki, Shinichiro Omachi

2026-06-29安全鲁棒

这篇论文针对对抗样本中非鲁棒特征会误导神经网络的问题,提出轻量插件 A3:用可学习掩码和由原始激活幅值导出的有界 scaling,同时构造“放大”与“衰减”两种激活视图,并把放大视图作为负参照设计对比与排序损失,推理时仅使用衰减特征。实验称其在不同骨干、数据集和对抗训练方法上稳定提升鲁棒精度,且计算与参数开销很小;但增益可能主要来自 scaling 机制与训练损失的共同作用。

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations Figure 1
2026-06-29cs.CV

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

2026-06-29生成模型

MindFlow针对双人对话中虚拟人表情“有反应但缺语义”、说话与聆听动态难以同时精细控制的问题,将生成拆成类脑腹侧语义理解与背侧声学运动生成两路。其关键在于用原始音频块构建连续情绪状态链,并用选择性声学注入在说话/聆听间自适应门控音频特征。实验显示其在语义贴合、表情自然度、唇同步和表达准确性上优于现有方法。

TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning Figure 1
2026-06-29cs.CV

TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning

Enguang Wang, Hao Zhou, Shuo Gao, Tuo Liu, Guangquan Zhou

2026-06-29视觉感知

腹部创伤超声依赖连续扫查中的细微动态线索,人工判读耗时且受操作者影响。TRUST将参数高效图像到视频迁移用于超声视频,在CLIP式框架中用跨频协同适配器抑制散斑并保留细节,用多粒度运动模块同时建模局部连续性和跨视角跳变,并以视觉查询动态生成文本原型以缓解扫描差异。院内数据上较现有方法提升9.63%,但数据规模与外部泛化文中未充分说明。

ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On Figure 1
2026-06-29cs.CV

ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On

Xiangyu Sai, Meysam Madadi, Sergio Escalera, Yong Xu

2026-06-29生成模型

ModaFlow针对虚拟试衣中服装纹理/文字细节易丢失、人体形变和非配对遮挡下对齐不稳的问题,引入流匹配框架,并区分视觉与文本条件:图像嵌入提供稳定结构约束,文本嵌入用自适应CFG控制语义;再配合随机mask训练和流场正则提升几何一致性。实验报告在配对与非配对基准上达到SOTA,FID分别约降30%和20%。

An Embedded Real-Time License Plate Recognition System for Complex Traffic Scenes Figure 1
2026-06-29cs.CV

An Embedded Real-Time License Plate Recognition System for Complex Traffic Scenes

Anuki Pasqual, Dulan Lokugeegana, Manimohan Thiriloganathan, Nuthya Rathnayake, Kithsiri Samarasinghe, Udaya S. K. P. Miriya Thanthrige

The authors are with the Dept. of Electronic and Telecommunication Engineering, University of Moratuwa, Sri Lanka

2026-06-29视觉感知

面向发展中国家无车道约束、多车型且需低成本边缘部署的复杂交通场景,本文将车牌检测与字符识别拆成两个轻量量化 CNN,并发布含斯里兰卡多车道道路图像的 SL-LPR 数据集,再用 FINN 在 Kria KV260 FPGA 上加速。系统在自建数据集上检测 mAP 达 93.6%、字符识别准确率 87.88%,端到端 11.5 FPS、最高延迟 87 ms,表明其主要贡献在于把复杂多车场景与嵌入式实时部署结合起来。

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning Figure 1
2026-06-29cs.LG

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

2026-06-29生成模型强化学习优化算法

本文针对流匹配生成模型在强化学习后训练中“奖励上升但画质变差”的问题,指出关键漂移并非整体偏离,而是每步速度范数被系统性放大且推理期重归一化无效。NormGuard 以训练期单边 hinge 约束抑制超过参考模型的范数增长,尽量保留方向性奖励信号。实验覆盖两类基座、三种后训练方法和两种奖励代理,显示其能提升感知质量与真实感,并基本保持奖励收益。

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion Figure 1
2026-06-29cs.CV

PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion

Zipeng Guo, Lichen Ma, Yu He, Xiaolong Fu, Jingling Fu, Junshi Huang, Yan Li

2026-06-29生成模型

PixelU针对像素空间扩散绕开VAE后难以同时处理低频语义与高频细节、且现有方法依赖昂贵像素解码器的问题,指出这些解码器主要是在补偿v-prediction优化困难;在x-prediction下,单阶段U形Transformer用跳连传递高频信息、恒通道下采样作为低通语义压缩即可。实验在ImageNet 256/512上FID为1.63/1.92,并以约JiT-G三分之一计算量超过该强基线。

Panoramic Scene Analysis: A Survey from Distortion-Aware Engineering to Sphere-Native Foundation Modeling Figure 1
2026-06-29cs.CV

Panoramic Scene Analysis: A Survey from Distortion-Aware Engineering to Sphere-Native Foundation Modeling

Qinfeng Zhu, Lei Fan

University of Liverpool, Xi’an Jiaotong-Liverpool University, University of Liverpool Department of Computer Science Liverpool L69 3BX United Kingdom, Xi’an Jiaotong-Liverpool University Department of Civil Engineering Suzhou 215123 China

2026-06-29视觉感知

该综述针对全景图像虽能提供机器人导航与具身感知所需的全局空间上下文、却因球面到平面投影产生畸变而失配常规视觉模型的问题,提出以“几何承诺”递进组织全景场景分析:从投影适配、畸变感知工程到球面原生建模与基础模型接口适配。主要洞察是严格球面等变性与完整复用透视预训练权重尚难兼得,并指出现有评测缺少球面面积加权、接缝一致性、极区鲁棒性等协议,给出面向通用全景智能的研究路线。

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models Figure 1
2026-06-29cs.CV

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

2026-06-29视觉感知生成模型

本文针对视频扩散模型中相机运动与物体运动相互“纠缠”、导致相对运动不符合物理直觉的问题,指出根源在于真实视频数据偏置和去噪重建训练会让模型复制已有运动捷径。SIFT改用自生成视频进行“自想象”微调,结合运动感知判别监督与渐进困难样本回放,从文本语义学习运动解耦。实验显示其提升了运动物理合理性、解耦性和可控性,但具体增益在不同基座模型上的泛化边界仍需看完整实验细节。

Learning 1-Bit LiDAR-based Localization with Auxiliary Objective Figure 1
2026-06-29cs.CV

Learning 1-Bit LiDAR-based Localization with Auxiliary Objective

Kaijie Yin, Zhiyuan Zhang, Tian Gao, Wentao Zhu, Cheng-zhong Xu, Hui Kong

2026-06-29视觉感知

这篇论文针对车载定位模块常驻运行、算力和内存预算受限的问题,尝试把 6DoF LiDAR 绝对位姿回归做成全 1-bit 二值网络。核心洞察是二值化不仅降容量,还会在层间造成任务相关信息流失和梯度不匹配,因此 BiLoc 用信息瓶颈视角引入训练期辅助目标,以全精度模型特征作参考来约束二值编码器保留关键表示,推理时不增加开销。实验称其在大规模室外数据集上优于已有二值定位方法,并在 Oxford Radar RobotCar 上降低平均位置和朝向误差。

Scene and Human in One World: Reconstruction in a Feedforward Pass Figure 1
2026-06-29cs.CV

Scene and Human in One World: Reconstruction in a Feedforward Pass

Boao Shi, Qiao Feng, Yiming Huang, Lingjie Liu

University of Pennsylvania, University of Pennsylvania Philadelphia Pennsylvania USA

2026-06-29强化学习三维

针对单目动态视频中人体与场景分开重建易产生尺度、位置和遮挡不一致的问题,论文提出 SHOW,将人体系数先验、DensePose 辅助监督与 mask prompt 注入前馈场景点图预测,并反向用场景几何约束 SMPL-X 人体恢复,在统一度量空间内联合估计人体、场景与全局位置。实验称其在 3DPW、EMDB、RICH 上提升了局部人体重建、尺度一致性和人景对齐,但真实复杂场景仍存在 sim-to-real 泛化不足。

MASS: Motion-Aligned Selective Scan for Refinement in Flow-Based Video Frame Interpolation Figure 1
2026-06-29cs.CV

MASS: Motion-Aligned Selective Scan for Refinement in Flow-Based Video Frame Interpolation

Jun-Sang Yoo, Seung-Won Jung

2026-06-29视觉感知生成模型

针对基于光流的视频插帧在大位移、遮挡和非线性运动下对应关系不稳,以及现有 SSM 仍按静态网格扫描而与真实运动路径错位的问题,MASS 将特征序列化改为沿每个像素的光流引导轨迹进行,并用可学习残差速度近似弯曲轨迹、按运动幅度自适应调整采样长度和 SSM 步长,再用于细化中间光流与遮挡掩码。实验显示其在标准基准上整体具有竞争力,尤其在大运动、高分辨率和复杂动态场景取得更明显优势。

ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval Figure 1
2026-06-29cs.CV

ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval

Siqiao Xue, Chunxue Xu

2026-06-29安全鲁棒

本文针对时尚图文检索中“领域微调提升目标集表现却损害泛化”的矛盾,提出在 SigLIP2-base 上进行全量微调、图像端知识蒸馏,并用 WiSE-FT 与基座权重插值,以兼顾短关键词和长描述查询。实验称该配方优于 LoRA、更大骨干和外部数据,并在 ZooClaw-Fashion、H&M 与重评后的 Fashion200k 上领先或持平;但部分收益也依赖其新基准与重标注协议。

Joint Transcription and Decryption of Images of Encrypted Handwritten Documents: A Comparison with the Traditional Pipeline Figure 1
2026-06-29cs.CV

Joint Transcription and Decryption of Images of Encrypted Handwritten Documents: A Comparison with the Traditional Pipeline

Marino Oliveros-Blanco, Lei Kang, Alicia Fornés, Beáta Megyesi

Computer Vision Center, Department of Computer Science, Department of Linguistics, Stockholm University, Sweden

2026-06-29视觉感知

这篇工作针对历史加密手稿“先识别密文符号、再解密”流程中转录错误会级联放大的问题,以 Copiale 密码为案例,提出从手写加密图像直接生成明文的端到端 Direct Image Decryption,并用合成数据扩充训练。结果表明联合图像到明文建模可作为传统流水线的有希望替代方案,但模型仍针对特定替换密码,跨密码泛化能力文中未充分说明。

Class-frequency Guided Noise Schedule for Diffusion Models Figure 1
2026-06-29cs.LG

Class-frequency Guided Noise Schedule for Diffusion Models

Jiequan Cui, Beier Zhu, Qingshan Xu, Xiaojuan Qi, Bei Yu, Hanwang Zhang

2026-06-29生成模型

这篇论文关注长尾数据中扩散模型对低频类别生成质量差的问题,指出统一噪声日程会让低频类仍处于更大低密度区域,且高频类主导 score 空间。核心做法是提出与类别频率负相关的 CFRG 噪声日程,为低频类加入更大尺度噪声以平衡 score 估计。实验在 CIFAR-100-LT、ImageNet-LT 的图像生成、分类增强和文生图上提升 FID 与分类精度。

Two-Stage Cross-Domain Cervical Abnormality Screening with Cytopathological Image Synthesis and Knowledge Distillation Figure 1
2026-06-29cs.CV

Two-Stage Cross-Domain Cervical Abnormality Screening with Cytopathological Image Synthesis and Knowledge Distillation

Jincheng Li, Yuzhi He, Yihui Zhan, Xinmei Zhang, Yifei Sun, Zelin Liu, Lichi Zhang, Minye Shao, Lili Zhao

2026-06-29视觉感知

针对宫颈细胞筛查在不同机构染色和制片差异下泛化差、病变阶段视觉差异细微的问题,论文提出两阶段跨域检测框架:先用空间连续的未配对神经薛定谔桥生成中间域,缓解高分辨率切块翻译的边界伪影;再通过知识蒸馏同时对齐浅层结构与深层语义特征。两套大规模数据实验显示其跨域检测提升明显,最高达到26.9% mAP和45.8% mAP50。

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory Figure 1
2026-06-29cs.RO

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Peng Su, Zhaowen Li, Yan Huang, Liang Wang

2026-06-29强化学习

DiM-WAM针对长时程机器人操作中短历史窗口易遗忘早期关键状态、难判断全局进度的问题,提出多类型历史事件记忆:从真实观测压缩事件信息,分多记忆库独立合并并带时间/库标识读出,同时用进度监督约束记忆表征。在RMBench上将LingBot-VA平均成功率由28.4%提升至69.8%,真实Franka任务全流程成功率由52.5%升至80.0%。

Multi-Modal Conditioned High-Resolution Transformer for Urban Electromagnetic Field Map Prediction Download PDF Figure 1
2026-06-29cs.CV

Multi-Modal Conditioned High-Resolution Transformer for Urban Electromagnetic Field Map Prediction Download PDF

Do-Eon Kim, Dongryul Park, Seungyoung Ahn, Namwoo Kang, Seong-heum Kim, Seongsin Kim

2026-06-29视觉感知

面向城市蜂窝网络规划中射线追踪仿真成本高的问题,论文将建筑布局、天线标量参数与方向图分路径建模:用HRFormer保持高分辨率特征,FiLM调制各阶段,交叉注意力融合辐射模式,并加入发射机相对空间通道与一致性TTA。768个仿真样本上,最佳模型MAE为0.0461,较UNet降25.2%、较仅HRFormer降31.8%,但跨城市、实测泛化文中未充分说明。

Explainable AI for Biodiversity Monitoring and Ecological Image Analysis Figure 1
2026-06-29cs.CV

Explainable AI for Biodiversity Monitoring and Ecological Image Analysis

Brinnae Bent, Holly R. Houliston, Jiayi Zhou, Günel Aghakishiyeva, David W. Johnston

Pratt School of Engineering, Duke University, Department of Applied Mathematics and Theoretical Physics, University of Cambridge, Duke University Division of Marine Science and Conservation, Nicholas School of the, Environment, Duke University Marine Laboratory

2026-06-29视觉感知

本文针对生态图像监测中深度视觉模型虽准确却难以判断是否依赖真实生物线索的问题,主张将可解释 AI 纳入模型验证流程,并围绕分类、检测、分割给出面向生态工作流的 XAI 方法框架。通过港海豹航拍检测和鲸豚解剖分割案例,论文展示解释图可揭示背景、形状、边缘与遮挡导致的误检或分割失败,并指导数据增广、重训和采样改进,但量化增益与统一评估标准文中未充分说明。

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving Figure 1
2026-06-29cs.CV

MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving

Nan Yang, Zhanwen Liu, Linfeng Zhang, Shangyu Xie, Yang Wang, Wenzhuo Zhou, Xiangmo Zhao

2026-06-29视觉语言视觉感知

本文针对自动驾驶多视角 VLM 因视觉 token 过长导致推理延迟高的问题,指出不同视角贡献随场景和指令变化,且模型在浅层偏全局语义、深层逐步形成任务相关视角先验。MVPruner据此采用两阶段动态剪枝:先按视角信息多样性分配预算并保留跨层稳定贡献 token,再由指令引导任务相关视角和 token 选择。在 DriveLMM-o1、DriveLM、MAPLM、STSnu 等基准上,该方法在仅保留约10%视觉 token 时仍保持较高准确率,DriveLM 上 FLOPs 降低 87.3%、prefill 加速 4.97×且保留 98.5%准确率。

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion Figure 1
2026-06-29cs.CV

GeoFace: Consistent Multi-View Face Generation with Geometry-Constrained Diffusion

Yeji Choi, Jinhyeok Choi, Jaewon Min, Minkyung Kwon, Jin Hyeon Kim, Seungryong Kim

2026-06-29生成模型

针对单张人脸生成多视角图像时常见的跨视角几何漂移与身份结构退化问题,GeoFace将外观生成和3D几何生成放入双流扩散框架,并用FLAME空间的规范UV位置图作为共享约束,通过几何引导的注意力对齐损失监督外观与几何token对应关系。实验在RenderMe-360和NeRSemble上显示,其视觉质量和跨视角几何一致性优于现有多视角扩散方法,并可为后续3D重建提供更好的初始化。

Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection Figure 1
2026-06-29cs.CV

Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection

Yinghui Xing, Donghao Chu, Shizhou Zhang, Di Xu

2026-06-29视觉感知

本文针对低信噪比多帧红外小目标在单帧中难以与背景区分、SAM类方法又依赖可靠提示的问题,提出TEP-SAM:显式建模全局背景运动与局部目标运动偏差,将“随时间显现”的线索注入冻结SAM特征,并自动生成时间提示以实现非交互分割。实验称其在多个M-IRSTD基准上优于现有方法,尤其在严重低SNR和复杂动态背景下更稳健。

VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models Figure 1
2026-06-29cs.CV

VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models

Chanik Kang, Raphaël Pestourie, Haejun Chung

2026-06-29视觉语言视觉感知

这篇论文关注紧凑/受限超表面光学前端与冻结视觉语言模型之间的目标错配:传统清晰成像指标未必最利于识别。作者提出 CODA,将冻结 CLIP 的分类损失经可微成像和 Maxwell 伴随梯度直接反传到超光学密度,不加入重建或 ISP。二维仿真中,ImageNet-100 零样本准确率由聚焦基线 53.75% 提升到 65.41%,且无需重优化可迁移到 CLIP、SigLIP、DINOv2 多数据集;但结论受限于线扫描二维仿真,未声称优于干净图像。

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations Figure 1
2026-06-29cs.CV

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

2026-06-29强化学习三维

针对占用世界模型过度依赖外部模态、LLM或人为拆分潜空间的问题,CascadeOcc强调挖掘3D占用表示自身的层级结构:用多尺度级联VQ/VQVAE-v2在自回归框架中由粗到细生成场景,并以TimeMixer融合长短期时序依赖。文中在Occ3D和nuScenes上报告,相比OccWorld,3D重建IoU/mIoU提升2.24%/4.6%,4D预测提升3.65%/3.2%,且碰撞率更低。

AI-Generated Image Recognition via Fusion of CNNs and Vision Transformers Figure 1
2026-06-29cs.CV

AI-Generated Image Recognition via Fusion of CNNs and Vision Transformers

Xuan-Bach Mai, Hoang-Minh Nguyen-Huu, Quoc-Nghia Nguyen, Hoang-Tung Vu, Minh-Triet Tran, Trung-Nghia Le

2026-06-29视觉感知

针对生成式图像质量提升带来的真假图像鉴别需求,论文将多个CNN与Vision Transformer检测器的输出进行融合,意在结合局部纹理特征与全局语义表征以提升AI生成图像识别。实验主要在CIFAKE数据集上进行,报告最高准确率97.32%;但跨生成器泛化、融合相对单模型的稳定增益及误差来源文中未充分说明。

Denoising ICF Images with Multiplicative Uniform Noise: A Self-Supervised Study Based on the Log-Domain Noisier2Inverse Framework Figure 1
2026-06-29cs.CV

Denoising ICF Images with Multiplicative Uniform Noise: A Self-Supervised Study Based on the Log-Domain Noisier2Inverse Framework

Gyeongha Hwang, Bradley Thomas Wolfe, Naima Naheed

2026-06-29视觉感知

针对惯性约束聚变图像中近零背景、强空间相关且逐图变化的乘性均匀噪声,论文将 Noisier2Inverse 放到对数域,把乘性噪声转为加性噪声,并强调合成噪声需按每张图的参数采样。最佳 Variant B 在无需干净训练图像下达到 21.41 dB PSNR、0.8358 SSIM,较噪声输入提升 19.46 dB,并明显优于 BM3D 与 Noise2Self。

Enhancing Co-packaging Optics Enabled Silicon Photonics Security Assurance Hardware Fingerprinting Figure 1
2026-06-29cs.CV

Enhancing Co-packaging Optics Enabled Silicon Photonics Security Assurance Hardware Fingerprinting

Liton Kumar Biswas, M Shafkat M Khan, Himanandhan Reddy Kottur, Hao Wang, Hamed Dalir, Navid Asadizanjani

Department of Electrical and Computer Engineering, University of Florida, resolution, scalable fingerprint for silicon photonic chips, enabling cost-effective device authentication and, silicon slab) act as optical resonators, creating sharp spectral

2026-06-29视觉感知

面向硅光子芯片在关键供应链中易遭篡改、伪造而传统电子认证不足的问题,论文将原本用于密度控制的填充区改造成二维光子晶体硬件指纹,通过波长、偏振和入射角响应编码身份且不增加工艺步骤。FDTD与样片表征显示,不同柱径/间距可产生可分离窄带共振峰,峰间距多超过40 nm、FWHM低于15 nm,实测与仿真偏差约5–10 nm,支持低成本光学认证。

Qwen-Image-2.0-RL Technical Report Figure 1
2026-06-29cs.CV

Qwen-Image-2.0-RL Technical Report

Yixian Xu, Kaiyuan Gao, Yuxiang Chen, Yilei Chen, Zecheng Tang, Zihao Liu, Zikai Zhou, Deqing Li, Hao Meng, Kuan Cao, Jiahao Li, Jie Zhang, Liang Peng, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yi Wang, Yu Wu, Yujia Wu, Zekai Zhang, Zhendong Wang, Xiao Xu, Kun Yan, Chenfei Wu

tion. Building on this reward system, we develop a scalable GRPO-based RL training, Podell et al., 2024) with scalable Transformer-based, Labs, 2025, Labs et al., . Scalable RL training framework (Sec. 4). We adopt a GRPO-based RL framework with multi-

2026-06-29视觉感知强化学习

本文针对扩散图像模型预训练目标难以直接对齐人类审美、提示遵循和编辑保真度的问题,提出将任务化 VLM 复合奖励、GRPO 强化学习与 on-policy distillation 结合:先分别优化文生图和编辑教师,再用轨迹级速度匹配合并为单一模型。实验显示其在 Qwen-Image-Bench 达到 57.84(较基座 +2.61),文生图和编辑 Arena Elo 分别提升 78 与 93,说明收益主要来自分解式奖励优化和蒸馏避免跨任务冲突。

On the stability of scale-space metrics Figure 1
2026-06-29math.NA

On the stability of scale-space metrics

William Leeb

School of Mathematics, University of Minnesota, Twin Cities

2026-06-29视觉感知

本文面向图像与断层投影比较中对形变、旋转和噪声敏感的问题,研究基于高斯尺度空间的函数距离。核心在于把多尺度平滑后的差异加权成度量,并证明其与 Besov/Wasserstein 相关形式的稳定性,同时构造 SO(2) 旋转不变版本。主要结果包括对几何扰动和投影角变化的误差界、离散采样下对次高斯噪声的鲁棒性,以及 r=2 时 O(n²log n) 的快速计算算法,并用数值实验验证这些性质。

Spectral Subsurface Scattering from RGB via Biophysical Skin Inversion Figure 1
2026-06-29cs.GR

Spectral Subsurface Scattering from RGB via Biophysical Skin Inversion

Carlos Aliaga, Adrian Jarabo

Meta Reality Labs Research

2026-06-29视觉感知

本文针对皮肤次表面散射渲染中仍依赖艺术家手调散射距离和各向异性、且单一均质介质难以匹配真实多层皮肤的问题,提出从单张 RGB 漫反射贴图反演全光谱光学参数。核心是用三组独立介质的加权混合近似多层散射,并训练神经解码器预测各波长的散射半径、反照率和各向异性,可直接接入随机游走路径追踪。结果显示该方法能自动区分 UV 近不透明、NIR 高透光等谱段差异,减少手工调参,但唇部等非典型皮肤区域和角度依赖验证仍有限。

Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding Figure 1
2026-06-29cs.CV

Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding

Liu Yu, Can Chen, Ping Kuang, Zhikun Feng, Fan Zhou, Gillian Dobbie

2026-06-29视觉语言

本文针对LVLM在物体生成中因语言先验绕过视觉证据而产生幻觉的问题,指出关键不在全局视觉注意力强弱,而在决策步骤中少数注意力头形成“病理捷径”。作者提出无需训练的Fox框架,用视觉注意力熵定位风险中介头,并以因果干预和冲突门控解码切断捷径、兼顾流畅性;实验称在CHAIR等指标上优于现有方法,较SID有明显提升。

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance Figure 1
2026-06-29cs.CV

CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance

Hana Kim, Minje Kim, Tae-Kyun Kim

2026-06-29三维

针对现有3D场景修复依赖精确多视角掩码、且多局限于物体移除的问题,CoIn采用先2D生成再以3D高斯泼溅反向约束的双向流程:Ref-GS提供参考自适应几何,CLG把3D一致性注入扩散去噪,TE-D提升纹理真实感。实验显示其在移除与插入任务上达到SOTA,并支持任意形状掩码。

Beyond Points: Spherical Distributional Part Prototypes for Interpretable Classification Figure 1
2026-06-29cs.CV

Beyond Points: Spherical Distributional Part Prototypes for Interpretable Classification

Duarte Leão, Diogo Pereira Araújo, Catarina Barata, Carlos Santiago

2026-06-29视觉感知

本文针对现代视觉骨干的归一化角度特征中,同一语义部件变化大而点原型易冗余、漂移的问题,提出 vMFProto:用超球面 von Mises-Fisher 混合分布表示类别部件,并为每个原型学习集中度,再结合熵正则 OT 做结构化 patch 分配与两阶段训练。实验显示其在 CUB、Dogs、Cars 上提升解释一致性、稳定性和区分性,同时保持有竞争力的分类准确率。

Distribution-based deep multiple instance learning for tumor proportion scoring in NSCLC Figure 1
2026-06-29cs.CV

Distribution-based deep multiple instance learning for tumor proportion scoring in NSCLC

Krzysztof Pysz, Artur Bartczak, Jarosław Kwiecień, Piotr Krajewski, Witold Dyrka

2026-06-29视觉感知

这篇论文针对NSCLC中PD-L1肿瘤比例评分依赖专家、逐片标注成本高且零表达样本难判的问题,提出先用MobileNetV3提取病理patch特征,再用带门控注意力的MIL预测零膨胀Beta分布参数,将TPS估计与不确定性/零类概率合在一起。实验显示深度MIL明显优于线性和岭回归,ZIBeta在RMSE、零类F1和宏F1上接近或达到最佳,但数据仅162例,增益稳定性仍需更大队列验证。

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data Figure 1
2026-06-29cs.CV

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

Bartosz Stachowiak, Dariusz Brzezinski

Institute of Computing Science, Poznan University of Technology, publicly available to foster future research on cross-modal restoration.

2026-06-29视觉感知

针对强光、眩光、过曝和闪烁会让RGB视频局部信息彻底丢失、且现有方法多按单一伪影分别处理的问题,DeLux提出跨模态局部伪影修复:先用事件相机高动态范围信号重建结构先验,再显式定位退化区域并只在受损像素上融合修复。实验显示其在合成与车载真实场景中优于RGB-only和事件引导HDR基线,平均MS-SSIM超过0.99,真实伪影强度最高降低88%。

Perceptual 3D Simulation With Physical World Modeling Figure 1
2026-06-29cs.CV

Perceptual 3D Simulation With Physical World Modeling

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

Stanford University

2026-06-29强化学习三维

论文针对真实场景缺少完整几何与动力学信息、局部操作后果不确定的问题,提出 P3Sim:把 RGB、深度、光流等局部变量建模为可任意条件化的概率世界模型,并用几何化模块提供部分 3D 变换线索、持久记忆维持时序一致性。实验覆盖新视角合成、物体操控、动态预测与几何补全,显示其能在不完整感知下生成较一致的 3D 场景演化,但具体量化增益与来源文中片段未充分说明。

Radar Guided Camera Verification for Automatic Emergency Braking Rethinking Object Detection in Radar Camera Fusion Figure 1
2026-06-29cs.CV

Radar Guided Camera Verification for Automatic Emergency Braking Rethinking Object Detection in Radar Camera Fusion

Ram Charan Akula, Sivanathan Kandhasamy, Manikandan Ganesan

2026-06-29视觉感知

这篇论文针对AEB中雷达已完成目标定位后,相机是否仍需运行深度目标检测的问题,提出将相机角色改为雷达ROI内的障碍物验证,并用无需训练和GPU的边缘密度门控实现。实车72次行驶、13.16万帧评估显示,其最多减少98.7%搜索空间,单ROI延迟0.121 ms,AUC 0.898、召回0.994,33个威胁场景无漏刹;但泛化到更多车辆、光照和标定误差下仍需验证。

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics Figure 1
2026-06-29cs.CV

Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics

Tim Alexander Bader, Tim Dieter Eberhardt, Maximilian Dillitzer, Wilhelm Stork

2026-06-29学习理论数据集/基准

本文关注自动驾驶多摄像头感知在真实车队中因相机位置、朝向、视场和数量变化带来的跨rig泛化问题。作者构建Plentiful CARLA Camera Rigs,在相同场景下渲染14种系统化相机配置,并提出Rig Variance与Rig Contrastive Distance来量化rig内部多样性和跨rig几何差异。实验表明,仅几何观测变化就会造成显著性能波动,且RigCD与多数模型的迁移难度高度相关,可作为排序跨rig退化风险的代理指标。

Beyond MoCap: Scaling Motion Tokenizers with Synthetic Human Motion for Generative Modeling Figure 1
2026-06-29cs.CV

Beyond MoCap: Scaling Motion Tokenizers with Synthetic Human Motion for Generative Modeling

Yiwen Yan, Wanning He, Yu-Wing Tai

Dartmouth College

2026-06-29生成模型

论文针对 MoCap 数据动作类型窄、长尾覆盖不足导致运动 tokenizer 词表受限的问题,提出用大规模合成且物理约束的人体动作扩展训练分布,并同步放大/改造 VQ-VAE 离散码本。核心洞察是生成质量瓶颈更多在表示空间而非下游架构;在不改 MotionGPT 等框架的情况下,重分词后在文本到动作和动作续写中提升多样性、组合性与长尾泛化,但具体增益可能主要来自 synthetic data scaling。

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments Figure 1
2026-06-29cs.CV

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

2026-06-29强化学习数据集/基准

MemoBench关注视频世界模型在部分可观测动态场景中的“物体离开又返回”记忆问题,这对机器人操作、自动驾驶和具身智能都很关键。它构建360段合成与真实视频,要求模型在目标遮挡期间继续推断物理状态,并用自动指标与VQA评估重现质量。实验显示10个先进模型均难以可靠保持对象记忆,ORS均未超过0.4,且无相机条件模型可能靠近静态生成虚高一致性。

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge Figure 1
2026-06-29cs.CV

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

2026-06-29视觉感知

这篇论文针对细粒度视觉分类中纯视觉蒸馏易依赖数据集教师、且可能放大背景偏差的问题,提出 LaViD:让语言模型生成区分类别语义差异的选择题,并把各类别在这些问题上的软分布作为概念签名,监督视觉学生模型。实验显示,即使语言教师不看图,LaViD 在六个细粒度基准上普遍优于多模态教师蒸馏和多种传统 KD 方法,并在 Waterbirds 上提升最差组准确率,说明其概念监督有助于抗伪相关。

Tessellating The Earth Figure 1
2026-06-29cs.CV

Tessellating The Earth

Daniel Cher, Hamza Iqbal, Eric Xing, Brian Wei, Nathan Jacobs

2026-06-29视觉感知

这篇论文针对现有地理位置编码器使用固定球面谐波或傅里叶基、把容量均匀浪费在海洋等低信息区域的问题,提出可学习的球面 Voronoi 分区,让站点和嵌入随卫星图像对比预训练迁移到更具判别力的区域,并用全局语义 token 在远距离相似环境间共享语义。实验称其在多项地理分类、回归任务及 iNaturalist-2018 物种分类地理先验中达到最优结果。

Structured-Li-GS: Structured 3D Gaussians Splatting with LiDAR Incorporation and Spatial Constraints Figure 1
2026-06-29cs.CV

Structured-Li-GS: Structured 3D Gaussians Splatting with LiDAR Incorporation and Spatial Constraints

Huaiyuan Weng, Huibin Li, Chul Min Yeum

Department of Civil and Environmental Engineering, University of Waterloo, 200 University Ave W, Waterloo, N2L 3G1

2026-06-29优化算法三维

本文针对传统 3DGS 依赖稀疏 SfM 与高斯增密导致几何约束弱、模型膨胀的问题,引入 LiDAR-惯性-视觉 SLAM 生成的稠密彩色点云,将高斯锚定在下采样点并用局部法线初始化椭球,再结合 RGB、深度、法线等多重损失训练。实验显示其在基准和自建手持扫描数据上以更少高斯取得更高重建质量,但增益可能部分来自更强传感器与数据预处理。

TruEye: Fine-Grained Detection of AI-Generated Human Subjects in Images Figure 1
2026-06-29cs.CV

TruEye: Fine-Grained Detection of AI-Generated Human Subjects in Images

Jay Barot, Dan Lin

2026-06-29视觉感知

面向社交欺诈等场景中难以解释、难泛化且成本高的 AI 人像伪造检测,TruEye 将图像按人物与场景拆成双流 token,并用掩码条件、特征放大和区域门控交叉注意力建模二者一致性,从而区分五类合成组合并输出局部证据。实验称其在 FineSyn 等多数据集上优于 SIDA、LEGION 等基线,对未见生成器泛化更强,且较 LLM 解释式方法推理快百倍以上。

ReWorld: Learning Better Representations for World Action Models Figure 1
2026-06-29cs.CV

ReWorld: Learning Better Representations for World Action Models

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

Huazhong University of Science and Technology, 2 Xiaomi EV

2026-06-29强化学习

本文针对自动驾驶世界动作模型只在输出端监督、难以让中间表征真正服务规划的问题,提出 ReWorld:直接优化 Video DiT 与 Action DiT 的中间表示,通过未来预测监督、跨模态世界对齐和安全临界硬负样本约束,使生成知识更有效迁移到规划。实验显示其在 nuScenes 上将 FVD 从 81.3 降至 61.9,在 NAVSIM 上将 PDMS 从 89.1 提升到 90.4,并约加速 2 倍收敛。

Aloe-Vision: Robust Vision-Language Models for Healthcare Figure 1
2026-06-29cs.CV

Aloe-Vision: Robust Vision-Language Models for Healthcare

Jaume Guasch-Martí, Enrique Lopez-Cuena, Martín Suárez-Fernández, Jordi Bayarri-Planas, Anna Arias-Duart, Dario Garcia-Gasulla

2026-06-29视觉语言视觉感知安全鲁棒

医疗视觉语言模型受限于高质量多模态数据稀缺、评测污染和安全鲁棒性不足。Aloe-Vision 通过公开的 Aloe-Vision-Data 训练混合、7B/72B 模型权重与流程,以及低污染的 CareQA-Vision 基准,强调可复现评测。实验显示其在医疗与通用任务上较基线有明显提升并接近同类前沿模型,但对误导和对抗输入仍脆弱,临床可靠性仍未解决。

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection Figure 1
2026-06-29cs.CV

DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection

Yujin Tang, Chenming Shang, Ruize Xu, Nikhil Singh

Dartmouth College

2026-06-29视觉语言

本文针对多模态代理长期任务中“看过但未被文字记录”的视觉细节难以评测的问题,构建 DMV-Bench:在电商多会话环境中向商品图像注入唯一偶发视觉线索,并隔离文本泄漏,用召回跨度测量视觉记忆保持。作者还提出并行存储视觉与语言编码的 DualMem。实验显示其在 Gemini 2.5 Flash 和 Qwen2.5-VL-7B、不同链长下均优于字幕记忆和现有多模态记忆系统,且消融表明主要收益来自视觉通道承载线索、文本通道辅助查询落地。

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds Figure 1
2026-06-29cs.CV

SelectAnyTree: A Promptable Instance Segmentation Model for 3D Forest LiDAR Point Clouds

Trung Thanh Nguyen, Daniel Lusk, Kilian Gerberding, Janusch Vajna-Jehle, Tuan-Anh Vu, Duc Viet Le, Tu Vo, Phi Le Nguyen, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Julian Frey, Teja Kattenborn

Nagoya University, Japan, University of Freiburg, Germany, University of California, Los Angeles, USA, University of Twente, the Netherlands, KC Machine Learning Lab, Korea, Hanoi University of Science and Technology, Vietnam, Ritsumeikan University, Japan

2026-06-29视觉感知三维

这篇论文针对森林 LiDAR 单木实例标注成本高、现有方法只能整场自动分割且难以交互纠错的问题,提出 SelectAnyTree:将用户点击的位置、正负属性和局部特征编码成查询,并用冠层高度模型树梢作为免费首个提示,再由线性复杂度状态空间解码器生成目标树掩码。实验覆盖多区域与跨数据集,单次点击达到 78.2 IoU,较最强可提示基线高 24.8 点,并以更少点击、更小模型和更快推理达到各精度目标。

Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos Figure 1
2026-06-29cs.CV

Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos

Mohammadmahdi Honarmand, Parnian Azizian, Aaron Kline, Kae Nurge, Zerin Nasrin Tumpa, Saimourya Surabhi, Kaitlyn Dunlap, Yang Qian, Ali Kargarandehkordi, Sameer Neupane, Peter Washington, Dennis P. Wall

Department of Mechanical Engineering, Stanford University, Stanford, CA 94305, USA, Department of Pediatrics, Stanford University, Stanford, CA 94305, USA, Department of Biomedical Data Science, Stanford University, Stanford, CA 94305, USA, Department of Information and Computer Sciences, University of Hawaii at Manoa, Honolulu, HI 96822, USA, Division of Clinical Informatics and Digital Transformation, Department of Medicine, University of California San Francisco, San Francisco, CA 94158, USA

2026-06-29视觉语言视觉感知

面向自闭症早筛中专业量表评估耗时、难规模化的问题,本文将多模态 Gemini 2.5 Pro 用 400 段临床评分家庭短视频做 LoRA 微调,只监督 30 个行为特征而非诊断标签。结果显示,与临床评分的一致性提升 40%,27/28 个可评估特征改善;未训练的 ASD 直接诊断 F1 也提升 53%,下游分类管线达到 77% 准确率和 86% AUC,说明特征级对齐可让视频语言模型更接近临床可用的行为评分器。

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models Figure 1
2026-06-29cs.CV

SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models

Jingfeng Mao, Xuyang Chen, Qilin Zhang, Oussema Dhaouadi, Guangming Wang, Brian Sheil, Daniel Cremers, Yan Xia, Olaf Wysocki

2026-06-29三维

SemCityLoc针对无人机在GNSS受限城市环境中依赖高精度GNSS或稠密纹理三维重建、难以规模化部署的问题,提出用基础模型生成的语义分割与单目深度去对齐标准化LoD语义城市模型,将6DoF定位转化为语义-几何表面对齐。论文还构建SemCityLockeD低空真实基准;实验显示在城市峡谷中召回率最高提升36%,平均位置误差由9.89米降至2.62米。

Not All Relations Rotate Alike: Transformation-Aware Decoupling for Viewpoint-Robust 3D Scene Graph Generation Figure 1
2026-06-29cs.CV

Not All Relations Rotate Alike: Transformation-Aware Decoupling for Viewpoint-Robust 3D Scene Graph Generation

Jingjun Sun, Chaowei Wang, Zhirui Liu, Jiaxu Tian, Ming Yang, Yaoxing Wang, Shan Gao

Northwestern Polytechnical University, Xi’an, Shaanxi, China, ShanghaiTech University, Shanghai, China

2026-06-29三维安全鲁棒

这篇论文针对具身场景中同一3D环境因水平视角旋转导致关系预测不稳定的问题,指出不同谓词的变换行为并不一致:左右前后应随视角变化,而支撑、接触等关系应保持不变。其核心是TAD,将关系推理解耦为视角稳定与方向敏感两类分支,并配合稳定物体编码和辅助监督。实验称在3DSSG上无需旋转增强即可提升偏航视角鲁棒性,同时保持标准基准性能。

RANSAC Scoring Done Right Figure 1
2026-06-29cs.LG

RANSAC Scoring Done Right

James Pritts, Felix Seegräber, Kevin Köser

Kiel University, Germany, (maximizing over latent inlier labels) and MLESAC is the marginal likelihood (summing over labels), reverse the usual elimination order. The scores above first remove the latent inlier/outlier labels, non-informative priors. A single score therefore adapts to data availability without any change to, the algorithm: an empirical-Bayes prior fit from a small validation set when labelled data exists, and, computation via a sort-and-sweep algorithm. Crucially, a is not a relabelled inlier scale: it param-, mixture [22, 20]: a latent label zi ∈{0, 1} marks observation i as inlier (zi=1) or outlier (zi=0) with, and labels z = (z1, . . . , zN) factorizes as, Maximizing (2) over labels classifies z∗, collecting positive labels

2026-06-29视觉感知

本文针对 RANSAC 及 MSAC、MLESAC、MAGSAC++ 等评分仍依赖内点噪声尺度或其阈值代理的问题,提出先在固定内外点划分下用逆伽马先验解析边缘化 σ,再优化划分的无尺度评分,并可用排序扫描以 O(N log N) 计算。实验覆盖近 7 万个图像对和多种两视几何任务,显示该方法在阈值失准时更稳定,少量甚至无需验证对即可接近最优,而基线通常需要更多调参数据。

2026-06-26

125 篇
DanceOPD: On-Policy Generative Field Distillation Figure 1
2026-06-26cs.CV

DanceOPD: On-Policy Generative Field Distillation

Wei Zhou, Xiongwei Zhu, Zelin Xu, Bo Dong, Lixue Gong, Yongyuan Liang, Meng Chu, Leigang Qu, Lingdong Kong, Wei Liu, Tat-Seng Chua

2026-06-26生成模型强化学习

本文针对单一图像生成模型难以同时保持文生图、局部/全局编辑等能力的问题,提出将各能力源视为共享流匹配状态空间中的速度场,并用硬路由、学生自身 rollout 的低噪声状态和简单速度 MSE 做 on-policy 蒸馏。实验显示 DanceOPD 在编辑与 T2I、局部与全局编辑组合,以及真实感场和 CFG 吸收中提升目标能力,同时基本保留锚定生成质量。

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards Figure 1
2026-06-26cs.CV

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

Mohamed bin Zayed University of Artificial Intelligence, Aalto University, Australian National University, Linköping University, preference labels, or external reward models. In this work, we ask: Can a unified LMM autonomously improve, both capabilities using only unlabeled images? To answer this, we propose a self-evolving training framework, built around three collaborating internal roles: a Proposer that generates visual questions, a Solver that answers, signals, requiring no human annotations, preference labels, or task-trained external reward/judge model. To, Most post-training pipelines rely on curated annotations, such as VQA labels for understanding, preference labels, work reports the same fully self-supervised U+G recipe, using only unlabeled images, with consistent gains across, Removing labels entirely introduces two concrete technical challenges. First, reward degeneracy: sample-level self-, trained on a frozen backbone using only unlabeled images. The understanding loop uses prompt-perturbed self-

2026-06-26视觉语言强化学习

这篇论文针对统一多模态模型后训练依赖人工标注、偏好或外部奖励的问题,提出仅用无标注图像的自进化框架:Proposer 出题、Solver 作答并评估、Generator 生成图像,并用 Solver Token Entropy 缓解自一致奖励退化,用 QA 保真与循环 caption 将理解能力反馈到生成评估。在 BLIP3o、BAGEL、VARGPT 三类架构上均带来理解指标提升,GenEval 统一提升约 3 个百分点,BAGEL 上 MMMU 提升 3.5%。

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays Figure 1
2026-06-26cs.RO

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

Department of Computer Science, University of North Carolina at Charlotte, United States

2026-06-26生成模型强化学习模仿学习

这篇论文针对机器人连续模仿学习中顺序微调易遗忘、真实历史示范又难以保存或获取的问题,提出 ReGen:利用世界动作模型同时生成动作与未来视觉的能力,递归合成旧任务伪轨迹并与新任务数据一起训练。实验覆盖仿真和真实操作,显示相较朴素顺序微调可将灾难性遗忘降低约 50%,性能接近依赖真实回放数据的方法;但作者也指出长时程视觉退化和动作—观测不一致仍是主要瓶颈。

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models Figure 1
2026-06-26cs.CV

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

Mohamed bin Zayed University of Artificial Intelligence, Aalto University, Australian National University, Linköping University

2026-06-26视觉语言

这篇论文针对自进化多模态模型只优化答案一致性、却可能忽视图像证据的“视觉欠条件化”问题,提出单模型无监督框架 VISE,用几何变换一致性和区域扰动后的语义不变性奖励,直接约束解码器关注视觉 token。实验覆盖18个基准,在 Qwen3-VL-2B 上 COCO 与 TextCaps 分别提升 16.85、19.66 CIDEr,并降低对象幻觉,表明收益主要来自更强的视觉条件化而非多角色自博弈。

DnA: Denoising Attention for Visual Tasks Figure 1
2026-06-26cs.CV

DnA: Denoising Attention for Visual Tasks

Ron Campos, Subhajit Maity, Xin Li, Srijan Das, Aritra Dutta

2026-06-26视觉感知

本文针对视觉 Transformer 中 softmax 注意力易把相关但无关的次要物体一并强化、导致注意力噪声和判别性下降的问题,提出 DnA:用正/负查询分别建模目标特征与近邻干扰特征,并投影到分离子空间以扩大类间主角度。实验显示其在 ViT-B 上较 ImageNet-1K 基线提升 0.8%,在视频 Transformer 与视频 LLM 任务上也有约 1.8% 和 0.5% 增益。

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance Figure 1
2026-06-26cs.CV

Don't Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance

Pradhaan S Bhat, Rishubh Parihar, Abhijnya Bhat, R. Venkatesh Babu

2026-06-26生成模型

本文针对预训练 flow 生成模型在同一条件下多次采样易收敛到少数模式的问题,指出输出多样性坍缩与 MMDiT 内部特征坍缩直接相关,并提出无需训练和外部奖励模型的 Feature Self-Guidance:在批量生成时拉开中间特征,同时用流形正则将其拉回有效条件流形。实验显示,该方法在文生图、深度条件和参考图生成中提升结构与风格多样性,基本保持提示一致性,推理开销显著低于基于样本筛选的 Group Inference。

PhysiFormer: Learning to Simulate Mechanics in World Space Figure 1
2026-06-26cs.CV

PhysiFormer: Learning to Simulate Mechanics in World Space

Yiming Chen, Yushi Lan, Andrea Vedaldi

Visual Geometry Group, University of Oxford, code, and models are available at https://yimingc9.github.io/physiformer.

2026-06-26强化学习

论文针对视频世界模型受视角、光照和遮挡影响、难以直接表达物理状态的问题,提出在世界坐标下用3D网格顶点轨迹学习力学演化。PhysiFormer将未来整段运动建模为坐标空间扩散过程,并用时间、空间、对象分解注意力处理多物体刚体/弹性动态。实验显示其在轨迹精度、刚性保持和动量一致性上优于自回归基线,并能泛化到混合材料、未见几何和更多物体,但长时域与接触伪影仍未充分解决。

Error-Conditioned Neural Solvers Figure 1
2026-06-26cs.LG

Error-Conditioned Neural Solvers

Haina Jiang, Liam Wang, Peng-Chen Chen, Min Seop Kwak, Seungryong Kim, Brian Bell, Jeong Joon Park

University of Michigan, Los Alamos National Laboratory

2026-06-26优化算法

论文针对神经 PDE 求解器难以自我纠错、混合方法虽降残差却在病态系统中不一定提升解精度的问题,指出“残差最小化—重构误差”存在缺口;提出 ENS 将当前 PDE 残差场作为网络输入,迭代学习修正而非做显式优化。在四类 PDE、超分辨率、参数外推和跨方程迁移中,ENS 多数设置精度最佳,Kolmogorov 湍流最高约 10 倍增益,同时推理成本低于 PINO、DiffusionPDE、PCFM。

RayPE: Ray-Space Positional Encoding for 3D-Aware Video Generation Figure 1
2026-06-26cs.CV

RayPE: Ray-Space Positional Encoding for 3D-Aware Video Generation

Minghao Yin, Jiahao Lu, Wenbo Hu, Wang Zhao, Shan Ying, Kai Han

The University of Hong Kong, The Hong Kong University of Science and Technology, ARC Lab, Tencent

2026-06-26视觉感知三维

该文针对视频 DiT 的 RoPE 只编码二维采样网格、难以表达跨视角三维对应的问题,提出将每个 token 的 6D Plücker 相机射线以加性方式注入自注意力的 Q/K,使注意力分数同时包含内容、几何及交叉项,并用方向/尺度解耦、门控与 RMSNorm 处理不同数据集的位姿尺度差异。在 Wan2.2-TI2V-5B 上仅增加不足 0.1% 参数,报告提升相机轨迹可控性、跨帧三维一致性和视频质量。

SAM2Matting: Generalized Image and Video Matting Figure 1
2026-06-26cs.CV

SAM2Matting: Generalized Image and Video Matting

Ruiqi Shen, Guangquan Jie, Chang Liu, Henghui Ding

2026-06-26视觉感知

该文针对视频抠图同时需要稳健时序跟踪与细粒度透明度估计、而视频 alpha 标注昂贵且领域狭窄的问题,提出将任务解耦为 VOS 跟踪器与图像级抠图头:保留 SAM2/SAM3 的跟踪能力,用 ROI Detector 找出半透明和细节区域,再由 Progressive Alpha Predictor 粗到细预测 alpha。模型仅用图像抠图数据训练,却在视频抠图零样本评测中达到 SOTA,并支持多种提示;SAM2.1-Tiny 版本据称可在 1080p 视频上约 40 FPS、显存低于 5GB。

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings Figure 1
2026-06-26cs.CV

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar

Bilkent University, Brown University, Bilkent University

2026-06-26视觉感知

针对单图物体搬移中身份保持、遮挡补全、阴影反射随位置更新等几何一致性难题,RoPEMover 的关键洞察是把扩散 Transformer 的 RoPE 视为可操控空间场,并引入深度感知扩展来控制前后遮挡关系。方法仅用合成数据加少量真实图微调,在标准物体移动基准上据称各项指标达到 SOTA,同时支持更可信的新区域生成和光照阴影传播。

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning Figure 1
2026-06-26cs.CL

Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning

Tianyi Men, Zhuoran Jin, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China, School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

2026-06-26规划控制

针对小型开源多模态 GUI Agent 在跨网站任务规划中能力弱、泛化差的问题,论文提出 PEEU:先让模型在网站中自主设定目标并探索,再用 hindsight 将已收集轨迹反向对齐为约束更严格的高层任务数据。其 TDHAF 分析指出,原子操作训练不足以带来高层规划能力,高层经验更利于 OOD 泛化;在真实网站评测中,7B 模型达到 30.6% 准确率,超过更大的 Qwen2.5-VL-32B。

Hallucination in World Models is Predictable and Preventable Figure 1
2026-06-26cs.LG

Hallucination in World Models is Predictable and Preventable

Nicklas Hansen, Xiaolong Wang

2026-06-26强化学习

这篇论文关注视觉世界模型在控制 rollout 中“看似合理但偏离真实动力学”的幻觉问题,指出其根因主要是状态-动作覆盖不足,而非单纯模型架构缺陷。作者构建 MMBench2,并将幻觉拆为感知、动作边缘化和场景发散三类,提出无需额外标注的预测信号用于检测与采样。实验显示覆盖感知训练可同步降低多类失败,用预测器作好奇心奖励时,仅约 50 条真实轨迹即可将预训练模型适配到未见环境;但结论仍局限于 350M 规模模拟任务,迁移到真实机器人尚未充分说明。

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model Figure 1
2026-06-26cs.CV

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li, Zecui Zeng, Renjing Xu

The Hong Kong University of Science and Technology (Guangzhou), Shenzhen University, Beijing University of Technology, JD Explore Academy

2026-06-26强化学习

本文针对高自由度灵巧操作中动作维度尺度差异大、传统全局压缩会淹没细微手指信号的问题,提出 DexAC-WM:将动作按维度 token 化并做幅值对齐,再用局部交叉注意力与全局调制联合注入,同时引入 DINOv3 与 VLM 语义分支。EgoDex、EgoVerse 实验显示其在 FID、FVD、PCK 上优于 Wan、IRASim、Cosmos 等基线,说明结构化动作建模能提升视觉时序真实感和动作跟随一致性。

OctoSense: Self-Supervised Learning for Multimodal Robot Perception Figure 1
2026-06-26cs.CV

OctoSense: Self-Supervised Learning for Multimodal Robot Perception

Anthony Bisulco, Jeremy Wang, Kostas Daniilidis, Randall Balestriero, Pratik Chaudhari

General, Robotics, Automation, Sensing and Perception (GRASP) Laboratory, University of Pennsylvania, Computer Science Department, Brown University, SSL has been instrumental in building highly general representations trained on unlabeled data. These

2026-06-26机器人视觉语言

针对真实机器人中单一视觉传感器在弱光、运动、遮挡或丢包下易失效的问题,OctoSense同时贡献开源多传感器硬件与59小时同步驾驶数据,并用模态专属 tokenizer 加共享 MAE 做后融合自监督表征、推理缓存新测量。结果显示其在深度、光流、语义分割和自运动估计上优于图像 SSL 基线,夜间和传感器退化场景增益更明显,但规模仍不足以称为通用基础模型。

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution Figure 1
2026-06-26cs.CV

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

Tsinghua University, Nanyang Technological University, Chinese Academy of Sciences

2026-06-26视觉感知

ViQ针对多模态模型中视觉连续特征与文本离散 token 不匹配、而现有视觉量化又难兼顾语义和细节的问题,提出先进行文本对齐预训练、再用近端表示学习和位置感知的分头量化逐步离散化,并支持原生任意分辨率输入。实验显示其在9个理解基准上接近或略超主流连续视觉编码器,同时保持较好重建质量,并使多模态训练加速约20%–70%。

See & Sniff: Learning Visuo-Olfactory Representations Figure 1
2026-06-26cs.CV

See & Sniff: Learning Visuo-Olfactory Representations

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

2026-06-26视觉感知

这篇论文针对嗅觉在多模态学习中因缺少视觉-气味配对数据而长期缺位的问题,提出利用同一语义类别内气味相对不随视觉变化而改变的洞察,将已有嗅觉数据与网络图像合成配对为 SmellNet-V,并用 See & Sniff 通过局部密集对齐学习视觉-嗅觉表征。结果显示其在仅凭气味分类上较 smell-only 基线提升约 7%,并可用于跨模态检索和气味源定位。

Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN Figure 1
2026-06-26cs.CV

Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN

Archer Moore, Mingming Gong, Liam Hodgkinson

School of Mathematics and Statistics, The University of Melbourne, Parkville, VIC 3010, Australia

2026-06-26生成模型三维

针对3D感知人脸GAN虽能生成逼真2D图像、但NeRF几何常有鼻部和侧脸伪影的问题,本文用少量人类偏好训练直接读取密度场的几何奖励模型,并在无文本、无网格先验、无多视图渲染下微调EG3D。密度一致性约束尽量保持外观,代价是FID从4.09升至6.66;用户比较中微调几何获74.4%偏好,但训练偏好主要来自单一标注者,泛化仍需验证。

Exact and Deterministic Patch Descriptor Retrieval via Hierarchical Normalization Figure 1
2026-06-26cs.CV

Exact and Deterministic Patch Descriptor Retrieval via Hierarchical Normalization

Koichi Sato

2026-06-26视觉感知

论文针对大规模局部特征匹配中 ANN 方法近似且不稳定的问题,提出层级归一化:把描述子能量集中到 K 维主前缀,并用次要部分的 α 上界做分支定界,从而只精算少量候选却保持与全量 128 维搜索完全一致。HN-HardNet 在 UBC patch 上实现确定性精确检索,K=8 时约 12.7–13.7 倍加速,推荐 K=16、α=1/8 时仍有 7.2 倍加速且 FPR@95 仅小幅上升。

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting Figure 1
2026-06-26cs.AI

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

The University of Hong Kong, Wuhan University

2026-06-26强化学习

本文将地球观测预测重新表述为稀疏观测下由天气驱动的概率世界模型问题,动机在于现有方法偏重像素重建,难以刻画不确定性和天气扰动下的真实响应。EO-WM 用视频扩散 Transformer 区分气候基线、天气异常与累积热旱胁迫,并设计极端夏季和季节配对基准检验响应一致性。实验显示其在 NDVI 下降幅度误差上相对降低 5.63%,方向命中率提升 7.80%,同时保持接近的常规重建指标。

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs Figure 1
2026-06-26cs.CV

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert

2026-06-26数据集/基准三维

该文针对3D胸部CT多模态大模型只给最终答案、推理难验证且缺少病史上下文的问题,提出CORTEX基准:把每个样本组织为任务理解、视觉观察、诊断推理、答案合成四阶段,并用临床参与设计的分阶段rubric和放射科专家审核筛选。基于CT-RATE,最终得到76,177条验证推理轨迹,覆盖开放/封闭VQA与报告生成;但文中主要贡献是数据与评测协议,模型训练增益尚未充分说明。

From Celebrities to Anyone: Characterizing AI Nudification Content, Technology, and Community Dynamics on 4chan Figure 1
2026-06-26cs.CY

From Celebrities to Anyone: Characterizing AI Nudification Content, Technology, and Community Dynamics on 4chan

Chi Cui, Yixin Wu, Yang Zhang

CISPA Helmholtz Center for Information Security

2026-06-26视觉感知

针对生成式 AI 非自愿色情合成从名人事件扩散到普通人的风险,本文对 4chan Adult Requests 进行 41 天大规模实测,创新在于直接观察匿名请求—满足生态而非只看平台或模型库。研究识别 24,105 个 SNEACI 项,发现非名人已占 55.8%,视频占比达 34.0%;生产主要依赖缺乏护栏的开源模型,Stable Diffusion 系列贡献 42.7% 图像、Wan 贡献 66.5% 视频,且少数高活跃生产者通过产出、教程和资源分享维持并放大该生态。

SatSplatDiff: Geometry-preserving generative refinement for high-fidelity satellite Gaussian Splatting Figure 1
2026-06-26cs.CV

SatSplatDiff: Geometry-preserving generative refinement for high-fidelity satellite Gaussian Splatting

Jiyong Kim, Shuang Song, Ronjgun Qin

aDepartment of Civil, Environmental and Geodetic Engineering, The Ohio State University, Columbus, 43210, OH, USA, bDepartment of Electrical and Computer Engineering, The Ohio State University, Columbus, 43210, OH, USA, geometric accuracy throughout the pipeline, it further demonstrates seamless cross-tile consistency and strong scalability for large-, scale reconstruction. Source code is available at https://github.com/GDAOSU/SatSplatDiff, strating scalability for larger area. Our major contributions can

2026-06-26生成模型三维

针对卫星视角近似俯视导致建筑立面监督不足、扩散式视图增强易产生幻觉并破坏几何一致性的问题,SatSplatDiff将摄影测量DSM初始化、单目深度监督、多尺度几何细化与基于阴影图约束的生成式细化结合,用稳定的光照/阴影几何线索控制扩散先验。在IARPA2016和DFC2019上,方法将几何MAEreg最高降低18%,FID-CLIP提升28–45%,并实现最高5倍分辨率增强且跨瓦片一致性较好。

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation Figure 1
2026-06-26cs.CV

LISA: Likelihood Score Alignment for Visual-condition Controllable Generation

Yanghao Wang, Hongxu Chen, Jiazhen Liu, Zhenqi He, Rui Liu, Zhen Wang, Long Chen

The Hong Kong University of Science and Technology

2026-06-26规划控制

本文针对视觉条件可控生成中双分支范式训练效率和侧分支作用不清的问题,从 score-based 视角指出主网络主要提供无条件分数、侧网络应学习条件带来的 likelihood score。LISA 用轻量解码器将侧网络中间特征对齐到近似 likelihood score,作为扩散/flow 训练的正则项;实验覆盖图像、视频、多种条件和架构,显示可加速收敛、提升感知质量与条件一致性,且几乎不增加训练成本、推理零开销。

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models Figure 1
2026-06-26cs.CV

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

2026-06-26视觉语言视觉感知数据集/基准

针对现有有害视频评测多停留在二分类且缺少可解释依据的问题,论文提出 HarmVideoBench,将理解拆成可观测证据、片内含义和片外背景推理三层,并构建 1,379 个视频与 4,137 道选择题。对 19 个模型的评测显示,模型在表层线索较强、在隐含语义和文化/历史背景推理上明显不足;其 BCR 方法通过判断推理边界并按需检索上下文,将宏平均从 61.7% 提升到 84.4%。

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks Figure 1
2026-06-26cs.CV

Safe Autoregressive Image Generation with Iterative Self-Improving Codebooks

Yunqi Xue, Zhijiang Li, Philip Torr, Jindong Gu

2026-06-26视觉感知安全鲁棒

本文关注自回归统一多模态模型的图像安全问题:这类模型依赖离散视觉码本,扩散模型的连续潜空间安全方法难以直接适用。核心做法是让模型自判不安全生成,构造有害空间并迭代修正码本,再在无害空间内自适应微调以保质量。实验覆盖八个有害提示集、五类生成模型和 OOD 数据,显示安全性可迭代提升且较好保留生成能力。

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision Figure 1
2026-06-26cs.CV

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

2026-06-26视觉感知数据集/基准

针对无人机野火监测中烟雾遮挡、尺度变化使纯 RGB VQA 难以可靠支撑安全决策的问题,FlameVQA 基于 FLAME 3 构建成对 RGB、热成像 JPEG 与辐射热 TIFF 的多选基准,每图 34 题覆盖检测、定位、覆盖估计、跨模态推理和飞行规划,并用热规则、一致性检查与人工审核生成标签。实验显示模型在显式跨模态线索下表现较好,但在浓烟下存在性判断和覆盖估计上仍明显失效。

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation Figure 1
2026-06-26cs.RO

Proposal-Conditioned Latent Diffusion for Closed-Loop Traffic Scenario Generation

Shubham Vaijanath Phoolari, Aleyna Kara, Christoph Lauer, Steven Peters

2026-06-26生成模型

面向自动驾驶验证中“既要逼真又要可控且能闭环重规划”的交通场景生成难题,论文提出以候选轨迹为条件的联合潜空间扩散策略:用实例中心场景编码与多模态边缘 proposal 初始化紧凑动作潜变量,并在测试时加入地图、碰撞和博弈目标引导。Waymo 实验显示,该方法较独立边缘组合更能保持交互一致性,并可在真实性、安全关键性与运行效率之间调节,但强引导会带来一定越界和保真度折衷。

TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing Figure 1
2026-06-26cs.CV

TMP: Tree-structured Mixed-policy Pruning for Large-scale Image Generation and Editing

Peizhen Zhang, Yang Li, Xunsong Li, Songtao Liu, Zewen Liu, Qiangqiang Hu, Guotong Guo, Jupeng Ding, Yifu Sun, coopersli, Jian Zhang, Zhao Zhong, Liefeng Bo

Multimodal Model Department, Tencent

2026-06-26视觉感知强化学习

这篇论文针对大规模图像生成/编辑模型参数和显存成本过高、难以在消费级硬件部署的问题,提出 TMP 结构化剪枝框架:先联合剪枝,再用树状合并的局部特征监督与离/在线混合策略蒸馏缓解层间误差累积。实验将 HunyuanImage-3.0 从 80B 压到 20B,并可在单张 24GB 4090 上推理;Z-Image turbo 从 6B 压到 4B,质量退化较小。

SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision Figure 1
2026-06-26cs.CV

SubdivAR: Autoregressive Next-Scale Prediction for Neural Mesh Subdivision

Huipeng Guo, Zikai Song, Hang Long, Jielei Zhang, Wenbing Li, Junkai Lin, Tianhao Zhao, Jinshen Zhang, Tianle Guo, Wei Yang

Huazhong University of Science and Technology

2026-06-26视觉感知

本文针对传统网格细分易过平滑、现有神经方法偏局部且难处理开放曲面的问题,提出将多级细分网格组织为自回归尺度序列,通过下一尺度坐标偏移预测保持拓扑并补充细节;其混合拓扑感知 Transformer 结合全局语义注意力与局部拓扑聚合,并配套构建 FII-40K 数据集。实验显示相对 SOTA 将 Hausdorff 与 Chamfer 距离分别降低 18.8% 和 14.2%,但部分增益可能来自数据清洗与规模化监督。

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT Figure 1
2026-06-26cs.CV

Pseudo-Text-Conditioned 3D Grounding DINO for Organ Localization in Abdominal CT

Siqi Chen, Han Gong, Keyi Hou, Jingxuan Yang, Sheethal Bhat, Andreas Maier

2026-06-26视觉语言生成模型三维

面向腹部创伤 CT 中后续损伤分析需要稳定器官空间先验的问题,本文将 Grounding-DINO 式查询检测扩展到 3D,用冻结伪文本类别 token 替代真实文本编码器,并结合 Swin3D、多模态特征增强和跨模态解码预测五类器官框。在 193 例 RSNA/RATIC 体数据上,最佳从零训练多尺度模型 mAP 为 0.5830,粗定位很强(IoU 0.1 AP 0.9649),但严格框对齐仍弱(IoU 0.7 AP 0.1552),伪文本增益相对纯 3D 检测基线仍文中未充分说明。

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views Figure 1
2026-06-26cs.CV

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views

Zhisong Xu, Takeshi Oishi

Zhisong XU and Takeshi Oishi are with the Institute of Industrial Science, The University of Tokyo, Tokyo, Japan

2026-06-26视觉感知三维

针对机器人在室内巡检、狭窄空间探索等场景中常见的少量全景图、弱视差或近纯旋转采集,PanoImager绕开易失效的SfM/SLAM初始化,将全景拆成局部透视视图,用前馈姿态/深度先验锚定几何,再以深度和位姿约束的扩散补全视角,并通过可靠性软监督与深度约束3DGS抑制漂浮物和幻觉。多基准实验显示其在极稀疏输入下重建更稳定,适合作为SLAM失败后的离线地图细化组件。

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA Figure 1
2026-06-26cs.LG

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

2026-06-26安全鲁棒

本文关注医疗视觉问答中多模态大模型“答错也很自信”的风险,认为仅沿用文本模型的口头置信度校准会忽视图像证据。方法通过图像有无与文本选项扰动构成2×2条件,结合Brier校准、锚定、图文对齐和top-k KL稳定项微调模型,使置信度更反映视觉证据依赖。在三个医疗VQA基准和两种架构上,校准误差降低60%以上、区分能力提升26%以上,且基本保持答题准确率。

On-board Remote-Sensing Foundation Models for Unsupervised Change Detection of Disaster Events Figure 1
2026-06-26cs.CV

On-board Remote-Sensing Foundation Models for Unsupervised Change Detection of Disaster Events

S. Ramírez-Gallego

2026-06-26视觉感知

面向灾害监测中星上算力、下传带宽和标注稀缺的约束,论文提出 UDFPN:用 SSL4EO-L 预训练 ResNet 作为遥感基础模型骨干,叠加未训练冻结 FPN,在单次图像级前向中恢复高分辨率空间嵌入,并以局部余弦距离做无监督变化检测。实验在 Landsat-8 火灾、洪水和滑坡事件上显示,其滑坡检测优于 PANN,并能生成更细粒度变化图;但整体事件规模较小,泛化增益来源仍需更多验证。

Event-Aware Instructed Assistant for Referring Video Segmentation Figure 1
2026-06-26cs.CV

Event-Aware Instructed Assistant for Referring Video Segmentation

Jinyu Liu, Henghui Ding, Shuting He, Yu-Gang Jiang

2026-06-26视觉感知

这篇论文针对指代表达视频分割中将整段视频视为单一事件、易混淆复杂动作和文本关系的问题,提出 EVIS:用文本引导的可学习 Event Query 将视频拆成多个简单事件,并通过 EAFM、事件内/事件间注意力及 Object-Pixel-Hybrid Learning 融合对象与像素线索。实验在 5 个公开视频基准上验证有效性,其中 MeViS 达到 46.8% J&F,显示事件级分解有助于长时目标跟踪与语义对齐。

Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation Figure 1
2026-06-26cs.CV

Unison: Benchmarking Unified Multimodal Models via Synergistic Understanding and Generation

Jinyu Liu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

2026-06-26视觉语言数据集/基准

现有统一多模态模型常被分别考察理解与生成,难以判断二者是否真正协同。Unison提出2169个人工验证样本,从内部一致性、理解引导生成、生成引导理解和相互增强四类任务评测,并配套与人类判断对齐的Unison-Judge及解耦诊断轨道。实验显示,不少在单项理解或生成基准表现强的模型,在联合任务中仍明显受限,提示当前统一建模的协同增益仍不足。

Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning Figure 1
2026-06-26cs.CV

Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning

Jiahe Chen, Qian Shao, Qiyuan Chen, Jiaying He, Jintai Chen, Jian Wu, Hongxia Xu

2026-06-26优化算法安全鲁棒

这篇论文针对开放集半监督学习中“过滤会丢掉困难类内样本、利用又会引入错误伪标签梯度”的矛盾,提出把问题从样本筛选转向梯度几何控制。其核心是用有标签监督梯度作锚点,将冲突的无标签辅助梯度投影到不反向的安全区域,并用子空间版本缓解小批量噪声。CIFAR 与 ImageNet 实验显示,GGR可作为插件提升多种OSSL基线,在低标签场景下同时改善闭集泛化和开放集鲁棒性。

Computer Vision for MOBA Analytics: A Dataset and Baseline for Visibility Analysis in Dota 2 Figure 1
2026-06-26cs.CV

Computer Vision for MOBA Analytics: A Dataset and Baseline for Visibility Analysis in Dota 2

Ricardo da Rocha Carvalho, Eloísa Oliveira, Luiz Bernardo Martins Kummer, Emerson Cabrera Paraiso, Rayson Laroca

2026-06-26视觉感知数据集/基准

这篇论文针对 MOBA 分析中过度依赖日志、坐标等结构化数据、难以刻画“敌方实际看见了什么”的问题,提出 Dota2-Vis:包含 TI 2025 全部 144 场双视角全高清视频和 2477 张人工标注小地图图像,并用小地图玩家图标检测来估计对手可见的地图存在。实验中 YOLO11l 表现最好,生成的可见性曲线揭示了玩家、英雄、位置和胜负队伍在活动时机、暴露风险与地图压力上的差异,为赛后复盘和战术分析提供了结构化数据难以直接获得的视觉信号。

Einstein World Models Figure 1
2026-06-26cs.AI

Einstein World Models

Munachiso Samuel Nwadike, Zangir Iklassov, Ali Mekky, Zayd M. Kawakibi Zuhri, Kentaro Inui

Tohoku University

2026-06-26强化学习

本文动机是弥补纯文本链式推理难以处理反事实、物理直觉和场景演化的问题。核心洞察是把“视觉思想实验”做成可调用的 world-module:LLM 在推理中少量生成视频式 rollout,并把它作为可检查假设继续推理,而非最终答案。主要结果偏概念框架与训练数据建议,文中未充分说明实证增益。

Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds Figure 1
2026-06-26cs.AI

Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds

Jiaming Bian, Bingliang Li, Yuehao Wu, Pichao Wang, Zhi Wang, Hailan Ma, Huadong Mo, Zhenhong Sun

2026-06-26强化学习三维

这篇论文关注动态三维故事世界中的具身视觉规划:相机不应先生成运动再被动观察,而要先根据叙事意图决定该看什么。其核心做法是将意图转成语义观察契约,再用蒙特卡洛视点搜索筛选兼顾叙事与几何可行性的视角,并用轨迹 grounding 生成连续避障运动。在基于 StoryBlender 的 50 个故事、1585 个镜头基准上,方法在主体感知、意图一致性和轨迹质量上优于代表性基线。

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization Figure 1
2026-06-26cs.CV

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian

2026-06-26视觉感知强化学习优化算法

本文针对多参考图像生成在参考类型混杂、数量增多时性能快速退化的问题,提出 OmniRef-Bench 进行更细粒度评测,并用 DyRef 两阶段训练框架结合 SFT、难度感知优势重加权和判别式奖励缩放,将优化重点转向困难样本。实验显示其显著提升开源模型在复杂 MRIG 与单图编辑任务上的表现,部分结果接近闭源模型。

No Figure
2026-06-26cs.CV

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

2026-06-26生成模型

针对帕金森等场景中面部表情质量评估只给严重度分数、缺少可审计运动证据的问题,TraMP-LLaMA在VideoLLaMA3上加入面部关键点轨迹流,并用解耦指令微调阻断文本生成损失对运动编码与融合模块的干扰,同时预测分数和生成结构化报告。作者还构建PFED5+文本标注集;实验显示其报告生成优于VLM基线,联合多表情训练下Spearman相关较竞品至少提升4.39%。

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE Figure 1
2026-06-26cs.CV

Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE

Haoyou Deng, Keyu Yan, Chaojie Mao, Xiang Wang, Yu Liu, Changxin Gao, Nong Sang

2026-06-26生成模型

本文针对扩散 MoE 中路由器受去噪噪声潜变量干扰、难以把更多专家分配给显著图像区域的问题,提出 SharpMoE:用前一去噪步预测的干净潜变量指导当前路由,并用轨迹路由损失约束整段生成过程的计算分配。实验称其可作为后训练、即插即用增强,用少量更新提升已收敛扩散 MoE,并在视觉生成指标上达到 SOTA。

PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation Figure 1
2026-06-26cs.CV

PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation

Xiaomin Li, Qian Liang, Yinan Li, Ying Zhang, Chen Li, Jing Lyu, Huchuan Lu, Xu Jia

2026-06-26强化学习

本文针对现有 T2I 强化学习后训练偏向提升色彩、构图等表层审美,却难以消除人像中的油腻皮肤、AI 痕迹和手指等生物不合理问题。PortraitGen 的关键做法是在 GRPO 采样组中注入真实人像,并用反演获得可优化轨迹,同时结合通用质量 OmniReward 与人像保真 AI-Portrait 双奖励。实验称其在 PortraitBench 上优于 FlowGRPO、DanceGRPO 等基线,更能压制伪影并提升照片真实感。

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation Figure 1
2026-06-26cs.CV

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

2026-06-26视觉感知

本文针对视频生成模型画面逼真但物理规律一致性不足的问题,提出 PhysRAG:先从 WISA-80K 通过两阶段过滤构建约 7K 高质量物理视频训练集,再检索相关物理视频,用 VideoMAE 特征和可学习查询将外部物理先验注入 DiT。实验在 PhyGenBench、VBench 上显示其在视觉质量和物理规则符合度上优于多种基线,但部分增益可能与数据筛选质量相关。

Neural Texture Compression using Hypernetworks Figure 1
2026-06-26cs.GR

Neural Texture Compression using Hypernetworks

Belcour Laurent

2026-06-26视觉感知

面向实时 PBR 中多张材质贴图带来的存储与带宽压力,本文用单个超网络直接为任意纹理集生成 BC1 潜变量和小型 MLP 解码器参数,替代逐材质梯度优化。结果显示其压缩质量接近现有 BCF1 神经纹理压缩器,并可扩展到多解码器和超分辨率任务;但文中也指出仍有全局色偏,增益更多体现在省去优化流程而非显著提升画质。

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation Figure 1
2026-06-26cs.CV

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu

2026-06-26视觉感知强化学习

针对真实图像生成请求常常语义不完整、依赖隐含意图或外部新知识的问题,论文将其概括为用户上下文与生成所需上下文之间的“Context Gap”。Qwen-Image-Agent的核心是用规划、推理、搜索、记忆和反馈逐步补全生成上下文,并提出IA-Bench评测计划、推理、搜索、记忆能力;在IA-Bench、MindBench和WISE-Verified上优于强基线,但具体增益中各模块贡献仍需结合消融细看。

Confidence-Aware Tool Orchestration for Robust Video Understanding Figure 1
2026-06-26cs.CV

Confidence-Aware Tool Orchestration for Robust Video Understanding

Yangfan He, Yujin Choi, Jaehong Yoon

University of Minnesota, Twin Cities, trajectory, recognized text, or action label), temporal grounding, and a calibrated re-, no stronger evidence is available, with residual uncertainty explicitly reported in the final answer.

2026-06-26视觉感知安全鲁棒

本文针对视频大模型在运动模糊、眩光、遮挡等真实退化下仍“盲信”所有帧的问题,提出 Robust-TO:先按帧质量与问题相关性筛选可信关键帧,再将子问题路由到合适感知工具,并把工具输出统一为结果、时间定位与置信度,供分层证据推理和 GRPO 训练使用。实验显示其在干净输入上平均准确率达 56.4%,在五类腐蚀下仍有 54.3%,同时减少约 35% 处理帧数和推理时间。

Tractography-Driven Synthetic Data Generation for Fiber Bundle Segmentation in Tracer Histology Figure 1
2026-06-26cs.CV

Tractography-Driven Synthetic Data Generation for Fiber Bundle Segmentation in Tracer Histology

Kyriaki-Margarita Bintsi, Sparsh Makharia, Yaël Balbastre, Joselyn Romero Avila, Julia F. Lehman, Suzanne N. Haber, Anastasia Yendiki

2026-06-26视觉感知

这篇论文针对猕猴示踪组织学中纤维束标注昂贵、跨脑和不同束密度泛化困难的问题,提出用离体 dMRI tractography 作为几何先验生成合成前景,并与 blockface 背景和域随机化混合训练 2D U-Net。结果显示,纯合成数据不足以替代真实监督,但少量真实标注加合成数据可达到接近 SOTA 的分割表现,并将人工标注需求降至约三分之一。

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI Figure 1
2026-06-26cs.CV

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI

Minh Duc Do, Tillmann Rheude, Noel Kronenberg, Roland Eils, Benjamin Wild

Berlin Institute of Health at Charité - Universitätsmedizin Berlin, Health Data Science Unit, Heidelberg University Hospital and BioQuant, Intelligent Medicine Institute, Fudan University, Department of Mathematics and Computer Science, Freie Universität Berlin

2026-06-26视觉语言三维

针对多模态3D脑MRI中局部结构、全脑上下文与跨模态互补信息难以同时建模的问题,论文提出MICViT,将模态内局部/全局注意力与跨模态局部/全局注意力分离组合,以模拟放射科医生的多尺度、多模态推理。其在UK Biobank、SOOP、Cam-CAN脑龄预测中优于3D CNN和Transformer基线,并在加入更多MRI模态时获得更明显增益。

Bridging Vision and Language Concepts through Optimal Transport Semantic Flow Figure 1
2026-06-26cs.CV

Bridging Vision and Language Concepts through Optimal Transport Semantic Flow

Chenyang Zhang, Anqi Dong, Guangming Zhu, Nuoye Xiong, Siyuan Wang, Lin Mei, Liang Zhang

2026-06-26视觉感知生成模型

这篇论文针对视觉语言概念瓶颈模型依赖预对齐嵌入、全局相似度导致细粒度概念定位弱的问题,提出 OTF-CBM:用逆最优传输学习跨模态语义代价,再以非平衡 OT 和流匹配刻画图像区域到文本概念的动态语义流,并用速度一致性激活概念。实验称其在分类准确率、概念忠实度和空间可解释性上优于现有 CBM,但具体增益的消融来源仍需结合完整实验细节判断。

RIS-Assisted Proactive Handover for Reliable mmWave Wireless Networks Figure 1
2026-06-26cs.CV

RIS-Assisted Proactive Handover for Reliable mmWave Wireless Networks

Alaa Adnan, Mohammad Al-Quraan, Ahmed Zoha, M. Majid Butt, Sami Muhaidat, Muhammad Ali Imran, Marco Di Renzo, Lina Mohjazi

and Communication Engineering, Khalifa University, Abu Dhabi 127788

2026-06-26视觉感知

针对毫米波链路易被遮挡且附近未必有可切换基站的问题,本文把视觉辅助的主动切换与RIS反射链路结合,并将RIS配置时延纳入切换准备约束;核心是用离线PSO优化RIS端到端链路和分配单元数,在链路质量、复杂度与能耗间取舍。结果显示,减少12% RIS单元可降低约10%耗散能量且不损失SNR,遮挡区域SNR提升约15–30 dB。

SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing Figure 1
2026-06-26cs.CV

SpatialFlow-GRPO: Where Spatial Credit Drives Image Editing

Yankai Yang, Yancheng Long, Wei Chen, Xingyu Lu, Hongyang Wei, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

2026-06-26视觉感知生成模型

这篇论文针对扩散图像编辑中全图奖励把不同区域成败混在一起的问题,指出 Flow-GRPO 类方法存在“空间信用分配”缺口。SpatialFlow-GRPO 用区域感知奖励模型 SFReward 将语义区域得分转成局部优势,并对齐到潜空间位置更新,同时构建 SFReward-14K 与 MultiEditBench。实验显示其在 OmniGen2、FLUX.2-klein-4B 上优于 Flow-GRPO,尤其提升多区域编辑,但效果仍依赖区域标注和奖励模型可靠性。

Rolling Shutter Relative Pose Estimation Made Practical Figure 1
2026-06-26cs.CV

Rolling Shutter Relative Pose Estimation Made Practical

Daniel Barath

2026-06-26三维

滚动快门相机会因逐行曝光破坏传统恒定本质矩阵假设,使相对位姿估计在RANSAC中因需20个点匹配而难以实用。论文的核心做法是把仿射对应引入滚动快门两视几何,推导考虑行相关本质矩阵与局部扰动耦合的约束,并构造仅需7个仿射对应的线性化代数求解器。实验显示其在TUM-RS上取得最佳位姿和滚动快门参数精度,显著改善平移速度估计,同时在EuRoC全局快门数据上接近5点法表现。

Appearance-Preserving Refinement of Generated 3D Assets for Monochromatic Fabrication Figure 1
2026-06-26cs.GR

Appearance-Preserving Refinement of Generated 3D Assets for Monochromatic Fabrication

Chentao Shen, Chen Jia, Mingjie Huang, Zhuang Zhang, Haisen Zhao, Xiangru Huang

2026-06-26三维

这篇论文针对生成式3D资产在单色3D打印中丢失纹理细节的问题,指出仅保形状不足以保外观。作者提出GenMF后处理框架,将纹理线索转化为几何诱导的灰度阴影,并用可微热应力预测器约束高频扰动以兼顾制造鲁棒性。实验、消融、FEM仿真和实物打印显示,其在单色渲染下保留更多可识别细节,同时降低应力集中。

Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection Figure 1
2026-06-26cs.CV

Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection

Ke Chen, Ling Zhou, Guangqi Jiang, Gengshen Wu, Yi Liu, Shoukun Xu

2026-06-26视觉感知

本文针对通用显著目标检测中单一 CNN、SSM 架构存在频谱偏置、难以同时兼顾全局语义与边界细节的问题,提出 LFNet:先用数据集级频谱分析指出 ConvNeXt 与 VMamba 的频率偏好互补,再以液态状态-刺激机制动态融合两类特征,并加入显著性引导上采样抑制伪影。实验覆盖 RGB、RGB-D、RGB-T、视频和 VDT 五类任务,报告达到新 SOTA 且兼顾效率。

Ordinal Neural Collapse as a Representation Prior for Visual Navigation Figure 1
2026-06-26cs.RO

Ordinal Neural Collapse as a Representation Prior for Visual Navigation

E-In Son, Jung-Taak Kim, Seung-Woo Seo

2026-06-26机器人

本文针对端到端视觉导航中编码器只受动作损失间接监督、易学到与控制无关表征的问题,提出 ORION:利用从 Far Left 到 Far Right 的目标相对方向天然有序性,将类别均值压到一条有序判别轴并抑制轴外方差,再接入扩散式导航策略微调。仿真和真实实验显示其较 NoMaD 与普通神经坍缩基线提升成功率和目标进展,在复杂路口等视觉歧义场景收益更明显,最高成功率增益约 26 个百分点。

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction Figure 1
2026-06-26cs.CV

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter

2026-06-26机器人视觉感知

面向机器人在开放环境中遇到未知物体却无法预先给出类别提示的问题,论文提出 AnomNOVIC:先用只见过空工作台的 MAE 以“异常即物体”生成类无关框,再交给 prompt-free 的 NOVIC 做细粒度命名,从而解耦定位与开放词表分类。在 NICOL 桌面场景中达到 47.1% AP、57.5% AP50,给定候选类时升至 59.0% AP、72.5% AP50,并在额外数据上最高取得 82.6% 检测分类准确率,优于 YOLO-World-v2、OWLv2 和 YOLOE。

Learning Adversarial Augmentation Policies for Robust Garlic Seedling Detection Figure 1
2026-06-26cs.CV

Learning Adversarial Augmentation Policies for Robust Garlic Seedling Detection

Soeun Lee, Chanho Kim, Yeji Kang, YoungKi Hong, Byeongkeun Kang

2026-06-26视觉感知强化学习安全鲁棒

面向地面平台在强阴影、过曝和空间不均匀光照下的大蒜幼苗检测,论文构建真实田间数据集,并用强化学习学习输入条件化的对抗增强策略,在训练中制造困难但受结构惩罚约束的扰动,推升检测器鲁棒性且不增加推理开销。实验中 AP50 达 91.6%,较基线提升 0.9 个百分点;缺苗定位精度 75.0%、F1 为 67.0%,分别较基线提升 4.8 和 2.0 个百分点。

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction Figure 1
2026-06-26cs.CV

Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction

Xilai Li, Xiaosong Li, Haishu Tan, Tao Ye, Huafeng Li, Hongbin Wang

2026-06-26视觉感知

这篇论文针对恶劣天气下红外-可见光等多模态图像同时退化与互补信息难以利用的问题,提出 AMG-Fuse:用伪真值降低早期训练难度,再从源图与融合结果关系生成模态贡献掩码,引导跨模态注意力、特征恢复和退化感知学习,以避免只拟合伪目标的静态偏差。实验称其在合成与真实恶劣天气数据上优于现有方法,并提升下游任务表现;但计算量较高,实时应用仍受限。

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision Figure 1
2026-06-26cs.RO

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision

Yuan Xu, Yixiang Chen, Kai Wang, Jiabing Yang, Peiyan Li, Qisen Ma, Yan Huang, Liang Wang

2026-06-26视觉语言视觉感知

这篇论文针对 VLA 微调中连续动作损失对所有时刻一视同仁、难以显式学习抓手开合附近阶段转换的问题,提出 StaKe:从演示中的抓手状态自动构造阶段分类和下一关键帧动作预测两个辅助监督,并仅在训练时加入轻量头,不改变推理流程。实验显示其在双臂仿真和 Franka 真机任务上分别带来约 14% 和 56% 相对成功率提升,长程、含更多抓手事件的任务收益更明显。

NaviCache: Test-Time Self-Calibration Caching for Video Generation Figure 1
2026-06-26cs.CV

NaviCache: Test-Time Self-Calibration Caching for Video Generation

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

2026-06-26视觉感知

这篇论文面向视频扩散模型推理开销高的问题,指出现有免离线校准缓存方法用零阶近似判断跳步,难以跟踪扩散轨迹中的动态变化。NaviCache将特征演化类比为惯性导航,在线估计输入/输出变化比例及漂移,并用初始对齐、噪声调度和不确定性触发的测量更新来控制计算跳过误差。实验覆盖HunyuanVideo、Wan和Open-Sora,显示其跳步误差判断更准确、综合加速保真表现优于TeaCache、MagCache、EasyCache等基线。

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP Figure 1
2026-06-26cs.CV

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

2026-06-26视觉感知

针对CLIP预训练偏重图文描述对齐、难以支撑视觉常识与组合推理的问题,论文提出ReasonCLIP-58M:用ReasonLite-42M逐步注入可视觉验证的推理描述,再用ReasonPro-16M进行五类结构化推理监督,并保持骨干不变。实验显示其在视觉 grounding、结构化推理、零样本检索及作为LLaVA-NeXT视觉编码器时均有稳定提升,但部分增益可能主要来自大规模数据与持续训练。

Event-based Gaze Control System for Accurate Real-time Spin Estimation in Professional Ball Games Figure 1
2026-06-26cs.CV

Event-based Gaze Control System for Accurate Real-time Spin Estimation in Professional Ball Games

Yunpu Hu, Fabian Schilling, Valentina Cavinato, Asude Aydin, Agis Politis, Ricardo Tapiador Morales, Kirk Y.W. Scheper, Peter Dürr, Naoya Takahashi

2026-06-26规划控制

论文面向高速球类比赛中小目标、高线速度与高速旋转导致传统相机难以实时估计旋转的问题,提出事件相机、可调焦长焦镜头与高速振镜组成的主动凝视系统,并用球面化对比度最大化分离旋转信息;离线在多类球上达约2.1%幅值误差和4.0°轴误差,在线乒乓场景实现750Hz、3ms延迟,误差约8.8%和6.4°。

No Figure
2026-06-26cs.CV

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

2026-06-26生成模型

本文针对 DiT 图像/视频生成推理中,传统特征缓存只复用历史激活、在高加速比下误差累积严重的问题,提出 LearniBridge。其核心洞察是缓存校正更新在不同提示词间共享低秩子空间,因此可用少量样本训练 LoRA 校准器,在跳过目标 timestep 全量计算时重构未来特征。实验显示其在 FLUX、HunyuanVideo、WAN 2.1 上分别达到最高 5.87×、5.75×、4.10×加速,并在 WAN 2.1 的 4.10×设置下较前 SOTA 提升 VBench 1.28%。

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration Figure 1
2026-06-26cs.AI

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan

2026-06-26生成模型规划控制

这篇论文针对扩散 Transformer 推理延迟高、现有 cache-then-forecast 在高加速比下失真的问题,指出根因是中间特征外推与连续扩散轨迹不对齐且数值不稳定。ResilPhase 改为预测全局漂移的宏轨迹,用无导数的重心 Lagrange 外推避免高阶导数噪声,并通过 Phase Mapping 抑制 Runge 振荡。实验称在 FLUX.1-dev 与 HunyuanVideo 上约 5× 加速且保持较好保真度。

Anatomy-Guided Residual Motion Diffusion for Controllable 4D Cardiac MRI Synthesis Figure 1
2026-06-26cs.CV

Anatomy-Guided Residual Motion Diffusion for Controllable 4D Cardiac MRI Synthesis

Yiheng Cao, Gustavo Andrade-Miranda, Jiatian Zhang, Lingxiao Zhao, Xin Gao

2026-06-26生成模型规划控制

针对4D心脏MRI标注稀缺、隐私限制和跨设备域偏移导致的模型泛化问题,论文将静态解剖与时间运动解耦:用半监督VAE联合学习图像与分割掩码,再以级联潜空间扩散分别生成受临床先验控制的ED解剖和残差运动轨迹。实验显示解剖控制相关性r>0.8、FVD为288.08,合成数据用于nnU-Net训练后平均Dice提升1.4%、HD降低3.0mm,左心室收益更明显。

Calibrated Harmonic Overlaid Implicit Neural Representations for Multi-Dimensional Data Figure 1
2026-06-26cs.CV

Calibrated Harmonic Overlaid Implicit Neural Representations for Multi-Dimensional Data

Honghang Chen, Xiujun Zhang, Xiaoli Sun, Mingqing Xiao

2026-06-26强化学习

本文针对周期激活 INR 在加深网络时因函数复合导致优化不稳、且固定频率难以匹配自然信号谱分布的问题,提出 CHOIR:用协调谐波叠加替代纯层级复合,并以感知谱校准引入 1/f 功率律先验。实验覆盖多维数据恢复任务,显示其在更深网络下仍能稳定提升 PSNR,并优于 SIREN、FINER、FreSh 等方法。

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory Figure 1
2026-06-26cs.CV

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

2026-06-26视觉感知

这篇论文面向流式视频理解中的延迟查询问题:关键视觉线索可能早已出现,但受固定显存和低延迟约束,传统滑窗或保留少量 token 容易丢失远历史证据。ProtoKV 的核心做法是保留近端精确 KV,同时把远端历史聚合为带残差统计的语义—空间原型,并以伪 token 形式接入标准注意力。实验称在四个 SVU 基准、相近预算下,长延迟场景较 token 保留基线最高提升 12.5 个百分点,且延迟越长优势越明显。

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting Figure 1
2026-06-26cs.CV

Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting

Zhihao Wen, Yixin Yang, Bojian Wu, Yang Zhou, Dani Lischinski, Daniel Cohen-Or, Hui Huang

2026-06-26规划控制三维

本文针对3D Gaussian Splatting风格化中按视角独立匹配导致的纹理重复、风格分配不稳和多视角不一致问题,提出以半平衡最优传输为核心的容量受控特征匹配,通过列容量约束抑制多对一复用,并用跨视角匹配引导约束同一3D内容对应一致风格;实验显示其在保持场景语义结构的同时提升风格多样性、细节表现和视角一致性,但代价是逐场景优化和一定计算开销。

Depth-Semantic Alignment and Affinity-Guided Fusion for Structured Radar Point Cloud Generation Figure 1
2026-06-26cs.CV

Depth-Semantic Alignment and Affinity-Guided Fusion for Structured Radar Point Cloud Generation

Amjad Hussain, Xin Qiu, Fuyuan Ai, Yuchen Tan, Zecheng Li, Chunyi Song, Wenjie Liu

Zhejiang University, China

2026-06-26三维

本文针对毫米波雷达点云稀疏、噪声多且结构不完整的问题,提出视觉-雷达融合生成框架:先用 Hessian 峰值增强抑制雷达噪声,再借助图像深度与语义先验完成跨模态空间对齐,并在 BEV 中融合与图优化补全结构。实验显示生成点云在结构完整性、语义一致性上更好,并提升检测与跟踪鲁棒性;但具体增益相对各模块的来源仍需消融细节支撑。

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation Figure 1
2026-06-26cs.RO

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

Yi Lu, Shenghao Ren, Tianyu Xiong, Zhaoxiang Li, Jiaqi Li, He Zhang, Tao Yu, Qiu Shen, Xun Cao

2026-06-26机器人模仿学习规划控制

PressMimic针对现有人形机器人模仿过度依赖视觉与运动学、忽略足地接触而导致滑步、穿地和不稳定的问题,将压力信号贯穿感知到控制:用RGB+压力的FRAPPE++估计人体姿态与全局运动,并在强化学习控制中加入压力监督PSP。论文还构建MotionPRO数据集,实验显示压力可提升姿态/轨迹估计一致性、任务成功率和运动稳定性。

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing Figure 1
2026-06-26cs.CV

LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing

Xinyu Wang, Chongbo Zhao, Fangneng Zhan, Yue Ma

2026-06-26视觉感知生成模型

LiveEdit面向AR和直播等实时场景中视频编辑难以同时保持未编辑区域稳定、低延迟响应的问题,提出从双向DiT到因果流式编辑器的三阶段蒸馏,并用基于编辑掩码的缓存复用自注意力中冗余区域计算。实验显示其在流式基线上取得更好的视觉质量和时序一致性,并将推理提升到12.66 FPS,接近交互式应用需求。

Do Image Editing Models Understand Lighting? Figure 1
2026-06-26cs.CV

Do Image Editing Models Understand Lighting?

Tim Küchler, Johann-Friedrich Feiden, Matthias Nießner, Carsten Rother

Heidelberg University, Technical University of Munich, Zuse School ELIZA

2026-06-26视觉感知

本文针对图像编辑模型是否真正理解真实光照而非只生成“看起来合理”的效果这一问题,提出3DLP基准:采集1K组真实室内HDR开/关灯探针对,并标注阴影、高光、金属等区域,配合可消除白平衡、曝光差异的物理指标评估六类模型。结果显示顶尖模型已能较好匹配真实光传输,Nano Banana Pro领先、Qwen-Image-Edit表现突出,但弱受光区域仍易出错,VLM也不适合像素级光照分析。

Robust Onion: Peeling Open Vocab Object Detectors Under Noise Figure 1
2026-06-26cs.CV

Robust Onion: Peeling Open Vocab Object Detectors Under Noise

Priyank Pathak, Mukilan Karuppasamy, Aaditya Baranwal, Shruti Vyas, Yogesh S Rawat

2026-06-26安全鲁棒

本文关注开放词汇目标检测器在真实噪声和视觉退化下为何失效这一尚不清楚的问题。作者用可控合成噪声逐层分析特征坍缩,指出鲁棒性主要由视觉骨干和图像域决定,预训练、结构细节与语言提示作用有限;并用轻量 NN & TK0 在 BDD-100K、WiderFace、VisDRONE 等真实数据上提升鲁棒性,参数量较端到端训练少 96 倍。

Full spectrum Unlearnable Examples via Spectral Equalization Figure 1
2026-06-26cs.CV

Full spectrum Unlearnable Examples via Spectral Equalization

Jiale Cai, Gezheng Xu, Zhihao Li, Ruiyi Fang, Ruizhi Pu, Di Wu, Qicheng Lao, Charles Ling, Boyu Wang

2026-06-26视觉感知

论文针对现有不可学习样本过度依赖高频扰动、经低通滤波后保护失效的问题,提出 FUSE:在生成器训练中用随机频谱遮蔽迫使不同频带都具备不可学习性,并通过跨频带指导协调低频与高频扰动。实验显示其在多数据集、架构迁移和不同滤波强度下能将测试准确率压到接近随机水平,优于既有方法。

A Latent ODE Approach to Spatiotemporal Modeling of Cine Cardiac MRI Figure 1
2026-06-26cs.AI

A Latent ODE Approach to Spatiotemporal Modeling of Cine Cardiac MRI

David Brüggemann, Ekaterina Krymova, Firat Özdemir, Jochen von Spiczak, Sebastian Kozerke, Samia Mora, Robert Manka, Mathieu Salzmann, Olga V. Demler

2026-06-26视觉感知

这篇论文针对传统心脏 MRI 风险模型只利用少数静态指标、可能遗漏全周期运动异常的问题,提出以双心室网格为输入的 GNN-Transformer 与心率感知 latent ODE 框架,将 cine CMR 建模为连续潜在轨迹,并用协变量条件先验提取偏离正常形态运动的残差表征。在 7.2 万 UK Biobank 样本中,该潜在风险分数将心衰预测 C-index 从 0.704 提升到 0.785,优于常规七项心脏指标,但仍需外部队列验证。

Dual-Prior Guided Null-Space Learning with Mixture-of-Splines for Arbitrary Medical Slice Super-Resolution Figure 1
2026-06-26eess.IV

Dual-Prior Guided Null-Space Learning with Mixture-of-Splines for Arbitrary Medical Slice Super-Resolution

Haofei Song, Siyuan Xu, Xintian Mao, Shaojie Guo, Qingli Li, Yan Wang

2026-06-26视觉感知

针对临床 CT/MRI 各向异性采集导致任意切片超分辨率病态、易篡改已观测切片或产生解剖幻觉的问题,论文将重建改写为双先验约束的零空间学习:MCP 硬性保证原始切片一致,MoS 以多阶 B 样条自适应建模局部连续性,并由 LSCD 增强空间一致性。在三组 CT 和一组 MRI 基准上,DP-NSL 相比现有方法取得更高指标,文中称最高带来 1.07 dB PSNR 提升且保持测量一致。

Extracting Neural Materials from Multi-view Images Figure 1
2026-06-26cs.CV

Extracting Neural Materials from Multi-view Images

Kim Youwang, Jon Hasselgren, Peter Kocsis, Andrea Weidlich, Tae-Hyun Oh, Jacob Munkberg

2026-06-26视觉感知

针对传统 PBR 材质难以表达雾化、清漆、绒毛、散射等复杂高光/次表面效果,本文提出 NeuMatEx,从多视图图像中提取空间变化的神经材质。核心做法是先用大型材质重建模型预测 base color、神经材质 latent 与不确定性,再用不确定性约束的可微路径追踪做测试时优化,缓解神经 latent 空间难优化和光照烘焙问题。合成与真实资产实验显示,其渲染质量和材质分解优于 PBR 方法,PathTrace PSNR 明显提升。

MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation Figure 1
2026-06-26eess.IV

MLFFM-SegDiff: A Multi-Level Feature Fusion Diffusion Model for Skin Lesion Segmentation

Jingjun Gu, Chaojie Shen, Yifeng Cao, Wei Zhang, Yiliu Li, Aobo Fan

2026-06-26视觉感知生成模型

针对皮肤镜病灶边界模糊、尺度变化大且易受毛发阴影干扰的问题,论文将扩散分割框架用于病灶掩码重建,并在去噪网络中加入双路径 U-Net 编码器、多层特征融合模块和可选边界敏感损失,以加强图像与噪声掩码交互及跨层语义/边界融合。在 ISIC2018、PH2、HAM10000 上相较 DermoSegDiff、U-Net、SwinUNETR 等取得最佳平均指标,平均 Jaccard 为 0.8546、Dice 为 0.9207。

Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation Figure 1
2026-06-26cs.CV

Mask to Concept: Auto-Promptable SAM3 via Efficient Test-Time Concept Embedding Search for Few-Shot Annotation

Quan Zhou, Shaoqing Zhai, Qiang Hu Jia Chen, Qiang Li, Zhiwei Wang

2026-06-26视觉感知

针对医学像素级标注依赖逐图交互、少样本自动标注又常需外部匹配器或辅助网络的问题,本文提出 M2C:在冻结 SAM3 内仅优化可学习概念嵌入,由少量掩码反推可迁移视觉概念,并结合 HUE 不确定性筛选形成人在环迭代。实验称其在 Kvasir-SEG、ISIC-2017 一次样本 Dice 分别较现有方法至少提升 4.2% 和 11.8%,同时提高标注效率。

Intracranial Aneurysm Classification and Segmentation via Tri-Axial ROI and Multi-Task Learning Figure 1
2026-06-26cs.CV

Intracranial Aneurysm Classification and Segmentation via Tri-Axial ROI and Multi-Task Learning

Pengcheng Shi, Kaiyuan Yang, Houjing Huang, Jiawei Chen, Yan Lu, Jiaqi Liu, Murong Xu, Bjoern Menze, Xinglin Zhang

2026-06-26视觉感知

针对颅内动脉瘤自动分析多停留在二分类、难以同时给出解剖位置与精细分割的问题,本文提出两阶段方案:用三轴少量2D切片快速定位ROI,再以3D多任务nnU-Net、双解码器和跨注意力池化联合完成13部位分类、动脉瘤与血管多类分割。方法在RSNA 2025挑战中两折集成获第2名,ROI较3D滑窗平均加速12.7倍;但分割标签主要来自伪标注与人工校正,独立标注验证文中未充分说明。

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models Figure 1
2026-06-26cs.CV

PhysEditWorld: A Large-Scale Dataset Toward Physics-Editable World Models

Bin Hu, Yanwen Ma, Jiehui Huang, Ziliang Zhang, Haoning Wu, Ruicheng Zhang, Yaokun Li, Zijun Wang, Yuechen Zhang, Chun-Mei Tseng, Hanhui Li, Shengju Qian, Jun Zhou, Kaipeng Zhang, Xiaodan Liang, Jiaya Jia, Xiu Li

Tsinghua Shenzhen International Graduate School, Tsinghua University, Beihang University, The Hong Kong University of Science and Technology, Shanghai Jiao Tong University, Sun Yat-sen University, The Chinese University of Hong Kong

2026-06-26强化学习数据集/基准

本文针对现有游戏世界模型把物理当作隐式统计相关、难以按设计需求编辑的问题,提出 PhysEditWorld 数据集:用 UE5 固定场景、初始状态、动作轨迹、角色控制器和相机策略,仅改变重力并重放,形成可归因的多模态匹配 rollout。实验证明它可用于训练和评估重力条件生成、第一人称世界模型与视频语言重力判断,并揭示当前模型虽能保持视觉真实,却常低估重力敏感运动或混淆重力等级。

DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection Figure 1
2026-06-26cs.CV

DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection

Hun Im, Jungi Lee, Subeen Cha, Pilsung Kang

2026-06-26视觉感知生成模型

面向工业产线中新类别持续到来且不能回放旧数据的异常检测问题,DeCoFlow抓住仿射耦合层对子网参数化不敏感、仍保持可逆与精确Jacobian的结构特性,将归一化流子网拆为冻结通用基座和任务低秩适配器,并用TSA、ACL、TAL缓解冻结带来的刚性。文中报告在MVTec-AD和VisA上图像级AUROC达98.40%和93.00%,正确路由下遗忘率为0,每任务仅增2.27M参数。

Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization Figure 1
2026-06-26cs.CV

Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization

Xuancheng Xu, Gengyun Jia, Bing-Kun Bao

Nanjing University of Posts and Telecommunications, Hefei University of Technology, Peng Cheng Laboratory

2026-06-26视觉感知

这篇论文针对文本到视频定制中内容、风格与运动难以同时受控的问题,提出多概念视频定制任务与基准,并用 Disco-LoRA 将内容-风格、内容-运动拆成双 LoRA 迭代解耦,再通过 Z-score 约束平衡 LoRA 权重幅值以减少概念干扰。实验显示其在外观保持、风格迁移和运动一致性上优于对比方法,但具体增益仍可能受数据与 scaling 影响。

LayersReg: A Layer-by-Layer Progressive Regressor for Reliable Intraoperative 3D/2D Registration Figure 1
2026-06-26cs.CV

LayersReg: A Layer-by-Layer Progressive Regressor for Reliable Intraoperative 3D/2D Registration

Xiyuan Wang, Zhenchao Wang, Xinran Chen, Junkai Liu, Chuan Chen, Feng Yin

School of Biological Science and Medical Engineering, Southeast University, School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, State Key Laboratory of Digital Medical Engineering

2026-06-26三维

这篇论文针对术中3D/2D配准中传统迭代法易陷局部最优、现有姿态回归器依赖外观记忆且缺少3D解剖先验的问题,提出LayersReg:将CT体特征与2D术中图像交互,用混合自编码器、特征相关残差、Mamba模块和逐层节点式回归,把一次性姿态预测改为受误差信号驱动的渐进配准。实验覆盖多数据集和模态,在大偏移条件下X-ray/CT配准达到0.68°、1.41 mm,切片定位达到0.73°、1.55 mm,优于文中比较方法。

FracEvent: Event-Camera Simulation via Fractional-Relaxation Pixel Dynamics Figure 1
2026-06-26cs.CV

FracEvent: Event-Camera Simulation via Fractional-Relaxation Pixel Dynamics

Langyi Chen, Chuanzhi Xu, Haoxian Zhou, Pengfei Ye, Ziyu Luo, Haodong Chen, Qiang Qu, Xiaoming Chen, Weidong Cai

The University of Sydney, Massachusetts Institute of Technology, Beijing Technology and Business University

2026-06-26视觉感知

事件相机真实数据采集成本高、同步和标注困难,促使从视频或渲染轨迹生成更可信事件流。FracEvent的核心是把传感器侧像素生命周期建模为分数松弛电压记忆:多时间尺度模式驱动电压,连续定位ON/OFF阈值穿越,并在触发后保留残余状态。实验显示其事件时序更接近真实数据,在图像重建和光流迁移中优于多种模拟器基线,但仍受输入亮度轨迹质量限制。

Temporally Consistent Label Interpolation for Robust Surgical Multi-Task Learning under Challenging Conditions Figure 1
2026-06-26cs.CV

Temporally Consistent Label Interpolation for Robust Surgical Multi-Task Learning under Challenging Conditions

Garam Kim, Juyoun Park

2026-06-26安全鲁棒

本文针对手术视频多任务学习中“时序任务密标注、像素级任务稀标注”的监督不均衡问题,提出 FAROS:用光流约束补强 SAM2 等外观传播在遮挡、烟雾、运动模糊下的漂移,生成时间一致的器械掩码与动作伪标签,并接入统一 Transformer 框架。实验在 DAVIS、GraSP、MISAW、AutoLaparo 上显示其提升标签传播稳定性和跨任务表征学习,但具体增益中各模块贡献仍需依赖消融判断。

Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning Figure 1
2026-06-26cs.CV

Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning

Mengzhao Wang, Yanli Ji, Wangmeng Zuo, Peng Ye, Chongjun Tu

Sun Yat-sen University, Shenzhen Loop Area Institute, Harbin Institute of Technology (HIT), Fudan University, Shanghai Artificial Intelligence Laboratory, The Chinese University of Hong Kong

2026-06-26视觉语言强化学习

这篇论文关注交错多模态推理中反复“回看”视觉证据带来的重算开销,指出直接复用历史视觉 KV cache 会因位置绑定失配导致自回归解码崩溃。作者提出 PRCR:保存未加位置编码的原始视觉 KV 及空间坐标,在回看时重分配兼容当前位置并重新绑定 key。实验显示其达到或超过 token replay 精度,平均提升约 2–5%,并将视觉回看计算量降低数个数量级。

TaskTok: Delving into Task Tokens for Task-driven Image Restoration Figure 1
2026-06-26cs.CV

TaskTok: Delving into Task Tokens for Task-driven Image Restoration

Hongjae Lee, Sojung Kang, Jaeseong Yu, Seung-Won Jung

2026-06-26视觉感知

本文针对任务驱动图像复原中全量更新潜变量 token 带来的计算浪费和语义漂移问题,指出一维 tokenizer 的不同索引承载不同任务相关线索,且分类、分割、检测所需 token 子集并不相同。TaskTok 用可学习 token switch 选择需修复的 task-relevant tokens,并以轻量模块精炼它们;实验覆盖分类、语义分割和目标检测,显示在更新更少 token 的情况下提升下游性能并提高效率。

LogicIR: Logic Gate Networks for Image Restoration Figure 1
2026-06-26cs.CV

LogicIR: Logic Gate Networks for Image Restoration

Hongjae Lee, Myungjun Son, Jaeseong Yu, Seung-Won Jung

2026-06-26视觉感知

本文针对图像复原模型计算量高、BNN仍依赖部分全精度运算且LUT受感受野扩展限制的问题,提出首个面向复原的逻辑门网络LogicIR。其核心是用全逻辑门UNet结构建模多尺度特征,并通过可微比特解码层和索引洗牌改善训练与信息传播。在BSD68去噪等基准上,LogicIR-S-4RT以169.3G二值操作达到27.71dB PSNR,显示出较强的效率-精度折中。

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues Figure 1
2026-06-26cs.CV

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

Geng Li, Yuxin Peng

2026-06-26视觉感知数据集/基准

该文针对现有细粒度感知评测依赖文本提示、分辨率偏低,难以衡量模型自主发现跨图隐含视觉线索的问题,提出 DiCoBench:以差异线索和共性线索为两条主线,构建 765 个近 2K 多图选择题样本,覆盖 8 类任务以减少生成式指标偏差。对 18 个 MLLM 的评测显示,人类准确率 98.3%,而最强闭源模型 Gemini-3-Pro 仅 58.1%,说明当前模型在微小细节捕捉和跨图逻辑感知上仍有明显缺口。

SpaceRipple: Lightweight Semantic Delivery for Mission-Oriented LEO Earth Observation Satellite Networks Figure 1
2026-06-26cs.CV

SpaceRipple: Lightweight Semantic Delivery for Mission-Oriented LEO Earth Observation Satellite Networks

Ziyi Yang, Hao Yuan, Yunxiang Yi, Wenbo Wang, Xing Zhang

2026-06-26视觉感知

针对低轨遥感卫星高分辨率图像下传受带宽与时延限制的问题,SpaceRipple将目标从完整图像传输改为任务语义交付:感知星只做自适应压缩和元数据生成,边缘计算星负责恢复、MoE增强与语义推理。实验显示该协同管线在保持较好重建质量的同时提升语义检测F1并显著提高接触窗口吞吐,但真实链路与多任务场景仍待验证。

Coarse-to-Fine: A Hybrid Self-Supervised Method for Non-rigid 3D Shape Matching Figure 1
2026-06-26cs.CV

Coarse-to-Fine: A Hybrid Self-Supervised Method for Non-rigid 3D Shape Matching

Feifan Luo, Ting Li, Zhao Li, Hongyang Chen

Zhejiang University, China Zhejiang Lab, China Wenzhou University of Technology, China, Corresponding author.Zhejiang University, China Zhejiang Lab, China Wenzhou University of Technology, China

2026-06-26三维

针对非刚性三维形状匹配中现有深度功能映射依赖几何先验、线性求解或推理微调而在复杂形变下效率和精度受限的问题,论文提出粗到细的混合自监督框架,使粗映射与细化对应在空间、谱及联合视角保持一致,并结合拉普拉斯基与弹性基双分支。实验显示其在非等距形变和拓扑噪声等场景取得优于已有方法的精度与运行效率,且对比能量可提升特征判别性。

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection Figure 1
2026-06-26cs.CV

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

2026-06-26视觉感知

针对高真实感 AI 生成图像让传统伪造检测难以捕捉细粒度痕迹、MLLM 方法又依赖昂贵静态合成监督的问题,论文提出 ForeAgent:用感知—裁决架构融合语义、空间与频域证据,并通过带真实标签回看信号的采样—反思—进化循环自生成高质量推理样本进行微调。实验显示其在 Chameleon 达到 82.18% 准确率、较 AIDE 提升 16.41%,在 AIGCDetectBenchmark 16 类生成器上平均准确率为 93.3%。

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing Figure 1
2026-06-26cs.CV

PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing

Shengbin Guo, Shaokang He, Chaoyue Meng, Shengpeng Xiao, Xunzhi Xiang, Shaofeng Zhang, Qi Fan

2026-06-26视觉感知强化学习数据集/基准

这篇论文针对现有图像编辑基准偏重空间/语义推理、缺少真实物理动态评测的问题,提出 PhyEditBench:从真实视频构建高分辨率多阶段物理编辑样例,并加入反物理合成样例,覆盖4类12子类物理过程。实验显示当前开闭源编辑模型常产生不符合物理的状态转移;其免训练基线 PhyWorld 将视频生成视为隐式物理推理,并结合测试时 scaling 与潜变量约束取得更好结果,但增益可能主要来自 scaling / data。

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP Figure 1
2026-06-26cs.CV

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

Zhixing Li, Yinan Yu

2026-06-26视觉语言

这篇论文针对VLM空间评测容易把语言先验误当作真实几何推理的问题,提出CRISP:将问答与度量3D场景图生成绑定,并用跨任务一致性和oracle干预区分感知瓶颈与推理缺陷。结果显示,闭源模型往往具备潜在推理能力但无法准确估计并利用自身结构表征,开源模型则更多受多跳组合推理限制。

The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report Figure 1
2026-06-26cs.CL

The Inattentional Gap: Task-Conditioned Language and Vision Models Omit the Safety-Critical Signals They Can Otherwise Report

Kwan Soo Shin

Kwan Soo Shin 1 1 1 PolymathMinds Lab, Seoul, Republic of

2026-06-26视觉感知安全鲁棒

论文关注安全评测只考“被指定风险”而真实事故常来自未被要求报告的信号这一错位,提出 Inattentional Gap:同一模型在开放提示下能报告危险,却在窄任务提示下省略。作者在放射、驾驶文本和胸片视觉任务中验证该现象,发现所有测试模型均出现抑制,且不随规模消失,推理模型也未避免,提示基准高分可与部署安全脱钩。

Forget, Anticipate and Adapt: Test Time Training for Long Videos Figure 1
2026-06-26cs.CV

Forget, Anticipate and Adapt: Test Time Training for Long Videos

Rajat Modi, Sebastian Noel, Xin Liang, Yogesh Singh Rawat

2026-06-26视觉感知

这篇论文针对长视频测试时训练中滑窗重复回传、相邻帧冗余导致算力随窗口和时长膨胀的问题,提出 Frame Forgetting Network:只处理退出帧、当前帧和新进入帧,并用“surprise”度量自适应决定何时扩缩窗口和执行适应。实验覆盖 11 个数据集及新建最长 3 小时 EpicTours,显示其在密集分割、视频分类和深度估计上保持竞争性能,同时更适合多小时视频。

Budget-Aware Keyboardless Interaction Figure 1
2026-06-26cs.HC

Budget-Aware Keyboardless Interaction

Quang-Thang Nguyen, Gia-Phuc Song-Dong, Minh-Triet Tran, Trung-Nghia Le

2026-06-26视觉感知

本文针对虚拟键盘依赖投影仪、AR 头显、多摄像头或标记纸张而成本高、部署繁琐的问题,提出只用普通摄像头和打印键盘纸的无键盘输入方案。其核心是用 YOLOv8 分割/检测键盘与按键,结合单应变换校正视角,并通过指甲颜色变化判断触键。实验中键盘检测 AP 达 92%、按键检测约 70%,但触摸检测准确率仅约 36%,受光照影响明显,实用性仍受限。

DanceDuo: Bridging Human Movement and AI Choreography Figure 1
2026-06-26cs.HC

DanceDuo: Bridging Human Movement and AI Choreography

Gia-Cat Bui-Le, Tuong-Vy Truong-Thuy, Hai-Dang Nguyen, Trung-Nghia Le

2026-06-26视觉感知

针对现有音乐驱动舞蹈生成系统偏重离线合成、缺少练习互动的问题,DanceDuo将DanceFusion扩散式音乐到动作生成、SMPL/Unity可视化与ROMP视频姿态估计结合,支持选曲、角色展示和用户舞蹈对比,并设计鼓励型评分。用户研究显示界面易用,舞蹈对比功能最受认可;但生成质量相对基线的定量增益与评分有效性文中未充分说明。

Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking Figure 1
2026-06-26cs.CV

Active Adversarial Perturbation-driven Associative Memory Retrieval for RGB-Event Visual Object Tracking

Xiao Wang, Xufeng Lou, Zikang Yan, Lan Chen, Sibao Chen, Yaowei Wang, Yonghong Tian, Jin Tang

School of Computer Science, Peking University, China

2026-06-26视觉感知

本文针对RGB-Event跟踪在真实机器人/无人系统场景中常见的传感器失效、低质模态与局部遮挡问题,提出APRTrack:用模态级和空间级对抗扰动分别模拟整模态缺失与目标局部缺失,并通过分层路由避免训练约束叠加导致特征坍塌;同时引入基于Hopfield的历史记忆检索,以置信足迹和通道校准限制补偿范围。实验在FE108、COESOT、VisEvent和FELT上验证了鲁棒性提升,但具体增益幅度在给定片段中未充分说明。

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation Figure 1
2026-06-26cs.RO

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

University of North Carolina at Chapel Hill

2026-06-26机器人数据集/基准

WatchAct针对现有机器人操作基准多依赖静态图像、难以评估对人类行为历史理解的问题,构建了3,000个由真人动作视频、语言指令和可执行LIBERO任务对齐的长程样例,覆盖事件、流程、意图和情景记忆四类能力,并将视频到计划、给定计划执行和端到端完成分开评测。结果显示当前系统差距显著:最佳组合仿真成功率仅16.3%,真机14.0%,主要瓶颈来自人中心空间推理、长程规划与低层执行。

Revealing Mammographic Phenotypes in Deep Learning Breast Cancer Risk Models Figure 1
2026-06-26eess.IV

Revealing Mammographic Phenotypes in Deep Learning Breast Cancer Risk Models

Ruiyu Jia, Yanqi Xu, Yuxuan Chen, Yiqiu Shen, Laura Heacock

Department of Mathematics, New York University Shanghai, China, Center for Data Science, New York University, USA, Department of Radiology, NYU Langone Health, USA, Perlmutter Cancer Center, NYU Langone Health, New York, USA

2026-06-26安全鲁棒

针对乳腺癌风险模型虽有效但难解释的问题,本文不再依赖单张显著图,而是用 Mirai 的补丁嵌入聚类挖掘人群级乳腺影像表型,并将其与5年风险关联。结果显示,高风险表型对应更复杂、异质的致密组织、微钙化等模式,也包含活检夹等捷径伪影;这些表型随 BI-RADS 密度升高而增加,并与更高年龄显著相关。

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs Figure 1
2026-06-26cs.LG

Rethinking Training & Inference for Forecasting: Linking Winner-Take-All back to GMMs

Qiyuan Wu, Katie Z Luo, Bharath Hariharan, Wei-Lun Chao, Mark Campbell

2026-06-26视觉感知

本文针对自动驾驶轨迹预测中多模态候选虽覆盖充分、但模式概率排序不可靠的问题,指出根因是模型按条件 GMM 推理、却用 WTA 硬分配训练,实际更接近 K-means,导致过分割和概率失真。作者据此提出测试时后验加权合并与一步 EM 软责任更新,无需重训即可在多种 WTA 架构上改善模式概率可解释性,并提升 NuScenes、WOMD 上的位移误差指标。

Methane-Plume Segmentation From Hyperspectral Satellite Imagery Via Multimodal Deep Learning Figure 1
2026-06-26cs.CV

Methane-Plume Segmentation From Hyperspectral Satellite Imagery Via Multimodal Deep Learning

Brayan Quintero, Jeferson Acevedo, Samuel Traslaviña, Hoover Rueda-Chacón

2026-06-26视觉语言视觉感知

针对卫星高光谱甲烷羽流稀疏、低信噪且仅依赖增强图易误检的问题,论文将RGB场景语义与甲烷增强图联合建模,用DINOv3提取多尺度视觉特征,并通过FGME门控把物理相关的甲烷线索注入RGB表示。MPDataset实验显示其较现有方法提升MIoU、精确率和召回率,同时计算开销更低,但具体增益中预训练与架构贡献占比文中未充分说明。

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection Figure 1
2026-06-26cs.CV

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

Zican Wang, Niloy Mitra

University College London

2026-06-26三维

这篇论文针对视频生成模型缺少三维几何约束、难以保持物体恒存和物理一致性的问题,提出将 V-JEPA 语义特征借助单目深度提升到体素潜空间,并用动作条件的体积特征平流学习隐式三维动力学,而非依赖显式物理引擎。实验称其在 CLEVRER、PhysInOne、PhysGaia 上较二维世界模型有更好的长期结构稳定性和物理合理性,但真实增益与数据、尺度的关系仍需进一步验证。

DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception Figure 1
2026-06-26cs.CV

DinoLink: A Token-Centric Representation Compression Framework for Bandwidth-Constrained Collaborative V2X Perception

Tianle Zhu, Haohua Que, Handong Yao, Hongyi Xu, Zhipeng Bao

2026-06-26视觉感知

DinoLink针对车云协同感知中V2X带宽窄、直接传图像或浮点特征都会造成语义损失或高时延的问题,将DINOv2特征转为可通信的离散语义 token:先用显著性Top-K丢弃背景token,再用RVQ编码为索引并在云端接DETR检测。nuScenes上在相对未压缩特征降低139倍码率时仍达32.8% mAP,窄带仿真中时延加速34.5倍;但泛化到更大数据和多车融合仍待验证。

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs Figure 1
2026-06-26cs.CV

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

2026-06-26视觉感知

这篇论文针对 MLLM 虽已编码视觉证据却在生成时依赖语言先验的“视觉懒惰”问题,提出 VIGIL:通过构造屏蔽视觉注意力的反事实盲态,最大化视觉输入与回答之间的信息增益,并惩罚无视觉仍自信的输出。实验称其在幻觉与推理基准上优于近期对齐方法,且用 25% 偏好数据即可匹配强基线全量数据表现,同时不损害纯文本能力,并出现无需框标注的空间 grounding。

What Do Deepfake Benchmarks Measure? An Audit Using Frozen Self-Supervised Representations Figure 1
2026-06-26cs.CV

What Do Deepfake Benchmarks Measure? An Audit Using Frozen Self-Supervised Representations

Samuel Pagon, Yixuan Shen, Vishal Asnani, Feng Liu

Department of Computer Science, Drexel University

2026-06-26数据集/基准

针对深伪检测高分基准难以迁移到真实场景的问题,本文不再提出新检测器,而是用冻结自监督表征加线性探针审计图像、音频、视频基准。核心洞察是:若简单探针接近专用模型,基准可能主要测到通用模态可分性而非取证理解。结果显示三类基准上探针均接近专用检测器,且生成器难度可由表征空间 Fréchet 几何部分解释。

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models Figure 1
2026-06-26cs.CV

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

2026-06-26视觉感知

这篇论文聚焦视觉提示调优中“提示与图像 token 如何融合”这一被固定为拼接或相加的关键设计,提出按 ViT 层搜索融合算子的框架,用可微架构搜索在拼接、相加、仿射变换和交叉注意力间为每层选择混合策略,并与提示参数联合优化。实验覆盖 VTAB-1k、FGVC、HTA 共 34 个数据集,在冻结 ViT 下以约 0.75% 可调参数取得 77.01%、91.6%、92.5% 等均值结果,显示层特异混合融合优于单一融合。

Tailor Made Embeddings for Quantum Machine Learning Figure 1
2026-06-26quant-ph

Tailor Made Embeddings for Quantum Machine Learning

Aldo Lamarre, Dominik Šafránek

Department of Electrical Engineering, KAIST, Daejeon, South Korea, Center for Theoretical Physics of Complex Systems, Institute for Basic Science (IBS), Daejeon - 34126, Korea, Faculty of Mathematics and Physics, Charles University, Ke Karlovu 3, 121 16 Praha 2, Czech Republic, ing on large datasets such as ImageNet [7]. The limited size of both simulable and current hardware, requirement (k) at the cost of increasing the runtime to O(Nd). Data reconcilability assumes that, scalability of state preparation [1], and the difficulty of training variational circuits [15, 4]. Classi-

2026-06-26视觉感知

本文针对量子机器学习在大规模视觉数据上受限于数据嵌入、测量可恢复性和训练初始化的问题,提出用变分自编码器学习任务定制的量子嵌入,使高维图像可压缩到少量量子比特并能经多项式测量重构。实验称 ImageNet 可压到 13 量子比特,MNIST 3/5 分类达 98.5%,显著优于朴素幅度嵌入,并在 IBM 硬件噪声下保持可重构性。

Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes Figure 1
2026-06-26cs.CV

Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes

Vasiliki Ismiroglou, Stefan H. Bengtson, Tasos Benos, Thomas B. Moeslund, Malte Pedersen

2026-06-26视觉感知

论文针对浑浊水下场景中视觉质量下降与模型可用信息损失常被混淆的问题,构建含1320张真实极端浑浊图像和1.6万余实例分割标注的TUB数据集,并提出基于相位一致性的PCD指标,强调结构信息比对比度或色彩更能解释任务性能。实验显示,PCD在真实与合成浑浊图像上均比NIQE、UIQM、SSIM等指标更强相关于MaskRCNN、YOLOv11、Mask2Former的AP50表现,同时表明极端浑浊数据可带来中高浑浊泛化收益,但也可能增加清晰图像上的歧义。

GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models Figure 1
2026-06-26cs.CV

GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models

Chaoxiang Cai, Minghe Weng, Jie Li, Yibo Jiang, Longrong Yang, Zequn Qin, Xi Li

2026-06-26视觉语言视觉感知安全鲁棒

针对 MoE 视觉语言模型中固定 Top-k 路由无法按 token 难度分配专家、导致资源浪费或语义欠拟合的问题,GeMoE 将动态路由解释为最小描述长度优化,并用门控熵作为不确定性代理,通过专家分配预测器为高熵 token 激活更多专家、低熵 token 减少计算。实验显示其在多种骨干和基准上保留静态路由 99.5% 平均性能,同时将专家激活稀疏性提升 36.5%。

Beyond Single-Source Cognitive Taskonomy:Multi-Source Task Relations through fMRI Transfer Learning Figure 1
2026-06-26cs.CV

Beyond Single-Source Cognitive Taskonomy:Multi-Source Task Relations through fMRI Transfer Learning

Junfeng Xia, Wendu Li, Mengjiao Zhang, Jie Guo

Department of Biomedical Engineering, Southern University of Science and Technology

2026-06-26视觉感知

本文关注单源 fMRI 任务迁移难以解释多认知成分共同作用的问题,将重建式 cognitive taskonomy 扩展到多源到单目标关系,并用布尔整数规划分析有限监督预算下应优先标注哪些任务。结果显示,运动任务内部迁移紧密但跨范式支持有限,多源效果取决于源任务组合,不能由成对关系简单概括;工作记忆 0-back/2-back 状态在全局分配中反复被选中,提示其覆盖多种感知、注意和执行控制成分。

A multi-task spatiotemporal deep neural network for predicting penetration depth and morphology in laser welding Figure 1
2026-06-26cs.CV

A multi-task spatiotemporal deep neural network for predicting penetration depth and morphology in laser welding

Sen Li, Haichao Cui, Chendong Shao, Yaqi Wang, Xinhua Tang

Shanghai Key Laboratory of Materials Laser Processing and Modification, School of Materials, Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, PR China.

2026-06-26视觉感知

面向激光深熔焊在线质量控制,论文针对仅靠人工特征或单帧视觉难以稳定判断熔透状态与焊缝形貌的问题,构建融合顶部熔池图像时序特征和焊接参数的多任务CNN/状态空间网络,同时预测熔透状态、熔深和横截面形貌。测试集中熔透状态准确率达99.35%,熔深误差1.79 mm,截面重建准确率95.65%;但相对各模块的消融增益与泛化到更多材料/工况的能力文中仍需进一步说明。

Rendering Novel Views of MRI Using 3D Gaussian Splatting Figure 1
2026-06-26eess.IV

Rendering Novel Views of MRI Using 3D Gaussian Splatting

Robin Y. Park, Mark C. Eid, Rhydian Windsor, Amir Jamaludin, Ana I.L. Namburete, João F. Henriques, Andrew Zisserman

{}^{1}\, Visual Geometry Group, University of Oxford, {}^{2}\, Oxford Machine Learning in NeuroImaging Lab, University of Oxford

2026-06-26三维

本文针对临床脊柱 MRI 轴位切片常因各向异性采样和扫描平面未对齐而漏显椎间盘/狭窄区域的问题,将 3D Gaussian Splatting 改造成可从稀疏非投影式 MRI 重建体数据并渲染解剖对齐新视角。实验显示,GS 重采样虽在 PSNR/SSIM 上不一定优于体素插值,但在 LPIPS 和四类局部狭窄自动分级上更好,说明更贴近诊断特征的视图比单纯结构指标更关键。

Fast LeWorldModel Figure 1
2026-06-26cs.LG

Fast LeWorldModel

Yuntian Gao, Xiangyu Xu

Xi’an Jiaotong University

2026-06-26强化学习

该文针对 LeWorldModel 在视觉规划中逐步自回归展开导致候选动作评估慢、长视野误差累积的问题,提出 Fast-LeWM:将单步潜在转移改为动作前缀预测,用因果编码器和并行预测器一次预测不同前缀对应的未来潜变量,并以密集前缀监督学习多步动作效应。在 LeWM 相同任务协议下,平均成功率由 85.8% 提升到 90.5%,动力学模块加速 3.9 倍,CEM 求解时间约减半,同时降低开环潜在误差及其随视野增长速度。

TaskNPoint: How to Teach Your Humanoid to Hit a Backhand in Minutes Figure 1
2026-06-26cs.RO

TaskNPoint: How to Teach Your Humanoid to Hit a Backhand in Minutes

Blake Werner, Ilona Demler, Pietro Perona, Aaron D. Ames

California Institute of Technology

2026-06-26机器人

论文动机是让人形机器人像人学运动一样,用少量教练示范快速掌握动态操作,而非依赖大规模数据或任务奖励调参。核心洞察是许多技能成败取决于短暂“交互窗口”,TaskNPoint由人指定技能、单次示范、关键窗口和目标,再用仿真RL与随机目标训练补全轨迹。结果显示Unitree G1可在网球、踢球、搬箱中从秒级视频、单GPU一小时内训练并部署,且能零样本泛化到新目标位置。

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models Figure 1
2026-06-26cs.CL

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

2026-06-26视觉语言视觉感知

针对现有多模态大模型综述多按视觉任务或语言推理割裂讨论、难以解释视觉语言感知演化的问题,本文将区域/实例级感知界定为统一能力,提出从编码器优化、解码器优化、动态感知到指令/RL与统一框架的五阶段分类。主要结果是系统梳理代表方法、边界与开放挑战,给出面向感知中心多模态智能的研究路线图;作为综述不报告新的实验增益。

Self-Supervised Tree-level Biomass Estimation in Urban Environments From Airborne LiDAR and Optical Observations Figure 1
2026-06-26cs.CV

Self-Supervised Tree-level Biomass Estimation in Urban Environments From Airborne LiDAR and Optical Observations

Jose Bermudez (1), Zilong Zhong (1), Dominic Cyr (2), Camile Sothe (3), Alemu Gonsamo (1) ((1) McMaster University, Hamilton, Ontario, Canada (2), Environment and Climate Change Canada, Montreal, Quebec, Canada, (3) Planet Labs PBC, San Francisco, California, USA)

McMaster University, 1280 Main Street West, Hamilton, Ontario L8S 4K1, Canada, Planet Labs PBC, 645 Harrison St., Floor 4, San Francisco, California 94107, USA

2026-06-26视觉感知

针对城市树木碳储量难以在单冠尺度、跨城乡异质场景中一致估计的问题,论文用机载 LiDAR 与近红外影像构建无需人工标注的伪标签双流交叉注意力框架,并量化树冠分割对生物量误差的影响;在安大略 810 km² 区域上,语义分割 Dice 为 0.84,AGB 估计 operational R² 为 0.570,显示主要瓶颈仍是树冠 delineation。

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention Figure 1
2026-06-26cs.CV

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

Huazhong University of Science and Technology, Peking University, Hong Kong University of Science and Technology, Huazhong University of Science and Technology China, Peking University China, Hong Kong University of Science and Technology Hong Kong

2026-06-26视觉感知

这篇论文面向漫画、分镜和视觉叙事中多图生成容易角色漂移、长序列全局注意力成本过高的问题,提出LCG并行去噪框架,用稀疏关系注意力在分支间选择性检索相关区域,再用身份掩码驱动的路由一致性约束对齐角色与结构。作者还构建含60万训练序列的LCCD;实验显示其在长上下文提示对齐、角色一致性和人类偏好上优于多图生成基线,但更长、更拥挤场景的细粒度身份保持仍有限。

Predicting Fruit Quality with a Hybrid Machine Learning and Image Processing Approach Figure 1
2026-06-26cs.CV

Predicting Fruit Quality with a Hybrid Machine Learning and Image Processing Approach

Amir Reza Hashemi, Shahram Amiri

¹ Department of Computer Science, Science and Research Branch, Islamic Azad University, ² Department of Decision and Information Sciences, School of Business Administration, Stetson, University, DeLand, Florida, USA

2026-06-26视觉感知

针对农业分拣中水果腐败检测成本高、实时性要求强的问题,论文将基于颜色阈值的图像处理腐败百分比、CNN二分类结果与逻辑回归融合,并进一步用逻辑回归把百分比映射为实时二分类,从而减少部署时对CNN算力的依赖。在苹果和橙子数据上,CNN准确率98.59%,轻量逻辑回归方案约94.5%、AUC 0.96,但方法依赖白色或透明背景,泛化到复杂场景仍文中未充分说明。

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents Figure 1
2026-06-26cs.CV

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

DocArena: Turning Raw Documents into Controllable, Rochester Institute of Technology, struggle to construct training environments that are controllable, scalable, and, analysis on agent search behaviors confirms the effectiveness and controllability, curation [22, 41] that limits scalability to new domains and large volumes. Third, it, curation pipeline to construct controllable, scalable, and generalizable training en-, which the pipeline produces diverse, scalable reasoning chains through predefined tem-

2026-06-26规划控制

本文针对搜索智能体训练环境多依赖文本、人工构造且难控制的问题,提出 DocArena:用多模态大模型解析原始 PDF、刻画跨页信息分布并自动生成带证据的推理型 QA,再经级联质检形成 DocArena-79K。实验显示,用该数据训练的 Doc-Search 在多模态文档检索与问答上领先,并在部分文本 QA 上泛化较好;但增益可能主要来自数据规模与环境构造质量。

Dot-Flik: A Scalable Edge AI Architecture for Distributed Insect Monitoring Figure 1
2026-06-26cs.NI

Dot-Flik: A Scalable Edge AI Architecture for Distributed Insect Monitoring

Mattia Consani, Denisa-Andreea Constantinescu, Åse Håtveit, Titus Venverloo, Fabio Duarte, Carlo Ratti, David Atienza

Dot-Flik: A Scalable Edge AI Architecture for Distributed Insect, along four axes — real-time performance, network scalability, fication by entomologists is labor-intensive, slow, and suffers, from low spatial resolution, making it unscalable for large-, Massachusetts Institute of Technology (MIT), Cambridge, MA, USA (e-mail:, systems still face a fundamental barrier to scalability. Current, Garden project [22] at Senseable City Lab developed Flik, Nevertheless, fundamental scalability limitations persist., sensing and classification enables scalable and cost-effective, AI and enables scalable distributed insect monitoring., performance, network scalability, hardware cost, and, available

2026-06-26视觉感知

面向昆虫种群下降下的大规模连续监测需求,Dot-Flik针对现有视觉方案成本高、耗能大且依赖集中处理的问题,将低成本Dot节点的运动感知帧过滤与Flik 2.0分类解耦。其核心是用时序差分、伽马增强和块级运动密度在传感端丢弃背景帧,降低传输与中心推理负载。实地结果显示轻风下可减少60–80%帧、维持30 FPS并节省最高22.6%能耗,单中心节点支持5–6路边缘流。

2026-06-24

129 篇
No Figure
2026-06-24cs.CV

DiffusionBench: On Holistic Evaluation of Diffusion Transformers

Xingjian Leng, Jaskirat Singh, Zhanhao Liang, Ethan Smith, Martin Bell, Aninda Saha, Yuhui Yuan, Liang Zheng

Australian National University

2026-06-24生成模型数据集/基准

本文针对 DiT 研究过度依赖 ImageNet-FID、难以判断方法是否真正提升生成能力的问题,提出统一训练评测框架 NanoGen,并据此构建同时覆盖 ImageNet 与文生图的 DiffusionBench。核心洞察是,在近似同一代码和算力设置下,ImageNet 排名与 T2I 指标相关性很弱甚至为负;21 个潜空间模型实验显示,仅报告 ImageNet 可能误导结论,因而应以双任务基准衡量更通用的进展。

BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases Figure 1
2026-06-24cs.CV

BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases

Qi Chen, Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Ibrahim Ethem Hamamci, Sezgin Er, Ashwin Kumar, Yiwen Ye, Yuhan Wang, Yuyin Zhou, Akshay S. Chaudhari, Curtis Langlotz, Kang Wang, Yang Yang, Alan L. Yuille, Zongwei Zhou

Johns Hopkins University, German Cancer Research Center, University Hospital Basel, University of Zurich, ETH AI Center, Istanbul Medipol University, Stanford University, Nanyang Technological University, University of California, Santa Cruz, University of California, San Francisco, information from clinical data, which makes the analysis both scalable

2026-06-24视觉感知数据集/基准

BenchX针对医学影像模型在真实临床人群和扫描协议变化下平均指标掩盖失效的问题,构建含85,355例CT、细粒度人口学与增强期标注的开放基准,并用LLM规模化整理临床信息。评测12个肿瘤检测/定位模型发现,年轻患者、少数族裔、非静脉期CT、小肿瘤和胰尾病灶上性能显著下降,动脉/平扫可使F1和敏感性降低15–30%,说明当前SOTA主要优化总体准确率,公平性与协议鲁棒性仍不足。

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation Figure 1
2026-06-24cs.CV

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari

University of Oxford, Visual Geometry Group

2026-06-24视觉感知

FLAT面向单图生成可探索3D场景时几何不准、3D Gaussian缺少显式表面且难进仿真/游戏管线的问题,提出从冻结视频扩散模型潜空间一次性解码三角形splat。其关键在于以射线为中心的三角形参数化和改进窗口函数,缓解平面基元方向敏感与梯度不足。实验显示其几何精度显著优于同类前馈基线,视觉质量保持接近,并可经轻量细化转为实时渲染的 opaque 三角表示。

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation Figure 1
2026-06-24cs.CV

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo

2026-06-24生成模型三维

FLUX3D针对单图生成3DGS时细节丢失的问题,指出瓶颈不只在模型容量,还在稀疏体素潜变量使用偏语义的2D特征、以及2D图像token与稀疏3D体素缺少结构化对齐。其核心做法是用FLUX扩散特征构建DA-SLAT并直接解码到3DGS,同时以SMDiT和MARoPE强化跨模态对齐。实验称在重建与生成基准上提升外观保真度并优于现有方法,但给定体素布局的设定意味着完整几何生成能力仍需谨慎解读。

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation Figure 1
2026-06-24cs.CV

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

NLPR, Institute of Automation, Chinese Academy of Sciences, The University of Hong Kong, recoverable and manipulable latent visual plans.

2026-06-24视觉感知

本文针对统一 MLLM 文生图在多对象计数、空间关系和属性绑定上易把结构规划与外观渲染混在同一条件流中的问题,提出 IV-CoT:把视觉查询按结构到语义因果级联组织,并用仅训练阶段的 sketch 监督塑造隐式结构计划,推理时仍只需文本、单次前向且不解码中间图。基于同一 OpenUni-L-1024,GenEval 从 0.86 提升到 0.88,T2I-CompBench 从 0.5448 到 0.5743,并比显式 CoT 低 9–15 倍延迟。

Spherical-to-ERP Epipolar Rectification for Single-Axis Disparity in 360 Stereo Figure 1
2026-06-24cs.CV

Spherical-to-ERP Epipolar Rectification for Single-Axis Disparity in 360 Stereo

Sahereh Obeidavi, Dieter Landes

[1] Faculty of Electrical Engineering and Computer Science, Coburg University of Applied Science, German, [2] Faculty of Electrical Engineering and Computer Science, Coburg University of Applied Science, German

2026-06-24视觉感知

面向360°/鱼眼双目在原始球面中极线弯曲、视差呈二维位移而难以直接套用传统立体匹配的问题,论文主张先做球面到ERP的极线校正,再用RAFT估计光流并通过EACS仅保留与基线一致的分量,将问题恢复为单轴视差。合成鱼眼数据实验显示该模块化流程可得到平滑、结构一致的视差图并具备实时速度,但真实场景和更宽基线下的泛化仍有待验证。

Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing Figure 1
2026-06-24cs.CV

Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing

Hongzhu Yi, Zhongtian Luo, Tong Li, Yiyan Fan, Jungang Xu

2026-06-24视觉感知

这篇论文针对一步图像编辑中“改得够强”与“保留原图结构”难以兼顾的问题,认为固定更新强度不足以覆盖不同编辑类型。RRLS在能量场传输框架上加入二阶时间曲率校正,并沿源图到强编辑结果构造残差候选,再用CLIP目标对齐选择输出。文中在700个PIE-Bench++样本、10类编辑上报告其相对现有一步方法达到SOTA,同时显著降低多步编辑的运行开销。

GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction Figure 1
2026-06-24cs.CV

GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction

Chenrui Fan, Paolo Favaro

Computer Vision Group, Institute of, University of Bern, Switzerland, pass/fail label or a single scalar ranking, GEOT2V-BENCH reports a continuous recon-

2026-06-24视觉感知数据集/基准三维

本文针对相机运动提示下的文生视频评测:仅看画质或局部几何不足以判断视频是否真像同一静态场景的多视角采集。GeoT2V-Bench用VGGT估计相机、DeformableGS吸收时变误差,并以MedianGS静态代理形成连续重建画像。3840次重建显示,可见运动、静态渲染误差、流一致性和静动拟合差常不一致,能补充GeCo暴露的全局3D一致性失败。

High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology Figure 1
2026-06-24cs.CV

High-Fidelity Synthetic Transmission Electron Microscopy Image Generation Using Diffusion Probabilistic Models for Data-Limited Semiconductor Metrology

Johannes Boehm, Bappaditya Dey

Chemnitz University of Technology, Chemnitz, Germany, Interuniversity Microelectronics Centre (imec), Leuven, Belgium, severely limit the availability of diverse datasets needed for, data bottlenecks and providing controllable, domain-consistent, integration of guidance mechanisms for controllable synthesis, microscope parameters, which may not always be available., performance by generating synthetic labeled images. While

2026-06-24视觉感知生成模型

面向先进半导体 TEM 数据因制样破坏、采集慢且昂贵而极度稀缺的问题,本文用 DDPM 从少量真实晶圆图像合成可用于量测与缺陷分析的数据。核心在于渐进式 patch 到全图训练,并结合 TEM 定制增强、跨工艺迁移、分类器引导和 RePaint 式补全,同时复用扩散特征做无监督分割。实验称仅 15 张图即可训练,合成图 MS-SSIM 最高超过 0.98,专家评估也支持其结构相似性。

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection Figure 1
2026-06-24cs.CV

DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection

Shiyi Mu, Zichong Gu, Zhiqi Ai, Yilin Gao, Shugong Xu

Shanghai University, Xi’an Jiaotong-Liverpool University

2026-06-24视觉感知三维

面向自动驾驶/机器人中双目3D检测难以兼顾实时性与开放集障碍发现的问题,DDStereo将已知类3D属性回归与类别无关前景定位拆成双轻量解码器,并用共享查询对齐两路结果,以几何视差信息估计异常而不依赖文本提示或NMS。实验称其在闭集和开放集双目基准上达到SOTA,并以23.5ms实现接近单目方法的实时速度。

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis Figure 1
2026-06-24cs.CV

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

Chenrui Fan, Paolo Favaro

Computer Vision Group, Institute of Computer Science, University of Bern, Switzerland

2026-06-24视觉感知三维

OrbitForge针对文本生成视频难以直接转成可用3D场景的问题:相机不可控、覆盖不完整且时序不一致。核心洞察是把初次失败的高斯重建当作坐标锚点,渲染规范环轨以定位缺失视角,再仅补全 unsupported 视图并二次重建。300个提示评测中,中位角覆盖达359.0度,弱覆盖区域Q10 ImageReward由8.07升至16.36,但仍受视频先验和补全错误影响。

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence Figure 1
2026-06-24cs.CV

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

Sun Yat-sen University, Peng Cheng Laboratory, Shenzhen University

2026-06-24视觉感知数据集/基准

这篇论文针对现有 VideoQA 只看答案正确、难以验证模型是否真正依据视频证据推理的问题,提出 EG-VQA 基准,要求开放式回答同时给出时间定位证据,并用 EG-F1 联合衡量时序对齐与语义一致性。实验显示强闭源模型也常出现答案对但证据错的情况;经显式证据监督训练的 EG-Reasoner 在开源模型中达到领先,尤其改善反事实等推理密集问题。

Pocket-SLAM: Rendering-Area-Aware Pruning for Memory-Efficient 3DGS-SLAM Figure 1
2026-06-24cs.CV

Pocket-SLAM: Rendering-Area-Aware Pruning for Memory-Efficient 3DGS-SLAM

Leshu Li, Jie Peng, Yang Zhao

autonomous driving scenarios. Our code is publicly available, at https://github.com/UMN-ZhaoLab/Pocket-SLAM., University of North Carolina at Chapel Hill, USA.

2026-06-24三维

Pocket-SLAM针对大规模户外3DGS-SLAM中高斯点持续累积导致峰值显存过高、难以部署到车载或无人机边缘GPU的问题,提出按有效渲染面积评估高斯贡献并剪枝,同时用tile级预算避免纹理密集区域被过度删除。其洞察是户外场景中道路、天空等大覆盖区域虽梯度或不透明度低,仍提供关键全局约束。EuRoC和KITTI实验显示,在基本保持定位与重建质量的同时,峰值内存降低超过60%,FPS提升超过2倍。

Counting Trees from Satellite Imagery with Noisy Supervision Figure 1
2026-06-24cs.CV

Counting Trees from Satellite Imagery with Noisy Supervision

Dimitri Gominski, Maurice Mugabowindekwe, Qiue Xu, Xiaowei Tong, Martin Brandt, Hieu Le, Rasmus Fensholt, Dimitris Samaras, Loic Landrieu

University of Copenhagen, University of Rwanda, University of Chinese Academy of Sciences, University of North Carolina at Charlotte, Stony Brook University, While scalable supervision can be derived from airborne LiDAR, scale tree counting from satellite imagery. Code, data and models are available at, ways admit a clear object center. They occur in heterogeneous spatial configurations, ranging from, (b) Strong Labels, (c) Weak Labels, labels consisting of manually annotated tree centers (b), and weak labels automatically derived from, pervision alongside sparse high-quality labels, providing a principled solution to heterogeneous an-

2026-06-24视觉感知

这篇论文针对卫星影像中单木计数难题:稀疏树可定位、密林树冠边界却模糊,且大规模人工标注昂贵、LiDAR 弱标注噪声大。作者将计数建模为空间密度匹配,引入非平衡最优传输并用运输残差自校正弱监督,同时发布覆盖三洲三类传感器、含 2.15 亿标注的 TINYTREES。实验显示 TREEMATCH 相比检测、回归和分布匹配基线更稳健,但部分增益可能主要来自 scaling / data。

AerialFusionMapNet: Online HD Map Construction with Aerial-Onboard BEV Fusion Figure 1
2026-06-24cs.CV

AerialFusionMapNet: Online HD Map Construction with Aerial-Onboard BEV Fusion

Daniel Lengerer, Mathias Pechinger, Klaus Bogenberger, Carsten Markgraf

Code and trained models are available at https://github., resulting in high accuracy but limited scalability and costly, University

2026-06-24视觉感知

针对车载相机在线构建高精地图易受遮挡、视野范围和上下文不足限制的问题,AerialFusionMapNet引入离线航拍图像与车载BEV特征融合,并指出关键不在更复杂的航拍编码器,而在两阶段训练:先航拍预训练,再用跨视角监督对齐表示。nuScenes地理划分上最高达到54.7 mAP,较既有航拍-车载融合基线48.8 mAP提升5.9点,且对中等航拍配准偏移保持一定鲁棒性。

Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients Figure 1
2026-06-24cs.CV

Revealing Training Data Exposure in Vision Language Large Models via Parameter Gradients

Zhihao Zhu, Hongyi Tang, Yi Yang, Ahmed Abbasi

Department of Information Systems, Business Statistics and, Operations Management (ISOM), Hong Kong University of Sci-, ence and Technology, Hong Kong, China. 2Department of IT, An-, alytics, and Operations, University of Notre Dame, Notre Dame, action lawsuit was filed against the University of Chicago, Medical Center for providing thousands of patients’ un-

2026-06-24视觉感知优化算法

针对视觉语言大模型训练数据来源与版权/隐私审计困难,论文提出白盒 GradAudit,不看输出熵等表层信号,而利用训练样本在参数梯度上更稳定、更对齐的特征,并用梯度切片与噪声掩蔽提升可分性。在医疗与通用数据、预训练和微调场景中,其 AUROC 最高约 92.7%,还能区分真实图文配对与打乱配对,Ghibli 案例显示既有方法可能低估数据暴露。

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization Figure 1
2026-06-24cs.CV

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

2026-06-24视觉感知

针对室内重定位长期依赖低层视觉特征、地图臃肿且缺少语义可解释性的问题,OpenReLoc将场景组织为对象级地图,用CLIP开放词汇描述符与全局场景图做2D-3D对象匹配,并以对象参考帧和DIOU检索提供位姿先验,再用双路径2D ICP按物体形状细化位姿。实验在ScanNet、ScanNet++和Habitat合成大场景上报告了更高召回与精度,表明对象级语义表示可兼顾紧凑性、可扩展性和定位性能。

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving Figure 1
2026-06-24cs.CV

UniDrive: A Unified Vision-Language and Grounding Framework for Interpretable Risk Understanding in Autonomous Driving

Xiaowei Gao, Pengxiang Li, Yitai Cheng, Ruihan Xu, James Haworth, Stephen Law, Yun Ye

aDepartment of Earth Science & Engineering, Imperial College London, London, SW7 2AZ, United Kingdom, bSpaceTimeLab, Department of Civil, Environmental, and Geomatic Engineering, University College London, London, WC1E 6BT, United, cDepartment of Computing, The Hong Kong Polytechnic University, Hong Kong, China, dTrinity College, University of Oxford, Oxford, OX1 3BH, United Kingdom, eDepartment of Geography, University College London, London, WC1E 6BT, United Kingdom, fCentre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London, London, WC1E, is available at https://github.com/pixeli99/unidrive-dev.

2026-06-24视觉语言视觉感知安全鲁棒

自动驾驶风险理解需要同时解释“为什么危险”和定位“危险在哪”,而现有多模态驾驶模型常在时序推理与空间精度间取舍。UniDrive以多帧时序分支结合最新帧高分辨率感知,并用门控交叉注意力融合,联合生成风险描述和目标框。在DRAMA-Reasoning上优于图像/视频基线,并在小目标定位、NuScenes与BDD100K零样本及人工可信度评价中表现更好。

Adaptive Hebbian Memory Routing in Vision Transformers for Few-Shot Learning Figure 1
2026-06-24cs.CV

Adaptive Hebbian Memory Routing in Vision Transformers for Few-Shot Learning

Mohammed Yusuf Mujawar, Noorbakhsh Amiri Golilarz

2026-06-24视觉感知

这篇论文针对少样本视觉识别中 ViT 推理时难以按当前 support set 快速适应的问题,提出用轻量 MLP 路由器按 episode 调节 Hebbian 快权重记忆的启用强度、写入塑性和保留率,而不是固定插入记忆模块。结果显示,在相同 Swin 记忆位置下,自适应塑性将准确率从 96.74% 提至 96.92%,全自适应达 96.94%,且推理时间由 16.51 ms 降至 14.05 ms;CIFAR-FS 与多 shot 设置也有一致增益,但整体提升幅度较小。

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming Figure 1
2026-06-24cs.CV

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

Guangdong Institute of Intelligence Science and Technology, Zhuhai, China, Zhejiang University, Hangzhou, China, Southeast University, Nanjing, China, The Hong Kong Polytechnic University, Hong Kong SAR, China, Institute of Science Tokyo, Tokyo, Japan, Shanghai Jiao Tong University, Shanghai, China, which is optimized using task labels to repurpose frozen models. When applied

2026-06-24视觉感知

BioMedVR针对CLIP等视觉语言模型迁移到医学影像时全量微调昂贵、少样本且相似疾病易混淆的问题,把视觉重编程用于输入空间适配,并用正向专家识别目标类别、负向专家结合LLM生成的混淆属性抑制相近类别,再以门控融合和混淆抑制损失拉开边界。实验覆盖11个生物医学数据集和7个自然图像基准,报告少样本与零样本性能均优于既有提示学习和VR方法,且可训练参数远少于全量微调。

VSANet: View-aware Sparse Attention Network for Light Field Image Denoising Figure 1
2026-06-24cs.CV

VSANet: View-aware Sparse Attention Network for Light Field Image Denoising

Gargi Panda, Soumitra Kundu, Saumik Bhattacharya, Aurobinda Routray

collaborative filtering of similar patches collected from, Gargi Panda and Aurobinda Routray are with the Department of EE, IIT, Soumitra Kundu is with the Rekhi Centre of Excellence for the Science of, Saumik Bhattacharya is with the Department of E&ECE, IIT Kharagpur

2026-06-24视觉感知

光场图像去噪需要利用跨视角内容相关而噪声相对独立的结构,但既有方法常局限于手工先验或分割的二维子空间。VSANet将完整4D光场展成统一空间-角度token,并用LSH稀疏注意力实现近线性复杂度的全局跨视角聚合,再结合空间、角度和极线子空间特征精炼。实验称其在两个基准、三种噪声水平下优于现有SOTA。

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards Figure 1
2026-06-24cs.CV

SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards

Sheng Xia, Zhengqin Lai, Tianxiang Jiang, Kanghui Tian, Shoujun Zhou, Bin Li, Yi Wang

Nanjing University, Shanghai Innovation Institute, Shanghai AI Laboratory, Harbin Institute of Technology, Shenzhen, Shenzhen Institutes of Advanced Technology, sensitive IoU rewards, and sparse temporal labels can, calization labels (Luo et al., 2025). Such annota-, ization labels are available, existing reinforcement, by overlap with one annotated box or one labeled

2026-06-24视觉感知强化学习

这篇论文针对视频 MLLM 在细粒度时空推理中“答对但证据错”的问题,指出 IoU 等几何奖励对边界扰动敏感且忽略语义有效性。SER 让模型生成对象、框和时间戳组成的证据声明,并用裁判 VLM 从相关性、定位质量与时间对齐进行语义验证,从而减少密集框标注依赖。实验在 V-STAR 上达到 49.6% mLGM,较 Open-o3-Video 提升 3.0 点,同时改善答案准确率和证据 grounding。

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations Figure 1
2026-06-24cs.CV

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir

The Berlin Institute for the Foundations of Learning and Data (BIFOLD), yielding the most interpretable SAEs. Code and datasets are available, fore critical for trust, controllability, and scientific analysis of these models [44].

2026-06-24视觉感知

这篇论文针对视觉/视觉语言模型中 SAE 可解释性常被重建误差、稀疏性或案例展示替代评估的问题,提出用人工标注概念来检验稀疏潜变量的语义对齐。核心创新是 FBMP 多对一潜变量-概念匹配、synCUB/synCOCO 单属性扰动数据集,以及验证响应方向和选择性的 TAPAScore。结果显示这些指标能区分训练与未训练 SAE,且过高过完备度会削弱扰动对齐,中等字典规模更可解释。

Agentic Collaborative Cognition for Zero-Shot 3D Understanding Figure 1
2026-06-24cs.CV

Agentic Collaborative Cognition for Zero-Shot 3D Understanding

Wenxin Wang, Bo Zhang, Feng Chen, Zixuan Wang, Wen Li, Changsheng Li, Yinjie Lei

Agentic Collaborative Cognition for Zero-Shot 3D, Sichuan University, 2Adelaide University, University of Electronic Science and Technology of China, Beijing Institute of Technology, per, we propose a collaborative multi-agent framework that assigns a, Through this closed-loop iterative process, two agents collaboratively fig-, Keywords: Zero-Shot 3D Understanding · Collaborative Cognition ·, limits scalability and adaptability to diverse real-world environments [52,56]., In this paper, we propose a collaborative multi-agent framework for zero-shot

2026-06-24三维

本文针对零样本三维理解中依赖视频关键帧导致视角有限、空间认知隐式且不稳定的问题,提出规划代理与感知代理协作:前者按查询主动补充关键视角,后者用跨视角实例一致性维护整体认知图并反馈筛选候选。该闭环在6个基准上达到SOTA,ScanRefer Acc@0.5提升11.1%、3D对话BLEU-1提升14.6、SQA3D EM提升2.1。

ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos Figure 1
2026-06-24cs.RO

ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos

Pranjal Mishra, René Zurbrügg, Max Wilder-Smith, Marco Hutter, Marc Pollefeys, Zuria Bauer, Hermann Blum

ETH Zürich, Zürich, Switzerland. 2 Microsoft, Zürich, Switzerland. 3 University of Bonn, Bonn, Germany.

2026-06-24视觉感知三维

面向机器人在真实家庭环境中操作抽屉、柜门等关节物体时缺少可交互数字孪生的问题,ArtiTwinSplat从手持RGB-D视频自动重建3D Gaussian Splatting模型,并通过外观变化检测、反向SAM2跟踪和4D RANSAC估计关节类型、轴、枢轴与运动范围,再进行关节条件优化。实验证明其可在三类真实Kallax场景中恢复旋转/平移关节并导出Isaac Sim可用URDF,但结果主要为定性展示,量化增益文中未充分说明。

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering Figure 1
2026-06-24cs.CV

ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering

Zhentao Guo, Chen Duan, Tongkun Guan, Zining Wang, Kai Zhou, Pengfei Yan

2026-06-24视觉感知数据集/基准

这篇论文针对现有视频文本问答基准多可由单帧回答、难以检验跨帧文字理解的问题,构建 ViTexQA:所有问答都要求融合多时间点文本线索,并配套时序 CoT 标注;同时提出 FrameThinker,用 CoT 监督微调和带多帧一致性奖励的强化学习显式训练时序感知。在该基准上,现有 MLLM 与人类仍有明显差距,FrameThinker 相比强基线 ROUGE-L 提升 6.3%。

EERLoss: A Novel Loss Function for Training Deep Biometric Models. A Case Study in Keystroke Dynamics Figure 1
2026-06-24cs.CV

EERLoss: A Novel Loss Function for Training Deep Biometric Models. A Case Study in Keystroke Dynamics

Nahuel Gonzalez, Marta Robledo-Moreno, Ivan DeAndres-Tame, Ruben Vera-Rodriguez, Ruben Tolosana

2026-06-24强化学习

这篇论文针对生物特征验证训练目标与常用 EER 评价指标不一致的问题,提出可次微分、可任意逼近 EER 的 EERLoss,使模型直接优化验证操作点而非仅拉开嵌入距离。在 18.5 万用户级 KVC-onGoing 键击动态基准上,相比多种现有损失收敛更快,并将原 SoTA 相对 EER 降低最高约 30.7%,训练耗时也显著下降。

Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning Figure 1
2026-06-24cs.CV

Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning

Julien Khlaut, Charles Corbière, Baptiste Callard, Amaury Prat, Leo Butsanets, Antoine Saporta, Théo Danielou, Leo Machado, Korentin Le Floch, Tom Boeken, Pierre Manceron, Corentin Dancette

Department of Vascular and Oncological Interventional Radiology, Imaging Department, Fondation Ophtalmologique Adolphe de Rothschild, Paris, France

2026-06-24视觉语言视觉感知三维

针对3D CT报告按器官组织而CLIP式全局对齐易丢失局部病灶信息的问题,Jolia提出ConQuer:用LLM将报告拆成解剖概念段,并以可学习跨注意力查询从体数据中无分割监督地提取对应区域表征,逐概念做对比学习。基于7.4万胸腹CT-报告预训练后,模型在发现分类、报告生成和跨中心迁移上优于CLIP基线并刷新多项公开基准,但部分增益可能仍受数据规模与骨干选择影响。

Multilevel Stochastic Plug-and-Play for Sparse-View CT Reconstruction Figure 1
2026-06-24cs.CV

Multilevel Stochastic Plug-and-Play for Sparse-View CT Reconstruction

Antoine De Paepe, Alexandre Bousse, Dimitris Visvikis

2026-06-24三维

针对稀疏视角 CT 中投影不足导致的病态重建与 PnP 随机方法迭代开销大问题,论文提出 ML-SPnP:把随机 PnP 的多层加速放到小波多分辨率近似空间中,使跨层先验一致性修正在期望上消失,从而避免多次估计细层随机先验梯度。实验显示其在两类医学 CT 数据上保持接近先进随机 PnP 的重建质量,同时显著缩短运行时间。

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments Figure 1
2026-06-24cs.CV

PatternGSL: A Structured Specification Language for Template-Free and Simulation-Ready 3D Garments

Zhenyang Li, Lutao Jiang, Yizhou Zhao, Ying-Cong Chen, Xin Wang, Weikai Chen, Yifan Peng

The University of Hong Kong, The Hong Kong University of Science and Technology (Guangzhou), Carnegie Mellon University, The University of Hong Kong Hong Kong Hong Kong SAR, China, The Hong Kong University of Science and Technology (Guangzhou) Guangzhou Guangzhou, China, Carnegie Mellon University Pittsburgh Pittsburgh, PA, USA

2026-06-24三维

这篇论文针对单图服装重建中“几何形状可恢复但缺少可仿真的缝制结构、程序化方法又依赖模板”的断层,提出 PatternGSL:用统一语言显式编码裁片、参数化边界和缝合拓扑,并训练 VLM 从图像直接生成该规格。配套 30 万样本数据集后,方法在图案精度、缝合恢复和布料 draping 稳定性上优于基线,报告 99.2% 仿真成功率,但部分增益可能主要来自 scaling / data。

Quantum CT via Dynamic Interval Encoding and Prior-Balanced QUBO Reconstruction Figure 1
2026-06-24cs.CV

Quantum CT via Dynamic Interval Encoding and Prior-Balanced QUBO Reconstruction

Ao Wang, Yikuang Yuluo, Yujie Liu, Shuangyang Zhong, Yuwen Zhang, Zihao Wang, Fenglin Liu, Andreas Maier, Haijun Yu, Yixing Huang

2026-06-24三维

本文针对灰度量子 CT 中二进制变量预算限制:全局高比特编码会放大 QUBO 规模,低比特又带来量化误差。核心做法是用动态局部灰度区间逐轮编码,并以边界命中规则调节搜索/细化,同时平衡投影一致性与边缘保持先验。稀疏视角和有限角扇束实验优于多类基线,D-Wave 混合求解器验证了可执行性,但大规模、噪声和真实 CT 仍待验证。

Heterogeneous Knowledge Distillation via Geometry Decoupling and Momentum-Aware Gradient Regulation Figure 1
2026-06-24cs.CV

Heterogeneous Knowledge Distillation via Geometry Decoupling and Momentum-Aware Gradient Regulation

Wuming Yang, Xiang Zhang, Hongmin Zhao

2026-06-24优化算法

论文针对 Transformer 到 CNN 等异构知识蒸馏中训练不稳定的问题,指出根因在于特征范数差异和主任务/蒸馏梯度冲突。方法 SPOFA 用 LayerNorm 投影解耦幅值与方向,并用动量 EMA 调节冲突蒸馏信号。实验称其在 CIFAR-100 和 ImageNet-1K 上优于 OFA、PAT,且训练开销很小、推理无额外成本。

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning Figure 1
2026-06-24cs.CV

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Yongsheng Li

Shanghai Jiao Tong University, Shanghai AI Laboratory, The Chinese University of Hong Kong

2026-06-24视觉感知数据集/基准

这篇论文关注文生图模型的“推理”是否只是训练共现的统计归纳。作者提出 CF-World,将同一场景拆成事实、显式反事实和隐式反事实三层,并用 CF-Eval、PRR/RRR 衡量模型抵抗现实先验和保留推理的能力。实验显示开源与闭源模型从事实到反事实均明显退化,说明当前 T2I 更依赖文本-视觉高频绑定,尚难真正解耦规则并生成反事实世界。

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought Figure 1
2026-06-24cs.CV

PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought

Ling Li, Bowen Liu, Zinuo Zhan, Jianhui Zhong, Ziyu Zhu, Bingcai Wei, Kenglun Chang, Zhidong Deng

Tsinghua University, Dalian University of Technology, Northwestern Polytechnical University, Wuhan University, Tsinghua University Beijing Shi China, Dalian University of Technology Dalian Shi China, Northwestern Polytechnical University Xi’an Shi China, Wuhan University Wuhan City China

2026-06-24视觉感知

针对多模态大模型在指向式视觉定位中易忽视手势几何约束、出现显著性偏差和定位幻觉的问题,PointVG-R将手部检测、指尖关键点、指向射线与目标语义串成视觉CoT,并用EgoPoint-CoT、SFT+RL及基于组方差的自适应奖励加权来稳定坐标学习;实验称在第一视角指向定位上达到SOTA,mIoU较基线提升15.86点。

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization Figure 1
2026-06-24cs.CV

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

Shenzhen University, Tencent Youtu Lab, Shenzhen MSU-BIT University

2026-06-24视觉感知

针对现有 MLLM 图像篡改定位依赖外部分割器、空间信号在拼接管线中被削弱的问题,ForensicsTok 将掩码定位改写为自回归空间 token 生成,并用 TSD 稳定 token 到二值掩码的解码、用 HEF 注入多尺度取证特征。六个基准上,它显著优于 MLLM 基线,并较强取证专家模型有小幅提升,同时在扰动下更稳健。

VisCritic: Visual State Comparison as Process Reward for GUI Agents Figure 1
2026-06-24cs.CV

VisCritic: Visual State Comparison as Process Reward for GUI Agents

Jiachen Qian

City University of Hong Kong, isting trajectories without additional human labels for critic training.

2026-06-24强化学习

这篇论文针对 GUI 智能体长程操作中缺少逐步校验、一次点错会级联失败的问题,提出将动作前后截图的视觉状态差异作为过程奖励信号。VisCritic 用孪生 ViT 提取变化表征,并以动作感知 critic 同时预测成功、进展和错误类型,弱监督数据来自已有轨迹。五个网页、移动和桌面基准显示其可作为即插即用模块,通常提升指标并多数情况下优于文本式 PRM,同时提供变化区域诊断;但细粒度文字变化和动态噪声仍是限制。

What Do Flow-Based Inverse Solvers Approximate? A Posterior-Transport View Figure 1
2026-06-24cs.CV

What Do Flow-Based Inverse Solvers Approximate? A Posterior-Transport View

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

South China University of Technology, Columbia University

2026-06-24生成模型优化算法

论文针对 FlowDPS、FLOWER、PnP-Flow 等基于流匹配先验的逆问题求解器缺少后验解释的问题,指出确定性流中的贝叶斯条件化应发生在源分布重加权而非轨迹漂移上,并将现有引导项统一为最小动能校正场的不同近似。闭式 2D 实验证明源重加权可贴近真实后验,而轨迹引导误差高出 200–800 倍且易塌缩模态;其轻量速度校正器在图像恢复中质量有竞争力,并能给出与误差相关的不确定性。

GeoIMO: Geometry-Driven Independent Motion Classification for Event Cameras Figure 1
2026-06-24cs.CV

GeoIMO: Geometry-Driven Independent Motion Classification for Event Cameras

Anil Bayram Gogebakan, Filippo Marostica, Alessio Caviglia, Alessandro Savino, Stefano Di Carlo

2026-06-24视觉感知

这篇论文针对事件相机自动驾驶数据集中“有框但不区分是否真正运动”的标注错位问题,提出不依赖学习和人工运动标签的 GeoIMO:用带偏航补偿的 FOE 几何模型估计自车诱导的全局背景运动,再以目标框内局部运动相对预测的尺度不变残差判定独立运动,并做时间稳定化。MVSEC 与 Prophesee 实验显示其在多种驾驶场景下表现稳定,转弯时偏航补偿带来改进,简单平移局部模型在精度与效率间较优。

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection Figure 1
2026-06-24cs.CV

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

Ling Li, Zhizhen Cai, Xinkun Wu, Ziyu Zhu, Jiaqing Lyu, Bowen Liu, Zhidong Deng

Tsinghua University, Beijing University of Posts and, Graduate School, Dalian University of Technology, AR and human-robot collaboration, providing a basis for seam-, cise physical spatial awareness for high-frequency collaboration in, robot collaboration [29, 39, 50, 61], and human–computer interface

2026-06-24视觉感知

本文关注指向式物体检测中 Transformer 对手指微小方向变化不敏感、易在远距离或密集目标中产生定位漂移的问题。VistaRef 的核心思路是把隐式指向几何显式化:用 LHEM 强化手部/指尖局部姿态建模,用 GRM 建模从手到目标的几何射线,并以 OCAL 约束方向一致性。实验称相对基线 grounding accuracy 绝对提升 14 个百分点,但具体增益在不同模块和数据因素间的归因仍需看完整消融。

RetiSEM: Generalising Causal Models for Fragmented Biomedical Data Figure 1
2026-06-24cs.CV

RetiSEM: Generalising Causal Models for Fragmented Biomedical Data

Inam Ullah, Imran Razzak, Shoaib Jameel

University of Southampton, Southampton, SO18 1PB, Hampshir, United Kingdom, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates, available at: https://github.com/Inamullah-Colab/, are rarely available jointly at the participant level [Acosta, clinical and physiological information [National Center for

2026-06-24视觉感知

针对临床、分子与眼底影像常分散且难以联合观测的问题,RetiSEM将变量按生物学先验分块,用禁边约束的结构方程模型恢复因果图,并分解总效应、直接效应和间接效应来检验视网膜表型的通路角色。十组合成基准中其结构误差更低、因果准确率更高;真实碎片化数据表明视网膜特征主要是下游生物标志物,间接中介信号较小但可检测。

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods Figure 1
2026-06-24cs.CV

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University, WeChat Vision, Tencent Inc., South China University of Technology, dArt), which provides highly accurate and controllable synthetic Wor-, and data are available at https://github.com/YesianRohn/WATER.

2026-06-24视觉感知数据集/基准

本文针对艺术字场景文本识别中字体、纹理和版式高度不规则、现有STR数据和固定尺寸模型难以覆盖的问题,构建2M规模合成数据WATER-S:一部分由SynthWordArt可控渲染,另一部分用Qwen3-VL挖掘提示并由Z-Image生成以提升真实多样性;同时提出支持任意形状输入、采用RoPE视觉编码和自回归解码的WATERec。在去重后的真实数据WATER-R配合下,WordArt-Bench准确率达90.40%,显著超过通用及OCR专用VLM,但增益可能主要来自data scaling与专用架构共同作用。

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction Figure 1
2026-06-24cs.CV

MambaRaw: Selective State Space Modeling for Efficient 4K Raw Image Reconstruction

Peize Li, Fanhu Zeng, Tongda Xu, Xingguo Xu, Xinjie Zhang, Xingtong Ge, Haotian Zhang, Yan Wang

Institute for AI Industry Research (AIR), Tsinghua University, King’s College London, Dalian University of Technology, Hong Kong University of Science and Technology, School of Computer Science, Peking University

2026-06-24视觉感知三维

MambaRaw针对4K RAW重建中卷积感受野有限、注意力代价过高的问题,利用相机内JPEG预览作为参考,在元数据式重建框架中引入SSM熵参数估计。其核心是空间-能量耦合上下文建模:TileMambaBlock只扫描信息密集块,EAR按RAW长尾能量分布细化特征。Sony、Olympus、Samsung实验显示其在低元数据码率下较强基线提升约1.2–1.4 dB PSNR,并降低约9%端到端编码延迟。

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding Figure 1
2026-06-24cs.CV

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

Yixuan Li, Guangzhi Sun, Yudong Yang, Wei Li, Zejun MA, Chao Zhang

Tsinghua University, University of Cambridge

2026-06-24视觉感知

这篇工作针对视频 LLM 受算力与显存限制、低帧率/低分辨率易漏掉关键细节的问题,将“先粗看定位、再高保真重看”的范式做成端到端模型。核心创新是不依赖 CoT 冷启动标注,而用强化学习学习重看策略,并通过 re-answer 先答后修正、re-ask 重注入问题来缓解预训练模型行为不匹配和因果注意力限制。实验显示其优于基座模型、QA-SFT 和既有重看方法,且计算成本更低。

Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation Figure 1
2026-06-24cs.CV

Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation

Tianyu Zhu, Yingping Liang, Hesong Li, Ying Fu

Beijing Institute of Technology, Beijing, China, performance across multiple RVOS benchmarks. The code is available at, rely on predefined labels and lack flexibility in open-world scenarios. Recently, cient and scalable manner. Rather than modeling complex temporal dynamics

2026-06-24视觉感知

针对文本驱动视频目标分割常依赖2D预训练和朴素分割损失、难以保持跨帧几何一致的问题,论文提出GeoLaV:先用单图新视角合成做单目几何预训练,再用VGGT/π3等3D教师进行几何感知蒸馏,把结构先验注入视频模型。仅图像训练已在零样本RVOS上明显优于SAMWISE,完整模型在消融中由65.1提升到70.5 J&F,并声称多基准达到SOTA。

Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching Figure 1
2026-06-24cs.CV

Lite Any Stereo V2: Faster and Stronger Efficient Zero-Shot Stereo Matching

Junpeng Jing, Ronglai Zuo, Zhelun Shen, Shangchen Zhou, Rolandos Alexandros Potamias, Stefanos Zafeiriou, Krystian Mikolajczyk, Jiankang Deng

world pseudo supervision, we further introduce pseudo-label, available at https://tomtomtommi.github.io/LiteAnyStereoV2/., Mikolajczyk, and J. Deng are with Imperial College London, London SW7, strategy. After supervised training on synthetic labeled data, perturbations. We then exploit real-world unlabeled stereo, introduce a pseudo-label filtering mechanism and an error-, clamping operation, which help suppress noisy labels and

2026-06-24视觉感知

面向机器人、自动驾驶等受算力约束场景,本文试图打破“轻量双目难以零样本泛化”的假设。LAS2用面向真实延迟优化的纯2D代价聚合替代重3D聚合,并结合合成监督、自蒸馏、真实无标注双目的教师蒸馏,以及伪标签过滤和误差截断。结果显示LAS2-M在四个真实基准上优于LAS且在H200/Orin更快,LAS2-H整体超过Fast-FoundationStereo并显著降延迟。

SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking Figure 1
2026-06-24cs.CV

SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking

Mohamad Alansari, Yonathan Michael, Hasan AlMarzouqi, Muzammal Naseer, Naoufel Werghi, Sajid Javed

Khalifa University, Abu Dhabi, UAE, University of Western Australia, Australia, source SAM2-based trackers across all available scales and datasets, fill-

2026-06-24视觉感知

这篇论文针对 SAM2 系视觉跟踪在遮挡、快速运动和干扰物下易因“只按置信度写入记忆”而漂移的问题,提出训练-free 的 SENTRY:在写入记忆前对候选掩码做短时回溯、邻域感知匹配和循环一致性验证。结果显示其可插入五个 SAM2 基线,在九个基准上稳定提升,并在 LaSOT、GOT-10k、VOT20/22、DiDi 等取得零样本 SOTA,同时保持实时速度和较小显存开销。

P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling Figure 1
2026-06-24cs.CV

P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling

Le Xiang, Chenxi Zhai, Shu Wei, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He

Department of Computer Vision Technology (VIS), Baidu Inc., China, Tsinghua University, Shenzhen International Graduate School, China

2026-06-24视觉感知

针对文档解析中 VLM 自回归生成在长文本、密集版面下延迟高的问题,P-MTP 将多 token 预测用于更深前瞻,并用渐进课程损失按路径可靠性和目标一致性抑制远距离预测噪声,推理时再以置信度门控动态决定草稿长度。多基准结果显示其在解析精度几乎不降的情况下最高实现约 5× 加速。

S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing Figure 1
2026-06-24cs.CV

S1-Omni-Image: A Unified Model for Scientific Image Understanding, Generation, and Editing

Qingxiao Li, Zikai Wang, Qingli Wang, Nan Xu

XScience Lab

2026-06-24视觉感知

科学图像不仅要“好看”,还要保持术语、结构关系和任务意图正确,通用生成模型容易在图表、医学分割等场景失真。S1-Omni-Image的核心是让S1-VL-32B先进行任务推理,再把隐藏状态对齐注入MMDiT生成/编辑模块,并用31.4万样本SciGenEdit训练。实验显示其在GenExam、TechImageBench及MSD、cigRockSEM、SynthRAD2025、IXI等编辑基准优于开源基线,同时基本保留科学图像理解能力。

MedPCFM: Improving Medical Point Cloud Completion by Integrating Point Transformers and Flow Matching Figure 1
2026-06-24cs.CV

MedPCFM: Improving Medical Point Cloud Completion by Integrating Point Transformers and Flow Matching

Kamil Kwarciak, Marek Wodzinski

Department of Measurement and Electronics, AGH University of Krakow, Krakow, Sano Centre for Computational Medicine, Krakow, Poland

2026-06-24生成模型三维

这篇论文面向医学三维重建中缺损解剖点云难以唯一补全、扩散采样代价高的问题,提出以 Point Transformer V3 表征条件速度场的流匹配方法 PCFM,并与确定性 PTv3 编码器-解码器、PVCNN/PTv3 扩散基线做匹配比较。结果显示,PCFM 在 SkullFix、SkullBreak 和 Mandibular Defect 上取得最强生成式表现,接近确定性 PTv3,且采样步数更少、速度最高约提升 7 倍;但部分增益可能来自 PTv3 backbone 与点数/模型 scaling。

Transformation Behavior of Images in Latent Space Figure 1
2026-06-24cs.CV

Transformation Behavior of Images in Latent Space

Christian Zöllner (1), Mozzam Motiwala (1), Aysel Ahadova (1), Gerrit Anders (4), Robert Hüneburg (2 and 3), Jacob Nattermann (2 and 3), Matthias Kloor (1) ((1) Department of Applied Tumor Biology Institute of Pathology Heidelberg University Hospital, (2) National Center for Hereditary Tumor Syndromes University Hospital Bonn, (3) Department of Internal Medicine I University Hospital Bonn, (4) Leibniz Institut für Wissensmedien)

aDepartment of Applied Tumor Biology, Institute of Pathology, Heidelberg University, bNational Center for Hereditary Tumor Syndromes, University Hospital, cDepartment of Internal Medicine I, University Hospital Bonn, Venusberg-Campus, There are several encoder networks available, either, rendering networks invariant to label-irrelevant transformations., the latent space, using networks provided by Lunit Inc. and Bioptimus, both, stained sections available in a colorectal tissue dataset and the publicly ac-, sonalized treatment plans. However, the scarcity of labeled data poses a ma-, tion, and embedder networks, which enhance the usability of available data, of training samples Si and corresponding labels Li, a transformation Tj is, i which still matches the original label, cost-intensive effort of labeling: so-called embedder networks are trained

2026-06-24视觉感知

本文关注病理图像编码器在常见增强后是否真正保持潜空间不变,以解释数据增强为何仍有价值。作者直接比较原图、变换图与随机图块的嵌入距离,指出现有编码器仅具鲁棒性而非不变性:变换后嵌入仍发生非零漂移,颜色变换影响大于空间翻转,病理专用模型较 ImageNet 通用模型更稳定,并暴露出特征解耦不足的问题。

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding Figure 1
2026-06-24cs.CV

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

2026-06-24数据集/基准

面向可穿戴/具身助手的实时交互理解,EgoSAT指出仅做离线视频问答难以评估模型在流式场景中对已发生、正在发生和将发生事件的统一推理。其核心是把回溯问答、在线理解和未来预测放入只可访问历史帧的同一协议,并引入可回答性与置信度校准诊断。基于165小时Ego4D视频和约4800个问答,实验显示现有开闭源VLM在前瞻预测和回溯检索上仍弱,流式模型落后离线模型,且常出现高置信错误。

Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition Figure 1
2026-06-24cs.CV

Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition

Lars Doorenbos, Duc Manh Vu, Serdar Ozsoy, Juergen Gall

University of Bonn, Germany, Lamarr Institute for Machine Learning and Artificial Intelligence, Germany

2026-06-24视觉感知

针对多模态动作识别中现有 OOD 检测在推理时仍套用单模态打分、未利用模态关系的问题,论文发现 ID 样本的单模态预测聚合与多模态预测高度相关,而 OOD 会破坏这种关系,并据此构建后验的模态感知混合检测器,结合该关系信号、特征空间离群分数与多模态 logits 归一化。实验在 MultiOOD 五个数据集、14 组设置上平均优于既有方法,Kinetics-600 Far-OOD 上 FPR 较 SOTA 降低 6.2。

Female-RHINO: A Real-Time Scanner-Integrated Framework for Automated Quantitative Uterine MRI Analysis and Structured Reporting Figure 1
2026-06-24eess.IV

Female-RHINO: A Real-Time Scanner-Integrated Framework for Automated Quantitative Uterine MRI Analysis and Structured Reporting

Deepak Bhatia, Saad Ahmad, Smiti Tripathy, Maria Camila Bustos Vivas, Lieselotte Kratzsch, Anika Knupfer, Jordina Aviles Verdera, Susanne Schulz-Heise, Matthias May, Jana Hutter

multi-center datasets spanning diverse protocols, vendors, pleted in under 70 seconds, enabling availability of results, J Aviles Verdera and J Hutter are with School of Biomedical Engineer-, J Aviles Verderas, A Knupfer and J Hutter are with Institute for Infor-, mation Processing, Leibniz University Hannover, Germany and CAIMed, L3S research institute, Hannover, Germany, M May is with Imaging Science Institute, Uniklinik Erlangen, Ulmen-, center MRI examinations spanning heterogeneous acquisition, Protocol I consists of a large publicly available dataset of, Each protocol includes segmentation labels for four clini-, labels are illustrated in Fig. 1C. All segmentation masks, In addition to segmentation labels, a set of anatomically

2026-06-24视觉感知

针对子宫 MRI 定量评估依赖人工、缺少扫描中反馈且报告不标准的问题,Female-RHINO 将 MRI 扫描仪内联通信与 3D 分割、解剖标志点检测结合,自动输出子宫/病灶体积、肌瘤和纳氏囊肿量化及结构化报告。其在 500 余例多中心数据上训练评估,子宫和肌瘤 Dice 分别为 0.82、0.80,标志点误差 3.7 mm,端到端耗时低于 70 秒。

MATCH: Flow Matching for Multi-View Anomaly Detection Figure 1
2026-06-24cs.CV

MATCH: Flow Matching for Multi-View Anomaly Detection

Mathis Kruse, Melissa Schween, Bodo Rosenhahn

2026-06-24视觉感知生成模型

面向复杂工业件单视角难以覆盖缺陷的问题,MATCH 将 Flow Matching 引入多视角异常检测,用 ODE 似然构造对象、图像和像素级异常分数,并利用其架构灵活性处理多尺度特征;同时省略昂贵散度项以提升实时性。实验在 Real-IAD 与 MANTA-Tiny 上取得检测和分割 SOTA,并在消费级 GPU 上约 18.77 FPS,但进一步融合 3D 约束仍留待未来工作。

Structural Kolmogorov-Arnold Convolutions: Learnable Function on the Values or the Filter Shape as Parameter-Efficient Alternative to Per-Edge Convolutional KANs Figure 1
2026-06-24cs.CV

Structural Kolmogorov-Arnold Convolutions: Learnable Function on the Values or the Filter Shape as Parameter-Efficient Alternative to Per-Edge Convolutional KANs

Stefano Mereu, Oleksandr Kuznetsov, Gabriele Marchello, Alessandro Galdelli, Emanuele Frontoni, Adriano Mancini, Ferdinando Cannella

bDepartment of Informatics, Bioengineering, Robotics and Systems Engineering (DIBRIS), University of Genoa, 16145 Genoa, Italy, cDepartment of Theoretical and Applied Sciences (DISTA), eCampus University, Via, dDepartment of Intelligent Software Systems and Technologies, School of Computer, Science and Artificial Intelligence, V. N. Karazin Kharkiv National University, 4 Svobody, eDepartment of Information Engineering, Marche Polytechnic University, 60131 Ancona

2026-06-24视觉感知

针对现有卷积 KAN 为每个卷积核位置配置独立一元函数而参数重、易过拟合的问题,论文提出把可学习函数从“边”移到卷积结构中,并按作用于像素值或滤波器形状组织 SV-KAN、AG-KAN 与 RF-KAN。核心洞察是函数放置位置比函数数量更关键:RF-KAN 用 Morlet 小波岭函数学习滤波器形状并引入内容自适应幅值。四层 CIFAR 实验中,RF-KAN/SV-KAN 以约 0.4M 参数超过普通卷积和多种 per-edge KAN,CIFAR-10 约 88.5%,CIFAR-100 约 64.6%。

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks Figure 1
2026-06-24cs.CV

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

2026-06-24视觉感知数据集/基准

针对现有手语翻译/识别数据多来自固定视角、单一背景和少量签者,模型在真实部署中易受分布偏移影响,SignNet-1M用3DGS新视角渲染、扩散式背景/身份编辑和视频扰动构建约100万多语种增强片段,并配套按视角、背景、身份等因素分层的下游基准。实验显示,用该数据训练可提升跨视角、跨背景、跨身份及后渲染扰动下的泛化,同时基本保持原分布性能;但具体增益可能主要来自更大规模和结构化增强的共同作用。

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints Figure 1
2026-06-24cs.CV

Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints

Hojun Choi, Seulbin Hwang, Dae Jung Kim, Kisung Kim, Hyunjung Shim, Jinhan Lee

2026-06-24视觉感知优化算法三维

这篇论文针对自动驾驶 BEV 感知长期依赖闭集类别、遇到训练外物体会形成语义盲区的问题,提出开放词汇 BEV 分割任务与 OVBEVSeg。核心洞察是避免把噪声 2D VLM 结果直接反投影到 3D,而用可靠 3D 结构约束语义投影、逐场景优化并蒸馏到在线模型。在 nuScenes 上,方法在未见类别上较闭集方法提升 15.3 mIoU,推理速度为投影式方法的 2.5 倍且显存仅 0.22 倍。

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration Figure 1
2026-06-24cs.CV

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration

Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou

2026-06-24视觉感知生成模型

本文针对人脸视频修复中身份漂移、参考图视角与表情纠缠、一步生成易损失真实感的问题,提出 TIGER:用 ArcFace 身份嵌入锚定主体,以跨源 3D 参数融合生成时序一致的几何法线,并用一步 rectified flow 调用视频生成先验;配合三阶段训练和新构建的 28,491 样本数据集,实验显示其在身份保持、感知质量和时序稳定性上优于现有方法。

Ill-Posed by Design: Probing Evidence Use in VLMs Figure 1
2026-06-24cs.CV

Ill-Posed by Design: Probing Evidence Use in VLMs

Boaz Meivar, Shaked Perek, Shani Shvartzman, Eli Schwartz, Shai Avidan

Tel Aviv University

2026-06-24视觉语言三维

本文动机是指出常规反事实干预在“答案已由多线索充分决定”的任务上难以诊断 VLM 真正用到的证据。作者把单目物体真实尺寸估计设计成先天欠定的诊断任务,构建 Metric VQA 并用六类视觉/语言干预拆解证据来源。结果显示,开放 VLM 在野外场景中甚至落后于纯文本强 LLM,主要依赖目标身份,较少稳定利用像素、上下文和全局几何;LoRA 虽能提升任务表现,但未学会利用场景几何。

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation Figure 1
2026-06-24cs.CV

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

2026-06-24视觉感知

这篇论文针对图中机器翻译中级联 OCR-MT-编辑易累积错误、统一多模态模型又存在理解与生成语义不一致及文本位置错位的问题,提出 UniTranslator:用 UGAM 对齐翻译理解与渲染表示,并用 SMD 以像素级文本区域监督增强空间控制。实验显示其在 Translatotron-V、IIMT30k、PRIM 等基准上整体提升 BLEU/COMET 与 FID,尤其改善真实场景中的翻译准确性和视觉保真。

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching Figure 1
2026-06-24cs.CV

REDI-Match: Rotation-Equivariant Distillation for Efficient and Robust Dense Matching

Yinji Ge, Guixu Zheng, Wulong Guo, Qian Feng, Xu Wu, Kai Zhou, Xinyuan Liu, Fei Xing

Tsinghua University, Southern University of Science and Technology, Beihang University, Zhejiang University

2026-06-24安全鲁棒

这篇论文针对稠密匹配在大幅平面旋转下容易失效、而数据增强或纯等变网络难兼顾语义与几何一致性的问题,提出将视觉基础模型语义蒸馏到轻量旋转等变编码器的 REDI,并用熵驱动模块显式选择旋转假设后再细化匹配。实验显示其在多类旋转基准上达到 SOTA,SatAst 位姿精度绝对提升 13.89%,且较 RoMa v2 快 1.9 倍、约 41 FPS。

TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation Figure 1
2026-06-24cs.CV

TrOCR for Medieval HTR: A Systematic Ablation Study with Cross-Dataset Validation

Sachin Sharma, Michele Flammini, Federico Simonetta

2026-06-24数据集/基准

本文针对中世纪手稿HTR中预训练TrOCR与历史书写域差异大、标注数据少的问题,系统消融对比CLAHE预处理、数据增强和编码器/解码器层冻结,并在Cortonese与READ-16上交叉验证。结果显示最佳CER约8.03%,去除CLAHE仍达7.84%,浅层冻结影响不显著但深度冻结退化,且解码器冻结阈值比编码器更可迁移。

No Figure
2026-06-24cs.CV

MM-TRELLIS: Point-Cloud Guided Multi-Modal 3D Vehicle Generation in Autonomous Driving

Hongli Xiao, Youjian Zhang, Yucai Bai, Chaoyue Wang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

2026-06-24三维

面向自动驾驶仿真与训练数据生成,论文针对现有车辆重建难以同时利用多视图图像和 LiDAR、且网格质量偏低的问题,提出 MM-TRELLIS:在 TRELLIS 的原生 3D 扩散先验上循环注入多视图条件,并用点云在测试时对齐朝向、约束去噪几何,再以 3DGS 不透明度过滤浮点伪影。Waymo 实验显示其在真实场景车辆生成的几何一致性和网格质量上优于既有方法。

Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching Figure 1
2026-06-24cs.CV

Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching

Sujun Sun, Mingwu Ren, Haofeng Zhang

2026-06-24视觉感知安全鲁棒

针对跨域少样本分割中现有方法依赖源域训练或目标微调、在引入视觉基础模型后仍易过拟合的问题,本文提出基于 DINOv3 的免训练框架,通过语义感知特征重融合、查询信息增强支持特征,以及全局/区域/像素混合原型匹配来提升跨域语义对齐与鲁棒性。四个目标域实验显示其无需训练即可超过当前 CD-FSS 方法,但具体增益中 DINOv3 scaling 贡献占比仍未充分说明。

Hierarchical Spatial and Channel Aggregation for Cross-domain Few-shot Segmentation Figure 1
2026-06-24cs.CV

Hierarchical Spatial and Channel Aggregation for Cross-domain Few-shot Segmentation

Sujun Sun, Mingwu Ren, Haofeng Zhang

2026-06-24视觉感知

本文针对跨域少样本分割中源域训练导致的语义粒度过对齐和属性过对齐问题,提出 DHANet:分别在空间维做层次区域聚合、在通道维做层次属性聚合,并在测试时用在线概率语义库从高置信查询预测中采样伪原型补充支持信息。实验称在四个目标域数据集上达到 SOTA,但具体增益拆分与失败场景仍需看完整表格验证。

ActiveScope: Actively Seeking and Correcting Perception for MLLMs Figure 1
2026-06-24cs.CV

ActiveScope: Actively Seeking and Correcting Perception for MLLMs

Yajing Wang, Chao Bi, Junshu Sun, Shufan Shen, Zhaobo Qi, Shuhui Wang, Qingming Huang

2026-06-24视觉感知

本文针对高分辨率图像中 MLLM 细粒度感知易被显著干扰物误导、且多目标定位不完整的问题,指出关键瓶颈是上下文支配和语义偏置。ActiveScope 以训练无关方式引入语义锚定位和干扰抑制式迭代校正,分别解耦多目标注意力并遮蔽错误区域重定位;在 V* Bench、HR-Bench 4K/8K 上优于现有训练无关方法,V* Bench 准确率达 96.34%。

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression Figure 1
2026-06-24cs.CL

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

Gaoling School of Artificial Intelligence, Renmin University of China 2 Huawei Inc.

2026-06-24视觉感知

针对长时音视频理解中上下文窗口受限、原始音视频 token 冗余且稀疏采样易漏关键信息的问题,AVOC 将多模态 token 压缩重述为固定预算下的 top-K 检索,结合查询相关性、跨音视频重要性和时间感知多样性选择信息子集。实验显示其在 OmniVideoBench、LVOmniBench 平均准确率分别领先次优 4.9、5.5 分,并能处理最长一小时的针尖检索任务。

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance Figure 1
2026-06-24cs.CV

UniRED: Unified RGB-D Video Frame Interpolation with Event Guidance

Yinuo Zhang, Guangshun Wei, Yuanfeng Zhou, Yiran Shen

2026-06-24视觉感知

面向高速运动下 RGB-D 相机帧率不足、仅靠两端帧难以保持外观与几何一致的问题,UniRED 将 RGB、深度和事件流统一用于视频插帧:先融合三模态特征,再用运动基细化 RGB 双向光流、用 Z 轴细化深度,并通过双向 warping 与软融合生成中间 RGB-D 帧。论文还构建 RGB-D-Event 数据集;实验显示其在公开基准和新数据集上提升 RGB 光度质量与深度几何精度,但具体增益中数据贡献占比仍需进一步区分。

MotifGen: Spatiotemporal interpolation of misaligned satellite images via multi-source generative modeling, in an application to tropical cyclones Figure 1
2026-06-24cs.CV

MotifGen: Spatiotemporal interpolation of misaligned satellite images via multi-source generative modeling, in an application to tropical cyclones

Clément Dauvilliers (Inria), Claire Monteleoni (Inria)

2026-06-24视觉感知生成模型

针对热带气旋微波卫星观测重访周期长、不同传感器时间不规则且地理错位的问题,MotifGen将多源微波与红外观测纳入流匹配生成框架,并用随机遮蔽重建的自监督任务训练,以适配可变数量和异构来源。实验显示,自监督和加入红外均降低CRPS;最佳模型的集合均值在RMSE、MAE等指标上与确定性MoTiF基线相当或略优,同时功率谱更接近真实观测,保留更多中高频结构。

3DCarGen: Scalable 3D Car Generation via 3D-consistent Multi-view Synthesis Figure 1
2026-06-24cs.CV

3DCarGen: Scalable 3D Car Generation via 3D-consistent Multi-view Synthesis

Hongli Xiao, Youjian Zhang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

2026-06-24三维

面向自动驾驶仿真中单张真实车辆图像难以生成高保真三维资产的问题,3DCarGen的关键洞察是先用固定视角生成粗一致多视图,再以3DGS粗几何作为同步条件驱动任意视角扩散生成,并将ISOMER扩展为结合颜色与法线优化的ISOMER+。实验显示其在合成与真实数据上提升了跨视角几何一致性和网格重建质量。

Social Structure Matters in 3D Human-Human Interaction Generation Figure 1
2026-06-24cs.CV

Social Structure Matters in 3D Human-Human Interaction Generation

Zhongju Wang, Beier Wang, Yatao Bian, Pichao Wang, Zhi Wang, Daoyi Dong, Hongdong Li, Huadong Mo, Zhenhong Sun

University of New South Wales, National University of Singapore, Nanjing University, University of Technology Sydney, Australian National University

2026-06-24三维

本文针对文本驱动三维双人交互生成中仅拼接单人动作会导致阶段错位、接触失败和角色不一致的问题,提出把 HHI 建模为“社会结构”规划与落地:LLM 负责分解交互阶段并分配双方角色,Solo-to-Social 执行器用 LoRA、自条件和自我坐标系下的伙伴条件改造单人运动模型。实验称在标准 HHI 基准上提升文本对齐、阶段一致性和伙伴协同,但具体增益来源仍需结合消融进一步判断。

TuringViT: Making SOTA Vision Transformers Accessible to All Figure 1
2026-06-24cs.CV

TuringViT: Making SOTA Vision Transformers Accessible to All

Qiman Wu, Hanlin Chen, Lyujie Chen, Rui Xin, Jianlei Zheng, Mingyuan Wang, Jiahui Hu, Da Zhu, Yuecheng Ma, Yuhua Wei, Yizhao Wang, Hua Zhou, Yuheng Zhang, Anhua Liu, Shaman Tang, Yue He, Pengfei Diao, Shuang Su, Haotong Xin, Weichao Huang, Hang Zhang, Xianming Liu

Foundation Model Team, Xpeng Inc.

2026-06-24视觉感知

这篇论文针对现有视觉编码器在高分辨率、动态分辨率和下游 VLM/VLA 定制中训练成本高、数据依赖重的问题,提出 TuringViT:以 Turing Linear Attention 替代大部分 softmax 注意力,结合 VISTA 图像-视频数据筛选与原生动态分辨率预训练。结果显示其用约 10% 数据超过 SigLIP2 等开源 ViT,在零样本分类、检索和下游多模态任务中更强,并在高分辨率推理延迟上呈更接近线性的扩展。

M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection Figure 1
2026-06-24cs.CV

M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection

Wei Bao, Siqi Li, Shouan Pan, Yi Xie, Yue Gao

2026-06-24视觉感知

本文针对事件相机目标检测中事件数据稀疏、语义弱,导致与RGB检测器存在性能差距的问题,提出M²C-EvDet跨模态蒸馏框架。其核心是将RGB教师知识按频域解耦为低/高频语义,并用超图式注意力蒸馏低阶与高阶目标关系,从而超越仅做空间或成对关系蒸馏的方法。在三个RGB-Event检测数据集上验证有效,DSEC-Detection上提升3.6 mAP并刷新SOTA。

Automated Residual Plot Assessment With the R Package autovi and the Shiny Application autovi.web Figure 1
2026-06-24stat.ML

Automated Residual Plot Assessment With the R Package autovi and the Shiny Application autovi.web

Weihao Li, Dianne Cook, Emi Tanaka, Susan VanderPlas, Klaus Ackermann

Monash University, The Australian National University and, University of Nebraska, \addressnum 1 Department of Econometrics and Business, Statistics, Monash University, Wellington Road, VIC 3800, Australia, \addressnum 2 Research School of Finance, Actuarial Studies and, Statistics, The Australian National University, CBE Building 26C, \addressnum 3 Department of Statistics, University of Nebraska, Hardin

2026-06-24视觉感知

这篇论文针对线性模型残差图诊断依赖人工目视判断、难以规模化且分析者间不一致的问题,提出用计算机视觉模型自动预测视觉信号强度(VSS),并封装为 R 包 autovi 与 Shiny 应用 autovi.web。其核心洞察是把残差图中的模型违背模式转化为基于 KL 距离的连续可学习目标,在模拟的非线性、异方差、非正态等场景上训练模型;主要结果是提供可直接用于残差样本评估的工具链,并输出 VSS 及辅助信息以支持模型拟合诊断。

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection Figure 1
2026-06-24cs.CV

From Open Waters to Enclosed Cabins: ProteusVPR for Cross-Scene Visual Place Recognition in Maritime Perception and Cabin Inspection

Zexi Chena, Zitai Huang, Qiwen Gu, Zhiqi Li, Shengli Dong, Chenlei Wang, Junqiao Zhao, Hongdong Wang, Bing Han

2026-06-24视觉感知

本文针对船舶机器人在甲板与舱室间切换时,视觉地点识别易受稀疏纹理、光照变化和舱内重复结构干扰的问题,提出ProteusVPR:不替换现有VPR骨干,而在检索后加入融合相邻帧、几何描述、局部仿射坐标和相机方位的位姿细化网络。作者还构建8K全景船载XHZ数据集;实验显示该框架可在多种VPR模型上稳定降低定位误差,平均均值误差降幅超过60%,但部分已较准检索场景的分位误差会轻微退化。

Latent Visual States for Efficient Multimodal Reasoning Figure 1
2026-06-24cs.CV

Latent Visual States for Efficient Multimodal Reasoning

Xiuwei Chen, Wentao Hu, Yongxin Wang, Zisheng Chen, Likui Zhang, Kun Xiang, Jianhua Han, Hui-Ling Zhen, Jingyuan Zou, Hang Xu, Xiaodan Liang

Sun Yat-sen University, The Hong Kong Polytechnic University, Huawei Noah’s Ark Lab, Yinwang Intelligent Technology Co. Ltd

2026-06-24视觉语言

针对多模态模型依赖外部裁剪、检测等离散工具带来的推理中断、不可端到端优化和高延迟问题,论文提出 EVA,让模型生成自适应连续 Latent_slot 作为内部视觉思考,并用显著性加权、三阶段训练和 D-GSPO 稳定潜在/文本联合优化;在多项视觉推理基准上取得一致性能提升,同时较工具调用范式降低推理延迟。

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image Figure 1
2026-06-24cs.CV

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

Codec Avatars Lab, Meta, School of Computing, KAIST

2026-06-24视觉感知三维

FiCA针对高保真可驱动头像依赖多视角采集、离线跟踪和个体优化的问题,提出从单张人像直接生成Gaussian Codec Avatar的前馈流程。其关键在于用人体视觉基础模型提取局部UV、法线和顶点信息,再由扩散模型补全纹理与几何,并用前馈网格细化保持身份细节,最后经通用先验解码为可实时驱动的3D高斯头像。实验显示其在多身份和表情上视觉与定量结果优于近期单图方法,单图生成约5秒完成。

No Figure
2026-06-24cs.CV

Geometry-Instructed Video Editing

Chirui Chang, Xiaoyang Lyu, Yi-Hua Huang, Haoru Tan, Shizhen Zhao, Yikang Ding, Jianmin Bao, Xin Tao, Pengfei Wan, Xiaojuan Qi

The University of Hong Kong, The University of Hong Kong Hong Kong Hong Kong

2026-06-24视觉感知

这篇论文针对生成式视频编辑中物体平移、旋转、缩放、删除等几何操作难以在时间和视角上精确执行、且阴影反射等次生效果不一致的问题,提出 GIVE:用编辑前后的深度框和朝向框表示物体 3D 状态转移,避免逐视频重建。作者还用 Unreal Engine 构造受控前后配对数据训练与评测;结果显示其在 GIVE-Bench 的 PSNR/SSIM/LPIPS 和真实视频用户偏好上优于基线,但增益可能部分来自合成数据规模与覆盖度。

MorVess: Morphology-Aware Pulmonary Vessel Segmentation Network Figure 1
2026-06-24cs.CV

MorVess: Morphology-Aware Pulmonary Vessel Segmentation Network

Fuyou Mao, Yifei Chen, Beining Wu, Lixin Lin, Jinnan Dai, Zhiling Li, Yilei Chen, Yaqi Wang, Hao Zhang, Yan Tang, Huiyu Zhou, Feiwei Qin

2026-06-24视觉感知

肺血管在 CT 中细小、稀疏且拓扑复杂,常规逐体素掩码监督容易漏分支、断连。MorVess 的核心是把血管距离图、厚度图等可微几何先验与掩码联合预测,并用轻量 2.5D 适配器将 SAM 引入体数据,再通过全局-局部融合强化多尺度结构一致性。文中在两个肺部 CT 基准上报告 Dice、clDice 和 HD95 均优于对比方法,尤其改善小血管恢复与连通性。

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation Figure 1
2026-06-24cs.CV

Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation

Chang Liu, Mingwen Shao, Xiang Lv, Xinyuan Chen, Lingzhuang Meng, Qiao Zhang, Zhengyi Gong, Jinghao Hu

2026-06-24三维

这篇论文针对现有文本到三维方法偏向单物体、难以生成多物体合理接触关系且多视角优化易产生不一致的问题,提出 I2C-3D:先用 LLM 规划局部—全局三维布局并组合粗场景,再通过“包容式交互碰撞”约束高斯基元集中到合理交互区域,并用多视角自适应 SDS 调制注意力以增强跨视角一致性。实验显示其在组合三维资产质量、交互合理性和多视角一致性上优于对比方法。

Co-occurring associated retained concepts in Diffusion Unlearning Figure 1
2026-06-24cs.CV

Co-occurring associated retained concepts in Diffusion Unlearning

Miso Kim, Georu Lee, Yunji Kim, Hoki Kim, Jinseong Park, Woojin Lee

Dongguk University-Seoul, 2Chung-Ang University, 3Korea Institute for Advanced Study, anchors are commonly obtained from prompts drawn from external label sets (e.g., ImageNet) or

2026-06-24生成模型

这篇论文关注扩散模型概念遗忘中的过度删除问题:擦除裸体、风格或物体时,模型也会压制“人”“星空”“淡水”等无害共现概念。作者提出 CARE 概念与 CARE score,并用 ReCARE 自动构建需保留的共现词表参与训练。实验显示其在裸体、梵高风格、Tench 遗忘任务上兼顾低攻击成功率、较好效用和最高 CARE 保留,训练开销也较低。

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling Figure 1
2026-06-24cs.CV

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China

2026-06-24视觉语言视觉感知三维

这篇论文针对长视频输入使多模态大模型推理成本和显存开销过高、而硬关键帧选择又难兼顾局部与全局理解的问题,提出免训练的 AdaQ,将帧选择建模为自适应准高斯采样,并利用帧-查询相似度方差调节 3σ 区间:局部问题收窄采样,全局问题扩大覆盖。实验覆盖4个MLLM和3种嵌入模型,显示其相对默认模型和SOTA选帧方法均有稳定增益,如Qwen3-VL-8B平均提升9.0%,且多数任务仅需1个超参数。

Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms Figure 1
2026-06-24cs.CV

Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms

Afifa Khaled, Said Jadid Abdulkadir, Majdy Mohamed Eltayeb Eltahir

Department of Computing, available at the end of the article, ever, most of the available scene understanding technologies, such as RGB-D cam-

2026-06-24生成模型三维

面向机器人、自动驾驶和医疗/数字孪生等场景中传感器只能获得遮挡、稀疏3D观测的问题,本文系统回顾2016—2026年3D场景补全从体素CNN到点云、隐式场、Transformer、扩散模型与3D Gaussian Splatting的演进,核心洞察是表示能力、内存/速度和生成先验之间的权衡决定方法路线;主要结果是给出方法分类、评测指标与部署挑战综述,并提出面向基础模型、4D补全、不确定性和绿色AI的研究议程,文中未报告新的定量增益。

Zero-Shot Test-Time Canonicalization using Out-of-Distribution Scoring Figure 1
2026-06-24cs.CV

Zero-Shot Test-Time Canonicalization using Out-of-Distribution Scoring

Dominik Lindner, Johann Schmidt, Tom Siegl, Martin Becker, Sebastian Stober

2026-06-24视觉感知

这篇论文针对预训练视觉模型在旋转、缩放、剪切等保持类别不变的仿射扰动下易失效、而重训或改架构成本高的问题,将测试时规范化重新解释为最小化 OOD 分数的零样本搜索。作者系统比较约二十种 OOD 分数和九类搜索策略,发现距离型分数配合随机搜索与局部细化整体最稳,并用门控机制避免已对齐样本被误变换,从而在保持 ID 精度的同时提升扰动输入鲁棒性。

Tri-Efficient Transfer Learning for Point Cloud Videos Figure 1
2026-06-24cs.CV

Tri-Efficient Transfer Learning for Point Cloud Videos

Yiding Sun, Dongxu Zhang, Jihua Zhu, Haozhe Cheng, Zhengqiao Li, Pengcheng Li, Chaowei Fang, Yonghao Dong, Lin Chen

2026-06-24视觉感知三维

本文针对点云视频迁移学习中标注成本高、参数冗余和显存瓶颈并存的问题,提出三重高效框架 PoinTriE:用刚体变换合成伪运动轨迹,并结合文本与2D投影进行几何-运动多模态自监督预训练;微调时冻结主干,仅训练带 LoRA 的时空侧网络并用梯度流掩码降显存。实验在动作识别和语义分割上取得新 SOTA,如 MSR-Action3D 94.37% 准确率、Synthia 4D 84.11% mIoU。

A Dual Edge Spatial Jacobian Image Graph for Interpretable Diabetic Retinopathy Grading Figure 1
2026-06-24eess.IV

A Dual Edge Spatial Jacobian Image Graph for Interpretable Diabetic Retinopathy Grading

Inam Ullah, Imran Razzak, Shoaib Jameel

University of Southampton, Mohamed bin Zayed University of Artificial Intelligence, University of Southampton Southampton United Kingdom, Mohamed bin Zayed University of Artificial Intelligence Abu Dhabi United Arab Emirates

2026-06-24视觉感知

本文针对糖尿病视网膜病变分级中“只给标签、难解释病灶与血管关系”的问题,提出双边空间–Jacobian图:一条边刻画病灶证据相对血管和黄斑区的空间关系,另一条边刻画图像嵌入对AutoMorph血管生物标志物的敏感性,并用轻量注意力融合。在2910张APTOS图像上,五分类QWK为0.8312、相邻等级准确率0.9330,转诊DR AUROC达0.9711;但全文图准确率未超过最强单一嵌入流,增益主要在可解释结构而非性能。

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models Figure 1
2026-06-24cs.CV

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

School of Software Technology, Zhejiang University, Ningbo, China, Zhejiang Key Laboratory of Digital-Intelligence Service Technology, China, The University of Queensland, St Lucia, QLD, Australia, Singapore Management University, Singapore, The University of Southern Queensland, Toowoomba, QLD, Australia

2026-06-24视觉语言

针对多模态大模型视觉 token 冗余导致推理延迟高、现有剪枝依赖单层注意力且易受位置偏置影响的问题,论文提出无需训练的 CLSE:从频域刻画视觉 token 跨 Transformer 层由高频结构细节向低频语义抽象的演化强度,并据此保留语义活跃 token。实验覆盖图像和视频基准,显示在激进压缩下可降低 FLOPs、KV cache 和延迟,同时保持或提升精度。

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement Figure 1
2026-06-24cs.CV

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement

Xiangqian Zhao, Xinyang Jiang, Zhipeng Xu, Lingfeng He, Zilong Wang, Dongsheng Li, De Cheng, Nannan Wang

Xidian University, Xidian University Shaanxi 710071 China

2026-06-24生成模型

本文针对基础视觉模型在有偏数据上依赖虚假相关、导致少数群体泛化差的问题,提出 D2CP:先用扩散模型解耦出的语义概念挖掘伪偏置属性,再以目标/偏置双分支提示调优和交叉零空间投影削弱偏置信息。四个基准上,其在无群组标注设置取得最优或强竞争的 worst-group accuracy,且仅调优最多 0.22% 参数。

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction Figure 1
2026-06-24cs.CV

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

School of Software Technology, Zhejiang University, Ningbo, China, Zhejiang Key Laboratory of Digital-Intelligence Service Technology, China, Hong Kong Polytechnic University, Hong Kong SAR, The University of Southern Queensland, Toowoomba, QLD, Australia

2026-06-24视觉语言

这篇论文针对MLLM推理中视觉token过多且现有注意力剪枝易受模型固有先验干扰的问题,指出无指令时模型也会偏向某些区域,导致任务相关证据被误删。PriorTR用空token在单次前向中估计先验,并以先验校正后的任务增量信息选择token,同时物理裁剪隐藏状态和KV缓存。多模型多基准实验显示其在激进token预算下改善精度—效率权衡,并降低延迟、显存和FLOPs。

Differential Unfolding: Efficient Unfolding Reconstruction for Video Snapshot Compressive Imaging Figure 1
2026-06-24cs.CV

Differential Unfolding: Efficient Unfolding Reconstruction for Video Snapshot Compressive Imaging

Muyuan Zhang, Jiancheng Zhang, Haijin Zeng, Yin-ping Zhao

2026-06-24视觉感知三维

本文针对视频快照压缩成像中深度展开网络各阶段重复使用高复杂度先验、后期特征更新趋于停滞而计算冗余的问题,提出 Differential Unfolding:用少量通用阶段做结构锚定,并以轻量差分阶段通过 DRP、DRA 和 DM-FFN 建模跨阶段变化。实验声称在多个 SCI 基准上达到新的 SOTA,同时显著降低参数量和 FLOPs。

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models Figure 1
2026-06-24cs.CV

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

Department of Computer Science and Technology, Tsinghua University, Beijing, China., Beijing National Research Center for Information Science and Technology, Beijing, China.

2026-06-24视觉感知强化学习规划控制

本文动机是指出视频生成虽能预测逼真画面,却未必具备可干预、可执行的机器人世界模型能力。核心洞察是以“反事实可控性”替代单纯视觉逼真度,提出生成、绑定、验证、蒸馏闭环,并用新颖性、一致性、OOD鲁棒性和效率联合评价。主要结果更像概念框架与指标定义,文中未充分说明实证增益。

Geometry-Aware Style Transfer in 3D Gaussian Splatting Figure 1
2026-06-24cs.CV

Geometry-Aware Style Transfer in 3D Gaussian Splatting

Min Hyeok Bang, Jun Hyeong Kim, Seung-Wook Kim, Se-Ho Lee

2026-06-24三维

这篇论文针对现有 3DGS 风格迁移多停留在颜色/纹理层面、几何改动易破坏场景的问题,提出将颜色参数与几何参数解耦交替优化,并用融合 RGB、深度和边缘的 GCFM 对比特征匹配,把风格图中的结构线索传到高斯基元。实验显示其在视觉保真度和定量指标上优于已有 3DGS 风格化方法,但具体增益在多大程度来自几何优化或多模态特征设计仍需更多消融支撑。

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image Figure 1
2026-06-24cs.CV

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Tongyan Hua, Dongli Wu, Jinjing Zhu, Yinrui Ren, Zhongcheng Hong, Ying-Cong Chen, Hui Xiong, Wufan Zhao

2026-06-24视觉感知三维

本文面向从单张卫星图生成可复用三维城市资产的问题,动机是现有方法多停留在街景渲染代理,难以得到可编辑的显式纹理网格。核心做法是构建1.6万组真实弱对齐卫星—网格数据,并把网格编码到预训练原生3D潜空间,再微调卫星条件几何流与纹理生成,以减少噪声网格带来的表示学习负担。实验显示其在DSM重建及几何、外观资产生成基准上整体优于对比方法,但增益可能主要来自预训练表示与真实数据规模。

Bengal-HP_RU: A Dataset of Bengal People For Head Pose Estimation Figure 1
2026-06-24cs.CV

Bengal-HP_RU: A Dataset of Bengal People For Head Pose Estimation

Md. Ahanaf Arif Khan, Md. Tawhidur Rahman, Sangeeta Biswas, Md. Iqbal Aziz Khan, Subrata Pramanik, Sanjoy Kumar Chakravarty, Bimal Kumar Pramanik

2026-06-24数据集/基准三维

针对现有头姿估计数据集对南亚、尤其孟加拉人群覆盖不足的问题,本文构建 Bengal-HP_RU:从 Wikimedia Commons 采集真实场景图像,经 YOLOv8-Face 裁剪、MediaPipe/OpenCV 三维几何估计与人工校正生成 yaw/pitch/roll 标签,并按上传者划分避免泄漏。主要结果是公开 12,894 张带连续头姿标注的孟加拉人脸图像,含 10,494 训练和 2,400 测试样本;模型增益文中未充分说明,贡献可能主要来自 data。

Flood Mapping from RGB imagery using a Vision Foundation Model Figure 1
2026-06-24cs.CV

Flood Mapping from RGB imagery using a Vision Foundation Model

Vladyslav Polushko, Tilman Bucher, Ronald Rösch, Thomas März, Markus Rauhut, Andreas Weinmann

2026-06-24视觉感知

本文面向灾后应急中快速获得高分辨率淹水范围的需求,研究将卫星预训练的地球观测视觉基础模型 Prithvi-EO-2.0 接入 UPerNet,并适配到厘米级机载 RGB 水体分割。结果显示,Prithvi-2.0-UPN 在同事件训练时达到或接近现有基线,在 Blessem 到 Neuenahr 的跨洪灾零样本迁移中优于基线,且用少量目标事件标注微调时提升最快,说明其具备一定数据高效迁移能力,但零样本性能仍有改进空间。

An LMM for Precisely Grounding Elements in Documents Figure 1
2026-06-24cs.CV

An LMM for Precisely Grounding Elements in Documents

Yijian Lu, Chuangxin Zhao, Kai Sun, Lei Hou, Juanzi Li, Ji Qi

Department of Computer Science and Technology, Tsinghua University, Institute of Automation, Chinese Academy of Sciences

2026-06-24视觉语言

针对文档图像中文字密集、布局复杂导致现有多模态模型难以精确定位证据的问题,本文提出 PreciseDoc:用两套文档生成流水线构造带细粒度坐标的训练数据,并在文档问答中通过 SFT 到强化学习联合监督答案与中间框,采用匈牙利匹配 IoU 奖励和长度惩罚。实验显示其在文档元素定位上优于基线,PreciseDoc-Reasoner 的证据框更准且问答准确率可接近现代 LMM。

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy Figure 1
2026-06-24cs.CV

A Benchmark for Hallucination Detection in VLMs for Gastrointestinal Endoscopy

Aminu Lawal, Niyoj Oli, Sachin Acharya, Prashnna Gyawali, Maria Carmen Romano, Binod Bhattarai

2026-06-24视觉语言视觉感知数据集/基准

该文针对胃肠内镜场景中 VLM 幻觉检测缺乏系统评测的问题,基于 Gut-VLM 在5个模型上比较9类黑盒、灰盒和白盒方法。核心洞察是放射学基准上的方法迁移不稳,且“自信虚构”会同时击穿一致性和不确定性信号;白盒 ReXTrust 依靠隐藏状态在所有模型上取得最高 AUC,平均领先非白盒方法19.5点,最高达93.0。

DramaDirector: Geometry-Guided Short Drama Generation Figure 1
2026-06-24cs.CV

DramaDirector: Geometry-Guided Short Drama Generation

Hengji Zhou, Sijie Liu, Jianrun Chen, Xingchen Zou, Lianghao Xia, Liqiang Nie

South China University of Technology, The Hong Kong University of Science and Technology (Guangzhou), Harbin Institute of Technology, Shenzhen

2026-06-24视觉感知

本文针对短剧生成中纯文本分镜难以表达快节奏镜头语法和人物空间几何的问题,提出 DramaDirector:将每个镜头拆为静态视觉条件与动态叙事条件,并从真实短剧镜头库检索深度—姿态参考来约束首帧和视频生成,同时用结构化 SFT 与基于文本-视觉对齐奖励的 GRPO 训练规划器。作者还构建 DramaBoard 基准,实验显示其在叙事忠实度、镜头一致性和可控性上优于多智能体与视频生成基线。

NavWM: A Unified Navigation World Model for Foresight-Driven Planning Figure 1
2026-06-24cs.RO

NavWM: A Unified Navigation World Model for Foresight-Driven Planning

Yanghong Mei, Longteng Guo, Ming-Ming Yu, Guiyu Zhao, Xingjian He, Jing Liu

Institute of Automation, Chinese Academy of Sciences, Beihang University, School of Artificial Intelligence, University of Chinese Academy of Sciences

2026-06-24机器人强化学习规划控制

NavWM针对视觉导航中反应式策略短视、单一轨迹导致模式坍缩,以及现有世界模型将感知、生成和控制割裂的问题,提出共享双向 Mamba 主干的统一导航世界模型,用潜在世界 token 注入几何/语义先验,并以锚点式多模态轨迹生成候选,再通过未来视觉模拟做闭环选择。实验显示其提升未来图像生成质量,PSNR由14.17升至17.34,导航成功率由66%升至72%,零样本场景达44%。

Beyond Bayer: Task-Optimal Sensor Co-Design for Robust Autonomous-Driving Segmentation Figure 1
2026-06-24cs.CV

Beyond Bayer: Task-Optimal Sensor Co-Design for Robust Autonomous-Driving Segmentation

Reeshad Khan, John Gauch

University Of Arkansas, Fayetteville AR 72701, USA

2026-06-24视觉感知安全鲁棒

这篇论文把自动驾驶分割的鲁棒性问题前移到相机传感器设计:相比继续放大模型,作者用可微 RAW-to-task 流水线分解 PSF、CFA 与噪声的作用。核心洞察是光学 PSF 对逐像素任务只能损失信息,而可学习 2×2 光谱 CFA 才是有效自由度。实验在 KITTI-360/ACDC 上显示 CFA 带来约 +0.017/+0.023 mIoU,PSF 共设计在匹配物理设置下反而下降约 0.020,大于 2×2 的 CFA tile 也持续变差。

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent Figure 1
2026-06-24cs.CV

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarmane, Junzhou Huang

The University of Texas at Arlington, 2 Amazon

2026-06-24视觉感知

这篇论文针对图像聚类在细粒度、长尾、多准则场景中难以统一的问题,提出用自然语言 guideline 驱动的通用聚类代理。核心做法是先用多模态 LLM 生成与准则相关的概念代理文本,再用指令嵌入形成可聚类表示,并通过最小生成树上的选择性 LLM 遍历处理复杂语义合并。实验覆盖四类聚类任务,报告相比专用方法有更好泛化与性能,但具体增益中 LLM 语义推理与表示改进的贡献仍需更多消融支撑。

Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection Figure 1
2026-06-24cs.CV

Progressive Pixel-Neighborhood Deformable Cross-Attention for Multispectral Object Detection

Tian Qiu, Jifeng Shen, Xin Zuo

School of Electrical and Information Engineering, Jiangsu University, Zhenjiang, 212013, China, School of Computer Science and Engineering, Jiangsu University of Science and Technology, Zhenjiang, 212003, China

2026-06-24视觉感知

针对可见光与红外图像弱配准下的跨模态融合,论文认为错位多集中在目标邻域,没必要做全局交叉注意力。PNAFusion用像素邻域交叉注意力减少冗余匹配,并用自适应可变形对齐学习局部偏移,再迭代细化融合。在FLIR、M3FD、DroneVehicle上取得84.2、90.5、85.5 mAP@0.5,相比ICAFusion显存降33%、FLOPs降至156.4G,但延迟仍受可变形采样影响。

End-to-End Radar and Communication Modulation Recognition with Neuromorphic Computing Figure 1
2026-06-24cs.CV

End-to-End Radar and Communication Modulation Recognition with Neuromorphic Computing

Xiaohu Li, Chongxiao Qu, Caiyong Lin, Chenxiao Dou, Wei Hua

2026-06-24视觉感知

针对自动调制识别在无人机、物联网等受限平台上难以兼顾精度与能耗的问题,本文提出端到端脉冲网络 EMRFormer,用自适应脉冲编码、ILIF 神经元、SSCNN 与 SpikeFormer 直接处理原始 IQ 波形,以减少静态编码信息损失并建模多尺度时序依赖。实验称其在多类雷达/通信数据集上达到领先精度,低 SNR 下更稳健,理论能耗降低超 90%,并在 KA200 类脑芯片上相对 3090 GPU/Orin NX 约降 5 倍功耗。

Fabric Image Demoiréing Benchmark from Synthesis to Restoration Figure 1
2026-06-24cs.CV

Fabric Image Demoiréing Benchmark from Synthesis to Restoration

Pengchao Wei, Xiaojie Guo

2026-06-24视觉感知数据集/基准

本文针对织物细纹与相机采样产生的摩尔纹难以用屏幕摩尔纹方法迁移的问题,指出核心瓶颈在于织物纹理与混叠频谱高度纠缠且真实成对数据难对齐。作者提出 PRISM 物理残差注入合成框架,构建 16,050 张多分辨率配对数据,并设计 FaDeNet 以基底/细节分解和频谱各向异性门控保守修复。实验显示其在 PRISM 的 PSNR、SSIM、LPIPS 上优于代表性基线,并在真实无配对织物图像上具备一定零样本泛化。

ObsGraph: Hierarchical Observation Representation for Embodied Reasoning and Exploration Figure 1
2026-06-24cs.CV

ObsGraph: Hierarchical Observation Representation for Embodied Reasoning and Exploration

Taekbeom Lee, Youngseok Jang, Jeonghwa Heo, Jeongjun Choi, H. Jin Kim

2026-06-24视觉感知

针对机器人在陌生环境中需边探索边判断“还缺什么信息”的问题,ObsGraph将观察组织为房间—视图—物体三层场景图,在保留视觉证据的同时用对象共现和空间层级支持粗到细检索,并把检索到的信息缺口直接映射为房间探索、视角细化或前沿探索。实验显示其在具身推理与探索基准上提升成功率和效率,说明结构化观察记忆有助于更有针对性地采集证据。

Ingredient-Level Food Image Segmentation for Nutrition Awareness Figure 1
2026-06-24cs.CV

Ingredient-Level Food Image Segmentation for Nutrition Awareness

Jonesh Shrestha

Jarvis College of Computing and Digital Media, DePaul University, assigning one dish label to an entire image hides important visual, Nutrition Awareness. Preprint submitted to arXiv. DePaul University, a picture, a model predicts one dish label. That is useful for, contains several visible ingredients. A single label such as "salad", Semantic segmentation means assigning a class label to every, pixel in an image. In this experiment, the labels come from, only one label for the whole image [3]. Later architectures, boundary refinement. DeepLabV3+ is a useful example because it, prediction layer is trained for the FoodSeg103 labels instead of, DeepLabV3+, U-Net, BEiT, or published FoodSeg103 benchmark

2026-06-24视觉感知

本文针对单一菜品分类难以反映多食材结构的问题,将营养感知前移到 FoodSeg103 上的像素级食材分割,并把预测掩码转成可见面积占比,作为非热量、非质量估计的餐盘组成提示。核心比较是在相同训练设置下微调 SegFormer-B0/B1,结果 B1 在测试集上像素准确率达 0.7929、mIoU 达 0.3204,较 B0 的 mIoU 提升 0.0683,增益可能主要来自模型容量 scaling。

VisChronos: Revolutionizing Image Captioning Through Real-Life Events Figure 1
2026-06-24cs.CV

VisChronos: Revolutionizing Image Captioning Through Real-Life Events

Phuc-Tan Nguyen, Hieu Nguyen, Minh-Triet Tran, Trung-Nghia Le

2026-06-24视觉语言视觉感知

传统图像描述多停留在物体和动作层面,难以解释真实事件的时间、地点、人物和意义。VisChronos将密集描述模型与多阶段LLM问答结合,并引入可信新闻事件信息来生成事件增强 caption,同时构建含3140对样本的EventCap。人类评测显示其描述在完整性、连贯性和事件相关信息上接近人工标注,但自动检索与外部事实对齐的可靠性仍需进一步验证。

EPEdit: Redefining Image Editing with Generative AI and User-Centric Design Figure 1
2026-06-24cs.CV

EPEdit: Redefining Image Editing with Generative AI and User-Centric Design

Hoang-Phuc Nguyen, Dinh-Khoi Vo, Trong-Le Do, Hai-Dang Nguyen, Tan-Cong Nguyen, Vinh-Tiep Nguyen, Tam V. Nguyen, Khanh-Duy Le, Minh-Triet Tran, Trung-Nghia Le

2026-06-24视觉感知生成模型

针对传统修图工具门槛高、现有生成式编辑工具控制不足且成本较高的问题,EPEdit将基于Stable Diffusion的零样本编辑算法与面向普通用户的网页交互结合,用文本提示和掩码支持生成、替换、移除、背景与局部编辑及主题设计。用户研究显示其在编辑、主题设计和整体体验上优于对比工具,但具体量化指标与增益来源文中未充分说明。

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model Figure 1
2026-06-24cs.CV

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

2026-06-24视觉语言视觉感知

本文针对自动驾驶 VLA 模型过度依赖透视图像 token 与语言先验、缺少度量几何和俯视结构的问题,提出 DriveStack-VLA:将 BEV 表征以 DeepStack 方式注入 LLM 解码器,并用 Render-Teacher Alignment 对齐真实图与栅格图的规划相关注意力,再通过轻量自评头筛选和修正轨迹。在 NAVSIMv1/v2 与 Bench2Drive 上分别达到 91.6 PDMS、91.0 EPDMS 和 79.49 驾驶分数,显示几何注入与注意力对齐对 VLA 规划有实际收益。

Token-to-Token Alignment of Text Embeddings for Semantic Blending Figure 1
2026-06-24cs.CV

Token-to-Token Alignment of Text Embeddings for Semantic Blending

Saar Huberman, Ron Mokady, Or Patashnik, Daniel Cohen-Or

Tel Aviv University

2026-06-24视觉感知

这篇论文针对文本到图像模型中提示词嵌入直接插值常导致语义纠缠、过渡不连贯的问题,提出 Token-to-Token alignment:先将两端提示改写到共享结构,再按语义相似度对齐 token 嵌入,使线性插值沿对应概念变化。实验显示该方法在连续合成、编辑和语义混合中提升中间状态一致性与结构稳定性,消融表明结构对齐和嵌入对齐需配合使用。

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models Figure 1
2026-06-24cs.LG

Cyclic Denoising Reveals Ultrastable Memories in Diffusion Models

Rishabh Sharma, Stefano Martiniani

Simons Center for Computational Physical Chemistry, New York University, Center for Soft Matter Research, Department of Physics, New York University, Center for Neural Science, New York University, Courant Institute of Mathematical Sciences, New York University

2026-06-24生成模型

本文关注扩散模型在常规采样下不易暴露的训练数据记忆风险,提出“循环去噪”作为无需提示词、训练集或权重访问的动态审计方法:反复加噪再去噪以寻找长期稳定吸引子。实验在 Stable Diffusion v1.4 和 CIFAR-10 DDPM 中发现,较高噪声幅度会诱导盆地跳跃并恢复可持续数百至数千轮的超稳定图像,其中不少对应库存照片、水印和网页抓取伪影,说明记忆应被视为生成动力学的稳定性问题。

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy Figure 1
2026-06-24cs.LG

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr

2026-06-24视觉语言三维安全鲁棒

针对荧光显微单细胞表征常把三维 z-stack 压成二维、丢失深度结构的问题,本文系统比较 2D/3D MAE,并将蛋白序列模型 ESM2 作为跨模态监督引入训练。结果显示原生 3D 建模持续优于最大投影和逐片方案,通道交叉注意力与频域正则有助利用体数据;在蛋白互作 ROC-AUC 达 0.865,蛋白定位 AUC/F1 也达到或超过既有方法。

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation Figure 1
2026-06-24cs.CV

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka

2026-06-24强化学习

这篇论文针对主体驱动生成中“保身份”会导致姿态/结构僵化、追求多样性又易身份漂移的问题,提出 DivRL 后训练框架:用解耦视觉特征的负自相似度 nSSM 奖励结构变化,并把 VSM 身份相似度改为门控约束,通过 Explore-and-Suppress 的 GRPO 优化只惩罚越过身份阈值的样本。DreamBench++ 上结果显示,它在维持接近基线身份一致性的同时提升结构多样性与提示匹配,但多样性主要限于姿态和视角。

Trustworthy Image Authentication using Forensic Knowledge Graphs Figure 1
2026-06-24cs.CV

Trustworthy Image Authentication using Forensic Knowledge Graphs

Tai D. Nguyen, Matthew C. Stamm

2026-06-24视觉感知

针对生成式编辑让图像伪造更逼真、现有取证模型难解释而 VLM 又缺乏微观取证证据的问题,论文提出 Forensic Knowledge Graphs,将区域来源、压缩/后处理痕迹及语义内容组织成可追溯图结构,并用自监督取证特征、区域提议网络和 ICR 提示生成解释。作者还构建 FKG-50K,实验称在检测、伪造类型识别、定位与取证理由上优于专用检测器和 VLM。

The Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language Models Figure 1
2026-06-24cs.CV

The Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language Models

Ahmad Algadhi, Ahmed Alzuhair, Omar Alkhulaif, Muzammil Behzad

Department of Information and Computer Science, King Fahd University of Petroleum and Minerals

2026-06-24视觉语言视觉感知

论文针对 PromptKD 只依赖单一 CLIP 教师、软标签可能受单一归纳偏置限制的问题,提出 TheProfessor:用 PromptSRC 微调的 ViT-L/14 与零样本 EVA-CLIP-L/14 双教师进行无监督提示蒸馏,并缓存第二教师 logits 以保持推理成本不变。结果显示多教师并非普遍有效,增益主要出现在存在领域偏移且教师互补时,四个数据集上置信度加权平均 HM 提升 1.77 点,EuroSAT 提升最大为 5.78 点。

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs Figure 1
2026-06-24cs.CV

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

Yifei Zhao, Qian Lou, Mengxin Zheng

University of Central Florida

2026-06-24视觉语言强化学习数据集/基准

针对物理世界VLM红队评测长期被数据集、指标和威胁模型割裂、难以区分攻击强弱与模型脆弱性的现状,ReaLM统一纳入12种攻击、3类模型无关防御和13个VLM,并用智能体生成场景化物理攻击目标来对齐比较。结果显示,文本与排版注入最易诱发功能性错误,多模态协同优化在视觉扰动迁移上最强,单次生成攻击接近迭代方法且成本更低,模型规模提升并不能保证鲁棒性。

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis Figure 1
2026-06-24eess.IV

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

2026-06-24视觉语言强化学习三维

该文针对3D CT肿瘤报告中VLM易依赖语言先验、产生视觉幻觉的问题,提出E-MRL,将生成过程建模为“诊断-定位-验证”的强化学习流程,并要求模型同时给出关键证据切片,通过全局报告与局部切片复查的一致性奖励约束视觉 grounding。实验称其在大规模3D CT肿瘤数据上较SFT和常规RL降低幻觉、提升诊断准确率与证据定位能力。

Mind the Heads: Topological Representation Alignment for Multimodal LLMs Figure 1
2026-06-24cs.CV

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Cornia, Lorenzo Baraldi

University of Modena and Reggio Emilia, University of Pisa, aimagelab.github.io/HeRA

2026-06-24视觉语言

针对多模态大模型在计数、空间关系和密集视觉理解中易受语言先验影响的问题,论文提出 HeRA:不再对齐固定层特征,而是用 MKNN 选择注意力头,并以对比目标保持视觉编码器与语言表征的局部拓扑邻域;一个反直觉发现是对齐最不一致的头收益最大。作者在 LLaVA 系列等模型和 18 个基准上报告视觉中心任务稳定提升,并减少视觉幻觉。

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification Figure 1
2026-06-24cs.CL

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

Rensselaer Polytechnic Institute

2026-06-24视觉感知

这篇论文针对知识型视觉问答中“先找对实体、再找证据”被现有MM-RAG重排序混在一起的问题,指出MLLM开放式命名实体不稳,但在候选实体名中做选择会显著更可靠。作者提出无需训练的IBA流程,先用MLLM筛选高置信实体,再用文本重排序器选证据;在E-VQA和InfoSeek上超过微调式多模态重排序基线,并降低训练与推理复杂度。

Machine Learning Modeling for Real-Time Melt Pool Monitoring in Laser Powder Bed Fusion Additive Manufacturing: A Hybrid Approach Figure 1
2026-06-24cs.LG

Machine Learning Modeling for Real-Time Melt Pool Monitoring in Laser Powder Bed Fusion Additive Manufacturing: A Hybrid Approach

Inioluwa Emmanuel, Zhuo Yang, Ho Yeung, Xinyao Zhang

Florida State University, National Institute of, and label-preserving data augmentation to emulate realistic, inspection tasks where labeled training data may be limited [11], frameworks have been proposed to address limited labeled data

2026-06-24视觉感知

针对LPBF金属增材制造中熔池异常需毫秒级监测、而纯深度模型推理较慢的问题,论文比较迁移学习CNN、原始像素随机森林与EfficientNetB0特征加随机森林的混合方案。核心洞察是将预训练视觉特征与轻量集成分类器解耦,可在小数据场景兼顾表征与部署效率;在1200张NIST AMMT图像上,混合模型达到F1 0.9451、AUC 0.9904、约1.15 ms推理,明显快于纯CNN,但泛化仍受单材料单机器数据限制。

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models Figure 1
2026-06-24cs.CV

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

2026-06-24视觉感知

这篇论文针对视觉语言模型难以理解“不是/没有”等否定语义、且直接微调易遗忘原有能力的问题,提出 HANCLIP:用双曲空间建模“图像是什么/不是什么”的层级与非对称关系,并加入角度三元组否定损失分离否定描述。仅用 2 万组样本适配 CLIP、LongCLIP 等模型,在 NegBench 上稳定提升,负向检索平均增益超 4%,多选问答提升近 35%,同时基本保持常规分类与检索表现。

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation Figure 1
2026-06-24cs.CV

ABACUS: Adapting Unified Foundation Model for Bridging Image Count Understanding and Generation

Anindya Mondal, Sauradip Nag, Anjan Dutta

University of Surrey, 2 Simon Fraser University

2026-06-24视觉感知

针对计数理解与按数量生成长期割裂、统一多模态模型缺乏实例级空间 grounding 的问题,ABACUS在3B统一基础模型上引入密度自适应缩放、由注意力得到的objectness map、边界感知GRPO计数策略,并用冻结理解分支以循环一致GRPO反向约束生成分支。在无需基准专门训练下,文中报告其在7个计数理解、指代表达计数与计数生成基准上超过专用模型和更大通用模型。

From Spatial to Spectral: An Efficient, Frequency-Guided Feature Representation Learner for Small Object Detection Figure 1
2026-06-24cs.CV

From Spatial to Spectral: An Efficient, Frequency-Guided Feature Representation Learner for Small Object Detection

Yuhan Rui, Shihan Qiao, Yibin Lou, Mingxi Yu, Yutong Wan, Yanqiao Chen, Dongsheng Hou, Zhen Cao, Athena Zhuoming Zhong, Qi Hao

2026-06-24视觉感知

本文针对小目标在下采样、特征融合和回归头中高频细节持续丢失的问题,主张从空间补偿转向频谱表征。核心是统一的 DER 分解—增强—重构算子,并以 WDG、LGE、FDHead 分别嵌入骨干、颈部和检测头,显式保留边界与细节频率信息。实验在 VisDrone、UAVDT、TinyPerson、DOTA 等数据集上显示跨 CNN/Transformer 检测器均有增益,DERNet 在同尺度下优于 YOLOv11 且参数约为其六分之一。

Listening makes Vision Clear for VLMs Figure 1
2026-06-24cs.CV

Listening makes Vision Clear for VLMs

Yiyang Chen, Yixin Tan, Binrui Shen

Beijing Normal University

2026-06-24视觉语言视觉感知

本文针对VLM视觉-语言一致性评估中依赖答案侧注意力易受解码漂移和语言先验干扰的问题,提出从固定提示词侧提取Prompt-Vision Token Activation Map,并用结构token去噪过滤模态边界带来的系统偏置;同时以TGR、TDR和MinDist衡量注意力峰值与目标区域的对齐。实验在PartImageNet、RefCOCO及多种VLM上优于或匹配CAM、CP-LRP、Attention Rollout、TAM等基线,表明细粒度对齐信号更可能出现在提示编码阶段。

Performance and Interpretability of Convolutional, Transformer, and Hybrid Deep Learning Models in Colorectal Histology Classification Figure 1
2026-06-24q-bio.QM

Performance and Interpretability of Convolutional, Transformer, and Hybrid Deep Learning Models in Colorectal Histology Classification

Reza Bozorgpour

College of Engineering & Applied Science, Department of Biomedical Engineering, University of

2026-06-24视觉感知

针对结直肠病理多类别识别中 CNN、Transformer 与混合模型缺少统一比较的问题,论文在 Kather 5,000 张八类 H&E 图像上用相同迁移学习流程评测 12 种架构,并结合多指标与可解释性分析。结果显示各模型准确率均较高,EVA-02 最优达 97.1%,ViT-B/16 接近,ResNet34 与 ConvNeXt-Tiny 也具竞争力;复杂间质最难分类,Transformer 略占优但相对强 CNN 的增益不大。

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation Figure 1
2026-06-24cs.CV

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, Enze Xie

2026-06-24视觉感知

这篇论文针对视频扩散模型在不同模型、硬件和推理配置下难以复用同一加速方案的问题,将缓存、稀疏注意力、token 剪枝、量化和 kernel 融合组织成由技能代理局部搜索、集成代理全局组合、人类做质量验证的训练-free 全栈框架。实验覆盖 Cosmos3-Super、LTX-2.3 和 SANA-Video,报告端到端超过 2 倍加速且 VBench 质量近似无损,但最终视觉评估仍依赖人工反馈。

Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search Figure 1
2026-06-24cs.LG

Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search

Yashkumar R Lukhi, Harsh Rameshbhai Moradiya, Radu Timofte, Dmitry Ignatov

Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany

2026-06-24视觉感知

针对异构4专家MoE组合空间过大、手工设计难以覆盖的问题,本文构建了基于LEMUR的自动代码组装、验证与长周期评测流水线。核心洞察是排序枚举导致搜索完全偏向AirNet,仅覆盖4.8%组合,并提出随机分层修正;在该受限空间内,1021个成功模型中最佳CIFAR-10单epoch准确率达68.0%,ShuffleNet和MobileNetV3更常带来高收益。

A Geometry-Informed Computer Vision Method for Detecting and Examining Overtaking Vehicles From A Bicycle Figure 1
2026-06-24cs.CV

A Geometry-Informed Computer Vision Method for Detecting and Examining Overtaking Vehicles From A Bicycle

Gandhimathi Padmanaban, Rayane Moustafa, Fred Feng

Department of Industrial Manufacturing and Systems Engineering, University of Michigan-Dearborn, vides a scalable foundation for vehicle-bicycle interaction analysis across larger datasets and

2026-06-24视觉感知

这篇论文针对自行车后视视频中超车事件仍需逐帧人工标注的瓶颈,提出将 RT-DETR、ByteTrack 与透视几何约束结合,用方位角趋势、目标变大和空间位置确认完成单目、免标定筛选。在 315 个真实城市超车事件上达到 97.8% 召回且零误报,平均提前 2.44 秒识别,并在 96 个样本上估计横向距离误差约 13–14 厘米。

2026-06-23

358 篇
Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild Figure 1
2026-06-23cs.CV

Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

Yehonathan Litman, Xiaoxuan Ma, Manan Shah, Nicolas Ugrinovic, Kris Kitani, Fernando De la Torre, Shubham Tulsiani

Carnegie Mellon University

2026-06-23三维

Lift4D针对单目野外视频中动态物体只被部分观察、还常有大形变和遮挡,难以恢复完整4D几何与外观的问题。核心思路是把单视图3D先验改造成因果潜变量条件的时序一致逐帧重建,再用可变形3D Gaussian和遮挡感知优化结合视角条件扩散先验补全不可见区域。实验显示其在合成与真实视频上提升新视角质量、语义一致性和运动对齐,尤其适合严重遮挡与非刚体运动场景。

Keep The Essentials: Efficient Reference Conditioned Generation via Token Dropping Figure 1
2026-06-23cs.CV

Keep The Essentials: Efficient Reference Conditioned Generation via Token Dropping

Rishubh Parihar, Ayush Raina, R. Venkatesh Babu, Or Patashnik

Tel Aviv University

2026-06-23视觉感知

这篇论文针对参考图像条件扩散模型在多参考、高分辨率场景中因密集参考 token 导致注意力开销急剧上升的问题,提出 Sparse Context:训练时随机丢弃不同比例参考 token,使模型适应稀疏上下文;推理时按任务选择更有信息量的区域 token。核心洞察是参考 token 存在大量冗余,适度稀疏化仍能保留可控性与细节。实验显示单参考约 2×、多参考约 4×至 5×加速,且空间编辑和主体生成质量基本不降。

Semantic Browsing: Controllable Diversity for Image Generation Figure 1
2026-06-23cs.CV

Semantic Browsing: Controllable Diversity for Image Generation

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

2026-06-23视觉感知规划控制

本文针对文本到图像模型在高提示遵循下易收敛到单一语义解释、随机采样多样性难以被用户控制的问题,提出“语义浏览”:先用 VLM 将提示扩展为结构化场景 JSON,再通过多智能体工作流沿可解释语义轴生成层级变体,并交给强提示遵循的图像模型渲染。实验显示其相比既有多样化方法能产生更高且可导航的结构化语义多样性,但具体增益中 VLM 规划与底层生成器能力的贡献仍需进一步拆分说明。

AIR: Adaptive Interleaved Reasoning with Code in MLLMs Figure 1
2026-06-23cs.CV

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

2026-06-23强化学习

AIR针对现有MLLM工具使用偏重视觉操作、难以处理复杂数值计算的问题,让模型在推理过程中自适应调用Python代码。其核心是两阶段冷启动数据构造、Self-Sampled/Prior-Filtered数据筛选,以及带组约束奖励的GRPO,以同时学习何时用工具并稳定长期Agentic RL训练。实验显示平均性能提升6.1个百分点,交错推理样本提升9.9个百分点,工具调用成功率超过95%。

IMAGIN-4D: Image-Guided Controllable Interaction Generation Figure 1
2026-06-23cs.CV

IMAGIN-4D: Image-Guided Controllable Interaction Generation

Sai Kumar Dwivedi, Federica Bogo, Buğra Tekin, Chenhongyi Yang, Nadine Bertsch, Tomas Hodan, Michael J. Black, Dimitrios Tzionas, Shreyas Hampali

2026-06-23视觉感知规划控制

IMAGIN-4D针对文本、物体几何和稀疏轨迹难以指定抓握、接触和人体-物体布局的问题,引入参考图像作为交互快照约束。其核心是将图像条件分解为空间交互状态 token 与逐帧视觉 token,并用角色感知条件融合文本、路标和视觉线索。作者还构建合成渲染数据与 image-adherence 指标;在 FBM 和 BEHAVE 上,相比单全局图像 token 或均匀图像条件,方法提升了细粒度图像遵循性,同时基本保持轨迹跟随、运动质量和接触表现。

GeoFidelity-Bench: Evaluating Segment-Level Geographic Fidelity in Text-to-Image Street-View Generation Figure 1
2026-06-23cs.CV

GeoFidelity-Bench: Evaluating Segment-Level Geographic Fidelity in Text-to-Image Street-View Generation

Kaizhen Tan, Hanzhe Hong, Siru Tao

2026-06-23视觉感知

本文针对街景生成“看起来像某城市但不像指定路段”的评测缺口,提出 GeoFidelity-Bench:用 25 城 109 个 OSM 路段的 Mapillary 参考面板和同城近邻负样本,检验生成图是否能区分目标路段。结果显示,加入街道/社区名使 top-1 准确率较城市提示提升 5.5 个百分点,但与同城最近路段的相似度差几乎为零;错误本地名也保留部分增益,普通文本 GPS 额外帮助不显著,说明当前模型多学到城市/社区风格而非精确路段身份。

PHAST-Net: Attention-Guided, Physics-Informed Network for Unified Estimation of Ideal Time-Frequency Representations Figure 1
2026-06-23eess.AS

PHAST-Net: Attention-Guided, Physics-Informed Network for Unified Estimation of Ideal Time-Frequency Representations

James M. Cozens, Simon J. Godsill

2026-06-23视觉感知

该文针对传统时频分析在多分量、交叉轨迹和含噪信号中难以同时保持高集中度与抑制交叉项的问题,提出 PHAST-Net:用一组按 Cohen 核分析选择的对数频率 CLAWT 作为输入,并加入注意力与物理重投影损失约束变换一致性和能量守恒。实验覆盖语音、音乐与合成基准,显示其在理想时频表示、基频化 Tempogram/Metrogram 和样条重渲染上优于既有方法,但部分增益可能主要来自程序化大规模数据与任务设定。

Lightweight Neural Framework for Robust 3D Volume and Surface Estimation from Multi-View Images Figure 1
2026-06-23cs.CV

Lightweight Neural Framework for Robust 3D Volume and Surface Estimation from Multi-View Images

Diego E. Farchione, Ramzi Idoughi, Peter Wonka

2026-06-23视觉感知三维安全鲁棒

针对多视图图像估计物体体积和表面积常依赖稠密重建、封闭网格与繁重后处理的问题,本文提出前馈式轻量框架,将MapAnything等生成的点云与DINOv3二维特征融合,并用证据回归同时输出尺度归一化几何量和不确定性。实验称其在稀疏视角、噪声点云下优于现有方法,并在珊瑚、食物和人体数据上验证泛化,但绝对尺度恢复仍不在模型能力内。

Pose Anything Anywhere:Model-free Object Poses from Arbitrary References Figure 1
2026-06-23cs.CV

Pose Anything Anywhere:Model-free Object Poses from Arbitrary References

Hongli Xu, Jiaqi Hu, Junwen Huang, Boyang Zhong, Peter KT Yu, Nassir Navab, Benjamin Busam, Slobodan Ilic

2026-06-23三维

这篇论文面向开放世界机器人中缺少 CAD 模型、参考视角稀疏且未标定时的 6D 位姿估计难题,提出 PANY:将多视图几何基础模型改造为物体中心的规范对齐器,并用跨视角一致对应与可选的位姿图注册整合辅助视图,缓解遮挡和大视角差导致的单参考歧义。实验称其在 YCB-V 提升约 12%、LM-O 超过 20%,且同时适用于 RGB/RGB-D 与单/稀疏参考设置。

Hedgementation = Hedgerow Segmentation: A Remote Sensing Benchmark Figure 1
2026-06-23cs.CV

Hedgementation = Hedgerow Segmentation: A Remote Sensing Benchmark

Nathan Senyard, Salem Hamdani, Astrid Zhang, Derek Wang, Evan Shelhamer, Mathias Lécuyer, Joséphine Gantois

Vector Institute

2026-06-23视觉感知数据集/基准

针对树篱在农业生态中重要但大尺度分布数据稀缺、模型跨区域可迁移性不明的问题,Hedgementation整合法国BD Haie标注、Sentinel-2影像与Alpha Earth嵌入,构建10米分辨率全国级树篱分割基准,并专门评估空间距离、气候区和农业区泛化。基线中PASTIS U-TAE最佳,IoU约0.41,近区略优于远区,温带和农业像素表现明显好于亚热带与非农业区域,说明现有方法仍难以可靠精细制图。

Data Selection Through Iterative Self-Filtering for Vision-Language Settings Figure 1
2026-06-23cs.CV

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

The availability of large amounts of clean data is paramount to training neural networks., of learned knowledge with the diversity available in the whole dataset.

2026-06-23视觉语言视觉感知

这篇论文关注大规模图文数据噪声导致 CLIP 训练低效的问题,质疑依赖预训练模型过滤会引入额外知识与偏差。核心方法是 Self-Filtering:训练过程中用当前模型按图文相似度反复筛选高置信样本,并与全量随机样本混合以平衡利用与多样性。实验显示,在不使用额外数据或预训练过滤器的情况下,该策略能提升下游表现,并体现更好的已见样本效率。

Vera: A Layered Diffusion Model for Content-Preserving Video Editing Figure 1
2026-06-23cs.CV

Vera: A Layered Diffusion Model for Content-Preserving Video Editing

Hongkai Zheng, Ta-Ying Cheng, Benjamin Klein, Yisong Yue, Zhuoning Yuan

California Institute of Technology

2026-06-23视觉感知生成模型

Vera针对现有视频扩散编辑会重生成整段视频、导致未编辑人物或背景被意外改动的问题,将编辑内容建模为独立RGBA层和alpha matte,再与源视频合成;其MoT结构用多层DiT通过联合自注意力协调编辑层、遮罩和合成结果,并配套486K帧分层数据训练。实验和人工偏好显示,它在内容保真上优于主流开源视频编辑模型,同时编辑质量保持竞争力。

Discovering Latent Groups for Robust Classification Figure 1
2026-06-23cs.LG

Discovering Latent Groups for Robust Classification

Ankur Garg, Ulrich Aïvodji, Samira Ebrahimi Kahou, Vincent Michalski

2026-06-23安全鲁棒

本文针对模型依赖伪相关导致少数子群性能崩溃且推理时不可解释的问题,提出神经分类树 NCT:用预测正确性作为“易/难”路由信号,迭代形成可保留到推理阶段的树形子群划分,并用无监督准则选择深度。在五个含二分类与多分类伪相关基准上,NCT能把少数/冲突子群集中到 hard 分支,最坏组准确率接近或匹配强基线,同时暴露潜在群组结构。

Autonomous Subsea Cable Search and Tracking with Graph-Optimised Priors and Visual Tracking Figure 1
2026-06-23cs.RO

Autonomous Subsea Cable Search and Tracking with Graph-Optimised Priors and Visual Tracking

Ibrahim Fadhil Djauhari, Adrian Bodenmann, Samuel Simmons, Cailei Liang, David White, Susan Gourvenec, Tom Bennetts, Darryl Newborough, Blair Thornton

2026-06-23视觉感知

面向海底通信电缆易受损且先验路由误差、细小/部分掩埋导致AUV难以连续跟踪的问题,论文将视觉检测与“反向SLAM”式图优化结合,用观测持续修正全局电缆地图,并用悬链线物理模型约束未观测段搜索范围。海试中,Smarty200在故意偏置的初始地图下仍定位电缆,跟踪检查了120米测试电缆最高59%,且能在丢失后恢复。

No Figure
2026-06-23cs.CV

Polycepta: Object-Centric Appearance Estimation for Multi-Object Tracking

Mohamed Nagy, Naoufel Werghi, Jorge Dias, Majid Khonji

2026-06-23视觉感知

本文针对多目标跟踪中外观特征常被静态 ReID 描述子建模、计算开销高且难适应遮挡和视角变化的问题,提出 Polycepta:为每个目标递归维护外观状态,并通过状态擦除训练避免记忆具体对象,从而学习可迁移的外观更新机制。实验显示其接入跟踪-by-detection框架后可减少 ID switch、提升 KITTI/Waymo/MOT17 性能,并以 90.57Hz 在 KITTI 上达到 92.27% MOTA。

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery Figure 1
2026-06-23cs.RO

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

(NSF) grants CNS-2146295 and CCF-2402941.The source code and supplementary materials for this paper will be publicly available.

2026-06-23机器人视觉语言视觉感知

面向机器人辅助手术中细微且与患者安全相关的执行性错误,论文指出仅靠视频或预定义手势标签难以利用手术层级上下文。其核心做法是把手势、器械—对象交互和错误定义写成活动提示,并与视频、运动学特征融合;结果在 JIGSAWS 和 SAR-RARP50 上较基线 F1 最高提升 5% 和 16.6%,且提示可接近或优于需额外预训练的活动感知视觉嵌入。

Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse Figure 1
2026-06-23cs.DC

Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse

Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein

2026-06-23视觉语言

本文针对多模态智能体反复查看视频帧、截图或文档页时,传统前缀 KV cache 因位置和前文变化而频繁重算的问题。核心洞察是朴素复用主要丢失跨块条件化信息,而非直接读出;Kamera 用精确 RoPE 重旋转处理位置变化,并为每个块保存训练无关的低秩条件补丁。实验显示该方法可恢复多跳跨块任务精度,在 MLA/GQA/MHA 与 SGLang 内核中以较小 KV 开销接近重新 prefill 的效果。

HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory Figure 1
2026-06-23cs.RO

HoloAgent-0: A Unified Embodied Agent Framework with 3D Spatial Memory

Xiaolin Zhou, Liu Liu, Tingyang Xiao, Wei Feng, Fa Fu, Xinrui Meng, Xinjie Wang, Jialiang Han, Boyang Yu, Yun Du, Wei Sui, Zhizhong Su

Webpage: horizonrobotics.github.io/robot_lab/holoagent, workflow centered on Embodied AgentOS. AgentOS converts natural-language instructions into executable

2026-06-23三维

这篇论文针对物理机器人中语言智能体难以像软件工具那样组合、监控和纠错的问题,提出 HoloAgent-0:以 Embodied AgentOS 为闭环运行时,结合持久 3D 空间/时间记忆和类型化技能接口,把导航、操作、全身运动等异构能力组织成可执行技能图。实机与仿真结果显示,其在长程导航、3D 语义映射上有定量优势,并展示了物体搜索、多机器人协同和移动操作等闭环任务。

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views Figure 1
2026-06-23cs.CV

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

Graduate School of Artificial Intelligence, KAIST, Republic of Korea, Code is available at: https://github.com/kaist-cvml/dr-mv3d, suggest that the core challenge is not merely the availability of visual inputs

2026-06-23强化学习三维

这篇论文针对多视角3D VQA中现有MLLM仅靠答案级稀疏监督而难以保持跨视角一致、视点选择不稳定的问题,提出DR-MV3D:先构建全局认知地图,再按问题规划视角轨迹并做自我中心 grounding;核心在于用冻结3D视觉基础模型生成伪结构目标,提供全局一致性和局部轨迹两类稠密奖励,并用GRPO优化。实验显示其在MindCube、VSI-Bench和BLINK(MV)上均优于强多图基线,MindCube-Tiny较Qwen2.5-3B提升28.7个百分点。

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct Figure 1
2026-06-23cs.AI

VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct

Haoling Li, Kai Zheng, Jie Wu, Can Xu, Qingfeng Sun, Han Hu, Yujiu Yang

2026-06-23视觉语言

本文针对视觉数学推理中“题目变难但答案标签不可靠”会在强化学习中放大噪声的问题,提出 VeriEvol:用按题型路由的 Evol-Instruct 生成更难且图像相关的题目,再用 HTV-Agent 进行离线反驳式多源验证,只有未被证伪的答案进入训练。实验显示,SFT 数据从 10K 扩到 250K 平均准确率由 35.42 提至 54.73;在固定骨干、初始化和 GRPO 配方下,相比未演化 RL 基线总增益为 +3.88,其中演化题目和验证器分别贡献 +1.82、+2.06。

AwakeForest: An Interactive Geospatial Platform for Large-Scale Forest Imagery Figure 1
2026-06-23cs.CV

AwakeForest: An Interactive Geospatial Platform for Large-Scale Forest Imagery

Suraj Prasai, Kangning Cui, Rongkun Zhu, Sarra Alqahtani, Ying Zhang, Victor Paul Pauca, Miles R. Silman, Fan Yang

Wake Forest University, Hong Kong Baptist University

2026-06-23视觉感知

森林遥感分析常需在超大正射影像上同时完成检测、分割、标注与空间统计,现有标注或 GIS 工具难以兼顾地理坐标、云端流式访问和模型接入。AwakeForest 的核心是把 COG/对象存储、PostGIS 空间索引、可插拔 YOLO/SAM 推理与人机协同修正整合为项目化流程。文中在 PALMS 数据集演示了从棕榈检测、分割到分析就绪输出的端到端工作流,但未提供定量精度或效率基准。

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement Figure 1
2026-06-23cs.CV

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University

2026-06-23视觉感知

本文针对视觉文档检索中对每页都调用多模态大模型导致延迟和成本过高的问题,抓住用户查询往往由可见关键词锚定的现象,提出先用无 LLM 的轻量视觉选择缩小候选页,再在候选上做视觉自适应语义精排,并通过区域特征融合与难负样本对比学习增强区分性。实验显示 LightSTAR 在保持或达到 SOTA 检索精度的同时,将端到端延迟降低数倍。

Scaling State-Space Models from Lines to Paragraphs: An Ablation of Mamba-based OCR Figure 1
2026-06-23cs.CV

Scaling State-Space Models from Lines to Paragraphs: An Ablation of Mamba-based OCR

Merveilles Agbeti-Messan, Pierrick Tranouez, Stéphane Nicolas, Clément Chatelain, Thierry Paquet

2026-06-23视觉感知

本文关注 Transformer 在段落级 OCR 中因注意力二次复杂度带来的效率瓶颈,系统消融 Mamba-OCR 从行到段落的扩展行为。核心发现是长序列精度主要受状态维度和扩展因子影响;在合成段落上 Mamba 与 Transformer 均低于 1% CER 且快 1.4–4.5 倍,但在 IAM 手写数据上明显落后,差距可能主要来自数据稀缺与长序列训练的数据需求。

Arbor: Explicit Geometric Conditioning for Controllable 3D Asset Generation Figure 1
2026-06-23cs.CV

Arbor: Explicit Geometric Conditioning for Controllable 3D Asset Generation

Jan-Niklas Dihlmann, Andreas Engelhardt, Simon Donne, Hendrik P.A. Lensch, Mark Boss

University of Tübingen

2026-06-23规划控制三维

针对文本/图像条件3D生成难以精确表达占用空间、避让区域和接触面的痛点,Arbor把艺术家给定的hull、avoidance、touch约束网格编码为几何token,并通过路由式适配器注入冻结的潜在3D去噪器,使局部约束进入生成过程而非仅采样后修正。实验显示其在自动与人工约束基准上提升约束服从性,同时基本保留物体质量和固定约束下的形状多样性。

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation Figure 1
2026-06-23cs.CV

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation

Yohann Perron, Guillaume Astruc, Nicolas Gonthier, Clement Mallet, Loic Landrieu

and models are available at github.com/gastruc/UniverSat., band counts, temporal sampling, and patch size. When operating on a narrow set of widely available

2026-06-23视觉感知

这篇论文针对遥感场景中传感器模态、空间/光谱/时间分辨率差异巨大,而传统 ViT 固定 patch 投影器依赖重采样或专用编码器的问题,提出 UniverSat:用 Universal Patch Encoder 以共享权重将任意形状观测映射到统一嵌入,并保留可选输出分辨率。模型在 7 个数据集、13 类传感器上自监督训练,在 GeoBench、PANGEABench 和高光谱基准的分类、分割探测中保持竞争力,并展示对未见传感器配置的泛化。

Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies Figure 1
2026-06-23cs.CV

Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies

Zhenyu Yi, Zhiyun Song, Yusong Sun, Zelin Liu, Manman Fei, Zhenhao Li, Jiaxuan Zhao, Xu Han, Lichi Zhang

2026-06-23视觉语言视觉感知三维

这篇论文针对3D脑CT急性颅内病变诊断中密集标注昂贵、2D视觉语言模型难以直接迁移到体数据的问题,提出Brain-Adapter:将CT体视为切片包,用文本条件注意力把报告语句对齐到相关切片,同时以LLM抽取的结构化标签监督视觉MIL分支,并用一致性约束与不确定性感知融合处理歧义。实验显示其在真实临床多标签分类中优于3D模型和常规MIL,并在CQ500零样本异常检测上表现出较好泛化。

MeshFlow: Mesh Generation with Equivariant Flow Matching Figure 1
2026-06-23cs.GR

MeshFlow: Mesh Generation with Equivariant Flow Matching

Qi Sun, Kiyohiro Nakayama, Jing Nathan Yan, Qixing Huang, Alexander Rush, Leonidas Guibas, Gordon Wetzstein, Jing Liao, Guandao Yang

City University of Hong Kong, Stanford University, The University of Texas, Austin, City University of Hong Kong Hong Kong, Stanford University USA, The University of Texas, Austin USA

2026-06-23生成模型

MeshFlow针对网格直接生成难以处理面与顶点置换对称、而自回归序列化方法推理慢的问题,将三角网格表示为triangle soup,并用等变最优传输flow matching建模;其改造DiT以保持面置换和三角形顶点循环等变性,再用对称感知的OT配对损失减少错误训练信号。在ShapeNet多类别上,网格质量接近自回归SOTA,单个样本低于1秒生成,约快18倍。

From Reconstruction to Decision: A Post-Encoder Plug-in Adapter for Curvilinear Segmentation Figure 1
2026-06-23cs.CV

From Reconstruction to Decision: A Post-Encoder Plug-in Adapter for Curvilinear Segmentation

Qin Lei, Jiang Zhong, Xin Xiao, Yuming Yang, Hao Wu

2026-06-23视觉感知三维

针对血管、裂缝等细长结构在基础视觉编码器强下采样后易断裂的问题,论文把改进点放在后编码器阶段,提出轻量 PEPA:用目标条件蛇形上采样恢复弯曲细节,并用目标自适应可微阈值校准二值化决策。五个医疗与工业基准显示,在冻结编码器上仅增加约0.26M参数即可稳定提升 IoU 与 clDice,且拓扑连通性收益更明显。

C^2GR: Coupled Comprehensive Generative Replay for a Continually Learnable Universal Segmentation Model Figure 1
2026-06-23cs.CV

C^2GR: Coupled Comprehensive Generative Replay for a Continually Learnable Universal Segmentation Model

Wei Li, Jingyang Zhang, Guoan Wang, Junzhi Ning, Yang Chen, Guang Yang, Lixu Gu

Shanghai Jiao Tong University, Southeast University, Stevens Institute of Technology, Shanghai Artificial Intelligence Laboratory, Imperial College London

2026-06-23视觉感知生成模型

这篇论文针对医疗通用分割模型在任务增量学习中因影像外观与分割目标同时变化而遗忘旧任务的问题,提出 C2GR:用扩散模型回放旧任务的图像-掩码对,并通过贝叶斯联合扩散保持结构对应、用任务关系感知统一提示同步生成器与分割器优化。在跨模态、跨目标的 20 个任务上,其总体性能较联合训练仅下降 2.44%,表明能较有效缓解连续学习遗忘。

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing Figure 1
2026-06-23cs.CV

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing

Zesong Yang, Yuanhang Lei, Liyuan Cui, Yihang Chen, Jiaer Huang, Boming Zhao, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui

State Key Laboratory of CAD&CG, Zhejiang University, University of British Columbia, trollable synthesis of physically plausible phenomena that faithfully adhere to, Gaussian Splatting, enabling controllable and thermophysically grounded edit-

2026-06-23三维

MeGAS针对现有物理神经渲染多关注机械变形、难以表达温度驱动熔化/凝固的问题,将温度属性加入3D Gaussian Splatting,并耦合热对流扩散、MPM相变本构切换与拓扑自适应渲染,以减少大变形下裂缝和漂浮点。实验显示其在真实和合成场景中能生成更一致的热机械行为,并在用户研究中提升物理真实感、照片真实感和多视角一致性。

Rethinking Object-Centric Representations for Video Dynamics Modeling Figure 1
2026-06-23cs.CV

Rethinking Object-Centric Representations for Video Dynamics Modeling

Amaury Wei, Ismail Nejjar, Olga Fink

2026-06-23视觉感知

这篇论文关注视频中无监督对象中心表示的失效:传统 slot 表征把外观与位置/尺度纠缠在一起,强行做时间一致性会偏向静态背景并导致前景碎片化、身份切换。作者提出 STAITUS,将每个 slot 拆成外观与几何姿态,只在外观空间做时间对齐,并加入空间分离损失与自适应 slot 门控以减少过分割。实验称其在合成和真实视频基准上提升分割质量与跟踪稳定性。

Polynomial Dice Loss for Medical Image Segmentation Figure 1
2026-06-23cs.CV

Polynomial Dice Loss for Medical Image Segmentation

Hiroaki Aizawa

2026-06-23视觉感知

针对医学图像中小病灶、前景稀少导致 Dice 类损失训练不稳定的问题,论文从几何角度将 Dice Loss 分解为尺度项与角度对齐项,并用泰勒展开构造 Polynomial Dice Loss,通过截断阶数和系数调节损失形状。实验与 Dice、Tversky 系列对比显示,其在多种分割设置下具有竞争力,尤其在多类和不均衡小前景场景中可改善表现,但 3D 数据仍以 2D 切片评估。

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger Figure 1
2026-06-23cs.CR

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger

Vu Tuan Truong, Long Bao Le

INRS, University of Quebec

2026-06-23生成模型

本文针对扩散模型后门攻击在成功率、隐蔽性、投毒率和训练成本之间的权衡,提出 TooBad:不再手工选择触发器,而是将触发器优化直接嵌入扩散去噪过程,使其更易把生成分布推向目标样本。实验显示,在 CIFAR-10 等基准上仅 0.5% 投毒率即可超过 85% ASR,5% 投毒率下 3–5 个注入 epoch 接近 100% ASR,并能绕过现有防御且保持正常生成质量。

Changing Modalities: Adapting Remote Sensing Models to New Satellites and Sensors Figure 1
2026-06-23cs.CV

Changing Modalities: Adapting Remote Sensing Models to New Satellites and Sensors

Tim G. Zhou, Anthony Fuller, Geoff Pleiss, Evan Shelhamer

University of British Columbia, Vector Institute, Carleton University

2026-06-23视觉感知

这篇论文针对遥感模型随卫星传感器新增、替换或退役而失效的问题,提出“变化模态”设定,并把模态迁移、增加与窥视统一到 DeluluNet 中:用已标注旧模态教师和未标注配对多模态数据,通过模态表征幻觉补全缺失输入。实验覆盖 Sentinel-2 跨波段与 Sentinel-1/2 跨卫星场景,显示无需新模态标签即可在三类适配任务中保持或提升预测能力。

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens Figure 1
2026-06-23cs.CV

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

2026-06-23视觉感知

这篇论文针对多模态大模型在视觉问答中虽能给出答案、却常把推理依据与图像证据脱钩的问题,指出文本坐标式 grounding 缺少与视觉特征的可学习语义连接,易产生“看似定位”的幻觉。作者提出 Composer,用 learned proxy-tokens 作为离散指针索引图像潜空间,并构建 ComposerGCoT 评估答案、推理链与定位一致性。实验显示其最终答案准确率与坐标基线基本持平,但整体 IoU 提升 2.7 点,严格 IoU@0.95 提升 9.0 点,说明收益主要体现在更精细、可信的视觉 grounding。

RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild Figure 1
2026-06-23cs.CV

RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild

Cheng Cui, Tingquan Gao, Xueqing Wang, Changda Zhou, Hongen Liu, Ting Sun, Yubo Zhang, Zelun Zhang, Jiaxuan Liu, Manhui Lin, Yue Zhang, Suyin Liang, Yiqing Xiang, Yi Liu

PaddlePaddle Team, Baidu Inc.

2026-06-23视觉感知

针对真实文档解析中版面元素耦合、拍摄/弯曲形变和阅读顺序需多阶段处理而易误差传播的问题,RT-DocLayout基于RT-DETR把分类、检测、像素级分割与阅读顺序关系预测统一到33M参数查询式解码器中,用掩码替代粗框提升OCR输入纯净度。实验称其在OmniDocBench等场景达92.46%综合准确率、132.1 FPS,并在扫描、扭曲、偏斜等扰动下优于对比方法。

VideoAgent: All-in-One Framework for Video Understanding and Editing Figure 1
2026-06-23cs.CV

VideoAgent: All-in-One Framework for Video Understanding and Editing

Hengji Zhou, Lingxuan Huang, Jian Wang, Bing Zhou, Si Wu, Lianghao Xia, Chao Huang

South China University of Technology, The University of Hong Kong, 3 Snap Inc, Harbin Institute of Technology, Shenzhen

2026-06-23视觉感知

这篇论文针对现有自动视频编辑系统只能处理短片段、任务专用且缺乏长视频叙事规划的问题,提出 VideoAgent:用镜头规划代理和跨模态检索生成连贯镜头序列,再由包含 30 多个专用编辑代理的编排框架通过意图过滤与文本梯度图优化组合工作流。实验在 VideoEdit 和公开数据集上报告 87–95% 编排成功率、API 成本降低 60%,人工评分仅比人类作品低约 4%。

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion Figure 1
2026-06-23cs.CV

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion

Yuqiang Huang, Yuxi Wang, Junyu Dong, Zhaoxiang Zhang

2026-06-23视觉感知生成模型三维

面向机器人水下感知与建图中动态水体、吸收和后向散射导致的单目4D重建不稳定问题,Ocean4D用4D-GCC聚合跨帧几何证据以补足遮挡和大视角变化下的条件信息,并在视频扩散去噪中加入深度调制的Medium-Aware Block隐式建模介质效应。论文在动态与静态水下基准上报告了几何一致性和视觉质量的SOTA结果。

Flow6D: Discrete-to-Continuous Flow Matching for Efficient and Accurate Category-Level 6D Pose Estimation Figure 1
2026-06-23cs.CV

Flow6D: Discrete-to-Continuous Flow Matching for Efficient and Accurate Category-Level 6D Pose Estimation

Mingyu Mei, Li Zhang, Zibo Dai, Han Sun, Xinyue Zhao, Huiliang Shen, Zaixing He

2026-06-23生成模型三维

Flow6D针对类别级6D位姿估计中连续回归易受噪声、局部最优和大搜索空间拖累的问题,将旋转与平移先离散成概率bin,用离散流匹配定位高置信潜空间,再以连续流匹配回归局部残差,从而兼顾粗定位与精细修正。方法可扩展到关节物体,在合成和真实数据上优于现有方法,并报告约70 FPS实时推理。

Transfer learning-based method for automated ewaste recycling in smart cities Figure 1
2026-06-23cs.CV

Transfer learning-based method for automated ewaste recycling in smart cities

Nermeen Abou Baker, Paul Szabo-Müller, Uwe Handmann

Ruhr West University of Applied Sciences, Lützowstr. 5, 46236 Bottrop, Germany, automation and reducing the need for labor., are not treated properly [3]. Moreover, when these recyclable

2026-06-23视觉感知

这篇论文面向智慧城市中快速增长的电子废弃物回收压力,关注如何减少人工分拣误差与数据采集成本。其核心做法是将预训练 AlexNet 迁移到手机废弃物识别任务,仅微调输出层,在包含 6 个品牌、12 类的小规模数据集上训练,并通过学习率、优化器和数据增强缓解过拟合。实验称使用 SGDM 与 3e-4 学习率可达到约 98% 准确率,但数据规模较小,实际工业泛化能力文中未充分说明。

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing Figure 1
2026-06-23cs.CV

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

City University of Hong Kong, City University of Hong Kong Hong Kong China

2026-06-23视觉感知强化学习三维

针对文本或粗粒度2D提示难以精确控制物体在3D空间中的平移、缩放和旋转,BoxCtrl将带RGB三正交面的3D包围盒投影到图像中作为视觉提示,用颜色对应解耦几何与外观控制;再以合成配对数据做SFT、无配对真实数据做RL,通过几何精度与视觉保真奖励缩小域差。实验显示其在平移、旋转、缩放及组合编辑上优于对比方法,但部分增益可能来自合成数据规模与RL奖励设计。

Safe Few-Step Generation via Velocity Editing Figure 1
2026-06-23cs.CV

Safe Few-Step Generation via Velocity Editing

Yujin Choi, Jaehong Yoon

2026-06-23安全鲁棒

本文针对少步数 flow matching 文生图模型中安全引导难以累积生效、提示嵌入编辑又受现代文本编码器限制的问题,提出无需训练的 VESFlow:不改 prompt,而是用安全后验的贝叶斯分解直接编辑速度场,并用风险评分跳过良性提示、在 VESFlow+ 中同时远离不安全方向。实验显示,在 4-step MeanFlow 上 NudeNet 攻击成功率降至 Ring-A-Bell 6.3%、MMA-Diffusion 6.8%,同时基本保持良性生成保真度。

No Figure
2026-06-23cs.CV

P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture

Felix Tristram, Stefano Gasperini, Benjamin Killeen, Marcel Walch, Christian Benz, Nassir Navab, Ghazal Ghazaei

Technical University of Munich, Munich Center for Machine Learning

2026-06-23视觉感知

这篇论文针对机器人/具身助手在长时序操作中难以仅凭短片段识别步骤语义的问题,提出P-JEPA:先用现有视频骨干提取帧对齐动作特征,再在30分钟级视频上做掩码潜变量预测,以学习程序进度和上下文依赖动作含义。实验显示其在EgoExo4D、EgoProceL、Assembly101上提升线性可分性、流式推理和时序动作分割,并以更少参数、实时速度达到EgoExo4D细粒度分类SOTA。

SteerVTE: Seamless Video Text Editing with Style and Glyph Control Figure 1
2026-06-23cs.CV

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang

Peking University, 2ByteDance China, 3ByteDance Singapore, requires. Meanwhile, existing controllable video editing methods [3, 9, 26, 36, 60] are tailored for global or, pairs are unavailable. We therefore design an automatic synthesis pipeline with four stages: text configuration

2026-06-23视觉感知规划控制

这篇论文针对视频中文字编辑难以同时保证字符准确、风格一致与跨帧稳定的问题,提出冻结视频 DiT、仅用轻量文本上下文适配器注入区域掩码、原文字体风格与行/字符级字形控制的 SteerVTE。其关键洞察是保留视频生成先验,用 GLAS 损失、三阶段课程和百万级合成/真实数据弥补视频模型弱文字渲染能力;在 VTE-Bench 上相较开源基线和 Seedance 2.0 显著提升文本准确率、风格相似度与时序一致性。

Privacy-Preserving Person Re-Identification from Temporal Sequences with Transformer and Hungarian Optimization Figure 1
2026-06-23cs.CV

Privacy-Preserving Person Re-Identification from Temporal Sequences with Transformer and Hungarian Optimization

Raphaël Delécluse, Hazem Wannous, Laurent Guimas

IMT Nord Europe, University of Lille, CNRS UMR 9189 - CRIStAL, F-59000 Lille, France

2026-06-23优化算法

面向公共空间行人重识别中 RGB 图像易泄露身份且受光照、遮挡影响的问题,论文以顶视深度序列为主,结合 Transformer 编码时序运动模式,并用匈牙利算法做跨视角全局匹配优化;在 TVPR2、GODPR、BIWI RGBD-ID 等数据集上,深度-only 方法在 CMC、mAP 上达到接近现有 RGB-D 方法的竞争性能,同时保留更强隐私属性。

PhysFlow: Frequency Decoupled with Dual-Field Rectified Flow for Remote Photoplethysmography Figure 1
2026-06-23cs.CV

PhysFlow: Frequency Decoupled with Dual-Field Rectified Flow for Remote Photoplethysmography

Zixu Li, jianjun Qian, Hang Shao, Lei Luo, Jian Yang

2026-06-23生成模型

本文针对远程光电容积描记在光照变化、表情和头动下脉搏信号易被扰动淹没的问题,提出 PhysFlow:将真实 rPPG 分解为趋势与幅度成分,并用双条件速度场的 rectified flow 分别生成,减少成分耦合且只需少量 ODE 步完成重建。实验称其在多个基准上同时提升心率估计和波形重建,但具体增益来源仍需结合消融细看。

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation Figure 1
2026-06-23cs.CV

RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation

Feifei Bian, Zhimin Zheng, Wei Deng, Daiguo Zhou, Jian Luan

MiLM Plus, Xiaomi Inc.

2026-06-23视觉感知

针对图像生成/编辑模型在隐含意图、多步视觉推理和 OOD 新知识上易失效的问题,RS-Gen 将生成流程改造成免训练、可插拔的多阶段智能体闭环:先识别知识缺口与逻辑障碍,再结合检索、ReAct 规划和生成-审查-修正完成任务。实验显示其在 WISE_Verified 与 RISEBench 上分别为 Qwen-Image 和 Qwen-Image-Edit-2511 带来 0.313、19.70 的绝对增益,并达到开源 SOTA。

Temporally Aware Densification for Dynamic 3D Gaussian Splatting Figure 1
2026-06-23cs.CV

Temporally Aware Densification for Dynamic 3D Gaussian Splatting

Vikram Sandu, Mayurdeep Pathak, Rajiv Soundararajan

2026-06-23三维

本文针对动态 3D Gaussian Splatting 仍沿用静态 densification、导致短生命周期运动区域监督稀疏和重建模糊的问题,提出把时间可见性纳入高斯分裂/克隆决策:用可见性加权梯度、按寿命自适应阈值,并通过时间偏移 warping 增强快速运动附近的形变能力。在 N3DV、Interdigital、VRU 等动态多视角数据上,方法主要提升动态区域的 Masked PSNR/SSIM,同时保持较高渲染速度,VAD 也可作为插件迁移到多种动态 3DGS 框架。

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning Figure 1
2026-06-23cs.CV

CFPO: Counterfactual Policy Optimization for Multimodal Reasoning

Zhangyuan Yu, Wanran Sun, Guangjing Yang, Xiaohu Wu, Qicheng Lao

2026-06-23视觉语言强化学习优化算法

这篇论文针对多模态强化学习只奖励最终答案、易让视觉语言模型依赖语言先验而忽视图像证据的问题,提出 CFPO:在注意力层构造反事实路径,抑制高显著视觉线索,并用事实与反事实预测差异正则化 GRPO/DAPO,以强化跨模态因果一致性。实验显示其在多模态推理任务上较标准 RL 基线提升 3.17%–6.25%,较 PAPO 提升 1.32%–2.13%。

Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets Figure 1
2026-06-23cs.CV

Unmasking LAION-5B: Age, Gender, Race, and Emotion Biases in Large-Scale Image Datasets

Iris Dominguez-Catena, Daniel Paternain, Mikel Galar

Institute of Smart Cities (ISC), Department of Statistics, Computer Science and Mathematics, Public University of Navarre

2026-06-23视觉感知数据集/基准

针对 LAION-5B 这类网络抓取图文数据可能把人口偏差传递给生成模型的问题,本文在 LAION-2B-en 与 LAION-2B-multi 的百万 URL 样本上,用 FairFace、DeepFace 和 Emo-AffectNet 自动估计人脸的年龄、性别、种族与表情,并用 Ducher’s Z 分析交叉与刻板关联。结果显示两部分都明显偏向 20–39 岁、白人和男性,少数族裔及中老年女性不足,且存在“愤怒-男性”“快乐-女性”等稳定情绪刻板偏差。

NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling Figure 1
2026-06-23eess.IV

NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling

Jaehyun Cho, YoungJoon Yoo

2026-06-23视觉感知

针对体数据相邻切片自监督去噪中错位会导致伪影、边界模糊,而简单掩码又丢弃高频解剖监督的问题,NGPS将结构匹配与信号取值解耦:用去噪引导图在局部搜索相似补丁,再从原始相邻切片取目标值,无需形变场或重采样。作者在低剂量CT、超低剂量CT和合成Rician MRI上报告了PSNR、SSIM及边缘相关指标的稳定提升,并显示对层厚和掩码阈值较鲁棒。

StreamPPG: Low-Latency rPPG Estimation via Consistent Privileged Learning Figure 1
2026-06-23cs.CV

StreamPPG: Low-Latency rPPG Estimation via Consistent Privileged Learning

Yiming Li, Yihan Yang, Yuguang Chu, Yuanhui Hu, Si-Yuan Cao, Xiaohan Zhang, Xiaokai Bai, Zhe Wu, Hui-Liang Shen

2026-06-23视觉感知

针对传统片段式 rPPG 需先缓存百余帧、带来数秒延迟,而逐帧方法又难建模生理周期的问题,StreamPPG 将逐帧流式推理与一致特权学习结合,训练时用真实 rPPG 信号强化表征并约束推理一致性,配合自适应时序模块关注脉搏区域和长程依赖。多数据集实验显示其在保持边缘设备实时吞吐的同时达到或超过片段式方法精度。

Interpretable Probabilistic Medical Image Segmentation via Gaussian Process with Explicit Modelling of Annotation Bias and Variability Figure 1
2026-06-23cs.CV

Interpretable Probabilistic Medical Image Segmentation via Gaussian Process with Explicit Modelling of Annotation Bias and Variability

Qi Li, Yuliang Huang, Shaheer U. Saeed, Qianye Yang, Vasilis Stavrinides, Zachary M. C. Baum, Dean C. Barratt, J. Alison Noble, Tom Vercauteren, Yipeng Hu

2026-06-23视觉感知三维

针对医学图像分割中多标注者存在系统偏差和不稳定性、但现有概率模型多在隐空间中隐式吸收这些差异的问题,论文提出在 logit 空间用 SVGP 建模图像相关参考分布,并以显式 bias/variance 表示标注者扰动。实验显示其在保持与 Pionono 相近 Dice/HD95 的同时,显著降低 ECE 和 NLL,且学到的参数能反映不同标注者行为。

Koshur Pixel: a large-scale synthetic ocr dataset for kashmiri Figure 1
2026-06-23cs.CV

Koshur Pixel: a large-scale synthetic ocr dataset for kashmiri

Haq Nawaz Malik, Faizan Iqbal, Nahfid Nissar

and rigorously demonstrate how programmatic data generation offers a scalable and cost-effective solution to, of meticulously labeled data, text is largely unavailable, these materials cannot, traditional, labor-intensive data collection paradigm., task of manually labeling noisy real-world scans, we, datasets, and allows for the scalable generation of over

2026-06-23数据集/基准

这篇论文针对克什米尔语 Nastaliq 文字缺乏可训练 OCR 数据、手工标注成本高且主流模型难以处理连写与层叠字形的问题,提出 Koshur Pixel:用 KS-PRET-5M 文本经 SynthOCR-Gen 程序化渲染为多字体、多粒度合成图像,并加入 25+ 类退化增强。主要结果是公开 613,078 对高保真图文样本,作为首个大规模克什米尔语 OCR 训练资源;但文中更侧重数据集构建与定性分析,实际模型精度增益文中未充分说明,可能主要来自 scaling / data。

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models Figure 1
2026-06-23cs.CV

T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models

Jaehyuk Jang, Minseok Seo. Seungju Cho, Kangwook Ko, Changick Kim

School of Electrical Engineering, KAIST

2026-06-23视觉语言视觉感知安全鲁棒

这篇论文针对零样本视觉语言模型在对抗扰动下视觉特征被破坏、而现有测试时提示或像素优化路径间接且昂贵的问题,提出 T-VSS:从同一受攻击图像的多视角特征残差中构建样本特定低秩子空间,并用可靠性加权熵最小化学习共享特征校正。实验显示其在细粒度、ImageNet 与 OOD 基准上提升鲁棒性,同时保持较好干净精度和更低推理开销;但防御感知攻击下仍会明显失效。

Expert Consensus on Criteria for the Automated Assessment of Laparoscopic Camera Navigation Figure 1
2026-06-23cs.CV

Expert Consensus on Criteria for the Automated Assessment of Laparoscopic Camera Navigation

Amir Ebrahimzadeh, Nazila Esmaeili, Michael Ghadimi, Jannis Hagenah

2026-06-23机器人

这篇论文针对腹腔镜摄像导航评价依赖人工打分、难以规模化反馈的问题,提出由14项技能组成的自动评估分类框架,并将其归入构图、清晰度、稳定性、运动和安全意识五类。作者结合23名外科医生问卷与现有计算机视觉能力,构建“临床重要性—技术就绪度”矩阵,发现视野、对焦和居中最受重视,也最适合作为近期自动化评估与训练反馈的优先目标。

Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations Figure 1
2026-06-23cs.CV

Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations

Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano

2026-06-23视觉感知

这篇论文针对隐式神经表示中“高频表达易记噪、紧支撑激活又偏低频”的谱选择矛盾,将神经元激活建模为受迫阻尼振子的稳态响应,用可学习的固有频率与阻尼形成训练中的谱门控。其关键洞察是带宽不靠显式正则或手工调参,而由优化动态从窄带逐步放宽,实现由粗到细并更难接纳随机噪声。实验称在多类 INR 重建任务上达到 SOTA 或竞争性能,且无需任务特定超参。

MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection Figure 1
2026-06-23cs.CV

MambaADv2: Evolving Duality-enhanced State Space Model for Unsupervised Anomaly Detection

Xiaobin Hu, Haoyang He, Bo Yin, Yu He, Lei Xie, Jiangning Zhang, Yu-Gang Jiang, Shuicheng Yan

Xiaobin Hu, Haoyang He, Lei Xie and Jiangning Zhang are with Zhejiang University, Hangzhou, China., Xiaobin Hu, Bo Yin, and Shuicheng Yan are with the School of Computing, National University of Singapore, Singapore., Yu He is with College of Computing and Data Science, Nanyang Technological University, Singapore, Yu-Gang Jiang is with the Institute of Trustworthy Embodied AI, Fudan University University, Shanghai, China.

2026-06-23视觉感知

面向工业视觉异常检测中 CNN 难建模长程关系、Transformer 计算开销高且多类别场景效率不足的问题,MambaADv2 将预训练编码器与 Mamba 式解码器结合,在多尺度 DSS 模块中融合 HSS 状态空间建模、频域增强卷积和语义自适应渐进扫描,以兼顾全局依赖、局部纹理与效率。论文在六个异常检测数据集、七项指标上报告优于现有方法的结果,但具体增益中有多少来自模型扩容与更高分辨率仍需结合消融判断。

LUMINA-26: Low-Light Understanding for Modeling and Interpreting Night-time Actions Figure 1
2026-06-23cs.CV

LUMINA-26: Low-Light Understanding for Modeling and Interpreting Night-time Actions

Aman Kumar Pandey, Anil Singh Parihar

2026-06-23视觉感知

该文针对夜间监控等真实低照度场景中动作识别易受噪声、低对比度和运动模糊影响的问题,提出真实采集的 LUMINA-26 数据集,并设计基于光照估计的 Illumi-Net,用 MoE 自适应增强与 VideoMAE 时空建模联合分类。实验在 ELLAR 上达到 Top-1 55.13%,在新数据集上给出 Top-1 75.95% 基线;但增益可能部分来自数据覆盖与模型组合,消融细节仍需进一步核实。

Technical Report for the ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Pretraining-Diverse Ensemble of Foundation Vision Encoders for Robust Outdoor Scene Understanding Figure 1
2026-06-23cs.CV

Technical Report for the ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Pretraining-Diverse Ensemble of Foundation Vision Encoders for Robust Outdoor Scene Understanding

Boyan Wang, Yongxi Huang, Wenjing Li, Tianrui Hui, Shaofei Huang, Nan Pu, Zhun Zhong

LION Lab, Hefei University of Technology, Hefei, China. 2 University of Macau, Macau, China.

2026-06-23视觉感知安全鲁棒

面向野外机器人在多平台、长尾类别和光照变化下的细粒度语义分割,论文将问题聚焦到感知骨干而非解码器微调。作者固定 Mask2Former,比较不同预训练视觉编码器,指出预训练范式比参数量更决定 GOOSE 表现;再用 DINOv3、SigLIP2、InternImage 做按类别 IoU 加权集成。最终在官方测试集取得 75.40% composite mIoU、挑战第二名。

Compression and Retrieval: Implicit Memory Retrieval for Video World Models Figure 1
2026-06-23cs.CV

Compression and Retrieval: Implicit Memory Retrieval for Video World Models

Zhan Peng, Jie Ma, Huiqiang Sun, Chong Gao, Zhijie Xue, Zhiyu Pan, Zhiguo Cao, Jun Liang, Jing Li

Huazhong University of Science and Technology, Sun Yat-sen University, Huazhong University of Science and Technology China, Sun Yat-sen University China

2026-06-23视觉感知强化学习

这篇论文针对视频世界模型在复杂相机轨迹下难以长期保持场景记忆的问题,提出 CaR:将压缩后的历史上下文与目标视频 token 拼接,并用带相机投影编码的注意力进行隐式检索,同时用轻量压缩网络降低长上下文开销。作者还构建 SceneFly 数据集;实验显示其在视频延展、场景重访和硬切换轨迹中优于全上下文与显式检索基线,并具备一定开放场景泛化能力。

Scene-agnostic ALS boresight self-calibration Figure 1
2026-06-23cs.CV

Scene-agnostic ALS boresight self-calibration

Aurélien Brun, Jan Skaloud

2026-06-23视觉感知

针对传统机载激光扫描 boresight 标定依赖特定航线和含多姿态平面的结构化场景、难以嵌入常规测图任务的问题,论文用重叠航带自动提取的场景无关点对点对应替代平面约束,并给出轻量 Gauss-Helmert 调整与联合 GNSS/惯导原始观测的动态网络两种估计方式。四次飞行、五类惯导实验显示,在轨迹质量足够且有约 3–4 条重叠航带时可无专门场景恢复 boresight;若存在显著时变姿态误差,动态网络更可靠,轻量方法更多起到吸收平均姿态误差、改善点云一致性的作用。

Poisson2Gaussian: Noise Gaussianization to Enhance Image Denoising Figure 1
2026-06-23cs.CV

Poisson2Gaussian: Noise Gaussianization to Enhance Image Denoising

Xirou Zhou, Zijing Xu, Yibo Qu, Qi Zhang, Xiaowan Hu, Xinyang Li

College of AI, Tsinghua University, Beijing, China, Department of Automation, Tsinghua University, Beijing, China, School, of Electronic and Information Engineering, Beihang University, Beijing, China

2026-06-23视觉感知三维

本文针对低光摄影、显微和天文成像中泊松主导噪声的信号相关、异方差和偏斜分布问题,指出这类噪声比独立同分布高斯噪声更难被去噪网络学习。核心创新是用可逆流做 Poisson2Gaussian,通过完整概率密度匹配把残差显式高斯化,并与 Noise2Noise 式无偏训练交替优化下游去噪器,无需干净配对或显式噪声参数。实验显示其在多数据集达到领先表现,在强非高斯场景 PSNR 最高提升 0.75 dB,且可插入多种去噪架构。

Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection Figure 1
2026-06-23cs.CV

Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection

KunHo Heo, Seungjae kim, Wongyu Lee, SuYeon Kim, MyeongAh Cho

2026-06-23视觉感知

这篇论文针对少样本目标检测中原型相似度方法的两个瓶颈:类别间相似度边界塌缩导致混淆,以及相似度分数缺少定位所需的空间细节。作者用文本特征作为语义锚筛选视觉通道,抑制风格噪声,并将 ViT 多层特征按阶段注入自回归框回归过程,实现由粗到细定位。在 COCO 上报告较前一最佳方法提升 10.1 nAP,消融显示两部分均有贡献。

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs Figure 1
2026-06-23cs.CV

Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs

Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu

The Hong Kong University of Science and Technology (Guangzhou), Sun Yat-sen University, Nanyang Technological University, Renmin University of China, Tsinghua University

2026-06-23视觉语言

本文针对多模态大模型在连续适应新视觉域、问题类型和指令时容易遗忘旧能力的问题,提出 ASR:不回放旧样本,而是把跨模态注意力图视为二维信号,保存按技能聚合的频谱原型,并用相位不变正则约束后续训练中的有害漂移。其核心洞察是旧技能遗忘与技能条件化的视觉注意结构漂移相关。实验在 VQA v2、VQACL、CLT-VQA、CoIN、UCIT 等连续 VQA 和多模态指令调优基准上显示,ASR 相比回放、正则化和适配器基线提升最终性能并降低遗忘。

No Figure
2026-06-23cs.GR

VolHuMe: a High-Resolution Large Scale Dataset of Volumetric Human Meshes

Giulia Martinelli, Niccolò Bisagno, Nicola Garau, Esa Rahtu, Nicola Conci

2026-06-23数据集/基准

针对现有4D人体重建数据集难以同时兼顾规模、真实运动、高精细几何与丰富标注的问题,VolHuMe用64个RGB和32个深度相机近距离采集104名受试者,提供高分辨率纹理网格、多视角RGB/深度、点云、SMPL-X/FLAME拟合、服装分割和可绑定网格等真值。论文在3D/4D人体重建、动态网格序列和服装人体动画任务上评测现有方法,结果显示该数据集能暴露当前基准和方法在细节重建上的不足,收益可能主要来自更高质量、更完整的数据。

MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning Figure 1
2026-06-23cs.CV

MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning

Weile Guo, Shenghong He, Danying Mo, Chengdong Xu, Xuexun Liu, Chao Yu

Sun Yat-Sen University, Shenzhen University

2026-06-23视觉感知

这篇论文针对双视频动作纠错中多模态大模型常把外观、视角或语言先验误当作真实运动差异的问题,提出 MotionHalluc 基准,从方向、归因和时间对齐三类运动幻觉诊断细粒度运动推理,并给出无需训练的 PPV 量化测量验证流程。实验显示现有五类先进模型均易出错,而注入显式运动学证据平均提升 10.6%,说明可靠动作反馈需要可验证的关节/时序测量支撑。

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction Figure 1
2026-06-23cs.CV

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

2026-06-23规划控制

这篇论文针对多人轨迹预测中时间动态、多模态线索与社会交互常被混在高成本注意力模块里、导致扩展性和可解释性不足的问题,提出三步层次化 Transformer:先按模态编码时间,再用 GRU 摘要和跨模态注意力融合,最后在时间-行人 token 上做社会注意力。实验在 JRDB、Urban 真实数据上达到 SOTA,在 JTA 上具竞争力,消融显示各阶段均有贡献。

Unlimited OCR Works Figure 1
2026-06-23cs.CV

Unlimited OCR Works

Youyang Yin, Huanhuan Liu, YY, Qunyi Xie, Chaorun Liu, Shiqi Yang, Shaohua Wang, Zhanlong Liu, Hao Zou, Jinyue Chen, Shu Wei, Jingjing Wu, Mingxin Huang, Zhen Wu, Guibin Wang, Tengyu Du, Lei Jia

Baidu Inc.

2026-06-23视觉感知

这篇技术报告针对端到端 OCR 在长序列生成中 KV cache 持续膨胀、难以一次解析多页文档的问题,提出 Reference Sliding Window Attention:生成 token 始终关注视觉/提示参考 token,但只保留近邻输出窗口,从而保持恒定缓存并避免视觉状态被递归模糊。基于 DeepSeek OCR 改造后,Unlimited OCR 可在 32K 长度内一次转写数十页,并在 OmniDocBench v1.5 达到 93.23%,较基线提升 6.22 分;但增益可能也受 2M PDF 数据继续训练影响,来源未完全拆清。

UECP: Uncertainty-Enhanced Collaborative Perception Figure 1
2026-06-23cs.CV

UECP: Uncertainty-Enhanced Collaborative Perception

Kang Yang, Tianci Bu, Peng Wang, Deying Li, Wen Jie, Yongcai Wang

2026-06-23安全鲁棒

这篇论文针对自动驾驶协同感知中置信图与检测头耦合、难以可靠抑制协作噪声的问题,提出用 LiDAR 点密度监督的不确定性图作为物理证据,并通过 UAPF 的不确定性加权下采样与残差融合嵌入多尺度 BEV 融合。实验在 DAIR-V2X、V2V4REAL 上优于 HEAL、CoBEVT 等方法,并在噪声条件下保持更强鲁棒性。

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models Figure 1
2026-06-23cs.CV

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

2026-06-23视觉语言

论文针对多模态大模型“能理解但难生成”的语义特征与像素重建错位问题,提出 SPAR:用非对称语义/像素双流 tokenizer 保留判别语义并补回高频细节,再让该 tokenizer 作为扩散模型的内部对齐教师,并通过动态 token 路由融合多层 MLLM 特征。实验称其在统一架构下提升重建与生成质量,同时基本保留视觉理解能力。

No Figure
2026-06-23cs.CV

DrivingVoxels: Compositional Sparse Voxel Rasterization for Dynamic Driving Scene Reconstruction

Tania Aguirre, Luis Roldão, Moussab Bennehar, Nathan Piasco, Dzmitry Tsishkou, Simone Rossi, Pietro Michiardi

2026-06-23三维

该文针对自动驾驶动态场景中稀疏体素方法多限于静态、而3DGS动态方案训练慢且内存不稳定的问题,提出DrivingVoxels:用背景八叉树与各刚体目标局部八叉树组合渲染,并通过射线-包围盒排序解决跨体素体的深度合成,结合LiDAR初始化加速几何收敛。在PandaSet上,其感知指标与StreetGS相当,结构重建更好,示例中CD从0.19降至0.06、F1从31.8%升至59.9%,训练时间约从102分钟降至30分钟。

Physics-Guided Spatiotemporal State Space Modeling for Lookahead Molten Pool Segmentation in Laser Wire-Feed Welding Figure 1
2026-06-23cs.CV

Physics-Guided Spatiotemporal State Space Modeling for Lookahead Molten Pool Segmentation in Laser Wire-Feed Welding

Sen Li, Haichao Cui, Changhao Yin, Chendong Shao, Yaqi Wang, Xinhua Tang, Fenggui Lu

Shanghai Key Laboratory of Materials Laser Processing and Modification, School of Materials Science and Engineering, Shanghai Jiao Tong University

2026-06-23视觉感知

面向激光送丝焊闭环控制中的感知、计算和执行延迟,本文将任务从当前熔池分割推进到提前预测关键孔、焊丝与熔池的未来像素布局。其核心是 WeldMamba:把历史同轴灰度图、工艺参数和焊丝电信号共同注入特征归一化与时空状态空间建模,并用预测时域条件、SDF/时序一致性和关键孔运动约束稳定几何。43 段数据上 500 ms 前视达到 74.63% mIoU,消融显示时间历史、patch 级状态空间和关键孔运动建模贡献最大。

Learning Stable Canonical Worlds for Novel View Synthesis and Beyond Figure 1
2026-06-23cs.CV

Learning Stable Canonical Worlds for Novel View Synthesis and Beyond

Xiaoyu Xu, Jian Zou, Sheyang Tang, Zhihua Wang, Jing Liao, Kede Ma

Department of Computer Science, City University of Hong Kong, Department of Electrical and Computer Engineering, University of Waterloo

2026-06-23强化学习

论文针对现有前馈 Gaussian Splatting 在多视角输入增加时仍偏向视角依赖预测、易累积噪声和冗余的问题,提出 CanonicalGS:先从图像估计深度、语义特征与不确定性,再在规范化潜在世界中做可靠性加权融合,最后解码为高斯 primitives。实验显示其在新视角合成上最高提升约 2.5 dB PSNR,并带来 11% 语义分割精度增益,但对姿态、深度质量和动态遮挡仍较敏感。

Boosting Neural Video Codec via Scale-Driven Online Flow Refinement Figure 1
2026-06-23cs.CV

Boosting Neural Video Codec via Scale-Driven Online Flow Refinement

Tiange Zhang, Rongqun Lin, Haocheng Tang, Xiandong Meng, Weijia Jiang, Zhimeng Huang, Siwei Ma

Peking University Shenzhen Graduate School, Pengcheng Laboratory, City University of Hong Kong, School of Computer Science, Peking University, Migu Interactive Entertainment Co., Ltd

2026-06-23视觉感知生成模型

这篇论文针对神经视频编码在测试视频出现复杂、训练外运动时光流估计失准、在线微调又代价高的问题,提出训练无关的 SOFR 插件:在推理时生成粗/细两种尺度光流,并依据 warping 误差与码率模式自适应软融合,同时用可靠性检查抑制无效粗尺度候选。在 USTC-TD 上接入 DCVC-SDD、DCVC-FM、EHVC 均有泛化收益,DCVC-FM 平均 BD-Rate 降低 2.84%(PSNR)和 4.05%(MS-SSIM),编码时间增量很小。

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers Figure 1
2026-06-23cs.CV

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song

2026-06-23视觉感知生成模型

视频扩散 Transformer 的 3D 全注意力带来二次复杂度,动态稀疏开销高、静态启发式又损伤质量。ScalingAttention 的核心洞察是各注意力头的高质量区域会收敛为由权重编码、跨提示稳定且尺度不变的内在稀疏拓扑,并用 WEST 离线提取拓扑、FAST 按扩散阶段调节头级稀疏度,配合块稀疏核实现加速。在 Wan2.1 上最高获得 1.90× 端到端加速,并在相近保真度下优于 SVG/SVG2 的效率—质量权衡。

From Point Estimates to Distributions: GMM Pooling for MIL in Preterm Birth Prediction Figure 1
2026-06-23cs.CV

From Point Estimates to Distributions: GMM Pooling for MIL in Preterm Birth Prediction

Hussain Alasmawi, Numan Saeed, Soha Said, Mohammad Yaqub

2026-06-23视觉感知

这篇论文针对早产预测中常只选单帧经阴道超声、丢失同一患者多图像差异的问题,将患者检查建模为MIL图像包。核心创新是用端到端GMM pooling表示包内特征分布,而非均值、最大或注意力的点估计,并通过可学习探针形成固定嵌入。结果显示PTB任务PR-AUC由0.44升至0.56,在淋巴结MIL基准上也达到0.91 F1和0.89 ROC-AUC,但临床私有数据细节限制了泛化判断。

MotionMAR: Multi-scale Auto-Regressive Human Motion Reconstruction from Sparse Observations Figure 1
2026-06-23cs.CV

MotionMAR: Multi-scale Auto-Regressive Human Motion Reconstruction from Sparse Observations

Yuhua Luo, Junsheng Zhang, Mengyin Liu, Xincheng Lin, Ming Yan, Zhudi Chen, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang

*Equal contribution 1Fujian Key Laboratory of Urban Intelli-, gent Sensing and Computing, Xiamen University 2Key Laboratory, istry of Education of China, School of Informatics, Xiamen Univer-, sity 3National Institute for Data Science in Health and Medicine, Xiamen University 4ShanghaiTech University. Correspondence to:

2026-06-23三维

MotionMAR针对VR/AR头手三点等稀疏观测下全身动作重建易漂浮、抖动且长短期细节难兼顾的问题,将人体运动视为由低频全局轨迹到高频局部细节的时间层级过程。其核心是把视觉VAR的next-scale思想改造成时间多尺度自回归:TMT VQ-VAE按时间分辨率离散运动,MAN由粗到细生成索引,SAC把稀疏追踪信号对齐到各尺度,MRN再平滑量化伪影。实验称在AMASS上达到SOTA精度和时间一致性,但片段中主要结果集中在该数据集,真实设备泛化与各模块增益幅度仍需看完整实验。

Black-Box Continual Learning for Vision-Language Models Figure 1
2026-06-23cs.CV

Black-Box Continual Learning for Vision-Language Models

Yuting Li, Weihang Fang, Haoyuan Gao, Linghe Kong, Yexin Li, Lichao Sun, Weiran Huang

Yuting Li is with the School of Computer Science, Shanghai Jiao Tong, School, gent Sensing, Shanghai Jiao Tong University, Shanghai, China (e-mail:, Haoyuan Gao is with the School of Computer Science, Shanghai Jiao Tong, Linghe Kong is with the School of Computer Science, Shanghai Jiao Tong, Yexin Li is with the State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI), Beijing, China, Lichao Sun is with the Department of Computer Science and Engineering, Weiran Huang is with the School of Computer Science, Shanghai Jiao, Tong University, and Shanghai Innovation Institute, Shanghai, China (e-mail:, all seen classes in a global label space without a task ora-, crimination across an expanding global universe of labels.

2026-06-23视觉语言视觉感知

本文针对云端或边缘部署的视觉语言模型难以访问权重、结构和梯度的问题,提出更贴近实际的黑盒持续学习基准 Black-CL。核心洞察是仅优化外部文本原型也可缓解增量学习遗忘,方法 BETA 结合语义投影积累、潜在分布回放和测试时原型自适应。在 10 个数据集和多种 VLM 骨干上,BETA 以约 0.05M 可训练参数显著超过现有黑盒调优方法,并接近甚至部分超过白盒持续学习方法。

Can Single-View Mesh Reconstruction Generalize to Robot Camera Rotation? Figure 1
2026-06-23cs.CV

Can Single-View Mesh Reconstruction Generalize to Robot Camera Rotation?

Yu Zhan, Guangcheng Chen, Hanjing Ye, Zhiqin Cheng, Zanjia Tong, Wenjun Xu, Hong Zhang

2026-06-23机器人三维

这篇论文关注机器人腕部、机身等相机旋转时,单视角网格重建是否仍可作为可靠空间感知模块。作者设计按 roll/pitch/yaw 控制旋转的评测,追踪 MDE、规范物体网格、相机坐标布局和物理合理性误差,发现旋转主要破坏深度点图与布局,规范网格相对稳定;两阶段 SAM3D+FoundationPose 比端到端布局更稳,引入重力约束的 GAR 将一阶段布局方向误差降低 47.1%,说明显式重力线索对机器人场景重建很关键。

Subject-Level Unknown-Identity Identification from Leap Motion Controller 2 Hand Landmarks Figure 1
2026-06-23cs.CV

Subject-Level Unknown-Identity Identification from Leap Motion Controller 2 Hand Landmarks

Bahar Moharrer, Susanna Cifani, Marco Raoul Marini, Luigi Cinque, Maria De Marsico

2026-06-23规划控制

本文动机是把原用于手姿态的 ML2HP/LMC2 手部 landmark 数据转化为接触式之外的身份识别与未知身份拒识问题。核心做法是在原始几何特征上加入指尖到掌心距离、掌心归一化指间角度,并用嵌套 LOSO 避免阈值调到真实未知主体。结果显示 Extra Trees 明显优于 MLP 与 OpenMax,开放集准确率约 91.3%、未知召回约 85.1%,说明难点主要在已知/未知分数分离而非闭集分类。

Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI Figure 1
2026-06-23cs.RO

Humanoid-OmniOcc: Stereo-Based Full-View Occupancy Dataset for Embodied AI

Xianda Guo, Bohao Zhang, Chenwei Huang, Shiyuan Chen, Ruilin Wang, Yiqun Duan, Cong Yang, Qin Zou, Wei Sui

School of Computer Science, Wuhan University, Soochow University

2026-06-23机器人数据集/基准

本文针对现有占据预测数据集偏向自动驾驶、难以覆盖人形机器人室内近场全向感知的问题,提出 Humanoid-OmniOcc:基于 Unitree G1 传感器参数在 Isaac Sim 中构建四向环视双目数据,并用 Real2Sim2Real 流程生成 15 个仿真场景、5 个真实环境的 155K+ 样本。配套 HS2Occ 利用双目深度先验进行 2D 到 3D 提升,实验显示其优于单目基线,并在未见仿真场景和真实采集上有较好泛化。

Concept Alignment Contrast and Long-Short Prompt Memory for Test-Time Adaptation of SAM3 in Medical Image Segmentation Figure 1
2026-06-23cs.CV

Concept Alignment Contrast and Long-Short Prompt Memory for Test-Time Adaptation of SAM3 in Medical Image Segmentation

Yubo Zhou, Jianghao Wu, Ping Ye, Shaoting Zhang, Guotai Wang

2026-06-23视觉感知

这篇论文针对 SAM3 从自然图像迁移到医学分割时域差明显、现有测试时自适应过度依赖图像级不确定性且连续更新不稳定的问题,提出 CM-TTA:用概念对齐对比衡量前景/背景与文本提示的语义一致性来选伪标签视图,并以长短期提示记忆和密集伪监督更新提示。在前列腺与皮肤病灶分割上,Dice 较基线分别平均提升 3.17 和 6.07 个百分点。

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production Figure 1
2026-06-23cs.AI

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production

Guilhem Fauré (MULTISPEECH), Mostafa Sadeghi (MULTISPEECH), Sam Bigeard (MULTISPEECH), Slim Ouni (LORIA)

VAEs are made available online1.

2026-06-23生成模型三维

这篇论文针对扩散式手语生成中“VAE只看重建误差是否足够”的常见假设,系统比较四种手语姿态VAE设计,分析架构与训练目标如何改变潜空间结构及其对下游文本到手语扩散模型的影响。PHOENIX14T实验显示,生成质量的BLEU差异有时比起重建精度,更能由潜空间性质解释,提示VAE设计需面向生成任务而非单纯优化几何重建。

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models Figure 1
2026-06-23cs.LG

PG-MAP: Joint MAP Optimization for Inference-Time Alignment of Diffusion and Flow-Matching Models

Ruolan Sun, Pawel Polak

Stony Brook University

2026-06-23生成模型优化算法

针对扩散与流匹配模型推理期对齐多沿单一控制轴、难以同时处理文本条件与潜变量依赖的问题,PG-MAP将每个去噪步表述为带前向一致性耦合的轨迹级近端MAP优化,按噪声日程自适应联合更新条件嵌入与潜状态,并在流匹配中退化为潜变量更新。实验显示其在SD1.5/SDXL上提升PickScore与美学指标,可与调优CFG叠加;在SD3.5-medium上相对静态基线取得91.9% PickScore、75.7% HPS胜率,人评也偏好该方法。

Evo-RAD: Navigating Rare Retinal Disease Diagnosis via Self-Evolving Agentic Retrieval Figure 1
2026-06-23cs.CV

Evo-RAD: Navigating Rare Retinal Disease Diagnosis via Self-Evolving Agentic Retrieval

Wangding Xia, Ye Du, Jiashi Lin, Meng Wang, Danli Shi, Shujun Wang

2026-06-23视觉感知

针对稀有视网膜病在预训练眼科模型中样本不足、易被常见病近邻误导的问题,Evo-RAD 将检索增强诊断从一次性相似度匹配改为自演化决策过程,用图代理在参考病例集中删除不一致证据、插入病理一致样本并适时终止,并以同质性奖励和 GRPO 训练。实验显示其较视网膜基础模型提升 21.04%,较静态检索与 PEFT 方法提升 3.56%。

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents Figure 1
2026-06-23cs.AI

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

University of Pennsylvania, Peking University

2026-06-23视觉感知

这篇论文针对长程 GUI 代理在真实桌面中反馈稀疏、VM rollout 昂贵且易被中断的问题,提出 ENVS:先在 OSWorld 中对行为差异明显的动作做环境原生搜索,用任务 oracle 验证成功轨迹,再将其整理为全局均衡的逐步监督数据进行 SFT,而非在线 RL。实验显示 ENVS 在 OSWorld 达到 30.3 pass@8、OSWorld-Noisy 达到 29.0,并以更少 GPU 小时超过 ARPO;30% 搜索数据仍达 27.0,说明增益可能主要来自高质量验证数据与数据均衡。

Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models Figure 1
2026-06-23cs.GR

Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models

Junrong Huang, Zhiyuan Zhang, Rui Tang, Hongbo Fu, Jnig Liao

City University of Hong Kong, Manycore Tech Inc., Hong Kong University of Science and Technology, City University of Hong Kong Hong Kong China, Manycore Tech Inc. Hang Zhou China, Hong Kong University of Science and Technology Hong Kong China

2026-06-23生成模型规划控制

该文针对生成式材质/纹理迁移难以按用户指定频率、方向和尺度精确平铺且易损失高频细节的问题,提出在 DiT 中把仿射变换注入 RoPE 坐标而非直接扭曲像素,并用分离注意力掩码减少参考纹理与背景语义泄漏;实验称在合成和真实基准上较现有方法提升控制精度、纹理保真度与视觉融合效果,但部分收益可能受数据集与上游几何/光照估计质量影响。

Evaluating self-supervised echocardiographic representations across downstream extraction strategies for left-ventricular segmentation and ejection fraction estimation Figure 1
2026-06-23cs.CV

Evaluating self-supervised echocardiographic representations across downstream extraction strategies for left-ventricular segmentation and ejection fraction estimation

Sylwia Majchrowska, Philip Teare

2026-06-23视觉感知

这篇论文关注医学影像自监督表征评估中的一个偏差:密集任务性能常被下游探针能力混淆。作者在 EchoNet-Dynamic 上以左心室分割和射血分数估计为例,系统比较启发式提取、线性探针、轻量解码器和部分微调。结果显示,启发式方法显著低估 DINOv3 与 BYOS 表征;冻结轻量解码器可将 Dice 提升到约 0.90,并使 EF 误差接近或优于监督基线,而微调增益有限,说明多策略评估比单一探针更可靠。

Hybrid Compression: Integrating Pruning and Quantization for Optimized Neural Networks Figure 1
2026-06-23cs.CV

Hybrid Compression: Integrating Pruning and Quantization for Optimized Neural Networks

Minh-Loi Nguyen, Long-Bao Nguyen, Van-Hieu Huynh, Minh-Triet Tran, Trung-Nghia Le

2026-06-23视觉感知

面向边缘和嵌入式设备部署时 CNN 计算与存储开销过高的问题,本文将剪枝、量化感知训练与 MoE 路由结合:先用 AGP 等方法压缩多个专家模型,再由门控选择压缩专家以弥补精度损失。在 CIFAR-10 和 BloodMNIST 上报告 FLOPs 降低约 10–11 倍、参数约 10.5 倍,精度仅小幅下降;但 MoE 相对单纯剪枝量化的独立增益来源仍需进一步说明。

BEV-Denoise: Learning Intrinsic Noise for Accurate Bird's-Eye-View Semantic Segmentation Figure 1
2026-06-23cs.CV

BEV-Denoise: Learning Intrinsic Noise for Accurate Bird's-Eye-View Semantic Segmentation

Dooseop Choi, Kyounghwan An, Kyoung-Wook Min

Electronics and Telecommunications Research Institute (ETRI), University of Science and Technology (UST)

2026-06-23视觉感知

该文针对多相机 BEV 语义分割中因未知深度、遮挡和恶劣天气导致的 BEV 特征内生噪声问题,提出 BEV-Denoise:借鉴 DDPM 的噪声估计能力,用 UNet 单次预测并从 BEV 特征中减去噪声;同时借助任务分解和预训练 BEV 地图自编码器获得训练监督。作者将其接入四类代表性 VT 模型,在 nuScenes 上报告了稳定性能提升,但具体增益与网络复杂度的权衡仍需进一步说明。

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework Figure 1
2026-06-23cs.CV

MythraGen: Two-Stage Retrieval Augmented Art Generation Framework

Quang-Khai Le, Cong-Long Nguyen, Minh-Triet Tran, Trung-Nghia Le

2026-06-23视觉感知

本文针对文本到艺术图像生成中仅靠文字难以精确表达画家风格、逐艺术家微调又成本过高的问题,提出 MythraGen:先用 BLIP-2 融合图像与元数据特征,并通过 FAISS 从 WikiArt 检索与提示在内容、流派和风格上相近的作品,再用这些样本以 LoRA 微调 Stable Diffusion。实验和用户研究显示其在提示匹配与艺术风格复现上优于若干开源和商业基线,但具体增益中检索质量、LoRA 微调与数据规模各自贡献仍需更细消融说明。

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation Figure 1
2026-06-23cs.CV

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

Queen Mary University of London, Huawei Darwin Research Center, Imperial College London

2026-06-23视觉语言视觉感知数据集/基准

这篇论文针对视频/世界模型越来越依赖 VLM 当物理一致性裁判、但固定评测维度无法匹配不同 VLM 感知能力的问题,提出 JudgeFit:先让目标 VLM 自述物理错误并聚类成初始分类,再用人类物理常识评分校准、诊断冗余或不可靠维度并迭代修订。作者在 16 个 VLM、8 个模型家族上验证,个性化分类在所有模型上优于全局 schema,平均相对提升约 32%,并揭示了总体排名掩盖的模型特定盲点。

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving Figure 1
2026-06-23cs.CV

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

Zisheng Chen, Yuping Qiu, Jianhua Han, Tao Tang, Xiuwei Chen, Likui Zhang, Ying-Cong Chen, Hang Xu, Xiaodan Liang

Sun Yat-sen University, Yinwang Intelligent Technology Co. Ltd.

2026-06-23视觉语言

本文针对端到端自动驾驶VLA模型常一次性生成轨迹、缺少对未来后果检验的问题,提出IRR-Drive:先生成文本驾驶意图,再预测未来语义BEV作为具身反思空间,并按场景复杂度自适应选择直接规划或反思修正;训练上结合反思数据与GSPO奖励以兼顾性能和开销。实验称其在NAVSIM v1/v2的PDMS和EPDMS达到SOTA,说明多模态反思与自适应策略有效,但具体增益中数据构造和强化学习各自贡献仍需细看消融。

Improving Robotic Imitation Learning via Trajectory Standardization Figure 1
2026-06-23cs.RO

Improving Robotic Imitation Learning via Trajectory Standardization

Licheng Yang, Lingfeng Qian, Fei Zheng, Yonghao He, Wei Sui, Shuangshuang Li, Hu Su

2026-06-23机器人模仿学习规划控制

这篇论文针对遥操作示教中速度不均、停顿和冗余点会制造非马尔可夫矛盾并拖累模仿学习的问题,提出离线的 ISR 轨迹重采样:用速度与加速度构造信息强度,在黎曼流形上按近似等信息距离选点,从而压缩低价值片段并保留高曲率、接触前减速等关键阶段。三项真实操作任务中,相比 3× 时间均匀下采样,π0.5 平均成功率由 47.8% 升至 71.8%,VO-DP 由 62.7% 升至 80.2%,同时减少数据量和训练成本。

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars Figure 1
2026-06-23cs.CV

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

2026-06-23视觉感知

本文针对实时流式数字人长期生成中易出现视觉漂移、且动作主要受音频驱动而难以体现用户意图的问题,提出 InteractiveAvatar。其核心是在流式扩散框架中加入长短期视觉记忆以压缩并保留历史状态,并用推理-反应模块结合状态循环与缓存切换生成意图对齐的语音和动作。实验显示其在长时一致性和复杂交互场景中优于现有方法,同时保持实时生成能力。

IViT: A Novel Interpretable Visual Transformer for Skin Disease Detection Figure 1
2026-06-23eess.IV

IViT: A Novel Interpretable Visual Transformer for Skin Disease Detection

Haibiao Li, Di Lin, Xue Jiang, Weiwei Wu, Yanxi Li, Yugang Chi

School of Information and Software Engineering, University of, Department of Dermatology, Chongqing Traditional Chinese Medicine, Chongqing Health Center for Women and Children, Chongqing, protection. As a result, available high-quality annotated, models in this field. Section 3 elaborates the overall pipeline, of reasoning controllability in medical scenarios [36]., features of images [40].However, labeled skin disease datasets

2026-06-23视觉感知

针对皮肤病图像中类间相似、医生经验依赖以及ViT黑箱且少样本适应差的问题,论文提出IViT:在预训练迁移基础上,用二次规划约束做可解释特征选择,并结合多目标损失减少冗余、调整激活分布。六个数据集上准确率93.80%,较黑箱ViT仅低0.21%,特征冗余降29.5%,激活区域与临床关注病灶较一致。

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy Figure 1
2026-06-23cs.CV

PHOEBI: An Open-World Benchmark for Bacterial Identification in Phase-Contrast Microscopy

Aaditya Baranwal, Md Jahid Hasan, Shruti Vyas

University of Central Florida

2026-06-23强化学习数据集/基准

该文针对相差显微镜下细菌样本常为多菌混合且含未知物种、现有基准缺少开放世界多标签评测的问题,提出PHOEBI:12万张、6种杆菌40种组合的数据集及留组合外协议。结果显示常规梯度聚合器在未见组合上F1下降0.39–0.57,失败主要在聚合而非表征;基于冻结DINOv2瓦片特征的锚点解码器缓解组合崩塌,并用同一重构残差实现开放集拒识AUROC约0.70和新类原型发现。

Full-Body Golf Swing Kinematic Reconstruction From a Smartwatch IMU Figure 1
2026-06-23cs.CV

Full-Body Golf Swing Kinematic Reconstruction From a Smartwatch IMU

Yuanshuo Tan, Kezhe Zhu, Xiujie Sun, Chunping Liang, Shuoyang Zhu, Chenquan Xu, Licheng Zhong, Huiming Pan, Yinri Jin, Chang Liu, Bo Xiao, Shenglong Le, Bryndan W. Lindsey, Peter B. Shull

2026-06-23三维

论文针对高尔夫挥杆量化依赖实验室光学捕捉、摄像机或多 IMU、难以上场使用的问题,提出仅用腕戴智能手表 IMU 的 WIT-KinNet,通过模态嵌入与时序运动学编码学习腕部到全身关节的依赖。36 名不同水平球手、7 类球杆实验中,全身关节角 MAE 为 8.11±1.84°,骨盆/躯干旋转及 X/S-factor 与光学捕捉高度相关,但误差受挥杆幅度、水平和球杆类型显著影响。

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs Figure 1
2026-06-23cs.CV

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

2026-06-23视觉感知

FedOT针对联邦潜扩散模型在共享全局模型时易被恶意客户端转售且难以追责的问题,提出分块水印:前段验证模型归属,后段编码客户端身份;同时用潜向量变换绑定VAE与U-Net,使替换干净VAE会显著破坏生成质量。实验显示其在所有权验证、泄漏追踪及多类去水印攻击下保持较好可靠性。

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning Figure 1
2026-06-23cs.CV

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard Team

AI Security Lab, Ant Group

2026-06-23视觉语言强化学习

论文针对多模态模型上线后安全策略会随产品、地区和场景变化,而现有护栏多依赖固定分类的问题,提出将自然语言策略作为运行时输入的 SingGuard,按规则逐条匹配内容,并用快/混合/慢三种推理路径兼顾延迟与可审计性,训练中加入快慢解耦强化学习以减弱初始判断锚定。在自建 SingGuard-Bench 的 56,340 个样本、80 多类风险和 35 个数据集上,其六类基准平均 F1 均达 SOTA,动态规则准确率由 0.6465 提升到 0.7415。

Fursee: Hybrid YOLO-DINOv3 Framework for Fursuit Identity Retrieval and Clustering Figure 1
2026-06-23cs.CV

Fursee: Hybrid YOLO-DINOv3 Framework for Fursuit Identity Retrieval and Clustering

Jundi Wu

Shandong University

2026-06-23视觉感知

针对漫展海量兽装照片难以人工归档、且兽装头部差异主要来自颜色纹理而非人脸几何的问题,论文提出 Fursee:先用 YOLO 裁剪拥挤场景中的头部,再以 ArcFace 优化 DINOv3 表征,并用轮廓系数搜索 DBSCAN 聚类参数。实验称其在检索与聚类指标上优于多模态大模型,但数据集规模与泛化范围有限,增益可能部分来自专用数据与检测裁剪。

VideoLatent: Video-Language Learning via Latent Self-Forcing Figure 1
2026-06-23cs.CV

VideoLatent: Video-Language Learning via Latent Self-Forcing

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

The Chinese University of Hong Kong

2026-06-23视觉感知

这篇论文针对视频多模态模型中显式 CoT 依赖人工推理标注、训练和推理开销高的问题,提出 VideoLatent,用潜在注入模块约束隐式“latent thoughts”不偏离视频与问题,并通过包含对齐与多样性目标的 latent self-forcing,仅用视频-问答三元组训练。实验覆盖 14 个视频理解与复杂推理基准,报告其优于标准与潜在 MLLM,并相较 Video-R1 将训练/推理开销约降至 1/6 与 1/68。

Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME Figure 1
2026-06-23cs.CV

Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

Zhichao Fan, Yanhang Li, Zexin Zhuang

University of Illinois Urbana-Champaign, Northeastern University, Southern Methodist University, University of Illinois Urbana-Champaign Urbana Illinois USA, Northeastern University Boston Massachusetts USA, Southern Methodist University Dallas Texas USA

2026-06-23视觉感知数据集/基准

这篇论文针对视频问答中“强制思维链会让模型更可靠”的常见假设,提出由配对准确率、视频置换诊断和视觉退化阶梯组成的三探针评估方案,并区分严格/宽松评分。结果显示,Qwen2.5-VL 的 CoT 确实受视频输入影响,但并未提升 Video-MME 多选准确率;7B 模型在严格评分下还出现经校正后显著的下降,说明“看见了”的推理链不等于有用答案。

G-MASt3R-SfM: Graph-based View Pruning and Multi-stage Optimization for Robust SfM Figure 1
2026-06-23cs.CV

G-MASt3R-SfM: Graph-based View Pruning and Multi-stage Optimization for Robust SfM

Toshiki Watanabe, Shintaro Ito, Natsuki Takama, Koichi Ito, Takafumi Aoki

2026-06-23优化算法安全鲁棒

这篇论文针对 MASt3R 用于 SfM 时会给无重叠图像也生成错误匹配、进而破坏全局位姿优化的问题,提出用匹配置信度构建场景图并通过图结构剪除异常视角,再按社区结构从局部到全局进行多阶段 bundle adjustment。ETH3D 实验显示,该流程在相机位姿估计和三维重建上优于 COLMAP、MASt3R-SfM 等基线,消融也表明主要收益来自 GVP 对几何不一致视角的主动过滤。

OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention Figure 1
2026-06-23cs.CV

OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention

Zijie Meng

Peking University, China

2026-06-23视觉感知

该文面向可控视频生成中相机运动与主体轨迹相互干扰的问题,指出仅靠2D光流条件无法唯一分解二者,因为相机平移与物体运动共享1/Z深度缩放。OrthoMotion将相机控制注入RoPE的保范几何相位,将主体轨迹作为门控语义值注入,并用正交正则压低交叉响应;在Wan2.1等骨干上同时提升相机/主体误差与FVD,交叉干扰降低超过2.4倍,但结论依赖一阶Jacobian估计和刚体场景假设。

Homographic Navigation: Geometry-Driven Camera Guidance for Deterministic Planar Capture Figure 1
2026-06-23cs.CV

Homographic Navigation: Geometry-Driven Camera Guidance for Deterministic Planar Capture

Dominik Kroupa, Marek Vaško, Muh Yuzril Ihza Baharuddin, Adam Herout

Ondokuz Mayıs University

2026-06-23机器人

面向机器人或手持设备对平面目标进行可重复拍摄的需求,论文指出单纯事后估计单应性难以保证采集姿态一致。其核心是把单应性作为导航、训练和评估的组织变量,用单张标注参考图生成合成训练数据,并结合稀疏关键点预测、两阶段推理和 Stable Warp 提升精度。实验显示,在极少监督下可实现较准确的平面定位与对齐,但第二阶段野外视频自训练主要作为未来方向。

DBT-Bleed: Dual-Branch Temporal Modeling with Key-Frame Selection for Surgical Bleeding Detection Figure 1
2026-06-23cs.CV

DBT-Bleed: Dual-Branch Temporal Modeling with Key-Frame Selection for Surgical Bleeding Detection

Sudhanshu Mishra, Jialang Xu, Jensen Ang, Evangelos B. Mazomenos, Beng Ti Ang, Yueming Jin

2026-06-23视觉感知

该文针对术中出血不良事件与残留血外观相似、长视频时序建模成本高的问题,提出基于CLIP的双分支DBT-Bleed,用层级多尺度时序适配器分离出血/正常表征,并以HiRED熵驱动选帧保留关键信息。在MultiBypass上F1、召回、MCC分别提升6.53%、5.62%、9%,在EndoPit-IAE零样本跨术式测试中F1和MCC提升6%与8%。

Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics Figure 1
2026-06-23cs.CV

Policy-as-Data: Learning Generalizable HOI Diffusion Models from Simulated Physics

Shujia Li, Jianshu Hu, Haiyu Zhang, Yunpeng Jiang, Haoyuan Jin, Xinyuan Chen, Yaohui Wang, Yutong Ban

2026-06-23生成模型强化学习

该文针对 HOI 生成依赖昂贵 MoCap、难覆盖新物体与长时序且物理接触不稳定的问题,提出把物理仿真中强化学习策略生成的任务轨迹当作数据,并用粗到细重定向弥合低 DoF 刚体与 SMPL 表示差异,再训练条件扩散模型。实验显示 PAD-HOI 在未见物体、百余种几何和长时序多阶段交互上提升泛化、接触稳定性与动态多样性,但具体增益可能主要来自 scaling / data。

CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams Figure 1
2026-06-23cs.CV

CoVStream: Edge-Cloud Collaboration for Understanding of Long Video Streams

Xu Liu, Guikun Chen, Zihao Yan, Kanzhi Wu, Wenguan Wang

2026-06-23视觉感知

面向智能眼镜等算力受限设备的长视频理解,论文指出纯云端传原始视频带宽过高、纯端侧又难以承载大模型。Co-VStream 的核心是把端侧作为语义压缩器,并行生成压缩视觉特征与关键帧描述,云端维护实体图和全局上下文,仅在查询时唤醒推理模型。实验称其在 VideoMME-Long、LVBench、RTV-Bench 上以约 87.6% 带宽下降保留 LVBench 云端基线 99.2% 准确率,并在超长流和 24 小时模拟中显著降低内存占用。

Learning Adaptive Dynamical Features via Multi-$τ$ Liquid-Mamba for All-in-one Image Restoration Figure 1
2026-06-23cs.CV

Learning Adaptive Dynamical Features via Multi-$τ$ Liquid-Mamba for All-in-one Image Restoration

Hu Gao, Changshuo Wang, Yulong Chen, Lizhuang Ma

2026-06-23视觉感知

这篇论文针对 all-in-one 图像复原中退化类型和空间区域差异大、现有 Mamba 单一状态演化时间尺度适应性不足的问题,提出 Multi-τ Liquid-Mamba:在不改变 selective scan 主流程的前提下,引入输入条件化的多时间常数液态离散化,并用退化感知门控融合不同动态分支,使模型同时处理局部细节和全局结构。基于该模块的 MLMIR 在多类 all-in-one 与任务对齐复原基准上报告达到或接近 SOTA,但具体增益中模块设计与训练规模、数据配置的相对贡献仍需看消融细节。

Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction Figure 1
2026-06-23cs.CV

Visual Geometry Transformer in the Wild: Distractor-Free 3D Reconstruction

Tianbo Pan, Xingyi Yang, Shizun Wang, Xinchao Wang

National University of Singapore, 2 The Hong Kong Polytechnic University

2026-06-23三维

这篇论文针对端到端多视角三维重建默认场景静态、无干扰物的弱点,指出真实采集中行人、车辆等瞬时遮挡会破坏跨视角一致性。VGTW通过干扰感知训练在注意力中分离并抑制受污染特征,结合辅助掩码头和像素级标注数据,仅用2D监督即可前馈输出更干净的点云。实验称其在多种真实场景中较现有方法更鲁棒并达到SOTA,但数据规模和任务外泛化仍有限。

DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings Figure 1
2026-06-23cs.CR

DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings

Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

2026-06-23视觉感知

本文针对 VLM 中恶意图像提示,尤其是间接提示注入缺少专门、低成本检测的问题,提出无需训练的 DE-FIVE。其核心思路是结合输入图像的傅里叶域特征黑盒检测,以及视觉编码器在扰动下的图像向量嵌入差异白盒检测,仅需少量恶意样例。实验显示混合检测在多种 VLM 和恶意图像提示场景下优于现有基线,但具体增益来源仍需更多消融支撑。

LoCC: Detection and Localization of Lip-Syncing Deepfakes via Counterfactual Frame Consistency Figure 1
2026-06-23cs.CV

LoCC: Detection and Localization of Lip-Syncing Deepfakes via Counterfactual Frame Consistency

Soumyya Kanti Datta, Shan Jia, Siwei Lyu

2026-06-23视觉感知

针对唇形同步伪造常只改动嘴部且可能只覆盖短片段、传统整段或音视同步检测易漏检的问题,LoCC用真实嘴部帧训练扩散重建器,从前后帧反事实预测中间帧,并以重建误差刻画局部时间不一致,再通过段级教师、帧级学生和扩散不一致损失实现定位。实验在FakeAVCeleb、KODF、LAV-DF、AVDF1M上显示较强检测与跨域泛化,但高IoU精确边界仍弱于部分更大模型。

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations Figure 1
2026-06-23cs.CV

READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations

Bo Fang, Xinyao Zhang, Yuxin Song, Hui Zhang, Hang Zhou, Antoni B. Chan

City University of Hong Kong, Tsinghua University

2026-06-23强化学习

这篇论文针对音频描述生成中仅靠提示或下一词监督容易产生风格不匹配、内容泛化和上下文不连贯的问题,提出 READ,将音频描述视为序列级强化学习优化任务,结合参考匹配、长度、格式奖励,并用上下文感知的一致性奖励约束叙事连贯性。在 MAD-Eval、CMD-AD 和 TV-AD 上,READ 相比既有训练式与免训练方法在多类指标上取得明显提升,说明 RL 有助于同时优化描述准确性与连贯性。

HERCULES: An Open-Source Simulation Framework for Heterogeneous Multi-Robot SLAM, Collaborative Perception, and Exploration Figure 1
2026-06-23cs.RO

HERCULES: An Open-Source Simulation Framework for Heterogeneous Multi-Robot SLAM, Collaborative Perception, and Exploration

Sandilya Sai Garimella, Daniel Chase Butterfield, Sean Wilson, Lu Gan

1 affiliationmark: Georgia Institute of Technology, USA, 2 affiliationmark: Georgia Tech Research Institute, USA

2026-06-23机器人

面向灾害响应、巡检等需要 UAV–UGV 协同建图、感知与探索的场景,HERCULES 针对现有模拟器难以同时支持大尺度异构空地机器人闭环实验的问题,改造 AirSim/Cosys-AirSim 架构,加入统一航点控制、共享导航栈、多模态传感、动态智能体与环境灾害接口。论文通过异构 SLAM、协同 3D 感知和闭环探索实验展示其可生成同步基准数据并支撑在线协同验证。

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation Figure 1
2026-06-23cs.CV

RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation

Yuchuan Ding, Linfei Li, Lin Zhang, Ying Shen

2026-06-23视觉感知

RaysUp针对视觉基础模型特征分辨率低、传统插值丢语义而学习式上采样又依赖特定模型或结构较重的问题,提出任务无关、VFM无关的轻量通用特征上采样框架。其核心是把重建从二维邻域提升到几何感知射线表示,用空间解耦引导编码、任意分辨率交叉注意力、基于6D Plücker坐标的RayPE和几何邻域注意力来兼顾边界结构与语义一致性。实验称其在多种密集预测任务上优于AnyUp,同时参数量约为其16%、推理约快7倍。

Interpretable Uncertainty Routing Separating Emotion Ambiguity from Distribution Shift in Facial Expression Recognition Figure 1
2026-06-23cs.CV

Interpretable Uncertainty Routing Separating Emotion Ambiguity from Distribution Shift in Facial Expression Recognition

Keito Inoshita, Takato Ueno

Faculty of Business and Commerce, Kansai University, Suita, Japan, Data Science and AI Innovation Research Promotion Center, Shiga University, Graduate School of Data Science, Shiga University, Hikone, Japan, a matched out-of-distribution rejection rate. A strong label-distribution-, annotated by multiple workers who provide label distributions rather than defini-, tive ground-truth labels. FERPlus [1] supplies ten votes per image across eight, cyclical SG-MCMC and soft-label learning [14], facial expression recognition is designed and introduced, centred on a novel

2026-06-23视觉感知安全鲁棒

这篇论文针对表情识别中“人类本就意见不一”和“输入已偏离训练分布”都会导致低置信度、但应采取不同处理的问题,提出用 DINOv2 深度集成分解偶然/认知不确定性,并以 UAR 在推理时分别保留模糊样本、拒绝 OOD。结果显示偶然不确定性与标注分歧相关性达 0.66,认知不确定性在强腐蚀下 OOD AUROC 为 0.699,且在相同拒绝率下保留约 1.8 倍更多模糊域内人脸。

Generative Relightable Avatars Figure 1
2026-06-23cs.CV

Generative Relightable Avatars

Kunwar Maheep Singh, Christian Theobalt, Rishabh Dabral

Max Planck Institute for Informatics, combines controllable, physics-grounded relighting with probabilistic re-, line of work comprises deterministic pipelines that reconstruct a controllable, lable, physically grounded intermediate renderings under the target environment

2026-06-23生成模型

该文针对全身数字人在自由视角与任意光照下易过平滑、缺少细节且生成式方法缺乏3D控制的问题,提出GRA:先用可跟踪网格、UV材质与微表面渲染获得物理约束的粗结果,再以RelightNet和带光照交叉注意力的视频扩散模型补全姿态相关纹理、皱褶和长序列一致性。实验显示其感知质量优于既有可重光照avatar基线,并能在未见环境光、OLAT等设置下保持较好效果。

Modular Diffusion Models for Structured Visual Recognition Figure 1
2026-06-23cs.CV

Modular Diffusion Models for Structured Visual Recognition

Siddhesh Khandelwal, Björn Ommer, Leonid Sigal

Department of Compute Science, University of British Columbia, Vector Institute for AI, CompVis, Ludwig Maximilian University of Munich, Munich Center for Machine Learning, Department of Computer Science, University of British Columbia, labels). Experimental results over three distinct structured tasks – object detection, instance, training set. While this shift has led to substantial gains in accuracy and scalability, it has also resulted

2026-06-23视觉感知生成模型

针对检测、分割和场景图等结构化视觉任务常被建模为单一确定性输出、难以表达遮挡和边界歧义的问题,论文提出模块化扩散模型,将异构结构输出分解为类别、位置、关系等条件扩散模块,避免联合加噪破坏组件对齐,并可独立训练、推理时组合。实验覆盖目标检测、实例分割和场景图生成,显示该框架能产生多样且合理的结构预测,并在不确定性刻画与任务指标上优于朴素联合扩散或确定性基线。

SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors Figure 1
2026-06-23cs.LG

SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors

Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok

collaborative, defenses often require large labeled reference datasets, prior, Osama Wehbi is with the Department of Computer and Software En-, Sarhad Arisdakessian is with the Department of Computer and Software, Omar Abdel Wahab is with the Department of Computer and Software, Azzam Mourad is with the Department of Computer Science, Khalifa, Hadi Otrok is with the Department of Computer Science, Khalifa Univer-, enables multiple clients to collaboratively train a shared global, while relabeling them to an attacker-designated target class., explicitly highlighting their applicability to collaborative and, raw client data or a large labelled clean proxy dataset at

2026-06-23视觉感知

联邦学习模型在训练后仍可能保留后门,而服务器通常不知道触发器或恶意客户端,清洗易损伤正常精度。SCRUB-FL的核心思路是在训练中由客户端用谱分析和激活聚类收集可疑样本,并聚合轻量WGAN-GP生成器,收敛后合成近似触发样本,用机器遗忘削弱触发到目标类的关联。在CIFAR-10和GTSRB上,面对三类攻击和最高40%恶意参与者,攻击成功率降至最低3.88%,同时保持超过91%的正常精度。

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection Figure 1
2026-06-23cs.CV

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

Nikita Sharma, Pranav Sara, Karan Singla

University of California, San Diego, Case Western Reserve University, Ohio

2026-06-23视觉语言视觉感知

这篇论文针对庭审/临床等场景中将人脸与语音视频上传给多模态模型带来的隐私、成本和可质疑性问题,提出在端侧提取转写、情绪、意图、韵律、面部行为等约250个可解释特征,再交给分类器或LLM判断。作者指出既有75%准确率受说话人泄漏影响;在按说话人划分评估下,特征分类器AUC达0.741,Claude基于摘要特征达0.755,并比原始视频少用7.8倍输入token。

NullFlow: One-Step Generative Reconstruction Figure 1
2026-06-23cs.CV

NullFlow: One-Step Generative Reconstruction

Xiao Shi, Edward P. Chandler, Chicago Y. Park, Shirin Shoushtari, Ulugbek S. Kamilov

University of Wisconsin–Madison, Washington University in St. Louis

2026-06-23生成模型三维

针对成像逆问题中扩散/流模型需反复迭代并频繁做数据一致性校正的高成本问题,NullFlow将Mean Flow限制在前向算子的零空间,使生成轨迹始终落在测量一致子空间内,并学习平均速度实现一次网络评估的后验采样。文中在图像修复上显示,单样本可达到接近迭代扩散/流方法的感知质量,100次采样平均还能提升PSNR和SSIM,但实验主要限于修复任务,含噪和变算子场景仍待验证。

SATURN: Symbolic Spatial Reasoning for Multi-Perspective Grounding Figure 1
2026-06-23cs.CV

SATURN: Symbolic Spatial Reasoning for Multi-Perspective Grounding

Danial Kamali, Tanawan Premsri, Shreya Rajpal, Amir Zadeh, Chuan Li, Parisa Kordjamshidi

Michigan State University, Lambda Labs

2026-06-23视觉语言

这篇论文针对机器人/具身指令中“左、前、后”等关系会随相机、代理或物体参考系变化而失效的问题,提出 SATURN:先重建粗略 3D 场景,再生成带不确定性的参考系感知空间谓词,并用免训练 Python 符号执行组合多跳关系。作者还构建 3D FORCE 诊断基准,显示 VLM 和空间微调模型随推理深度、视角复杂度明显退化,而 SATURN 更稳定;在 MindCube 上达到 78.57%,较最强基线高 14 个百分点。

Prompting Diffusion Models for Zero-Shot Instance Segmentation Figure 1
2026-06-23cs.CV

Prompting Diffusion Models for Zero-Shot Instance Segmentation

Irem Zeynep Alagöz, Nils Morbitzer, Andrea Ramazzina, Nassir Navab, Federico Tombari, Stefano Gasperini

Technical University of Munich (TUM), Munich Center of Machine Learning (MCML), discriminative models such as SAM are trained purely on label boundaries and therefore lack, afterthought [2], which makes them less "controllable" than SAM. More specifically, Gen2Seg [2]

2026-06-23视觉感知生成模型

这篇论文针对 SAM 等判别式可提示分割在强纹理、弱边界目标上易过分割,以及既有扩散分割只在后处理使用点击、未真正受用户意图控制的问题,提出 Prompt2Seg:在冻结扩散分割模型上加入空间条件分支,将点击表示为 2D 高斯或置信图直接调制扩散过程。模型仅用受限合成类别微调,却在 COCO、VOC、DRAM、EgoHOS、PIDRay、ZeroWaste 等七个数据集上零样本优于其扩散骨干,显示生成先验加空间提示可提升跨域交互式实例分割。

MaRS: Robust Out-of-Distribution Detection via Mahalanobis Residual Scoring Figure 1
2026-06-23cs.CV

MaRS: Robust Out-of-Distribution Detection via Mahalanobis Residual Scoring

Francesco Di Salvo, Sebastian Doerrich, Christian Ledig

xAILab Bamberg, University of Bamberg, Germany, halanobis Residual Scoring), a label-free OOD detector that learns an, is available at github.com/francescodisalvo05/mars., regularize reliably. Reconstruction- and subspace-based methods offer a label-, reliance on labeled data for backbone fine-tuning, thereby enabling a label-free, – We introduce MaRS (see Figure 1), a plug-and-play, label-free OOD detection

2026-06-23视觉感知安全鲁棒

医学视觉基础模型在患者、设备和采集条件变化下易失效,亟需无需标签的事后 OOD 检测。MaRS 的关键洞察是重建法瓶颈不在重建质量,而在 L2 忽略残差各向异性;它用轻量自编码器学习 ID 流形,并以残差协方差上的 Mahalanobis 距离放大低方差异常方向。实验覆盖三种模态、多类分布偏移和不同骨干规模,整体优于置信度、距离和重建基线。

Learning Entropy Signature for Image Representation and Classification Figure 1
2026-06-23cs.CV

Learning Entropy Signature for Image Representation and Classification

Jan Glaser, Ivo Bukovsky, Noriyasu Homma, Marcel Jirina

Czech Technical University in, University of South Bohemia in, Tohoku University Graduate, School of Medicine, Let’s train MLP to predict the intensity of locally centered, In a simplest case, the target pixels, i.e. locally centered

2026-06-23视觉感知

本文针对图像中哪些局部观测真正驱动学习系统更新的问题,提出从空间学习熵图中选取 K 个最高 LE 位置构成 Learning Entropy Signature,用神经预测器的增量权重变化而非像素/梯度直接描述图像。实验在合成形状、手写数字和人脸上显示,少量高 LE 点即可在低维空间保留可分辨结构差异;但文中也承认尚缺系统分类对比,实际增益来源仍未充分说明。

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking Figure 1
2026-06-23cs.CV

4DVLT: Dynamic Scene Understanding with Worldline-Centered Vision-Language Tracking

Chaoyue Li, Boxue Yang, Shengyao Zhou, Haoyang Wu, Rui Qian, Linfeng Zhang

DVLT: Dynamic Scene Understanding with Worldline-Centered, Huazhong University of Science and Technology, Shanghai Jiao Tong University, Zhejiang University, We therefore introduce 4DVLT, a worldline-centered task for instruction-conditioned, that worldline-centered modeling improves both target grounding and recovered worldline quality. The, project page is available at https://github.com/mikubaka88/4DVLT., centered modeling as an effective route to instruction-conditioned 4D dynamic scene understanding.

2026-06-23视觉语言视觉感知强化学习

本文针对现有多模态模型缺少度量时空拓扑、视觉语言跟踪又割裂于2D或3D局部输出的问题,提出以“世界线”统一目标身份、3D运动和多视角2D投影的4DVLT任务,并构建Instruct-4D基准。其4DTrack用对象中心4D状态图、度量路由、双向解码和运动学校准联合求解指令 grounding 与轨迹恢复,在TGATop1上达62.68,较最佳改造VLT基线高19.62点。

DR-Mamba: Automatic Inference-Time Domain Adaptation for Document Image Binarization via Sample-Conditioned Detail-Background Suppression Figure 1
2026-06-23cs.CV

DR-Mamba: Automatic Inference-Time Domain Adaptation for Document Image Binarization via Sample-Conditioned Detail-Background Suppression

Sheng-Wei Chan, Jen-Shiun Chiang

Department of Electrical and Computer Engineering, Tamkang University, New, gates within a single forward pass, requiring no target-domain labels, ing pixel-level labels for every new collection is costly and often impractical, pass, requiring no target-domain labels, no fine-tuning, and no test-time parame-, ter updates. This forward-pass, label-free form of per-sample adaptation falls di-

2026-06-23视觉感知

这篇论文针对退化文档二值化在纸张老化、渗墨、阴影等未见域上前景/背景易混淆的问题,提出 DR-Mamba:把 Mamba 扫描改造成快细节、慢背景双路线,并用输入条件化的 D−βB 减法门在单次前向中自适应抑制背景,无需测试时更新或目标标签;再结合全分辨率细节重建和细笔画监督。留一年 DIBCO/H-DIBCO 评测显示其跨域鲁棒性提升,最难的 2019 fold 表现尤其强,消融称主要增益来自自适应减法抑制。

OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs Figure 1
2026-06-23cs.CV

OmniSpace: Efficient Geometry Awareness for Autonomous Vehicles MLLMs

Hao Vo, Phu Loc Nguyen, Khoa Vo, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

University of Arkansas, USA, University of Liverpool, UK, Max Planck Research School for Intelligent Systems

2026-06-23视觉感知

OmniSpace针对自动驾驶MLLM虽能做2D理解、却缺乏深度估计与跨视角对应的问题,先通过诊断实验指出这两项几何能力与下游驾驶表现相关,再用相机位姿注入、极线约束的多视角注意力和训练期3D几何蒸馏,把几何先验内化到模型中,避免推理时依赖外部3D模块。实验显示其在nuScenes、Bench2Drive、nuInstruct、OmniDrive和DriveBench等规划、风险检测、语言与泛化任务上优于现有方法。

Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline Figure 1
2026-06-23cs.CV

Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline

Wentao Che, Esteban Garcés Arias, Asim Niaz, Andreas Bender, Enrique Jiménez

Institute of Assyriology and Hittite Studies, LMU Munich, Germany, Department of Statistics, LMU Munich, Germany, Munich Center for Machine Learning (MCML), Germany, to tablet damage and layout variability, it provides a scalable and interpretable foundation for, exceeds the ability of a limited number of trained Assyriologists available to analyse it. Furthermore, annotations demands specialist philological expertise, and the labelling effort scales poorly with corpus, vidually annotated signs (Lewenstein et al., 2026). It constitutes the largest publicly available, the sign-by-sign workflow of traditional epigraphy while enabling scalable computational analysis.

2026-06-23视觉感知数据集/基准

针对楔形文字泥板数量巨大、专家标注与释读能力不足的问题,本文将扩展到12.45万符号标注的数据集用于训练可变形DETR,并把检测、自动版面侧面提取、启发式行分组和n-gram文本相似度评估串成端到端OCR流程。在173/106类粒度下,COCO式检测指标较既有工作提升约28–37%,并在eBL的8.77万件残片上生成近290万次符号检测;但系统仍不使用语言先验,受破损和版式变化影响,增益可能主要来自数据规模与workflow适配。

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ? Figure 1
2026-06-23cs.CV

MapReason-OSM: Can Vision-Language Models Make Graph-Verifiable Mobility Decisions from Street Maps ?

Srinivas Venkatanarayanan (1 and 2), Clement Pakkam Isaac (1 and 3) ((1) NVIDIA, (2) University of Central Florida, (3) University of South Florida)

University of Central Florida, University of South Florida, these models. A model that “reads” a map well (identifying labels, titioners: today’s VLMs can be trusted to read a labeled map but not, Code, data, and the deterministic generator are available at https://github.com/Vi-, zoom scales sharing one center: a mid panel (half-extent 500 m, placement). Because the two panels share a center and the local ex-, marker is placed within a 130 m-radius window of that center (well

2026-06-23视觉语言视觉感知

论文针对VLM在物流、配送和无障碍导航中“能读地图但决策需遵守路网”的落差,提出MapReason-OSM:用自渲染OSM街图、隐藏道路图和精确oracle,将路线、设施选址、停车等结构化输出映射回图上验证合法性、最优性、约束满足与跨缩放一致性。七个模型实验显示,当前VLM能完成简单读图和路线任务,但在图成本推理尤其单设施选点上接近随机,且答案常随缩放变化。

The Power of Light: Improving Synthetic-to-Real Domain Adaptation through Physically-Based Indirect Illumination Figure 1
2026-06-23cs.CV

The Power of Light: Improving Synthetic-to-Real Domain Adaptation through Physically-Based Indirect Illumination

Hooman Tavakoli Ghinani, Tatjana Legler, Martin Ruskowski

While synthetic data generation resolves the manual labeling bottleneck in computer vision, Training OD models requires large-scale annotated datasets, where high-quality labels provide the, costly [7]. The challenge lies not only in producing sufficient labels but also in ensuring that the dataset, datasets. By eliminating the need for manual labeling, synthetic data enables greater control over bias, and labeling accuracy, thereby reducing errors, cost, and labor intensity. Virtual environment–based, ∗German Research Center for Artificial Intelligence (DFKI), Kaiserslautern, Germany, data while minimizing energy consumption in terms of both human labor and computational resources., outperform human-labeled datasets., approach to addressing the bottleneck of limited data availability. Relating to the assumption of a

2026-06-23视觉感知

针对合成数据训练目标检测时仍存在明显 sim-to-real 域差的问题,论文把关注点从常见的直接光随机化转向物理间接光照,基于 Isaac Sim 构建 SmartSDG 和工业数据集 ILLUM INTRUCK,控制光照强度、相机视角与背景复杂度做 18 组 YOLOv12 实验。结果显示,多次反射的间接光和任务相关背景能保留表面纹理、减少高光饱和与误检,使 mAP 和收敛表现优于传统直接光设置。

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion Figure 1
2026-06-23cs.CV

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Team

2026-06-23视觉感知生成模型

针对文本到图像基础模型训练成本高、语义引导方法此前多停留在小模型低分辨率数据上的问题,SeFi-Image 将 semantic-first diffusion 扩展到 1B/2B/5B 规模,并结合高保真 VAE 潜空间、双语细粒度标注与文本渲染合成数据。其 5B 模型仅用 125K A800 GPU 小时训练,在 GenEval、DPG、LongTextBench 等基准上达到接近或优于 Qwen-Image、Z-Image 的结果,同时提供少步蒸馏 turbo 版本。

No Figure
2026-06-23cs.CL

Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do

Zhuoran Jin, Kejian Zhu, Hongbang Yuan, Yupu Hao, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China, School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

2026-06-23视觉语言

本文关注多模态任务中链式思考是否真的有用:作者将12类任务区分为感知与推理,系统比较14个非推理模型和8个推理模型。核心洞察是 CoT 并非免费增益,数学、科学和多图推理受益明显,但视觉定位、计数等感知任务可能退化;开源多模态推理模型整体提升有限,可能因训练过度偏向数学。主要瓶颈在视觉反思,模型呈现“少看、多想”的模式,长推理中逐渐忽视视觉信息。

HiMatch-AD: DINOv3-driven Hierarchical Matching for Training-free Medical Anomaly Detection Figure 1
2026-06-23cs.CV

HiMatch-AD: DINOv3-driven Hierarchical Matching for Training-free Medical Anomaly Detection

Jiayu Huo, Jingyuan Hong, Meng Zhou, Liyun Chen, Le Zhang

Imperial College London, London, UK, King’s College London, London, UK, SonoScape Medical Corp., University of Birmingham, Birmingham, UK, tensive normal data, which limits scalability across modalities and in-, ing and uncertainty-aware fusion for scalable medical anomaly detection., to fully supervised segmentation, anomaly detection offers a more scalable solu-, their scalability across imaging modalities and institutions. In contrast, training-, training, leveraging strong pretrained visual representations to enable scalable

2026-06-23视觉感知

针对医学异常检测依赖任务训练和大量正常数据、跨模态部署受限的问题,HiMatch-AD利用DINOv3做免训练层级匹配:先用CLS与patch双分支检索相近正常参考,再在多层Transformer特征上以聚类正常原型生成异常图,并用不确定性加权融合。BMAD上覆盖脑MRI、肝CT和视网膜OCT,结果优于训练式及DINO系方法,说明多层匹配与可靠性建模对定位和泛化有效。

Mitigating Measurement-Induced Training Instability in Hybrid Quantum Neural Networks for Protein Classification Figure 1
2026-06-23cs.LG

Mitigating Measurement-Induced Training Instability in Hybrid Quantum Neural Networks for Protein Classification

Milton Mondal, Sushovan Chanda, Mohamad Mahdi Alawieh, Brijesh Sukhadiya, Donatus Krah, Clinton Gonsalves, Antonios Ntolkeras, Silvio O. Rizzoli, Ali H. Shaib

aDepartment of Neuro- and Sensory Physiology, University Medical Center Göttingen

2026-06-23视觉感知

本文关注混合量子神经网络分类中常被忽略的测量—损失接口问题:Pauli 测量输出被限制在 [-1,1],直接作为 softmax 交叉熵 logits 会压缩类别间隔并削弱梯度。作者提出可学习的 Quantum Measurement Temperature,在不改变量子线路结构、深度或测量算子的情况下放大量子读出。实验在荧光显微蛋白图像和六类 Fashion-MNIST 上显示,该 scaling 能增强 logit 分离与梯度、降低随机初始化下的训练不稳定,并提升分类准确率。

Training-Free Semantic Correction for Autoregressive Visual Models Figure 1
2026-06-23cs.CV

Training-Free Semantic Correction for Autoregressive Visual Models

Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang

Zhejiang University, 2Shandong University, Code is available at https://github.com/June-Hall/

2026-06-23视觉感知

这篇论文针对自回归视觉模型按尺度逐步生成时,早期语义错误难以及时发现且会沿后续尺度累积的问题,提出无需训练的 GAZER:在中间尺度生成可读的 rollout 预览,用多模态大模型诊断偏离,再回退到前一尺度并按增强/抑制线索重采样修正轨迹。实验显示,该方法在图像与视频组合生成基准上提升了多种 AVM 的语义对齐和组合准确性,但主要适用于 next-scale 模型及可从中间语义证据识别的错误。

Venice-H1: Failure-Aware Query Re-Ranking with Multi-Scale Grid Signatures for Referring Image Segmentation Figure 1
2026-06-23cs.CV

Venice-H1: Failure-Aware Query Re-Ranking with Multi-Scale Grid Signatures for Referring Image Segmentation

Nicolò Savioli

2026-06-23视觉感知

本文关注指代表达图像分割中多候选掩码“选错查询”的瓶颈:默认置信度排序虽多数有效,但少量失败样本贡献大量误差。Venice-H1用4×4/8×8/16×16多尺度网格签名刻画掩码形状与边界,并以带Failure Gate的Transformer仅在疑似失败时重排。结果显示在DeRIS-L/B的16个分割-骨干组合上失败子集mIoU均稳定提升,医疗零样本也有小幅收益,但全量mIoU增益很有限。

MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization Figure 1
2026-06-23cs.CV

MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization

Yutong Hu, Siyuan Tan, Shaocheng Yan, Pengcheng Shi, Qingwu Hu, Jiayuan Li

determining ground position when GNSS is unavailable or, ayuan Li are with the School of Remote Sensing and Information Engineering

2026-06-23视觉语言视觉感知

针对机器人或移动智能体在 GNSS 不可靠时需要同时利用视觉观测与语言线索定位的问题,论文指出传统余弦式点对点对齐会割裂图像与文本的互补约束,提出 UniMAG 与 MAPS,将两种查询特征构成锚平面,并用候选位置到该子空间的投影及方向约束进行检索和对比学习。在 CORE 与 CVG-Text 上,该方法较成对对齐持续提升定位准确率,且额外计算开销较小。

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models Figure 1
2026-06-23cs.CV

PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models

Xianghui Wang, Feng Chen, Wenbo Zhang, Hua Yan, Zixuan Wang, Changsheng Li, Yinjie Lei

2026-06-23视觉语言视觉感知强化学习

本文关注VLA机器人部署中被忽视的“策略效率”瓶颈:不仅推理慢,动作块尾部预测不可靠还会导致频繁重规划和冗余物理动作。PolicyTrim用两阶段强化学习后训练,先通过动态执行窗口奖励更长且成功的动作块,再用步数节省奖励与稳定正则压缩多余动作,无需改架构或额外示教。实验覆盖3个基准和3类VLA,动作块利用率提升3倍,物理步数减少51.4%,端到端最高加速5.83倍且成功率基本不降。

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models Figure 1
2026-06-23cs.CV

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

Yingjie Zhang, Shuai Li, Peng Wang

NegAS: Negative Label Guided Attention and, Northwestern Polytechnical University, Xi’An, China, ground with ID labels but treats background uniformly, leaving potential, and (ii) their sigmoid-based multi-label outputs are incom-, tive Label Guided Attention and Scoring (NegAS). To address (i), we, propose a negative label guided attention module (NegA), where LLM-, generated, visually-similar but semantically-different negative labels are, (NegS) that leverages both ID and negative labels, producing strong, · Negative Label Guided Attention and Scoring, MCM [22], GL-MCM [24], NegLabel [12], EOE [2], emphasizes developing im-, Negative label guided Attention (NegA) module that uses curated negative la-, that contradict ID labels or resemble OOD labels. Besides, we design an LLM-

2026-06-23视觉语言视觉感知

本文针对视觉语言检测器在安全场景中遇到未知类别时易把 OOD 目标误判为已知类的问题,指出其 ID 文本注意力忽略潜在 OOD 背景、且 sigmoid 输出不适配传统 softmax OOD 分数。NegAS 用 LLM 生成的负标签引导背景注意力,并设计结合 ID/负标签的 sigmoid 打分;在 YOLO-World 与 Grounding DINO 上均提升 OOD 检测,COCO、OpenImages 的 FPR95 分别较基线降低 11.4% 和 25.5%,且基本保持 ID 精度。

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories Figure 1
2026-06-23cs.CV

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger

with Controllable Semantic Trajectories, University of Tübingen, Tübingen, Germany, Max Planck Institute for Intelligent Systems, Tübingen, Germany, ELLIS Institute, Tübingen, Germany, Tübingen AI Center, Tübingen, Germany, images, yet their controllability remains largely endpoint-centric: users, measure structural consistency and local controllability beyond endpoint, controllable, trajectory-aware image synthesis.

2026-06-23规划控制

这篇论文针对扩散/flow 生成过程只控制终点、难以干预中间语义路径的问题,提出 Trajectory Forcing:用 DINOv2 特征聚类构造从布局到物体、部件、细节的层级轨迹,并在每层训练层级条件的一步 flow matching,使中间状态可解码、检查和局部编辑。实验在 ImageNet 类条件生成上显示其质量接近常规模型、FID 收敛较快,同时提供更好的结构一致性和跨层编辑能力。

Projection-Volume Fidelity Divergence: Diagnosing and Controlling Optimization Drift in Sparse-View 3D Gaussian Tomography Figure 1
2026-06-23cs.CV

Projection-Volume Fidelity Divergence: Diagnosing and Controlling Optimization Drift in Sparse-View 3D Gaussian Tomography

Yikuang Yuluo, Ao Wang, Shen Kuan, Yujie Liu, Wang Liao, Ying Chen, Shuangyang Zhong, Yixing Huang, Fuquan Wang

Chongqing University, Chongqing, China, Peking University Health Science Center, Beijing, China, evaluation [8, 9, 5]. When only sparse views are available due to dose, time, safety, or acquisition

2026-06-23规划控制优化算法三维

论文针对稀疏视角3D Gaussian CT中“投影越拟合、体重建反而变差”的优化漂移问题,提出PVFD诊断,并用GAI、VCS刻画高斯退化和体密度脆弱性。其LADES通过早期线性退火dropout抑制视角共适应,并按高斯增长饱和停止致密化;实验显示体保真度提升、结构退化减少且训练时间降低,同时保持投影精度。

The Scissors Effect: When Resize-Based Input Diversity Helps or Hurts Transfer Attacks Figure 1
2026-06-23cs.LG

The Scissors Effect: When Resize-Based Input Diversity Helps or Hurts Transfer Attacks

Yuhang Jiang, Xiaojing Chen

University of Trento, Anhui University

2026-06-23视觉感知

论文针对迁移攻击中“输入多样性默认有益”的惯例,发现其效果取决于替代模型的鲁棒性:随机缩放填充对标准模型可提升迁移,却会削弱鲁棒模型,形成“剪刀效应”。作者将原因定位到缩放导致的梯度对齐恶化,并用局部梯度一致性 LGC 判断何时关闭 DI;ImageNet 上盲目启用 DI 使鲁棒源平均攻击成功率下降 10.3%,而 CG-DI 可避免主要损失。

Biological Sex Determination in Cadavers Using Deep Learning Algorithms from Computed Tomography Images of Pelvis and Skull Figure 1
2026-06-23cs.CV

Biological Sex Determination in Cadavers Using Deep Learning Algorithms from Computed Tomography Images of Pelvis and Skull

Giovanna Herculano Tormena, Davi Nascimento Araújo, Germano Coimbra Soares de Carvalho, Gustavo Bruno Centenaro, Rafael Janowski Pozzer, Rodrigo Akira Azevedo Kurosawa, Danilo Aires Alves, Filipe Thiago Xavier de Campos, Pedro Henrique Macedo dos Santos, Pedro Augusto Prado Mota, Ricardo V. Godoy, João Manoel Herrera Pinheiro, Marcelo Becker

São Carlos School of Engineering, University of São Paulo, São Carlos 13566-590, Brazil, Aristoclides Teixeira Institute of Forensic (IMLAT), Goiânia 74.425-030, Brazil, autopsied cadavers from the Forensic Medical Institute of Goiânia-GO, including a broad age range and, validation across multiple centers and scanners is required to assess the generalizability of the proposed, autopsied at the Medical-Legal Institute of Goiânia-GO. The, logical landmarks such as the glabella, supraorbital margin

2026-06-23视觉感知

针对腐败、创伤或碎片化遗骸中传统目测性别鉴定主观且耗时的问题,论文将尸体骨盆和颅骨 CT 三维重建转为标准化二维投影,比较 YOLO、ConvNeXt、EfficientNetV2、ViT 等迁移学习模型。其关键洞察是骨盆投影判别力更稳定,颅骨仍可补充;在141具单中心尸检样本上最佳模型达到95.65%患者级准确率,但跨设备、跨中心泛化仍文中未充分说明。

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding Figure 1
2026-06-23cs.CV

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang

The University of Queensland, 2Adelaide University, 3University of Southern Queensland, sure accurate and consistent labeling. Compared with exist-, like PlantVillage [37] provide clean, laboratory-collected, and model architectures, which limit scalability and gener-, scalability and generalization.

2026-06-23视觉语言视觉感知数据集/基准

本文针对现有植物VLM评测偏重田间宏观图像、缺少显微层级理解的问题,提出PlantMicro基准,整合5210张植物显微图像和9718个专家校订VQA,覆盖模态、染色、宿主、病原、细胞器、定位与计数等10类任务。实验显示,GPT-5、Gemini 2.5等在模态识别较强,但在细粒度生物实体、空间定位和计数上明显退化;RAG可带来稳定提升,说明瓶颈主要是植物显微领域知识不足。

FetSelect: Task-Specific Architectures and Self-Supervised Learning for Automated Fetal Ultrasound Frame Selection Figure 1
2026-06-23cs.CV

FetSelect: Task-Specific Architectures and Self-Supervised Learning for Automated Fetal Ultrasound Frame Selection

Mahmood Alzubaidi, Raden Muaz, Uzair Shah, Mohammed Ammar, Khalid Alyafei, Mowafa Househ, Marco Agus

College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar, LIST Laboratory Department of Electrical Systems Engineering, University of, available. We introduce FetSelect, a task-specific framework that pairs, combined via learned fusion. We curate 6,486 expert-labeled frames across, pretraining on 19,019 unlabeled images. On a held-out test set (974, available., unlabeled images, and (ii) a lightweight multi-path head trained on 6,486 multi-

2026-06-23视觉感知

本文针对胎儿超声生物测量前必须人工挑选最佳帧这一上游瓶颈,指出 CRL、NT、鼻骨和标尺的可用帧标准并不相同。FetSelect 将冻结视觉基础模型与任务门控分类头、检测派生质量头及学习融合结合,并用 1.9 万张超声图做 BYOL 自监督适配;在 974 张测试帧上达到平均 AUROC 0.956、质量相关 0.818,外部视频和 CRL 图像也显示任务特异判别能力。

Human and AI collaboration for pulmonary nodule segmentation Figure 1
2026-06-23cs.CV

Human and AI collaboration for pulmonary nodule segmentation

Hongqiao Dong, Wenhao Chi, Ruobing Liang, Xiaokui Yang, Wenhua Liang, Peng Hou, Wenjun Pu, Yipeng Zhao, Ping Chen, Haiping Liu, Jianxing He, Bo Liu

Human and AI collaboration for pulmonary nodule segmentation, State Key Laboratory of Mathematical Sciences, Academy of Mathematics and, Systems Science, Chinese Academy of Sciences, Beijing, China, PET/CT Center, The First Affiliated Hospital of Guangzhou Medical University, Department of Thoracic Surgery and Oncology, The First Affiliated Hospital of, Guangzhou Medical University, Guangzhou, China, Department of Mathematical Science, Tsinghua University, Beijing, China, Yau Mathematical Sciences Center, Tsinghua University, Beijing, China, China State Key Laboratory of Respiratory Disease & National Clinical Research, Centre for Respiratory Disease, Guangzhou, China, School of Mathematical Sciences, University of Chinese Academy of Sciences, National Center for Respiratory Medicine, National Clinical Research Center for

2026-06-23视觉感知

针对肺结节高质量分割标注稀缺、专家人工勾画成本高且单纯依赖自动模型易失效的问题,论文提出基于 SAM 的 Hi-Seg 人在回路流程,让标注者通过正负点击和反馈迭代学习来修正掩膜。其关键洞察是性能提升主要来自人类语义判断与模型快速边界生成的闭环协作,而非一次性提示本身。多中心 CT 验证中平均 Dice 约 85%,优于多种深度模型和 SAM 变体,并可缩短低年资或非医学标注者时间、缩小专家差距。

Physically-guided Image Generation for Multi-Projection Mapping Figure 1
2026-06-23cs.CV

Physically-guided Image Generation for Multi-Projection Mapping

Xingyun Liu, Yuqi Li, Jinhui Xiang, Pinyan Tang, Chong Wang

controllable physically-guided generative multi-projection map-, remains constrained by high time and labor costs. The genera-, Ningbo University, Ningbo, 315211 P.R.China., limits the scalability and widespread deployment of projection, ing user artistic freedom, we propose a unified, Controllable, • We propose a unified, creator-controllable generative

2026-06-23视觉感知

论文针对投影映射中扩散模型生成的理想二维图像难以适配真实三维表面、反射率和多投影仪色域约束的问题,提出 ConPhyG 框架,将内容生成划分为与物体属性协同的模式和通过辐射补偿消除干扰的对抗模式,并引入逐像素色域、深度、边缘等物理先验及有界优化补偿。四投影仪实测结果显示,其在几何对齐、色域利用和语义保真上优于现有方法,并初步扩展到 360 度多视角一致投影。

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming Figure 1
2026-06-23cs.CV

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

Ruixun Liu, Lingyu Zhang, Lanxuan Xue, Kaiyu Li, Bowen Fu, Xiangyong Cao

Faculty of Electronic and Information Engineering, Xi’an Jiaotong University, Ministry of Education Key Laboratory of Intelligent Networks and Network Security

2026-06-23数据集/基准

本文针对现有空间推理基准多局限于简单室内或小视角变化、难以检验VLM跨视角一致性的动机,提出以卫星—街景配对构建CVSBench,覆盖跨视角VQA、定位与grounding等任务,并强调用显式视觉空间表征而非纯文本推理来弥补模型缺口。实验显示主流VLM在剧烈视角变化下仍难保持物体和布局一致;CoT/SFT/RL带来的提升有限,而深度估计与认知地图式3D场景想象能带来更明显增益。

DreamUV: Unwrap Artist-like UV by End-to-End Flow Matching Figure 1
2026-06-23cs.CV

DreamUV: Unwrap Artist-like UV by End-to-End Flow Matching

Quanyuan Ruan, Jiabao Lei, Xingyi Du, Xifeng Gao

South China University of Technology, School of Data Science, The Chinese University of Hong Kong, Shenzhen

2026-06-23生成模型

DreamUV针对传统UV展开只优化几何失真、难以表达艺术家偏好的问题,将UV生成建模为网格条件的Flow Matching,从噪声采样多样化的艺术家式布局,并用边界感知训练和MITL缓解接缝误差与离散采样累积误差。实验显示其边界更直、轴对齐与打包效率更接近专业UV,同时保持较低重叠和可竞争的失真;用户研究也更偏好其结果。

Curvature-aware 3D length estimation of greenhouse cucumbers using RGB-D imaging and cubic spline arc-length integration Figure 1
2026-06-23cs.CV

Curvature-aware 3D length estimation of greenhouse cucumbers using RGB-D imaging and cubic spline arc-length integration

Manveen Kaur, Rajmeet Singh, Saeed Mozaffri, Shahpour Alirezaee

Department of Mechanical Engineering, University of Windsor, Mohamed bin Zayed University of Artificial Intelligence

2026-06-23三维

温室黄瓜按长度分级,人工测量难以支撑采收调度与物流自动化。论文提出 CucumberVision,用 RGB-D、YOLO26/SAM 分割与 3D 中轴三次样条弧长积分来估计弯曲黄瓜长度,并对五类方法做同条件比较;在 48 次采集、7 根黄瓜上,样条中轴法 MAPE 为 4.13%,显著优于 PCA、骨架、关键点等基线,同时指出颜色流内参对齐可避免 12–18% 系统低估。

MMGist: A Comprehensive Multimodal Benchmark for 2027 Figure 1
2026-06-23cs.CV

MMGist: A Comprehensive Multimodal Benchmark for 2027

Wenzhen Yuan, Jiacheng Ruan, Wutao Xiong, Chengping Zhao, Ting Liu, Yuzhuo Fu

2026-06-23视觉语言数据集/基准

针对现有视觉语言基准规模膨胀但题目常缺乏视觉依赖、已饱和或标注异常的问题,MMGist从18个基准的23,250题中用文本消融、跨模型饱和过滤和异常复核筛出7,262题,覆盖七类能力。27个LVLM实验显示,它在保留模型排名一致性(Spearman ρ=0.98)的同时减少69%题量,并将跨模型区分度提升78%,也揭示视觉逻辑仍是当前模型短板。

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation Figure 1
2026-06-23cs.CV

FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation

Yufei Zhang, Changhao Chen

The Hong Kong University of Science and Technology (Guangzhou), China

2026-06-23机器人视觉语言视觉感知生成模型安全鲁棒

本文针对连续视觉语言导航中大模型代理默认依赖干净视觉输入、遇到运动模糊/噪声等真实腐蚀会显著失效的问题,提出 FlowDec:用条件流匹配做实时去腐蚀,并结合历史帧混合时序条件与动作质心过滤,使恢复结果更符合导航动作而非单纯追求画质。在 R2R-CE、RxR-CE 六类腐蚀和真实机器人实验中,相对成功率分别提升 25.33% 与 9.38%,且比扩散式 TTA 快 3–8 倍。

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding Figure 1
2026-06-23cs.CV

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang

assigning predefined labels, and vision-language models (VLMs), ior. For robots to effectively collaborate, assist, and socialize, Beijing National Research Center for Information Science and Tech-, nology (BNRist), Department of Automation, Tsinghua University, Beijing, State Key Laboratory of General Artificial Intelligence, Beijing Institute, [28] with label "person pulls out chair". (a). Action recognition, gives precise but limited labels. (b). VLMs’ outputs are informative, ing predefined action labels [15–18] to visual inputs, as, from coarse video-label matching to fine-grained strategies, and noisy labels. Knowledge distillation methods [6, 7], limited to predefined action labels, hindering fine-grained, by manual labor or proprietary APIs, we bypass these bot-

2026-06-23视觉语言

面向家庭机器人在宽视角、小目标场景中理解人类细粒度动作的需求,论文指出传统开放词表动作识别只给标签、VLM长描述又易幻觉。GPS通过提取动作相关“Gold Points”、选择性自问校验,并用语义蕴含评估事实一致性来训练轻量VLM。基于CAP构建的指令数据实验显示,多种轻量模型在细节丰富度和事实准确性上明显提升,部分接近GPT-4o且幻觉更少。

Multi-cancer detection using a computationally efficient CNN with transfer learning Figure 1
2026-06-23cs.CV

Multi-cancer detection using a computationally efficient CNN with transfer learning

Vasileios E. Papageorgiou, Georgios Petmezas, Dimitrios-Panagiotis Papageorgiou, Leandros Stefanopoulos, Nicos Maglaveras

School of Medicine, Aristotle University of Thessaloniki, Thessaloniki, Greece, Department of Mathematics, Aristotle University of Thessaloniki, Thessaloniki, Greece, Department of Mathematics, National and Kapodistrian University of Athens, Athens, Department of Electrical and Computer Engineering, Northwestern University, Evanston, supervised learning, AI models are trained on labeled data to replicate human expertise, unnaturally and uncontrollably. According to the World Health Organization (WHO)

2026-06-23视觉感知

面向医疗影像中标注数据和算力受限的问题,本文用低复杂度CNN结合跨癌种预训练与只微调分类头,验证轻量模型是否足以迁移到脑MRI、肺/肾CT分类。5折结果显示脑、肺、肾癌准确率分别为90.85%、98.64%、99.92%,微调约20个epoch即可接近从头训练,并优于多种常用预训练骨干;但泛化到更多中心和可解释性仍文中未充分说明。

Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning Figure 1
2026-06-23cs.CV

Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning

Songtao Tian, Guhan Chen, Bohan Li, Jingyi Ma, Zixiong Yu

Tsinghua University

2026-06-23生成模型强化学习规划控制优化算法

本文针对 Flow Matching/扩散模型少步生成中一致性蒸馏仍依赖静态时间采样、难以适应不同轨迹曲率的问题,指出蒸馏难点并非集中在中间步,而是呈边界主导的 U 形分布。其核心做法是用轻量强化学习调度器动态选择高收益子轨迹,并结合 Flow-adapted DMD 与对抗一致性损失。实验称在 FLUX、SDXL 上取得更低 FID 和更好视觉质量,尤其改善极少步生成的结构畸变与高频细节。

Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers Figure 1
2026-06-23cs.CV

Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers

Edwin Kwadwo Tenagyei, Lei Wang, Ugochukwu Ejike Akpudo, Jun Zhou, Yongsheng Gao

Griffith University, Nathan QLD 4111, Australia

2026-06-23视觉感知

这篇论文针对 ViT 参数高效微调中适配器按 token 独立更新、忽略图像区域结构关系的问题,提出 HyperAdapter:用原型路由把 patch token 软分配到超边,在超边层聚合、瓶颈适配后再扩散回 token,从而把适配空间从 token 转为结构化群组。实验覆盖 24 个下游视觉任务和多种骨干,在相近参数预算下优于多类 PEFT 基线,结构推理任务增益更明显。

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset Figure 1
2026-06-23eess.IV

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

Large Language Model–Assisted Cleaning of Report-Derived Labels in a Large-, Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The, University of Tokyo, Tokyo, Japan, Department of Computational Diagnostic Radiology and Preventive Medicine, The, University of Tokyo Hospital, Tokyo, Japan, Department of Radiology, Kanazawa University Hospital, Ishikawa, Japan, Faculty of Medicine, The University of Tokyo, Tokyo, Japan, Department of Radiology, School of Medicine, Jichi Medical University, Tochigi, Japan, Department of Radiology, The University of Tokyo Hospital, Tokyo, Japan, Purpose: To evaluate whether large language model (LLM)–assisted label cleaning can, identify label–report discordance in CT-RATE, a large-scale public chest CT dataset., Microsoft Azure AI Foundry content-safety filtering, leaving 24,434 reports and 439,812 label

2026-06-23数据集/基准

针对公开胸部 CT 数据集 CT-RATE 中报告派生标签可能与原始放射报告不一致、进而影响模型训练和评测的问题,本文用 GPT-5.4 从报告中按 18 类异常重新抽取结构化标签,并结合放射科医师复核与多 LLM 多数投票评估清洗效果。结果显示 GPT-5.4 与原标签总体一致率为 96.4%、κ=0.884,但能发现有临床意义的错配;在抽样不一致案例中,医师更支持 GPT-5.4 标签的比例为 74.2%,淋巴结肿大定向样本达 91.9%,多模型投票在人工参考集上取得最高宏平均 F1 和 κ。

Enhancing Road Safety: An IoT-Based Accident Detection and Prevention Mechanism Figure 1
2026-06-23cs.ET

Enhancing Road Safety: An IoT-Based Accident Detection and Prevention Mechanism

Prabhu Pugalenthi, Pramod Krishnaa Dhanbalan

Prabhu Pugalenthi, MS Computer Science, University of Southern California, Los Angeles, CA, Pramod Krishnaa Dhanbalan, M.Sc. Software Systems, Coimbatore Institute of Technology, Tamil Nadu, India.

2026-06-23视觉感知安全鲁棒

面向超速、酒驾、疲劳驾驶及事故后救援延迟等道路安全问题,论文提出将酒精传感器、摄像头、加速度计、气囊触发按钮、GPS/GSM 与 Blynk 云平台集成到车载 ECU 的 IoT 事故预防与检测系统。其核心在于用多传感器联动实现酒驾阻止、限速/疲劳提醒和碰撞后自动定位告警;小车原型验证了告警流程,疲劳检测 CNN 报告约 91.97% 准确率,但真实道路规模化测试文中未充分说明。

No Figure
2026-06-23cs.CV

Following the Flow: Advection-Consistent Modeling for Event-based Small Object Detection

Wen Guo, Fulong Cai, Wuzhou Quan

2026-06-23视觉感知生成模型

本文针对事件相机小目标响应稀疏、易被噪声打断而难以形成连续轨迹的问题,提出 PACT,将事件演化显式建模为沿局部速度场的平流式特征传输,而非仅做局部时空聚合。其关键洞察是弱目标虽观测间歇但运动连续,噪声难满足同一传输一致性;通过轨迹特征、可微平流算子和重建模块保留弱响应并抑制背景。实验在基准数据集上相较现有方法提升 20.72% IoU 和 15.03% accuracy,计算效率相近。

No Figure
2026-06-23eess.IV

ZeroGVC: Zero-Shot Generative Video Compression with Autoregressive Diffusion Priors

Yixin Gao, Xiaohan Pan, Lin Liu, Xin Li, Zhibo Chen, Qi Tian

University of Science and Technology of China

2026-06-23视觉感知生成模型

针对现有生成式视频压缩多需额外训练、且零样本方案在GOP级多步去噪下延迟较高的问题,ZeroGVC利用预训练自回归扩散先验逐帧重建P帧;关键洞察是用可复现高斯码本的稀疏原子组合和量化系数来压缩并引导少步潜在去噪轨迹,而非传密集残差。实验显示其在超低码率下获得更好的感知重建质量,并可用双向参考减轻误差传播。

Towards Error-Free Long Video Generation Figure 1
2026-06-23cs.CV

Towards Error-Free Long Video Generation

Shuning Chang, Weihua Chen, Jiasheng Tang, Hao Xu, Zeyu Zhang, Hangjie Yuan, Yu Lu, Ruigang Niu, Fan Wang, Bohan Zhuang, Yi Yang

Zhejiang University, due to error accumulation, attribute drift, and the limited availability of

2026-06-23视觉感知

这篇论文针对长视频生成中随时间累积的画质退化、颜色/曝光偏移和身份漂移问题,提出将扩散视频模型与自回归框架结合:片段内保持双向注意力,片段间用因果注意力与KV缓存建模长期上下文,并用基于相关性的片段选择控显存;同时提出T-RFlow,按频率截断整流流以抑制过锐和色偏。实验显示其在分钟级单镜头视频上提升一致性与VBench表现,但具体增益中数据规模与训练细节贡献仍需进一步拆分说明。

ORBIT: Training-Free Multi-Attribute Behavioral Steering via Orthogonal Subspace Rotation Figure 1
2026-06-23cs.CL

ORBIT: Training-Free Multi-Attribute Behavioral Steering via Orthogonal Subspace Rotation

Narges Ghasemi, Amir Ziashahabi, Salman Avestimehr, Jonathan May

Information Sciences Institute, University of Southern California, Department of Electrical and Computer Engineering, University of Southern California

2026-06-23视觉感知

本文针对多属性激活 steering 中向量相加易受范数失衡、方向抵消影响且训练式方法难以动态换属性的问题,提出 ORBIT:先用 SVD 合并各属性 steering 平面为共享正交子空间,再按 token 失配程度门控并在子空间内做保范数旋转。实验在 TraitFactory 与 ToneBank、三类模型上显示,其多属性控制更均衡、成功率更高,并较好保持生成连贯性。

Interest Entanglement: The Hidden Barrier to Blind Super-Resolution Optimization Figure 1
2026-06-23cs.CV

Interest Entanglement: The Hidden Barrier to Blind Super-Resolution Optimization

Junxiong Lin, Xinji Mai, Qianyu Guo, Haoran Wang, Zeng Tao, Xuan Tong, Ivy Pan, Wenqiang Zhang

College of Intelligent Robotics and Advanced Manufacturing, Fudan University, College of Computer Science and Artificial Intelligence, Fudan University, The University of Hong Kong, Shanghai Institute of Virology, Shanghai Jiao Tong University School of Medicine

2026-06-23优化算法

本文针对盲超分中保真度与感知质量难以兼顾的问题,指出回归损失与感知损失在频域关注不同,导致特征层面的“兴趣纠缠”。作者提出 SFR 框架,将不同目标的学习解耦,并用 InfoSqueeze 对共享特征去冗余、对齐空间。五个数据集上的定量、定性和消融实验显示其在 PSNR/SSIM 与 LPIPS 间取得更好折中,但具体增益相对各基线的统计显著性文中未充分说明。

Reliability-Guided Adaptive Ensembling for Robust Test-Time Adaptation Figure 1
2026-06-23cs.LG

Reliability-Guided Adaptive Ensembling for Robust Test-Time Adaptation

Adam Koziak, Yuhong Guo

School of Computer Science, Carleton University, Ottawa, Canada, model online using only unlabeled target-domain test samples [27, 18, 30]. Rep-, resentative methods such as Tent [27], pseudo-label-based adaptation [16], and, harm their own predictions: they can also corrupt the statistics, pseudo-labels, ronments are changing online and source data is unavailable. While adversarial, Code available at https://github.com/AdamKoziak1/RobustTestTimeAdaptation.

2026-06-23安全鲁棒

论文关注测试时自适应在对抗污染在线测试流中会被错误样本持续带偏的问题,提出训练无关的 SAFER 包装器:对每个样本生成随机增强视图,用跨视图特征一致性估计可靠性、丢弃离群视图并加权汇聚预测,同时保留原 TTA 目标。作者在 PACS、VLCS、OfficeHome 的不同 PGD 攻击率下验证,SAFER 可增强多种 TTA 方法的抗攻击稳定性,并基本维持干净数据性能。

Customizing Video Portraits via Identity-ActionDecoupling Figure 1
2026-06-23cs.CV

Customizing Video Portraits via Identity-ActionDecoupling

Junxiong Lin, Haoran Wang, Xinji Mai, Zeng Tao, Xuan Tong, Ivy Pan, Wenqiang Zhang

College of Intelligent Robotics and Advanced Manufacturing, Fudan University, College of Computer Science and Artificial Intelligence, Fudan University, The University of Hong Kong, identity consistency and (2) exhibit rich, controllable expres-, in preserving identity, they overlook controllability of facial, rally fine-grained and controllable dynamic driving of facial, exhibits rich, controllable facial movements and scene varia-

2026-06-23视觉感知

这篇论文针对身份保持文生视频中“保脸”与“表情动作可控”冲突:现有零微调方法把含表情、动作等非身份信息的脸部 embedding 一并注入,易导致动作单调或不听文本。作者提出 IaD,将身份特征与 Facial-Action 特征解耦,并用身份解耦损失和文本对齐损失分别约束身份纯度与动作语义匹配。实验声称在无需针对新身份微调的情况下,相比 ID-Animator、ConsisID 提升身份一致性、文本对齐和视觉真实感,但极端姿态、长视频和多人场景仍未充分解决。

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation Figure 1
2026-06-23cs.CV

T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation

Gagandeep Singh, Aaditya Yadav, Priyanka Singh

The University of Queensland, labels, and supporting grounding metadata. Starting from a news, Most provide binary authenticity labels, coarse manipulation cate-, severity score and a corresponding coarse low/medium/high label, the low/medium/high labels serve as coarse operating buckets rather, Multi-label detection, Boxes, labels, severity labels, modality and edit-type annotations, and sup-, that multimodal systems still center on truthfulness, support/refute, decisions, or coarse manipulation labels rather than graded impact, labels.

2026-06-23机器人视觉感知数据集/基准

这篇论文针对现有多模态伪造检测多停留在真假或类型标签、难以衡量“改动多大程度改变叙事理解”的问题,提出 T-IMPACT 基准:用语义锚点定位、局部图像编辑与受约束文本改写生成近 9.9 万个新闻图文样本,并提供连续严重度分数、粗粒度等级和 grounding 元数据。实验显示模型能捕捉部分真伪信号,但严重度排序与人类判断仍弱相关,说明上下文影响评估比二分类更难。

EmbodiedUS-FS: Fast Slow Intelligence for Ultrasound Robotics Figure 1
2026-06-23cs.RO

EmbodiedUS-FS: Fast Slow Intelligence for Ultrasound Robotics

Fangzhuo Zhang, Xinyu Wang, Xiao Yang, Jinchang Zhang

2026-06-23机器人

面向真实临床超声机器人中“医生指令需语义规划、扫描执行又需高速闭环适应”的矛盾,论文提出快慢脑分层框架:慢脑结合 API/手册检索、任务图与计划校验生成可执行流程,快脑用图像、位姿/力和患者运动反馈做局部恢复,并加入安全盾与升级机制。实验覆盖规划、动态扰动执行和安全验证,显示任务成功率提升且安全违规减少,但真实临床规模化验证仍有限。

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution Figure 1
2026-06-23cs.LG

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

Soyeon Kim, Kyowoon Lee, Jaesik Choi

Diffusion Integrated Gradients: Controllable Path, Ajou University, Korea, INEEJI Corp., Korea, controllable Explainable Artificial Intelligence (XAI) methods., controllable guidance (see Sec. 3). (Bottom) Visualization in the image space, where

2026-06-23生成模型规划控制优化算法

本文针对 Integrated Gradients 直线路径在现代 ReLU 网络中易穿越梯度不连续区域、导致归因噪声和失真的问题,提出 DiffIG:用 Stick-Breaking 过程生成路径分布训练扩散模型,并在推理时通过 guided sampling 注入保真度、复杂度等用户约束,生成可控非线性积分路径。实验显示其在定量指标上匹配或优于既有路径归因方法,解释更符合感知且更忠实;但仍依赖固定 baseline,跨模态泛化文中未充分说明。

Specificity- and Calibration-Aware Breast Ultrasound Segmentation via Entropy-Guided Boundary Supervision Figure 1
2026-06-23eess.IV

Specificity- and Calibration-Aware Breast Ultrasound Segmentation via Entropy-Guided Boundary Supervision

Manar Alsaid, Mandip Shrestha, Mohammad Abbas

Department of Computer Science, East Texas A&M University, Texas Woman’s University, and the availability of annotated public datasets. The BUSI, The UDIAT dataset provides multicenter BUS images col-

2026-06-23视觉感知学习理论

本文针对乳腺超声分割中边界模糊导致的轮廓泄漏,以及正常图像中伪病灶高置信误检问题,提出用预测熵和真实边界共同加权的边界监督,使训练更关注模型不确定的病灶边缘,并结合空间温度缩放改善概率校准。在 BUSI 上,病灶图像 Dice 基本不变,但无病灶图像误检由基线的 14/20、标准边界损失的 19/20 降至 5/20,ECE 也由 0.0201 降至 0.0095;结论更偏向提升特异性与校准,而非提升重叠精度。

Towards Accurate and Robust Surveillance Roadside IVD via Trackletized Audio-Visual Reasoning Figure 1
2026-06-23cs.CV

Towards Accurate and Robust Surveillance Roadside IVD via Trackletized Audio-Visual Reasoning

Xiwen Li, Xiaoya Tang, Bodong Zhang, Tolga Tasdizen

Kahlert School of Computing, University of Utah, Scientific Computing and Imaging Institute, University of Utah, Department of Electrical and Computer Engineering, University of Utah, tical and scalable solution for monitoring vehicle idling be-, cues with the last-frame labeling protocol and avoid un-

2026-06-23安全鲁棒

这篇论文针对路侧怠速车辆检测在跨日期、跨地点部署时易依赖背景捷径、音频与单车实例难对齐的问题,提出以车辆轨迹片段为中心的 TAVR:先检测并跟踪车辆,再结合几何约束的音频绑定 MASP 与状态结构化表征 JACE 做逐车判断。实验在原 AVIVD 及新增 AVIVD-LT、AVIVD-M 上均优于既有 IVD、通用音视频模型和音视频 MLLM,显示鲁棒性提升主要来自实例锚定与音频-几何对应。

Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding Figure 1
2026-06-23cs.CV

Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT-Quantization Embedding

Mohamed Dhouib, Ye Zhu, Sonia Vanier, Aymen Shabou

2026-06-23视觉感知

本文针对文档篡改定位在合成训练到真实/跨域场景中泛化差的问题,提出 DiffNet:用多级零和滤波的幅值差异变换压制内容特征、突出不一致线索,并以频率索引感知的 DCT-量化联合嵌入替代较重的频域头。结果显示其在人为篡改与跨域协议上较既有最佳方法约提升 30%,吞吐最高提升 7 倍。

MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learninga Figure 1
2026-06-23cs.CV

MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learninga

Wenhao Wang, Franziska Boenisch, Michael Backes, Adam Dziedzic

CISPA Helmholtz Center for Information Security, set, which correspond to mislabeled samples in SL [3, 5], example, based on label prediction in SL [5] or augmen-, pattern, rather than SL models which memorize labels [5]., from label-driven to pattern-driven memorization behavior

2026-06-23视觉感知

这篇论文关注多模态对比学习中训练样本被模型“记住”却缺乏统一度量的问题,提出 MultiMem,用留一训练模型对比来衡量任意数量模态的记忆化。实验显示,全模态记忆与单/子模态不同,跨模态语义错配是最强诱因,文本影响最大;针对高记忆样本做训练中增强或训练后剔除微调,可将记忆化降低最高 20%,并提升检索、零样本和下游分类性能。

Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge Figure 1
2026-06-23eess.IV

Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge

Yongheng Sun, Minhui Yu, Mengqi Wu, Maureen Kohi, Mingxia Liu

University of North Carolina at Chapel Hill

2026-06-23生成模型

针对纵向淀粉样蛋白 PET 随访昂贵、辐射累积且生成模型易复制基线或身份漂移的问题,本文将预测未来 PET 重写为锚定基线扫描的条件泊松扩散桥,并结合 DiT、随访间隔/MRI 调制和 VOI 加权损失以刻画细微进展。在 542 名受试者的 PIB/AV45 两队列上,方法较 SOTA 更能捕捉淀粉样沉积的纵向变化。

Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation Figure 1
2026-06-23cs.CV

Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation

Rui Wang, Quentin Lohmeyer, Siyu Tang, Mirko Meboldt

2026-06-23三维

本文针对动态 3D Gaussian Splatting 中“可跟踪的一致运动”和“高保真瞬态细节”难以兼得的问题,提出 Multi4D:让静态结构、持久动态几何和瞬态外观三类高斯在共享渲染与残差驱动优化中竞争分配建模责任。实验显示其在 Technicolor、Neu3D 等动态新视角合成上提升 PSNR 并达到百 FPS 级渲染,同时以更少动态 primitives 支持更快的 4D 分割。

Resolving Multi-Target Association in OFDM-based ISAC via Vision-aided Multi-Modal Learning Figure 1
2026-06-23cs.CV

Resolving Multi-Target Association in OFDM-based ISAC via Vision-aided Multi-Modal Learning

Meng Hua, Chenghong Bian, Deniz Gunduz

(bounding-box coordinates and class labels) with the DDM, against triangular soft labels centered on the ground-truth, M. Hua and D. G¨und¨uz are with the Department of Electrical and Electronic, Engineering, Imperial College London, London SW7 2AZ, U.K. (e-mail:, C. Bian is with the Department of, Electrical and Computer Engineering, Hong Kong University of Science and, soft labels, a variant of label distribution learning, to

2026-06-23视觉感知

针对OFDM-ISAC在多目标场景中仅靠延迟-多普勒图难以完成目标关联、且同一分辨单元内目标不可分的问题,论文引入车载视觉作为辅助模态:用DeepJSCC传输图像,经YOLOv5提取框和类别,再与DDM及几何信息融合估计位置、时延和速度,并用三角软标签KL损失稳定分类训练。Blender车流测试中达到16 cm定位RMSE、10.8 ns时延RMSE和5.5 m/s速度RMSE;去除视觉后定位误差约恶化60倍,说明收益主要来自视觉提供的目标级语义关联。

Dual-Stream EEG Decoding for 3D Visual Perception Figure 1
2026-06-23cs.CV

Dual-Stream EEG Decoding for 3D Visual Perception

Ninon Lizé Masclef, Taisija Demcenko, Antonella Catanzaro, Nataliya Kosmyna

Massachusetts Institute of Technology

2026-06-23三维

针对现有脑解码模型难以从 EEG 中同时区分 3D 物体类别与视角/朝向的问题,论文借鉴腹侧“是什么”和背侧“在哪里/如何”通路,设计双流解码框架,并结合圆形回归与 EEG 条件多视角扩散生成。结果显示模型可在六类物体上达到最高 68% 分类准确率,角度误差约 10–11°,并能从神经信号重建 3D 物体;可解释性分析还提示解码依赖动态的腹侧、背侧与运动相关通道协同,而非单一腹侧主导。

From Convolution to Transformer: A Comparative Study of U-Net Variants for Brain Tumor and Retinal Vessel Segmentation Figure 1
2026-06-23cs.CV

From Convolution to Transformer: A Comparative Study of U-Net Variants for Brain Tumor and Retinal Vessel Segmentation

Khoa Pham, Sindhuja Penchala, Jiacheng Li, Andy Perkins, Noorbakhsh Amiri Golilarz

Mississippi State University, 2The University of Alabama, experts. However, manual segmentation is time consuming, labor

2026-06-23视觉感知

这篇论文针对传统卷积 U-Net 难以建模长程依赖的问题,比较 3D U-Net、Residual U-Net、Attention U-Net、UNETR 与 Swin UNETR 在脑肿瘤和视网膜血管分割中的表现。核心洞察是不同结构偏置适合不同目标:Transformer 更利于全局上下文,残差学习仍有助于细小血管。结果显示 Swin UNETR 在 BraTS 2023 和 DRIVE 上 Dice 分别达 0.8965、0.8078,整体最佳。

No Figure
2026-06-23cs.CV

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

Sourabh Sharma, Sonam Gupta, Sadbhawna Thakur

Malaviya National Institute of Technology Jaipur

2026-06-23视觉语言视觉感知

这篇论文针对VLM自训练只按答案正确性筛选样本、容易把视觉幻觉和语言捷径写入CoT监督的问题,提出“感知验证”流程:先用caption-reasoning-conclusion模板拆开感知与推理,再用PerceptEval结合图文对齐和OCR无监督验证caption,并按难度进行两阶段课程学习与caption引导重生成。实验称在多个领域和模型上较标准自训练最高提升约16%,主要价值在于用低成本过滤机制提升多模态推理的视觉扎根性。

Failure Analysis in Transition: An Industry Survey of Challenges, Priorities, and Standardization Needs in Advanced Packaging and Heterogeneous Integration Figure 1
2026-06-23cs.SE

Failure Analysis in Transition: An Industry Survey of Challenges, Priorities, and Standardization Needs in Advanced Packaging and Heterogeneous Integration

Himanandhan Reddy Kottur, Nusra Akter Takia, Mahamudul Hassan Fuad, Istiaq Firoz Shiam, Matthew Walsh, Navid Asadizanjani

*Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA, EDA & tool vendors, failure analysis laboratories, interpret them as evidence of a broader shift in the center of, c) Failure analysis laboratories at 16%

2026-06-23视觉感知

面向异构集成、chiplet、混合键合和背面供电使失效机制转向封装界面与系统耦合的趋势,论文通过约百名产业从业者问卷梳理失效分析瓶颈。核心洞察是难点已从单器件定位扩展到样品制备、三维无损成像、跨工具数据贯通与标准化。结果显示69%受访者聚焦异构/3D产品,封装与HI失效分析重要性最高为7.92/10,混合键合最难分析占54%,无损高分辨成像和数据标准化需求最突出。

SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis Figure 1
2026-06-23cs.CV

SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis

Niyoj Oli, Sachin Acharya, Sandesh Pokhrel, Sanjay Bhandari, Ramesh Rana, Nikesh Mani Shrestha, Ram Bahadur Gurung, Yash Raj Shrestha, Prashnna K Gyawali, Binod Bhattarai

Nepal Applied Mathematics and Informatics Institute for Research, Nepal, GastroIntestinal Department, Dhulikhel Hospital, Nepal, University of West Virginia, USA, University of Utah, USA, University of Aberdeen, UK, technical expertise to perform diagnosis. However, almost all open-source, publicly available datasets are predominantly, image captioning, multi-label classification, and visual question answering (VQA) tasks. It consists of 1,300 images, their captions along with hallucination tag, 18 labels and 14,726 question-answer pairs making it well-suited for diverse, population bias in medical AI. The code is publicly available at https://github.com/bhattarailab/SAGE, and the, Table 1: Comparison of publicly available gastrointestinal endoscopy datasets. SAGE is the only dataset collected from, Unlabelled, further extended this landscape with 10,662 labeled images

2026-06-23视觉语言数据集/基准

针对南亚胃肠内镜数据长期缺位、现有模型可能受欧洲数据偏置影响的问题,SAGE提供尼泊尔采集的1300张专家标注图像,覆盖图像描述、多标签分类、VQA与幻觉标注。基准显示,分类模型迁移到南亚数据平均性能下降58%,多模态大模型在解剖定位和异常检测上的GREEN分数也较低,提示地域分布差异会显著削弱医学AI可靠性。

Feed-forward Motion In-betweening for Any 4D Figure 1
2026-06-23cs.CV

Feed-forward Motion In-betweening for Any 4D

Hiroki Nishizawa, Hubert P. H. Shum, Yoshihiro Fukuhara, Hirokatsu Kataoka, Shigeo Morishima

Waseda University, Durham University, controllability, and short-horizon generation often leads to error accu-, controllability on both DyMesh16 and DyMesh32 benchmarks., introduce new limitations that hinder their use as controllable 4D content creation

2026-06-23视觉感知

这篇论文针对任意拓扑4D网格生成中推理慢、文本控制不足和长序列漂移的问题,提出CompletionAny4D:用参考网格锚定形状/拓扑,借助逐帧mesh VAE把关键帧注入潜空间,再用关键帧条件rectified flow补全中间帧。实验在DyMesh16/32上显示其相比现有前馈4D生成具备更好的可控性,并可在短序列训练下生成更长、时空一致性更强的结果。

Surgical Anatomy Recognition with Context Learning using Foundation Representations Figure 1
2026-06-23cs.CV

Surgical Anatomy Recognition with Context Learning using Foundation Representations

Ronald L. P. D. de Jong, Tim J. M. Jaspers, Raf A. H. Vervoort, Aron F. H. A. Bakker, Yiping Li, Jip L. Tolenaar, Jelle P. Ruurda, Willem M. Brinkman, Josien P. W. Pluim, Marcel Breeuwer, Daan de Geus, Fons van der Sommen

2026-06-23视觉感知

针对微创手术中解剖结构识别因标注稀缺、流程差异大而难以泛化的问题,论文同时提出 ATLAS-120k 数据集和 ATLAS 视频分割模型;核心做法是在外科基础模型表征上加入手术类型、阶段与短期时序记忆等上下文查询。实验显示其在 AP、mDice 与视频一致性上优于多类自然图像和内窥镜预训练基线,并可在 H100 上达到 64 FPS,但部分增益可能主要来自数据规模与域内预训练。

Accurate identification and measurement of the precipitate area by two-stage deep neural networks in novel chromium-based alloys Figure 1
2026-06-23cs.CV

Accurate identification and measurement of the precipitate area by two-stage deep neural networks in novel chromium-based alloys

Zeyu Xia, Kan Ma, Sibo Cheng, Thomas Blackburn, Ziling Peng, Kewei Zhu, Weihang Zhang, Dunhui Xiao, Alexander J Knowles, Rossella Arcucci

2026-06-23视觉感知

针对铬基超合金电镜图像中析出相面积与尺寸分布依赖人工阈值、对噪声和材料差异不鲁棒的问题,论文提出两阶段 DT-SegNet:先用 YOLOv5 高效定位候选析出相,再用 SegFormer 精细分割。实验显示其在准确率、精确率、召回率和 F1 等指标上优于 Weka、ilastik,有助于高通量合金开发中的显微组织测量。

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology Figure 1
2026-06-23cs.LG

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology

Pietro Belligoli, Nikita Makarov, Sayedali Shetab Boushehri, Fabian Schmich, Raul Rodriguez-Esteban, Michael Menden

ences Center of Excellence, Roche, Penzberg, Germany 2Technical, University of Munich, Munich, Germany 3Computational Health, Center, Helmholtz Munich, Munich, Germany 4Department of, Biology, Ludwig Maximilian University of Munich, Munich, Germany 5Computational Sciences Center of Excellence, Roche, Basel, Switzerland 6Department of Biochemistry and Pharmacol-, ogy, Bio21 Molecular Science and Biotechnology Institute, The, University of Melbourne, Parkville, Australia. Correspondence to:

2026-06-23生成模型

这篇论文针对眼科精准治疗中多模态、非规则随访数据难以预测长期视力变化的问题,提出 OphthaDT:将 3220 名临床试验患者的病史、检查、治疗等纵向记录序列化为结构化文本,并微调 LLM 预测 BCVA 轨迹。结果显示其在 nAMD 上较基线平均 MAE 降低 6.0%,在 DME 上与强基线相当,提示 LLM 数字孪生的优势主要出现在轨迹更复杂、波动更大的疾病中。

Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring Figure 1
2026-06-23cs.CV

Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring

Taeho Kang, Nairan Zhang, Yelin Kim, Yujiao Shi, Youngki Lee

Seoul National University, ShanghaiTech University

2026-06-23安全鲁棒

这篇论文针对地面图像与鸟瞰图跨视角定位中,偏航角在位置有噪声、视角未知时难以稳定估计的问题。核心洞察是将地面图像列特征与 BEV 中径向线对齐,利用同一径向方向上候选位置诱导相同 yaw 的不变性,通过三维投票把正确匹配聚成峰值,从而摆脱高度和精确位置假设。在 Mapillary、Ford、KITTI、VIGOR 上,LAYS 在未知 yaw 尤其普通 FoV 场景取得约 28–45 个百分点提升,并可作为下游 3-DoF 定位的 yaw 先验。

BAC-JEPA: Label-Efficient Breast Arterial Calcification Segmentation via Synthetic Mammography-Guided Supervision Figure 1
2026-06-23cs.CV

BAC-JEPA: Label-Efficient Breast Arterial Calcification Segmentation via Synthetic Mammography-Guided Supervision

Scott Chase Waggener, Lakshman Tamil

BAC-JEPA: Label-Efficient Breast Arterial, Department of Computer Engineering, University of Texas at Dallas, We present BAC-JEPA, a label-efficient segmentation frame-, labeled BacSeg synthetic two-dimensional mammograms derived, commonly relies on clinical and laboratory variables rather, positive labels using morphology- and physics-informed rules, evaluation on corrected labels [6]., These challenges motivate label-efficient approaches that, labeled images with scalable exact masks for dense BAC, nal validation on the public human-labeled BacSeg dataset, independent human-labeled synthetic two-dimensional mam-

2026-06-23视觉感知

这篇论文针对乳腺动脉钙化分割中像素级标注昂贵、且BAC形态细长易与高亮伪影混淆的问题,提出用真实乳腺X线背景合成带精确掩码的BAC,并结合JEPA预训练ViT与高分辨率解码器训练分割模型。结果显示ViT-B在合成验证集IoU为0.5325、Dice为0.6357,在BacSeg上由分割概率图做图像级判别AUROC达0.8719;但真实乳腺片的像素级临床验证仍未完成,泛化能力仍需专家标注校准。

Morphology-Aware Multimodal Representation Learning for Insect Phylogenetic Reconstruction Figure 1
2026-06-23cs.CV

Morphology-Aware Multimodal Representation Learning for Insect Phylogenetic Reconstruction

Zixuan Liu, Kaijie Yu, Chun He, Xiaoxu Cai, Xinhai Ye, Haishuai Wang, Gongyin Ye, Jiajun Bu

incomplete, unavailable, or difficult to obtain [2]. It also, Key Lab of Accessible Perception and Intelligent Systems, Zhejiang, Kaijie Yu, Chun He, Gongyin Ye are with the State Key Laboratory of, Laboratory of Molecular Biology of Crop Pathogens and Insects, Institute of, Insect Sciences, Zhejiang University, Hangzhou 310058, China., Xiaoxu Cai is with the Rural Development Academy, Zhejiang University, Xinhai Ye is with the College of Advanced Agriculture Science, Zhejiang, A&F University, Hangzhou 311300, China., The source code, data, and implementation details are publicly available at, morphological matrices are labor-intensive and can vary with, Image-derived morphological traits provide a scalable

2026-06-23视觉语言三维

这篇论文针对昆虫系统发育中人工形态编码难扩展、纯视觉特征缺少形态语义约束的问题,提出将标本图像与整理后的属级形态描述对齐:用 LoRA 和监督对比学习适配自监督 ViT,再把图像嵌入作为连续性状用于贝叶斯建树。Rove-Tree-11 上,多骨干和消融结果显示图文对齐比原始或仅图像微调特征更接近参考树,注意力分析也显示模型更关注形态相关区域。

Learning Cross-View Semantic Priors for Single-Reference Unseen Object Pose Estimation Figure 1
2026-06-23cs.CV

Learning Cross-View Semantic Priors for Single-Reference Unseen Object Pose Estimation

Jiahong Chen, Jinghao Wang, Ziwen Wang, Zi Wang, Banglei Guan, Qifeng Yu

will be available at chenjiahongbq.github.io/LCVSP., of National University of Defense Technology under Grant ZK24-31, and, and Qifeng Yu are with the College of Aerospace Science and Engi-, neering, National University of Defense Technology, Changsha 410073, China, and also with the Hunan Provincial Key Laboratory of Im-, available as the reference. A common solution is to follow a

2026-06-23三维

这篇论文面向单参考视角下的未知物体6D位姿估计,动机是现有方法把VFM特征当作各视角独立描述子,难以应对大视角差和噪声掩码。核心做法是在几何解码前引入跨视角语义交互,并用IVSP保持token结构、RAGC约束3D一致性。实验在六个基准和困难视角配对协议上达到SOTA且速度相近。

A Controlled Study of CLIP-Based Body-Scene Fusion for Emotion Recognition in Context Figure 1
2026-06-23cs.CV

A Controlled Study of CLIP-Based Body-Scene Fusion for Emotion Recognition in Context

Zubair Abbas, Muhammad Umair, Muqaddas Hameed

Department of Computer Science, University of Central Punjab, Lahore, Pakistan, the full image. The fused feature predicts 26 categorical emotion labels and the continuous valence, arousal, and dominance values., the next step should focus on label relationships and finer subject-context interaction., Index Terms—Emotion recognition, affective computing, EMOTIC, context-aware recognition, CLIP, multi-label classification., categories as the main weakness, motivating label-, expression is weak or unavailable [9].

2026-06-23视觉感知规划控制

本文针对自然图像中面部不可见或表情中性时情绪识别依赖身体姿态与场景语义的问题,构建ResNet-18人体裁剪分支与CLIP ViT-B/16全图场景分支的轻量双流模型,并在同一流程下检验简化去偏、反事实和稀有类训练策略。结果显示干净基线在EMOTIC测试集达到34.52% mAP,所有附加变体均未提升,说明CLIP已提供较强全局语义,后续瓶颈更可能在标签关系和细粒度主体-场景交互。

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR Figure 1
2026-06-23cs.AI

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

Zekun Xu

2026-06-23视觉语言视觉感知强化学习规划控制

本文关注多模态 RLVR 中视频语言模型为优化结果奖励而“停止看视频”、转向语言先验的视觉捷径问题。作者把 grounding penalty 强度 λ 作为可控变量,并用扰动式 VHS 指标沿训练过程追踪捷径形成与逆转。结果显示,捷径会在窄训练窗口内突发且跨随机种子稳定;增大 λ 可单调压低捷径平台,中等强度会先形成再逆转;惩罚必须在形成前或临界期介入,事后补救效果明显较弱。

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance Figure 1
2026-06-23cs.CV

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

Yuan-Zhih Lin, Huu-Thang Nguyen, Huu-Phu Do, Hong-Han Shuai, Ching-Chun Huang

Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan, improves temporal stability and multi-object controllability, multi-object controllability.

2026-06-23视觉感知

针对扩散式视频编辑在多对象场景中易出现注意力泄漏、属性纠缠、身份漂移和时间闪烁的问题,IDAG-Edit在无需训练的框架中引入布局引导交叉注意力、实例级时空解耦引导和实例解耦自注意力,用掩码将各对象的语义、运动与特征交互分开约束。实验显示其相较VideoDirector、VideoGrain等方法提升了多对象可控性和时间稳定性。

Topological summaries of fingerprint ridge patterns carry identity information Figure 1
2026-06-23cs.CV

Topological summaries of fingerprint ridge patterns carry identity information

Chad M. Topaz, Niny Arcila-Maya, Elizabeth Munch, Zofia Stanley, Lori Ziegelmeier

aWilliams College, Williamstown, MA 01267, bQSIDE Institute, Williamstown, MA 01267, cUniversity of Colorado Boulder, Boulder, CO 80309, dSan Francisco State University, San Francisco, CA 94132, eMichigan State University, East Lansing, MI 48824, fMacalester College, Saint Paul, MN 55105

2026-06-23视觉感知

论文针对指纹验证过度依赖细节点提取、骨架化和专有匹配流程的问题,改用拓扑数据分析直接概括脊线/谷线整体形状:在距离变换场上计算持久同调,用多尺度环结构表征身份信息。FVC2000 DB1 上,简单拓扑摘要已明显优于像素几何基线,学习模型 AUC 达 0.91;局部最优传输在低误接受率下更强,二者融合在严格 FAR 阈值下表现最佳,说明拓扑特征可作为细节点系统的透明补充。

One-Shot Data Selection for Medical Image Classification via Graph Coverage Figure 1
2026-06-23cs.CV

One-Shot Data Selection for Medical Image Classification via Graph Coverage

Zahiriddin Rustamov, Nadia Badawi, Rafat Damseh, Nazar Zaki

Department of Computer Science and Software Engineering, United Arab Emirates, University, Al Ain, United Arab Emirates, Department of Computer Science, KU Leuven, Leuven, Belgium, equally, yet acquiring expert labels is expensive. Active learning reduces, training during selection. Code is available at https://github.com/, label, but which samples to label., the most informative unlabeled samples are selected, and an expert annotates, The availability of foundation models pretrained on large-scale medical image

2026-06-23视觉感知

针对医学图像标注昂贵、主动学习需多轮训练和反复专家介入的问题,论文提出在冻结基础模型嵌入上构建全局 kNN 图,用一阶与二阶邻接近似热扩散覆盖核,再以带类别预算的贪心 facility location 一次性选样。核心洞察是局部图结构比完整谱扩散更关键,且跨类别全局图能捕捉边界信息。五个 MedMNIST 数据集上,该方法在 10 个数据集-比例设置中的 9 个取得最高 balanced accuracy,类不均衡场景增益更明显。

From Driving Videos to Simulatable Scenarios Figure 1
2026-06-23cs.SE

From Driving Videos to Simulatable Scenarios

Alexandre Levy, Ernest Valveny Llobet, Antonio Manuel López

it is crucial to reproduce these scenarios in a controllable, repeatable, and scalable manner, with simulation playing a, in a controllable and scalable manner is needed. Thus, Computer Vision Center (CVC), UAB, language [2], chosen for its open-source availability, high-, metrics and human judgment through elaborated surveys on

2026-06-23视觉感知

面向自动驾驶安全评测中“从真实事件到可重复仿真场景”依赖人工编程、成本高的问题,论文提出 D-V2S:先用带提示的 VLM 将行车视频解析为可编辑的自然语言场景描述,再由上下文约束的 LLM 生成 SCENIC/CARLA 可执行场景。实验显示生成场景平均保留约 90% 相关语义元素,DRA 中 GPT-4o 明显优于 LLaVA/Qwen-VL,SG 相比 LCTGen、ChatScene 获得 0.93 的语义保持分和 75% 人类偏好,但增益可能部分来自模型 scaling。

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation Figure 1
2026-06-23cs.CV

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

2026-06-23视觉感知

该文针对视频扩散模型少步蒸馏中 DMD 在 4 步预算下易出现布局不稳、过饱和和运动崩塌的问题,指出其只匹配样本内分布、缺少对帧间与样本间 copula 关系约束。CoDMD 复用教师和在线模型已有 score,构造批间与帧间关系矩阵并对齐,无需额外网络或采样轨迹。在 Wan-2.1-T2V 1.3B/14B 上将 50 步蒸馏为 4 步,约 25 倍加速,VBench 达 84.46/84.87,优于 DMD 与 rCM。

Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems Figure 1
2026-06-23cs.HC

Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems

Jingjing Jiang, Atsumoto Ohashi, Ryuichiro Higashinaka

Graduate School of Informatics, Nagoya University, Japan

2026-06-23视觉感知

该文针对全双工语音对话虽低延迟却缺少面对面交流中表情、唇动和头动的问题,提出 Moshi-Face:用 VQ-VAE 将 3D 面部运动离散为与音频同频率的 face tokens,并在 Moshi 中加入非自回归 Face Transformer 同步生成语音与面部运动。基于 180 小时视听对话数据的实验显示,其能在低延迟下保持较好音画对齐,同时基本保留原音频模型的对话质量;但真实感仍缺少人工评价验证。

No Figure
2026-06-23cs.CV

Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG

Oanh N. Tran, Thanh Quoc Hung Le, Oscar Chew, Kuan-Hao Huang, Khoa D. Doan

VinUni-Illinois Smart Health Center, VinUniversity, Texas A&M University

2026-06-23视觉感知

本文针对视觉问答中“小目标需放大、但盲目裁剪会破坏大目标上下文且增加延迟”的矛盾,提出 ViRGo 将视觉检索改写为自适应路由问题:利用 VLM 初次前向中的定位头、语义置信度和图像尺度,选择全局感知、注意力裁剪或 patch 检索。实验显示其在多类 VQA 和不同骨干上改善准确率—效率权衡,小目标接近检索方法,大目标更多保留上下文并减少不必要计算。

Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation Figure 1
2026-06-23cs.CV

Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation

Houzhang Fang, Ruixuan Huang, Qiuhuan Chen, Xiaolin Wang, Yi Chang, Luxin Yan

Xidian University, Xi’an, China, Huazhong University of Science and Technology, Wuhan, China

2026-06-23视觉感知

这篇论文针对高分辨率红外小目标检测中目标弱、背景干扰强且全图计算冗余的问题,提出 ECFNet:先用网格化多尺度区域二分类筛出含上下文的候选区,并通过带噪 GT 掩码重建训练提升抗背景干扰能力;再在局部候选区上用轻量检测器,并以教师-学生交叉注意力先验做知识蒸馏。实验在三个真实红外数据集上优于单阶段和两阶段方法,同时保持较高实时效率。

CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales Figure 1
2026-06-23cs.CV

CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales

Xinlong Chen, Jiafu Tang, Yue Ding, Yizhuo Jia, Bozhou Li, Bohan Zeng, Yang Shi, Shihao Li, Yiyan Ji, Qiang Liu, Weihong Lin, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

2026-06-23视觉语言视觉感知数据集/基准

现有视频字幕基准多偏短、场景单一且少有转场,难以暴露长视频中同一主体指代漂移对理解与生成任务的影响。CapRiCorn-1K收集1000个含动态转场、最长600秒的视频,并同时评估字幕质量与主体指代一致性,支持视听和纯视觉设置。实验显示当前模型在准确、完整描述和保持主体一致方面仍明显不足,且视频越长性能下降越明显;其指标还与下游智能体理解和视频重建表现强相关。

ScalePredictor: Instance-aware Scale Learning for Accurate Quantization of Vision Transformers Figure 1
2026-06-23cs.CV

ScalePredictor: Instance-aware Scale Learning for Accurate Quantization of Vision Transformers

Changjun Li, Runqing Jiang, Lian Xu, Ye Zhang, Qingyong Hu, Yulan Guo

2026-06-23视觉感知

这篇论文针对ViT在边缘部署中PTQ静态量化忽略样本间激活差异、动态量化又需逐层运行时归约的问题,提出ScalePredictor。核心洞察是浅层patch embedding的稳健激活范围与深层最优量化scale存在相关性,因此用一次范围提取加Taylor启发的多项式投影预测全层实例级scale。ImageNet实验显示其在多种量化设置下优于既有PTQ,并以很小额外开销获得更好的精度—效率权衡。

Artic-O: End-to-End Articulated Object Reconstruction via Latent Geometry Learning Figure 1
2026-06-23cs.CV

Artic-O: End-to-End Articulated Object Reconstruction via Latent Geometry Learning

Xuyang Wang, Zhenyu Li, Jian Ding, Habib Slim, Peter Wonka, Hongdong Li, Mohamed Elhoseiny

XUYANG WANG∗, Australian National University and KAUST, HONGDONG LI, Australian National University, limit geometric fidelity, scalability, or adherence to the input im-, towards scalable image-based articulated object reconstruction by, cability when only sparse images are available. Image-conditioned

2026-06-23三维

针对稀疏多状态图像重建铰接物体时几何、部件与运动参数分阶段估计导致不一致且推理慢的问题,Artic-O 将观测映射到预训练冻结的几何潜空间,并结合图像特征做部件分割与关节预测,端到端生成可动画资产。在 PartNet-Mobility 上较 LARM 降低 CD、F-score 提至 95.4%,运动范围准确率升至 93.5%,推理从约 9 分钟降至 0.32 秒。

CoSA: Correlation-Guided Change Attention with Learnable Residual Gating for Remote Sensing Change Detection Figure 1
2026-06-23cs.CV

CoSA: Correlation-Guided Change Attention with Learnable Residual Gating for Remote Sensing Change Detection

Abdirashid Omar, Jonghyuk Park

Department of Data Science, Graduate School of Kookmin University, under sparse changes, noisy labels, and appearance variations. In this paper, we propose Context Sampling

2026-06-23视觉感知

针对遥感双时相变化检测中稀疏变化易被噪声、光照和配准误差干扰的问题,CoSA将同位置双时相特征相关性显式转为变化门控,在1/8与1/16解码尺度用可学习残差注入强化低相关区域,而不引入全局注意力开销。在LEVIR-CD、S2Looking、DSIFN和CLCD上,changed-class F1相对受控基线提升约1.5–2.6个百分点,消融显示多尺度放置和残差scaling是主要贡献。

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation Figure 1
2026-06-23cs.CV

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Muhammad Nabeel Asim

Department of Computer Science, Rhineland-Palatinate Technical University of, German Research Center for Artificial Intelligence (DFKI), Kaiserslautern 67663, Department of Core Informatics, Graduate School of Informatics ,Osaka, Metropolitan University, Saka, 599-8531, Japan

2026-06-23视觉语言视觉感知学习理论

本文针对胸片报告生成中视觉区域、文本词语与疾病语义常靠隐式注意力耦合、缺乏可解释对齐的问题,提出 GTA-Net,将跨模态对齐建模为合作博弈:用二元博弈刻画区域—词对齐,并用疾病感知三元对齐约束图像、报告和14类疾病概念的一致性,结合 Swin 与 LoRA 微调的 LLaMA 端到端训练。在 CheXpertPlus 和 IU-XRay 上,文中报告其在常规生成指标和临床一致性上达到或超过现有方法,但具体增益有多少来自博弈对齐而非骨干模型或数据规模仍需看消融细节。

Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation Figure 1
2026-06-23cs.CV

Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation

Qing Xu, Xiangjian He, Wenting Duan, Jiebo Luo, Zhen Chen

2026-06-23视觉感知

针对细胞分割中视觉基础模型适配依赖重训大编码器、标注和算力成本高的问题,论文提出 EffiCell-Seg:冻结 VFM,利用其 CLS 全局显著性与空间 token 局部形态先验,经 CSP-Encoder 生成结构提示,并由 SM-Decoder 联合预测距离场和语义图。实验称其在多种细胞成像模态上优于现有方法,仅约 5M 可训练参数,比全量微调少 130 倍以上。

Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution Figure 1
2026-06-23cs.CV

Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution

Yu-Syuan Xu, Hao-Lun Sun, Hao-Wei Chen, Hsien-Kai Kuo, Chun-Yi Lee

National Taiwan University, MediaTek Inc.

2026-06-23视觉感知

本文针对任意尺度超分中回归方法保真但平滑、扩散方法逼真却易幻觉的矛盾,提出 FPLIA:用 FPAM 在保真特征与感知特征间做自注意力和非对称交叉注意力,再由 FPSM结合内容与倍率逐像素选择候选表示。实验覆盖多数据集和整数/非整数倍率,显示其在保持重建精度的同时提升感知质量,并处于保真度-感知质量帕累托前沿。

Mesh2GS: White-Box 3DGS Construction via Plenoptic Sampling Figure 1
2026-06-23cs.GR

Mesh2GS: White-Box 3DGS Construction via Plenoptic Sampling

Haoran Zhu, Youcheng Cai, Huangsheng Du, Jingyang Meng, Ligang Liu

University of Science and Technology of China

2026-06-23三维

Mesh2GS关注从已有网格直接构建3D Gaussian以缓存全局光照,动机是替代依赖试错的网格绑定式3DGS方案并服务实时多用户渲染。其核心是用全光采样理论推导视角最低采样率和高斯分布,并结合反照率-阴影分解更新与NIE模块处理高光等非朗伯效应。实验称其在质量和实时共享渲染中优于启发式基线,但代码尚待发布,具体泛化边界仍需进一步验证。

AgroSense 2.0: Cross-Modal Transformer Fusion with Geospatial Raster Integration and Interpretable Multi-Task Learning for Precision Crop Recommendation Figure 1
2026-06-23cs.LG

AgroSense 2.0: Cross-Modal Transformer Fusion with Geospatial Raster Integration and Interpretable Multi-Task Learning for Precision Crop Recommendation

Vishal Pandey, Rishav Tewari, Ruzina Haque Laskar

Centre for Development of Telematics, trees [4, 5]. While effective on clean, laboratory-sourced data, these approaches are fundamentally limited by their

2026-06-23视觉感知

本文针对作物推荐中视觉土壤、养分表格与空间分布割裂的问题,提出 AgroSense 2.0:引入覆盖印度的七波段土壤栅格补充地理上下文,用跨模态 Transformer 让养分特征注意图像表示,并以多任务学习联合土壤分类和作物推荐。结果展示了 TreeSHAP 揭示的作物条件敏感性,如降雨和 pH 全局最重要、咖啡受钾和温度驱动;但相对基线的定量增益文中片段未充分说明。

Prompt-Calibrated SAM 3 for Open-Vocabulary Remote Sensing Semantic Segmentation Figure 1
2026-06-23cs.CV

Prompt-Calibrated SAM 3 for Open-Vocabulary Remote Sensing Semantic Segmentation

Yanghui Song, Nanqing Liu, Haonan Yin, Yingjie Gao, Chengfu Yang, Qi Ming

label space. Recent SAM 3-based methods provide a promising, available at https://github.com/YanghuiSong/ProC-SAM3., School, Information Science and Technology, Yunnan Normal University, Kunming, Science and Engineering, Beihang University, Beijing, China., Science, Beijing University of Technology, Beijing, China., wise semantic labels ˆY

2026-06-23视觉感知

本文针对遥感开放词汇语义分割中 SAM 3 依赖单一类名提示、扩展提示带来重复编码、以及多提示融合易引入噪声的问题,提出 ProC-SAM3:用多模态大模型离线生成并约束提示池,缓存文本嵌入,并以存在性与置信度门控残差融合保留小目标响应。在 8 个基准上平均 mIoU 达 56.1%,较此前最佳训练自由方法提升 3.9 个百分点。

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization Figure 1
2026-06-23cs.CV

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

Carnegie Mellon University, University of Michigan, Ann Arbor

2026-06-23视觉语言视觉感知学习理论数据集/基准

论文关注课堂参与度自动识别中,零样本视觉语言模型是否可直接替代人工观察这一问题。作者在 DAiSEE 个体视频帧与 SCB 场景图像上系统比较 CLIP、BLIP、GPT-4o、LLaVA、Qwen,并把提示词敏感性作为基准维度。结果显示个体级识别近随机、κ≤0.10且常发生类别坍缩;场景级更可行,CLIP/GPT-4o 在行为化 rubric 下 κ约0.60,但提示改写可导致最高32个百分点波动,部署可靠性仍不足。

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification Figure 1
2026-06-23cs.CV

Beyond Flat Labels: Level-Restricted Contrastive Learning for Hierarchical Fine-Grained Vision Classification

Zhiyuan Tao, Srikumar Sastry, Matthew J Thompson, Elizabeth G Campolongo, Net Zhang, Ziheng Zhang, Hilmar Lapp, Yu Su, Tanya Berger-Wolf, Nathan Jacobs, Wei-Lun Chao, Jianyang Gu

Beyond Flat Labels: Level-Restricted Contrastive Learning for, The Ohio State University, Washington University in St. Louis, Boston University, However, in hierarchically structured label spaces, exist-, its simultaneously predicted higher-level label. By analysis, the issue originates from false negative labels when con-, That is, the predicted fine-grained label does not belong to, CLIP-style contrastive learning adopts a flat-label assump-, tion and treats all non-matching text labels as equal nega-, tives [19]. When applied to label spaces with hierarchical, false negatives. While treating ancestor–descendant labels

2026-06-23视觉感知

这篇论文针对 CLIP 式对比学习在层级细粒度分类中把不同层级的相关标签误当负样本、导致上下位预测不一致的问题,提出只在同一分类层级内做对比,并用组均衡监督避免训练偏向粗层级。基于 BioCLIP 和 TreeOfLife-10M 微调后,在 iNat21 等生物分类基准上同时提升层级一致性与准确率,iNat21 跨层级平均准确率较基线提升约 30.47%。

RAPID: A Reproducible Multi-Agent Pipeline for Interpretable Disaster Damage Assessment from Satellite and Street-View Imagery Figure 1
2026-06-23cs.CV

RAPID: A Reproducible Multi-Agent Pipeline for Interpretable Disaster Damage Assessment from Satellite and Street-View Imagery

Yifan Yang, Wenjing Gong, Kaili Zhang, Lei Zou, Zhengzhong Tu, Hao Li, Zongrong Li, Xinyue Ye

Texas A&M University, National University of Singapore, The University of Alabama, Texas A&M University College Station Texas USA, National University of Singapore Singapore Singapore, The University of Alabama Tuscaloosa Alabama USA

2026-06-23视觉感知

面向灾后快速评估中标注昂贵、跨灾种泛化弱和单一视角信息不足的问题,RAPID将卫星与街景图像接入由灾害感知、图像恢复、损伤识别和地理推理组成的多智能体流程,在无需任务微调下输出可解释损伤等级与处置建议。实验覆盖飓风、洪水、山火和地震,多灾种分类准确率达0.92,跨视角损伤严重度预测最高为0.627,但相对传统监督模型的增益来源仍需进一步拆解。

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation Figure 1
2026-06-23cs.RO

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

Yashom Dighe, Karthik Dantu

University at Buffalo

2026-06-23视觉感知

论文针对手内重定向中点云目标难以直接用于控制的问题:原始点集受无序采样、遮挡和对应不稳定影响,使当前—目标差异不等同于旋转误差。核心做法是用度量学习训练旋转感知点云编码器,使潜空间欧氏距离对齐 SO(3) 测地误差,再供 PPO 策略比较当前与目标点云。实验显示其无需显式位姿、配准、稠密 flow 或教师动作监督,性能接近特权状态和蒸馏基线;但仍主要在仿真和单物体策略设定下验证。

Motion-Aware Reinforcement Learning For Object Localization Figure 1
2026-06-23cs.CV

Motion-Aware Reinforcement Learning For Object Localization

Prithvi Raj Singh, Satyendra Singh

McNeese State University, Louisiana Tech University

2026-06-23强化学习

本文针对检测器一次性框回归难以修正定位误差的问题,把目标框细化建模为PPO序列决策,并在状态中加入恒速运动先验、在奖励中加入动作平滑惩罚。关键洞察是运动惩罚与绝对IoU奖励会导致触发器坍塌,而平滑动作可稳定训练;同时共享骨干的crop特征细化存在表示上限。实验在VOC和VisDrone上主要提升SR@0.5,最高分别约+0.011和+0.007,但mAP未超过原检测器。

From Gradient Clipping to Structural Refinement: Improving DPSGD for Medical Image Segmentation Figure 1
2026-06-23cs.CV

From Gradient Clipping to Structural Refinement: Improving DPSGD for Medical Image Segmentation

Shiva Parsarad, Parth Shandilya, Isabel Wagner

University of Basel

2026-06-23视觉感知优化算法

这篇论文针对医学分割中DPSGD因梯度裁剪与加噪导致效用下降的问题,系统比较Auto-S、NSGD、PSAC在二分类与多分类分割中的表现,并分析梯度对齐,指出分类任务中的假设尤其是PSAC优势并不稳定迁移。作者进一步将裁剪策略与DP-Morph形态学细化结合,提出按类别自适应的结构修正,在OCT与CT数据上使隐私约束下分割质量提升,Dice约有1–2%增益。

Scaling up fine-grained intracranial vessel annotations in computed tomography angiography Figure 1
2026-06-23eess.IV

Scaling up fine-grained intracranial vessel annotations in computed tomography angiography

Chu-Hsuan Lin, Alberto Mario Ceballos-Arroyo, Jisoo Kim, Shrikanth M. Yadav, Huaizu Jiang, Lei Qin, Geoffrey S. Young

Harvard Medical School, \addr Khoury College of Computer Sciences, Northeastern University, \addr Washington University in St. Louis, \addr Dana-Farber Cancer Institute

2026-06-23视觉感知

针对CTA中颅内血管精细标注成本高、既有数据多忽略远端小血管且偏向MRA的问题,本文构建SemanticVessel,利用4D-CTA多期相对动静脉的天然区分,通过区域生长、专家细化和跨期复用扩大标注,并将未细分小动脉设为通用动脉类。实验显示,显式处理未标注血管和加入通用动脉监督可提升细粒度分割,左右坐标信息也带来明显增益。

Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats Figure 1
2026-06-23cs.GR

Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats

Xiaoyang Liu, Shangzhe Wu, Kai Han

The University of Hong Kong, University of Cambridge

2026-06-23三维

这篇论文针对 3D Gaussian Splatting 资产只能高保真渲染、难以进入真实物理引擎交互的问题,提出表示抽象框架:把 3DGS、网格、流体和静态场景边界统一转成物理粒子/碰撞表示,再将仿真结果映射回各自视觉表示。结果展示了软体 3DGS 与流体、网格及复杂捕获场景的双向耦合,并接入 UE5 渲染;但定量评测和鲁棒性细节文中未充分说明。

Configurable Algorithms for Histopathologic Cancer Detection on Quantum Hardware Figure 1
2026-06-23eess.IV

Configurable Algorithms for Histopathologic Cancer Detection on Quantum Hardware

Nandika Goyal, Glen Uehara, Andreas Spanias

SenSIP Center, School of ECEE, Arizona State University, is further complicated by limited labeled data and image, and statevector readout is not available on hardware. Hybrid

2026-06-23视觉感知

本文针对病理癌症图像中染色差异、组织形态细微且现有量子边缘检测难以落到真实 QPU 的问题,提出局部 Ry 编码的双梯度 SWAP/破坏式 SWAP 等价电路,用 shot 测量生成边缘图,并配合读出校正、偏置扣除和斜率回归降噪。方法在五个量子处理器上验证,跨平台相关约 0.93–0.94,单像素 MSE 降约 8 倍,PCam 单 ResNet-50 准确率 79.80%,Lite 版提速 17 倍但损失 2.59% 准确率。

Quantile Adaptive Temperature Scaling for Confidence Calibration Figure 1
2026-06-23cs.CV

Quantile Adaptive Temperature Scaling for Confidence Calibration

Omprakash Chakraborty, Leo Fillioux, Ismail Ben Ayed, Jose Dolz

2026-06-23视觉感知

这篇论文针对深度模型置信度校准中过度自信且误差在不同置信度区间分布不均的问题,指出全局温度缩放难以修正这种异质性。其核心是按经验置信度分位数学习单调的样本级温度函数,在分位空间重参数化 ECE,从而有针对性地软化或锐化预测且不改变类别结果。实验覆盖视觉、医学、文本、分割、长尾与分布偏移场景,显示 QaTS 相比多种后验校准方法更稳定地降低校准误差。

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization Figure 1
2026-06-23cs.CV

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

Xidian University, 2Microsoft Research Asia, 3Chongqing University of Posts and Telecommunications, mains while there is only one single domain available for, proaches. Code is available in the supplementary materials., SDG aims to train a model on a labeled source domain, are usually unseen/out-of-distribution and unavailable dur-

2026-06-23学习理论

针对单源域训练难以覆盖未知域、手写扩散模型提示又难以描述抽象风格的问题,论文提出 PAPT:为文本到图像扩散模型分别学习类别不变提示和域风格提示,并通过渐进对抗训练维护域提示池,在扩大生成域多样性的同时保留类别语义。实验称其在多个主流单域泛化数据集上优于现有方法,但具体增益可能部分来自预训练 T2I 模型带来的生成数据能力。

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning Figure 1
2026-06-23cs.CV

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

Queen’s University Belfast, Greg Slabaugh, Queen Mary University of London

2026-06-23视觉感知

这篇论文针对长视频中感知信息稀疏、时序推理跨度长,而单次前向的VLM容易把感知与规划混在潜空间中处理的问题,提出HPP:让具备编码能力的LLM在REPL中按层级视频结构编程式搜索、采样和调用小型VLM做局部感知。核心洞察是将语义感知与高阶推理解耦,并用信息密度分段、后期交互检索和结构化探针降低长视频探索成本。实验在LongVideoBench、EgoSchema、VideoMME和MLVU上显示明显提升,且更强感知模型和更强编码LLM都能带来收益。

Adaptive Beam Selection for Efficient Scanning Probe Tomography Figure 1
2026-06-23cs.CV

Adaptive Beam Selection for Efficient Scanning Probe Tomography

San Dinh, Zichao Wendy Di, Matt Menickelly

Mathematics and Computer Science Division, Argonne National Laboratory, Lemont, IL, 60439, USA, reconstructing the sample based on available measurements., conventional laboratory Computed Tomography systems., This work was supported in part by the U.S. Department of Energy, Of-, distances from the center outside this interval do not intersect

2026-06-23视觉感知

针对同步辐射扫描探针断层成像中全角度采集耗时、剂量高且易损伤样品的问题,本文把自适应设计从“选角度后整行扫描”推进到同时选择角度与束位置。核心做法是在 sinogram 上用高斯过程估计未测束值和不确定性,并结合边缘对齐启发式构造采集函数,绕过中间重建以降低计算和重建误差影响。数值实验显示,在相同测量数下相比均匀采样可获得更好重建质量,但独立束定位的硬件开销仍待解决。

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space Figure 1
2026-06-23cs.CV

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

Yue Cao, Jianyang Gu, Vyacheslav Kungurtsev, Yu Hu, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

The University of British Columbia, The Ohio State University, Czech Technical University in Prague

2026-06-23数据集/基准

本文针对数据集蒸馏中“相似原数据却不一定好用”的问题,提出用离散视觉 tokenizer 分析语义 token 组合,而非只看连续分布匹配。核心是由 JSD、HHI、覆盖率构成免训练 structural score,发现 token 使用更均衡与验证精度更相关,并据此选择锚点指导扩散式蒸馏。实验显示该分数能预测 ImageWoof/ImageNette 等替代集质量,在 EuroSAT 上保持相对排序,TGDD 在 ImageWoof 上较强基线提升 5.4%。

VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation Figure 1
2026-06-23cs.CV

VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation

Xuan Qi, Daniele Berardini, Dario Serez, Vito Paolo Pastore, Vittorio Murino

DITEN, University of Genoa, MaLGa, DIBRIS, University of Genoa, Department of Computer Science, University of Verona, beled source data and unlabeled target data under distribution shift. Recent diffusion-based, UDA methods approach this problem by synthesizing labeled target-style images and train-, style data. The project page is available at https://xuanqi99.github.io/VT-DUDA/., Unsupervised domain adaptation (UDA) aims to learn a target-domain classifier from labeled source data, and unlabeled target data under distribution shift. Classical UDA methods address this problem primarily, directly, they adapt a generative model to synthesize labeled target-style images and then train a classifier, text signal. That is, on the source side, multiple labeled source images from the same class are typically, target labels are unavailable, the text condition may be reduced to a generic prompt such as “an image.”, On the source side, the visual tokens are paired with class prompts, so that different labeled source instances

2026-06-23生成模型

这篇论文针对扩散式无监督域适应中过度依赖类别文本提示、缺少实例级约束的问题,提出将源/目标图像编码为视觉 token,并与文本嵌入拼接进潜在扩散模型的 cross-attention,在不改动骨干和扩散目标的前提下生成更有用的目标风格训练样本。实验在 Office-31、Office-Home 和 VisDA-2017 上相较判别式与扩散式基线提升平均目标域分类准确率,并显示 token 选择、强度调节及 DDIM 翻译组合可带来额外收益。

No Figure
2026-06-23cs.CV

Enlight: Fast Low-Light Image Enhancement via Multi-Objective Optimization and Shadow-Aware Refinement

Nirjhor Datta, M. Sohel Rahman

2026-06-23视觉感知优化算法

低照度图像增强常在亮度提升、结构保真与噪声放大之间失衡,且深度方法依赖训练数据、可解释性较弱。ENLIGHT将增强转为少量亮度、对比度、伽马参数的多目标推理时优化,并加入由全局到局部的阴影感知细化,兼顾暗区提亮与过曝抑制。在BAID、Backlit300、LIME等数据集上,其MUSIQ、NIQE、BRISQUE感知质量具竞争力,推理显著更快,Ultrafast约0.10–0.23秒/图,但目标函数和阈值选择仍偏经验。

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating Figure 1
2026-06-23cs.CV

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

Jiehui Huang, Yuechen Zhang, Bin Xia, Jiahao Wang, Xu He, Zhenchao Tang, Meng Chu, Xin Tao, Pengfei Wan, Jiaya Jia

The Hong Kong University of Science and Technology, The Chinese University of Hong Kong, Tsinghua University, Sun Yat-sen University

2026-06-23视觉感知学习理论

该文针对多镜头音视频生成中人物外观、场景与说话人音色跨剪辑易漂移、长序列上下文成本高的问题,提出 UnityShots:用固定大小的长短期视频记忆槽分别锚定首镜头与前一镜头尾部,并以视觉切换概率和音乐节拍共同驱动边界门控,同时用说话人参考 token 保持音色。实验在 I2V/T2V/R2V 与多文化 200 序列基准上显示,其跨镜头一致性整体优于开源基线,并在多镜头指标上接近最强闭源系统。

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition Figure 1
2026-06-23cs.CV

Chehre: An Emoji-Prompted Video Dataset for Perceptually Diverse Facial Expression Recognition

Bita Azari, Zoe Stanley, Avneet Batra, Poorvi Bhatia, Hali Kil, Manolis Savva, Angelica Lim

Simon Fraser University, Canada, and label annotations, resulting in 2,111 high, cover the top human-rated labels, and distri-, percentage of annotators who selected each label as top-, from the candidate set of labels for each video., many benchmarks assume a single definitive label, human perception, both in selecting the top labels, cannot accurately predict the top two labels

2026-06-23视觉感知数据集/基准

现有表情识别基准多依赖静态图像、基础情绪和单一标签,难以评估具身智能对动态非语言信号及人类感知分歧的理解。Chehre 用 40 个 emoji 诱发表情视频,并通过人脸重演匿名化,构建含 203 名表演者、902 名标注者的分布式标注数据集,提出主导表情与分布式表情识别两项任务。实验显示当前 VLM 表现有限,最佳 Top-1 仅 32.5%,且远未复现人类响应分布。

PaaF: Raising the perceived quality of INR-Based Image Compression Figure 1
2026-06-23eess.IV

PaaF: Raising the perceived quality of INR-Based Image Compression

Lorenzo Catania, Dario Allegra

• Availability of the codec as open-source. The full, ciency and computational scalability.

2026-06-23视觉感知

这篇论文针对纯 INR 图像压缩编码慢、PSNR 与感知质量落后于成熟 codec 的问题,提出 PaaF:将图像表示为坐标到颜色的函数,并结合 YCbCr/均值位移、指数式网络配置、细粒度自适应量化搜索和熵编码打包来改善率失真。实验称其相对既有 INR 压缩方法在定量指标与视觉伪影上都有稳定提升,但主要比较限定在 INR 系列内,与传统/学习式 codec 的整体差距仍文中未充分说明。

A DVDrive Approach for doScenes Instructed Driving Challenge Figure 1
2026-06-23cs.CV

A DVDrive Approach for doScenes Instructed Driving Challenge

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

Team MIC Lab, Beijing University of Posts and Telecommunications, 2 Xiaomi EV, code is publicly available at: https://github.com/, ego-vehicle planning, the future intention is often available

2026-06-23视觉感知

本文面向 doScenes 中“按自然语言指令预测自车未来轨迹”的需求,动机是减少仅依赖视觉和历史运动时的意图歧义。方法在 OmniDrive 上加入指令条件训练,将监督扩展到 6 秒 12 个路点,并引入 DVDrive 分视角感知,用局部可见性注意力降低跨视角干扰。论文称该设计有助于语言与局部驾驶证据对齐,但未给出充分可核验的量化结果,实际增益来源仍不清。

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring Figure 1
2026-06-23cs.CV

Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring

Bharath Pillai, Varun Viswapriyan, Christopher Stewart, Tanya Berger-Wolf, Jenna Kline

The Ohio State University

2026-06-23视觉感知

这篇论文针对濒危野生动物监测中标注稀缺、人工评估昂贵的问题,提出用视觉与声学两条独立管线得到的小时活动曲线,并与既有动物行为学先验相互印证,作为免标注可靠性信号。方法结合 BioCLIP 2 零样本相机陷阱识别、SAHI 小目标检测、几何定位和微调声学分类器;在麋鹿数据上,两种模态均恢复出与已知昼夜活动规律一致的模式,但绝对定位精度和更广泛物种泛化仍文中未充分说明。

CurvSegFlow: Time-Conditioned Flow Matching for Robust Segmentation of Curvilinear Structures in Noisy Biomedical Images Figure 1
2026-06-23cs.CV

CurvSegFlow: Time-Conditioned Flow Matching for Robust Segmentation of Curvilinear Structures in Noisy Biomedical Images

Sidi Mohamed Sid'El Moctar, Achraf Ait Laydi, Alexandre Beber, Marcus Braun, Zdenek Lansky, Yousef El Mourabit, Helene Bouvrais

aCNRS, Univ. Rennes, Institute of Genetics and Development of Rennes (IGDR), Rennes, France, bTIAD Laboratory, Sciences and Technology Faculty, Sultan Moulay Slimane Univ, Beni Mellal, Morocco, cInstitute of Biotechnology, Czech Academy of Sciences, Vestec, Czech Republic

2026-06-23视觉感知生成模型安全鲁棒

针对显微、眼底等生物医学图像中细长曲线结构易受噪声、低对比度和断裂影响的问题,CurvSegFlow将分割从一次性掩码预测改为时间条件的流匹配迭代细化,用U-Net、时间嵌入和三项损失学习从噪声初始化到目标掩码的速度场。实验覆盖微管、视网膜血管、角膜神经和冠脉数据,结果显示在低信噪比下精度与结构连续性更稳,且无需改架构即可跨模态泛化。

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition Figure 1
2026-06-23cs.CV

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

Suzhou Institute for Advanced Research, University of Science and Technology of China, Suzhou, China, Inria Center at Universit´e Cˆote d’Azur, Valbonne, France, tions are fine-grained, temporally dense, and multi-label, their, Action Labels, ing action label. ViCLIP [11] is a general video foundation

2026-06-23视觉感知

这篇论文针对视觉语言模型偏重外观语义、缺少显式人体运动建模的问题,提出 T-MOR:以骨架序列为推理输入,在预训练中用视频和文本嵌入作语义锚点,并加入聚类引导的多模态对比学习来提升可迁移的运动表征。作者还构建 PoseCap-1M 三元组数据集;在 Toyota Smarthome、UAV-Human、Penn Action、TSU、Charades 等分类和帧级检测任务上均有提升,并展示少样本、零样本泛化能力。

$μ$Match: Foundation Models for Semi-supervised Learning and Domain Adaptation in EM Figure 1
2026-06-23cs.CV

$μ$Match: Foundation Models for Semi-supervised Learning and Domain Adaptation in EM

Marei Freitag, Olesia Korchevaia, Luca Freckmann, Anwai Archit, Constantin Pape

Life and Medical Sciences Institute (LIMES), University of Bonn, Germany, Institute of Computer Science, Georg-August-University Göttingen, Germany, tation tasks, particularly across different organelles, and the limited availability, Fig. 1: µMatch overview: a) we study SSL, training on data with a small labeled, part (green box), and DA, pre-training on a labeled source followed by training on, the unlabeled (UDA) or partially labeled (SSDA) target. The student teacher uses, loss Lsup on labeled samples. We implement three different methods: Mean Teacher, comprehensive foundation model for organelles remains unavailable and would

2026-06-23视觉感知

这篇论文针对电镜分割高度依赖像素级标注、基础模型在 EM 中尚未系统落地的问题,提出 µMatch,将 SAM/µSAM/DINO 等初始化与 Mean Teacher、FixMatch、UniMatch v2 等学生—教师式半监督和域适应方法统一评测于细胞核、线粒体、神经突分割。结果显示 SAM 系初始化显著提升监督训练,半监督学习在多数任务稳定优于强基线;Mean Teacher 更稳健,UniMatch v2 在资源充足时常更优,而 DINO 与大域迁移下的 UDA/SSDA收益有限。

Deep Unrolled Networks in Representation Space Applied to MRI Reconstruction Figure 1
2026-06-23eess.IV

Deep Unrolled Networks in Representation Space Applied to MRI Reconstruction

Efe Ilıcak, Baris Imre, Chloé Najac, Ruben van den Broek, Beatrice Lena, Andrew Webb, Marius Staring

Department of Radiology, Leiden University Medical Center, Leiden, Netherlands, quisitions. The code will be available upon publication at https://

2026-06-23三维

这篇论文针对传统深度展开网络在图像域反复压缩特征、而已有表示空间方法又用启发式数据一致性导致物理测量约束变弱的问题,提出 DUNE:用链式法则和 VJP 将测量残差精确反传到特征/潜空间,并使编码器仅用于初始化,从而可接入预训练模型。在低场单通道和临床多通道 MRI 重建中,DUNE 相比图像域、启发式表示空间及若干基线获得更高 PSNR、SSIM 和 HaarPSI,说明主要收益来自更精确的数据一致性梯度与表示空间优化。

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction Figure 1
2026-06-23cs.CV

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

HAODONG LI, University of California San Diego, USA, LULU SHAO, University of California San Diego, USA, HAOLIN LU, University of California San Diego, USA, YU FU, University of California San Diego, USA, YEN-RU CHEN, University of California San Diego, USA, SEEMANDHAR JAIN, University of California San Diego, USA, MANMOHAN CHANDRAKER, University of California San Diego, USA, explicitly optimized. 𝜙-Scene instead places physical grounding at the center of 3D scene reconstruction by formulating it as a physics-aware assembly process:, ucsd.edu, University of California San Diego, USA, University of California San Diego, USA, ucsd.edu, University of California San Diego, USA., grounding at the center of image-to-3D scene reconstruction: it

2026-06-23视觉感知三维

本文针对单图到组合三维场景重建中常见的物体悬空、穿透和接触不稳定问题,提出将场景视为受支撑关系约束的物理系统。ϕ-Scene 先用三维基础模型恢复物体与初始姿态,再按推断的支撑拓扑逐个通过 SDF 去穿透和刚体仿真沉降。实验显示其在 3D-Front 上优于其他域外方法,并在人工/VLM评价及静态接触、动态漂移指标上显著提升物理合理性。

Boundary-by-Mask: Few-Shot Instance Segmentation with Mask-Conditioned Boundary Learning for Texture-Poor Industrial Parts Figure 1
2026-06-23cs.CV

Boundary-by-Mask: Few-Shot Instance Segmentation with Mask-Conditioned Boundary Learning for Texture-Poor Industrial Parts

Yutaka Yoshinaga, Naoya Chiba, Koichi Hashimoto

Yutaka Yoshinaga is with the Graduate School of Information Sciences, Tohoku University, Sendai, Japan.

2026-06-23视觉感知学习理论

这篇论文面向工业零件少样本实例分割:纹理弱、上下文少且“实例”定义随装配或检测任务变化,使通用分割模型和外观匹配式 FSIS 不可靠。核心做法是用参考 RGB-mask 条件化目标定义,在冻结基础编码器特征上训练轻量像素 MLP 预测 SDF 边界,再由 SDF 重建掩码,从内部外观转向轮廓监督。实验显示在工业件和边界模糊食品上具备较稳的低样本泛化、边界分离和粒度切换能力,但真实产线杂乱、遮挡和光照下的有效性文中仍未充分说明。

Radial Basis Function Networks as Projection Heads in Self-Supervised Learning Figure 1
2026-06-23cs.CV

Radial Basis Function Networks as Projection Heads in Self-Supervised Learning

Andreas Schliebitz, Heiko Tapken, Martin Atzmueller

Osnabrück University of Applied Sciences, Osnabrück University, Semantic Information Systems Group, German Research Center for Artificial Intelligence (DFKI), bone quality is assessed via costly linear probing on labeled data. We, with a radial basis function network (RBFN), whose interpretable center, without labels or a separate classifier. To this end, we introduce Scale-, Normalized Separation (SNS), a novel label-free quality metric derived, solely from the kernel centers and shapes learned during training. Across, The results of this paper can be reproduced using the code available in the following, sparsely labeled data. Common SSL architectures [8,10,12,13,21] consist of two, model is evaluated by training a linear classifier [10, 21, 34] on the labeled test, without the need for a labeled test split and by extension a linear classifier. The

2026-06-23视觉感知

论文针对自监督视觉学习中投影头训练后被丢弃、骨干质量仍需有标签线性探测评估的浪费问题,提出用可解释的径向基函数网络替代常规 MLP 投影头,并从其学习到的中心与尺度参数构造无标签 SNS 指标。实验覆盖 MoCo、SimCLR、BYOL、SwAV、SimSiam 和四个图像数据集,显示三层 Gaussian RBFN 基本可作为即插即用替代,SNS 与逻辑回归评估强相关,但实际性能增益并非主要结论。

Unsupervised Susceptibility Distortion Correction of EPI without Calibration Scans via Image Translation-Based Registration Figure 1
2026-06-23eess.IV

Unsupervised Susceptibility Distortion Correction of EPI without Calibration Scans via Image Translation-Based Registration

Wooseung Kim, Sung-Hong Park

2026-06-23视觉感知

针对fMRI中EPI易受磁场不均匀影响而产生相位编码方向几何畸变、且许多数据缺少场图或反向PE校准扫描的问题,论文提出SACRED:用T1w与单向PE BOLD,通过可逆网络做解剖到伪BOLD的图像翻译,并以MIND-SSC约束结构一致性,再进行无监督配准和测试时自适应。实验在一个ID和两个OOD数据集上优于多种免校准校正方法,显示对扫描仪和人群分布变化更稳健。

No Figure
2026-06-23cs.CV

The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection

Serdar Ozsoy, Lars Doorenbos, Federico Spurio, Gianpiero Francesca, Juergen Gall

University of Bonn, Lamarr Institute for Machine Learning and Artificial Intelligence

2026-06-23视觉语言视觉感知

这篇论文针对现有流程错误检测依赖监督时序分割、错误判别等多模块训练、难以迁移的问题,提出零样本设定下的 ZeProM:仅用任务说明驱动单个预训练 VLM 同时完成动作分割、错误检测和解释。实验在 EgoPER 与 CaptainCook4D 上显示,其无需训练即可接近甚至超过强监督方法,在 EgoPER 段级错误上平均 EDA 提升 4.4、F1@.5 提升 2.0,说明 VLM 的通用视频推理能力足以替代部分专用管线。

A Smart Classroom Behavior Analysis Framework with a New Highly Congested Classroom Dataset Figure 1
2026-06-23cs.CV

A Smart Classroom Behavior Analysis Framework with a New Highly Congested Classroom Dataset

Wei Xu, Maoxiang Chu, Yuelong Fan, Guanghao Liao, Yinxiang Yu, Zhi Chen, Haotian Wang, Yutian Zhu

2026-06-23数据集/基准

本文针对真实大班课堂中学生目标密集、前后排遮挡、尺度断裂和远距离细粒度行为线索退化的问题,构建HCCB数据集,含796张高分辨率图像与50,229个七类行为实例;同时提出YOLO系ODER-HSFNet,通过遮挡边界校正、高阶跨尺度关系融合和候选框置信度校准提升检测。在HCCB与SCB-D3-S上分别达到60.60/80.12和57.36/74.65的mAP50:95/mAP50,优于主流YOLO基线。

Compressing Observation History into Agent Memory: Distilling Transformers into Recurrent Transformers Figure 1
2026-06-23cs.CV

Compressing Observation History into Agent Memory: Distilling Transformers into Recurrent Transformers

Philippe Weinzaepfel, Christian Wolf, Bülent Mert Sariyildiz, Guillaume Bono, Gianluca Monaci

Naver Labs Europe, Meylan, France

2026-06-23视觉感知

面向长时序流式视觉与机器人任务,论文指出循环 Transformer 落后于全历史 Transformer 的关键不在架构容量,而在其必须在线决定记忆保留内容、压缩学习更难。作者提出 Chimera:先训练带固定瓶颈的历史 Transformer 教师,再将其瓶颈表示蒸馏到循环模型记忆中。实验在无地图姿态估计上显示,该方法保持随时间线性/常数级推理开销,并显著缩小与全历史模型的性能差距。

LOGOS: LiDAR-Only Gaussian Elevation Splatting for Unified Tiny Obstacle Segmentation Figure 1
2026-06-23cs.RO

LOGOS: LiDAR-Only Gaussian Elevation Splatting for Unified Tiny Obstacle Segmentation

Nan Ming, Yeqiang Qian, Chunxiang Wang, Ming Yang

School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Key Laboratory of System Control and Information

2026-06-23视觉感知三维

LOGOS针对路沿、碎石、坑洼等微小正负障碍在地形起伏、遮挡和稀疏激光点云中易被误判的问题,将路面表示为连续的二维高斯基元混合,并用无反传的自由空间初始化与法向感知高程 splatting 估计逐点有符号距离。实验覆盖城市与矿区越野、多种雷达和密度变化,显示其在退化区域和复杂越野场景中优于现有分类或网格/参数化路面建模方法,同时保持实时性。

A Skin-Tone-Aware Dual-Representation Remote Photoplethysmography Framework for Contactless Respiratory Rate Estimation Figure 1
2026-06-23eess.IV

A Skin-Tone-Aware Dual-Representation Remote Photoplethysmography Framework for Contactless Respiratory Rate Estimation

Trishna Saikia, Anup Kumar Gupta, Puneet Gupta, Pasi Liljeberg

2026-06-23视觉感知

本文针对接触式呼吸率测量不便、现有 rPPG 方法多沿用心率估计中的固定 RGB 投影且难适应肤色差异的问题,提出 ELITE-RR:用肤色感知的动态投影提取 Eulerian 颜色信号,并为 Lagrangian 运动信号加入去噪网络,再通过相位无关对比学习融合两类表征。作者还构建印度人群 RR-rPPG 数据集;在 RR-rPPG 与 COHFACE 上,相比基线最高降低 42.1% MAE。

Decoupling the Declarative from the Procedural in Vision-Language-Action Models Figure 1
2026-06-23cs.RO

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

University of Edinburgh, Samsung AI Center - Cambridge, UK

2026-06-23视觉语言视觉感知

本文针对现有 VLA 在少量示教后易把“技能”和“对象”绑定、难以零样本迁移的问题,提出 w2VLA:冻结 VLM 表征,并将目标位置的 declarative “where” 与动作技能的 procedural “what” 分离,按模块调制机器人状态而非混合所有 token。实验显示其在已见任务上保持与 π0.5、OTTER 相近表现,同时能将已学技能迁移到不同乃至未见物体,而基线在该设置下明显失效。

Semi-Supervised Vision-Language-Action Model Figure 1
2026-06-23cs.CV

Semi-Supervised Vision-Language-Action Model

Hongyang He, Jiuming Liu, Victor Sanchez

University of Warwick, 2University of Cambridge, 3Manifolda.Ai, costly action-labeled demonstrations. To reduce this dependence, we study semi-supervised VLA, actions and the remaining trajectories provide action-unlabeled vision-language observations. Unlike, pseudo-actions on unlabeled trajectories. SemiVLA introduces a VLA-specific reliability controller to, strategies across LIBERO and CALVIN. Under 10% labeled trajectories, SemiVLA with Selective, to new robots, new environments, and new task distributions still heavily depends on action-labeled robot, A natural way to reduce this cost is to exploit unlabeled or weakly labeled robot data. In many robotic, scenarios, visual observations and language instructions are easier to obtain than dense action labels. For, semi-supervised learning (SSL), where a model learns from a small labeled set and a large unlabeled set. SSL, of average performance on LIBERO and SIMPLER-ENV under 10% labeled trajectories. SemiVLA consistently, has been widely studied in visual recognition, where pseudo-labeling, teacher-student learning, and consistency, regularization are commonly used to improve learning under limited labels [16, 17, 21, 23]. However, directly

2026-06-23视觉语言视觉感知

这篇论文针对VLA模型迁移到新环境时仍依赖昂贵动作标注的问题,提出半监督适配框架SemiVLA:用教师-学生自蒸馏从无动作标注的视觉语言轨迹中筛选可靠伪动作,并以视觉语言对齐、动作可行性和时序一致性控制噪声反馈。以OpenVLA为骨干,在LIBERO和CALVIN上提升多种PEFT策略;10%标注下Selective LoRA在LIBERO达89.0%成功率,比监督LoRA高8.0点且无额外推理成本。

ASCII Art Turns LLMs into VLA Controllers Figure 1
2026-06-23cs.RO

ASCII Art Turns LLMs into VLA Controllers

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

2026-06-23规划控制

论文针对传统 VLA 依赖多模态骨干、大规模示教和较高算力的问题,提出将视觉观测渲染为 ASCII 文本,让纯文本 LLM 直接条件化状态、指令并输出受约束动作。方法用程序生成 2D 操作场景、规划器教师与 DAgger 训练,并在仿真和 7 自由度真实机械臂上验证;结果显示模型可识别关键实体、判断不可达并规划可执行序列,部分 2D 任务中文本模型优于对应视觉模型。

Native space based pipelines outperform template space based pipeline in subcortical segmentation Figure 1
2026-06-23cs.CV

Native space based pipelines outperform template space based pipeline in subcortical segmentation

Tomás Lima, Daniel Novák, Eduard Bakštein

Department of Cybernetics, Czech Technical University in Prague, Prague, Czech Republic, National Institute of Mental Health, Klecany, Czech Republic, against manual labels. We further investigated the effect of the template resolution., Neurological Institute Space (MNI) [13]. This step allows for consistent anatomical refer-, available 7T data., available, these were also collected. 7T images were collected from the Open Science CBS

2026-06-23视觉感知

针对丘脑底核等小型皮层下结构在手术规划中需保持患者原生解剖精度的问题,本文比较了基于 nnUNet 的原生空间与 MNI 模板空间分割流程。核心洞察是,往返配准到模板空间会损害细粒度边界,且提高模板分辨率并不能弥补。7T 留出集上原生流程在 STN、RN、SN 均更优,STN Dice 为 0.775 对 0.713、HD95 为 0.79mm 对 1.17mm;迁移到 3T 时性能明显下降,合成 3T 数据仅带来有限增益。

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding Figure 1
2026-06-23cs.CV

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding

David Pascual-Hernández, Roberto Calvo-Palomino, Inmaculada Mora-Jiménez, Jose María Cañas-Plaza

2026-06-23视觉感知

面向野外机器人导航中细粒度地形与障碍物难区分、类别长尾和跨平台泛化的问题,本文在 GOOSE/GOOSE-Ex 挑战中比较 SegFormer 与基于查询的 Mask2Former,并重点验证更大训练裁剪带来的空间上下文作用。结果显示 Mask2Former 在粗细粒度指标上均优于基线,扩大 crop 与 TTA 进一步提升表现,最终测试集 mIoU_comp 达 69.6%、排名第 5;但部分增益可能主要来自模型规模、预训练与测试时增强的组合。

Precision Recall Controllable Radiology Report Generation via Hybrid Natural Language and Clinical Reward Learning Figure 1
2026-06-23cs.CL

Precision Recall Controllable Radiology Report Generation via Hybrid Natural Language and Clinical Reward Learning

Ling Chen, Ruinan Jin, Jun Luo, Hanliang Chen, Quirin Strotzer, Rongkai Yan, Yuan Xue, Luciano Prevedello, Dufan Wu

Precision Recall Controllable Radiology Report, The Ohio State University, Columbus, OH 43221, USA, University Medical Center Regensburg, Regensburg, Germany, recall controllable RRG, where a control parameter explicitly adjusts the, recall controllable RRG for chest X-rays, in which a continuous control pa-, Precision Recall Controllable Reinforcement Learning

2026-06-23强化学习规划控制

本文针对放射报告生成中“语言流畅但临床发现不准或漏报、且无法按场景调节精确率/召回率”的问题,提出在强化学习框架中引入连续控制参数λ,并同时作用于解码表示的自适应层归一化和临床奖励,以生成偏高精确率或高召回率的报告;再结合NLG奖励、临床效能奖励和组内相对归一化降低训练方差。MIMIC-CXR实验显示其在语言指标和临床效能指标上优于既有方法,并能形成可解释的精确率-召回率控制。

Synergistic Dual-Branch Adaptation for Multi-modal Generalized Category Discovery Figure 1
2026-06-23cs.CV

Synergistic Dual-Branch Adaptation for Multi-modal Generalized Category Discovery

Yuxun Qu, Minyu Zhou, Yongqiang Tang, Chenyang Zhang, Wensheng Zhang

classify old categories and discover new ones from unlabeled, different baselines validate the broad scalability of the proposed, exploiting unlabeled images. However, SSL assumes a closed-, world setting where the unlabeled data shares the same label, space as the labeled set [3], limiting its applicability when, unlabeled dataset contains new categories absent from the, labeled set. The goal of GCD is not only to classify old, Yuxun Qu and Minyu Zhou are with the College of Computer Science, Yongqiang Tang and Chenyang Zhang are with the State Key Lab-, oratory of Multimodal Artificial Intelligence Systems, Institute of Au-, tomation, Chinese Academy of Sciences, Beijing 101408, China. (e-mail:, Wensheng Zhang is with the College of Computer Science, Nankai Uni-

2026-06-23视觉感知

这篇论文针对多模态广义类别发现中双分支方法协同不足的问题:检索或生成文本含噪,却与视觉分支独立编码,且互学习只对齐全局类锚。作者提出 SDBA,在冻结骨干上加入轻量适配器,并逐层把视觉类表示注入文本分支,同时用局部邻域分布的双向 KL 约束替代粗粒度锚对齐。六个基准上达到或提升 SOTA,并在 GET、TextGCD 等基线上的一致增益表明其更像可插拔增强模块。

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning Figure 1
2026-06-23cs.CV

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

Changwon National University

2026-06-23视觉语言视觉感知数据集/基准

针对通用与 CCTV 场景中细粒度图文数据不足的问题,MIRCaps 汇集 14.1 万图像、近百万图像级描述、174 万区域级描述和 139 万框标注,用多视角场景描述与对象中心属性描述强化类别、颜色、动作、状态和环境对齐。实验显示 SmolVLM、BLIP/BLIP2、Qwen2.5-VL 等轻量 VLM 可通过该数据提升图像描述质量,并辅助检测评估;但区域级微调不足,检测增益受原始框覆盖不完整限制。

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models Figure 1
2026-06-23eess.IV

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models

Sampath Rapuri, Jeremy Ko, Benjamin D. Killeen, Russell H. Taylor, Mathias Unberath

2026-06-23生成模型三维

针对介入式 X 光 AI 缺少带标注真实数据、传统 DRR 又依赖高质量真实 CT 的瓶颈,论文比较了两条纯合成训练路线:3D 扩散生成 CT 再投影 DRR,以及按视角和分割条件直接生成 2D X 光。受控骨盆 landmark 检测实验显示,2D DiffXray 迁移到真实 X 光的误差为 4.84 mm,接近 RealCT-DRR 的 4.37 mm;3D DiffCT-DRR 在高置信预测下也可比,但低置信时下降较快。

Robot Self-Improvement via Human-Video Dynamics Models Figure 1
2026-06-23cs.RO

Robot Self-Improvement via Human-Video Dynamics Models

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger

Technical University of Munich

2026-06-23机器人视觉感知

这篇论文针对机器人部署后仍会遇到具身差异和失败、但人工纠错难以扩展的问题,提出从人类视频中学习与具体机器人无关的动作、动力学和值表示,并用 DGAC 将失败状态转化为可排序的纠正动作监督。真实操作实验覆盖两类机器人和七个任务,平均成功率由 40% 提升到 81%,在 π0.5 上也从 62.7% 提升到 88.0%。

VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models Figure 1
2026-06-23cs.LG

VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models

Florian Seligmann, Emiliyan Gospodinov, Enes Ulas Dincer, Gerhard Neumann

Autonomous Learning Robots Lab, Karlsruhe Institute of Technology

2026-06-23视觉语言视觉感知

这篇论文针对微调后视觉语言动作模型在真实部署中仍会因分布外状态或动作生成不一致而失败、且现有检测器依赖失败数据或多次采样开销过高的问题,提出 VLA-FAIL:用最后层特征的逐 token 马氏距离捕捉内部表征偏移,并用重叠动作块的一致性捕捉执行计划抖动,同时以 AUCPDT 衡量准确性与提前量。实机和 LIBERO-Plus 实验显示,两类信号互补,组合方法常优于更昂贵基线且仅带来很小延迟。

No Figure
2026-06-23cs.CV

EnTrust: Modeling Inter-Modal Conflict for Trustworthy Multimodal Medical Image Analysis

Dwarikanath Mahapatra, Abhijit Das, Behzad Bozorgtabar, Zongyuan Ge, Sudipta Roy, Deepak Nayak, Mauricio Reyes, Imran Razzak

2026-06-23视觉语言视觉感知

该文针对多模态医学分割中不同成像模态在病灶边界常相互矛盾、传统融合会抹平冲突且事后不确定性难解释的问题,提出 EnTrust,将模态一致信息、单模态特有线索和空间冲突显式解耦,并用冲突条件化扩散分割与 TrustMap 生成可校准像素级不确定性。四个脑、心脏、病灶和肿瘤基准上报告分割精度最优,校准误差较最强基线降低约 40%,且单模型超过 5 模型集成并减少内存。

OSOG: A Differentiable, Physics-Informed Synthetic Data Engine for Micro-Optical Environments Figure 1
2026-06-23cs.CV

OSOG: A Differentiable, Physics-Informed Synthetic Data Engine for Micro-Optical Environments

Caio Silva

Department of Physics, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, USA∗, particles in under 50 milliseconds ( 20 FPS). By providing a fast, scalable, and physically grounded, dense, overlapping suspensions is not only labor-intensive, architecture and scope, introducing a highly scalable SoA

2026-06-23视觉感知

论文针对显微成像中密集标注稀缺、传统几何渲染难以刻画衍射与相位效应的问题,提出 PyTorch 原生、可微且物理约束的 OSOG 合成数据引擎,用 SoA 张量化管线生成波光学显微图像并支持 DiffOSOG 反向校准。实验显示,仅用合成数据训练的 YOLOv11-OBB 可零样本检测真实重叠溶菌酶晶体,且可在 50ms 内合成 4 万粒子;但检测结果以定性展示为主,真实标注指标文中未充分说明。

No Figure
2026-06-23cs.CV

FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction

Guangcheng Chen, Lihuang Fang, Huaqi Tao, Yicheng He, Li He, Hong Zhang

2026-06-23视觉感知

该文针对室内单目占据预测中高斯/超二次曲面原语常滞留在空区域、造成表示和计算浪费的问题,指出根因是体素分类损失只提供局部监督、难以驱动远距离重定位。FLM 将任务改写为占据体素分布估计,用前馈最大似然训练混合模型,并以归一化原语体积作为权重实现端到端体素化。FLM-Occ 在 Occ-ScanNet 上仅用 32 个超二次曲面、约为前 SOTA 原语数的 2.7%,取得更高精度且推理快 3.7 倍。

No Figure
2026-06-23cs.CV

Graph-of-Differences: Anatomy-Structured Difference Alignment for Medical Image Re-Identification

Nichula Wasalathilaka, Abhijit Das, Imran Razzak, Dwarikanath Mahapatra

2026-06-23视觉感知

这篇论文针对医学图像重识别中模型可能依赖设备伪影、且难以让临床医生核查“比较了哪些解剖结构”的问题,提出 Graph-of-Differences:把每张图表示为具名解剖节点图,在图像对之间建立软对应,并只在匹配解剖结构上计算差异,再与全局特征差异对齐。结果显示,在眼底和胸片内部基准上 Rank-1 分别较冻结 MaMI 提升 7.1 和 3.1 个百分点,外部零样本也有增益,同时提供节点级可审计解释。

LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces Figure 1
2026-06-23cs.CV

LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces

Aslı Çelik

LEViL: Label-Efficient Video Learning via, Pseudo-Label Spaces, Department of Electronics and Communications Engineering, Kocaeli University, performance. However, it requires large-scale labeled source, domains. Constructing such labeled pretraining datasets for, these limitations, this study proposes a label-efficient video learn-, with target-label-set-aware fine-tuning. During pretraining, a, unlabeled videos, which are processed to construct an inter-, pretable semantic pseudo-label space. A frozen video-language, downstream adaptation, target-label-set-aware fine-tuning com-, bines supervised learning from labeled target videos with zero-

2026-06-23视觉语言视觉感知

这篇论文针对视频动作识别中有标注源数据昂贵、且传统预训练受固定类别和域差异限制的问题,提出用VLM为未标注视频生成描述并构建语义伪标签空间,再由冻结视频语言模型进行零样本软蒸馏,结合面向目标标签集的微调。实验在UCF101和HMDB51的低标注设置下优于对比半监督方法,且可作为全量微调初始化;但结果主要集中在常见动作识别数据集,跨域泛化边界文中未充分说明。

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife Figure 1
2026-06-23cs.CV

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, Devis Tuia, Fabio Remondino, Benjamin Risse

Computer Vision and Machine Learning Systems group, Institute for Geoinformatics, University of, School of Civil, Aerospace and Design Engineering, University of Bristol, Bristol, UK, Department of Biology, University of Southern Denmark, Odense, Denmark, The Ohio State University, Columbus, Ohio, USA, Department of Collective Behavior, Max Planck Institute of Animal Behavior University of, Centre for the Advanced Study of Collective Behaviour, University of Konstanz, Konstanz, Germany, Department of Biology, University of Konstanz, Konstanz, Germany, Environmental Computational Science and Earth Observation Laboratory, EPFL, Sion, Switzerland, pseudo-3D labels, motivated by the high deployment cost of LiDAR and other 3D sensors. Similarly, LabelAny3D [52] produces pseudo 3D bounding-box annotations for arbitrary categories on in-the-, coverage of existing 3D datasets and the labour cost of manual 3D annotation. Together, these works, show that scalable 3D supervision is becoming practical for in-the-wild RGB data, but also confirm

2026-06-23视觉感知数据集/基准三维

面向生态无人机监测中缺少真实单目航拍三维动物标注、现有3D检测偏向车载/地面场景的问题,WildBox提供非洲草原多物种视频的23.8万个人审3D框、实例轨迹与KITTI/Omni3D兼容基准。实验显示2D开放词表定位尚可,但零样本3D提升即使给真值2D框也为0;微调后恢复到13.17宏AP3D,误差主要来自单目航拍深度估计。

A Test-time Actor-Critic Approach to News Images Generation Figure 1
2026-06-23cs.CV

A Test-time Actor-Critic Approach to News Images Generation

Damianos Galanopoulos, Vasileios Mezaris

Information Technologies Institute (ITI), Centre of Research and Technology Hellas (CERTH), Thessaloniki, Greece, The code is available at https://github.com/IDT-ITI/actor-critic-image-generation.

2026-06-23视觉感知

面向仅凭新闻标题生成配图时语义对齐不足、一次性提示难以稳定的问题,论文提出无需训练的测试时 Actor-Critic 流程:VLM 生成提示,扩散模型出图,另一 VLM 评分并把历史反馈给 Actor 迭代改写。结果显示带评分历史的迭代版本普遍优于单次生成,单一轻量 Z-Image-Turbo 配置在官方评测中取得最佳平均评分且计算成本更低。

SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry Figure 1
2026-06-23cs.CV

SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry

Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Yixing Lao, Xiaoyang Guo, Biao Gong, Fan Wang, Hengshuang Zhao

ZHENG ZHANG, The University of Hong Kong, Hong Kong, LIHE YANG, The University of Hong Kong, Hong Kong, YIXING LAO, The University of Hong Kong, Hong Kong, HENGSHUANG ZHAO, The University of Hong Kong, Hong Kong, Authors’ Contact Information: Zheng Zhang, The University of Hong Kong, Hong, Lihe Yang, The University of Hong, Yixing Lao, The University of Hong, alibaba-inc.com, Hengshuang Zhao, The University of Hong Kong, Hong Kong, Hong

2026-06-23三维

SCOPE针对单目长视频三维重建中几何精度与跨数百帧尺度一致性难以兼顾的问题,预测共享尺度/平移参数的仿射不变点图。其核心是将多视角几何对齐到统一参考系,结合跨指数时间尺度的一致性监督和NTK调制RoPE外推长序列。实验显示其在ScanNet上相对点图误差降低24.2%、时间对齐误差降低34.9%,并能单次前向处理复杂轨迹与光照变化。

Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models Figure 1
2026-06-23cs.CV

Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

Marwane Hariat, Gianni Franchi, David Filliat, Antoine Manzanera

semantic state from all available views. This posterior formulation naturally distinguishes between

2026-06-23三维

论文针对将CLIP、DINO等2D基础模型特征直接平均提升到3D时容易受视角、遮挡和噪声影响的问题,提出把每个3D点的语义表示视为不可观测潜变量,将多视角2D特征视为带位姿条件的噪声观测,并用集合式变分模型通过预测留出视角来学习后验。实验显示Casper3D在开放词汇3D语义分割中比简单多视角池化更稳定、鲁棒,尤其在歧义和噪声场景下更明显。

NoduLoCC2026: Lung Nodule Localization and Classification Contest from Chest X-Ray Images Figure 1
2026-06-23cs.CV

NoduLoCC2026: Lung Nodule Localization and Classification Contest from Chest X-Ray Images

Adnan Mustafic, Halim Benhabiles, Adnane Cabani, Kristhian André Oliveira Aguilar, Romain Amigon, Clément Bardin, Chiara Bentifece, Marin Boehm, Kévin Bouchard, Laura Burattini, Diedre Carmo, Fahima Idiri, Matthis Lahargoue, Ilaria Marcantoni, Hicham Messaoudi, Cyril Meyer, Farid Meziane, Léon Morales, Letícia Rittner, Agnese Sbrollini, Léonard Zipper, Karim Hammoudi

IMT Nord Europe, Institut Mines-T´el´ecom, Universit´e de Lille, Center for Digital Systems, Universit´e de Bejaia, Facult´e des Sciences Exactes, Laboratoire d’Informatique M´edicale et, University of Derby, Derby, United Kingdom, than the first one. The challenge website is available, Institute for Health Metrics and Evaluation, based, using a more easily scalable paradigm than transform-, institutes, or industry labs of which at least one mem-, Label, multi-class and multi-label, we filtered the images, or explicitly labeled as containing nodules without, the highest quality available from the source., CT scans. Nodule center point annotations are

2026-06-23视觉感知

针对胸片中肺结节比 CT 更便宜但受二维投影和结构重叠影响、自动检测与定位更难的问题,论文组织 NoduLoCC2026 竞赛,构建含 NIH ChestX-ray14、LIDC-IDRI 训练集与 JSRT 外部测试集的分类/定位评测。结果显示分类尚可,最佳平衡准确率 0.72、AUC 0.79;定位明显受限,最佳仅在 53% 图像上预测正确结节数,中位误差 12.83mm。

Unsupervised Domain Adaptation for Sim-to-Real Object Pose Estimation with Contrastive Alignment and Pseudo-Label Refinement Figure 1
2026-06-23cs.CV

Unsupervised Domain Adaptation for Sim-to-Real Object Pose Estimation with Contrastive Alignment and Pseudo-Label Refinement

Nidhal Eddine Chenni, Arunkumar Rathinam, Djamila Aouada

Estimation with Contrastive Alignment and Pseudo-Label Refinement, ments while exploiting a subset of unlabeled target data to, Pseudo-Label Refinement to improve reliability by encouraging, The authors are associated with SnT, University of Luxembourg. Contact, is often impractical given the cost, labor, and scalability, Adaptation (UDA) [3] leverages unlabeled real data (tar-, get) alongside labeled synthetic data (source) to train DL, pseudo labels. Multi-view consistency approaches [10], [11], pseudo labels in the target domain remain reliable despite, Pseudo-Label Refinement. wiith the following key contri-, a consistency-based pseudo-label refinement scheme that, UDA aims to transfer knowledge from a labeled source

2026-06-23三维

本文针对仅用合成数据训练的物体位姿估计在真实场景中因外观与几何域差异而退化的问题,提出 CAPLR:先用中间特征无监督匹配姿态相近的源/目标图像,再在局部 patch 上对齐骨干特征与任务输出,并用增强一致性细化伪标签,以避免全局对齐破坏关键几何线索。实验称其在多个位姿估计基准上达到 SOTA,并通过消融验证各组件有效。

Beyond Damage Assessment: Recyclable Material Detection in Aerial Disaster Imagery Using a Lightweight Patch-Based Framework Figure 1
2026-06-23cs.CV

Beyond Damage Assessment: Recyclable Material Detection in Aerial Disaster Imagery Using a Lightweight Patch-Based Framework

Mahmoud Hazem, Karim Hammoudi

Beyond Damage Assessment: Recyclable Material, efficient detection of recyclable material. Experimental results, recyclable materials. Accordingly, we provide a rare dataset, of material images that we labeled towards supporting the, development of recyclable material detectors. The dataset of, labeled material images is publicly available at: anonymous., ment, Recyclable Material Detection, Patch-Based Classifica-, vision [4]–[7] with the goal of identifying recyclable materials, lously prepared and labeled manually (546 images) is, provided towards training recyclable material detectors, terial overlay maps potentially representing recyclable, quantity of potentially recyclable material per regions of

2026-06-23视觉感知

本文关注灾后航拍图像中受损区域不仅要评估破坏程度,还可识别可回收建材以支持清理与资源回收。核心做法是构建手工标注的 RecyMat 小数据集,并用轻量 MobileNetV2 对 64×64 破片进行木材、砖、瓷砖和其他分类,再生成材料覆盖图和区域占比。模型在验证/测试上约 93.8% 准确率与宏 F1,在 AIDER 外部图像人工评估约 71%,但跨场景尺度变化和未见材料会显著降性能。

Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering Figure 1
2026-06-23cs.CV

Non-line-of-sight imaging with arbitrary relay surface geometries via 3D Gaussian Transient Rendering

Yi Wang, Ziyu Zhan, Yuran Wang, Hao Wang, Qiang Liu, Zuoqiang Shi, Lingyun Qiu, Xing Fu

YI WANG∗, Department of Precise Instrument, Tsinghua University, China, ZIYU ZHAN∗, Department of Precise Instrument, Tsinghua University, China, YURAN WANG, Department of Precise Instrument, Tsinghua University, China, HAO WANG, Department of Electrical Engineering, City University of Hong Kong, China, QIANG LIU, Department of Precise Instrument, Tsinghua University, China, ZUOQIANG SHI, Yau Mathematical Science Center, Tsinghua University, China, LINGYUN QIU, Yau Mathematical Science Center, Tsinghua University, China, XING FU†, Department of Precise Instrument, Tsinghua University, China, of Precise Instrument, Tsinghua University, Beijing, China, tsinghua.edu.cn, Department of Precise Instrument, Tsinghua University, Beijing, China, Tsinghua University, Beijing, China, of Electrical Engineering, City University of Hong Kong, Hong Kong, China

2026-06-23三维

这篇论文针对实际 NLOS 成像中中继面常为空间受限、非平面且采样稀疏,导致传统平面墙假设失效的问题,提出由可见 LOS 测量估计中继面几何,并用 3D Gaussian 表示隐藏场景、结合可微瞬态渲染端到端优化的 3D-GTR。实验覆盖公开数据和自建系统,在共焦/非共焦及任意中继面几何下均优于 NeTF、CC-SOCR 等方法,尤其提升复杂不规则中继面上的重建鲁棒性。

Few-Shot Hyperspectral Aphid Detection via FastGAN Synthetic Data Generation, Transformer-Based Classification and Explainable AI Figure 1
2026-06-23cs.CV

Few-Shot Hyperspectral Aphid Detection via FastGAN Synthetic Data Generation, Transformer-Based Classification and Explainable AI

Ali Saeidan

Lancaster Medical School, Faculty of Health and Medicine, Lancaster University, Lancaster LA1 4YG, United Kingdom, yields and quality. Conventional detection methods rely on visual inspection or chemical analyses, which are labor-intensive, time-consuming, HSI data is the limited size of available datasets (Ma et al., 2019, transformers (ViTs) require large volumes of labeled data to achieve generalizable performance (Dosovitskiy et al., 2021, fidelity. These characteristics make FastGAN particularly suitable for generating synthetic hyperspectral SID images, where the availability of, labeled data is limited but high spectral detail is essential. In our study, FastGAN was trained on the real SID dataset to produce 10,000 synthetic

2026-06-23视觉感知生成模型

针对高光谱蚜虫检测标注样本少、深度模型易过拟合的问题,本文用 FastGAN 扩增蚕豆叶 SID 图像并比较 VGG16、ResNet-50、EfficientNet 与 ViT。结果显示合成数据提升分类稳健性、减少漏检,ViT 准确率和 F1 最优;但增益可能主要来自 data scaling,合成样本对真实泛化的贡献仍需更严格验证。

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM Figure 1
2026-06-23cs.RO

Spectral GS-SLAM: Observability-Aware, Degeneracy-Robust Tracking for Real-Time 3D Gaussian Splatting SLAM

Edward Beng Wai Tan, Siew-Kei Lam, Dongshuo Zhang

College of Computing and Data Science, Nanyang Technological University, Singapore. ∗ Corresponding author.

2026-06-23视觉感知三维安全鲁棒

这篇论文针对实时 3DGS-SLAM 中轻量跟踪的互补失效:特征法怕低纹理,ICP 在几何退化场景中病态。核心做法是用 Hessian 谱分析和高斯协方差中的平面性统计识别不可观方向,并只在退化子空间注入稀疏特征约束。TUM RGB-D 实验显示其在无纹理和结构退化序列中保持轨迹稳定,同时达到约 40.14 FPS。

A Neurosymbolic Framework for Interpretable Skeleton-Based Seizure Detection via Concept-Driven Logical Reasoning Figure 1
2026-06-23cs.CV

A Neurosymbolic Framework for Interpretable Skeleton-Based Seizure Detection via Concept-Driven Logical Reasoning

Talha Ilyas, Deval Mehta, Zongyuan Ge

Department of ECSE, Faculty of Engineering, Monash University, Australia, AIM for Health Lab, Faculty of IT, Monash University, Australia, Department of DSAI, Faculty of IT, Monash University, Australia

2026-06-23视觉感知

针对视频癫痫检测虽性能提升但缺乏临床可解释性、且二分类易把正常剧烈动作误报为发作的问题,本文把患者骨架提取、ILAE运动半定量概念瓶颈和可微逻辑规则结合,并细分非发作活动提供监督。在SAHZU和IEEE上分别达到89.78%/85.27%敏感性,误报降至0.06/0.09次每小时,同时给出概念、规则和贡献度三级解释。

ACE-GS: Acing the Trade-off with Accurate, Compact and Efficient 3D Gaussian Splatting Figure 1
2026-06-23cs.CV

ACE-GS: Acing the Trade-off with Accurate, Compact and Efficient 3D Gaussian Splatting

Jijian Zhao

2026-06-23三维

ACE-GS针对3D Gaussian Splatting在快速训练、模型紧凑与高保真之间的冲突,核心洞察是精细管理高斯基元而非粗暴裁剪:用动量一致性约束增密到真实几何流形,结合统计敏感度在线稀疏化,并用残差频率补偿恢复高频细节。实验称其3–5分钟收敛,相比Speedy-Splat最高加速3.7倍,且PSNR较原始3DGS最高提升0.89 dB。

No Figure
2026-06-23cs.CR

DIPBox: A Multi-scale Testing Framework for Tracking Dataset Regeneration

Tian Dong, Yan Meng, Shaofeng Li, Guoxing Chen, Yuling Chen, Zhen Liu, Haojin Zhu, Hao Chen

∗ Shanghai Jiao Tong University, China † Southeast University, China ‡ Guizhou University, China § The University of Hong Kong, China

2026-06-23视觉感知数据集/基准

针对训练数据集被改写、重组或生成式复刻后难以追踪的问题,DIPBox的核心洞察是只要再生数据仍保持模型效用,就会在样本、集合与分布多尺度上留下可测相似性;论文据此设计四类指标和自适应测试流程。实验覆盖16个视觉/文本数据集、320个再生集和590个模型,显示其TPR较既有方法至少提升25%,但黑盒且无数据访问时仍受限。

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production Figure 1
2026-06-23cs.CV

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production

JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi

Dankook University, University of Birmingham

2026-06-23生成模型

这篇论文针对句级手语生成中长序列易漂移、手部细节模糊且难以逐词控制的问题,提出按 gloss 自回归生成的扩散模型 GARD,将当前/历史语义与上一段运动上下文共同作为条件,并用跨 gloss 边界引导和全局运动协调器处理协同发音与过渡连续性。实验在 Phoenix-T 和 CSL-Daily 上显示其在语言准确性和运动相似度上优于已有 SLP 方法。

Arc-Length Parameterized Interpolating Splines Figure 1
2026-06-23cs.CG

Arc-Length Parameterized Interpolating Splines

Dafna K. Matsegora, Stephen M. Watt

Cheriton School of Computer Science, University of Waterloo, generally available. Importantly, our problem is one of interpolation: the curve

2026-06-23视觉感知

面向路径规划、CAD、手写识别等需要按真实弧长稳定评估曲线的场景,论文针对固定采样点插值样条难以同时保持过点与弧长参数化的问题,提出从弦长初始化、反复重建插值样条并用数值积分更新节点弧长的迭代方法。实验显示多数平面曲线约两次迭代即可获得较低误差,可扩展到任意维度;但收敛性、唯一性及噪声下实际收益文中未充分说明。

Real-time pedestrian attribute recognition with YOLOv8 and ResNet18 Figure 1
2026-06-23cs.CV

Real-time pedestrian attribute recognition with YOLOv8 and ResNet18

Houssam El Mir

College of Computer Science and Technology, Zhejiang University of Technology, Pedestrian attribute recognition (PAR) assigns semantic labels to detected pedestrians, and is useful in surveillance, video retrieval, and human-centred graphics applications. This, Multi-label classification, transportation analytics, human-computer interaction, and human-centred graphics applica-, labels are multi-valued, • A dataset preparation strategy that maps PA-100K labels into the PETA 61-attribute, tion and joint multi-label learning. Recent work explores attention mechanisms [15], multi-task, Modern PAR models usually share visual features across attributes because many labels are, labels can often be inferred from overlapping image regions. This motivates the ResNet18-based, and multi-label attribute prediction., creates a combined PAR dataset by mapping PA-100K labels into the PETA attribute space

2026-06-23视觉感知

面向监控与视频检索中实时行人语义标注需求,论文将 YOLOv8n 行人检测与 ResNet18 任务头串成检测到属性识别流水线,并通过语义映射合并 PETA 与 PA-100K,保留 61 个属性空间。结果显示性别准确率 99.89%、年龄 MAE 4.23 年、多属性准确率 89.96%,RTX 5060 上达 25–30 FPS;但宏 F1 仅 36.32%,说明性能增益可能主要来自数据整合与轻量工程集成,稀有属性仍未解决。

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders Figure 1
2026-06-23cs.CV

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

Sergio Lanza, Jae Hee Lee, Stefan Wermter

2026-06-23视觉语言视觉感知

这篇论文针对VLM内部概念难解释、现有SAE方法常将视觉与文本概念割裂且忽略多模态概念的问题,提出统一框架:按SAE神经元分别收集强激活的图像patch和文本token,用外部VLM生成候选概念,再用CLIP/ALIGN相似度判定其视觉、文本或多模态属性。在LLaVA-NeXT的VQA实验中,视觉概念描述质量相对既有SAE方法最高提升45%,同时保持文本概念质量并实现多模态概念的系统识别。

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models Figure 1
2026-06-23cs.CV

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

Seoul National University, Seoul National University Hospital, Seoul National University College of Medicine, Sungkyunkwan University School of Medicine

2026-06-23视觉语言视觉感知数据集/基准

针对患者直接获取影像结果后难以理解专业报告的问题,本文提出 MedLayXPlain-122K:一个覆盖 8 类医学影像、带 ROI grounding、UMLS 本体锚定的专家—通俗描述基准,并用 HOVER 与轻量 MedLayEval 约束语义一致和可读性。对 33 个 VLM 的评测显示,医学 VLM 擅长专业描述但通俗化退化明显,通用 VLM 更易懂却临床精度不足,揭示当前模型尚难同时满足患者沟通需求。

Anatomically Consistent TMJ Disc Segmentation via Semantic Anchoring and Clinical Priors Figure 1
2026-06-23eess.IV

Anatomically Consistent TMJ Disc Segmentation via Semantic Anchoring and Clinical Priors

Dayun Ju, Chanyoung Kim, Sunyoung Jung, Hyo-Jung Jung, Chena Lee, Younjung Park, Seong Jae Hwang

2026-06-23视觉感知

这篇论文针对TMJ关节盘在MRI中极小、低对比且病变时形态/位置变化大,导致通用分割模型易漏检、误分和边界不稳定的问题。TISC用相邻切片的MedDINOv3特征构建原型语义锚点定位关节盘,并引入口张受限MOL作为临床先验调制点级边界细化。在1300例、2488个PD MRI体数据上,较UNet、nnUNet、SwinUNETR等基线最高提升约4.96 Dice,并改善HD95等边界指标。

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis Figure 1
2026-06-23cs.CV

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

Xiangyu Li, Ran Su

College of Intelligence and Computing, Tianjin University, Tianjin 300072, China, ] aggregates patches under slide-level labels, Fig. 1. (A) MIL relies on slide-level labels

2026-06-23视觉感知

HERO针对乳腺癌全切片中异质性强、传统MIL或VLM容易检索到非诊断区域的问题,将DNA甲基化和miRNA先映射为可审计的形态学假设,再用结构化caption的TF-IDF检索与一致性门控修复证据不足区域。在TCGA-BRCA上,方法在ER、PR、HER2、分型和风险预测均优于多模态融合与VLM基线,HER2和风险增益最明显。

No Figure
2026-06-23cs.CV

BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving

Zhe Shuai, Xiaopeng Xie, Yikun Zeng

Shanghai Jiao Tong University

2026-06-23视觉感知强化学习

本文关注自动驾驶视频世界模型在感知到规划链路中的训练期后门风险:上游未来表征一旦被污染,即使轨迹监督干净也会误导下游动作。BadDreamer通过“触发物只出现在观测帧、未来帧保持干净”的擦除式投毒,让模型在看到黄色骑手时预测其消失并形成清路幻觉。实验在VaViM/VaVAM上显示,5%投毒即可在保持干净生成与动作性能的同时达到92.5%世界模型攻击成功率、90.3%动作攻击成功率和86.2%端到端成功率。

PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling Figure 1
2026-06-23cs.GR

PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling

Sang-Hun Han, Min-Gyu Park, Jisu Shin, Seunghyun Shin, Jin-Hwi Park, Hae-Gon Jeon

2026-06-23优化算法

PIAvatar针对现有3D人体头像虽外观逼真但缺乏与物体、他人双向物理交互及软体形变的问题,基于MPM提出将运动学速度从形变梯度更新中解耦,避免控制动作诱发多余应力,并嵌入骨架以闭式估计受力后的姿态。实验展示了不同质量、材料和人-物/人-人接触下可产生一致的轨迹变化与非刚性身体形变。

Contrastive and Adaptive Multi-modal Masked Autoencoder for Spatial Transcriptomics Figure 1
2026-06-23cs.CV

Contrastive and Adaptive Multi-modal Masked Autoencoder for Spatial Transcriptomics

Joohyeok Kim, Taejin Jeong, Jinyeong Kim, Seong Jae Hwang

2026-06-23视觉感知

这篇论文针对仅凭 H&E 形态预测空间转录组信息不足、临床 ST 成本高的问题,将任务改写为空间插补:用少量实测基因表达作为锚点。核心创新是以 bio-saliency 和排序学习自适应选择连续高信息区域,并用多模态 MAE 与对比学习融合图像和基因锚点。实验称其在纯图像预测和插补任务上均优于既有方法,且仅用约 10% 转录组覆盖即可进一步提升精度。

ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization Figure 1
2026-06-23cs.CV

ChronoLock: Protecting Videos from Unauthorized Text-to-Video Personalization

Jiaming He, Jiashu Zhang, Guanyu Hou, Shuhan Ye, Hanwei Zhu, Yi Yu, Xudong Jiang

2026-06-23视觉感知

这篇论文关注公开视频被少量样本用于未授权文本到视频个性化微调的风险,指出现有“保护扰动”多针对静态外观,难以破坏视频模型学习运动的时间去噪证据。ChronoLock 的核心是把视频切块,在扰动预算内同时放大块内时间适配误差和块间边界不连续,并用变换采样增强鲁棒性。实验在 UCF Sports、HMDB51 及 ZeroScope、ModelScope 上显示,它能显著降低运动模仿质量,人评偏好从 Clean 的 67.68% 降至 32.32%。

No Figure
2026-06-23cs.CV

SEED: Simple ViT and Evolving Harness for Explainable Text Forgery Detection

Kahim Wong, Kemou Li, Yiming Chen, Haiwei Wu, Jiantao Zhou

State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau, School of Information and Software Engineering, University of Electronic Science and Technology of China

2026-06-23视觉感知

面向AI图像编辑带来的票据、证件等文本型文档伪造风险,SEED将任务从单纯检测扩展到“检测—像素定位—自然语言解释”的结构化取证报告生成。其核心是用相似性引导合成伪造数据与干净/伪造配对训练增强判别,再以DINOv3 ViT+LoRA+EoMT统一检测和定位,并用Meta-Harness迭代优化MLLM报告生成。系统在ACM MM 2026 GenText-Forensics挑战中获得第3名;具体各模块独立增益文中未充分说明。

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion Figure 1
2026-06-23cs.CV

Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion

Dongseok Shim, Julian Tanke, Kengo Uchida, Christian Simon, Koichi Saito, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

2026-06-23视觉语言生成模型

Odoriko针对现有统一人体运动生成框架忽略性别、体型等形态差异的问题,将SMPL形状参数与多模态条件共同注入扩散式Shape-Aware Motion Transformer,在文本到动作、音乐到舞蹈、视频/关键点到姿态估计间共享模型,并可在缺少形态输入时联合估计体型。实验显示其在多项标准指标上达到或超过专用模型,同时在新引入的形态一致性评测中更能保持主体相关的运动差异。

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis Figure 1
2026-06-23cs.CV

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shenda Hong, Liwei Wang

State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics, Center for Data Science, Peking University, Yizhun co. ltd, International School, Beijing University of Post and Telecommunications, School of Public Health, University of Michigan, Ann Arbor, Future Technology College, Xi’an Jiaotong University, Peking University, State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University Beijing China, School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics Beijing China, Center for Data Science, Peking University Beijing China, Yizhun co. ltd Beijing China

2026-06-23数据集/基准

针对乳腺X线AI多停留在端到端识别、缺少可解释诊断推理标注的问题,MammoExpert构建了含2379张图像、67类WHO病理亚型和42项影像特征的基准,并用三阶段CoT模拟放射科医生从观察到综合判断的流程。实验显示,加入该数据较CBIS-DDSM训练提升7.1%准确率,显式学习CoT在本测试集再增4%,在INBreast和Vindr也有约6.9%与6.7%增益。

ConnectomeBench2: A Unified Benchmark for Automated Connectomic Proofreading Figure 1
2026-06-23cs.CV

ConnectomeBench2: A Unified Benchmark for Automated Connectomic Proofreading

Jeff Brown, Tim Farkas, Gleb Razgar, Edward S. Boyden

The Open University, Mindspan Institute, McGovern Institute, MIT Departments of Brain and Cognitive Sciences and Biological Engineering

2026-06-23数据集/基准

这篇论文瞄准连接组重建中人工校对耗时、限制全脑突触级图谱生成的问题,提出 ConnectomeBench2:从鼠、人、斑马鱼和果蝇四类公开连接组中统一整理分裂与合并错误校对任务,形成大规模专家标注基准。作者用共享网格几何与电镜图像编码器的单一 ViT 进行多物种、多任务训练,达到接近人类的分裂校正和合并错误识别准确率,并展示性能随数据规模、多模态输入提升;校准、分布偏移度量、预训练和主动学习实验表明其可用于评估跨物种泛化与降低新数据标注成本,但部分增益可能主要来自 scaling / data。

MS-rPPG: Multi-spectral State Space Model for Remote Photoplethysmography in Driver Monitoring Systems Figure 1
2026-06-23cs.CV

MS-rPPG: Multi-spectral State Space Model for Remote Photoplethysmography in Driver Monitoring Systems

Jiho Choi, Sang Jun Lee

2026-06-23视觉感知

面向车载驾驶员健康监测中光照剧烈变化和头部运动导致的 rPPG 失准问题,论文提出 MS-rPPG,将 RGB 与近红外人脸视频结合,并用频域先验驱动的跨光谱线性调制融合脉搏信息,再以 MS-Mamba 线性复杂度建模长时序和跨通道依赖。作者还采集 50 人真实驾驶 MS-Drive 数据,并在 MR-NIRP Car 与 MS-Drive 上报告心率估计优于既有方法。

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation Figure 1
2026-06-23cs.CV

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation

Vasile Marian, Yong-Bin Kang, Alexander Buddery

The University of Queensland, Swinburne University of Technology, The University of Queensland Brisbane Australia, Swinburne University of Technology Melbourne Australia

2026-06-23视觉感知数据集/基准

这篇论文针对低数据场景下目标中心生成缺少统一、可复现数据资源的问题,整理并发布 Cityscapes 行人、TrafficSigns 与 COCO 盆栽三类 256×256 裁剪、框标注、清单、脚本和校验文件,覆盖遮挡行人、清晰标志与复杂背景物体。主要价值在于标准化受限数据生成与增强评测接口;已有 YOLOv11 用例显示合成增强在 Cityscapes 行人和 COCO 盆栽上分别带来 +7.6% 与 +30.6% 提升,TrafficSigns 增益较小。

SARIF: Segment Anything for Robust Image Forensics Figure 1
2026-06-23cs.CV

SARIF: Segment Anything for Robust Image Forensics

Dong-Hyun Moon, Ju-Hyeon Nam, Sang-Chul Lee

2026-06-23视觉感知安全鲁棒

针对图像篡改定位在跨域与常见退化下不稳、SAM类方法又依赖人工提示的问题,SARIF将SAM改造成自动取证框架:用冻结/适配双编码器的残差提取篡改特异线索,并与上一轮掩码融合进行反馈式解码细化。实验显示其在标准篡改定位基准上取得较强平均跨数据集表现,并对JPEG压缩、噪声和模糊更鲁棒。

ShuffleFlow: Scalable Posterior Inference for Bayesian Inverse Imaging Figure 1
2026-06-23cs.CV

ShuffleFlow: Scalable Posterior Inference for Bayesian Inverse Imaging

Tianao Li, Tjitske Starkenburg, Yu Sun, Emma Alexander

T. Li and E. Alexander are with the Department of Computer Science, Northwestern University, Evanston, IL 60208., T. Li, E. Alexander, and T. Starkenburg are also with the NSF-Simons AI Institute for the Sky (SkAI), Chicago, IL 60611., Y. Sun is with the Department of Electrical and Computer Engineering, Johns Hopkins University, Baltimore, MD 21218., Project website: https://nubivlab.github.io/ShuffleFlow/ .

2026-06-23生成模型

本文针对贝叶斯逆成像中变分推断虽能高效生成后验样本、但标准归一化流随图像维度扩展代价过高的问题,提出 ShuffleFlow:用 pixel-unshuffling 将大图分解为子图栈,由神经场编码采样坐标特征,并用共享条件归一化流建模子图联合后验。实验覆盖线性与非线性逆问题,显示其在重建质量和不确定性估计上优于既有 VI 分解策略,并能比扩散采样更快生成大量后验样本。

How Should a Robot Configure Its Laser Scanner for Inspection? Figure 1
2026-06-23cs.RO

How Should a Robot Configure Its Laser Scanner for Inspection?

Zhiling Chen, David Gorsich, Matthew P. Castanier, Yang Zhang, Jiong Tang, Farhad Imani

2026-06-23机器人

这篇论文关注机器人激光检测中常被忽略的传感器参数配置问题:固定或人工调参会因几何、反光和任务意图变化导致漏扫或细节退化。作者提出 SenseHD,将曝光、量程等参数视为离散“感知动作”,用视觉预扫描与检测指令构成超维表示并在关联记忆中检索稳定配置。真实机器人实验显示其相较规则、DNN 和多模态大模型基线具备更高配置准确性、数据效率和低延迟,提升检测可靠性。

Neural Architecture Distributions: A New Paradigm for Stochastic Segmentation Figure 1
2026-06-23cs.CV

Neural Architecture Distributions: A New Paradigm for Stochastic Segmentation

Conghui Li, Junhao Huang, Chern Hong Lim, Bing Xue, Mengjie Zhang

School of Information Technology, Monash University Malaysia, Selangor, Malaysia, Centre for Data Science and Artificial Intelligence, School of Engineering and Computer Science, Victoria University of Wellington, Wellington, New Zealand

2026-06-23视觉感知

这篇论文针对多标注者分割中单一预测易产生“平均掩码”、且潜变量或扩散随机源难以审计的问题,提出把随机性放到离散神经架构分布中:按输入采样不同算子路径生成多种掩码,并用进化搜索构建候选算子库、以能量距离式集合监督防止坍缩。实验称在 LIDC-IDRI 上取得最佳 GED 与 HM-IoU,并在两个扩展任务有效,但候选库搜索带来额外训练成本。

MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts Figure 1
2026-06-23eess.IV

MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts

Jiancheng Zhao, Xiang Ji, Yifan Zhan, Zunian Wan, Yinqiang Zheng

2026-06-23视觉感知

这篇论文针对机器视觉场景中图像压缩难以同时兼顾人类重建质量与分类、检测、分割等下游任务的问题,提出在 Transformer 学习式压缩器中用 token 级 MoE 替换 FFN,使不同区域按内容和任务目标动态分配专家计算。为避免路由碎片化和参数暴涨,作者采用 expert-choice 路由、空间总变差正则与 Group Shuffle MLP。实验显示,在 TIC、TinyLIC、TCM 上重建 BD-Rate 分别提升 11.54%、8.12%、6.42%,并在分类、检测、实例分割上相对 Full Finetune-TIC 进一步降低 BD-Rate。

FlowCodec: One-Step Flow Prior for Generative Image Compression Figure 1
2026-06-23eess.IV

FlowCodec: One-Step Flow Prior for Generative Image Compression

Yinhuan Huang, Hao Cao, Pu chen, Wenqi Guo, Zhijin Qin

Tsinghua University

2026-06-23视觉感知生成模型

本文针对超低码率图像压缩中生成先验适配成本高、常需额外条件或分支的问题,提出将压缩视为从受限噪声潜变量到干净潜变量的单步流式传输。FlowCodec把潜变量压缩与预训练文生图先验的Latent Transport解耦,仅用轻量LoRA适配即可支持多码率。实验显示其在低于0.05 bpp时提升感知质量,Qwen版在LPIPS/DISTS上优于既有方法,并保持较高PSNR和更快编码。

Self-Supervised Dual-Frequency Phase Decomposition for Single-Shot Composite Fringe Projection Profilometry Figure 1
2026-06-23cs.CV

Self-Supervised Dual-Frequency Phase Decomposition for Single-Shot Composite Fringe Projection Profilometry

Jin-Hyuk Seok, Yatong An, Jae-Sang Hyun

2026-06-23视觉感知

针对单次复合条纹投影轮廓术中低/高频相位难分离、传统变换法需调参且监督学习依赖昂贵标签的问题,论文提出自监督双频相位精炼,利用两种频率相位梯度的尺度与方向一致性,并加入软边缘一致性保结构。实验中深度 MAE/RMSE 达 0.367/1.804 mm,优于最佳变换基线 0.402/2.785 mm,有效像素率从 84.75% 提升到 95.07%。

Sparse Point-Guided Fusion of Supervised and Self-Supervised Learning Model for Seaweed Segmentation Figure 1
2026-06-23cs.CV

Sparse Point-Guided Fusion of Supervised and Self-Supervised Learning Model for Seaweed Segmentation

Tatsuya Suzuki, Kazuya Ijuin, Hideki Tomimori, Megumi Chikano, Katsushi Sakai

and self-supervised learning (unable to assign class labels), approach allows automatic class label assignment and mitigates, using ground truth data (images and labels indicating what each, of available ground truth data. Particularly, when the training, generating training signals from large-scale unlabeled image, class labels, such as identifying the species of seaweed within, addition to the input underwater image, sparse point labels, segmentation masks through label propagation. In this research, Coral, a label propagation technique that utilizes these features., combined with HIL-Coral for efficient label propagation

2026-06-23视觉感知

面向海洋数字孪生中的蓝碳核算,论文针对水下海藻小目标、类别多样和标注稀缺导致的分割困难,提出用USIS-SAM提供类别与稀疏点位置,再由DINOv2/HIL-Coral传播细粒度区域并用MaskFusion合并实例掩码的两阶段融合方法。在山口县水下图像上,SSL.Prop.+MF较USIS-SAM提升0.068 mIoU,尤其改善小型海藻分割,但跨海域泛化仍文中未充分说明。

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays Figure 1
2026-06-23cs.CV

CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays

Geon Choi, Hangyul Yoon, Nalee Kim, Jeong Yun Jang, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Edward Choi

KAIST 2 Samsung Medical Center 3 Konkuk University Medical Center

2026-06-23数据集/基准

现有胸片 VLM 评测多停留在疾病有无判断,难以验证临床所需的病灶级视觉感知。CheXpercept 将放射科医生流程拆成粗粒度检测、轮廓评估与修订、语义属性抽取,并用 2,100 张胸片生成 10,400 个专家复核 QA。对 14 个通用和医学 VLM 的测试显示,模型只在粗层级尚可,细粒度和语义任务显著退化,医学模型也未体现稳定优势。

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City Figure 1
2026-06-23cs.CV

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

due to their high out-of-distribution nature. Our dataset is available at

2026-06-23视觉语言数据集/基准安全鲁棒

本文关注自动驾驶向复杂新城市扩展时,作为VLA认知骨干的VLM能否在真实OOD路况中可靠泛化。作者构建Robusto-2,用利马和纽约行车视频、两地人类司机与10个VLM做全因子VQA比较,并按模型回答方差筛选高分歧片段。结果显示,人类与VLM的认知回答差异明显且受问题类型影响,但地理来源对人类或模型回答模式影响不强,两地人类表现相近。

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion Figure 1
2026-06-23cs.CV

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma

The University of Queensland, Australia, efficient and scalable composite conditioning in diffusion-based image, scalability of existing conditioning frame-

2026-06-23生成模型

针对多条件扩散生成中为每种控制信号单独训练适配器、显存和推理开销随模态数线性增长的问题,UNITY提出先跨模态联合学习共享语义、再按模态专化的两阶段适配器,并用MAF可学习流场做空间对齐。实验在SD1.5和SDXL的Canny、Depth、Sketch、Segmentation上报告更低FID和更高CLIP,同时以固定参数和24GB单卡训练降低多条件成本。

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models Figure 1
2026-06-23cs.CV

CogniRoute: Learning to Route Social Evidence in Omni-Modal Models

Yifan Shen, Pei Tian, Xinzhuo Li, Bowen Fang, Shujun Xia, Bingxuan Li, Ana Jojic, Wenming Ye, Xu Cao, James Matthew Rehg, Ismini Lourentzou

University of Illinois Urbana-Champaign, 2Columbia University, 3Google, reasoning traces, schema labels, temporal evidence spans, and a manually verified evaluation split. CogniRoute, schema labels, grounded reasoning, routing-related annotations, and temporal evidence spans, providing, pipeline that first extracts observation-level visual and audio evidence, then assigns schema labels and

2026-06-23视觉感知

针对全模态模型虽能接入视频、音频和文本却常未使用正确社会线索的问题,CogniRoute用训练期认知模式标注跨模态关系、推理需求和时间范围,并以路由对齐与强化学习约束MoE专家分配。其构建OmniSocialBench,报告平均准确率59.38%,较最强闭源基线高15.33个百分点,优势集中在音视协调、冲突消解和时间扎根社会推理。

Scaling Diverse Language Generation for 3D Visual Grounding Figure 1
2026-06-23cs.CL

Scaling Diverse Language Generation for 3D Visual Grounding

Austin T. Wang, Dongchen Yang, Angel X. Chang

Simon Fraser University

2026-06-23视觉语言三维

这篇论文针对3D视觉定位数据规模化后语言模式单一、难以训练机器人理解复杂空间指称的问题,提出ViGiL3D++:先从场景图采样多样约束并用交叉引用保持相似物体属性表述一致,再交给LLM改写为查询。实验显示其生成数据在语言模式覆盖和有效性上优于多种自动基线,并能提升多个3DVG基准表现,但也指出VLM在场景图生成和空间表述上仍有明显局限。

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion Figure 1
2026-06-23cs.CV

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li

2026-06-23视觉感知生成模型

ELDiff针对多对象文生图中,基于分割图的token级监督容易受SAM掩码偏差和语义重叠冲突影响的问题,将证据学习引入扩散微调:用像素证据损失建模注意力的不确定性,避免对错误标签过度自信,并用Dempster-Shafer冲突度约束不同名词token的空间竞争。实验显示其在SD v1.4/v2.1、SDXL、SD v3.5和Qwen-Image上优于训练式与免训练方法,且不增加推理操作。

GIM-ENDO: A Multimodal Endoscopic Image and Video Dataset for Gastric Intestinal Metaplasia Morphology and Pathology Figure 1
2026-06-23cs.CV

GIM-ENDO: A Multimodal Endoscopic Image and Video Dataset for Gastric Intestinal Metaplasia Morphology and Pathology

Mojgan Forootan, Mahziar Setayeshfar, Ali Darvishi, Mohammad Tashakoripour, Hamidreza Bolhasani

2026-06-23视觉语言视觉感知数据集/基准

针对胃肠上皮化生早筛 AI 缺少公开、病理验证且带细粒度内镜标注的数据瓶颈,GIM-ENDO整合24例患者的WLE/NBI/M-NBI图像与视频、病理亚型、OLGA/OLGIM及幽门螺杆菌等结构化信息,并标注LBC、MTB、WOS等形态征象。主要结果是发布约98张图像和39段视频的多模态基准,可支持GIM检测、亚型分类和活检靶向研究,但规模小、正常对照少,性能增益仍需更大队列验证。

PROTON: Prototype-Based Test-Time Online OOD Detection for Medical VLMs Figure 1
2026-06-23cs.CV

PROTON: Prototype-Based Test-Time Online OOD Detection for Medical VLMs

Abhijit Das, Nichula Wasalathilaka, Yifan Lu, Adinath Dukre, Dwarikanath Mahapatra, Shadab Khan, Imran Razzak

2026-06-23视觉语言视觉感知

这篇论文针对医疗视觉语言模型部署时 OOD 检测在协变量偏移上失效的问题,指出软最大置信度会混淆 ID 与偏移样本,而嵌入空间仍保留可分几何。PROTON 在测试流中用高置信预测维护在线类别原型,并按 MCM 方差自适应融合原型距离与 MCM,无需训练数据、改模型或提示工程。在眼科基准上相对 MCM 分别提升语义、协变量、远域 AUROC 8.8、23.9、8.1 点,并可迁移到放射和病理任务。

BELDE: Building a Large-scale Earth-observation Land-cover Dataset for Europe Figure 1
2026-06-23cs.CV

BELDE: Building a Large-scale Earth-observation Land-cover Dataset for Europe

Ümit Mert Çağlar, Alptekin Temizel

2026-06-23数据集/基准

针对现有土地覆盖分割数据集在地域覆盖、规模和可获得性上的不足,BELDE用Sentinel-2 RGB影像与ESA WorldCover标注构建了覆盖欧洲的百万级训练就绪数据集,并提供韩国、美国加州-内华达OOD评测集和可复现流水线。基线显示欧洲域内F1为83.0%,跨域降至66.4%和58.3%,说明主要价值在于大规模RGB基准与地理域移评测,性能增益可能主要来自scaling/data。

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking Figure 1
2026-06-23cs.CV

Go-with-the-Track: Video Compositing and Motion Control with Point Tracking

Koichi Namekata, Yash Kant, Zhizheng Liu, Ryan D Burgert, Yuancheng Xu, Kuan Heng Lin, Emmett Steven, Julien Philip, Li Ma, Andrea Vedaldi, Paul Debevec, Ning Yu

Eyeline Labs, University of Oxford, University of California, Los Angeles, Stony Brook University, Columbia University, Eyeline Labs USA, University of Oxford Oxford United Kingdom, Eyeline Labs Los Angeles USA, University of California, Los Angeles Los Angeles USA, Stony Brook University USA, Columbia University USA, Eyeline Labs United Kingdom

2026-06-23视觉感知规划控制

本文针对视频生成中“参考外观一致性”和“精确时空运动控制”长期分离的问题,提出用锚定到多张参考图的点轨迹统一描述元素从哪里来、何时出现以及如何运动。核心创新是空间感知点轨迹嵌入与轻量适配器,使大量轨迹可注入视频扩散 Transformer,并结合动态、静态和合成数据训练。实验显示其在多参考合成、点轨迹驱动运动控制和静/动态场景相机控制上优于既有方法。

Fine-grained Human Motion Understanding with Language Models Figure 1
2026-06-23cs.CV

Fine-grained Human Motion Understanding with Language Models

Thomas Markhorst, Zhi-Yi Lin, Jouh Yeong Chew, Jan van Gemert, Xucong Zhang

Delft University of Technology, Honda Research Institute Japan

2026-06-23视觉感知

本文针对视频输入计算开销大、隐私敏感且难以保留精细时序的问题,提出 FiGMo:将人体运动表示为带显式时间戳的 2D/3D 骨架姿态序列,并用统一姿态编码器接入 LLM。核心洞察是细粒度运动理解更依赖姿态与运动层级的多样监督,分阶段训练增益较小。实验在 BABEL-QA、HuMMan-QA、CompMo、NTU-RGB+D、QEVD-Coach 等基准达到 SOTA,且仅用 2D 骨架也超过部分 3D 方法。

Toward Parking Spot Occupancy Recognition: A Self-Supervised Approach Figure 1
2026-06-23cs.CV

Toward Parking Spot Occupancy Recognition: A Self-Supervised Approach

Luan Marko Kujavski, Rayson Laroca, Paulo Lisboa de Almeida

2026-06-23视觉感知

面向停车场占用识别中目标场景标注成本高、跨环境精度下降的问题,本文将 SimCLR/ResNet-50 扩展为“通用无标注预训练—停车场无标注自监督微调—通用有标注微调”的流程,并在部署初期继续收集目标场景无标注图像训练专用模型。三数据集留一环境实验显示,强通用模型平均准确率达 97.2%,两阶段部署提升至 97.8%,但增益来源可能主要来自目标无标注数据适配。

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation Figure 1
2026-06-23cs.CV

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

adaptation. Our code is available at this link., Center for AI Research, VinUniversity, University of Utah, USA, German Research Center for, Technical University of Denmark, University of Oldenburg, Germany, University of, Max Planck Research School for Intelligent, enabling scalable robotic control across tasks, embodiments, only by the number of action-labeled trajectories, but also, labels (Eysenbach et al., 2021).

2026-06-23视觉语言视觉感知

本文针对VLA模型在10–30条示范下适应性能急剧下降的问题,提出FOCA:不再只做逐步行为克隆,而是利用示范中的未来帧,在潜空间显式预测任务相关的机器人—物体交互嵌入,并隐式对齐未来目标观测,还可用无动作合成视频协训。实验显示其在LIBERO 20示范达95.7%成功率,在RoboCasa提升7–12%,真实机器人最高绝对提升26%。

Stochastic Signed Distance Processes Figure 1
2026-06-23cs.CV

Stochastic Signed Distance Processes

Hiroki Sakuma, Masatoshi Okutomi

Department of Systems and Control Engineering, Institute of Science Tokyo

2026-06-23视觉感知

本文针对 NeuS/VolSDF 将 SDF 映射为局部衰减系数时难以刻画空间相关几何与历史可见性依赖的问题,提出将沿射线的 SDF 建模为随机过程 SSDP,用首次穿越时间分布重写概率表面渲染,并用贝叶斯滤波及可并行近似计算区间命中概率。实验在 DTU 与 MobileBrick 上显示其重建质量和不确定性估计优于基线,同时说明 NeuS 可视为该框架特例。

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays Figure 1
2026-06-23cs.CV

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka, Paulo Eduardo de Aguiar Kuriki, Felipe Campos Kitamura

Department of Radiology, Stanford University School of Medicine, University of Texas Southwestern Medical Center (UTSW)

2026-06-23视觉语言视觉感知规划控制

这篇论文针对医学视觉语言模型在胸片肺炎判断中受提示与阈值影响较大的问题,考察无需微调的推理时激活转向是否能作为操作点控制手段。作者用CAA构造文本、图像条件和答案偏置向量,并加入阈值校准与反向/随机控制,指出固定阈值F1提升并不等同诊断改进;主要有效结果集中在NV-Reason-CXR-3B,校准F1由0.7692升至最高0.8727,其他模型增益有限或置信区间不稳。

From Uncertainty to Stability and Fidelity: Guiding Sparse-View 3D Gaussian Splatting with Fisher Information Figure 1
2026-06-23cs.CV

From Uncertainty to Stability and Fidelity: Guiding Sparse-View 3D Gaussian Splatting with Fisher Information

Junbao Zhou, Qingshan Xu, Yuan Zhou, Xiaolong Shen, Beier Zhu, Kesen Zhao, Yiming Zeng, Chen Bai, Cheng Lu, Hanwang Zhang

2026-06-23三维安全鲁棒

针对稀疏视角下 3D Gaussian Splatting 易过拟合、深度增强和 Dropout 依赖随机策略导致优化不稳定的问题,本文用 Fisher Information 为训练过程提供定量指导:一方面主动选择信息量更高的支撑视角生成更可靠的伪真值,另一方面按每个 Gaussian 的不确定性自适应调整 dropout 概率并引入 soft-scale dropout。实验在 LLFF、Mip-NeRF 360、DTU 等基准上报告达到稀疏视角新视角合成的 SOTA,并显示 PSNR 方差下降、平均质量提升。

NeoLoc-68: End-to-end 68-point neonatal facial landmark localisation in neonatal clinical environments Figure 1
2026-06-23cs.CV

NeoLoc-68: End-to-end 68-point neonatal facial landmark localisation in neonatal clinical environments

Abdullah Bin-Obaid, Maria M. Cobo, Rebeccah Slater, Lionel Tarassenko, Mauricio Villarroel

Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford, Oxford, United Kingdom, Department of Paediatrics, University of Oxford, Oxford, United Kingdom

2026-06-23视觉感知

面向新生儿疼痛评估等非接触监测,论文指出成人/儿童人脸关键点模型在NICU中受遮挡、姿态和模糊影响明显失效。NeoLoc-68将多源公开人脸数据统一到68点标注,并加入临床新生儿帧,以预训练新生儿人脸检测器初始化YOLO关键点回归,实现端到端全帧定位。结果显示其在公开集达到最佳总体指标,在临床集微调后检测失败率降至1.77%,但精度仍受领域差异和遮挡限制。

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling Figure 1
2026-06-23cs.CV

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling

Yixuan Lai, Tianjia Shao, Kun Zhou, Weijia Dou, Siyu Zhu, Jingdong Wang

State Key Lab of CAD&CG, Zhejiang University, Fudan University

2026-06-23视觉感知

这篇论文针对长视频多镜头生成中角色、物体和场景随镜头累积漂移的问题,提出关键洞察:观众通常以实体首次清晰出现作为“规范参考”。GroundShot不改模型、不训练新模块,而是按实体建立视觉记忆,优先生成更适合作为参考的镜头,并通过实体定位、质量筛选和参考检索来约束后续镜头。作者还提出GroundBench做实体级一致性评测,实验显示其相较现有多镜头方法提升一致性,但具体增益幅度在给定片段中未充分说明。

World Action Models: A Survey Figure 1
2026-06-23cs.RO

World Action Models: A Survey

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

National University of Singapore

2026-06-23强化学习

针对具身智能中 VLA 只做观察到动作映射、缺少对自身干预后果建模的问题,本文将 World Action Models 界定为“预测未来并服务动作”的模型族,并用生成到像素、潜空间预测、无视频生成三类设计及四轴组件分解统一整理文献。主要洞察是 WAM 不是给视频生成器加动作头,而是在未来表征丰富度与算力、延迟、动作标注成本之间取舍;领域趋势是少生成未来,但保留控制所需信息。

TriMotion: Modality-Agnostic Camera Control for Video Generation Figure 1
2026-06-23cs.CV

TriMotion: Modality-Agnostic Camera Control for Video Generation

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng

2026-06-23视觉感知规划控制

针对现有相机可控视频生成通常绑定单一输入形式、难以兼顾易用性与几何精度的问题,TriMotion 将视频、相机位姿和文本轨迹对齐到共享运动嵌入空间,并用由外参生成描述的 Motion Triplet Dataset 监督跨模态一致性;其潜空间运动一致性约束避免反复像素解码。实验显示模型在三种输入下都能更准确跟随目标相机运动,并支持顺序运动组合与跨模态插值。

UniSLAD: A Unified Framework for Structural and Logical Industrial Visual Anomaly Detection Figure 1
2026-06-23cs.CV

UniSLAD: A Unified Framework for Structural and Logical Industrial Visual Anomaly Detection

Changyi Li, Chao Yang, Yu Xiao, Kari Tammi

2026-06-23视觉感知

工业视觉检测中结构缺陷与逻辑异常常同时出现,但前者依赖局部纹理、后者需要全局关系理解,单一 CNN 或 Transformer 难以兼顾。UniSLAD 将 ResNet 与 ViT 组成双特征提取器,并在 patch 级用 Mahalanobis 变换增强记忆库、在图像级用 LUM-PMP 聚合构建分布表示,以无额外训练方式融合两类证据。在 MVTec AD 和 LOCO AD 上分别达到 99.4% 与 93.1% AUROC,消融显示各模块有效。

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception Figure 1
2026-06-23cs.CV

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

2026-06-23视觉感知强化学习

这篇论文针对自动驾驶、海事监控等空间感知中罕见场景数据稀缺导致检测器长尾失效的问题,提出 WMGen-v1:从单张参考图像中由 LVLM 抽取几何、语义和空间约束,再由 LLM 在物理常识约束下扩展场景,最后驱动扩散模型生成训练样本。实验显示其在 ROADWork、LaRS 和内部数据上优于常规合成基线,纯合成数据训练的检测器在总体指标上接近真实数据训练,但具体增益来源仍可能与生成规模和筛选策略有关。

Mirage: a Clean-Label Backdoor against LiDAR 3D Object Detection Figure 1
2026-06-23cs.CV

Mirage: a Clean-Label Backdoor against LiDAR 3D Object Detection

Ziba Parsons, Ang Li

2026-06-23视觉感知三维

面向自动驾驶/机器人中依赖 LiDAR 3D 检测的安全风险,论文指出现有后门多需改标签或白盒能力,低估了数据采集阶段的攻击面。Mirage 通过少量标签一致点云投毒,在黑盒设定下学习触发器到目标类别的关联,可将行人/骑行者定向误判为车。实验称仅 0.5% 投毒率即可达到 73% 误分类成功率,且正常检测性能接近干净模型。

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion Figure 1
2026-06-23cs.CV

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion

Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling

Labcin - Nature Inspired Computing Lab, Federal University of Espírito Santo, PPGI - Graduate Program in Computer Science, Federal University of Espírito, tection. In Brazil, recent estimates from the National Cancer Institute (INCA)

2026-06-23视觉语言

针对医学多模态癌症诊断中图像、临床/人口学数据融合常牺牲可解释性的问题,本文将视觉 Mamba 与表格 Mamba 串接进 Mixed Fusion:先由图像模型输出类别概率,再与表格特征共同判别,并可用 SHAP 解释。实验在皮肤与口腔癌数据集上显示,PAD-UFES-20 的 balanced accuracy 略低于 Transformer 基线,NDB-UFES 表现更好,召回率有明显提升,但具体增益来源仍不完全清楚。

No Figure
2026-06-23cs.CV

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation

Tengjie Lin, Yutao Sun, Jingwei Ni, Shuhan Ge, Hao-Xuan Ma, Yanting Miao, Wangyue Lu, Mingshuai Chen, Tiancheng Zhao, Jianwei Yin

Zhejiang University, Nanjing University of Science and Technology, Nanjing University, University of Waterloo, Binjiang Institute of Zhejiang University

2026-06-23数据集/基准

这篇论文针对静态 VQA 基准泄漏后分数混入记忆而非真实视觉搜索能力的问题,提出 ReKey:只在真实图像中重新生成决定答案的局部“视觉钥匙”,由人工一次标注可编辑槽位,并用生成元数据直接构造标签,以兼顾新答案、难度保持和标签可靠性。在 V*Bench 上,8 个前沿 VLM 在原题上的准确率比重生成版本高 9.5–18.8 个百分点,显示原基准存在明显污染增益。

Robust Zero-Shot Generalization for Open-Vocabulary Action Recognition via Task Arithmetic Figure 1
2026-06-23cs.CV

Robust Zero-Shot Generalization for Open-Vocabulary Action Recognition via Task Arithmetic

Francesca Morandi, Omayma Moussadek, Federico Venturini, Mauro Suardi, Alessandro Banzatti, Francesco Cannarile, Angelo Porrello, Simone Calderara

University of Modena and Reggio Emilia, University of Pisa, trained base model. Code is available at https://github.com/, and scalable approach for open-vocabulary action recogni-, available datasets [9]–[12], from which we extract the corre-, fully merge models fine-tuned on diverse, publicly available

2026-06-23视觉感知学习理论安全鲁棒

这篇论文针对开放词汇动作识别在真实场景中常需敏感域内视频微调的问题,提出不采集目标域数据,而是从多个公开数据集微调模型中提取任务向量,并用任务算术/模型合并重组已有知识。实验显示,合并后的模型在OOD零样本设置下优于预训练基线,说明参数空间聚合可带来一定鲁棒泛化,但具体增益可能受源数据多样性与缩放策略影响。

XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction Figure 1
2026-06-23cs.CV

XmoPipe: A Pipeline for Large-Scale In-the-Wild Human Motion Dataset Construction

Nathan Salazar, Emmanuel Dellandréa, Mathieu Lefort, Alexandre Meyer

2026-06-23数据集/基准

针对传统 MoCap 数据昂贵、规模和场景多样性不足的问题,XmoPipe提出从少量关键词出发自动检索公开视频、筛选分段,并用单目重建与视频语言模型生成带文本描述的SMPL-X人体/面部运动数据。其洞察在于用可定制流水线把野外视频转为可训练的伪GT运动语料,支持多人和语义丰富场景。实验显示,该数据与MoCap结合可提升重建泛化,训练MDM的文本到运动生成质量接近MoCap数据且覆盖更广动作,但增益可能主要来自scaling/data。

VTOS: Learning to Orchestrate Vision Tools by Co-Searching Solutions and Observers Figure 1
2026-06-23cs.CV

VTOS: Learning to Orchestrate Vision Tools by Co-Searching Solutions and Observers

Jinchao Ge, Lingqiao Liu, Shuwen Zhao, Lei Wang

University of Wollongong, Adelaide University, Tianjin University of Technology

2026-06-23视觉感知

这篇论文针对视觉基础工具虽强但依赖人工/固定编排、在密集目标、遮挡、小病斑和域外场景中易失效的问题,提出 VTOS:同时搜索可执行的工具调用方案和用于诊断失败的观察器,并把经验写入 VisionThoughts 知识库迭代改进。实验在 LVIS-Count 密集计数和 PlantSeg-OOD 零样本病害分割上优于静态流水线与视觉编程基线,说明主要收益来自可审计的闭环诊断与参数/流程自适应。

How Well Can Your Video Model Remember? Measuring Memory-Budget Trade-offs in Long Video Understanding Figure 1
2026-06-23cs.CV

How Well Can Your Video Model Remember? Measuring Memory-Budget Trade-offs in Long Video Understanding

Yixian Tian

Fudan University, Beijing University of Posts and Telecommunications

2026-06-23视觉感知

长视频模型在固定帧预算下常需回忆很久以前的事件,但现有评测难以区分“帧数不够”和“时间太远”的影响。本文提出用预算指数 α(D) 描述额外帧在不同时间距离上的边际价值,并在约15.5万次预测上拟合预算—距离经验律。结果显示,StreamingVLM 在1000秒回忆距离上的预算有效性约为最佳基础模型的7.4倍,10倍帧预算带来约29个百分点提升,而采样策略的收益随模型和距离变化。

D2HDMap: Non-visible Driveline Map Prior for Online Vectorized HD Map Prediction Figure 1
2026-06-23cs.CV

D2HDMap: Non-visible Driveline Map Prior for Online Vectorized HD Map Prediction

Seojun Shon, Chikao Tsuchiya, Dhaval Bhanderi, David Ilstrup, Hsinmin Cheng, Christopher Ostafew

2026-06-23视觉感知

本文针对自动驾驶中完整高精地图维护成本高、纯在线建图又易受远距感知与遮挡限制的问题,提出 D2HDMap:用轻量的非可见车道中心线/行驶线先验替代完整可见地图先验,引导车道线、边界和人行横道等矢量化预测,并通过位姿噪声训练增强定位误差鲁棒性。在 nuScenes 与 Argoverse 2 消融中,模型在缺少先验时仍能保持性能,地理分离划分上达到 44.8 mAP,超过近期方法。

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images Figure 1
2026-06-23cs.CV

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

∗ Department of Computer Science, New Jersey Institute of Technology, Newark, NJ, USA, ‡ Department of Data Science, New Jersey Institute of Technology, Newark, NJ, USA, from real patients by the collaborating medical team

2026-06-23视觉感知数据集/基准三维

慢性伤口评估依赖医生经验且管理决策差异大,本文用20例真实、此前未见的多类型伤口图像和12项临床问题,比较医学专用与通用VLM在诊断和处置推理上的可靠性。核心洞察是医学微调并未带来优势,通用前沿模型更强:ChatGPT达72.50%,Claude为62.08%,而最佳开源/医学模型HuluMed仅40.00%,提示当前系统仍不适合自主临床决策。

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation Figure 1
2026-06-23cs.GR

Multimodal Image Colorization: Quantifying the Impact of Text-Conditioned Guidance on Grayscale-to-Color Translation

Colten Reissmann, Hugo Garrido-Lestache Belinchon

2026-06-23视觉语言视觉感知

本文针对灰度图上色存在多解、难以仅凭亮度确定语义颜色的问题,做了较干净的受控消融:在 U-Net 与 Stable Diffusion 1.5 两个尺度中只改变是否加入 CLIP 文本条件。结果显示文本条件在两类模型上均提升 PSNR/SSIM 和感知质量,U-Net 色彩丰富度增益更大,说明文本主要缓解颜色歧义,且对缺少预训练视觉先验的模型更关键。

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents Figure 1
2026-06-23cs.CV

MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents

Xuelong Dai, Jianyu Ma, Boyang Ma, Biwei Yan, Yijun Yang, Yue Zhang

2026-06-23视觉感知

本文关注截图驱动的多模态网页代理在受信任网站中被第三方视觉区域诱导的风险:攻击者仅能控制广告位、商品图等局部区域。MIRAGE 的核心是将注入限制在掩码内,用扩散先验生成自然图像,并结合曲率感知引导与稀疏暗像素残差实现定向下一步动作劫持。实验在 SeeAct、OpenClaw 上显示其比现有截图或文本注入基线更隐蔽且更有效,但仍依赖白盒梯度,黑盒迁移性文中未充分说明。

CDER-SME: A Cross-Device Event-RGB Micro-Expression Dataset under Multi-Level Stress Induction Figure 1
2026-06-23cs.CV

CDER-SME: A Cross-Device Event-RGB Micro-Expression Dataset under Multi-Level Stress Induction

Jingting Li, Hui Sha, Su-Jing Wang

2026-06-23数据集/基准

微表情识别在真实高压场景中受限于RGB帧率、实验诱发不自然和跨设备标定困难。CDER-SME用认知与社交多级压力诱发自发微表情,并构建解耦Event-RGB采集、时空对齐流程和三层数据集;包含92名受试者、1963个专家标注样本,其中790对Event-RGB与210对高精度对齐样本。基线显示跨模态融合优于单模态,说明事件动态与RGB外观具有互补性。

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit Figure 1
2026-06-23cs.CV

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

Mingde Xu, Zhen Yang, Yan Wang, Yu Wang, Xijun Liu, Zijun Dou, Wenyi Hong, Xiaotao Gu, Bin Xu, Jie Tang

University of Waterloo, Tsinghua University, Beihang University

2026-06-23视觉感知

这篇论文针对 UI 视频生成可交互网页时,稀疏采样易漏掉点击、滚动等短暂动作边界,导致状态转移与代码行为不一致的问题。核心思路是把任务重定义为可执行状态转移恢复,并提出 Action-Aware Revisit:先粗看全视频定位关键动作片段,再高时间分辨率回看这些片段后生成 HTML/CSS/JS。实验表明,相比直接视频观察,Video2Code 在功能正确性和交互覆盖上更好,尤其适合多步密集交互场景。

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation Figure 1
2026-06-23cs.CV

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li

2026-06-23视觉感知

TeleStyle V2针对V1只能处理“真实内容+艺术风格”、难以应对风格化内容或真实风格且会混淆参考图顺序的问题,利用V1自蒸馏构造RnR/RnS/SnR/SnS四类内容-风格-目标三元组,并用DMD缓解SFT导致的内容一致性退化、保留通用图像编辑能力,再以VLM提示增强解决顺序混淆。实验称其风格迁移接近Gemini 3 Pro Image Preview,通用编辑与Qwen-Image-Edit-DMD相当。

GEOPHYS: The Geometry of Physical Plausibility Figure 1
2026-06-23cs.CV

GEOPHYS: The Geometry of Physical Plausibility

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

Bielefeld University, University of Oxford, Cold Spring Harbor Laboratory, Honda Research Institute EU, New York University, Flatiron Institute, Simons Foundation

2026-06-23视觉感知

这篇论文针对现有视频物理合理性检测依赖多模态大模型、视频预训练或专门训练、成本高的问题,提出无需训练的 GeoPhys:用冻结图像编码器逐帧特征轨迹的速度、曲率、加速度和预测残差等几何统计来评分。结果显示该信号与人类 EEG 中物体恒存违背反应相关,并在 LikePhys、IntPhys2 上达到 98.3%/93.3%,还可作为生成视频的 best-of-N 验证器提升 PhysicsIQ 表现且更省算力。

MotionPyramid: Hierarchical Motion Representation and Residual Interfaces Figure 1
2026-06-23cs.CV

MotionPyramid: Hierarchical Motion Representation and Residual Interfaces

Gao Zhu, Zaishuo Xia, Yubei Chen

2026-06-23视觉感知

论文动机是解决人形机器人控制中单一动作接口难以兼顾粗粒度探索效率与细粒度反馈精度的问题。MotionPyramid 从运动跟踪教师中预训练递归潜变量解码层级,将高层潜变量展开为较长运动片段、低层保留即时控制,并通过残差接口让下游策略同时使用粗上下文和细修正。实验显示粗层提升早期学习与动作平滑性,细层保持最终精度,但评估仅限少量仿真任务,统计稳定性文中未充分说明。

No Figure
2026-06-23cs.CV

Robust Image-Driven Phenotyping of Ovarian Tumor Cells using Optimized Dynamic Features in Hyperbolic Channels

Hong-Fei Li, Xi-Lin Gao, Yi-Juan Xiang, Shu-Song Huang, Yi-lin Wang, Chun-Dong Xue, Zhuo Yang, Yong-Jiang Li, Xu-Qu Hu

Cancer Hospital of Dalian University of Technology, Dalian University of Technology, Shenyang 110000, China, Faculty of Medicine, Dalian University of Technology, Dalian 116024, China, The Queen’s University of Belfast Joint College, China Medical University, Shenyang 110122, China

2026-06-23视觉感知安全鲁棒

该文针对双曲微流道中细胞动态图像特征易受流速扰动、导致分类边界混入水动力伪差的问题,提出跨流速稳定性筛选框架,从93维形态、运动和胞内光密度轨迹中选出任务相关鲁棒特征。结果显示二分类压缩为20维、癌症亚型为25维,亚型任务主成分中的流速方差占比由69.9%降至9.3%,并在多种机器学习模型和受限采样下保持诊断性能。

Beyond Templates: Revisiting Zero-Shot Remote Sensing through Meta-Prompting Figure 1
2026-06-23cs.CV

Beyond Templates: Revisiting Zero-Shot Remote Sensing through Meta-Prompting

Eirini Baltzi, Dionysis Christopoulos, Sotiris Spanos, Valsamis Ntouskos, Konstantinos Karantzalos

Remote Sensing Lab, National Technical University of Athens, Department of Engineering and Sciences, calibration · centering · retrieval · scene classification, and text-side centering, analyzing their asymmetric impact on classification and text-to-image retrieval., • Embedding calibration analysis. We study simple embedding-centering strategies and show task-dependent, effects: image centering consistently benefits classification, while text centering is more effective for retrieval.

2026-06-23视觉感知

针对遥感零样本识别中提示词对VLM表现影响大、通用模板难以描述俯视场景的问题,本文系统比较12个数据集、17种VLM和多种LLM元提示。核心洞察是,LLM生成的丰富类别描述并不稳定优于领域模板,反而可能在文本嵌入空间引入噪声;简单的查询嵌入中心化校准更可靠,图像侧中心化提升分类,文本侧中心化更利于检索,且遥感适配VLM整体优于通用模型。

AEF-Econ: Toward Plug-and-Play Socioeconomic Foundation Embeddings from AlphaEarth for Urban Remote Sensing Figure 1
2026-06-23cs.CV

AEF-Econ: Toward Plug-and-Play Socioeconomic Foundation Embeddings from AlphaEarth for Urban Remote Sensing

Shuyang Hou, Ziqi Liu, Haoyue Jiao, Lutong Xie, Yaxian Qing, Xiaopu Zhang, Qingyang Xu, Zhangyan Xu, Xuefeng Guan, Huayi Wu

*a. State Key Laboratory of Information Engineering in Surveying, Mapping, and Remote Sensing, Wuhan University, Wuhan, China, CHN-Econ, a socioeconomic benchmark with 16 labels in three categories. We conduct 31, .693, and restores collapsed labels from negative R² to a stable range. Using CAR, we infer 14.4

2026-06-23视觉感知

本文针对 AlphaEarth Foundations 偏重物理地表表征、在城市社会经济任务中即插即用能力不足的问题,融合 AEF、人口、夜光、POI、形态与跨语言文本等七类数据,构建 CHN-Econ,并指出共享重建会压制低维语义流。其 CAR 机制用分流解码和流级损失缓解容量竞争,使跨区域 R² 从 AEF 单独的 0.301 提升到 0.848,跨层级从 0.160 提升到 0.693。

Spatio-Temporal Wildfire Spread Prediction in Canada using a Video Swin-Hybrid-U-Net and Satellite Imagery Figure 1
2026-06-23cs.CV

Spatio-Temporal Wildfire Spread Prediction in Canada using a Video Swin-Hybrid-U-Net and Satellite Imagery

Maulik Srivastava, Esha Saha, Hao Wang

Faculty of Science, University of Alberta, Interdisciplinary Lab for Mathematical Ecology & Epidemiology (ILMEE), University of Alberta, Department of Mathematical and Statistical Sciences, University of Alberta

2026-06-23视觉感知

加拿大野火规模和风险上升,但既有模型常难同时适配本地生态、捕捉短时天气变化且可复现性不足。本文将三天火点、气象、土壤、地形、植被等公开遥感数据建模为视频到图像分割任务,用 Video Swin 编码器结合 U-Net 解码器学习时空依赖,预测次日火灾分布。结果显示模型能较好生成空间显式的火情图,但具体相对基线增益与误差来源文中未充分说明。

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation Figure 1
2026-06-23cs.CV

NeoJaundice-AI: Smartphone-Based Neonatal Jaundice Detection Using Dual-Input Deep Learning and Synthetic Augmentation

Rahul Patel, Nirjala Jarpula

2026-06-23视觉感知

面向印度农村新生儿黄疸筛查中抽血检测昂贵、深肤色样本不足的问题,本文提出手机端离线系统,用皮肤与巩膜双输入 EfficientNet-B0 融合 YCbCr 颜色特征,并用合成黄疸增强缓解严重病例和深肤色数据稀缺。报告四级分类准确率91.8%、临床敏感度93.5%、胆红素MAE 1.4 mg/dL,量化后8.3MB、3秒内推理;但临床前瞻验证仍文中未充分说明。

ARGUSTRACK: A Multi-View Annotation System for Multi-Object Tracking Figure 1
2026-06-23cs.CV

ARGUSTRACK: A Multi-View Annotation System for Multi-Object Tracking

Hao Vo, Duc Nguyen, Ngan Le

AICV Lab, University of Arkansas, USA

2026-06-23视觉感知

多相机多目标跟踪受限于跨视角标注成本和身份一致性维护,尤其在动物监测等仅用相机的场景中。ArgusTrack 的核心做法是把标注从单视角图像转到标定后的 BEV 平面,一次地面点标注自动投影到各相机,并结合时间传播与检测器辅助生成候选位置。肉鸡多相机试验显示,其相较传统单相机流程显著缩短标注时间,消融中从 150s 降至 113s、102s。

Shear-Free Viewport Magnification for 360-Degree via Spherical Mobius Boosts Figure 1
2026-06-23cs.CV

Shear-Free Viewport Magnification for 360-Degree via Spherical Mobius Boosts

Boyang Li, Hezhao Xu

Peking University

2026-06-23视觉感知

这篇论文针对360度图像在固定采样预算下难以同时提升视口清晰度并避免形变的问题,提出用球面Möbius boost将样本共形地集中到预测视口,核心洞察是其可放大局部但保持角度、无剪切。实验在SUN360的216个目标上显示,C1相对优化offset cubemap视口PSNR中位提升约3.26 dB,但代价是全景WS-PSNR下降,适用于预测准确的注视区域而非通用布局。

Open Annotations and Synthetic Data for Field Localisation in Indian Bank Cheques Figure 1
2026-06-23cs.CV

Open Annotations and Synthetic Data for Field Localisation in Indian Bank Cheques

Jaganadh Gopinadhan

2026-06-23视觉感知

面向印度支票自动处理中的字段定位缺少公开标注和可再分发数据的问题,论文为112张IDRBT支票补充六类字段框,并用剪贴式流程生成295张合成支票,同时给出ResNet-50直接回归基线。关键结果反而是否定性的:固定版式下,仅预测训练集平均框已达0.691 mIoU和80% IoU≥0.5准确率;控制随机种子和计算量后,合成数据相对真实数据无可测增益,提示此类文档更需要布局变化而非外观增强。

A UAV-Based Multi-Modal Vision System for Automated Sideslope Deformation Monitoring and Hazard Detection Figure 1
2026-06-23cs.CV

A UAV-Based Multi-Modal Vision System for Automated Sideslope Deformation Monitoring and Hazard Detection

Jingfeng Zhang, Yi Li, Xianchong Liang, Huan Yang

aSouth China Normal University, Foshan, Guangdong, China, capacity, the flexibility and rapid deployability of UAVs have revealed strong potential to replace labor-intensive, processing unordered 3D point clouds. RandLA-Net further improved the scalability (Hu et al., 2020) of point-cloud

2026-06-23视觉感知

针对高速公路边坡人工巡检低效、危险且难以发现植被覆盖下厘米级早期变形的问题,论文构建了无人机载 LiDAR 端到端流程:先提取地表点云,再用 RandLA-Net 做单次观测隐患筛查,并用多期网格高程差分监测变形。实地、受控形变与仿真实验显示,该流程可在植被场景获得可用地表点云、定位潜在滑坡/落石/侵蚀区域,并量化厘米级高程变化。

Beyond ROC-AUC: Operating-Point Performance Reporting for Biometric Verification Figure 1
2026-06-23cs.CV

Beyond ROC-AUC: Operating-Point Performance Reporting for Biometric Verification

Ajan Ahmed, Masudul H. Imtiaz

2026-06-23视觉感知

本文针对生物特征验证常用 ROC-AUC/EER 难以反映部署阈值的问题,强调应按 ISO/IEC 19795-1 报告低误匹配率下的 DET 曲线、固定 FMR 的 FNMR/TMR 及置信区间。作者在脸、声纹、虹膜、指纹七个预训练匹配器上验证,发现全 AUC 更高的系统在 FMR=10^-3 时可能显著更差,FaceNet 与 ArcFace 的排序甚至反转。

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation Figure 1
2026-06-23cs.RO

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

University of California, Los Angeles, 2 Nirvana Robotics, University of California, San Diego, 4 University of Utah

2026-06-23机器人视觉感知

MemoryVAM针对视频世界模型策略只看短时观测、在计数/顺序/遮挡等长程操作中无法区分相似状态的问题,引入情节记忆:用Recap-Cue模块把历史CLIP特征压缩为记忆token,并同时注入视频预测骨干和动作解码器,使“想象未来”和执行动作共享任务进度。在LIBERO-Mem上平均成功率由5%升至42.5%,真实机器人在计数、空间回忆和顺序跟踪任务上约75%–80%成功。

Democratizing and accelerating AI-driven pathology research through agentic intelligence Figure 1
2026-06-23cs.AI

Democratizing and accelerating AI-driven pathology research through agentic intelligence

Jiabo Ma, Cheng Jin, Yihui Wang, Hao Jiang, Ling Liang, Yingxue Xu, Junlin Hou, Zhengrui Guo, Zhengyu Zhang, Yifei Xia, Hongyi Wang, Fengtao Zhou, Zhe Xu, Huajun Zhou, Jiarui Ouyang, Qian Zeng, On Ki Tang, Eunhyang Park, Carolyn Glass, Ronald Cheong Kin Chan, Li Liang, Hao Chen

Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong SAR, China, Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China, Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China, Jinfeng Laboratory, Chongqing, China, Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong, Hong Kong SAR, China, Pathology Artificial Intelligence Development and Assessment Laboratory, State Key Laboratory of Translational, Oncology, The Chinese University of Hong Kong, Hong Kong SAR, China, Department of Pathology, Severance Hospital, Yonsei University College of Medicine, Seoul, South Korea, Department of Pathology, Duke University Medical Center, Durham NC, USA, Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology, Hong Kong SAR, China, Division of Life Science, Hong Kong University of Science and Technology, Hong Kong SAR, China, HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, Futian, Shenzhen, China

2026-06-23视觉感知

病理AI虽受基础模型推动,但临床专家仍难将研究设想落成可执行流程,瓶颈在多阶段管线与软件割裂。本文提出 PathLab,用智能体把自然语言目标组合为含预处理、建模、评估和解释的可验证工作流,并检查语义有效性。其在12个公开数据集、四类任务上相对专家管线达到非劣性能,用户研究显示可显著缩短生成可执行分析流程的时间。

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity Figure 1
2026-06-23cs.CV

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

University of Cambridge, University of Colorado Boulder, Carnegie Mellon University

2026-06-23视觉感知

针对多模态模型充当评审时“与人类一致”却未说明代表谁的判断这一问题,论文构建 VOIR DIRE,用中美文化配对图文与双参考人群检验文化歧义下的评审偏向。结果显示六个 MLLM 存在低分不用的正向校准地板和默认文化取向残差,人设提示只能部分校准,示例反而加深偏向,说明应分别报告不同文化池的对齐。

NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication Figure 1
2026-06-23cs.LG

NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication

Matin Fallahi, Patricia Arias-Cabarcos, Thorsten Strufe

2026-06-23视觉感知

针对 EEG 认证模型常被固定头显、通道布局和时间窗绑定、难以跨设备复用的问题,NeuroShield 用双阶段 Transformer 与时空位置编码处理变通道、变长度 EEG,并在 3 个公开数据集上预训练为身份表征模型。迁移到两个未见数据集后,微调相较基线将等错误率降低 0.44–8.06 个百分点,并能适应更长片段、新通道布局及约 10%–30% 通道缺失。

A Projection-Based Surrogate Gradient Interpretation for Neural Codec Wrappers Figure 1
2026-06-23cs.CV

A Projection-Based Surrogate Gradient Interpretation for Neural Codec Wrappers

Esteban Pesnel, Julien Le Tanou, Michael Ropert, Aline Roumy (COMPACT), Thomas Maugey (COMPACT)

2026-06-23优化算法

针对传统视频编解码器中量化、模式选择等离散步骤导致神经前后处理 wrapper 难以端到端训练的问题,本文把 SCALED 替代梯度重新解释为满足近似幂等、强度平移不变和非零压缩误差均值等性质的局部一阶线性投影,而不只是重参数化技巧。实验显示该梯度可从下采样扩展到完整前后处理训练,并在 x264、VVenC、多质量和多缩放设置下相对标准重采样取得最高约 -23.59% 与 -20.07% BD-Rate(PSNR)增益。

SPARC: A Multi-Agent System for Electrical Circuit Question Answering Figure 1
2026-06-23cs.AI

SPARC: A Multi-Agent System for Electrical Circuit Question Answering

Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia, Nishat Shawrin, Ang Chen, Amrita Roy Chowdhury

+University of Michigan, Ann Arbor, ∗Bangladesh University of Engineering and Technology, able faster design cycles, scalable verification, and, Both our datasets and code are publicly available at:, Labels:

2026-06-23视觉感知

电路图问答需要从视觉符号、拓扑连接和物理定律中推导可计算关系,普通多模态 LLM 难以保证推理可靠性。SPARC 的核心思路不是让 LLM 端到端作答,而是由多智能体拆解问题、生成并修复 SPICE 仿真程序,再用仿真日志计算答案,从而把数学推理落到可执行工具上。实验显示其准确率达 83%,相对基线最高提升 58 个百分点,并能按流水线阶段定位错误来源。

A Viscosity Semigroup Framework for Stable Image Reconstruction Figure 1
2026-06-23cs.CV

A Viscosity Semigroup Framework for Stable Image Reconstruction

Arina Oberoi

2026-06-23视觉感知三维

针对医学图像重建中纯学习逆映射缺乏扰动稳定性保证的问题,本文用黏性解与尺度空间半群框架解释“神经重建器后接非线性扩散”的混合算子,核心洞察是连续扩散阶段可由比较原理带来唯一性、非扩张和上确界范数收缩。CT间皮瘤分类实验中AUC约0.875且跨epoch波动很小,优于不稳定基线,但离散实现与性能增益来源仍文中未充分说明。

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora Figure 1
2026-06-23cs.CY

CourseBlueprint: A Structured Pipeline for Adaptive Pedagogical Video Generation Grounded in Course Corpora

Md Zabirul Islam, Md Motaleb Hossen Manik, Ge Wang

M. Z. Islam and M. M. H. Manik are with the Department of Computer, Science, Rensselaer Polytechnic Institute, Troy, NY 12180, USA (e-mail:, Rensselaer Polytechnic Institute, Troy, NY 12180, USA (e-mail:

2026-06-23视觉感知

本文针对现有文生视频系统“看起来像教学”但缺少先修顺序、学习者适配和认知参与的问题,提出 CourseBlueprint:用类型化教学契约和课程检索替代自由提示链,生成概念脚手架、风格控制、参与式讲稿,并在高置信检索时直接复用课程幻灯片。五主题消融显示,去掉参与契约会使参与分从 5.00 降至 1.20、适配分从 4.80 降至 3.40;幻灯片覆盖将匹配从 0/9 提升到 9/10。

TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index Figure 1
2026-06-23cs.RO

TIDY: Thermal Infrared Image Denoising via Wavelet Domain Entropy and Directional Stripe Index

Tai Hyoung Rhee, Dong-Guw Lee, Ayoung Kim

2026-06-23视觉感知

TIDY针对室内热红外图像低热对比下随机噪声和固定条纹会破坏机器人估计、而现有方法依赖合成噪声且难以兼顾实时性的痛点,将去噪转到小波域以分离结构与噪声,并提出小波熵和方向条纹指数作为度量与损失。文中称其基于真实成对SCaN-TIR数据训练,可约34Hz运行,在严重退化、零样本场景及热惯性里程计、单目深度等下游任务中带来一致改进。

2026-06-19

124 篇
JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising Figure 1
2026-06-19cs.CV

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang, Yu-Lun Liu

2026-06-19三维

本文针对3D视觉错觉生成中SDS优化慢、颜色过饱和,以及简单拼接导致几何接缝和语义泄漏的问题,提出训练-free的JanusMesh。核心思路是在TRELLIS三维潜空间与体素/SDF空间间交替去噪,用CLIP引导视角对齐和SDF融合保证几何连续,再用视角条件纹理合成注入不同语义。实验显示其可在3–5分钟生成双语义网格,并在几何完整性、语义可辨性和效率上优于基线。

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living Figure 1
2026-06-19cs.CV

TimeProVe: Propose, then Verify for Efficient Long Video Temporal Reasoning in Activities of Daily Living

Arkaprava Sinha, Dominick Reilly, Siddharth Krishnan, Hieu Le, Srijan Das

University of North Carolina, Charlotte

2026-06-19视觉感知三维

长时 ADL 视频问答的关键证据常只出现在少数细粒度动作片段中,直接用 VLM 全量处理成本高,而稀疏字幕又易丢失时序和手物交互线索。TimeProVe 的核心是先用轻量动作检测与 LLM 生成答案—证据候选,再仅让强 VLM 验证短片段。其在 OTB 上较最强基线提升 7.3%,同时减少 75% VLM 调用和 93% 推理成本,并在 CHARADES-STA 上具备较好泛化。

UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning Figure 1
2026-06-19cs.CV

UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning

Wenhao Chi, Arkaprava Sinha, Dominick Reilly, Hieu Le, Srijan Das

University of North Carolina at Charlotte

2026-06-19视觉感知

该文针对第一视角视频视野窄、遮挡多且难以同时利用外视角、深度、骨架和基础模型知识的问题,提出UNIEGO:先用各类教师训练同构的代理模型,再按样本选择预测正确且置信的代理进行蒸馏,并用代理参数凸组合初始化统一编码器。实验称其在动作识别、视频检索和动作分割的三个ego-exo基准上优于直接多教师蒸馏和既有方法。

Thinking in Boxes: 3D Editing in Real Images Made Easy Figure 1
2026-06-19cs.CV

Thinking in Boxes: 3D Editing in Real Images Made Easy

Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar, Vaibhav Vavilala, R. Venkatesh Babu, D.A. Forsyth, Anand Bhattad

Indian Institute of Science, Johns Hopkins University

2026-06-19视觉感知三维

针对文本或2D框难以精确表达真实图像中大幅3D位移、旋转和视角变化的问题,论文把用户编辑定义为输入/目标3D盒之间的几何变换,并用带深度线索的平面地面提供全局参照,使扩散编辑模型能统一处理物体运动、遮挡显露和相机变化。模型经合成多物体场景与少量Objectron视频两阶段训练,在真实野外照片的大幅3D编辑上优于近期方法,但相似物体造成的指代歧义和背景细微扰动仍未解决。

The Token Is a Group Element: On Lie-Algebra Attention over Matrix Lie Groups Figure 1
2026-06-19cs.LG

The Token Is a Group Element: On Lie-Algebra Attention over Matrix Lie Groups

Przemyslaw Musialski

New Jersey Institute of Technology

2026-06-19视觉感知

这篇论文针对空间推理中等变注意力依赖向量特征与外部群表示、难覆盖仿射尺度和剪切的问题,提出把 token 直接定义为矩阵李群元素,并用相对位姿的李代数对数范数作为闭式注意力分数。该构造使等变性和相对位姿一致性由群结构自动给出,无需 irrep、球谐或学习核;在 SE(2)、SO(3)、Aff(2) 序列补全中,闭式分数匹配或优于 MLP 核且参数少 50–80 倍,向量 token 基线则显著破坏不变性。

Current World Models Lack a Persistent State Core Figure 1
2026-06-19cs.CV

Current World Models Lack a Persistent State Core

Jinpeng Lu, Dexu Zhu, Haoyuan Shi, Linghan Cai, Guo Tang, Yinda Chen, Jie Cao, Duyu Tang, Yi Zhang, Yong Dai, Xiaozhu Ju

2026-06-19强化学习

本文针对现有视频世界模型只评估画质、运动和相机控制,却不检验遮挡/离视后物体状态是否继续演化的问题,提出 WRBench,将相机运动视为可观测性干预,并用人类校准的分层指标区分控制失败、再观察缺失与状态不一致。对 23 个模型、9600 段视频的评测显示,当前模型常在目标重新出现时停留在离视前状态,问题不随更大参数、更强几何先验或更好可见一致性自然解决。

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation Figure 1
2026-06-19cs.CV

SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation

Shilong Xiang, Zirui Zhang, Lijun Yu, Chengzhi Mao

Rutgers University

2026-06-19视觉感知

这篇论文针对自回归图像生成把二维图像展平成一维 token 后推理步数过多、受 memory wall 限制的问题,提出 Spatially Speculative Decoding:利用图像水平与垂直邻域同样可预测的洞察,用轻量头在连续隐空间同时草拟横向和下方 token/块,并通过验证修正。方法无需改动预训练 backbone,在 Lumina-mGPT、Janus-Pro、Emu3 上实现最高约 13.3 倍墙钟加速,同时在 DPG-Bench、GenEval 上保持生成质量。

CalTennis: Large Multi-View Tennis Video Dataset and Benchmark of Monocular-to-3D Pose Estimation Figure 1
2026-06-19cs.CV

CalTennis: Large Multi-View Tennis Video Dataset and Benchmark of Monocular-to-3D Pose Estimation

Ilona Demler, Xinran Xie, Blake Werner, Anna Szczuka, Pietro Perona

California Institute of Technology

2026-06-19视觉感知数据集/基准三维

该文瞄准单目视频到三维人体姿态在真实运动场景中缺少大规模、低成本评测的问题,构建 CalTennis:包含40名网球选手、51小时、1100万帧、2–6个同步视角的视频数据,并用多视角一致性替代昂贵 MOCAP 作为无标注评测信号。核心洞察是标准关节角指标不足以暴露实用误差,因此加入深度稳定性、脚步/足接触和体型一致性等指标。对五种现有方法的基准显示,关节角恢复相对可用,但深度、足接触和体型估计仍明显不稳定。

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation Figure 1
2026-06-19cs.CV

The FID Lottery: Quantifying Hidden Randomness in Generative-Model Evaluation

Nicolas Dufour, Alexei A. Efros, Patrick Pérez

2026-06-19生成模型数据集/基准

本文针对生成模型论文常以单次训练、单个采样种子报告 FID 的可复现性问题,把 FID 建模为训练种子与生成种子两轴上的随机变量。作者在数百个 ImageNet 条件 SiT 模型上量化方差,发现重新训练造成的 FID 波动约为重采样的 3.2 倍,主要来自初始化、数据顺序和训练噪声;增大模型或算力难以消除 1–2% 噪声底,因而建议多训练种子报告误差条,并将约 1.3% 以下差距视为不确定。

VisDom: Sparse Novel View Synthesis with Visible Domain Constraint Figure 1
2026-06-19cs.CV

VisDom: Sparse Novel View Synthesis with Visible Domain Constraint

Mariia Gladkova*, Tarun Yenamandra*, Edmond Boyer, Robert Maier, Tony Tung, Daniel Cremers

2026-06-19优化算法

稀疏视角新视图合成中,NeRF/3DGS容易因几何不适定产生漂浮物,单纯轮廓约束又会保留过大的视觉外壳。VisDom的核心洞察是只允许至少被K个视角共同可见的三维区域参与重建,用无学习参数的可见域约束收紧轮廓几何,并分别限制NeRF采样和引导高斯放置。实验显示其在三类数据和多种框架上稳定提升,4张图即可改善物体重建,并在结合GaussianObject时以约22倍更低训练成本达到或超过其效果。

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs Figure 1
2026-06-19cs.CL

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner

Technical University of Munich, Munich Center for Machine Learning, Princeton Center for Information and Technology Policy

2026-06-19视觉感知

本文关注 MLLM 在招聘、司法等高风险场景中如何被人物外观线索影响。作者提出 StylisticBias,用固定身份、单属性编辑的 2.5 万张合成脸来隔离视觉属性效应。结果显示,偏差集中在少数线索上:年龄和体型主导身份层面差异,时尚风格等自我呈现线索带来最大属性级偏移,约 15 个属性解释近 80% 变化,且财富、时尚等与外观语义对齐的判断最敏感。

SARLO-80: Worldwide Slant SAR Language Optic Dataset 80cm Figure 1
2026-06-19cs.CV

SARLO-80: Worldwide Slant SAR Language Optic Dataset 80cm

Solène Debuysère, Nicolas Trouvé, Nathan Letheule, Elise Colin, Georgia Channing

DEMR-ONERA – The French Aerospace Lab, Université Paris-Saclay, Palaiseau, France, DTIS-ONERA – The French Aerospace Lab, Université Paris-Saclay, Palaiseau, France

2026-06-19强化学习数据集/基准

该文针对现有 SAR-光学数据多依赖低分辨率、强度型 GRD 产品,难以保留相位与斜距几何的问题,构建 SARLO-80:将约2500个 Umbra VHR SLC 场景重采样到80厘米斜距网格,并配准高分辨率光学图像与三种文本描述。数据集含119,566个三模态样本,覆盖72国257地点,并提供划分、预处理和基线代码,用于跨模态检索与条件生成基准;性能增益可能主要来自数据规模与物理几何保留。

HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining Figure 1
2026-06-19cs.CV

HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining

Juncheng Ma, Jianxin Bi, Yufan Deng, Xuanran Zhai, Kewei Zhang, Ye Huang, Bo Liang, Shukai Gong, Jiankai Tu, Xiaotian Tang, Jiaxin Li, Kaiqi Chen, Duomin Wang, Yuqi Wang, Bingyi Kang, Eric Huang, Zhiyang Dou, Zhen Dong, Enze Xie, Wojciech Matusik, Tat-Seng Chua, Daquan Zhou

scalability is limited by high collection cost, acquisition difficulty, and low behavioral and environ-, mental diversity. These limitations have sparked interest in egocentric human video as a scalable, designed filtering and labeling pipeline, is not merely a viable substitute for model pretraining but, execution, respectively. This finding verifies a scalable paradigm for embodied foundation models:, amount of labeled real-robot data for action-space alignment. We hope this study encourages broader, diversity, but provides only pseudo action labels from human hand retargeting. Teleoperated robot data provides, precise action labels yet is limited in scale (∼104 public hours), costly to collect, and limited scene diversity. Middle:

2026-06-19机器人视觉感知

针对机器人预训练受限于遥操作数据成本高、规模小且场景多样性不足的问题,HumanScale系统比较第一视角人类视频与等规模真实机器人轨迹。核心洞察是,经筛选和伪动作标注的人类视频虽缺少精确机器人动作,却能提供更丰富的开放世界交互先验;在相同后训练协议下,其真实机器人动作预测验证损失降低24%,真实执行中ID/OOD成功率分别提升52.5%和90%。

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence Figure 1
2026-06-19cs.CV

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Baoliang Tian, Dingwen Zhang, Tao Wang, Kim-Hui Yap, Ziwei Liu

2026-06-19视觉感知

本文针对现有 VLM 空间推理多停留在静态单帧、难以维持连续 3D 场景状态的问题,提出 S-Agent:让 VLM 充当语义规划器,调用分层空间工具完成 2D 定位、3D 几何提升与关系/测量等聚合,并用场景记忆和智能体记忆跨视角、跨时间累积证据。实验显示该框架可训练自由提升开闭源 VLM;由其轨迹构造的 S-300K 微调出 S-Agent-8B,在多项多视图和视频空间推理基准上超过同规模基线,接近部分闭源模型。

FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining Figure 1
2026-06-19cs.CV

FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining

Jinghong Lan, Wei Cheng, Yunuo Chen, Ziqi Ye, Peng Xing, Yixiao Fang, Rui Wang, Yufeng Yang, Xuanyang Zhang, Xianfang Zeng, Difan Zou, Gang Yu, Chi Zhang

Fudan University, Westlake University, University of Hong Kong, multiple base models, artistic styles, and subject categories. 3 FreeStyle enables both style transfer and style-subject controllable image, we propose FreeStyle, a scalable dual-reference generation, paradigm for controllable visual synthesis, built upon the, this work, we propose FreeStyle, a scalable framework for, • We propose FreeStyle, a scalable dual-reference genera-

2026-06-19规划控制

FreeStyle针对双参考图像生成中内容保真、风格对齐与风格图语义泄漏难以兼顾的问题,提出从社区 LoRA 挖掘风格/内容锚点来构造大规模三元组,并用两阶段训练分别抑制注意力过度分配和高频 RoPE 位置复制导致的泄漏。实验显示其在风格相似、内容保持、审美和 VLM 验证上取得更均衡表现;但效果可能主要来自数据规模与筛选质量,跨基座泛化仍受限。

Fast Human Attention Prediction for Fixation-guided Active Perception in Autonomous Navigation Figure 1
2026-06-19cs.RO

Fast Human Attention Prediction for Fixation-guided Active Perception in Autonomous Navigation

Fatma Youssef Mohammed, Grzegorz Malczyk, Kostas Alexis

2026-06-19机器人

面向自主导航中全视野高分辨率感知成本过高的问题,论文提出用 MobileNetV3 特征提取与液态神经网络递归模块组成的 GazeLNN,自回归预测人类注视序列,并将其接入强化学习主动相机控制。模型在 MIT Low Resolution 上以 0.61 GFLOPs 达到 0.47 ScanMatch,较循环基线显著降算力和提速;实机无人机实验中,相比固定相机增加近 50% 地图体素并提升显著区域观测约 8 倍。

How Fragile Are Training-Free AI-Generated Image Detectors? A Controlled Audit of Score Direction, Preprocessing, and Compression Figure 1
2026-06-19cs.CV

How Fragile Are Training-Free AI-Generated Image Detectors? A Controlled Audit of Score Direction, Preprocessing, and Compression

Jingwen Zhou, Mingzhe Wang

2026-06-19视觉感知规划控制

本文关注免训练 AI 图像检测器在统一评测下是否可靠,动机是现有结果常被数据源、预处理和实现细节混淆。作者不提出新检测器,而是受控审计 AEROBLADE、RIGID 与 kNN 基线,发现 LPIPS 骨干可带来 0.085 AUROC 差异,分辨率策略可使单生成器结论相差最高 0.38,RIGID 分数方向还会随噪声强度反转;JPEG 格式偏差会虚高鲁棒性,简单融合也未超过最佳单项。

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology Figure 1
2026-06-19cs.CV

Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology

Yusuf Salcan (1 and 4), Simon Ging (1 and 2), Robin Schirrmeister (3), Philipp Arnold (3), Elmar Kotter (3), Behzad Bozorgtabar (2), Thomas Brox (1) ((1) Computer Vision Group, University of Freiburg, Germany, (2) Adaptive & Agentic AI (A3) Lab, Aarhus University, Denmark, (3) Department of Radiology, Medical Center -- University of Freiburg, (4) CRIION-AI Lab, Freiburg, Germany)

2026-06-19视觉语言视觉感知

针对放射科 VLM 难以把文本结论定位到 CT/MRI 图像区域、从而影响可验证性的问题,本文构建 RefRad2D:由临床报告经 LLM 清洗/翻译、TotalSegmentator 自动生成空间标签的 120 万双语 2D 图文数据,并训练 PaliGemma2 式 RadGrounder 同时做报告、VQA 与框/掩码 grounding。结果显示其在 Slake、VQA-RAD 上接近专用医学 VLM,临床数据提升开放式 VQA,且加入 grounding 不损害语言质量;但数据单中心、定位主要是解剖结构而非病灶。

PCFootprint: A Large-Scale Dataset and Benchmark for Vectorized Building Footprint Extraction from Aerial LiDAR Point Clouds Figure 1
2026-06-19cs.CV

PCFootprint: A Large-Scale Dataset and Benchmark for Vectorized Building Footprint Extraction from Aerial LiDAR Point Clouds

Haoyuan Shen, Kuihao Wang, Ruisheng Wang, Yujun Liu

2026-06-19数据集/基准三维

针对光学影像足迹提取易受遮挡、透视形变且缺少高程信息的问题,PCFootprint转向航空LiDAR点云,构建33,000个128×128瓦片、227,264个矢量建筑标注及3,000瓦片跨域测试集。论文同时评测主流方法,结果显示点云足迹提取仍受类内差异、数据不均衡和噪声显著制约,基准价值可能主要来自大规模公开数据与标准化评测。

InfantFace: Detecting infant faces in neonatal clinical environments Figure 1
2026-06-19cs.CV

InfantFace: Detecting infant faces in neonatal clinical environments

Abdullah Bin-Obaid, Maria M. Cobo, Rebeccah Slater, Lionel Tarassenko, Mauricio Villarroel

Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford, Oxford, UK, Department of Paediatrics, University of Oxford, Oxford, UK, neonatal clinical environments. We combined multiple publicly available datasets (VGGFace2, the lack of publicly available neonatal datasets. Prioritising the creation of such datasets

2026-06-19视觉感知

新生儿临床场景中遮挡、弱光和设备干扰使通用人脸检测器难以稳定服务于疼痛评估与非接触生命体征监测。InfantFace以YOLOv11m为一阶段检测框架,先用大规模公开人脸数据训练,再用113名婴儿的临床视频做领域适配,并强调标准AP评估与标注释放。结果显示未适配时在新生儿数据AP50达0.87,优于MTCNN、SCRFD、DSFD;适配后AP50升至0.96,但增益可能主要来自数据/领域微调。

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation Figure 1
2026-06-19cs.CV

Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation

Karn Tiwari, Varnith Chordia, Prathosh A P

Indian Institute of Science, Bengaluru

2026-06-19视觉语言

本文针对VLM在图像描述中依赖语言先验、生成不存在物体的问题,提出无需数据和训练的QK Product Steering:直接抑制中层注意力QK乘积的少数主导奇异模,并用仅更新query权重的闭式投影兼容GQA。实验在三种VLM上使CHAIRs平均相对下降4.0%,随机模对照几乎无效;分解分析显示幻觉信号主要集中在对称互注意通道。

On the Redundancy of Timestep Embeddings in Diffusion Models Figure 1
2026-06-19cs.LG

On the Redundancy of Timestep Embeddings in Diffusion Models

José A. Chávez

2026-06-19生成模型

本文针对扩散模型长期默认依赖时间步嵌入的问题,检验其是否真有必要。作者在 U-Net 与 DiT 中移除显式时间条件,并给出在特定分布假设下模型可从带噪输入隐式恢复噪声尺度的理论解释。CelebA 与 CIFAR-10 实验显示无时间步版本仍保持结构质量,部分 FID、精度和召回优于原模型且采样更快,但增益是否可推广到更大规模数据与复杂条件生成文中未充分说明。

FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows Figure 1
2026-06-19cs.CV

FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows

Daniel Gilo, Sven Elflein, Ido Sobol, Or Litany

University of Toronto, Vector Institute

2026-06-19生成模型

本文针对条件扩散/流模型在采样中偏离深度、边缘、几何等约束的问题,指出关键缺口是模型从未学习利用自身对齐误差。FlowBender把前向算子计算的偏差信号作为闭环反馈输入,通过二次修正预测学习非线性纠偏,并支持不可微算子的零阶版本与低成本快捷采样。实验显示其在图像翻译、JPEG修复和3D纹理生成中同时提升条件一致性与FID等真实性指标,优于监督微调、对齐损失和推理时引导。

Geometry-Aware Superpixel Graph Transformer with Metadata for Skin Lesion Classification Figure 1
2026-06-19cs.CV

Geometry-Aware Superpixel Graph Transformer with Metadata for Skin Lesion Classification

Muhammad Azeem, Tanveer Hussain, Amr Ahmed, Ardhendu Behera

2026-06-19视觉感知

本文针对皮肤镜病灶结构异质、局部区域关系难以由传统 CNN/ViT 或后期元数据融合充分建模的问题,提出 GeoMeta-GT:将冻结 CNN 特征上的 SLIC 超像素作为图节点,用距离与方向编码区域几何边,并把年龄、性别等元数据作为上下文节点参与消息传递。实验称其在四个公开基准上较现有方法取得稳定提升,但摘要未给出具体幅度,增益来源仍需结合消融细节判断。

Reliability-Aware Prototype Calibration for Frozen Pose-Flow Video Anomaly Detection Figure 1
2026-06-19cs.CV

Reliability-Aware Prototype Calibration for Frozen Pose-Flow Video Anomaly Detection

Ning Dong, Yingna Su, Xin Dong, Ziyun Jiao, Xinnian Guo, Zhuangzhuang Pan

School of Information Engineering, Suqian University, School of Electronic & Information Engineering, Nanjing University of Information, School of Computer Science and Engineering, University of Electronic Science, Institute for Advanced Studies

2026-06-19视觉感知生成模型三维

针对冻结 pose-flow 视频异常检测中单一似然分数难以表达多模态正常行为、且易受姿态噪声影响的问题,论文提出 RPC:在冻结潜空间中引入最近正常原型偏差,并用关键点置信度仅门控该几何证据,而不把低置信度直接当异常。结果显示其在两种骨干、四个数据集的八组设置中均提升帧级 AUROC,平均增益约 2.03 个百分点,主要收益来自原型偏差。

Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models Figure 1
2026-06-19cs.CV

Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models

Haoxuan Wu, Lai Man Po, Mengyang Liu, Kun Li, Hongzheng Yang, Wei Liu

2026-06-19视觉感知生成模型

本文针对现有视频奖励模型只能在干净像素域评估、与扩散去噪过程脱节且需高成本 VAE 解码的问题,提出 PRISM:冻结视频扩散骨干,仅用轻量 Query 聚合头从噪声 latent 中解码偏好信号。核心洞察是生成骨干的时空先验本身具备评估能力,且与生成性能正相关。实验称其在偏好基准达 SOTA,并能在高噪声早期进行 Best-of-N 筛选以降低推理成本。

GEN-Guard: Correcting Generalization Failures for Deployable Federated Surgical AI Figure 1
2026-06-19cs.CV

GEN-Guard: Correcting Generalization Failures for Deployable Federated Surgical AI

Julia Alekseenko, Pietro Mascagni, AI4SafeChole Consortium, Nicolas Padoy

University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France, Bioimage Analysis Center, Fondazione Policlinico Universitario Agostino Gemelli IRCCS, Rome, Italy, Fondazione IRCCS Ca’ Granda Ospedale Maggiore Policlinico di Milano, University of Milan, Milan, Italy

2026-06-19学习理论

这篇论文针对联邦手术视频 AI 中常被忽视的部署风险:仅用参与医院验证集选模型会产生“性能泄漏”,导致未见机构泛化失败。作者提出后处理框架 GEN-Guard,用客户端阻塞评估发现模型选择失败,并用分歧感知蒸馏做特征级校正。实验覆盖胆囊切除阶段识别和结肠镜息肉分割,标准评估下失败率超过 80%,校正后内部 F1 最高提升 2 点、外部机构最高提升 3 点、最差机构提升 3–9 点。

CUPID: Reconstructing UV Texture Maps for Interpretable Person-of-Interest Deepfake Detection Figure 1
2026-06-19cs.CV

CUPID: Reconstructing UV Texture Maps for Interpretable Person-of-Interest Deepfake Detection

Giovanni Affatato, Sara Mandelli, Edoardo Daniele Cannas, Paolo Bestagini, Stefano Tubaro

This work was supported by the FOSTERER project, funded by the Italian Ministry of Education, University, and Research within the PRIN 2022 program.

2026-06-19视觉感知

针对名人等特定对象深度伪造检测难以同时兼顾鲁棒性、效率与可解释性的问题,CUPID将3D人脸重建得到的UV纹理图作为统一语义空间输入,用仅真实视频训练的MAE学习身份表征,测试时与该对象公开视频参考集比对,并可用残差图定位异常面部区域。四个数据集实验显示其多数场景优于现有方法,对压缩和降采样更稳健,推理也更快。

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection Figure 1
2026-06-19cs.CV

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

Junhao Cai, Deyu Zeng, Junhao Pang, Junyu Chen, Qiwei Liang, Xiaopin Zhong, Zongze Wu

2026-06-19视觉感知

本文针对少样本多模态异常检测中正常样本稀缺、2D/3D 模态错位和误报高的问题,提出 CMDS-AD:用 LoRA 扩散生成补充 RGB 数据,并将预训练扩散几何估计器视作非线性低通滤波器,构建低频估计流辅助真实流分离微小缺陷;再通过坐标感知层级映射和跨模态乘性打分抑制单模态噪声。在 1-shot 下,MVTec 3D-AD 的 I-AUROC/AUPRO 分别提升 5.7/2.0 个百分点,EyeCandies 提升 7.7/5.6 个百分点。

Integrating national forest inventory, airborne lidar, and satellite imagery for wall-to-wall mapping of forest structure with computer vision Figure 1
2026-06-19cs.LG

Integrating national forest inventory, airborne lidar, and satellite imagery for wall-to-wall mapping of forest structure with computer vision

Luke J. Zachmann, David D. Diaz, Vincent A. Landau, Chelsey Walden-Schreiner, Tony Chang, Nathan E. Rutenbeck, Katharyn A. Duffy, Kiarie Ndegwa, Andreas Gros, Scott Conway, Guy Bayes

2026-06-19视觉感知

面向森林经营和野火风险规划中多源数据年代、精度不一致导致的决策伪影,论文提出 VibrantForests:以国家森林清查和机载 lidar 生成训练样本,用 Sentinel-2 等卫星影像训练多任务视觉模型,在美国本土以 10 米、年度尺度联合估计冠层覆盖、高度、生物量、断面积和平均胸径。结果显示其在稀疏到高密森林条件下均能预测,并缓解被动传感模型常见的饱和与回归均值偏差;具体相对增益幅度文中片段未充分说明。

U$^2$Mamba: A Two-level Nested U-structure Mamba for Salient Object Detection Figure 1
2026-06-19cs.CV

U$^2$Mamba: A Two-level Nested U-structure Mamba for Salient Object Detection

Junhui Li, Jialu Li, Youshan Zhang

2026-06-19视觉感知

针对显著目标检测中全局上下文建模与边界细节保留难以兼顾的问题,U²Mamba将Mamba状态空间机制嵌入两级嵌套U形结构,提出多尺度Mamba U块以在下采样特征上高效建模长程依赖,并用层级监督约束多尺度预测。实验显示其在多个SOD基准上达到有竞争力的效果,但具体增益与模型规模、训练设置的关系文中未充分说明。

Efficiently Linking Real Scenes with Synthetic Data Generation for AI-based Cognitive Robotics and Computer Vision Applications Figure 1
2026-06-19cs.RO

Efficiently Linking Real Scenes with Synthetic Data Generation for AI-based Cognitive Robotics and Computer Vision Applications

Paul Koch, Vivek Chavan, André Sers, Adem Karakurt, Paul Hofmann, Mohamad Zaher Ziadeh, Jörg Krüger

2026-06-19机器人视觉感知

面向认知机器人中的视觉感知、6D 位姿与抓取任务,论文指出当前模型受限于真实标注数据成本高、仿真到真实域差距和物理知识不足。核心洞察是把真实场景与仿真数据生成闭环连接,用真实场景约束合成并迭代缩小 sim2real 差距,为多模态、物理扎根的机器人模型提供训练基础。主要结果仍是趋势梳理与工作中方案,文中未充分说明定量增益。

Single-Stage Hierarchical Rectification for Weakly Supervised Histopathology Segmentation Figure 1
2026-06-19cs.CV

Single-Stage Hierarchical Rectification for Weakly Supervised Histopathology Segmentation

Duc T. Nguyen, Hoang-Long Nguyen, Thanh-Ha DO, Huy-Hieu Pham

2026-06-19视觉感知

针对病理弱监督分割中传统 CAM 生成、伪标签离线细化、再训练的多阶段流程成本高且会放大浅层纹理误检的问题,论文提出单阶段 SSHR,在前向传播中用 HFRM 以深层全局语义约束浅层特征,并结合空间同质化直接净化激活图。其在 LUAD-HistoSeg 和 BCSS 上优于多阶段方法,训练时间减少约 2–5 倍。

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs Figure 1
2026-06-19cs.CV

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng YAN

2026-06-19视觉语言

本文针对冻结视觉语言模型在图表、文档等证据密集任务中容易忽略小而局部关键视觉证据的问题,提出用答案片段熵作为测试时反馈,但指出单纯降熵会导致自信错误捷径。SPOT-E通过低熵锚点约束和问题条件视觉聚光模块,在每个样本上用GRPO轻量优化聚光LoRA,既降低不确定性又保持基线高置信token稳定。实验显示其在多类开源/闭源VLM和多基准上带来一致提升,并增强视觉扰动鲁棒性。

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models Figure 1
2026-06-19cs.CV

BAFIS: Dataset + Framework to assess occupational Bias and Human Preference in modern Text-to-image Models

Thomas Klassert, Adrian Ulges, Biying Fu

RheinMain University of Applied Sciences, Wiesbaden, Germany

2026-06-19视觉感知数据集/基准

该文关注文本到图像模型在职业人物生成中延续性别、族裔偏见的问题,尤其考察语言提示如何放大或改变偏差。作者提出 BAFIS 静态对战平台,并构建 2.1 万张德英职业提示合成图像,将自动指标、人类偏好和德国就业统计对齐比较。结果显示五个主流模型均存在系统性偏差,自动指标只与主观评价部分相关,说明公平性评估需要纳入人类感知反馈。

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models Figure 1
2026-06-19cs.CV

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

City University of Hong Kong

2026-06-19视觉感知

这篇论文针对绿幕角色合成中前景与新环境缺乏物理接触、遮挡响应和光照一致性的问题,将任务重构为角色到环境的物理交互与环境到角色的光照协调。方法用三重掩码、RGB-D联合去噪和参考条件视频扩散统一处理背景生成、道具保留/替换/生成及重光照,并用生成先验构建多光照训练对。实验显示其在美学、前景/背景相似度等指标和消融中优于VACE、级联重光照等基线,但部分增益可能主要来自数据构造与扩散模型能力。

DeepForestVisionV2: Ecology-Driven Taxonomy Expansion for Camera-Trap Monitoring in African Tropical Forests Figure 1
2026-06-19cs.CV

DeepForestVisionV2: Ecology-Driven Taxonomy Expansion for Camera-Trap Monitoring in African Tropical Forests

Hugo Magaldi, Theau d'Audiffret, Etienne Francois Akomo-Okoue, Bala Amarasekaran, Naomi Anderson, Claire Auger, Noemie Cappelle, Daniel Cornelis, Raphael Cornette, Tobias Deschner, Gabriel Dubus, Davy Fonteyn, Rosa M. Garriga, Jennifer Hatlauf, Innocent Kasekendi, Raymond Katumba, Aram Kazandjian, Alfred Ngomanda, Stephan Ntie, Simone Pika, Xavier Rufray, Harold Rugonge, John Justice Tibesigwa, Peter van Lunteren, Hadrien Vanthomme, Joeri A. Zwerts, Sabrina Krief

2026-06-19视觉感知

针对非洲热带森林相机陷阱从闭冠林地扩展到河岸、空旷地和公园边缘后,原 DeepForestVision 35 类标签过粗的问题,本文按垂直分层、开放场景和人类活动界面扩展到 64 类,并保持离线照片/视频工作流。模型用多国大规模数据训练,在跨国验证集达 0.86 准确率、0.82 macro-F1;在乌干达视频基准中保持或提升准确率,增加可识别类群,并将边缘场景误报从 11 降至 0。

Evaluation of Image Matching for Art Skills Assessment Figure 1
2026-06-19cs.CV

Evaluation of Image Matching for Art Skills Assessment

Asaad Alghamdi, Michael Poor, Trung-Nghia Le, Tam V. Nguyen

2026-06-19视觉感知数据集/基准

这篇论文针对绘画技能评估依赖人工主观打分、流程繁琐的问题,将手绘稿与模板图像做视觉匹配,比较传统 SIFT 关键点与基于 VGG16 的 Siamese 网络相似度评估。其主要洞察是,在小规模卡通模板与120名参与者草图数据上,局部关键点匹配反而比深度匹配更适合区分绘画水平;但数据规模、专家评分细节和泛化能力文中未充分说明。

Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation Figure 1
2026-06-19cs.CV

Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon, Kuk-Jin Yoon

2026-06-19数据集/基准

这篇论文针对持续测试时自适应中无法保留源数据、长期在线更新易累积伪标签错误并遗忘源知识的问题,提出 DO-ALL:部署前用数据集蒸馏生成少量源域合成锚点,部署时按语义匹配为目标样本提供回放、表征对齐和平滑正则。其作为即插即用稳定层可接入多种 CTTA 方法,在 CIFAR100-C、ImageNet-C 和 CCC 上提升长期鲁棒性;增益与蒸馏锚点质量相关。

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-trainin Figure 1
2026-06-19cs.CV

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-trainin

Maciej Wozniak, Jesper Ericsson, Hariprasath Govindarajan, Truls Nyberg, Thomas Gustafsson, Patric Jensfelt, Olov Andersson

2026-06-19生成模型

HilDA针对自动驾驶LiDAR预训练中标注不足、现有相机到LiDAR蒸馏只对齐VFM最终层且缺少时序几何约束的问题,提出分层蒸馏:利用多层特征和CLS全局语义指导3D骨干,并加入时间占据扩散任务强化运动与空间一致性。实验显示其在跨模态蒸馏、3D检测、场景流和语义占据预测上优于既有蒸馏方法,消融也表明扩散与分层蒸馏存在互补增益。

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs Figure 1
2026-06-19cs.CV

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

2026-06-19视觉感知

这篇论文针对遥感多模态大模型在“没有、非、未覆盖”等否定表达上易误判的问题,构建了首个遥感否定理解基准 RS-Neg,覆盖 VQA、选择题、定位和场景分类等 2.2 万余样本,并用 LLM 生成否定查询、动态视觉聚焦验证缺失概念。实验显示现有遥感 MLLM 在否定条件下明显退化且易幻觉;其 NeFo 测试时学习方法仅用少量无标注测试样本和约 250 万可训练参数,就能显著提升多模型表现并泛化到未见任务。

ARTEMIS: Agent-guided Reliability-aware Temporal Mask Evolution for Imperfectly Supervised Video Polyp Segmentation Figure 1
2026-06-19cs.CV

ARTEMIS: Agent-guided Reliability-aware Temporal Mask Evolution for Imperfectly Supervised Video Polyp Segmentation

Tong Wang, Siwen Wang, Yaolei Qi, Jinxing Zhou, Yuting He, Guanyu Yang, Yutong Xie

2026-06-19视觉感知

本文针对结肠镜视频息肉分割中密集标注昂贵、点/涂鸦或少量帧标注易导致伪标签漏边界、时序漂移和噪声监督的问题,提出 ARTEMIS:先用 SAM2 将不完整监督补成粗掩码,再由辩论-裁决式视觉语言 agent 选择可靠时序锚点并双向传播,最后通过可靠性引导参考选择、RPTM 和鲁棒损失训练分割器。实验在 SUN-SEG 与 CVC-ClinicDB-612 的弱监督和半监督设置下报告达到 SOTA。

NAMESAKES: Probing Identity Memorization in Text-to-Image Models Figure 1
2026-06-19cs.CV

NAMESAKES: Probing Identity Memorization in Text-to-Image Models

Morris Alper, Vasudha Varadarajan, Moran Yanuka, Angelina Wang, Hadar Averbuch-Elor

Carnegie Mellon University, Tel Aviv University, Cornell University

2026-06-19视觉感知

本文关注文本到图像模型在输入人名时可能复现真实人物长相带来的隐私审计问题。核心创新是提出无需参考照片、训练数据或白盒访问的黑盒行为探针,并构建含1269名维基公众人物、名气梯度和扰动姓名的Namesakes基准。实验显示该探针能较好预测身份记忆并区分真实记忆姓名与未识别/伪造姓名,同时揭示不同T2I模型家族的记忆范围差异。

HEad and neCK TumOR (HECKTOR) 2025: Benchmark of Segmentation, Diagnosis, and Prognosis in Multimodal PET/CT Figure 1
2026-06-19cs.CV

HEad and neCK TumOR (HECKTOR) 2025: Benchmark of Segmentation, Diagnosis, and Prognosis in Multimodal PET/CT

Numan Saeed, Salma Hassan, Shahad Hardan, Lishan Cai, Xinglong Liang, Moona Mazher, Abdul Qayyum, Yansong Bu, Mengye Lyu, Yue Lin, Mingyuan Meng, Chuanyi Huang, Lisheng Wang, Dalal Chamseddine, Shamimeh Ahrari, Beining Wu, Yifei Chen, Fuyou Mao, Hao Zhang, Baixiang Zhao, Surajit Ray, Muzi Guo, Lei Xiang, Jakob Dexl, Michael Ingrisch, Adrien Depeursinge, Arman Rahmim, Mathieu Hatt, Vincent Andrearczyk, Mohammad Yaqub

2026-06-19视觉语言视觉感知数据集/基准

头颈癌 PET/CT 中肿瘤勾画耗时且主观,复发风险和 HPV 状态也难从影像稳定预测。HECKTOR 2025 将 10 个中心 1100 余例 PET/CT、临床变量与电子病历整合为多任务基准,同时评估原发灶/淋巴结分割、RFS 预测和 HPV 分类。15 个最终提交中,最佳结果约为分割 Dice 0.75、预后 C-index 0.66、HPV 平衡准确率 0.56,显示分割较成熟,而预后与分子诊断仍受限,增益可能主要来自 scaling / data。

SA-VIS: Sparse frame Annotations for training Video Instance Segmentation Figure 1
2026-06-19cs.CV

SA-VIS: Sparse frame Annotations for training Video Instance Segmentation

Edoardo Mello Rella, Ajad Chhatkuli, Shipra Jain, Ender Konukoglu, Luc Van Gool

2026-06-19视觉感知

SA-VIS针对视频实例分割训练依赖密集逐帧标注、计算和显存成本高的问题,提出用未标注历史帧的低维编码特征做Past-frames Feature Propagation,并结合帧特定实例查询,让在线模型在稀疏标注下仍学习时序关联与更准掩码。实验在YouTube-VIS 2019/2021/2022和OVIS上优于基线,在仅用1/5帧标注时相比密集训练仅下降0.4%,有限标注场景AP超过既有方法1%以上。

TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields Figure 1
2026-06-19cs.CV

TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields

Haoxuan Li, Ziya Erkoç, Daniele Sirigatti, Vladislav Rosov, Lei Li, Angela Dai, Matthias Nießner

2026-06-19生成模型三维

针对隐式3D生成或扫描结果通常需经Marching Cubes得到过密、杂乱网格,而自回归网格生成又慢且易累积错误的问题,TriFlow将三角网格拓扑改写为表面上的最近顶点向量场,并用条件潜在流匹配生成该场,再结合watershed聚类与约束QEM抽取紧凑、类艺术家拓扑。实验显示其相较学习式基线泛化更稳,Chamfer Distance降低约90%,单样本推理约8倍加速。

SAM3 Self-Distillation for Fine-Grained GOOSE 2D Semantic Segmentation Figure 1
2026-06-19cs.CV

SAM3 Self-Distillation for Fine-Grained GOOSE 2D Semantic Segmentation

Xuesong Wang

X. Wang conducted this work at Wayne State University

2026-06-19视觉感知

面向越野地面机器人在 GOOSE 细粒度语义分割中长尾类别、相近植被/地形类别和跨平台成像差异带来的感知难题,论文以 SAM3 图像编码器加轻量 FPN 解码器为主干,提出用带真值框提示的 SAM3 仅在其优于学生模型的 22 类上做自蒸馏,并用图像级多尺度测试增强绕过固定输入限制;最终在 ICRA 2026 GOOSE 2D 测试集上取得 69.73% composite mIoU、排名第 4,最大增益主要来自强光度扰动而非蒸馏本身。

When Calibration Fails the Vulnerable Hospital: Federated Conformal Risk Control via Risk-Curve Shrinkage Figure 1
2026-06-19cs.LG

When Calibration Fails the Vulnerable Hospital: Federated Conformal Risk Control via Risk-Curve Shrinkage

Nafis Fuad Shahid

2026-06-19规划控制安全鲁棒

这篇论文关注联邦医疗分割中“平均校准掩盖弱势医院失效”的风险:简单汇总各医院校准数据虽满足边际 CRC 保证,却会让部分机构漏检率超标。作者提出只上传每站点经验风险曲线、再做风险曲线 shrinkage 的联邦 CRC,为站点级阈值提供覆盖率与预测集大小的折中。FeTS-2022 上,朴素 pooled CRC 有 8/20 医院违规、最差 FNR 0.178;局部 CRC 虽稳但预测集膨胀 83 倍;所提方法在 LOSO 选取 n0=19 时约 2.7/20 违规且 stretch 降至 2.0 倍。

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation Figure 1
2026-06-19cs.CV

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

Zhenkai Zhang, Markus Hiller, Krista A. Ehinger, Tom Drummond

School of Computing and Information Systems, The University of Melbourne

2026-06-19生成模型三维

针对高分辨率3D CT生成中计算开销大、全局结构与局部细节难兼顾的问题,论文提出PRDiT:先用MLP局部去噪器从重叠3D块估计低频结构,再用带高效注意力的全局残差DiT建模高频残差,并复用低分辨率预训练骨干扩展到更高分辨率。实验在LIDC-IDRI和RAD-ChestCT上较HA-GAN、3D LDM、WDM-3D降低3D FID、MMD和Wasserstein距离,但具体增益中scaling与数据因素占比仍不清。

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model Figure 1
2026-06-19cs.CV

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

Yuhwan Jeong, Hyeonseong Kim, Daehyun We, Seonkyu Song, Jinnyeong Yang, Hyun-Kurl Jang, Youngho Yoon, Kuk-Jin Yoon

Equal contribution.KAIST, Visual Intelligence Lab, KAIST, Visual Intelligence Lab

2026-06-19生成模型

面向自动驾驶长尾场景数据稀缺与现有扩散生成方法微调后削弱文本对齐的问题,FrozenDrive主张冻结预训练扩散骨干、不引入额外参数,通过多视角膨胀自注意力和时间参考自注意力在单次生成中保持跨相机与时序一致,并用面向稀有目标的约束提升物体保真度。实验称其可零样本文本生成雨夜、雪天等少见组合,在nuScenes上优于既有生成基线,并使UniAD等下游模型在夜间和雨天更鲁棒。

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors Figure 1
2026-06-19cs.CV

EFIQA: Explainable Fundus Image Quality Assessment via Anatomical Priors

Pengwei Wang, José Morano, Qian Wan, Hrvoje Bogunović

2026-06-19视觉感知

本文针对眼底图像质量评估依赖数据集标签、跨标准泛化差且缺少局部解释的问题,提出用解剖先验定义质量:通过血管遮挡补全学习“应当可见的结构”,再蒸馏到冻结基础模型特征上生成质量热图。外部数据集实验显示,该无质量标签方法在不同评判标准下优于监督基线,并能定位退化区域。

Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration Figure 1
2026-06-19cs.CV

Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration

Kyoleen Kwak, Daeho Kim, Jeong Woon Lee, Hyoseok Hwang

2026-06-19三维

这篇论文针对无靶 LiDAR-相机外参标定中 3DGS 代理几何会被光度重建目标“拉偏”的问题,提出 GeoP-Calib:用多视角 LiDAR 聚合形成稠密深度锚定,并通过体积软掩码处理遮挡,同时阻断光度梯度更新高斯位置与协方差。其核心洞察是标定更依赖度量几何保真而非渲染质量;在 KITTI odometry 和 KITTI-360 上相较现有无靶方法取得更高标定精度,平移估计提升尤为明显。

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization Figure 1
2026-06-19cs.CV

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

Qian Liang, Xiaomin Li, Ying Zhang, Jia Xu, Lihao Ni, Hongrui Li, Jingjing Li, Jing Lyu, Chen Li

University of Electronic Science and Technology of China, Dalian University of Technology

2026-06-19视觉感知优化算法数据集/基准

针对现有文生图基准多偏英语、评测维度粗或场景单一,WeGenBench构建了中英各2000条、带宏观场景与多维标签的诊断式提示集,并用VLM、OCR等从语义对齐、美学质量和视觉文字渲染三方面给出可解释评分。文中对多种主流模型做系统评测,显示该基准能定位模型在双语文字、复杂语义和特定子类上的短板,但具体优化增益来源仍需后续模型改进实验验证。

Stitching and dimensionality effects on large artificially generated volume datasets Figure 1
2026-06-19cs.CV

Stitching and dimensionality effects on large artificially generated volume datasets

Lucas von Chamier, Jan Philipp Albrecht, Dagmar Kainmüller

Max Delbrück Center for Molecular Medicine in the Helmholtz Association, University of Potsdam

2026-06-19数据集/基准

这篇论文关注大体积科学图像生成中因显存限制必须切块推理、再拼接而产生的接缝伪影问题,并比较 CycleGAN 在冷冻电镜数据上的三种拼接策略与 2D/3D patch。核心洞察是 FID 难以发现会显著损害线粒体分割的细微接缝;无伪影 3D 仅小幅优于 2D,成本收益有限,而 2D 因更大 batch 训练更稳定,三正交方向集成也只改善低质量体数据。

MakeupMirror: Improving Facial Attribute Preservation in Diffusion Models for Makeup Transfer Figure 1
2026-06-19cs.CV

MakeupMirror: Improving Facial Attribute Preservation in Diffusion Models for Makeup Transfer

Nefeli Andreou, Angel Martínez-González, Sabine Sternig, Matthieu Guillaumin, Epameinondas Antonakos, Michael Opitz

2026-06-19生成模型

本文针对扩散式妆容迁移在虚拟试妆中常改变身份特征和肤色的问题,提出 MakeupMirror:在 Stable-Makeup 上加入深度与边缘 ControlNet 约束面部几何,按皮肤、眼唇区域调节迁移强度,并依据源/参考肤色差自适应抑制肤色漂移,同时用 LM Langevin 采样加速。实验显示相对人脸相似度提升 60%,肤色差降低 50%,延迟约 0.7 秒,专家通过率 94%。

EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies Figure 1
2026-06-19cs.CV

EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies

Ganlin Yang, Zhangzheng Tu, Yuqiang Yang, Sitong Mao, Junyi Dong, Tianxing Chen, Jiaqi Peng, Jing Xiong, Jiafei Cao, Jifeng Dai, Wengang Zhou, Yao Mu, Tai Wang

University of Science and Technology of China, Shanghai AI Laboratory, Shanghai Jiao Tong University, Dalian University of Technology, Huawei Technologies Co., Ltd., The University of Hong Kong, Tsinghua University, Peking University

2026-06-19视觉语言视觉感知

长时程机器人操作中,关键线索常在交互后被遮挡,传统 VLA 的马尔可夫假设和粗放历史缓存都会失效或带来冗余。EventVLA 的核心洞察是只保留稀疏视觉证据:用初始帧与短期窗口作基础锚点,并通过 KEM 从策略隐表示预测未来关键帧,主动写入转瞬即逝的事件记忆。实验在 17 个仿真记忆任务和 4 个真实双臂任务上较现有记忆 VLA 平均提升约 40%,并提出 RoboTwin-MeM 检验非马尔可夫记忆能力。

Holo-World: Unified Camera, Object and Weather Control for Video World Model Figure 1
2026-06-19cs.CV

Holo-World: Unified Camera, Object and Weather Control for Video World Model

Xiangchen Yin, Wenzhang Sun, Jiahui Yuan, Zijie Liu, Yinda Chen, Wei Li, Dachun Kai, Chunfeng Wang, Xiaoyan Sun

University of Science and Technology of China, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, controllable camera and object motion while allowing its environmental state to, duce Holo-World, a unified controllable video world model that jointly controls, generating dynamic and controllable worlds via structured conditions. A controllable video world, the world is in. Yet controllability in current video generation is often developed along separate, generation within the same controllable video model., The data obstacle follows from the separation of existing controllable video methods. Existing, vision. We introduce Holo-World, a unified controllable video world model that jointly controls

2026-06-19视觉感知强化学习规划控制

这篇论文针对现有视频世界模型将相机、物体运动与天气状态分开控制的问题,提出从单张首帧出发的统一状态控制设定。核心做法是构建 HoloStateData,并用 UniSA 将世界保持与天气迁移拆到不同残差子空间,再用分解式 CFG 分别引导场景和天气。实验显示其在保持结构、相机与物体控制精度的同时,可生成雨雪雾云等天气,优于视频到视频天气编辑基线。

The Hidden Evolution of Disguised Visual Context inside the VLM Figure 1
2026-06-19cs.CV

The Hidden Evolution of Disguised Visual Context inside the VLM

Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Atito

2026-06-19视觉语言

这篇论文针对 VLM 中视觉 token 如何被 LLM 消化的问题,控制训练条件比较输入端 in-context 注入与中间层 layer-wise 注入。核心洞察是视觉信息进入时像“伪装上下文”,会随层深按不同范式演化并偏向不同频率特征;性能差异不仅取决于注意力分配,更取决于各层视觉表征质量,因而在单图、多图、视频及 OCR 等任务上呈现不同优势。

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers Figure 1
2026-06-19cs.CV

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

Dong Hoon Lee, Seunghoon Hong

2026-06-19生成模型

本文针对潜扩散模型中固定压缩率限制质量—算力权衡、传统可变长度 tokenizer 通过截断导致跨长度表征分布漂移的问题,提出以 token 合并调节长度,并用可学习的全局合并模式让生成时也可获得合并结构,从而增强不同 token 数下的表征对齐。实验在 ImageNet 256×256 上显示,该 tokenizer 结合扩散 Transformer 相比既有可变长度方法取得更好的 gFID—计算量权衡。

See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View Figure 1
2026-06-19cs.CV

See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View

Fanfu Xue, En Yu, Yantian Shen, Zhikun Hu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

2026-06-19机器人视觉语言视觉感知

本文针对现有 UAV-VLN 将远程搜索与末端抵达混合评测、难以诊断可见目标精确接近能力的问题,提出 UAV-VLN-FOV 任务与更严格的 10 米成功标准。核心创新是 3DG-VLN:利用高分辨率前视/下视观测保留细粒度几何信息,并在线更新目标相对 3D 方向以减少闭环导航漂移。作者构建含 2717 条轨迹的基准,实验显示成功率较竞争基线提升 13.82%,并给出真实场景试验验证其实用潜力。

FUSE: Frequency-domain Unification and Spectral Energy Alignment for Multi-modal Object Re-Identification Figure 1
2026-06-19cs.CV

FUSE: Frequency-domain Unification and Spectral Energy Alignment for Multi-modal Object Re-Identification

Xuanhao Qi, Tom H. Luan, Yukang Zhang, Jinkai Zheng, Zhou Su, Shuwei Li, Lei Tan

2026-06-19视觉感知

这篇论文针对多模态重识别中过度依赖颜色、光照等低频线索,导致跨 RGB/NIR/TIR 对齐不稳的问题,提出 FUSE 将融合转到频域:用 SDM 自适应拆分低/中/高频特征,再用 CAM 对齐各模态谱能量并保持子空间互补。实验在 RGBNT201、RGBNT100、MSVR310 上报告提升,其中 RGBNT201 mAP 提高 9.1%、Rank-1 提高 9.5%。

PU-UNet: Stable Multiplicative Interactions for Medical Image Segmentation Figure 1
2026-06-19cs.CV

PU-UNet: Stable Multiplicative Interactions for Medical Image Segmentation

Ziyuan Li, Osamah Sufyan, Uwe Jaekel, Babette Dellen

2026-06-19视觉感知

这篇论文针对 U-Net 类医学分割主要依赖加性卷积、难以显式建模纹理/边界/对比度等高阶交互的问题,提出在低分辨率语义层插入稳定 Product Unit 残差块,并用 softplus 正值映射与 log 域裁剪缓解乘性单元数值不稳定。实验在 ISIC 2018、Kvasir-SEG、BUSI 上较匹配 Residual U-Net 稳定提升 Dice/IoU,计算量和延迟几乎不变,BUSI 正常病例假阳性率降至 0。

ReA-OVCD: Reliability-Aware Open-Vocabulary Change Detection via Semantic and Spatial Refinement Figure 1
2026-06-19cs.CV

ReA-OVCD: Reliability-Aware Open-Vocabulary Change Detection via Semantic and Spatial Refinement

Hongming Zhu, Huaji Chen, Bowen Du, Sicong Liu, Qin Liu

Hongming Zhu, Huaji Chen, Bowen Du, and Qin Liu are with the School of Computer Science and Technology, Tongji University, Shanghai 200092, China, Sicong Liu is with the College of Surveying and Geo-Informatics, Tongji University, Shanghai 200092, China

2026-06-19视觉感知

针对开放词汇遥感变化检测中实例匹配难捕捉局部语义变化、像素比较又易受语义歧义和边界错位影响的问题,ReA-OVCD在无需训练的框架下先用像素语义差异生成候选变化,再通过语义变化推理和边界感知细化评估变化可靠性。实验在LEVIR-CD、WHU-CD、DSIFN、SECOND上较现有方法提升F1C约2.13%至9.75%,并报告更高计算效率。

QG-MIL: A Gated Transformer Aggregator for Domain-Agnostic Multiple Instance Learning in Medical Imaging Figure 1
2026-06-19cs.CV

QG-MIL: A Gated Transformer Aggregator for Domain-Agnostic Multiple Instance Learning in Medical Imaging

Luca Zedda, Davide Antonio Mura, Cecilia Di Ruberto, Maurizio Atzori, Muhammed Furkan Dasdelen, Carsten Marr, Andrea Loddo

Department of Mathematics and Computer Science, University of Cagliari, Cagliari, Italy, Institute of AI for Health, Helmholtz Munich, Neuherberg, Germany

2026-06-19视觉感知

针对医学影像多实例学习中注意力常集中到少数实例、导致过度自信和跨域泛化不稳的问题,QG-MIL将RMSNorm预归一化、逐头QK归一化、注意力输出门控和SwiGLU前馈集成到Transformer聚合器中,试图从结构上抑制注意力塌缩而非依赖额外正则。六个病理与血液学基准上,其最佳变体均超过主流基线,平均提升约6.1个macro F1点,并显示更分散的注意力分布。

Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory Figure 1
2026-06-19cs.RO

Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory

Jinghan Yang, Yunchao Zhang, Wang Yuan, Haolun Wan, Jiaming Zhang, Zhengyang Hu, Yanchao Yang

InfoBodied AI Lab, The University of Hong Kong

2026-06-19学习理论

这篇论文关注 VLA 机器人在分布外场景中“静默失败”且代价不可逆的问题,提出用动作熵、动作时序互信息和状态转移—动作互信息三类信息论信号刻画失败前兆,而非依赖模型内部 embedding。其核心洞察是不同失败模式会改变闭环感知—动作信息流,从而兼具可迁移性和诊断性。实验覆盖六个 VLA 与仿真/真实任务,Tri-Info 域内接近最强基线,跨模型和 sim-to-real 无需重训仍保持较高准确率,真实任务约 83%。

Vision-Reasoning-Guided Occlusion Removal from Light Fields Figure 1
2026-06-19cs.CV

Vision-Reasoning-Guided Occlusion Removal from Light Fields

Mohamed Youssef, Oliver Bimber

2026-06-19视觉感知

针对植被等严重遮挡下机器人/野外感知容易失效的问题,本文将光场多视角积分的物理可观测性与视觉语言模型的语义补全能力结合:先用 LFI 抑制前景遮挡,再以 VLM 作为条件先验恢复结构细节,并通过多样本融合降低幻觉。实验在合成与真实光场数据上取得较高 SSIM,且对结构化/非结构化采集有一定泛化,但具体增益中 VLM、融合与数据规模的相对贡献仍需进一步拆分。

CrossFlow: One-Step Generation Across Latent and Pixel Spaces Figure 1
2026-06-19cs.CV

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

Institute for Artificial Intelligence, Peking University, Fudan University

2026-06-19生成模型

本文针对潜空间扩散中“生成器预测 latent、独立解码器负责出图”带来的分布错配与弱像素监督问题,提出 CrossFlow:用潜空间轨迹定义扰动,但去掉速度预测目标,让 ViT 模型一步从噪声 latent 直接生成像素图像,并可替代 VAE 解码器。ImageNet-1k 256×256 上 CrossFlow-XL 单次函数评估达到 1.62 FID,消融显示 latent 表征及感知、对抗损失对保真度关键。

Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis Figure 1
2026-06-19cs.CV

Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis

Yucheng Xing, Ling Huang, Pei Liu, Jingying Ma, Jiaqing Xu, Kai He, Mengling Feng

2026-06-19安全鲁棒

论文针对全切片生存分析在跨医院部署时受染色、扫描仪等域偏移影响而失效的问题,提出 SAEFS:用病理 VQA 自动抽取肿瘤分级、微环境等高层语义锚点,并通过双流 MIL、主观逻辑不确定性建模和谨慎证据融合降低相关模态的过度自信。在仅用 TCGA 训练、四个外部中心零样本测试中,平均 C-index 提升约 10.2%,且校准指标同步改善。

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models Figure 1
2026-06-19cs.CV

ROSE: Benchmarking the Perception-to-Action Gap in Multimodal Models

Yihao Wang, Zijian He, Jie Ren, Keze Wang

Sun Yat-sen University, Shaanxi Normal University

2026-06-19视觉语言数据集/基准

ROSE关注多模态模型从“看懂”到“按当前任务行动”的断层:同一网格场景保持不变,只改变区域约束与符号输出,要求模型先推断多数参照物再定位异常并执行计数或坐标点击。该基准用1,512个场景和配对任务分离计数、定位、上下文选择与格式错误。九个MLLM中,人类达98.8%,但模型从计数到区域动作最高下降44.5个百分点,说明瓶颈不只是坐标 grounding,而是将共享视觉证据重新绑定到任务上下文。

Addressing Detail Bottlenecks in Latent Diffusion for RGB-to-SWIR Image Translation Figure 1
2026-06-19cs.CV

Addressing Detail Bottlenecks in Latent Diffusion for RGB-to-SWIR Image Translation

Kaili Wang, Martin Dimitrievski, Jose Maria Salvador, Ben Stoffelen, David Van Hamme, Lore Goetschalckx

2026-06-19视觉感知生成模型

这篇论文关注RGB到SWIR翻译中潜扩散虽高效却丢失小目标细节、进而影响自动驾驶感知的问题。作者将瓶颈拆为自编码器压缩和条件信号下采样,提出SCAE用源图高分辨率特征跳连辅助解码,LGE用可学习编码替代朴素下采样,且不依赖特定去噪骨干。在U-Net和DiT上,方法使检测mAP较潜扩散基线最高提升2倍,小目标最高提升3.4倍,并取得较优FID,同时指出FID与检测性能相关性弱。

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis Figure 1
2026-06-19cs.CV

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

Meixi Li, Xianlin Zhang, Yue Zhang, Xueming Li

Beijing University of Posts and Telecommunications

2026-06-19视觉感知

这篇论文面向低成本动画制作中“只有一张彩色参考图和少量关键草图”的场景,试图减少逐帧绘制与上色负担。其核心是把稀疏草图拆成空间控制与语义时序建模两路,并用带门控的交叉注意力平衡参考外观和草图结构,再用自适应损失强化关键帧线稿监督。在 Sakuga-42M Aesthetic 子集上,相比最佳基线 EDMD 降低 31.9%、FVD 降低 9.5%,显示出更好的结构贴合与时序一致性。

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA Figure 1
2026-06-19cs.CV

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

2026-06-19视觉语言

本文关注医疗视觉问答中多模态大模型“自报置信度”与真实正确率不匹配的问题,动机在于过度自信可能误导临床决策。核心做法是用MS-FBI多策略追问结合专家LLM评估,在惩罚、挑战和解释等交互中重新校准置信度。实验在三个Medical VQA数据集上使ECE平均降低约40%,但效率成本与更广泛医疗模型的泛化仍需进一步说明。

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models Figure 1
2026-06-19cs.CV

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han

2026-06-19视觉语言视觉感知生成模型

针对多模态大模型在细粒度空间推理中难以把文本查询锚定到正确图像区域的问题,Timage不改模型参数,而是用受约束 Schrödinger Bridge 将查询以可读文字叠加到图像中,并通过区域搜索与字形预算避免遮挡、保持可读性。文中报告其在 VMCBench 上以7B骨干达到87.7%平均准确率,超过GPT-4o、Qwen2-VL-72B及全量微调基线,显示输入重构可能比参数适配更有效。

DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation Figure 1
2026-06-19cs.CV

DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation

Wei Pan, Xuhan Zheng, Yilin Shi, Huiguo He, Hiuyi Cheng, Dezhi Peng, Minghui Liao, Lianwen Jin

2026-06-19生成模型

针对手写数学公式生成中二维布局复杂、长程结构依赖强且以往方法依赖符号框等昂贵位置标注的问题,DiffMath 将 LaTeX/MathML 的层级结构转化为含符号、空间关系和深度的 RelAST 三元组,并在结构保持的 MathVAE 潜空间中用 MathDiT 扩散生成,另以符号计数通过 AdaLN 提供全局约束。实验显示其在 MathWriting 上优于原始 LaTeX 与 MathML AST 条件,RelAST 达到更高 ExpRate 和更低 FID,并可用合成数据提升下游 OCR,但具体泛化边界仍需更多验证。

Triangular Consistency as a Universal Constraint for Learning Optical Flow Figure 1
2026-06-19cs.CV

Triangular Consistency as a Universal Constraint for Learning Optical Flow

Yi Xiao, Carlos Rodriguez Coronel, Jing Zhan, Haniyeh Ehsani Oskouie, Alex Wong, Dong Lao

2026-06-19生成模型优化算法

论文针对光流学习长期偏重两帧预测、未充分利用真实运动可组合性的缺口,提出“三角一致性”:两段光流复合应与首尾帧直接光流一致,并将循环一致性、视频时序链式监督和仿射增强伪标签统一到同一约束中。该方法无需改网络或额外标注,实验显示在自监督适配、无监督训练和有监督跨数据集泛化中均有提升,单轮适配最高约18.1%,监督跨域最高约23.1%。

Speeding up the annotation process in semantic segmentation industrial applications Figure 1
2026-06-19cs.CV

Speeding up the annotation process in semantic segmentation industrial applications

Marta Fernandez-Moreno, Margarita Guerrero, Rosalia Rementeria, Pablo Mesejo, Raul Moreno

ArcelorMittal Global R&D, SLab—Steel Labs, Calle Marineros 4, 33490, Avilés, Spain, Department of Computer Science and Automatic Control, National Distance Education University (UNED), Juan del Rosal 16, Madrid 28040, Spain

2026-06-19视觉感知

面向工业材料语义分割中高分辨率图像逐像素标注耗时、易出错的问题,论文将无监督分割作为专家标注前的预标注步骤,并直接比较从零标注与“算法预标注+人工修正”的时间成本。结果显示,在钢微结构数据集上标注时间由170小时降至37小时,约减少78%,同时发布82张全标注MicroSteel数据集并训练部署基准模型;但该加速幅度主要针对该冶金场景,跨领域收益文中提示需谨慎外推。

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models Figure 1
2026-06-19cs.CV

Spatial-Aware Reduction Framework: Towards Efficient and Faithful Visual State Space Models

Jindi Lv, Aoyu Li, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Qing Ye, Yueqi Duan, Wentao Feng, Jiancheng Lv

2026-06-19视觉感知

本文针对视觉 Mamba 在剪枝/合并等 token reduction 后,尤其是 VMamba 等依赖 2D selective scan 的结构化变体出现性能崩塌的问题,指出根因不是单纯 token 重要性估计不足,而是展平压缩破坏了二维网格拓扑和邻域语义。作者提出免训练插件 STORM,将压缩约束在行列空间单元和局部窗口内,保持全局布局与局部一致性;实验显示其在多种 Mamba 骨干上显著恢复精度,VMamba 上最高较既有方法提升 63.3% top-1,PlainMamba 仅下降 1.0%。

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs Figure 1
2026-06-19cs.CV

CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs

Chengwen Liu, Hao Peng, Jisheng Dang, Hong Peng, Bin Hu, Tat-Seng Chua

School of Information Science and Engineering, Lanzhou University, Lanzhou, China, School of Medical Technology, Beijing Institute of Technology, Beijing, China, School of Computing, National University of Singapore, Singapore

2026-06-19视觉感知强化学习

这篇论文针对视频多模态推理中固定推理长度奖励与模型能力变化不匹配的问题:早期可能压制探索,后期又鼓励冗长推理。CARE用通过率滑动平均估计能力,在GRPO中奖励从长链探索逐步转向简洁高效,并结合批内长度归一化与困难样本后验放大。实验显示其在多个视频理解/推理基准上提升准确率、稳定训练并减少推理token,且无需推理时额外控制器。

SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision Figure 1
2026-06-19cs.CV

SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

Jiayu Tang, Yuchen Zhou, Chao Gou

School of Intelligent Systems Engineering, Sun Yat-sen University

2026-06-19视觉感知三维

SpatialSV针对MLLM依赖2D图文训练、缺乏内生3D空间表征且外部空间工具推理开销大的问题,提出用任务导向视觉监督把视觉特征显式提升为深度图、相机位姿和点云,并以此作为可解释探针。实验显示该方法在多模型、多基准上提升空间智能,并在半监督场景中接近全量文本监督效果。

Gaussian Process Prior Variational Autoencoder for Endoscopic Videos Figure 1
2026-06-19cs.CV

Gaussian Process Prior Variational Autoencoder for Endoscopic Videos

Ivan De Boi, Xinxing Shi, Xiaoyu Jiang, Tim J.M. Jaspers, Francisco Caetano, Mauricio A. Alvarez, Fons van der Sommen, Sam Van der Jeught

Department of Electromechanics, InViLab, University of Antwerp, Antwerp, Belgium, Department of Computer Science, University of Manchester, Manchester, United Kingdom, Department of Electrical Engineering, Eindhoven University of Technology

2026-06-19视觉感知三维

针对内窥镜视频中高光、运动伪影和缺帧破坏时序连续性、进而影响三维重建与导航的问题,论文将 VAE 的独立潜变量先验替换为时间高斯过程先验,并结合内窥镜编码器与高光掩膜,实现带不确定性的缺帧/缺像素恢复。在 C3VDv2 上,最佳 GPVAE 相比匹配 VAE 平均降低重建 RMSE 21.9%、轨迹 RMSE 12.7%,但验证主要基于受控数据,临床泛化仍需进一步说明。

Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution Figure 1
2026-06-19cs.CV

Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution

Mingyu Choi, Woo Kyoung Han, Sunghoon Im, Kyong Hwan Jin

Korea University

2026-06-19视觉感知

本文针对图像超分中 Mamba/Transformer 类模型虽能建模长程依赖但计算和动态扫描较复杂、而原始 LRU 静态扫描难适应二维空间语义的问题,提出 LSM:以稳定高效的线性循环单元为骨干,引入语义调制单元用 learned prototype 做像素类别划分、LRU 转移调制和特征增强。实验显示其在相近计算复杂度下超过近期超分方法,说明主要增益来自语义驱动的静态递归增强与容量分配。

SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics Figure 1
2026-06-19cs.CV

SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics

Wentao Pan, Wuyang Li, Shengyuan Liu, Xinyu Liu, Hengyu Liu, Yixuan Yuan

The Chinese University of Hong Kong, Imperial College London

2026-06-19强化学习

面向自主手术中真实交互数据昂贵且体内探索风险高的问题,SurgVista将手术世界模型聚焦到长时域器械-组织动力学,针对接触后组织形变不一致和自回归漂移两类失效,提出基于场景点轨迹的形变一致性正则与在线残差/光度扰动的漂移适应训练,并构建SurgWorld-Bench分离评估器械运动和组织响应;实验显示其在视觉质量、时序一致性和交互保真度上优于现有方法,且预测时域越长优势越明显。

Multimodal Concept Bottleneck Models Figure 1
2026-06-19cs.CV

Multimodal Concept Bottleneck Models

Tongqing Shi, Ge Yan, Tuomas Oikarinen, Tsui-Wei Weng

2026-06-19视觉语言

针对传统概念瓶颈模型只能处理固定类别、且线性分类头可能绕过概念层造成信息泄漏的问题,本文将 CBM 扩展到 CLIP,提出图像与文本双概念瓶颈,使任意文本标签和图像都映射到同一可解释概念空间,并以概念响应相似度完成预测。实验显示其在四个基准上较既有 CBM 平均最高提升 51.26%,同时精度距黑盒模型约 5% 内。

MMD-SLAM: Structure-Enhanced Multi-Meta Gaussian Distribution-Guided Visual SLAM Figure 1
2026-06-19cs.RO

MMD-SLAM: Structure-Enhanced Multi-Meta Gaussian Distribution-Guided Visual SLAM

Fan Zhu, Ziyu Chen, Peichen Liu, Yifan Zhao, Zhisong Xu, Hui Zhu, Hongxing Zhou, Sixun Liu, Chunmao Jiang

2026-06-19三维

这篇论文针对现有 3DGS-SLAM 对室内结构先验利用不足、易导致渲染模糊和地图不一致的问题,提出 MMD-SLAM:在跟踪中融合点线特征约束位姿,在建图中用 Atlanta World 假设引导点、线、面三类 Multi-Meta Gaussian 及其演化优化。实验显示其在 ScanNet 上较 MonoGS 降低 48.56% ATE RMSE,在 Replica 上提升 5.71% PSNR。

PSCT-Net: Geometry-Aware Pediatric Skull CT Reconstruction via Differentiable Back-Projection and Attention-Guided Refinement Figure 1
2026-06-19cs.CV

PSCT-Net: Geometry-Aware Pediatric Skull CT Reconstruction via Differentiable Back-Projection and Attention-Guided Refinement

Dong Yeong Kim, Jaewon Choi, Youmin Shin, Jungyu Lee, Myeongseop Kim, Jinwook Choi, Joo Whan Kim, Young-Gon Kim

2026-06-19三维

该文针对儿童颅面诊断中 CT 辐射高、双平面 X 光又缺乏深度信息的问题,提出 PSCT-Net:用可微反投影显式注入成像几何,结合注意力引导 2D-3D 对应和 BiM-3D 建模长程体素依赖,以减少深度歧义和骨缝等细节丢失。作者还构建 982 例私有儿童颅骨数据集,并称在三个公开基准和该队列上优于扩散等方法且推理更高效。

ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference Figure 1
2026-06-19cs.CV

ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference

Yang Tan, Junlong Tong, Linan Yue, Hao Wu, Pengfei Fang, Xiaoyu Shen

Southeast University, Eastern Institute of Technology, Ningbo, Shanghai Jiao Tong University

2026-06-19视觉感知

本文针对流式 VideoLLM 在长视频中难以同时保持高吞吐和低首 token 延迟的问题,指出单独加速编码、剪枝或缓存压缩会导致瓶颈迁移。ViCoStream 将预处理、ViT 编码、token dropping 与 LLM 推理组织为分阶段流水线,并结合 chunk 执行、CUDA 重叠、有界视觉注意力和查询侧检索来限制每块计算与显存。实验显示其在单张 A100 上达到 134 FPS、TTFT 低于 50ms,精度接近全历史基线。

OTCHA: Optimal Transport-driven Confidence-aware Latent Hub Alignment for Multi-View Medical Image Classification Figure 1
2026-06-19cs.CV

OTCHA: Optimal Transport-driven Confidence-aware Latent Hub Alignment for Multi-View Medical Image Classification

Jiwoong Yang, Haejun Chung, Ikbeom Jang

2026-06-19视觉感知

该文针对多视角医学图像未配准、背景和视角特异伪影会污染直接融合特征的问题,提出 OTCHA:先用可学习 latent hub 作为跨视角中介,通过结合特征与几何代价的最优传输及 dustbin 机制筛掉低置信 token,再以置信度门控消息传递和 OTRA 损失稳定对齐。三类多视角医学数据集上相对现有融合方法取得一致提升,且参数开销较小,但仍局限于固定视角设置。

World Engine: Towards the Era of Post-Training for Autonomous Driving Figure 1
2026-06-19cs.RO

World Engine: Towards the Era of Post-Training for Autonomous Driving

Tianyu Li, Li Chen, Caojun Wang, Haochen Liu, Kashyap Chitta, Zhenjie Yang, Yuhang Lu, Naisheng Ye, Yihang Qiu, Yufei Wang, Luoxi Zou, Jiaxin Peng, Jin Pan, Zhaoyu Su, Andrei Bursuc, Shengbo Eben Li, Andreas Geiger, Peng Su, Hongyang Li

2026-06-19强化学习

针对自动驾驶长尾安全事件稀缺、仅扩大真实数据收益递减的问题,World Engine从真实日志中发现失败场景,重建高保真交互仿真并生成交通变体,用强化学习对端到端驾驶策略后训练。nuPlan闭环长尾基准上失败显著减少,收益超过单纯加倍预训练数据;在量产系统中仿真碰撞率最高降45.5%,200公里路测零接管。

Neural Events: Discrete Asynchronous Autoencoders for Event-Based Vision Figure 1
2026-06-19cs.CV

Neural Events: Discrete Asynchronous Autoencoders for Event-Based Vision

Roberto Pellerito, Daniel Gehrig, Shintaro Shiba, Davide Scaramuzza

Robotics and Perception Group, University of Zurich, University of Pennsylvania, The University of Tokyo, Keio University

2026-06-19视觉感知

事件相机原始事件时间精度高但单个语义弱,现有同步表征损失稀疏性,异步 SNN/GNN 又难扩展。论文提出离散异步编码器,将局部时空事件序列映射到可学习码本,只有码字翻转时才触发“神经事件”,并用重建与时间平滑预训练抑制冗余触发。在检测和分类中,其事件率约降至原来的 1/2,性能持平或优于多种基线,编码计算量也低于既有异步编码器。

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models Figure 1
2026-06-19cs.CV

3D-PLOT-LLM: Part-Level Object Tokens for 3D Large Language Models

Jintang Xue, Xinyu Wang, Yixing Wu, Jingwen Chen, C.-C. Jay Kuo

University of Southern California, Ohio State University

2026-06-19三维

这篇论文针对现有3D多模态大模型只能整体描述物体、难以命名和推理局部部件的问题,提出把点云patch划分为固定几何区域,并为每个区域引入可读写的<part_k>词表标记,再用MSR结合空间统计和邻接关系细化区域表示。其关键洞察是将部件理解转化为LLM词表级寻址,而非依赖分割解码器或框预测头。实验显示,在少于100万新增参数下,模型在PartVerse-QA、3DCoMPaT-GrIn和Objaverse captioning上均优于多项基线,但粒度仍受固定K槽限制,不能替代点级分割。

CSWinUNETR: Segmentation of Thin Anatomical Structures in Medical Images Figure 1
2026-06-19cs.CV

CSWinUNETR: Segmentation of Thin Anatomical Structures in Medical Images

Junho Moon, Haejun Chung, Ikbeom Jang

2026-06-19视觉感知

本文针对视网膜血管、脑血管和皱纹等细长弯曲结构易低对比、断裂和类别不平衡的问题,提出通用2D/3D分割骨干CSWinUNETR。核心思路是用带循环移位的十字条带注意力建模轴向长程依赖,再结合细节增强多尺度注意力与稀疏控制动态蛇形卷积,使特征沿弯曲轨迹聚合。四个跨眼科、神经血管和皮肤影像基准显示其优于代表性方法,且不依赖任务特定后处理或拓扑损失。

Training-Free Metrics for Synthetic Object Detection Data: A Proxy for Detector Performance Figure 1
2026-06-19cs.CV

Training-Free Metrics for Synthetic Object Detection Data: A Proxy for Detector Performance

Myeongseok Nam, Donghoon Yeo, Seungwook Kim

2026-06-19视觉感知

这篇论文关注合成数据用于目标检测时“先训练再评估”成本高的问题,指出 FID/KID/MMD 等全局特征距离忽略目标数量、尺度、类别组成等会影响检测 mAP 的元数据。作者提出无需训练的 CCDM 指标族,按图像元数据分层后同时衡量层内外观匹配与层间组成差异。在 VisDrone-DET 上,CCDM-MMD_CLIP 对五个候选训练集的排序与 YOLOv8 mAP 完全一致,Spearman 相关为 1.0,但验证范围仍限于单数据集和单检测器。

ParaScale: Scale-Calibrated Camera-Motion Transfer via a Gauge-Invariant Parallax Number Figure 1
2026-06-19cs.CV

ParaScale: Scale-Calibrated Camera-Motion Transfer via a Gauge-Invariant Parallax Number

Zijie Meng

Peking University, China

2026-06-19视觉感知

这篇论文针对参考视频相机运动迁移中的尺度失配问题:同一轨迹用于星空或桌面场景会导致运动过弱或过强。核心洞察是平移感知强度由基线与场景深度之比决定,提出尺度规不变的 Parallax Number,并用 ParaScale 在推理时按目标深度逐帧重标定平移、保留旋转。实验称其在四个尺度量级和多种生成骨干上将 PCE 较未校准迁移降低超过 3 倍,且基本不损失视觉质量。

HypOProto: Hyperbolic Ordinal Prototypes for Left Ventricular Filling Pressure Classification Figure 1
2026-06-19cs.CV

HypOProto: Hyperbolic Ordinal Prototypes for Left Ventricular Filling Pressure Classification

Victoria Wu, Nima Hashemi, Hooman Vaseli, Christina Luong, Purang Abolmaesumi, Teresa S. M. Tsang

2026-06-19视觉感知

这篇论文针对传统 LVFP 依赖多普勒 E/e′ 测量、受操作者和资源限制影响且深度模型难解释的问题,提出 HypOProto:用冻结 DINOv3 超声表征、双曲空间序数原型和 HyperPAS 损失,把接近阈值的模糊病例放在双曲根部、确定病例外移。私有大规模心超数据上,其 cine 级 bACC 达 82.57、study 级平均 F1 达 0.79,优于多数基线并保留原型可视化解释性。

Flow Map Denoisers: Traversing the Distortion-Perception Plane for Inverse Problems Figure 1
2026-06-19cs.LG

Flow Map Denoisers: Traversing the Distortion-Perception Plane for Inverse Problems

Nicolas Zilberstein, Morteza Mardani, Santiago Segarra

Rice University, NVIDIA Inc.

2026-06-19生成模型

针对图像逆问题中低失真常导致模糊、强感知质量又牺牲保真度的矛盾,论文指出 flow map 的 lookahead 参数天然对应一族“平均去噪器”,可在单个模型内连续调节 DP 权衡。作者证明高斯情形下可精确恢复最优 DP 前沿,并将其嵌入 PnP 求解器;在 CelebA、AFHQ 的修复、去模糊、超分等任务上,该方法能覆盖两端及中间操作点,部分匹配或超过专门基线。

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding Figure 1
2026-06-19cs.CV

Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding

Jianing Li, Zhou Fang, Yijiang Liu, Li Du

2026-06-19视觉语言视觉感知

该文针对现有3D视觉语言模型依赖点云/RGB-D或额外几何编码器、导致RGB场景理解复杂且割裂的问题,提出Occ-VLM:用单一2D视觉编码器从带位姿RGB图像预测语义占据,并以占据作为2D token与3D空间对齐的桥梁。核心洞察是2D预训练语义可反哺3D几何,几何占据又提升空间推理。实验显示其在多视角占据预测达SOTA,在3D VQA和稠密描述上接近显式3D输入模型。

Contour-Constrained Deformable Registration with Parameter Characterization for Head and Neck Surgical Guidance Figure 1
2026-06-19eess.IV

Contour-Constrained Deformable Registration with Parameter Characterization for Head and Neck Surgical Guidance

Qingyun Yang, Jon S. Heiselman, Ayberk Acar, Morgan J. Ringel, Michael I. Miga, Matthieu Chabanas, Michael C. Topf, Jie Ying Wu

Vanderbilt University, Department of Computer Science, 2301 Vanderbilt Pl, Nashville, United States, Vanderbilt University, Department of Biomedical Engineering, 2301 Vanderbilt Pl, Nashville, United States, Vanderbilt University Medical Center, Department of Otolaryngology-Head and Neck Surgery, 1211 Medical Center Drive, Nashville, United States

2026-06-19视觉感知

这篇论文面向头颈癌术中切缘复定位难题:切除标本会因收缩和软组织变形而难以与切除床对齐。作者在基于 Kelvinlet 的生物力学可变形配准中加入边界轮廓约束,并系统分析表面、标志点、轮廓和应变正则权重。9 个标本实验中,目标配准误差由刚性配准的 11.11 mm 降至 5.62 mm,较无轮廓约束方案也明显改善,舌部样本收益最大。

VFACamou: View-Fused Adversarial Camouflage for Environment-Adaptive Physical Evasion Figure 1
2026-06-19cs.CV

VFACamou: View-Fused Adversarial Camouflage for Environment-Adaptive Physical Evasion

Shihui Yan, Hu Liu, Junyu Shi, Zihui Zhu, Ziqi Zhou, Yufei Song, Youming Geng, Minghui Li, Shengshan Hu

State Key Laboratory of Intelligent Vehicle Safety Technology, School of Cyber Science and Engineering, Huazhong University of Science and Technology, School of Computer Science and Technology, Huazhong University of Science and Technology, School of Software Engineering, Huazhong University of Science and Technology, Hebei Energy College of Vocation And Technology

2026-06-19视觉感知

面向无人机侦察中视角、尺度、姿态与光照持续变化导致物理对抗伪装失效的问题,VFACamou将UV体渲染、扩散纹理生成、光照/主色估计与多尺度动态训练结合,在兼顾环境融合和检测规避的同时生成可穿戴纹理。文中称其在8类主流检测器和多视角物理测试中较既有方法显著降低人体检出率,并保持更自然的视觉外观。

GLARE: A Natural Language Interface for Querying Global Explanations Figure 1
2026-06-19cs.AI

GLARE: A Natural Language Interface for Querying Global Explanations

Bhavan Vasu, Rajesh Mangannavar

2026-06-19视觉感知

GLARE针对全局解释规模大、规则复杂导致用户难以定位问题的痛点,将视觉分类器的概念式局部解释整理为可查询数据库,并用微调LLM把自然语言问题映射到受模板约束的SQL,再返回统计、局部证据和可视化。实验显示,在ADE20K上微调模型结果匹配率约95%,对拼写和同义改写较正则更稳,并能零样本迁移到PASCAL VOC;但评估主要围绕查询解析,真实用户收益仍需进一步验证。

QueryGaussian: Scalable and Training-Free Open-Vocabulary 3D Instance Retrieval Figure 1
2026-06-19cs.CV

QueryGaussian: Scalable and Training-Free Open-Vocabulary 3D Instance Retrieval

Xiuyuan Zhu, Ke Lu, Zijie Yang, Chao Yue, Jian Xue, Dongming Zhang

2026-06-19三维

QueryGaussian针对大规模3DGS场景中开放词汇实例检索的内存与预处理瓶颈,避开把语义特征蒸馏进每个高斯的场景级嵌入范式,改为按查询调用预训练2D视觉模型生成掩码,并通过最大权重关联提升到3D,再用跨视角时序融合和多阶段密度聚类去噪。实验显示其精度接近现有方法,同时GPU显存降低70%以上、推理最高加速180倍,可在消费级硬件上处理千万级高斯城市场景。

One-Shot Novel View and Pose Human Image Synthesis via 3D Prior Guided Diffusion Model Figure 1
2026-06-19cs.CV

One-Shot Novel View and Pose Human Image Synthesis via 3D Prior Guided Diffusion Model

Shenjian Gong, Kangkan Wang, Shanshan Zhang, Jian Yang

aPCA Lab, Key Lab of Intelligent Perception and Systems for High-Dimensional Information of Ministry, of Education, and Jiangsu Key Lab of Image and Video Understanding for Social Security, School of, Computer Science and Engineering, Nanjing University of Science and Technology, Nanjing, 210094, bAdvanced Laser Technology Laboratory of Anhui Province, Electronic Engineering Institute, National, University of Defense Technology, and Jianghuai Advance Technology Center, Hefei 230037, China, generalization ability across datasets. The code will be made publicly available at

2026-06-19视觉感知生成模型三维

本文针对单张参考图在新视角与新姿态下合成人体时,2D姿态条件歧义、NeRF难恢复遮挡区域的问题,提出以扩散模型为生成框架,并引入SMPL驱动的3D法线图与颜色提示分别约束几何和外观,再用自重建式个性化微调增强未知人物细节。实验显示其在RenderPeople和THuman上优于既有方法,并具备更好的跨数据集泛化。

Efficient Neural Network Model Selection for Few-Class Application Datasets Figure 1
2026-06-19cs.LG

Efficient Neural Network Model Selection for Few-Class Application Datasets

Bryan Bo Cao, Abhinav Sharma, Lawrence O'Gorman, Michael Coss, Shubham Jain

Department of Computer Science, Stony Brook University, Nokia Bell Labs, Part of the rapid progress of neural network technology is due to the public availability

2026-06-19数据集/基准

针对许多实际应用只有少数类别、却常按 ImageNet/COCO 等多类基准选模型导致冗余的问题,论文提出用类别数、类内/类间相似度等数据侧属性估计分类难度,并指出“少类可区分性”会改变精度—规模关系。该指标可比反复训练测试快 6–29 倍;结合向更小尺度扩展的模型族,在移动机器人、无人机和 IoT 场景中取得相近精度下更小模型,如机器人任务中比 YOLOv5-nano 小最多 42%。

NEST: Narrative Event Structures in Time for Long Video Understanding Figure 1
2026-06-19cs.CV

NEST: Narrative Event Structures in Time for Long Video Understanding

Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker, Hani Alomari, Chia-Wei Tang, Anushka Sivakumar, Zaber Ibn Abdul Hakim, Shaurya Mallampati, Chris Thomas

Department of Computer Science, Virginia Tech

2026-06-19视觉感知

NEST针对长视频模型“能读长上下文但不懂叙事结构”的问题,构建1005部完整电影、平均约98分钟的多模态事件基准,将视觉、对白、音频中的叙事事件与时间顺序、层级组成和长程依赖关系连接起来,并设置触发检测、定位、论元抽取和关系抽取任务。结果显示现有模型在事件发现上很弱,ETD低于8%、EL低于6%、EAE低于11%,但给定事件后的关系抽取相对可做,微调后F1达44.42%。

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval Figure 1
2026-06-19cs.CV

Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval

Nguyen Cao Hoang, Hoang Bui Le, Nam Vo Hoang, Trung-Nghia Le

2026-06-19视觉感知

该文针对时尚组合图像检索中细粒度属性难识别、标注三元组稀缺和随机负样本过弱的问题,引入 LLaVA 生成颜色、纹理、款式等属性感知描述与合成三元组,并用两阶段微调结合粗对齐和硬负样本对比学习。实验在 FashionIQ 上显示组合推理和细粒度检索有所改善,但文中对具体增益来源拆分仍不够充分,可能部分来自数据扩增与负样本 scaling。

Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval Figure 1
2026-06-19cs.CV

Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval

Duc-Tho Nguyen, Hieu-Hoc Tran-Minh, Khanh-Hoa Lam, Hoang-Nhut Ly, Huu-Phuc Huynh, Thanh-Tien Tran, Trung-Nghia Le

2026-06-19视觉感知

面向大规模视频库中自然语言、视频片段、问答与时序事件检索的需求,Vortex将自适应关键帧抽取、多模态元数据生成与交互式检索整合到统一系统中,核心在于用CLIP捕获全局语义、SigLIP2补充细粒度线索,并以RRF融合排序,同时加入Rocchio反馈和多阶段时序对齐。系统在AIC’25预赛取得79.6/88(90.5%),决赛总体为Excellent,QA任务达到Outstanding。

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing Figure 1
2026-06-19cs.CV

TeleMorpher: Toward Robust Simultaneous Motion-Location Editing

Haengbok Chung

2026-06-19安全鲁棒

针对现有视频运动编辑难以同时改变人物动作与位置、且易出现闪烁和外观漂移的问题,TeleMorpher将人物与背景分离,利用可控3D/合成运动先验生成目标运动引导,并通过免训练姿态变形注入基线编辑器以缩小源目标运动差距。文中还提出基于LPIPS的背景一致性和骨架对齐指标;在野外视频、合成视频与TaiChi数据集上,定量指标和真人评测均优于对比方法。

Learning When to Denoise: Optimizing Asynchronous Schedules for Latent Diffusion Figure 1
2026-06-19cs.CV

Learning When to Denoise: Optimizing Asynchronous Schedules for Latent Diffusion

Bingshuo Qian, Xiang Cheng

Department of Electrical and Computer Engineering, Duke University, FID 2.14 at 600 epochs. Code is available at https://github.com/bsq532087/LWD.

2026-06-19生成模型

多表示扩散中,语义与纹理潜变量何时去噪会显著影响结构形成和细节恢复,手工异步调度难以适配模型与表示。本文把语义领先的时间表作为可学习对象,提出带局部时间权重校正的异步 flow matching、凸单调参数化与低开销联合探测。ImageNet 256 上,675M XL 在 AutoGuidance 下 200 epoch 达 FID 1.05,600 epoch 达 1.02,并优于更大 SFD-XXL。

BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation Figure 1
2026-06-19cs.AI

BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation

Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

Department of Biomedical Data Science, Stanford University School of Medicine, Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University, Department of Electrical Engineering, Stanford University

2026-06-19规划控制三维

本文针对3D脑MRI潜空间生成中“可重建”和“含临床语义”难以兼得的问题,提出冻结3D MAE编码器、另接线性投影与CNN解码器的双用途tokenizer,并在其嵌入上训练条件DiT。模型用3.5万例多队列MRI预训练,在23个线性探测任务中21项达到或超过现有基线,并支持六类条件生成与纵向预测;但跨队列混杂仍明显,部分增益可能来自数据规模与分布覆盖。

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering Figure 1
2026-06-19cs.IR

SAFE-Cascade: Cost-Adaptive Vision-Language Routing for Chart Question Answering

Ayush Dwivedi, Qixin Wang, Ashvi Soni, Ruoteng Wang, Han Li, Animesh Mahapatra, Neeraj Agrawal, Xintao Wu

University of Arkansas, University of Arkansas USA

2026-06-19视觉语言视觉感知安全鲁棒

这篇论文针对图表问答中“每题都调用VLM”带来的成本浪费,提出SAFE-Cascade:先用OCR与文本模型生成答案,再由随机森林路由器判断是否升级到视觉语言模型,并把证据、概率、成本和阈值暴露给用户。ChartQA测试中其准确率69.1%,与全VLM的67.7%统计上相当,同时减少26.9%的VLM调用和9.3%估算成本。

Scaling Self-Play for End-to-End Driving Figure 1
2026-06-19cs.RO

Scaling Self-Play for End-to-End Driving

Luke Rowe, Roger Girgis, Rodrigue de Schaetzen, Daphne Cornelisse, Alaap Grandhi, Felix Heide, Eugene Vinitsky, Christopher Pal, Liam Paull

NYU Tandon School of Engineering, 6 McMaster University, 7 Princeton University

2026-06-19视觉感知

针对端到端自动驾驶依赖人类日志、缺少闭环反馈而易累积误差的问题,论文提出在简化像素级仿真器 Gigapixel 中进行大规模自博弈,并用特权 RL 教师通过 self-play DAgger 蒸馏像素策略,再做轻量感知适配迁移到真实传感器。结果显示该方法无需人类轨迹监督,在 HUGSIM 和 NAVSIM-v2 上达到有竞争力表现,且性能随自博弈训练规模提升而增长。

GB-LSR: A Fast Local Spectral Image Representation with a Single Global Bandwidth for Continuous Reconstruction and Super-Resolution Figure 1
2026-06-19cs.CV

GB-LSR: A Fast Local Spectral Image Representation with a Single Global Bandwidth for Continuous Reconstruction and Super-Resolution

Max Shad, Naeem Khoshnevis

Kempner Institute for the Study of Natural, Harvard University

2026-06-19视觉感知三维

针对连续图像重建和任意尺度超分中,坐标 MLP 表达力与逐点推理成本难兼顾的问题,GB-LSR 将图像划分为局部 patch,用共享卷积特征预测截断傅里叶系数,并以单个全局可训练带宽控制所有局部谱基。结果显示,在匹配预算重建基准上较 LIIF/LTE/WIRE 提升 2.8–3.6 dB PSNR、降低 LPIPS,推理约为最慢基线 0.247 倍;超分扩展也更快,但结论严格限于其设定协议。

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception Figure 1
2026-06-19cs.CV

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

Chengzhi Mao, Xudong Lin, Wen-Sheng Chu

CONTROLLABLE AND GENERALIZABLE PERCEPTION, relevant aspects of the input, yielding more controllable and generalizable represen-, reliance on descriptive text rather than true instructions, limiting their versatility and controllability., generalizable, and controllable visual perception. More details and training data are available at our

2026-06-19视觉感知规划控制

现有视觉基础模型多生成静态特征,任务适配依赖下游大模型,容易丢失细粒度线索并产生幻觉。LIVE 的核心洞察是把语言指令直接注入视觉编码器,在推理时生成任务相关嵌入,并用 LLM 合成的图像-指令-答案三元组训练。实验显示其在 MMVP 上提升 34 分、GQA 超过更大 VLM 约 7 分,且能泛化到未见指令,但效果也可能主要受合成数据质量影响。

FrequencyFormer: A Co-Designed Sensor-to-Processor Pipeline for Frequency-Domain Vision Transformer Inference Figure 1
2026-06-19eess.IV

FrequencyFormer: A Co-Designed Sensor-to-Processor Pipeline for Frequency-Domain Vision Transformer Inference

Chengwei Zhou, Ovishake Sen, Xuming Chen, Rishith Paramasivam, Shaahin Angizi, Swarup Bhunia, Baibhab Chatterjee, Gourav Datta

Case Western Reserve University, USA, University of Florida, USA, New Jersey Institute of Technology, USA, foundation for scalable in-sensor ViT deployment., memory (CiM) fabric [13], as well as scalable neural accelerators

2026-06-19视觉感知

本文针对边缘视觉系统中 ViT 推理的传感器到处理器传输能耗与带宽瓶颈,提出在近传感器端用多尺度 DCT 将图像转为紧凑频域 token,并以 LUT 硬件和低功耗 MIPI 链路协同实现。其核心洞察是频域低频系数可保留主要视觉信息且便于固定系数硬件化;实验称数据量最高降 128×,通信能耗约降 230×,传感器侧总能耗降 2.22×,精度仅小幅下降。

Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models Figure 1
2026-06-19cs.CV

Mix-QVLA: Task-Evidence-Aware Mixed-Precision Quantization of Vision-Language-Action Models

Navin Ranjan, Andreas Savakis

Rochester Institute of Technology

2026-06-19视觉语言视觉感知

这篇论文针对VLA模型难以部署到资源受限机器人上的问题,指出仅用最终动作偏差评估量化敏感性会忽略内部任务证据是否被破坏。Mix-QVLA用全精度动作决策作锚点,在视觉、跨模态推理和动作形成等边界比较梯度加权证据图,并结合时间敏感性分配混合精度。LIBERO实验中,OpenVLA-OFT显存由15.4GB降至4.1GB,成功率96.3%接近BF16的97.1%,推理加速1.52倍。

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models Figure 1
2026-06-19cs.CV

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong

Peking University MSALab, ByteDance

2026-06-19视觉语言生成模型

这篇论文针对多区域视觉感知中自回归MLLM需逐区域、逐token生成导致延迟随区域数线性增长的问题,提出基于扩散语言模型的PerceptionDLM,通过区域感知mask嵌入、结构化注意力与并行去噪,在一次生成中同时描述多个区域。实验显示其在ParaDLC-Bench上较LLaDA-V准确率显著更高,并在密集区域场景获得约3.5倍吞吐提升。

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing? Figure 1
2026-06-19cs.CV

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

Yuyang Zhang, Wenyao Zhang, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin

2026-06-19视觉感知强化学习

论文针对视频生成式世界动作模型推理昂贵、易建模无关外观细节且长时预测误差会误导控制的问题,提出用预训练图像编辑模型替代未来视频生成:不解码目标图,而利用编辑去噪过程的 KV cache 作为紧凑的动作上下文,并接入 flow-matching 动作专家。实验显示 ImageWAM 在仿真和真实任务上优于标准 VLA 与竞争性 WAM,同时将 FLOPs 降至视频式 WAM 的 1/6、延迟降至 1/4。

LooseControlVideo: Directorial Video Control using Spatial Blocking Figure 1
2026-06-19cs.CV

LooseControlVideo: Directorial Video Control using Spatial Blocking

Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli

2026-06-19视觉感知规划控制

本文针对文本到视频中多物体轨迹、遮挡和交互难以精确导演的问题,提出用稀疏有朝向的 3D 包围盒作为电影“走位”控制,并以 DNOCS 编码尺寸、朝向和深度遮挡来微调 Wan 2.2。实验在 nuScenes、HO-3D、BEHAVE 上显示,相比 2D 框和光流等控制,轨迹误差降低约 1.2–3 倍,刚体运动一致性提升约 2 倍,遮挡准确率提升约 1.5–2 倍。

LEAP: Layer-skipping Efficiency via Adaptive Progression for Vision Transformer Distillation Figure 1
2026-06-19cs.CV

LEAP: Layer-skipping Efficiency via Adaptive Progression for Vision Transformer Distillation

Jiaqi Zhang, Ashton Lee, Anthony Wong, John Zou, Sami BuGhanem, Randall Balestriero

2026-06-19视觉感知

LEAP针对大规模ViT教师与小学生模型之间的表征能力落差,认为直接模仿最终层会导致训练不稳、收敛慢。其核心做法是把教师中间层按由浅到深作为课程目标,并用在线CKA相似度自适应决定何时跳到更深层,避免手工层匹配。实验显示ViT-S在ImageNet-100达90.1%,较基线提升12.24%,在Oxford/Paris检索分别提升3.84%和7.75%,并节省25.1%训练FLOPs与21%时间。

Scaling Generative Foundation Models for Chest Radiography with Rectified Flow Transformers Figure 1
2026-06-19cs.CV

Scaling Generative Foundation Models for Chest Radiography with Rectified Flow Transformers

Fabio De Sousa Ribeiro, Emma A.M. Stanley, Charles Jones, Tian Xia, Dominic C. Marshall, Laurent Renard Triché, Christopher V. Cosgriff, Panagiotis Dimitrakopoulos, Sotirios A. Tsaftaris, Ben Glocker

Imperial College London, Causality in Healthcare AI Hub, 3 University of Edinburgh, Department of Perioperative Medicine, CHU Clermont-Ferrand, Department of Medicine, Massachusetts General Hospital, 7 Broad Institute of MIT and Harvard

2026-06-19生成模型

针对胸片数据难共享、分布偏倚和现有生成模型在保真度、可控性及跨人群泛化上的不足,论文构建CXR7-1M数据集,并从零训练最高1.3B参数的Rectified Flow Transformer,引入临床因果图控制人口学、体位和病灶属性。RadiT XL在CheXGenBench上较既有方法显著降低FDD/KDD,专家实验称合成片与真实片难以区分,但增益可能主要来自scaling / data。

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning Figure 1
2026-06-19cs.LG

3D-DLP: Self-Supervised 3D Object-Centric Scene Representation Learning

Ellina Zhang, Madhaven Iyengar, Amir Zadeh, Chuan Li, Deepak Pathak, David Held, Tal Daniel

2026-06-19三维

面向机器人操作中3D观测高维、稀疏且难以直接用于控制的问题,3D-DLP将DLP扩展到RGB-D和彩色/占据体素,以自监督重构学习把场景分解为带3D关键点、尺度和外观的潜在粒子,并引入外观感知K-means先验与色度重构损失。实验显示其分解可解释且可编辑,在重构上优于非物体中心AE/VAE,并在MimicGen与RLBench操作任务中相对2D粒子或体素基线取得更高成功率。

3D Scene Graphs: Open Challenges and Future Directions Figure 1
2026-06-19cs.RO

3D Scene Graphs: Open Challenges and Future Directions

Dennis Rotondi, Francesco Argenziano, Sebastian Koch, Nathan Hughes, Martin Buechner, Johanna Wald, Lukas Rosenberger Schmid, Daniele Nardi, Abhinav Valada, Liam Paull, Federico Tombari, Luca Carlone, Kai O. Arras

University of Stuttgart, Sapienza University of Rome, University of Freiburg, University of Montreal, be exhaustive and included all available relevant works in, ric grounding, and scalability to large scenes. Subsequently

2026-06-19三维

面向机器人在真实三维环境中同时需要几何精度、语义理解和可查询记忆的问题,本文系统梳理3D场景图这一表示。核心洞察是用统一定义连接节点/边属性、层级、动态性与可供性,并比较从传感数据构建、下游规划/导航/操作应用及评测协议。主要结果是指出领域仍被术语、管线和基准割裂,现有指标难以反映任务级表现,并发布持续更新的3DSG论文检索网站。

Full-Self Diagnostics (FSD): Physics-Grounded Visual Biomarker Inference from Smartphone Video via Inverse Problems and Operator Learning Figure 1
2026-06-19eess.IV

Full-Self Diagnostics (FSD): Physics-Grounded Visual Biomarker Inference from Smartphone Video via Inverse Problems and Operator Learning

Jonathan Thomas, Harsh Thaker

Algomash® (Algorithmic Mashup Inc.)

2026-06-19视觉感知

本文动机是摆脱专用传感器,用普通手机9秒面部视频推断血糖等生理指标。核心洞察是把皮肤光传输、色素吸收、rPPG、眼动和行为时序视作多通道可观测信号,并用逆问题与算子学习融合。主要结果为59人38812次配对扫描中,作者自测MARD 29.86%,最佳个体约17%;但临床有效性与增益是否主要来自个体数据 scaling 仍需更严格验证。

ProMUSE: Progressive Multi-modal Uncertainty-guided Staged Evidential Alzheimer Disease Classification Figure 1
2026-06-19cs.LG

ProMUSE: Progressive Multi-modal Uncertainty-guided Staged Evidential Alzheimer Disease Classification

Long Doan, Branden Chen, Ethan Litton, Huan Huang, Jiajing Huang, Yixin Xie, Weihua Zhou, Nandakumar Narayanan, Chen Zhao

2,3,4,9Department of Computer Science, Kennesaw State University, Department of Data Science and Analytics, Kennesaw State University, Department of Information Technology, Kennesaw State University, Department of Applied Computing, Michigan Technological University, Department of Neurology, University of Iowa, and they typically assume that all modalities are readily available at inference time. Under this, modality availability, they overlook the practical constraints of cost and accessibility in real-world

2026-06-19安全鲁棒

这篇论文针对阿尔茨海默病筛查中全量采集 MRI/PET 成本高、可及性差的问题,提出 ProMUSE:先用低成本临床数据做证据分类,并以 Dirichlet 主观逻辑估计不确定性;仅在不确定时逐步引入 MRI/PET,再用 Dempster–Shafer 融合多模态信念。ADNI、AIBL、OASIS 上的 CN–AD、CN–MCI、MCI–AD 实验显示,其准确率接近或优于全模态基线,同时减少约 50–90% 的影像使用。

Human Universal Grasping Figure 1
2026-06-19cs.RO

Human Universal Grasping

Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto

New York University, Tsinghua University, University of Michigan

2026-06-19视觉感知

面向多指机器人抓取泛化受限于仿真数据和遥操作成本的问题,HUG 的核心洞察是直接学习人类日常抓取分布:用智能眼镜采集 1M 帧自我中心 RGB-D 与 MANO 手姿态,训练流匹配模型生成可重定向的人手抓取。在 HUG-Bench 真实 30 物体测试中,桌面成功率 66.7%,较基线提升 23 和 34 个百分点,并能零样本迁移到不同相机、手型和家庭环境。

2026-06-18

100 篇
Native Active Perception as Reasoning for Omni-Modal Understanding Figure 1
2026-06-18cs.CV

Native Active Perception as Reasoning for Omni-Modal Understanding

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

2026-06-18视觉感知

长视频/全模态理解中,被动“全看一遍”使计算随时长增长,交互式方法也常依赖全局预扫描。OmniAgent 将感知建模为 POMDP 下的观察-思考-行动循环,按查询主动读取帧、音频和片段并压缩为文本记忆,再用 Agentic SFT 与带 TAURA 的 RL 训练。实验在十个基准达到开源 SOTA,7B 模型在 LVBench 超过 Qwen2.5-VL-72B,并呈现推理轮数增加带来性能提升。

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games Figure 1
2026-06-18cs.CV

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

Fudan University, Shanghai Innovation Institute, Shanghai Artificial Intelligence Laboratory, Zhejiang University, The Chinese University of Hong Kong

2026-06-18视觉语言规划控制

论文针对多模态模型在闭环控制中必须依据“已不可见”的历史观察行动的问题,提出 RNG-Bench,用配对卡牌和 3D 迷宫隔离非马尔可夫状态重建能力,并用可控难度、对战协议和 Memory Gap 区分遗忘与决策错误。结果显示前沿 MLLM 在最长约 128K token、350 图像情境下仍远未饱和,主要误差来自遗忘;基于最优轨迹和筛选示范微调 Qwen3.5-9B 可提升并具一定迁移。

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos Figure 1
2026-06-18cs.RO

Do as I Do: Dexterous Manipulation Data from Everyday Human Videos

Bhawna Paliwal, Haritheja Etukuru, William Liang, Pieter Abbeel, Nur Muhammad Mahi Shafiullah, Jitendra Malik

2026-06-18机器人视觉感知

这篇论文瞄准灵巧操作数据获取成本高、远程操作和仿真探索难以规模化的问题,提出 Do as I Do:从日常单目 RGB 人类视频重建手—物体 4D 交互,并通过带物理仿真的采样优化重定向到多指机器人手臂。其关键在于放宽对视角、物体类别和数据来源的限制,支持互联网、第一/第三人称甚至生成视频。实验显示其手物重建和轨迹提取优于已有方法,且生成数据可在真实灵巧手上回放,但仍依赖刚体物体、单目深度和近似物理模型。

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors Figure 1
2026-06-18cs.SD

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

Tel Aviv University

2026-06-18视觉感知

针对现有多说话人语音系统依赖轮次标签、说话人嵌入且缺少真实环境声的问题,论文提出 ScenA:将多段参考声直接拼入流匹配文本到音频基础模型,并用自由文本完成说话人绑定。关键洞察是发现“参考捷径”,即训练时模型会靠带噪目标与参考声相似性绕过文本,作者用偏高噪声的时间步分布迫使模型学习文本绑定。在 CoVoMix2-Dialogue 上,ScenA 在说话人绑定指标上达到或超过现有方法,并能生成重叠说话、笑声等副语言事件和环境声。

NeuMesh++: Towards Versatile and Efficient Volumetric Editing with Disentangled Neural Mesh-based Implicit Field Figure 1
2026-06-18cs.CV

NeuMesh++: Towards Versatile and Efficient Volumetric Editing with Disentangled Neural Mesh-based Implicit Field

Chong Bao, Yuan Li, Bangbang Yang, Yujun Shen, Hujun Bao, Zhaopeng Cui, Yinda Zhang, Guofeng Zhang

2026-06-18视觉感知

针对 NeRF/神经隐式场难以像传统网格那样进行精细非刚性变形、局部纹理修改和语义选择的问题,NeuMesh++ 将辐射场绑定到网格顶点,并解耦几何、纹理与语义代码,配合局部空间参数化、顶点可学习修改颜色和空间感知优化,实现网格驱动变形、纹理交换/填充/绘制及单击式语义编辑。真实与合成数据实验显示其在渲染质量、训练稳定性和可编辑性上优于对比方法,但复杂光照、流体和缺失网格结构仍受限。

Confidence is Not Reliability: Rethinking MC Dropout in Brain Tumour Segmentation Figure 1
2026-06-18cs.CV

Confidence is Not Reliability: Rethinking MC Dropout in Brain Tumour Segmentation

Xin Ci Wong, Duygu Sarikaya, Kieran Zucker, Marc De Kamps, Nishant Ravikumar

2026-06-18视觉感知

论文关注脑肿瘤分割中模型在关键亚区“静默失败”的临床风险,质疑常用 MC Dropout 置信度能否等同可靠性。作者比较 SegResNet 与 UNet-Res,指出高不确定性-错误排序 AUROC 约 0.97 仍可掩盖增强肿瘤区严重失准;UNet-Res 在 ET 上熵近零、ECE 达 0.915、Dice 仅 0.714。结果表明应按肿瘤亚区报告校准,并可用熵做患者级复核分流。

A Unified Framework for Efficient Remote Sensing Visual Question Answering: Adapting Dual, Hybrid, and Encoder-Decoder Architectures Figure 1
2026-06-18cs.CV

A Unified Framework for Efficient Remote Sensing Visual Question Answering: Adapting Dual, Hybrid, and Encoder-Decoder Architectures

Timothy Agboada, Shikha Chandel, Yadav Raj Ghimire, Leila Hashemi-Beni

2026-06-18视觉感知

面向灾害评估、城市监测等场景中遥感影像高分辨率、目标小且标注稀缺导致通用VLM难以低成本迁移的问题,论文将RSAdapter扩展到RS-VQA,在冻结的CLIP、BLIP、FLAVA注意力与MLP层中注入轻量瓶颈适配器,训练参数低于5%。在RSVQAx上三类模型均可收敛,其中混合架构FLAVA在多模态推理与检索之间表现最佳,但具体相对增益幅度文中未充分说明。

A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2 Figure 1
2026-06-18cs.CV

A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

College of Computer Science, Sichuan University

2026-06-18视觉感知数据集/基准

针对 GPT-Image-2 已能生成带可读文字和复杂版式的票据、表格、海报、UI 等图像,现有偏物体图像的检测基准难以评估其真实性风险。论文构建 8602 张、六类文本密集图像的多域基准,并用隐私保护的提示合成流程控制生成。零样本评测显示,现有检测器强烈依赖类别,JPEG 压缩下鲁棒性明显下降;多模态模型有提升但在结构化格式上仍不可靠。

CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems Figure 1
2026-06-18cs.CV

CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems

Haohua Que, Zhipeng Bao, Qianyi Wu, Handong Yao

All authors are with the College of Engineering, University of Georgia, Athens, GA 30602, USA.

2026-06-18视觉感知

CABLE面向V2X中云端LMM感知的带宽与预填充延迟瓶颈,利用交通场景目标区域的时空稀疏性,在边缘端用上一帧云端分割掩码结合自车运动补偿、残差运动与走廊包络生成ROI,只上传遮罩图像并将云端结果反馈到下一帧。五个自动驾驶数据集上,其ROI像素覆盖减少73%–87%,估计LMM预填充加速5–8倍,但相对全帧推理存在一定检测质量折衷。

OneCanvas: 3D Scene Understanding via Panoramic Reprojection Figure 1
2026-06-18cs.CV

OneCanvas: 3D Scene Understanding via Panoramic Reprojection

Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner

Technical University of Munich

2026-06-18三维

面向机器人/具身场景中需要从特定视角判断距离、方向和可见性的3D理解问题,OneCanvas避免为VLM另接复杂几何编码器,而是把多视角RGB-D patch按深度和位姿反投影到统一全景画布,并补充度量3D位置嵌入,使预训练VLM像读单图一样进行空间推理;再配合可控的合成空间预训练课程,在SQA3D、VSI-Bench和零样本SPBench上达到领先结果,且训练算力低于强基线约一个数量级。

Transformer Geometry Observatory TGO-I: Spectral Geometry Observatory Figure 1
2026-06-18cs.CV

Transformer Geometry Observatory TGO-I: Spectral Geometry Observatory

Kaustubh Kapil, Kishor P. Upla

2026-06-18视觉感知

针对 ViT 训练过程中表征维度与几何演化缺乏系统观测的问题,本文提出 Transformer Geometry Observatory 的首个谱几何观测器 TGO-I,通过协方差谱、有效秩、参与率、谱熵和各向异性等指标跟踪各层与 CLS token。实验显示,训练并未把信息压缩到少数主方向,而是使方差更均匀分布、维度利用率上升、各向异性下降,最终 CLS 表征最明显;但因框架偏观察性,具体因果机制文中未充分说明。

Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation Figure 1
2026-06-18cs.RO

Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation

Thomas M. Kwok, Nicholas Koenig, Yue Hu

2026-06-18机器人

面向远程护理等机器人遥操作场景,单 RGB-D 无标记动捕虽低成本、少侵入,但上肢自遮挡会使肘肩等关节深度失真并破坏臂长一致性。论文提出 AKC 后处理,用固定上/前臂长度和勾股几何从腕部位置确定被遮挡关节深度,无需概率模型或调参。与 Vicon 对比及仿真、实体机器人遥操作实验显示,其在静态和动态动作中降低误差、保持解剖一致性,并在长时间严重自遮挡下提升稳定性。

No Figure
2026-06-18cs.CV

GUMP-Net: An interpretable model-data-driven intelligent algorithm for multi-class pelvic segmentation

Liheng Wang, Yinghui Zhang, Licheng Zhang, Hailin Xu, Qiyong Cao, Chong Chen

State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, Beijing 100190, China, University of Chinese Academy of Sciences, Beijing 100190, China., State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, Beijing 100190, China., Department of Orthopedics, The Fourth Medical Center of Chinese PLA General Hospital, Beijing 100048, China, National Clinical Research Center for Orthopedics, Sports Medicine and Rehabilitation, Beijing 100048, China., Department of Trauma and Orthopedics, People’s Hospital Peking University, Beijing 100044, China., Department of Orthopedics and Traumatology, Beijing Jishuitan Hospital, Capital Medical University, Beijing 100035, China

2026-06-18视觉感知

面向骨盆骨折诊疗、术前规划和导航中对精确且可解释多类别骨盆分割的需求,GUMP-Net 将改进测地活动轮廓与深度网络做算法展开:用检测模块初始化水平集、边缘模块学习解剖感知边缘函数、迭代模块执行可训练的水平集演化。实验显示其在骨盆数据上较现有方法更准确、鲁棒,尤其小样本下更稳定,并在踝关节数据上展示一定泛化潜力。

ROSA-TFormer: A Radar-Optical Sensor-Aware Temporal Transformer for Pinus sylvestris Plantation Classification in Northern Shaanxi Using GEE-Derived Sentinel-1/2 Time Series Figure 1
2026-06-18cs.CV

ROSA-TFormer: A Radar-Optical Sensor-Aware Temporal Transformer for Pinus sylvestris Plantation Classification in Northern Shaanxi Using GEE-Derived Sentinel-1/2 Time Series

Nengbo Zhang, Chang sheng

2026-06-18视觉感知

针对陕北半干旱防护林中樟子松与裸地、建设用地和其他植被混杂、单靠光学影像易受云和物候混淆的问题,论文将GEE合成的Sentinel-1/2年时间序列建模为雷达-光学分类任务,提出分离SAR/光学嵌入、传感器门控与时间注意力池化的ROSA-TFormer。在半月数据上点级验证达99.67% OA、99.56%宏F1,空间划分仍有99.34% OA,但未超过最强1D-CNN,且仍需面状制图验证。

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance Figure 1
2026-06-18cs.CV

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance

Kangsheng Duan, Ziyang Xu, Wenyu Liu, Xiaohu Ruan, Xiaoxin Chen, Xinggang Wang

2026-06-18视觉感知

针对10B级图像修复基础模型计算与显存成本过高、难以部署的问题,Moebius将扩散U-Net重构为0.22B轻量专家模型,核心是用Local-λ与Interactive-λ组成的LλMI块,以固定大小线性矩阵压缩局部空间上下文和全局语义先验,并结合仅在潜空间进行的自适应多粒度蒸馏缓解表示瓶颈。实验显示其在自然场景和人像修复上接近或超过FLUX.1-Fill-Dev,参数少于2%,总推理加速超过15倍。

When AUC Misleads: Polarization-Aware Evaluation of Deepfake Detectors under Domain Shift Figure 1
2026-06-18cs.CV

When AUC Misleads: Polarization-Aware Evaluation of Deepfake Detectors under Domain Shift

Dat Nguyen, Cosmin Radoi, Romain Hermary, Marcella Astrid, Nesryne Mejri, Enjie Ghorbel, Djamila Aouada

2026-06-18数据集/基准

论文指出深伪检测常用的逐数据集平均 AUC 会在域偏移下高估泛化,因为真实部署面对混合来源与不同伪造痕迹。作者提出 Cross-AUC,将各域 AUC 与基于正负类分数分布 Wasserstein 距离的预测极化程度结合,以解释性能下降。七个基准上的实验显示,平均 AUC 相比合并测试 AUC普遍偏高,Cross-AUC更接近合并 AUC,并揭示 LAA-Net、ForensicsAdapter在跨域场景下更稳健。

The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL Figure 1
2026-06-18cs.LG

The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL

Nicolas Beltran-Velez, Felix Friedrich, Zhang Xiaofeng, Reyhane Askari-Hemmat, Xiaochuang Han, Adriana Romero-Soriano, Michal Drozdzal

FAIR at Meta, 2Columbia University, 3Mila – Québec AI Institute, 4McGill University, 5Université

2026-06-18生成模型强化学习

论文关注流/分数匹配模型为何仍需RL恢复数据中已有的真实感与结构一致性,指出训练时边际上的L2场回归与推理样本质量存在结构错配。其核心是DRL:在自监督表征空间训练判别器区分真实数据与基模型样本,用logit近似密度比作为KL正则RL奖励,避免人工偏好。实验在SiT、JiT、REPA、RAE上显著降低无引导FID与语义FD,并改善后续偏好RL的保真度—奖励前沿。

Hand-4DGS: Feed-Forward 3D Gaussian Splatting for 4D Hand Reconstruction from Egocentric Videos Figure 1
2026-06-18cs.CV

Hand-4DGS: Feed-Forward 3D Gaussian Splatting for 4D Hand Reconstruction from Egocentric Videos

Jeongmin Bae, Seoha Kim, Marc Pollefeys, Mahdi Rad, Youngjung Uh, Taein Kwon

2026-06-18视觉感知三维

面向 AR/VR、AI 眼镜与机器人遥操作中自我视角手部快速运动、遮挡和单目深度歧义问题,Hand-4DGS 用前馈网络直接从视频预测网格引导的 3D Gaussian,并加入顶点锚定位置编码与时间卷积来约束结构和动态,无需推理时手姿态估计器或逐视频优化。在 H2O、ARCTIC 上相较改造的 HUGS、EVA 提升 4D 手重建与手姿态精度,并达到约 60 FPS。

The Market in the Model: Latent Diffusion as Neural Economy Figure 1
2026-06-18cs.CY

The Market in the Model: Latent Diffusion as Neural Economy

Eryk Salvaggio

Cambridge Digital Humanities, University of Cambridge, Machine Visual Culture Research Group, Max Planck Institute

2026-06-18生成模型

本文动机是补足仅从数据集或版权讨论生成图像模型的不足,转而拆解潜在扩散模型内部组件的历史任务与自动化决策。核心洞察是将 LDM 解释为“神经经济”:把社会交流压缩为可交换向量,并服务于平台与注意力经济。主要结果是一套组件级批判框架,指出生成图像的价值逻辑来自模型管线对社会交换的抽象与商品化,而非单纯数据偏差。

Urdu Katib Handwritten Dataset: A Historical Document Dataset for Offline Urdu Handwritten Text Recognition with CRNN-Based Baseline Evaluation Figure 1
2026-06-18cs.CV

Urdu Katib Handwritten Dataset: A Historical Document Dataset for Offline Urdu Handwritten Text Recognition with CRNN-Based Baseline Evaluation

Ramza Basharat, Muhammad Usman Ali

Department of Computer Science, University of Gujrat, Department of Computer Science, University of Gujrat Gujrat Punjab Pakistan

2026-06-18视觉感知数据集/基准

针对乌尔都语连写、Nastalique 斜基线与历史 Katib 手稿缺少标准数据的问题,论文构建 UKHD:面向离线手写文本行识别的真实历史文档数据集,覆盖平头笔书写变化,并以多种 CRNN 混合模型建立基线。实验显示 CNN-BGRU-CTC 在字符错误率和词错误率上最稳健,但具体数据规模与相对增益在给定文本中未充分说明。

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation Figure 1
2026-06-18cs.LG

Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation

Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han

State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences, University of Chinese Academy of Sciences

2026-06-18视觉语言强化学习

论文关注将 on-policy 自蒸馏直接用于多模态模型时的“答案泄漏”捷径:教师因看到参考答案,可能先塑造推理而非促使模型看图。ViGOS 将轨迹拆成视觉描述与推理回答,前者由仅看图的感知教师监督,后者再由带答案的推理教师监督。实验覆盖通用视觉语言、视觉数学、空间定位和语言先验压力测试,显示其保留 OPSD 的常规收益,并在需依赖图像的场景提升稳健性。

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL Figure 1
2026-06-18cs.CV

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

Mukund Khanna, Raj Singh Yadav, Kunal Singh

2026-06-18视觉感知强化学习

本文针对商品图像指令编辑中常见的品牌、几何和包装文字被篡改问题,构建了带可验证文本的 ProductConsistency 合成数据、SFT/RL 训练集与基准,并用基于编辑后图像 caption 相似度的循环一致性奖励约束商品身份。微调 Qwen-Image-Edit-2511 和 Flux 后,OCR、感知指标及 MLLM 评测均提升,其中 Qwen 字符错误率约降至原来的五分之一;增益可能主要来自数据与奖励共同作用。

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model Figure 1
2026-06-18cs.CV

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz, Afonso Simplício, Gonçalo Vinagre, Diogo Tavares, Rafael Ferreira, Inês Calvo, Inês Vieira, David Semedo, João Magalhães

2026-06-18视觉感知

针对欧葡在开源多模态模型中常被巴葡混同且缺少评测资源的问题,AMALIA-VL以LLaVA-NeXT式高分辨率视觉编码、动态切图和欧葡优化LLM为骨架,配合视觉语言对齐、指令微调、偏好优化三阶段训练,并构建欧葡中心数据与翻译基准。实验显示其在全开放pt-PT LVLM中形成有竞争力基线,OCR、字幕和空间定位较强,但复杂视觉推理仍弱,部分增益可能主要来自定制数据。

DVANet: Degradation-aware Visual-prior Alignment Network for Image Restoration Figure 1
2026-06-18cs.CV

DVANet: Degradation-aware Visual-prior Alignment Network for Image Restoration

Yanjie Tu, Qingsen Yan, Axi Niu, Tao Hu, Haokui Zhang, Jiantao Zhou

2026-06-18视觉感知

针对统一图像复原在多种退化、复合退化和局部结构缺失下难以兼顾可解释性与泛化的问题,DVANet将HQS深度展开为双分支过程:一支学习全局/局部退化表示以约束观测一致性,另一支引入冻结DINOv3层级视觉先验补足结构细节。实验显示其在单一退化、夜间复杂退化、复合退化及跨域任务上达到优于或相当的结果,但视觉先验带来的额外计算开销仍是限制。

PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction Figure 1
2026-06-18cs.CV

PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction

João Cardeira, Diogo Glória-Silva, Manuel Letras da Luz, Rafael Ferreira, Diogo Tavares, David Semedo, João Magalhães

2026-06-18数据集/基准

针对欧洲葡萄牙语在现代 OCR 基准中长期缺位、既有数据多偏历史文献的问题,PorTEXTO 构建了面向当代场景的图像文字抽取基准,覆盖手写笔记、真实照片/截图/票据表单和合成文本,并以 LVLM 预标注加本地母语者全面复核保证标注质量。实验显示,多数模型从合成样本到真实与手写样本性能显著下降,模型规模和分辨率预算并非主要瓶颈,表现更可能主要来自专门的多语种/pt-PT OCR 数据。

No Figure
2026-06-18cs.CV

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

2026-06-18视觉感知数据集/基准

针对现有图像编辑擅长静态属性、难以保持既有人物与物体并生成合理交互的问题,论文提出 HOI-Edit 三层认知基准与基于成对区域的 HOI-Eval,用 VLM 评估交互、空间和因果物理合理性;同时利用 I2V 生成过程可诊断失败的洞察,设计 SCPE 通过视频分析—评论器—Playbook 迭代改写提示。实验显示其在开源模型中总体领先,交互指标可与 Nano Banana 竞争甚至更优。

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots Figure 1
2026-06-18cs.RO

Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots

Roberto Corlito, Fabian Schmidt, Nils Seibert, Markus Enzweiler, Abhinav Valada, Arne Roennau

Machine Intelligence and Robotics Lab, Karlsruhe Institute of Technology (KIT), Germany., Institute for Intelligent Systems, Esslingen University of Applied Sciences, Germany. 3 Department of Computer Science, University of Freiburg, Germany.

2026-06-18机器人视觉语言数据集/基准

针对四足机器人步态冲击、振动和快速转动会破坏常规 SLAM 假设的问题,论文利用 ANYmal D 的 GrandTour 数据集系统改变相机模态、快门类型和 IMU 档次,评估视觉、视觉惯性与激光-视觉惯性 SLAM。主要发现是硬件配置显著影响鲁棒性:双目优于单目和 RGB-D,全局快门明显减少运动导致的跟踪失败,而在剧烈腿式运动下,标准惯性融合反而可能削弱 ORB-SLAM3、RTAB-Map 等以视觉为主方法的表现。

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval Figure 1
2026-06-18cs.CV

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

2026-06-18视觉语言视觉感知

针对文本检索视频时难以同时建模细粒度时序变化与复杂语言结构的问题,DREAM在CLIP式视觉语言框架上加入双目标文本编码,将MLM与PLM结合以覆盖局部依赖和全局句法;视觉端采用层次化编码器与级联分组注意力逐步融合空时信息。在MSR-VTT、MSVD和LSMDC上R@1分别达到49.4%、49.7%和27.3%,报告为新SOTA。

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis Figure 1
2026-06-18cs.CV

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

Yuxin Peng is with the Wangxuan Institute of Computer Technology, National

2026-06-18视觉语言视觉感知数据集/基准

针对现有 LVLM 基准难以刻画细粒度图像理解边界的问题,本文提出 FG-BMK,覆盖 28 万图像与 101 万问题,并同时从对话语义识别和特征级判别性诊断模型失效来源。实验显示,当前 LVLM 仍不是可靠的细粒度识别器,瓶颈交织于视觉表征、视觉-语义 grounding、模态对齐和类别知识;对比式训练、合适粒度的图文对齐与数据设计更有助于提升细粒度能力。

Low-Rank Tensor Completion Based on Fractional Regularization with Ky Fan p-k Norm Figure 1
2026-06-18cs.CV

Low-Rank Tensor Completion Based on Fractional Regularization with Ky Fan p-k Norm

Shan Fan, Feng Zhang, Jianjun Wang, Xi-Le Zhao, Tingwen Huang

in part by the Graduate Research and Innovation Project of Southwest University under Grant SWUS26072, with the School of Mathematics and Statistics, Southwest University, Chongqing 400715, China (e-mail:, Xi-Le Zhao is with the School of Mathematical Sciences/Research Center for Image and Vision Computing, Tingwen Huang is with the Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology, Shenzhen 518055

2026-06-18视觉感知

针对图像、MRI 等高维数据在采集传输中缺失时,传统张量核范数会均等惩罚奇异值、导致低秩估计偏差的问题,论文提出以张量核范数与 Ky Fan p-k 范数之比构造尺度不变的非凸分式正则,更灵活逼近 tubal rank;并给出 NSP 下局部最优性、近端算子和带收敛保证的 ADMM。合成与真实数据实验显示其补全效果优于多种现有低秩张量补全方法。

FlowObject: Flow Steering for Bridging Generative Priors and Reconstruction Fidelity Figure 1
2026-06-18cs.CV

FlowObject: Flow Steering for Bridging Generative Priors and Reconstruction Fidelity

Yuchen Rao, Xuqian Ren, Yinyu Nie, Sayan Deb Sarkar, Biao Zhang, Vincent Lepetit, Friedrich Fraundorfer

2026-06-18生成模型三维

FlowObject针对少量随手拍RGB-D图像难以同时获得完整几何与观测一致性的对象重建问题,将稀疏视角重建表述为无需训练的引导式逆问题,通过潜空间对齐与观测空间一致性双重引导来操控Flow-Matching ODE轨迹,并接入3DGS细化外观。实验显示其在合成与真实数据上相较生成式和优化式基线,同时提升遮挡区域补全、实例几何一致性和视角相关外观保真度。

Show, Don't Ask: Generative Visual Disambiguation for Composed Image Retrieval with Turn-Valid Coverage Figure 1
2026-06-18cs.CV

Show, Don't Ask: Generative Visual Disambiguation for Composed Image Retrieval with Turn-Valid Coverage

Amsisan Tran, Baogh Le, Tuan Kiet Pham, Sui Yang Guang

2026-06-18视觉感知生成模型三维

论文针对组合图像检索中“文本+参考图”常对应一片候选区域而非唯一目标的问题,指出既有交互式 conformal 方法在多轮追问后覆盖率失效,且文本澄清难表达细粒度外观/视角差异。CLARA 改为生成候选模式的视觉原型面板供用户选择,并用选择诱导似然比重加权校准以保证逐轮覆盖。实验显示其单轮性能接近 SOTA,多轮维持标称覆盖率,并比最强文本追问策略更快命中目标。

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning Figure 1
2026-06-18cs.CV

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

2026-06-18视觉语言强化学习

这篇论文针对统一多模态模型在视觉链式思考中生成“视觉想法”需多步扩散、推理代价高的问题,发现渲染出的中间图像本身贡献有限,但生成路径会改变后续文本分布。作者提出 Visual-OPSD,用同权重、不同上下文的教师/学生做在线 JSD 自蒸馏,把含 VT 的推理信号迁移到纯文本推理。九个基准上平均比生成式教师高 3.40 个百分点,并将单样本延迟从 142.8s 降到 10.0s。

A Controlled Benchmark of Quantum-Latent GAN Augmentation for Brain MRI Figure 1
2026-06-18cs.LG

A Controlled Benchmark of Quantum-Latent GAN Augmentation for Brain MRI

Syed Mujtaba Haider, Silvia Figini

2026-06-18生成模型规划控制数据集/基准

针对医学影像小样本场景中量子 GAN 增广常被单次实验和不匹配容量夸大效果的问题,本文构建参数近似匹配的量子/经典潜空间 WGAN-GP 基准,并在 5%–100%标注比例、8 个随机种子下检验脑 MRI 分类。结果显示两类增广均未显著优于仅用真实数据,量子与经典生成器统计上无差异;低数据下的微弱收益更像正则化,且样本明显离分布并模式坍塌。

Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation Figure 1
2026-06-18cs.CV

Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation

Zirui Zheng, Jiaqian Yu, Xiongfeng Peng, jun shi, Mingyi Li, Chao Zhang, Weiming Li, Dong Wang, Huchuan Lu, Xu Jia

2026-06-18机器人强化学习

针对机器人操作中腕部相机快速运动、遮挡导致动作条件世界模型在长时序 rollout 中遗忘或幻觉历史物体的问题,Mem-World 引入以腕视角为中心的 4D surfel 索引记忆 W-VMem,将历史观测锚定到动态表面元素,并按未来动作几何检索相关帧作为条件。实验显示其提升时序一致性,策略评估与真实表现的 Pearson 相关性较 Ctrl-World 提高 14.5%,合成数据使长程任务成功率从 58% 升至 72%。

Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos Figure 1
2026-06-18cs.CV

Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos

Runze Xu, Yiluo Zhang, Jian Wang, Yu Wang, Jincheng Yu

2026-06-18视觉感知

这篇论文针对通用 VLA 训练过度依赖大规模带动作标注机器人数据的问题,尝试从无标注第一视角人类操作视频中提取可迁移动作先验。核心做法是用物理 mask 引导的混合解耦 VQ-VAE 将运动动态与背景变化分离,构建跨本体离散动作码本,并在适配阶段解耦意图预测与状态感知以减少动作幻觉。实验显示,仅用人类视频预训练后约 50 条机器人轨迹即可适配,在仿真和真实场景中接近大量标注数据训练的 VLA。

No Figure
2026-06-18cs.CV

SP-TransientBench: A Real-Captured Single Photon Perception Benchmark

Hongzhou Dong, Zili Zhang, Ziting Wen, Yiheng Qiang, Runrong Deng, Wenle Dong, Ziwen Jiang, Xinyang Li, Rui Lu, Shuoyao Sun, Wenyu Wang, Ziyi Xia, Haitao Zheng, Guodong Shi, Xiaoqiang Ren

2026-06-18数据集/基准

该文针对单光子 LiDAR 研究长期依赖仿真或小规模受控采集、难以评估真实噪声与多回波瞬态的问题,提出 SP-TransientBench。其核心是发布真实采集的多任务基准,含 10 个场景、约 1.03 万视角、完整 ToF 直方图、标定多视角位姿及部分 13 类 3D 语义标注,并给出深度估计、多视图重建和语义分割的统一划分与评测协议;主要结果是补齐真实 SPL 感知评测资源,但算法性能增益并非本文重点。

Physics-IQ Verified Figure 1
2026-06-18cs.CV

Physics-IQ Verified

Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, Carsten T. Lüth

Anates Labs, Technical University of Munich, University of Technology Nuremberg, Tuebingen AI Center, University of Tuebingen

2026-06-18视觉感知

面向将视频生成模型用作世界模型(含机器人任务)时“是否真正理解物理”的评测需求,本文系统审计 Physics-IQ,指出原基准受提示歧义、参考视频伪激活和数据集级聚合偏置影响。作者提出 Physics-IQ Verified:改写/模板化提示、清理非物理伪影,并引入样本级等权评分。结果显示其修改了 57.6% 样本、改进 34.8% 提示;在 6 个图生视频模型上带来有意义的排名变化(Kendall τ=0.46)。

No Figure
2026-06-18cs.CV

BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing

Chaewon Park, Soyoon Lee, Naeun Lee, Minjung Shin, Seogkyu Jeon, Kibeom Hong

Sookmyung Women’s University, Yonsei University

2026-06-18视觉感知

面向真实图像中多目标同时编辑易出现语义混合、目标缺失或源类别残留的问题,论文将根因归结为编辑 token 与区域错配、源对象注意力压制两类 attention leakage。BindEdit在单次扩散轨迹中用掩码约束交叉/自注意力、重平衡目标与源 token,并加入区域一致性约束;新多目标基准上的实验显示其在单目标和多目标编辑中均优于既有方法。

No Figure
2026-06-18cs.CV

Automatic ply-specific analyses of CFRP micrographs using shortest-path-based ply distinction

Jonas Naumann, Jonas P. Appels, Julius Biermann, Christopher Gorsky, Timo de Wolff, Christoph Brauer

Jonas Naumann, German Aerospace Center (DLR), Institute of Lightweight Systems, Composite Process Technologies, Ottenbecker Damm 12, 21682 Stade, Germany, Jonas P. Appels, German Aerospace Center (DLR), Institute of Lightweight Systems, Composite Process Technologies, Ottenbecker Damm 12, 21682 Stade, Germany, Julius Biermann, German Aerospace Center (DLR), Institute of Lightweight Systems, Composite Process Technologies, Ottenbecker Damm 12, 21682 Stade, Germany, Christopher Gorsky, German Aerospace Center (DLR), Institute of Lightweight Systems, Structural Mechanics, Lilienthalplatz 7, 38108 Braunschweig, Germany, Timo de Wolff, Technische Universität Braunschweig, Institute of Analysis and Algebra, Applied Algebra, Universitätsplatz 2, 38106 Braunschweig, Germany, Christoph Brauer, German Aerospace Center (DLR), Institute of Lightweight Systems, Composite Process Technologies, Ottenbecker Damm 12, 21682 Stade, Germany

2026-06-18视觉感知

针对CFRP高分辨率显微图中铺层级质量评估仍依赖人工、语义分割难以区分具体铺层的问题,论文将分割掩码像素建图,用最短路径寻找铺层分隔线,从而把语义分割转为铺层实例分析。方法在含间隙、波曲、不同铺层序列和贯穿裂纹的样本上可用,并支持逐铺层纤维体积分数、铺层厚度与夹层厚度的自动量化。

DINO-Med3D: Bridging Dimension and Domain Gaps in Volumetric Segmentation via Progressive Adaptation Figure 1
2026-06-18cs.CV

DINO-Med3D: Bridging Dimension and Domain Gaps in Volumetric Segmentation via Progressive Adaptation

Haoyu Hu, Xiyao Ma, Shiqi Liu, Linsen Zhang, Xiaoliang Xie, Xiaohu Zhou, Zeng-Guang Hou

2026-06-18视觉感知三维

该文针对2D自然图像预训练的DINOv3直接用于3D医学体数据分割时存在维度断裂与领域偏移的问题,提出两阶段渐进适配:先用跨切片ICE嵌入和分割代理任务对齐,再冻结骨干加入3D adapter、LoRA及细节恢复流强化层间连续性和边界纹理。五个公开数据集上优于SOTA,但第一阶段全量微调带来计算负担,细节流增益受数据纹理影响。

LARE: Low-Attention Region Encoding for Text-Image Retrieval Figure 1
2026-06-18cs.CV

LARE: Low-Attention Region Encoding for Text-Image Retrieval

Abdulmalik Alquwayfili, Faisal Almeshal, Jumanah Almajnouni, Leena Alotaibi, Faisal Alhajari, Mohammed Alkhrashi, Alreem Almuhrij, Abdullah Aldwyish, Raied Aljadaany, Huda Alamri, Muhammad Kamran J. Khan

2026-06-18视觉感知

本文针对拥挤场景图文检索中全局视觉嵌入偏向显著物体、忽略小目标和低显著区域的问题,提出无需训练的 LARE:利用视觉 Transformer 注意力图定位低关注区域,并与整图并行编码,再通过置信门控融合相似度。作者还构建强调密集场景与稀有物体的 Dense-Set;实验显示该方法在密集检索上稳定提升,同时基本保持标准基准排序行为。

Performance Gap Analysis between Latin and Arabic Scripts HTR Figure 1
2026-06-18cs.CV

Performance Gap Analysis between Latin and Arabic Scripts HTR

Sana Al-azzawi, Elisa Barney, Marcus Liwicki

Luleå University of Technology, Department of Computer Science, Electrical and Space Engineering, matters, as many datasets contain labeling errors. Cleaning reduces er-

2026-06-18视觉感知

针对阿拉伯系手写文本识别长期落后于拉丁文字但缺少受控比较的问题,本文用统一的行级 CRNN 在九个多语种数据集和不同训练规模下分析性能差距。核心洞察是差距不只来自模型或数据量,还与标注噪声、阿拉伯文字形随位置变化、点/附加符号混淆及长尾字符分布有关。结果显示低资源时差距最大,数据增多后缩小但全量仍约有 5–7 个 CER 点差;清洗标注可降低错误但不能消除差距,阿拉伯数据中约 30% 替换错误来自视觉相似字符混淆。

Test-Time Adaptation in Optical Coherence Tomography Using Trajectory-Aligned Time-Independent Flow Figure 1
2026-06-18cs.CV

Test-Time Adaptation in Optical Coherence Tomography Using Trajectory-Aligned Time-Independent Flow

Veit Hucke, Thomas Pinetz, Gregor Reiter, Ursula Schmidt-Erfurth, Hrvoje Bogunović

Institute of Artificial Intelligence, Center for Medical Data Science, Medical, University of Vienna, Austria, Comprehensive Center for Artificial Intelligence in Medicine, Medical University of, Department of Ophthalmology and Optometry, Medical University of Vienna, Laboratory for Ophthalmic Image Analysis, Medical University of Vienna, Austria, (AMD). Code is available here: https://github.com/Veit21/tta-flow., pseudo-labels via augmentations and thresholding (e.g., COTTA [25]). However

2026-06-18生成模型规划控制

低成本 OCT 设备噪声和域偏移会削弱病灶分割模型。本文提出 TTA-Flow:用流匹配重建高质量替代图像,并将测试图像直方图对齐到生成的参考轨迹,同时去掉时间条件以适应未知真实噪声。实验在两类 AMD 生物标志物、两种低成本设备的 3D/2D 分割中优于多种 TTA 和生成式基线,消融显示主要增益来自直方图对齐与无时间条件设计。

Bridging Single Distortion Artifacts and Mmultifactorial Clinical Quality: Few-shot Biparametric MRI Quality Assessment via Distortion-trained Prototypical Networks Figure 1
2026-06-18cs.CV

Bridging Single Distortion Artifacts and Mmultifactorial Clinical Quality: Few-shot Biparametric MRI Quality Assessment via Distortion-trained Prototypical Networks

Yuheng Tang, Alexander Ng, Wen Yan, Natasha Thorley, Pawel Rajwa, Yipei Wang, Aqua Asif, Clare Allen, Louise Dickinson, Francesco Giganti, Shonit Punwani, Daniel Alexander, Veeru Kasivisvanathan, Yipeng Hu

2026-06-18视觉感知

针对前列腺MRI质量评估中低质量样本少、PI-QUAL标注主观且类别失衡的问题,本文将较易获得的DWI几何畸变标签作为元训练任务,提出融合T2WI/DWI的双分支3D ResNet原型网络,并用FiLM与GRL处理不同b值带来的域偏移。模型仅需每类5个样本即可适配PI-QUAL评分,在两个数据集上优于少样本基线,但支持集选择仍是潜在敏感因素。

Learning to Distort: Weakly-Supervised Image Quality Transfer for Prostate DWI Correction Figure 1
2026-06-18cs.CV

Learning to Distort: Weakly-Supervised Image Quality Transfer for Prostate DWI Correction

YuCheng Tang, Wen Yan, Alexander Ng, Natasha Thorley, Pawel Rajwa, Yipei Wang, Aqua Asif, Clare Allen, Louise Dickinson, Francesco Giganti, David Atkinson, Shonit Punwani, Daniel Alexander, Shaheer Ullah Saeed, Veeru Kasivisvanathan, Yipeng Hu

2026-06-18视觉感知

该文针对前列腺 DWI 常见几何畸变且临床缺少成对畸变/无畸变扫描的问题,提出先“学会加畸变”再监督去畸变的弱监督 IQT 框架:用图像级质量标签训练 IQA 特征与质量原型,并以原型约束 flow matching 生成逼真伪畸变配对数据。实验显示合成畸变会显著干扰 PI-RADS 与 Gleason 分类,且由此训练的校正模型在真实 DWI 上优于 CycleGAN、UNIT-DDPM、OT-FM 等未配对方案。

URDF Synthesis from RGB-D Sequences via Differentiable Joint Inference and Energy-Consistent Verification Figure 1
2026-06-18cs.CV

URDF Synthesis from RGB-D Sequences via Differentiable Joint Inference and Energy-Consistent Verification

Xinze Zhang

aUniversity of Southern California, Los Angeles, CA 90007, USA, pipeline Articulate-Anything [20] on the per-axis metrics where comparable numbers are available. Long-horizon

2026-06-18视觉感知

这篇论文面向从 RGB-D 序列自动生成可仿真的关节物体 URDF,动机是现有方法常将部件重建与运动学估计割裂,且缺少能量一致性验证,导致仿真漂移。作者提出 KinemaForge,用软约束关节图、可微螺旋轴求解和能量残差把视觉重建与刚体动力学闭环优化。实验中关节轴误差降至 2.83°,50 秒仿真漂移较 PARIS 降低 64%,闭环操作成功率较 Ditto 提升 14.6 个百分点。

Quantification of Uncertainty with Adversarial Models in Medical Image Segmentation Figure 1
2026-06-18cs.CV

Quantification of Uncertainty with Adversarial Models in Medical Image Segmentation

Hana Jebril, Thomas Pinetz, Günter Klambauer, Hrvoje Bogunović

2026-06-18视觉感知安全鲁棒

面向医疗分割中边界和病灶区域过度自信、影响临床监测的问题,论文提出后处理框架 QUAM-SM:用定向对抗搜索寻找容易被翻转的“脆弱像素”,并分解认知与偶然不确定性。两组多专家标注公开数据实验显示,其可靠性、边界敏感性及与标注者差异的一致性优于常见不确定性估计方法,但方法依赖训练分布访问。

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models Figure 1
2026-06-18cs.CV

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

School of Artificial Intelligence, Jilin University, College of Computer Science, Jilin University

2026-06-18视觉语言视觉感知强化学习学习理论

面向 GUI 理解、流程图解析等需要坐标、文本、属性和关系联合监督的 VLM 推理任务,论文指出传统标注工具仍停留在闭集检测范式,难以复用且与训练脱节。作者提出开源 ScreenAnnotator,以统一标注原子、在线人机共演训练循环、贝叶斯标注验证器和模板化多任务合成,把一次标注转成多类推理数据。实验中流程图标注接受率接近 100%、GUI 为 77%,单图耗时随数据积累下降;流程图 QA 微调后平均准确率达 76.1%,较基座提升 35.1 个百分点。

Rethinking Air-Ground Collaboration: A Progressive Cross-Task Benchmark and Socialized Learning Framework Figure 1
2026-06-18cs.CV

Rethinking Air-Ground Collaboration: A Progressive Cross-Task Benchmark and Socialized Learning Framework

Zhoupeng Guo, Yunqi Zhu, Zhihe Fan, Xinjie Yao, Ruipu Zhao, Boan Tao, Yiming Sun, Zhen Wang, Pengfei Zhu

2026-06-18数据集/基准

论文针对现有空地协同多停留在单任务跨视角融合、难以处理定位、关联与解析依赖且易受视角异质性负迁移影响的问题,提出AGPC渐进式跨任务基准,并设计SCP框架以粗到细串联空中全局定位、地面目标关联和身份感知解析,DLR选择性路由跨视角/跨任务信息。实验报告3.73%协同演化增益和7.86%下游平均提升,说明任务条件化交互优于统一特征共享。

Semantic Robustness Certification for Vision-Language Models Figure 1
2026-06-18cs.LG

Semantic Robustness Certification for Vision-Language Models

Peiyu Yang, Paul Montague, Feng Liu, Andrew C. Cullen, Amardeep Kaur, Christopher Leckie, Sarah M. Erfani

Code is available at https://github.com/, School of Computing & Information Systems, Univer-, dataset via similarity to the transformed embedding (φ = 1) as visual references, with labels and similarities shown.

2026-06-18视觉语言视觉感知安全鲁棒

现实应用中的 VLM 容易因形状、风格、背景等语义变化产生预测漂移,而传统鲁棒认证多停留在像素或几何扰动。本文将认证转到图文共享嵌入空间,用文本提示作为源/目标语义代理,在二维语义子空间中参数化变化强度,并利用闭式决策边界给出预测不变区间。合成与真实数据实验显示,该方法能较好刻画多类语义变化下的类别切换,且无需为每种变化额外收集训练数据。

EDoF-NeRF: extended depth-of-field neural radiance fields using a coded aperture camera Figure 1
2026-06-18cs.CV

EDoF-NeRF: extended depth-of-field neural radiance fields using a coded aperture camera

Yoshiyuki Shirasaki, Ryoichi Horisaki

2026-06-18三维

本文针对传统相机在进光量与景深之间的权衡会传递到 NeRF、导致浅景深输入难以合成清晰新视角的问题,引入位于光瞳的编码孔径,并将其 PSF/散焦成像模型嵌入 NeRF,使网络可直接利用编码图像恢复扩展景深结果。仿真与光学实验显示,EDoF-NeRF 相比 NeRF 和 DoF-NeRF 在新视角图像与深度估计的 PSNR、SSIM 上更优。

DreamReg: Belief-Driven World Model for 2D-3D Ultrasound Registration Figure 1
2026-06-18cs.CV

DreamReg: Belief-Driven World Model for 2D-3D Ultrasound Registration

Luoyao Kang, Yuelin Zhang, Jiwei Shan, Haifan Gong, Qingpeng Ding, Shing Shin Cheng

2026-06-18强化学习三维

针对术中2D超声切片与术前3D体数据配准中视野不完整、斑点噪声和探头运动耦合导致的一次性回归不稳问题,DreamReg将6DoF刚体配准建模为部分可观测下的序贯信念更新,引入动作条件世界模型和想象 rollout 来模拟候选探头运动并迭代细化位姿。在CAMUS与μ-RegPro上,其几何精度和图像相似性较现有方法更稳健,但真实组织形变场景仍未充分覆盖。

Where Will They Go? Modelling Multimodal Pedestrian Manoeuvres from Ego-centric Videos Figure 1
2026-06-18cs.CV

Where Will They Go? Modelling Multimodal Pedestrian Manoeuvres from Ego-centric Videos

Yuxuan Xie, Nicolas Pugeault, Chongfeng Wei, Hubert P. H. Shum, Edmond S. L. Ho

School of Computing Science, University of Glasgow, Glasgow, United, James Watt School of Engineering, University of Glasgow, Glasgow, Department of Computer Science, Durham University, Durham, United, the ground truth action labels, i.e. crossing or non-crossing, availability in the dataset.

2026-06-18视觉语言视觉感知

针对车载视角下行人未来轨迹一对多、单一随机分布易生成不真实“混合模式”轨迹的问题,论文提出 MMPM:用 PIM 融合行人注视、头/手势、车辆与场景交互,再以 CVAE 式 MTP 按过街/不过街分别建模轨迹分布并用查询解码保持模式一致。在 PIE 与 JAAD 上优于现有方法,MTP 还能接入 BiTrap-NP、SGNet-ED,数据驱动验证中帧级位移误差最高降低 4.73%。

Fuzzy-Geometric Branch-Point Modeling for Structure-Aware Augmentation of Handwritten Chinese Characters Figure 1
2026-06-18cs.CV

Fuzzy-Geometric Branch-Point Modeling for Structure-Aware Augmentation of Handwritten Chinese Characters

Dongbin Jiao, Yibo Lyu, Qiulu Wei, Fuxiang Lu, Shengcai Liu, Shi Yan

2026-06-18视觉感知

面向高安全手写中文识别/签名验证中样本稀缺与复杂笔画交叉易被增强破坏的问题,论文提出 FGSA:将骨架分支点建模为模糊集合,融合邻域拓扑证据与方向场散度,并用无监督代理目标自适应调参,再通过三次 Bézier 重建和扰动生成结构保持样本。在 CASIA-HWDB1.1、ChiSig 与新建 LZUSig 上,方法降低词级错误率,并在识别增益、结构保真和判别特征保留间取得较好折中。

HandwritingAgent: Language-Driven Handwriting Synthesis in Scalable Vector Space Figure 1
2026-06-18cs.CV

HandwritingAgent: Language-Driven Handwriting Synthesis in Scalable Vector Space

Jaward Sesay, Yue Yu, Börje F. Karlsson

Beijing Institute of Technology, Beijing Academy of Artificial Intelligence

2026-06-18视觉感知

现有手写合成多依赖大规模训练和栅格图像,难以按自然语言细粒度控制笔画并迁移到新字体或脚本。HandwritingAgent 将任务改写为语言模型在离散画布中基于参考样式进行几何推理和自回归 SVG 笔画生成,无需特定风格训练,输出可编辑、可解释。论文在风格模仿、识别、多语言和数学/科学表达式生成中称达到或超过现有生成模型,但具体增益来源仍需结合完整实验细节判断。

Learned Radius Estimation for UDF-Based Point Cloud Reconstruction Figure 1
2026-06-18cs.CV

Learned Radius Estimation for UDF-Based Point Cloud Reconstruction

Eito Ogawa, Hiroshi Watanabe

Graduate School of FSE, Waseda University, label. These cached target radii are used only during training

2026-06-18三维

面向消费级点云重建中采样不均、局部稀疏导致固定或曲率启发式支持半径不稳的问题,论文在冻结 LoSF-UDF 上加入轻量逐查询半径选择器,用缓存 UDF 误差曲线的抛物线插值得到连续监督半径。该插件无需重训主干,80 个训练形状即可泛化到 ScanNet;相对 GeoLA,ScanNet F1@0.005 从 0.645 提升到 0.691,CD 也从 0.795 降至 0.692。

SCR-Guided Difficulty-Aware Optimization for Infrared Small Target Detection Figure 1
2026-06-18cs.CV

SCR-Guided Difficulty-Aware Optimization for Infrared Small Target Detection

Yunus Sevim, Behçet Uğur Töreyin

Istanbul Technical University, The code is available at https://github., false alarms [22], while single-point supervision and label-

2026-06-18视觉感知优化算法

针对红外小目标常处于低对比、强杂波中,单纯 IoU/Dice 等几何重叠损失难以反映真实可见性的痛点,论文提出 REEM:训练时用标注区域计算局部 SCR,并以可微权重调制 soft-IoU,使低 SCR 难样本获得更大优化权重,同时不改网络结构、参数和推理流程。集成到 MSHNet 后,在 IRSTD-1k 等实验中提升 IoU 与检测概率,并显著降低虚警,低可见目标收益更明显。

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction Figure 1
2026-06-18cs.CV

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

The source code and datasets are available at https://github.com/UESTC-GQJ/SAMA .

2026-06-18视觉语言

针对多模态信息抽取在低资源下标注稀缺、文本图像增强易语义漂移且各任务割裂的问题,SAMA将标签重编码为“语义锚”,统一约束多专家MLLM生成文本,并用保锚扩散生成图像,再以跨模态一致性和锚保真过滤样本。实验覆盖MNER、MRE、MEE,在低资源和全监督设置均优于现有增强基线。

SpectralDiT: Timestep-Conditioned Spectral Residual Correction for Flow-Matching DiTs Figure 1
2026-06-18cs.CV

SpectralDiT: Timestep-Conditioned Spectral Residual Correction for Flow-Matching DiTs

Jiayu Tian

Peking University, . We evaluate the scalability of our method on Ima­, paths between noise and data [2], and scalable interpolant, Label

2026-06-18生成模型

该文针对 flow-matching DiT 在不同时刻生成过程的频率需求不同、但残差更新对频谱一视同仁的问题,提出在 MLP 残差支路加入零初始化的时间步条件频谱校正,将 token 网格残差分解为低/高频并门控加回,初始化等同基线。实验显示其以约 0.6% FLOPs、1.36% 参数开销,在 CIFAR-10 将 FID 从 20.78 降至 19.71,并在 ImageNet-100 潜空间 CFG 下取得 8.7% 相对 FID 降低。

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas from High-Resolution Imaging Data Figure 1
2026-06-18cs.CV

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas from High-Resolution Imaging Data

John Kalkhof, Boris Gutman (IIT), Emile d'Angremont (Amsterdam UMC), Daniel C. Alexander (UCL), Marco Lorenzi

SMART: A Flexible, Interpretable, and Scalable Spatio-temporal Brain Atlas, Inria Center at University Cˆote d’Azur, Illinois Institute of Technology, Amsterdam University Medical Center, University College London, ble, interpretable, and scalable spatio-temporal brain atlas, scalable multi-scale Neural Cellular Automata. Evaluated, paradigm for flexible, interpretable, and scalable modeling, ity: flexibility, interpretability, and scalability. In practice, high dimensionality of 3D brain images raises scalability, ible, interpretable, and scalable representation of disease-

2026-06-18视觉感知

针对纵向高分辨率3D脑MRI中疾病时间线不一致、生成式预测难解释且难扩展的问题,SMART将阿尔茨海默病进展建模为连续时空脑图谱:用区域微分方程刻画群体级病程轨迹,再以多尺度NCA生成个体化微分同胚形变。其在五个MRI队列、1357名受试者上优于GAN、扩散和VoxelMorph基线,并以更少参数提升预测精度与时间一致性。

Toward Training-Free Zero-Shot Anomaly Detection in 3D Medical Images: A Batch-Based Approach Using 2D Foundation Models Figure 1
2026-06-18cs.CV

Toward Training-Free Zero-Shot Anomaly Detection in 3D Medical Images: A Batch-Based Approach Using 2D Foundation Models

Tai Le-Gia

aDepartment of Mathematics, Chungnam National University, Daejeon, Republic of Korea, annotated training data may be unavailable. Most existing zero-shot anomaly detection methods, limited by the availability and diversity of pathological, ical images using readily available 2D foundation models, unavailable in a single orientation, the token construction

2026-06-18视觉感知三维

针对三维医学影像中异常标注和正常训练集难获取、3D基础模型不足的问题,论文提出CS3F:用冻结2D ViT按三轴切片提特征,经深度池化构成体素token,并以跨受试者最近邻相似性给异常打分;再用随机投影和粗到细token化缓解计算量与小病灶信号稀释。实验覆盖脑MRI多病种和肺CT,显示其优于CLIP式零样本基线,并可接近重建式UAD,但细粒度增益受病灶对比度和模态影响。

Low-Cost Neuromorphic Fall Detection Using Synthetic Event Data and Hybrid SNNs Figure 1
2026-06-18cs.LG

Low-Cost Neuromorphic Fall Detection Using Synthetic Event Data and Hybrid SNNs

Guillermo Rojas, Gonzalo Soto, Daniel Yunge

School of Electrical Engineering, NFDD SNN, is available as a Kaggle repository [11]. The

2026-06-18视觉感知

面向养老/辅助生活中的低功耗、隐私友好跌倒检测,论文用普通手机视频经 v2e 合成 DVS 事件流,构建 NFDD 数据集,并训练 CNN+SNN 混合模型以替代昂贵事件相机。模型先在 DVS128Gesture 上达到 91.4% 准确率,再迁移到行走、坐下、跌倒三类任务;文中称效率显著提升且精度未明显牺牲,但 NFDD 的完整量化结果和增益来源未充分说明。

Clinically Aligned Geometry Constraints for Robust IVUS Vessel Boundary Segmentation Figure 1
2026-06-18cs.CV

Clinically Aligned Geometry Constraints for Robust IVUS Vessel Boundary Segmentation

Yunshu Chen, Litao Yang, Giuseppe Di Giovanni, Jordan Tan, Deval Mehta, Andrew Lin, Derek Chew, Masasi Fujino, Julie Butters, Stephen Nicholls, Zongyuan Ge, Kyung Hoon Cho

2026-06-18视觉感知优化算法学习理论安全鲁棒

针对 IVUS 管腔与外弹力膜分割中高 Dice 仍可能带来边界漂移、拓扑错误和临床几何测量偏差的问题,论文提出 GeoCat:用 5 帧时序输入、笛卡尔/极坐标双编码器交叉注意力,并在极坐标域加入可微几何一致性损失直接约束直径、角度和面积。在 146 名患者 12,242 帧上,Dice 达 0.93,95HD 降至 0.14 mm,拓扑违规率 1.0%,直径误差约 0.13–0.16 mm。

Rethinking the Pointer Loss in Table Structure Recognition: Geometry-Aware Pointer Loss for Spatial Locality Figure 1
2026-06-18cs.CV

Rethinking the Pointer Loss in Table Structure Recognition: Geometry-Aware Pointer Loss for Spatial Locality

Hong-Jun Choi, Jongho Lee, Jaeyoung Kim

Teamreboott Inc., South Korea, Our code is available at https://github.com/teamreboott/GAP

2026-06-18视觉感知

本文针对表格结构识别中指针网络常把单元格对齐到相邻格的问题,指出79.6%的指针错误发生在曼哈顿距离≤2的邻近位置,而标准交叉熵对所有负样本等权。作者提出GAP Loss,按与真值的几何距离重加权指针损失,将梯度集中到易混淆邻格,不改模型且无额外推理开销;在PubTabNet和SynthTabNet上减少相邻格错误并达到新的SOTA。

PEFT-MedSAM: Efficient Fine-Tuning of Medical Foundation Models for Explainable Skin Lesion Segmentation Figure 1
2026-06-18cs.CV

PEFT-MedSAM: Efficient Fine-Tuning of Medical Foundation Models for Explainable Skin Lesion Segmentation

Asad Channa, Abdullah Khan, Asghar Ali Chandio, Aamir Akbar, Shahzad Memon, Aqib Hussain, Ameer Hamza

Department of Computer Science, Quaid-e-Awam University of Engineering, Sciences &, Department of Artificial Intelligence, Quaid-e-Awam University of Engineering, Sciences &, Department of Computer Science, Sindh Madressatul Islam University, City Campus, Karachi, Department of Computer Science and Digital Technologies, School of Architecture, Computing and, normally be detected. However, most deep learning methods available do not perform well., The International Skin Imaging Collaboration (ISIC) challenges have set a high benchmark

2026-06-18视觉感知

针对皮肤镜病灶分割中标注成本高、从头训练模型泛化和临床可解释性不足的问题,论文提出 PEFT-MedSAM:冻结 MedSAM 的图像与提示编码器,仅微调轻量 mask decoder(约 4.3% 参数)。在 ISIC 2018 上 Dice 达 0.9411、IoU 0.8918,优于 U-Net 和零样本 MedSAM;PH2 外部验证 Dice 为 0.9467±0.0310,并用 Grad-CAM/Pointing Game 补充解释性评估。

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation Figure 1
2026-06-18cs.CV

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

2026-06-18视觉感知

现有自回归视频扩散模型多只能按时间正向生成,难以支持倒序扩展、首尾补帧等创作流程。UniTemp通过双向蒸馏训练单一学生模型,并指出反向生成的块间闪烁源于Causal 3D VAE缺失过去上下文,进而引入blockwise anchor latents补足边界上下文。实验显示其在短/长视频生成上接近正向专用方法,同时支持双向扩展、inbetween、循环、场景过渡和视觉故事生成。

Spatially Stratified Distillation for Heterogeneous Radar Place Recognition Figure 1
2026-06-18cs.CV

Spatially Stratified Distillation for Heterogeneous Radar Place Recognition

Sagun Singh Shrestha, Samuel Harding, Abdelwahed Khamis, Saimunur Rahman, Peyman Moghadam

CSIRO Robotics, Brisbane, Australia 2 University of Queensland, Brisbane, Australia

2026-06-18视觉感知

面向低成本4D车载雷达查询与高密度旋转雷达地图匹配,本文针对4D雷达稀疏、视场窄导致跨会话地点识别退化的问题,提出空间分层蒸馏:对双方共同观测区域强对齐,对仅教师可见结构施加折扣监督,避免逼迫学生“幻觉”不可观测内容。在HeRCULES上,异构AR@1从0.722提升至0.766,同构4D检索从0.905提升至0.954。

Multi-Class Brain Tumor Classification Using Advanced Deep Learning Models: A Comparative Study Figure 1
2026-06-18cs.CV

Multi-Class Brain Tumor Classification Using Advanced Deep Learning Models: A Comparative Study

Asad Channa, Asghar Ali Chandio, Akhtar Hussain Jalbani, Mehwish Leghari, Shahzad Memon

Department of Computer Science, Quaid-e-Awam University of Engineering, Sciences &, Department of Artificial Intelligence, Quaid-e-Awam University of Engineering, Sciences &, Department of Data Science, Quaid-e-Awam University of Engineering, Sciences & Technology, Department of Computer Science and Digital Technologies, School of Architecture, Computing and, [15]), are then fine-tuned to better classify medical images on smaller, labeled datasets [16,17]. The

2026-06-18视觉感知

针对脑肿瘤 MRI 多分类中人工阅片耗时且不同 CNN 难以公平比较的问题,论文在约 1 万张四类 MRI 上统一评测自建 CNN、VGG16/19、DenseNet121 与 EfficientNetB0。核心洞察是模型效率可能比单纯加深更关键:EfficientNetB0 以 95% 准确率最佳,并将脑膜瘤召回率由基线约 20% 提升到 89%;但增益可能主要来自预训练架构与数据规模,外部泛化仍需进一步验证。

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs Figure 1
2026-06-18cs.CV

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

Inha University

2026-06-18视觉语言三维

这篇论文针对VLM中大量视觉token带来的推理开销,指出现有多样性剪枝依赖归一化余弦相似度会丢失幅值信息,难以重构原始视觉表征。作者提出SPARE,将token剪枝建模为列子集选择,通过投影残差和RRQR式贪心选择保留子空间结构,并发现低图文相关token反而有助于保留上下文。实验显示其免训练、即插即用,在LLaVA上最多剪掉94%视觉token仍保持约95%基线性能,并在多技能组合推理任务上优于已有方法。

InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Search Figure 1
2026-06-18cs.LG

InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Search

Qinqin Zhou, Fuhai Chen, Jipeng Wu, Zhiwei Chen, Zhikai Hu, Weiwei Cai

School of Computer and Data Science, Fuzhou University, School of Computer and Data Science, Minjiang University, School of Artificial Intelligence, Nanchang University, Department of Computer Science, Hong Kong Baptist University, School of Interdisciplinary Medicine and Engineering, Harbin Medical University

2026-06-18视觉感知

针对零成本 NAS 代理多依赖割裂启发式、难解释“架构为何可训练”的问题,本文提出 InTrain,将可训练性视为由前向表示几何容量与反向优化韧性共同决定的架构不变量,分别用激活协方差参与率和累积梯度健康度度量,并以尺度不变乘法耦合。实验在 NAS-Bench-101/201 和 MobileNetv2 空间中显示,其排序相关性接近集成代理,优于多数单指标方法。

BrainFusionNet: a deep learning and XAI model to understand local, global, and sequential features of MRI images for improved brain tumour detection Figure 1
2026-06-18cs.CV

BrainFusionNet: a deep learning and XAI model to understand local, global, and sequential features of MRI images for improved brain tumour detection

Md Taimur Ahad, Bo Song, Yan Li

School of Mathematics, Physics and Computing, University of Southern, School of Engineering, University of Southern Queensland, Toowoomba, evaluated on two publicly available MRI datasets. K-fold validation suggests 98% accuracy on both datasets. The

2026-06-18视觉感知

针对 MRI 噪声、肿瘤边界模糊及深层网络中特征消失导致的脑肿瘤识别困难,论文提出 BrainFusionNet,将 CNN 的局部/层级特征、ViT 的上下文建模与 GRU 的序列关系学习融合,并用 SHAP、LIME、Grad-CAM解释判别区域,还分析像素强度对分类的影响。在两个公开 MRI 数据集上,K 折验证准确率均约 98%,高于文中对比的最佳 CNN/迁移学习结果约 96%,但具体增益来源仍可能混合来自架构融合与数据设置。

LandslideAgent with Multimodal LandslideBench: A Domain-Rule-Augmented Agent for Autonomous Landslide Identification and Analysis Figure 1
2026-06-18cs.CV

LandslideAgent with Multimodal LandslideBench: A Domain-Rule-Augmented Agent for Autonomous Landslide Identification and Analysis

Chengfu Liu, Dongyang Hou, Junwu Xiang, Cheng Yang, Xuezhi Cui, Zeyuan Wang, Liangtian Liu, Zelang Miao

2026-06-18视觉语言

针对现有滑坡遥感方法偏重视觉定位、缺少地学语义推理且通用 VLM 易产生领域幻觉的问题,论文构建含七类细粒度标签、掩膜与文本描述的 LandslideBench,并用 LoRA 训练 LandslideVLM,再以领域规则约束的 LandslideAgent 调度工具完成识别分析。实验显示其在滑坡判别、细分类和语义描述上分别提升 10.96%、32.87%、15.91%,并支持多源空间数据的自动推理。

On-Manifold Variational Learning with Heat-Kernel Priors Figure 1
2026-06-18cs.CV

On-Manifold Variational Learning with Heat-Kernel Priors

Jiarui Xing, Tal Zeevi, Nian Wu, Jian Wang

Yale School of Medicine, New Haven CT, 06510, USA, University of Virginia, Charlottesville, VA, 22903, USA, Harvard Medical School, Boston MA, 02115, USA, cohorts can reveal clinically meaningful prototypes without expert labels, sub-population uncertainty score enables label-free quality assessment., assume that expert-provided labels faithfully delineate these groups. In practice, however, diagnostic labels across a wide range of clinical domains are unreliable, beyond label noise alone., Code and implementation details are available at https://github.com/jr-xing/, with poorly reproducible delineation [18]. In neuroimaging, the diagnostic labels, chiatric neuroimaging [21]. Label noise is well-recognized, paradigms simultaneously addresses label-free representation learning, manifold-

2026-06-18视觉感知

这篇论文针对医学影像无监督分群中标签不可靠、VAE/GMM 原型由欧氏均值导致偏离潜在流形和组件退化的问题,提出热核加权潜在图上的流形锚定变分学习:EM 的 M 步用扩散中心性最高的图 medoid 作为子群原型,并以 Dirichlet 能量保持潜在空间平滑,同时给出子群不确定性。实验在心肌瘢痕与脑 MRI 等数据上优于 VAE-GMM、Diffusion-GMM,原型更清晰且大 K 下更稳定。

Intrinsic 4D Gaussian Segmentation from Scene Cues Figure 1
2026-06-18cs.CV

Intrinsic 4D Gaussian Segmentation from Scene Cues

Hasan Yazar, Mohamed Rayan Barhdadi, Erchin Serpedin, Mehmet Tuncel, Hasan Kurban

Istanbul Technical University, Texas A&M University, Hamad Bin Khalifa University, Project Page: kurbanintelligencelab.github.io/intrinsic-gs/

2026-06-18视觉感知三维

针对4D Gaussian场景分割依赖SAM等2D掩码、在多视角多帧动态场景中成本高且一致性受限的问题,论文提出Intrinsic-GS:直接利用高斯元的外观、尺度、朝向、形变轨迹和渲染边界构建稀疏亲和图,并用Leiden聚类,无需训练和外部掩码。结果显示其在Neu3D/HyperNeRF达0.746/0.575 mIoU,Neu3D几何-only变体达0.902并匹配SAM监督TRASE,且在HyperNeRF相关阶段快12.5倍。

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation Figure 1
2026-06-18cs.RO

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

University of Toronto, Vector Institute, Stanford University, Allen Institute for AI

2026-06-18机器人视觉感知

针对真实机器人操作评测成本高、视频世界模型长时滚动易漂移且多视角不一致的问题,SC3-Eval将预训练视频基础模型改造成闭环评测器,通过前向-逆动力学一致性、跨视角补全一致性和测试时逆动力学不确定性早停来约束生成轨迹。其在381小时桌面清理数据上评测7个VLA策略,闭环Pearson达0.929、MMRV为0.119,优于Ctrl-World等基线,并能复现真实失败模式。

Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification Figure 1
2026-06-18cs.CV

Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification

Nan Zhou, Ke Zou, Meng Liu, Linchao He, Jiaqi Zhu, Yi Zhang, Hu Chen, Huazhu Fu

2026-06-18视觉语言视觉感知

医疗VLM在报告生成和问答中常出现缺乏影像依据的幻觉,现有相似度或注意力方法难以验证“说法是否真由对应区域支持”。本文提出无需训练的CoEV,通过遮挡诊断相关区域构造反证探针,并用文本事实性与视觉依赖性四象限定位、修正可疑陈述。在四个医疗数据集上,检测PR-AUC/ROC-AUC平均提升3.0/3.9个百分点,纠错Micro-F1最高提升12.5%,报告幻觉率下降超过11.9%。

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops Figure 1
2026-06-18cs.CV

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops

Denis Savytski, Aiden Lei, Heding Liu, Warren Yang, Sihan Liang, Alexander Liu, Zhe Zhao

2026-06-18视觉感知

针对长视频生成虽有视觉质量但常缺乏叙事连贯和创作者意图的问题,论文提出 CHIEF:以创作者为中心的迭代视频生成框架,用人格化多模态 LLM 模拟不同观众观看并给出主观反馈,再由翻译/细化代理转成提示更新。实验包括 1 分钟短片自迭代和学生制作 10 分钟短片,现场观众评分从基线 2.4/5 提升到 4.1/5,但评价规模与增益来源仍需更充分说明。

No Figure
2026-06-18cs.DC

Splaxel: Efficient Distributed Training of 3D Gaussian Splatting for Large-scale Scene Reconstruction via Pixel-level Communication

Wenqi Jia, Zhewen Hu, Ying Huang, Yu Gong, Stavros Kalafatis, Yuke Wang, Wei Niu, Chengming Zhang, Ang Li, Sheng Di, Yuede Ji, Bo Fang, Miao Yin

Texas A&M University, Rice University, University of Georgia, University of Houston, University of Washington, Argonne National Labs

2026-06-18三维

本文针对大规模 3D Gaussian Splatting 分布式训练中,高斯级 all-to-all 交换随场景规模迅速放大并主导迭代时间的问题,提出 Splaxel:各 GPU 仅渲染本地高斯并交换部分像素,再做全局合成,以像素级通信保持一致性且使通信量基本不随高斯数增长;同时用几何/透射率可见性预测削减冗余,并通过无冲突视角调度提升利用率。在最高 1.2 亿高斯的大场景上,相比现有分布式 3DGS 框架最高提速 7.6 倍且重建质量基本保持。

APT: Atomic Physical Transitions for Causal Video-Language Understanding Figure 1
2026-06-18cs.CV

APT: Atomic Physical Transitions for Causal Video-Language Understanding

Shang Wu, Haoran Lu, Songling Liu, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

Northwestern University, Dolby Laboratories

2026-06-18视觉感知

论文针对现有视频物理理解多停留在片段级事件标签、难解释“为什么发生”的问题,提出原子物理转变 APT,将视频表示为带时间戳的因果状态变化链,并构建含 14 类、2.73 万实例的混合数据。实验显示现有 VLM 零样本召回仅约 10–14%;APT-Tune 用少量 LoRA 参数将召回提升到 38.1%,同时改善事件级迁移,说明转变级监督可补足物理因果理解。

No Figure
2026-06-18cs.CV

Aerial-ground LiDAR place recognition with patch-level self-supervised learning and expanded reciprocal re-ranking

Yandi Yang, Xianghong Zou, Jianping Li, Haofeng Xie, Saurav Uprety, Hongzhou Yang, Naser El-Sheimy

2026-06-18视觉感知

面向城市峡谷中 GNSS/视觉不可靠、地面先验地图需预采且覆盖不足的问题,论文将公开 ALS 航空点云作为先验,处理航地 LiDAR 的视角/密度域差与初检误匹配。方法把多尺度 patch 级自监督语义一致性并入场景级检索,并利用 ALS 空间结构做扩展互惠重排序。新建 CS-Urban-Scenes 后,检索网络在 Recall@1 上较 SOTA 平均提升 9.8%,ER 重排序无需训练再提升 10.2%。

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Leveraging DINOv3 for Robust Outdoor Scene Understanding in Field Robotics Figure 1
2026-06-18cs.CV

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Leveraging DINOv3 for Robust Outdoor Scene Understanding in Field Robotics

Jaeil Park, Hyobin Choi, Sangjin Lee, Hyungtae Lim, Sung-Hoon Yoon

∗ Co-advised this work. 1 Multimodal Intelligence and Perception Laboratory (MIP), Department of Electrical Engineering and Computer Science, Daegu Gyeongbuk Institute of Science and Technology (DGIST), Massachusetts Institute of Technology (MIT)

2026-06-18机器人视觉感知安全鲁棒

面向野外机器人在非结构化户外场景中遇到的长尾细粒度类别、局部纹理歧义与多平台视角变化,本文给出 GOOSE 2D 挑战冠军方案。方法并未提出全新架构,而是将 DINOv3 ViT-L/16、ViT-Adapter 与 Mask2Former 结合,并在全局 [CLS] token 上加入粗类别多标签辅助损失,推理时使用多尺度/翻转 TTA 和前三检查点集成。最终在隐藏测试集取得 76.57% 综合分、69.32% 细类 mIoU 和 83.81% 粗类 mIoU,排名第一。

Multi-Modal Hyper-Graph Fusion for Low-Light Crowd Counting Figure 1
2026-06-18cs.CV

Multi-Modal Hyper-Graph Fusion for Low-Light Crowd Counting

Hao-Yuan Ma, Li Zhang, Yushi Qiu, Jie Gao, Yan Zhang, Bangjun Wang

School of Computer Science and, Technology, Soochow University, Crowd Dataset), where the synthetic ones provide controllable, based methods directly predict head centers or point sets through

2026-06-18视觉感知

本文针对夜间监控、集会等场景中低照度导致 RGB 人群计数失效的问题,将任务从 Retinex 视角表述为特征级反射率重校准。核心做法是用由图像获得的深度与 Canny 边缘作为几何/结构先验,并通过多模态超图融合建模高阶互补关系,再用可变形矩形稀疏注意力聚焦前景区域。作者还构建 SHA_Dark、SHB_Dark 与 LC-Crowd 三个基准,实验显示 LCNet 在三者上整体优于现有 SOTA,但运行时稀疏算子仍是限制。

Experimental Analysis of Neural Network-Based Image Classification on the CIFAR-10 Dataset Figure 1
2026-06-18cs.CV

Experimental Analysis of Neural Network-Based Image Classification on the CIFAR-10 Dataset

Necati Kagan Erkek, Emre Balci, Berkin Halay

2026-06-18视觉感知数据集/基准

本文以 CIFAR-10 低分辨率图像分类为动机,系统复现实验流程来说明 MLP 展平输入与 CNN 保留空间局部性的差异。核心洞察不是提出新模型,而是用学习曲线展示表示学习与记忆化的分界:六层卷积、三次池化的 CNN 在 Adam、10 轮训练下验证准确率最高约 74.77%,但中后期验证损失上升,提示需早停、正则化或数据增强。

MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction Figure 1
2026-06-18cs.CV

MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction

Jianing Zhang, Chenhao Zheng, Yajun Yang, Max Argus, Rustin Soraki, Winson Han, Taira Anderson, Chun-Liang Li, Shuo Liu, Jiafei Duan, Zhongzheng Ren, Jieyu Zhang, Ranjay Krishna

2026-06-18三维

面向机器人规划和视频生成中“预测未来物体运动”的需求,MolmoMotion主张用世界坐标系下的物体附着3D点轨迹替代像素、2D轨迹或类别模板,以获得跨视角、跨类别且可直接用于下游的运动表示。论文构建了从116万公开视频自动标注的MolmoMotion-1M、人工验证的PointMotionBench,并训练支持自回归坐标预测与flow matching生成的语言条件模型。实验显示其在基准上显著优于既有运动预测方法,并能提升机器人操作样本效率与泛化、为视频生成提供更真实的运动引导。

Rethinking Text-to-Image as Semantic-Aware Data Augmentation for Indoor Scene Recognition Figure 1
2026-06-18cs.CV

Rethinking Text-to-Image as Semantic-Aware Data Augmentation for Indoor Scene Recognition

Trong-Vu Hoang, Quang-Binh Nguyen, Dinh-Khoi Vo, Hoai-Danh Vo, Minh-Triet Tran, Trung-Nghia Le

University of Science, VNU-HCM, Vietnam, Vietnam National University, Ho Chi Minh City, Vietnam, these advancements centre around two dominant approaches:

2026-06-18视觉感知

室内场景识别常受真实标注数据不足、光照遮挡和物体布局复杂影响,限制机器人等应用的感知鲁棒性。论文将 Stable Diffusion 作为语义感知数据增强工具,通过图像描述生成提示、合成室内图像并去除重复与离群样本,同时用 DIRE 表征检测合成图像滥用。在 MIT Indoor Scene 上,合成增强使 EfficientNetV2 达到 84.2% 准确率;MobileNetV3 基于 DIRE 可 100% 识别 SD 生成图像。

Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion Figure 1
2026-06-18cs.CV

Forged Calamity: Benchmark for Cross-Domain Synthetic Disaster Detection in the Age of Diffusion

Duc-Manh Phan, Quoc-Duy Tran, Duy-Khang Do, Anh-Tuan Vo, Hai-Dang Nguyen, Trong Le Do, Mai-Khiem Tran, Vinh-Tiep Nguyen, Tam V. Nguyen, Isao Echizen, Minh-Triet Tran, Trung-Nghia Le

University of Science, VNU-HCM, Ho Chi Minh, Vietnam, Vietnam National University, Ho Chi Minh, Vietnam, University of Information technology, VNU-HCM, Ho Chi Minh, Vietnam, University of Dayton, Ohio, United States, National Institute of Informatics, Tokyo, Japan

2026-06-18视觉感知生成模型数据集/基准

扩散模型已能伪造逼真的火灾、洪水、地震等灾害图像,可能误导舆情与应急响应;论文提出 Forged Calamity 基准,汇集 6000 张真实图像和由四种扩散模型生成的 24000 张合成图像,专门考察跨灾种、跨生成器检测泛化。实验显示检测器在域内表现好,但遇到未见生成器或灾害类型时准确率最高下降约 50%,零样本方法也不稳定,说明现有取证模型明显依赖生成器指纹而非通用真实性线索。

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning Figure 1
2026-06-18cs.CV

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning

Minh-Loi Nguyen, Xuan-Vu Le, Long-Bao Nguyen, Hoang-Bach Ngo, Trung-Nghia Le

University of Science, VNU-HCM, Ho Chi Minh City, Vietnam, Vietnam National University, Ho Chi Minh City, Vietnam

2026-06-18视觉语言视觉感知

面向新闻图像中人物、事件时间地点等难以仅由视觉判断的信息缺口,论文提出层次化多模态检索增强 captioning:按标题、正文、图注和视觉位置对新闻文章加权检索,并结合内容-视觉、视觉-视觉与语篇位置相似度;随后用 VLM 生成视觉上下文、抽取相关文章句子,再由 LLM 合成描述。在 OpenEvent-V1 私测集的 EVENTA 2025 挑战中排名第 5,总分 0.2824。

A Prototypical Signature Approach for Writer-Independent Offline Signature Verification Figure 1
2026-06-18cs.CV

A Prototypical Signature Approach for Writer-Independent Offline Signature Verification

Kecia G. de Moura, Robert Sabourin, Rafael M. O. Cruz

natures using static images. Since real forgeries are rarely available, negative samples are, scalability and computational efficiency., Implementation of the method is available at, Writer-independent system, Biometrics, Scalability, [21]. However, these samples are not always available during the training stage [7], forcing systems, more informative training samples to improve performance, efficiency, and scalability. Yet, identi-, scalable real-world deployment.

2026-06-18视觉感知

论文针对离线签名验证中真实伪造样本稀缺、随机负样本冗余且对熟练伪造不够“难”的问题,提出先对签名特征做数据驱动聚类摘要,生成非可识别的原型签名,再按与用户真签名中心的距离选择更有信息量的负样本。实验在 GPDS Synthetic、CEDAR、MCYT-75 上验证了该策略可提升熟练伪造检测,并对不同特征骨干较稳健;结合原始形式线性 SVM 时,还显著降低存储与计算成本,具备更好的扩展性。

DART: A design-aware microfluidic chip paradigm for real-time live-cell image analysis Figure 1
2026-06-18q-bio.QM

DART: A design-aware microfluidic chip paradigm for real-time live-cell image analysis

Johannes Seiffarth, Matthias Pesch, Lukas Scholtes, Dietrich Kohlheyer, Hanno Scharr, Katharina Nöh

Institute for Bio- and Geosciences, IBG-1: Biotechnology, Forschungszentrum J¨ulich, J¨ulich, Computational Systems Biotechnology (AVT.CSB), RWTH Aachen University, Aachen, Institute for Advanced Simulation, IAS-8: Data Analytics and Machine Learning, throughput-dependent setup burden limits the practical scalability of modern high-density chip, the structural knowledge already available in the chip design is generally not used during the

2026-06-18视觉感知

针对高通量微流控活细胞成像中 RoI 逐个定位、结构遮罩与离线分析随通量线性变慢的问题,DART 将芯片 CAD 蓝图通过嵌入式基准标记和深度学习检测对齐到实体芯片,使图像处理直接利用设计语义而非为每种几何重新训练。在含 8 类 RoI、1164 个位置的 SAK 芯片上,系统 5 分钟定位全部 RoI,40 ms 去除微流控结构,并在每图低于 1.1 s 完成含细胞分割的自动分析。

Architectural Bias in Face Presentation Attack Detection: A Comparative Study of Vision Transformers and Convolutional Neural Networks Figure 1
2026-06-18cs.CV

Architectural Bias in Face Presentation Attack Detection: A Comparative Study of Vision Transformers and Convolutional Neural Networks

Ngela Landon Ntung, Floride Tuyisenge, Jema David Ndibwile

College of Engineering, Carnegie Mellon University Africa, Kigali, Rwanda

2026-06-18视觉感知

针对人脸活体检测在深肤色群体上误拒更高的问题,本文比较 ViT 与 CNN 的架构偏置,核心洞察是全局自注意力可能弱化 CNN 的局部纹理/肤色反射依赖。在 CeFA 上,预训练 DeiT-S 达到 97.27% 准确率、0.86% EER,非洲与东亚 ACER 差距降至 0.13%,零样本中亚 BPCER 为 2.89% 而 ResNet18 为 10.44%;但增益来源不清,可能是注意力架构与 ImageNet 预训练共同作用。

Neural Phase Correlation Figure 1
2026-06-18cs.CV

Neural Phase Correlation

Cole Reynolds

Weyl Labs

2026-06-18视觉感知

论文针对现有稠密对应方法把图像各自编码、缺少显式变换表示的问题,将相位相关从固定傅里叶基推广为可学习的成对滤波基,把局部变换分解为二维子空间旋转,并用闭式残差筛选满足结构假设的子空间。该框架在 ACDC 心脏 MRI 配准上达到或超过已发表基线,在 CAMUS 上匹配最强结果,并能从量子波函数观测对中恢复本征态与能级。

Vines-DB: An RGB image dataset for multi-species ornamental vine segmentation Figure 1
2026-06-18cs.CV

Vines-DB: An RGB image dataset for multi-species ornamental vine segmentation

Saroj Burlakoti, Utsav Bhandari, Aaron Etienne, Shital Poudyal (Utah State University)

a Department of Plants, Soils and Climate, Utah State University, Utah, 84322, USA, b Department of Applied Sciences, Technology and Education, Utah State University, Utah, 84322, applications such as automated canopy cover estimation, species identification, and scalable field, Utah State University, Logan, Utah, United States of America, development of advanced models requiring high-quality labeled data., which are labor-intensive and difficult to scale for structurally complex species such as ornamental

2026-06-18视觉感知数据集/基准

针对观赏藤本冠层重叠、形态复杂导致人工测量和传统阈值分割难以规模化的问题,Vines-DB提供7个物种、168株植株的1218张田间高分辨率RGB图像及多边形实例标注,并保留跨月份重复成像以刻画季节变化。经预处理和增强后形成2307张训练/验证/测试数据,可用于多类分割、物种识别和冠层面积估计;文中主要贡献是数据集与流程,未报告模型性能增益。

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation Figure 1
2026-06-18cs.CV

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

2026-06-18视觉感知

本文针对 DMD/DMD2 将多步视频扩散模型蒸馏为少步模型时的多样性下降与过饱和伪影,指出根源在反向 KL 的 mode-seeking。DFD 的关键是把真实视频直接送入教师分数计算,用 teacher score discrepancy 将学生拉向真实数据分布,只需近似一行代码改动。实验在 Wan2.1-1.3B、Cosmos-Predict2.5-2B 的文生视频、图生视频等任务上,经过约 100–300 步微调即可改善动态、外观和多样性,部分结果甚至超过教师模型。

Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs Figure 1
2026-06-18cs.CV

Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

Chengwen Liu, Zhe Huang, Jisheng Dang, Hong Peng, Qi Tian, Tat-Seng Chua

School of Information Science and Engineering, Lanzhou University, Lanzhou, China, Beijing University of Posts and Telecommunications, Beijing, China, School of Computing, National University of Singapore, Singapore

2026-06-18视觉感知

针对视频多模态大模型仅用最终答案奖励难以指明应依赖哪些帧证据的问题,本文提出 CF-GRPO:用时间覆盖、场景切换和问题相关性构造无人工时序标注的共识帧先验,并通过 CFR 奖励其与模型帧使用分布对齐。实验显示 VideoCFR 在复杂视频推理基准上具竞争力并提升部分指标,消融表明先验、稀疏聚合和分布锐化均有贡献。

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer Figure 1
2026-06-18cs.CV

RegimeVGGT: Layer-Wise Spatially Preserving Redundancy Removal for Visual Geometry Grounded Transformer

Jinhao You (1), Shuo Lyu (1), Zhuohang Lyu (1), Tanxuan Li (1), Zibo Zhao (1), Jiaxiang Hu (2), Kai Tang (3), Yichen Guo (3) ((1) University of Pennsylvania, (2) University of California, Irvine, (3) Nanyang Technological University)

University of Pennsylvania, University of California, Irvine, Nanyang Technological University

2026-06-18视觉感知

本文针对 VGGT 多视角三维重建中跨帧注意力随帧数和 patch 数二次增长、长序列推理过慢的问题,指出 24 层聚合器存在浅层缺少跨视图结构、中层负责对齐、深层几何冗余但影响位姿的分区规律,并据此提出无需训练的双轴 U 形压缩:显著性保护 token 合并与保留空间覆盖/相机 token 路径的 K/V 下采样。在多组重建与位姿实验中,RegimeVGGT 基本保持质量,并在 ScanNet-1000 上相对 VGGT* 达到 6.7× 加速。

CAOA -- Completion-Assisted Object-CAD Alignment Figure 1
2026-06-18cs.CV

CAOA -- Completion-Assisted Object-CAD Alignment

Hiranya Garbha Kumar, Minhas Kamal, Balakrishnan Prabhakaran

University at Albany, licly available on GitHub.

2026-06-18视觉感知

面向室内 RGB-D 语义重建中因遮挡、噪声和实例分割误差导致的 CAD 与物体 9DoF 对齐不稳问题,CAOA 的核心思路是先用带场景上下文的点云补全净化目标几何,再结合 CAD 对称性编码与对称感知损失估计位姿;同时构建 S2C-Completion 真实补全基准和更贴近室内扫描的 SN-Indoor 合成数据。文中在 Scan2CAD 上报告较现有方法约 17% 的对齐准确率提升,增益可能主要来自补全数据与对称建模的联合作用。

Budget-Aware Adaptive Adversarial Patches for Black-Box Object Detection Figure 1
2026-06-18cs.CV

Budget-Aware Adaptive Adversarial Patches for Black-Box Object Detection

Pedram MohajerAnsari, Amir Salarpour, David Fernandez, Mert D. Pesé

School of Computing, Clemson University, USA, is available at https://github.com/pedram-mohaj

2026-06-18视觉感知

面向自动驾驶、机器人和监控中常见的黑盒目标检测器,论文指出现有对抗补丁常忽视查询预算、补丁位置/大小联合优化和可见面积评估。PATCHBANDIT用上下文 Thompson 采样选位置、NES更新纹理,并在停滞时增大补丁,同时区分普通视图成功率与EOT鲁棒性。实验在YOLOv5、Faster R-CNN、YOLOS上分别达77.5%、89.7%、59.1%严格抑制,并显示物理打印迁移潜力。

2026-06-17

112 篇
Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion Figure 1
2026-06-17cs.CV

Future Dynamic 3D Reconstruction: A 3D World Model with Disentangled Ego-Motion

Nils Morbitzer, Jonathan Evers, Artem Savkin, Thomas Stauner, Nassir Navab, Federico Tombari, Stefano Gasperini

2026-06-17强化学习三维

面向自动驾驶/机器人中长期预测,论文指出2D视频式世界模型会把自运动与场景运动混在一起,导致几何漂移和物体消失。FR3D在预训练3D重建模型的潜空间中自回归预测,将相机位姿与3D场景演化解耦,并用教师-学生蒸馏引入基础模型几何先验。实验显示其可从单目历史观测预测多数据集未来动态3D重建,在约2秒预测范围内保持较好几何一致性和零样本泛化。

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification Figure 1
2026-06-17cs.CV

Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification

Wujian Peng, Lingchen Meng, Yuxuan Cai, Xianwei Zhuang, Yuhuan Yang, Rongyao Fang, Chenfei Wu, Junyang Lin, Zuxuan Wu, Shuai Bai

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Innovation Institute, Qwen Team, Alibaba Inc., Website: https://sharelab-sii.github.io/uniar-web

2026-06-17视觉语言

针对统一多模态模型中理解与生成常由双视觉 tokenizer 分裂表示空间、生成结果需重编码的问题,UniAR主张用单一离散视觉 tokenizer 作为共享上下文桥梁。其核心是多层视觉特征融合、无查表 bitwise 量化、并行 bitwise 自回归预测与 DiT 解码器,在压缩视觉序列的同时保留语义和细节。实验显示其在图像生成的文本渲染、指令遵循和编辑上达到领先表现,理解基准保持有竞争力;部分收益可能也来自大规模预训练、SFT 与 RL 数据流程。

MOCHI: Motion Enhancement of Collaborative Human-object Interactions Figure 1
2026-06-17cs.CV

MOCHI: Motion Enhancement of Collaborative Human-object Interactions

Jiye Lee, Yonghun Choi, Jungdam Won

MOCHI: Motion Enhancement of Collaborative Human-object, JIYE LEE, Seoul National University, South Korea, YONGHUN CHOI, Seoul National University, South Korea, JUNGDAM WON∗, Seoul National University, South Korea, Collaborative human-object interaction shows dynamic and complex move-, laborative multi-human object interaction (MHOI) scenarios requires high-, Enhancement of Collaborative Human-object Interactions), a two-stage, Authors’ addresses: Jiye Lee, Department of Computer Science and Engineering, Seoul, Yonghun Choi, Department of, Jungdam Won, Department of Computer Science and Engineering, Seoul, ment of Collaborative Human-object Interactions. ACM Trans. Graph. 45, 4, Collaborative human-object interaction scenarios, such as carrying

2026-06-17视觉感知

MOCHI针对多人协作搬运、放置物体等MHOI数据难采集且常有遮挡、手物错位、抖动和手指缺失的问题,提出两阶段增强框架:先从噪声身体姿态优化出物理合理且语义一致的抓握与手物序列,再用单人扩散运动先验结合人-物、人-人约束细化全身动作。实验显示其可提升捕获或生成的多类MHOI序列质量,并支持不同人数、物体几何变化与关键帧创作。

EventDrive: Event Cameras for Vision-Language Driving Intelligence Figure 1
2026-06-17cs.CV

EventDrive: Event Cameras for Vision-Language Driving Intelligence

Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi

University Toulouse, CNRS, CerCo, Toulouse, France, ETIS UMR 8051, CY Cergy Paris University, ENSEA, CNRS, France

2026-06-17视觉语言视觉感知

本文针对事件相机在自动驾驶中多停留于检测、分割等低层任务,缺乏与语言推理和决策闭环结合的问题,提出 EventDrive 基准与 EventDrive-VLM:以47.1万事件-图像-语言样本覆盖感知、理解、预测、规划17个子任务,并用多时间尺度事件金字塔、MoE动态时域选择和Q-Former对齐融合RGB与事件流。实验显示事件流主要提升运动精度、低光/模糊鲁棒性和速度/意图预测,融合模型较单一模态在各任务更稳定。

Adaptive Volumetric Mechanical Property Fields Invariant to Resolution Figure 1
2026-06-17cs.CV

Adaptive Volumetric Mechanical Property Fields Invariant to Resolution

Rishit Dagli, Donglai Xiang, Vismay Modi, Xuning Yang, Gavriel State, David I.W. Levin, Maria Shugrina

2026-06-17视觉感知

面向机器人训练和交互式数字世界,现有3D资产普遍缺少体积内的杨氏模量、泊松比和密度,手工标注难以规模化。AdaVoMP用稀疏自适应体素树表示形状与材料,并以稀疏Transformer自回归生成粗到细的结构和值,把容量集中在边界和复杂部件。实验称其在更低测试计算下较VoMP/Pixie更准确,并将有效分辨率从64³提升到1024³。

Looped World Models Figure 1
2026-06-17cs.LG

Looped World Models

Hongyuan Adam Lu, Z.L. Victor Wei, Qun Zhang, Jinrui Zeng, Bowen Cao, Lingwei Meng, Mocheng Li, Zezhong Wang, Haonan Yin, Naifu Xue, Minyu Chen, Cenyuan Zhang, Zefan Zhang, Hao Wei, Jiawei Zhou, Haoran Xu, Hao Yang, Ronglai Zuo, Tongda Xu, Yonghao Li, Jian Chen, Hebin Wang, Zeyu Gao, Yang Li, Wei Zhao, Qimin Zhong, Siqi Liu, Yumeng Zhang, Leyan Cui, Zhangyu Wang, Wai Lam

2026-06-17强化学习

论文针对世界模型长时域 rollout 中固定深度计算易累积误差、加深又推高部署成本的问题,提出 LoopWM:用参数共享的 Transformer 块对潜在环境状态做循环迭代细化,并通过谱约束保持递归稳定、按转移难度自适应计算。实验中约 1B 参数模型在 AlfWorld 上 BLEU 最优、EM/F1 接近强基线,并宣称最高 100× 参数效率,但该效率增益的具体来源文中未充分说明。

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners Figure 1
2026-06-17cs.CR

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners

Xiaojun Jia, Jie Liao, Simeng Qin, Ke Ma, Wenbo Guo, Yebo Feng, Aishan Liu, Yang Liu

Nanyang Technological University, Singapore, Chongqing University, China, Northeastern University, China, University of Chinese Academy of Sciences, China, Beihang University, China

2026-06-17视觉语言

这篇论文关注多模态智能体技能审核中的盲区:现有扫描器多看文本、清单和代码,容易漏掉图片中承载的可执行恶意意图。作者提出 SkillCamo,将恶意命令伪装进技能图片并重写文档使其在运行时被联合解释;同时提出 ExecScan,从意图、行为、滥用风险到执行模拟进行多模态审计。实验显示该攻击对六类扫描器最高可达 90% 逃逸率,而 ExecScan 可将成功率降至 8%。

EgoCS-400K: An Egocentric Gameplay Dataset for World Models Figure 1
2026-06-17cs.CV

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

Rongjin Guo, Dong Liang, Yuhao Liu, Fang Liu, Tianyu Huang, Gerhard P. Hancke, Rynson W. H. Lau

City University of Hong Kong

2026-06-17强化学习数据集/基准

面向交互式世界模型,论文指出普通视频缺少可执行动作和状态监督,机器人数据又昂贵且场景有限。EgoCS-400K 的核心洞察是利用 CS/CS2 回放作为可审计轨迹源,同步渲染第一人称视频并解析键鼠、视角、状态、武器和事件,形成多粒度视频-动作-语言数据。结果是构建了超 40 万段、1 万小时、覆盖 13 张地图的数据集,可支持动作条件预测、状态/事件感知 rollout 和自我中心动作理解;其增益可能主要来自 scaling / data。

ReAge3D: Re-Aging 3D Faces with View Consistency Figure 1
2026-06-17cs.CV

ReAge3D: Re-Aging 3D Faces with View Consistency

Libing Zeng, Li Ma, Mingming He, Ning Yu, Paul Debevec, Nima Khademi Kalantari

Texas A&M University

2026-06-17三维

本文针对3D人脸重龄化中细小皱纹、肤质等年龄线索容易因多视角不一致而被抹平的问题,提出ReAge3D:先训练面向身份保持与年龄控制的2D扩散模型DiffReaging,再从正面枢轴视角向外通过光流传播与Masked-DiffReaging补全各视角,用一致的重龄化图像监督3DGS优化。实验显示其在2D年龄误差、身份保持以及3D视觉质量上优于FADING、FRAN和多种3D编辑基线,可实现20到80岁连续可控变化。

Neural Tree Reconstruction for the Open Forest Observatory Figure 1
2026-06-17cs.CV

Neural Tree Reconstruction for the Open Forest Observatory

Marissa Ramirez de Chanlatte, Arjun Rewari, Trevor Darrell, Derek J. N. Young

University of California, Berkeley, Department of Plant Sciences, University of California, Davis

2026-06-17三维

针对 OFO 现有无人机森林三维地图依赖 SfM、在林下和细枝叶结构上易产生伪影且影响火灾/碳汇等下游分析的问题,论文尝试将 NeRF 引入开放森林观测数据流程。核心洞察是用神经辐射场的体渲染和新视角合成能力弥补俯视影像稀疏与遮挡限制。结果主要为概念验证:相比 SfM 点云/网格,NeRF 渲染和提取网格在树干、枝叶等细节上更清晰,但定量评测和科学误差边界文中未充分说明。

Predicting Immune Biomarkers with MultiModal Mixture-of-Expert Pathology Foundation Models Empowers Precision Oncology Figure 1
2026-06-17cs.CV

Predicting Immune Biomarkers with MultiModal Mixture-of-Expert Pathology Foundation Models Empowers Precision Oncology

Tianyu Liu, Ziqing Wang, Zhaokang Liang, Tong Ding, Peter Humphrey, Lorraine Colón-Cartagena, Emily Ling-Lin Pai, Kenneth Tou En Chang, Mohamed Kahila, Jonathan Chong Kai Liew, Tinglin Huang, Rex Ying, Kaize Ding, Faisal Mahmood, Wengong Jin

Program of Computational Biology and Bioinforamtics, Yale University, USA, Broad Institute of MIT and Harvard, USA, Department of Statistics and Data Science, Northwestern University, USA, Department of Computer Science, Northeastern University, USA, Department of Computer Science, Harvard University, USA, Department of Pathology, Yale University, USA, Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania, USA, Department of Pathology and Laboratory Medicine, University of California, San Francisco, USA, Department of Pathology and Laboratory Medicine, KK Women’s and Children’s Hospital, SGD, Department of Biostatistics, Epidemiology and Informatics, Perelman School of Medicine, University of Pennsylvania, USA

2026-06-17视觉语言

针对仅用单一病理图像预测肿瘤免疫微环境标志物时分辨率低、临床/生物信息利用不足的问题,论文提出 MixTIME,用 MoE 路由融合图像、图文、图像-转录组等病理基础模型,并以分布与趋势感知损失预测 H&E 到 mIF 蛋白表达。在 HEMIT 与 ORION 上,模型在 17 个标志物相关性指标上总体优于 GigaTIME、HEX、ROSIE 等基线,并提升空间域识别、生存预测和病理报告生成等下游任务。

HLS-GPT: A Generative Pretrained Transformer (GPT) for Continental-Scale NASA Harmonized Landsat and Sentinel-2 (HLS) Reflectance Reconstruction Across All Bands on Arbitrary Dates Figure 1
2026-06-17cs.CV

HLS-GPT: A Generative Pretrained Transformer (GPT) for Continental-Scale NASA Harmonized Landsat and Sentinel-2 (HLS) Reflectance Reconstruction Across All Bands on Arbitrary Dates

Junjie Li, Hankui K. Zhang, David P. Roy

a, Geospatial Sciences Center of Excellence, Department of Geography and Geospatial, Sciences, South Dakota State University, Brookings, SD 57007, USA, b, Department of Geography, Environment, and Spatial Sciences, & Center for Global, Change and Earth Observations, Michigan State University, MI 48824, USA, geographic scalability, and/or are limited by patch-based designs with short temporal coverage that

2026-06-17生成模型三维

针对 Landsat/Sentinel-2 HLS 受云、轨道与传感器差异影响而时间序列稀疏不规则、难以获得任意日期全波段无缝反射率的问题,HLS-GPT 用分层 Transformer 分别建模两类传感器并融合特征,通过九年、25 万余 CONUS 像元的随机裁剪与遮蔽自监督训练重建 12 个月单像元序列。独立测试中各波段 RMSE 低于 0.026,遮蔽 10%–50% 时仍保持接近精度,并在未训练瓦片上优于传统拟合方法和 Prithvi。

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System Figure 1
2026-06-17cs.RO

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

Qwen-RobotNav Technical Report: A Scalable Navigation Model, We present Qwen-RobotNav, a scalable navigation model built on Qwen3-VL that, multiple task modes that select the navigation behaviour, and controllable observation, AMAP CV Lab, 2025, multi-task capability, but also a controllable interface whose observation strategy can be reconfigured by, ABot-N0 (AMAP CV Lab, 2025) retains only a sliding, We introduce Qwen-RobotNav, a scalable navigation model built on Qwen3-VL (Yang et al., 2025a) that, behaviour appropriate for each sub-goal. Second, controllable observation parameters, including visual

2026-06-17机器人

面向具身问答等长程任务,固定视觉上下文策略难以同时适配指令跟随、搜索、跟踪和驾驶。Qwen-RobotNav基于Qwen3-VL,将导航统一为航点预测,并用任务模式、token预算、时间衰减和相机权重构成可由上层规划器动态调控的接口;15.6M样本多任务训练后,在VLN-CE RxR达76.5%成功率、EVT-Bench达90.0%跟踪率、NAVSIM达91.4 PDMS,EQA也显著提升且步数更少。

Blended Chart Surfaces: A Seamless Explicit Representation for Smooth Surface Fitting Figure 1
2026-06-17cs.GR

Blended Chart Surfaces: A Seamless Explicit Representation for Smooth Surface Fitting

Romy Williamson, Niloy Mitra

2026-06-17视觉感知

针对隐式场需等值面提取、显式神经曲面受全局参数域或拼接缝限制的问题,本文提出 Blended Chart Surfaces:在用户给定粗代理网格上为每个顶点优化低阶多项式局部映射,并用 one-ring 坐标与单位分解平滑混合,从而将拓扑/粗几何与细节解耦。实验显示其在多拓扑曲面拟合中较插值函数和网格位移 MLP 更好兼顾紧凑性、可微导数访问和跨 patch 光滑性。

When LLMs Analyze Scars: From Images to Clinically-Meaningful Features Figure 1
2026-06-17cs.CV

When LLMs Analyze Scars: From Images to Clinically-Meaningful Features

Ruman Wang, Hangting Ye

Liaoning University of Traditional Chinese Medicine 1, School of Artificial Intelligence, Jilin University 2

2026-06-17视觉感知

针对瘢痕图像标注稀缺、隐私受限且端到端深度模型难以解释的问题,论文提出 ScaFE:不让 LLM 直接诊断图像,而是依据 VSS/POSAS 等临床量表生成本地可执行的特征提取代码,将图像转为低维、可解释特征后用轻量分类器分类。实验称在低数据瘢痕分类中优于端到端深度学习和黑盒 LLM 基线,但具体增益来源仍需结合完整实验细节判断。

PhaseWin: An Efficient Search Algorithm for Faithful Visual Attribution Figure 1
2026-06-17cs.CV

PhaseWin: An Efficient Search Algorithm for Faithful Visual Attribution

Zihan Gu, Ruoyu Chen, Junchi Zhang, Li Liu, Xiaochun Cao, Hua Zhang

2026-06-17视觉感知

这篇论文针对视觉/视觉语言模型归因中“忠实但昂贵”的子集搜索问题,指出常用贪心法不仅需反复重评分导致 O(n²) 前向开销,其子模理论依据也不适用于充分性—必要性代理目标。作者提出 PhaseWin,通过分阶段全局筛选、自适应剪枝与局部窗口精排,在保留近似贪心排序行为的同时将评估复杂度降至线性。实验覆盖分类、检测、指代定位和图像描述,显示其以最少前向次数达到较高归因忠实度。

AIGS-Net: Compact Illumination Field Modeling via 2D Gaussian Splatting for Fast Low-Light Image Enhancement Figure 1
2026-06-17cs.CV

AIGS-Net: Compact Illumination Field Modeling via 2D Gaussian Splatting for Fast Low-Light Image Enhancement

Yuhan Chen, Kunyang Huang, Fuchen Li, Zhuohan Qin, Guofa Li, Wenbo Chu, Keqiang Li

2026-06-17视觉感知三维

针对低光增强中照明场表达能力与边缘端计算开销难兼顾的问题,AIGS-Net用输入相对亮度统计动态调制2D Gaussian Splatting基的透明度,并结合零参数多尺度上下文、噪声掩码和锁定单通道Gamma约束来抑制噪声与偏色。在LOL、LSRW上报告更好的细节和色彩保真,仅约440个可学习参数,显示其增益主要来自自适应照明建模与强约束的轻量设计。

Recover Semantics First, Generate Better: Improved Latent Modeling for 3D MRI Reconstruction and Cross-Contrast Synthesis Figure 1
2026-06-17cs.CV

Recover Semantics First, Generate Better: Improved Latent Modeling for 3D MRI Reconstruction and Cross-Contrast Synthesis

Yonghao Chen, Sicheng Yang, Rui Tang, Lei Zhu

2026-06-17三维

针对3D多对比MRI直接生成成本高、现有VAE/VQ潜空间压缩易破坏长程解剖一致性、混淆对比语义并过度平滑的问题,论文提出“先恢复语义再生成”的潜变量建模框架:用LHE融合卷积与切片ViT捕获全局结构,SRB借助DINO教师恢复对比可分语义,AFL强化关键高频解剖细节。两套公开多对比MRI数据上的实验显示,该方法在体数据重建和跨对比合成质量上均稳定优于基线。

Gaussian Light Field Splatting: A Physical Prior-Driven Vision Transformer for Unsupervised Low-Light Image Enhancement Figure 1
2026-06-17cs.CV

Gaussian Light Field Splatting: A Physical Prior-Driven Vision Transformer for Unsupervised Low-Light Image Enhancement

Yuhan Chen, Wenxuan Yu, Guofa Li, Fuchen Li, Kunyang Huang, Yicui Shi, Ying Fang, Wenbo Chu, Keqiang Li

2026-06-17视觉感知三维

针对无监督低光增强在非均匀照明下易出现局部过曝/欠曝、偏色和细节损失的问题,本文提出 GLFS,将 2D Gaussian Splatting 的连续光场表示作为物理先验嵌入 ViT 自注意力,通过各向异性高斯基函数推断平滑空间增益场,并用颜色向量角损失与亮度边缘损失约束色相和结构。实验与消融显示其在照明校正、细节保持和 SSIM 等指标上优于已有方法。

SegDINO: Introducing Multi-Scale Structure into DINO for Efficient Medical Image Segmentation Figure 1
2026-06-17cs.CV

SegDINO: Introducing Multi-Scale Structure into DINO for Efficient Medical Image Segmentation

Sicheng Yang, Hongqiu Wang, Zhaohu Xing, Sixiang Chen, Qiuxia Yang, Yize Mao, Guang Yang, Lei Zhu

2026-06-17视觉感知

针对 DINO 特征直接用于医学分割时缺少显式多尺度层级、简单解码器难以处理小病灶而重解码器又代价高的问题,SegDINO 冻结 DINOv3 编码器,通过 TPA 将不同深度 token 重组为伪金字塔,并用轻量 SAD 做尺度内细化与自顶向下传播。作者还构建 284 例胰腺肿瘤 CT 数据集 PanCT;在 PanCT 和三个公开基准上报告达到 SOTA 且参数/计算效率更高。

Reload-Mamba: Hierarchical Anti-Dilution State-Space Modeling for Multi-Class Semantic Segmentation Figure 1
2026-06-17cs.CV

Reload-Mamba: Hierarchical Anti-Dilution State-Space Modeling for Multi-Class Semantic Segmentation

Sheng-Wei Chan, Hsin-Jui Pan, Jen-Shiun Chiang

2026-06-17视觉感知

本文针对 Mamba 在高分辨率语义分割中顺序传播会稀释边界、细结构和小目标响应的问题,提出 Reload-Mamba:用边界监督的局部细节先验、基于类别熵的不确定性感知 Reload Gate,以及三层级解码器重载融合来恢复被削弱的特征。实验在 ADE20K 达 47.9/48.9 mIoU、Cityscapes 达 83.2、PASCAL VOC 达 87.8,消融显示相较直接移植反稀释结构提升 2.2 mIoU。

Robustness of Similarity-based Positional Encoding Under Rotations: Theoretical Analysis and Experimental Validation Figure 1
2026-06-17cs.CV

Robustness of Similarity-based Positional Encoding Under Rotations: Theoretical Analysis and Experimental Validation

Andrea Santomauro, Luigi Portinale, Giorgio Leonardi

Computer Science Institute, DiSIT, University of Piemonte Orientale, Alessandria, Italy

2026-06-17安全鲁棒

针对医疗影像等场景中小角度旋转会扰动 Transformer 位置信息的问题,本文把相似度位置编码 simPE 形式化为若干 Lipschitz 组件的组合,指出其一般并非旋转不变,但可在 Frobenius 范数下获得显式稳定性界。合成箭头、形状、数字和 FashionMNIST 实验显示,simPE 在小到中等旋转下较 learned PE 衰减更慢,准确率、F1 等指标更稳。

Beyond Visual Cues: CoT-Enhanced Reasoning for Semi-supervised Medical Image Segmentation Figure 1
2026-06-17cs.CV

Beyond Visual Cues: CoT-Enhanced Reasoning for Semi-supervised Medical Image Segmentation

Yuming Chen, Yuxin Xie, Tao Zhou, Yi Zhou

2026-06-17视觉感知

针对半监督医学图像分割过度依赖像素相似、在视觉相似但病理语义不同或边界模糊病例中易失效的问题,论文提出 CERS:用冻结 LLM 生成分割相关 CoT,构建仅含标注样本的推理知识库,先按形态检索再按 CoT 一致性重排,并通过 MCAM 融入双解码器。文中称在多个公开数据集优于现有方法,尤其改善边界歧义和语义不一致,但具体增益幅度需看实验表。

MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias Figure 1
2026-06-17cs.CV

MLLMs Get It Right, Then Get It Wrong: Tracing and Correcting Late-Layer Textual Bias

Xingming Li, Ao Cheng, Qiyao Sun, Xixiang He, Xuanyu Ji, Runke Huang, Qingyong Hu

National University of Defense Technology, changsha, China, Chinese University of Hong Kong, Shenzhen, China, Intelligent Game and Decision Lab, Beijing, China

2026-06-17视觉感知

针对多模态大模型在图文冲突时盲从文本、削弱视觉 grounding 的风险,论文通过逐层投影输出概率发现“晚层文本覆盖”:模型中间层常已给出正确视觉答案,却在末层转向文本。作者提出 MDR 诊断该方向性偏移,并用免训练的 CALRD 在检测到高置信视觉预测被压制时回灌中间层 logits;在五个 MLLM 和冲突基准上最高带来 9.4% 绝对提升,同时基本保持常规任务性能。

Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model Figure 1
2026-06-17cs.CV

Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model

Jinghan Wu, Jing Li, Ivor W. Tsang, Xuetao Zhang

2026-06-17视觉语言

本文针对多模态共指消解依赖目标数据标注训练或大型VLLM、难以即插即用的问题,提出先在视觉语言对齐数据上预训练细粒度关系式对齐模型,再通过相似度聚合构造提及表示,并用证据理论融合视觉与类别线索。该方法无需CIN共指链训练,在CIN上CoNLL F1较专用SOTA和常用VLLM分别提升5.31%和2.12%,在masked CIN与新建VCR-MCR上也显示鲁棒性和泛化性。

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization Figure 1
2026-06-17cs.CV

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization

Guo Pu, Yixuan Han, Haofeng Li, Yao Zhang, Hui Zhou, Zhouhui Lian

Wangxuan Institute of Computer Technology, Peking University, Beijing Hydrogen Intelligent Tech. Co., Ltd., Wangxuan Institute of Computer Technology, Peking University China, Beijing Hydrogen Intelligent Tech. Co., Ltd. China

2026-06-17优化算法三维

MoonSplat针对单目在线3DGS在长序列中位姿易漂移、缺少回环全局校正且体素化表示优化慢的问题,提出结合预训练多视几何先验、体素化Gaussian表示与Sim(3)因子图全局优化的框架,同步修正相机位姿、尺度漂移和Gaussian锚点,并用颜色残差学习加速收敛。实验显示其在室内外数据上提升位姿精度与渲染质量并保持实时性,还部署到无人机主动重建系统验证实用鲁棒性。

Revisiting Structural Dependency in Autoregressive Multi-Task Table Recognition via Order-Independent Cell-Level Representations Figure 1
2026-06-17cs.CV

Revisiting Structural Dependency in Autoregressive Multi-Task Table Recognition via Order-Independent Cell-Level Representations

Takaya Kawakatsu

2026-06-17视觉感知

本文针对多任务表格识别中自回归结构解码器的隐藏状态被直接复用于定位和内容识别、导致单元格表示受生成顺序影响的问题,提出在结构生成后加入单元格级结构精炼模块,用非因果自注意力并结合视觉特征重对齐,获得顺序无关的全局单元格表示。两套大规模数据集实验显示,该方法将单元格定位 IoU 提升约 3–5 点,改善端到端 TEDS,尤其利于长文本单元格,并通过并行单元格解码将推理时间约降至 MuTabNet 的三分之一。

A Quantitative Analysis of Multimodal Biomarkers in Alzheimer's Disease Figure 1
2026-06-17cs.CV

A Quantitative Analysis of Multimodal Biomarkers in Alzheimer's Disease

Antonio Scardace, Daniele Ravì

2026-06-17视觉语言

针对阿尔茨海默病多模态生物标志物虽被广泛融合、但各模态信息贡献与冗余关系不清的问题,本文在789名ADNI受试者上联合tau-PET、结构MRI、MMSE/CDR和APOE ε4,量化互信息、解释方差、tau-萎缩关系并分解tau-认知关联。主要结果显示,该分析可揭示跨模态冗余、筛选更有预测价值的脑区,并得到与认知下降一致的主导神经退行轨迹;具体数值增益文中片段未充分说明。

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models Figure 1
2026-06-17cs.RO

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

et al., 2026), and EBench (Laboratory, 2026), alongside two new benchmarks: RoboTwin-IF, an instruction-

2026-06-17机器人

本文针对机器人操作数据异构、昂贵且难以规模化导致 VLA 泛化不足的问题,提出基于 Qwen-VL 的 Qwen-RobotManip,核心是先做跨本体对齐再扩展数据:统一状态动作表示、相机坐标增量位姿和上下文自适应,并用人到机器人合成与多源清洗构建约 3.81 万小时数据。实验在多种 OOD、指令跟随和跨本体基准及真实机器人上超过 π0.5 等模型,RoboChallenge 相对提升 20%,但增益可能主要来自 scaling / data 与对齐共同作用。

High-Fidelity 3D Geometric Reconstruction of Pelvic Organs from MRI: A Hybrid Deep Learning and Iterative Optimization Approach Figure 1
2026-06-17cs.CV

High-Fidelity 3D Geometric Reconstruction of Pelvic Organs from MRI: A Hybrid Deep Learning and Iterative Optimization Approach

Hui Wang, Xiaowei Li, Chenxin Zhang, Yifan Feng, Jianwei Zuo, Yumeng Tang, Xiuli Sun, Jianliu Wang, Bing Xie, Jiajia Luo

Institute of Medical Technology, Peking University Health Science Center, Peking University, Beijing, People’s Republic of China, Biomedical Engineering Department, Institute of Advanced Clinical Medicine, Peking University, Beijing, People’s Republic of China, Department of Obstetrics and Gynecology, Peking University People’s Hospital, People’s Republic of China, fidelity, high-quality geometries remains labor-intensive and poorly standardized., In conventional workflows, constructing these 3D models remains a highly labor-intensive, necessitates labor-intensive and often inconsistent post-processing workflows. This "technical

2026-06-17生成模型优化算法三维

针对盆腔器官 MRI 到高质量三维网格仍依赖人工分割、修补且难以标准化的问题,本文提出深度预测与迭代优化耦合的可变形形状建模框架,用几何感知多层网络、两阶段摊销优化和推理时热启动细化来兼顾拓扑一致性、表面细节与网格质量。实验显示其在膀胱、子宫、直肠重建中降低 Chamfer Distance、提高 Dice,并在 minSICN/minSIGE 等体网格质量指标上优于传统后处理方法。

Human-in-the-Loop Atlas-Based 3D Asset Segmentation for Interactive Content Workflows Figure 1
2026-06-17cs.CV

Human-in-the-Loop Atlas-Based 3D Asset Segmentation for Interactive Content Workflows

Paul Julius Kühn, Saptarshi Neil Sinha, Jakob Hansen, Robin Horst

2026-06-17视觉感知生成模型三维

面向游戏、XR与文化遗产等流程中“分割标准依任务而变、用户需可控”的3D资产编辑需求,本文将多视图2D分割回投到UV图集,并用贪心集合覆盖选择紧凑视角,结合SAM 2与Label Studio进行人在环修正。八个文化遗产物体的演示评估表明可生成可用的分割图集,但细结构、孔洞和弱外观边界仍需较多人工纠正。

Million-scale multimodal pollen microscopy with expert-guided foundation models Figure 1
2026-06-17cs.CV

Million-scale multimodal pollen microscopy with expert-guided foundation models

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

Department of Physics of Complex Systems, ELTE Eötvös Loránd University, Budapest, Hungary, The Palynological Laboratory at the Swedish Museum of Natural History, Stockholm, Sweden, National Centre for Public Health and Pharmacy, Budapest, Hungary, National Korányi Institute for Pulmonology, Budapest, Hungary, Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University, Budapest, Hungary, Department of Biological Physics, ELTE Eötvös Loránd University, Budapest, Hungary

2026-06-17视觉语言

针对花粉显微识别依赖专家且跨制片、扫描器和地域泛化困难的问题,本文构建 Pollen AI Atlas:用每张纯种全片一个专家示例在密集特征空间挖掘花粉颗粒,并以专家形态学锚点约束开源 VLM 生成粒级描述。最终发布 151 万个检测、精度 99.6%,冻结视觉特征分类达 88.16%,跨地域检索中文本嵌入明显优于图像相似度。

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model Figure 1
2026-06-17cs.CV

MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model

Lichen Bai, Tianhao Zhang, Shitong Shao, Dingwei Tan, Qiyu Zhong, Zhengpeng Xie, Haopeng Li, Qinghao Huang, Dandan Shen, Tengjiao Ji, Wei Wang, Peicheng Wu, Yuxuan Zhao, Xiangyu Zhu, Welly Luo, Shurui Yang, Zeke Xie

large-scale social-interactive applications. Consequently, none of them can yet deliver a long-horizon scalable

2026-06-17强化学习

论文针对现有视频/世界模型难以支持社交场景中的实时互动、音画同步和长时稳定生成的问题,提出“社交世界模型”定位,并构建22B参数的MaineCoon:采用流式自回归音视频生成,结合自重采样、跨模态对齐、领域偏好优化、ROPD及智能缓存推理。文中称其可在单张H100上达到最高47.5 FPS、亚秒交互,并支持千秒级生成;具体增益来源可能同时来自模型规模、数据与工程优化。

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams Figure 1
2026-06-17cs.CV

LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams

Zhenyu Yang, Kairui Zhang, Bing Wang, Shengsheng Qian, Changsheng Xu

2026-06-17视觉感知

面向在线机器人/视频助手在长时连续流中难以及时发声且易遗忘历史的问题,LiveStarPro不再学习高频EOS静默,而以SVeD用困惑度单次验证响应时机,配合SCAM做增量视频语言对齐,并用树状层级记忆检索被移出上下文的事件链。其在OmniStarPro等评测中较既有在线Video-LLM语义正确性提升28.9%、时序误差降低18.2%,KV缓存带来1.58倍推理加速。

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports Figure 1
2026-06-17cs.CL

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

Samar Ansari

School of Computing and Engineering Sciences, University of Chester

2026-06-17安全鲁棒

针对LLM进入放射报告摘要、标准化与教学改写后可能污染临床文本和多模态训练数据的问题,本文在IU胸片报告上量化实体、模糊/不确定性表达与图文对齐损失,提出“slop paradox”:看似更干净的标准化/教学改写虽少丢实体,却使BiomedCLIP图文对齐下降14.9–16.5%;EHR摘要丢失51.4%实体和43.7%hedging,但对齐仅降2.5%,且罕见病并未更易受损。

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics Figure 1
2026-06-17cs.CV

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Xuanye Pan, Mo Wang, Quanying Liu

Department of Biomedical Engineering, Southern University of Science and Technology, China, School of Biomedical Engineering, Shenzhen University, China

2026-06-17生成模型强化学习

针对现有 fMRI 基础模型多偏向表征学习、难以进行受结构条件约束的长时程全脑 4D 动态生成,BrainWorld 将 sMRI 作为个体解剖先验注入扩散 Transformer 去噪过程,而非简单并联融合,并用 VAE 潜空间建模体素级 fMRI 轨迹。文中在 22 个数据集上报告可稳定生成最长 400 帧序列,生成样本可提升下游任务,且中间特征具备较好迁移表征能力。

ED3R: Energy-Aware Distributed Disaster Detection Enabled by Cooperative Robotic Agents Figure 1
2026-06-17cs.RO

ED3R: Energy-Aware Distributed Disaster Detection Enabled by Cooperative Robotic Agents

Lina Magoula, Nikolaos Koursioumpas, Nancy Alonistioti, Ramin Khalili

* Dept. of Informatics and Telecommunications, National and Kapodistrian University of Athens, Greece, ** Huawei Heisenberg Research Center (Munich), Germany

2026-06-17机器人视觉感知

面向野火等灾害巡检中检测置信度、响应时间与机器人续航相互制约的问题,ED3R将无人机与远程控制器建模为分层协作智能体,联合决定运动、视觉模型选择及本地/远程推理,并用分布式神经回归做前瞻评估,辅以避障、区域避免和早停机制。仿真显示任务成功率最高97.18%,困难场景下能耗降36.4%、检测提速41%。

ActWorld: From Explorable to Interactive World Model via Action-Aware Memory Figure 1
2026-06-17cs.CV

ActWorld: From Explorable to Interactive World Model via Action-Aware Memory

Zhexiao Xiong, Yizhi Song, Hao Kang, Qing Yan, Liming Jiang, Jenson Yang, Zhoujie Fu, Stathi Fotiadis, Angtian Wang, Zichuan Liu, Bo Liu, Yiding Yang, Xin Lu, Nathan Jacobs

2026-06-17强化学习

ActWorld针对现有交互式世界模型“能逛不能操作”的问题,指出瓶颈在于缺少密集人-物交互数据以及按时间近因压缩历史导致的动作遗忘。论文构建10万交互视频数据,并提出分层动作感知记忆,用本地与持久记忆保留事件更新和物体身份信息。实验显示其在统一实时框架中同时支持导航和中途物体交互,交互保真度优于导航型基线且基本不牺牲视角控制。

GSPan: A Continuous Gaussian Primitive Representation for Arbitrary-Scale Pansharpening Figure 1
2026-06-17cs.CV

GSPan: A Continuous Gaussian Primitive Representation for Arbitrary-Scale Pansharpening

Fangyi Li, Xiaoyuan Yang, Yixiao Li, Zongyang Sui, Kangqing Shen, Gemine Vivone

2026-06-17三维

针对现有深度全色锐化多依赖固定输出网格、难以适配任意尺度且大场景推理开销高的问题,GSPan将高频残差表示为连续可学习的2D高斯基元,并用DSHI与SSIA融合PAN结构和MS光谱信息,再渲染残差注入上采样MS。该表示支持无需重训的任意尺度输出,并通过SDAI低分辨率估计、高分辨率渲染加速大场景处理;在QuickBird、GaoFen-2、WorldView-3及WV3-4K上取得SOTA融合效果与更优效率权衡。

Heterogeneous SAR-optical fusion for near-real-time land use and land cover mapping under cloud contamination: A novel framework and global benchmark dataset Figure 1
2026-06-17cs.CV

Heterogeneous SAR-optical fusion for near-real-time land use and land cover mapping under cloud contamination: A novel framework and global benchmark dataset

Jiangong Xu, Weibao Xue, Xiaoyu Yu, Jun Pan, Xinlian Lianga, Mi Wang

a State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan 430079, China, b School of Computer Science and Information Engineering, Hefei University of Technology, Hefei 230009, China, c Hangzhou International Innovation Institute, Beihang University, Hangzhou 311100, China, d Oriental Space Port Research Institute, Yantai, 265100, China, e Hubei Luojia Laboratory, Wuhan, 430079, China, benchmark dataset containing 40,223 curated SAR–optical–label triplets with pixel-level LULC, available at: https://github.com/RSIIPAC/CloudLULC, availability of valid optical observations, especially in tropical, effectiveness strongly depends on the availability of sufficient

2026-06-17数据集/基准

针对云/云影使光学影像在近实时土地利用/覆盖制图中不可靠的问题,论文提出 CloudLULC-Net,直接融合受污染 Sentinel-2 与邻近 Sentinel-1 SAR,通过光学可靠性调制、高阶空间-通道交互和语义映射 Transformer 减少云区误导,并构建含 40,223 组三元样本的 CloudLULC-Set。实验达到 OA 86.60%、F1 83.29%、mIoU 73.51%,优于重建优先和端到端基线。

Structured Adversarial Camouflage via Voronoi Diagrams Figure 1
2026-06-17cs.CV

Structured Adversarial Camouflage via Voronoi Diagrams

Jens Bayer, Stefan Becker, David Münch, Michael Arens, Jürgen Beyerer

Fraunhofer IOSB and Fraunhofer Center for Machine Learning, Karlsruhe Institute of Technology

2026-06-17视觉感知

针对像素级对抗贴片计算开销大、外观突兀且难以物理复现的问题,本文用固定可打印调色板下的 Voronoi 图参数化伪装,只优化种子点并通过软分配生成类似碎裂迷彩的结构。实验显示,简单框内贴片迁移效果有限,但在 3DPeople 服装分割区域应用时可显著降低行人检测 AP,并能跨背景和 YOLOv9–12 迁移;换调色板会基本削弱攻击,说明效果依赖结构与颜色耦合,物理验证仍未充分说明。

Vision-language models for chest radiography do not always need the image Figure 1
2026-06-17cs.CV

Vision-language models for chest radiography do not always need the image

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

2026-06-17视觉语言视觉感知

针对胸片视觉语言模型高准确率是否真的来自读图这一疑问,论文提出基于图像干预的因果审计:遮挡病灶区/无关区、替换同标签他人胸片,并联合多项行为指标区分图像依赖与语言先验。结果显示,纯文本模型距最佳多模态仅差5.7个百分点,9个系统中3个基本不看图、1个不稳定,其余也只在部分发现上选择性接地图像,说明临床部署不能只看准确率。

SegTME-UNI2: A Foundation Model-Based Framework for Generalisable Multiclass Cell Segmentation and LLM-Driven Tumour Microenvironment Characterisation in Histopathology Figure 1
2026-06-17cs.CV

SegTME-UNI2: A Foundation Model-Based Framework for Generalisable Multiclass Cell Segmentation and LLM-Driven Tumour Microenvironment Characterisation in Histopathology

Wan Siti Halimatul Munirah Wan Ahmad, Faris Syahmi Samidi, Mohammad Badal Ahmmed, Vimal Angela Thiviyanathan, Selvam James Thavaraj, Anwar P.P. Abdul Majeed

2026-06-17视觉感知

针对H&E病理图像中细胞分割、TME特征量化与临床可读报告脱节的问题,SegTME-UNI2将UNI2-h基础模型接入双UperNet头,同时做6类语义分割与HV实例分离,并用三阶段伪标签课程把PanNuke监督扩展到160万TCGA-UT补丁,再由结构化TME特征驱动BioNeMo生成叙述。结果主要是内部验证显示可行和一致性,外部基准、消融与临床获益文中尚未充分说明,增益可能主要来自scaling/data。

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL Figure 1
2026-06-17cs.CV

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

2026-06-17强化学习

这篇论文针对多模态大模型在答题时依赖语言先验、忽视细粒度图像证据的问题,提出在预训练与指令后训练之间加入 VEPA 阶段:先让模型生成与问题相关的视觉证据,再由冻结的“盲读者”LLM用充分性奖励和 GRPO 训练,避免直接泄露答案。实验显示该方法在多类视觉要求高的 VQA、细粒度感知与综合评测上稳定提升,并且增益主要来自更可迁移的视觉 grounding,而非额外任务监督。

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation Figure 1
2026-06-17cs.CV

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation

Alicia Pirwass, Birte Glimm, Michael Munz, Hans-Joachim Wilke

2026-06-17视觉感知生成模型

该文针对临床常规T2加权MRI缺少定量脂肪信息、Dixon/SFF采集不普及的问题,研究用配对图像翻译从T2w估计SFF。核心洞察是,在这种空间对齐、近确定性的医学跨模态任务中,轻量4层U-Net并不逊于扩散模型,反而更合适。基于NAKO 23万余张配对2D图像,U-Net在相关性和误差上优于DDPM(r=0.975、MAE=0.014 vs. r=0.962、MAE=0.019),推理速度快208倍,支持实时临床应用。

MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block Figure 1
2026-06-17cs.CV

MambaCount: Efficient Text-guided Open-vocabulary Object Counting with Spatial Sparse State Space Duality Block

Hao-Yuan Ma, Li Zhang, Minjie Qiang, Jie Gao

School of Computer Science and Technology, Soochow University, School of Computer Science and Technology, Soochow University Suzhou China

2026-06-17视觉感知

本文面向文本引导开放词汇计数中高分辨率、密集目标场景的效率瓶颈,指出Transformer二次复杂度和现有Mamba因因果建模、空间token高熵而不利于视觉计数。MambaCount重构Mamba2的状态空间对偶衰减动态,提出S4D与空间Token选择以保留局部高频细节,并用多粒度原型增强图文对齐和可解释性。在FSC-147上,无二次查询方法中取得Test MAE 12.23,同时保持线性复杂度。

Bounding Box Label Propagation for Re-Annotation of Document Layout Analysis Datasets Figure 1
2026-06-17cs.CV

Bounding Box Label Propagation for Re-Annotation of Document Layout Analysis Datasets

Nick Jochum, Tobias Alt-Veit, Christian Schön, Alexander Lück, René Schuster, Didier Stricker

2026-06-17学习理论数据集/基准

工业文档布局数据集会持续扩展且类别体系反复细化,若边界框仍有效,重新标注全部类别代价很高。本文将问题转化为已有框的传导式分类,提出 BBLP:用视觉、文本和位置特征学习统一布局对象嵌入,再做标签传播,为未重标对象生成伪标签。实验显示,仅用 10% 标注数据时,在 D4LA 上训练检测器可达 54.0% mAP,约为全监督性能的 81.6%,说明该方法能显著降低重标成本。

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI Figure 1
2026-06-17cs.RO

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

Hong Yang, Basura Fernando

Centre for Frontier AI Research, College of Computing and Data Science, Nanyang Technological University, Singapore

2026-06-17数据集/基准

针对现有 VQA/EQA 基准难以区分真实具身推理与视觉/语言捷径的问题,ERQA-Plus 构建了含 711 张机器人视角图像、1766 个问答的诊断基准,并用感知、动作、社交、导航环境和常识五类推理 taxonomy 及生成-评审-修订-人工验证流程控制质量。实验显示 Qwen3-VL-32B 最高达 83.4% 准确率,但模型在空间、程序、事件预测和意图推断上仍明显薄弱。

Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition Figure 1
2026-06-17cs.CV

Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition

Alessandro Sottovia, Alessandro Torcinovich, Oswald Lanz

Faculty of Engineering, Free University of Bozen-Bolzano, Bolzano, Italy

2026-06-17视觉感知

面向工业辅助、AR 训练和人机协作中的第一视角细粒度动作识别,论文针对单一 VLM 容易被显著物体误导、忽略细微时序线索的问题,提出本地零样本的“划分—审议—决策”多智能体流程:由编排模型切片并给出候选标签,异构 VLM 专家通过问答审议修正排序,再用 Borda 计数聚合并重排。实验显示其较单模型基线提升零样本识别效果,且增益主要来自异构模型先验去相关,而非单纯增加计算量。

RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation Figure 1
2026-06-17cs.CV

RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation

Qiwei Yan, Zhiqiang Yuan, Chongyang Li, Jiapei Zhang, Ying Deng, Jinchao Zhang, Jie Zhou

2026-06-17视觉感知

这篇论文关注参考驱动生成中“换主体但保持同视角”的几何失控问题,指出仅靠多图生成器容易把语义相似误当视角一致。RAVA先学习跨实例视角检索表示,再用LogDet选择视角一致且互补的目标参考图,为生成器提供显式几何证据。实验显示通用语义嵌入近似随机,RAVA在视角检索和下游生成上均优于零样本及同骨干检索替代方案。

SkillMoV: Mixture-of-View Routing with Prototype-Conditioned Gating for Unified Multi-View Proficiency Estimation Figure 1
2026-06-17cs.CV

SkillMoV: Mixture-of-View Routing with Prototype-Conditioned Gating for Unified Multi-View Proficiency Estimation

Edoardo Bianchi, Antonio Liotta

2026-06-17视觉感知

本文面向跨活动、多相机的人类技能熟练度估计,针对现有方法依赖场景专模或简单共享多视角聚合、难以适配不同视角的问题,提出 SkillMoV:用 Mixture-of-View 将每个相机特征软路由到专家 MLP,并结合跨视角注意力、类别原型锚定和原型条件门控。在 EgoExo4D 六类技能上,统一模型在 Exos 设置达 50.17% 准确率,较对比最强 Exos 结果高 3.57 个百分点,且仅训练 23.32% 参数。

Flux-Guard: Facial Identity Protection using diffusion models Figure 1
2026-06-17cs.CV

Flux-Guard: Facial Identity Protection using diffusion models

Jie Wang, Tao Wang, Ru Zhang, Jianyi Liu

2026-06-17生成模型

针对社交平台人脸图像在生成式编辑后仍可被人脸识别系统关联追踪的问题,Flux-Guard将文本驱动人脸编辑与身份对抗保护合并到同一扩散生成流程中,通过流轨迹控制、区域掩码速度场融合和感知损失自适应的潜空间对抗优化,在保持编辑语义与自然外观的同时削弱识别特征。实验在CelebA-HQ、LADN及商业API上显示,其跨模型攻击成功率较现有方法更高,并能保留可用的编辑效果。

Test-Time Training for Robust Text-Guided Open-Vocabulary Object Counting Figure 1
2026-06-17cs.CV

Test-Time Training for Robust Text-Guided Open-Vocabulary Object Counting

Hao-Yuan Ma, Yuda Zou, Li Zhang, Yongchao Xu

School of Computer Science and Technology, Soochow University, Wuhan University, School of Computer Science and Technology, Soochow University Suzhou China, Wuhan University Wuhan China

2026-06-17安全鲁棒

面向真实部署中雨雾、低照和传感器噪声会破坏图文对齐、导致开放词汇计数失效的问题,本文提出 Robust-TOOC 基准,并设计 Dual-TTT:冻结原计数网络,仅在测试时用文本引导的轻量去噪模块恢复受污染特征。多种 TOOC 基线上的实验显示,该方法在不同退化类型和强度下均能稳定提升鲁棒计数表现。

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation Figure 1
2026-06-17cs.RO

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

School of Computer Science, Peking University, Princeton University, Tsinghua University

2026-06-17机器人视觉语言视觉感知

针对多数 VLA 只依赖 RGB、难以感知温度、声音、雷达响应等物理属性的问题,MuseVLA 将传感器视为按需调用的工具:先生成传感器 token 和目标描述,再把异构读数转成接地传感图像以统一融合,并用合成管线降低多传感数据需求。真实灵巧手任务中平均成功率 80.6%,较 RGB-only 和原始热图基线显著提升,未见任务零样本达 66.7%。

TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization Figure 1
2026-06-17cs.CV

TivTok: Broadcasting Time-Invariant Tokens for Scalable Video Tokenization

Weiliang Chen, Yuanhui Huang, Xuebo Wang, Yueqi Duan

2026-06-17视觉感知

视频生成的计算成本随帧数和 token 数增长,而现有 tokenizer 往往在每帧重复编码背景、外观等持久信息。TivTok 的核心洞察是将视频表示拆成可跨时间复用的 TIV token 与逐帧残差 TV token,并用不同注意力范围的 SIF 诱导分解,再通过 IB 在帧和 chunk 间广播 TIV。实验中其在 16×256×256 上取得 rFVD 12.65,128 帧场景压缩效率较基线提升 2.91×。

Root-Selecting Fixed-Point Inversion for Rectified Flows via Trajectory Straightness Figure 1
2026-06-17cs.CV

Root-Selecting Fixed-Point Inversion for Rectified Flows via Trajectory Straightness

Semin Kim, Jihwan Yoon, Seunghoon Hong

2026-06-17生成模型规划控制

该文针对 rectified flow 反演中固定点方程可能存在多个近似根、仅最小残差会导致重建和编辑质量波动的问题,提出 SelFix:用轨迹直度作为选根准则,并通过带直度锚点的 Halpern 迭代在保持精确固定点反演收敛性的同时偏向更直的逆轨迹。在 FLUX.1-dev 与 PIE-Bench 上,方法改善真实图像重建,并在提示词编辑中更好保留源图像内容。

Geometric Consistency Protocol for Foundation Model Features in Multi-View Satellite Imagery Figure 1
2026-06-17cs.CV

Geometric Consistency Protocol for Foundation Model Features in Multi-View Satellite Imagery

Qiyan Luo, Jie Yang, Yingdong Pi, Lekang Wen, Mi Wang

2026-06-17视觉感知

针对卫星多视角重建中常用无约束 2D 全局匹配会违背 RPC/RFM 曲面、随高度变化的成像几何,论文提出一套几何一致的评测协议:用 RPC 投影的 3D 特征一致性和受几何约束的稠密匹配代理联合衡量基础模型特征。核心洞察是语义相似不等于几何可匹配;在 Omaha、Jacksonville 百余区域测试中,几何约束显著影响评价结论,且强 2D backbone 在该协议下仍可与 3D-aware 模型竞争。

RT-Counter: Real-Time Text-Guided Open-Vocabulary Object Counting Figure 1
2026-06-17cs.CV

RT-Counter: Real-Time Text-Guided Open-Vocabulary Object Counting

Hao-Yuan Ma, Li Zhang, Zhiwei Zhu, Jie Gao

School of Computer Science and Technology, Soochow University

2026-06-17视觉感知

针对文本引导开放词表计数依赖大型视觉语言模型、难以兼顾细粒度空间理解与实时性的瓶颈,RT-Counter用VPT将视觉原型投射到文本特征空间以融合语义与细节,并用Weaformer低成本编织局部/全局特征。在三个数据集上验证其打破精度—速度权衡,FSC147上MAE 13.30、112.48 FPS,较领先方法快7.4倍且参数效率超4倍。

Universal Image Restoration via Internalized Chain-of-Thought Reasoning Figure 1
2026-06-17cs.CV

Universal Image Restoration via Internalized Chain-of-Thought Reasoning

Yu Guo, Zhengru Fang, Shengfeng He, Senkang Hu, Yihang Tao, Phone Lin, Yuguang Fang

2026-06-17视觉感知

针对真实图像中多种退化耦合导致统一修复模型泛化差、逐步 CoT 修复又计算开销高且难建模退化相互作用的问题,论文提出 CoTIR,将“思考-规划-行动”式推理内化到单个基于 FLUX 编辑模型微调的修复框架中,并用拉格朗日式可微软约束编码推理目标;同时构建含 520 万样本的 CoTIR-Bench,实验显示其在复合退化场景中感知质量更强、保真度具竞争力。

TaFD: Threat-Aware Frequency Decoupling for Adversarial Robustness against Heterogeneous Attacks Figure 1
2026-06-17cs.CV

TaFD: Threat-Aware Frequency Decoupling for Adversarial Robustness against Heterogeneous Attacks

Mengda Xie, Yiling He, Meie Fang

School of Computer Science and Cyber Engineering, Guangzhou University, Information Security Research Group, University College London, School of Computer Science and Cyber Engineering, Guangzhou University Guangzhou Guangdong 510006 China, Information Security Research Group, University College London London NW1 2AE United Kingdom

2026-06-17安全鲁棒

针对多威胁对抗训练中ℓp扰动与语义/颜色等攻击相互拖累的问题,TaFD将负迁移解释为梯度不兼容,并利用不同攻击在频域中的可分谱特征进行解耦:先聚类攻击频谱原型识别潜在威胁域,再用频率条件卷积为不同域分配专家和谱掩码。在CIFAR-10/100、Tiny-ImageNet及ResNet、MobileViT上,平均鲁棒准确率较最强基线提升约11%,同时保持较高干净准确率。

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models Figure 1
2026-06-17cs.CV

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu

The University of Hong Kong, University of California, San Diego

2026-06-17视觉感知

本文针对空间VLM虽能感知几何却难以完成多步深度、距离与场景关系推理的问题,提出SR-ReaL:在同一模型中联合训练语言链式推理LOR与先3D定位再推理DTR,并通过冷启动混合监督、region-to-3D接口和GRPO奖励优化两条路径。实验显示其在多类空间基准上优于空间VLM基线,DTR更利于区域对象任务,联合训练带来互补增益且无需逐任务调参。

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation Figure 1
2026-06-17cs.CV

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

Peking University, Xiamen University, Korea Advanced Institute of Science and Technology (KAIST), National Taiwan University, Wuhan University, Wuhan University of Technology, Tsinghua University, Jimei University

2026-06-17视觉感知强化学习

OmniDrive针对自动驾驶视频生成中语义提示、地图/轨迹等几何控制割裂,以及多相机后融合导致的跨视角漂移问题,提出由Qwen2.5-VL多智能体生成WorldScript、布局与审计信号,并通过视角-时间置换把RGB和几何布局在3D VAE中共同压缩到统一位置 token 网格。nuScenes上其跨视角一致性、BEV mAP达SOTA,FVD为45.7,纯合成数据训练检测器在真实验证集提升2.4 NDS。

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments Figure 1
2026-06-17cs.RO

GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments

Jiawei Zhang, Yiming Yan, Chao Liang, Nuo Xu, Seson Sun, Qichen Zhang, Yuhao Xu, Yantai Yang, Yingqiao Wang, Qin Jin, Zhipeng Zhang

2026-06-17三维

面向具身智能训练中真实数据昂贵、现有重建式仿真场景采集慢且前景物体分离差的问题,GASE用全景相机阵列多视频流快速扫描,并基于相机位姿在2D域结合提示/跟踪完成跨帧物体提取与背景修复,再分别用3DGS和TRELLIS重建背景与物体。实验显示其分割准确率较3D Gaussian方法高10%以上,修复质量领先,真实机器人操纵和导航中与纯真实数据训练的性能差距小于10%。

MagicSim: A Unified Infrastructure for Executable Embodied Interaction Figure 1
2026-06-17cs.RO

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

2026-06-17视觉感知

MagicSim针对机器人学习中控制、技能与高层规划被割裂,常依赖“魔法动作”且难以复现实验的问题,提出以确定性批量运行时和共享MDP为核心的具身交互基础设施。其创新在于用YAML规格统一构建多物理世界,并通过Command-Skill-Planner-Robot-Record链路把语言命令落到真实机器人动作,同时支持基准/RL评测、自动轨迹采集和VLM交互。结果上展示了多形态、多任务长时序交互与同步多模态记录能力,但定量性能增益文中未充分说明。

Two-Stage Fine-Tuning of ResNet50 for High-Sensitivity Melanoma Detection on Dermoscopic Images Figure 1
2026-06-17eess.IV

Two-Stage Fine-Tuning of ResNet50 for High-Sensitivity Melanoma Detection on Dermoscopic Images

Aryan Bhagat

MS Computer Science, Florida Atlantic University, Boca Raton, FL, publicly available at https://github.com/Aryanbhagat23/melanoma-detection.

2026-06-17视觉感知

针对皮肤镜黑色素瘤筛查中类别不均衡易漏诊、单阶段迁移学习敏感性不足的问题,论文采用ResNet50两阶段微调:先冻结骨干训练分类头,再以低学习率全网微调,并仅在训练集过采样和对齐推理预处理。在HAM10000独立测试集3826图像上,AUC达0.9559,准确率88.34%,敏感性87.56%、特异性89.13%,消融显示敏感性较单阶段提升约4.21%;但外部临床泛化仍文中未充分说明。

No Figure
2026-06-17cs.CV

SPHINX: First Explain, Then Explore

Nguyen Do, Tue M. Cao, Tien Van Do, András Hajdu, Tamás Bérczes, My T. Thai

N. Do, T. Cao, and My T. Thai are with the University of Florida, Gainesville, T. V. Do is with the Budapest University of Technology and Eco-, nomics, Department of Networked Systems and Services, Budapest, Hungary, A. Hajdu and T. Bérczes are with the University of Debrecen, Debrecen

2026-06-17视觉感知

本文针对自动驾驶仿真中对抗场景生成常依赖 LLM/VLM 先验、难以对准特定策略失效机制的问题,提出 SPHINX:先用概念解释、不确定性、时序控制和参与者遥测诊断策略为何失败,再由 VLM/LLM 生成针对性场景用于闭环再训练。文中称其能给出可解释失败归因,并在多种自动驾驶架构和测试集上相比既有场景生成方法带来更稳定的鲁棒性提升。

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning Figure 1
2026-06-17cs.CV

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

School of Computer Science, Peking University

2026-06-17机器人规划控制三维

论文针对层级式 VLA 机器人规划中两类不可靠输入:单目物体重建易幻觉几何、经验记忆仅按语义检索而缺少质量控制。GeneralVLA-2用 GeoFuse-MV3D 引入经掩码验证的多视角几何先验、软视觉壳与保外观的几何融合,并将 KnowledgeBank 改为带质量、置信度、生命周期和冲突元数据的治理式长期记忆。实验显示其在 GSO-30 上小幅改善 CD、PSNR、SSIM、LPIPS,在 Terminal-Bench 与 SWE-Bench 上优于 ReasoningBank,但重建增益较保守。

Theoretical Grounding of Out-Of-Distribution Detection With Reinforcement Learning Optimizer Figure 1
2026-06-17cs.CV

Theoretical Grounding of Out-Of-Distribution Detection With Reinforcement Learning Optimizer

Salimeh Sekeh, Xin Zhang

San Diego State University

2026-06-17视觉语言视觉感知强化学习

本文针对移动机器人等开放环境中分布持续漂移导致 OOD 检测逐步退化的问题,指出只优化当前损失会破坏未来的 ID/OOD 能量分离。核心做法是在梯度下降中加入由 TD 学习价值函数提供的可微修正项,使更新方向偏向降低长期语义 OOD 误报率。论文主要给出时间误差分解、梯度对齐与能量桥接等理论结果,证明在结构假设下较 GD 可降低未来域泛化误差和 FPR;实证细节在片段中未充分说明。

StereoFactory: A Unified Merging Framework for Robust Stereo Matching Figure 1
2026-06-17cs.CV

StereoFactory: A Unified Merging Framework for Robust Stereo Matching

Xianda Guo, Pinhan Fu, Ruilin Wang, Wenke Huang, Mang Ye, Qin Zou

Xianda Guo is with the School of Computer Science, Wuhan University, Wuhan, China, and also with D-Star Robotics, Beijing, China., Pinhan Fu, Mang Ye, and Qin Zou are with the School of Computer Science, Wuhan University, Wuhan, China., Ruilin Wang is with the Institute of Automation, Chinese Academy of Sciences, Beijing, China, and also with D-Star Robotics, Beijing, China., Wenke Huang is with the College of Computing and Data Science, Nanyang Technological University, Singapore.

2026-06-17安全鲁棒

针对立体匹配基础模型在新增数据时需昂贵联合重训、而简单合并全部专用模型会引入任务向量干扰的问题,StereoFactory将合并拆成遗传算法筛选模型子集与CMA-ES模块级路由/缩放两步,强调不同网络模块偏好的知识源不同。在NMRF和FoundationStereo、四个基准上,其平均误差分别优于最强受控基线,且后处理搜索仅约为联合重训时间的2.7–3.7%。

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation Figure 1
2026-06-17cs.CV

WeaveLA: Event Driven Cross-Subtask Latent Memory Weaving for Repetitive Robot Manipulation

Shoujing Zhu, Zhenyang Liu, Fungmiu Wang, Jiafeng Wang, Bo Yue, Guiliang Liu, Simo Wu, Xiangyang Xue, Taiping Zeng

Fudan University, School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shanghai Innovation Institute, Shenzhen Loop Area Institute

2026-06-17机器人

这篇论文针对短窗口 VLA 在重复操作中缺少跨子任务状态传递、容易忘记已完成步骤的问题,提出 WeaveLA:在子目标完成事件触发时,用查询注意力将刚完成片段压缩为 8 个潜在记忆 token,并直接注入下一子任务的动作专家,且冻结主干。基于 π0.5 在 RoboMME 上,SwingXtimes N=3 成功率从 0% 提升到 47.8%,N=1 基本不变,说明增益主要来自需要跨子任务记忆的场景。

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation Figure 1
2026-06-17cs.CL

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

Zehang Wei, Jiaxin Dai, Jiamin Yan, Xiang Xiang

School of Computer Science & Tech, Huazhong University of Science and Technology, School of AI and Automation, Huazhong University of Science and Technology, China

2026-06-17数据集/基准

该文针对多模态 RAG 在视觉问答中易受跨模态冲突、因果编造和迎合式回答影响的问题,提出 MODE-RAG:用 VFE 与内部注意力状态做风险路由,只对高风险样本触发五代理流水线,并结合视觉优先检索、MCTS 因果图、logit 扰动和事后监督校验。作者还从 MultiVent 构造 ModeVent 基准;实验显示总体评分从 4.40 提升到 5.45,外点场景增益更明显。

AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation Figure 1
2026-06-17cs.RO

AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation

Haoran Lu, Mutian Shen, Shuyang Yu, Yu Xiao, Songling Liu, Jianshu Zhang, Shang Wu, Yue Chen, Guo Ye, Jiayi Wang, Zhaoran Wang, Han Liu

Northwestern University, Peking University

2026-06-17机器人三维

该文针对仿真中大量原始3D资产只有几何外观、缺少可执行操作语义这一数据瓶颈,提出 AnnotateAnything:先用VLM抽取人类交互先验并定位 affordance、关键点和部件,再通过大规模并行物理管线进行候选生成、几何优化、轨迹生成与验证,产出抓取、灵巧接触、关节操作、插入、悬挂和导航等标签。实验显示其在标注效率、数据采集效率和任务成功率上优于现有流程,并可支撑 affordance 检测、机器人VQA和视觉指令微调。

Contact-Based Fringe Projection Profilometry for High-Resolution 3-D Surface Measurement of Reflective and Transparent Objects Figure 1
2026-06-17cs.CV

Contact-Based Fringe Projection Profilometry for High-Resolution 3-D Surface Measurement of Reflective and Transparent Objects

Ingu Yeo, Hyung-Gun Chi, Jae-Sang Hyun

2026-06-17视觉感知

针对传统条纹投影难测反光/透明物体、GelSight 依赖法线积分导致绝对深度误差和大面积标定困难的问题,论文把数字条纹投影引入覆灰反射涂层的硅胶接触界面,通过相移、Gray 编码和相机-投影仪三角测量直接恢复每像素 3D 形状。实验与 GelSight Mini、常规 DFP 及球拟合/不确定度分析比较,显示其在金属和透明样件上缺失更少、深度更稳定,尺寸结果接近卡尺测量。

Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos Figure 1
2026-06-17cs.CV

Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos

Bo Gou, Jicheng Zhang, Jianlong Xiong, Tao He, Bentian Liu, Hai Wu, Yijiao Wang, Yu Zhang, Yujia Yang, Yun Dai, Jian Liu, Jie Wang

2026-06-17视觉感知

针对超声心动图标准切面自动识别中公开视频数据少、单帧外观相似且视频帧质量不均的问题,论文发布EV9V数据集,并提出双流CNN-LSTM的STFM,用不确定性感知采样和证据融合强化时空信息利用。实验在CNN、RNN、Transformer等架构上建立基准,显示STFM具备有竞争力表现;具体相对增益和主要来源在给定片段中未充分说明。

UoU: A Universal Fingerprint Foundation Model Based on Large-Scale Unsupervised Learning Figure 1
2026-06-17cs.CV

UoU: A Universal Fingerprint Foundation Model Based on Large-Scale Unsupervised Learning

Xiongjun Guan, Jianjiang Feng, Jie Zhou

2026-06-17视觉感知

针对指纹识别仍依赖增强、结构解析、对齐、匹配等割裂流水线、跨传感器与低质样本迁移受限的问题,UoU将指纹特征抽取重构为领域基础模型:用图像、方向场、语义 token、细节点和全局描述的层级表示,结合少量精标冷启动、弱监督扩展与无监督迭代巩固,并利用脊线周期性和空间等变等指纹先验。论文给出一个基于 Transformer 的结构预测原型和开源基线,但下游匹配、增强等统一评测结果文中未充分说明,实际增益可能主要来自 scaling / data。

LADBench: A Benchmark for Logical Fault Detection in Images Figure 1
2026-06-17cs.CV

LADBench: A Benchmark for Logical Fault Detection in Images

Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar, Mingyang Mao, Xiaomin Lin

2026-06-17视觉感知数据集/基准

面向家庭摄像头、具身机器人等开放场景,作者指出现有异常检测基准多考察视觉瑕疵或显式规则,难以衡量VLM是否能主动发现违背物理/社会常识的逻辑故障。LADBench构建千余张四类合成异常图像,并用分层提示与衰减加权评分衡量模型需要多少提示才定位问题。实验显示最优模型总体准确率仅70.11%,且深层提示后仍会漏检,说明当前多模态模型的隐式逻辑故障检测仍不可靠。

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting Figure 1
2026-06-17cs.GR

Edit3DGS: Unified Framework for Dynamic Head Editing via 2D Instruction-Guided Diffusion and 3D Gaussian Splatting

Duy-Dat Tran, Trung-Nghia Le

2026-06-17生成模型三维

针对动态 3DGS 头部头像难以用文本稳定编辑、易出现跨视角不一致和身份漂移的问题,Edit3DGS 将指令引导的 2D 扩散编辑与高斯拟合闭环结合,并用多视角批量编辑和自动掩码补全约束时序表情。NeRSemble 实验显示其在新视角、重演等任务中能生成较平滑逼真的编辑结果,CLIP 文本对齐相较 GaussianAvatar-Editor 具竞争力或更优。

Visual Retrieval-Augmented Generation for Silhouette-Guided Animal Art Figure 1
2026-06-17cs.CV

Visual Retrieval-Augmented Generation for Silhouette-Guided Animal Art

Quoc-Duy Tran, Anh-Tuan Vo, Trung-Nghia Le

2026-06-17视觉感知

论文针对生成模型难以从云、石头等自然轮廓中自主“看出”动物意象的问题,提出 Visual-RAG:先用形状标准化、Shape Context 与 RANSAC 在 2.86 万动物剪影库中检索结构相近样例,再用 ControlNet 和 IP-Adapter约束轮廓并迁移外观。消融显示几何对齐比速度更关键,去除标准化内点率降至 13.4%;用户研究表明结果具备可解释性和形状一致性,但审美冲击力仍有限。

CIAN: Multi-Stage Framework for Event-Enriched Image Captioning via Retrieval-Augmented Generation Figure 1
2026-06-17cs.CV

CIAN: Multi-Stage Framework for Event-Enriched Image Captioning via Retrieval-Augmented Generation

Trinh Thi Thu Hien, Trung-Nghia Le

2026-06-17视觉语言视觉感知

针对传统图像描述只依赖像素、难以说明事件时间地点、人物身份与背景的问题,CIAN把任务改造成检索增强的事件叙事生成:先用SigLIP检索相关新闻并做数据对齐,再以摘要引导LoRA微调Qwen生成,最后用N-gram润色。OpenEvents-V1上检索mAP达0.979、Recall@1为0.969,CIDEr由0.030升至0.094;但失败分析显示实体落地和图文融合仍弱,部分增益可能来自数据清洗。

Impact of Hand Impairment and Occlusions on Hand Pose Estimation Accuracy in Augmented Reality Applications Figure 1
2026-06-17cs.CV

Impact of Hand Impairment and Occlusions on Hand Pose Estimation Accuracy in Augmented Reality Applications

Damian M. Manzone, Mathew Szymanowski, Olga Taran, Shuo Cai, Melissa Marquez-Chin, Tammy Zeng, Hardeep Singh, Cesar Marquez-Chin, José Zariffa

the Research Ethics Board of the University Health Network under

2026-06-17三维

面向AR手功能康复,论文关注颈髓损伤者异常手姿与真实物体遮挡是否会削弱手部三维姿态估计。研究用HoloLens 2与WiLoR、HaMeR等方法,在清晰/不透明物体交互中以多相机三角化作真值评测。结果显示损伤组与健康组精度无显著差异,透明物体仅带来约0.1 mm小幅优势,WiLoR和HaMeR较HoloLens 2约优2 mm,支持其在康复场景中的可用性。

Enhancing Pathological VLMs with Cross-scale Reasoning Figure 1
2026-06-17cs.CV

Enhancing Pathological VLMs with Cross-scale Reasoning

Chi Phan, Tianyi Zhang, Qiaochu Xue, Yufeng Wu, Dan Hu, Zeyu Liu, Sudong Wang, Yueming Jin

2026-06-17视觉语言

病理诊断需要在低倍组织结构与高倍细胞形态间来回验证,而现有病理 VLM 多按单尺度训练评测,容易缺少跨尺度证据链。本文提出跨尺度 VQA 范式,并用文本泄漏筛查与约束式问题设计构建 Scale-VQA,减少只看题干猜答案的捷径;再以强化学习训练 ScaleReasoner-R1。结果显示其在跨尺度基准和若干单图病理 VQA 上达到 SOTA,说明少量高质量跨尺度监督可提升病理理解,但具体增益中数据质量与 RL 的贡献仍需进一步拆分。

Attention Alignment Between Humans and Vision-Language Models Figure 1
2026-06-17cs.CV

Attention Alignment Between Humans and Vision-Language Models

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

Princeton Neuroscience Institute, Princeton University, Department of Psychology, Princeton University, Department of Computer Science, Princeton University, Department of Psychology and Center for Computational Language Sciences, University of Southern California, Department of Psychology, Université de Montréal

2026-06-17视觉语言视觉感知

该文关注视觉语言模型的注意力是否能解释人类在不同任务中的注视位置,并通过控制训练分布、交叉比较 CNN/ViT 编码器与 LSTM/Transformer 解码器来拆分自下而上表征和自上而下注意机制的作用。核心发现是解码器比编码器更决定人类对齐:LSTM 注意力虽更弥散、任务适应性弱,却达到人类噪声上限的 80–87%;Transformer 更集中且抗消融,但仅 40–59%。同时,注视对齐与合成神经预测出现分离,说明“像人看哪里”和“像脑表征什么”不可简单等同。

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies Figure 1
2026-06-17cs.RO

Where Should Action Generation Begin? A Learnable Source Prior for Generative Robot Policies

Meipo Dai, Qiyuan Zhuang, He-Yang Xu, Ying-Jie Shuai, Yijun Wang, Qi Dou, Xiu-Shen Wei

Southeast University, The Chinese University of Hong Kong

2026-06-17机器人生成模型

本文针对生成式机器人策略默认从与观测无关的标准高斯噪声开始、导致生成器需额外“搬运”到可行动作区域的问题,提出可学习源先验 LeaP:用本体状态条件化的轻量 MLP 预测动作块对角高斯的均值与状态自适应方差,在不改生成器和求解器的情况下提供有信息且随机的初始化。实验显示其在 15 个 RoboTwin 操作任务平均成功率达 81.6%,较 A2A、VITA、无先验和 BridgePolicy 高 6.5–25.5 个百分点,并可迁移到 flow matching 与 diffusion-bridge 生成器及真实部署。

Graph Neural Networks for Semi-Supervised Image Classification with Multi-Feature Aggregation Figure 1
2026-06-17cs.CV

Graph Neural Networks for Semi-Supervised Image Classification with Multi-Feature Aggregation

Marina Chagas Bulach Gapski, Vinicius Atsushi Sato Kawai, Gustavo Rosseto Leticio, Lucas Pascotti Valem, Daniel Carlos Guimarães Pedronette, Mohand Said Allili

2026-06-17视觉感知

针对图像半监督分类中标注稀缺且单一特征提取器信息有限的问题,论文利用 GNN/GCN 同时接收特征与图结构的特点,融合来自 CNN、ViT 等多种提取器的特征和样本图,并用流形学习重排序与 rank aggregation 改善图构建。实验显示,多特征/多图组合在多数设置下提升分类精度,且 GCN 对输入图质量比对特征本身更敏感。

Bridging Spatial And Frequency Views For Disaster Assessment: Benefits And Limitations Figure 1
2026-06-17cs.CV

Bridging Spatial And Frequency Views For Disaster Assessment: Benefits And Limitations

Shikha V. Chandel, Yadav Raj Ghimire, Timothy Agboada, Leila Hashemi-Beni

2026-06-17模仿学习

面向灾后卫星图像中建筑损伤快速分级,论文关注仅依赖空间纹理可能漏掉坍塌纹理、碎片等高频线索的问题,在相同 EfficientNet-B0 和训练设置下对比空间域、傅里叶频域及双域融合。结果显示双域空间配置取得最高测试准确率 0.4688,但空间单域的宏 F1 更好为 0.4254;频域单独使用最差且过拟合,说明频率信息有补充价值但不能独立解决类别不均衡和轻微损伤难判问题。

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models Figure 1
2026-06-17cs.CV

Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models

Logan Mann, Yi Xia, Ajit Saravanan, Ishan Dave, Saadullah Ismail, Shikhar Shiromani, Emily Huang, Ruizhe Li, Kevin Zhu

University of California, Santa Barbara, University of California, Berkeley

2026-06-17视觉语言视觉感知

面向高风险场景中视觉语言模型幻觉与可信度评估,本文质疑“注意力越集中越可靠”的常见假设,提出 VRP 跨模型分析框架,将空间注意力结构、生成自一致性与隐藏状态探针分离比较。结果显示注意力聚类/熵与正确性几乎无关(R≈0.001),自一致性更能预测真值(R=0.429),隐藏状态探针 AUROC 可超 0.95;同时揭示 LLaVA 依赖脆弱晚期瓶颈,而 PaliGemma、Qwen2-VL 的可靠性表征更分布式。

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations Figure 1
2026-06-17cs.CV

TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations

Zikang Xiong, Weixin Li, Zhouchonghao Wu, Akshay Rangesh, Saarth Bonde, Grantland Hall, Chen Tang, Yihan Hu, Wei Zhan

2026-06-17模仿学习

针对端到端自动驾驶依赖大规模专家示范、图像闭环 RL 成本高的问题,TerraTransfer 将“学会驾驶”和“学会看见”解耦:先在向量化仿真中用多智能体自博弈训练教师规划头,再用动作 KL 与低秩批关系结构损失把预训练视觉骨干对齐到教师,仅需成对图像/场景状态而非轨迹标签。在 3D Gaussian splatting 闭环场景中,图像策略接近自博弈教师,并在 aggregate HD-Score 上超过模仿学习基线。

Improving and Evaluating Hand-Object Interaction Detection Figure 1
2026-06-17cs.CV

Improving and Evaluating Hand-Object Interaction Detection

Ahmad Darkhalil, Dima Damen, David Fouhey

2026-06-17视觉感知

手与物体交互检测是动作理解、三维重建和机器人操作的前置能力,但传统检测难以按交互状态区分“直接接触物”“工具作用对象”并建立链接。本文在 Co-DETR 上加入手-物、物-物交互建模,提出 HOI-DETR,并整理 Hands23、HOIST、FineBio、HD-EPIC 等图像/视频评测与新标注。实验显示其在多个基准显著优于既有方法,Hands23 和 FineBio 的 mAP 提升超过 20 个百分点。

MeiBRD: Meta-Learning Intraoperative Biomechanical Residual Deformation Figure 1
2026-06-17cs.CV

MeiBRD: Meta-Learning Intraoperative Biomechanical Residual Deformation

Casey Meisenzahl, Jon Heiselman, Michael Holtz, Yubo Ye, Michael Miga, Linwei Wang

2026-06-17视觉感知

针对腹腔镜肝切除中软组织大形变而术中测量稀疏,传统线性生物力学有偏、纯数据驱动泛化差的问题,MeiBRD不直接学全场形变,而将线性模型残差表示为带几何感知注意力的图神经扩散函数,并把稀疏对应点视作上下文样本进行前馈元学习快速适配。在可变形肝脏模型数据上,相比刚性ICP、生物力学和数据驱动基线取得更低配准误差,尤其在分布外几何和形变上更稳;但验证仍限于phantom数据。

Contactless Respiratory Monitoring on Heterogeneous Mobile Robots: A Multimodal Edge-Computing Framework Figure 1
2026-06-17cs.RO

Contactless Respiratory Monitoring on Heterogeneous Mobile Robots: A Multimodal Edge-Computing Framework

Milind Rampure, Shadman Sakib, Haley Patel, Zahid Hasan, Nirmalya Roy

2026-06-17机器人视觉语言

面向灾害救援、远程分诊等不宜接触伤员的场景,论文提出在异构移动机器人上运行的无接触呼吸率监测框架:按亮度在 RGB、热成像、近红外和低照度相机间自适应选择,用人体关键点定位胸部 ROI,并以 SQI 过滤低质量信号。三类机器人实验显示无需逐平台调参即可迁移;RGB 最远约 8 米,NIR 约 6 米,热成像仅适合近距,低照度相机可在全黑下到 8 米。

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models Figure 1
2026-06-17cs.CV

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

2026-06-17视觉语言视觉感知数据集/基准

面向端到端自动驾驶在长尾场景中难以被可靠评估的问题,论文指出纯规则指标缺少语境、纯 VLM 评估又缺少物理约束。DriveJudge 让 VLM 先理解场景并选择调用碰撞、车道偏离等确定性规则函数,以兼顾可解释性和上下文感知;作者还构建 33,577 个带人工合理性标注的困难样本,并提出质量分类与轨迹偏好基准。结果显示其相较 EPDMS 提升 21.23 AUC、相较 DriveCritic 提升 6.5% 偏好选择准确率。

Complex Layout Classification in the Wild: A Low-Resource Approach with Layout-Preserving Augmentations Figure 1
2026-06-17cs.CV

Complex Layout Classification in the Wild: A Low-Resource Approach with Layout-Preserving Augmentations

Sharva Gogawale, Iddo Hakim, Gal Grudka, Mohammad Suliman, Omer Ventura, Daria Vasyutinsky-Shapira, Berat Kurar-Barakat, Nachum Dershowitz

2026-06-17视觉感知

面向历史/低资源文献中噪声大、标注少且版式非规则导致OCR与分割易失败的问题,论文构建155页希伯来复杂版式数据集,并将页面按分隔区域划为8类。核心做法是在CNN训练中用窄各向异性高斯遮蔽弱化文字细节、保留分隔几何,再结合镜像引起的标签变换扩充样本。实验显示,这类版式保持增强在极少标注下能明显提升页级版式分类,并包含骨干、消融和外部盲测评估。

MM++: Unsupervised Scale-Invariant Multilayer OOD Detection via Top-K Gated Feature Fusion Figure 1
2026-06-17cs.LG

MM++: Unsupervised Scale-Invariant Multilayer OOD Detection via Top-K Gated Feature Fusion

Rahim Hossain, Md Tawheedul Islam Bhuian, Md Farhan Shadiq, Kyoung-Don Kang

School of Computing, State University of New York at Binghamton

2026-06-17视觉感知

针对深度视觉模型在开放环境中对分布外样本过度自信、且现有多层 Mahalanobis 方法忽略跨层依赖的问题,MM++用熵密度下降选择信息层,将归一化中间层与末层特征联合建模,并用 Ledoit–Wolf 协方差稳定距离估计;无需 OOD 数据或微调,在 ViT、Swin、ConvNeXt及 ImageNet-LT 场景中表现稳健,长尾近 OOD 平均 AUROC 领先。

Bayesian Magnetic Resonance Joint Image Reconstruction and Uncertainty Quantification using Sparsity Prior Models and Markov Chain Monte Carlo Sampling Figure 1
2026-06-17cs.CV

Bayesian Magnetic Resonance Joint Image Reconstruction and Uncertainty Quantification using Sparsity Prior Models and Markov Chain Monte Carlo Sampling

Ahmed Karam Eldaly, Matteo Figini, Daniel C. Alexander

Department of Computer Science, University of Exeter, North Park Road, Exeter EX4 4QF, United Kingdom, UCL Hawkes Institute, Department of Computer Science, University College London, London, United Kingdom

2026-06-17视觉感知强化学习三维安全鲁棒

针对欠采样 MRI 重建虽能加速采集、但缺少可信不确定性评估的问题,论文把压缩感知重建写成贝叶斯线性逆问题,并在任意稀疏基上保留 TV/小波等先验,通过 split-and-augmented Gibbs 与 proximal MCMC 联合采样图像和参数。单线圈、多线圈及多种 k-space 采样实验显示,重建优于对应优化法,且不确定性图与真实误差图相关性更高。

Learning a Maximum Entropy Model for Visual Textures using Diffusion Figure 1
2026-06-17cs.CV

Learning a Maximum Entropy Model for Visual Textures using Diffusion

Xinyuan Zhao, Eero P. Simoncelli

New York University, New York University & Flatiron Institute

2026-06-17生成模型

针对传统视觉纹理模型依赖手工统计量或物体识别预训练特征的问题,本文用扩散去噪训练最大熵纹理模型,无监督学习约束分布的512维统计量,并比较条件扩散采样与统计匹配采样。实验显示其生成质量达到或优于Gatys模型,9类中8类FID更好,且表示空间线性插值能产生更均匀平滑的过渡纹理。

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation Figure 1
2026-06-17cs.CV

Geometry-Consistent Endoscopic Representations for Image-Guided Navigation via Structured Foundation Model Adaptation

Hongchao Shu, Roger D. Soberanis-Mukul, Hao Ding, Morgan Ringel, Mali Shen, Saif Iftekar Sayed, Hedyeh Rafii-Tari, Mathias Unberath

Science, Johns Hopkins University, Baltimore, MD 21211 USA. He is

2026-06-17机器人视觉感知

针对单目内镜导航中深度线索弱、组织纹理少且跨设备/术式域移严重导致位姿和深度估计不稳的问题,论文用合成内镜数据提供几何监督,并提出 HGSA:在 ViT 层级中选择性加入低秩适配器,以中层几何对应和深层语义一致共同约束表示。实验显示其提升几何/语义表征质量,改善位姿优化和单目深度估计,并在支气管镜合成到真实、鼻窦镜和结肠镜少样本迁移中表现较好。

FATE: Pillar Encoding and Frequency-Aware Training for Event-Based Object Detection Figure 1
2026-06-17cs.CV

FATE: Pillar Encoding and Frequency-Aware Training for Event-Based Object Detection

Md Tawheedul Islam Bhuian, Kyoung-Don Kang

School of Computing, State University of New York at Binghamton

2026-06-17视觉感知

本文针对事件相机目标检测中常见的时间分箱会丢失细粒度动态、且低频标注限制高频推理的问题,提出 FATE:用 Pillar Encoding 将空间柱内事件投影到连续时间正交多项式基,避免内部子分箱;再用频率感知训练生成稠密伪标签并做 mean-teacher 课程学习。实验称其在多种架构和基准上优于强基线,可支持最高 200Hz 检测,额外参数少于 0.15M、端到端延迟约增 1%。

ProCUA-SFT Technical Report Figure 1
2026-06-17cs.LG

ProCUA-SFT Technical Report

Jaehun Jung, Ximing Lu, Brandon Cui, Muhammad Khalifa, Shaokun Zhang, Hao Zhang, Jin Xu, Amala Sanjay Deshmukh, Karan Sapra, Andrew Tao, Yejin Choi, Jan Kautz, Mingjie Liu, Yi Dong

2026-06-17视觉感知

针对桌面计算机使用智能体缺少高质量大规模轨迹、AgentNet 微调反而负迁移的问题,ProCUA-SFT 用单一 VLM 在真实内容填充的桌面中生成任务、做二值前置条件校验并执行轨迹,再扩展为 step-prefix SFT 样本。数据含 93K 合成轨迹、3.1M 样本;UI-TARS 7B 训练一轮后 OSWorld 达 45.0%,较基座提升 18.7 个百分点,显著优于 AgentNet 微调。

SierpinskiCam: Camera-Controlled Video Retaking with Sierpinski Triangle Pattern Cues Figure 1
2026-06-17cs.CV

SierpinskiCam: Camera-Controlled Video Retaking with Sierpinski Triangle Pattern Cues

Suttisak Wizadwongsa, Hyelin Nam, Supasorn Suwajanakorn, Jeong Joon Park

University of Michigan, Ann Arbor

2026-06-17视觉感知规划控制

本文面向单目视频重拍中目标相机远离原轨迹时几何引导稀疏、源视频外观难以保持的问题。核心做法是在几何代理的空洞区域加入 Sierpinski 分形纹理穹顶,提供跨尺度可跟踪的运动线索,并用负 RoPE 将源视频 token 与目标 token 位置解耦,无需改模型或逐视频微调。实验显示其在相机可控性、几何一致性和视频质量上优于既有方法,用户偏好提升约 15%。

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins Figure 1
2026-06-17cs.CV

Reasoning Text-to-Video Retrieval for Operating Room Clips via Action-Driven Digital Twins

Yiqing Shen, Hao Ding, Mathias Unberath

2026-06-17视觉感知

手术室视频检索需要回答“夹闭前一步”等隐式查询,而常规全局文本-视频嵌入难以推理相邻、视觉相似片段的动作差异。论文提出 OR³,将片段转为按时间组织的主语-动作-宾语动作数字孪生,并由 LLM 从查询“想象”目标 ActDT,再做同模态匹配和证据修正。在基于 MM-OR 的 386 个机器人膝关节手术片段、276 个查询上,OR³ 达到 57.6% R@1、77.3% R@5,显著优于 ReasonT2V 等基线。

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration Figure 1
2026-06-17cs.CV

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

The University of Texas at Austin, Advanced Micro Devices, Inc.

2026-06-17视觉语言优化算法

该文针对统一多模态模型在 LoRA 指令微调中“文本梯度压过视觉梯度”、导致图文交错生成里图像质量受损的问题展开分析。核心洞察是将文本与图像损失视为双目标优化,并用 Pareto LoRA 在检测到梯度冲突或失衡时调节更新方向与强度,避免弱视觉模态被淹没。在 Emu2 与 CoMM 基准上,相比普通 LoRA,方法最高提升 44.9% 感知图像质量,同时基本保持文本表现。

Phenotyping TPF via Self-Supervised Learning: A Label-Agnostic Framework with Expert Validation Figure 1
2026-06-17eess.IV

Phenotyping TPF via Self-Supervised Learning: A Label-Agnostic Framework with Expert Validation

Miral Elnakib, Muhammad Saad, Ahmad Al-Kabbany

Alexandria University, Multimedia Interaction and Communication Lab, Wearables, Biosensing, and Biosignal Processing Research Lab, Arab Academy for Science and Technology

2026-06-17视觉感知

针对胫骨平台骨折传统 Schatzker/AO-OTA 标签存在观察者差异、会让监督模型学习标签噪声的问题,本文改用无标签表征学习:以 RadImageNet 预训练 ResNet-50 经 SimCLR 在清洗后的膝关节 X 光上微调,再用 UMAP 与 k-means 发现影像表型。结果得到 4 类表型,轮廓系数 0.511、bootstrap ARI 0.319±0.041,专家盲评均达面效度阈值;与 Schatzker 的 ARI 仅 0.013,说明其捕捉的是互补的形态结构而非既有分类复刻。

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA Figure 1
2026-06-17cs.CV

Training LLMs with Reinforcement Learning over Digital Twin Representations for Reasoning-Intensive Surgical VideoQA

Yiqing Shen, Han Zhang, Mathias Unberath

2026-06-17视觉感知强化学习

本文针对手术 VideoQA 难以进行语义、空间和时间多步推理的问题,提出用强化学习训练 LLM 先规划并调用手术基础模型构建数字孪生表示,再在分层、概率化的中间表示上推理,从而解耦视觉感知与推理,并用临床合理性和不确定性校准设计奖励。作者还构建 REAL-Colon-Reason 数据集,在该集及 REAL-Colon-VQA、EndoVis18-VQA 上报告了最优表现。

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering Figure 1
2026-06-17cs.CV

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

University of California, Riverside, 2 YouTube (Google)

2026-06-17视觉感知生成模型安全鲁棒

针对开源视频扩散模型易生成暴力、色情和误导内容,而微调成本高、输入/输出过滤易绕过的问题,本文提出 REINS:无需训练地在推理中沿 SPCA 从安全标签激活中发现的单一“安全方向”调控中层隐藏状态,并用逐通道范数保持减少伪影。实验覆盖 9 个 1.3B–5B 文生/图生视频模型,显示可将有害生成转向语义相关的安全结果,且安全可分信息随深度增强、最佳干预约在中层。

Contrastive Action-Image Pre-training for Visuomotor Control Figure 1
2026-06-17cs.RO

Contrastive Action-Image Pre-training for Visuomotor Control

Yuvan Sharma, Dantong Niu, Anirudh Pai, Zekai Wang, Zhuoyang Liu, Baifeng Shi, Stefano Saravalle, Boning Shao, Ruijie Zheng, Jing Wang, Konstantinos Kallidromitis, Yusuke Kato, Fabio Galasso, Yuke Zhu, Danfei Xu, Linxi "Jim" Fan, Jitendra Malik, Trevor Darrell, Roei Herzig

Sapienza University of Rome

2026-06-17视觉感知规划控制

本文针对机器人数据规模不足、通用视觉预训练缺少动作监督而与控制需求错位的问题,提出 CAIP:从大规模第一视角人类视频中提取 3D 手部关键点,将其作为末端执行器动作代理,并用对比学习对齐图像/文本与动作片段。模型用约 3.2 万小时人类视频和少量机器人数据训练,在真实灵巧操作中优于 DINOv2、SigLIP、MVP、R3M 等,平均成功率达 76%,折叠、倒液等任务提升超过 30%。

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence Figure 1
2026-06-17cs.CV

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

Biplab Banerjee 1, Indian Institute of Technology Bombay, Mohamed bin Zayed University of Artificial Intelligence

2026-06-17数据集/基准

本文针对现有遥感视觉语言模型只擅长静态感知、难以完成灾害响应中多源证据整合与多步工具推理的问题,提出 GeoDisaster 基准:覆盖 2921 个实例、43 类问题和五类灾害任务,并用可执行 GIS 流程生成可验证答案与轨迹。同时提出带执行契约的多智能体框架和 RCEA 对齐方法。实验表明现有 RS-VLM/智能体在该基准上明显不足,RCEA 可提升工具调用、证据 grounding、状态一致性和决策质量。

Landsat-Sentinel-2 Algal Bloom Mapping Using Vision Transformers: Model Description, Implementation, and Examples Figure 1
2026-06-17cs.CV

Landsat-Sentinel-2 Algal Bloom Mapping Using Vision Transformers: Model Description, Implementation, and Examples

Thainara Lima, Vitor Martins

a Department of Agricultural & Biological Engineering, Mississippi State University (MSU), Starkville, MS 39762, the urgent need for a scalable coastal algal bloom monitoring (Anderson et al., 2009, 2012, 2019

2026-06-17视觉感知

针对近岸藻华突发、形态破碎且传统粗分辨率海色产品和光谱指数易受云、耀斑与水体反射误差影响的问题,本文用30米Landsat/Sentinel-2构建全球藻华斑块数据集,并首次系统比较ViT、Swin、SegFormer、MAE与ResUNet用于细粒度藻华分割。结果显示深度模型总体可检测漂浮藻华,漏检和误检约8%–65%;Swin在云和耀斑压力下优于阈值指数,并比MODIS更能刻画碎片化受影响区域。

Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception Figure 1
2026-06-17cs.CV

Beyond Benchmarks: Continuous Edge Inference for Fine-Grained Roadside Perception

Aditya Mishra, Haroon Lone

Indian Institute of Science Education and Research, Indian Institute of Science Education and Research Bhopal India

2026-06-17数据集/基准

论文指出静态图像基准会掩盖车载边缘连续推理中的时间抖动、热降频和负载波动,导致部署性能被系统性高估。作者提出 Edge-TSR,将检测、跟踪、细粒度分类与轨迹感知的置信度平滑/滞回锁定结合,用很低开销提升交通标志视频识别稳定性。实验显示三类基线从图像到真实流式部署下降约20–30%,该方法最高恢复10.16%分类准确率,并在 Jetson Orin Nano 上完成55分钟26公里实测,维持16.18 FPS且温度安全。

Quantum Enchanced Multi-Scale CNN with Bi-directional Mamba for Crop Field Analysis Figure 1
2026-06-17cs.CV

Quantum Enchanced Multi-Scale CNN with Bi-directional Mamba for Crop Field Analysis

Mohammad Salman Khan, Ehsan Atoofian, Saad B. Ahmed

Department of Computer Science, Lakehead University, Department of Electrical and Computer Engineering

2026-06-17视觉感知

面向无人机高光谱农田分类中光谱维度高、标注少、类别不均衡且传统 CNN/Transformer 计算负担大的问题,论文提出融合多尺度 CNN、光谱通道注意力、双向 Mamba 状态空间建模和量子启发特征增强的框架,并用加权损失改善训练稳定性。在 UAV-HSI-Crop 上 OA 为 84.83%,证明组合架构可用,但相对已有更高精度方法的增益来源仍不够清楚。

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors Figure 1
2026-06-17cs.CL

Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors

Vanshali Sharma, Andrea M. Bejar, Halil Ertugrul Aktas, Quoc-Huy Trinh, Debesh Jha, Gorkem Durak, Ulas Bagci

2026-06-17三维

本文针对3D CT报告生成中全量微调易过拟合、产生临床幻觉且计算昂贵的问题,系统比较96M到1.6B LLM的冻结与微调策略,并提出RAD3D-Prefix,将3D图像嵌入与多标签诊断logits作为异常感知前缀注入冻结LLM。结果显示小模型更适合微调,约1B以上模型冻结并仅训练投影层更优;该方法在自动指标、临床读者评估和域外泛化上优于同类参数高效基线。

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation Figure 1
2026-06-17cs.CV

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

∗RediMinds Inc., USA, †The University of Texas at Austin, USA, ∗Data and code is available at https://github.com/

2026-06-17视觉语言数据集/基准

本文针对现有多语种VLM评测默认“一种语言一种文字”、忽视旁遮普等多文字用户的问题,构建PuMVR:1000个在Gurmukhi、Shahmukhi、Roman三种文字间严格平行的视觉推理样本,并提出脚本一致率SCR衡量正交鲁棒性。对10个VLM的评测显示,同一语义与图像仅因文字不同即可产生最高16%的准确率差,视觉输入提升总体表现但不能弥合差距,SCR最低仅24.8%,跨文字few-shot迁移也很脆弱。

HRDX: A Large-Scale Vector HD-Map Dataset Figure 1
2026-06-17cs.RO

HRDX: A Large-Scale Vector HD-Map Dataset

Sahith Reddy Chada, Isht Dwivedi, Nirav Savaliya

Honda Research Institute US, San Jose, CA.

2026-06-17数据集/基准

针对现有公开矢量 HD 地图数据规模小、语义属性稀疏且缺少可复现航拍模态的问题,HRDX 发布约 40 小时/1400 km 湾区驾驶数据,含环视相机、LiDAR、RTK 定位、对齐正射影像及 10 类地图元素和 20+ 属性,并提出同时评估几何与属性的 CS 指标。实验显示更大数据规模提升在线制图表现,航拍图像在训练或推理中能改善几何质量,航拍教师蒸馏也可增强纯相机模型,增益可能主要来自 scaling / data 与额外结构先验。

2026-06-16

291 篇
Context-Aware RL for Agentic and Multimodal LLMs Figure 1
2026-06-16cs.CL

Context-Aware RL for Agentic and Multimodal LLMs

Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

Princeton University

2026-06-16视觉语言强化学习

论文针对长轨迹智能体和视觉语言模型常见的“看到上下文却未据此作答”问题,提出 ContextRL:在 GRPO 后训练中加入对比式上下文选择目标,让模型在相似轨迹或图像中识别支持给定答案的证据,而非只优化最终答案。作者构造 1k 代码轨迹对和 7k 图像对,在 5 个长程任务与 12 个 VQA 基准上较 GRPO 平均提升约 2.2% 和 1.8%,且同数据的 SFT/RL 增广几乎无效,说明收益主要来自该辅助目标。

BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering Figure 1
2026-06-16cs.CV

BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering

Yi-Ruei Liu, Jie-Ying Lee, Zheng-Hui Huang, Yu-Lun Liu, Chih-Hao Lin

National Yang Ming Chiao Tung University, University of Illinois Urbana-Champaign, National Taiwan University, sistency and controllability. We present BRDFusion, a unified framework, controllable rendering from the scene configuration, and the generative, alism and controllability is crucial for several downstream applications, including

2026-06-16视觉感知

面向自动驾驶仿真和内容编辑,城市视频逆渲染需要同时具备物理可控性与视觉真实感。BRDFusion将3D Gaussian场景表示、HDR环境光和PBR渲染与扩散生成先验结合,用生成模型缓解材质/光照分解歧义并修复PBR伪影。文中在真实与合成城市场景上优于物理或纯生成基线,支持可控新视角重光照、夜间仿真和带一致阴影的动态物体插入。

Exact Posterior Score Estimation for Solving Linear Inverse Problems Figure 1
2026-06-16cs.LG

Exact Posterior Score Estimation for Solving Linear Inverse Problems

Abbas Mammadov, Ozgur Kara, Kaan Oktay, Iskander Azangulov, Adil Kaan Akan, Hyungjin Chung, James Matthew Rehg, Yee Whye Teh

University of Oxford

2026-06-16视觉感知

针对扩散/flow 先验在超分、去模糊、修复等线性逆问题中只能提供无条件 score、导致后验采样依赖近似校正的问题,本文推导线性高斯观测下精确后验 score 的闭式形式,指出可等价为在测量诱导 pivot 和各向异性噪声协方差上的去噪,并据此提出 EPS 训练目标。实验在 FFHQ、ImageNet 的五类逆问题上提升保真度、感知质量和分布校准,同时比梯度式后验采样少约一个数量级 denoiser 调用。

Geometric Action Model for Robot Policy Learning Figure 1
2026-06-16cs.RO

Geometric Action Model for Robot Policy Learning

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

ETH AI Center

2026-06-16机器人强化学习

针对VLA/WAM主要依赖2D图像表征、难以显式处理深度、尺度和遮挡的问题,本文提出GAM:将预训练几何基础模型在中间层拆分,插入语言、状态与动作历史条件化的因果未来预测器,在共享几何token空间同时预测未来3D几何和动作。实验显示其在LIBERO-Plus达85.5%成功率,摄像机扰动下优势明显,并以1.4B规模实现较现有大模型更快推理和更强真实机器人鲁棒性。

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies Figure 1
2026-06-16cs.RO

R2RDreamer: 3D-aware Data Augmentation for Spatially-generalized 2D Manipulation Policies

Xiuwei Xu, Haowen Sun, Angyuan Ma, Yiwei Zhang, Zhenyu Wu, Xiaofeng Wang, Bingyao Yu, Zheng Zhu, Jie Zhou, Jiwen Lu

Tsinghua University

2026-06-16机器人三维

为缓解模仿学习在物体位姿、机器人构型和相机视角变化下需要大量示教的问题,R2RDreamer将真实示教中的物体点云与末端轨迹在统一3D坐标系中共同编辑,再通过遮挡感知投影生成2D控制视频,并用图像到视频模型补全RGB观测,从而避免强3D几何补全假设。文中在空间偏移操作任务上显示,该增强能提升2D扩散策略和视觉-语言-动作策略的空间泛化,并验证了3D编辑、遮挡处理与视频补全的贡献。

The Importance of Phase in Neural Representations: An Internal Oppenheim-Lim Test of Image Classifiers Figure 1
2026-06-16cs.CV

The Importance of Phase in Neural Representations: An Internal Oppenheim-Lim Test of Image Classifiers

Alper Yıldırım

2026-06-16视觉感知

本文追问图像分类器内部是否也像经典 Oppenheim–Lim 实验那样更依赖相位而非幅值。作者把相位/符号移植做成逐层因果干预,比较 PRISM2D、GFNet、ViT 与 ResNet。结果显示多数模型预测随相位或符号供体变化,去除图像特异幅值仍接近基线;ResNet 的符号码被 ReLU 隐藏,需在激活前揭示,说明不同架构共享相位/符号身份编码但呈现基不同。

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation Figure 1
2026-06-16cs.CV

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Chenxu Lv, Deqing Li, Gengze Zhou, Hang Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zhixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Xiong-Hui Chen, Chenfei Wu

generation for policy training augmentation, scalable virtual environments for policy, with safety risks. World models offer a scalable alternative: by learning environment dynamics from, generated video to serve as an action label. This flexibility positions language-conditioned world models

2026-06-16机器人视觉感知强化学习

该报告针对真实机器人训练成本高、通用视频模型缺少具身物理而专用模型难跨平台的问题,提出以自然语言统一动作接口的 Qwen-RobotWorld。其核心是双流 MMDiT 结合冻结 Qwen2.5-VL 动作编码、8.6M EWK 视频文本数据和通用到专家的渐进训练。结果在 EWM-Bench、DreamGen Bench 总体第一,并优于开源模型于 WorldModelBench、PBench;具体增益可能主要来自 scaling / data 与架构共同作用。

MeshLoom: Feed-Forward Non-Rigid Registration of Mesh Sequences Figure 1
2026-06-16cs.CV

MeshLoom: Feed-Forward Non-Rigid Registration of Mesh Sequences

Jianqi Chen, Jiraphon Yenphraphai, Xiangjun Tang, Sergey Tulyakov, Chaoyang Wang, Peter Wonka, Rameen Abdal

Snap Inc., Purdue University, Snap Inc. United States of America, Purdue University United States of America

2026-06-16视觉感知

针对动态网格非刚性配准常受逐例优化、类别受限、只能成对处理或需后处理制约的问题,MeshLoom提出前馈式拓扑感知编码—解码框架:用参考网格邻域特征消除欧氏近但测地远的顶点混淆,并将多帧形状/图像线索压缩为全局运动嵌入再按时间查询逐顶点形变。实验显示其在多类别、多运动配准上优于现有方法,且可生成中间时刻形变用于插值和网格变形。

FusionRS: A Large-Scale RGB-Infrared Remote Sensing Dataset for Dual-Modal Vision-Language Foundation Models Figure 1
2026-06-16cs.CV

FusionRS: A Large-Scale RGB-Infrared Remote Sensing Dataset for Dual-Modal Vision-Language Foundation Models

Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Chengyin Hu, Fengyu Zhang, Yiwei Wei, Jiujiang Guo

China University of Petroleum-Beijing at Karamay, University of Electronic Science and Technology of China, Tianjin University, most existing work remains centered on RGB, vision for more scalable RGB-infrared remote, data and tasks centered on forest fires rather than

2026-06-16视觉语言视觉感知数据集/基准

针对遥感视觉语言模型长期依赖 RGB、缺少大规模 RGB-红外-文本数据的问题,FusionRS 将公开 RGB 遥感图像翻译为红外风格配对图,并加入普通场景描述与红外感知 caption,形成约 60 万组三元数据,用于训练 CLIP 式对齐模型和生成式 VLM。实验显示其在 RGB-IR 对齐、红外到文本检索、双模态 caption/VQA 上优于 RGB-only 和非红外感知训练;但红外图像为合成风格而非真实传感器采集,真实物理泛化仍需验证。

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation Figure 1
2026-06-16cs.CV

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

Tran Dinh Tien, Zhiqiang Shen

VILA Lab, Mohamed bin Zayed University of Artificial Intelligence

2026-06-16视觉感知

针对 SAM 3 做开放词汇语义分割时需对整套类别逐一全分辨率解码、而单张图通常只含少量相关类的低效问题,ActiveSAM 将 presence 信号前置为低分辨率预览,按图像裁剪活跃类别,并结合提示扩展、桶化多路解码和边界感知背景校准,在不训练、不更新权重的条件下提升速度与精度;八个 OVSS 基准平均较 SegEarth-OV3 高约 1.4 mIoU,大词表场景最高快 5.5 倍,并在图像退化下更稳健。

DreamX-World 1.0: A General-Purpose Interactive World Model Figure 1
2026-06-16cs.CV

DreamX-World 1.0: A General-Purpose Interactive World Model

DreamX Team, Yancheng Bai, Rui Chen, Xiangxiang Chu, Rujing Dang, Hao Dou, Bingjie Gao, Qiwen Gu, Siyu Hong, Jiachen Lei, Geng Li, Jifan Li, Ruimin Lin, Qingfeng Shi, Bingze Song, Lei Sun, Jing Tang, Ruitian Tian, Jun Wang, Jiahong Wu, Pengfei Zhang, Shen Zhang, Jiashu Zhu

2026-06-16强化学习三维

本文瞄准交互式世界模型在长时生成中难以同时保持相机可控、场景记忆和低延迟的问题。DreamX-World 结合 UE、游戏与真实视频数据,引入降采样几何注意力 E-PRoPE、基于相机几何的记忆检索、事件指令微调,以及 DMD 蒸馏后强化学习对齐。结果在 5 秒评测中总体分 84.76,高于 HY-WorldPlay 1.5 和 LingBot-World,并在 8 张 RTX 5090 上最高达 16 FPS。

A Multi-Center Benchmark for Abdominal Disease Diagnosis and Report Generation from Non-Contrast CT Figure 1
2026-06-16cs.CV

A Multi-Center Benchmark for Abdominal Disease Diagnosis and Report Generation from Non-Contrast CT

Mariam Elbakry, Aliaa Sayed Sheha, Salma Hassan Tantawy, Aya Yassin, Concetto Spampinato, Karim Lekadir, Xiaomeng Li, Marawan Elbatel

A Multi-Center Benchmark for Abdominal, Ain Shams University, Cairo, Egypt, The Hong Kong University of Science and Technology, Hong Kong SAR, China, University of Catania, Catania, Italy, introduce a novel multi-center benchmark for multi-organ abdominal dis-, ology reports from two centers, partitioned into internal sets and an ex-, sible contrast-free abdominal imaging workflows. Code is available at:, strict its availability. Non-contrast CT (NCCT) offers a safer, more globally, licly available data. Consequently, no prior work has introduced a dataset and

2026-06-16数据集/基准

针对增强腹部 CT 存在造影剂风险、采集负担和资源可及性问题,本文构建了一个多中心基准,用单期非增强 CT 学习生成增强 CT 级别的多器官诊断与报告。核心贡献是整理 1254 例配对 NCCT–CECT 及报告,并统一评测 5 类模型;结果显示 NCCT 含有可学习诊断信号,平均多器官 AUC 在内部/外部队列为 69.1%/63.1%,但跨中心性能仍明显下降。

SurroundNEXO: Ego-Centric Metric Bridging for Spatially Consistent Geometry in Autonomous Driving Figure 1
2026-06-16cs.CV

SurroundNEXO: Ego-Centric Metric Bridging for Spatially Consistent Geometry in Autonomous Driving

Shuai Yuan, Runxi Tang, Yuzhou Ji, Fudong Ge, Hanshi Wang, Yifei Wang, Xianming Zeng, Jianyun Xu, Xingliang Liu, Yanfeng Wang, Zhipeng Zhang

School of Artificial Intelligence, Shanghai Jiao Tong University, 2Hello Inc., the extreme sparsity of available LiDAR ground truth and the limited field-of-view (FoV) overlap between adjacent, constructs reliable metric anchors directly from the available sparse LiDAR measurements, effectively propagating

2026-06-16视觉感知

面向自动驾驶环视相机重叠视野很小、单目深度易尺度不一致的问题,SurroundNEXO不再依赖密集跨视图匹配,而用自车坐标系下的Ego-Ray位置编码统一各视角射线,以稀疏LiDAR作度量锚点,并通过渐进式几何Transformer从单视图到时空/全局交互逐步融合。在NuScenes、Waymo、DDAD上,相比SOTA单视图误差降33.2%,跨视图一致性提升10.5%,重建质量提升25.6%。

Simulation-Based Multi-Fillet Evaluation of Woody Breast Poultry Fillets Figure 1
2026-06-16cs.CV

Simulation-Based Multi-Fillet Evaluation of Woody Breast Poultry Fillets

Chirantan Sen Mukherjee, Seung-Chul Yoon, William J. Beksi

bends, providing a robust and scalable alternative to a side-view, The authors are with the Department of Computer Science and, Engineering, The University of Texas at Arlington, Arlington, TX, USA., Unit, U.S. National Poultry Research Center, USDA Agricultural Research, lab.github.io/woody-breast-sim.

2026-06-16数据集/基准

针对现有木质鸡胸肉检测依赖侧视单片下落弯曲、难以满足产线多片吞吐的问题,本文构建工业输送线数字孪生,生成合成3D鸡胸网格并用物理仿真建模黏弹性弯曲,从俯视相机提取2D轮廓形变分数进行多片跟踪与判别。实验显示该分数能区分正常与严重WB,100 FPM下分离度约3.5倍,但真实产线验证仍属未来工作。

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization Figure 1
2026-06-16cs.CV

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

RGA Inc.

2026-06-16安全鲁棒

面向真实具身机器人中“看不见、指代不清或前提错误”的用户请求,论文关注VLM过度自信导致问答幻觉或导航到任意坐标的安全风险。Semantic Flip通过分别扰动查询或视频记忆合成无外部标注的OOD配对,在冻结VLM上训练轻量拒答模块。其在AbstainEQA上以7B模型F1=0.7110超过32B提示基线0.6746,并在新建空间定位拒答集SpaceReject上达到F1=0.9559。

Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation Figure 1
2026-06-16cs.CV

Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation

Adrian Ramlal, Yuhao Chen, John S. Zelek

University of Waterloo

2026-06-16强化学习

针对食物操作仿真中材料参数难测、且断裂模拟器不可微又耗时的问题,论文以橙子剥皮为例,用2000次仿真训练神经代理,并在归一化流潜空间中训练目标条件PPO,学习一次即可对任意行为目标快速反推参数。结果显示该策略约10 ms、8次代理评估完成估计,真实恢复率0.642,比原9维空间高23%;再用CMA-ES热启动细化可达0.828,但泛化仅在单一任务上验证。

Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection Figure 1
2026-06-16cs.CV

Federated Medical Image Segmentation under Real-World Label Noise: A Benchmark Suite for Noisy Label Learning Method Selection

Markus Bujotzek, Dimitrios Bounias, Stefan Denner, Ralf Floca, Maximilian Fischer, Peter Neher, Klaus Maier-Hein

2026-06-16视觉感知强化学习数据集/基准

针对联邦医学图像分割中各机构标注噪声难以集中检查、且既有研究多依赖合成噪声的问题,本文构建了包含真实噪声数据、多种客户端噪声场景和噪声定向评估的基准套件。实验显示真实噪声常以轮廓差异、漏标/多标和类别混淆组合出现;FedSelect整体最强,但FedAvg仍是有竞争力的基线,并给出按噪声类型选择方法的指南。

Redirecting the Flow: Image Customization through Attention Distribution Shift Figure 1
2026-06-16cs.CV

Redirecting the Flow: Image Customization through Attention Distribution Shift

Jie Li, Suorong Yang, Jian Zhao, Furao Shen

2026-06-16视觉感知生成模型

本文针对主体驱动图像定制中参考主体身份难保持、测试时微调低效、外部编码特征与生成过程错位以及共享注意力易引入干扰的问题,将参考图像建模为注意力分布迁移,并以最大熵推导条件注意力分布偏移。基于 SD3 的 CustomShift 采用参考对齐与交叉引导双分支,在训练期用轻量 LoRA 而无需测试时优化;在 DreamBooth 和 Custom101 上相较现有方法更好兼顾文本语义一致性与主体一致性。

An Open-Source Monitoring Framework for Data Exploration and Progress Tracking in Multi-Center Radiology Studies Figure 1
2026-06-16cs.CV

An Open-Source Monitoring Framework for Data Exploration and Progress Tracking in Multi-Center Radiology Studies

Markus Bujotzek, Jonas Scherer, Stefan Denner, Peter Neher, Benjamin Hamm, Lorenz Feineis, Uenal Akuenal, Andreas Bucher, Tobias Penzkofer, Klaus Maier-Hein

2026-06-16视觉感知

多中心放射学研究常依赖邮件和共享表格来寻找数据、协作者并跟踪进度,易过期且难扩展。论文将通用 Grafana–Prometheus 监控栈改造成轻量开源框架,只汇聚各中心的聚合指标并用可配置仪表盘展示,兼顾隐私与平台无关集成。其在 Kaapana 中落地,并部署到德国 RACOON 联盟 38 所大学医院,展示了跨中心数据探索、伙伴发现和研究进度监控的可行性。

Robust Spoofed Speech Detection via Temporal Pyramid Modeling Figure 1
2026-06-16cs.CV

Robust Spoofed Speech Detection via Temporal Pyramid Modeling

Mahtab Masoudi Nezhad, Nima Karimian

Lane Department of Computer Science and, West Virginia University, Bellini College of Artificial Intelligence, University of South Florida

2026-06-16视觉感知安全鲁棒

面向语音认证中合成、转换和重放攻击在跨数据集/跨语言场景下易失效的问题,论文在 XLS-R 自监督表示前加入时间金字塔适配器,用多尺度并行时序卷积同时捕捉局部伪造痕迹与长程韵律异常。实验覆盖 ASVspoof、PartialSpoof、DiffSSD 和 HQ-MPSD;在 PartialSpoof 上取得 99.24% AUC、3.87% EER,优于多种基线,但跨域和跨语言阈值指标仍明显下降,说明校准与适配仍是瓶颈。

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment Figure 1
2026-06-16cs.CV

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

Zijie Meng

generation prompts are available. Extensive experiments, rameters. Our project is available at https://github.com/, generation prompts are available, a lightweight cross-, plates. When generation prompts are available, we denote

2026-06-16视觉语言视觉感知

本文针对 CLIP/VLM 做 AI 生成图像质量评价时“语义判别强、细粒度失真感知弱”的矛盾,提出 MST-CLIPIQA:用不同 patch 粒度的双流 CLIP 分别建模全局语义一致性与局部纹理伪影,并通过信息瓶颈式门控融合去冗余;有提示词时再用跨注意力评估图文对应。五个基准上质量 SRCC 平均提升 1.11%、图文对应提升 2.35%,且仅约 0.8M 可训练参数。

WaveDINO: Learning-Based Atmospheric Correction of Unwrapped InSAR Interferograms Validated by GNSS: Results at Laguna del Maule and Campi Flegrei Volcanoes Figure 1
2026-06-16cs.CV

WaveDINO: Learning-Based Atmospheric Correction of Unwrapped InSAR Interferograms Validated by GNSS: Results at Laguna del Maule and Campi Flegrei Volcanoes

Robert Popescu, Juliet Biggs, Tianyuan Zhu, Nantheera Anantrasirichai

Grant No. 101003173) and the NERC Centre for the Observation, University, Centre for Observation and Modelling of Earthquakes, Vol-, of interest of 50×50 km centred on each volcano, with an

2026-06-16视觉感知

本文针对火山 InSAR 形变监测中大气相位延迟易掩盖真实形变、传统气象模型校正残差和偏差不稳定的问题,提出 WaveDINO:用小波多尺度去噪结合冻结 DINOv3 全局特征、DEM 地形调制和相位斜坡头,并以真实短期干涉图叠加物理合成岩浆形变进行监督训练。在 Laguna del Maule 与 Campi Flegrei 的长期数据上,方法优于对比模型和气象校正,GNSS 平均失配约降 3% 与 19%。

LLM-Based Visual Explanation Evaluation Framework for Assessing the Explainability of Facial Skin Disease Classification Models Figure 1
2026-06-16cs.CV

LLM-Based Visual Explanation Evaluation Framework for Assessing the Explainability of Facial Skin Disease Classification Models

Gyuyeon Na

AI and Business Analytics, Ewha Womans University, Seoul, Republic of Korea, labeled data. In acne detection, Wei et al. (2023)

2026-06-16数据集/基准

针对皮肤病分类研究多关注准确率、缺少对 Grad-CAM 是否落在临床病灶区域的可复现评估,本文提出用 GPT-5.5、Gemini 3.5 Flash、Claude Sonnet 4.6 作为 LLM-as-a-Judge,并通过逐步提示加入量表、临床知识、惩罚规则和结构化输出。实验显示,不同增强策略对 EfficientNet-B0、MobileNetV3、ResNet18 的性能与注意力分布影响不同,最佳增强下模型更集中于病灶区域,细化提示也提升了定位与可信度评分一致性;但验证仍属单图像、小样本试点,结论外推受限。

Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations Figure 1
2026-06-16cs.CV

Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations

Zhiqiang Zhou, Junliang Dai, Xu ling

Hunan Chemical Industry Vocational and Technical College, Zhuzhou, Hunan 412000, China

2026-06-16生成模型

针对多模态模型依赖文本 CoT、难以显式表达空间中间过程的问题,Gen-VCoT 用 SAM 分割图和 Marigold 伪彩深度图作为可视化 RGB 推理中间表示,再由 Qwen2-VL 作答,并用路由器按问题复杂度选择步骤。实验显示其在复杂空间/深度问题上优于直接推理(78.9% vs 68.4%,空间+25%、深度+50%),但在简单事实/CLEVR 上反而弱于基线和文本 CoT,说明增益具有任务依赖性。

Text-Vision Co-Instructed Image Editing Figure 1
2026-06-16cs.CV

Text-Vision Co-Instructed Image Editing

Chenxi Xie, Yuhui Wu, Qiaosi Yi, Lei Zhang

2026-06-16视觉感知

本文针对图像编辑中“文字有语义但空间控制粗、拖拽有位置但意图含糊”的矛盾,提出文本-视觉协同指令任务。核心做法是从视频构建2.3万余组源/目标图、点轨迹与文本描述,并用可插拔的TV-Edit将稀疏点提示结合图文语义转为语义感知空间控制。作者还建立TV-Edit-Bench,实验显示其在多种编辑骨干上较文本-only和drag-only方法有更好的语义忠实、空间对齐与视觉一致性。

3D Classification of Paramagnetic Rim Lesions in Multiple Sclerosis via Asymmetric QSM-FLAIR Modeling Figure 1
2026-06-16cs.CV

3D Classification of Paramagnetic Rim Lesions in Multiple Sclerosis via Asymmetric QSM-FLAIR Modeling

Veronica Pignedoli, Giacomo Boffa, Nicoletta Noceti, Matilde Inglese, Francesca Odone, Matteo Moro

MaLGa, DIBRIS, University of Genova, Genova, Italy, DINOGMI, University of Genova, Genova, Italy, pert interpretation remain limited to specialized centers, visual assess-, centered MRI patches extracted from co-registered QSM and FLAIR volumes., of publicly available benchmark datasets., work currently available. However, its reliance on handcrafted radiomic features, Rim−lesion classification operating directly on lesion-centered QSM and FLAIR

2026-06-16三维

这篇工作面向多发性硬化中Rim+病灶稀少、QSM判读依赖专家且耗时的问题,提出端到端3D多模态分类器:以QSM作为主要磁敏感信号,用FLAIR经空间FiLM提供结构上下文,并结合跨模态自监督预训练与监督对比正则缓解小样本和类别不平衡。在88名患者临床队列上,方法相较既有架构表现更好,但具体增益来源在片段中未充分说明。

Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment Figure 1
2026-06-16cs.CV

Structure-aware Knowledge-guided Heterogeneous Mamba for Zygomaticomaxillary Suture Assessment

Xiaoqi Guo, Birui Chen, Xinquan Yang, Chaoyun Zhang, Xuefen Liu, Mianjie Zheng, Kun Tang, Xuguang Li, Wen Ma, Yanhua Xu, Linlin Shen

and Linlin Shen1,2 1 College of Computer Science and Software Engineering, Shenzhen University, School of Artificial Intelligence, Shenzhen University, Shenzhen, China, Affiliated Stomatology Hospital of Kunming Medical University, Kunming, China, Shenzhen University General Hospital, Shenzhen, China, formance compared to existing methods. Code is available at https:, this expert-dependent process is inherently subjective and labor-intensive due, often leads to inter-observer inconsistency, further complicating the labeling pro-, To address these challenges, this paper introduces the first publicly available

2026-06-16视觉感知

针对CBCT中颧颌缝成熟分期依赖专家、边界细碎且邻近阶段语义模糊的问题,论文构建了首个公开ZMS数据集,并提出SKMamba:用结构预训练的隐式边缘提取器强化缝隙高频形态,再以LLM解剖描述做跨模态语义对齐。实验显示其在3790张标注ROI上优于既有CNN/Transformer等方法,具备辅助正畸干预时机判断的潜力。

Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection Figure 1
2026-06-16cs.CV

Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection

Renxi Cheng, Jie Gui, Hongsong Wang

School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China, Purple Mountain Laboratories, Nanjing 210000, China, Engineering Research Center of Blockchain Application, Supervision And Management, (Southeast University), Ministry of Education, China, School of Computer Science and Engineering, Southeast University, Nanjing 210096, China, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary, Applications (Southeast University), Ministry of Education, China

2026-06-16视觉感知

针对文生视频越来越逼真、传统深伪检测对新生成器泛化不足的问题,论文从低位 bit-plane 中更容易暴露细节噪声伪迹这一观察出发,提出 NAMP:提取低位噪声并通过像素强度增强、局部空间放大和跨帧时间聚合后送入3D判别网络。同时构建 HardGVD 难例基准;在 GenVidBench 与 HardGVD 上显著优于既有方法,GenVidBench 平均检测准确率超过90%,但训练稳定性仍受随机区域和帧采样影响。

PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation Figure 1
2026-06-16cs.RO

PATCH: Action-Chunk-Conditioned Latent Patch Innovation Monitoring for Robot Manipulation

Yanan Zhou, Ranpeng Qiu, Yincong Chen, Jiajie Cui, Weiming Zhi

School of Computer Science, The University of Sydney.Australian Centre For Robotics, The University of Sydney.

2026-06-16机器人

面向开放工作空间中移动物体、遮挡等局部扰动会误导学习型操作策略的问题,PATCH不再做全局异常检测,而是利用当前动作块投影短时执行走廊,在其中预测潜在patch演化并过滤机器人自运动,只累积持续的外部残差作为干预信号。真实机器人回放和部署显示,其触发更稳定、更贴近任务风险,可支持暂停、恢复源选择与原策略续执行。

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation Figure 1
2026-06-16cs.CV

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

Yagmur Akarken, Orest Kupyn, Christian Rupprecht

2026-06-16生成模型

MMDiff针对扩散Transformer生成图像后丢弃中间感知表征、仍需另跑分割/深度模型的问题,冻结FLUX类DiT,仅训练轻量解码头,同时输出语义分割、显著性和深度。核心洞察是感知信息沿去噪时间分布,需用带空间权重的多时间步特征融合,并结合概念注意力;实验中分割较单时间步最高提升28.7% mIoU,且与DINOv3特征互补,可用于大规模合成标注。

Sinkhorn-CPD: Robust point cloud registration via unbalanced entropic optimal transport Figure 1
2026-06-16cs.CV

Sinkhorn-CPD: Robust point cloud registration via unbalanced entropic optimal transport

Jin Zhang, Mingyang Zhao, Bing Liu, Xin Jiang

aLMIB & School of Mathematical Sciences, Beihang University, Beijing, China, bState Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, Beijing, China, cBeijing Key Laboratory of Artificial Intelligence Innovation and Application in the Machine Tool Industry, School of Artificial Intelligence, Beihang, University, Beijing, China, dUniversity of Chinese Academy of Sciences, Beijing, China, Data availability. Data and code are publicly available at, showed that entropic regularization makes OT scalable and

2026-06-16三维安全鲁棒

本文针对 CPD 在大量离群点和低重叠点云配准中因目标端硬边缘约束而易被错误点牵引的问题,指出 CPD 的 E 步等价于单边熵正则 OT,且方差可视为温度;据此提出 Sinkhorn-CPD,用双边 KL 松弛构成非平衡熵 OT,并用广义 Sinkhorn 保留闭式 Procrustes 与自适应退火。实验显示其在合成、跨类别和 scan-to-CAD 场景中较 CPD、RPOT 等更稳健,70% 离群下仍保持低旋转误差。

Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model Figure 1
2026-06-16cs.CV

Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

South China University of Technology, Columbia University, evidence is cheaply available, and introduce Budgeted Con-, when more evidence is cheaply available. When a person is, malabstentionforLLMs(Yadkorietal.2024)boundtheerror, fixed, label-independent transformation to both calibration, claim c about image x has an unknown binary label y ∈

2026-06-16视觉语言视觉感知

针对视觉语言模型为保证低幻觉率而过度拒答的问题,论文提出 BCEA:在回答/ abstain 之外加入有预算的再观察,并将裁剪、缩放或关系特定干预纳入打分后重新做 conformal 校准,指出朴素后处理会破坏交换性与风险保证。实验在 POPE、COCO 及多种开源 VLM 上显示,BCEA 能在目标幻觉率下提升覆盖率,水平翻转干预也显著改善空间关系验证。

Vision-Language Models as Zero-Annotation Oracles in Histopathology Figure 1
2026-06-16cs.CV

Vision-Language Models as Zero-Annotation Oracles in Histopathology

Vishal Jain, Giorgio Buzzanca, Sarah Cechnicka, Maarten Naesens, Priyanka Koshy, Tri Nguyen, Jesper Kers, Candice Roufosse, Bernhard Kainz

Imperial College London, London, UK, Leiden University Medical Center, Leiden, The Netherlands, University Hospitals Leuven, Leuven, Belgium, University Medical Center Utrecht, Utrecht, The Netherlands, Dept. AIBE, Friedrich-Alexander University Erlangen-Nürnberg, Germany, pseudo-labels are used to distil lightweight student models that are as, cost. Our framework provides a principled, scalable solution to a per-, sistent infrastructure bottleneck in digital pathology. Code is available, of expensive calls, and we use the resulting pseudo-labels to distil lightweight, mentation, and a distillation pathway that converts VLM pseudo-labels into

2026-06-16视觉语言视觉感知

针对全切片病理前景分割依赖手调阈值或H&E监督模型、在特殊染色和跨站点场景易失效的问题,本文将组织/背景判别重定义为通用视觉感知任务,用通用VLM作零标注oracle,并通过粗到细框定位、颜色聚类、零/少样本Auto-context复核与学生模型蒸馏降低成本。在Leica-75上,方法在Jones和EVG染色取得Dice 0.858/0.853,跨染色方差较最佳监督基线低7倍;难例Dice由0.470升至0.819,VLM质控也接近或超过人工一致性。

MVM-IOD: An Industrial Object-Centric Benchmark Dataset for the Evaluation of 3D Reconstruction Methods Figure 1
2026-06-16cs.CV

MVM-IOD: An Industrial Object-Centric Benchmark Dataset for the Evaluation of 3D Reconstruction Methods

Robert Langendörfer, Markus Hillemann, Markus Ulrich

Machine Vision Metrology, Institute of Photogrammetry and Remote Sensing, Karlsruhe Institute of Technology, Germany -

2026-06-16数据集/基准三维

面向工业机器人视觉中无纹理、反光/透明和复杂几何物体导致三维重建与位姿评估困难的问题,论文发布 MVM-IOD:用机器人臂半球采样采集9类工业物体、2种背景的18个场景,并提供精确相机位姿与线扫点云参考。作者以 COLMAP、VGGT、π³ 和 2DGS 建立基线,发现前馈几何模型在该工业采集分布外场景中位姿和点云质量下降,简单预处理可缓解但工业应用仍需谨慎。

DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation Figure 1
2026-06-16cs.CV

DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation

Xifeng Xue, Xiaokang Wang, Zirui Li, Ming-Ming Cheng, Guolei Sun

College of Computer Science, Nankai University, Tianjin, China, Nanjing University of Posts and Telecommunications, Nanjing, China

2026-06-16视觉感知

本文针对视觉语言模型在极低视觉 token 预算下剪枝不稳定的问题,指出性能下降与保留 token 相对全量 token 的特征分布偏移高度相关,并提出分布一致性度量。方法用 ACGR 在删除前把上下文信息转移到锚点 token,再用 TATCS 结合文本重选代表性 token。实验显示,在 LLaVA-1.5-7B 仅保留 16 个视觉 token 时仍达到上界平均性能的 92.1%。

SUP-MCRL: Subject-aware Unified Pseudo-feature Coded Multimodal Contrastive Representation Learning for EEG Visual Decoding Figure 1
2026-06-16cs.CV

SUP-MCRL: Subject-aware Unified Pseudo-feature Coded Multimodal Contrastive Representation Learning for EEG Visual Decoding

Shengyu Gong, Weiming Zeng, Yueyang Li, Zijian Kang, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

Lab of Digital Image and Intelligent Computation, Shanghai Maritime University, Shanghai 201306, China, Department of Language Science and Technology, The Hong Kong Polytechnic University, Hung Hom, Kowloon, Affiliated Lianyungang Hospital of Xuzhou Medical University, Lianyungang 222002, China, unified framework integrating three collaborative mechanisms: (1) Semantic-entity Aware Vi-, subject and 24.0%/52.9% LOSO accuracy, surpassing state-of-the-art methods. Code is available at

2026-06-16视觉语言强化学习

这篇工作针对 EEG 视觉解码在自然图像零样本场景中因模态鸿沟、低信噪比和个体差异导致的伪对齐问题,将 EEG–图像匹配从单纯距离对齐改为带语义与主体约束的对比表示学习。SUP-MCRL 结合可学习语义实体视觉注意力、含多尺度空洞卷积与频带注意力的 EEG 增强器,以及 EMA 原型伪特征池来提高监督密度并抑制塌缩。在 THINGS-EEG 上,文中报告被试内 Top-1/Top-5 为 66.0%/91.9%,LOSO 为 24.0%/52.9%,优于既有方法。

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models Figure 1
2026-06-16cs.CV

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

Dingrong Wang, Xian Tao, Zhen Qu, Hengliang Luo, Xinyi Gong, Fei Shen, Zhengtao Zhang, Guiguang Ding

Qwen3-VL (235B parameters). Our code is publicly available, Academy of Sciences (CAS) under Grant 2023145, and in part by the Beijing, the Institute of Automation, Chinese Academy of Sciences (CAS), Beijing, China, and also with the School of Artificial Intelligence, University, of Chinese Academy of Sciences, Beijing 100049, China., Xian Tao is with the Institute of Automation, CAS, Beijing 100190, China, CASI Vision Technology Co., Ltd., Luoyang 471000, China and also with, the Shandong Laboratory of Aluminum Advanced Manufacturing in Binzhou, (SLAAMB), Binzhou Institute of Technology, Weiqiao-UCAS Science and, Hengliang Luo is with CASI Vision Technology Co., Ltd., Luoyang 471000, Xinyi Gong is with the Space Information Research Institute, Hangzhou, Dianzi University, Hangzhou 310018, China.

2026-06-16视觉语言

本文针对工业缺陷定位中闭集方法跨场景泛化差、MLLM 问答范式难以精确定位且 GRPO 对细微缺陷信号不足的问题,提出 DifferAD-R1:将正常/待检双图输入重构为 one-shot 差异 grounding,并用双一致性定位奖励、难度感知重加权与组内重采样强化困难样本学习。作者还构建 20 类、13K 图像对的 AD-DualDiff,实验显示其优于现有基线,并接近 235B 参数 Qwen3-VL 的表现。

Rotational Symmetry based Object Pose Estimation from Point Clouds in the Absence of Known 3D Models Figure 1
2026-06-16cs.CV

Rotational Symmetry based Object Pose Estimation from Point Clouds in the Absence of Known 3D Models

Weichen Dai, Ruixun Yu, Yangjie Tang, Yifan Du, Yiyang Zhang, Donglei Sun, Hua Zhang

Key Laboratory of Brain Machine Collaborative Intelligence of Zhe-, jiang Province, School of Computer Science, Hangzhou Dianzi University, ufacturing Research Group, the University of Nottingham Ningbo China, using known 3D models. To address the model availability challenge, unlike, the object is available. However, high-quality 3D models of, industrial objects are not commonly available, often due to, a sequence of 3D measurements is available in an unknown, considering the limited availability and inconsistent quality of, industrial objects to address the problem of unavailability of

2026-06-16三维

面向工业喷涂等场景中 CAD/高质量三维模型因保密难以获取的问题,论文利用许多工件固有的旋转对称性作为几何先验,在无已知模型点云上通过旋转后的近邻对应构造对称约束损失,迭代联合优化物体位姿与点云修正。作者在四类合成物体和真实轮毂数据上验证,结果显示其精度可接近依赖已知三维模型的方法,并在噪声、遮挡下仍保持一定鲁棒性。

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models Figure 1
2026-06-16cs.CV

LOCUS: Local Visual Cue Search for Enhancing Fine-Grained Perception in Multimodal Large Language Models

Zhou Tao, Fang Zhang, Zewen Ding, Shida Wang, Xiaokun Sun, YongXiang Hua, Haoyu Cao, Linli Xu

University of Science and Technology of China, State Key Laboratory of Cognitive Intelligence

2026-06-16视觉语言

论文关注多模态大模型在高分辨率图像中仍难以利用小物体、细微属性等局部证据的问题,并将其归因于冗余视觉上下文导致的“visual context rot”。LOCUS 的核心做法是在训练时给出局部裁剪作为视觉线索,让模型在全图中用 IoU 奖励学习定位该线索,从而把局部证据搜索内化到模型中,推理时仍保持普通图像-问题接口。实验显示其在细粒度感知、幻觉鲁棒性等定位敏感任务上有稳定提升,同时基本保留通用理解与推理能力,注意力分析也显示模型更聚焦真实证据区域。

Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction Figure 1
2026-06-16cs.LG

Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction

Daniele Mos, Felipe Drummond, Anton Bossenbroek, Soufiane el Khinifri

information available in current satellite technologies and standard regressors treat each sample in

2026-06-16生成模型

本文针对传统土壤有机碳预测依赖手工协变量、难以利用多时相遥感信息且忽略采样点不规则空间结构的问题,提出 SpTGNN:用 TerraMind 提取 Sentinel/DEM 表征,将影像、环境、位置和时间特征经 MoE 融合,并在含地理邻近、NDVI 相似和高程相似三类边的异构图上做关系注意力传播,同时结合 Moran’s I 正则与集成不确定性估计。在约 4.9 万全球样本上评估,非洲测试集 5 模型集成达到 R²=0.762、RMSE=3.51 g/kg、MAPE=22.9%,显著优于 XGBoost;消融显示异构图、MoE 和微调骨干均有贡献。

Transformation-driven generation of comparable projection images from multimodal anatomical scenes Figure 1
2026-06-16cs.CV

Transformation-driven generation of comparable projection images from multimodal anatomical scenes

Dariusz Pojda, Krzysztof Domino, Michał Tarnawski, Agnieszka Anna Tomaka

2026-06-16视觉语言视觉感知

为减少动态颌面放射成像中的重复曝光,并提升运动场景的可控与可复现性,本文将DRR式投影从单体积渲染改写为“变换驱动”的多模态解剖场景观测:CT/CBCT、分割体、表面模型和治疗器具保持独立对象及显式空间变换。框架分离投影几何、采集、材料解释与显示,在pyDpVision中生成多种下颌运动/复位配置下可直接比较的VirtualRTG图像;物理逼真度并非重点,定量优势文中未充分说明。

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models Figure 1
2026-06-16cs.CV

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

Zhiang Chen, Nahyuk Lee, Boyang Sun, Taein Kwon, Marc Pollefeys, Zuria Bauer, Sunghwan Hong

VGG, University of Oxford, ETH AI Center

2026-06-16视觉语言视觉感知

面向机器人/AR跨时间重访同一室内空间时,头戴RGB视角模糊、重叠少且点云不可靠的问题,PROSE用预训练VLM同时构建开放词汇3D场景图并做跨扫描物体匹配,通过高度分桶、同/不同验证和几何一致性投票估计刚体位姿,无需训练、深度或标注图。在Aria Digital Twin与AEA上,其配准召回、旋转和平移误差均优于几何和学习式场景图基线,并可支持下游路径规划。

Local-GS: Accelerating 3D Gaussian Splatting via Tile-Local Warp Coherence Figure 1
2026-06-16cs.CV

Local-GS: Accelerating 3D Gaussian Splatting via Tile-Local Warp Coherence

Yang Luo, Yan Gong, Yongsheng Gao, Jie Zhao, Xinyu Zhang, Huaping Liu

Blending scenes. Code: https://github.com/tilaba/Local-GS.git., Laboratory of Robotics and Systems, Harbin Institute of Technology, Harbin, Xinyu Zhang is with the State Key Laboratory of Intelligent Green Vehicle, and Mobility, the School of Vehicle and Mobility, Tsinghua University, Beijing, Huaping Liu is with the Department of Computer Science and Technology, memory latency, threads execute collaborative prefetching

2026-06-16三维

本文针对3D Gaussian Splatting在复杂场景中因高斯分布不规则导致的GPU warp分歧、无效访存和重复alpha计算问题,提出Local-GS:不再按几何粗粒度组织渲染,而是围绕SIMT执行边界做tile-local参数提升、warp级剔除和无分支混合。其作为纯kernel级插件不改变场景表示,在多数据集保持画质,Deep Blending上与FlashGS结合相对原始3DGS最高达7.76×加速。

Assessing Reliability of Symbol Detection in Concept Bottleneck Models Figure 1
2026-06-16cs.LG

Assessing Reliability of Symbol Detection in Concept Bottleneck Models

Javier Fumanal-Idocin, Javier Andreu-Perez

University of Essex, Wivenhoe Park, Essex, United Kingdom, concept labels by building post-hoc or label-free bottlenecks from pretrained, code label-relevant signals that are not part of the intended concept semantics

2026-06-16视觉感知

这篇论文针对概念瓶颈模型中“任务准确率高但概念符号不可信”的问题,提出用独立训练的概念检测器与分类头互换来压力测试符号可靠性,并结合概念级指标与不确定性定位伪触发;还引入多头、可靠性感知训练抑制信息泄漏。结果显示,CUB全监督下互换几乎无损,而合成任务在弱概念监督时概念对齐会崩塌,该方法可在泄漏区间约翻倍互换准确率。

Kairos: A Native World Model Stack for Physical AI Figure 1
2026-06-16cs.AI

Kairos: A Native World Model Stack for Physical AI

Kairos Team, Fei Wang, Shan You, Qiming Zhang, Tao Huang, Zuoyi Fu, Zhisheng Zheng, Yunlong Xi, Feng Lv, Xiaoming Wu, Zeyu Liu, Cong Wan, Pu Li, Ruiqing Yang, Xiaoou Li, Wei Wang, Kangkang Zhu, Yuwei Zhang, Shi Fu, Xiaoning Wu, Xuzeng Fan, Dacheng Tao, Xiaogang Wang

2026-06-16强化学习

面向物理智能中世界模型从视频生成走向可部署基础设施的需求,Kairos试图同时解决异构经验学习、长时状态保持与低延迟运行。其核心是跨具身数据课程、统一理解/生成/预测架构和混合线性时序注意力,并配合系统协同设计。文中称在具身世界模型、长时预测和动作策略基准上达到领先表现,但增益可能主要来自大规模数据与工程 scaling。

BadWorld: Adversarial Attacks on World Models Figure 1
2026-06-16cs.CV

BadWorld: Adversarial Attacks on World Models

Linghui Shen, Mingyue Cui, Xingyi Yang

The Hong Kong Polytechnic University

2026-06-16强化学习

面向机器人、自动驾驶等安全场景中越来越常用的交互式视觉世界模型,本文关注单张上下文图像的微小扰动是否会破坏后续动作条件 rollout。作者提出 BadWorld:用自监督速度攻击绕开未来视频标签缺失,并用轨迹自适应双层优化提升对未知控制序列的泛化。实验显示,在连续相机和离散动作控制模型上,几乎不可见的扰动会导致去噪不完整、结构崩塌、语义漂移和控制不一致,暴露出现有世界模型的显著鲁棒性风险。

Active Reference Acquisition in Few-Shot Font Generation Figure 1
2026-06-16cs.CV

Active Reference Acquisition in Few-Shot Font Generation

Shinnosuke Matsuo

NTT, Inc., Japan, code is available at https://github.com/matsuo-shinnosuke/ActiveRef-, Designing a font is a highly time-consuming and labor-intensive process that, ⋆This work was conducted while the author was affiliated with Kyushu University.

2026-06-16视觉感知

本文针对少样本字体生成中“参考字形固定”导致复杂风格覆盖不足的问题,提出设计师在环的主动参考获取框架。核心洞察是字体风格由局部笔画部件表征,方法用 SIFT 等局部特征聚类成部件直方图,并选择能最大化当前参考集部件覆盖、减少冗余的下一个查询字形。在 Google Fonts 上,相比随机查询和不考虑当前参考集的固定/覆盖策略,用更少查询获得更高生成质量。

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering Figure 1
2026-06-16cs.CL

Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering

Jieyuan Liu, Jianyang Gu, Shijie Chen, Jefferson Chen, Zhen Wang

University of California, San Diego, The Ohio State University

2026-06-16视觉语言

本文关注多模态知识增强 VQA 中检索证据放在提示不同位置时读者是否同样可用,挑战仅看 recall@k 的假设。作者设计只移动黄金段落槽位的受控协议,在3个7B/8B VLM和两个KB-VQA基准上发现并非文本LLM常见的“中间丢失”U形,而是强首因偏置:首位比末位高16–26个百分点;消融表明多模态会放大文本侧偏置,主要锚定提示slot 0,简单重排、MMR或oracle rerank难以修复。

Unified Multimodal Model for Brain MRI Imputation and Understanding Figure 1
2026-06-16cs.CV

Unified Multimodal Model for Brain MRI Imputation and Understanding

Zhiyun Song, Che Liu, Tian Xia, Avinash Kori, Wenjia Bai

Department of Computing, Imperial College London, London, UK, Department of Brain Sciences, Imperial College London, London, UK, of modality incompleteness. Source code is publicly available at https:, Explicit methods leverage the available modalities to synthesise images of miss-, itly in the model. Some of these methods align the representations of the available, ple generative modules to map representations of available images to those of

2026-06-16视觉语言

针对临床脑 MRI 常缺失 T1/T2/FLAIR 等模态、两阶段补全再诊断易割裂的问题,UniBrain 将缺失模态生成、影像描述与最终诊断统一为自回归交错序列,并用自对齐学习细粒度解剖表征、动态 hidden state 缓解长上下文误差累积。多疾病 MRI 实验显示其在模态补全保真度、报告生成和疾病诊断准确率上均表现较强,但计算开销仍高。

Uncertainty Quality of VGGT: An Analysis on the DTU Benchmark Dataset Figure 1
2026-06-16cs.CV

Uncertainty Quality of VGGT: An Analysis on the DTU Benchmark Dataset

Markus Hillemann, Robert Langendörfer, Steven Landgraf, Markus Ulrich

Institute of Photogrammetry and Remote Sensing, Karlsruhe Institute of Technology, Germany -, optimization. For photogrammetry, this opens new possibilities for real-time, scalable, and accessible 3D reconstruction. In this, photogrammetric use cases requiring scalability and fast pro-

2026-06-16数据集/基准安全鲁棒

本文针对 VGGT 在安全关键三维重建中“置信度是否可信”的问题,系统评估其原生 aleatoric 不确定性在 DTU 基准上的作用,而非只看几何精度。核心洞察是直接分析无后处理的点图与深度图分支,并用 PAvPU、AUSE 等指标检验不确定性质量。结果显示置信阈值 2.0 可作为过滤原始输出的实用起点,点图分支在重建精度和不确定性质量上优于深度图分支,深度图存在过度自信;改进不确定性预测有望进一步提升精度。

AURA: Active-Response Attribution under Treatment Ambiguity in Bacterial Cytological Profiling Figure 1
2026-06-16cs.CV

AURA: Active-Response Attribution under Treatment Ambiguity in Bacterial Cytological Profiling

Kartik Jhawar, Mrunmayee Deshpande, Wilfried Moreira, Guillermo C. Bazan, Lipo Wang

Institute for Digital Molecular Analytics and Science, Nanyang Technological University, Singapore 636921, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore 639798, Institute for Functional Intelligent Materials, National University of Singapore, Singapore 117544, the lowest reconstruction energy, using no strain label at test, ing where generic multi-label classification fails., or response labels, but they do not explicitly encode the, that always returns a label [47, 48].

2026-06-16视觉感知

论文关注多抗生素处理下“施加药物”与显微形态中真正起效药物不一致的问题。AURA将其建模为带约束的能量式逆归因,利用活性集合必须是施加集合子集的先验,将残差形态分解为药物响应原子并选最低重构能量,AURA-E还能在证据接近时拒答。在E. coli跨重复实验中精确匹配率达95.47%,显著高于朴素规则37.43%,拒答后80%覆盖率下达97.86%。

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry Figure 1
2026-06-16cs.CV

MVOFormer: Flow-Semantic Transformer for Robust Monocular Visual Odometry

Jituo Li, Shunwang Sun, Jialu Zhang, Xinqi Liu, Jinyao Hu, Zhicheng Lu, Sajad Saeedi, Guodong Lu

Zhicheng Lu is with the Rural Health Research Institute, Charles Sturt University, Sydney, Australia., Sajad Saeedi is with University College London, U.K.

2026-06-16生成模型安全鲁棒

针对单目视觉里程计在动态物体、低纹理和跨域部署中易失效,以及现有学习式方法要么表征不够可解释、要么流水线复杂的问题,MVOFormer用光流-语义双分支编码器联合建模像素运动与对象级先验,并通过迭代多模态解码器抑制不可靠区域、逐步细化6DoF位姿。在TartanAir、KITTI、TUM-RGBD和ETH3D-SLAM上,无目标域微调时优于已有学习式帧间方法,显示出更强零样本鲁棒性。

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands Figure 1
2026-06-16cs.CV

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

2026-06-16机器人视觉感知

针对机器人从示教视频生成指令时常把动作说对却选错物体的问题,论文将动作识别与物体识别解耦:用 TSM 建模时序动作,再通过轨迹角色、模糊检测和重叠抑制选择任务相关物体,并交给 VLM 做类别识别。改造 Something-Something V2 上动作准确率 86.79%,标准/新物体 BLEU-4 为 0.337/0.261,较最强专用基线提升明显。

ResEdit: Residual embeddings for precise generative image editing Figure 1
2026-06-16cs.CV

ResEdit: Residual embeddings for precise generative image editing

Ahmet Canberk Baykal, Valentin Deschaintre, Yannick Hold-Geoffroy, Michael Fischer, Anna Frühstück, Cengiz Öztireli, Iliyan Georgiev

University of Cambridge

2026-06-16视觉感知生成模型

针对扩散反演编辑中噪声潜变量容易“烘入”身份与条件信息、导致编辑僵硬或身份漂移的问题,ResEdit将图像身份单独编码为可优化的残差嵌入,并用梯度反转抑制其携带待编辑内禀条件,从而把重建负担从噪声转移到旁路条件。实验显示其在内禀空间编辑、重光照及初步文本编辑中提升了身份保持与编辑响应性,甚至可降低对精确反演的依赖。

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory Figure 1
2026-06-16cs.CV

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

Shuai Yang, Bingjie Gao, Ziwei Liu, Jiaqi Wang, Dahua Lin, Tong Wu

Shanghai Jiao Tong University, Stanford University, S-Lab, Nanyang Technological University, The Chinese University of Hong Kong, Shanghai Innovation Institute

2026-06-16视觉感知

这篇论文关注视频生成在连续相机运动和编辑后重访场景时容易使用过期记忆、导致语义回退或几何错位的问题。PermaVid的核心洞察是将空间上下文拆成易变的语义外观与相对稳定的几何结构,用RGB记忆和深度记忆分别存储,并通过编辑感知的更新与检索进行多模态融合。实验显示其在全局风格编辑和局部对象编辑后能更好保持长期语义与结构一致性,优于已有方法。

Hierarchical Fine-Grained Aerial Object Detection Figure 1
2026-06-16cs.CV

Hierarchical Fine-Grained Aerial Object Detection

Yan Zhang, Fang Xu, Wen Yang, Gui-Song Xia

detection, relying solely on single-label supervision and thus, levels. The dataset, benchmark, and code are available at, Yan Zhang is with the School of Computer Science, Wuhan University, Fang Xu and Gui-Song Xia are with the School of Artificial Intelligence, Wen Yang is with the School of Electronic Information, Wuhan University, category labels as supervision [14]–[17], with the expectation, specific appearances from category labels and embed struc-, publicly available collection of model-specific categories for, scalability of such methods.

2026-06-16视觉感知

针对遥感细粒度检测中仅靠单标签难以区分舰船、飞机型号细微结构差异的问题,论文提出 ExpertDet,将专家属性与类别层级作为监督信号:用掩码属性重建对齐视觉细节,并以层级原型树和对比约束保持跨层语义连续、强化兄弟类区分。作者还构建含 106 类舰船和 30 类飞机的 PSP 基准;实验显示该方法在多种检测器、PSP 各层级及已有细粒度数据集上均取得稳定提升。

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos Figure 1
2026-06-16cs.RO

V2P-Manip: Learning Dexterous Manipulation from Monocular Human Videos

Kaihan Chen, Yanming Shao, Haifeng Ji, Xiaokang Yang, Yao Mu

Zhejiang University, Hangzhou, China, Shanghai Jiao Tong University, Shanghai, China, Shanghai AI Laboratory, Shanghai, China

2026-06-16机器人视觉感知

V2P-Manip针对遥操作/动捕数据昂贵且单目人类视频存在深度歧义、遮挡和物理不一致的问题,提出从非结构化RGB视频到灵巧手策略的完整流程,结合3D资产获取、尺度恢复、轨迹估计与两阶段几何/接触约束优化,并用残差学习缩小策略探索空间。在TACO、OakInk及合成任务中,其位姿精度、训练效率和环境适应性优于基线,多任务平均成功率超过75%,且可迁移到五种不同灵巧手。

Beer-Lambert Guided Representation Learning for Unsupervised Anomaly Detection in Sub-THz Food Inspection Images Figure 1
2026-06-16cs.CV

Beer-Lambert Guided Representation Learning for Unsupervised Anomaly Detection in Sub-THz Food Inspection Images

Gyutae Hwang, Sang Jun Lee

Division of Electronics and Information Engineering, Jeonbuk National University, cues for anomaly detection, the publicly available Inline-

2026-06-16视觉感知

针对食品异物检测中低密度污染物难以用传统成像和RGB预训练特征可靠识别的问题,本文把Sub-THz透射图像的物理衰减机制引入无监督异常检测,用Beer-Lambert定律约束表征学习,并通过吸收/厚度分解重建衰减图作为辅助正则;同时提出LOFO评估跨食品泛化。在Inline-Food-Inspection-THz上,相比基线整体检测性能提升,但具体增益幅度文中片段未充分说明。

Instance-Aware Knowledge Distillation for Semi-Supervised Learning of an On-Board Multi-Task Dense Prediction Model for Collision Avoidance System Figure 1
2026-06-16cs.CV

Instance-Aware Knowledge Distillation for Semi-Supervised Learning of an On-Board Multi-Task Dense Prediction Model for Collision Avoidance System

Gyutae Hwang, Sang Jun Lee

aDivision of Electronics and Information Engineering, Jeonbuk National University, 567 Baekje-daero, Deokjin-gu, Jeonju, 54896, Republic of Korea, supervised learning. Specifically, we generate pseudo labels that mitigate teacher bias by leveraging, curs substantial labeling costs [5]., objects, resulting in a labor-intensive and time-consuming, labeling process. Semi-supervised learning (SSL) is a prac-, tical training approach that uses both labeled and unlabeled, and self-training, among which pseudo labeling is the most, widely used. Pseudo labels are usually generated from the, predictions of a prototype model trained on labeled dataset, teacher model are well suited for pseudo label generation, trained on a small labeled dataset often shows limited gen-, omission or incomplete pseudo masks on unlabeled data. To

2026-06-16视觉感知

面向乡村俱乐部等通信不稳、算力受限且标注昂贵的车载避障场景,论文将实例分割与单目深度整合为轻量多任务模型,并提出实例感知半监督蒸馏:用教师的领域先验结合 SAM、Depth Anything 等基础模型生成伪标签以减轻教师偏差。实测中学生模型实例分割超过大教师、深度退化受控,同时 FLOPs 降低 22.68×、参数降低 14.33×,低成本边缘设备达 6.46 FPS。

RGFVR: Reference-Guided Face Video Restoration with Flow Matching Figure 1
2026-06-16cs.CV

RGFVR: Reference-Guided Face Video Restoration with Flow Matching

Cem Eteke, Batuhan Tosun, Eckehard Steinbach

2026-06-16视觉感知生成模型

该文针对重度退化人脸视频中仅靠退化帧易丢失身份、而现有参考引导视频方法又需逐人优化的问题,提出无需主体特定微调的参考图像引导恢复框架。方法将感知与描述性双模态身份表征注入预训练 flow-based 视频生成器,并用两阶段训练增强身份条件。实验显示其在下采样、模糊、噪声和压缩等退化下提升保真度、时序一致性与身份保持,PSNR、LPIPS、DISTS、IDS、FVD等指标优于多数基线。

SP$^3$: Spherical Priors for Plug-and-Play Restoration Figure 1
2026-06-16cs.CV

SP$^3$: Spherical Priors for Plug-and-Play Restoration

Sean Man, Ron Raphaeli, Matan Kleiner, Or Ronai

Technion – Israel Institute of Technology

2026-06-16视觉感知

针对扩散/flow 等零样本图像复原方法推理需反复求梯度、速度较慢的问题,SP3 将 Plug-and-Play 中的去噪先验替换为 Spherical Encoder 的球面潜空间投影,并用 HQS 在流形投影与闭式数据一致性步骤间交替,无需反传即可收敛且具备 anytime 输出。实验显示其感知质量接近主流扩散/flow 方法,同时快约 3–630 倍,但也更偏向感知真实,失真指标和后验采样能力受限。

Towards UAV Image Dehazing: A UAV Atmospheric Scattering Model, Benchmark, and Geometry-Aware Deep Unfolding Network Figure 1
2026-06-16cs.CV

Towards UAV Image Dehazing: A UAV Atmospheric Scattering Model, Benchmark, and Geometry-Aware Deep Unfolding Network

Wenxuan Fang, Jiangwei Weng, Yu Zheng, Junkai Fan, Guangfa Wang, Xiang Chen, Jian Yang, Jun Li

School of Computer Science and Engineering, Nanjing University of Science and Technology, lable paired synthetic data together with 2,285 real UAV haze, UASM-HazeSet, which consists of a controllable syn-

2026-06-16视觉感知数据集/基准

针对无人机高空、大俯仰成像中雾霾呈现上重下轻且真实成对数据难获取的问题,论文提出显式建模飞行高度、视角与垂直消光的 UASM,并据此构建含 2.2 万合成对和 2285 张真实图的基准;GP-DUN 将该物理模型展开为几何感知去雾网络,实验显示在合成与真实无人机雾图上均优于现有方法。

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving Figure 1
2026-06-16cs.CV

GraphBEV++: Multi-Modal Feature Alignment for Autonomous Driving

Ziying Song, Caiyan Jia, Lin Liu, Shaoqing Xu, Lei Yang, Yadan Luo

Beijing Key Laboratory of Traffic Data Mining and Em-, bodied Intelligence, School of Computer Science and Tech-, University, School of Artificial Intelligence (School of Software), Yan-, shan University. 3University of Macau, Nanyang Technological University, The University of Queensland

2026-06-16视觉感知

论文聚焦自动驾驶 BEV 多模态融合中常被忽略的相机-LiDAR 标定误差导致的特征错位问题。GraphBEV++用 LocalAlign-v2 通过邻域深度/图匹配修正局部错位,并用 GlobalAlign-v2 的可变形偏移或扩散去噪处理 LSS 与 Query BEV 的全局错位。实验显示其在 nuScenes、Waymo 噪声设置、Argoverse2 远距检测、3D 占据及端到端驾驶评测中提升鲁棒性和精度。

What Should a Streaming Video Model Remember? Figure 1
2026-06-16cs.CV

What Should a Streaming Video Model Remember?

Haonan Ge, Yiwei Wang, Hang Wu, Yujun Cai

University of California, Santa Barbara, University of California, Merced, The University of Queensland

2026-06-16视觉感知

论文关注流式视频模型在固定记忆与计算预算下如何避免“记得太多反而干扰当前感知”。作者将问题表述为在线潜在证据分配,提出 SelectStream:用惊讶度自适应写入、优先级合并和查询条件图推理,在冻结 VLM 中注入少量校准潜在证据而非回放历史帧。实验在 StreamingBench 达 82.67%、OVO-Bench 达 67.03%,离线视频平均 74.4%,优于近期窗口和既有记忆方法。

When the Past Matters: FlashBack Memory for Precipitation Nowcasting Figure 1
2026-06-16cs.CV

When the Past Matters: FlashBack Memory for Precipitation Nowcasting

Yuhao Du, Boxiao Huang, Chengrong Wu, Jiankai Zhang

2026-06-16视觉感知

针对高分辨率降水临近预报中 RNN 模型易遗忘、长时依赖不足并导致漏报和虚警的问题,论文提出 FlashBack Memory:按当前状态动态检索相关历史隐状态,经轻量动态路由聚合,并用自适应门与当前表示融合。该模块可插入 PredRNN 系列、MIM、MotionRNN 等,在 CIKM2017、Shanghai2020、SEVIR 上改善 MSE、MAE、SSIM、CSI,长序列和强降水场景收益更明显。

Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT Figure 1
2026-06-16cs.CV

Chronological Blindness: Benchmarking Temporal Reasoning in Vision-Language Models with CHRONOSIGHT

Parthaw Goswami, Jaynto Goswami Deep

2026-06-16视觉语言视觉感知数据集/基准

论文针对现有 VLM 评测很少衡量静态图像中的“何时”理解,提出 ChronoSight 基准,将时间推理拆成排序、阶段定位、时间间隔估计、反向检测和异常项识别五类任务,覆盖 8 类过程共 1000 项。实验显示开源 VLM 与人类差距显著:人类均分约 0.89,最佳 Qwen2.5-VL-7B 仅 0.40;同时发现结构化输出失败会掩盖能力,少量 LoRA 微调可把 ChronoDelta 从近零提升到 0.43,并迁移到相关任务。

Differentiable Packing of Irregular 3D Objects with Adaptive Container Estimation Figure 1
2026-06-16cs.CV

Differentiable Packing of Irregular 3D Objects with Adaptive Container Estimation

Palak Gupta, Shanmuganathan Raman

Indian Institute of Technology Gandhinagar, India

2026-06-16三维

针对不规则三维物体装箱中容器常被预设、或只优化单一尺寸且依赖复杂物理/FFT管线的问题,论文提出纯 PyTorch 的可微框架,在同一梯度循环中联合优化物体 6N 位姿与三维容器尺寸,并用六类物理启发损失和自适应收缩机制压紧空间。实验显示其张量化 pairwise 计算带来 3.4–54 倍加速,100 个物体约 3–4 分钟完成,容器体积较 DBLF、模拟退火等基线小 11%–32%。

Attention-Based Prototype Calibration for Multi-Rater Few-Shot Medical Image Segmentation Figure 1
2026-06-16cs.CV

Attention-Based Prototype Calibration for Multi-Rater Few-Shot Medical Image Segmentation

Truong Vu, Minh Khoi Ho, Yutong Xie

2026-06-16视觉感知

本文针对少样本医学分割默认单一真值、难以处理多专家标注差异的问题,提出少样本多标注者分割设定,并在原型空间中用注意力校准建模各标注者相对共识原型的系统偏移,配合校准损失、伪风格生成和两阶段训练,无需改动骨干即可接入现有原型方法。CURVAS 与 QUBIQ 实验显示其按标注者 Dice 稳定优于少样本和多标注者基线,但胰腺场景仍落后部分超体素方法。

HAFMat: Hybrid Priors Guided Adaptive Fusion for Single-Image Human Material Estimation Figure 1
2026-06-16cs.CV

HAFMat: Hybrid Priors Guided Adaptive Fusion for Single-Image Human Material Estimation

Yu Jiang, Jiahao Xia, Jiongming Qin, Jianchi Sun, Chunxia Xiao

School of Computer Science, Wuhan University, Wuhan, Jiahao Xia. Faculty of Engineering and IT, University of, lenging because the visual evidence available in a single, graphics and centers on two core tasks: PBR mate-

2026-06-16视觉感知

单张人体图像中光照、几何与反射强耦合,PBR材质估计易产生歧义。HAFMat的核心洞察是不同先验并非同质:SMPL几何、DensePose、RGB表观及HM/AFHR材质预测分别偏向纹理约束或语义结构,因此用多层自适应特征融合在解码不同阶段引入这些引导。实验称其在OpenHumanBRDF和真实数据上优于既有方法,并带来更真实的重光照结果。

Training-free sparse attention based on cumulative energy filtering Figure 1
2026-06-16cs.CV

Training-free sparse attention based on cumulative energy filtering

Chunlu Li, Yixuan Pan, Bai Du, Zhenyuan Chen, Yanzhao Li, Hui Dong, Hui Wang, Zhiqiang Zou

2026-06-16视觉感知

面向视频生成 DiT 中注意力随序列长度二次增长的推理瓶颈,论文将稀疏注意力的 token 过滤表述为“高稀疏、低精度损失”的双目标问题,指出固定 Top-K/Top-P 或固定阈值难以兼顾两者。其核心是利用 Flash Attention 循环中的累计能量动态设阈,无需额外 mask 计算;在 Wan 2.2 上相较 BLASST 将稀疏率由 61.42% 提升到约 82%,VBench 下降小于 5%,计算效率提升约 1.61 倍。

Explainable Flood Segmentation on Sentinel-1 SAR Imagery: A Comparative Study of CNN and Transformer Architectures Figure 1
2026-06-16cs.CV

Explainable Flood Segmentation on Sentinel-1 SAR Imagery: A Comparative Study of CNN and Transformer Architectures

Arundhuti Banerjee, David Daou

United Nations University’s Institute for Environment and Human Security (UNU-EHS)

2026-06-16视觉感知

针对SAR洪水监测中临时淹没区与永久水体易混淆、且模型黑箱难以用于应急决策的问题,本文将Sentinel-1洪水分割设为三类任务,并在场景级划分下比较U-Net、DeepLabV3等CNN与SegFormer系列,同时加入可解释性和不确定性评估。结果显示SegFormer-b2在ETCI各测试场景的洪水IoU均优于U-Net,但在Sen1Floods11微调后优势缩小;其解释更忠实、激活更连贯,而U-Net边界不确定性和校准略好。

DDTNet: Degradation Disentanglement and Transfer Network for Test-Time All-in-One De-weathering Adaptation Figure 1
2026-06-16cs.CV

DDTNet: Degradation Disentanglement and Transfer Network for Test-Time All-in-One De-weathering Adaptation

Kuan-Hung Lin, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

2026-06-16视觉感知

针对统一去雨、去雾、去雪模型在多任务折中和训练/测试域差下表现下降的问题,DDTNet将重点从直接恢复干净内容转向更易建模的退化模式:用双分支编码器和DDM/DCA两阶段注意力从目标域恶劣天气图像中解耦退化,并迁移到源域干净图像上生成成对自适应数据,用于测试时微调任意all-in-one复原模型。实验显示其在真实去雨、去雪、去雾基准上能稳定提升现有模型表现。

VisualClaw: A Real-Time, Personalized Agent for the Physical World Figure 1
2026-06-16cs.CV

VisualClaw: A Real-Time, Personalized Agent for the Physical World

Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao, Cihang Xie

2026-06-16强化学习

VisualClaw针对实时视频代理在边缘部署中帧上传成本高、技能库提示膨胀且部署后难以个性化的问题,提出级联帧筛选与冷热技能注入,并用失败记忆离线演化技能库。在4个视频问答基准上平均API成本较全帧上传降约98%、多数设置准确率提升;其VisualClawArena也显示工具型代理宏准确率提升约2.9–3.2个百分点。

Sex-based Network-Specific Differences in Connectomes: A Krakencoder-Based Analysis Figure 1
2026-06-16cs.CV

Sex-based Network-Specific Differences in Connectomes: A Krakencoder-Based Analysis

Vibhashree S H, Debanjali Bhattacharya, Vamshi Krishna Kancharla, Neelam Sinha

Centre for Brain Research, Indian Institute of Science, Bengaluru 560012, India, Dept. of Artificial Intelligence, Amrita School of Artificial Intelligence, Amrita Vishwa Vidyapeetham, Bengaluru 560035, India

2026-06-16视觉感知

该文关注结构/功能脑连接组中某一网络缺失会如何影响跨模态预测,以及这种扰动是否保留性别信息。作者用 Krakencoder 做 Yeo-7 网络逐一置零消融,并以谱 KL、Frobenius 范数和 Wasserstein 距离评估扰动。结果显示默认模式网络对 SC↔FC 映射影响最大、躯体运动网络最小;扰动特征的性别分类最高仅 66.09%,而完整预测连接组可达 84.76%,说明性别判别信息主要仍在完整连接模式中。

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos Figure 1
2026-06-16cs.CV

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

2026-06-16视觉感知强化学习三维

面向自动驾驶长尾危险场景,论文关注可编辑3DGS仿真虽可控但渲染伪影、光照不一致和时序闪烁导致Sim-to-Real落差的问题。RealityBridge以视频级多模态条件、前景/边缘/语义约束和GateNet自适应分配控制,并结合定向数据、长视频自回归训练与奖励后训练,在内部和公开数据上较现有修复/生成方法提升伪影去除、资产光照融合和长序列一致性。

GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving Figure 1
2026-06-16cs.CV

GraphWorld: Long-Horizon Planning with World Models for End-to-End Autonomous Driving

Ziying Song, Caiyan Jia, Lin Liu, Lei Yang, Shengkai Zhang, Feiyang Jia, Fengda Zhao, Peiliang Wu, Shaoqing Xu, Chen Lv, Yadan Luo

Lei Yang and Chen Lv are with School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore., Fengda Zhao and Peiliang Wu are with the School of Artificial Intelligence (School of Software), Yanshan University, Qinhuangdao, China., Shaoqing Xu is with University of Macau, China., Yadan Luo is with The University of Queensland, Australia.

2026-06-16强化学习规划控制

这篇论文针对端到端自动驾驶多偏短视规划、难以建模长时交互的问题,提出 GraphWorld:不生成像素级未来场景,而用自车中心交互图筛选关键邻车,并学习潜在世界状态来重加权多模态轨迹查询。实验覆盖 Bench2Drive、NAVSIM 和 nuScenes,显示其在长时规划中降低碰撞率、提升安全性;文中还报告 nuScenes 6 秒任务较 World4Drive 平均碰撞率降 19.5%,NAVSIMv1 较 DiffusionDrive 快 13.3%。

Contrastive Learning for Seismic Horizon Tracking with Domain-Specific Priors Figure 1
2026-06-16cs.CV

Contrastive Learning for Seismic Horizon Tracking with Domain-Specific Priors

Alexandre Thouvenot, Lionel Boillot, Vincent Gripon

Alexandre Thouvenot and Vincent Gripon are with IMT Atlantique, LAB-STICC

2026-06-16视觉感知

针对无监督三维地震层位追踪中“信号传播精确但遇断层易失效、深度纹理模型鲁棒但依赖标注且精度下降”的矛盾,论文用反射层斜率估计的可靠道间对应作为领域先验,构造高置信正样本与道内负样本训练对比式体素嵌入,并通过相似性搜索跨不连续区域传播层位。在 F3 与含断层合成数据上,该方法较无监督基线降低 MAE,并接近使用单张标注切片的半监督方法。

Wavelength-Multiplexed 2D Beam Steering via a Passive Diffractive Network Figure 1
2026-06-16cs.CV

Wavelength-Multiplexed 2D Beam Steering via a Passive Diffractive Network

Che-Yung Shen, Yuhang Li, Cagatay Isil, Tianyi Gan, Mona Jarrahi, Aydogan Ozcan

Electrical and Computer Engineering Department, University of California, Los Angeles, CA, 90095, USA, Bioengineering Department, University of California, Los Angeles, CA, 90095, USA, California NanoSystems Institute (CNSI), University of California, Los Angeles, CA, 90095, USA, addressable diffractive architecture establishes a compact and scalable paradigm for high-speed

2026-06-16视觉感知

针对机械扫描、液晶/相控阵光束 steering 在速度、体积和主动控制上的限制,以及传统光栅只能一维色散路由的问题,本文用深度学习反向设计多层被动衍射网络,把波长作为寻址变量实现任意二维出射角映射。数值上在400–750 nm的625个通道实现25×25光束位置,平均PSNR约33.3 dB、定位误差约0.18λ,并在太赫兹与可见光实验中验证了波长复用转向。

KeepLoRA++: Continual Learning with Layer-Scaled Residual Gradient Adaptation Figure 1
2026-06-16cs.CV

KeepLoRA++: Continual Learning with Layer-Scaled Residual Gradient Adaptation

Mao-Lin Luo, Yi-Lin Zhang, Zi-Hao Zhou, Yankun Hong, Xialiang Tong, Mingxuan Yuan, Tong Wei, Min-Ling Zhang

are with the School of Computer Science and Engineering, Southeast Univer-, sity, Nanjing 210096, China, and the Key Laboratory of Computer Network, and Information Integration, Southeast University, Ministry of Education, Noah’s Ark Lab., frequent unavailability of proprietary training corpora [10]–

2026-06-16优化算法

针对预训练视觉语言模型持续学习中“学新任务、保旧任务、保零样本迁移”难以兼顾的问题,KeepLoRA++指出通用知识更多位于浅层和参数主子空间,任务特化知识位于深层和残差子空间;据此将LoRA梯度投影到避开预训练主子空间与旧任务方向的残差空间,并采用浅层小、深层大的缩放。实验覆盖图像分类、VQA和视频理解,报告相较O-LoRA、InfLoRA、SD-LoRA等基线更稳健。

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer Figure 1
2026-06-16cs.CV

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

Nanjing University, University of Hong Kong

2026-06-16视觉语言生成模型

针对统一多模态模型中理解与生成目标冲突、视觉空间割裂和训练数据二元性利用不足的问题,UniDDT以Noisy ViT和LLM共享语义编码,在统一潜空间中连接理解与生成,并用独立扩散解码器解耦图像生成;同时从同一图文对构造双向数据。实验显示其在生成侧达到GenEval 0.87、DPG 86.9,在理解侧达到MME 1699.5、SEEDbench 76.5。

Learned Image Compression for Vision-Language-Action Models Figure 1
2026-06-16cs.CV

Learned Image Compression for Vision-Language-Action Models

Hyeonjun Kim, Jegwang Ryu, Sangbeom Ha, Junhyeok Lee, Jun-Hyuk Kim, Hyemin Ahn, Jaeho Lee

Soongsil University, Chung-Ang University

2026-06-16视觉语言视觉感知

面向边缘机器人将多相机视觉流传到远端 VLA 推理时的带宽与时延瓶颈,论文提出 SPARC:不再按图像保真度均匀压缩,而是在神经编码器潜空间中用时序掩码选择器按相机与空间区域的任务相关性分配码率,并用 tilted rate loss 避免压掉罕见但关键细节。在 RoboCasa365、VLABench、LIBERO 及远程真机实验中,相同码率下控制成功率优于 JPEG/H.265 和学习式压缩,且降低端到端延迟。

Structure-Semantic Co-optimized Latent Diffusion Model for Fast Visual Anagram Synthesis Figure 1
2026-06-16cs.CV

Structure-Semantic Co-optimized Latent Diffusion Model for Fast Visual Anagram Synthesis

Xiang Gao, Yunpeng Jia

School of Digital Media and Design Arts, Beijing University of Posts and Telecommunications

2026-06-16生成模型

针对视觉变形图生成中像素扩散方法慢、分辨率受限且语义易混的问题,论文将多视角并行去噪迁移到 SDXL-Turbo 潜空间,并提出 S2CO:用空文本结构对齐约束低频结构一致性,以语义增强和注意力引导噪声融合缓解语义稀释。实验称其在视觉和定量指标上优于相关方法,并显著加快推理。

Propagating Structural Guidance: Synthesizing Fluorescein Angiography from Fundus Images and Sparse OCT Scans Figure 1
2026-06-16cs.CV

Propagating Structural Guidance: Synthesizing Fluorescein Angiography from Fundus Images and Sparse OCT Scans

Tengfei Ma, Ruiqi Wu, Chenran Zhang, Ye Geng, Na Su, Xiangyuan Duanmu, Tao Zhou, Yi Zhou, Wen Fan

School of Computer Science and Engineering, Southeast University, China1, Key Laboratory of New Generation Artificial Intelligence Technology and, Tianyuan Honors School, Nanjing Medical University, China3, Nanjing University of Science and Technology, Nanjing, China4, Department of Ophthalmology, The First Affiliated Hospital of, Nanjing Medical University, Nanjing, China5, invasive decision-support tool in routine workflows. The code is available, narios, only CFP-like views and OCT are typically available, as FFA is inva-

2026-06-16视觉感知

针对FFA需注射造影剂、而仅由CFP合成又缺乏血管渗漏和深层结构线索的问题,本文引入稀疏OCT作为非侵入式结构指导,构建3676眼CFP-FFA-OCT配准数据集,并用SACMF将OCT深度特征投影到眼底平面、以TCMA约束CFP与FFA局部表征对齐。实验显示其合成FFA较现有方法更逼真,并在下游疾病诊断中带来更大性能提升。

LUCID: Learned Undersampling-Adaptive Consistency-Guided Inference with Deterministic Flow Matching for Sparse-View CT Reconstruction Figure 1
2026-06-16cs.CV

LUCID: Learned Undersampling-Adaptive Consistency-Guided Inference with Deterministic Flow Matching for Sparse-View CT Reconstruction

Jigang Duan, Jiayi Wang, Heran Wang, Ping Yang, Genwei Ma, Xing Zhao

School, University, Genwei Ma is with the National Center for Applied Mathematics Beijing, Capital Normal University and Academy for multidisciplinary studies, Capital, trajectory provides a controllable inference process, making it

2026-06-16生成模型三维

针对稀疏视角 CT 中角度欠采样导致的伪影、细节丢失,以及监督模型难跨采样设置、生成模型易幻觉的问题,LUCID 用仅由高质量 CT 训练的确定性 Flow Matching 作为统一先验,在推理时按稀疏度融合 FBP 与噪声初始化、调节更新步长,并逐步加入投影域数据一致性。多种视角数实验显示其在定量指标、结构保真和局部细节上优于多类基线,并降低扩散式重建的幻觉风险。

DynFS-MoE: Dynamic Functional-Structural Mixture-of-Experts for Post-Traumatic Epilepsy Diagnosis Figure 1
2026-06-16cs.CV

DynFS-MoE: Dynamic Functional-Structural Mixture-of-Experts for Post-Traumatic Epilepsy Diagnosis

Jun-En Ding, Spencer Chen, Henry Noren, Daniel Valdivia, Christine Yohn, Suhina Patel, Taylor Zink, Hai Sun, Feng Liu

Department of Systems Engineering, Stevens Institute of Technology, Hoboken, NJ, Department of Neurosurgery, Robert Wood Johnson Medical School, Rutgers, University, New Brunswick, NJ, USA

2026-06-16视觉感知

针对创伤性脑损伤后癫痫早期识别中结构损伤与功能连接异常难以联合建模的问题,DynFS-MoE将fMRI时间片段与sMRI连接特征统一为多模态patch,并通过时间感知功能-结构编码、模态/跨模态专家及类别条件路由动态选择诊断相关信息。三项二分类实验显示其优于静态融合基线,并能揭示有意义的ROI交互,但具体数据规模与增益来源仍需结合全文进一步核验。

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video Figure 1
2026-06-16cs.CV

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang

2026-06-16视觉感知

面向机器人操作中难以从真实交互获得可控仿真的布料、弹性体等可变形物体,EgoPhys尝试仅用单段第一视角RGB人类操作视频构建物理数字孪生。其核心是先重建时序4D点云并拟合粗弹簧质点模型,再把逐物体反演得到的密集刚度场蒸馏为状态条件材料码本,以便对新物体免去测试时逐弹簧优化。实验显示其在重建、未来预测和零样本泛化上优于基线,并在xArm6上验证可辅助可变形物体规划。

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction Figure 1
2026-06-16cs.CV

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

Shanghai Jiao Tong University, China, Hangzhou Dianzi University, China, The 52nd Research Institute of China Electronics Technology Group Corporation, Hangzhou Bywin Technology Co., Ltd., China, Zhejiang Dahua Technology Co., Ltd., China, School of Information Science and Engineering, Shandong University, China, Haihe Laboratory of Information Technology Application Innovation, China

2026-06-16视觉感知

这篇论文针对视频广告中“观众情绪”并非画面人物表情可直接读出、稀疏帧 MLLM 又容易漏掉关键叙事事件的问题,提出 GRACE:先抽取时序 SVO 动作三元组和可见文字,再将主客体 grounding 为局部视觉裁剪,与原始帧一起作为结构化证据提示模型推理。Pitts 上相对 Qwen2.5-VL/Qwen3-VL 稳定提升,消融、AdsQA 跨数据集和 TVQA 情绪子集迁移实验也支持动作结构与视觉 grounding 的互补作用。

When Confidence Lacks Concepts: Interpretable OOD Detection via Representation Perturbations Figure 1
2026-06-16cs.LG

When Confidence Lacks Concepts: Interpretable OOD Detection via Representation Perturbations

Anju Chhetri, Pratik Shrestha, Ramesh Rana, Prashnna Gyawali, Binod Bhattarai

NepAl Applied Mathematics and Informatics Institute for research, Nepal, West Virginia University, USA, Kathmandu University, Nepal, University College London, UK, University of Aberdeen, UK

2026-06-16视觉感知

针对医疗视觉模型在分布偏移下过度自信且现有 OOD 分数语义不透明的问题,论文提出 CAPS:用稀疏自编码器从 ViT 中间表示中提取类别概念向量,并沿预测类别概念方向扰动表示,以 logits 稳定性作为 OOD 信号。实验覆盖内镜、病理和眼科影像,显示跨模态有效,且临床专家验证部分 SAE 潜变量对应有意义视觉模式;低数据场景下概念方向可靠性仍受限。

Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs Figure 1
2026-06-16cs.CV

Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs

Yusong Zhao, Hengyi Wang, Tanuja Ganu, Akshay Nambi, Hao Wang

difficult to interpret. Sparse Autoencoders (SAEs) provide a scalable way to de-, To address these challenges, Sparse Autoencoders (SAEs) [12] have emerged as a scalable, unsu-, Rutgers University.

2026-06-16视觉语言

针对多模态大模型内部视觉表征难解释、现有 SAE 多停留在扁平特征或受嵌套前缀/堆叠瓶颈限制的问题,本文提出级联稀疏自编码器 CSAE:先用一级 SAE 学低层视觉概念,再直接以其解码权重作为二级 SAE 输入,学习“概念的概念”。在 Qwen3-VL、Gemma-3、LLaVA 及多数据集上,CSAE 提升层级概念一致性,并支持有效的概念组级输出干预。

teasr: training-efficient any-step diffusion transformer for real-world image super-resolution Figure 1
2026-06-16cs.CV

teasr: training-efficient any-step diffusion transformer for real-world image super-resolution

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

2026-06-16视觉感知生成模型强化学习

针对真实图像超分中扩散模型采样慢、一步蒸馏训练开销大且无法按需求调节速度/质量的问题,TEASR在单一扩散模型内做自对抗蒸馏,并用时间感知校正稳定不同噪声水平的一步生成;同时提出双分支DiT与解耦时间步条件,区分当前噪声状态和去噪目标。实验称其可在无需额外训练下支持1到多步采样,在多个数据集优于现有方法,并可将20B模型蒸馏压到单A100训练。

Learned JPEG Compression for DNN Vision Figure 1
2026-06-16cs.CV

Learned JPEG Compression for DNN Vision

Kaixiang Zheng, Ahmed H. Salamah, Siyu Chen, En-Hui Yang

Department of Electrical and Computer Engineering, University of Waterloo

2026-06-16视觉感知

这篇论文针对“JPEG仍按人眼优化、却越来越多被DNN消费”的错配问题,提出J4D框架:用概率量化构造可微JPEG软量化器,并用DCT系数量化熵解析估计码率,从而端到端学习量化表和α参数,在实际编码时仍接近标准JPEG复杂度。实验覆盖分类与分割、多数据集和多架构,相比默认JPEG最高同码率提升11.60%准确率,或同准确率降码率80.05%,还展示了跨模型通用参数的可行性。

Closed-Loop Triplet Synergistic Generation for Long-Form Video Figure 1
2026-06-16cs.CV

Closed-Loop Triplet Synergistic Generation for Long-Form Video

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

University of Science and Technology of China

2026-06-16视觉感知

针对多镜头长视频生成中角色身份漂移、道具/场景状态误差跨镜头累积的问题,论文提出 CoTriSyGen,将故事板生成从一次性前馈流程改为“文本意图—实体记忆—已生成视觉”的闭环协同。其 VLM Analyzer 在镜头内检测语义/构图偏差并触发重生成、修正运动提示,在镜头间把新出现或变化的实体写入动态记忆并改写后续提示。作者在自建 StoryBench 上报告跨镜头一致性、提示遵循和电影连续性均优于代表性方法。

To forget is to preserve: Machine Unlearning for 3D medical image segmentation Figure 1
2026-06-16cs.CV

To forget is to preserve: Machine Unlearning for 3D medical image segmentation

Nitesh Kumar Singh, Akhilesh Singh, Arjun Arora

School of Computer Science, UPES, University of Tomorrow, horizons 20 and 50 epochs. The results show that the Noisy Label, Institute For Advanced Research-10 (CIFAR-10), ImageNet, prediction as opposed to a single class label. Hence the

2026-06-16视觉感知三维

面向GDPR等“被遗忘权”在医疗影像模型中的落地,论文研究如何从3D分割网络中删除特定患者影响而不完全重训。其核心是把机器遗忘从2D分类扩展到MRBrainS18的主体级3D脑分割,基于Med3D预训练3D ResNet-50比较多种近似遗忘策略,并用保留/遗忘集合的Dice与MAE评估权衡。结果显示Noisy Label在50轮后使遗忘集性能下降93%、仍保持保留集约84%精度;其他策略虽遗忘更强但常导致保留性能灾难性退化。

Fi-Gaussian: Frequency-Aware Implicit Gaussian Splatting for Single Image Dehazing Figure 1
2026-06-16cs.CV

Fi-Gaussian: Frequency-Aware Implicit Gaussian Splatting for Single Image Dehazing

Yuhan Chen, Ying Fang, Guofa Li, Wenxuan Yu, Yicui Shi, Kunyang Huang, Wenbo Chu, Keqiang Li

are with the College of Mechanical and Vehicle Engineering, Chongqing, Kunyang Huang is with the Department of Electrical and Computer, Engineering, Carnegie Mellon University, Moffett Field, CA 94035, USA (e-, Wenbo Chu is with the National Innovation Center of Intelligent and, Keqiang Li is with the School of Vehicle and Mobility, Tsinghua University, and geometric cues are unavailable. As a result, the potential

2026-06-16视觉感知三维

针对单幅图像去雾中高频纹理易丢失、散射物理参数难以连续建模的问题,Fi-Gaussian将Gaussian splatting改写为2D特征空间的隐式连续表示,并在频域分离结构与纹理,用复值权重自适应聚合;同时引入物理驱动散射重归一化估计透射图和大气光。文中在多个基准上报告达到SOTA指标和更好的视觉细节、色彩保持效果。

Dehaze-GaussianImage: Zero-Shot Dehazing via Efficient 2D Gaussian Splatting Representation Figure 1
2026-06-16cs.CV

Dehaze-GaussianImage: Zero-Shot Dehazing via Efficient 2D Gaussian Splatting Representation

Yuhan Chen, Wenxuan Yu, Guofa Li, Kunyang Huang, Ying Fang, Yicui Shi, Wenbo Chu, Keqiang Li

are with the College of Mechanical and Vehicle Engineering, Chongqing, Kunyang Huang is with the Department of Electrical and Computer, Engineering, Carnegie Mellon University, Moffett Field, CA 94035, USA (e-, Wenbo Chu is with the National Innovation Center of Intelligent and, Keqiang Li is with the School of Vehicle and Mobility, Tsinghua University

2026-06-16视觉感知三维

针对单图去雾中像素级 CNN/Transformer 计算冗余、隐式映射物理可解释性弱的问题,本文将 2D Gaussian Splatting 引入去雾,把雾图表示为可演化的各向异性高斯场,并在高斯参数空间嵌入大气散射模型,通过重建-解耦优化、自适应分裂/克隆/裁剪和结构保持约束分离透射介质与清晰纹理。实验称其在完全无监督零样本设置下以少量参数达到 SOTA,但具体增益来源仍需结合完整实验细节判断。

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification Figure 1
2026-06-16cs.CV

Multimodal LLM-Empowered Re-Ranking for Generalizable Person Re-Identification

Jiachen Li, Xiaojin Gong

College of Information Science and Electronic Engineering, Zhejiang University

2026-06-16视觉语言

针对域泛化行人重识别中,传统重排序依赖源域编码器特征、在未知域邻域关系不可靠的问题,论文把多模态大模型引入推理阶段:用域无关提示和难样本 query-candidate 挖掘对 MLLM 做监督微调,再将其判别得到的距离与欧氏距离融合为 µ-distance,接入现有重排序方法。多组 DG Re-ID 基准显示该后处理能稳定提升重排序效果,但也带来额外推理开销。

Continuous Splatting meets Retinex: Continuous Gaussian Splatting and Implicit Reflectance Modeling for Low-Light Image Enhancement Figure 1
2026-06-16cs.CV

Continuous Splatting meets Retinex: Continuous Gaussian Splatting and Implicit Reflectance Modeling for Low-Light Image Enhancement

Yuhan Chen, Yicui Shi, Guofa Li, Wenxuan Yu, Ying Fang, Guangrui Bai, Wenbo Chu, Keqiang Li

2026-06-16视觉感知三维

针对低照增强中全局照明平滑与局部纹理恢复难兼顾、易出现偏色和结构伪影的问题,论文提出 CGS-Retinex,将连续 Gaussian Splatting 用于显式建模照明场,并用带浅层高频特征引导的隐式表示建模反射率,在 Retinex 约束下解耦曝光与纹理。实验显示其可减少暗区噪声、过曝和网格伪影,同时提升高频结构与颜色恢复;但具体增益相对各模块的来源仍需看消融细节。

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding Figure 1
2026-06-16cs.CV

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

Yifan Wang, Peiming Li, Shiyu Li, Zhiyuan Hu, Xiaochen Yang, Wenming Yang, Yang Tang, Zheng Wei

2026-06-16视觉语言

针对训练-free视觉定位方法对所有样本都缩放、裁剪而造成算力浪费并可能破坏全局上下文的问题,论文提出 LazyMCoT:先用单次前向中首个答案 token 的置信统计和保形校准判断样本难度,简单样本直接回答,困难样本再结合 VLM 跨模态注意力与外部视觉专家做两阶段协同定位。实验称其在多基准和开源 VLM 上优于现有训练-free方法,接近或超过部分训练式方法,同时降低平均推理延迟。

A Comprehensive Survey of Medical Image Segmentation: Challenges, Benchmarks, and Beyond Figure 1
2026-06-16cs.CV

A Comprehensive Survey of Medical Image Segmentation: Challenges, Benchmarks, and Beyond

Pengyu Zhu, Xiaojing Zhang, Kunbo Zhang, Chunyan Zhang, Zhenyu Wang

aSchool of Control and Computer Engineering, North China Electric Power University, Beijing, 102206, China, bSPIC Digital Technology Co., Ltd, Beijing, 102209, China, cInstitute of Automation, Chinese Academy of Sciences, Beijing, 100190, China, dDepartment 6 of Health Care, Second Medical Center, People’s Liberation Army General Hospital, Beijing, 100037, China, publicly available in our GitHub repository Awsome_MedSeg., level labels which define anatomical or pathological regions, Zhang et al.[61] center their discussion around the recently

2026-06-16视觉感知数据集/基准

面向医学图像分割在诊断、治疗规划和随访中的落地需求,本文梳理了数据、模型、评价与临床部署之间的断点。其核心洞察是将 U-Net、Transformer 与 SAM 系方法放在统一框架下比较,指出领域适应、标注质量和评价指标比单纯架构更制约泛化。主要结果是整理主流数据集与指标,归纳当前模型已接近实时和专家级表现,但跨机构、稀有病灶及临床验证仍不足。

Shift-and-Sum Quantization for Visual Autoregressive Models Figure 1
2026-06-16cs.CV

Shift-and-Sum Quantization for Visual Autoregressive Models

Jaehyeon Moon, Bumsub Ham

Yonsei University, tablishing a new state of the art in PTQ for VAR. Project page is available at:, available samples in PTQ. This mismatch biases the quantization parameters toward an inaccurate

2026-06-16视觉感知

这篇论文关注视觉自回归模型在实际部署中的后训练量化难题:VAR 多尺度生成虽高效但 Transformer 计算开销大,而常规 PTQ 会在粗尺度注意力-Value 乘积处放大量化误差,并受少量校准样本导致的码本采样偏差影响。作者提出 shift-and-sum 对高注意力 value 做对称平移复制并聚合量化结果,同时重采样校准 token 以匹配预测概率。实验在 ImageNet 条件生成、修复、外扩和编辑中较基线稳定提升,4/6-bit 下取得新的 VAR PTQ 最优结果。

Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos Figure 1
2026-06-16cs.CV

Training-Free Open-Vocabulary Visual Grounding for Remote Sensing Images and Videos

Ke Li, Di Wang, Yongshan Zhu, Ting Wang, Weiping Ni, Tao Lei, Quan Wang, Xinbo Gao

2026-06-16视觉语言视觉感知

针对遥感图像/视频视觉指代表达依赖昂贵标注、难覆盖开放词汇目标的问题,论文提出免训练的 RSVG-ZeroOV:不让通用 VLM 直接回归坐标,而是抽取其跨注意力作语义概览,再用扩散模型自注意力补全结构,并通过注意力演化去除噪声;视频版加入查询相关关键帧选择与 SAM3 时序传播。六个图像和视频基准上,该方法优于现有零样本基线,并达到或超过部分弱/全监督方法。

EdgeZSAD: Practical Zero-Shot Anomaly Detection on Edge Devices Figure 1
2026-06-16cs.CV

EdgeZSAD: Practical Zero-Shot Anomaly Detection on Edge Devices

Taewan Cho, Andrew Jaeyong Choi

Gachon University, Plaid Labs Inc., geneous, and rarely available before deployment. Recent, Our study centers on EdgeZSAD, a compact deployed

2026-06-16视觉感知

面向工业零样本异常检测在边缘设备上难以承载 ViT-L/CLIP 等大模型的问题,论文提出 EdgeZSAD:以 TinyViT-21M-512 为骨干,结合全局排序与稀疏局部校正的 EdgeGLR,并用 Real-IAD-DR 改造源域训练难度而不增加部署图。三次运行在 MVTec-AD、VisA 图像 AUROC 达 91.6、88.2,可导出到 Jetson Orin Nano Super 与 RB5 Gen2,设备重评分漂移低于 0.2;但像素级定位仍明显落后强基线,部分增益可能主要来自数据配方。

Variable-Rate Deep Image Compression based on Low-Rank Adaptation by Progressive Learning Figure 1
2026-06-16eess.IV

Variable-Rate Deep Image Compression based on Low-Rank Adaptation by Progressive Learning

Xing-Yu Xu, Chen-Hsiu Huang, Ja-Ling Wu

Communications and Multimedia Lab, National Taiwan University

2026-06-16视觉感知

该文针对深度图像压缩中可变码率通常需训练多模型、存储和训练成本高,或单模型带来额外计算与率失真下降的问题,将 LoRA 引入 WACNN/STF 等压缩骨干,设计可合并的 LoRAM 并用渐进学习适配不同码率,推理阶段不增加延迟。实验显示其率失真性能接近独立训练模型,同时约节省 99% 参数存储、90% 数据和 97% 训练步数,下游 ImageNet 分类基本无退化。

SceneCraft: Interactive System for Image Editing via Scene Graph Figure 1
2026-06-16cs.CV

SceneCraft: Interactive System for Image Editing via Scene Graph

Duc-Manh Phan, Ngoc-Dai Tran, Duy-Khang Do, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

University of Science, Vietnam National University, University of Dayton, • Human-centered computing →Interactive systems and

2026-06-16视觉感知

针对多对象复杂场景中纯文本提示难以准确表达空间与关系约束的问题,SceneCraft 将输入图像自动解析为可编辑场景图,结合 Detic、Grounding DINO 与 LLM 构建对象和关系,并把用户的图操作转成结构化提示分发给 FLUX、Qwen、Gemini 等模型。用户研究显示其交互更直观,降低提示工程负担,输出在质量与忠实度上更受偏好。

Effective and Low-cost Lane-based Map Localization for Vehicle-Centric Route Generation Figure 1
2026-06-16cs.MM

Effective and Low-cost Lane-based Map Localization for Vehicle-Centric Route Generation

Hong-Shiang Lin, Jung-Hsin Chen, Yu-Luen Tzeng, Wei-Hao Chen, Yi-Chen Lee, Li-Jhe Chen, Peng-Yuan Chen

National Taipei University, globally available, limiting real-world applicability. There is, coverage and is available through commercial navigation ser-

2026-06-16视觉感知

面向 AR-HUD 等车载导航中“地图路线难以对齐驾驶员视角”的问题,论文提出 OLRA:仅用导航路点、前视相机车道线、GPS 与运动传感器,通过车道-路线对齐损失优化地图位姿,再生成车体坐标路线。NuScenes 上其整体欧氏误差低于 OpenPilot,尤其在交叉口、弯道和 20 米以外预测更稳,但近距离略弱且直道纵向 GPS 偏差修正仍有限。

VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA Figure 1
2026-06-16cs.CV

VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA

Young Rok Jang, Hyesoo Kong, Kyunghwan An, Jae Sub Huh, Gyeonghun Kim, Stanley Jungkyu Choi

2026-06-16视觉语言强化学习

现有多模态文档问答多生成纯文本,难以利用页面中的图表、照片和示意图。VinQA将真实文档QA改造成长答案中交错引用视觉元素的任务,并比较整页框选引用的Page Encoding与解析后裁剪引用的Modality Encoding,配套M-GroSE、Visual Source F1和Visual G-Eval评测。实验显示闭源模型仍领先,但用VinQA微调Qwen2.5-VL显著提升视觉引用与grounding;Modality初始更稳,训练后Page Encoding可接近其表现。

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools Figure 1
2026-06-16cs.CV

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

National University of Singapore, 2OPPO Research Institute, Nanyang Technical University, 4Duke University, City University of Hong Kong, 6The Hong Kong Polytechnic University, Label restructuring

2026-06-16视觉感知

针对现有 VLM 图像质量评价依赖单次全局观察、易漏检局部伪影或受低照度对比度误导的问题,Tool-IQA 将评分改为“观察—工具检查—量化”的流程,引入放大镜与 Gamma 校正器,并用批感知 BATE 奖励约束有效调用工具。在多个 IQA 基准上超过既有方法,CLIVE 上 PLCC 达 0.854。

AME: A Multi-Type Contributor Attribution Framework in Generative AI Markets Figure 1
2026-06-16cs.LG

AME: A Multi-Type Contributor Attribution Framework in Generative AI Markets

Yang Shi, Songwen Pei, Yang Gao, Bingxue Zhang

2026-06-16生成模型

针对生成式 AI 市场中训练数据、基础模型、微调与提示等多类贡献者共同创造价值却难以公平分账的问题,论文提出 AME 框架,将多阶段贡献归因 MMShapley、链上权利映射与低成本可信执行协议串联起来,处理异构贡献、嵌套授权和收益分配。实验称其分配结果更接近人工参考判断,并能在较低执行成本下保持可信性,但具体增益来源仍需更多细节验证。

Stepwise Token Selection for Efficient Multimodal Large Language Models Figure 1
2026-06-16cs.CV

Stepwise Token Selection for Efficient Multimodal Large Language Models

Landi He, Shawn Young, Lijian Xu

Shenzhen University of Advanced Technology

2026-06-16视觉语言

论文针对 MLLM 推理中视觉 token 前缀过长导致的延迟与显存瓶颈,指出现有 top-K 剪枝忽略 token 间冗余且固定压缩率不适配不同图像复杂度。StepPrune 将剪枝改为指针式逐步选择,并用学习到的停止动作自适应决定保留数量,再通过方差保持噪声门实现端到端训练。在 LLaVA-v1.5-7B 和 Qwen2.5-VL-7B 上,66.7%/77.8%/88.9% 剪枝仍保留 97.9%/96.7%/94.6% 原精度,最高带来 1.88× prefill 加速。

PointDiffusion: Diffusion-Based Scene Completion in the Point Cloud Domain Figure 1
2026-06-16cs.CV

PointDiffusion: Diffusion-Based Scene Completion in the Point Cloud Domain

Chidera Agbasiere, Mikhail Sannikov, Faith Ogunwoye, Erik Shaikhiev, Alex Kozinov, Ilya Mikhalchuk, Iana Zhura, Dzmitry Tsetserukou

Laboratory, Institute, labelling, mean-centred and isotropically rescaled to [−1, 1]

2026-06-16生成模型三维

本文面向自动驾驶中由稀疏 LiDAR 补全密集三维场景的问题,指出现有扩散方法受场景级点云压缩不稳、里程计漂移污染监督和多步推理延迟限制。核心做法是用跨注意力的多 token Gaussian VAE 表示场景,并用锚点 ICP 重建更干净的 SemanticKITTI 真值,再采用单步无 scaffold 扩散补全。结果显示真值精炼带来约 16× Chamfer 改善,方法较 LiDiff、ScoreLiDAR 低 10–19% 误差且延迟低 25–143×;但作者也承认主要增益可能主要来自 data 质量而非架构。

Trusting Right Predictions for Wrong Reasons: A LIME Based Analysis of Deep Learning Interpretability in Lung Cancer Diagnosis Figure 1
2026-06-16cs.CV

Trusting Right Predictions for Wrong Reasons: A LIME Based Analysis of Deep Learning Interpretability in Lung Cancer Diagnosis

Samarpan Poudel, Vladislav D Veksler

Caldwell University, School of Business and Computer Science

2026-06-16视觉感知

这篇论文针对肺癌 CT 深度模型“高准确率是否等于可信诊断”的问题,比较 CNN、预训练 ResNet50 与从零训练 ViT,并用 LIME 同时衡量预测一致性和解释一致性。结果显示三者准确率达 93.75%–98.61%、AUC 均约 0.99,预测相关性超过 0.99,但解释相关性低于 0.26;误判样本常关注肺实质外区域,说明模型可能“答对但理由错误”,临床验证不能只看性能指标。

The Third Challenge on Image Denoising at NTIRE 2026: Methods and Results Figure 1
2026-06-16cs.CV

The Third Challenge on Image Denoising at NTIRE 2026: Methods and Results

Lei Sun, Hang Guo, Bin Ren, Shaolin Su, Xian Wang, Danda Pani Paudel, Luc Van Gool, Radu Timofte, Yawei Li

lable Bokeh rendering [53], rip current detection and seg-, exchange and technical collaboration.

2026-06-16视觉感知

面对高噪声图像恢复中细节保真与公平评测不足的问题,本文汇总 NTIRE 2026 σ=50 AWGN 去噪挑战,采用 DIV2K/LSDIR 与以 PSNR 为核心的无约束赛道,比较各类神经网络方案。主要结果是从116个注册队中验证20支决赛队,给出当前无约束去噪的排行榜和方法谱系;具体增益来源文中未充分说明,可能主要来自 scaling / data 与集成策略。

Stringalign: Moving beyond summary statistics with a transparent Unicode-aware tool for evaluating automatic transcription models Figure 1
2026-06-16cs.CV

Stringalign: Moving beyond summary statistics with a transparent Unicode-aware tool for evaluating automatic transcription models

Yngve Mardal Moe, Marie Roald

2026-06-16视觉感知

针对HTR/OCR/ASR评测中CER、WER受归一化、分词和Unicode字符定义影响而难以复现的问题,本文提出轻量Python库Stringalign,将预处理流程显式化,支持Unicode感知分词、通用TER与按token错误分析及可视化。实验以案例对比现有工具,显示其能解释常见错误并避免不透明结果;文中未充分说明对模型性能的直接提升。

Classifying by Proxy: Explainable and Reproducible Ensemble of Proxy Tasks for Child Sexual Abuse Imagery Classification Figure 1
2026-06-16cs.CY

Classifying by Proxy: Explainable and Reproducible Ensemble of Proxy Tasks for Child Sexual Abuse Imagery Classification

Clara Ernesto, Carlos Caetano, Sandra Avila, João Macedo, Camila Laranjeira, Leo S. F. Ribeiro

should not be publicly available. These restrictions mean that stud-, all changes publicly available as a general-purpose Python library, The source code for our modified implementation of EISP is available at, available at github.com/araceli-project/EISPCSAI., ing on publicly available datasets and testing on LEA apprehen-, domains, and the limited personnel available to curate and annotate

2026-06-16视觉感知

针对CSAI取证分类中数据高度敏感、模型难复现且缺乏可解释性的问题,论文将EISP代理任务集成首次用于真实CSAI数据:用姿态、裸露、年龄、感知性别等7类公开可训练子任务提取特征,再以XGBoost融合,并用SHAP和降维可视化解释贡献。在巴西联邦警察RCPD数据集上最佳组合达到91.9% balanced accuracy,且较DINO特征基线更准、更可解释。

Multi-Task Tennis Stroke Biomechanics Analysis Using MediaPipe Pose Figure 1
2026-06-16cs.CV

Multi-Task Tennis Stroke Biomechanics Analysis Using MediaPipe Pose

Jigyashman Hazarika

Department of Artificial Intelligence and Machine Learning, BMS Institute of, without frame-level labels., depth and visibility scores unavailable in prior frameworks. An ablation study demonstrates a, (cross-court, down-the-line, center) and posture quality (good/bad), plus a deterministic, coaching layer requiring no additional labels., Federer, Djokovic, Nadal, Zverev, Sinner, Wawrinka) was sourced from publicly available YouTube, (2) shot direction (cross-court, down-the-line, or center)

2026-06-16三维

针对网球视频分析多停留在球路或粗动作识别、缺少击球生物力学反馈的问题,本文用 MediaPipe 单目3D姿态、关节速度自动分割和多任务 Transformer,同时预测正反手、方向与姿态质量,并加入规则化建议层。在1281个击球上随机划分正反手准确率83.7%、方向61.9%、姿态62.6%;跨球员正反手仍82.9%,但方向基本退化为多数类,姿态标注也受单一标注者限制。

A Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts Figure 1
2026-06-16cs.CV

A Text Recognition Dataset from Sahidic Coptic Ancient Manuscripts

Fabio Quattrini, Carmine Zaccagnino, Costanza Bianchi, Silvia Cascianelli, Rita Cucchiara

2026-06-16视觉感知数据集/基准

本文面向低资源手写文本识别中罕见文字、灭绝语言和古籍退化图像带来的性能下降问题,构建了萨希德科普特古抄本行级数据集 SCAM,包含来自两个档案、采集条件差异明显的 SCAM-A/B 子集,并保留褪墨、透印、材质损伤及特殊变音符等真实难点。作者还比较了多类主流 HTR 方法,结果表明现有模型在该历史低资源场景下仍明显落后于现代高资源文字识别,为后续方法提供了基准;具体增益来源文中未充分说明。

Mind the Gap: Diagnosing Constraint Discovery Failures in Text-in-Image Editing Figure 1
2026-06-16cs.CV

Mind the Gap: Diagnosing Constraint Discovery Failures in Text-in-Image Editing

Rui Gui

Central South University, labels (0.646), suggesting that edit-specific causal cues ac-, ing label on the other side. These are implicit constraints:, region names (0.610) and type labels (0.646), indicating

2026-06-16视觉感知优化算法

论文关注多模态模型在图中文字编辑中能否主动发现未明说的连带约束,如折扣变化需同步改价格。作者提出隐式约束图 ICG 和受控诊断流程,将“发现”与“验证”分离。461 个案例上,四个 MLLM 无提示仅召回 46%,给出约束后达 94%;因果原因提示最有效,而单纯提高自发现召回会引入误报,未必改善下游编辑计划。

HadBalance: A Plug-and-Play Unified Global Geometric Prior Framework for Generalizable Biomedical Segmentation Figure 1
2026-06-16cs.CV

HadBalance: A Plug-and-Play Unified Global Geometric Prior Framework for Generalizable Biomedical Segmentation

Zhuangzhi Gao, Feixiang Zhou, He Zhao, Wenhan Chen, Ruiyu Luo, Xin Wang, Hongyi Qin, Zhongli Wu, Yanda Meng, Yitian Zhao, Alena Shantsila, Gregory Y. H. Lip, Eduard Shantsila, Yalin Zheng

2026-06-16视觉感知

本文针对医学分割中几何先验常依赖特定器官、难跨模态泛化的问题,观察到许多目标近似全局近凸,提出 HadBalance:用 Hadwiger 定理中的面积、周长和欧拉示性数构成统一形状先验,并通过 CAOB 在梯度层面削弱与分割目标冲突的先验影响。实验在颈动脉超声、息肉和视盘数据上相对强骨干及线性加权均有提升,尤其在更非凸的息肉数据上增益更明显。

CRIS: Cross-Plane Self-Supervised Isotropic Restoration for Anisotropic Volumetric Imaging Across Modalities Figure 1
2026-06-16cs.CV

CRIS: Cross-Plane Self-Supervised Isotropic Restoration for Anisotropic Volumetric Imaging Across Modalities

Adi Ahituv, Anat Ilivitzki, Moti Freiman

aFaculty of Data and Decision Sciences, Technion – Israel Institute of Technology, Haifa, 3200003, Israel, cFaculty of Biomedical Engineering, Technion – Israel Institute of Technology, Haifa, 3200003, Israel, dThe May-Blum-Dahl MRI Research Center, Technion – Israel Institute of Technology, Haifa, 3200003, Israel, retraining. Code is available at https://github.com/adi-hatav/CRIS., available or when priors do not transfer well across datasets

2026-06-16视觉感知

针对 MRI 与体电子显微中层间采样稀疏导致各向异性、影响重建和下游分析的问题,CRIS 将 3D 各向同性恢复转化为正交重切片上的 2D 条纹补全:用高分辨率面内切片自监督训练,推理时插入空白层并多视角融合,无需成对各向同性真值。在脑/腹部 MRI 和 vEM、最高 8× 各向异性实验中,PSNR、SSIM、FID/KID 及分割一致性均优于插值和多种自监督基线。

VEPHand: View-Efficient Photometric Hand Performance Capture at Scale Figure 1
2026-06-16cs.CV

VEPHand: View-Efficient Photometric Hand Performance Capture at Scale

Zhengyang Shen, Kai-Hung Chang, Erroll Wood, Deying Kong, Bo Peng, Timo Bolkart, Jinlong Yang, Bowen Zhao, Danhang Tang, Sasa Petrovic, Emre Aksan, Jérémy Riviere, Vassilis Choutas, Delio Vicini, Jay Busch, Shichen Liu, Zhe Cao, Hugh Liu, JingJing Shen, Jonathan Taylor, Mingsong Dou

the scalability and robustness of our automated pipeline on an extensive dataset of over 12,000 sequences, from which, mm mean surface error), significantly advancing practical, high-quality hand capture. Our project page are available at, data that is the foundation for our scalable pipeline., scalable system for View-Efficient Photometric Hand perfor-, Scalable Non-SDF Neural Reconstruction for View-, Scalable, Automated, and Validated End-to-End Pipeline:

2026-06-16视觉感知

面向低成本、大规模获取高保真手部数据,VEPHand针对约20视角、无遮挡掩码的稀疏多视角采集难题,提出非SDF的mask-free神经密度重建,并用场景化正则抑制漂浮物和背景塌陷;随后以个性化四面体手模上的规范空间体积偏移进行物理启发配准,刻画非线性皮肤形变和自接触。系统在约1.2万序列、800人数据上自动运行,覆盖单手、双手和手物交互,报告约1mm平均表面误差并生成大规模2D/3D合成手部数据。

You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences Figure 1
2026-06-16cs.CV

You Don't Need Strong Assumptions: Visual Representation Learning via Temporal Differences

Ninad Daithankar, Alexi Gladstone, Yann LeCun, Heng Ji

New York University

2026-06-16视觉感知

论文针对现有视觉自监督仍依赖增强、遮挡、裁剪等强归纳偏置,指出数据规模增大时最优偏置强度会下降。作者提出 TDV,从视频中利用“过去可预测未来”的弱因果假设,联合训练帧编码器与运动编码器,使当前帧表征加运动表征预测下一帧表征。实验显示其在密集空间任务上可接近 DINO、iBOT 等方法,但语义任务仍不强,扩展到更大视频数据的收益文中未充分说明。

Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis Figure 1
2026-06-16cs.CV

Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis

Zhangfeng Hu, Zefan Yang, Ge Wang, Tanveer Syeda-Mahmood, Anushree Burade, Mannudeep Kalra, Pingkun Yan

2026-06-16视觉感知

针对纵向胸片中真实病灶变化细微、易被解剖不变性和拍摄差异淹没,且进展具有“好转/恶化”等方向性的难点,本文提出 ProTrans,将前后两次 CXR 的疾病演变建模为语义空间中的可学习有向转移,并用报告对齐状态与转移语义,结合反向时间建模和双向重建一致性约束。实验显示其在疾病进展分类和进展描述生成上优于既有纵向建模方法。

GOOSE-M2F: Adapting Mask2Former for High-Fidelity, Long-Tailed Fine-Grained Semantic Segmentation in Unstructured Outdoor Terrain Figure 1
2026-06-16cs.CV

GOOSE-M2F: Adapting Mask2Former for High-Fidelity, Long-Tailed Fine-Grained Semantic Segmentation in Unstructured Outdoor Terrain

Jyothiraditya Lingam, Nikhileswara Rao Sulake, Sai Manikanta Eswar Machara

Department of Computer Science and Engineering, Rajiv Gandhi University of Knowledge Technologies, Nuzvid, India, models are publicly available at: Github GOOSE-M2F Code, scale H/4 limitation. ASPP-lite, inspired by DeepLabV3+ [5], batch 16 (1 sample × 16 grad-accum), label smoothing 0.10, assigning higher confidence to center predictions (full re-

2026-06-16视觉感知

面向腿式机器人在森林、 gravel、雪地等非结构化户外场景中的细粒度语义分割,GOOSE-M2F针对64类长尾、模糊边界和微小目标改造Mask2Former:扩展到200个查询,引入ASPP-lite+CBAM特征细化和辅助像素监督,并配合长尾重加权、稀有类Copy-Paste与密集滑窗TTA。其在GOOSE 2D FGSS取得70.08% Composite mIoU、榜单第3,但推理增益很大且代价约12倍。

TurboGS: Accelerating 3D Gaussian Splatting via Error-Guided Sparse Pixel Sampling and Optimization Figure 1
2026-06-16cs.CV

TurboGS: Accelerating 3D Gaussian Splatting via Error-Guided Sparse Pixel Sampling and Optimization

Zheng Dong, Daifei Qiu, Pinxuan Dai, Ke Xu, Jiamin Xu, Lili He, Rynson W.H. Lau, Weiwei Xu

2026-06-16优化算法三维

面向消费级/快速周转的新视角合成,TurboGS针对3DGS训练中大量低误差像素重复光栅化、细节又易因剪枝受损的问题,提出按多视角误差图进行tile级稀疏像素采样,并结合稀疏NCC结构损失、误差驱动的高斯增删和混合优化器,把算力集中到边缘、细结构等难区域。标准基准显示其在约100秒内达到相当或更好画质,相比原版3DGS最高约10倍训练加速,但低纹理区域仍可能出现轻微波纹伪影。

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing Figure 1
2026-06-16cs.CV

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

Shenzhen University 2 Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), Tsinghua University 4 Shanghai Jiao Tong University 5 University of Science and Technology of China, Shenzhen Technology University 7 Tongji University 8 Huawei, is particularly pronounced in human-centered scenarios involving states, emo-, expert-annotated ground-truth labels, directly using these labels for supervised, inference requires no labels, rationales, CoT annotations, or closed-source model, Wen et al., 2026b), yet human-centered multimodal reasoning, The available supervision, however, is poorly matched to this goal. Most affective computing datasets, provide reliable expert-annotated or consensus-based labels (Busso et al., 2008, Zhang et al., 2024), but these labels are sparse outcome-level, signals. A label such as happy, angry, or intent to complain does not identify the facial cue, acoustic, and especially hard to scale for subjective human-centered tasks (Lian et al., 2023b

2026-06-16强化学习

面向情感计算中的多模态推理,论文指出仅用类别标签或直接模仿前沿模型生成的理由,容易造成奖励稀疏、捷径学习和虚假解释。OmniOPSD 将前沿模型理由仅作为训练时教师侧特权证据,让学生在自身轨迹上接受本地教师的逐 token 指导,推理时无需理由或闭源模型。MER-UniBench 平均得分 84.19,达到文中报告的 SOTA,消融支持特权理由指导的贡献。

High-Fidelity 4D Hand-Object Capture via Multi-View Spatiotemporal Tracking and Physics-Aware Gaussians Figure 1
2026-06-16cs.CV

High-Fidelity 4D Hand-Object Capture via Multi-View Spatiotemporal Tracking and Physics-Aware Gaussians

Bo Peng, Xu Chen, Yi Gu, Hidenobu Matsuki, Mingsong Dou, Jingjing Shen, Deying Kong, Juyong Zhang, Zhengyang Shen

2026-06-16视觉感知三维

面向具身智能中高保真手-物交互数据难以摆脱模板、标记且遮挡下跟踪易失效的问题,论文提出21相机同步多视角管线:先用HOST时空Transformer融合跨视角与时间线索初始化手/物姿态和稠密几何,再以物理感知高斯优化加入四面体约束、碰撞修正与外观分解。实验在公开与内部数据上显示姿态跟踪、动态新视角合成和几何恢复更稳,77段复杂序列自动成功率超过93%。

SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture Figure 1
2026-06-16cs.CV

SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture

Adi Rosenthal, Tomer Koren, Nadav Shaked, Doron Friedman, Ariel Shamir

Reichman University, Israel

2026-06-16生成模型

该文针对共语手势生成中语义手势稀少、易被潜空间模型抹平且难以保持说话人风格的问题,提出在显式关节旋转空间中训练多模态扩散模型,并用无需训练的 JMI 按空间方差识别活跃关节,将外部语义动作局部注入采样过程。实验和用户研究显示,该方法在保持动作平滑自然与个体风格的同时,提升了语义控制能力并优于现有基线。

Text region detection in historical astronomical diagrams Figure 1
2026-06-16cs.CV

Text region detection in historical astronomical diagrams

Zeynep Sonat Baltacı, Raphaël Baena, Fei Meng, Somkéo Norindr, Florence Somer, Matthieu Husson, Mathieu Aubry

2026-06-16视觉感知

历史天文图中的文字常与几何元素交织、方向和语言多样,现有手稿或地图文本检测数据难以覆盖。本文构建948幅、跨8至18世纪七种传统的开放数据集,标注10940个带阅读方向的多边形文本区域,并提出可预测有序顶点的Poly-DETR及合成预训练流程。实验显示Poly-DETR在cBAD2019和MTHv2上达到新SOTA,在该数据集上接近大规模场景文字预训练的TESTR,但部分增益可能主要来自数据与预训练。

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models Figure 1
2026-06-16cs.CV

Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models

Kaiqing Lin, Zhiyuan Yan, Ruoxin Chen, Ke-Yue Zhang, Yue Zhou, Caiyong Piao, Bin Li, Taiping Yao, Bo Wang, Youchang Xiao, Shouhong Ding

2026-06-16视觉语言

针对 MLLM 检测 AI 生成图像时只依赖语义、难以捕捉低层生成器痕迹且直接微调会破坏语义表征的问题,论文通过层级分析指出语义主要在早中层形成,并提出 Deep-VRM:冻结早期语义路径,用带 LoRA 的视觉分支学习伪造残差并注入中间层融合。实验称其无需外部专家检测器,在 GenImage、AIGI-Now、WildRF 等多数基准达到 SOTA,并对压缩、缩放更鲁棒。

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation Figure 1
2026-06-16cs.CV

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

Fudan University, Shanghai Innovation Institute, The University of Hong Kong, Tongji University, Li Auto Inc., Huazhong University of Science and Technology, Imperial College London, University of Surrey

2026-06-16机器人强化学习

面向自动驾驶与城市导航中世界动作模型推理慢、视频生成与动作预测强耦合导致泛化受损的问题,Metis 将未来视频建模视为训练辅助而非推理前置步骤,采用 Mixture-of-Transformers 分设视频与动作专家,并用非对称注意力实现联合训练、推理时跳过显式视频生成。实验显示其在 NAVSIM navhard/navtest 与 CityWalker 上达到 SOTA,且真实机器人部署验证了效率与跨场景可行性。

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation Figure 1
2026-06-16cs.CV

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

Long-Bao Nguyen, Quang-Khai Tran, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

University of Science, Ho Chi Minh City, Vietnam, University of Dayton, Ohio, United States, Vietnam National University, Ho Chi Minh City, Vietnam

2026-06-16视觉感知数据集/基准

针对多主体参考图生成缺少联合评测的问题,CogCanvas将多身份保持、人物-物品/服饰绑定、背景约束、空间关系与交互放入同一基准,构建1952张参考图和1361个2–5人组合提示,并用结构化关系图、BG-Sim与Attr-VQA补足背景和属性绑定评估。五个SOTA方法在人数增加时明显退化,超过三人后物品/服饰绑定几乎失效。

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery Figure 1
2026-06-16cs.CV

Object Tokens as a Bridge Between Segmentation and Visual Question Answering in Robotic Surgery

Yiping Li, Ronald de Jong, Romy van Jaarsveld, Franco Badaloni, Gino Kuiper, Jelle Ruurda, Josien Pluim, Marcel Breeuwer

2026-06-16机器人视觉感知

针对手术VQA常用框级定位、难以刻画器械与组织细粒度空间关系的问题,论文将VLM生成的对象token作为问答与分割的共享中介,并接入SAM解码器,在联合损失下学习可用于回答也可还原为像素掩码的表示。作者在私有RAMIE和公开EndoVis18上报告优于基线,并用多种SAM变体验证,但具体泛化与数据贡献仍需更多公开评测支撑。

A Dual-Branch Collaborative Framework for Joint Optimization of Underwater Image Enhancement and Object Detection Figure 1
2026-06-16cs.CV

A Dual-Branch Collaborative Framework for Joint Optimization of Underwater Image Enhancement and Object Detection

Liyuan Cao, Zheng Liu, Guanghao Liao, Yonghui Yang, Qi Li

A Dual-Branch Collaborative Framework for Joint Optimization of Underwater Image Enhance-, A Dual-Branch Collaborative Framework for Joint Optimization of, aSchool of Electronic and Information Engineering, University of Science and Technology Liaoning, No.189 Qianshan Middle Road, Lishan

2026-06-16视觉感知优化算法

面向水下机器人感知中颜色偏移、细节模糊会削弱目标检测的问题,论文将退化拆为细节退化与颜色失真,提出无需复杂训练的双分支增强框架:一支做照明/局部对比与纹理增强,另一支做亮度引导的颜色补偿并融合输出。实验显示其在 UIEB、EUVP 上取得 UIQM 2.249/2.576,256×256 单图约 0.009s,并使 YOLOv8 在 URPC 上 mAP50 较基线提升 2.1%。

EmoZone-Talker: Regional Semantic Control of Audio-Driven 3DGS Talking Heads via Facial Action Units Figure 1
2026-06-16cs.CV

EmoZone-Talker: Regional Semantic Control of Audio-Driven 3DGS Talking Heads via Facial Action Units

Tingting Chen, Shaojun Wang, Huaye Zhang, Diqiong Jiang, Chenglizhao Chen

China University of Petroleum (East China), China University of Petroleum (East China) Qingdao China

2026-06-16规划控制三维

针对音频驱动 3DGS 说话头中语音动态与显式表情控制相互纠缠、导致局部编辑不准和时序抖动的问题,EmoZone-Talker 将任务建模为跨模态冲突下的时空协调,引入基于解剖先验的 SZ-PAB 区域优先注意力和 CIT-AE 时序 AU 编码器,把解耦后的语音/表情信号映射到高斯形变。实验显示其提升 AU 控制精度、上半脸自然度与时间一致性,同时基本保持渲染质量和唇同步。

Learning a Sampling-Free Variational DNN Plugin from Tiny Training Sets to Refine OOD Segmentation With Uncertainty Estimation Figure 1
2026-06-16cs.CV

Learning a Sampling-Free Variational DNN Plugin from Tiny Training Sets to Refine OOD Segmentation With Uncertainty Estimation

Jimut B. Pal, Suyash P. Awate

2026-06-16视觉感知安全鲁棒

针对跨医院、跨设备医学图像中 DNN 分割易因 OOD 偏移失效且难以重新标注训练的问题,论文提出轻量插件 VarDeepPCA:只用少量 ID 分割学习解剖几何先验,并通过对 softmax 的变分重释实现免采样建模、推理和不确定性估计。作者在 4 类任务、14 个公开数据集上接入多种分割器,对比 15 种方法显示其能提升几何合理性和临床指标并降低 OOD 分割误差。

SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models Figure 1
2026-06-16cs.CV

SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models

Siya Yang, Nanxiang Jiang, Zhaoxin Fan, Yunfeng Diao

2026-06-16视觉感知

针对视觉自回归(VAR)文生图模型易生成不安全/侵权内容、而扩散模型概念擦除方法直接迁移会造成语义崩塌和伪影的问题,论文提出“语义奇点”洞察:目标概念主要在 Scale-0 被锁定,并用 ISSA 分析验证。基于此,SACE 仅在首尺度干预,结合熵正则擦除与保真保持损失;实验称其在多类概念擦除上达到更好效果,同时训练开销更低。

CPS4: Class Prompt driven Semi-Supervised Spine Segmentation with Class-specific Consistency Constraint Figure 1
2026-06-16cs.CV

CPS4: Class Prompt driven Semi-Supervised Spine Segmentation with Class-specific Consistency Constraint

Qingtao Pan, Hongzan Sun, Bing Ji, Shuo Li

2026-06-16视觉感知优化算法

针对半监督脊柱 MRI 多类别分割中伪标签噪声大、现有 VLM 类提示与具体椎体/椎间盘区域绑定不足的问题,CPS4 先用类特异一致性约束预训练视觉-文本编码器,通过 token 与 pixel 级注意力损失强化提示和目标结构对齐,再用类提示生成的二值图融合改进未标注样本伪标签。在公共脊柱数据集上,仅 5% 标注数据时 Dice 达 80.44%,优于常见半监督和 VLM 基线。

DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing Figure 1
2026-06-16cs.CV

DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing

Artyom Mazur, Nina Konovalova, Aibek Alanov

HSE University, FusionBrain Lab

2026-06-16生成模型三维

针对文本到图像扩散 Transformer 内部语义如何跨去噪步、跨文本/图像流传播难以追踪的问题,DifFRACT 将 LLM 中的 transcoder 电路追踪引入 FLUX.1 双流 MM-DiT,用时间步条件化 transcoder 近似各 MLP 子层并做特征到特征归因。实验显示其稀疏性—保真度与 SAE 相当或略优,可恢复属性绑定、语义传播和生成错误相关电路,且电路引导干预比 SAE steering 更精确。

Domain-Guided Prompting of the Segment Anything Model for Seismic Interpretation: The Role of Attributes, Visualization, and Hybrid Prompts Figure 1
2026-06-16cs.CV

Domain-Guided Prompting of the Segment Anything Model for Seismic Interpretation: The Role of Attributes, Visualization, and Hybrid Prompts

Aniq Ahmad, Heather Bedle, Ahmad Mustafa

2026-06-16视觉感知

针对地震解释中标注昂贵、微调 SAM 成本高且易削弱泛化的问题,本文探索不重训的零样本适配:按地质目标选择地震属性与配色,并将用户点提示与由 SAM 内部激活生成的稠密 mask 提示结合。多目标、多数据集实验显示,该策略较单纯点提示能提升地质特征可分性、边界刻画和分割精度,使 SAM 在零样本场景下达到有竞争力的表现。

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference Figure 1
2026-06-16cs.AI

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

University of Massachusetts, Dartmouth, MA, or falling back when the available evidence does not justify a definitive answer.

2026-06-16视觉语言

针对多模态模型在视觉证据弱或冲突时仍给出自信错误回答的问题,本文提出一种无需重训的检索增强可靠性感知推理层:用外部视觉近邻证据计算相似度、类别支持、证据间隔和熵等信号,并通过门控决定接受、谨慎回答或拒答。在 ImageNet-100 上,接受样本准确率由 85.84% 提升至 88.88%,覆盖率 89.04%,类幻觉的接受错误率由 14.16% 降至 11.12%。

Faithful Action-unit Causal Reasoning for Counterfactually Faithful Emotion Explanations Figure 1
2026-06-16cs.CV

Faithful Action-unit Causal Reasoning for Counterfactually Faithful Emotion Explanations

Van Thong Huynh, Hong Hai Nguyen, Thuy Pham, Trong Nghia Nguyen, Soo-Hyung Kim

2026-06-16视觉感知

论文针对多模态情绪识别中“能说出AU但解释未必真实驱动预测”的问题,提出FACR:用极性化AU→情绪因果图约束推理,并通过AU潜变量上的do干预训练与度量反事实忠实性。UNBC-PAIN上PSPI一致性由0.08升至0.57,AUC小降0.83到0.79;跨数据集七类情绪任务中对图一致性由0.50升至0.84,但真实AU一致性依赖图本身正确性。

Ellipse Meets Bit-Planes: A Novel Approach to RNFL based Glaucoma Detection Using Advanced Image Processing and Deep Learning Figure 1
2026-06-16cs.CV

Ellipse Meets Bit-Planes: A Novel Approach to RNFL based Glaucoma Detection Using Advanced Image Processing and Deep Learning

Snigdha Paul, Sambit Mallick, Anindya Sen

2026-06-16视觉感知

针对青光眼早期常表现为彩色眼底图中细微、弥漫性 RNFL 变薄且 OCT 成本较高的问题,论文提出自适应椭圆极坐标变换,使 RNFL 轨迹在不同视盘/黄斑位置下更易对齐分析,并分别构建深度特征融合与位平面切片的轻量图像处理方案。前者报告 99.3% 检出率,后者以较低计算量达到 92.31% 准确率。

Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning Figure 1
2026-06-16cs.CV

Task-Instructed Causal Routing of Vision Foundation Models for Multi-Task Learning

Donghyun Han, Yuseok Bae, Jung Uk Kim, Hyung-Il Kim

2026-06-16视觉感知

针对单一视觉基础模型难以同时覆盖语义、几何和边界等密集预测需求的问题,论文提出 TIGER:冻结 CLIP、DINOv2、SAM、OWLv2 等异构专家,用自然语言任务指令驱动 token 级路由,并以反事实移除专家造成的性能变化约束路由权重,使融合更贴近因果贡献。在 NYUD-v2 与 Pascal Context 上,TIGER 超过多任务学习基线和单专家模型。

The Circumplex Degeneracy Behind the Rare-Class Limit in Affect Recognition Figure 1
2026-06-16cs.CV

The Circumplex Degeneracy Behind the Rare-Class Limit in Affect Recognition

Van Thong Huynh, Hong Hai Nguyen, Soo-Hyung Kim

2026-06-16视觉感知

本文针对野外表情识别中愤怒、恐惧等稀有类长期低 F1 的问题,质疑“类别不均衡”解释,提出用效价—唤醒环形空间与最优传输代价做受控诊断。结果显示,环形代价虽提升宏 F1,但均匀代价同样甚至更好,说明增益主要来自通用置信惩罚;真正稳定的失败源于类别在情感几何中退化重合,需改进表征而非重定价损失。

OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning Figure 1
2026-06-16cs.CV

OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning

Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong Chen

The Chinese University of Hong Kong, Shenzhen, Shanghai AI Lab, Beihang University, Nanyang Technological University, The Hong Kong University of Science and Technology (Guangzhou), The Chinese University of Hong Kong

2026-06-16规划控制数据集/基准

现有交通多模态基准多偏向被动识别,难以可控评估车道拓扑、多视角几何、时序演化与信号相位推理。OmniTraffic 将12个真实路口重建为可编辑3D环境,结合真实监控,生成带结构元数据的多视角VQA,并按感知、时空推理、决策支持分层。其8M样本和3K人工测试显示,最佳MLLM仅72.4%准确率,显著低于人类92.9%,弱点集中在拓扑和时空任务;仿真数据微调还能提升真实场景表现。

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs Figure 1
2026-06-16cs.MM

MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs

Hangling Xie

Nanjing University of Posts and Telecommunications, Wenyuan Road No.9, Xixia, utilization. Despite these advances, large labeled datasets and task-specific re-

2026-06-16视觉语言

针对多模态大模型做情感分析时对提示和示例选择高度敏感、固定融合难以适配不同输入的问题,MAF不微调主模型,而是按查询动态检索少样本示例:联合人脸表情、场景与文本特征,并用唇动定位说话人,再由轻量网络生成样本级模态融合权重,最后用多次输出投票稳定预测。论文在三个公开数据集上显示其相对对应骨干有稳定提升,并与强多模态情感分析基线具备竞争力。

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning Figure 1
2026-06-16cs.RO

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning

Shuaike Zhang, Shaokun Wang, Haoyu Tang, Jianlong Wu, Liqiang Nie

Harbin Institute of Technology, Shenzhen, Shandong University, Shenzhen Loop Area Institute

2026-06-16视觉感知

本文针对具身持续学习中闭环控制会放大特征漂移、导致旧操作任务遗忘的问题,提出把新任务视为可复用技能的组合。SCE 通过 CSG 从示范中构建技能库,并用执行/转移双专家分别建模技能执行与技能切换,再自适应融合生成动作。LIBERO 与真实机器人实验显示其在保持旧任务能力和总体成功率上优于基线,并通过消融与漂移分析支持改进来源。

3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation Figure 1
2026-06-16cs.CV

3D Consistency Optimization for Self-Supervised Monocular Video Depth Estimation

Yuanye Liu, Ke Zhang, Junzhe Jiang, Li Zhang, Vishal Patel, Xiahai Zhuang

Fudan University, Shanghai, China, Johns Hopkins University, Baltimore, USA

2026-06-16视觉感知优化算法三维

该文针对单目内窥视频缺少可靠位姿、逐帧自监督深度易产生跨帧漂移和闪烁的问题,将视频深度估计重写为无位姿多视角三维重建。方法用多视角Transformer与3D Gaussian表示联合预测深度和相机,并通过光度渲染、世界坐标几何对齐和多尺度时序梯度约束训练,推理无需逐场景优化。实验称在自监督和零样本临床场景中优于逐帧、视频深度及多视角重建基线。

CEVAR: Centerline Embedding Extraction for Endovascular Aneurysm Repair Figure 1
2026-06-16cs.CV

CEVAR: Centerline Embedding Extraction for Endovascular Aneurysm Repair

Roman Naeem, Timo Niiniskorpi, Charlotte Sandström, Naman Desai, Anders Jeppsson, Ida Häggström, Fredrik Kahl, Håkan Roos, Jennifer Alvén

CEVAR: Centerline Embedding Extraction for, Chalmers University of Technology, 412 96 Gothenburg, Sweden, The University of Gothenburg, 405 30 Gothenburg, Sweden, Sahlgrenska University Hospital, 413 45 Gothenburg, Sweden, seal in stent graft sealing zones. Structured CT review using centerline, ual centerline editing and expert operators. We propose a transformer, combines 3D centerline tracking with embedding-based geometric pre-, aorto-iliac centerline extraction from follow-up CT and for measure-, cial semi-automatic workflow. Code and pretrained models are available, Keywords: Endovascular aneurysm repair (EVAR) · Vascular center-, The EVAR4C protocol [19] evaluates sealing zones using vessel centerlines, manual centerline editing by highly trained operators [2, 19].

2026-06-16强化学习

EVAR 术后破裂常源于支架密封区丧失,而 EVAR4C 依赖中心线测量但需专家手工修正。CEVAR 将 Transformer 3D 图式中心线跟踪与点级嵌入上的多任务几何预测结合,自动估计支架边缘、血管直径和密封长度。基于 142 名患者 374 次 CT 及 Aorta24 预训练,方法在完整测试集和无增强 CT 子集上均优于商业半自动流程;但密封长度预测仍较困难,增益部分可能来自数据与预训练。

OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model Figure 1
2026-06-16cs.CV

OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

Jiali Wen, Hongxia Gao, Litao Li, Yixin Chen, Kaijie Zhang, Qianyun Liu, Xiaoqin Wen

2026-06-16视觉语言视觉感知强化学习

面向安检 X 光中违禁品种类变化、遮挡严重且缺少高质量图文数据的问题,论文构建了含 52,124 对图文、28 类违禁品的 MMXray,并用符合 X 光成像物理的 AnyContraSyn、CleanDET 与 OnePipe 补充合成和标注数据;在此基础上训练统一 VLM OneFocus,同时支持问答、定位、分类和图像理解,并在多基准上取得 SOTA 与跨域泛化。

SpatialAvatar-0: High-Quality 4D Head Avatar with Multi-Stage Reconstruction Figure 1
2026-06-16cs.CV

SpatialAvatar-0: High-Quality 4D Head Avatar with Multi-Stage Reconstruction

Yiran Wang, Zeyu Zhang, Yuanming Li, Ziming Wang, Yang Zhao

2026-06-16三维

本文针对4D头部数字人中前馈生成与单人精修难以共享表示、且精修耗时的问题,提出基于FLAME绑定3D Gaussian的SpatialAvatar-0:用可变K源均值池化和单目到多视两阶段训练缓解域偏差,再以冻结布局的1万步精修和抗尖刺正则替代densification。结果显示其在VFHQ/HDTF零样本PSNR较GAGAvatar高1.5dB,在SplattingAvatar上以约60倍更短流程超过GeoAvatar 1.3dB。

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning Figure 1
2026-06-16cs.CV

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

Saraswathy Amjith

Massachusetts Institute of Technology

2026-06-16视觉语言视觉感知强化学习

论文针对 VLM 在计数、比较等组合视觉推理中缺少显式中间步骤、而人工推理标注难扩展的问题,提出用 GRPO 奖励模型自行生成子问题/子答案再作答,无需示范分解。实验显示 A-OKVQA 上标准 RL 已从 46.8% 提至 51.6%,自提问仅到 52.2%,说明主要增益来自 RL 校准;但在跨域和复杂计数/材质问题上,自提问仍有一定价值,简单问题则可能因格式开销降性能。

Fusing Transferred Priors and Physics-based Decomposition for Underwater Image Enhancement Figure 1
2026-06-16cs.CV

Fusing Transferred Priors and Physics-based Decomposition for Underwater Image Enhancement

Haochen Hu, Yanrui Bin, Zhengyan Zhang, Minchen Wei, Chih-yung Wen, Bing Wang

2026-06-16视觉感知

针对水下图像增强依赖人工筛选伪标签、易被带偏的问题,论文将退化按成像物理拆成全局校色、去雾和背景噪声抑制三步,并分别迁移扩散模型、真实雾图数据和语义分割先验作监督,避免成对真值需求。实验显示该 P2UIE 在多数据集感知质量指标和下游视觉任务上优于基线,消融表明真实雾先验与前景/背景融合是主要增益来源。

Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action Figure 1
2026-06-16cs.AI

Towards Next-Generation Healthcare: A Survey of Medical Embodied AI for Perception, Decision-Making, and Action

Cheng Zhang, Qing Cai, Xingzheng Wu, Xun Yang, Xiaojun Chang, Bingkun Bao, Liqiang Nie, Xinwang Liu, Yi Yang

2026-06-16视觉感知

本文针对医疗基础模型难以与真实临床环境物理交互的问题,将医疗具身智能统一到“感知—决策—行动”闭环框架下,系统梳理具身感知、规划导航与动作执行的技术脉络,并覆盖手术机器人、护理陪伴、沉浸式教学和远程诊疗等应用及数据集。主要结果是给出系统级分类与挑战清单,指出数据稀缺、不确定性建模和高精度安全控制仍是落地瓶颈;文中未充分说明定量增益。

Open-World Video Segmentation Figure 1
2026-06-16cs.CV

Open-World Video Segmentation

Qing Su, Kaiyang Li, Yuan Zhuang, Fei Miao, Shihao Ji

University of Connecticut

2026-06-16视觉感知强化学习

本文针对开放世界长视频分割中对象会持续出现、重现且标注粒度不固定的问题,指出现有方法缺少稳健的新对象发现与长期身份维护,传统 1:1 评测也会低估合理的细粒度预测。作者提出 Savvy,通过层级掩码发现、延迟接纳和轨迹合并管理对象生命周期,并提出 OGA 以 n:1 粒度无关匹配评估。实验显示,在 VIPSeg 上 GA 评测显著恢复被压低的性能;在 ScanNet、HM3D 上 Savvy 在 VPQ∞、STQ、身份持续性等指标上优于 DEVA+SAM、EntitySAM。

XPASS-Vis: A Dataset for Cross-Domain Personalized Image Aesthetic Assessment Figure 1
2026-06-16cs.CV

XPASS-Vis: A Dataset for Cross-Domain Personalized Image Aesthetic Assessment

Takato Hayashi, Hiroaki Takahara, Candy Olivia Mawalim, Hiromi Narimatsu, Akisato Kimura, Shiro Kumano, Shogo Okada

Japan Advanced Institute of Science and Technology, Communication Science Laboratories, NTT, Inc.

2026-06-16视觉感知数据集/基准

针对现有个性化图像美学评估多局限单域、难检验个人审美能否跨域迁移的问题,XPASS-Vis构建了艺术、时尚、风景三域共享标注者数据集,含6526个刺激、129人、87836次交互,并记录总体美学分与9类审美情绪。基于无监督域适应的基线显示,最佳方法在目标域无标签时达到监督上界约60%(Spearman ρ=.28),说明偏好有一定可迁移性,但仍存在明显差距。

NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis Figure 1
2026-06-16cs.CV

NeRD: Neuro-Symbolic Rule Distillation for Efficient Ontology-Grounded Chain-of-Thought in Medical Image Diagnosis

Hongxi Yang, Yiwen Jiang, Siyuan Yan, Jamie Chow, Eunis Li, Charlotte Poon, Stephanie Fong, Xiangyu Zhao, Deval Mehta, Yasmeen George, Zongyuan Ge

2026-06-16视觉感知

面向医学影像诊断中可解释性与临床工作量的矛盾,NeRD不再按类别判别性挑概念,而是从临床概念中自动归纳逻辑诊断规则,再经规则激活、逻辑化简和概念 grounding 蒸馏为本体对齐的多模态 CoT。两套皮肤数据实验显示其保持诊断性能并提升解释紧凑性,盲法专家评估认为推理更符合临床,同时支持较高效的概念级人工干预。

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers Figure 1
2026-06-16cs.LG

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

School of Computer Science, Peking University, Beijing, China, School of Software Engineering, University of Electronic Science and Technology of China, Chengdu, China

2026-06-16生成模型

这篇论文关注 DiT-MoE 扩散模型采样时跨时间步计算冗余的问题,指出传统按 token 缓存与 MoE 内部按专家分支演化的结构不匹配:同一 token 的不同专家分支变化速度不同。MoECa 将缓存粒度下探到专家分支,并加入专家感知控制及 MoE/注意力同步更新,在多个 DiT-MoE 上实现最高 2.83× 推理加速且质量损失较小。

Variational Test-time Optimization for Diffusion Synchronization Figure 1
2026-06-16cs.CV

Variational Test-time Optimization for Diffusion Synchronization

Hyunsoo Lee, Farrin Marouf Sofian, Kushagra Pandey, Stephan Mandt

Seoul National University, University of California, Irvine

2026-06-16生成模型优化算法

针对协同生成中多条扩散轨迹需保持一致、但现有同步方法依赖启发式且迁移性有限的问题,本文将扩散同步表述为最优控制/变分推断,在测试时优化控制变量,在一致性约束与预训练先验之间折中,无需再训练。SyncVC在宽图生成、视觉错觉生成和3D网格纹理三类任务上整体优于同步与任务专用基线,并能接入风格等外部约束。

Mutual Distillation of Dual-Foundation Models for Semi-Supervised PET/CT Segmentation Figure 1
2026-06-16cs.CV

Mutual Distillation of Dual-Foundation Models for Semi-Supervised PET/CT Segmentation

Fuyou Mao, Beining Wu, Yanfeng Jiang, Bohan Xu, Lixin Lin, Naye Ji, Hao Zhang, Yan Tang

2026-06-16视觉感知

针对 PET/CT 器官分割标注昂贵且 PET 功能信息与 CT 解剖结构存在错配的问题,MuDuo 将 CT 侧 SAM-Med3D 与 PET 侧 SegAnyPET 作为冻结双基础模型,通过自动提示生成、跨模态伪标签融合和 IoU 共识过滤,把结构与代谢先验蒸馏到轻量学生网络。实验显示其在 AutoPET 上仅用 5 个标注病例即优于 SemiSAM+ 等方法,Dice 更高且 HD95 明显降低。

On the Adversarial Robustness of Multimodal LLM Judges Figure 1
2026-06-16cs.CV

On the Adversarial Robustness of Multimodal LLM Judges

Zihan Wang, Guansong Pang, Zelin Liu, Wenjun Miao, Jin Zheng, Xiao Bai

2026-06-16视觉语言安全鲁棒

针对多模态大模型越来越多被用作图像质量与安全评测裁判、但其可被对抗扰动操纵的问题,论文提出 RobustMLLMJudge 评测框架,将裁判范式归纳为 token 概率、细粒度分解和提示式裁判三类,并进一步设计 MGSIA,通过诱导“Yes”等肯定语义与对齐高分样本表征流形生成可迁移的提分扰动。实验显示,多类先进 MLLM 裁判在质量和安全场景下均易被隐蔽扰动抬高分数,MGSIA 相比已有攻击更有效,凸显自动裁判鲁棒性风险。

Parameter-Efficient Adaptation of SAM 3 for Automated ITV Generation from 4DCT Images Figure 1
2026-06-16cs.CV

Parameter-Efficient Adaptation of SAM 3 for Automated ITV Generation from 4DCT Images

Changwoo Song

2026-06-16视觉感知

本文针对胸部放疗中4DCT各呼吸相独立勾画ITV导致耗时且易受相位伪影影响的问题,将SAM 3通过LoRA以少量3D CT标注做参数高效适配,并结合硬负样本挖掘与基于呼吸周期连续性的时空过滤来抑制假阳性。实验在肺和心脏结构上取得中位Dice 0.968/0.910、HD95 0.998/2.931 mm,仅7例标注可保留超过95%全数据精度,但4DCT定量真值验证仍文中未充分说明。

Fusion-E2Pulse: A Multimodal Event-RGB Fusion Network for Non-contact Pulse Wave Reconstruction Figure 1
2026-06-16cs.CV

Fusion-E2Pulse: A Multimodal Event-RGB Fusion Network for Non-contact Pulse Wave Reconstruction

Qian Feng, Hao Guo, Yan Niu, Zhenhuan Xu, Yidi Li

College of Computer Science and Technology, Taiyuan University of Technology, China, College of Artificial Intelligence

2026-06-16视觉语言三维

本文针对RGB rPPG因曝光积分丢失脉搏细节、事件相机又易受微小运动噪声干扰的问题,提出Fusion-E2Pulse:以滤波后的RGB信号提供稳定结构先验,结合事件流的高时间敏感性,并用双流编码、注意力融合和时频对抗监督重建脉搏波形。在EMPD上心率MAE达0.78 bpm,波形相关0.89,收缩期时长误差16.74 ms,显示其更适合恢复重搏切迹等细粒度形态特征。

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC Figure 1
2026-06-16cs.RO

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC

Devesh Nath, Anutam Srinivasan, Haoran Yin, Ruitong Jiang, Jeffrey Fang, Glen Chou

Georgia Institute of Technology

2026-06-16强化学习规划控制安全鲁棒

这篇论文针对从像素进行机器人控制时“潜在世界模型好规划但难保证真实安全”的问题,提出 SLS²:学习紧凑马尔可夫潜在动力学,并用保形预测校准动力学误差与安全分类器误差,再结合 GPU 并行 SLS 鲁棒 MPC 做可达集约束规划。实验覆盖 Reacher、Cube、Push-T 和双臂绳操作,名义成功率与安全/鲁棒成功率普遍优于 Le-WM、DINO-WM、PLDM 及潜在安全过滤基线;但 Push-T 等长序列复杂任务仍受潜在距离度量限制。

DenseControl: Instance-Level Controllable Synthesis of Dense Crowd Image Figure 1
2026-06-16cs.CV

DenseControl: Instance-Level Controllable Synthesis of Dense Crowd Image

Juncheng Wang, Lei Shang, Wang Lu, Baigui Sun, Shujun Wang

Lei Shang, and Baigui Sun are with Tongyi lab, Alibaba Group, Hangzhou, China, Wang Lu is with Tsinghua University, Beijing, China, Shujun Wang is with the Department of Biomedical Engineering, the Hong Kong Polytechnic University, Hong Kong SAR, China.

2026-06-16视觉感知规划控制

针对密集人群数据采集标注昂贵、现有扩散/ControlNet难以按实例精确控制位置与尺度的问题,DenseControl将人群实例表示为IOE位置嵌入,并用ISE注入隐式尺度信息,再通过Position Shortcut缓解控制信号到潜空间的投影困难。实验显示其在人群图像合成质量、位置/尺度可控性上优于多种控制方案,并可用于数据稀缺、迁移学习和天气泛化下的人群分析增强。

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation Figure 1
2026-06-16cs.CV

Unlocking Diffusion Hierarchies: Adaptive Timestep Selection for Zero-Shot Segmentation

Ramin Nakhli, Mahesh Ramachandran, Luca Ballan

2026-06-16视觉感知生成模型

针对扩散模型零样本分割中“高分辨率边界”与“语义上下文”难兼顾、且固定去噪时刻取特征的问题,论文提出融合自注意力与 U-Net 编码特征的上下文相似图,并观察到去噪过程存在从部件到物体的语义层级演化,据此为每个像素自适应选择最佳时刻。实验显示其在多项零样本分割基准上优于 DiffSeg、DiffCut 等方法。

Toward the Whole Picture: Accumulative Fingerprint Mapping and Reconstruction for Small-Area Mobile Sensors Figure 1
2026-06-16cs.CV

Toward the Whole Picture: Accumulative Fingerprint Mapping and Reconstruction for Small-Area Mobile Sensors

Xiongjun Guan, Jianjiang Feng, Jie Zhou

2026-06-16三维

面向手机小面积指纹传感器单次采集覆盖不足、姿态和形变变化大导致多次局部匹配低效且不稳的问题,论文将识别重构为“累积建图—状态更新—一次匹配”,提出以方向场和细节点等结构特征先配准融合、再相位重建脊线的经典基线,并展望结构化 token、两阶段位姿和扩散重建。当前主要结果是给出可解释 MATLAB 原型和评测方案,文中未充分说明完整基准性能增益。

An Extensive Benchmark for Single-round and Multi-round Instruction-based Image Editing Figure 1
2026-06-16cs.CV

An Extensive Benchmark for Single-round and Multi-round Instruction-based Image Editing

Yiwei Ma, Ke Ye, Weihuang Lin, Jiayi Ji, Xiaoshuai Sun, Tat-Seng Chua, Rongrong Ji

2026-06-16视觉感知数据集/基准

针对指令式图像编辑评测难以同时覆盖复杂指令、多样编辑类型与多轮稳定性的问题,论文提出 I2EBench2.0 基准,构建含 2000 余图像和 6700 余指令的数据集,并以单轮 16 个维度、多轮 7 个维度评估高低层编辑能力。作者测试 8 个近期模型,发现基准分数与人工偏好显著相关,并据此分析各模型在不同编辑维度和多轮场景下的优势与短板。

RaLMPH: Reliability-aware Learning for Multi-Pathologist Harmonization in Whole-Slide Image Classification Figure 1
2026-06-16cs.CV

RaLMPH: Reliability-aware Learning for Multi-Pathologist Harmonization in Whole-Slide Image Classification

Sungrae Hong, Jiwon Jeong, Soeun Cheon, Donghee Han, Sol Lee, Jisu Shin, Kyungeun Kim, Mun Yong Yi

2026-06-16视觉感知

针对全切片图像 MIL 训练中默认单一“金标准”标签、却与临床多病理医生分歧不符的问题,RaLMPH 将切片特征局部结构、实例包方差与专家标签熵合成可靠性场,按样本而非全局评估专家可信度,并用门控机制融合局部可靠意见。在六名病理医生标注的临床数据和模拟基准上,该方法相对多数投票、软标签及现有多标注学习方法取得更稳定的分类提升。

EcoBin: A Two-Stage Deep Convolutional Neural Network for Contamination-Aware Waste Classification Figure 1
2026-06-16cs.CV

EcoBin: A Two-Stage Deep Convolutional Neural Network for Contamination-Aware Waste Classification

Raghav Senthil Kumar

2026-06-16视觉感知

针对现有垃圾分类只识别物品类别、难以判断可回收物是否被油污/食物残渣污染的问题,EcoBin将EfficientNetV2-S路径分类器与污染检测器串联,并用U2-Net分割后合成污染数据训练第二阶段。结果显示基础阶段路径准确率96.13%,污染阶段ROC-AUC达0.99,在25张真实污染样本上由1/25提升到24/25正确,但真实污染数据规模仍偏小。

Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks Figure 1
2026-06-16cs.CV

Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks

Feng Qiao, Zhaochong An, Zhexiao Xiong, Serge Belongie, Nathan Jacobs

Washington University in St. Louis, University of Copenhagen

2026-06-16视觉感知规划控制三维

面向视频到视频的新视角重渲染,论文针对现有相机姿态嵌入、点云渲染或隐式对应难以同时保证空间与时间一致的问题,提出用源/目标视角成对3D点轨迹作为扩散视频模型条件,显式描述内容在何时何处出现,并通过双视角轨迹条件器传递上下文。在400段静/动态视频上,相比强基线提升视觉质量、视角同步和相机精度,旋转误差降30–65%、平移误差降61–72%。

Selective Synergistic Learning for Video Object-Centric Learning Figure 1
2026-06-16cs.CV

Selective Synergistic Learning for Video Object-Centric Learning

WonJun Moon, Jae-Pil Heo

2026-06-16视觉感知

论文针对视频对象中心学习中编码器注意力图与解码器对象图的结构性错位:前者边界锐利但噪声多,后者时空一致但边界模糊。SSync的核心洞察是只在各自可靠区域互相蒸馏,用编码器细化边界、用解码器去噪内部,并通过线性复杂度伪标签和传递式合并抑制 slot 冗余。实验显示其在多个 VOCL 基准上提升分解质量、较密集对齐更省内存,且对 slot 配置更稳健。

ST-DiffEye: Diffusion-based Continuous Gaze Generation via Joint Scanpath-Trajectory Modeling Figure 1
2026-06-16cs.CV

ST-DiffEye: Diffusion-based Continuous Gaze Generation via Joint Scanpath-Trajectory Modeling

Brian Nlong Zhao, Ozgur Kara, Junho Kim, James M. Rehg

University of Illinois Urbana-Champaign

2026-06-16生成模型规划控制

针对人类凝视生成中离散扫视路径只保留注视结构、连续眼动轨迹才包含细粒度运动动态的问题,ST-DiffEye 将扫视路径对齐为同长度序列并作为额外通道与轨迹联合扩散去噪,几乎不增加架构复杂度;同时用 CRPS 将常见序列指标改造成兼顾准确性与多样性的分布式评估。在 COCO-Search18、COCO-FreeView 和 MIT1003 上相对轨迹或扫视单模态基线取得整体最优或接近最优表现。

Analyzing Visual Aircraft Representations with Sparse Autoencoders Figure 1
2026-06-16cs.CV

Analyzing Visual Aircraft Representations with Sparse Autoencoders

Deepshik Sharma

Department of Computer Science & Engineering, Jain University, Bangalore, India

2026-06-16视觉感知

针对飞机细粒度分类中模型依赖的机身结构线索难以从热力图解释的问题,论文将稀疏自编码器用于分解 ConvNeXt 在 FGVC-Aircraft 上的中间空间激活,无需预设概念地挖掘可复用特征。结果显示部分稀疏特征对应起落架、舷窗、驾驶舱、发动机/机翼邻域等结构,消融会影响 logits、分类间隔和置信度;但特征仍存在多义性、定位较粗和信息分散等局限。

Lesion-DDPM: Lesion-Enhanced 3D Diffusion for MS MRI Synthesis Figure 1
2026-06-16cs.CV

Lesion-DDPM: Lesion-Enhanced 3D Diffusion for MS MRI Synthesis

Weidong Zhang, Yongchan Jung, Shafayat Mowla Anik, Furen Xiao, Vasudevan Janarthanan, Enkhzaya Chuluunbaatar, Byeong Kil Lee, Jeeho Ryoo

2026-06-16生成模型三维

针对多发性硬化症公开3D FLAIR MRI数据少、病灶小且稀疏导致生成模型易抹平病灶的问题,Lesion-DDPM将解剖/病灶掩码在3D U-Net扩散模型的编码器、瓶颈和解码器多层注入,并用病灶加权L1损失强化病灶体素重建。在MSLesSeg子集上,其病灶区域重建误差最低;仅用合成数据训练3D U-Net在真实MRI上Dice达0.616,优于最佳对照0.569,加入真实训练集后升至0.685。

Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection Figure 1
2026-06-16cs.LG

Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection

Nicholas A. Welsh, Lennon J. Shikhman, Monty Nehru Attazs, Seemanthini K. Putane, Van Minh Nguyen, Ryan T. White

Florida Institute of Technology, University of Florida, or expanding fixed label sets becomes operationally im-, than expanding a fixed label set through retraining, these

2026-06-16视觉语言视觉感知

面向在轨航天器巡检中发射后难以重训或上传大模型权重的问题,论文检验冻结 SAM3 是否可仅通过自然语言提示扩展部件分割能力。核心洞察是提示驱动的开放词汇分割对大尺度结构可用,但强依赖目标尺度与提示措辞;结构化空间/几何描述较短类名最高提升 82%。在 129 张未见卫星图像上,零样本单次推理达 0.385 mAP@0.5,星体和太阳翼较可靠,天线与推进器仍表现较弱。

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models Figure 1
2026-06-16cs.CV

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer

University of Alicante, optionally augmented with labeled graph examples for in-context learning., provide a scalable, fine-tuning-free alternative to end-to-end approaches that better, in its native text domain, to predict the action label. This design exploits a key asymmetry: while, learning (ICL): prepending just one or two labeled graph examples to the prompt significantly boosts

2026-06-16视觉语言视觉感知

面向机器人操作相关的第一视角视频,论文指出通用 VLM 直接看帧难以捕捉抓取、释放、放置等手物交互的细粒度时序变化。其核心做法是用多阶段提示先生成局部交互叙述,再转成可文本序列化的 Temporal Action Graph,让 VLM 在符号图上做闭集动作识别和少样本上下文学习。在 EGTEA、Epic-Kitchens-100 上,11 个开放 VLM 的图推理通常优于同模型帧输入,且 1–2 个标注图示例带来明显增益。

Segmentation-based Detection for Efficient Multi-Task Spacecraft Perception Figure 1
2026-06-16cs.CV

Segmentation-based Detection for Efficient Multi-Task Spacecraft Perception

Sivaperuman Muniyasamy, Surendar Devasundaram

University of Arizona, Tucson, AZ, USA

2026-06-16视觉感知

面向在轨操作中算力、功耗受限且空间图像标注稀缺、光照复杂的航天器感知问题,论文将任务重心放在部件分割:用 MobileNetV3 编码器和轻量 U-Net 解码器预测部件掩码与类别,再由掩码并集解析得到检测框,省去独立检测回归头。在 SPARK 2026 Stream-1 上总分 0.9482,分类 1.0000、检测 0.9788、分割 0.8917,排名第二,模型仅 3.849M 参数、22.575 GFLOPs。

Timestep Rescheduling in Diffusion Inversion Figure 1
2026-06-16cs.CV

Timestep Rescheduling in Diffusion Inversion

Shangquan Sun, Ting Gong, Zhirui Liu, Jiamin Wu, Runkai Zhao, Mianxin Liu, Wenqi Ren, Xiaochun Cao

2026-06-16生成模型

论文关注扩散反演中少步、均匀时间步会累积重建误差的问题,指出误差尺度与 timestep 间隔强相关,并在两端呈抛物线式增大。作者据此提出无需额外参数和计算的非均匀重调度:先全局缩放,再用动态规划局部重排,把细步分配到高误差区。实验显示该调度可作为即插即用模块,稳定提升多种反演方法在图像重建和编辑中的表现。

MNet++: Extended 2D/3D Networks for Anisotropic Medical Image Segmentation Figure 1
2026-06-16cs.CV

MNet++: Extended 2D/3D Networks for Anisotropic Medical Image Segmentation

Kirsten Odendaal, Rade Bajic

School of Computing, Georgia Institute of Technology

2026-06-16视觉感知三维

针对厚层 MRI/CT 中 z 轴采样稀疏导致 2D 缺少体上下文、3D 易受各向异性影响的问题,论文在 nnU-Net 框架内复现混合 2D/3D 的 MNet,并加入可学习的 2D–3D 融合门控与沿深度建模的 VMamba 模块。结果显示复现性能接近原文,PROMISE Dice 为 89.0%,LiTS 肝脏/肿瘤为 94.3%/54.6%;空间门控带来约 0.8% 提升且开销小,VMamba 提高稳定性并使 LiTS 肝脏 Dice 达 95.8%,但结论仍需更多测试支撑。

Sustainable Face Recognition on Low-Power Devices with VQ-VAE Embeddings Figure 1
2026-06-16cs.CV

Sustainable Face Recognition on Low-Power Devices with VQ-VAE Embeddings

Christos Chronis, Georgios Th. Papadopoulos, Iraklis Varlamis

2026-06-16视觉感知生成模型

面向低功耗门禁等边缘人脸识别场景,论文针对云端大模型带来的带宽、能耗与隐私压力,提出在端侧用 VQ-VAE 将人脸压缩为离散潜码,云端再重建并用预训练人脸嵌入检索匹配,同时通过知识蒸馏保留身份判别信息。结果声称在显著降低端侧内存、计算和传输开销的同时接近主流嵌入模型精度,但具体量化增益与数据设置文中片段未充分说明。

Chroma-gated, differentiable OKLCH interpolation: Continuous Oklab fallback for color-cast reduction Figure 1
2026-06-16eess.IV

Chroma-gated, differentiable OKLCH interpolation: Continuous Oklab fallback for color-cast reduction

Naoyuki Uchida

Continuous Oklab fallback for color-cast reduction∗, OKLCH—the cylindrical (lightness, chroma, hue) form of Ottosson’s Oklab color space—is, Continuous Oklab fallback (COFb), a one-parameter, differentiable chroma gate w(C) =, Cn/(Cn + σn) that continuously blends the OKLCH path toward the linear Oklab path as, does not preserve chroma. In deployment, COFb runs entirely in plain Oklab (a, b) →sRGB, interpolation (color-mix(in oklch) and the like) is unavailable—older engines, image and, OKLCH—the cylindrical (lightness, chroma, hue) form of Ottosson’s Oklab [1]—is the interpo-, We close this gap with Continuous Oklab fallback (COFb): a one-parameter, differentiable, chroma gate that continuously blends the raw OKLCH path toward the linear Oklab path as chroma, control) against linear Oklab (w →0 at the neutral axis, no cast), and the blend is taken in the, (σ →0) and linear Oklab (σ →large) as a single family. The gate’s properties are confirmed

2026-06-16视觉感知

论文针对 OKLCH 在中性轴附近插值会产生色偏的问题,指出现有 CSS/ColorAide 式阈值继承只处理无彩端点,无法处理两个有彩端点间的绕行色偏。作者提出 COFb,用可微色度门控在 OKLCH 弧线与线性 Oklab 路径间连续混合,无需端点测试。实验显示默认参数下跨色色偏路径横向偏差约降 49.5%、色相偏移降 35.5%;但无彩端点场景仍不如二值切换,且不保持色度。

Facial Affect Analysis for Service-Oriented Systems: Advances, Challenges, and Future Visions Figure 1
2026-06-16cs.CV

Facial Affect Analysis for Service-Oriented Systems: Advances, Challenges, and Future Visions

Spyridon Georgiou, Aggelos Psiris, Thomas Lagkas, Vasileios Argyriou, Panagiotis Sarigiannidis, Iraklis Varlamis, Georgios Th. Papadopoulos

2026-06-16视觉感知

本文动机是将面部情感分析从单一识别模型转向可部署的服务组件,解决现有研究过度依赖闭集基准、忽视边缘/云端延迟、隐私、公平性和生命周期维护的问题。核心洞察是按任务、架构与部署层重组FAA能力,并用服务契约、置信度输出和运行时监控评估其可组合性。主要结果是给出面向教育、健康、智能环境和交通等场景的部署路线图,指出单纯精度提升不足以支撑SoSE落地。

DYNA-PRUNER: Input-Adaptive Data-Model Co-Pruning for Efficient and Scalable Spatio-Temporal Media Prediction Figure 1
2026-06-16cs.CV

DYNA-PRUNER: Input-Adaptive Data-Model Co-Pruning for Efficient and Scalable Spatio-Temporal Media Prediction

Fuyan Zhang, Yuqi Li, Yingli Tian, Edmond S.L. Ho

2026-06-16视觉感知

该文针对天气、交通等时空预测中大量区域信息冗余但模型仍密集计算的问题,提出 Dyna-Pruner,将输入区域裁剪与模型结构裁剪用共享重要性场同步起来,为每个样本生成稀疏子网络,而非固定压缩。其在 WeatherBench、SEVIR、TaxiBJ 上可接入 CNN/RNN/Transformer,最高减少约 70% FLOPs,并在 Jetson AGX Orin 上实现 2.5 倍加速,精度损失低于 1%。

CausalDrive: Real-time Causal World Models for Autonomous Driving Figure 1
2026-06-16cs.CV

CausalDrive: Real-time Causal World Models for Autonomous Driving

Tianyi Yan, Huan Zheng, Dubing Chen, Meizhi Qu, Yingying Shen, Lijun Zhou, Mingfei Tu, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Cheng-zhong Xu, Jianbing Shen

2026-06-16强化学习

面向现有驾驶世界模型多停留在离线视频生成、依赖未来布局且难以闭环交互的问题,CausalDrive只用初始前视图、自车轨迹和文本提示生成反应式场景,引入SocioDrive-Bench刻画让行/博弈等“驾驶社会性”,并用因果自回归flow teacher与Self-Corrective Forcing蒸馏实现≤4步、约12 FPS生成。实验展示其可用于闭环评测、Video2Reward强化学习后训练和实时人在环仿真,训练策略在交互能力上更优。

SGFormer++: Semantic Graph Transformer for Incremental 3D Scene Graph Generation Figure 1
2026-06-16cs.CV

SGFormer++: Semantic Graph Transformer for Incremental 3D Scene Graph Generation

Mengshi Qi, Changsheng Lv, Zijian Fu, Xianlin Zhang, Huadong Ma

2026-06-16三维

面向点云三维场景图生成中全局关系难建模、GCN易过平滑,以及真实场景关系类别持续增加导致遗忘的问题,SGFormer++以Transformer做全局消息传递,设计线性复杂度的边感知Graph Embedding、结合LLM/VLM语义注入,并用空间引导适配器与级联二分类头支持增量谓词学习。在3DSSG上达到标准与增量设置SOTA,增量Predicate A@1绝对提升4.49%。

PPDM: Pixel Puzzling Diffusion Model for Speed and Memory Efficient Volumetric Medical Image Translation Figure 1
2026-06-16cs.CV

PPDM: Pixel Puzzling Diffusion Model for Speed and Memory Efficient Volumetric Medical Image Translation

Tianqi Chen, Jun Hou, Yinchi Zhou, James S. Duncan, Chi Liu, Bo Zhou

Department of Radiology, Northwestern University, Chicago, IL, USA, Department of Biomedical Engineering, Yale University, New Haven, CT, USA, Department of Radiology and Biomedical Imaging, Yale School of Medicine, New Haven, CT, USA

2026-06-16视觉感知生成模型

针对高分辨率3D医学图像翻译中扩散模型显存和采样开销过高的问题,PPDM用可逆的pixel puzzle/unpuzzle将空间分辨率换为通道维度,在保留全局体积上下文的同时降低激活内存,并结合从条件输入出发的direct bridge diffusion与puzzle-gradient loss抑制重排伪影。实验覆盖PET去噪、PET衰减校正和MRI跨模态翻译,性能达到或超过完整3D扩散模型,训练显存最多降低一个数量级且推理更快。

Conditional Multi-Event Temporal Grounding in Long-Form Video Figure 1
2026-06-16cs.CV

Conditional Multi-Event Temporal Grounding in Long-Form Video

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

University of Central Florida

2026-06-16视觉语言视觉感知

长视频中的真实查询常需在时空条件约束下找全多个事件并给出计数,现有单片段定位或无条件计数基准难以评估这一能力。论文提出 CoMET-Bench,覆盖600个长视频、2789个组合查询和负样本,并用统一协议及 Rejection-F1 同时衡量计数、定位与拒答;还提出免训练的 CoMET-Agent,以视频时序图和全局记忆做结构化搜索聚合。实验显示现有 MLLM 与专用方法均表现不足,CoMET-Agent 相比 GPT-5 的 F1@0.5 提升6.1%,但仍暴露实体跟踪、均匀检索和因果配对瓶颈。

CoMNeT: A MedNeXt-CorrDiff Framework for Volumetric Brain Tumor Segmentation Figure 1
2026-06-16cs.CV

CoMNeT: A MedNeXt-CorrDiff Framework for Volumetric Brain Tumor Segmentation

Michael L. Evans, MD Fayaz Bin Hossen, MD Shibly Sadique, Walia Farzana, Khan M. Iftekharuddin

Department of Electrical and Computer Engineering, Old Dominion University, Norfolk, VA, USA

2026-06-16视觉感知

针对多模态 MRI 胶质瘤中 ET/TC 小目标和跨扫描差异导致的体素级分割不稳,论文提出 CoMNeT:以 3D MedNeXt 为主干,加入 CorrDiff 对概率图做残差式纠错,并进行五折模型概率集成。UTSW-Glioma 五折验证平均 Dice 为 0.7798,高于 SegResNet 的 0.7555 和 MedNeXt 的 0.7697;但 TC 略低于单独 MedNeXt,纠错模块的独立贡献仍不够充分。

HemExp: Clinically-Guided Latent Diffusion for Modeling Hematoma Expansion Figure 1
2026-06-16cs.CV

HemExp: Clinically-Guided Latent Diffusion for Modeling Hematoma Expansion

Orhun Utku Aydin, Satoru Tanioka, Tzu I Chuang, Alexander Koch, Dimitrios Rallios, Marie Gultom, Begum Tahhan, Fujimaro Ishida, Dietmar Frey, Adam Hilbert

2026-06-16生成模型

针对脑出血血肿扩大的预测不能只给二分类风险或单一体积的问题,HemExp 将基线 NCCT、临床变量和指定扩张状态注入潜在扩散模型,并用出血感知多头 VAE 同时生成随访 CT 与 IPH/IVH 分割。模型在多中心 450 例训练、外院 107 例测试,可通过多次采样形成空间扩张概率图;改变发病到成像时间、抗凝状态会移动预测体积分布,并能呈现脑室受累、占位效应等临床终点,但作者也强调其更适合作为条件模拟器而非独立预测器。

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition Figure 1
2026-06-16cs.CV

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Lin Pei

2026-06-16视觉感知

面向只有单目相机的机器人在预建 LiDAR 地图中定位,G2IA 将跨模态地点识别从单纯全局描述子匹配改为“检索+验证”:利用 VGGT 视觉几何先验和实例特征对齐图像与点云表示,再用局部实例形状和相对布局一致性重排候选。实验在 NCLT、KITTI 等基准上提升不同阈值下的识别性能,并显示较好的跨数据集泛化。

Decoupled Motion Representation Learning for Moving Infrared Small Target Detection Figure 1
2026-06-16cs.CV

Decoupled Motion Representation Learning for Moving Infrared Small Target Detection

Guoyi Zhang, Peiwen Wu, Han Wang, Xiangpeng Xu, Xiaohu Zhang

2026-06-16视觉感知

面向动态场景中平台、背景与红外小目标运动高度耦合导致的误检问题,论文的关键洞察是背景误警多服从全局相干运动,而真实目标表现为稀疏局部异常。方法用显式光流分支建模相干背景运动,并以自监督适配到红外域,再用可变形对齐分支捕获局部异常、抑制相干运动诱发响应。在两个红外小目标检测基准上优于现有方法,尤其改善复杂运动场景且保持较好推理效率。

Enhancing Precision Agriculture with a Hybrid Deep Learning Framework for Multi-Class Plant Disease Classification and Interpretability Figure 1
2026-06-16cs.CV

Enhancing Precision Agriculture with a Hybrid Deep Learning Framework for Multi-Class Plant Disease Classification and Interpretability

Hasibul Islam Sufi, Ridam Roy, Shayla Alam Setu, Mahimul Islam Nadim

¹ Department of Computer Science and Engineering, Daffodil International University, Dhaka 1216, Bangladesh, depended upon the trained man’s eye and hand, often surrounded by laboratory activity., Although effective procedures are laborious, time-consuming, costly, and thus, (Techniques) AI that offers. Inexpensive, scalable, rapid solutions for an auto- mated

2026-06-16视觉感知

面向农业病害早诊断中人工识别慢、成本高且难以规模化的问题,论文比较 ResNet-50、MobileNetV2、EfficientNet-B0 与 ResNet+ViT 混合模型,在覆盖多作物 38 类病害的叶片数据上训练,并加入 Grad-CAM、显著图和分割可视化提升可解释性。结果显示 ResNet-50 验证准确率最高为 98.74%,混合模型为 98.58%;但混合架构相对 CNN 的增益来源不清,可能主要来自数据规模与强基线微调。

MamBOA: State-Space Architecture for Video Recognition Figure 1
2026-06-16cs.CV

MamBOA: State-Space Architecture for Video Recognition

Mustafa Bora Çelik

aAnkara Medipol University, Ankara, 06050, Turkey

2026-06-16视觉感知

针对细粒度视频识别中3D算子代价高、相邻特征硬相减表达力弱的问题,MamBOA将连续帧特征交错成序列,用Mamba的S6状态递推在共享隐状态中“合成”运动差分,并结合空间分支、对齐解码与双路径池化,作为可接入CNN/Transformer/Mamba的轻量时序头。其每对特征约增2.1 GFLOPs,在Diving48上图像预训练达85.02%、视频预训练全视频前向达86.24% Top-1。

Trusted Multi-View Deep Learning Classification of Fetal Congenital Heart Disease with Feature-level and Decision-level Fusion Figure 1
2026-06-16cs.CV

Trusted Multi-View Deep Learning Classification of Fetal Congenital Heart Disease with Feature-level and Decision-level Fusion

Tan Zhou, Shifa Yao, Suncheng Xiang, Dahong Qian, Baoying Ye

2026-06-16视觉感知

胎儿先心病超声诊断受多视角互补信息难融合、图像质量不稳定影响。该文构建含五个标准切面的较大规模CHD数据集,提出MVC-FDF:用共享ResNet50提特征,SE注意力做特征级多视图融合,再以Dempster–Shafer证据理论进行决策融合并输出不确定性,以降低低质量视图干扰。实验在自建数据集上取得较高分类表现,但外部验证与具体增益来源文中未充分说明。

Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection Figure 1
2026-06-16cs.CV

Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Yu Zhou

2026-06-16视觉感知优化算法

面向动态环境中目标类别持续增加的问题,论文指出 DETR 式增量目标检测的遗忘根源在于“梯度稀释”:旧知识保持信号被背景噪声、匹配漂移和样本支撑不足逐步削弱。其 FAS 框架通过先验注入查询、确定性锚点蒸馏和流形支撑回放,分别聚焦前景梯度、稳定跨阶段匹配并覆盖旧类边界;实验显示在 40+10×4 等设置中较已有方法提升超过 5 AP。

Landmark-free Assessment of Lower-limb Alignment with Implicit Neural Shape Functions from Knee Radiographs Figure 1
2026-06-16cs.CV

Landmark-free Assessment of Lower-limb Alignment with Implicit Neural Shape Functions from Knee Radiographs

Zhisen Hu, Antti Kemppainen, David Johnson, Egor Panfilov, Huy Hoang Nguyen, Timothy Cootes, Claudia Lindner, Aleksei Tiulpin

2026-06-16视觉感知

针对膝关节置换前后下肢力线评估依赖人工测量或固定解剖标志点、难以适配临床定义变化的问题,本文用隐式神经形状函数将股骨和胫骨轮廓编码为连续潜空间,并从潜码直接回归 aTFA、aMPTA、JLCA 等角度。内部566例训练、50例内部测试和402例MRKR外部测试显示,其精度接近标志点方法与人工一致性,但外部集略有下降,泛化增益来源仍不完全清楚。

SPARK: Spatial Policy-driven Adaptive Reinforcement learning for Knowledge distillation Figure 1
2026-06-16cs.CV

SPARK: Spatial Policy-driven Adaptive Reinforcement learning for Knowledge distillation

Mohamed Jismy Aashik Rasool, Shabir Ahmad, Gisong Oh, Teag Kuen Whangbo

Department of IT Convergence Engi-, neering, Gachon University, Sujeong-

2026-06-16强化学习

低比特量化虽利于在端侧部署图像复原模型,但量化噪声会优先破坏边缘与纹理,而传统蒸馏对所有像素等权监督。SPARK 将蒸馏权重分配视为强化学习策略:用边缘、纹理、学生误差和师生差距生成空间权重图,在 QAT 中强调困难区域且推理无额外开销。实验称其在多任务和多学生架构上优于 PTQ、QAT 与现有 KD,收益主要集中在高频区域。

HairLRM: Strand-based Hair Modeling via Large Reconstruction Models Figure 1
2026-06-16cs.GR

HairLRM: Strand-based Hair Modeling via Large Reconstruction Models

Yuefan Shen, Yican Dong, Xiufeng Huang, Zhongtian Zheng, Youyi Zheng, Kui Wu

State Key Lab of CAD and CG, Zhejiang University, Hong Kong Baptist University, State Key Lab of CAD and CG, Zhejiang University Hangzhou China, Hong Kong Baptist University Hong Kong China

2026-06-16强化学习三维

本文针对从单/多视图图像直接回归三维发丝场易出现遮挡顺序错误、卷发方向过平滑等问题,提出以大重建模型生成的头发网格作为几何支架,再用 Dual Orientation AutoEncoder、潜空间优化、表面引导修正和闭环迭代生成显式发丝。实验显示其在真实与风格化图像、马尾和卷发等复杂拓扑上比现有方法更稳健,轮廓与局部走向更准确。

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion Figure 1
2026-06-16cs.CV

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

Weichen Fan, Haiwen Diao, Penghao Wu, Ziwei Liu

S-Lab, Nanyang Technological University

2026-06-16生成模型

本文针对像素空间扩散在各时间步处理全频噪声图像而浪费容量的问题,指出自然图像频谱下存在随时间移动的信噪频带边界。作者提出无需参数的 Spectral Forcing,在输入端用时间条件 2D-DCT 低通显式隐藏噪声高频;在粗 patch、 高频多为噪声时收益最大。ImageNet-256 上 JiT-700M/32 的 FID 从 24.19 降至 20.68,IS 提升到 93.96,并迁移到 SenseNova-U1 改善 DPG-Bench 与 GenEval。

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments Figure 1
2026-06-16cs.CV

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

Marta Vallejo, Siwen Wang

2026-06-16视觉语言视觉感知安全鲁棒

面向自动驾驶、机器人和公共空间监控中的安全感知需求,论文检验视觉语言模型能否预测人类在风险场景中的注视区域。作者用10名被试、33张不同风险图像构建眼动热图,并将GPT-4o等模型的空间风险预测转为显著性图进行对齐评估。结果显示GPT-4o与人类注视有中等相关性(r=0.515、AUC-Judd=0.806),Gemini Pro在多数定位指标上更强,而GPT-4o的分布匹配KL更低,说明VLM可在无眼动训练下近似人类安全注意模式。

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams Figure 1
2026-06-16cs.CV

Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams

Yun Wang, Junbin Xiao, Han Lyu, Yifan Wang, Jing Zuo, Zhanjie Zhang, Hong Huang, Dapeng Wu, Angela Yao

2026-06-16视觉感知

面向可穿戴/具身助手,论文指出现有空间理解多停留在短片段或当前可见内容,难以随用户运动持续更新“物体相对我在哪”。作者提出UCS-Bench长时第一视角问答基准,并用DirectMe以相机位姿、深度和物体关系构建动态场景图记忆。实验显示其显著提升Qwen3-VL等MLLM,在长时间间隔问题上优于空间感知和长视频流基线。

City landscape in sight: A crowdsourced framework for unlocking urban-scale window view perceptions from real estate imagery Figure 1
2026-06-16cs.CV

City landscape in sight: A crowdsourced framework for unlocking urban-scale window view perceptions from real estate imagery

Chucai Peng, Sijie Yang, Ang Liu, Yang Xiang, Zhixiang Zhou, Filip Biljecki

2026-06-16视觉感知

针对城市尺度真实住宅窗景感知缺少数据与建模的问题,论文利用武汉房产平台的1.23万张真实窗景图,并通过304人两两比较构建六维感知标签,训练混合神经网络进行全城预测。结果显示窗景感知存在显著空间冷热区和楼层梯度:高层更受偏好且视野开阔,低层更安静鲜活;天空、树木和低层建筑提升偏好,高层建筑增加单调与压迫,且影响呈非线性。

Adaptive Inference-Time Scaling via Early-Step Latent Verification for Image Editing Figure 1
2026-06-16cs.CV

Adaptive Inference-Time Scaling via Early-Step Latent Verification for Image Editing

Yue Yu, Yang Jiao, Jiayu Wang, Qi Dai, Jingjing Chen

Yue Yu, Yang Jiao, and Jiayu Wang are with the College of Computer

2026-06-16视觉感知强化学习

本文针对指令式图像编辑中初始噪声随机性导致复杂编辑不稳定的问题,提出 VeriLatent:在去噪早期直接用潜空间编辑激活图评估候选噪声是否会在正确区域触发有效编辑,避免先解码再验证的成本与噪声预览误判,并按任务难度自适应分配推理预算。多基准和多基础模型实验显示其提升指令跟随与编辑质量,同时相较 Best-of-N 将 NFE 降低约 5.5–6 倍。

Enabling Real-Time Point-of-Care Ultrasound Segmentation: A GPU-Free Deployment in Resource-Limited Settings Figure 1
2026-06-16cs.CV

Enabling Real-Time Point-of-Care Ultrasound Segmentation: A GPU-Free Deployment in Resource-Limited Settings

Weihao Gao

School of Computer Science and Artificial Intelligence, Guangdong University of Education

2026-06-16视觉感知

论文针对POCUS在基层和移动场景中“超声设备便宜、AI分割却依赖昂贵GPU”的部署矛盾,将原用于息肉分割的超轻量UltraSeg系统适配到多部位超声分割。核心洞察是许多单ROI超声任务可由百万参数以下CNN完成,而非依赖大模型。实验覆盖10个公开数据集、6类解剖部位,UltraSeg-130K/500K在CPU和手机端实现实时推理,500K版本Dice可匹敌或超过UNet,并在UDIAT、DDTI零样本跨数据集测试中表现更稳健。

Label Shift Aware Adaptation for Online Zero-shot Learning with Contrastive Language-Image Pre-Training (CLIP) Figure 1
2026-06-16cs.CV

Label Shift Aware Adaptation for Online Zero-shot Learning with Contrastive Language-Image Pre-Training (CLIP)

Pengxiao Han, Changkun Ye, Yanshuo Wang, Jinguang Tong, Miaohua Zhang, Xuesong Li, Jie Hong, Lars Petersson

2026-06-16视觉感知

针对 CLIP 在线零样本识别中测试流类别分布与预训练源分布不一致导致的预测偏置,论文将任务重新表述为标签偏移下的域适应问题,提出 LSA:在不存储历史样本、不更新 CLIP 参数的条件下,用当前无标注预测动态估计目标标签先验,并重加权后验分数。实验覆盖 14 个数据集,显示其相较现有在线零样本 CLIP 方法有稳定提升,适合边缘或机器人等流式部署场景。

Variational Network with Wavelet-based UNET in Accelerated MRI Reconstruction from Under Sampled K-space Data Figure 1
2026-06-16cs.CV

Variational Network with Wavelet-based UNET in Accelerated MRI Reconstruction from Under Sampled K-space Data

Yasir Arafat Prodhan (1), Shaikh Anowarul Fattah (1) ((1) Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology, Dhaka, Bangladesh)

2026-06-16三维

针对欠采样 k-space 加速 MRI 中易产生混叠、噪声放大并丢失细节的问题,论文将变分网络的物理一致性迭代与小波 U-Net 结合,用 DWT/IDWT 替代池化,在重建细化和线圈敏感图估计中保留多尺度高低频信息。实验称在 fastMRI 膝部与 M4Raw 脑数据上达到 SOTA,并通过消融验证小波分解带来更好的伪影抑制和细节保持。

GeoStream: Toward Precise Camera Controlled Streaming Video Generation Figure 1
2026-06-16cs.CV

GeoStream: Toward Precise Camera Controlled Streaming Video Generation

Yizhou Zhao, Yifan Wang, Xiaoyuan Wang, Yushu Wu, Hao Zhang, Moayed Haji-Ali, Rameen Abdal, Ashkan Mirzaei, Yanyu Li, Willi Menapace, Laszlo Jeni, Sergey Tulyakov, Peter Wonka, Chaoyang Wang

δ Northeastern University, ρ Rice University, σ Snap Inc., Work partially done during an internship at Snap Inc. Corresponding author.

2026-06-16视觉感知规划控制

GeoStream针对视频世界模型中相机轨迹控制不准的问题:隐式姿态条件缺少几何约束,固定3D缓存又会在大视角运动后失效。其核心是用生成帧在线估深、反投影并重投影,周期性刷新3D缓存,并以学生自身输出构造条件做on-policy蒸馏,缓解自回归与几何反馈漂移。实验显示其在RealEstate10K上显著降低全局和局部相机误差,同时保持较好视觉质量。

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning Figure 1
2026-06-16cs.CV

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

David Huang, Lianlei Shan

University of Toronto, Tsinghua University

2026-06-16视觉语言强化学习

这篇论文针对多模态场景中遮挡、模糊和语义歧义导致的单一路径推理不稳、且多路径推理开销大的问题,提出 DLWM:在连续潜空间显式构造多个“世界假设”,用正交正则避免假设塌缩,并通过资源感知强化学习动态决定扩展、终止、合并或回答。实验称在多个多模态推理基准上准确率提升 2–5 个点,同时内存降低 24%,但具体增益在多大程度来自假设多样性与 RL 调度的拆分仍需看消融细节。

RefGC-SR$^2$: Reference-guided Generated Content Super-Resolution and Refinement Figure 1
2026-06-16cs.CV

RefGC-SR$^2$: Reference-guided Generated Content Super-Resolution and Refinement

Jeahun Sung, Dahyeon Kye, Soo Ye Kim, Jihyong Oh

CMLab, Chung-Ang University

2026-06-16视觉感知

本文针对参考引导生成中高分辨率参考图被降采样、输出又含身份失真和纹理缺失的问题,提出 RefGC-SR² 这一后处理任务:同时做超分和生成伪影修复。核心创新是构建 LRGI-HRRI-HRGT 三元组数据,并用双图条件生成器合成对齐低质样本,结合频率感知 DiT、LoRA 专家和频域损失注入参考细节。实验显示其较 RefGCR、RefSR 基线能更好保持身份并恢复高频细节。

HiRo: A Compact Four-Directional Hierarchical Reservoir Token-Mixer for Efficient Image Classification Figure 1
2026-06-16cs.CV

HiRo: A Compact Four-Directional Hierarchical Reservoir Token-Mixer for Efficient Image Classification

Md Farhadul Islam, Ishan Thakkar, J. Todd Hastings

University of Kentucky, University of Kentucky Lexington USA

2026-06-16视觉感知

为降低视觉分类中可训练 token-mixer 的参数与计算开销,HiRo 将图像补丁保留为二维网格,在常规/移位窗口内做四方向扫描,并用两级固定 reservoir 加轻量可训练读出混合局部与跨窗口信息。实验称其在少于 100 万可训练参数下,MNIST、CIFAR-10、CIFAR-100 准确率分别达 99.46%、85.57%、59.10%,但更大规模数据上的泛化仍文中未充分说明。

MotionVLA: Vision-Language-Action Model for Humanoid Motion Figure 1
2026-06-16cs.CV

MotionVLA: Vision-Language-Action Model for Humanoid Motion

Nonghai Zhang, Siyu Zhai, Yanjun Li, Zeyu Zhang, Zhihan Yin, Yandong Guo, Boxin Shi, Hao Tang

School of Computer Science, Peking University

2026-06-16机器人视觉语言视觉感知

面向场景图像与文本驱动的人形动作生成,论文指出单一运动码本会让低频姿态主导量化,削弱高频速度/接触动态,导致漂移和脚滑。其核心是 DSFT 双流频域 tokenizer,将 Base 姿态语义与 Phys 物理动态分别经 DCT 截断和 BPE 压缩,再由 Qwen3.5 自回归先生成 Base 后生成 Phys。HumanML3D 上 Diversity 与真实数据差距缩小超 50%,MBench 的条件一致性提升 3.8%,脚滑略降。

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings Figure 1
2026-06-16cs.CV

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

University of Illinois Urbana-Champaign

2026-06-16优化算法

论文针对深度度量学习只用同/异类标量监督、难以捕捉细粒度属性差异的问题,提出 SAGA:用冻结 MLLM 比较图像对并通过 GRPO 将正确判别转化为属性级梯度,同时蒸馏其注意力到池化器,推理时仍只保留视觉编码器。在 CUB、Cars、Aircraft、iNat-Aves 零样本检索上,Recall@1 较最强基线提升约 3–6 个百分点。

DragMesh-2: Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects Figure 1
2026-06-16cs.RO

DragMesh-2: Physically Plausible Dexterous Hand-Object Interaction with Articulated Objects

Tianshan Zhang, Yijia Duan, Yanjun Li, Zeyu Zhang, Hao Tang

School of Computer Science, Peking University

2026-06-16视觉感知

本文针对灵巧手操作抽屉、门把等铰接物体时,仅靠几何轨迹或固定动力学强化学习难以维持真实接触、且负载变化会导致策略失效的问题,提出 DragMesh-2,将目标关节运动限制为只能由手—把手物理接触产生,并用 PICA 注入接触保持、脱离风险、动作饱和、阻尼随机化与时序接触响应等信号。在 7 个 GAPartNet 物体和多种阻尼条件下,该方法相比基线在负载变化下更稳健,同时保持较高任务成功率。

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining Figure 1
2026-06-16cs.CV

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

Zhuo Deng, Ruiheng Zhang, Ziheng Zhang, Weihao Gao, Yitong Li, Qian Wang, Lei Shao, Jiaoyue Dong, Zhixi Zeng, Lijian Fang, Haibo Wang, Xiaobin Lin, Tao Liu, Zhicheng Du, Zhengwei Zhang, Lin Yang, Zheng Gong, Xinyu Zhao, Zhenquan Wu, Fang Li, Zhiguang Zhou, Guoming Zhang, Sun Jing, Han Lv, Wenbin We, Lan Ma

2026-06-16视觉感知

EyeMVP针对眼底照相便宜易用但缺少OCT深度结构信息的问题,用同眼同日CFP-OCT大规模配对数据做跨模态掩码重建预训练,并以源约束交叉注意力和CFP结构掩码缓解两种成像几何不对齐;推理时只需CFP。在16项分类、分割、少样本和检索任务上优于多种视网膜基础模型,黄斑水肿AUROC达0.948、近视黄斑劈裂0.825,但部分增益可能来自配对数据规模和数据优势,架构独立贡献仍需数据匹配验证。

Multi-view feature High-order Fusion for Space Weak Object Detection and Segmentation Figure 1
2026-06-16cs.CV

Multi-view feature High-order Fusion for Space Weak Object Detection and Segmentation

Weilong Guo, Yuhan Sun, Shengyang Li

and Key Laboratory of Space Utilization, Chinese Academy of Sciences, Beijing 100094, China.

2026-06-16视觉感知

面向空间科学与遥感图像中尺度小、对比度低、外观信息有限的弱目标,论文将单幅图像的空间、通道、频率注意力视作多视角特征,提出可插拔的高阶融合模块 MHF,并用递归任务贡献门控选择减少冗余、保留互补信息。在两个自建空间科学数据集和一个卫星视频数据集上,MHF 接入 21 种检测/分割模型均带来提升,并报告达到三数据集两类任务的 SOTA。

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection Figure 1
2026-06-16cs.MM

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee

is available. Furthermore, our model’s architecture and training, Department of Computer Engineering, Sharif University of Technology., Finally, a decision-making module integrates the predictions to determine the final label.

2026-06-16视觉感知

针对音视频 Deepfake 检测在跨数据域时性能明显下降、且现实中可能缺失单一模态的问题,论文提出 EAV-DFD:将音频、视觉和音视频交互子网络集成,并用教师-学生框架以少量新域样本做域适配,同时保留旧域知识和模态级可解释输出。在 FakeAVCeleb 训练、DFDC/Deepfake TIMIT/PolyGlotFake 测试中,AUC 分别提升 4.09%、17.94% 和 0.5%。

Learn Temporal Consistency For Robust Satellite Video Detector Figure 1
2026-06-16cs.CV

Learn Temporal Consistency For Robust Satellite Video Detector

Weilong Guo, Shengyang Li, Yanfeng Gu

and Key Laboratory of Space Utilization, Chinese Academy of Sciences, Beijing 100094, China., Shengyang Li is also with the University of Chinese Academy of Sciences, Beijing 100049, China

2026-06-16视觉感知安全鲁棒

针对卫星视频中现有方法多只检测少数运动粗类别、使用水平框且忽略跨帧一致性的问题,论文提出面向任意方向细粒度目标的TCL框架,通过时序细粒度特征聚合、结构编码和时序一致性约束联合利用邻帧上下文与外观/结构信息。在SAT-MTB上达到47.7% mAP,较基线提升4.8%,并可增强已有图像检测器。

Physics-Driven Zero-Shot MRI Reconstruction with Non-local Image Priors Figure 1
2026-06-16cs.CV

Physics-Driven Zero-Shot MRI Reconstruction with Non-local Image Priors

Lingtong Zhang, Wenlei Li, Mu He, Li Xiao, Yang Ji

2026-06-16视觉感知三维

针对单次欠采样 MRI 零样本自监督重建中监督稀缺、训练易过拟合和伪影不稳定的问题,论文将物理一致性与图像非局部先验结合:用 CSM 引导动态仓库筛选可靠 k 空间点,加入 SPIRiT 自一致正则,并构建 NSS Pixel Bank 挖掘解剖相似性以扩充监督。FastMRI 实验显示其在高加速因子下优于现有零样本方法,并缩小与监督重建的差距。

Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space Figure 1
2026-06-16cs.CV

Text-Driven Fusion for Infrared and Visible Images: Achieving Image Scene Adaptation on Hyperbolic Space

Huan Kang, Hui Li, Tianyang Xu, Tao Zhou, Xiao-Jun Wu, Josef Kittler

2026-06-16视觉感知

针对红外-可见光融合中欧氏空间难以表达跨模态语义层级、易造成细节失真和场景适应不足的问题,TEDFusion在训练阶段用BLIP生成文本作为双曲空间锚点,引导属性与视觉特征按粗到细语义对齐,并设计双曲损失;推理时无需文本,依靠学到的文本-属性先验自适应融合。文中称其在基准数据集上优于现有方法,但具体增益来源仍需结合消融进一步判断。

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models Figure 1
2026-06-16cs.CV

Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models

Dianqiao Lei, Lianlei Shan

2026-06-16视觉语言视觉感知强化学习

针对显式 CoT 推理在 VLA 机器人决策中带来的高延迟和多步误差累积,论文提出 AVA-VLA,将推理改为连续潜变量演化,并用强化学习按任务奖励对潜在轨迹去噪、对齐目标;同时通过置信度门控早退,在简单场景提前行动。实验称其相较显式 CoT 推理提速约 6 倍,并在 LIBERO 上达到 98.3% 平均成功率,但具体增益来源仍需结合完整实验细节判断。

Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery Figure 1
2026-06-16cs.CV

Texture-Shape Bias Balancing for Robust Synthetic-to-Real Semantic Segmentation in Automotive NIR Imagery

Felix Stillger, Ben Hamscher, Lukas Hahn, Annika Mütze, Tobias Meisen, Kira Maag

2026-06-16视觉感知安全鲁棒

面向车载近红外语义分割中真实标注稀缺、合成到真实域差距大的问题,论文提出生成式增强框架:用少量真实 NIR 图像通过 LoRA 微调潜扩散模型做目标风格适配,并结合保持几何的 Voronoi 风格多样化来平衡纹理/形状偏置。多架构、车内与街景实验显示,该策略提升跨域鲁棒性,外部场景最多缩小 63.6% 域差,车内最多缩小 28.4%。

Bridging Geographic Bias in Urban Streetscape Inference via Lifelong Learning with Visual-Semantic Pivoting Figure 1
2026-06-16cs.CV

Bridging Geographic Bias in Urban Streetscape Inference via Lifelong Learning with Visual-Semantic Pivoting

Xinze Zhang

University of Southern California, Los Angeles, CA 90007, USA

2026-06-16视觉感知

论文关注街景感知模型在少数大城市训练后迁移到欠代表地区时产生的地理偏差。作者提出 HVSP-LL,将宏观结构、中观组成、微观元素的视觉-语义锚点与公平感知的终身学习回放结合,以顺序吸收新城市并约束区域差距。在 12 城市全景数据上,Spearman 达 0.834,较最强持续学习基线提升 6.1 点,城际感知差距降至 0.094。

Gaussian Spatial Priors for Anatomy-Aware Object Detection in Surgical Videos Figure 1
2026-06-16cs.CV

Gaussian Spatial Priors for Anatomy-Aware Object Detection in Surgical Videos

Yunfan Li, Artem Shmelev, Himanshu Gupta

2026-06-16视觉感知三维

面向腹股沟疝修补术中CVMPO安全评估,论文关注小而易遮挡、外观不稳定的解剖结构检测难题。核心做法是在DAB-DETR中加入无需学习参数的高斯空间先验,用训练标注估计锚点结构与依赖结构的相对位置分布,并将其作为解码器自注意力偏置。5折实验显示,依赖类AP50较DAB-DETR提升33.5%,较YOLOv26提升53.9%,锚点类也提升6.0%。

Temporal Difference Learning for Diffusion Models Figure 1
2026-06-16cs.LG

Temporal Difference Learning for Diffusion Models

Qizhen Ying, Yangchen Pan, Victor Adrian Prisacariu, Junfeng Wen

2026-06-16生成模型

本文针对扩散模型常用单时刻去噪损失缺乏跨时间一致性、在少步采样时误差易累积的问题,将反向去噪过程重写为马尔可夫奖励过程,把去噪视作策略评估,并引入TD正则来约束不同噪声层级的后验均值漂移与真实扩散漂移一致,同时用样本级重加权稳定训练。实验显示该方法可作为现有扩散/一致性训练的附加目标降低FID,且在低NFE少步生成场景收益更明显。

ReportQA: QA-Based Radiology Report Evaluation Figure 1
2026-06-16cs.CL

ReportQA: QA-Based Radiology Report Evaluation

Yiming Shi, Shaoshuai Yang, Xi Chen, Haolin Li, Hengyu Zhang, Che Jiang, Kaiwen Wang, Xun Zhu, Dong Xie, Fei Wang, Dejing Dou, Miao Li, Ji Wu

Department of Electronic Engineering, Tsinghua University, College of AI, Tsinghua University, Beijing National Research Center for Information Science and Technology

2026-06-16数据集/基准

针对放射报告生成评估中 BLEU 等文本重合指标临床相关性弱、CE 指标实体覆盖窄且难扩展的问题,ReportQA 将报告视为临床问答上下文:由放射科知识树和 LLM 抽取结构化实体/属性,再生成并过滤 QA,用回答准确率形成 QAScore。实验显示 QAScore 比既有指标更贴近放射科医生判断,并揭示现有报告式推理难捕捉细粒度临床信息且有负例先验偏置,问题驱动推理更有效。

Towards Global AI-Driven Cervical Cancer Screening Figure 1
2026-06-16cs.CV

Towards Global AI-Driven Cervical Cancer Screening

Thuy Nuong Tran, Ömer Sümer, Evangelia Christodoulou, Lennart Nauschütte, Simon Kalteis, Martin Paulikat, Esmira Pashayeva, Klara Steinheuer, Isabella Borges, Piotr Kalinowski, Hermann Bussmann, Sieng Sokmney, Poeung Kuong, Sathiarany Vong, Achim Schneider, Magnus von Knebel-Doeberitz, Patrick Godau, Lena Maier-Hein

2026-06-16视觉感知

针对低中收入地区宫颈癌筛查中专家与活检资源不足、既有AI多局限于单国私有数据的问题,本文将阴道镜醋酸染色图像的CIN1-与CIN2+判别建模为分类与病灶分割联合的多任务学习,并结合强数据增强与跨国验证。模型在同分布测试中平衡准确率高于医生(0.68 vs 0.64),在四国外部数据上优于基线,但AUC仅0.54–0.80且受合并症等因素显著影响,泛化仍是主要瓶颈。

NEXUS: Neural Energy Fields for Physically Consistent Contact-Rich 3D Object Dynamics Figure 1
2026-06-16cs.CV

NEXUS: Neural Energy Fields for Physically Consistent Contact-Rich 3D Object Dynamics

Qizhen Ying, Guangming Wang, Yangchen Pan, Victor Adrian Prisacariu, Yixiong Jing

Department of Engineering Science, University of Oxford, Department of Engineering, University of Cambridge

2026-06-16三维

针对视频生成和机器人规划中接触、形变与外力作用下3D物体轨迹易漂浮、穿透或长期能量漂移的问题,NEXUS将物体表示为结构图并动态构建接触图,用可加能量项和Rayleigh式耗散统一建模保守/非保守效应,通过求导得到力并半隐式积分。实验显示其在不同材料与物理组合的长时预测中优于学习式和物理结构基线,并能提升轨迹引导视频的物理合理性。

Polyp-D2ATL: Deep Domain-Adaptive Transfer Learning for Colorectal Polyp Classification under Label Distribution Shift Figure 1
2026-06-16eess.IV

Polyp-D2ATL: Deep Domain-Adaptive Transfer Learning for Colorectal Polyp Classification under Label Distribution Shift

Sajad Jabarzadeh Ghandilu, Maryam Sadat Hosseini Azad, Shahriar Baradaran Shokouhi, Emad Fatemizadeh

under Label Distribution Shift, School of Electrical Engineering, Sharif University of Technology, Tehran, Iran, School of Electrical Engineering, Iran University of Science and Technology, handle imbalanced data, label distribution shift, and cross-modality gen-, with label distribution shift (i.e., different class distributions between train/val, crimination across visually similar polyp subtypes under label distribution, alpha and label smoothing, combined with MixUp augmentation. Further-

2026-06-16视觉感知

本文针对结直肠息肉 NICE 三分类在真实内镜数据中面临的类别极不均衡、训练/测试标签分布偏移及 NBI/WLI 跨模态差异问题,提出 Polyp-D2ATL:以经息肉分割数据预训练的 Res2Net-50 为骨干,结合注意力多尺度融合、GeM 池化、两阶段微调、Focal Loss、MixUp 与批归一化策略。在 PICCOLO 验证集上达到 82.38% 准确率、77.49% Macro-F1 和 87.47% 特异性,并在保留测试集较现有方法保持提升。

ReGenHuman: Re-Generating Human Appearances for Realistic Full-Body Video Anonymization Figure 1
2026-06-16cs.CV

ReGenHuman: Re-Generating Human Appearances for Realistic Full-Body Video Anonymization

Adam Sun, Eshaan Barkataki, Arnold Milstein, Gordon Wetzstein, Ehsan Adeli

Stanford University, Stanford, CA, USA

2026-06-16视觉感知

面向医院、课堂等难以公开的人体视频数据,论文指出传统打码/编辑会牺牲真实性、时序一致性或隐私覆盖。ReGenHuman改为“重生成而非编辑”:从姿态、分割、单目深度等无身份结构信号构造StructAll/StructHuman,并微调视频到视频扩散模型生成全身外观,避免原始人体像素进入输出。实验按隐私、质量和下游VQA效用评测,显示其相对现有匿名化方法取得更好的三者权衡;但仍有生成较慢、步态/轮廓可能泄露等限制。

Multi-Modal Attention for Automated Disaster Damage Assessment Using Remote Sensing Imagery and Deep Learning Figure 1
2026-06-16cs.CV

Multi-Modal Attention for Automated Disaster Damage Assessment Using Remote Sensing Imagery and Deep Learning

Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-Beni

Built Environment Department, College of Science and Technology, North Carolina A&T State University, Greensboro, NC, USA, United Nations University Institute for Water, Environment and Health

2026-06-16视觉感知

针对灾后建筑损毁评估依赖人工或单时相遥感、速度慢且难区分细粒度损伤的问题,论文用灾前/灾后卫星图像构建双时相框架,以ConvNeXT-Tiny提特征并通过跨注意力/变化token融合结构变化信息,进行四级损毁分类。在大规模灾害数据上总体准确率94.90%,无损和毁坏类表现较强,但重大与轻微损伤仍易混淆。

MVEB: Massive Video Embedding Benchmark Figure 1
2026-06-16cs.CV

MVEB: Massive Video Embedding Benchmark

Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michelle Yang, Márton Kardos, Niklas Muennighoff, Kenneth Enevoldsen

Harvard University, 2SaluteDevices, 3MIRAI, 4Zendesk, 5Shanghai University of Finance and Economics, Google LLC, 7Salesforce, 8Cornell University, 9Astera Institute, 10Independent Contributor, Indian Institute of Technology, Kharagpur, 12Barclays, 13Aarhus University, 14Stanford University, (labels produced from both modalities) and hurts, on V-grounded ones (labels produced from visu-

2026-06-16视觉感知数据集/基准

现有视频表征评测多聚焦单一能力,难以判断通用嵌入质量。MVEB从184个任务中裁剪出23项,覆盖分类、检索、聚类、问答等,并区分视频、文本-视频和音视频输入。评测33个模型显示无模型通吃:适配过的MLLM擅长分类/QA,多模态绑定擅长检索/零样本;未做对比嵌入适配的生成式MLLM跨模态显著失效。音频收益取决于标注来源,视觉标注任务中反而有害。

Learning Sparse Latent Predictive Foundation Model for Multimodal Neuroimaging Figure 1
2026-06-16cs.CV

Learning Sparse Latent Predictive Foundation Model for Multimodal Neuroimaging

Haoxu Huang, Long Chen, Jingyun Chen, Jinu Hyun, James Ryan Loftus, Kara Melmed, Daniel Orringer, Jennifer Frontera, Seena Dehkharghani, Arjun Masurkar, Narges Razavian

New York University, Center for Data Science, New York, NY, 10001, USA, NYU Grossman School of Medicine, Department of Radiology, New York, NY, 10016, USA, State University of New York at Binghamton, School of Computing, Binghamton, NY 13902, USA, NYU Grossman School of Medicine, Department of Neurology, New York, NY, 10016, USA, NYU Grossman School of Medicine, Department of Neurosurgery , New York, NY, 10016, USA, NYU Grossman School of Medicine, Department of Pathology, New York, NY, 10016, USA, School of Medicine, Department of Radiology, Stanford, CA, 94305, USA, NYU Grossman School of Medicine, Department of Neuroscience, New York, NY, 10016, USA, NYU Grossman School of Medicine, Neuroscience Institute, New York, NY, 10016, USA

2026-06-16视觉语言

针对临床脑 MRI 多序列(T1w、T2w、FLAIR)互补但现有模型多按单序列学习、难以统一表征的问题,本文提出 Neuro-JEPA,将 JEPA 潜变量预测目标与 MoE 稀疏 ViT 结合,并系统比较掩码、目标和稀疏化设计。在约155万次扫描预训练后,模型在3个医疗系统和12个公开数据集的47项任务上较现有神经影像基础模型及简单 CNN 基线表现更稳定、更强,但部分增益可能主要来自 scaling / data。

FlexPooling with Simple Auxiliary Classifiers in Deep Networks Figure 1
2026-06-16cs.CV

FlexPooling with Simple Auxiliary Classifiers in Deep Networks

Muhammad Ali, Omar Alsuwaidi, Salman Khan (Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE)

Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE

2026-06-16视觉感知

本文针对 CNN 中全局平均/最大池化不可学习、在有损下采样中可能丢失判别信息的问题,提出 FlexPooling:为每个特征图学习可端到端优化的加权平均池化,并结合简单辅助分类器 SAC 强化中间监督。实验在多种图像分类数据集和不同 ResNet 规模上,相比标准池化基线提升约 1–3% 准确率;但文中展示重点偏分类任务,增益来源中 FlexPooling 与 SAC 的相对贡献仍需进一步拆分验证。

Mask Proposal Voting Based on Geodesic Framework for Robust Image Segmentation Figure 1
2026-06-16cs.CV

Mask Proposal Voting Based on Geodesic Framework for Robust Image Segmentation

Li Liu, Mingzhu Wang, Zhenjiang Li, Da Chen, Laurent D. Cohen

2026-06-16视觉感知安全鲁棒

针对最短路径/测地线分割在杂乱背景、强度不均和弱边界下高度依赖初始化的问题,论文提出 Mask Proposal Voting:用受约束自适应域切生成多样的 min-cut Randers 掩码候选,再按先验加权投票形成分割得分图。实验显示该方法较现有测地线路径投票和 min-cut Randers 模型在精度与鲁棒性上更稳定,尤其能减少漏分割和边界偏移。

Deep Learning in Seismic Interpretation: Federated Advances in Salt Dome Segmentation Figure 1
2026-06-16cs.CV

Deep Learning in Seismic Interpretation: Federated Advances in Salt Dome Segmentation

Muhammad Zain Mehdi, Muhammad Zaid, Owais Aleem

2026-06-16视觉感知

面向地震盐丘分割中标注稀缺、企业数据不能集中共享及跨盆地分布差异导致泛化差的问题,论文提出 FedSaltNet:以轻量 Small U-Net 作为联邦骨干,并用按盐体前景像素数加权的 FG-WEIGHTED 聚合缓解类别不平衡和非 IID。四个数据集模拟客户端实验显示,该聚合较最佳常规 FL 的 IoU 相对提升 4.0%,Small U-Net 平均 IoU 还比 ResNet-18 U-Net 高 166%,说明受限联邦场景下模型简化比增大容量更有效。

Improved Knowledge Distillation for Land-Use Image Classification Figure 1
2026-06-16cs.CV

Improved Knowledge Distillation for Land-Use Image Classification

Arundhuti Sur, Abhiroop Chatterjee, Susmita Ghosh, Emmett Ientilucci

Jadavpur University, India, Rochester Institute of Technology, USA, truth labels with a soft supervision strategy that combines, predicted class label but also a confidence distribution, student only on hard labels (ground truth), we also train, labels measuring the discrepancy between, student predictions and ground truth labels., Let y denote the ground truth label, zt and zs represent, with respect to true labels using the categorical cross-, where yc denotes the ground truth label for class c

2026-06-16视觉感知

针对遥感土地利用分类中高精度 CNN/Transformer 计算与存储开销大的问题,本文用 VGG16 教师蒸馏 MobileNetV2 学生,并将真实标签交叉熵、温度化 KL 散度与归一化 logit 的余弦相似损失结合,以同时传递类别概率关系和表示几何。实验在三个土地利用数据集上报告最高 99.04% 准确率,优于直接训练学生和单一蒸馏损失,同时保留轻量化压缩效果。

Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective Figure 1
2026-06-16cs.CV

Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective

Salimeh Sekeh, Mary Wisell

San Diego State University

2026-06-16视觉语言视觉感知

针对连续微调视觉语言模型时新任务适应与旧知识遗忘的矛盾,本文从理论上刻画跨环境的图像—文本贡献:用冻结前向即可计算的跨/同模态余弦贡献分数解释损失漂移、梯度对齐与遗忘界。实验在 COCO、CUB 和三种 CLIP 骨干上验证,贡献引导的任务排序在 COCO 上最高将遗忘差异拉开 1.74×,并提升 OOD AUROC;但其判别力依赖环境间跨模态差异,CUB 上增益较小。

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy Figure 1
2026-06-16cs.RO

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami

Control/Robotics Research Laboratory (CRRL), Department of Electrical and Computer Engineering, NYU Tandon School of Engineering, Brooklyn, NY, 11201.

2026-06-16生成模型强化学习

针对单目相机等传感受限机器人难以构建可靠占据地图、且探索缺少专家数据的问题,VANDERER在推理阶段用视觉好奇心模块引导预训练扩散策略:先用导航世界模型预测候选动作的未来观测,再以与历史观测的差异度作为好奇心代价推动采样走向新区域。仿真户外环境中,其平均探索面积比NoMaD高13.4%,并显示视觉新颖性与几何探索收益存在相关性。

An Ensemble Deep Learning Approach for Reliable and Scalable Lemon Leaf Disease Classification Figure 1
2026-06-16cs.CV

An Ensemble Deep Learning Approach for Reliable and Scalable Lemon Leaf Disease Classification

Shayan Abrar, Sudeepta Mandal, Abdul Awal Yasir, Sonjoy Bhattacharjee, Sadman Haque Bhuiyan, Samanta Ghosh, Rafi Ahamed

and Scalable Lemon Leaf Disease Classification, American International University-Bangladesh, East West University, North South University, complex. It needs more labor, and the prediction might not be, the real world depends on various things like the availability

2026-06-16视觉感知

针对柠檬叶病害人工识别费时且难以规模化的问题,论文在1354张、9类Kaggle图像上比较InceptionV3与MobileNetV2,并用二者集成、对抗训练和Grad-CAM提升鲁棒性与可解释性。集成模型测试准确率达99.27%,高于单模型和若干既有工作;但数据集较小且类别不均衡,真实田间泛化增益来源仍需进一步验证。

Multi-HMR 2: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking Figure 1
2026-06-16cs.CV

Multi-HMR 2: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking

Guénolé Fiche, Philippe Weinzaepfel, Romain Brégier, Fabien Baradel

2026-06-16视觉感知

这篇论文针对多人 HMR 在真实人机交互/场景理解中常被忽略的相机坐标系检测与度量 3D 定位问题,提出基于 DETR 的 Multi-HMR 2:联合预测人体网格、3D 位置与相机内参,引入覆盖儿童到成人的 Anny 身体模型,并用 2D 位置匹配降低训练成本;同时蒸馏 SAM2 记忆特征实现无需视频监督的在线跟踪。实验显示其在常规 HMR、近距离交互、重投影关键点和 PoseTrack 跟踪上达到或接近 SOTA,尤其提升检测与相机空间定位精度。

Leptomeningeal Collateral Detection on DSA via Vessel-Graph Neural Networks Figure 1
2026-06-16eess.IV

Leptomeningeal Collateral Detection on DSA via Vessel-Graph Neural Networks

Junyong Cao, Hakim Baazaoui, Chinmay Prabhakar, Suprosanna Shit, Lukas Bastian Otto, Susanne Wegener, Bjoern Menze, Ezequiel de la Rosa

University of Zurich, Zurich, Switzerland, University Hospital Zurich, Zurich, Switzerland, Code available at, complexity, limited data availability and the absence of structured vascular rep-

2026-06-16视觉感知

针对急性缺血性卒中侧支循环评估依赖CTA粗粒度评分、DSA人工判读主观性强的问题,论文将DSA血管分割转为血管段图,把软脑膜侧支检测建模为节点分类,并融合拓扑GNN分支与像素分支。在73例、136帧五折验证中,融合模型PR-AUC为0.434,高于图分支0.403和像素分支0.362,但仍受小样本、单中心和预选帧限制。

S23DR 2026: End-to-End 3D Wireframe Prediction via DETR-Style Set Prediction with Contrastive Denoising Figure 1
2026-06-16cs.CV

S23DR 2026: End-to-End 3D Wireframe Prediction via DETR-Style Set Prediction with Contrastive Denoising

Nitiz Khanal

2026-06-16三维

针对 S23DR 2026 中从稀疏多视角 COLMAP 点云恢复建筑屋顶三维线框、传统两阶段顶点再连边易受误差传播和边精度瓶颈影响的问题,论文将线框直接表述为边坐标集合预测。WireframeDETR 用 DETR 式 Hungarian 匹配回归 6D 边端点,并加入对比去噪查询、多尺度编码器记忆和递进辅助损失以稳定早期训练。模型在公开测试集达到 HSS 0.575(F1 0.664、IoU 0.516),清洗验证集最佳 HSS 0.534。

Explainable Task-Oriented Token Communication for AI-Native 6G Networks Figure 1
2026-06-16eess.IV

Explainable Task-Oriented Token Communication for AI-Native 6G Networks

Feibo Jiang, Lei Mao, Li Dong, Kezhi Wang, Cunhua Pan, Jiangzhou Wang

oriented Token representation, inadequate collaboration between, ) Inadequate Collaboration Between Visual Tokens and, be obtained separately, establishing an effective collaborative, paradigm centered on task completion. Its basic idea is not to

2026-06-16视觉感知

面向6G中由保真传图转向任务驱动图像通信的需求,论文指出现有方法难以同时组织任务相关Token、协同视觉证据与任务意图,并解释决策依据。其核心是ET-TokenCom:用视觉Token保留低层证据、用基础模型生成任务Token,再以跨模态注意力引导选择和加权传输,并在接收端用热力图解释关键区域。仿真显示任务有效性和信道鲁棒性提升,但具体增益幅度与来源文中未充分说明。

HSQ-VLM: A Novel Spatially-Constrained Quadrant Segmentation VLM Model for Explainability in Diabetic Retinopathy Figure 1
2026-06-16cs.CV

HSQ-VLM: A Novel Spatially-Constrained Quadrant Segmentation VLM Model for Explainability in Diabetic Retinopathy

Shivum Telang

2026-06-16视觉语言视觉感知

本文针对糖尿病视网膜病变 AI 诊断难以解释、病灶象限计数与解剖位置不一致的问题,提出以黄斑中心坐标系为锚的 HSQ-VLM:结合动态解剖对齐、笛卡尔交叉注意力、软性四象限拓扑划分和一致性损失,将分割结果转为可量化自然语言报告。在 3500 张眼底图上,出血和微动脉瘤敏感性分别达 99.6% 和 96.4%,边界归因错误降至 1.8% 以下;但数据来源与标注细节文中未充分说明。

Position: The Systemic Lack of Agency in Visual Reasoning Figure 1
2026-06-16cs.CV

Position: The Systemic Lack of Agency in Visual Reasoning

Yizhao Huang, Haoyang Chen, Shiqin Wang, Pohsun Huang, Jiayuan Li, Haoyuan Du, Yandong Shi, Zheng Wang, Zhixiang Wang

2026-06-16视觉感知

本文针对现有视觉语言模型在真实场景中依赖显式提示、缺少主动寻找隐含证据的问题,提出“视觉隐式推理缺陷”这一诊断视角,并构建 V-IRD 基准,通过 Target-Exclusive Prompting 强制模型在无语言线索下自主发现参考物和物理线索。实验显示,主流 VLM 虽具备较强识别与检索能力,但在隐式设置下准确率显著下降,说明语义识别并不等同于主动视觉探索。

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model Figure 1
2026-06-16cs.CV

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji

2026-06-16生成模型

论文针对多模态交错推理中,AR 统一模型即使只需局部视觉修改也要重生成整幅图像、导致 RL rollout 成本高的问题,提出 LocFac-RL:用离散扩散模型做局部视觉编辑,并将文本与视觉片段的奖励因子化分配以减少跨模态干扰。实验显示局部编辑可降低 GRPO 视觉 rollout 计算约 26.9%,因子化奖励较联合奖励提升 11.2%,相对基座平均提升 38.04%。

Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs Figure 1
2026-06-16cs.CV

Vision-Encoder Behavioral Fingerprints of Image-to-Image Generative Models: A Training-Paradigm-Driven Taxonomy of Six Commercial APIs

Hunter Hill

image is available, while image-to-image attribution requires a different methodology because a clean, center-crop and JPEG robustness via wavelet-perturbation consistency. We use DINOv2 cosine distance, differs in two respects: we attribute image-to-image outputs where a clean reference is available by

2026-06-16视觉感知生成模型

针对商用图像到图像模型黑盒、传统盲检测难以归因近似保真编辑的问题,论文用保留的干净参考图与DINOv2 token距离构建行为指纹。核心洞察是六个API按训练范式而非架构分成“紧贴输入”的编辑训练带与“漂移”的T2I采样适配带。3,588次调用中,AI身份解释69.5%方差,六类归因51.4%显著高于随机和盲基线;扰动在Gemini约98%、Flux约80%保留,在gpt-image-1中被覆盖。

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification Figure 1
2026-06-16cs.MM

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for, National University of Singapore, School of Computing, Scalable Inference, Sarkar, and Kun Xu. 2026. MatchLM2Lite: A Scalable MLLM-to-Lite Frame-, & student trained separately with GT labels. Stage 2 - Freeze teacher, using labeled data. In the second stage, MatchLM is frozen and, based content moderation demands significant human labor [5]

2026-06-16视觉感知

短视频平台需要在推荐链路中低延迟识别搬运、裁剪或轻度编辑的复刻内容,而单纯视觉相似度容易漏掉音频与文本线索。MatchLM2Lite将复刻识别建模为视频对的视觉-音频-文本匹配,用MLLM教师MatchLM学习强跨模态判别,再蒸馏到轻量MatchLite部署。相较旧生产模型,MatchLM F1提升8.57,MatchLite仍提升6.55且计算成本降35倍;线上复刻视频观看率下降2.5%,端到端延迟低于30秒。

The Vision Encoder as a Privacy Boundary: Visual-Token Side Channels in Encoder-Free Vision-Language Models Figure 1
2026-06-16cs.CV

The Vision Encoder as a Privacy Boundary: Visual-Token Side Channels in Encoder-Free Vision-Language Models

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

School of Engineering, Institute of Science Tokyo, College of Control Science and Engineering, Zhejiang University, Department of Electrical and Computer Engineering, National University of Singapore, School of Engineering, Institute of Science Tokyo Tokyo Japan, College of Control Science and Engineering, Zhejiang University Hangzhou China, Department of Electrical and Computer Engineering, National University of Singapore Singapore Singapore

2026-06-16视觉语言视觉感知学习理论

论文关注 VLM 部署中常被忽视的中间视觉 token 隐私风险:输出过滤前,缓存、日志或分布式推理已可能暴露图像内容。核心洞察是视觉编码器本身构成隐私边界,去编码器架构的高空间采样视觉 token 会形成侧信道。实验显示 Gemma4、Fuyu 可从 token/KV cache 重建结构并读出访问码,而 Qwen3-VL、InternVL、LLaVA 基本无法精确恢复;泄漏由字符方向采样密度而非 token 数决定,噪声和量化难以防御,需降低空间采样或严格保护中间状态。

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression Figure 1
2026-06-16cs.CV

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

Zhejiang Laboratory, The Chinese University of Hong Kong, National University of Singapore

2026-06-16视觉语言学习理论

针对多模态长视觉上下文导致 KV cache 膨胀、激进压缩易丢失关键视觉证据的问题,论文指出常用观察窗口平均注意力会稀释稀疏证据,而最后一个 prompt query 能补回边界处答案相关信号但噪声较多。BACON 以窗口注意力为稳定基线,用最后查询注意力校准,并通过层内局部一致性和跨层持续性过滤孤立噪声。实验覆盖多任务、模型、预算和压缩方法,在最激进预算下平均提升 7.5%,最高 30.9%,且称不增加额外推理成本。

Variational Deep Unfolding with Mamba-Based Nonlocal Modeling for Underwater Image Enhancement Figure 1
2026-06-16cs.CV

Variational Deep Unfolding with Mamba-Based Nonlocal Modeling for Underwater Image Enhancement

Daniel Torres, Julia Navarro, Catalina Sbert, Joan Duran

2026-06-16视觉感知

面向水下机器人与海洋观测中低能见度、偏色和噪声导致的视觉感知退化,论文将去雾型变分模型展开为可学习网络,引入乘性残差吸收伪影、非局部梯度约束保边,并用 Mamba 建模长程自相似,配合近端轨迹损失约束各展开阶段。作者还证明变分问题解存在;在 UIEB、SUIM-E 上报告视觉质量提升、定量指标相对近期方法具竞争力。

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories Figure 1
2026-06-16cs.CV

YTClickbait21K: Human-Annotated Multimodal Dataset for YouTube Clickbait Detection Across Diverse Channels and Content Categories

Md. Minhazul Islam, Md. Tanbeer Jubaer, Amith Khandakar, Shovon Sarker, Sumaiya Rahman, Md. Masum Mia, Mohamed Arselene Ayari, Hamed Noori

Department of Computer Science and Engineering, Rajshahi University of Engineering & Technology, Rajshahi, Department of Electrical Engineering, Qatar University, Doha, Qatar, Department of Civil and Environmental Engineering, Qatar University, Doha, Qatar, SenseNet Inc., Ontario, Canada, Department of Electrical Engineering, Qatar University, comprehensive multimodal analysis. To ensure annotation quality, every video was independently labeled by three, with final labels determined through majority voting. The dataset exhibits substantial inter-annotator agreement (κ ≈ 0.65), confirming reliable labeling despite the inherent subjectivity of clickbait detection. By combining scale, annotation rigor, 912 non-clickbait) using semi-supervised pseudo-label expansion and demonstrated that user-based features, manually annotated samples using a ternary label scheme of non-clickbait, general-clickbait, and malicious-clickbait. For, However, the study relies on channel-level annotation labels inherited from prior work, Zannettou et al.12 , rather than

2026-06-16视觉语言视觉感知数据集/基准

面向视频平台标题党检测中缺少大规模、可靠多模态标注数据的问题,本文构建 YTClickbait21K:从 40 个 YouTube 频道、29 个国家采集 21,238 个视频,保留标题、描述、互动统计与缩略图,并以三人独立标注、多数投票和质控保证视频级标签。数据集中点击bait/非点击bait为 9,653/11,585,标注一致性 κ≈0.65,主要贡献是提供可训练和评测跨模态不一致性的基准,增益可能主要来自 scaling / data。

FactCheck: Feasibility-aware Long-term Action Anticipation with Multi-agent Collaboration Figure 1
2026-06-16cs.CV

FactCheck: Feasibility-aware Long-term Action Anticipation with Multi-agent Collaboration

Rui Cao, Jiannong Cao, Bo Yuan, Zhiyuan Wen, Mingjin Zhang

\orgdiv Department of Computing, \orgname The Hong Kong Polytechnic University, \orgaddress \state Hong Kong SAR, \country China

2026-06-16视觉感知

面向具身智能中的长时动作预测,论文指出现有开环方法虽能保持语义连贯,却常预测不存在物体、违背物体可供性或忽略状态。FactCheck 将任务拆成 Observer、Planner、Verifier,以结构化历史摘要和动作图支撑“观察-规划-验证”闭环,显式修正不可行动作;在 EPIC-Kitchens-55 与 EGTEA Gaze+ 上持续优于已有方法。

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence Figure 1
2026-06-16cs.CV

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan, Jiaqi Wang

2026-06-16视觉语言视觉感知

针对现实事件稍纵即逝而现有大模型多需被动提问的问题,论文提出8B级视觉优先的 JoyAI-VL-Interaction,让模型每秒自行决定沉默、回应或委托后台模型,并配套可部署的实时流式系统、数据与训练流程。六个真实流媒体场景中,人评在质量与时机上相对豆包、Gemini 视频助手胜率分别为77.6%和87.9%,但评测规模仍较小。

Double-Helix Vision (DH-V2): A Geometry-Based Visual Sampler for Bandwidth-Constrained Perception Figure 1
2026-06-16cs.CV

Double-Helix Vision (DH-V2): A Geometry-Based Visual Sampler for Bandwidth-Constrained Perception

Jinwen Wen

2026-06-16视觉感知

面向机器人和嵌入式视觉中带宽、算力受限的问题,DH-V2用两条相差180°的黄金螺旋进行中心密、外围疏的几何采样,将2D图像压成双1D信号,并在其上做运动碰撞、结构差异和空间报告。文中报告4K下约1433×压缩、1080p CPU端到端0.52 ms、CIFAR-10极低采样下较随机采样提升6.03%;但其深度仅是几何假设,外周漏检和过曝失效仍是限制。

ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering Figure 1
2026-06-16cs.CV

ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering

Wenhao Lu, Zhengqiu Zhu, Xiaofeng Wang, Xiaoran Zhang, Yatai Ji, Yong Zhao, Yue Hu, Yingzhen Nie, Jinlong Zhu, Zheng Zhu

National Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology

2026-06-16强化学习

本文针对现有无人机室外EQA在目标入镜后即停止、难以获取车牌等细粒度证据的问题,提出FG-EQA基准和ScoutVLA。其关键是将问题语义与缺失证据对齐,并用解耦双专家VLA以5-DoF连续轨迹微调视角,同时通过知识隔离避免动作训练损伤语言推理。仿真与真实外场结果显示,相比基线严格成功率平均提升10.48倍、问答正确率提升7.72倍。

An Empirical Analysis of Optimization Dynamics and Sparsity Boundaries in Large-Scale Pedestrian Attribute Recognition Figure 1
2026-06-16cs.CV

An Empirical Analysis of Optimization Dynamics and Sparsity Boundaries in Large-Scale Pedestrian Attribute Recognition

Houssam El Mir

College of Computer Science and Technology, Zhejiang University of Technology, Hangzhou, 310023, China, This work is an extended version of the author’s graduation thesis at Zhejiang University of Technology.

2026-06-16视觉感知优化算法学习理论

面向监控场景中的行人属性识别,论文关注大规模合并数据下少数属性被 BCE 优化“全判为负”的失衡问题。作者不改网络结构,而是在轻量 ResNet-18 上系统考察多标签 Focal Loss 的 α、γ 对优化动态和稀疏边界的影响,指出存在仅靠全局损失调制难以跨越的 Sparsity Wall。实验在 20 个属性上显示 α=0.50、γ=2.0 的 Macro F1 达 62.32%,接近强 BCE 基线且无额外推理开销。

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems Figure 1
2026-06-16cs.CV

XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems

Hamza Riaz, Arham Haroon, Maha Baig, Muhammad Dawood Rizwan, Muhammad Naseer Bajwa, Muhammad Moazam Fraz

2026-06-16视觉语言

针对放射报告生成中端到端视觉语言模型视觉 grounding 弱、易漏检或幻觉的问题,XMedFusion 将医学影像理解拆成视觉证据提取、知识图谱构建、检索草稿和迭代综合四类代理,以结构化中间表示约束推理。胸片数据集上相较基线 BLEU-1 从 0.0493 提升到 0.3359,ROUGE-L、METEOR 及一致性、准确性评分也明显提高,但具体消融与增益来源仍需进一步核实。

Momentum-Guided Semantic Forecasting (MoFore) for Self-Supervised Video Representation Learning Figure 1
2026-06-16cs.CV

Momentum-Guided Semantic Forecasting (MoFore) for Self-Supervised Video Representation Learning

Qinwu Xu

2026-06-16视觉感知

针对视频自监督学习中过度依赖像素重建、难以捕捉长时语义动态的问题,MoFore改在潜空间中由上下文片段预测时间上相隔较远的未来嵌入,并用动量教师、随机时间间隔和对比正则稳定训练。UCF101实验显示其无需动作标签即可形成较好的时间一致性、类别结构和运动感知检索,但评估规模较小,细粒度时序推理能力仍有限。

Avoiding Exponential Blow-Up in Distributive Lattice Submodular Minimization Figure 1
2026-06-16cs.CV

Avoiding Exponential Blow-Up in Distributive Lattice Submodular Minimization

Ishant Shanu

2026-06-16视觉感知

本文针对计算机视觉等场景中分配格上的子模函数最小化,指出传统先扩展到布尔格再优化会引入随集合规模指数增长的额外状态,导致实际不可扩展。核心做法是在分配格内部构造通用变换与基多面体分解,使既有布尔格 SFM/MNP 等算法可复用而不遍历冗余空间。实验报告相较传统扩展法有显著运行时间提升,但具体任务规模与增益来源文中未充分说明。

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis Figure 1
2026-06-16cs.CV

Scribby: A Multi-Level LLM Framework for Semantic Video Analysis

Julian Abelarde, Hugo Garrido-Lestache Belinchon

2026-06-16视觉感知

针对长视频只给粗粒度摘要、难以定位主题演进的问题,Scribby用LLM先做全局转写理解,再在句子级结合相邻上下文判定语义相似,将内容聚成“verses”,并以交互时间线和向量检索热力图呈现。文中称在结构化与非结构化网络视频上测试了分组准确性和可用性,但缺少明确量化指标,主要结果与增益来源仍未充分说明。

GeoRoPE: Ground-Aware Rotary Adaptation for Remote Sensing Foundation Models Figure 1
2026-06-16cs.CV

GeoRoPE: Ground-Aware Rotary Adaptation for Remote Sensing Foundation Models

Yu Luo, Kun Hu, Mengwei He, Xiaogang Zhu, Shan Zeng, Allen Benter, Wei Xiang, Patrick Filippi, Thomas Francis Bishop, Zhiyong Wang

The University of Sydney, Edith Cowan University, Adelaide University, Wuhan Polytechnic University, Climate, Orange Agricultural Institute, La Trobe University

2026-06-16视觉感知

遥感基础模型在多传感器、多 GSD 迁移时,固定 token 网格偏移对应的真实地面距离不同,导致位置先验尺度错配。GeoRoPE 将 RoPE 改造成地面感知适配器:用 GCC 按单步 token 的地面距离重标定相对坐标,用 GFC 按区域空间粒度调节频率敏感度,并以轻量并行适配注入冻结模型。实验覆盖多种 RSFM、传感器、分辨率和分类/分割任务,显示其提升跨分辨率鲁棒性与尺度敏感表征。

Temporally Consistent and Controllable Video Generation of 2D Cine CMR via Latent Space Motion Modeling Figure 1
2026-06-16cs.CV

Temporally Consistent and Controllable Video Generation of 2D Cine CMR via Latent Space Motion Modeling

Yiheng Cao, Gustavo Andrade-Miranda (SyCoIA - IMT Mines Alès), Jiatian Zhang, Guillaume Sallé, Xin Gao

TEMPORALLY CONSISTENT AND CONTROLLABLE VIDEO GENERATION OF 2D CINE, Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences, Suzhou, China, data, offering a scalable solution to data scarcity., Animations and demo will be available on https://github.com/, availability of large, diverse, and annotated datasets. How-, ever, publicly available datasets are often insufficient, being, by a controllable temporal signal to ensure temporal co-, mate motion, which is not available during inference. To ad-

2026-06-16视觉感知规划控制

针对 cine CMR 公开数据少、病理多样性不足且现有扩增缺乏时间可控性的问题,论文将空间结构与心动时序解耦:先用临床文本条件扩散生成舒张末首帧,再以相位嵌入驱动的潜空间 flow/残差扩散扭曲首帧生成序列,从而减少逐帧生成的结构漂移。在 ACDC、DSB 上得到较连贯的合成视频,报告 FID 31.68、CLIP 31.04;但其对下游分割或诊断的实际增益文中未充分说明。

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability Figure 1
2026-06-16cs.CV

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

2026-06-16安全鲁棒

面向VLM在安全场景中的可解释性失真,论文指出显著图会因文本嵌入非正交产生“语义泄漏”,即错误提示也激活相关物体。作者提出LSA理论框架与OSP方法,用OMP残差将查询向量相对干扰概念正交化,作为免训练插件接入CLIP、SigLIP和扩散模型。实验覆盖3类基础模型、5种归因方法、2个数据集,并含用户研究,显示OSP能降低归因幻觉、提升AUROC且基本保持定位保真度。

Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers Figure 1
2026-06-16cs.CV

Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont, Volkan Cevher

2026-06-16视觉感知

针对ViT自注意力缺少显式空间归纳偏置、在小模型或少数据微调时更易退化的问题,论文提出Violin:用多种空间填充曲线扫描图像patch,生成可学习衰减掩码并乘到注意力矩阵中,几乎不改架构且额外参数低于0.0015%。实验显示其在VTAB-1K微调平均最高提升4.7%、单任务最高8.7%,ImageNet-1K小模型预训练提升约0.8–0.9%,像素级CIFAR-100最高提升7.2%。

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models Figure 1
2026-06-16cs.CV

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola

2026-06-16生成模型强化学习

针对复用多个预训练扩散模型时常见的模型互相冲突、某一模型主导、目标对象缺失或属性错配问题,本文提出 Divide-and-Denoise,在采样过程中把噪声样本区域视为可分配资源,通过公平分配博弈动态决定各模型负责的软区域,并据此约束去噪更新。实验在条件图像生成上验证,方法在 GenEval、CLIP-Score、VQAScore、ImageReward 等指标上优于组合基线,并能更充分利用单概念模型的专长。

Where Does Texture Evidence Live in SAM? Features, Proposal Masks, and Texture Segmentation Figure 1
2026-06-16cs.CV

Where Does Texture Evidence Live in SAM? Features, Proposal Masks, and Texture Segmentation

Nadav Orenstein, Aviad Cohen Zada, Shai Avidan, Gal Oren

Tel Aviv University, Israel, Stanford University, Technion, USA

2026-06-16视觉感知

这篇论文针对 SAM 在材质、纹理而非物体语义定义的分割中常失效的问题,追问失败是否真因“看不见纹理”。作者不微调 SAM,而是分别探查冻结多尺度特征和自动 proposal mask 库,并用最小聚类/监督整合读出纹理分区。结果显示,SAM 默认并非纹理分割器,但其粗层特征和候选掩码常已保留纹理证据;自然场景更需碎片组装,合成场景多是选中已有候选。

Sub-Semantic Image Segmentation Figure 1
2026-06-16cs.CV

Sub-Semantic Image Segmentation

Aviad Cohen Zada, Nadav Orenstein, Shai Avidan, Gal Oren

Tel Aviv University, Israel, Stanford University, Technion, USA

2026-06-16视觉感知

论文针对传统纹理分割只看低层统计、语义分割又过度依赖物体类别的问题,提出“亚语义”分割:用自由语言描述可稳定识别的材质/外观模式而非对象名。方法 Detecture 将 Qwen3-VL 与 SAM 3 通过专门桥接、隔离注意力和竞争式分区机制结合,并构建 TextureADE。实验显示其在 RWTD、STLD、TextureADE 上 mIoU 均领先,多数 ARI 也优于基线。

Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning Figure 1
2026-06-16cs.CV

Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning

Chiradeep Ghosh, Dakshina Ranjan Kisku

Department of Computer Science and Engineering, National Institute of Technology Durgapur, redundancy limits scalability and increases inference cost in, improve scalability. Although REFORMER reduced memory

2026-06-16视觉语言视觉感知

针对图像描述中 ViT 自注意力随 patch 数二次增长、推理成本高的问题,论文用 GMM 软聚类和 EM 将相似图像块归入固定簇,以簇级概率关系替代全量两两注意力,使复杂度由 O(n²) 降至 O(nK),并接入自回归 GPT 解码器生成描述。在 Flickr30K 上作者报告较既有方法有竞争力并取得提升,但具体指标幅度与增益来源在给定片段中未充分说明。

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining Figure 1
2026-06-16cs.CV

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

2026-06-16视觉语言视觉感知

论文针对 VLA 中视觉语言离散语义与连续机器人控制之间的表征错配,认为动作 tokenizer 不应只做压缩,而应提供语义监督。X-Tokenizer 用 SRQ 将顶层码训练成含粗粒度意图的“动作语言”,底层保留执行细节,并通过与冻结基础模型对齐和预测下一帧特征注入多模态语义。在 2.4M 轨迹预训练后,冻结用于混合离散-连续 VLA,在真实任务、RoboTwin 2.0 和 VQA 上优于 FAST,长程任务提升 8.25, grounding 相对提升 13.5%。

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech Figure 1
2026-06-16eess.AS

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

Adarsh Arigala, Arjun Gangwar, S Umesh, Yova Kementchedjhieva

SPRING Lab, Indian Institute of Technology, Madras, India

2026-06-16视觉感知安全鲁棒

针对传统 TTS 依赖离散 Unicode 字符嵌入、跨语种适配需扩展词表且难处理未见字符的问题,Pixel-TTS 将文本渲染为 16×16 字符图像块,经 2D 卷积生成像素级嵌入,并接入 ADMA/F5-TTS 式流匹配与对齐损失。实验显示其在 LibriTTS 上 WER/CER 低于文本基线、SIM 和 UTMOS 相当,且在德语低资源微调、零样本跨语种和 Unicode/l33tspeak 扰动下收敛更快、鲁棒性更好。

Automated 3D Kinematic Monitoring for Circadian Activity and Anomaly Detection in Juvenile Fish Figure 1
2026-06-16cs.CV

Automated 3D Kinematic Monitoring for Circadian Activity and Anomaly Detection in Juvenile Fish

Chih-Wei Huang, Chang-Wen Huang, Chung-Ping Chiang, Tsung-Wei Pan

AI Research Center, National Taiwan Ocean Univ., Keelung City 20224, Taiwan., Center of Excellence for the Oceans, National Taiwan Ocean University, Keelung City 20224, Taiwan., data expansion far outpaces the availability of high-resolution

2026-06-16视觉感知三维

针对水产育种中幼鱼行为表型难以高频、无接触量化的问题,论文将YOLO类检测、双目立体视觉和轨迹滤波结合,把2D检测框中心映射到绝对3D坐标,并用静止门控抑制深度噪声。实验显示该系统可重建幼年罗非鱼昼夜游动基线,估计3D速度/加速度,并用于生理压力异常预警。

Is My Vision-Language Data in Your AI? Membership Inference Test (MINT) Demo 2 Figure 1
2026-06-16cs.CV

Is My Vision-Language Data in Your AI? Membership Inference Test (MINT) Demo 2

Daniel DeAlcala, Gonzalo Mancera, Julian Fierrez, Aythami Morales, Ruben Tolosana, Ruben Vera-Rodriguez

2026-06-16视觉语言视觉感知

这篇论文面向AI Act等监管下训练数据透明性需求,将传统成员推断从“攻击”改写为授权审计工具MINT,用模型输出、激活等可审计信号判断某条图像或文本是否参与训练,并扩展为支持MINT/aMINT/gMINT的网页平台。实验覆盖人脸识别模型、4个LLM、6个大规模图像库和6个文本库,训练数据检测准确率最高约90%,但不同模型与模态下的稳定性和误报代价仍需进一步说明。

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios Figure 1
2026-06-16cs.CV

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang

Soochow University, Suzhou, China

2026-06-16视觉语言数据集/基准

针对多模态嵌入模型虽宣称支持 32K 长上下文、但缺少系统评测的问题,MMLongEmbed 构建覆盖网页、文档、视频与长文本的长上下文检索基准,并用长度分层和高相似干扰项控制难度。对 11 个模型的评测显示,现有模型随上下文变长在细粒度检索上明显退化,且常依赖表层匹配;模型规模或嵌入维度增大并不稳定带来收益。

Style-CCL: Content-Preserving Style Transfer via Curriculum Continual Learning Figure 1
2026-06-16cs.CV

Style-CCL: Content-Preserving Style Transfer via Curriculum Continual Learning

Shiwen Zhang, Haoyuan Wang, Xianghao Zang, Haibin Huang, Chi Zhang, Xuelong Li

Labs, 2025) with diffusion transformers, (Labs, 2024, Institute of Artificial Intelligence (TeleAI), China Telecom., ence, target] triplets to train SC-DiT on FLUX-dev (Labs, (Esser et al., 2024) and FLUX (Labs, 2024) improves text-, does FLUX-Kontext (Labs et al., 2025). OmniConsistency

2026-06-16视觉感知

本文针对双参考图像风格迁移中 DiT 易混淆内容与风格、语义风格压制纹理风格并损害内容保持的问题,提出 SC-DiT 双分支解耦结构,并用 LID 将风格按难度排序,采用从语义到纹理、从干净到合成数据的课程持续学习与随机记忆回放。实验称其在风格相似度、内容一致性和美学质量上达到 SOTA,但增益可能部分来自百万级三元组数据构建。

HorusEye: Language as Dynamic Attention for Emergency Visual Analysis Figure 1
2026-06-16cs.CV

HorusEye: Language as Dynamic Attention for Emergency Visual Analysis

Armel Yara

2026-06-16视觉感知

面向搜救中雾、烟、热成像等分布偏移导致VLM视觉定位与判断失效的问题,HorusEye构建RefCOCO-Degraded并把语言反馈作为动态注意力来评测多模型。结果显示该机制强依赖模型:Gemini在热成像迭代反馈下提升47.3%,Qwen2-VL反降5.1%;同时发现热成像中裁剪会破坏上下文、使Gemini姿态识别下降26%,BLIP-2在退化下幻觉增加,不宜应急部署。

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods Figure 1
2026-06-16cs.CV

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal

University of Virginia, USA

2026-06-16视觉语言

针对视觉语言模型解释方法缺乏可验证跨模态真值、难以区分真实空间推理与词袋式捷径的问题,论文提出 GridVQA-X:用闭世界合成网格生成唯一因果解释,并训练纯推理与捷径依赖的成对模型作为诊断基准。实验显示,多种现有多模态解释器难以区分两类决策路径,说明其对真实跨模态协同的忠实性评估仍存在明显缺口。

UtVAA: Ultra-tiny Vision Transformer with Affix Attention for Mobile Image Classification Figure 1
2026-06-16cs.CV

UtVAA: Ultra-tiny Vision Transformer with Affix Attention for Mobile Image Classification

Romiyal George, Sathiyamohan Nishankar, Selvarajah Thuseethan, Roshan G. Ragel

2026-06-16视觉感知

面向移动/边缘端部署,论文针对标准 ViT 自注意力开销高、参数量大的问题,提出超小型 UtVAA。其核心是在 Affix Attention 中结合深度/逐点卷积、线性注意力、坐标注意力与三路融合,并用空洞深度可分离瓶颈扩大感受野。最小模型仅 204.67K 参数、53.95M FLOPs,在 CIFAR 与番茄病害数据集上保持有竞争力的分类精度。

Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion Figure 1
2026-06-16cs.CV

Steady-Forcing: Balancing Spatial Persistence and Motion Continuity in Long-Horizon Nature Video Diffusion

Matiur Rahman Minar, Seunghun Oh, GangHyeon Jeong, Unsang Park

2026-06-16视觉感知生成模型

本文关注自回归视频扩散在固定机位长时自然场景中易出现的背景漂移与水、火、烟等流体运动停滞问题。Steady-Forcing 的核心是将空间身份锚点 V-Sink 与 EMA 运动记忆分离,并结合块相对时间编码、周期性 KV 缓存清理及 Wan2.1-14B 教师蒸馏,以平衡稳定性和运动连续性。实验相对七个基线提升了长时背景一致性与画质,盲测也显示用户更偏好其稳定视角和持续流动效果。

BBR-Net: Boundary-Balanced Replay for Continual Medical Image Segmentation Figure 1
2026-06-16cs.CV

BBR-Net: Boundary-Balanced Replay for Continual Medical Image Segmentation

Zahid Ullah, Sieun Choi, Jihie Kim

2026-06-16视觉感知学习理论

论文针对医疗分割持续学习中跨域更新易遗忘的问题,指出仅保存外观样本不足以维持解剖结构一致性。BBR-Net用双头U-Net引入边界监督,并按边界信息量与类别均衡选择回放样本。CAMUS到CardiacNet实验中接近联合训练、显著减轻遗忘;反向顺序和边界扰动显示,回放效果受初始结构标注质量强烈制约。

Hierarchical GRU with Input-Conditioned Slot Queries for Ball Action Anticipation Figure 1
2026-06-16cs.CV

Hierarchical GRU with Input-Conditioned Slot Queries for Ball Action Anticipation

Parthsarthi Rawat

2026-06-16视觉感知

本文面向足球转播中的球类动作预判:利用过去30秒视频预测未来5秒内10类动作,动机是处理长时序上下文、类别不均衡和事件时间定位。方法以冻结视频特征为输入,用局部Transformer建模5秒片段内关系、GRU聚合跨窗口上下文,再用由输入条件化的slot查询解码事件,并结合频率重加权匈牙利匹配和高斯时间软标签。SoccerNet BAA测试集mAP为17.91%,接近但略低于FAANTRA基线18.05%,输入条件化查询带来约0.8个百分点验证增益。

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty Figure 1
2026-06-16cs.CV

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

Harry Zhang, Luca Carlone

2026-06-16视觉语言视觉感知安全鲁棒

面向机器人等高风险场景中 VLM 容易幻觉且置信度失准的问题,FUSE 将输入图文歧义带来的偶然不确定性与多次生成语义分散反映的认知不确定性区分建模,用 GP 将 CLIP 嵌入概率化作为先验,再以响应分散作似然进行闭式贝叶斯融合,得到单一可解释不确定性分数;在多个 VQA 基准上相较 token likelihood 等基线取得更好的校准、选择性准确率和错误相关性。

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis Figure 1
2026-06-16cs.CV

FairGen: Preference-Aligned Diffusion for Demographically Equitable Medical Image Synthesis

Zhimin Li, Ruichen Zhang, Zhen Tan, Howard J Aizenstein, Jingtong Hu, Tianlong Chen

University of Pittsburgh, Swanson School of Engineering, Pittsburgh, 15261, USA, The University of North Carolina at Chapel Hill, Department of Computer Science, Chapel Hill, 27599, USA, Arizona State University, School of Computing and Augmented Intelligence, Tempe, 85281, USA, University of Pittsburgh, Department of Psychiatry, Pittsburgh, 15213, USA

2026-06-16视觉感知生成模型

医疗影像数据常因肤色、性别、年龄等人口属性失衡,使诊断模型在少数群体上产生偏差。FairGen 将属性-疾病重采样、多样性正则与医生偏好对齐引入扩散生成,合成更均衡且保留病灶特征的图像;在皮肤、胸片和脑 MRI 任务上分别带来 95.9%、80.0%、35.2% 的公平性提升,并保持接近原始临床数据训练的诊断准确率。

Interpolation between Convolution and Attention via K-Nearest Neighbors Figure 1
2026-06-16cs.CV

Interpolation between Convolution and Attention via K-Nearest Neighbors

Mingi Kang

An Honors Paper for the Department of Computer Science, Bowdoin College, 2026

2026-06-16视觉感知

这篇论文针对视觉模型中卷积的局部归纳偏置与注意力的全局特征匹配长期割裂的问题,提出用 k 近邻选择与加权聚合统一两者:按空间坐标选邻居可退化为卷积,按特征相似度选邻居可退化为自注意力。ConvNN 可替换卷积或注意力层,并在 CIFAR-10/100、ImageNet-1K 的 VGG/ResNet/ViT 实验中相较纯卷积、全注意力和部分稀疏注意力取得更好分类表现,但具体增益来源仍可能受实现与训练设置影响。

VigilFormer: Deformable Attention for Video Anomaly Detection with Causal Risk Inference Figure 1
2026-06-16cs.CV

VigilFormer: Deformable Attention for Video Anomaly Detection with Causal Risk Inference

Xinze Zhang

University of Southern California, Los Angeles, CA 90007, USA

2026-06-16视觉感知安全鲁棒

面向监控视频异常检测中精度与实时性的矛盾,VigilFormer将可变形时空注意力用于稀疏捕捉跨帧异常线索,并结合因果膨胀卷积与对比式MIL在仅视频级标签下建模时序风险;推理端用置信度调度跳过低信息帧。文中报告在UCF-Crime、ShanghaiTech、CUHK Avenue上AUC为87.83%、97.21%、89.74%,单卡41.5 FPS,但仍依赖I3D预提特征。

Disagreement-Based Cross-Model Routing for Implicit Video Question Answering Figure 1
2026-06-16cs.CV

Disagreement-Based Cross-Model Routing for Implicit Video Question Answering

Durga Sandeep Saluru

2026-06-16视觉感知

本文针对 ImplicitQA 中单一视频 LLM 接近上限且自一致投票会放大相关错误的问题,提出无需训练的分歧路由:对 Gemini 零温三次采样,用答案不一致作为不确定性信号,仅将约 20% 难题交给输入模态不同的 Claude 处理。验证集 AvgAcc 提升 1.43,挑战测试集达 82.03 AvgAcc,较最佳单次 Gemini 提升 1.81,增益主要出现在跨镜头空间与运动推理类别。

DC-Motion: Decoupling Semantics and Details via Discrete-Continuous Tokens for Human Motion Generation Figure 1
2026-06-16cs.GR

DC-Motion: Decoupling Semantics and Details via Discrete-Continuous Tokens for Human Motion Generation

Hequan Wang, Jiaxu Zhang, Zhengbo Zhang, Zhigang Tu

Wuhan University, Wuhan University Wuhan China

2026-06-16视觉感知

针对文本到人体动作生成中扩散模型语义组合推理弱、离散 AR 模型又易丢失细节并产生抖动的问题,DC-Motion 将动作表示拆成离散语义 token 与连续残差细节:先用 DC-VAE 分解层级信息,再由 MaskGIT 预测全局动作结构、轻量残差扩散补回物理动态。实验称其在 HumanML3D 与 KIT-ML 上取得最佳 FID 和 R-precision,尤其提升复杂长指令对齐与动作真实感。

AI for Maritime Security: Comparative Evaluation of CNN and Vision Transformer Architectures for Maritime Object Detection Figure 1
2026-06-16cs.CV

AI for Maritime Security: Comparative Evaluation of CNN and Vision Transformer Architectures for Maritime Object Detection

Ismet Gocer, Zakirul Bhuiayn, Shakeel Ahmad, Raza Hasan

Southampton Solent University, School of Technology and Maritime Industries

2026-06-16视觉感知数据集/基准

面向海上安防中复杂天气、实时监控和边缘部署的船舶视觉检测需求,本文用6468张多天气海事图像系统比较基础CNN、Xception/VGG16/MobileNetV2/EfficientNetV2L迁移模型与ViT,并把准确率、I/II类错误、模型大小和视频处理时间纳入同一评估。结果显示模型选择强依赖算力约束:轻量网络更适合受限设备,而ViT在文中实验中达到100%准确率、最低错误率和最快视频处理;但其泛化增益来源仍可能主要来自数据与实验设置,文中未充分说明。

RAMS: Resource-Adaptive and Detection-Conditioned Model Switching for Embedded Edge Perception Figure 1
2026-06-16cs.CV

RAMS: Resource-Adaptive and Detection-Conditioned Model Switching for Embedded Edge Perception

Kushal Khemani, Evan Leri, George Xu, Amit Hod

NEXEDGE Research Lab

2026-06-16视觉感知

RAMS针对嵌入式边缘目标检测中资源波动导致的延迟—精度冲突,提出按空闲状态自校准资源阈值、常驻三档YOLOv8模型并结合VRU检测事件延迟降级的运行时切换器,同时用SWAS评估无标注视频策略效果。跨树莓派、x86与Jetson实验显示,重载下safety2在Jetson TRT上平均3.41 ms、比固定MEDIUM快5.6倍,并在保留约74%代理精度的同时较阈值策略提升25.4% oracle SWAS,但受NANO层VRU召回仅24.2%限制。

From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models Figure 1
2026-06-16cs.CL

From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models

Junlong Tong, Zilong Wang, YuJie Ren, Peiran Yin, Hao Wu, Wei Zhang, Xiaoyu Shen

Shanghai Jiao Tong University, Institute of Digital Twin, Eastern Institute of Technology, Ningbo

2026-06-16视觉感知

针对传统 LLM 依赖完整静态输入、难以处理实时语音/视频和交互式智能体中持续到来的信息,本文从数据流与交互并发性重新界定 streaming LLM,并将现有工作划分为输出流式、顺序流式和并发流式三类。其主要结果是梳理文本、语音、视频场景下的生成加速、增量编码、上下文管理和全双工交互策略,指出延迟—性能权衡、实时对齐数据不足等仍是关键瓶颈。

2026-06-15

83 篇
Gaze Heads: How VLMs Look at What They Describe Figure 1
2026-06-15cs.CV

Gaze Heads: How VLMs Look at What They Describe

Rohit Gandikota, David Bau

Northeastern University

2026-06-15视觉语言

本文关注视觉语言模型在生成图像描述时,内部如何决定“看哪里再说什么”。作者发现语言骨干中少量中后层注意力头会随当前描述区域移动,并将其称为 gaze heads;用漫画分格的空间叙事顺序可低成本定位这些头。对 Qwen3-VL-8B 仅干预前 100 个头(约 8.7%)即可把回答重定向到指定分格,准确率 83.1%,随机头无效,全头干预会破坏生成;该机制还可中途切换目标,并部分迁移到 COCO 和多种模型规模。

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains Figure 1
2026-06-15cs.CV

OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains

Xinyue Cai, Chaoyou Fu, Yi-Fan Zhang, Ran He, Caifeng Shan

Nanjing University

2026-06-15视觉感知数据集/基准

针对现有音视频 QA 数据生成中音画分离、跨片段实体不一致和问题缺少长程推理的问题,OmniVideo-100K 用“实体锚定脚本”统一人物/声源引用,再以“线索引导”先挖掘跨片段多模态证据链后生成问答。该流程构建了 10 万训练样本和 505 条人工测试集,微调 VITA-1.5、Qwen2.5/3-Omni 在 OmniVideo-Test 上最高提升 20.59%,并在 Daily-Omni、JointAVBench 等基准上有一定泛化。

RATS! Patches Talk Through Registers: Emergent Parts in Register Attention Transformers Figure 1
2026-06-15cs.CV

RATS! Patches Talk Through Registers: Emergent Parts in Register Attention Transformers

Timing Yang, Predrag Neskovic, Jansen Seheult, Wenchao Han, Anand Bhattad, Alan Yuille, Feng Wang

Johns Hopkins University, Department of Laboratory Medicine and Pathology, Mayo Clinic, MN, USA

2026-06-15视觉感知

论文针对自监督 ViT 虽含有部件级线索、却缺少显式分组机制的问题,提出 RATS:用多个可学习 register 替代单一 CLS 聚合,在每个块中通过 L→N→N→L 的压缩、通信、广播瓶颈路由 patch 信息,并按注意力头隔离 register 以促成区域专化。无需部件标注或辅助损失,register 可形成类似物体部件的表示;在五个分割基准上平均提升约 12 mIoU,并在 ADE20K、COCO 下游任务上取得小幅增益。

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space Figure 1
2026-06-15cs.CV

RepFusion: Leveraging Multimodal Priors for Denoising in Representation Space

Xichen Pan, Aashu Singh, Satya Narayan Shukla, Xiangjun Fan, Shlok Kumar Mishra, Saining Xie

2026-06-15视觉语言

针对现代文生图中 LLM 多停留在静态文本编码、去噪仍依赖新训 DiT 的分工,RepFusion 利用 RAE 提供的语义化视觉表征空间,将冻结的预训练 MLLM改作“噪声表征编码器”,反复读取随去噪演化的视觉 latent,并用其输出条件化 DiT。实验显示,在相近推理 FLOPs 下,仅微调 1.3B DiT 和 MLP projector 即优于训练更大去噪器或 Transfusion 基线,说明 MLLM 先验可直接帮助表征空间去噪。

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control Figure 1
2026-06-15cs.CV

Instruct-Particulate: Scaling Feed-Forward 3D Object Articulation with Kinematic Control

Ruining Li, Yuxin Yao, Matt Zhou, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi

University of Oxford, University of Cambridge, Nanyang Technological University

2026-06-15规划控制三维

针对可动三维物体标注稀缺、模型难泛化到新类别的问题,本文将静态网格的关节重建改写为“按运动学指令解析”:输入部件描述、连接关系、关节类型和可选点提示,预测部件分割与运动参数,并用 VLM 伪标注构建超 15 万异构训练集。实验显示其跨类别和 AI 生成网格泛化更好,可结合图像到三维模型生成可导入物理仿真的可动资产;增益可能主要来自 scaling / data 与指令消歧共同作用。

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning Figure 1
2026-06-15cs.CV

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

The Hong Kong University of Science and Technology (Guangzhou), DAMO Academy, Alibaba Group, Hupan Lab, Zhejiang University

2026-06-15数据集/基准

针对现有医学多模态幻觉评测只看最终答案、难以定位错误来源的问题,ClinHallu将7,031个医学VQA样本标注为视觉识别、知识回忆和推理整合三阶段轨迹,并用阶段替换干预诊断瓶颈。对11个MLLM的实验显示,不同模型和数据集的幻觉来源差异明显,视觉与知识错误会向后传播;轨迹监督微调还能降低分阶段幻觉率。

CottonLeafVision: An Explainable and Robust Deep Learning Framework for Cotton Leaf Disease Classification Figure 1
2026-06-15cs.CV

CottonLeafVision: An Explainable and Robust Deep Learning Framework for Cotton Leaf Disease Classification

Rafi Ahamed, Md. Abir Rahman, Tasnia Tarannum Roza, Munaia Jannat Easha, Md. Asif Khan, Sudeepta Mandal

East West University, DenseNet201, InceptionV3, and VGG19 on a publicly available, consuming, and require a significant amount of manual labor., severity. The availability of reliable, expertly annotated image, Initially, crop experts and computer scientists will collaborate, images, which are labeled. After that, they applied, model, which is trained on a labeled dataset of healthy and, disease using a publicly available dataset, this study utilizes a, available for Cotton Leaf Disease Detection, shown in Fig. 2.

2026-06-15视觉感知安全鲁棒

面向棉花病害早期诊断中人工巡检成本高、田间图像变化大的问题,论文比较 DenseNet201、InceptionV3、VGG19,并加入过采样、对抗训练、Grad-CAM 与遮挡敏感性分析以提升鲁棒性和可解释性。在7类公开叶片数据上 DenseNet201 达到98%准确率,高于对比模型;但仅单一公开数据集验证,泛化增益来源仍需更多外部测试说明。

HumP-KD: A Hybrid Uncertainty-Aware Multi-Stage Progressive Knowledge Distillation Framework for Efficient Fire Classification Figure 1
2026-06-15cs.CV

HumP-KD: A Hybrid Uncertainty-Aware Multi-Stage Progressive Knowledge Distillation Framework for Efficient Fire Classification

Mohammed Arif Mainuddin, Najifa Tabassum, Omar Ibne Shahid, Riasat Khan

2026-06-15安全鲁棒

面向火灾监控在边缘设备上需兼顾准确率、实时性与退化图像鲁棒性的需求,论文提出 HumP-KD,将 Swin-Tiny、ViT-Base 及 Meta-MLP 集成教师蒸馏到 MobileViT-S,并结合教师不确定性加权、层级注意力掩码和多阶段渐进训练。Dataset-II 上 10 次试验 F1 达 0.9876,显著高于未蒸馏学生模型,同时仅 4.94M 参数、CPU 37.72 FPS;但部分基线接近满分,增益来源仍可能受数据集难度影响。

Memento: Reconstruct to Remember for Consistent Long Video Generation Figure 1
2026-06-15cs.CV

Memento: Reconstruct to Remember for Consistent Long Video Generation

Xuan Wei, Longbin Ji, Guan Wang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Qingqi Hong

Xiamen University, ERNIE Team, Baidu Inc.

2026-06-15视觉感知

长视频生成中,分镜式自回归方法虽可扩展,但历史记忆常只服务下一镜头连贯性,导致人物或物体身份随时间漂移。Memento 将一致性转化为“能否仅凭记忆重建主体”的显式监督,并用双查询记忆区分长期身份证据与短期上下文线索,配合无代词主体描述的数据管线。实验显示其在长期主体一致性、跨镜头连贯性和视觉质量上优于对比方法,但误差写入记忆和物理合理性仍是限制。

Giving AI a Headache: Acoustic Adversarial Attacks to Computer Vision Applications Figure 1
2026-06-15cs.CV

Giving AI a Headache: Acoustic Adversarial Attacks to Computer Vision Applications

Nicole Villavicencio-Garduño, Maksim Ekin Eren, Milo Prisbrey, Ben Migliori, Michael Teti

Carnegie Mellon University, Pittsburgh, USA

2026-06-15视觉感知

针对自动驾驶、安防等视觉系统可能被物理传感链路干扰的问题,本文把声学对抗攻击从以往短距离超声扩展到可听低频,利用商品摄像头机械共振在成像阶段引入模糊、抖动和畸变,而非直接改像素。实物实验中,低频声信号可使 Logitech C930e 采集画面扰动并显著降低 YOLOv11 检测表现,出现漏检、误检或幻觉目标;但验证仅覆盖单一相机和固定声源,泛化范围仍文中未充分说明。

HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities Figure 1
2026-06-15cs.CV

HPSv3++: Scaling Reward Models Across the Full Spectrum of Diffusion Model Capabilities

Yijun Liu, Jie Huang, Zeyue Xue, Yuming Li, Ruizhe He, Haoran Li, Shijia Ge, Siming Fu

Tsinghua University, JD Explore Academy, Peking University, Zhejiang University

2026-06-15生成模型强化学习

针对现有 T2I 奖励模型依赖旧模型标注、难以适应生成能力提升和 RL 迭代分布漂移的问题,论文提出 HPSv3++:构建 212K 双维偏好数据 HPDv3++,并用 OGD 保留旧偏好知识,再加入能力—迭代条件化与基于组内分数方差的半监督引导。结果在 HPDv3、GenAI-Bench 分别较 HPSv3 提升 9.8% 和 5.5%,用于多种扩散模型 RL 时也提升 GenEval。

Improving Lunar Topography with Deep Learning Schrödinger Bridges Figure 1
2026-06-15cs.CV

Improving Lunar Topography with Deep Learning Schrödinger Bridges

Matthew Repasky, Erwan Mazarico, Michael K. Barker, Stefano Bertone, Terence J. Sabaka, Yao Xie

H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology, USA, NASA Goddard Space Flight Center, USA, Center for Research and Exploration in Space Science and Technology (CRESST II), University of Maryland, College Park, MD, USA, National Institute for Astrophysics (INAF), Astrophysical Observatory of Turin, 10025 Pino Torinese (TO), Italy

2026-06-15视觉感知

针对月球 LOLA 等高程模型分辨率不足、传统明暗恢复形状方法依赖专家调参与大规模计算的问题,本文将地形超分建模为低分辨率 DEM 到高分辨率 DEM 的 Schrödinger Bridge 生成过程,并用模拟 NAC 光学影像作物理条件约束。模型可多次采样给出像素级不确定性,在20 mpp渲染测试集上重建误差约5–6米,并展示了分块拼接扩展到大区域;但真实 NAC 与米级分辨率适配仍未充分验证。

SED:Lightweight Saliency prediction for Event-based data via Distillation Figure 1
2026-06-15cs.CV

SED:Lightweight Saliency prediction for Event-based data via Distillation

Romaric Mazna, Jean Martinet, Michele Magno

2026-06-15视觉感知

面向机器人、无人机等边缘平台,事件相机显著性预测需要兼顾低功耗实时性与跨域鲁棒性,而现有深度模型过重。SED用因子化深度可分离时空卷积DSTconv构建81k参数学生网络,并通过SEST教师蒸馏把压缩同时作为正则化。结果显示模型从180MB降至0.32MB,在N-DHF1K和N-UCF Sports上匹配或超过教师,并能从合成数据迁移到真实事件记录。

StereoGeo: an end-to-end stereo camera calibration method Figure 1
2026-06-15cs.CV

StereoGeo: an end-to-end stereo camera calibration method

Imane Meddour, Andréa Macario Barros, Cédric Gouy-Pailler

2026-06-15视觉感知

StereoGeo针对传统双目标定依赖棋盘格、多视角或假设左右相机内参相同的问题,提出从双目图像端到端估计左右焦距、重力方向及相对位姿的框架。方法将GeoCalib扩展到双目场景,用独立视角特征和透视场预测结合可微LM优化,并构建5万余合成双目对训练。实验显示其内参精度具竞争力,外参估计优于仅面向单目或受限假设的方法。

S$^2$COPE: Self-Supervised Concept Discovery via Preference Learning Figure 1
2026-06-15cs.CV

S$^2$COPE: Self-Supervised Concept Discovery via Preference Learning

Shilong Xiang, Zirui Zhang, Chengzhi Mao

Rutgers University

2026-06-15视觉感知

这篇论文针对自监督视觉表征难解释、概念模型依赖人工标注的问题,提出 S2COPE:让 VLLM 不再只是静态概念生成器,而是在基于视图不变性与跨实例判别性的自监督偏好优化循环中,主动生成、验证并强化视觉属性。实验覆盖自然、医学和物理图像,显示其能发现更贴近领域的可读概念,并在未见数据分类上最高带来 24 个百分点 top-1 提升。

A Qualitative Review of GenAI-Based Methods for Data Generation and Augmentation in Industrial Computer Vision Applications Figure 1
2026-06-15cs.CV

A Qualitative Review of GenAI-Based Methods for Data Generation and Augmentation in Industrial Computer Vision Applications

Paul Koch, Paul Hofmann, Ferdinand Waßelewsky, Adem Karakurt, Andre Sérs, Jörg Krüger

Hamburg University of Applied Sciences (HAW Hamburg), Technical University Berlin (Tu-Berlin), available in industrial applications, and its acquisition is not trivial either., classification of unlabeled objects, which is crucial for tasks such as parts sorting, a promising tool for realistic and controllable data augmentation. Using text

2026-06-15视觉感知

面向工业视觉项目初期缺数据、主动采集又易损害用户信任的困境,本文以 MVIP 工业零件分类为案例,定性比较图像个性化、GenAI 增强与仿真合成三类数据扩增路线。核心洞察是这些方法可辅助自动数据 ramp-up,但对提示词表述、视角一致性和工业语义高度敏感,易出现语义或类别特征偏移。主要结果显示其潜力仍受源域人类中心知识与目标工业对象特征不匹配限制,稳定带来分类增益的证据文中未充分说明。

Trimodal Glioma Representation Alignment via Volumetric Contrastive Learning Figure 1
2026-06-15eess.IV

Trimodal Glioma Representation Alignment via Volumetric Contrastive Learning

Denise Marini, Eleonora Grassucci, Danilo Comminiello

2026-06-15视觉感知

针对胶质瘤分级与生存预测中病理、转录组和MRI信息常被两两融合、难以统一对齐的问题,论文提出GLORIA,用模态专属编码器将WSI、mRNA和3D MRI投到共享空间,并以Gramian体积对比损失约束三模态嵌入,再经跨模态门控融合。在132例匹配队列、29例测试集上,相比WSI-mRNA双模态基线提升Micro/Macro-F1、AUC和综合指标,但样本较小,泛化仍需更大队列验证。

NEST3D: A High-Resolution Multimodal Dataset of Sociable Weaver Tree Nests Figure 1
2026-06-15cs.CV

NEST3D: A High-Resolution Multimodal Dataset of Sociable Weaver Tree Nests

Constanza A. Molina Catricheo, Simon Boeder, Ting-Jia Guo, Giacomo May, Clément Berthelot, Devis Tuia, Friedrich Fedor Reinhard, Fabio Remondino, Benjamin Risse

2026-06-15视觉语言数据集/基准三维

针对织巢鸟巢穴与宿主树冠交织、缺少精细三维标注数据而难以自动测量的问题,NEST3D用无人机采集104棵带巢树,发布1.4TB RGB、多光谱与约7.81亿点的三维点云,并提供树、巢、草三类专家语义标注。论文还以KPConv、RandLA-Net和Point Transformer V3建立基准,其中PT-v3测试mIoU达86.35%,同时显示极端类别不均衡下不同3D架构表现差异明显。

Visual Quality Score Assessment of Large White Goods in Remanufacture with Multi-View Deformable-DETR Figure 1
2026-06-15cs.CV

Visual Quality Score Assessment of Large White Goods in Remanufacture with Multi-View Deformable-DETR

Paul Koch, Vivek Chavan

2026-06-15视觉感知

面向大件白色家电再制造中人工质检耗时、主观且难以支撑定价的问题,论文将 Deformable-DETR 扩展到多视角质量评分,并结合 DINOv2 冻结特征、自监督多视角预训练、少量专家分数微调及热力图解释。工业数据含 2298 台设备、2.33 万图像;实验显示多视角结构与预训练逐步带来改进,可生成质量分和关注区域,但数据规模较小且人工评分不一致,具体增益稳定性仍受限。

Rethinking Global Average Pooling: Your Classifier Is Secretly a Multi-Instance Learner Figure 1
2026-06-15cs.CV

Rethinking Global Average Pooling: Your Classifier Is Secretly a Multi-Instance Learner

Aray Karjauv

2026-06-15视觉感知

针对单标签分类把多物体场景压成单一图像预测、难以判断证据来源的问题,论文指出GAP加线性分类头可等价为对空间网格逐点分类后求平均,因而普通分类器可被解释为多实例学习器。作者用这一结构做无需重训的稠密读出诊断,发现ImageNet、ImageNet-A和COCO设置中,现成CNN/ViT及自监督特征仍能在前景区域恢复真实类别,许多失败更像是均值聚合稀释局部证据所致。

A Lightweight Fiducial-Based Pipeline for 3D Hyperspectral Mapping of ex-vivo Lumpectomy Specimens Figure 1
2026-06-15cs.CV

A Lightweight Fiducial-Based Pipeline for 3D Hyperspectral Mapping of ex-vivo Lumpectomy Specimens

Anna Bicchi, Alberto Rota, Leonardo Passoni, Nicola Ancellotti, Andrea Peroni, Lorenzo Vinco, Dario Polli, Elena De Momi

Authors are with the Department of Electronics, Information and Bioengineering (DEIB), Politecnico di Milano, Milan, Italy, Authors are with the Department of Physics, Politecnico di Milano, Milan, Italy

2026-06-15三维

针对乳腺保乳手术中高光谱图像只能给出二维可疑区域、难以对应到切除标本真实表面的痛点,论文提出用消费级RGB多视角和单次HSI采集、借助四个ArUco标记完成免标定三维重建与2D-3D配准的轻量流程。在两例离体肿块切除标本上,中位三维配准误差低于1毫米、二维重投影误差低于0.02毫米,单例处理少于4分钟。

Scratched Lenses, Shifted Depth: Passive Camera-Side Optical Attacks Figure 1
2026-06-15cs.CV

Scratched Lenses, Shifted Depth: Passive Camera-Side Optical Attacks

Qinlin He, Zeming Zhuang, Yongji Wu, Lan Zhang, Xiaoyong (Brian) Yuan

2026-06-15视觉感知

该文关注视觉/机器人系统中被忽视的相机端被动光学风险:普通镜头划痕在强点光源或高光触发下会生成随场景变化的条纹,从而误导几何感知。核心创新是把划痕建模为光学空间中的触发条件攻击通道,并优化固定物理划痕而非像素扰动。数字与真实实验显示,SLASH可使单目深度产生最高约32%的定向相对误差,并影响单目3D检测;常规去眩光和对抗训练难以完全消除该效应。

Value-order Decomposition for Generalist Anomaly Detection Figure 1
2026-06-15cs.CV

Value-order Decomposition for Generalist Anomaly Detection

Miaoyun Zhao, Jing Chen, Miaoni Zhao, Qiang Zhang

Dalian University of Technology, Xi’an Chang’an Vanke City Primary School, Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education, Dalian, China.

2026-06-15视觉感知

面向工业/医疗视觉异常检测中目标类别、缺陷类型和数据域变化导致的跨域泛化困难,论文提出 Value-Order Decomposition,将残差特征拆为跨差距稳定的 value 分量与携带类别/结构偏差的 order 分量,并仅用少量正常样本加 Cut-and-Paste 合成异常作参考。实验称该简单框架在多类工业与医疗基准上提升三类泛化能力,甚至接近或超过依赖真实异常参考的方法。

MooMIns -- Monocular 3D Reconstruction and Object Pose Estimation from Multiple Instances Figure 1
2026-06-15cs.CV

MooMIns -- Monocular 3D Reconstruction and Object Pose Estimation from Multiple Instances

Robert Langendörfer, Markus Hillemann, Markus Ulrich

2026-06-15三维

面向工业拣选中仅有单张RGB图、却包含同一物体多个姿态实例的场景,MooMIns利用实例间隐含多视角约束,反转高斯泼溅的建模方式:学习一个共享规范物体,并在各实例位姿下渲染优化,结合SAM3掩码与改造SfM初始化,避免单目深度先验幻觉。实验在合成与真实料箱数据上同时改进重建Chamfer距离和6D位姿误差,但金属少纹理场景仍依赖较强初始化。

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products Figure 1
2026-06-15cs.CV

IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products

Haonan Qi, Jin Cao, Yongqi Zhang, Xintong Wang, Weidong Tang, Bin Chen, Chengfu Huo, Haojun Pan, Hengyu You, Jing Li, Yingde Wang, Liang Ding

single-image accuracy, is the core bottleneck. Dataset and code are publicly available., tables, nameplates, and labels, requiring reliable text recognition. Beyond surface-level reading, technical, Figure 1 Four Challenges in Multi-Image Industrial Product Understanding: (1) text recognition from labels and, MMMU (Yue et al., 2024) and MMMU-Pro (Yue et al., 2025) measure college-level multimodal reasoning, AVE has evolved from sequence labeling on product titles (Zheng et al., 2018

2026-06-15视觉感知数据集/基准

面向工业品采购与匹配中规格信息分散在表格、铭牌和图纸多张图片上的问题,论文提出 IndustryBench-MIPU,以结构化属性-值抽取评估多模态大模型的 OCR、图纸推理、领域术语理解和跨图整合能力。基准含 4559 个产品、27652 张图和 10.37 万标注;9 个模型虽有 86–94% 精度,但产品级最高召回仅 49.9%,显示瓶颈主要在多图证据整合而非单图识别。

FLaRA: Predicting Future Latent Representations for Accident Anticipation Figure 1
2026-06-15cs.CV

FLaRA: Predicting Future Latent Representations for Accident Anticipation

Lorenzo Caselli, Tomaso Trinci, Tommaso Bianconcini, Simone Magistri, Leonardo Taccari, Francesco Sambo, Andrew D. Bagdanov

2026-06-15视觉感知

面向行车记录仪中事故需提前预警而非事后检测的问题,FLaRA不再把已观测帧直接映射为碰撞概率,而是基于V-JEPA2先预测未来场景的潜在表示,再用这些预测特征分类,并以潜表示重建损失和交叉熵联合约束。作者在Nexar训练,并在DAD、DADA-2000、DoTA跨域验证,AP/AUC达到或超过现有方法且参数更少,但平均提前量与强基线接近,固定预测时域仍是限制。

Point Cloud Upsampling through Patch-based Frequency Superposition Figure 1
2026-06-15cs.CV

Point Cloud Upsampling through Patch-based Frequency Superposition

Marina Ritthaler, Azhar Hussian, Vasileios Belagiannis, André Kaup

2026-06-15三维

针对神经网络点云上采样依赖同分布训练数据、可解释性弱且可能扭曲几何的问题,本文提出无需训练的 PUtPFS:优先在稀疏区域选种子点,生长局部 patch,并用空间频率叠加拟合局部曲面后放置新点。实验称其在 PU-GAN、PU1K 上 P2F 超过现有深度方法,并在优化类方法中取得最佳 CD/HD,但对近距离双曲面和细线结构仍有限。

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models Figure 1
2026-06-15cs.CV

ForceForget: Reinforcement Concept Removal for Enhancing Safety in Text-to-Image Models

Dong Han, Yong Li

2026-06-15视觉感知安全鲁棒

该文针对文本到图像模型的安全概念擦除问题:现有监督微调方法常把有害概念与提示中的良性语义一并抹除,导致人物等正常生成能力下降。ForceForget 将概念擦除改写为强化学习中的奖励优化,设计安全与对齐奖励,并在交叉注意力中加入 Safe Adapter 调节部分文本嵌入以减轻过度擦除。实验显示其在多数据集上降低不安全生成,同时更好保留良性图像质量,并在红队攻击和 I2I 场景下较基线更稳健;还扩展到风格和物体擦除。

CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation Figure 1
2026-06-15cs.CV

CausalMotion: Structured Physical Reasoning as Keyframe and Trajectory Guidance for Training-Free Video Generation

Sihan Zhuang, Xinyuan Chen, Tianfan Xue, Yaohui Wang

Shanghai Artificial Intelligence Laboratory, 2 ShanghaiTech University, The Chinese University of Hong Kong

2026-06-15视觉感知规划控制

针对视频扩散模型常出现物理不一致、长时因果转移跳变的问题,CausalMotion 将推理与生成解耦:用视觉语言模型把文本分解为因果关键帧和对象运动轨迹,再作为推理期软约束引导预训练视频模型,无需训练或标注。实验显示其在动态密集场景提升物理合理性与时序连贯性,PhyGenBench 平均分 0.65,较 LTX-Video 基线提升 67%,同时保持较高 VBench 质量分。

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation Figure 1
2026-06-15cs.CV

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation

Victor Barberteguy, Ahmet Iscen, Mathilde Caron, Alireza Fathi, Gül Varol, Cordelia Schmid

2026-06-15视觉感知三维

Pano3D针对无相机参数多视图重建模型缺乏稳健语义理解的问题,将基于查询的集合式全景分割头接到前馈3D重建骨干上,融合单目编码器与跨视图解码器特征,并用几何与语义损失联合微调,避免外部2D模型和聚类后处理。实验显示该框架可适配MUSt3R、Pi3等骨干,在ScanNet、ScanNet200和ScanNet++的3D全景分割上达到SOTA,同时基本保持重建能力。

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective Figure 1
2026-06-15cs.CV

What Drives Test-Time Adaptation for CLIP? A Controlled Empirical Study from an Update Perspective

Jiazhen Huang, Xiao Chen, Zhiming Liu, Yaru Sun, Jingyan Jiang, Zhi Wang

Tsinghua University, Shenzhen Technology University

2026-06-15规划控制

针对CLIP在部署分布偏移下零样本性能不稳、TTA4CLIP方法增益来源不清的问题,本文构建TTABC统一评测20余种方法,并按测试时更新对象划分为参数、状态、推理三类。核心结论是,收益主要来自测试样本证据和可靠代理,而非复杂参数优化;轻量原型更新或跨/当前样本证据也能取得有竞争力且高效的表现,但不同偏移需匹配不同范式,不存在通用最优方案。

Pix2Pix-Hybrid: Structure-Guided Conditional Synthesis of Hajj Crowd Images with Multi-Channel Conditioning and Weak Attribute Supervision Figure 1
2026-06-15cs.CV

Pix2Pix-Hybrid: Structure-Guided Conditional Synthesis of Hajj Crowd Images with Multi-Channel Conditioning and Weak Attribute Supervision

Amirah F. Alshammari, Bander A. Alzahrani, Nahed A. Alowidi

Information Systems Department, Faculty of Computing and Information Technology, King Abdulaziz University, Jeddah, Saudi Arabia, Department of Information Systems, College of Computer and Information Sciences, Jouf University, Aljouf, Saudi Arabia, Computer Science Department, Faculty of Computing and Information Technology, King Abdulaziz University, Jeddah, Saudi Arabia

2026-06-15视觉感知

针对朝觐场景人群计数缺少标注数据且采集存在隐私风险的问题,论文提出 Pix2Pix-Hybrid,用边缘、灰度、密度和时段等八通道条件约束 U-Net 生成器,并用双尺度 PatchGAN、感知/特征匹配损失和自适应增强稳定训练。模型基于 993 帧生成 1 万张 CrowdH 图像,较 Pix2Pix、StyleGAN2-ADA 保持结构更好;加入筛选合成图后,五种计数模型 MAE 均下降,CSRNet 增益最大。

A Robust Point Cloud Analysis Framework Inspired By Primary Visual Cortex Figure 1
2026-06-15cs.CV

A Robust Point Cloud Analysis Framework Inspired By Primary Visual Cortex

Jisheng Dang, Dengyue Pan, Delin Deng, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua

2026-06-15三维安全鲁棒

针对点云模型在稀疏、遮挡、噪声和形变下鲁棒性不足且能耗偏高的问题,论文借鉴初级视觉皮层提出 DC-CCNN++:用离散—连续协同编码的脑启发网络替代部分 MLP,并加入全局增益调制、双码读出和渐进扰动训练。实验显示其在分类与部件分割上优于原 DC-CCNN,鲁棒性覆盖多类退化,同时保持接近主流方法的性能与较低能耗。

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs Figure 1
2026-06-15cs.CV

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

Hikvision Research Institute, Peking University, East China Normal University

2026-06-15视觉语言

针对大视觉语言模型中视觉 token 过长导致推理开销高、传统剪枝一旦丢弃 token 便造成后续层信息不可恢复的问题,论文指出不同层关注的视觉区域并不相同,提出 ALVTS 在每层用轻量低秩选择器动态挑选重要 token,低重要 token 跳过当前层后再合并,无需重训。在 LLaVA-1.5、LLaVA-NeXT、Qwen2.5-VL 上,89% 压缩率下保留 96.7% 原性能,并带来约 1.6× 加速。

HiST: A Hierarchical Sparse Transformer for Cross-Modal Spatial Transcriptomics Modeling Figure 1
2026-06-15cs.CV

HiST: A Hierarchical Sparse Transformer for Cross-Modal Spatial Transcriptomics Modeling

Weiyi Wu, Xinwen Xu, Xingjian Diao, Siting Li, Zhi Wei, Alma Andersson, Jiang Gui

2026-06-15视觉感知

空间转录组成本高、通量低,而从常规 H&E 全切片预测基因表达又面临稀疏不规则采样与多尺度上下文建模开销。HiST 将测点组织为稀疏格点场,在有效组织区域上用二分层级编码器-解码器和稀疏窗口注意力建模,并用切片校准 token 处理染色/扫描差异。多器官基准中其精度达到或优于近期方法,同时推理约快一个数量级、峰值显存低一个数量级以上。

Spectrum Aware Illumination Estimation Using Multispectral Image Figure 1
2026-06-15eess.IV

Spectrum Aware Illumination Estimation Using Multispectral Image

Hyejin Oh, Woo-Shik Kim, Sangyoon Lee, YungKyung Park, Je-Won Kang

2026-06-15视觉感知

本文针对多光谱图像中光照谱估计难以充分利用通道相关性、且跨传感器维度迁移需反复训练的问题,提出含3D卷积、光照先验谱注意力和多头谱自注意力的时空/谱特征提取框架,并用线性谱域变换把高维SPD投影到不同相机空间。作者还构建真实多光照MS数据集,实验显示其精度优于既有方法且可零额外训练适配低维传感器。

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators Figure 1
2026-06-15cs.CV

A Multi-Domain Feature Fusion Framework for Generalizable Deepfake Detection Across Different Generators

Amna Amjid, Sana Qadir, Mehwish Fatima, Raja Khurram Shahzad

School of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), Islamabad, Pakistan, Department of Communication, Quality Management and Information Systems, Mid Sweden University, Ostersund Campus, Sweden, Department of Computer Science, Electrical and Space Engineering, Lulea University of Technology, Luleå, Sweden.

2026-06-15视觉感知

针对现有深伪检测器依赖单一空间或频域线索、在未见 GAN/扩散生成器上易失效的问题,本文提出 SGFF-Net,在双残差网络中融合空间、梯度与 DWT 小波频域特征,强调跨域互补取证线索。实验显示其同数据集准确率达 98.95%,跨模型/跨范式约 70%,结合多源训练与增强后提升至 79.80%、78.12%,真实场景达 75.80%,但部分增益可能主要来自数据多样性与增强。

Hybrid Classical-Quantum (HCQ) Alzheimer's Classification via Supervised $β$-VAE and Quantum Kernels Figure 1
2026-06-15cs.CV

Hybrid Classical-Quantum (HCQ) Alzheimer's Classification via Supervised $β$-VAE and Quantum Kernels

Tia Tiwari, Vamshi Krishna Kancharla, Neelam Sinha

Centre for Brain Research, Indian Institute of Science, Vision and AI Lab (VAL), Indian Institute of Science

2026-06-15生成模型

针对阿尔茨海默病3D MRI分类中样本少、直接深度模型易过拟合而手工特征又易丢失病灶信号的问题,论文提出先用监督β-VAE学习64维疾病感知表征,再经PLS选6维送入ZZ量子特征图和量子核SVM。ADNI-1的308例上,稳定版由67.2%准确率、0.759 AUC提升到72.1%、0.799,并称跨折方差减半;但样本规模较小,量子核相对经典核的独立增益仍需更多消融说明。

Context-aware Modality-Topology Co-Alignment for Multimodal Attributed Graphs Figure 1
2026-06-15cs.LG

Context-aware Modality-Topology Co-Alignment for Multimodal Attributed Graphs

Sirui Zhang, Xu Wang, Zhengyu Wu, Xunkai Li, Hongchao Qin

2026-06-15视觉语言

这篇 arXiv 预印本关注多模态属性图中固定邻域传播与过度融合导致的任务不适配和模态细节丢失问题。CoMAG 的核心思路是先按跨模态语义一致性评估边可靠性、补全语义邻居,并用任务门控选择上下文,再以模态保留的多跳 token 对齐和共享/私有解耦同时服务图任务与模态任务。在 9 个 OpenMAG 数据集上,其相对特征、图、 multimodal 与统一 MAG 基线取得最佳报告性能,但具体增益对数据与协议的依赖仍需进一步验证。

MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction Figure 1
2026-06-15cs.CV

MUSE: Agentic 3D Scene Authoring via Memory-Grounded Incremental Requirement Satisfaction

Ruijie Xu, Xinnan Zhu, Jiayu Ying, Daoguo Dong, Yuzhou Ji, Xin Tan

East China Normal University, Fudan University, Shanghai Jiao Tong University

2026-06-15三维

本文针对文本驱动3D场景生成难以在多轮编辑中保留非目标内容的问题,将构建与编辑统一为“增量需求满足”。MUSE用Architect/Sculptor/Inspector三代理结合工作、场景、技能记忆,逐步分解、局部执行并验证约束。在AuthorBench上,构建All-Goal成功率由37.9提升到80.7,编辑保持率达99.9%,非预期改动仅0.6%。

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling Figure 1
2026-06-15cs.CV

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

Nanjing University, Institute of Artificial Intelligence, China Telecom (TeleAI), Chinese University of Hong Kong, Shenzhen

2026-06-15视觉感知

针对视频扩散模型在视角变化和长时生成中易出现几何漂移的问题,VideoWeave不再依赖深度图、点云等显式重建作为条件或监督,而是在训练期把几何模型的隐式特征适配为几何潜变量,并与视频潜变量联合去噪,再将联合分布蒸馏到学生生成器,推理时无需几何管线。论文还构建GeoVid-80K用于学习几何—外观配对先验,实验显示其在文生视频和图生视频中提升空间一致性与长程几何稳定性,同时基本保持视觉质量和生成效率。

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic Figure 1
2026-06-15cs.CV

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic

Qingping Zeng, Fei She

Tsinghua University

2026-06-15视觉感知

针对小规模 VLA 上选出的视觉编码器是否能迁移到更大骨干这一问题,论文提出冻结语言模型与动作专家、仅训练线性投影的视觉塔 grafting 诊断。结果显示编码器排名随骨干和任务变化:SmolVLA 上 SigLIP 最优,而 π0.5 的空间任务由 DINOv2-small 领先,物体任务则种子敏感近似持平;因此小骨干赢家不能可靠指导大骨干选型,且结论受固定 grafting 协议和离线 MSE 指标限制。

BoRAD: Bootstrap your Own Representations for Multi-class Anomaly Detection Figure 1
2026-06-15cs.CV

BoRAD: Bootstrap your Own Representations for Multi-class Anomaly Detection

Duy Hoang Khuong, Tri Nguyen Minh, Ngu Huynh Cong Viet

Department of Artificial Intelligence, FPT University, Department of IT, Department of Computing Fundamental

2026-06-15视觉感知

面向工业多类别“一模通用”异常检测,BoRAD指出重建模型同时受异常被原样复制的 identical shortcut 与正常类别混淆的 mis-reconstruction 困扰。其核心是在训练期引入共享可学习原型库,用局部原型对齐压缩同原型变化、用全局相对原型对齐保留类间结构;推理仍为教师-学生特征差异,无需标签、负样本或检索。在 MVTec AD、VisA、Real-IAD 上 mAD 分别为 86.2%、80.7%、73.1%,并显示更少异常泄漏和更好正常类别可分性。

Conditioning Matters: Stabilizing Inversion and Attention in Diffusion Image Editing Figure 1
2026-06-15cs.CV

Conditioning Matters: Stabilizing Inversion and Attention in Diffusion Image Editing

Zheyuan Zhan, Hongchen Li, Can Wang, Yinfei Ma, Mingzhen Huang, Ruoshi Bai, Jiawei Chen, Siwei Lyu, Defang Chen

2026-06-15视觉感知生成模型

针对基于反演的扩散图像编辑中重建误差累积、语义编辑与背景保持难兼顾的问题,论文指出文本条件的精确度会改变扩散速度场几何与跨分支注意力一致性。SimEdit通过细化条件并按token区分编辑相关/结构保持成分进行非对称注意力控制,在无需训练的情况下,于PIE-Bench上提升反演重建质量和编辑保真度;但注意力作用时间段仍需手动选择。

Naive Visual Memory is Not Enough: A Failure-Mode Study of GUI Agents Figure 1
2026-06-15cs.MA

Naive Visual Memory is Not Enough: A Failure-Mode Study of GUI Agents

Seoyoung Choi, Minseok Ko, Hyunseok Lee, Kunwoong Kim, Woomin Song, Chanseok Jeon, Jinwoo Shin

2026-06-15视觉感知

论文针对 GUI 智能体引入视觉记忆后效果不清的问题,先将失败归纳为认知失败、视觉状态误解、隐藏操作盲区和定位错误四类,发现整屏截图记忆虽能缓解状态识别错误,却会加重隐藏操作和坐标定位问题。作者提出 AGMem,只保存与成功动作或恢复相关的局部截图并按状态检索;在 OSWorld 上相对整屏视觉记忆将任务成功率提高 33.3%,GPT-5.4-mini 设置下还带来约 6.8 个百分点增益。

A New Multi-Domain Benchmark for Micro-Action Recognition and Detection Figure 1
2026-06-15cs.CV

A New Multi-Domain Benchmark for Micro-Action Recognition and Detection

Yanbin Hao, Pengyu Liu, Xing Wei, Xun Yang, Dan Gu, Meng Wang

2026-06-15视觉感知数据集/基准

针对既有 MA-52 在受控场景、类别规模和评测协议上的局限,本文构建多域微动作基准 MMA-82,将类别扩展到82类,并覆盖实验室、街访、精神健康访谈和情绪电视视频,支持识别与多标签检测及跨域、少样本、零样本评测。实验显示现有方法在域迁移、长尾类别和时间定位上仍明显不足;情绪分析还表明微动作可补充面部微表情,但提升可能主要来自更大规模与多源数据。

FEMOT: Multi-Object Tracking using Frame and Event Cameras Figure 1
2026-06-15cs.CV

FEMOT: Multi-Object Tracking using Frame and Event Cameras

Shiao Wang, Xiao Wang, Chao Wang, Yitao Li, Menghao Liu, Bo Jiang, Yaowei Wang, Yonghong Tian, Jin Tang

2026-06-15视觉感知

该文针对RGB多目标跟踪在低照、过曝、运动模糊等真实场景中易失效且RGB-事件MOT缺少大规模标注基准的问题,构建FEMOT数据集,含100段序列、20万帧、1.458万轨迹和42万框,并覆盖14类挑战;同时提出FEMOTR,将RGB低频外观语义与事件高频运动轮廓在频域解耦融合。作者在FEMOT和DSEC-MOT上重训评测十余种跟踪器,实验显示该频率感知多模态框架优于强基线,但部分增益可能也来自更匹配的数据与训练设置。

Clay-CNN Hybrids: Leveraging Geo-Foundational Models as Auxiliary Context for Landslide Detection Figure 1
2026-06-15cs.CV

Clay-CNN Hybrids: Leveraging Geo-Foundational Models as Auxiliary Context for Landslide Detection

Huong Binh Vu

B. Vu was with Harvard University, Cambridge, MA 02138 USA

2026-06-15视觉感知

面向灾后滑坡快速制图中标注稀缺、滑坡像素仅约2%且与裸土光谱相近的问题,论文比较将地理基础模型 Clay v1.5 作为主编码器、作为 U-Net 瓶颈辅助语义,以及纯 U-Net 三种方案。核心洞察是 Clay 单独替代 CNN 会因缺少多尺度跳连而变差,但作为上下文注入可补足光谱泛化能力;两阶段 LoRA 的 U-Net+Clay 在 L4S 上取得64.5±1.8% F1,高于 U-Net 59.9% 和 Clay-only 55.2±3.6%。

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI Figure 1
2026-06-15cs.CV

Diffusion-Refined Segmentation and Vision-Language Interpretation for Pediatric Brain Tumor MRI

Wentao Ke, Jianche Liu

Department of Mechanical Engineering, Stanford University, School of Medicine

2026-06-15视觉语言视觉感知生成模型

针对儿科脑肿瘤 MRI 标注稀缺、亚区类别不平衡和弥散边界难分的问题,论文采用先由 3D Res U-Net/Swin-UNETR 生成粗分割、再以粗掩码条件化 3D DDPM 与 MedSegDiff 进行扩散细化的两阶段框架,并把体积与叠加图交给多模态语言模型生成放射报告。结果显示条件化扩散提升稳定性和边界质量,MedSegDiff 的 HD95 最低,尤其改善增强肿瘤边界分割。

ShearFuse-UNet: Hadamard, DCT, and Shearlet Transform Fusion for Next-Day Wildfire Spread Prediction Figure 1
2026-06-15cs.CV

ShearFuse-UNet: Hadamard, DCT, and Shearlet Transform Fusion for Next-Day Wildfire Spread Prediction

Ene Meco, Yingyi Luo, Emadeldeen Hamdan, Adam Watts, Ahmet Enis Cetin

under Award No. 2531376. 1 E. Meco, Y. Luo, E. Hamdan and A. E. Cetin are with the Department of Electrical, and Computer Engineering, University of Illinois Chicago, Chicago, IL 60607 USA

2026-06-15强化学习

面向多模态卫星数据的次日野火蔓延分割,论文关注现有 U-Net/模拟器在非线性环境因素和计算成本上的不足。ShearFuse-UNet 在轻量 U-Net 编码器中融合 WHT、DCT 与 Shearlet 三类固定变换,用门控融合谱表示并以方向性残差刻画火线边缘。其在 WildfireSpreadTS 上以 26.7 万参数取得 F1=0.596、IoU=0.424,略高于 1400 万参数 ResNet18-U-Net,Google 数据集也显示可迁移性。

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision Figure 1
2026-06-15cs.SD

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

Shiyao Wang, Xijuan Zeng, Hui Wang, Shiwan Zhao, Feng Deng, Chen Zhang, Yong Qin

Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China

2026-06-15视觉感知规划控制

针对现有视频生音频方法在时间同步、多模态控制与细粒度语义之间难以兼顾的问题,FoleyGenEx 基于 MMDiT 引入参考音频条件注入、多模态动态遮蔽和副词增强数据,支持 VTA、文本/音频控制与 Foley 扩展。AudioCaps、VGGSound、Greatest Hits 实验显示其在同步、可控性和语义指标上具竞争力,但具体增益仍可能部分来自数据增强。

WAM4D: Fast 4D World Action Model via Spatial Register Tokens Figure 1
2026-06-15cs.CV

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, Sirui Han, Shanghang Zhang

2026-06-15强化学习

WAM4D针对现有世界动作模型停留在2D视频/潜空间、难以刻画操作所需3D约束,而显式预测 dense 4D 又拖慢推理的问题,提出用空间register token在训练期读取未来深度、蒸馏几何基础模型先验,并通过因果混合注意力避免模态间非因果捷径;部署时移除几何分支,保持轻量观测到动作接口。在RoboTwin 2.0和真实长程操作中,模型提升空间一致性和成功率,同时维持较高推理效率。

Rethinking One-Step Image Editing through ChordEdit: Reproduction, Simplification, and New Insights Figure 1
2026-06-15cs.CV

Rethinking One-Step Image Editing through ChordEdit: Reproduction, Simplification, and New Insights

Minghan Li, Jeremy Moebel, Mengyu Wang

Harvard AI and Robotics Lab

2026-06-15视觉感知

本文针对一步文本引导图像编辑虽高效但机制不清的问题,复现并重析 ChordEdit。核心洞察是 chord window δ 很大程度等价于把编辑时刻从 t 移到 t−δ,增益主要来自合适 timestep 而非完整 chord 传输;其过程可分解为高噪声下的低频语义迁移与低噪声近端细化。复现实验显示 chord 传输更稳定提升保真但语义增益不一致,近端细化则稳定增强编辑语义但略损背景保持。

Toward 360-Degree Indoor Panorama Editing via Tuning-Free Diffusion Model with Refocusing Cross-Attention Figure 1
2026-06-15cs.CV

Toward 360-Degree Indoor Panorama Editing via Tuning-Free Diffusion Model with Refocusing Cross-Attention

Dinh-Khoi Vo, Nhut-Thanh Le-Hinh, Viet-Tham Huynh, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

2026-06-15生成模型

针对零样本文本引导扩散编辑在小目标、多物体室内场景中易受提示影响、编辑外溢且破坏背景的问题,论文提出 FocusDiff:先由分割或手选确定目标区域,再通过对非编辑区选择性模糊来重聚焦交叉注意力,并结合上下文保持模块稳定背景。其扩展到 360 度全景编辑,在 LIMB 基准上相较现有零样本方法取得更好的文本对齐、背景保真和真实感。

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark Figure 1
2026-06-15cs.CV

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

2026-06-15数据集/基准

面向时尚设计中从草图生成成衣图像的需求,论文指出现有模型缺少大规模高质量草图—语义资源,难以保留廓形、垂坠和装饰细节。GarmentSketch构建了26,249个覆盖21类服装的草图—丰富文本描述数据集,并用多MLLM加人工校验生成标注;作者还评测多种扩散和多模态生成模型,给出基线并显示当前方法虽有潜力,但在设计意图与细粒度结构保持上仍明显受限。

ViT-Up: Faithful Feature Upsampling for Vision Transformers Figure 1
2026-06-15cs.CV

ViT-Up: Faithful Feature Upsampling for Vision Transformers

Krispin Wandel, Jingchuan Wang, Hesheng Wang

K. Wandel, J. Wang, and H. Wang are with Shanghai Jiao Tong University, Shanghai, China. Corresponding author: Hesheng Wang.

2026-06-15视觉感知

ViT低分辨率token网格限制分割、深度等密集预测,现有图像引导上采样又易因浅层编码器产生特征泄漏和模糊。ViT-Up将上采样改为坐标条件的隐式特征解码,直接利用ViT中间层逐层构造查询并保持特征空间对齐。实验显示其在Cityscapes、COCO深度和SPair-71k上优于NAF、UPLiFT等方法,DINOv3-B下增益扩大到+3.36 mIoU和+8.09 PCK@0.10。

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation Figure 1
2026-06-15cs.CV

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar

Carnegie Mellon University

2026-06-15视觉语言视觉感知

面向端到端自动驾驶中 VLA 模型因大视觉语言骨干和自回归推理导致难以实时部署的问题,RT-VLA 将 SimLingo 教师的驾驶与语言能力蒸馏到轻量学生,通过视觉特征、查询表示、路点预测和语言 logits 的多层监督,并把解释性语言分析后置到离线安全片段。Bench2Drive 上其闭环驾驶和语言推理接近教师,视觉模式推理提速 44.8 倍,视觉+语言模式提速 7.9 倍。

HARBOR: Heading Analysis and Reconstruction from Behavioral Observation and Radar Figure 1
2026-06-15cs.CV

HARBOR: Heading Analysis and Reconstruction from Behavioral Observation and Radar

Joao P. A. Dantas, Paulo F. Silva Filho, Jelton A. Cunha, Gabriel Dietzsch

Joao P. A. Dantas 1 1 1 Researcher, C4ISR Division, Institute for Advanced Studies (IEAv)., Paulo F. Silva Filho 2 2 2 Researcher, C4ISR Division, Institute for Advanced Studies (IEAv)., Jelton A. Cunha 3 3 3 Researcher, C4ISR Division, Institute for Advanced Studies (IEAv)., and Gabriel Dietzsch 4 4 4 Researcher, C4ISR Division, Institute for Advanced Studies (IEAv).

2026-06-15三维

针对AIS缺失、欺骗或卫星重访不足时单幅SAR只能给出静态船位的问题,HARBOR将离线AIS统计与在线SAR图像分析解耦:先做预处理、船舶检测、按尺寸分类,并用骨架几何和局部强度估计艏艉方向,再按船型速度与角度分布生成未来位置概率热图。在巴西南部COSMO-SkyMed实景案例中,该流程能给出船舶运动趋势和候选位置投影,但文中主要是案例展示,定量增益未充分说明。

Context-Guided Semantic Alignment for Feature Fusion Networks Figure 1
2026-06-15cs.CV

Context-Guided Semantic Alignment for Feature Fusion Networks

Hyungseop Lee, Jiho Lee, Woochul Kang

2026-06-15视觉感知

该文针对目标检测特征金字塔中高层语义强、低层定位细但直接融合会产生语义不一致的问题,提出可插拔的 FINE 模块:先用高层上下文通过跨层注意力调制低层特征,并以 Alignment-Aware Token Sampling 对齐跨尺度区域、降低注意力开销。COCO 实验显示其可在多种检测器上以很小推理代价提升精度,主要减少背景误检,并改善小目标检测。

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation Figure 1
2026-06-15cs.CV

Prompt2Effect: Training-Free Image-to-Video Model Specialization via LoRA Generation

Xiaomeng Yang, Yanyu Li, Gordon Guocheng Qian, Ivan Skorokhodov, Viacheslav Ivanov, Avalon Vinella, Xuan Zhang, Yanzhi Wang, Sergey Tulyakov, Anil Kag

Work done during internship at Snap Inc.

2026-06-15视觉感知

面向图像到视频生成中“每个特效都要重新训练 LoRA”的高成本问题,Prompt2Effect把特效描述转化为一次前向生成的LoRA权重。关键在于让超网络同时读取冻结基模型权重,并用SVD规范化LoRA因子消除分解歧义,从而稳定预测大规模I2V适配器。实验称其质量和特效对齐可比或优于常规微调,单特效成本由56 GPU小时降至3.3秒,且可作为初始化带来约10倍加速。

CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis Figure 1
2026-06-15cs.CV

CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis

Dongyu Wang, Dar-Yen Chen, Yi-Zhe Song

SketchX, CVSSP, University of Surrey

2026-06-15生成模型

本文针对草图驱动夸张肖像中“保身份”与“跟形变”相互干扰的问题,指出其根源是扩散去噪中的条件信号污染。CaricHarmony在推理时并行维护纯身份、纯形状与融合三条扩散路径,并用跨注意力特征上的形状与身份能量函数进行梯度引导,无需训练或逐身份微调。实验显示其可接受任意草图格式,约16秒生成,在形状CLIP分数、审美指标和用户偏好上优于DemoCaricature、CaricatureBooth等基线,同时保持相近身份一致性。

High-Fidelity Video Compression based on Invertible Neural Transform and Implicit Conditioning Figure 1
2026-06-15eess.IV

High-Fidelity Video Compression based on Invertible Neural Transform and Implicit Conditioning

Siyue Teng, Ho Man Kwan, Yuxuan Jiang, Fan Zhang, David Bull

Visual Information Lab, University of Bristol, UK

2026-06-15视觉感知

针对现有神经视频编码在高质量区间受非可逆变换近似误差限制、难以覆盖宽码率范围的问题,InnVC在量化前保留可逆主变换路径,并用紧凑隐式条件场注入内容自适应时空上下文,再通过调度式通道掩码提升熵编码效率。UVG和MCL-JCV实验显示其在高保真区间优势明显,相对x265在UVG上PSNR BD-rate降低21.66%、MS-SSIM降低46.06%,且单一架构覆盖超过20 dB PSNR范围。

Self-Evolving Visual Questioner Figure 1
2026-06-15cs.CV

Self-Evolving Visual Questioner

Yijun Liang, Hengguang Zhou, Ming Li, Lichen Li, Cho-Jui Hsieh, Tianyi Zhou

University of Maryland, College Park, University of California, Los Angeles, Peking University

2026-06-15视觉感知

论文针对VLM长期被训练成“被动答题者”、缺乏主动提出视觉扎根且有推理价值问题的能力,提出无需人工标注或外部教师的自进化视觉提问框架:模型在多种视觉意图下生成问题,再经重写、过滤与QA/QG双格式训练迭代提升。实验显示两轮后问题生成评分相对基座提升约82%,问题更具多样性、感知难度和推理性,同时VQA能力基本保持甚至部分提升。

GMN4AD: Graph Matching Network for Alzheimer's Disease Diagnosis with Test-Time Domain Adaptation using Multi-centered Structure Magnetic Resonance Imaging Figure 1
2026-06-15eess.IV

GMN4AD: Graph Matching Network for Alzheimer's Disease Diagnosis with Test-Time Domain Adaptation using Multi-centered Structure Magnetic Resonance Imaging

Chen Zhao, Huan Huang, Yixin Xie, Jiajing Huang, Weihua Zhou, Nandakumar Narayanan

using Multi-centered Structure Magnetic Resonance Imaging, . Department of Computer Science, Kennesaw State University, Marietta, GA, 30060, . Department of Information Technology, Kennesaw State University, Marietta, GA, 30060, . School of Data Science and Analytics, Kennesaw State University, Marietta, GA, 30060, . Department of Applied Computing, Michigan Technological University, Houghton, MI, 49931, USA, . Department of Neurology, University of Iowa, Iowa City, IA, 52242

2026-06-15视觉感知

针对多中心结构 MRI 中扫描协议、站点与个体差异导致脑图异质、传统 GNN 泛化受限的问题,GMN4AD 不再独立编码单个脑图,而是通过图匹配建模患者脑图间关系,并在测试时用对比学习与图重建无标签自适应。ADNI、AIBL、OASIS3 上多项 AD/MCI/CN 分类优于对比方法,AD vs CN 在 ADNI/AIBL 准确率约 0.92,但 OASIS3 指标波动显示跨中心鲁棒性仍有限。

Overhead Wildlife Locator (OWL): Benchmarking Weakly Supervised Learning for Aerial Wildlife Surveys Figure 1
2026-06-15cs.CV

Overhead Wildlife Locator (OWL): Benchmarking Weakly Supervised Learning for Aerial Wildlife Surveys

Isai Daniel Chacón, Zhongqi Miao, Bruno Demuro, Caleb Robinson, Rahul Dodhia, Lasha Otarashvili, Jason Holmberg, Kirk Larsen, Howard Frederick, Nathan J. Pamperin, Pablo Arbeláez, Juan M. Lavista Ferres

2026-06-15数据集/基准

针对航拍野生动物普查中框标注成本高、点标注更易规模化的问题,论文提出弱监督密度估计框架 OWL,并比较 CNN、Swin 混合与冻结 DINOv3 基础模型三种变体。结果显示 OWL-D 在多数公开数据集取得最高 AP,并在 Delplanque 上超过 HerdNet;但极高密度场景由 OWL-T/OWL-C 更稳,说明最佳架构依赖调查密度与场景类型。

PMOF: A Dataset and Benchmark for Passenger Monitoring Using Overhead Fisheye Cameras Figure 1
2026-06-15cs.CV

PMOF: A Dataset and Benchmark for Passenger Monitoring Using Overhead Fisheye Cameras

Stella Katharina Wermuth, Qazi Arbab Ahmed, Klaus Neumann, Thorsten Jungeblut

2026-06-15数据集/基准

面向无人值守公共交通,车厢内监控受运动、光照变化、遮挡和鱼眼畸变影响,而现有公开顶视鱼眼数据多来自静态场景。PMOF首次提供移动车辆内顶置鱼眼数据,含1.97万帧、旋转框、跟踪ID和动作标签,并用YOLO26m-obb建立检测基准;结合静态鱼眼数据与旋转感知增强后,在PMOF上达94.8% AP50,在外部HABBOF上达96.5% AP50,显示其主要价值在于补足动态车厢域差并提升跨域泛化。

HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing Figure 1
2026-06-15cs.CV

HiLo-Token: Input-Adaptive High-Low Frequency Token Compression for Efficient Image Editing

Haoran You, Yotam Nitzan, Lingzhi Zhang, Yifan Gong, Mang-Tik Chiu, Connelly Barnes, Yan Kang, Yuqian Zhou, Eli Shechtman, Sohrab Amirghodsi

Adobe ART AI Lab

2026-06-15视觉感知

面向 Photoshop 等交互式图像编辑中 DiT 推理占主要延迟、服务成本高的问题,HiLo-Token 利用用户掩码与图像频率差异做输入自适应 token 压缩:掩码膨胀区保留完整 token,区外用 Sobel/池化选择高频细节,并以 16× 下采样 token 承载低频全局结构。生产级样本上,在小/中/大掩码比例下分别获得 3.13×、2.59×、1.67× DiT 加速,报告无生成质量回退。

How do Self-Supervised Remote Sensing Vision Models Transfer to Downstream Tasks? Figure 1
2026-06-15cs.CV

How do Self-Supervised Remote Sensing Vision Models Transfer to Downstream Tasks?

Julia Romero, Qin Lv, Morteza Karimzadeh

University of Colorado Boulder, University of Colorado Boulder Boulder CO USA

2026-06-15视觉感知

针对遥感自监督基础模型在不同下游任务中排名不稳定、难以解释的问题,本文系统比较六类 GeoFM 在分类、回归和分割中的迁移,并用逐层探针与 CKA 分析表征组织方式。结果显示,中间层常比最终嵌入更含任务信息,分割性能受解码器和微调策略影响可与模型选择相当,微调变化主要局限于 ViT 块 MLP 首个线性层,提示评测与适配需更关注表征深度结构。

Gefen: Optimized Stochastic Optimizer Figure 1
2026-06-15cs.LG

Gefen: Optimized Stochastic Optimizer

Nadav Benedek, Tomer Koren, Ohad Fried

Reichman University, Tel Aviv University, Google Research

2026-06-15视觉感知

针对 AdamW 在大模型训练中需为一、二阶动量额外保存约两份参数状态、限制显存和吞吐的问题,Gefen 的核心思路是用初始平方梯度自动推断参数块,共享二阶矩,并用动态规划学习码本量化一阶矩;其理论洞察是 Hessian 强耦合参数的平方梯度比例会趋近。实验显示其在多种模型与 FSDP/DDP 设置下保持 AdamW 级性能,同时将优化器内存约降至 1/8,并因可用更大 microbatch 提升吞吐。

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation Figure 1
2026-06-15cs.RO

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

Namai Chandra, Shriram Damodaran, Lin Wang

EmPACT Lab, Nanyang Technological University

2026-06-15机器人

论文针对VLA只拟合示教、缺少刚体动力学与接触约束导致动作物理不一致的问题,提出无需重训的推理时外接模块PhysVLA:用任务阶段有限状态机划分接近、抓取、搬运、放置,并以选择性Euler-Lagrange门控只在检测到动力学残差时修正动作。在LIBERO-Spatial上跨四类VLA最高提升17个百分点成功率、19个百分点稳定性,轨迹效率提升至15%,并在真实Agilex Piper抓放中显示可迁移增益。

Avatar V: Scaling Video-Reference Avatar Video Generation Figure 1
2026-06-15cs.CV

Avatar V: Scaling Video-Reference Avatar Video Generation

Benjamin Liang, Ce Chen, Desmond Lin, Ivan Somov, Jiajun Zhao, Jiewei Yuan, Jingfeng Zhang, Junhao Huang, Nik Nolte, Pedram Haqiqi, Penghan Wang, Rong Yan, Rui Zhang, Sam Prokopchuk, Sivan Wang, Viktor Goriachko, Yi Ren, Yuanming Li, Yutao Chen, Zhenhui Ye, Zhibin Hong, Zilong Nie, Zujin Guo

2026-06-15视觉感知

本文针对单图驱动数字人难以保持身份细节、说话节奏和微表情的问题,将个性建模改为直接以参考视频 token 条件化。核心做法包括线性复杂度的 Sparse Reference Attention、运动表征闭环建模和身份感知超分,并配合大规模视频数据与多阶段训练。作者称可生成无限时长 1080p 头像视频,在身份保持、唇同步和主观评价上优于 Seedance、Kling、Veo、OmniHuman 等;但增益可能主要来自 scaling / data。

Mirage Probes: How Vision Models Fake Visual Understanding Figure 1
2026-06-15cs.CV

Mirage Probes: How Vision Models Fake Visual Understanding

Daniel Ben-Levi, Judah Goldfeder, Weiliang Zhao, Raz Lapid, Amit LeVi, Allen G. Roush, Ravid Shwartz-Ziv, Hod Lipson

Daniel Ben-Levi 1 Judah Goldfeder 1 Weiliang Zhao 1 Raz Lapid 2 Amit LeVi 3 Allen G Roush 4 Ravid Shwartz-Ziv 5 Hod Lipson 1 1 Columbia University, New York University

2026-06-15视觉感知

针对VLM在无图时仍能自信回答图像问题、导致基准分数虚高的问题,论文提出Mirage Probes,用改写问题构造对比探针并分析内部激活。结果显示“海市蜃楼”行为可在残差流、MLP、注意力等位置被线性解码,且非简单文本表面特征;作者进一步指出其可能包含文本偏置与伪视觉表征两类机制,因而仅清洗文本分布不足以保证视觉扎根。

Temporal Backtracking Search for Test-time Generative Video Reasoning Figure 1
2026-06-15cs.CV

Temporal Backtracking Search for Test-time Generative Video Reasoning

Sejoon Jun, Zheng Ding, Huangyuan Su, Weirui Ye, Yilun Du

Northeastern University, 2 Independent Researcher, 3 Harvard & Kempner, 4 MIT

2026-06-15视觉感知生成模型

这篇论文针对生成视频作为世界模型进行长时序推理时的一次性采样瓶颈:错误常在时间早期出现,而扩散去噪早期已决定轨迹,后续加算力难以纠偏。作者提出 Temporal Backtracking Search,将测试时搜索从去噪轴转到时间轴,通过可变前缀条件生成、过程验证定位失败帧,并从已验证前缀重启。其在算法、导航和机器人任务中以相同预算优于 BoN,OOD 场景从 0.7% 提升到 22.7%。

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models Figure 1
2026-06-15cs.RO

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Sam Tak Wu Kwong, Yuguang Fang

everything (V2X) communication, collaborative perception, inter-, Index Terms—Autonomous driving, collaborative perception, torically centered on robust, self-contained vehicles that, collaborative intent, and react too late in tightly coupled traffic., toward collaborative autonomy., Lab of Smart City funded by The Hong Kong Jockey Club Charities Trust, Department, University, Sam Tak Wu Kwong is with Lingnan University, Hong Kong. (Email:, of sight and led to collaborative perception (CP) methods based, including collaborative perception, shared world modeling, Surveys collaborative machine learning enabled by

2026-06-15强化学习

面向单车智能在遮挡、部分可观测和密集交互中易失效的问题,本文综述多智能体具身自动驾驶从 V2X 信息交换走向共享世界模型的脉络,核心洞察是协作不应止于传感数据融合,而需维护跨车辆、路侧与交通参与者的预测性共享状态,并支撑意图对齐和联合规划。文中梳理 380 余篇工作,指出现有结果多停留在仿真、离线基准和精选场景,基础模型协同仍缺少开放交通中的实时安全验证。

Explaining RhythmFormer: A Systematic XAI Analysis of Periodic Sparse Attention for Remote Photoplethysmography Figure 1
2026-06-15cs.CV

Explaining RhythmFormer: A Systematic XAI Analysis of Periodic Sparse Attention for Remote Photoplethysmography

Louis Chen, Torbjörn E. M. Nordling

Department of Mechanical Engineering, National Cheng Kung University, Tainan, Taiwan.

2026-06-15视觉感知

本文针对 rPPG Transformer 虽能降低心率误差但解释性不足的问题,系统分析 RhythmFormer 的周期稀疏注意力。核心做法是将 raw attention、rollout、flow 与 Beyond Intuition 适配到 top-k 双层路由注意力,并提出皮肤覆盖率与面向回归的 SaCo 忠实度指标。实验显示 rollout/flow 会产生多跳泄漏、几乎恢复被稀疏层置零的连接,而 Beyond Intuition 在 UBFC-rPPG 上取得最高皮肤覆盖率 0.83 和忠实度 F=0.92,但跨数据集与模型验证仍不足。

Compressing Image Style Training into a Single Model Forward Figure 1
2026-06-15cs.CV

Compressing Image Style Training into a Single Model Forward

Zhongjie Duan, Yingda Chen

2026-06-15视觉感知

针对扩散风格迁移中适配器快但风格弱、LoRA保真却需逐风格训练的问题,论文提出 i2L:用图像编码器、可学习 LoRA 查询和压缩解码头,将一张或多张参考图直接预测为文本到图像模型的 LoRA 权重。该方法把风格内化为显式权重更新,在 Z-Image、FLUX.2、Hidream-O1 上提升风格一致性、提示对齐和感知质量,并支持非对称 CFG、多参考融合及与可控生成模块组合。

$μ_0$: A Scalable 3D Interaction-Trace World Model Figure 1
2026-06-15cs.RO

$μ_0$: A Scalable 3D Interaction-Trace World Model

Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

University of Maryland, College Park, Seoul National University

2026-06-15强化学习三维

针对机器人学习中视频数据丰富但动作标注稀缺且依赖具体本体的问题,μ0主张用物体、工具、手和接触区域的3D交互轨迹替代像素预测或直接动作建模。其TraceExtract从异构视频自动抽取全局对齐、带事件语言标注的轨迹,并用VLM加Trace Expert预测B样条轨迹。实验显示其2D/3D轨迹预测优于基线,冻结后接动作专家在RoboCasa365和UR3任务上可接近或超过带动作预训练的VLA。

CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation Figure 1
2026-06-15cs.CV

CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation

Sharath Girish, Tsai-Shien Chen, Zhikang Dong, Mukesh Singhal, Hao Chen, Sergey Tulyakov, Aliaksandr Siarohin

Snap Inc.

2026-06-15视觉感知

电影级视频生成需要同时控制多主体身份、事件时序、镜头运动与转场,现有方法多按单一轴线处理。CineOrchestra将这些元素统一为带时间区间的“实体”条件,并用区间采样 temporal RoPE 与二维实体-时间 cross-attention RoPE解决长短事件和多实体路由问题。在 CineBench/CineBenchSyn 上,相比六类专项基线,在密集描述遵循和转场时机上更优,用户研究与消融也支持其设计。

Connections Between Pairs of Filters Improve the Accuracy of Convolutional Neural Networks Figure 1
2026-06-15cs.CV

Connections Between Pairs of Filters Improve the Accuracy of Convolutional Neural Networks

Kathleen Anderson, Philipp Grüning, Erhardt Barth

2026-06-15视觉感知

本文针对传统 CNN 依赖逐点非线性、难以表达滤波器间选择性关系的问题,提出在两个并行深度卷积输出之间加入更通用的连接块,并引入可学习参数化 XOR/OR/AND 式连接,使不同层可自适应选择保留或抑制信息。实验显示,在参数量相近下替换部分卷积块可提升小型 SOTA 网络在 CIFAR-10 上的准确率,其中参数化连接优于简单求和和固定 AND 连接。

Morphology-Aware Sample Assignment: Overcoming IoU Insensitivity for Surface Defect Detection Figure 1
2026-06-15cs.CV

Morphology-Aware Sample Assignment: Overcoming IoU Insensitivity for Surface Defect Detection

Pengfei Liu, Yuhan Guo

Key Lab of Ultra-precision Intelligent Instrumentation, (School of Instrumentation, Science and Engineering, Harbin Institute of Technology), Ministry of Industry and, School of Management, Harbin Institute of Technology, Harbin 150001, China, College of Computing and Data Science, Nanyang Technological University

2026-06-15视觉感知

针对工业表面缺陷检测中仅靠 IoU 分配正样本会出现“非敏感区”、难以区分几何差异相近候选框的问题,论文提出 MCC 形态感知样本分配,用面积、形状和长宽比相似度补充匹配分数,使高响应区域更集中且无需推理开销。基于 YOLOv9 在 GC10-DET 与 NEUDET 上均有稳定提升,如 NEUDET 多个 YOLOv9 模型 mAP 约提升 0.9–1.2 个百分点,GC10-DET 横向比较达到 74.2% mAP。

TSA: Temporal Slot Activation for Persistent Object-Centric Video Representation Figure 1
2026-06-15cs.CV

TSA: Temporal Slot Activation for Persistent Object-Centric Video Representation

Duc Nguyen, Sieu Tran, Hao Vo, Khoa Vo, Duy Minh Ho Nguyen, Nghi D. Q. Bui, Anh Nguyen, Long Mai, Ngan Le

University of Arkansas, USA, Max Planck Research School for Intelligent Systems, University of Liverpool, UK

2026-06-15视觉感知

这篇论文针对视频 Slot Attention 在遮挡或目标消失时仍无条件更新、解码所有 slot,导致表示漂移和身份切换的问题,提出 TSA:为每个 slot 学习逐帧激活值,用于门控状态更新和解码注意力,并结合时间记忆判断遮挡与重现。在 MOVi-C/E、YouTube-VIS 和遮挡更重的 OVIS 上,TSA 提升了 FG-ARI、mBO 以及 IDF1、HOTA,尤其改善长视频遮挡场景的身份保持。

Orchestra-o1: Omnimodal Agent Orchestration Figure 1
2026-06-15cs.AI

Orchestra-o1: Omnimodal Agent Orchestration

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu, Donghao Zhou, Zhihong Zhu, Zheng Lian, Xin Wang, Pheng-Ann Heng

Tongji University

2026-06-15视觉感知

针对现有多智能体编排多局限于文本或视觉语言、难以处理文本/图像/音频/视频共存任务的问题,Orchestra-o1将高层决策与感知/行动子智能体解耦,通过模态感知任务分解、在线子智能体专长化和并行执行实现全模态协作,并用DA-GRPO对主智能体的逐步委派与工具选择决策进行强化学习对齐。在OmniGAIA上,GPT-5主智能体版本较次优方法高10.3个百分点,开源Orchestra-o1-8B将最佳开源准确率从20.8%提升到30.0%。

C-MambaPose: A Physics-Informed Complex Mamba Framework for Cross-Environment WiFi Human Pose Estimation Figure 1
2026-06-15eess.SP

C-MambaPose: A Physics-Informed Complex Mamba Framework for Cross-Environment WiFi Human Pose Estimation

Phuc Nguyen H

Phuc Nguyen H. is with VinUniversity, Hanoi, Vietnam

2026-06-15三维

该文针对 WiFi 三维人体姿态估计在跨房间场景中易受多径与相位失真影响、泛化差且模型偏大的问题,提出 C-MambaPose:先校正 CSI 相位并保留复值物理关系,再用复值 Mamba 捕获时空相位动态,并以关节查询和 GCN 骨架先验约束输出。MM-Fi 实验显示其在跨环境划分上 MPJPE 降至 298.5 mm,参数量仅 3.78M,较 GraphPose-Fi 和 MetaFi++ 大幅减少且无需预训练。

2026-06-12

99 篇
InterleaveThinker: Reinforcing Agentic Interleaved Generation Figure 1
2026-06-12cs.CV

InterleaveThinker: Reinforcing Agentic Interleaved Generation

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

CUHK MMLab

2026-06-12强化学习

这篇论文针对现有图像生成器只能单图输出、UMM在长序列中易视觉过度依赖和逐步误差累积的问题,提出Planner-Generator-Critic多智能体框架,为冻结生成器赋予文本-图像交错生成能力。其关键在于先全局规划,再由Critic逐步评估并改写提示,并用SFT数据和GRPO的单步双奖励训练降低长轨迹优化成本。实验显示该方法可提升多种生成器,在交错生成上接近Nano Banana和GPT-5,并将FLUX.2-klein的WISE从0.47提升到0.73、RISE从13.3提升到28.9。

Mana: Dexterous Manipulation of Articulated Tools Figure 1
2026-06-12cs.RO

Mana: Dexterous Manipulation of Articulated Tools

Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, C. Karen Liu

Stanford University 3 {}^{\text{3}}

2026-06-12机器人

针对多指手使用钳子、镊子、注射器等铰接工具时需同时稳定抓握与施加精确驱动力、遥操作和端到端 RL 都难以获得数据的问题,Mana 将操作重写为“动画补间”:少量点击标注功能区域后生成抓握关键帧,用运动规划连接几何阶段、用 RL 处理短程接触阶段,并训练点云条件扩散策略。其在 Allegro 手上对四类工具实现仿真数据训练后的零样本实机抓取与在手驱动,报告成功率较高;但完整任务链仍含腕部遥操作,完全自主性文中未充分说明。

Modality Forcing for Scalable Spatial Generation Figure 1
2026-06-12cs.CV

Modality Forcing for Scalable Spatial Generation

Bardienus Pieter Duisterhof, Deva Ramanan, Jeffrey Ichnowski, Justin Johnson, Keunhong Park

Carnegie Mellon University, World Labs

2026-06-12视觉感知

针对3D/深度数据稀缺且现有T2I改造依赖稠密深度、流程复杂的问题,论文提出 Modality Forcing:在单个DiT中为RGB与深度设置独立噪声层级和解码器,用稀疏真实深度进行联合后训练,统一支持图像到深度、深度到图像和文本生成RGB-D。实验显示深度精度随T2I预训练规模提升,最强模型接近专用单目深度方法,并较既有联合RGB-D生成模型降低57% AbsRel,但部分增益可能主要来自scaling/data。

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers Figure 1
2026-06-12cs.CV

RepWAM: World Action Modeling with Representation Visual-Action Tokenizers

Junke Wang, Qihang Zhang, Shuai Yang, Yiming Luo, Yujun Shen, Zuxuan Wu, Yu-Gang Jiang, Yinghao Xu

2026-06-12强化学习

RepWAM针对现有世界动作模型沿用像素重建型视频 tokenizer、语义不足且视觉潜变量与动作割裂的问题,提出将视频自编码潜空间对齐冻结视觉基础模型,并在该语义空间中学习表示状态转移的潜在动作 token,再联合预测未来视觉状态与动作。实机与仿真结果显示其优于或匹配VLA和WAN式WAM基线,在RoboTwin 2.0 Easy/Hard达89.3/88.4,消融支持语义视觉-动作 token 化是主要增益来源。

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning Figure 1
2026-06-12cs.CV

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

2026-06-12视觉感知

论文指出,VLM 的3D/4D空间推理瓶颈不只在感知工具本身,还在工具调用接口:单次代码执行难以根据中间结果修正,结构化工具调用又限制组合。SpatialClaw 将代码作为可持续交互的动作接口,在持久 Python 内核中逐步调用感知与几何原语、检查可视化结果并迭代推理。其无需训练,在20个空间推理基准上平均准确率达59.9%,较近期空间智能体高11.2个百分点,并在多种VLM骨干上保持增益。

Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction Figure 1
2026-06-12cs.CV

Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction

Jen-Hao Cheng, Yipeng Wang, Hao Zhang, Gengshan Yang, Jenq-Neng Hwang

University of Washington, World Labs, scalable 4D content creation from casual monocular videos for simulation, gaming, AR/VR, and video, On zero-shot ActorsHQ, where ground-truth multi-view skeletons are unavailable at inference, our

2026-06-12视觉感知生成模型三维

针对动态人体从单目或稀疏视角重建4D内容时依赖骨架、深度/法线等几何先验且难泛化的问题,Flex4DHuman将Wan 2.1视频扩散改造成多视角生成器,用相对相机位姿的五轴位置编码和三阶段课程学习生成同步密集视角视频,并接入4D Gaussian Splatting。实验在DNA-Rendering和ActorsHQ上超过Diffuman4D、MV-Performer等基线,且可扩展到动物类别。

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible Figure 1
2026-06-12cs.CV

World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible

Hao Zhang, Mohamed El Banani, Jen-Hao Cheng, Paul Zhang, Yi Hua, Ben Mildenhall, Christoph Lassner, Narendra Ahuja, Gengshan Yang

World Labs, University of Illinois Urbana-Champaign

2026-06-12生成模型强化学习

本文针对单图/视频 3D 方法在“像素对齐但只见表面”和“形状完整但与输入错位”之间的取舍,提出 World Tracing:为每个像素沿相机射线生成多层 3D 点,首层重建可见表面,后续层补全遮挡几何,并用流匹配 DiT、分解/全局注意力和深度填充目标联合训练。实验显示其在物体、场景和动态基准上同时提升可见表面精度与完整几何 Chamfer,并支持文本 3D 编辑、新视角视频和免训练 mesh 集成;部分增益可能来自更大规模训练和 MoGe/DINO 先验。

Surflo: Consistent 3D Surface Flow Model with Global State Figure 1
2026-06-12cs.CV

Surflo: Consistent 3D Surface Flow Model with Global State

Antoine Guédon, Shu Nakamura, Nicolas Dufour, Jiahui Lei, Ko Nishino, Angjoo Kanazawa

Kyoto University

2026-06-12生成模型三维

Surflo针对多视图重建中按视角输出冗余且难融合、全局潜变量又受固定低分辨率限制的问题,主张把无位姿RGB图像压缩为单一全局3D状态。方法用冻结VGGT特征和Perceiver压缩成固定latent,再以flow matching独立生成任意数量带法向表面点,并在ODE推理中加入光度/深度引导抑制局部不一致。实验称其在8个重建基准上达到或超过前馈基线,且较需大量视图的优化法快一个数量级。

Revisiting Vehicle Color Recognition in Long-Tailed Surveillance Scenarios Figure 1
2026-06-12cs.CV

Revisiting Vehicle Color Recognition in Long-Tailed Surveillance Scenarios

Vinícius Orrú, Bruno H. Foggiatto, Gabriel E. Lima, David Menotti, Rayson Laroca

2026-06-12视觉感知

面向监控中车牌不可读且车辆颜色分布长尾的问题,本文强调仅看总体准确率会掩盖稀有颜色失效,并在 UFPR-VeSV 上系统评估少数类合成增强。其核心做法是结合 RunDiffusion 文生图与 Gemini 图像改色,经人工筛选后配合 DINOv3、重加权、颜色安全增强、前景预处理和集成。最佳结果达 94.6% micro、79.7% macro,较既有方法 macro 提升 8.2 个百分点,但错误分析也指出不少剩余样本对人类同样颜色含糊。

Towards Effective Waste Segmentation for Automated Waste Recycling in Cluttered Background Figure 1
2026-06-12cs.CV

Towards Effective Waste Segmentation for Automated Waste Recycling in Cluttered Background

Mamoona Javaid, Mubashir Noman, Abdul Hannan, Shah Nawaz, Mustansar Fiaz, Sajid Ghuffar

2026-06-12视觉感知

面向自动化废品回收中杂乱背景、透明/可变形垃圾难分割且大骨干代价高的问题,论文提出 EWSegNet:先用空间上下文建模局部结构,再在频域用数据相关核捕获全局关系,并以 DoG 与池化注意力的 AFEM 强化边界和块状区域。在 ZeroWaste-aug、ZeroWaste-f、SpectralWaste 上实验表明其在保持较低计算开销的同时提升了分割效果,但具体增益幅度需结合完整表格判断。

EvTexture++: Event-Driven Texture Enhancement for Video Super-Resolution Figure 1
2026-06-12cs.CV

EvTexture++: Event-Driven Texture Enhancement for Video Super-Resolution

Dachun Kai, Jiayao Lu, Yueyi Zhang, Xiaoyan Sun

2026-06-12视觉感知

视频超分在纹理密集区域常因 RGB 帧时间采样不足而过平滑,事件相机虽常被用于运动对齐,但其高频动态细节尚未被充分用于纹理恢复。EvTexture++将事件信号作为显式纹理线索,设计纹理增强分支、迭代纹理增强模块和事件引导的时序纹理对齐,并可作为插件接入现有 VSR 骨干。五个数据集实验显示其达到 SOTA,在 Vid4 上接入 IART 可提升约 1.55 dB PSNR。

Contrast-Informed Augmentation and Domain-Adversarial Training for Adult-to-Neonatal MR Reconstruction Generalization Figure 1
2026-06-12cs.CV

Contrast-Informed Augmentation and Domain-Adversarial Training for Adult-to-Neonatal MR Reconstruction Generalization

Stephen Moore, Lara Leijser, Richard Frayne, Roberto Souza

2026-06-12学习理论三维

针对深度MRI重建从成人数据迁移到新生儿时受对比度、解剖尺度和SNR域移影响的问题,本文在E2E-VarNet中引入面向新生儿特征的对比度增强,并结合域对抗训练以学习更域不变的表示。无需新生儿训练数据,Mixed/Mixed-DAT在R=4、R=8新生儿测试上均优于成人数据基线,R=4下Mixed-DAT达SSIM 0.924、PSNR 33.98 dB,t-SNE也显示潜表示重叠增加。

Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models Figure 1
2026-06-12cs.CV

Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models

Shengqiang Zhang, Ruotong Liao, Volker Tresp, Barbara Plank, Hinrich Schütze

LMU Munich & Munich Center for Machine Learning (MCML)

2026-06-12视觉感知

这篇工作针对 VAR 图像编辑中“改什么”和“写到哪里”难以同时控制的问题,指出 bitwise-residual VAR 的逐比特 Bernoulli 头与多尺度残差码求和结构尚未被利用。BitResEdit 无需训练,用 BitEdit 在逐比特 log-odds 上做带 KL 信任域的源负向引导,再用 ResEdit 将采样变化作为掩码门控残差写回连续码空间。PIE-Bench 上基于 Infinity-2B,相比同骨干既有编辑器在编辑区域 CLIP 提升 1.07,同时背景保持仍具竞争力。

What's Old is New Again: Classical Dimensionality Reduction for Efficient Saliency-Guided Biometric Attack Detection Figure 1
2026-06-12cs.CV

What's Old is New Again: Classical Dimensionality Reduction for Efficient Saliency-Guided Biometric Attack Detection

Samuel Webster, Walter Scheirer

Department of Computer Science and Engineering, University of Notre Dame, IN, USA

2026-06-12视觉感知

针对生物特征呈现攻击检测中显著性引导训练依赖人工标注或领域工具、难以扩展的问题,论文将 PCA/LDA 等经典降维重新用于从原始训练集自动生成逐样本显著图,并接入 CYBORG 类损失训练。实验覆盖虹膜、合成脸、指纹、指静脉和证件 PAD,结果显示该低成本方法普遍优于无显著性基线,在合成脸与指纹任务上还超过既有 SOTA 显著性方案。

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models Figure 1
2026-06-12cs.CV

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

Hanyang Yu, Haitao Lin, Jingbo Zhang, Wenyao Zhang, Chenghao Gu, Heng Li, Ping Tan

2026-06-12强化学习

针对世界-动作模型在杂乱场景中仅靠语言易产生指代歧义、仅预测 RGB 又缺少目标语义约束的问题,MaskWAM 将目标掩码同时作为首帧视觉提示和未来预测目标,用 MoT 统一建模 RGB、掩码与动作,从而把控制关注点锚定到任务物体。实验在 LIBERO、RoboTwin 和真实任务上均优于文本条件 WAM/VLA,报告成功率最高达 98.4%、92.2%,真实歧义任务也有明显提升。

Measurement-Calibrated Multi-Camera Fusion for Vision-Based Indoor Localization Figure 1
2026-06-12cs.CV

Measurement-Calibrated Multi-Camera Fusion for Vision-Based Indoor Localization

Mateo Toro Diz, Jonathan Hoss, Noah Klarmann

Mateo Toro Diz is with Rosenheim Technical University of Applied Sciences

2026-06-12视觉感知

针对室内视觉定位中多相机融合常被当作黑箱、难以判断误差来自检测、单应标定还是融合的问题,论文将流水线拆分评估,并用单相机实测不确定性来标定卡尔曼滤波的测量噪声。实验显示,多相机融合相较单相机能提升定位精度;测量校准对绝对误差增益有限,但明显降低轨迹方差、改善平滑性,更适合需要连续稳定轨迹的实时应用。

Heterogeneous LiDAR Early Fusion and Learned Re-Ranking Strategy for Robust Long-Term Place Recognition in Unstructured Environments Figure 1
2026-06-12cs.CV

Heterogeneous LiDAR Early Fusion and Learned Re-Ranking Strategy for Robust Long-Term Place Recognition in Unstructured Environments

Judith Vilella-Cantos, Juan José Cabrera, Mónica Ballesta, David Valiente, Luis Payá

2026-06-12视觉感知强化学习安全鲁棒

面向葡萄园等非结构化、季节变化和重复纹理强的长期定位场景,论文提出 MinkUNeXt-VINE++:将 Livox Mid-360 与 Velodyne VLP-16 异构 LiDAR 点云做早期融合,并在检索后用轻量学习式重排序修正候选顺序。TEMPO-VINE 实验显示,相比单传感器 Recall@1 有约20%提升,加入重排序后约+30%,并优于多种现有 LPR 方法。

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale Figure 1
2026-06-12cs.RO

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

Karlsruhe Institute of Technology, Robotics Institute Germany

2026-06-12机器人模仿学习

机器人示教的空间标注常依赖检测器置信度,难判断“是否真被操作”,在杂乱场景会引入高置信错误。SPARC把标注视为可选择预测,利用阶段一致运动、夹爪3D邻近和机器人重叠过滤生成交互感知候选与可靠性分数。IA-Bench上高置信定位准确率80.2%对58.1%,95%精度下保留167k轨迹,并提升物体定位、指向基准和真实杂乱场景策略表现。

Budget-Constrained Step-Level Diffusion Caching Figure 1
2026-06-12cs.CV

Budget-Constrained Step-Level Diffusion Caching

Mingkun Lei, Tong Zhao, Liangyu Yuan, Chi Zhang

2026-06-12生成模型

针对扩散/flow 模型逐步采样开销高、现有缓存方法用阈值在线决策导致延迟不可控且未直接面向最终质量的问题,BudCache 将缓存视为固定 NFE 预算下的离散资源分配,离线用模拟退火结合爬山搜索静态缓存策略,并在低预算下对时间步调度做缓存感知对齐。实验在 FLUX.1-dev 与 Wan2.1 上显示,在相同推理预算下生成质量优于启发式缓存基线,最高报告约 3.73× 加速。

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation Figure 1
2026-06-12cs.RO

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

The University of Tokyo, National Institute of

2026-06-12机器人强化学习

本文针对目标条件视觉导航中“会预测未来视角但仍需外部规划器选动作”的问题,提出 NavWAM:用扩散 Transformer 将未来观测、目标进展价值和动作片段放入共享潜序列联合去噪,使视觉前瞻直接生成闭环控制。经仿真预训练与真机适配,在离线和真实机器人图像目标导航中优于规划式世界模型基线,且默认模式无需 CEM 搜索,并与更大的直接策略模型保持竞争力。

Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery Figure 1
2026-06-12cs.CV

Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery

Siyu Zhou, Zhongliang Jiang

The Chair for Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany., The authors are now affiliated with The University of Hong Kong, Hong Kong SAR, China

2026-06-12三维

面向计算机辅助手术中术中点云只覆盖部分解剖结构、且重叠率/密度/噪声变化导致配准不稳的问题,论文提出 GAPR-Net:在粗到细框架中结合 KPConv 与 Transformer,并用变换不变的点级几何特征作为位置嵌入,通过交叉注意力融合局部与全局信息。四类骨结构实验显示整体配准召回率 94.2%、RMSE 1.992 mm,低重叠和不完整全点云场景下仍较稳健。

Reinforcement Learning for Neural Model Editing Figure 1
2026-06-12cs.LG

Reinforcement Learning for Neural Model Editing

Shaivi Malik

2026-06-12强化学习

针对预训练模型编辑常需为遗忘、去偏等目标手工设计专用算法的问题,论文把权重编辑建模为强化学习:智能体仅根据奖励对单层权重做乘性 MaskWorld 或加性 ShiftWorld 更新,并用类似 LoRA 的低秩动作降低维度。实验覆盖图像分类遗忘和文本分类去偏,遗忘任务将 forget set 准确率降至近 0%、retain set 保持 90% 以上,去偏指标提升超过 5%;但全层扩展性仍文中未充分解决。

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models Figure 1
2026-06-12cs.CV

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha

University of Maryland College Park, Nanjing University of Posts and Telecommunications, Standford University, Motional AD Inc.

2026-06-12视觉语言强化学习三维

面向自动驾驶/机器人决策中的3D语义占用,论文指出直接用VLM图文嵌入对齐会提升文本相似度却不稳定提升闭集体素mIoU。VISA改将离线VLM作为实例语义审计器,生成类别、混淆、属性与置信度,并沿物体轨迹约束匹配体素,推理无需VLM。nuScenes上OccWorld mIoU从19.06升至20.05,GaussianWorld从21.36升至21.91,物体和稀有类增益更明显。

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data Figure 1
2026-06-12cs.CV

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan

2026-06-12视觉感知

该文针对视频生成中相机运动克隆难以精确控制且多镜头切换支持不足的问题,提出将参考视频相机参数渲染为空场景中的“camera grid”运动视频,以视觉化、解耦的表示替代参数或成对数据依赖,并训练百万级 grid-video 对的 MMDiT 框架 OmniDirector;推理时用分层提示扩展融合镜头、主体与动作。实验显示其在复杂和多镜头相机克隆上优于既有方法,但部分增益可能主要来自 scaling / data。

VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits Figure 1
2026-06-12cs.CV

VietFashion: Benchmarking Sketch-Text Composed Image Retrieval for Cultural Outfits

Hoang-Nguyen Cao, Le-Hoang Bui, Dinh-Khoi Vo, Minh-Triet Tran, Trung-Nghia Le

University of Science, Vietnam National University, University of Science Ho Chi Minh City Vietnam, Vietnam National University Ho Chi Minh City Vietnam

2026-06-12视觉感知数据集/基准三维

面向传统服饰数字化与设计检索,现有CIR/SBIR数据多偏西式服装,难表达奥黛的领型、纹样等细粒度文化语义。VietFashion以草图表示结构、文本表示文化属性,结合Qwen-2.5与SANA-ControlNet从650张草图扩展到2.1万余图文样本,并采用每查询多目标标注以贴近设计歧义。基准测试显示现有监督、零样本、草图文本检索方法召回仍低,主要瓶颈在跨草图-照片域对齐和细粒度语义组合,增益可能主要来自数据与评测设定。

Person Identification from Contextual Motion Figure 1
2026-06-12cs.CV

Person Identification from Contextual Motion

Igor Kviatkovsky, Ehud Rivlin, Ilan Shimshoni

I. Kviatkovsky and E. Rivlin are with the Department of Computer Science, Technion – Israel Institute of Technology, Technion City, Haifa 32000, Israel., I. Shimshoni is with the Department of Information Systems, University of Haifa, Carmel Mount, Rabin building, Haifa 31905, Israel.

2026-06-12视觉感知

该文针对人脸不可用、遮挡或隐私受限时的身份识别问题,利用人体运动风格作为生物特征。核心创新是把动作身份识别统一为生成式概率推断,并提出交互式场景:系统按最大互信息主动选择视觉 cue,逐步更新身份后验直到置信度足够。实验在五个公开数据集及含22人、4476段响应的CuedId数据集上报告较高识别率,且多动作组合明显提升精度。

SmartFont: Dynamic Condition Allocation for Few-Shot Font Generation Figure 1
2026-06-12cs.CV

SmartFont: Dynamic Condition Allocation for Few-Shot Font Generation

Zian Yang, Zixin Wang

Fudan University

2026-06-12视觉感知

针对少样本字体生成中全局字形结构与局部笔画风格难以兼顾的问题,SmartFont 将其重新表述为多层条件分配:在扩散骨干上加入弱监督局部专家,通过语义-空间分配定位细节修正,并按去噪时间步与注入模块动态权衡内容、风格和局部特征。实验显示其在复杂字形下提升整体完整性与局部风格保真度,但具体增益幅度需结合完整实验表判断。

MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold Figure 1
2026-06-12cs.CV

MoVerse: Real-Time Video World Modeling with Panoramic Gaussian Scaffold

Yang Zhou, Ziheng Wang, Yuqin Lu, Haofeng Liu, Jun Liang, Shengfeng He, Jing Li

South China University of Technology 2Columbia University 3Orange Team, Youku Moku-Lab, HUJING, Digital Media & Entertainment Group 4Singapore Management University, world, persistent geometry, controllable camera motion, and temporally coherent high-fidelity observa-, causal autoregressive student for bounded-latency streaming. This design combines the controllability, ∗Work done during an internship at Orange Team, Youku Moku-Lab, HUJING Digital Media & Entertainment Group., complete the missing field of view, convert that completion into a camera-controllable scene representation, a curated set of canonicalized panoramas with yaw-centered perspective-view supervision.

2026-06-12视觉感知强化学习三维

MoVerse面向单张窄视场图像生成可交互漫游世界,解决缺失视野、长期几何一致性与实时渲染难兼得的问题。其关键是将世界构建与观测渲染解耦:先用拓扑感知扩散补全重力对齐360°全景,再提升为全景3D Gaussian scaffold,最后以蒸馏后的因果视频渲染器增强画质。实验以定性结果为主,展示可保持布局并改善观感,在单张RTX 4090上达到8 FPS实时漫游。

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing Figure 1
2026-06-12cs.AI

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

2026-06-12视觉语言

IterCAD针对现有CAD自动生成多为一次性开环、难以像工程师那样反复验证和修改的问题,将多视图工程图、CadQuery沙盒执行、编译与视觉反馈结合成闭环多轮智能体,覆盖图纸/文本到代码和局部编辑;训练上用渐进SFT加几何感知RL与可行前缀约束,并构建含复杂制造特征的IterCAD-Bench及避免“幸存者偏差”的CD-TR/AUC-TR指标。实验显示其在代码可执行性、几何精度和迭代修复上优于既有方法,但具体增益中数据合成与模型规模贡献仍需进一步拆分。

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization Figure 1
2026-06-12cs.CV

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

Sanxin Jiang, Jiro Katto, Heming Sun

Department of Information Engineering, Shanghai University of Electric Power, Department of Computer Science, Waseda University, Institute of Science Tokyo

2026-06-12视觉感知生成模型优化算法

针对神经图像压缩中码率、失真与感知真实感难以同时可控,且解码端公共随机性难以实现的问题,论文提出 DCIC:在学习压缩码流上叠加扩散解码,并用失真约束与重编码幂等约束共同引导反向去噪,通过一致噪声注入实现无额外码率的共享随机性;调节参数可从单一码流连续切换保真与真实感。实验在 CelebA-HQ、CLIC2020 和 ImageNet-1K 上显示,其 RDP 设置相较感知 codec 有更好 BD-PSNR,RP 设置的 BD-FID 接近专门感知方法。

VideoMDM: Towards 3D Human Motion Generation From 2D Supervision Figure 1
2026-06-12cs.LG

VideoMDM: Towards 3D Human Motion Generation From 2D Supervision

Amir Mann, Gal Michael Harari, Merav Keidar, Or Litany

2026-06-12视觉感知三维

针对3D人体运动生成依赖昂贵MoCap、难以覆盖真实视频多样性的问题,VideoMDM尝试仅用单目视频提取的2D姿态训练3D扩散先验。其关键做法是用2D到3D lifter作噪声教师,在3D空间去噪并以深度加权重投影损失和2D化运动正则约束训练。实验显示,HumanML3D上FID 0.88接近3D监督MDM的0.54,在Fit3D和NBA中也优于基线并更受人工偏好,但对相机参数和lifter质量仍较敏感。

JointEdit3D: Feed-Forward 3D Scene Editing in a Unified Latent Space Figure 1
2026-06-12cs.CV

JointEdit3D: Feed-Forward 3D Scene Editing in a Unified Latent Space

Xinnan Zhu, Ruijie Xu, Jiayu Ying, Daoguo Dong, Jiachen Xu, Yuan Xie, Xin Tan

East China Normal University, Shanghai Artificial Intelligence Laboratory, Fudan University

2026-06-12三维

针对现有3D场景编辑依赖逐场景优化或先2D编辑再重建、导致开销高和几何不一致的问题,JointEdit3D将编辑放入统一RGB-几何潜空间,用单张编辑参考帧做非对称潜空间补全,并以SceneAnchor和区域感知损失保留源场景结构。作者还构建15K配对数据与基准,实验显示其提升编辑区域质量和3D结构完整性,同时保持较好的背景保真。

Dual-Domain Equivariant Generative Adversarial Network for Multimodal CT-PET Synthesis Figure 1
2026-06-12cs.CV

Dual-Domain Equivariant Generative Adversarial Network for Multimodal CT-PET Synthesis

Gabriel Steele, Alzahra Altalib, Alessandro Perelli

2026-06-12视觉语言生成模型

针对CT-PET双模态采集成本高、缺失模态补全困难且传统GAN易忽略频谱信息和旋转几何一致性的问题,论文提出DDE-GAN,在图像域与傅里叶域联合学习,并把旋转等变约束加入生成器和判别器损失,通过分阶段域内/域间一致性训练提升结构保真度。文中称在HECKTOR 2022等数据上优于基线,用于PET补全和数据增强,但具体增益来源仍需结合消融判断。

OR-Action: Multi-Role Video Understanding with Fine-Grained Actions Figure 1
2026-06-12cs.CV

OR-Action: Multi-Role Video Understanding with Fine-Grained Actions

Felix Tristram, Ege Özsoy, Christian Benz, Marcel Walch, Ghazal Ghazaei, Nassir Navab

2026-06-12视觉感知

面向手术室外部场景中多人协作、遮挡和器械交互导致的细粒度时序理解难题,本文基于 EgoExOR 场景图用规则蒸馏出 OR-Action 基准,包含 78 类、1295 段多角色动作,并比较场景图管线与视觉时序模型。结果显示,预测场景图难以形成稳定动作片段,即使加 GNN 仍较弱;使用多视角自我中心视频的视觉模型显著更好,跨视角特征对齐还能提升部分单视角表现。

Masked and Predictive Self-Supervised Foundation Models for 3D Brain MRI Figure 1
2026-06-12cs.CV

Masked and Predictive Self-Supervised Foundation Models for 3D Brain MRI

Esra Ergün, Hersh Chandarana, Dan Sodickson, Gözde Ünal

2026-06-12三维

针对3D脑MRI基础模型多偏向分割、缺少疾病检测系统评估的问题,本文对比MAE重建式预训练与JEPA预测式表征学习,并分别加入频域重建损失和方差-协方差正则。结果显示自监督目标的收益强依赖任务结构:高频解剖信号任务更受益于频域MAE,分布式特征任务更受益于协方差正则;总体上带频域监督的MAE在五个疾病检测任务中优于JEPA。

MagPlus: Bridging Micro-to-Regular Facial Expressions through Learnable Magnification Figure 1
2026-06-12cs.CV

MagPlus: Bridging Micro-to-Regular Facial Expressions through Learnable Magnification

Sliman Jammal, Andrei Sharf

Ben-Gurion University of the Negev, Ben-Gurion University of the Negev Israel

2026-06-12视觉感知

微表情幅度小且标注数据稀缺,常被宏表情人脸动画模型当作噪声,导致直接生成不稳。MagPlus的关键思路不是重训生成器,而是先学习放大微弱运动,使其落入预训练宏表情模型可处理的运动域,再用DeMagPlus还原到真实微表情强度。作者在FOMM、FSRT、MetaPortrait和EmoPortraits上验证,无需微调骨干即可提升微表情迁移与合成的真实感。

ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance Figure 1
2026-06-12cs.CV

ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance

Salaheldin Mohamed, M. Hamza Mughal, Rishabh Dabral, Christian Theobalt

Max Planck Institute for Informatics

2026-06-12视觉感知强化学习

针对语音驱动头像动画中“口型准但僵硬、表情丰富却不同步”的矛盾,ReFree-S2V在预训练视频生成模型上构建flow-matching框架,用多层级语音表示同时建模局部音素与全局韵律,并通过可学习选择器注入Transformer;同时引入无需人工偏好或奖励模型的RL式微调,以真实样本和课程化负样本约束不自然运动。文中实验显示其在口型同步指标和人评自然度、表现力上优于现有方法。

DuET: Dual Expert Trajectories for Diffusion Image Editing Figure 1
2026-06-12cs.CV

DuET: Dual Expert Trajectories for Diffusion Image Editing

Lidia Troeshestova, Alexander Ustyuzhanin, Sergey Kastryulin

HSE University

2026-06-12视觉感知生成模型

针对扩散图像编辑中全程依赖源图会导致大幅改写时指令执行不足、画面不自然的问题,DuET提出在单次去噪轨迹中短暂从编辑模式切到仅文本生成模式,再回到编辑模式,以临时放松源图锚定且无需训练或额外采样。实验在FLUX2-Klein和BAGEL等模型、多个基准上提升指令相关性、语义一致性和感知质量,但会可预期地牺牲部分源图保真度。

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers Figure 1
2026-06-12cs.CV

HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers

Guozhen Zhang, Xuerui Qiu, Yutao Cui, Tianhui Song, Changlin Li, Junzhe Li, Tao Huang, Xiao Zhang, Yang Li, Jianbing Wu, Miles Yang, Zhao Zhong, Liefeng Bo, Limin Wang

Nanjing University 2 CASIA 3 Tencent Hunyuan, Zhongguancun Academy 5 Shanghai AI Lab

2026-06-12视觉语言

针对统一多模态模型中图像与视频常由不同编码器或逐帧 tokenizer 处理、难以同时保留时序结构与语义的问题,Hydra-X 用单一 ViT 构建 Hydra-XTok,提出帧级因果时序注意力、分层时间压缩和训练期 Decompressor 进行图像/视频教师蒸馏,并把编辑中的源-目标交互前移到 latent 层。7B 实例在图像/视频理解、生成和编辑上均取得较强表现,消融显示全时空注意力和单步压缩反而不优。

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality Figure 1
2026-06-12cs.CV

Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality

Wei Li, Zhen Huang, Xinmei Tian

MoE Key Laboratory of Brain-inspired, Intelligent Perception and Cognition, University of Science and Technology of China

2026-06-12视觉感知

针对 CLIP 类视觉语言模型常把文本当“词袋”、难以区分关系、属性绑定和词序的问题,论文提出 MACCO:不依赖显式困难负样本,而是遮蔽一侧模态中的组合概念,并用另一侧完整上下文重建,同时用 MCA/MIR 约束跨模态对齐与模态内稳定性。五个组合性基准和多种骨干上的实验显示其提升 VLM 组合理解,并对文生图和多模态大模型有附带收益。

Zero-Shot Captioning for Cultural Heritage: Automated Image Analysis of Traditional Indonesian Clothing Figure 1
2026-06-12cs.CV

Zero-Shot Captioning for Cultural Heritage: Automated Image Analysis of Traditional Indonesian Clothing

Anugrah Aidin Yotolembah, Novanto Yudistira, Gembong Edhi Setyawan

2026-06-12视觉语言视觉感知

针对通用视觉语言模型难以识别印尼传统服饰细粒度文化术语的问题,论文构建覆盖38省的专家标注数据集,并提出在省级归纳零样本设置下的 Custom ZeroCLIP:冻结 CLIP 编码器,用训练省份 caption 检索增强 BERT-LSTM 生成。其在8个未见省份上取得 CLIPScore 0.8536、BLEU-4 0.3342、METEOR 0.4859,检索带来19.3% METEOR 增益,但术语泛化与检索迁移的边界仍需谨慎解读。

TimeLens: On-Device Artifact Recognition with Retrieval-Augmented Question Answering for the Grand Egyptian Museum Figure 1
2026-06-12cs.CV

TimeLens: On-Device Artifact Recognition with Retrieval-Augmented Question Answering for the Grand Egyptian Museum

Rawan Hesham, Ali Ashraf, Amr Ahmed, Malak Alaa, Omar Ahmed, Omar Wagih

2026-06-12视觉感知

面向大埃及博物馆中相似文物、弱网络与双语讲解易幻觉的问题,TimeLens将手机端YOLOv8n识别与基于ChromaDB的英阿双语RAG问答结合。论文的主要洞察是细粒度文物检测的瓶颈首先在标注质量而非模型或分辨率;手工校验标签后,5.97MB TFLite模型达mAP@0.5 0.995、mAP@0.5:0.95 0.924,RAG端约10秒回答且30题评测未见幻觉。

Towards More General Control of Diffusion Models Using Jeffrey Guidance Figure 1
2026-06-12cs.LG

Towards More General Control of Diffusion Models Using Jeffrey Guidance

Raphaël Razafindralambo, Rémy Sun, Frédéric Precioso, Jes Frellsen, Pierre-Alexandre Mattei

Technical University of Denmark, Denmark

2026-06-12生成模型规划控制

现有扩散 guidance 往往只能做条件采样,或依赖难解释的启发式能量,目标分布不明确。本文把 Jeffrey 条件化规则引入采样过程,通过密度比校正显式匹配指定边缘分布,并把分类 guidance 视为特例。实验显示,在 CIFAR-10、FFHQ 上匹配 Inception 嵌入可显著降低 FID,在 CelebA-HQ 上还能调节属性分布并削弱 Male 与 Young 的相关性。

ComAct: Reframing Professional Software Manipulation via COM-as-Action Paradigm Figure 1
2026-06-12cs.SE

ComAct: Reframing Professional Software Manipulation via COM-as-Action Paradigm

Jiaxin Ai, Tao Hu, Xuemeng Yang, Shu Zou, Hairong Zhang, Daocheng Fu, Yu Yang, Hongbin Zhou, Nianchen Deng, Pinlong Cai, Zhongyuan Wang, Botian Shi, Kaipeng Zhang, Licheng Wen

2026-06-12机器人

论文针对专业软件中 GUI 智能体视觉定位脆弱、长程操作易累积错误,以及 API/MCP 接口碎片化的问题,提出将 Windows COM 作为统一动作空间的 ComAct,把软件操控转化为可执行程序合成。作者以工业 CAD 为验证场景,构建 ComCADBench、ComForge,并训练可自纠错的 ComActor;实验显示 GUI 基线几乎失败,而 COM 执行显著提升,ComActor 在长程 CAD 任务和外部基准上达到 SOTA。

Distributional Loss for Robust Classification Figure 1
2026-06-12cs.LG

Distributional Loss for Robust Classification

Kathleen Anderson, Thomas Martinetz

Institute for Neuro- and Bioinformatics, University of Lübeck, Germany, sample to a single assigned label, we define an optimization objective, all without requiring additional label information. Experimental results, x ∼P(x) are associated with class labels ck ∼P(ck | x), where k = 1, . . . , K, to each input x(n) is assigned a hard class label c(n), Assigning each sample a single definitive label may fail to capture the in-, tics shared across multiple classes. Using softer, more informative labels, ideally, [21], but such high-quality probabilistic annotations are rarely available in prac-, tice. Enforcing a rigid, hard label assignment instead may encourage overfitting, ture. The training labels now indicate only to which mode of the distribution, network output logits and target label is robust to label noise [8], which moti-

2026-06-12安全鲁棒

本文针对交叉熵用 one-hot 目标易导致过度自信、噪声下过拟合的问题,提出直接在 logits 上约束全数据输出服从双峰高斯分布的 distributional loss,并用参数化概率编码器与基于样本距离的非参数 KL 估计联合优化。实验在多种图像分类数据集上显示其鲁棒性和小样本表现通常优于 CE、PolyLoss、T-vMF,BloodMNIST、PathMNIST增益明显,但 Caltech256 并非全程占优,且训练更难、需调参。

Visual Place Recognition in Forests with Depth-Aware Distillation Figure 1
2026-06-12cs.CV

Visual Place Recognition in Forests with Depth-Aware Distillation

Walter Nedov, Saimunur Rahman, Kavindie Katuwandeniya, David Hall, Kaushik Roy, Peyman Moghadam

CSIRO Robotics, Brisbane, Australia 2 University of Queensland, Brisbane, Australia 3 Queensland University of Technology, Brisbane, Australia

2026-06-12视觉感知

本文针对森林场景中植被重复、结构线索弱、跨遍历外观变化大导致 RGB 视觉地点识别不稳的问题,提出 DAD 深度感知蒸馏:冻结 DINOv2/SALAD 外观教师,仅学习深度 patch 嵌入,并用三元组检索损失与描述子对齐损失在保留预训练空间的同时注入几何信息。在 WildCross 零样本评测中,DAD 相比外观基线显著提升,跨序列平均 R@1 从 49.38 提至 62.69,说明预测深度也能补足自然环境 VPR 的外观歧义。

Transformer-Guided Graph Attention for Direct Cardiac Mesh Reconstruction: A Structural Digital Twin Framework Figure 1
2026-06-12cs.CV

Transformer-Guided Graph Attention for Direct Cardiac Mesh Reconstruction: A Structural Digital Twin Framework

Abhishek H S, Akash Ganamukhi, Abhimanyu Suresh, Aditya G Hiremath, Prasad B Honnavalli, Adithya Balasubramanyam

CAVE Labs, C-IoT, Dept. of CSE, PES University, C-IoT, Dept. of CSE, PES University, CAVE Labs, C-IoT, Dept. of CSE, PES University Bengaluru India, C-IoT, Dept. of CSE, PES University Bengaluru India

2026-06-12三维

面向心脏数字孪生,论文针对传统“分割-Marching Cubes-人工修补”流程耗时且网格质量不稳定的问题,提出由3D Swin Transformer提取CT/MRI体特征、GAT变形模板网格的端到端直接重建框架,并联合优化分割与几何目标。在MM-WHS 2017上,CT/MRI Dice为0.84/0.83,平均Chamfer距离1.8 mm,95%表面误差低于5 mm,可单次前向生成无需后处理的心脏表面网格。

Iterative Visual Thinking: Teaching Vision-Language Models Spatial Self-Correction through Visual Feedback Figure 1
2026-06-12cs.CV

Iterative Visual Thinking: Teaching Vision-Language Models Spatial Self-Correction through Visual Feedback

Animesh Tripathy, Aswanth Krishnan

QpiAI India Pvt. Ltd

2026-06-12视觉语言视觉感知

论文针对VLM在指代表达定位中虽能单次预测框、却不会观察并修正自身错误的问题,提出IVT“预测—渲染—再修正”闭环:把上一轮框叠加回图像作为视觉反馈,并用学生错误+教师纠错轨迹做SFT,再以IoU奖励GRPO稳定多步推理。结果显示,朴素迭代会使Acc@0.5从79.6%跌至48.7%,而SFT后升至82.0%,GRPO主要将逐步IoU退化降低约5倍。

An Extensible and Lightweight Unified Architecture for Demosaicing Pixel-bin Image Sensors Figure 1
2026-06-12cs.CV

An Extensible and Lightweight Unified Architecture for Demosaicing Pixel-bin Image Sensors

Saurabh Kumar, Nutan Sairam Yenneti

Samsung Research Institute Bangalore

2026-06-12视觉感知

面向手机像素合并传感器中 Bayer、Tetra、Nona、Hexadeca 等 CFA 需多模型去马赛克、占用端侧资源的问题,论文提出带免学习 CFA 识别的统一轻量架构:按频域签名选择专用编码器,再经共享核心与解码器重建 RGB,并可通过新增签名和编码器扩展。实验在多合成数据和真实 raw 数据上优于 KLAP 及若干单 CFA 模型,端侧参数量约为既有统一模型的 1/6。

Cascade Classification of Dermoscopic Images of Skin Neoplasms with Controllable Sensitivity and External Clinical Validation Figure 1
2026-06-12cs.CV

Cascade Classification of Dermoscopic Images of Skin Neoplasms with Controllable Sensitivity and External Clinical Validation

Elena S. Kozachok, Sergey S. Seregin, Aleksandr V. Kozachok, Ilya P. Latyshev, Oleg I. Samovarov

2026-06-12视觉感知规划控制

针对皮肤镜模型从ISIC等开放数据迁移到真实临床时性能与校准下降的问题,本文比较ViT、Swin、ConvNeXt、EfficientNetV2及二分类、四分类、两阶段级联方案。核心洞察是用可调阈值的恶性初筛再做癌种细分,可显式控制敏感性,更贴近临床流程。内部ROC-AUC达0.952–0.966,但外部临床降至0.797–0.893且校准误差显著上升;级联多数情况下提升macro F1,但显著性主要仅见于ViT。

Fully Distributed Multi-View 3D Tracking in Real-Time Figure 1
2026-06-12cs.CV

Fully Distributed Multi-View 3D Tracking in Real-Time

Byron Hernandez, Fangyu Li, Aotian Wu, Paul J. Shin, Kaustubh Purandare, Henry Medeiros

2026-06-12视觉感知三维

针对重叠视场多摄像头跟踪依赖中心化融合、难以在大规模实时部署中承受带宽与算力瓶颈的问题,论文提出 MV3DT:每个相机节点独立执行单目3D感知、分布式关联、ID传播与卡尔曼多视角融合,并用 MQTT 轻量通信实现无中心协同。在给定标定、无需场景训练的零样本设置下,WILDTRACK 达到 96.5% IDF1、93.1% MOTA,100相机仓库场景可维持30 FPS、约5ms延迟和2.2%通信开销。

PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks Figure 1
2026-06-12cs.CV

PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks

Yubo Zhang, Xueqing Wang, Manhui Lin, Yue Zhang, Penglongyi Deng, Ting Sun, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Changda Zhou, Hongen Liu, Suyin Liang, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

PaddlePaddle Team, Baidu Inc.

2026-06-12视觉语言

本文针对通用VLM在OCR中定位不准、幻觉和计算开销高的问题,提出轻量级PP-OCRv6:用统一的MetaFormer式LCNetV4骨干结合结构重参数化,并重做检测RepLKFPN与识别EncoderWithLightSVTR,覆盖1.5M到34.5M参数。文中在自建基准上报告medium达86.2%检测Hmean、83.2%识别准确率,优于PP-OCRv5且超过多款大规模VLM;tiny在Xeon CPU上较PP-OCRv5_mobile快3.9倍,但增益可能也来自数据优化。

Unified MRI Brain Image Translation via Hierarchical Tumor Structure Comparison Figure 1
2026-06-12cs.CV

Unified MRI Brain Image Translation via Hierarchical Tumor Structure Comparison

Yupeng Cai, Jia Wei, Jianlong Zhou

2026-06-12视觉感知

针对多模态脑 MRI 常缺失且肿瘤区域翻译失真会影响诊断的问题,论文提出统一的 HTSCGAN,将肿瘤分区结构显式纳入生成过程:用多尺度 Patch Contrast Module 保留层级结构差异,并借助预训练 Patch Classifier 与结构感知编码器约束生成图像的肿瘤语义和空间依赖。在 BraTS2020/2021 上,该方法在图像翻译及下游分割任务中均优于对比方法。

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck Figure 1
2026-06-12cs.CV

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

University of Science and Technology of China, Zhejiang University, Tsinghua University

2026-06-12视觉语言

针对显式 CoT 多模态嵌入推理在检索中延迟高、且依赖 CoT 标注质量的问题,LaME 将面向嵌入的推理改写为潜空间信息瓶颈:用少量可学习 reason tokens 在单次前向中完成“思考”,并以重构探针与聚合嵌入头分离生成与对比监督,配合两阶段训练稳定收敛。在 MMEB-v2 和 MRMR 上,其性能接近或超过部分 CoT 方法,推理较显式 CoT 快 60 倍、较迭代潜推理快 2 倍。

Augmentation techniques for video surveillance in the visible and thermal spectral range Figure 1
2026-06-12cs.AI

Augmentation techniques for video surveillance in the visible and thermal spectral range

Vanessa Buhrmester, Ann-Kristin Grosselfinger, David Munch, Michael Arens

2026-06-12视觉感知

面向昼夜视频监控中热红外标注数据稀缺、可见光与红外域差异导致模型泛化不足的问题,论文尝试将易获得的可见光训练图像通过颜色空间、灰度/反相亮度与模糊等增强变得更像红外数据。核心洞察是削弱颜色纹理、突出形状/亮度特征可提升跨谱分类;在 ThermalWorld 上,相比未增强可见光训练,红外分类提升约76%,可见+红外混合测试提升约24%,且可见光性能基本不降。

SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing Figure 1
2026-06-12cs.CV

SeamEdit: A Black-Box VLM-Agnostic Pipeline for Large-Image Semantic Editing

Xiangyu Lyu, Dan Lei

Fine-Arts Educator, Yuncheng Middle School, Yuncheng, Shanxi, China

2026-06-12视觉语言视觉感知

SeamEdit关注黑盒闭源VLM在大图分块语义编辑中因分辨率限制产生的对齐漂移、语义变形和接缝伪影。其核心是无需训练、无需访问模型内部状态,把带修复能力的VLM当作oracle,并通过重叠切块、Grid-SIFT几何校正、局部色彩一致性、多候选接缝风险排序和动态规划曲线接缝融合来后处理。文中声称可降低接缝可见性并支持任意tile区域编辑,但具体量化增益在给定文本中未充分说明。

TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment Figure 1
2026-06-12cs.CV

TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment

Yu Meng, Xiangyang Luo, Letian Li, Wenyuan Jiang, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

Tsinghua University, 2 D-INFK, ETH Zürich

2026-06-12视觉感知

本文针对自回归视频扩散在分钟级生成中受 KV-cache 容量限制、且长期自条件导致上下文分布漂移的问题,提出无需训练的 TetherCache。其将缓存划分为 sink、memory、recent,并用 GRAB 兼顾注意力相关性与时间多样性选择历史帧,再用 TAME 以早期可信帧统计校准召回 token。基于 Self-Forcing,在 VBench-Long 的 30/60/240 秒设置均提升质量,240 秒质量漂移由 7.84 降至 1.33。

SAM-Deep-EIoU: Selective Mask Propagation for Multi-Object Tracking Figure 1
2026-06-12cs.CV

SAM-Deep-EIoU: Selective Mask Propagation for Multi-Object Tracking

Alexander Holmberg

KTH Royal Institute of Technology

2026-06-12视觉感知

这篇论文针对多目标跟踪中少数遮挡、近距离交互帧导致身份切换,而全程使用 VOS 又计算昂贵且易漂移的问题,提出按匈牙利匹配代价的 assignment margin 触发“选择性掩码传播”:仅在高风险窗口调用 SAM 3,并且只有当掩码结果高置信反驳基础跟踪器时才改写身份。方法免训练、黑盒兼容,在 DanceTrack 上提升 SORT、ByteTrack、Deep-EIoU,并结合全局轨迹关联在 SportsMOT 达到 86.8 HOTA;代价是仍需额外 VOS 计算,且多数触发窗口未改写输出。

GeoCFNet: Geometry-Aware Confidence Field Network for Robot-Assisted Endoscopic Submucosal Dissection Figure 1
2026-06-12cs.CV

GeoCFNet: Geometry-Aware Confidence Field Network for Robot-Assisted Endoscopic Submucosal Dissection

Rui Tang, Guankun Wang, Long Bai, Haochen Yin, Huxin Gao, Jiewen Lai, Jiazheng Wang, Hongliang Ren

2026-06-12机器人

面向机器人辅助 ESD 中烟雾、反光、组织形变和细长切割区域导致的视觉引导不稳定问题,论文将切割导航表述为连续置信场估计。GeoCFNet 以冻结 DINOv3 提取密集特征,用 TDF 融合 CLS 全局上下文与 patch 表征,并通过 SegFormer 解码和 GASR 平滑/各向异性约束保持线状几何连续性。实验在 ESD 图像上达到 RMSE 0.0480、PSNR 27.1995、SSIM 0.3397、CC 0.2466,显示较稳定的置信场预测。

A Multi-Modal Framework with Cross-Subject Pseudo-Labeling and Semantic Alignment for Micro-Gesture Recognition Figure 1
2026-06-12cs.CV

A Multi-Modal Framework with Cross-Subject Pseudo-Labeling and Semantic Alignment for Micro-Gesture Recognition

Haoran Zhang, Haokun Zhang, Pengyu Liu, Yujia Zhang, Weibao Xue, Yanbin Hao

2026-06-12视觉感知

面向未裁剪视频中的微手势识别,论文针对动作幅度小、背景噪声强、类别长尾和跨被试域偏移等问题,构建融合68点骨架、3D热图与高分辨率RGB的多模态框架,并用显著性裁剪、平方根平滑采样、正交语义嵌入损失及跨模态伪标签适配提升尾类与泛化能力;在第4届MiGA-IJCAI挑战iMiGUE测试集取得68.13% F1/Top-1并排名第4。

Comparing Commercial Depth Sensor Accuracy for Medical Applications Figure 1
2026-06-12cs.RO

Comparing Commercial Depth Sensor Accuracy for Medical Applications

Pit Henrich, Maximilian Weiherer, Franziska Hansen, Bernhard Egger, Franziska Mathis-Ullrich

Department of Artificial Intelligence in Biomedical Engineering, Friedrich-Alexander-Universit¨at Erlangen-N¨urnberg, Erlangen, Germany, Department of Computer Science, Friedrich-Alexander-Universit¨at Erlangen-N¨urnberg, Erlangen, Germany, nologies, Germany), Stereolabs ZED 2i (Stereolabs, France), and, D405 (Intel RealSense, United States), Stereolabs ZED 2i -, .1 mm (Stereolabs, France), Zivid 2M+ 60 (Zivid, Norway), marble-white PLA (Bambu Lab, China) calibration cubes have, Stereolabs ZED 2i (2.1mm)

2026-06-12视觉感知

面向医疗/手术机器人中依赖3D表面感知的需求,本文在约50 cm工作距离下,用触针采样参考点云对四类商用深度传感器在猪骨、猪腹组织和硅胶肾模型上做定量比较,覆盖真实组织的均质、反光和次表面散射挑战。结果显示Zivid 2M+ 60整体最稳且误差最低,ZED 2i在真实组织上接近但在深色均质模型上退化,D405受距离影响明显,Flexx精度落后。

Quality-Preserving Imperceptible Adversarial Attack on Skeleton-based Human Action Recognition Figure 1
2026-06-12cs.CV

Quality-Preserving Imperceptible Adversarial Attack on Skeleton-based Human Action Recognition

Ziyi Chang, Kanglei Zhou, Xiaohui Liang, Hubert P. H. Shum

2026-06-12视觉感知

针对骨架动作识别对抗攻击常因噪声扰动破坏动作自然性、在高质量骨架输入下更易被察觉的问题,论文指出根源在单样本优化的经验风险与真实数据分布风险不匹配,并用预训练扩散模型构建分布式潜空间生成攻击动作,同时提出贴近生理自然性的质量指标。实验在多种S-HAR模型和数据集上显示,该方法在攻击成功率、动作质量和人类不可察觉性上优于现有方法,但也暴露了动作识别器的鲁棒性缺口。

A Machine Learning Framework for Real-Time Personalized Ergonomic Pose Analysis Figure 1
2026-06-12cs.CV

A Machine Learning Framework for Real-Time Personalized Ergonomic Pose Analysis

Manex Atxa, Bruno Simoes, Julen Balzategui

available for a thorough postural evaluation, especially when occlusions occur. The, selected and labeled by the user are used to train the personalized deep learning, labeling. The model was trained on this data and, following the training phase, performs inference on new streaming data in real time. This research offers a scalable, issues, and limited scalability for large workforce populations [1]. Solutions powered, this makes pose interpretation easier, the data available for analysis is limited, in case

2026-06-12三维

针对传统人工工效评估耗时、主观且难以扩展的问题,论文提出用多 RGB-D 相机生成三维点云/体视频,并从可交互视角投影到二维以复用 MMPose 等姿态估计,再用用户手动标注的样本训练个性化工效/非工效分类器。搬运负载案例显示系统可在流式数据上实时骨架标注与推理,缓解固定视角和遮挡限制;但文中未充分说明相对基线的量化增益。

Diffusion Transformer World-Action Model for AV Scene Prediction Figure 1
2026-06-12cs.CV

Diffusion Transformer World-Action Model for AV Scene Prediction

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

Stanford University

2026-06-12生成模型强化学习

本文面向自动驾驶中可由自车动作驱动的紧凑世界模型,解决“预测哪种潜空间”和“生成式 DiT 是否优于回归”的问题。核心洞察是空间 token、x0 目标、残差锚定和不确定性匹配采样决定 DiT 效果,且仅看 L2/SSIM 会偏向模糊均值。nuScenes 上,V-JEPA2 时序表征使转向 RMSE 降低 40%,扩散模型 KID 较回归好 4.8 倍,并表现出明显转向可控性。

Objects Before Words: Object-First Inductive Biases for Grounding Language in Child-View Video Figure 1
2026-06-12cs.CV

Objects Before Words: Object-First Inductive Biases for Grounding Language in Child-View Video

Sathira Silva, Abrham Kahsay Gebreselasie, Muhammad Umer Sheikh, Kartik Kuckreja, Daniel Harari, Muhammad Haris Khan

Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE, Weizmann Institute of Science, Rehovot, Israel, face, links candidates across a short utterance-centered window, On SAYCam-S, BabyMind improves Labeled-S 15 forced-, • Improved SAYCam-S grounding on Labeled-S 15 and con-, without labels (Burgess et al., 2019, of candidates rather than a single labeled instance, multiple-

2026-06-12视觉语言视觉感知

论文针对儿童第一视角视频中照护者语音稀疏、与画面弱同步且场景杂乱导致词义 grounding 噪声大的问题,提出 BabyMind 的“先物体后语言”偏置:用离线掩码生成候选区域,在短时间窗内跟踪成 object files,并以原型空间多实例对比学习对齐话语与候选物体,同时用轨迹一致性和全局-物体一致性正则稳定训练。结果在 SAYCam-S 上较 CVCL 的 Labeled-S 15 强制选择准确率提升 2.6 个百分点,并在词表内 OOD 评测有小幅稳定增益。

Camera and LiDAR BEV Fusion for Cooperative 3D Object Detection on TUMTraf V2X Figure 1
2026-06-12cs.CV

Camera and LiDAR BEV Fusion for Cooperative 3D Object Detection on TUMTraf V2X

Muhammad Shahbaz, Shaurya Agarwal

Department of Civil, Environmental and Construction Engineering, University of Central Florida, boxes through a CenterPoint-style head with a generalised IoU regression loss and an IoU quality, test frames are also present in the released train (40) and validation (4) splits with their labels, so, labels, in the released train and validation data, so Section 4 reports two further studies that measure, cloud where the two LiDARs have been aligned by the dataset providers. Labels are released in the, labelling frame is moving per-frame, which complicates the camera-to-BEV projection that we rely on., block, concatenated, and passed to a CenterPoint head. The head predicts a heatmap, box regression, The two BEV maps are gated and concatenated before a CenterPoint head [4] predicts class heatmaps, box centres, sizes, rotations and an IoU score. The full network has 118.7M parameters, projected back to 512 channels. A CenterPoint multi-task head splits the eight classes into four groups, (vehicle, pedestrian, cyclist, trailer) and shares a 256-channel trunk followed by separate heads for centre

2026-06-12视觉感知三维

本文面向 TUMTraf V2X 协同 3D 检测,动机是在路侧多相机与车路融合 LiDAR 间建立统一 BEV 表示。方法采用双分支 BEV 融合、SE 门控、CenterPoint 头,并加入 GIoU 回归与 IoU 质量重排序。标准训练在 Codabench 达 0.85 mAP;但关键洞察是测试集 50 帧中 44 帧与训练/验证重叠,过采样可到 0.89,直接替换真值可到 0.99,说明成绩受数据泄漏显著影响。

Trajectory-Level Redirection Attacks on Vision-Language-Action Models Figure 1
2026-06-12cs.RO

Trajectory-Level Redirection Attacks on Vision-Language-Action Models

Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda, Hooshang Nayyeri, Dilek Hakkani-Tür, Melkior Ornik

2026-06-12视觉语言视觉感知规划控制

本文关注 VLA 机器人中语言指令被闭环反复使用带来的安全风险:微小且看似保留原命令的文本扰动,可能改变最终物理结果。作者形式化“命令保持的轨迹重定向”威胁,并提出基于 rollout 的 on-policy 提示搜索。仿真与硬件实验显示,该攻击可跨多类 VLA 生效,9 个架构中 7 个成功率超过 90%,防御需做命令级规范化而非表面清洗。

Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models Figure 1
2026-06-12cs.CV

Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models

Jianwei Fei, Yunshu Dai, Zhihua Xia, Xiaochun Cao, Jiantao Zhou, Alessandro Piva, Benedetta Tondi

in part by Research Committee at University of Macau under MYRG-CRG2025-00031-FST and MYRG-GRG2025-00086-FST

2026-06-12视觉感知生成模型安全鲁棒

针对文本到图像扩散模型指纹在多用户参数平均等合谋攻击下易被抹除的问题,本文将比特指纹编码进VAE解码器中的个性化归一化模块,并引入保持单模型功能不变、但会破坏合谋模型生成质量的ACT变换。该方法无需为每个用户重训即可生成指纹副本,并通过最坏情况优化增强抗剪枝、微调等鲁棒性;实验中多任务指纹提取准确率超过99.5%,合谋后FID显著升高,模型可用性被主动削弱。

YOLO-AMC: An Improved YOLO Architecture with Attention Mechanisms for Building Crack Detection Figure 1
2026-06-12cs.CV

YOLO-AMC: An Improved YOLO Architecture with Attention Mechanisms for Building Crack Detection

Ching-Yu Tsai, Chia-Min Lin, Chih-Hsiang Yang, Yung-Che Wang, Jen-Shiun Chiang

Department of Electrical and Computer Engineering, Tamkang University, Taiwan, However, traditional manual inspection methods are time-consuming and labor-intensive, making them difficult to, trade-off between accuracy and deployment efficiency. The implementation code for this study is available on, labor-intensive, and susceptible to subjective judgment

2026-06-12视觉感知

面向建筑/基础设施裂缝细长、低对比且易受背景噪声干扰的问题,论文在 YOLOv11 基础上移除 C2PSA,并在 Neck 多尺度融合处比较引入 GAM、Res-CBAM、SA 等注意力以强化细粒度裂缝特征。实验中 GAM 版本最佳,mAP@0.5 达 0.9917、mAP@0.5:0.95 达 0.9506,高于 YOLOv11n/YOLOv8n;同时约 7.6 GFLOPs,在 RTX 4090 上 110.95 FPS、树莓派 5 约 5 FPS。

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models Figure 1
2026-06-12cs.AI

OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert

Department of Electrical Engineering, Stanford University, Department of Biomedical Data Science, Stanford University School of Medicine, Department of Mathematical Modelling, Statistics and Bioinformatics, Ghent University, our code and an interactive demo is publicly available as a reproducible baseline for the, interactive demo is already available at https://openmedq.streamlit.app/ for qualitative

2026-06-12视觉语言视觉感知

针对医学视觉语言模型常依赖窄数据或不开源权重的问题,OpenMedQ采用LLaVA式ViT-base+LLaMA-7B架构,在14个全开放医学数据集约335万样本上预训练,强调数据广度而非专有规模。结果显示其在PathVQA达75.9 BLEU-1、VQA-MED达64.5,视觉编码器在8个未见分类任务平均macro-F1为0.757,略优于BiomedCLIP等;增益可能主要来自更广数据混合。

ViPER: Vision-based Packing-Aware Encoder for Robust Malware Detection Figure 1
2026-06-12cs.CR

ViPER: Vision-based Packing-Aware Encoder for Robust Malware Detection

Fatima Qaiser, Bisma Tahir, Muhammad Abid Mughal, Nauman Shamim

aDepartment of Computer & Information Sciences, Pakistan Institute of Engineering & Applied Sciences (PIEAS), Islamabad, Pakistan, boundaries for packed and unpacked inputs. To address packing label skew during training, we, rely on become unavailable (Lyda and Hamrock, 2007).

2026-06-12视觉感知安全鲁棒

针对PE二进制可视化检测中“加壳”会制造高熵纹理、且良性软件也常加壳导致单一决策边界失效的问题,ViPER用LoRA适配的DINOv2 ViT-B/14从byteplot联合学习恶意分类与加壳检测,并以残差门控将加壳置信度注入主分类头。其在20万样本上达到BalAcc 0.8521、ROC-AUC 0.9260、AUPR 0.9279,加壳检测AUC 0.9949,优于CNN基线;消融显示主要增益来自LoRA域适配,门控带来较小排序改进。

MAMVI: 3D Test-Time Adaptation via Masked Multi-View Point Clouds Figure 1
2026-06-12cs.CV

MAMVI: 3D Test-Time Adaptation via Masked Multi-View Point Clouds

Inseok Kong, Geunyoung Jung, Jiyoung Jung

Department of Geo Informatics, University of Seoul, Department of Artificial Intelligence, University of Seoul, making it highly suitable for real-time applications. The code is available, Without requiring additional labeled data or full retraining, TTA enables pre-, trained models to adapt on-the-fly using unlabeled test samples, allowing them to

2026-06-12三维

针对3D点云模型在传感器噪声、遮挡和环境变化下测试分布偏移导致性能下降、而现有多视角TTA逐视角顺序优化延迟过高的问题,MAMVI用固定比例与Beta采样结合的掩码生成多视角,通过多视角共识聚合损失并仅一次反传更新归一化层,同时用置信度自适应学习率控制适应强度。在ModelNet-40C、ShapeNet-C和ScanObjectNN-C上,方法在后两者达到SOTA,在ModelNet-40C保持竞争力,并比既有多视角方法快4.9–8.9倍。

Multi-Label Test-Time Adaptation with Bayesian Conditional Priors Figure 1
2026-06-12cs.CV

Multi-Label Test-Time Adaptation with Bayesian Conditional Priors

Qiru Li, Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Yafeng Yin, Qing Gu

Multi-Label Test-Time Adaptation with Bayesian Conditional Priors, Multi-label recognition with frozen Vision-, labels independently, ignoring co-occurrence, structure and producing incoherent label sets, compatible labels. We introduce Bayesian Con-, test-time adaptation method that injects label de-, mismatched label prior. For each test image, it, selects a high-confidence anchor label and ap-, multi-label benchmarks and multiple CLIP back-, *Equal contribution 1 State Key Laboratory of Novel Software, Technology, Nanjing University, Nanjing 210023, China . Corre-, ever, the exploration of TTA within multi-label recogni-

2026-06-12视觉感知

这篇论文针对冻结 VLM 在分布偏移下做多标签识别时忽略标签共现、易产生不一致预测的问题,提出无需反传的 BCP:把零样本 logits 视作边缘后验,为每张图选高置信锚标签,并用在线估计的条件先验/PMI 闭式校正其他标签。实验在多数据集和 CLIP 骨干上显著提升 mAP,如 RN50 平均 57.31→69.22、ViT-B/16 62.61→71.79,同时延迟低于需迭代优化的基线。

Selecting Samples on Graphs: A Unified Dataset Pruning Framework for Lossless Training Acceleration Figure 1
2026-06-12cs.LG

Selecting Samples on Graphs: A Unified Dataset Pruning Framework for Lossless Training Acceleration

Dongyue Wu, Zilin Guo, Xiaoyu Li, Jiajia Liu, Jingdong Chen, Nong Sang, Changxin Gao

State Key Laboratory of Multispectral Information Intelli-, gent Processing Technology, School of Artificial Intelligence and, Automation, Huazhong University of Science and Technology, sity and coverage via objectives such as K-center (Sener &, scalable pruning algorithm rather than a heuristic rule. We, et al., 2012) and k-center selection (Sener & Savarese, 2018)

2026-06-12数据集/基准

大规模训练数据带来高计算成本,现有数据剪枝往往只看单样本难度或样本间多样性,难以同时控制信息量与冗余。本文提出 UGIES,将数据集建模为带节点/边权图,把内在重要性与外在交互统一为最大权团目标,并用边际增益贪心近似及次模保证指导指标设计。实验显示其优于多种剪枝方法,在 ImageNet-1k/ResNet-50 上可减少超过 40% 训练时间且基本不损失精度。

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning Figure 1
2026-06-12cs.RO

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

Allison Andreyev, Landon Eum, Nestor Tiglao, Romel Gomez

2026-06-12规划控制学习理论

面向家庭、仓储等场景中机器人需实时理解开放自然语言且避免大规模示教训练的问题,论文提出 GRASP:用 LLM 将指令解析为带边界框约束的符号目标,再用 GroundingDINO检测并以 IoU、中心距离反馈驱动闭环抓取与摆放。其核心洞察是把边界框同时作为语义目标和控制信号,从而解耦高层规划与低层控制。实验称在桌面分拣/整理任务上有较高指令遵循和定位精度,但具体指标与对比增益来源文中未充分说明。

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension Figure 1
2026-06-12cs.CV

Magnifying What Matters: Attention-Guided Adaptive Rendering for Visual Text Comprehension

Shenglai Zeng, Qirui Wang, Kai Guo, Xinnan Dai, Xianxuan Long, Hui Liu

Michigan State University, Xi’an Jiaotong University

2026-06-12视觉感知

针对视觉文本理解中长文本渲染通常固定、且不清楚 VLM 如何利用可视化证据的问题,本文发现模型在中后层已能定位证据但常未能用好。提出无需训练的 AGAR,用自身注意力选取重要图像 patch 并映射到文本片段放大后重渲染再回答。在 9 个基准、4 个开源 VLM 上均提升准确率,并可与后训练叠加,对视觉和文本扰动保持较稳健。

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement Figure 1
2026-06-12cs.CV

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

2026-06-12强化学习

本文关注统一多模态模型在长链交错推理中“文本想、图像画、再由文本验证”却彼此脱节的问题,指出关键瓶颈不是最终答案监督不足,而是模态边界的信息损失。作者定义模态转移损失,并提出 MoTiF:用带错误图像的 Reflective SFT 训练文本侧纠错,用 Flow-GRPO 强化图像对文本的忠实生成。四个视觉谜题基准上,该转移级监督提升跨模态一致性和最终准确率。

Learning Task-Aware Sampling with Shared Saliency through Density-Equalizing Mappings Figure 1
2026-06-12cs.CV

Learning Task-Aware Sampling with Shared Saliency through Density-Equalizing Mappings

Tsz Lok Ip, Han Zhang, Lok Ming Lui

*Department of Mathematics, The Chinese University of Hong Kong, Hong Kong, China., Department of Mathematics, City University of Hong Kong, Hong Kong, China.

2026-06-12视觉感知

针对图像和曲面学习中均匀卷积把算力浪费在低信息区域的问题,本文提出 DECNN:用可学习密度函数表示共享任务显著性,并通过密度均衡映射扩展重要区域、压缩无关区域,从而实现非均匀感受野采样。实验在局部信息分类与颅面 3D 曲面分析上显示,其以更少参数达到相当或更好精度,并能给出较可解释的任务相关显著区域。

JSCGC: Joint Source-Channel-Generation Coding for Wireless Generative Communications Figure 1
2026-06-12cs.IT

JSCGC: Joint Source-Channel-Generation Coding for Wireless Generative Communications

Tong Wu, Zhiyong Chen, Guo Lu, Li Song, Feng Yang, Meixia Tao, Wenjun Zhang

Generative Communications, Generation Controllability, Dif-, Center, the School of Information Science and Electronic Engi-, neering, Shanghai Jiao Tong University, Shanghai 200240, China, via a communication-aware adapter, enabling controllable

2026-06-12生成模型

论文针对传统 JSCC 以 MSE/LPIPS 等失真指标训练、易产生模糊或伪影的问题,提出 JSCGC:把接收端解码器替换为生成模型,将信道输出作为条件控制采样,并以感知约束下的互信息最大化取代显式失真最小化。系统结合 Mamba 编码器、潜空间 flow matching 与通信感知适配器端到端训练;图像传输实验显示其在多种信道下提升 LPIPS、FID、CLIP 等感知与语义指标,但错误形态转为语义不一致而非局部失真。

SemanticXR: Low Power and Real-time Queryable Semantic Mapping with an Object-Level Device-Cloud Architecture Figure 1
2026-06-12cs.DC

SemanticXR: Low Power and Real-time Queryable Semantic Mapping with an Object-Level Device-Cloud Architecture

Rahul Singh, Devdeep Ray, Connor Smith, Sarita Adve

University of Illinois Urbana-Champaign

2026-06-12视觉感知

面向移动 XR 中空间搜索和 AI 助手所需的开放词汇语义地图,论文指出纯端侧算力不足、简单云卸载又难以兼顾断网查询、带宽和内存。SemanticXR 将“对象”提升为设备—云之间通信、执行和存储的基本单元,在云端做对象级并行、几何降采样与深度协同,在端侧维护稀疏对象地图并增量优先更新。实验显示其在同等语义质量下服务器映射延迟提升 2.2 倍,上行低于 2.5 Mbps,万级对象查询低于 100 ms,设备功耗仅增加约 2%。

Language-Guided Abstraction for Visual Reasoning Figure 1
2026-06-12cs.CV

Language-Guided Abstraction for Visual Reasoning

Xu-Jing Ye, Yuan-Gen Wang, Ruping Wang

aSchool of Artificial Intelligence, Guangzhou University, Guangzhou, 510006, China, the contribution of the two new designs towards the L-VARC framework. The code is available at, the form of language descriptions is available only during, are available for training tasks (via LARC) but not for unseen

2026-06-12视觉感知

本文针对ARC视觉推理中纯LLM参数庞大、纯视觉VARC易陷入像素相关而缺少抽象语义的问题,提出L-VARC:训练时把LARC语言描述经DeepSeek压缩、CLIP编码,并用跨注意力投影与ViT视觉特征对齐,推理时丢弃语言分支保持约18M参数。实验显示验证准确率由76.7%升至78.1%,ARC-2 pass@1由6.25%升至6.67%,增益较小但集中在变换与填充类任务。

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning Figure 1
2026-06-12cs.CV

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

Changye Li, Meng Lu, Yi Wu, Ligeng Zhu

Tsinghua University, reasoning requires aligning station labels with route topology [Feng et al., 2025c,b], while MapTrace, toward map center, {"label": "library icon", {"label": "park icon", "bbox":, {"label": "cafe icon", "bbox":, • We develop a unified reinforcement training recipe centered on Observation-Relaxed Group-

2026-06-12视觉感知

针对现有 VLM 依赖静态视觉表征、在地图路径等空间任务中难以主动获取细粒度证据的问题,论文提出 PERIA,将感知工具与交互工具纳入“感知—交互—推理”流程,并用轨迹合成、复合奖励和 OR-GIGPO 训练多工具策略。在 8 个数据集 13 个基准上,PERIA-8B 较 Qwen3-8B 分布内提升 10.0%、分布外提升 4.4%,并超过同规模强基线 7.0%–14.8%。

DIMOS: Disentangling Instance-level Moving Object Segmentation Figure 1
2026-06-12cs.CV

DIMOS: Disentangling Instance-level Moving Object Segmentation

Hongxiang Huang, Hongwei Ren, Xiaopeng Lin, Yulong Huang, Zeke Xie, Bojun Cheng

The Hong Kong University of Science and Technology (Guangzhou), sity and enables more effective use of the available pixels

2026-06-12视觉感知

DIMOS面向移动实例分割中事件相机分辨率低、事件特征稀疏且外观与运动线索纠缠的问题,认为两种模态都应同时挖掘外观和运动信息。方法通过双解耦编码器、模态内对比学习与任务监督分离两类特征,并用多粒度跨模态对齐提升融合一致性。实验显示其在多模态MIS上达到SOTA,尤其改善小目标、快速运动和低光场景。

Acquisition state behaves as a structured, measurable variable governing lung-nodule AI: kernel-driven measurement instability and noise-driven detection fragility, invisible to DICOM metadata Figure 1
2026-06-12eess.IV

Acquisition state behaves as a structured, measurable variable governing lung-nodule AI: kernel-driven measurement instability and noise-driven detection fragility, invisible to DICOM metadata

Daniel Soliman

(identical “STANDARD” labels across reconstructions)., that adopt these practices can earn the voluntary ACR Recognized Center for Healthcare-AI, between AI outputs and radiology-report-derived surrogate labels, alongside anonymized patient, image through a physical space and change the information available to a reader or a model [4], throughout. Per-scan outputs: candidate boxes (center, extent) and confidence scores.

2026-06-12视觉感知

这篇论文关注影像 AI 监管中只看输出和 DICOM 元数据、却忽略输入采集漂移的问题。作者将 CT 采集状态视为可测量的结构化变量,用像素级噪声/频率指纹刻画其轴向影响:真实与受控实验显示,重建核主要扰动肺结节尺寸测量并导致 5.2% Fleischner 分级翻转,噪声主要削弱小结节检测置信度;像素指纹可识别重建状态,而 DICOM 标签常失效。

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models Figure 1
2026-06-12cs.CV

GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models

Garvita Allabadi, Matteo Sodano, Roberto Estevão, Yuxiong Wang, Vikram Adve, Emre Kiciman, Ranveer Chandra

Garvita Allabadi1, Matteo Sodano2, Roberto Estevão3, University of Illinois Urbana Champaign, University of Bonn, source GPT-4o and Gemini, enabling scalable and cost-efficient deployment of M-ICL. Code, pretable (positive, neutral, or negative contribution), and is readily available whenever we can query the, LMM on labeled training samples., each candidate neighbor and assigning labels according to a task-appropriate score change. Third, train a, that (1) uses the target LMM’s own outputs to generate labeled positives and negatives for candidate, filtering step to limit labeling cost, leverages hard-negative mining, and supports transfer when the target, source API-based systems like GPT-4o and Gemini. This enables scalable, cost-efficient performance

2026-06-12视觉语言

论文针对多模态上下文学习中“视觉相似样本最有用”的常见假设,指出近邻样本未必提升 LMM 预测。GRIP 用目标模型反馈给候选示例打正负标签,并以监督对比学习训练纯视觉检索器,使检索空间对齐实际提示效用而非表面相似。实验覆盖分类、VQA、 captioning,在 Qwen2.5-VL-7B 上六项均优于相似度检索,在 Idefics2-8B 分类增益最明显,并显示可跨模型迁移到 GPT-4o、Gemini。

EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows Figure 1
2026-06-12cs.RO

EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows

Clinton Enwerem, John S. Baras, Calin Belta

Institute for Systems Research, University of Maryland, College Park, MD, U.S.A.

2026-06-12生成模型

针对灵巧抓取生成中姿态与接触力分离、易导致力闭合失败或摩擦违规的问题,EquiDexFlow 将腕部 SE(3) 流匹配、关节、指尖接触、法向与接触力联合建模,并用表面投影和摩擦锥投影把部分物理约束做成结构保证。实验在 81 个物体的 8100 个 Allegro 抓取上验证,摩擦违规为零、力矩残差和综合评分优于消融,并能重定向到 LEAP 手完成 6 个实物开环抓取。

VLADriveBench: Evaluating CoT-Action Relationship in VLA for Autonomous Driving Figure 1
2026-06-12cs.CV

VLADriveBench: Evaluating CoT-Action Relationship in VLA for Autonomous Driving

Thach Nguyen, Danhua Guo, Tom Lampo, Fei Wu, Burhan Yaman

Uber AV Labs

2026-06-12视觉感知

本文针对自动驾驶 VLA 只用轨迹指标评测、无法判断 CoT 是否真实影响动作的问题,提出 VLADriveBench,将提及、幻觉、矛盾、动作对齐等观察指标与 CoT 替换干预结合。实验显示两类证据会明显分歧:ORION 观察对齐最高但 CoT 更像事后合理化,Alpamayo v1.5 对齐较低却呈现更强因果作用,且受视觉显著性调节。

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images Figure 1
2026-06-12cs.CV

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

Xiaoxiao Sun, Ruotian Zhang, Junzhe Huang, James Burgess, Serena Yeung-Levy

Stanford University, Zhejiang University, The University of Queensland

2026-06-12视觉语言视觉感知

论文关注 VLM 用于生成图像瑕疵检测时“判对有瑕疵但看错位置或编造原因”的隐患,提出 SALART-VQA,将显著 artifact 理解拆成存在判断、语义定位、空间框选、基于证据的缺陷识别,并加入真实/生成参考图测试校准与拒答。950 图、3681 题评测 20 个 VLM 显示,最强模型虽有 99.37% 检出召回,但四步全对仅 53.26%,且敏感模型易误报、保守模型易漏检。

Amnesia: A Stealthy Replay Attack on Continual Learning Dreams Figure 1
2026-06-12cs.CR

Amnesia: A Stealthy Replay Attack on Continual Learning Dreams

Ahmed Sharshar, Naveen Kumar Kummari, Mohsen Guizani

Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence, AbuDhabi, UAE, Department of Machine Learning, verify compliance using sampler-visible telemetry, e.g., logged replay index/label statistics, limited-privilege insider controlling only the replay index selection, not pixels, labels, or, and establish a principled impact-visibility-budget trade-off. Code is available anonymously, label sets, or distribution shift under a fixed label set)., reliability and compliance: it logs replay index sets, per-batch label counts, queue/priority metadata (e.g., fraction stays fixed and that the replay label histogram remains close to a nominal baseline derived from the

2026-06-12视觉感知

论文关注连续学习中经验回放采样器这一低权限但易被忽视的攻击面:攻击者不改图像、标签或参数,只操控回放索引。Amnesia用类别伤害效用偏置采样,并在TV/KL可审计偏差预算和固定回放率下投影、调度以保持隐蔽。实验在Split CIFAR、CORe50、Tiny-ImageNet及ER、DER++等基线上显示其降低最终准确率、加剧遗忘;KL版本更隐蔽,TV版本破坏更强但更易被审计发现。

CD-RCM: Generalizable Continuous-Depth Novel View Synthesis for Reflectance Confocal Microscopy Figure 1
2026-06-12cs.CV

CD-RCM: Generalizable Continuous-Depth Novel View Synthesis for Reflectance Confocal Microscopy

Tooba Imtiaz, Milind Rajadhyaksha, Kivanc Kose, Jennifer Dy

Northeastern University, 2Memorial Sloan Kettering Cancer Center

2026-06-12视觉感知

RCM 皮肤 z-stack 轴向采样稀疏、各向异性,限制了 DEJ 等深度结构的判读。CD-RCM 将中间深度生成表述为面向 RCM 的连续深度新视角合成,利用轴向光学切片与遮挡特性,采用前馈、可按深度查询的 transformer 框架,并加入 RCM 域感知损失以保留细胞纹理。实验显示其可在单次、亚秒级推理中生成较真实的未采样切片,优于传统插值基线。

ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation Figure 1
2026-06-12cs.CV

ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation

Jiangtao Kong, Peijun Zhao, Chun-Fu Chen, Youngwook Do, Shaohan Hu, Tianyi Zhou, Huajie Shao

Code and benchmarks are available at https:, Department of Computer Science, William & Mary, Vir-, Chase, USA 3Mohamed bin Zayed University of Artificial Intelli-

2026-06-12视觉感知

这篇论文关注开放式图像到文本生成在真实连续视觉流中的遗忘问题:任务不再按互斥类别划分,而按主导语义随时间迁移且可重叠。作者提出只更新预训练 VLM 的跨模态对齐模块的 ECA,用 MoQ 组合任务查询、FeDEx 按 Fisher 冲突动态扩展适配器,并用嵌入字典回放替代原始样本存储。在四个按主题构造的 Caption/VQA 增量基准上,ECA 相比基线更好缓解灾难性遗忘并提升增量性能。

Context-Aware Feature-Fusion for Co-occurring Object Detection in Autonomous Driving Figure 1
2026-06-12cs.CV

Context-Aware Feature-Fusion for Co-occurring Object Detection in Autonomous Driving

Binay Kumar Singh, Niels Da Vitoria Lobo

Department of Computer Science, University of Central Florida, head. The code is available at https://github.com/

2026-06-12视觉感知

面向自动驾驶中拥挤、遮挡场景下小目标与低频共现类别易漏检的问题,本文在两阶段检测器RoI头中加入CCFF:用RoI间自注意力建模局部交互,并将Top-K RoI池化为全局上下文token以编码共现先验。Cityscapes与BDD100K上CCS达0.973/0.969,小目标APS提升至14.1%,还能恢复Train等稀有类,额外开销约0.2 FPS。

Dual-State Slot Attention: Decoupling Appearance and Identity for Video Object-Centric Learning Figure 1
2026-06-12cs.CV

Dual-State Slot Attention: Decoupling Appearance and Identity for Video Object-Centric Learning

Sieu Tran, Duc Nguyen, Hao Vo, Khoa Vo, Ngan Le

University of Arkansas

2026-06-12视觉感知

本文针对视频对象中心学习中槽表示易在快速运动、遮挡时发生身份交换的问题,指出单一 slot 同时承担外观重建与跨帧身份保持会产生目标冲突,且注意力重归一化会放大弱匹配槽。DSSA 将每个槽拆为局部外观状态与稳定身份状态,并用竞争调制聚合抑制伪更新;在 MOVi-C/D 和 YouTube-VIS 上提升分割、时序一致性,并改善对象识别与视频动力学预测。

Emerging Flexible Designs for Geospatial Multimodal Foundation Models Figure 1
2026-06-12cs.LG

Emerging Flexible Designs for Geospatial Multimodal Foundation Models

Philipe Dias, Waqwoya Abebe, Abhishek Potnis, Aristeidis Tsaris, Dan Lu, Xiao Wang, Dalton Lunga

Oak Ridge National Laboratory, abling scalable pretraining across diverse unlabeled geospatial modalities. However, unlabeled data. Such architectures are preliminarily showing the potential to interpret vast amount, volumes of unlabeled imagery data. Presently in Earth observation imagery applications, varying

2026-06-12视觉语言

针对地球观测多模态基础模型在传感器、光谱波段不一致时难以公平比较的问题,本文统一预训练数据、SSL目标、参数规模与GeoBench评测协议,对SatMAE、DOFA和Flex做“同条件”对照。核心洞察是 tokenization 与跨波段融合策略直接影响光谱推理、鲁棒性和泛化:Flex的模块化设计更适合缺失或异构波段,但在光谱同质数据上可能不如标准ViT;文中主要给出架构取舍结论,具体增益来源仍需更多消融说明。

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs Figure 1
2026-06-12cs.CV

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal, Ali Etemad, Elham Dolatabadi

York University, University of British Columbia, Vector Institute, Queen’s University, labels are unreliable in medicine [23, 24], prior work substitutes the supervised fine-tuning (SFT)

2026-06-12视觉语言优化算法

本文关注医学大视觉语言模型在临床描述中易幻觉、视觉依据不足,以及 DPO 将关键医学词与套话同等优化导致对齐失真的问题。作者提出 FIRE-MPO:用模型自身输出构造在策略偏好对,仅最小修改错误医学片段,并结合双向 token 级 KL 正则与干净/病灶扰动图像的视觉对比约束。实验显示其在多项医学影像与临床文本生成基准上优于 DPO、RRPO,两个 LVLM 平均相对提升约 10.24%,并减少风格化 reward hacking。

High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation Figure 1
2026-06-12cs.CV

High-Fidelity Two-Step Image Generation via Teacher-Aligned End-to-End Distillation

Dongyang Liu, Ruoyi Du, David Liu, Dengyang Jiang, Liangchen Li, Qilong Wu, Zhen Li, Steven C.H. Hoi, Hongsheng Li, Peng Gao

The Chinese University of Hong Kong

2026-06-12视觉感知

本文针对扩散模型虽已能稳定蒸馏到4–8步、但进一步压到2步会因单步跨度过大和两步职责差异导致质量崩塌的问题,提出Z-Image Turbo++:用8步教师生成图像作为GAN“真实”目标以降低分布对齐难度,解耦两步参数提升专用容量,并进行端到端训练同时保留第一步损失。实验显示其在仅2步采样下显著缩小与8步教师的视觉和指标差距。

HairPort: In-context 3D-aware Hair Import and Transfer for Images Figure 1
2026-06-12cs.CV

HairPort: In-context 3D-aware Hair Import and Transfer for Images

Alireza Heidari, Amirhossein Alimohammadi, Wallace Michel Pinto Lira, Adi Bar-Lev, Ali Mahdavi-Amiri

ALIREZA HEIDARI∗, Simon Fraser University, Canada, AMIRHOSSEIN ALIMOHAMMADI, Simon Fraser University, Canada, ALI MAHDAVI-AMIRI, Simon Fraser University, Canada, Fraser University, Vancouver, Canada., segmentation-guided controllability, trained through in-context, Zhu et al. 2022] that emphasize controllability, fidelity, and, have achieved strong results in image synthesis [Labs 2024

2026-06-12视觉感知三维

本文针对发型迁移在源图与参考图存在大姿态、尺度差异时易错位、遮挡区域难补全且身份易漂移的问题,提出 HairPort:先用基于 FLUX.1 Kontext 的 LoRA 裸头转换器和 6000 对 Baldy 数据去除原发型,再进行三维重建与视角对齐,最后用条件 flow-matching 合成。实验和用户研究显示其在姿态一致性、发型保真与身份/背景保持上优于多种 2D GAN/扩散基线,但速度较慢且受 3D 头发重建误差影响。

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation Figure 1
2026-06-12cs.SD

AudioX-Turbo: A Unified Framework for Efficient Anything-to-Audio Generation

Zeyue Tian, Lei Ke, Zhaoyang Liu, Ruibin Yuan, Liumeng Xue, Yujiu Yang, Weijia Chen, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

The Hong Kong University of Science and Technology, Tsinghua University, following capabilities. The code and datasets will be available at, both critical for controllable audio generation.

2026-06-12视觉感知

面向现有音频/音乐生成模型输入模态单一、数据监督分散且扩散采样开销高的问题,AudioX-Turbo用MMDiT统一文本、视频、音频条件,并通过自适应多模态融合提升对齐;再将多步教师以适配flow matching的分布匹配蒸馏和扩散判别器压缩为4步学生。作者还构建约920万样本IF-caps-Pro。实验显示其在多任务尤其T2A/T2M和指令跟随上优于或接近SOTA,NFE最多降约25倍,但增益可能部分来自大规模数据。

Stereo Vision-Based Fall Prediction and Detection using Human Pose Estimation on the AMD Kria K26 SOM Figure 1
2026-06-12cs.CV

Stereo Vision-Based Fall Prediction and Detection using Human Pose Estimation on the AMD Kria K26 SOM

Shreyas Narasimhiah Ramesh, P. D. Rathika, Mahasweta Sarkar, Kristen Wells, Michel Audette, Christopher Paolini

aElectrical and Computer Engineering, San Diego State University, 5500 Campanile Drive, San, bDepartment of Robotics and Automation Engineering, PSG College of Technology, Peelamedu, Coimbatore, 641004, Tamil, cPsychology, San Diego State University, 5500 Campanile Drive, San Diego, 92182-4611, California, USA, dElectrical and Computer Engineering, Old Dominion University, 5115 Hampton Blvd, Norfolk, 23529, Virginia, USA

2026-06-12视觉感知三维

针对老年人跌倒需及时发现、而穿戴设备依从性和摄像头隐私受限的问题,论文在 AMD Kria K26 边缘 SOM 上构建低功耗双目/深度视觉流程:YOLOX 检人后丢弃 RGB,A2J 从深度估计 15 个三维关节,再由 CNN 判别跌倒。量化后 YOLOX IoU@0.5 为 74%,A2J 10cm mAP 为 84.13%,跌倒分类准确率 75.85%;双 DPU 多线程吞吐提升到 4.5 FPS,证明本地隐私保护方案可行但速度和精度仍有限。

2026-06-11

121 篇
Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models Figure 1
2026-06-11cs.CV

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

National Yang Ming Chiao Tung University, National Taiwan University

2026-06-11视觉语言视觉感知

这篇论文针对 VLM 推理中视觉 token 多、注意力与 KV-cache 开销高的问题,指出现有“打分后永久删除”假设 token 重要性跨层稳定,易在定位任务中过早丢失后层才变重要的证据。Reroute 将删除改为可恢复路由:低分 token 暂时绕过当前层,后续仍可重新参与候选,且复用 FastV、PDrop、Nüwa 的打分与预算。实验显示,在 LLaVA-1.5 与 Qwen 系列上,激进压缩时 grounding 提升明显,同时基本保持通用 VQA 表现。

How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology Figure 1
2026-06-11cs.CV

How Seemingly Inconsequential Design Choices Dictate Performance of LLMs in Pathology

Kian R. Weihrauch, Thomas A. Buckley, William Lotter, Arjun K. Manrai

Massachusetts Institute of Technology, Cambridge, MA, Harvard Medical School, Boston, MA, Dana-Farber Cancer Institute, Boston, MA

2026-06-11视觉感知

针对全切片病理图像超出通用多模态 LLM 上下文、既有基线常用小块高倍独立投票而可能低估模型能力的问题,本文系统考察推理方式、patch 尺寸、倍率和数量四个输入设计因素。核心洞察是输入配置本身可主导性能:大尺寸、低倍率并联合推理显著优于标准协议。MultiPathQA 上 GPT-5 癌种分类由 15.1% 提至最高 43.9%,器官分类由 38.1% 提至 71.6%,均衡配置还可迁移到 Qwen、Gemini 和 CPTAC,最高带来 23.4 个百分点增益。

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? Figure 1
2026-06-11cs.RO

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

Stanford University, 2 University of Waterloo, 3 NVIDIA

2026-06-11视觉感知

这篇论文关注具身规划中一味增加测试时计算带来的高延迟与收益递减问题。作者提出 Direct,将高层 VLM 规划器视为可动态选择的组件,依据视觉场景与指令判断任务需求,在思维链深度、模型规模和记忆历史等计算轴上路由到“足够便宜且能胜任”的配置。实验显示,不同计算形式带来不同能力增益,且大量任务无需最强模型;在 VLABench、RoboMME 和 Franka DROID 实机上,Direct 可接近或达到强模型成功率,同时最高降低 65% 平均延迟。

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving Figure 1
2026-06-11cs.CV

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

2026-06-11视觉语言视觉感知

面向自动驾驶VLA模型难以把语言推理落到连续3D空间的问题,VLGA在视觉、语言、动作之外加入参数隔离的几何专家,并用LiDAR监督的逐像素pointmap重建提供稠密空间信号,使策略不仅“看和说”还显式重建场景。在nuScenes开环中其无ego状态VLA规划平均L2降至0.50m、3秒碰撞率0.18%,Bench2Drive闭环驾驶分数达79.08,显示增益主要集中在空间精度和安全相关指标上。

Illumination-Robust Camera-Based Heart-Rate Estimation for Physiological Sensing in Robots Figure 1
2026-06-11cs.CV

Illumination-Robust Camera-Based Heart-Rate Estimation for Physiological Sensing in Robots

Zhi Wei Xu, Torbjörn E. M. Nordling

Department of Mechanical Engineering, National Cheng Kung University, Tainan, Taiwan.

2026-06-11机器人安全鲁棒

面向服务/社交机器人在日常光照变化下的无接触生理感知,论文将RGB视频rPPG心率估计做成时空Transformer框架,结合PRNet三维人脸对齐、片段级光照增强、残差时间标准化模块,并调节时间波形损失与频域KL监督的权重。静态三光照混合协议中,β=5最佳,HR MAE达0.79 bpm、相关系数0.982,相比同数据上的PhysFormer显著降低误差;但尚未验证运动机器人、在线适应和真实HRI场景。

Semantically-Aware Diver Activity Recognition Framework for Effective Underwater Multi-Human-Robot Collaboration Figure 1
2026-06-11cs.RO

Semantically-Aware Diver Activity Recognition Framework for Effective Underwater Multi-Human-Robot Collaboration

Sadman Sakib Enan, Junaed Sattar

2026-06-11机器人视觉感知

面向水下多潜水员—机器人协作中AUV需理解队友行为以保障安全与协同决策的问题,论文提出DAR-Net,用Transformer建模视频时空信息,并以像素级语义掩码通过多损失引导模型关注潜水员、机器人和目标物而非背景;同时构建含2640张标注图像、6类活动的UDA数据集。受控闭水实验显示其优于现有动作识别模型,但开放水域泛化仍文中未充分说明。

A Turbo-Inference Strategy for Object Detection and Instance Segmentation Figure 1
2026-06-11cs.CV

A Turbo-Inference Strategy for Object Detection and Instance Segmentation

Zhen Zhao, Gang Zhang, Xiaolin Hu, Liang Tang

School of Technology, Beijing Forestry University, Beijing 100091, China, Department of Computer Science and Technology, Tsinghua University, Beijing 100084, China, Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing 100084, China, Chinese Institute for Brain Research (CIBR), Beijing 100010, China

2026-06-11视觉感知

针对顶层实例分割中“检测先行、分割只被动依赖检测”的单向流程,论文提出训练无关的 turbo-inference:用分割得到的粗 mask 反向修正框和分类分数,再基于修正框重做分割,形成可迭代闭环。该策略可接入 Mask R-CNN、HTC、QueryInst 等方法,在 COCO、Cityscapes 和 iFLYTEK 上同时提升检测与分割精度,但代价是推理计算量和时延增加,适用范围也主要限于 top-down 框架。

DepthMaster: Unified Monocular Depth Estimation for Perspective and Panoramic Images Figure 1
2026-06-11cs.CV

DepthMaster: Unified Monocular Depth Estimation for Perspective and Panoramic Images

Pengfei Wang, Shihao Wang, Liyi Chen, Zhiyuan Ma, Guowen Zhang, Lei Zhang

VISUAL COMPUTING LAB, POLYU VCLAB • PREPRINT 2026, The Hong Kong Polytechnic University, Visual Computing Lab · The Hong Kong Polytechnic University, visualizations on our project page: https://polyu-vclab.github.io/DepthMaster-page.

2026-06-11视觉感知

DepthMaster针对单目度量深度在透视图与360°全景间难以统一、且全景标注稀缺的问题,将全景拆成重叠透视patch,并注入虚拟投影相机几何先验;用对应一致性损失约束patch拼接,避免改造标准Transformer,从而继承大规模透视数据先验。文中称在仅含一个全景训练集的混合数据上,于13个数据集零样本评测达到SOTA,并超过多种通用和专用模型。

Atlas H&E-TME: Scalable AI-Based Tissue Profiling at Expert Pathologist-Level Accuracy Figure 1
2026-06-11cs.CV

Atlas H&E-TME: Scalable AI-Based Tissue Profiling at Expert Pathologist-Level Accuracy

Kai Standvoss, Miriam Hägele, Rosemarie Krupar, Julika Ribbat-Idel, Jennifer Altschüler, Gerrit Erdmann, Hans Pinckaers, Evelyn Ramberger, Madleen Drinkwitz, Ádám Nárai, Alexander Möllers, Katja Lingelbach, Sebastian Kons, Lukas Hönig, Recepcan Adigüzel, Joana Baião, Alberto Megina Gonzalo, Marius Teodorescu, Marie-Lisa Eich, Paolo Chetta, Shakil Merchant, Verena Aumiller, Simon Schallenberg, Andrew Norgan, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen

2026-06-11视觉感知

针对常规 H&E 全切片难以规模化、定量解析肿瘤微环境且 H&E 标注存在形态歧义的问题,本文提出 Atlas H&E-TME,基于病理基础模型联合组织质控、区域分割与细胞分类,生成每张切片 4500 多项细胞级读数;其关键在于用 IHC 辅助多病理专家共识做深度验证,并用 1500 余病例、8 类癌种和 20 万余标注做广度验证。结果显示模型相对 IHC 共识达到或超过 H&E-only 病理专家表现,并在多来源、多扫描仪场景下保持稳健。

Echoes of the Prior: A Computational Phenomenology of Forgetting Figure 1
2026-06-11cs.CV

Echoes of the Prior: A Computational Phenomenology of Forgetting

Gege Gao, Bernhard Schölkopf, Andreas Geiger

GEGE GAO, Eberhard Karl University of Tübingen, Germany, BERNHARD SCHÖLKOPF∗, Max Planck Institute for Intelligent Systems, Germany, ANDREAS GEIGER∗, Eberhard Karl University of Tübingen, Tübingen AI Center, Germany, CCS Concepts: • Human-centered computing →Interaction design theory, concepts and paradigms, gen, Tübingen AI Center, Tübingen, Baden-Württemberg, Germany., philosopher Descartes, we elaborate on the philosophical implications of this choice in Sec. 5.1.

2026-06-11视觉感知

论文动机是把阿尔茨海默等遗忘的主观体验从神经机制解释转化为可感知的视觉现象。其核心做法是将前馈 3D Gaussian Splatting 重建模型视作“硅脑”,分别扰动视觉编码器与 DINOv2 语义先验,模拟感知衰退和记忆衰退,形成可交互的 Deep Glitch 装置。结果展示用户调节衰减因子后场景会实时融化、幽灵化并失去空间结构;但文中未充分说明其对认知现象的定量验证。

Anatomically Conditioned Recurrent Refinement for Topology-Aware Circle of Willis Segmentation Figure 1
2026-06-11cs.CV

Anatomically Conditioned Recurrent Refinement for Topology-Aware Circle of Willis Segmentation

Juraj Perić, Marija Habijan, Dario Mužević, Irena Galić, Danilo Babin, Aleksandra Pižurica

Clinical Medical Center Osijek, Osijek, Croatia, Ghent University, Dept. of Telecommunications and Information Processing, imec-TELIN-IPI, Ghent, Belgium, Ghent University, Dept. of Telecommunications and Information Processing, TELIN-GAIM, Ghent, Belgium, While manual segmentation remains the gold standard, it is labor-intensive and subject to inter-observer variability [4]., introduced the centerline-Dice (clDice) to penalize disconnected skeletons [15]. Similarly, in the recent TopCoW

2026-06-11视觉感知

针对MRA中Willis环血管细、拓扑复杂,常规U-Net/nnU-Net易出现断裂且Dice损失难约束连通性的问题,论文提出AC2RUNet:用静态解剖特征流缓存3D结构信息,轻量动态流按时间步递归修补分割,并配合由高召回几何监督过渡到拓扑约束的课程学习。在TopCoW上,相比nnU-Net保持相近Dice,同时Hausdorff距离从9.17降至4.72 mm,Betti错误从0.40降至0.19,显示主要收益在拓扑连通性改善。

Slots, Transitions, Loops: Learning Composable World Models for ARC Figure 1
2026-06-11cs.CV

Slots, Transitions, Loops: Learning Composable World Models for ARC

Gege Gao, Bernhard Schölkopf, Andreas Geiger

University of Tübingen

2026-06-11强化学习

论文针对 ARC 中仅凭少量示例归纳视觉符号规则的问题,指出直接网格到网格预测会掩盖对象、颜色和空间关系的中间结构。作者提出 Loop-OWM,将网格表示为对象中心的世界状态,用演示条件化任务摘要推断转移规则,并通过循环转移模型迭代执行,结合密集传播与 slot 条件校正。在 ARC-1 和 ARC-2 上,该方法以相当或更少参数优于非循环及循环 ViT 基线,说明把 ARC 视为可组合状态转移能提供有效归纳偏置。

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion Figure 1
2026-06-11cs.CV

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion

Yuchen Xian, Yunqiu Xu, Yang He, Yi Yang

ReLER, The State Key Lab of Brain Machine Intelligence, Zhejiang University 2College of Artificial Intelligence, Zhejiang, University 3National University of Singapore 4CFAR, Agency for, pact and controllable organization to regulate non-local, cess as global guidance. This division of labor allows, lable global interface and preserves the 2D fusion

2026-06-11视觉语言视觉感知

本文针对多模态图像融合中2D共享特征网格难以解耦全局外观与局部细节的问题,提出用冻结的1D图像 tokenizer 作为紧凑的全局“base”载体,并通过选择性 Token 编辑仅调整少量外观敏感位置,再与2D细节通路融合。实验覆盖红外-可见光、医学融合及检测/分割下游任务,在四个常用基准上整体指标最优,显示全局一致性和局部保真度均有提升。

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition Figure 1
2026-06-11cs.CV

Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

Sukmin Seo, Geewook Kim

2026-06-11视觉语言视觉感知数据集/基准

面向小时级视频的自然语言时间定位,作者指出瓶颈不再是近邻事件识别而是长时段搜索,并构建开放基准ExtremeWhenBench(194个视频、2273问,均长75.7分钟、开放式查询)。实验将任务拆为search/localize:开放Video-LLM在该基准上显著失效,帧级CLIP检索反而更强;失败分析称85%来自搜索,retrieve-then-ground混合方案较单体Video-LLM提升6.7倍,说明长视频定位需优先改进语言条件检索。

Findings of the MAGMaR 2026 Shared Task Figure 1
2026-06-11cs.CV

Findings of the MAGMaR 2026 Shared Task

Alexander Martin, Dengjia Zhang, Joel Brogan, Francis Ferraro, Jeremy Gwinnup, Reno Kriz, Teng Long, Kenton Murray, Andrew Yates, Xiang Xiang

Johns Hopkins University, University of Maryland, Baltimore County, Air Force Research Laboratory, Human Language Technology Center of Excellence, Johns Hopkins University, University of Amsterdam, Huazhong University of Science and Technology, generated report that was labeled the best by a

2026-06-11视觉感知

针对现实信息检索日益需要跨视频、文本和多语言证据,而现有任务偏文本的问题,MAGMaR 2026 扩展为视频检索与基于检索视频的有据生成两条赛道,使用含 11 万余事件视频的 WIKIVIDEO25/MultiVENT2.0。核心洞察是将视频转为摘要、字幕等文本代理并配合大召回与推理式重排优于单一稠密嵌入;17 个检索系统均超过去年强基线,生成赛道也显示人工偏好与自动指标存在明显脱节。

Bridging the Modality Gap in Forensic Image Retrieval Figure 1
2026-06-11cs.CV

Bridging the Modality Gap in Forensic Image Retrieval

Ricardo González-Gazapo, Annette Morales-González, Yoanna Martínez-Díaz, Heydi Méndez-Vázquez, Milton García-Borroto

2026-06-11视觉感知

针对法证检索中照片、目击描述、手绘纹身/人脸素描等证据形态差异大、纯视觉匹配难以处理语义与噪声的问题,论文提出统一的多模态流程:用 MLLM 为查询和图库生成结构化文本,再以句向量比较,并与任务相关视觉特征分数融合。实验覆盖四类法证场景,结果显示文本表征在视觉信息缺失时仍有效,多模态融合整体提升检索精度和鲁棒性,但具体增益来源与规模化因素文中未充分说明。

CellNet -- Localizing Cells using Sparse and Noisy Point Annotations Figure 1
2026-06-11cs.CV

CellNet -- Localizing Cells using Sparse and Noisy Point Annotations

Benjamin Eckhardt, Dmytro Fishman, Stuart Fawke, Andrew Curtis, Bo Fussing, Constantin Pape

University of G¨ottingen, 2 Wellcome Sanger Institute, 3 University of Tartu, laborators at the Wellcome Sanger Institute study vital genes in humans via large scale, centers, the sum of Gaussian probability distributions centered, our approach to the LivECell dataset (Edlund et al., 2021) by training on the centers of mass

2026-06-11视觉感知

面向高通量基因筛选中反复活细胞计数的标注与人工成本,CellNet用少量稀疏点标注训练U-Net/ResNet回归细胞密度图,并以积分计数、局部极值定位。结果显示其在LiveCell和Sanger23上明显落后于零样本CellposeSAM(如30.5% vs 7.94% sMAPE),但仅用两张部分标注图训练后与Countess 3 FL计数有较强相关性(r=0.83);当前增益主要体现为低数据与轻量化,定位F1很低且评估流程可能有缺陷。

Finding Sparse Subnetworks in One Training Cycle via Progressive Magnitude-Based Pruning Figure 1
2026-06-11cs.CV

Finding Sparse Subnetworks in One Training Cycle via Progressive Magnitude-Based Pruning

Romana Qureshi, Hafida Benhidour, Said Kerrache, Nahlah Aljeraisy

2026-06-11视觉感知

为降低剪枝寻找“彩票票据”所需的多轮完整训练成本,本文将基于权重幅值的剪枝嵌入单次训练:按线性稀疏率日程逐轮更新全局掩码,并禁止已剪连接再生。在 CIFAR-10/MNIST 的 ResNet、VGG、LeNet 上,该方法在 ResNet-18 72.9% 稀疏率达 95.12%,高于文中引用的 LTH 90.5%;在约 97–98% 极高稀疏下也优于 SNIP/GraSP 报告值,但对比主要依赖已发表基线,公平性仍需谨慎判断。

VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models Figure 1
2026-06-11cs.CV

VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models

Chunlin Qiu, Ang Li, Tianxiao Huang, Ruilin Gan, Yunjie Ge, Shenyi Zhang, Huayi Duan, Lingchen Zhao, Chao Shen, Qian Wang

School of Cyber Science and Engineering, Wuhan University, School of Computer Science, Wuhan University, Institute for Math&AI, Wuhan University, The Hong Kong University of Science and Technology (Guangzhou), School of Cyber Science and Engineering, Xi’an Jiaotong University

2026-06-11生成模型

针对潜在扩散模型被用于人脸/风格等未授权模仿的问题,本文指出既有“语义引导”扰动会被 VAE 编码、扩散噪声与模型恢复先验逐步抹除。Void 改为放大模型内部随机编码误差并抵消 CFG 条件引导,使生成轨迹语义崩塌,同时用 JND 约束保持图像可用性。实验覆盖 10 类攻击、24 种防御和 5 个数据集,平均 FID 从 113 提升到 365,并保持 PSNR 34.41 dB、SSIM 0.89。

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning Figure 1
2026-06-11cs.CV

Bridging Day and Night: Unsupervised Cross-Domain Re-Identification with Synergistic Prompt and Prototype Learning

Jiyang Xu, Rui Liu, Hang Dai

School of Computer Science, Wuhan University, Wuhan, China

2026-06-11视觉感知

针对昼夜车辆重识别中光照变化导致的强域偏移和人工标注成本高问题,本文探索无监督设定,将视觉语言模型的实例感知动态提示与日/夜域原型记忆库结合,通过域内身份关联和双向跨域原型匹配建立无标注身份对应。公开基准实验显示,其无监督 Rank-1 精度可接近现有全监督方法。

Damage-TriageFormer: A Foundation-Model Framework for Typology-Based Building Damage Assessment from Mono-Temporal Imagery Figure 1
2026-06-11cs.CV

Damage-TriageFormer: A Foundation-Model Framework for Typology-Based Building Damage Assessment from Mono-Temporal Imagery

Yiming Xiao, Yu-Hsuan Ho, Sanjay Thasma, Junwei Ma, Ali Mostafavi

Texas A&M University, Institute for a Disaster Resilient Texas, major, destroyed) or require paired pre- and post-event imagery that is often unavailable for emerging, remains difficult due to its limited examples and an inherently ambiguous label boundary, our results show, labels do not explicitly encode whether visible damage is confined to the roof, extends into structural, load-bearing elements have partially failed may both be labeled “major,” even though they call for different, imagery is available and well registered, but it is brittle in the conditions where rapid assessment matters most., formulation removes this dependency and matches the data that are often available first, including NOAA, building-footprint layers are increasingly available from local and state GIS programs as well as curated

2026-06-11视觉感知

面向灾后快速分配资源,论文指出传统损伤评估常把屋顶与结构破坏压成单一严重度,且依赖灾前/灾后配准影像。作者构建基于 NOAA 灾后单时相影像和建筑轮廓的 DamageTriage-Bench,并用 DINOv3 ViT-L、特征金字塔、实例池化与两阶段门控头预测五类损伤类型。模型在分层测试集 macro F1 为 0.619,对无损和完全结构坍塌表现较强,但全屋顶损伤因样本稀少和边界模糊仍是主要瓶颈。

DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems Figure 1
2026-06-11cs.RO

DrivingAgent: Design and Scheduling Agents for Autonomous Driving Systems

Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang

Wangxuan Institute of Computer Technology, Peking University, University of California, Merced

2026-06-11视觉感知

面向自动驾驶系统引入基础模型后模块集成成本高、实时调度不足的问题,DrivingAgent将“设计”和“调度”拆成两类代理:前者解析网络结构、生成并用超网络训练验证新模块,后者用强化学习训练的轻量LLM结合长短期时间戳记忆动态调用模块。实验在nuScenes和Bench2Drive上显示其取得更好的速度—精度权衡,但具体增益来源仍需看消融细节。

An Electric Potential-Augmented Benchmark Dataset for Physics-Guided Image Reconstruction of Electrical Capacitance Tomography Figure 1
2026-06-11cs.CV

An Electric Potential-Augmented Benchmark Dataset for Physics-Guided Image Reconstruction of Electrical Capacitance Tomography

Xinqi Zhang, Qiming Ma, Lihui Peng

Department of Automation, Tsinghua University, Beijing 100084, China, physics behind ECT into the learning process. Generated via a COMSOL-MATLAB

2026-06-11视觉感知数据集/基准三维

针对ECT深度重建常把电容到介电率视为黑箱、忽略软场物理的问题,论文构建了电势增强基准数据集:以八电极传感器仿真生成2万组三类/四类典型流型样本,同时提供介电率图、28维电容和8个激励下全场电势图,并给出正/反问题评测协议。IID与OOD实验显示,引入电势这一潜在场信息可提升建模精度和鲁棒性,但目前仍限于二维仿真、单一几何和单一介电率对比。

Adapting Prithvi-EO for Fallow Detection for Food-Water Nexus: ViT-Adapter Necks and Parameter-Efficient Backbone tuning of Geospatial Foundation Model Figure 1
2026-06-11cs.CV

Adapting Prithvi-EO for Fallow Detection for Food-Water Nexus: ViT-Adapter Necks and Parameter-Efficient Backbone tuning of Geospatial Foundation Model

Sk Muhammad Asif, Orhun Aydin

Earth, Atmospheric and Geospatial Science Saint Louis University Saint Louis Missouri USA 63103

2026-06-11视觉感知

针对休耕地在食品—水资源管理中重要但光谱模糊、CDL 标注精度低且难以按地块检测的问题,论文将 Prithvi-EO-2.0 用于 HLS 影像休耕目标检测,系统比较 LoRA/混合 PEFT 与伪多尺度、Lite/Full ViT-Adapter 及两类检测头。核心洞察是轻量空间先验融合与选择性解冻更互补;最佳 FCOS+Hybrid PEFT+Lite ViT-Adapter+DIoU 达 mAP@50=0.9479,比无适配器锚框基线提升 25.70%。

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models Figure 1
2026-06-11cs.CV

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

The University of Hong Kong

2026-06-11强化学习

本文针对世界动作模型中“能预测合理未来却未必能输出正确动作”的失配问题,指出视频扩散特征偏重重建与外观,易让动作解码器关注无关背景。作者提出 AGRA,将中间视频特征与冻结视觉基础模型的空间语义表示对齐,以正则化世界模型到动作的接口。真实机器人操作中,AGRA使注意力更集中于手-物交互区域,ID成功率由34%提升到80%,并在语义、实例和属性泛化上分别提升27%、32%、32%。

MLT-Dedup: Efficient Large-Scale Online Video Deduplication via Multi-Level Representations and Spatial-Temporal Matching Figure 1
2026-06-11cs.CV

MLT-Dedup: Efficient Large-Scale Online Video Deduplication via Multi-Level Representations and Spatial-Temporal Matching

David Yuchen Wang, Haoying Li, Hailun Xu, Wei Chee Yew, Zirui Zhu, Sanjay Saha, Hao Hei, Kanchan Sarkar, Kun Xu

School of Computing, School of Computing National University of Singapore Singapore Singapore

2026-06-11视觉感知

面向短视频平台中近重复内容带来的推荐质量、版权与存储成本问题,MLT-Dedup用多层视频编码器同时生成稀疏片段级索引用于高覆盖召回、帧级特征按需加载用于精匹配,并以DiF-SiM建模时空重叠以支持按覆盖比例去重。真实大规模平台实验显示,在90%精度下线上重复率降低91%,同等资源下索引容量提升5倍。

SHERPA: Seam-aware Harmonized ERP Adaptation for Open-Domain 360$^\circ$ Panorama Generation Figure 1
2026-06-11cs.CV

SHERPA: Seam-aware Harmonized ERP Adaptation for Open-Domain 360$^\circ$ Panorama Generation

Jungwoon Kang, Jaehun Kim, Yiwon Yu, Hyungyum Jang, Sanghoon Lee, Jongyoo Kim

Yonsei University

2026-06-11视觉感知

针对平面文生图模型直接生成 ERP 360°全景时易出现接缝断裂、极区畸变且风格适配会削弱开放域先验的问题,SHERPA在冻结 FLUX 上引入频率选择性 Circular RoPE、循环潜编码/解码、轻量 FFN 适配器和配对/非配对双路径训练,以几何监督结合 yaw 一致性保留风格能力。实验中其在 Matterport 测试上取得最佳 FID 27.80 和 polar FID 66.29,用户研究总体优于 DiT360。

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning Figure 1
2026-06-11cs.CV

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li, Kanghui Tian, Yicheng Xu, Yinan He, Kai Chen, Limin Wang, Yu Qiao, Yi Wang

Shanghai Innovation Institute, Shanghai AI Laboratory, Nanjing University

2026-06-11视觉语言视觉感知

针对开放多模态模型在长视频中难以持续积累证据、调用工具并修正判断的问题,InternVideo3 将视频理解表述为共享上下文中的闭环多模态推理,并用 M²LA 压缩 KV cache 以保留完整 token 流、支撑长程 rollout。配合继续预训练、短到长 SFT、规则 RL 和教师蒸馏后,模型在 Video-MME、MLVU、EgoSchema 等长视频基准上取得开放模型中的较强表现,并展示了带检索与验证工具的视频代理能力。

DynaTok: Token-Based 4D Reconstruction from Partial Point Clouds Figure 1
2026-06-11cs.CV

DynaTok: Token-Based 4D Reconstruction from Partial Point Clouds

Weirong Chen, Keisuke Tateno, Hidenobu Matsuki, Michael Niemeyer, Daniel Cremers, Federico Tombari

2026-06-11三维

本文关注深度传感器常见的部分、无序且跨帧无对应点云序列,动机是仅靠单帧或图像线索难以恢复动态场景的完整4D结构。DynaTok将各帧编码为紧凑潜在token,用Transformer做时空聚合,并以残差token解耦几何与运动,再通过flow-matching解码完整时序点云。实验显示其在物体级和场景级基准上提升了重建质量与时间一致性。

Beyond Dark Knowledge: Mixup-Based Distillation for Reliable Predictions Figure 1
2026-06-11cs.CV

Beyond Dark Knowledge: Mixup-Based Distillation for Reliable Predictions

José Medina, Paul Honeine, Abdelaziz Bensrhair, Amnir Hadachi

2026-06-11视觉感知

本文关注知识蒸馏与 mixup 结合时的可靠性问题:学生在 mixup 样本上查询未见过该分布的教师,传统“暗知识”解释不足。作者指出这种分布错配会让教师信号更多体现混淆而非类间结构,但学生仍能在邻域区域学到更强线性与更好校准。实验在 CIFAR 和 ImageNet 上显示,KD+mixup 提升学生准确率,并将过度自信降低约一个数量级;同时温度 scaling 带来明确的准确率—校准权衡。

OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models Figure 1
2026-06-11cs.CV

OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi

York University, Vector Institute, University of British Columbia, University of Toronto, University Health Network, Arc Institute, Queen’s University

2026-06-11视觉语言视觉感知

面向高风险临床应用中“答对但不可审计”的问题,OpenMedReason强调视觉证据与医学知识支撑的推理监督,而非仅训练最终答案。论文构建约45万例开放多模态医学图文问答数据,其中核心推理链来自人工撰写科研文献,并提出按感知、知识、理由三轴评测的OpenMedReason-Bench。用于SFT到GRPO后,VQA准确率较基座平均提升20%,接近同规模最强医学LVLM,推理偏好率达86.1%。

TopoCap: Learning Topology-Agnostic Motion Priors for Monocular Video-to-Animation Figure 1
2026-06-11cs.CV

TopoCap: Learning Topology-Agnostic Motion Priors for Monocular Video-to-Animation

Cheng-Feng Pu, Jia-Peng Zhang, Meng-Hao Guo, Yan-Pei Cao, Shi-Min Hu

CHENG-FENG PU, Zhili College, Tsinghua University, China, JIA-PENG ZHANG, BNRist, Department of Computer Science and Technology, Tsinghua University, China, MENG-HAO GUO, BNRist, Department of Computer Science and Technology, Tsinghua University, China, SHI-MIN HU∗, BNRist, Department of Computer Science and Technology, Tsinghua University, China, species-specific templates (e.g., SMPL) or requiring labor-intensive manual, Authors’ Contact Information: Cheng-feng Pu, Zhili College, Tsinghua University, Jia-peng Zhang, BNRist, Department of Computer, Meng-hao Guo, BNRist, Department of Computer Science and Technology, Tsinghua, Shi-Min Hu, BNRist, Department of Computer Science and Technology, retargeting for the long tail of 3D creatures. Dataset is publicly available at, fundamentally non-scalable: they fail catastrophically when applied, limiting scalability. Physics-based methods [Peng et al. 2018, 2021

2026-06-11视觉感知

面向生成式 3D 资产难以自动动画化的问题,TopoCap 试图摆脱 SMPL/SMAL 等物种模板对单目动捕的限制。核心洞察是不同骨架拓扑下的运动动力学可落在共享低维流形中,因此用 Graph/Perceiver CVAE 学习拓扑无关潜码,再由条件 flow matching 从视频特征预测潜码并按目标骨架解码。实验显示其在人类、四足基准上优于专用模型,并可对未见双足、六足、飞行动物等零样本重定向;增益可能部分来自 Mobjaverse 的大规模结构多样数据。

AerialClaw: An Open-Source Framework for LLM-Driven Autonomous Aerial Agents Figure 1
2026-06-11cs.RO

AerialClaw: An Open-Source Framework for LLM-Driven Autonomous Aerial Agents

Ke Li, Jianfei Yang, Luyao Zhang, Guo Yu, Chengwei Yan, Yuan Ding, Di Wang, Nan Luo, Gang Liu, Xiao Gao, Quan Wang

Xidian University, Xi’an University of Architecture and Technology, Xidian University Xi’an China, Xi’an University of Architecture and Technology Xi’an China

2026-06-11视觉感知

针对无人机任务仍依赖预设指令和手工串接感知、规划、控制模块的问题,AerialClaw提出开源的“brain–skill–runtime”框架,让LLM按自然语言任务在闭环中选择硬/软技能、读取反馈并经运行时安全校验执行。其文档化能力边界、记忆反思和平台无关适配器提升可检查性与复用性;系统已提供mock、PX4/Gazebo、AirSim、Web控制台和示例任务,但真实飞行效果与量化增益文中未充分说明。

Time-Conditioned and Multi-Time Survival Prediction from 2D PET/CT Projections in Lung Cancer Figure 1
2026-06-11cs.CV

Time-Conditioned and Multi-Time Survival Prediction from 2D PET/CT Projections in Lung Cancer

Ashish Chauhan, Sambit Tarai, Elin Lundström, Johan Öfverstedt, Håkan Ahlström, Joel Kullberg

Radiology, Department of Surgical Sciences, Uppsala University, Uppsala, Sweden, University, Linköping, Sweden, SciLifeLab, Uppsala University, Uppsala, Sweden

2026-06-11视觉感知

针对非小细胞肺癌中PET/CT影像生存预测对时间建模依赖尚不清楚的问题,论文比较连续时间条件与离散多时间两类策略,提出带注意力的ATCS和MTS,并分析肿瘤/组织通道与时间粒度影响。在848例数据、独立测试292例上,ATCS和MTS平均AUC约0.794/0.793,高于TCS的0.767;前者偏短期、后者偏长期,组合输入优于单一输入。

AGE-MIL: Anchor-Guided Evidence Learning for Patient-Level Prediction Figure 1
2026-06-11cs.CV

AGE-MIL: Anchor-Guided Evidence Learning for Patient-Level Prediction

Jiawei Niu, Jian Chen, Di Zhang, Junbo Lu, Zhangcheng Liao, Xuhao Liu, Honglin Zhong, Mireia Crispin-Ortuzar, Chen Li, Zeyu Gao, Yi Cai

School of Computer Science and Technology, Xi’an Jiaotong University, Xi’an, Department of Oncology, University of Cambridge, Cambridge, UK, Xiangya School of Medicine, Central South University, Changsha, Hunan, China, tently outperforms eight state-of-the-art MIL methods. Code is available

2026-06-11视觉感知

这篇论文针对病理实践中诊断需整合患者多张 WSI、而传统 MIL 多停留在单张切片层面的粒度错配问题,提出 AGE-MIL:先由切片表征构建患者级 anchor,再引导检索关键 patch 并进行证据感知融合,同时将风险建模为证据累积过程。作者在两个前列腺癌队列、约 700 名患者和 1 万张 WSI 的六个患者级任务上验证,较八种 MIL 方法平均提升约 2% AUC/准确率。

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding Figure 1
2026-06-11cs.CV

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

Shenzhen Campus of Sun Yat-sen University, Harbin Institute of Technology, Shenzhen, Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China

2026-06-11视觉感知

长视频理解受视觉预算限制,均匀采样易漏关键事件,检索又可能牺牲时间覆盖。Q-Fold的核心洞察是按查询相关性以“片段”而非单帧组织输入:关键片段保留为高保真Focus Frames,次要片段折叠成保序Context Panels,从而兼顾细节、上下文和局部时序。其无需训练、可插入多种Video-MLLM,在四个长视频基准上稳定提升,超长视频最高增益达9.1个百分点。

MSUE: Multi-Modal Soccer Understanding Expert Figure 1
2026-06-11cs.CV

MSUE: Multi-Modal Soccer Understanding Expert

Litao Li, Yibo Yu, Yufeng Hu, Zhuo Yang, Jiali Wen, Yixin Chen, Yixi Zhou

South China University of Technology, Johns Hopkins University, Peking University, University of Electronic Science and Technology of China

2026-06-11视觉感知

面向足球场景 VQA 中视觉细节、时序推理与领域知识难以统一的问题,MSUE 先用 VLM 将多源足球数据合成为 3.2 万条指令样本,再由 LLM 路由到文本、图像、视频专家,结合微调 Qwen3-VL、Gemini 与 SoccerWiki/Replay 检索,并针对球衣颜色、解说等易错类做规则化细化。其在 SoccerNet VQA 挑战基准达到 0.95 准确率、列第三;但文中关于“超过第二名”的表述与名次不一致。

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model Figure 1
2026-06-11cs.RO

DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model

Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga, Moritz Reuss, Gianluca Geraci, Xinkai Jiang, Rudolf Lioutikov

Intuitive Robots Lab, Karlsruhe Institute of Technology (KIT), Germany, Robotics Institute of Germany

2026-06-11视觉语言视觉感知

该文针对现有 VLA 将视觉、语言、力觉等传感器强行同步到同一时钟,导致慢模态重复计算、快模态接触瞬态丢失和动作延迟的问题,提出 DAM-VLA:为各模态维护按自然频率刷新的潜在缓冲,并用门控交叉注意力接入高频力/扭矩而尽量保留预训练骨干。七个真实接触操作任务中,其平均成功率达 95.2%,显著高于最强同步基线 40.95%,并实现 100Hz 平滑控制。

ISAP-3D: Identity-Slot Aligned Part-Aware 3D Generation Figure 1
2026-06-11cs.CV

ISAP-3D: Identity-Slot Aligned Part-Aware 3D Generation

Junlin Hao, Haoshuai Fu, Xibin Song, Wei Li, Ruigang Yang, Xinggong Zhang, Jinchuan Zhang

No Institute Given, uncontrollable, demonstrate improved structural stability, controllability, and robustness, D generative modelling has become a key technology for scalable 3D content

2026-06-11三维

面向可编辑、可组合的部件级3D生成,论文指出现有方法的部件交换、合并源于语义身份与生成slot未显式对齐,提出ISAP-3D:用语义身份token锚定一对一slot,先预测身份条件布局再生成受布局约束的几何,并以局部/全局条件保持跨阶段一致。作者还构建统一语义协议的部件数据集,实验显示其在结构稳定性、可控编辑和鲁棒性上优于现有部件感知生成基线。

Non-frontal face recognition using GANs and memristor-based classifiers Figure 1
2026-06-11cs.CV

Non-frontal face recognition using GANs and memristor-based classifiers

Semih Vazgecen, Cristian Sestito, Spyros Stathopoulos, Themis Prodromakis

\orgdiv Centre for Electronics Frontiers, Institute for Integrated Micro and Nano Systems, \orgname School of Engineering, The University of Edinburgh, \orgaddress \country UK

2026-06-11视觉感知生成模型

面向无人机等低算力边缘平台中非正脸人脸难以识别的问题,论文将轻量GAN姿态正面化与忆阻器交叉阵列/SNN分类器结合,并加入未知身份拒识与在线学习机制。实验在CMU Multi-PIE和DroneFace上分别达到约96.3%和73.4%平均识别率,显示生成式补偿可缓解姿态退化,但硬件实测部署能效与增益来源仍未充分说明。

World Model Self-Distillation: Training World Models to Solve General Tasks Figure 1
2026-06-11cs.CV

World Model Self-Distillation: Training World Models to Solve General Tasks

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

Department of Computer Science, u b UNIVERSITY OF BERN

2026-06-11强化学习

论文针对预训练视频世界模型依赖详细文本方案、难以直接用于任务规划的问题,提出 WMSD:由 VLM 从无标注场景生成任务与步骤说明,用其驱动的 Demonstrator 自蒸馏出只需图像和短指令的 Executor,并结合 VLM 反馈强化学习优化。实验显示其在 WorldTasks-Bench 上超过教师模型,并在 DreamGen 机器人任务中具备有竞争力迁移,但机器人特定动力学仍受无数据训练限制。

Tac-DINO: Learning Vision-Tactile Features with Patch Alignment Figure 1
2026-06-11cs.CV

Tac-DINO: Learning Vision-Tactile Features with Patch Alignment

Hong Li, Yankang Dong, Yue Xu, Yihan Tang, Mingzhu Li, Jiamin Qiu, Qihang Yao, Xing Zhu, Yujun Shen, Nan Xue, Yong-Lu Li

Shanghai Jiao Tong University, 2Ant Group, 3Shanghai Innovation Institute, to multiple valid tactiles. To our knowledge, existing works neglect to address tactile labeling at, Orlov et al. (2010). Hence, fine-grained vision-tactile collaborative is indispensable., lack of labeled data, we propose a data collection system to gather the largest 3D-Vision-Tactile

2026-06-11视觉感知

这篇论文针对触觉信号只对应物体局部接触、但现有视觉-触觉学习多做整图级粗对齐的问题,构建了含505个真实物体、2万余次接触的Touch3D数据集,并提出Vis-Tac全息匹配基准与基于DINOv2的VTPA局部patch对齐方法。实验显示,视觉-触觉融合优于单模态,局部对齐也优于整物体图像对齐;但作者同时指出性能仍受数据规模和触觉基础模型不足限制,部分增益可能主要来自数据与对齐标注质量。

Performance Analysis of YOLOv11 and YOLOv8 for Mixed Traffic Object Detection under Adverse Weather Conditions in Developing Countries Figure 1
2026-06-11cs.CV

Performance Analysis of YOLOv11 and YOLOv8 for Mixed Traffic Object Detection under Adverse Weather Conditions in Developing Countries

Quoc Thuan Nguyen, Ha Anh Vu, Ngo Dang Thanh Ngan, Minh Phuc Hoang Ngoc

FPT University, Ho Chi Minh City, Vietnam

2026-06-11视觉感知

面向发展中国家混合、无序交通及雨雾夜间等恶劣天气下的自动驾驶感知难题,本文将 IDD 的本地车辆类别与 BDD100K 的恶劣天气样本融合,统一为 8 类数据,并比较 YOLOv11n 与 YOLOv8n。结果显示 YOLOv11n 在 mAP@50 为 46.6% 时精度提升约 3.2%,FLOPs 从 8.1G 降至 6.3G,Tesla T4 上达 70.9 FPS,但增益可能同时来自数据筛选与架构差异。

MFEN:Multi-Frequency Expert Network for Visible-Infrared Person Re-ID Figure 1
2026-06-11cs.CV

MFEN:Multi-Frequency Expert Network for Visible-Infrared Person Re-ID

Xulin Li, Yan Lu, Bin Liu, Qinhong Yang, Qi Chu, Tao Gong, Nenghai Yu

University of Science and Technology of China, China, Anhui Province Key Laboratory of Digital Security, China, The Chinese University of Hong Kong, China

2026-06-11视觉感知

论文面向可见光-红外行人重识别中的模态差异,指出差异不仅来自波长/颜色,也来自光源导致的过曝、欠曝等照明变化,且相关身份线索分布在不同频段。MFEN用多频段专家和门控按样本自适应融合频域信息,并配合低频交换的RFA与频域辅助优化FAO。三套VI-ReID数据集实验显示该框架优于现有方法。

Metadata-Aware Multi-Prompt Reasoning for Zero-Shot Accident Understanding Figure 1
2026-06-11cs.CV

Metadata-Aware Multi-Prompt Reasoning for Zero-Shot Accident Understanding

Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran

2026-06-11视觉感知

面向真实监控视频中事故瞬间短暂、类别相近且零样本缺少标注的问题,论文将事故理解拆成“何时、何类、何处”三步:先用视觉语言相似度定位碰撞窗口,再结合元数据的五视角多提示与熵门控裁决判定类型,最后按预测类型做开放词汇空间定位。方法无需微调、可在单卡运行,在 ACCIDENT@CVPR 2026 上相较中心点基线显著提升调和均值,但具体增益来源仍需更细消融支撑。

Vision Transformers for Face Recognition Need More Registers Figure 1
2026-06-11cs.CV

Vision Transformers for Face Recognition Need More Registers

Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira, Naser Damer, Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany, 2 Department of Computer Science, the Arts within their joint support of the National Research Center for Applied, widespread availability of large-scale annotated datasets [19], in low-data availability scenarios. ARTriViT [27] is a triplet

2026-06-11视觉感知

本文关注人脸识别中 CPE 型 ViT 虽优于 CLS 方案但注意力图在背景区域出现伪影、可解释性差的问题。作者在 patch 序列中加入可学习 register tokens,让模型把内部计算转移到寄存器而非低信息图像块;实验显示伪影在多种规模 ViT 中普遍存在,4/8 个寄存器可明显改善注意力结构,其中 ViT-8R 在 IJB-B/IJB-C 上达到 ViT 人脸识别方法的领先结果。

SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection Figure 1
2026-06-11cs.CV

SpikeTAD: Spiking Neural Networks for End-to-End Temporal Action Detection

Min Yang, Mi Zhou, Limin Wang

aState Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, Jiangsu, China, is available at https://github.com/MCG-NJU/SpikeTAD.

2026-06-11视觉感知

面向移动/神经形态硬件部署,现有端到端时序动作检测模型能耗高且SNN转换常需长时间步、精度下降。SpikeTAD将ViT-S骨干与轻量多尺度检测头先按ANN训练,再分别用多阈值神经元、期望补偿和IF神经元进行ANN-SNN转换,并用量化clip-floor减小转换误差。其在THUMOS14平均mAP达67.2%、ActivityNet-1.3达37.42%,能耗显著低于ANN基线,但仍依赖预训练ANN骨干。

ViT-FREE: Efficient Face Recognition via Early Exiting and Synthetic Adaptation Figure 1
2026-06-11cs.CV

ViT-FREE: Efficient Face Recognition via Early Exiting and Synthetic Adaptation

Tahar Chettaoui, Guray Ozgur, Eduarda Caldeira, Naser Damer, Fadi Boutros

Fraunhofer Institute for Computer Graphics Research IGD, Germany, 2 Department of Computer Science, Center for Applied Cybersecurity ATHENE., information available at intermediate depths and incurring, overlooking informative signals available at intermediate, tations, potentially overlooking informative signals available

2026-06-11视觉感知强化学习

面向ViT人脸识别在移动/边缘设备上推理开销高的问题,ViT-FREE利用各Transformer层特征维度一致、表示逐层收敛的现象,在不改动或重训骨干的情况下从中间层直接早退验证;另用少量合成数据仅微调各出口投影头以补强浅层。多基准实验显示,较深出口能取得较好精度—效率折中,如第10层在IJB-C等上约提速20%,验证性能仅下降约1.5%。

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control Figure 1
2026-06-11cs.CV

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control

Yiqun Ning, Ao Shen, Chenhang He, Lei Zhang

Department of Computing, The Hong Kong Polytechnic University, Hong Kong, trollable garment–body fit variation. As a result, most VTON approaches formulate the task as, • Controllable Simulation Data Pipeline. We generate large-scale, aligned try-on triplets, mask supervision and texture rectification for controllable and realistic fitting on various

2026-06-11规划控制

本文针对现有扩散式虚拟试衣偏向二维补全、常生成“看起来真实但尺码不对”的中性贴合问题,提出 FitVTON:用结构化文本编码人体与服装尺寸,借助 GarmentCode/SMPL-X 可控仿真三元组学习不同体型下的悬垂、松紧和轮廓,并以双分支掩码监督与真实图像纹理校正缓解几何与域差距。作者还构建 FittingEffect3K 和 VLM/人工评测协议,结果显示其在尺码准确性和体型保持上优于强基线,同时图像质量保持竞争力。

From Nominal Intensity to Equivalent Rainfall: A Path-Based Credibility Evaluation Framework for Simulated Rainfall in Autonomous-Driving Perception Tests Figure 1
2026-06-11cs.CV

From Nominal Intensity to Equivalent Rainfall: A Path-Based Credibility Evaluation Framework for Simulated Rainfall in Autonomous-Driving Perception Tests

Tian Xia, Xin Zhao, Shaolingfeng Ye, Junyi Chen

Tian Xia, Shaolingfeng Ye, and Junyi Chen are with the College of, Automotive and Energy Engineering, Tongji University, Shanghai, China., Xin Zhao is with Tsinghua University, Beijing, China., tions [7], [8]. Virtual testing is efficient, scalable, and control-, lable, but it is still limited by the gap between virtual and real, field simulated-rainfall testing, can generate controllable and, not only for controllability and repeatability, but also for their, a layer-controllable rain simulator with an average rainfall

2026-06-11数据集/基准

针对封闭场自动驾驶感知雨淋测试常用名义雨强或单点测量、难以映射真实降雨的问题,论文提出按测试路径评估可信度:以真实雨滴粒径-速度联合分布为参照,给出路径等效雨强、不确定带和RRD,并用激光雷达点云数与反射率做感知一致性修正。约1万真实雨谱样本、728个RainSense样本和45个模拟雨场点表明,同一名义条件下仍有明显空间不均匀,Path IV与VI在稳定性、雨滴真实性和感知一致性上更均衡。

ParseFixer: An Agentic Framework for Document Parsing via Selective Multimodal Correction Figure 1
2026-06-11cs.CV

ParseFixer: An Agentic Framework for Document Parsing via Selective Multimodal Correction

LeKai Yu, Hao Liu, Kun Wang, Zhiran Li, Ruping Cao, Fan Liu, Yupeng Hu

Shandong University, Southeast University

2026-06-11视觉语言

本文关注文档页面到结构化 Markdown 的解析难题:单一多模态模型容易在版面顺序、表格公式等结构恢复中出错,整页重生成又可能引入改写或幻觉。ParseFixer 的核心思路是保留 MinerU2.5 Pro 的稳定全页解析结果,仅对可疑页面或局部元素进行多模态选择性修正,并用 verify-and-rollback 机制避免破坏可靠预测。在 DataMFM 文档解析赛道测试集上取得 61.78 总分,排名第三。

SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation Figure 1
2026-06-11cs.CV

SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation

Xu Zhang, Yu Lu, Ruijie Quan, Zhaozheng Chen, Bohan Wang, Yi Yang

ReLER, College of Artificial Intelligence, Zhejiang University, Huawei Central Research Institute

2026-06-11视觉感知

针对 Flow Matching 文生视频在 ODE 采样中误差累积导致轨迹漂移、进而出现肢体重复和运动不连贯等问题,SpecLoR 的核心洞察是漂移会表现为早期 clean lookahead latent 的时空频谱幅值异常;方法在频域按自然视频 1/f 先验校正幅值、保留相位并重噪声继续积分。文中在 Wan2.2 上报告仅增加 4 次 NFE 即减少物理伪影、提升多基准运动一致性。

Feature extraction for plant growth estimation Figure 1
2026-06-11cs.CV

Feature extraction for plant growth estimation

Simbarashe Aldrin Ngorima, Albert Helberg, Marelie H. Davel

Faculty of Engineering, North-West University, South Africa, Centre for Artificial Intelligence Research, South Africa, National Institute for Theoretical and Computational Sciences, South Africa, neural networks (CNNs) and transfer learning. We test these methods on a publicly available plant, is available online at: https://doi.org/10.1007/978-3-032-11733-5_5.

2026-06-11视觉感知

面向室内精准农业中需实时判断作物生长阶段以减少水肥浪费的问题,本文比较了两类视觉特征:结合形态学增强的 Gabor 纹理特征,以及预训练 VGG/ResNet 的迁移特征并接传统分类器。实验在油菜和萝卜 bccr-segset 数据集上显示,CNN 特征更快且更准;VGG-19+RBF-SVM 两物种均达 98.4% 准确率,单图约 0.08 秒,而相邻生长阶段仍是主要混淆来源。

Frozen Multimodal Embeddings for Personality and Cognitive Ability Assessment in Asynchronous Video Interviews Figure 1
2026-06-11cs.HC

Frozen Multimodal Embeddings for Personality and Cognitive Ability Assessment in Asynchronous Video Interviews

Kuo-En Hung, Hung-Yue Suen, Shih-Ching Yeh, Hsiang-Wen Wang

Technology Application and Human Resource Development, National Taiwan Normal University, Computer Science and Information Engineering, National Central University, Institute of Photonic System, National Yang Ming Chiao Tung University, Technology Application and Human Resource Development, National Taiwan Normal University Taiwan, Computer Science and Information Engineering, National Central University Taiwan, Institute of Photonic System, National Yang Ming Chiao Tung University Taiwan

2026-06-11视觉语言视觉感知

面向异步视频面试中标注少而视听语言特征维度高的问题,论文将人格与认知能力评估视为小样本表征学习,冻结 CLIP、Whisper 与多种文本编码器,仅训练低容量下游模型,并按人格特质做独立建模与后期融合。结果显示人格预测验证 MSE 从官方 0.3334 降至 0.2696;认知能力任务虽高于基线,但更强的主体属性模型提示存在数据捷径,需谨慎解释。

Corpus Augmentation for Sign Language Translation via LLM-Guided Video Stitching Figure 1
2026-06-11cs.CV

Corpus Augmentation for Sign Language Translation via LLM-Guided Video Stitching

Zsolt Robotka, Ádám Rák, Jalal Al-Afandi, András Horváth, György Cserey

Peter Pazmany Catholic University, (Z. Robotka also with DeepSign Technologies Ltd., Budapest, Hungary)

2026-06-11视觉感知

针对手语翻译中高质量视频—文本微调数据稀缺、长尾词和新句式泛化受限的问题,论文提出无需额外标注、外部视频或生成视频模型的语料增强:用 CTC 强制对齐切出单 gloss RGB 片段,借助受语料约束的 LLM 生成新 gloss—句子对,再随机拼接成合成训练样本。该数据直接用于 GFSLT-VLP 微调,在不改架构和训练协议下 BLEU-4 从 21.38 提升到 24.30;同时发现平滑拼接反而有害,突兀边界可能起正则化作用。

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations Figure 1
2026-06-11cs.CV

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

Tsinghua Shenzhen International Graduate School, Tsinghua, University, Shenzhen, China 2Microsoft Research Asia. Corre-

2026-06-11视觉感知

针对长视频在多轮问答中反复编码视觉 token 或检索数据库导致高延迟、高显存的问题,论文提出将单个视频的语义知识蒸馏为可挂载到冻结 VLM 上的神经知识表示 NKR,本质上是一组视频专属 LoRA 参数;AKD 自动生成密集描述与问答来离线优化该表示。实验显示在 LVBench 等长视频基准上精度接近现有强方法,同时端到端延迟降低两个数量级以上,推理时额外视频内存几乎为零。

Wild3R: Feed-Forward 3D Gaussian Splatting from Unconstrained Sparse Photo Collection Figure 1
2026-06-11cs.CV

Wild3R: Feed-Forward 3D Gaussian Splatting from Unconstrained Sparse Photo Collection

Yuto Furutani, Takashi Otonari, Kaede Shiohara, Toshihiko Yamasaki

The University of Tokyo, Project page: https://furuschool.github.io/wild3r-page

2026-06-11三维

Wild3R针对野外稀疏照片集中光照变化、曝光差异和临时遮挡导致前馈3DGS几何重复、外观不一致的问题,核心洞察是瓶颈可能主要来自训练数据而非复杂架构;作者构建含200场景、170种光照和临时物体的WildCity,并微调现有前馈模型,使其按参考视图生成去临时物体、外观一致的高斯。在Photo Tourism等基准上优于既有前馈方法,接近需相机或点云初始化的逐场景优化方法,且推理约1秒。

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection Figure 1
2026-06-11cs.CV

Task-Aligned Stability Analysis of Vision-Language Models for Autonomous Driving Hazard Detection

Everett Richards

2026-06-11视觉语言视觉感知

本文关注自动驾驶中 VLM 危险检测的鲁棒性:仅看图像嵌入漂移可能无法反映安全相关决策变化。作者用 CLIP 图文相似度构造任务对齐的 hazard margin,并在 BDD100K 上比较七类腐蚀下的嵌入漂移、margin 漂移和判定翻转。结果显示二者关系强烈依赖腐蚀类型,JPEG/下采样较可预测,而运动模糊、遮挡可在嵌入变化不大时诱发高翻转;多数腐蚀导致漏检,遮挡更易误报。

Image Quality Assessment of Identity Cards Using Measures from Open Face Image Quality Figure 1
2026-06-11cs.CV

Image Quality Assessment of Identity Cards Using Measures from Open Face Image Quality

Gregor Grote, Juan E. Tapia, Christian Rathgeb

Darmstadt University of applied science, Darmstadt, Germany, concerns, as there are no public datasets available that contain, Proposed but no algorithm available in OFIQ.

2026-06-11视觉感知

面向远程身份核验中证件图像质量不稳会干扰呈现攻击检测的问题,本文将 OFIQ 的采集相关人脸质量指标迁移到身份证图像,加入角点检测、透视归一化、前景遮罩,并为光照均匀性设计新算法。四个证件数据集和三种 PAD 方法上的误差-丢弃分析显示,锐度与欠曝光筛选能稳定提升 PAD 表现,其他亮度、动态范围和压缩指标仅在部分系统中有中等影响。

SG2Loc: Sequential Visual Localization on 3D Scene Graphs Figure 1
2026-06-11cs.CV

SG2Loc: Sequential Visual Localization on 3D Scene Graphs

Nicole Damblon, Olga Vysotska, Federico Tombari, Marc Pollefeys, Daniel Barath

2026-06-11三维

针对室内机器人/AR定位依赖大规模图像库或带特征点云、存储和传输成本高的问题,SG2Loc用对象级3D场景图替代密集地图,并在粒子滤波中将查询图像patch语义与投影的粗物体网格匹配,随序列逐步收敛位姿。实验显示其在ScanNet、3RScan等真实数据上以显著更低存储开销达到与HLoc、MeshLoc等接近、部分场景更好的精度,但逐帧计算开销仍偏高。

Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning Figure 1
2026-06-11cs.CV

Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning

Zhirui Chen, Ziwei Chen, Ling Shao

2026-06-11视觉感知

本文针对多模态 Many-Shot ICL 中长图文序列带来的 KV cache 显存与延迟瓶颈,提出免训练的 TASM,将缓存视为任务结构记忆而非静态 token 缓冲:用任务向量估计跨示例重要性,以二分图语义合并替代硬剪枝,并用 Core Memory/Latent Bank 支持按查询动态取回。实验称在 IllusionVQA、MME-RealWorld、ImageNet-100 等上接近全上下文性能,同时最高减少约 80% 内存占用。

SheafStain: Sheaf-Theoretic Schrödinger Bridge for Spatially and Biologically Coherent Virtual Staining Figure 1
2026-06-11cs.CV

SheafStain: Sheaf-Theoretic Schrödinger Bridge for Spatially and Biologically Coherent Virtual Staining

Hyeongyeol Lim, Hongjun Yoon, Eunjin Jang, Daeky Jeong, Won June Cho, Hwamin Lee

Department of Medical Informatics, College of Medicine, Korea University, DEEPNOID Inc.

2026-06-11视觉感知

针对全切片虚拟染色中小块独立推理导致的边界断裂、色调漂移和同一区域表征不一致,论文将这种“上下文污染”形式化为违反粘合公理的层论问题。SheafStain把病理VFM的CLS与patch token作为薛定谔桥的层式空间条件,并用像素层损失、cocycle粘合损失及FFT自适应覆盖约束训练/推理一致性。在HER2、ER、PR、Ki-67的1024×1024拼接评测中优于六个基线并减轻拼接伪影。

Scene-Adaptive Nonlinear Tone Curves for Pseudo Ground-Truth Generation in Low-Light 3D Gaussian Splatting Figure 1
2026-06-11cs.CV

Scene-Adaptive Nonlinear Tone Curves for Pseudo Ground-Truth Generation in Low-Light 3D Gaussian Splatting

Mingzhe Lyu, Jinqiang Cui, Hong Zhang

Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of, Pengcheng Laboratory, Shenzhen, 518108, China., targets when paired normal-light references are unavailable. Existing pseudo-GT methods apply a, their different mathematical forms, suggesting the improvement is curve-agnostic. Code is available, normal-light references are unavailable.

2026-06-11三维

本文针对低光照 3DGS 中伪真值常用线性增益会过曝高亮、又难以充分提升暗部的问题,提出仅替换伪 GT 生成的场景自适应非线性 tone curve 框架,通过百分位归一化、黑电平偏移和 ASE/AP3 两类曲线增强监督信号而不改骨干。在 21 个场景上相较线性基线稳定提升,LOM/RealX3D 的 PSNR 最高增益分别达 +4.34/+3.25 dB,且两种曲线表现接近,说明收益主要来自非线性映射本身。

Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding Figure 1
2026-06-11cs.CV

Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

Hyomin Kim, Junghye Kim, Joanie Hayoun Chung, Yoonjin Oh, Kyungjae Lee, Sungbin Lim, Sungwoong Kim

Department of Artificial Intelligence, Korea University, 2Department of Statistics, Korea University

2026-06-11视觉语言视觉感知强化学习

面向文生视频后训练中“奖励模型漏检细粒度语义违背”的问题,论文提出 SG-PVR:先把提示词拆成带重要性的原子核验项,再从视频抽取时空场景图,将实体、属性和时间关系作为显式证据,与原视频共同逐项验证并汇总评分。实验显示其在语义对齐和细粒度时间语义评测上表现领先,用作测试时重排序器还能提升生成视频的组合对齐。

LASA: A Weak Supervision Method for Open-Vocabulary Scene Sketch Semantic Segmentation Figure 1
2026-06-11cs.CV

LASA: A Weak Supervision Method for Open-Vocabulary Scene Sketch Semantic Segmentation

Liwen Yi, Xianlin Zhang, Yue Zhang, Yue Ming, Xueming Li

Beijing University of Posts and, to assign dense semantic labels to sparse line drawings based, code will be made publicly available., to assign dense semantic labels to sparse line drawings using, ] to sketch parsing and labeling [15], and then to multi-

2026-06-11视觉感知

针对场景草图缺少纹理颜色、弱监督下区域定位约束不足,导致现有开放词汇分割模型在稀疏笔画上不稳定的问题,LASA利用ViT不同层注意力的互补性:浅层表征全局布局、深层捕捉局部笔画部件,并聚合为跨层结构先验,结合层级语义对齐和推理阶段注意力细化。在FS-COCO、SFSD、FrISS上较既有弱监督基线mIoU分别提升3.43、8.01、15.74。

TextHOI-3D: Text-to-3D Hand-Object Interaction via Discrete Multi-View Generation and Joint Mesh Optimization Figure 1
2026-06-11cs.CV

TextHOI-3D: Text-to-3D Hand-Object Interaction via Discrete Multi-View Generation and Joint Mesh Optimization

Zixiong Hao, Zhencun Jiang

Technical University of Munich, School of Computation, Information and Technology, Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems

2026-06-11优化算法三维

针对文本生成手-物交互网格中语义一致、跨视角几何、手部关节形态和接触物理约束难以同时满足的问题,TextHOI-3D将任务拆成“文本到多视图再到网格”:用VQ-VAE学习固定相机多视图离散token,结合CLIP条件VAR生成视图,再通过先验初始化、多视图联合优化和抗穿透细化恢复手物网格。在HO3D衍生评测中,多视图相较单视图将物体CD从17.26mm降至4.92mm,穿透体积从5.3721cm³降至0.2193cm³。

MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models Figure 1
2026-06-11cs.CV

MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

Yuansheng Gao, Wenbin Xing, Jiahao Yuan, Kaiwen Zhou, Han Bao, Zonghui Wang, Wenzhi Chen

Zhejiang University, Sun Yat-sen University, East China Normal University

2026-06-11视觉语言视觉感知

针对视频大多模态模型易把语言先验或不可靠视觉证据放大为幻觉的问题,MultiToP把干预粒度下探到视觉token:用轻量Visual Token Patcher预测需替换的token,并以动态全局patch token局部修补,同时用答案条件的帧级信息线索做排序校准训练。实验显示其在几乎不增加推理开销且不改原模型的情况下,降低Vript-HAL幻觉,Qwen3-VL-4B-Instruct F1相对提升50.60%,并在ActivityNet-QA上保持甚至提升通用视频理解能力。

A Comprehensive Ecosystem for Open-Domain Customized Video Generation Figure 1
2026-06-11cs.CV

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

University of Science and Technology of China, Seoul National University, this, we introduce PexelsCustom-1M, the first publicly available, • PexelsCustom-1M: The first large-scale, publicly available, • Scalable Data Pipeline: A reproducible framework for har-, Center Frame, the center frame of each video. Since VLMs naturally emphasize, identity. Specifically, the extracted identities and the center frame, original caption,center frame and cropped reference image to GPT-

2026-06-11视觉感知

本文针对开放域定制视频生成中身份保持数据稀缺、类别覆盖窄和逐身份微调成本高的问题,构建 PexelsCustom-1M 百万级身份-文本-视频数据集,并提出用 3DVAE 参考特征、RoPE 偏置与 LoRA 适配的 CustoMDiT,仅增加约 8% 可学习参数。实验在既有基准和含 1000+ 类的 OpenCustom 上优于现有方法及部分商业 API,但增益可能主要来自数据规模与清洗流程。

Seeing What Matters: Perceptual Wrapper with Common Randomness for 3D Gaussian Splatting Figure 1
2026-06-11cs.CV

Seeing What Matters: Perceptual Wrapper with Common Randomness for 3D Gaussian Splatting

He-Bi Yang, Jing-Zhong Chen, Yen-Kuan Ho, Sang NguyenQuang, Fan-Yi Hsu, Yun-Yu Lee, Jui-Chiu Chiang, Wen-Hsiao Peng

2026-06-11三维

该文针对3DGS在高频纹理、低存储和RDO压缩场景中易模糊、且传统L1/SSIM难以对应感知质量的问题,提出一个可插拔的2D感知wrapper:在渲染图像域用轻量合成网络,结合Plücker视线嵌入与共享伪随机噪声,并以Wasserstein Distortion匹配局部特征统计来合成感知可信纹理。实验显示其可接入vanilla、紧凑和RDO 3DGS,在主观/客观感知质量上优于基线,并在相近感知分数下显著降低模型或文件大小,但代价是训练与渲染开销增加。

Battery detection of XRay images using transfer learning Figure 1
2026-06-11cs.CV

Battery detection of XRay images using transfer learning

Nermeen Abou Baker, David Rohrschneider, Uwe Handmann

- Ruhr West University of Applied Sciences - Dept of Computer Science

2026-06-11视觉感知

面向电子废弃物回收、安检等场景中电池难以人工安全识别与分拣的问题,本文用XRay图像和两阶段迁移学习:先在HiXray电子设备数据上微调YOLOv5m,再将权重迁移到手工标注的三类锂电池检测。结果显示电池检测精度约94%,较直接COCO预训练权重高约5个百分点,单张推理22ms;但类别不均衡和遮挡使圆柱电池表现较弱。

AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory Figure 1
2026-06-11cs.CV

AnchorEdit: Maintaining Temporal Consistency in Multi-turn Image Editing via Causal Memory

Hang Xu, Xiaoxiao Ma, Guohui Zhang, Yu Hu, Siming Fu, Jie Huang, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

University of Science and Technology of China, JD Explore Academy

2026-06-11视觉感知

多轮图像编辑在迭代创作中易出现身份漂移与误差累积,且现有借用视频先验的方法多为双向上下文,和在线因果编辑不匹配。AnchorEdit将自回归视频扩散改造为高分辨率多轮编辑框架,通过身份保持预训练、自回滚因果微调、4步一致性蒸馏,以及以初始图像为锚的记忆与受限RoPE来稳定长程推理。论文还构建1024p多轮基准,实验显示其在10轮以上编辑中较现有方法更能保持主体一致性、视觉质量和指令遵循。

From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning Figure 1
2026-06-11cs.CV

From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning

Haoping Yu, Yuanxi Li, Jing Ma

Department of Computer & Data Sciences, Case Western, University, Cleveland, OH, US. Correspondence to: Jing Ma, All Available, include node/edge labels of causal graphs), since construct-

2026-06-11视觉语言视觉感知

针对多图像干预与反事实视觉因果推理中,VLM 仅把因果图或解释作为提示而难以内化执行的问题,论文提出 BridgeVLM:从图像诱导 DAG,将变量关系转成可被解码器持续关注的 Causal Tokens,并用 RAMP 做路由消息传播,M3S 对齐缺失或多粒度因果监督。实验显示其相较提示级监督显著提升,CausalVLBench 干预准确率 33.2%→54.4%,因果结构 F1 33.4%→75.1%,Causal3D 也有提升。

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA Figure 1
2026-06-11cs.CV

UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA

Mengzhuo Chen, Yan Shu, Chi Liu, Hongming Piao, Xidong Wang, Derek Li, Bryan Dai

2026-06-11三维

面向医学 VQA 中 2D 影像标注充足而 3D 体数据推理困难的问题,论文提出 UniReason-Med,用统一的框语法、区域 token 注入和 grounded CoT 接口,让单一模型同时处理 2D 图像与切片序列化 3D 体。作者构建 22 万样本 UniMed-CoT,并以 SFT 加 GRPO 训练;消融显示 2D+3D 联合监督较 3D-only 明显提升 3D 推理,grounding 与区域注入对两类任务均有收益。

Multi-View In-Cabin Monitoring System for Public Transport Vehicles Figure 1
2026-06-11cs.CV

Multi-View In-Cabin Monitoring System for Public Transport Vehicles

Evgeny Gorelik, Kenny Dean Karrow, Fikret Sivrikaya, Sahin Albayrak, Christian Baumann

2026-06-11视觉感知

面向公交车厢内乘客计数、定位与安全监测,论文指出单视角数据难以应对拥挤遮挡和有限视角,因而构建了德国城市公交内四路RGB-D相机加旋转LiDAR的同步多模态数据集。其核心在于标定与伪标注流程,可生成3D人体姿态、跨视角轨迹和有向3D框,并转为nuScenes格式;数据含9136帧、13484个标注。基准实验覆盖LSS、BEVFusion等模型,单相机漏检率最高达60.69%,验证多视角设置必要性,但紧阈值性能仍受标签噪声与标定敏感性限制。

Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning Figure 1
2026-06-11cs.CV

Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning

Enhan Zhao, Wei Wu, Yuanrui Zhang, Xueliang Zhao, Di He

Peking University, The University of Hong Kong

2026-06-11视觉感知

针对多模态大模型空间推理训练依赖静态大规模数据、样本难度与模型阶段不匹配的问题,Ouroboros-Spatial把模型置于提问者与解题者闭环中:由提问者基于3D元数据和视频生成可执行验证的QA,解题者置信度反哺下一轮难度调节。用仅25.6k样本微调Qwen3-VL-4B/8B,在VSI-Bench达62.7/63.3,并在去偏和其他空间基准上保持迁移增益。

ERN-Net : Evolving Reason Node-Net for Document Binarization Figure 1
2026-06-11cs.CV

ERN-Net : Evolving Reason Node-Net for Document Binarization

Hsin-Jui Pan, Sheng-Wei Chan, Jen-Shiung Chiang

Tamkang University

2026-06-11视觉感知

针对退化文档二值化中淡笔画、断裂字符和噪声背景易出错且统一处理低效的问题,ERN-Net在ConvNeXt-Tiny编码器上引入Top-K演化推理节点、多尺度空洞分支和空间难度门,集中增强困难区域。DIBCO系列实验平均FM达89.35、DRD为2.99;ConvNeXt-Tiny较ResNet-101显著更省显存且更准,预训练在不增推理显存下进一步提升,但部分增益可能来自数据扩充。

MedCTA: A Benchmark for Clinical Tool Agents Figure 1
2026-06-11cs.CV

MedCTA: A Benchmark for Clinical Tool Agents

Tajamul Ashraf, Hyewon Jeong, Fida Mohammad Thoker, Bernard Ghanem

King Abdullah University of Science and Technology (KAUST), Saudi Arabia, Massachusetts Institute of Technology (MIT), USA

2026-06-11数据集/基准

针对现有医学评测多停留在感知或单轮问答、难以暴露临床工具调用中的规划与执行失败,MedCTA构建了含107个真实多模态临床任务、5个可执行工具和医生验证轨迹的过程感知基准。对18个模型的测试显示,最佳自主工具使用准确率仅31.54%,严格轨迹成功率为0;给定金标准路由可提升最多35%,说明瓶颈主要在控制器和工具编排可靠性。

RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval Figure 1
2026-06-11cs.CV

RankVR: Low-Rank Structure Perception and Value Recalibration for Robust Composed Image Retrieval

Jiale Huang, Zixu Li, Zhiheng Fu, Zhiwei Chen, Qinlei Huang, Yupeng Hu

Shandong University, lowering standards risks mislabeling low-value noise as high-value

2026-06-11视觉感知三维安全鲁棒

针对组合图像检索中参考图、修改文本与目标图三元组易含噪、且传统逐样本置信度难区分局部匹配噪声与高价值难样本的问题,RankVR将噪声识别转向批量相关结构:用相关矩阵有效秩感知破坏全局低秩语义一致性的样本,并结合训练潜力与可靠性动态重标定样本价值。文中在 FashionIQ 和 CIRR 上报告其优于现有方法,显示在噪声环境下更稳健。

DroneShield-AI: A Multi-Modal Sensor Fusion Framework for Real-Time Autonomous Drone Threat Detection, Behavioral Intent Classification, and Swarm Intelligence in Contested Airspace Figure 1
2026-06-11cs.CV

DroneShield-AI: A Multi-Modal Sensor Fusion Framework for Real-Time Autonomous Drone Threat Detection, Behavioral Intent Classification, and Swarm Intelligence in Contested Airspace

Marius Bayizere

Code, model weights, and simulation datasets: publicly available at submission (see Section VI.D), Networks. Evaluated on three publicly available real-world datasets (DroneRF, OpenSky Network, a target of 500+ labelled sorties by Q4 2026. All code, model weights, and simulation datasets are, The global proliferation of commercially available unmanned aerial vehicles (UAVs) has created a security

2026-06-11视觉感知

针对小型无人机在低空、静默或集群攻击中绕过单一传感器且预警时间短的问题,DroneShield-AI提出RF、声学、YOLOv8视觉与证据加权融合,并加入BICE意图分类和GAT集群分析。在公开数据与仿真评估中融合检测率96.1%、误报3.2%、延迟142ms;但BICE/GNN-SIM主要基于物理校准仿真,真实外场验证仍在进行。

Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning Figure 1
2026-06-11cs.CV

Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning

Chaofan Ma, Zhenjie Mao, Yuhuan Yang, Fanqin Zeng, Yue Shi, Yingjie Zhou, Xiaofeng Cao, Jiangchao Yao

plementary viewpoints become available. Build-, Cooperative Medianet Innovation Center, Shanghai Jiao Tong, University 2Shanghai Jiao Tong University 3Tongji University., available (e.g., a viewpoint revealing an occluded region, or, and task-specific heavy training, limiting scalability. More

2026-06-11视觉感知

本文针对自我中心视频视角受限、单轮空间推理易依赖语义先验而出错的问题,提出训练-free 的 ReRe:先让 MLLM 基于原视频形成空间假设,再利用预测 3D 几何合成的高位斜视新视角视频进行复核与修正。其核心洞察是把空间推理做成可回访过程,并保持原生视频接口无需改模型。VSI-Bench 与 STI-Bench 结果显示,该方法显著提升开源 MLLM,性能接近闭源 SOTA。

Parameter-Efficient Adapter Tuning for Tabular-Image Multimodal Learning Figure 1
2026-06-11cs.CV

Parameter-Efficient Adapter Tuning for Tabular-Image Multimodal Learning

Jiaqi Luo

2026-06-11视觉语言视觉感知

本文针对表格-图像多模态任务中全量微调成本高、完全冻结又适配不足的问题,提出 TI-Adapter:冻结 TabPFN 表格编码器并在表格嵌入后加适配器,同时在 ResNet 图像分支的嵌入层和瓶颈层插入轻量适配器。20 个分类与回归数据集实验显示,其性能可与全量微调相当或更好,且显著减少可训练参数;消融表明适配器插入深度会影响性能与显存开销的权衡。

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation Figure 1
2026-06-11cs.CV

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

Peking University, Xiamen University, We introduce Argus, a Wan-based framework centered on Stacked, A second principle of Argus is that scalable identity supervision need not rely on cross-

2026-06-11视觉感知

这篇论文针对主体保持视频生成中单张参考图易把身份与姿态、遮挡、光照等偶然因素绑定的问题,提出 Argus 将身份视为多视角动态分布。其核心 SMII 把 MLLM 选出的图像/视频证据组织成 3×3 马赛克,并作为 Wan 原生 token 空间中的负时间只读记忆注入,配合反事实训练、TIA 与 ASLG 提升鲁棒性。在 OpenS2V-Eval Human-Domain 上达到 64.38 总分,并在 HardID-Celeb 上显著提升大偏航和遮挡场景指标。

Learning Instance-Adaptive Low-Rank Orthogonal Subspaces for Clothes-Changing Person Re-Identification Figure 1
2026-06-11cs.CV

Learning Instance-Adaptive Low-Rank Orthogonal Subspaces for Clothes-Changing Person Re-Identification

Dong-Woo Kim, Tae-Kyun Kim

School of Computing, KAIST, Daejeon, South Korea. Corre-

2026-06-11视觉感知

针对换衣行人重识别中服装外观易误导身份匹配的问题,Ortho-ReID将服装视为VLM表征中的低秩线性子空间:用服装文本嵌入SVD初始化基,借助图像patch交叉注意力生成实例自适应正交基,并约束身份特征与其正交以去除服装信息。实验在PRCC、Celeb-reID-light和LaST分别取得Top-1约5.9%、3.5%、5.3%的提升,LTCC上也保持竞争力。

Motion Reinforces Appearance: RGB-Skeleton Gated Residual Fusion for Micro-Gesture Online Recognition Figure 1
2026-06-11cs.CV

Motion Reinforces Appearance: RGB-Skeleton Gated Residual Fusion for Micro-Gesture Online Recognition

Jialin Liu, Xinwen He, Pengyu Liu, Jiale Shi, Huaijuan Zang, Yanbin Hao

School of Computer Science and Information Engineering, Hefei University of

2026-06-11视觉感知

本文面向未裁剪视频中的微手势在线识别,针对动作幅度小、边界模糊且单一 RGB 或骨架模态容易丢失关键信息的问题,提出 DyFADet+:将 RGB 与骨架投影到共享多尺度时序表示,并用门控残差融合选择性注入可靠骨架运动,而非直接拼接。模型在 SMG/MiGA 赛道取得 F1=40.88、官方第 2,消融显示优于单模态和朴素融合。

Adapting Vision-Language Models from Iconic to Inclusive for Multi-Label Recognition Without Labels Figure 1
2026-06-11cs.CV

Adapting Vision-Language Models from Iconic to Inclusive for Multi-Label Recognition Without Labels

Cheng Chen, Jingyu Zhou, Yifan Zhao, Jia Li

Multi-Label Recognition Without Labels, Abstract Understanding multi-label images remains, without labeled data. However, due to their intrinsic de-, conflicts with the nature of multi-label learning, thereby, label-free multi-label image recognition. Our approach, State Key Laboratory of Virtual Reality Technology and, Systems, SCSE & QRI, Beihang University, Beijing 100191, to adjust the labels to better conform to the multi-label, notations. Our code is publicly available at https://, Keywords Multi-label Image Recognition · Unsuper-, Multi-label image recognition aims at predicting multi-, in multi-label learning is achieved by the construction

2026-06-11视觉语言视觉感知

这篇论文针对 CLIP 等视觉语言模型在多标签识别中偏向最显著物体、漏掉上下文正类的问题,提出无需人工标签的 TailorCLIP 框架:先通过多采样局部响应“切分”出潜在物体线索,再用多物体混合适配和置信校正“缝合”成更符合多标签分布的训练信号,并以 EM 迭代优化。实验显示其在四个公开数据集上显著优于现有无监督方法,且超过若干弱监督基线。

Precision-Aware Illumination-Disentangled Vision Transformer for Spacecraft 6D Pose Estimation Figure 1
2026-06-11cs.CV

Precision-Aware Illumination-Disentangled Vision Transformer for Spacecraft 6D Pose Estimation

Zongwu Xie, Yifan Yang, Yonglong Zhang, Guanghu Xie, Yang Liu, Shuo Zhang

The authors are with the School of Mechatronics Engineering, Institute, object labels, translation, and rotation from RGB images

2026-06-11视觉感知三维

面向在轨服务中单目航天器 6D 位姿估计易受强光、阴影、反光和弱纹理干扰的问题,PAID-ViT 将 ViT token 分解为结构与光照外观成分,并用patch可靠性加权聚合、前景mask监督和无参数几何恢复来稳定直接回归。SPEED+ V2实验显示其降低平移误差,在sunlamp强光域更稳;消融支持解耦、可靠性聚合和训练正则的互补作用。

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks Figure 1
2026-06-11cs.CV

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Omid Ahmadieh, Nima Karimian

University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing, University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing Tampa Florida USA

2026-06-11视觉感知生成模型

针对人脸识别被未授权利用及现有噪声/补丁攻击不自然、扩散攻击效率和可编辑性受限的问题,Adv-TGD在Stable Diffusion 2.1上为每个源-目标身份对微调跨注意力LoRA,并用SGSM面部显著掩码、潜空间融合与复合身份损失实现局部、逼真的冒充式对抗编辑。黑盒评测中其在IR152、IRSE50、MobileFace、FaceNet上的平均ASR达85.90%,较Adv-CPG高6.25点,同时保持PSNR 27.15 dB、SSIM 0.981,并展示到LADN、ImageNet和FLUX.1的可迁移性。

Information-Theoretic Decomposition for Multimodal Interaction Learning Figure 1
2026-06-11cs.LG

Information-Theoretic Decomposition for Multimodal Interaction Learning

Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu

Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, 2Beijing Key Laboratory of, Research on Large Models and Intelligent Governance, 3Engineering Research Center of Next-Generation, Intelligent Search and Recommendation, MOE, 4Beihang University, Beijing, 5Gaotu Techedu Inc., available at https://github.com/GeWu-Lab/DMIL., Code: https://github.com/GeWu-Lab/DMIL

2026-06-11视觉语言

本文针对多模态样本中冗余、独有与协同信息比例动态变化的问题,指出传统联合学习容易低用冗余信息、模态集成难以捕获协同信息。作者提出 DMIL,用变分分解显式拆出三类交互成分,并在微调中针对性强化。多任务、多架构实验显示其在不同交互组成下较联合与集成范式更稳健、性能更高。

Frozen Foundation-Model Embeddings Discard Small-Lesion Signal in Chest Radiography: Implications for Pre-Deployment Evaluation Figure 1
2026-06-11cs.CV

Frozen Foundation-Model Embeddings Discard Small-Lesion Signal in Chest Radiography: Implications for Pre-Deployment Evaluation

Raajitha Muthyala, Zhenan Yin, Alekhya Jilla, Frank Li, Theo Dapamede, Bardia Khosravi, Mohammadreza Chavoshi, Judy Gichoya, Saptarshi Purkayastha

aDepartment of Biomedical Engineering and Informatics, Indiana University, 535 W Michigan St., IT 475J, Indianapolis, IN, 46202, USA, bDepartment of Radiology and Imaging Sciences, Emory University, 1364 Clifton Rd NE, Atlanta, GA, 30322, USA

2026-06-11数据集/基准

针对胸片基础模型常以冻结全局嵌入服务下游、却可能漏掉早期小结节等低对比局部信号的问题,本文用近49万张胸片的可控扰动和带框小病灶基准,定位信号在CLS/全局池化阶段被抑制而非前向中完全消失。结果显示CLS小尺度扰动AUC接近随机0.500–0.524,但ROI限制的patch-local池化可接近1.0,并在真实小病灶上各类AUC≥0.899,提示部署前不能只看全局疾病AUC。

On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning Figure 1
2026-06-11cs.CV

On Aligning Hierarchical Standardized Embedding for Audio-visual Generalized Zero-shot Learning

Zihan Zhang, Jie Hong, Siyuan Fan, Yanghao Zhou, Pengfei Fang

Zihan Zhang and Siyuan Fan are with School of Software Engineering, Southeast University, Nanjing, 210096, China. Jie Hong is with Faculty of, Engineering, The University of Hong Kong, Pok Fu Lam, 999077, Hong Kong, SAR. Yanghao Zhou is with Beijing Institute of Technology, Beijing, 100811, China. Pengfei Fang is with Key Laboratory of New Generation Artificial, University), Ministry of Education, Nanjing, 210096, China. Pengfei Fang is, also with School of Computer Science and Engineering, Southeast University, i is the ground truth class label, to the ground truth class label. N is the number of samples in, number of classes is denoted as K, and the class label is

2026-06-11视觉感知

本文针对音视频广义零样本学习中音视频表征与文本语义在分布和结构上不匹配的问题,提出 AHSE:先用 Z-score 将融合音视频与文本嵌入标准化到共享空间,再在语义、类别和 batch 三个层级约束局部结构对齐,以缓解 hubness 并保留类间关系。实验在 VGGSound-GZSL、UCF-GZSL 和 ActivityNet-GZSL 上取得稳定且有竞争力的结果,但具体相对增益幅度文中片段未充分说明。

Spatially Coupled Phase-to-Depth Calibration for Fringe Projection Profilometry Figure 1
2026-06-11cs.CV

Spatially Coupled Phase-to-Depth Calibration for Fringe Projection Profilometry

Sehoon Tak, Jae-Sang Hyun

Department of Mechanical Engineering, Yonsei University, Seoul 03722, South Korea., grid as the native grid. By contrast, external depth labels ac-, the rectified depth labels. In this work, we instead map the depth, produce native-grid depth labels zn,uv, avoiding phase rectification. (c) Pixel-wise fitting estimates an independent fuv(Φ) per pixel, whereas the proposed method

2026-06-11视觉感知

针对 FPP 中逐像素相位到深度标定虽局部精确但易产生邻域不一致和结构化伪影的问题,论文提出在未畸变参考相机原生网格上共享低维相位—深度映射,并可加入有界平滑残差场,同时用平面拟合把立体深度监督回采到原生网格以避免相位重采样。牙科目标实验显示其空间一致性优于多项式/有理逐像素标定,点到面 RMSE 约 11.9–12.9 µm,接近主动立体基线。

Contactless 3D Human Body Measurement Using Depth Cameras for Smart Health Monitoring Figure 1
2026-06-11cs.CV

Contactless 3D Human Body Measurement Using Depth Cameras for Smart Health Monitoring

Martha Asare, Xuan Wang, Juan Lopez Alvarenga, Lois Akosua Serwaa, Jinghao Yang

Department of Computer, University of Texas Rio Grande, Department of Information, School of Medicine, Primary &, Department of Human Genetics, Department of Electrical and, scalability in remote healthcare settings. In this study, we, CREST Center for Multidisciplinary Research Excellence in Cyber-Physical, Sensing and Intelligent Quality Assessment for Scalable Additive, camera optical center.

2026-06-11三维

面向远程医疗和连续健康监测中人工接触式人体测量效率低、可扩展性差的问题,本文用 Orbbec Astra 2 深度相机构建 RGB-D/点云流程,通过空间滤波、人体分割与地标选择估计身高和臂展,并用体素占据与网格重建近似体积和可见表面积。单次深度采集实验显示可获得较准确的非接触测量,但样本规模、定量误差和多视角完整性文中未充分说明。

AVIS: Adaptive Test-Time Scaling for Vision-Language Models Figure 1
2026-06-11cs.CV

AVIS: Adaptive Test-Time Scaling for Vision-Language Models

Ahmadreza Jeddi, Minh Ngoc Le, Amirhossein Kazerouni, Hakki Can Karaimer, Hue Nguyen, Iqbal Mohomed, Michael Brudno, Alex Levinshtein, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

AI Center-Toronto, Samsung Electronics, University of Toronto, Vector Institute, York University

2026-06-11视觉语言视觉感知

论文针对视觉语言模型在高分辨率图像/视频与CoT多次推理下推理成本过高的问题,提出将计算拆成视觉上下文VCS与推理搜索VRS两轴联合分配。AVIS用无需训练的KDV剪除冗余视觉token,并用难度预测器自适应选择自一致rollout数,配合共享prefill复用KV缓存。实验显示其在多类图像和视频推理基准上较仅剪枝或仅增加rollout取得更好的准确率–FLOPs/延迟权衡,并可叠加于RL后训练VLM。

Understanding Cross-Sensor Feature Variations for Generalizable 3D Perception Figure 1
2026-06-11cs.CV

Understanding Cross-Sensor Feature Variations for Generalizable 3D Perception

Xin Qiu, Wenjie Liu, Fuyuan Ai, YuChen Tan, Zhiwei Xu, Chunyi Song

Zhejiang University, of target-domain data is available., labeled target data. Ablation studies and visualization analyses

2026-06-11三维

本文针对雷达-相机 BEV 3D 检测跨数据集性能下降,指出问题不只是图像风格变化,而是视觉场景偏移会经编码、投影和融合传播到 BEV 特征。作者提出 VBS2M,从源域图像频谱统计挖掘场景原型,生成偏移视图,并用 BEV 偏移原型正则化融合空间;在 VoD 与 TJ4DRadSet 双向迁移及少量目标域标注设置下,对多种 BEV 融合骨干均带来稳定 OOD 提升。

FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection Figure 1
2026-06-11cs.CV

FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection

Keval Thaker, Venkatraman Narayanan, Abdalmalek Aburaddaha, Samir A. Rawashdeh

University of Michigan-Dearborn, mAP50). Code is available here., for the thermal domain, where labelled data is one to two orders of magnitude smaller and, normalised, transformed by 2D fast Fourier transform (FFT), and split via a centred radial, sifier or label-space alignment, as it distils from a frozen foundation-model teacher. (3) A, architectures (ResNet-50 via cross-architecture distillation). A frequency-resolved centered

2026-06-11视觉感知

红外检测缺少大规模预训练表征,直接把 RGB 基础模型蒸馏到 IR 会因成像物理差异引入冲突监督。FreqKD 的核心洞察是 RGB–IR 差异集中在高频:低频形状/布局更可迁移,高频纹理更模态特异,因此用 FFT 分频后对低频强 MSE 对齐、对高频弱 log-MSE 约束,并用 LoRA 两阶段训练。结果在 KAIST 达 64.1 mAP50,较 DINOv2 基线提升 2.4 点,并迁移到 FLIR、MFNet 和 ResNet-50。

4DP-QA: Scalable QA for 4D Perception in Vision Language Models Figure 1
2026-06-11cs.CV

4DP-QA: Scalable QA for 4D Perception in Vision Language Models

Seokju Cho, Abhishek Badki, Hang Su, Jindong Jiang, Ziyao Zeng, Seungryong Kim, Sifei Liu, Orazio Gallo

DP-QA: Scalable QA for 4D Perception in Vision Language Models, Yale University, duce a scalable spatio-temporal QA generation pipeline that, • We introduce a scalable spatio-temporal QA generation

2026-06-11视觉感知

论文针对VLM难以从视频中理解真实4D运动的问题,指出关键瓶颈在于2D投影会混淆相机运动与物体运动。作者用多源几何标注构建可扩展时空QA生成管线,并提出固定参考系下的True-Motion Tracking,生成40万训练样本和2.2K基准。实验显示,Qwen与NVILA等模型经4DP-QA训练后在自建基准和外部VLM4D上明显提升,增益可能主要来自高质量运动数据与细粒度跟踪监督。

Cross-Modal Benchmarking for Robotic Perception in Natural Environments Figure 1
2026-06-11cs.CV

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

University of Sydney (USyd), Australia., Queensland University of Technology (QUT), Australia.

2026-06-11机器人数据集/基准

面向农业、监测和搜救等非结构化自然环境,论文指出现有机器人感知基准多偏城市/室内,难以暴露视觉基础模型在植被、遮挡和窄径中的弱点。作者扩展 WildCross,提供47.6万余帧RGB、半稠密深度/法线、6DoF位姿和同步激光子图,并以四折设置评测视觉/跨模态地点识别与单目度量深度。结果主要显示现有VPR、CMPR和DepthAnything系模型存在明显域外泛化缺口,微调与伪真值融合可用于分析和缓解,但具体增益幅度文中未充分说明。

VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio Figure 1
2026-06-11cs.CV

VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio

Hao Zhang, Qinran Lin, Linqi Song, Yong Li

Chongqing University, Chongqing, China, City University of Hong Kong, Hong Kong, China, model are available at https://github.com/HaoZ416/VL-DINO., relying on category-specific labels. QPSC introduces no extra learnable parameters, and all positive

2026-06-11视觉语言视觉感知

针对开放词汇检测中 DINO 难以同时吸收 CLIP 文本与视觉知识、且原去噪训练不适配自由短语标注的问题,VL-DINO 用 QPSC 构造无需类别索引的高质量正样本,引入 VSE 将 CLIP 全局视觉语义蒸馏到高层特征,并用 ORSA 对齐目标区域与文本嵌入;训练辅助模块推理时可丢弃。零样本实验中,VL-DINO-T/L 在 LVIS 达到 36.3/38.1 AP,在 COCO 达到 48.5/50.0 AP。

XPR: An Extensible Cross-Platform Point-Based Differentiable Renderer Figure 1
2026-06-11cs.GR

XPR: An Extensible Cross-Platform Point-Based Differentiable Renderer

Steve Rhyner, Sankeerth Durvasula, Aleksandr Kovalev, Hansel Jia, Adrian Zhao, Mrutunjayya Mrutunjayya, Nilesh Ahuja, Selvakumar Panneer, Christina Giannoula, Nandita Vijaykumar

University of Toronto, Vector Institute, Max Planck Institute for Software Systems, improve efficiency and scalability [10, 42]. Point-based renderers, beyond NVIDIA, but are currently incompatible with data center, models, on non-NVIDIA data center GPUs or accelerators like the, blocks available across all accelerators: data parallel element-wise

2026-06-11视觉感知

点基可微渲染常依赖 CUDA/Vulkan 专用内核和手写反传,限制新表示探索及在 TPU、Trainium 等训练平台中的集成。XPR 将方法逻辑拆成 project、tile_cull、pixel_info、evaluate 四个单元素接口,把过滤、分块、排序、混合与自动微分留给共享管线,并用 JAX/XLA 表达静态并行计算。论文用数百行 Python 复现 3DGS、3DGUT、LinPrim,并展示可编译到多类硬件,主要结果指向可扩展性和可移植性提升;性能相对专用内核的取舍需看实验细节。

SceneMiner: Identity-Preserving Multi-Task Fine-Tuning for Unified BEV Scene Mining Figure 1
2026-06-11cs.CV

SceneMiner: Identity-Preserving Multi-Task Fine-Tuning for Unified BEV Scene Mining

Abdalmalek Aburaddaha, Venkatraman Narayanan, Keval Thaker, Samir A. Rawashdeh

University of Michigan-Dearborn, of difficulty labels, and no single proxy, collision risk, trajectory ambiguity, or seman-, trieval embedding for text-prompted scenario search, a multi-label scene-tag distribution, text-prompted retrieval, validated qualitatively. Code is available here., safety-critical situations worth re-simulating, labelling, or training on. This is the problem, without ground-truth difficulty labels, and critically no single proxy can recover them: fore-, text-prompted scenario search, (ii) a multi-label tag distribution over weather, road class

2026-06-11视觉感知

针对自动驾驶日志缺少难例/风险标签、单一代理指标难以挖出长尾安全场景的问题,SceneMiner用冻结SigLIP2+BEVFormer相机BEV骨干一次前向输出检索嵌入、20类场景标签和物理风险分数。核心洞察是多头共享激活会产生“跨任务干扰”,即权重冻结仍会因输入分布漂移损害其他头;其通过零初始化新模块并冻结所有影响共享流的参数实现身份保持微调。模型仅训练约10.2万参数,标签mAP 0.4614、micro-F1 0.5557,风险相关r=0.3925,检索主要为定性验证,跨数据集和独立风险验证仍未充分说明。

On the Study of Biometric Spoofing Detection using Deep Learning Figure 1
2026-06-11cs.CV

On the Study of Biometric Spoofing Detection using Deep Learning

Kumar Kartikey, Nikos Komninos

School of Science and Technology, City St George’s University of London, specialized hardware, limiting their scalability. Machine learning, particularly deep learning, has emerged as a

2026-06-11视觉感知

针对人脸生物识别在打印照片、视频重放和3D面具等欺骗攻击下易失效的问题,本文比较MobileNetV2、DenseNet-121、Inception-v3与STD在CelebA-Spoof上的反欺骗表现,并用MSU-MFSD做跨数据集验证。核心洞察是轻量模型在精度与部署成本间更均衡:MobileNetV2达到约92%准确率且更适合实时应用;Inception-v3鲁棒性中等,而DenseNet-121和STD泛化较弱,提示后续需加强域适应和混合架构。

Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models Figure 1
2026-06-11cs.CV

Towards Fully Automated Exam Grading: Fairness-Aware Recognition of Handwritten Answers with Foundation Models

Hartwig Grabowski

Institute for Machine Learning and Analytics (IMLA), Offenburg, University, Offenburg, Germany., previous baseline. Crucially, we centre the evaluation on fairness: we distinguish

2026-06-11视觉感知

针对纸笔考试人工批改耗时、全数字考试又限制题型的问题,论文把答案设计为表格中的单个大写字母,并用通用视觉语言模型直接理解整页而非模板检测,重点区分误判扣分与误给分。61份考试、3141个位置上最佳模型达98.4%准确率,弱提示将不利学生的假阴性降至0.58%,仅3份可能影响成绩且可由学生复核发现。

PT-WNO: Point Transformer with Wavelet Neural Operator for 3D Point Cloud Semantic Segmentation Figure 1
2026-06-11cs.CV

PT-WNO: Point Transformer with Wavelet Neural Operator for 3D Point Cloud Semantic Segmentation

Nhut Le, Maryam Rahnemoonfar

Lehigh University, resentation capacity but still face notable scalability challenges in, former V3 (PTv3) [29] overcame these scalability barriers by se-

2026-06-11视觉感知三维

针对点云 Transformer 主要依赖局部注意力和跳连传递全局信息、长程场景结构建模不足的问题,PT-WNO 在序列化 Point Transformer 骨干的编码器—解码器过渡处加入共享小波神经算子分支,将点特征投影到 3D 网格中学习多尺度全局上下文,再轻量融合回点特征。实验显示其相对 PTv3 在 S3DIS Area 5 提升 1.03 mIoU、DALES 提升 1.47 mIoU,ScanNet v2 基本持平。

Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognition Figure 1
2026-06-11cs.CV

Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognition

Shengkai Sun, Zhiyong Cheng, Zefan Zhang, Jianfeng Dong, Zhihui Li, Meng Wang

Hefei University of Technology, Jilin University, Zhejiang Gongshang University, University of Science and Technology of China, mand large volumes of labor-intensive annotations, which, severely limit their scalability in real-world applications., manual labels, dominantly center on two paradigms: contrastive learning

2026-06-11视觉感知三维

本文针对骨架动作识别中掩码重建预训练需预测大量时空块、训练慢且平均重建会分散到非关键运动区域的问题,提出 AMR:用与编码器解耦的交叉注意力解码器支持更大块预测以降复杂度,并以局部运动能量引导自适应焦点重建。实验在 NTU RGB+D 60/120 和 PKU-MMD 上显示其预训练更快、下游精度超过现有方法。

3D-CBM: A Framework for Concept-Based Interpretability in Generative 3D Modeling Figure 1
2026-06-11cs.CV

3D-CBM: A Framework for Concept-Based Interpretability in Generative 3D Modeling

Ahmad Al-Kabbany

Yubree Labs, Ottawa K2M1T2, Canada, Multimedia Interaction and Communication Lab, Arab Academy for Science and Technology, Alexandria 21937, Egypt

2026-06-11生成模型三维

论文针对3D生成模型难以用“桌腿厚度、结构稳定性”等人类概念解释和纠错的语义鸿沟,将概念瓶颈模型引入点云/网格生成流程,构建分层3D概念 taxonomy,并支持测试时人工干预概念激活来修正结构错误。概念验证的部件操作实验达到88.8%概念预测准确率和0.0115 Chamfer Distance,但效果主要来自小规模验证,泛化与真实复杂场景仍文中未充分说明。

A Scalable PyTorch Abstraction for Multi-GPU Gaussian Splatting Figure 1
2026-06-11cs.CV

A Scalable PyTorch Abstraction for Multi-GPU Gaussian Splatting

Matthew Cong, Francis Williams, Jonathan Swartz, Mark Harris, Sanja Fidler, Ken Museth

University of Toronto, Vector Institute

2026-06-11三维

针对高分辨率、大场景 Gaussian Splatting 受单卡显存与算力限制、现有多卡方案需手写通信的问题,论文提出 torch-dgx:用 CUDA 统一内存与 NVLink 将多 GPU 暴露为聚合 PyTorch 设备,并在算子层按高斯或像素维度自动分布计算,配合异步统一内存分配器降低开销。结果展示可重建含超 10 亿 Gaussian 的城市级街景,规模超过既有约 25 倍。

DeceptionX: Explainable Deception Detection with Multimodal Large Language Models Figure 1
2026-06-11cs.CV

DeceptionX: Explainable Deception Detection with Multimodal Large Language Models

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Hui Ma, Zitong Yu

Great Bay University, Hong Kong Polytechnic University, Great Bay University Dongguan Guangdong China, Hong Kong Polytechnic University HongKong China

2026-06-11视觉语言视觉感知

针对传统测谎模型只给真假标签、缺少可验证推理链的问题,DeceptionX将多模态大模型用于视频欺骗检测,把微表情、视线、声颤等视听线索组织为Observe-Think-Summarize流程;其核心还包括人机协同构建DeceptChain推理数据、三阶段训练和DARE冗余消除。实验称其在多个真实基准和跨域测试中优于现有MLLM与SOTA,并能输出专家式解释。

From Simulation to Real-World: An In-Field 6D Pose Dataset and Baseline for Robotic Strawberry Harvesting Figure 1
2026-06-11cs.CV

From Simulation to Real-World: An In-Field 6D Pose Dataset and Baseline for Robotic Strawberry Harvesting

Woojung Son (1), Won Suk Lee (1), Zijing Huang (1), Daeun Choi (1), Catia Silva (2), Yu She (3), Yan Gu (4) ((1) Department of Agricultural and Biological Engineering, University of Florida, (2) Department of Electrical and Computer Engineering, (3) Edwardson School of Industrial Engineering, Purdue University, (4) School of Mechanical Engineering, Purdue University)

2026-06-11机器人强化学习数据集/基准三维

针对草莓采摘中仅估计果实位置难以支撑无损抓取、真实田间6D位姿真值缺失的问题,论文构建了首个田间草莓6D位姿数据集,并用PnP、COLMAP重建与3D框标注生成真值,同时提供Isaac Sim合成集。基线实验显示,即使加入场景级真实感和域随机化,合成到真实仍存在明显差距,说明真实田间数据对评测和训练不可替代。

NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization Figure 1
2026-06-11cs.CV

NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization

Hao Lu, Yongxin Guo, Onur Koyun, Zhengjie Zhu, Abbas Alili, Metin N. Gurcan

Wake Forest University School of Medicine / Advocate Health, Wake Forest University School of Medicine

2026-06-11视觉感知

这篇论文针对大码本 VQ 训练中常见的 codebook collapse,指出根因不只是码字利用率不足,而是编码器持续漂移与稀疏码本更新之间的非平稳错配。NSVQ 通过非平稳嵌入损失、码字替换和分阶段冻结编码器,让码本先跟踪漂移、再在固定潜空间中巩固。ImageNet-1k 上 65,536 码本实验中,相比 SimVQ 将 rFID 从 2.39 降至 2.10,并保持 100% 利用率,且改善下游潜扩散生成 FID。

DarkVGGT: Seeing Through Darkness Using Thermal Geometry without Daylight Tax Figure 1
2026-06-11cs.CV

DarkVGGT: Seeing Through Darkness Using Thermal Geometry without Daylight Tax

Minseong Kweon, Wenyuan Zhao, Nuo Chen, Lulin Liu, Huiwen Han, Zihao Zhu, Srinivas Shakkottai, Chao Tian, Zhiwen Fan

University of Minnesota, Texas A&M University, Stanford University

2026-06-11视觉感知

DarkVGGT针对VGGT等前馈3D重建模型在夜间/低可见度下依赖RGB纹理而失效、且低光适配易损害白天性能的问题,提出保守的RGB-T融合框架:通过物理启发的热成像因子分解剔除反射残差,并用几何共享热路由将可靠热结构注入RGB流。实验显示其在ViViD++、STheReO、Dark3R等低光基准上提升深度与相机位姿估计,同时在ETH3D、ScanNet++上基本保留VGGT的明亮场景能力。

Semantic Segmentation of Node and Edge Diagrams for Assistive Technology Figure 1
2026-06-11cs.CV

Semantic Segmentation of Node and Edge Diagrams for Assistive Technology

Michael Cormier, Yichun Zhao, Laura Paul, Cameron Swift, Duc Tri Dang, Miguel Nacenta

Mount Allison University, Department of Computer Science, University of Victoria, diagrams will generally be made available as bitmap images. Our, when studying textbooks for a university course, when brows-, More recently, the availability of large language models, agrams, circumventing most of the human-centered issues, to the network and making the translation unavailable when, becoming more available. A machine learning system that can

2026-06-11视觉感知

面向盲人和低视力用户难以从位图节点—边图中获取结构信息的问题,论文将图解析前端聚焦为本地可运行的语义分割任务,提出紧凑的双分支全卷积网络,同时保留细节与较大感受野,并用合成 Graphviz 数据和 JPEG 退化评估鲁棒性;模型在节点、边、文本等像素分类上达到超过 93% 的逐像素准确率,可作为后续实例分割与辅助交互管线的基础。

TRON: Tracing Rays to Orchestrate a Neural Renderer for 3D Gaussian Reconstructions Figure 1
2026-06-11cs.CV

TRON: Tracing Rays to Orchestrate a Neural Renderer for 3D Gaussian Reconstructions

Or Perel, Hassan Abu Alhaija, Zian Wang, Jacob Munkberg, Matan Atzmon, Sanja Fidler, Masha Shugrina

University of Toronto, Vector Institute

2026-06-11三维

TRON针对3D Gaussian重建中光照与材质被烘焙、难以在动态光照和物体运动下真实编辑的问题,将Gaussian ray tracing改为提供PBR/辐照度等结构化引导,并借助逆渲染先验约束材质,再用单步神经渲染器弥合物理模型与真实图像的差距。论文通过合成到真实的多阶段训练和210万帧数据,报告在重光照真实感、可编辑性与速度上优于Gaussian重光照和既有神经渲染方法。

i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models Figure 1
2026-06-11cs.CV

i1: A Simple and Fully Open Recipe for Strong Text-to-Image Models

Boya Zeng, Tianze Luo, Shu Pu, Jucheng Shen, Taiming Lu, Gabriel Sarch, Zhuang Liu

Princeton University

2026-06-11视觉感知

针对强文本到图像扩散模型训练细节和数据不透明、难以复现实验归因的问题,论文通过300余组受控实验系统梳理建模与数据选择,发现单强文本编码器配大适配器、双流DiT加长跳连、数据集等权混合和长字幕训练等简单策略有效,并据此训练3B参数i1。该模型仅用公开数据,在1024分辨率五个基准上接近领先模型,较最佳全开放模型平均提升29.5个百分点。

Intelligent Skin Cancer Detection Using a Multispectral Metasurface and a Hybrid Figure 1
2026-06-11eess.IV

Intelligent Skin Cancer Detection Using a Multispectral Metasurface and a Hybrid

Afsane Saee Arezoomand

Islamic Azad University, Urmia Branch, Urmia, Iran

2026-06-11视觉感知

针对传统皮肤镜主要依赖可见光、难捕捉早期病灶细微光谱差异的问题,论文提出用多光谱/太赫兹超表面采集非侵入式组织光谱,再由CNN–ViT混合模型融合局部纹理与全局注意力完成分类。仿真评估报告约98%准确率、95%敏感度和99%特异度,并用注意力图展示关注病灶区域;但结果主要来自仿真,真实临床数据与硬件验证文中未充分说明。

EventRadar: Long-Range Visual UAV Discovery through Spatiotemporal Event Sensing Figure 1
2026-06-11cs.CV

EventRadar: Long-Range Visual UAV Discovery through Spatiotemporal Event Sensing

Zhiting Zhou, Xingchen Liu, Xinglin Yu, Jiashen Chen, Haoyang Wang, Jingao Xu, Yunhao Liu, Xinlei Chen

2026-06-11视觉感知

面向机场等敏感空域的远距离反无人机监测,论文指出传统依赖外形、轨迹或事件密度的视觉线索在公里级距离会迅速失效,转而利用螺旋桨诱发的高频时间周期性。EventRadar通过SAGE把扫描事件与IMU/云台姿态融合成方位索引场景记忆以抑制背景,再用CHG-LISTA从候选ROI中恢复相位不敏感的谐波证据。在700–1500米事件相机实测中,其报告0.990 mAP、0.949 F1,并将漏检率降至0.009。

Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment Figure 1
2026-06-11cs.CV

Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment

Jia Li, Qian Chen, Wei Wang, Xinyu Li, Zhenzhen Hu, Dongsheng Shao, Richang Hong, Meng Wang

Hefei University of Technology, Intelligent Interconnected Systems Laboratory of Anhui Province, Jianghuai Advanced Technology Center, Hefei University of Technology Hefei China, Intelligent Interconnected Systems Laboratory of Anhui Province Hefei University of Technology Hefei China, Jianghuai Advanced Technology Center Anhui Provincial Industry Innovation Center of Humanoid Robots Anhui Provincial Key Laboratory of Humanoid Robots Hefei China

2026-06-11视觉感知

本文针对自动人格评估中各人格维度依赖不同语言、语音与视觉线索,而现有方法常用统一多模态融合导致跨模态干扰的问题,提出 Traits Run Deeper:用心理学语义模板增强基础模型表征,并为每个特质设计非对称的特定模态融合路径,同时通过分布校准回归缓解标签集中偏置。在 AVI Challenge 2026 上,验证集 MSE 较基线约降 25%,官方测试集 MSE 为 0.27767,并获人格评估赛道第一。

A2SG:Adaptive and Asymmetric Surrogate Gradients for Training Deep Spiking Neural Networks Figure 1
2026-06-11cs.NE

A2SG:Adaptive and Asymmetric Surrogate Gradients for Training Deep Spiking Neural Networks

Yechan Kang, Yongjin Kweon, Mingyeong Seo, Sohee Park, Yeonguk Jeon, Jongkil Park, Hyun Jae Jang, Jaewook Kim, YeonJoo Jeong, Suyoun Lee, Seongsik Park

2026-06-11优化算法

针对深度脉冲神经网络用替代梯度训练时易出现尖锐损失景观和跨时间步梯度不一致的问题,论文提出 A2SG:自适应调节有效梯度窗口以降低空间梯度波动并对齐时间方向,同时采用非对称梯度给高膜电位神经元更大权重。作者将局部梯度变异与曲率联系起来,解释其趋向平坦极小值;在 CNN/Transformer SNN、静态与神经形态分类及分割任务上报告了稳定的精度和能效提升。

OSCS-SupCon: Orthogonal Sigmoid-based Common and Style Supervised Contrastive Learning for Robust Feature Disentanglement Figure 1
2026-06-11cs.CV

OSCS-SupCon: Orthogonal Sigmoid-based Common and Style Supervised Contrastive Learning for Robust Feature Disentanglement

Bin Wang, Fadi Dornaika

University of the Basque Country, 2IKERBASQUE

2026-06-11安全鲁棒

论文针对监督对比学习中 InfoNCE 容易稀释关键负样本、且类别相关 common 特征与风格 style 特征纠缠的问题,提出 OSCS-SupCon:用带可学习温度和偏置的 sigmoid 成对对比损失替代传统归一化对比,并结合风格距离约束与显式正交投影来解耦子空间。六个数据集和多种骨干上的实验显示其优于现有 SupCon 方法,CUB200-2011 上较 CS-SupCon 提升 3.4%,消融支持各组件有效。

CFCamo: A Counterfactual Detect-or-Abstain Framework for Camouflaged Object Detection Figure 1
2026-06-11cs.CV

CFCamo: A Counterfactual Detect-or-Abstain Framework for Camouflaged Object Detection

Suhang Li, Osamu Yoshie, Yuya Ieiri

are available at https://github.com/suhang2000/CFCamo., The authors are with the Graduate School of Information, Production and, Systems, Waseda University, Fukuoka, Japan., integrates multi-scale feature interactions in a collaborative

2026-06-11视觉感知

本文指出现有伪装目标检测多只在“目标存在”数据上训练评测,易产生无目标也强行检测的过检幻觉。CFCamo将任务改成成对的“检测或拒答”:用去除目标的反事实图像构建CF-COD,并以CSPO/CPR联合奖励约束原图检测、反事实图拒答。在CAMO-test上Sα较RL基线提升3.7个百分点,CF-COD成对准确率达80.0–90.8%,消融显示无反事实耦合时PA几乎崩溃。

LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment Figure 1
2026-06-11cs.CV

LAST: Bridging Vision-Language and Action Manifolds via Gromov-Wasserstein Alignment

Huaihai Lyu, Chaofan Chen, Yuheng Ji, Xiansheng Chen, Pengwei Wang, Shanghang Zhang, Changsheng Xu

MAIS, Institute of Automation, Chinese Academy of Sciences., Beijing Academy of Artificial Intelligence. 3Peking University.., ) typically discretize actions to leverage the scalability

2026-06-11视觉语言视觉感知

论文针对 VLA 中视觉语言语义空间近似线性、各向同性,而机器人 SE(3) 动作流形非欧且各向异性导致直接回归不适定的问题,提出 LAST:先用李代数映射和 B 样条将轨迹线性化为固定长度可加表示,再以层级离散和协方差白化构造与语义度量更兼容的局部动作 token。作者将其接入 AR token 预测与 diffusion 连续控制框架,称在仿真和真实机器人基准上提升收敛、性能与泛化,但具体增益归因仍需看完整实验细节。

Detecting AI-Generated Content on Social Media with Multi-modal Language Models Figure 1
2026-06-11cs.CL

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

Chenyang Yang, Shen Yan, Yibo Yang, Litao Hu, Yuchen Liu, Yuan Zeng, Hanchao Yu, Yinan Zhu, Sumedha Singla, Brian Vanover, Huijun Qian, Zihao Wang, Fujun Liu, Aashu Singh, Jianyu Wang, Xuewen Zhang

Carnegie Mellon University, 2Meta

2026-06-11视觉感知

针对社交媒体中逼真 AIGC 被用于垃圾信息、误导和欺诈,且传统检测器对新生成模型泛化差、单模态且缺少解释的问题,论文提出持续采集多平台图文/视频社交数据,并训练小型 LLaVA 式视觉语言模型 IFM-AIGCSPOTTER-3B,同时输出判定与理由。模型在公开基准达到或接近 SOTA,在内部多平台数据上表现稳健,并已用于推荐系统,带来正向用户参与影响;具体增益可能主要来自持续数据构建与多模态微调。

2026-06-10

122 篇
ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations Figure 1
2026-06-10cs.CV

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

2026-06-10视觉语言

ARM针对统一多模态模型中理解与生成常依赖不同视觉表征、带来结构割裂和推理开销的问题,提出语义对齐且可重建的离散视觉 tokenizer,并用单一7B自回归模型建模文本与图像 token,再通过偏好强化学习优化生成和编辑。实验显示其在MMMU/POPE、GenEval/WISE和GEdit-Bench上取得竞争或领先结果,且RL带来生成与编辑的跨任务协同。

Next Forcing: Causal World Modeling with Multi-Chunk Prediction Figure 1
2026-06-10cs.CV

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

2026-06-10强化学习

本文针对自回归视频世界模型在高帧率下只预测当前 chunk 易走“外观捷径”、训练慢且推理慢的问题,提出 Next Forcing:借鉴多 token 预测,用轻量 MCP 模块按因果链同时预测多个未来视频 chunk,并融合主模型多层特征提供长时程监督。其在 RoboTwin 达到 94.1/93.5% Clean/Random,50 fps 下收敛加速 2.3 倍,推理可加速 2 倍,并在 PhyWorld 与通用视频预训练上提升明显。

AnyMod-LLVE: Low-Light Video Enhancement with Modality-Agnostic Inference Figure 1
2026-06-10cs.CV

AnyMod-LLVE: Low-Light Video Enhancement with Modality-Agnostic Inference

Hangfeng Liang, Yutao Hu, Yanhan Hu, Xiaohan Wu, Wenqi Shao, Ying Fu

2026-06-10视觉感知

低照度视频中 RGB 细节严重退化,而事件/红外等多模态方法又依赖测试时传感器可用。本文提出 AMNet,将辅助模态视为可选线索,并用空间-频谱双门控 Translator 从低光 RGB 生成隐式辅助表征;同时用合成事件/红外进行大规模预训练以学习跨模态对应。实验显示其可处理任意模态组合,在缺失辅助模态时性能下降较小,并取得优于 RGB-only 基线的增强效果。

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization Figure 1
2026-06-10cs.CV

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Paul Hyunbin Cho (1), Jinhyuk Jang (1), SeokYoung Lee (1), Joungbin Lee (1), Siyoon Jin (1), Heeseong Shin (1), Jung Yi (1), Yunjin Park (2), Chulmin Park (2), Seungryong Kim (1) ((1) KAIST AI, (2) AIPARK)

2026-06-10生成模型

针对扩散式视频口型同步因全序列双向注意力和多步去噪难以实时部署的问题,Lip Forcing 将14B音频条件双向教师蒸馏为因果自回归学生,并基于教师轨迹中“CFG提升同步但损伤参考保真”的观察设计Sync-Window DMD、两步采样和SyncNet奖励。实验显示1.3B学生达31 FPS、较同尺度双向模型快17.6倍,14B学生较教师快39.8倍且保持相近保真度。

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories Figure 1
2026-06-10cs.CV

Data Journalist Agent: Transforming Data into Verifiable Multimodal Stories

Kevin Qinghong Lin, Batu EI, Yuhong Shi, Pan Lu, Philip Torr, James Zou

2026-06-10视觉语言

面向数据新闻从原始数据到可信多媒体报道耗时且难追溯的问题,Data2Story 将检索、统计、叙事、设计、编程、审稿与溯源 Inspector 组织成虚拟 newsroom,使数字、图表和事实主张可回连到代码、数据或 URL,并按题材生成交互/音视频等呈现。18 篇对照与 53 人评测显示,其在透明度和可审计性上有优势、整体具竞争力,但编辑角度、创意设计和信息呈现仍弱于人类记者。

Mean Flow Distillation: Robust and Stable Distillation for Flow Matching Models Figure 1
2026-06-10cs.CV

Mean Flow Distillation: Robust and Stable Distillation for Flow Matching Models

An Zhao, Shengyuan Zhang, Zhongjian Sun, Yixiang Zhou, Zejian Li, Ling Yang, Tianrun Chen, Lingyun Sun

2026-06-10生成模型安全鲁棒

该文针对 Flow Matching 采样依赖多步 ODE、难以用于实时场景的问题,提出 Mean Flow Distillation:不再匹配瞬时速度或转成 score,而用时间积分后的平均速度约束学生与教师轨迹,并引入辅助流跟踪学生分布以降低梯度方差。理论上给出均值流匹配可实现分布对齐的条件;实验在 4D occupancy 预测和文生图中实现高质量单步生成,nuScenes 上接近 10 步教师且优于多种蒸馏基线。

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning Figure 1
2026-06-10cs.CV

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao

Nanjing University

2026-06-10数据集/基准三维

针对现有基准很少评估“用代码生成可编辑参数化3D模型”的缺口,本文提出 P3D-Bench:覆盖 Text-to-3D、Image-to-3D 和 Assembly-3D,支持多种CAD/渲染代码格式,并从可执行性、几何、拓扑、MLLM判别和部件结构打分。实验显示,前沿模型虽能生成语义上相近的整体形状,但精确尺寸与参数几何仍差,装配任务最难,部件数量、几何和空间关系恢复尤其薄弱。

MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-On Figure 1
2026-06-10cs.CV

MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-On

Xiaoyu Han, Chenyang Wang, Jing Wang, Shunyuan Zheng, Quanling Meng, Shengping Zhang

Harbin Institute of Technology, 2 HiDream.ai Inc., Harbin Institute of Technology (Weihai) Qingdao Research Institute

2026-06-10视觉感知

这篇论文针对现有虚拟试衣多只做服装替换、难以表达塞衣角/外放等穿法变化的问题,提出 MOFA-VTON:用用户手绘曲线构造上下身双区域 mask,并在扩散式 Adapt-Net 中加入布局调整块,通过跨注意力分别对齐上下区域服装特征。实验在 VITON-HD 和 DressCode 上优于已有方法,同时展示了更细粒度、可交互的试衣布局控制。

UniPET: a universal network for high-quality PET image denoising across varied dose reduction factors Figure 1
2026-06-10cs.CV

UniPET: a universal network for high-quality PET image denoising across varied dose reduction factors

Zhiwen Yang, Yang Zhou, Haowei Chen, Hui Zhang, Dan Zhao, Bingzheng Wei, Yan Xu

2026-06-10视觉感知

针对低剂量 PET 去噪中剂量降低因子(DRF)变化导致专用模型失效、通用模型又易过平滑的问题,UniPET 将不同 DRF 视为域偏移,引入风格对齐网络 SAN 保留纹理细节,并用区域感知学习 RALS 只在风格化区域施加对抗约束。四个数据集及未知 DRF/中心测试显示,其在 PSNR、SSIM、感知质量和临床 ROI/SUV、病灶检出指标上优于现有通用方法,接近单 DRF 专用模型。

WorldOlympiad: Can Your World Model Survive a Triathlon? Figure 1
2026-06-10cs.CV

WorldOlympiad: Can Your World Model Survive a Triathlon?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

2026-06-10强化学习

针对现有视频生成评测偏重画质、难以判断世界模型是否真懂物理、三维结构和长期交互的问题,WorldOlympiad提出覆盖游戏、机器人与真实场景的统一长视频基准,将评测拆为物理、几何和交互三项,并结合分割、MLLM裁判与Gaussian splatting等指标。作者构建1000段高质量长视频并测试8个长视频生成流水线,结果显示当前模型在物理推理、3D一致性和长程可控交互上仍有系统性短板。

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football Figure 1
2026-06-10cs.AI

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

Andrew Kang, Priya Narasimhan

Carnegie Mellon University

2026-06-10强化学习规划控制数据集/基准三维

针对足球传球评价易受执行噪声和后续对抗结果偏置影响的问题,本文将其重构为类似 MCTS 的反事实搜索:从3D球轨迹推断踢球参数,采样局部执行扰动与全局替代选择,用球条件多智能体生成世界模型滚动到下一次触球,再以控球价值给出ΔPV分布。结果显示,改造自SMART的离散token自回归模型在仅7场公开数据上取得较强best-of-20预测精度,并能区分传球的稳健性、机会选择与执行超额,但真实增益仍受数据规模和世界模型误差限制。

Multimodal Brain Tumour Classification Using Feature Fusion Figure 1
2026-06-10eess.IV

Multimodal Brain Tumour Classification Using Feature Fusion

Wajih ul Islam, Muhammad Yaqoob, Javed Ali Khan, Volker Steuber

School of Physics, Engineering, School of Engineering and Computer Science, University of Hertfordshire, UK, symptoms, history, laboratory results, and imaging such as MRI. However, the majority of deep learning models, The publicly available dataset comprises 7,200 brain MRI images distributed across four tumor categories:, available MRI repositories, including the Sartaj dataset, BRaTS MRI images, and other open access sources [2,3], and testing split provided with the dataset was used in this study. Since patient identifiers were not available, label smoothing, gradient clipping, and mixed precision. We performed an experiment grid of 9 runs (3

2026-06-10视觉语言

针对脑肿瘤分类模型多依赖单一 MRI、难以模拟临床多源判断的问题,论文将原始 MRI 的 CNN 表征与同图像提取的 91 个放射组学特征经 MLP 编码后融合,比较拼接、门控和双向跨模态注意力。7200 张四分类数据上,多模态均略优于单模态,ResNet-50/DenseNet-121 加门控融合最高 96.13%;但增益较小,且两路信息同源,真实互补性与患者级泛化仍文中未充分说明。

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model Figure 1
2026-06-10cs.CV

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

Mahmood Alzubaidi, Uzair Shah, Raden Muaz, Ines Abbes, Nader Mohammed, Abdullatif Magram, Khalid Alyafei, Mowafa Househ, Marco Agus

2026-06-10视觉语言视觉感知

针对低资源地区产前超声缺少训练技师、现有模型需按分类/检测/分割分别部署且依赖专家指定标签的问题,FADA基于Qwen3.5-VL构建“先解释后标注”的统一视觉语言流程,并仅在标注任务上从4个超声/胎儿基础模型选择性蒸馏。FADA-SKD达到0.8820 Dice、0.7671 mAP@0.50,结构化解释合规率100%,专家验证显示人机协同时73.5%解释满分,0.8B量化版可在手机离线约60秒完成全流程。

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder Figure 1
2026-06-10cs.CV

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

2026-06-10视觉感知

IDEAL针对VFM/RAE离散化后深层语义特征缺少颜色、纹理和局部结构,导致重建保真度不足的问题,提出“深度对齐”思路:在量化前融合浅层外观特征与深层语义特征,并监督离散token同时恢复两者。其洞察是VFM层级存在重建—语义权衡。ImageNet上重建rFID达0.61,零样本分类80.89%,用于自回归生成时gFID为1.89。

A History-Aware Visually Grounded Critic for Computer Use Agents Figure 1
2026-06-10cs.AI

A History-Aware Visually Grounded Critic for Computer Use Agents

Jaewoo Lee, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Supriyo Chakraborty, Kartik Balasubramaniam, Sambit Sahu, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

University of North Carolina at Chapel Hill 1, University of Texas at Austin 3

2026-06-10视觉感知

针对 GUI 计算机使用智能体在长任务中易遗忘历史、且现有 critic 多依赖文本意图而难发现坐标/视觉错误的问题,论文提出 HiViG:用多模态 critic 将过往交互压缩为宏动作历史,并在执行前基于截图核验原始坐标与预测状态变化。其在 Web、移动和桌面基准上均优于标量奖励和普通语言 critic,相比最强基线使 Qwen3-VL-32B、Gemini-3-Flash 平均成功率分别提升 5.8% 和 9.0%。

U-TTT: Towards Generalizable PET Image Denoising via Test-Time Training Figure 1
2026-06-10cs.CV

U-TTT: Towards Generalizable PET Image Denoising via Test-Time Training

Zhiwen Yang, Jiayin Li, Hao Lu, Hui Zhang, Zihua Wang, Bingzheng Wei, Yan Xu

2026-06-10视觉感知

针对低剂量 PET 去噪模型在剂量、扫描仪变化下易因分布偏移失效的问题,U-TTT 将测试时训练层嵌入 U 形 3D 去噪网络,在推理中按单个测试样本做自监督特征重建适配;其关键设计是同时引入空间 S-TTT 与频率 F-TTT,分别修正结构退化和全局噪声谱。实验称其在 PET 去噪及未见剂量、未见扫描仪泛化上优于现有方法,但具体增益幅度需看正文表格。

An Uncertainty Estimation Framework for Dose Accumulation in Adaptive Radiotherapy: Application to CBCT-Guided Radiotherapy for Cervical Cancer Figure 1
2026-06-10cs.CV

An Uncertainty Estimation Framework for Dose Accumulation in Adaptive Radiotherapy: Application to CBCT-Guided Radiotherapy for Cervical Cancer

Cedric Hemon, Delphine Lebret, Jean-Claude Nunes, Valentin Boussot, Karine Peignaux, Nathalie Mesgouez-Nebout, Chantal Hanzen, Antoine Simon, Anaïs Barateau, Renaud de Crevoisier, Caroline Lafond

Department of Radiation Oncology, Centre Georges-Francois Leclerc, F-21000 Dijon, France

2026-06-10安全鲁棒

针对宫颈癌在线自适应放疗中器官形变导致累积剂量难以可信评估的问题,论文提出 IMPACT-DoseAcc,将分割特征驱动的配准不确定性以贝叶斯和集成两种方式传播到剂量累积与概率 DVH,并加入解剖变异加权。9例回顾实验中,集成不确定性与几何误差相关性较高,CTVt 的 pDVH 覆盖率达 96.3±3.9%,显示可为安全鲁棒的剂量解释提供校准信息。

IPSM-Bench: A New Intermediate Phase Segmentation Benchmark in Microstructure Images of Zinc-Based Absorbable Biomaterials Figure 1
2026-06-10cs.CV

IPSM-Bench: A New Intermediate Phase Segmentation Benchmark in Microstructure Images of Zinc-Based Absorbable Biomaterials

Jinglin Xu, Shangyan Zhao, Jiabo Wang, Xinghong Mu, Yulong Lei, Jiacheng Zhang, Hongbo Sun, Yageng Li

School of Artificial Intelligence, University of Science and Technology Beijing, China, School of Advanced Materials Innovation, University of Science and Technology Beijing, China, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd, School of Materials Science and Engineering, University of Science and Technology Beijing, China, Institute of Materials Intelligent Technology, Liaoning Academy of Materials, China, School of Big Data and Software Engineering, Chongqing University, China

2026-06-10视觉感知数据集/基准

面向锌基可吸收生物材料,论文针对中间相标注稀缺、低对比、小目标和形态复杂导致的显微图像分割难题,构建含1054张SEM/OM图像、20类合金和22179个专家标注实例的IPSM-Bench,并提出将梯度结构与灰度属性作为空间上下文先验注入SAM编码—解码流程的SCoP-SAM。实验显示其在该基准上达到SOTA,并在两个公开合金数据集上有较好泛化。

AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects Figure 1
2026-06-10cs.CV

AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects

Yiming Zhao, Haoyu Sun, Aoyu Wang

2026-06-10三维

本文针对任意类别3D资产动画仍依赖人工、现有网格形变或优化式骨骼方法推理慢且易抖动的问题,提出AnimaSpark。其核心洞察是许多基础运动的关节变换可近似限制在二维子空间:先将带骨骼模型渲染为含网格与骨架的多层图像,经视频生成与关键点跟踪得到2D运动,再提升为3D骨骼动画。实验显示其在文本-运动一致性、运动质量和计算效率上优于已有方法。

Quo Vadis, Visual In-Context Learning? A Unified Benchmark Across Domains and Tasks Figure 1
2026-06-10cs.CV

Quo Vadis, Visual In-Context Learning? A Unified Benchmark Across Domains and Tasks

Pradnya Halady, Jiale Wei, Zdravko Marinov, Alexander Jaus, Simon Reiß

Karlsruhe Institute of Technology

2026-06-10数据集/基准

针对视觉上下文学习评测多局限于预训练相近任务与域、难以检验真实测试时适应的问题,本文构建统一基准 VIBE,覆盖6类成像域、14个数据集、12项任务,并以确定性上下文采样、统一任务编码和后处理评测6个开源模型的106个一样本组合。结果显示现有 VICL 在跨域与新任务下仍存在明显局限和系统性失败模式,哪些增益来自架构、训练数据或策略仍需进一步拆解。

Architect-Ant: Editable Automatic Furnishing of Architectural Floor Plans Figure 1
2026-06-10cs.AI

Architect-Ant: Editable Automatic Furnishing of Architectural Floor Plans

Fedor Rodionov, Aleksandar Cvejic, Michael Birsak, John Femiani, Peter Wonka

King Abdullah University of Science and Technology (KAUST), Miami University, King Abdullah University of Science and Technology (KAUST) Saudi Arabia, Miami University United States of America

2026-06-10视觉感知

针对真实、可编辑家具标注稀缺导致自动户型布置难以兼顾几何合法性与功能性的痛点,Architect-Ant将家具布局建模为坐标化DSL序列,结合AntPlan-270伪标注、程序化空间推理轨迹和规则评分产生的偏好优化,再用Flux LoRA渲染为蓝图图像。实验显示其在CubiCasa等场景中规则分数多数房型优于监督基线,VLM评审在浴室、厨房较强,但卧室有退化,偏好构造仍影响质量。

Democratising Camera Trap AI: An Open-Source Model for Detecting UK Mammals Figure 1
2026-06-10cs.CV

Democratising Camera Trap AI: An Open-Source Model for Detecting UK Mammals

Paul Fergus, Philip Stephens, Russell A. Hill, Lee Oliver, Katie Appleby, Sarah Beatham, Naomi Davies Walsh, Stuart Nixon, Naomi Matthews, Chris Sutherland, Kelly Hitchcock

Liverpool John Moores University, Byrom Street, Liverpool, L3 3AF, UK., Durham University, Stockton Road, Durham, DH1 3LE., University of St Andrews, College Gate, St Andrews, KY16 9AJ., Nottingham Trent University, Southwell, NG25 0QF., and vehicles, drawn from a curated dataset of 48,165 labelled, with small expert teams labelling hundreds of thousands or, sensitive data and ensured consistent, expert labelling, but it is, citizen science is not available to everyone, even where it is available, volunteer effort is a finite resource, labelled dataset, train a deep classifier or detector on it, report, citizen-science labels [10]. Subsequent work refined the, reduce the labels required for new datasets [11]

2026-06-10视觉感知

针对英国相机陷阱图像量大、商业平台门槛高且全球模型不够贴合本地物种的问题,论文发布面向31类英国常见动物及人车等辅助类的开源YOLO26x检测器,并提供ONNX权重和本地/实时使用支持。模型基于十年多站点48,165个标注实例训练,在同源验证集上mAP@0.5达0.984、精确率0.988、召回率0.965;但跨全新站点泛化文中未充分说明。

PENet+: A Lightweight Residual Transformer Framework for Efficient Image Steganalysis Figure 1
2026-06-10cs.CV

PENet+: A Lightweight Residual Transformer Framework for Efficient Image Steganalysis

Jincheol AN, Dongsu Kim, Haneol Jang, YoungJoon Yoo

SNUAILAB, Seoul, Korea

2026-06-10视觉感知生成模型

针对原始 PENet 在 512×512 图像隐写分析中计算和内存开销较高、难以部署到受限设备的问题,PENet+ 保留自注意力拓扑以保证可复现性,重点通过激活感知 HPF 筛选、MobileNetV2 式倒残差骨干、SPP 到 FC1 分类瓶颈瘦身和 PReLU 保留弱负响应来降本。在 ALASKA2 JPEG QF90 协议下,参数最多减少 45.5%、FLOPs 约降 97%,精度损失很小;但文中也承认真实设备延迟和功耗尚未验证。

Beyond Model Size: Probing the Gaps in Visual in-Context Learning by Training a Tiny Model Figure 1
2026-06-10cs.CV

Beyond Model Size: Probing the Gaps in Visual in-Context Learning by Training a Tiny Model

Sunil Khatri, Steven Landgraf, Markus Ulrich, Simon Reiß

2026-06-10视觉感知

论文质疑视觉上下文学习是否必须依赖大模型和大数据,训练仅约100万参数、7万图像的 TinyVICL,并引入 Palette-aware Dice loss 作为极端反例。实验将其与最高大约7000倍参数的 VICL 模型比较,发现 TinyVICL 在训练一致任务的小分布偏移上可超过大模型,但在新任务编码与未见任务下表现暴露出现有评测对任务编码、预训练任务和指标选择过于敏感,真实自适应能力仍需更严格衡量。

Pose-ICL: 3D-Aware In-Context Learning for Pose-Controllable Subject Customization Figure 1
2026-06-10cs.CV

Pose-ICL: 3D-Aware In-Context Learning for Pose-Controllable Subject Customization

Xuan Han, Yihao Zhao, Mingyu You

2026-06-10规划控制三维

针对主体定制生成中换姿态后易出现姿态不准、身份与局部结构不一致的问题,Pose-ICL将多张图像-姿态参考作为上下文,并用SAPE把图像token锚定到体素包围盒表面坐标,引入显式三维几何约束且无需为新主体微调。文中在3D资产和真实主体上评测,显示其相较现有姿态控制与定制方法提升姿态精度和跨姿态一致性。

The 1st PortraitCraft Challenge: A CVPR 2026 Workshop Competition on Portrait Composition Understanding and Generation Figure 1
2026-06-10cs.CV

The 1st PortraitCraft Challenge: A CVPR 2026 Workshop Competition on Portrait Composition Understanding and Generation

Zijie Lou, Youyun Tang, Xiaochao Qu, Haoxiang Li, Ting Liu, Luoqi Liu, Xun Zhu, Zheng Zhang, Xi Chen, Miao Li, Ji Wu, Dizhe Zhang, Xian Ge, Sujia Wang, Ruiyang Zhang, Jiaming Wang, Xianshun Wang, Lu Qi, Boao Kang, Wei Zhou, Jinghui Sun, Zhenyu Yan, Jiliang Zhao, Rui Yang, Yipo Huang, Boyuan Liu, Shanglin Li, Zifan Xie, Yichen Zhang, Anlan Wang, Wenfeng Lin, Mingyu Guo, Dong Li, Xinghao Wang, Yanting Li, Shanzhao Tong, Shuai He, Qiu Zhou, Yongqi Yang, Taoyang Mu, Dianqiao Lei, Anlong Ming, Huadong Ma

2026-06-10视觉感知

针对现有人像美学基准多停留在全局打分、缺少构图结构化监督的问题,本文报告首届 PortraitCraft 挑战赛,将任务拆为构图理解与按结构化描述生成两条赛道,并提供约 5 万张带全局分、13 项属性、解释、VQA 与生成描述的人像数据。比赛吸引 295 支队伍,理解赛道最佳总分 0.8986,生成赛道采用自动与专家评分结合,结果显示细粒度属性推理和构图对齐生成是主要有效方向。

Improving Text-Instance Alignment Of Foreground Conditioned Out-Painting Via Customized Concept Embedding Figure 1
2026-06-10cs.CV

Improving Text-Instance Alignment Of Foreground Conditioned Out-Painting Via Customized Concept Embedding

Yihao Zhao, Xuan Han, Bin He, Mingyu You

2026-06-10视觉感知

该文面向电商产品图等前景条件外扩场景,指出背景中重复生成同类物体或边界溢出的伪影,源于文本中通用概念嵌入与具体前景实例外观不对齐。作者提出 CCE-Diffusion,用实例视觉特征定制概念嵌入,并以实例感知损失和语义保持提示模板约束其不破坏其他词义。实验显示该模块可插入 ControlNet、BrushNet、BLD 等方法,显著减少伪影并提升生成质量。

Listen, Look, and Learn: Learning Without Forgetting through SAM-Audio Figure 1
2026-06-10cs.CV

Listen, Look, and Learn: Learning Without Forgetting through SAM-Audio

Avi Gupta, Nilotpal Sinha, Vishnu Raj, Sambuddha Saha, Pratik Joshi, Koteswar Rao Jerripothula, Tammam Tillo

2026-06-10视觉感知

这篇论文关注音视频类别增量学习中基础模型仍会遗忘的问题:直接使用 SAM-Audio 的单模态特征或朴素融合,在连续任务上表现会明显退化。作者冻结 SAM-Audio 音频和视觉编码器,用音频特征通过交叉/自注意力引导视觉表示,并在特征与 logits 两级做蒸馏以保持旧类对齐关系。实验称在音视频 CIL 基准上持续优于现有方法,但具体增益与数据/模型规模的关系文中未充分说明。

XtrAIn: Training-Guided Occlusion for Feature Attribution Figure 1
2026-06-10cs.LG

XtrAIn: Training-Guided Occlusion for Feature Attribution

Thodoris Lymperopoulos, Ioannis Kakogeorgiou, Denia Kanellopoulou

2026-06-10视觉感知

论文针对传统输入遮挡归因依赖基线、易产生分布外样本且在非线性模型中会引发“归因漂移”的问题,提出 XtrAIn 将遮挡从输入空间转到训练轨迹中的特征相关参数更新,并给出 Xstep 与面向目标类的 XtrAIn+。在受控图像数据和 PAM50 乳腺癌分型实验中,该方法得到更干净、可解释的归因图,但主要验证集中在 FCNN 场景。

Advancing Wood Identification in the Philippines: Utilizing the Xylorix Platform for Efficient AI Model Development and Deployment for Five Key Species Figure 1
2026-06-10cs.CV

Advancing Wood Identification in the Philippines: Utilizing the Xylorix Platform for Efficient AI Model Development and Deployment for Five Key Species

Rosalie C. Mendoza, Vivian C. Daracan, Arlene D. Romano, Ronniel D. Manalo, Xin Jie Tang, Yi Hong Wong, Yong Haur Tay

Rosalie C. Mendoza* (College of Forestry and Natural Resources, University of the Philippines, Los Banos), Vivian C. Daracan (College of Forestry and Natural Resources, University of the, Philippines Los Banos), Arlene D. Romano (College of Forestry and Natural Resources, University of the Philippines Los Banos), Ronniel D. Manalo (College of Forestry and Natural, Resources, University of the Philippines Los Banos), Xin Jie Tang (Agritix), Yi Hong Wong, potential to deliver accurate, rapid, and scalable identification of timber species, thereby, varied lighting rather than preparing perfectly polished laboratory specimens. As a result, the, multiple field captures. Xylorix thus eliminates the need for bulky manuals, lab equipment, or

2026-06-10视觉感知

针对菲律宾非法采伐执法中木材树种鉴定依赖专家和设备、难以现场快速部署的问题,论文评估了无编程经验木材科学家借助 Xylorix 平台构建宏观横切面图像二分类器的可行性。其核心在于用手机 24×微距采集、多图样本级均分和平台化数据验证/部署闭环提升现场鲁棒性;在 260 个样本、10663 张验证图像上,五类硬木 AUC 为 0.969–1.000,四类达 AA 等级,Rain Tree 因阳性测试样本过少导致 AP 偏低。

Schmidt Decomposition-Based Methods for Efficient Quantum Image Encoding Figure 1
2026-06-10cs.CV

Schmidt Decomposition-Based Methods for Efficient Quantum Image Encoding

Ana-Maria Pangeva, Yassine Ferhi, Alexander Geng, Andreas Weinmann, Desislava Ivanova, Ali Moghiseh

Fraunhofer Institute for Industrial Mathematics ITWM, Technical University of Sofia, Institut d’Optique Graduate School - Université Paris-Saclay, Algorithms for Computer Vision, Imaging and Data Analysis Lab, Technical University of Applied Sciences

2026-06-10视觉感知

面向 NISQ 量子硬件上图像编码电路过深、CNOT 多且易受噪声影响的问题,论文将 Schmidt 分解低秩截断作为模型无关压缩手段,用少量主导纠缠成分近似 FRQI、QPIE、NEQR 状态。实验比较重建误差、视觉质量与资源消耗,显示存在精度—效率权衡,其中 FRQI 电路深度可降约 97%,仍保持近乎无损重建(MSE≈0.27)。

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination Figure 1
2026-06-10cs.CV

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

Taishan Li, Jiwen Zhang, Siyuan Wang, Xuanjing Huang, Zhongyu Wei

Fudan University, Shanghai, China, Shanghai Innovation Institute, Shanghai, China, Chinese University of Hong Kong, Hong Kong, China

2026-06-10视觉语言视觉感知

论文针对现有VLA评测默认目标物体可见、难以反映真实操作中场景遮挡的问题,构建了LIBERO-Occ,在LIBERO任务中加入可控的物理遮挡类型和强度。核心方法VIM不增加部署相机,而是从受遮挡主视角生成互补视角,并联合用于动作预测。实验显示强VLA在遮挡下明显退化,VIM在多任务套件、遮挡目标和严重程度上提升鲁棒性;但评测仍限于仿真,真实机器人效果文中未充分说明。

HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation Figure 1
2026-06-10cs.CV

HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation

Cong Wang, Zhentao Yu, Hongmei Wang, Weicong Liang, Zixiang Zhou, Zilin Yang, Jiarong Ou, Rui Chen, Yuan Zhou, Qinglin Lu

2026-06-10视觉感知优化算法

针对身份一致视频在大视角变化下易出现身份漂移、幻觉和参考视角错配的问题,HarmoView将多视角人像参考引入预训练DiT视频骨干,通过多层特征注入、可学习代理token和Jump-RoPE隔离跨身份干扰,并配合四阶段Progressive View Curriculum及LoRA合成数据管线缓解多视角数据稀缺。其在含100个案例、52个身份的基准上优于开源方法,并接近闭源视频生成引擎。

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks Figure 1
2026-06-10cs.CV

Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks

Miaoxin Cai, Guanqun Wang, Wei Zhang, Guangyao Zhou, Yin Zhuang, Tong Zhang, Hao Wang, He Chen, Jun Li

2026-06-10视觉语言视觉感知

面向遥感多模态大模型传感器与任务割裂的问题,Earth-OneVision 用 2B 自回归框架统一光学、SAR、红外、多光谱、时序、视频及跨传感器融合,覆盖 9 类任务;其关键在于多层视觉-语言对齐、空间输出序列化和分阶段跨模态适配,并构建约 3400 万 QA 训练集。在 24 个基准上,该模型总体追平或超过 4B–72B RS-MLLM,如光学 grounding P@0.5 达 87.52%、SAR VQA 达 80.68%。

IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation Figure 1
2026-06-10cs.RO

IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation

Jiawei Gao, Chaoqi Liu, Peilin Wu, Haonan Chen, Yilun Du

Harvard University, Stanford University

2026-06-10机器人规划控制

面向搬运重物、擦桌、书写等需要持续接触力的操作,论文指出仅靠模仿策略输出位姿会把任务规划与物体动力学耦合,难以泛化且显式力控依赖额外传感器。IMPACT 用关节测量和机械臂动力学在线估计外力,学习内部模型并在阻抗控制中前馈补偿,使高层轨迹规划与低层力补偿解耦。仿真和 Franka FR3 实验显示其在未见重量、外扰和混合位置-力任务上成功率、鲁棒性、安全性与能效优于隐式力控和数据增强基线。

Deep learning for echo sounder data Figure 1
2026-06-10cs.CV

Deep learning for echo sounder data

Ketil Malde

2026-06-10视觉感知

本文关注回声测深数据在水下观测与生物量评估中的自动解读需求,指出现有深度学习多直接套用图像领域的 CNN、U-Net、YOLO 等方法。核心洞察是声学回波不满足图像的平移等变、清晰边界和常规增强假设,频率关系、距离衰减与标注不确定性都需专门建模。文中未报告新的实验增益,主要结果是归纳现有方法成效有限,并强调标准格式、高质量数据集和明确评测目标是突破瓶颈。

SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning Figure 1
2026-06-10cs.CV

SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning

Wenhao Yan, Fengjia Guo, Zhuoyi Yang, Jie Tang

2026-06-10规划控制

本文针对角色动画中依赖骨架、掩码背景等中间表示导致遮挡、交互和非人驱动信息丢失的问题,提出 SCAIL-2:直接把驱动视频作为上下文输入,并用 in-context mask、模式化 RoPE 统一动画、替换和多角色任务;同时构建 MotionPair-60K 合成配对数据,并用 Bias-Aware DPO 修正手部等细节偏差。实验显示其在多类角色动画任务上优于现有方法,但部分增益可能主要来自数据合成规模与任务统一训练。

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use Figure 1
2026-06-10cs.CL

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

Singapore Management University, The Hong Kong Polytechnic University

2026-06-10视觉感知

针对MLLM虽擅长调用数字API、却未被系统检验能否在具身场景中使用真实工具的问题,论文提出PhysTool-Bench,将真实场景图像、任务指令、工具识别与按序选用规划拆开评测,覆盖2510个查询和2678种工具。13个主流模型结果显示,最佳模型工具识别F1仅58.7%,端到端EM仅21.0%,错误多来自功能相近工具混淆,说明瓶颈主要在物理功能常识而非单纯视觉感知。

A Multimodal RGB and Events Dataset for Hand Detection in First-Person View Figure 1
2026-06-10cs.CV

A Multimodal RGB and Events Dataset for Hand Detection in First-Person View

Bharghav Kota (1), Yulia Sandamirskaya (1) ((1) Zurich University of Applied Sciences, Wädenswil, Switzerland)

2026-06-10视觉语言视觉感知数据集/基准

面向移动机器人第一视角手部检测,RGB 相机受帧率、暗光运动模糊限制,而事件相机缺少训练数据。论文从 EgoHands 合成同步 RGB-事件数据 EventEgoHands,用 v2e 构造不同噪声、光照和尺度版本,并以微调 YOLOv8 补全框标注、插值到高时间分辨率事件流。基于 DAGr 训练后,最佳版本在手检测上达到 mAP50 0.931、mAP75 0.817、总体 mAP 0.697,显示多模态事件数据可支持高频手检测,但真实事件相机泛化仍需验证。

From Patches to Patients: A study of the tile-to-slide performance transferability in Digital Pathology Figure 1
2026-06-10cs.CV

From Patches to Patients: A study of the tile-to-slide performance transferability in Digital Pathology

Sofiène Boutaj, Leo Fillioux, Maria Vakalopoulou, Stergios Christodoulidis, Pierre Marza

2026-06-10视觉感知

数字病理中为每个临床队列筛选基础模型通常要完整跑 WSI 预处理、特征提取和 MIL 训练,成本高。本文系统检验 tile 级线性探测能否预测 slide 级表现,在19个病理基础模型、16个tile任务和42个WSI任务上比较排名相关性,并纳入ABMIL与均值池化。结果显示二者整体高度相关,说明编码器表征质量是主要因素;迁移稳定性更受队列规模和每张切片tile数影响,tile基准可用于低成本 shortlist,但最终临床验证仍需slide级评估。

Spatially Selective Self-Training for Unsupervised Building Change Detection Figure 1
2026-06-10cs.CV

Spatially Selective Self-Training for Unsupervised Building Change Detection

Wafaa I. M. Hussin, Zhi Lu, Anas M. I. Mohammed, Xiang Zhou, Ratiba A. H. Abubaker, Zhenming Peng

2026-06-10视觉感知

针对无标注双时相遥感中的建筑变化检测,论文指出直接把时间差异或冻结基础模型响应当作变化图,容易受外观、配准和非建筑变化干扰。SST-CD将这些差异改作候选伪标签,只在局部空间一致的可靠像素上自训练,并用轻量特征适配器和原型解码器稳定变化/未变化表征。在LEVIR-CD、WHU-CD、DSIFN-CD上F1分别达83.08%、91.69%、86.60%,优于既有无监督和免标注基线。

ZODS-RS -- Zero-training Oriented Detection & Segmentation for Remote Sensing Figure 1
2026-06-10cs.CV

ZODS-RS -- Zero-training Oriented Detection & Segmentation for Remote Sensing

Zuan Gu, Tianhan Gao, Langxu Zhao

Northeastern University, China

2026-06-10视觉感知

遥感与无人机图像存在尺度、旋转、密集小目标和跨平台域移,且逐任务训练成本高。ZODS-RS将冻结DINOv3特征、SAM2候选和记忆库组合成零训练闭式流程,用原型净化、旋转尺度等变匹配与不确定性感知像素合并统一输出HBB和实例掩码。其在xView/FAIR1M取得16.69/13.06 mAP,在自建UAV集mAP 47.30、mask mIoU 31.10,并显著提升小目标AP。

DD-INR: Dynamics-Driven Implicit Neural Representation for Accelerated Whole-Brain Functional MRI Reconstruction Figure 1
2026-06-10cs.CV

DD-INR: Dynamics-Driven Implicit Neural Representation for Accelerated Whole-Brain Functional MRI Reconstruction

Qiaoxin Li (MIND), Caini Pan (NEUROSPIN, MIND), Pierre-Antoine Comby (MIND, BAOBAB), Chaithya Giliyar (MIND), Philippe Ciuciu (MIND)

CEA NeuroSpin, Paris-Saclay University, CNRS BAOBAB, Gif-sur-Yvette, France, available at https://github.com/JoosenLi/DD-INR.

2026-06-10三维

针对高速全脑 fMRI 在强 k 空间欠采样下难以恢复仅 2–5% 的 BOLD 动态信号,DD-INR 将 3D+T 数据分解为时间聚合重建的静态背景与由 SIREN-INR 表示的动态残差,并用时间导数的空间 TV 约束强化血流响应的时空一致性。仿真和在体实验显示,其在图像质量、ROI 时间序列保真度和激活图检出上优于传统重建方法,但运动破坏静态背景假设等影响仍需进一步量化。

Patient-Level Diagnosis of Acute Myeloid Leukemia via Deep Learning Analysis of Bone Marrow Smear Figure 1
2026-06-10cs.CV

Patient-Level Diagnosis of Acute Myeloid Leukemia via Deep Learning Analysis of Bone Marrow Smear

Yuqi Ma, Tianyi Wang, Weihua Meng, Hongru Chen, Fajin Tao, Qunxian Lu, Lin An, Xiaodong Mo, Gen Yang

State Key Laboratory of Nuclear Physics and Technology, School of Physics, Peking University, Beijing 100871, China., Peking University People’s Hospital, Peking University Institute of Hematology, National Clinical Research Center for, Hematologic Disease, Beijing Key Laboratory of Hematopoietic Stem Cell Transplantation, Beijing 100044, China., Shanghai Dishuo Beiken Biotechnology Co., Ltd., Building 9-10, No. 3377 Kangxin Highway, Pudong New Area, Shanghai, single-cell interpretation is labor-intensive and patient-level diagnosis requires aggregation of many cellular, marrow smear images. The study included 258 patients from six anonymized centers, including a main cohort, of 169 patients from Centers 1-3 and an external validation cohort of 89 patients from Centers 4-6. A 16-, class-imbalance correction, center-border regularization, and morphology-assisted supervision. Cell-level, of 0.9076, 0.8696, and 0.9124 on Centers 4, 5, and 6, respectively., review of large numbers of cells and is affected by workload, center-specific practice, and observer variability., The study used de-identified bone marrow smear images collected from six centers. As shown in Figure 1, the total cohort contained 258 patients. Centers 1-3 formed the main cohort for training and patient-level five-

2026-06-10视觉感知

针对骨髓涂片人工阅片耗时且细胞级判断难以直接服务患者级 AML 诊断的问题,论文构建了从 YOLO 细胞分割、单细胞分类到患者级 CBLC 比例聚合的流程,并用复合“类原始细胞”替代严格白血病原始细胞定义以提高形态覆盖。该方法在六中心 258 名患者数据上验证,外部中心集成加权 F1 分别为 0.9076、0.8696、0.9124,显示一定跨中心泛化能力。

++nnU-Net: Scaling nnU-Net with Prefix-Based Data Augmentation Figure 1
2026-06-10eess.IV

++nnU-Net: Scaling nnU-Net with Prefix-Based Data Augmentation

Ana Sofia Santos, André Ferreira, Gijs Luijten, Naida Solak, Lisle Faray de Paiva, Behrus Hinrichs-Puladi, Jens Kleesiek, Jan Egger, Victor Alves

Center Algoritmi / LASI, University of Minho, Braga, Portugal, Institute for Artificial Intelligence in Medicine, University Medicine Essen, Essen, Germany, Institute of Medical Informatics / Dept. of Oral and Maxillofacial Surgery, University Hospital RWTH Aachen, Germany, Faculty of Computer Science, University of Duisburg-Essen, Essen, Germany

2026-06-10视觉感知

医学分割常受隐私与标注成本限制,nnU-Net在小样本下依赖数据量。++nnU-Net将基于图像配准的增强模块前置到预处理和训练之前,通过刚性+SyN形变生成配对图像与掩膜,并加入磁盘检查、二值合成掩膜和checkpoint。五个2D超声/X光数据集上Dice均优于基线,最高提升约22%,但HD95略增且过度扩增可能降性能。

Vector Map as Language: Toward Unified Remote Sensing Vector Mapping Figure 1
2026-06-10cs.CV

Vector Map as Language: Toward Unified Remote Sensing Vector Mapping

Yinglong Yan, Yunkai Yang, Haoyi Wang, Wei Fu, Linshan Wu, Honghu Pan, Shaobo Xia, Shanghang Zhang, Hao Chen, Leyuan Fang

2026-06-10视觉感知

针对遥感矢量制图中多类别实体结构异质、现有多边形或图表示难以同时表达实例边界与拓扑关系的问题,论文提出将矢量地图视为结构化语言的 VecLang,用 GeoJSON 式 SVL 统一描述语义、几何和拓扑,并通过先定位矢量化单元再生成文本的视觉语言框架及强化学习优化提升可执行性。作者构建含 5.4 万图像、80 万实例的 VecMap-Bench,实验显示其可统一处理建筑、水体和道路等对象,并具备较强跨数据集与开放词汇泛化能力。

Using the YOLOv12 Model for Verifying the Correct Color Sequence of Wires in Network Cables (Patch Cords) on the Production Line Figure 1
2026-06-10cs.CV

Using the YOLOv12 Model for Verifying the Correct Color Sequence of Wires in Network Cables (Patch Cords) on the Production Line

Amin Doroodchi, Danial Soleimany

Computer Department, Islamic Azad University, Beyza Branch, Beyza, Iran

2026-06-10视觉感知

面向网线生产中人工显微检查线序慢且易疲劳出错的问题,论文将YOLOv12用于RJ45接头内8根线的颜色与位置检测,并按从左到右序列与T568标准比对;核心更像是把单阶段检测器落地到产线质检,具体相对前代的增益来源文中未充分说明。在2500张显微图像上,报告检测精度约98%,整体平均准确率约95%,分类精度99%、召回98%,可实时替代人工判定。

Don't waste SAM Figure 1
2026-06-10cs.CV

Don't waste SAM

Nermeen Abou Baker, Uwe Handmann

- Ruhr West University of Applied Sciences - Dept of Computer Science

2026-06-10视觉感知

面向垃圾分割中遮挡、形变、透明物体和背景混淆导致 SAM 零样泛化不足的问题,论文系统比较 SAM-B/L/H 并仅微调 mask decoder,强调基础模型需结合下游数据而非直接丢弃。结果显示微调 SAM-ViT-H 在 ZeroWaste 与 TACO 上较 DeepLabv3+ 的 IoU 提升约 30 点,在 TrashCan1.0 上接近 SOTA,仅低 1.44 点。

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data Figure 1
2026-06-10cs.RO

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data

Dong Fang, Youjun Wu, Yuanxin Zhong, Rui Zhang, Yunlong Wang, Xiaosong Jia, Yu-Gang Jiang

Fudan University, Hefei University of Technology, Beijing University of Posts and Telecommunications

2026-06-10视觉感知

这篇论文针对灵巧手硬件形态、关节定义和数据格式不统一导致真实数据难以联合训练的问题,提出UDHM将人手与机器人手映射到共享22-DoF语义接口,并用UniDexTok在真实标准化关节状态上学习跨本体离散token,避免重定向和仿真依赖。实验中相较UniHM,MPJAE从15.63°降至0.16°、MPJPE从18.51mm降至0.18mm,并显示跨本体数据可提升重建及具备零/少样本适配能力。

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion Figure 1
2026-06-10cs.CV

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

Yu Lu, Junjie Yang, Piotr Koniusz, YuXin Song, Yi Yang

Zhejiang University, University of New South Wales (UNSW)

2026-06-10视觉感知生成模型

针对自回归长视频扩散中历史 KV cache 随时长线性增长、固定窗口或 sink token 难以兼顾短期细节与长期一致性的问题,FadeMem 基于“高频细节快衰减、低频结构慢衰减”的观察,将缓存组织为近密远疏的时间层级:新片段细粒度保留,旧相邻片段按幂律分配逐步合并为跨度级锚点。该方法无需改模型结构,在固定缓存预算下提升主体一致性、背景稳定性和时间连贯性。

Analyzing Training-Free Corruption Detection for Object Detection Datasets Figure 1
2026-06-10cs.CV

Analyzing Training-Free Corruption Detection for Object Detection Datasets

Christian Sieberichs, Simon Geerkens, Thomas Waschulzik, Viswanathan Ramesh, Alexander Braun

University of Applied Sciences Düsseldorf, Goethe University Frankfurt

2026-06-10视觉感知数据集/基准

针对目标检测数据集中标注错误会同时涉及类别与边框位置、而现有免训练特征空间审计多停留在分类任务的问题,本文将 SimiFeat 式邻域一致性分析改到实例级检测标注,并在 VOC2012、KITTI 上结合多种预训练嵌入、合成与真实噪声评估。结果显示该方法能较稳定发现语义错标,但对位置扰动和边框错误识别能力有限,且受嵌入模型选择与类别不均衡影响明显。

Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving Figure 1
2026-06-10cs.CV

Envision4D: Envisioning Visual Futures via Feed-forward 4D Gaussian Splatting for Autonomous Driving

Qi Song, Yifei He, Chi Zhang, Zheng Fu, Xuhe Zhao, Mengmeng Yang, Kun Jiang, Rui Huang, Diange Yang

Tsinghua University 2 \quad{}^{2} The Chinese University of Hong Kong, Shenzhen

2026-06-10视觉感知三维

面向自动驾驶中动态场景未来演化预测,Envision4D针对现有前馈4DGS偏重插值、依赖未来位姿或线性运动假设的问题,提出自监督、无未来位姿的前馈外推框架;通过迭代去噪预测未来相机位姿,结合层内时间注意力、条件运动提升与渐进训练来建模非线性运动并抑制误差累积。实验显示其在未来视角合成和动态场景外推上达到SOTA,并具备一定开放场景泛化能力。

STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model Figure 1
2026-06-10cs.CV

STEDiff: Strengthening Text Embedding for Text-to-Image Alignment in Diffusion Model

Hailan Zhang, Haipeng Liu, Bo Fu, Yang Wang

2026-06-10视觉感知生成模型

针对复杂提示下扩散文生图常出现实体遗漏、属性或子对象绑定错误的问题,STEDiff从CLIP文本嵌入入手,利用[EOT]聚合的全局上下文和子句级语义增强,将强化后的token替换回原提示,并在早期去噪中加入语义增强与熵约束以减少语义泄漏。其无需训练或布局先验,在T2I-CompBench上相较多种基线提升了复杂多对象、多属性场景的语义一致性与生成完整性。

Kwai Keye-VL-2.0 Technical Report Figure 1
2026-06-10cs.CV

Kwai Keye-VL-2.0 Technical Report

Kwai Keye Team, Bin Wen, Changyi Liu, Chengru Song, Chongling Rao, Guowang Zhang, Han Li, Haonan Fan, Hengrui Ju, Jiankang Chen, Jiapeng Chen, Jiawei Yuan, Kaixuan Yang, Kaiyu Jiang, Kun Gai, Lingzhi Zhou, Na Nie, Sen Na, Tianke Zhang, Tingting Gao, Xuanyu Zheng, Yulong Chen, Fan Yang, Haixuan Gao, Lele Yang, Mingqiao Liu, Muxi Diao, Qi Zhang, Qile Su, Wei Chen, Wentao Hong, Xingyu Lu, Yancheng Long, Yankai Yang, Yingxin Li, Yiyang Fan, Yu Xia, Yuzhe Chen, Ziliang Lai, Chuan Yi, Haonan Jia, Tianming Liang, Weixin Xu, Xiaoxiao Ma, Yang Tian, Yufei Han, Feng Han, Hang Li, Jing Wang, Jinghui Jia, Junmin Chen, Junyu Shi, Ruilin Zhang

2026-06-10视觉感知

针对小时级视频带来的超长上下文、冗余信息与高算力成本,以及多任务对齐易遗忘基础推理的问题,Keye-VL-2.0 将 DSA 适配到 GQA 多模态 MoE 架构,并结合跨模态多教师 on-policy 蒸馏、Context-RL/Video-RL。模型以 30B 总参数、3B 激活参数支持 256K 上下文,在 TimeLens、Video-MME-v2、LongVideoBench 等长视频理解和时序定位基准上达到同规模领先表现。

ManiSplat: Manipulation Trajectory Synthesis from Monocular Video via Decoupled 3D Gaussian Splatting Figure 1
2026-06-10cs.CV

ManiSplat: Manipulation Trajectory Synthesis from Monocular Video via Decoupled 3D Gaussian Splatting

Wenhao Hu, Haonan Zhou, Liu Liu, Yun Du, Xinjie Wang, Ziang Li, Zhizhong Su, Gaoang Wang

Zhejiang University

2026-06-10机器人视觉感知规划控制三维

针对现有动态 3DGS 难以处理机器人主动操作中接触、突变位姿和对象级可控性的问题,ManiSplat 从单目第一视角操作视频重建可仿真的高斯数字孪生。其核心是用场景图解耦机器人、物体与背景,并按 Motion/Skill 阶段做时空对齐与光度-几何联合优化;实验显示可获得更稳定高保真的交互场景重建,并支持单示教轨迹增广和下游策略学习。

ChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary Refinement Figure 1
2026-06-10cs.CV

ChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary Refinement

Hao Liu, Ruping Cao, Kun Wang, Zhiran Li, Fan Liu, Yupeng Hu, Liqiang Nie

Shandong University, Southeast University, Harbin Institute of Technology (Shenzhen)

2026-06-10视觉感知

图表理解中,直接由多模态模型生成 CSV 和摘要容易出现数值错位、结构不完整或事实幻觉。ChartLens 的核心思路是把任务改为“先生成、再验证纠错”:用 LoRA 适配的 Granite-Vision 初始化结果,SAVC 检查并修正表格结构与数值一致性,TRSR 结合 OCR 文本保留标题、图例和关键数值证据来精修摘要。在 DataMFM Track 2 测试集上取得 69.10 总分并排名第一,但剩余列对齐错误说明结构推理仍是瓶颈。

Leveraging Metric Depth for Relative Depth Prediction Figure 1
2026-06-10cs.CV

Leveraging Metric Depth for Relative Depth Prediction

Xiaoyang Bi, Shuaikun Liu, Zhaohong Liu, Yuxin Yang, Zhe Zhao, Mengshi Qi, Liang Liu, Huadong Ma

Team BUPT MICLAB, Beijing Key Laboratory of Intelligent Telecommunications Software and Multimedia, Beijing University of Posts and Telecommunications

2026-06-10视觉感知

针对足球视频相对深度标注少、单目深度估计难的问题,论文将视角相近场景中的相对深度近似视为0–256米的度量深度,冻结预训练Depth Anything编码器,仅训练ZoeDepth/LocalBins解码器,并主要依赖水平翻转与学习率、轮数调参。在SoccerNet 2025挑战集上取得RMSE 2.68×10^-3;增益可能主要来自强预训练模型和训练配置,方法新意相对有限。

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency Figure 1
2026-06-10cs.CV

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

Xinrui Wu, Lichen Huang

2026-06-10视觉感知强化学习数据集/基准

现有图像生成评测多看单帧对齐,难发现动作过程中的身份漂移、因果错序和状态跳变。ImageTime将动作拆成四个有序关键帧,构建覆盖22域、375类动作、750案例的时空一致性基准,并用L0–L6能力树与结构化VLM裁判定位失败。多模型测试显示,当前图像模型虽能生成合理静态画面,但在跨帧保持同一世界、交互几何和因果约束上仍频繁失稳。

SSR-Merge: Subspace Signal Routing for Training-Free LoRA Merging in Diffusion Models Figure 1
2026-06-10cs.CV

SSR-Merge: Subspace Signal Routing for Training-Free LoRA Merging in Diffusion Models

Zhengxuan Wei, Yi Dong, Zonghui Li, Xianhui Lin, Xing Liu, Hong Gu, Shaofeng Zhang, Wenbin Li, Qi Fan

2026-06-10生成模型

针对扩散模型中多个 LoRA 直接合并易在共享参数空间产生干扰、导致能力互相破坏的问题,论文提出 SSR-Merge:不做参数算术叠加,而是在拼接后的低秩子空间内用二阶统计构造无训练路由器,先去相关再导向各任务子空间,并可重参数化为标准 LoRA、无额外推理开销。作者给出其等价于 OLS 投影的最优性证明和流式统计实现;实验显示其在多任务 LoRA 合并中优于 TIES、DARE 等方法且效率相近。

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations Figure 1
2026-06-10cs.RO

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

Recently, robotic foundation models choose to mine the vast pool of human videos available on-, line [11, 12, 13, 14] as a scalable substitute for robot data. They learn visual or reward representations, or pretrain Vision-Language-Action (VLA) models on hand-action labels distilled from egocentric, available at internet scale.

2026-06-10强化学习模仿学习

针对灵巧手机器人示教昂贵、而人类视频到机器人存在 embodiment gap 的问题,论文提出 Dexterous Point Policy:用手腕与五指尖的统一 3D 关键点同时表示观测和动作,并加入指尖接触预测补足力信息,先在约百万自我中心人类视频上预训练再用少量任务人类示教微调。真实双臂灵巧手实验中无需任何机器人示教,8 类抓取、放置与工具使用任务成功率达 75.0%,显著高于 VLA 基线的 1.0%。

GaussTrace: Provenance Analysis of 3D Gaussian Splatting Models with Evidence-based LLM Reasoning Figure 1
2026-06-10cs.CV

GaussTrace: Provenance Analysis of 3D Gaussian Splatting Models with Evidence-based LLM Reasoning

Haoliang Han, Ziyuan Luo, Renjie Wan

2026-06-10三维

针对3D Gaussian Splatting资产在多方传播、反复编辑后难以追溯来源的问题,GaussTrace不再依赖图像取证式痕迹匹配,而是将溯源建模为证据推理:从3DGS参数提取属性统计,并用假设编辑模拟提供可能变换证据,再交给LLM生成有向溯源图和边解释。实验在44个模型构成的数据集上显示,其在边与图重建指标上优于渲染图像、几何距离和规则搜索基线,且无需训练或编辑历史。

Geometry-Aware Reinforcement Learning for 2D Irregular Nesting Figure 1
2026-06-10cs.LG

Geometry-Aware Reinforcement Learning for 2D Irregular Nesting

Auguste Lehuger, Guillaume Henon-Just

2026-06-10强化学习

针对无边界、可连续旋转平移的二维不规则排样中传统启发式难以利用多边形几何、主要靠搜索试探的问题,本文将组合优化强化学习引入该任务,提出可直接编码连续向量多边形并进行跨多边形注意力的 Polygons Transformer,同时发布地理轮廓数据集和评测基准。实验显示,训练出的智能体在面积利用率上可接近当前启发式求解器 Sparrow,说明几何感知策略能为精细空间排样提供有效搜索先验。

Globally Localizing Lunar Rover in Pixels via Graph Alignment Figure 1
2026-06-10cs.CV

Globally Localizing Lunar Rover in Pixels via Graph Alignment

Mao Chen, Xu Yang, Chuankai Liu, Xiangkai Zhang, Xiaoxue Wang, Zheng Bo, Zuoyu Zhang, Zhiyong Liu

2026-06-10视觉感知

针对月球车在无 GNSS 环境中依赖里程计/惯导会长期漂移、跨视角匹配又受月面重复地貌和视角差异干扰的问题,论文提出 WARG,用共享特征的图表示与几何重投影匹配多实体结构,而非逐点找相似外观。在 LuSNAR 上误差 0.32 m,南极仿真零样本 3.63 m,玉兔二号实测结合全景降至 1.68 m,且仅 1.56M 参数、5.49 Hz。

Segment and Select: Vision-Language Segmentation in 3D Scenarios Figure 1
2026-06-10cs.CV

Segment and Select: Vision-Language Segmentation in 3D Scenarios

Yulin Chen, Zhihang Zhong, Yuenan Hou

Shanghai AI Laboratory 2 University of Science and Technology of China, Shanghai Jiaotong University

2026-06-10视觉语言视觉感知三维

本文针对3D视觉语言分割中超点表示边界粗糙、语义混杂的问题,提出SEGA3D“先分割候选、再选择验证”的范式:用细粒度候选掩码构建假设空间,结合LLM生成的语义与空间线索进行候选筛选,并通过Loopback Verification细化和重排掩码。在ScanRefer、ScanNet、Matterport3D上表现有竞争力,相比Reason3D在ScanNet和Matterport3D的mIoU分别提升8.38和5.34点。

Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction Figure 1
2026-06-10cs.CV

Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction

Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu

2026-06-10视觉语言视觉感知

针对视觉语言预训练模型黑盒迁移攻击在异构目标上易受替代模型依赖影响的问题,论文提出“替代模型特定偏差”视角:弱语义输入上的梯度可估计这种偏差。DeBias-Attack用原图主分支与均值图加噪参考分支做梯度投影校正,并结合上下文文本替换生成图文对抗样本。实验显示其在多类VLP模型、下游任务及开闭源多模态大模型上提升迁移攻击效果,异构模型场景收益更明显。

PrismAvatar: Pseudo-Multiview Reconstruction and Subpixel Prism Rendering for Real-Time Stereoscopic Communication Figure 1
2026-06-10cs.CV

PrismAvatar: Pseudo-Multiview Reconstruction and Subpixel Prism Rendering for Real-Time Stereoscopic Communication

Chufeng Fang, Dongdong Teng, Lilin Liu

Sun Yat-sen University, Sun Yat-sen University Guangzhou China

2026-06-10三维

面向免眼镜3D远程交流,单目头像虽能正面重建,却在透镜多视区暴露头发、耳朵、下颌和颈部伪影。PrismAvatar的关键洞察是把自然转头当作偏航匹配的伪多视监督,并用头发/头部掩膜、轮廓损失与正则抑制漏透明和鬼影;系统可将32视图编码到4K柱透镜屏,实时跟踪版达10.65 FPS,蒸馏驱动后达38.49 FPS。

GRAR: Glass-induced Reflection Artifact Removal in LiDAR Point Clouds Figure 1
2026-06-10cs.CV

GRAR: Glass-induced Reflection Artifact Removal in LiDAR Point Clouds

Wanpeng Shao, Zeyi Guo, Bo Zhang, Yifei Xue, Tie Ji, Yizhen Lao

2026-06-10三维

面向城市TLS点云中玻璃幕墙引发的虚假反射点,GRAR指出传统方法过度依赖完整玻璃观测和理想镜面对称,难以处理玻璃“空洞”和畸变反射。方法先用多模态视觉基础模型生成玻璃掩码,并结合几何约束细化与补全玻璃区域,再提出基于真实激光反射几何的RE-LGGS描述子,联合局部/全局结构和方向一致性识别虚拟点。多组公共TLS数据集实验显示其较现有方法更稳健。

Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning Figure 1
2026-06-10cs.CV

Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning

Zihan Meng, Dexiang Hong, Weidong Chen, Ziyu Zhou, Bo Hu, Zhendong Mao

2026-06-10视觉语言

面向音视频描述中多模态 token 过多、LLM prefill 注意力开销二次增长的问题,论文指出注意力/显著性等代理分数与真实描述贡献相关性弱,且音频与视觉贡献具有非加性。AVEX-Prune 用冻结描述模型的 CIDEr 变化监督强化学习剪枝策略,通过同模态和跨模态 token 交换学习交互价值;在 AVCaps 上仅保留 40% token 时,VILA 1.5-8B 与 VideoLLaMA 2 基本保持全 token CIDEr,并报告 FLOPs 降低超过 55%。

GUI-AC: Enhancing Continual Learning in GUI Agents Figure 1
2026-06-10cs.CV

GUI-AC: Enhancing Continual Learning in GUI Agents

Can Lin, Tao Feng, Hangjie Yuan, Dan Zhang, Yifan Zhu, Zhonghong Ou

Beijing University of Posts and Telecommunications, Tsinghua University, Zhejiang University, National University of Singapore

2026-06-10视觉感知

本文关注 GUI 智能体在持续遇到新域名、分辨率和界面布局时,强化微调容易出现奖励震荡、定位退化与探索坍塌的问题。作者用优势—概率四象限分析指出关键在过度自信旧动作和被裁剪抑制的新探索动作,并提出 GUI-AC,以 grounding certainty 驱动自适应优势降噪和动态裁剪放宽探索。实验称其在 ScreenSpot-V1/V2/Pro 及跨域、跨分辨率持续学习中超过现有基线,并提升训练稳定性。

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching Figure 1
2026-06-10cs.CV

LAFP: Preserving Latent Action Structure in Latent Policy Learning via Flow Matching

Jiexi Lyu, Xizhou Bu, Qingqiu Huang, Chufeng Tang, Xiaoshuai Hao, Hongbo Wang, Wei Li

2026-06-10生成模型强化学习

针对潜在动作学习中动作标注稀缺、行为克隆易把多模态潜在动作压成单峰并破坏预训练结构的问题,LAFP将流匹配用于潜在策略蒸馏,并在动作解码器训练时引入推理期插值以缓解随机潜变量与物理动作错位。实验在16个Procgen任务上显示其较既有方法更稳定,成功率最高提升约10–15%,额外训练和推理开销低于1倍。

PathRelax: Parallel-Path Relaxed Speculative Jacobi Decoding for Accelerating Auto-Regressive Text-to-Image Generation Figure 1
2026-06-10cs.CV

PathRelax: Parallel-Path Relaxed Speculative Jacobi Decoding for Accelerating Auto-Regressive Text-to-Image Generation

Haodong Lei, Hongsong Wang, Bingxuan Dai, Pan Zhou

College of Software Engineering, Southeast University, School of Computer Science and Engineering, School of Cyber Science and Engineering, School of Computing and Information Systems, Singapore Management University

2026-06-10视觉感知

本文针对自回归文生图需逐 token 生成、长图像序列导致推理延迟高的问题,提出 PathSpec:用多序列草稿树替代传统链式草稿以并行探索候选路径,并通过跨路径概率聚合与 relaxed verification 利用语义相近分支提升接受率。实验在 Parti-Prompts、MSCOCO2017、T2ICompBench 上分别达到 4.14×、3.95×、4.18× 加速,且声称基本保持图像质量。

5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning Figure 1
2026-06-10cs.CV

5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

Yifan Zhu, Can Lin, Hangjie Yuan, Zixiang Zhao, Pengfei Zhang, Tao Feng, Zhonghong Ou

2026-06-10视觉语言

论文关注多模态大模型 PEFT 虽省参数但常收敛到尖锐极小值、影响下游泛化的问题。核心洞察是梯度中仅少量“尖锐维度”主导泛化需求,因而提出 FlatPO,按梯度分布识别并优先平滑约 5% 关键维度,而非对全部参数做统一平坦化。实验覆盖 LoRA、Prefix/Prompt 等多种 PEFT,报告其在多模态任务上带来稳定泛化提升,但具体增益幅度需结合各任务表格判断。

3D-CoS: A New 3D Reconstruction Paradigm Based on VLM Code Synthesis Figure 1
2026-06-10cs.CV

3D-CoS: A New 3D Reconstruction Paradigm Based on VLM Code Synthesis

Yuhao Wang, Puyi Wang, Linjie Li, Zhengyuan Yang, Kevin Qinghong Lin, Yu Cheng

Shanghai Jiao Tong University, The Chinese University of Hong Kong, University of Oxford

2026-06-10视觉语言三维

针对 NeRF、点云、网格等三维表示难以程序化控制和局部编辑的问题,3D-CoS 将单图三维重建表述为由 VLM 合成可执行 Blender 代码,并系统比较提示、RAG、few-shot 与部件级 Agent 流程。实验显示该范式可恢复较结构化几何,最佳 Gemini/Agent 配置在部分指标上接近 InstantMesh,但总体仍未替代专用网格重建;其优势主要体现在文本驱动局部编辑中,编辑保真和未编辑区域保持优于点云编辑基线。

Geometric Coastline Localization using Vision-Language Models Figure 1
2026-06-10cs.CV

Geometric Coastline Localization using Vision-Language Models

Rafia Malik, Bernhard Pfahringer, Karin Bryan, Mark Dickson, Eibe Frank

2026-06-10视觉语言视觉感知

论文针对海岸线监测中“像素分割训练、矢量几何使用”的表示错配,主张将海岸线直接建模为几何边界而非后处理轮廓。作者基于 GeoChat/LLaVA 构建 CoastlineVLM-7B,同时判断海岸线存在、代理类型并输出折线边界,并用 Chamfer、Hausdorff、Fréchet、EMD 等距离指标评估。实验显示其相比分割模型提升几何对齐,Hausdorff 从 37.74 m 降至 31.84 m,EMD 从 21.12 m 降至 17.32 m。

Few-step Generative Models as Lossy Compression Figure 1
2026-06-10cs.CV

Few-step Generative Models as Lossy Compression

Fuma Kimishima, Jinjia Zhou

2026-06-10生成模型

本文针对 DiffC 扩散压缩因多步前向/反向过程导致编解码慢的问题,探讨将 Rectified Flow、CTM 与 MeanFlow 等少步生成模型纳入同一 RCC 压缩框架。核心做法是把速度场或 EDM 噪声参数化转成 RCC 所需的后验与共享分布参数,并用局部高斯近似补齐 CTM 的概率形式,无需重训预训练模型。CIFAR10、ImageNet 64×64 上显示其在低码率下编解码更快、重建更真实;高分辨率结论仍较初步。

Vision-Assisted Foundation Model for Solving Multi-Task Vehicle Routing Problems Figure 1
2026-06-10cs.CV

Vision-Assisted Foundation Model for Solving Multi-Task Vehicle Routing Problems

Shuangchun Gui, Zhiguang Cao, Wen Song, Yew-Soon Ong

2026-06-10视觉感知

多任务车辆路径规划中,不同约束组合使单任务神经求解器难以复用,纯图输入也不易显式捕捉空间需求与时间窗等复杂关系。论文提出 VaFM,将为约束定制的视觉图像经 CNN 编码后与图节点表示融合,并用混合交叉注意力自适应整合局部/全局视觉语义,再以约束感知辅助损失缓解像素不均衡。实验覆盖 16 种 VRP 变体,报告相较现有多任务图求解器整体更优,复杂约束场景增益更明显。

Time-frequency localization of bird calls in dense soundscapes Figure 1
2026-06-10cs.SD

Time-frequency localization of bird calls in dense soundscapes

Simen Hexeberg, Fanghui Tong, Hari Vishnu, Mandar Chitre

2026-06-10视觉感知

针对被动声学监测中传统分类器只能判断时间窗内物种存在、难以给出鸟鸣精确时频位置的问题,论文将密集声景中的鸟鸣检测转化为声谱图目标检测,训练 YOLO11,并提出浏览器标注工具与更适合模糊声学边界的 IoMin 指标。实验中最佳模型在新加坡分布内数据上将 IoMin@50 F1 从 42.1% 提升到 81.8%,在夏威夷分布外录音上也优于能量基线 58.6% 对 48.6%。

CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence Figure 1
2026-06-10cs.CV

CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence

Yiming Zhang, Ruoxuan Cao, Zhihang Zhong

Shanghai Jiao Tong University, Cornell University

2026-06-10视觉感知

针对长视频空间理解中单个 MLLM 受上下文长度限制、易遗漏或错置物体的问题,CoCoSI 将视频切分给多智能体分别构建局部认知地图,再通过局部—全局协同、原子提交和跨智能体验证合并为一致的空间记忆;该方法无需改模型或微调,可直接用于现成 MLLM,并在两个空间理解基准上优于单智能体、通用多智能体和其他免训练方案。

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark Figure 1
2026-06-10cs.CL

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

Pratham Singla, Shivank Garg, Vihan Singh, Paras Chopra

Indian Institute of Technology Roorkee

2026-06-10视觉语言视觉感知规划控制数据集/基准

论文针对 VLM 在视觉问答中可能“看图”不足、更多依赖问题措辞和常识先验的隐性失效,构建了固定 540 张图像、为每图生成四种措辞变体的受控基准,并用无图消融衡量文本先验依赖。结果显示 11 个模型在最少文本泄漏的 Vision-Grounded 变体上均下降,开源模型跌幅更大;无图时其准确率降至 1–9%。匹配构造方式的示例可恢复部分性能,GRPO+LoRA 微调也带来跨变体和 OOD 增益,说明该依赖可测且可部分缓解。

Efficient RWKV-based Representation Learning for 3D Point Clouds Figure 1
2026-06-10cs.CV

Efficient RWKV-based Representation Learning for 3D Point Clouds

Yun Liu, Xuefeng Yan, Liangliang Nan, Xianzhi Li, Peng Li, Zhe Zhu, Honghua Chen, Mingqiang Wei

2026-06-10三维

面向点云中 Transformer 自注意力开销随点数二次增长、原生 RWKV 又缺乏局部几何与空间关系建模的问题,论文提出 P-RWKV 块,并以 LPE 扩展邻域感知、SCE 用门控融合空间上下文,同时采用双向 WKV 保持线性复杂度。基于该模块的自监督框架 PointER 在补全、分类和细粒度分割等任务上达到与 Transformer/Mamba 方法相近的效果,并报告更低 FLOPs、训练/推理时间和最低推理延迟。

FSS-Net: Frequency-Spatial Synergy Network with Wavelet Attention for Carotid Artery Ultrasound Segmentation Figure 1
2026-06-10cs.CV

FSS-Net: Frequency-Spatial Synergy Network with Wavelet Attention for Carotid Artery Ultrasound Segmentation

Jiawei Liu, Zhijiang Wan, Junhua Hu, Rongli Zhang, Zhongbiao Xu, Yankun Cao, Yuan Chen, Jin Hong

. Ji luan Academy, Nanchang University, Nanchang 330031, China, . School of Information Engineering, Nanchang University, Nanchang 330031, China, . State Key Laboratory of Water Cycle and Water Security, China Institute of Water Resources and Hydropower, . Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong, Pok Fu, . Department of Radiotherapy, Guangdong Provincial People's Hospital, Guangdong Academy of Medical Sciences, Southern Medical University, Guangzhou 510080, China, . Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University, Jinan 250101, China, . Department of Pediatrics, Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, screening [4-6], manual measurement and delineation are labor-intensive, driving the demand for, motivation, we construct a frequency-spatial collaborative framework consisting of three complementary

2026-06-10视觉感知

针对颈动脉超声在机器人/自动化筛查中受散斑噪声、低对比度和边界模糊影响而难以精确分割的问题,FSS-Net将小波频域分解嵌入U-Net式编码器-解码器,用CSWA联合通道、空间与频率注意抑噪,WEB建模全局上下文,LAEF用拉普拉斯先验补偿边缘。实验报告在颈动脉数据上DSC达96.46%,低SNR下仅下降0.2%,并有乳腺超声迁移验证。

PF-Trans: Physics-Embedded Frequency-Aware Transformer for Spectral Reconstruction Figure 1
2026-06-10cs.CV

PF-Trans: Physics-Embedded Frequency-Aware Transformer for Spectral Reconstruction

Yuzhe Gui, Tianzhu Liu, Yanfeng Gu, Xian Li

2026-06-10三维

面向BFA快照高光谱成像中由周期掩膜引起的严重频谱混叠,PF-Trans不再把重建仅当作空间域去噪,而是将物理成像模型注入输入,并用灰度一致性约束闭环校验;同时在Transformer中加入并行FFT频域分支,以区分掩膜伪影和真实纹理。多数据集实验显示其达到SOTA,GF-5上海数据集PSNR最高48.50 dB。

ClinReadNet: A clinical reading-inspired network for low-dose abdominal CT image quality assessment Figure 1
2026-06-10cs.CV

ClinReadNet: A clinical reading-inspired network for low-dose abdominal CT image quality assessment

Xianye Xiao, Yulong Zou, Yujie Luo, Taihui Yu, Cun-Jing Zheng, Yuan-ming Geng, Shuihua Wang, Yudong Zhang, Jin Hong

. School of Mathematics and Computer Sciences, Nanchang University, Nanchang 330031, China, . School of Information Engineering, Nanchang University, Nanchang 330031, China, . Department of Radiology, Sun Yat-Sen Memorial Hospital, Sun Yat-Sen University, Guangzhou 510120, China, . Department of Stomatology, Zhujiang Hospital, Southern Medical University, Guangzhou 510282, China, . Department of Biological Sciences, School of Science, Xi'an Jiaotong Liverpool University, Suzhou 215123, . School of Computer Science and Engineering, Southeast University, Nanjing 210096, China, grading labels, effectively improving the performance of image quality assessment. Experiments, radiologists: by establishing a collaborative learning mechanism for detailed and global information

2026-06-10视觉感知

低剂量腹部 CT 需要在降辐射与可诊断图像质量间取舍,而人工主观评分成本高且临床难以获得参考图像。ClinReadNet 将无参考 IQA 设计成贴近放射科阅片流程的 Swin Transformer:用 SOQN 强化边缘与有序质量分布,用多温度窗口注意力模拟由整体到局部的关注,并以 HRPS 约束等级距离。文中在 LDCTIQAG2023 上报告 PLCC/SROCC/KROCC 约为 0.95/0.955/0.863,优于已有方法。

Benchmarking stereo reconstruction for 3D printable Martian terrain models Figure 1
2026-06-10cs.CV

Benchmarking stereo reconstruction for 3D printable Martian terrain models

Josephine Wang

al. evaluate on clean, object-centered ShapeNet renderings, Laboratory Curiosity imagery [11].

2026-06-10数据集/基准三维

面向火星车双目图像难以直接转成可触摸/可打印地形模型的问题,本文搭建并评测从视差估计、几何补全到水密 OBJ 导出的基准流程。核心洞察是标准立体匹配榜单性能存在明显域迁移落差:RAFT-Stereo 在 Middlebury 上优于 SGBM(MAE 0.73px vs 3.22px、覆盖率 100%),但在 Curiosity 图像上边缘对齐和重投影误差更差;补全方面 alpha shape 更保真但易碎片化,Poisson 更连通但会引入无支撑表面。

Multi-Angular Reflectance Anisotropy Observed from UAV Multispectral Imagery Figure 1
2026-06-10cs.CV

Multi-Angular Reflectance Anisotropy Observed from UAV Multispectral Imagery

Zhenqiang Qin, Chenguang Dai, Min Wang, Xian Li

College, University, School of Electronics and, Harbin Institute of, The experiments were conducted on the Harbin Institute, of the University of Information Engineering and by Heilongjiang Provincial

2026-06-10视觉感知

针对低空、宽视场无人机多光谱影像中同一地物被多视角观测而引入的辐射不一致问题,论文从 BRDF 角度构建几何感知提取流程:用 SfM 精化相机内外参,将正射影像标注的均质草地 ROI 重投影到多张原始子图,并在 VZA/RAA 极坐标域分析各波段反射率。结果显示十个波段均存在明显各向异性,红边和近红外最大/最小反射率差异达 119–137%,说明观测几何对 UAV 定量反演不可忽略。

Building Change Detection in Earthquake: A Multi-Scale Interaction Network and A Change Detection Dataset Figure 1
2026-06-10cs.CV

Building Change Detection in Earthquake: A Multi-Scale Interaction Network and A Change Detection Dataset

Yunlong Liu, Zekai Zhang

2026-06-10视觉感知数据集/基准

面向震后应急救援中短时相遥感变化检测缺少数据、且近时相成像角差导致建筑侧视错位的问题,论文构建了土耳其地震建筑变化数据集 TUE-CD,并提出 MSI-Net,通过联合跨注意力、多尺度偏移校准和特征融合增强双时相交互与对齐。实验在 WHU-CD、CLCD 和 TUE-CD 上较九种主流方法取得更好的定量与可视化结果。

Content-Induced Spatial-Spectral Aggregation Network for Change Detection in Remote Sensing Images Figure 1
2026-06-10cs.CV

Content-Induced Spatial-Spectral Aggregation Network for Change Detection in Remote Sensing Images

Yunlong Liu, Zekai Zhang

2026-06-10视觉感知

针对多时相遥感变化检测中仅建模空间关系易受季节、光照等光谱伪变化干扰的问题,本文提出 CSI-Net:用级联图卷积做全局空间推理,以特征均值/方差估计光谱差异,并通过高层内容引导的 CGI 模块融合空间—光谱信息。在 LEVIR-CD、WHU-CD、CLCD 上较八种 SOTA 取得更高精度,但模型规模和 FLOPs 较大。

Dissect and Prune: Enhancing Robustness in AI-Generated Image Detection Figure 1
2026-06-10cs.CV

Dissect and Prune: Enhancing Robustness in AI-Generated Image Detection

Dahye Kim, Jaehyun Choi, Hyun Seok Seong, Seongho Kim, Donghun Lee, Sungwon Yi, Jang-Ho Choi

2026-06-10视觉感知安全鲁棒

本文关注 AI 生成图像检测中被总体准确率掩盖的“预测不对称”:模型在压缩、缩放或未见生成器下仍偏向判真,导致假图召回崩塌。作者提出 DEAR,用局部重绘图像及掩码解剖通道与生成/真实区域的对齐关系,并双侧剪除过度依赖两端信号的脆弱特征,仅微调分类头。实验表明该策略可提升跨生成器与后处理鲁棒性,缓解假图检测退化。

What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory Figure 1
2026-06-10cs.AI

What Spatial Memory Must Store: Occlusion as the Test for Language-Agent Memory

Doeon Kwon, Junho Bang

Space Zero, Inc.

2026-06-10视觉感知

论文追问语言智能体“记忆宫殿”中,空间坐标究竟提供了文本检索不能提供的能力。其核心洞察是区分按位置回忆与可见性判断:遮挡不是召回过滤器,而是需由存储几何和视线计算回答的感知谓词。实验显示,默认把空间邻近与时效、重要性线性混合会失效,而几何主导排序显著提升;DDA 视线检测在遮挡目标上远超文本与 FoV 基线,并在预注册 live 系统中确认。

Overlapped Wavelet Diffusion for Low-Light Image Enhancement Figure 1
2026-06-10eess.IV

Overlapped Wavelet Diffusion for Low-Light Image Enhancement

Fen Peng, Taizo Suzuki, Seisuke Kyochi

University of, ††Institute of Systems and Information Engineering, University, †††the Department of Digital Media, Hosei University, Koganei-, Copyright © 200x The Institute of Electronics, Information and Communication Engineers

2026-06-10视觉感知生成模型强化学习

本文针对 DiffLL 在低光增强中因非重叠 Haar 小波带来的块效应、以及高频恢复不足导致边缘模糊的问题,提出 OWDiff:用重叠小波变换建模邻域相关性以保持结构连续,并引入低频引导的 HFEBlock 强化纹理与边缘恢复。在 LOLv1 和 LOLv2-real 上,相比 DiffLL 平均提升 0.58 dB PSNR、SSIM 相对提升 1.64%、LPIPS 相对降低 5.9%。

FoA-SR: Faithful or Aesthetic? Profile-Aware Preference Optimization for Real-World Image Super-Resolution Figure 1
2026-06-10cs.CV

FoA-SR: Faithful or Aesthetic? Profile-Aware Preference Optimization for Real-World Image Super-Resolution

Amjad Mahdi Alqarni, Peizhong Ju

Department of Computer Science, University of Kentucky

2026-06-10视觉感知强化学习优化算法

本文针对真实图像超分中“保真”与“美观”目标相互冲突的问题,提出 FoA-SR:先将 FLUX.2 适配为成对 LR-HR 超分基线 Flux2SR,再从同一随机候选池中按不同奖励挖掘偏好对,分别训练 Faithful 与 Aesthetic LoRA。RealSR 和 DIV2K 实验显示,两类适配器可分别提升参考一致性指标与无参考感知质量;78.4% 候选赢家不一致及 Hybrid-LoRA 消融表明单一混合奖励会掩盖可控性。

POPSICLE: Benchmark Datasets for Segmentation and Localization in CryoET Figure 1
2026-06-10eess.IV

POPSICLE: Benchmark Datasets for Segmentation and Localization in CryoET

Jonathan Schwartz, Utz Heinrich Ermel, C. Braxton Owens, Zhuowen Zhao, Ariana Peck, Gus L.W. Hart, Grant J. Jensen, Bridget Carragher, Dari Kimanius

Brigham Young University, Provo, UT, 84602, USA

2026-06-10视觉感知数据集/基准

针对 cryoET 机器学习评测长期受小规模、任务割裂和标注不统一限制的问题,POPSICLE 基于 CryoET Data Portal 构建可扩展基准,统一覆盖 2,993 个带标注断层数据中的密集细胞结构分割与稀疏大分子定位,并通过 copick 标准化访问、划分和评测。基线实验显示卷积、Transformer 与 cryoET 专用模型的排名随任务和数据集显著变化,说明相邻医学影像评测经验难以直接迁移。

Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing Figure 1
2026-06-10cs.SD

Dual-Branch Gated Fusion for Open-Set Audio Deepfake Source Tracing

Awais Khan, Kutub Uddin, Khalid Malik

College of Innovation and Technology, University of Michigan, Flint, MI, USA, ProbeTruth Inc., MI, USA

2026-06-10视觉感知

针对音频深伪溯源在真实部署中会遇到未见合成器、闭集分类器易过度自信的问题,论文提出双分支门控融合:用 XLSR-53 保持已知源判别力,用 66 维 CORES 手工声学描述符提供分布外稳健线索,并以输入条件门控、能量边界损失和门控多样性避免简单拼接被 SSL 特征主导。在 MLAAD 上取得 97.6% 域内准确率、4.9% EERc,并相对 Interspeech 2025 基线降低 83.5% FPR95。

An Improved Generative Adversarial Network for Micro-Resistivity Imaging Logging Restoration Figure 1
2026-06-10cs.CV

An Improved Generative Adversarial Network for Micro-Resistivity Imaging Logging Restoration

Ahmed Faizul Haque, S.M. Riaz Rahman Antu, Saif Ahmed, Asadullah Hil Galib, Souvik Pramanik, Mohammad Ashrafuzzaman Khan, Mohammad Abdul Qayum, Mohsin Sajjad

North South University

2026-06-10生成模型

微电阻率成像测井常因仪器不稳、井壁坍塌等出现缺失,影响裂缝和岩性解释。本文在GAN修复框架中以FCN生成器结合深度可分离残差、Inception、多尺度特征与通道/空间注意力,并用全局—局部双判别器约束整体语义与局部纹理一致性。实验在不同缺失区域测试集上报告平均SSIM为0.903,较类似方法提升约0.3,但数据规模与消融细节文中未充分说明。

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity Figure 1
2026-06-10cs.LG

Density Ridge Selective Prediction for LLM and VLM Hallucination Detection under Calibration Label Scarcity

Nina I. Shamsi

2026-06-10视觉语言视觉感知

本文针对LLM/VLM幻觉检测在校准标签稀缺时,监督探针易退化、无监督采样方法性能受限的问题,提出用生成期隐藏状态轨迹的六维运动学特征构建正确回答的KDE密度脊,并以测试轨迹到一维脊的距离作为选择性预测置信度。实验覆盖9个文本与视觉语言模型、7个QA基准,在仅200个校准查询和每题5次生成下,相比语义熵、EigenScore、SAPLMA和logP等方法AUROC提升约5–20点,但增益是否来自特征选择或脊几何仍需更细消融确认。

Fisher-Guided Progressive Parameter Selection for Adaptive Fine-Tuning Figure 1
2026-06-10cs.CV

Fisher-Guided Progressive Parameter Selection for Adaptive Fine-Tuning

Ghodsiyeh Rostami, Po-Han Chen, Mahdi S. Hosseini

Concordia University, Mila - Québec AI Institute

2026-06-10视觉感知

针对现有参数高效微调多依赖固定层或模块启发式、难以随任务动态选择参数的问题,论文提出 FisherAdapTune:用相邻训练阶段 Fisher 信息分布的 Jensen-Shannon 距离衡量参数组曲率漂移,已稳定者逐步冻结,仍变化者继续更新,并从 PAC-Bayes 角度解释其泛化收益。实验在裂缝分割等下游密集预测任务上显示,该方法在减少有效可训练参数的同时提升域内表现和多种零样本迁移效果。

Making Time Editable in Video Diffusion Transformers Figure 1
2026-06-10cs.CV

Making Time Editable in Video Diffusion Transformers

Konstantin Kuklev, Viacheslav Vasilev, Alexander Kunitsyn, Andrei Ivaniuta, Denis Dimitrov

2026-06-10视觉感知生成模型

本文针对视频 DiT 中扩散时间与运动演化纠缠、导致 FPS 变化或慢过程生成时节奏不可控的问题,提出 Time Adapter:用全局 FPS 条件控制运动速率、用 latent-time 嵌入对齐局部时间进展,可仅训练轻量时间分支或结合全模型微调。Wan2.2 与 Kandinsky 实验显示其降低 Flow Acceleration/LPIPS-Var,改善速度一致性;TA 更适合人体动作,FTTA 更利于雾、云等自然过程,但部分指标与感知质量仍不完全一致。

A Large Scale Open-Source Image and Video Dataset for Robust Wildfire Detection and Classification Figure 1
2026-06-10cs.CV

A Large Scale Open-Source Image and Video Dataset for Robust Wildfire Detection and Classification

Emadeldeen Hamdan, Yingyi Luo, B. Ugur Toreyin, Erdem Koyuncu, Adam J. Watts, Ugur Gudukbay, Ahmet Enis Cetin

2026-06-10视觉感知数据集/基准安全鲁棒

针对野火早期检测中专用大规模数据不足、模型易过拟合且跨域泛化弱的问题,论文提出开源图像/视频数据集 GWFP,覆盖火焰、烟雾、余烬、近红外和雾/水汽等干扰负样本,并用多种 CNN 与 Transformer 做域内和跨数据集基准;还测试了 Hadamard 跳连的 HTE-ResNet。实验显示该数据集有助于评估真实监控鲁棒性,HTE-ResNet 在域移下有一定改进,但增益可能主要来自数据多样性。

FlexPath: Learned Semantic Path Priors for Image-Based Planning Figure 1
2026-06-10cs.CV

FlexPath: Learned Semantic Path Priors for Image-Based Planning

Taehyoung Kim, Tim Schoenbrod, David Eckel, Henri Meeß

labor-intensive and often struggles to generalize across environments [41].

2026-06-10视觉感知规划控制

针对现有学习式图像规划器把可行性与“最短路”偏好绑定、难以适配避障距离或语义约束的问题,FlexPath先用模仿学习从语义栅格中学习任务无关的软路径先验,再用可微路径形状目标进行目标级微调。实验显示其在TMP上较TransPath减少14.3%搜索扩展且路径成本更低,跨VG/CSM/SC零样本泛化更稳,并在dmin=2避障中达到96.8%完全避障率。

Fusing Satellite Imagery and Planimetric Maps for Cross-View Localization Figure 1
2026-06-10cs.CV

Fusing Satellite Imagery and Planimetric Maps for Cross-View Localization

Quang Long Ho Ngo, Zimin Xia, Alexandre Alahi

modalities are widely available and possess complementary, semantic labels and becomes less informative under strong, are widely available. As shown in Fig. 1, the two modalities, metric maps, since overhead imagery is typically unavailable, the labeled, occlusion-robust structural information provided, requires large-scale training and is not available on the fly, as OSM. Despite the availability of both modalities, current

2026-06-10视觉感知

针对城市 GNSS 误差下跨视角定位过度依赖卫星图、而 OSM 等平面地图虽抗遮挡却单独性能较弱的问题,论文提出可插入现有方法的双模态融合模块:用跨模态条件化让两类 BEV 特征相互感知,并以 patch 级规则自适应选择卫星细节或地图语义。该模块在三种定位方法、两个基准上稳定提升,在 KITTI cross-area 上平均定位误差降至 3.85 m,相比最佳单模态方法降低 30.13%。

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs Figure 1
2026-06-10cs.AI

From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs

Wish Suharitdamrong, Muhammad Awais, Xiatian Zhu, Sara Atito

Surrey Institute for People-Centred AI (PAI), University of Surrey, UK, Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey, UK

2026-06-10视觉语言生成模型

针对音视频大模型中“听觉、视觉信号如何影响最终答案”仍不清楚的问题,本文用注意力 knockout 等机制分析追踪 AVLLM 信息流。核心发现是:单个音视频视频沿类似 VLM/VideoLLM 的顺序路径传递,多交错输入则形成并行路径;模态贡献随任务需求变化,深层视频注意力多为伪迹。实验在 Qwen2.5-Omni、Video-SALMONN2 Plus 的 3B/7B 上表明,信息转移完成后丢弃相应 token 几乎不降精度,甚至略有提升。

DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation Figure 1
2026-06-10cs.CV

DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

Nanshan Jia, Zhenyu Zhao, Sui Huang, Jingshen Wang, Zeyu Zheng

University of California, Berkeley, dented improvements in realism, controllability, and effi-, pushing the boundaries of controllability, fidelity, and ef-, proaches enable scalable and fully automatic evaluation, scalable mesh-level evaluation a critical component of 3D, The human labels cover two evaluation di-, human-centered 3D mesh evaluation objectives. The result-

2026-06-10数据集/基准三维

针对3D生成快速发展但网格质量评估仍依赖昂贵人工、CLIP式指标或未对齐VLM的问题,DB-3DME构建了含2619个合成3D网格及人工几何/提示一致性评分的数据集,并系统比较SOTA VLM,指出3D表示的视觉编码能力是关键因素;在此基础上微调Qwen-2.5-VL-7B后,模型在多个评估维度显著超过现有预训练VLM,形成新的自动3D网格评测基准。

iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision Figure 1
2026-06-10cs.CV

iSAGE: A Human-in-the-Loop Framework for Remote Sensing Semantic Segmentation via Sparse Point Supervision

Osmar Luiz Ferreira de Carvalho, Osmar Abilio de Carvalho Junior, Anesmar Olino de Albuquerque, Daniel Guerreiro e Silva

aDepartment of Electrical Engineering, University of Brasília, Brasília, DF, Brazil, bDepartment of Geography, University of Brasília, Brasília, DF, Brazil, iary machinery (pseudo-labels, propagation, CRFs, foundation-model prompts, auxiliary heads), all, Experiments use a minimum-effort regime: at most one labeled pixel per class per frame. On BsB, Aerial (controlled laboratory), iSAGE recovers 97.2% of dense supervision (74.79% mIoU on 0.040%, (oracle entropy across budgets 1–100×, pseudo-labels across thresholds 0.90–0.99, CRF-based prop-, and target-dependent, the prevailing assumption is that extensive labeled data is a prerequisite., However, models in production demand more than benchmark-style labeling: (1) speed: Cityscapes, MS-COCO took over a year and a half of collaborative effort (Lin et al., 2014), to insert the label, prompts but do not assign class labels in specialized taxonomies, and even when used as labeling, ), pseudo-labeling reuses high-confidence predictions (Lee et al., 2013

2026-06-10视觉感知

遥感语义分割常因传感器和地域迁移差而反复需要昂贵密集标注。iSAGE的核心洞察是:模型预测分布无法区分“高置信但错误”和“高置信且正确”像素,因此让专家直接点击可见的高置信错误,并用误差加权Dice损失反复放大这些稀疏点监督,而不做伪标签或传播。在每类每帧最多1点的设置下,BsB Aerial用0.040%像素达到密集监督97.2%,Vaihingen用0.011%像素取得76.78% mIoU,接近/略超密集基线,并显著高于同管线输出读取基线。

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression Figure 1
2026-06-10cs.CV

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Weijie Ma

2026-06-10视觉感知强化学习

针对因果自回归视频世界模型流程复杂、长时交互中误差累积导致画质和控制漂移的问题,BiWM提出开源的双向自回归框架:在块内保留双向注意力、块间自回归,仅用相机/动作控制微调与少步DMD蒸馏两阶段完成训练,并加入历史压缩、4-bit部署及GAN/forward-KL抗退化项。论文报告其可在数百步、8×H200上收敛,支持多种视频骨干和真实相机控制,相比minWM更稳定但仍需更系统的对照基准。

Improving PET/CT-Based Whole-Body Lesion Segmentation Using Prediction Uncertainty-Augmented Models Figure 1
2026-06-10cs.CV

Improving PET/CT-Based Whole-Body Lesion Segmentation Using Prediction Uncertainty-Augmented Models

Bashirul Azam Biswas, Biratal Raj Wagle, Zhihan Yang, Marc A. Seltzer, Matthew E. Maeder, James B. Yu, Indrani Bhattacharya

Department of Biomedical Data Science, Geisel School of Medicine at Dartmouth, Dartmouth Hitchcock Medical Center, processes by detecting uptake of different radiotracers, such as [68Ga]-PSMA-11 and [18F]-labeled prostate specific, gions, different radiotracers, and the labor- and expertise-intensive task of lesion identification and annotation5. The, growing volume of PET/CT scans, without a corresponding increase in nuclear medicine experts available for inter-

2026-06-10视觉感知安全鲁棒

针对全身 PET/CT 病灶分割在多癌种、多示踪剂场景下易受训练随机性、漏检和缺乏可靠性估计影响的问题,论文在 nnU-Net 上引入贝叶斯集成、体素级认知/偶然不确定性分解,并用不确定性增强训练与病例自适应路由。AutoPET-III 上 Dice 从 60.1 提至 62.0,路由达 63.1;Deep-PSMA 外部分布上最高 Dice 65.3,但召回提升伴随假阳性增加。

Maximum Matching Accuracy: An Instance Segmentation Evaluation Metric Utilizing Globally Optimal Matching Figure 1
2026-06-10cs.CV

Maximum Matching Accuracy: An Instance Segmentation Evaluation Metric Utilizing Globally Optimal Matching

Kaden Stillwagon, Alexandra D. VandeLoo, Craig R. Forest

aCollege of Computing, Georgia Institute of Technology, Atlanta, 30332, Georgia, United States, bSchool of Materials Science and Engineering, Georgia Institute of Technology, Atlanta, 30332, Georgia, United States, cWallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology, Atlanta, 30332, Georgia, United States, dGeorge W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology, Atlanta, 30332, Georgia, United States

2026-06-10视觉感知数据集/基准

针对生物细胞实例分割中 AP、PQ、SEG、AJI 等指标受硬 IoU 阈值、逐实例归一化和贪心/一对多匹配影响而导致排名不稳的问题,论文提出 MMA:用全局最优一对一匹配、连续重叠计分和像素级归一化来评估掩膜质量。合成失效、渐进腐蚀和模型排名实验显示,MMA 对分裂、合并和边界误差更敏感稳定,并在最高 50% 情况下给出不同最佳模型。

Interpretable Temporal Facial-Region Motion Analysis for In-the-Wild Parkinson's Disease Video Classification Figure 1
2026-06-10cs.CV

Interpretable Temporal Facial-Region Motion Analysis for In-the-Wild Parkinson's Disease Video Classification

Riyadh Almushrafy (Majmaah University, Saudi Arabia)

Department of Computer Science and Information, College of Science, Majmaah, University, Saudi Arabia, difficult, but it also reflects the conditions under which scalable video-based screening or cue, level annotations, and expert-provided labels. Its public availability makes it valuable for, disease duration, and detailed clinical rating context is not generally available. For this reason

2026-06-10视觉感知

针对野外视频中帕金森低面部表情难以量化且易受姿态、光照、说话和头动干扰的问题,本文在 YouTubePD 的14个面部区域关键点上比较静态几何、归一化几何、速度/相对速度与 GRU,核心洞察是归一化的区域运动速度比复杂序列模型更稳且可解释。随机森林取得测试 balanced accuracy 0.826、AUROC 0.855,10种子下 AUROC 0.855±0.005;区域消融和置换重要性显示信息集中在少数区域及运动变异、峰值变化,但不等同于受控临床严重度评估。

A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks Figure 1
2026-06-10cs.CV

A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

Bruce Changlong Xu, Lan Wu, Alexander Ryu

Stanford University, University of California, Berkeley, VQA-RAD (Lau et al., 2018): datasets that (a) have been publicly available for 3–7 years

2026-06-10视觉语言视觉感知规划控制数据集/基准

针对医学视觉语言基准长期公开、可能被预训练语料污染而仍被当作独立测试集的问题,本文对多种开放VLM和SLAKE-En、PathVQA、VQA-RAD、OmniMedVQA镜像做受控审计,并同时检验泄漏检测器可靠性。结果显示SLAKE-En存在明显图像源分布重叠、OmniMedVQA有文本侧污染信号,VQA-RAD相对更干净;而Min-K%++尾部富集和top-K重叠在BLIP-2对照下失效,不宜单独作为泄漏证据。

Continuous Neural Reparameterization as a Deep Geometric Prior for Robust Fixed-Chart UV Repair Figure 1
2026-06-10cs.GR

Continuous Neural Reparameterization as a Deep Geometric Prior for Robust Fixed-Chart UV Repair

Mohammad Sadegh Salehi

2026-06-10安全鲁棒

针对传统固定图表 UV 展开在初始化不良、局部极小或折叠时易产生翻面的问题,本文将顶点到 UV 的映射改写为未训练 SIREN 的连续神经重参数化,并结合 LBO 谱特征、Tutte 预热、行列式屏障、无效步拒绝与回退路由来优先保证局部有效性。结果显示紧致图表全零翻面,Thingi10K/xatlas 47 个分层图表中 42 个有效零翻面,Amara 大规模流程经回退后 1000/1000 局部有效;但方法较慢,且允许重切时 BFF/OptCuts 可能更快或低失真。

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation Figure 1
2026-06-10cs.RO

GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation

Sriram Krishna, Ben Eisner, Haotian Zhan, Ying Yuan, Haoyu Zhen, Chuang Gan, Shubham Tulsiani, David Held

2026-06-10机器人

针对机器人模仿学习依赖大量遥操作数据且难泛化到新物体/场景的问题,GHOST将操作分解为高层3D末端子目标预测与低层目标条件控制,并用投影热图把3D目标接入图像策略;子目标相对跨本体,使人类视频可训练高层而无需动作重定向。实验显示其在长时程折叠、锤钉等任务上显著优于平坦Diffusion Policy,并能借少量人类示范适应OOD组合与类别,但高层视觉域差仍是瓶颈。

SpineReport: Automated 3D Quantification and Reporting of Lumbar Spine Degeneration on MRI Figure 1
2026-06-10cs.CV

SpineReport: Automated 3D Quantification and Reporting of Lumbar Spine Degeneration on MRI

Nathan Molinier, Adrian A. Marth, Reto Sutter, Christoph Germann, Jacob A. Connolly, Mathieu Guay-Paquet, Nathan D. Schilaty, Kenneth A. Weber II, Julien Cohen-Adad

NeuroPoly, Institute of Biomedical Engineering, Polytechnique Montreal, Montreal, QC, Canada, Mila, Quebec AI Institute, Montreal, QC, Canada, Department of Radiology, Balgrist University Hospital, Zurich, Switzerland, Faculty of Medicine, University of Zurich, Zurich, Switzerland, Department of Neurosurgery, Brain & Spine, University of South Florida, Tampa, FL, USA, Center for Neuromusculoskeletal Research, University of South Florida, Tampa, FL, USA, Department of Medical Engineering, University of South Florida, Tampa, FL, USA, Stanford School of Medicine, Stanford, CA, USA, Centre de recherche du CHU Sainte-Justine, Université de Montréal, Montreal, QC, Canada

2026-06-10三维

腰椎 MRI 退变评估常依赖二维手工测量,易受切面和体位影响且复现性不足。SpineReport 将稳健解剖分割转化为开放的全自动三维形态与信号定量,并生成可与队列分布对照的个体报告。与放射科分级对照显示,其指标能较好识别中央椎管狭窄,T2 脑脊液信号 AUC 达 0.95,椎管前后径和面积比 AUC 超 0.80;侧隐窝狭窄关联中等,椎间孔狭窄未见显著关联。

Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization Figure 1
2026-06-10cs.CV

Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization

Ray Zhang, Marcus Greiff, Thomas Lew, John Subosits

when other sensors such as GPS are unavailable or unre-, *1Website: https://github.com/ToyotaResearchInstitute/, †2All authors are with Toyota Research Institute, 4440 El Camino Real, color and pixel labels through the functional representa-, pixel labels. RKHS-BA [66] extends frame-to-frame reg-

2026-06-10优化算法三维

针对点云里程计在特征稀疏、噪声场景中难以建立可靠对应,以及既有 RKHS 无对应配准速度慢、未利用局部几何的问题,论文提出 G-CVO:用逐点各向异性核编码表面结构,在法向更强约束、切向放松,并以 SE(3) 上的黎曼 Gauss-Newton 近似二阶求解。实验在 KITTI、室内 RGB-D 和自采稀疏赛车场景提升跟踪鲁棒性,较一阶 CVO 最多快 10 倍,困难驾驶任务平移和旋转漂移均降逾 55%。

ABot-Earth 0.5: Generative 3D Earth Model Figure 1
2026-06-10cs.CV

ABot-Earth 0.5: Generative 3D Earth Model

Ming Qian, Tianjian Ouyang, Mingchao Sun, Zijian Wang, Jincheng Xiong, Jiarong Han, Yongchang Zhang, Jiawei Zhang, Xu Wang, Yu Liu, Luyang Tang, Fei Yu, Zengye Ge, Mengmeng Du, Yuan Liu, Nianfei Fan, Song Wang, Yingliang Peng, Chunxue Jia, Yang Liu, Shiying Zeng, Haozhe Shi, Junnan Lai, Hongyu Pan, Zheng Wu, Ning Guo, Mu Xu, Hang Zhang

AMAP CV Lab

2026-06-10生成模型三维

针对传统大规模三维地球重建依赖航拍/LiDAR、成本高且难以按需扩展的问题,ABot-Earth 0.5 将生成模型直接建在 3D Gaussian Splatting 表示上,以卫星图像为条件,并用真实城市级 3DGS 重建数据训练,避免纯合成场景的 sim-to-real 偏差。论文报告其可在每平方公里 10 分钟内生成具多级 LOD 的可交互场景,在真实感和几何保真度上优于基线,并支持 UAV 导航等闭环仿真;具体增益可能主要来自 scaling / data。

SPARX: Secure and Privacy-Aware Approximate CNN Acceleration with Edge RISC-V SoC Figure 1
2026-06-10cs.AR

SPARX: Secure and Privacy-Aware Approximate CNN Acceleration with Edge RISC-V SoC

Sonu Kumar, Akash Sankhe, Mukul Lokhande, Santosh Kumar Vishvakarma

Centre for Advanced Electronics, Indian Institute of Technology Indore, accelerators while preserving programmability, scalability, and

2026-06-10视觉感知

面向边缘设备上视觉 CNN 推理的能耗、实时性与隐私安全约束,SPARX 将近似对数 MAC 加速器、RISC-V 自定义指令、差分噪声隐私保护和挑战响应认证集成到 RV32IMC SoC,并用 ASI/AFOM/HAE 等指标选择算术单元。实验选出 ILM,相比精确 Booth MAC 面积降 51.7%、功耗降 81.5%、吞吐提升 2.13×,ResNet-20/CIFAR-10 精度仅降 2.82 个百分点,FPGA 达 58.4 GOPS/W。

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization Figure 1
2026-06-10cs.CR

Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization

Ziang Xu, Wenbo Yu, Hongyao Yu, Hao Fang, Jiawei Kong, Bin Chen, Hao Wu, Shu-Tao Xia, Zhiyong Wu

Harbin Institute of Technology, Graduate School, Resource Availability:, The source code of this paper has been made publicly available at https:

2026-06-10生成模型优化算法

针对扩散模型个性化生成中以对抗扰动保护版权图像但可能被自适应绕过的问题,论文指出现有防御主要破坏图像到 LDM 潜空间的语义映射,并提出 TS-LFO 通过潜变量去噪与像素约束重建两阶段恢复该映射。实验显示其可持续绕过多种 SOTA 版权防御,并优于 DiffPure、GrIDPure、IMPRESS 等攻击基线。

On the Controllability-Fidelity Frontier in Diffusion Editing Figure 1
2026-06-10cs.GR

On the Controllability-Fidelity Frontier in Diffusion Editing

Yi Hu, Leying Yi, Emily Davis, Finn Carter

On the Controllability-Fidelity Frontier in Diffusion Editing, Xidian University, lable diffusion-based image editing, analyzing the trade-offs, In particular, users seek controllability (precision in fol-

2026-06-10生成模型规划控制

本文关注扩散图像编辑中“按意图可控”与“保留原图保真”的内在冲突。作者将文本、掩码、拖拽和反演式编辑统一为带保真正则的优化框架,并分析噪声注入、引导采样与反演误差,给出重建误差、重复编辑稳定性和局部性界。实验比较 TF-ICON、DragFlow、InstructPix2Pix、UltraEdit 等方法,显示强提示对齐常伴随身份漂移、背景破坏、提示敏感和组合失败,同时讨论概念擦除等安全防护。

WHU-Infra3D: A Full-stack Multi-modal Dataset and Benchmark for 3D Roadside Infrastructure Inventory Figure 1
2026-06-10cs.CV

WHU-Infra3D: A Full-stack Multi-modal Dataset and Benchmark for 3D Roadside Infrastructure Inventory

Chong Liu, Luxuan Fu, Xuyu Feng, Zhen Dong, Bisheng Yang

aState Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China, scalable, AI-driven urban infrastructure inventory and lifecycle management. The WHU-Infra3D dataset is available at https:, boxes, semantic masks, and instance masks). (Center) The core feature is Instance Association, which establishes consistent cross-frame tracking

2026-06-10数据集/基准三维

面向数字孪生城市中路侧设施从“看见”到“可维护”的需求,论文指出现有数据集缺少严格2D-3D对齐、跨帧去重和缺陷状态标注。WHU-Infra3D采集三城53.8 km全景图与激光点云,提供2D框、3D实例、跟踪ID及18万余属性/状态标签,并建立检测、匹配、定位、分割和属性识别五类基准。实验显示跨城市域偏移明显,现有模型对长尾损坏/遮挡状态仍较脆弱。

Toward Calibrated, Fair, and accurate Deepfake Detection Figure 1
2026-06-10cs.LG

Toward Calibrated, Fair, and accurate Deepfake Detection

Ryan Brown, Chris Russell

University of Oxford, ing fairness approaches require demographic labels, retraining, or sacrifice accuracy., label-free fairness method demonstrated for deepfake detection: a lightweight cali-, racy when demographics are available, and FF-Discover, which does the same with, Post-processing methods that adjust decision thresholds often need group labels at inference time, challenge: it achieves fairness without demographic labels, without retraining, and without sacrificing, a barrier. FF-Max directly optimizes thresholds using known group labels, while FF-Discover does, graphic labels. Our evaluation demonstrates the effectiveness of FF. FFT reduces performance gaps, decision thresholds to maximize worst-group accuracy when demographic labels are available at, thresholds to maximize minimum group accuracy without demographic labels at any stage and, is group-label-free, retraining-free, and improves both worst-group and overall accuracy.

2026-06-10视觉感知

针对深伪检测器在性别、族裔等群体间误报率和召回率差异大的部署问题,论文提出即插即用的 Face-Fairness 后处理框架。核心洞察是冻结人脸嵌入已包含与失效相关的连续线索,可用轻量 MLP 对检测 logit 做条件重映射;另给出基于显式或聚类群体的阈值版本。实验显示在域内与跨数据集测试中,该方法降低 FPR/TPR 差距、提升最差群体准确率,并基本保持或提高总体准确率。

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation Figure 1
2026-06-10cs.CV

SD-GRPO: Verifiable Segment Decomposition for Long-Form Vision-Language Generation

Hyunwoong Kim, Seongeun Lee, Hannah Yun, Junhyun Park, Jonggwon Park

DEEPNOID Inc., Seoul, South Korea

2026-06-10视觉语言视觉感知

本文针对长篇视觉语言生成中 GRPO 只用单一整体奖励导致细粒度信用分配错误的问题,提出 SD-GRPO:将输出按可验证语义段切分,并在 rollout 组内对分段奖励做 z 归一化,得到分段优势。实验覆盖多面板描述、多图表 VQA 和科学图注,显示其较 GRPO/Dr. GRPO 稳定提升;当分段语义耦合较强时,分段奖励与整体奖励混合效果最好。

MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting Figure 1
2026-06-10cs.MM

MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

Joonhyung Bae

JOONHYUNG BAE, Korea Advanced Institute of Science and Technology (KAIST), South Korea, yet the genre target turns on how symbols are arranged rather than on which ones appear. The same lens separates a content label, that survives transfer to held-out source institutions, genre, from a style label that does not, era, a prediction we confirm on two, further labels in the corpus. We release the multimodal system, a worked-example reading of one painting’s evidence map against its, The public corpus we use is well suited to the question we pose. Each whole painting carries a curatorial genre label, Author’s Contact Information: Joonhyung Bae, Korea Advanced Institute of Science and Technology (KAIST), Daejeon, South Korea, value interpretive. Two of the answers are about what one would expect. Fusion reliably helps a content label like genre, The same lens organizes a second observation. Fusing image and text helps a content label whose attributes the, captions describe, like genre, and does not help a style label that the captions ignore, like era. The same separation, labels in the corpus, theme and drawing technique, and find that it holds., of labeled Western paintings and the OmniArt benchmark adding artist, type, and timeframe annotations at scale [23, 24]., themes rather than the movements and schools that label Western art, so the categories overlap in their visual content.

2026-06-10视觉语言

论文探讨韩国民画中“吉祥符号清单”能否决定题材类别。作者构建 MinhwaNet,将整画图像、双语策展文本与专家对象裁剪结合,提出“忠实但不足”的对象 grounding 诊断:证据图能定位策展对象并解释模型关注处,但题材更多取决于符号的组合、布局与画法。结果显示图文融合显著优于仅用对象清单,强制对象化表示反而降低题材分类;同时,年代预测主要受馆藏来源混杂影响,跨机构泛化不足。

Sketch-to-Layout: A Human-Centric Computational Agent for Constraint-Aware Synthesis of Modular Photobioreactors Figure 1
2026-06-10cs.HC

Sketch-to-Layout: A Human-Centric Computational Agent for Constraint-Aware Synthesis of Modular Photobioreactors

Xiujin Liu, Shuqi Li, Yuxin Lin

Qrafty Technology Inc. 2University of Michigan, vitality from ordinary photographs without requiring absolute ground-truth labels., scalable carbon capture systems., widespread adoption due to the transition from bespoke engineering to scalable, user-deployed

2026-06-10优化算法

面向建筑集成微藻光生物反应器难以由非专家扩展部署、管路拓扑易失效且维护成本高的问题,论文将14类模块化“碳中和砖”的布局生成建模为CSP,用CP-SAT把用户草图作为软偏好、端口对齐和全局连通等作为硬约束,并加入弱监督视觉健康监测。实验显示15×15网格内求解成功率达95.5%,监测轨迹与14天生物周期基本一致。

Integrated Real-Time Motion Tracking and AI Analysis for Athletic Performance Optimization Figure 1
2026-06-10cs.HC

Integrated Real-Time Motion Tracking and AI Analysis for Athletic Performance Optimization

Parth Agrawal, Ronit, Sagar Kumar, Aashish Bhambri

and labour-intensive method often missed the subtle, expensive, controlled, lengthy and intrusive lab setups, which, cameras [8]. Advanced analysis tools available only to well-, Department of Computer Science, Chandigarh University

2026-06-10视觉感知优化算法

针对传统人工观察和昂贵标记式动捕难以在真实训练中提供低延迟反馈的问题,本文梳理HPE架构取舍,并提出基于MediaPipe的轻量模块化原型,结合运动专项逻辑、有限状态机计次、关节角峰值跟踪和赛后LLM反馈。四段视频测试显示MPJPE约0.0147–0.0316、23–25 FPS、95分位端到端延迟低于45ms,计次较稳定;但样本规模较小,泛化能力文中未充分说明。

2026-06-09

276 篇
Latent Spatial Memory for Video World Models Figure 1
2026-06-09cs.CV

Latent Spatial Memory for Video World Models

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

2026-06-09视觉感知强化学习

视频世界模型在长轨迹生成中容易因缺少持久三维记忆而产生几何漂移,而既有 RGB 点云缓存又有渲染、重编码开销和潜在表征损失。本文提出 Mirage,将 VAE 潜变量通过深度反投影存入三维 latent spatial memory,并在目标视角以潜空间投影直接读出,再结合分块更新维持一致性。实验显示其在 WorldScore 达到 SOTA、RealEstate10K 重建质量较强,同时端到端生成最高加速 10.57 倍、3D 缓存显存降低 55 倍。

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models Figure 1
2026-06-09cs.RO

MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

Hao Shi, Weiye Li, Bin Xie, Yulin Wang, Renping Zhou, Tiancai Wang, Xiangyu Zhang, Ping Luo, Gao Huang

2026-06-09视觉语言视觉感知

本文针对现有 VLA 多依赖当前观测、难以处理长程时序操作的问题,提出 MemoryVLA++:用感知/认知记忆库存储并检索历史上下文,同时借助世界模型在潜空间“想象”未来状态,再由扩散动作专家生成动作。实验覆盖 5 个仿真基准和 3 类真机任务,报告在 Libero、SimplerEnv、Calvin 等及真机长程记忆/想象任务上均有提升,真机分别带来约 +9%、+26%、+28% 增益。

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics Figure 1
2026-06-09cs.CV

OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics

Mingxian Lin, Shengju Qian, Yuqi Liu, Yi-Hua Huang, Yiyu Wang, Wei Huang, Yitang Li, Fan Zhang, Zeyu Hu, Lingting Zhu, Xin Wang, Xiaojuan Qi

The University of Hong Kong, The Chinese University of Hong Kong, Tsinghua University

2026-06-09视觉语言数据集/基准

针对现有 VLM 游戏基准多只给单次冷启动分数、偏重 Solo 且难以公平比较异构智能体的问题,OmniGameArena 构建了 12 个全新 UE5 实时游戏,覆盖 Solo/PvP/Coop,并提出 IDC 多轮反思评测来观察分数演化与泛化到留出变体的能力。实验显示 12 个智能体中无模型全面领先,商业 VLM 明显强于开源与专用策略;4 个强模型经反思均有提升,但峰值常出现在中途,原任务增益与迁移表现可能分离。

PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws Figure 1
2026-06-09cs.CV

PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws

Danqi Zhuang, Jisui Huang, Xiaoyue Xi, Andrew Kiggins, Xiaojie Wang, Ke Chen, Yue Wu

2026-06-09生成模型

针对标准扩散模型以单一高斯终端分布生成、难以显式保留低维流形几何的问题,PTL-Diffusion 将周期相位结构嵌入前向加噪过程,使其收敛到相位索引的周期高斯终端族,并保持闭式边缘分布、反向后验和常规噪声预测训练。在环面、圆柱点云和 Olivetti 人脸上,相比 DDPM 降低了相位误差、协方差误差和流形近邻距离,但仍属小规模概念验证。

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models Figure 1
2026-06-09cs.RO

iMaC: Translating Actions into Motion and Contact Images for Embodied World Models

Zhenyu Wu, Xiuwei Xu, Yukun Zhou, Yifan Li, Qiuping Deng, Xiaofeng Wang, Zheng Zhu, Bingyao Yu, Ziwei Wang, Jiwen Lu, Haibin Yan

Beijing University of Posts and Telecommunications, Tsinghua University, Nanyang Technological University

2026-06-09视觉感知强化学习

面向机器人策略评估,论文指出动作条件视频模型若只用紧凑动作向量,难以捕捉厘米级接触差异。iMaC 将未来关节动作经 URDF/正运动学渲染为运动图像,并结合深度点云生成双流接触图像,显式约束机器人外观与场景几何关系,同时用训练期滚动缓解长时闭环误差。在 8 个真实长程操作任务中,其世界模型成功率估计与真实策略表现强正相关,可用于比较不同 checkpoint。

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing Figure 1
2026-06-09cs.RO

AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing

Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu

Shanghai Jiao Tong University, Shanghai AI Laboratory, The University of Hong Kong

2026-06-09强化学习

本文针对现有世界-动作模型将视频预测与动作执行绑定在同一短时频率、导致视频分支浪费在低信息量近邻帧的问题,提出AHA-WAM:用低频视频DiT做长时世界规划并复用KV上下文,用高频动作DiT闭环执行,并通过OVCR和offset训练缓解异步错位。实验显示其在RoboTwin达92.80%成功率、4个真实任务达78.3%,闭环控制24.17Hz并较Fast-WAM加速4.59倍。

Echo-Memory: A Controlled Study of Memory in Action World Models Figure 1
2026-06-09cs.CV

Echo-Memory: A Controlled Study of Memory in Action World Models

Wayne King, Zeyue Xue, Yuxuan Bian, Jie Huang, Haoran Li, Yaowei Li, Yaofeng Su, Yuming Li, Haoyu Wang, Shiyi Zhang, Songchun Zhang, Yuwei Niu, Sihan Xu, Junhao Zhuang, Haoyang Huang, Nan Duan

2026-06-09强化学习规划控制

本文针对动作条件世界模型在视角离开后再返回时场景和物体身份易漂移的问题,固定视频扩散骨干、动作接口和评测流程,仅改变记忆的存储与读取方式,拆分容量、压缩、读出和递归四个因素。结果显示,回放指标不能代表真实记忆;增加原始上下文显著提升开放域返回,一些紧凑空间/混合压缩会丢失关键证据,而分块状态空间递归在开放域返回上最强。

Beyond Spherical Harmonics: Rethinking Appearance Models for Radiance Reconstruction Figure 1
2026-06-09cs.CV

Beyond Spherical Harmonics: Rethinking Appearance Models for Radiance Reconstruction

Ewa Miazga, Jorge Condor, Piotr Didyk

2026-06-09三维

本文针对新视角合成/辐射场重建中低阶球谐难以表达高频视角相关外观、而高阶球谐又带来显存和计算开销的问题,系统比较多类球面函数,并归纳出多模态、闭式积分和各向异性是关键属性;据此提出归一化各向异性球面 Gabor(NASGabor)核。实验显示其能更准确重建高光、glints 等视角效应,相比常用 SH 最高约节省 5 倍内存且评估更快,可集成到 3DGS 管线。

End-to-End Optimization of Incoherent Imaging for Classification Under Detector-Limited Readout Figure 1
2026-06-09cs.CV

End-to-End Optimization of Incoherent Imaging for Classification Under Detector-Limited Readout

Archer Wang, Joshua Chen, Sachin Vaidya, Marin Soljačić

are with the Research Laboratory of Electronics, Massachusetts Institute of, Massachusetts Institute of Technology, Cambridge, MA 02139 USA.

2026-06-09优化算法

本文关注光学前端与神经分类器端到端协同设计在何种成像约束下真正优于传统透镜,动机是高速度、低功耗场景中全像素读出成本高。核心洞察是:非相干被动相位掩模在全探测器读出时不能超过理想通道互信息上限,优势主要来自受限读出下的任务感知测量形成。实验与理论表明,在低探测噪声、稀疏或掩膜读出且类别信息偏低频时增益最大;读出充分、块求和或噪声升高时收益明显缩小。

POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction Figure 1
2026-06-09cs.CV

POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction

Brandon Smock, Libin Liang, Max Sokolov, Amrit Ramesh, Valerie Faucon-Morin, Tayyibah Khanam, Maury Courtland

2026-06-09视觉感知

面向大规模文档处理中页级表格抽取依赖自回归VLM、成本高且缺少空间定位的问题,POTATR将TATR扩展为2900万参数的图预测模型,并行检测表格、行列、表头、标题和脚注及其父子关系,每个元素都有框。借助预训练TSR权重,它在PubTables-v2 Single Pages上达到GriTSCon 0.964、标题文本F1 0.979,较前沿MLLM快130倍、成本低约300倍。

SemDINO: A DINOv3-Driven Network for Cross-Temporal Semantic Alignment in Change Detection Figure 1
2026-06-09cs.CV

SemDINO: A DINOv3-Driven Network for Cross-Temporal Semantic Alignment in Change Detection

Xinyu Tong, Meihua Zhou, Jinxiao Sun, Yingjie Tang, Lei Wang

and multi-scale change enhancement (MCE) modules collabora-, Xinyu Tong and Lei Wang are with the Xinjiang Institute of Ecology and, Geography, Chinese Academy of Sciences, Urumqi 830011, China, and also, with the University of Chinese Academy of Sciences, Beijing 100049, China., Meihua Zhou is with the University of Chinese Academy of Sciences, Jinxiao Sun is with the School of Computer Science, Xiangtan University, Yingjie Tang is with the College of Information and Communication, Engineering, Harbin Engineering University, Harbin 150001, China.

2026-06-09视觉感知

针对遥感语义变化检测中跨时相语义对齐不足、易受光照季节和配准噪声诱发伪变化的问题,SemDINO将冻结DINOv3语义先验与CNN金字塔门控融合,并用多尺度双向时序Transformer校准两期特征,再结合语义净化、变化增强和解耦多任务头输出变化掩码、双时相语义图及边缘约束。公开SCD实验显示其优于现有方法,且仅替换预测头即可在WHU-CD、LEVIR-CD等二值变化检测上保持竞争性能。

Hybrid Robustness Verification for Spatio-Temporal Neural Networks Figure 1
2026-06-09cs.CV

Hybrid Robustness Verification for Spatio-Temporal Neural Networks

Sherwin Varghese, Matthew Wicker, Alessio Lomuscio

2026-06-09安全鲁棒

面向自动驾驶、视频识别和医学体数据等高维时空输入,论文指出传统 ℓp 扰动验证过于保守或计算昂贵。其核心是将更现实的连续帧/局部 patch 攻击建模为时空共享约束,提出 STBP:首个卷积层用闭式精确可达集,后续层用可扩展界传播。实验在 UCF-101、Udacity、MedMNIST 和 ST-Bench 上显示,相同扰动预算下认证鲁棒准确率最高提升约 1.7 倍。

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents Figure 1
2026-06-09cs.CV

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents

Letian Li, Chao Shen, Shuzhao Xie, Chenghao Gu, ZhengXiao He, Yu Meng, Xin Yang, Wenyuan Jiang, Zhi Wang

SIGS, Tsinghua University, Nankai University, University of Arizona, Zhejiang University

2026-06-09三维

论文针对文本驱动室内 3D 场景生成与后续编辑中,场景图/全局约束难以表达局部几何、编辑成本高且易影响无关物体的问题,提出 XML/CSS 风格的层次化 DSL(HDSL),用可寻址树节点表示房间、区域、物体和支撑面,并结合递归 LLM 生成、验证、资产检索、力导向布局修复及 HRAG 局部重写。实验显示其提升物体覆盖、文本对齐和生成速度;编辑时 token 减少 5.22 倍、运行时间减少 6.19 倍,并更好保留非目标对象。

Evaluating the Representation Space of Diffusion Models via Self-Supervised Principles Figure 1
2026-06-09cs.LG

Evaluating the Representation Space of Diffusion Models via Self-Supervised Principles

Xiao Li, Yixuan Jia, Zekai Zhang, Xiang Li, Lianghe Shi, Jinxin Zhou, Zhihui Zhu, Liyue Shen, Qing Qu

University of Michigan, Ohio State University

2026-06-09生成模型

论文关注扩散模型既能生成又能表征但二者关系不清的问题,借鉴自监督学习将特征分解为不变成分与残差成分,并提出基于 Fisher 信噪比的 ICR 指标衡量残差对语义不变性的污染。实验显示,中等噪声层的 ICR 对应最佳分类表征;在生成侧,ICR 可在无需采样、验证集或外部评估器的情况下跟踪 FID,并在小数据训练中提前提示从泛化转向记忆的拐点。

Cranio-Diff: Diffusion-based Cross-domain Craniofacial Reconstruction with 2D X-ray Skull Guidance and Structural Identity Constraints Figure 1
2026-06-09cs.CV

Cranio-Diff: Diffusion-based Cross-domain Craniofacial Reconstruction with 2D X-ray Skull Guidance and Structural Identity Constraints

Ravi Shankar Prasad, Naresh Gurjar, Shashank Baghel, Chirag, Dinesh Singh

School of Computing and Electrical, Indian Institute of Technology Mandi, University, Department, flexible and controllable image synthesis by incorporating semantic guidance through textual, anatomy. Also, few studies were conducted on 3D skull and 3D face due unavailability of

2026-06-09生成模型优化算法三维

面向法医颅面重建中2D X光颅骨到人脸跨模态语义与结构身份难对齐的问题,Cranio-Diff以Stable Diffusion/Realistic Vision为骨干,引入ControlNet颅骨结构引导和生物特征文本条件,生成可控且更符合解剖约束的人脸。作者在120人多视角X光-人脸数据及年龄、BMI变体上评测,报告在FID、SSIM、ArcFace及检索Recall/mAP/MRR上优于GAN和已有方法,但增益可能部分来自数据扩展与合成设置。

GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development Figure 1
2026-06-09cs.CV

GenEyePose: Patient-Free, Knowledge-Based Saccadic Eye Movement Modeling for Digital Neurophysiologic Biomarker Development

Tianyu Lin, Jooyoung Ryu, Puvada Sreevarsha, Rahul Srinivasaragavan, Riya Satavlekar, Susan Kim, Nidhi Soley, Yujie Yan, Ishan Vatsaraj, Carl Harris, Aimon Rahman, Vishal Patel, Joseph Greenstein, Casey Taylor, Kemar E. Green

2026-06-09三维

针对真实眼动视频受隐私、标注稀缺和噪声限制而难以训练神经疾病筛查模型的问题,GenEyePose用临床参数生成生理合理的扫视波形,并反向映射为瞳孔掩码,再通过条件视频生成得到无需患者数据的合成眼动视频。仅用合成数据训练的MViT-V2在真实临床集上达到AUROC 0.76、敏感度0.71,但合成到真实的性能差距仍显示复杂伪影建模不足。

SoccerNet 2026 Player-Centric Ball-Action Spotting:Retraining and Post-Processing Extensions to the FOOTPASS Baselines Figure 1
2026-06-09cs.CV

SoccerNet 2026 Player-Centric Ball-Action Spotting:Retraining and Post-Processing Extensions to the FOOTPASS Baselines

Parthsarthi Rawat

entropy loss and label smoothing 0.05. At a 15% global, to fall back to a centred crop that cannot identify the correct

2026-06-09视觉感知

本文面向足球转播中的球员中心动作定位,核心难点是同时判断“谁、何时、做了什么”且类别极度不均衡。作者在 FOOTPASS/TAAD+DST 基线 上加入梯度检查点全骨干微调、GNN logits 融合、平方根类权重和针对稀有类的后处理/集成,使测试集 Macro F1 从 0.493 提升到 0.548,挑战集为 0.446;但 tackle、block 在挑战集显著退化,说明阈值后处理泛化仍不足。

Visual Prompting Meets Feature Reconstruction-Based Anomaly Detection with Dual-Teacher Supervision Figure 1
2026-06-09cs.CV

Visual Prompting Meets Feature Reconstruction-Based Anomaly Detection with Dual-Teacher Supervision

Mateo Diaz-Bone, Daniel Caraballo, Florian Scheidegger, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Roy Assaf, Niccolo Avogaro, Yagmur G. Cinar, Brown Ebouky, Filip M. Janicki, Piotr S. Kluska, Cezary Skura, Cristiano Malossi

2026-06-09视觉感知三维

本文针对工业异常检测在真实场景中因物体尺度、视角、背景和光照变化而失效的问题,指出 MVTec 等基准的高分很大程度依赖受控采集条件。方法在 MMR 特征重建框架上加入视觉提示生成的前景/背景掩码以抑制背景干扰,并通过双教师监督解冻教师网络以提升域适应性,同时用扩散模型生成正常样本做数据增强。实验显示,在更具域偏移的 AeBAD 上较已有最佳结果提升 3.5 个百分点。

Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis Figure 1
2026-06-09cs.CV

Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis

Samuele Punzo, Niccolò Caselli, Ippokratis Pantelidis, Francesco Massafra, Salvatore Lo Sardo, Mohammadreza Salehi

2026-06-09视觉感知

论文关注视频基础模型的高分是否真的对应直觉物理表征,而非视觉捷径或通用运动线索。作者用冻结特征、分层探针和时间扰动控制,在 IntPhys2 与 MVP 上比较 V-JEPA、VideoMAE 和 LTX-Video,洞察是物理信息并非均匀存在,而随预训练目标、层深和读出器能力变化。结果显示 V-JEPA 最强,VideoMAE 接近,LTX-Video 较弱但有信号;中后层更可解码,打乱时序会明显降分。

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving Figure 1
2026-06-09cs.CL

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

University of Waterloo

2026-06-09数据集/基准

本文针对自动驾驶多视角 MLLM 评测只看答案、难以判断模型是否依据正确摄像头证据的问题,提出基于 NuScenes 的视角级证据识别基准:122 个冲突场景问答要求模型在六路相机中选择黄金视角并作答,并区分视角选择、给定黄金视角问答和联合预测。实验表明,该设置能暴露“答对但看错视角”的 grounding 失败;具体性能增益不构成重点,数据规模较小,定位更偏诊断探针。

MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding Figure 1
2026-06-09cs.CV

MAVIS: Multi-Agent Video Retrieval via Structured Video Understanding

Jie Zhang, Qilang Ye, Hao Zhou, Haochen Liang, Fei Luo

School of Computing and Information Technology, Great Bay University, College of Computer Science, Nankai University, Tsinghua Shenzhen International Graduate School, Tsinghua University, Graduate School of Information Science and Technology, The University of Tokyo

2026-06-09视觉感知

针对文本到视频检索中全库 embedding 扫描计算冗余、短查询与高密度视频语义粒度不匹配的问题,MAVIS 将视频预解析为场景、对象、动作等结构化语义库,再由规划器拆解查询并调度专门代理提名候选,通过带否决规则的逻辑辩论剪枝,最后只对争议样本做细粒度匹配。在 MSR-VTT、MSVD 和 ActivityNet 上,文中报告其无需任务微调即可取得有竞争力的性能,并改善效率—精度权衡。

CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation Figure 1
2026-06-09cs.CV

CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Zhucun Xue, Qianyu Zhou, Xiangtai Li, Lizhuang Ma, Jiangning Zhang, Dacheng Tao

2026-06-09视觉感知

针对开源模型在多镜头长视频音画生成中缺少高质量数据、长程稳定性和跨镜头一致性不足的问题,CineDance提出百万级1080p CineDance-1M数据集,通过影视叙事解析、分层双模态标注与音画绑定构建训练监督,并给出CineBench六维评测。基于LTX-2.3微调的模型在音画对齐、主体与环境一致性及单模态质量上优于现有基线;增益可能主要来自高质量数据与规模化标注。

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity Figure 1
2026-06-09cs.CV

ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity

Debojyoti Biswas, Xianbiao Hu

2026-06-09视觉感知强化学习三维

本文针对自动驾驶中30米外目标仅有极稀疏激光点、雾天进一步削弱感知的问题,提出ATN3D以雷达补充LiDAR,并用密度感知早期融合、占据门控邻域聚合、证据条件通道注意力和距离感知损失抑制空体素噪声、强化远距监督。在VoD清晰/重雾场景中,整体mAP分别提升3.55%和8.41%,30米外目标也有2%—3%左右增益。

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience Figure 1
2026-06-09cs.RO

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience

Ruizhe Liao, Wenrui Chen, Liangji Zeng, Haoran Lin, Fan Yang, Kailun Yang, Yaonan Wang

Hunan University

2026-06-09强化学习

DexPIE针对灵巧手模仿学习在真实部署中易累积误差、长时序稀疏奖励下探索和价值评估困难的问题,提出从真实交互经验进行后训练的框架:用适配灵巧手的人类介入与多阶段DAgger扩展覆盖,用相对动作空间异步推理减小示教—部署时序噪声,并以连续最优性指标做细粒度策略改进。在三个真实灵巧操作任务上,相比示教策略成功率提升37%,且优于基线。

TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution Figure 1
2026-06-09cs.CV

TUDSR: Twice Upsampling-Diffusion for Higher Super-Resolution

Zhiqiang Wu, Yitong Dong, Xian Wei

East China Normal University, Zhejiang University

2026-06-09生成模型

TUDSR针对现有扩散超分在×8、2048²等高倍率高分辨率场景中受原生分辨率和放大倍率限制、直接训练大模型成本高的问题,将一次高倍率超分拆成两次上采样-扩散:在同一SD2.1-base骨干上训练两个LoRA,并用循环分块降低第二阶段显存。其实例TUDSR-S在×4/×8多数据集指标上达到SOTA,并能生成1024²乃至2048²高质量结果。

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications Figure 1
2026-06-09cs.RO

Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications

Tao Li, Liang Liu, Jianli Han, Weimin Lv

\authormark 1College of Aerospace Science and Engineering, Naval Aviation University, Yantai 264000, China

2026-06-09优化算法三维

面向自动驾驶多相机相对位姿估计,论文针对传统 6 点/17 点方法在 RANSAC 中计算慢、匹配需求高的问题,利用车辆常见先验提出基于深度平移参数化和一阶旋转近似的统一框架,并给出已知竖直方向、已知转轴方向和平面运动三类 4/4/3 点最小求解器。合成数据与 KITTI 实验显示,其在速度上更适合实时假设生成,同时保持与现有方法相近的精度与鲁棒性。

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur? Figure 1
2026-06-09cs.CV

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh, Rajeev Yasarla, Reza Pourreza, Litian Liu, Risheek Garrepalli, Roland Memisevic

York University, Vector Institute for AI, Work done while employed at Qualcomm AI Research.Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-06-09视觉感知

这篇论文关注视频大模型在真实操作指导中能否“边看边纠错”:用户做菜步骤出错时,模型需及时发现、判断何时介入并给出可执行反馈。作者提出反应式评测基准 Ego-MC-Bench,并用非交互烹饪视频构造反事实合成训练集 Ego-CoMist。实验显示现有视频 LLM 在错误检测和介入时机上仍很困难,而用 Ego-CoMist 微调可稳定提升纠错、时序和步骤完成判断,尤其利于较小的边缘部署模型。

A VideoMAE-v2 Approach to Zero-Shot Traffic Accident Anticipation Figure 1
2026-06-09cs.CV

A VideoMAE-v2 Approach to Zero-Shot Traffic Accident Anticipation

Siyuan Li, Xiaoyang Bi, Mengshi Qi

Team BUPT MIC Lab, State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, ing data is available: the model must learn exclusively, from a publicly available binary-labelled driving-accident, ticipation competition [1]. Code is available at https:, however, collecting and labelling dashcam, in which the model is trained solely on publicly available, licly available accident datasets provide only coarse binary, labels (accident vs. normal). Bridging this granularity gap, available binary-labelled accident dataset into temporally, to recalibrate the output without any target-domain labels

2026-06-09视觉感知

面向行车记录仪事故预判,论文关注目标域事故标注昂贵导致的零样本泛化问题。方法将二分类 Nexar 数据重切为平衡的 5 秒片段,用 VideoMAE-v2 16 帧滑窗加逐帧预测头生成风险序列,并通过重叠平均、插值和免训练测试时校准缓解短窗口与后验压缩。系统获 2026 CVPR@AUTOPILOT 零样本事故预判竞赛第 2 名,消融显示类别平衡和全上下文逐帧建模很关键。

Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation Figure 1
2026-06-09cs.CV

Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation

Lucas Görnhardt, Timo Bartels, Niklas Schwarz, Tim Fingscheidt

2026-06-09视觉感知

面向自动驾驶等安全关键感知中攻击或自然扰动会使 one-hot 模型过度自信、熵检测失效的问题,论文将 Hadamard 编码输出扩展到语义分割和目标检测,并提出基于概率单纯形投影的解码,把码字冗余转化为不一致性检测信号。实验显示在单次前向、几乎无额外开销下达到或接近多次前向检测的 AuROC,同时干净数据性能基本保持参考水平。

SwiftVR: Real-Time One-Step Generative Video Restoration Figure 1
2026-06-09cs.CV

SwiftVR: Real-Time One-Step Generative Video Restoration

Jiaqi Yan, Xiangyu Chen, Xinlin Zhong, Haibin Huang, Chi Zhang, Jie Liu, Jiantao Zhou, Xuelong Li

State Key Laboratory of Internet of Things for Smart City, Department of Computer and Information Science, University of Macau, Institute of Artificial Intelligence (TeleAI), China Telecom, State Key Laboratory for Novel Software Technology, Nanjing University, Project is available at https://h-oliday.github.

2026-06-09视觉感知生成模型

SwiftVR面向直播等低时延场景中高分辨率视频修复难以落地的问题,指出一阶扩散模型的主要瓶颈已转向高分辨率空间注意力和视频自编码器开销。其核心是因果分块流式处理、无mask移位窗口注意力保持标准稠密SDPA路径,以及轻量修复感知自编码器。实验显示单H100可达1440p 31 FPS、4K 14 FPS,RTX 5090上1080p 26 FPS,并在无参考感知质量和成本上优于对比的一阶VR方法。

Securing Self-supervised Data Curation for Foundation Models Robustness Figure 1
2026-06-09cs.CV

Securing Self-supervised Data Curation for Foundation Models Robustness

Sandeep Gupta, Roberto Passerone

2026-06-09安全鲁棒

针对视觉基础模型依赖自监督网页数据筛选、易引入投毒样本的问题,论文将数据完整性检查前置到训练前,提出以预训练 ImageBind 表征结合 RF/KNN/NB/SVM 的 PDD 主动检测器,并支持集成扩展新攻击检测器。作者在 3 个数据集、176,200 张图像和 3 类攻击上评估 20 个变体,结果显示 SVM-PDD 在同分布与跨分布场景均表现最好,但对真实超大规模流水线的部署开销与误报影响文中未充分说明。

Prisma-World: Camera-Controllable Multi-Agent Video World Model Figure 1
2026-06-09cs.CV

Prisma-World: Camera-Controllable Multi-Agent Video World Model

Huiqiang Sun, Zhan Peng, Size Wu, Kun Wang, Kang Liao, Dianyi Wang, Xingyu Zeng, Sheng Jin, Yangguang Li, Zhiguo Cao, Ziwei Liu, Wei Li

School of AIA, HUST, S-Lab, NTU

2026-06-09视觉感知强化学习规划控制

本文针对现有视频世界模型多为单观察者、独立生成多智能体视角会导致重叠区域物体与布局不一致的问题,提出 Prisma-World,将所有智能体视频放入同一全注意力序列联合去噪,并用多智能体 RoPE、相对相机几何注入、重叠递减课程和小地图条件来耦合共享场景。作者还构建 UE5 PrismaDataset 与一致性评测,实验显示单模型可支持可变智能体数量和相机控制,生成质量、跨视角一致性与空间 grounding 优于基线。

ContextShift: A Controlled Benchmark for Context Dependence in Object Detection Figure 1
2026-06-09cs.CV

ContextShift: A Controlled Benchmark for Context Dependence in Object Detection

Dan Zlotnikov, Alex Lazarovich, Ohad Ben-Shahar

Ben-Gurion University of the Negev, Israel

2026-06-09视觉感知规划控制数据集/基准

针对目标检测在真实部署中可能过度依赖背景共现、而现有鲁棒性评测难以隔离上下文因素的问题,ContextShift在COCO上通过几何变换、合成/自然背景替换保持目标外观不变,并用NPMI构造连续的目标—背景兼容性轴。实验显示多类检测器在上下文变化下主要表现为预测抑制:漏检最高增加227%、预测数最多下降44%,AP会掩盖这一召回损失;兼容性与性能呈非单调关系,训练时加入上下文解耦增强可部分恢复性能。

Optical Music Recognition for Real-World Manuscripts with Synthetic Data Figure 1
2026-06-09cs.CV

Optical Music Recognition for Real-World Manuscripts with Synthetic Data

Jiří Mayer, Martina Dvořáková, Vojtěch Dvořák, Markéta Herzánová Vlková, Filip Bím, Pavel Pecina, Samuel Šomorjai, Petr Žabička, Jan Hajič jr

2026-06-09视觉感知强化学习

本文针对音乐图书馆真实手稿乐谱与现有 OMR 训练数据多为数字排版稿之间的域差问题,构建复杂钢琴手稿的低资源基线,并用 MuNG 标注与 Smashcima 从 MusicXML 合成手稿图像进行域适配。实验表明,少量真实域转写仍不可替代,但加入逼真的合成手稿能显著提升真实多样手稿识别;且符号库不必来自目标域,降低了细粒度标注成本。

Efficient Minimal Solvers for Visual-Inertial Relative Pose Estimation in Multi-Camera Systems Figure 1
2026-06-09cs.CV

Efficient Minimal Solvers for Visual-Inertial Relative Pose Estimation in Multi-Camera Systems

Tao Li, Zhenbao Yu, Banglei Guan, Jianli Han, Weimin Lv

Tao Li, Jianli Han, and Weimin Lv are with the College, Zhenbao Yu, and Banglei Guan is with the College of Aerospace, Science and Engineering, National University of Defense Technol-, single center of projection, multi-camera configurations, their multiple projection centers [15], see Fig. 1. This, center components [25]. Chen et al. further demon-

2026-06-09优化算法三维

多相机相对位姿估计虽能扩大视野并恢复尺度,但广义相机几何使传统方法需要较多匹配点且在 RANSAC 中代价高。论文以深度参数化重写广义极几何约束,结合 IMU 提供的竖直方向或旋转轴先验,构造两个仅需 4 点的最小求解器,将求解降为一元 6 次多项式而非常见 8 次。合成数据与 KITTI 实验显示,其计算效率更高,精度与现有方法相当,适合视觉里程计场景。

Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration Figure 1
2026-06-09cs.CV

Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration

Silas Kwabla Gah, Ebenezer Owusu

Department of Computer Science, University of Ghana, text priors weaken on label-disjoint vocabularies., Semantic segmentation, the task of assigning a class label to, classes described only by K labelled support images, a, any training, while LPOSS [24] demonstrates that label, foundation text prior weakens: on a label-disjoint vocab-, label-disjoint open-vocabulary settings without task-, into the final label map.

2026-06-09视觉感知

这篇论文针对 GFSS 依赖训练适配、词表固定的问题,提出 Open-V:冻结 SAM3-PCS 与 CLIP,用 K-shot 支持样本形成 CLIP 类中心,只在推理时对像素级开放词表候选做校准仲裁和边界细化。核心洞察是少样本信息可作为语义 grounding 而非参数更新,且在文本先验较弱的标签不重合场景更有价值。实验覆盖 PASCAL-5i、COCO-20i、ADE-OW;PASCAL-5i 1-shot 达到 78.4/77.5/77.9 base/novel/HM mIoU,较最强训练式基线 HM 高 17.7,同时指出预处理与评测空间错位会显著干扰复现。

GD-MIL: Grade-Disentangled Multiple Instance Learning for Multimodal Biochemical Recurrence Prediction in Prostate Cancer Figure 1
2026-06-09cs.CV

GD-MIL: Grade-Disentangled Multiple Instance Learning for Multimodal Biochemical Recurrence Prediction in Prostate Cancer

Dasari Naga Raju

2026-06-09视觉语言

这篇论文针对前列腺癌根治术后生化复发预测中影像信号常被 Gleason 分级替代、且评估易泄漏的问题,构建严格 TCGA-PRAD 基准,并提出 GD-MIL:用梯度反转对抗去除病理切片表征中的分级信息,再与临床变量后融合。结果显示特征提取器比 MIL 聚合器更关键;GD-MIL 的 C-index 达 0.704,显著优于临床 Cox 基线 0.687 和最佳纯影像模型,但仍需外部验证。

Dense Force Estimation with an Event-based Optical Tactile Sensor Figure 1
2026-06-09cs.RO

Dense Force Estimation with an Event-based Optical Tactile Sensor

Agis Politis, René Zurbrügg, Valentina Cavinato

2026-06-09视觉感知

为突破传统视觉触觉在帧率、运动模糊和带宽上的限制,论文将事件相机用于光学触觉的密集三维力场估计。其关键做法是用事件驱动的标记点跟踪恢复剪切位移,用 U-Net 从稀疏事件推断法向形变,再通过逆有限元映射为物理一致的力。在四类压头、最高约(4N,4N,20N)范围内,剪切/法向力 MAE 为(0.14N,0.10N,0.93N),平均约100Hz。

Leveraging Morphology for Historical Script Metrological Analysis Figure 1
2026-06-09cs.CV

Leveraging Morphology for Historical Script Metrological Analysis

Malamatenia Vlachou Efstathiou, Raphaël Baena, Dominique Stutzmann, Mathieu Aubry

2026-06-09视觉感知

本文针对历史手稿古文字分析依赖专家主观比较、难以规模化和复现的问题,提出用字符形态原型来定义稳定的度量特征。方法将基于 Transformer 的检测式行识别与原型重建结合,仅需行级转写监督即可学习字符原型、位置和形变,并据此测量字符、双字母和词间空间。在 BnF fr.2813 的 160 页案例中,相比 Learnable Handwriter 提升了原型质量与训练稳定性,并能区分不同书手及发现细微书写差异。

vesselFM-CT: Segmenting All Blood Vessels in CT Images for System-Level Cardiovascular Analysis Figure 1
2026-06-09cs.CV

vesselFM-CT: Segmenting All Blood Vessels in CT Images for System-Level Cardiovascular Analysis

Bastian Wittmann, Chinmay Prabhakar, Suprosanna Shit, Bjoern Menze

Department of Quantitative Biomedicine, University of Zurich, Zurich, Switzerland

2026-06-09视觉感知

针对既有CT血管分割多聚焦单一部位、难以支撑全身心血管系统级分析的问题,本文提出“分割所有可见血管”的任务与vesselFM-CT,通过迭代训练、人工校正、合成数据和面向管状结构半径不均衡的TubeLoss/TubeDice处理大血管到细小肠系膜血管的尺度差异。实验显示其较基线获得更完整细致的血管提取,并可用于疾病分类与合成CT生成等下游任务。

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning Figure 1
2026-06-09cs.CV

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

Tsinghua University, University of Science and Technology of China, Shanghai AI Laboratory, Shanghai Innovation Institute, The Chinese University of Hong Kong

2026-06-09视觉语言视觉感知强化学习

针对视觉描述依赖昂贵 SFT 标注、易记忆单一参考且难以客观奖励的问题,CapRL++把“描述是否有用”转化为可验证信号:让无视觉 LLM仅凭生成 caption 回答图像/视频 MCQ,并以正确率及视频时空约束作为 RL 奖励。实验覆盖 20 多个图像与视频基准,显示其提升密集描述质量和基于 caption 的预训练效果,小模型在 Prism 评测中可接近或超过更大 LVLM。

Real-time body pose non-verbal communication with a consistency-based reliability measure Figure 1
2026-06-09cs.CV

Real-time body pose non-verbal communication with a consistency-based reliability measure

Alina Marcu, Dragos Costea, Cristina Lazar, Marius Leordeanu

2026-06-09三维

论文面向远距离、嘈杂或隐私受限的人机交互场景,研究仅凭2D全身姿态实时识别非语言意图。核心贡献是发布含10类意图、15.7万真实帧的数据集,并在Orin Nano上比较12种骨架识别/预测模型,同时提出无需标签的自回归自一致性可靠性度量。结果显示真实数据可达较高可识别性但预测更难,合成集更易因动作模板化;一致性通常能提升可信度判断,但在类间混淆严重时仍会自信出错。

An Opticalmechanics Framework for Dynamic Estimation of Multibody Systems Figure 1
2026-06-09cs.CV

An Opticalmechanics Framework for Dynamic Estimation of Multibody Systems

Banglei Guan, Xuanyu Bai, Qingquan Chen, Zibin Liu, Dongcai Tan, Zhenbao Yu, Yang Shang, Qifeng Yu

National University of Defense Technology

2026-06-09视觉感知

针对人体/多体系统动力学估计依赖接触式力矩传感器和实验室环境的问题,论文将图像测得的运动学量引入受约束多体动力学模型,并用遗传算法最小化预测与观测角速度差来反求关节力矩。气浮平台验证中,腕关节力矩相对传感器平均绝对误差为0.46 N·m,前向预测角速度误差为0.006 rad/s,显示非接触动力估计的可行性。

Echo-DM: Ultrasound Marker Removal via Conditional Latent Diffusion and Region-Aware Fusion Figure 1
2026-06-09cs.CV

Echo-DM: Ultrasound Marker Removal via Conditional Latent Diffusion and Region-Aware Fusion

Zhiwei Wang, Tao Huang, Wentao Jiang, Muyi Li, Jianxin Liu, Jian Chen, Jie Zou, Yong Luo, Bo Du, Jing Zhang

School of Computer Science, Wuhan University, China, School of Computer Science, Hubei University of Technology, China

2026-06-09生成模型

本文针对临床超声图像中测量尺、文字等人工标记会诱导下游模型学习捷径、削弱 clean 输入泛化的问题,提出 Echo-DM:以 DiT 条件潜空间扩散做全局去标记恢复,再用区域感知融合在像素域尽量保留未受影响组织,并支持 VAE/RAE 两种潜表示实现。作者构建 Echo-PAIR 配对数据集,实验显示其相较两阶段基线在标记区域恢复和全图解剖保真上更优,且 Echo-DM-V 偏保真、Echo-DM-R 偏速度与 ROI-PSNR。

PhysScene: A Scene Graph Dataset for Scientific Visual Reasoning in Physics Experiments Figure 1
2026-06-09cs.CV

PhysScene: A Scene Graph Dataset for Scientific Visual Reasoning in Physics Experiments

Minghao Zou, Qingtian Zeng, Shangkun Liu, Yanda Meng, Guanghui Yue, Baoquan Zhao, Abdulmotaleb El Saddik, Wei Zhou

Cardiff University, Shandong University of Science and Technology, University of Exeter, Shenzhen University, Sun Yat-sen University, University of Ottawa, Cardiff University Cardiff UK, Shandong University of Science and Technology Qingdao China, University of Exeter Exeter UK, Shenzhen University Shenzhen China, Sun Yat-sen University Zhuhai China, University of Ottawa Ottawa Canada

2026-06-09数据集/基准

现有场景图基准多面向自然图像,难以评估物理实验中由仪器功能和操作流程决定的关系推理。PhysScene构建了首个物理实验场景图数据集,含4.5K高清图、45.9K物体、34类对象、39类关系和130.4K三元组,强调高关系密度与强语义约束。作者在PredCls、SGDet及零样本设置下测试多种模型,结果显示该数据集能暴露现有SGG方法在实验语义建模和泛化上的不足。

RT-SDGOD: Real-Time Single-Domain Generalized Object Detection Figure 1
2026-06-09cs.CV

RT-SDGOD: Real-Time Single-Domain Generalized Object Detection

Yupeng Zhang, Fangzhuo Gao, Ruize Han, Wei Feng, Liang Wan

2026-06-09视觉感知

面向自动驾驶、监控等实时场景中天气和成像变化导致的单源域检测失效,论文提出RT-SDGOD设定,要求测试时零额外开销。作者洞察到DETR式实时检测器主要因漏检上升而退化,根源是判别证据局部且不稳定;据此提出RT-SDGDet,用O2M查询组、证据多样性和双视图一致性在训练期扩展并稳定目标证据。多未见域实验显示其较现有方法有更好泛化且不增加推理成本。

Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study Figure 1
2026-06-09cs.CV

Zero-Shot Semantic Re-Identification for Autonomous Driving: A VLM Baseline Study

Eduardo Borges, Manuel Abreu, Luís Garrote, Urbano J. Nunes

2026-06-09视觉语言

自动驾驶中的 ReID 常依赖视觉外观嵌入,易受视角、遮挡、光照和传感器域变化影响且可解释性有限。本文将 VLM 生成的车辆/行人等结构化语义描述作为零样本中间表示,再编码文本并用余弦相似度检索身份,探索语言属性能否支撑匹配。结果显示其检索性能可接近监督 CNN 基线,并提供显式身份线索,但跨视角属性不一致和相似实例细粒度区分不足仍是主要限制。

ExDet: Open-Domain Open-Vocabulary Detection with Cross-modal Extrapolation and Rectification Figure 1
2026-06-09cs.CV

ExDet: Open-Domain Open-Vocabulary Detection with Cross-modal Extrapolation and Rectification

Yupeng Zhang, Yuzhong Feng, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

College of Intelligence and Computing, Tianjin University, Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology, School of Artificial Intelligence, Nanchang University, College of Intelligence and Computing, Tianjin University Tianjin China, Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology Shenzhen China, School of Artificial Intelligence, Nanchang University Jiangxi China

2026-06-09视觉感知

针对开放域开放词表检测同时面临新类别与未见域、且现有方法需重训检测器成本高的问题,ExDet利用VLM文本/视觉空间的DeltaSpace结构,从文本外推出类别-域代理视觉原型,并以训练无关、无真实数据的DCR在推理时校正分类表示;同时ExRPN融合语义相似度与RPN置信度提升候选召回。文中在OD-LVIS、OV-LVIS、Objects365和MSOSB上报告SOTA,且单卡约30分钟训练。

Beyond Humans: Multispecies Animal Face Recognition Using Transfer Learning Figure 1
2026-06-09cs.CV

Beyond Humans: Multispecies Animal Face Recognition Using Transfer Learning

Maria De Marsico, Anil K. Jain, Annalaura Miglino

2026-06-09视觉感知

针对宠物找回、濒危物种跟踪和农场个体识别中芯片、耳标等接触式方案侵入性强且动物身份标注数据不足的问题,论文考察将人脸预训练的 FaceNet 与 ImageNet 预训练的 ViT 作为迁移学习骨干用于多物种动物脸识别,而非设计专用网络。实验覆盖犬、灵长类和牛:ViT 在犬脸上达到 96.85% 验证准确率和 84.34% Rank-1,在牛脸上优于既有方法,灵长类结果受图像质量和类别差异影响,未稳定超过 SOTA。

Taming Perception Jitter: Uncertainty-Aware LiDAR Object Detection for Reliable Motion Classification Figure 1
2026-06-09cs.RO

Taming Perception Jitter: Uncertainty-Aware LiDAR Object Detection for Reliable Motion Classification

Cornelius Schröder, Žygimantas Marcinkus, Markus Lienkamp

This research was funded by the Bavarian Research Foundation. 1 Institute for Automotive Engineering, Munich Institute of Robotics and Machine Intelligence, School of Engineering and Design

2026-06-09视觉感知安全鲁棒

本文针对自动驾驶中 LiDAR 3D 检测框跨帧抖动会被跟踪器误估为速度、进而把静态障碍误判为动态并触发不必要停车的问题,给 CenterPoint 增加偶然不确定性方差头,并在短时间窗内用两样本 z 检验区分真实运动与感知抖动。方法可复用 Autoware 的关联与协方差字段,部署改动小;在 nuScenes 上与速度阈值相当,但实车中显著减少虚假动态轨迹和无谓停车,关键洞察是实车数据存在速度规则易误判的“抖动带”。

IB-HFN: Information Bottleneck-Driven SAR-Optical Fusion Network for High-Fidelity Cloud Removal Figure 1
2026-06-09cs.CV

IB-HFN: Information Bottleneck-Driven SAR-Optical Fusion Network for High-Fidelity Cloud Removal

Haojun Guo, Fan Feng, Ziquan Wang

2026-06-09视觉感知

针对SAR辅助光学遥感去云中,早期拼接易把SAR斑点噪声传入重建、像素损失又导致纹理过平滑的问题,IB-HFN用双流骨干延后跨模态融合,并在融合处以通道变分信息瓶颈压缩SAR特征、用局部-全局门控保留可信光学细节,再配合结构、光谱和锐度等联合损失动态训练。在SEN12MS-CR的时空划分实验中,方法相较现有模型表现出更好的结构保持和光谱保真。

Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning Figure 1
2026-06-09cs.CV

Reason Twice: Segmentation via Candidate Discovery and Comparative Reasoning

Xinyan Gao, Haoran Hao, Xiangyu Yue

2026-06-09视觉感知

针对现有MLLM分割方法在复杂推理查询中难以把语言推理可靠传递给掩码解码器、且评测偏常识的问题,论文提出Rea2Seg:先利用分割MLLM注意力发现候选掩码,再让MLLM比较候选并打分重排,将分割转为判别式选择;同时构建ReasonSeg-SGDR与训练数据。实验显示其在新基准和ReasonSeg上相较既有推理分割模型取得一致提升。

Virtual-point-based Solutions to Handle Generalized Absolute Pose Problem Figure 1
2026-06-09cs.CV

Virtual-point-based Solutions to Handle Generalized Absolute Pose Problem

Bin Li, Banglei Guan, Shunkun Liang, Yang Shang

projection centers. This paper introduces a virtual point, will be made publicly available upon acceptance., Bin Li is with the Hunan Institute of Advanced Technology, Changsha, China, and also with the College of Aerospace Science and, Engineering, National University of Defense Technology, Changsha, Banglei Guan, Shunkun Liang, and Yang Shang are with the College, of Aerospace Science and Engineering, National University of Defense, Provincial Key Laboratory of Image Measurement and Vision Navigation, one projection center. Among them, multi-camera systems can, centers, traditional PnP algorithms designed for a single camera, which assume a single optical center, cannot be directly applied, projection centers into the virtual point coordinates and

2026-06-09三维

面向多相机机器人/导航中多投影中心使传统 PnP 难以直接适用的问题,论文用“虚拟点”把广义绝对位姿转化到标准 PnP 框架,进而派生 Cayley、四元数和旋转矩阵三类 VGP 求解器。实验显示其基本继承原 PnP 的精度与效率:VGPc 在异方差噪声下更准,VGPq 保持全局最优性,VGPr 速度最快且无明显精度损失。

Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning Figure 1
2026-06-09cs.CV

Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

Haoran Xu, Hongyu Wang, Yifei Gao, Jiaze Li, Zizhao Tong, Xiaofeng Zhang, Xiaosong Yuan

Zhejiang University 2Hunan University 3Tianjin University, University of Chinese Academy of Sciences, Shanghai Jiao Tong University 6Jilin University, on final labels. The shared policy is trained, ent conflict among collaborative roles. A native, organize visual reasoning as multi-role collabora-, role collaboration framework, termed Visual Para-, kens, our approach enables subagents to collabo-, To realize this multi-agent collaboration within, der a fixed four-path collaboration protocol (Fig. 1).

2026-06-09强化学习

针对视觉推理中证据分散、单条 CoT 容易过早锁定感知并产生幻觉的问题,本文提出 Visual Para-Thinker++:用同一个 MLLM 策略通过角色条件化扮演 Main、Worker、Summary,多 Worker 隔离并行取证,Summary 按完整推理轨迹融合;训练上用角色化 SFT 与分角色奖励/优势缓解梯度冲突,并用 KV cache 复用降成本。实验称其在 V*、CountBench、MMVP、RefCOCO、HallusionBench 等上优于长 CoT、自一致性和多智能体辩论,幻觉敏感任务增益更明显。

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models Figure 1
2026-06-09cs.CV

EditSSC: Toward Editable Semantic Occupancy Scenes with Unconditional Diffusion Models

Fatima Balde, Raoul de Charette, Alexandre Boulch

2026-06-09生成模型

面向自动驾驶中3D语义占据场景数据稀缺且需可控编辑的问题,EditSSC的关键洞察是将体素占据重排为多通道BEV图像,用近乎标准的VQ自编码器和Stable Diffusion式潜空间UNet替代复杂三平面3D架构,并利用码本中的类别-编码对应实现无需重训的草图引导、补全和外扩。在SemanticKITTI上,其无条件生成优于现有3D专用基线,LiDAR条件设置也保持竞争力。

See More, Match Better: Multi-Source Feature Fusion for Two-View Correspondence Learning Figure 1
2026-06-09cs.CV

See More, Match Better: Multi-Source Feature Fusion for Two-View Correspondence Learning

Xiaojie Li, Xin Jiang, Luanyuan Dai, Jinnan Yang, Yongdong Zhang, Zechao Li

2026-06-09视觉感知

该文针对两视图匹配中过度依赖坐标几何一致性、难以排除重复纹理和弱纹理场景中的“伪一致”外点的问题,提出 TriMatch:将几何特征与 CNN 纹理语义、DINOv2 结构语义对齐融合,并用语义调制和层级细化建模对应关系依赖。实验显示其在多基准、不同描述子下达到或超过现有方法,鲁棒性和泛化性更好。

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition Figure 1
2026-06-09cs.CV

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

Hefei University of Technology, Hefei, China, United Arab Emirates University, Al Ain, United Arab Emirates, Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Anhui Evolution Technology Co., Ltd., Hefei, China, Nanyang Technological University, Singapore, University College London, United Kingdom, The University of Sydney, Sydney, New South Wales, Australia, Beijing QBoson Quantum Technology Co., Ltd., China, Abstract. In this paper, we present XInsight Lab’s solution to the, on 120K unlabeled clips via masked video modeling and then fine-tuned, learning transferable representations from unlabeled in-domain videos., unlabeled data, making it well-suited to scarce and imbalanced micro-gesture an-

2026-06-09视觉感知

微手势短暂且幅度小,标注稀缺、类别不均衡,使纯监督骨架或多模态方法容易受噪声与长尾影响。本文的关键做法不是设计复杂新结构,而是将基于 SMILE 掩码视频建模的自监督 RGB 分支先在 12 万无标注域内片段预训练,再与 Video Swin、PoseConv3D 等监督多流模型做加权融合;单个自监督 RGB 分支在 iMiGUE 达到 69.224% top-1,最终集成达到 74.419%,较此前 SOTA 提升 1.206 个百分点并获 MiGA 2026 Track 1 第一。

A practical probabilistic framework for deformable image registration uncertainty in radiotherapy dose propagation Figure 1
2026-06-09cs.CV

A practical probabilistic framework for deformable image registration uncertainty in radiotherapy dose propagation

Stefan Heldmann, Sven Kuckertz, Nasim Givehchi, Thomas Coradi, Mikel Byrne, Ben Archibald-Heeren, Nils Papenberg

Fraunhofer Institute for Digital Medicine MEVIS, L¨ubeck, Germany

2026-06-09视觉感知安全鲁棒

针对放疗中可变形配准缺乏稠密真值、误差会传递到剂量累积和 DVH 评估的问题,论文提出轻量概率框架:用可解释的局部 certainty map 将每个体素映射建模为随机变量,并输出期望剂量、置信界和 DVH 包络。前列腺案例显示,不确定性边界主要受 certainty map 设计影响,核函数选择影响较小,结构引导 in/out 策略收益有限且具病例依赖性。

LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution Figure 1
2026-06-09cs.CV

LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

2026-06-09视觉感知生成模型

LiteVSR针对生成式视频超分在新域适配中全量微调成本高、ControlNet式DiT适配需复制骨干的问题,利用flow matching恒定速度场的洞察,将条件注入简化为固定模式学习,并冻结全部Diffusion Transformer,仅训练双流State-Aware Adapter,以低质结构和中间去噪状态经时序交叉注意力动态引导。文中报告仅11.25%可训练参数、单A100约12 GPU小时训练,在多个真实/合成基准上取得有竞争力的感知质量,并支持最快单步采样。

MAGIS: Evidence-Based Multi-Agent Reasoning for Interpretable Strabismus Clinical Decision-Making Figure 1
2026-06-09cs.CV

MAGIS: Evidence-Based Multi-Agent Reasoning for Interpretable Strabismus Clinical Decision-Making

Xikai Tang, Yifan Wang, Jiafan Zhuang, Li Luo, Jinming Guo, Xiaoling Xie, Jiacheng Liu, Peiwei Wei, Lihao Zhong, Xiaoli Kang, Jie Cen, Guangqiang Yin, Kunliang Qiu, Ce Zheng, Zhun Fan

2026-06-09视觉感知

针对斜视细分类诊断中黑箱模型缺少可验证推理、LVLM易产生与图像或临床规则不一致幻觉的问题,MAGIS将诊断拆为候选假设、双证据约束上下文、证据校验纠错和报告生成,并用九方位眼位图像、热图线索与医生规则共同约束多智能体推理。在细粒度斜视基准上,weighted F1由72.0%提升至91.3%,报告一致性、对齐性和完整性也更好。

Temporal-Aware Reasoning Optimization for Video Temporal Grounding Figure 1
2026-06-09cs.CV

Temporal-Aware Reasoning Optimization for Video Temporal Grounding

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

2026-06-09视觉语言视觉感知优化算法

针对视频时序定位中强化学习推理常停留在表面、随机探索低效且奖励只看答案 IoU 的问题,TaRO 将“带时间思考”显式纳入优化:用带时间戳的密集字幕构造高质量推理轨迹,并通过扰动关键边界后推理置信度下降来奖励时序敏感性,再以课程式训练过渡到自由探索。实验显示其在多个 VTG 基准上达到 SOTA。

SOMA: From Surface Observations to Muscle Anatomy Figure 1
2026-06-09cs.CV

SOMA: From Surface Observations to Muscle Anatomy

Eduardo Alvarado, Emily Kim, Gerrit Nolte, Friedemann Runte, Mario Botsch, Marc Habermann, Christian Theobalt

2026-06-09视觉感知

现有人体模型多停留在皮肤表面,FEM 或医学影像又难以规模化捕获动态肌肉。SOMA 将问题反向设定为由多视角 RGB/姿态和皮肤时空形变推断个体肌肉形变,并发布 SKIM 数据集;其用解耦 blendshape 与物理几何先验把表面变化传播到个体肌肉网格,实现可交互、解剖一致的内部动画,但定量增益幅度文中片段未充分说明。

Proposal Refinement for Few-Shot Object Detection Figure 1
2026-06-09cs.CV

Proposal Refinement for Few-Shot Object Detection

Yuan Zeng, Bin Song, Jie Guo, Yuwen Chen

2026-06-09视觉感知

本文针对少样本目标检测中基础类与新类候选框数量严重失衡的问题,指出两阶段检测器的新类精度受 RPN proposal 分布限制。方法在基类训练阶段引入 refinement loss,减弱基类样本对新类参数的抑制梯度;微调阶段为 RPN 增加 refinement branch 以提升新类候选框比例。实验称在 VOC/COCO 等基准较基线提升约 1%–6%,且不增加推理时间。

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video Figure 1
2026-06-09cs.CV

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video

Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

2026-06-09视觉感知

针对机器人操作和VR中全手抓握压力难以用侵入式触觉硬件大规模获取的问题,EgoTactile将自我中心视频与63类日常3D物体的全手压力监督配对,并加入裸手迁移子集。方法上用条件视频扩散模型EgoPressureDiff结合预训练视频先验与物理属性特征校正,处理遮挡和重量、材质等视觉歧义。实验显示其在该基准上优于判别式基线,并具备一定野外迁移能力。

Semi-supervised Source Detection in Astronomical Images: New Benchmark and Strong Baseline Figure 1
2026-06-09cs.CV

Semi-supervised Source Detection in Astronomical Images: New Benchmark and Strong Baseline

Longhan Feng, Zihuang Cao, Ali Luo, Yuanhao Guo, Shuilian Yao, Yixin Guo, Qi Jia, Yu Liu

School of Software, Dalian University of Technology, Chinese Academy of Sciences, Research Institute of Highway, code is available at https://github.com/AcWiz/NovaTeacher., semi-supervised object detection, pseudo-labeling., available during training. However, astronomical sources are small, such methods still assume the availability of a substantial amount of, fully-labeled images, and tend to struggle in astronomical domains, In this work, we propose a new dataset benchmark and label-, a dual-teacher paradigm and pseudo-label guidance to enhance, ploiting confidence scores to stratify pseudo-labels, as a result of

2026-06-09视觉感知数据集/基准

这篇论文针对天文图像中星源密集、PSF 扩散和低信噪比导致检测召回下降,以及完整标注成本过高的问题,构建了 LAMOST-DET 基准,含 18,400 张图像和 728,898 个星源实例;并提出 Nova Teacher,在双教师半监督框架中结合光源增强、置信度引导伪监督和跨视角互补挖掘。实验显示其在两种稀疏标注设置下较已有方法提升 4.04% 和 5.22% mAP,并在自然图像数据上具备一定泛化性。

Minimal Solvers for Full-DoF Motion Estimation from Asynchronous Differential SfM Figure 1
2026-06-09cs.CV

Minimal Solvers for Full-DoF Motion Estimation from Asynchronous Differential SfM

Shuo Pan, Banglei Guan, Bin Li, Zhenbao Yu, Zibin Liu, Zi Wang, Yang Shang, Qifeng Yu

College of Aerospace Science and Engineering, National University of Defense Technology, Changsha 410073, China, The Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation, Changsha 410073, China

2026-06-09优化算法

针对事件相机数据异步、传统帧式自运动估计易产生延迟和时间离散误差的问题,论文从异步光流出发重写微分对极约束,并将角速度与线速度解耦,提出可用最少5个点估计全自由度运动的特征值迭代求解器,以及基于一阶旋转近似和Gröbner基的代数最小求解器及加速版本。合成与真实数据实验显示,相比同步方法在精度和抗时空噪声鲁棒性上更好,加速版以小幅精度损失换取近一数量级速度提升。

Event-driven dynamic trajectories reconstruction and measurement of mechanical parameters for fragments Figure 1
2026-06-09cs.CV

Event-driven dynamic trajectories reconstruction and measurement of mechanical parameters for fragments

Haoyang Li, Banglei Guan, Muxi Zha, Yifei Bian, Minzu Liang, Yang Shang, Qifeng Yu

a School of Aeronautics, Northwestern Polytechnical University, Xi’an, Shaanxi 710072, China, b College of Aerospace Science and Engineering, National University of Defense Technology, c College of Science, National University of Defense Technology, Changsha, Hunan 410073, China

2026-06-09三维

针对爆炸碎片高速、高密度且受强闪光烟尘遮挡导致传统高速相机难以同时获得高动态范围与高时间分辨率的问题,论文构建多事件相机系统,用时间相关极线、三焦张量线和局部单应约束结合熵权概率模型筛除误匹配,并通过空间线交会与非线性优化重建三维轨迹、估计速度和动能。仿真中标定板重建误差为0.041%/0.128%、速度误差1.0%,真实无人机验证轨迹平均相对误差0.51%。

Trajectory Optimization in Single and Dual-UAV Bearing-Only Target Localization Figure 1
2026-06-09cs.RO

Trajectory Optimization in Single and Dual-UAV Bearing-Only Target Localization

Zhijian Xiao, Huayu Huang, Bin Li, Yang Shang, Banglei Guan

College of Aerospace Science and Engineering, National University of Defense Technology, Changsha 410073, China, Hunan Key Laboratory of Image Measurement and Visual Navigation, Changsha 410073, China

2026-06-09规划控制优化算法

面向单/双无人机仅方位目标定位中观测几何退化、传统 FIM 目标易陷入奇异构型的问题,论文将主动轨迹规划与机动约束结合,提出谱加权 FIM 目标、双机视线交角正弦项及带粒子归一化的约束 PSO,以改善可观测性并避免双机聚集。仿真显示,相比常规 FIM 方法,单机中位定位误差降低 99.21%,双机提升 69.70%,但结果主要来自仿真验证。

CP4D: Compositional Physics-aware 4D Scene Generation Figure 1
2026-06-09cs.CV

CP4D: Compositional Physics-aware 4D Scene Generation

Hanxin Zhu, Cong Wang, Tianyu He, Long Chen, Xin Jin, Chen Gao, Zhibo Chen

2026-06-09视觉感知

本文针对现有4D生成常忽略物理规律、导致动态场景不一致的问题,提出CP4D:将场景拆为静态3D背景与受物理约束的动态前景,先生成并重建各组件,再结合物理仿真与视频扩散先验合成运动,最后用深度启发和优化自动组合。实验显示其在视觉真实感、物理合理性和可控交互上优于已有方法。

Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA Figure 1
2026-06-09cs.CV

Counterfactual Reasoning for Fine-Grained Evidence Disentanglement in VideoQA

Zhou Du, Hamid Krim, Xiao Wu, Zhaoquan Yuan, Liangwei Li, Keisuke Fujii

School, University, Hamid Krim is with the Department of Electrical and Computer Engi-, neering, North Carolina State University, Raleigh, NC 27695, USA (e-mail:, Xiao Wu and Zhaoquan Yuan are with the School of Computing and, Artificial Intelligence, Southwest Jiaotong University, Chengdu 611730, China, Liangwei Li is with School of OptoElectonic Science and Engineering, University of Electronic Science and Technology of China, Chengdu 610031, are rarely available for most VideoQA datasets. (3) A few

2026-06-09视觉感知

这篇论文针对 VideoQA 模型“答对但未基于真实视觉证据”的问题,认为根源在于 ERM 易学习伪相关。作者提出 CREDiT,用结构因果模型刻画问答过程,将跨模态特征拆为因果与非因果部分,并通过独立性、最小性约束及特征级反事实干预抑制混杂。实验在 NExT-GQA、SportsQA、SPORTU-video 上取得 70.4%、60.4%、71.9% Acc@QA,并提升 grounded QA,显示其更能定位因果证据。

Claude Code-Driving Scenario Mining for the Argoverse 2 Challenge Figure 1
2026-06-09cs.CV

Claude Code-Driving Scenario Mining for the Argoverse 2 Challenge

Wei Deng, Caoshengzhe Xue, Shuaikun Liu, Zhaohong Liu, Mengshi Qi, Huadong Ma

State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China

2026-06-09视觉感知

面向 Argoverse 2 中按自然语言描述定位自动驾驶场景的挑战,论文提出将场景挖掘转化为可组合原子函数代码生成:用 Claude Code/GLM 5.1 代理检索函数并生成代码,经训练集 Timestamp BA>0.8 筛选少样例、独立语义审查,再用 Qwen3-VL 做场景级验证以压低误报。测试集 HOTA-Temporal 为 27.91、Timestamp BA 为 69.65,优于官方 RefProg 和 SM-Agent 基线,但排名中游,增益来源仍部分不清。

IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation Figure 1
2026-06-09cs.AI

IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation

Lingyi Meng, Zecong Tang, Haoran Li, Tengju Ru, Zhejun Cui, Weitong Lian, Qi Kang, Hangshuo Cao, Yichen Zhu, Yechi Liu, Kaixuan Wang, Yu-Jie Yuan, Chunwei Wang, Yu Zhang, Bo Dai

Zhejiang University, The University of Hong Kong, Institute of Automation, Chinese Academy of Sciences

2026-06-09视觉语言强化学习数据集/基准

现有统一多模态模型评测多停留在单轮或静态问答,难以反映真实交错图文多轮交互中的理解—生成耦合与误差累积。IMUG-Bench构建静态空间、时序因果、混合三类任务,含3113样本、12034轮,并引入动态理解问题。实验显示主流开闭源模型在长上下文多轮生成中明显暴露偏差;CoT、自验证和Best-of-N等测试时scaling可提升生成准确率并缓解退化。

Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating Figure 1
2026-06-09cs.CV

Vision-Language Guided Hyperspectral Object Tracking via Semantics Fusion and Contextual Template Updating

Rui Yao, Yuhong Zhang, Kunyang Sun, Hancheng Zhu, Jiaqi Zhao, Zhiwen Shao, Abdulmotaleb El Saddik

is available at https://github.com/rayyao/VLHTrack., wen Shao are with the School of Computer Science and Technology / School, of Artificial Intelligence, and Mine Digitization Engineering Research Center, gineering Center for Intelligent Sensing and Emergency IoT in Underground, Space, China University of Mining and Technology, Xuzhou 221116, China, Abdulmotaleb El Saddik is with the School of Electrical Engineering and, Computer Science, University of Ottawa, Ottawa, ON K1N 6N5, Canada (E-

2026-06-09视觉语言视觉感知

该文针对高光谱目标跟踪中谱段冗余、固定/启发式选带难适应场景,以及遮挡和光照变化导致模板失效的问题,提出 VLHTrack:用 LLM 生成的目标语义指导谱段选择,建立语义到光谱映射,并融合视觉语言特征;同时用 Mamba 式 DTUM 动态更新模板。HOT2023/2024 实验显示其总体 AUC、DP 优于多种 SOTA,消融表明 LBSM 与 DTUM 均带来稳定增益。

Zero-Parameter Geometric Gating for Temporally Stable Low-Altitude UAV Video Semantic Segmentation Figure 1
2026-06-09cs.CV

Zero-Parameter Geometric Gating for Temporally Stable Low-Altitude UAV Video Semantic Segmentation

Jingpu Yang, Fengxian Ji, Zhengzhao Lai, Juanfan Wu, Mingxuan Cui, Yufeng Wang

Beihang University, Northeastern University, The Chinese University of Hong Kong, Shenzhen, Beijing Institute of Technology, Beihang University China, Northeastern University China, The Chinese University of Hong Kong, Shenzhen China, Beijing Institute of Technology China

2026-06-09视觉感知

低空无人机视频分割常受边界闪烁影响,而大面积道路、建筑等平面区域中稠密光流会引入结构化噪声。论文提出无需学习参数的几何门控:用RANSAC单应性内点率在16×16网格上选择单应或光流 warp,再经SSP融合。合成UAVid上两类骨干mIoU提升约4.24–4.91%,平面区域时间一致性由62%升至92%,但真实数据验证仍文中未充分说明。

OmniGen-AR: AutoRegressive Any-to-Image Generation Figure 1
2026-06-09cs.CV

OmniGen-AR: AutoRegressive Any-to-Image Generation

Junke Wang, Xun Wang, Qiushan Guo, Peize Sun, Weilin Huang, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Collaborative Innovation Center of Intelligent Visual Computing, Bytedance Seed, 4 The University of Hong Kong

2026-06-09视觉感知

现有自回归视觉生成多依赖单一文本或类别条件,难以覆盖真实应用中的空间控制、参考图和历史帧等多源输入。OmniGen-AR将文本与各类视觉条件统一离散成token,并提出DCA在训练中解耦条件/内容注意力以抑制信息泄漏。其在文生图、编辑、帧预测、深度/分割条件生成和文生视频等六类任务上达到SOTA或竞争结果,如GenEval 0.63、VBench 80.02。

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions Figure 1
2026-06-09cs.CV

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions

Luxury, Jie Huang, Zihao Fan, Xiaoxiao Ma, Yuming Li, Jun-hao Zhuang, Zeyue Xue, Siming Fu, Haoran Li, Mingchen Zhong, Guohui Zhang, Shichen Ma, Yijun Liu, Jiaqi Shi, Yanwen Ma, Yaofeng Su, Haoyu Wang, Yaowei Li, Songchun Zhang, Weiyang Jin, Yuxuan Bian, Shiyi Zhang, Haojun Xu, Shuai Lu, Xin Han, Wei Tang, Haoyang Huang, Nan Duan

JD Explore Academy, 2USTC, 3PKU, 4THU, 5BUAA, 6FDU, 7HKUST, 8HKU, 9CUHK, Low latency, scalable, scalable, real-time high-resolution video generation a fundamental open challenge., sparse causal attention MIT HAN Lab (2025) replaces dense attention for streaming-compatible

2026-06-09视觉感知

面向实时预览、交互式内容生成等需要高分辨率低延迟视频的场景,Ultra Flash 采用级联式流式生成:先由低分辨率自回归模型生成语义与运动,再通过保持架构的 T2V-to-TV2V 超分训练、因果潜空间上采样与高分辨率解码、稀疏因果化和单步蒸馏实现高效放大。实验显示其在单 GPU 上达到约 30FPS@1K、18FPS@2K,并在人类偏好和视觉质量上优于对比方法。

CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms Figure 1
2026-06-09cs.CV

CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms

Yanze Jiang, Yanfeng Gu, Xian Li

aSchool of Electronics and Information Engineering, Harbin Institute of Technology, Harbin 150001, China

2026-06-09视觉语言视觉感知三维

本文针对无人机俯视场景中树冠遮挡导致 LiDAR 与相机退化程度不同、传统车载多模态融合难以适配的问题,提出 CAMF-Det:用类 Beer–Lambert 物理模型离线构建双模态遮挡强度,并训练网络在线预测,将遮挡先验注入增强、编码、融合和检测头。在两个自建 UAV 多模态数据集上,其困难级 mAPBEV 较最强基线分别提升 9.43% 和 4.88%。

Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models Figure 1
2026-06-09cs.CV

Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models

Danya Li, Xiang Su, Yan Feng, Rico Krueger

Danya Li and Rico Krueger are with Department of Technology, Management, and Economics, Technical University of Denmark, Denmark

2026-06-09视觉感知

本文关注车载/路侧视角难以捕捉行人第一人称感知的问题,将短时自我中心视频中的过街意图预测改写为封闭式 VQA,用通用 VLM 评估并经参数高效微调适配交通场景。零样本模型仅略优于随机且高层交通推理不足;微调后显著提升,较专用 Transformer 基线准确率高 9%,加入自运动、车辆运动与眼动线索后,Qwen3-VL-2B 最高提升 14.5%。

DiffSight-Former: Modeling Structural Differences and Temporal Dynamics for Glaucoma Progression Prediction Figure 1
2026-06-09cs.CV

DiffSight-Former: Modeling Structural Differences and Temporal Dynamics for Glaucoma Progression Prediction

Yi Huang, Lei Bi, Jinman Kim

2026-06-09视觉感知

针对单时点眼底图像难以捕捉青光眼早期进展、常规序列模型又易依赖固定长度或已患病外观线索的问题,DiffSight-Former利用眼底基础模型提取时变解剖特征,显式建模视盘/视杯与血管的访视间结构差异,并结合时间间隔嵌入的Transformer预测未来发病风险。在SIGF上AUC达91.54%、敏感度92.16%,在GRAPE三种视野进展标准下平均准确率87.48%。

A Geometric Framework for Absolute Pose and Velocity Estimation with Event Cameras Figure 1
2026-06-09cs.CV

A Geometric Framework for Absolute Pose and Velocity Estimation with Event Cameras

Zibin Liu, Shunkun Liang, Banglei Guan, Yang Shang, Qifeng Yu, Ji Zhao

2026-06-09三维

针对事件相机几何方法多聚焦速度、难以将稀疏异步事件锚定到3D地图以估计绝对位姿的问题,论文利用场景3D线与触发事件建立正交与共线约束,提出线性/多项式位姿求解器及线性/优化速度求解器,最少三组事件-线对应即可独立恢复6DoF位姿或速度;仿真和真实数据表明其精度与效率优于现有方法。

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs Figure 1
2026-06-09cs.RO

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs

Jiangtao Shuai, Zongxiong Chen, Manfred Hauswirth, Sonja Schimmler

Technical University of Berlin, Germany and 2 Fraunhofer FOKUS, Germany.

2026-06-09视觉语言

本文针对机器人数字孪生中 USD 场景对象难以自动映射到本体类别、手工词典脆弱的问题,提出用 LLM 将 USD 属性与线性化 TBox 结合做零样本 grounding。核心洞察是性能主要来自场景图中的语义线索而非几何:厨房 125 物体上,描述性命名达 90–96%,缩写命名 49–89%,不透明命名靠上下文最高恢复到 48%,但匿名化父路径和兄弟名后仅 0–6%。

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation Figure 1
2026-06-09cs.AI

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

Siyuan Liu, Jinyang Wu

2026-06-09视觉语言视觉感知

本文针对多模态大模型将图像与文本 token 等深处理导致视觉计算冗余的问题,指出 LLaVA 中视觉 token 在中层已趋于饱和,而文本仍需深层语义推理。作者提出 DPVR-LF:在饱和层后将视觉 token 路由到一层可训练侧枝,深层主干只处理文本,并在最后一层再融合。实验显示其仅训练约 3% 参数,在 7B/13B 多个基准上接近或超过全量微调,同时降低约 25–30% 前向计算、A800 延迟下降 28%。

An Enhanced Geometric-Spectral Feature Learning Framework for Airborne Multispectral Point Cloud Classification Figure 1
2026-06-09cs.CV

An Enhanced Geometric-Spectral Feature Learning Framework for Airborne Multispectral Point Cloud Classification

Xian Li, Yanfeng Gu, Aleksandra Pižurica

codes and datasets used in this paper will be made available, Xian Li and Yanfeng Gu are with the School of Electronics and, Information Engineering, Harbin Institute of Technology, Harbin 150001, Aleksandra Pižurica is with the Department of Telecommunications and, Information Processing, UGent-GAIM, Ghent University, 9000 Ghent, Especially when the number of labeled training data is limited, incorporates a long-tail center loss and a minimum margin loss, classification, which will be openly available after a possible, labeled and denote the labeled set by, nr denotes the class label from the set, predict the labels of unlabeled points., joint loss that incorporates long-tail center loss and minimum

2026-06-09三维

本文针对机载多光谱点云分类中空间—光谱异构、高维、长尾类别和类间光谱相似导致的小类识别困难,提出轻量级几何—光谱双流框架:一支用位置编码自注意力建模全局光谱,另一支以光谱引导多核点卷积提取局部几何,并用残差注意力融合;同时设计长尾中心损失与最小间隔损失。作者构建两个机载MPC数据集,实验显示相较多种点云分类方法更有效,但具体增益幅度需依赖正文表格核验。

Illumination-Invariant Anomaly Detection for Sub-Canopy UAV Multispectral Point Clouds Figure 1
2026-06-09cs.CV

Illumination-Invariant Anomaly Detection for Sub-Canopy UAV Multispectral Point Clouds

Likun Chen, Yanfeng Gu, Xian Li

School of Electronics and Information, Harbin Institute of Technology, with center wavelengths of 444, 475, 531, 560, 650, 668, 705, Final Label ( k ), same illumination label as the center point:

2026-06-09视觉感知三维

面向林下无人机多光谱点云异常检测,论文针对植被阴影导致的光照异质性和暗物体误判问题,提出无需飞行元数据的框架:用NSVDI粗分阴影并通过光线追踪反演太阳角校正,再仅以同光照状态邻域构建稀疏表示背景字典。实验显示该方法在复杂森林中提升异常与背景可分性,并优于若干基线。

HDRAgent: An Agentic Framework for Multi-Exposure HDR Imaging Figure 1
2026-06-09cs.CV

HDRAgent: An Agentic Framework for Multi-Exposure HDR Imaging

Weiyu Zhou, Tao Hu, Yijian Wang, Xiaogang Xu, Ruixing Wang, Qingsen Yan

Weiyu Zhou, Tao Hu, Yijian Wang and Qingsen Yan are with the School, of Computer Science, Northwestern Polytechnical University, Xi’an 710129, Qingsen Yan is also with the Shenzhen Research Institute, Northwestern, Polytechnical University, Shenzhen, China., Xiaogang Xu is with Zhejiang University, Hangzhou, China.

2026-06-09视觉感知

多曝光 HDR 在动态场景中常因大运动、遮挡和饱和产生鬼影,固定前向管线难以按区域退化差异调整。HDRAgent 将重建改写为 MLLM 驱动的感知、规划、执行与反馈流程,通过细粒度知识匹配选择对齐/融合工具,并用感知-失真反馈和生成式对齐修复极端运动区域。实验显示其能减少鬼影和局部融合伪影,客观指标与视觉质量达到竞争或更优水平。

Driving Video Retrieval for Complex Queries with Structured Grounding Figure 1
2026-06-09cs.CV

Driving Video Retrieval for Complex Queries with Structured Grounding

Manyi Yao, Sparsh Garg, Christian Shelton, Amit Roy-Chowdhury, Abhishek Aich

‡NEC Laboratories, America, †University of California, Riverside, labeled in-domain videos to estimate when a query rule is reliable, adapt rules that, and sensor logs at the center of safety engineering, with a single instrumented vehicle generating tens, (using weak supervision from auto-generated captions of unlabeled auxiliary videos), with an LLM, no labels are required in the target benchmark.

2026-06-09视觉语言视觉感知

面向自动驾驶海量行车视频检索,论文指出密集视觉语言嵌入会稀释变道、急刹等细粒度运动,而LLM生成规则又存在数值阈值失准和规则库覆盖不足。STRIVE-D用弱标注域内视频进行学习排序式阈值校准,并结合置信度自适应规则生成与视觉语言/关键词融合检索。三项驾驶基准上相较强基线一致提升,DrivingDojo Acc@1相对增益最高约84%,且发布了人工标注事件集。

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization Figure 1
2026-06-09cs.LG

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

OPPO AI Center

2026-06-09强化学习

本文针对多模态大模型后训练中 on-policy 蒸馏的梯度不稳定问题:原始 token 级 KL 反馈在 OOD 状态或教师低概率 token 上会产生异常大更新。作者提出 GNDPO,将原始蒸馏奖励在 batch 内归一化为相对优势,保留密集监督同时抑制梯度尖峰。实验显示其在多种多模态推理基准上较标准 OPD 和 RLVR 提升平均准确率与训练鲁棒性。

Edge-Constrained UAV Small-Object Detection with P2 Enhancement and Quantum-Inspired Lightweight Structure Search Figure 1
2026-06-09cs.CV

Edge-Constrained UAV Small-Object Detection with P2 Enhancement and Quantum-Inspired Lightweight Structure Search

Wuming Lei, Yanbin Gao, Mingyan Sun, Xiaobin Li, Xuechen Liang

East China Jiaotong University, Nanchang, China.

2026-06-09视觉感知

面向无人机边缘端小目标检测,论文指出轻量化网络反复下采样会损失浅层空间细节,且手工堆叠注意力/融合模块收益不稳。作者以 YOLOX-Nano 为基线,引入 stride-4 的 P2 高分辨率检测分支,并用量子启发进化算法在精度、FLOPs、延迟、内存和召回间筛选轻量结构。VisDrone 上 P2 使小目标 AP 较基线提升 31.10%,相近模型规模下较 NanoDet-Plus 的 AP50:95 和小目标 AP 分别提升 17.5% 与 44.9%;QIEA 候选召回最高,但完整训练后 AP 最强仍是 +P2,说明搜索更适合作为成本分析与候选筛查工具。

Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions Figure 1
2026-06-09cs.CV

Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C.H. Hoi

VCIP, CS, Nankai University

2026-06-09强化学习

本文针对文生图后训练中奖励模型把主观视觉偏好压成单一标量、难表达不确定性的问题,提出 Z-Reward:大 VLM 教师通过推理学习评分分布,紧凑学生则蒸馏这种“推理后的判断”以便高效、可微打分。实验中 27B 教师达人类偏好准确率 89.6%,9B 学生 88.6%,并在文生图优化中相对 SFT 带来 41.3% 净偏好提升;但评测主要依赖内部标注集,泛化性仍需外部验证。

REFINE: Super-efficient 3D Gaussian Splatting Pruning via Rendering-Free Primitive Importance Figure 1
2026-06-09cs.CV

REFINE: Super-efficient 3D Gaussian Splatting Pruning via Rendering-Free Primitive Importance

Zhang Chen, Shuai Wan, Mengting Yu, Fuzheng Yang, Junhui Hou

School of Electronics and Information, Northwestern Polytechnical University, School of Telecommunication Engineering, Xidian University, Department of Computer Science, City University of Hong Kong, ated 3DGS pruning framework centered on a novel rendering-free primi-, ally fall into two categories, both of which face an irreconcilable contradiction

2026-06-09三维

针对3D Gaussian Splatting模型高存储、现有剪枝要么依赖参数启发式导致画质下降、要么需渲染评估开销过大的问题,REFINE用解析近似的渲染感知Hessian场估计删除单个高斯带来的感知误差,并显式建模可见性、投影几何与内容自适应权重,从而无需前向渲染即可排序剪枝。多基准实验显示其在接近渲染感知方法画质的同时,将剪枝相关计算复杂度降低约3000倍。

See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding Figure 1
2026-06-09cs.CV

See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding

Shuning Wang, Zhiheng Wu, YiNuo Lu, Naiming Liu, Chen Jia, Bowen Liu, Shuo Nie, Weijie Zhu, Yumeng Zhang

Baidu Inc., Harbin Institute of Technology, Hong Kong University of Science and Technology

2026-06-09视觉感知

长视频问答常因关键证据稀疏而依赖单一检索意图或语言先验,导致答案正确但视觉依据不完整。论文提出 CoVER:先用伪查询将问题拆成多种可观察线索,检索并放大相关视频证据;再从初始答案生成可验证线索,进行视觉反馈式反思与修正。实验中 CoVER-7B 相比 Qwen2.5-VL-7B 在 MLVU、LVBench 分别提升约 3.9% 和 4.6%,并在部分指标超过闭源模型。

Stage-1 Controls the Entropy Regime, Not the Outcome Figure 1
2026-06-09cs.LG

Stage-1 Controls the Entropy Regime, Not the Outcome

Jianxiong Shen

2026-06-09规划控制

本文追问小数据 VLM 两阶段后训练中,SFT 与同模态教师 OPD 作为 Stage-1 热启动究竟影响什么。核心洞察是 Stage-1 更稳定地改变策略熵与探索状态,而非最终任务效果:OPD 进入 RL 时熵更高、初始 Geometry3K pass@16 和答案多样性略优,但经 GRPO 后三种热启动在域内仅约 53–54%,MathVista 上也无明显优势;SFT 的遗忘则强依赖训练配方。

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation Figure 1
2026-06-09cs.CV

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

Massachusetts Institute of Technology, Toyota Research Institute

2026-06-09视觉感知

长视频生成受限于 Transformer 上下文长度,常在分块自回归中遗忘离帧物体与场景结构。MilliVid 的关键是学习分层帧 tokenizer,并在扩散模型中按粗到细 rollout:用少量粗粒度 token 覆盖更长历史,细粒度只补近期纹理。在自建 20 万条 1024 帧 Minecraft 数据集上,相比 FramePack 和全分辨率 rollout,长程 PSNR、LPIPS、DINOv2、FVD/FID 等均明显更优,但需更多 rollout 步且尚未验证可直接迁移到大规模预训练视频模型。

Leveraging NeRF-Rendered Images for 3D Gaussian Splatting Figure 1
2026-06-09cs.CV

Leveraging NeRF-Rendered Images for 3D Gaussian Splatting

Mizuki Morikawa, Yuta Shimizu, Chunyu Li, Yusuke Monno, Masatoshi Okutomi

Institute of Science Tokyo, Tokyo, Japan

2026-06-09视觉感知三维

论文针对街景新视角合成中3DGS速度快但质量常不及NeRF的问题,提出用预训练StreetNeRF渲染图像来“教”目标3DGS:以合成输入视图去除动态物体,并生成俯视额外视图,必要时再用扩散模型增强。实验在一个合成和两个真实数据集、三类3DGS方法上显示,该策略提升街景尤其俯视视角质量,同时基本保留3DGS实时渲染速度。

CRANE: Knowledge Editing for Reasoning MLLMs Figure 1
2026-06-09cs.CV

CRANE: Knowledge Editing for Reasoning MLLMs

Han Huang, Hao Wang, Mengqi Zhang, Shu Wu, Qiang Liu, Liang Wang

2026-06-09视觉感知

本文针对具备显式思维链的多模态推理模型,指出传统知识编辑在教师强制或精确匹配下会产生“虚假成功”,实际存在格式崩塌、视觉证据抵触编辑事实、仅记住原问法等问题。作者提出检查推理链的 ReasonEdit-Bench 与 CRANE:不逐条改权重,而用双库检索结合 SFT 和 GRPO 认知路由奖励来调解视觉先验与注入知识。实验中 CRANE 在冲突场景 Grounded Success 达 96.9%,多跳中间实体使用率 96.9%,但 OOD 表现仍受检索精度限制。

Frequency Decoupled Framework for Screen Content Image Super-Resolution Figure 1
2026-06-09cs.CV

Frequency Decoupled Framework for Screen Content Image Super-Resolution

Xufei Wang, Qicheng Zhang, Qi Wu, Ziyang Gu, Shizhuang Weng

are with the School of Electronic and Information Engineering, Anhui

2026-06-09视觉感知

本文针对屏幕内容图像超分中现有隐式表示方法忽视频域特性的不足,指出SCI的幅度承载稀疏高能周期纹理、相位保留连续结构配置,因而应解耦建模。方法提出FDF:用APFN分别通过幅度聚类提取周期模式、相位一致性注意力强化全局上下文,再由OAIF-Net联合隐式拟合。实验称其在四个公开SCI数据集、多尺度设置下达到SOTA,消融支持各模块有效。

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models Figure 1
2026-06-09cs.CV

ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models

Jiaheng Chen

School of Software, Northeastern University

2026-06-09强化学习

针对潜在世界模型评估依赖 CEM/仿真 rollout、耗时且难区分表示与规划器问题,论文提出 ATM,用真实编码转移与模型预测转移之间的动作一致性迁移矩阵诊断动作语义是否可解码、可迁移并揭示域不一致;同时提出 AITS 将动作可识别性作为训练信号。实验称 ATM 可将评估降至秒级、加速超 100 倍,在 OGBench-Cube 上 5% 间隔排序准确率达 98.8%,AITS 使 LeWM 成功率提升约 10 个点。

Scaling by Diversified Experience for Vision-Language-Action Models Figure 1
2026-06-09cs.CV

Scaling by Diversified Experience for Vision-Language-Action Models

Leiyu Wang, Zhaofengnian Wang, Xueqi Li, Luoyi Fan, Cewu Lu, Nanyang Ye

2026-06-09视觉语言视觉感知

本文针对 VLA 在真实机器人中高层推理与低层控制纠缠、以及大模型强化学习易漂移的问题,提出 SyVLA:以 VLM 生成控制意图、Flow Matching 动作专家执行,并用 Feature Query Token 的梯度掩码做意图解耦,再以相似示例引导 RL 稳定更新。实验显示其在真实任务和多模态基准上提升成功率与 OoD 泛化,长程稀疏奖励任务最高较模仿初始化提升 15%,同时较好保留视觉语言能力。

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning Figure 1
2026-06-09cs.RO

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

School of Information Science and Electronic Engineering & School of Integrated Circuits, Shanghai Jiao Tong University, Institute of Artificial Intelligence, China Telecom, Central South University, Jiangsu University

2026-06-09机器人视觉感知

该文针对连续环境中零样本视觉语言导航易依赖局部观察和线性历史、缺乏全局空间认知的问题,提出 SpaceVLN:用在线空间认知记忆抽象已探索区域、路径与地标证据,并以可验证的“空间—地标”阶段进行闭环规划执行,结合 Spatial-CoT 做进度定位和空间关系推理。其在 R2R-CE、RxR-CE、GN-Bench、HM3D-OVON 上取得零样本 SOTA,并完成真实机器人验证,但效率受多次基础模型调用限制。

EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation Figure 1
2026-06-09cs.CV

EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation

Runsong Zhu, Jiaxin Guo, Xiaoyang Guo, Zhengzhe Liu, Ka-Hei Hui, Wei Yin, Kai Chen, Wei Chen, Weiqiang Ren, Yunhui Liu, Pheng-Ann Heng, Chi-Wing Fu

2026-06-09视觉感知三维

针对开放词汇三维全景分割中多视角2D特征不一致、逐场景优化耗时且易累积误差的问题,EPS3D从未标定多视图图像端到端前馈预测含几何、外观、语义和实例的3D Gaussian,并用2D基础模型作蒸馏教师;其语义-实例互增强模块通过Ins2Sem与Sem2Ins约束对象内语义一致和实例边界。文中称在ScanNet、Replica优于基线,Replica语义mIoU提升约13%,推理约1秒/场景。

C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache Figure 1
2026-06-09cs.LG

C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache

Weisen Zhao, Lam Nguyen, Zhicong Lu, Yuzhang Shang

George Mason University, University of Central Florida

2026-06-09强化学习

这篇论文针对世界动作模型在机器人闭环控制中需对连续动作块反复执行昂贵去噪、导致推理延迟高的问题,指出现有缓存只利用单个 chunk 内冗余,忽略相邻 chunk 在同一去噪步的残差高度相关。C3ache 无需训练,跨推理 chunk 缓存并复用残差以跳过部分 DiT 计算,并可与步内缓存结合;在 Fast-WAM 上于 LIBERO 和 RoboTwin 实验中最高获得 2.5× 墙钟推理加速,任务成功率几乎不降。

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China Figure 1
2026-06-09cs.CV

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

Yi Zhang, Bolei Ma, Yong Cao, Chengyan Wu, Daniel Hershcovich, Anna-Carolina Haensch

LMU Munich 2 FAU Erlangen-Nuremberg 3 Munich Center for Machine Learning, University of Tübingen & Tübingen AI Center, Sun Yat-sen University, University of Copenhagen 7 University of Maryland, College Park

2026-06-09强化学习数据集/基准

针对现有视觉语言评测偏西方、难衡量中国文化遗产图像中历史与建筑知识的问题,论文提出 ChinaHeritaQA:覆盖中国 UNESCO 世遗的中英双语 VQA 基准,含 2,279 张野外图片和 14,133 个多选问答,并用遗产本体与人工校验构建。实验显示,强 VLM 平均可超过非专家人类,尤其擅长地点识别和视觉定位,但在断代、功能与建筑推理上明显下滑,且受朝代和地域分布影响。

Rethinking 3D Shape Generation: Diffusion over Superquadrics Figure 1
2026-06-09cs.CV

Rethinking 3D Shape Generation: Diffusion over Superquadrics

Zhiyang Liu, Wanze Li, Yuwei Wu, Chengran Yuan, Jiawei Sun, Rui Zheng, Marcelo H Ang Jr

2026-06-09生成模型三维

针对现有3D扩散在体素、点云或网格等高维表示上去噪导致计算/显存开销大且难以显式控制的问题,论文提出DoSs:将形状表示为少量超二次曲面primitive,并直接扩散其位姿、尺度、形状与存在分数参数。该紧凑可解释表示将状态压到约7KB,可任意分辨率解码点云并支持部件编辑、约束生成;在ShapeNet等基准上达到有竞争力的保真度和分布质量,多数条件下单形状生成约0.6秒。

NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis Figure 1
2026-06-09cs.CV

NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis

Runze Yan, Minxiao Wang, Jiaying Lu, Darren Liu, Xiao Hu, Hanqi Luo

2026-06-09视觉语言

针对临床营养中微量营养素难以从饮食照片可靠估计的问题,论文指出通用 MLLM 常拒答或给出不合理数值,并用 NHANES 24 小时膳食回忆生成约 110 万图像-描述-65 营养素三元组来微调 Qwen3-VL/GLM。NutriMLLM 在真实食物图像上实现近完整覆盖,最大模型多数营养素准确性匹敌或超过 GPT-5、Gemini 3、Claude 等闭源基线。

PolyBuild: An End-to-End Method for Polygonal Building Contour Extraction from High-Resolution Remote Sensing Images Figure 1
2026-06-09cs.CV

PolyBuild: An End-to-End Method for Polygonal Building Contour Extraction from High-Resolution Remote Sensing Images

Yaoteng Zhang, Julin Zhang, Guangshuai Wang, Jiwei Deng, Hui Sheng, Yasir Muhammad, Shiqing Wei

This work was supported in part by the Tianjin Key Laboratory of Rail Transit Navigation Positioning and Spatio-temporal Big Data Technology (Grant No. TKL2024A11)

2026-06-09视觉感知

面向遥感制图中建筑轮廓需从像素分割再后处理、易产生锯齿和误差的问题,PolyBuild将检测与矢量多边形回归端到端结合:先用建筑框内四个子区域中心特征生成更接近真实边界的初始轮廓,再用融合CNN局部特征与Transformer全局顶点关系的优化模块迭代修正。论文在三个建筑数据集上报告其优于现有mask-based和contour-based方法。

When Vision Misleads, Let Location Speak: A Worldwide Image Geo-Localization Method via Location Attention Mechanism and Large Multimodal Models Figure 1
2026-06-09cs.CV

When Vision Misleads, Let Location Speak: A Worldwide Image Geo-Localization Method via Location Attention Mechanism and Large Multimodal Models

Junchao Cui, Wenqi Shi, Xuanzi Ma, Nan Wu, Shaoyong Du, Xiangyang Luo

2026-06-09视觉语言视觉感知强化学习

该文针对全球图像定位中过度依赖视觉相似性、易把外观相近但地理相距很远的场景误匹配的问题,提出 TransGeoCLIP:用带位置注意力的 Transformer 编码 GPS 语义,并与 CLIP 图文表征及大多模态模型的检索增强推理结合。实验在 IM2GPS、IM2GPS3k、YFCC4k、YFCC26k 上提升 1 km 内街景级定位准确率,较 SOTA 分别高 1.5%、1.07%、7.18%、9.75%。

Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection Figure 1
2026-06-09cs.CV

Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

Pangyun Jeong, Jiyeong Kong, Yuehua Hu, Dohee Jeong, Kyung-Tae Kang

HYU-KITECH Joint Department, Hanyang University, Ansan, 15588, Korea, Micro/Nano System Department, Korea University, Seoul 02841, Korea, Department of Photonics and Nanoelectronics, Hanyang University, Ansan, 15588, Korea, Korea Institute of Industrial Technology, Ansan, 15588, Korea

2026-06-09视觉语言视觉感知

光刻缺陷小且易与正常图形混淆,单阶段检测容易漏检、误报或分错类。本文将检测改写为视觉语言结构化生成任务,用 LoRA 微调 Qwen3-VL 输出数量、类别和归一化框,再用首阶段失败案例训练二阶段修正模块。简单图形数据上 mAP@0.5 从 0.554 提升到 0.597,并在 ICCAD 复杂显微图上给出定性可用性,但泛化证据仍有限。

DifferSeg: Towards Diverse Multimodal Binary Segmentation via Differential Perception and Frequency Guidance Figure 1
2026-06-09cs.CV

DifferSeg: Towards Diverse Multimodal Binary Segmentation via Differential Perception and Frequency Guidance

Qiangqiang Zhou, Jiawei Xu, Yong Chen, Dandan Zhu, Yugen Yi, Xiaoqi Zhao

pretrained models will be available at the link ., Qiangqiang Zhou, Jiawei Xu, Yong Chen, and Yugen Yi are with the School, of Artificial Intelligence, Jiangxi Normal University, Nanchang, China (e-mail:, Dandan Zhu is with the Institute of AI Education, East China Normal, Xiaoqi Zhao is with the Yale School of Medicine, Yale University, New

2026-06-09视觉语言视觉感知

针对二值分割中现有通用模型难以同时跨任务、跨 RGB+X 多模态泛化的问题,DifferSeg 将重点放在两处瓶颈:模态差异导致的固定融合失效,以及解码中高低频信息失衡。方法用可学习差分算子做自适应模态对齐与残差互补融合,并以频率引导解码显式建模跨频交互和多路径上采样。论文在29个数据集、18类任务上报告超过67种SOTA方法,显示较强泛化性。

A multi-agent system for spine MRI report generation from multi-sequence imaging Figure 1
2026-06-09cs.CV

A multi-agent system for spine MRI report generation from multi-sequence imaging

Zhiping Xiao, Junwei Yang, Gongbo Sun, Han Zhang, Hanwen Xu, Yi Yao, Zachary D. Miller, William E. King III, Mohammed M. Kanani, Jalal B. Andre, Sammy Chu, Ming Zhang, Paul E. Kinahan, Nathan M. Cross, Sheng Wang

Paul G. Allen School of Computer Science & Engineering, University of Washington, Seattle, WA, USA, School of Computer Science, Peking University, Beijing, China, Department of Computer Sciences, University of Wisconsin–Madison, Madison, WI, USA, Department of Arts and Sciences, New York University, New York City, NY, USA, Department of Radiology, University of Washington Medical Center, Seattle, WA, USA, School of Medicine, University of Washington, Seattle, WA, USA

2026-06-09视觉感知

针对脊柱 MRI 报告需跨多序列、解剖区域整合且人工判读耗时的问题,论文提出 SpineAgent:先分别预训练 T1/T2 的 DINOv3 编码器,再用持续训练合成其他序列嵌入,并将诊断、定位、相似病例检索等 37 个专门代理输出结构化供报告代理生成文本。在 5 万余扫描上,17 项病变预测平均 AUROC 较最强基线提升 10.8%,并在跨厂商/队列、病灶定位、检索和放射科医师评估中表现领先。

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions? Figure 1
2026-06-09cs.CV

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang, Ziyi Wang, Hao Li, Yang Cui, Wenhao Cai, Jingyu Sun, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

University of Manchester, Imperial College London

2026-06-09视觉语言视觉感知安全鲁棒

针对现有 VLM 鲁棒性评测多关注噪声、模糊等感知退化而忽视“看得见但选错证据”的问题,论文提出人工验证的 Distract-Bench,在不改变答案的前提下加入语义相关但任务无关的视觉干扰。对 8 个开源和 2 个闭源模型的比较显示,推理型 VLM 在传统视觉腐蚀下大体继承基座模型表现,却对语义干扰更脆弱,错误案例中干扰常进入推理链并被当作证据。

Generalizing Geometry-Guided Mamba as a Plug-and-Play Context Module for CNN-based Semantic Segmentation Figure 1
2026-06-09cs.CV

Generalizing Geometry-Guided Mamba as a Plug-and-Play Context Module for CNN-based Semantic Segmentation

Sheng-Wei Chan, Hsin-Jui Pan, Chun-Po Shen, Chia-Min Lin, Yung-Che Wang, Jen-Shiun Chiang

Department of Electrical and Computer Engineering, Tamkang University, New Taipei City, Taiwan, replace the original context heads of six representative CNN segmentation models, including DeepLabV3+, DANet, CCNet, PSP-, DeepLabV3+, and PSPNet provide strong local feature extrac-, scribes the tendency toward object centers, while the bound-, DeepLabV3+ replaces ASPP, PSPNet replaces, DeepLabV3+

2026-06-09视觉感知

针对 CNN 语义分割中 ASPP、PPM 与注意力上下文头在高分辨率下计算/显存开销大且易跨边界扩散的问题,论文将 DGM-Net 的 G-Mamba 解耦为可插拔模块,用边界、向心势与方向流引导 Mamba 选择性扫描,使长程传播随几何结构变化。在 Cityscapes 上替换六种 ResNet-101 分割模型的上下文头均提升 mIoU,Cascade 版本最高约提升 0.44–2.84 点,1024² 下额外开销约 33–51 GFLOPs。

CHROMA: Detecting AI-Generated Images through Inter-Channel Color-Space Correlations Figure 1
2026-06-09cs.CV

CHROMA: Detecting AI-Generated Images through Inter-Channel Color-Space Correlations

Juan Pablo Sotelo, Marina Gardella, Pablo Musé

Université Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, Gif-sur-Yvette, and Lab color spaces providing the most apparent separation between, available. Across a standard benchmark protocol, correlation-augmented, Code is available at https://github.com/JPSoteloSilva/CHROMA., (b) Lab correlation (real/gen.), the split Lab correlation map exposes structured chro-, tually meaningful color spaces. Fig. 1 illustrates how Lab inter-channel correla-

2026-06-09视觉感知

针对AI生成图像检测在未见生成器上泛化脆弱的问题,本文将相机成像管线导致的跨颜色通道相关性作为轻量取证线索,发现LPIPS对不同色彩空间的通道耦合扰动约束不一致,且RGB/Lab相关特征能区分真伪。基于此提出CHROMA,在RGB外加入通道相关图并用固定ResNet-50训练,在单生成器和少量多生成器监督下提升鲁棒性,性能接近近期检测器。

Vision-Language Work Zone Intelligence for Safety-Critical Speed Regulation of Mixed-Autonomy Vehicles in Dynamic Environments Figure 1
2026-06-09cs.CV

Vision-Language Work Zone Intelligence for Safety-Critical Speed Regulation of Mixed-Autonomy Vehicles in Dynamic Environments

Angel Martinez-Sanchez, Kianna Ng, Wesley Maia, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Yash Tandon, Parthib Roy, Mohan Trivedi, Ross Greer

positive. These results demonstrate a practical, scalable approach, repository: https://github.com/Mi3-Lab/workzone, the-shelf cameras and embedded computing already available, representations, offering a scalable pathway to improving

2026-06-09视觉语言视觉感知安全鲁棒

针对施工区临时限速标志样式不一且常缺失于地图、给混合自动驾驶带来超速风险的问题,本文提出车载实时视觉/视觉语言管线,将目标检测、语义校验与带滞回的时序状态机结合,输出可用于提醒或控制的施工区状态和限速值,并可在低成本嵌入式硬件运行。ROADWork 490 段序列上施工区事件召回率 96.5%、精度 68.7%;35 分钟自采数据中限速识别精度 95.45%、召回率 53.85%,无错误限速分类。

Intelligent Character Recognition of Handwritten Forms with Deep Neural Networks Figure 1
2026-06-09cs.CV

Intelligent Character Recognition of Handwritten Forms with Deep Neural Networks

Hartwig Grabowski

2026-06-09视觉感知

论文面向纸质考试等手写表单仍需人工录入的问题,研究在固定表格中识别手写拉丁大写字母。其核心思路是用深度网络把字符检测与分类合并为单一任务,并用表单模板和 EMNIST 人工合成训练数据,减少手工标注与传统分割流程依赖。相比初始两阶段方案在真实考试数据上仅约 44.46% 准确率,定制数据后整体识别率达到 88.28%,但对 EMNIST 分布差异的处理细节仍是性能关键。

Hybrid E-Assessment in Higher Education: Semi-Automated Grading of Paper-Based Written Examinations Figure 1
2026-06-09cs.AI

Hybrid E-Assessment in Higher Education: Semi-Automated Grading of Paper-Based Written Examinations

Hartwig Grabowski, Michael Canz

2026-06-09视觉感知

针对高校总结性考试中全数字化评测常被选择题化、难以承载推理和问题求解的动机,论文提出保留纸笔作答、将关键中间结果写入结构化表格,再用视觉大模型进行手写识别、双通道校验并与答案键比对的混合评测流程。主要结论是该方案有望降低批改负担并改善规模化考试的公平性与有效性,但文中未充分说明真实考试中的量化增益。

BLM-SGAN: Bidirectional Language Modeling for Semantic-Spatial Text-to-Image Generation Figure 1
2026-06-09cs.CV

BLM-SGAN: Bidirectional Language Modeling for Semantic-Spatial Text-to-Image Generation

Ahmed Abdelmoneim Mazrou, Haidy Maher El-Amir, Ali Hamdi

2026-06-09视觉感知生成模型

本文针对GAN式文本生成图像中长程语义建模不足、文本与空间区域融合不充分及多阶段训练不稳定的问题,提出BLM-SGAN:以BERT双向语言模型提取上下文文本特征,并在单阶段生成器的SSACN模块中进行语义-空间注入。实验主要在鸟类描述生成上验证,报告IS为5.45±0.08,优于SSA-GAN、DF-GAN等基线;但泛化到更复杂多物体场景的证据文中未充分说明。

Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups Figure 1
2026-06-09cs.CV

Geometry-Aware Fisheye-LiDAR Fusion for Robust 3D Object Detection in Low-Overlap Setups

Xiangzhong Liu, Xihao Wang, Hao Shen

Technical University of Munich, 80333 Munich, Germany

2026-06-09视觉感知强化学习三维安全鲁棒

面向低成本自动驾驶/物流平台中双鱼眼相机与车顶 LiDAR 重叠少、畸变强导致常规 BEV 融合失真的问题,论文提出 GA-HF:鱼眼特征用畸变感知 Polar LSS 保留角向密度,LiDAR 与检测回归保持笛卡尔度量一致,并用双注意力校正低质量区域。实验在 KITTI-360 上较笛卡尔基线 NDS 提升 4.2%,在 Dur360BEV 超过 LiDAR-only 与 BEVFusion,在 Fisheye3DOD 取得融合方法最高检测分。

ZIPP:Zero-shot Image Personalization from Personas Figure 1
2026-06-09cs.AI

ZIPP:Zero-shot Image Personalization from Personas

Harini SI, Somesh Singh, Yaman Kumar Singla, David Doermann, Rajiv Ratn Shah

2026-06-09视觉感知

论文针对文生图模型偏向“平均审美”、冷启动用户缺少偏好数据的问题,提出用自然语言 persona 作为零样本个性化条件:从 Reddit 大规模交互图中用 GAT 挖掘用户画像,再让 LLM 角色扮演改写提示词以驱动扩散模型。实验在 ZIP-Bench 等基准上显示,persona 条件在零/少样本均提升,前沿模型增益约 13–20%,人工评测相对通用生成胜率 79%,且比微调基线更能保留用户内偏好多样性。

CSFlow: Aligning Flow Matching with Human Contrast Sensitivity Figure 1
2026-06-09cs.CV

CSFlow: Aligning Flow Matching with Human Contrast Sensitivity

Malgorzata Galinska, Bart Pogodzinski, Jan Eric Lenssen

Max Planck Institute for Informatics, Saarland Informatics Campus

2026-06-09生成模型

论文针对扩散/flow matching各去噪阶段生成不同空间频率,而人眼对中频更敏感这一错配,提出CSFlow:先估计反向流区间带来的频率信息增益,再用人类对比敏感函数为训练损失或推理步长加权,把算力更多分配给可感知频段。在PixelGen、JiT上,FID降低4.7%、IS提升2.2%、GenEval提升2.5%,视觉上更真实且少些卡通感。

Classifying galaxies in the Galaxy10 DECals dataset using Inception and Residual CNNs Figure 1
2026-06-09cs.CV

Classifying galaxies in the Galaxy10 DECals dataset using Inception and Residual CNNs

Lanz Anthonee A. Lagman, Prospero C. Naval Jr, Reinabelle C. Reyes

Data Science Program, College of Science, University of the Philippines - Diliman, Philippines, Department of Computer Science, College of Engineering, University of the Philippines - Diliman, Philippines, National Institute of Physics, College of Science, University of the Philippines - Diliman, Philippines, Batangas State University, Batangas City, 3–6 July 2024, need a large, labeled dataset for this study. We use the Galaxy10 DECals dataset [2], which is composed, z-band Legacy Survey. Meanwhile, the labels were sourced from the Galaxy Zoo project [4].

2026-06-09数据集/基准

面对未来天文巡天带来的海量星系图像,论文将ResNet101与InceptionV4用于经空间增强和平衡处理的Galaxy10 DECals十分类任务,核心洞察是评估两类高效CNN作为星系形态分类基线的成本与效果。两者测试准确率约89%,ResNet101在准确率、精确率、召回率和F1上略优于InceptionV4,但差异统计显著性文中未充分说明。

PairWise Image Finder: An Open-source Tool for Finding Visually Aligned Street-Level Image Pairs for Urban Perception Studies Figure 1
2026-06-09cs.CV

PairWise Image Finder: An Open-source Tool for Finding Visually Aligned Street-Level Image Pairs for Urban Perception Studies

Jussi Torkko

aDigital Geography Lab, Department of Geosciences and Geography, University of Helsinki, PO Box 64 (Gustaf Hällströmin katu 2), 00014, Helsinki, Finland, provides a scalable and open tool for researchers and stakeholders to find high-quality image pairs for urban analysis, perception, ments.txt. Firstly, the tool uses the publicly available meta-, compared. All models used at this step are publicly available as, Face, Inc., 2026), enabling easy usage. The amount of matched, the other hand, the center of panoramic images often faces the, Sánchez and Labib (2024)).

2026-06-09视觉感知

论文针对街景时序变化研究中仅靠 GPS、朝向等元数据难以保证视角一致的问题,提出开源 PairWise Image Finder,将 SuperPoint/LightGlue 特征匹配与语义分割掩码结合,输出匹配比例、距离、覆盖和语义 mIoU 供用户筛选图像对。示例比较显示,视角对齐会显著影响纵向变化量化结果,可减少人工配对并提升城市感知研究的可比性。

MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training Figure 1
2026-06-09cs.CV

MaskAlign: Token-Subset Representation Alignment for Efficient Diffusion Training

Lianyu Pang, Tianlin Pan, Cheng Da, Changqian Yu, Huan Yang, Kun Gai, Song Guo, Wenhan Luo

2026-06-09生成模型

针对扩散模型用干净图像表征对齐 noisy 特征时存在 token 级不匹配的问题,论文发现全 token 对齐的高梯度位置有稳定空间偏置,可能诱导依赖完整干净 token 的捷径。MaskAlign 随机只对齐 token 子集,并在掩码前加入轻量 token mixing 以缓解信息损失。ImageNet 256×256 上,SiT-XL/2 达到同等 FID 所需迭代显著减少,相比 vanilla SiT-XL/2 在 FID 8.3 约快 77×,相对 REG 还降低单步时间并改善 FID。

DeepMine-Mamba: Mitigating Information Dilution in Mamba-Based State Space Models for Document Image Binarization Figure 1
2026-06-09cs.CV

DeepMine-Mamba: Mitigating Information Dilution in Mamba-Based State Space Models for Document Image Binarization

Sheng-Wei Chan, Yung-Che Wang, Hsin-Jui Pan, Chia-Min Lin, Jen-Shiun Chiang

2026-06-09视觉感知

本文针对退化文档二值化中细弱、断裂笔画易在长程建模中丢失的问题,指出直接使用 Mamba 状态传播会产生笔画级信息稀释。DeepMine-Mamba 结合 ConvNeXt、Sobel 边缘先验与四向 Mamba,并引入 Anti-Dilution Gate 按传播变化恢复局部笔画响应。DIBCO/H-DIBCO 留一年测试显示其整体 FM、Fps 具竞争力,DIBCO 2019 上 FM、Fps、PSNR 最优,但 DRD 并非始终最低。

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing Figure 1
2026-06-09cs.CV

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

Deyin Liu, Yisheng Ding, Zhe Jin, Xiatian Zhu, Anjan Dutta, Lin Wu

aAnhui University, No 111, Jiulong Road, Hefei, 230601, Anhui Province, China, bSurrey Institute for People-Centred Artificial Intelligence, University of, cUniversity of Warwick, Gibbet Hill Road, Coventry, CV4 7AL, UK

2026-06-09视觉感知

这篇论文指出,现有零样本视频编辑多追求帧间平滑,却会抹掉长视频中的场景切换、身份变化等时间语义结构。作者提出 TSPVE:用扩散特征自适应分段并选锚帧,在片段内做自适应 token 合并,后期交替联合相邻片段注意力,以兼顾语义差异和过渡连续。实验显示其在时间一致性、结构保持指标 TSPR、用户偏好和推理效率上优于多种一/零样本基线。

TeamHerald@CHIPSAL 2026: Hate Speech Detection and Sentiment Analysis of Nepali Memes using Transformer-based Architectures and Ensemble Learning Figure 1
2026-06-09cs.CL

TeamHerald@CHIPSAL 2026: Hate Speech Detection and Sentiment Analysis of Nepali Memes using Transformer-based Architectures and Ensemble Learning

Ashish Acharya, Anish Khatiwada, Rohit Khadka, Pragya Aryal

Herald College Kathmandu, Kathmandu, Nepal, is unavailable. We then benchmark six Transformer-, availability and model development (Parihar et al., sive labeled datasets (Ranasinghe et al., 2021)., jective labels such as hate and sarcasm (Ranas-, need for clearer annotation protocols and scalable

2026-06-09视觉感知

针对尼泊尔语 meme 中低资源、混合书写与缺少基线导致的仇恨言论和情感识别困难,论文采用 OCR 提取图中文字后比较六种 Transformer,并系统评估硬/软投票集成。结果显示,二分类仇恨检测中单一 decoder-only 模型最佳,而三分类情感任务中软投票 Macro F1 较最强单模型相对提升 15.8%,说明集成收益与任务类型相关。

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation Figure 1
2026-06-09cs.RO

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation

Shengcheng Luo, Kefei Wu, Xiaoying Zhou, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

ShanghaiTech University, Beijing Institute for General Artificial Intelligence

2026-06-09机器人视觉感知安全鲁棒

这篇论文针对灵巧操作中视觉遮挡时触觉与图像难以对齐、隐式融合样本效率低的问题,提出 RGB-S:用机器人正运动学和相机标定把触觉传感器接触位置投影到 RGB 平面,并生成力调制高斯显著图,再以零初始化条件模块接入预训练视觉骨干。六个仿真与真实任务显示,该显式空间锚定在遮挡场景更稳健,真实遮挡成功率较最强隐式视触觉基线提升 26.7 个百分点。

Less Is More: Training-Free Acceleration Framework of 3D Diffusion Models for Low-Count PET Denoising via Global-Local Trajectory Reduction Figure 1
2026-06-09cs.CV

Less Is More: Training-Free Acceleration Framework of 3D Diffusion Models for Low-Count PET Denoising via Global-Local Trajectory Reduction

Yuhan Liu, Scott M. Leonard, Marlee Crews, Muhannad Fadhel, Jinkui Hao, Tianqi Chen, Ryan J. Avery, Bo Zhou

Department of Radiology, Northwestern University, Chicago, IL, USA, Department of Biomedical Engineering, Hefei University of Technology, Hefei, Anhui, China

2026-06-09生成模型规划控制三维

低剂量/低计数 PET 可降低辐射和采集时间,但 3D 扩散去噪推理过慢。本文的核心洞察是条件恢复任务中低计数图像已含结构信息,完整反向轨迹和相邻步 U-Net 特征存在冗余;因此提出免训练 LIM,通过中间噪声初始化跳过全局步数,并复用局部高层特征。多示踪剂公开与院内数据上实现超过一个数量级加速,重建质量与盲读临床评分保持或优于全步基线。

Stain-Aware Wavelet Regularization for Instant Adversarial Purification in Histopathology Figure 1
2026-06-09cs.CV

Stain-Aware Wavelet Regularization for Instant Adversarial Purification in Histopathology

Zhe Li, Bernhard Kainz

Department AIBE

2026-06-09视觉感知

病理图像中对抗噪声与具有诊断意义的中高频纹理高度重叠,通用即时净化易损伤组织结构。SAWR将Haar多级小波正则嵌入一致性蒸馏,并按苏木精/伊红染色通道分别约束频谱,另加语义一致性以保留病理特征。在PathMNIST上,相比OSCP等基线,对PGD、定向PGD和AutoAttack均更稳健,鲁棒性最高提升10.69%,同时改善干净精度和频谱保真度。

MB-Loc: Multi-planar Bird's-eye-view Localization in outdoor LiDAR scenes Figure 1
2026-06-09cs.CV

MB-Loc: Multi-planar Bird's-eye-view Localization in outdoor LiDAR scenes

Ayaan Choudhury, Preet Savalia, Anirudh Pydah, Avinash Sharma

Indian Institute of Technology Jodhpur, invariant features. We perform extensive experiments on the publicly available

2026-06-09视觉感知

针对户外 LiDAR 全局定位中 SCR 方法精度高但依赖重型 3D 计算、且视角变化下易退化的问题,MB-Loc 将点云按高度切片为 2.5D 多平面 BEV,用 2D CNN 保留部分垂直几何并降低计算量,同时加入 KL 正则化确定性瓶颈和投影前 3D 增广以处理稀疏与旋转鲁棒性。在 NCLT 上,文中报告其精度优于现有方法,并以实时推理速度显著提升相对传统 3D-SCR 的效率。

AUCp: Pseudo-AUC for Inference Model Selection with Unlabeled Validation Data in Abnormality Detection Figure 1
2026-06-09cs.CV

AUCp: Pseudo-AUC for Inference Model Selection with Unlabeled Validation Data in Abnormality Detection

Md Mahfuzur Rahman Siddiquee, Fazle Rafsani, Jay Shah, Teresa Wu, Catherine D Chong, Todd J Schwedt, Baoxin Li

2026-06-09视觉感知

针对无监督/自监督医学异常检测常依赖带标注验证集或FID、重建误差选checkpoint而难以落地的问题,论文提出AUCp:将未标注测试样本暂视为异常、与正常训练集一起计算伪AUC来做推理模型选择。作者给出其在正常训练集充分且有代表性时接近真实AUC的分析,并在HealthyGAN、Brainomaly及多种自监督方法和数据集上显示,相比FID等准则通常能选出检测AUC更高的模型;但异常占比过低或正常集偏小时可靠性会下降。

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery Figure 1
2026-06-09cs.AI

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan

2026-06-09视觉感知

本文关注数学推理为何成为检验 AI 的关键场景:答案可验证、推理需组合且能连接语言、视觉与形式证明。其主要洞察是把数学题求解、几何多模态、Lean 等证明助手中的形式化,以及开放式数学发现统一到“生成—验证”框架下,并梳理 CoT、工具调用、RLVR、测试时扩展等机制。作为综述,文中主要结果是给出238篇工作的系统分类、基准与失效模式分析;性能增益多被归因于 scaling、数据和验证器辅助,独立复现实验有限。

Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation Figure 1
2026-06-09cs.CV

Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

Yishuo Cai, Jiahui Liu, Yuanxin Liu, Haobo Deng, Linli Yao, Yuhao Zheng, Kun Ouyang, Zhimo Li, Ziyue Wang, Xu Sun, Haoli Bai, Xiaohui Li

State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Central South University, University of Science and Technology of China, Peking University, code is publicly available at https://github., the local evidence available to the teacher, while

2026-06-09机器人视觉感知强化学习

论文针对多模态模型细粒度视觉推理中依赖裁剪/放大工具导致推理慢且中间证据不稳定的问题,提出 Thinking with Imagination 与 Imagine-OPD:训练时用带标注区域放大视图的同源教师,对学生自身生成的“看哪里、想象看到什么”轨迹做 on-policy 自蒸馏,推理时不再调用工具。实验显示其在4个视觉中心基准上提升4B/8B骨干并取得最佳平均表现,同时比显式工具方法快约1.5–2.7倍;但训练仍依赖区域标注。

SNR-ST-Mix: Sample-specific Neighborhood Regression Mixup for Augmented Spatial Transcriptomics Imputation with Deep Neural Network Figure 1
2026-06-09cs.LG

SNR-ST-Mix: Sample-specific Neighborhood Regression Mixup for Augmented Spatial Transcriptomics Imputation with Deep Neural Network

Hongyi Yu, Yaoyu Fang, Jiahe Qian, Xinkun Wang, Lee A. Cooper, Bo Zhou

Northwestern University, Department of Radiology, Chicago, IL, USA, Yale University, Department of Biostatistics, New Haven, CT, USA, Northwestern University, Department of Cell and Developmental Biology, Chicago, IL, USA, Northwestern University, Department of Pathology, Chicago, IL, USA

2026-06-09视觉感知

空间转录组数据常受噪声、低分辨率和样本稀缺限制,影响基于病理图像的基因表达插补。SNR-ST-Mix将 mixup 限定在每个 spot 的空间近邻内,并按表达相似性自适应插值,以生成更符合局部生物结构的回归增强样本。多组织实验显示其优于常规增强方法,且无需改动模型结构或增加额外计算。

PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping Figure 1
2026-06-09cs.CV

PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping

Qiming Li, Tianlun Li, Xiaolong Cheng, Hangyu Li, Ruiyan Gong, Kangning Niu, Kaitao Jiang, Mu Xu

Amap CV Lab, Alibaba Group, 2 Peking University

2026-06-09强化学习优化算法

本文针对多模态 RLVR 将轨迹级奖励平均分配给所有 token、导致稀疏关键视觉感知 token 被语言模板淹没的问题,提出 PRPO:用 RVD 识别既依赖视觉又对扰动稳定的 token,再用 PAR 在 token 级重塑优势以强化感知信用分配。七个多模态推理基准上,3B/7B 模型平均提升 23.3%/21.1%,并报告更好训练效率与跨任务泛化。

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback Figure 1
2026-06-09cs.RO

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

Chunji Lv, Jiaxi Ye, Yuchen Jiang, Rexar Lin, Changsheng Li

Beijing Institute of Technology

2026-06-09规划控制

针对物理 4D 合成中环境力场仍需专家手调、SDS 优化慢且难处理离散力场切换、开放式 LLM 又缺少物理反馈的问题,PhysAgent 将 MPM 仿真器置于多智能体闭环中:语义智能体借助外置力场技能库生成初始配置,Refine Agents 从渲染视频中提取轨迹并转成文本反馈,用 LLM 推理迭代修正力场。实验显示其在多模态提示下可更快生成稳定、多样的物理场景,物理准确性和多样性优于基线。

Shift-Dependent Asymmetry: Orthogonal Inverse Low-Rank Adaptation for Federated Medical Segmentation Figure 1
2026-06-09cs.CV

Shift-Dependent Asymmetry: Orthogonal Inverse Low-Rank Adaptation for Federated Medical Segmentation

Xingyue Zhao, Wenke Huang, Linghao Zhuang, Haoran Wu, Anwen Jiang, Zhifeng Wang, Wenwen He, Ming Feng, Mang Ye, Bo Xu

Department of Neurosurgery, Peking, Union Medical College Hospital, Chinese Academy of Medical, Sciences and Peking Union Medical College 2The Key Laboratory, stitute of Automation, Chinese Academy of Sciences 3College of, Computing and Data Science, Nanyang Technological University, Singapore 4Institute of Basic Medical Sciences, Chinese Academy, of Medical Sciences and Peking Union Medical College, Beijing, China 5Xinjiang University 6Ant Group, China 7Wuhan Univer-, requires diverse data from multiple centers (Hu et al., 2025a, this challenge by enabling collaborative training across insti-, burdens on local computing resources. To make collabo-, Accordingly, we center our investigation on the Federated

2026-06-09视觉感知

针对多中心医学分割中联邦 LoRA 统一聚合忽视编码器/解码器异质性的问题,论文指出编码器更受外观协变量偏移影响、解码器更受标注/目标概念偏移影响,并提出 IAT:在编码器个性化 A、解码器个性化 B,同时用子空间正交正则抑制共享与本地更新泄漏。多站点细胞核与眼底分割实验显示,其相较强联邦 LoRA 和参数高效 FL 基线取得更好精度及通信/参数效率。

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving Figure 1
2026-06-09cs.CV

BLUE: Toward Better Language Use in Efficient Vision-Language-Action Models for Autonomous Driving

George Ling, Lijin Yang, Hao Yang, Zhongzhan Huang

2026-06-09视觉语言视觉感知

论文针对自动驾驶 VLA 模型每帧生成语言推理成本高且未必有益的问题,先通过闭环分析发现语言只在少数路线显著影响表现,且可能有害;据此提出 BLUE,在冻结 VLA 隐状态上训练 0.11M 参数门控,按帧决定是否生成语言。该方法无需改 backbone 或人工标注,在 Bench2Drive 达 76.2% 成功率、Longest6 v2 得分 36,并相对骨干提升 8.9% 成功率、加速 2.54 倍。

Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras Figure 1
2026-06-09cs.CV

Distortion-Aware PETR for BEV Object Detection with Mixed Pinhole-Fisheye Cameras

Xiangzhong Liu

2026-06-09视觉感知

针对自动驾驶中针孔与鱼眼混合相机的 BEV 3D 检测,论文指出鱼眼径向畸变会破坏 PETR 等方法的均匀采样与2D-3D对应。DAPETR 不做图像矫正,而用 MEI 统一畸变感知位置编码,并通过双向特征-几何调制对齐外观与空间信息。在转换的 KITTI-360 上,它优于 PETR、PolarPETR 及多种投影式基线;同时发现极坐标重参数化与学习式调制叠加会相互冲突。

BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension Figure 1
2026-06-09cs.CV

BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension

Tsung-Wei Pan, Jung-Hua Wang

aDepartment of Electrical Engineering, National Taiwan Ocean University, Keelung, Taiwan, bAI research center, National Taiwan Ocean University, Keelung, Taiwan

2026-06-09视觉感知

BioVid针对现有视频生成把时长固定为外部参数、难以反映生物行为自然持续时间的问题,提出两阶段自回归框架:用FSQ-R3GAN离散化帧以缓解码本坍塌,再由因果Transformer学习EOS停止信号,使动作长度从数据中涌现。在NTU RGB+D饮水动作上,其生成长度分布Wasserstein-1为1.24,优于固定长度基线6.05和VideoGPT的15.48,同时保持相近空间质量。

Learning to Solve Generative ODEs Beyond the Linear Span Figure 1
2026-06-09cs.CV

Learning to Solve Generative ODEs Beyond the Linear Span

Sihyeon Kim, Seunghun Lee, Vikas Singh, Hyunwoo J. Kim

Korea University, University of Wisconsin–Madison, they learn, existing methods still execute each step by scalar-recombining the available velocity

2026-06-09生成模型

针对扩散/flow 生成模型少步采样中仍需多次 ODE 评估的问题,论文指出现有学习求解器只重组历史速度,更新被限制在线性张成空间内,无法修正正交残差。SpanLift 在固定基求解器上加入轻量空间残差算子,并用教师端点匹配训练,不改 backbone 且不增加模型 NFE。实验覆盖像素扩散、潜空间 flow matching 和降水临近预报,3 NFE 下将 CIFAR-10 FID 从 8.16 降至 5.69、ImageNet 从 17.37 降至 11.83。

WaveDiT: Distribution-Aware Wavelet Flow Matching for Efficient 3D Brain MRI Synthesis Figure 1
2026-06-09cs.CV

WaveDiT: Distribution-Aware Wavelet Flow Matching for Efficient 3D Brain MRI Synthesis

Danilo Danese, Angela Lombardi, Giuseppe Fasano, Matteo Attimonelli, Tommaso Di Noia

Sapienza University of Rome, Italy, baselines. Code is available at https://github.com/sisinflab/WaveDiT.

2026-06-09生成模型三维

针对全分辨率3D脑MRI生成中像素扩散开销大、潜空间压缩易损失解剖细节的问题,WaveDiT在可逆3D Haar小波系数空间做条件流匹配,并用分解的空-深注意力降低体数据计算量;其关键洞察是不同小波子带呈现重尾、异方差且随生成轨迹变化,因此引入Morpheus按高阶统计预测子带不确定性,进入损失和条件。多站点实验显示其相较扩散、潜空间和小波基线更贴近真实分布,并改善脑龄预测与ROI解剖一致性。

PhysGraph: A Physics-aware 3D Scene Graph for Perception and Reasoning Figure 1
2026-06-09cs.RO

PhysGraph: A Physics-aware 3D Scene Graph for Perception and Reasoning

Haoyu Li, Aaron Thomas, Shuyan Zhou, Xianyi Cheng

Department of Mechanical Engineering and Materials Science, Duke University, Durham, NC 27708, USA. 2 Department of Computer Science, Duke University, Durham, NC 27708, USA.

2026-06-09三维

该文针对现有开放词汇3D场景表示偏重语义、缺少材料与运动学约束而难以支撑安全操作的问题,提出PhysGraph:从RGB-D多视角重建对象级几何、关联实例,并借助视觉/语言模型进行功能部件分解、材料和关节推理,形成含空间关系与物理属性的层次3D场景图。实验显示其在语义分割、多物体质量估计和关节预测上达到SOTA,并可用于约束感知3D可供性预测与real-to-sim迁移。

FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning Figure 1
2026-06-09cs.CV

FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning

Haihao Lin, Xiangsheng Huang, Xiao Yang, Weibang Zhou, Yiqi Zhang, Bo Yang, Simin Zeng, Jiawei Yang, Zhengyang Wang, Jiahui Du

University of Chinese Academy of Sciences, Hebei Key Laboratory of Cognitive Intelligence, Xiong’an Institute of Innovation, Hebei University of Technology, Beijing Information Science and Technology University

2026-06-09视觉语言视觉感知

论文指出,VLA 行动监督微调只约束会改变动作预测的特征方向,易压缩颜色、类别、干扰物等“动作等价”视觉残差信息。FiberTune 用在线动作探针滤除动作预测方向,再将残差视觉 token 对齐冻结视觉教师并维持有效秩,且不增加推理开销。在 CALVIN、LIBERO、π0.5/OpenVLA-OFT 及真实 SO-101 上均优于仅任务损失微调,如 CALVIN SR(5) 提升 10.7 个百分点,真实成功率 72.7% 升至 78.1%。

Reconstructing Synthetic SDO/AIA 193 A EUV Images from He I 10830 A Observations with Diffusion Model Translator Figure 1
2026-06-09astro-ph.SR

Reconstructing Synthetic SDO/AIA 193 A EUV Images from He I 10830 A Observations with Diffusion Model Translator

Marco Marena, Qin Li, Haimin Wang, Haodi Jiang, Prajwal Shah, Bo Shen

Department of Mechanical and Industrial Engineering, New Jersey Institute of Technology, Department of Physics, New Jersey Institute of Technology, Department of Computer Science, Sam Houston State University, Department of Computer Science, New Jersey Institute of Technology, Department of Data Science, New Jersey Institute of Technology

2026-06-09视觉感知生成模型

为弥补SDO前缺乏常规EUV全日面成像的历史空档,论文利用长期He I 10830 Å观测作为日冕结构代理,提出面向日冕洞的条件扩散图像翻译模型,将其重建为合成AIA 193 Å图像。模型在2011–2015配准数据上训练,测试中全盘形态相关达0.92、低强度日冕洞结构相关达0.84,并与EIT、SXT及太阳活动指标的跨年代比较显示其可作为历史日冕演化研究的物理合理代理;但绝对辐射定标和日冕洞边界仍需谨慎解释。

Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning Figure 1
2026-06-09cs.CV

Learnable Token Sparsification for Efficient Gigapixel Whole Slide Image Reasoning

Jingzhi Chen, Landi He, Zhuo Chen, Shawn Young, Lijian Xu

Shenzhen University of Advanced Technology

2026-06-09视觉感知

针对千兆像素病理全切片在视觉语言模型中产生海量视觉 token、易淹没稀疏诊断证据的问题,论文将 token 压缩改为可学习稀疏化:训练时用 SparseLearn 的 Soft Top-K、方差保持噪声门和去噪器传递梯度,推理时移除该模块,仅用 scorer 选取 32 个 token。该方法在 SlideBench TCGA 上达 73.32% 准确率,并在 BCNB 与 WSI-VQA* 上显示零样本泛化。

SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders Figure 1
2026-06-09cs.CV

SSAFE: Simple and Strong AI-Generated Image Detection via Frozen Vision Encoders

Seunghyun Lee, Byoungkwon Kim, Jaehyun Nam, Kyungmin Lee, Jinwoo Shin

2026-06-09视觉感知安全鲁棒

针对现有 AI 图像检测依赖海量真伪数据且难以适应新生成器的问题,SSAFE 指出冻结的多模态视觉编码器已在嵌入空间中自然区分真实与合成图像,并据此用 PE-Core 特征加线性分类器及表示感知数据筛选。仅用 10K 样本、8 个代表生成器,模型在 AIGI-Holmes、OpenFake 和 RealWorldBench 上达到或接近最优,RealWorldBench 上较随机筛选提升 96.4% vs. 94.9%,显示鲁棒性更多来自表示与数据策划而非单纯扩数据。

Harnessing Streaming Video in the Wild Figure 1
2026-06-09cs.CV

Harnessing Streaming Video in the Wild

Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

2026-06-09视觉感知

针对视频通话、直播解说和具身机器人中视频无限流入、需因果低延迟响应的问题,论文提出从数据、系统和评测三端重构流式 VLM:用 Streaming-Train-248K 和响应/沉默训练目标学习何时开口,用 StreamingHarness 提供每秒决策、12 小时记忆与 vLLM 友好的亚秒推理,并以 Streaming-Eval 衡量时机与正确性。实验称 8B 流式模型结合 Harness 超过多种闭源 VLM,并可在数小时直播中保持稳定亚秒延迟。

Facial Expression Recognition in the Deep Learning Era: A Systematic Multi-Criteria Review of Methods, Models, Datasets, Performance, Challenges, and Future Research Directions Figure 1
2026-06-09cs.CV

Facial Expression Recognition in the Deep Learning Era: A Systematic Multi-Criteria Review of Methods, Models, Datasets, Performance, Challenges, and Future Research Directions

Spyridon Georgiou, Aggelos Psiris, Spyridon Evangelatos, Thomas Lagkas, Vasileios Argyriou, Panagiotis Sarigiannidis, Iraklis Varlamis, Georgios Th. Papadopoulos

2026-06-09视觉感知数据集/基准

面向野外表情识别在姿态、遮挡、标注噪声、跨人群泛化与边缘部署中的困难,本文系统梳理深度学习时代 FER 研究。其核心是按任务、模态、预处理、架构、学习策略、采集场景和应用七维建立分类,并串联 CNN、Transformer、视觉语言与基础模型演进。主要结果是汇总数据集、评测指标和代表方法性能,指出未来瓶颈集中在数据标注、鲁棒泛化、时序建模、可信公平与伦理部署。

OrderDP: A Theoretically Guaranteed Lossless Dynamic Data Pruning Framework Figure 1
2026-06-09cs.LG

OrderDP: A Theoretically Guaranteed Lossless Dynamic Data Pruning Framework

Chenhan Jin, Shengze Xu, Qingsong Wang, Fan Jia, Dingshuo Chen, Tieyong Zeng

The Chinese University of Hong Kong, Beijing Normal-Hong Kong Baptist University, Guangzhou Nanfang College, Institute of Automation, Chinese Academy of Sciences, Xiangtan University, University of Utah, publicly available at https://github.com/shengze-xu/OrderDP.

2026-06-09视觉感知

针对动态数据剪枝中仅保留高信息样本易造成梯度偏差、训练不稳定且“近无损”机制缺乏解释的问题,OrderDP先随机生成候选池,再按损失选择Top-q样本,并以替代损失建立无偏梯度、收敛和泛化分析。实验在CIFAR-10/100与ImageNet-1K上显示,其在中等剪枝率下接近全量精度,ImageNet 40%剪枝仍保持精度并降低40%以上训练成本。

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning Figure 1
2026-06-09cs.CV

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu

NJU-LINK Team, Nanjing University, Despite their proficiency in general video description, high-quality, controllable outputs are crucial for, drastically degrades. Finally, to advance controllable generation, we construct OmniCap-IF-54K, a large-, path toward highly controllable omni-modal assistants., • A high-quality training dataset and a strong baseline for controllable generation. We release

2026-06-09视觉语言视觉感知数据集/基准

现有全模态视频描述评测多看语义丰富度,难以衡量模型在音视频联合理解下是否严格服从复杂格式与内容约束。OmniCap-IF提出含50类约束、1920样本的基准,将格式、视觉、音频、跨模态与时间定位分开评估,并揭示严格格式会削弱内容推理的“format-content tradeoff”。作者还构建54K指令微调数据和OmniCaptioner-IF,在复杂约束遵循和通用全模态描述上均优于基线。

Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction Figure 1
2026-06-09cs.CV

Towards Accurate Emotion-Attributed Video Captioning via Fine-grained Emotion-Cause Pair Extraction

Weidong Chen, Cheng Ye, Zhendong Mao, Liping Wang, Xinyan Liu, Yongdong Zhang

2026-06-09视觉语言视觉感知

论文针对情感视频描述中仅用全局视觉特征易引入冗余、导致情感归因错误的问题,提出 MM-ECPE++,把情感视为由特定视觉原因触发,通过概念级场景/物体/运动分解、视觉引导的情感可解释学习及跨注意力对比对齐,抽取细粒度情感-原因对。三组数据集实验显示方法优于基线,在 EVC-MSVD 上 BLEU-2 和 ROUGE-L 分别提升 4.4% 与 5.4%。

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA Figure 1
2026-06-09cs.RO

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

Tsinghua University

2026-06-09机器人视觉感知

论文关注探索式操作中“失败尝试”所揭示的隐藏前提:现有 VLM/具身多模态模型难以仅凭视频或本体轨迹判断最短成功动作链。作者提出 EMT-QA 任务,并用闭环代码代理从标注轨迹中蒸馏一行可读启发式 DRH,推理时只作为冻结 VLM 的提示。三项仿真和两项真机任务中,链预测准确率较最佳原始模态基线提升 0.38–0.47,且同一 DRH 可生成匹配 VLM 的程序分类器。

NGram-MoSE: Efficient Remote Sensing Super-Resolution via N-Gram Context and Mixture-of-Experts Figure 1
2026-06-09cs.CV

NGram-MoSE: Efficient Remote Sensing Super-Resolution via N-Gram Context and Mixture-of-Experts

Yun-Hsuan Huang, Trong-An Bui, Chih-Hung Chuang

Institute of Aerospace and Systems Engineering, National Taipei University of Technology, Taipei City, Taiwan., available observations are typically coarser. Single-image super-, whereas observations with higher temporal availability are

2026-06-09视觉感知

针对遥感中高时效影像分辨率低、现有 Transformer 超分模型计算重且跨地域泛化不稳的问题,NGram-MoSE 将跨窗口 N-Gram 上下文注入与稀疏 MoE 前馈结合,以减少窗口边界纹理断裂并在不等比例增加推理成本下扩展容量。地理隔离 OOD 测试中达到 31.68 dB PSNR,较重型基线 FLOPs 降低 14 倍;用于滑坡分割时相对双三次上采样提升 mAP@50 4.47%。

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving Figure 1
2026-06-09cs.CV

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

Hangjun Ye2, , Long Chen2, Yi Zhang1, 1Tsinghua University, rigorously labeled via temporally-grounded visual guidance, and augmented with, severely bottlenecks data scalability. In contrast, model-based methods are typically trained jointly

2026-06-09视觉语言视觉感知生成模型强化学习数据集/基准

论文针对自动驾驶中多模态轨迹选择和RL微调依赖手工规则、感知真值且难覆盖长尾失败的问题,构建DriveReward数据集:用时序视觉提示、反事实驾驶行为和多维QA标注训练/评测VLM奖励模型。结果显示通用VLM在该基准上并不稳健,而定制的1B DriveReward在任务奖励对齐上超过更大模型,并在RL微调与测试时轨迹打分中达到接近规则奖励的开闭环表现。

OmniTryOn: Video Try-On Anything at Once! Figure 1
2026-06-09cs.CV

OmniTryOn: Video Try-On Anything at Once!

Changliang Xia, Chengyou Jia, Minnan Luo, Zhuohang Dang, Xin Shen, Bowen Ping

Xi’an Jiaotong University, Xi’an Jiaotong University Xi’an China

2026-06-09视觉感知

针对现有视频虚拟试衣多限于单件服饰且依赖掩码、姿态等外部先验导致动态破坏的问题,论文提出 Try-On Anything 任务与 TryAny-Bench,并设计无需外部先验的 OmniTryOn:用首帧作为可穿戴对象缓存注入多物体细节,结合 STC-RoPE 保持时空锚点和 GTO 渐进训练。实验显示其在多物体试穿、画质与运动/背景一致性上优于专用试衣和通用视频编辑基线。

Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs Figure 1
2026-06-09cs.CV

Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs

Jie Ma, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

Xiamen University

2026-06-09视觉语言

针对高分辨率视觉 token 使多模态 LLM 自注意力预填充开销激增的问题,本文指出深层视觉-视觉注意力会“饱和”,空间关系已稳定而 FFN 仍负责语义对齐。基于此提出免训练 V-Skip:不删 token、不跳整层,而在校准选择的层中绕过冗余视觉自注意力并保留 FFN。实验显示其可跳过约 60% 饱和注意力模块,在 LLaVA 系列保持 98.42%–100.31% 性能、Qwen 上保持 94.16%,并降低幻觉风险。

EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control Figure 1
2026-06-09cs.RO

EgoPriMo: Egocentric Motion Generation for Interactive Humanoid Control

Haoyang Ge, Peng Ren, Yukun Shi, Cong Huang, Kun Li, Kai Chen

Tianjin University, Tianjin, China, Zhongguancun Academy, Beijing, China, Beihang University, Beijing, China, Zhongguancun Institute of Artificial Intelligence, Beijing, China

2026-06-09机器人规划控制

论文针对人形机器人依赖既定轨迹回放、缺少可交互全身运动先验的问题,提出从第一视角人类示范中学习 EgoPriMo:用三流 DiT 联合建模身体运动、视觉上下文和文本,并以任务掩码在同一 checkpoint 中支持重建、生成与预测。Nymeria 与 EgoExo4D 实验显示其优于 UniEgoMotion,生成的 SMPL 运动可接入 Unitree 控制器,但足滑和真实闭环评估仍有限。

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation Figure 1
2026-06-09cs.CV

Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation

Xuanyi Liu, Deyi Ji, Junyu Lu, Jing Wang, Qianxiong Xu, Xuhang Chen, Tianrun Chen, Siwei Ma

Peking University, Dalian University of Technology, Nanyang Technological University, University of Cambridge, Zhejiang University

2026-06-09视觉感知

本文针对文本到图像生成中短提示词含糊、传统 LLM 改写只追求流畅而易引入视觉/物理幻觉的问题,提出 FaithRewriter:先把改写提示渲染成“视觉锚点”,用多模态模型诊断并修正不合理之处,再通过 SFT+DPO 蒸馏到小型纯文本改写器。实验在 FaithT2I 等基准上显示其生成的提示更忠实用户意图、视觉可行性优于强基线,但离线构造数据的计算开销较高。

OctaOctree Neural Radiosity for Real-time Glossy Material Rendering Figure 1
2026-06-09cs.GR

OctaOctree Neural Radiosity for Real-time Glossy Material Rendering

Jierui Ren, Haojie Jin, Bo Pang, Meng Gai, Fei Zhu, Yisong Chen, Sheng Li (Peking University)

JIERUI REN, Peking University, China, HAOJIE JIN, Peking University, China, BO PANG, Peking University, China, MENG GAI, Peking University, China, FEI ZHU, Peking University, China, YISONG CHEN, Peking University, China, SHENG LI∗, Peking University, China, cn, Peking University, Beijing, China

2026-06-09视觉感知

该文针对实时全局光照中光泽/镜面材质出射辐射方向变化尖锐、传统神经辐射缓存易模糊或需多次采样的问题,提出 OctaOctree:用自适应空间八叉树结合每节点八面体方向图,在表示层分配互补的空间与角分辨率。实验显示其可在主交点单次网络查询下更好保留视角相关反射,较神经 radiosity/缓存基线提升保真度并达到实时渲染性能。

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding Figure 1
2026-06-09cs.CV

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

2026-06-09视觉语言强化学习

该文针对多模态 CoT 在初次视觉编码后只能“盲目”用文本推理、难以回看图像细节的问题,提出 TVI-CoT:用可学习的 Think、Look、Answer 控制符在推理中交替生成文本思路与重新访问相关视觉区域。八个基准上相对基线提升明显,如 MMMU +6.1%、MathVerse +3.8%、MathVista 和 ScienceQA 各 +3.4%。

GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors Figure 1
2026-06-09cs.RO

GraspFoM: Towards Reconstruction-Driven Robotic Grasping with 3D Foundation Priors

Dongli Wu, Xiaobao Wei, Hao Wang, Qiaochu Dong, Ying Li, Qingpo Wuwu, Ming Lu, Wufan Zhao

2026-06-09机器人三维

针对遮挡和部分观测下抓取既需局部接触又需完整三维结构的问题,GraspFoM将SAM3D三维基础先验转化为重建与抓取共享的对象潜变量,并用锚点初始化的截断扩散器直接生成连续多模态抓取姿态,再通过重建感知评分器和残差更新器让几何与可抓取性相互反馈。在GraspNet-1B上,文中报告其抓取和网格/3DGS重建均达到SOTA,且额外可训练参数较少。

X-Palm: Paired Multispectral-to-Smartphone Dataset for Cross-Domain Palmprint Authentication Figure 1
2026-06-09eess.IV

X-Palm: Paired Multispectral-to-Smartphone Dataset for Cross-Domain Palmprint Authentication

Jamal Seyedmohammadi, Pai Chet Ng, Angelo Genovese, Zhixiang Chi, Jeannie Lee, Konstantinos N. Plataniotis

Singapore Institute of Technology, University of Toronto, available at: https://github.com/X-Palm/X-Palm-2026

2026-06-09数据集/基准

针对掌纹认证中“受控注册、手机端随意验证”的域差,X-Palm构建了同一身份的多光谱扫描仪与非受控智能手机成对数据,覆盖设备、光照、姿态、距离、遮挡和手掌表面状态等复合变化。数据含103人206只手共6006张图像,并给出12种模型的跨数据集、闭集/开集跨域基准;结果显示既有方法在X-Palm上明显崩塌,而用X-Palm训练的模型跨域鲁棒性更稳定,增益可能主要来自数据覆盖与成对设计。

Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning Figure 1
2026-06-09cs.CV

Reinforcing Temporal Answer Grounding in Instructional Video via Candidate-Aware Causal Reasoning

Muge Qi, Rong Fu, Pengbin Feng, Xianda Li, Yu Cai, Yifu Guo, Shizhe Zhang, Simon James Fong, Lei Ma, Bin Li

Center, Peking University, Beijing, China 2University of Macau, Macau, China 3University of Southern California, Los Ange-, les, USA 4University of Bologna, Bologna, Italy 5Sun Yat-sen, University, Guangzhou, China 6Shenzhen Institute of Advanced, away from label fitting, and promotes cross-scene

2026-06-09视觉语言视觉感知

这篇论文针对教学视频问答定位中“长视频里找极短答案片段”的难题,指出全视频推理易受冗余内容和弱视觉推理干扰。方法先用视觉语言预训练模型筛出Top-K候选片段,再在候选集上进行带拒绝奖励的时序因果/逻辑推理,并用GRPO优化以提升抗干扰能力。实验在六个基准上取得mIoU最优,说明候选感知缩小搜索空间对长视频精确定位有效。

Segmentation-Assisted Brain MRI Synthesis with Cross-Image Multi-Contrast Feature Memory Bank Retrieval Augmentation Figure 1
2026-06-09cs.CV

Segmentation-Assisted Brain MRI Synthesis with Cross-Image Multi-Contrast Feature Memory Bank Retrieval Augmentation

Wenwei Huang, Jia Wei, Jianlong Zhou

2026-06-09视觉感知

针对临床多对比脑 MRI 常因扫描时间、伪影或协议差异而缺失,且现有合成方法在肿瘤区域易模糊的问题,论文提出 SSCF:用分割分支预测肿瘤掩膜并回馈合成分支,同时通过肿瘤掩膜库与跨图像多对比特征库检索外部先验。其在 BraTS2020 和 UCSF-BMSR 上优于既有方法,尤其改善多对比缺失时的肿瘤结构与纹理恢复。

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs Figure 1
2026-06-09cs.CV

CheXanatomy: Anatomy-Aware Vision-Language Modeling for Chest Radiographs

Sergios Gatidis, Curtis Langlotz, Christian Bluethgen

2026-06-09视觉语言视觉感知

胸片解剖分割受投影重叠、标注稀缺和域偏移限制,普通VLM又偏全局图文对齐。CheXanatomy用CT分割经DRR投影生成合成胸片监督,将框和掩码编码为token,让PaliGemma以自回归方式学习解剖结构而非加专用解码头。结果显示其在合成数据上接近U-Net,在真实胸片域移下几何鲁棒性更好,少样本定位更省标注;但增益可能部分来自模型规模和输入分辨率。

CoVEBench: Can Video Editing Models Handle Complex Instructions? Figure 1
2026-06-09cs.CV

CoVEBench: Can Video Editing Models Handle Complex Instructions?

Jiangtao Wu, Jiaming Wang, Yiwen He, Yuanxing Zhang, Shihao Li, Dunyuan Liu, Xuedong Zhao, Jialu Chen, Zekun Moore Wang, Jiaheng Liu

NJU-LINK Team, Nanjing University

2026-06-09视觉感知

这篇论文针对现有视频编辑评测多停留在单一简单编辑、难以反映真实多约束指令的问题,提出 CoVEBench:包含416个源视频、626条多点编辑指令和9990个细粒度检查项,覆盖主体、背景、镜头、运动、特效等维度,并用多模态大模型评估指令遵循、保真度和质量。实验显示,当前开源与闭源模型在组合编辑中仍常漏改、破坏应保留内容或产生伪影。

Geometry-Driven Flow Analysis of Brain Sulcal Pattern Figure 1
2026-06-09cs.CV

Geometry-Driven Flow Analysis of Brain Sulcal Pattern

Moo K. Chung, Luigi Maccotta, Aaron Struck

University of Wisconsin, Madison, USA, Washington University, St. Louis, USA, at the University of Wisconsin Hospital and Clinics [7]. De-

2026-06-09生成模型

针对 JME 中传统厚度、脑回化指数等标量指标难以刻画分布式皮层折叠组织的问题,论文将平均曲率视为沟/回源汇,在皮层流形上求解正则化 Poisson 方程,得到折叠势及其梯度流。结果显示该求解器在仿真中较稳健,并在 JME 相比对照中发现不对称的额中央、运动区及外侧裂周围折叠势改变,且与皮层厚度仅部分重叠,提示其捕捉到互补的几何重组信息。

SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration Figure 1
2026-06-09cs.CV

SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration

Jeonghwan Kim, Yushi Lan, Yongwei Chen, Hieu Trung Nguyen, Chuanyu Pan, Xingang Pan

Nanyang Technological University, 2 University of Oxford, 3 Meshy AI

2026-06-09视觉感知三维

针对单图生成完整三维场景时几何、物体关系与环境上下文难以一致且依赖场景级标注的问题,SceneConductor将流程拆为场景初始化、环境构建和多智能体局部细化,并用点图稀疏几何先验训练布局预测器以降低监督需求。实验显示其在基准和真实图像上提升几何精度、空间一致性与感知真实感,但多基础模型串行带来的时延和误差传播仍是限制。

Programmable Silicon Retina on Pixel Processor Array Figure 1
2026-06-09eess.IV

Programmable Silicon Retina on Pixel Processor Array

Maciej Lewandowski, Prince Philip, Alexandre Marcireau, Chetan Singh Thakur, André van Schaik, Piotr Dudek

Department of Electrical and Electronic Engineering, University of Manchester, UK, Department of Electronic Systems Engineering, Indian Institute of Science, Bangalore, India, Department of Computer Science, Most commercially available event cameras [18, 19, 20] implement a relatively simplified model of retinal processing., arithmetic noise. Given these constraints and the limited commercial availability of PPA hardware, we also provide a, rating biologically motivated functions such as center-surround filtering and spike-based encoding. To the best, of our knowledge, this is the first implementation of a multi-stage silicon retina model with center-surround, currently being prepared for release and will be made available in a cleaned and documented repository here

2026-06-09视觉感知

针对传统帧相机带宽/功耗高、标准DVS仅做时间对比而缺少更完整视网膜处理的问题,本文在SCAMP-5像素处理阵列上实现含中心-周边滤波、增益控制与ON/OFF脉冲输出的多阶段硅视网膜,并提供CUDA仿真框架。实验显示其不利于绝对强度重建,但在相同轻量网络下使视频显著性预测损失较DVS降低13%,事件率约降47%,说明其过滤可能对边缘语义任务起到信息蒸馏作用。

Self-Supervised Vision Transformers for CBCT-Based Detection of Temporomandibular Joint Osteoarthritis Figure 1
2026-06-09cs.CV

Self-Supervised Vision Transformers for CBCT-Based Detection of Temporomandibular Joint Osteoarthritis

Shradhdha Trivedi, Vrundan Sojitra, Mariela Padilla

∗Herman Ostrow School of Dentistry, University of Southern California, †Viterbi School of Engineering, University of Southern California, without labels, making them attractive for low-data medical, than 200 annotated cases are available—directly relevant to, bag-level classification without patch labels. Its combina-, orientation, centred on the TMJ region of each volume, as-, positive-class weighting addresses label imbalance, label, Review Board (IRB) at the University of Southern Califor-, the public University of Michigan Deep Blue TMJ OA repos-, data leakage (Table 1). Labels are binary: OA-positive (any

2026-06-09视觉感知

针对颞下颌关节骨关节炎在 CBCT 中骨性改变细微、标注数据少且跨站点泛化困难的问题,本文将 3D CBCT 转为轴向切片,用 DINO 系列自监督 ViT 提取切片特征,并以注意力 MIL 做患者级分类。核心洞察是适配策略比骨干选择更关键:仅解冻最后两个 Transformer block 即可显著提升性能,DINOv2 AUC 从冻结的 0.671 升至 0.902,优于 DINOv1、DINOv2+reg 和监督 ImageNet ViT 基线。

Beyond Raw Signals: Undecoded Generative Latents as Privileged Synthetic Data Figure 1
2026-06-09cs.CV

Beyond Raw Signals: Undecoded Generative Latents as Privileged Synthetic Data

Cristian Sbrolli, Nicolas Michel, Matteo Matteucci, Toshihiko Yamasaki

The University of Tokyo, and auxiliary modalities are rarely available in the wild., class label, Inequality, mutual information I with the label Y cannot in-

2026-06-09生成模型

本文针对多模态训练依赖成对数据、推理成本高,以及生成补全模态需“解码再编码”造成噪声和浪费的问题,提出直接使用3D/音频生成模型未解码潜变量作为特权信息的DLA,并用MESSy预测式多层蒸馏让纯视觉学生吸收几何与声学先验而不强制特征对齐。实验称其优于原始数据增强和传统蒸馏,但具体增益幅度与来源文中片段未充分说明。

SMI: Efficient Self-Supervised Learning via Mutual-Information-Inspired Dependency Optimization Figure 1
2026-06-09cs.CV

SMI: Efficient Self-Supervised Learning via Mutual-Information-Inspired Dependency Optimization

Pritam Mishra, Coloma Ballester, Dimosthenis Karatzas

representations from large-scale unlabeled data. Recent contrastive approaches achieve remarkable, conceptual appeal, developing scalable and computationally efficient MI-inspired objectives for SSL

2026-06-09优化算法

针对现有自监督方法依赖大 batch、动量编码器、内存库或全局同步导致训练复杂的问题,SMI 将样本间相关性经高斯互信息启发的非线性变换后,在样本级依赖矩阵上做对齐与去冗余,而非优化高维特征相关矩阵。ResNet-50/ImageNet 上线性评估接近主流 SSL,同时降低计算与同步需求;在低资源和细粒度迁移任务上优于 Barlow Twins。

Set-Based Transformer for Atmospheric Compensation in Standoff LWIR Hyperspectral Imaging Figure 1
2026-06-09cs.CV

Set-Based Transformer for Atmospheric Compensation in Standoff LWIR Hyperspectral Imaging

Fabian Perez, Nicolas Quintero, Jeferson Acevedo, Hoover Rueda-Chacon

Department of Computer Science, Universidad Industrial de Santander, code is publicly available at: https://factral.co/SAE-LWIR/, • The first publicly available MODTRAN-generated dataset

2026-06-09视觉感知

本文针对近水平远距离 LWIR 高光谱成像中大气透过率、上行辐射和下行辐射随距离强烈变化、传统星载/机载补偿方法难以适用的问题,提出用 Set Transformer 无序联合处理多距离辐射观测,并分别输出逐距离 T/La 与共享 Ld;同时用稀疏自编码器分析潜变量。基于 MODTRAN 生成数据的实验显示三类大气产物光谱失真较低,但真实场景泛化仍文中未充分说明。

Where the Score Lives: A Wavelet View of Diffusion Figure 1
2026-06-09cs.LG

Where the Score Lives: A Wavelet View of Diffusion

Emma Finn, Binxu Wang, T. Anderson Keller, Demba E. Ba

2026-06-09生成模型

论文针对扩散模型中“架构选择如何影响生成/去噪行为”仍不清楚的问题,用二维正交小波基参数化 score,并将最优 score 写成数据分布矩的闭式形式,从而把 U-Net/CNN 等归纳偏置转化为可分析的局部、多尺度耦合。MNIST 实验显示,高阶矩特征提升重建,局部邻域耦合稳定降低 MSE;跨方向 band-tying 可让边缘更锐但高噪声下可能损害 MSE,增益更像来自局部相关与多尺度结构。

HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling Figure 1
2026-06-09cs.CV

HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

Ziran Qin, Yuchen Jiang, Mingbao Lin, Youru Lv, Hang Guo, Wen Fei, Weiyao Lin

Ziran Qin, Yuchen Jiang, Youru Lv, Fei Wen, and Weiyao Lin are with Shanghai Jiao Tong University, Shanghai, China

2026-06-09视觉感知

VAR 视觉自回归模型按尺度生成虽减少解码步数,但历史尺度 KV cache 持续累积,带来注意力计算和显存瓶颈。HACK++ 的关键洞察是注意力头可分为维持语义的 contextual heads 与保持空间结构的 structural heads,且二者对历史尺度依赖随层和生成步变化;方法通过离线校准、头感知 token 选择、注意力与 cache 解耦预算及自适应分配实现训练-free 压缩。实验显示其在多类 VAR 任务中可在较低注意力和 cache 预算下保持近无损质量,并降低显存与推理开销。

G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation Figure 1
2026-06-09cs.CV

G2G: Exploiting Intra-Group Geometry for Inter-Group Pose Estimation

Yufei Wei, Shuhao Ye, Chenxiao Hu, Yiyuan Pan, Dongyu Feng, Rong Xiong, Yue Wang, Yanmei Jiao

State Key Laboratory of Industrial Control and Technology, Zhejiang University, Hangzhou, China, Zhejiang Humanoid Robot Innovation Center Co., Ltd., Ningbo, China, School of Information Science and Engineering, Hangzhou Normal University, Hangzhou, China

2026-06-09三维

论文针对跨序列重定位与多相机 rig 里程计都需估计两组图像间 6DoF 位姿、但现有多视图模型忽略组内几何的问题,提出 G2G:冻结多视图基础模型,用重采样器、跨组自注意力桥和多帧位姿头补足跨组推理,仅以相对位姿监督训练约 32M 参数。在四个仿真、真实跨季节和 sim-to-real 数据集上取得最佳非 oracle 精度,优势在外观变化和真实 rig 场景更明显。

Remember with Confidence: Uncertainty Quantification for Spatio-temporal Memory with Probabilistic Guarantees Figure 1
2026-06-09cs.CV

Remember with Confidence: Uncertainty Quantification for Spatio-temporal Memory with Probabilistic Guarantees

Harry Zhang, Nicolas Gorlo, Luca Carlone

2026-06-09安全鲁棒

面向长时程机器人操作,论文指出现有4D场景图/检索记忆常把VLM描述当作可靠事实,难以发现视角差异导致的错误语义。作者提出UQ-DAAAM,用跨视角caption嵌入散布量化对象级语义不确定性,并在固定查询预算下优先补采高质量视角、融合多视角描述,同时给出视角质量降低不确定性的概率保证。OC-NaVQA实验显示其相比基线获得更大不确定性下降,并提升时空问答表现。

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation Figure 1
2026-06-09cs.CV

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

Zhejiang University, Bilibili Inc., is available at https://LittleWork123.github.io/tide.

2026-06-09视觉感知生成模型

视频生成、指令编辑和参考驱动编辑长期依赖不同专用模型,统一建模时又容易混淆目标、源视频与多参考图像的角色。TIDE将这些任务归为条件去噪问题,用逐 token 任务嵌入显式隔离不同条件,并结合 VLM 语义路径与 VAE latent 细节路径,再以渐进多任务训练缓解任务冲突。实验显示其在 OpenVE-Bench、OpenS2V 及新建 TIDE-Bench 上达到或超过现有方法。

MS-COOT: Comparing Morse-Smale Complexes with Co-Optimal Transport Figure 1
2026-06-09cs.GR

MS-COOT: Comparing Morse-Smale Complexes with Co-Optimal Transport

Guangyu Meng, Mingzhe Li, Erin Wolf Chambers

revealing all regions individually, labeled S1–S9 and T1–T5. (c) Row-normalized region coupling ξ for t=51→52: each bar shows how a, • All authors are with the Department of Computer Science and Engineering, University of Notre Dame, Notre Dame, Indiana, United States. E-mail:

2026-06-09视觉感知

针对现有 Morse-Smale 复形比较多只匹配临界点、忽略区域结构的问题,论文将临界点与区域分别建模为超图节点和超边,提出 MS-COOT 用协同最优传输同时求临界点耦合与区域耦合,从而识别区域合并、分裂等事件。五类 2D/3D 标量场实验显示,它比 WD/GWD/FGW 更能区分结构变化、仿真分辨率与形状类别,但全局最优性、计算开销和简化阈值稳定性仍未充分解决。

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding Figure 1
2026-06-09cs.CV

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

Ziang Li, Dongzhou Cheng, Yibin Wang, Shiyue Wang, Xiaoyang Xu, Lingxuan Weng, Juan Wang, Jiaqi Wang

Wuhan University, Shanghai Innovation Institute, Southeast University, Fudan University, East China Normal University

2026-06-09强化学习

针对现有世界动作模型依赖大规模生成式视频/动作架构、训练和闭环推理开销高的问题,Light-WAM将未来视频预测保留为训练期表征监督,但在下采样潜空间中执行,并用冻结紧凑视频骨干加轻量适配;其StateFusionActionExpert从多层状态做学习查询池化,单次前向直接预测动作块。实验中以0.44B可训练参数在LIBERO达97.2%成功率、RoboTwin 2.0达76.4%,相较Fast-WAM吞吐提升4.25倍,推理72.03ms/4.1GiB。

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding Figure 1
2026-06-09cs.AI

When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding

Yiheng Wang, Yueqian Lin, Lichen Zhu, Yudong Liu, Hai "Helen" Li, Yiran Chen

Duke University, Durham, North Carolina, USA

2026-06-09视觉感知

本文关注视频理解 MLLM 在“正确答案不在候选项中”时是否仍会被迫选择的问题,以移除真值答案构造 absent answer detection,并在带 NOTA、多轮开放生成和无提示三种设置下诊断模型可靠性。结果显示,多数模型即使基准准确率较高,也倾向选择看似合理的干扰项;时间推理任务更差,增加帧采样反而降低检测率。CoT 可部分改善逐项核验,但仍不足,说明仅靠提示难以解决该失效模式。

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning Figure 1
2026-06-09cs.CV

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning

Cong Wan, Ying He, Zhongzhan Huang, Hefeng Wu

Sun Yat-sen University

2026-06-09视觉语言

针对多模态基础模型继续依赖预训练扩展收益递减、推理阶段算力如何有效利用缺少统一框架的问题,本文系统梳理测试时扩展(TTS)在视觉语言生成与推理中的进展,将方法归纳为采样、反馈和搜索三类,并对应MLLM与扩散模型场景整理应用与基准。主要结果是给出领域首个较完整分类图谱和未来问题清单;作为综述,文中未报告统一实验增益。

SegmentAnyTreeV2: Scaling Transformer-Based Tree Instance Segmentation Across Sensors, Platforms, and Forests Figure 1
2026-06-09cs.CV

SegmentAnyTreeV2: Scaling Transformer-Based Tree Instance Segmentation Across Sensors, Platforms, and Forests

Maciej Wielgosz, Stefano Puliti, Rasmus Astrup

aNorwegian Institute of Bioeconomy Research (NIBIO), Høgskoleveien 7, 1433 Ås, Norway, available benchmark datasets (Puliti et al., 2023, Nevertheless, most publicly available datasets remain biased, • Scalable plot-level inference.

2026-06-09视觉感知

针对现有森林点云分割在复杂阔叶/热带林、密集冠层和跨传感器场景中泛化不足的问题,论文提出 SegmentAnyTreeV2:用 PTv3 序列化 Transformer 骨干替代稀疏卷积,并将语义头与树实例解码解耦,只在树类体素上做交叉注意力,结合实例感知查询初始化和非对称掩码评分;同时扩展 FOR-instanceV3 数据集。实验在 FOR-instanceV2 上达到 85.0% F1、90.7% coverage 和 87.6% mIoU,优于既有学习方法,并展示一定零样本跨域能力。

Empowering Feed-Forward Reconstruction Models with Metric Scale via Satellite Images Figure 1
2026-06-09cs.CV

Empowering Feed-Forward Reconstruction Models with Metric Scale via Satellite Images

Xianghui Ze, Yongjian Luo, Mengjun Chao, Zhenbo Song, Jianfeng Lu, Yujiao Shi

Nanjing University of Science and Technology, 2ShanghaiTech University, feed-forward 3D reconstruction. The key idea is to use readily available satellite imagery as, controlled settings, accurate camera parameters are often unavailable or unreliable in practice., leveraging satellite imagery as an external reference. Satellite images are widely available and, GPS measurements are not always available or reliable in real-world scenarios [14]. We relax

2026-06-09视觉感知三维

前馈三维重建虽泛化强,但通常只有相对尺度,难以用于自动驾驶等需要米制几何的场景。本文的关键洞察是把粗 GPS 检索到的卫星图作为全局尺度参照,通过地面视角与卫星视角的双向交互和场景到卫星对齐损失,同时恢复绝对尺度、优化几何并估计相机位姿。在 KITTI、nuScenes 和 Oxford RobotCar 上,方法在米制深度、多视角点云重建和跨视角定位上均取得一致提升。

Neural Field Tokenizations with Hierarchy and Spatial Locality Priors Figure 1
2026-06-09cs.LG

Neural Field Tokenizations with Hierarchy and Spatial Locality Priors

Alonso Urbano, David W. Romero, Max Zimmer, Sebastian Pokutta

Department for AI in Society, Science, and Technology, Zuse Institute Berlin (ZIB), Germany, Institute of Mathematics, Technische Universität Berlin, Germany, scalability bottleneck of training with per-sample optimization., limits the scalability of existing modality-agnostic neural field methods., • We identify a tradeoff between scalability, structural priors and modality-agnosticism in neural

2026-06-09视觉感知

论文针对通用神经场表示依赖逐样本元学习、显存高且难以扩展,而前馈编码又常引入模态假设的问题,提出 LH-NeF:用保持空间局部性的层级分组注意力将坐标-取值观测编码为结构化 token,并通过高斯软路由与跨注意力渲染任意坐标。实验显示其在图像、3D 形状和气候场的重建及生成、分类、预测任务上达到或接近最优,同时较 ENF 显存降约 42×、批量增 133×。

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models Figure 1
2026-06-09cs.CV

How Much MRI Preprocessing Is Enough? A Cost-Utility Study for Brain MRI Foundation Models

Jiangshuan Pang, Wangyang Tang, Jing Yan, Zhixuan Cheng, Youzhe He, Zhenkun Zhuang, Tao Zhou, Shiping Liu

School of Artificial Intelligence, University of the Chinese Academy of Sciences, Beijing 101408, China, Key Laboratory of Spatial Omics of Zhejiang Province, BGI Research, Hangzhou 310030, China, Key Laboratory of Brain Cell Mapping of Zhejiang Province, BGI Research, Hangzhou 310030, China, escalation pipeline. Code is available at https://github.com/PangJiangShuan/PreBrain., Multi-center, multi-modal MRI data

2026-06-09视觉感知

这篇论文针对脑 MRI 基础模型中“预处理是否越多越好”的常见假设,将预处理从例行清洗重新定义为带计算成本的建模选择。作者在同一 2 万例 3D MRI、3D ViT、MAE/JEPA 和下游任务设置下系统比较 P0–P7 流水线,发现 P0/P1 不稳定,P2 是最低可行基线;继续加强预处理的总体收益很小,MAE 仅增 3.4 个百分点、JEPA 仅增 1.8 个百分点,且收益主要依赖任务,MCI 最明显,而 AGE、肿瘤分割常接近或优于 P2。

RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT Figure 1
2026-06-09cs.CV

RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT

Kyumin Choi, Ikbeom Jang

Hankuk University of Foreign Studies, evolution. Code is available at https://github.com/labhai/RAPID.

2026-06-09视觉感知

ViT 自注意力计算随 token 数二次增长,现有剪枝/合并常忽略不同深度表征差异。RAPID 的核心洞察是浅中层更适合按冗余与相似性剪掉重复局部模式,深层则用 CLS 注意力保护重要语义 token,并合并低重要但相似的邻居。ImageNet-1K 上在 ViT/DeiT 中相较 ToMe、ToFu 保持更好精度-压缩折中,极端压缩下最高比 ToMe 高 4.29% 准确率。

Property-Informed Diffusion-Based Text-to-Microstructure Generation Figure 1
2026-06-09cs.CV

Property-Informed Diffusion-Based Text-to-Microstructure Generation

Bingxuan Dai, Hongsong Wang, Jie Gui

School of Cyber Science and Engineering, Southeast University, Nanjing 210096, China, School of Computer Science and Engineering, Southeast University, Nanjing 210096, China, Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary, Applications (Southeast University), Ministry of Education, China, Purple Mountain Laboratories, Nanjing 210000, China, Engineering Research Center of Blockchain Application, Supervision And Management, (Southeast University), Ministry of Education, China

2026-06-09生成模型

面向超材料 3D 微结构逆向设计中依赖专家条件、迭代仿真且生成多样性和物理可行性不足的问题,本文提出 PropDiff-TMG,用自条件扩散模型从文本生成体素微结构,并通过物性随机注入、FiLM 调制、文本-结构对比对齐及测试时奖励引导局部编辑增强语义与力学一致性。实验表明其能在多类材料上生成语义相关且物理上较合理的结构,但具体相对增益幅度文中片段未充分说明。

IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval Figure 1
2026-06-09cs.CV

IMAGINE: Adaptive Schema-Imagery Enhanced Composition for Composed Video Retrieval

Jiale Huang, Zixu Li, Zhiwei Chen, Zhiheng Fu, Chunxiao Wang, Yupeng Hu

Shandong University, Qilu University of Technology, (Shandong Academy of Sciences), construct a scalable semantic memory to materialize the im-, et al. [65] introduced a multi-expert collaborative network. Simi-, multi-agent collaboration mechanisms [82–87], aiming to achieve

2026-06-09视觉感知三维

论文针对组合视频检索中“修改文本所指语义未必直接出现在画面里”的问题,指出仅做显式对象对齐会漏掉如蛋糕到生日派对这类隐含联想。IMAGINE用动态多模态原型构建“图式意象”语义记忆,并通过置信度调制把隐式语义自适应注入视频-文本组合与双空间对齐。实验称其在三个CVR/CIR基准上达到SOTA,但具体增益来源与数据/模型规模关系仍需进一步核查。

Gravity-guided Contact Dynamics Estimation from 3D Human Motions Figure 1
2026-06-09cs.CV

Gravity-guided Contact Dynamics Estimation from 3D Human Motions

Cuong Le, Urs Waldmann, Bastian Wandt, Mårten Wadenbäck

Linköping University, scalable solution is to estimate the dynamics directly from motion cap-, gravity. We use the human’s center of gravity to estimate the ground con-, abilities and the total exterior force computed from the center of mass, contact dynamics are collected from sensor devices in laboratory environments, i.e. force plates for ground reaction force and center of pressure measurements., This laboratory setting restricts biomechanics research to simple motions per-, on the root or the center of mass of the human body [2,23]. The total exterior, arrow). The gravity-guided model imposes the influence of the center of gravity (CoG), total contact reaction force that could reconstruct the center of mass (CoM), based on the center of gravity (CoG) for more accurate dynamics estimation

2026-06-09三维

本文针对力板/压力垫采集接触动力学受限、仅按离地高度估计又难区分多接触受力的问题,提出 GraCE:利用人体质心/重心相对各 SMPL+H 顶点的距离来调制接触概率,并用由质心轨迹和牛顿力学估计的总外力分配到全身顶点。实验在 GroundLink 的地面反作用力和 MOYO 的压力预测上优于重实现基线,文中报告接触估计精度约提升 36%。

Phase Marginalization for Patch-Grid Instability in Vision Transformers Figure 1
2026-06-09cs.CV

Phase Marginalization for Patch-Grid Instability in Vision Transformers

Oğuzhan Ercan

patch partition can change the token evidence available to a pixel, es-, Dense prediction tasks require coordinate-stable outputs: a pixel-level label should, evidence available to the dense prediction head.

2026-06-09视觉感知

论文针对 ViT 固定非重叠 patch 网格在密集预测中引入的相位不稳定:网格起点微移会改变边界像素可见的 token 证据。作者将 patch-grid phase 形式化为 nuisance variable,提出无需训练的 Phase Marginalization,在多个结构化相位下前向、反向对齐并平均 logits。实验显示 K=4 在分割、深度和局部匹配上优于 K=1,并在 Cityscapes 同等四次前向预算下较 shift-TTA 提升约 0.31 mIoU;K=8/16 收益趋缓,代价上升。

One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling Figure 1
2026-06-09cs.CV

One Stone, Three Birds: Self-adaptive Optimal Transport for Multi-VLM Selection, Adaptation, and Ensembling

Qiyu Xu, Zhanxuan Hu, Yu Duan, Yonghang Tai, Huafeng Li, Quanxue Gao, Xiangyong Cao

attractive when target annotations are scarce or unavailable., and then adapt that model to the unlabeled target set. This single-, labels are available to identify the reliable ones. Deployment, are available at https://github.com/Afleve/OSTB., specified without training a supervised classifier for each label, Qiyu Xu and Xiangyong Cao are with the School of Computer Science and, Technology and the Ministry of Education Key Lab for Intelligent Networks, and Network Security, Xi’an Jiaotong University, Xi’an, Shaanxi 710049, Zhanxuan Hu and Yonghang Tai are with the School of Information Science, and Technology, Yunnan Normal University, Chenggong, Kunming, Yunnan, Yu Duan and Quanxue Gao are with the School of Telecommunica-, tions Engineering, Xidian University, Xi’an 710071, China (e-mail: du-

2026-06-09视觉语言

论文针对多种通用与领域 VLM 在无标注目标集上可靠性差异大、先选单模型再适配易失效的问题,提出训练自由的 OSTB:用自适应最优传输估计共享样本-类别结构,并同时服务于模型排序、传输条件视觉分类器适配和可靠性加权集成。实验覆盖自然图像、遥感和病理数据集,显示其提升模型排名准确性、适配稳定性与集成鲁棒性。

Human-Centered Benchmarking of Driver Monitoring Models Figure 1
2026-06-09cs.CV

Human-Centered Benchmarking of Driver Monitoring Models

Ruben Dario Florez-Zela

2026-06-09数据集/基准

针对驾驶员监控模型常以干净集准确率作比较、难以反映车载安全部署需求的问题,论文提出 HCBF,从准确性、可解释性、效率和鲁棒性联合评测轻量 CNN 与 DeiT-Tiny。实验显示四类模型准确率接近且各占一维优势,均在 Pareto 前沿;ShuffleNetV2 在综合 HCS 中持续第一,但在传感器噪声下性能跌至不足一半并易把闭眼判为睁眼,而 DeiT-Tiny 更稳健,说明单一或加权总分会掩盖关键失效风险。

Trustworthy Visual Predicates for Robust Manipulation Understanding under Degradation Figure 1
2026-06-09cs.CV

Trustworthy Visual Predicates for Robust Manipulation Understanding under Degradation

Fatemeh Ziaeetabar

Department of Computer Science, School of Mathematics, Statistics, and Computer Science, College of Science, University of Tehran, vision. In applications such as assistive robotics, human–robot collaboration, indus-, therefore requires more than assigning a single label to a video clip. It requires infer-, labels, but they provide the perceptual evidence from which actions are interpreted.

2026-06-09机器人安全鲁棒

机器人操作理解常只看最终动作准确率,难以定位模糊、遮挡、掉帧等退化下的关系证据失效。本文提出谓词级可靠性框架,围绕接触、支撑、包含、抓取/释放等视觉谓词建模置信度、时序一致性和下游影响。实验显示失效并非均匀:静态空间谓词较稳,接触和动态派生谓词更脆弱;严重退化下检测噪声、遮挡和掉帧损失最大,动作理解准确率由0.89降至0.58,置信度加权也带来明显缓解。

Revisiting Articulated Parts Perception in Robot Manipulation Figure 1
2026-06-09cs.RO

Revisiting Articulated Parts Perception in Robot Manipulation

Xiaoqian Wu, Yejie Guo, Xiaoyang Chen, Lixin Yang, Cewu Lu, Yong-Lu Li

Shanghai Jiao Tong University

2026-06-09机器人

针对铰接物体在机器人操作中难以从单帧 RGB-D 稳健感知的问题,论文提出 GPS 几何主结构,用显式运动轴与手部代理点替代高成本位姿标注和噪声较大的点流监督,并配合 VR 在约一分钟内标注序列。作者据此采集 234 个物体、41K 帧数据训练通用预测模型;真实机器人无需域内微调,在 9 个物体 270 个初始状态上达到 73% 成功率。

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation Figure 1
2026-06-09cs.CV

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

Zhejiang University, rics. Code and dataset is available at https:, models themselves as callable tools. Such agentic

2026-06-09视觉感知

论文关注通用智能体框架能否胜任长视频生成这一长程多模态编排任务,而非依赖人工固定流水线。VideoWeaver将其定义为技能组合与演化问题,构建16类285例基准,并用可检查执行轨迹、中间文件和最终视频的agent-as-judge给出过程与结果评分,再以反馈优化组合/创作技能。实验显示显式组合技能优于仅调用基础技能,技能演化进一步提升质量且可泛化,自动评审尤其在过程指标上与人工较一致。

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding? Figure 1
2026-06-09cs.CV

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

2026-06-09安全鲁棒

该文针对多模态大模型在噪声、压缩、恶劣天气等真实视觉损坏下理解能力显著下降的问题,提出 Robust-U1:不再只做特征对齐或文本解释,而是让模型先自恢复受损图像,再结合原图与恢复图进行推理。方法用监督微调获得重建能力,并以 SSIM 与 CLIP 相似度双奖励强化像素和语义保真。实验称其在 R-Bench 及多种 VQA 对抗损坏设置下达到更强鲁棒性,且恢复质量与推理增益相关。

OSMGraphCLIP: Learning Global Location Representations from OpenStreetMap Graphs Figure 1
2026-06-09cs.AI

OSMGraphCLIP: Learning Global Location Representations from OpenStreetMap Graphs

Dimitrios Michail, Eleni Saka, Ioannis Giannopoulos, Ioannis Papoutsis

National Technical University of Athens, Athens, Greece., Vienna University of Technology, Vienna, Austria., learns global location embeddings from freely available OpenStreetMap (OSM) data., Satellite imagery is a natural context modality: it is globally available and densely en-, Geographic Information (VGI), OSM is a freely available, collaboratively curated global

2026-06-09视觉感知

论文针对全球位置表征过度依赖卫星/街景影像、较少利用 OSM 结构化语义的问题,提出 OSMGraphCLIP:将道路、建筑、用地和 POI 构成异构图,用空间拓扑关系与多尺度图编码器监督坐标位置编码器。实验在 24 个地理下游任务上显示,仅用 OSM 图即可多数情况下匹配或超过卫星基线,尤其在社会经济与公共健康预测中更强,说明显式人类活动语义是关键增益来源。

OmniFaceRig: Fully Automatic Inner-Mouth-Aware Face Rigging Across Diverse 3D Character Topologies Figure 1
2026-06-09cs.GR

OmniFaceRig: Fully Automatic Inner-Mouth-Aware Face Rigging Across Diverse 3D Character Topologies

Chao Wang, Guangyao Ma, John Doublestein, Junming Chen, Yiming Lin, Zhaoen Su, Xiaomin Luo, Shiyang Cheng, Jie Shen, Doug Roble, Dilin Wang, Yilei Li, Rakesh Ranjan

Reality Labs, Meta, category-specific tuning. We also publicly release Omni-Bench, a freely available benchmark dataset, D character animation—remains one of the most labor-intensive steps in the character production pipeline., (e.g., cats, bears, rabbits, tigers). These animal labels describe coarse facial topology for template selec-

2026-06-09三维

面部绑定仍依赖人工标注、模板调参和口腔建模,尤其难覆盖动物等非人拓扑。OmniFaceRig提出从仅有表面网格到动画就绪FACS绑定的全自动流程,结合VLM/CV可绑定性检测、多模型人脸解析、关键点模板配准、程序化牙龈舌生成与碰撞感知变形迁移,并按拓扑选择模板。实验在筛选后的Omni-Bench上显示较高绑定成功率、近完整人脸检测召回、低口腔穿透,单A100约20–30秒处理一个资产。

Wispy to Voluminous: Prior-free Multi-view Capture of Strand-level Facial Hair Figure 1
2026-06-09cs.GR

Wispy to Voluminous: Prior-free Multi-view Capture of Strand-level Facial Hair

Jaeseong Lee, Giljoo Nam, Adrian Jarabo, Carlos Aliaga

2026-06-09视觉感知

该文针对数字人中胡须、眉毛、睫毛等面部毛发常被体积场烘焙进人脸、难以编辑且稀疏结构难恢复的问题,提出无先验多视角流程:先用头部几何约束3DGS抑制皮下噪声,再进行跨交叉的欧拉追踪、根部落到面部网格与光度细化。结果生成显式曲线级毛发资产,能保留方向与稀疏分布,并可直接用于动画、修剪、迁移、编辑和物理渲染;局限是浓密胡须内部受可见性与光度歧义影响仍可能缺失。

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning Figure 1
2026-06-09cs.CV

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

University of Trento, Singapore Management University, spanning visual-centric and mathematical reasoning. Our repository is available at

2026-06-09强化学习

本文针对多模态大模型在视觉 CoT 推理中只优化最终可验证奖励、忽视生成过程中视觉证据提取与文本逻辑锚定动态切换的问题,指出错误常与 token 级跨模态注意力失配相关。DyCo-RL 用 Fisher–Rao 注意力距离判定 token 的视觉/文本功能角色,并按角色—注意力对齐度重加权优势信号。实验在 Qwen2.5-VL-3B/7B 上为 GRPO、DAPO、SAPO、GSPO 在七个视觉与数学推理基准带来一致提升。

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems Figure 1
2026-06-09cs.CV

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

§Binus University, ¶Bandung Institute of Technology, and Computer Science at the high school and pre-university level, with each problem implemented as

2026-06-09数据集/基准

现有视觉 STEM 评测多为英文静态题,难以区分模型是真正视觉推理还是记住表面模式。Sci-ρ 用专家编写的 Python 符号模板,在五个学科、七种语言中生成含图像扰动、推理步骤和答案的 42,420 个实例。对 17 个 VLM 的测试显示,平均准确率与最坏情形准确率差距明显,小模型跨语言退化更显著,步骤级 F1 和注意力分析也表明静态基准会高估鲁棒性。

Balancing Real and Synthetic Data for CNN-based Masonry Crack Detection Figure 1
2026-06-09cs.CV

Balancing Real and Synthetic Data for CNN-based Masonry Crack Detection

Mattia Forlesi, Alfonso Esposito, Ivan Zyrianoff, Alessandro Marzani, Marco Di Felice

Department of Computer Science and Engineering, University of Bologna, Bologna, Department of Civil, Chemical, Environmental, and Materials Engineering, University of Bologna, Bologna, Italy, (CNNs), have enabled scalable solutions for automated crack detection., However, CNN performance strongly depends on the availability of large, while publicly available datasets may not be adequate. To address this, The overall diffusion of DL techniques has led to feasible and scalable solu-, ten time-consuming, while the datasets available online could be unsatisfactory, for data collection and labeling, while overall enhancing the performance metrics, – The real dataset was totally collected and labeled by our team. In particular

2026-06-09视觉感知

面向砌体表面裂缝检测中真实数据采集与标注成本高、公开数据适配性差的问题,本文用可控裂缝叠加工具在真实墙面背景上生成合成样本,并系统考察真实/合成数据配比对 U-Net/CNN 分割的影响。实验在真实测试集上表明,合成数据加入少量真实数据即可接近纯真实训练;最佳配比报告达到 F1 76%、mIoU 80%,且优于纯真实基线,但具体增益来源可能主要来自数据规模与分布互补。

Vision-Language Asymmetry in Bistable Image Captioning Figure 1
2026-06-09cs.CV

Vision-Language Asymmetry in Bistable Image Captioning

Arohan Agate

uli with both per-aspect feature pools available, University of Washington. Correspondence to: Arohan Agate, per stimulus per α. Success is the fraction Qwen3 labels as

2026-06-09视觉语言视觉感知

本文追问视觉语言模型在描述鸭兔、奈克方块等双稳态图像时,究竟在哪一层从“看到”转为“看作某物”。作者在 LLaVA 上结合提示行为测试、CLIP 消费层 TopK SAE 特征池与因果 steering,发现 72% 图像在视觉塔同时激活两种解释,但语言输出会单边承诺;部分默认主导样本可被翻转,年轻/老妇等平衡样本却不能,说明主导瓶颈主要位于视觉塔之后的语言侧。

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment Figure 1
2026-06-09cs.CV

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Huawei Technologies Ltd., Nanyang Technological University, Jiangsu Key Lab of Language Computing

2026-06-09视觉感知

针对业余用户难以用专业软件表达细粒度修图意图、生成式编辑又易引入伪影且缺乏可解释性的痛点,IEA 将 VLM 约束在 16 个参数化工具的显式动作空间中,并通过专家编辑蒸馏 SFT、带工具有效性与相似度奖励的 GRPO、以及大规模合成数据对编辑、意图总结和反馈细化进行三阶段多任务对齐。实验中其在参考编辑像素距离和意图总结 ROUGE-L 上优于基线,用户研究也显示其在工具调用方法中指令跟随最好,并在整体感知质量上超过生成式方法。

GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence Figure 1
2026-06-09cs.CV

GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence

Liang Xu, Fangjing Wang, Jinyu Yang, Feng Zheng

2026-06-09视觉感知三维

针对训练-free 3D实例分割在融合多种2D/3D预训练模型提案时容易偏向高置信但低质量掩码的问题,GVC-Seg利用3D几何线索与2D视觉先验的一致性重新评估提案置信度,并结合3D提案生成与mask-aware CLIP语义推理实现无训练集成。实验在ScanNet200、ScanNet++和Replica上达到SOTA,且开放词汇场景提升明显。

Aqua Boundary-Saliency Attention Module for Lightweight Underwater Salient Instance Segmentation Detection Transformer Figure 1
2026-06-09cs.CV

Aqua Boundary-Saliency Attention Module for Lightweight Underwater Salient Instance Segmentation Detection Transformer

M. Fazri Nizar, Julian Supardi, Muhammad Naufal Rachmatullah

Department of Informatics Engineering, Universitas Sriwijaya, Indonesia, ary, contrast, attenuation, chroma, dark-channel, and center-, chroma, dark-channel, and center cues while preserving, provides foreground salient instance labels and therefore, center prior. A shallow convolutional cue encoder ϕ maps C

2026-06-09视觉感知学习理论

面向水下机器人感知中实例分割既要高质量掩码又要低延迟部署的矛盾,论文提出轻量级 LUSIS-DETR,在 DINOv2 初始化的 DETR 掩码预测器中加入 AquaBSAM,用边界、对比度、衰减、色度、暗通道与中心先验对多尺度特征做有界残差调制,且训练辅助项不进入推理。四个水下数据集上其精度接近或超过重型 SAM/伪深度方法,USIS10K、USIS16K 增益较明显,T4 TensorRT FP16 延迟约 4.31–6.34 ms。

Learning a Semantic Calibration Network for Open-Vocabulary Semantic Segmentation Figure 1
2026-06-09cs.CV

Learning a Semantic Calibration Network for Open-Vocabulary Semantic Segmentation

Yang Sun, Tao Wang, Anastasia Ioannou, Ge Xu

2026-06-09视觉感知

这篇工作针对开放词汇语义分割中 CLIP 偏全局语义、掩码分类阶段易出现类别混淆的问题,提出 Semantic Calibration Network,将文本嵌入经跨注意力转为视觉感知伪文本,并用类别消歧模块建模类间依赖、Logits Fusion 动态融合原始与校准相似度。实验称在 ADE20K 和 PASCAL-Context 等基准上超过现有方法,主要增益来自对 mask-text 分类语义的显式校准。

FMRFusion: Frequency-Aware Multi-View Representation Learning for Heterogeneous Image Fusion Figure 1
2026-06-09cs.CV

FMRFusion: Frequency-Aware Multi-View Representation Learning for Heterogeneous Image Fusion

Tao Zhoua, Yunlong Liu, Qinghui Chen, Zekai Zhang, Minlong Sun, Changlin Biana, Dagang Li, Wenmin Wang, Jinglin Zhang

aControl Science and Engineering, Shandong University, Jinan, 250061, China, bKey Laboratory of Machine Intelligence and System Control, Ministry of Education, Jinan, 250061, China, cSchool of Computer Science and Engineering, Macau University of Science and Technology, Macau, 999078, China, dKey Laboratory of Industrial Intelligent Systems, Jinan, 250061, China

2026-06-09视觉感知

针对红外-可见光融合中单路径编码易丢失模态特性、CNN/Transformer难兼顾细节与全局上下文的问题,FMRFusion采用双分支CNN-Transformer结构,并以频率解耦区分低频共享结构和高频模态细节,再通过跨视图互补交互与Flow Matching逐步精炼融合特征。多基准实验显示其在红外-可见光、医学和多焦点融合上表现更稳定,夜间场景优势更明显。

DisCo: World Models with Discrete Camera Motion Control Figure 1
2026-06-09cs.CV

DisCo: World Models with Discrete Camera Motion Control

Hongrui Huang, Junke Wang, Quanhao Li, Yu-Gang Jiang, Zuxuan Wu

2026-06-09强化学习规划控制

DisCo针对可控视频世界模型在复杂相机动作下跟随不稳的问题,指出连续相机轨迹会造成不同运动模式的条件特征纠缠,进而削弱控制性。方法将相机运动量化为紧凑的离散动作原语,并在Wan 2.2上微调、蒸馏为支持长时生成的因果模型。其提出DisCoBench评测短期、长程和动态场景,动作跟随分数达0.633,高于Matrix-Game2的0.588,同时保持视觉质量。

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors? Figure 1
2026-06-09cs.CV

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

Peking University, Shenzhen Graduate School, 2Peng Cheng Laboratory 3 Rabbitpre Intelligence, Nanyang Technological University 5Tsinghua University

2026-06-09强化学习

这篇论文针对多模态大模型在物理推理中可能依赖语言先验而非视觉证据的问题,提出 ChronoPhyBench,用历史视频与文本条件下的下一状态帧选择和多帧时序排序来压制捷径推断,并构建万级长视频标注数据。实验显示,开源模型的视觉物理推理仍很弱,部分闭源强模型在视觉缺失或受扰时仍能凭语言猜中答案,暴露明显模态偏置与幻觉风险。

Feasibility to detect rapid change and disappearance of seagrass: Lessons from nearly 80 years of vegetation change in the Ako, Seto Inland Sea, Japan Figure 1
2026-06-09q-bio.PE

Feasibility to detect rapid change and disappearance of seagrass: Lessons from nearly 80 years of vegetation change in the Ako, Seto Inland Sea, Japan

Takehisa Yamakita, Yoji Igarashi, Akira Eto, Ken Ishida, Masaaki Iiyama

Japan Agency for Marine-Earth Science and Technology (JAMSTEC), Application Laboratory (APL), 3173-25, Showa-machi, The University of Tokyo, Graduate School of Agricultural and Life Sciences, 1-1-1 Yayoi, Bunkyo City, Tokyo, Japan, Tokyo University of Marine Science and Technology, 4-5-7 Kohnan, Minato-ku, Tokyo, Japan, Shiga University, Faculty of Data Science, 1-1-1 Banba, Hikone City, Shiga, Japan, highlighting the need for practical workflows that integrate historical aerial photographs with low-cost or freely available satellite, classification accuracy, we recommend that (1) baselines be defined over the longest available record and justified ecologically, (2), recently available low-cost or free satellite data with open-, freely available satellite data, processed primarily using free and, Co., Ltd.), seagrass polygons were extracted from historical, information from labels created for the entire extent of two, images taken in 2010 and 1999. Additionally, label information, available open missions. Images were acquired more than twice

2026-06-09强化学习

海草床监测受商业卫星和野外调查成本限制,难以及时发现长期退化与突发崩塌。本文将1940年代以来航片、WorldView/GRUS与免费Sentinel‑2月合成影像结合,用YOLOv8分割重建日本赤穗近80年海草变化。模型总体精度≥0.9,显示2025年优势大叶藻并非季节波动而是快速崩塌,面积降至约0.2公顷,可能与夏季水温异常升高有关。

DAL-PCQA: Enabling Distortion-Level and Language-Driven Reasoning for Point Cloud Quality Assessment Figure 1
2026-06-09cs.CV

DAL-PCQA: Enabling Distortion-Level and Language-Driven Reasoning for Point Cloud Quality Assessment

Swarna Chakraborty, Gabriel De Castro Araújo, Syeda Tasmi Faria, Marcelo M. Carvalho, Mylene C.Q. Farias

2026-06-09三维

点云质量评估常只给 MOS 分数,难解释压缩、采集或渲染造成的具体感知退化。DAL-PCQA 的核心是把 SJTU-PCQA、WPC 扩展为带三维失真分类、五级严重度、离散质量标签和自然语言描述的数据集,覆盖颜色、亮度、密度、缺失与几何变形等线索。实验用零样本与微调多模态模型对比,显示失真感知监督能提升生成描述与人工标注的词汇和语义一致性,但主要贡献偏数据与标注框架。

REACT 2026: The Fourth Multiple Appropriate Facial Reaction Generation Challenge: Personalised MAFRG and Appropriate EEG Reaction Prediction Figure 1
2026-06-09cs.CV

REACT 2026: The Fourth Multiple Appropriate Facial Reaction Generation Challenge: Personalised MAFRG and Appropriate EEG Reaction Prediction

Siyang Song, Micol Spitale, Zijian Wu, Xiangyu Kong, Cheng Luo, Cristina Palmero, German Barquero, Sergio Escalera, Michel Valstar, Mohamed Daoudi, Fabien Ringeval, Andrew Howes, Elisabeth Andre, Hatice Gunes

University of Exeter, Nanjing University of Science and, King Abdullah University of Science, King’s College London, University of Nottingham, University of Augsburg, University of Cambridge, alised MAFRG, respectively, which are publicly available at https:, • Human-centered computing →HCI theory, concepts and, personality labels and EEG signals along with multi-modal human, duced Big-Five personality labels and EEG signals, together

2026-06-09视觉感知

本文针对现有面部反应生成多为通用、忽略个体差异与神经生理状态的问题,提出 REACT 2026 挑战。核心创新是在 MARS 数据集中加入 Big-Five 人格标签和 EEG,设置离线/在线、通用/个性化四类 MAFRG 任务,并要求生成合适、多样、真实且同步的反应。主要结果是给出公开基线、提交规范与 FRCorr/FRRea 等评测框架;实际性能增益文中未充分说明。

LEGS: Laplacian-Enhanced Gaussian Splatting with a Nonlinear Weighted Loss Figure 1
2026-06-09cs.CV

LEGS: Laplacian-Enhanced Gaussian Splatting with a Nonlinear Weighted Loss

Yongfei Guo, Qizhou Huo, Xuan Sun, Yuanhao Gong

Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Sciences, Changchun, China, University of Chinese Academy of Sciences, Beijing, China

2026-06-09三维

针对3D Gaussian Splatting的光度损失对平坦区与结构丰富区域一视同仁、易削弱轮廓和细节的问题,LEGS不改动渲染与表示管线,而是在损失层用二阶Laplacian响应替代一阶梯度,并通过非线性映射生成像素权重以强化结构监督。在Tanks&Temples和Mip-NeRF360上,PSNR相对3DGS最高提升1.68 dB、相对EGGS最高提升0.52 dB,迁移到FastGS/FasterGS也有最高1.69 dB增益。

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation Figure 1
2026-06-09cs.CV

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

School of Computer Science & Tech, Huazhong University of Science and Technology, School of AI and Automation, Huazhong University of Science and Technology, China, through a modality-aware division of labor., a balance between computational scalability and, recall and computational scalability while maintain-

2026-06-09视觉感知

针对大规模跨语种长视频 RAG 中语义相似但逻辑无关的“硬负例”易导致人格约束失效和幻觉的问题,论文提出无需训练的 C2F-RAG:先用 BGE-M3 基于全局视觉/文本摘要高召回预取,再由引入 OCR/ASR 的 A.I.R. LLM 代理做逻辑重排,并用提示约束 JSON 与时间引用。在约 11 万视频检索中 nDCG@10 达 0.848、R@100 达 0.837,优于 Mixedbread 等基线;生成评测平均分 0.437 高于 CAG 的 0.378,但部分增益可能来自强商业 LLM 重排。

3D Oral Modelling with Improved Vertex Distribution Using Matching-Based Learning Figure 1
2026-06-09cs.CV

3D Oral Modelling with Improved Vertex Distribution Using Matching-Based Learning

Jihun Cho, Soo-Yeon Jeong, Eun-Jeong Bae, Sun-Young Ihm

2026-06-09三维

本文针对多视角口内图像直接重建3D牙颌点云时,Chamfer Distance易使预测顶点聚集在真值高密度区域、覆盖不足的问题,改用匈牙利一对一匹配、困难匹配过滤与Repulsion Loss组合约束顶点分布。结果显示常规准确率由77.49%降至68.02%,但聚集现象明显缓解;在一对一匹配指标上由8.61%提升到35.71%,代价是仅能采样5000点匹配,效果仍受算力限制。

Beyond the Thin-Layer Limit: Differentiable Volumetric Training for Visible-Range Diffractive Neural Networks Figure 1
2026-06-09cs.CV

Beyond the Thin-Layer Limit: Differentiable Volumetric Training for Visible-Range Diffractive Neural Networks

Dineth Jayakody, Dushan N. Wadduwage

\authormark 1Department of Computer Science, Old Dominion University, Norfolk, VA 23529, USA, \authormark 2School of Data Science, Old Dominion University, Norfolk, VA 23529, USA, \authormark 3Department of Physics, Old Dominion University, Norfolk, VA 23529, USA

2026-06-09视觉感知

面向可见光机器视觉中的衍射神经网络,论文指出性能落后并非主要因纳米加工,而是低折射率材料下“薄层掩膜”训练与真实厚结构产生失配。作者提出可微BPM体积层,将高度图作为可制造三维结构端到端优化,显式建模层内传播与相位累积;在MNIST、Fashion-MNIST、CIFAR-100及成像任务中降低仿真到器件差距,FDTD验证分类准确率由约50%提升至90%。

TBD-VLA: Temporal Block Diffusion Vision Language Action Model Figure 1
2026-06-09cs.CV

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

University of Virginia

2026-06-09视觉感知生成模型

TBD-VLA针对离散VLA逐token自回归延迟高、并行解码又缺少显式时序依赖的问题,将动作序列划分为时间块:块内用掩码离散扩散并行生成,块间保持自回归,同时支持通过时序补全做Real-Time Chunking异步执行。论文称其在仿真和真实操作、含扰动场景中优于既有VLA,并在LIBERO上以2B模型达到0.117秒延迟,兼顾速度与时序一致性。

C3VD-DEFCOL: A Deformable Colonoscopy Dataset with Time-Resolved 3D Ground Truth and Realistic Appearance Figure 1
2026-06-09cs.CV

C3VD-DEFCOL: A Deformable Colonoscopy Dataset with Time-Resolved 3D Ground Truth and Realistic Appearance

Ethan Luk, Mayank V. Golhar, Anthony Song, Raúl Iranzo, Víctor M. Batlle, Lalithkumar Seenivasan, José M.M. Montiel, Nicholas J. Durr

Department of Biomedical Engineering, Johns Hopkins University, Baltimore, MD, USA, Department of Computer Science, Johns Hopkins University, Baltimore, MD, USA, deformations of the colon surface, including peristaltic waves and centerline mo-, ground truth is typically unavailable or limited. Consequently, algorithms are often evaluated either

2026-06-09数据集/基准三维

针对结肠镜三维重建缺少兼具真实外观与时序稠密3D真值、难以评估非刚性形变鲁棒性的问题,C3VD-DEFCOL基于C3VD网格生成受控蠕动/中心线形变,并用深度条件LTX sim-to-real生成逼真RGB,提供110段视频及深度、法线、光流、位姿和逐时刻网格。实验从真实感、几何/时间一致性验证数据,并显示位姿估计误差随形变强度增加而上升。

The Cross-Architecture Substrate: A Domain-Transcendent, Calibration-Surviving Geometric Invariant of Modern Vision Encoders Figure 1
2026-06-09cs.CV

The Cross-Architecture Substrate: A Domain-Transcendent, Calibration-Surviving Geometric Invariant of Modern Vision Encoders

Yousef Radwan

2026-06-09视觉感知

这篇论文追问不同架构、损失和数据训练的视觉编码器是否真的学到不可比较的表征。作者提出“跨架构基底”:13个现代视觉编码器倒数层特征的前16个主成分会收敛到相近几何子空间,并用PCA、CKA及Pang校准检验。结果显示该基底可跨8类视觉域保持中等对齐,排除像素/Gabor/随机切片解释,并带来无标签迁移筛选、域检测、低样本特征和免教师蒸馏等收益;但其不跨视觉-音频,也不能预测迁移性能。

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning? Figure 1
2026-06-09cs.CV

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

Imperial College London, are available on our Project page.

2026-06-09视觉语言

这篇论文关注多模态模型“答对”是否真的依赖关键视觉证据,而非语言先验或表面推理。作者提出 VisualFLIP,将同一问题配对到最小视觉扰动前后,使正确答案确定翻转,并用成对准确率与 Collapse Rate 衡量是否随证据更新。对 24 个 MLLM 的评测显示,高准确率和工具调用仍不能避免答案固化,顺序暴露会加剧旧答案 persistence,空间与计数任务尤其容易暴露视觉 grounding 失败。

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models Figure 1
2026-06-09cs.CV

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

University of Luxembourg

2026-06-09视觉语言视觉感知

本文关注现有视觉语言模型在标准评测之外的细粒度视觉极限:小到多少像素的字母、形状或物体仍能被可靠看见并用于推理。作者提出 FineSightBench,将像素级感知与空间、计数、排序等推理任务分离,在 4–48px 尺度上系统测试。结果显示模型感知能力约在 12px 后趋于饱和,但即使目标更大,计数和序列推理仍频繁出错,说明“看见”并不等于能稳定推理。

MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots Figure 1
2026-06-09cs.RO

MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots

Aniket Patil, Mandeep Singh, Uday Girish Maradana, Nitin J. Sanket

Perception and Autonomous Robotics (PeAR) Group, Robotics Engineering Department, Worcester Polytechnic Institute.

2026-06-09机器人生成模型

微型无人机受载荷与算力限制,难以依赖激光雷达或高开销深度估计实现避障。MinNav 用单目相机预测多尺度光流及不确定性,并通过主动探索运动区分静态障碍、动态障碍和未知形状缝隙,统一生成朝向自由空间的控制。实机与仿真显示其可在机载计算上运行,真实场景总体成功率约 70%,性能接近深度方法但计算量低得多;动态障碍延迟与非全向感知仍是主要失败来源。

Frequency-Scale Saliency for Spectral Descriptor Analysis in 3D Shape Retrieval Figure 1
2026-06-09cs.GR

Frequency-Scale Saliency for Spectral Descriptor Analysis in 3D Shape Retrieval

Jianru Shen

University of Montana, Missoula, MT 59812, USA

2026-06-09三维

这篇论文针对 HKS/WKS 等谱描述子在非刚性三维形状检索中只看整体 mAP、难以解释失败尺度来源的问题,提出基于尺度遮蔽消融的频率-尺度显著性分析,并用类别谱指纹诊断类间混淆。SHREC’11 实验显示短尺度贡献最大、长尺度可能有害,类间描述子相似度与检索失败相关(Spearman 0.479),显著性加权在困难类别上提升 mAP 0.156。

Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events Figure 1
2026-06-09cs.AI

Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events

Venkatesh Kolluru, Rajat Shinde, Abdelhak Marouane, Caden Helbling, Deepak Shah, Othneil Drew, Iksha Gurung, Manil Maskey, Rahul Ramachandran

Earth System Science Center, University of Alabama in Huntsville, Huntsville, AL 35805, USA, NASA Marshall Space Flight Center, Huntsville, AL, 35808 USA.

2026-06-09视觉感知

针对地理基础模型在真实洪水业务制图中可靠性缺乏系统评估的问题,本文将 Prithvi-EO-2.0 部署到 19 个全球分布的 OOD 洪水事件,并用双参考产品与红队式流水线排查分析失效。核心洞察是检测上限主要受土地覆盖与洪水类型共同约束,而非单纯地域迁移:农田和河流型洪水表现较好,树木覆盖与建成区几乎失效;平均 IoU 约 0.46/0.49,且发现 23 类失败模式,早期误差更多来自工程流水线和参考定义差异。

DALE-CT: Depth-Aware Foundation Models for Computed Tomography Figure 1
2026-06-09cs.CV

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

College of Medicine Office of Research, University of Kentucky, Lexington, KY 40506 USA

2026-06-09视觉感知

针对3D CT基础模型常依赖文本监督、固定体素输入且计算开销高的问题,DALE-CT探索用2D切片ViT学习体数据表征。核心做法是在LeJEPA自监督中加入深度感知多裁剪,并用解剖与病灶掩码提供稠密辅助监督。在线性探针+MIL多异常检测中,DALE-CT-2S的冻结骨干达到Macro AUROC 0.833,接近3D视觉语言模型COLIPRI且无需文本监督。

Quantum-Enhanced Similarity Measures for Polarimetric Materials Classification Figure 1
2026-06-09cs.CV

Quantum-Enhanced Similarity Measures for Polarimetric Materials Classification

Sara Shojaei, Seyed Mohamad Ali Tousi, Emma Bennett, Param Sangani, Ali Shiri Sichani, Ilker Ersoy, Hadi Ali-Akbarpour, Filiz Bunyak, G. N. DeSouza

†University of Missouri–Columbia, MO, USA, ‡Saint Louis University, MO, USA, available, and Basheer et al. apply SWAP-test fidelity scoring, light sources are sampled uniformly from the 147 available

2026-06-09视觉感知

针对RGB材质识别易受光照、视角影响的问题,论文把偏振Mueller矩阵材料分类改写为嵌入点集匹配:用OctGPT/GNN学习64×32体素嵌入,推理时以量子幅度编码并用SWAP test聚合保真度检索锚样本。在23类KAIST偏振数据上,理想仿真达72.7% Top-1、90.9% Top-3,低于最优传输/匈牙利匹配的87.9% Top-1;效果说明量子保真度可作为相似性信号,但真实NISQ噪声与状态制备开销仍未验证。

DroneDAR: Long-Range Drone Distance Estimation Using Monocular Vision and Bounding-Box Features Figure 1
2026-06-09cs.CV

DroneDAR: Long-Range Drone Distance Estimation Using Monocular Vision and Bounding-Box Features

Knut Peterson, Zaid Mayers, David Han

2026-06-09视觉感知学习理论

面向远距离小型无人机在单目图像中仅占少量像素、外观与尺度线索易受噪声干扰的问题,本文提出 DroneDAR,在 DroneRanger 基线上用 ResNet 替换自定义 CNN,并通过轻量边界框特征门控自适应融合裁剪外观与几何线索。LRDDv3 实验显示其在各距离段优于基线,ResNet-18、220×220 裁剪和 Huber 损失表现最佳;但极远距离仍受边界框误差限制。

A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline Figure 1
2026-06-09cs.AI

A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline

Kai A. Horstmann, Ethan Lin, Alice A. Robie, Jennifer J. Sun, Kristin Branson

Cornell University, Allen Institute, 2021, The International Brain Laboratory, 2022) rely on tools and, fully automated “AI scientist” or self-driving lab approaches (Lu et al., 2026, Code available at: https://github.com/kaihorstmann/neuro-d2d-eval

2026-06-09视觉感知

这篇论文关注科学研究流水线中耗时的软件构建瓶颈,而非直接追求全自动“AI 科学家”。作者以果蝇光遗传学数据到发现流程为案例,设计7个大规模、专家标准驱动的阶段任务及端到端评测。结果显示,通用编码智能体能完成若干单阶段任务,但在缺少明确可迭代指标、需要科学判断和视觉自检时明显失效,端到端串联仍超出现有能力。

Multi-planar 2D-U-Net Segmentation of 3D-CT Abdominal Organs augmented by Spatial Occurrence Maps Figure 1
2026-06-09eess.IV

Multi-planar 2D-U-Net Segmentation of 3D-CT Abdominal Organs augmented by Spatial Occurrence Maps

Daria Kern, Negar Chabi, Souraj Adhikary, Andre Mastmeyer

Glasgow Caledonian University, School of Science, Jade University of Applied Sciences, Department of Engineering, training set labels. This probability map serves as a sec-, axial, coronal and sagittal sections. A maximum label, label data from various public sources2. All scans are, tion labels undergo morphological closing, and extrac-

2026-06-09视觉感知生成模型三维

腹部大视野 3D CT 中多器官分割受视野差异、低软组织对比和器官邻近影响,轻量 2D 方法仍需利用解剖先验。本文在粗到细 VOI 定位后,将训练标签生成的模糊三维空间出现图作为额外通道,结合轴/冠/矢多平面 2D-U-Net 融合。80 例公开 CT 五折实验显示,相比无 SOM,五个器官 Dice 均提升,最大约 4%,胰腺由 0.67 提至 0.70。

Cross-View Urban Traffic Dataset: Drone-Supervised Ground Truth for Monocular Bird's-Eye View Localization Figure 1
2026-06-09cs.CV

Cross-View Urban Traffic Dataset: Drone-Supervised Ground Truth for Monocular Bird's-Eye View Localization

Prakhar Bhardwaj, Simone Weikl, Kilian Mang, Elia Jonas Sandtner

cessing pipeline, and evaluation code will be made publicly available at https://huggingface., co/datasets/prakharbh/CrossViewUrbanTrafficDataset and the codebase is available at

2026-06-09数据集/基准

针对现有交通/V2X数据集缺少街景自车视角与无人机俯视视角之间“身份级”对齐的问题,论文提出CVUTD:在真实城市路口同步采集自行车单目视频与无人机视频,支持跨视角轨迹身份匹配和由自车视角预测BEV两项任务,并提供标注、评测与基线工具链。实验显示该基准可运行但未被现有方法解决:匹配召回较高但受过度分配、时间不稳定和视角歧义限制,单目BEV预测虽受益于空中监督仍明显未饱和。

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking Figure 1
2026-06-09cs.CV

Struct-Searcher: Agentic Structural Thinking Advances Multimodal Deep Information Seeking

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Zheng Lian, Hao Wu, Yuan Gao, Xinyu Geng, Xin Wang, Pheng-Ann Heng

CUHK 2LIGHTSPEED 3PKU 4Tongji University 5THU 6HKUST

2026-06-09视觉语言

论文针对多模态深度检索中图文等异构证据相互矛盾、传统智能体只线性累积证据而难以修正错误信念的问题,提出 Struct-Searcher:以信念修正理论维护多模态结构图,显式建模查询、假设、证据及支持/冲突关系,并从最大无冲突子图生成答案。实验显示其可插拔且模型无关,在 BrowseComp-VL 五个骨干上平均相对提升 17.2%,并在三项基准上超过现有 VLM 与深度研究智能体。

What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction Figure 1
2026-06-09cs.CV

What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction

Jewon Yeom, Hanseul Kim, Jeongjae Park, Sungmok Jung, Jaejin Lee, Taesup Kim

Graduate School of Data Science, Seoul National University

2026-06-09视觉感知强化学习三维

这篇论文针对机器人 VLA/世界模型常用像素指标难以反映控制可用性的问题,统一用逆动力学探针比较八类冻结视频编码器。核心发现是动作相关潜空间主要来自自然视频的时间预测预训练,而非重建清晰度;高 PSNR 的自编码器/扩散模型可几乎无法恢复动作。V-JEPA、VideoMAE 对比显示时间上下文贡献最大,潜变量预测有额外收益;逆动力学微调还能显著提升视觉扰动鲁棒性。

The Need for Neural ISP in the Small-Pixel Era: How Shrinking Pixels Push Optics to the Limit and Neural Restoration Pushes Back Figure 1
2026-06-09eess.IV

The Need for Neural ISP in the Small-Pixel Era: How Shrinking Pixels Push Optics to the Limit and Neural Restoration Pushes Back

Jingxi Li, Neerja Aggarwal, Laurent Gudemann, Shivansh Rao, Vishal Vinod, Tom E. Bishop, Ziv Attar

2026-06-09视觉感知

论文针对手机长焦小像素化带来的“物理墙”:像素降至亚 0.5µm 时,为抑制衍射需放大光圈,却加重几何像差,传统分阶段 ISP 难以恢复。作者用受控仿真固定 SNR 与衍射因素,比较 0.35–0.75µm 配置,指出相机特定 Neural ISP 可联合建模 PSF、去马赛克与去噪。在 0.35µm 下其 MTF50 约为传统 ISP 的 2.5–3 倍,LPIPS 从 0.244 降至 0.151;低照多帧实验也显示传统瓶颈主要是未校正 PSF 模糊而非噪声。

Simultaneous hyperkinetic movement disorders phenotyping: a cross-cohort pediatric transfer study using routine videos, markerless pose estimation and a tabular foundation model Figure 1
2026-06-09cs.CV

Simultaneous hyperkinetic movement disorders phenotyping: a cross-cohort pediatric transfer study using routine videos, markerless pose estimation and a tabular foundation model

Laura Cif, Diane Demailly, Zohra Souei, Muhammad Mushhood Ur Rehman, Juan Dario Ortigoza Escobar, Mayté Castro Jiménez, Cécile A. Hubsch, Sophie Huby, Morgan Dornadic, Gun-Marie Hariz, Eduardo M. Moraud, Jocelyne Bloch, Gabriella A. Horvath, Xavier Vasques

2026-06-09视觉感知强化学习三维

针对儿童混合性多动运动障碍依赖专家看视频、跨年龄泛化工具不足的问题,本文将常规临床视频经无标记姿态估计转为运动学特征,并用表格基础模型构建成人训练的共享骨干,只在儿童队列做轻量决策层校准。外部儿科留出集上,Hamming accuracy 由0.804升至0.839,Jaccard由0.548升至0.633;在临床一致性更高的表型上达0.900/0.786,但样本很小,临床级可靠性仍待验证。

Liquid Neural Networks as a Drop-in Continuous-Time Deformation Field for Dynamic 3D Gaussian Splatting Figure 1
2026-06-09cs.CV

Liquid Neural Networks as a Drop-in Continuous-Time Deformation Field for Dynamic 3D Gaussian Splatting

Mingzhao Li, Arghya Pal, Guan Yuan Tan

∗School of Information Technology, Monash University, Selangor, Malaysia, (xi, ri, si, αi, ci)}, where xi ∈R3 is the centre, ri a unit

2026-06-09三维

该文针对 D-3DGS 的 MLP 变形场虽输入连续时间、结构上却近似逐帧独立预测的问题,将其替换为由 CfC 液态神经元堆叠的连续时间变形场,用 sigmoid 时间门在候选隐状态间插值,无需 ODE 求解器且基本保留原管线。实验在 D-NeRF 与 NeRF-DS 上总体持平或略优于 MLP,收益主要出现在高频关节运动场景,但部分场景退化且同宽 CfC 计算量更高。

MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios Figure 1
2026-06-09cs.CV

MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios

Guo Li, Jiandian Zeng, Yang Li, Zihao Peng, Ke Chen, Tian Wang

Institute of Artificial Intelligence and Future Networks, Beijing Normal University, Zhuhai, China, School of Computing and Artificial Intelligence, Southwest Jiaotong University, Chengdu, China, Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of, Education, Beijing Normal University, Zhuhai, Guangdong, China, laborative framework that selectively incorporates, available at: https://memovad2026.github.io/., computational resources available on edge devices [Ghasemi, whelming edge resources, edge-cloud collaboration offers a, Instead, we introduce a novel collabora-, • We propose MemoVAD, a resource-efficient collabora-, bels are available [Mishra et al., 2024, Efficient Edge-Cloud Collaboration

2026-06-09视觉感知

面向边缘监控中的视频异常检测,论文针对VLM语义能力强但端侧算力、带宽和时延受限的问题,提出MemoVAD边云协同框架:端侧轻量检测器结合因果时序编码,只有在主观逻辑不确定性高且语义新颖时查询云端VLM,并用动态语义记忆缓存已验证原型以复用语义知识。UCF-Crime和XD-Violence实机实验显示,其在显著降低通信率的同时接近全量云查询性能并超过已有方法。

PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing Figure 1
2026-06-09cs.CV

PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing

Maksim Shandybo, Ivan Bespalov, Daniil Yefimov, Marina Kosheleva, Alexander Loukianov

National University of Science and Technology MISIS, Moscow, Russian Federation

2026-06-09视觉语言安全鲁棒

针对历史报纸因退化扫描、多栏非规则排版导致通用视觉语言模型难以恢复文章结构的问题,PereStruct采用模块化流程:微调YOLO做版面块检测,结合OCR/LLM校正,并用TF-IDF语义、YOLO视觉嵌入和几何约束进行块到文章的语义组装。实验显示其块映射F1达0.904,端到端BLEU约0.96,显著高于Qwen VLM约0.34,并发布标注语料与基准。

Need We Teach Foundation Models What is a Generative Image? Gradient-Free Generative Artifact Detection via Analytic Spectral Adaptation Figure 1
2026-06-09cs.CV

Need We Teach Foundation Models What is a Generative Image? Gradient-Free Generative Artifact Detection via Analytic Spectral Adaptation

Qiaoyu Chen, Bing Zhang

Harbin University of Commerce, and inherently enables privacy preserving federated collaboration via covariance

2026-06-09视觉感知生成模型优化算法

论文针对生成图像检测中微调基础模型易在少量伪造样本上过拟合、产生“anchor drift”并削弱跨域零样本能力的问题,提出 Lightning:冻结 CLIP,把检测改写为相对真实图像自然锚点的 OOD 异常度量,通过注意力加权统计/语义解耦、SVD 降维和层选择完成无梯度谱适配。在 FF++ 校准、OpenFake T2I 零样本测试中,平均 AUC 达 0.820,高于最佳梯度基线 GenD 的 0.618。

Real-Time Industrial Defect Detection on Edge Hardware Using Fine-Tuned YOLOv8: A Systematic Benchmark on the NEU Surface Defect Database and MVTec AD with Automotive & Battery Manufacturing Extensions Figure 1
2026-06-09cs.CV

Real-Time Industrial Defect Detection on Edge Hardware Using Fine-Tuned YOLOv8: A Systematic Benchmark on the NEU Surface Defect Database and MVTec AD with Automotive & Battery Manufacturing Extensions

Emmanuel Ezeji Somtochukwu, Nitesh Rijal

labeled industrial data and the computational, First, labeled industrial defect data is scarce —

2026-06-09视觉感知数据集/基准

面向工厂端侧无云、低时延且缺陷标注稀缺的质检场景,本文系统比较 YOLOv8 n/s/m/l 在 NEU-DET 与经 mask 转 bbox 的 MVTec AD 上的检测表现,并提出汽车/电池缺陷迁移路径。结果显示 NEU-DET 上 YOLOv8l 最高 74.1% mAP@0.5,但 YOLOv8n 仅低 0.5pp 且 2.1ms;MVTec AD 上排名反转,YOLOv8m 最优 72.4%,说明最优模型大小可能主要来自任务复杂度与每类数据量,而非单纯 scaling。

What neurosurgeons need to see: synthetic intra-operative MRI from ultrasound for brain-shift compensation in brain tumour surgery Figure 1
2026-06-09cs.CV

What neurosurgeons need to see: synthetic intra-operative MRI from ultrasound for brain-shift compensation in brain tumour surgery

Santiago Cepeda, Olga Esteban-Sinovas, Ignacio Arrese, Rosario Sarabia

Department of Neurosurgery, Neurovascular Unit, Río Hortega University Hospital, Valladolid, Spain, requires dedicated infrastructure and is not widely available, whereas intraoperative ultrasound (ioUS), informative update, but it requires dedicated infrastructure, prolongs the operation, and is available in only a small, number of centres. Intraoperative ultrasound (ioUS) is the practical alternative: it is fast, inexpensive, repeatable, available signal and must be reconciled with the deformed intraoperative anatomy at the field-of-view boundary.

2026-06-09视觉感知

针对胶质瘤术中开颅后脑移位导致术前 MRI 导航失准、而术中 MRI 难普及的问题,论文提出用术中超声合成 MRI,并与形变配准融合成术前空间下的全脑 siMRI:超声视野内显示术后腔和残余等术中状态,视野外保留配准后的术前 MRI。ReMIND 评估中,ResViT-2.5D 合成质量较好;配准 TRE 从 6.27 降至 5.86 mm,与 NiftyReg 基线 5.85 mm 基本持平,因此主要贡献不是精度提升,而是生成可导航的 MRI 风格术中更新体积。

FADRW: A Feature-Aware Modulated and Dynamically Reweighted Loss for Few-Shot Linguistic Steganalysis Figure 1
2026-06-09eess.SP

FADRW: A Feature-Aware Modulated and Dynamically Reweighted Loss for Few-Shot Linguistic Steganalysis

Shuo Liu, Xianghong Lin, Yukun Wei, Zhongliang Yang

S. Liu is with the International School, Beijing University of Posts and, are with the School of Cyberspace Security, Beijing University of Posts and, with a binary label yi ∈{0, 1}, where yi = 1 denotes, text. The goal is to predict the label of each node by jointly

2026-06-09生成模型

本文面向社交媒体中隐写文本占比低于 1% 时的少样本检测难题,指出现有模型同时受多数类决策偏置和隐写弱特征被淹没影响。作者提出 FADRW 损失,通过动态重加权逐步校正类别偏置,并用特征感知的 logit 缩放与偏移增强隐写特征可分性。Reddit、X 和微博实验显示其在多数设置下优于基线,低载荷场景提升更明显,但个别消融结果提示重加权可能存在过校正。

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework Figure 1
2026-06-09cs.CV

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

Hong Kong University of Science and Technology (Guangzhou), Alibaba Cloud Computing, 3Hong Kong University of Science and Technology, Dimension-Level Scalability, Token-Level Scalability, Layer-Level Scalability, full-budget accuracy, but also a controllable budget

2026-06-09视觉语言

多向量视觉文档检索虽能细粒度匹配文本、版面和图像区域,但存储与深层 VLM 编码开销高。MM-Matryoshka 将 Matryoshka 训练扩展为二维预算:用维度前缀监督压缩向量宽度,并用层级蒸馏让中间层保留最终层检索行为,使单一 ColPali 式模型可在推理时选择层数与维度。文中在 14 个 VDR 数据集和多种骨干上显示,其低预算质量明显优于直接截断,同时降低存储和计算开销。

A Dataset for Dynamic Human Preferences for Vision Language Models Figure 1
2026-06-09cs.CV

A Dataset for Dynamic Human Preferences for Vision Language Models

Hannah Gao (Massachusetts Institute of Technology), Dylan Hadfield-Menell (Massachusetts Institute of Technology), Rachel Ma (Massachusetts Institute of Technology)

2026-06-09视觉感知数据集/基准

面向聊天助手和VLM驱动机器人等交互场景,论文指出现有多模态基准多评估静态知识,难以衡量模型是否能在推理时遵循用户即时偏好。作者构建含图像、偏好、问题和可执行选项的动态人类偏好基准,并用生成—审查—修订流水线及边界框版本增强视觉依赖。实验显示闭源VLM整体优于开源模型,几乎所有模型在含边界框提示上明显更困难;数据集仍属早期且规模有限。

KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection Figure 1
2026-06-09cs.LG

KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection

Kevin Patel, Shashi Bhushan Jha

Department of Computer Science, University of West Florida, Pensacola, FL, USA, Code and dataset availability: https://github.com/KaiDMML/FakeNewsNet/

2026-06-09视觉感知

针对假新闻中误导文本、篡改图像与事实错误交织,传统单模态或文本图像融合难以发现深层语义矛盾的问题,KITE将RoBERTa文本、CLIP视觉特征与来自Wikidata的实体事实小图统一送入多模态Transformer,并用GAT学习知识关系、三模态交叉注意力和模态置信度提升可解释性。实验称其在基准数据上优于单模态和双模态基线,尤其擅长识别图文不一致及外部知识冲突,但具体增益幅度需看完整实验表。

Detecting Aimbot Cheaters in MOGs Figure 1
2026-06-09cs.CR

Detecting Aimbot Cheaters in MOGs

Salman Shaikh, Tao Ni, Marc Dacier

2026-06-09视觉感知

针对视觉自瞄不读游戏内存、可绕过内核级反作弊的问题,论文提出 PATCH:把对抗补丁作为游戏 HUD 蜜标,诱导作弊者的目标检测模型瞄准假目标,从而检测或干扰其游戏。作者在 Unreal Engine 自制游戏中测试不同补丁尺寸、分辨率、同机/外机配置和 YOLO 模型,白盒多数尺寸检测率超过 90%,较大补丁跨模型迁移约 60%–90%,并在 Fortnite 上做了可行性验证。

ViMax: Agentic Video Generation Figure 1
2026-06-09cs.CV

ViMax: Agentic Video Generation

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

The University of Hong Kong, 2South China University of Technology, Harbin Institute of Technology, Shenzhen, dinated multi-agent collaboration where spe-, agent collaboration to generate extended narra-, timelines. The code for ViMax is available at:, This section elaborates technical details of ViMax.

2026-06-09视觉感知

本文针对长视频生成中短片模型缺乏叙事规划、跨镜头角色与场景易漂移的问题,提出 ViMax 多智能体框架,将编剧、分镜、角色造型、视频生成与 VLM 质检协同起来,并用层级叙事 RAG 与图依赖跟踪维持全局剧情和视觉连续性。实验在 ViMax-Bench 与小说改编任务上优于 Veo 3.1、HoloCine、Animaker 等基线,整体一致性和人工偏好均有提升。

AQIFormer: A Transformer-Based Multi-View Architecture for Cross-City Air Quality Classification Figure 1
2026-06-09cs.CV

AQIFormer: A Transformer-Based Multi-View Architecture for Cross-City Air Quality Classification

Om Kathalkar, Nitin Nilesh, Sachin Chaudhari, Anoop Namboodiri

monitoring systems facing significant scalability and economic, cant scalability constraints that limit comprehensive urban cover-, strain scalability for large-scale implementation. Popular devices, As sensor-based methods face significant scalability issues, research, lishes practical viability for scalable deployment across diverse

2026-06-09视觉感知

针对传统空气质量监测站成本高、覆盖稀疏,以及图像式 AQI 估计跨城市泛化差的问题,AQIFormer 采用 Transformer 集成框架融合车辆前后视角交通图像与气象参数,并引入天气感知注意力和多任务学习。论文在 26,678 对同步图像上达到 89.96% 分类准确率,较既有方法提升 14.96%;在 Nagpur 独立数据上经少样本适配达 81.67%,性能下降 8.29%。

Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation Figure 1
2026-06-09cs.CV

Steer Where It Matters: Token-Level Visual-Sensitivity Steering for LVLMs Hallucination Mitigation

Ruipeng Zhang, Zhihao Li, C. L. Philip Chen, Tong Zhang

2026-06-09视觉语言

针对LVLM生成中易受语言先验驱动而产生视觉幻觉的问题,论文指出图像条件对自回归解码的影响并非均匀分布,而是集中在少量视觉敏感token上,传统全序列平均与固定强度activation steering会稀释信号并扰动无关token。作者提出TLVS,按token提取/细化转向方向,并依据在线视觉敏感度逐步调节干预强度。实验在LLaVA-1.5-7B、Qwen2.5-VL-7B及POPE、AMBER、CHAIR、MMHal、HallusionBench上显示,相比既有steering方法更稳定地降低幻觉并尽量保持生成质量。

DOME: Learning Transferable Domain Variables from Sparse Supervision for Test-Time Adaptation Figure 1
2026-06-09cs.CV

DOME: Learning Transferable Domain Variables from Sparse Supervision for Test-Time Adaptation

Xiaoran Xu, Yifan Xu, Yupeng Wu, Xiaoshan Yang, Changsheng Xu

mains using only unlabeled streaming data. Most existing methods, unlabeled test data. This direction is gaining increasing attention, to utilize the predictions of the model itself as pseudo-labels and, typically provide only discrete, single-domain labels. This mismatch, Label Domain Disentanglement, constructing explicit su-, labels [44], making it well-suited for dynamic or unseen domains.

2026-06-09视觉感知

本文针对测试时自适应中常把目标域压成单一全局分布、难以处理多维且逐样本变化的域偏移问题,提出 DOME 显式为每个样本编码域变量。方法借助 CLIP 视觉语言预训练学习连续域表示,并用动量更新的稀疏域库作为监督以削弱语义纠缠,再将域线索注入下游 ViT。实验显示,在 ImageNet-C/R/Sketch 等基准上,仅配合简单熵最小化即可达到或超过更复杂 TTA 方法。

FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction Figure 1
2026-06-09cs.CV

FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction

Chang Kong, Yuebing Li, Peng Mo, Haigang Zhang, Qiuming Luo

Shenzhen Polytechnic University, Shenzhen, China, Institute of Applied Artificial Intelligence of the Guangdong-Hong Kong Macao, Shenzhen University, China, tomated dataset construction. By employing a collaborative “Generation-, Collaboration · Automated Dataset Construction · Hard Negative Mining., leverages VLM-based Multi-Agent Collaboration to automate the construction, of fine-grained image-text datasets. Inspired by human collaborative work-

2026-06-09视觉语言视觉感知数据集/基准

本文针对现有图文数据集缺少细粒度属性硬负样本、导致 VLP 模型依赖粗语义匹配的问题,提出 FineGen:用生成、验证、纠错三个 VLM agent 闭环构造最小属性扰动样本,以降低幻觉和无效负例。基于 ImageNet 得到 FineGen-100K,含 14.7 万余属性硬负例,属性有效率 96.7%;在 FG-OVD hard split 上微调带来 +14.4% 准确率提升,效果可能主要来自更密集且经验证的 hard negative 数据。

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs Figure 1
2026-06-09cs.CV

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

2026-06-09视觉感知

现有音视觉评测多按单模态或零散任务设计,难以判断 Omni-MLLM 是否具备接近人类的跨模态感知、理解与推理能力。AVI-Bench 以认知阶段划分任务,并加入 PriSe 用低语义陌生刺激测试原始音视觉泛化,同时提出四级 AVI 分类。实验覆盖开闭源模型,显示当前模型在联合音视觉解释与域外鲁棒性上仍有明显短板。

Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View Figure 1
2026-06-09cs.CV

Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View

Dongdong Wang, Alina Hagen, Isabelle Gatmaitan, Hao Zhou, Yiwen Dong, Shabboo Valipoor, Vivian W.H. Wong, Lingyao Li

Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for, University of Florida, University of South Florida, University of Illinois Urbana-Champaign, at the University of Florida, linking 407 unique, of expert-guided VLMs for scalable accessi-, baseline accessibility (U.S. Department of Justice, manual site visits. For instance, university acces-, a labor-intensive and unscalable process. To ad-, as a scalable visual source for auditing outdoor en-, the University of Florida campus. Our study makes, pipeline as a scalable screening layer for accessi-

2026-06-09视觉语言

针对轮椅可达性障碍分散、临时且人工巡检难以规模化的问题,论文用谷歌街景结合ADA/专家规则的RAG式VLM流程评估校园环境,并与轮椅GPS停留时间对齐验证。UF校园407个街景点结果显示,VLM评分与停留时间呈负相关且分布相近;RAG、多问题提示和透视街景优于基线,但对细微路面、临时遮挡和视角相关障碍仍有限。

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models Figure 1
2026-06-09cs.CV

Readable Yet Unpredictable: Rotated-Outcome Prediction in Vision-Language Models

Lexin Wang, Shenghua Liu, Yiwei Wang, Jiafeng Guo, Xueqi Cheng

Institute of Computing Technology, Chinese Academy of Sciences, University of California, Merced

2026-06-09视觉语言视觉感知

这篇论文关注视觉语言模型在非标准朝向输入中的“预判”能力:模型是否能仅凭当前图像推断其旋转 180° 后会看到或读到什么。作者提出 Rotated-Outcome Prediction 与成对诊断集 RotOutBench,区分“看到后识别”和“未看到时推断”。实验显示,多数 VLM 能直接读出原图或旋转图内容,但在从原图预测旋转结果时准确率接近崩溃,揭示其旋转表征与最终文本读出之间存在断裂。

No Free Lunch for Synthetic Images under Data Scarcity Conditions Figure 1
2026-06-09cs.CV

No Free Lunch for Synthetic Images under Data Scarcity Conditions

Borja Arroyo Galende, Alejandro Almodóvar, Patricia A. Apellániz, Juan Parras, Silvia Uribe, Santiago Zazo

2026-06-09视觉感知

针对医疗等隐私敏感场景中真实图像稀缺、合成数据又需兼顾可用性与隐私的问题,本文提出同时评估保真度、隐私和下游效用的统一框架,比较 VAE、GAN 与 DDPM 在 MNIST、OCTMNIST、OrganAMNIST 上的表现。结果显示不存在“免费午餐”:增强差分隐私会牺牲至少一项指标,其中 GAN 和 DDPM 在噪声下更稳健,VAE 退化更快。

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention Figure 1
2026-06-09cs.CV

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu

Fudan University, Shanghai Innovation Institute, fully recorded and is available before generation begins: the model watches the clip through, then answers.

2026-06-09视觉感知

这篇论文针对智能眼镜、机器人等场景中视频仍在流入而模型已在回答的问题,强调“实时”关键在于生成不能阻塞感知。作者提出 MOSS-Video-Preview,用交叉注意力双通道让视觉特征走旁路,并合成带答案修订与静默监督的数据进行 SFT。结果显示其离线能力接近但总体仍落后 Qwen2.5-VL,可能主要来自 data / scaling;在单 H200、256 帧下 TTFT 约快 5 倍、解码吞吐高 2.7 倍,实时能力目前主要为定性验证。

Anchor-Conditioned Compositional Control for Landscape Image Generation Figure 1
2026-06-09cs.CV

Anchor-Conditioned Compositional Control for Landscape Image Generation

Gadha Lekshmi P, Govind Arun, Rohith Syam, Ahmed Elgammal

Rutgers University–New Brunswick, USA, University of Maryland–College Park, USA, University of Technology Sydney, Australia, lack controllability over composition, a capability that is, rated from multiple publicly available sources, including a, Experiments were conducted on Google Colab using an, available

2026-06-09视觉感知规划控制

本文针对扩散模型生成风景图时难以显式控制地平线、前景占比和视觉重心的问题,提出从训练图像自动提取4维构图锚点,并经傅里叶编码与独立交叉注意力通路注入微调模型,避免与文本 token 竞争。实验显示该方法在地平线检测率0.850、三分法对齐0.817上优于基线和消融;类别消融还表明同质场景训练可将地平线偏差最多降低40%,说明构图控制精度受数据类别影响。

Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing Figure 1
2026-06-09cs.CV

Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing

Lecheng Yan, Yichong Zhang, Ben Pan, Xiaoyu Zheng, Jiawei Qian, Anqi Wu, Wenxi Li, Chenyang Lyu

traces, and examples are publicly available at, role-based collaboration (Yao et al., 2022, also on controllable production workflows.

2026-06-09视觉感知生成模型

长视频剪辑需要在异构素材、叙事、时间线和后期工具间保持可追踪状态,避免小错误导致整体重做。Crayotter将流程拆为覆盖感知素材准备、基于产物的剪辑研究和工具落地执行,并把检索报告、分析、蓝图、工具调用和中间渲染显式化以支持诊断与局部修复。在23个主题上,人评均分3.40/5,高于CapCut-Mate的2.44和CutClaw的1.70。

NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis Figure 1
2026-06-09cs.CV

NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis

Xiongri Shen, Zhenxi Song, Jiaqi wang, Yi Zhong, Leilei Zhao, Chenqi Xu, Linling Li, Yichen Wei, Lingyan Liang, Demao Deng, Luping Song, Ping Luan, Ahmed M. Anter, Shuqiang Wang, Baiying Lei, Zhiguo Zhang

aDepartment of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), Shenzhen, 518055, China, bSchool of Intelligence Science and Engineering, College of Artificial Intelligence, Harbin Institute of Technology, Shenzhen, 518055, China, c School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China, dGuangdong Key Laboratory of Biomedical Measurements and Ultrasound Imaging, School of Biomedical Engineering, Shenzhen University, Medical School, Shenzhen University, Shenzhen, 518055, China, eDepartment of Radiology, The People’s Hospital of Guangxi Zhuang Autonomous Region, Guangxi Academy of Medical Sciences, Guangxi, fShenzhen Sxith People’s Hospital (Nanshan Hospital), Huazhong University of Science and Technology Union Shenzhen Hospital, Shenzhen, gSchool of Basic Medical Sciences, Shenzhen University, Shenzhen, 518055, China, hthe Egypt-Japan University of Science and Technology (E-JUST), Alexandria, 21934, Egypt, iSchool of Biomedical Engineering, National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, Guangdong Key, Laboratory for Biomedical, Measurements and Ultrasound Imaging, Shenzhen University Medical School, Shenzhen University, Shenzhen, j the Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, 518055, China

2026-06-09视觉语言

该文针对 fMRI/DTI 多模态认知障碍分析中功能—结构表征错位、动态/静态连接割裂和可解释性不足的问题,提出 NeuroAlign:用 DMHA 对齐多尺度 DFC、SFC 与结构特征,用 DDHI 在区域与连接域做细粒度到全局交互,并以 SAM 给出 DFC/SFC/ALFF/FA 归因图。在 GUTCM、ADNI、OASIS 五折验证中表现具竞争力,ADNI/OASIS 准确率约 0.825/0.735,跨站点迁移仍存在域差距。

AMN: An Adaptive Multi-Scale Fusion Network with Boundary and Uncertainty Modeling for Nuclei Segmentation Figure 1
2026-06-09cs.CV

AMN: An Adaptive Multi-Scale Fusion Network with Boundary and Uncertainty Modeling for Nuclei Segmentation

Spoorthi M, Suja Palaniswamy

2026-06-09视觉感知学习理论安全鲁棒

针对病理图像中细胞核类别形态尺度差异大、类别极不均衡且边界拥挤,单纯 CNN 或 Transformer 难以兼顾局部纹理与全局上下文的问题,AMN 采用 Swin Transformer 与 ResNet-50 双编码器,并以逐通道自适应门控在多尺度融合,同时加入边界头和不确定性调制损失以抑制过度自信错误。文中在 CoNIC 七类核分割上取得 mean Dice 0.82、mean F1 0.68,优于八个基线,并在 MoNuSeg 零重训练测试中显示一定跨域泛化。

Frankenstein in the Pipeline: Computational Epistemicide in Facial Recognition Figure 1
2026-06-09cs.CY

Frankenstein in the Pipeline: Computational Epistemicide in Facial Recognition

Nina da Hora

2026-06-09视觉感知

针对人脸识别批评常停留在数据偏差和误差率的问题,本文把检测、对齐、嵌入、阈值判定等流水线步骤作为认识论操作来分析,提出“计算性认识灭绝”:活的、关系性的面孔被压缩为可治理的向量代理。论文的主要结论是,伤害并非只来自实现不佳,而是来自以距离和“足够接近”来授权身份的结构,因此单纯提升公平性、校准或准确率不足,作者主张拒绝将向量化身份作为权利和准入依据。

Eyes All Around: Design and Analysis of 360-Degree LiDAR Perception Using Equivariant Feature Learning in Unstructured Traffic Figure 1
2026-06-09cs.CV

Eyes All Around: Design and Analysis of 360-Degree LiDAR Perception Using Equivariant Feature Learning in Unstructured Traffic

Pranav Darshan, Raghuveer Narayanan Rajesh, M Uttara Kumari

Department of Computer Science and Engineering, RV College of Engineering, Bengaluru 560059, India, Department of Electronics and Communication Engineering, Among the available sensing modalities, LiDAR, methods such as Complete & Label (Yi et al., 2021), (Shi et al., 2020) and CenterPoint (Yin et al., 2021), tions (Zhu et al., 2022) further improve scalability

2026-06-09视觉感知

面向印度等密集无序交通中遮挡多、参与者类型杂且360°视角下方位变化和扇区边界易破坏一致性的问题,论文构建了Ouster OS0全景LiDAR检测流程,将方位扇区划分、重叠处理与旋转等变稀疏卷积结合,用于分析全周感知中的鲁棒性。自采数据上汽车表现最好(92.02/90.51),公交和卡车次之,小目标行人与骑行者仍明显较难。

SENTRY: Statistical Reliability Analysis of Vision Transformers Under Soft Errors Figure 1
2026-06-09cs.CV

SENTRY: Statistical Reliability Analysis of Vision Transformers Under Soft Errors

Pramit Kumar Bhaduri, Mahdi Taheri, Samira Nazari, Maksim Jenihhin, Christian Herglotz, Michael Hubner

Brandenburg University of Technology Cottbus-Senftenberg, Germany, Tallinn University of Technology, Tallinn, Estonia, Zanjan University, Iran

2026-06-09视觉感知

面向自动驾驶、医疗等安全场景中 ViT 参数规模过大、穷举软错误注入不可行的问题,SENTRY 提出基于有限总体抽样的多粒度统计故障注入框架,在网络、层、组件和比特位置间逐步细化失效率估计。实验在 ViT-Tiny/Small 上约 5.1 万次注入即可给出 99% 置信、1% 误差界,较穷举最高降本 10700 倍;结果显示约 3% FP32 单比特翻转会失效且多为灾难性,风险集中在 LayerNorm 和指数位 Bit 30。

ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization Figure 1
2026-06-09cs.LG

ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

Li Lin, Xiaojun Wan

Wangxuan Institute of Computer Technology, Peking University

2026-06-09视觉感知

针对 NVFP4 量化仍依赖 AbsMax/4⁄6 等启发式尺度初始化、与最优 FP8 block scale 存在差距的问题,本文提出 ScaleSweep:在理论推导的 MSE/WMSE 上下界内枚举可行块尺度,从而以很小搜索空间选择最小误差尺度,并可接入 RTN/GPTQ。Llama、Qwen 实验显示其在权重-激活、KV cache 与 query state 激进量化下优于现有初始化,最强设置仍保留超过 93% 全精度性能,推理开销接近默认算子。

Can You Trust What You See? Human and AI Detection of Synthetic Legal Evidence Figure 1
2026-06-09cs.CV

Can You Trust What You See? Human and AI Detection of Synthetic Legal Evidence

Jinzhe Tan, Ali Ekber Cinar, Karim Benyekhlef

Cyberjustice Laboratory, Faculty of Law, Universit´e de Montr´eal, Faculty of Law, McGill University, goods to obtain refunds, while platforms and service centers indicated that they

2026-06-09视觉感知

针对生成式 AI 使照片类法律证据不再天然可信的问题,论文构建 SLED-1400:200 张真实证据图与 1200 张由 6 个图像生成器产生的合成图,覆盖民事纠纷中常见的物体中心证据场景,并统一测试 136 名普通人和 4 个前沿多模态模型。结果显示,人类总体准确率仅 64.8%,面对最强生成器接近随机;MLLM 虽不误判真实图,却大量漏检高质量合成图,说明单靠人或模型都不足以完成证据认证。

DiffoR: A Unified Continuous Generative Framework for Universal Ordinal Regression Figure 1
2026-06-09cs.LG

DiffoR: A Unified Continuous Generative Framework for Universal Ordinal Regression

Hongxu Ma, Lin Wang, Chenghou Jin, Han Zhou, Jie Zhang, Xiaoyu Yang, Chunjie Chen, Jihong Guan, Shuigeng Zhou

Fudan University, Shanghai University of Finance and, Tongji University

2026-06-09生成模型

本文针对有序回归中离散化带来的量化误差、刚性边界和全局序关系建模不足,提出将任务改写为连续生成式有序回归。DiffoR用扩散模型迭代恢复连续目标,并通过多尺度增量聚合与动态去噪感知分别建模层级有序结构和粗到细语义频率。论文在12个跨四领域基准上报告稳定优于现有方法,但具体增益在多大程度来自框架设计仍需结合消融细看。

VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents Figure 1
2026-06-09cs.CV

VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

2026-06-09视觉语言视觉感知学习理论

本文关注视觉语言代理在截图、文档和界面中读取敏感或危险文本后,将其复制进工具参数的“动作边界传播”风险。作者提出 VisualLeakBench,用500张合成图和轨迹级诊断评估保存笔记、外部转发等流程。结果显示,基线下 PII 与不安全文本传播率分别达78.8%和85.5%;防御提示虽将 PII 降至2.0%,但多依赖抑制工具调用,且不安全文本仍有52.6%越过工具边界。

A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers Figure 1
2026-06-09cs.CV

A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers

Hannah Gao (Massachusetts Institute of Technology), Isha Agarwal (Massachusetts Institute of Technology), Dylan Hadfield-Menell (Massachusetts Institute of Technology), Rachel Ma (Massachusetts Institute of Technology)

2026-06-09视觉感知

面向VLM/VLA等系统中ViT感知模块在真实模糊、噪声下的可靠性,本文不只看鲁棒精调后的准确率,而是结合logit lens、注意力差异和SAE稀疏表征做机制分析。结果显示,在同类扰动上精调可提升性能与置信度,并让正确类别更早在层间出现,但低频到高频等跨扰动泛化有限;注意力和知识演化会变,稀疏表征未发生根本改变。

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions Figure 1
2026-06-09cs.CV

SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions

Mingyi He, Xinyi Guo, Xitong Ling, Weiming Chen, Jiawen Li, Lianghui Zhu, Minxi Ouyang, Mingxi Fu, Yizhi Wang, Tian Guan

Beijing University of Chemical Technology, South China Normal University, Tsinghua University

2026-06-09数据集/基准

病理基础模型常以WSI切片级弱标签构建patch预训练集,难以知道哪些异常或癌变形态真正进入数据。SlideCheck在冻结病理特征上用双头MLP分别评分异常与恶性,并结合MIL注意力挖掘伪标签,用于筛选和审计ViT自监督预训练子集。实验显示其定义的数据分布会影响下游AUC,25%精选子集接近全量表现;但文中也指出模型尺度影响更大,增益可能主要来自scaling / data composition而非单一采样比例。

Multimodal Group Emotion Recognition In-the-Wild Towards a Privacy-Safe Non-Individual Approach Figure 1
2026-06-09cs.CV

Multimodal Group Emotion Recognition In-the-Wild Towards a Privacy-Safe Non-Individual Approach

Anderson Augusma

2026-06-09视觉语言视觉感知安全鲁棒

针对野外群体情绪识别依赖人脸、凝视或声纹带来的隐私与监控风险,论文转向仅使用群体级音视频信号。核心创新是交叉注意力音视频融合与帧注意力池化,并提出VE-MD共享潜空间联合学习情绪分类和身体/面部结构表征,比较DETR与热图解码。实验称在真实场景具备鲁棒性并达到竞争性或SOTA表现,但具体指标与增益来源在给定片段中未充分说明。

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs Figure 1
2026-06-09cs.AI

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

Tsinghua University, Department of Engineering, University of Cambridge, signals are available. The second is token selection

2026-06-09视觉感知

长视频音视LLM在流式推理中KV缓存随时长线性膨胀,且音频/视觉token严重不均衡,使统一压缩容易丢失音频线索。OmniMem提出按层、按模态分配预算的AVBA,并用注意力重要性结合value余弦冗余来选择对输出扰动最小的KV状态,还加入预算感知微调。其在VideoMME Long、LVBench、LVOmniBench上相同内存预算较强无训练基线提升约2–4个百分点,微调后再增1–2个百分点。

A Systematic Study of Behavioral Cloning for Scientific Data Annotation Figure 1
2026-06-09cs.HC

A Systematic Study of Behavioral Cloning for Scientific Data Annotation

Ishaan Singh Chandok, Core Francisco Park

Department of Physics, Harvard University, Cambridge, MA, cess as a direct mapping from data to labels, optimizing, quality annotations are produced, not just the final labels.

2026-06-09视觉感知

论文针对科学数据标注中自动化后仍需人工验证纠错的“最后一公里”问题,提出用行为克隆学习专家在 GUI 中的导航、点击与修正过程,并构建9个合成标注任务作为可控基准。实验显示模型先学会界面操作再学关键决策,大模型在多任务训练中更省数据,预训练可迁移到新任务;线性探针还发现跨任务共享的错误表征,但结论主要限于合成任务与25M–320M规模。

Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing Figure 1
2026-06-09cs.CV

Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing

Kateryna Lutsai, Pavel Straňák, David Novák, Dana Křivánková

2Institute of Formal and Applied Linguistics, Charles University MFF, Malostransk´e, Institute of Archaeology, Czech Academy of Sciences, Letensk´a, Prague, 11800, Czech, Document Image Transformers (ViT, DiT), and multimodal CLIP models. An 11-category label, scheme was designed collaboratively with domain experts and evaluated via five-fold cross-validation., racy and produce consistent labels across 649,508 unlabeled archival pages with over 90% inter-model, with image-only models on unlabeled data, making it less suitable for deployment. The final models, annotated dataset, and software are publicly available under open-source licenses., resources available for curation., is available in the accompanying thesis [4].

2026-06-09视觉感知

面向人文档案数字化中扫描页类型混杂、缺少元数据且难以人工分拣的问题,本文构建经专家多轮校订的4.8万页捷克考古档案数据集和11类视觉标签,系统比较手工特征、CNN、ViT/DiT与CLIP微调。结果显示传统随机森林约75%准确率,而RegNetY-16GF、ViT-large等图像模型在测试集达约99.1%,并在64.9万未标注页上保持较高一致性;CLIP虽测试分高但部署一致性不足。

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation Figure 1
2026-06-09cs.HC

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

2026-06-09视觉语言视觉感知数据集/基准

本文针对视频人群研究中真人受试者成本高、MLLM能否替代主观反馈仍不清的问题,以短视频感知感官参与度为任务,基于PMSV量表比较673名真人与按个人画像条件化的Gemini 3 Flash、Qwen 3 Omni模拟评分。结果显示,两者与人类一致性显著低于人—人基线,并存在均值下移、中心化和群体差异扭曲;提示策略仅带来混合影响,说明视频理解能力并不等同于可靠模拟主观人类反应。

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models Figure 1
2026-06-09cs.CL

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng

Southern University of Science and Technology

2026-06-09三维

该文针对3D-VL中完整场景图关系数随物体数平方增长、而KNN近邻剪枝易删掉任务关键长程关系的问题,提出CAPruner:结合查询相关的模糊语义匹配与空间距离为边打分,并用目标节点邻边聚合分数进行弱监督,避免逐关系标注。实验显示其能更好保留空间推理所需关系,提升LLM在3D-VL任务上的表现。

2026-06-08

113 篇
UniSHARP: Universal Sharp Monocular View Synthesis Figure 1
2026-06-08cs.CV

UniSHARP: Universal Sharp Monocular View Synthesis

Meixi Song, Dizhe Zhang, Hao Ren, Ruiyang Zhang, Bo Du, Ming-Hsuan Yang, Lu Qi

Sun Yat-sen University, Beihang University, Wuhan University, University of California, Merced

2026-06-08视觉感知

针对现有单目3DGS(如SHARP)依赖针孔相机、难以泛化到广角/鱼眼/全景输入的问题,UniSHARP将高斯预测改到统一的射线-距离空间,并融合2D语义与3D空间特征,在潜空间而非图像空间对齐不同相机;还支持无内参的射线场推断。作者构建按FoV分层的多相机基准,结果显示其在透视、广角、鱼眼和全景新视角合成上均显著优于PanoDreamer、Matrix3D等基线。

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism Figure 1
2026-06-08cs.CV

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

Ant Group, 2Zhejiang University, 3Central South University

2026-06-08视觉感知

针对小时级视频中全量帧输入导致 token 爆炸、注意力稀释和长程因果线索丢失的问题,MemDreamer 将感知与推理解耦:先流式构建包含 Video Root、Super/Macro Event 与实体事件关系的层级图记忆,再由推理模型通过工具化 Observation-Reason-Action 检索导航。实验在四个长视频基准达 SOTA,LVBench 较端到端提升 12.5 点且仅用约 2% 上下文,并观察到 agentic 推理能力与长视频表现强相关。

Streaming Video Generation with Streaming Force Control Figure 1
2026-06-08cs.CV

Streaming Video Generation with Streaming Force Control

Hanhui Wang, Yiming Xie, Haiwen Feng, Zhaoyang Lv, Shenlong Wang, Huaizu Jiang

Northeastern University, University of California, Berkeley, University of Illinois Urbana-Champaign

2026-06-08视觉感知规划控制

论文针对现有视频生成难以在生成过程中接受可变物理力并实时反馈的问题,提出 StreamForce:用像素对齐的掩码力图统一表示局部推力与全局环境力,并将力条件双向教师蒸馏为因果自回归学生,配合时变力数据保持力-运动对应。结果显示其在单 H200 上以 832×480 达到 16.6 FPS、约 0.6 秒延迟,并在力遵循与运动真实感上优于已有方法。

Differences in Detection: Explainability Where it Matters Figure 1
2026-06-08cs.CV

Differences in Detection: Explainability Where it Matters

Johannes Theodoridis, Johannes Maucher, Andreas Schilling

University of Tübingen, Institute for Applied AI

2026-06-08视觉感知

目标检测常用 mAP/TIDE 只能分别评估模型,难回答两个检测器是否识别同一批目标、错误是否重合。论文提出 DnD,沿用 mAP 匹配,将真值划分为两者都检出、仅一方检出、都漏检等集合,并结合 TIDE 错误形成直观混淆分析。主要结果是提供实例级、与指标相关的对比子集,可指导 ODAM 等解释方法聚焦关键样本;文中未充分说明显著量化性能增益。

Implicit Data Synthesis for Contrastive Unsupervised Data Augmentation Figure 1
2026-06-08cs.CV

Implicit Data Synthesis for Contrastive Unsupervised Data Augmentation

Patrick Kage, Trevor Hedges, N. Siddharth, Pavlos Andreadis

School of Informatics, The University of Edinburgh, Massachusetts Institute of Technology Lincoln Laboratory

2026-06-08视觉感知

针对科学观测数据标注昂贵且常规图像增强会破坏物理含义的问题,论文将 SimCLR 的正样本生成从数据空间移到权重空间:在编码器单个全连接层加入有界随机扰动,形成隐式数据合成。合成流星雷达数据和 CIFAR-10 实验显示,浅层 CNN 上 IDS 可匹配或优于翻转旋转基线;但在流星数据的深层 ResNet 上单点扰动不足,增益并不稳定。

Planning-aligned Token Compression for Long-Context Autonomous Driving Figure 1
2026-06-08cs.RO

Planning-aligned Token Compression for Long-Context Autonomous Driving

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

2026-06-08规划控制

本文针对端到端 VA/VLA 自动驾驶在长时序上下文下 token 过多、而简单时间衰减压缩会丢失让行/停车等关键历史线索的问题,提出 COMPACT-VA:用条件 VQ-VAE 与 Q-former 将压缩记忆和轨迹规划意图耦合,并以分层 FIFO 保留近远期信息。在四向停车、遮挡、无保护转弯等高信号场景中,其成功率达 68.3%,较基线提升约 6.3%,roll-through 降低 22%,同时闭环评测实现 3.3× 加速和 2.7× 显存/内存降低。

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment Figure 1
2026-06-08cs.CV

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany, Department of Language Science and Technology, Saarland University, Saarbrücken, Germany

2026-06-08视觉语言视觉感知

论文针对 CLIP 类视觉语言模型中图像信息多于文本描述导致的模态间隙,提出 TEVI:先用稀疏自编码器将图像嵌入分解为概念潜变量,再由文本条件掩码选择性重构,只保留 caption 涉及的信息。合成实验验证其能保留目标属性、丢弃无关属性;在 COCO、Flickr、DOCCI、IIW 和 RoCOCO 上提升检索、对齐与语言扰动鲁棒性,长描述场景收益更明显,但推理需逐图文条件化,计算成本较高。

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning Figure 1
2026-06-08cs.CV

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang

Zhejiang University, Hangzhou, China, University of Technology Sydney, Sydney, Australia, OPPO Research Institute, Shenzhen, China

2026-06-08三维

本文针对现有 MLLM 3D 空间推理代理在不同室内场景中套用统一工具流程、导致工具误用和收益有限的问题,提出 Skill-3D:用场景记忆记录成功/失败工具轨迹,并蒸馏为可演化的场景感知技能,在推理和后训练中指导工具选择。实验显示其将 VSI-Bench 有效工具使用率从 39% 提升到 78%,Gemini-3-Flash 在 MMSI-Bench 提升 67%,Qwen3-VL-8B 后训练在 VSI-Bench 提升 43%。

The Lipreading Gap: Do VSR Models Perceive Visual Speech Like Human Lipreaders? Figure 1
2026-06-08cs.CV

The Lipreading Gap: Do VSR Models Perceive Visual Speech Like Human Lipreaders?

Rishabh Jain, Naomi Harte

Sigmedia Group, School of Engineering, Trinity College Dublin, Ireland

2026-06-08视觉感知

本文质疑VSR低WER是否等同于类人唇读感知,利用MaFI人类唇读数据,将Auto-AVSR、AV-HuBERT和VSP-LLM在词、字符、音素、视素层面与人类对齐比较。核心发现是模型总体准确率虽高,但成败词和混淆模式不同于人类;仅给初始音素的文本n-gram已接近人类,模型错误更受训练词频而非视觉清晰度解释,说明当前VSR主要依赖语言捷径而非稳健视觉发音理解。

Watch, Remember, Reason: Human-View Video Understanding with MLLMs Figure 1
2026-06-08cs.CV

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

J. Meng, Y. Tan, and Y. Tong are with School of Intelligence Science and Technology, Peking University., Q. Xu and L. Qi are with Wuhan University., K. Gao and Y. Li are with Shanghai Jiao Tong University., J. Li is with Nanyang Technological University., Q. Zhou is with the University of Tokyo., G. Cheng is with the University of Liverpool., J. Zhang is with Zhejiang University., L. Kong is with the National University of Singapore.

2026-06-08视觉感知

长视频 MLLM 面临证据稀疏、长程依赖和算力受限,单纯按任务梳理难以解释系统瓶颈。本文提出“观看-记忆-推理”的人类视角综述框架,把感知表示、记忆状态、推理轨迹和预测统一起来,覆盖细粒度定位、多模态感知、长视频压缩、离线/流式记忆与基于证据的推理,并系统整理应用、训练数据和评测基准;文中主要结果是方法学版图与开放问题总结,而非新的实验增益。

OpenGlass: Open-Source Smart Glasses for On-Device Event-Based Gesture Recognition Figure 1
2026-06-08cs.CV

OpenGlass: Open-Source Smart Glasses for On-Device Event-Based Gesture Recognition

Pietro Bonazzi, Julian Moosmann, Ahmet Celik, Philipp Mayer, Michele Magno

2026-06-08视觉感知

面向智能眼镜在隐私、低时延与续航约束下难以承载本地视觉智能的问题,OpenGlass提供开源模块化硬件:以FPC转接同时支持事件相机与RGB相机,并用nRF5340事件唤醒和PMIC管理使GAP9推理间休眠。原型200 mAh电池可连续本地ML约11.8小时;在LynX手势识别中,R(2+1)D跨被试准确率83.94%、宏F1为0.781,端到端延迟33.9 ms。

DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation Figure 1
2026-06-08cs.CV

DisPOSE: Projected Polystochastic Diffusion for Self-Supervised Multi-View 3D Human Pose Estimation

Tony Danjun Wang, Tolga Birdal, Nassir Navab

2026-06-08生成模型三维

针对多视角多人 3D 姿态中视角间人员匹配离散、遮挡严重且自监督方法受合成姿态域偏移影响的问题,DisPOSE 将匹配建模为多随机张量空间上的投影扩散,并用可微 Sinkhorn 约束可行分配,再以超图卷积解码完整骨架。实验称其在 CMU Panoptic 的 AP25 较自监督 SOTA 提升 19%,新相机布局 mAP 达 75% 对 59%,且 10% 伪标签保留 99% 性能。

RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents Figure 1
2026-06-08cs.CV

RealDocBench: A Benchmark for Field-Level QA and Layout Understanding on Real-World Regulated Documents

Ameya Joshi, Joon Kim, Gus Eggert, Joseph Bajor, Cindy Hao, Jing Reyhan, Kushal Byatnal, Eli Badgio

2026-06-08强化学习数据集/基准

面向抵押、金融、物流和医疗等受监管流程,现有文档解析基准多用干净版面和整页相似度,难反映代理真正需要的字段值正确性。RealDocBench用581份真实文档构建字段级QA,并配套1500页九类布局标注,以类型容忍评分和邻接感知匹配统一评测18个系统。结果显示系统差距被单一指标掩盖,医疗子域持续困难,且准确率需与单页成本和冷缓存延迟一起权衡。

Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation Figure 1
2026-06-08cs.CV

Mind the Gap: Disentangling Performance Bottlenecks in Video Instance Segmentation

Danial Hamdi, Fardin Ayar, Mahdi Javanmardi

2026-06-08视觉感知

针对视频实例分割中分类、分割与跟踪误差被统一指标混在一起、难以定位瓶颈的问题,论文提出基于整数线性规划的模型无关 oracle,分层隔离身份关联、语义分类和掩码质量误差,并配套 TrackLens 可视化查询级失败模式。对 7 种在线/离线方法在 YTVIS 与 OVIS 上分析发现,在线方法的核心瓶颈是长期跟踪不稳定,遮挡下跟踪缺口可超过 20 AP,且随视频长度和实例密度显著增大;更强 backbone 提升默认 AP,却基本不消除跟踪缺口。

Impact of Synthetic Lesional MR Images in Automated Focal Cortical Dysplasia Detection in Low-Data Scenarios Figure 1
2026-06-08eess.IV

Impact of Synthetic Lesional MR Images in Automated Focal Cortical Dysplasia Detection in Low-Data Scenarios

Prabhjot Kaur, Hakim Ouaalam, Sedat Kandemirli, Sanjay P. Prabhu, Simon K. Warfield

Computational Radiology Laboratory, Boston Children’s Hospital, Harvard Medical School, Computational Radiology Laboratory​, Boston Children’s Hospital, Harvard Medical School​, reducing labeled data needs by ~20% while maintaining equivalent sensitivity. Equivalent, amounts of real data, when available, remain more effective than synthetic augmentation.

2026-06-08视觉感知

针对FCD自动检测依赖昂贵体素级病灶标注、低数据场景难训练的问题,论文将GMM生成的类FCD掩膜嵌入健康脑MRI,并用条件生成网络合成带标签T1/FLAIR数据,而非从零生成整脑。合成图像较难被专家区分;加入合成数据使nnU-Net敏感性提升8.14%、病灶置信度显著提高,但同等规模真实数据效果更强,说明收益可能主要缓解标注不足而不能替代真实数据。

Beyond Backscatter: InSAR coherence from detected SAR images Figure 1
2026-06-08eess.SP

Beyond Backscatter: InSAR coherence from detected SAR images

Francescopaolo Sica, Andrea Pulella, Michael Schmitt

Department of Aerospace Engineering, University of the Bundeswehr Munich, Neubiberg, Germany, Microwaves and Radar Institute, German Aerospace Center (DLR), Weßling, Germany

2026-06-08视觉感知

干涉相干性对形变监测、变化检测和任务设计很有用,但传统估计依赖精确配准的 SLC,计算和数据门槛高。本文用由 SLC 生成的相干图监督 Residual U-Net,仅输入两期检测 SAR 后向散射,在无需亚像素配准的情况下回归高分辨率相干性。实验显示其优于既有强度代理方法,并能跨地区、极化、频率及未见过的时间基线泛化,还可用于 GEE 等 GRD 分析就绪数据。

Mitosis Detection in the Wild: Multi-Tumor and Context-Aware Generalization in the MIDOG 2025 Challenge Figure 1
2026-06-08cs.CV

Mitosis Detection in the Wild: Multi-Tumor and Context-Aware Generalization in the MIDOG 2025 Challenge

Marc Aubreville, Jonas Ammeling, Sweta Banerjee, Viktoria Weiss, Taryn A. Donovan, Robert Klopfleisch, Jiaqi Lv, Shan E Ahmed Raza, Raphaël Bourgade, Thomas Walter, Yasemin Topuz, Songül Varlı, Charles-Antoine Collins-Fekete, Zhuoyan Shen, Navya Sri Kelam, Nitin Singhal, Christian Marzahl, Brian Napora, Tengyou Xu, Hongyan Gu, Mario Vento, Gennaro Percannella, Norbert Ropiak, Izabela Wasiak, Jie Xiao, Shaojun Liu, Seungho Choe, April Khademi, Vidushi Walia, Sujatha Kotte, Andrew Broad, Alex Wright, Guillaume Balezo, Esha Sadia Nasir, Mostafa Jahanifar, Yosuke Yamagishi, Shouhei Hanaoka, Mattia Sarno, Francesco Tortorella, Biwen Meng, Jingxin Liu, Sara Krauss, Daniel Hieber, Lavish Ramchandani, Dev Kumar Das, Mieko Ochi, Yuan Bae, Piotr Giedziun, Mateusz Maniewski, Vangala Govindakrishnan Saipradeep, Naveen Sivadasan, Leire Benito-Del-Valle, Adrian Galdran, Kaustubh Atey, Sameer Anand Jha, Adinath Dukre, Imran Razzak, Maxime W. Lafarge, Viktor H. Koelzer, Nils Porsche, Nikolas Stathonikos, Mitko Veta, Dominik Hirling, Zsanett Zsófia Iván, Peter Horvath, Katharina Breininger, Christof A. Bertram

2026-06-08视觉感知学习理论

为推动有丝分裂检测从精选热点区走向真实病理全切片应用,MIDOG 2025在365例、12类人/犬/猫肿瘤及多扫描平台上,同时评估热点、随机和“伪阳性丰富”困难区域,并加入非典型有丝分裂分类。结果显示检测最高F1为0.740、分类平衡准确率0.908;离开热点区后误报率上升208%,罕见或高度多形性肿瘤暴露明显盲点。集成平均带来约1.5/1.3个百分点增益,TTA基本无效。

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos Figure 1
2026-06-08cs.CV

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos

Anurag Ghosh, Francesco Pittaluga, Khiem Vuong, Angela Chen, Juan Alvarez-Padilla, Manmohan Chandraker, Srinivasa Narasimhan

Carnegie Mellon University, NEC Labs America, referenced 3D reconstruction at metric scale (center). Long-tailed objects such as cones, barrels, and barricades, ∗Work done at Carnegie Mellon University, platforms, spans more cities and unusual situations than any publicly available autonomous vehicle, maintained map, yields a scalable, annotation-free signal of data quality (Fig. A.1). This allows us to

2026-06-08视觉感知

针对车队数据城市覆盖窄、合成长尾场景真实感不足的问题,Dash2Sim 将野外单目行车记录仪视频恢复为具备尺度和地理参考的 4D 驾驶日志,并用独立地图进行免标注闭环可用性验证。作者构建 ROADWork4D,覆盖 17 城 4,244 个施工场景和 270 万 3D 对象;在 2,201 个验证场景上,规则/混合规划器明显优于学习式方法但仍难处理施工导流换道,恢复深度还使新视角合成感知指标最高提升 19%。

Spatial-Temporal Decoupled Adapter for Micro-gesture Online Recognition Figure 1
2026-06-08cs.CV

Spatial-Temporal Decoupled Adapter for Micro-gesture Online Recognition

Xucheng Shen, Kun Li, Fei Wang, Wei Qian, Jin Jiang, Dan Guo

2026-06-08视觉感知

本文针对未裁剪视频中微手势持续时间短、动作幅度小且类别长尾导致在线定位与分类困难的问题,提出在冻结视频骨干中插入时空解耦 Adapter,用轻量深度卷积分支分别建模时间动态与局部空间线索,并以自适应软均衡增强按类别稀缺性和学习难度调节增广强度。方法在 SMG 数据集/第4届 EI-MiGA-IJCAI Track 2 上取得 F1=0.43808、排名第一,但边界定位精度仍被作者认为有限。

VeriDrive: Verifiable Counterfactual Supervision for Cost-Efficient Vision-Language Planning Figure 1
2026-06-08cs.CV

VeriDrive: Verifiable Counterfactual Supervision for Cost-Efficient Vision-Language Planning

Zikai Zhang, Hubert P. H. Shum, Toby P. Breckon

2026-06-08视觉语言视觉感知规划控制

针对自动驾驶视觉语言规划中自由文本推理难验证、依赖前沿模型生成而成本高的问题,VeriDrive将监督改写为“感知—评估—修正”结构,用未来运动证据、规则检查的反事实轨迹评估和专家意图修正生成可审计QA,并通过本地生成加验证器选择性纠错降本。在nuScenes/Omni-Q开环实验中,相比OmniDrive改善L2、碰撞和路口指标,同时减少token、生成时间和估算GPT费用,但结论仍限于开环安全代理指标。

Varifold Moment Invariants for Sustainable and Explainable Contour Feature Extraction Figure 1
2026-06-08cs.CV

Varifold Moment Invariants for Sustainable and Explainable Contour Feature Extraction

G. Longari, J.-C. Alvarez Paiva, A.B. Tumpach

triangles or distances from random tangent and normal lines to the center of mass), yielding, triangles or signed distances from tangent lines to the center of mass, can be expressed in terms of Varifold

2026-06-08视觉感知

针对轮廓分类中平移、旋转/尺度不变特征常依赖重模型且解释性弱的问题,论文提出 Varifold Moment Invariants,将区域、边界及切线几何统一到 varifold 矩积分框架,并覆盖 Hu/复矩、EGI 等经典描述子。配合 RF/MLP,在物体、叶片、细胞数据集上以少量可解释特征取得接近或优于多种基线的 F1,同时显著降低特征提取计算成本;但特征仍偏手工设计。

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization Figure 1
2026-06-08cs.CV

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization

Yu Li, Menghan Xia, Gongye Liu, Xintao Wang, Conglang Zhang, Lei Ke, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Kun Gai, Yujiu Yang

Tsinghua University

2026-06-08强化学习

本文针对第一人称交互世界模型难以同时表达真实身体动作控制与局部场景可定制演化的问题,提出 AnchorWorld:用3D全身运动驱动自我视角视频,并引入外部视角辅助监督弥补自我视角中身体缺失;同时以带位姿的 anchor view 结合文本演化提示,在统一世界坐标中约束局部外观、位置和动态变化。实验显示其在动作准确性、场景一致性和可控演化上优于改造基线,并在大视角变化、初始视角与锚点重叠较少时仍有较好泛化。

CULTURESCORE: Evaluating Cultural Faithfulness in Video Generation Models Figure 1
2026-06-08cs.CV

CULTURESCORE: Evaluating Cultural Faithfulness in Video Generation Models

Anku Rani, Wei Dai, Shravan Nayak, Pattie Maes, Mahdi M. Kalayeh, Paul Pu Liang

Massachusetts Institute of Technology, Mila – Quebec AI Institute

2026-06-08视觉感知

视频生成模型已具备较强视觉质量,但现有评测偏重清晰度、时序一致性,难以发现把 Namaste 误生成握手等文化失真。论文提出 CultureScore,将文化忠实度拆为身份、场景语境与行为三维,并用覆盖10国、5类社会文化场景的提示与QA评测三种模型。结果显示最佳总体仅56.8%,行为维度均低于52%,且人类偏好与VideoScore相反,说明视觉质量指标会掩盖文化失败。

Closed-Form Spectral Regularization for Multi-Task Model Merging Figure 1
2026-06-08cs.LG

Closed-Form Spectral Regularization for Multi-Task Model Merging

Yongxian Wei, Runxi Cheng, Xingxuan Zhang, Li Shen, Chun Yuan, Peng Cui, Dacheng Tao

2026-06-08视觉感知

针对多任务模型合并中 WUDI/OptMerge 需数百步优化且闭式伪逆反而效果差的问题,论文指出迭代下降的关键作用是对病态正规方程做隐式谱正则,抑制小特征值方向的代理噪声放大。基于此提出 SWUDI/SWUDI-A,用单次逐层特征分解实现软指数滤波与自适应截断,无需数据和优化器状态;在视觉、语言及多模态合并基准上达到或超过现有方法,并将耗时降低 28–72 倍、显存最高降 50%。

ExMesh: EXplicit Mesh Reconstruction with Topology Adaptation Figure 1
2026-06-08cs.CV

ExMesh: EXplicit Mesh Reconstruction with Topology Adaptation

Chuanjin Fan, Lifan Wu, Wenjie Chang, Hanzhi Chang, Wenfei Yang, Tianzhu Zhang

University of Science and Technology of China, National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory

2026-06-08三维

多视图重建若依赖 NeRF/SDF、Gaussian 到网格的后处理,容易带来碎片、锐边丢失和面数冗余;ExMesh 选择直接优化显式网格,在可微渲染的连续优化中插入离散顶点分裂/合并,并同步维护 UV,使复杂区域细化、退化或冗余面被合并,纹理与几何解耦。实验表明其在重建精度、计算效率和网格简洁性之间取得较好折中,但自适应策略的更自动化调参仍是未来工作。

Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentation Figure 1
2026-06-08cs.CV

Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentation

Zihao Zhang, Aming Wu, Yang Li, Yahong Han, Jialie Shen

School of Artificial Intelligence, College of Intelligence and Computing, Tianjin University, China, School of Computer Science and Information Engineering, Hefei University of Technology, China, Department of Computer Science, City St George’s, University of London, UK

2026-06-08视觉感知三维

面向开放世界点云分割中训练类不完备的问题,论文关注如何利用已知类推断未标注新类。其核心是把类别原型组织为超图,用超边建模多类之间的高阶几何与语义关联,并引入几何感知原型及动态超边更新,缓解仅靠两两关系和语义特征带来的歧义。实验在 SemanticKITTI 与 SemanticPOSS 上较既有 NCD 方法取得明显提升,但具体增益来源仍需结合消融进一步判断。

Reconstructing Multi-Decadal Forest Disturbances: A Spatio-Temporal Transformer Approach Figure 1
2026-06-08cs.CV

Reconstructing Multi-Decadal Forest Disturbances: A Spatio-Temporal Transformer Approach

Linus Scheibenreif, Anton Raichuk, Maxim Neumann

2026-06-08视觉感知

针对传统森林扰动监测按像素分析、缺乏空间上下文而易产生噪声和碎片化结果的问题,本文用时空 Transformer 同时建模 Landsat 等卫星时间轨迹与邻域结构,并以弱标签训练、人工标注集和火灾边界数据验证。模型能生成更连贯的扰动图,在 MTBS ±1 年检测精度最高 98.2%、F1 75.8%,但在不同扰动类型上相对像素基线仍有取舍。

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation Figure 1
2026-06-08cs.RO

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

Harbin Institute of Technology (Shenzhen), Pengcheng Laboratory, Harbin Institute of Technology (Shenzhen) Shenzhen China, Pengcheng Laboratory Shenzhen China

2026-06-08机器人视觉语言视觉感知规划控制

这篇论文针对 VLN-CE 中传统“预测离散路标—选择—控制执行”流程容易产生不可达目标和规划/控制不一致的问题,提出 Trajectory Waypoint 范式:用 TSDF 代价引导的扩散策略生成多条可执行、避障轨迹,并让导航器直接基于轨迹几何和时序信息做语言条件选择。实验在 VLN-CE 基准上显示,其路标可达性(%Open)和下游导航性能均优于现有基线。

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking Figure 1
2026-06-08cs.CV

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking

Eduardo Borges, Luís Garrote, Urbano J. Nunes

Authors are with the Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra, Portugal.

2026-06-08视觉感知三维

面向移动机器人在人群中因遮挡、拥挤导致仅靠 LiDAR 几何关联易丢失行人身份的问题,论文系统评估将 RGB ReID 接入在线 3D 多行人跟踪的作用。其核心洞察是外观信息不能简单与运动代价线性融合,而应作为级联的二阶段恢复机制;在 KITTI 行人实验中,线性融合因视觉噪声反而降级,级联匹配能减少 ID 切换并恢复遮挡轨迹,轻量 CNN/MGN 比重型 Transformer 更适合实时延迟约束。

DualGate-Net: A Prior-Gated Dual-Encoder Framework for Histopathology Cell Detection Figure 1
2026-06-08cs.CV

DualGate-Net: A Prior-Gated Dual-Encoder Framework for Histopathology Cell Detection

Bahman Jafari Tabaghsar, Son Tran, K. Devaraja, Atul Sajjanhar

2026-06-08视觉感知

病理细胞检测中,相似细胞会因组织微环境不同而类别不同,但现有组织先验常以静态拼接融合,易把噪声传入模型。DualGate-Net用ConvNeXtV2局部编码器和SegFormer全局编码器建模细胞形态与组织上下文,并通过可学习先验门控按空间位置调节组织先验影响,辅以前景重建和cellness提示增强定位。在OCELOT上验证/测试macro F1达0.7722/0.7345,并报告BRCA跨数据集分析,显示自适应先验融合有效。

Robotic Policy Adaptation via Weight-Space Meta-Learning Figure 1
2026-06-08cs.RO

Robotic Policy Adaptation via Weight-Space Meta-Learning

Christian Bianchi, Siamak Yousefi, Alessio Sampieri, Andrea Roberti, Luca Rigazio, Fabio Galasso, Luca Franco

University of Verona, ItalAI and Sapeinza University of Rome

2026-06-08机器人强化学习

针对VLA机器人策略迁移到新任务时仍需带动作标注示范和逐任务微调的问题,论文提出WIZARD,将适应视为权重空间推断:由语言指令和短示范视频生成冻结VLA的任务LoRA适配器,无需测试时优化。LIBERO上未见数据集最高约2倍、未见任务最高约14倍提升,真实Franka实验也优于实域适配基线;但对示范质量敏感,长时序组合任务仍受限。

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens Figure 1
2026-06-08cs.CV

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

Xiaocheng Lu, Yuxi Chen, Jie Zhang, Jian Liu, Jingcai Guo, Fangqi Zhu, Tao Han, Song Guo

The Hong Kong University of Science and Technology, The Hong Kong Polytechnic University

2026-06-08视觉感知

针对固定图像 token 预算在简单样本上浪费、复杂样本上不足的问题,AdaTok 将 token 数作为内容条件输出而非手工超参。其关键是把有序前缀表示与分配策略联合设计:用嵌套尾部遮蔽和预算专属 MH-LoRA 保持不同长度可解码,再用确定性组 GRPO 与动态 Pareto 权重一趟选择预算。在 ImageNet-1K 上,自适应版平均约 118 tokens 达到 rFID 1.50,并使自回归生成吞吐较 256-token 固定解码提升约 2.1 倍。

OPTIMUS-Prime: Minimal and Sufficient Concept Explanations for Deep Vision Models Figure 1
2026-06-08cs.CV

OPTIMUS-Prime: Minimal and Sufficient Concept Explanations for Deep Vision Models

Arthur Hoarau, Chenrui Zhu, Vu Linh Nguyen

2026-06-08视觉感知

本文针对视觉模型解释中热力图易懂但缺少形式保证的问题,提出 OPTIMUS-Prime:先在中间层概念空间中用 prime implicant 搜索最小且充分的概念子集,再用 Integrated Gradients 或 DeepLIFT 回传到像素空间生成热图。实验在猫狗鸟分类基准上显示,该方法能更集中呈现与预测相关的概念;但验证场景较窄,跨架构与复杂数据集效果文中未充分说明。

EvoGS: Constructing Continuous-Layered Gaussian Splatting with Evolution Tree for Scalable 3D Streaming Figure 1
2026-06-08cs.CV

EvoGS: Constructing Continuous-Layered Gaussian Splatting with Evolution Tree for Scalable 3D Streaming

Yuang Shi, Simone Gasparini, Géraldine Morin, Wei Tsang Ooi

National University of Singapore, IRIT - University of Toulouse

2026-06-08三维

面向 XR/6DoF 场景中 3D Gaussian Splatting 的渐进传输,论文指出现有离散 LOD 分层因层间无结构关联,会累积几何误差、产生冗余 splat 并导致质量跳变。EvoGS 将 splat 组织为带父子谱系的 Evolution Tree,用类小波的连续细化让子节点修正祖先误差并形成可压缩层间信号。实验称冗余率由超过 65% 降至低于 25%,传输负载和 GPU 显存最高分别降至约 1/2.4 和 1/5.5,同时质量过渡更平滑。

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs Figure 1
2026-06-08cs.CV

Seeing Without Exposing: Adaptive Privacy Control for Open-World, Context-Hungry MLLMs

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

City University of, Research Institute, University

2026-06-08强化学习规划控制

针对 MLLM 输入中敏感信息类型开放、用户意图个性化,而简单打码又会破坏下游视觉推理语境的问题,论文提出免训练的 APD,在多模态潜空间中让隐私区域漂移到语义等价但不泄露的替代内容,同时锚定原图结构与上下文;并构建含 22 类隐私的 AdaptShield 评测。实验在 Qwen 与 InternVL 系列上显示,文本隐私类别平均提升 10.4%,MLLM 评估平均提升 8.5%。

Textual Supervision Enhances Geospatial Representations in Vision-Language Models Figure 1
2026-06-08cs.CV

Textual Supervision Enhances Geospatial Representations in Vision-Language Models

Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon, Luiz Felipe Vecchietti, Bryan Nathanael Wijaya, Cheng Yaw Low, Virgilio Almeida, Meeyoung Cha

2026-06-08视觉语言视觉感知

本文关注视觉模型是否在无显式地理监督下内化地球位置知识,以解释图像定位与空间推理中的区域偏差。作者用逐层线性探针从 ViT、CLIP 与 LLaVA/Qwen/Gemma 等表征中回归经纬度,并按可定位性类别分析。结果显示,文本监督和多模态训练显著增强地理结构:纯视觉模型主要在末层较强,VLM 的地理信息集中于语言模块早层;提示可将其传播到后层,且约 40% 维度已接近最佳预测表现。

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing Figure 1
2026-06-08cs.CV

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

2026-06-08视觉感知

本文关注云端 MLLM 图像编辑中的隐私盲点:替换敏感区域生成 surrogate 虽能保护输入,却常只得到“被编辑的替身”,难以还原到原图。作者提出面向恢复的 SPPE 基准,覆盖36类隐私与65种指令,并拆分为编辑可行性评估和 surrogate-to-source 恢复两任务;相应提出 ERMA 与 C2E-S2SER。实验显示 ERMA 在 SRCC/PLCC 上较最佳基线提升13.9%/12.3%,恢复模型在 SPPE 的8项完整性与编辑一致性指标上均优于 SOER。

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance Figure 1
2026-06-08cs.CV

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

Duc Tri Tran, Trung Thanh Nguyen, Vijay John, Phi Le Nguyen, Yasutomo Kawanishi

Hanoi University of Science and Technology, Vietnam, Nagoya University, Japan, Lawrence Technological University, USA, Ritsumeikan University, Japan

2026-06-08视觉感知规划控制

针对城市场景视频文本识别中运动模糊、遮挡和尺度变化导致逐帧结果不稳定的问题,TraRA将识别从单帧提升到文本轨迹层面:先用时序聚类修复噪声轨迹,再用LoRA增强的视觉语言模型聚合多帧视觉线索与语言上下文。作者在RoadText、BOVText、ArTVideo和ICDAR15上验证,其可作为即插即用模块提升现有VTS方法的跟踪与识别表现。

Consistent-Inversion: Reverse Consistency Guidance for Structure-Preserving Visual Editing Figure 1
2026-06-08cs.CV

Consistent-Inversion: Reverse Consistency Guidance for Structure-Preserving Visual Editing

Xiaocheng Lu, Jingcai Guo, Song Guo

2026-06-08视觉感知

本文针对反演式扩散编辑中“源图重建轨迹”和“目标编辑轨迹”共用噪声潜变量导致的结构漂移或过度保真问题,提出 Consistent-Inversion:在早期去噪步将目标中间状态按源提示反向检查其能否回到源反演轨迹,并用差异作为一致性校正信号。该方法无需训练、可接入现有编辑器;PIE-Bench 与 SD/SD3.5 实验显示其提升背景和结构保真,同时基本保持文本编辑对齐,代价较小。

Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment Figure 1
2026-06-08cs.CV

Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment

Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi

Kuaishou GameMind Lab

2026-06-08三维

面向室内三维场景生成中由2D中间表示带来的几何畸变、纹理退化和多视角不一致问题,Native3D直接在3D网格与纹理上端到端建模,用Transformer场景编码器和DiT学习联合潜空间,并以3D REPA Loss对齐场景级与对象级语义特征。实验称其在生成质量、几何/纹理保真度和文本驱动编辑灵活性上优于现有方法。

3DMorph: Single-Image-Guided Local 3D Shape Editing and Morphing Figure 1
2026-06-08cs.CV

3DMorph: Single-Image-Guided Local 3D Shape Editing and Morphing

Tobias Preintner, Yunfei Deng, Phillip Müller, Sebastian Illing, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

2026-06-08视觉感知三维

针对工程/设计中静态网格缺少参数化结构、局部几何修改常需重建全流程的问题,3DMorph提出免训练的单图引导编辑框架:用户只需编辑一个渲染视图,系统自动估计3D编辑区域,将2D形状变化映射回网格,并保持未编辑部分,还可生成局部形变中间态。论文同时构建含真值编辑的Delta3D基准,实验显示其在几何局部编辑质量上优于现有生成与编辑方法。

GP-Adapter: Gaussian Process CLIP-Adapter for Few-Shot Out-of-Distribution Detection Figure 1
2026-06-08cs.CV

GP-Adapter: Gaussian Process CLIP-Adapter for Few-Shot Out-of-Distribution Detection

Taisei Saito, Koretaka Ogata, Takafumi Hiroi

2026-06-08视觉感知三维

这篇论文关注少样本和分布偏移下 CLIP 置信度过于确定、难以可靠拒识的问题。GP-Adapter 在冻结 CLIP 图像与文本嵌入上为每类构建单类高斯过程,用预测均值和方差形成不确定性感知的 OOD 分数,避免反向微调且缓存开销随类别和 shot 数可控。ImageNet 与多组 OOD 实验显示其少样本分类具竞争力,并能与 CoOp/LoCoOp 等提示学习方法互补提升 OOD 检测。

LARA: Latent Action Representation Alignment for Vision-Language-Action Models Figure 1
2026-06-08cs.CV

LARA: Latent Action Representation Alignment for Vision-Language-Action Models

Mengya Liu, Baoxiong Jia, Jiangyong Huang, Jingze Zhang, Siyuan Huang

2026-06-08视觉语言视觉感知

机器人 VLA 受限于昂贵稀缺的带动作标注数据,而人类视频虽丰富却缺少可直接迁移的动作标签。LARA 的核心是让潜在动作模型 LAM 与扩散式 VLA 不再分阶段冻结使用,而通过潜在动作表示对齐共同优化:真实动作轨迹约束 LAM,LAM 的前向动力学又正则化 VLA。实验覆盖 3 个仿真和 1 个真实操作基准,作为完整训练、后训练增强和 LAM 精炼分别带来约 10%、5%、15% 平均提升。

Detecting Temporally Localized Manipulations in Authentic Video Streams Figure 1
2026-06-08cs.CV

Detecting Temporally Localized Manipulations in Authentic Video Streams

Okan Umur, Ali Emre Güşlü, Ibrahim Delibasoglu

2026-06-08机器人视觉感知

现有视频伪造数据多聚焦整段篡改、换脸或目标移除,难覆盖真实视频中仅插入短时高逼真片段的场景。本文据此整理相关数据集缺口,构建部分篡改测试集,并以 DINOv3 特征上的线性探针和相邻帧余弦相似度异常检测建立基线;无监督方法报告 83% precision、真实流视频级准确率 95%,但阈值依赖明显,需内容自适应机制。

An Adaptive Data cleaning Framework for Noisy Label Detection Figure 1
2026-06-08cs.CV

An Adaptive Data cleaning Framework for Noisy Label Detection

Chen-Hsuan Fang, Wei-Hsinag Chen, Pin-Hsuan Yu, Jung-Hua Wang, Tsung-Wei Pan

Noisy-Label Detection, Department of Electrical Eng. National Taiwan Ocean University, Keelung City 20224, Taiwan, AI Research Center, National Taiwan Ocean University, Keelung City 20224, Taiwan, Industrial Technology Research Institute (ITRI), Hsinchu, 310401, Taiwan, vision tasks owing to large-scale annotated datasets. In real-world applications, however, labels are corrupted, memorize these noisy labels during training, resulting in degradation of model accuracy and generalization., data-cleaning framework that integrates local, global, and learning dynamics cues for robust noisy-label, ImageNet-100 with 5% to 40% symmetric label noise show high recall in most settings, including near-, label detection, INDEX TERMS: Noisy-label detection, Label noise, machine learning tasks, largely owing to the availability of

2026-06-08视觉感知

针对真实视觉数据中人工标注错误会被过参数化模型记忆、且现有清洗方法依赖阈值或噪声率先验的问题,本文提出自适应多指标标签噪声检测框架,将KNN局部不一致、k-means全局中心距离与EL2N学习动态拼接后用多维GMM自动划分干净/噪声样本。在CIFAR-10、MNIST和ImageNet-100的5%–40%对称噪声实验中,多数设置取得高召回,ImageNet-100 40%噪声下召回≥98%,并在多项重训练中提升精度。

AsyncPatch Diffusion: spatially-flexible image generation Figure 1
2026-06-08cs.CV

AsyncPatch Diffusion: spatially-flexible image generation

Samuele Papa, Valentin De Bortoli, Guillaume Couairon, Daniel Sýkora, Romuald Elie, Klaus Greff

2026-06-08视觉感知生成模型

标准扩散把整幅图绑定到同一噪声时间,限制了局部区域按需生成。AsyncPatch 将联合扩散推进到像素/潜变量 token 级异步噪声,给出该过程的有效 ELBO,并用受控时间采样缓解训练与推理路径不匹配;模型在 ImageNet 256、LSUN 上保持接近常规扩散的生成质量,同时无需专项微调即可做修复,并在纹理合成、输入引导、自适应加速和自回归采样中展示优势。

Beyond Universality: The GCC-FER Dataset and Culture-Aware Adaptation for Dynamic Facial Expression Recognition Figure 1
2026-06-08eess.IV

Beyond Universality: The GCC-FER Dataset and Culture-Aware Adaptation for Dynamic Facial Expression Recognition

Sonalika Singh, Jyotirindra Dandapat, Avishi Razdan, Kshipra V. Moghe, Puneet Gupta, Lalan Kumar

Sonalika Singh, Jyotirindra Dandapat, and Lalan Kumar are with the Department of Electrical Engineering, Indian Institute of Technology Delhi, India., Puneet Gupta is with the Department of Computer Science and Engineering, Indian Institute of Technology Indore, India., Avishi Razdan and Kshipra V. Moghe are with the Department of Psychology, COEP Technological University, India.

2026-06-08视觉感知数据集/基准

针对现有动态表情识别默认“表情跨文化通用”、在欠代表人群上易失效的问题,论文构建含非洲、白人、东亚、南亚四类文化群体的 GCC-FER 视频基准,并提出利用文化先验重校准潜在表征的 CA-FER。实验显示该数据集更能暴露跨文化性能差异,CA-FER 在 GCC-FER 与 DFEW 的多文化设置中稳定提升识别表现。

Constructing VAE Latent Spaces with Prescribed Topology Figure 1
2026-06-08cs.LG

Constructing VAE Latent Spaces with Prescribed Topology

Jilles S. van Hulst, Jakub M. Tomczak, W.P.M.H. Heemels, Duarte J. Antunes

2026-06-08生成模型

本文针对标准 VAE 高斯潜变量与周期、边界或商空间等非欧拓扑数据不匹配的问题,提出按圆、区间、直线等因子及有限群商空间构造潜空间的框架,并给出可重参数化分布、闭式解耦 KL、群不变解码特征与锚点约束。实验在圆柱、环面、莫比乌斯带及旋转/平移 MNIST 上显示,拓扑匹配先验在实用正则强度下优于高斯基线。

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation Figure 1
2026-06-08cs.CV

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

Dian Gu, Zhengyi Yang

Institute of Automation, Chinese Academy of Sciences

2026-06-08视觉感知生成模型三维

TrioPose针对多人姿态引导文生图中肢体畸变、遮挡下特征串扰,以及传统UNet适配器难以迁移到MM-DiT的问题,基于SD3.5M将姿态作为独立模态引入三流TSPA-DiT,并用零初始化双残差注入、可学习关系偏置掩码和姿态加权损失稳定约束几何结构。实验在Human-Art、CrowdPose、OCHuman上达到SOTA,其中Human-Art AP为64.33,较前作提升约30%。

STREAM: Stochastic Riemannian Flow Matching with Anisotropic Decoder for Digital Histopathology Image Generation Figure 1
2026-06-08cs.CV

STREAM: Stochastic Riemannian Flow Matching with Anisotropic Decoder for Digital Histopathology Image Generation

Won June Cho, Daeky Jeong, Hyeongyeol Lim, Hongjun Yoon

DEEPNOID Inc.

2026-06-08视觉感知生成模型

本文针对病理图像生成中 VAE 潜空间语义不足、依赖 VFM 条件导致“条件坍缩”和无条件生成受限的问题,提出将病理 VFM 的球面 patch-token 特征直接作为潜空间,并用随机黎曼流匹配与各向异性解码器适配其几何结构。在乳腺癌和结直肠癌数据上,STREAM 在生成 FID、病理感知分布指标及部分重建指标上优于 ZoomLDM、PixCell 等基线,但训练规模较大,部分增益可能来自 scaling / data。

ForensicConcept: Transferable Forensic Concepts for AIGI Detection Figure 1
2026-06-08cs.CV

ForensicConcept: Transferable Forensic Concepts for AIGI Detection

Menyanshu Zhou, Ziyin Zhou, Ke Sun, Yunpeng Luo, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

2026-06-08视觉感知

针对现有 AIGI 检测器在未见生成器上泛化差且证据黑箱的问题,论文提出 ForensicConcept:用 Transformer 归因定位关键图像块,聚类成可审计的“取证概念”码本,并借助 CleanDIFT 扩散特征与 CKNNA 衡量其是否对齐生成痕迹,再将扩散概念注入目标骨干。实验在 GenImage、GAN-family、Chameleon 上分别达到 92.0%、90.1%、84.4% 准确率,并显示 CKNNA 可预测概念迁移效果。

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization Figure 1
2026-06-08cs.AI

Hierarchical Semantic-Constrained Heterogeneous Graph for Audio-Visual Event Localization

Zhe Yang, Ruyi Zhang, Hongtao Chen, Wenrui Li, Hengyu Man, Wangmeng Zuo, Xiaopeng Fan

2026-06-08视觉感知

本文针对开放词汇音视频事件定位中未见类别缺少监督、音画不同步以及片段级与视频级语义不一致的问题,提出 HSCHG:先在欧氏空间构建含音频/视觉片段节点和视频节点的层次异构图,用多向时序边、跨模态边和双阈值门控融合抑制错误对齐;再将多层表示与文本原型映射到双曲空间,通过层次蕴含正则刻画视频—片段关系。实验显示其在 OV-AVEBench 上的识别与定位均优于已有方法,消融验证了各模块作用。

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets Figure 1
2026-06-08cs.CV

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

2026-06-08视觉感知数据集/基准三维

本文针对零样本组合图像检索中测试集被 CLIP 预训练见过、参考/目标图像语义不一致导致评估虚高的问题,提出 ZeroSight:用 2022 年后公开视频抽帧构造一致图像对,并以 LLM 生成相对描述,含多正例与硬负例评测;同时给出免训练的 SC4CIR 一致性筛选方法。对 27 种方法的实验显示,既有基准显著高估能力,SC4CIR 可作为插件提升检索表现,LLM 类方法平均提升约 9.12%。

GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding Figure 1
2026-06-08cs.CV

GuideCAD: A Lightweight Multimodal Framework for 3D CAD Model Generation via Prefix Embedding

Minseong Kim, Jinyeong Park, Sungho Park, Jibum Kim

Convergence Research Center for Insect Vectors, Department of Computer Science and Engineering, Incheon National University, Center for Brain-Machine Interface

2026-06-08视觉语言三维

针对多模态 3D CAD 生成依赖全量微调、训练成本高的问题,GuideCAD 将图像编码经映射网络转为 prefix embedding,冻结预训练视觉模型与语言模型,仅训练少量参数并由 Transformer 解码施工序列。作者还构建图文配对的 GuideCAD 数据集;实验显示其质量接近微调方法,参数约少 4 倍、训练效率约提升 2 倍。

An Integrated Roadside Sensing and Communication Framework for Vulnerable Road User Safety at Signalized Intersections Figure 1
2026-06-08stat.AP

An Integrated Roadside Sensing and Communication Framework for Vulnerable Road User Safety at Signalized Intersections

Parvez Anowar

PhD Student, Department of Civil, Environmental and Construction Engineering, University of Central

2026-06-08安全鲁棒

针对信号交叉口中行人、骑行者等弱势道路使用者易受遮挡且单车/单传感器预警不足的问题,论文提出把路侧 LiDAR、雷达、RGB/热成像、边缘近失分析、V2X/P2X 通信和自适应信号控制集成到同一路口框架。基于 R-LiViT 的 5.3 万标注分析显示,VRU 占约 49%,夜间密度下降但近距离风险占比更高,地点间冲突密度差异近 10 倍,支持多模态与场景化部署。

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding Figure 1
2026-06-08cs.CV

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu

2026-06-08视觉感知

论文针对在线 Video-LLM 生成回答时暂停视频感知、导致直播理解卡顿的问题,提出 SVLS 范式与 LyraV 控制层:用 FDTC 在逐帧输入下判定继续说、重启回答或静默,用 SToP 按视觉节奏和时延预算调节每帧输出 token 数。实验覆盖 5 个在线和 3 个离线基准,显示其基本保留骨干理解能力,并将视频同步率提升到 98.29%、实时速度达 3.89 FPS。

DaX: Learning General Pathology Representations Across Scales Figure 1
2026-06-08eess.IV

DaX: Learning General Pathology Representations Across Scales

Bokai Zhao, Yiyang Zhang, Long Bai, Tai Ma, Hanqing Chao, Minfeng Xu

DAMO Academy, Alibaba Group, Institute of Automation, Chinese Academy of Sciences 3Hupan Lab, page can be accessed at https://alibaba-damo-academy.github.io/DaX/benchboard/.

2026-06-08视觉感知

病理全切片理解需要同时建模细胞细节与组织结构,并应对倍率、染色、扫描和输入尺寸差异;DaX以DINOv3初始化的ViT-L为骨干,通过连续倍率训练、跨尺度自监督、多输入尺寸与Gram一致性学习统一这些需求。在44个公开数据集161项任务的患者级交叉验证中,DaX在诊断、分子、预后和样本来源任务上表现稳定,但具体增益中数据规模与训练策略的相对贡献仍需进一步拆分。

CL-CLIP: CLIP-Based Continual Learning Framework with Cost-Volume Category Decoupling for Object Detection Figure 1
2026-06-08cs.CV

CL-CLIP: CLIP-Based Continual Learning Framework with Cost-Volume Category Decoupling for Object Detection

Zihan Liu, Yuguang Yang, Shengjie Su, Jianing Pang, Linlin Yang, Chunyu Xie, Nikolai Yu. Zolotykh, Baochang Zhang

National College for Excellent Engineers, Beihang University, School of Electronic Information Engineering, Beihang University, School of Cyber Science and Technology, Beihang University, School of Computer Science and Engineering, Beihang University, State Key Laboratory of Media Convergence and Communication, Communication University of China, Institute of Information Technology, Mathematics and Mechanics, Lobachebsky University, School of Artificial Intelligence, Beihang University

2026-06-08视觉感知

该文关注 CLIP 开放词汇检测器在持续学习中一经微调新类就遗忘旧类的问题。CL-CLIP 的关键思路是用冻结 CLIP 的图文相似度 cost volume 作为类别级空间先验,将共享 RoI 特征路由到按类解耦的多专家检测头,并配合漂移正则降低新旧类干扰。作者在 PASCAL VOC 与 MS-COCO 上显示其相对 F-ViT 持续微调显著提升,并与现有持续目标检测方法具有竞争力,但专家数随类别线性增长。

From Vision to Text: A Compact Multimodal Approach for Robust, Cross-Domain Presentation Attack Detection on ID Cards Figure 1
2026-06-08cs.CV

From Vision to Text: A Compact Multimodal Approach for Robust, Cross-Domain Presentation Attack Detection on ID Cards

Qingwen Zeng, Juan E. Tapia, Sneha Das, Christoph Busch

2026-06-08视觉语言视觉感知安全鲁棒

该文针对远程开户中 ID 卡 PAD 受隐私与国家域偏移限制、难以跨数据集泛化的问题,改造紧凑 SmolVLM2 多模态框架,将图像与文本线索结合,并加入生成式与判别式结构,对真实身份证和合成护照的五国数据做交叉评测。结果显示,多模态模型经监督微调后泛化较好,但零样本表现失败;可靠性可能主要来自模型容量与真实数据,现有合成数据作为基准的代表性不足。

MVSegNet: A Lightweight Boundary-Aware Network for Fetal Lateral Ventricle Segmentation and Atrial Width Estimation in Prenatal Ultrasound Figure 1
2026-06-08cs.CV

MVSegNet: A Lightweight Boundary-Aware Network for Fetal Lateral Ventricle Segmentation and Atrial Width Estimation in Prenatal Ultrasound

Arafat Hossain Sayem

Department of Computer Science & Engineering, Stamford University Bangladesh, Dhaka 1217, Bangladesh

2026-06-08视觉感知学习理论

针对产前超声中胎儿侧脑室边界受散斑、阴影和低对比度影响而导致房宽测量不稳定的问题,论文提出轻量级 MVSegNet:以 MobileNetV3-Small 编码器结合多尺度注意、跳连注意、孕周 FiLM 条件化和边界细化模块来强化轮廓。其在 584 帧专家标注数据上优于 6 个基线,Dice 80.79%、IoU 68.47%、Hausdorff 4.07 mm、房宽 MAE 3.40 mm,且仅 2.31M 参数、T4 上 165.6 FPS。

When is 3D Worth It? A Resource-Performance Frontier for CNNs and Transformers in Lung CT Figure 1
2026-06-08cs.CV

When is 3D Worth It? A Resource-Performance Frontier for CNNs and Transformers in Lung CT

Md Enamul Hoq, Sharafat Hossain, Imraul Emmaka, Linda Larson-Prior, Lawrence Tarbox, Jonathan Bona, Donald Johann Jr.and Fred Prior

Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Department of Information Science, University of Arkansas at Little Rock, Department of Neuroscience

2026-06-08三维

这篇论文针对肺部 CT 中“3D 是否值得额外算力”的常见假设,在固定训练协议下比较 2D、2.5D、3D 输入对 CNN 与 ViT 的影响,并把重点放在资源—性能边界和失败模式而非新架构。结果显示,2.5D CNN 在 NLST 上取得最高 ROC-AUC 0.682、PR-AUC 0.158,且稳定性较好;3D CNN 阈值不稳,ViT 常出现全阳性或零敏感度等退化预测,说明在类别不平衡的小规模筛查任务中,完整 3D 的收益并不明确。

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models Figure 1
2026-06-08cs.CV

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

Sunoh Kim, Daeho Um

code is available at https://github.com/, Dankook University, Yongin, South Korea 2University of, ence without labeled data (Zhang et al., 2022

2026-06-08视觉语言视觉感知安全鲁棒

针对 CLIP 等视觉语言模型在对抗扰动下脆弱、现有测试时自适应依赖大量增强视图而推理过慢的问题,SS-TPT 的核心洞察是少量视图场景下应评估“视图质量”而非默认等权使用。方法用预测稳定性和特征空间密度衡量可信视图,并据此设计一致性损失与加权预测,抑制异常视图。实验显示其在多数据集、攻击和视图数量下取得更好的鲁棒性—吞吐折中,如 15 视图下较 R-TPT 更快且鲁棒性更高。

When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness Figure 1
2026-06-08cs.CV

When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness

Sunoh Kim, Daeho Um

Dankook University, University of Seoul, sign. Our code is available at https://github.com/, hance robustness, they rely on task-specific labeled data, limiting their scalability. To preserve the zero-shot flexi-, requiring labels or retraining.

2026-06-08安全鲁棒

针对 CLIP 零样本识别在测试时易受强对抗扰动影响、现有 TTC 依赖已污染原视图且硬门控难以按攻击强度自适应的问题,论文提出 MAC:用多视图增强提供更稳健的反向扰动引导,并以估计的 corruption degree 对各视图软加权调节反击强度。20 个数据集和多种攻击下,MAC 相比 TTC 显著提升鲁棒性,同时保持免调参、约 0.08 秒/图和较低显存开销。

SVHighlights: Towards Extremely Long Sport Video Highlight Detection Figure 1
2026-06-08cs.CV

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

Donggyu Lee, Youngbin Ki, Jeonghun Kang, Taehwan Kim

Ulsan National Institute of Science and Technology, Ulsan National Institute of Science and Technology Ulsan Republic of Korea

2026-06-08视觉感知

针对现有高光检测多限于几分钟短视频、缺少小时级评测的问题,论文构建 SVHighlights:用完整体育赛事与官方高光视频自动对齐生成标签,覆盖 320 个视频、总计 640 小时。其无训练基线 TF-SELECTOR 按语义合并镜头成片段,并结合字幕、视觉描述和音量由 LLM 打分;相比 VTG 微调基线在 HIT@1、HIT@K、IoU 上分别提升 3.12、4.06、2.95。

DRIFT: From Robustness Gaps to Invariance Manifolds for AI-Generated Image Detection Figure 1
2026-06-08cs.CV

DRIFT: From Robustness Gaps to Invariance Manifolds for AI-Generated Image Detection

Abhishek Ameta, Sayan Banerjee, Shreyas Pandith, Harshit, Ankita Chatterjee, Akshay Janardan Bankar, Amit Satish Unde

2026-06-08视觉感知安全鲁棒

针对现有 AI 生成图像检测在未知生成器和扰动选择下鲁棒性不足的问题,DRIFT 将检测重写为仅用真实图像学习“不变性流形”:在冻结视觉基础模型上用轻量投影头分解鲁棒/脆弱子空间,并以排序间隔约束区分物理成像扰动与编辑式变化。推理时通过多尺度 patch 漂移做违例检测和热图定位;实验显示其在开放世界、跨生成器与分辨率场景下优于训练-free 鲁棒性基线。

polyDAG: Polynomial Acyclicity Constraints for Efficient Continuous Causal Discovery in Visual Semantic Graphs Figure 1
2026-06-08cs.CV

polyDAG: Polynomial Acyclicity Constraints for Efficient Continuous Causal Discovery in Visual Semantic Graphs

Wenhao Zhang, Ramin Ramezani, Tao Han, Kai Hwang, Minyi Guo

2026-06-08优化算法

论文关注视觉语义变量因果图学习中,无环约束在连续优化里反复计算、成为 NOTEARS 类方法瓶颈的问题。核心做法是用有限多项式迹约束替代矩阵指数,并给出与无环性等价的证明,再用几何级数形式减少显式求和。实验在合成图和 CelebA 属性上显示,polyDAG-Geo 相比指数基线降低平均 SHD、提升 F1,并带来约 14–33% 运行时间节省;但结构增益更多来自优化动态,因果语义解释仍需谨慎。

ActionMap: Robot Policy Learning via Voxel Action Heatmap Figure 1
2026-06-08cs.RO

ActionMap: Robot Policy Learning via Voxel Action Heatmap

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

Show Lab, National University of Singapore

2026-06-08机器人强化学习

论文指出当前 VLA 多把动作解码成单点连续值,忽略相邻动作的几何结构,影响数据效率与精度。ActionMap 将动作头替换为平移、旋转和夹爪的体素概率热图,用高斯软标签训练并从分布解码连续动作。实验显示其可直接接入 OpenVLA-OFT 与 π0.5,在 LIBERO 平均成功率分别提升 8.2% 和 1.6%,低数据下更稳,并在 Franka 实机任务中优于 L1 回归头。

Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy Figure 1
2026-06-08cs.CV

Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy

Yuan Zeng, Yujia Shi, Yuhao Yang, Dongxia Liu, Zongqing Lu, Wenming Yang, Qingmin Liao

Tsinghua University, Harbin Institute of Technology, Pengcheng Laboratory

2026-06-08视觉感知

针对人体图像动画中骨架、DensePose 等中间姿态在遮挡和复杂动作下易出错、且表情表达不足的问题,DirectAnimator改为从驱动视频原始像素学习,并将其整理为姿态、脸部、位置三类驱动线索,通过CueFusion DiT注入去噪过程;Same2X先学同身份再对齐跨身份特征,缓解身份保持与动作跟随的优化冲突。实验显示其在视觉质量、身份一致性和复杂遮挡鲁棒性上达到SOTA,跨身份训练收敛可快6.7倍。

LUCID: Learning Unified Control for Image Deflaring and Exposure Mastery in Nighttime Photography Figure 1
2026-06-08cs.CV

LUCID: Learning Unified Control for Image Deflaring and Exposure Mastery in Nighttime Photography

Tingyu Yang, Yuan Cheng, Xiaoyun Yuan

MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, School of Biomedical Engineering, School of Artificial Intelligence, School of Biomedical Engineering Shanghai Jiao Tong University Shanghai China, School of Artificial Intelligence Shanghai Jiao Tong University Shanghai China, MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science Shanghai Jiao Tong University Shanghai China

2026-06-08视觉感知规划控制

夜景成像中眩光遮挡结构、欠曝光放大噪声,串联去眩光与低光增强易累积伪影。LUCID将问题建模为可连续控制的统一恢复流程:先分离眩光成分提供结构引导,再用扩散先验重建,并通过四模式训练与CFG调节光源、鬼影和曝光。实验显示其在多种真实夜景中优于现有方法,并可由单张图生成伪曝光序列用于HDR重建。

Lighting-Aware Representation Learning under Controllable Lighting Variation Figure 1
2026-06-08cs.CV

Lighting-Aware Representation Learning under Controllable Lighting Variation

Lizhen Zhu, Charantej Reddy Pochimireddy, James Z Wang, Brad Wyble

\addr Department of Informatics and Intelligent Systems, College of Information Sciences and Technology, The Pennsylvania State University, University Park, PA, 16802, USA, \addr Department of Psychology, College of the Liberal Arts

2026-06-08规划控制

论文针对光照变化导致视觉表征分布偏移、传统增强只追求不变性而忽略光照因素的问题,提出受人类视觉启发的 lighting-aware 对比学习:在语义一致性目标外加入光照相关辅助目标,利用可控渲染数据显式学习光照结构。实验在 ImageNet、ExDark 与 PASCAL VOC 分类/检测上优于标准对比学习,架构和训练预算相同,但内部表征如何分离内容与光照文中未充分说明。

Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors Figure 1
2026-06-08cs.CV

Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors

Hanxun Yu, Xuan Qu, Lei Ke, Boqiang Zhang, Yuxin Wang, Jianke Zhu, Dong Yu

2026-06-08视觉语言三维

面向机器人、AR 等需要边看边交互的场景,现有 3D 多模态模型多依赖完整场景或离线视频,难以实时回答。Stream3D-VLM 将“何时回答”建模为自回归 next-token 控制,并用 VSFI 增量注入流式重建的几何先验,配合 GAVC 按 3D 结构压缩视觉 token;同时构建百万级带时间戳 3D QA 和 29 任务基准。实验显示其在在线 3D 理解、推理、定位及部分离线任务上优于开源和闭源基线。

Diagnosing Visual Ignorance in Vision-Language Models Figure 1
2026-06-08cs.CV

Diagnosing Visual Ignorance in Vision-Language Models

Runyu Zhou, Qi Zhang, Qixun Wang, Yisen Wang

Peking University

2026-06-08视觉语言视觉感知

本文关注VLM在视觉问答中“看图不看图”、依赖语言先验仍自信作答的问题。作者从内部机制与外部评测两侧诊断:用反事实层替换和逐层监督MLP探针追踪视觉语义与文本先验竞争,并用逐步高斯模糊衡量答案对视觉破坏的不变性。结果显示,中层常未能有效取回视觉信息,后层还会压制残留视觉信号;在12个基准和3个模型上,约20%–40%样本在严重甚至完全遮蔽后仍可被答对,说明现有评测可能奖励视觉无视。

ARAPDiffusion: ARAP Regularization for Diffusion-Based Deformable Shape Space Learning Figure 1
2026-06-08cs.CV

ARAPDiffusion: ARAP Regularization for Diffusion-Based Deformable Shape Space Learning

Haibo Liu, Jinghan Ke, Haitao Yang, Xiangru Huang, Georgios Pavlakos, Qixing Huang

University of Texas at Austin, Westlake University

2026-06-08生成模型

本文针对可变形三维形状生成在小规模数据下难以学习连续形状空间的问题,提出在潜在扩散训练中交替注入 ARAP 近刚性形变正则:一方面用扩散模型采样分布约束解码器,另一方面用解码器评估的形变质量反过来正则扩散模型。实验在人体、动物等网格与无序点云设置中,显示其在无条件和条件生成、插值质量及分布指标上优于 ARAPReg、GenCorres 等基线。

FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising Figure 1
2026-06-08cs.CV

FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising

Yuan Zeng, Yujia Shi, Zongqing Lu, QingMin Liao

2026-06-08视觉感知

针对人体图像动画依赖大规模训练、资源成本高且泛化受数据偏置限制的问题,FreeAnimate尝试只利用预训练图像扩散模型完成姿态驱动生成。其关键做法是先生成与目标帧对齐的预览帧作为时序和结构先验,再用DDIM反演注意力进行去噪引导,并通过参考锚定自注意力保持身份。实验显示其优于已有免训练方法,部分指标和视觉质量接近训练式SOTA,但复杂背景和手脸细节仍是后续问题。

A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation Figure 1
2026-06-08cs.RO

A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation

Kangjian Zhu, Haobo Jiang, Jianjun Qian, Jin Xie

Nanjing University of Science and Technology, Nanyang Technological University, Nanjing University

2026-06-08三维安全鲁棒

针对单视角 RGB-D 在角落视角下易受遮挡、而传统多视角先重建再抓取耗时且可能损失几何细节的问题,论文提出仅引入一个辅助视角的后融合框架;其关键在于用跨视角自监督对比学习约束点特征的空间一致性与抓取方向可分性,并通过对齐的圆柱局部积分模块融合抓取相关几何。在 GraspNet-1Billion 及真实场景中,该方法相对已有 SOTA 在 Seen/Similar/Novel 划分上均取得 AP 提升。

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows Figure 1
2026-06-08cs.CV

Unified Safe In-context Image Generation in Multimodal Diffusion Transformers via Restricting Unsafe Information Flows

Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

2026-06-08视觉语言视觉感知生成模型安全鲁棒

针对多模态扩散 Transformer 在文生图与图像编辑中仍可由文本或参考图注入 NSFW 等不安全语义的问题,论文从 MM-Attn 信息流分析发现早期通用“语义启动”阶段可定位危险输出 patch,并提出无需训练的 UVR,通过定向注意力调制限制后续有害信息传播。在 FLUX 系列实验中,图像生成和编辑擦除率分别达 91% 与 77%,且画质和编辑保真度下降较小。

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation Figure 1
2026-06-08cs.CV

EgoPressDiff: Multimodal Video Diffusion for Egocentric UV-Domain Hand-Pressure Estimation

Yuan Zeng, Zilue Gao, Yujia Shi, Zongqing Lu, Wenming Yang, QingMin Liao

2026-06-08视觉语言视觉感知生成模型

这篇论文针对第一视角手部接触压力估计中离散分箱带来的量化误差、逐帧预测导致的时序不稳,以及几何先验利用不足等问题,将任务改写为连续UV压力图的视频扩散生成。EgoPressDiff用PoseNet、MANO顶点编码器、深度与RGB特征共同条件化去噪,并通过分布校准空间层对齐多模态特征。在EgoPressure设置上,其Volumetric IoU相对基线提升超过34%,同时降低MAE并保持较高时序一致性。

Multi-FRuGaL: Multimodal Flexible Redundancy-aware Decomposed Gated Learning for Cancer Diagnosis and Prognosis Figure 1
2026-06-08cs.CV

Multi-FRuGaL: Multimodal Flexible Redundancy-aware Decomposed Gated Learning for Cancer Diagnosis and Prognosis

Sanket Kachole, Siddhesh Thakur, Shubham Innani, Sanyukta Adap, Suhang You, Carla Pitarch-Abaigar, Spyridon Bakas

2026-06-08视觉语言三维

临床多模态肿瘤数据常因影像、病理、文本或表格缺失而使常规融合失效。Multi-FRuGaL通过模态编码、共享/特异信号分解、输入条件门控和信息预算正则,动态抑制冗余或噪声模态并利用可用信息。在HANCOCK与HECKTOR头颈癌任务上,生存AUC提升至0.8496、复发AUC至0.8102,HPV预测AUC达0.975,但跨队列泛化与增益来源仍需更多验证。

LRMIL: Efficient Low-Resolution Multiple Instance Learning via High-Resolution Knowledge Distillation for Whole Slide Image Classification Figure 1
2026-06-08cs.CV

LRMIL: Efficient Low-Resolution Multiple Instance Learning via High-Resolution Knowledge Distillation for Whole Slide Image Classification

Yonghan Shin, Won-Ki Jeong

2026-06-08视觉感知

针对全切片病理图像 MIL 依赖大量高分辨率 patch、推理成本高且难以兼顾低倍全局结构的问题,LRMIL 将训练与推理分辨率解耦:先做跨分辨率 patch 表征蒸馏,再用高分辨率 MIL 教师进行切片级蒸馏,使学生仅用低分辨率 patch 推理。多数据集实验显示其优于现有 MIL 方法并显著降低预处理和特征提取开销。

FS-DVS: A Frequency-Selective Dynamic Visual Sensing Paradigm for Enhancing Information Completeness Figure 1
2026-06-08cs.CV

FS-DVS: A Frequency-Selective Dynamic Visual Sensing Paradigm for Enhancing Information Completeness

Feiyu Ji, Xiaokang Yang, Xiaoyun Yuan

2026-06-08视觉感知

针对传统 DVS 逐像素独立触发导致弱结构边缘低于阈值而丢失、事件表示不完整的问题,FS-DVS 在触发前加入可学习空间滤波器,并用可微事件仿真与下游任务端到端优化。论文的关键洞察是滤波器会自发收敛到类似视网膜中心-周边、强调中频的 CSF 形态;在检测、动作识别和分割迁移中提升表现,检测 mAP 最高报告增益 12.3%,且互信息分析显示保留更多有效信息。

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models Figure 1
2026-06-08cs.CV

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

School of Computer Science and Engineering, Beihang University, Beijing Digital Native Digital City Research Center, School of Computer Science, Peking University, School of Artificial Intelligence, Beijing University of Posts and Telecommunications

2026-06-08视觉语言视觉感知生成模型

这篇论文针对视频 VLM 擅长宏观事件理解、却容易忽略细粒度运动变化的问题,提出用视频扩散模型中蕴含的运动先验来监督 VLM 注意力。其核心是无参数的 MHS 与 MTTI,从扩散模型注意力头和文本 token 中筛出运动相关信号,再在 SFT 中做文本到视觉注意力对齐。实验在 MotionBench 与 FAVOR-Bench 上对多种 Qwen2.5-VL、InternVL3 模型带来稳定提升,尤其改善运动类指标。

CFRNet: Cycle-Consistent Fixed-Point Training for Real-Time Blind Face Restoration on Consumer Embedded NPUs Figure 1
2026-06-08cs.CV

CFRNet: Cycle-Consistent Fixed-Point Training for Real-Time Blind Face Restoration on Consumer Embedded NPUs

Fuchen Li, Xinyang Wang, Yahui Zhang, Yuhan Chen, Jiahong Guo, Zhuohan Qin, Wenbo Ma

2026-06-08视觉感知

面向手机、车载等消费级 NPU 上的盲人脸复原,论文针对大模型难量化部署、小 CNN 易过平滑的问题,提出 2.0M 参数 CFRNet,并用循环一致固定点训练让多次迭代成为受约束的粗到细复原而非启发式重复。其在 300 张 FFHQ-256 测试中 k=3 取得 LPIPS 0.250,k=2 的 PSNR/SSIM 最优,INT8 在 Hi3402 上约 23ms/次,可用循环次数调节质量与延迟。

Physics-Driven Semantic Scattering Structure Understanding of Aircraft Target in SAR Images Figure 1
2026-06-08eess.IV

Physics-Driven Semantic Scattering Structure Understanding of Aircraft Target in SAR Images

Yifei Yin, Xiaogang Yu, Hao Shi, Liang Chen, Wei Li

(Corresponding author: Hao Shi, Xiaogang Yu).X. Yu is with the Beijing Institute of Remote Sensing Information, Beijing, China.

2026-06-08视觉感知

针对SAR飞机解译中传统散射中心无序、缺少部件语义且易漏掉弱散射结构的问题,论文提出“语义散射结构理解”范式,并设计S³U-SAR,用语义关键点、可见性属性和刚体拓扑等物理先验构建完整结构表示;同时发布KP-SAR-Aircraft-1.0基准。实验显示其在多基线、跨类别/跨数据集上更稳健,并在航向估计P1°、P5°上较最强基线提升17.07%和19.31%。

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation Figure 1
2026-06-08cs.RO

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

Colab, Colab, Beihang University, National University of Singapore

2026-06-08机器人

该文针对现有 UAV VLN 多为离散/粗动作、VLA 又偏短程原子任务的问题,提出 FLIGHT 长程细粒度导航基准,并用“Pilot Reasoning”显式记录飞行状态与下一子目标;方法上采用低频流式 VLM 负责任务推理、高频扩散动作模型负责连续 6-DoF 控制的异步架构。闭环评测中,FLIGHT VLA 在多阶段完成、子目标遵循和终端控制上优于代表性 VLN/VLA 基线,且其推理 VLM 提升了 UAV 视频推理能力。

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO Figure 1
2026-06-08cs.CV

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

Shanghai Jiao Tong University, S-Lab, Nanyang Technological University, Shanghai AI Laboratory, University of Science and Technology of China, Stanford University, Shanghai Innovation Institute, The Chinese University of Hong Kong, Fudan University

2026-06-08生成模型

本文针对文本到图像 flow 模型中 GRPO 对齐训练与模型当前能力脱节的问题,指出随机选 prompt 和仅用组内相对奖励会带来无效课程与优势估计偏差。AdaGRPO 用历史奖励 EMA 追踪全局能力,在线筛选处于学习边界的中等难度 prompt,并融合组内优势与全局基线优势。实验显示其可插入 Flow-GRPO、DanceGRPO、Flow-CPS 等框架,提升生成质量并稳定训练。

VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation Figure 1
2026-06-08cs.CV

VideoSEG-O3: A Multi-turn Reinforcement Learning Framework for Reasoning Video Object Segmentation

Ming Dai, Sen Yang, Boqiang Duan, Boyuan Tong, Jiedong Zhuang, Wankou Yang, Jingdong Wang

2026-06-08视觉感知强化学习

面向长视频和复杂指代表达中的推理式视频目标分割,本文指出固定采样与一次性推理容易遗漏关键证据,且隐式 [SEG] token 难被强化学习直接按掩码质量优化。VideoSEG-O3 通过多轮时空 CoT 主动选择关键区间/帧,引入 SEG-aware logit calibration 将像素级反馈注入 token 策略,并用解耦思维轨迹与 VTS-CoT 冷启动数据训练;4B 模型在 8 个 RVOS 基准取得领先,LongRVOS、MeViS、ReVOS 分别提升约 6.1%、4.2%、4.0%。

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation Figure 1
2026-06-08cs.CV

Breaking the Lock-in: Diversifying Text-to-Image Generation via Representation Modulation

Dahee Kwon, Haeun Lee, Jaesik Choi

2026-06-08视觉感知

本文针对固定提示下文本到图像模型输出趋同、候选探索受限的问题,指出多样性塌缩并非只来自采样策略,而与 Transformer 中间特征的早期轨迹锁定有关。核心洞察是跨随机种子的零频空间均值(DC)分量会快速收敛,进而限制布局和风格变化;作者提出免训练的 DAVE,在早期推理中轻量衰减该分量。实验显示其在保持提示一致性和图像质量的同时提升多样性,且计算与显存开销显著低于需批量优化或额外采样的方法。

MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models Figure 1
2026-06-08cs.CV

MedSIGHT: Towards Grounded Visual Comprehension in Medical Large Vision-Language Models

Aofei Chang, Le Huang, Alex James Boyd, Parminder Bhatia, Taha Kass-Hout, Fenglong Ma, Cao Xiao

2026-06-08视觉语言视觉感知

针对医学大视觉语言模型难以把诊断语义与像素级证据统一起来的问题,MedSIGHT在输入端引入Region Perceiver提取区域级细粒度表征,在输出端把模态感知区域码本并入LLM词表,使模型可生成可解码为分割掩码的区域 token,并用渐进式训练稳定对齐。文中称其仅用72K多模态指令样本,在多模态医学理解、分割及新DiagSeg grounded诊断分割基准上达到SOTA。

Compute-Optimal Network Design for Echocardiography Myocardial Segmentation and Perfusion Quantification using Neural Scaling Laws Figure 1
2026-06-08eess.IV

Compute-Optimal Network Design for Echocardiography Myocardial Segmentation and Perfusion Quantification using Neural Scaling Laws

Clara Rodrigo González, Matthieu Toulemonde, Lasha Gvinianidze, Cameron A. B. Smith, Oscar Bates, Roxy Senior, Fu Siong Ng, Meng-Xing Tang

Department of Bioengineering, Imperial College London, National Heart and Lung Institute

2026-06-08视觉感知

针对CEUS心肌灌注量化依赖耗时手工分割、且小样本下模型规模难选的问题,论文将神经缩放律用于超声心肌分割,用小数据子集外推不同U-Net规模的全量测试损失,并考察从CAMUS到25例CEUS数据的迁移。结果显示缩放律可指导算力最优选型,CAMUS上以少240倍参数达到SOTA,CEUS灌注参数与资深心脏科医生标注相当,但跨域绝对损失存在偏差。

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception Figure 1
2026-06-08cs.CV

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

Qian Zhang, Michal Golovanevsky, Fulvio Domini, James Tompkin

2026-06-08视觉语言视觉感知

论文以纹理推断表面倾斜这一经典心理物理任务检验VLM是否具备低层几何感知,而非只看高层视觉语言基准。其核心洞察是:模型可能编码了几何信息,却在语言输出端把连续倾斜压成少数锚点。多模型实验显示,零样本和上下文学习几乎不随视场、光学倾斜或曲率变化;监督微调能改善单调性和曲率判断,但离散锚定仍存在。

USU-Corn-WeedDB: A UAV RGB Image Dataset for Multi-Species Weed Detection in Forage Corn Figure 1
2026-06-08cs.CV

USU-Corn-WeedDB: A UAV RGB Image Dataset for Multi-Species Weed Detection in Forage Corn

Utsav Bhandari, Saroj Burlakoti, Rhonda Miller, Sierra Young, Eric Westra, Aaron Etienne

Department of Applied Sciences, Technology, and Education, Utah State University, Logan, UT, USA, Department of Plants, Soils & Climate, Utah State University, Logan, UT, USA, Department of Civil and Environmental Engineering, Utah State University, Logan, UT, USA, scarcity of field-representative training datasets. We present USU-Corn-WeedDB, a publicly available, instances, with the remaining 8,000 tiles retained as an unlabeled pool for semi-supervised experiments., performance relevant to edge-deployed UAV systems. USU-Corn-WeedDB is publicly available at, significant time and expert labor for accurate data annotation. This is especially prevalent in corn fields., consistent labeling standards across thousands of image tiles captured under varying flight altitudes, illumination, and growth stages. Thus, a single field may require months of expert labor to achieve, iteratively generates pseudo-labels for unannotated images using various SSL frameworks. This process, can substantially reduce the annotation burden while still retaining the benefits of label-guided, supervision. The effectiveness of this approach, however, depends on the availability of a paired

2026-06-08视觉感知数据集/基准

面向玉米田杂草检测中真实田间数据和标注稀缺的问题,论文发布 USU-Corn-WeedDB:来自犹他商业饲用玉米田的无人机 RGB 数据集,含 800 张三类杂草框标注图像与 8000 张未标注图像,保留自然类别不均衡以支持监督和半监督研究。作者用多代 YOLO 与 RT-DETR 等 28 个检测器验证,mAP@0.5 为 0.773–0.840,轻量模型也具备边缘部署潜力;但数据仅来自单地单日,跨地域和生长期泛化仍需验证。

MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models Figure 1
2026-06-08cs.CV

MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy

2026-06-08视觉语言视觉感知数据集/基准

针对现有生物医学 VLM 评测数据集覆盖窄、元数据不足且可能与训练数据重叠导致能力被高估的问题,MMBU 构建了覆盖 11 类模态、35 个子模态、410 个数据集和丰富结构化元数据的大规模基准,统一评测开放/封闭分类、定位分类与检测等感知任务。对 15 个开源权重模型和 2 个前沿 VLM 的实验显示,医学适配虽带来有限可测增益,但各模型错误率仍高,尤其在空间定位与跨域泛化上存在明显短板。

S23DR 2026 Winning Solution Figure 1
2026-06-08cs.CV

S23DR 2026 Winning Solution

Jan Skvrna, Miroslav Purkrabek, Lukas Neumann

Visual Recognition Group, Czech Technical University in Prague

2026-06-08三维

本文针对无 RGB、仅有稀疏 SfM 点云、拟合深度和语义分割的建筑三维线框重建难题,将顶点预测建模为条件集合生成:用 Perceiver 风格场景编码器汇聚语义点云,再以 flow-matching DiT 去噪 64 个顶点槽,并通过全局预测、凸包裁剪细化和多样本共识稳定推理。该方案在 S23DR 2026 私榜获第一,HSS 达 0.654,顶点 F1 为 0.791。

RPC-GS: Gaussian Splatting with native RPC Rendering for Satellite Imagery Figure 1
2026-06-08cs.CV

RPC-GS: Gaussian Splatting with native RPC Rendering for Satellite Imagery

Valentin Wagner, Sebastian Bullinger, Christoph Bodensteiner, Michael Arens

Fraunhofer Institute of Optronics, System Technologies and Image Exploitation

2026-06-08视觉感知三维

卫星影像的推扫传感器通常用非线性 RPC 描述,既有 3D Gaussian Splatting 为适配透视/仿射渲染而近似相机,易引入系统几何误差。RPC-GS 将高斯均值与协方差直接经地理坐标变换链和 RPC 投影,并用雅可比协方差传播与基于度量射线的深度排序实现原生渲染。在 DFC2019 和 IARPA2016 上,其平均高程误差较透视/仿射近似分别降低 29.6%/63.8% 与 9.9%/37.9%。

RigPAPR: Rig-Based Animation of Static Neural Point Clouds from a Fixed-Viewpoint Video Figure 1
2026-06-08cs.CV

RigPAPR: Rig-Based Animation of Static Neural Point Clouds from a Fixed-Viewpoint Video

Shichong Peng, Yanshu Zhang, Ke Li

APEX Lab, School of Computing Science, Simon Fraser University

2026-06-08视觉感知三维

该文面向从静态神经点云和单目固定视角驱动视频生成可重摆姿三维资产的问题,动机是现有高斯点在骨骼 LBS 关节处易因固定协方差形状产生裂缝和尖刺。核心洞察是改用无单点形状参数的 PAPR,让像素由变形后邻近点实时插值重组,并结合自动绑定与两阶段优化恢复骨骼、权重和动作。实验显示其在监督视角与强基线接近,在合成新视角较网格和高斯方案提升约 3dB PSNR,并呈现更干净的关节区域。

Adaptive Band Selection for Hyperspectral Classification with Spatially Disjoint Evaluation Figure 1
2026-06-08cs.CV

Adaptive Band Selection for Hyperspectral Classification with Spatially Disjoint Evaluation

Ikram El-Hajri (1), Ouassim Karrakchou (1), Alejandro Mousist (2) ((1) International University of Rabat, Rabat, Morocco, (2) Thales Alenia Space, Spain)

2026-06-08数据集/基准

针对高光谱分类中可微选带对初始化、硬子集提取和预设波段数敏感的问题,论文提出 SGBR-HC:先用训练像素的类别可分性与谱间多样性生成监督谱组排序,再初始化 Hard-Concrete 稀疏门并与分类器联合优化,由正则强度自适应决定约 20 个波段。在 Pavia University 与 Houston 2013 的空间不相交评测中取得最高平均 OA/κ;去掉排序先验显著降点,并显示随机像素划分会把 PU 的 OA 虚高 30.56 个百分点。

JA-SIREN: Deterministic Initialization for Sinusoidal Networks via Spectral Matching Figure 1
2026-06-08cs.CV

JA-SIREN: Deterministic Initialization for Sinusoidal Networks via Spectral Matching

Mohammed Alsakabi, Kejia Hu, John M. Dolan, Ozan K. Tonguz

Department of Electrical and Computer Engineering, College of Engineering, The Robotics Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA

2026-06-08视觉感知

本文针对 SIREN 等正弦隐式神经表示随机初始化导致重建质量和复现实验波动的问题,提出 JA-SIREN:先对目标信号做 DST,再用 Jacobi-Anger 展开和贝塞尔函数为两层正弦 MLP 解析设定权重,使初始频谱匹配信号且无需随机种子。在 Kodak 图像拟合上平均 PSNR 达 67.18 dB,比最佳基线高 21.30 dB,并实现零 run-to-run 方差。

Architecture-Adaptive Uncertainty Fusion for Deepfake Detection Figure 1
2026-06-08cs.CV

Architecture-Adaptive Uncertainty Fusion for Deepfake Detection

Ritesh Sharma, Mohammad Ghasemigol, Yuichi Motai

2026-06-08视觉感知安全鲁棒

论文关注深伪检测在高准确率下仍缺乏可靠“不确定性”这一取证部署痛点,提出后处理的 COF:按架构自适应地融合认知、偶然、校准、保形和分布不确定性,并直接优化其与预测错误的相关性。实验显示 COF 无需改模型、优化约 42 秒,域内略逊于随机森林等非线性方法,但跨 CelebDF 更稳;同时跨数据集相关性普遍崩塌,指出域自适应 UQ 才是关键瓶颈。

Inside the Visual Mind: Neuroscience-Motivated Concept Circuits for Interpreting and Steering Vision Transformers Figure 1
2026-06-08cs.CV

Inside the Visual Mind: Neuroscience-Motivated Concept Circuits for Interpreting and Steering Vision Transformers

Tang Li, Yanlin Chen, Mengmeng Ma, Xi Peng

2026-06-08视觉感知

论文针对 ViT 高准确率背后可能依赖伪相关线索、内部机制难诊断的问题,提出受视觉神经层级启发的 ViSAE 工具箱:用 64K 探针图像和 16K 分层概念训练/解释 SAE,并结合自上而下概念读取与自下而上因果电路追踪。结果显示其概念覆盖效率较 ImageNet 高 20 倍,解释准确率提升 28.7%,在 WaterBirds 上通过概念编辑将最差组准确率提升 48.2%。

From Pixels to Newtons: Predicting In Vivo Joint Contact Forces from Monocular Video Figure 1
2026-06-08cs.CV

From Pixels to Newtons: Predicting In Vivo Joint Contact Forces from Monocular Video

Jessy Lauer

2026-06-08视觉感知

关节接触力对植入物寿命、骨关节炎和康复评估关键,但通常只能靠有创植入物或复杂肌骨模型间接获得。本文用未标定单目视频恢复SMPL运动特征,并以融合体型、关节、活动文本和V-JEPA视频表征的Transformer直接预测髋/膝3D接触力及不确定性。基于OrthoLoad 26名患者、25类活动的留一受试者验证,髋/膝RMSE达0.32/0.23 BW,接近实验室级肌骨仿真,并在独立植入物队列零样本测试中可媲美既有方法。

What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos? Figure 1
2026-06-08cs.RO

What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos?

Richard Li, Aditya Prakash, Andrew Wen, Saurabh Gupta, Yilun Du, Pulkit Agrawal

Massachusetts Institute of Technology, University of Illinois Urbana-Champaign, Harvard University

2026-06-08机器人视觉感知

为缓解机器人操作示教数据稀缺,论文系统考察日常人类视频能否与机器人数据共同训练。作者构建含532段、28小时高质量三角化3D手部标注的TriHands,指出关键瓶颈不仅是手姿质量,还包括自然人类动作与机器人动作的 embodiment gap,并通过图像尺度对齐、token级融合及按具身分离的动作编解码器缓解。六个真实操作任务、3480次rollout显示,低机器人数据下成功率绝对提升约29.7%,且高质量手标注明显优于单目估计。

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies Figure 1
2026-06-08cs.CV

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

2026-06-08三维

本文针对现有物体插入方法多停留在二维修补、难以精确指定三维姿态的问题,提出 DIRECT:先由参考图生成粗三维代理并按用户 6-DoF 姿态渲染为稠密几何条件,再将外观、几何与背景上下文拆分到独立通路注入,以减少条件纠缠;同时构建约 16 万对混合训练数据。实验显示其在姿态可控性、重建质量和身份保持上优于基线。

ErA: Error-Aware Deep Unrolling Network for Single Image Defocus Deblurring Figure 1
2026-06-08eess.IV

ErA: Error-Aware Deep Unrolling Network for Single Image Defocus Deblurring

Tu Vo, Chan Y. Park

KC Machine Learning Lab

2026-06-08视觉感知

针对单幅离焦去模糊中 PSF 空间变化强、传统两阶段估计误差易累积且高斯/圆盘核假设过强的问题,ErA 将紧凑核基与逐像素权重学习结合,并在增广拉格朗日深度展开中加入稀疏误差项,通过闭式更新与 ResUNet 去噪交替校正核估计偏差。实验报告其在 DPDD、RealDOF、RTF 上取得领先 PSNR/SSIM,并在无真值 CUHK 上表现出较好泛化。

Synthetic Benchmarks Overstate Forward-Forward Scaling: Real-Data Limits of Layer-Local Training Figure 1
2026-06-08cs.CV

Synthetic Benchmarks Overstate Forward-Forward Scaling: Real-Data Limits of Layer-Local Training

Yucheng Chen

2026-06-08数据集/基准

本文针对 Forward-Forward 层局部训练是否能在真实视觉规模替代反向传播的问题,提出 DTG-FF,结合动态温度 goodness、解耦归一化与多层特征融合,用作强基线审计。结果显示其虽刷新多项 FF 基准,但在 CIFAR-10/100 仍落后匹配 BP 2.40/5.93 个百分点,ImageNet-100 仅 49.4%;合成任务随类别数增长的优势不能迁移到真实细粒度分类,且内存/吞吐也未优于公平 BP 基线。

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark Figure 1
2026-06-08cs.CV

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

Yida Yin, Harish Krishnakumar, Chung Peng Lee, Boya Zeng, Wenhao Chai, Shengbang Tong, Wenhu Chen, Hu Xu, Xingyu Fu, Gabriel Sarch, Aleksandra Korolova, Zhuang Liu

Princeton University, University of Waterloo 4Meta, FAIR

2026-06-08视觉语言强化学习数据集/基准

WorldBench针对现有多模态评测偏重任务类型、忽视开放世界视觉多样性的问题,改以“视觉概念覆盖”构建基准:用LLM辅助 taxonomy 覆盖7类、2000个概念,采集非典型场景图并人工设计前沿模型会出错的问题。定量嵌入指标和人评均显示其视觉多样性领先;15个MLLM测试中最强仅64.0%,开源最佳56.6%,暴露细粒度感知和无依据推断等短板。

DSU-Net: An Attention-Enhanced Dense Skip U-Net for Breast Lesion Segmentation in Mammographic Images Figure 1
2026-06-08q-bio.QM

DSU-Net: An Attention-Enhanced Dense Skip U-Net for Breast Lesion Segmentation in Mammographic Images

Reza Bozorgpour, Mohammadreza Soltany Sadrabadi

Department of Biomedical Engineering, University of Wisconsin-Milwaukee, Milwaukee, WI, USA, Department of Mechanical Engineering, Northern Arizona University, Flagstaff, AZ, USA, making the process labor-intensive and time-consuming for radiologists. These challenges have motivated

2026-06-08视觉感知

针对乳腺钼靶病灶形态差异大、边界低对比且前景/背景严重不平衡的问题,论文提出 DSU-Net,在 U-Net 中加入瓶颈处密集特征传播与注意力引导跳连,并用 Dice、Focal、BCE 组合损失训练,以减少信息丢失和无关背景传递。在 CBIS-DDSM 验证集上取得 Dice 0.9421、IoU 0.8905、AUC 0.9878,但跨数据集泛化与各模块独立增益仍文中未充分说明。

Attention-Guided Autoencoder Fusion for Insulator Defect Detection Using UAV Transmission-Line Imaging Figure 1
2026-06-08cs.CV

Attention-Guided Autoencoder Fusion for Insulator Defect Detection Using UAV Transmission-Line Imaging

Malak Allam, Khaled Shaban, Ali Hamdi

2026-06-08视觉感知

面向无人机巡检中绝缘子缺陷小、尺度变化大且类别不均衡的问题,论文提出 AE-YOLO:在 FPN-PAN 融合中嵌入轻量自编码器,并结合 CBAM、方差最大化正则、WBF 与置信度增强以保留异常特征。Insulator-Defect 数据集上 EfficientNetV2 版本达 95.10% mAP@0.5、96.40% 精度和 93.80% 召回,较最强 YOLO 基线 mAP 提升 5.0 点。

GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning Figure 1
2026-06-08cs.CV

GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning

Haozhe Chi, Yang Jin, Yadong Mu

Peking University

2026-06-08视觉感知

针对长视频智能体常因稀疏采样丢失细粒度运动、且记忆检索低效的问题,GOPAgen 将视频编码中的 GOP 与运动向量引入理解流程,训练专门的运动 agent,并用结构化局部记忆、运动向量库和 GOP 树式粗到细推理来定位证据。实验显示其在 MotionBench、Egoschema 等 VQA 基准上优于既有方法,同时降低 token 与推理开销。

Advanced Flood Prediction with Physics-Guided Deep Learning: Combining UNet, FNO, and SAR/Optical Imagery Figure 1
2026-06-08eess.IV

Advanced Flood Prediction with Physics-Guided Deep Learning: Combining UNet, FNO, and SAR/Optical Imagery

Tewodros Syum Gebre, Jagrati Talreja, Leila Hashemi-Beni

2026-06-08视觉感知

针对卫星影像难以直接给出应急所需水深、流速且纯数据驱动模型缺乏水动力一致性的问题,本文融合Sentinel-1 SAR、Sentinel-2光学与DEM特征,提出UNet捕捉局部淹没边界、FNO建模流域尺度相互作用,并用浅水方程残差约束质量和动量守恒。实验中洪水范围IoU达0.82、F1为0.90,水深和流速RMSE分别为0.21 m与0.15 m/s,质量不平衡低于2.1%,消融显示物理正则缺失会明显退化。

Applying Deep Learning for cockpit segmentation in the context of mixed reality Figure 1
2026-06-08cs.CV

Applying Deep Learning for cockpit segmentation in the context of mixed reality

Alexandre Leles Sousa, Pedro de Oliveira Nielson, Erick Oliveira Rodrigues, Rafael Francisco dos Santos, Giovani Bernardes Vitor

* Laboratdrio de Robética, sistemas inteligentes e Complezos - RobSIC, “U-net” and “DeepLabV3+" are applied to perform image segmentation. As a result, metrics, The COCO dataset, which is a dataset available for, is “DeepLabV3+”. Finally, all the good results generated, these studies, namely “U-net” and “DeepLabV3+”, in order

2026-06-08视觉感知

为提升矿用 CAT793F 卡车模拟器混合现实训练的沉浸感,论文将座舱与用户手臂等真实前景从第一视角相机画面中分割,以便叠加到虚拟环境。核心工作是面向特定座舱场景实现并比较 U-net 与 DeepLabV3+ 两类语义分割网络,而非通用数据集评测。文中报告分割指标约 90% 准确率并据此选择较优模型,但具体增益来源和实时性细节未充分说明。

A Geometric Gaussian Mixture Representation of Plane Curves Figure 1
2026-06-08cs.CG

A Geometric Gaussian Mixture Representation of Plane Curves

Ali Darijani, Benedikt Stratmann, Jürgen Beyerer

2026-06-08三维

本文针对传统平面曲线表示只给出确定几何、难以直接表达法向不确定性的问题,提出先将曲线离散为带法向标准差的概率多边形段,再用一阶和二阶矩闭式转换为高斯分量并按段长混合成 GMM。该方法避免从点云迭代拟合,保留局部切向、法向和弧长尺度;在多类典型曲线实验中可较好重建全局形状,但结果主要是表示能力展示,实际下游增益文中未充分说明。

Semantic-Structural Alignment for Generative Pictorial Charts Figure 1
2026-06-08cs.GR

Semantic-Structural Alignment for Generative Pictorial Charts

Zhida Sun, Yulin Zhang, Zheng Gu, Min Lu, Bongshin Lee, Daniel Cohen-Or, Hui Huang

ZHIDA SUN, Shenzhen University, China, YULIN ZHANG, Shenzhen University, China, ZHENG GU, Shenzhen University, China, MIN LU, Shenzhen University, China, BONGSHIN LEE, Yonsei University, South Korea, DANIEL COHEN-OR, Shenzhen University, China, HUI HUANG∗, Shenzhen University, China, traditional controllable generation and image editing baselines, providing a, • Human-centered computing →Visualization., Research Center (VCC), College of Computer Science and Software Engineering (CSSE), Shenzhen University, China, Yulin Zhang, VCC, CSSE, Shenzhen University, China

2026-06-08生成模型

论文针对传统图表精确但缺少吸引力、现有图像编辑又难保持数据结构的问题,提出双条件的图形图表生成框架:用文本控制语义对象,用原始统计图作为结构约束,并在多模态 DiT 中加入 Structural/Semantic DIFT 做特征级对齐与外观迁移。实验和用户研究显示,该方法在柱形等多类视觉通道上比 ControlNet、SDEdit 等基线更能兼顾可读的结构一致性与图像表现力。

Real-Time AttentionBender: Granular Interactive Network Bending of Video Diffusion Transformers Figure 1
2026-06-08cs.GR

Real-Time AttentionBender: Granular Interactive Network Bending of Video Diffusion Transformers

Adam Cole, Mick Grierson

University of the Arts London, as independently manipulable surfaces, with targeting down to, this approach by presenting an expressive and controllable inter-

2026-06-08视觉感知生成模型

该文针对视频生成模型仅靠提示词、艺术家难以理解和干预内部过程的问题,提出 Real-Time AttentionBender:在实时 Wan/DayDream Scope 管线中对 DiT 的自注意力、交叉注意力和 FFN 进行逐层、逐扩散步、逐 token/神经元的网络弯折。系统在单张 RTX A6000 Pro 上约 15 FPS,并展示不同层与神经元调制会改变结构和纹理,但正式用户研究和定量可解释性评估文中未充分说明。

2026-06-05

124 篇
PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding Figure 1
2026-06-05cs.CV

PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding

Shaohui Dai, Yansong Qu, You Shen, Shengchuan Zhang, Liujuan Cao

Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University

2026-06-05三维

面向机器人等具身交互,现有3D-MLLM偏重物体级理解,难以定位把手、抽屉等功能部件。PAR3D的核心是把部件建模为依附于宿主物体的层级语义单元,并引入ScenePart合成场景数据、部件感知3D表征学习和层级分割查询生成。实验显示其显著提升部件级问答与指代表达分割,同时保持较强物体级任务表现,但真实扫描域差距仍需验证。

Complexity-Balanced Diffusion Splitting Figure 1
2026-06-05cs.CV

Complexity-Balanced Diffusion Splitting

Noam Issachar, Dani Lischinski, Raanan Fattal

The Hebrew University of Jerusalem

2026-06-05生成模型

论文针对扩散/流匹配模型用单一大网络覆盖全时间轴导致容量分配低效的问题,提出 CBS:用 de Boor 等分复杂度原则按近似负担切分时间,并以 Dirichlet 能量和采样轨迹加速度估计局部复杂度,从而训练多个专门子网络。实验在 SiT、JiT、UNet 等架构上提升生成质量且不增加单步推理开销,SiT-XL 相比朴素切分 FID 最高改善约 35%。

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators Figure 1
2026-06-05cs.CV

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang, Jiangmiao Pang, Xihui Liu

2026-06-05强化学习

这篇论文针对VLM在少量第一视角图像下难以推断未观察布局、保持跨视角一致的问题,提出Astra:让RL训练的Astra-VL主动向经视角一致性调优的Astra-WM世界模拟器请求新视角“想象”证据,并学习何时、向哪里、如何使用。实验显示,Astra-WM使Gemini-3-Flash在MMSI-Bench由45.1升至49.5,完整框架使Qwen3-VL在MMSI-Bench由29.8升至38.8、MindCube由36.8升至42.7。

In-Context Multiple Instance Learning Figure 1
2026-06-05cs.LG

In-Context Multiple Instance Learning

Alexander Möllers, Marvin Sextro, Julius Hense, Gabriel Dernbach, Klaus-Robert Müller

Berlin Institute for the Foundations of Learning and Data, Berlin, Germany, Institute of Pathology, Charité – Universitätsmedizin Berlin, Berlin, Germany, Max-Planck Institute for Informatics, Saarbrücken, Germany, Department of Artificial Intelligence, Korea University, Seoul, Korea

2026-06-05视觉感知

本文针对多实例学习中只有少量袋级标签时,监督聚合器易过拟合或偏置不匹配的问题,提出 ICMIL:用合成袋结构任务预训练 Perceiver 风格的上下文学习器,并混合因子化与联合先验以覆盖不同 MIL 归纳偏置。推理时无需梯度更新即可用少量标注袋预测;在 12 个基准低标签设置下取得最佳平均 AUROC 和排名,但向更大袋、高维特征与多分类扩展仍需验证。

A Vision-language Framework for Comparative Reasoning in Radiology Figure 1
2026-06-05cs.CV

A Vision-language Framework for Comparative Reasoning in Radiology

Tengfei Zhang, Ziheng Zhao, Lisong Dai, Xiaoman Zhang, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Weidi Xie

University of Science and Technology of China, Shanghai Artificial Intelligence Laboratory, School of Artificial Intelligence, Shanghai Jiao Tong University, Department of Radiology, Renmin Hospital of Wuhan University, Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University, Department of Biomedical Informatics, Harvard Medical School

2026-06-05视觉语言视觉感知

针对医学影像AI多按单图解读、难以支持放射科常见的随访比较和相似病例参照问题,本文将比较诊断建模为实体感知的跨图像推理,构建MedReCo-DB,并提出用于可控检索的MedReCo和生成变化描述的MedReCo-VLM。结果显示其在12个内部检索设置Recall@1均最佳,外部检索平均提升6.0个百分点,纵向随访准确率在胸片和CT上分别提升14.5–46.5和13.0–27.9个百分点。

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes Figure 1
2026-06-05cs.CV

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes

Wenbo Li, Xiaoliang Ju, Zipeng Qin, Rongyao Fang, Hongsheng Li

2026-06-05强化学习规划控制

面向具身智能仿真中缺少真实、多房间、可交互家庭场景的问题,HomeWorld将整屋生成拆成可控层级流程:先用30万真实户型和K-D树表示训练LLM生成平面图,再结合图像生成、多视角漫游、VLM递归修正与3D资产替换布置家具和可操作小物体,并补充物理属性。实验和用户研究显示其在布局多样性、3D设计吸引力及定量/定性指标上优于既有方法,但增益可能主要来自scaling / data。

EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models Figure 1
2026-06-05cs.CV

EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

Qiwei Zeng, Hao Wang, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

Jilin University, Changchun, China, School of Computer Science, The University of Sydney, Sydney, NSW, Australia, Institute of Translational Medicine, Shanghai Jiao Tong University, Shanghai, China

2026-06-05视觉语言视觉感知

医学视觉语言模型在全局聚合时容易稀释低对比、稀疏的微小病灶线索,导致漏检。EasyLens的核心思路是不训练原模型,而用病灶—解剖原型库EasyBank对局部patch做病理与正常参照比较,再由EasyTag筛选疑似病灶区域,EasyAmplifier以形态引导残差增强其表示。多数据集和冻结VLM实验显示,该方法提升微小病灶检测与报告生成,并优于需训练的编码器增强基线。

Visual Commonsense Driven Knowledge Refinements for Scene Graph Generation Figure 1
2026-06-05cs.CV

Visual Commonsense Driven Knowledge Refinements for Scene Graph Generation

Maëlic Neau, Salim Baloch, Jakob Suchan, Zoe Falomir, Mehul Bhatt

2026-06-05视觉感知

针对场景图生成在长尾关系和稀疏标注下容易产生违背视觉常识的关系预测,本文提出无需重训、模型无关的后处理框架:从训练数据自动挖掘空间可行性、角色基数和逻辑蕴含等约束,并用声明式常识推理修正排序结果、补全缺失关系。在 PSG、VG150、IndoorVG 及 Motifs、Transformer、REACT++ 上均带来 F1@K 提升,并用约束违反率显示一致性改善。

GMBFormer: An NDVI-Guided Global Memory Bank Transformer for Urban Green-Space Extraction from Ultra-High-Resolution Imagery Figure 1
2026-06-05cs.CV

GMBFormer: An NDVI-Guided Global Memory Bank Transformer for Urban Green-Space Extraction from Ultra-High-Resolution Imagery

Hao Lei, Xi Cheng, Chenlu Shu, Zhiheng Chen, Zhengjie Duan, Haoyu Wang, Zhanfeng Shen

College of Geophysics, Chengdu University of Technology, Chengdu 610059, China

2026-06-05视觉感知

面向超高分辨率城市绿地分割中按块处理导致跨区域相似植被证据难复用、NDVI直接拼接又易扰乱RGB表征的问题,GMBFormer将NDVI解耦为高置信植被原型的写入门控,并用全局记忆库与跨注意力按语义相似性检索原型增强当前块。其在成都自建数据集和两个Potsdam弱标注设置上均优于受控SegFormer-B4,mIoU/mDice分别达到89.25/94.31%、92.17/95.92%和83.72/90.86%。

Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases Them Figure 1
2026-06-05cs.CV

Physics in 2-Steps: Locking Motion Priors Before Visual Refinement Erases Them

Woojung Han, Seil Kang, Youngjun Jun, Min-Hung Chen, Fu-En Yang, Seong Jae Hwang

2026-06-05视觉感知

本文针对图生视频扩散模型视觉质量提升时常产生违背物理的运动这一问题,指出物理先验并非完全缺失,而是在多步去噪中因相位谱侵蚀被抹除:2步结果反而更保留正确运动。作者提出免训练的 PhaseLock,从少步 latent 提取帧间运动增量并在后续去噪中锁定相位结构,在 CogVideoX、Wan 2.1、LTX-Video 等模型上平均提升 Physics-IQ 6.2 分,同时仅带来约 1.06× 时间和 1.02× 显存开销。

Comparison of Deep Learning Frameworks For Rice Disease Mapping From UAV Multispectral Imaging Figure 1
2026-06-05cs.CV

Comparison of Deep Learning Frameworks For Rice Disease Mapping From UAV Multispectral Imaging

Yadav Raj Ghimire, Jagrati Talreja, Tewodros Syum Gebre, Timothy Agboada, Shikha V. Chandel, Leila Hashemi Beni

2026-06-05视觉感知

面向水稻白叶枯病的田间快速制图需求,论文在同一公开 UAV 多光谱 BLB 数据集和统一训练流程下,对 U-Net、U-Net++、DeepLabV3+ 与 SegFormer及 NDVI/NDRE 输入进行受控比较。核心洞察是轻量 CNN 编码器比小数据上的 Transformer 更稳,植被指数只带来小幅稳定增益;U-Net++-EfficientNet-B3 最高 mIoU 达 97.62%,速度与精度最适合部署。

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset Figure 1
2026-06-05cs.CV

StoryVideoQA: Scaling Deep Video Understanding with a Large-Scale, Multi-Genre and Auto-Generated Dataset

Zhengqian Wu, Zhixian Liu, Aodong Chen, Jingyang Zhang, Ruizhe Li, Hanlin Ge, Zhongyuan Wang, Chunxia Xiao, Chao Liang

2026-06-05视觉感知数据集/基准

论文针对现有 VideoQA 在长剧情、多角色关系和因果推理上的退化,提出 StoryMindv2 自动生成深度视频理解数据,并用监督引导与多评审投票提升电影/剧集问答质量;构建 393.2 小时、36.3 万问答的 StoryVideoQA。对 20 个方法评测显示其仍难维持长程角色关联,作者另以 PlotTree 层级剧情结构改进推理。

Efficient Mean Curvature Computation on High-Dimensional Data Manifolds Figure 1
2026-06-05cs.LG

Efficient Mean Curvature Computation on High-Dimensional Data Manifolds

Alexandre L. M. Levada

Federal University of São Carlos

2026-06-05视觉感知

本文针对高维数据流形上逐点平均曲率估计代价过高、难以用于几何感知学习的问题,利用协方差特征向量正交性与迹运算重写原估计式,避免显式构造高维特征矩阵,并结合局部协方差低秩性用截断 SVD 与 Haar 零空间近似替代完整特征分解。实验显示相较原实现约有 50–300 倍加速,精度损失很小,使曲率特征更适合作为机器学习预处理。

RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling Figure 1
2026-06-05cs.CV

RhymeFlow: Training-Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling

Chensheng Dai, Shengjun Zhang, Yifan Li, Zhang Zhang, Zheng Zhu, Yueqi Duan

2026-06-05视觉感知生成模型

RhymeFlow针对DiT视频生成中每帧都完整经历全部去噪步导致的高延迟,提出免训练的异步去噪流调度:先按潜在语义变化选关键帧,仅关键帧密集去噪,非关键帧逐步跳步,并用潜在轨迹投影补齐被跳过状态以维持时序一致。实验称在现有DiT视频模型上相较缓存、稀疏注意等基线同时提升推理速度与视觉质量。

Towards One-to-Many Temporal Grounding Figure 1
2026-06-05cs.CV

Towards One-to-Many Temporal Grounding

Qi Xu, Yue Tan, Shihao Chen, Jiahao Meng, Anna Wang, Shunping Ji, Hao Fei, Jason Li

2026-06-05视觉语言

本文针对传统视频时序定位只找单个片段、难处理同一事件多次出现的问题,提出 One-to-Many Temporal Grounding,并将其建模为多区间生成任务。核心贡献是构建 OMTG Bench 与 5.6 万训练样本,引入 C-Acc、EtF1 等计数敏感指标,并用 SFT+RL 结合时间边界奖励和基于密集字幕 CoT 的完整性奖励优化模型。实验显示其在 OMTG Bench 上 EtF1 达 43.65%,较 Gemini 2.5 Pro 和 Seed-1.8 分别高 15.85% 和 15.61%。

Synthetic Data Generation and Vision-based Wrinkle and Keypoint Detection for Bimanual Cloth Manipulation Figure 1
2026-06-05cs.CV

Synthetic Data Generation and Vision-based Wrinkle and Keypoint Detection for Bimanual Cloth Manipulation

Ariel Herrera, Xueyang Kang, Atal Anil Kumar

Ariel Herrera is with the Department of Engineering, University of Luxembourg, Esch-sur-Alzette, Luxembourg.

2026-06-05机器人视觉感知

面向双臂布料操作中完全折叠、角点被遮挡导致难以选取抓取点的问题,论文构建域随机化 Blender 合成数据管线自动标注关键点,并结合 CNN 角点热图与 YOLOv8-OpenCV 褶皱检测,先沿结构褶皱拉伸、再转入基于角点的熨平。关键点检测在合成测试集上 MPE 为 1.7615±0.7461 像素,且无需微调可迁移到真实织物,较仅依赖角点或轮廓的方法更能处理高遮挡折叠状态。

Geodesic Flow Matching on a Riemannian Degradation Manifold for Blind Image Restoration Figure 1
2026-06-05cs.CV

Geodesic Flow Matching on a Riemannian Degradation Manifold for Blind Image Restoration

Akshay Janardan Bankar, Ankita Chatterjee, Sayan Banerjee, Shreyas Pandith, Kalakonda Sai Shashank, Amit Satish Unde

2026-06-05视觉感知生成模型

针对盲图像复原中退化类型未知、混合退化非线性而传统流匹配常假设欧氏线性插值的问题,本文将退化显式建模为低维黎曼流形上的状态,在Stable Diffusion潜空间与退化流形的乘积空间中做测地流匹配,并用两阶段训练约束切空间动力学。实验称在去模糊和恶劣天气复原等任务上,非欧几何可提升退化表示稳定性与轨迹结构性,双曲几何在严重退化下更有效,同时保持有竞争力的复原质量。

RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning Figure 1
2026-06-05cs.RO

RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning

Ziyang Yu, Xiang Li, Qiong Chang, Jun Miyazaki

School of Computing, Institute of Science Tokyo

2026-06-05视觉感知

论文针对机器人点云管线中 FPS 在大规模 LiDAR/RGB-D 输入下成为主要延迟与显存瓶颈的问题,提出 RadiusFPS:用球形体素建立保守半径界,先剪枝整块无关体素,再用坐标级跳过测试减少残余距离更新,并给出融合体素选择、剪枝和更新的 warp 级 GPU 版本。实验显示 CPU 最高较原始 FPS 加速 186×,GPU 最高降采样延迟较 GPU-FPS 降低 52×,端到端分割最高加速 2.5×,且精度基本相当、显存约为 QuickFPS 一半。

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention Figure 1
2026-06-05cs.CV

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

Giordano Cicchetti, Eleonora Grassucci, Danilo Comminiello

Dept. of Information Engineering, Electronics, and Telecommunications, Sapienza University of Rome, Italy

2026-06-05视觉语言

本文针对多模态 Transformer 中跨注意力多依赖两两点积或拼接、难以显式建模高阶模态关系且随模态数开销上升的问题,提出 VMA:用查询与多模态 key 张成的平行多面体体积来定义注意力分数,并集成到 GRAMformer 以支持任意数量模态交互。实验显示其在多模态任务上较基线更准确且更轻量,但具体增益的任务分布与来源仍需结合完整实验细节判断。

Benchmarking Open-Source Layout Detection Models for Data Snapshot Extraction from Institutional Documents Figure 1
2026-06-05cs.CL

Benchmarking Open-Source Layout Detection Models for Data Snapshot Extraction from Institutional Documents

AJ Carl P. Dy, Aivin V. Solatorio

2026-06-05视觉感知数据集/基准

针对机构报告中大量可复用信息藏在图表而非正文、通用版面分析难以区分“有分析价值”与装饰性元素的问题,论文定义并基准化“数据快照抽取”任务,发布覆盖人道报告、世行论文和项目文件的数据集与评测框架。实验显示,多种开源布局检测模型虽在传统学术基准表现强,但在运营文档上泛化不足,常混淆非分析内容、切碎复合图表并漏掉标题图例等上下文。

SAM-Flow: Source-Anchored Masked Flow for Training-Free Image Editing Figure 1
2026-06-05cs.CV

SAM-Flow: Source-Anchored Masked Flow for Training-Free Image Editing

Haowang Cui, Rui Chen, Tao Luo, Tao Guo, Zheng Qin, Jiaze Wang

2026-06-05视觉感知生成模型

这篇论文针对免训练图像编辑中全局潜变量传输容易把目标语义泄漏到背景的问题,提出 SAM-Flow:先用 scout 图像与词元注意力联合定位可编辑区域,再仅在该区域施加差分 flow,并用动态软掩码把背景锚定回源图轨迹。实验显示其在 FLUX、SD3 等骨干上无需微调即可提升语义编辑准确性和背景保持性。

Symb-xMIL: Symbolic Explanations for Multiple Instance Learning in Digital Pathology Figure 1
2026-06-05cs.CV

Symb-xMIL: Symbolic Explanations for Multiple Instance Learning in Digital Pathology

Yanqing Luo (1 and 2), Julius Hense (1 and 2), Niklas Prenißl (3 and 4), Andreas Mock (5 and 6 and 7), Klaus-Robert Müller (1 and 2 and 8 and 9), Thomas Schnake (10 and 11 and 12), Mina Jamshidi Idaji (1 and 2) ((1) Berlin Institute for the Foundations of Learning and Data, Berlin, Germany, (2) Machine Learning Group, Technische Universität Berlin, (3) Institute of Pathology, Charité Universitätsmedizin, (4) Berlin Institute of Health at Charité -- Universitätsmedizin Berlin, BIH Biomedical Innovation Academy, BIH Charité Digital Clinician Scientist Program, (5) Institute of Pathology, Ludwig Maximilian University of Munich, Munich, (6) Division of Translational Medical Oncology, DKFZ, Heidelberg, NCT Heidelberg, (7) German Cancer Consortium (DKTK), partner site Munich, a partnership between DKFZ and Ludwig-Maximilians-Universität München (LMU), (8) Department of Artificial Intelligence, Korea University, Seoul, Korea, (9) Max-Planck Institute for Informatics, Saarbrücken, (10) Department of Chemistry, Chemical Physics Theory Group, University of Toronto, Canada, (11) Vector Institute for Artificial Intelligence, Toronto, (12) Acceleration Consortium, Canada)

Berlin Institute for the Foundations of Learning and Data, Berlin, Germany, Institute of Pathology, Charité Universitätsmedizin, Berlin, Germany, Berlin Institute of Health at Charité – Universitätsmedizin Berlin, BIH Biomedical Innovation Academy, BIH Charité Digital Clinician Scientist Program, Berlin, Germany, Institute of Pathology, Ludwig Maximilian University of Munich, Munich, Germany, Department of Artificial Intelligence, Korea University, Seoul, Korea, Max-Planck Institute for Informatics, Saarbrücken, Germany, Department of Chemistry, Chemical Physics Theory Group, University of Toronto, Canada, Vector Institute for Artificial Intelligence, Toronto, Canada, Acceleration Consortium, University of Toronto, Canada

2026-06-05视觉感知

针对数字病理中 MIL 模型解释多依赖热图、难以说明不同组织区域证据如何组合的问题,本文提出 Symb-xMIL,将模型行为与 AND/OR/NOT 等人可读逻辑规则对齐,并构建可跨样本比较的符号表示空间。实验显示其在合成 MIL 上能恢复真实规则,在肿瘤检测中暴露隐藏错误,并在 TCGA-HNSCC 的 HPV 预测中进一步细分与生存相关的患者亚群。

DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments Figure 1
2026-06-05cs.CV

DisasterBench: A Multimodal Benchmark for UAV-Based Disaster Response in Complex Environments

Tan Zhang, Quanyou Li, Lu Zhang, Jun Liu, Xiaofeng Zhu, Ping Hu

2026-06-05视觉语言数据集/基准

论文针对灾害响应中无人机低空图像噪声大、遮挡多且现场算力受限的问题,指出现有基准偏重识别/描述,难以评估跨灾前、灾中、灾后的因果、演化和决策推理。作者构建DisasterBench,含5330张真实UAV图像、29300个样本、14类场景和9类任务,并提出2B轻量模型DisasterVL,通过领域指令、CoT对齐和强化学习优化;在21个MLLM对比中优于开源模型,并接近GPT-4o精度且更高效。

SC-MFJ: A Simple Haptic Quality Metric for Medical Image Segmentation Figure 1
2026-06-05cs.CV

SC-MFJ: A Simple Haptic Quality Metric for Medical Image Segmentation

Souraj Adhikary, Negar Chabi, Andre Mastmeyer

Jade University of Applied Sciences

2026-06-05视觉感知

面向手术触觉仿真,论文指出 Dice、HD95 只衡量几何重叠,难以发现分割表面阶梯伪影导致的力反馈突变。作者提出 SC-MFJ,通过在器官表面采样短虚拟触笔轨迹并计算接触力 jerk,低成本评估触觉可用性。胰腺和肝脏实验显示,高斯平滑相对二值输出将 SC-MFJ 分别改善 147 倍和 189 倍,而这些差异在 Dice/HD95 中基本不可见;SDF 回归均值接近但稳定性明显差于高斯平滑。

ActiveMimic: Egocentric Video Pretraining with Active Perception Figure 1
2026-06-05cs.RO

ActiveMimic: Egocentric Video Pretraining with Active Perception

Xingyao Lin, Guojin Zhong, Tianyi Lu, Ziyi Ye, Yichen Zhu, Zuxuan Wu, Yu-Gang Jiang

Fudan University, Shanghai Innovation Institute

2026-06-05视觉感知

该文针对第一视角人类视频预训练虽易扩展却弱于机器人数据的问题,指出关键缺口不是手部伪标签,而是被当作噪声的主动视角移动。ActiveMimic从单目穿戴RGB视频中恢复同步相机与双腕轨迹,构成统一27维动作并联合预训练感知与操作。真实机器人实验显示其优于人类视频基线,接近机器人数据预训练模型,且主动感知能力主要来自预训练。

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models Figure 1
2026-06-05cs.CV

Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models

Liangsheng Liu, Si Chen, Jiamin Wu, Weiwei Feng, Zhixin Cheng, Xiaotian Yin, Wenfei Yang, Tianzhu Zhang

University of Science and Technology of China, National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory, The Chinese University of Hong Kong, Zhejiang University

2026-06-05视觉语言视觉感知

针对 CLIP 等视觉语言模型易受对抗扰动、而训练式防御成本高且可能损害零样本能力的问题,论文发现多种输入变换下,对抗样本特征会沿稳定主方向偏移,且该方向可反向指向正确类中心;据此提出 DBD,在测试时估计 Defense Direction,并用 DB-score 区分样本后进行双流特征重构。15 个细粒度与 ImageNet-OOD 数据集上,DBD 在保持干净精度的同时取得更强鲁棒性,部分对抗精度甚至高于干净精度。

RQUL-UIE: Revitalizing Quality-Unstable Labels for Underwater Image Enhancement via In-Dataset Self-Supervision Figure 1
2026-06-05cs.CV

RQUL-UIE: Revitalizing Quality-Unstable Labels for Underwater Image Enhancement via In-Dataset Self-Supervision

Haochen Hu, Yanrui Bin, Chih-yung Wen, Bing Wang

The Hong Kong Polytechnic University

2026-06-05视觉感知数据集/基准

本文针对水下图像增强中成对训练标签质量不稳定的问题:低质量“增强结果”若直接监督会拖累模型,删除又会损失有限数据。RQUL-UIE用预训练扩散模型的语义嵌入估计标签质量,并将其映射为不同去噪步数进行分级监督,同时加入傅里叶细节修复网络补偿高频纹理。实验在LSUI、EUVP、UIEB及多种无参考指标上显示其平均表现优于现有方法。

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting Figure 1
2026-06-05cs.CV

Adaptive Tokenisation Via Temporal Redundancy Masking And Latent Inpainting

Kevin Dave, Sai Aditya Patkuri, Chhaya Kumar Das, Gouranga Bala, R. Venkatesh Babu, Rajeshkumar SA

2026-06-05视觉感知

本文针对视频 tokeniser 固定预算或现有自适应方法推理开销大的问题,指出冻结连续潜空间中的相邻帧 L1 差异已能反映时间冗余;据此用固定阈值丢弃低变化 latent,并用轻量 LIT 做潜变量补全。TokenBench 与 DAVIS 上在重建质量接近基线的同时,实现内容驱动的 token 分配,相比 ElasticTok-CV 推理快 31×、相比 InfoTok 快约 2×,但无法保证目标码率。

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding Figure 1
2026-06-05cs.RO

AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding

Qize Yu, Jiadi You, Yuran Wang, Jiaqi Liang, Bowen Ping, Yang Tian, Yue Chen, Minghong Cai, Zeying Gong, Ruihai Wu, Yinchuan Li, Junwei Liang, Yingcong Chen

2026-06-05视觉语言视觉感知

论文针对 VLA 中 VLM 语义空间与机器人 3D 控制动作之间的结构错配,提出以 affordance 作为任务导向中间表征,而非直接端到端映射。方法将操作先验拆为 Which2Act 目标物体定位、Where2Act 2D 交互区域预测和 How2Act 3D 几何推理,并结合 MoT 多专家架构、三阶段课程训练及自动标注增强。实验显示其在 LIBERO、CALVIN 和真实场景中取得有竞争力的成功率,并提升泛化、空间鲁棒性与指令对齐。

Computation-Aware Event-to-Frame Reconstruction via Selective Attention Figure 1
2026-06-05cs.CV

Computation-Aware Event-to-Frame Reconstruction via Selective Attention

Jingqian Wu, Yunbo Jia, Edmund Y. Lam

2026-06-05三维

面向事件相机在快速运动、强光照变化和嵌入式部署中的帧重建需求,论文针对现有 E2F 方法质量与计算量难兼顾的问题,提出计算感知的循环编码器—解码器,用 ConvLSTM 做因果时序聚合,并用上一帧强度先验的选择性上下文融合与轻量混合注意力替代重型 Transformer 注意力。实验称在 ECD 等基准上以更小参数量取得有竞争力甚至更优的 SSIM/MSE,但具体增益来源仍需结合完整消融判断。

Diff-CA: Separating Common and Salient Factors with Diffusion Models Figure 1
2026-06-05cs.CV

Diff-CA: Separating Common and Salient Factors with Diffusion Models

Michaël Soumm, Alexandre Fournier Montgieux, Yunlong He, Pietro Gori, Alasdair Newson

2026-06-05生成模型

这篇论文针对传统对比分析依赖 VAE/GAN、重建质量不足导致公共/显著因素难分离的问题,将 CA 引入无文本图像条件扩散模型,在条件 token 上学习公共与显著的加性分解,并给出弱监督下可辨识性论证。实验涵盖人脸、动物和脑 MRI,Diff-CA 在重建质量、显著属性交换成功率及身份/姿态等公共因素保持上明显优于 MM-cVAE、SepVAE 和 DoubleInfoGAN。

Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback Figure 1
2026-06-05cs.CV

Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback

Huaisong Zhang, Hao Yu, Yuxuan Zhang, Jiahe Wang, Xinrui Chen, Haoxiang Cao, Feng Lu, Wendong Zhang, Changqian Yu, Chun Yuan

Tsinghua University, University of British Columbia, Vector Institute, South China Normal University

2026-06-05视觉语言视觉感知

针对文生图模型常出现局部、细微且类型复杂的缺陷,而标量评分或热力图难以绑定位置、类别、原因和重要性的不足,论文提出结构化缺陷定位 SDG,将每个缺陷表示为框、类型、解释与重要性元组,并构建 SDG-30K 与 SDG-Eval;基于 VLM 检测器和 BoxFlow-GRPO,把缺陷转为空间加权奖励。实验显示其结构化定位优于主流闭源 VLM,并能提升扩散模型对齐和局部修复效果。

MS-DKC: A Dataset Knowledge Card Framework for Designing and Adapting Medical Image Segmentation Models Figure 1
2026-06-05cs.CV

MS-DKC: A Dataset Knowledge Card Framework for Designing and Adapting Medical Image Segmentation Models

Tariq M. Khan, Syed Saud Naqvi, Thantrira Porntaveetus, Hamid Alinejad-Rokny, Shahzaib Iqbal, Imran Razzak, Mohammad AU Khan

Center of Excellence in Precision Medicine and Digital Health, Faculty of Dentistry, Chulalongkorn University, Bangkok, Thailand, Department of Computer Engineering, COMSATS University Islamabad, Islamabad, Pakistan, School of Biomedical Engineering, UNSW, Sydney, NSW, Australia, Visiting Scholar (Collaborative Projects), Center of Excellence in Precision Medicine and Digital Health, Chulalongkorn University, Bangkok, Thailand, Department of Computing, Abasyn University Islamabad Campus (AUIC), Islamabad, Pakistan, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates, College of Computer and Information Sciences, prince Sultan University, Riyadh, SAudi Arabia

2026-06-05视觉感知数据集/基准

本文针对医学分割研究常以“更强架构”替代数据需求分析的问题,提出 MS-DKC 数据集知识卡,将成像、形态、标注、上下文和部署风险等描述子映射到失效模式、设计先验与评估指标。实验覆盖 DRIVE、ISIC2018、ACDC:在 DRIVE 上轻量 DKC-TNet-v2 仅 3.5 万参数达 Dice 0.8044,SA-UNetv2-DKC-AmbRef 达 Dice 0.8141;ISIC2018 上经验证约束选择的模型达 Dice 0.8872,显示不同数据集需不同先验和操作点。

HyperVis: Continuous Latent Visual Relational Graphs on the Lorentz Hyperboloid for Compositional Reasoning Figure 1
2026-06-05cs.CV

HyperVis: Continuous Latent Visual Relational Graphs on the Lorentz Hyperboloid for Compositional Reasoning

Moshiur Farazi, Sameera Ramasinghe, Mahbub Ahmed Turza, Shafin Rahman

Data Science and AI, University of Doha for Science and Technology, Qatar, Department of Electrical and Computer Engineering, North South University, Bangladesh

2026-06-05视觉感知

针对 VLM 在物体关系与组合推理上的短板,论文指出直接注入离散场景图文本三元组会与连续视觉特征冲突并降低 GQA。HyperVis 改为从无类别区域提案构造连续视觉关系图,投影到 Lorentz 双曲空间,用 IoA 蕴含锥和角度排斥约束层级关系。实验中其关系损失将 GQA 提升至 61.03%,推理前缀使 SugarCrepe 达 79.94%,且双曲性相对欧氏消融带来主要组合增益。

Knowledge Distillation for Visual Autoregressive Models Figure 1
2026-06-05cs.CV

Knowledge Distillation for Visual Autoregressive Models

Elia Peruzzo, Aritra Bhowmik, Guillaume Sautiere, Yuki M Asano, Amirhossein Habibian

University of Technology Nuremberg, Qualcomm AI Research is an initiative of Qualcomm Technologies, Inc.

2026-06-05视觉感知

本文关注视觉自回归图像生成中小模型压缩难题:长序列解码、空间误差累积和视觉 token 歧义使语言模型中的蒸馏策略难以直接迁移。作者系统比较多种 KD,并提出 VarKD,在带真实前缀的学生 rollout 上蒸馏,用教师置信度重加权/过滤低可靠监督,并在压缩 token 空间降低歧义。ImageNet 上跨 LlamaGen、ARPG 等骨干实验显示其优于标准 KD、SeqKD 和 GKD,且不改变推理解码。

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation Figure 1
2026-06-05cs.AI

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

Haocheng Luo, Jiahui Liu, Ruicheng Zhang, Zhizhou Zhong, Jiaqi Huang, Zunnan Xu, Quan Shi, Jun Zhou, Xiu Li

Tsinghua University, The Hong Kong University of Science and Technology

2026-06-05规划控制

论文针对 VLM 在视觉空间规划中需先从像素恢复状态、再进行多步推理而产生的感知—推理模态鸿沟,提出 MGSD:先用 SFT 冷启动对齐视觉状态表征,再用仅训练期可见的符号状态教师对学生自生成轨迹做 on-policy 蒸馏,推理时仍纯视觉。实验在 FrozenLake、Maze、MiniBehaviour 等任务上使 4B/8B 模型宏平均分别提升 19.3%/18.4%,并缩小与符号输入上界的差距。

VZCrash: A Large-Scale IMU Dataset of Ego-Vehicle Crashes Figure 1
2026-06-05cs.CV

VZCrash: A Large-Scale IMU Dataset of Ego-Vehicle Crashes

Tommaso Bianconcini, Henrique Piñeiro Monteagudo, Aurel Pjetri, Tomaso Trinci, Leonardo Taccari

2026-06-05数据集/基准

针对真实碰撞稀缺、现有视觉或低频 IMU 数据难以支持车载实时碰撞检测的问题,本文发布 VZCrash:覆盖 7.3 万辆商用车、近 19 万事件、3.1 万经人工共识验证碰撞的高频 IMU 数据集,并包含近失、坑洼、挂车对接等难负例。实验比较阈值到深度模型,主要结果显示模型泛化和鲁棒性随训练数据规模显著提升,增益可能主要来自 scaling / data。

FontFusion: Enhancing Generative Text in Diffusion Models with Typographic Conditioning Figure 1
2026-06-05cs.CV

FontFusion: Enhancing Generative Text in Diffusion Models with Typographic Conditioning

Marian Lupascu, Nipun Jindal, Ionut Mironica, Zhaowen Wang

2026-06-05生成模型

该文针对扩散模型生成文字时“字体可控性”和可读性相互牵制的问题,提出可插拔的 FontFusion,为 DiT 注入字体条件而无需重训基座模型。核心是用 DeepFont+DINOv2 双编码器表征字体,并通过字符/词/段落层级 token、位置感知嵌入和多级 token drop 绑定文本、字体与空间区域。实验称其在装饰字体上较单编码器提升 76%,相对无条件模型字体一致性提升约 68–76%。

ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE Figure 1
2026-06-05cs.CV

ReCache: Learning Budget-Aware Caching Schedules for Diffusion Models via REINFORCE

Mishan Aliev, Eva Neudachina, Ilya Bykov, Aleksandr Oganov, Kirill Struminsky, Aibek Alanov, Denis Rakitin

HSE University, Russia

2026-06-05生成模型

扩散模型采样需多步去噪,特征缓存虽能加速,但现有重算时刻多靠均匀或误差阈值,算力预算难直接控制。ReCache将缓存调度建模为预算条件下的强化学习策略,用REINFORCE在不反传完整生成过程、无需标注的情况下选择最关键重算步,并兼容复用与预测式缓存。实验在FLUX、Wan2.1等模型上显示,同等FLOPs下优于手工调度,如FLUX约5.04倍降算时LPIPS较DiCache降31%,Wan2.1约2.6倍加速时LPIPS降65%、VBench升5.6分。

LLM-Conditioned Synthesis of Pathological Gaits via Structured Gait-Language Representations Figure 1
2026-06-05cs.CV

LLM-Conditioned Synthesis of Pathological Gaits via Structured Gait-Language Representations

Mritula Chandrasekaran, Sanket Kachole, Jarik Francik, Dimitrios Makris

2026-06-05视觉感知

针对病理步态数据因隐私、招募和成本而稀缺、通用文本到动作方法又难保留临床判别线索的问题,论文提出LLM条件的3D骨架步态合成框架,引入病理tokeniser并用ROM、站立、步幅、不对称等统计先验约束语言到步态生成。在Jun等数据集上,真实+合成数据使GRU在LOSO下由91.08%升至92.77%,优于MotionGPT和Qwen-5B,但CNN加合成后下降,增益主要限于循环模型。

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing Figure 1
2026-06-05cs.CV

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

Jianzong Wu, Hao Lian, Jiongfan Yang, Dachao Hao, Ye Tian, Yunhai Tong, Jingyuan Zhu, Biaolong Chen, Qiaosong Qi, Aixi Zhang, Wanggui He, Mushui Liu, Jinlong Liu, Hao Jiang

Peking University, Alibaba Group, Project Page: https://msalab-pku.github.io/projects/LoomVideo/index.html, Github: https://github.com/MSALab-PKU/LoomVideo, Model: https://huggingface.co/MSALab/LoomVideo, The demand for versatile and highly controllable video generation and editing is rapidly increasing across diverse

2026-06-05视觉语言视觉感知

针对现有统一视频生成/编辑模型依赖13B级大模型、编辑时拼接源视频token导致注意力开销激增的问题,LoomVideo以5B Wan为底座,引入Qwen3-VL与Deepstack多层注入对齐多模态指令,并用Scale-and-Add将源视频latent直接加到带噪目标latent,实现零额外token编辑;多参考图像通过负时间RoPE区分。实验显示其在多项基准达到SOTA或接近SOTA,电商与服饰场景表现突出,推理相较同类拼接式模型至少快5.41倍。

Texture-preserving implicit neural representation for Cone beam CT truncated reconstruction Figure 1
2026-06-05cs.CV

Texture-preserving implicit neural representation for Cone beam CT truncated reconstruction

Genyuan Zhang, Junyao Wang, Haoran Lan, Chuandong Tan, Songtao Zhu, Fenglin Liu

2026-06-05三维

针对锥束 CT 截断投影会产生环状伪影、限制视野且监督式深度方法依赖完整真值的问题,论文提出自监督的三维隐式神经表示:用坐标网络在投影监督下重建并外推体数据,以避开传统滤波反投影;再以该无伪影结果初始化物理迭代重建,补回坐标网络因谱偏置丢失的高频纹理。仿真与真实数据表明,该方法兼顾截断伪影抑制、视野外外推和细节保真。

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition Figure 1
2026-06-05cs.CV

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition

Pablo Ayuso-Albizu, Pablo Carballeira, Juan C. SanMiguel, Paula Moral

2026-06-05视觉感知生成模型

针对行人属性识别中监控图像低分辨率、长尾属性和标注稀缺导致扩散生成难以直接用于训练的问题,ReSAGE-PAR将LoRA式img2img域适配与视觉-语言相似度评分、贝叶斯伪标签转换结合,生成并筛选更可靠的合成样本。实验显示其可作为模型无关的数据扩展模块,在多种PAR骨干和SOTA框架上稳定提升,标准骨干最高增益达8.7%,但部分收益可能主要来自经验证的synthetic data scaling。

Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation Figure 1
2026-06-05cs.CV

Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation

Mengshi Qi, Wei Deng, Xianlin Zhang, Huadong Ma

2026-06-05视觉语言视觉感知强化学习三维

针对LVLM用链式CoT生成3D室内布局时无法回改早期决策、易导致空间错误累积的问题,论文将文本到3D室内场景视为受常识与物理约束的规划搜索,引入房间—区域—物体层级表示,并用PRM引导的全局/局部MCTS剪枝和权衡探索利用,另用扩散模型统一纹理;在新建3DTindo-bench上平均分较最佳基线提升约14%。

ATT-CR: Adaptive Triangular Transformer for Cloud Removal Figure 1
2026-06-05cs.CV

ATT-CR: Adaptive Triangular Transformer for Cloud Removal

Yang Wu, Ye Deng, Pengna Li, Wenli Huang, Kangyi Wu, Xiaomeng Xin, Jinjun Wang

Wenli Huang is with the Ningbo University of Technology, Ningbo, Zhejiang 315211, China.

2026-06-05视觉感知

针对遥感云去除中标准自注意力计算量高、且云区与干净像素混合参与注意力会引入伪影的问题,ATT-CR提出三角注意力用上下三角矩阵在线性复杂度下近似并保留注意力秩,同时用特征选择门控按空间和通道抑制云污染信息。作者在RICE1、RICE2、T-CLOUD和SEN12MS-CR上报告优于现有云去除方法的结果。

Deep Learning-based 3D Oral Cavity Reconstruction Using 2D Intraoral Images Figure 1
2026-06-05cs.CV

Deep Learning-based 3D Oral Cavity Reconstruction Using 2D Intraoral Images

Jihun Cho, Soo-Yeon Jeong, Eun-Jeong Bae, Sun-Young Ihm

2026-06-05视觉感知三维

针对传统牙模取模不适、口内扫描仪和 CBCT 成本高的问题,论文提出仅用 10 张固定视角二维口内图像重建上颌三维模型:以 MobileNetV2 提取多视角特征,并用多头注意力融合后直接预测 5 万个点云坐标。在 Dental3DS 的 950 个上颌样本上,按 0.035 距离阈值的最近邻匹配准确率为 77.49%,但预测点易集中在高密度区域,重建分布仍不均匀。

Multimodal Sexism Identification and Characterization using Large Language Models and Gradient Boosting Figure 1
2026-06-05cs.CV

Multimodal Sexism Identification and Characterization using Large Language Models and Gradient Boosting

Kyriakos Chaviaras, Maria Lymperaiou, Athanasios Voulodimos

Artificial Intelligence and Learning Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens

2026-06-05视觉语言优化算法

针对社交媒体中表情包和短视频常以讽刺、图文/音画互补方式呈现性别歧视、单模态检测易漏判的问题,本文采用晚期特征融合而非端到端大模型,结合CLIP、OCR文本、音频、人口/生理元数据与LLM抽取的刻板印象、物化等语义指标,并用层级XGBoost回归适配软标签。结果显示,定向LLM语义特征能提升表情包识别;视频任务对特征维度和跨模态噪声很敏感,开发集上的特征筛选结论未能稳定迁移到测试集,提示需更强时序建模。

Video-Rate Streaming Stylization on a Vision-Aware MLLM-Conditioned Edit Diffusion: Asymmetric Batched Inference on a Distilled UNet + MLLM Text Encoder Figure 1
2026-06-05cs.CV

Video-Rate Streaming Stylization on a Vision-Aware MLLM-Conditioned Edit Diffusion: Asymmetric Batched Inference on a Distilled UNet + MLLM Text Encoder

Yoshiyuki Ootani

2026-06-05视觉感知生成模型

论文关注蒸馏扩散视频编辑中瓶颈从 U-Net 转向重型 MLLM 文本编码器后的实时化问题,提出侧/主 CUDA 流异步流水、可编译的 LLLite 重写及周期条件刷新来摊薄编码与适配器成本。在 512×512 单卡流式风格化中,RTX 3090 Ti 达 27.4–29.6 fps,4090/5090 分别达 54.9/74.1 fps,但定位为高吞吐而非低延迟交互。

T-FunS3D: Task-Driven Hierarchical Open-Vocabulary 3D Functionality Segmentation Figure 1
2026-06-05cs.CV

T-FunS3D: Task-Driven Hierarchical Open-Vocabulary 3D Functionality Segmentation

Jingkun Feng, Reza Sabzevari

Jingkun Feng and Reza Sabzevari are with the P4MARS Lab at the Faculty of Aerospace Engineering, Delft University of Technology.

2026-06-05视觉感知三维

面向机器人交互,现有开放词汇3D方法多停留在物体级,或对全场景做细粒度过分割,计算和内存开销高。T-FunS3D的核心思路是先构建含实例与关系视觉嵌入的开放词汇场景图,再按自由文本任务只检索相关物体并用VLM定位其功能部件。SceneFun3D实验显示其精度接近现有最优,同时运行更快、内存占用更低。

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models Figure 1
2026-06-05cs.CV

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

Shanghai Innovation Institute, Shanghai AI Laboratory, University of Science and Technology of China, Wuhan University, Nankai University, Shanghai Jiao Tong University, Fudan University

2026-06-05数据集/基准

针对自然科学论文插图生成中现有评测过于整体、难以区分遵循提示、合理补充与幻觉添加的问题,本文提出 FEPBench:用文本、视觉、关系、布局“语义原子”标注 1300 张高质量插图,并从指令忠实度、推理丰富度、语义精确度细粒度评估 T2I 模型。实验显示闭源模型总体领先,但 GPT Image 2、Nano Banana Pro 等仍受文字渲染、科学推理不足及丰富性与精确性权衡困扰。

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection Figure 1
2026-06-05cs.CL

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

Erfan Loweimi, Mengjie Qian, Kate Knill, Guanfeng Wu, Chi-Ho Chan, Abbas Haider, Muhammad Awan, Josef Kittler, Hui Wang, Mark Gales

University of Cambridge, UK, Queen's University Belfast, UK, University of Surrey, UK, ‡ Southwest Jiaotong University, China, ◆ Teesside University, UK

2026-06-05视觉语言视觉感知

面向真实广播档案中目标人物可能只出现声音、只出现人脸或二者皆有的情况,论文指出固定音视频融合会把缺失模态当噪声引入排序。其核心做法是用跨模态检索分数一致性判断查询的活跃模态,并自适应选择单模态或融合权重。在 BBC Rewind 1.2万余视频上,模态检测约89%,P@1 达94.2%,优于说话人、人脸和固定融合基线,并接近使用真实模态标签的 oracle。

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering Figure 1
2026-06-05cs.CV

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

School of Computer Science and Engineering, Northeastern University, Shenyang, China, Department of Computer Science and Technology, Tsinghua University, Beijing, China

2026-06-05视觉感知

长视频问答中关键信息常短暂且分散,传统按帧采样或检索容易得到碎片化证据,难以支撑事件级推理。MemoryCard 的核心思路是让 VLM 先结合视频与语音自读分段,将每个主题/事件压缩为含摘要、话语和代表画面的多模态记忆卡,再按问题检索并自适应分辨率输入。三项长视频 QA 基准显示,在相近视觉 token 预算下准确率稳定提升,最高相对增益达 21.8%。

Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs Figure 1
2026-06-05cs.CV

Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs

Yi Chen, Yinghao Lu, Zhehao Li, Chenchen Yan, Jiafei Wu, Chong Wang, Jiangbo Qian

2026-06-05视觉感知

针对开放词汇检测只做区域-文本对齐、忽略物体间交互导致新类泛化受限的问题,论文提出SRM框架:用场景图显式建模候选框邻域关系,并以关系注意力和基于caption的文本对齐强化视觉-语义关联。实验称在COCO与LVIS上较现有OVOD方法提升新类别AP,但具体增益拆分需结合完整表格判断。

CamFlow+: Hybrid Motion Bases for 2D Camera Motion Estimation with Stabilization Applications Figure 1
2026-06-05cs.CV

CamFlow+: Hybrid Motion Bases for 2D Camera Motion Estimation with Stabilization Applications

Haipeng Li, Zhen Liu, Zhanglei Yang, Hai Jiang, Tianhao Zhou, Zhengzhe Liu, Ping Tan, Bing Zeng, Shuaicheng Liu

Hai Jiang is with the School of Aeronautics and Astronautics, Sichuan University, Chengdu, Sichuan, China., Tianhao Zhou is with the YingCai Honors College, University of Electronic Science and Technology of China, Chengdu, Sichuan, China., Zhengzhe Liu is with Lingnan University, Hong Kong, China., Ping Tan is with the Hong Kong University of Science and Technology and Shenzhen Loop Area Institute.

2026-06-05生成模型

本文针对单应性在相机平移、深度变化和局部视差下失效,而网格/局部平面模型又易受动态物体与深度边界干扰的问题,提出在稠密光流空间建模2D相机运动的CamFlow+。其核心是混合运动基:结合单应物理基、随机单应流基,以及由深度和内参解析得到的平移视差基,并加入深度感知平滑约束。在GHOF/GHOF-Cam上提升稀疏与稠密估计,视频防抖中也改善全局和局部稳定性,盲测top-1偏好率达43.30%。

Self-Learning Expression Deformations for Data-Efficient Gaussian Avatars Figure 1
2026-06-05cs.CV

Self-Learning Expression Deformations for Data-Efficient Gaussian Avatars

Jiahao Yang, Xiaohang Yang, Qing Wang, Yilan Dong, Gregory Slabaugh, Shanxin Yuan

Gregory Slabaugh, Queen Mary University of London

2026-06-05三维

针对3D Gaussian头像在表情形变中易失真且依赖大量多视角/连续表情数据的问题,SAGE用SDF联合2D Gaussian surfel约束高斯贴合表面,并通过无真实图像的自监督深度、法线与外观一致性学习表情形变。实验显示其在多视角单帧、单目转头和单图设置下可接近现有方法的重建与动画质量,同时将数据需求降低数个数量级。

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind Figure 1
2026-06-05cs.CV

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

Jianxu Shangguan, Jing Xu, Hang Ye, Xiaoxuan Ma, Yizhou Wang, Wentao Zhu

2026-06-05学习理论

针对现有 LLM 社交仿真缺少具身表达、说话人视频生成缺少社会认知的问题,论文提出闭环双智能体框架,将多模态感知、基于心智理论的隐含状态推断与情绪可控双人视频生成串联,并构建含人格与私有目标的 Persona-Scenario 数据集。在该设定下,方法在对话质量和视频生成指标上达到竞争或更优表现,部分对话维度甚至超过全信息 Script 模式。

Geometry-Aware Dataset Condensation for Diffusion Model Training Figure 1
2026-06-05cs.CV

Geometry-Aware Dataset Condensation for Diffusion Model Training

Xiao Cui, Yulei Qin, Mo Zhu, Wengang Zhou, Hongsheng Li, Houqiang Li

2026-06-05生成模型数据集/基准

这篇论文针对扩散模型训练中数据集压缩不匹配的问题:合成样本保真度不足,而常规真实子集选择又难以保留分布几何。作者将子集选择重写为几何感知的分布对齐,用单边部分最优传输聚焦高密度结构,并结合特征统计与语义正则,再用贪心构建加交换细化求解。实验显示其在不同扩散模型、子集规模、分辨率和训练轮次下优于既有选择/压缩方法,提升生成保真度与覆盖度。

LadderMan: Learning Humanoid Perceptive Ladder Climbing Figure 1
2026-06-05cs.RO

LadderMan: Learning Humanoid Perceptive Ladder Climbing

Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi

Amazon FAR, 2 USC, 3 UC Berkeley, 4 Stanford University, 5 CMU, † Amazon FAR Co-Lead

2026-06-05机器人

针对人形机器人在梯子上因踏点/抓点稀疏、全身多接触协调和感知误差而难以稳定攀爬与作业的问题,LadderMan用单条参考动作经混合运动跟踪生成多专家,再以模仿学习+强化学习蒸馏为深度视觉策略,并借助视觉基础模型缩小深度仿真到现实差距;另用双智能体解耦下肢稳态和上肢操作。实验显示其可在多种梯子几何上零样本迁移到Unitree G1,并支持换灯泡、递箱等梯上遥操作。

Entropy-Based Evaluation of AI Agents: A Lightweight Framework for Measuring Behavioral Patterns Figure 1
2026-06-05cs.AI

Entropy-Based Evaluation of AI Agents: A Lightweight Framework for Measuring Behavioral Patterns

Olasimbo Ayodeji Arigbabu

2026-06-05数据集/基准

这篇论文针对只看成功率、成本和延迟难以刻画智能体行为的问题,提出 EEA:把运行轨迹标准化为事件序列,用动作熵、轨迹熵、工具熵、信息增益、探索效率和鲁棒性熵评估探索、僵化、工具使用与不确定性下降。作者实现了可接入 LangChain、Google ADK 和日志的 Python 工具,并在受控模式与学习路线图智能体上展示指标能区分框架间行为差异;但实验规模很小,效果结论需谨慎解读。

Inverse Design of Realizable Metasurface based Absorbers using Improved Conditioning and Diversity Enhanced Progressively Growing GANs Figure 1
2026-06-05cs.CV

Inverse Design of Realizable Metasurface based Absorbers using Improved Conditioning and Diversity Enhanced Progressively Growing GANs

Vineetha Joy, Mohammad Abdullah, Pramit Pal, Anshuman Kumar, Amit Sethi, Hema Singh

Centre for Electromagnetics, CSIR-National Aerospace Laboratories, Kodihalli, Bangalore 560017, Birla Institute of Technology and Science, Pilani, Rajasthan 333031, Indian Institute of Technology, Bombay, Maharashtra 400076, a generative inverse design framework for controllable and, labelled datasets and suffer from generalization limitations, inverse design framework for controllable and physically, available substrate materials and feasible thickness

2026-06-05生成模型

针对超表面吸波器逆向设计依赖昂贵全波仿真、现有生成模型难以连续谱条件控制且易缺乏多样性的问题,论文提出逐步增长 WGAN-GP,结合 FiLM 连续条件、代理谱对齐损失和 DPP 多样性正则,将电磁一致性与可制造约束纳入训练。在 2–18GHz 任务中,生成设计经仿真验证,MSE 为 0.0052,有效电磁设计率 89.57%。

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models Figure 1
2026-06-05cs.CV

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

Haibo Wang, Lifu Huang

University of California, Davis

2026-06-05视觉语言视觉感知

针对现有多模态大模型仅靠2D语义监督、在视角变化和物理空间推理中缺乏深度、位姿与尺度一致性的问题,GeoVR利用纯2D视频在训练阶段引入相机位姿、深度、度量尺度和3D教师特征对齐等几何目标,重塑模型内部表征而非推理时外挂3D分支。论文称其在空间推理与3D场景理解基准上达到SOTA,且不增加推理开销。

Gender Artifacts from Art History to Text-to-Image Generation Figure 1
2026-06-05cs.CV

Gender Artifacts from Art History to Text-to-Image Generation

Piera Riccio, Miriam Doh, Benedikt Höltgen, Noa Garcia, Nanne van Noord

University of Amsterdam, University of Potsdam, The University of Osaka

2026-06-05视觉感知

本文针对AI中常把艺术风格视为中性色彩/纹理滤镜的问题,研究历史艺术风格如何携带性别化社会结构并被文生图模型继承。作者构建含约7.4万张图、19种风格的StyleGender数据集,并提出PixelSGA与MaskSGA衡量像素和构图层面的性别伪迹。结果显示历史图像中已存在显著风格相关性别差异,新古典主义和新艺术较突出,而Stable Diffusion与FLUX在风格提示下往往进一步放大这些伪迹。

Emotion-Aware Image Generation from Korean Diary Text via LLM-based Prompt Translation and LoRA Fine-Tuning Figure 1
2026-06-05cs.CV

Emotion-Aware Image Generation from Korean Diary Text via LLM-based Prompt Translation and LoRA Fine-Tuning

Jihun Cho, Soo-Yeon Jeong, Sun-Young Ihm

Pai Chai University, Resources Development Center, machine learning approaches that learn patterns from labelled, primarily rely on explicit emotional labels and English-

2026-06-05视觉感知

针对通用文生图模型难以从短韩语日记中把握隐含情绪的问题,论文提出先用 Qwen3-8B 识别情感并翻译成带情绪触发词的英文提示,再用基于儿童画情绪数据 LoRA 微调的 SD 3.5 生成图像。实验显示情绪触发词会明显改变生成图的情感表达,较高学习率提升儿童画风格迁移率,但 CLIP Score 与风格质量并不一致。

Next-Generation Parallel Decoder for LPDR: Architectural Optimization and Class-Balanced GAN-Augmentation Figure 1
2026-06-05cs.CV

Next-Generation Parallel Decoder for LPDR: Architectural Optimization and Class-Balanced GAN-Augmentation

Shawaiz Obaid, Nida Chandio, Neha Jamil, Muhammad Khuram Shahzad

2026-06-05生成模型优化算法

该文针对车牌检测识别中并行解码器对字符空间位置不敏感、训练集省份字符长尾失衡的问题,提出带二维位置嵌入的CSHA并行混合注意力、保留细粒度空间信息的IGFE,以及用CycleGAN生成少数类车牌的CBSA扩增。实验在CCPD、CLPD、PKU等基准上使用7.5万合成样本,将少数省份识别率由78.2%提升到91.5%,速度约152 FPS;但增益可能部分来自数据扩增规模。

Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment Figure 1
2026-06-05cs.CV

Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment

Qifei Jia, Xintong Yao, Minghao Li, Yajie Chai, Qiming Lu, Baoyue Shen, Yasen Zhang, Runyu Shi, Ying Huang, Yue Zhang

2026-06-05视觉感知

针对图像美学评估长期依赖单图绝对 MOS 回归、跨域泛化弱的问题,论文提出将审美判断建模为“编辑前后”的相对差异学习:用可控图像编辑构造 RED-20k 源图-编辑图对,配合差值评分与 CoT 因果解释,并通过 SFT、轻量校准和带相对排序一致性奖励的 GRPO 训练 RED-Aes。实验称其在五个公开基准的零样本跨域评测中达到 SOTA,轻量 2B 版本也超过既有基线。

LiAuto-GeoX: Efficient Grounded Driving Transformer Figure 1
2026-06-05cs.CV

LiAuto-GeoX: Efficient Grounded Driving Transformer

Jiawei Lian, Haoyi Sun, Yang Wu, Lifu Mu, Siyuan Wang, Le Hui, Ning Mao, Tao Wei, Pan Zhou, Kun Zhan, Jian Yang

Nanjing University of Science and Technology 2 Li Auto Inc., Northwestern Polytechnical University, Department of Computing, The Hong Kong Polytechnic University

2026-06-05视觉感知

面向自动驾驶中稠密3D重建难以实时上车、远距几何和环视一致性不足的问题,LiAuto-GeoX先用大规模环视数据和稀疏LiDAR先验训练高容量几何教师,再通过掩码引导的深度感知蒸馏与相对位姿关系蒸馏压缩为155M车载模型,保留局部度量结构和跨视角一致性。实验显示其在KITTI达220 FPS,并在轨迹预测、占据预测和未来帧预测上分别取得90.6 PDMS、24.63 mIoU和47.67 IoU。

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction Figure 1
2026-06-05cs.CV

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang

University of Science and Technology of China, Shanghai AI Laboratory, City University of Hong Kong, Nanjing University, Fudan University, Zhejiang University, University of Electronic Science and Technology of China

2026-06-05视觉感知强化学习

这篇论文针对视频事件预测中“把未来视觉推理先翻成文字”会丢失运动、几何和交互细节的问题,提出 Future-L1:在自回归解码中交替生成文本与连续潜在视觉片段,并用 Future-L1-50K 对齐未来帧嵌入、再以 LA-DAPO 强化学习优化潜在轨迹。实验中 FutureBench 从 Qwen3-VL-8B 的 61.0 提升到 85.4,TwiFF-Bench 均分从 2.44 到 3.04,说明增益主要来自保留潜在视觉语义而非纯文本 CoT。

ExpSpeech-Net: Multimodal Fusion of Expression and Speech for Deepfake Detection Figure 1
2026-06-05cs.CV

ExpSpeech-Net: Multimodal Fusion of Expression and Speech for Deepfake Detection

Ruchika Sharma, Rudresh Dwivedi

2026-06-05视觉语言视觉感知

针对现有深伪检测模型计算开销大、单模态线索难以捕捉音视频不一致的问题,ExpSpeech-Net融合面部表情与语音特征:图像侧提取ISLBT等局部/全局/深度特征,语音侧提取MPNCC、MFCC和chroma,并用SASMA进行特征选择,最后以SqueezeNet和RNN分类。文中报告准确率94.5%、精确率99.3%、F-measure 96.8%,但跨数据集泛化与增益来源仍未充分说明。

Physics-Guided Deep Unfolding for Blind Cross-Sensor Spectral Super-Resolution via Learning the Spectral Transformation Function Figure 1
2026-06-05cs.CV

Physics-Guided Deep Unfolding for Blind Cross-Sensor Spectral Super-Resolution via Learning the Spectral Transformation Function

Zhaolin Li, Jinsong Chen, Shanxin Guo, Tuo Zhang, Xinglong Zhang, Pan Chen

sensors remain costly and thus unavailable in many UAV, The authors are with a Center for Geo-Spatial Information, Shenzhen, Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, b University of Chinese Academy of Sciences, Beijing, c Shenzhen Engineering Laboratory of Ocean Environmental, no explicit degradation matrix is available to guide the process

2026-06-05视觉感知

针对无人机等跨传感器场景中多光谱到高光谱重建依赖已知固定SRF、真实退化未知的问题,论文提出PGU-Net,将交替优化展开为可训练网络,联合估计高光谱图像与可学习光谱变换函数,并结合闭式求解与近端网络保持物理约束。CAVE、NTIRE及真实Headwall–DJI数据实验显示其能恢复退化算子并优于多种SSR方法,且STF可能随地物类别变化。

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models Figure 1
2026-06-05cs.CV

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

Zhuoming Liu, Jinhong Lin, Kwan Man Cheng, Lin Zhang, Shayok Bagchi, Yin Li

University of Wisconsin–Madison, West Lafayette Jr./Sr. High School, of discrete tokens. While text-based output interfaces enable scalable pretraining, discrete text tokens as their primary output interface. This design enables scalable pretraining via, interface entirely is undesirable, as it would sacrifice the scalability of language-style pretraining and, Figure 1: (1): DRIFT learns a velocity field that transports a starting distribution centered at an

2026-06-05视觉语言视觉感知生成模型

这篇论文关注 VLM/MLLM/VLA 以离散 token 解码时难以精确输出时间边界、坐标和机器人连续动作的问题。DRIFT 的核心是先用基础预测器给出粗估计,再用 flow matching 只建模其附近的残差分布,从而降低生成式连续解码的优化难度和方差。实验覆盖视觉定位、视频时序定位和机器人控制,在 MLLM、VLA、WAM 上均优于回归头和直接 flow,TVG 提升约 2%,Libero 平均达 97.9%。

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents Figure 1
2026-06-05cs.CV

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

XiuYu Zhang, Junfeng Fang, Zhenkai Liang

National University of Singapore

2026-06-05视觉感知

这篇论文针对潜在视觉推理中“潜变量与视觉目标越对齐,答案越好”的常用假设展开检验。作者构造五种 LVR 变体,并提出 PRISM:用线性探针定位答案可解码位置、用潜变量扰动测试其因果作用。结果显示余弦对齐与任务准确率反而强负相关(r=-0.94),扰动潜变量最多只影响 4 个百分点,说明辅助损失主要通过共享参数重塑 VLM,而非让被监督潜变量真正承载答案信息。

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models Figure 1
2026-06-05cs.CV

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

University of Science and Technology of China, Shanghai Innovation Institute, Fudan University

2026-06-05视觉语言视觉感知

论文针对扩散式 VLA 仍沿用多步图像生成范式导致推理慢的问题,指出机器人策略的条件很丰富而动作块低维,单步生成可能本就更容易。其核心做法是不引入教师、蒸馏或额外损失,仅在标准 flow matching 中将训练时间分布偏向高噪声端。MNIST 探针、LIBERO 系列和少量真实双臂实验显示,单步策略通常可接近十步解码,在 LIBERO-Long 上达到 95.6%,但最优噪声偏移如何选择仍未充分说明。

VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning Figure 1
2026-06-05cs.CV

VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

Shufan Zhang, Ziyue Lin, Bairun Wang, Lei Jin, Xuanding Ding, Xinzhu Ma, Kunlin Yang

2026-06-05视觉感知强化学习

本文针对视频推理中现有 CoT 多为纯文本、难以在推理时回看关键视觉证据的问题,提出 VTI-CoT:将每个推理步骤与对应视频片段/帧交织,并用自动标注流水线生成多模态 CoT 数据;同时把长链路文本图像渲染到画布,用 OCR 式视觉表示压缩监督信号。实验显示同规模模型达到 SOTA,并提升训练效率,但具体增益中数据构造与压缩机制的贡献仍需细看消融。

TextWand: A Unified Framework for Scene Text Editing Figure 1
2026-06-05cs.CV

TextWand: A Unified Framework for Scene Text Editing

Shuyu Wang, Zhile Guan, Hongxiu Chen, Yule Duan, Weiqi Li, Xin Shan, Ronggang Wang, Jian Zhang

School of Electronic and Computer Engineering, Peking University, Shenzhen, China., and tedious manual labor. Such workflows are, available, where text remains a separate vector, unavailable, the text layer cannot be extracted

2026-06-05视觉感知

针对扁平化图片中文字难以像图层文件那样分离、替换时易出现残影且难同时保持字形、排版和背景的问题,TextWand将场景文字编辑统一为“渲染”和“擦除”两个原语,并用ORPE约束像素级布局与参考样式、RAS抑制原文字痕迹。作者还构建TextWand-Bench,在删除、生成、替换三类任务上报告优于开源和闭源基线的文字准确性、风格一致性与图像质量。

ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation Figure 1
2026-06-05cs.CV

ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation

Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong, Yi Wang

Shanghai AI Laboratory, Fudan University, Nanjing University

2026-06-05视觉语言强化学习

这篇论文针对多模态 on-policy 自蒸馏中用答案/推理作为教师特权会造成训练-测试不匹配、诱导捷径模仿的问题,提出 ViCuR:把特权改为来自图像/视频的可恢复视觉线索,并用 sink-token 交叉注意力在学生内部聚合证据。实验在 7 个基准和 Qwen3-VL 2B/8B 上较答案式 OPSD 平均提升约 1.2 分,强教师 OPD 中也有 0.64/1.08 分增益。

Real-Time Threat Detection from Surveillance Cameras using Machine Learning Figure 1
2026-06-05cs.CV

Real-Time Threat Detection from Surveillance Cameras using Machine Learning

Gajendra Mandal, J. P. Patra, Priyansh Mahant

2026-06-05视觉感知

针对传统监控依赖人工且现有武器数据集少覆盖印度场景中常见棍棒、铁杆等钝器的问题,论文构建336张本地钝器图像并与枪、刀公开数据合并,训练YOLOv8三类实时检测器;还描述了帧缓冲与VLM行为分析告警流程,但实验支撑主要集中在检测模型。结果显示延长训练可提升钝器类召回率和AP且未见明显过拟合,实时部署可行性有所验证,增益可能主要来自data与training scaling。

Parallel Jacobi Decoding for Fast Autoregressive Image Generation Figure 1
2026-06-05cs.CV

Parallel Jacobi Decoding for Fast Autoregressive Image Generation

Boya Liao, Ying Li, Siyong Jian, Huan Wang

Westlake University

2026-06-05视觉感知

自回归图像生成逐 token 解码导致延迟高,而传统 Jacobi 解码沿一维序列扩展会因候选 token 误差传播而加速饱和。本文利用图像注意力的局部空间相关性,提出无需训练的 Parallel Jacobi Decoding,在二维空间中为下一行初始化并并行细化草稿 token,同时调整注意力掩码稳定收敛。在 Lumina-mGPT 与 LlamaGen 等模型上实现约 4.8×–6.4×加速,并基本保持生成质量。

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models Figure 1
2026-06-05cs.AI

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

Haoyu Zhou, Qing Qing, Caichong Li, Qixin Zhang, Yongcheng Jing, Ziqi Xu, Juncheng Hu, Xikun Zhang, Renqiang Luo

2026-06-05视觉语言视觉感知数据集/基准

本文关注现有 VLM 时间推理评测多停留在视频帧排序、难以判断模型是否真正理解年代线索的问题,提出 ChronoVision 基准,包含长跨度相似物体演化、分类事件/物体以及新闻图文对齐三类数据。实验显示,不同类别上模型表现差异明显,且常依赖黑白/彩色等表面捷径而非真实年代特征,暴露了当前多模态时间对齐与因果式时间判断的不足。

T-SAR-JEPA: Self-Supervised Temporal Anomaly Detection in SAR Amplitude Stacks via Latent Prediction Figure 1
2026-06-05cs.CV

T-SAR-JEPA: Self-Supervised Temporal Anomaly Detection in SAR Amplitude Stacks via Latent Prediction

Kerod Woldesenbet, Abem Woldesenbet

2026-06-05视觉感知

针对传统 InSAR 时序变化检测流程复杂、难以扩展到密集商业 SAR 栈的问题,本文提出 T-SAR-JEPA:仅用幅度图自监督学习潜表示,并用带连续正弦时间编码的 Transformer 预测未来 latent,异常由预测误差给出;InSAR 相干性只作独立伪标注验证。在 DFC 2026 三个区域上,夏威夷火山窗口 ROC-AUC 达 77.0%,明显高于约 50% 的 RX、PaDiM、线性 AR 和 LSTM 基线,但更强时序基线和跨区域泛化仍文中未充分说明。

LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video Figure 1
2026-06-05cs.CV

LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

Shiqiang Lang, Jing Liu, Haoyang He, Peiwen Sun, Yuanteng Chen, Tao Liu, Lan Yang, Longteng Guo, Honggang Zhang

Beijing University of Posts and Telecommunications, Zhongguancun Academy, Institute of Automation, Chinese Academy of Sciences, The Chinese University of Hong Kong, Xi’an Jiaotong University

2026-06-05视觉感知

面向机器人导航、自动驾驶等长时程任务,论文指出视频 MLLM 不能只看当前帧,而需跨远距离片段记住布局、路线、视角变化和物体状态。作者提出 LongSpace-Bench,用真实室内漫游视频评测感知、空间关系与空间记忆,并设计 LongSpace:按 chunk 处理长视频,引入 3D 结构线索和层感知可检索记忆。实验显示其在多项空间推理基准、尤其记忆密集任务上提升长视频空间理解,但具体增益幅度需看完整表格。

Two-Way Is Better Than One: Bidirectional Alignment with Cycle Consistency for Exemplar-Free Class-Incremental Learning Figure 1
2026-06-05cs.LG

Two-Way Is Better Than One: Bidirectional Alignment with Cycle Consistency for Exemplar-Free Class-Incremental Learning

Hongye Xu, Bartosz Krawczyk

Chester F. Carlson Center for Imaging Science, Rochester Institute of Technology, available at https://github.com/HXuSz11/BiCyc_ICLR2026., widely used protocol is class-incremental learning (CIL), where tasks introduce disjoint labels and

2026-06-05视觉感知

本文针对无样本类增量学习中旧类原型随特征空间更新而漂移、单向投影补偿易产生几何偏置的问题,提出 BiCyc:在新任务训练中同时学习 old→new 与 new→old 两个映射,并用停止梯度和循环一致性约束使表示与传输共同演化。理论上将循环损失与奇异值收缩、分类 log-odds 稳定性联系起来;实验在 CIFAR-100、TinyImageNet、ImageNet-100、CUB-200 等基准上降低遗忘并提升从零训练准确率,预训练细粒度场景保持竞争力。

V2V-Bench: A Comprehensive Benchmark for Video-to-Video Generation Evaluation Figure 1
2026-06-05cs.CV

V2V-Bench: A Comprehensive Benchmark for Video-to-Video Generation Evaluation

Tao Liu, Leela Krishna, Gouti Pavan Kumar, Sreeja K, Vishav Garg

2026-06-05视觉感知数据集/基准

针对视频到视频编辑既要执行指令又要保持源视频逐帧对应、现有 T2V/I2V 指标难以衡量的问题,V2V-Bench 构建含 81 个源视频和 11 维指标的分层基准,突出时间对齐、结构保真和编辑忠实度等 V2V 专属诊断。实验显示 Grok 在编辑与源结构保持上更强,Veo3.1 视觉质量更好;6 个核心维度与人工判断 Spearman 相关达 0.905。

CoFi-UCGen: Coarse-to-Fine Unsupervised Conditional Generation without Label Priors Figure 1
2026-06-05cs.CV

CoFi-UCGen: Coarse-to-Fine Unsupervised Conditional Generation without Label Priors

Shengxi Li, Zhaokun Hu, Ce Zheng, Mai Xu, Jingyuan Xia, Si Liu

C. Zheng is with the School of Cyber Science and Technology, Beihang University, Beijing 100191, China.

2026-06-05视觉感知

针对无标注条件生成难以同时获得全局可控性与细粒度变化的问题,CoFi-UCGen将GAN的紧凑潜空间与扩散模型细节生成结合:用对抗语义互学习从零学习bit-codes以组织粗粒度语义,并在HM-UNet中层级注入条件形成细粒度语义基。实验称其在无需标签先验或预训练特征的情况下,图像质量、语义一致性和控制精度均优于现有UCGen方法。

GS-NFS: Bandwidth-adaptive Streaming of Dynamic Gaussian Splats and Point Clouds Figure 1
2026-06-05cs.MM

GS-NFS: Bandwidth-adaptive Streaming of Dynamic Gaussian Splats and Point Clouds

Rajrup Ghosh, Haodong Wang, Haoran Hong, Eduardo Pavez, Amartya Chaudhuri, Weiwu Pang, Harsha V. Madhyastha, Antonio Ortega, Ramesh Govindan

University of Southern California, space (i.e., the center of the ellipsoid).

2026-06-05三维

动态 3D Gaussian Splatting 适合自由视角 3D 视频,但单帧体积远大于 2D 视频,现有后训练压缩难以实时编解码。GS-NFS 将点云式八叉树位置编码、RAHT 属性变换、ANS/RLGR 熵编码及 SH 的 YUV/KLT 去相关系统性 GPU 并行化,支持按带宽调节码率。实验显示其帧级编码/解码速度比现有方法快 1–2 个数量级,可达约 30 fps,移动 GPU 上部分序列约 25 fps,同时保持有竞争力的压缩率和渲染质量。

Multi-Task Crack Foundation Model for Engineering-Reliable Crack Representation and Topology Preservation in Civil Infrastructure Figure 1
2026-06-05cs.CV

Multi-Task Crack Foundation Model for Engineering-Reliable Crack Representation and Topology Preservation in Civil Infrastructure

Blessing Agyei Kyem, Joshua Kofi Asamoah, Eugene Denteh, Armstrong Aboah

2026-06-05视觉感知

面向土木基础设施巡检中裂缝细长、易断裂且跨场景泛化差的问题,论文将裂缝分割从单一掩码预测扩展为结构与置信度联合表征。CrackGeoFM冻结视觉基础模型,并加入频域增强、裂缝域适配和多任务解码,同时预测掩码、骨架和不确定性;骨架监督由已有二值标注自动生成。作者在20个裂缝数据集上报告了更好的分割、拓扑保持、校准不确定性和5张标注图像下的少样本适配效果。

ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions Figure 1
2026-06-05cs.CV

ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions

Dehong Kong, Lina Lei, Lingtao Zheng, Chenyang Wu, Ailing Zhang, Xinran Qin, Teng Ma, Jiaqi Xu, Zhixin Wang, Zhikai Chen, Xuecheng Qi, Renjing Pei, Fan Li

Huawei Noah’s Ark Lab, Sun Yat-sen University

2026-06-05视觉感知

针对传统美学裁剪只给单一画幅、难以同时保留人物场景、主体姿态与情绪细节的问题,本文提出三镜头构图任务TSC,从单张人像中心图像生成远景/中景/特写裁剪及描述。ShotCrop³结合专家标注、MLLM伪标签筛选、CoT-SFT、半监督微调和GRPO-S奖励优化,在1.2K专家标注TSC-Bench上显著优于通用MLLM,镜头定位准确性较GPT-5平均提升2.82倍。

KV-Control: Parameter-Efficient K/V Injection for Trajectory-Controlled Text-to-Motion Figure 1
2026-06-05cs.CV

KV-Control: Parameter-Efficient K/V Injection for Trajectory-Controlled Text-to-Motion

Tengjiao Sun, Pengcheng Fang, Xiaoyu Zhan, Yanwen Guo, Dongjie Fu, Xiaohao Cai, Hansung Kim

2026-06-05规划控制

面向动画与具身智能中仅靠文本难以精确跟踪根轨迹、末端目标或多关节约束的问题,KV-Control 将轨迹条件改写为自注意力中的 K/V 记忆检索,并结合 PartVQ 与 T-Concat 让每个帧-部位 token 可寻址,在冻结文本到动作 Transformer 上只训练约 1.5M 注入参数。HumanML3D/MaskControl 协议下,方法达到 0.40cm 骨盆误差和 0.71cm 多关节误差,较同骨干复制分支以约 26 倍更少机制参数取得更低误差。

What's Under the Skin? Estimating Swine Body Condition Figure 1
2026-06-05cs.CV

What's Under the Skin? Estimating Swine Body Condition

Mk Bashar, Kuljit Bhatti, Gary Rohrer, Madonna Benjamin, Tami Brown-Brandl, Daniel Morris

2026-06-05视觉感知

针对母猪体况评估中目测和卡尺与真实脂肪/肌肉组成相关性弱、超声又难以规模化的问题,论文提出 PigFormer:先将顶置 RGB-D 深度帧经分割蒸馏、地面去除和朝向归一化转为标准高度图,再用切片注意力编码背部截面序列联合回归背膘、腰肌和总组织厚度。在两场站 319 个实例上,背膘 MAE 为 2.43mm、总体 MAE 为 3.87mm,较 ResNet-18 和 ViT-small 基线分别降低约 22% 和 39%。

HDST-GNN: Heterogeneous Dynamic Spatiotemporal Graph Neural Networks for Multi-Object Tracking in UAV Aerial Imagery Figure 1
2026-06-05cs.CV

HDST-GNN: Heterogeneous Dynamic Spatiotemporal Graph Neural Networks for Multi-Object Tracking in UAV Aerial Imagery

Phillip Jiang

2026-06-05视觉感知

面向无人机航拍多目标跟踪中高度变化、小目标密集和遮挡导致的误匹配,HDST-GNN将检测、活跃轨迹和丢失轨迹建成异构动态时空图,并用基于目标面积的高度自适应连边、类型化关系和遮挡门控注意力改进关联。VisDrone2019-MOT上,oracle检测下达94.51% MOTA、97.24% IDF1,较SORT少81%身份切换;噪声检测下身份切换也降低49%。

BMCR: Adaptive Backbone Module Composition via Reinforcement Learning for Remote Sensing Object Detection Figure 1
2026-06-05cs.CV

BMCR: Adaptive Backbone Module Composition via Reinforcement Learning for Remote Sensing Object Detection

Wenlin Liu, Xikun Hu, Ping Zhong

Wenlin Liu, Xikun Hu, and Ping Zhong are with the College of Elec-, tronic Science and Technology, National University of Defense Technology

2026-06-05视觉感知强化学习

面向遥感目标检测中场景复杂度差异大、固定 CNN/ViT 主干难以同时兼顾局部细节与全局上下文的问题,BMCR 将现成 CNN 和 ViT 拆成带元数据的可复用模块,用强化学习按输入动态组合推理路径,并用 OT 接口对齐网格特征与 token 表示、AMCO 稳定训练。在 DOTA-v1.0、DOTA-v1.5 和 DIOR-R 上分别达到 79.31%、73.41%、71.86% mAP,较强静态和动态基线最高提升约 2.5 点且效率保持竞争力。

Monte Carlo Steklov Operators for Large-Scale Geometry Processing in the Wild Figure 1
2026-06-05cs.GR

Monte Carlo Steklov Operators for Large-Scale Geometry Processing in the Wild

Arman Maesumi, Tanish Makadia, Aruna Anderson, Oras Phongpanangam, Justin Solomon, Daniel Ritchie

ARMAN MAESUMI∗, Brown University, USA, TANISH MAKADIA∗, Brown University, USA, ARUNA ANDERSON†, Loyola Marymount University, USA, ORAS PHONGPANANGAM†, Brown University, USA, JUSTIN SOLOMON, Massachusetts Institute of Technology, USA, DANIEL RITCHIE, Brown University, USA, of this operator is visualized on the moose, which contains 2 million faces. Center: Our method applies to both interior and exterior operators—the latter, this scalability, we compute interior and exterior Steklov eigenspectra for, Scalability and robustness are key obstacles for volumetric meth-

2026-06-05强化学习

面向 Objaverse 这类网格质量差、组件众多的大规模“野外”几何,论文指出传统内蕴 Laplacian 与 BEM/FEM 体算子在鲁棒性和规模上受限;其核心是用布朗运动/Walk-on-Spheres 与 Beurling-Deny 公式直接蒙特卡洛估计内外 Dirichlet-to-Neumann 算子及 Steklov 谱,避免四面体化和大稠密矩阵,并可通过外域耦合断开部件。结果显示方法比既有边界元计算快数个数量级,能处理百万面片和约45万 Objaverse 形状,并支撑 Steklov-CLIP 学到可文本查询的全局与稠密3D表示。

UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning Figure 1
2026-06-05cs.CV

UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning

Gexin Huang, Yanting Yang, Myeongkyun Kang, Beidi Zhao, Jun Zhou, Chen Zhou, Gang Wang, Zu-hua Gao, Xiaoxiao Li

University of British Columbia, Vancouver, BC, Canada, Vector Institute, Toronto, ON, Canada, The Hong Kong Polytechnic University, Hong Kong SAR, China

2026-06-05视觉感知数据集/基准

本文针对超高分辨率图像中证据细小、分散且跨区域的问题,指出仅看最终 VQA 准确率难以定位 VLM 失败原因。UltraVR 的核心是覆盖 CCTV、遥感、病理切片和工业异常的诊断基准,并为每题标注分步 GT-CoT 与证据定位、局部感知、量化、整合、推断等操作标签。实验显示最强模型宏平均准确率仅 44.9%,主要瓶颈集中在早期证据定位和局部感知。

Dual Feature Decoupling for Fine-Grained OOD Detection Figure 1
2026-06-05cs.CV

Dual Feature Decoupling for Fine-Grained OOD Detection

Xiaokun Li, Yaping Huang, Qingji Guan

nition system is commonly trained in a controlled labora-, Xiaokun Li, Yaping Huang and Qingji Guan are from School of Computer, Science and Technology, Beijing Jiaotong University, No. 3 Shangyuan

2026-06-05视觉感知

论文关注细粒度场景下的 OOD 检测:ID/OOD 同属大类、外观与背景高度相似,传统依赖粗粒度语义差异的方法容易失效。作者提出 DFDNet,从特征解耦角度同时在空间/频率域抑制风格信息,并用像素级对抗重建去除背景和低层细节、强化类别特异语义。四个细粒度数据集实验显示其相较 MSP、ODIN、Energy 等基线取得更好检测效果,但具体增益幅度在给定片段中未充分说明。

Noise-Aware Visual Representation Learning for Medical Visual Question Answering Figure 1
2026-06-05cs.CV

Noise-Aware Visual Representation Learning for Medical Visual Question Answering

I Putu Adi Pratama, Bahadorreza Ofoghi, Atul Sajjanhar, Shang Gao

2026-06-05视觉感知

针对医疗 VQA 中视觉编码器输出易受采集/传输噪声和无关扰动影响、直接投影会把噪声传给 LLM 的问题,论文在 CLIP 特征到 MLP 视觉前缀映射前加入去噪自编码器,两阶段先重建干净嵌入再用 LoRA 做生成对齐。SLAKE 和 PathVQA 上干净性能基本保持竞争力,噪声嵌入下平均准确率显著优于直接投影和普通 AE,说明增益主要来自嵌入级去噪带来的鲁棒性。

What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning Figure 1
2026-06-05cs.LG

What Objects Enable, Not What They Are: Functional Latent Spaces for Affordance Reasoning

Rohan Siva, Neel P. Bhatt, Yunhao Yang, Seoyoung Lee, Nishant Gadde, Christian Ellis, Alvaro Velasquez, Zhangyang Wang, Ufuk Topcu

The University of Texas at Austin, University of Colorado Boulder

2026-06-05视觉感知

这篇论文针对机器人规划中过度依赖外观类别、难以判断物体“能做什么”的问题,提出 A4D:用 CLIP 图文嵌入构造由 affordance 及其反义词定义的功能潜空间,并以投影距离进行功能判别、不确定性估计和新 affordance 发现。实验显示其在已知 affordance 上约 94% 准确率,较 VLM 基线高 15 个百分点以上,新增 affordance 少样本后可超 90%,单次推理约 22ms、快约 100 倍。

Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models Figure 1
2026-06-05cs.CV

Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor, Marzia Nouri, Doratossadat Dastgheib, Mohamed Hefeeda, Ehsaneddin Asgari

‡ University of British Columbia, § Zuse School ELIZA, † Qatar Computing Research Institute (QCRI), Hamad Bin Khalifa University

2026-06-05视觉语言视觉感知数据集/基准

针对现有 VLM 基准多为零散任务、难以定位真实认知短板的问题,论文提出英阿双语多模态 BloomBench,将图像问答按布鲁姆六层认知组织,并用半自动生成与人机混合质检保证规模和语言一致性。对多种 SOTA VLM 的评测显示,模型在语义理解上表现较强,但在事实回忆和创造性综合上明显薄弱,且阿拉伯语相对英语存在显著性能差距,暴露跨语言多模态推理不足。

BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding Figure 1
2026-06-05cs.CV

BRepCLIP: Contrastive Multimodal Pretraining on BRep Primitives for CAD Understanding

Muhammad Usama, Didier Stricker, Mohammad Sadil Khan, Muhammad Zeshan Afzal

aware pretraining for multimodal CAD understanding. Project page is available at

2026-06-05视觉语言

该文针对点云/网格预训练会丢失CAD原生BRep中的精确曲面、曲线和拓扑信息,导致细粒度检索与生成评估不足的问题,提出BRepCLIP:将面和边分别经双dVAE离散化,并加入几何类型语义描述,再用Transformer对齐CLIP文本/图像空间。实验显示其在ABC、CADParser、Automate文本到CAD检索上较OpenShape显著提升Top-1,FabWave零样本分类提升15%,BRepCLIP-Score也更贴近人工评估。

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning Figure 1
2026-06-05cs.CV

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

2026-06-05机器人安全鲁棒

针对视觉 PointGoal 导航在跨场景外观和语义变化下易过拟合的问题,论文用训练期特权 LiDAR 以几何相似度和自适应温度引导 RGB 对比预训练,并冻结编码器再做强化学习,促使策略依赖可迁移几何结构而非纹理捷径。仿真实验显示其在室内外场景迁移中优于大型视觉预训练模型和常规对比基线,部署时仅需单目 RGB 与任务状态输入。

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers Figure 1
2026-06-05cs.CV

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers

Jean Cordonnier, Chenghao Xu, Olga Fink, Malcolm Mielle

2026-06-05三维

针对RGB-热成像三维重建依赖精确配对/标定、难以用于独立采集或多机器人异构传感的痛点,论文用VGGT分别估计两模态相机位姿,再借助跨模态匹配与Procrustes对齐,训练未配对RGB-T 3D Gaussian Splatting,并提出同时评估单模态合成与跨模态一致性的基准。九个场景中热视图合成具竞争力且RGB质量基本保持,但位姿对齐仍有误差,部分增益与VGGT位姿质量相关。

LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval Figure 1
2026-06-05cs.CV

LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval

Shahrzad Esmat, Chaunte W. Lacewell, Sameh Gobriel, Nilesh Jain, Ali Jannesari

Iowa State University, retrieval ground truth without additional labeling.

2026-06-05优化算法

论文关注多阶段向量检索中 ANN 索引与重排参数强耦合、传统 HPO 独立建模易失效的问题,提出读取完整试验历史的分阶段 LLM 代理,并以 SIEVE 约束质量后优化吞吐。在 HICO-DET 文本到 HOI 图像检索上较 Optuna TPE 提升 33.3%、较 VDTuner 提升 34.2%,对 UniIR 吞吐提升 15.3×;在耦合较弱的 GLDv2、SIFT1M 上优势收敛,并可无改动迁移到 Milvus。

Can We Predict The Human Preference For Text-to-Image Content Prior To Generation And Is It Even Useful To Do So? Figure 1
2026-06-05cs.CV

Can We Predict The Human Preference For Text-to-Image Content Prior To Generation And Is It Even Useful To Do So?

Joong Ho Kim, Keith G. Mills

2026-06-05视觉感知

论文关注扩散模型中随机初始噪声会显著影响文本生成图像的人类偏好评分,而直接多次生成再筛选计算昂贵。作者提出在生成前用提示词与候选噪声预测 HPM 分数,并以 Best-of-N 选择更优噪声,同时比较不同偏好指标和预测器。实验覆盖 SDXL、DreamShaper、Hunyuan-DiT、PixArt-Σ 等,显示该策略可提升端到端偏好分数;但指标选择很关键,且简单的不依赖扩散模型内部计算的预测器反而平均增益更好、硬件开销更低。

Formal Concept Lattices are Good Semantic Scaffolds for Concept-Based Learning Figure 1
2026-06-05cs.CV

Formal Concept Lattices are Good Semantic Scaffolds for Concept-Based Learning

Deepika SN Vemuri, Sayanta Adhikari, Ankit Saha, Krishn Vishwas Kher, Vineeth N Balasubramanian

ful and hierarchically structured. Code available, (often hierarchical) in the label space. Our approach, on

2026-06-05视觉感知

针对现有概念瓶颈模型常把语义概念平铺在单一层、难以对应人类从泛到细的层级理解,本文用形式概念分析从类别—属性关系构建概念格,并将不同粒度概念分配到网络不同深度作为语义脚手架。实验显示该设计在保持/提升分类表现的同时,得到更有层级结构和可解释性的嵌入,并支持比单层概念模型更有效的多层干预。

ORACLE-CT: Anatomy-Aware Support Pooling for CT Classification Figure 1
2026-06-05cs.CV

ORACLE-CT: Anatomy-Aware Support Pooling for CT Classification

Lavsen Dahal, Yubraj Bhandari, Geoffrey Rubin, Joseph Y. Lo

2026-06-05视觉感知

腹部 CT 多标签分类中,病灶证据常局限于特定器官,而常规全局池化/无约束注意力会混入无关解剖区域。ORACLE-CT 的关键是利用多器官分割为每个标签限定解剖支持域,只在相应区域内做注意力汇聚。实验显示该策略在 DINOv3、I3D-ResNet 上提升 MERLIN 内部 AUROC/AUPRC,并改善 Duke-Abdomen、AMOS 外部迁移;Pillar-0 的主要增益更多来自学习式注意力,掩膜增益较小。

Horse Eye Blink Detection and Classification for Equine Affective State Assessment Figure 1
2026-06-05cs.CV

Horse Eye Blink Detection and Classification for Equine Affective State Assessment

João Alves, Signe Møller-Skuldbøl, Pia Haubro Andersen, Rikke Gade

Visual Analysis and Perception Lab, Aalborg University, Department of Animal Biosciences, Swedish University of Agricultural Sciences, publicly available dataset. We achieve a macro-F1 score, not available. Observational scales such as the Horse Gri-, the human centered FACS [3]. EquiFACS describes facial, multiple methodologies on a publicly available dataset [6]., • Evaluation of our methods on the publicly available set [6, of available training data [5]. A key contributing factor to, For frame-based methods, individual frames were labelled, visible was labelled as half-blink. For video-based meth-, level labels and individually classified short video clips. In, gle label to all consecutive blink frames within an episode

2026-06-05视觉感知

论文面向马匹疼痛与情绪评估中 EquiFACS 标注成本高、半眨眼/全眨眼微表情难以人工稳定识别的问题,比较了光流阈值、逐帧 YOLOv12 与微调 VideoMAE 三类视频眨眼检测/分类方法,并加入人类基线说明半眨眼标注本身困难。公开测试集上,三分类宏 F1 达 0.898,二值眨眼检测宏 F1 达 0.926,显示其可用于缩小人工检索范围,但细粒度 AU 识别仍受数据稀缺与类别细微差异限制。

Disentangled Fine-Grained Prototype Learning for Incomplete Image-Tabular Classification Figure 1
2026-06-05cs.CV

Disentangled Fine-Grained Prototype Learning for Incomplete Image-Tabular Classification

Feixiang Zhou, Jianyang Xie, Zhuangzhi Gao, Qinkai Yu, Fu Wang, Yuheng Fan, Jing Li, Zheheng Jiang, Yitian Zhao, Yanda Meng, He Zhao, Gregory Y.H. Lip, Yalin Zheng

Code will be made publicly available., with the School of Eye and Vision Sciences, University of Liverpool, U.K., G. Y.H. Lip is with the Department of Cardiovascular and Metabolic, Medicine, University of Liverpool, U.K., Q. Yu is with the School of Computer Science, University of Exeter, U.K., J. Li is with the School of Computer Science and Engineering, South China, University of Technology, China., Z. Jiang is with the School of Computing and Mathematical Sciences, University of Leicester, U.K., Y. Zhao is with Ningbo Institute of Industrial Technology, Chinese, Academy of Sciences, China., Science and Engineering Division (BESE), King Abdullah University of

2026-06-05视觉感知

针对图像—表格多模态分类中常见的模态缺失问题,论文指出仅在全局平均特征上做共享/特异解耦会忽略细粒度语义与分布错位。DFPL通过共享-特异原型建模、原型级分布与类别语义对齐,以及类别感知多尺度聚合来增强缺失模态下的表示利用。三个图像—表格基准上的实验显示其在多种缺失设置下优于已有方法,但对未配对样本的利用仍未充分解决。

Uncertainty-Aware Adaptive Sensor Fusion for Autonomous Navigation Figure 1
2026-06-05cs.RO

Uncertainty-Aware Adaptive Sensor Fusion for Autonomous Navigation

Simegnew Yihunie Alaba, Yuichi Motai

Simegnew Yihunie Alaba

2026-06-05机器人安全鲁棒

针对自动导航中 IMU 易漂移、视觉在遮挡/光照变化下不可靠的问题,论文将深度特征学习与 UKF 结合:用 ViT 建模 IMU 时序、MCNN 提取光流运动线索,并通过不确定性估计自适应调节传感器权重和噪声协方差,训练中加入不确定性感知损失。在 KITTI 上报告 ATE/RPE 优于基线,并在 A100 上达到 155 FPS;但真实资源受限平台上的部署效果文中未充分说明。

Would you still call this Dax? Novel Visual References in VLMs and Humans Figure 1
2026-06-05cs.CV

Would you still call this Dax? Novel Visual References in VLMs and Humans

Ada Defne Tür, Gaurav Kamath, Joyce Chai, Siva Reddy, Benno Krojer

♡McGill University, ♣Mila Quebec AI Institute, ♠University of Michigan - Ann Arbor, ♢Canada CIFAR AI Chair, learned labels to stimuli that humans reject. We, label, and thus assign novel words to unfamiliar

2026-06-05视觉语言

本文关注 VLM 在只见过少量样例后如何把新视觉对象映射到新词,尤其当新命名与预训练常识冲突时的泛化边界。作者构建 NVRD,含 90 类从熟悉到完全新颖的对象及 1.9 万张受控扰动图,并与 2400 个人类判断对比。结果显示,模型能一定程度上下文学习新指称,但对已有常识标签的对象更抗拒;其对形状扰动最敏感、与人类趋势相关,却明显过度泛化,把人类拒绝的变体仍归为同一新词。

UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching Figure 1
2026-06-05cs.CV

UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching

Qilin Huang, Quynh Anh Huynh, Long Le, Chen Wang, Chuhao Chen, Ryan Lucas, Eric Eaton, Lingjie Liu

University of Pennsylvania, Southern University of Science and Technology

2026-06-05生成模型三维

针对从单幅视觉输入预测物体物理属性时,传统前馈模型只能给出确定性点估计、难以表达材料歧义的问题,UniPixie将任务改写为可控的连续物理谱学习。它基于带属性范围标注的PixieMultiVerse,用统一编码器和条件Flow Matching解码器生成从最软到最硬的材料场,并适配MPM、LBS和弹簧质点等多种求解器。实验显示其可产生多样且物理可行的动态效果,杨氏模量误差较最强确定性基线降低超过50%。

Deep Learning-assisted AMD Staging based on OCT and OCT Angiography Figure 1
2026-06-05cs.CV

Deep Learning-assisted AMD Staging based on OCT and OCT Angiography

Yukun Guo, Tristan T. Hormel, An-Lun Wu, Liqin Gao, Min Gao, Steven T. Bailey, Yali Jia

Casey Eye Institute, Oregon Health & Science University, Portland, OR 97239, USA, Department of Biomedical Engineering, Oregon Health & Science University, Portland, OR 97239, USA, Department of Ophthalmology, Mackay Memorial Hospital, Hsinchu 300044, Taiwan, Visionix/Optovue Inc., CA). Each, labor burden that is associated with manual AMD staging an increasing number of studies have proposed

2026-06-05视觉感知

针对AMD分期依赖专家、CFP与既有OCT方法难充分利用三维结构和血流信息的问题,本文用OCT/OCTA构建自动四级分期框架,对比病灶生物标志物图、2D en face投影和3D体数据三类EfficientNet模型。351眼2030个体数据五折验证显示各模型QWK均≥0.83,生物标志物模型最佳(0.85±0.03)且早期AMD F1最高,提示显式病灶表示可能更具临床实用性。

Three-Dimensional Retinal Microvasculature Restoration in OCT Angiography Figure 1
2026-06-05cs.CV

Three-Dimensional Retinal Microvasculature Restoration in OCT Angiography

Yukun Guo, Min Gao, Tristan T. Hormel, Steven T. Bailey, Thomas S. Hwang, Yali Jia

Casey Eye Institute, Oregon Health & Science University, Portland, OR 97239, USA, Department of Biomedical Engineering, Oregon Health & Science University, Portland, OR 97239, USA, truth, in both 2D and 3D by at least 3.8/51.2% (2D/3D) in several different vascular slabs., introduced a slab-based subtraction strategy to suppress projection artifacts to improve the accuracy of, CNV visualization[18]. However, because the method relies on slab-based subtraction, it may, attenuation with slab subtraction methods, our group developed projection-resolution OCTA (PR-OCTA), diverse imaging conditions. Projection artifact removal techniques, including slab-based subtraction and, Optovue/Visionix, Inc.). Two consecutive B-scans were acquired, by the Institutional Review Board of Oregon Health & Science University (Portland, OR) and was

2026-06-05视觉感知

针对OCTA中散斑、投影、衰减和运动伪影影响视网膜血流与无灌注区量化的问题,论文提出从单次OCTA体数据恢复三维微血管的深度模型:以相邻3张B帧预测中间帧,采用EfficientNet-B5编码器、scSE解码器和跳连,利用多次扫描平均构造真值。实验显示相较原始单次扫描,PSNR由22.23升至26.16,SSIM由0.72升至0.91,2D/3D血管Dice也显著提升。

Biomazon: A Multimodal Dataset for 3D Forest Structure and Biomass Modeling in the Amazon Basin Figure 1
2026-06-05cs.CV

Biomazon: A Multimodal Dataset for 3D Forest Structure and Biomass Modeling in the Amazon Basin

Sayan Mandal, Rocco Sedona, Simon Besnard, Mikhail Urbazaev, Morris Riedel, Ehsan Zandi, Gabriele Cavallaro

2026-06-05视觉语言数据集/基准三维

针对热带森林结构建模常把 GEDI 信息压成冠层高度或单一生物量标量、难以评估垂直结构一致性的问题,Biomazon 提供亚马孙 20m 多模态基准,将 Sentinel、PALSAR、DEM、LULC 与 AlphaEarth 嵌入对齐到完整 RH 剖面和 AGBD,并用锚定累积参数化强制 RH 单调。文中给出统一空间划分、共享编码器基线、尺度/模态/联合训练消融及与现有产品的对齐比较,但具体性能增益幅度和来源在给定片段中未充分说明。

Recovering Physically Plausible Human-Object Interactions from Monocular Videos Figure 1
2026-06-05cs.CV

Recovering Physically Plausible Human-Object Interactions from Monocular Videos

Dingbang Huang, Etienne Vouga, Qixing Huang, Georgios Pavlakos

University of Texas at Austin, Shanghai Jiao Tong University, control framework [9, 31, 37]. Meanwhile, scalable train-

2026-06-05视觉感知

该文针对单目视频人-物交互重建虽外观合理、却常有穿模、悬浮和抖动等物理违背的问题,提出 RePHO:先用运动学方法得到初值,再在物理仿真中通过强化学习训练策略复现交互;核心在于自适应采样与双自更新机制,从噪声重建中挑出可靠帧并逐步传播物理一致性。实验显示其在两个 HOI 基准上相较运动学和物理基线提升了物理合理性及部分 3D 精度指标。

LightVesselNet: An Ultra-Lightweight Sub-100K Parameter Network for Retinal Blood Vessel Segmentation Figure 1
2026-06-05cs.CV

LightVesselNet: An Ultra-Lightweight Sub-100K Parameter Network for Retinal Blood Vessel Segmentation

Shadman Sobhan, Farhana Jalil

2026-06-05视觉感知

针对视网膜血管分割模型精度高但参数量和算力需求阻碍边缘筛查部署的问题,LightVesselNet以约75K参数的紧凑编码器—解码器为核心,结合深度可分离卷积SE微块、多尺度空洞卷积聚合、空间/通道注意力、亚像素上采样和边缘残差来保留细小血管。其在DRIVE、STARE、CHASE_DB1、FIVES、HRF上取得0.7686–0.8649 Dice,并在参数/算力效率和跨数据集泛化上优于多种更大模型。

TopoPult-SSL: Gland-Mask-Free Cross-Device Meibomian Gland Segmentation via Self-Distilled Weak Clinical Priors Figure 1
2026-06-05cs.CV

TopoPult-SSL: Gland-Mask-Free Cross-Device Meibomian Gland Segmentation via Self-Distilled Weak Clinical Priors

Nicolò Savioli, Luca Del Tongo

2026-06-05视觉感知

针对睑板腺分割在新成像设备上因域偏移而需重新标注密集腺体掩码的问题,TopoPult-SSL利用眼睑轮廓、Pult分级和形态比例等弱临床先验进行无目标腺体掩码适配,并在有少量目标标注时把互补教师自蒸馏为单模型。在MGD-1k到CAMG跨设备基准上,蒸馏模型Dice达0.716±0.006,优于UA-MT的0.710;无腺体掩码阶段Precision为0.694,明显高于SAM/MedSAM的0.30–0.34。

The Invisible Hand of Physics: When Video Diffusion Models Know More Than They Show Figure 1
2026-06-05cs.GR

The Invisible Hand of Physics: When Video Diffusion Models Know More Than They Show

Parsa Esmati, Somjit Nath, Katja Hofmann, Derek Nowrouzezahrai, Samira Ebrahimi Kahou, Majid Mirmehdi

University of Bristol, McGill University, Mila–Quebec AI Institute, University of Calgary, can arise as a byproduct of generative denoising. Code is available here.

2026-06-05视觉感知生成模型

面向将视频扩散模型用作机器人世界模拟器的需求,论文追问其逼真视频背后是否真的含有物理结构。作者通过反向积分采样轨迹,从真实视频恢复扩散过程中的内部状态并做线性探测与干预,发现物理合理性不在 VAE 输入中,却在去噪 Transformer 中涌现;在 IntPhys、InfLevel 上平均约 81.27% 准确率,并优于 V-JEPA、VideoMAE 等表征基线。

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation Figure 1
2026-06-05cs.CV

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

Tobia Poppi, Silvia Cappelletti, Sara Sarto, Florian Schiffers, Garin Kessler, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

University of Modena and Reggio Emilia, University of Pisa, aimagelab.github.io/cross-model-safety-representations

2026-06-05安全鲁棒

针对生成式图像/视频模型安全控制常需为每个目标模型重训或接触不安全数据的问题,本文提出跨模型安全转向:在源 LLM 中由安全/不安全提示估计安全方向,再用仅含良性提示的轻量对齐映射到目标生成器,并支持类别化多向量控制。实验覆盖多种文生图与文生视频模型,显示转移方向可显著降低攻击成功率,CLIP/FID 质量权衡接近甚至超过使用目标端不安全数据学习的本地基线。

Personal AI Agent for Camera Roll VQA Figure 1
2026-06-05cs.CV

Personal AI Agent for Camera Roll VQA

Thao Nguyen, Krishna Kumar Singh, Donghyun Kim, Yong Jae Lee, Yuheng Li

University of Wisconsin-Madison, Korea University

2026-06-05视觉感知

论文关注个人相册问答中“照片多、时间跨度长、语境强”的检索与推理难题,指出直接长上下文或普通RAG难以保留身份、关系和事件线索。作者构建含50名用户、31476张照片、2500个问答的camroll,并提出带层次化记忆和少量导航工具的camroll-agent。实验显示其优于多种基线,凸显个性化视觉记忆不同于文本长上下文,需要专门的数据与代理机制。

NIV: Neural Axis Variations for Variable Font Generation Figure 1
2026-06-05cs.CV

NIV: Neural Axis Variations for Variable Font Generation

Nadav Benedek, Ariel Shamir, Ohad Fried

Reichman University, variable font from a static font remains a labor-intensive process requiring expert, flexibility in responsive design and typography. However, creating a variable font is a labor-intensive

2026-06-05视觉感知

针对静态字体转可调变量字体仍依赖人工设计多套母版与 gvar 位移的问题,NIV 直接在矢量字形控制点上学习轴条件形变,并用 Property Embedding 建模粗细、宽度、倾斜、光学尺寸等多轴交互,再分层写入 OpenType fvar/gvar 元组。基于 Google Fonts 百万级变体元组训练后,模型可为未见字体、Unicode 字符、复杂 CJK 甚至手写输入生成可连续插值的标准 TTF;但字距、hinting 等字体级排版能力仍未充分覆盖。

VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding Figure 1
2026-06-05cs.CV

VideoKR: Towards Knowledge- and Reasoning-Intensive Video Understanding

Lin Fu, Zheyuan Yang, Yang Wang, Tingyu Song, Arman Cohan, Yilun Zhao

2026-06-05视觉感知

论文指出现有视频训练集偏日常感知,难支撑需要领域知识和多步推理的理解任务。VideoKR的核心是重新做数据:收集145K个CC授权专家域视频,生成315K个按基础推理、知识增强感知、知识密集推理划分的QA/CoT,并配套更难由单帧或文本捷径解答的VideoKR-Eval。实验在标准SFT→GRPO下显示,后训练模型在知识密集视频推理上优于既有后训练方案,通用视频推理仍保持竞争力,增益可能主要来自数据设计。

Oklch+: A Three-Parameter Extension of Oklab for Improved Color Difference Prediction Figure 1
2026-06-05eess.IV

Oklch+: A Three-Parameter Extension of Oklab for Improved Color Difference Prediction

Naoyuki Uchida

2026-06-05视觉感知

论文针对 Oklab/Oklch 适合设计插值但颜色差异预测弱于 CIEDE2000 的问题,提出 Oklch+:仅用 3 个参数对亮度轴做幂变换、对彩度轴做 Naka-Rushton 饱和压缩,再在变换坐标中计算欧氏距离。其核心洞察是区分外观均匀性与辨别均匀性,并直接用超阈值色差数据优化。COMBVD 上 STRESS 为 29.09,接近 CIEDE2000 的 29.13,显著优于 Oklab,但验证仍主要限于 sRGB 中心数据。

Flash-WAM: Modality-Aware Distillation for World Action Models Figure 1
2026-06-05cs.LG

Flash-WAM: Modality-Aware Distillation for World Action Models

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

Northeastern University, University of Georgia, EmbodyX Inc.

2026-06-05强化学习

Flash-WAM针对世界-动作模型虽能联合预测未来视频与机器人动作、但扩散去噪步数过多而难以实时控制的问题,指出视频与动作因SNR噪声日程不同导致普通一致性蒸馏在低噪声动作流中梯度衰减。其按模态选择一致性函数:视频用方差保持参数化,动作用线性梯度缩放。基于LingBot-VA,单步推理将RoboTwin延迟从8.1秒降至348毫秒,成功率保持在85.5%,LIBERO为95.7%,真机平均60%。

Drishti AI-Event Guardian: An Intelligent Real-Time Crowd Monitoring and Emergency Response System for Mass Gathering Events Figure 1
2026-06-05cs.CY

Drishti AI-Event Guardian: An Intelligent Real-Time Crowd Monitoring and Emergency Response System for Mass Gathering Events

Ritabrata Roy Choudhury, Arkajyoti Karmakar, Rudra Pratap Mitra

School of Computer Engineering, Kalinga Institute of Industrial Technology, School of Electronics Engineering, processing and elastic scalability., provide a scalable, replicable foundation for deployment across event contexts ranging from localized

2026-06-05视觉感知

面向大型集会中人工监控滞后、拥挤踩踏和应急调度低效的问题,论文提出 Drishti,将 CCTV/UAV 视觉、YOLOv8 密度估计、多相机融合、异常检测、5 分钟拥堵预测与失踪人员识别、医疗上报、聊天机器人和保安重分配整合为云端系统。在 Kumbh Mela 与 RCB 游行案例中,密度 MAE 为 3.2 人/m²,异常检测 F1=0.91,告警中位延迟 111 ms,调度延迟较人工降低 34%。

Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing Figure 1
2026-06-05cs.HC

Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing

Yixuan Ding, Wei Huang, Ruijie Quan, Xiaojuan Qi, Yi Yang

♠Zhejiang University, ♢The University of Hong Kong, lability driven by diffusion-based frameworks [28, 31], it

2026-06-05视觉感知数据集/基准

本文关注图像编辑中“看起来合理但逻辑不对”的问题,指出现有模型多停留在表层指令匹配,难处理隐含的物理、环境、文化、因果和指代约束。作者提出 RE-Edit 基准,含 1000 个样本和分维度评测,并评测 12 个开源/商业编辑模型,发现先进模型仍频繁违反隐含逻辑;其轻量后处理 EditRefine 通过显式推理改写指令,在不改底座模型的情况下稳定提升推理正确性。

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue Figure 1
2026-06-05cs.RO

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

† denotes the corresponding author 1 College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China., Shanghai Innovation Institute, Shanghai, China., Mechanical Systems Control Lab, UC Berkeley, California, USA.

2026-06-05视觉感知

本文针对现实机器人指令常含歧义、现有 VLA 多被动执行且缺少澄清机制的问题,提出 Ask-to-Clarify:先用 VLM 进行多轮追问消解歧义,再通过连接模块把澄清后的语义转为扩散动作模型条件,并以两阶段“知识隔离”训练保留对话能力。真实世界 8 个操作任务中,该方法较 π0、π0-FAST、OpenVLA-OFT 等 VLA 表现更好,显示主动澄清可提升协作式具身操作可靠性。

2026-06-04

118 篇
Controllable Dynamic 3D Shape Generation via 3D Trajectories and Text Figure 1
2026-06-04cs.CV

Controllable Dynamic 3D Shape Generation via 3D Trajectories and Text

Jaeyeong Kim, Ines Kim, Jahyeok Koo, Seungryong Kim

Project Page : https://cvlab-kaist.github.io/T2Mo

2026-06-04规划控制三维

针对仅靠文本难以精确控制动态三维物体运动的问题,T2Mo将用户在网格点上指定的3D轨迹作为空间约束,并与文本语义共同条件化扩散式前馈生成器;其关键在于形状锚定的轨迹嵌入,把稀疏、密集或不均匀轨迹统一映射为覆盖全物体的形状感知token。实验与用户研究显示,相比文本基线和视频级联方案,它在轨迹对齐、运动表达性和主观偏好上更好,同时基本保持运动质量。

An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers Figure 1
2026-06-04cs.CV

An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers

Gandhimathi Padmanaban, Fred Feng

2026-06-04视觉感知

面向骑行者超车安全分析中缺少可扩展、细粒度车型标注工具的问题,本文将预训练 RT-DETR 粗检测与微调 ViT-Base/16 车型分类串联,并用置信度拒判减少低置信误报,区分轿车、SUV、皮卡等六类。系统在 Ann Arbor 3805 个事件上准确率 0.94,跨域开放骑行数据无需重训达 0.89,主要退化集中在面包车类且更多表现为拒判而非错判。

GeM-NR: Geometry-Aware Multi-View Editing for Nonrigid Scene Changes Figure 1
2026-06-04cs.CV

GeM-NR: Geometry-Aware Multi-View Editing for Nonrigid Scene Changes

Josef Bengtson, Yaroslava Lochman, Fredrik Kahl

2026-06-04视觉感知

多视角编辑在非刚性场景变化中常因原始几何失效而难以保持一致。GeM-NR的关键洞察是从已编辑锚视图重建编辑后几何,并将其投影到查询视角,再结合未编辑查询图作为条件交给多参考编辑模型细化,无需训练或逐场景优化。实验显示其在大幅几何与外观修改、编辑3D Gaussian生成中提升了几何和光度一致性,单图约数秒。

Geometry Gaussians: Decoupling Appearance and Geometry in Gaussian Splatting Figure 1
2026-06-04cs.GR

Geometry Gaussians: Decoupling Appearance and Geometry in Gaussian Splatting

Hongyu Zhou, Zorah Lähner

2026-06-04三维

本文针对 3D Gaussian Splatting 中外观渲染与几何重建共用同一 opacity 导致的冲突,尤其是透明/半透明物体颜色来自后方而几何位于表面的情况,提出为每个 Gaussian 额外加入 geometry opacity,仅用于深度、法线和几何正则,从而轻量解耦颜色贡献与几何占据。作者还结合视觉基础模型几何输入设计透明感知优化流程;在 NeRF Synthetic、DTU、TransLab 和 Mip-NeRF 等数据集上,方法在不降低常规场景渲染的同时提升几何与渲染质量,透明物体收益最明显。

Continual Visual and Verbal Learning Through a Child's Egocentric Input Figure 1
2026-06-04cs.CV

Continual Visual and Verbal Learning Through a Child's Egocentric Input

Xiaoyang Jiang, Yanlai Yang, Kenneth A. Norman, Brenden Lake, Mengye Ren

Agentic Learning AI Lab, New York University, Department of Psychology, Princeton University

2026-06-04视觉感知

这篇论文针对以往儿童视角词义学习模型依赖离线打乱、多轮遍历数据而缺乏认知真实性的问题,提出 BabyCL:按时间顺序单遍处理 SAYCam,用多阶段时间分段、视觉/多模态双重回放缓冲和共享骨干上的三种对比损失联合学习视觉表征与图文对齐。在相同优化预算下,它在 SAYCam Labeled-S 4AFC 上优于流式基线,接近离线训练上界,且对分段窗口和缓冲淘汰策略较稳健。

Who Needs Labels? Adapting Vision Foundation Models With the Metadata You Already Have Figure 1
2026-06-04cs.CV

Who Needs Labels? Adapting Vision Foundation Models With the Metadata You Already Have

Elouan Gardès, Seung Eun Yi, Kartik Ahuja, Théo Moutakanni, Huy V. Vo, Piotr Bojanowski, Wolfgang M. Pernice, Loïc Landrieu, Camille Couprie

Who Needs Labels? Adapting Vision Foundation, Meta FAIR, Paris, 2LIGM, CNRS, Gustave Eiffel, ENPC, IP Paris, 3Columbia University, New York, We propose a label-free approach to adapt powerful but generic vision foundation models to specialized, scientific domains. Standard supervised fine-tuning is often ill-suited to these settings: labels are scarce, domain-specific state of the art, while using no task labels for backbone adaptation and only lightweight, correlated to these variations, and which are available at virtually no extra cost., In scientific settings, however, labels are often scarce or expensive [16], and fine-tuning can overfit task-, Unsupervised domain adaptation instead leverages unlabelled data from the target distribution [18, 19], but, application domain without task labels, then evaluating the frozen adapted representation with lightweight, We propose FINO (FIne tuning with NO labels), a unified framework for metadata-driven representation, labels, adapt a generic foundation model to a new application domain without task labels (b). The resulting representations

2026-06-04视觉感知

科学影像中标签稀缺且分布偏移明显,直接监督微调容易过拟合任务并损害基础模型泛化。本文提出 FINO,把已有采集元数据作为弱监督,与自监督目标结合,既支持高基数离散元数据也支持连续元数据,用于保留有用因素、抑制批次等伪相关。实验覆盖显微、遥感、野生动物与胸片,冻结骨干加轻量探针即可优于无监督域适应和监督微调,并达到或超过部分领域专用 SOTA。

Identifying Gems from Roman RAPIDly Figure 1
2026-06-04cs.LG

Identifying Gems from Roman RAPIDly

Karan Gandhi, Ashish A. Mahabal, Jacob E. Jencson, Russ R. Laher, Ben Rusholme, Lin Yan, Ryan M. Lau, Schuyler D. Van Dyk, Mansi M. Kasliwal

Department of Computer Science and Engineering, Indian Institute of Technology, Gandhinagar, India, Division of Physics, Mathematics, and Astronomy, California Institute of Technology, Pasadena, CA 91125, USA, Center for Data Driven Discovery, California Institute of Technology, Pasadena, CA 91125, USA, IPAC, California Institute of Technology, 1200 E. California Blvd, Pasadena, CA 91125, USA, Caltech Optical Observatories, California Institute of Technology, Pasadena, CA 91125, USA

2026-06-04视觉感知

Roman 望远镜将产生海量时域红外告警,但发射前缺乏真实数据训练去伪存真模型。本文面向 RAPID 差分流水线提出 RuBR:结合图像与特征编码、旋转不变嵌入,并用本地注入与 OpenUniverse2024 模拟数据及域自适应方案应对仿真到真实的落差。在 OU24 上报告精度 90.10%、召回 71.68%,显示可用于早期告警过滤,但召回受 PSF、星系核残差和数据不平衡限制。

ZipSplat: Fewer Gaussians, Better Splats Figure 1
2026-06-04cs.CV

ZipSplat: Fewer Gaussians, Better Splats

Alexander Veicht, Sunghwan Hong, Dániel Baráth, Marc Pollefeys

2026-06-04三维

现有前馈 3D Gaussian Splatting 通常按输入像素生成高斯,预算随分辨率和视角数增长,导致平面/重叠区域冗余。ZipSplat 将场景表示为可聚类压缩的 scene tokens,经注意力融合后解码为自由 3D 位置的高斯,并用几何监督稳定训练;推理时调压缩率即可权衡质量与效率。在无真实位姿/内参设置下,它在 DL3DV、RealEstate10K 达到 SOTA,约少用 6 倍高斯并较最佳 pose-free 基线提升 2.1/1.2 dB PSNR,且可零样本泛化到 Mip-NeRF360 和 ScanNet++。

InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space Figure 1
2026-06-04cs.CV

InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space

Jiarui Wu, Yujin Wang, Ruikang Li, Fan Zhang, Mingde Yao, Tianfan Xue

Shanghai AI Laboratory, 2 CUHK MMLab, 3 CPII under InnoHK

2026-06-04视觉感知

本文针对扩散式指令修图易改动内容且推理慢的问题,主张将修图限制在与内容解耦的双边空间中:模型一次预测低分辨率仿射双边网格,经引导图切片后作用于原图,并用VSD、提示对齐和渐进蒸馏吸收扩散先验。在新建 iRetouch 基准上,方法相较 FLUX、Qwen、Gemini 等减少内容漂移,保持相近指令跟随能力,同时延迟提升约 70–800 倍。

MaCo-GAN: Manifold-Contrastive Adversarial Learning for Single Image Super-Resolution Figure 1
2026-06-04cs.CV

MaCo-GAN: Manifold-Contrastive Adversarial Learning for Single Image Super-Resolution

Daeyoung Han, Seongmin Hwang, Moongu Jeon

Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology, Gwangju, Republic of Korea

2026-06-04视觉感知生成模型

针对感知型单图超分中传统 GAN 判别器只看整体自然度、易产生幻觉伪影和训练不稳的问题,MaCo-GAN 将对抗损失改为监督式流形对比目标,并用可控假样本合成器生成保持低分辨率对应的正负样本,引导生成器靠近低失真解、远离高失真解。实验显示,在多个基准上替换基线对抗项即可改善感知—失真权衡,消融也支持合成样本与对比博弈的作用。

UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD Figure 1
2026-06-04cs.CV

UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

Jingyuan Chen, Sheng Jin, Haopeng Sun, Wentao Liu, Chen Qian

2026-06-04数据集/基准

针对CAD研究长期按单一模态或单一任务割裂、缺少统一评测的问题,UniCAD构建覆盖文本、图像/草图、点云到CAD及CAD问答的多模态多任务基准,并提出UniCAD-MLLM,用模态专属编码器映射到共享几何-语义空间,生成可执行可编辑的Python/CadQuery脚本。实验称其在UniCAD和Fusion360上全面优于任务专用与多任务基线,但具体增益可能同时来自统一数据与模型规模。

Anchor3R: Streaming 3D Reconstruction with Transient Anchors for Long-Horizon Visual Mapping Figure 1
2026-06-04cs.CV

Anchor3R: Streaming 3D Reconstruction with Transient Anchors for Long-Horizon Visual Mapping

Peilin Tao, Chong Cheng, Yuansen Du, Caiwei Song, Zhengqing Chen, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Hainan Cui, Shuhan Shen

2026-06-04三维

面向长时程在线视觉建图,现有前馈式流式重建常被首帧或持久记忆的固定坐标系束缚,导致注意力偏置与漂移累积。Anchor3R 的核心是把当前帧作为临时锚点,预测窗口相对位姿和局部点图,并用仅缓存图像状态的 pose-query Transformer 生成相对测量,再通过运动图、回环重插入与运动平均做全局对齐。实验覆盖室内、室外、驾驶和 RGB-D 场景,报告其在长序列位姿精度和稠密重建质量上优于流式基线,并可在有界显存下运行。

MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation Figure 1
2026-06-04cs.CV

MetaPoint: Unlocking Precise Spatial Control in Agentic Visual Generation

Dewei Zhou, Xinyu Huang, Xun Wang, Ji Xie, Yabo Zhang, Liang Li, Kunchang Li, Zongxin Yang, Yi Yang

2026-06-04规划控制

本文针对统一多模态生成模型难以把文本中的数值坐标精确映射到图像画布的问题,提出 MetaPoint:用一个带连续二维位置编码的特殊 <mp> token 复用模型原生位置编码,实现无需改架构的像素级点/框/布局控制,并由 VLM 规划器把高层需求转为组合式空间指令。实验在 COCO-MIG、T2I-CoReBench、ImgEdit 上显著优于既有方法,mIoU 从 59.23% 提升到 77.29%,且可扩展到 30 个物体和多对象编辑。

Handwriting Extraction and Analysis of Signature Lists in Swiss Popular Initiatives Figure 1
2026-06-04cs.CV

Handwriting Extraction and Analysis of Signature Lists in Swiss Popular Initiatives

Marco Peer, Thomas Gorges, Mathias Seuret, Vincent Christlein, Andreas Fischer

AIBEX Group, University of Fribourg, Pattern Recognition Lab, FAU Erlangen-Nürnberg

2026-06-04视觉感知

针对瑞士公民倡议签名表仍依赖人工核验、重复签名排查成本高的问题,论文构建了从模板匹配/行分割到OCR与书写者检索的文档分析流程。核心洞察是短姓名、地址等离词表手写内容使通用OCR不可靠,最佳名字识别CER仍为29.6%;相比之下,基于笔迹相似性的书写者检索更适合作为辅助筛查工具,mAP达50.6%、Top-10准确率86.6%。

CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation Figure 1
2026-06-04cs.CV

CIPER: A Unified Framework for Cross-view Image-retrieval and Pose-estimation

Yurim Jeon, Dongseong Seo, Seung-Woo Seo

2026-06-04视觉感知三维

CIPER针对跨视角地理定位中“检索范围大但精度受限、位姿估计精但搜索窄”的割裂问题,将城市级航拍图检索与3-DoF位姿回归统一到同一Transformer框架;通过共享编码器中的任务 token 分离全局检索与空间线索,并用双向交叉注意力解码器缓解地面/空中视角域差异。其在VIGOR、KITTI和Ford Multi-AV上表现出有竞争力的检索与定位精度,尤其在视野受限和任意朝向场景更稳健。

M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks Figure 1
2026-06-04cs.CV

M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks

Jie Huang, Ruixun Liu, Sirui Sun, Xinyi Yang, Yin Li, Yixin Zhu, Yiwu Zhong

School of Intelligence Science and Technology, Peking University, State Key Laboratory of General Artificial Intelligence, Peking University, Yuanpei College, Peking University, Institute for Artificial Intelligence, Peking University, School of Psychological and Cognitive Sciences, Peking University, University of Wisconsin-Madison

2026-06-04视觉感知数据集/基准

长视频多模态模型虽有更长上下文,但现有基准多测感知/推理,难以隔离“记住什么、保真度和抗干扰”。M³Eval借鉴认知心理学,把分心注意、记忆干扰、交错事件组织和N-Back符号记忆设计成受控视频问答。实验显示,多种模型在并行视频中表征混淆,时间来源定位弱于空间,干扰模式不同于人类,符号记忆和过滤无关信息能力仍明显不足。

Multi-Camera AR Guidance System for Surgical Instrument Handling and Assembly: Investigating Workload and Efficiency Figure 1
2026-06-04cs.CV

Multi-Camera AR Guidance System for Surgical Instrument Handling and Assembly: Investigating Workload and Efficiency

Shiyu Li, Julian Kreimeier, Hannah Schieber, Dirk Müller, Bernhard Kainz, Rüdiger von Eisenhart-Rothe, Daniel Roth

2026-06-04视觉感知

针对手术中巡回/器械护士面对陌生、复杂器械时认知负荷高、纸质说明易造成中断的问题,论文提出无需标记的多相机6D位姿估计驱动AR头显指导系统,用合成数据训练并通过已知器械实现动态标定,叠加取放提示与装配动画。技术评估优于CosyPose;29名护士模拟膝关节置换实验中,相比纸质手册任务时间减少21.3%(4.76分钟)、主观负荷降低,错误率相近,收益主要体现在经验较少者。

Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning Figure 1
2026-06-04cs.CV

Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning

Yu Zhu, Yongkang Li, Wenjie Zhu, Haoyi Jiang, Wenyu Liu, Wei Yang, Bin Li, Xinggang Wang

2026-06-04视觉语言视觉感知强化学习

针对食物图像中食材遮挡、烹饪差异导致的营养推理不稳定,以及高质量热量标注稀缺问题,Food-R1构建了含热量、饮食建议和CoT推理标注的CalorieBench-80K,并以多任务VLM结合CoT冷启动蒸馏与GRPO强化微调,支持热量估计、食材识别、食谱生成等任务。实验显示其在CalorieBench-80K及代表性食物基准上稳定优于强基线,但具体增益中数据扩充与强化学习的相对贡献仍需结合消融判断。

Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance Figure 1
2026-06-04cs.CV

Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

Kaustav Kundu, Ritvik Shrivastava, Maxim Arap, Nanshu Wang, Xianhui Zhu, Quintin Fettes, Gautam Tiwari, Parth Suresh, Théo Moutakanni, Alejandro Castillejo Munoz, Allen Bolourchi, Pascale Fung, Pinar Donmez, Babak Damavandi, Anuj Kumar, Seungwhan Moon

2026-06-04数据集/基准

论文针对程序性任务中用户常偏离标准步骤、现有具身视频基准缺少偏离与恢复标注的问题,提出 PWR:发布含 OOP 恢复指导的 EgoProactive,并将五个数据集统一重标为 Pro²Bench,同时采用规划器与实时交互模型解耦的架构。实验显示,经后训练的 Llama-4 在六个数据集上显著优于多种闭源和开源 VLM,Oracle 计划下 G-Mean F1 可达 0.84,偏离恢复收益明显。

Scene-Centric Unsupervised Video Panoptic Segmentation Figure 1
2026-06-04cs.CV

Scene-Centric Unsupervised Video Panoptic Segmentation

Christoph Reich, Oliver Hahn, Nikita Araslanov, Laura Leal-Taixé, Christian Rupprecht, Daniel Cremers, Stefan Roth

University of Oxford, Instance Labeling, Semantic Labeling, Pseudo-Labels, to generate scene-centric panoptic video pseudo-labels and train a video panoptic segmentation model using a novel Video DropLoss., temporally consistent panoptic video pseudo-labels from, tion, and visual cues. Training on these pseudo-labels us-, strong label-efficient learning. With VideoCUPS, our eval-, source intensive [23]. Extending labeling efforts to the tem-, ited scalability and label quality [21, 114, 117]. Despite the, scalable annotation-free alternatives [41, 48, 93, 111]., bining semantic pseudo-labels from STEGO [42] and in-

2026-06-04视觉感知

针对视频全景分割依赖昂贵逐帧像素与实例标注的问题,论文提出无监督 VPS 设定和 VideoCUPS:仅用单目场景视频中的自监督视觉特征、深度与运动线索生成时序一致的全景伪标签,并用 Video DropLoss 训练模型。在 Cityscapes-VPS 上 STQ 达 22.2%,优于多种由无监督图像/视频方法组合的基线,并在 KITTI-STEP、Waymo、MOTS 上展示跨域与少标注学习潜力。

Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models Figure 1
2026-06-04cs.CV

Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models

Tran Dinh Tien, Zhiqiang Shen

Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence

2026-06-04视觉语言视觉感知

针对生物医学 VLM 少样本提示调优中只强化真类、忽略疾病类别语义关系而导致边界不稳和过度自信的问题,论文提出 OGKD:用冻结文本原型构建类别相似图,重塑教师分布,并在全局图像 token 与标签引导的局部 patch token 上蒸馏几何信息。11 个医学数据集上,在 base-to-novel 与 few-shot 设置中较既有适配方法平均提升 1.7%–2.8%,同时降低风险覆盖曲线面积,显示更可靠的选择性预测。

Toward Multi-Domain and Long-Tailed Quantization via Feature Alignment and Scaling Figure 1
2026-06-04cs.LG

Toward Multi-Domain and Long-Tailed Quantization via Feature Alignment and Scaling

Chin-Yuan Yeh, Ting-An Chen, De-Nian Yang, Ming-Syan Chen

C. Y. Yeh is with the Graduate Institute of Communication Engineering, National Taiwan University, Taiwan, and with the Institute of Information Science, Academia Sinica, Taiwan., T. A. Chen is with the Graduate Institute of Electrical Engineering, National Taiwan University, Taiwan, and with the Institute of Information Science, Academia Sinica, Taiwan., D. N. Yang is with the Institute of Information Science and the Research Center for Information Technology Innovation, Academia Sinica, Taiwan.

2026-06-04视觉感知

这篇论文关注低比特量化在真实视觉感知数据中的两类失效:多域分布偏移和长尾类别会放大量化误差、损害少数类。作者提出 EmaQ,用 CDF 特征对齐、近似量化梯度和敏感度加权聚合稳定多域训练,并扩展 EmaQ-LT,通过类别方差缩放、均衡损失和置信度 logit 调整抑制多数类过度自信。实验覆盖 Office-31、Digits、CIFAR-LT 等,显示在低比特设置下较现有方法更稳健,但具体增益可能主要来自 scaling 与重加权机制。

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine Figure 1
2026-06-04cs.CV

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

2026-06-04视觉语言

该文针对乳腺癌临床流程中筛查、诊断、治疗规划依赖不同影像且现有医疗 MLLM 多停留在单模态/单任务的问题,构建了覆盖 5 种模态、17 个子数据集和 136 类任务的 BreastStage,并提出带双分支视觉编码器与概念保留 token 压缩的 BreastGPT,以统一处理常规放射影像和千兆像素病理切片;在 BreastStage-Bench 上取得 75.66% 闭集准确率和 89.92% 开放题得分,显著超过通用及医疗 MLLM,但部分收益可能主要来自 workflow-aligned 数据规模。

CDPM-Align: Multi-Scale Guidance-Aligned Diffusion Pretraining for Robust Few-Shot Anatomical Landmark Detection Figure 1
2026-06-04cs.CV

CDPM-Align: Multi-Scale Guidance-Aligned Diffusion Pretraining for Robust Few-Shot Anatomical Landmark Detection

Roberto Di Via, Irina Voiculescu, Francesca Odone, Vito Paolo Pastore

2026-06-04视觉感知生成模型安全鲁棒

面向医学 X 光少样本解剖标志点检测,论文关注临床部署中仅有坐标精度不足、还需热图不确定性集中和鲁棒性的问题。CDPM-Align 用数据集索引条件化扩散预训练,并将 classifier-free guidance 的条件/无条件特征差作为结构信号,在多尺度、跨噪声步对齐其方向一致性,再用 10/25 张标注图微调。三项公开小规模基准上,相比监督、SSL 和既有方法在定位精度、ERE 不确定性与鲁棒性上均有一致改进。

Hierarchical Space Partition for Surface Reconstruction Figure 1
2026-06-04cs.CV

Hierarchical Space Partition for Surface Reconstruction

Minjie Tang, Xiangfei Li

Huazhong University of Science and Technology

2026-06-04三维

面向 LiDAR/MVS 点云中遮挡和视距限制导致的缺失区域,本文改进平面组装式表面重建:按可见性将平面分为高可见、弱可见和由结构分析恢复的不可见平面,并赋予不同层级与生长速度进行层次空间划分,再用 min-cut 判定内外生成水密网格。实验在多类公开数据上显示其能减少冗余划分、保持模型紧凑,并更好补全局部缺失细节。

HD-DinoMoE: A Class-Aware Hierarchical Dual Mixture-of-Experts Network for Scleral Anomaly Segmentation in Complex Acquisition Scenarios Figure 1
2026-06-04cs.CV

HD-DinoMoE: A Class-Aware Hierarchical Dual Mixture-of-Experts Network for Scleral Anomaly Segmentation in Complex Acquisition Scenarios

Yinxiang Yu, Maoxiang Chu, Qi Niu, Guanghu Liu, Wei Xu, Haotian Wang, Zhi Chen, Yutian Zhu, Yuelong Fan, Guanghao Liao

2026-06-04视觉感知

针对中医目诊中巩膜血管、色斑与血斑等异常依赖主观判断、且临床/移动采集存在域差异和高光干扰的问题,论文提出HD-DinoMoE:用双流DINOv3特征融合、类别感知MoE解码、冻结路由训练及PCP/CA-ASW损失提升多标签像素分割,并构建ML-SASD数据集。在Mix设置下取得72.11% mean Dice、58.44% mean IoU,并在SBVPI血管子集上表现出一定泛化能力。

DiverAge: Reliable Pluralistic Face Aging with Cross-Age Identity Relation Guidance Figure 1
2026-06-04cs.CV

DiverAge: Reliable Pluralistic Face Aging with Cross-Age Identity Relation Guidance

Yueying Zou, Peipei Li, Qianrui Teng, Dianyan Xu, Zekun Li

Zou, Peipei Li, Qianrui Teng, and Dianyan Xu are with the School of Artificial Intelligence, Beijing University of Posts

2026-06-04视觉感知

本文针对人脸老化生成中“多样但不成序”或“成序但单一”的矛盾,提出 DiverAge 将老化建模为兼顾同龄候选多样性与跨年龄序列可靠性的轨迹生成问题。其核心是在扩散自编码框架中用随机解码保留外观变化,并以真实同身份跨龄相似度构建 CIS 先验,通过无需训练参数的 CARR 在采样时约束身份漂移。实验显示该方法提升序列级年龄顺序一致性,同时基本维持身份、年龄准确性、图像质量和多样性。

MAOAM: Unified Object and Material Selection with Vision-Language Models Figure 1
2026-06-04cs.CV

MAOAM: Unified Object and Material Selection with Vision-Language Models

Jaden Park, Valentin Deschaintre, Jason Kuen, Kangning Liu, Iliyan Georgiev, Krishna Kumar Singh, Yong Jae Lee, Michael Fischer

University of Wisconsin-Madison, University of Wisconsin-Madison USA

2026-06-04视觉语言视觉感知

MAOAM针对交互式编辑中对象选择与材质选择割裂、且文本/点击模态难以统一的问题,提出用VLM理解选择意图并由分割头输出像素级掩码的统一框架。其关键在于构建真实与合成材质掩码,并用VLM生成细粒度材质描述与VQA辅助训练。实验显示其在对象、材质及多种交互场景下获得更连贯准确的选择,且文本+点击在推理时出现额外增益。

Recent Advances and Trends in Learning-based 3D Representations Figure 1
2026-06-04cs.CV

Recent Advances and Trends in Learning-based 3D Representations

Adrien Schockaert, Hamid Laga, Hazem Wannous, Vincent Magnier, Guillaume Dufaye, Jean-françois Witz

2026-06-04三维

本文动机是三维重建、渲染与机器人/自动驾驶等应用中,表示形式直接决定效率、可微性、可编辑性和下游兼容性。核心洞察是把点云、网格、体素、SDF/NeRF与3D Gaussian Splatting等统一为可查询函数框架,按显式/隐式、表面/体积、离散/连续梳理取舍。主要结果是给出面向学习式3D表示的分类图谱、应用关联与开放挑战;文中未充分说明新的实证增益。

IRIS-GAN: Staged Specialist Detection of Deepfake Faces Figure 1
2026-06-04cs.CV

IRIS-GAN: Staged Specialist Detection of Deepfake Faces

Jaume M. Trenchs, Veronica Sanz

2026-06-04视觉感知生成模型

针对深伪人脸检测在未见生成器上易失效的问题,本文将任务限定为GAN人脸取证,而非通用合成图检测,并提出按ProGAN到StyleGAN/EG3D等逐步引入、同时保留旧生成器的阶段式专家训练。结果显示,相比一次性二分类训练,该策略改善跨GAN迁移,最终在所测GAN家族上伪造检出率超过99%,外部真实人脸准确率98.9%;Grad-CAM还表明响应模式具有生成器相关性,但扩散模型测试显示其适用域仍有限。

MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU Figure 1
2026-06-04cs.CV

MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU

Kun Cheng, Songshuo Lu, Sicong Liao, Tankun Li, Yafei Zhang, Dong Yang, Qiheng Lv, Hua Wang, Zhi Chen, Yaohua Tang

2026-06-04视觉感知

面向新模型中大量长尾算子融合带来的手写 GPU kernel 成本,MusaCoder 将原生 CUDA/MUSA kernel 生成视为可执行验证的代码对齐问题。其核心在于渐进式内核数据合成、保留多样性的 RFT,以及 MooreEval 驱动的多轮 RL,并用 PrimeEcho、BDR、MirrorPop 缓解稀疏奖励、作弊和离策略漂移。在 KernelBench 与 MUSA 迁移版上,9B 已接近或超过闭源前沿模型,27B 刷新正确率与速度表现,但增益中数据与 scaling 占比仍未充分说明。

Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification Figure 1
2026-06-04cs.SD

Drift-Augmented Scoring: Text-Derived Noise Robustness for Zero-Shot Audio-Language Classification

Tu Vo, Sheir Zaheer, Chan Y. Park

2026-06-04安全鲁棒

针对 CLAP 等音频-语言模型在噪声下零样本分类显著退化的问题,论文提出 DAS:用噪声短语在文本编码空间中为每个类别预先估计“漂移方向”,推理时在原余弦分数上加入类条件漂移奖励,不改音频嵌入、无需梯度或测试批。基于 LAION CLAP,在 UrbanSound8K 和 FSD50K 多个 SNR 设置下均优于并行方法,分别提升约 2.60–5.75 个准确率点和 1.50–1.74 mAP。

3D Temporal Analysis for Autism Spectrum Disorder Screening During Attention Tasks Figure 1
2026-06-04cs.CV

3D Temporal Analysis for Autism Spectrum Disorder Screening During Attention Tasks

Inam Qadir, Elizabeth B Varghese, Dena Al-Thani, Marwa Qaraqe

College of Science and Engineering, Hamad Bin Khalifa University, Qatar Foundation, Doha, Qatar

2026-06-04三维

针对学龄儿童 ASD 筛查依赖主观量表且 2D 视频难以刻画空间位移的问题,论文用 DECA 提取含 Tx/Ty/Tz 的 3D 头姿与姿态解耦的面部表情,并用 LSTM/GRU建模 VR-CPT 注意任务中的时序行为。在 39 名儿童数据上,GRU 的 3D 头姿达 83.9%、3D 表情达 81.4%,PCA 后多模态融合最高 84.6%,较 2D 基线有约 7.5–10.7 个百分点提升。

OA-CutMix: Correcting the Label Bias of CutMix Figure 1
2026-06-04cs.CV

OA-CutMix: Correcting the Label Bias of CutMix

Tobias Christian Nauen, Stanislav Frolov, Federico Raue, Brian B. Moser, Andreas Dengel

2026-06-04视觉感知

论文指出 CutMix 用裁剪面积分配软标签会把背景也当作语义贡献,导致约 21.5% 的标签偏差和“幽灵标签”,小目标尤甚。OA-CutMix 保持图像混合不变,利用离线 SAM3 分割掩码按可见物体像素重算标签权重。实验覆盖 4 种架构、6 个数据集和 10 余种混合增强,显示其精度稳定优于 CutMix,并以较低训练开销达到或超过动态混合方法。

Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation? Figure 1
2026-06-04cs.CV

Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation?

Rui Zhao, Kaiming Yang, Jifeng Zhu, Siyang Chen, Ziqi Wang, Weijia Wu, Kevin Qinghong Lin, Heng Wang, Mike Zheng Shou

2026-06-04机器人视觉感知

本文针对“视频生成模型是否真的学到物理世界模型”缺乏直接检验的问题,提出 Dream.exe:把给定场景和任务生成的操作视频,经深度估计、末端轨迹与夹爪时序恢复,转成机器人动作并在仿真中执行。其核心洞察是用任务成功率而非视觉分数衡量可执行性。对 8 个模型、101 个 RoboCasa365 任务的评测显示,部分通用视频模型已有可测成功率,但视觉质量与可执行性相关性弱,长程任务仍明显受限。

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning Figure 1
2026-06-04cs.CV

NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning

Sichao Li, Sai Ma, Daniel Kilov, Secil Yanik Guyot, Zhuang Li, Seth Lazar

The University of Sydney, Australian National University, RMIT University, Johns Hopkins University

2026-06-04视觉感知

论文关注具身/社会场景中智能体不仅要“选对动作”,还要基于可见事实给出合乎规范的理由。NoRA 将第一人称视频规范行动推理改造成开放式候选动作生成,并用事实–理由–动作支持图评估 grounded reasonableness。基于 1420 段视频和 12 个多模态系统实验,模型虽能提出可行行动和部分场景事实,但难以覆盖完整合理行动空间并把动作与正确局部依据绑定。

Fast Cubical Persistent Homology on 2D and 3D Images via Union-Find, Pruning, and Lookup Tables Figure 1
2026-06-04cs.CV

Fast Cubical Persistent Homology on 2D and 3D Images via Union-Find, Pruning, and Lookup Tables

Titouan Le Breton, Karol Szustakowski, Marie Piraud

Institute of AI for Health, Helmholtz Munich, Neuherberg, Germany

2026-06-04视觉感知三维

针对2D图像和3D体数据中立方复形持久同调计算耗时、占内存的问题,论文提出 Flash Cubical:利用对偶图上的并查集计算最高维持久性,先局部剪枝零持久与已分类单元,再用查表预计算局部信息。单线程基准显示其在V-filtration上相较 GUDHI 和 CubicalRipser 通常更快且更省内存,优势在3D真实体数据上最明显。

Crafting Your Evolving Dreams: Concept-Incremental Versatile Customization Figure 1
2026-06-04cs.CV

Crafting Your Evolving Dreams: Concept-Incremental Versatile Customization

Jiahua Dong, Wenqi Liang, Hongliu Li, Yang Cong, Duzhen Zhang, Hanbin Zhao, Henghui Ding, Yulun Zhang, Salman Khan, Fahad Shahbaz Khan

Hanbin Zhao is with the College of Computer Science and Technology, Zhejiang University, Hangzhou, China.

2026-06-04视觉感知

这篇论文针对个性化扩散模型默认概念集合静态的问题,提出概念增量的多用途定制设定 CIVC,并给出 CCDM:用属性解耦 LoRA 与相关性引导聚合保留旧概念特征、缓解灾难性遗忘,再用可控区域上下文合成减少多概念生成中的概念遗漏。实验显示其在文生图、文生视频、文生 3D 的单/多概念合成、编辑和风格迁移任务上优于现有基线。

A Pathology Foundation Model for Gastric Cancer with Real-World Validation Figure 1
2026-06-04cs.CV

A Pathology Foundation Model for Gastric Cancer with Real-World Validation

Ling Liang, Jiabo Ma, Zhengyu Zhang, Fengtao Zhou, Yingxue Xu, Yihui Wang, Cheng Jin, Zhengrui Guo, On Ki Tang, Zhijian Cen, Zhen Wang, Qi Xie, Chengyu Lu, Chenglong Zhao, Feifei Wang, Yu Cai, Hongyi Wang, Jing Zhang, Yaping Ye, Shijun Sun, Shenglei Li, Yu Wang, Zhenhui Li, Ronald Cheong Kin Chan, Xiuming Zhang, Zhe Wang, Hao Chen, Li Liang

Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China, Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China, Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China, Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China, Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong, Hong Kong SAR, China, Pathology Artificial Intelligence Development and Assessment Laboratory, State Key Laboratory of Translational Oncology, The Chinese University of Hong Kong, Hong Kong SAR, China, Department of Pathology, Shandong Provincial Qianfoshan Hospital, Jinan, China, Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China, Department of Pathology, The First Affiliated Hospital, School of Medicine, Zhejiang University, Hangzhou, China, Department of Pathology, Zhongshan People’s Hospital, Zhongshan, China, Department of Pathology, The First Affiliated Hospital of Zhengzhou University, Zhengzhou, China, Department of Pathology, School of Basic Medicine, Zhengzhou University, Zhengzhou, China

2026-06-04强化学习

针对泛癌病理基础模型在胃癌细粒度诊断、分子预测及真实临床验证上不足的问题,本文提出胃癌专用模型 GRACE:在大规模多中心 H&E 全切片数据上对 Virchow2 进行 LoRA 持续预训练,并用 ABMIL 做下游预测。其在 28 项任务和前瞻队列中优于多种泛癌 PFM,macro-AUC 达 0.9188;读片研究显示 AI 辅助将准确率由 82.0% 提升至 89.9%,并缩短诊断时间。

Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives Figure 1
2026-06-04cs.CV

Z-FLoc: Zero-Shot Floorplan Localization via Geometric Primitives

Ayumi Umemura, Toshinori Kuwahara, Marc Pollefeys, Daniel Barath

2026-06-04视觉感知

本文针对室内相机定位中图像与平面图模态差大、学习方法需环境级重训的问题,提出零样本 floorplan localization。核心洞察是人造环境中的线与圆等几何基元可提供外观无关约束:从单目重建生成 BEV,提取基元并用最小求解器与鲁棒估计匹配平面图。实验显示其在模拟和真实未见环境中优于需目标域训练的学习式方法,并使用固定超参数。

Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control Figure 1
2026-06-04cs.LG

Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control

Jihoon Hong, Alice Chan, Qiyue Dai, Julian Skifstad, Glen Chou

Georgia Institute of Technology

2026-06-04视觉感知规划控制

针对文本到视频模型易生成裸露、暴力等不安全内容且传统微调/过滤易降质或被绕过的问题,论文将生成过程建模为动态系统,提出 LA-LQR:在由对比提示构造的低维激活子空间中估计局部线性动力学,并用 LQR 进行按层、按时间步的闭环最小扰动 steering。实验显示其在概念控制和视频安全基准上比基线更能降低不安全生成,同时较好保持提示一致性与视觉质量。

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models Figure 1
2026-06-04cs.CV

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

Yong Cao, Chuqiao Li, Xianghui Xie, Gerard Pons-Moll, Andreas Geiger

University of Tübingen, Tübingen AI Center, Germany, Max Planck Institute for Informatics, Saarland Informatics Campus, Germany, When domain experts cannot agree on the labels, diversity, controllability, and sampling efficiency., target controllability at the body-part level via

2026-06-04视觉语言视觉感知数据集/基准

针对现有人体运动理解基准语义粗、难度不分层且标注歧义大的问题,本文提出 NextMotionQA:以多选问答、视频描述和细粒度纠错三类任务,交叉身体部位、方向、动作三条语义轴与三档难度,构建 1307 个专家验证样本。对 12 个 VLM 的评测显示,模型没有在所有任务上通吃,位移方向普遍最弱,难度升高会显著降分;将 VLM 用作 T2M 评审时,粗粒度与专家一致性较高 κ=0.70,但部位级细评几乎失效 κ=0.10。

Coarse-to-fine Hierarchical Architecture with Sequential Mamba for Brain Reconstruction Figure 1
2026-06-04cs.CV

Coarse-to-fine Hierarchical Architecture with Sequential Mamba for Brain Reconstruction

Hoang-Son Vo, Van-Hung Bui, Minh-Huy Mai-Duc, Tien-Dung Mai, Soo-Hyung Kim

2026-06-04三维

针对深度视觉表征与人类视觉皮层层级对应关系仍不清晰的问题,论文提出 CHASMBrain:先用双流 Mamba 分离 CLS 全局语义与 patch 局部空间信息预测去噪 ROI 活动,再以 Mamba-VAE 细化到体素级 fMRI。NSD 上 Pearson 达 0.429、MSE 0.261,优于 ridge、DINOv2 探针等基线;消融显示局部流更对应早期视觉区,全局流服务高阶语义,并具备一定跨被试迁移性。

Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms Figure 1
2026-06-04cs.LG

Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms

Chong Zhang, Xiang Li, Jia Wang, Qiufeng Wang, Xiaobo Jin

2026-06-04学习理论安全鲁棒

针对对抗鲁棒评测依赖具体攻击、成本高且解释性不足的问题,本文把输入空间 Fisher 信息矩阵的谱范数作为攻击无关的敏感度指标,并将其与输入 Jacobian 方差及 KL 局部几何联系起来。作者给出 VGG、ResNet、DenseNet、Transformer 等架构的谱界和理论排序,设计幂迭代与 Hutchinson 估计以支持白盒/黑盒计算;在 CIFAR、ImageNet 和医学图像实验中,该指标与对抗脆弱性呈强相关,但更适合作为诊断工具而非替代攻击评测。

Do Foundation Models See Biology? Evaluating Attention Coherence with Spatial Transcriptomics in Glioblastoma Figure 1
2026-06-04cs.CV

Do Foundation Models See Biology? Evaluating Attention Coherence with Spatial Transcriptomics in Glioblastoma

Dilakshan Srikanthan, Amoon Jamzad, Paul Wilson, Nooshin Maghsoodi, Robert Policelli, Gabor Fichtinger, John F. Rudan, Parvin Mousavi

2026-06-04视觉感知

本文关注病理基础模型的注意力图是否真能对应胶质母细胞瘤生物学,而不只是视觉上平滑或可解释。作者用空间转录组作为独立参照,评估5个病理基础模型和ResNet在abMIL分子预测中的高注意区域与87类转录特征的共定位。结果显示内部交叉验证与TCGA外部验证排名会反转,注意力更富集于通路级多基因程序而非单基因事件,且不同编码器关注的生物区室不同。

Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment Figure 1
2026-06-04cs.CV

Physics-Informed Video Generation via Mixture-of-Experts Latent Alignment

Cong Wang, Hanxin Zhu, Jiayi Luo, Yonglin Tian, Xiaoqian Cheng, Peiyan Tu, Xin Jin, Long Chen, Zhibo Chen

2026-06-04视觉感知

针对现有视频生成模型画面逼真但运动与交互常违背物理规律的问题,PILA在冻结的flow-matching视频模型中加入轻量物理潜空间适配器:以可观测运动锚定物理属性代理场,并用提示标签路由到不同物理类别专家,通过残差约束修正向量场。作者在Wan 2.1训练并迁移到Wan 2.2,报告在VBench-2.0、VideoPhy-2和PhyGenBench上兼顾视觉质量与物理合理性达到SOTA。

StrokeTimer: Robust Representation Learning for Ischemic Stroke Onset-Time Estimation from Non-contrast CT Figure 1
2026-06-04cs.CV

StrokeTimer: Robust Representation Learning for Ischemic Stroke Onset-Time Estimation from Non-contrast CT

Weiru Wang, Susanne G.H. Olthuis, Elizaveta Lavrova, Robert J. van Oostenbrugge, Charles B.L.M. Majoie, Wim H. van Zwam, Ruisheng Su

2026-06-04安全鲁棒

针对急性缺血性卒中发病时间常不明确、NCCT早期征象细微且多中心数据存在扫描风格差异和长尾类别的问题,StrokeTimer用自监督语义-风格解耦学习获得较稳健的病灶相关表征,再以能量引导的原型对比均值漂移处理类不平衡。其在MR CLEAN两队列上将发病时间分为<4.5h、4.5–6h、>6h,取得macro AUC 0.69、macro F1 0.57,较最强基线提升近50%,解释图也指向灰白质模糊和低密度区等临床征象。

Data Efficient Complex Feature Fusion Network For Hyperspectral Image Classification Figure 1
2026-06-04cs.CV

Data Efficient Complex Feature Fusion Network For Hyperspectral Image Classification

Maitreya Shelare, Atharva Satam, Poonam Sonar, Sneha Burnase

2026-06-04视觉感知

针对高光谱分类中高维谱段带来的计算负担与实时部署困难,论文提出 DE-CFFN:用因子分析替代 PCA 做降维,并在实值/复值双分支 3D 卷积中逐层减半滤波器,再以复值 SE 融合空间、光谱与频域特征。在 Pavia University 和 Salinas 上精度基本接近原 CFFN,同时参数量最多降 72%、显存降 75%、推理延迟降 14%。

ReConFuse: Reconstruction-Error Guided Semantic Fusion for AI-Generated Video Detection Figure 1
2026-06-04cs.CV

ReConFuse: Reconstruction-Error Guided Semantic Fusion for AI-Generated Video Detection

Xiaojing Chen (1), Xinyu Lu (1), Changtao Miao (2), Yunfeng Diao (3) ((1) Anhui University, (2) Ant Group, (3) Hefei University of Technology)

2026-06-04视觉感知三维

针对 AI 生成视频日益逼真、传统检测难以同时兼顾空间伪迹、时间动态与跨生成器泛化的问题,ReConFuse 将预训练 WF-VAE 的逐帧重建误差作为取证线索,洞察真实与生成视频在重建先验下呈现不同误差模式,并与 XCLIP 语义 token 对齐融合,再用 Mamba 建模时间演化。文中称在多生成器和多评测设置下取得有效检测与较强泛化,但具体增益来源仍需结合消融细节判断。

Enhancing MedSAM with a Lightweight Box Predictor for Medical Image Segmentation Figure 1
2026-06-04cs.CV

Enhancing MedSAM with a Lightweight Box Predictor for Medical Image Segmentation

Amirhossein Movahedisefat, Amirreza Fateh, Mohammad Reza Mohammadi

School of Computer Engineering, Iran University of Science

2026-06-04视觉感知

针对 MedSAM 在医学图像中依赖精确提示、单点提示空间信息不足的问题,论文在其框架中加入仅约 1.6M 参数的轻量 Box Predictor,由一次点击结合局部图像嵌入预测粗边界框,再与点提示共同引导分割,并采用先独立训练再接入 MedSAM 的两阶段流程。其在 CT、MRI、超声等四个数据集上验证,Dice 达到 BUSI 0.89、FLARE22 0.93、BRISC 0.88、LungSegDB 0.98,显示提示鲁棒性和跨模态泛化有所提升。

Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms Figure 1
2026-06-04cs.CV

Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms

Jiashu Yao, Heyan Huang, Daiqing Wu, Wangke Chen, Huaxi Ai, Haoyu Wen, Zeming Liu, Yuhang Guo

Beijing Institute of Technology 2 Tsinghua University 3 Beihang University

2026-06-04视觉感知数据集/基准

现有 GUI Agent 基准多默认屏幕在动作间静止,难以评估短视频这类持续播放界面中的“看什么、看多久”。论文提出 Living-Screen-Native GUI Agent 设定与 LivingScreen 基准,用浏览器复刻短视频平台、三级任务和兼顾准确率/信息效率的指标评测。实验显示前沿 MLLM 均未达到人类成本—准确率权衡,主要失败来自过度或不足观察,提示观察控制是当前 GUI Agent 的关键短板。

A New Angle on Bones: Robust Pose Estimation in X-Ray and Ultrasound Figure 1
2026-06-04cs.CV

A New Angle on Bones: Robust Pose Estimation in X-Ray and Ultrasound

Ron Keuth, Christoph Großbröhmer, Franziska Halm, Miriam Johann, Anne-Nele Schröder, Ludger Tüshaus, Mattias P. Heinrich, Lasse Hansen

2026-06-04三维安全鲁棒

本文面向儿科骨折与髋关节发育不良中依赖人工量角、受超声噪声和离群点影响大的骨姿态估计问题,提出先由深度模型生成骨轴点候选,再用带假阳性抑制的鲁棒直线拟合(如 RANSAC、Hough)恢复轴线角度。其洞察是密集点候选比两点地标对局部误差更不敏感;在 X 光和超声三项任务上平均误差为 4.1°、5.4°、5.51°,处于临床观察者差异范围内并优于地标基线。

Graph-Guided Universum Learning in Generalized Eigenvalue Proximal SVMs for Alzheimer's Disease Classification Figure 1
2026-06-04cs.LG

Graph-Guided Universum Learning in Generalized Eigenvalue Proximal SVMs for Alzheimer's Disease Classification

Yogesh Kumar, Vrushank Ahire, Mudasir Ganaie

2026-06-04视觉感知

针对阿尔茨海默病结构 MRI 中标注少、MCI 作为 Universum 样本却被既有 GEPSVM 方法当作独立点处理的问题,论文将 MCI 样本用高斯相似度、最小生成树和多跳传播构图,并以图拉普拉斯正则替代独立 Universum 惩罚,形成 UG-GEPSVM 与更稳定的 IUG-GEPSVM。ADNI 上 ICA/PCA 特征和多噪声实验显示其优于 GEPSVM 及 Universum 基线,UG-GEPSVM 平均 AUC 达 88.07%,且抗噪声较稳。

MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation Figure 1
2026-06-04cs.CV

MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation

Jiale Xu, Wang Zhao, Ying Shan

ARC Lab, Tencent PCG

2026-06-04视觉感知

针对自回归网格生成中坐标级 token 序列过长、缺少局部几何引导而难以扩展到高面数并保持细节的问题,MeshWeaver 将生成视为已知表面上的“编织/重拓扑”,改为逐顶点预测,并用多层稀疏体素编码器在表示、交叉注意力和结构约束三处注入几何上下文。实验显示其 token 压缩率达 18%,可生成最高 16K 面网格,并提升几何保真度。

Real-Time Automatic License Plate Recognition Using YOLOv8, SORT Tracking, and Temporal Data Interpolation Figure 1
2026-06-04cs.CV

Real-Time Automatic License Plate Recognition Using YOLOv8, SORT Tracking, and Temporal Data Interpolation

Mirza Muhammad Mobeen

2026-06-04视觉感知

面向真实交通监控中光照、遮挡、高速运动导致的车牌检测断轨和 OCR 不稳,本文构建 YOLOv8 车辆/车牌检测、SORT 跟踪、EasyOCR 与车牌语法校正的端到端 ALPR 流水线,并加入离线线性时序框插值补全缺失轨迹。在 3599 帧视频上跟踪 45 辆车,原始检测 2247 个,经插值补入 2289 个位置、坐标数提升 101.9%;但平均 OCR 置信度仅 0.414,识别鲁棒性仍有限。

Instance-Level Post Hoc Uncertainty Quantification in Object Detection Figure 1
2026-06-04cs.CV

Instance-Level Post Hoc Uncertainty Quantification in Object Detection

Chongzhe Zhang, Zifan Zeng, Qunli Zhang, Feng Liu, Zheng Hu

2026-06-04视觉感知安全鲁棒

面向自动驾驶目标检测中已部署模型难以重训、却需要逐框量化边界框认知不确定性的场景,论文提出 MC-GLM:在 Laplace 后验下用固定次数的 Monte Carlo 权重扰动和有限差分方向导数近似 GLM 的雅可比协方差,避免按输出实例多次反传,样本数与检测框数量无关且可并行。在 nuScenes 上结合 CenterPoint 的实验显示,该方法能生成质量较好的实例级不确定性估计。

MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer Figure 1
2026-06-04cs.CV

MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-based Diffusion Transformer

Weiyu Li, Antoine Toisoul, Tom Monnier, Roman Shapovalov, Rakesh Ranjan, Ping Tan, Andrea Vedaldi

Hong Kong University of Science and Technology

2026-06-04生成模型

面向游戏/VFX 等场景中可编辑、高质量网格生成,论文针对自回归网格模型推理随规模二次增长、坐标量化带来塌点和重叠的问题,提出 MeshVAE 将顶点位置、法向与连接关系统一压缩到连续潜空间,并用对比学习表示边连接,再以 Rectified Flow Transformer 并行生成。实验称潜表示较朴素 tokenizer 少 72×、较高效方案少 16×,生成速度比最快 AR 方法快 18×且指标保持领先。

Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain Figure 1
2026-06-04cs.CV

Beyond Symmetric Alignment: Spectral Diagnostics of Modality Imbalance in Vision-Language Models in the Medical Domain

Alessandro Gambetti, Qiwei Han, Cláudia Soares, Hong Shen

NOVA School of Science and Technology, Nova School of Business and Economics, Carnegie Mellon University, NOVA School of Science and Technology Lisbon Portugal, Nova School of Business and Economics Lisbon Portugal, Carnegie Mellon University Pittsburgh Pennsylvania USA

2026-06-04视觉语言视觉感知

针对医学图文中 VLM 对齐失效却难以判断“哪一模态拖后腿”的问题,论文提出非对称的 Spectral Alignment Score,将两模态投影到锚模态主特征谱并比较方向性可恢复性。对 15 个 VLM、自然与医学数据集的评测显示,医学图像保留的结构信息明显多于临床报告,传统对称指标无法揭示该不平衡;SAS 在医学域与零标签检索表现相关性最强,可作为部署前诊断工具。

COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations Figure 1
2026-06-04cs.CV

COMBINER: Composed Image Retrieval Guided by Attribute-based Neighbor Relations

Zixu Li, Yupeng Hu, Zhiwei Chen, Haokun Wen, Xuemeng Song, Liqiang Nie

2026-06-04视觉感知三维

针对组合图像检索中“视觉相似但属性无关”样本会被传统邻域关系误拉近的问题,COMBINER用属性原型来度量跨模态相似性:先自适应解耦图文属性语义,再构建统一跨模态原型并进行组合,最后联合建模成对关系与基于属性的邻域关系。三项CIR基准实验显示其在各指标上优于已有方法,消融验证了各模块有效性。

4D Reconstruction from Sparse Dynamic Cameras Figure 1
2026-06-04cs.CV

4D Reconstruction from Sparse Dynamic Cameras

Kazuki Ozeki, Shun Kenney, Yuto Shibata, Eisuke Takeuchi, Takuya Narihira, Kazumi Fukuda, Ryosuke Sawata, Yuki Mitsufuji, Yoshimitsu Aoki

Keio University

2026-06-04三维

针对单目动态相机4D重建存在深度歧义、密集固定相机成本高的问题,本文研究少量独立运动相机的实用采集设置。核心做法是将跨相机特征匹配与单相机点跟踪结合,初始化时空一致的3D轨迹,并加入抗噪深度顺序约束和时空多样采样;同时发布LetCamsGo基准。实验显示其在动态区域重建质量和时间一致性上优于朴素MoSca扩展及部分固定多相机基线。

Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues Figure 1
2026-06-04cs.CL

Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues

Hanbo Bi, Zhiqiang Yuan, Chongyang Li, Qiwei Yan, Zexi Jia, Jiapei Zhang, Xiaoyue Duan, Yingchao Feng, Jinchao Zhang, Jie Zhou

2026-06-04视觉感知

针对长篇图文交织对话中用户往往需要找回完整话题片段而非单条消息的问题,论文提出细粒度片段检索任务,并区分单对话与语料库两种场景;方法上用强化学习训练的F²RVLM提升片段一致性,再以FEM离线建索引、F²RVLM在线精排组成FFRS。作者构建MLDR和微信真实测试集,实验显示在两类设置下均优于现有嵌入模型与多模态大模型基线。

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization Figure 1
2026-06-04cs.CV

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

Zhenliang Li (1), Yutao Hu (1), Qixiong Wang (2), Wenpeng Du (1), Hongxiang Jiang (2), Jiasong Wu (1), Xiaolong Jiang (2), Jungong Han (3) ((1) Southeast University, (2) Xiaohongshu Inc., (3) Tsinghua University)

Southeast University, Xiaohongshu Inc., Tsinghua University, trollability of localized image manipulation, raising new challenges for image, Recent advances in generative image editing models (Labs et al., 2025, localized manipulations increasingly controllable and semantically consistent with the surrounding

2026-06-04机器人数据集/基准

现代生成式局部编辑让篡改区域在语义上更自然,削弱了现有取证定位基准的区分度。本文用闭环 CraftAgent 构建 10 万张 Impostor 数据集,覆盖 7 个 AIGC 编辑器、三类及多区域篡改,并提出结合局部相位线索与语义—取证一致性监督的 PANet。实验显示该基准显著压低 LVLM 和专用 IMDL 方法表现,而 PANet 在 Impostor 及多个公开集上取得更好定位与泛化结果。

Optical-Guided Neural Collapse for SAR Few-Shot Class Incremental Learning Figure 1
2026-06-04cs.CV

Optical-Guided Neural Collapse for SAR Few-Shot Class Incremental Learning

Fan Zhang, Sijin Zheng, Fei Ma, Qiang Yin, Yongsheng Zhou, Fei Gao, Xian Sun

Sijin Zheng, Fei Ma, Qiang Yin, Yongsheng Zhou are with the School of, Information Science and Technology, Beijing University of Chemical, using only small amounts of labeled data. This gives rise to the, Fan Zhang is with the School of Information Science and Technology and, the Interdisciplinary Research Center for Artificial Intelligence, Beijing, University of Chemical Technology, Beijing 100029, China (e-mail:, Fei Gao is with the Beihang University, Beijing 100191, China (e-mail:, Xian Sun is with the Aerospace Information Research Institute, Chinese, converge to their respective class centers, which in turn collapse, subspace centers.

2026-06-04视觉感知

本文针对SAR目标少样本类增量学习中方位敏感导致类内变化大、类间混淆和灾难性遗忘的问题,提出用数据更充足的光学ATR模型构造正交特征子空间,并通过主角约束、固定simplex-ETF分类器和中心对齐将其几何结构迁移到SAR特征,诱导神经坍缩。24类光学/SAR基准的基类加7次增量实验显示,方法较NC-FSCIL、PriViLege、WaRP、FACT取得最高最终精度,且类内紧凑性和类间分离性指标更接近ETF结构。

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation Figure 1
2026-06-04cs.MM

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation

Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin, Yaowei Li, Junhao Zhuang, Haoran Li, Jie Huang, Haoyang Huang, Nan Duan, Qiang Xu

The Chinese University of Hong Kong, 2Joy Future Academy, JD, 3The Hong Kong University of, Science and Technology, 4Tsinghua University, 5The University of Hong Kong, Peking University, 7University of Science and Technology of China, Project Page: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/, Code: https://github.com/Echo-Team-Joy-Future-Academy-JD/Echo-Infinity

2026-06-04视觉感知

面向自回归视频生成在长时滚动中 KV 缓存无限增长、RoPE 位置越界导致质量崩溃的问题,Echo-Infinity 将被移出局部窗口的历史用可学习 Memory Queries 通过注意力与门控持续压缩,并在训练/推理统一使用有界相对 RoPE。实验显示其在长短视频与交互生成上达到 SOTA,并在单 H100 上实现 24 小时、超 130 万帧实时生成,开销约 10.6%。

SFMambaNet: Spectral-Frequency Enhanced Selective State Space Model for Correspondence Pruning Figure 1
2026-06-04cs.CV

SFMambaNet: Spectral-Frequency Enhanced Selective State Space Model for Correspondence Pruning

Zhihua Wang, Yanping Li, Yizhang Liu

pruning network. Our method is collaboratively composed of, ods on several challenging tasks. The code is available at, Zhihua Wang is with the School of Optical-Electrical and Computer, Engineering, University of Shanghai for Science and Technology, Shanghai, Yanping Li is with the Institute of Artificial Intelligence, Shanghai Jiao, College, ence/College of Software, Fuzhou University, Fuzhou 350108, China (e-mail:

2026-06-04视觉感知

针对两视图匹配中外点多、GNN难捕捉细微几何一致性且Mamba隐状态易累积不一致特征的问题,SFMambaNet将内点视为低频几何信号、外点视为高频噪声,引入局部谱几何注意力LSGA和带频率门控的全局SIGM,在局部增强细粒度一致性、在全局抑制高频噪声传播;实验显示其在多项对应剪枝任务上超过现有方法。

IMPose: Interactive Multi-person Pose Estimation with Dynamic Correction Propagation Figure 1
2026-06-04cs.CV

IMPose: Interactive Multi-person Pose Estimation with Dynamic Correction Propagation

Haoyang Ge, Jian Ma, Ziwen Wang, Qihe Wang, Jianqi Fan, Hongzhi Yu, Xingyu Chen, Kun Li

2026-06-04三维

视频多人姿态标注成本高,现有工具难把少量人工修正稳定传播到遮挡、运动模糊和身份交错的长序列中。IMPose将问题建模为交互式校正传播,结合关键点级时序跟踪、实例级关键点感知嵌入与轨迹库,联合维护关键点连续性和跨帧身份一致性。实验显示其在低点击预算下仍保持精度效率权衡:3DPW约每1050帧27次点击,PoseTrack21约每轨迹3次点击,并用10名标注员10小时扩展出约18.8万人体实例和355万关键点。

Evaluating Reasoning Fidelity in Visual Text Generation Figure 1
2026-06-04cs.CV

Evaluating Reasoning Fidelity in Visual Text Generation

Jiajun Hong, Jiawei Zhou

Stony Brook University

2026-06-04视觉感知

这篇论文关注一个被现有视觉文本生成评测忽略的问题:T2I 模型生成的文字即使清晰可读,是否仍能忠实承载推理过程。作者设计分层评测,将长文本渲染、事实知识、长上下文理解和多步数学推理中的渲染错误、最终答案错误与中间步骤错误区分开,并辅以人工验证。结果显示,当前前沿与开源 T2I 模型常出现语义错误、逻辑不一致和错误中间步骤,显著弱于同任务文本 LLM,说明渲染质量提升并不等同于推理保真。

Adaptive Calibration for Fair and Performant Facial Recognition Figure 1
2026-06-04cs.CV

Adaptive Calibration for Fair and Performant Facial Recognition

Ryan Brown, Chris Russell

University of Oxford

2026-06-04视觉感知

针对人脸验证中“同一余弦相似度在不同嵌入区域对应不同匹配概率”导致全局阈值放大群体误差的问题,论文提出后处理式 Adaptive Calibration,将相似度与成对样本的局部嵌入位置一起映射为校准概率,可用逻辑/MLP/局部残差模型实现且不需人口属性标签。实验称其在多种预训练骨干和基准上同时提升准确性、公平校准与最差群体指标,避免以牺牲优势群体性能来换公平。

ChannelTok: Efficient Flexible-Length Vision Tokenization Figure 1
2026-06-04cs.CV

ChannelTok: Efficient Flexible-Length Vision Tokenization

Sukriti Paul, Arpit Bansal, Tom Goldstein

University of Maryland, College Park

2026-06-04视觉感知

本文针对现有可变长度视觉 tokenizer 依赖大模型骨干和多步生成式解码、推理成本高的问题,提出将潜变量的通道而非空间位置视为 token,并通过训练时随机保留前 k 个通道的 tail-dropping 促使通道形成由粗到细的语义排序。这样推理时只需改变保留通道数即可调节压缩率。在 ImageNet 上,ChannelTok 以 159M 参数取得 rFID 2.92,解码比次优方法快 8.6 倍、规模小 2.1 倍,并展示了可变 token 预算下的自回归生成能力。

Imagine Before You Draw: Visual Prompt Engineering for Image Generation Figure 1
2026-06-04cs.CV

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

Nanyang Technological University, National University of Singapore, Zhejiang University, The Chinese University of Hong Kong

2026-06-04视觉感知

论文针对文本/类别到像素生成中语义条件与细节合成跨度过大的问题,提出 VPE:先自回归生成 SigLIP 2 视觉语义 token 作为“画前构图”,再据此生成图像 token,并用渐进训练缓解训练—推理不一致和损失尺度失衡。实验覆盖类别生成、文生图和编辑,显示其可加速收敛、提高质量上限;内置式 VPE 在编辑细节保持上明显优于外部两阶段方案,PSNR 26.76 对 19.92。

Radiomic Feature Selection Using Gradient Loss of Deep Neural Network for Lung Cancer Stage Detection Figure 1
2026-06-04cs.CV

Radiomic Feature Selection Using Gradient Loss of Deep Neural Network for Lung Cancer Stage Detection

Hina Shakir, Mohammad Mohatram, Javeed Hussain, Syed Rizwan Ali, Muhammad Irfan Memon

Department of Software Engineering, Bahria University, Karachi, Pakistan, Global College of Engineering and Technology, Muscat, Oman, Software Engineering & Business Incubation Center, Bahria University Karachi, Pakistan

2026-06-04视觉感知优化算法

针对放射组学特征高维、小样本且冗余易影响肺癌分期模型的问题,论文提出 GL-RFE:用神经网络损失对输入特征的梯度敏感度递归剔除低贡献特征,并以选出的 15 个 CT 放射组学特征训练 DNN 区分早期与晚期。NSCLC Radiomics 数据上测试准确率 90.22%、F1 为 90.16%,优于若干传统筛选和基线模型;但外部数据集验证文中未充分说明。

INTACT: Ego-Guided Typed Sparse Evidence Retrieval for Heterogeneous Collaborative Perception Figure 1
2026-06-04cs.CV

INTACT: Ego-Guided Typed Sparse Evidence Retrieval for Heterogeneous Collaborative Perception

Chen Li, Shengrong Yuan, Jialong Zuo, Xinzhong Zhu, Nong Sang, Changxin Gao

National Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Zhejiang Normal University.

2026-06-04视觉感知

本文针对异构车端传感器、骨干和训练目标导致中间特征难以直接融合、且新增协作者需重新适配的问题,提出 INTACT:由自车发起带类型的稀疏证据查询,只在可疑目标或证据不足区域向协作者索取局部响应,并经稀疏路由与门控残差写回注入自车 BEV。实验显示其在 OPV2V-H 达到 80.1 AP70,仅增 0.52M 参数并约 16 倍压缩通信量,在 DAIR-V2X 达到 43.8 AP50。

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training Figure 1
2026-06-04cs.CV

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

Jiaxin Shi, Xidong Zhang, Fucai Zhu, Zhe Li, Siyu Zhu, Weihao Yuan

Shanghai Jiao Tong University, Harbin Institute of Technology, Nanyang Technological University, Fudan University, Nanjing University, Great Bay University

2026-06-04视觉语言视觉感知三维

针对2D输入VLA在真实三维操作中缺乏空间推理、且共训练时动作提示会绕过已学3D先验的问题,3DThinkVLA将几何感知与空间推理解耦:用潜空间3D特征对齐获取低层几何,用共享推理锚点做在线蒸馏,再把两类空间条件注入动作头。推理时仅需2D图像和轻量适配器,在LIBERO、LIBERO-PLUS、SimplerEnv及真实机器人任务上报告达到SOTA。

Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning Figure 1
2026-06-04cs.CV

Hyper-ICL: Attention Calibration with Hyperbolic Anchor Distillation for Multimodal In-Context Learning

Niloufar Alipour Talemi, Hossein Kashiani, Fatemeh Afghah

2026-06-04视觉语言

针对多模态 ICL 需要插入图文示例而带来的高延迟、且对示例格式和顺序敏感的问题,Hyper-ICL 试图在推理时去掉示例:用低秩 logit 级适配器校准注意力,并按查询动态调节各层各头干预强度,再以双曲锚点蒸馏对齐有示例教师的中间表征。文中在 VQAv2、OK-VQA、COCO Caption 等六个基准和两个 MLLM 上报告了优于直接 ICD、ICV 与 LIVE 的准确率和稳定性。

Stateful Visual Encoders for Vision-Language Models Figure 1
2026-06-04cs.CV

Stateful Visual Encoders for Vision-Language Models

Zirui Wang, Junwei Yu, Adam Yala, David M. Chan, Joseph E. Gonzalez, Trevor Darrell

2026-06-04视觉语言视觉感知

现有开源 VLM 在多图/多轮任务中通常逐图独立编码,细微但关键的视觉变化可能在进入语言模型前被弱化。本文提出 Stateful Visual Encoder,在视觉骨干内让当前图像特征因果地关注历史图像特征,并配套跨注意力、初始化、零初始化与停梯度微调策略。实验显示其在空间聚合、多目标差异、轨迹模仿及放射影像、图像编辑、遥感变化检测中稳定优于无状态微调基线,并可跨分辨率、模型规模和骨干泛化。

DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation Figure 1
2026-06-04cs.CV

DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation

Thanh-Tung Le, Yunhan Zhao, Menglei Chai, Zhengyang Shen, Zhe Cao, Danhang Tang, Xiaohui Xie, Deying Kong

University of California, Irvine

2026-06-04视觉感知

该文针对自回归视频扩散在每帧使用固定去噪步数导致简单帧浪费算力、复杂帧欠优化的问题,提出 DSA:在分布匹配蒸馏中联合训练轻量置信度头,按帧/片段估计去噪可靠性并动态分配采样步数。实验显示其在 H100 上达到 22.63 FPS、亚秒级延迟,VBench 质量与近期 AR 和双向扩散模型相当或更优;但长时序生成仍有漂移与误差累积。

Implicit Fuzzification via Bounded Noise Injection for Robust Medical Image Segmentation Figure 1
2026-06-04cs.CV

Implicit Fuzzification via Bounded Noise Injection for Robust Medical Image Segmentation

Bisheng Tang, Zhangfeng Ma, Chuchu Zhai, Feng Dong, Yaoqun Wu, Ammar Oad, Yifei Peng

mation loss and inherent uncertainty in pixel-wise labeling., vision, aiming to assign a semantic label to each pixel and, School, Laboratory, University, Oad Ammar and Yifei Peng are with with the School of Information, uncertainty in pixel-to-label mapping rather than purely archi-

2026-06-04视觉感知学习理论安全鲁棒

本文针对医学图像分割中由下采样信息丢失、噪声与标注不确定性导致的边界模糊问题,提出 NoiseUNet:在 U-Net 跳连处注入有界扰动,以正则化跨尺度特征融合,并从理论上解释为隐式模糊化,使边界区域形成软隶属表示。作者还构建甲状腺超声 ThyR 数据集,实验显示该方法在分割精度和边界一致性上均有稳定提升。

L-TGVN: Leveraging Longitudinal Priors for Personalized Rapid MRI Figure 1
2026-06-04eess.IV

L-TGVN: Leveraging Longitudinal Priors for Personalized Rapid MRI

Arda Atalık, Sumit Chopra, Daniel K. Sodickson

¹ NYU Center for Data Science, NY, USA, ² Center for Advanced Imaging Innovation and Research (CAI²R), Department of Radiology, NYU, Grossman School of Medicine, NY, USA, ³ Courant Institute of Mathematical Sciences, NY, USA, Source code is available at github.com/sodicksonlab/L-TGVN.

2026-06-04视觉感知

为缩短 MRI 扫描而重度欠采样会使重建问题高度不适定,单靠群体先验在高加速下易丢细节。L-TGVN 将患者最近一次纵向扫描作为个体化先验,但通过信任引导/数据一致性约束限制其只影响测量难以确定的部分,且不需显式配准、可容忍协议差异。脑部多线圈 T2 数据上,在 10×–20× 加速下相较无先验和已有侧信息方法均提升 SSIM、PSNR、NRMSE,并更好保留细小结构和病灶。

Motion-Guided Causal Disentanglement for Robust Multi-View Cine Cardiac MRI Diagnosis Figure 1
2026-06-04cs.CV

Motion-Guided Causal Disentanglement for Robust Multi-View Cine Cardiac MRI Diagnosis

Chuankai Xu, Cristiane De Carvalho Singulane, Mohammad Abuannadi, Stephen Chandler, Jeremy Slivnick, Karolina Zareba, Jane Cao, Vidya Nadig, Fabio Fernandes, Seth Uretsky, Diego Perez de Arenaza, Amit Patel, Jianxin Xie

2026-06-04安全鲁棒

多视角电影心脏 MRI 中,模型易把视角解剖差异与疾病线索混在一起,低样本和罕见病场景下会放大捷径学习。论文提出 MoViD,在 ViT-MAE 上用疾病/视角双分支对比学习、梯度反转去相关和无标注帧间运动 ROI 裁剪分离表征,并用 focal 重加权缓解类别不均衡。在私有 VTE 与 M&Ms/M&Ms2 上分类和分割均优于常规 Transformer/CineMA,UVA-Cardiac AUROC 从 0.538 提升到 0.749,消融显示运动定位贡献最大。

Ultra-Fast Neural Video Compression Figure 1
2026-06-04cs.CV

Ultra-Fast Neural Video Compression

Jiahao Li, Wenxuan Xie, Zhaoyang Jia, Bin Li, Zongyu Guo, Xiaoyi Zhang, Yan Lu

Microsoft Research Asia, 2 University of Science and Technology of China

2026-06-04视觉感知

针对神经视频编码虽压缩率高但编解码复杂度阻碍部署的问题,论文提出 DCVC-UF:将多帧 chunk 编成单一紧凑 latent 并并行解码,用跨帧交互替代显式运动建模,配合帧特定解码器和单步比特流交互的熵编码以降低开销。实验显示其在 1080p、RTX 4090 上可达数百 FPS,HT-L 相比 VTM-LD 平均省码率 42.2%,显著改善率失真复杂度权衡。

An Empirical Study of Data Scale, Model Complexity, and Input Modalities in Visual Generalization Figure 1
2026-06-04cs.CV

An Empirical Study of Data Scale, Model Complexity, and Input Modalities in Visual Generalization

Luoyidi Zhou

School of Medical Information and Artificial Intelligence, Shandong First Medical University

2026-06-04学习理论

论文针对传统复杂度理论难以解释深度视觉模型泛化的问题,用一维函数拟合与 CIFAR-10/100 控制实验拆解数据规模、模型复杂度和输入模态的作用。核心洞察是:泛化提升更稳定地来自训练数据增加,而非单纯加大模型;去除颜色会明显损害性能,边缘、梯度、小波等显式先验在不同架构上效果不一致,增益来源不清。

Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models Figure 1
2026-06-04cs.CV

Geometry-Preserving Unsupervised Alignment for Heterogeneous Foundation Models

Shuwen Yu, Zhanxuan Hu, Yi Zhao, Yonghang Tai, Huafeng Li

modality gap without labels and model parame-, code is available at: https://github.com/, Yunnan Normal University, Kunming, China 2Kunming Uni-, space of VLMs, without requiring labels or model parame-

2026-06-04视觉感知

针对 VLM 语义强但视觉粗、VFM 结构判别强但缺少语言锚定的问题,论文提出 GPUA:把 VFM 特征视作“视觉语言”,在不使用标签、不更新模型参数的条件下学习正交映射,将其对齐到 VLM 语义空间并尽量保持原有几何结构。该方法只需特征级访问、任务无关,可融合多个视觉编码器;实验显示其在零样本识别和开放词汇分割等基准上提升跨模型兼容性,并带来较小额外开销。

Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers Figure 1
2026-06-04cs.CV

Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers

Biao Qian, Yang Wang, Yong Wu, Jungong Han

2026-06-04视觉感知

ViT 无数据量化缺少 BN 统计先验,合成样本易出现语义分散和全精度/量化模型注意力不一致,影响低比特校准。MaskAQ 的关键洞察是语义集中在少量 informative patches,并通过 patch 相似性熵最大化分离前景、掩码注意力对齐耦合量化模型及周期刷新样本来保持校准信息。实验在多种 ViT/DeiT/Swin 和分类、检测、分割任务上优于现有 DFQ,3-bit ImageNet 上最高提升约 3.1% Top-1。

VT-3DAD: Cross-Category 3D Anomaly Detection via Visual-Text Normal Space Alignment Figure 1
2026-06-04cs.CV

VT-3DAD: Cross-Category 3D Anomaly Detection via Visual-Text Normal Space Alignment

Zi Wang, Katsuya Hotta, Yawen Zou, Koichiro Kamide, Yijin Wei, Chao Zhang, Jun Yu

\skiplinehalf \supit 1Niigata University, \supit 2University of Toyama, \supit 3Iwate University

2026-06-04视觉感知三维

针对少样本跨类别 3D 点云异常检测中视觉相似类别易混淆、按类别训练不够灵活的问题,VT-3DAD 将点云投影为多视角深度图,用冻结 CLIP 视觉特征度量与正常参考的偏离,同时用深度/3D 感知文本提示构建正常语义锚点,融合视觉与文本正常空间得分。ShapeNetPart 上 1/3/5-shot 均达 SOTA,1-shot AUC-ROC 从 DMP-3DAD 的 92.49% 提升到 94.80%,标准差也降低。

Multi-Granularity 3D Kidney Lesion Characterization from CT Volumes Figure 1
2026-06-04cs.CV

Multi-Granularity 3D Kidney Lesion Characterization from CT Volumes

Renjie Liang, Zhengkang Fan, Jinqian Pan, Chenkun Sun, Jiang Bian, Russell Terry, Jie Xu

aDepartment of Health Outcomes and Biomedical Informatics, University of, bDepartment of Urology, University of Florida, 1600 SW Archer, cDepartment of Biostatistics and Health Data Science, Indiana University School of, dCenter of Biomedical Informatics, 1101 W 10th St, at one academic medical center, with multi-granularity side- and per-lesion, labels, and used KiTS23 (489 cases) for zero-shot external validation. We

2026-06-04三维

针对放射报告按单个肾脏病灶描述类型、大小、强化和密度,而现有3D CT方法多停留在患者或器官级预测的问题,论文将肾病灶表征重构为可变数量的病灶集合预测,提出LesionDETR、尺寸距离匈牙利匹配和层级监督,并构建多粒度标注数据。实验显示分割掩膜通道与腹部CT预训练是主要增益来源,侧别异常AUC约0.80且可零样本迁移到KiTS23,但病灶级mAP仍低、罕见实体病灶受数据规模限制明显。

Spatially Grounded Concept Bottleneck Models via Part-Factorized Attention Figure 1
2026-06-04cs.CV

Spatially Grounded Concept Bottleneck Models via Part-Factorized Attention

Dhanesh Ramachandram

such as CUB-200-2011 [Wah et al., 2011] encode this knowledge as binary part-attribute labels, weakens the labeling requirement: post-hoc CBMs [Yuksekgonul et al., 2022] retrofit a concept layer, onto a pretrained backbone using textual concept embeddings, and label-free CBMs [Oikarinen et al., tion. LaBo [Yang et al., 2023] uses a language model to propose a large candidate concept space and, CLIP. Label-free CBMs [Oikarinen et al., 2023] similarly remove manual concept annotation. These, iterations and uses a saliency map together with concept-label statistics as transportation priors, with

2026-06-04视觉感知

本文针对细粒度识别中 CBM 概念头“名为某部位却看向其他区域”的空间失真问题,提出 PF-CBM:在冻结 DINOv3 特征上用前景门抑制背景,以部位查询和固定概念-部位路由强制属性只读对应解剖部位,并用可学习二维高斯先验打破部位槽置换。CUB 上其 top-1 接近全监督基线,同时显著提升 pointing accuracy;用 PCA 前景目标可去除逐图监督仍保持约 88.6% 准确率和约 70% 定位准确率。

Video2LoRA: Parametric Video Internalization for Vision-Language Models Figure 1
2026-06-04cs.CV

Video2LoRA: Parametric Video Internalization for Vision-Language Models

Manan Suri, Sarvesh Baskar, Dinesh Manocha

† University of Maryland, College Park

2026-06-04视觉语言视觉感知

针对视频 VLM 每次查询都需携带大量视觉 token、长视频易超上下文并退化的问题,Video2LoRA 将视频先由冻结 VLM 编码,再用 Perceiver 超网络一次性生成视频专属 LoRA,把视觉上下文内化到参数中,查询时无需视觉 token。实验显示其在多项字幕任务和多数视频 QA 设定上与直接视频上下文推理统计等价或非劣,并在长帧数/高分辨率下更稳定,查询 TTFT 降低约 6–80 倍。

MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models Figure 1
2026-06-04cs.CV

MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models

Yue Wu, Changyuan Wang, Zixuan Wang, Shilin Ma, Yansong Tang

2026-06-04视觉感知

该文针对全模态大模型在音频、视频、图像、文本混合输入下激活分布差异大、4-bit PTQ易截断离群值的问题,提出 MorphoQuant:用 DABC 将长尾通道残差吸收到通道偏置中,并用 MDQFO 联合优化量化网格与偏置掩码,以兼顾离群值保真和主体分布精度。在 Qwen2.5-Omni 上,W4A4 在 MMMU、Video-MME 等任务优于现有 W4A4,ScienceQA 达 76.63%,还超过部分 W4A16 基线。

HYolo: An Intelligent IoT-Based Object Detection System Using Hypergraph Learning Figure 1
2026-06-04cs.CV

HYolo: An Intelligent IoT-Based Object Detection System Using Hypergraph Learning

Isha Abid, Fawad Khan, Muhammad Khuram Shahzad

2026-06-04视觉感知

本文针对 IoT 场景下 YOLO 检测器难以建模跨层、跨位置高阶特征关系的问题,提出 HYolo:在 YOLO 流水线中加入基于距离阈值构图的超图表示、HyperC2Net 跨层交互模块和 HyperConv 信息传播,以增强上下文建模。文中称在 COCO 上 mAP@50 提升约 12%,但实验细节与消融支撑有限,增益来源仍不够清楚。

Robust Multi-view Clustering against Imperfect Information Figure 1
2026-06-04cs.CV

Robust Multi-view Clustering against Imperfect Information

Zhichao Huang, Haochen Zhou, Hao Wang, Mouxing Yang, Xi Peng

College of Computer Science, Sichuan University, China., School of Artificial Intelligence, Sichuan University, China., Tianfu Jincheng Laboratory, Chengdu, China., be either unavailable or unreliable. Based on the observation, we propose a novel, partition unlabeled instances into semantic groups by exploiting complementary information within, No caption available., information. Specifically, IV makes the counterpart unavailable, whereas NC renders the observed, solutions of IV and NC. To be more specific, one could first recover the unavailable counterparts

2026-06-04安全鲁棒

论文关注多视图聚类中更现实的“不完美信息”场景:视图缺失与跨视图对应噪声同时存在,使只面向 IV 或 NC 的方法依赖条件失效。核心洞察是二者都源于跨视图 counterpart 不可用或不可靠,因而提出 PLCI,将 counterpart 建模为潜变量,结合实例级可靠性估计与原型级语义最优传输推断其后验。六个数据集上对比 10 种方法显示其在该混合扰动下更稳健。

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge Figure 1
2026-06-04cs.CV

Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge

Tomoya Miyazawa, Hiroyasu Okuno

Data Analytics Labo Co.

2026-06-04视觉感知

针对 VRR-QA 中关系线索常跨镜头、隐含且单次 Video LLM 推理不稳定的问题,论文提出无需训练的测试时框架 ASC-MQRA:多次随机问答后按答案自一致性投票,并尝试在低票差样本上缩小候选重看视频再仲裁。结果显示 ASC 相比单次推理显著更稳,最终验证集 AvgAcc 72.73、测试集 81.16;MQRA 验证集有增益但测试集略降,说明收益依赖触发样本分布,主要来自 test-time scaling。

PureLight: Learning Complex Luminaires with Light Tracing Figure 1
2026-06-04cs.GR

PureLight: Learning Complex Luminaires with Light Tracing

Pedro Figueiredo, Zixuan Li, Beibei Wang, Miloš Hašan, Nima Khademi Kalantari

Texas A&M University, Nankai University, Nanjing University of Science and Technology, Texas A&M University USA, Nankai University China, Nanjing University of Science and Technology China

2026-06-04视觉感知

针对含微小 LED、玻璃/镜面层等复杂灯具在路径追踪和双向路径追踪中难以低方差估计外观的问题,PureLight 将灯具出射辐射建模为由光线追踪样本学习的概率分布,并用 normalizing flow、蒸馏 MLP、采样网络和混合网络支持外观查询与直接光照。实验显示其可在任意场景中以低采样数渲染复杂灯具,64 spp 即比百万 spp 路径追踪更低噪,并提供更快但带轻微偏差的离散版本。

XSSR: Cross-Domain Self-Supervised Representative Selection for Efficient Annotation in Medical Image Segmentation Figure 1
2026-06-04cs.CV

XSSR: Cross-Domain Self-Supervised Representative Selection for Efficient Annotation in Medical Image Segmentation

Byunghyun Ko, Aleksei Anisimov, Kobe Ke, Suhas Bharthepude, Jeongkyu Lee

2026-06-04视觉感知

针对跨医院/设备医学图像分割中目标域标注昂贵且域偏移降低性能的问题,XSSR先用源域无标注数据训练轻量MAE获得嵌入,再按密度、新颖性与多样性贪心挑选少量目标样本,并自动校准权衡参数。在5%标注预算下,Chest X-ray仅22例达到全量性能99.3%,Prostate MRI较随机最高提升2.5 Dice,并整体优于CoreSet 0.4–1.2 Dice。

Efficient and Training-Free Single-Image Diffusion Models Figure 1
2026-06-04cs.CV

Efficient and Training-Free Single-Image Diffusion Models

Haojun Qiu, Kiriakos N. Kutulakos, David B. Lindell

Department of Computer Science, University of Toronto, Vector Institute

2026-06-04视觉感知生成模型

针对单图像生成中传统单图扩散需数小时内部训练的问题,本文将单张参考图像视为多尺度 patch 数据集,利用有限低维 patch 分布可闭式计算 score 的洞察,构造无需神经网络训练的最优去噪器并嵌入粗到细反向扩散。实验显示其在单图 FID、质量与多样性上达到或优于已训练的单图扩散模型,并支持文本风格化、对称化、重定向等应用;结合 latent diffusion、近邻检索和加速 kernel,可实现秒级百万像素和分钟级十亿像素生成。

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application Figure 1
2026-06-04cs.CV

A Cookbook of 3D Vision: Data, Learning Paradigms, and Application

Hongyang Du, Zongxia Li, Dawei Liu, Runhao Li, Haoyuan Song, Qingyu Zhang, Yubo Wang, Jingcheng Ni, Shihang Gui, Congchao Dong, Tao Hu

2026-06-04视觉感知三维

三维视觉因表示形式、数据集和学习范式分散,研究者难以统一比较效率、保真度与可扩展性。本文不是提出新模型,而是以数据为中心梳理 RGB-D、点云、网格、体素、隐式场与 3D Gaussian 等表示,并把基准设计、监督方式与重建、生成、4D 世界建模等任务联系起来。主要结果是一套综述性分类框架与趋势判断,指出统一评测、跨模态/2D 监督和实时高保真表示是后续关键方向。

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs Figure 1
2026-06-04cs.CV

FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs

Eshika Khandelwal, Jingjing Pan, Mingfang Zhang, Quan Kong, Lorenzo Garattoni, Hilde Kuehne

Tuebingen AI Center, University of Tuebingen, Woven by Toyota, Inc., Tokyo, Japan

2026-06-04视觉语言视觉感知数据集/基准

针对通用多模态 LLM 已被用于输出框定位、但现有评测多停留在 VQA/描述等自由文本任务的问题,FindIt 构建了覆盖目标检测、指代表达、实例级与视频检测的统一基准,并强制可解析框格式、比较文本/JSON及不同坐标定义。实验显示模型对输出格式高度敏感,开源模型定位有时优于闭源模型但格式迁移差,闭源模型更稳健;实例检测仍是主要短板。

StandardE2E: A Unified Framework for End-to-End Autonomous Driving Datasets Figure 1
2026-06-04cs.CV

StandardE2E: A Unified Framework for End-to-End Autonomous Driving Datasets

Stepan Konev

2026-06-04数据集/基准

面向端到端自动驾驶研究中各数据集格式、坐标系、模态与 API 割裂导致的重复预处理和跨数据集训练困难,StandardE2E 提出以 StandardFrameData 为核心的统一模式,将每个数据集仅映射一次,后续适配器链、缓存索引、场景过滤与 PyTorch 多数据集 DataLoader 复用。框架已支持 Waymo、Argoverse 2、NAVSIM、WayveScenes101 等六类数据集并开源,但文中主要是扩展摘要,缺少系统实验,跨数据集收益仍未充分说明。

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation Figure 1
2026-06-04cs.RO

Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation

Yilong Wang, Cheng Qian, Edward Johns

The Robot Learning Lab, Imperial College London

2026-06-04机器人模仿学习

针对柔性物体状态高维、遮挡多且同一任务存在多种有效操作流程的问题,Instant-Fold将服装折叠建模为单示范提示下的上下文模仿学习:先用时间对比预训练获得形变一致的视觉 token,再以示范条件化的 flow-matching Transformer生成双臂动作。实验显示,示范条件比语言条件更能保留几何与时序意图,模型可泛化到未见折叠模式和衣物,并在无真实数据微调下实现零样本 sim-to-real;但仍依赖分割、手工上下文库和较规整初始状态。

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation Figure 1
2026-06-04cs.CV

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

2026-06-04视觉感知生成模型

针对自回归 VLM 会推理但图像质量弱、扩散模型能生成图像却难生成连贯文字的问题,UniCanvas 将文字也视为可绘制的像素模式,在共享画布上用单一扩散骨干和统一去噪目标联合生成图文,并通过两阶段生成与 CLIP 对齐增强可读性。实验显示其在 Recipe、FrozenLake、RLBench 等多步任务中较分离式基线有更好的文字一致性、视觉保真度和长程状态更新稳定性。

Can Generalist Agents Automate Data Curation? Figure 1
2026-06-04cs.AI

Can Generalist Agents Automate Data Curation?

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

Virginia Tech, 2University of Illinois Urbana-Champaign, University of Wisconsin-Madison, 4University of California, Berkeley, sequential yet labor-intensive parts of modern, Code and benchmark available at: https://github., when additional raw data is unavailable or increas-, adapt, and validate the data already available.

2026-06-04视觉感知

论文关注训练数据整理仍依赖人工反复试错的问题,提出 CURATION-BENCH,将模型、训练流程和评测固定,让通用代码智能体通过命令行迭代提出、执行并修订数据策略。结果显示,开放提示的智能体能在少量迭代内接近强人工基线,但多停留在局部启发式调参;要求引用、实例化并改造既有方法的脚手架可促成更有效的策略探索,并在十分之一数据预算下超过已发表基线。

SBP-Net: Learning Thin Structure Reconstruction with Sliding-Box Projections Figure 1
2026-06-04cs.CV

SBP-Net: Learning Thin Structure Reconstruction with Sliding-Box Projections

Ofir Gilad, Andrei Sharf

2026-06-04三维

针对血管、管线等稀疏细长三维结构在缺失、噪声和低采样下易断裂、过平滑的问题,SBP-Net将全局3D补全拆成重叠滑动盒的六向正交深度投影,用带注意力的U-Net在2D中补洞,再反投影融合回体素模型。实验覆盖肺动脉CT、合成与真实工业管线,显示相比现有方法更能保留细节和拓扑连续性。

Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurement Figure 1
2026-06-04cs.CV

Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurement

Lixuan Chen, Zhongnan Liu, Jesse Hamilton, James M. Balter, Jeong Joon Park, Liyue Shen

University of Michigan

2026-06-04视觉感知三维

面向 MRI 引导放疗等需要低延迟 3D 解剖可视化的场景,论文针对单次超稀疏 k-space 采样下前瞻重建病态的问题,提出 PDMR:先离线学习患者特异的非线性运动潜空间,并用 tri-plane 映射生成 3D 形变场,在线只优化低维 latent 以快速跟踪运动。XCAT 与腹部 MRI 实验显示其在 Immediate/After-2min 设置下重建更稳定,较 MR-MOTUS 等基线取得更高 PSNR/SSIM,院内数据约有 2dB 以上增益。

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark Figure 1
2026-06-04cs.AI

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari, Yasamin Medghalchi, Ilker Hacihaliloglu, Mesrob Ohannessian, Lele Wang, Giuseppe Carenini

2026-06-04数据集/基准

本文关注多模态模型在数学解题中“把问题转成图、再从图中推理”的薄弱环节,提出 VAMPS:基于伊朗高考代数/微积分题的波斯语-英语双语基准,含 1,168 道需借助绘图发现交点、极值、渐近线等线索的选择题,并评估文本解析、Desmos 工具绘图与给定可视化等模式。主要结果显示,多数模型即使在适合画图的题上,直接符号/文本求解仍优于工具辅助视觉求解,说明瓶颈在工具调用、图像生成质量和视觉解释的衔接。

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1) Figure 1
2026-06-04cs.CV

Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)

Jingbiao Mei

University of Cambridge, University of Cambridge Cambridge United Kingdom

2026-06-04视觉语言

面向图文混排文档的 RAG 需要同时利用视觉、文本与版面信号,而传统 OCR/文本检索容易丢失关键信息。本文总结 EReL@MIR 2025 多模态文档检索挑战,首次用统一系统同时评测长文档页内检索 MMDocIR 与开放域图像/图文到段落检索 M2KR。结果显示,优胜方案均转向 Qwen2-VL 系多模态 LLM 表征而非 CLIP,任务感知管线更有效;无训练的多路融合加重排方法仅落后微调集成约 0.1 分。

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities Figure 1
2026-06-04cs.MM

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Taranukhin, Maura Grossman, Vered Shwartz, Yuntian Deng, Ebrahim Bagheri

University of Toronto, University of Waterloo, Toronto Metropolitan University, University of British Columbia, Vector Institute, body of work on detection across text, images, and audio. Most available detectors, are publicly available at https://github.com/sadjadeb/DetectZoo, and the, Label

2026-06-04视觉感知

生成式模型让文本、图像、音频中的人机内容边界变模糊,但现有检测器代码、预处理和指标割裂,难以公平比较和复现。DetectZoo的核心贡献不是新检测算法,而是将三种模态的61个检测器、22个基准数据集和统一评测API整合到同一工具链,覆盖数据加载、预处理、权重缓存、打分与多指标报告。文中结果表明该框架可复现原方法并支持系统化跨模态基准分析,但训练流水线、视频支持和部分外部模型依赖仍未解决。

Spatial Artifact Coherence Determines Codec Robustness in Patch-Based rPPG Figure 1
2026-06-04cs.CV

Spatial Artifact Coherence Determines Codec Robustness in Patch-Based rPPG

Achraf Ben Ahmed

2026-06-04安全鲁棒

面向远程医疗等压缩视频场景,论文指出基于分块 PCA 的 rPPG 在不同编码器下表现差异并非只由码率决定,而由跨面部块伪影的空间相干性主导。作者提出 SAC 指标和 PatchPCA 系列,用 280 名受试者、3 个数据集、11 种退化和 13 个算法验证:SAC 解释 93.8% 的变体间 PCA 优势方差,MPEG-4 呈高 SAC 且显著削弱 PCA 增益;低 SAC、低到中等运动时 P-Hybrid 更稳健。

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs Figure 1
2026-06-04cs.CV

GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMs

Weidong Tang, Jierui Li, Yueling Hou, Zihan Mei, Can Zhang, Xinyan Wan, Zhiyuan Liang, Pengfei Zhou, Yang You, Wangbo Zhao

Xidian University, National University of Singapore, University of Electronic Science and Technology of China, University of Science and Technology of China

2026-06-04学习理论数据集/基准

论文针对现有 MLLM 心智理论评测多停留在个体意图推断、难以刻画群体中从众、权力结构和信息不对称导致的非线性涌现,提出 GroupToM-Bench:包含 8 类社会域、240 个专家场景和 3000+ 推理任务,并用微观 BDI—中观张力/约束—宏观结果的七级审计框架诊断模型。实验显示当前强模型与人类仍有明显差距,常把群体结果线性化为理性共识,难以识别群体迷思、阿比林悖论等结构性陷阱。

End-to-End Text Line Detection and Ordering Figure 1
2026-06-04cs.CV

End-to-End Text Line Detection and Ordering

Benjamin Kiessling (ALMAnaCH)

2026-06-04视觉感知

历史文档OCR常把行检测与阅读顺序排序拆开,后者依赖几何启发式,难处理边注、多栏、表格和不同转写规范。Orli将页面布局建模为图像到序列任务,自回归输出按阅读顺序排列的文本基线,并用弦坐标参数化与局部细化恢复曲线。在19.7万页、多书写系统数据上训练后,无需特定微调即在cBAD略超既有最佳,并在OHG、FCR近乎完美;ABP需少量微调提升排序,说明专门版式仍依赖适配。

Pinpoint: Grounded Worldwide Image Geolocation via Cross-Source Retrieval and Reranking Figure 1
2026-06-04cs.CV

Pinpoint: Grounded Worldwide Image Geolocation via Cross-Source Retrieval and Reranking

Nika Chuzhoy, Brian Hu, Amit A. Arora, Jae Ro, Sarthak S. Sahu

2026-06-04视觉感知强化学习

Pinpoint针对全球图像定位中视觉线索歧义、互联网照片与街景数据长期割裂的问题,提出不依赖多模态大模型的检索—重排序框架:先用Flickr与OSV-5M联合训练图像-GPS对比嵌入检索候选,再用注意力重排序融合候选视觉/GPS特征及邻近跨源证据。其在IM2GPS3k、YFCC4k和OSV-5M各距离阈值均达到SOTA,同时强调更低延迟与可复现性。

SymTRELLIS: Symmetry-Enforced Voxel Latents for 3D Generation Figure 1
2026-06-04cs.GR

SymTRELLIS: Symmetry-Enforced Voxel Latents for 3D Generation

Guangda Ji, Qimin Chen, Qinchan Li, Mingrui Zhao, Kai Wang, Hao Zhang

Simon Fraser University, Simon Fraser University Burnaby BC Canada

2026-06-04三维

单视图3D生成虽外观逼真,却常破坏齿轮、陀螺等物体赖以工作的对称性。SymTRELLIS不重训TRELLIS.2,而学习空间变换在体素潜变量中的线性作用,并在ODE采样每步对对称等价的流速度求平均,从生成过程中强制旋转、反射及多面体点群对称。266个严格对称物体上,它较TRELLIS.2、Hunyuan3D-2.1和TripoSG显著降低对称误差,同时基本保持重建精度。

Reflection Separation from a Single Image via Joint Latent Diffusion Figure 1
2026-06-04cs.CV

Reflection Separation from a Single Image via Joint Latent Diffusion

Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang

National Taiwan University, National Yang Ming Chiao Tung University

2026-06-04视觉感知生成模型

本文针对单张图像反射分离在强眩光、弱反射等信息不足场景下易残留或失真的问题,提出联合潜空间扩散框架,同时生成透射层与反射层。核心在于利用预训练扩散先验,并通过跨层自注意力、互相约束的 disjoint sampling 及带学习组合函数的潜变量优化来减少层间干扰。实验显示其在多个真实基准上超过现有方法,尤其改善强反射细节补全和弱反射提取。

When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection Figure 1
2026-06-04cs.CV

When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection

Tao Yu, Yujia Yang, Shenghua Chai, Zhang Jinshuai, Haopeng Jin, Hao Wang, Minghui Zhang, Zhongtian Luo, Yuchen Long, Xinlong Chen, Jiabing Yang, Zhaolu Kang, Yuxuan Zhou, Zhengyu Man, Xinming Wang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

1 CASIA 2 2 UCAS 3 3 BAAI 4 4 Tsinghua University 5 5 Peking University

2026-06-04视觉感知数据集/基准

针对视频谣言常通过剪辑、重排、拼接或局部生成来扭曲事件语义、仅看输入视频难以判真这一问题,论文提出搜索 grounded 的 EVID-Bench,要求模型检索开放网络相关视频并做跨视频证据对比,覆盖222个样本、9类操纵和6个主题。九个前沿多模态模型在检索增强基线下仍表现有限,最佳仅达61.43%点级准确率和43.24%视频级准确率,显示主要瓶颈在检索锚点选择、差异推理和证据充分性判断。

Optimal Transport Flow Matching by Design Figure 1
2026-06-04cs.CV

Optimal Transport Flow Matching by Design

Shimon Malnick, Matan Rusanovsky, Ohad Fried, Shai Avidan

Tel Aviv University, Reichman University

2026-06-04生成模型

论文针对流匹配中高维最优传输耦合难算、随机噪声-数据配对导致轨迹弯曲和少步生成低效的问题,提出不再求解固定高斯先验的 OT,而是把先验作为设计变量:用自然图像低频投影构造可采样的结构化先验,使其与原图的恒等耦合经验上满足 OT,并让模型主要补全高频细节。实验显示该设计无需改动流模型,可结合潜空间、CFG 和一步框架,轨迹曲率较现有方法降低超过 2 倍,少步/一步生成质量更好,但低频先验生成器仍是主要瓶颈。

Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning Figure 1
2026-06-04cs.CV

Intra-Modal Neighbors Never Lie: Rectifying Inter-Modal Noisy Correspondence via Graph-Based Intra-Modal Reasoning

Yang Liu, Wentao Feng, Shu-Dong Huang, Yalan Ye, Jiancheng Lv

2026-06-04视觉感知

针对网络图文数据中图像与文本错配会破坏跨模态检索训练的问题,论文指出现有替换单一样本标签的离散选择易受噪声邻居和离散化误差影响,提出 IN2R 利用模态内邻域结构更稳定的洞察,通过跨模型记忆检索高置信邻居,并用图精炼器聚合成连续软原型来校正监督信号。在 Flickr30K、MS-COCO 和 CC152K 上,该方法相较已有抗噪图文匹配方法取得更优结果,尤其面向高噪声场景。

Weakly Supervised Incremental Segmentation via Semantic Anchors and Spatial Arbitration Figure 1
2026-06-04cs.CV

Weakly Supervised Incremental Segmentation via Semantic Anchors and Spatial Arbitration

Zhonggai Wang, Kai Fang, Guangyu Gao

2026-06-04视觉感知

这篇论文关注弱监督增量语义分割中,CAM 伪标签稀疏与旧模型补全会在同一物体内产生新旧类矛盾,长期累积导致特征漂移和遗忘。作者提出 SASA:用可学习语义锚点稳定类别身份,并以弹性残差吸收实例变化;同时通过空间标签仲裁利用物体掩码执行“一物一类”过滤噪声。实验在 Pascal VOC 与 MS COCO 上优于现有方法,尤其多步增量场景更明显。

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation Figure 1
2026-06-04cs.CV

Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation

Boyuan Xiao, Bohong Chen, Yumeng Li, Ji Feng, Yao-Xiang Ding, Kun Zhou

2026-06-04视觉语言视觉感知

本文针对机器人操作与导航中 VLM/VLA 难以从干扰物中识别任务相关目标、导致幻觉和误定位的问题,提出 SceneDiver:先构建场景图形成全局理解,再将任务分解到局部子场景中逐步生成聚焦计划,并用轻量适配器蒸馏到 VLA。实验显示其在操作任务提升约10%–15%,导航最高提升16%,LIBERO-plus 成功率最高提升9.6%,额外开销约2.64%。

TGSD: Topology-Guided State-Space Diffusion for EEG Spatial Super-Resolution Figure 1
2026-06-04eess.SP

TGSD: Topology-Guided State-Space Diffusion for EEG Spatial Super-Resolution

Zijian Kang, Weiming Zeng, Yueyang Li, Shengyu Gong, Hongjie Yan, Wai Ting Siok, Nizhuan Wang

2026-06-04生成模型

面向可穿戴/IoT低密度 EEG 难以保留跨脑区空间信息的问题,TGSD 将完整电极拓扑先验与条件扩散结合:用层次空间先验编码器建模局部几何和脑区上下文,再以交替时序/通道状态空间去噪生成缺失通道。SEED 与 PhysioNet MM/I 实验显示,其在不同超分辨率倍率下的重建误差和下游分类表现均优于代表性基线。

PointAction: 3D Points as Universal Action Representations for Robot Control Figure 1
2026-06-04cs.RO

PointAction: 3D Points as Universal Action Representations for Robot Control

Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

University of Pennsylvania

2026-06-04机器人规划控制三维

针对视频动作模型只用 RGB rollout 难以确定三维运动、接触几何与精细空间约束,且跨任务/本体动作标注昂贵的问题,PointAction 将动态 3D pointmap 作为视频预测到控制的通用接口:先联合生成未来 RGB 与 XYZ 点图,再由扩散式动作解码器映射为机器人控制。实验显示其在机器人场景 4D 生成质量上达到 SOTA,在仿真中优于 VLA/VAM 基线,并能迁移到预训练未见的两种真实机械臂。

2026-06-03

147 篇
SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image Figure 1
2026-06-03cs.CV

SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image

Inhee Lee, Sangwon Baik, Sungjoo Kim, Hyeonwoo Kim, Hyunsoo Cha, Hanbyul Joo

Seoul National University

2026-06-03视觉感知三维

这篇论文针对单图重建的多物体场景在机器人仿真中常因穿模、悬空或下沉而失效的问题,提出 SimuScene:把物理引擎从事后修布局变成重建过程中的诊断信号,用重力下接触位移、穿透等反馈驱动竖直拉伸和遮挡形状重采样,从而同时修正形状与位姿。实验显示其在物理稳定性和几何对齐指标上达到领先,并可用于类人控制和机械臂操作场景。

Exploring Easy Boosts for Lidar Semantic Scene Completion Figure 1
2026-06-03cs.CV

Exploring Easy Boosts for Lidar Semantic Scene Completion

Tetiana Martyniuk, Jonathan Seele, Alexandre Boulch, Gilles Puy, Renaud Marlet, Raoul de Charette

2026-06-03视觉感知

本文针对激光雷达语义场景补全中复杂架构不断堆叠、但输入先验贡献不清的问题,系统考察两种“低成本”增强:用现成点云分割器为输入点云提供语义伪标签,并用射线可见性区分空闲与未知体素。结果显示语义先验是 mIoU 提升主因,可见性带来次级增益;二者结合使4个既有模型平均提升约5.2 mIoU,SSA-SC 达到28.8 mIoU,旧模型也可接近或超过可复现SOTA。

Neuron Populations Exhibit Divergent Selectivity with Scale Figure 1
2026-06-03cs.LG

Neuron Populations Exhibit Divergent Selectivity with Scale

Amil Dravid, Yasaman Bahri, Alexei A. Efros, Yossi Gandelsman

2026-06-03视觉感知

这篇论文关注 scaling laws 之外的内部表征如何随模型规模变化,试图解释大模型中哪些单神经元结构会跨训练重复出现。作者以 Rosetta Neurons 作为可测对象,在语言与视觉模型中发现其数量随规模按次线性幂律增长、占比下降;同时提出容量受限下的特征竞争解释,并观察到“神经元极化”:这些共享神经元更选择性、更单义且更领域专化,而非 Rosetta 神经元更多保持多义叠加。

PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation Figure 1
2026-06-03cs.CV

PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation

Shinjeong Kim, Ignacio Alzugaray, Callum Rhodes, Paul H. J. Kelly, Andrew J. Davison

Department of Computing, Imperial College London

2026-06-03视觉感知

PixVOD面向机器人/可穿戴等低功耗边缘视觉,试图避免把整帧像素传出传感器再集中计算。其核心是把单目6DoF视觉里程计和稠密深度估计写成分布在像素阵列上的高斯因子图,用GBP在像素间同步位姿,并结合光度观测、表面法线先验与关键帧式锚定稳定基线。实验在真实感数据上验证了片上分布式VO/深度估计的可行性,但文中结果更像近未来PPA设计探索,尚非真实传感器芯片完整实现。

NewtPhys: Do Foundation Models Understand Newtonian Physics? Figure 1
2026-06-03cs.CV

NewtPhys: Do Foundation Models Understand Newtonian Physics?

Sebastian Cavada, Soumava Paul, Tuan-Hung Vu, Andrei Bursuc, Raoul de Charette

aware evaluations. Code and datasets are available at:, rely on human judgments or high-level proxy labels and, therefore do not provide physics labels, while bench-, real-world dynamics in lab conditions [64]., is impractical outside lab conditions, NewtPhys uses 3D, physical labels and events over time, including forces

2026-06-03视觉感知

针对现有物理推理评测要么过于合成、要么缺少牛顿量真值的问题,NewtPhys用真实多视角场景的3D Gaussian Splatting结合点式牛顿仿真,生成含力、碰撞、形变、材质、场景流等像素对齐标注的4D基准,并构建141K物理VQA与730K帧数据。对56个VLM和10个VFM的评测显示,模型虽能处理部分常识或材质识别,但在质量、密度、力学因果等低层物理量上明显不足,且常依赖语言先验而非视觉线索。

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking Figure 1
2026-06-03cs.RO

Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking

Zekun Qi, Xuchuan Chen, Dairu Liu, Chenghuai Lin, Yunrui Lian, Sikai Liang, Zhikai Zhang, Yu Guan, Jilong Wang, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi

2026-06-03机器人视觉感知

论文针对人形机器人运动跟踪中“敏捷性与零样本泛化难兼得”的问题,认为瓶颈主要来自数据规模不足和模型结构不匹配。Humanoid-GPT用2B帧重定向运动语料、因果GPT式Transformer、专家蒸馏与HME平衡采样来学习在线全身控制。实验显示其在未见动作、遥操作和Unitree G1实机动态舞蹈等任务上保持实时稳定跟踪,并给出数据/模型scaling趋势。

Formalizing the Binding Problem Figure 1
2026-06-03cs.CV

Formalizing the Binding Problem

Lianghuan Huang, Yihao Li, Saeed Salehi, Yingshan Chang, Ansh Soni, Konrad P. Kording

Department of Physics and Astronomy, University of Pennsylvania, Philadelphia, PA, USA 2Department, of Computer and Information Science, University of Pennsylva-, nia 3Machine Learning Group, Technical University of Berlin, Berlin, Germany 4Language Technology Institute, Carnegie Mel-, lon University, Pittsburgh, PA, USA 5Department of Psychology, University of Pennsylvania 6Department of Neuroscience, Univer-, available, KordingLab/formalizing-the-binding-problem., X inside,” combining elements from the middle-center and the

2026-06-03视觉感知

这篇论文针对多物体场景中模型常把颜色、形状等特征归错对象的绑定问题,提出用信息论把“对象是否存在”的可解码信息形式化为绑定信息,并用探针估计 ViT 表征中的该信息。实验显示,[CLS] token 只保留不到一半绑定信息且呈二次结构,而完整空间 token 几乎可完美解码;结果说明强视觉识别与推理依赖细粒度空间表征中的绑定能力。

AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation Figure 1
2026-06-03cs.CV

AAD-1: Asymmetric Adversarial Distillation for One-Step Autoregressive Video Generation

Haobo Li, Yanhong Zeng, Yunhong Lu, Jiapeng Zhu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yujun Shen, Zhipeng Zhang

AutoLab, Department, University

2026-06-03视觉感知

面向实时流式视频/世界模型中的一阶段自回归图像到视频生成,AAD-1针对现有对抗蒸馏易运动坍塌、训练不稳的问题,提出生成器保持因果、判别器改为全时空双向注意力并输出视频级整体真实性评分的非对称设计,同时用分布匹配先热启动再对抗蒸馏。VBench实验显示其在一步自回归生成中达到SOTA,视觉质量和运动保真度更好,但快速运动、复杂结构和长程外推仍有限。

Video-Mirai: Autoregressive Video Diffusion Models Need Foresight Figure 1
2026-06-03cs.CV

Video-Mirai: Autoregressive Video Diffusion Models Need Foresight

Yonghao Yu, Lang Huang, Runyi Li, Zerun Wang, Toshihiko Yamasaki

The University of Tokyo, National Institute of Informatics, Peking University

2026-06-03视觉感知生成模型

这篇论文关注自回归视频扩散在流式生成中“只学当前、不规划未来”导致的身份、布局和运动漂移。Video-Mirai 的核心洞察是让未来帧只作为训练期表征监督:用冻结的非因果前瞻编码器读取完整 rollout,并将目标蒸馏到因果隐状态,推理时不增加架构、FLOPs 或 KV-cache 成本。结果上,5 秒 VBench 总分由 83.8 提升到 84.6,30 秒长 rollout 的主体一致性和背景一致性也明显提高。

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring Figure 1
2026-06-03cs.CV

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu

Carnegie Mellon University, Mitsubishi Electric Research Laboratories, Harvard University

2026-06-03视觉语言视觉感知安全鲁棒

面向智能眼镜、协作机器人等物理场景中错误后果不可逆的问题,VLESA强调安全判断必须同时预测未来动作并依赖人的意图:同一动作在不同目标下可安全或危险。其核心是从第一视角视频联合推断目标与候选动作,再用基于机器人宪法标注的 EgoSafety 数据和 GRPO 训练目标条件 Q-filter 做约束解码。实验称在 ASIMOV-2.0 上干预时机与准确率优于基线,Q-filter 使动作安全性提升超过 41 个百分点,但真实长尾视频鲁棒性仍文中未充分说明。

Demo2Tutorial: From Human Experience to Multimodal Software Tutorials Figure 1
2026-06-03cs.CV

Demo2Tutorial: From Human Experience to Multimodal Software Tutorials

Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao, Xiangwu Guo, Xin Wang, Mike Zheng Shou

Show Lab, National University of Singapore, be available at https://github.com/showlab/, often a labor-intensive process. For instance, in a desktop

2026-06-03视觉语言

论文针对原始屏幕演示冗长、缺少语言说明和视觉指引,难以复用为人类或 GUI 代理学习知识的问题,提出 Demo2Tutorial:同步记录屏幕与交互日志,经 VLM 动作解析、层级步骤规划和图文教程生成,将操作经验压缩为可执行多模态教程。在 TutorialBench 上总体分数 86.2,高于人工教程 79.1;用于 OSWorld 可将 Chrome 中 GPT-5 代理成功率从 52.9% 提升到 70.6%,用户完成任务也快 10.5% 且 80% 更偏好教程。

SEAOTTER: Sensor Embedded Autoencoding with One-Time Transcode for Efficient Reconstruction Figure 1
2026-06-03eess.IV

SEAOTTER: Sensor Embedded Autoencoding with One-Time Transcode for Efficient Reconstruction

Dan Jacobellis, Neeraja J. Yadwadkar

Department of Electrical and Computer Engineering, The University of Texas at Austin

2026-06-03三维

面向云机器人中高分辨率视觉数据受限于端侧算力、功耗与上行带宽的问题,SEAOTTER将轻量传感器端自编码潜表示与云端一次性转码结合,并学习JPEG颜色变换和量化矩阵,使后续数据以标准JPEG被反复解码使用。文中报告在200:1压缩率下,相比AVIF编码快7倍、解码快3.5倍,ImageNet top-1提升8%,同时保持JPEG基础设施兼容。

Adaptive Causal Alignment for High-Confidence Adversarial Training Figure 1
2026-06-03cs.CV

Adaptive Causal Alignment for High-Confidence Adversarial Training

Zhiming Luo, Kejia Zhang, Yingxin Lai, Junwei Wu, Juanjuan Weng, Shaozi Li

Department of Artificial Intelligence, Xiamen University, Xia-, Department of Computer Science, Emory University, GA, College of Information Science and Technology, Jinan Univer-

2026-06-03视觉感知

论文关注逆对抗训练中“高置信度”并不一定来自目标语义的问题,指出背景上下文既可能是有用先验,也可能形成伪相关,盲目抑制会造成特征损失。为此提出 HICAT,通过可学习背景偏差估计、 自适应 logit 去偏和 FLOE 正交约束实现因果对齐。在 CIFAR-10/100 与 ImageNet-1K、CNN 和 ViT 上,相比匹配基线提升鲁棒性并缩小鲁棒泛化差距。

GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images Figure 1
2026-06-03cs.CV

GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images

Jiahao Sun, Dingkun Wei, Zehong Shen, Hongyu Zhou, Yujun Shen, Liang Li

Zhejiang University

2026-06-03视觉感知三维

GARDEN针对RGB多视角重建虽逼真但缺少物理坐标、前景物体与背景纠缠,难以用于机器人交互和仿真的问题,提出以重力作为通用先验,将场景对齐到Gravity-View坐标系,并重建带6-DoF位姿的独立刚体网格,再用条件3D点分类清除背景中的重复物体几何。实验显示其较CAD检索式流程提升物体放置与解耦质量,并将LiteReality等流程耗时从约4330秒降至560秒。

Benchmarking Visual State Tracking in Multimodal Video Understanding Figure 1
2026-06-03cs.CV

Benchmarking Visual State Tracking in Multimodal Video Understanding

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

New York University

2026-06-03视觉语言视觉感知数据集/基准

现有视频理解评测常可依赖关键帧或终态作答,难以检验机器人等场景所需的连续状态跟踪。本文提出 VSTAT 基准,含 834 段合成与真实过程视频、1500 个必须跨全视频整合事件的问题。实验显示,先进 MLLM 远低于人类且仅略高于答案先验;诊断表明主要瓶颈不是文本推理,而是事件识别、实体关联和状态更新等视觉感知失败,视频/代码智能体也未能明显缓解。

PatchScene: Patch-based Voxel Diffusion for Large-Scale Scene Completion Figure 1
2026-06-03cs.CV

PatchScene: Patch-based Voxel Diffusion for Large-Scale Scene Completion

Qingdong Xu, Jiajun Zhu, Shilin Zhu, Xinjing He, Chao Lu, Huanran Wang, Jiyao Zhang

Peking University, Northeastern University, China, Northwest Polytechnical University, Xi’an, retraining, highlighting its strong scalability and general-, ther validates its flexible spatial scalability. Finally, the in-, pancy state (occupied / free) and semantic labels of each

2026-06-03生成模型

面向自动驾驶中稀疏、远距且有遮挡的 LiDAR 场景补全,PatchScene 将大场景拆为局部体素 patch,直接在显式体素空间做扩散生成,并用置信度引导的时空融合连接重叠区域与相邻帧;其 Annular-Flow 策略按 LiDAR 径向密度由近到远传播信息。SemanticKITTI 上报告达到 SOTA,且 20m 训练可泛化到 50m,显示较强尺度扩展与时序一致性。

Bootstrap Your Generator: Unpaired Visual Editing with Flow Matching Figure 1
2026-06-03cs.CV

Bootstrap Your Generator: Unpaired Visual Editing with Flow Matching

Yoad Tewel, Yuval Atzmon, Gal Chechik, Lior Wolf

2026-06-03生成模型

针对图像/视频编辑依赖海量成对样本、长尾创意编辑难以采集监督的问题,ByG提出无配对训练的flow matching编辑框架:用冻结生成基模型提取指令语义信号,以循环一致性保持源结构,并通过类似STE的梯度路由把干净输出损失传回噪声训练状态。实验显示其在数据稀缺图像与视频编辑中优于多种零样本和监督基线,用户偏好率超过训练于百万级配对数据的模型。

SparseStreet: Sparse Gaussian Splatting for Real-Time Street Scene Simulation Figure 1
2026-06-03cs.CV

SparseStreet: Sparse Gaussian Splatting for Real-Time Street Scene Simulation

Qingpo Wuwu, Xiaobao Wei, Peng Chen, Nan Huang, Zhongyu Zhao, Hao Wang, Ming Lu, Ningning Ma, Shanghang Zhang

Peking University, Chinese Academy of Sciences, University of Illinois, environments, which limit realism and scalability. To address these, scalability. To better model dynamic environments, several meth-, to address these scalability issues. One prominent line of work

2026-06-03三维

SparseStreet针对自动驾驶街景3D Gaussian Splatting中高斯数量过多、存储和渲染开销大的问题,利用“动态目标需高保真、静态背景冗余更多”的洞察,提出可插拔压缩框架:按场景图节点学习剪枝强度,并在表示稳定后用融合权重与投影面积评估背景重要性再压缩。在Waymo和nuScenes上接入StreetGS、OmniRe,可减少最高约80%高斯基元,动态物体质量基本保持,渲染FPS约提升2倍。

MAdam: Metric-Aware Multi-Objective Adam Figure 1
2026-06-03cs.LG

MAdam: Metric-Aware Multi-Objective Adam

Fengbei Liu, Rachit Saluja, Sunwoo Kwak, Ruibo Wang, Ruining Deng, Heejong Kim, Johannes C. Paetzold, Mert R. Sabuncu

Delft University of Technology

2026-06-03视觉感知

本文关注多目标学习中常见的“先由 MOO 求解器合成方向、再交给 Adam 更新”流程,指出 Adam 二阶矩会稀释动态偏好并改变求解器假设的欧氏几何。MAdam 以偏好条件化的对角 Fisher 对合成梯度做预条件,作为不改求解器和 Adam 的包装器。实验覆盖多任务、Pareto 前沿、PINN 与医学影像,整体上相对 Adam 稳定提升各类基线。

An Attention-Based Denoising Model for Diffusion Weighted Imaging Figure 1
2026-06-03cs.CV

An Attention-Based Denoising Model for Diffusion Weighted Imaging

Prithviraj Verma, Pawan Kumar, Chandan Deshani, Prasun Chandra Tripathi

2026-06-03生成模型

针对缩短 DWI 扫描时间后信噪比下降、幅值重建带来信号相关 Rician 噪声且 CNN 难以建模长程结构的问题,论文提出噪声级条件化的 Swin Transformer–Restormer 去噪框架,用窗口自注意力、通道门控细化和残差重建适配 1%–15% 噪声。实验在合成污染 DWI 上取得平均 PSNR 33.69 dB、SSIM 0.8539,但真实临床泛化与相对增益来源文中仍需更充分说明。

Electromagnetic Navigation for Femoral Osteotomy Using High-Accuracy X-ray-to-CT Registration Figure 1
2026-06-03cs.CV

Electromagnetic Navigation for Femoral Osteotomy Using High-Accuracy X-ray-to-CT Registration

Roman Flepp, Arend Nieuwland, Bastian Sigrist, Philipp Fürnstahl, Lilian Calvet, Thomas Dreher

Department of Pediatric Orthopedics and Traumatology, University, Research in Orthopedic Computer Science, University Hospital, Balgrist, University of Zurich, Switzerland., Department of Orthopedic Surgery, University Hospital Balgrist, University of Zurich, Switzerland.

2026-06-03机器人

股骨截骨中,术前 CT 计划难以准确、低创且低辐射地转移到术中,徒手依赖多次透视,PSI 又有暴露和制造成本。本文将两张术中透视的 C 臂校准/X-ray-to-CT 配准与电磁跟踪结合,实现锯片和骨片相对术前计划的实时无透视导航。在 18 根合成股骨实验中,角度误差较徒手从 6.32°降至 3.05°,无病例超过 5°阈值,并在角度和平移精度上与 PSI 统计等效,但仍需尸体和临床验证。

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs Figure 1
2026-06-03cs.CV

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

Tsinghua University, Shanghai AI Laboratory, Beihang University

2026-06-03视觉语言数据集/基准

面向机器人、AR 和自动驾驶中的在线空间理解,本文指出现有视频/空间基准多给完整视频或偏事件记忆,难以检验因果视角流中的空间建图。OVO-S-Bench 以查询时间戳+证据区间限制模型只看前缀,人工构建 348 段视频 1680 题,覆盖从当前感知到自中心/他中心建图的四层能力。38 个 MLLM 测试显示最强 Gemini-3.1-Pro 仍落后人类 27 分,L4 拓扑建图是主要瓶颈,专门流式/空间微调模型常低于原 backbone,未落地的 CoT 还会放大空间错误。

CoralBay: A Self-Supervised CT Foundation Model Figure 1
2026-06-03cs.CV

CoralBay: A Self-Supervised CT Foundation Model

Ioannis Gatopoulos, Nicolas Känzig, Sebastian Otálora, Fei Tang

2026-06-03视觉感知

针对2D自然图像预训练难以刻画CT体数据的三维连续性、HU强度语义和各向异性问题,CoralBay将DINO自蒸馏扩展到层次化3D Swin,并对多尺度特征拼接监督,结合3D裁剪与随机HU窗等放射学增强。文中报告其在多类放射分类与分割任务上稳定迁移,两个规模模型用更少数据取得较强表现,并通过eva提供可复现3D榜单。

Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs Figure 1
2026-06-03cs.CV

Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

Wei Ding, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

Tsinghua University, Tsinghua University, Tencent, University of Macau, University of Science and Technology Beijing

2026-06-03视觉语言

多视觉编码器VLM常靠堆叠异构编码器提分,但推理时遮蔽难以反映联合训练中的真实作用。本文在Cambrian-1套件上重训五个编码器的31个非空子集,提出Capacity–Necessity分解并用预投影有效秩解释组合差异。结果显示重训排名与遮蔽法不一致,ConvNeXt+CLIP两编码器已接近五编码器性能,新增编码器收益迅速递减。

MLP Splatting: Object-Centric Neural Fields Figure 1
2026-06-03cs.CV

MLP Splatting: Object-Centric Neural Fields

Shinjeong Kim, Yuzhou Cheng, Xin Kong, Paul H. J. Kelly, Andrew J. Davison

Department of Computing, Imperial College London

2026-06-03视觉感知

针对 NeRF/3DGS 难以天然按物体分解、需额外分割才能编辑的问题,MLP-Splatting 将场景表示为少量具局部支撑的独立小 MLP primitive,用稀疏体渲染组合,并让物体/部件级结构在 RGB 监督下自然涌现,可选蒸馏语义特征支持开放词汇交互。实验在 Replica/ScanNet 上保持相近或更好新视角质量,较语义 3DGS 约 1/15 显存、3× 渲染速度,同时给出内存-误差理论解释。

Seg2Track++: Probabilistic Track Validation and Data Association for Multi-Object Tracking and Segmentation Figure 1
2026-06-03cs.CV

Seg2Track++: Probabilistic Track Validation and Data Association for Multi-Object Tracking and Segmentation

Diogo Mendonça, Tiago Barros, Cristiano Premebida, Urbano J. Nunes

2026-06-03视觉感知

面向自动驾驶等动态场景中的多目标跟踪分割,论文指出直接用 SAM2 容易因关联不稳和误检持续传播形成幽灵轨迹。Seg2Track++在实例分割与 SAM2 外加入轨迹管理,用掩膜质心距离、置信度调制关联和基于 Bernoulli 滤波的概率轨迹验证来抑制假轨迹。在 KITTI MOTS 上,相比原 Seg2Track-SAM2 提升身份保持与鲁棒性,并减少误检传播,且无需微调。

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction Figure 1
2026-06-03cs.CV

DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction

Koki Nagano, Hongyu Liu, Seonwook Park, Tianye Li, Amrita Mazumdar, Christian Jacobsen, Shengze Wang, Michael Stengel, Rajarshi Roy, Ka Chun Cheung, Simon See, Shalini De Mello

2026-06-03视觉感知

DyaPlex针对双人交流中语音与肢体动作同时感知、同时回应的需求,解决以往方法离线生成或只看语音/粗略位置而缺乏闭环互动的问题。它冻结全双工语音模型,新增可流式运动塔,通过双人动作token交错与时间对齐RoPE跨注意力耦合语音隐状态和动作序列。在4000小时Seamless Interaction训练后,文中报告其在单人和双人交互基准上达到SOTA,但部分增益可能主要来自scaling / data。

Visual Instruction Tuning Aligns Modalities through Abstraction Figure 1
2026-06-03cs.CV

Visual Instruction Tuning Aligns Modalities through Abstraction

Luis Palacios, Lorenzo Basile, Diego Doimo, Alberto Cazzaniga

2026-06-03视觉感知

论文关注视觉指令微调如何把图像特征接入预训练 LLM 的层级表征,而不只是经验提升 VLM 性能。作者在多种开放 VLM 上用因果干预、语义探针和表示几何比较发现,跨模态整合主要发生在中间语义抽象层,早期层更偏单模态处理;消融这些层性能下降最大。进一步只微调中间层即可接近全量微调,尤其在视觉中心任务上保持效果并降低训练时间。

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation Figure 1
2026-06-03cs.CV

Unified Video-Action Joint Denoising for Dexterous Action and Data Generation

Dingrui Wang, YuAn Wang, Jinkun Liu, Yue Zhang, Mattia Piccinini, Yu Sun, Johannes Betz

Technical University of Munich, Tsinghua University

2026-06-03视觉感知

论文针对灵巧操作中纯动作预测缺少对接触后视觉演化建模、且成对视频-动作数据昂贵的问题,提出 Donk:在视频扩散 Transformer 上联合去噪视频 latent 与双手 MANO 动作 token,把带初始图像的 TI2VA 策略和纯文本 T2VA 数据生成统一为同一条件生成模型。实验显示其在 OakInk 上提升手部 RMSE 与腕部轨迹误差,同时保持较好视频质量(LPIPS 0.2992),并能从文本生成较平滑的对齐视频-动作 rollout。

Where Do We (Not) Need Temporal Context in Low-Resource Video Task Adaptation? Figure 1
2026-06-03cs.CV

Where Do We (Not) Need Temporal Context in Low-Resource Video Task Adaptation?

Luc P.J. Sträter, Hazel Doughty

Leiden University, these models still require adaptation to task-specific objectives, label spaces or domains. This is, and removes the need for elaborate task-specific decoders. (4) Temporal modeling is driven by the

2026-06-03视觉感知

本文关注低资源视频任务中,PEFT 与探测头应把时间上下文放在骨干、适配模块还是预测头的问题。作者系统比较图像/视频预训练骨干、LoRA/AdaptFormer/ST-Adapter 等方法及不同探测头,提出“时间上下文分配”视角。结果显示,视频预训练骨干配合标准 PEFT 通常优于图像到视频适配;运动任务偏好注意力式适配,空间密集预测更适合 MLP 式适配;简单 attentive probe 与 PEFT 结合后已足够,骨干仍是时间建模和吞吐瓶颈。

Conditional Latent Diffusion Model with Fourier-based Motion Modelling for Virtual Population Synthesis Figure 1
2026-06-03cs.CV

Conditional Latent Diffusion Model with Fourier-based Motion Modelling for Virtual Population Synthesis

Shaokun Lan, Haoran Dou, Jinghan Huang, Arezoo Zakeri, Fengming Lin, Zherui Zhou, Jinming Duan, Alejandro F. Frangi

2026-06-03生成模型

面向心血管器械 in-silico 试验所需的动态虚拟人群,本文针对现有网格生成多偏静态、序列模型心动周期闭合不稳的问题,提出 4D F-MeshLDM:先用 Mesh VAE 表示解剖,再在潜空间用截断傅里叶系数显式建模周期运动,并以条件扩散生成系数 token。基于 5000 名 UK Biobank 数据,模型在解剖保真度上优于多种基线,周期闭合误差接近零,且较好保持临床功能指标。

TeX-1500: A Paired Real-World LWIR Hyperspectral Dataset and Benchmark for Temperature-Emissivity-Texture Decomposition Figure 1
2026-06-03cs.CV

TeX-1500: A Paired Real-World LWIR Hyperspectral Dataset and Benchmark for Temperature-Emissivity-Texture Decomposition

Cheng Dai, Jiale Lin, Hongyi Xu, Bingxuan Song, Ziyang Xie, Fanglin Bao

2026-06-03强化学习数据集/基准

针对现有长波红外高光谱 TeX 分解多依赖逐场景逆优化、缺少跨真实场景配对监督的问题,论文构建 TeX-1500:包含 1,522 组校准 LWIR HSI 与温度、发射率、纹理标签,并统一恢复与标定流程;同时给出波长感知 TeX-UNet 基线。实验在 DARPA 留出场景及 FTIR 零/少样本迁移上验证该数据可用于监督学习和可量化评测,但性能增益可能主要来自数据与协议规模化。

Template Collapse and Information-Theoretic Limits in Camera rPPG Pulse Morphology Restoration Figure 1
2026-06-03cs.CV

Template Collapse and Information-Theoretic Limits in Camera rPPG Pulse Morphology Restoration

Achraf Ben Ahmed

2026-06-03视觉感知

本文针对消费级人脸摄像头 rPPG 能否恢复用于动脉僵硬评估的单周期脉搏形态这一问题,系统测试 3 个数据集 153 名受试者上的 16 类架构,并提出 cross-subject Pearson r 识别“模板坍缩”。结果显示所有模型均未恢复个体特异形态,SupCon 收敛到信息论空值;VAE 只补回群体平均谐波内容,抗坍缩目标在输入缺乏可辨别结构时也失效。

Beyond Compression: Quantifying Spectral Accessibility in Vision Representations Figure 1
2026-06-03cs.CV

Beyond Compression: Quantifying Spectral Accessibility in Vision Representations

Akayou A. Kitessa, Yijun Zhao

Fordham University

2026-06-03视觉感知

这篇论文关注视觉/视觉语言模型把图像特征压缩到共享嵌入时,是否只是降维,还是会选择性改变空间频率信息。作者用线性探针衡量各频段傅里叶能量的可恢复性,并提出相对随机投影基线的残差谱损失 RSL。结果显示 CLIP 与 DINOv2 的频谱可访问性随深度非单调变化,中间层最高、输出前下降;CLIP 投影基本谱中性,而 DINOv2 的 [CLS] 池化带来结构化频谱损失。

No Figure
2026-06-03cs.CL

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

2026-06-03安全鲁棒

针对多模态大模型鲁棒与安全评测长期偏英语的问题,本文将多项基准翻译校验到12种语言,系统考察对抗图像与文本/图像越狱。核心发现是,对抗扰动可跨语言迁移;低资源语言看似更安全,往往源于模型读不懂指令或图中文字的“失败式安全”,而非真实对齐。相比仅做多语指令微调的 Palo、Parrot,训练全流程融入多语能力的 Qwen3-VL 表现出更稳定的跨语拒答。

Training-Free Multi-Concept LoRA Composition with Prompt-Aware Weighting Figure 1
2026-06-03cs.CV

Training-Free Multi-Concept LoRA Composition with Prompt-Aware Weighting

Georgios Tsoumplekas, Stella Bounareli, Vasileios Argyriou

Department of Networks and Digital Media, Kingston University London, UK

2026-06-03视觉感知

多概念文本到图像定制中,直接合并多个 LoRA 容易产生概念干扰并损害身份保真。论文的核心思路是在无训练解码阶段利用提示词中触发词的语义影响,为各 LoRA 输出自适应赋权,提出 W-Switch 与 W-Composite,并补充基于分割区域与参考图的 CLIP、DINO、ArcFace 评估。实验在 ComposLoRA 上显示视觉质量、身份保持和组合性均优于既有方法,用户与 LLM 评测也支持该结论。

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation Figure 1
2026-06-03cs.CV

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

Zeno Testa, Antonino Furnari, Lorenzo Baraldi, Natalia Díaz-Rodríguez

University of Modena and Reggio Emilia, University of Catania, University of Granada, CITIC & DaSCI Institute, Spain, ness. Code, prompts, and benchmark files are available at

2026-06-03数据集/基准

本文针对手语翻译仍主要依赖 BLEU/ROUGE 等表层重合指标、难以衡量语义忠实的问题,提出从手语理解角度评测的 SLU-2K 基准:基于 PHOENIX-2014T 和 CSL-Daily 自动生成并过滤 2350 个封闭式视频问答,覆盖动作、地点、数字、时间等语义类别。实验显示通用 MLLM 接近随机,微调 SLT 系统也仅达 56.7%–75.2%,暴露出现有评测高估真实理解,尤其数字等精确信息仍是短板。

AmbientEye: A Dataset for Pupil Segmentation under Natural Ambient Infrared Illumination Figure 1
2026-06-03cs.CV

AmbientEye: A Dataset for Pupil Segmentation under Natural Ambient Infrared Illumination

Mingyu Han, Hyunyoung Han, Nitheekulawatn Thommakoon, Gangtae Park, Jieun Han, Xucong Zhang, Ian Oakley

Electrical Engineering, Korea Advanced Institute of Science and Technology, KR, Intelligent Systems Department, Delft University of Technology, NL

2026-06-03视觉感知数据集/基准

论文针对智能眼镜全天候眼动追踪中主动红外补光耗电高、户外自然红外未被现有数据集覆盖的问题,提出 AmbientEye 数据集:在无主动红外、自然阳光下采集35名受试者、双离轴视角和两种朝阳条件的约260万张眼图,并用 SAM2 加人工修订标注瞳孔。基准结果显示,现有分割模型性能从受控红外数据的0.928降至0.767,揭示户外被动红外下的几何畸变与光照饱和是关键难点。

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models Figure 1
2026-06-03cs.CV

Ultralytics YOLO26: Unified Real-Time End-to-End Vision Models

Glenn Jocher, Jing Qiu, Mengyu Liu, Shuai Lyu, Fatih Cagatay Akyon, Muhammet Esat Kalfaoglu

2026-06-03视觉感知

面向机器人等边缘场景中实时视觉既要低延迟又要易部署的问题,YOLO26在YOLO11基础上采用去DFL的双头结构,实现原生NMS-free推理,并用MuSGD、Progressive Loss和STAL分别改善收敛、推理头监督与小目标正样本覆盖;同时扩展分割、姿态、OBB和开放词汇YOLOE-26。其在COCO达40.9–57.5 mAP、T4 TensorRT延迟1.7–11.8 ms,较YOLO11提升1.6–2.8 AP并推进精度-延迟前沿。

Qwen-Image-Flash: Beyond Objective Design Figure 1
2026-06-03cs.CV

Qwen-Image-Flash: Beyond Objective Design

Tianhe Wu, Kun Yan, Zikai Zhou, Lihan Jiang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Ningyuan Tang, Shengming Yin, Xiaoyue Chen, Xiao Xu, Yilei Chen, Yuxiang Chen, Yan Shu, Yixian Xu, Yanran Zhang, Zihao Liu, Zhendong Wang, Zekai Zhang, Deqing Li, Liang Peng, Yi Wang, Jingren Zhou, Chenfei Wu

2026-06-03视觉感知

该文针对扩散/流式视觉生成推理步数高、难以交互部署的问题,指出少步蒸馏不能只依赖目标函数设计,而要系统组织训练配方。作者以 Qwen-Image-2.0 为例分析数据组成、教师引导和文生图/编辑任务混合,发现多样数据未必更好,单类一致数据可跨域迁移,并提出逐步多教师引导。最终 Qwen-Image-Flash 在仅 4 次 NFE 下统一支持文生图与指令编辑,保持较强质量。

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models Figure 1
2026-06-03cs.CV

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

2026-06-03视觉语言视觉感知

本文针对 CLIP 等视觉语言模型测试时防御常牺牲干净精度的问题,指出既有方法过度关注弱噪声下的“伪稳定”:噪声增强后,对抗样本反而比干净样本产生更大特征漂移。基于此,作者提出无需训练的高噪声漂移门控,只在检测到对抗式不稳定时触发 TTC、AOM 等防御。13 个数据集上,该门控提升干净—鲁棒折中,细粒度数据平均指标如 TTC 从 65.7% 升至 71.4%,AOM 从 68.4% 升至 73.2%。

Text-to-Image Models Need Less from Text Encoders Than You Think Figure 1
2026-06-03cs.CV

Text-to-Image Models Need Less from Text Encoders Than You Think

Nurit Spingarn, Noa Cohen, Tamar Rott Shaham, Tomer Michaeli

Technion – Israel Institute of Technology

2026-06-03视觉感知

本文质疑文生图模型是否真的依赖大型文本编码器中的复杂上下文信息。作者构造可直接替换原嵌入的无上下文表示 BoT、BoW 与带位置词袋 BoPTW,隔离词义、词合并和词序作用。在 SD3、FLUX.1/2 上,BoPTW 在计数、空间关系、属性绑定等任务中与完整嵌入视觉质量和文本一致性相近,说明许多语言结构可能由图像生成器内部解析,而非文本编码器提供。

Investigating Adversarial Robustness of Multi-modal Large Language Models Figure 1
2026-06-03cs.CV

Investigating Adversarial Robustness of Multi-modal Large Language Models

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

2026-06-03安全鲁棒

本文针对MLLM因引入CLIP等视觉编码器而暴露于图像对抗扰动的问题,系统比较鲁棒视觉骨干、端到端对抗训练与测试时防御。核心洞察是鲁棒性迁移依赖大规模多模态对抗预训练而非单纯模型规模,并提出CLIP对齐诊断来预判可迁移性;非鲁棒骨干上直接对抗训练反而伤害性能。实验中相对受限即插即用基线,图像描述提升28 CIDEr、VQA提升11.7%,鲁棒骨干上再训练还有小幅增益,并降低视觉越狱毒性输出。

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset Figure 1
2026-06-03cs.RO

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset

Jessica Wenninger, Gabriel Skantze

2026-06-03机器人视觉感知数据集/基准

面向社交机器人近距离、第一视角交互中行人遮挡、出画和非线性运动导致的身份切换问题,本文用 Furhat 采集并标注了自我中心 HRI 跟踪数据集,系统比较人脸/身体跟踪、长时记忆与 ReID 的作用。核心发现是瓶颈更多在时序关联而非检测:长记忆可缓解遮挡,ReID显著稳定身体轨迹却会因侧脸敏感恶化人脸ID切换;优化管线较基线减少49% IDSW。

Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study Figure 1
2026-06-03cs.CL

Does Language Shift Break Medical Vision-Language Models? Indonesian Radiology Visual Question Answering Case Study

Pieter Christy Yan Yudhistira, Dzaki Rafif Malik, Novanto Yudistira

Intelligent System Laboratory, Faculty of Computer Science, Brawijaya University, Malang, Indonesia

2026-06-03视觉语言视觉感知

本文关注医学视觉语言模型在非英语临床语境下是否失效:作者将 VQA-RAD 翻译为印尼语构建 IndoRad-VQA,并在固定影像、切换问题语言的设置下评估语言鲁棒性,引入双语归一化与 LRG 指标。七个开源通用、多语和医学 VLM 的实验显示,印尼语输入相较英语普遍下降约 8–25%,且医学预训练并不自动带来语言鲁棒性,常见错误包括 yes/no 翻转、术语理解和左右侧混淆。

A Fast Methane Detection Pipeline on Board Satellites Based on Mag1c-SAS and LinkNet Figure 1
2026-06-03cs.CV

A Fast Methane Detection Pipeline on Board Satellites Based on Mag1c-SAS and LinkNet

Jonáš Herec, Vít Růžička, Rado Pitoňák, Jan Sedmidubsky

2026-06-03视觉感知

面向高光谱卫星下行带宽受限、人工选区易漏检甲烷泄漏的问题,论文将传统甲烷增强产品改造成可在低功耗星载 CPU 上运行的检测流水线,提出 Mag1c-SAS 并结合轻量 LinkNet 去噪分割,同时评估波段选择与跨传感器泛化。结果显示 Mag1c-SAS 约比原 Mag1c 快 80 倍,配合 LinkNet 在 EMIT-MSeg 上 AUPRC 提升超 30 个百分点、在 STARCOP 上 F1 约高 4 个百分点,并通过硬件 profiling 证明资源占用较低。

Beyond Single Solution: Multi-Hypothesis Collaborative Deep Unfolding Network for Image Compressive Sensing Figure 1
2026-06-03cs.CV

Beyond Single Solution: Multi-Hypothesis Collaborative Deep Unfolding Network for Image Compressive Sensing

Wenxue Cui, Hualin Li, Yuhang Qin, Yifu Xu, Xiaopeng Fan, Debin Zhao

Harbin Institute of Technology, Harbin, China, Harbin Institute of Technology Suzhou Research Institute, Suzhou, China

2026-06-03视觉感知

本文针对图像压缩感知中深度展开网络通常只在单一解空间回归、难以处理病态逆问题多解性的局限,提出 MHC-DUN:在近端梯度展开框架内并行维护多假设,由 AlphaNet 预测空间可变步长,并用跨假设协同近端模块融合各候选解的内部结构与相互相关性;复合损失同时约束测量一致性、多样性和重建质量。实验显示其在 Set11、Urban100 等基准上较多种现有 CS 网络提升约 0.4–1.4 dB PSNR。

Graph Regularized Non-negative Reduced Biquaternion Matrix Factorization for Color Image Recognition Figure 1
2026-06-03cs.CV

Graph Regularized Non-negative Reduced Biquaternion Matrix Factorization for Color Image Recognition

Hailang Wu, Yonghe Liu, Bingxuan Yu, Chaoqian Li

School of Mathematics and Statistics, Yunnan University, Kunming

2026-06-03视觉感知

针对 NRBMF 虽能在约化双四元数域保持彩色像素非负性、但忽略样本局部几何结构的问题,本文将图拉普拉斯正则加入系数矩阵,促使相近图像获得相近低维表示,并给出交替投影梯度求解及收敛分析。在 CASIA-FaceV5、KDEF、Asirra 上,相比实值、四元数和 NRBMF 类方法多数设置下表现更优或相当。

A Benchmark for Semi-supervised Multi-modal Crowd Counting Figure 1
2026-06-03cs.CV

A Benchmark for Semi-supervised Multi-modal Crowd Counting

Haoliang Meng, Xiaopeng Hong, Yabin Wang, Wangmeng Zuo

Harbin Institute of Technology, Pengcheng Laboratory, standardized protocol that specifies the labeled-unlabeled data partition, across different labeled ratios. Next, to establish solid reference points, the generated pseudo-labels or predictions are often extremely noisy, leading to, standardized protocol that specifies the labeled-unlabeled data partition across, different labeled-unlabeled ratios. Next, to establish solid reference points, we, from two source modals through gated modal collaborative [14], auxiliary bro-, ing their prediction consistency to make efficient use of unlabeled data. For

2026-06-03数据集/基准

针对多模态人群计数依赖密集标注、而单模态半监督在弱光和遮挡下伪标签易失真的问题,本文首次定义半监督 RGB-T 人群计数基准,固定 5%/10%/40% 标注划分,并在 RGBT-CC、DroneRGBT 上统一评测。其核心贡献是将全监督多模态方法接入 Mean Teacher、将 RGB 半监督方法改造成门控双分支,以形成可复现实验参照;主要结果是给出现有方法在该设置下的系统性能表明该任务仍有明显改进空间,但具体最优增益来源文中未充分说明。

VidMsg: A Benchmark for Implicit Message Inference in Short Videos Figure 1
2026-06-03cs.CV

VidMsg: A Benchmark for Implicit Message Inference in Short Videos

Issar Tzachor, Michael Green, Rami Ben-Ari

2026-06-03视觉感知数据集/基准

短视频理解常停留在物体、动作或字幕层面,难以捕捉创作者隐含的劝告、态度或社会含义。VidMsg 将问题定义为“消息—视频”双向检索与诊断式多选 QA,采用先设定目标消息、再生成间接检索场景并经人工过滤显性表达的流程,构建 400 个 YouTube 短片、9 个主题和 52 类细粒度消息。实验显示现有强视频语言模型在该任务上仍不可靠;VidVec-Msg 通过文本侧适配提升检索,但仍留下明显空间。

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics Figure 1
2026-06-03cs.CV

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

Chao Wen, Jacqueline Staub, Adish Singla

University of Trier

2026-06-03视觉语言数据集/基准

该文关注教育场景中的视觉编程评测缺口:现有VLM多在生产力导向任务上验证,难以说明其能否支持K-12 Turtle Graphics 学习。作者构建TurtleAI,含823个来自XLogoOnline真实任务的图像到Python代码复现基准,并提出少量种子驱动的合成数据生成方法。实验显示20多个VLM在真实任务上普遍低于30%成功率,Qwen2-VL-72B微调后约提升20%;错误分析指出瓶颈主要在空间推理、精确复现及视觉推理到代码实现的对齐。

SkelHCC: A Hyperbolic CLIP-Driven Cache Adaptation Framework for Skeleton-based One-Shot Action Recognition Figure 1
2026-06-03cs.CV

SkelHCC: A Hyperbolic CLIP-Driven Cache Adaptation Framework for Skeleton-based One-Shot Action Recognition

Yanan Liu, Anqi Zhu, Jingmin Zhu, Jun Liu, Hossein Rahmani, Mohammed Bennamoun, Farid Boussaid, Dan Xu, Qiuhong Ke

2026-06-03视觉感知

针对单样本骨架动作识别中标注稀缺、人体运动层级结构难以与动作语义对齐的问题,SkelHCC 将骨架序列与语言嵌入共享双曲 CLIP 空间,用负曲率建模关节—部位—全身的树状关系,并引入无需训练的 LLM 引导多粒度投票缓存进行测试时适配。其在 NTU RGB+D 60/120 和 PKU-MMD II 上超过现有方法,NTU120 两种基类设置较 SOTA 提升 6.7% 和 9.0%。

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning Figure 1
2026-06-03cs.CV

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

University of Macau

2026-06-03强化学习

这篇论文关注静态视觉输入下预测未来结果时,世界模型生成的视觉 rollout 与 MLLM 抽象推理如何互补但不可盲信的问题。核心洞察是将其表述为“受控具体推理”:模型需学习何时调用仿真、如何验证并决定依赖程度;PF-OPSD 用真实未来仅作训练期特权教师信号蒸馏这些决策。实验在 VRQABench 和 OpenWorldQA 上较基线提升 10.6% 与 10.9%,并增强对噪声或冲突 rollout 的鲁棒性。

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models Figure 1
2026-06-03cs.RO

PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models

Ziyang Chen, Shaoguang Wang, Weiyu Guo, Qianyi Cai, He Zhang, Pengteng Li, Yiren Zhao, Yandong Guo

2026-06-03视觉语言视觉感知

这篇论文针对 VLA 机器人连续学习中新任务会遗忘旧技能的问题,指出传统经验回放按帧均匀采样会饿死短但关键的操作阶段,并忽略不同历史任务的干扰风险。PHASER 将缓存分配改为按子技能阶段均衡,并用语言、视觉、动作原型路由高风险历史阶段,另以 Auto-PC 自动找阶段边界。在 LIBERO 上跨三种 VLA 骨干,相比同预算 ER 最高提升 31% ASR,Goal 设置最终 ASR 达 87.8%。

UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion Figure 1
2026-06-03cs.CV

UnsOcc: 3D Semantic Occupancy Prediction in Unstructured Scene via Rendering Fusion

Ye Wu, Ruiqi Song, Baiyong Ding, Nanxin Zeng, Junjie Cheng, Yunfeng Ai

2026-06-03三维

面向露天矿等非结构化自动驾驶场景,论文指出稀疏布局、异形障碍和长尾类别会削弱传统检测与常规占用预测的融合效果。UnsOcc以图像-LiDAR多模态为基础,通过RenderFusion用深度与语义的双向渲染监督对齐跨模态特征,并用基于3D Gaussian Splatting的GSRefinement把稀疏3D占用投影到2D语义图以强化长尾监督。作者构建露天矿占用数据集,并在该数据集和nuScenes上报告优于现有方法的结果。

Diffusing in the Right Space: A Systematic Study of Latent Diffusability Figure 1
2026-06-03cs.CV

Diffusing in the Right Space: A Systematic Study of Latent Diffusability

Tianxiong Zhong, Xingye Tian, Xuebo Wang, Xin Tao, Pengfei Wan

2026-06-03视觉感知

本文针对潜扩散中“重建更好未必生成更好”的问题,系统比较不同 tokenizer 正则、架构和潜空间配置下的可扩散性指标。核心创新是提出 VIV,用 Flow Matching 中同一中间状态的速度歧义衡量潜空间难学程度。实验显示,VIV、语义可分性和空间结构与生成质量在多种扩散骨干上稳定相关,且语义与空间结构的联合指标比单一因素更能解释 gFID。

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching Figure 1
2026-06-03cs.CV

Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching

Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen

State Key Laboratory of CAD & CG, Zhejiang University, Westlake University

2026-06-03视觉感知

面向物理环境中的多模态模型,论文认为宽基线视图匹配能同时考察几何、遮挡、视角变化和细粒度感知,是空间推理的有效压力测试。作者构建 ReasonMatch-Bench,并从 RGB-D/SfM 视频3D数据自动生成可验证监督,提出带图像级视角递进和点级对应课程的 DCRL 强化学习。结果显示现有模型与人类差距明显,DCRL 将 ReasonMatch 表现提升到约70.5 F1,并迁移提升 OmniSpatial、MindCube 等空间基准。

When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics Figure 1
2026-06-03cs.CV

When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

Jiahui Wang, Kai Zhang, Mai Han, Huanghe Zhang

Shandong University, National University of Singapore (Suzhou) Research Institute

2026-06-03视觉感知

这篇论文针对 VLM 推理中视觉 token 过多导致的延迟和显存开销,指出单纯按注意力剪枝会在深层视觉编码器中塌缩到语义相近区域,损失结构多样性。作者提出免训练的 STS:先用特征空间“排斥”采样保留全局结构覆盖,再在 LLM 中用指令感知交叉注意力过滤无关 token。多模型多基准实验显示其在激进压缩下仍能较好保持任务性能并提升推理效率。

Learned Non-Maximum Suppression for 3D Object Detection Figure 1
2026-06-03cs.CV

Learned Non-Maximum Suppression for 3D Object Detection

Timo Osterburg, Stefan Schütte, Torsten Bertram

Institute of Control Theory and Systems Engineering, TU Dortmund University, Germany.

2026-06-03视觉感知三维

针对LiDAR三维检测中NMS依赖手工阈值、难以利用候选框间关系的问题,本文把后处理改为检测级可学习重打分,提出基于自注意力的D2D-Rescore和BEV局部消息传递的GossipNet3D,并用贴合nuScenes指标的匹配监督训练。实验显示二者在不改动基础检测器、计算开销较小的情况下,相比CircleNMS提升mAP、NDS和真阳性质量,尤其利好小类与低频类别。

Efficient Transformer-Based Localized Patch Sampling for Choroid Plexus Segmentation in Multiple Sclerosis Figure 1
2026-06-03cs.CV

Efficient Transformer-Based Localized Patch Sampling for Choroid Plexus Segmentation in Multiple Sclerosis

Po-Jui Lu, Alessandro Cagol, Mario Ocampo-Pineda, Federico Spagnolo, Marina Mastantuono, Andreea-Alexandra Aldea, Jannis Müller, Özgür Yaldizli, Matthias Weigel, Lester Melie-Garcia, Roberta Magliozzi, Maria Pia Sormani, Ludwig Kappos, Jens Kuhle, Cristina Granziera

. TranslaƟonal Imaging in Neurology (ThINk) Basel, Department of Biomedical, Engineering, Faculty of Medicine, University Hospital Basel and University of Basel, . Department of Neurology, University Hospital Basel, Basel, Switzerland, . Research Center for Clinical Neuroimmunology and Neuroscience Basel (RC2NB), University Hospital Basel and University of Basel, Basel, Switzerland, . Neurology SecƟon of Department of Neurological and Movement Sciences, University, . Division of Radiological Physics, Department of Radiology, University Hospital Basel, . Department of Brain Sciences, Faculty of Medicine, Imperial College London, United

2026-06-03视觉感知

针对多发性硬化中侧脑室脉络丛可作为炎症和残疾相关影像标志物、但人工分割耗时的问题,论文提出在脑室内及周边区域做32³小块局部采样,并以SwinUNETR完成单模态或多模态MRI自动分割。其关键在于用解剖先验缩小搜索空间而非处理整脑大块;在388例独立测试中,MPRAGE+FLAIR的DSC达0.868,显著优于UXNET的0.858,同时计算量从22080降至91.8 GFLOPs,参数也少得多。

\textsc{CR-Seg}: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation Figure 1
2026-06-03cs.CV

\textsc{CR-Seg}: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation

Yifan Cao, Xiaocui Yang, Faxian Wan, Shi Feng, Daling Wang, Yifei Zhang

School of Computer Science and Engineering, Northeastern University Shenyang 110819, China

2026-06-03视觉感知

CR-Seg面向复杂语言描述下的推理分割,针对现有IRS跨模态对齐困难、ERS将推理压缩为框/点而易出现推理与答案不一致的问题,提出用MLLM注意力图作为可监督的空间-语义桥梁:EAP抽取注意力图和信息点交给SAM细化,GLCoT按全局到局部排除干扰物。实验显示其在ReasonSeg和新构建的FReasonSeg上优于LISA、LENS等,并以更少对齐训练数据取得更好表现。

Attend to Anything: Foundation Model for Unified Human Attention Modeling Figure 1
2026-06-03cs.CV

Attend to Anything: Foundation Model for Unified Human Attention Modeling

Wenzhuo Zhao, Ronghao Xian, Keren Fu, Qijun Zhao

code will be available at https://github., College of Computer Science, Sichuan University, Chengdu, China 2National Key Laboratory of Fundamental Science, on Synthetic Vision, Sichuan University, Chengdu, 610065, China.

2026-06-03视觉感知

针对现有人类注意力/显著性模型按图像、视频、音视场景和数据集割裂建模、跨场景泛化差的问题,AAM将注意力重写为由语言提示驱动的从一般到具体的认知蕴含层级,并用双曲空间表示;同时用Fokker–Planck动力学把视频注意力视为静态注意力的扩散演化。基于1.75M注视数据训练后,其在16个基准上平均较SOTA提升约6%,视频推理约快4倍。

Knowledge-Preserved Model Tuning in Null-Space for Robust Spatio-Temporal Video Grounding Figure 1
2026-06-03cs.CV

Knowledge-Preserved Model Tuning in Null-Space for Robust Spatio-Temporal Video Grounding

Haoxuan Chen, Xianqin Liu, Jian-Fang Hu

School of Computer Science and Engineering, Sun Yat-sen University, China, National Information Center of GACC (Guangdong), GuangZhou, China, Guangdong Province Key Laboratory of Information Security Technology, China, Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China

2026-06-03视觉语言视觉感知安全鲁棒

针对时空视频定位在真实低质视频中因模糊、压缩等退化导致视觉语言对齐失效,且 LoRA 等统一微调会破坏高质样本预训练知识的问题,论文提出 Null-Space Tuning:冻结骨干,用质量自适应单元估计语义缺口,并基于冻结权重 SVD 将高质残差约束到零空间、低质修复导向非零空间。作者构建混合质量 STVG 基准,实验显示其较现有 PEFT 方法在低质恢复和高质知识保持上更稳健。

EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation Figure 1
2026-06-03cs.CV

EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation

Zuhao Ge, Xiaosong Jia, Chao Wu, Yuchen Zhou, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI (TEAI), Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI

2026-06-03机器人

针对零样本具身导航中传统目标场景图丢失细粒度视觉证据、3D重建代价高且记忆难以复用的问题,EvoMemNav将原始视图作为核心记忆,构建房间-视图-物体层级的VSMGraph,并用预算化粗到细策略只在候选短名单上调用VLM;同时通过子任务后的反思写回更新节点先验。文中在GOAT-Bench和HM3D的物体、文本描述、图像目标任务上提升SR/SPL,减少同类目标误停并改善零样本泛化。

Structure-Guided Mixed Masked Pretraining and Spatial Continuity Regularization for Printed Circuit Board Defect Detection Figure 1
2026-06-03cs.CV

Structure-Guided Mixed Masked Pretraining and Spatial Continuity Regularization for Printed Circuit Board Defect Detection

Peitong Wang, Nuo Wang, Enxin Qin, Chengjin Yu, Hanyu Xuan, Yuanting Yan

2026-06-03视觉感知

面向AOI中PCB缺陷小、低对比且易被密集走线背景淹没,以及细长缺陷预测碎片化的问题,论文在YOLOv8s上引入结构引导混合掩码自监督预训练与稀疏卷积重建,学习PCB结构先验,并在微调时加入空间连续性正则约束同一缺陷的分散响应。在DsPCBSD+上达到85.5% mAP@0.5、52.3% mAP@0.5:0.95,较YOLOv8s分别提升1.4和1.6点。

AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization Figure 1
2026-06-03cs.CV

AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization

Zhaorong Wang, Yoshihiro Kanamori, Yuki Endo

University of Tsukuba

2026-06-03视觉感知

针对3D虚拟试衣中2D提升易损失服装/身份细节、分层服装建模易产生穿插的问题,AvatarMix改为在3DGS中直接组合用户头部与模特着装身体,并用SeamFix修补发颈接缝、可选FullbodyFix恢复重塑后的服装外观,结合GSReshape按用户体型重定向身体。实验显示其在服装保真和身份保持上达到SOTA,但具体增益在多大程度来自各模块仍需看消融细节。

Characterizing Detectability in 3DGS Poisoning: A Stage-wise Benchmark Figure 1
2026-06-03cs.CV

Characterizing Detectability in 3DGS Poisoning: A Stage-wise Benchmark

Quoc-Anh Bui-Huynh, Thanh Duc Ngo, Xue Geng, Kaixin Xu, Wang Zhe, Xulei Yang, Ngai-Man Cheung

Temasek Laboratories, Singapore University of Technology and Design, Vietnam National University, Ho Chi Minh City, University of Information Technology, VNU-HCM

2026-06-03数据集/基准三维

针对3DGS投毒研究多关注攻击成功、缺少防守侧可检测性评估的问题,本文提出Poison-3DGS基准,将多视图图像、SfM几何、训练动态和高斯参数按流水线阶段暴露出来。核心洞察是取证信号具有阶段依赖性:攻击注入点与最易检测阶段常不一致。实验显示不同攻击的最佳检测阶段差异明显,后期训练轨迹和模型参数往往提供早期不可见的强线索,说明3DGS安全应做流水线级检测。

Low-Frequency Shortcuts in Texture-Driven Visual Learning Figure 1
2026-06-03cs.CV

Low-Frequency Shortcuts in Texture-Driven Visual Learning

Utku Şirin, Cathy Hou, David Alvarez-Melis, Stratos Idreos

Harvard University, Kempner Institute

2026-06-03视觉感知

本文针对既有捷径学习研究多集中于形状主导基准、难解释纹理型视觉任务的问题,用 DCT 频率剪枝分析病理、织物、地形等领域,发现模型虽应依赖高频细粒度纹理,却常借少数低频成分决策。剪除低频成分可使谱行为更均衡,ID 准确率最高提升 8%,低频扰动下 OOD 鲁棒性最高提升 40%,但对高频扰动存在依赖增强的权衡。

TrAction: Action Recognition with Sparse Trajectories Figure 1
2026-06-03cs.CV

TrAction: Action Recognition with Sparse Trajectories

Jan F. Meier, Felix B. Mueller, Alexander Ecker, Timo Lüddecke

Institute of Computer Science and Campus Institute Data Science, University Göttingen, Germany, Max Planck Institute for Dynamics and Self-Organization, Göttingen, Germany

2026-06-03视觉感知

针对RGB视频动作识别计算开销大且易依赖物体/背景捷径的问题,TrAction将CoTracker3稀疏点轨迹与单目深度组成2.5D运动输入,并用轨迹Transformer及遮蔽轨迹预训练学习动作动态。该方法在SSv2、EPIC-Kitchens-100上达45%/54% top-1,预训练约提升5点;与DINOv2、V-JEPA 2融合在SSv2分别再增8.7和1.6点,说明轨迹特征与外观表征互补。

PersistGS: Differentiable Physics for Object Permanence in 4D Gaussian Splatting Figure 1
2026-06-03cs.CV

PersistGS: Differentiable Physics for Object Permanence in 4D Gaussian Splatting

Adrian Ramlal, John S. Zelek

University of Waterloo

2026-06-03三维

该文针对动态3DGS中物体被所有训练相机完全遮挡后缺少光度梯度、导致高斯退化和“物体恒存”失败的问题,引入可微刚体物理作为位置先验:按物体分解高斯与碰撞网格,从遮挡前轨迹估计摩擦和速度,并用物理模拟得到的SE(3)轨迹维持遮挡期物体。其质心轮廓损失降低约40%轨迹误差;合成实验较恒速外推提升2.46 dB PSNR,距真值轨迹上界仅0.19 dB。

Mixed-Modality Dual Face-Hair Retrieval Figure 1
2026-06-03cs.CV

Mixed-Modality Dual Face-Hair Retrieval

Quoc-Anh Bui-Huynh, Mai-Tuyen Lam, Dai-Anh-Tuan Nguyen, Thanh Duc Ngo

Vietnam National University, Ho Chi Minh City, Vietnam, University of Information Technology, VNU-HCM, Ho Chi Minh City, Vietnam, controllable visual retrieval across modalities., text can specify abstract semantic attributes or styles visually unavailable. The, reasoning, identity preservation, and controllable appearance variation within a

2026-06-03视觉感知

针对现有检索难以同时约束人脸身份与发型、且发型可由图像或文本表达的问题,论文提出 DFHR 混合模态双参考任务,并构建含超 18 万标注三元组的 DFHR-Bench;方法 MFHC 通过身份/发型解耦、伪 token 注入与多视图监督统一图文发型线索。主要结果是给出首个标准化评测与基线框架,但具体性能增益幅度在给定片段中未充分说明。

From 3D Perception to Safety Reasoning: A Graph-Based Framework for Real-Time Underground Mine Monitoring Figure 1
2026-06-03cs.CV

From 3D Perception to Safety Reasoning: A Graph-Based Framework for Real-Time Underground Mine Monitoring

Pasindu Ranasinghe, Simit Raval, Dibyayan Patra, Bikram Banerjee, Ismet Canbulat

aSchool of Minerals and Energy Resources Engineering, University of New South Wales, Sydney, bSchool of Science, Engineering and Digital Technologies, University of Southern Queensland, structure, linking perception outputs across reasoning stages. To overcome the scarcity of labelled

2026-06-03三维安全鲁棒

面向井下煤矿狭窄、低照和人机混行导致的近距碰撞、盲区与结构风险,论文把彩色三维点云从感知结果进一步组织为场景/时序图,串联语义分割、不确定性异常、规则检查、本地 LLM 与 GraphRAG 记忆推理。实验中感知模型达 92.7% 准确率、30 FPS;115 个危险场景中覆盖率由规则的 57% 提升到含上下文推理的 76%、含历史记忆的 93%。

PRISM: Synergizing Vision Foundation Models via Self-organized Expert Specialization Figure 1
2026-06-03cs.CV

PRISM: Synergizing Vision Foundation Models via Self-organized Expert Specialization

Ying Tang, Dong Li, Youjia Zhang, Zikai Song, Junqing Yu, Wei Yang

2026-06-03视觉感知生成模型

多种视觉基础模型各擅长语义、结构与纹理,但直接蒸馏到单一学生模型会产生梯度冲突和负迁移。PRISM将多教师蒸馏重构为“共识—冲突”动态权衡,采用双流MoE:共享锚点保留通用表征,条件路由专家分解并重组冲突知识,并用浅层去相关促进专门化。在PASCAL-Context和NYUD-v2上取得新的SOTA,表明稀疏自组织专家可更有效整合异构视觉知识。

PHAF-Personalized Hand Avatars in a Flash Figure 1
2026-06-03cs.CV

PHAF-Personalized Hand Avatars in a Flash

Meghana Shankar, Akanxit Upadhyay, Anmol Namdev, Green Rosh KS, Pawan Prasad BH

2026-06-03视觉感知

PHAF面向AR/VR中个性化手部化身难以兼顾真实纹理、可驱动网格和快速生成的问题,只需手心/手背两张图,通过语义引导的网格对齐、稠密纹理提取与视角引导修补,将高频外观直接映射到参数化手模型,避免逐实例优化。实验显示其视觉保真度接近或优于UHM、HARP、OHTA等方法,同时纹理生成约在2分钟内完成,速度提升约30倍,更适合端侧部署。

IDO: Incongruity-aware Distribution Optimization for Multimodal Fake News Detection Figure 1
2026-06-03cs.CV

IDO: Incongruity-aware Distribution Optimization for Multimodal Fake News Detection

Hengyang Zhou, Rongman Hong, Yuxuan Zhou, Jing Wang, Zhaoyan Pan

*Equal contribution 1Nanjing University 2University of Birm-, ingham 3East China Normal University 4Zhejiang University. Cor-, with news labels. The incongruity of fake news is signif-

2026-06-03视觉语言视觉感知优化算法

针对多模态假新闻中图文并非简单“不一致”、而常表现为事实语义与模态预测层面的隐性冲突,本文提出 IDO 框架,从不协调性而非跨模态一致性入手建模。方法用通道重加权提取与真伪判别相关的语义表示,并以真假样本的高斯相似度分布刻画事实不协调,同时通过不协调对比学习捕捉跨模态语义差异。实验显示其在多个公开 MFND 基准上超过现有方法,达到新的最佳表现。

A unified multi-task framework enables interpretable chest radiograph analysis Figure 1
2026-06-03cs.CV

A unified multi-task framework enables interpretable chest radiograph analysis

Lijian Xu, Ziyu Ni, Xinglong Liu, Xiaosong Wang, Hongsheng Li, Shaoting Zhang

Shenzhen University of Advanced Technology, Centre for Perceptual and Interactive Intelligence, the Chinese University of Hong Kong, Hong Kong, Shanghai Artificial Intelligence Laboratory, Shanghai, Department of Electronic Engineering, the Chinese University of Hong Kong, Hong Kong

2026-06-03视觉感知

胸片诊断需求大但现有AI多为黑箱且割裂分类、定位、分割与报告生成,难以支撑临床信任。论文提出IMT-CXR,用统一Transformer和医学指令微调模拟放射科流程,先识别疾病、刻画位置/大小/严重度等证据,再生成可追溯报告。其在10个CXR基准上表现有竞争力,四中心160份盲评中66% AI报告被认为诊断清晰度不低于原报告。

Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams Figure 1
2026-06-03cs.CV

Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams

Abhishek Kumar, Isha Motiyani, Tilak Kasturi, Ethan Seefried, Prahitha Movva, Tirthankar Ghosal

Oak Ridge National Laboratory

2026-06-03视觉语言视觉感知数据集/基准

工程维修图纸包含密集标注、专业符号及零件表交叉引用,现有VLM基准难以衡量这类能力。Enginuity构建首个开放工程图理解数据集,含2056对图纸-零件表、494个结构化抽取样本和60个专家VQA。四个前沿VLM虽能较好找出零件(Recall@all 0.61–0.87),但描述保真度很低(Token F1 0.03–0.18),自由问答推理也仅2.6–3.2/5,显示当前模型离可靠工程应用仍有明显差距。

SAMatcher: Co-Visibility Modeling with Segment Anything for Robust Feature Matching Figure 1
2026-06-03cs.CV

SAMatcher: Co-Visibility Modeling with Segment Anything for Robust Feature Matching

Xu Pan, Qiyuan Ma, Mingyue Dong, He Chen, Wei Ji, Xianwei Zheng

page are available at https://xupan.top/Projects/samatcher., the State Key Laboratory of Information Engineering in Surveying, Mapping, and Remote Sensing (LIESMARS), Wuhan University, Wuhan, P. R. China, Wei Ji is with the National Key Laboratory of Space Target Awareness, Space Engineering University, Beijing, P. R. China., scalable and generalizable region-level representations.

2026-06-03安全鲁棒

本文针对大视角、尺度变化和遮挡下局部/patch 级匹配易产生像素混淆的问题,提出先显式预测跨视图共可见区域再做匹配的 SAMatcher。其核心是将 SAM 扩展到双视图场景,通过对称跨视图交互、共享提示查询以及联合 mask-box 监督,把共可见掩码和框作为结构化先验约束对应搜索。实验显示其在挑战性匹配基准上提升了几何与视角变化下的鲁棒性,但具体增益相对不同组件和数据规模的来源仍需看消融细节。

Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation Figure 1
2026-06-03cs.CV

Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation

Xuan Wei, Jiahui Chen, Kaiheng Li, Mingyu Shao, Qingqi Hong

Department of Digital Media Technology, School of Film, Xiamen University, Xiamen, China, National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China, Institute of Artificial Intelligence, Xiamen University, Xiamen, China, and the Giant Interactive Group Inc., driven frameworks, using the scalable motion transformation.

2026-06-03视觉感知

针对音频驱动肖像动画中关键点方法易产生形变、抖动且长时一致性不足的问题,论文提出两阶段隐式运动学习框架:先用DIT与深度分层/区域注意学习运动偏移和渲染,再用Mamba增强扩散模型由音频预测潜在运动特征。在MEAD、DiverseHeads和PATS上多数指标优于多种基线,推理也较快;但部分增益可能主要来自380小时自建数据与模型规模。

Towards Characterizing Scientific Image Utility and Upgradability Figure 1
2026-06-03cs.CV

Towards Characterizing Scientific Image Utility and Upgradability

WenZhe Li, Qihang Yan, Liang Chen, Junying Wang, Farong Wen, Yijin Guo, Chunyi Li, Zicheng Zhang, Guangtao Zhai

TongJi University, Shanghai Artificial Intelligence Laboratory, Shanghai Jiao Tong University, than plausible appearance. Even subtle defects, such as missing scale bars, mislabeled axes, or

2026-06-03视觉感知

论文针对科研图像“看起来真实但科学上错误”的问题,指出传统感知质量指标和通用多模态模型难以验证其证据有效性。作者提出 SIU2A 框架,将评价拆为错误可诊断与可修复的 Utility、以及修复后是否保持科学一致性的 Upgradability,并构建含四类受控错误和专家标注的基准。实验显示现有多模态理解与图像编辑模型在定位科学错误、生成可靠修复指令和忠实恢复方面均明显不足。

P\textsuperscript{2}-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization Figure 1
2026-06-03cs.CV

P\textsuperscript{2}-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

Ruipeng Zhang, Zhihao Li, Haozhang Yuan, C. L. Philip Chen, Tong Zhang

Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology, Pazhou Lab, Guangzhou, China, Engineering Research Center of the Ministry of Education on Health Intelligent Perception and, The code for model training and testing is available at:

2026-06-03视觉语言优化算法

本文针对 LVLM 幻觉中“已关注到关键区域却仍答错”及图像退化下鲁棒性不足的问题,指出传统 DPO 偏好对多为离线且偏文本语义,难以校正视觉处理瓶颈。P²-DPO 让模型基于增强/退化细节、干净/噪声图像自生成在线视觉偏好对,并加入动态缺陷加权与 Calibration Loss 对齐视觉证据和文本生成。实验显示其在幻觉基准、注意区域保真度和退化场景中优于若干依赖人工反馈的强基线。

SynCred-Bench: Benchmarking Synthetic Credibility in AI-Generated Visual Misinformation Figure 1
2026-06-03cs.CV

SynCred-Bench: Benchmarking Synthetic Credibility in AI-Generated Visual Misinformation

Junxiao Yang, Minghao Zhang, Xiaoce Wang, Haoran Liu, Shiyao Cui, Hongning Wang, Minlie Huang

The Conversational AI (CoAI) group, DCST, Tsinghua University

2026-06-03数据集/基准

生成模型已能伪造带有真实文字、版式和传播痕迹的截图、通知、票据等,使虚假信息获得“合成可信度”。论文提出 SynCred-Bench,将可信形式与可信流通两维系统化,构建600张中英伪造图及450张真实负样本。结果显示现有15个MLLM在5%误报率下平均TPR仅10.5%,开源检测器低于5%,人类也只有63%TPR,说明模型常把官方版式、截图噪声等表面可信线索误当真实性证据。

Beyond Semantics: Modeling Factual and Affective Perceptual Experiences from Vision-Language Data Figure 1
2026-06-03cs.CV

Beyond Semantics: Modeling Factual and Affective Perceptual Experiences from Vision-Language Data

Youssef Mohamed, Kenneth Ward Church, Mohamed Elhoseiny

genre and the pair’s emotion as proxy labels for the, emotion labels), learns effective mapping functions, severe context-length scalability issues on large

2026-06-03视觉语言视觉感知

该文针对同一图像在不同文化与情绪背景下会产生多重感知这一问题,提出超越语义标签的 P-Topics 建模,将视觉语言样本分解为客观事实与主观情感两类体验。PercepT 先用融合的 CLIP/情感嵌入做无监督 DEC 聚类并动态确定主题数,再用注意力池化把新图像映射到相关感知主题。在 ArtELingo/Affection 上,聚类分离度显著提升(SI 0.97 vs 0.37),映射 AUC 达 0.94 vs 0.77,人工评测也更偏好其主题。

Cross-Modality Feature Fusion Based on Structured State Space Duality for Multimodal Image Registration Network Figure 1
2026-06-03cs.CV

Cross-Modality Feature Fusion Based on Structured State Space Duality for Multimodal Image Registration Network

Zhikang Li, Yan Wu, Xin Hu, Yi Dai, Ming Li

Ming Li is with the National Key Laboratory of Radar Signal Processing, Xidian University, Xi’an 710071, China.

2026-06-03视觉语言视觉感知

针对多模态图像配准中模态差异、噪声和Transformer代价高导致共享结构特征难提取的问题,论文提出RegNetMamba-2,将SSD/Mamba-2引入粗到细无检测匹配,并设计跨模态交互CMI、多尺度融合MSF及特征scaling以强化边缘和结构信息。在VIS-SAR、VIS-IR、VIS-NIR数据集上,相比多种深度匹配方法取得更好的精度与效率,但具体增益可能主要来自SSD结构与scaling的共同作用。

IdEst: Assessing Self-Supervised Learning Representations via Intrinsic Dimension Figure 1
2026-06-03cs.LG

IdEst: Assessing Self-Supervised Learning Representations via Intrinsic Dimension

Julie Mordacq, Vicky Kalogeiton, Steve Oudot

sentations from unlabeled data. However, the stan-, able, label-free insights into their quality for downstream, selection without labels at a fraction of the computational, erties of deep neural networks (DNNs) in a label-free setting

2026-06-03视觉感知

本文针对自监督视觉表征评估依赖线性探测、成本高且需标签的问题,提出 IDEST:用最小生成树维度估计表征的内在维度,作为无监督几何代理。作者强调相比 TwoNN/MLE 等近邻估计,MST 在高维、样本稀疏和 SSL 依赖结构下更稳健;在 ImageNet、iNat、SUN397 等数据集和多类 SSL/视觉语言模型上,IDEST 与线性探测准确率呈显著负相关,并可用于无标签超参选择以降低计算开销。

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing Figure 1
2026-06-03cs.CV

TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing

Tim-Felix Faasch, Jochen Kall, Lucas Nunes, Jens Behley, Cyrill Stachniss

University of Bonn, Bonn, Germany, narios. Current approaches provide limited support for controllable edit-, for structured, controllable editing. We argue that a semantic scene represen-, powerful interface for controllable scene manipulation., Controllable semantic abstraction is beneficial for scene editing since it al-, or autoencoding [31] address memory, but do not directly allow for controllable, ture, TASE enable controllable semantic abstraction: retaining more channels

2026-06-03三维

面向机器人、自动驾驶和仿真中对可控三维场景编辑的需求,TASE针对现有3DGS语义特征维度高、跨视角不一致且难以控制抽象层级的问题,将预训练2D特征投影为按通道截断可调的语义嵌入,并用尺度/平移等变损失去除位置偏置,配合ControlNet和扩散模型微调支持文本编辑。实验显示其在大几何变化编辑上明显优于既有方法,同时可用于3D语义分割。

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series Figure 1
2026-06-03cs.CL

SagaQA: A Multi-hop Reasoning Benchmark for Long-form Narrative Understanding in TV Series

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

∞ \infty IRIT, University of Toulouse, France

2026-06-03数据集/基准

现有视频推理评测多停留在短片段或相邻事件,难以衡量模型对电视剧长程叙事的理解。SagaQA构建面向20集、约20小时内容的多视频、多模态、多跳抽象问答基准,平均需连接4个跨集事件。论文还比较并行、顺序与混合规划策略,结果显示混合规划在推理计划完整性和剧集定位上更稳定优于其他方法。

BA-T: An Iterative Transformer for Two-View Bundle Adjustment Figure 1
2026-06-03cs.CV

BA-T: An Iterative Transformer for Two-View Bundle Adjustment

Ganlin Zhang, Weirong Chen, Daniel Cremers, Xi Wang

2026-06-03视觉感知

论文针对前馈式两视图重建依赖深层跨视图注意力、缺少类似 BA 的自校正机制而一致性不足的问题,提出 BA-T:将位姿与局部几何的迭代信息传播做成可复用 Transformer 层,在隐式 token 空间按残差逐步细化,而非外接显式求解器。实验显示其随 3–4 次迭代提升位姿和几何精度,在仅约 38M、约为 DUSt3R 解码器 16% 参数下,达到或超过更大模型并优于同规模 ViSTA 变体。

VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch Figure 1
2026-06-03cs.CV

VistaHop: Benchmarking Multi-hop Visual Reasoning for Visual DeepSearch

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

East China Normal University, Shanghai Innovation Institute

2026-06-03数据集/基准

现有多模态视觉问答基准多停留在一次性看图或浅层推理,难以检验模型是否会反复定位证据并串联多区域线索。VistaHop构建300张图、25类场景和350个多跳任务,并配套VistaArena评测检索、局部查看与证据化推理。实验显示当前MLRM差距明显,最佳SenseNova-MARS-32B仅24.31% Pass@1,说明瓶颈在深层视觉搜索与证据融合。

PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training Figure 1
2026-06-03cs.CV

PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training

Zelun Zhang, Hongen Liu, Suyin Liang, Yubo Zhang, Yiqing Xiang, Jiaxuan Liu, Ting Sun, Manhui Lin, Yue Zhang, Changda Zhou, Tingquan Gao, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

PaddlePaddle Team, Baidu Inc.

2026-06-03视觉感知

该文针对PaddleOCR-VL-1.5在高性能阶段残余错误集中于边界不稳、覆盖稀疏和监督不可靠区域的问题,提出面向欠优化区域的数据挖掘与修正框架,并结合专家共识、迭代Judge-and-Refine标注以及CPT-SFT-RL渐进后训练。模型保持0.9B规模,在OmniDocBench v1.6达到96.33% SOTA,并在真实文档与表格、图表、文本定位、印章等子任务上取得稳定增益。

FreeStreamGS: Online Feed-forward 3D Gaussian Splatting from Unposed Streaming Inputs Figure 1
2026-06-03cs.CV

FreeStreamGS: Online Feed-forward 3D Gaussian Splatting from Unposed Streaming Inputs

Ruiyang Chen, Feiran Li, Chu Zhou, Zonglin Li, Zhanyu Ma, Heng Guo

Beijing University of Posts and Telecommunications, China, National Institute of Informatics, Japan, sistency, as future observations are unavailable during inference. As a result

2026-06-03三维

FreeStreamGS面向无位姿视频流的在线3D Gaussian Splatting,动机是离线前馈方法依赖未来帧,而在线几何误差会累积并造成新视角渲染伪影。论文的核心洞察是内参逐帧漂移会引发尺度抖动,刚性反投影会放大位姿—深度耦合误差,因此提出DIR-Head统一锚定内参,并用DPR-Offsets修正高斯位置。实验显示其在无需未来帧和迭代优化的情况下,渲染质量接近离线前馈3DGS,并优于或竞争于在线方法。

Do Real-World Datasets Contain Natural Experiments? An Empirical Study Using Causal Feature Selection Figure 1
2026-06-03cs.AI

Do Real-World Datasets Contain Natural Experiments? An Empirical Study Using Causal Feature Selection

Gautam Gare, John Galeotti, Michael Mozer, Deva Ramanan, Nan Rosemary Ke

Carnegie Mellon University, the effects of an intervention or event, and may be more generalizable than findings from a laboratory, classification tasks. Specifically, we treat a sub-portion of the data (based on the classification label)

2026-06-03强化学习数据集/基准

这篇论文关注真实机器学习数据集中是否隐含“自然实验”,即部分样本受到非人为干预而导致分布变化。作者用 DCDI 做因果发现,并仅保留目标变量 Markov blanket 特征来训练分类器,以性能提升作为存在自然实验的证据。合成实验先验证该判据,随后在 11 个公开数据集上发现约 3 个可被此框架解释,并带来优于非因果特征选择的下游表现。

MariData: One-Step Unpaired Image Translation for Maritime Environments Figure 1
2026-06-03cs.CV

MariData: One-Step Unpaired Image Translation for Maritime Environments

Santeri Henriksson, Mehdi Asadi, Amin Majd, Juha Kalliovaara

* AIS Lab, Turku University of Applied Sciences, Turku, Finland

2026-06-03视觉感知

面向海上自主船在雾、黄昏和夜间数据稀缺且难以采集成对样本的问题,论文将 CycleGAN-turbo 用于一 步非配对海事图像翻译,并通过零卷积跳连绕过 VAE 压缩瓶颈以保留远处船只、航标等小目标结构。基于 7000 张图像的定性与可调强度实验显示,雾天和黄昏转换能较好保持语义结构,夜间模型则因数据分布不均出现人工岸灯等语义幻觉。

MemoGen: Can Past Experience Improve Future Text-to-Image Generation? Figure 1
2026-06-03cs.CV

MemoGen: Can Past Experience Improve Future Text-to-Image Generation?

Wenshuo Chen, Kuimou Yu, Bowen Tian, Jianfei Song, Shaofeng Liang, Haozhe Jia, Kan Cheng, Haosen Li, Kaishen Yuan, Lei Wang, Jiemin Wu, Songning Lai, Yutao Yue

The Hong Kong University of Science and Technology (Guangzhou), Scholarly, Guangzhou Ziyan Technology Co., Ltd., LimX Dynamics Technology Co., Ltd., Shandong University, Griffith University, Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)

2026-06-03视觉感知

本文针对文本生成图像在隐含视觉约束、关系推理和外部知识场景中不稳定的问题,提出无需更新底层生成器的 MemoGen:在智能体层记录任务理解、检索证据、视觉反馈、成功策略与失败教训,并在后续相似任务中复用。基于 Qwen-Image,两轮演化后在 WISE 和 Mind-Bench 上超过 Nano Banana Pro、GPT-Image-1,表明经验记忆可作为测试时持续改进信号。

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting Figure 1
2026-06-03cs.CV

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

Junkun Yuan, Yutao Shen, Toru Aonishi, Hideki Nakayama, Yue Ma

Zhejiang University, The University of Tokyo, Tsinghua University

2026-06-03视觉感知

本文关注图像修复中较少被系统研究的偏好对齐问题,动机是现有方法依赖单一奖励模型时易受评估偏差影响。作者用DPO和公开奖励模型重审偏好数据构造,发现奖励模型普遍可提供训练信号,但在亮度、构图、色彩上存在偏好并会导致reward hacking;简单及校准后的奖励集成可缓解偏差,并在BrushBench、EditBench及物体移除任务上超过既有方法。

Effect of Demographic Bias on Skin Lesion Classification Figure 1
2026-06-03cs.AI

Effect of Demographic Bias on Skin Lesion Classification

Ralf Raumanns, Gerard Schouten, Veronika Cheplygina, Josien P.W. Pluim

2026-06-03视觉感知

这篇论文关注皮肤病灶分类中训练集性别、年龄分布不均带来的公平性风险。作者用线性规划构造受控人口统计偏置数据集,并比较单任务、强化多任务与对抗学习三种 ResNet 策略。结果显示,性别偏差主要随数据不平衡传播,多任务/对抗在均衡或女性占优时可缩小差距,但男性占优时效果有限;年龄偏差则持续偏向年轻组,外部验证还表明域迁移会改变性能与偏置模式。

Reinforcement Learning from Cross-domain Videos with Video Prediction Model Figure 1
2026-06-03cs.CV

Reinforcement Learning from Cross-domain Videos with Video Prediction Model

Zhao Yang, Xinrui Zu, Jacob E. Kooi, Thomas Delliaux, He Liu, Shujian Yu, Kevin Sebastian Luck, Vincent François-Lavet

2026-06-03视觉感知强化学习

论文关注跨视觉域专家视频中无奖励、无动作标签导致机器人难以模仿的问题。作者提出 XIPER:先将智能体像素观测翻译到专家域,再用视频预测模型的下一帧似然作为密集奖励,从而避开域不变判别器和对抗训练。在 DMC 颜色与形态变化任务上优于三类基线,并在仿真到真实机器人数据中显示奖励与真实任务回报相关。

Inference-Time Scaling for Joint Audio-Video Generation Figure 1
2026-06-03cs.MM

Inference-Time Scaling for Joint Audio-Video Generation

Jaemin Jung, Kyeongha Rho, Inkyu Shin, Joon Son Chung

Korea Advanced Institute of Science and Technology, available on the project page: https://jung-jaemin.github.io/ITS-AVGen-Proj., The video samples are available at the following link.

2026-06-03视觉感知

针对联合音视频生成中单纯扩大训练成本高、且文本对齐、感知质量与音画同步目标彼此牵制的问题,本文首次系统研究推理时扩展(ITS)在该任务中的作用,指出单 verifier 易产生指标投机和性能 trade-off,并提出多 verifier 组合与自适应奖励加权(ARW)来在线校准异构奖励。实验在 VGGSound 与 JavisBench-mini 上显示,该框架可同时提升语义对齐、感知质量和音画同步。

GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations Figure 1
2026-06-03cs.CV

GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations

Jonggwon Park, Seongeun Lee, Junhyun Park, Hannah Yun, Hyunwoong Kim, Sohyun Jeong, Hyewon Kang, Byungmu Yoon, Kyoyun Choi

DEEPNOID Inc., Seoul, South Korea, Department of Artificial Intelligence and Data Science, Sejong University, Seoul, South Korea, Vision-language models (VLMs) for radiology have emerged as a scalable paradigm, Vision-language models (VLMs) have emerged as a scalable paradigm for medical image analysis [57, from a long tail findings beyond fixed label set [32]. It also mitigates the inter-annotator disagreement

2026-06-03视觉语言视觉感知

放射影像报告只给全局监督,而病灶常对应少量局部区域,导致现有VLM难学细粒度对齐。GLINT用独立门控嵌入中的sigmoid稀疏门选择与文本查询相关的patch,并以冻结SSL教师做密集特征正则以保留局部表征,统一支持2D胸片和3D胸CT。实验显示其在零样本定位、分割上增益最明显,并在分类、报告生成和监督分割中优于SSL编码器与医学VLM;文中还声称首次实现无掩码监督的3D CT零样本分割。

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation Figure 1
2026-06-03cs.CV

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation

Xunyi Zhao, Sihao Lin, Gengze Zhou, Zerui Li, Shijie Li, Wei Tao, Jiajun Liu, Qi Wu

Adelaide University, Responsible AI Research Centre, Australian Institute for Machine Learning, Institute for Infocomm Research (I2R), A*STAR

2026-06-03机器人

论文针对实例目标导航中“找哪个具体物体”常因描述粗略和干扰物而需询问的问题,指出以往把澄清与路线指导等价计费会鼓励过度求助。作者将交互建模为带成本的不确定性削减,基于语料挖掘得到外观、区域、路线、确认四类问题及权重,构建 Isaac Sim 基准和加权成功率,并提出零样本 MLLM 导航器 TANDEM。实验显示其在加权成功率上优于无交互和统一成本交互,困难场景收益最大。

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation Figure 1
2026-06-03cs.CV

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

Zhejiang University, Tencent Youtu Lab, Nanjing University, University of Auckland, Fudan University, National University of Singapore

2026-06-03视觉感知

针对现有指令式视频编辑多只改视觉、缺少音画同步数据与评测的问题,JAVEdit提出面向人物视频的JAVEdit-100k,覆盖主体/背景编辑、增删人和语音编辑,并用Agent-in-the-loop流水线替代人工筛选以控制跨模态对齐;同时给出JAVEditBench和基于LTX-2.3 LoRA微调的基线。实验中其在6项指标中5项优于对比方法,音画同步相对最强串联方案提升26%,但能力可能主要受数据规模与底座模型限制。

SRENet: Spectral Re-Entry Network for Point Cloud Action Recognition Figure 1
2026-06-03cs.CV

SRENet: Spectral Re-Entry Network for Point Cloud Action Recognition

Qiuxia Wu, Jiarui Lan, Wenxiong Kang, Zhiyong Wang, Kun Hu

2026-06-03视觉感知三维

本文针对点云动作序列的无序结构、帧间错位以及 Transformer 偏低频导致细粒度动作线索易丢失的问题,提出 SRENet 从频域建模运动:用 SDeBlock 沿时空轴小波分解高低频并分别注意,用 SReBlock 二次分解以恢复融合后被削弱的时频结构,并配合频谱对比学习与由低到高频的课程训练。实验在 MSR-Action3D、NTU-RGBD 和 NTU-RGBD120 上达到 SOTA,说明频率建模对点云动作识别有效。

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation Figure 1
2026-06-03cs.CV

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA : Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

OmniDreams acts as a highly responsive, reactive environment, providing a scalable and comprehensive, Controllable Scenario Editing . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

2026-06-03生成模型强化学习

面向自动驾驶长尾场景的安全闭环评测,OmniDreams试图突破重建式神经仿真受限于采集数据、难生成新天气和动态行为的问题。它从Cosmos扩散模型经21k小时驾驶数据中训练/后训练而来,以历史帧、仿真状态和车辆动作自回归生成实时多视角传感器视频,并接入AlpaSim/Alpamayo闭环。实验展示了较好的仿真质量、长时滚动和反事实编辑能力;其后训练为WAM后在NuRec上以约1/5参数超过Alpamayo 1.5,但具体增益可能主要来自数据与模型规模。

$A^2$: Smaller Self-Supervised ViTs Localize Better than Larger Ones Figure 1
2026-06-03cs.CV

$A^2$: Smaller Self-Supervised ViTs Localize Better than Larger Ones

Sreehari Rammohan, Huy Ha, Carl Vondrick

Columbia University, Stanford University

2026-06-03视觉感知

论文针对视觉分类在背景、共现物等空间伪相关下易被误导的问题,发现自监督 ViT 存在反常 scaling:小模型注意力更能定位前景,而大模型 patch 表征更强。A² 将“看哪里”和“提取什么”解耦,用小 ViT 注意力裁剪前景、再用大模型嵌入,无需组标签或端到端训练;在 5 个分布偏移基准上提升最差组准确率,强偏移下优于注意力重训练,并可与 DFR 互补。

Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy Figure 1
2026-06-03cs.CV

Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy

Soohyun Lee, Jaeyoung Kim, Seokhyeon Park, Sihyeon Lee, Jiwon Song, Bohyoung Kim, Hyunjoo Song, Jinwook Seo

capability does not predict prompt-controllability, indicating that, are available at https://github.com/JaeyoungKim-HCIL/CVLAT., Seo are with Seoul National University. E-mail: {shlee, shpark, sihyeon, Bohyoung Kim is with Hankuk University of Foreign Studies. E-mail:

2026-06-03视觉语言

论文关注 LVLM 图表理解评测中“看懂可视化”与“调用事实记忆”被混在一起的问题,提出区分视觉正确性和事实正确性的框架,并构造反事实 CVLAT 测试视觉—事实冲突下的仲裁。对 15 个模型的实验显示,标准 VLAT 高分不一定代表忠实视觉推理,多数模型偏向图表证据,少数会被先验事实覆盖;提示词可改变偏好但强烈依赖模型且方向不对称。

KC-3DGS: Kurtosis-Constrained Gaussian Splatting for High-Fidelity View Synthesis Figure 1
2026-06-03cs.CV

KC-3DGS: Kurtosis-Constrained Gaussian Splatting for High-Fidelity View Synthesis

Vivekjyoti Banerjee, Abhay Yadav, Rama Chellappa, Aniket Roy

Johns Hopkins University, NEC Labs America

2026-06-03三维

针对3DGS在稀疏视角下仅依赖L1/SSIM等像素损失易把误差转移到不同频段、导致过平滑和漂浮物的问题,KC-3DGS在训练中加入可微的小波域自然图像统计约束,包括多尺度系数对齐、峰度集中和跨频带协方差惩罚。该正则无需改网络,可插入现有3DGS;在多数据集上提升感知质量,WRIVA-ULTRRA的DreamSim改善9.48%,12视角MipNeRF360上PSNR最高增0.5 dB,但密集视角可能过正则并增加开销。

GuidedBridge: Training-freely Improving Bridge Models with Prior Guidance Figure 1
2026-06-03cs.CV

GuidedBridge: Training-freely Improving Bridge Models with Prior Guidance

Zehua Chen, Yucheng Yang, Binjie Yuan, Kaiwen Zheng, Jun S. Liu, Jun Zhu

2026-06-03视觉感知

桥模型适合图像到图像等已有干净先验的生成任务,但现有 CFG/AG 主要面向扩散噪声到数据过程,未充分利用桥过程的先验结构。本文提出无需训练的 Prior Guidance,通过构造弱先验与原先验的去噪差异来放大先验利用,并进一步按桥模型 U 形 SNR 动态对高低频 guidance scale 做 FMPG 调制;对修复任务还级联 CFG-FMPG。实验显示该方法可在 DDBM、DBIM 等预训练桥模型和多类图像翻译任务上提升生成质量且不降低采样效率。

Learning to See via Epiretinal Implant Stimulation in silico with Model-Based Deep Reinforcement Learning Figure 1
2026-06-03cs.LG

Learning to See via Epiretinal Implant Stimulation in silico with Model-Based Deep Reinforcement Learning

Jacob Lavoie, Marwan Besrour, William Lemaire, Jean Rouat, Réjean Fontaine, Eric Plourde

Department of Electrical Engineering and Computer Engineering, Universit´e de

2026-06-03强化学习

针对视网膜假体中上视网膜刺激常产生沿神经轴突延展的各向异性光幻视、传统方法试图抑制而导致可用形状受限的问题,本文将刺激选择建模为基于笔触渲染的强化学习任务,在 rlretina 中用经心理物理验证的轴突图模型生成虚拟患者感知,并训练模型式深度RL智能体组合各向同性与各向异性光幻视。结果显示,相比朴素下采样刺激策略,该方法在不同虚拟患者设置下生成的感知图像更可辨识。

FAF-CD: Frequency-Aware Fusion for Change Detection under Imperfect Multimodal Remote Sensing Figure 1
2026-06-03cs.CV

FAF-CD: Frequency-Aware Fusion for Change Detection under Imperfect Multimodal Remote Sensing

Yufan Wang, Sokratis Makrogiannis, Chandra Kambhamettu

University of South Florida, Delaware State University

2026-06-03视觉语言视觉感知

针对灾害监测中前后时相遥感影像常跨传感器、错时相并受光照季节干扰,伪变化易被误判为结构损伤的问题,FAF-CD在DINOv3预训练ConvNeXt与VMamba解码器之间加入校正感知三分支融合,同时做可变形空间对齐、FFT全局频域差异和Haar小波边界比较,并用门控融合。实验显示其在BRIGHT异构EO-SAR上优于NeXt2Former-CD,在LEVIR-CD/WHU-CD达0.924/0.955 cF1,且较NeXt2Former-CD少约24 GFLOPs。

No Figure
2026-06-03cs.CV

Inverting the Generation Process of Denoising Diffusion Implicit Models: Empirical Evaluation and a Novel Method

Yan Zeng, Masanori Suganuma, Takayuki Okatani

Graduate School of Information Sciences, Tohoku University, RIKEN Center for AIP

2026-06-03生成模型数据集/基准

本文关注确定性 DDIM 生成过程的反演:从生成图像恢复中间潜变量,尤其初始噪声,以支撑图像编辑和理解扩散模型。核心做法是在首个反演步用梯度下降直接求逆,后续步采用固定点迭代,并提出同一图像真/估计噪声间插值的 self-interpolation 测试。三数据集结果显示,既有方法虽可重建图像但常估不准初始噪声,而该混合方法在潜变量预测、重建和插值质量上均更好。

Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation Figure 1
2026-06-03cs.CV

Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation

Dongsheng Wang, Dawei Su, Hui Huang

2026-06-03三维

针对3D问答中将点云采样为多视图再交给2D VLM时,输入预算有限且视图/patch冗余会丢失关键空间证据的问题,论文提出KeyVT:先结合图像语义与相机位姿选择空间一致、任务相关的关键视图,再用最优传输在特征分布中压缩代表性token。实验称其在三个常用3D-QA基准上显著优于免训练方法,并接近部分需训练模型。

Hierarchical Federated Learning with Dynamic Clustering and Adaptive Regularization for Robust Infrastructure Inspection Figure 1
2026-06-03cs.CV

Hierarchical Federated Learning with Dynamic Clustering and Adaptive Regularization for Robust Infrastructure Inspection

Yuhu Feng, Keisuke Maeda, Takahiro Ogawa, Miki Haseyama

• Dynamic adaptive regularization mitigates client drift from imbalanced labels.

2026-06-03安全鲁棒

面向桥梁、隧道等基础设施巡检中数据因隐私难以集中、且跨结构类型与本地标签分布同时非 IID 的问题,论文提出 Clustered-DRAPR 分层联邦学习:用梯度动态聚类形成结构退化模式相近的专家组,并在组内按标签偏斜和梯度差异自适应近端正则以抑制客户端漂移。真实大规模道路巡检数据实验显示,其较 FedAvg、FedProx 等基线收敛更快、分类更稳健,尤其在极端异质场景下表现更好。

TGV-KV: Text-Grounded KV Eviction for Vision-Language Models Figure 1
2026-06-03cs.CV

TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

Jizhihui Liu, Ruizi Han, Miao Zhang, Rui Shao, Xuebo Liu, Weili Guan, Yaowei Wang

2026-06-03视觉语言视觉感知

该文针对视觉语言模型推理中视觉 token 冗余导致 KV cache 显存随上下文线性增长、而直接套用 LLM 驱逐策略会因文视模态差异损伤性能的问题,提出以文本为锚的 TGV-KV:用文视注意分配层预算、用文本加权排序视觉 KV 重要性,并优先保留文本 KV。跨 LLaVA、Qwen 等模型实验显示,在仅保留 5% KV 时可大幅降显存,VizWiz-VQA 保持 99.2% 全 KV 精度,端到端吞吐提升 52.6%。

ROBUST-WT: Robust Uncertainty-aware Segmentation Transform via Whitening and Training Enhancements Figure 1
2026-06-03cs.CV

ROBUST-WT: Robust Uncertainty-aware Segmentation Transform via Whitening and Training Enhancements

Aqsa Naseer, Maryam Bibi, Syeda Samiya Urooj, Muhammad Khurram Shahzad

aSchool of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), Islamabad, Pakistan, source code and implementation details for the proposed improvements and baseline replication are publicly available, susceptible to inaccurate edge labels.

2026-06-03视觉感知安全鲁棒

本文针对跨设备、跨协议医学图像分割中的域偏移问题,认为原 WT-PSE 的训练流程在增强、损失和训练稳定性上限制了鲁棒性。作者不改动 whitening 与形状蒸馏架构,而加入域自适应增强、BCE+Dice 混合损失、Dice 权重课程调度及消融开关。眼底视盘分割实验中 OD Dice 从基线 0.939 提升到 0.956,ASD OD 为 13.31,说明增益主要来自训练层面的改进。

FCUS-rPPG: A Fast-Converging Unsupervised Framework for Remote Photoplethysmography via Gradient Oscillation Suppression Figure 1
2026-06-03cs.CV

FCUS-rPPG: A Fast-Converging Unsupervised Framework for Remote Photoplethysmography via Gradient Oscillation Suppression

Jiajie Li, Yu Liu, Rencheng Song, Xun Chen, Juan Cheng

2026-06-03优化算法

针对无监督 rPPG 依赖频域先验时梯度噪声大、收敛慢且跨域泛化差的问题,FCUS-rPPG 将 BVP 的多光谱协同与低维生理流形作为建模依据,设计光谱共享轻量骨干,并在梯度、损失地形和特征层引入后验证梯度掩蔽、扰动平滑与噪声零空间正则。五个数据集实验显示其从零训练仅需 1 个 epoch,并在跨数据集评测中达到 SOTA。

MUSE: A Unified Agentic Harness for MLLMs Figure 1
2026-06-03cs.CV

MUSE: A Unified Agentic Harness for MLLMs

Jianglin Lu, Hailing Wang, Xu Ma, Qihua Dong, Mingyuan Zhang, Yizhou Wang, Yun Fu

2026-06-03视觉感知

本文针对冻结多模态大模型在网格规划、拼图、密集字符识别等视觉任务中常因执行框架而非模型本身失误的问题,提出 MUSE:在黑盒 MLLM 外加入任务表示、视觉预处理、工具调用、结构化解析、确定性验证与迭代修复的统一 agentic harness。实验覆盖 VSP-Grid、BLINK-Jigsaw、CoMT、TIR-Bench 等任务和多种前沿模型,均较裸模型取得稳定提升,困难样例增益更明显,如 GPT-4o 在 Word Search 从 3% 提至 21%。

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry Figure 1
2026-06-03cs.RO

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja

Northwestern University, University of Chicago

2026-06-03视觉感知

针对单 IMU 惯性里程计在 AR/可穿戴人体跟踪中易因噪声积分和缺乏运动动力学约束而漂移的问题,MARIO 将头戴 IMU 推断的 SMPL 人体姿态作为运动学先验注入现有 IO 模型,并融合第二 IMU、气压计和磁力计以补充航向与高度信息。在 Nymeria、Aria Everyday 和 TLIO 等数据集上接入 TLIO、AirIO、RoNIN、EQNIO 均有改进,Nymeria 位置漂移最高降低 36%,多传感器融合进一步提升长期鲁棒性。

Towards Compact Autonomous Driving Perception with Balanced Learning and Multi-sensor Fusion Figure 1
2026-06-03cs.CV

Towards Compact Autonomous Driving Perception with Balanced Learning and Multi-sensor Fusion

Oskar Natan, Jun Miura

2026-06-03视觉感知

自动驾驶感知需在多天气、多视角下融合互补传感器,但为每个任务部署独立模型开销大,多任务训练又易失衡。本文提出紧凑多任务网络,在一次前向中融合4路RGB、DVS与LiDAR,联合输出多视角语义分割、深度、LiDAR分割和BEV,并用改造GradNorm自适应调权。实验在3个CARLA和nuScenes-lidarseg上显示其以更少参数、显存和更快推理取得相对组合基线更稳的性能。

Hand Trajectory Fusion for Egocentric Natural Language Query Grounding Figure 1
2026-06-03cs.CV

Hand Trajectory Fusion for Egocentric Natural Language Query Grounding

Enmin Zhong, Carlos R. del-Blanco, Fernando Jaureguizar, Narciso García

Grupo de Tratamiento de Im´agenes (GTI), Information Processing and Telecommunications Center

2026-06-03视觉语言规划控制

这篇论文针对第一人称 NLQ 定位中大量问题发生在手—物交互时、但现有视频语言模型忽略手部运动的缺口,引入手轨迹分支:用时空 Transformer 将稀疏手骨架编码为运动学特征,并通过交叉注意力与自适应门控融合到冻结的视频文本特征中。在 Ego4D NLQ v2 上总体小幅提升,HOI 的 R1@0.3 提升 2.54,Quantity/State 提升 4.32,说明手轨迹主要帮助操控相关查询的时间定位。

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset Figure 1
2026-06-03cs.CV

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset

Richard Schwarzkopf, Fabian Immel, Alexander Blumberg, Jonas Merkert, Nils Rack, Kaiwen Wang, Fabian Konstantinidis, Julian Truetsch, Carlos Fernandez, Annika Bätz, Kevin Rösch, Marlon Steiner, Willi Poh, Yinzhe Shen, Royden Wagner, Felix Hauser, Dominik Strutz, Jaime Villa, Gleb Stepanov, Holger Caesar, Ömer Şahin Taş, Frank Bieder, Jan-Hendrik Pauls, Christoph Stiller

FZI Research Center for Information Technology, Karlsruhe Institute of Technology, University Charles III of Madrid, Delft University of Technology

2026-06-03视觉语言数据集/基准

面向现有自动驾驶数据集在传感器精度、HD地图完整性和欧洲复杂城市覆盖上的不足,论文提出 KITScenes Multimodal:同步高分辨率全局快门相机、400m+ 激光雷达、4D雷达与冗余定位,并提供含3D交通灯/标志及拓扑关系的 Lanelet2 地图。四个基准显示,现有HD地图构建方法在完整任务上AP很低,深度模型在200m外普遍失效,暴露出现有方法的长距空间理解短板。

SCOPE: Real-Time Natural Language Camera Agent at the Edge Figure 1
2026-06-03cs.RO

SCOPE: Real-Time Natural Language Camera Agent at the Edge

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

2026-06-03视觉感知

这篇论文针对自然语言控制 PTZ 摄像机在真实部署中难评测、难闭环、受边缘算力限制的问题,提出 SCOPE:用解耦的 SLM 规划器调用 PTZ 控制与轻量 VLM 感知工具,并在 Blender 仿真和实体相机中共享动作/观测接口。作者构建 536 个任务基准,评测 19 组模型,发现更强 SLM 可降低幻觉和工具路由错误;当规划足够可靠后,感知成为瓶颈,MoE 与量化在延迟、内存和精度间更适合边缘实时部署。

BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks Figure 1
2026-06-03cs.LG

BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks

Ivan Sabolić, Marin Oršić, Josip Šarić, Sven Lončarić

gers into training inputs and label the response to a desired, learning with labeled responses (Li et al., 2023, partially labeled datasets (Kim et al., 2024

2026-06-03视觉语言视觉感知

这篇论文针对视觉语言模型指令微调易被后门样本诱导、且开放式生成中现有防御依赖特定触发模式的问题,提出 BYORn:利用预训练模型认为投毒回答与图文语义不匹配、似然较低的洞察,训练中检测可疑回答并用模型自生成响应动态替换,从而切断触发器与目标输出的关联。实验覆盖图像描述、差异识别和 VQA,平均较现有防御降低约 40 个百分点攻击成功率,同时保持干净任务性能,并在自适应攻击下仍有效。

BEAST3D: Animal behavioral analysis and neural encoding from multi-view video via Gaussian splatting Figure 1
2026-06-03q-bio.NC

BEAST3D: Animal behavioral analysis and neural encoding from multi-view video via Gaussian splatting

Yanchen Wang, Lenny Aharon, Wangshu Zhu, Kyle Daruwalla, Linghua Zhang, Jiaru Zou, Selmaan Chettih, Helen Hou, Liam Paninski, Matthew R Whiteway

Columbia University, Stanford University, ting of laboratory experiments. We address these limitations with BEAST3D, a, unlabeled, calibrated multi-view video. BEAST3D uses a vision transformer to, available in lab settings. Through comprehensive evaluation across four species, we, sis that leverages 3D structure in modern multi-view laboratory recordings. Our, growing number of laboratories address these limitations by recording with multiple synchronized, of keypoints, which is labor-intensive and must be repeated for each new experimental setup or, require a species-specific template mesh and costly per-frame optimization, limiting their scalability, specialized imagery of laboratory recordings: close-up views of animals under controlled lighting, process that can fail with limited view overlap (Fig. 6). Neither assumption holds in typical laboratory, features from calibrated multi-view animal behavior videos. Given only unlabeled, synchronized

2026-06-03视觉感知三维

针对实验室多视角动物视频中3D行为表征难以获取、监督姿态标注成本高且通用3D重建模型不适配稀疏标定相机的问题,BEAST3D用自监督ViT直接结合相机参数预测3D Gaussian splats,并通过可微渲染重建留出视角、同时分割前景动物。在小鼠、大鼠、山雀和人体数据上,模型仅用4到6视角即可获得更稳定的3D特征,并在新视角合成、多视角姿态估计和神经编码任务中优于或接近VGGT、E-RayZer、DINOv3等基线。

CAD-to-CT Registration of Cylindrical Objects via Ellipse-Based Axis Estimation Figure 1
2026-06-03cs.CV

CAD-to-CT Registration of Cylindrical Objects via Ellipse-Based Axis Estimation

Aleksander Ogonowski, Mikołaj Mrozowski, Daniel Więcek, Arkadiusz Ćwiek, Konrad Klimaszewski, Rafał Możdżonek, Adam Padee, Lech Raczyński, Piotr Wasiuk, Wojciech Wiślicki, Michał Matusiak, Sławomir Wronka

Department of Complex Systems, National Centre for Nuclear Research, ImagineRT sp. z o.o., National Centre for Nuclear Research

2026-06-03视觉感知

该文针对工业 CT 中灰度未标定、边界模糊导致 CAD 模型难以为圆柱类电离室生成可靠真值掩膜的问题,利用倾斜圆柱在切片中呈椭圆且椭圆中心随层线性移动的几何约束,先经边缘椭圆拟合、RANSAC 与 PCA 估计三维轴向,再体素化 CAD 并优化平移重叠。仿真与真实 CT/CMM 验证显示,旋转与倾角误差低于 0.1°,无需强度标定或特征匹配。

SaluNet: Enabling Total Plasticity in Normalization-Free Deep Networks Figure 1
2026-06-03cs.CV

SaluNet: Enabling Total Plasticity in Normalization-Free Deep Networks

Mourad Zaied (University of Gabes, Tuisia)

Department of electrical engineering, National Engineering School of Gabes (ENIG), University of Gabes

2026-06-03视觉感知

论文针对 BatchNorm/LayerNorm 虽稳定训练却会压制可学习激活参数适应性的现象,提出以有界可学习激活 SALU 内生完成信号稳定,并扩展 SWALU/GALU 形成无归一化的 SaluNet。其核心洞察是用“几何可塑性”替代外部统计约束。在 CIFAR、ViT 与 ImageNet 实验中,SaluNet 在无归一化甚至 batch size 1 下保持较高精度,部分设置优于标准归一化基线。

ATLAS: A Large-Scale Evaluation Benchmark for Adversarial LiDAR Perception Figure 1
2026-06-03cs.CV

ATLAS: A Large-Scale Evaluation Benchmark for Adversarial LiDAR Perception

Mellon M. Zhang, Siddhant Panse, Zimo Fan, Akshal Dhal, Rishit Sarkar, Glen Chou

Georgia Institute of Technology, have largely centered on attack hardware, geometric and algorithmic defenses, and

2026-06-03数据集/基准

针对现有自动驾驶 LiDAR 基准主要评测干净数据、缺少黑盒传感器级对抗操纵评估的问题,ATLAS 基于 Waymo 构建大规模物理约束的点注入与点移除攻击套件,覆盖真实时序场景和多类现代检测器。实验发现干净性能并不等于鲁棒性:强模型通常更能抵抗点移除,却更易受点注入诱导,脆弱性可能与常用目标数据库采样增强有关。

Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction Figure 1
2026-06-03cs.CV

Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction

Yufan Zhang, Yu Ji, Ayo Ajiboye, Rundi Wu, Yu Guo, Changxi Zheng, Jinwei Ye

George Mason University, Columbia University, George Mason University Fairfax USA, Columbia University New York USA

2026-06-03视觉感知生成模型

针对日常人像视频拍摄后难以获得理想且时序一致光照的问题,论文提出 Pixel Cube:用经辐射校准的立方 LED 舞台复现实景 HDR 环境光,采集带真实光照/反照率标注的动态数据,并结合 MetaHuman 渲染数据微调视频扩散模型,以环境图和合成背景控制重打光。实验显示其在野外视频上提升真实感、光照协调性和时间稳定性,但部分收益可能主要来自高质量数据与预训练模型。

Any2Poster: Any-Source Poster Generation Across Modalities and Domains Figure 1
2026-06-03cs.CV

Any2Poster: Any-Source Poster Generation Across Modalities and Domains

Amogh Vinaykumar, Aiden Li, Suozhi Huang, Shilong Liu

Flower Mound High School, University College London, Princeton University

2026-06-03视觉感知

现有海报生成评测多局限于论文输入和表层视觉相似,难以衡量跨来源的信息保真与表达质量。本文提出覆盖 PDF、网页、PPT、视频等 8 类输入和 5 个领域的 Any2Poster Bench,并给出含统一解析、自适应规划、HTML/CSS 渲染与 VLM 修复的 Agent。实验中其跨模态/跨领域准确率约 87%,在 PaperQuiz 设置下较 PosterAgent-4o 将总体准确率提升至 72.58%。

Depth from Dual Differential Defocus and Stereo Consensus Figure 1
2026-06-03eess.IV

Depth from Dual Differential Defocus and Stereo Consensus

Junjie Luo, Wei Xu, Dylan Chu, Emma Alexander, Qi Guo

Purdue University, West Lafayette, IN, USA, Northwestern University, Evanston, IL, USA, commercially available stereo cameras with much larger form factors., directly compare with commercially available stereo cameras. We estimate the working, a ^\top I_{\vx }(\x ) + b~\lVert I_{\vx \vx }(\x ) \rVert }{\dot {I}(\x ) + c ~\lVert I_{\vx \vx }(\x ) \rVert }, \label {eq:d3_intro}

2026-06-03视觉感知

针对传统被动三角测距在小基线/短焦距下精度和工作距离受限的问题,本文提出 D3S Consensus,将双差分离焦的闭式物理深度关系与标准双目立体约束耦合,并用两类独立线索的一致性筛掉不可靠估计。原型仅 4 mm 基线、12 mm EFL,单次拍摄生成最高 900×1800 稀疏深度图,在 0.3–1.64 m 范围达到约 1 cm MAE,较多种 DfD/双目基线更紧凑且精度更高。

Tiny Collaborative Inference for Occlusion-Robust Object Detection Figure 1
2026-06-03cs.CV

Tiny Collaborative Inference for Occlusion-Robust Object Detection

Chieh-Tung Cheng, Mustafa Aslanov, Eiman Kanjo

Tiny Collaborative Inference for Occlusion-Robust Object Detection, CHIEH-TUNG CHENG, Imperial College London, United Kingdom, MUSTAFA ASLANOV, Nottingham Trent University, United Kingdom, EIMAN KANJO, Nottingham Trent University, United Kingdom and Imperial College London, United Kingdom, collaborative inference strategies are evaluated: feature-level fusion, concatenating intermediate feature maps, and decision-level, Additional Key Words and Phrases: edge AI, tinyML, collaborative inference, object detection, occlusion robustness, Chieh-Tung Cheng, Mustafa Aslanov, and Eiman Kanjo. 2026. Tiny Collaborative Inference for Occlusion-Robust Object Detection., Authors’ Contact Information: Chieh-Tung Cheng, Imperial College London, London, United Kingdom, Mustafa Aslanov, Nottingham Trent University, Eiman Kanjo, Nottingham Trent University, Nottingham, United Kingdom and, design keeps the model small enough for constrained hardware, uses collaborative inference to recover detections that, • A collaborative inference setup that compares feature-level and decision-level fusion under controlled occlusion.

2026-06-03视觉感知安全鲁棒

面向搜救等多机器人边缘视觉场景,论文关注低于 1MB SRAM 的超低端设备在遮挡下难以可靠检测的问题。方法将 MCUNet、YOLOv2 头和 TFLite 量化结合,并比较特征级融合与基于 WBF 的决策级多视角协同推理。结果显示 WBF 在各类遮挡下优于特征融合,非对称遮挡最高提升 0.2736 mAP,三视角最高提升 0.3827 mAP;两块 Coral Micro 的自主实验中融合帧覆盖率较单板提升 29.8%。

Pathway-Structured Privileged Distillation for Deployable Computational Pathology Figure 1
2026-06-03cs.CV

Pathway-Structured Privileged Distillation for Deployable Computational Pathology

Yongxin Guo, Hao Lu, Onur Koyun, Zhengjie Zhu, Muhammet Demir, Metin Gurcan

*School of Medicine, Wake Forest University, Winston-Salem, NC, USA., elling, yet practical use is constrained by the limited availability of RNA profiling, provide a scalable record of tumour morphology, tissue architecture and microenviron-, are not consistently available in routine care because they require sufficient tissue, validated laboratory workflows, additional cost and turnaround times [6, 7]. This cre-

2026-06-03视觉感知

针对临床中RNA测序常缺失、而训练数据可含WSI-RNA配对的部署不对称,论文将问题视为H&E对分子状态的“部分可观测”而非简单缺模态。其MoPE用通路级RNA token和通路专家,通过共享记忆使用方式对齐来蒸馏分子监督,推理时仅需病理切片。TCGA多项 biomarker/生存任务及两个乳腺癌外部队列显示WSI-only性能优于MIL和蒸馏基线,并提供可审计但非因果证明的通路读出。

Principled Reflection Separation via Nonlinear Superposition and Feature Interaction Figure 1
2026-06-03cs.CV

Principled Reflection Separation via Nonlinear Superposition and Feature Interaction

Qiming Hu, Mingjia Li, Yuntong Li, Xiaojie Guo

design of principled image decomposition models. Code and models are publicly available at https://mingcv.github.io/DIRS-Page., All the authors are from College of Intelligence and Computing, Tianjin, University, Tianjin 300350, China.

2026-06-03视觉感知

该文针对单张图像反射分离中 sRGB 成像并非线性叠加、透射层与反射层相互纠缠的问题,指出传统线性混合假设与真实 ISP 非线性不匹配。方法上引入可学习非线性叠加项,并设计双流交互框架,在 CNN/Transformer 中通过激活、门控或注意力交换两层特征。实验显示其在多个真实反射分离基准上优于现有方法且泛化较强。

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging Figure 1
2026-06-03cs.CV

Automated Report-Derived Oncology VQA Benchmark for Evaluating Vision-Language Models on 3D Medical Imaging

Bo Liu, Hanxue Gu, Xiangru Li, Zheren Zhu, Jacob Ellison, Kang Wang, Janine M. Lupo, Yang Yang, Hui Lin

Department of Radiology, UCSF, Department of Radiation Oncology, UCSF

2026-06-03视觉语言视觉感知数据集/基准三维

针对医学VQA基准规模小、人工标注重且易被预训练数据污染的问题,本文提出从私有放射报告与3D肿瘤影像自动生成多选题的双路径流程,结合RADS式结构化问题和报告派生问题。四个院内队列上零样本评测六个VLM显示无模型接近饱和,最佳约0.70;盲测还揭示视觉依赖强烈受数据集影响,肺CT甚至可主要靠语言先验作答。

Cosmos 3: Omnimodal World Models for Physical AI Figure 1
2026-06-03cs.CV

Cosmos 3: Omnimodal World Models for Physical AI

Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang

omnimodal world models as scalable, general-purpose backbones for embodied agents. Our post-trained, synthetic datasets, and evaluation benchmark available under the Linux Foundation’s OpenMDW-1.1, website is available at research.nvidia.com/labs/cosmos-lab/cosmos3 .

2026-06-03强化学习

论文针对物理 AI 训练依赖真实世界而成本高、风险大,以及感知、世界模拟、动作策略模型割裂的问题,提出 Cosmos 3:用统一的 Mixture-of-Transformers 处理并生成语言、图像、视频、音频和动作序列,将 VLM、视频生成、世界模型和策略模型收敛到同一骨干。实验显示其在多类理解与生成任务达到 SOTA,后训练模型在开源文生图、图生视频和 RoboArena 策略评测中领先,并开放代码、权重、合成数据与基准。

Diagnosis of Human Object Interaction Detectors for Real World Educational Applications Figure 1
2026-06-03cs.CV

Diagnosis of Human Object Interaction Detectors for Real World Educational Applications

Divya Mereddy, Ashwin Tudur Sadashiva, Marcos Quinones-Grueiro, Gautam Biswas

Vanderbilt University, itors, labeling equipment engagement as “valid-interaction”, operational intent—is explicitly labeled as no-interaction.

2026-06-03强化学习

论文关注HOI检测器在真实教育/医疗训练场景中因遮挡、低照度、域特定设备和“近接触但无交互”而失效的问题。作者将三元组级错误分类与错误因素归因结合,用诊断结果指导数据增强、框标注/伪标注和人工纠错式微调;在CCATT数据上,预训练CDN的macro-F1由48.6提升到90.2,但具体各 refinement 的独立增益来源仍未充分说明。

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving Figure 1
2026-06-03cs.CV

GeoDrive-Bench: Benchmarking Region-Specific Multimodal Reasoning in Autonomous Driving

Yingzi Ma, Chaowei Xiao, Ming Jiang

University of Wisconsin-Madison, Johns Hopkins University

2026-06-03视觉语言数据集/基准

现有自动驾驶 VLM 评测多默认交通规则通用,难以暴露跨国家部署中的本地规则与驾驶文化差异。GeoDrive-Bench 构建覆盖中、日、新、英、印、美的 5,053 条人工验证多选 QA,要求模型在无国家标签下结合视觉线索与区域规则完成感知、预测、规划和区域推理,并提出 DriveOPD 将规则知识蒸馏进模型。九个 VLM 实验显示各国性能差异显著,主要瓶颈来自文化规则缺口;DriveOPD 可降低跨国方差并提升区域感知推理。

From Local Training to Large-Scale Mapping: A Comparative Assessment of Machine Learning and Deep Learning for Transferable Satellite-Derived Bathymetry Figure 1
2026-06-03cs.CV

From Local Training to Large-Scale Mapping: A Comparative Assessment of Machine Learning and Deep Learning for Transferable Satellite-Derived Bathymetry

Hsiao-Jou Hsu, Joachim Moortgat

School of Earth Sciences, The Ohio State University, Mendenhall Laboratory, 125 South Oval Mall, Columbus, OH 43210, USA, water depths, yet its scalability and cross-regional generalizability remain challenging in optically, Finally, we release optimized network architectures and pretrained weights to facilitate scalable, pretrained weights released openly to enable scalable, transferable mapping of shallow coastal, about 7% of the seafloor, they demand roughly 64% of total survey effort [2], motivating scalable

2026-06-03视觉感知

面向浅水测深中现场测量昂贵、传统卫星反演跨区域泛化差的问题,本文用 Sentinel-2 多光谱数据系统比较随机森林与 ResNet、EfficientNet、ConvNeXt 等深度模型。核心洞察是训练样本保持空间连续性比随机切块更关键,并结合浅水加权 SWF 损失与多时相中位聚合提升稳定性。结果显示随机森林跨区 RMSE 升至 2.99–3.78 m,而深度模型约 2.46–2.98 m,浅水段最低可到 0.26 m,但文中也承认浑浊近岸与全球可迁移性仍未充分说明。

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data Figure 1
2026-06-03cs.CV

MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data

Teng Hu, Mingchun Lu, Yating Wang, Jiangning Zhang, Jinkun Hao, Ye Pan, Ran Yi, Lizhuang Ma, Dacheng Tao

Shanghai Jiao Tong University, Zhejiang University, Nanyang Technological University

2026-06-03视觉感知强化学习

该文针对现有视频世界模型难以从单视角扩展到开放域多智能体场景的问题,提出 MetaWorld:用 MWSU 将单目视频分解为拍摄者自运动与被摄主体轨迹,构造共享 3D 空间中的多智能体监督,并以身份条件生成器和跨分支注意力对齐双视角去噪过程。实验显示其在跨视角一致性、物理同步和身份保持上优于基线,但具体增益可能部分来自数据与模型 scaling。

Plan2Map: A Multimodal Benchmark for Document-Grounded Geospatial Boundary Reconstruction from Planning Records Figure 1
2026-06-03cs.CV

Plan2Map: A Multimodal Benchmark for Document-Grounded Geospatial Boundary Reconstruction from Planning Records

Fabian Degen, Oishi Deb, Jindong Gu, Junchi Yu, Samuele Marro, Philip Torr, Jialin Yu

University of Oxford 2Google DeepMind, ules, map plates, map labels, and boundary, answers, tables, or labels, Plan2Map requires a

2026-06-03视觉语言规划控制学习理论数据集/基准三维

这篇论文面向规划档案数字化中的实际痛点:许多英国 Article 4 规划记录只有法律文本和扫描地图,缺少可机器读取的边界。作者提出 Plan2Map,收集208个PDF—GeoJSON案例,并给出工具增强的 GeoPlanAgent,将证据抽取、定位、地图配准、边界分割和投影拆解处理。结果显示其平均 IoU 约0.74、中位 IoU 约0.91,显著优于直接 VLM 生成 GeoJSON;误差主要来自定位和配准。

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models Figure 1
2026-06-03cs.CV

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

S Divakar Bhat, Toshihiko Yamasaki

The University of Tokyo, Japan, are highly consistent but inaccurate. [Centre] Same-pair traces show predictions that remain fixed across views despite changing evidence.

2026-06-03视觉语言视觉感知

论文质疑“跨视角一致=几何理解”的常见假设:在机器人/自动驾驶所需的米制距离估计中,VLM 可能稳定但错误。作者提出 ViewDiag,多数据集、多视角跟踪同一物体对,并结合误差、输出集中度和隐状态探针诊断证据敏感性。结果显示多种通用/空间 VLM 落入高一致低准确的塌缩区,ZoeDepth 等几何基线误差更低且更随视角证据变化。

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes Figure 1
2026-06-03cs.CV

AVTrack: Audio-Visual Tracking in Human-centric Complex Scenes

Yaoting Wang, Yun Zhou, Zipei Zhang, Henghui Ding

Institute of Big Data, College of Computer Science and Artifi-, cial Intelligence, Fudan University, Shanghai, China. Correspon-, laboratory settings, with few speakers and largely static, labels in in-the-wild scenarios, but are dominated by short, scenarios beyond laboratory conditions.

2026-06-03视觉感知

现有音视频说话人跟踪/分割基准多为静态、短片段或粗标注,难以检验复杂人本场景中的跨模态时空推理。AVTrack提出面向音视频实例分割的动态基准,含871段视频和3120条密集实例轨迹,覆盖遮挡、相机运动、多实例、位置/尺度变化等8类挑战。对现有VIS与AVIS方法的评测显示性能明显下降,并给出一个简单可扩展基线,说明该数据集更能暴露鲁棒人本音视频理解的瓶颈。

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models Figure 1
2026-06-03eess.AS

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

2026-06-03视觉感知数据集/基准

现有音视频幻觉评测多把狗叫、警笛等环境声当作事件提示,难以检验语音内容与画面的真实对齐。SVHalluc提出首个面向语音-视觉幻觉的综合基准,从语义对应与时间关系两方面设计6个由粗到细的诊断任务。实验显示,多种开源音视频LLM在多项任务上接近随机,虽单模态感知尚可但跨模态整合不足;Gemini 2.5 Pro明显更强,凸显开源与商业模型差距。

Sparse-View Lung Nodule Volumetry from Digitally Reconstructed Radiographs via AReT: Anatomy-Regularized TensoRF Figure 1
2026-06-03eess.IV

Sparse-View Lung Nodule Volumetry from Digitally Reconstructed Radiographs via AReT: Anatomy-Regularized TensoRF

Spoorthi M, Suja Palaniswamy

2026-06-03视觉感知

本文针对肺结节体积评估依赖高剂量密集 CT 的问题,探索仅用冠状、矢状、轴向三张 DRR 重建 3D 结节。核心洞察是 TensoRF 默认 density shift 会在 X 射线衰减场中抑制梯度,改为 0 后结合胸腔空气占优先验的 L1+TV 正则形成 AReT。19 例 LIDC-IDRI 上,对 ≥10mm 结节体积相关 r=0.983、中位误差 11.4%,但评估基于模拟 DRR 且样本较小,临床泛化仍需验证。

Wavelet as Tokenizer: Preliminary Results on a Shared Wavelet Token Schema for Natural Signals Figure 1
2026-06-03eess.AS

Wavelet as Tokenizer: Preliminary Results on a Shared Wavelet Token Schema for Natural Signals

Shenghao Ding

2026-06-03视觉感知

论文关注自然信号 tokenizer 过度依赖模态专用网格的问题,提出用一层 Haar 小波把音频、图像、视频统一成带有尺度、子带、位置等元信息的连续系数 token,并由共享 trunk 重建。实验在 Speech Commands、EuroSAT、DAVIS 上验证小规模自编码可行,密集模型分别达 39.92/29.37/23.93 dB PSNR;能量选 token 显著优于均匀选择,50% video token 仍达 34.45 dB。但尚未证明离散通用词表,元信息增益也并非稳定。

COD10K-C: Benchmarking Robustness of Camouflaged Object Detection Under Natural Image Corruptions Figure 1
2026-06-03cs.CV

COD10K-C: Benchmarking Robustness of Camouflaged Object Detection Under Natural Image Corruptions

Arafat Hossain Sayem

2026-06-03视觉感知数据集/基准安全鲁棒

本文针对伪装目标检测只在干净图像上评测、难反映真实相机模糊噪声和天气退化的问题,构建 COD10K-C:在 COD10K 测试集上加入 8 类扰动、5 个强度共 81,040 对样本,并评测多种 COD 模型。核心洞察是几何退化尤其运动/高斯模糊远比亮度、雾等光度退化更伤害模型;轻量 RobustCODLite 结合扰动增强、高频先验和不确定性一致性,在腐蚀下保留 92.3% 干净 Dice,且在最难扰动上可超过更大的模型。

Graph Mamba Survival Analysis Based on Topology-Aware ordering Figure 1
2026-06-03cs.LG

Graph Mamba Survival Analysis Based on Topology-Aware ordering

Yuanfang Chen, Peiqiang Yan, Yuntao Shou, Qian Zhao, Xiangyong Cao

aSchool of Mathematics and Statistics, Xi’an Jiaotong University, West China Science and Technology Innovation Harbor, Xi’an, bSchool of Computer Science and Technology, Xi’an Jiaotong University, West China Science and Technology Innovation Harbor, the instances sharing the same label of this WSI, and uses

2026-06-03视觉感知

针对WSI生存分析中GNN难建模全局依赖、Transformer代价高且Graph Mamba对节点顺序敏感的问题,本文提出TopoMamSurv:用基于最短路径的拓扑感知排序生成更符合图连通性的扫描序列,并结合双向Mamba与GCN形成“局部聚合—全局捕获”的层次特征学习。实验在五个TCGA数据集上显示相对现有方法有综合优势,且可视化支持TAO得到的节点更相似。

PaintBench: Deterministic Evaluation of Precise Visual Editing Figure 1
2026-06-03cs.GR

PaintBench: Deterministic Evaluation of Precise Visual Editing

Kai Xu, Ellis Brown, Shrikar Madhu, Rob Fergus, He He, Saining Xie

New York University

2026-06-03数据集/基准

针对现有图像编辑评测依赖人工或模型裁判、难以衡量“唯一正确答案”的精确编辑,PaintBench 用程序化生成构造20类基础操作,并以像素级确定性指标评估编辑区与保留区。实验覆盖11个编辑模型,最佳仅17.1% mIoU,几何变换、结构操作和公式化改色尤其困难;场景复杂度、小编辑区域等会显著降分,且与数据可视化编辑基准 TinyGrafixBench 分数高度相关。

2026-06-02

363 篇
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models Figure 1
2026-06-02cs.CV

Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models

Guangzhao He, Rundong Luo, Wei-Chiu Ma, Hadar Averbuch-Elor

Cornell University, Cornell University USA

2026-06-02视觉语言视觉感知

本文关注单张图像到可编辑 3D 场景的逆图形问题,动机是避免 NeRF/3DGS 等隐式表示难以编辑,以及端到端让 VLM 同时推断几何、材质、布局和光照过于困难。作者提出 SEIG,将重建拆成初始化、几何、材质、组合与光照等可执行 Blender 代码阶段,并用生成器—验证器循环逐步渲染比较和修正。实验在合成与真实场景上显示,分阶段策略相较整体式 VLM 重建显著提升像素、感知和语义一致性,并支持重打光、编辑和物理仿真。

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling Figure 1
2026-06-02cs.CV

Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling

Seojeong Park, Jiho Choi, Junyong Kang, Seonho Lee, Jaeyo Shin, Hyunjung Shim

2026-06-02视觉语言强化学习

针对多模态 LLM 评审在图文冲突时偏向“说得通”的文本而忽视视觉证据的问题,论文将其定义为感知判断偏差,并区分感知能力不足与响应锚定两类失败。作者构造含最小反事实视觉扰动的 PPJD 数据集,用可验证批排序奖励结合 GRPO 训练 Perception-Judge。实验显示其在多种 MLLM-as-a-Judge 基准上提升感知一致性与排序连贯性,批级指标最高提升 11%,单分数预测准确率提升 15%。

RoboDream: Compositional World Models for Scalable Robot Data Synthesis Figure 1
2026-06-02cs.RO

RoboDream: Compositional World Models for Scalable Robot Data Synthesis

Junjie Ye, Rong Xue, Basile Van Hoorick, Runhao Li, Harshitha Rajaprakash, Pavel Tokmakov, Muhammad Zubair Irshad, Vitor Guizilini, Yue Wang

1 USC Physical Superintelligence (PSI) Lab, 2 Toyota Research Institute

2026-06-02机器人强化学习

RoboDream针对机器人模仿学习中真实遥操作数据昂贵且难以覆盖多物体、多场景的问题,提出以“机器人运动、物体、场景可组合”为核心的具身视频世界模型:用渲染的机器人轨迹固定运动学,再显式注入物体与场景先验生成示教视频,从而支持轨迹“重生”和无道具遥操作。实验显示,合成数据可在多种真实操作任务中提升下游策略表现并减少真实数据需求,但部分增益可能主要来自更大规模数据合成。

ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning Figure 1
2026-06-02cs.CV

ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning

Yu-Cheng Shi, Zhen-Hao Xie, Jun-Tao Tang, Da-Wei Zhou

School of Artificial Intelligence, Nanjing University, China, State Key Laboratory of Novel Software Technology, Nanjing University, China

2026-06-02视觉语言

这篇论文关注多模态大模型在连续指令调优中因任务陆续到来而遗忘、尤其是输出格式被新任务破坏的问题。作者指出仅按图文语义相似度路由 LoRA 专家会把语义相近但答案协议不同的任务混在一起,并提出 ProtoAda:用视觉、语言及回答长度、熵等格式统计构建任务原型,自适应扩展/分组适配器,再用几何感知方式合并兼容更新。实验称其在多个 MCIT 基准上优于现有方法,对易受格式干扰的任务提升更明显。

From Zero to Hero: Training-Free Custom Concept Spawning in World Models Figure 1
2026-06-02cs.CV

From Zero to Hero: Training-Free Custom Concept Spawning in World Models

Kiymet Akdemir, Pinar Yanardag

2026-06-02强化学习

该文针对交互式世界模型在视野外只能按模型先验补全、难以按用户意图放置特定物体或场景元素的问题,提出训练自由的 SPAWN。核心洞察是图像到视频自回归模型的首个上下文记忆槽长期锚定参考帧,可短时替换为概念潜变量并再恢复,使概念经模型记忆自然传播。WorldPlay 上 200 条 rollout 显示其可用图像或文本注入角色、道具、建筑等,并保持光照、尺度、透视、身份与时序一致性。

HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image Figure 1
2026-06-02cs.CV

HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image

Hezhen Hu, Wangbo Zhao, Lanqing Guo, Hanwen Jiang, Jonathan C. Liu, Zhiwen Fan, Kai Wang, Zhangyang Wang, Georgios Pavlakos

University of Texas at Austin, National University of Singapore, Texas A&M University

2026-06-02视觉感知三维

单图真人三维重建常因遮挡视角歧义和高质量人体数据稀缺而依赖逐实例优化或扩散补全,速度与泛化受限。HumanNOVA的主要洞察是可能主要来自scaling / data:用绑定资产动画化与多相机真人拟合扩展到10万训练资产,并在前馈LRM中引入SMPL粗人体先验,经token交叉注意力生成triplane头像。实验称在三项基准上实现亚秒推理,LPIPS相对提升超40%、F-Score相对提升超90%。

VISReg: Variance-Invariance-Sketching Regularization for JEPA training Figure 1
2026-06-02cs.CV

VISReg: Variance-Invariance-Sketching Regularization for JEPA training

Haiyu Wu, Randall Balestriero, Morgan Levine

2026-06-02视觉感知

这篇论文针对 JEPA/自监督视觉表征训练中“防塌缩”依赖启发式或仅用协方差约束不足的问题,提出 VISReg:保留 VICReg 的方差与不变性项,用基于 Sliced-Wasserstein 的 sketching 约束替代协方差,以分离尺度和分布形状并在塌缩时保持梯度。实验显示其在低质量、长尾、低秩数据上更稳定,ImageNet-1K 预训练后 OOD 表现领先,ImageNet-22K 上可接近使用更多数据的 DINOv2。

AdaCodec: A Predictive Visual Code for Video MLLMs Figure 1
2026-06-02cs.CV

AdaCodec: A Predictive Visual Code for Video MLLMs

Haowen Hou, Zhen Huang, Zheming Liang, Qingyi Si, Chenglin Li, Shuai Dong, Kele Shao, Ruilin Li, Dianyi Wang, Nan Duan, Jiaqi Wang

Shanghai Jiao Tong University, Shanghai Innovation Institute

2026-06-02视觉感知

视频 MLLM 将每帧当独立图像编码,导致相邻帧内容重复、长视频 token 与延迟快速上升。AdaCodec 将输入接口改为面向 MLLM 的预测视觉码:仅在预测代价高时放置完整 I 帧,其余帧用运动与残差 P-token 表示,并用两阶段对齐接入现有模型。实验显示其在 11 个基准上优于 Qwen3-VL-8B 逐帧 RGB 基线,32k token 仍超过 224k 长视频基线,通用视频 TTFT 从 9.26s 降至 1.62s。

Policy-based Foveated Imaging and Perception Figure 1
2026-06-02cs.CV

Policy-based Foveated Imaging and Perception

Howard Xiao, Jan Ackermann, Boyang Deng, Gordon Wetzstein

Stanford University, Stanford University USA

2026-06-02强化学习

超高分辨率传感器虽能保留跟踪、文字识别和机器人操作所需细节,但全帧读出/处理受带宽、延迟和功耗限制。论文将成像时的“看哪里”建模为基于历史观测的传感器注意力策略,在低清全局上下文上动态选择全清 ROI,闭合采集—感知循环。仿真中在相同像素预算下优于空间/时间降采样,并在 200MP 双流传感器上验证了实时可行性。

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization Figure 1
2026-06-02cs.CV

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

City University of Hong Kong

2026-06-02视觉语言视觉感知优化算法

该文针对视频生成模型在“用视频推理”中画面连贯但难遵守任务规则的问题,提出把VLM从文本规划器改为测试时教师:自动提取过程约束与目标条件,构造成可微奖励,并在线优化轻量LoRA来引导VGM生成推理轨迹。在VBVR-Bench与RULER-Bench上平均提升16.7分,显著高于VLM-as-Solver和Best-of-N,说明收益主要来自反馈优化而非单纯采样扩展。

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation Figure 1
2026-06-02cs.CV

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

Qixin Hu, Shuai Yang, Wei Huang, Song Han, Yukang Chen

2026-06-02视觉感知

针对自回归视频扩散在长时生成中因滑动窗口只依赖近期上下文而导致误差累积、身份和背景漂移的问题,LongLive-RAG将已生成latent视为可检索记忆,在每个新片段生成前检索相关历史latent并作为额外注意力上下文,同时用Window Temporal Delta Loss提升检索区分性。实验在多个AR骨干和30/60/120秒长度上取得最佳平均VBench-Long排名,并改善主体一致性、背景一致性、运动平滑和成像质量。

Modeling Depth Ambiguity: A Mixture-Density Representation for Flying-Point-Free Depth Estimation Figure 1
2026-06-02cs.CV

Modeling Depth Ambiguity: A Mixture-Density Representation for Flying-Point-Free Depth Estimation

Siyuan Bian, Congrong Xu, Jun Gao

University of Michigan

2026-06-02视觉感知

这篇论文针对深度估计在物体边界产生“飞点”的问题,指出根源在于单像素单深度假设会把前景与背景的歧义平均到空空间。作者提出 MDA 混合密度表示,让每个像素预测多个深度假设及概率,并从假设中解码深度。该方法仅改预测头、开销很小,在 DA3 和 VGGT 等骨干上显著改善边界重建,模糊输入下也能减少飞点,并可扩展到透明物体多层深度和天空区域处理。

AFUN: Towards an Affordance Foundation Model for Functionality Understanding Figure 1
2026-06-02cs.RO

AFUN: Towards an Affordance Foundation Model for Functionality Understanding

Zhaoning Wang, Yi Zhong, Jiawei Fu, Henrik I. Christensen, Jun Gao

University of Michigan, University of California, San Diego

2026-06-02视觉感知

机器人可供性研究常只回答“在哪交互”,缺少可执行的“如何运动”且数据域窄。AFUN 将异构机器人、人类、仿真和扫描数据统一为语言、功能掩码与物体中心 3D 运动标注,并用 RGB-D 与任务文本联合预测交互区域和 Bézier 运动曲线。其在 8 个分割测试集上平均 gIoU/cIoU 较最强基线提升 23.9/26.3,接触点与 3D 运动评测也领先,并展示了无需微调的真实机器人部署。

LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models Figure 1
2026-06-02cs.CV

LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models

Lu Liu, Huiyu Duan, Chenxin Zhu, Jintong Lu, Haoyun Jiang, Liu Yang, Qiang Hu, Guangtao Zhai, Xiaoyun Zhang

Shanghai Jiao Tong University, Shanghai, China

2026-06-02视觉感知生成模型数据集/基准

低层视觉任务要求像素级保真,而大生成模型在修复/增强中的能力与幻觉风险缺少系统评测。本文构建 LL-Bench,覆盖16类真实退化、31类模型输出及专家偏好标注,并据此比较生成式与传统修复方法,揭示其任务边界和失败模式;同时提出基于多模态大模型的 LL-Score,用输入与结果联合判断质量和幻觉,实验显示其与人类偏好相关性优于现有 IQA 指标,并可作为生成式修复的奖励信号。

Improving Combined Detection and Classification of TEM Defects via Mask-Conditioned Latent Diffusion Augmentation Figure 1
2026-06-02cs.CV

Improving Combined Detection and Classification of TEM Defects via Mask-Conditioned Latent Diffusion Augmentation

Ni Li, Nuohao Liu, Ryan Jacobs, Ajay Annamareddy, Maciej P. Polak, Kevin Field, Izabela Szlufarska, Dane Morgan

. University of Wisconsin-Madison, Madison, WI, . University of Michigan-Ann Arbor, Ann Arbor, MI

2026-06-02视觉感知生成模型

针对辐照金属 TEM/STEM 缺陷检测中标注稀缺、人工成本高的问题,论文用从真实缺陷掩码统计中采样的多类掩码条件化潜扩散模型,生成带自动标签的图像-掩码对来增强 Mask R-CNN 训练。结果显示在 10/50/100 张小训练集上总体仅有小幅提升,检测与分类 F1 调和均值最高增益约 0.02,且检测或分类受益取决于数据划分,增益来源不完全稳定。

Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approach For Long-Tailed Recognition Figure 1
2026-06-02cs.CV

Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approach For Long-Tailed Recognition

Shuo Zhang, Chenqi Li, Tingting Zhu

University of Oxford

2026-06-02视觉感知

针对长尾识别中两阶段解耦的分类器重训依赖敏感超参数来调节类别权重范数的问题,论文从类条件分布角度支持“尾类主要是表征欠拟合”这一解释,并提出 SAMN:用 PAVA 直接约束按类别频次排序的权重范数单调变化,避免正则项调参。实验显示其可作为通用重缩放模块提升多个基准上的长尾识别精度,并多次达到或接近 SOTA。

FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes Figure 1
2026-06-02cs.CL

FigSIM: A Dataset for Fine-grained Suicide Severity and Figurative Language in Suicide Memes

Liuliu Chen, Elise R. Carrotte, Brian E. Chapman, Jo Robinson, Mike Conway

School of Computing and Information Systems, University of Melbourne, Australia, Orygen, The National Centre of Excellence in Youth Mental Health, Australia, Centre for Youth Mental Health, University of Melbourne, Australia, O’Donnell School of Public Health, UT Southwestern Medical Center, United States

2026-06-02数据集/基准

针对社交平台上自杀相关 meme 难以用文本式、二分类审核方法理解的问题,论文构建 FigSIM:含 1049 张 Reddit meme,标注细粒度自杀严重度、隐喻/反讽等修辞现象及具体自杀相关内容,并评测 16 类单模态/多模态模型。结果显示最佳多模态模型在三项任务 macro-F1 约为 70.21%、71.60%、58.51%,但高严重度尤其是修辞化表达常被低估,说明当前模型和审核策略仍缺乏情境化理解。

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events Figure 1
2026-06-02cs.CV

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

Xiaolin Liu, Yilun Zhu, Xiangyu Zhao, Xuehui Wang, Yan Li, Xin Li, Haoyu Cao, Xing Sun, Shaofeng Zhang, Xu Yang, Zhihang Zhong, Xue Yang

2026-06-02视觉感知

针对视频 MLLM 在稀疏采样、视觉 token 压缩和粗粒度聚合下容易错过短暂关键事件的问题,论文提出 Moment-Video 基准,以 1000 个跨 7 类场景的人审视频问答,专门评测事件发生、计数、动作描述和时序推理。33 个模型测试显示最佳 Seed-2.0-Pro 仅 39.6%,多数开源模型低于 25%,加密采样虽有帮助但不能解决短暂事件的时序保真瓶颈。

Drifting Preference Optimization for One-Step Generative Models Figure 1
2026-06-02cs.LG

Drifting Preference Optimization for One-Step Generative Models

Zhou Jiang, Yandong Wen, Zhen Liu

Westlake University, The Chinese University of Hong Kong, Shenzhen

2026-06-02生成模型优化算法

针对一步文本到图像模型难以用传统 RLHF/DPO 对齐(缺少似然、去噪轨迹,且奖励反传昂贵或不可用)的问题,论文提出 DrPO:用当前模型样本的奖励排序构造特征空间“偶极”偏好漂移,并结合冻结基模型的参考漂移,以脱梯度回归目标微调。实验在 SD-Turbo/SDXL-Turbo、HPSv3 与 GenEval 等设置中优于无奖励梯度基线,并在匹配有效 batch 下将 HPSv3 训练计算降至约 1/3.51,但离线扩展仍较初步。

ToolFG: Towards Well-Grounded Fine-Grained Image Classification Figure 1
2026-06-02cs.CV

ToolFG: Towards Well-Grounded Fine-Grained Image Classification

Yu Xue, Haoxuan Qu, Zhuoling Li, Yihang Lou, Yan Bai, Hossein Rahmani, Jun Liu

Lancaster University, Peking University

2026-06-02视觉感知

针对现有多模态大模型做细粒度分类时常依赖“尾巴不长”等模糊描述、缺少可验证视觉证据的问题,ToolFG将图像处理与测量工具封装为可调用API,让模型在推理中主动放大、取色、测量部件比例等;并用MCTS引导从强教师模型蒸馏工具使用轨迹,再通过模型—工具共进化优化工具集和调用策略。实验显示该框架在多种设置下提升细粒度识别效果,但具体增益与工具、蒸馏数据各自贡献需看消融细节。

Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis Figure 1
2026-06-02cs.CV

Not All Points Are Equal: Uncertainty-Aware 4D LiDAR Scene Synthesis

Xiang Xu, Alan Liang, Youquan Liu, Xian Sun, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

2026-06-02安全鲁棒

这篇论文针对现有4D LiDAR生成模型对所有空间区域平均分配建模能力的问题,指出远距、遮挡边界和小目标更不确定也更易失真。U4D用预训练分割器的香农熵估计逐点不确定性,先用无条件扩散生成高熵困难区域,再条件补全全场景,并以MoST门控融合时空特征。nuScenes和SemanticKITTI实验显示其FRD/FPD降低约6%–11%,时间一致性和下游分割表现也优于基线。

Question-Aware Evidence Ledgers for Video Relational Reasoning Figure 1
2026-06-02cs.CV

Question-Aware Evidence Ledgers for Video Relational Reasoning

Yilin Ou, Mengshi Qi, Huadong Ma

State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China

2026-06-02视觉感知

该文针对 VRR-QA 中计数、左右/前后参照系、终点状态和对话指代容易被视频问答模型误判的问题,不再训练新模型,而是在 GPT-5.5 初答后按问题类型路由到“证据账本”,显式记录目标、计数单位、时空范围和参照系,并用检测、深度、ASR 等外部证据配合保守门控决定是否改答。消融显示从 71.89% 提升到 92.95% 总准确率、93.79% 宏准确率,但结果依赖强闭源模型,增益中 scaling 成分需谨慎解读。

GloResNet: A lightweight 3D CNN with global topological features for preterm brain injury prediction Figure 1
2026-06-02cs.CV

GloResNet: A lightweight 3D CNN with global topological features for preterm brain injury prediction

Boyu Yuan, Jiamiao Lu, Weichuan Zhang, Benqing Wu, Tuo Wang, Changshan Wang, Changming Sun, Liang Guo

2026-06-02三维

针对早产儿脑损伤 MRI 判读依赖专家且小样本 3D 数据易过拟合的问题,论文提出 GloResNet:将整脑 T2 MRI 统一重采样到 128³ 并做个体 z-score,以保留全局拓扑,再用 MedicalNet 初始化的轻量 ResNet-10、mixup、类别加权和 TTA 训练。dHCP 五折交叉验证平均准确率 75.18%、最高 81.82%,敏感性 0.76、特异性 0.81;但细小白质损伤可能因降采样被平滑,增益也部分依赖预训练和正则化。

MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents Figure 1
2026-06-02cs.CV

MORPHOS: Autoregressive 4D Generation with Temporal Structured Latents

Minkyung Kwon, Jinhyeok Choi, Youngjin Shin, Jaeyeong Kim, JongMin Lee, Seungryong Kim

2026-06-02视觉感知

现有视频到4D资产方法常绑定单一表示,且依赖形变导致拓扑变化和长序列一致性不足。MORPHOS将结构化潜变量扩展为时间结构潜变量T-SLat,用两阶段自回归流先生成稀疏体素再生成统一4D表示,并以因果注意力和时序-结构增强降低误差累积。实验显示其可同时输出网格、3D Gaussian和辐射场,在外观指标达SOTA、几何结果具竞争力,长时生成更稳。

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding Figure 1
2026-06-02cs.CV

X-Stream: Exploring MLLMs as Multiplexers for Multi-Stream Understanding

Peiwen Sun, Xudong Lu, Huadai Liu, Yang Bo, Dongming Wu, Huankang Guan, Minghong Cai, Jinpeng Chen, Xintong Guo, Shuhan Li, Rui Liu, Xiangyu Yue

2026-06-02视觉感知

现实机器人多相机、自动驾驶和直播等场景需要在线跨视频流理解,而现有评测多停留在单流。X-Stream构建932段视频、4220个问答的多流流式基准,并用双重验证抑制单流捷径,还把MLLM视作受带宽约束的“复用器”,比较空分、时分、语义复用策略。实验显示当前强模型综合得分约50%,主动性和因果等跨流推理仍明显不足。

Places in the Wild: A Large, High-Resolution RAW Photograph Dataset for Ecologically Valid Vision Research Figure 1
2026-06-02cs.CV

Places in the Wild: A Large, High-Resolution RAW Photograph Dataset for Ecologically Valid Vision Research

Michelle R. Greene

Barnard College, Columbia University

2026-06-02视觉感知数据集/基准

针对常用视觉数据集多为低分辨率、网络 JPEG 且缺少真实采集条件与连续视角的问题,本文构建 Places in the Wild:在 810 个真实地点按标准协议采集 67,574 张 45MP RAW/JPEG 图像,覆盖 260 类场景,并以 5° 间隔提供近 360° 稠密视角及 EXIF、质量指标。主要结果是形成约 3 万亿像素、可用于自然场景统计、视角依赖识别和真实条件下场景理解评测的大规模开放数据集;文中未充分说明其对具体模型性能的增益。

Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation Figure 1
2026-06-02cs.CV

Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation

Minseok Joo, Dogyun Park, Taehoon Lee, Kyujin Lee, Hyunwoo J. Kim

Korea University

2026-06-02视觉感知

长视频自回归生成常因上下文有限,在相机重访场景时出现几何漂移,影响机器人仿真等世界模型应用。本文提出 CovRAG,用预训练 3D 先验的深度与位姿构建目标视角覆盖图,并按残余覆盖增益迭代检索互补历史帧,避免 FoV 检索过粗和显式重建过贵。RealEstate10K 与 DL3DV10K 上,MEt3R 几何一致性误差最高降 29%,相较 3D 记忆方法延迟最高低 5 倍。

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence Figure 1
2026-06-02cs.CV

MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence

Hilton Raj, Vishnuram AV

Boston University

2026-06-02三维

MASER针对具身3D VQA中问题语义会偏好不同传感模态、但逐一调用多模态适配器代价高的问题,提出在共享Qwen2-VL骨干上训练图像、深度、点云、位姿、文本五个DoRA专家,并用仅看问题文本的SBERT+MLP路由器选择适配器。Open3D-VQA显示不存在单一最优模态,点云占51.5%最优;路由与oracle一致率51.3%,高于随机森林43.5%,延迟最低,但整体准确率未超过图像单模态,增益主要体现为成本权衡。

Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models Figure 1
2026-06-02cs.CV

Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models

Wei Deng, Xianlin Zhang, Mengshi Qi

2026-06-02视觉语言视觉感知

针对 VLM 空间推理常被动接收全景信息、且强化学习只依赖最终答案导致奖励稀疏的问题,论文把模型设计成主动探索者:选择性检索视角,持续更新以物体位置和朝向表示的动态认知地图,并用可执行的 Spatial Assertion Codes 校验中间空间关系以提供密集奖励。经监督微调和强化微调后,在 MindCube 上达到 80.5% 准确率,尤其 Rotation 子集较最佳基线提升 29.5 个百分点。

Initialization is Half the Battle: Generating Diverse Images from a Guidance Potential Posterior Figure 1
2026-06-02cs.CV

Initialization is Half the Battle: Generating Diverse Images from a Guidance Potential Posterior

Xiang Li, Dianbo Liu, Kenji Kawaguchi

2026-06-02视觉感知

论文针对扩散/流匹配生成中随机种子虽不同却易收敛到少数模式的问题,指出标准高斯初始化忽略条件引导势能地形,高势能区域会放大轨迹收缩。作者提出 DivIn,将初始噪声改为从引导势能后验采样,并用 Langevin 动力学在保持高斯先验约束的同时避开塌缩区域。实验显示其在 ImageNet 类条件和文本到图像任务中提升多样性指标,且可与轨迹干预方法叠加拓展质量-多样性折中。

Reason-Then-Retrieve for CoVR-R with Structured Edit Prompts and Dense-Sparse Fusion Figure 1
2026-06-02cs.CV

Reason-Then-Retrieve for CoVR-R with Structured Edit Prompts and Dense-Sparse Fusion

DongQing Liu, MengShi Qi, HongWei Ji

Beijing University of Posts and Telecommunications

2026-06-02视觉感知

本文面向 CoVR-R 中“目标视频需由参考视频+编辑指令推断”的难点,指出普通字幕会丢失动作顺序、终态和交互细节。方法以 Qwen3.5-27B 先推理编辑再检索,生成结构化目标/库视频描述,用加权生成 token 隐状态做稠密表示,并融合 TF-IDF 精确词匹配。零样本设置下验证集 R@1 达 80.81,盲测 R@1 达 89.73。

HLL: Can Agents Cross Humanity's Last Line of Verification? Figure 1
2026-06-02cs.AI

HLL: Can Agents Cross Humanity's Last Line of Verification?

Xinhao Song, Su Su, Sirui Song, Hongliang Wu, Wen Shen, Zhihua Wei, Gongshen Liu, Linfeng Zhang, Dongrui Liu

Shanghai Jiao Tong University, Shandong University, Tongji University

2026-06-02视觉感知

论文关注多模态 GUI 代理在真实网页流程中能否跨过 CAPTCHA 这类“人类验证”边界,而非只做静态识别。作者提出 HLL 基准,将十类交互式 CAPTCHA 按难度、页面干扰和基于动作轨迹的动态验证拆解评测,并可接入网页/移动代理环境。对八个前沿代理的闭环实验显示,当前系统在不同验证类型上表现波动大,遇到杂乱界面和轨迹一致性约束时明显退化,暴露出定位、动作校准、状态跟踪与过程一致性的短板。

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning Figure 1
2026-06-02cs.CL

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

The Chinese University of Hong Kong, Shenzhen, 2 Tsinghua University

2026-06-02视觉感知数据集/基准安全鲁棒

论文针对现有安全基准多为静态输入、缺少预警时机与误报评估的问题,提出 PaSBench-Video:740 段跨驾驶、医疗、日常和工业的视频,标注风险出现与事故边界,并以因果流式协议评估模型是否在正确时间、以正确内容报警。对 13 个视频 MLLM 的测试显示,最严格指标最高仅 20.0%,召回提升伴随高误报,说明当前模型更多依赖场景活动线索而非真正推理风险如何演化为伤害。

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation Figure 1
2026-06-02cs.CV

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

Shanghai Jiao Tong University, University of Electronic Science and Technology of China, Zhejiang University, Shanghai Jiao Tong University Shanghai Shanghai China, University of Electronic Science and Technology of China Chengdu Sichuan China, Zhejiang University Hangzhou Zhejiang China

2026-06-02视觉感知

该文针对身份保持文生视频中“文本可控性”和“人脸细节保真”难以兼顾的问题,提出 ST-DRC:将参考图经视频 VAE 编码为潜空间身份记忆,并用时间邻近、空间错位的 TASS-RoPE 让模型检索身份而减少像素级照搬;训练中加入外观扰动和人脸身份监督,推理时用三路 CFG 分离文本与参考强度。基于 LTX-2.3 的实验显示其在身份一致性、提示对齐、时序稳定和视频质量上表现较强,并在相关赛道中排名靠前。

Geometry-Aware Implicit Memory for Video World Models Figure 1
2026-06-02cs.CV

Geometry-Aware Implicit Memory for Video World Models

Zhengxuan Wei, Xu Guo, Xinghui Li, Xunzhi Xiang, Min Wei, Yiran Zhu, Qiulin Wang, Xintao Wang, Pengfei Wan, Xiangwang Hou, Qi Fan

School of Intelligence Science and Technology, Nanjing University, Tsinghua University

2026-06-02视觉感知强化学习

论文关注视频世界模型长时滚动中历史信息离开上下文后导致的外观漂移与几何不一致问题。GIM-World 的关键思路是把几何视为“记忆状态”的属性:用轻量 Transformer 将变长历史压成固定记忆 token,并在训练期通过可相机查询的几何头从冻结 3D 基础模型蒸馏跨视角结构,同时用信息量准则裁剪历史以控成本。MIND 实验显示其在长程视觉一致性、动作控制和 3D 几何一致性上优于显式与隐式记忆基线。

GC-MoE: Genomics-Guided Cell-Type-Specific Mixture of Experts for Histology-Based Single-Cell Spatial Transcriptomics Figure 1
2026-06-02cs.CV

GC-MoE: Genomics-Guided Cell-Type-Specific Mixture of Experts for Histology-Based Single-Cell Spatial Transcriptomics

Kaito Shiku, Ahtisham Fazeel Abbasi, Ryoma Bise, Yuichiro Iwashita, Kazuya Nishimura, Andreas Dengel, Muhammad Nabeel Asim

Kyushu University, Japan, German Research Center for Artificial Intelligence (DFKI GmbH), Germany, RPTU University Kaiserslautern-Landau, Germany, The University of Osaka, Japan, Osaka Metropolitan University, Japan

2026-06-02视觉感知

本文针对从 H&E 病理图像和细胞位置估计单细胞空间转录组的难题:单细胞表达差异强、且受细胞类型结构约束,普通共享回归易得到折中表达。GC-MoE用路由网络软选择细胞类型专家,并以CAP引入细胞类型特异共表达先验、C2CA利用邻近细胞上下文。多组公开单细胞ST实验和消融显示其优于现有单细胞方法及改造的spot级基线。

Edge Prediction for Roof Wireframe Reconstruction with Transformers Figure 1
2026-06-02cs.CV

Edge Prediction for Roof Wireframe Reconstruction with Transformers

Gustav Hanning, Ludvig Dillén, Jonathan Astermark, Johanna Lidholm, Viktor Larsson

Centre for Mathematical Sciences, Lund University

2026-06-02三维

面向从稀疏 SfM 点云与地面语义/深度线索重建屋顶三维线框的挑战,论文将任务改写为端到端边预测:按语义优先级采样点云,融合 Gestalt/ADE20k 及冻结自编码器提供的多视角局部语义特征,再用 DETR 式 Transformer 查询直接解码边端点。方法在 HoHo 22k 私榜取得 HSS 0.6476,排名第二,并优于手工与学习基线。

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos Figure 1
2026-06-02cs.CV

Explainable Forensics of Manipulated Segments in Untrimmed Long Videos

Yue Feng, Jingjing Li, Qijia Lu, Wei Ji, Jingrou Zhang, Fei Shen, Xiao Li, Yizhen Jia, Qiang Chen, Limin Wang, Wentong Li, Jie Qin

2026-06-02视觉感知

这篇论文针对现有伪造视频检测多停留在短片二分类、难以处理长视频中局部嵌入 AIGC 片段的问题,提出“长视频 AI 生成片段定位与解释”任务,并构建含 12,472 个未裁剪视频的 TASLE 基准,提供边界、真伪与解释标注。方法上给出粗到细的 MSLoc:先用边界敏感提议筛查长视频,再借助 MLLM 精修边界并生成取证理由。实验表明该基线在长视频混合真伪场景中有效,但最终性能受首阶段召回限制。

Honey, I Shrunk the Arc de Triomphe! Figure 1
2026-06-02cs.CV

Honey, I Shrunk the Arc de Triomphe!

Yuanbo Xiangli, Hanyu Chen, Xueqing Tsang, Noah Snavely

2026-06-02视觉感知

论文指出单目度量几何模型在野外场景存在“尺度坍缩”,远处地标被系统性缩小,根因可能主要来自缺少真实且尺度多样的训练数据。作者构建 MetricScenes,从互联网照片与立体影像中借助地理标签、已知基线恢复绝对尺度,并用两阶段边缘感知 Poisson 补全提升深度标签质量。基于该数据微调 MoGe-2 得到 WildMoGe,显著缓解远景尺度低估,在开放场景度量精度更好,同时保持标准基准表现。

PRIMA: Boosting Animal Mesh Recovery with Biological Priors and Test-Time Adaptation Figure 1
2026-06-02cs.CV

PRIMA: Boosting Animal Mesh Recovery with Biological Priors and Test-Time Adaptation

Xiaohang Yu, Ti Wang, Mackenzie Weygandt Mathis

2026-06-02视觉感知

针对单目四足动物三维网格恢复中3D监督稀缺、物种长尾和姿态不均衡导致的均值形状/姿态回归,PRIMA将BioCLIP生物语义与形态先验注入SMAL预测,并用2D重投影和关键点引导做测试时自适应,进而生成Quadruped3D伪3D数据。实验在Animal3D、CtrlAni3D等基准达到SOTA,尤其改善欠代表物种和复杂姿态。

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains Figure 1
2026-06-02cs.CV

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

Garvin Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

University of Chinese Academy of Sciences, Tongyi Lab, Alibaba Group, Peking University, ation should distinguish tool availability from, ‡ Intern at Tongyi Lab, Alibaba Group., that the tool mattered. Distinguishing tool availabil-

2026-06-02视觉语言

论文质疑多模态智能体的工具调用轨迹是否真的带来能力增益,而非只是学会调用流程。作者以 Thyme、DeepEyesV2 为例,对比禁用工具版本和无工具训练的 Pure-Text Reasoner,并用解题集合、过程归因、format-only/result-only 消融分析工具贡献。结果显示工具访问未稳定提升准确率或降低 token 成本,93.2%/96.0% 的工具解题也可被非工具设置解决,增益来源不清。

Multi-modal Video Representation Alignment for Robust Self-supervised Driver Distraction Detection Figure 1
2026-06-02cs.CV

Multi-modal Video Representation Alignment for Robust Self-supervised Driver Distraction Detection

David J. Lerch, Livien Majer, Zeyun Zhong, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

2026-06-02视觉感知安全鲁棒

面向真实驾驶监控中多传感器信号受遮挡、视角变化和语义重叠影响的问题,本文提出自监督的全局多模态视频对齐框架:用循环一致性生成软目标,缓解“所有负样本都应推远”的假设,并按相似度分布降低噪声正样本权重。在 Drive&Act 上,方法在 RGB、红外、深度和骨架模态间优于成对及已有全局对齐基线,跨视角实验也显示对未见摄像机视角有更好泛化。

TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos Figure 1
2026-06-02cs.CV

TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos

Jinpeng Liu, Yukang Xu, Yutong Li, Xingyu Liu

National University of Singapore

2026-06-02视觉感知三维

这篇论文针对人体运动、场景几何与相机轨迹长期被分开重建而导致尺度漂移、交互不物理的问题,提出多视角视频中的统一人-场景-相机4D重建任务。TROPHIES用多视角时空人体分支、人感知静态场景分支,以及结合尺度、接触、重力和跨视角时序一致性的全局优化来对齐坐标系。文中在EgoHuman和EgoExo4D上显示,其全局保真度和人景一致性优于既有范式。

VEDAL: Variational Error-Driven Asynchronous Learning for 3D Gaussian Splatting Pruning Figure 1
2026-06-02cs.CV

VEDAL: Variational Error-Driven Asynchronous Learning for 3D Gaussian Splatting Pruning

Aoduo Li, Jiancheng Li, Huan Ye, Hongjian Xu, Shiting Wu, Xiujun Zhang, Zimeng Li, Xuhang Chen

2026-06-02三维

针对3D Gaussian Splatting因数百万高斯导致显存占用高、现有剪枝易用固定时刻或启发式分数误删未收敛区域的问题,VEDAL将剪枝写成变分自由能最小化,并用逐高斯预测误差门控在重要性稳定后才异步施加稀疏先验,再由伯努利变分头学习保留概率。实验在三类基准上实现约5.2×压缩、PSNR仅降0.31 dB,并保持约185 FPS;相对基线提升较稳定但幅度不大。

Detecting Pen-In-Air States from Video: A Proof-of-Concept Toward Complementary Handwriting Analysis Figure 1
2026-06-02cs.CV

Detecting Pen-In-Air States from Video: A Proof-of-Concept Toward Complementary Handwriting Analysis

Lauren Sismeiro, Remy Plastre, Binbin Xu, Frederic Puyjarinet, Gerard Dray

2026-06-02视觉感知

本文针对数位板只能感知贴近纸面的笔尖、可能漏掉高抬笔空中运动的问题,探索用俯视普通视频补充书写动力学分析。方法将 YOLO 笔尖跟踪、运动学特征提取与传统分类器解耦组合,比端到端 CNN 更适合小数据且可解释。在 5 段公开视频、逐帧人工标注和 LOVO 评估下,Pen-Up 事件级 F2 最高 0.805;但样本规模很小,泛化性文中未充分说明。

Entropy Minimization without Model Collapse: Mitigating Prediction Bias in Medical Imaging Figure 1
2026-06-02cs.LG

Entropy Minimization without Model Collapse: Mitigating Prediction Bias in Medical Imaging

Tim Nielen, Sameer Ambekar, Johannes Kiechle, Daniel M. Lang, Julia A. Schnabel

School of Computation, Information and Technology, Technical University of Munich, Germany, Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich, Germany, School of Biomedical Engineering and Imaging Sciences, King’s College London, UK, Munich Center for Machine Learning (MCML), relAI – Konrad Zuse School of Excellence in Reliable AI, TUM University Hospital Rechts der Isar

2026-06-02视觉感知

医学影像部署中常见扫描仪、染色或人群差异带来的细微分布偏移,现有测试时熵最小化易出现单类预测崩塌。论文的核心洞察是:偏移会先让特征空间中不同类别簇合并,造成预测类别分布偏置,而熵最小化会继续压紧这些错误簇。作者提出DSBR,在测试时按预测类别分布重加权熵损失,平衡各类贡献;在四个医学影像数据集及ImageNet-C上能稳定适应、避免崩塌,并达到或超过多种现有方法。

Hallucination-Aware Diffusion Sampling for Inverse Problems via Robust Prior Updates Figure 1
2026-06-02cs.CV

Hallucination-Aware Diffusion Sampling for Inverse Problems via Robust Prior Updates

Pengfei Jin, Yiqi Tian, Kailong Fan, Bingjie Qi, Quanzheng Li

Center for Advanced Medical Computing and Analysis, Massachusetts General Hospital and Harvard Medical School, Boston, MA 02114, Department of Industrial Engineering, University of Pittsburgh, Pittsburgh, PA 15261

2026-06-02生成模型安全鲁棒

本文关注扩散模型求解逆问题时“看起来真实但不受观测支持”的幻觉风险,指出贝叶斯式求解器中幻觉可在先验提议阶段进入,再由测量校正难以完全消除。作者提出 RPU,在不改变 DPS 测量更新的情况下探测并重锚先验位移,以提升局部稳定性。FFHQ 的修补和去模糊任务中 PSNR、LPIPS 均优于 DPS,人评也明显偏好 RPU;ImageNet 结果平局较多但非平局样本仍倾向 RPU。

Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning Figure 1
2026-06-02cs.CV

Training-Free Composed Video Retrieval via Visual Representation-Guided Video-LLM Reasoning

Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Qingming Huang

School of Computer Science and Technology, University of Chinese Academy of Sciences, State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing Academy of Artificial Intelligence, Institute of Information Engineering, Chinese Academy of Sciences, School of Cyber Security, University of Chinese Academy of Sciences

2026-06-02视觉感知三维

针对“参考视频+文本修改”检索目标视频时,全库逐一用视频大模型推理成本高且仅靠视觉相似难满足编辑语义的问题,论文提出免训练粗到细流程:先用冻结 DINOv3 帧特征与 Chamfer 相似度筛候选,再由 Qwen3-VL 按修改指令重排并对前列候选深度推理细化。在 CoVR-R 测试集上,R@1 从 DINOv3 的 25.34 提升到最终 48.78,R@5 为 51.48。

Deep Learning for Remote Sensing to Improve Flood Inundation Mapping Figure 1
2026-06-02cs.CV

Deep Learning for Remote Sensing to Improve Flood Inundation Mapping

Yogesh Bhattarai, Vijay Chaudhary, Wai Lim Kim, Sanjib Sharma

2026-06-02视觉感知

洪水期间光学卫星常被云遮挡,传统时序合成难以跟上淹没范围的快速变化。本文将去噪扩散模型与Masked Diffusion Transformer用于Sentinel-2B多光谱洪水影像去云,结合自注意力、掩码重建和DEM地形信息推断被遮挡水体。实验显示其在图像质量及水体连续性、光谱水指数保持等水文指标上更稳健,但数据规模仅62幅,泛化增益仍需更多验证。

Measurement Geometry and Design for Trustworthy Generative Inverse Problems Figure 1
2026-06-02cs.LG

Measurement Geometry and Design for Trustworthy Generative Inverse Problems

Pengfei Jin, Na Li, Quanzheng Li

Center for Advanced Medical Computing and Analysis, Massachusetts General Hospital and Harvard Medical School, Boston, MA 02114, School of Engineering and Applied Sciences, Harvard University, Boston, MA 02138

2026-06-02生成模型

针对扩散等生成先验在欠定反问题中可能“补全”未观测方向、产生可信度风险的问题,本文从测量几何刻画算子能否区分局部数据流形上的合理替代解,提出局部测量-流形兼容性指标及基于后验云的固定/序贯采样设计。实验覆盖行采样、层析角度选择和 fastMRI 笛卡尔采样,显示几何分数能预测幻觉与失败模式,并在固定预算下优于强非学习 ACS 保留基线。

Cross-Domain Dead Tree Detection via Knowledge Distillation in Aerial Imagery Figure 1
2026-06-02cs.CV

Cross-Domain Dead Tree Detection via Knowledge Distillation in Aerial Imagery

Anis Ur Rahman, Mete Ahishali, Einari Heinaro, Samuli Junttila

CSC – IT Center for Science Ltd., Espoo, Finland, Department of Forest Sciences, University of Helsinki, KOKO Forest Ltd., School of Forest Sciences, University of Eastern Finland

2026-06-02视觉感知

针对航拍死树检测在不同森林区域间因树种、冠层密度、成像条件差异和标注稀缺而泛化困难的问题,论文将芬兰数据训练的 TreeMort-1T-UNet 作为教师,比较基础、自蒸馏、特征级和集成蒸馏以适配波兰、德国、爱沙尼亚等目标域。结果显示特征级蒸馏最稳,在波兰集上 F1 达 0.63、精度 0.55,并在低数据场景减少误检;表征分析也支持其更强域不变性。

Quantitative Movement Testing: Measuring Patient Movements from a Single Smartphone Video Figure 1
2026-06-02cs.HC

Quantitative Movement Testing: Measuring Patient Movements from a Single Smartphone Video

Pranav Mahajan, Amanda Wall, Eleonora Maria Camerone, Julie Stebbins, Eoin Kelleher, Shuangyi Tong, Annina Schmid, Katja Wiech, Anushka Irani, Ben Seymour

Nuffield Department of Clinical Neurosciences, University of Oxford, Oxford, UK., Max Planck Institute of Biological Cybernetics, Tuebingen, Germany., Oxford Gait Laboratory, University of Oxford, UK., Harvard Medical School, Boston, Massachusetts, USA., Institute of Biomedical Engineering, University of Oxford, Oxford, UK.

2026-06-02视觉感知

针对慢性疼痛患者功能受损难以在真实环境中客观量化、光学动捕昂贵且受限于实验室的问题,论文提出 QMT:用单部智能手机视频结合深度学习 3D 姿态估计提取运动学 biomarker。其在前屈、原地踏步和小深蹲任务上与动捕高度一致,多数指标相关性 r>0.85,并在纤维肌痛和坐骨神经痛队列中显示较高重测可靠性与居家纵向监测可行性,但家庭场景方差更高。

Neural Acquisition & Representation of Subsurface Scattering Figure 1
2026-06-02cs.CV

Neural Acquisition & Representation of Subsurface Scattering

Arjun Majumdar, Raphael Braun, Hendrik Lensch

University of Tübingen

2026-06-02视觉感知

针对半透明材料次表面散射难以用解析 BSSRDF 或少量采样准确建模、完整光传输采集又代价高的问题,论文用3D扫描中常见的高频相移条纹作为少量输入,训练 U-Net 预测每个表面像素的各向异性散射 footprint,并据此进行图像域重光照。实验将预测重光照与真实投影拍摄对比,显示在多视角、多物体上能较好泛化;但方法不恢复物理材质参数,角度依赖和大范围散射仍未充分处理。

Cross-modal linkage risk in clinical vision-language models Figure 1
2026-06-02cs.CV

Cross-modal linkage risk in clinical vision-language models

Soroosh Tayebi Arasteh, Mahshad Lotfinia, Sven Nebelung, Daniel Truhn

2026-06-02视觉语言视觉感知安全鲁棒

本文关注临床视觉语言模型在“影像与报告应被隔离”场景下的跨模态重关联隐私风险,将其形式化为胸片到报告检索问题。核心洞察是,越医学专用的共享嵌入越可能保留实例级配对信息,且不只是疾病标签相似。实验显示 BioViL-T 等模型在 MIMIC-CXR、CheXpert Plus 上显著高于随机命中;仅对投影头做差分隐私微调可将 N=10000 的 Recall@1 降低 61.8%,同时 14 类影像分类 AUROC 基本不变。

Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset Figure 1
2026-06-02cs.CV

Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset

David J. Lerch, Sarath Mulugurthi, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

2026-06-02视觉语言视觉感知数据集/基准

面向车内驾驶员监控,通用VLM难以区分开关瓶盖等细粒度驾驶动作,限制安全告警与可解释性。论文将Drive&Act原子动作转成自然语言描述,构建描述数据集,并用LLM评分评测/微调VLM。结果显示现有三种VLM零样本表现不可靠;在该数据上微调后跨DMD评测ACCR由66提升到76,但更广泛场景的泛化仍需更多数据验证。

From Extrinsic to Intrinsic: Geodesic-Guided Representation Learning for 3D Geometric Data Figure 1
2026-06-02cs.CV

From Extrinsic to Intrinsic: Geodesic-Guided Representation Learning for 3D Geometric Data

Yuming Zhao, Junhui Hou, Qijian Zhang, Jia Qin, Ying He

2026-06-02三维

本文针对现有3D预训练多依赖外在坐标结构或语义、难以刻画形状内在拓扑与抗形变细节的问题,提出PRISM:以测地距离预测为自监督任务,借鉴等距嵌入思想约束潜空间,并用两阶段训练和重要采样缓解测地距离样本不均衡。实验显示,该方法可仅从点云高效预测测地距离,并在形状识别、表面参数化和非刚性对应等任务上取得更强或有竞争力的表现。

A combination of noise and bilateral filters achieve supralinear and scalable adversarial robustness in CNNs Figure 1
2026-06-02cs.LG

A combination of noise and bilateral filters achieve supralinear and scalable adversarial robustness in CNNs

Nicolas Stalder, Benjamin F. Grewe, Matteo Saponati, Pau Vilimelis Aceituno

Institute of Neuroinformatics, ETH Zürich, University of Zürich

2026-06-02安全鲁棒

针对对抗训练计算开销大、且常针对特定攻击的问题,本文提出在训练和推理前端组合像素级高斯噪声与多次双边滤波,并从理论上解释二者通过互补机制带来超线性鲁棒性增益。实验显示该简单预处理可与对抗训练叠加,在 RobustBench/AutoAttack 上接近或超过既有强防御,同时仅用约35%训练 FLOPs,并在不同模型规模下以约2–8倍更少总计算匹配竞争方法。

Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark Figure 1
2026-06-02cs.CV

Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark

Maria Santos-Villafranca, Jesus Bermudez-cameo, Alejandro Perez-Yus, Giovanni Maria Farinella, Antonino Furnari

University of Zaragoza - I3A, Department of Mathematics and Computer Science, University of Catania

2026-06-02视觉语言视觉感知数据集/基准

面向机器人/可穿戴设备的持续感知,论文指出现有动作分割多默认算力与能耗充足,难以支持 always-on 部署。Ego-METAS 将 EgoExo4D、CMU-MMAC、CaptainCook4D 统一为超 100 小时、5 模态的在线节能时序动作分割基准,要求逐时刻动态选择传感器并满足硬件能耗预算。实验显示最优路由强依赖场景,现有面向裁剪片段的策略学习方法在未裁剪连续环境中适应不佳,而简单动态多模态融合也能改善精度-能耗权衡。

Towards Resolving Optimization Conflicts Between Image- and Text-Based Person Re-Identification Figure 1
2026-06-02cs.CV

Towards Resolving Optimization Conflicts Between Image- and Text-Based Person Re-Identification

Karina Kvanchiani, Timur Mamedov

Lomonosov Moscow State University, Russia

2026-06-02视觉感知优化算法

本文关注统一行人重识别中图像检索与文本检索的训练目标冲突:前者需要身份级不变性,后者常受实例级文本属性驱动。作者的核心洞察是不要用同一阶段强行联合优化,而是先训练共享视觉编码器,再冻结其语义空间并对齐文本编码器;实验显示 I2I 预训练可提升 T2I 泛化,在视觉预训练中加入文本监督还能同时改善两类检索,且无需增加架构复杂度。

Bayesian meta-learning for modeling Alzheimer's disease progression Figure 1
2026-06-02stat.ML

Bayesian meta-learning for modeling Alzheimer's disease progression

Clara Hoffmann, Nadja Klein

Scientific Computing Center, Karlsruhe Institute of Technology, Germany

2026-06-02视觉感知

本文关注阿尔茨海默病个体随访稀疏、MRI 高维且长期预测易过度自信的问题,提出结合元学习与贝叶斯最后一层的模型,用超网络根据患者历史轨迹动态调整预测分布,无需为新个体重训。理论与仿真说明确定性 ReLU 分类器在长期外推时会过度自信,贝叶斯化可缓解;在 ADNI 数据上总体性能接近单任务和确定性元学习方法,并在长期疾病进展预测上有明显改进。

Chroma Clues: Leveraging Color Statistics to Detect Synthetic Images Figure 1
2026-06-02cs.CV

Chroma Clues: Leveraging Color Statistics to Detect Synthetic Images

Lea Uhlenbrock, Davide Cozzolino, Christian Riess

2026-06-02视觉感知

针对生成图像越来越逼真、传统黑盒检测难解释的问题,本文从颜色统计入手,指出常用于生成器训练的 LPIPS 损失对色度不如亮度敏感,可能留下系统性色彩痕迹。作者设计六种手工颜色变换,并学习任务优化变换,用像素/块级颜色特征进行检测、修复区域可视化和模型归因;简单可解释分类器跨生成器平均准确率达 93.27%,且对六类后处理保持较强鲁棒性。

CORE-MTL: Rethinking Gradient Balancing via Causal Orthogonal Representations Figure 1
2026-06-02cs.CV

CORE-MTL: Rethinking Gradient Balancing via Causal Orthogonal Representations

Chengfeng Wu, Tao Zou, Yanru Wu, Jingge Wang

2026-06-02优化算法

本文针对多任务学习中负迁移与 OOD 退化,指出梯度平衡只处理冲突表象,未约束共享表征中语义与伪相关因素的纠缠。CORE-MTL 将表征分为语义流和残差流,并用重建、解耦、反事实不变性及物理/统计先验约束任务头只依赖稳定语义。理论上给出更紧的 OOD 泛化界并诱导梯度正交,实验在多个视觉多任务 ID/OOD 基准上优于十个基线。

Symmetry-Aware 9D Pose Estimation with Sim(3)-Consistent Feature and Spherical Inception Convolution Figure 1
2026-06-02cs.CV

Symmetry-Aware 9D Pose Estimation with Sim(3)-Consistent Feature and Spherical Inception Convolution

Panfei Cheng, Hongshan Yu, Wenrui Chen, Xiaojun Tang, Jian Liu, Naveed Akhtar

2026-06-02三维

面向无 CAD 模型的类别级机器人操作,论文针对 9D 位姿在非线性 Sim(3) 空间难学、类内形变大的问题提出 SSH-Pose:用 DINOv2 引导的对称感知模块先估计平移与尺寸,将旋转学习化简到 SO(3),再以 Sim(3) 一致的层次点对几何特征和球面大核 inception 卷积融合语义/几何信息。文中报告在基准与真实场景达到 SOTA,并搭建了可抓取多样未知物体的机器人系统。

Order within Chaos: Capturing Intrinsic Energy Anomalies for AI-Manipulated Image Forgery Localization Figure 1
2026-06-02cs.CV

Order within Chaos: Capturing Intrinsic Energy Anomalies for AI-Manipulated Image Forgery Localization

Yiming Wang, Baiqi Wu, Qingming Li, Jiahao Chen, Tong Zhang, Shouling Ji

2026-06-02视觉感知

针对扩散编辑图像缺少传统传感器噪声、语义又趋于自洽导致伪造定位失效的问题,论文从能量建模解释生成区域会抑制局部高频方差并形成能量异常,提出以 LAD 图捕获邻域统计差异,再结合轻量 LAD-Net 与 SAM adapter 细化像素级边界,并用 EditStream 持续合成训练数据;实验称在多个人工智能伪造定位数据集上达到新 SOTA,且能泛化到未见生成架构。

Closing the Alignment-Maturity Gap in Federated Prototype Learning Figure 1
2026-06-02cs.LG

Closing the Alignment-Maturity Gap in Federated Prototype Learning

Mario Casado-Diez, Alejandro Dopico-Castro, Verónica Bolón-Canedo, Bertha Guijarro-Berdiñas

2026-06-02视觉感知

本文针对联邦原型学习在非 IID 视觉数据上早期“原型尚不成熟却被强制对齐”的问题,指出距离相关梯度会压制本地判别表征形成。FedSAP 通过线性预热延迟原型对齐,并复用全局原型在超球面上做类别分离,无额外通信开销。三项基准实验显示其较原型基线最高提升约 4 个百分点,异质性越强收益越明显,并可较自然扩展到半监督场景。

InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark Figure 1
2026-06-02cs.CV

InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark

Shiyu Wang, Ziyu Liu, Chaoyi Yu, Yujie Yin, Zhongqian Mao, Jing Chen, Jiaqi Song, Yunshi Lan, Yan Wang (East China Normal University, Shanghai, China)

East China Normal University, East China Normal University Shanghai China

2026-06-02数据集/基准

现有视觉情感基准多停留在情绪分类,难评估模型对触发因素、语境因果和回应意图的理解。InsightVQA 将情感理解组织为感知、具身/证据化理解与认知推理三层 VQA,从 351K 图像筛得 138K 图像并构建 725K 问答,另设 30K 评测集和 InsightNet 基线。实验显示现有多模态模型在低层感知较强,但在高层情感归因与认知推理上仍明显受限。

Disentanglement-Based Equivariant Learning for Compositional VQA Figure 1
2026-06-02cs.CV

Disentanglement-Based Equivariant Learning for Compositional VQA

Zhou Du, Zhaoquan Yuan, Xiao Wu, Changsheng Xu

Zhou Du, Zhaoquan Yuan, and Xiao Wu are with the School, of Computing and Artificial Intelligence, Southwest Jiaotong University, Changsheng Xu is with the State Key Laboratory of Multimodal Artificial, Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of, Sciences, Beijing 100190, China, and with the School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing 101408, China, and also with Peng Cheng Laboratory, ShenZhen 518055, China (e-mail:

2026-06-02视觉感知

针对组合式 VQA 中模型易学习概念共现偏差、难以泛化到未见视觉/语言组合的问题,论文提出 DEAL:用因果干预和重编码解耦视觉与文本概念,再在特征层构造组合变换,并约束答案随输入等变变化。方法仅依赖真实答案监督,在 CLEVR-CoGenT 和 GQA-SGL 上相较现有方法取得更好的组合泛化表现。

Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis Figure 1
2026-06-02cs.CV

Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis

Catyana Heyne, Jürgen Frikel, Filippo Riccio

2026-06-02视觉语言

面向企业/政务中版式复杂的视觉富文档分类,论文指出现有多模态模型因OCR依赖、布局建模与评测设置不一而难以比较。作者在统一RVL-CDIP流程下对LayoutLMv3、Donut、Qwen3-VL与Qwen3文本LLM做受控对比,核心洞察是图像与布局信号对分类最关键,OCR文本只是辅助;结果显示专用多模态Transformer整体优于通用LLM,尤其在布局密集文档上更可靠。

InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models Figure 1
2026-06-02cs.CV

InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

Xinxin Liu, Shiwei Gan, Xiao Liu, Yafeng Yin, Lei Xie, Sanglu Lu

State Key Laboratory of Novel Software Technology, Nanjing University

2026-06-02视觉感知

针对 Video-LLM 视觉 token 过多导致推理开销高、现有免训练压缩依赖相邻帧局部相似且预算分配粗糙的问题,InfoMerge 将压缩重写为段级二阶时序冗余估计与信息感知预算分配:用 Temporal Fingerprint Difference 捕捉同一空间位置的段内相似结构变化,并用 CABA 按片段独特性和谱熵丰富度分配 token。实验显示其在多基准和骨干上取得更好效率–精度折中,在 LLaVA-OneVision-7B 上减少 85% 视觉 token 仍保留 98.8% 平均性能,prefill 加速 4.24 倍。

Predicting the risk of colorectal anastomotic leak based on preoperative mapping of the blood supply of the bowel Figure 1
2026-06-02eess.IV

Predicting the risk of colorectal anastomotic leak based on preoperative mapping of the blood supply of the bowel

Zahra Tabatabaei, Jon Sporring, Mark Bremholm Ellebæk, Alaa El-Hussuna

2026-06-02安全鲁棒

结直肠吻合口漏术前缺乏可靠预测,现有评估依赖医生目测血供,主观且难以预防干预。本文提出基于术前平扫/增强 CT 的 AI 流程,以肠系膜血管树、组织灌注等特征生成漏风险评分,并结合 CBMIR 检索相似历史病例提升可解释性。主要结果是给出从数据合规处理、分割配准到风险估计和临床部署的协议框架,文中未充分说明真实验证集上的预测增益。

Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking From Sparse Inertial Sensors and Ranging-Based Between-Sensor Distances Figure 1
2026-06-02cs.CV

Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking From Sparse Inertial Sensors and Ranging-Based Between-Sensor Distances

Dominik Hollidt, Tommaso Bendinelli, Christian Holz

Department of Computer Science, ETH Zurich, Switzerland

2026-06-02视觉感知生成模型三维

针对稀疏 IMU 人体动捕易受惯性漂移影响、既有 IMU+UWB 方法仅把测距当作特征而未利用几何约束的问题,UDP 用扩散式自回归补全预测 SMPL 动作,并通过 MDS 空间布局模块从 UWB 距离解析重建传感器 3D 位置,再在采样中以前向运动学的 UWB-Diffusion Guidance 约束预测距离一致性。实验在 AMASS、DIP-IMU、TotalCapture 等设置下达到 SOTA,关节位置误差相较先前方法最高降低 22%。

Rethinking Evaluation Paradigms in IBP-based Certified Training Figure 1
2026-06-02cs.LG

Rethinking Evaluation Paradigms in IBP-based Certified Training

Konstantin Kaulen, Hadar Shavit, Holger H. Hoos

2026-06-02数据集/基准

针对IBP认证训练中自然准确率与认证准确率相互冲突、单一配置报告易造成不公平比较的问题,本文主张用完整Pareto前沿评估方法,并以自动多目标超参数优化在相近预算下搜索各方法的最优权衡。实验发现既有结果普遍存在欠调优,部分新前沿支配原报告;同时近年进展幅度被高估,SABR偏高自然准确率、MTL-IBP偏强认证保证,方法间呈互补关系。

Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization Figure 1
2026-06-02cs.CV

Equilibrated Diffusion: Frequency-aware Textual Embedding for Equilibrated Image Customization

Liyuan Ma, Xueji Fang, Guo-Jun Qi

Westlake University, Zhejiang University, Westlake University Hangzhou China

2026-06-02视觉感知生成模型

本文关注文本到图像个性化中主体身份、原图风格与背景容易纠缠,导致新提示尤其风格化提示下主体一致性和文本对齐难兼顾。方法以高低频分别关联风格与内容为核心洞察,提出频率感知解耦文本嵌入,并用主体掩码扩散削弱背景干扰、残差参考注意力保留结构细节。实验显示其在主体一致性和提示遵循上优于多种定制扩散方法。

Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection Figure 1
2026-06-02cs.CV

Understanding-Enhanced Model Collaboration for Long-Tailed Egocentric Mistake Detection

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Qingming Huang

State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, School of Computer Science and Tech., University of Chinese Academy of Sciences, Beijing Academy of Artificial Intelligence, Institute of Information Engineering, CAS, School of Cyber Security, University of Chinese Academy of Sciences

2026-06-02视觉感知

本文面向第一视角教学视频中的操作失误检测,动机在于错误样本稀少且既可能是局部执行错误,也可能是流程阶段不匹配。作者提出 UE-MCM,用 Qwen3-VL 处理细粒度片段、DCR 增强的 CLIP4CLIP 建模粗细上下文,并以协作门融合,配合长尾损失优化。HoloAssist 测试集上仅用 RGB 达到 F-score 0.60,高于 2025 Top1 的 0.57,但消融不足,增益来源仍不完全清楚。

Jailbreaking Multimodal Large Language Models using Multi-Clip Video Figure 1
2026-06-02cs.CV

Jailbreaking Multimodal Large Language Models using Multi-Clip Video

Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang Hyun Kim

Department of Applied Artificial Intelligence, Sungkyunkwan University, Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University

2026-06-02视觉语言视觉感知

本文关注视频输入下多模态大模型安全对齐为何更易失效的问题,构建含2920个多片段视频的 MCV SafetyBench,用不同数量、动态性和上下文多样性的短片段系统测试越狱风险。实验覆盖8个视频 MLLM,发现攻击成功率随片段数和语义多样性上升,视频比图像、动态视频比静态视频更脆弱;作者还提出基于抽帧图像安全过滤的简单防御,可一定程度缓解该漏洞。

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving Figure 1
2026-06-02cs.CV

Multimodal Action Diffusion for Robust End-to-End Autonomous Driving

Jorge Daniel Rodríguez-Vidal, Diego Porres, Gabriel Villalonga Pineda, Antonio M. López Peña

2026-06-02视觉语言生成模型安全鲁棒

针对端到端自动驾驶多依赖轨迹中间表示、最终仍由确定性控制或带 GPS 的手工控制器执行的问题,本文主张应直接在油门、转向、刹车动作空间建模多模态不确定性。其 ADT 用无锚扩散 Transformer 生成多个动作候选,并以最近邻匹配选择执行命令,从而避免轨迹锚点和定位依赖。实验显示其在 Bench2Drive 闭环基准超过既有 SOTA,延迟低约 10 倍,并带来更稳定的表征与行为一致性。

WebSpline: Structure-Informed Splines for Real-Time 3D Gaussians from Monocular Videos Figure 1
2026-06-02cs.CV

WebSpline: Structure-Informed Splines for Real-Time 3D Gaussians from Monocular Videos

Jongmin Park, Jeonghwan Yun, Minh-Quan Viet Bui, Munchurl Kim

2026-06-02视觉感知三维

本文针对单目动态场景中多视角约束不足导致的结构不稳定与细节过平滑问题,提出 WebSpline:先用 2D 点轨构建并正则化结构代理图,再以结构引导的三次 Hermite 样条为每个 3D Gaussian 建模运动,并在空间/结构邻域上施加时序刚性约束。实验在 iPhone、NVIDIA 基准上取得 SOTA 渲染质量,PSNR 分别较次优提升 0.36/0.61 dB,且在 iPhone 上比 WorldTree 渲染快 10 倍以上。

LALE: Lightweight-Transformer Architecture for Land-Cover Estimation Figure 1
2026-06-02eess.IV

LALE: Lightweight-Transformer Architecture for Land-Cover Estimation

Ümit Mert Çağlar, Alptekin Temizel

2026-06-02视觉感知

面向高分辨率遥感地物分割中全局上下文、局部细节与算力预算难兼顾的问题,LALE按分辨率拆分编码器:高分辨率用轻量ConvMixer提取局部特征,低分辨率再用Transformer建模全局,并配合全MLP多尺度解码器、RMSNorm和StarReLU降本。在ARAS400k上,小模型仅1.6M参数,F1距UPerNet约2.6点,但参数少4.5倍、GMAC少17倍、吞吐高1.8倍。

FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation Figure 1
2026-06-02cs.CV

FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation

Xueji Fang, Liyuan Ma, Jianhao Zeng, Jinjin Cao, Mingyuan Zhou, Guo-Jun Qi

Zhejiang University, Westlake University, Westlake University Hangzhou China

2026-06-02视觉感知生成模型

本文关注 DiT 中较少被系统优化的 FFN,指出其类似存储视觉语义的键值词表,而细节区域的关键 query token 容易被背景、低频 token 干扰。FocusDiT 通过随时间步和层动态预测 Query Mask,只让关键 token 更充分调用 FFN,并重分配各层 FFN“词表”容量。文本到图像实验显示其在细粒度质量、定量指标和部分推理效率上优于对比方法。

Agentic-J: An AI Agent for Biological Microscopy Image Analysis Figure 1
2026-06-02cs.MA

Agentic-J: An AI Agent for Biological Microscopy Image Analysis

Lukas Johanns, Marilin Moor, Davide Panzeri, Yu Zhou, Xinyi Chen, Nora F. K. Pauly, Zixuan Pan, Matthias Gunzer, Andreas Müller, Yiyu Shi, Hedi Peterson, Jianxu Chen

Institute of Computer Science, University of Tartu, Tartu, Estonia., Faculty of Computer Science, Ruhr University Bochum, Bochum, Germany., Informatics Institute, University of Amsterdam, Amsterdam, Netherlands., Department of Computer Science and Engineering, University of Notre Dame, Notre, Institute for Experimental Immunology and Imaging, University of Duisburg-Essen, Institute of Molecular and Clinical Immunology, Faculty of Medicine, Magdeburg, project is available at https://mmv-lab.github.io/Agentic-J/., The open-source code is available at https://github.com/MMV-Lab/Agentic-J. In general, the main

2026-06-02视觉感知

生物显微图像分析常受 Fiji/ImageJ 插件依赖、参数选择和手工流程不可复现困扰。Agentic-J 将 Fiji、兼容插件和多智能体助手封装进沙箱容器,用自然语言生成或引导执行分割、跟踪、统计与质控脚本,并把数据、代码、图表和记录组织为可追溯项目。案例中复现小鼠干细胞跟踪得到原论文一致的 29 条轨迹和 2001 个 spots,但系统性基准和相对增益文中未充分说明。

FACT: A Simple and Efficient Framework for Active Finetuning Figure 1
2026-06-02cs.CV

FACT: A Simple and Efficient Framework for Active Finetuning

Wenshuai Xu, You Song, Yuzhuo Cui, Minjie Ren, Qingjie Liu, Zhenghui Hu

2026-06-02视觉感知

本文关注主动微调中“选少量样本后如何微调”被忽视的问题:全量微调在标注稀缺和分布偏移下会扭曲预训练特征并加剧过拟合。作者提出 FiAF 视角与 FACT 三阶段框架,先线性探测、再全量微调,最后用冻结特征增强和轻量模型降低参数风险。实验覆盖多类分类数据集和 ConvNeXt、ViT、ViL,在低采样率下 ViT 于 CIFAR/ImageNet 等任务报告超过 20% 增益,并提升效率与鲁棒性。

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image Figure 1
2026-06-02cs.CV

Fast and Lightweight Novel View Synthesis with Differentiable Multiplane Image

Kaidi Zhang, Guanxu Zhu

2026-06-02视觉感知

面向机器人与移动端等稀疏视角场景,论文针对 NeRF/3DGS 训练慢、模型大及前馈高斯冗余的问题,重新采用紧凑的 MPI 表示;其核心是用视觉基础模型预测点图初始化可学习多平面,并通过可微体渲染多视图优化,同时引入一步扩散参与蒸馏和后处理以修复孔洞伪影。实验称相较代表性 GS 方法渲染快 30.7%、模型仅为 14.8%,在前视场景保持有竞争力质量。

TIDES: Time-Derivative Event Simulation via Deformable Reconstruction Figure 1
2026-06-02cs.CV

TIDES: Time-Derivative Event Simulation via Deformable Reconstruction

Christopher Thirgood, Dipon Kumar Ghosh, Simon Hadfield

2026-06-02三维

针对事件相机仿真常由离散帧差分推断时间戳、在高速运动和遮挡下产生“时间戳批处理”的问题,TIDES基于动态4D Gaussian Splatting直接对渲染过程做时间导数计算,获得可见性一致的亮度及其变化率,并用遮挡风险自适应步进和tile级读出仲裁模拟带宽限制。文中在四个配对RGB-事件基准上报告事件流保真度达到SOTA,且合成事件在真实下游任务迁移上优于现有帧式模拟器。

Topological texture analysis of microscopy images of dynamic casein gelation and its relation to rheological properties Figure 1
2026-06-02cs.AI

Topological texture analysis of microscopy images of dynamic casein gelation and its relation to rheological properties

Zahra Tabatabaei, Diana Soto Aguilar, Jose C. Bonilla, Mathias P. Clausen, Jon Sporring

Department of Computer Science, University of Copenhagen, Denmark., Department of Green Technology, University of Southern Denmark, Denmark., Department of Food Science, University of Copenhagen, Denmark.

2026-06-02视觉感知

针对酪蛋白凝胶化微结构长期缺少可量化、可与流变性质对应的动态图像分析工具,本文将TDA、差分盒计数、多重分形和LBP结合用于STED时间序列。核心洞察是用Betti-1环结构刻画网络连通性,弱化强度漂移影响。结果显示拓扑曲线可识别聚集滞后、溶胶-凝胶转变及后期重排,并与储能模量变化相互印证。

Attention mechanisms and transfer learning for robust peach leaf damage classification under domain shift Figure 1
2026-06-02cs.CV

Attention mechanisms and transfer learning for robust peach leaf damage classification under domain shift

Adrián Cánovas-Rodriguez, Miguel A. González-Illán, Maria Fernanda García-Cruz, Pedro Nortes Tortosa, José Salvador Rubio-Asensio, Miguel A. Zamora Izquierdo, Juan Antonio Martínez Navarro, Antonio F. Skarmeta

synergy with scalable backbone families such as EfficientNetB5, where, aDepartment of Information and Communication Engineering, University of, bDepartment of Irrigation, Centro de Edafología y Biología Aplicada del Segura, through manual annotation of publicly available images, comprising 1,366

2026-06-02安全鲁棒

针对桃园中病虫害与非生物胁迫叶片症状相似、公开数据到真实田间存在域偏移的问题,论文构建1366张六类桃叶损伤基准,并比较多种CNN、CBAM注意力与迁移微调策略。结果显示CBAM增益强依赖骨干,EfficientNetB5+CBAM在基准上达93.3%准确率/93.6% F1;本地180图四类数据迁移后,EfficientNetB3+CBAM宏F1约93%、准确率94.6%,但部分提升可能也来自scaling与数据适配。

Normality-Preserving Continual Industrial Anomaly Detection via Orthogonal LoRA Banks Figure 1
2026-06-02cs.CV

Normality-Preserving Continual Industrial Anomaly Detection via Orthogonal LoRA Banks

Weibai Fang, Haijun Che, Feiyang Ren, Qiancheng Lao

2026-06-02视觉感知

面向产线中新品类持续加入时扩散式工业异常检测容易遗忘旧类正常先验的问题,论文将 LoRA 视为低秩正常性记忆,提出冻结历史 LoRA 并把新适配器约束到其正交补空间的 HF-OLB,同时用 HNABG 按层级新颖度选择性扩展容量。MVTec 与 VisA 连续设置中,VisA 2×6 达到 83.6/91.8 图像/像素 A-AUROC,像素级较 SOTA 提升 3.2 点且遗忘指标降低 1.3。

OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents Figure 1
2026-06-02cs.LG

OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents

Rui Yang, Qianhui Wu, Yuxi Chen, Hao Bai, Wenlin Yao, Hao Cheng, Baolin Peng, Huan Zhang, Tong Zhang, Jianfeng Gao

2026-06-02强化学习

论文针对开放视觉网页智能体依赖大量人工轨迹、难以适应动态真实网站的问题,提出 OpenWebRL:在真实网页上进行在线多轮强化学习,结合少量 SFT 热启动、并行浏览器 rollout、多模态上下文管理、轨迹级 VLM judge 与多轮 GRPO。其 4B 模型仅用 0.4K 初始化轨迹和 2.2K RL 任务,在 WebVoyager、Online-Mind2Web、DeepShop 达到 74.1%、67.0%、64.0%,超过多种开放基线并接近部分闭源系统。

Ranking vs. Assignment: The Metric Mismatch in Multi-View Object Association Figure 1
2026-06-02cs.CV

Ranking vs. Assignment: The Metric Mismatch in Multi-View Object Association

Matvei Shelukhan, Timur Mamedov, Aleksandr Chukhrov, Karina Kvanchiani

2026-06-02视觉感知

多视角目标关联最终要解一对一匹配,但许多论文用 AP、FPR-95 等成对排序指标评价,可能与真实任务目标不一致。本文的核心洞察是这种错配可被理论构造和 Sinkhorn 后处理“放大”:正确匹配时排序指标仍可能不完美,排序最优也可能匹配错误。实验中仅调少量后处理参数即可显著提升 AP/FPR-95,而 ACC、IPAA 基本不同步提升,提示应更重视分配级乃至全局一致性指标。

PerBite: A Curated Diagnostic Workflow for Bite-Aware Food Volume Estimation Figure 1
2026-06-02cs.CV

PerBite: A Curated Diagnostic Workflow for Bite-Aware Food Volume Estimation

Ahmad AlMughrabi, Farid Al-Areqi, David Fernández Gómez, Umair Haroon, Marc Bolaños, Ricardo Marques, Petia Radeva

2026-06-02生成模型

本文针对连续进食场景中“看起来合理”的食物网格未必能可靠估计摄入量的问题,提出 PerBite,将前后状态视为成对的度量体积推理:用 SAM 3 定位食物/盘子、Hunyuan3D/SAM 3D 生成网格,再以盘径定标、去除盘面并修补为 watertight 网格后积分。其核心洞察是表面重建、尺度、清理和消耗量差分需分开评估。方法在 MetaFood CVPR 2026 挑战中排名第一,34 个网格 Chamfer 为 8.31,17 对状态体积 MAPE 为 33.87%、无单调性违例,但消耗体积 MAPE 仍达 53.74%,且流程依赖已选帧和人工清理。

Distortion-Aware Fusion of Statistical and Vision-Language Features for Blind Image Quality Assessment Figure 1
2026-06-02cs.CV

Distortion-Aware Fusion of Statistical and Vision-Language Features for Blind Image Quality Assessment

Bishr Omer Abdelrahman Adam, Xu Li

2026-06-02视觉语言视觉感知

针对无参考图像质量评估中传统自然场景统计特征可解释但表达有限、视觉语言特征语义强却易忽略低层失真的问题,本文将138维NSS与冻结的SigLIP、CLIP-H嵌入融合,并用按输入自适应的乘性门控学习各流权重。结果在KADID-10k达SROCC 0.9715、PLCC 0.9733,在KonIQ-10k和LIVE-itW也保持竞争力;失真级分析显示NSS对噪声和色偏更关键,门控权重与该贡献趋势相关。

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization Figure 1
2026-06-02cs.CV

Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization

Jingyun Liang, Min Wei, Shikai Li, Yizeng Han, Hangjie Yuan, Lei Sun, Weihua Chen, Fan Wang

DAMO Academy, Alibaba Group, Hupan Lab, Zhejiang University

2026-06-02视觉感知生成模型规划控制三维

本文以人体运动控制检验视频扩散模型是否真正具备三维理解,而非依赖2D投影捷径。核心做法是绕过渲染,将SMPL运动分解为轨迹与身体姿态网格,并用VQ-VAE压缩成3D mesh tokens,通过交叉注意力接入DiT视频生成器。实验显示其在人类运动控制、视角变化和运动编辑中更稳健,可减少浮脚、穿插等由2D引导和轨迹姿态不匹配带来的伪影。

A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision Figure 1
2026-06-02cs.CV

A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision

Stefano Samele, Eugenio Lomurno, Teodora Jovanovic, Sanjay Shivakumar Manohar, Alberto Crivellaro, Matteo Matteucci

Politecnico di Milano, AIRLab, Milan, Italy

2026-06-02视觉感知数据集/基准

这篇论文针对多模态工业异常检测“看似可由文本指导、实则标准评测未检验文本是否影响决策”的问题,提出 TGAD 基准:从提示敏感性、指定部件检测到真实装配面板 APD,逐步提高语言约束作用。实验覆盖三类代表模型,发现文本多只提供弱类别先验;去掉物体名、要求忽略非指定部件缺陷或同时指定缺陷类型与位置时,图像级 AUROC 明显下滑,APD 上甚至接近或低于随机,说明现有基准可能高估了语言可控性。

MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching Figure 1
2026-06-02cs.CV

MT-EditFlow: Reinforcement Learning for Multi-Turn Image Editing with Flow Matching

Jiahui Huang, Yasi Zhang, Tianyu Chen, Shu Wang, Jianwen Xie, Oscar Leong, Mingyuan Zhou, Nanzhu Wang, Ying Nian Wu

2026-06-02视觉感知生成模型强化学习

针对单轮训练的图像编辑模型在多轮交互中易因“一步失败全局失败”和曝光偏差导致错误累积的问题,本文提出 MT-EditFlow,将流匹配生成模型的强化学习扩展到多轮编辑,并设计多奖励、跨轮聚合的优势广播机制,兼容 GRPO 与 NFT。实验显示其在多种基座上提升连续编辑稳定性,FLUX.1-Kontext-dev 第三轮总体性能提升 6.85 分并超过 Qwen-Image-Edit。

Generalization Limits in Vehicle Re-Identification Figure 1
2026-06-02cs.CV

Generalization Limits in Vehicle Re-Identification

Anis Yassine Ben Mabrouk (CB), Antoine Tadros (CB), Rafael Grompone von Gioi (CB), Gabriele Facciolo (CMLA, LIGM), Axel Davy (CB), Rodrigo Verschae

Universit´e Paris-Saclay, ENS Paris-Saclay, CNRS, Centre Borelli, limited available samples., was mainly used for predicting known class labels. However

2026-06-02学习理论

本文关注车辆重识别基准的泛化评估偏差:训练集与测试集中常出现同品牌、型号、颜色的高度相似车辆,使模型可能靠记忆而非真正细粒度判别取得高分。作者提出按车辆类型划分 seen/unseen 的新评测,并进一步区分同视角与跨视角检索。结果显示,在 VeRi776 与 VeRI-Wild 上,多数现有方法对已见类型可接近饱和,但面对未见车型时显著退化,视角鲁棒性与细节关注也主要局限于训练中出现过的类型。

A Closer Look at In-Distribution vs. Out-of-Distribution Accuracy for Open-Set Test-time Adaptation Figure 1
2026-06-02cs.LG

A Closer Look at In-Distribution vs. Out-of-Distribution Accuracy for Open-Set Test-time Adaptation

Zefeng Li, Evan Shelhamer

University of British Columbia and Vector Institute

2026-06-02视觉感知

针对开放集测试时自适应中只重视已知类精度、忽视未知类拒识的问题,本文系统评测 SAR、OSTTA、UniEnt、SoTTA 在 CIFAR-10-C/ImageNet-C 及多种 OOD 数据上的 InD/OOD 表现,并引入可变 OOD 比例与 sigmoid 输出基线。结果显示现有方法常以牺牲 OOD 准确率换取 InD 提升,OOD 过滤并不可靠,BN 对批内混合更敏感,GN 更稳定。

Contrastive Augmented Transformer with Domain-specific Enhancement for Robust Multi-scenario Metal Surface Defect Detection Figure 1
2026-06-02cs.CV

Contrastive Augmented Transformer with Domain-specific Enhancement for Robust Multi-scenario Metal Surface Defect Detection

Yiyao Liua, Wenxiao He, Liyuan Ren, Huan Wang

2026-06-02视觉感知安全鲁棒

针对金属表面缺陷样本稀缺、微小多尺度缺陷难分辨以及跨产线光照/噪声导致泛化差的问题,论文提出 CAT:以可训练 Swin Transformer 结合冻结 ResNet-50 形成双分支参考,并用改进 FPN、液滴式领域增强和带难负样本挖掘的多尺度对比损失提升判别性。在 KolektorSDD2 上像素 AUROC 达 99.54%,并在 KSDD1、MTD、RSDD 等未见数据上显示较好鲁棒性。

WALL-WM: Carving World Action Modeling at the Event Joints Figure 1
2026-06-02cs.RO

WALL-WM: Carving World Action Modeling at the Event Joints

Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Sage Yang, Lorien Shu, J.W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, PS Zhang, Neo Li, Lily Li, James Wang, Ping Yang, Chris Pan, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

2026-06-02强化学习

论文针对现有VLA/WAM用固定长度动作块训练导致语言、视觉与控制粒度错配、削弱长程泛化的问题,提出以可命名、可观察、可执行的语义事件作为视频-动作学习原子,结合事件级标注、聚类均衡采样和两种推理模式保留视频先验并支持变长执行。实验称在大规模真实机器人泛化评测中达到SOTA,但具体增益中有多少来自事件建模、数据规模或预训练基础设施,文中片段仍未充分说明。

Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects Figure 1
2026-06-02cs.RO

Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects

Jens U. Kreber, Lukas Mack, Joerg Stueckler

University of Augsburg

2026-06-02强化学习三维

针对多物体桌面场景中形状多样、遮挡和接触传播使机器人难以预判动作后果的问题,论文提出 MRO-GWM:用物体中心的 Gaussian/anchor 表示刚体形状,并以时空 Transformer 在历史物体与末端执行器位姿及未来动作条件下预测多步刚体运动。实验在合成家居物体场景中比较变体与消融,并将模型用于 MPC,能在仿真中完成两类非抓取操作;但仍依赖已知分割与物体位姿。

Parameter-Efficient Fine-Tuning of Large Pretrained Models for Instance Segmentation Tasks Figure 1
2026-06-02cs.CV

Parameter-Efficient Fine-Tuning of Large Pretrained Models for Instance Segmentation Tasks

Nermeen Abou Baker, David Rohrschneider, Uwe Handmann

2026-06-02视觉感知

本文针对大规模预训练分割模型全量微调成本高、易过拟合且在实例分割中PEFT研究不足的问题,系统考察Adapter与LoRA在SEEM、Mask DINO等模型上的适配。核心创新是将LoRA用于多尺度可变形注意力,并设计顺序堆叠Adapter。实验显示仅训练约1–6%参数即可接近传统40–55%参数微调的性能,2–3个Adapter较均衡,LoRA在部分场景还能优于Adapter。

Beyond Low-Rank: Low-Rank Sparse Prompting via Spiking Neural Network and Prompt Factorization Figure 1
2026-06-02cs.CV

Beyond Low-Rank: Low-Rank Sparse Prompting via Spiking Neural Network and Prompt Factorization

Yumiao Zhao, Bo Jiang, Beibei Wang, Xixi Wan, Xiao Wang, Jin Tang

Sensing Laboratory of Anhui Province, Anhui Provincial Key Laboratory of, Multimodal Cognitive Computation, School of Computer Science and Technology, Anhui University

2026-06-02视觉感知

本文针对视觉提示中密集像素扰动冗余、泛化受限和能耗偏高的问题,提出 LoRSP:先用低秩分解构造多个提示因子,再借助脉冲神经网络的积分-发放机制生成面向单样本的稀疏像素提示,在保持低秩约束的同时自适应选择提示位置与强度。实验覆盖五类视觉骨干和多个基准,显示其以更少可调参数取得与现有 VP 方法相当或更好的性能。

SCAPO: Self-Supervised Category-Level Articulated Pose Estimation from a Single 3D Observation Figure 1
2026-06-02cs.CV

SCAPO: Self-Supervised Category-Level Articulated Pose Estimation from a Single 3D Observation

Can Zhang, Gim Hee Lee

Department of Computer Science, National University of Singapore

2026-06-02三维

面向机器人在单帧 RGB-D 中理解门、抽屉等未知铰接物体,SCAPO试图摆脱部件/关节标注、多帧运动和CAD模板依赖。其核心是用 SE(3) 等变自编码器建立类别规范空间,再以关节感知 blend-skinning、可学习规范模板和残差形状解耦几何与关节运动,直接估计部件分割、枢轴、轴向和状态。合成与真实数据实验显示其在分割和关节参数上优于自监督基线,消融表明形状方差与关节正则对稳定性关键。

SAVMap: Structure-Aided Visual Mapping of Large-Scale 2.5D Manhattan Wireframes from Panoramic Video Figure 1
2026-06-02cs.CV

SAVMap: Structure-Aided Visual Mapping of Large-Scale 2.5D Manhattan Wireframes from Panoramic Video

Howard Huang, Bharath Surianarayanan, Keifer Lee, Chenyu Wang, Chen Feng

2026-06-02视觉感知

面向仓库/工厂中机器人定位与数字孪生对低成本语义3D地图的需求,SAVMap不追求稠密点云,而是从全景视频渲染货架和天花板视图,用轻量分割提取货架角点、灯具中心等语义结构点,并在SfM中加入曼哈顿网格等几何约束,生成2.5D语义线框。实仓46排、约1小时视频实验中,重建5000余个货架元素,相对真值平均绝对误差4.8厘米。

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning Figure 1
2026-06-02cs.CV

Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

Ziyang Yao, Zeyu Zhu, YunCheng Jiang, Zibin Guo, Huijing Zhao

2026-06-02强化学习规划控制

这篇论文针对自动驾驶离散视觉 token 仍偏向像素重建、与规划可用性脱节的问题,提出以 VQ-VAE 为基础的统一驾驶 tokenizer:用冻结 DINO 特征引导语义表示,结合 RGB 重建、细节分支、相邻帧深度与相对位姿监督,并用多码本缓解量化瓶颈。NAVSIM 实验显示,其 token 在重建保真度和 DINO 一致性上更好,在固定轻量规划器下规划表现有竞争力,并提升自回归世界模型的生成质量。

3rd Place at CVPR 2026 CASTLE Challenge: Agentic Multi-View Long-Context Video Understanding via Hierarchical Knowledge Graph Retrieval Figure 1
2026-06-02cs.CV

3rd Place at CVPR 2026 CASTLE Challenge: Agentic Multi-View Long-Context Video Understanding via Hierarchical Knowledge Graph Retrieval

Raghad Albusayes, Munirah Alyahya

2026-06-02视觉感知

针对 CASTLE 中 600 小时多视角音视频带来的长上下文检索与时空/语义推理难题,论文提出免训练的 agentic 框架:先把 30 秒片段抽取为音视觉描述并构建含实体、时间关系和“提及”关系的视频知识图谱,再由规划、图检索、片段复核与 VQA 代理分层求解。方法在挑战中获第三名,准确率 55%,较基线 43% 提升 12 个百分点;消融显示适量 KG 检索和保留 Mention 关系较关键。

Pool-Select-Refine: Allocation-Aware Generative Dataset Distillation with Soft-Label-Guided Latent Refinement Figure 1
2026-06-02cs.CV

Pool-Select-Refine: Allocation-Aware Generative Dataset Distillation with Soft-Label-Guided Latent Refinement

Wenmin Li, Shunsuke Sakai, Zhongkai Zhao, Tatsuhito Hasegawa

with Soft-Label-Guided Latent Refinement, aGraduate School of Engineering, University of Fukui, 3-9-1 Bunkyo, Fukui, 910-8507, Fukui, Japan, bCollege of Computer Science and Artificial Intelligence, Southwest Minzu University, No.168, Wenxing Section, Dajian Road, Konggang Development, Soft Labels, budget. Second, we refine the selected samples in latent space using soft-label supervision derived, teacher-derived soft-label supervision while preserving the, more controllable and better aligned with the goal of dataset

2026-06-02生成模型数据集/基准

论文针对扩散式数据集蒸馏中“生成即使用”把随机样本直接占满固定 IPC 预算、易造成冗余和低信息量样本的问题,提出 Pool-Select-Refine:先生成过完备候选池,再按教师模型给出的语义可靠性、特征多样性和不确定性筛选,随后用软标签指导潜空间细化。实验显示其在 ImageNet 子集和细粒度分类基准上相对扩散基线有稳定提升,低预算场景收益更明显。

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning Figure 1
2026-06-02cs.CL

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

Kyoto University, Case Western Reserve University, The Hong Kong Polytechnic University, The University of Osaka, University of Tokyo

2026-06-02视觉语言

本文针对多模态大模型在空间选择题中“看得见却答错”的问题,指出错误不只来自视觉 grounding,而是加入 left/right/front/behind 等空间词后触发语言侧词汇偏置。作者用 BSTF 案例、注意力/残差探针、activation patching 和稀疏干预定位到 LLM 侧通道与神经元;仅用小规模合成偏好数据做 LLM-only DPO,即在合成四选任务最高提升 100 点,并迁移提升 WhatsUp、SpatialMQA-Direct、VSR。

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering Figure 1
2026-06-02cs.CV

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

Dongxing Mao, Jinpeng Wang, Jiahao Tang, Kevin Qinghong Lin, Linjie Li, Zhengyuan Yang, Lijuan Wang, Min Li, Jingru Tan

Central South University, University of Oxford

2026-06-02视觉感知

这篇论文关注自回归图像生成中文字渲染模糊、字形破坏的问题,指出瓶颈主要在离散视觉 tokenizer 的细节重建能力,而重训 tokenizer 会破坏原有 token ID 并迫使 AR 模型重训。作者提出 RDA,在冻结原 tokenizer 和 AR 模型的前提下,用共享 ID 的 Hint Codebook 与像素残差解码分支后处理重建结果。实验显示其在 Janus-Pro、TAR、Lumina-mGPT 等模型上提升文本可读性,如 Janus-Pro 在 TextVisionBlend OCR 准确率由 24.52% 提至 58.26%。

Single-Line Drawing Generation via Semantics-Driven Optimization Figure 1
2026-06-02cs.GR

Single-Line Drawing Generation via Semantics-Driven Optimization

Tanguy Magne, Alexandre Binninger, Ruben Wiersma, Olga Sorkine-Hornung

as embroidery, laser engraving and wire bending. Our code and results are available at https://github.com/tanguymagne/SLDgen., Association for Computer Graphics and John Wiley & Sons Ltd., fusion models with the controllability of classic parameterizations., Computer Graphics Forum published by Eurographics and John Wiley & Sons Ltd.

2026-06-02优化算法

本文针对扩散模型虽能生成“像单线画”的图像、却难以严格保证一笔连续且不利于制造的问题,提出直接优化单条 URBS 曲线的语义驱动框架,用 SDS、可微光栅化、LoRA 风格适配和正则项共同约束语义、简洁度与线条风格。实验显示其在文本/图像条件下相较文生图和现有草图优化管线更符合单线画美学,并输出可用于刺绣、激光雕刻等的矢量结果。

Private and Stable Test-Time Adaptation with Differential Privacy Figure 1
2026-06-02cs.LG

Private and Stable Test-Time Adaptation with Differential Privacy

Zefeng Li, Qiaoyue Tang, Mathias Lecuyer, Evan Shelhamer

2026-06-02视觉感知

本文关注测试时自适应在部署中会把未标注测试样本写入模型更新、从而泄露隐私的问题。作者将 Tent、EATA、SAR、DeYO、COME 等 TTA 方法改造成差分隐私版本,引入逐样本梯度裁剪、加高斯噪声及相应隐私会计,并处理选择性更新和流式评估。ImageNet-C 结果显示,DP-TTA 以较小精度代价提供隐私保证;低隐私或无隐私噪声下,逐样本裁剪还可提升连续适应的准确率与稳定性,开销适中。

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue Figure 1
2026-06-02cs.CV

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin, David Schlangen

Computational Linguistics, Department of Linguistics, University of Potsdam, Germany, German Research Center for Artificial Intelligence (DFKI), Berlin, Germany

2026-06-02视觉语言视觉感知三维

针对现有视觉语言评测多停留在静态 caption/VQA、难以考察多轮纠错中“共同基础”形成的问题,本文提出全自动 Image Reconstruction Game:VLM 描述者仅用自然语言迭代指导图像生成器重建目标图。实验显示,重建质量主要由描述者决定,生成器影响迭代是增益还是退化;数学与几何图最难,token 预算会改变收敛形态,而自动评审与人类偏好一致性仍较弱,需人工校准。

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation Figure 1
2026-06-02cs.CV

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

Koç University, University College London, Adobe, Hacettepe University

2026-06-02视觉感知

现有视频生成的相机控制多依赖世界坐标轨迹,难以随人物动作保持有叙事意义的构图。Auteur 的核心洞察是把镜头表示为相对演员的景别、角度与画面位置,并用可转为 6-DoF 的 DSL 由微调多模态 LLM 生成关键帧,再插值成连续机位。论文构建 34K 文本-人体运动-相机数据,并在新构图指标上优于既有可控相机方法。

Train, Test, Re-evaluate: Schedule-Sensitive Evaluation of Generative Data for Hand Detection Figure 1
2026-06-02cs.CV

Train, Test, Re-evaluate: Schedule-Sensitive Evaluation of Generative Data for Hand Detection

Atmika Bhardwaj, Silvia Vock, Nico Steckhan

2026-06-02视觉感知生成模型数据集/基准

面向工业安全中的手部检测,论文关注公开数据多为裸手、难覆盖手套/饰品等部署外观偏移的问题。作者用生成式局部修补只改真实图像的手部区域,构造成对合成数据,并系统比较不同训练日程而非只看图像逼真度。结果显示,合成数据是否有用强依赖训练流程:先用真实+合成训练再低学习率真实微调可提升真实测试 mAP@0.5 并缩小手套子集差距,三阶段课程则在更严格 mAP@0.5:0.95 上最好。

Collaborative Space Object Detection with Multi-Satellite Viewpoints in LEO Constellations Figure 1
2026-06-02cs.CV

Collaborative Space Object Detection with Multi-Satellite Viewpoints in LEO Constellations

Xingyu Qu, Wenxuan Zhang, Peng Hu

2026-06-02视觉感知

面向低轨星座日益拥挤带来的空间目标快速、低功耗检测需求,论文把多颗卫星的不同视角以早期融合方式组织成 YOLO 可直接处理的输入,避免复杂多分支结构。实验显示多视角在 RGB 和灰度下通常提升 mAP 与定位质量,如 YOLOv9-m 三视角 RGB 的 mAP50 从 0.638 升至 0.732,最佳三视角灰度 mAP50-95 提升 46.5%。

Adversarial Attacks on Robot Localization Systems via Deep Feature Perturbation Figure 1
2026-06-02cs.CV

Adversarial Attacks on Robot Localization Systems via Deep Feature Perturbation

Zhenyu Li, Tianyi Shang

2026-06-02机器人

论文关注机器人视觉定位中基于产品量化(PQ)的检索管线易被对抗扰动误导的问题。作者提出轻量级 LPQN,直接扰动查询特征的质心分配概率,并用前向扰动与反向优化两阶段绕过量化不可微性。实验称在受控和真实机器人环境中可显著降低 PQN 定位性能,暴露部署安全风险,但具体数值增益在给定片段中未充分说明。

Divide and Conquer: Reliable Multi-View Evidential Learning for Deepfake Detection Figure 1
2026-06-02cs.CV

Divide and Conquer: Reliable Multi-View Evidential Learning for Deepfake Detection

Xiaolu Kang, Zhongyuan Wang, Jikang Cheng, Baojin Huang, Zhanhe Lei, Gang Wu, Qin Zou, Qian Wang

2026-06-02视觉感知

本文针对深伪检测在未知伪造与跨域场景中易被强语义特征掩盖细微伪造痕迹、产生过度自信的问题,提出 DiCoME:用几何正交投影将伪造痕迹视为语义空间的补空间,构建语义视图与 artifact 视图,再以证据学习和 Dempster-Shafer 融合建模视图冲突与不确定性。多基准实验显示其泛化性能优于现有方法,并能给出更可靠的不确定性估计。

Beyond the Simplex: Balanced Prototype Geometry for Scorer-Agnostic Open-Set Recognition Figure 1
2026-06-02cs.LG

Beyond the Simplex: Balanced Prototype Geometry for Scorer-Agnostic Open-Set Recognition

Mayank Sharma, Rohit Kumar Mourya

Indian Institute of Technology Jodhpur

2026-06-02视觉感知

面向医疗和机器人视觉中需拒识未知类别的安全需求,本文补上 simplex-ratio 开集识别在低维嵌入下的理论缺口。核心是用等范数零和的 balanced codes 替代只在 d≥C−1 存在的正单纯形,证明接受域可由欧氏球并刻画、U 分数 Lipschitz 且紧,并给出缺陷参数和指数型 FAR 界。实验显示该几何有助于表征先验,但原始 ratio 分数常弱于 KNN 或 logit 类后处理,性能仍强依赖 scoring rule。

Deep Learning for Generating Computational PIN-4 Immunohistochemistry Staining from Prostate Biopsy H&E Images Figure 1
2026-06-02cs.CV

Deep Learning for Generating Computational PIN-4 Immunohistochemistry Staining from Prostate Biopsy H&E Images

Vietbao Tran, Pratik Shah

University of California, Irvine, Pathology and Laboratory Medicine, biopsy and resection WSIs collected at the University of, California, Irvine Medical Center (UCI Health) in Orange, excluding unavailable or unpaired images and applying prepro-

2026-06-02视觉感知

针对前列腺活检中 PIN-4 免疫组化需在相邻切片完成、难与触发检查的 H&E 形态逐细胞对齐的问题,论文构建配准的临床 H&E/PIN-4 WSI 数据集,并用监督式 cGAN 从常规明场 H&E 直接合成 PIN-4 染色。最终含 93 名患者、172 对 WSI、27298 个配准 patch;独立测试集上 PSNR 21.88 dB、SSIM 0.667、PCC 0.684,病理医师认为可捕捉 AMACR 与基底细胞相关信号,但复杂高级别癌区域质量仍不稳定。

Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs Figure 1
2026-06-02cs.CV

Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs

Zhi-Kai Chen, Jun-Peng Jiang, Jun-Jie Tao, De-Chuan Zhan, Han-Jia Ye

2026-06-02视觉感知

针对单一图像生成模型难覆盖长尾个性化风格、逐需求微调又成本高的问题,Polaris 将社区已有 Stable Diffusion 检查点与 LoRA 适配器视为可检索模型库,通过文本/图像联合查询、指令解析与重排序,在 6500 余个 checkpoint 和 7.5 万个 adapter 中选择并组合合适组件。文中称该方法无需额外训练即可实现风格感知的生成与编辑,并在交互延迟下提升多样化需求的对齐和质量,但具体增益可能主要来自大规模模型库覆盖。

RescueBench: Can Embodied Agents Save Lives in the Wild ? Figure 1
2026-06-02cs.CV

RescueBench: Can Embodied Agents Save Lives in the Wild ?

Kui Wu, Beiyu Guo, Hao Chen, ShuHang Xu, Yuling Li, Yongdan Zeng, Zhoujun Li, Yizhou Wang, Fangwei Zhong

Beihang University 2 Beijing Normal University 3 Peking University, City University of Macau 5 ATEC2025 Challenge Committee

2026-06-02视觉感知

面向真实搜救中开放探索、连续交互与长程空间记忆相互耦合而现有基准多孤立评测的问题,RescueBench构建了照片级四阶段搜救流程,并用五级难度和阶段级指标诊断级联失败。对七类基线、oracle和人类的评测显示,最高难度下无基线完成全任务,主要瓶颈是自主探索,空间记忆也是独立短板,现有拓扑VLN和地图方法仍难覆盖。

Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection Figure 1
2026-06-02cs.CV

Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection

Yihui Wang, Yonghui Yang, Jilong Liu, Fengbin Zhu, Le Wu, Tat-Seng Chua

Hefei University of Technology, National University of Singapore, Hefei University of Technology China, National University of Singapore Singapore

2026-06-02视觉感知

本文针对 Deepfake 检测跨伪造方法泛化差的问题,指出模型常依赖特定伪造算法的纹理/伪影捷径。核心洞察是用伪造方法分类线性探针与 SVD 显式提取“方法敏感子空间”,并在训练中抑制该子空间梯度、推理时削弱相关神经元激活。多基准实验显示 S3 能提升未知伪造方法上的检测性能,同时基本保持域内表现。

Physics-Guided Attention in a Lightweight TCN for Efficient WiFi CSI-Based Human Activity Recognition Figure 1
2026-06-02cs.CV

Physics-Guided Attention in a Lightweight TCN for Efficient WiFi CSI-Based Human Activity Recognition

Chinthaka Ranasingha, Tharindu Fernando, Sridha Sridharan, Clinton Fookes, Harshala Gammulle

and Vision Technologies (SAIVT) Research Group, School of Electrical, Engineering and Robotics, Queensland University of Technology (QUT)

2026-06-02视觉感知

这篇论文针对 WiFi CSI 人体活动识别中过度依赖深层模型、难以在边缘设备实时部署的问题,提出在轻量 TCN 中显式注入物理先验:用多普勒能量引导时间注意力突出运动片段,并用时序方差驱动通道注意力选择敏感子载波。实验显示其在多个基准上优于更深、更重的基线,同时显著降低参数量和 FLOPs。

ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search Figure 1
2026-06-02cs.CV

ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search

Zequn Xie, Xibei Jia, Sihang Cai, Shulei Wang, Tao Jin

Zhejiang University

2026-06-02视觉感知安全鲁棒

该文针对文本行人搜索中 CLIP 类模型偏向全局语义、难以利用服饰/发型等局部细节的问题,提出 ROGLE:用 SAM 分割与 CLIP 相似度自动挖掘区域—句子伪配对,并结合全局对比学习、局部对齐和可靠性校准。作者还构建含长描述和 10 万级区域标注的 P-VLG,实验显示在长文本、组合查询上优于现有方法,但增益可能部分来自数据扩充。

Hierarchically Decoupled Mixture-of-Experts for Robust Traffic Sign Recognition in Complex Driving Scenarios Figure 1
2026-06-02cs.CV

Hierarchically Decoupled Mixture-of-Experts for Robust Traffic Sign Recognition in Complex Driving Scenarios

Mingxiao Wang, Xiaozhen Qu, Bolin Gao, Tong Wang, Lei He

2026-06-02视觉感知安全鲁棒

针对交通标志检测中静态 YOLO 难以同时适应近距清晰样本、远距离小目标和恶劣天气的问题,论文提出 CBDES MoE TSR:用轻量门控按图像语义进行 Top-1 路由,在异构 YOLO 专家池中动态选择模型,将难度评估与特征提取解耦。其在复合数据集上 mAP50-95 达 76.8%,较 YOLOv9c 提升 2.3%,计算开销降低约 39.4%。

Hist2Style: Histogram-Guided Stylization with Bilateral Grids Figure 1
2026-06-02cs.CV

Hist2Style: Histogram-Guided Stylization with Bilateral Grids

Dekel Galor, Adam Pikielny, Zhoutong Zhang, Ke Wang, Laura Waller, Jiawen Chen, Ilya Chugunov

University of California, Berkeley

2026-06-02视觉感知

针对大图像编辑模型在照片级调色中计算重、易幻觉且难精细控制的问题,Hist2Style将其能力选择性蒸馏到轻量网络,用目标图像颜色直方图作为可编辑风格条件,并以双边网格中的局部仿射变换限制输出,从结构上保留边缘与内容。方法支持高分辨率实时色调迁移和交互式直方图控制;文中还提出与人类偏好相关的风格化质量指标,但具体相对增益在片段中未充分说明。

Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing Figure 1
2026-06-02cs.CV

Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing

Jiahe Fan, Shaolong Shu, Mingjian Sun, Tiehua Zhang, Bohong Xiao, Hanli Wang, Rui Fan

2026-06-02视觉感知

面向自动驾驶场景解析,论文针对新域无标注、源数据因隐私/产权不可用且单一源模型易带偏的问题,提出源自由的 UCDA:用类级原型记忆库以原型相似度统一评估多源模型预测可靠性,再通过正负一致性协同细化源模型,并蒸馏为单一目标模型。实验覆盖公开驾驶数据和真实车载数据,显示其能整合多源互补知识,提升目标域分割可靠性与跨环境泛化。

Personalized 3D Myocardial Infarct Geometry Reconstruction from Cine MRI for Cardiac Digital Twins Figure 1
2026-06-02cs.CV

Personalized 3D Myocardial Infarct Geometry Reconstruction from Cine MRI for Cardiac Digital Twins

Yilin Lyu, Mark YY Chan, Ching-Hui Sia, Lei Li

Department of Biomedical Engineering, National University of Singapore, Singapore, Department of Medicine, National University of Singapore, Singapore, Department of Cardiology, National University Heart Centre Singapore, Singapore

2026-06-02三维

为避免LGE MRI造影剂限制与稀疏切片插值带来的心梗瘢痕建模误差,论文提出GeoMo-Net,从常规多视角cine MRI构建4D双心室网格,解耦并融合几何与运动特征,并用AHA-17分段先验做多尺度监督,直接重建可用于心脏数字孪生仿真的3D梗死区域。在225例扫描上Dice为0.678±0.011,电生理仿真与LGE真值较一致,但透壁性和跨域鲁棒性仍未充分解决。

STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models Figure 1
2026-06-02cs.CV

STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models

Yuhang Han, Wenzheng Yang, Yujie Chen, Xiangqi Jin, Yaojie Zhang, Siteng Huang, Linfeng Zhang

EPIC Lab, SJTU, The University of Sydney

2026-06-02视觉语言视觉感知

该文面向GUI视觉语言智能体多轮截图导致KV cache线性膨胀、显存难以部署的问题,指出既有方法把视觉重要性压成统一显著图且固定top-B截断,忽略注意力子空间的空间专化与轨迹中的分布漂移。STaR-KV无需训练,通过在线空间互信息做子空间评分、用时间稳定性折扣压制持久UI冗余,并以熵自适应调温选择缓存。在四个GUI基准上,其在同等预算下优于GUIKV、SnapKV等,20%缓存预算时峰值显存约降40%,压缩阶段几乎无额外FLOPs。

PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps Figure 1
2026-06-02cs.CV

PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps

Junlin Long, Zeyu Zhang, Xu Deng, Yiran Wang, Yue Yang, Luke Borgnolo, Maxwell Twelftree, Yang Zhao

2026-06-02机器人

论文针对 VLN 与 ObjNav 仍依赖架构融合、混合训练或 CLIP/VLM 跨模态监督的问题,提出将二者视为同一对象语义流形上的不同接口。PlatonicNav 用自监督视觉编码器构建融合几何与语义距离的拓扑图,并通过盲匹配把语言目标对齐到纯视觉地图,无需成对图文数据。实验覆盖 HM3D-IIN、OVON、R2R-CE 及 Unitree Go2 实机,显示其可在任务、模态和载体间泛化。

PillarDETR: YOLO-Backbone and RT-DETR Head for Real-Time 3D Object Detection Figure 1
2026-06-02cs.CV

PillarDETR: YOLO-Backbone and RT-DETR Head for Real-Time 3D Object Detection

Smit Kadvani, Shriya Gumber, Kriti Faujdar, Harsh Dave

2026-06-02视觉感知三维

面向自动驾驶与机器人中 LiDAR 3D 检测的实时性瓶颈,PillarDETR沿用 PointPillars 的柱状编码生成 BEV 伪图像,但将后端替换为 YOLOv8 风格 CSP 骨干与适配 3D 框回归的 RT-DETR 解码头,以减少锚框和 NMS 依赖并建模全局关系。实验称其在 KITTI moderate mAP 从 62.78% 提升到 66.57%,nuScenes mAP 达 46.8%,A100 上 41.2 FPS;但增益可能部分来自更大模型容量。

EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models Figure 1
2026-06-02cs.CV

EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Pengfei Zhang, Yao Hu, Jiawei Li, Shikai Jiang

Harbin Institute of Technology, Fudan University

2026-06-02视觉语言视觉感知

面向高分辨率图像和视频中视觉 token 过多导致 LVLM 推理慢、显存高的问题,EvoCut 不再依赖注意力或单层特征,而是利用视觉编码器跨层演化:信息 token 往往持续偏离群体演化方向。据此进行免训练、无注意力的多层重要性评分与裁剪。在 LLaVA-1.5-7B 上仅保留 64 个视觉 token(约 11.1%)仍保持 94.4% 平均性能,并获得约 1.44× 总时延加速。

Quality-Guided Semi-Supervised Learning for Medical Image Segmentation Figure 1
2026-06-02cs.CV

Quality-Guided Semi-Supervised Learning for Medical Image Segmentation

Kumar Abhishek, Ghassan Hamarneh

2026-06-02视觉感知

医学分割的半监督学习常用模型置信度筛伪标签,但置信度自指且难反映真实分割质量。本文训练独立质量预测器,从图像-掩码对估计 Dice,并用合成扰动与弱模型输出覆盖真实错误,再作为质量正则和伪标签重加权模块插入现有 SSL。五个皮肤/肠镜数据集、多架构和多种 SSL 范式实验显示其稳定提升,质量预测也与真实 Dice 高相关。

Sensitivity as a Double-Edged Sword: A Trade-off Between Discriminability and Adversarial Robustness Figure 1
2026-06-02cs.CV

Sensitivity as a Double-Edged Sword: A Trade-off Between Discriminability and Adversarial Robustness

Kai Wang

2026-06-02安全鲁棒

论文从分类头视角解释对抗脆弱性:FC 分类器对特征扰动更敏感,带来判别力也放大攻击,而 ℓ2 距离分类器更稳但精度受限。作者提出 HPM 重分类器,用 EMA 全局原型与由 FC 预测生成的批原型融合,再以 ℓ2 距离决策,并设计 MSA 避免梯度遮蔽误评。在 CIFAR-10/100 与 ImageNet 上,该插件经少量分类头微调可提升已有对抗训练模型鲁棒性。

FlatVPR: Plug-and-play Geo-linear Residual Adapter for Geometric Rectification of Foundation Model Feature Manifolds Figure 1
2026-06-02cs.CV

FlatVPR: Plug-and-play Geo-linear Residual Adapter for Geometric Rectification of Foundation Model Feature Manifolds

Rai Hisada, Kanji Tanaka

2026-06-02视觉感知

面向机器人长期视觉地点识别,FlatVPR试图缓解大规模地图中密集存储特征与定位精度的矛盾:它在DINOv2等基础模型特征上加入即插即用残差适配器,并用Pullback Flatness Loss压平特征流形,使稀疏锚点间可线性插值重构。在NCLT跨季节、100m稀疏锚点实验中,平均MRR由0.697提升到0.872;但EM中的锚点选择部分更偏概念化,实际增益归因仍需更多消融支撑。

Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference Figure 1
2026-06-02cs.CV

Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference

Hyeonwoo Cho, DongHyeon Baek, Yewon Kim, Bumsub Ham

2026-06-02视觉语言

为降低多模态大模型中大量视觉 token 带来的显存与时延开销,本文指出现有视觉 token 削减会破坏原序列的位置关系并削弱视觉注意力,导致视觉 grounding 变差。RESTORE 保留原位置索引,并按相对距离校准注意力,同时用兼顾代表性与区分性的锚点选择改进 token 合并。多基准实验显示,该方法可稳定提升多种 VTR 策略精度,在保持推理效率的同时达到更好的平均表现。

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs Figure 1
2026-06-02cs.CV

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

School of Computing and Information Systems, The Uni-, rely on bias-aware objectives but require labelled supervi-, sampling to capture variations across both labels and spu-, no access to spurious attribute labels at test time., augmenting text prompts with hierarchical label information, ture. In TIE, it is assumed that the spurious labels of the, test images are available. To relax this assumption, TIE*, labels.

2026-06-02视觉语言

本文针对零样本 CLIP/VLM 容易把背景、医院标记等高频上下文当作类别依据的问题,指出其根源与嵌入空间的各向异性和局部密度不均有关。方法 DAT 用小规模均衡参考集估计组级相对密度,并据此重标定图文相似度,无需微调、提示改写或测试时伪属性标签。理论上用 Kent 分布解释其接近贝叶斯判别;实验显示在多个虚假相关基准和 VLM 上提升最差组与平均准确率。

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions Figure 1
2026-06-02cs.SD

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang

2026-06-02视觉感知

针对现有视频配乐模型多面向短片、难以在多场景长视频中保持叙事连续的问题,JenBridge将长视频切分为语义片段,用基于MMDiT与flow matching的文本-视觉双条件模型生成分段音乐,并由LLM代理在多种转场工具中选择衔接方式。论文还提出LVS长视频配乐基准,实验显示其在音乐质量、视听对齐、转场自然度和整体连贯性上优于既有方法。

Spatio-Temporal Correlation Guided Geometric Partitioning for Versatile Video Coding Figure 1
2026-06-02cs.CV

Spatio-Temporal Correlation Guided Geometric Partitioning for Versatile Video Coding

Xuewei Meng, Chuanmin Jia, Xinfeng Zhang, Shanshe Wang, Siwei Ma

2026-06-02视觉感知

本文针对 VVC 几何划分虽能刻画运动边界、但需传输划分模式和两路运动候选索引导致开销偏高的问题,提出 STGEO:利用相邻块边缘与历史划分模式预测高概率几何模式,并按离线统计的候选选择概率自适应组织 merge 列表,使常用模式/运动信息用更少比特表示。实验显示,相比不含 GEO 的 VTM-8.0,在 RA 与 LDB 配置下平均码率分别降低 0.95% 和 1.98%。

MixerSENet: A Lightweight Framework for Efficient Hyperspectral Image Classification Figure 1
2026-06-02cs.CV

MixerSENet: A Lightweight Framework for Efficient Hyperspectral Image Classification

Mohammed Q. Alkhatib, Swalpa Kumar Roy, Ali Jamali

2026-06-02视觉感知

针对高光谱分类中标注有限、Transformer/3D-CNN计算开销大的问题,MixerSENet用PCA降维后对图像块进行轻量混合:以多尺度深度卷积解耦空间与通道特征,并加入SE重标定光谱通道。模型仅约5.3万参数,在Houston13和Qingyun上OA达82.47%和96.70%,超过多种CNN、Transformer与Mamba基线,但具体消融增益仍需看全文细节。

Learning Label-Efficient Interpretable Medical Image Diagnosis via Semi-supervised Hypergraph Concept Bottleneck Model Figure 1
2026-06-02cs.CV

Learning Label-Efficient Interpretable Medical Image Diagnosis via Semi-supervised Hypergraph Concept Bottleneck Model

Yijun Yang, Ruiqiang Xiao, Lijie Hu, Angelica I Aviles-Rivero, Yunzhu Wu, Jing Qin, Lei Zhu

Joy Future Academy, Tsinghua University, Sichuan University

2026-06-02视觉感知

面向医学影像中黑箱诊断难以被临床信任、概念标注昂贵且传统 CBM 忽略概念依赖的问题,论文提出半监督 HyperCBM:用概念级超图建模高阶临床概念关系,并用图像级超图生成更贴近医学域的动态伪标签。在新建 PAS 超声、公开乳腺超声和 SkinCon 皮肤镜数据上的实验显示,其在少量概念标签下提升概念识别与分类性能,并保持可解释推理。

Understanding Identity Continuity in Thermal Video through Scene-Level Consistency Figure 1
2026-06-02cs.CV

Understanding Identity Continuity in Thermal Video through Scene-Level Consistency

Wei-Chieh Sun, Gyungmin Ko, Heejae Kwon, Hsiang-Wei Huang, Jenq-Neng Hwang

Department of Electrical and Computer Engineering, Information Processing Lab, University of Washington, USA

2026-06-02视觉感知

热红外行人多目标跟踪中,外观线索弱、漏检和遮挡易造成轨迹碎片与身份切换。本文不追求更复杂的跟踪器,而是在 YOLOv8+SORT 基线上加入轻量身份修复,将身份连续性视为场景级时空一致性问题,通过短间隔重映射和保守的离线轨迹重连恢复 ID。消融显示主要收益来自长程重连,PBVS 评测中 IDF1 从 82.25 提升到 84.93 且基本保持 MOTA,阈值敏感性也较稳定。

RPCASSM: Robust PCA State Space Model For Infrared Small Target Detection Figure 1
2026-06-02cs.CV

RPCASSM: Robust PCA State Space Model For Infrared Small Target Detection

Pingping Liu, Aohua Li, Yubing Lu, Jin Kuang, Tongshun Zhang, Qiuzhan Zhou

2026-06-02视觉感知安全鲁棒

本文针对红外小目标在下采样和序列扫描中易丢失像素级边缘、主流视觉 SSM 难以兼顾精细定位与效率的问题,提出以 RPCA 低秩背景/稀疏目标先验引导的双分支 RPCASSM:BSSM 用空间探针扫描建模背景,TSSM 用可变形提示扫描聚焦目标区域,并通过协同反馈缓解前景背景失衡。实验在 NUDT-SIRST 与 IRSTD-1K 上显示其优于现有方法,说明结构性先验对边缘保持和鲁棒检测有效。

Physics-Aware Linearized ADMM and Its Unrolling Figure 1
2026-06-02eess.SP

Physics-Aware Linearized ADMM and Its Unrolling

Satoshi Takabe, Shunta Arai, Tadashi Wadayama

2026-06-02视觉感知

针对由 PDE 描述测量过程的逆问题,标准 ADMM 需反复调用可微 PDE 求解器导致开销高。论文将含 PDE 的子问题线性化,提出 PA-LADMM,使每轮仅需一次求解和梯度评估,并给出条件收敛保证;进一步用深度展开学习内部参数。在光纤压缩感知和各向异性扩散图像复原中,方法优于梯度类基线,展开训练带来额外提升。

Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment Figure 1
2026-06-02cs.CV

Restoring Initial Noise Sensitivity in Text-to-Image Distillation via Geometric Alignment

Huayang Huang, Ruoyu Wang, Jinhui Zhao, Wei Deng, Daiguo Zhou, Jian Luan, Yu Wu, Ye Zhu

2026-06-02视觉感知

论文指出,文本到图像蒸馏虽能加速采样,但点对点对齐会平滑教师映射,削弱初始噪声敏感性,进而损害基于噪声的控制与多样性。作者提出 GAD,通过匹配相对输入噪声的 Jacobian-vector product 来对齐师生局部几何响应。实验覆盖 SD2、PixArt-α、SANA 及三类蒸馏范式,显示其在布局控制、噪声检索和多样性上优于多种基线,同时基本保持图像保真度。

PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation Figure 1
2026-06-02cs.CV

PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation

Weixing Chen, Zhuoqian Feng, Yang Liu, Yexin Zhang, Yifan Wen, Yinghong Liao, Weichao Qiu, Guanbin Li, Liang Lin

2026-06-02三维

面向机器人操作仿真中桌面场景密集、层级关系复杂且训练数据常含碰撞的问题,PhyScene3D将生成改写为类人逐步搭建过程:用CTRC按锚点和3D AABB顺序化拓扑放置,再用PADA结合可微SDF与测试时优化把结果投影到物理可行流形。实验显示其语义准确性和物理有效性优于现有方法,场景级碰撞率较人工标注训练数据降低40%。

Conditional Collapse in Sign Language Production: A Diagnostic and a Scaling Argument Figure 1
2026-06-02cs.CV

Conditional Collapse in Sign Language Production: A Diagnostic and a Scaling Argument

Rui Hong, Jana Košecká

George Mason University

2026-06-02视觉感知

本文针对手语生成中 FID 与回译 BLEU 可能“变好但不忠实”的评估失真,提出用冻结运动自编码器潜空间的三类距离比诊断条件坍塌:初始姿态依赖、输出多样性与目标忠实度。作者在 How2Sign 的 14 个模型检查点上发现 τ3 忠实度始终未达成,且 FID 与忠实度无关;而同一扩散骨干在孤立词 ASL3DWord 上可取得较好 τ3,说明瓶颈可能主要来自句级配对数据规模。

Edge-directed geometric partitioning for versatile video coding Figure 1
2026-06-02cs.CV

Edge-directed geometric partitioning for versatile video coding

Xuewei Meng, Xinfeng Zhang, Chuanmin Jia, Xia Li, Shanshe Wang, Siwei Ma

2026-06-02视觉感知

针对 VVC 几何划分(GEO)虽能改善非矩形运动补偿、但 140 个候选模式需显式传索引导致码率开销的问题,论文提出在编解码端构建最可能模式(MPM)列表,并利用相邻空间块与时域共位块的边缘信息预测当前 CU 的物体边界,从而优先编码更可能的划分角度和距离。实验相对 VTM-6.0 在 RA、LDB 配置下平均获得 0.58% 和 1.00% BD-rate 降低,并改善边界视觉质量。

CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation Figure 1
2026-06-02cs.CV

CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation

Jinwon Ko, Keunsoo Ko, Chang-Su Kim

Korea University, The Catholic University of Korea

2026-06-02视觉感知

针对参考图调色中,风格迁移易过度偏色、滤镜方法又会保留或叠加输入原有色调的问题,CanonCGT将调色拆为“去风格化到中性 canonical pivot”和“按参考再调色”两步,并用3D LUT与双阶段训练结合预设监督和无配对自监督细化。实验显示其在多数据集上比现有写实风格迁移和滤镜迁移方法更稳定,结构保真与色调一致性更好。

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition Figure 1
2026-06-02cs.CV

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang

University of Science and Technology of China, Shanghai Jiao Tong University, Fudan University, Harbin Institute of Technology, Beihang University, Shanghai AI Laboratory, University of Science and Technology of China China, Shanghai Jiao Tong University China, Fudan University China, Harbin Institute of Technology China, Beihang University China, Shanghai AI Laboratory China

2026-06-02视觉感知

本文针对 flow 文生图模型用 GRPO 做偏好后训练时,为降低 rollout 成本只能用少量去噪步、导致奖励监督过于稀疏的问题,提出 Pave-GRPO:在保持少步 group sampling 的同时,将粗粒度状态转移按平均速度分解为等价的多段子轨迹,复用同一奖励向更密集时间步传播监督。实验在 FLUX.1-dev 上显示其在不同奖励设置下优于现有 GRPO 变体,改善全局布局与细节对齐,且不增加采样成本。

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs Figure 1
2026-06-02cs.CV

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

Abhishek Aich, Sparsh Garg, Vijay Kumar BG, Turgun Yusuf Kashgari, Manmohan Chandraker

† NEC Laboratories, America, USA, ‡ University of California, San Diego, USA

2026-06-02视觉语言

这篇论文针对驾驶 VLM 验证中大量 ODD 场景未被测试、失败率估计不可靠的问题,提出 SliceScorer 用“低覆盖稀有性”和“邻近已测失败风险”确定性排序待测切片,并由 SliceNav 用 LLM 编排查询、扩展 ODD 与评测流程但保持打分可审计。在 WiseAD、DriveMM、Cosmos 上,方法比 SliceFinder/SliceLine 更能发现高风险缺口且推荐更分散;K=5000 时相对 SliceFinder 在 DriveMM/Cosmos 上分别降低平均漏失失败风险 65%/71%。

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation Figure 1
2026-06-02cs.CV

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

Carnegie Mellon University, Nanyang Technological University

2026-06-02机器人视觉语言视觉感知

本文针对VLN-CE中VLM反复预测低层动作带来的监督歧义、短视决策和高推理成本,将导航统一改写为图像平面上的可通行像素 grounding:前进像素反投影为3D路标,转向/停止由图像外辅助区域表示,并配合可见性关键帧记忆、语义嵌入和坐标感知损失。在R2R-CE上达54.1% SR/52.5% SPL,平均每轮仅7.75次VLM调用,较直接动作预测约少6倍;RxR-CE也达到竞争性SOTA并展示实机可行性。

Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs Figure 1
2026-06-02cs.CV

Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo

2026-06-02视觉感知生成模型

针对扩散式说话人像生成难以实时交互、且常局限离线生成的问题,论文提出面向流式场景的音频驱动框架:用参考图引导的因果视频 VAE 将静态外观从动态信息中“剥离”以深度压缩,再用块级自回归 Rectified Flow Transformer 生成潜变量。实验显示其可生成任意长度视频,压缩率达 768,速度约 42 FPS,较现有扩散人像模型快 25 倍以上,画质与真实感相当或更优。

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval Figure 1
2026-06-02cs.CV

Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval

Xiang Fang, Wanlong Fang, Wei Ji, Tat-Seng Chua

Nanyang Technological University, Nanjing University, National University of Singapore, Nanyang Technological University Singapore Singapore, Nanjing University Suzhou China, National University of Singapore Singapore Singapore

2026-06-02视觉感知生成模型

针对语言引导视频时刻检索中,静态跨注意力难以刻画视频时间演化与文本语义的非线性对齐问题,论文将多模态融合类比为图灵反应-扩散过程,提出 RDMF:视频特征沿时间扩散以建模上下文,文本-视频反应放大相关片段并抑制噪声,并结合 Gray-Scott 模型与 DETR 式预测头。文中称初步实验在显著时刻定位上优于既有方法,但具体数据与增益来源在给定片段中未充分说明。

Self-Improving Small Object Grounding in LVLMs Figure 1
2026-06-02cs.CV

Self-Improving Small Object Grounding in LVLMs

Tianze Yang, Yucheng Shi, Ruitong Sun, Ninghao Liu, Jin Sun

University of Georgia

2026-06-02视觉语言

针对 LVLM 直接输出框时小目标定位明显弱于大目标的问题,论文提出利用模型内部注意力进行自改进:先多次采样候选框,再用仅基于注意力图的轻量 IoU 回归器筛选,进一步从关键层头的熵规律蒸馏出无需训练的 ACS-Free。COCO 和 Objects365 上,小目标定位最高提升约 19%,且无需微调或外部检测器,但需要白盒注意力访问并增加少量采样开销。

Exploiting Semantic and Pixel Representations for Ultra-Low Bitrate Image Compression Figure 1
2026-06-02cs.CV

Exploiting Semantic and Pixel Representations for Ultra-Low Bitrate Image Compression

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

2026-06-02视觉感知

面向带宽/存储极受限场景,论文指出现有极低码率压缩常在感知真实感与像素保真间失衡,易产生结构漂移。SPDiff采用一步扩散编解码器,引入VAE、失真导向与语义导向三编码器,并用失真感知粗重建提取像素和语义条件来约束扩散生成。实验显示其在低于0.03 bpp时优于多种SOTA,能同时提升感知质量和像素级 fidelity。

Paving the Way for Point Cloud Video Representation Learning Using A PDE Model Figure 1
2026-06-02cs.CV

Paving the Way for Point Cloud Video Representation Learning Using A PDE Model

Zhuoxu Huang, Zhenkun Fan, Jungong Han, Josef Kittler

2026-06-02视觉感知三维

点云视频的空间无序性使逐点跟踪和光流式时空建模不可靠,限制了动作理解等任务。论文提出 MotionPDE,将空间点随时间变化抽象为可求解的 PDE,并用时间/空间嵌入的对比学习约束求解过程,作为低开销即插即用模块增强现有骨干。实验显示其在端到端与自监督预训练中均提升 PSTNet、PST-Transformer 等模型,MSRAction-3D 上最高达 97.3%,跨到 UTD-MHAD 也有约 4.84% 增益。

EIVE: End-to-End Instance-Specific Visual Explanations for Detection Transformers Figure 1
2026-06-02cs.CV

EIVE: End-to-End Instance-Specific Visual Explanations for Detection Transformers

Jianlin Xiang, Yanshan Li, Linhui Dai

the Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University, and the Shenzhen Key Laboratory of Modern Communications and Information Processing, Shenzhen University, Shenzhen, China

2026-06-02视觉感知

针对目标检测中多实例解释依赖梯度或反复扰动、开销高且与模型内部推理不一致的问题,EIVE将DETR解码器交叉注意力视为实例级特征归因通路,并用跨层混合共识融合生成稳定紧凑的显著图;同时通过注意力感知联合训练约束注意力分布。COCO、ExDark和Cityscapes实验显示其解释质量接近或优于后验方法,并显著提升解释效率,且适用于多种DETR式检测器。

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation Figure 1
2026-06-02cs.CV

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

Singapore Management University, Fudan University, Princeton University

2026-06-02机器人视觉感知强化学习数据集/基准

这篇论文关注机器人视频世界模型从“看起来真实”走向可用于决策时的可信性缺口:现有评测多默认指令可行且安全。作者基于 DROID 构建 RoboTrustBench,覆盖正常、约束敏感、反事实和对抗四类场景,含 1207 个专家验证图像-指令对,并用六维十三项准则评估。对七个模型的人工与 MLLM 评测显示,模型虽常能生成连贯视频,但在约束推理、反事实 grounding、物理交互和拒绝不安全指令上明显不足。

TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning Figure 1
2026-06-02cs.CV

TLG: Temporal-Logic Grounding for Video Question Answering via Source-Annotation Reconstruction and Category-Targeted Reasoning

Ali Alavi

The Ohio State University

2026-06-02视觉语言视觉感知三维

本文针对 TimeLogic 视频问答中 VLM 近似把视频当帧集合、难以定位动作时间轴的问题,提出 TLG 三层方案:优先从生成基准的公开数据集标注重建动作时间线并符号执行时序逻辑,缺标注时用开源 VLM,并将其薄弱的选择题路由到 Gemini。结果显示测试准确率由 46.9% 提升到 71.37%,消融表明主要增益来自真实时序标注而非模型规模。

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis Figure 1
2026-06-02cs.CV

Effective Multi-sensor Conditioning for Street-view Novel-view Synthesis

Zhengfei Kuang, Adam Sun, Liyuan Zhu, Tong Wu, Shengqu Cai, Jonathan Tremblay, Iro Armeni, Ehsan Adeli, Lior Yariv, Gordon Wetzstein

2026-06-02视觉感知

本文针对车载街景新视角合成中目标轨迹远离原始行驶路径时,单靠重投影 LiDAR 易变稀疏、导致扩散模型退化的问题,提出 StreetNVS,将稀疏 LiDAR、环视参考图像与相机位姿作为互补多传感器条件,并用基于相对射线位置编码的 Reference-Enhanced Camera Attention 融合外观与几何,再通过两阶段课程训练适应 LiDAR 稀疏性。在 Waymo Open Dataset 上,其在稀疏点云条件下超过现有方法,并可匹配依赖 10–100 倍更密点云的基线,支持抬升、换道、后撤和旋转等极端轨迹视频合成。

FLAME: Physics-Guided Neural Operators for Onboard Satellite Methane Detection in Hyperspectral Imagery Figure 1
2026-06-02cs.CV

FLAME: Physics-Guided Neural Operators for Onboard Satellite Methane Detection in Hyperspectral Imagery

Junhyuk Heo, Junhwan Park, Sancheol Sim, Beomkyu Choi, Woojin Cho

2026-06-02视觉感知

面向卫星高光谱甲烷监测的数据下传与星上算力瓶颈,FLAME把Beer–Lambert吸收与对数域匹配滤波的内积结构嵌入网络,用傅里叶神经算子逐像素估计背景和白化目标谱,避免全局协方差迭代。在STARCOP上其F1领先各类方法,小羽流优势明显,较最强神经基线像素级误报降近3倍,并以较少参数满足Jetson类星载硬件时延预算。

Deformable Wiener Filter for Future Video Coding Figure 1
2026-06-02cs.CV

Deformable Wiener Filter for Future Video Coding

Xuewei Meng, Chuanmin Jia, Xinfeng Zhang, Shanshe Wang, Siwei Ma

2026-06-02视觉感知

该文针对 VVC 环路滤波主要依赖局部相似性、非局部滤波又常因无监督估计与复杂度受限的问题,提出可变形 Wiener 滤波器,将局部邻域与非局部相似样本按噪声和样本特征分组后自适应融合,并用 Wiener 理论监督求解系数及约束异常值。相较 VTM-11.0,AI、RA、LDB 平均节码率分别为 1.16%、1.92%、2.67%,但快速实现仍带来千级解码时间增量。

$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer Figure 1
2026-06-02cs.CV

$\text{VG}^2$GT: Voxel-Gaussian Splatting Visual Geometry Grounded Transformer

Yibin Zhao, Yihan Pan, Jun Nan, Wenli Yang, Liwei Chen, Jianjun Yi

East China University of Science and Technology, Shanghai, Shanghai Open University, Shanghai, Shanghai Xiaoyuan Innovation Center, Shanghai

2026-06-02三维

针对现有 3DGS 重建依赖相机位姿、逐场景优化,以及免位姿前馈方法中像素对齐高斯易产生分布不均和跨视角伪影的问题,VG²GT 将冻结的视觉基础模型与可微多尺度体素模块结合,从体素特征而非像素直接拆分回归高斯,并用随机实体体渲染监督深度。实验称其在 DTU、Replica、TAT、ScanNet 上提升几何重建和新视角合成质量,同时显著降低训练成本。

PINNOCHIO: Physics-Informed Neural Network for Coupled Hyperelastic Interface-Volume Simulation in Orthognathic Surgery Figure 1
2026-06-02eess.IV

PINNOCHIO: Physics-Informed Neural Network for Coupled Hyperelastic Interface-Volume Simulation in Orthognathic Surgery

Jungwook Lee, Daeseung Kim, Kevin Gu, Zhangfeng Hu, Tianshu Kuang, Finn Hopeman, Michael A.K. Liebschner, Jaime Gateno, Pingkun Yan

2026-06-02视觉感知

该文面向正颌手术中软组织响应仿真,针对 FEM 过慢、纯深度模型缺少生物力学一致性的问题,提出 PINNOCHIO:将骨—软组织界面的不连续位移预测与体积内超弹性传播顺序解耦,并用物理约束支持仅外表面监督的 sim-to-real 适配。40 例临床数据上,其表面精度和物理有效性优于基线,并相对 FEM 显著提速。

Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation Figure 1
2026-06-02cs.RO

Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation

Xiang Fang, Wanlong Fang, Changshuo Wang

School of Software Engineering, Huazhong University of Science and Technology, Nanyang Technological University, Singapore, University College London

2026-06-02机器人视觉语言视觉感知

针对连续环境视觉语言导航中长程任务易受场景理解不足、静态地图依赖和低层控制不稳影响的问题,论文提出 HSAN:用 VLM 动态构建对象—区域—分区的层次语义场景图,以最优传输进行兼顾语义相关性与可达性的拓扑目标选择,并用图感知强化学习执行子目标。文中声称在多个 VLN-CE 数据集上达到 SOTA、提升成功率和未见环境泛化,但关键片段未给出具体指标,增益幅度需看完整实验表。

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning Figure 1
2026-06-02cs.CV

Attention-guided Fine-tuning of Multimodal Large Language Models Improves Chain-of-Thought Reasoning

Sanchit Sinha, Guangzhi Xiong, Bohan Liu, Zhenghao He, Aidong Zhang

University of Virginia

2026-06-02视觉语言

这篇论文针对多模态大模型中 CoT 提示常不如直接回答的问题,指出关键失败来自过早锁定答案和推理阶段对视觉 token 访问不足。作者提出无需改架构的 Attentive-CoT 微调目标,同时惩罚早承诺并鼓励持续视觉注意。六个 MLLM、三个视觉推理基准上,相比常规 CoT-SFT 提升 CoT 准确率,并改善反事实视觉依赖与 OOD 表现。

ForestMamba: Sparse Mamba with Geometry-guided Queries for 3D Forest Point Cloud Segmentation Figure 1
2026-06-02cs.CV

ForestMamba: Sparse Mamba with Geometry-guided Queries for 3D Forest Point Cloud Segmentation

Trung Thanh Nguyen, Tuan-Anh Vu, Duc Viet Le, Yasutomo Kawanishi, Takahiro Komamizu, Ichiro Ide, Teja Kattenborn

2026-06-02视觉感知三维

面向森林激光雷达点云规模大、采样不均、树冠重叠且 Transformer 注意力难扩展的问题,ForestMamba 将森林垂直结构先验融入稀疏编码、CHM 几何引导查询初始化与 Mamba 查询解码,用线性状态空间建模替代二次注意力。在七个地区实验中,其语义与实例分割均优于基线,推理约快 3 倍、显存约降 2.3 倍。

PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images Figure 1
2026-06-02cs.CV

PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images

Yuan Zhang, Jiahao Xia, Junzhang Huang, Meng Wang, Feng Chen, Guanyu Yang, Huazhu Fu

2026-06-02视觉语言视觉感知

针对多模态病理图像中外观差异大、但细胞拓扑和组织边界等结构需保持一致的问题,PathAR 将结构与外观显式拆成双 VQ token,并用非对称可见性的交错自回归 Transformer 强制先生成结构、再渲染外观。实验显示其在结构一致性、模态保真度和多样性上优于基线,生成的对齐图像—掩码还能提升低数据分割表现。

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics Figure 1
2026-06-02cs.GR

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics

Žiga Kovačič, Kevin Ellis

Cornell University

2026-06-02强化学习

本文关注从短视频推断物理规律并外推未来这一世界模型难题,构建含流体、沙雪、可变形体、发射器等2D MPM仿真数据集,配套代码、配置和视频,用于对比生成仿真代码的VLM与直接续帧的VDM。结果显示二者互补:代码生成长时域更稳定但难从视觉恢复几何和参数,视频扩散更擅长外观/布局却易产生不合物理的长期动态,指向视觉状态估计与显式动力学结合的混合方案。

PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder Figure 1
2026-06-02cs.CV

PaCX-MAE: Physiology-Augmented Chest X-Ray Masked Autoencoder

Yancheng Liu, Kenichi Maeda, Manan Pancholy

2026-06-02视觉感知

临床中胸片常是唯一可即时获得的模态,而单模态视觉预训练难捕捉心电、化验等生理状态。PaCX-MAE在MAE胸片编码器上,用配对ECG与实验室数据的冻结表征进行对比-预测式跨模态蒸馏,推理时仍只需胸片。九个基准显示其较领域MAE稳定提升,尤其在MedMod、VinDr等生理相关任务上增益明显,1%标注场景更省样本,同时分割性能基本不降。

MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes Figure 1
2026-06-02cs.CV

MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes

Ye Tao, Yuxin Yao, Kendong Liu, Dapeng Wu, Junhui Hou

2026-06-02三维

面向游戏、VR与4D资产生产中任意绑定模型难以自动生成动作的问题,MotionDreamer用视频条件扩散直接预测骨骼关节序列,并通过约2万带纹理、骨骼和动画的3D模型数据集,以及纹理/语义注入和双向视频-骨架融合来适配异构拓扑。实验称其在未见类别和复杂动作上优于现有方法;但部分增益可能主要来自 scaling / data。

On the Limits of Token Reduction for Efficient Unified Vision Language Training Figure 1
2026-06-02cs.CV

On the Limits of Token Reduction for Efficient Unified Vision Language Training

Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

University of Michigan

2026-06-02视觉感知

本文关注统一视觉语言模型同时做理解与生成时训练成本过高的问题,系统分析自回归 VLM 的逐层注意力后指出二者的视觉 token 冗余并不对称:理解任务在深层大量依赖文本而视觉 token 可裁剪,生成任务则始终依赖图像 token。作者据此设计任务特定加速器,单任务可显著省算,但联合训练中出现 synergy loss,破坏理解与生成的互利优化,说明高效统一训练需保留跨任务共享结构。

Splatshot: 3D Face Avatar Generation from a Single Unconstrained Photo Figure 1
2026-06-02cs.CV

Splatshot: 3D Face Avatar Generation from a Single Unconstrained Photo

Hao Liang, Zhixuan Ge, Soumendu Majee, Joanna Li, Ashok Veeraraghavan, Guha Balakrishnan

Rice University

2026-06-02三维

本文针对单张野外照片生成逼真且多视角一致的3D人脸头像难题,指出3DGS的几何一致性与2D扩散模型的真实感先验互补。SplatShot在无需训练的去噪过程中引入逐步3D反馈:用多视角预测重拟合3DGS,再将重渲染误差回传修正采样,并用噪声混合稳定早期引导。实验显示其在身份保持、真实感和视角一致性上优于多类基线,但速度较慢且发型、帽子和后视角仍受限。

Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering Figure 1
2026-06-02cs.CV

Perception First: A Frontier Native-Video Model with Self-Consistency for Implicit Video Question Answering

Ali Alavi

The Ohio State University

2026-06-02视觉感知

本文面向 ImplicitQA/VRR-QA 中单帧不可见、需跨帧推断的隐式视频问答,系统比较开源 Video-LMM 与多种推理时策略。核心洞察是该任务主要受限于低层视觉感知而非推理流程,复杂分解、布局提示和音频常无益甚至有害;原生视频输入加 5 次自一致投票最有效。最终 Gemini 3.1 Pro 达到 81.18% 测试准确率,超过此前最好 80.85%,接近非专家人类水平。

SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation Figure 1
2026-06-02cs.CV

SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation

Yingzi Ma, Xiaogeng Liu, Yawen Zheng, Chaowei Xiao

University of Wisconsin-Madison, Madison, Tsinghua University, 3 Johns Hopkins University

2026-06-02视觉感知数据集/基准安全鲁棒

本文关注图像条件文本到视频生成中的安全盲区:单独看似安全的起始图像与文本组合后可能诱导有害视频。作者提出 SafeGen-Bench,覆盖10类恶意风险,构建392组起始帧-提示对,并用GPT-4o与视频质量指标联合评估五个条件T2V模型及护栏。结果显示现有模型在高质量生成时仍会产生较高不安全分数,最高达44.5,且单模态文本或图像护栏在七类风险上失败率约80%。

UR-JEPA: Uniform Rectifiability as a Regularizer for Joint-Embedding Predictive Architectures Figure 1
2026-06-02cs.LG

UR-JEPA: Uniform Rectifiability as a Regularizer for Joint-Embedding Predictive Architectures

Triet M. Le

2026-06-02视觉感知

本文针对 JEPA/LeJEPA 用各向同性高斯正则防塌缩却违背流形假设的问题,提出以一致可整性约束嵌入分布:用高斯核平滑的 Carleson 损失和 Jones β 数刻画局部 n 维切空间,从而让表示保持低维几何结构。在 Inet10 上较 LeJEPA 提升 0.83 个百分点且种子方差约降 30%,在 Galaxy10、ImageNet-100、EuroSAT 精度相近但表示谱呈明显低秩;不过其理论最优性与增益来源仍未充分说明。

DENSER: Depth-Guided Ensemble with Staged EFA-GS Reconstruction for Soccer Novel View Synthesis Figure 1
2026-06-02cs.CV

DENSER: Depth-Guided Ensemble with Staged EFA-GS Reconstruction for Soccer Novel View Synthesis

Parthsarthi Rawat

2026-06-02三维

面向足球场景新视角合成中地面转播机位样本少、草地/看台等弱纹理区域几何不稳的问题,DENSER在EFA-GS上引入按相机高度加权的光度损失、Depth-Anything-V2伪深度约束,并通过分阶段训练后分叉出不同训练时长和尺度钳制策略的三模型像素平均集成。在SoccerNet-NVS五个测试场景上达到29.89 dB PSNR、0.791 SSIM、0.366 LPIPS,PSNR较3DGS和Triangle Splat分别提升约3.15/3.46 dB;但文中未充分说明各组件的独立增益。

Agent Skills Should Go Beyond Text: The Case for Visual Skills Figure 1
2026-06-02cs.CV

Agent Skills Should Go Beyond Text: The Case for Visual Skills

Binxiao Xu, Ruichuan An, Bocheng Zou, Hang Hua

Peking University, University of Wisconsin, MIT-IBM Watson AI Lab

2026-06-02视觉感知

论文指出,现有智能体技能库多把经验压缩成文本,在 GUI 操作、计数等视觉任务中会丢失空间边界、目标区域和中间状态。作者提出 Visual Skill,将文本逻辑与静态视觉先验、动态视觉工作记忆和图文交织证据绑定,并用 AutoVisualSkill 从轨迹自动生成。实验显示其在 GUI grounding 和视觉密集任务上稳定优于纯文本技能,尤其适合需要空间对应和状态跟踪的场景。

PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion Figure 1
2026-06-02cs.CV

PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion

Heyuan Gao, Bangxun Tang, Yiren Song, Guian Fang, Zijian He, Jie Yang, Mike Zheng Shou

Nanyang Technological University, University of California, Irvine, Show Lab, National University of Singapore, showlab/PAI-Studio, 60] have demonstrated exceptional scalability and high-

2026-06-02视觉感知

论文针对电影级视频换背景中前景有推、摇、跟拍等镜头运动时,现有方法易产生静态背景、边界闪烁、光照不一致和身份漂移的问题。PAI-Studio将任务建模为参考图条件的视频生成,用双向注意力的 in-context Diffusion Transformer 统一融合前景视频与1至3张背景参考,并通过时序位置编码克隆实现多帧背景控制;同时构建30K电影/在线视频数据集强化运动与重光照监督。实验显示其在1080P背景运动一致性、前景保持、光照和边界和谐上优于开源方法及商业API,但部分增益可能主要来自数据规模与筛选。

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing Figure 1
2026-06-02cs.CL

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

Minglai Yang, Xinyan Velocity Yu, Pengyuan Li, Xinyu Guo, Zhenting Qi, Konwoo Kim, Longtian Ye, Xiaolong Luo, Jinhe Bi, Henry Zhang, Haris Riaz, Xuan Zhang, Yunze Xiao, Bangya Liu, Tom Tang, Yunfei Zhao, Qunshu Lin, Zihan Wang, Minghao Liu, Michael Lingzhi Li, Yilun Du, Jesse Thomason, Rogerio Feris, Alex Pentland, Zexue He

Stanford University, Carnegie Mellon University, University of Southern California, Harvard University, University of Arizona, Duke University

2026-06-02数据集/基准

现有 OCR/文档解析基准多集中在常见版式,难以暴露 VLM 在专业长文档中的真实缺陷。Dr.DocBench 从多语种图书中按 52 个 BISAC 领域构建,并用多解析器失败/分歧采样挑选难页,提供 4,514 页、约 7 万个页面与块级标注,覆盖阅读顺序、层级关系、化学式、乐谱、复杂表格等结构。实验显示,管线解析器和通用 VLM 在既有基准上的强表现不能迁移到该设置,技术/符号类、Reference 与 Music 等领域及密集公式、颜色依赖表格仍明显失效。

Training-free image inversion for one-step diffusion models Figure 1
2026-06-02cs.CV

Training-free image inversion for one-step diffusion models

Tao Wu, Senmao Li, Yaxing Wang, Shiqi Yang, Kai Wang, Joost van de Weijer

2026-06-02视觉感知生成模型

针对一步扩散模型在真实图像反演中难以兼顾重建与可编辑性、且多步编辑反馈慢的问题,论文指出初始噪声是否接近高斯分布和文本-图像 caption gap 是关键瓶颈,提出无需训练的 TFinv,通过迭代噪声对齐、后缀提示学习和基于 mask 的局部编辑提升反演与背景保持。PIE-Bench 实验显示其一步编辑质量达到同类 SOTA,并在多轮编辑时显著快于多步方法。

BRo-JEPA: Learning Modular Arithmetic in Latent Space Figure 1
2026-06-02cs.LG

BRo-JEPA: Learning Modular Arithmetic in Latent Space

Divyansh Jha, Yuanfang Xie, Varan Mehra, Brennen Yu

Georgia Institute of Technology

2026-06-02视觉感知

本文用MNIST视觉数字的模10加法检验神经网络是在记忆训练操作还是学习抽象规则。核心做法是在JEPA潜在世界模型中引入块旋转预测器,把模运算的循环群结构直接约束为潜空间旋转,而非仅靠加性操作嵌入或MLP拟合。实验显示常规监督模型和普通JEPA难以严格零样本外推,BRo-JEPA在未见操作上达到约99.46%的零样本与rollout准确率,但结论仍局限于结构已知的受控任务。

ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo Figure 1
2026-06-02cs.RO

ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo

Guo Pu, Yixuan Han, Zhouhui Lian

2026-06-02三维

ActMVS瞄准机器人/UAV主动重建对低成本、轻量化感知的需求,试图摆脱深度相机依赖。其核心是在单目在线流程中用体素-帧可见性的视图因子图选择MVS参考帧,并通过全局深度优化约束跨视角一致性,从而生成可用于占据图和路径规划的稠密度量深度。Replica实验显示其重建质量可接近RGB-D主动重建基线,但运行开销仍高,实时机载部署仍是后续问题。

AlbedoEdit: Unified Instance-Level Video Editing with Albedo Guidance Figure 1
2026-06-02cs.GR

AlbedoEdit: Unified Instance-Level Video Editing with Albedo Guidance

Xilong Zhou, Bao-Huy Nguyen, Zheng Zeng, Jacob Munkberg, Jon Hasselgren, Thomas Leimkühler, Nima Kalantari, Miloš Hašan, Christian Theobalt

Max Planck Institute for Informatics, University of California Santa Barbara, Texas A & \& M University

2026-06-02视觉感知

面向实例级视频编辑中插入、移除、改纹理难以兼顾精细控制与光照一致性的问题,AlbedoEdit 将用户编辑的首帧反照率作为条件,驱动 DiT 扩散模型把源 RGB 视频生成目标视频,并用覆盖三类任务的合成配对数据训练。其洞察是反照率剥离高光、阴影等光照效应,更适合作为外观编辑接口;实验显示模型能补全高光、软阴影和镜面反射等效果,在定性和定量上优于对比视频编辑方法。

Diamonds in the Sky: Pareidolic Animals in Clouds Figure 1
2026-06-02cs.CV

Diamonds in the Sky: Pareidolic Animals in Clouds

Miriam Horovicz, Yacov Hel-Or, Yael Moses

Reichman University, Israel

2026-06-02视觉感知

本文关注人能在云中看见动物而现有检测器难以识别的视觉错觉问题。核心思路不是训练新检测器,而是用 SAM 分割云块,并以 MDDS 扩散在局部将云形轻微推向候选动物,再用可识别性与相似性筛选,同时通过从生成图回到原云的 morphing 视频引导人类感知。用户研究显示预测与人类选择相关,增强后召回率由 0.28 升至 0.55,F1 由 0.16 升至 0.39,接近其定义的最优基线 0.45。

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats Figure 1
2026-06-02cs.CV

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

Shangpin Peng, Gengluo Li, Xingyu Wan, Chengquan Zhang, Hao Feng, Binghong Wu, Huawen Shen, Weinong Wang, Ziyi Cai, Zhuotao Tian, Han Hu, Can Ma, Yu Zhou

LLM Department, Tencent, Shenzhen Loop Area Institute, Institute of Information Engineering, Chinese Academy of Sciences, Nankai University

2026-06-02数据集/基准

针对图表解析评测长期受限于类型覆盖窄、输出格式不统一且缺少打印/手绘真实场景的问题,本文提出双语基准 ChartArena,覆盖8类数值与图示图表、3种视觉场景,并用三元组/有向图语义空间实现格式无关评测。对26个MLLM的实验显示,闭源前沿模型总体领先,开源模型差距缩小;文档解析模型在数值图尚可但图示结构明显掉队,雷达图和手绘场景仍最难。

FreqLite: A Lightweight Frequency-Decomposed Linear Model with Adaptive Reversible Normalization for Robust Long-Term Time-Series Forecasting Figure 1
2026-06-02cs.LG

FreqLite: A Lightweight Frequency-Decomposed Linear Model with Adaptive Reversible Normalization for Robust Long-Term Time-Series Forecasting

Mirza Samad Ahmed Baiga, Syeda Anshrah Gillani

2026-06-02三维安全鲁棒

针对长时序预测中线性模型虽高效但 RevIN 难适应非平稳、固定时域分解不够自适应的问题,FreqLite 用可学习、无损的频域分带与逐带线性头保留高频信息,并提出带门控的 A-RevIN 按非平稳程度调整反归一化。实验显示其在标准 LTSF 基准上优于轻量模型,长 lookback 下以更少参数、显存和训练时间超过 PatchTST;但相对 RLinear 的常规增益较小,非平稳 ILI 上提升更明显。

HOLA: Holistic Multi-Modal Alignment for Open-Set 3D Recognition Figure 1
2026-06-02cs.CV

HOLA: Holistic Multi-Modal Alignment for Open-Set 3D Recognition

Koby Aharonov, Oren Shrout, Ayellet Tal

Technion – Israel Institute of Technology, Technion - Israel Institute of Technology

2026-06-02视觉感知三维

面向机器人等场景中稀有/未知物体的开放集3D识别,HOLA指出以单张图或单句文本对齐点云会限制整体形状理解。其核心是将点云同时对齐多视图图像和多文本,并用解耦多正样本对比损失分开正样本聚合与负样本竞争,另以轻量文本适配器缓解网页 caption 域差。实验在长尾 Objaverse-LVIS 等基准取得更高零样本性能和帧率,且参数量显著低于重型2D-ViT方案。

DeblurNVS: Geometric Latent Diffusion for Novel View Synthesis from Sparse Motion-Blurred Images Figure 1
2026-06-02cs.CV

DeblurNVS: Geometric Latent Diffusion for Novel View Synthesis from Sparse Motion-Blurred Images

Changyue Shi, Wangbo Yu, Chaoran Feng, Li Yuan

2026-06-02视觉感知生成模型

针对实际采集中运动模糊会破坏稀疏视图的纹理细节与跨视角几何对应、而现有去模糊 NVS 多需逐场景优化的问题,DeblurNVS 将去模糊放到几何感知潜空间:先恢复上下文几何 latent,再结合目标相机用扩散生成目标视图 latent 并解码清晰图像。作者还构建 DL3DV-10K-Blur 大规模训练集;实验显示其在合成模糊与真实模糊场景中较基线更锐利、结构更稳定,但推理较慢且可能产生幻觉细节。

ResNet-34 with Lightweight Decoder for Accurate and Efficient Segmentation of Fetal Brain MRI Figure 1
2026-06-02eess.IV

ResNet-34 with Lightweight Decoder for Accurate and Efficient Segmentation of Fetal Brain MRI

Ashiqur Rahman, Muhammad E. H. Chowdhury, Md. Abu Sayed, Md. Sharjis Ibne Wadud, Abu Naser Md. Arafat, Mehedi Hasan Prince

Department of Electrical Engineering, College of Engineering, Qatar University, Doha, Qatar. Email:, Department of Biomedical Engineering, Jashore University of Science and Technology, Jashore, Bangladesh. Email:, baseline architectures such as UNet, UNet++, DeepLabV3, and DeepLabV3+, achieving an average Accuracy of

2026-06-02视觉感知

针对胎儿脑 MRI 中运动伪影、低组织对比度和孕周解剖差异导致的多组织分割不稳定问题,论文提出以 ResNet-34 做层级特征编码、MLP 轻量解码并用双线性上采样降低计算量的模型。其核心取舍是用较浅残差骨干和精简解码器兼顾边界保真与临床实时性。在 FeTA 2021 五折验证中,模型优于 UNet、UNet++、DeepLabV3/+,达到 97.37% Accuracy、90.33% Dice、86.93% IoU 和 90.83% Precision。

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning Figure 1
2026-06-02cs.CV

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

Garvin Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong

Shanghai Innovation Institute

2026-06-02视觉感知

针对“连续潜在视觉 token 是否真的存储视觉证据”的疑问,论文将其拆成潜在槽、边界标记和格式三部分,并设计 MVH 作为有利于槽内容的诊断探针。结果显示,在多设置和感知基准上,槽内容对答案弱因果、难以恢复缺失图像信息;仅保留边界标记即可保留 78–100% 增益,说明收益主要来自标记、格式和更聚焦的图像注意力,而非可读视觉记忆。

Knowledge-Intensive Video Generation Figure 1
2026-06-02cs.CV

Knowledge-Intensive Video Generation

Chenxu Wang, Mingda Chen

Fudan University, Shanghai Jiao Tong University, The code and supplementary materials are available at

2026-06-02视觉感知

论文指出现有文生视频评测过度关注画质,难以衡量教学、解释类信息检索场景中的事实正确性与实用性。作者提出知识密集视频生成 KIVI,构建含1080个短提示的 KIVI-Bench,并设计事实性与有用性自动指标。人评显示这些指标更贴近人工判断;七个先进模型测试表明,闭源模型最好但仍显著落后人类,主要短板在视觉属性、流程操作和信息呈现清晰度。

KG-FairDiff: Knowledge Graph-Guided Prompt Refinement for Demographically Fair Text-to-Image Generation Figure 1
2026-06-02cs.CV

KG-FairDiff: Knowledge Graph-Guided Prompt Refinement for Demographically Fair Text-to-Image Generation

Farbod Davoodi, Seyed Reza Tavakoli Shiyadeh, Pooria Safaei, Sana Harighi, Parsa Gholami, Amirali Amini, Kimia Vanaei, Emad Firoozi, Parham Abed Azad, Babak Khalaj, Siavash Ahmadi, Amir Hossein Payberah, Mohammad Hossein Rohban, Soheil Kolouri, Ali Diba

2026-06-02视觉感知

该文关注文本到图像模型在职业与文化场景中放大性别、种族、年龄和非西方文化刻板印象的问题。KG-FairDiff将去偏置放在推理期提示词改写:用约1200条文化/偏见知识图谱三元组检索上下文,LLM生成改写,并由验证器只接受降低公平性散度且保持语义相似的提示。实验审计8个生成器,报告在多维与交叉人口属性上显著降低Bias-W、提升ENS,同时基本保持CLIP语义一致性;但验证器校准、分类器偏差和知识图谱覆盖仍文中承认不足。

Event-Based Vision in Space: Applications, Trends, and Future Directions Figure 1
2026-06-02cs.CV

Event-Based Vision in Space: Applications, Trends, and Future Directions

Luigi Capogrosso, Pietro Bonazzi, Michele Magno

2026-06-02视觉感知

针对事件相机在空间/对地观测中的研究分散、传统帧相机又受运动模糊、功耗和冗余数据限制的问题,本文用 PRISMA-light 从 90 篇筛到 18 篇核心文献,提出四类应用 taxonomy:高速大气观测、环境变化检测、星上处理与任务支持、地理建模预测。主要结论是事件视觉结合脉冲网络可降低带宽与能耗、支持微秒级感知和边缘自治,但大规模在轨验证与工程化挑战仍未充分解决。

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance Figure 1
2026-06-02cs.RO

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura

2026-06-02视觉感知

针对突发横穿行人中帧式视觉易受延迟、运动模糊和光照影响的问题,DeepIPCv3将LiDAR的3D几何与DVS事件流融合,并用类Transformer跨模态注意力动态权衡高速变化与场景结构,再输出局部航点和控制指令。论文在自采昼夜多模态数据上离线评估,报告其轨迹与控制误差低于对比方法,能更稳定触发避让或刹停;但安全性仍主要由离线模仿结果支撑,在线实车验证文中未充分说明。

Exploiting In-Sensor Computing for Energy-Efficient Earth Observation Figure 1
2026-06-02cs.CV

Exploiting In-Sensor Computing for Energy-Efficient Earth Observation

Luigi Capogrosso, Pietro Bonazzi, Loris Hoxhaj, Michele Magno

2026-06-02视觉感知

针对立方星地球观测中原始影像下传带宽有限、OBC 资源和能耗受限的问题,论文将 TinyML 推理前移到 Sony IMX500 智能视觉传感器内,结合静态图追踪与 INT8 量化部署 SqueezeNet、ShuffleNetV2、MCUNetV1 等模型,在 EuroSAT 上平均精度达 96.68%,满足 8MB 约束,并实现约 17.40 FPS、27.43 ms 延迟和 14.19 mJ/次推理,显示传感器内早期筛选可降低无效数据传输与主板负载。

Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration? Figure 1
2026-06-02cs.CV

Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?

Liyang Li, Muzhi Zhu, Zhiyue Zhao, Hengyu Zhao, Ke Liu, Linhao Zhong, Hao Chen, Chunhua Shen

Zhejiang University

2026-06-02视觉感知

论文关注基础模型能否像人一样通过移动身体和转动视角主动复现目标图像,而非只做静态空间理解。作者提出TVR任务与TVRBench,要求智能体闭环比较当前视角和目标视角并执行动作,揭示现有开闭源模型成功率仅7.8%/12.0%,主要卡在多轮视觉历史利用和将视角差异转成平移。后训练中视觉-动作SFT把9B模型提升到50.8%,多轮GRPO小幅到51.4%,但CoT和单轮GRPO反而损害闭环表现。

Differing Roles of Leisure and Productivity in GDP - A Machine Learning based comparative analysis of Germany and USA Figure 1
2026-06-02econ.GN

Differing Roles of Leisure and Productivity in GDP - A Machine Learning based comparative analysis of Germany and USA

Achintya Ranjan, Uma Ranjan

2026-06-02视觉感知

本文关注在工作时长下降、生产率提升背景下,德国与美国 GDP 增长机制是否不同。作者用总工作时长和全要素生产率替代传统资本—劳动设定,训练随机森林并结合 Gini、SHAP 和偏依赖解释特征作用。结果显示两国关系高度非线性:德国 GDP 仍受劳动时长影响,美国几乎主要由生产率驱动;地缘事件等会降低预测可靠性。

Analysis of Ethnic Disparities in Autism Spectrum Disorder among Toddlers Figure 1
2026-06-02cs.CV

Analysis of Ethnic Disparities in Autism Spectrum Disorder among Toddlers

Aadithya Prabha Ramaharsha, Deevna Reddy, Uma Ranjan

2026-06-02视觉感知

论文关注幼儿 ASD 筛查中不同族群表现和诊断差异,动机是现有 Q-CHAT 等行为量表可能受文化、人口学和健康因素影响。其核心洞察是用多变量逻辑回归同时控制行为题项、性别和新生儿黄疸后,族裔差异才显现。结果显示相较亚洲儿童,白人欧洲儿童 ASD 风险约升高 81%,中东儿童约降低 79%,男性和新生儿黄疸也是显著风险因素。

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs Figure 1
2026-06-02cs.CV

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

Wentao Mo, Yang Liu

2026-06-02三维

论文针对3D空间推理中“神经符号方法可解释但封闭、3D MLLM开放但黑箱”的矛盾,提出APEIRIA:将符号程序的执行轨迹蒸馏为自然语言CoT,并通过感知对齐、CoT-SFT和基于结果监督的CoT-RL,把推理模式扩展到开放词汇和复杂嵌套指令。实验显示其在grounding、问答和描述任务上超过既有NS3D方法,并接近或匹配主流3D MLLM,同时保留可追踪推理过程。

TECCI: Tricky Edits of Collected and Curated Images Figure 1
2026-06-02cs.CV

TECCI: Tricky Edits of Collected and Curated Images

Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe, Sherry Ben, Jason Baldridge

2026-06-02视觉感知

现有文本引导图像编辑在复杂指令、最小改动和画质保持上仍不稳定,TECCI因此构建了由作者新采集、覆盖7类场景和5类编辑的7550个高难样本,并结合人工与Gemini自动评分评测5个主流模型。结果显示所有模型总体成功率均低于22%,Nano Banana Pro最佳;模型更会“听指令”,但在不破坏原图和保持质量上明显不足,建筑、自然、推理和创意编辑尤为困难。

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning Figure 1
2026-06-02cs.CV

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

Zhiqiang Zhou, Xuezhen Xie

[Hunan Chemical Industry Vocational and Technical College]

2026-06-02视觉语言

本文针对多模态系统中交叉注意力与特征拼接常凭经验选择的问题,提出“特征对齐质量决定融合策略”的观点,并用样本复杂度解释两者差异:已由 CLIP 对齐的视觉语言特征更适合低参数、低样本需求的拼接。Flickr8k 实验显示,在 2048–16384 样本下拼接较交叉注意力高 4.1–5.1 个百分点;未对齐 ResNet18 特征下则交叉注意力占优,但结论仍主要受限于单一数据集和二分类设置。

PairedGTA: Generating Driving Datasets for Controlled Photometric Shift Analysis Figure 1
2026-06-02cs.CV

PairedGTA: Generating Driving Datasets for Controlled Photometric Shift Analysis

Andrea Chianese, Giulio Rossolini, Alessandro Biondi, Marco Cococcioni, Giorgio Buttazzo

University of Pisa, DII, Pisa, Italy

2026-06-02规划控制数据集/基准

自动驾驶感知在夜间、雨雾等光照/天气变化下会退化,但真实“同场景不同条件”数据常混入视角、交通参与者和遮挡变化,难以归因。PairedGTA 利用 GTA V 引擎固定几何、相机位姿及动态目标身份与位置,仅改变光照和天气,生成像素对齐的反事实驾驶图像。实验以语义分割模型的跨条件自一致性为例,显示该受控数据比真实恶劣天气数据更能隔离光度偏移带来的性能变化。

Reusing Fusion-Time Spectral Reliability for Adaptive Fusion and Expert Routing in RGB-Infrared Object Detection Figure 1
2026-06-02cs.CV

Reusing Fusion-Time Spectral Reliability for Adaptive Fusion and Expert Routing in RGB-Infrared Object Detection

Yefeng Wu

2026-06-02视觉感知

这篇论文针对 RGB-红外检测中“融合结果被保留、融合是否可靠却被丢弃”的问题,提出将傅里叶交互中得到的能量、幅值、相位一致性和跨模态相关性压缩为无参数 7 维谱可靠性描述子,并复用于融合门控与 MoE 专家路由。实验显示,相比内容驱动门控/路由,该可靠性信号带来更大边际收益;在 DroneVehicle 六类退化下平均保持率达 95.0%,自然昼夜划分上 mAP50 提升约 +5.2/+5.3。

Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends Figure 1
2026-06-02cs.CV

Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends

Jiuming Liu, Chaojun Ni, Mengmeng Liu, Chensheng Peng, Fangjinhua Wang, Sitian Shen, Marc Pollefeys, Masayoshi Tomizuka, Ayush Tewari, Per Ola Kristensson

2026-06-02视觉感知强化学习数据集/基准

本文动机是交互式世界模型快速进入游戏、自动驾驶和机器人等场景,但缺少统一梳理。核心洞察是把动作条件视频/3D生成视为世界状态转移问题,并围绕动作可控性、长程一致性与记忆、实时响应三类瓶颈建立分类。主要结果是汇总趋势、基准与指标,覆盖开放世界探索、游戏引擎、自动驾驶和具身AI;作为综述无新模型实验,性能增益来源不涉及。

HiTokSR: A Coarse-to-Fine Tokenizer with Hierarchical Codebooks for High-Fidelity Real-World Image Super-Resolution Figure 1
2026-06-02cs.CV

HiTokSR: A Coarse-to-Fine Tokenizer with Hierarchical Codebooks for High-Fidelity Real-World Image Super-Resolution

Mingxi Li

2026-06-02视觉感知强化学习

现有 VQ 超分方法用单一码本同时编码结构与纹理,导致容量利用低且高维检索不稳定。HiTokSR 将潜空间按通道划分为频率感知的层级子码本,粗到细分离全局结构和细节纹理,并结合视觉基础模型语义调制、对齐损失及索引扰动微调提升鲁棒性。真实超分基准上,文中报告其在感知质量和重建保真度达到 SOTA,同时保持单次前向推理效率。

CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection Figure 1
2026-06-02cs.CV

CoSTL: Comprehensive Spatial-Temporal Representation Learning for Moment Retrieval and Highlight Detection

Xin Dong, Wenjia Geng, Wenfeng Deng, Yansong Tang

Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory

2026-06-02视觉感知

这篇论文针对视频片段检索与高光检测中仅依赖帧级特征、忽视查询相关的帧内细节和跨帧动态的问题,提出 CoSTL:先用文本驱动的渐进式细粒度图像编码器从空间 patch 中抽取相关视觉信息,再通过多尺度时间感知模块建模粗细粒度动作变化。实验在 QVHighlights、Charades-STA、TACoS 和 TVSum 上超过已有方法,但具体增益与模型规模、特征预训练的关系文中仍需进一步拆解。

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers Figure 1
2026-06-02cs.CV

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Naoaki Okazaki

♡ \heartsuit Institute of Science Tokyo

2026-06-02数据集/基准

针对图表/表格 VQA 基准长期偏英语、日语 JGraphQA 规模小且趋于饱和的问题,论文提出从日本政府白皮书规模化构建 HakushoBench:覆盖 33 份白皮书、2053 张真实图表/表格、10 余类图像,并人工设计需整体理解和多跳推理的问答。实验显示其显著更难,最佳开源模型仅 58.6%,与最佳闭源模型相差 34.9 个百分点,暴露开源 VLM 在复杂日语图表理解上的短板。

STARFISH: faST Accuracy Recovery in pruned networks From Internal State Healing Figure 1
2026-06-02cs.LG

STARFISH: faST Accuracy Recovery in pruned networks From Internal State Healing

Shir Maon, Odelia Melamed, Adi Shamir

2026-06-02视觉感知

大模型剪枝虽能降低视觉模型的推理成本,但高稀疏度后精度恢复通常依赖昂贵微调或训练数据。STARFISH将剪枝后修复视为“内部状态愈合”,只用少量无标注校准样本,让稀疏模型各层中间表征与原密集模型方向对齐,并且不绑定特定剪枝方式或结构。实验显示其在ViT、MobileNet等图像分类模型上优于CORP等方法,50%剪枝时最高接近99.8%密集精度保留,75% DeiT-B剪枝可恢复82%原精度,高稀疏度优势更明显。

Rank-Aware Quantile Activation for Motion-Robust Crop Segmentation in UAV Imagery Figure 1
2026-06-02cs.CV

Rank-Aware Quantile Activation for Motion-Robust Crop Segmentation in UAV Imagery

Abinav Kiran, Sravan Danda, Aditya Challa, Sougata Sen, Daya Sagar B S

2026-06-02视觉感知安全鲁棒

本文针对高速无人机农田成像中的 6-DOF 运动模糊会抹除杂草簇、端行等稀有纹理类信号的问题,将分割网络的 ReLU 替换为带实例级秩归一化的 Dual QAct 残差激活,以保留模糊后特征的相对排序。基于 Agriculture-Vision 2021 和物理模糊模拟,QAct 在零样本与模糊蒸馏训练下均提升 mIoU,零样本相对增益约 37%–66%,且与蒸馏互补,但部分类别表现仍有波动。

R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking Figure 1
2026-06-02cs.CV

R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking

Zixu Li, Yupeng Hu, Zhiheng Fu, Zhiwei Chen, Weili Guan, Liqiang Nie

Shandong University, Harbin Institute of Technology (Shenzhen)

2026-06-02视觉感知三维

论文针对组合视频检索中“参考视频+文本修改”难以同时保持原上下文并捕捉隐含变化的问题,提出零样本 R³ 流程:先用 Qwen3-VL 生成目标侧推理轨迹,再将基础查询与推理增强查询做一致性门控残差融合召回,最后仅对候选池成对重排。实验称在 CoVR-R 挑战中有效,但具体指标与消融增益在给定片段中未充分说明。

Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA Figure 1
2026-06-02cs.CV

Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

Southeast University, National University of Singapore, University of Science and Technology of China‌

2026-06-02视觉感知

本文针对 TimeLogicQA 中视频问答容易把时序关系交给端到端直觉判断、从而混淆事件顺序与状态持续的问题,提出 Temporal Evidence Routing:先解析问题与时序算子,再按视频长短构造全帧或候选窗口证据,由 VLM 生成结构化事件区间,最后用确定性规则和保守融合给出答案。官方测试 AvgAcc 达到 81.8,但文中对各模块相对增益说明有限。

Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge Figure 1
2026-06-02cs.CV

Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

Southeast University, National University of Singapore, University of Science and Technology of China‌

2026-06-02视觉感知

VRR-QA要求模型在视频中判断空间、时间、深度、视角与遮挡等跨帧关系,单次视频问答容易压缩或误判关键证据。本文提出无需训练的自适应测试时推理:先直接作答,再用多视角找不稳定题,只对难例构建带时间戳的密集证据、关系探针和成对验证,并用风险门控决定是否改答案。最终测试AvgAcc达90.07、MacroAvgAcc达87.81,较直接Gemini提示的70.47有明显提升。

Dual-Route Top-K Retrieval with 1v1 VLM Reranking for the CoVR-R Figure 1
2026-06-02cs.CV

Dual-Route Top-K Retrieval with 1v1 VLM Reranking for the CoVR-R

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

Southeast University, National University of Singapore, University of Science and Technology of China‌

2026-06-02视觉语言

面向 CoVR-R 中仅靠文本相似度难以处理状态变化、时序与禁忌内容的问题,论文将组合视频检索拆成“高召回候选构造”和“谨慎替换 top-1”两步:先用 VLM 推理/槽位选择稳住文本种子,再用 DFN 接触表视觉检索补足 top-10,最后以 1v1 VLM 复核和致命错误共识控制晋升。隐藏测试报告最高 95.28 R@1、99.66 R@50,但结论处数值与摘要不一致。

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing Figure 1
2026-06-02cs.CV

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing

Sukhun Ko, Soo Ye Kim, Jihyong Oh

2026-06-02视觉感知

跨域图像合成需要在保留前景物体身份的同时匹配背景风格,现有免训练混合方法常停留在色调对齐并导致身份漂移、过度风格化或缺少阴影。Chameleon 构建大规模真实监督数据集,并用 JHCL 解耦风格/内容、以 STAG 在 DiT 中调控风格注入。实验称其优于同域、跨域方法及商业模型,在构图合理性和风格一致性上均有提升。

Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs Figure 1
2026-06-02cs.RO

Expanding Spatial and Temporal Context for Robotic Imitation Learning With Scene Graphs

Jianing Qian, Qinhe Peng, Emmanuel Panov, Leonor Fermoselle, Dinesh Jayaraman, Bernadette Bucher, Tarik Kelestemur

University of Pennsylvania, RAI Institute, University of Michigan

2026-06-02机器人模仿学习

这篇论文针对家庭/办公室等大尺度、长时序任务中机器人视野受限导致模仿学习策略遗忘历史信息的问题,提出把任务相关物体及其关系维护为动态场景图,并作为结构化显式记忆输入扩散策略等模型。该表示只保留关键对象的视觉嵌入、2D框和3D位置,可随交互增量更新。仿真移动操作和真实桌面实验显示,在需长期推理和部分可观测泛化的场景中成功率显著提升,但方法依赖准确物体识别,拥挤或强动态环境仍可能受限。

A Multiscale Network with Supervised Contrastive Learning for Real-Time Facial Emotion Recognition Figure 1
2026-06-02cs.CV

A Multiscale Network with Supervised Contrastive Learning for Real-Time Facial Emotion Recognition

Rejoy Chakraborty, Archisman Adhikary, Chayan Halder, Payel Rakshit, Sanchita Ghosh, Kaushik Roy

2026-06-02视觉感知

该文面向视频/咨询场景中表情随时间连续变化、单帧识别难以反映心理状态的问题,提出 MSFERNet:以 EfficientNet-B0 早期层为骨干,结合残差、多尺度卷积、CBAM 注意力和监督对比学习,并开发 RT-FER 实时监测界面。实验在重构的 FER13 三类情绪与 CK+ 等数据上报告优于对比方法,但具体增益来源可能同时受类别合并与数据处理影响。

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code Figure 1
2026-06-02cs.CV

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

University of Southern California

2026-06-02数据集/基准三维

面向用代码生成可编辑、可执行三维资产的需求,3DCodeBench试图弥补现有3D基准缺少程序代码、复杂几何与迭代评测的问题。其核心是从Infinigen整理26K文本/图像—代码—3D对象三元组、覆盖212类,并结合自动指标与3DCodeArena人类偏好Elo评测12个VLM。结果显示失败多来自API不匹配,即便可渲染也常有悬浮或断裂部件;更高思考预算和多轮反馈能提升表现,增益可能主要来自scaling和执行环境反馈。

TextFake: Benchmarking AI-Generated Image Detection on Text-Rich Images Figure 1
2026-06-02cs.CV

TextFake: Benchmarking AI-Generated Image Detection on Text-Rich Images

Yuning Zhang, Changtao Miao, Mingyu Liao, Tingyu Liu, Xinghao Wang, Tao Gong, Qi Chu, Nenghai Yu

School of Cyber Science and Technology, University of Science and Technology of China, Anhui Province Key Laboratory of Digital Security

2026-06-02视觉感知数据集/基准

针对伪造截图、文档和新闻页等文本密集图像在现有 AIGI 检测基准中缺位的问题,本文构建 TextFake:含 2 万张、28 种语言、两类场景和四类主题,并通过分布对齐的四阶段生成流程减少捷径。对 14 个检测器和 3 个前沿 VLM 零样本评测显示,最高准确率仍低于 80%,平均性能较自然图像基准大幅下降,失败主要来自高文本密度、渲染保真度提升和常见扰动导致的阈值崩塌。

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation Figure 1
2026-06-02cs.CV

Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation

Ziyue Lin, Jiahe Hou, Hongyu Xia, Xinrui Xie, Feifei Wang, Yuyin Zhou, Wei Wang, Jiawei Liu, Liangqiong Qu

The University of Hong Kong, Shenyang Institute of Automation, Chinese Academy of Sciences, The Chinese University of Hong Kong, University of California, Santa Cruz

2026-06-02视觉感知生成模型

面向多任务图像到图像翻译中域差大、配对数据少的问题,论文指出扩散噪声除流形提升外还能缩小跨域特征差距,但传统反向过程会同时去噪和去残差而提前削弱这一作用。DRDD将过程拆成目标域无配对数据训练的噪声扩散与固定噪声域内的确定性残差扩散,使语义映射始终受域协调保护;理论和实验表明其可兼容DDPM、DDIM和SDE框架,在有限配对数据下仍能实现较稳健的统一I2I翻译。

Ask4VG: Risk-Aware Question Selection for Reducing Prior-Driven Answers in Medical VQA Figure 1
2026-06-02cs.CV

Ask4VG: Risk-Aware Question Selection for Reducing Prior-Driven Answers in Medical VQA

Xiaorong Zhu, Qiang Li, Zibo Xu, Weijie Wang, Weizhi Nie

2026-06-02安全鲁棒

医学VQA中大量模板化问题容易让模型依赖语言先验而非影像证据,带来临床幻觉风险。Ask4VG将问题表述视为可控因素,通过原图、扰动图、空白图和错配图的反事实探测估计问题诱发风险,并用该风险重排保意图的改写问题。VQA-RAD上风险由0.658降至0.623,准确率由0.337升至0.356,PMC-VQA小样本外部检查也显示同向小幅增益。

Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation Figure 1
2026-06-02cs.GR

Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation

Zhicheng Zhang, Lei Wang, Yu Zhang, Yongsheng Gao

2026-06-02数据集/基准

针对音频驱动说话头评测过度依赖逐帧对齐、易把可接受的语速和相位差误判为质量问题,论文将评测重构为序列轨迹对齐问题,把 Soft-DTW 接入感知、身份、同步等既有指标。在20种方法、7个数据集上的统一基准显示,时序对齐指标对时间偏移更稳健,跨数据集结果更一致,也更清楚揭示同步与真实感、表现力与稳定性之间的范式差异。

Data Collection for Training Quality-Control AI in Carpet Manufacturing Figure 1
2026-06-02cs.CV

Data Collection for Training Quality-Control AI in Carpet Manufacturing

Akbar Erkinov

2026-06-02规划控制

针对地毯产线扩产后人工质检速度慢、主观且漏检会放大瓶颈的问题,论文提出一套在线机器视觉与数据采集一体化方案:用同步线扫相机和复合照明覆盖多米幅宽,并把缺陷采集、人工标注飞轮、从无监督异常检测到监督分类/检测/分割的模型演进纳入系统设计。主要结果是给出可部署蓝图和六西格玛口径下的DPMO/过程sigma收益映射,但文中未充分说明真实产线实测精度与经济增益。

ProductWebGen: Benchmarking Multimodal Product Webpage Generation Figure 1
2026-06-02cs.CV

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

School of Computer Science, Shanghai Jiao Tong University, School of Computer Science &, Zhiyuan College Shanghai Jiao Tong University Shanghai China, Shanghai Jiao Tong University Shanghai China

2026-06-02视觉语言数据集/基准

面向电商营销中由单张商品图和布局/视觉指令生成可渲染展示网页的需求,ProductWebGen提出含500个测试样本、13类商品的多模态网页生成基准,并比较LLM+图像编辑与统一多模态模型两类流程。结果显示,编辑式方法更擅长网页指令遵循、内容吸引力和图像感知质量,统一模型在跨图视觉一致性上更有优势;Gemini-2.5-Flash-Image总体最佳,开源统一模型仍有明显差距,1k SFT数据可显著提升BAGEL。

Learning Neural Deformation Representation for 4D Dynamic Shape Generation Figure 1
2026-06-02cs.CV

Learning Neural Deformation Representation for 4D Dynamic Shape Generation

Gyojin Han, Jiwan Hur, Jaehyun Choi, Junmo Kim

2026-06-02视觉感知

针对现有4D动态形状生成将形状与运动混在占据场中、导致逐帧网格提取慢且时序不一致的问题,本文提出分离形状与运动潜空间的神经变形表示:用条件SDF建模形状,并通过多部件蒙皮权重与刚体变换连续表示运动,再在编码潜向量上训练扩散模型。实验显示其在无条件生成的多样性、时序一致性和渲染效率上优于HyperDiffusion,并支持点云条件生成与运动迁移,但数据规模较小仍限制潜空间学习。

Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing Figure 1
2026-06-02cs.CV

Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing

Gyojin Han, Junmo Kim

School of Electrical Engineering, KAIST

2026-06-02三维

本文针对文本驱动三维人体动作编辑中“何时改”之外缺少“改哪些关节”的问题,提出关节轴与时间轴两个锚定 Transformer,并用跨轴融合为扩散编辑模型提供条件;同时以源/目标关节旋转轨迹的 Soft-DTW 距离做关节级差异预测辅助监督。MotionFix 实验和消融显示,该设计提升了文本语义对齐、源动作保留与生成质量,达到文中报告的 SOTA。

Automated Erythrocyte Detection and Tracking for Retinal Blood Flow Quantification in Erythrocyte-Mediated Angiography Figure 1
2026-06-02cs.CV

Automated Erythrocyte Detection and Tracking for Retinal Blood Flow Quantification in Erythrocyte-Mediated Angiography

Chiao-Yi Wang, Havish S Gadde, Yi-Ting Shen, Saige M. Oechsli, Osamah Saeedi, Yang Tao

2026-06-02视觉感知生成模型

论文关注 EMA 视网膜成像中红细胞需人工识别与跟踪、难以规模化量化毛细血管血流的问题。作者提出 EMTrack:用结合连续帧运动上下文的 FlowContext-DINO 区分运动与暂停红细胞,并重建血管拓扑以约束 Dijkstra 式关联,处理大帧间位移和速度突变;同时发布带检测/跟踪标注的 RBF-EMA 数据集。实验显示其在该数据集上的检测与跟踪均优于基线,并可用于自动化 RBF 定量。

SWARD: Stochastic Window-Attention-Based Relational Distillation for Cross-Architectural Semantic Segmentation Figure 1
2026-06-02cs.CV

SWARD: Stochastic Window-Attention-Based Relational Distillation for Cross-Architectural Semantic Segmentation

Aditya Makineni, Qing Tian

2026-06-02视觉感知

SWARD针对语义分割中Transformer基础模型教师与轻量CNN学生的结构错配,避免直接特征模仿失效。其核心是用随机偏移的多尺度窗口注意力蒸馏对齐局部与长程关系,并加入原型判别正则提升类内紧凑和类间分离。论文在城市场景解析和医学分割实验中报告达到SOTA,显示学生能更完整定位目标。

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation Figure 1
2026-06-02cs.CV

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li

2026-06-02视觉感知数据集/基准

现有指代表达分割多处理单时刻图像,难以满足监控、遥感等场景中“按语言找到某个变化区域”的需求。本文提出多时相指代分割 MTRS,构建含 2.1 万图文掩码三元组的 MTRefSeg-21K,并用 CRAFT-Agent 自动生成加人工审核;同时设计两阶段训练的变化感知 LVLM MTRefSeg-R1,先学双时相变化感知再做语言引导掩码微调。实验显示通用 VLM/LVLM 直接推理表现较差,而该方法在多设置下优于现有基线。

Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts Figure 1
2026-06-02cs.CV

Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts

Weicheng Dai, Chenyu Wang, Andy Li, Shantanu Ghosh, Kayhan Batmanghelich

2026-06-02视觉感知规划控制三维

本文针对高分辨率3D CT生成中“文本提示灵活但空间控制弱、分割提示精确但需全器官标注”的矛盾,提出可同时或单独使用放射报告与语义定义分割掩码的多模态DiT框架,通过统一图像/掩码token化与门控注意力处理长报告。实验显示其在感知和语义指标上达到SOTA,平均FID相对提升约24%,生成体数据解剖一致,并可用于数据增强;但部分增益可能来自架构与数据规模共同作用。

Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning Figure 1
2026-06-02cs.CV

Reasmory: 3D Reconstruction as Explicit Memory for VLMs Spatial Reasoning

Jixuan He, Xueting Li, Chieh Hubert Lin, Ming-Hsuan Yang

2026-06-02视觉语言三维

针对多视角图像和单目视频中空间线索稀疏、冗余且难以被 VLM 稳定组织的问题,Reasmory 将三维重建结果作为显式空间记忆,并用语义化 3D 对象实例与轻量 DSL 约束查询、视角变换和渲染,避免自由工具调用中的漏用和误用。实验显示其在多视角图像与视频空间推理基准上较 GPT-5-mini、Gemini-3-flash 等强基线提升约 6–18%。

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers Figure 1
2026-06-02cs.CV

Boundary-Protection W8A8 HiFloat8 Quantization for Large-Scale Text-to-Video Diffusion Transformers

Yiming Zhao

2026-06-02视觉感知生成模型学习理论

为降低大规模文生视频 DiT(Wan2.1-T2V-14B)在昇腾 910B 上的显存与推理成本,论文指出各 Transformer 块激活分布高度异质,首尾边界块对量化误差最敏感。方法保留第 0、1、37、38、39 块为 BF16,其余 35 块采用 W8A8 HiFloat8 后训练量化。5 个提示词上的 VBench 结果显示其在五项指标上匹配或略超 BF16,消融支持完整边界保护;但评测规模较小,统计结论仍需更大测试验证。

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation Figure 1
2026-06-02cs.CV

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation

Xinlong Zhang, Jia Wei, Xiaoyu Zhang, Teng Zhou, Chengyu Lin, Yongchuan Tang

College of Computer Science, Zhejiang University

2026-06-02视觉感知

针对扩散 Transformer 在多物体、局部小区域条件生成中易出现属性泄漏、伪影和空间控制不稳的问题,COLLAR提出无需训练的级联潜变量细化框架:通过扩展视野分支承接局部目标特征,结合跨尺度语义对齐与循环特征注入,将背景上下文和目标语义自适应融合到全局生成过程。在 COCO-MIG 与 COCO-POS 上,方法在语义对齐、图像质量和空间保真度上均优于现有基线。

One Channel to Rule Them All: Rethinking Input Representation for Visual Place Recognition Figure 1
2026-06-02cs.CV

One Channel to Rule Them All: Rethinking Input Representation for Visual Place Recognition

Timur Ismagilov, Shakaiba Majeed, Michael Milford, Tan Viet Tuyen Nguyen, Sarvapali D. Ramchurn, Shoaib Ehsan

School, Computer Science, University of Southampton, SO17 1BJ Southamp-, Department, University, Michael Milford is with the QUT Centre for Robotics, School of, Shoaib Ehsan is also with the School of Computer Science and, Electronic Engineering, University of Essex, Colchester, CO4 3SQ, U.K.

2026-06-02视觉感知

论文质疑视觉地点识别长期默认使用 RGB 的必要性,系统比较多种 VPR 模型、预训练方式与 RGB/灰度训练设置。核心洞察是全局地点检索主要依赖结构与亮度,颜色只在稳定且有辨识度的色彩线索存在时有用,外观剧烈变化下反而可能干扰。实验中灰度训练的 MixVPR 平均 Recall@1 达 82.4%,高于 RGB 的 81.2%,且部分轻量灰度模型可胜过更大的 RGB 模型,同时降低存储、带宽与部署成本。

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences Figure 1
2026-06-02cs.CV

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

Texas A&M University, Worcester Polytechnic Institute, Tohoku University, Georgia Institute of Technology

2026-06-02视觉感知数据集/基准

现有指令式图像编辑基准多停留在外观/风格修改,难以覆盖真实专业流程中的高分辨率修复、几何、物理一致性与文字恢复等约束。CV-Arena 将问题扩展为 iCVPS,构建 12K 真实高分辨率、16 类任务数据,并用 Active Elo 结合 VLM 评审与专家偏好评估。对 21 个系统的测试显示,当前模型在指令遵循、物理推理、结构控制和细节保真上仍有明显缺口;其 CV-Agent 结果表明闭环规划与验证有助于提升约束满足。

Single-Channel Tissue Segmentation via Cross-Modal Distillation from Foundation Models Figure 1
2026-06-02cs.CV

Single-Channel Tissue Segmentation via Cross-Modal Distillation from Foundation Models

Sakib Mohammad, Jarin Ritu, Md Sakhawat Hossain

Department of Engineering Technology, Fairmont State University, Department of Electrical and Computer Engineering, Texas A&M University, College Station, TX, USA, Department of Mechanical Engineering, Auburn University

2026-06-02视觉感知

针对多通道荧光显微分割依赖核与膜等全部通道、难以在缺失通道或低资源场景部署的问题,论文用冻结的 SAM/CellSAM 多通道教师向仅看核通道的轻量 U-Net 学生做跨模态蒸馏,并结合概率匹配、边界监督与不确定性加权。在 TissueNet 上,SAM 蒸馏的 Swin-Tiny Dice 达 78.36,比无蒸馏高 13.05 点,约恢复教师性能的 87.9%;四种学生均提升约 12 点,BBBC038 跨数据集也有增益。

Bridging Topology and Deep Representation Learning: A TDA-ViT Fusion Model for Four-Class Brain Tumor Classification Figure 1
2026-06-02cs.CV

Bridging Topology and Deep Representation Learning: A TDA-ViT Fusion Model for Four-Class Brain Tumor Classification

Faisal Ahmed

2026-06-02视觉感知

针对ViT在脑肿瘤MRI分类中偏重语义与全局上下文、可能忽略肿瘤形状连通性等拓扑结构的问题,论文提出将TDA持久同调等拓扑描述子与预训练ViT特征融合,用于胶质瘤、脑膜瘤、垂体瘤和无肿瘤四分类。在BRISC2025上报告99.10%准确率、99.98%AUC,优于ResNet、EfficientNet和单独ViT;但具体增益来源与泛化验证仍需更多说明。

Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval Figure 1
2026-06-02cs.CV

Reason, Retrieve, Re-rank: A Zero-Shot Reasoning-Aware Framework for Composed Video Retrieval

Ali Alavi

The Ohio State University

2026-06-02视觉感知三维

该文针对零样本、推理感知的组合视频检索:给定参考视频和隐含编辑指令,需找出符合后效变化的目标视频。核心做法是R3-CoVR,用冻结Qwen3-VL先推理状态、动作、镜头等后效并生成短描述,再由SigLIP-2召回,最后让多模态模型作约束裁判重排候选;关键洞察是描述长度需匹配文本窗口,且重排贡献最大。挑战测试集上达到91.9% R@1、98.2% R@10。

hZACH-ViT: Curved Latent Geometry for Compact Vision Transformers in Low-Data Medical Imaging Figure 1
2026-06-02cs.CV

hZACH-ViT: Curved Latent Geometry for Compact Vision Transformers in Low-Data Medical Imaging

Athanasios Angelakis

2026-06-02视觉感知

针对低数据、资源受限医学影像中紧凑 ViT 默认欧氏潜空间可能不合适的问题,论文在保持 ZACH-ViT 主干不变的前提下,仅替换最终表示空间与原型分类头,比较 Poincaré、Klein 与球面几何及曲率。7 个 MedMNIST 少样本任务、770 次训练显示,最佳非欧配置均优于欧氏基线,平均提升 0.021;但最优几何和曲率随数据集变化,低曲率较常胜出。

MMDG-Bench: A Benchmark for Multimodal Domain Generalization Figure 1
2026-06-02cs.CV

MMDG-Bench: A Benchmark for Multimodal Domain Generalization

Qianshan Zhan, Qian Wang, Da Li, Xiao-Jun Zeng, Xiatian Zhu

2026-06-02视觉语言学习理论数据集/基准

针对多模态学习与域泛化长期割裂、现有多模态域泛化评测集中在动作识别且协议不统一的问题,MMDG-Bench提出D2M与M2D两种组合框架,并在视频-音频-光流动作识别及RGB-Depth-IR人脸反欺骗上统一评测。实验显示,将五类DG方法与统一MML配置组合的十个基线常超过既有方法;关键洞察是DG带来更稳定增益,D2M/M2D优劣取决于跨域模态关系是否稳定,强骨干会放大收益。

Cohort-Scale Neural Atlases of Ultrasound Video Figure 1
2026-06-02cs.CV

Cohort-Scale Neural Atlases of Ultrasound Video

Zhuorui Zhang, Roger Pallarès-López, Xuan Wu, Praneeth Namburi, Brian W. Anthony

Department of Mechanical Engineering, MIT, Institute for Medical Engineering and Science, MIT, MIT.nano Immersion Lab, MIT

2026-06-02视觉感知

超声视频的逐帧专家标注昂贵,且斑点噪声、阴影和探头姿态差异使跨帧跨个体对应困难。本文将群体图谱思想扩展到超声视频,在 DINOv3 特征空间联合学习共享规范坐标图和每视频 GLO 嵌入,以分离解剖结构与采集外观变化。实验覆盖心脏与肌骨五个数据集,在 EchoNet-Dynamic 和 MSK-Bone 上实现有竞争力的单/少样本标注迁移,并可在单张消费级 GPU 上数分钟训练,潜空间也显示一定可解释性。

GABI: Geometry-Aware Boundary Integration for Spacecraft Segmentation Figure 1
2026-06-02cs.CV

GABI: Geometry-Aware Boundary Integration for Spacecraft Segmentation

Iason Georgios Velentzas, Dhruv Ahuja, Panagiotis Tsiotras

Georgia Institute of Technology

2026-06-02视觉感知学习理论

空间强光照、阴影和背景变化使航天器分割难以跨目标泛化,而机载感知又要求模型轻量。GABI的核心是在卷积分割骨干上加入距离场预测头,用由掩码生成的连续边界几何监督约束特征,并以边界权重调制分割。实验显示其在SPARK上较基线AP提升最高约5%,泛化实验AP提升超过50%;轻量版接近重型Transformer且参数约小10倍,重型版性能超过Transformer且更轻。

Images as Tables: In-Context Learning with TabPFN for Low-Data Detection of AI-Generated Images Figure 1
2026-06-02cs.CV

Images as Tables: In-Context Learning with TabPFN for Low-Data Detection of AI-Generated Images

Jan Philip Walter, Shashank Agnihotri, Margret Keuper

2026-06-02视觉感知

针对AI生成图像检测中新生成器不断出现、标注样本稀缺且跨生成器易失效的问题,论文把图像先经冻结DINOv3提取CLS特征、PCA降到500维,再交给TabPFN做上下文表格推理,将适配从微调分类器转为更换少量标注上下文。在GenImage上,LATTE在大规模混合训练时仍领先7.4%,但该方法在低数据和跨生成器迁移场景最高超过LATTE 8.2%。

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated Figure 1
2026-06-02cs.CV

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

Rashid Mushkani

2026-06-02视觉语言视觉感知数据集/基准

论文关注VLM用于街景审计、制图和公众咨询时,传统基准把主观城市感知压成单一真值会掩盖分歧与弃答。作者提出可靠性感知、可协商的评测框架,将标注者一致性、弃答率和标签/打分政策一并报告,并用100张蒙特利尔街景、30个维度、12名社区参与者评测7个零样本VLM。结果显示模型与人类共识的对齐度随维度级人类可靠性共同变化,在“总体印象”等评价维度存在分布错配和Not applicable比例差异。

RefDiffNet: Learning to Expose Subtle PCB Defects Before Detection Figure 1
2026-06-02cs.CV

RefDiffNet: Learning to Expose Subtle PCB Defects Before Detection

Vinay Edula, Nilesh Badwe, Priyanka Bagade

2026-06-02视觉感知三维

针对微小 PCB 缺陷易被复杂走线背景淹没、现有检测器常忽略无缺陷参考图的问题,RefDiffNet 将经典模板比对思想做成检测器前的轻量增强模块:对齐缺陷图与 golden template,经局部对比归一化、Haar/残差/形态学线索和门控编码生成突出缺陷的 RGB 修正图。HRIPCB 与 DeepPCB 上,该模块可插接 YOLO、RT-DETR、Faster R-CNN 等,最高带来 18% 相对 mAP50:95 增益,额外参数仅约 0.004–0.005M。

MoEIoU: Rethinking Bounding-Box Regression as a Mixture of Experts Figure 1
2026-06-02cs.CV

MoEIoU: Rethinking Bounding-Box Regression as a Mixture of Experts

Vinay Edula, Priyanka Bagade

Department of Computer Science and, Indian Institute of Technology Kanpur, center-distance and aspect-ratio mismatch, to improve bounding-box regression. How-, optimization dynamics in which predicted boxes initially exhibit large center-distance, loss that jointly models overlap, center alignment, and aspect-ratio mismatch. MoEIoU, DIoU resolved this by introducing a normalized center-distance penalty that directly guides, from geometric cues such as center distance and aspect-ratio mismatch, while later stages, its mixture-of-experts [9] design, where each component —log-IoU, center distance, and

2026-06-02学习理论

本文针对边界框回归中 IoU 类损失常以固定加和方式处理重叠、中心距离和形状误差、难以匹配训练阶段变化的问题,提出 MoEIoU:将三类定位误差视作专家,用加权 log-sum-exp 自适应突出当前主导误差,并通过课程权重从早期几何校正逐步转向后期重叠精修。作者在 PASCAL VOC、HRIPCB、MS COCO 子集及多种 YOLO 上报告了更快收敛和更高定位精度,可作为无需改结构的替换损失。

The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge Figure 1
2026-06-02cs.CV

The Right Inference Strategy Is All You Need: Nearly Training-Free Domain-Wise Inference for EgoCross Challenge

Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Ying-Cong Chen

2026-06-02强化学习

该文面向 EgoCross 源受限赛道中手术、工业、极限运动和动物视角视频带来的强域移问题,指出瓶颈不一定是 Qwen3-VL-4B 缺乏能力,而是推理接口与任务格式错配。方法几乎不训练模型,而是按领域设计帧组织、提示、问题路由和答案归一化;手术与动物用冻结基座,工业和 XSports 仅用官方 20 样本两轮 SFT。最终总准确率达 66.98%,显示领域感知推理可在有限数据下显著释放基座模型已有能力。

RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes Figure 1
2026-06-02cs.CV

RoboStressBench: Benchmarking VLM Robustness to Physical Visual Stress in Embodied Scenes

Leyi Wu, Yifan Zhao, Jinjie Zhang, Suzeyu Chen, Wosong Chen, Zhifei Chen, Tianshuo Xu, Qingchun He, Hongxin Hu, Haojian Huang, Yangkai Wei, Wenqian Li, Yinchuan Li, Ying-Cong Chen

2026-06-02视觉语言数据集/基准安全鲁棒

面向具身机器人在透明材质、遮挡、低照度和异常视角等真实场景中的感知失效,本文提出 RoboStressBench,用逆图形/成像因素将物理视觉压力划分为材质、视角、光照、几何四类,并通过筛选、合成与实拍构建约 7.2K 样本评测 VLM。对 16 个模型的结果显示,物理压力会显著拉低性能且失效具有任务相关性:几何更伤定位和空间推理,材质与光照更影响识别和状态理解;StressDART 通过压力检测与视觉校正带来一定测试时鲁棒性增益。

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory Figure 1
2026-06-02cs.CV

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx, James Fort, Richard Newcombe, Hyo Jin Kim, Mi Zhang

The Ohio State University

2026-06-02数据集/基准

面向 AI 眼镜作为个人记忆助手时需跨天、跨场景回答真实记忆问题的需求,SuperMemory-VQA 提供 52.9 小时多模态第一视角数据和 4,853 个经人工验证的多选问答,覆盖物体位置、意图、时间线、对话等长期记忆任务,并加入不可回答选项检验幻觉。对 Video-RAG、EgoButler 等系统的评测显示,现有模型在可答性判断、长时检索和多证据整合上仍明显不可靠。

Directed Distance Fields for Constant-Time Ray Queries on Gaussian Splatting Figure 1
2026-06-02cs.GR

Directed Distance Fields for Constant-Time Ray Queries on Gaussian Splatting

Subhankar MIshra

S. Mishra is with the School of Computer Sciences, National Institute of

2026-06-02三维

3D Gaussian Splatting 只能高效回答相机主光线,难以支持阴影、环境光遮蔽和全局光照所需的任意二次光线。本文将训练好的 3DGS 蒸馏为 Directed Distance Function,用一次小网络前向直接预测光线首个交点距离与可见性,避免 BVH 随高斯数量增长或 SDF 球追踪多步查询。实验显示其固定约 52MB,查询比等价 SDF 球追踪快 26–72 倍,并在 142 个物体上复现阴影 30.3dB、AO 21.3dB;但质量依赖干净距离监督,mesh-free 场景的薄结构仍受神经表面误差限制。

Generative Diffusion Priors for 3D Mapping of the Dark Universe Figure 1
2026-06-02astro-ph.CO

Generative Diffusion Priors for 3D Mapping of the Dark Universe

Brandon Zhao, Diana Scognamiglio, Olivier Doré, Katherine L. Bouman

Department of Computing and Mathematical Sciences, California Institute of Technology, Jet Propulsion Laboratory, California Institute of Technology, Department of Physics, Duke University, Cahill Center for Astronomy and Astrophysics, California Institute of Technology

2026-06-02生成模型三维

本文针对弱引力透镜下从单一视线、带噪星系形变中恢复三维暗物质分布的病态问题,利用高分辨率 N-body 模拟构建 Conicus3D 光锥数据集,并训练红移条件扩散先验,与可微物理前向模型结合进行后验采样。实验在类 COSMOS-Web 模拟上显示,其二维/三维重建相关性和小尺度结构保真度优于 Wiener 滤波与神经集成基线,样本统计更接近真实模拟,且对中等宇宙学偏移仍较稳健。

DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models Figure 1
2026-06-02cs.CV

DASH: Dual-Branch Score Distillation for Guidance-Calibrated Compact Diffusion Models

Abdullah Al Shafi, Kazi Saeed Alam, Sk Imran Hossain, Engelbert Mephu Nguifo

Khulna University of Engineering & Technology, Bangladesh, University Clermont Auvergne, France

2026-06-02生成模型

DASH关注CFG条件扩散模型做参数压缩时的结构性失效:只蒸馏条件或合成引导输出会让无条件分支欠约束,学生的guidance gap可能塌缩。其核心是分别监督条件/无条件score,并加入条件噪声锚定与教师TIRT时间步课程迁移。CIFAR-10/100上约5.9倍压缩后50步DDIM FID距教师小于4,无条件监督贡献超过60%增益,但实验仍限于32×32分类生成。

MBench: A Comprehensive Benchmark on Memory Capability for Video World Models Figure 1
2026-06-02cs.CV

MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

Shengjun Zhang, Zhang Zhang, Simin Huang, Zhenyu Tang, Hanyang Wang, Chensheng Dai, Min Chen, Yifan Li, Yuxin Li, Yingjie Chen, Hao Liu, Chen Li, Yueqi Duan

2026-06-02视觉感知强化学习数据集/基准

现有视频世界模型评测多关注画质、运动和文本对齐,难以衡量机器人交互所需的长期状态记忆。MBench将记忆拆为实体、环境、因果一致性三层共12个可量化维度,基于真实长视频并结合规则指标与VLM评估。对8个文本条件和6个动作条件模型的测试显示,主流方法在长期状态保持上存在系统性短板。

DINO-GFSA: Geo-Localization via Semantic Gated Fusion and Mamba-based Sequential Aggregation Figure 1
2026-06-02cs.CV

DINO-GFSA: Geo-Localization via Semantic Gated Fusion and Mamba-based Sequential Aggregation

Beier Hu, Yuanshen Guo, Jialu Cai, Chengwei Li, Yong Wang, Shunan Wu, Zhigang Wu

School of Aeronautics and Astronautics, Sun Yat-sen University, Shenzhen, China

2026-06-02视觉感知

本文面向 GNSS 受限场景下无人机跨视角地理定位,针对 UAV 与卫星图像视角差异大、语义与细粒度空间信息难兼顾的问题,提出 DINO-GFSA:用 LoRA 高效适配 DINOv3 ViT-L,借语义门控残差融合筛选低层几何线索,并以 Mamba 顺序聚合建模长程空间依赖。实验在 University-1652 与 DenseUAV 达到 SOTA,DenseUAV Recall@1 较此前最佳提升 3.48%。

FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection Figure 1
2026-06-02cs.CV

FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection

Yao Wei, Andrea Cavallaro, Changjae Oh

Queen Mary University of London 2 EPFL

2026-06-02视觉感知生成模型

FlowOVD针对开放词汇检测中解码查询依赖静态嵌入或Top-K启发式选择、语义多样性不足的问题,将查询初始化改写为潜空间中的文本条件连续输运过程,并用rectified flow把文本无关查询逐步生成语义对齐查询。无需额外数据,在COCO达49.5 AP、LVIS达31.5 AP,较GroundingDINO分别提升1.2和4.1 AP,长尾LVIS收益更明显。

GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval Figure 1
2026-06-02cs.CV

GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval

Shihang Zhang, Mingjin Kuai, Ye Wei, Zhen Zhang, Wei Ji

2026-06-02视觉感知强化学习优化算法

本文针对视频时刻检索中监督代理损失与 tIoU 等不可微指标不一致导致的后期停滞和排序退化问题,提出 GIRL-DETR:先用 CMI/TGG 建立跨模态对齐,再冻结骨干、仅让检测头通过三阶段梯度隔离强化学习直接优化 tIoU。实验在 Charades-STA、QVHighlights、TACoS 上显示,该策略以较少参数更新提升定位精度,并可迁移到多种 VMR 基线。

Head-Pose-Aware Visual Speech Recognition with FiLM Modulation Figure 1
2026-06-02cs.CV

Head-Pose-Aware Visual Speech Recognition with FiLM Modulation

Matthew Kit Khinn Teng, Haibo Zhang, Takeshi Saitoh

2026-06-02视觉感知三维

该文针对视觉语音识别中非正脸姿态造成的唇部几何畸变、遮挡及视素歧义,提出将头部姿态作为显式条件信号而非仅靠归一化或语言上下文弥补。方法在2D CNN前端后加入姿态条件残差FiLM调制,并用预训练NLLB完成音素到文本重建。LRS2/LRS3上WER为25.0%/33.2%,消融显示单个FiLM块可稳定降低错误率,深层调制对偏航角大于30°样本更有效。

SkyShield: Occupancy as a Safety Interface for Low-Altitude UAV Autonomy Figure 1
2026-06-02cs.CV

SkyShield: Occupancy as a Safety Interface for Low-Altitude UAV Autonomy

Jie Gao, Jie Ma, Kaihui Lin, Kai Ye, Miaohui Zhang, Pingyang Dai, Liujuan Cao

Xiamen University, Jiangxi Academy of Sciences

2026-06-02安全鲁棒

论文针对20米以下城市低空无人机中细小障碍、遮挡和动态姿态使传统2D/框标注及车载占用基准难以支撑安全飞行的问题,提出CARLA仿真的SkyShield数据集,含3.6万前视单目样本、逐帧6-DoF位姿/相机几何和前视体素语义占用;同时给出按可达性与碰撞时间加权的KAR-mIoU及几何优先基线SkyOcc。主要结果是建立了新的安全评测与基线框架,具体性能增益文中未充分说明。

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders Figure 1
2026-06-02cs.CV

Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders

Yitong Jiang, Hongjun Wang, Collin McCarthy, Hanrong Ye, David Wehr, Xinhao Li, Qi Dou, Tianfan Xue, Ka Chun Cheung, Simon See, Wonmin Byeon, Ke Chen, Kai Han, Jinwei Gu, Hongxu Yin, Pavlo Molchanov, Jan Kautz, Sifei Liu

The Chinese University of Hong Kong, The University of Hong Kong, University of California, San Diego

2026-06-02视觉感知

本文针对视觉基础模型中自注意力随分辨率二次增长、限制高分辨率预训练与推理的问题,将保留二维空间结构的 GSPN 扩展为 C-GSPN。核心在于同时优化系统、结构和训练:用融合 CUDA 线扫描核提升硬件效率,在压缩潜空间中传播以降低块开销,并通过两阶段跨算子蒸馏从注意力教师迁移。结果显示其较原 GSPN 核快 40–52 倍,600M 图文对蒸馏后以少 15% 参数匹配 ViT,ADE20K 提升 2.1%,2K 下块级推理约 4 倍加速。

SORA: Free Second-Order Attacks in Fast Adversarial Training Figure 1
2026-06-02cs.LG

SORA: Free Second-Order Attacks in Fast Adversarial Training

Mazdak Teymourian, Ramtin Moslemi, Farzan Rahmani, Mohammad Hossein Rohban

2026-06-02视觉感知

该文针对单步快速对抗训练中常见的灾难性过拟合问题:模型对FGSM表现良好却在PGD等多步攻击下鲁棒性崩塌。作者提出“Epsilon Overfitting”解释固定扰动幅度/方向的风险,并用PertAlign低成本预测过拟合,再以SORA按损失几何自适应调整步长。实验称其在多数据集和架构上用固定超参数避免CO,兼顾更高干净精度、鲁棒性与训练效率。

CASTLE2026 Team WDL Technical Report Figure 1
2026-06-02cs.CV

CASTLE2026 Team WDL Technical Report

Zhengyang Li, Zhenglin Du, Yi Wen, Fang Liu, Shuo Li, Xu Liu

Key Laboratory of Intelligent Perception and Image Understanding

2026-06-02视觉感知

这篇技术报告面向 CASTLE 长时长第一视角多模态问答,动机在于关键证据可能散落在数百小时视频、ASR、照片和时空上下文中,单纯抽帧难以命中。方法将问题线索解析为人、日期、房间和类型,结合转写检索、辅助图像、视频帧采样、类型化提示、LoRA 与置信加权投票。消融显示 LoRA 将分数从 0.21 提升到 0.50,增加采样帧到 0.58,并获挑战第一,但各模块独立贡献仍未充分说明。

CR-JEPA: Cross-Modal Joint-Embedding Predictive Learning for Remote Sensing Image Retrieval Figure 1
2026-06-02cs.CV

CR-JEPA: Cross-Modal Joint-Embedding Predictive Learning for Remote Sensing Image Retrieval

Md Aminur Hossain, Ayush V. Patel, Nitant Dube, Biplab Banerjee

2026-06-02视觉感知

跨模态遥感检索需在光学、SAR、全色/多光谱等成像差异下对齐语义,同时保留同模态邻域结构。CR-JEPA用模态专属stem、共享Transformer、同/跨模态JEPA潜表示预测、SIGReg正则和解耦检索头来分离传感器适配与检索空间学习。在BEN-14K、CBRSIR_VS、DSRSID上均优于近期基线,BEN-14K相对X-JEPA的S1→S2和S2→S1 F1@5分别提升14.59和11.67点,且参数更少。

VICR: Visual In-Context Restoration for Real-World Image Super-Resolution Figure 1
2026-06-02cs.CV

VICR: Visual In-Context Restoration for Real-World Image Super-Resolution

Qichang Zhang, Hailong Wang, Baiang Li, Linhao Wang, Rong Fu, Erkang Cheng, Simon James Fong

Faculty of Science and Technology, University of Macau, Hefei University of Technology, Shandong Normal University

2026-06-02视觉感知强化学习

面向真实图像超分中生成先验易导致结构漂移、语义幻觉的问题,VICR将Real-ISR改写为DiT上的视觉上下文补全:把低质图像提供的局部结构证据、CLIP全局上下文和推理时代理动态修正的语义提示解耦注入。实验称其在多个Real-ISR基准达到SOTA,且仅需127M可训练参数。

FROST-STA: Frozen Dense Features for the Ego4D Short-Term Object Interaction Anticipation Figure 1
2026-06-02cs.CV

FROST-STA: Frozen Dense Features for the Ego4D Short-Term Object Interaction Anticipation

Chaoyang Wang, Lexuan Xu

Beihang University

2026-06-02视觉感知

面向第一视角视频中机器人/助手需在接触前预判“将拿什么、做什么、何时接触”的需求,FROST-STA冻结V-JEPA 2.1密集图像-视频特征,用短时视频提供运动线索、末帧提供高分辨率定位,并通过注意探针、帧引导时序池化与Faster R-CNN式多头解码融合预测。其八头与多checkpoint集成在Ego4D STA 2026测试集取得5.13 Overall Top-5 mAP、挑战第二,但具体消融增益来源文中仍不够充分。

Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning Figure 1
2026-06-02cs.CV

Wavelet-Fusion Diffusion Model for Multimodal Brain MRI Synthesis with Modality and Metadata Conditioning

Muhammad Nabi Yasinzai, Remika Mito, Mangor Pedersen

Department of Psychology & Neuroscience, Auckland University of Technology, Department of Psychiatry, University of Melbourne, Melbourne, Victoria 3053, Australia.

2026-06-02视觉语言生成模型

针对大型脑 MRI 数据集中 T2w、FLAIR 尤其 T1Gd 覆盖不足且站点/元数据异质的问题,论文提出 WFDM:用小波融合 VAE 保留空间频率信息,并在 3D 潜空间扩散中显式条件化模态与人口/临床元数据。在 BrainScape 45,880 扫描上,相比 MAISI 将 pooled FID 从 0.00550 降至 0.00404、MMD 从 0.1918 降至 0.1471,T1w/T2w 改善明显;T1Gd 仍较弱,RFlow 50 步可显著降低采样成本。

Shape-Prior-Based Point Cloud Completion for Single-Stage Fully Sparse 3D Object Detection Figure 1
2026-06-02cs.CV

Shape-Prior-Based Point Cloud Completion for Single-Stage Fully Sparse 3D Object Detection

Kaizheng Wang, Mingqian Ji, Jian Yang, Shanshan Zhang

2026-06-02视觉感知三维

本文针对单阶段全稀疏3D检测器易受激光点云稀疏、遮挡不完整影响的问题,提出基于形状先验的点云补全框架SPPCC。其关键在于不依赖proposal box,而用实例选择模块从前景点中聚类目标,再将实例与类别原型在中心和朝向上对齐,并选取原型点补全缺失区域。方法接入FSDV2和VoxelNeXt后在KITTI验证/测试集上提升检测性能,说明该补全思路对点式和体素式稀疏检测器具有一定泛化性。

A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation Figure 1
2026-06-02cs.CV

A Modelling and Evaluation Framework for EuroCrops-Driven Sentinel-2 Crop Segmentation

Alexandra Nicoleta Scarlat, Ioana Cristina Plajer, Alexandra Baicoianu

Transilvania University of Braşov, Faculty of Mathematics and Computer Science

2026-06-02视觉感知数据集/基准

面向大尺度作物监测中像素级标注难、作物类别异构和跨区域泛化弱的问题,论文提出将 EuroCrops 地块标注与 Sentinel-2 多光谱影像自动对齐、栅格化、筛选并采样的可配置数据生成与评测框架,构建 5 国 67,337 个补丁。基于 10 波段四层 U-Net 的内部测试 mIoU 达 0.7665,优于随机森林基线;但在比利时子集、DACIA5 和 PASTIS 上性能明显下降,说明收益主要依赖同域数据与类别对齐。

T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining Figure 1
2026-06-02cs.CV

T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee, Brejesh Lall

Indian Institute of Technology Delhi, India, NVIDIA AI Technology Center, India, Jawaharlal Nehru University, India

2026-06-02视觉感知

这篇论文针对CLIP在热成像中无法按温度、发射率和热特征对齐文本的问题,指出全局场景语义与物体级热签名在同一嵌入空间联合学习会相互干扰。作者构建IR-Cap物理感知热图字幕,并用双LoRA分别适配场景与细粒度热属性后融合。T-CLIP在KAIST、FLIR、FMB的跨模态检索上均优于基线,KAIST上R@1由0.003提升到0.078,并展示了用于热图生成的可行性。

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models Figure 1
2026-06-02cs.RO

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

2026-06-02强化学习

针对像素级具身世界模型长时域逐帧生成开销高、但简单丢帧又会漏掉接触/抓取/释放等关键事件的问题,SKIP提出“事件保留的稀疏到稠密”范式:用机器人感知多模态特征选关键帧,仅扩散生成这些帧,再由间隔预测与动作条件插值恢复完整视频。在LIBERO上其稠密rollout较Wan 2.2快4.16倍、FVD降89%,合成数据完全替代真示教时π0.5成功率仅小幅下降,优于逐帧生成。

TAP-JEPA: Frozen Future-Latent Probing and Two-Stage Score Fusion for EPIC-KITCHENS-100 Action Anticipation Figure 1
2026-06-02cs.CV

TAP-JEPA: Frozen Future-Latent Probing and Two-Stage Score Fusion for EPIC-KITCHENS-100 Action Anticipation

Chaoyang Wang, Lexuan Xu

Beihang University

2026-06-02视觉感知

该文针对第一视角厨房视频中目标动作尚未发生、只能依赖手-物距离和场景状态等弱线索进行预测的问题,提出冻结 V-JEPA 2.1 编码器与潜变量预测器,仅训练轻量任务查询探针来融合可见上下文与近未来 latent,并用8个副本及12–20轮检查点做两阶段分数字段加权融合。方法在 EK-100 Action Anticipation 隐藏测试集取得27.91% action MT5R,开放榜第二,但最终增益中融合与扩大训练数据的贡献占比未充分说明。

Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models Figure 1
2026-06-02cs.CV

Collaborative Few-Step Distillation and Low-Bit Quantization for Wan2.2 Dual-Expert Video Diffusion Models

Jinyang Du, Shenghao Jin, Ziqian Xu, Ruihao Gong, Shiqiao Gu, Yang Yong, Jinyang Guo, Xianglong Liu

2026-06-02视觉感知生成模型

针对 Wan2.2-T2V-A14B 视频扩散模型采样步数多、显存占用高的问题,本文将少步分布匹配蒸馏与 W4A4/HiF4 低比特量化协同设计:先学习短轨迹,再在该轨迹上按高噪声/低噪声双专家分别校准,并保护敏感入口层以减少激活失配。VBench 结果显示量化模型接近同少步全精度学生,并在 8、20 步平均分超过原全精度基线,其中 20 步为较优质量—效率折中。

An Attribute-Based Measure of Video Complexity Figure 1
2026-06-02cs.CV

An Attribute-Based Measure of Video Complexity

Aditya Sarkar, Yi Li, Zihao Wang, Jiacheng Cheng, Sai Vidyaranya Nuthalapati, Aashu Singh, Shlok Kumar Mishra, David Jacobs, Nuno Vasconcelos

UMIACS-University of Maryland College Park, 2 University of California San Diego, Yale University, 4 Meta AI

2026-06-02视觉感知

针对视频 LLM 评测成本高、现有难度估计依赖大模型且缺乏可解释性的问题,论文提出 VideoABC:把视频-问题复杂度定义为模型失败概率,并用视频长度、事件速度、位置、场景复杂度等属性空间的非参数量化来估计。方法结合 k-means 与通用格量化,并用合成视频补足小参考集的覆盖。实验显示其在低维属性下仍优于 LLM-as-judge,且能解释不同基准的难度来源。

A Systematic Benchmark of Intraoperative Ultrasound-to-MR Synthesis for Brain Tumour Surgery Figure 1
2026-06-02cs.CV

A Systematic Benchmark of Intraoperative Ultrasound-to-MR Synthesis for Brain Tumour Surgery

Olga Esteban-Sinovas, Santiago Cepeda, Ignacio Arrese, Rosario Sarabia

Department of Neurosurgery, Neurovascular Unit, Río Hortega University Hospital, Valladolid, Spain

2026-06-02数据集/基准

脑肿瘤手术中 ioUS 便宜且可重复采集,但与术前 MRI 外观差异大,限制导航和分割模型复用。本文在 ReMIND 上统一比较 6 类生成器、4 种推理形态和单/多任务目标共 48 组 ioUS→MRI 合成实验,并加入 nnU-Net 下游评估。结果显示无单一架构全胜,LPIPS 比 SSIM 更贴近分割效用,SynDiff-2.5D 保留下游分割最好(U Dice=0.55)。

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue Figure 1
2026-06-02cs.CV

MM-Snowball: Evaluating and Mitigating Hallucination Snowballing in Multimodal Multi-Turn Dialogue

Yue Jiang, Xue Jiang, Lihua Zhang, Zhiqiang Wang, Yuhang Lu, Peng Wang, Bo Han, Feng Zheng, Dingkang Yang

2026-06-02视觉语言

论文关注多模态多轮对话中早期视觉幻觉会被历史文本不断放大的“雪球效应”,指出现有单轮或两轮基准难以诊断长期误差传播。作者构建含4992条六轮轨迹的MM-Snowball,并提出AHTS刻画从视觉锚定到推理升级的阶段;实验发现模型在第3–5轮明显崩塌、重新看图后恢复,揭示关键在视觉证据被污染文本压制。其训练-free的CAVR通过表示层刷新视觉锚定和logit层冲突校正,在该基准上优于现有缓解方法。

FlowNar: Scalable Streaming Narration for Long-Form Videos Figure 1
2026-06-02cs.CV

FlowNar: Scalable Streaming Narration for Long-Form Videos

Zeyun Zhong, Manuel Martin, Chengzhi Wu, David Schneider, Frederik Diederichs, Juergen Gall, Juergen Beyerer

2026-06-02视觉感知生成模型

针对现有在线视频 LMM 在长视频流中视觉上下文不断累积、显存和计算随时长线性增长的问题,FlowNar 通过动态删除已完成片段的视觉 KV cache,并用 CLAM 线性注意力记忆以固定 token 压缩历史视觉信息,同时采用自条件评测以暴露误差累积。实验在 Ego4D、EgoExo4D、EK100 上显示其叙述质量优于强基线,可处理约 10 倍更长视频并达到约 3 倍 FPS。

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion Figure 1
2026-06-02cs.CV

Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion

Shivam Singh, Saptarshi Majumdar, Pratik Prabhanjan, Zicheng Liu, Emad Barsoum

Inc.), Advanced Micro Devices, Inc. (AMD)

2026-06-02视觉感知数据集/基准

本文针对现有视频 VLM 在真实辅助场景中易脱离视觉证据、回答冗长且难做下一步规划的问题,提出 Pause-and-think-T 训练集和 Pause-and-think-B 基准,用显式结构化推理监督促使模型先依据时序视觉证据“想一想”再给出简洁行动建议。实验显示,仅微调约 4B 模型即可在基准上达 58.0% 准确率,接近 235B Qwen3-VL,并在场景理解、简洁性及部分 OOD 基准上优于多种前沿模型。

FiSeR: Fine-Grained Source Representations for Cross-Domain AI Image Detection Figure 1
2026-06-02cs.CV

FiSeR: Fine-Grained Source Representations for Cross-Domain AI Image Detection

Shan Zhang, Yongxin He, Mingming Zhang, Huiwen Tian, Lei Ma

2026-06-02视觉感知

该文针对AI生成图像检测在跨域时因分类头过拟合源域伪迹而失效的问题,指出中间特征在新域中仍保留可分结构。FiSeR通过层次化监督对比学习同时拉开真/假图像并保留生成器身份细粒度结构,并用kNN图同质性评估表征。训练于WildFake后,在Chameleon、AIGIBench等跨域基准相对DIRE平均AUROC提升10.22,10-shot轻量SVM适配还带来显著增益。

ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training Figure 1
2026-06-02cs.CV

ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training

Rongsheng Wang, Fenghe Tang, Zihang Jiang, Yingtai Li, Xu Zhang, Haoran Lai, Wenxin Ma, Wei Wei, Zhiyang He, Xiaodong Tao, Rui Yan, Qingsong Yao, Shaohua Kevin Zhou

Medical Imaging, Robotics, Analytic Computing & Learning (MIRACLE) Lab, YRD-RIGHT, USTC Suzhou Institute for Advanced Research, Suzhou, Jiangsu, China 215123, Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou, Jiangsu, China 215123, and also with Biomedical Basic Research Center (BBRC) of Jiangsu Province, Suzhou, Jiangsu, China 215123., Wei Wei is with Department of Radiology, The First Affiliated Hospital of USTC, Division of Life, Zhiyang He and Xiaodong Tao are with Anhui IFLYTEK CO., Ltd., Qingsong Yao is with the School of Medicine, Stanford University., Shaohua Kevin Zhou is also with State Key Laboratory of Precision and Intelligent Chemistry, Hefei, Anhui, China 230026.

2026-06-02视觉感知

针对3D胸部CT中病灶空间稀疏、报告语义开放且难以定位,导致传统全局视觉语言对齐易被背景噪声稀释的问题,ASAP将器官分割先验注入体素补丁表示,并按句子语义自适应选择相关局部区域,再在双模态掩码建模中融合图文信息。论文还构建15个数据集、22项任务的评测基准,实验显示其在分类、分割、预后、报告生成等任务上优于既有方法,低标注和分布偏移场景收益更明显。

Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs Figure 1
2026-06-02cs.CV

Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy, Sayan Nag

Ohio State University, 2 Adobe Research

2026-06-02数据集/基准

现有视觉设计评估常压缩为单一美学分数,难以指出具体原则错误并给出可操作反馈。本文构建 PRISM,通过对 Crello 专业版式按连贯性、可读性、对比、对齐和重叠做受控扰动,形成 100K/10K 训练验证样本,并提出结合 SigLIP 轻量评分器、指令微调 VLM 定位器与提示式全局判断的多尺度框架。实验显示 Qwen-2.5-VL、GPT-4o-mini 对定向退化不敏感,GPT-4o 有全局感知但原则解耦不足,而专用评分器和定位器更能区分并解释局部设计缺陷。

Response-Aware Multimodal Learning for Post-Treatment Visual Acuity Forecasting Figure 1
2026-06-02cs.CV

Response-Aware Multimodal Learning for Post-Treatment Visual Acuity Forecasting

Phuoc-Nguyen Bui, Van-Vi Vo, Duc-Tai Le, Van-Nguyen Pham, Ki-Young Kim, Seung-Young Yu, Hyunseung Choo

2026-06-02视觉语言

针对DME患者抗VEGF治疗后长期视力难以仅凭早期随访判断的问题,本文把基线与1个月OCT及临床表格数据建模为3至24个月多时点预测任务。核心在于显式利用早期治疗反应:LoRA适配RETFound提取局部OCT特征,结合依赖感知表格编码和跨模态融合生成轨迹预测;在188例真实队列上,24个月预测达到MAE 0.1246、RMSE 0.1621、R² 0.6064。

Improving Visual Representation Alignment Generation with GRPO Figure 1
2026-06-02cs.CV

Improving Visual Representation Alignment Generation with GRPO

Shentong Mo, Sukmin Yun

2026-06-02视觉感知

该文针对扩散 Transformer 训练中生成特征与判别视觉表征对齐弱、REPA 等静态余弦/对比损失难以随训练状态调节的问题,提出 VRPO,将表征对齐改写为奖励驱动的策略优化,并用保真度、语义一致性和去噪稳定性奖励动态权衡生成质量与对齐强度。方法无需额外网络,兼容 SiT/DiT;在 ImageNet-256 上相较 REPA 报告 FID 提升约 1.8、训练加速 2.3 倍,并提升跨域对齐保持率。

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers Figure 1
2026-06-02cs.CL

Sandboxed Coding Agents are Competitive Omni-modal Task Solvers

Dongping Chen, Xuanao Huang, Zhihan Hu, Qingyuan Shi, Dianqi Li, Tianyi Zhou

University of Maryland

2026-06-02优化算法

本文质疑视频/音频任务必须依赖原生全模态模型的假设,提出把沙盒编码代理作为“多模态处理器”:通过终端调用 ffmpeg、ASR、OCR 并编写脚本,将媒体流转为转写、帧、元数据等可检索证据。实验显示 GPT-5.4 Codex 在 OmniGAIA 达 75.0%,超过 Gemini 3.1 Pro;技能注入可将平均准确率由 61.4% 提升到 76.7%。论文还给出 Code-X 训练方案与 TerminalBench-O,用于开放模型和真实多模态处理评测。

On the Difficulty of Learning a Meta-network for Training Data Selection Figure 1
2026-06-02cs.LG

On the Difficulty of Learning a Meta-network for Training Data Selection

Zilin Du, Junqi Zhao, Boyang Albert Li

2026-06-02视觉感知

针对合成数据与真实数据分布不匹配时,元学习式训练数据选择(MTS)常低于预期的问题,本文指出关键瓶颈不是框架本身,而是选择网络梯度信噪比过低以及输入特征缺乏数据质量信息;通过理论分析解释权重归一化导致的高方差,并用增大 batch 与分布/训练动态特征改进选择器。在4个基准、15种设置中,相比不选择数据平均提升5.49%,较最强基线提升2.89%。

Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding Figure 1
2026-06-02cs.CV

Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding

Hee Suk Yoon, Eunseop Yoon, Jaehyun Jang, SooHwan Eom, Ji Woo Hong, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

2026-06-02视觉语言视觉感知强化学习优化算法三维

面向小型视觉语言推理模型,多模态 on-policy 蒸馏若沿用单一 KL 目标,容易把语言先验对齐与视觉 grounding 混在一起。论文将损失分解为语言先验和视觉感知两部分,发现二者梯度近似正交,并提出 Visual Gradient Steering 将更新方向显式偏向视觉子空间。实验显示,在 8B 教师蒸馏 2B/4B 学生及多种复杂多模态基准上,VGS 优于标准蒸馏且训练开销较小。

DeepLatent: Think with Images via Parallel Latent Visual Reasoning Figure 1
2026-06-02cs.CV

DeepLatent: Think with Images via Parallel Latent Visual Reasoning

Dongchen Lu, Zhimo Li, Mao Shu, Huo Cao

Baidu Inc., Peking University

2026-06-02视觉感知

论文针对VLM推理中视觉表征一次编码后难以随思考动态更新、而工具调用延迟高且自回归潜变量视觉信息不足的问题,提出DeepLatent:用LatentFormer以可学习2D查询并行生成、且始终锚定原图特征的上下文潜在视觉状态,并用连续空间RL优化调制参数。文中称其在多项视觉推理基准上达到SOTA,同时发布DeepLatent-180K数据集。

Improving Visual Grounding in Remote Sensing via Cluster-Guided Refinement and Model Ensemble Voting Figure 1
2026-06-02cs.CV

Improving Visual Grounding in Remote Sensing via Cluster-Guided Refinement and Model Ensemble Voting

Panav Shah, Geet Sethi, Ashutosh Gandhe

Indian Institute of Technology Bombay

2026-06-02视觉语言

遥感图像中目标小、尺度变化大且背景复杂,单一视觉 grounding 模型往往定位粗糙或分割不稳。论文将 RemoteSAM 的初始定位与 SAM3 的精细分割串联,进一步用聚类合并碎片候选,并对六条管线做多数投票集成。VRS Bench 和 NWPU-VHR-10 实验显示,CGR 与集成方案的 mIoU 优于各单模型,提升了定位一致性与鲁棒性。

CAFOSat: A Strongly Annotated Dataset for Infrastructure-Aware CAFO Mapping Using High-Resolution Imagery Figure 1
2026-06-02cs.CV

CAFOSat: A Strongly Annotated Dataset for Infrastructure-Aware CAFO Mapping Using High-Resolution Imagery

Oishee Bintey Hoque, Nibir Chandra Mandal, Mandy L Wilson, Samarth Swarup, Madhav Marathe, Abhijin Adiga

University of Virginia, Biocomplexity Institute, University of Virginia

2026-06-02视觉感知数据集/基准

针对美国 CAFO 位置记录噪声大、漏报多且缺少设施级标注,CAFOSat 将 NAIP 高分辨率影像与多源清单结合,用 AI 预筛、GradCAM 定位、几何聚类和人工验证把弱地理点精炼为强标注,并加入硬负样本与合成增强。数据集覆盖 20 州、超 4.5 万图块,实验显示更准标注和负样本能提升 CNN、Transformer 与视觉语言模型的泛化,合成数据进一步改善分布偏移鲁棒性。

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs Figure 1
2026-06-02cs.CV

ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs

Yiling Gao, Hongchen Wei, Zhenzhong Chen

School of Remote Sensing and Information Engineering, Wuhan University

2026-06-02视觉语言

高分辨率 VLM 会产生大量视觉 token,带来注意力计算与 KV-cache 开销,极端压缩下现有选择式方法易性能崩塌。ETC 从任务损失最小化出发,提出应保留“指令感知”的任务相关充分统计量,并用文本到图像交叉注意力近似该统计量,再通过变分信息蒸馏约束少量压缩 token 保持可恢复信息。在 LLaVA-1.5-7B 与 Qwen3-VL-2B 上,即使压到单 token 仍能保留较强性能并显著降低缓存开销。

An Effective Solution for the CVPR 2026 8th UG2+ Challenge Track 3: Dynamic Object Segmentation in Turbulence Figure 1
2026-06-02cs.CV

An Effective Solution for the CVPR 2026 8th UG2+ Challenge Track 3: Dynamic Object Segmentation in Turbulence

Hongzhen Li, Miao Yu, Leilei Cao, Youwei Pan, Yingfang Zhu, Fengjie Zhu

2026-06-02视觉感知

本文面向大气湍流下动态目标分割,动机是传统光流和短时匹配在几何畸变、时间抖动中易失效。方法不重做端到端网络,而以 SegAnyMo 的长程点轨迹提示 SAM2 为基础,加入基于 DAVIS/DOST 的湍流仿真域适配,并用时空后处理去除边界伪前景和短暂碎片噪声。DOST 测试上 mIoU 从 0.6392 提升到 0.7249,mDice 从 0.6953 到 0.7783,挑战排名第二。

Generate in Reconstruction Space, Match in Semantic Space: Transport Geometry for One-Step Generation Figure 1
2026-06-02cs.LG

Generate in Reconstruction Space, Match in Semantic Space: Transport Geometry for One-Step Generation

Hugues Van Assel, Edward De Brouwer, Saeed Saremi, Gabriele Scalia, Aviv Regev

2026-06-02三维

本文关注自监督语义特征为何能提升一步生成中的分布匹配。作者将生成放在 VAE 重构潜空间中进行,而把 Sinkhorn 最优传输损失定义在冻结 SSL 语义空间,并指出语义特征通过压缩无关重构细节、提高传输估计稳定性来改善训练。ImageNet 实验显示该策略可使 FID 下降约 39 倍,同时揭示用 Inception 对齐 FID 可能造成指标投机、样本质量反而变差。

Saliency-Aware Model Merging Figure 1
2026-06-02cs.LG

Saliency-Aware Model Merging

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

2026-06-02视觉感知

论文针对无数据模型合并中仅按参数幅值/符号筛选、忽略层间依赖而易产生专家冲突的问题,提出 SA-Merging:借鉴 SynFlow 的连通性显著性,为相对基座的任务向量估计端到端影响,并用专家一致性调制显著性,迭代剪除低价值更新;还扩展到 LoRA 的秩级分解。实验覆盖 ViT 视觉任务、T5 语言任务与 Flan-T5 LoRA,结果显示其优于现有无数据合并方法,缩小与测试时适配/多任务微调的差距。

Structure-Aware Consistency Priors for Shape from Polarization in Complex Media Figure 1
2026-06-02cs.CV

Structure-Aware Consistency Priors for Shape from Polarization in Complex Media

Kaimin Yu, Puyun Wang, Huayang He, Xianyu Wu

2026-06-02视觉感知

论文针对冰等复杂介质中双折射、多次散射导致偏振观测与表面法线关系失稳的问题,提出用 AoLP 自相关构造结构感知一致性先验,并通过 IceSfP 双分支网络、跨模态可靠性注意力和多尺度融合结合原始偏振特征与物理先验。作者还建立首个真实冰物体 SfP 数据集,实验 MAE 达 16.01°,较次优方法降低 2.74°。

V-LynX: Token Interface Alignment for Video+X LLMs Figure 1
2026-06-02cs.CV

V-LynX: Token Interface Alignment for Video+X LLMs

Jungin Park, Jiyoung Lee, Kwanghoon Sohn

2026-06-02视觉感知

针对现有 Video LLM 扩展到音频、3D 等新模态时依赖重型专用编码器和成对数据的问题,V-LynX 提出“token interface”洞察:视频通路已形成可复用的连续感知 token 流形。方法冻结原视觉骨干,仅用轻量 LoRA 辅助路径,并以非成对单模态数据对齐注意力响应和投影 token 统计分布。实验显示其在视听问答、3D 推理、高帧率与多视角视频理解等任务达到 SOTA,且新增参数显著少于 PAVE。

OptiWorld: Optimal Control for Video World Generation under Physical Constraints Figure 1
2026-06-02cs.CV

OptiWorld: Optimal Control for Video World Generation under Physical Constraints

Yu Yuan, Jianhao Yuan, Xijun Wang, Daiqing Li, Liu He, Lu Ling, Stanley H. Chan

Purdue University, University of Oxford, SixteenMiles Labs

2026-06-02视觉感知强化学习规划控制优化算法

针对视频世界模型只生成“看起来合理”的运动、却难以保证安全平滑和物理一致的问题,OptiWorld在推理阶段加入最优控制层:先用视觉基础模型/VLM抽取任务相关3D状态,再把安全、目标、效率等约束统一为黎曼流形上的几何最短路规划,最后用轨迹条件渲染视频。实验在I2V和视频动力学编辑中显示,其目标误差、安全违规率、加速度/jerk和能量均优于HunyuanVideo、Wan、Cosmos与VLIPP等基线。

Pre-Deployment Robustness Stress Testing for CT Segmentation Systems Using Clinically Motivated Multi-Corruption Augmentation Figure 1
2026-06-02cs.CV

Pre-Deployment Robustness Stress Testing for CT Segmentation Systems Using Clinically Motivated Multi-Corruption Augmentation

CholMin Kang, Jonghyun Chung, Amanpreet Kaurb, Nagesh Gulkotwarb, Arthi Sivasankaranb

2026-06-02视觉感知安全鲁棒

论文关注 CT 分割模型在真实临床部署前可能遭遇噪声、低分辨率、对比度变化和伪影等复合退化时的失效风险,提出 RAMP:将解剖约束空间扰动、CT 强度变换与随机多腐蚀组合用于鲁棒训练。实验显示其牺牲部分干净图像 Dice,但显著提升退化图像表现:五器官基准 corrupted Dice 从 0.610 升至 0.753,Abdomen1K 从 0.633 升至 0.789,并大幅缩小鲁棒性缺口。

3D Segment Anything Model with Visual Mamba for Diagnosing Placenta Accreta Spectrum Figure 1
2026-06-02cs.CV

3D Segment Anything Model with Visual Mamba for Diagnosing Placenta Accreta Spectrum

Yuliang Zhang, Fang He, Lulu Peng, Tianyu Yan, Pingping Zhang, Ting Song, Lili Du, Dunjin Chen

Fang He is also with the Department of Obstetrics, Guangzhou Women and Children’s Medical Center, Guangzhou Medical University, Guangzhou 510180, China.

2026-06-02三维

针对胎盘植入谱系疾病依赖资深医生解读MRI、基层医院诊断能力不足且缺少公开数据的问题,论文构建首个带细粒度分割与分类标注的MRI-PAS数据集,并提出3DSAMba:将SAM扩展到3D医学影像,用适配器注入医学先验,结合MLAM与FSSM的Mamba结构聚合多层多尺度特征,再以病灶掩膜辅助分类。实验显示该框架能提升病灶分割和PAS诊断表现。

Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs Figure 1
2026-06-02cs.CL

Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs

Xin Gao, Cheng Yang, Chufan Shi, Taylor Berg-Kirkpatrick

2026-06-02数据集/基准

论文关注统一多模态模型中“文本侧知识编辑能否迁移到图像生成”的问题,提出 UniKE 基准,以属性和关系编辑配合 VQA 验证生成图像是否体现新知识。结果显示明显模态鸿沟:文本编辑成功率约 92%,直接生成的最佳 VQA 准确率仅 18.5%;作者进一步用推理增强先显式激活编辑知识,最高提升 18.6 个百分点,并指出瓶颈可能在文本表示到视觉生成条件通路的信号衰减与错配。

CodeCytos: AI-assisted spatial molecular imaging analysis via code-augmented agent action space Figure 1
2026-06-02cs.CV

CodeCytos: AI-assisted spatial molecular imaging analysis via code-augmented agent action space

Hung Q. Vo, Huy Q. Vo, Son T. Ly, Zhihao Wan, Anh-Vu Nguyen, Hong Zhao, Jianting Sheng, Stephen T. C. Wong, Hien V. Nguyen

University of Houston, Department of Electrical and Computer Engineering, Houston, Texas, 77004, USA, Houston Methodist Hospital, Department of Systems Medicine and Biomedical Engineering, Houston, Texas, 77030, USA

2026-06-02视觉感知

空间分子影像分析常受限于传统软件的固定功能和人工干预,难以快速验证自定义细胞空间特征。CodeCytos将LLM代理的动作空间扩展为可执行代码,通过“思考-代码-观察”循环按自然语言请求完成特征提取;在额叶皮层、NSCLC、胰腺和扁桃体数据上,相比工具增强LLM和零样本CodeAct表现更好,且领域外少样本代码推理示例也能显著提升成功率与Pass@k。

MUSCLE-NET: Predicted-Multiscale-Aware Network for Pedestrian Trajectory Forecasting Figure 1
2026-06-02cs.CV

MUSCLE-NET: Predicted-Multiscale-Aware Network for Pedestrian Trajectory Forecasting

Yu Liu, Ming Huang, Xiao Ren, Zhijie Liu, Youfu Li, He Kong

2026-06-02规划控制

本文面向自动驾驶中的行人轨迹预测,指出现有多模态方法常忽略不同观测源可靠性变化,以及未来运动对特征尺度的依赖。MUSCLE-NET通过MMFE重标定框、速度、姿态等线索并建模非对称跨模态交互,再用MEHP先粗估不确定未来、按预测尺度融合并逐步修正轨迹漂移。在JAAD和PIE上相对现有方法取得稳定增益,但摘要未给出具体幅度。

An explainable hierarchical self attention-based approach for tremor detection in the time domain Figure 1
2026-06-02cs.CV

An explainable hierarchical self attention-based approach for tremor detection in the time domain

Timothy Odonga, Jeanne M. Powell, Mark Saad, Richa Tripathi, Christine D. Esper, Stewart A. Factor, Hyeokhyen Kwon, J. Lucas Mckay

Department of Biomedical Informatics, School of Medicine, Emory University, Atlanta, Department of Neurology, School of Medicine, Emory University, Atlanta, GA, USA, Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of, ¤Current Address: Department of Biomedical Informatics, School of Medicine, Emory, University, Atlanta, GA, USA, neurologists, creating a bottleneck in access and scalability. Consequently, there is

2026-06-02视觉感知

针对临床震颤评估依赖专家、现有自动方法多依赖频域手工特征且易弱化间歇性变化的问题,本文提出两级时域层次模型:用 DeepConvLSTM 从3D运动学短窗学习表示,再由 ViT 汇聚整段试验并用注意力和 Grad-CAM解释时间窗与标记点贡献。九个身体部位平均 F1 为0.765,头部和手部较好但低于频域SOTA 0.909,显示可行但性能增益有限。

Beyond Static Gaussians: An Empirical Investigation of Architectural Paradigms for Dynamic 3D Scene Reconstruction Figure 1
2026-06-02cs.CV

Beyond Static Gaussians: An Empirical Investigation of Architectural Paradigms for Dynamic 3D Scene Reconstruction

Adrian Ramlal, John S. Zelek

University of Waterloo

2026-06-02三维

针对动态 3DGS 方法快速增多但取舍不清的问题,论文将其归纳为结构引导与高斯中心两类,并在 D-NeRF 上统一比较质量、速度、训练与存储。结果显示,结构引导方法重建精度和模型紧凑性更好,如 SC-GS 达 43.31dB;高斯中心方法渲染显著更快,4D Rotor GS 达 1257 FPS,但质量波动和存储开销更大,核心结论是保真/紧凑与实时速度之间存在明确权衡。

Optimizing 3D Gaussian Splatting via Point Cloud Upsampling Figure 1
2026-06-02cs.CV

Optimizing 3D Gaussian Splatting via Point Cloud Upsampling

Adrian Ramlal, Yan Song Hu, John S. Zelek

Vision and Image Processing Group, Systems Design Engineering, University of Waterloo

2026-06-02三维

这篇论文关注 3DGS 对初始 SfM 稀疏点云高度敏感、低纹理区域种子不足的问题,系统比较线性/三角插值、样条、MLS、Voronoi 等点云上采样,并提出利用深度图约束的 point lifting。Mip-NeRF360 与 Replica 实验显示,上采样通常小幅提升重建质量,平均约 0.258 dB;MLS 在多类细节或有机场景更稳,简单插值适合分段平滑结构,Voronoi/深度引导对平坦或低纹理区域更有价值。

GeoSAM-3D: Geodesic Prompt Propagation for Open-Vocabulary 3D Scene Segmentation from Monocular Video Figure 1
2026-06-02cs.CV

GeoSAM-3D: Geodesic Prompt Propagation for Open-Vocabulary 3D Scene Segmentation from Monocular Video

Arun Sharma

University of Minnesota, Twin Cities

2026-06-02视觉感知三维

GeoSAM-3D面向机器人/AR中“单目视频点击一次却需得到持久3D物体掩码”的需求,将SAM/SAM2的2D提示监督提升到3D Gaussian场,并用基于kNN图拉普拉斯的热核测地传播替代欧氏近邻,以减少相近但不连通表面的标签泄漏。文中主要结果偏实现与验证:给出特征头、传播核、单元测试、Space smoke test和评测协议;尚未充分说明其达到SOTA或具备完整开放词汇识别能力。

DarkVesselNet: Multi-Modal Remote Sensing and Trajectory Reasoning for Dark Vessel Detection Figure 1
2026-06-02cs.CV

DarkVesselNet: Multi-Modal Remote Sensing and Trajectory Reasoning for Dark Vessel Detection

Arun Sharma

University of Minnesota, Twin Cities

2026-06-02视觉感知规划控制

面向船舶关闭或伪造 AIS、单一遥感证据易误判的海上监管场景,DarkVesselNet 将 Sentinel-1 SAR、Sentinel-2 光学、AIS 轨迹与地理基础模型 token 统一到可替换骨干和缺失感知注意力融合框架,并用 TGARD 间隙检测与 Pi-DPM 异常头生成可追溯告警。当前结果主要是软件层验证,覆盖滤波、配准、轨迹距离、token 形状和可微异常评分;外部 xView3 式基准效果文中未充分说明。

Real-Time Physics Simulation with Dynamic Mesh-Gaussian Reconstructions Figure 1
2026-06-02cs.CV

Real-Time Physics Simulation with Dynamic Mesh-Gaussian Reconstructions

Adrian Ramlal, John S. Zelek

University of Waterloo

2026-06-02三维

这篇论文关注动态三维重建接入机器人/交互仿真时的拓扑一致性瓶颈:高保真 DG-Mesh 拓扑随帧变化,物理引擎却需要固定网格。作者提出物理固定网格与高斯渲染解耦的双表示框架,并比较时序跟踪、模板投影两种后处理拓扑转换。结果显示固定拓扑更新可达 147.8 FPS、较变拓扑快 4.65 倍,但转换会带来 65–80% 几何退化,甚至不如原生固定拓扑 MaGS,说明物理兼容性应在重建训练中直接优化。

Physical Object Understanding with a Physically Controllable World Model Figure 1
2026-06-02cs.CV

Physical Object Understanding with a Physically Controllable World Model

Rahul Venkatesh, Klemen Kotar, Lilian Naing Chen, Wanhee Lee, Gia Ancone, Seungwoo Kim, Luca Thomas Wheeler, Jared Watrous, Honglin Chen, Daniel Bear, Stefan Stojanov, Daniel LK Yamins

Stanford University, 2 OpenAI, 3 Noetik Inc., 4 Google

2026-06-02强化学习规划控制

论文针对从原始视频中理解物体边界、运动规律和支撑/铰接等物理关系的难题,提出 PSI:把 RGB、光流、相机等局部视觉变量表示为可查询的概率结构,并用自回归序列建模训练,使模型能在任意条件下推断未观测变量。通过生成多种物理一致的未来并分析运动相关性,PSI 可零样本发现物体和关节子部件、进行 3D 操控,并在 SpelkeBench、DragAMove、3DEditBench 及 Visual Jenga 类任务上优于相关基线。

Detect Before You Leap: Mirage Detection in Vision-Language Models Figure 1
2026-06-02cs.CV

Detect Before You Leap: Mirage Detection in Vision-Language Models

Sayeed Shafayet Chowdhury, Md. Shaown Miah

Indiana University Indianapolis, Bangladesh University of Engineering and Technology

2026-06-02视觉语言视觉感知

论文关注VLM在图像缺失、空白或与问题不匹配时仍给出自信答案的“海市蜃楼”风险,主张在生成前判断是否应回答。核心方法TC-LIA不只看最终CLIP相似度,而是追踪ViT各层patch与问题文本的对齐轨迹,并结合空白检测、域路由和VLM自评做集成。跨5类VQA和12个模型,三分类准确率最高94.7%,将基线21.7–66.6%的mirage率降至约2.7–3.3%。

4D Radar Meets LiDAR and Camera: Cooperative Perception under Adverse Weather Figure 1
2026-06-02cs.CV

4D Radar Meets LiDAR and Camera: Cooperative Perception under Adverse Weather

Melih Yazgan, Iramm Hamdard, Qiyuan Wu, J.Marius Zoellner

FZI Research Center for Information Technology, Karlsruhe Institute of Technology

2026-06-02视觉感知

面向雨雾中相机和 LiDAR 易退化导致协同感知不可靠的问题,本文将 4D 成像雷达引入多车融合:一方面用雷达替代或补充 LiDAR,另一方面利用 Doppler 速度生成 BEV 动态注意力以突出运动目标。作者构建含物理 LiDAR 退化的 OPV2V-R、Adver-City-R,并在仿真雨雾及 MAN TruckScenes 上验证,显示雷达增强方案在恶劣天气、时延和位姿误差下更稳健。

Rethinking Amortized Neural Representations for High-Resolution Terrain Elevation Data Figure 1
2026-06-02cs.CV

Rethinking Amortized Neural Representations for High-Resolution Terrain Elevation Data

Haoan Feng, Xin Xu, Leila De Floriani

University of Maryland, College Park, University of Maryland, College Park MD USA

2026-06-02视觉感知

高分辨率DEM若为每个地形块单独拟合INR,虽可连续查询并求解析导数,但难以扩展到大规模数据。论文首次在1 m/pixel swisstopo地形上统一评测TransINR、Functa、HUVR,指出自然图像摊销INR存在跨域落差,并提出将HUVR解码器替换为更平滑可微的SIREN。HUVR+SIREN在相同逐块存储下PSNR提升2.83 dB,导数保真度更好,int8量化仍基本无损;残余差距被定位到共享超网络后端而非token容量。

AutoIQ: An Ensemble Framework for Automatic Assessment of Geometric Distortion in Prostate Diffusion-Weighted Imaging Figure 1
2026-06-02eess.IV

AutoIQ: An Ensemble Framework for Automatic Assessment of Geometric Distortion in Prostate Diffusion-Weighted Imaging

Haoran Sun, Lixia Wang, Yin-Chen Hsu, Hsu-Lei Lee, Chang Gao, Fei Han, Robert Grimm, Vibhas Deshpande, Ziyang Long, Hsin-Jung Yang, Rola Saouaf, Alessandro D'Agnolo, Timothy Daskivich, Hyung Kim, Debiao Li, Yibin Xie

Biomedical Imaging Research Institute, Cedars-Sinai Medical Center, Los Angeles, CA, USA, Department of Bioengineering, University of California, Los Angeles, CA, USA, Siemens Medical Solutions USA Inc., Los Angeles, CA, USA, Siemens Medical Solutions USA Inc., Austin, TX, USA, Department of Imaging, Cedars-Sinai Medical Center, Los Angeles, CA, USA, Department of Nuclear Medicine, Cedars-Sinai Medical Center, Los Angeles, CA, USA, Department of Urology, Cedars-Sinai Medical Center, Los Angeles, CA, USA

2026-06-02生成模型

前列腺 DWI 易受几何畸变影响,导致病灶定位和是否需重扫仍依赖主观目测。AutoIQ 将 T2WI-DWI 前列腺边界错配与配准形变幅度两类可解释畸变指标集成,并用放射科医师判定训练逻辑回归集成分类器。在 140 例回顾性数据中,两类指标均能显著区分严重与可接受畸变,独立测试集准确率 0.95、F1 0.93、AUC 0.98,但单中心小样本限制了泛化判断。

Zamba2-VL Technical Report Figure 1
2026-06-02cs.CV

Zamba2-VL Technical Report

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

Olabode M. Sule

2026-06-02视觉感知

本文针对高分辨率图像/多模态长上下文使 Transformer VLM 预填充和 KV 缓存成本急剧上升的问题,提出基于 Zamba2 的混合 Mamba2 状态空间与少量共享注意力块的 Zamba2-VL,并系统消融视觉编码器与数据配比。结果显示其在图像理解、OCR、grounding、计数和推理上接近同规模 Molmo2、Qwen3-VL、InternVL3.5,显著优于既有 SSM VLM,且 TTFT 约低一个数量级,小模型更适合端侧部署。

αDepth: Learning Single-Pass Soft Boundary Decomposition for Stereo Conversion Figure 1
2026-06-02cs.CV

αDepth: Learning Single-Pass Soft Boundary Decomposition for Stereo Conversion

Xiang Zhang, Yang Zhang, Lukas Mehl, Karlis Martins Briedis, Markus Gross, Christopher Schroers

2026-06-02学习理论

这篇论文针对单目转立体中头发、虚化等软边界处前景/背景混色导致的深度歧义与渗色伪影,提出 αDepth 分层表示,同时估计局部边界的 alpha、前后景颜色和深度;其 CAR 将任务从全局抠图改为局部边界分解,可在复杂多目标场景中单次前向、无需人工提示。实验称其在立体转换上达到 SOTA,并减少背景 bleeding 与结构扭曲。

VESTA: Visual Exploration with Statistical Tool Agents Figure 1
2026-06-02cs.AI

VESTA: Visual Exploration with Statistical Tool Agents

William Rudman, Abhishek Divekar, Kanishk Jain, Sebastian Joseph, Stella S. R. Offner, Matthew Lease, Kyle Mahowald, Greg Durrett, Junyi Jessy Li

The University of Texas at Austin, New York University

2026-06-02视觉感知

论文针对科学流程中定量模型拟合难以自动化、现有 LLM/VLM 代理在复杂分布和领域任务上迭代改进不足的问题,提出 VESTA:让 VLM 在 PyMC 建模循环中动态选择或生成可复用的统计与可视化诊断工具,用图形反馈驱动假设修正。作者还构建 Dawn 基准,覆盖分布拟合、时间序列和天文任务;实验显示动态工具版在复杂与领域特定任务上优于既有代理流程,但仍未超过专家手写工具。

SUPREME: A Multi-GPU Framework for Reproducible Image Unlearning Method Evaluation Figure 1
2026-06-02cs.CV

SUPREME: A Multi-GPU Framework for Reproducible Image Unlearning Method Evaluation

Petros Andreou, Jamie Lanyon, Axel Finke, Georgina Cosma

2026-06-02视觉感知数据集/基准

图像分类机器遗忘评测需要在多随机种子下反复训练、遗忘和评估,单 GPU 框架难以支撑且单种子结论可能偏差。SUPREME 将数据集、模型、方法、指标和场景做成注册式组件,并用 Lightning Fabric 支持 DDP/FSDP/ZeRO,把三阶段分布到多 GPU。作者在 Pins Face Recognition 上用 ResNet18 与 ViT、全类和随机样本遗忘做十种子演示,显示不同种子下遗忘精度可相差数十个百分点,但实验仍局限于单数据集和单设备,方法排名结论有限。

Non-Learning Low-Light Stereo Vision Figure 1
2026-06-02cs.CV

Non-Learning Low-Light Stereo Vision

Jason Wang, Lucas Nguyen, Hyunseung Eom, Wei Xu, Qi Guo

2026-06-02视觉感知

本文针对低光/光子受限双目图像中噪声破坏纹理与匹配线索的问题,提出不依赖学习的稀疏视差框架:用 FoJ 保留长边缘、大块区域等粗结构并构建双向代价体,再以边界感知 SGM 动态调节平滑惩罚以避免跨真实深度边界过度平滑。实验显示其在严重噪声下的未遮罩像素精度优于近期双目和去噪后匹配方法,但输出主要是稀疏视差,FoJ 计算开销较高。

Score-Control for Hallucination Reduction in Diffusion Models Figure 1
2026-06-02cs.CV

Score-Control for Hallucination Reduction in Diffusion Models

Mahesh Bhosale, Naresh Kumar Devulapally, Abdul Wasi, Chau Pham, Vishnu Suresh Lokhande, David Doermann

University at Buffalo, University at Buffalo Buffalo NY USA

2026-06-02生成模型规划控制

本文关注扩散模型生成落在真实数据支持集外的“幻觉”样本,动机是提升图像生成可靠性。核心洞察是过度平滑的 score 场会让概率质量泄漏到低密度区域,并用 Lipschitz 常数给出形式化解释;据此提出 VSM,在训练中通过方差引导调制 score Jacobian,尤其约束后期去噪。实验在合成、真实及新建 ChessImages/Cards 基准上显示幻觉率最高降低约25%–26%,同时基本保持保真度和多样性。

LFA: Layer Feature Attention for Run-Time Introspection of 2D Object Detectors in Automated Driving Figure 1
2026-06-02cs.CV

LFA: Layer Feature Attention for Run-Time Introspection of 2D Object Detectors in Automated Driving

Mert Keser, Alois Knoll

2026-06-02视觉感知

面向自动驾驶中2D检测器难免失效且置信度/单层特征难以可靠预警的问题,论文提出LFA,将冻结检测器的多层骨干特征经GAP与投影后视作token,用轻量Transformer注意力自适应聚合,利用低层细节与高层语义对不同错误的互补性。在KITTI和BDD100K、多种检测架构上,LFA优于单层内省基线,并可通过层权重分析失效线索。

HiGS: A Hierarchical Rendering Architecture for Real-Time 3D Gaussian Splatting Figure 1
2026-06-02cs.CV

HiGS: A Hierarchical Rendering Architecture for Real-Time 3D Gaussian Splatting

Dawid Pająk, Martin Bisson, Rodolfo Lima

2026-06-02三维

本文针对 3D Gaussian Splatting 中分区偏好大 tile、光栅化偏好小 tile 的粒度冲突,提出 HiGS:用粗宏 tile 做分桶与分段深度排序,在其内部用细 render tile 光栅化,并按每个宏 tile 的高斯数量动态拆分批次以缓解密集区域尾部瓶颈。实验覆盖 Mip-NeRF 360 与大型 nvcampus 场景,在保持精确前向 alpha 合成的同时,相比原始 3DGS 最高提速约 15.8 倍,并优于评测中的其他光栅器。

UniVerse: A Unified Modulation Framework for Segmentation-Free,Disentangled Multi-Concept Personalization Figure 1
2026-06-02cs.CV

UniVerse: A Unified Modulation Framework for Segmentation-Free,Disentangled Multi-Concept Personalization

Quynh Phung, Sandesh Ghimire, Minsi Hu, Chung-Chi Tsai, Jia-Bin Huang

University of Maryland, College Park, Qualcomm Technologies, Inc.

2026-06-02视觉感知

UniVerse针对真实参考图常含多目标、遮挡或抽象风格而现有多概念个性化依赖分割掩码、易特征串扰的问题,提出统一参考条件提取器,用提示词同时抽取语义对齐的视觉条件与文本调制偏移,并经分割预训练到生成联合训练实现无分割的概念拆解与组合。实验在多个基准和新UniVerseBench上显示,其定位精度、身份保持和视觉质量优于现有方法,但仍存在概念泄漏和对模糊提示敏感的问题。

Training-Free Object-Agnostic Jam Detection in Fulfillment Centers Figure 1
2026-06-02cs.CV

Training-Free Object-Agnostic Jam Detection in Fulfillment Centers

Ruiliang Liu, Tina Dongxu Li, Joshua Migdal, Fernando Ruch, Kenneth Meszaros, Moses Trevor Dardik

2026-06-02视觉感知

面向履约中心传送带堵塞检测,论文针对传统“检测再跟踪”依赖大量标注且只能识别已知类别的问题,提出无需训练的物体无关方案:在空场景 AOI 内均匀布参考点,把持续遮挡而非点位移作为堵塞信号,并用时间与比例阈值判定。作者在 1,069 段内部视频上评估,AllTracker 版本达到 100.00% 精度和 93.33% F1,但数据集非公开,泛化边界仍需进一步验证。

Belief Consistency Between Foundation-Model Evidence and Geometric Perception in Persistent Robotic Maps Figure 1
2026-06-02cs.RO

Belief Consistency Between Foundation-Model Evidence and Geometric Perception in Persistent Robotic Maps

Christoffer Heckman, Harel Biggie, Brendan Crowe, Nicholas Roy

2026-06-02机器人

论文针对机器人持久语义地图中,基础模型语义证据未校准且可能与几何感知当场矛盾的问题,提出在贝叶斯更新前加入按类别校准的提交门和逐事件冲突丢弃窗口。该机制用几何通道作为在线验证源,拒绝不一致断言并保留可追溯更新;在 KITTI-360、ScanNet 上显著提升地图精度,KITTI 平均 IoU 从 0.180 提至 0.522,is_car 提交精度达 99.7%。

Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation Figure 1
2026-06-02cs.CV

Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation

Changwang Mei, Peisong Wang, Zekun Li, Changsheng Li, Shuang Qiu, Qinghao Hu, Gang Li, Yifan Zhang, Zhihui Wei, Jian Cheng

2026-06-02视觉感知

高分辨率 VAR 图像生成虽质量高但推理延迟大,现有基于层特征的 token 剪枝和固定 CFG 跳过难以适应语义差异。论文提出以对图像/潜空间输出影响来定义 Latent Discrepancy,并据此设计免训练的 LD-Pruning:用潜空间高频能量做无需解码的区域选择,用分支差异动态停止无条件分支。实验在 Infinity-2B/8B、HART 上保持质量的同时降延迟,Infinity-8B 最高加速 2.35×。

Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion Figure 1
2026-06-02cs.CV

Real2SAM2Real: Generative 3D Caches as Complementary Context for Video Diffusion

Jiayi Wu, Haoming Cai, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos

University of Maryland

2026-06-02视觉感知生成模型三维

这篇论文针对视频扩散模型在大视角运动、遮挡和非朗伯材质下只能依赖先验补全、易结构崩塌的问题,提出从单张图像生成可编辑、实例完整的3D几何缓存,并以实例掩码法线图和Soft Spatial-Aligned Injection注入VDM,在尽量保留预训练能力的同时提供显式3D约束。实验显示其可解耦控制相机轨迹与多物体运动,较传统warp-and-inpaint在遮挡、反射折射和大视角变化中保持更好的时空一致性。

Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models Figure 1
2026-06-02cs.CV

Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models

Zijie Zhou, Dandan Zhu, Hangxiangpan Wang, Heng Zhang, Huishen Jiao, Yi Zhao

China University of Petroleum (Beijing), Hainan Institute of China University of Petroleum (Beijing), South China Normal University, China University of Petroleum (Beijing) Beijing China, Hainan Institute of China University of Petroleum (Beijing) Sanya Hainan China, South China Normal University Foshan Guangdong China

2026-06-02视觉语言视觉感知

本文针对 LVLM 中 MoE 往往对视觉与语言采用对称专家、难以建模“文本描述包含于完整视觉场景”的层级关系,以及深层语言专家转向参数记忆而弱化输入证据的问题,提出 AsyMoE:保留模态内专家,引入双曲跨模态专家和证据优先语言专家。实验称其在 18 个基准上较 MoE 平均提升 1.5%,幻觉敏感任务最高提升 3.8%,且比稠密模型少激活 25.45% 参数。

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement Figure 1
2026-06-02cs.CV

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

Carnegie Mellon University, University of Washington, Stanford University, Video results are available at the project website: https://junwon.me/StressDream/.

2026-06-02视觉感知强化学习数据集/基准安全鲁棒

该文针对视频世界模型用于策略评估时只看“名义想象”会漏掉低概率但高影响失败的问题,提出 StressDream:在推理时优化扩散模型初始噪声,用 VLM 语义梯度把生成视频引向文本指定的碰撞、洒落等事件,同时用典型集约束保持可 plausibly。实验覆盖自动驾驶和机械臂,失败检出召回率由 54% 提升到 94%,并使 VLA 策略成功率由 39% 提升到 71%。

The Harsh Truth: Segment-Level Analysis of Harsh Driving Events in Milan Using Large-Scale Telematics, Street Networks, and Google Street View Figure 1
2026-06-02cs.CV

The Harsh Truth: Segment-Level Analysis of Harsh Driving Events in Milan Using Large-Scale Telematics, Street Networks, and Google Street View

Andrea La Grotteria, Paolo Santi, Titus Venverloo, Umberto Fugiglando, Carlo Ratti

2026-06-02视觉感知

针对警方事故记录滞后且不完整的问题,本文用米兰420万辆车载终端的急加速/急刹数据,融合TomTom流量、OSM路网与OneFormer分割的街景视觉特征做路段级安全分析。结果显示控制暴露后,宽车道、路口/公交站和更开阔视野对应更高风险,建筑界面更密集则较低;仅划线自行车道和混行路段的严苛事件强度分别高于物理隔离车道19.5%和11.5%。

LastAct: Trajectory-Guided Latest-Activity Localization for Real-Time Smart-Home Activity Recognition Figure 1
2026-06-02cs.CV

LastAct: Trajectory-Guided Latest-Activity Localization for Real-Time Smart-Home Activity Recognition

Zishuai Liu, Ruili Fang, Jin Lu, Fei Dou

School of Computing, University of Georgia, School of Computing, University of Georgia USA

2026-06-02视觉感知规划控制

针对智能家居连续传感流中滑窗常跨越活动边界、导致“最新活动”被旧上下文污染的问题,LastAct 将事件投影到户型图生成布局对齐轨迹序列,并用轻量门控与边界定位进行后边界掩蔽,同时缓存轨迹模板以降低在线开销。在四个公开数据集的近真实混合窗口协议下,其在纯窗口保持竞争力,并显著提升跨活动窗口的 Macro-F1。

APE: Agentic Prompt Enhancer for Image Generation and Editing Figure 1
2026-06-02cs.CV

APE: Agentic Prompt Enhancer for Image Generation and Editing

Zijian Huang, Jay Zhangjie Wu, Zian Wang, Tianshi Cao, Jiasi Chen, Sanja Fidler, Huan Ling, Xuanchi Ren

University of Michigan

2026-06-02视觉感知

论文关注文本到图像生成/编辑对提示词措辞高度敏感的问题,认为提示增强应作为可训练模块而非用户技巧。APE通过后训练小语言模型实现单代理SAPE和路由-重写-组合式多代理MAPE,在不改动下游视觉模型的情况下补全对象、属性、空间关系和编辑约束。实验显示,小模型增强器优于基座模型并缩小与闭源LLM增强器差距,MAPE在复杂组合任务上更突出。

Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models Figure 1
2026-06-02cs.RO

Safe2Drive: Evaluating Safe Driving Behaviors of E2E Autonomous Driving Models

Nishad Sahu, Kalpana Panda, Congyuan Yu, Changzhong Qian, Shounak Sural, Ragunathan Rajkumar

Carnegie Mellon University, Birla Institute of Technology and Science Pilani

2026-06-02安全鲁棒

本文针对端到端自动驾驶在闭环基准高分但安全语义能力不明的问题,提出 Safe2Drive,在 Bench2Drive 上扩展施工区、行人横穿和遮挡 VRU 等 100 个高风险场景,并引入含预碰撞制动、施工物体接触、车道居中与平顺性的 SDS 指标。实验显示 LEAD、SimLingo 的驾驶分从原基准 94.7/85.07 降至 39.95/41.00,SDS 仅 11.85/15.27,暴露施工区理解、红灯遵守和行人制动的脆弱性。

MyoSem: Aligning Electromyography to Natural-Language Action Semantics for Hand Action Understanding Figure 1
2026-06-02cs.CV

MyoSem: Aligning Electromyography to Natural-Language Action Semantics for Hand Action Understanding

Chiyue Wang, Dong She, Yang Gao, Zhanpeng Jin

South China University of Technology

2026-06-02视觉感知

本文针对传统肌电手势识别依赖固定类别、难以按自然语言动作描述查询与泛化的问题,提出 MyoSem,将 EMG 信号与多视角动作文本构成的语义空间对齐。其核心在于用过程/规范/改写描述丰富标签,结合激活感知 EMG 编码器与语义查询机制保留局部肌肉证据并缩小模态差异。在 EMG2Pose、NinaPro 及截肢者迁移设置中,方法在 EMG-文本双向检索、未见用户和留出类别上优于多数基线。

UF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment Figure 1
2026-06-02cs.HC

UF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment

Zheng Wang, Shuo Wang, Junhong Wang

2026-06-02视觉语言视觉感知

该文针对生理信号情绪识别在跨被试、跨会话场景中因个体差异、情境变化和模态质量不均导致泛化不足的问题,提出 UF-AMA:用 Transformer 与跨注意力融合 EEG 和眼动,并通过置信度筛选、自适应一致性对齐、跨模态蒸馏及多层域适配同时校正模态局部与融合全局分布。实验在 SEED 和 SEED-IV 上报告跨被试、跨会话均达到 SOTA,但具体增益中各模块贡献仍需结合消融进一步判断。

Modeling Robotics Dataset Construction as an Artifact-Based Build Process Figure 1
2026-06-02cs.RO

Modeling Robotics Dataset Construction as an Artifact-Based Build Process

Leon Pohl, Lukas Beer, George Sebastian, Mirko Maehlisch

2026-06-02机器人数据集/基准

论文针对 ROS bag 到机器学习数据集转换常依赖顺序脚本、迭代慢且难复现的问题,将机器人数据集构建建模为带显式依赖和缓存工件的 Bazel 构建过程,并实现 Bagzel/Bagzel-xattr 支持 nuScenes 导出与服务端摘要管理。实验显示在 5.1–20.4GB 数据上较 rosbag2nuscenes 扩展性更好,20.4GB 暖启动最高加速 386.26 倍、增量构建 7.21 倍,但验证仍限于单机和中等规模数据。

Digital-to-Physical Transfer of Adversarial Patches for Aerial Vehicle Detection Figure 1
2026-06-02cs.CV

Digital-to-Physical Transfer of Adversarial Patches for Aerial Vehicle Detection

Jung Heum Woo, Eun-Kyu Lee

School of Information Technology, Incheon National University

2026-06-02视觉感知

论文关注航拍/卫星车辆检测在现实物理对抗贴片下的安全性,针对以往多停留在地面场景的问题,构建从数字优化到打印部署的评测流程,并比较车顶 ON、车旁 OFF、双侧 OFF-Side 等布置。结果显示数字域中 OFF 最高可达 85.51% AORR,但真实环境里 ON 因可见性更稳定,OSR 为 0.197–0.343;天气增强未必带来收益,TV 正则需适中。

Training-Free Continuous Bitrate Control for Scalable Image Coding for Humans and Machines Figure 1
2026-06-02eess.IV

Training-Free Continuous Bitrate Control for Scalable Image Coding for Humans and Machines

Yui Tatsumi, Hiroshi Watanabe

2026-06-02视觉感知规划控制

面向交通监控等“机器常看、人偶尔看”的场景,现有可伸缩图像编码难以连续调码率。本文将基于超先验尺度的自适应量化无训练地扩展到机器层与增强层,用参数独立控制两层码率并保护高重要性潜变量。在 COCO 上,码率下降时检测/分割精度平滑退化,重建 RD 优于均匀量化;同时显示最优两层码率分配取决于识别与人眼重建目标。

DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion Figure 1
2026-06-02cs.CV

DiffCrossGait: Trajectory-Level Alignment for 2D-3D Cross-Modal Gait Recognition via Latent Diffusion

Zhiyang Lu, Ming Cheng

2026-06-02视觉感知生成模型规划控制三维

该文针对2D轮廓与3D LiDAR range-view步态在结构与域分布上难以直接对齐的问题,提出将跨模态匹配从最终嵌入约束改为潜在扩散轨迹对齐:两模态共享高斯噪声,并按三阶段噪声强度分别约束身份锚定、去噪动态一致和跨模态可恢复性。扩散分支仅用于训练,推理仍走判别骨干;在SUSTech1K与FreeGait上报告达到SOTA。

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning Figure 1
2026-06-02cs.CV

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

National University of Defense Technology, Zhejiang University, Intelligent Game and Decision Lab

2026-06-02视觉感知

本文针对现有抽象视觉推理评测只看最终答案、无法区分“看不见、不会归纳规则、不会把规则对应到选项”的问题,提出共享题干诊断基准 StemBind,用同一视觉证据设计感知、规则和完整作答三类问题,并标注四阶段推理过程。对24种MLLM评测发现,多数模型规则识别显著好于最终作答;即使感知和规则都正确,仍有51.2%答错,主要瓶颈定位在规则到实例的绑定阶段,且模型变大或开启思考模式并未稳定修复。

Multi-Contrast MRI Motion Correction via Parameter-Informed Disentanglement and Adaptive Experts Figure 1
2026-06-02eess.IV

Multi-Contrast MRI Motion Correction via Parameter-Informed Disentanglement and Adaptive Experts

Honglin Xiong, Yuxian Tang, Feng Li, Yulin Wang, Lei Xiang, Dinggang Shen, Qian Wang

2026-06-02视觉感知

针对现有MRI运动校正模型常绑定特定对比度、难适应不同伪影强度的问题,论文用扫描参数驱动的ScanCLIP分离对比度与解剖/运动信息,再由ViT估计严重度并通过MoE自适应选择校正专家,双路径同时重建净图和残差伪影。在IXI、HCP上较SOTA提升约0.75 dB PSNR、SSIM最高提升2.79%,且在未见真实临床扫描参数上表现出较好的零样本泛化。

Geodesics with Unified Tangent-constrained Priors and Curvature Regularization Figure 1
2026-06-02cs.CV

Geodesics with Unified Tangent-constrained Priors and Curvature Regularization

Chong Di, Li Liu, Jinglin Zhang, Zhenjiang Li, Da Chen, Laurent D. Cohen

Shandong Artificial Intelligence Institute, Qilu University of Technology (Shandong Academy of Sciences), Jinan, Shandong, China, Yuanshen Rehabilitation Institute, Shanghai Jiao Tong University School of Medicine, Shanghai 200025, China, School of Control Science and Engineering, Shandong University, Jinan, Shandong, China, Department of Radiation Oncology, Shandong Cancer Hospital and Institute, Shandong First Medical University, Shandong Academy of Medical Sciences, Jinan, Shandong, China

2026-06-02视觉感知

针对曲率惩罚测地线在弱边界、复杂形状中易走“捷径”的问题,论文把由骨架或内部标记等内在形状代表生成的切向可行扇区嵌入方向提升空间,形成带硬切向约束的 Finsler 度量,并与 RS、Dubins、Euler–Mumford 等曲率正则统一到 HJB/快速行进求解框架中。合成、自然和医学图像实验显示,该方法能减少拓扑捷径、提升形状一致性,优于若干经典测地线及部分图模型/学习基线。

Advances in Neural 3D Mesh Texturing: A Survey Figure 1
2026-06-02cs.CV

Advances in Neural 3D Mesh Texturing: A Survey

Sai Raj Kishore Perla, Hao Zhang, Ali Mahdavi-Amiri

Simon Fraser University

2026-06-02三维

本文关注网格仍是游戏、动画和建模流水线核心表示下,神经方法如何降低人工 UV 展开与贴图制作成本。其主要贡献不是新模型,而是把神经 3D 网格纹理化按 GAN/前馈生成、CLIP 优化、SDS/扩散管线、人像与 PBR 材质等脉络统一梳理,并比较架构、监督、数据集和评测。主要结果是给出领域版图与开放问题:效率、多视角一致性、光照下物理真实性和标准基准仍未充分解决。

Positional Encodings Anchor Spatial Structure in Vision Transformers: A Geometric Perspective on Robustness Figure 1
2026-06-02cs.CV

Positional Encodings Anchor Spatial Structure in Vision Transformers: A Geometric Perspective on Robustness

Mahmoud Mannes

2026-06-02视觉感知安全鲁棒

本文关注 ViT 中位置编码为何影响鲁棒性,而不只比较精度。作者提出 SSDC 表征几何指标,并结合推理/训练时随机 token 置换,区分空间结构来自内容还是锚定索引。结果显示,无位置编码的 ViT 也会形成空间结构但置换后崩塌;APE、正弦和 RoPE 都提供稳定位置参考框架,使内容破坏型分布偏移下更稳健,编码形式差异相对次要。

CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations Figure 1
2026-06-02cs.CV

CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations

Zixian Su, Hongkai Zhang, Fan Gao, Encheng Su, Taiping Qu, Jingwei Guo, Nan Zhang, Hui Wang, Zhen Zhou, Kairui Bo, Yan Chen, Yue Ren, Shuai Li, Lei Xu, Henggui Zhang

Beijing Academy of Artificial Intelligence, Beihang University, King Abdullah University of Science and Technology

2026-06-02数据集/基准

现有医学 MLLM 评测多依赖公开、孤立图像和简化 VQA,难以反映真实诊断流程。CardioLens 用私有医院多序列心脏 MRI 构建抗泄漏基准,覆盖 Cine、LGE、灌注和 T2,并按图像理解、报告生成、疾病诊断三级评估。对 24 个模型测试显示性能整体较差且随流程加深下降,存在类别塌缩;换切片策略仅约 1% 影响,显式推理提示也未能改善。

Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity Figure 1
2026-06-02cs.CV

Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity

Yizhuo Lu, Changde Du, Qiongyi Zhou, Liuyun Jiang, Huiguang He

2026-06-02视觉感知三维

针对脑活动重建图像中语义可辨但位置、方向、大小等结构不稳定的问题,本文提出 MindDiffuser:先用解码的 CLIP 文本嵌入驱动 Stable Diffusion 生成语义初稿,再以浅层 CLIP 视觉特征反向优化结构,对应腹侧/背侧视觉通路。实验覆盖 fMRI、EEG、MEG 和多类生成模型,普遍提升低层结构指标,但高层语义增益有限,EEG 上改善较弱。

Physics from Video: Identifiability of Time-Invariant Second-Order ODEs under Minimal Trajectory Conditions Figure 1
2026-06-02cs.CV

Physics from Video: Identifiability of Time-Invariant Second-Order ODEs under Minimal Trajectory Conditions

Yuanyuan Wang, Wenjie Wang, Kun Zhang, Mingming Gong

2026-06-02视觉感知规划控制

论文针对视频世界模型“像素逼真但物理不可靠”的问题,研究无解码器、仅编码器从原始视频识别二阶线性常微分方程参数的可辨识性。核心洞察是提出 level-set slope coverage 条件,使潜变量只能与真实物理状态局部仿射,从而保证参数唯一恢复;结果表明欠阻尼系统单条足够长视频即可识别,临界/过阻尼等情形需三条多样轨迹,并用 variance-floor 正则缓解潜变量坍塌。

Recursive Vision Transformer with Dynamic Depth and Width Adjustment for Resource-Efficient Image Semantic Communication Figure 1
2026-06-02cs.CV

Recursive Vision Transformer with Dynamic Depth and Width Adjustment for Resource-Efficient Image Semantic Communication

Zhilong Zhang, Xinhui Zhang, Gongyu Jin, Sihua Wang, Danpu Liu, Changchuan Yin

with Beijing Laboratory of Advanced Information Network, and the Beijing, Key Laboratory of Network System Architecture and Convergence, Beijing, University of Posts and Telecommunications, Beijing 100876, China

2026-06-02视觉感知

面向图像语义通信在端侧部署时参数量和计算量过高的问题,本文将 ViT 编码器做成递归共享模块,并在推理阶段按图像内容与信道状态动态调节深度、按重要性裁剪神经元和注意力头,进一步联合宽深配置。实验显示该方案参数量减少 48.7%,在相近计算复杂度下重建质量优于对比方法。

Evolving to the Aesthetics of a Vision-Language Model Figure 1
2026-06-02cs.NE

Evolving to the Aesthetics of a Vision-Language Model

Stephen James Krol, Jon McCormack

SensiLab, Monash University

2026-06-02视觉语言视觉感知

面向抽象/非具象参数化生成设计中难以手工定义审美适应度的问题,论文比较了两种借助预训练视觉语言模型的进化评价方式:CLIP-IQA 单图打分,以及用 Qwen3-VL 按用户提示做成对偏好比较并以 Glicko 汇总排名。实验与艺术家研究显示,两者与人工审美排序相关性相近;CLIP-IQA 计算更便宜,但可控性弱,成对 VLM 更符合创作者意图却代价高且仍需个性化。

ChWDTA: Channel-wise Wavelet-Domain Transformer Attention and Entropy Modeling for Learned Image Compression Figure 1
2026-06-02eess.IV

ChWDTA: Channel-wise Wavelet-Domain Transformer Attention and Entropy Modeling for Learned Image Compression

Haisheng Fu, Runyu Yang, Feng Ding, Siyu Zhu, Jie Liang, Xiaoxiao Li, Zhenman Fang, Jingning Han

Haisheng Fu and Xiaoxiao Li are with the Electrical and Computer Engineering Department, The University of British Columbia, Vancouver, BC, Canada

2026-06-02视觉感知

针对混合 CNN–Transformer 学习式图像压缩中通道相关性仍较强、切片熵模型难以匹配潜变量协方差的问题,论文将可逆的通道小波变换嵌入窗口空间注意力的 Q/K/V 投影,并用通道小波包生成均衡子带以适配 ChARM 熵编码。8-slice 模型在 Kodak、CLIC Pro、Tecnick 上相对 VTM 9.1 分别取得 −17.82%、−19.15%、−22.56% BD-rate,4-slice 则以较低复杂度保留大部分增益。

General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling Figure 1
2026-06-02cs.CV

General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling

Huaihai Lyu, Chaofan Chen, Mingyu Cao, Yuheng Ji, Changsheng Xu

2026-06-02视觉感知

本文针对 VLA/机器人模仿学习中直接回归绝对动作坐标导致的坐标系依赖、速度绑定和多模态平均问题,提出 Generalized Action Manifold:用弧长参数化解耦轨迹形状与执行速度,并通过 Schema-Affine-Factorization 将轨迹规范化为世界线,分离不变动作 schema 与位姿/尺度调制。实验显示该结构先验在空间与时间分布偏移下优于不含几何约束的基线,但具体增益的任务覆盖与规模依赖仍需进一步核实。

VDSB-GWSyn: Diffusion Schrödinger Bridge for Controllable and Anatomically Feasible Guidewire Synthesis in Coronary Angiography Figure 1
2026-06-02cs.CV

VDSB-GWSyn: Diffusion Schrödinger Bridge for Controllable and Anatomically Feasible Guidewire Synthesis in Coronary Angiography

Haoyuan Tang, Zhuo Zhang, Jialin Li, Shuai Xiao, Jiachen Yang

2026-06-02生成模型规划控制

针对冠脉造影中导丝标注稀缺、端点弱可见导致机器人 PCI 感知难训练的问题,VDSB-GWSyn先学习导丝形状先验,并在血管分割约束下生成解剖可行的掩码和端点,再用带 SPADE 条件的扩散 Schrödinger Bridge 只在掩码区域修补,尽量保持真实背景不变。合成数据用于预训练后再真实微调,使端点定位 MPE 从16.01px降至7.71px,3px PCK 从52.63%升至86.27%;但质量仍依赖血管分割,复杂重叠血管下可能需人工剔除。

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning Figure 1
2026-06-02cs.CV

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

Junkai Chen, Yuhao He, Junxiang You, Ruiqi Liu, Chenyu Wang, Shu Wu

Institute of Automation, Chinese Academy of Sciences, School of Advanced Interdisciplinary Sciences, UCAS

2026-06-02视觉语言

针对多模态大模型可能通过图像与文本触发隐私/受限知识、而现有训练式遗忘损害能力、纯上下文遗忘又不改参数且易被反向攻击的问题,论文提出 Vgid:用视觉噪声加文本遗忘指令从冻结基模型构造教师分布,再蒸馏到学生模型实现参数级遗忘。MLLMU-Bench 上其在多模型和任务中降低遗忘集泄露,例如代表设置下 forget ROUGE-L 降 0.371,retain ROUGE-L 仅降 0.055。

CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection Figure 1
2026-06-02cs.CV

CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng

School of Informatics, Xiamen University, China Academy of Information and Communications Technology, AI Transcend Pte. Ltd.

2026-06-02视觉感知数据集/基准

现有 AIGC 视频检测数据多来自开源生成器,质量与商业模型差距大,易导致检测器过拟合低质伪造痕迹。本文构建 CoCoVideo-26K,用 13 个商业视频模型生成与真实视频语义对齐的真假配对,并提出结合时空对比学习与置信度门控 MLLM 推理的 CoCoDetect。实验显示其在自建和公开基准上达到 SOTA,并具备较好的跨数据集泛化,但部分增益可能主要来自更高质量数据。

CoilDrop-MRI: Self-supervised physics-guided MRI reconstruction with coil dropout Figure 1
2026-06-02cs.CV

CoilDrop-MRI: Self-supervised physics-guided MRI reconstruction with coil dropout

Tongxi Song, Ziyu Li, Zihan Li, Wen Zhong, Congyu Liao, Yang Yang, Hua Guo, Wenchuan Wu, Qiyuan Tian

School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University, Beijing, China, Oxford Centre for Integrative Neuroimaging, FMRIB, Nuffield Department of Clinical Neurosciences, University of Oxford, Oxford, UK, Department of Radiology & Biomedical Imaging, University of California San Francisco, San Francisco, *Correspondence to: Qiyuan Tian, Center for Biomedical Imaging Research, Tsinghua University, 30

2026-06-02三维

针对监督式 MRI 重建依赖全采样参考、现有自监督方法只在 k-space 划分数据而忽略线圈间冗余的问题,CoilDrop-MRI 通过随机丢弃部分接收线圈、用被丢弃线圈作为训练目标,在 SENSE 与 SPIRiT 展开框架中学习重建。实验覆盖 0.3T/0.55T/3T、多对比度和多发射 dMRI,结果显示其优于 SSDU 等自监督基线,接近监督方法,并具备少样本与跨域泛化能力。

Segmentation-Guided Spatial Indexing for Generalizable and Explainable Deepfake Detection Figure 1
2026-06-02cs.CV

Segmentation-Guided Spatial Indexing for Generalizable and Explainable Deepfake Detection

Izaldein Al-Zyoud, Abdulmotaleb El Saddik

2026-06-02视觉感知

针对跨数据集 Deepfake 检测易被全脸压缩痕迹、背景等捷径干扰且事后热力图难以解释的问题,论文提出“先分割、再筛选、后池化”的空间索引:用冻结 FaRL 为 DINOv3 patch 标注语义区域,仅保留如嘴部 token 训练线性探针。结果显示无需微调和目标域数据,在 Celeb-DF v2/DFD 上 AUC 达 0.905/0.930;去掉区域索引或换用 FaRL 特征均显著下降,说明增益主要来自冻结 DINOv3 表征与预池化语义筛选的组合。

Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents Figure 1
2026-06-02cs.CV

Diversity Over Frequency: Rethinking Tool Use in Visual Chain-of-Thought Agents

Dong-Hee Kim, Reuben Tan, Donghyun Kim

2026-06-02视觉感知

针对视觉链式思维代理在复杂视觉推理中是否应频繁调用外部工具的问题,论文从3D空间推理与医学VQA出发,发现强化微调会出现“工具使用坍缩”:准确率上升但工具调用趋近消失;单纯奖励用工具也只带来有限增益。其核心洞察是性能关键不在调用频率,而在训练早期的文本与视觉探索多样性;加入自适应熵正则后,即便后期工具使用下降,仍取得最佳表现,支持“工具作为训练脚手架”的观点。

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation Figure 1
2026-06-02cs.CV

Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation

Kailing Li, Tianwen Qian, Lijin Yang, Yuqian Fu, Jingyu Gong, Xiaoling Wang, Liang He

School of Computer Science and Technology, East China Normal University, King Abdullah University of Science and Technology

2026-06-02机器人视觉感知三维

论文针对 VLM 在视觉语言导航中擅长语义与 2D 感知、却缺乏 3D 空间推理和低层运动控制的问题,提出无需训练的 HSGM:用几何、语义、决策三层语义几何地图把 3D 环境转成 VLM 可读的 BEV 表示,并让 VLM 只选有效航点、A* 负责避障执行,同时用子任务管理缓解长程遗忘。在 R2R-CE 和 RxR-CE 上零样本成功率达 47.9% 和 41.8%,超过现有零样本方法及部分监督方法。

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry Figure 1
2026-06-02cs.CV

Diffusion Image Generation with Explicit Modeling of Data Manifold Geometry

Duoduo Xue, Zhiyu Zhu, Junhui Hou

2026-06-02视觉感知生成模型

论文针对连续扩散虽依赖低维数据流形假设、却通常在无界欧氏空间建模的问题,提出 MIND:先用离散 patch token 保留结构信息,再将 token 映射到低维超球面,在连续扩散中显式建模流形几何,并用 soft top-k、双分支高频嵌入和分阶段采样连接训练与推理。在 ImageNet-256 上,MIND-B 80 epoch 无引导 FID 为 22.73,显著优于 DiT-B/2 的 43.47;有引导时 130M 参数达 FID 2.06,MIND-XL 达 1.95。

Aligning Cellular Sheaves with Classifier Attention for Interpretable Weakly-Supervised Pathology Localization Figure 1
2026-06-02cs.CV

Aligning Cellular Sheaves with Classifier Attention for Interpretable Weakly-Supervised Pathology Localization

Devansh Lalwani, Swapnil Bhat, Maulik Shah

2026-06-02视觉感知

针对弱监督病理全切片中 ABMIL 分类已强但注意力定位不可靠的问题,论文把切片 patch 构成图,引入 cellular sheaf 的局部不一致场,并提出用分类器注意力差异而非特征相似度来监督邻域一致性。联合训练后,Camelyon16 patch 定位中 sheaf AUC 达 0.940,注意力 AUC 从 0.717 提升到 0.953;冻结分类器消融仅到 0.727,显示增益来自表示与 sheaf 目标的协同适配,并可零微调迁移到 Camelyon17。

Structured Visual Evidence Decomposition for Evidence-Grounded Multimodal Screening of Obstructive Sleep Apnea-Hypopnea Syndrome Figure 1
2026-06-02cs.CV

Structured Visual Evidence Decomposition for Evidence-Grounded Multimodal Screening of Obstructive Sleep Apnea-Hypopnea Syndrome

Chen Zhan, Yingchen Wei, Xiaoyu Tan, Jingjing Huang, Xihe Qiu

School of Electronic and Electrical Engineering, Shanghai University of Engineering Science, Shanghai 200438, China, Tencent Youtu Lab, Shanghai 200233, China, ENT Institute and Department of Otorhinolaryngology, Eye & ENT Hospital of Fudan University, Shanghai 200031, China, National University of Singapore, 9 Engineering Drive 1, Singapore 117575, Singapore

2026-06-02视觉语言

针对 PSG 前 OSAHS 筛查成本高且直接多模态提示易失准的问题,论文提出 EviOSAHS:先用七个解剖部位问题从正面人脸提取可审计视觉证据卡,再与结构化临床资料交由 LLM 做二分类裁决。在 642 人队列上达到 88.47% 准确率、94.86% 敏感度和 5.14% 假阴性率,优于临床-only、直接多模态和朴素两阶段基线,但仍需外部验证与校准。

Planktonzilla: Multimodal dataset and models for understanding plankton ecosystems Figure 1
2026-06-02cs.CV

Planktonzilla: Multimodal dataset and models for understanding plankton ecosystems

Alan Gerson Contreras Montanares, Luis Valenzuela, Luis Martí, Nayat Sanchez-Pi

Inria Chile Research Center, to isolated training datasets and inconsistent labels. To address this, we introduce, Planktonzilla-17M, a unified dataset consolidating publicly available plankton, existing studies still rely on isolated datasets with limited taxonomic breadth [4]. Moreover, labels, ∗Dataset and models are publicly available at https://huggingface.co/datasets/project-oceania/. Code use to, train and evaluate the models and generate the Planktonzilla-17M is available at https://github.com/Inria-Chile/, available georeferenced environmental metadata, we provide, to our knowledge, the most comprehen-, datasets using the World Register of Marine Species (WoRMS), retaining each label at its deepest, reproducible training, validation, and test splits stratified by source dataset and taxonomic labels, taxonomic classes, paired with available geo-environmental metadata—to our knowledge

2026-06-02视觉语言数据集/基准

针对浮游生物图像数据分散、跨设备/海域分布偏移和分类标签层级不一致导致模型难泛化的问题,本文构建 Planktonzilla-17M,将13种成像系统的1740万图像按 WoRMS 统一分类,并加入地理环境元数据与可复现实验划分。实验显示,在共享 ViT 骨干上,监督分类器可匹配或超过基于分类谱系文本的 CLIP 式训练,BioCLIP/BioCLIP2 在该领域零样本和少样本表现较弱,性能提升可能主要来自更大且更一致的领域数据。

Flow-Based Generative Modeling for Optimizing Sampling Policies in Compressed Sensing Applications Figure 1
2026-06-02cs.CV

Flow-Based Generative Modeling for Optimizing Sampling Policies in Compressed Sensing Applications

Roman Pavelkin, Luis A. Zavala-Mondragon, Christiaan G. A. Viviers, Fons van der Sommen

Eindhoven University of Technology

2026-06-02生成模型

压缩感知中采样掩码离散、组合空间大,传统或启发式采样难以适配具体重建/分类任务。本文将 Flow Matching 从信号生成改为在采样空间生成任务条件化的子采样策略,并与下游模型联合优化。实验显示其在低采样率图像重建和 8× fastMRI 加速中优势明显,CelebA 5% 采样达 25.17 dB,fastMRI 8× 重建达 29.24 dB/SSIM 0.7163;MNIST 分类提升随机掩码但弱于 A-DPS。

Improved Belief-Attention in Vision Task Figure 1
2026-06-02cs.CV

Improved Belief-Attention in Vision Task

Guoqiang Zhang

University of Exeter

2026-06-02视觉感知

针对 Belief-Attention 只保留正交投影后的垂直分量、可能丢弃有用 token 相关信息的问题,论文通过消融指出投影分量同样有价值,并提出 Belief2-Attention:用激活和线性映射处理投影分量,同时可在 QK 相似度外加入 ZZᵀ 捕获更丰富相关性。图像分类与分割实验显示其优于标准 Attention,但增益伴随额外参数,部分来源仍需更细致拆解。

DefocusTrackerAI -- A Generalized Framework for the Automatic Detection of Defocused Particle Images Figure 1
2026-06-02cs.CV

DefocusTrackerAI -- A Generalized Framework for the Automatic Detection of Defocused Particle Images

Gonçalo Coutinho, Ana S. Moita, António L. N. Moreira, Massimiliano Rossi

IN+ Center for Innovation, Technology and Policy Research, Instituto Superior Técnico, University of Lisbon, Lisbon, Portugal, CINAMIL - Military Academy Research Center, Militart Academy, Portugal, IN+ Center for Innovation, Technology and Policy Research, Instituto Superior Técnico, University of Lisbon, Lisbon,Portugal, Department of Industrial Engineering, Alma Mater Studiorum University of Bologna, Bologna, Italy

2026-06-02视觉感知

针对散焦粒子跟踪中高密度场景检测率与定位不确定性难以兼顾、且模型常需按光学系统重训的问题,本文用 MicroSIG 合成多种散光/非散光粒子图像训练通用检测器,并比较 Faster R-CNN 与 YOLOv9。结果显示 YOLOv9 在高粒子密度下召回更高、不确定性更低,Ns≤0.5 时约 0.1–0.4 像素,并能迁移到荧光、阴影法等真实 DPT/喷雾液滴实验;但泛化增益可能主要来自合成数据覆盖与模型 scaling。

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data Figure 1
2026-06-02cs.RO

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data

Zhiyuan Feng, Qixiu Li, Huizhi Liang, Rushuai Yang, Yichao Shen, Zhiying Du, Zhaowei Zhang, Yu Deng, Li Zhao, Hao Zhao, Zongqing Lu, Oier Mees, Marc Pollefeys, Jiaolong Yang, Baining Guo

Tsinghua University, Xi’an Jiaotong University, Fudan University, Peking University

2026-06-02机器人视觉语言视觉感知

这篇综述针对 VLA 机器人操作受限于昂贵、具身绑定的机器人示教数据这一瓶颈,讨论如何把海量人类视频转化为可用于策略学习的动作相关信号。核心洞察是按信号形态而非模型架构划分四条桥接路径:潜在动作、预测世界模型、显式 2D 线索和显式 3D 结构。主要结果是给出数据集与监督信号地图,并总结视频分段、具身/视角对齐和更能预测真实部署的评测三类关键挑战。

When Jokes Cross the Line: Analyzing Regular Humor and Dark Humor in YouTube Shorts Figure 1
2026-06-02cs.MM

When Jokes Cross the Line: Analyzing Regular Humor and Dark Humor in YouTube Shorts

Sydney Johns, Sanjeev Parthasarathy, Shantnu Bhalla, Vaibhav Garg

Virginia Polytechnic Institute and State University, Virginia Polytechnic Institute and State University Alexandria Virginia USA

2026-06-02视觉感知

短视频平台上黑色幽默常处于“允许但可能伤害”的审核灰区,论文为此构建 TwistedHumor:含 1,211 个 YouTube Shorts 与 33,041 条评论,并标注幽默类型、伤害、主题和修辞。分析显示黑色幽默并非单一类别,常围绕批判、应对、尴尬和身份表达;普通幽默评论更正向,黑色幽默反应更混合且有时更具毒性,LLM 在单口喜剧上优于短笑话。

Shu Dao: A Calligraphy Score Framework Linking Calligraphy, Music, and Performance Figure 1
2026-06-02cs.HC

Shu Dao: A Calligraphy Score Framework Linking Calligraphy, Music, and Performance

Lican Huang

2026-06-02视觉感知

针对传统书法数字表示只保留静态字形、难以表达笔顺、节奏、力度与身体现象的问题,本文提出 CWSR 与“Shu Dao”框架,将书法建模为类似乐谱的可执行动作序列,编码笔画、结构、章法和动态属性。文中展示 AI agent 可从 Score JSON 生成不同风格的 SVG 书法,并具备可复现、可解释和生成性;但实验主要是概念与示例验证,量化效果和真实笔触增益文中未充分说明。

2026-06-01

147 篇
Representation Forcing for Bottleneck-Free Unified Multimodal Models Figure 1
2026-06-01cs.CV

Representation Forcing for Bottleneck-Free Unified Multimodal Models

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

2026-06-01视觉语言

本文针对统一多模态模型生成端依赖冻结 VAE 导致的结构瓶颈,提出 Representation Forcing:让解码器先自回归预测来自自身理解编码器的视觉表征,再以这些中间 token 在同一骨干中引导像素空间扩散。结果显示,去掉外部 VAE 后的像素模型在图像生成上可匹配 VAE 基线,并在理解任务上通常更优;但从头多模态预训练与视频扩展仍未充分验证。

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models Figure 1
2026-06-01cs.CV

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Hai Ci, Tao Feng, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

Zhejiang University, DAMO Academy, Alibaba Group, Hupan Lab, National University of Singapore, Hong Kong University of Science and Technology, Fudan University, Tsinghua University

2026-06-01视觉感知

针对连接式视频统一模型难以在训练中接入大规模高保真扩散生成器、导致语义推理与画质难兼得的问题,Lumos-Nexus 训练时仅对齐同潜空间的小生成器,推理时用 UPFB 将生成过程逐步交给大生成器做由粗到细细化。实验显示其在 VBench 的真实感与时序一致性提升,并在新提出的 VR-Bench 上保持较强推理驱动生成能力。

Linear Scaling Video VLMs for Long Video Understanding Figure 1
2026-06-01cs.CV

Linear Scaling Video VLMs for Long Video Understanding

Cristobal Eyzaguirre, Jiajun Wu, Juan Carlos Niebles

2026-06-01视觉语言视觉感知

长视频 VLM 在自动驾驶、具身机器人等流式场景中受限于时空自注意力的二次预填充开销。论文提出 StateKV:在不改架构、不微调的推理阶段,用固定容量、重要性驱动的跨帧循环状态保留时间 sink,同时保留完整逐帧缓存供解码,从而把视频预填充降为线性复杂度。实验覆盖 3 个长视频基准、7 个模型和多种规模,性能更接近全注意力并优于滑窗/近因式 ReKV,在相同 FLOPs 预算下可运行更大模型取得更好精度。

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models Figure 1
2026-06-01cs.CV

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

Max Planck Institute for Informatics, Saarland Informatics Campus, CISPA Helmholtz Center for Information Security, University of Freiburg, within-category score—recognizing the same local concept (e.g. a wheel center), center on a car, bus, or tractor) at all. This ambiguity limits current evaluations

2026-06-01视觉感知数据集/基准

现有语义对应基准难以区分局部部件识别、重复部件定位和跨类别迁移,限制了对机器人所需结构化物体理解的评估。SOCO提出基于分类体系的语义物体对应定义,覆盖100类、超100万对应对,并加入关键点语言描述以测试VFM/LVLM。实验显示强视觉骨干仍易混淆重复部件、跨类泛化弱,LVLM更擅长文本提示定位而非跨图匹配,且SOCO成绩比ImageNet分类更能预测分割、跟踪和3D任务表现。

KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems Figure 1
2026-06-01cs.CV

KLIP: localized distribution shift detection via KL-divergence with diffusion priors in Inverse Problems

Alireza Kheirandish, Jihoon Hong, Sara Fridovich-Keil

Georgia Institute of Technology, School of Electrical and Computer Engineering, are available at inference time in an inverse problem, and, well when both ID and OOD data is available, they are not

2026-06-01视觉感知生成模型

该文针对逆问题成像中只能观察间接测量、且异常常以小病灶等局部形式出现的分布偏移检测难题,提出 KLIP:用扩散先验与测量后验之间的 KL 散度,并在采样时间窗和图像块上局部化估计,无需 OOD 校准数据。实验显示其可在稀疏视角 CT 与高斯去模糊中检测并定位肝肿瘤、合成伪影和人脸局部异常,且跨整图/patch 扩散模型有效;但对块大小和时间窗超参数较敏感。

Learning Global Motion with Compact Gaussians for Feed-Forward 4D Reconstruction Figure 1
2026-06-01cs.CV

Learning Global Motion with Compact Gaussians for Feed-Forward 4D Reconstruction

Mungyeom Kim, Minkyeong Jeon, Honggyu An, Jaewoo Jung, Hyuna Ko, Jisang Han, Hyeonseo Yu, Donghwan Shin, Sunghwan Hong, Takuya Narihira, Kazumi Fukuda, Yuki Mitsufuji, Seungryong Kim

ETH Zürich, ETH AI Center, video and fundamentally limiting their scalability to general-purpose video inputs., to leverage globally available information and leaving occluded regions poorly reconstructed.

2026-06-01三维

本文针对单目视频前馈4D重建中逐像素高斯带来的重复、鬼影和视角偏置问题,提出C4G:用少量时间条件化可学习高斯查询在全时序上下文中聚合特征,并随目标时间解码运动高斯;再以视频扩散模型增强渲染细节,并扩展到4D特征场。实验显示其用不超过逐像素方法0.007倍的高斯数,在多动态基准上取得SOTA或相当的新视角合成表现,并在大时间间隔、点跟踪和动态理解上更稳健。

CoFiDA-M: Concept-Aware Feature Modulation for Cross-Domain Adaptation with Image-Only Inference Figure 1
2026-06-01cs.CV

CoFiDA-M: Concept-Aware Feature Modulation for Cross-Domain Adaptation with Image-Only Inference

Nurjahan Sultana, Moi Hoon Yap, Xinqi Fan, Wenqi Lu

Department of Computing and Mathematics, Manchester Metropolitan University, probabilistic scores, this metadata is unavailable at test, available at GitHub ., Rich metadata available, NO metadata available, are available at training but absent in the real world. A concept-, tation (UDA) methods aim to adapt a model from a labeled, source domain to an unlabeled target domain. Many classi-, captions available for the target domain during adaptation, its prior unavailability. The availability of such rich meta-, key challenges are: (1) the concepts are available only dur-, unlabeled target domain.

2026-06-01视觉感知

针对皮肤癌模型从皮镜图像迁移到手机临床照片时性能骤降、且推理阶段无法获得医学概念元数据的问题,CoFiDA-M把 MONET 产生的病灶概念概率作为训练期特权信息,用 FiLM 调制教师网络特征,再让纯图像学生同时蒸馏预测和“语义编辑”后的特征。六个未见数据集评测显示,该学生在 AUROC 和黑色素瘤召回率上优于现有域适应方法,并保持无需概念输入的部署形态。

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation Figure 1
2026-06-01cs.CV

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation

Ruotong Liao, Guowen Huang, Qing Cheng, Guangyao Zhai, Lei Zhang, Xun Xiao, Thomas Seidl, Daniel Cremers, Volker Tresp

Ludwig Maximilian University of Munich, Technical University of Munich, University of Hamburg, Huawei European Research Institute

2026-06-01视觉感知生成模型

面向长时程机器人规划、自动驾驶等需要多事件视频的场景,现有 DiT 文生视频易把事件混合、顺序错乱或转场崩塌。TunerDiT 的关键洞察是去噪过程中存在文本作用从全局布局转向细节/运动的稳定拐点,并据此在推理时用事件分区注意力掩码与跨事件提示融合进行渐进控制,无需训练。在 Meve 基准上,该方法在最多四事件生成中于 8 项指标达到最佳,提升文本对齐、一致性和转场平滑性。

Recognizing Co-Speech Gestures in-the-Wild Figure 1
2026-06-01cs.CV

Recognizing Co-Speech Gestures in-the-Wild

Sindhu B Hegde, K R Prajwal, Andrew Zisserman

Visual Geometry Group, Dept. of Engineering Science, University of Oxford, instances, we provide precise word labels and frame-accurate temporal bound-

2026-06-01视觉感知

针对真实演讲中语义性伴随手势稀疏、形态多变且缺少精确标注,现有多模态模型难以把手势对应到具体词的问题,本文构建 GRW:15.7 万手工标注片段、150 类词汇,并给出词标签与帧级手势边界。基于该数据,作者分析了语音与手势的时间错位及不同词的可手势化倾向,训练语义判别、词级识别和时序定位模型,结果超过现有视觉语言模型;增益可能主要来自高质量数据规模与更长时序上下文建模。

SurGe: Improved Surface Geometry in Point Maps Figure 1
2026-06-01cs.CV

SurGe: Improved Surface Geometry in Point Maps

Karim Knaebel, Gonzalo Martin Garcia, Christian Schmidt, Ilya Fradlin, Lucas Nunes, Daan de Geus, Bastian Leibe

RWTH Aachen University, Eindhoven University of Technology

2026-06-01视觉感知

这篇论文关注单目点图重建中被平均位置误差掩盖的局部表面伪影,尤其是细杆、椅腿等薄结构的弯曲和振荡。作者提出点图法向指标来显式评估邻域诱导的表面朝向,并用尺度不变的点梯度匹配损失与基于 Neighborhood Attention 的渐进解码器改善局部几何。八个零样本基准上,SurGe 在全局 AbsRel 平均排名最佳,同时稳定提升局部点图与法向误差表现。

Joint Multi-Camera LiDAR Extrinsic Calibration via Learned Pairwise Initialization and Geometric Refinement Figure 1
2026-06-01cs.CV

Joint Multi-Camera LiDAR Extrinsic Calibration via Learned Pairwise Initialization and Geometric Refinement

Aziz Al-Najjar, Marzieh Amini, James R. Green, Felix Kwamena

Department of System and Computer Engineering, Carleton University, Ottawa, Canada, trajectories [20]. Multi-Calib [21] further studies scalable

2026-06-01视觉感知

针对多相机平台中逐对相机-LiDAR标定会忽略刚性耦合、导致系统级不一致的问题,本文用CMRNext先产生单相机外参和2D-3D匹配,再通过多帧BA联合优化,并加入重投影、单相机先验和相对位姿先验。在KITTI上达到0.89 cm、0.038°误差;在跨域Walkley上将平移误差由108.6 cm降至3.1 cm,说明收益主要来自显式多相机几何约束。

nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving Figure 1
2026-06-01cs.CV

nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving

Zhiyu Huang, Johnson Liu, Rui Song, Zewei Zhou, Ruining Yang, Yun Zhang, Tianhui Cai, Hanyin Zhang, Mingxuan Gao, Valeria Xu, Jiali Chen, Yishan Shen, Yiluan Guo, Tony (Xuewei)Qi, Jiaqi Ma

University of California, Los Angeles

2026-06-01数据集/基准

针对现有自动驾驶数据集偏重感知、预测或规划、难以监督长尾场景推理的问题,nuReasoning构建了2万段真实多城市场景,配套多相机、LiDAR、地图与目标标注,并加入空间、决策和反事实三类人工验证推理标注,同时用统一基准同时评估VLM推理与VLA规划。实验显示,在该数据上微调可提升驾驶问答能力,推理监督还能在推理文本不输出时改善规划表现。

EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision Figure 1
2026-06-01cs.CV

EGOSTREAM: A Diagnostic Benchmark for Streaming Episodic Memory in Egocentric Vision

Rosario Forte, Giuseppe Lando, Antonino Furnari

Department of Mathematics and Computer Science, University of Catania

2026-06-01视觉感知数据集/基准

面向具身/可穿戴智能体在连续第一视角视频中“记住什么、记多久”的评估缺口,EGOSTREAM将2250个问题按细节、空间、时间等7类记忆组织,并提出答案有效窗口区分遗忘与场景变化,扩展为8528个带回忆间隔的测试。统一Qwen3-VL基线显示,平均准确率会掩盖不同记忆机制的弱点;剪枝优于合并保留细节与时序,量化卸载改善超长程回忆,但最佳约45%且速度低于实时。

Vision-Language Models Suppress Female Representations Under Ambiguous Input Figure 1
2026-06-01cs.CV

Vision-Language Models Suppress Female Representations Under Ambiguous Input

Arnau Marin-Llobet, Simon Henniger, Mahzarin R. Banaji

School of Engineering and Applied Sciences, 2Department of Psychology, Harvard University

2026-06-01视觉语言视觉感知

本文关注VLM在性别不可见或模糊图像中的隐藏偏见:输出层面看似中性,并不代表内部表征无偏。作者提出零样本LALS,将视觉token激活投到文本嵌入空间,逐层逐块度量男女概念倾向。对15类职业、800余张模糊图和4个VLM的实验显示,模型在强制选择时普遍默认男性,甚至对护士、保姆等女性刻板职业也如此;内部常已编码女性关联,但后层会放大男性信号、抑制女性信号,衣物颜色等文化线索还会调制这种关联。

SMART: SMPLest-X Mesh Adaptation and RAFT Tracking for Soccer Pose Estimation Figure 1
2026-06-01cs.CV

SMART: SMPLest-X Mesh Adaptation and RAFT Tracking for Soccer Pose Estimation

Parthsarthi Rawat

bounding-box centre, then 50 steps aligning projected joints

2026-06-01视觉感知三维

针对足球转播视频中球员尺度小、视角远且相机持续变焦导致的三维世界坐标姿态估计困难,SMART将SMPLest-X做领域微调,引入骨盆深度监督与转播增强,并用RAFT密集光流跟踪相机、脚底平面锚定和两阶段时序平滑来降低漂移与抖动。在FIFA验证集上得分由基线1.053降至0.647,提升38.6%,测试集得分0.593。

Automated Prediction of Postoperative Pancreatic Fistula Using Preoperative Computed Tomography Figure 1
2026-06-01cs.CV

Automated Prediction of Postoperative Pancreatic Fistula Using Preoperative Computed Tomography

Ashok Choudhary, Chris Varghese, Leo Y. Li-Han, Frank G. Lee, Ellen L. Larson, Elizabeth B. Habermann, Cornelius A. Thiels, Hojjat Salehinejad

2026-06-01视觉感知

胰腺术后胰瘘风险高且传统评分依赖主观/术中因素,本文尝试仅用术前CT做可提前介入的风险分层。核心做法是自动胰腺分割后进行HU窗宽标准化、胰腺中心ROI裁剪,再用多种3D CNN/时空ResNet分类。5折验证中ResNet-(2+1)D-18和MC3-18优于轻量CNN3D,平衡划分AUC约0.73、自然患病率下约0.70–0.72,但仍需外部验证。

RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video Figure 1
2026-06-01cs.CV

RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video

Ulrich Prestel, Stefan Andreas Baumann, Nick Stracke, Björn Ommer

RayDer: Scalable Self-Supervised Novel View, keeps static-scene NVS as its target task: dynamic content is leveraged purely as scalable supervision, not, Data Availability, Novel view synthesis (NVS) should, in principle, be a highly scalable learning problem: given a set of posed views, pretext task for learning transferable features: camera-pose labels are noisy and expensive to obtain on real video at, scale, so removing them is precisely what makes abundant, unlabeled video usable for training the synthesis model, itself. Despite this, and large amounts of video being available on the internet [cf. 1], these methods rely on restrictive, the main obstacle to scalable self-supervised NVS is not data availability, but rather how current systems are designed to, compute is available, scaling remains brittle and inconsistent., A related challenge is robustness to the videos that are available at scale: unconstrained videos often contain dynamic, scene content, which exposes instabilities in existing methods and prevents direct training on such scalable data sources., We introduce RayDer, a unified, feed-forward transformer that enables scalable self-supervised novel view synthesis.

2026-06-01视觉感知强化学习

论文针对自监督新视角合成难以利用海量真实视频的问题:现有方法依赖静态场景或多网络管线,扩展时不稳定。RayDer将相机估计、场景重建与渲染统一到单个前馈Transformer,并用最小动态状态吸收视频中的运动干扰,使动态内容只作为监督噪声而非4D重建目标。实验显示其在数据、模型和算力上呈较干净的幂律扩展,优于静态数据混合,并在多基准零样本表现接近有监督方法。

Feature-Optimized Vision for Adaptive 3D Scene Reconstruction Figure 1
2026-06-01cs.CV

Feature-Optimized Vision for Adaptive 3D Scene Reconstruction

Eric Liang

2026-06-01视觉感知三维

论文针对三维重建中特征预算常被固定阈值或均匀分配浪费在重复纹理、低视差和不稳定点上的问题,将特征选择建模为几何感知的预算分配:按纹理、可重复性、区分性、预期三角化角和覆盖度打分并自适应选点。在四类合成多视图场景中,该策略相较随机、仅纹理和均匀网格基线取得最低总体 RMSE 与最高质量感知完整度;但实验仅为小规模合成原型,真实系统增益仍需验证。

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence Figure 1
2026-06-01cs.CV

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

2026-06-01视觉感知强化学习

论文针对现有视频基准难以同时评估真实多智能体场景中的感知、因果推理、反事实模拟与策略决策这一缺口,提出以篮球、足球、冰球等团队运动为“动态微世界”的 SVI-Bench,并通过多模态数据引擎对视频、动作标注、解说、战报和统计记录进行对齐,构建9项分层任务。实验显示,强模型在细粒度动作问答等感知任务约达73%,但随任务进入推理、模拟和自主证据整合性能显著下滑,最难的 agentic 任务最高仅5%,表明瓶颈不只是视觉识别,而在长期因果、规划与跨语料综合。

Personalize Your Large Vision-language Models With In-context Prompt Tuning Figure 1
2026-06-01cs.CV

Personalize Your Large Vision-language Models With In-context Prompt Tuning

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

Brown University, Columbia University, University of Alabama at Birmingham, Purdue University, Rutgers University, transforming these features alongside identity-label mappings into con-, Label embedddings, ing the conceptual mapping between a personalized label <sks1> and the visual, they reduce practical scalability, as each new concept requires vocabulary ex-, age and trains a cross-attention module to combine them with the concept label

2026-06-01视觉语言视觉感知

面向私有化视觉语言应用中快速学习用户特定人物、物体等新概念的需求,论文指出现有个性化方法依赖推理时训练,且在多图、多概念场景易混淆。ICPT 用轻量自适应概念投影器把参考图像和标签映射为连续提示,并以动态 token 分配和几何正则抑制环境偏差与概念干扰。在多任务、多 LVLM 骨干实验中,其个性化准确率优于 ICL 和既有方法。

Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization Figure 1
2026-06-01cs.CV

Internalizing Temporal Consistency in Video Object-Centric Learning without Explicit Regularization

Rongzhen Zhao, Zhiyuan Li, Juho Kannala, Joni Pajarinen

Department of Electrical Engineering and Automation, Aalto University, Finland, Department of Computer Science, Aalto University, Finland, Center for Machine Vision and Signal Analysis, University of Oulu, Finland

2026-06-01视觉感知

针对视频对象中心学习中 SSC 对比损失依赖跨帧一一匹配、在遮挡和消失重现时脆弱且带来额外开销的问题,论文提出 xSSC:把 slot 通道拆成静态语义与动态运动子空间,并用跨时刻重建仅靠标准重建误差内化时间一致性。实验显示其接入 RandSF.Q、SmoothSA 等基线后提升训练效率,并在视频对象发现与识别任务上取得新的 SOTA;PCA 和梯度分析支持了静动态解耦的解释性,但长时遮挡和相同实例区分仍是局限。

How can embedding models bind concepts? Figure 1
2026-06-01cs.CV

How can embedding models bind concepts?

Arnas Uselis, Darina Koishigarina, Seong Joon Oh

available at GitHub., University of T¨ubingen, T¨ubingen, Center

2026-06-01视觉感知

本文针对 CLIP 等视觉语言嵌入模型能识别颜色、形状等概念却难以判断“哪个属性属于哪个物体”的绑定失败,分析多物体场景嵌入的几何结构。核心洞察是:场景表示可加性地分解为物体表示,因此单模态探针能读出物体信息;但 CLIP 的概念到物体映射复杂、近似记忆化,难以跨模态泛化。受控实验表明,足够数据覆盖下从零训练的双编码 Transformer 可学习低复杂度、含乘性交互的绑定函数,并泛化到未见组合。

Enhancing Computer Vision Model Generalization in Warehouse Facilities: A Case Study on Anomaly Detection in Vertical Material Handling Systems Figure 1
2026-06-01cs.CV

Enhancing Computer Vision Model Generalization in Warehouse Facilities: A Case Study on Anomaly Detection in Vertical Material Handling Systems

Ruiliang Liu, Tina Dongxu Li, Joshua Migdal, Ken Meszaros, Trevor Dardik

by conducting the standard procedure solely in a laboratory setting, enables effective generalization from laboratory conditions to, examines computer vision model generalization from laboratory, (Fig 2). Our study encompasses three facilities: laboratory, While lab provides controlled conditions for camera mounting, The key to successful model generalization from laboratory to, effective generalization from laboratory conditions to diverse, computational resources and labeled data at each new site. Our, MODEL GENERALIZATION FROM LABORATORY TO, To enhance model generalization from laboratory environ-, laboratory settings) and test data (from operational warehouse, angle. Four distinct camera views were tested in the laboratory

2026-06-01视觉感知学习理论

论文针对仓库视觉模型每到新场地都需重新采集、标注和训练的高成本问题,以垂直物料搬运系统叉齿异常检测为例,主张通过前置工程化降低域偏移:选择单叉正视相机位、基于 AOI 的动态触发、比较 Mask R-CNN/RTMDet/Grounding DINO 并加入时间集成。实验显示实验室训练模型可迁移到不同仓库,Grounding DINO 实验室 mAP 约 96.1%,集成在理论上可将误报率由 6.61% 降低;但部分增益依赖相机安装条件,受场地约束时仍不稳定。

VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching Figure 1
2026-06-01cs.CV

VolFill: Single-View Amodal 3D Scene Reconstruction with Volumetric Flow Matching

Tuan Duc Ngo, Chuang Gan, Evangelos Kalogerakis

2026-06-01生成模型三维

单张 RGB 图像的三维重建通常只能恢复可见表面,难以为机器人交互和导航提供遮挡后的完整场景几何。VolFill 将问题转为生成完整 TUDF 体素场,用混合 3D VAE 压缩稀疏体表示,并以流匹配训练的 DiT 结合图像 token 与 MoGe2 可见几何先验进行补全。实验在 SCRREAM 和 NRGB-D 上优于 LaRI、NOVA3R 等基线,输出更连续、锐利的点云和网格。

VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning Figure 1
2026-06-01cs.CV

VisionPulse: Dynamic Visual Sparsity for Efficient Multimodal Reasoning

Hengbo Xu, Shengjie Jin, Yanbiao Ma, Zhiwu Lu

2026-06-01视觉语言视觉感知

针对大多模态模型推理时视觉 token 多、CoT 变长导致的高开销,论文指出视觉证据需求随解码步骤变化,静态预剪枝会错过后续关键区域且保留冗余上下文。VisionPulse 在每步用轻量视觉注意力质量估计保留预算,并选择当前最关键视觉 token。七个基准上每步仅保留 5% 视觉 token,推理轨迹缩短 11.2%,准确率基本不变。

Astra: a generalizable report generation foundation model for 3D computed tomography Figure 1
2026-06-01cs.CV

Astra: a generalizable report generation foundation model for 3D computed tomography

Zhuhao Wang, Fang Chen, Chaohui Yu, Zihan Li, Yuchao Zheng, Jing Wang, Xuan Yang, Jia Guo, Zhenlu Yang, Xingju Zheng, Yihua Sun, Haojie Han, Xiaoxiao Qin, Zhan Feng, Wenbo Xiao, Chao Zhu, Yuehua Li, Shipeng Zhang, Hao Luo, Yunsong Peng, Fan Wang, Hongen Liao

School of Biomedical Engineering, Tsinghua University., School of Biomedical Engineering, Shanghai Jiao Tong University., DAMO Academy, Alibaba Group., Hupan Laboratory., Department of Radiology, Guizhou Provincial People’s Hospital., Department of Radiology, The First Affiliated Hospital, Zhejiang University School, Department of Radiology, Shanghai Sixth People’s Hospital Affiliated to Shanghai, Jiao Tong University School of Medicine., Department of Biomedical Engineering, National University of Singapore., College of Computer Science and Technology, Zhejiang University., interpretable narratives, while requiring only readily available radiology reports for supervision

2026-06-01三维

面向CT阅片需浏览大量三维切片、报告撰写耗时且现有模型多局限单区域/单机构的问题,Astra用9万余胸腹部CT-报告对构建CTRgDB,通过报告风格统一、监督微调与强化学习提升术语一致性和细粒度诊断能力。在库内及6个外部队列上细粒度指标平均提升44.1%,临床协作中胸部报告起草提速29.6%、腹部报告完整性提升11.3%。

YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models Figure 1
2026-06-01cs.CV

YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models

Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

Guangdong University of Technology, Nanyang Technological University, Shenzhen TENCLASS Technology Co., Ltd.

2026-06-01视觉语言视觉感知

针对大视觉语言模型在生成中易受语言先验或粗糙视觉退化影响而产生幻觉的问题,YARD 将对比解码的退化分支移入解码器中层:浅层共享计算,在视觉 grounding 形成的关键层分叉,并用保留全局语义但缺少局部证据的 register tokens 替换 patch 视觉特征。实验显示,该免训练方法在多种 LVLM、生成式与判别式幻觉评测上优于现有对比解码,并显著降低两次完整前向带来的推理延迟。

Self-Tuning Regularization for Image Scanning Microscopy Figure 1
2026-06-01eess.IV

Self-Tuning Regularization for Image Scanning Microscopy

Sofia Agostoni, Lisa Cuneo, Christian Daniele, Giacomo Garré, Laurent Le, Alessandro Zunino, Giuseppe Vicidomini, Luca Calatroni

MaLGa Center, DIBRIS, University of Genoa

2026-06-01视觉感知

该文针对图像扫描显微 ISM 中 MID/s2ISM 依赖 Richardson–Lucy 迭代、需经验早停且易放大噪声的问题,提出基于 MAP 的自调显式正则化框架,将多帧 Poisson 保真项与 ℓ1/平滑 TV 先验结合,并用残差白化与高通谱扩展自动选参。仿真与真实荧光数据表明,该方法可稳定重建、减少伪影,在低光子条件下保持超分辨与光学切片能力。

Triangle Splatting SLAM Figure 1
2026-06-01cs.CV

Triangle Splatting SLAM

Nicholas Fry (1 and 2), Eric Dexheimer (2), Kirill Mazur (2), Paul H. J. Kelly (1 and 2), Andrew J. Davison (2) ((1) Software Performance Optimisation Group, Imperial College London, (2) Department of Computing, Imperial College London)

2026-06-01视觉感知

面向机器人等具身应用中对可渲染、可规划、可编辑显式几何的需求,本文用可微三角形“triangle soup”统一替代高斯/体素等地图表示,在在线渲染中同时做位姿跟踪与建图,并通过受限 Delaunay 实时生成连通网格,配合等边正则、窗口增密和剪枝保持几何稳定。Replica 与 TUM-RGBD 上其轨迹精度接近现有方法,3D 几何质量优于多种可微渲染 SLAM,并展示了在线网格编辑与碰撞检查等能力。

FSM-Net: An Efficient Frequency-Spatial Network for Real-World Deblurring Figure 1
2026-06-01cs.CV

FSM-Net: An Efficient Frequency-Spatial Network for Real-World Deblurring

Vinh-Thuan Ly

University of Science, VNU-HCM, Ho Chi Minh City, Vietnam, Vietnam National University, Ho Chi Minh City, Vietnam

2026-06-01强化学习

面向真实高分辨率去模糊中质量与算力难兼顾的问题,FSM-Net在轻量NAFNet框架上显式拆分频域与空域:用FFT频率注意力补回运动模糊削弱的高频结构,并在瓶颈加入线性复杂度的Cross-Gated Vision E-Branchformer建模全局上下文。配合多阶段课程训练和复合损失,在RSBlur/NTIRE 2026公开测试中以4.94M参数、159.35GMAC达到33.144dB PSNR并获第2名。

LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting Figure 1
2026-06-01cs.RO

LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting

Hannah Schieber, Dominik Frischmann, Victor Schaack, Angela P. Schoellig, Daniel Roth

* equal contribution 1 Hannah Schieber, Dominik Frischmann, Victor Schaack, and Daniel Roth are with the Technical University of Munich, Human-Centered Computing and Extended Reality Lab, TUM University Hospital, Clinic for Orthopedics and Sports Orthopedics, Munich Institute of Robotics and Machine Intelligence (MIRMI), Learning Systems and Robotics Lab

2026-06-01规划控制三维

面向未知室内导航中“TSDF几何安全但缺语义、GS外观丰富但几何偏软”的矛盾,LiftNav在GSFusion的TSDF+Gaussian Splatting双地图上,将YOLO检测结果经TSDF深度实时提升到3D语义目标,并用带hinge-loss碰撞项的连续B样条优化轨迹。Replica仿真中相较SplatNav语义目标可行率达100%,路径更短、jerk更低,但严格GT成功率受目标质心落入物体边界影响降至79%。

A Unifying View of Variational Generative Wasserstein Flows Figure 1
2026-06-01cs.LG

A Unifying View of Variational Generative Wasserstein Flows

Paul Caucheteux, Clément Bonet, Anna Korba

have demonstrated very good results and scalability, recent

2026-06-01生成模型

本文针对生成模型中扩散、GAN、流模型等目标和几何解释割裂的问题,将其统一到 Wasserstein 梯度流与 JKO 近端离散框架下。核心洞察是多类 f-散度、IPM 与 MMD 训练可写成参数化 JKO 方案,并证明 VWGF、S-JKO 等近期方法在理论和实践上等价。实验主要考察 JKO 正则对多种目标训练的影响,同时给出参数化流的投影梯度流解释。

A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation Figure 1
2026-06-01cs.CL

A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

Department of Computing, The Hong Kong Polytechnic University, BLV users. Data and code are available at:, quate for this human-centered setting with open-, Follower reward for human-centered post-training

2026-06-01视觉语言数据集/基准

论文针对视障辅助任务中人工评测昂贵、VLM-as-a-Judge 是否可信缺乏检验的问题,提出 VIABLE 基准,覆盖导航、场景/物体描述和第一视角操作三类场景,以有效性—公正性—稳定性框架和 12 类失败 taxonomy 构造 30 万+评判样本。实验发现现有 7 个评判模型整体不可靠,GPT-5.4 单失败诊断仅 52.6% 且自偏好达 94.2%,开源模型偏置和对抗脆弱性更明显;其 VIA-Judge-Agent 通过视觉证据抽取与流程化诊断带来约 +4.6 点诊断提升,并改善下游回答偏好。

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection Figure 1
2026-06-01cs.CL

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

Indian Institute of Technology (IIT), Kharagpur

2026-06-01视觉语言视觉感知数据集/基准

现有仇恨 meme 基准将修辞机制与目标群体混杂,难以诊断 VLM 是否真正做多模态推理。本文构建 FBHM:按25类功能机制与10个目标群体控制生成5000例,并提出冻结模型的可学习 steering vectors。实验显示,多种开源/闭源 VLM 在 FHM/MAMI 上表现较好但在 FBHM 近随机;LSV 仅用500个 steering 样本将 Macro-F1 提升约30点至约74–75,且基本不损伤源域性能。

DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory Figure 1
2026-06-01cs.CV

DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory

Zhenhao Yang, Xiaoshi Wu, Zhengyao Lv, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Kun Gai, Kwan-Yee K. Wong

The University of Hong Kong, 2Kling Team, Kuaishou Technology, controllable world models. However, maintaining fine-grained spatio-temporal, ing, and propose a fine-grained, learnable, and scalable memory for consistent, superior extrapolation capabilities, DecMem enables minute-level controllable long, video generation with high fidelity and consistency. Project page is available at, recent works have successfully achieved controllable generation through injecting action informa-, Such a computational inefficiency severely constrains the scalability towards minute-long video, To address the aforementioned limitations, we propose a fine-grained, learnable, and scalable, in preserving long-range memory. We then propose a fine-grained, learnable, and scalable

2026-06-01强化学习

面向可控世界模型的长视频生成,论文聚焦重访场景中历史场景难以被稳定记忆、导致时空不一致的问题。作者指出朴素全历史稠密注意力会带来计算低效与注意力分散,并提出 DecMem:用稀疏全局记忆做块级细粒度检索,用锚定局部记忆稳定近期上下文。实验显示其相较现有显式/隐式记忆方法在分钟级生成中同时提升一致性、画质与推理效率。

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization Figure 1
2026-06-01cs.CV

Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization

Haolin Deng, Xin Zou, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

data are available at https://github.com/, OPPO-Mente-Lab/IC-VCO., The Hong Kong University of Science and Technology, (Guangzhou) 2OPPO AI Center 3The Hong Kong University, context [m, m′] and applies an anchor prompt extension step to specify the target image for preference labels. This design ensures a

2026-06-01视觉语言优化算法

针对多模态模型在DPO后训练中仍易忽视图像、产生幻觉的问题,论文指出现有视觉偏好DPO因切换图像上下文导致配分函数不匹配,且负样本过粗会诱发捷径学习。其IC-VCO把原图与对比图放入同一多图上下文,并用VCDist对齐单图推理,同时通过局部语义编辑构造硬负样本;五个基准上取得总体最佳表现,说明细粒度视觉对比监督有助于缓解幻觉。

Interpretability Without Tradeoffs: Disentangling Polysemanticity At Equal Predictive Performance Figure 1
2026-06-01cs.LG

Interpretability Without Tradeoffs: Disentangling Polysemanticity At Equal Predictive Performance

Doğukan Bağcı, Bernt Schiele, Simone Schaub-Meyer, Jonas Fischer, Robin Hesse

Max Planck Institute for Informatics, SIC, Department of Computer Science, TU Darmstadt, the same. It requires no explicit training, no labels, and can be applied to pretrained, In short, ELUDe offers interpretability (almost) without a tradeoff: clearer, scalable, fine-grained manipulation [17, 45], or require supervised training [29], limiting their scalability., manipulable units (explicit), exact preservation of the original model’s behavior (lossless), and scala-

2026-06-01视觉感知

针对神经元常混合响应多个无关概念、导致可解释分解与预测保真度相互牺牲的问题,论文提出 ELUDe:通过重组相邻层权重,把多义单元拆成可检查、可干预的子单元,并保证子单元求和精确恢复原计算,无需训练或标签。在 DINOv2、监督 ViT 等视觉模型上,ELUDe 在 ImageNet 准确率与 R² 保持原模型水平的同时提升单义性评分,并展示了更稳定的分解和视觉语言模型 steering 的可用性。

MoE-dqINR: A Unified Mixture-of-Experts Implicit Neural Representation Framework for Scan-Specific Dynamic and Quantitative MRI Reconstruction Figure 1
2026-06-01eess.IV

MoE-dqINR: A Unified Mixture-of-Experts Implicit Neural Representation Framework for Scan-Specific Dynamic and Quantitative MRI Reconstruction

Yinzhe Wu, Fanwen Wang, Zhenxuan Zhang, Zi Wang, Chengyan Wang, Guang Yang

Department of Bioengineering and I-X, Imperial College London, London, SW7 2AZ, United Kingdom, Cardiovascular Research Centre, Royal Brompton Hospital, London, SW3 6NP, United Kingdom, National Heart and Lung Institute, Imperial College London, London, SW7 2AZ, United Kingdom, School of Biomedical Engineering & Imaging Sciences, King’s College London, London, WC2R 2LS, Shanghai Pudong Hospital and Human Phenome Institute, Fudan University, Shanghai, China, International Human Phenome Institute (Shanghai), Shanghai, China

2026-06-01三维

该文针对动态与定量 MRI 中欠采样多线圈重建既需共享空间结构又需适配不同时间/对比状态、且现有 scan-specific INR 优化耗时高的问题,提出 MoE-dqINR:用共享空间专家表示可复用图像内容,并由状态条件路由组合生成各帧或对比图像。实验称其在 cine 与 T1 mapping 上保持更好重建质量,同时将单次扫描优化降至约 30 秒。

TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens Figure 1
2026-06-01cs.CV

TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens

Qingcheng Zhao, Yifang Pan, Karan Singh

University of Toronto

2026-06-01视觉感知

TokTalk针对现有对话头像需经历语音识别、文本生成、语音合成再驱动表情而带来的延迟与情感信息丢失,提出直接利用Audio-LLM流式音频token生成3D面部运动的并行架构。其核心洞察是这些token比ASR特征保留更多情绪和副语言信息,并用chunk式条件流匹配与轻量适配层实现跨模型接入。实验显示其延迟接近实时方法,感知质量、表现力和可控性优于对比方案。

Authentication of Copy Detection Patterns via Cross-Camera Dual-Synthetic Referencing Figure 1
2026-06-01cs.CV

Authentication of Copy Detection Patterns via Cross-Camera Dual-Synthetic Referencing

Ivan Oleksiyuk, Roman Chaban, Slava Voloshynovskiy

Department of Computer Science, University of Geneva, Switzerland, strength lies in combining low cost, scalability, and strong, available

2026-06-01视觉感知

针对CDP防伪中数字模板无法反映打印随机性、手机成像差异又削弱比对可靠性的问题,论文加入生产端注册拍摄,用数字模板与注册图像共同生成面向验证相机的双合成参考,并以互信息解释其信息增益。实验显示该方法在高低端手机、小区域CDP和机器学习复制攻击下均提升认证准确率,使iPhone XS等低端设备也能达到可靠验证。

SAM for Robust Mitochondria Instance Segmentation in Fluorescence Microscopy Figure 1
2026-06-01cs.CV

SAM for Robust Mitochondria Instance Segmentation in Fluorescence Microscopy

Suyog Jadhav, Dilip K. Prasad, Krishna Agarwal

UiT The Arctic University of Norway

2026-06-01视觉感知安全鲁棒

论文针对荧光显微线粒体实例分割中低对比、衍射模糊、密集重叠及人工标注稀缺的问题,提出用物理仿真的合成线粒体图像和实例掩码微调 SAM,并在推理时聚焦前景提示以更好处理重叠实例。实验在真实手工标注数据上显示,相比 Nellie 和 μSAM,方法提升了精度与平均 Dice、减少碎片化;但召回仍不足,部分线粒体会漏检。

Topologically Consistent Multi-view 3D Head Reconstruction via Coarse-Guided Layered Surface Sampling Figure 1
2026-06-01cs.CV

Topologically Consistent Multi-view 3D Head Reconstruction via Coarse-Guided Layered Surface Sampling

Timo Bolkart, Daoye Wang, Prashanth Chandran

scalability for dense topologies (≥10𝑘vertices) and introduces surface noise., produces noise and holes in specular regions, necessitating labor-, per frame, and labor-intense as it requires manual clean up and hy-, scale datasets. However, while these methods offer superior scalabil-, lacking semantic labels or consistent topology. While VGGT and

2026-06-01三维

面向数字人数据的大规模注册,传统 MVS+非刚性配准耗时且需清理,现有前馈方法又受体素特征内存限制、难扩展到高密网格。SHELLS 用 DINOv2+LoRA 提取多视图特征,先估计粗网格,再沿表面法线构建分层采样壳,由 Transformer 整体预测 18k 顶点拓扑一致头模。仅用合成数据训练即可泛化到真实采集,推理显存约降 88%,速度 0.08s,注册中位误差降低 21%–29%。

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions Figure 1
2026-06-01cs.CV

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

Shanghai Qi Zhi Institute, Tsinghua University, Tongji University

2026-06-01视觉语言视觉感知

本文针对驾驶 VLA 中“语言决策说得对但轨迹不执行”的语言-动作鸿沟,提出 DriveMA:把加速、减速、转向、变道等元动作作为可验证中间接口,由专家轨迹自动标注,并通过规则投影检查生成轨迹一致性,再结合动作中心训练与按生成轮次分配信用的强化学习显式对齐决策和规划。结果显示,2B/4B 模型在 WOD-E2E 上 RFS 达 8.060/8.079 刷新 SOTA,并在 NAVSIM 获得有竞争力的闭环表现。

Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation Figure 1
2026-06-01cs.CV

Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation

Nan Bao, Yifan Zhao, Wenzhuang Wang, Jia Li

mains. The source code is publicly available at, for controllable generation (e.g., Liu et al., 2022, Mou et al., 2024). Among various controllable paradigms, State Key Laboratory of Virtual Reality Technology and Sys-, tems, School of Computer Science and Engineering and Qingdao, Research Institute, Beihang University, China. Correspondence to:, alization, allowing for controllable generation of complex, layout-image pairs in atypical conditions is labor-intensive., of training samples (e.g., a few shots) are available. This

2026-06-01视觉感知

本文关注少样本非典型场景下布局到图像生成的失效:现有 L2I 方法在水下、航拍等域中因语义身份与局部纹理细节纠缠,容易产生结构破碎和几何畸变。作者将其概括为“表示碎片化”,并提出将语义锚点与可重组视觉原语解耦,再用显著性约束保持前景一致。实验显示在 5-shot 设置、多个非典型域上,相比 MIGC、CC-Diff 等方法提升了图像保真度和布局对齐,但仍受小目标分辨率、外部 DINOv2/Grad-CAM 先验和 SD1.5 骨干限制。

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models Figure 1
2026-06-01cs.CV

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

Beijing University of Posts and Telecommunications, Bei-, jing, China 2State Key Laboratory of Networking and Switching, Technology, Beijing University of Posts and Telecommunications, Beijing, China 3School of Materials Science and Engineering, Shanghai Jiao Tong University, Shanghai, China 4China Mobile, Research Institute, Beijing, China 5College of Computing and, Data Science, Nanyang Technological University, Singapore. Cor-, tions assume that sufficient localization cues are available in, tion setting via a controllable camera model, enabling agents

2026-06-01视觉语言数据集/基准

现有图像地理定位多依赖单张或全景静态输入,难以评估模型像人一样主动取证和整合视角的能力。ERGeoBench用2207个全球街景全景构建单视角、全景和具身视角三类任务,允许通过偏航、俯仰、缩放逐步观察,并从感知、空间、常识和定位推理四维诊断MLLM。实验显示模型能把握国家/城市等高层语义,但在细粒度度量定位、跨视角空间一致性和低层几何推理上仍明显不足。

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning Figure 1
2026-06-01cs.CR

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

CISPA Helmholtz Center for Information Security, Institute of Science Tokyo, Wuhan University, code is available at https://github.com/TrustAIRLab/B, Correct Labels, Target Labels, ters and X denotes the input space. Given a labeled down-, fθ : Xpre →RM, and a pre-defined label mapping function, labels in T and Tpre, the mapping function h is designed to, likelihood of the correct label y

2026-06-01视觉感知

视觉提示学习复用冻结骨干模型,带来供应链式后门风险,但以往多攻击提示本身。BadBone 将后门植入骨干,并用双层优化模拟下游提示学习,形成“干净提示+触发器”共同激活的隐蔽机制。实验覆盖3种模型和3个数据集,定向/非定向攻击均保持预训练与下游效用,CIFAR-10上ResNet50定向成功率达98.66%,且多数现有模型级防御难以拦截。

Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval Figure 1
2026-06-01cs.CV

Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval

Alicja Dobrzeniecka, Filip Szatkowski, Sebastian Cygert, Szymon Lukasik, Bartlomiej Twardowski

NASK National Research Institute, IDEAS Research Institute, Warsaw University of Technology

2026-06-01视觉语言

本文指出视觉语言模型的持续学习长期套用分类增量范式,但检索更依赖全局一致的跨模态嵌入,小漂移也会破坏排序。作者构建覆盖多视觉域、含 OOD 评测的持续多模态检索框架,并发现常见 CIL/检索方法收益有限;进一步提出 DAR,用原型路由选择任务适配器,并在不确定样本上动态合并适配器。实验显示 DAR 在异构检索基准和 OOD 场景中均优于既有基线。

HiERO-StepG @ Ego4D Step Grounding Challenge: hierarchical activity understanding enables zero-shot step grounding Figure 1
2026-06-01cs.CV

HiERO-StepG @ Ego4D Step Grounding Challenge: hierarchical activity understanding enables zero-shot step grounding

Andrea Zenotto, Simone Alberto Peirone, Francesca Pistilli, Giuseppe Averta

chical taxonomy of goal-oriented activity labels. Here, we

2026-06-01视觉语言

本文针对步骤定位依赖大量过程边界标注、难以泛化到新任务的问题,提出零样本 HiERO-StepG:利用 HiERO 从无脚本第一视角视频叙述中学习功能相似动作的层级表征,并在推理时融合细粒度节点与粗粒度簇相似度,用 Viterbi 强制步骤时间单调,再通过边界扩展和 NMS 抑制噪声。其在 Ego4D Step Grounding 2026 测试榜 R1@IoU0.3 达 56.27%,排名第二,且无需步骤级监督。

Latent Geometric Chords for Query-Efficient Decision-Based Adversarial Attacks Figure 1
2026-06-01cs.CV

Latent Geometric Chords for Query-Efficient Decision-Based Adversarial Attacks

Ei Hmue Khine, Yao Li, Jiebao Sun, Shengzhu Shi, Zhichang Guo, Boying Wu

versarially trained robust models. The source code is available, The authors are with the School of Mathematics, Harbin Institute of, labels. Therefore, decision-based (hard-label) attacks, which, Without gradients or continuous scores, hard-label attackers, to estimate the available path. To mitigate this excessive, drastically limits the available directions for adversarial move-, perturbations relying exclusively on top-1 predicted labels. Ex-

2026-06-01视觉感知

本文针对决策式黑盒攻击中像素扰动易产生高频伪影、潜空间攻击又受低维流形和重建误差限制的问题,提出 LGC/LGC-H:在压缩语义流形中做曲率感知几何搜索,并用 RAG 将潜在“几何弦”残差叠加回原图以扩大搜索空间、保留细节。实验显示其在 5000 次查询下可达 SSIM>0.99、LPIPS<0.01,扰动更小,并能跨数据集攻击及突破对抗训练模型。

TALON: Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation Figure 1
2026-06-01cs.CV

TALON: Token-Aligned Lightweight Adapters for 6-DoF Spacecraft Pose Estimation

Abid Ali, Arunkumar Rathinam, Djamila Aouada

2026-06-01三维

本文针对单目航天器6DoF位姿估计常逐帧处理、缺少时序信息,而全量微调或光流模块又成本高且易遗忘的问题,提出在冻结ViT自注意力前插入轻量3D时空适配器,并用patch-token对齐损失把特征锚定到关键点几何。该设计以少于5%额外参数联合建模时序与关键点结构,在SPADES上位姿误差较前SOTA降约50%,SwissCube ADD-0.1d提升21.8%,SPADES到SPARK真实域零样本误差降低4.7倍。

Fixed-Point Masked Generative Modeling Figure 1
2026-06-01cs.LG

Fixed-Point Masked Generative Modeling

Andrea Miele, Yiming Qin, Alba Carballo-Castro, Justin Deschenaux, Pascal Frossard

Controllable-depth / looped / DEQ-style models, transformers, and DEQ-style models provide controllable effective depth by repeatedly applying

2026-06-01生成模型

这篇论文针对掩码生成模型每个去噪步都运行完整双向 Transformer、训练贵且低采样预算质量差的问题,提出 FP-MGMs/CoFRe:用共享注意力层的定点求解器替代部分去噪器,并加入跨步一致性损失和区分未变、仍掩码、新揭示 token 的三状态复用。结果显示在 OpenWebText 上参数降 38.8%、训练时间降 11.5%、显存降 16.9%,96 次前向预算下困惑度从 830.8 降至 101.8;ImageNette 上训练时间和显存也约减半且 FID 全预算提升。

Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education Figure 1
2026-06-01cs.CV

Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education

Junling Wang, Boqi Chen, Heejin Do, Mubashara Akhtar, April Yi Wang, Mrinmaya Sachan

Department of Computer Science, ETH Zurich, ETH AI Center, In this work, we focus on primary school level, terviewed ten primary-school mathematics teachers, Visuals in Teaching Primary-School Arithmetic

2026-06-01视觉感知强化学习数据集/基准

面向低年级算术教学中按需生成配图的需求,论文提出 equation-to-visual 任务与 E2V-Bench,基于教材分析和教师访谈定义颜色、物体、空间、容器四类视觉表示及自动正确性指标。对9个T2I模型的评测显示,即使最强模型也常因数量不准和关系结构破坏而失败,DSL参考法达98.3%准确率;提示改写、重生成和拒绝采样微调可带来改进,但仍暴露出现有模型数值与关系 grounding 不足。

Probabilistic Precipitation Nowcasting with Rectified Flow Transformers Figure 1
2026-06-01cs.CV

Probabilistic Precipitation Nowcasting with Rectified Flow Transformers

Johannes Schusterbauer, Jannik Wiese, Nick Stracke, Timy Phan, Björn Ommer

Munich Center for Machine Learning (MCML), scaling. Code available here: https://github.com/, probabilistic, fast, and scalable., (1) easy to train, (2) scalable, and (3) able to quantify un-, FREUD provides a fast, scalable first stage for, • A simple, scalable first stage tailored for weather now-, • Scalable and robust latent-space nowcasting.

2026-06-01生成模型

短临降水预报需要快速且能表达不确定性的高分辨率生成模型,但现有潜空间方法常用确定性压缩,极端降水下会丢失解码不确定性。论文提出 FREUD:逐帧 Transformer 编码避免未来泄漏并支持连续更新,统一的 rectified-flow 视频解码器保持时序一致性,并用随机 tanh 正则构造有界潜空间。结合 masking-based rectified-flow 预测后,在 SEVIR 上取得 CRPS 和感知指标的 SOTA,且模型规模、集成数和采样步数 scaling 还能继续带来增益。

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration Figure 1
2026-06-01cs.CV

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

Jun Wang, Xiaohao Xu, Xiaonan Huang

University of Michigan, Ann Arbor

2026-06-01机器人视觉语言视觉感知安全鲁棒

面向人机共处场景,论文指出VLM仅会描述画面不足以承担安全监控,关键在于将视觉证据与机器人形体、视角、深度和运动绑定以判断当前或即将碰撞。作者提出Habitat 3.0中的TouchSafeBench,含多视角RGB-D、轨迹和仿真接触标签,评测状态分类与提前预警。结果显示先进/机器人VLM最佳Macro-F1仍低于50%,深度输入不自动转化为碰撞依据,机器人—场景接触尤为薄弱。

The Regularizing Power of Language-Training Deepfake Detectors Figure 1
2026-06-01cs.CV

The Regularizing Power of Language-Training Deepfake Detectors

Benedikt Hopf, Zongwei Wu, Radu Timofte

Computer Vision Lab, CAIDAS, University of Würzburg, Germany, labels. By rewarding this “explain-then-classify” behavior, we explicitly, which limits scalability and cross-dataset adaptability

2026-06-01视觉感知

针对深伪检测易过拟合数据集特定低层伪影、且解释通常依赖人工文本标注的问题,本文将语言视为正则化信号:用冻结专用检测器与LoRA调优的MLLM组成双编码器,先做二分类对齐,再用仅基于真假标签的GRPO鼓励“先描述伪影再分类”。结果显示,该训练促使模型偏向可描述、跨域更稳健的高层线索,在跨数据集AUC上优于现有方法,最佳约93.95%,且推理时可省略推理链仍保留增益。

Student Capacity Moderates Knowledge Distillation Effectiveness: A Systematic Study Across ResNet Teacher-Student Pairs on CIFAR-10 Figure 1
2026-06-01cs.LG

Student Capacity Moderates Knowledge Distillation Effectiveness: A Systematic Study Across ResNet Teacher-Student Pairs on CIFAR-10

Umut Onur Yasar

pp — an order of magnitude larger than any KD gain. All code and results are available at, training a small student model on hard one-hot labels alone, the student also learns from the soft

2026-06-01视觉感知

本文关注知识蒸馏中“更强教师是否总能带来更好学生”的实际条件,系统比较 CIFAR-10 上 ResNet R50/R34/R18 组合的 Logit-KD 与 Feature-KD。核心洞察是学生容量会调节蒸馏收益,R34 学生明显比 R18 更能吸收教师信息;同时指出 CIFAR 输入 stem 修正和 Feature-KD 投影层梯度裁剪会显著影响结论。实验中最佳 R50→R34 Feature-KD 从 95.25% 提升到 95.55%,但 KD 增益远小于架构修正带来的 5 个百分点以上提升。

From Local Geometry to Global Pseudo Labeling for Robust Positive Unlabeled Learning under Covariate Shift Figure 1
2026-06-01cs.CV

From Local Geometry to Global Pseudo Labeling for Robust Positive Unlabeled Learning under Covariate Shift

Firas Gabetni, Alexandre Rocchi Henry, Nacim Belkhir, Ziyi Liu, Gianni Franchi

From Local Geometry to Global Pseudo-Labeling, for Robust Positive–Unlabeled Learning under, approaches typically rely on fully supervised training, requiring labeled, effectively addressed with weaker supervision using Positive–Unlabeled, Keywords: Covariate shift · Positive Unlabeled Learning · Pseudo la-, and synthetic images. While effective, such methods require labeled examples, unavailable or expensive to curate. This raises a fundamental question:, tive–Unlabeled (PU) learning. This field studies binary classification when only, labeled positive examples and unlabeled data are available. This paradigm natu-, detection [28], where negative labels are scarce or unreliable. Surprisingly, to the, treat the unlabeled dataset as a mixture of low-dimensional submanifolds cor-, notation (S-PUNA), a geometry-aware pseudo-labeling framework for covari-

2026-06-01安全鲁棒

本文关注少被单独处理的协变量偏移检测:实际部署中往往只有源域正样本和未标注混合数据,难以获得完整负样本监督。作者将问题建模为PU学习,提出S-PUNA,利用特征空间局部流形和双向kNN伪标注逐步发现偏移样本,并用负集协方差谱熵稳定作为停止准则以抑制漂移。实验显示其在PU设置下达到SOTA,性能接近全监督方法,并能跨多类偏移迁移。

Vanilla ViT for Automotive Point Cloud Semantic Segmentation Figure 1
2026-06-01cs.CV

Vanilla ViT for Automotive Point Cloud Semantic Segmentation

Gilles Puy, Nermin Samet, Alexandre Boulch, Spyros Gidaris, Tuan-Hung VU, Renaud Marlet

ficiency of our method. Code and models are available at, mantic labeling while keeping the overall architecture sim-

2026-06-01视觉感知三维

本文针对车载激光点云语义分割长期依赖稀疏卷积、U-Net层级结构或2D投影而难以与通用Transformer统一的问题,验证非层级 vanilla ViT 可直接处理3D点云。核心在于3D点嵌入到粗BEV网格的tokenizer、融合高分辨率点特征的轻量解码头,以及PillarMix+几何增强。实验在nuScenes、SemanticKITTI和Waymo上达到或超过现有方法,说明专用混合架构并非必要。

Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning Figure 1
2026-06-01cs.CV

Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning

Wenlun Zhang, Jun Yin, Kentaro Yoshioka

Keio University, Tsinghua University, while MED integrates multiple specialized detectors to collaboratively handle diverse detection

2026-06-01视觉感知

面向真实场景中低光、雨雾、水下失真及目标分布变化导致固定检测器/固定恢复流水线泛化差的问题,论文将检测建模为由 MLLM 代理动态决策的流程:DetAS 自适应选择图像恢复工具与多专长检测器,DetAS-X 进一步从少量标注数据收集节点级经验以指导推理。六个基准上其相对 MLLM 检测基线平均 F1 提升 28.36%,DarkFace 最高提升 37.01%。

Guidance for Low-Level Perceptual Editing in Unconditional Diffusion Models Figure 1
2026-06-01cs.CV

Guidance for Low-Level Perceptual Editing in Unconditional Diffusion Models

Shreyansh Modi, Akshat Tomar, Aarush Aggarwal

†Indian Institute of Technology Roorkee.

2026-06-01生成模型

这篇论文关注无条件扩散模型难以直接控制锐度、对比度、饱和度等低层感知属性的问题,并指出传统 h-space activation patching 在全局低层编辑中会因 U-Net 解码器干扰而失效。作者用成对退化/干净图像提取“退化概念向量”,再将瓶颈 patching 与负向 classifier-free guidance 结合,使采样远离退化流形且无需重训练。在 CelebA-HQ 上,该方法相对基线降低 FID,并在锐化、饱和、对比增强指标及人工偏好中优于标准 patching。

Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models Figure 1
2026-06-01cs.CV

Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models

Jiacheng Lu, Haoyi Zhu, Sipei Yi, Enze Xie, Yu Li, Cheng Zhuo

Zhejiang University

2026-06-01视觉感知强化学习

交互式视频世界模型在长轨迹生成中受上下文增长、二次注意力和多步去噪拖累,10 秒视频可需数百秒。Light Interaction 的关键洞察是交互轨迹本身可指示计算是否必要:按相机位姿相似度裁剪空间记忆、按局部潜变量动态调节时间窗口,并在重访场景复用早期去噪输出,同时用 Triton 融合的 AR 友好块稀疏注意力落实加速。在 HY-WorldPlay 与 Matrix-Game-3.0 上无需重训最高加速 2.59×,HY-WorldPlay 相对原模型 PSNR 为 24.81。

BIAS-ID: A Framework for Analyzing Transformation Biases in AI-Generated Image Detectors Figure 1
2026-06-01cs.CV

BIAS-ID: A Framework for Analyzing Transformation Biases in AI-Generated Image Detectors

Jonas Ricker, Asja Fischer, Erwin Quiring

Ruhr University Bochum

2026-06-01视觉感知

针对AI生成图像检测器在真实场景中性能骤降、可能依赖压缩/缩放/方向等训练集伪相关的问题,论文提出BIAS-ID,不只看AUC等性能变化,而是用变换前后预测分数偏移及聚合变换敏感度ATS量化偏向真实或伪造类别的程度。作者在两个数据集、六个检测器和五类变换上验证,发现多种SOTA检测器存在系统性变换偏置,且部分偏置难以从常规性能指标中看出。

SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes Figure 1
2026-06-01cs.CV

SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

Tianhui Liu, Jie Feng, Zhiheng Zheng, Shengyuan Wang, Yiming Guo, Yanxin Xi, Hangyu Fan, Yong Li, Pan Hui

The Hong Kong University of Science and Technology (Guangzhou), Zhongguancun Academy, Tsinghua University, Helsinki University

2026-06-01视觉语言三维

这篇论文针对现有空间推理评测多停留在“观察后答题”、难以检验行动后状态跟踪的问题,提出 SpatialAct:在3D模拟器中让VLM执行移动、旋转、缩放等高层语义动作,并通过多视角反馈做单步修复与多轮布局 refinement。结果显示,模型在基础空间题上可达约80%,但多轮修复最优仅0.411 Repair Rate、0.206 Scene Success Rate,显著低于人类,暴露出推理到行动的断层。

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization Figure 1
2026-06-01cs.CV

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

Mohammed Asad Karim, Vinay Kumar Verma

ples available at inference time. In contrast to traditional, labels during training to reduce reliance on true category, ence continues to rely on original category labels, creating, even with pseudo-label training, models frequently underuti-, and query prompts. Instead of relying on true labels or, pseudo-labels, our method optimizes in-context attention us-, localization without relying on category labels or prior, of pseudo-label and visual grounding, however pseudo label, model have not learned the pseudo label., canonical labels, motivating methods that relax or adapt

2026-06-01强化学习优化算法

本文针对VLM在上下文目标定位中依赖类别名和语义先验、难以处理无名或实例级目标的问题,提出FOCUS:训练时完全移除类别文本,用支持框到查询图的注意力约束强化纯视觉对应,并通过GRPO直接优化边界框误差。实验显示,7B模型在该目标下可超过最高72B的基线,消融也支持注意力优化与奖励优化的贡献。

PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet) Figure 1
2026-06-01cs.CV

PolSAR Image Classification using a Hybrid Complex-Valued Network (HybridCVNet)

Mohammed Q. Alkhatib

2026-06-01视觉感知

针对 PolSAR 分类中实值 CNN/ViT 容易丢失复数相位信息、CNN 又偏局部而 ViT 需建模全局依赖的问题,HybridCVNet 将复值 3D/2D CNN 作为极化-空间特征提取器,并把 ViT 层复值化以处理相干矩阵序列,从而同时利用局部散射特征与长程关系。在 Flevoland 上总体精度达 97.39%,San Francisco 仅 1% 采样时 Kappa 为 0.972,优于多种实值 CNN/Transformer 基线。

QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer Figure 1
2026-06-01cs.CV

QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer

Zhizhen Pan, Hesong Wang, Huan Wang

Westlake University, Beijing University of Posts and Telecommunications, †Work done as a visiting research intern at ENCODE Lab, Westlake, University.

2026-06-01视觉感知

QVGGT针对VGGT 1.26B参数导致机器人、UAV和AR等端侧3D感知难部署的问题,提出后训练量化方案:按块敏感度做选择性混合精度,过滤高方差相机/寄存器token并用PCA补偿几何信息,再以多头监督和几何一致性搜索量化尺度。实验显示其在W4A16下接近无损,模型/显存约降3–4.9倍,并在硬件上最高加速2.8倍。

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving Figure 1
2026-06-01cs.CV

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving

Jiahui Li, Jiawei Sun, Zixiang Ren, Ming Liu, Jiamin Shi, Ruiteng Zhao, Zhiyang Liu, Liying Liu, Zuoguan Wang, Kaidi Yang

National University of Singapore

2026-06-01三维

这篇论文针对感知自由端到端驾驶中,密集图像 token 被压缩为少量 scene tokens 后仅受规划损失监督、易冗余且丢失细粒度信息的问题,提出 NTR:训练时用自蒸馏的 masked latent reconstruction 直接约束 scene-token 瓶颈,并用基础模型语义先验强调车辆、可行驶区域和交通控制等结构,推理时不增加开销。在 Waymo E2E 与 NavSim1/2 上取得 SOTA,并显示 token 冗余降低、有效秩提升;但语义先验质量和额外训练成本仍是限制。

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning Figure 1
2026-06-01cs.CV

Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning

Hao Zheng, Hu Wang, Tiantian Zheng, Prajjwal Bhattarai, Tuka Alhanai

New York University Abu Dhabi, Abu Dhabi, United Arab Emirates, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates, x-labs-xyz/Polyphony-Dual-hand-Action-, frame-wise action labels, to construct action-level tokens, cross-attention. However, relying on simple action labels, wise action labels into verb, object, and tool components, to predict frame-wise action label sequences Y h = {yh

2026-06-01视觉感知生成模型

面向装配、烹饪等双手任务,论文指出逐帧分割同时受左右手依赖、视觉不对称、主导手梯度压制和细粒度语义歧义影响。Polyphony用交替训练的共享ADH-ViT平衡双手表征,引入动词-物体-工具语义条件,并用扩散分割结合跨手特征融合。其在HA-ViD、ATTACH上刷新结果,最高提升16.8点,在Breakfast达82.5%,但语义描述仍需人工构造。

Remembering by Reconstructing: Domain Incremental Learning With Test-Time Training on Video Streams Figure 1
2026-06-01cs.CV

Remembering by Reconstructing: Domain Incremental Learning With Test-Time Training on Video Streams

Jonathan Swinnen, Tinne Tuytelaars

2026-06-01视觉感知

面向视频等连续流中域分布随时间变化、传统域增量学习难以在未知域身份下兼顾旧域的问题,论文反其道而行接受“临时遗忘”:为各域训练 LoRA,并在测试时仅用 MAE 重建损失在线优化 LoRA 权重来找回当前域。实验覆盖动作识别和语义分割,显示相比多种基线性能更稳;但推理需额外训练,域数增多时开销与可扩展性仍是限制。

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning Figure 1
2026-06-01cs.CV

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

Visual AI Lab, The University of Hong Kong 2Independent, Researcher 3University of Science and Technology of China. Cor-, the grounded CoT. Specifically, we manually label target

2026-06-01强化学习

论文动机是细粒度视觉问答中显式框/裁剪式视觉 CoT 在推理时未必可靠,错误定位还会干扰答案生成。作者的关键洞察是定位能力可被内化到文本 CoT,提出 iVGR:用强化学习双流训练,让文本推理通过一致性奖励对齐高质量带框推理。实验在 Qwen2.5-VL、Qwen3-VL 及多项高分辨率/细粒度基准上优于现有方法,并仍可结合测试时裁剪工具;局限是依赖框标注和外部 LLM 打分。

Redefining Instance Matching: A Unified Framework for Part-Aware Matching in Panoptic Segmentation Evaluation Figure 1
2026-06-01cs.CV

Redefining Instance Matching: A Unified Framework for Part-Aware Matching in Panoptic Segmentation Evaluation

Erik Großkopf, Soumya Snigdha Kundu, Hendrik Möller, Nicolas Münster, Mehdi Astaraki, Paula Tamara Buzduga, Kerstin Ritter, Benedikt Wiestler, Jan Kirschke, Jonathan Shapey, Tom Vercauteren, Florian Kofler

Hertie Institute for AI in Brain Health, University of Tübingen, Germany, King’s College London, UK, Technical University of Munich, Germany, Stockholm University, Sweden, Semantic segmentation assigns every pixel/voxel i a single class label li ∈L [19]. Pixels/voxels, typically accompanied by a class label and a confidence score [9, 8]. Unlike PS, it considers only, pixel/voxel receives exactly one label pair (see visual comparison of segmentation tasks in section C).

2026-06-01视觉感知数据集/基准

针对传统 Panoptic Quality 在 IoU≤0.5 时匹配规则不明确、且难处理实例碎片化/合并和部件层级标注的问题,论文将预测与真值段匹配重写为受约束二分图分配,并用顶点而非边统计 TP/FP/FN,统一刻画一对一、多对一、一对多等策略,指出多对多不再符合 PQ 不变量。结果显示该框架可扩展到 PartPQ、AUTC 和 Voronoi 区域分析,并以 Panoptica 开源实现支持生物医学等密集实例评测。

Cross-Modal Clinical Knowledge Integration for Mammography Report Generation Figure 1
2026-06-01cs.CV

Cross-Modal Clinical Knowledge Integration for Mammography Report Generation

Jiayi Zhu, Fuxiang Huang, Yu Xie, Xi Wang, Zhixuan Chen, Yuan Guo, Qingcong Kong, Zhenhui Li, Qiong Luo, Hao Chen

aThe Hong Kong University of Science and Technology (Guangzhou), Guangzhou, Guangdong, China, bLingnan University, Hong Kong, China, cThe Third Affiliated Hospital of Kunming Medical University, Yunnan Cancer Hospital, Peking University Cancer Hospital, dThe Hong Kong University of Science and Technology, Hong Kong, China, eGuangzhou First People’s Hospital, South China University of Technology, Guangzhou, Guangdong, China, fThe Third Affiliated Hospital, Sun Yat-Sen University, Guangzhou, Guangdong, China, gHKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, Shenzhen, Guangdong, China, on an internal test set, two independent external test sets, and a publicly available external dataset demonstrate that

2026-06-01视觉感知

针对乳腺X线报告生成中通用视觉到文本模型难以处理四视图联合推理、BI-RADS评估和专业术语一致性的问题,本文提出MammoRG:先通过分类监督整合报告库与乳腺知识图谱中的临床先验,再用术语感知微调将乳腺词表作为语义单元,并配套MammoRGTool解析报告用于临床效能评估。在内部、两个外部及VinDr-Mammo数据集上,模型在NLG和临床指标均达SOTA,BI-RADS F1较次优提升约1.90%–3.27%。

On Revisiting Entropy for Identifying Mislabeled Images Figure 1
2026-06-01cs.CV

On Revisiting Entropy for Identifying Mislabeled Images

Chunlei Li, Zixuan Zheng, Yilei Shi, Guanglu Dong, Pengfei Li, Jingliang Hu, Xiao Xiang Zhu, Lichao Mou

On Revisiting Entropy for Identifying Mislabeled Images, Mislabeled samples in training datasets severely, roneous labels., proposing a novel approach for mislabeled data, correctly labeled samples exhibit consistent en-, tropy decrease during training, while mislabeled, labeling errors due to diagnostic complexity—, performance in mislabeled data identification, Our code is available at https:, MedAI Technology (Wuxi) Co. Ltd., Wuxi, China 2Sichuan, University, Chengdu, China 3University of Basel, Allschwil, Switzerland 4Technical University of Munich, Munich, Germany.

2026-06-01视觉感知

针对医学影像等数据中误标样本会被过参数化模型记忆、进而损害分类性能的问题,论文重新审视训练过程中的预测熵:干净样本熵通常下降,而误标样本长期高熵且与给定标签不一致。作者提出带符号熵及其时间积分 SEI,将不确定性大小、变化趋势和标签-预测一致性合成单一统计量,并可接入 CLIP 分类训练。实验显示其在四个医学影像数据集上识别误标样本达到或超过现有方法,同时实现较简单、计算开销较低。

A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models Figure 1
2026-06-01cs.MM

A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models

Iosif Tsangko, Andreas Triantafyllopoulos, George Margetis, Ioana Crihana, Björn W. Schuller

Technical University of Munich, National University of Science and Technology Politehnica Bucharest, Technical University of Munich Munich Germany, National University of Science and Technology Politehnica Bucharest Bucharest Romania

2026-06-01视觉语言视觉感知

面向博物馆需本地部署、保护隐私且支持低资源语言的无障碍艺术导览,本文用 Qwen2.5-VL-3B 构建德/罗/塞三语 BLV 艺术描述语料,并比较固定预算下单语 LoRA 与共享多语适配器,同时用罗马尼亚 BLV 小规模用户研究校准 LLM-as-Judge。结果显示,单语适配器在罗马尼亚语和塞尔维亚语上更稳定、视觉依据更好,多语方案在德语仍具竞争力。

Task-Focused Memorization for Multimodal Agents Figure 1
2026-06-01cs.CV

Task-Focused Memorization for Multimodal Agents

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

ByteDance Seed, 2Fudan University

2026-06-01视觉语言

这篇论文关注多模态/具身智能体面对连续视频与任务流时“该记什么”的问题,而不只是如何存储记忆。作者将记忆生成建模为可学习策略,提出 TaskMem:先用强化学习优化忠实、非冗余等基础记忆质量,再在部署后用近期任务反馈微调轻量适配器,使记忆偏向任务相关内容。基于 Qwen3-VL-30B-A3B,在流式改造的 VideoMME、EgoLife、EgoTempo 上仅凭记忆回答问题,准确率分别提升 6.3%、7.0%、5.3%。

Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining Figure 1
2026-06-01cs.CV

Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining

Bo Peng, YuanJie Lyu, PengGang Qin, Tong Xu

University of Science and Technology of China

2026-06-01视觉感知

面向电影、剧集等长视频的未来事件预测,现有LVLM虽能问答和总结,却常遗漏人物身份、动作等关键细节,且对事件演化建模过粗。论文提出VISTA,通过角色中心视觉提示抽取事件相关细节,再用知识增强迭代检索构建因果连贯事件链,最后以“先提出候选、再检索线索”融合多层语义预测未来。实验在CMD和MILES上较各类LVLM与短视频方法显著领先,准确率稳定超过60%,消融也显示视觉细节、事件链和三项组件均关键。

HQ-JEPA: Hybrid Quantum Joint-Embedding Predictive Architecture for Cross-Modal Remote Sensing Representation Learning Figure 1
2026-06-01cs.CV

HQ-JEPA: Hybrid Quantum Joint-Embedding Predictive Architecture for Cross-Modal Remote Sensing Representation Learning

Md Aminur Hossain, Ayush V. Patel, Sanjay K. Singh, Biplab Banerjee

Biplab Banerjee2, Space Applications Centre, Centre of Studies in Resources, Indian Institute of Technology Bombay, images, SSL enables scalable pretraining and improves downstream performance in tasks

2026-06-01视觉感知

针对光学 Sentinel-2 与 SAR Sentinel-1 在成像机理、噪声和纹理上差异大、跨模态自监督易出现嵌入空间不稳定的问题,HQ-JEPA 将 JEPA 的掩码潜表示预测扩展到双模态遥感,并联合跨模态对齐、SIGReg 分布正则与基于可微 SWAP-test 的量子保真相似度损失。GeoBench 分类和分割实验显示其在线性探测和微调中较多基线有竞争力或更优,但量子模块仍依赖经典仿真,计算开销与规模化效果仍需进一步验证。

LVSA: Training-Free Sparse Attention for Long Video Diffusion Figure 1
2026-06-01cs.CV

LVSA: Training-Free Sparse Attention for Long Video Diffusion

Gael Glorian, Ioannis Lamprou, Zhen Zhang, Yujie Yuan, Hongsheng Liu

Distributed Parallel Technology Laboratory, Paris Research Center, Huawei Technologies France, AI Framework and Data Technology Lab, Huawei Technologies Co., Ltd.

2026-06-01视觉感知生成模型

长视频扩散推理受密集自注意力二次复杂度和训练长度外“冻结/循环”退化限制。LVSA提出无需训练、模型无关的块稀疏注意力,以局部时间窗口结合旋转全局锚点,缓解固定网格偏置并降低计算。实验在Wan与HunyuanVideo等模型上相对密集注意力最高约3.33倍加速,还使单卡生成更长视频成为可能,并用VQeval评估循环失败,扩展长度下质量优于密集基线。

Rethinking Efficient Crack Segmentation with Task-Aligned Structural-Directional Modeling Figure 1
2026-06-01cs.CV

Rethinking Efficient Crack Segmentation with Task-Aligned Structural-Directional Modeling

Shipeng Liu, Liang Zhao, Dengfeng Chen, Weihua Zhang

2026-06-01视觉感知

本文针对裂缝分割中盲目加深通用 CNN/Transformer/Mamba 特征混合导致复杂且未必匹配任务的问题,将其重定义为稀疏结构恢复。RIFT 以局部结构保真、水平/垂直/斜向协同连续性建模和轻量多尺度解码为核心,显式服务于细长、断裂、低对比裂缝的拓扑恢复。在 DeepCrack、CamCrack789、CrackMap、Crack500 上,RIFT 在 16 项主指标中取得最佳或并列最佳;RIFT-B 精度最高,RIFT-T 仅 0.47M 参数且部署效率突出。

Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior? Figure 1
2026-06-01cs.CV

Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?

Jingtao He, Hongliang Lu, Xiaoyun Qiu, Yixuan Wang, Xinhu Zheng

2026-06-01视觉语言视觉感知

这篇论文针对 VLA 自动驾驶模型“行为是否真正依赖视觉信息”这一诊断缺口,提出按通道退化、语义信息扰动和空间结构修改组织的多层视觉扰动框架,并同时考察开环轨迹预测与闭环安全表现。结果显示视觉依赖并不均匀:低层像素退化影响有限,语义与空间结构破坏更容易暴露闭环安全退化,说明常规开环指标可能低估交互场景中的视觉 grounding 问题。

GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration Figure 1
2026-06-01cs.CV

GGT-100K: Generative Ground Truth for Generalizable Real-World Image Restoration

Xiangtao Kong, Jixin Zhao, Lingchen Sun, Rongyuan Wu, Lei Zhang

2026-06-01视觉感知生成模型强化学习

真实图像复原受限于缺少大规模、高质量的真实退化配对数据,合成退化与实拍配对都难以泛化。本文提出用多模态生成基础模型从真实低质图生成“生成式真值”,评测9个MFM后选用Nano-Banana-2结合VLM自适应提示,并通过自动指标、VLM筛选和人工核验构建GGT-100K。实验显示,该10.3万对数据能稳定提升CNN、Transformer、all-in-one及生成式复原模型的真实场景泛化,收益对生成模型微调尤其明显。

SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation Figure 1
2026-06-01cs.CV

SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation

Weijia Dou, Hui Li, Jiahao Cui, Lei Zhou, Jingdong Wang, Siyu Zhu

Fudan University, Meta Superintelligence Labs

2026-06-01视觉感知

长视频流式生成常用按时间窗口保存帧或token,角色离开视野、提示词切换后易身份漂移。SlotMemory把扩散Transformer的KV历史按对象语义分解为可复用slot,并以slot作为高保真KV的索引,结合提示感知检索实现实体级持久记忆。在Wan2.1-T2V-1.3B上,60秒交互叙事质量分81.61,30秒动态一致性较最强基线相对提升22.8%。

PEEK: Picking Essential frames via Efficient Knowledge distillation Figure 1
2026-06-01cs.CV

PEEK: Picking Essential frames via Efficient Knowledge distillation

Killian Steunou, Anas Filali Razzouki, Khalil Guetari, Mounîm A. El-Yacoubi, Yannis Tevissen

2026-06-01视觉感知

视频字幕生成受限于可输入帧数,均匀采样虽便宜但忽略内容,现有自适应选帧又常依赖文本查询或计算开销大。PEEK用SigLIP 2离线根据真值字幕产生帧相关性排序,再蒸馏到仅看MobileCLIP2视觉特征的轻量时序Transformer,推理时按时间窗口选最高分帧。其在ActivityNet Captions和MSR-VTT低帧预算下优于多种基线,尤其1–2帧时CIDEr更高,且仅增加约5.2%字幕时间。

Iterative Framework For Data Augmentation Of Segmented Fingerprints Figure 1
2026-06-01cs.CV

Iterative Framework For Data Augmentation Of Segmented Fingerprints

João Leonardo H. D. Agnol, Wesley Augusto de Bona, Erick Oliveira Rodrigues, Luiz Fernando Puttow Southier, Jefferson Oliva, Marcelo Filipak, Dalcimar Casanova

*Federal University of Technology (UTFPR), compounded by the scarcity of available data for rescarch that, of availability of large and representative infant datasets [1]., mains, its efficacy is fundamentally reliant on the availability, cumventing the issue of data availability, this study introduces

2026-06-01视觉感知

针对婴幼儿指纹采集困难、脊谷细且公开数据稀缺导致匹配模型难训练的问题,论文提出不合成原始纹理,而在已分割指纹上迭代叠加CNN分割结果,利用可控的分割误差生成变体。实验在5枚高分辨率新生儿指纹上显示,不同透明度和迭代次数能显著改变细节点数量与结构,同时保持与原图的视觉相似性;但尚未验证其对实际匹配或分割模型训练的性能增益。

Parallel Tempering Initial Sampling in Inference-Time Reward Alignment Figure 1
2026-06-01cs.LG

Parallel Tempering Initial Sampling in Inference-Time Reward Alignment

Myeongjun Oh, Gwangho Kim, Sungyoon Lee

Department of Artificial Intelligence, Department of Computer Science, Hanyang University, Seoul, Korea

2026-06-01强化学习

本文关注扩散/流模型推理时奖励对齐中的初始化瓶颈:标准 SMC 从先验采样难以命中稀有高奖励区域,已有奖励感知 pCNL 又易陷入多模态局部峰。作者提出 PATHS,在初始噪声后验上运行带温度梯度的并行回火链,并用 Metropolis 交换把热链探索到的高奖励状态传给冷链。布局生成和数量控制实验显示其相对 TDS、DAS 与 Ψ-Sampler 稳定提升,复杂提示下收益更明显。

Benchmarking Single-Step Inpainting Methods for Multi-Object 3D Gaussian Splatting Scenes Figure 1
2026-06-01cs.CV

Benchmarking Single-Step Inpainting Methods for Multi-Object 3D Gaussian Splatting Scenes

Finn Dröge, Cecilia Curreli, Abhishek Saroha, Daniel Cremers

Technical University of Munich, Munich Center for Machine Learning

2026-06-01数据集/基准三维

针对3D Gaussian Splatting场景物体移除后补全容易出现跨视角不一致的问题,论文系统比较单步2D修复器与3DGS补全流程,并引入带真实无目标GT的多物体360°客厅遮挡场景。核心洞察是2D视觉质量更高的生成式修复在3D一致性上反而不如LaMa等重建式方法,且用修复后视图从零初始化场景优于在原场景上微调;直接在原图中修掉物体的Nano Banana基线也显示先做3D物体移除很关键。

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation Figure 1
2026-06-01cs.CV

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation

Tom Maye-Lasserre, Yitong Li, Bailiang Jian, Morteza Ghahremani, Benedikt Wiestler, Christian Wachinger

Technical University of Munich (TUM), Munich Center for Machine Learning (MCML)

2026-06-01三维

论文指出3D CT报告生成中,现有VLM常以流畅文本掩盖低病灶检出与低多样性,坍缩为少量正常模板并漏报罕见关键异常。作者将其定义为Template Collapse,并用临床一致性、多样性、正常模板偏置和罕见病灶保留率进行诊断;提出CLarGen,把病理多标签检测、病理引导检索和医学语言合成解耦。实验显示其相较基线显著提升临床准确性,macro-F1由0.189升至0.487,CRG由0.368升至0.472,同时保持报告流畅性。

Can BEV Perception Gracefully Degrade under Sensor Failures? Figure 1
2026-06-01cs.CV

Can BEV Perception Gracefully Degrade under Sensor Failures?

Haifa Zhang, Yijing Wang, Haoyu Wang, Zheng Li, Zhiqiang Zuo

Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System, School of Electrical and Information Engineering, Tianjin University, Key Laboratory of System Control and Information Processing, Ministry of Education of China, Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System, School of Electrical and Information Engineering, Tianjin University Tianjin China, Key Laboratory of System Control and Information Processing, Ministry of Education of China Shanghai China

2026-06-01视觉感知

这篇论文关注自动驾驶多模态 BEV 感知在相机或 LiDAR 失效时容易因静态融合和“模态懒惰”而崩溃的问题。作者提出 Grace-BEV,在对齐 BEV 空间中用 TrustGate Router 评估模态可信度,并通过 FailSafe Fusion Block 动态抑制坏特征,配合三阶段训练和模态 dropout 促使均衡学习。nuScenes-R/C 实验显示,在严重 LiDAR 故障下可将基线 0.0% mAP 恢复到最高 34.7%,干净场景精度也提升最多 1.4%。

BiSegMamba: Efficient Bidirectional Tri-Oriented Mamba for 3D Medical Image Segmentation Figure 1
2026-06-01cs.CV

BiSegMamba: Efficient Bidirectional Tri-Oriented Mamba for 3D Medical Image Segmentation

Bakht Zada, Chao Tong, Qile Su, Shuai Zhang

2026-06-01视觉感知三维

针对3D医学分割中CNN难建模长程依赖、Transformer开销高,以及现有Mamba体数据扫描存在高FLOPs、单向顺序偏置和固定方向融合的问题,BiSegMamba采用紧凑到细节结构、早期多尺度空间混合、深层双向三正交Mamba与自适应方向融合。在颈动脉CTA、BraTS2023、ACDC和AMOS-CT上表现出较好泛化,相比SegMamba-V2在部分任务精度更高,并最多减少77.9% FLOPs。

Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning Figure 1
2026-06-01cs.CV

Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning

Zhenwu Shi, Jingyu Gong, Peiwei Wang, Xingzan Wang, Tianwen Qian, Wenxi Li, Yuan Fang, Jiao Xie, Lizhuang Ma, Shaohui Lin

Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China, School of Computer Science and Technology, East China, Normal University, China, School of Statistics, East China Normal University, China, The 27th Research Institute of CETC, Zhengzhou, China, Key Laboratory of Advanced Theory and Application in Statistics and Data Science, MOE, China, Shanghai Key Laboratory of Computer Software Evaluating and Testing, China, School of Computer Science, Shanghai Jiao Tong University, China

2026-06-01视觉感知

本文关注文本驱动人体动作编辑中“该改的要改准、未编辑部分要保持”的矛盾,指出现有扩散方法易因全局条件或启发式相似度导致语义偏差和动作失真。OmniME将监督拆成正负两支:多层回溯特征约束、基于源目标相似度的动作保持,以及三元组语义对齐。在 MotionFix 与 STANCE Adjustment 上取得 SOTA,AvgR(1 at best) 分别由 20.88 降至 13.06、29.05 降至 22.77。

Variational Adapter for Cross-modal Similarity Representation Figure 1
2026-06-01cs.CV

Variational Adapter for Cross-modal Similarity Representation

WenZhang Wei, Zhipeng Gui, Dehua Peng, Tiandi Ye, Huayi Wu

2026-06-01视觉感知

论文针对图文匹配中二值稀疏标注把连续相似度硬切分、产生假负样本并削弱泛化的问题,提出 VACSR,将跨模态相似度而非单模态特征的不确定性建模为变分潜空间,通过 VAE 式适配器与正则化缓解对二值标签的过拟合。实验显示其在图文检索、噪声对应、域泛化和 base-to-novel 泛化上均有提升,但具体增益来源仍可能受适配器结构与超参数影响。

PRISM: Progressive Reasoning through Iterative Slot Memory for Vision Figure 1
2026-06-01cs.CV

PRISM: Progressive Reasoning through Iterative Slot Memory for Vision

Ziyu Wang, Shuangpeng Han, Mengmi Zhang

Deep NeuroCognition Lab, Nanyang Technological University, Singapore

2026-06-01视觉感知

针对前馈视觉模型在遮挡或证据缺失时难以修正中间表征的问题,PRISM 将图像特征先聚合为对象中心 slot,再用向量量化原型记忆检索可能的完整模式,并在金字塔各阶段自适应迭代执行“组织—回忆—精炼”。文中称其在分类、检测和语义分割上达到有竞争力的表现,并在不完整观测下更稳健,但具体增益幅度和来源需结合完整实验表进一步判断。

IAF-Net: Illumination-Adaptive Fusion for Low-Light Urban Road Segmentation Figure 1
2026-06-01cs.CV

IAF-Net: Illumination-Adaptive Fusion for Low-Light Urban Road Segmentation

Bingtao Wang, Daojie Peng, Fulong Ma, Jun Ma, Liang Zhang

2026-06-01视觉感知

面向自动驾驶夜间/低照城市道路分割,本文指出固定 RGB-几何融合会把退化的 RGB 噪声带入特征。IAF-Net 以全局亮度估计 RGB 可靠性,动态调节 RGB 与深度法向几何特征权重,并用亮度调制注意力增强暗光特征选择。作者构建 nuScenes-NRS 与 CARLA-MWRS,报告在真实夜间集上达到对比方法中最佳整体表现,合成多天气集验证鲁棒性;消融中 IAF 模块带来最大单项 MaxF 增益 0.70%。

MultiAct: Text-to-Motion Generation from Composite Text via Tailored Attention Guidance Figure 1
2026-06-01cs.CV

MultiAct: Text-to-Motion Generation from Composite Text via Tailored Attention Guidance

Nathan Sala, Ofir Abramovich, Ariel Shamir, Daniel Cohen-Or, Andreas Aristidou, Sigal Raab

Tel Aviv University, Reichman University, CYENS Centre of Excellence, University of Cyprus, Tel Aviv University Tel Aviv 4610101 Israel, Reichman University Herzliya 4610101 Israel, CYENS Centre of Excellence Nicosia 1016 Cyprus, Reichman University Herzliya Israel, Tel Aviv University Tel Aviv Israel, University of Cyprus Nicosia 1678 Cyprus

2026-06-01视觉感知

现有文本到动作模型在“边跑边挥手”等同时复合动作提示下易出现语义塌缩,只生成主导动作。MultiAct不重训骨干模型,而是在推理时按提示自适应选择需增强的词、层和扩散步,通过放大弱语义的交叉注意力提升组合可控性。实验和用户研究显示其较MoMask、STMC及改造版Attend-and-Excite在语义覆盖和偏好上更优,同时基本保持动作真实感。

Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search Figure 1
2026-06-01cs.IR

Inference-Free Multimodal Learned Sparse Retrieval for Production-Scale Visual Document Search

Gyu-Hwung Cho (1 and 2), Youngjune Lee (1), Kiyoon Jeong (1), Siyoung Lee (1), Sanggyu Han (1), Hervé Dejean (3), Stéphane Clinchant (3), Seung-won Hwang (2) ((1) NAVER Corp., Republic of Korea, (2) Seoul National University, (3) Naver Labs Europe, France)

NAVER Corp., Seoul National University, Naver Labs Europe, NAVER Corp. Gyeonggi-do Republic of Korea, Seoul National University Seoul Republic of Korea, Naver Labs Europe Meylan France

2026-06-01视觉语言

面向 arXiv/PDF 等大规模视觉文档检索,论文指出现有 VLM 稠密/多向量方法在线需神经查询编码,而 OCR/Caption+BM25 索引成本高。其核心洞察是视觉稀疏表示存在“词汇落地”问题,并提出 V-SPLADE,用训练期 caption-gated token supervision 引导页面图像激活词表维度,推理时直接倒排检索。六个基准平均 NDCG@5 较同规模稠密基线提升 13.8pp,在 18.7M 文档上 R@5 翻倍以上,并可与稠密检索融合增益。

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent Figure 1
2026-06-01cs.CV

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent

Seungho Choi, Jihyong Oh

Department of Computer Science, Cranberry-Lemon University

2026-06-01视觉感知

真实图像常同时含雾、雨、噪声、模糊等多重退化,且去除顺序会影响最终质量。DiTTo将全能图像复原建模为顺序感知的专家调用问题,用模拟器结合单步复原模拟与IQA评分,以线性成本构造轨迹数据,再经SFT和轻量ORA对齐,新增专家只需更新ORA阶段。在MiO-100最多五种退化评测中,其多退化复原质量超过既有智能体方法,并展示约40倍更快适配。

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR Figure 1
2026-06-01cs.CV

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

Harbin Institute of Technology, Zhongguancun Academy, Zhongguancun Institute of Artificial Intelligence, Nankai University, Shanghai Jiaotong University, Zhejiang University

2026-06-01视觉语言视觉感知强化学习

这篇论文针对多模态 RLVR 只按最终答案给奖励、难以判断模型是否真正看到了关键图像证据的问题,提出 EASE:把训练集中的证据框转成平滑视觉 token 目标,并仅在高奖励轨迹上约束回答 token 对图像区域的注意力,推理时不需额外标注。在 Qwen2.5/3-VL 多个骨干上,相比 DAPO 平均提升 2.5–3.1 分,且诊断显示注意力更贴近标注证据区域。

What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness Figure 1
2026-06-01cs.CV

What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness

Yusheng He, Jizhe Zhou, Xia Du, Zheng Lin, Jun Luo, Jiancheng Lv

2026-06-01视觉语言安全鲁棒

针对LVLM幻觉难以从零散组件改动中解释的问题,论文把架构因素拆为语言基础、视觉表征与语义对齐三维七项,并提出CoSimUE统一评测共现、相似性和不确定性幻觉。实验显示,单纯扩大参数作用有限;更强语言模型主要缓解共现偏置,更强视觉编码器和高分辨率降低相似性错误,而对齐质量对不确定场景更关键,视觉保真与对齐联合提升最全面。

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging Figure 1
2026-06-01cs.CV

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

Tsinghua University, Westlake University, Zhejiang University, Hong Kong University of Science and Technology, Shanghai AI Lab

2026-06-01视觉感知

针对连续 VAE 重建好但语义纠缠、离散 VQ 适合自回归却易梯度稀疏和码本塌缩的问题,MergeTok 将二者放入共享编码器—解码器中联合训练,并用 token merging 产生的分组作为语义桥梁:约束 VAE 的合并 token 对齐,同时引导 VQ 的组内多样、组间排斥量化。ImageNet-256 上在相同 token 预算下 rFID 低于强 VAE/VQ 基线,并兼容自回归与扩散生成器。

SteerFace: Debiasing Synthetic Face Generation via Adaptive Residue Perturbation Figure 1
2026-06-01cs.CV

SteerFace: Debiasing Synthetic Face Generation via Adaptive Residue Perturbation

Yuxi Mi, Qiuyang Yuan, Jianqing Xu, Yichun Zhou, Xuan Zhao, Jun Wang, Rizen Guo, Shuigeng Zhou

Fudan University, Youtu Lab, Tencent, WeChat Pay Lab33, Tencent, Fudan University Shanghai China, Youtu Lab, Tencent Shanghai China, WeChat Pay Lab33, Tencent Shenzhen China

2026-06-01视觉感知

针对合规人脸数据稀缺下合成数据训练识别模型仍存在 synthetic-real gap 的问题,论文指出扩散生成虽具身份一致性和多样性,却会因身份嵌入夹带非身份视觉线索而形成数据集级“视觉倾向”。SteerFace在训练中将身份嵌入沿超球面正交方向自适应扰动,抑制生成器依赖残余视觉偏差,同时尽量保留身份信息;实验显示其能减轻视觉倾向,并在多数据集和生成管线中提升下游人脸识别表现。

Foundation VAEs for 3D CT Reconstruction, Augmentation, and Generation Figure 1
2026-06-01cs.CV

Foundation VAEs for 3D CT Reconstruction, Augmentation, and Generation

Qi Chen, Shuhan Ding, Yu Gu, Nan Liu, Jiang Bian, Alan Yuille, Zongwei Zhou, Jingjing Fu

2026-06-01生成模型三维

针对CT专用VAE训练成本高且跨扫描仪、协议和疾病泛化不稳的问题,论文提出直接冻结自然图像/视频预训练的Foundation VAE,作为3D CT重建、增强与生成的统一潜空间接口。其洞察是重建误差主要表现为噪声和轻微伪影而非边界偏移,可用于边界增强训练;实验显示肿瘤分割NSD平均提升3.9%,潜空间条件扩散生成的FVD降低3.9%、CT-CLIP提升36.2%,18类疾病忠实度AUC提升2.76%。

GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning Figure 1
2026-06-01cs.CV

GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

Junlong Li, Chao Hao, Lap-Pui Chau, Yi Wang

The Hong Kong Polytechnic University

2026-06-01视觉语言强化学习

GUI 定位在密集界面、小图标和相似控件上仍易失败,且现有 RL 方法既把样本等权处理,又难在裁剪时兼顾上下文与冗余。本文提出 GUI-D 按难度筛选并加权训练样本,GUI-C² 则用面积门控的粗到细裁剪和改进感知奖励,把决策简化为目标框预测。实验称其在仅 4,624 个样本、3B 模型设置下于三个常用基准达到 SOTA。

DSD-GS: Dynamic-Static Decomposition of Gaussian Splatting for Efficient and High-Fidelity Dynamic Scene Reconstruction Figure 1
2026-06-01cs.CV

DSD-GS: Dynamic-Static Decomposition of Gaussian Splatting for Efficient and High-Fidelity Dynamic Scene Reconstruction

Youngtae Han, Sung-hwan Han, Youngmin Yi

Department of Artificial Intelligence Engineering, Sogang University

2026-06-01三维

面向动态场景重建中现有动态 3DGS 将静态背景也按帧变形、导致计算浪费和背景不稳定的问题,DSD-GS 用前馈 Gaussian Splatting 编码器结合光流进行动静分解,只对动态前景建模,并缓存静态背景渲染,同时绕过 COLMAP 实现确定性初始化。文中报告在 Neural 3D 上训练约 10 分钟、1352×1014 分辨率超过 700 FPS,并在质量、速度和存储上优于基线。

Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation Figure 1
2026-06-01cs.CV

Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation

Hanlin Chen, Jiaxin Wei, Xibin Song, Yifu Wang, Steve Wang, Hongdong Li, Pan Ji, Gim Hee Lee

School of Computing, National University of Singapore, Vertex Lab, Australian National University

2026-06-01视觉感知规划控制三维安全鲁棒

本文面向逐帧动作控制的交互式世界模拟,针对长时自回归生成中视觉质量和3D一致性易漂移的问题,指出反复 latent-RGB 转换和训练时干净记忆与推理时污染记忆不匹配是关键原因。方法以 Latent Gaussian Memory 将扩散 latent 绑定到高斯基元并在 latent 空间 splatting 召回,同时用动态偏差档案在训练中注入 rollout 误差。ScanNet、DL3DV 和 OmniWorldGame 实验显示其长时保真度、3D一致性和鲁棒性优于现有方法。

Count Anything Figure 1
2026-06-01cs.CV

Count Anything

Mengqi Lei, Shuokun Cheng, Wei Bao, Shaoyi Du, Jun-Hai Yong, Siqi Li, Yue Gao

{BNRist, THUIBCS, BLBCI, School of Software}, Tsinghua University, School of Computer Science and Technology, China University of Geosciences, Wuhan, State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University, outperforming existing open-world counting methods. The code is available at:, and others describe instances with masks, polygons, or label maps [20, 21, 22]. Some datasets, further use crowd or group labels for targets that are difficult to separate instance by instance, and

2026-06-01视觉感知

面向跨场景计数任务长期被人群、遥感、细胞等专用数据集割裂的问题,论文将计数重定义为文本引导的实例点预测,并构建含六类视觉域、约22万图像和1500万实例的 CLOC。方法上用区域级稀疏计数器补强大而稀疏目标,用像素级密集计数器覆盖小而拥挤目标,再通过点中心监督和无参融合处理异构标注。实验显示其在多域泛化和计数精度上优于现有开放世界计数方法,但增益可能部分来自大规模数据。

LegSegNet: A Public Deep Learning System for Lower Extremity CT Tissue Segmentation and Quantification Figure 1
2026-06-01cs.CV

LegSegNet: A Public Deep Learning System for Lower Extremity CT Tissue Segmentation and Quantification

Yuwen Chen, Yaqian Chen, Roy Colglazier, Haoyu Dong, Hanxue Gu, Maciej A. Mazurowski, Kevin W. Southerland

Department of Electrical and Computer Engineering, Duke University, Durham, NC 27708, Department of Biostatistics & Bioinformatics, Duke University, Durham, NC 27708, Department of Radiology, Duke University, Durham, NC 27708, Department of Computer Science, Duke University, Durham, NC 27708, Department of Surgery, Duke University, Durham, NC 27708

2026-06-01视觉感知

面向下肢 CT 体成分分析中人工标注昂贵、现有公开工具难以覆盖肌间/肌内脂肪且缺少端到端量化流程的问题,LegSegNet基于 nnUNet 构建公开系统,可分割骨、骨骼肌、皮下脂肪和肌间/肌内脂肪并输出定量指标。模型用1302张放射科审核切片训练、900张测试,并对比CNN、Transformer和微调基础模型,平均Dice达89.31且整体最佳,但增益可能主要来自任务定制与数据标注。

Function2Scene: 3D Indoor Scene Layout from Functional Specifications Figure 1
2026-06-01cs.CV

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

Ruiqi Wang, Qimin Chen, Daniel Ritchie, Angel X. Chang, Manolis Savva, Kai Wang, Hao Zhang

Simon Fraser University, Brown University, ShanghaiTech University, Simon Fraser University Burnaby BC Canada, Simon Fraser University Burnaby Canada, Brown University Providence Rhode Island USA, ShanghaiTech University China

2026-06-01三维

本文针对现有文本到室内场景方法偏向“放什么家具”、难以保证真实使用功能的问题,提出 Function2Scene:先从功能性设计 brief 中解析住户画像与活动需求,再映射到空间、人体工学、活动和环境等17类约束,并用几何工具、LLM 推理与 VLM 评估组成检查—修复循环迭代优化布局。在30个专业室内设计案例上,其生成结果相比近期 LLM 场景合成基线更符合功能需求,成对比较中获94.3%偏好。

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding Figure 1
2026-06-01cs.CV

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

2026-06-01视觉语言数据集/基准

针对通用多模态大模型在高密度标注、正投影约束和工程符号并存的机械图纸上易漏读、空间推理不稳的问题,论文构建了 MechVQA:含 3.3K 图纸、约 21K 问答,覆盖识别、推理、判断三类 10 个子任务,并基于 SFT 与 DAPO 强化学习训练领域模型 MechVL。实验显示 MechVL 在总分上较最强闭源基线提升 7.57 个百分点,主要增强跨视图推理和标准敏感判断。

Text-guided Feature Disentanglement for Cross-modal Gait Recognition Figure 1
2026-06-01cs.CV

Text-guided Feature Disentanglement for Cross-modal Gait Recognition

Zhiyang Lu, Ming Cheng

Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University., Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China.

2026-06-01视觉感知

针对RGB视频与LiDAR点云步态识别中2D/3D模态差距大、共享特征难以稳定提取的问题,论文提出TCFDNet:用LLM构建跨视角步态文本字典,并借助CLIP将文本先验作为语义锚点,引导模态特定/共享特征解耦;同时加入残差正交约束、特征稳定增强和跨模态patch交换。实验在SUSTech1K与FreeGait上取得新的最优结果,消融显示各模块均有贡献。

CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping Figure 1
2026-06-01cs.CV

CameraNoise: Enabling Faithful Camera Control in Video Diffusion through Geometry-Flow-Guided Noise Warping

Haoyu Zhao, Jiaxi Gu, Haoran Chen, Qingping Zheng, Yeying Jin, Hongyi Yang, Junqi Cheng, Yuang Zhang, Zenghui Lu, Huan Yu, Jie Jiang, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

2026-06-01视觉感知生成模型规划控制

本文针对视频扩散中相机位姿控制不准、几何一致性差的问题,提出 CameraNoise:不再把相机参数作为特征条件注入,而是用仅由相机参数构造的 GRFlow 将位姿运动扭曲到高斯噪声空间,尽量解耦外观与运动。实验在 RealEstate10K、MultiCamVideo、DrivingDoJo 上显示,其在轨迹误差、FVD 和视觉质量上普遍优于 MotionCtrl、CameraCtrl、AC3D 等基线。

DisPlace: Discriminative Place Projections for Multi-Reference Visual Place Recognition Figure 1
2026-06-01cs.CV

DisPlace: Discriminative Place Projections for Multi-Reference Visual Place Recognition

Dhyey Manish Rajani, Michael Milford, Tobias Fischer

2026-06-01视觉感知

针对多次巡航参考图像在天气、季节和视角变化下难以高效融合的问题,DisPlace把多参考VPR描述子融合转化为广义特征值问题,学习最大化地点间可分性、抑制同地点跨参考变化的投影,再聚合为紧凑地点表示。其无需重训现有描述子,在4个数据集、6类描述子上评测,49/54种外观变化条件优于7个多参考基线,并降低推理存储开销。

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling Figure 1
2026-06-01cs.CV

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

Xiang Fang, Wanlong Fang

2026-06-01视觉感知

该文针对LVLM因稀疏采样产生“时间盲区”、导致遮挡场景中物体消失和因果不一致的问题,提出将视频潜变量视为语义流形上的动力学轨迹,用语义最小作用量和拉格朗日桥把插值转化为边值问题,而非像素级生成。实验声称在MSR-VTT、ActivityNet等基准上将物体消失率降低68%,推理加速177倍;但具体实验细节与增益来源仍需核查。

Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness Figure 1
2026-06-01cs.CV

Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness

Xiang Fang, Wanlong Fang, Wei Ji

2026-06-01视觉语言视觉感知生成模型强化学习

本文针对大视觉语言模型在开放世界中容易把未知异常高置信归入已知类的“语义自负”问题,提出 Immuno-VLM:借鉴免疫负选择,让 LLM 生成近分布异常和上下文异常的“语义抗体”,在共享语义嵌入空间主动刻画已知类边界,而非依赖事后阈值或像素级异常生成。实验称其在 ImageNet-1K 与四个 OOD 基准上达到新 SOTA,并在语义扰动检测上较零样本基线提升超过 16%。

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding Figure 1
2026-06-01cs.CV

Annotations Are Not All You Need: A Cross-modal Knowledge Transfer Network for Unsupervised Temporal Sentence Grounding

Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Yu Cheng, Keke Tang, Kai Zou

Hubei Key Laboratory of Distributed System Security, Hubei Engineering Research Center on Big Data Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology, Peking University, Henan University, The Chinese University of Hong Kong, Guangzhou University, Protagolabs Inc.

2026-06-01视觉语言

针对时序句子定位依赖昂贵视频-文本与边界标注的问题,本文提出无监督 CMKT,将廉价跨模态任务中的图像-名词外观知识和视频-动词动作知识迁移到 TSG,并用 clip 级 copy-paste 构造多动作场景以增强泛化。模型无需 TSG 标注或额外 grounding 训练即可检索片段,在 ActivityNet Captions 和 Charades-STA 上超过现有无监督方法,并接近或优于部分监督方法。

Beyond Accuracy: Evaluating Efficiency, Robustness and Explainability in Deep Learning for Malaria Diagnosis Figure 1
2026-06-01cs.LG

Beyond Accuracy: Evaluating Efficiency, Robustness and Explainability in Deep Learning for Malaria Diagnosis

Olivier Kanamugire, Kerol Djoumessi

African Institute for Mathematical Sciences, Kigali, Rwanda, Hertie Institute for AI in Brain Health, University of Tübingen, Germany

2026-06-01安全鲁棒

针对疟疾显微图像自动诊断在低资源临床中受算力成本、模型不透明与图像扰动影响的问题,本文在 NLM-Malaria 上比较 ResNet-18、EfficientNet-B0、MobileNetV3 和 ViT,并同时评估准确性、效率、鲁棒性与事后解释。结果显示轻量模型性能不显著弱于大模型;CAM 类解释更能定位相关区域,但所有 XAI 在临床可见噪声下均不稳,且置信度比准确率更早退化,可作为人工复核信号。

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation Figure 1
2026-06-01cs.CV

Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation

Zhiyuan Yang, Jiahao Cheng, Vincent Quoc-Huy Trinh, Mahdi S. Hosseini

2026-06-01视觉语言视觉感知

面向多张全切片病理图像生成病例级结构化报告时,主要瓶颈是视觉 token 过长和显存成本过高。论文用冻结病理 patch 编码器、两层 MLP 对齐器和 Qwen2.5-3B 解码器组成简化 VLM,并以 5×低倍 512×512 patch 与 WSI 分隔 token 降低序列长度,再经两阶段监督训练完成对齐和报告生成。实验显示其在 ROUGE、METEOR、BLEU-4 与 AI 评审中优于强基线,同时可在半张 H100 上训练;但临床有效性仍主要由自动指标和模型评审支撑。

Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China Figure 1
2026-06-01cs.CV

Vision-Based Localization in Dense Urban Environments: A Case Study of an Urban Village in China

Menglin Wu, Rui Cao

2026-06-01视觉感知

针对城中村建筑密集导致 GPS 失效、地图不完整而影响导航、配送和应急的问题,本文以广州石牌村为案例,提出低成本双相机采集流程,同步获取全景库图与手机查询图,构建面向城中村的视觉地理定位数据集,并系统评测检索式定位模型。结果显示视觉定位在此类遮挡、弱光、重复外观场景中有应用潜力,但现有方法仍存在明显鲁棒性限制,具体增益来源文中未充分说明。

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models Figure 1
2026-06-01cs.LG

Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models

Yijie Tong, Yifan Hou, Shaobo Cui, Antoine Bosselut, Mrinmaya Sachan

Tong University, Our code is publicly available here: https://github.c

2026-06-01视觉语言视觉感知

本文关注LLM中常用的测试时计算能否迁移到视觉语言模型:视觉感知误差和跨模态对齐使文本启发式不再可靠。作者指出单模型多采样收益受预测相关性限制,并提出基于预测熵的ETTC,在多模型集成中优先选择更自信的输出。7个VLM、6个基准上,特征打分基本失效,多数投票仅在CoT下小幅提升,而ETTC稳定优于投票并常超过最佳单模型。

Equivariant Latent Alignment via Flow Matching under Group Symmetries Figure 1
2026-06-01cs.CV

Equivariant Latent Alignment via Flow Matching under Group Symmetries

Sunghyun Kim, Jaehoon Hahm, Jeongwoo Shin, Joonseok Lee

*Equal contribution 1Seoul National University, Seoul, Korea, University of Illinois Urbana-Champaign, Illinois, USA. Corre-

2026-06-01生成模型

论文关注等变表示用于新视角合成时的“潜变量错位”:解析群作用后的潜码与变换图像重新编码的潜码并不一致,削弱几何一致性。作者将已知 SO(2)/SO(3) 群作用视为一阶近似,提出 Residual Latent Flow,用 flow matching 在成对潜码间学习残差传输而非替代群先验。实验显示该方法能降低潜空间错位,并提升旋转对称数据上的新视角合成质量。

Mathematical Morphology in Machine Learning Figure 1
2026-06-01cs.CV

Mathematical Morphology in Machine Learning

Erick Oliveira Rodrigues, Aura Conci

Department of Computer Science, the center belong to the same cluster and the remaining, labels are known and growing them, filling the space around, these instances in order to cover a wider range of unlabelled, responsible for choosing the correct label when intersections

2026-06-01视觉感知

针对常规机器学习聚类/分类较少显式利用形状、密度与分形结构的问题,本文把数学形态学引入学习流程,提出基于形态重建的 k-MS 聚类、可由结构元素控制的形态学分类器,并给出结合 Minkowski 与 Chebyshev 的新距离以加速离散膨胀。实验显示 k-MS 在形状/密度敏感聚类中速度优于对比方法;新距离在邻域迭代中约比 Manhattan 快 1.3 倍、比 Euclidean 快 329.5 倍,k-NN 在 33 个 UCI 数据集上 26 次高于平均、9 次最佳。

A Context-Aware Middleware for Medical Image Based Reports: An approach based on image feature extraction and association rules Figure 1
2026-06-01cs.LG

A Context-Aware Middleware for Medical Image Based Reports: An approach based on image feature extraction and association rules

Erick O. Rodrigues, Jose Viterbo, Aura Conci, Trueman Mac Henry

Department of Computer Science, laboratories, would be the best physician, whether he is available at a certain, as information of which nurse is available at the moment for a, hospitals, laboratories and teleradiology companies, some, the medical context, checking whether someone is available and, York University, the hospital (e.g., best available physicians related to the medical, image, where they are and whether they are available) and sends, be employed in medical laboratories, teleradiology companies, member is available at the requested moment. The authors built

2026-06-01视觉感知

面向医院、实验室和远程放射场景中医学图像转交依赖人工沟通、耗时且受医生专长与可用性影响的问题,本文提出一种上下文感知中间件:从医护处理过的图像中提取特征,结合临床上下文与关联规则学习,将新图像自动分派给合适人员。论文主要给出架构与方法设想,尚未在真实场景验证;文中称单图处理约7分钟,并预期可减少沟通时间,但实际效率增益仍未充分说明。

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence Figure 1
2026-06-01cs.CV

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

Peking University, Shanghai Jiao Tong University, Nanyang Technological University, Renmin University of China, Shandong University

2026-06-01视觉感知

针对多智能体 VQA 仅靠文本讨论易形成“表面一致”、却未必真正看对图像证据的问题,论文提出关键洞察:可靠共识需要答案一致与视觉证据对齐。其 EAGLE 框架无需训练,显式要求各 VLM 给出 grounding 区域,并据此进行证据诊断、修正和仲裁。六个 VQA 基准上取得最佳平均表现,同时提升可解释性与部署实用性。

ConTrans: Learning Text-enhanced Local-global Temporal Representations for Zero-shot Temporal Action Localization Figure 1
2026-06-01cs.CV

ConTrans: Learning Text-enhanced Local-global Temporal Representations for Zero-shot Temporal Action Localization

Kanchan Keisham, Thenukan Pathmanathan, Thangarajah Akilan

2026-06-01视觉感知

这篇论文面向零样本时序动作定位,针对现有方法偏重长程上下文、忽视帧间局部相对时序关联而导致边界不准的问题,提出 ConTrans:在多尺度编码器中结合卷积归纳偏置与 Transformer 自注意力,并引入文本增强的视觉—语义融合,以同时建模局部运动细节和全局上下文。实验在 ActivityNet-1.3 与 THUMOS14 上报告优于已有方法,但具体增益来源仍需结合消融进一步判断。

WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation Figure 1
2026-06-01cs.CV

WristCompass: Kinematic Coupling as a Learnable Visual Concept for Ego-Camera Orientation

Varun Nair, Vidyut Baradwaj, Jiahang He, Anya Singh, Jai Relan, Cabrel Happi

2026-06-01视觉感知

该文针对第一视角操作视频中手部遮挡导致基于场景几何的相机朝向估计失效的问题,提出利用手腕—肩—头运动链产生的“运动学耦合”作为可学习视觉概念。WristCompass 仅用双腕相对距离与方向的 4D 特征和短窗 GRU,从单目 RGB 恢复相机旋转;在 TACO 上达 13.8°,优于常量和 VGGT,并能零样本迁移到 Epic Kitchens 达 14.3°,但依赖双手可见且仅评估相对朝向。

PInVerify: An Offline Embodied Benchmark for Active Instance Verification Figure 1
2026-06-01cs.CV

PInVerify: An Offline Embodied Benchmark for Active Instance Verification

Yuhang Jiang

University of Trento, Italy

2026-06-01数据集/基准

论文针对具身导航“到达目标附近却未确认是否为正确实例”的语义缺口,提出主动实例验证 AIV,并构建离线基准 PInVerify:3000 个多视角 episode、6 扇区拓扑及陷阱/不可达视角标注,用于考察细粒度语言描述下的验证决策。实验显示最佳 MLLM 基线较嵌入基线高 4.9pp,检测仍带来约 3.1pp 瓶颈,所测 NBV 主动选视角未带来稳定增益;LoRA 微调代理达到 85.6%。

Controllable Lung Nodule Synthesis via Histogram-Regularized Latent Diffusion Models Figure 1
2026-06-01cs.CV

Controllable Lung Nodule Synthesis via Histogram-Regularized Latent Diffusion Models

Arunkumar Kannan, Yanbo Zhang, Han Liu, Michael Baumgartner, Jianing Wang, Alexander Hertel, Bogdan Georgescu, Sasa Grbic

Controllable Lung Nodule Synthesis via Histogram-Regularized Latent Diffusion Models, bJohns Hopkins University, Baltimore, MD, USA, dDepartment of Radiology and Nuclear Medicine, University Medical Center Mannheim, Heidelberg University, Mannheim, Germany, different nodule subtypes, including solid, part-solid, and ground-glass nodules. To address this challenge, we propose a controllable, scalability of LDMs with the fine-grained textural fidelity of, ing, addressing the limited availability of pathological training

2026-06-01生成模型规划控制

针对肺结节 CT 数据稀缺且亚型长尾导致诊断模型偏向常见实性结节的问题,本文提出 HR-LDM,在潜空间扩散中同时条件化亚型、空间掩码和 HU 直方图,并加入可微直方图正则以约束病灶强度分布。实验显示其可在完整 3D CT 中合成更符合亚型纹理的结节,定量指标和视觉图灵测试支持真实性;作为数据增强还提升结节亚型分类,并对恶性分类有潜在帮助。

Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs Figure 1
2026-06-01cs.CV

Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs

Haozhe Zhao, Shuzheng Si, Zhenhailong Wang, Zheng Wang, Liang Chen, Xiaotong Li, Zhixiang Liang, Maosong Sun, Minjia Zhang

University of Illinois at Urbana-Champaign, Tsinghua University, Peking University, most labor-intensive parts of paper preparation. Existing automated systems each, and benchmark are available at https://github.com/HaozheZhao/Crafter., Black Forest Labs, 2024]. One area where this progress has yet to translate into practical, labor-intensive parts of paper preparation. Recent work has begun to tackle this from two directions:, problematic when researchers need to adjust or revise individual labels, swap color schemes, or, recent raster-to-vector attempts [Lin et al., 2026, bit-datalab Contributors, unlike natural images, are structured compositions of discrete semantic components: labeled boxes, localized errors such as garbled labels and misaligned connectors that prompt rephrasing alone cannot

2026-06-01视觉感知

论文针对科研插图生成难以覆盖多图型、多输入条件且栅格结果不可局部编辑的问题,提出以结构化规格为共享记忆的多智能体“harness”:CRAFTER通过意图推理、方案探索、批评与规格修正闭环生成图,CRAFTEDITOR将栅格转为可编辑SVG,并构建CRAFTBENCH评测。实验显示其在PaperBanana-Bench和CRAFTBENCH上优于独立生成器与agent基线,消融表明各模块均有贡献。

ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models Figure 1
2026-06-01cs.CV

ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

Zihu Wang, Karthik Somayaji N.S, Peng Li

University of California, Santa Barbara

2026-06-01视觉语言视觉感知

针对视觉语言模型中自然语言 CoT 难以承载连续视觉证据、现有潜空间推理又缺少对象关系 grounding 的问题,ReGuLaR 用训练期 ReGFormer 将每个潜在推理状态对齐到问题相关的主体、客体及关系,并构建 RGrounding-351K 提供框和关系监督;推理时不需外部场景图。实验显示其在多类视觉推理基准上优于通用 LVLM、文本 CoT 和已有潜推理方法,消融表明增益主要来自关系级潜状态监督而非单纯数据微调。

Prior Availability in Industrial Visual Sim-to-Real: A Review of CAD-Guided and CAD-Unavailable Regimes Figure 1
2026-06-01cs.CV

Prior Availability in Industrial Visual Sim-to-Real: A Review of CAD-Guided and CAD-Unavailable Regimes

Chenxi Tao, Seung-Kyum Choi

George W. Woodruff School of Mechanical Engineering, Georgia Institute of Technology

2026-06-01视觉感知

工业视觉 sim-to-real 常被简化为合成到真实图像迁移,但真实产线还受传感器、光照、材料、标定和稀有缺陷影响。本文的核心洞察是按“先验可用性”重组问题:有 CAD 时可用几何进行渲染、位姿和测试时验证;无 CAD 时只能依赖正常性、特征残差或语言/基础模型先验。基于 T-LESS/BOP、MVTec AD、VisA 的综述锚点显示,CAD 渲染数量本身不足以闭合域差,源分布设计、模型容量和少量真实标定往往更关键。

AdvScene: Rethinking Adversarial Patch Evaluation Through Scene Robustness Figure 1
2026-06-01cs.CR

AdvScene: Rethinking Adversarial Patch Evaluation Through Scene Robustness

Xiaoyong (Brian) Yuan, Lan (Emily) Zhang

Clemson University, are controllable but not grounded in a specific real scene., scenes with controllable rendering and calibrated using matched, A gap between realism and controllability. Existing evalua-, tion sweeps [1], is scalable because a patch can be rotated, scaled, camera trajectories is labor-intensive, difficult to reproduce, and, grounded, controllable, and faithful to the behavior of the same, ingly practical to build controllable scene representations from, real capture with the controllability of simulation. However, adver-

2026-06-01数据集/基准安全鲁棒

本文针对物理对抗贴片评估中过于依赖单视角成功率的问题,指出真实风险应由视角、距离和场景上下文下的“场景鲁棒性”决定。AdvScene借助真实场景重建与3DGS渲染,并用APSE将单锚点视图贴片约束嵌入目标表面,测量攻击的有效操作包络。实验在CO3D、Waymo及物理采集中显示,其与真实攻击行为一致性达99.30%,并揭示图像平面或仿真评估会遗漏显著的场景依赖失效。

VLM3: Vision Language Models Are Native 3D Learners Figure 1
2026-06-01cs.CV

VLM3: Vision Language Models Are Native 3D Learners

Zhipeng Cai, Zhuang Liu, Yunyang Xiong, Zechun Liu, Vikas Chandra, Yangyang Shi

2026-06-01视觉语言视觉感知三维

论文针对现有三维理解仍依赖专用架构、复杂损失和增强的问题,提出 VLM3,核心洞察是标准 VLM 通过焦距统一、文本化像素/区域引用以及混合数据 scaling 即可学习细粒度 3D。结果显示其在深度估计上将 VLM 准确率从 0.84 提至 0.90,并在像素对应、相机位姿和物体级 3D 理解上接近或超过专家模型;增益可能主要来自数据混合与 scaling。

Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)? Figure 1
2026-06-01cs.CV

Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?

Yue Zhang, Zun Wang, Han Lin, Yonatan Bitton, Idan Szpektor, Mohit Bansal

2026-06-01视觉语言

这篇论文关注具身/机器人场景中视觉观察并不总可靠的问题:遮挡会让关键信息缺失,视角会制造误导。作者构建 SpatialUncertain,在3D仿真中把同一空间问题从可答变为应拒答,并加入视角选择评测。结果显示多种前沿VLM在遮挡和视角歧义下仍过度自信,遮挡平均约30%、视角歧义低于10%,且常难以选出可靠新视角;提示可部分缓解但有准确率代价,微调需覆盖多类不确定性。

On-Device Generative AI for GDPR-Compliant Visual Monitoring: Natural Language Alerts from Local Object Detection Figure 1
2026-06-01cs.CV

On-Device Generative AI for GDPR-Compliant Visual Monitoring: Natural Language Alerts from Local Object Detection

Gudrun Schappacher-Tilp, Nicoletta Kaehling, Jan Kornberger, Egon Teiniker

2026-06-01视觉感知生成模型

针对云端视觉监控需上传原始图像、与 GDPR 数据最小化原则冲突的问题,论文实现了树莓派 5 上的端侧闭环:Hailo-8L 加速 YOLOv5n-seg 检测后立即丢弃像素,仅把类别与事件 JSON 交给本地 Phi-3 Mini 生成告警文本。实验报告了延迟、资源占用和示例告警,表明单板机上结合视觉加速器与本地 LLM 可生成可用的自然语言监控输出,但仅为概念验证。

OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation Figure 1
2026-06-01cs.CV

OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation

Lin Zhao, Yushu Wu, Yifan Gong, Yanzhi Wang, Pu Zhao

Northeastern University

2026-06-01视觉感知

长视频自回归生成中,历史 KV cache 随片段增长而带来显存和注意力开销,截断或隐式压缩又易丢失远程细节并导致身份漂移。OmniMem 的核心洞察是做显式全范围稀疏检索,同时用自适应窗口排除缓解近邻偏置,并通过查询共享选择与逐头离散访问抑制 Union Explosion。实验显示其在 VBench-Long 上 Dynamic Degree 较最强基线提升 52.3%,一致性保持较好,且相对 LongLive 仅增加 1.7% 显存。

PhyDrawGen: Physically Grounded Diagram Generation from Natural Language Figure 1
2026-06-01cs.AI

PhyDrawGen: Physically Grounded Diagram Generation from Natural Language

Nafiul Haque, Syed Nazmus Sakib, Shifat E Arman

Department of Robotics and Mechatronics Engineering, University of Dhaka

2026-06-01视觉感知

论文针对现有图像生成模型在物理示意图中常出现力箭头幻觉、守恒律和几何约束错误的问题,提出将文本理解与物理约束求解解耦的 PhyDrawGen:先由 LLM 抽取类型化场景图,再用确定性 PSLG 求解器编码力平衡、光路和场线,最后由微调 Qwen-VL 迭代纠错。在含 1449 道力学、光学和电磁学题目的基准上,其物理约束满足率和标签正确性显著优于 GPT-5-image 与 Gemini 系列,但仍受限于二维经典场景和初始 LLM 抽取质量。

A Novel Global Context-aware Deep Neural Network for Enhanced Brain Tumor Segmentation using Magnetic Resonance Images Figure 1
2026-06-01cs.CV

A Novel Global Context-aware Deep Neural Network for Enhanced Brain Tumor Segmentation using Magnetic Resonance Images

Sourjya Mukherjee, Ananya Bhattacharjee, R. Murugan

2026-06-01视觉感知

针对脑肿瘤 MRI 手工分割成本高、误差大且肿瘤形态差异显著的问题,论文提出 GCSER-UNet:在 U-Net/残差框架中引入以通道均值和标准差加权的全局上下文 SE,并融合空间注意力与 ASPP 多尺度特征,另用三个轻量二分类模型分别处理 W/T/E 区域。结果在 TCGA LGG 上 Dice 达 94%,在 BraTS 2020 上 W/T/E 分别为 95%、92%、90%,整体优于多项对比,但 T 类较既有最佳略低。

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments Figure 1
2026-06-01cs.RO

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments

Shivendra Agrawal, Bradley Hayes

University of Colorado Boulder

2026-06-01视觉语言视觉感知强化学习安全鲁棒

针对商店、办公室等几何重复且物体半静态变化导致 AMCL 和固定类别语义定位易混淆的问题,VLM-GLoc 将视觉语言模型作为开放词表语义观测前端,把图像转为细粒度文本嵌入,并用反向语义提议初始化粒子、再分层融合几何约束。真实杂货店和实验室实验中,全局定位成功率分别达 70% 和 74%,显著高于几何或固定类别基线。

3DAE: Binaural Quality Assessment for Audio Novel View Synthesis with Spatial Maps and Benchmark Figure 1
2026-06-01cs.SD

3DAE: Binaural Quality Assessment for Audio Novel View Synthesis with Spatial Maps and Benchmark

Jialu Xu, Yifan Zhou

University of Waterloo

2026-06-01数据集/基准三维

这篇论文针对音频新视角合成中全局误差指标难以定位双耳失败原因的问题,提出全参考的 3DAE Map 与 3DAE Bench,将幅度、ILD/IPD、时间对齐、响度和高频损失转为可视化误差图和失效模式评分。实验用 ViGAS 在 Replay-NVAS 与 SoundSpaces 上验证,同一模型分别主要表现为时间错位和 ILD 不匹配,说明该基准能揭示单一标量指标掩盖的数据集相关问题。

Clustering Guided Domain-Specific Pretrained Foundation Model Very High-Resolution Arctic Remote Sensing Figure 1
2026-06-01cs.CV

Clustering Guided Domain-Specific Pretrained Foundation Model Very High-Resolution Arctic Remote Sensing

Amal S. Perera, Chandi Witharana, Elias Manos, Michael Pimenta, Anna K. Liljedahl

with limited labeled data. In this study, spectral and acquisition-, metadata descriptors were used within a scalable affinity-, hand-labeled Arctic feature-mapping datasets: human-built, Advanced Computing Center Award #: DPP20001). Authors would like to, thank Polar Geospatial Center, University of Minnesota for imagery support, Department of Natural Resources and the Environment, University of, Woodwell Climate Research Center, Falmouth, MA., availability from ground-based sensing, conventional aerial, However, despite the scale and diversity of available data, much, representations directly from raw, unlabeled data by, and suggest a pathway toward scalable and transferable, freely access Vantor images via the Polar Geospatial Center.

2026-06-01视觉感知

针对北极甚高分辨率遥感中标注稀缺、通用地球基础模型难以刻画冻土景观细粒度结构的问题,论文用光谱与成像元数据聚类从267TB影像中筛选约300万代表性patch,并以MAE预训练ViT-Large形成北极专用编码器。在基础设施、冰楔多边形、融冻滑塌和苔原网络任务上,F1较ImageNet初始化提升约5–8个百分点,并显著优于Prithvi-EO-2.0,增益可能主要来自领域数据筛选与预训练。

Dex2HOI: Dexterous Bimanual Two-Object Interaction Generation Figure 1
2026-06-01cs.CV

Dex2HOI: Dexterous Bimanual Two-Object Interaction Generation

Chrysa Pratikaki, Pablo Ruiz-Ponce, Jiankang Deng, Stefanos Zafeiriou, Rolandos Alexandros Potamias

Imperial College London, UK, University of Alicante, Spain

2026-06-01视觉感知

针对现有 HOI 生成多局限于单物体、缺少精细双手协同且常依赖测试时优化的问题,Dex2HOI提出文本条件的统一扩散框架,用双流解码与双向交叉注意力分别建模两个物体交互,并以手相对物体表示、运动融合网络和接触感知监督生成全身动作。其在 GRAB、HIMO、HUMOTO 上取得单/双物体设定的 SOTA,并通过前缀窗口自回归实现长序列实时生成,最高较优化式方法快 540 倍。

Mitigating Content Shift and Hallucination in GenAI Image Editing via Structural Refinement Figure 1
2026-06-01cs.CV

Mitigating Content Shift and Hallucination in GenAI Image Editing via Structural Refinement

Luxi Zhao, Michael S. Brown

Department of Electrical Engineering, York University, AI Center-Toronto

2026-06-01视觉感知

针对黑盒生成式图像编辑虽能提升观感却常引入位移、纹理失真、幻觉内容和分辨率不一致的问题,论文提出“结构保持 GenAI 融合”设定,并以光流对齐、全局色调迁移和可解释的多尺度共同/独有分解融合输入图与 GenAI 输出。实验在色调调整和低光增强中显示,相比写实风格迁移与图像融合基线,该方法在保留原图像素结构和分辨率的同时更好继承感知增强。

DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution Figure 1
2026-06-01cs.CV

DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

Hidir Yesiltepe, Koutilya PNVR, Gaurav Pathak, Navaneeth Bodla, Bharat Singh, Pinar Yanardag, Jinrong Xie

2026-06-01视觉感知生成模型

针对扩散式视频超分在低质或 AI 生成视频上容易照搬扭曲几何、导致时序不稳的问题,论文提出无需训练的 Decoupled Time Guidance:在采样中让无条件分支提前到更干净的时间步提供 lookahead 先验,并逐步退火,再接任意修复模块补细节。实验及新建 GenWarp480 表明其可提升结构保真、时序一致性和感知真实感,但摘要外的具体量化增益需结合全文核查。

SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer Figure 1
2026-06-01cs.CV

SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer

Yuyang Zhao, Yicheng Pan, Qiyuan He, Jincheng Yu, Junsong Chen, Tian Ye, Haozhe Liu, Enze Xie, Song Han

Project Page: https://nvlabs.github.io/Sana/Streaming

2026-06-01视觉感知生成模型

面向直播、游戏等需要低延迟且长时一致的视频到视频编辑,SANA-Streaming将GDN线性记忆与局部softmax注意力交错,配合Cycle-Reverse反向重建正则、因果VAE及针对RTX 5090的融合GDN核和混合精度量化,在单卡实现1280×704端到端24 FPS、DiT 58 FPS,并报告较现有方法在时序一致性和吞吐上更优。

Functional MRI Time Series Generation via Wavelet-Based Image Transform and Spectral Flow Matching for Brain Disorder Identification Figure 1
2026-06-01cs.LG

Functional MRI Time Series Generation via Wavelet-Based Image Transform and Spectral Flow Matching for Brain Disorder Identification

Hwa Hui Tew, Junn Yong Loo, Fang Yu Leong, Julia K. Lau, Ding Fan, Hernando Ombao, Raphaël C.-W. Phan, Chee Pin Tan, Chee-Ming Ting

School of Information Technology, Monash University Malaysia, School of Engineering, Monash University Malaysia, Statistics Program, King Abdullah University of Science and Technology

2026-06-01视觉感知生成模型

针对 fMRI 采集昂贵、样本少且传统 FC 或原始时序生成难以保留 BOLD 的非平稳与多尺度动态,论文提出 DSFM:先用 DWT 将时序转为多分辨率时尺度图,再在 DCT 域用谱流匹配进行类别条件生成,并经逆变换还原信号。实验显示其在无/有条件谱图合成上更贴近真实分布,并提升脑障碍分类表现,但具体增益与数据规模、预处理的关系仍需进一步澄清。

Lightweight SAR Ship Detection via Contrastive Distillation Figure 1
2026-06-01cs.CV

Lightweight SAR Ship Detection via Contrastive Distillation

Surendar Devasundaram, Saber Latibari Banafsheh, Abhijit Mahalanobis

University of Arizona, University of Arizona Department of Electrical and Computer Engineering Tucson Arizona USA

2026-06-01视觉感知

面向实时/星载 SAR 船舶检测中大模型精度高但计算开销大的问题,论文提出 SURGE:将不同检测器的预测统一为候选区域,在共享嵌入空间用 InfoNCE 蒸馏教师的目标级关系几何,而非仅匹配特征或 logits。SSDD、HRSID 实验显示其对两阶段轻量学生最有效,最高提升 6.2 mAP、8.0 AP75,参数减少超过 50%,部分学生可超过教师。

Updating the standard neuron model in artificial neural networks Figure 1
2026-06-01cs.NE

Updating the standard neuron model in artificial neural networks

Raul Mohedano, Thomas Batard, Erik Velasco-Salido, Ramsses De Los Santos Mendoza, Jorge H. Martínez, Stacey Levine, Marcelo Bertalmío

2026-06-01视觉感知

这篇论文针对现有 ANN 仍沿用“点神经元”而忽略树突非线性与反向动作电位交互的问题,提出隐式偏置神经元模型,在不增加可训练参数的情况下把同层单元间的耦合非线性写入神经元计算。作者给出解存在唯一性等理论分析,并在实验中报告更强表达性、鲁棒性、更快学习、较少记忆以及更低训练数据需求;但具体增益在多大程度来自该生物启发结构而非任务设置仍需更多验证。

XOResNet: Exclusive-OR Meta-Residuals Facilitate Deep Spiking Neural Networks Learning Figure 1
2026-06-01cs.NE

XOResNet: Exclusive-OR Meta-Residuals Facilitate Deep Spiking Neural Networks Learning

Jianfang Wu, Junsong Wang

School of Artificial Intelligence, Shenzhen Technology University, Shenzhen 518118, China, Faculty of Data Science, City University of Macau, Macau 999078, China

2026-06-01视觉感知

该文针对深层脉冲神经网络直接套用 ResNet 时的脉冲冗余、非恒等捷径信息丢失和残差分支重复学习问题,提出 OR-ADD 捷径:恒等映射用 OR 保持二值脉冲,尺度变换时改加电流;并用 XOR 预筛“元残差”指导主干学习。基于此构建的 XOResNet 在 Fashion-MNIST、CIFAR-10/100 和 miniImageNet 上优于多种梯度训练深层 SNN,并可扩展到 110 层未见退化。

2026-05-29

170 篇
GMOS: Grounding Moving Object Segmentation in 3D Space and Time Figure 1
2026-05-29cs.CV

GMOS: Grounding Moving Object Segmentation in 3D Space and Time

Junyu Xie, Tengda Han, Weidi Xie, Andrew Zisserman

Visual Geometry Group, Department of Engineering Science, University of Oxford, UK, SAI, Shanghai Jiao Tong University, China

2026-05-29视觉语言视觉感知三维

这篇论文针对现有运动物体分割依赖光流/轨迹等2D预处理、缺少3D几何且只按整段视频判断“是否运动”的问题,提出从RGB视频直接工作的Gmos:用π³几何特征与SAM2分割特征生成逐帧物体候选和瞬时运动状态,再传播成多目标轨迹,并提供更快的Gmos-S。作者还构建含逐物体时序运动标注的Gmos-2K与MOS-I评测;结果显示其在MOS、MOS-I和UVOS上达到SOTA,并显著快于既有多目标MOS方法。

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion Figure 1
2026-05-29cs.CV

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

2026-05-29视觉感知生成模型

面向分钟级自回归视频扩散,论文指出瓶颈不只在滑动窗口长度,而在每个 token 的密集多头 KV 缓存。VideoMLA 将每层 per-head K/V 替换为共享低秩内容 latent 和解耦 3D-RoPE 位置键,使单 token 缓存减少 92.7%;同时发现效果并非来自预训练注意力天然低秩,而是模型在给定秩预算内重新适配。基于 Wan-2.1 1.3B 的实验显示,其在 60 秒 VBench 上取得最佳总体分数,并在单 B200 上提升 1.23× 吞吐。

AdaState: Self-Evolving Anchors for Streaming Video Generation Figure 1
2026-05-29cs.CV

AdaState: Self-Evolving Anchors for Streaming Video Generation

Yusuf Dalva, Pinar Yanardag

2026-05-29视觉感知

本文针对自回归视频扩散在流式生成中“首帧锚点”过强的问题:KV 缓存中最干净的初始位置吸走注意力,带来一致性却压制运动和场景推进。AdaState 将固定锚点替换为不渲染的自适应隐状态,随每个 chunk 与内容共同去噪并写回缓存,使去噪过程本身形成递归状态转移;再用 horizon-weighted DMD 强化远期帧训练。实验显示其在更长 rollout 中提升动态性、场景演化和用户偏好。

NeuROK: Generative 4D Neural Object Kinematics Figure 1
2026-05-29cs.CV

NeuROK: Generative 4D Neural Object Kinematics

Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu

Stanford University, University of Cambridge, Cornell University

2026-05-29生成模型

面向具身智能/机器人所需的3D世界模型,NeuROK针对现有4D动态生成依赖类别物理模型、难扩展的问题,学习对象的低维运动学状态空间及解码器,把复杂形变转化为潜空间中的拉格朗日动力学建模。模型仅用大规模4D几何轨迹训练,无需物理或动作标注;在逆运动学与4D仿真评测中优于多类基线,并能覆盖弹性体、布料、连续体和多刚体等对象。

YoCausal: How Far is Video Generation from World Model? A Causality Perspective Figure 1
2026-05-29cs.CV

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

2026-05-29视觉感知强化学习

本文关注视频扩散模型能否从逼真生成走向真正世界模型,尤其是否理解因果而非只拟合时间统计。YoCausal借鉴认知科学VoE范式,用真实视频倒放构造可扩展反事实,并以RSI衡量时间箭头感知、CCI区分因果认知与时间偏置。对13个开源VDM的评测显示,部分模型有初步因果信号,但与人类仍有明显差距;高RSI不等于高CCI,性能提升可能主要来自scaling和架构/数据差异。

Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field Figure 1
2026-05-29cs.CV

Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field

Shangjie Xue, Jesse Dill, Dhruv Ahuja, Frank Dellaert, Panagiotis Tsiotras, Danfei Xu

Georgia Institute of Technology

2026-05-29三维安全鲁棒

面向机器人主动建图,论文指出3DGS现有不确定性估计常低估训练视角未覆盖区域,影响下一视角选择。GAVIS以每个高斯粒子相对训练视角的各向异性可见性为核心,用球谐表示并接入贝叶斯不确定性光栅化器,在最大信息增益框架下规划视角。多类合成、室内与空间机器人场景中,其重建指标和不确定性质量优于FisherRF、VIMC、NVF,且约200 FPS、预处理开销更低,并可作为后处理增强既有方法。

GPIC: A Giant Permissive Image Corpus for Visual Generation Figure 1
2026-05-29cs.CV

GPIC: A Giant Permissive Image Corpus for Visual Generation

Keshigeyan Chandrasegaran, Kyle Sargent, Suchir Agarwal, Michael Jang, Michael Poli, Juan Carlos Niebles, Justin Johnson, Jiajun Wu, Li Fei-Fei

Stanford University, University of Michigan

2026-05-29视觉感知

针对视觉生成研究缺少大规模、稳定、可复现且商业可用数据集的问题,GPIC构建了约280万亿像素、1亿训练图像的宽许可图像语料,并用VLM完成过滤、去重与多粒度字幕标注;论文还提出基于百万留出集和FD-DINOv2的评测协议,并给出像素空间flow matching基线,主要贡献可能来自数据规模与许可/托管规范化。

Benchmarking Single-Factor Physical Video-to-Audio Generation Figure 1
2026-05-29cs.CV

Benchmarking Single-Factor Physical Video-to-Audio Generation

Tingle Li, Siddharth Gururani, Kevin J. Shih, Gantavya Bhatt, Sang-gil Lee, Zhifeng Kong, Arushi Goel, Gopala Anumanchipalli, Ming-Yu Liu

University of Washington

2026-05-29视觉感知数据集/基准

现有视频生音频评测多看感知真实感,难判断模型是否理解碰撞、材质、液体多少等物理成因。本文提出 FlatSounds,用单因素反事实视频对和单视频模式测试,配合时间对齐与物理特征指标审计因果响应。实验显示,主流 V2A 模型更依赖文本提示获得语义和物理正确性,但会牺牲音画同步;去掉文本后时间指标反而常改善,暴露视觉编码器尚未从像素中学到可靠物理过程。

REST3D: Reconstructing Physically Stable 3D Scenes from a Single Image Figure 1
2026-05-29cs.CV

REST3D: Reconstructing Physically Stable 3D Scenes from a Single Image

Xiaoxuan Ma, Jiashun Wang, Nicolas Ugrinovic, Yehonathan Litman, Kris Kitani

Carnegie Mellon University

2026-05-29视觉感知三维

REST3D针对单图像3D重建常见的物体悬浮、穿模导致仿真不稳定问题,不只追求视觉相似,而是用VLM推断重力支撑关系的场景树,再结合图像到3D初始化、树引导对齐与物理约束优化修正布局。实验在合成和真实数据上同时提升重建质量与物理稳定性,相比SAM3D稳定性提高83个百分点,并展示可用于VR交互的仿真就绪场景。

Colored Noise Diffusion Sampling Figure 1
2026-05-29cs.CV

Colored Noise Diffusion Sampling

Hadar Davidson, Noam Issachar, Sagie Benaim

The Hebrew University of Jerusalem

2026-05-29生成模型

本文针对扩散模型采样中 SDE 求解器始终注入白噪声、忽略“先生成低频结构、后补高频细节”的谱偏置问题,提出无需训练的 Colored Noise Sampling:在保持每步总方差不变的前提下,按时间步和频段把噪声能量分配给尚未解析的频率。该方法可直接替换采样器,在 SiT、JiT、FLUX 上验证;ImageNet-256 无引导 FID 如 SiT-XL/2 从 8.26 降至 6.27,JiT-B/16 从 32.39 降至 26.69,并在 CFG 下也有稳定改进。

Supercharging Thermal Gaussian Splatting with Depth Estimation Figure 1
2026-05-29cs.CV

Supercharging Thermal Gaussian Splatting with Depth Estimation

Manoj Biswanath, Chenxin Cai, Hannah Schieber, Daniel Roth, Benjamin Busam

Photogrammetry and Remote Sensing, Munich Center for Machine Learning (MCML), Human-Centered Computing and Extended Reality Lab, TUM University Hospital, Clinic for Orthopedics and Sports Orthopedics, Munich Institute of Robotics and Machine Intelligence (MIRMI)

2026-05-29三维

面向低光、烟雾等RGB失效场景下的三维热辐射场重建,论文提出TDg:用热红外图像生成深度先验,并在Gaussian Splatting中联合热图与深度渲染损失,减少多模态配准和冗余优化。其在RGBT-Scenes与ThermalMix上多数指标略优于MSMG,LPIPS/SSIM/PSNR平均小幅提升,同时训练时间减少约55%;但初始化仍依赖RGB-SfM点云,纯热端到端能力尚未充分解决。

Veda: Scalable Video Diffusion via Distilled Sparse Attention Figure 1
2026-05-29cs.CV

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

2026-05-29视觉感知生成模型

本文针对视频 DiT 在高分辨率、长时长生成中自注意力二次复杂度过高的问题,指出质量下降关键不在稀疏率本身,而在稀疏 tile mask 是否对齐全注意力的 tile 结构。Veda 通过全注意力蒸馏显式学习 tile 选择,结合统计感知打分、按 head 的 tiling 与 tile-skipping kernel,在 Waver/Wan2.1 上实现无明显质量损失的加速;720P 10 秒 Waver-T2V-12B 达到 5.1× 端到端和 10.5× 注意力加速。

MonoPhysics: Estimating Geometry, Appearance, and Physical Parameters from Monocular Videos Figure 1
2026-05-29cs.CV

MonoPhysics: Estimating Geometry, Appearance, and Physical Parameters from Monocular Videos

Daniel Rho, Jun Myeong Choi, Matthew Thornton, Biswadip Dey, Roni Sengupta

University of North Carolina at Chapel Hill

2026-05-29视觉感知

MonoPhysics瞄准单目视频中可变形物体反演物理参数的难题:缺少多视角约束会导致尺度、几何和材料估计相互混淆。论文将3D Gaussian同时作为渲染单元和MPM粒子,并通过全局尺度对齐、物理感知几何细化和可微位置图加强视觉—物理梯度耦合。实验显示其在Vid2Sim单目设置和新弹性/塑性数据集上优于PAC-NeRF、GIC等基线,部分参数精度接近多视角Vid2Sim。

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes Figure 1
2026-05-29cs.GR

Before the Shutter: Aesthetic and Actionable Portrait Photography Planning in 3D Scenes

Ruixiang Jiang, Chang Wen Chen

The Hong Kong Polytechnic University, The Hong Kong Polytechnic University Hong Kong SAR China

2026-05-29规划控制三维

本文针对现有人像计算多停留在拍后2D修图、难以给出可执行拍摄方案的问题,提出“3D审美人像规划”:在三维场景中联合规划人物姿态、相机、灯光与曝光。核心是用摄影场景图编码可供性、人物-场景关系和光照结构,并通过审美引导的成对比较迭代优化候选方案。实验显示其在人类与多模态大模型评审中较基线更受偏好,同时保持较高物理可行性。

VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation Figure 1
2026-05-29cs.CV

VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation

Xinyao Liao, Qiyuan He, Yicong Li, Jiayin Zhu, Xiaoye Qu, Wei Wei, Angela Yao

National University of Singapore, Huazhong University of Science & Technology

2026-05-29视觉感知

论文针对视觉自回归生成中 teacher forcing 训练与自生成前缀推理不一致导致的 exposure bias 和前缀漂移,提出无需训练的 Visual Prefix Guidance:用真实前缀与同尺度 embedding 置换后的损坏前缀做 logit 对比,偏向更支持已有前缀的下一步预测。该方法可与 CFG 组合,在 VAR 上平均降低 FID 0.36,并提升 Infinity 文生图与 InfinityStar 文生视频基准表现。

Archon: A Unified Multimodal Model for Holistic Digital Human Generation Figure 1
2026-05-29cs.CV

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

State Key Lab of CAD&CG, Zhejiang University

2026-05-29视觉语言

面向数字人生成中多模态专家模型割裂、跨模态任务难扩展的问题,Archon 将描述、脚本、语音、动画、语义视频、图像和视频用专用 tokenizer 统一到自回归模型中,并以同步数据和 72 类任务预训练;其语义视频重参数化缓解长视频 token 爆炸,再用扩散解码恢复高保真画面,“Thinking in Modality”则把含糊跨模态生成拆成中间模态链。实验显示其在多种数字人生成任务上达到优于或接近专用模型的表现,但具体增益中可能包含 data / scaling 贡献。

City-Mesh3R: Simulation-Ready City-Scale 3D Mesh Reconstruction from Multi-View Images Figure 1
2026-05-29cs.CV

City-Mesh3R: Simulation-Ready City-Scale 3D Mesh Reconstruction from Multi-View Images

Sayan Paul, Sourav Ghosh, Siddharth Katageri, Soumyadip Maity, Sanjana Sinha, Brojeshwar Bhowmick

Visual Computing & Embodied AI Lab, TCS Research, India

2026-05-29视觉感知三维

面向城市数字孪生、规划与灾害仿真,论文指出 NeRF/高斯表示难以直接产出可仿真的水密网格且大规模 SfM 代价高。City-Mesh3R 采用端到端分布式图像到网格流程:拓扑图像聚类做稀疏 SfM 与合并,再几何感知分区、密集重建和曲率自适应重网格化后拼接全城网格。实验称在城市级数据上提升处理时间与表面质量,增益主要来自分治式 scaling 与自适应网格优化。

Grounded 3D-Aware Spatial Vision-Language Modeling Figure 1
2026-05-29cs.CV

Grounded 3D-Aware Spatial Vision-Language Modeling

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

2026-05-29视觉语言视觉感知三维

面向具身智能中语言指令难以可靠落到物体位置与三维结构的问题,本文提出 GR3D,将显式2D grounding、生成过程中的隐式区域 token 插入,以及区域提示的单目3D框预测统一到空间 VLM 中,用“先定位2D证据、再推断3D几何”的分解增强推理。实验显示其在 CVBench、ERQA、SAT 等空间任务上提升一致性,并在 Omni3D 上取得领先的3D grounding/检测结果。

Boosting Image Quality Assessment Performance: Unsupervised Score Fusion by Deep Maximum a Posteriori Estimation Figure 1
2026-05-29cs.CV

Boosting Image Quality Assessment Performance: Unsupervised Score Fusion by Deep Maximum a Posteriori Estimation

Zhongling Wang, Raymond Zhou, Shahrukh Athar, Wenbo Yang, Zhou Wang

2026-05-29视觉感知

针对单个图像质量评估模型常因内容或失真类型产生偏置的问题,本文将多模型分数融合表述为无 MOS 监督的后验估计任务,核心是用编码器、解码器与逐分数不确定性模块建模各 IQA 分数可信度,并可兼容排序融合。实验在十个 IQA 数据集上显示,该方法优于单模型及现有无监督融合方法,还能在融合中降低“坏模型”影响。

PhyGenHOI: Physically-Aware 4D Generation of Dynamic Human-Object Interactions Figure 1
2026-05-29cs.CV

PhyGenHOI: Physically-Aware 4D Generation of Dynamic Human-Object Interactions

Omer Benishu, Gal Fiebelman, Sagie Benaim

Hebrew University of Jerusalem

2026-05-29视觉感知

针对文本到4D人-物交互中语义生成易出现穿模、幽灵效应而物理响应不足的问题,PhyGenHOI将3DGS作为统一表示,把MDM驱动的人体语义运动与MPM物体仿真耦合,并用窗口吸引损失、接触触发重仿真和掩码Video-SDS对齐接触过程。实验在10类交互上优于4DFY和AnimateAnyMesh,提升物理合理性、文本对齐和用户评分。

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion Figure 1
2026-05-29cs.CV

LoMo: Local Modality Substitution for Deeper Vision-Language Fusion

Feng Han, Zhixiong Zhang, Zheming Liang, Yibin Wang, Jiaqi Wang

Fudan University, Shanghai Innovation Institute, Shanghai Jiao Tong University, University of Science and Technology of China

2026-05-29视觉语言视觉感知

论文指出现有视觉语言模型对“语义载体”敏感:同一问题从文本改为渲染图像后性能显著下降,且与跨载体表征距离相关。LoMo通过在SFT数据中局部选择文本片段并渲染成图像,构造“文本-视觉-文本”序列,隐式强化等价语义的跨模态对齐且无需改模型。实验在13个多模态基准上提升推理表现,相比标准SFT在LLaVA-OneVision-1.5-8B和Qwen3.5-9B上分别增益2.67和2.82分,并降低跨模态距离14.2%。

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models Figure 1
2026-05-29cs.CV

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

2026-05-29视觉感知强化学习

现有视频扩散模型虽能离线生成高质量视频,但缺少交互式世界模型所需的因果、可控与低延迟推演。minWM 的核心是把 T2V/TI2V 双向视频基座通过相机可控微调、AR 扩散训练、Causal Forcing/++ 少步蒸馏和非对称 DMD,转为相机轨迹可控的自回归生成器。论文在 Wan2.1 与 HY1.5 等开源骨干上给出可复现流水线、脚本、检查点和消融,展示其可适配 HY-WorldPlay 等模型;具体量化增益文中未充分说明。

How LoRA Remembers? A Parametric Memory Law for LLM Finetuning Figure 1
2026-05-29cs.CL

How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

Ziwen Xu, Haiwen Hong, Linsong Yu, Benglei Cui, Longtao Huang, Hui Xue, Ningyu Zhang

Zhejiang University

2026-05-29视觉感知

论文关注 LoRA 微调中“参数记忆”到底能存多少、如何失效的问题,避免仅用问答等下游任务混淆记忆与理解。作者把 LoRA 作为可控探针,提出损失下降与有效参数、序列长度相关的 Parametric Memory Law,并发现贪心解码下 token 概率超过 0.5 可触发稳定逐字召回。基于此设计 MemFT,将训练预算转向低于阈值的难记 token,实验显示可提升精确记忆保真度与参数效率;但结论主要验证于 8B 规模,跨规模与随机解码适用性文中未充分说明。

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning Figure 1
2026-05-29cs.CV

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss

2026-05-29视觉语言视觉感知强化学习

本文针对图像分层分解缺少唯一标注、监督学习易惩罚合理替代分解的问题,提出用VLM打分作为奖励来微调Qwen-Image-Layered。核心在于两阶段奖励:先按编辑相关维度结构化评分,再用候选网格做相对校准,以缓解VLM分数压缩;同时调整RatioNorm稳定Flow-GRPO训练。无需层标注训练后,在Crello等评测中获得更清晰的语义分离、更少空白/伪影层和更低逐层重建误差。

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents Figure 1
2026-05-29cs.CV

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello

2026-05-29视觉感知

面向机器人、XR 等场景中的自然人机对话,论文指出现有全双工评测多只看语音,难以衡量点头、凝视、表情等非语言互动。VideoFDB 构建237段真实双人视频、11类非语言动态,并用感知/生成分离的量表式 LM-as-judge 评估框架。实验显示当前开闭源视觉语音代理普遍出现“字幕化回答”和忽视视觉流,级联语音到虚拟人系统也难以实时生成全双工非语言线索。

Ambient-robust Inverse Rendering using Active RGB-NIR Imaging Figure 1
2026-05-29cs.CV

Ambient-robust Inverse Rendering using Active RGB-NIR Imaging

Hoon-Gyu Chung, Jinnyeong Kim, Hyunwoo Kang, Seung-Hwan Baek

2026-05-29安全鲁棒

针对传统逆渲染在非受控环境光下易混淆光照与材质、几何重建不稳定的问题,本文引入主动 RGB–NIR 成像:用人眼不可见的 NIR 闪光提供近似不受环境光影响的点光源阴影,同时保留 RGB 自然外观,并设计三阶段联合估计几何、粗糙度/金属度与可见光反照率。作者还构建移动机械臂采集系统和多光照 RGB–NIR 数据集;真实与合成实验显示其在多种环境光下较已有方法获得更准确的几何和反射率估计。

GenClaw: Code-Driven Agentic Image Generation Figure 1
2026-05-29cs.CV

GenClaw: Code-Driven Agentic Image Generation

Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li

2026-05-29视觉感知

针对现有图像生成代理只能反复改提示、难以直接控制空间布局和文字等问题,GenClaw提出“构思—草图—上色”的代码驱动流程:先检索推理补全语义,再用SVG/HTML/Three.js生成可执行草图,最后交给图像模型补纹理与真实感。文中展示其在复杂构图、文字排版、物理场景和分层编辑上更可控,但多为定性案例,量化增益和失败边界文中未充分说明。

Reinforcement Learning with Robust Rubric Rewards Figure 1
2026-05-29cs.CV

Reinforcement Learning with Robust Rubric Rewards

Ya-Qi Yu, Hao Wang, Fangyu Hong, Xiangyang Qu, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

Huawei Technologies Co., Ltd.

2026-05-29强化学习安全鲁棒

针对视觉语言任务中许多监督信号只能“部分可验证”、传统 RLVR 奖励过粗且易被在线策略利用的问题,本文提出 RLR³,将实例化 rubric 拆到准则级:可验证项由抽取器加确定性校验,模糊项由文本 Judge 评分,并用最小暴露、分层聚合和分数重映射提升鲁棒性。在 Qwen3-VL-30B-A3B 的 15 个基准上,相比基座平均提升 4.7 分,并在三类训练混合上稳定优于 RLVR,审计显示可降低可利用的假阳性。

SAM3D-Phys: Towards Multi-Object Interactive Simulation in Real World Figure 1
2026-05-29cs.CV

SAM3D-Phys: Towards Multi-Object Interactive Simulation in Real World

Xin Dong, Weijian Deng, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

2026-05-29强化学习三维

该文针对真实多视角重建场景中物体因遮挡和视角不足而几何残缺、难以用于物理交互的问题,提出免训练的 SAM3D-Phys:用 SAM3D 的生成式三维先验补全物体,再通过物理约束位姿对齐和掩码引导外观蒸馏恢复其在场景中的位置与纹理,并接入 MPM 做多物体仿真。实验构建真实多物体基准,显示其能得到更完整的可仿真物体并支持更稳定、场景一致的交互,但外观光照变化仍是限制。

BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval Figure 1
2026-05-29cs.CV

BullingerDB: A Dataset for Handwritten Text Recognition and Writer Retrieval

Marco Peer, Anna-Scius Bertrand, Patricia Scheurer, Andreas Fischer

2026-05-29视觉感知数据集/基准

面向历史手稿分析中缺少大规模、多语种且带时间元数据基准的问题,BullingerDB整理布林格16世纪通信,提供20,898页、499,222行、796名书写者的行切分、转写、作者与日期信息。其核心价值可能主要来自数据规模与时间跨度,并为HTR和书写者检索建立协议,引入时间nDCG衡量检索的时间一致性。基线中TrOCR达到9.1% CER;书写者检索mAP为78.3%,显示长期书写风格变化仍会削弱排序质量。

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning Figure 1
2026-05-29cs.CV

Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning

Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao

2026-05-29视觉语言视觉感知三维

针对VLM三维空间推理依赖3D VQA微调易过拟合、外接3D编码器又笨重的问题,本文提出GASP:在LLM各层训练期插入轻量对应头,用跨帧点对应的对比损失和深度一致性监督注入几何先验,推理时移除该头且无需3D输入。实验显示内部对应匹配从低于5%提升到70%以上,并在All-Angles、VSI-Bench、BLINK等空间基准上分别取得显著增益。

IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation Figure 1
2026-05-29cs.CV

IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang

Information Engineering University, Huai’an University, Chongqing University of Post and Telecommunications, Nankai University

2026-05-29生成模型

针对扩散式说话人脸生成依赖大规模音视频数据和高成本微调的问题,FreeTalkDiff尝试直接冻结使用 Stable Diffusion 与 IP-Adapter,并利用后者对人脸口部语义的天然关注;再通过无训练参数的 Structurist、Structure Controller 和 Noise Sensor 分别缓解身份漂移、唇形不同步与时序闪烁。在 CREMA、HDTF 上,文中报告相较现有方法 PCLD 至少提升 0.16、FID 至少改善 0.7。

Déjà View: Looping Transformers for Multi-View 3D Reconstruction Figure 1
2026-05-29cs.CV

Déjà View: Looping Transformers for Multi-View 3D Reconstruction

Alessandro Burzio, Tobias Fischer, Sven Elflein, Qunjie Zhou, Riccardo de Lutio, Jiawei Ren, Jiahui Huang, Shengyu Huang, Marc Pollefeys, Laura Leal-Taixé, Zan Gojcic, Haithem Turki

University of Modena and Reggio Emilia, AImageLab, University of Toronto, Vector Institute

2026-05-29三维

针对多视角三维重建 Transformer 依赖加深加宽、参数冗余地“隐式迭代”的问题,DéjàView 将迭代显式化:用同一个共享 Transformer 块在 DINOv2 视图特征上循环细化,并通过可变 K 训练把推理步数变成算力旋钮。实验显示其在室内、室外、物体和驾驶等五类基准上达到或超过更大前馈模型,参数更少且计算相当或更低;共享循环还优于同预算的非共享逐步参数版本。

Cycle Consistency in Video Object-Centric Learning Figure 1
2026-05-29cs.CV

Cycle Consistency in Video Object-Centric Learning

Rongzhen Zhao, Zhiyuan Li, Ruonan Wei, Juho Kannala, Joni Pajarinen

2026-05-29视觉感知

这篇论文关注视频对象中心学习中如何利用多目标跟踪里的循环一致性:作者指出,直接在 slot 潜空间做前后向硬对齐会忽视自监督场景分解的多解性,导致特征塌缩。其核心做法是提出隐式循环一致性 ICC,把约束移到重建/观测流形上,让前后向表示在解释画面上达成软共识而非逐点匹配。实验显示 ICC 在复杂视频 OCL 基准上优于显式一致性基线,并能缓解对象发现中的退化问题。

LiveSVG: Zero-Shot SVG Animation via Video Generation Figure 1
2026-05-29cs.CV

LiveSVG: Zero-Shot SVG Animation via Video Generation

Matan Levy, Ran Margolin, Bar Cavia, Dvir Samuel, Yael Pritch, Shmuel Peleg, Alex Rav Acha, Ariel Shamir, Dani Lischinski

The Hebrew University of Jerusalem, Bar-Ilan University, Reichman University, The Hebrew University of Jerusalem Israel, Bar-Ilan University Israel, Reichman University Israel

2026-05-29视觉感知

针对现有 SVG 动画方法难以表达复杂非刚性运动、SDS 优化噪声大且常依赖骨架的问题,LiveSVG 将运动生成与矢量拟合解耦:先用图生视频模型生成可预览目标视频,再通过可微渲染拟合原始 SVG,并结合组级单应变换、路径级 Bézier 控制点偏移和球堆积重着色减少对应歧义。在 AniClipart 与新提出的复杂多物体 ChallengeSVG 上,人评显示其优于代码生成和 SDS 基线,同时保持可编辑矢量输出。

Unveiling the Visual Counting Bottleneck in Vision-Language Models Figure 1
2026-05-29cs.MM

Unveiling the Visual Counting Bottleneck in Vision-Language Models

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

*Equal contribution 1Department of Computer Science, ETH, Our code is publicly available here: https://github.c, a label?, in real-world datasets, we construct a synthetic laboratory, (50 −99), where the model possesses the linguistic labels, a synthetic laboratory using a custom VLM trained from, .1. Study 1: The Synthetic Laboratory, model possesses the labels (from Phase 1) but has never ob-

2026-05-29视觉语言视觉感知

本文关注视觉语言模型在视觉计数中训练分布外骤降的问题,将计数拆成视觉个体化、数量感知与符号映射三阶段,并用合成围棋盘、线性探针及 Qwen3-VL 验证机制。结果显示模型在外推区仍能线性表征数量、完成比较推理,失败主要发生在把潜在数量映射为数字 token,支持“断裂数量空间”假说,说明单纯数据 scaling 不足以解决跨模态数值泛化。

OmniCD: A Foundational Framework for Remote Sensing Image Change Detection Guided by Multimodal Semantics Figure 1
2026-05-29cs.CV

OmniCD: A Foundational Framework for Remote Sensing Image Change Detection Guided by Multimodal Semantics

Chenhao Sun

2026-05-29视觉语言视觉感知

针对遥感变化检测在跨场景、开放类别和少标注条件下泛化不足的问题,OmniCD将多时相图像与文本描述、语义图、地理元数据等提示统一建模,并结合层级场景检索、guider–detector检测结构和风格解耦以增强跨域鲁棒性。论文还构建30万级图文对RSITCD数据集,实验称在多基准取得SOTA并支持零样本语义变化理解,但增益可能部分来自大规模数据。

Visual Spatial Learning: Single-Field Spatial Interpolation Using Convolutional Neural Networks Figure 1
2026-05-29stat.ML

Visual Spatial Learning: Single-Field Spatial Interpolation Using Convolutional Neural Networks

Daniel Tinoco, Raquel Menezes, Carlos Baquero, Alexandra Silva

2026-05-29视觉感知

本文针对稀疏观测下重建完整空间场的问题,指出 Kriging 依赖平稳性、协方差/变差函数建模且在异质场景中成本高。核心做法是把插值视为类似图像修复的单场学习任务,用带掩码/部分卷积的编码器—解码器 CNN 仅在当前观测点监督训练,无需外部数据或先验场。实验在合成与真实空间场上显示,其效果可与普通 Kriging 相当,调参后在局部结构和非平稳性明显的场景中可更优。

Why Far Looks Up: Probing Spatial Representation in Vision-Language Models Figure 1
2026-05-29cs.CV

Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

Cheolhong Min, Jaeyun Jung, Daeun Lee, Hyeonseong Jeon, Yu Su, Jonathan Tremblay, Chan Hee Song, Jaesik Park

2026-05-29视觉语言视觉感知

针对VLM空间推理高分可能只是利用自然图像透视捷径的问题,论文从表示层构造最小对比样本,分析左右、上下、远近轴是否解耦,并提出去除“越高越远”相关性的SpatialTunnel基准。实验发现多类模型普遍把垂直位置与距离纠缠,数据规模提升会提高总体分数但加重该偏差;空间轴更分离的模型在常规与反启发样本上更稳健。

AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection Figure 1
2026-05-29cs.CV

AnomalyAgent: Training-Free Agentic Models for Zero-/Few-Shot Anomaly Detection

Yi Zhang, Jiawen Zhu, Lele Fu, Guansong Pang

Singapore Management University, Singapore, Sun Yat-sen University, China

2026-05-29视觉感知

针对现有零/少样本异常检测依赖VLM相似度打分、需辅助训练且难处理逻辑/上下文异常的问题,本文提出无需训练的AnomalyAgent,将MLLM的规划、工具调用、反思推理直接纳入检测,并用异常中心工具集与少样本记忆校准正常性先验。实验覆盖工业、医疗、物流等场景,显示其优于训练-free VLM和通用Agent,消融表明AD专用工具与记忆校准是主要增益来源。

CCS: Clinical Consensus Selection for Radiology Report Generation Figure 1
2026-05-29cs.CL

CCS: Clinical Consensus Selection for Radiology Report Generation

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

♠ School of Computing Science, University of Glasgow, ♣ School of Electrical and Computer Engineering, University of Sydney, ♢ Language Technology Lab, University of Cambridge

2026-05-29视觉感知

本文针对放射报告生成中常见的单路径解码脆弱性:固定 MLLM 往往已在候选池中生成更可靠报告,却默认选错。CCS 不重训模型,而是在推理时采样多份报告,用文本相似度和影像-报告多模态嵌入计算候选间临床共识,选择共识最高者。三组数据集和多种放射 MLLM 上,CCS 相比单路径解码与通用 Best-of-N 更稳定提升,尤其体现在临床指标上。

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding Figure 1
2026-05-29cs.CV

PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding

Selim Kuzucu, Alessio Tonioni, Vasile Lup, Bernt Schiele, Federico Tombari, Muhammad Ferjad Naeem

Max Planck Institute for Informatics, SIC, Technical University of Munich

2026-05-29视觉语言视觉感知

针对大视觉语言模型中视觉 token 过多导致推理成本高、固定压缩又难兼顾细节的问题,PARCEL指出纯空间池化会混叠细节、纯查询重采样会削弱空间定位,并用空间池化 token 作低频锚点、条件化弹性查询补充语义细节,实现一次训练多预算部署。在27个图像、视频与密集理解基准上,它在16到256 token预算下均优于M3和MQT,提升性能—效率帕累托前沿。

SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation Figure 1
2026-05-29cs.CV

SGMD: Score Gradient Matching Distillation for Few-Step Video Diffusion Distillation

Zhuguanyu Wu, Ruihao Gong, Yang Yong, Yushi Huang, Xiangyu Fan, Lei Yang, Dahua Lin, Xianglong Liu

2026-05-29视觉感知生成模型优化算法

针对少步视频扩散蒸馏中 DMD 需频繁更新 fake score、训练开销高,且反向 KL 易保守抑制运动的问题,SGMD 以 teacher stop-gradient Fisher 构造稳定匹配目标,并用 NR/RC 双势函数分别修正生成器外循环和收缩 fake-score 跟踪残差。在 Wan2.1-T2V-14B 的 4 步蒸馏上,相比 DMD2 将 fake-score 更新从 5 次降至 1 次,约 3 倍提速,同时提升运动强度与动态一致性,人评运动质量和总体偏好更高。

Large Depth Completion Model from Sparse Observations Figure 1
2026-05-29cs.CV

Large Depth Completion Model from Sparse Observations

Zhu Yu, Zhengyi Zhao, Runmin Zhang, Lingteng Qiu, Kejie Qiu, Yisheng He, Siyu Zhu, Zilong Dong, Si-Yuan Cao, Hui-Liang Shen

Zhejiang University, Tongyi Lab, Alibaba Group, Fudan University, Ningbo Innovation Center, Zhejiang University, NingboTech University, Jinhua Institute of Zhejiang University, Internship at Tongyi Lab Corresponding author

2026-05-29视觉感知

针对稀疏、分布不规则深度观测在跨域场景中难以补全且缺乏显式3D几何的问题,LDCM先用单目深度基础模型与稀疏点构造泊松粗深度,再将深度回归改为逐像素相机坐标点图预测,以强化度量一致性且减少对内参依赖;六个基准和多种稀疏度实验显示其在深度补全与点图估计上均优于现有方法。

xModel-KD: Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR Figure 1
2026-05-29cs.CV

xModel-KD: Cross-modal Knowledge Distillation for 3D Scene Perception using LiDAR

Thenukan Pathmanathan, Kanchan Keisham, Thangarajah Akilan

2026-05-29三维

针对3D点云分割标注昂贵、LiDAR缺少纹理语义且相机-LiDAR融合存在视场不匹配和推理开销的问题,xModel-KD将冻结2D视觉教师的语义知识仅在训练阶段蒸馏到3D网络。其核心是用点-像素投影和多尺度对比损失对齐2D/3D层级特征,测试时移除图像分支实现零额外开销;实验显示相对LiDAR-only基线mIoU绝对提升约2%。

Evaluation of Conversational Agents: Understanding Culture, Context and Environment in Emotion Detection Figure 1
2026-05-29cs.CV

Evaluation of Conversational Agents: Understanding Culture, Context and Environment in Emotion Detection

Martha Teiko Teye, Yaw Marfo Missah, Emmanuel Ahene, Twum Frimpong, Auxane Boch

Cluster of Excellence, University of Stuttgart, 70174 Stuttgart, German, Department of Computer Science, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana, Institute for Ethics in Artificial Intelligence, Technical University of Munich, 80333 Münich, Germany, Large image and text-based datasets made available from

2026-05-29视觉感知数据集/基准

论文关注会话式 AI 情绪识别在跨文化部署中的偏差问题,尤其是黑人非洲社会中地理、文化语境被通用模型忽视而带来的伦理与可靠性风险。作者将语音与人脸图像融合,用三层 CNN 结合 Audio-Frame Mean Expression,并在数据平衡、预处理和后处理阶段减轻偏差,识别七类基本情绪及讽刺。报告准确率为 85%–96%,但具体基准设置与增益来源文中未充分说明。

Geometry Matters: 3D Foundation Priors for Learning Semantic Correspondence Figure 1
2026-05-29cs.CV

Geometry Matters: 3D Foundation Priors for Learning Semantic Correspondence

Artur Jesslen, Olaf Dünkel, Adam Kortylewski

University of Freiburg, Germany, Max Planck Institute for Informatics, Saarland Informatics Campus, Germany, CISPA Helmholtz Center for Information Security, Germany

2026-05-29三维

针对 DINO/Stable Diffusion 等二维基础特征在语义对应中易混淆左右、重复部件和三维上不同结构的问题,本文引入无需人工姿态标注的 3D 后训练框架:用 SAM3D 估计实例几何与姿态,经渲染对比细化后投影 PartField 特征,并以重建形状上的测地距离过滤伪匹配来训练轻量适配器。实验显示其在标准语义对应基准上优于既有基于球面先验的方法,同时减少人工几何监督。

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation Figure 1
2026-05-29cs.CL

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

2026-05-29视觉感知数据集/基准

长视频生成已从单镜头扩展到多镜头叙事,但现有评测偏重局部画质和提示对齐,难以定位跨镜头、音画同步及用户偏好相关失败。DirectorBench用结构化元数据、7类用户画像和40个检查点,结合多智能体与置信聚合给出个性化诊断。评测4种流程、6个LLM后发现主要瓶颈在单元间过渡,平均仅0.256,且人评支持其能揭示聚合分数掩盖的失败模式。

Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation Figure 1
2026-05-29cs.CV

Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation

Jiayi Luo, Qiyan Liu, Tengyang Wang, JunHao Liu, Jiayu Chen, Cong Wang, Hanxin Zhu, Chen Gao, Xiaobin Hu, Qingyun Sun, Zhibo Chen

2026-05-29视觉感知强化学习

长时自回归视频生成受限于KV cache随长度增长带来的显存压力和误差累积,现有压缩策略偏重当前/历史重要性,易丢弃未来关键token。Future Forcing观察到RoPE前query分布在固定提示下近似稳定,据此无训练构造未来query代理来评分、淘汰并合并缓存token。在有限缓存下,60秒生成的VBench-Long主体一致性较已有策略最高提升1.49,同时保持生成质量。

Native Audio-Visual Alignment for Generation Figure 1
2026-05-29cs.CV

Native Audio-Visual Alignment for Generation

Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

ERNIE Team, Baidu Inc.

2026-05-29视觉感知

针对联合音视频生成中双塔后验对齐难以细粒度同步、全统一三模态又混淆语义控制与底层同步的问题,NAVA将音视频先在专用空间原生对齐,再由外部上下文条件化,并用Align-then-Fuse MMDiT与Timbre-in-Context实现协同去噪和音色绑定。在Verse-Bench、Seed-TTS及用户研究中,6.3B参数模型取得更好的视频质量、音画同步和音色可控性,音频质量保持竞争力。

Boosting Zero-Shot 3D Style Transfer with 2D Pre-trained Priors Figure 1
2026-05-29cs.CV

Boosting Zero-Shot 3D Style Transfer with 2D Pre-trained Priors

Xin Dong, Yunzhi Teng, Wenfeng Deng, Yansong Tang

Shenzhen International Graduate School, Tsinghua University 2 Pengcheng Laboratory

2026-05-29三维

针对零样本三维风格迁移中每个场景训练样本少、导致风格监督不足的问题,论文提出 DS-StyleGaussian:把在大规模二维内容-风格对上预训练的 VGG/AdaIN 解码器接入 3D Gaussian Splatting,并用特征高斯与延迟着色把视角相关归一化改为视角无关过程以保持多视图一致。实验显示其在多个数据集上的视觉质量优于现有零样本三维风格迁移方法,但增益可能主要来自二维预训练数据与解码器先验。

FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection Figure 1
2026-05-29cs.CV

FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection

Leqi Zhu, Junyan Ye, Kaiqing Lin, Zhiyuan Yan, Conghui He, Weijia Li

Shanghai AI Lab, Nanjing University, Sun Yat-Sen University, Shenzhen University, Peking University, Tsinghua University

2026-05-29视觉语言视觉感知

针对现有多模态伪图检测多依赖SFT模仿伪造痕迹、缺少因果推理并易把真实图像噪声误判为伪造的问题,FakeVLM-R1在SFT上引入GRPO与批判式CoT,要求模型同时提出伪造假设和基于物理常识的真实性反证;配套FakeClue++用真实图像物理规律作“真实性锚点”。实验称其在多基准达到SOTA,并降低真实图像过拒与解释幻觉。

Towards Consistent Video Geometry Estimation Figure 1
2026-05-29cs.CV

Towards Consistent Video Geometry Estimation

Zhu Yu, Jingnan Gao, Runmin Zhang, Lingteng Qiu, Zhengyi Zhao, Rui Peng, Yichao Yan, Kejie Qiu, Siyu Zhu, Si-Yuan Cao, Hui-Liang Shen

Zhejiang University, Tongyi Lab, Alibaba Group, Shanghai Jiao Tong University, Fudan University, Internship at Tongyi Lab Equal Contribution

2026-05-29视觉感知

面向机器人感知、导航等对长视频空间精度与时间一致性的需求,论文指出现有视频几何模型常被固定的离线/在线时序访问模式和稀疏噪声标注限制。ViGeo以普通Transformer结合动态分块注意力,在同一模型中切换全序列、流式和长视频推理,并用视频深度补全教师细化LiDAR/SfM监督,同时预测深度、法线和点图。仅用公开数据训练后,在多类视频深度、法线和点图基准上达到或接近SOTA。

GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver Figure 1
2026-05-29cs.CV

GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

Tsinghua University, Pengcheng National Laboratory, Southeast University, Harbin Institute of Technology, Tsinghua University China, Pengcheng National Laboratory China, Southeast University China, Harbin Institute of Technology China

2026-05-29视觉感知

针对视频物体移除在开放场景中难以同时擦除目标及烟雾、反射、光照等伴随物理效应的问题,GenEraser引入双分文本与掩码的多条件专家,并用可学习LD-CFG自适应平衡语义与空间约束;同时将定位与背景保持解耦,缓解泛化和像素对齐冲突。实验在ROSE与VOR-Eval上分别提升约2.16dB和1.44dB,并展示更强开放世界泛化。

Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models Figure 1
2026-05-29cs.LG

Alignment-Guided Score Matching for Text-to-Image Alignment in Diffusion Models

Jaa-Yeon Lee, Yeobin Hong, Taesung Kwon, Jong Chul Ye

2026-05-29视觉感知生成模型

针对扩散文生图在计数、重复和语义一致性上的对齐问题,论文认为 SoftREPA 的对比式负样本惩罚会把软提示推向流形外。其提出 AGSM,将 Plackett-Luce 偏好建模嵌入 score matching,用正负软 token 提供有界的分数级引导且无需外部奖励。实验显示该方法在 SD1.5、SDXL、SD3 上可用,并在 GenEval 计数准确率上较相关失败案例提升超过 35%。

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark Figure 1
2026-05-29cs.CV

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark

Ruofan Hu, Menghui Zhu, Jieming Zhu, Bo Chen, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Li Tang, Tao Jin, Zhou Zhao

Zhejiang University, Huawei Technologies Co., Ltd, Zhejiang University Hangzhou Zhejiang China, Huawei Technologies Co., Ltd Shanghai Shanghai China, Huawei Technologies Co., Ltd Shenzhen Guangdong China

2026-05-29视觉语言数据集/基准

论文针对多模态文档检索中密集视觉嵌入语义过粗、OCR/结构化抽取代价高以及监督重排泛化弱的问题,提出可插拔的 DocRetriever:利用 VLM 语言头 logits 构造布局感知稀疏表示,与密集向量混合编码,并用自动合成的推理示例做少样本 ICL 重排;同时发布 MultiDocR 基准。实验显示其在多项文档检索基准上优于现有方法,稀疏混合编码相对密集基线约提升 3% NDCG@10。

VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies Figure 1
2026-05-29cs.CV

VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

Mingjian Gao, Wenqiao Zhang, Yuqian Yuan, Yang Dai, Binhe Yu, Zheqi Lv, Haoyu Zheng, Jiaqi Zhu, Zhiqi Ge, Zixuan Wan, Siliang Tang, Yueting Zhuang

2026-05-29视觉语言视觉感知

这篇论文针对VLA机器人策略中“文本思维链有延迟、密集视觉提示又易干扰动作预测”的矛盾,提出VisualThink-VLA:在冻结VLA骨干前接入稀疏的视觉证据接口,并用任务自适应路由选择位置、边界、运动、关系等通道,再通过软硬掩码和密集教师蒸馏稳定训练。作者还构建VisualEvidence-Set用于路由监督与忠实性审计。实验显示其在多项仿真和真机任务上保持或提升成功率,并将BridgeData V2单步延迟由ECoT的8.377秒降至0.367秒。

EarlyTom: Early Token Compression Completes Fast Video Understanding Figure 1
2026-05-29cs.CV

EarlyTom: Early Token Compression Completes Fast Video Understanding

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

Zhejiang University, Westlake University

2026-05-29视觉感知强化学习

EarlyTom针对Video-LLM推理中视觉token过多导致首token延迟高的问题,指出瓶颈相当一部分来自视觉编码器而非仅LLM预填充。其核心是在编码器内部进行早期帧/视觉token合并,并结合解耦的空间token选择,训练无关且额外开销小。在LLaVA-OneVision-7B上可将TTFT最高降低2.65倍、FLOPs减少61%,同时保持接近全token基线的准确率。

FRUC: Feedforward Dynamic Scene Reconstruction from Uncalibrated Collaborative Driving Views Figure 1
2026-05-29cs.CV

FRUC: Feedforward Dynamic Scene Reconstruction from Uncalibrated Collaborative Driving Views

Yihang Tao, Yu Guo, Zhengru Fang, Haonan An, Yuguang Fang

Hong Kong JC STEM Lab of Smart City, City University of Hong Kong

2026-05-29三维

FRUC针对自动驾驶中单车视角受遮挡导致动态3D重建不完整、现有协同方法依赖标定和逐场景优化的问题,提出从未标定多车视角进行前馈3DGS重建。其核心是将跨车融合视为有界残差学习,利用自车因果遮挡场引导潜空间残差去噪,在补全盲区的同时避免外部视角破坏自车几何先验。文中在V2XReal和UrbanIng-V2X上报告其渲染质量与效率均优于优化式和单车前馈基线。

Improving Adversarial Robustness of Attribution via Implicit Regularization Figure 1
2026-05-29cs.LG

Improving Adversarial Robustness of Attribution via Implicit Regularization

Amir Mehrpanah, Matteo Gamba, Hossein Azizpour

2026-05-29安全鲁棒

本文针对梯度和注意力归因易受微小扰动影响、而显式曲率正则成本高的问题,提出从 SGD 学习动力学解释归因鲁棒性:参数空间更平坦可隐式降低输入曲率,从而提升梯度归因稳定性。实验显示 ICR 在多架构和数据集上以很小开销取得接近昂贵正则方法的鲁棒性;但软max注意力因熵约束难以继承该增益,改用核化注意力后可恢复部分鲁棒提升。

Genetically Aligned Patient Representations Improve Hematological Diagnosis Figure 1
2026-05-29cs.CV

Genetically Aligned Patient Representations Improve Hematological Diagnosis

Muhammed Furkan Dasdelen, Fatih Ozlugedik, Ilaria Looser, Rao Muhammad Umer, Christian Pohlkamp, Carsten Marr

2026-05-29视觉感知

血液肿瘤诊断依赖形态学与遗传检测联合判断,单看血涂片图像难以刻画分子异质性。本文提出 GenBloom,将白细胞单细胞图像先经自监督患者级聚合预训练,再用核型异常和体细胞突变进行监督对比对齐,学习遗传感知的患者表征。结果显示其在 AML 分型、跨域诊断和图像—基因检索上优于通用病理基础模型,但增益仍可能部分来自领域数据与任务匹配。

EVL-ECG: Efficient ECG Interpretation With Multi-Aspect Heterogeneous Knowledge Distillation Figure 1
2026-05-29cs.CV

EVL-ECG: Efficient ECG Interpretation With Multi-Aspect Heterogeneous Knowledge Distillation

Dang Hong Nguyen, Nhi Ngoc-Yen Nguyen, Huy-Hieu Pham

2026-05-29视觉感知

针对大型视觉语言模型在心电图解读中计算开销高、难以落地边缘临床场景的问题,EVL-ECG提出面向异构师生架构的知识蒸馏:用多头交叉注意力缓解 tokenizer/序列不匹配,用最优传输保持12导联视觉拓扑,并以几何关系匹配迁移诊断逻辑。多基准结果显示其相对现有蒸馏方法最高提升2.4% AUC和1.1%准确率,形成约2B参数的高效ECG模型。

SwInception -- Local Attention Meets Convolutions Figure 1
2026-05-29cs.CV

SwInception -- Local Attention Meets Convolutions

David Hagerman, Roman Naeem, Jakob Lindqvist, Carl Lindström, Fredrik Kahl, Lennart Svensson

2026-05-29视觉感知

针对Swin在小规模医学体数据分割中局部归纳偏置不足、易过拟合且窗口受显存限制的问题,SwInception把多分支Inception卷积嵌入Transformer前馈层,在块内引入多尺度局部特征,并改造解码器以更少参数保留细节。论文在11个医学数据集及MSD、BTCV基准上报告优于既有Swin系骨干的分割性能。

Mesh-Aware Epipolar Matching for Multi-View Multi-Person 3D Pose Estimation in Basketball Figure 1
2026-05-29cs.CV

Mesh-Aware Epipolar Matching for Multi-View Multi-Person 3D Pose Estimation in Basketball

Li Yin, Qin Haobin, Tomohiro Suzuki, Calvin Yeung, Mariko Isogawa, Keisuke Fujii

2026-05-29三维

篮球等团队运动中多人遮挡、队服相似且多视角标注稀缺,使跨视角身份关联成为3D姿态估计瓶颈。MAEM不依赖目标域训练,而是将单目人体网格恢复得到的密集网格顶点投影为极线验证线索,并结合框中心粗筛、网格极线细筛、匈牙利匹配与并查集聚类来替代脆弱的关键点/外观匹配。实验在SportCenter EPFL和Human-M3 Basketball上达到59.8/40.7 mm与74.0/51.8 mm的MPJPE/PA-MPJPE,优于训练自由基线。

CityGen: Structure-Guided City-Style Synthesis for Cross-City Autonomous Driving Figure 1
2026-05-29cs.CV

CityGen: Structure-Guided City-Style Synthesis for Cross-City Autonomous Driving

Zezhong Qian, Zhao Yang, Lu Tan, Zhihao Yan, Weiyi Hong, Haizhuang Liu, Yawei Jueluo

2026-05-29视觉感知

该文针对自动驾驶模型在新城市部署时因道路拓扑、外观和交通模式差异导致性能下降的问题,构建了地理隔离的 CityTransfer-Bench,并提出 CityGen:利用 HD 地图结构约束和目标城市视觉提示的扩散生成,零标签合成目标城市风格数据。实验显示其在感知、分割和规划上均提升跨城鲁棒性,但具体增益中生成数据规模与结构控制的相对贡献仍需进一步拆解。

Treatment-Conditioned Diffusion for Forecasting Neurodegenerative Disease Progression Figure 1
2026-05-29cs.LG

Treatment-Conditioned Diffusion for Forecasting Neurodegenerative Disease Progression

Danylo Boiko, Viktoriia Mishkurova

Innoloft Inc., Bogomolets National Medical University

2026-05-29生成模型

针对帕金森等神经退行性疾病预测常停留在量表分数、难保留影像细节的问题,论文将进展建模为治疗条件扩散生成:以筛查期 DaTscan 和一年 LEDD 用药序列为条件,结合 Transformer 药物编码与多权重 ROI 约束生成未来脑影像。PPMI 实验显示,相比无进展基线,14 个切片上 MSE 降低 14.0%、MAE 降低 7.2%、SSIM 提升 4.9%。

Reducing Experimental Testing in Space Propulsion Film Cooling Analyses by Pixelwise Generative Image Interpolation Figure 1
2026-05-29cs.LG

Reducing Experimental Testing in Space Propulsion Film Cooling Analyses by Pixelwise Generative Image Interpolation

Adam T. Müller, Philipp J. Teuffel, Konstantin Manassis, Nicolaj C. Stache

⋆ Heilbronn University of Applied Sciences, Center for Machine Learning, ‡ German Aerospace Center (DLR), Institute of Space Propulsion

2026-05-29视觉感知生成模型

针对航天推进膜冷却实验成本高、参数空间难以密集采样的问题,论文将冷却膜图像生成表述为物理参数与像素坐标联合空间上的回归,提出带位置编码的轻量前馈网络 PixCOIN,并加入专家知识引导的局部修正。其在合成与真实冷流数据上取得 RMSE<8%、SSIM>93%,且在减少约30%测量时仍保持精度。

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning Figure 1
2026-05-29cs.CV

Train the Agent, Not the Expert: Learning to Harness Heterogeneous Experts for Multi-Turn Visual Reasoning

Yaowu Fan, Tao Han, Dazhao Du, Andy J. Ma, Jia Wan

Sun Yat-sen University, Harbin Institute of Technology

2026-05-29视觉感知

针对专用视觉模型各自孤立、MLLM又难以精确执行分割/检测/计数的问题,本文提出VisHarness:不再训练单一专家,而训练一个可多轮调用异构视觉专家的高层代理,并用动态视觉记忆归档降低交互中的视觉token开销以支持在线强化学习。实验覆盖推理分割、广义指代表达分割、密集小目标检测与指代计数,结果显示其优于通用模型,并达到或超过部分任务专用模型。

DVSM: Decoder-only View Synthesis Model Done Right Figure 1
2026-05-29cs.CV

DVSM: Decoder-only View Synthesis Model Done Right

Cheng Sun, Jaesung Choe, Min-Hung Chen, Ryo Hachiuma, Yu-Chiang Frank Wang

2026-05-29视觉感知

本文针对LVSM中重建与渲染网络解耦、decoder-only按目标视角重复建场景而低效的问题,重新审视新视角合成架构。核心洞察是用严格共享权重的decoder-only Transformer,将场景隐式存为KV-cache,使重建与渲染特征在同视角更一致,并结合基础模型先验与分阶段patch大小。实验显示其在多基准达到SOTA,参数少于encoder-decoder,部分密集视角设置下甚至超过逐场景优化的3DGS。

Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering Figure 1
2026-05-29cs.CV

Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering

Soumyadeep Jana, Pulkit Mittal, Sanasam Ranbir Singh

Indian Institute of Technology Guwahati, India

2026-05-29视觉语言视觉感知

论文针对LVLM解码中视觉注意力逐步减弱、导致物体幻觉的问题,提出无需训练的BRACS:用预softmax图像注意力作为显式 grounding 屏障,只在低于阈值时对隐藏状态做闭式最小校正,并自适应调节强度。LLaVA-1.5-7B和Qwen-VL-Chat实验显示,CHAIRs下降9.4点、POPE F1提升2.7点,同时基本保持通用多模态能力与较高吞吐。

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding Figure 1
2026-05-29cs.CV

DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding

Luzhou Ge, Xiangyu Zhu, Jinyan Liu, Xuesong Li

2026-05-29视觉语言三维

面向长期机器人任务中动态环境、跨视角实例关联脆弱和缺少显式空间推理的问题,DGSG-Mind将概率体素网格与3D Gaussian实例地图结合,支持开放词汇语义融合,并用几何-语义一致性的局部更新处理物体变化;其上构建层次场景图和3D Gaussian Mind进行多模态目标定位。实验显示,在自重建地图上取得最佳零样本3D视觉定位表现,并兼顾开放词汇分割、重建和真实机器人动态更新。

Ciphera: A Decentralised Biometric Identity Framework Figure 1
2026-05-29cs.CR

Ciphera: A Decentralised Biometric Identity Framework

Ankit Kanaiyalal Prajapati, Shahzad Memon, Mohammed Mahir Rahman, Ameer Al-Nemrat

Department of Computer Science and Digital Technologies, University of East London, template hashing, cancellable biometrics, and on-device, workflow. Microsoft ION supports scalable DID anchoring

2026-05-29视觉感知

针对集中式生物身份系统存在单点失效、验证不透明和生物特征泄露不可撤销的问题,Ciphera将本地人脸验证、DID/VC、零知识证明、IPFS元数据与区块链吊销及多节点验证整合到统一框架。实验显示注册和认证较稳定,功能成功率81%,并发多节点下p95验证约820ms;但吊销传播延迟、审计日志不一致仍存在,活体检测不足使其仍易受deepfake和重放攻击。

Masked Diffusion Vision-Language Models for Temporal Action Localization Figure 1
2026-05-29cs.CV

Masked Diffusion Vision-Language Models for Temporal Action Localization

Fengshun Wang, Zhengbo Zhang, Zhigang Tu

Wuhan University, Singapore University of Technology and Design

2026-05-29视觉语言视觉感知生成模型

这篇论文针对生成式视觉语言模型做时间动作定位时,自回归解码一旦先生成时间戳就难以后续修正的问题,将任务改为掩码扩散序列生成,使语义与边界时间 token 在双向去噪中共同迭代更新。其关键在于边界感知的 Planned Training Objective 延后时间 token 恢复,并用逐步 IoU 奖励弥补交叉熵与 tIoU 目标不一致。实验在 ActivityNet-RTL、ActivityNet-1.3 和 THUMOS-14 上优于自回归 VLM 基线,严格 tIoU 阈值下收益更明显。

Building and Road Recognition in Dense Urban Informal Settlements: A Dataset and Benchmark Figure 1
2026-05-29cs.CV

Building and Road Recognition in Dense Urban Informal Settlements: A Dataset and Benchmark

Hongyu Long, Jiaxuan Liu, Rui Cao

2026-05-29视觉感知数据集/基准

针对城中村建筑密集、道路狭窄且主流地图与既有遥感数据缺少精细标注的问题,论文构建 DenseUIS:覆盖深圳、广州 126 个城中村的高分辨率建筑与道路提取数据集,并作为专门面向非正式聚落内部结构的基准。作者评测多类深度模型,结果显示现有方法在这类高密度、不规则形态下表现受限,提示后续需要更针对性的建模而非直接沿用常规城市提取方案。

Parameter-Efficient Subspace Decoupling ViT for Mitigating Multi-Task Negative Transfer in Histological Scoring Figure 1
2026-05-29cs.CV

Parameter-Efficient Subspace Decoupling ViT for Mitigating Multi-Task Negative Transfer in Histological Scoring

Youhan Huang, Jiajun Li, Yilin Fang, Shuai Wang, Chuheng Li

2026-05-29视觉感知

针对NAFLD组织学NAS评分中多任务标签相关性强、共享ViT易产生负迁移且全量微调成本高的问题,论文在冻结Swin-T上为脂肪变、气球样变和炎症加入任务专属Adapter/LoRA,并用正交子空间约束与不确定性加权解耦任务表示。实验称在内部鼠NAFLD数据和公开基准上,相比单任务或全量微调获得更稳定泛化,并显著减少可训练参数;具体增益与数据集规模细节仍需看完整结果验证。

Fairness Beyond Demographics: Optimizing Performance Across Appearance-Based Hidden Cohorts in Medical Imaging Figure 1
2026-05-29cs.CV

Fairness Beyond Demographics: Optimizing Performance Across Appearance-Based Hidden Cohorts in Medical Imaging

Milad Masroor, Cuong Nguyen, Kevin Wells, Gustavo Carneiro

2026-05-29视觉感知

医学影像公平性方法常依赖性别、年龄等显式人口属性,但交叉分组会造成样本稀疏,也可能漏掉真正导致误差的外观隐含队列。本文提出无人口标签的 LHCF:先用预训练图像嵌入经 GMM/BIC 聚类发现外观队列,再把队列作为敏感属性做公平优化,并构建 HIDFairBench 压测多属性公平性。实验显示其在单属性和交叉人口分组上同时改善 AUC 与公平指标,优于传统人口属性训练。

Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language Figure 1
2026-05-29cs.CV

Not All Inputs Are Valid: Towards Open-Set Video Moment Retrieval Using Language

Xiang Fang, Wanlong Fang, Daizong Liu, Xiaoye Qu, Jianfeng Dong, Pan Zhou, Renfu Li, Zichuan Xu, Lixing Chen, Panpan Zheng, Yu Cheng

Huazhong University of Science and Technology, Peking University, Zhejiang Gongshang University, Dalian University of Technology, Shanghai Jiao Tong University, Xinjiang University, The Chinese University of Hong Kong, Huazhong University of Science and Technology Wuhan China, Peking University Beijing China, Zhejiang Gongshang University Guangzhou China, Dalian University of Technology Dalian China, Shanghai Jiao Tong University Shanghai China

2026-05-29视觉感知

这篇论文针对现有视频片段检索默认“所有文本查询都与视频相关”的闭集假设,指出在安防等场景中无关查询会被强行匹配并造成风险。作者提出开放集视频片段检索 OS-VMR,并设计 OpenVMR:用归一化流建模 ID 查询分布,通过不确定性与似然确定 ID/OOD 边界,再结合粗细粒度跨模态匹配和正-未标注学习完成定位。三 个 VMR 数据集实验显示其能在拒绝 OOD 查询的同时保持有效检索。

Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing Figure 1
2026-05-29cs.CR

Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing

Leyi Qi, Yiming Li, Siyuan Liang, Zhengzhong Tu, Dacheng Tao

2026-05-29视觉感知生成模型

针对文生图扩散模型易被盗用而现有后门水印依赖“忠实”查询、在随机或对抗扰动下易失效的问题,Cert-LAS将扩散分类器作为隐式水印载体,并按UNet层微调敏感度分配自适应平滑噪声,再用WR/RP统计和配对t检验做所有权验证。论文给出有界参数扰动下的可认证鲁棒性条件,实验显示其在保持生成质量与隐蔽性的同时,对恶意移除和自适应攻击更稳定。

AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security Figure 1
2026-05-29cs.AI

AgentDoG 1.5: A Lightweight and Scalable Alignment Framework for AI Agent Safety and Security

Dongrui Liu, Yu Li, Zhonghao Yang, Peng Wang, Guanxu Chen, Yuejin Xie, Qinghua Mao, Wanying Qu, Yanxu Zhu, Tianyi Zhou, Leitao Yuan, Zhijie Zheng, Qihao Lin, Yimin Wang, Haoyu Luo, Shuai Shao, Chen Qian, Qingyu Liu, Ling Tang, Ruiyang Qin, Qihan Ren, Junxiao Yang, Kun Wang, Zhiheng Xi, Linfeng Zhang, Ranjie Duan, Bo Zhang, Wenjie Wang, Wen Shen, Qiaosheng Zhang, Yan Teng, Chaochao Lu, Rui Mei, Man Li, Jialing Tao, Xi Lin, Tianhang Zheng, Yong Liu, Quanshi Zhang, Lei Zhu, Xingjun Ma, Junhua Liu, Hui Xue, Xiaoxiang Zuo, Xiangnan He, Chao Shen, Xianglong Liu, Minlie Huang, Jing Shao, Xia Hu

Shanghai Artificial Intelligence Laboratory

2026-05-29安全鲁棒

面向 OpenClaw/Codex 等开放式智能体带来的跨环境执行风险,本文提出 AgentDoG 1.5 安全对齐框架:扩展风险分类与 ATBench,借助分类引导数据引擎和影响函数筛选,用约 1k 样本训练 0.8B–8B 轻量守卫模型,并构建有限状态仿真的 SFT/RL 环境及在线护栏。实验显示其在多类安全评测上达到或超过现有模型,且训练环境开销较 Docker 级方案降低约两个数量级。

Low-Magnification SEM May Suffice: Interpretable Deep Learning for Multi-Scale Fracture-Cause Classification in Zirconia-Toughened Alumina Figure 1
2026-05-29cs.CV

Low-Magnification SEM May Suffice: Interpretable Deep Learning for Multi-Scale Fracture-Cause Classification in Zirconia-Toughened Alumina

Julian Schmid, Pawel Astankow, Tom Vater, Julius Beck, Robert Cichon, Danny Krautz

2026-05-29视觉感知

面向陶瓷髋/膝关节植入物质检中耗时且依赖专家的断口溯因问题,论文用多倍率 SEM 历史图像训练可解释 ViT,将缺陷归为生坯、硬加工和材料三类。关键洞察是 50×低倍率下的断口镜面与羽纹等宏观形貌已含足够诊断信号,性能接近高倍率。模型在五折验证中达 0.907 准确率、0.888 macro-F1,Grad-CAM 关注区域与断口学线索一致,但仍受类别不均衡和历史标签噪声影响。

Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language Figure 1
2026-05-29cs.CV

Fewer Steps, Better Performance: Efficient Cross-Modal Clip Trimming for Video Moment Retrieval Using Language

Xiang Fang, Daizong Liu, Wanlong Fang, Pan Zhou, Zichuan Xu, Wenzheng Xu, Junyang Chen, Renfu Li

2026-05-29视觉感知

这篇论文针对语言引导视频片段检索在长视频中需处理大量无关固定 clips、计算开销高且易造成边界偏差的问题,提出 SpotVMR:先用低成本语义索引特征预览视频,再由查询条件化的跨模态 clip 搜索器选择少量相关区域,并用蒸馏缓解选择器与检索模型联合训练困难。该模块可插入现有 VMR 方法,在三个数据集上显示能减少处理步骤并保持或提升检索性能。

Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning Figure 1
2026-05-29cs.CV

Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning

Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li

2026-05-29视觉感知

针对无源跨域少样本中 CLIP 在大域移、少标注下易因“所有 patch 都对齐文本”而过拟合的问题,论文提出尾部对齐应被打破的洞察:高相似 head token 继续拉近文本,低相似 tail token 反向推离。其 ATHA 在 ViT 各层动态选择 token,并用可学习强度加减文本嵌入;四个 CDFSL 基准上报告达到 SOTA。

Energy-Aware NECO for Single-Pass Pixel-wise Out-of-Distribution Detection in Semantic Segmentation Figure 1
2026-05-29cs.CV

Energy-Aware NECO for Single-Pass Pixel-wise Out-of-Distribution Detection in Semantic Segmentation

Boyuan Zhang, Huanshan Huang, Yifei Cao

2026-05-29视觉感知

面向移动机器人语义分割中的像素级 OOD 检测,论文针对 MC Dropout/集成等不确定性方法推理代价高、纯 NECO 几何分数易漏检嵌入主 ID 子空间的异常,提出单次前向的 Energy-Aware NECO,将解码器特征的中心化 NECO 几何比与 logit Energy 标准化后凸融合。在 miniMUAD 上 AUROC 达 0.8539,优于 NECO-only、Energy-only 和集成熵基线,但极高召回尾部集成方法仍更稳。

GeoMag: Geometric-Aware Video Motion Magnification via State Space Model Figure 1
2026-05-29cs.CV

GeoMag: Geometric-Aware Video Motion Magnification via State Space Model

Kecheng Han, Yuchen Zhang, Bingqing Liu, Boqiang Guo, Wenbin Zheng, Shiyuan Pei

2026-05-29视觉感知

这篇论文针对视频运动放大在旋转、复合运动和传感器噪声下易出现结构不一致、CNN缺全局上下文而Transformer代价高的问题,提出基于状态空间模型的GeoMag,以线性复杂度建模全局几何一致性;同时构建含复杂几何变换与真实退化的Geo-200K合成数据。实验显示其在合成和真实基准上提升视觉保真度、效率并减少伪影,但部分增益可能主要来自更强数据合成。

S2MDF: A Plug-And-Play Layer for Intersection-Free Multi-Object Signed Distance Fields Figure 1
2026-05-29cs.CV

S2MDF: A Plug-And-Play Layer for Intersection-Free Multi-Object Signed Distance Fields

Deniz Sayin Mercadier, Federico Stella, Aurel Bizeau, Nicolas Talabot, Pascal Fua

Nicolas Talabot, CVLab, Ecole Polytechnique Fédérale de Lausanne (EPFL)

2026-05-29视觉感知

多物体组合式 SDF 常会生成相互穿透的几何,软碰撞损失既不能保证消除交叠又需调权。S2MDF 将向量值 SDF 投影到满足硬约束的多物体距离场,并利用与线性插值兼容的约束形式,可作为训练层或后处理接入现有方法。实验显示其将交叠降至数值精度,同时基本保持重建质量。

SLAD : Shared LoRA Adapters for Task Specific Distillation Figure 1
2026-05-29cs.CV

SLAD : Shared LoRA Adapters for Task Specific Distillation

Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau

2026-05-29视觉感知

面向嵌入式等受限场景,论文关注小型视觉基础模型的任务特定蒸馏:作者指出全量微调教师虽提升教师精度,却会拉大教师与学生的特征错位,反而削弱蒸馏。SLAD用LoRA保持表示对齐,并在教师、学生编码器间共享部分适配器联合训练。分类和语义分割实验显示其提升学生也提升教师,平均较既有分类基线高2.16%准确率,训练约比全量微调快2倍。

Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets Figure 1
2026-05-29cs.CV

Efficient, Validation-Free Intrinsic Quality Estimation for Large-Scale Face Recognition Datasets

Zhichao Chen, Yongle Zhao, Kaicheng Yang, Meng Yang, Yin Xie, Ziyong Feng

2026-05-29视觉感知数据集/基准

面向大规模人脸识别数据集,论文关注在无干净验证集、无需完整训练时如何预判数据“可训练性”。核心做法是用代理嵌入结合近邻标签一致性与有效秩,区分有益的数据多样性扩展和噪声导致的复杂度膨胀。实验显示,WebFace 清洁扩展时 IQ 随验证准确率从90.36%升至96.26%同步提高,而注入噪声时能比单看有效秩更好保持下游性能排序。

Subcortical Shape Variations and Their Associations with Cognition Across the 8th Decade of Life. A Study in the Lothian Birth Cohort 1936 Figure 1
2026-05-29q-bio.NC

Subcortical Shape Variations and Their Associations with Cognition Across the 8th Decade of Life. A Study in the Lothian Birth Cohort 1936

Maria del C. Valdes-Hernandez, Wonjung Park, Joanna Moodie, Susana Muñoz Maniega, Janie Corley, Fraser N. Sneden, Mark E. Bastin, Joanna M. Wardlaw, Simon R. Cox, Jinah Park

2026-05-29视觉感知

针对单纯体积难以刻画功能相关脑老化的问题,本文利用 LBC1936 纵向 MRI 与认知数据,按顶点建模第八个十年中皮层下结构形态轨迹及其与一般认知变化的关系。结果显示形变高度异质:海马和腹侧间脑左右差异明显,丘脑与苍白球更接近对称收缩;认知下降主要关联不同时点的局部内外向位移。

Unsupervised Semantic Segmentation Facilitates Model Understanding Figure 1
2026-05-29cs.CV

Unsupervised Semantic Segmentation Facilitates Model Understanding

Xiaoyan Yu, Lisa Mais, Jannik Franzen, Peter Hirsch, Nick Lechtenbörger, Andreas Mardt, Dagmar Kainmüller

2026-05-29视觉感知

针对自监督 ViT 研究中常把对比学习结论泛化到 MIM、且位置效应缺少直观诊断的问题,论文将无监督语义分割的 k-means 可视化改作模型理解工具,跨层比较 token、key、query、value。结果显示中间层常最具语义结构,MIM 的 key/query 存在强位置效应并可解释局部性偏置,且 DINOv3-Large token 的边界伪影可能关联其密集预测退化。

A Geometric View of SRC: Learning Representations for Stable Residual Inference Figure 1
2026-05-29cs.LG

A Geometric View of SRC: Learning Representations for Stable Residual Inference

Vangelis P. Oikonomou

2026-05-29视觉感知

本文针对 SRC 等重构式分类在表示空间几何不佳时残差排序不稳定的问题,主张训练与推理严格分离:不把 SRC 纳入训练,而从类子空间张成、主角度和残差间隔分析稳定性。核心洞察是重叠、包含或近重叠会导致间隔坍塌;在覆盖与分离假设下给出间隔下界,并设计类内自表达、跨类抑制和子空间排斥损失。实验在图像、文本和 EEG 上用固定 SRC/OMP 评估几何诊断,但实际增益与求解器近似的关系仍属条件性解释。

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation Figure 1
2026-05-29cs.CV

SAFE-Pruner: Semantic Attention-Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation

Shilin Ma, Chubin Zhang, Changyuan Wang, Yuji Wang, Yue Wu, Zixuan Wang, Jingqi Tian, Zheng Zhu, Yansong Tang

2026-05-29机器人视觉语言视觉感知安全鲁棒

面向VLA机器人策略的实时闭环控制,论文针对现有视觉token剪枝只看浅层注意力、易误删深层推理所需信息的问题,提出SAFE-Pruner。其核心洞察是连续操作中存在“语义注意力一致性”,据此用历史帧深层注意力预测当前帧未来token重要性,并通过自适应子任务划分处理注意力突变。仿真与真实实验显示最高1.89倍加速,成功率下降低于1.7%,较已有方法最多提升1.9%。

Geometry-Guided Modeling of Foundation Features Enables Generalizable Object Shape Deformation Learning Figure 1
2026-05-29cs.CV

Geometry-Guided Modeling of Foundation Features Enables Generalizable Object Shape Deformation Learning

Yiyao Ma, Kai Chen, Zhongxiang Zhou, Zhuheng Song, Dongsheng Xie, Zelong Tan, Rong Xiong, Qi Dou

2026-05-29视觉感知

单目3D重建在遮挡、视角变化和未见类别下易产生不可靠形状,限制机器人操作。本文将类别模板作为可变形几何起点,引入2D基础模型特征,并用模板拓扑进行几何引导传播与点级对齐;同时通过多视角模板特征和位姿感知注意力缓解视角错配。实验显示其在大形变、多视角和新类别上优于现有方法,并可支持真实灵巧操作任务。

OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning Figure 1
2026-05-29cs.CV

OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning

Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

2026-05-29视觉语言

这篇论文针对 VLM 推理中视觉 token 过长导致 prefill 计算和 KV 缓存开销高的问题,指出固定 top-K 剪枝易受 attention sink 和样本差异影响。OccamToken 的核心是把测试时 register token 作为相对证据锚点,用其注意力分数动态设阈,分两阶段做图像冗余剪枝和查询相关性剪枝且无需训练。实验覆盖 LLaVA-NeXT、LLaVA-v1.5 和 Qwen3-VL,在匹配预算下优于多种剪枝基线;其中 LLaVA-NeXT 可将 2880 个视觉 token 压到约 40 个,仍保留超过 93% 原始精度。

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation Figure 1
2026-05-29cs.CV

SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation

Yuan Li, Congyi Zhang, Xifeng Gao, Xiaohu Guo

2026-05-29三维

本文针对自回归 MLLM 做高分辨率 3D 生成时,现有 tokenization 要么无序难建模、要么体素序列冗长的问题,提出先预测几何显著性,再用显著性引导的 3D CVT 构造自适应且确定排序的 supervoxel,并通过 SuperVoxelVAE 与微调 MLLM 生成形状。Trellis-500K 实验显示序列长度降至均匀体素的 12.8%,质量达到 SOTA,平均加速约 10 倍。

MARTIAN: A Rendering Framework for Aerial Mars Imagery from HiRISE Orbital Data Figure 1
2026-05-29cs.CV

MARTIAN: A Rendering Framework for Aerial Mars Imagery from HiRISE Orbital Data

Dario Pisanti, Georgios Georgakis

2026-05-29视觉感知

针对火星无人机/着陆器视觉导航缺少大规模带位姿标注航拍数据的问题,MARTIAN用Blender导入真实HiRISE地形模型与正射影像,在可控太阳光照、相机位姿和高度下渲染火星航拍图并输出精确位姿标注。该框架已用于Ingenuity及未来旋翼机地图定位研究,合成数据训练的深度匹配器在真实火星图像上得到验证;但纹理自带原始阴影,跨地点泛化仍需进一步说明。

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning Figure 1
2026-05-29cs.CV

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

Xiaohongshu Inc., Tsinghua Shenzhen International Graduate School, Tsinghua University

2026-05-29视觉感知强化学习

针对跨视频推理中证据稀疏、时序错位且单次压缩上下文易丢失关键线索的问题,AgentCVR将任务改写为主动取证:由Master Agent多轮调度视觉与音频Agent,并用LLM生成脚本和轻量文本模拟器进行强化学习以降低训练成本。在CrossVid上,其优于单次推理基线,并在复杂对齐与定位任务上接近闭源SOTA。

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces? Figure 1
2026-05-29cs.CV

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

2026-05-29视觉语言

本文关注 VLM 在网页界面中识别细粒度视觉差异的薄弱能力,这对 GUI 代理和设计工具的状态验证很关键。DiffSpot 的核心做法是从代码空间构造差异:对自包含 HTML 的单个元素修改单一 CSS 属性,并用渲染后的边界框门控保证差异局限于目标元素。基准含 4400 对样本;13 个前沿 VLM 零样本测试中,最佳模型真实变化召回仅 40.7%,Hard 档均低于 23%,且失败主要随 CSS 属性而非网页域变化。

Learning Context-Conditioned Predicate Semantics via Prototype Feedback Figure 1
2026-05-29cs.CV

Learning Context-Conditioned Predicate Semantics via Prototype Feedback

NamGyu Jung, Chang Choi

2026-05-29视觉感知

本文针对场景图生成中谓词多义且随图像上下文变化的问题,指出固定或多原型表示难以区分如“standing on”和“riding”等关系。AlignG通过原型反馈先由图内关系候选调整谓词语义,再反向校准关系特征,并用全局语义中心约束漂移。在VG-150和GQA-200上取得稳定提升,SGDet下F@100分别提高1.4和2.7。

CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning Figure 1
2026-05-29cs.CV

CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning

Xiang Fang, Wanlong Fang, Changshuo Wang

School of Software Engineering, Huazhong University of Science and Technology, Nanyang Technological University, Singapore, University College London

2026-05-29视觉感知

针对多模态 RAG 在知识密集问答中常见的噪声检索、跨模态对齐不足和生成不连贯问题,CogniVerse 引入认知反思来判断是否需要检索并过滤内容,用黎曼/双曲几何与谱图方法对齐文本、图像和知识图谱,再以最优传输约束层次化生成。文中称其在多模态问答基准上提升准确率与连贯性并降低检索延迟,但具体增益来源仍需结合实验细节判断。

How to Relieve Distribution Shifts in Semantic Segmentation for Off-Road Environments Figure 1
2026-05-29cs.RO

How to Relieve Distribution Shifts in Semantic Segmentation for Off-Road Environments

Ji-Hoon Hwang, Daeyoung Kim, Hyung-Suk Yoon, Dong-Wook Kim, Seung-Woo Seo

All authors are with Department of Electrical and Communication Engineering, Seoul National University, Korea

2026-05-29视觉感知

越野导航中的语义分割易受场景差异和颠簸导致的传感器噪声、模糊影响,训练域与部署域出现外部/内部分布偏移。论文提出 ST-Seg,不再只在固定源域内做泛化,而是用 ImageNet 学到的真实风格分布进行风格扩展,并以深度纹理流形约束局部纹理。实验显示其在多种偏移目标域上较已有方法有明显提升,但具体增益幅度需看正文表格。

Non-Forgetting Knowledge Allocation with Bi-level Competition for Class-Incremental Learning Figure 1
2026-05-29cs.CV

Non-Forgetting Knowledge Allocation with Bi-level Competition for Class-Incremental Learning

Xiang Tan, Run He, Yawen Cui, Mengchen Zhao, Yan Wu, Tianyi Chen, Huiping Zhuang, Xiaonan Luo, Guanbin Li

2026-05-29视觉感知

针对预训练视觉模型在类增量学习中多适配器被平均使用、既稀释相关任务知识又易让分配器遗忘的问题,论文提出 NoFA-BC:用递归最小二乘构建等价于联合训练的非遗忘分配器,并以任务内 WTA、任务间 LOF 动态抑制无关适配器,再加入稳定性增强。实验在多数据集上优于现有方法,ImageNet-R 长序列和 ImageNet-A 复杂场景分别较次优提升 4.09% 和 7.87%。

Brain-IT-VQA: From Brain Signals to Answers Figure 1
2026-05-29cs.CV

Brain-IT-VQA: From Brain Signals to Answers

Roman Beliy, Matias Cosarinsky, Oliver Heinimann, Navve Wasserman, Michal Irani

Weizmann Institute of Science

2026-05-29视觉感知

针对从观看图像时的 fMRI 信号中回答视觉问题仍性能有限、且难以解释脑区表征的问题,本文提出 Brain-IT-VQA:将 Brain Interaction Transformer 解码出的语言条件 token 接入冻结语言模型,绕过显式图像重建直接做问答;同时构建含 20 类问题、每图约 20 个问答的 NSD-VQA 基准。结果显示其在 fMRI captioning/VQA 上超过既有方法,并可分析不同视觉语义信息与脑区贡献。

BitC-3DGS: High-Capacity 3D Gaussian Splatting Watermarking via Bit Compression Figure 1
2026-05-29cs.CV

BitC-3DGS: High-Capacity 3D Gaussian Splatting Watermarking via Bit Compression

Yuquan Bi, Baosheng Yu, Yingke Lei, Jianwei Yang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

2026-05-29三维

面向3DGS资产在大规模分发中的版权、溯源与完整性验证,论文针对CLIP语义水印受77-token/77-bit容量限制的问题,提出BitC-3DGS:将多比特压缩映射为单个语义token,并用块级/比特级双分支解码和难消息采样提升高容量恢复。Blender与LLFF实验显示,其可支持超过77位水印,128-bit恢复精度接近以往64-bit设置,同时保持较好渲染质量。

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation Figure 1
2026-05-29cs.CV

ReactBench: A Cause-Driven Benchmark for Multimodal Hallucination via Systematic Evaluation

Shizhe Zhou, Bohan Jia, Kai Wu, Yan Shen, Tongyun Li, Yuyang Wu, Shaohui Lin

East China Normal University

2026-05-29视觉语言数据集/基准

ReactBench针对现有多模态幻觉评测只看结果、场景简单且缺少成因诊断的问题,构建以成因为中心的基准:用真实图像编辑和考试式问题覆盖关系抹除、反事实属性、变化追踪与密集计数,并结合CoT追踪细粒度子原因。实验显示当前MLLM在共现偏置、语言先验、跨图比较和细粒度感知触发下仍明显脆弱,说明该基准更适合定位鲁棒性短板。

Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning Figure 1
2026-05-29cs.CV

Mitigating State Aliasing in Vision-Language-Action Models via Inverse Dynamics Learning

Kyujin Lee, Injae Kim, Jihwan Park, Yejun Ju, Minseok Joo, Hyunwoo J. Kim

Korea University

2026-05-29视觉语言视觉感知

论文针对VLA模型继承VLM表征后对末端位姿、物体关系等细微状态不敏感,易把需不同动作的相似画面混淆的问题,引入逆动力学辅助任务,直接让视觉编码器从当前与未来观测预测中间动作,并用伪时间反转扩充动作方向。该方法训练后移除辅助头,不改推理流程,在CALVIN与SimplerEnv上提升多种VLA基线,并通过冻结探测和状态-特征对齐分析显示其表征更能区分机器人状态。

Optimizing Latent Representations for Robust Building Damage Assessment Onboard Earth Observation Satellites Figure 1
2026-05-29cs.CV

Optimizing Latent Representations for Robust Building Damage Assessment Onboard Earth Observation Satellites

Thomas Goudemant, Benjamin Francesconi

resolution optical imagery. Available pre-disaster images

2026-05-29安全鲁棒

面向灾后建筑损伤评估中全图下传、地面处理带来的高时延,本文提出地面/星上解耦的双时相检测框架:灾前影像先在地面编码为紧凑潜表示并上注卫星,灾后影像在轨与其比较,输出建筑框和损伤等级。作者系统比较早期融合、孪生分支、交叉注意力、潜空间压缩与鲁棒增强;在 xBD 上显示强压缩下性能下降较小,并能在预/后影像错配时保持较稳健。

DefSynUS: Real-time Patient-specific Intrahepatic Vessel Identification via Deformation-Aware CT-US Domain Adaptation Figure 1
2026-05-29cs.CV

DefSynUS: Real-time Patient-specific Intrahepatic Vessel Identification via Deformation-Aware CT-US Domain Adaptation

Karl-Philippe Beaudet (MIMESIS, UNISTRA), Yordanka Velikova (TUM), Sidaty El Hadramy (MIMESIS, Unibas), Nassir Navab (TUM), Philippe Cattin (Unibas), Juan Verde (MIMESIS, UNISTRA, IHU Strasbourg), Stéphane Cotin (MIMESIS

University of Strasbourg, Strasbourg, France., Technical University of Munich, Germany., University of Basel, Switzerland., Institute of Image-Guided Surgery, France., because vascular topology varies across patients and per-branch labeled ultrasound

2026-05-29视觉感知

面向腹腔镜肝切除中探头受限、血管拓扑复杂和软组织形变导致的肝内血管分支难识别问题,DefSynUS用术前CT血管标注经物理超声渲染生成患者特异训练数据,并在渲染环节加入形变感知增强与CT-US域适配,避免术前超声采集。腹部体模和单病例临床可行性实验显示可实时识别MPV/LPV/RPV等分支并对新姿态保持性能,但多患者泛化和临床有效性仍未充分验证。

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments Figure 1
2026-05-29cs.CV

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

Ji-Hoon Hwang, Jisung Bae, Dong-Wook Kim, Yeonkyu Lee, Seung-Woo Seo

2026-05-29视觉感知

面向越野等非结构化场景中“语义可通行”与真实安全不一致、标注边界含糊导致误检的问题,论文提出 ViTA,在 SAM2 上用可学习通行提示注入任务先验,并通过多视角训练估计不确定性、蒸馏单目深度模型的坡度/高程风险,融合为连续通行分数。实验显示其在多域城市与越野数据上提升 IoU 和 Precision,并显著降低 false positive,跨域泛化更稳。

Planning with the Views via Scene Self-Exploration Figure 1
2026-05-29cs.AI

Planning with the Views via Scene Self-Exploration

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Manling Li

Northwestern University, University of Washington, University of Oxford, Stanford University

2026-05-29规划控制

论文关注 VLM 是否能在真实 3D 场景中理解相机动作并组合成多步视角规划,指出现有模型虽具备局部视角变化知识,却难以长程组合。作者构建基于 ScanNet 的 ViewSuite,并提出自探索与视图图蒸馏交替训练,将失败轨迹也转化为视角连接监督。该方法使 Qwen2.5-VL-7B 在交互式视角规划上由 2.5% 提升到 47.8%,超过 GPT-5.4 Pro 与 Gemini 3.1 Pro。

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models Figure 1
2026-05-29cs.RO

VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models

Shengyu Si, Yuanzhuo Lu, Ruimeng Yang, Ziyi Ye, Zuxuan Wu, Yu-Gang Jiang

Institute of Trustworthy Embodied AI, Fudan University, Shanghai Key Laboratory of Multimodal Embodied AI, Shanghai Xinzhi Embodied Intelligence Technology Co., Ltd.

2026-05-29视觉语言视觉感知

这篇论文针对 VLA 在未见任务中难以迁移相似物体、场景和动作经验的问题,提出 VLA-Pro:将每个训练任务的 LoRA 适配器作为可检索的程序性记忆,推理时依据视觉与语言形成的过程状态检索 top-k 记忆并动态融合参数。其在 RoboTwin、RLBench 和真实操作中跨骨干提升泛化,仿真最高相对提升 207%,真实成功率由 5.8% 提至 65.0%。

TAE: Target-aware enhancer for nighttime UAV tracking Figure 1
2026-05-29cs.CV

TAE: Target-aware enhancer for nighttime UAV tracking

Yanyan Chen, Ruigang Fu, Yu Song, Ping Zhong

2026-05-29视觉感知

面向夜间低照度下无人机单目标跟踪易因图像退化、背景噪声增强而失效的问题,TAE用跟踪框弱监督生成目标感知增强掩码,并融合Gamma、对数、Sigmoid三类RGB曲线做区域自适应增强,使增强更集中于目标而非全图提亮。论文还构建含268段、9类目标的DarkSOT基准;在DarkSOT和UAVDark135上报告了明显跟踪性能提升,但具体增益中数据集与模块贡献的可分性仍需看消融细节。

Learning Representations from 3D Gaussian Splats Figure 1
2026-05-29cs.CV

Learning Representations from 3D Gaussian Splats

Julia Farganus, Krzysztof Żurawicki, Arkadiusz Gaweł, Weronika Jakubowska, Halina Kwaśnicka

2026-05-29三维

本文针对3D Gaussian Splatting长期偏重渲染、其场景理解表征能力缺乏系统评估的问题,将3DGS视为带位置、尺度、旋转、透明度和颜色等异质属性的几何输入,比较PointNet系、DGCNN、GAT、SplineCNN等点/图模型,并用分类、线性探测和聚类检验嵌入质量。结果显示PointNet家族更稳健,SplineCNN端到端分类可接近其表现,但GNN在线性探测和聚类上明显退化,提示标准k-NN消息传递与采样机制不适配非均匀Gaussian splats。

GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Detection Figure 1
2026-05-29cs.CV

GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Detection

Jiacong Liu, Shu Luo, Yikai Qin, Yaze Zhao, Yongwei Jiang, Yixiong Zou

Huazhong University of Science and Technology

2026-05-29视觉感知生成模型

GiPL面向跨域少样本目标检测中两类实际瓶颈:支持集常只有单实例标注,导致密集场景的正确检测被当作负例,以及极少样本微调易过拟合。其核心是按数据集问题选择两分支:迭代伪标签自训练补全支持集监督,或借助Qwen等生成域一致、多目标带标注图像扩充数据。文中在RUOD、CARPK、CarDD的1/5/10-shot设置下平均提升7.63%、9.97%、10.03%,但部分增益可能主要来自生成数据与伪标签规模扩充。

RadioFormer3D: Weakly Supervised 3D Radio Map Estimation in Low-Altitude Airspace via Generative Modeling Figure 1
2026-05-29cs.CV

RadioFormer3D: Weakly Supervised 3D Radio Map Estimation in Low-Altitude Airspace via Generative Modeling

Zheng Fang, Junjie Liu, Kangjun Liu, Jianguo Zhang, Yaowei Wang, Ke Chen

2026-05-29生成模型三维

面向低空无人机与三维异构网络,论文指出二维无线电地图难以刻画随高度变化的遮挡、多径与近自由空间传播。RadioFormer3D在RadioFormer双流融合基础上加入傅里叶采样编码器和体素/多高度解码器,并用联合频谱完整性损失结合体级伪标签、几何感知渲染和像素约束缓解垂直标注稀缺。实验称其在多个数据集上优于代表方法,尤其改善未标注高度重建,同时保持较好精度—效率权衡。

Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion Figure 1
2026-05-29cs.SD

Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion

S. Sutharya, Remya K. Sasi

Department of Computer Science, Cochin University of Science and Technology (CUSAT)

2026-05-29视觉感知

针对传统音频深伪检测只做真假二分类、难以处理“真话中插入一小段合成语音”的取证需求,论文提出轻量级 CAFNet,将 MFCC、LFCC 与 Chroma-STFT 经深度可分离卷积和交叉注意力融合,并在一次前向中同时完成真/假/半真三分类与篡改边界回归。在 MLADDC T2+T3 上达到 92.71% 准确率、0.9910 macro AUC,边界 MAE 为 0.075 秒;二分类也以 57.6 万参数超过微调 XLS-R 和 AST,但跨数据集微调仍出现表征遗忘。

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing Figure 1
2026-05-29cs.CV

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing

Mingshu Cai, Miao Zhang, Chenghe Yang, Yixuan Li, Osamu Yoshie, Yuya Ieiri

2026-05-29视觉感知

针对复杂文本驱动视频生成/编辑中语义歧义、概念绑定错误和跨帧漂移的问题,KGEdit不再依赖反复改提示或额外训练,而是将提示解析为含身份、关系、属性和负约束的歧义感知知识图,并通过SSIM注入扩散Transformer、用TASC按去噪阶段调度语义控制。实验称其在编辑精度、语义对齐和时间一致性上优于代表性训练自由方法及统一框架。

ESAM++: Efficient Online 3D Perception on the Edge Figure 1
2026-05-29cs.CV

ESAM++: Efficient Online 3D Perception on the Edge

Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco

Stanford University

2026-05-29三维

面向机器人、AR/VR 等边缘端在线 3D 感知,ESAM++针对 ESAM 中 3D sparse UNet 占用主要 CPU 推理时间的问题,提出稀疏 3D 特征金字塔 SFPN,通过限制高分辨率通道、利用多尺度层级预测与聚合来降低点云特征提取开销。在 ScanNet、ScanNet200、SceneNN、3RScan 上,其大模型精度接近或略优 ESAM-E,同时 CPU 3D 部分延迟由约 934ms 降至 326ms,模型约缩小到 41.2M,较基线最高约 3 倍加速、2 倍更小。

Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting Figure 1
2026-05-29cs.CL

Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting

Runze Xu, Arpit Garg, Hemanth Saratchandran, Simon Lucey

Australian Institute for Machine Learning, Adelaide University

2026-05-29视觉感知

论文关注无回放场景下 LoRA 适配新领域时的遗忘问题:目标分布越偏离预训练/对齐分布,旧能力越易下降。核心方法 TMKL 在损失层屏蔽真实目标 token,仅对非目标词表做重归一化 KL,避免对抗交叉熵且不改适配器、无推理开销。实验显示在多种 LoRA 变体和 Qwen/Llama/Mistral 等骨干上显著降低 WikiText、LAMBADA 等保留集漂移,7B PubMed 适配中保留性能接近基座,目标 PPL 基本不损失。

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training Figure 1
2026-05-29cs.CL

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

University of California, Los Angeles

2026-05-29视觉语言视觉感知优化算法

本文关注 VLM 后训练中“推理变强但感知仍弱”的瓶颈,构造图着色和数独等可控任务,将感知与推理输出、评测解耦。核心洞察是 SFT 的不对称主要来自 CoT 中感知 token 和梯度信号过少,RL 则来自结果奖励与推理更强耦合。通过感知损失动态重加权和感知奖励,端到端准确率分别最高提升 18.2 和 6.0 个点。

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling Figure 1
2026-05-29cs.CV

AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling

Yiheng Li, Zhuo Li, Ruibing Hou, Yingjie Chen, Hong Chang, Hao Liu, Shiguang Shan

Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China, University of Chinese Academy of Sciences, China

2026-05-29视觉感知

论文针对条件人体运动生成中多模态对齐数据稀缺、模型常被固定输入模态绑定的问题,构建了约5000小时、320万序列的OmniHuMo,并提出AnyMo:用残差FSQ离散运动、结合可扩展双向掩码Transformer和模态专属编码器,以支持文本、语音、音乐、轨迹等任意组合控制。实验显示其在多任务上生成质量较高,并能同时调节空间轨迹与风格属性,但部分增益可能主要来自数据规模与scaling。

V2XCrafter: Learning to Generate Driving Scene Across Agents Figure 1
2026-05-29cs.CV

V2XCrafter: Learning to Generate Driving Scene Across Agents

Yihang Tao, Yu Guo, Senkang Hu, Yanan Ma, Zihan Fang, Sam Kwong, Yuguang Fang

Hong Kong JC STEM Lab of Smart City, City University of Hong Kong, Lingnan University

2026-05-29视觉感知

针对真实 V2X 协同驾驶数据稀缺、仿真增强存在域差且单车多视角生成难以扩展到动态多车视角的问题,V2XCrafter以单车扩散骨干为基础,采用两阶段渐进式多智能体生成,并通过协作视图图与共享目标表示的跨车注意力约束一致性。实验显示其可生成更高保真、可控且跨视角一致的街景,并提升下游协同 3D 目标检测表现。

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset Figure 1
2026-05-29cs.CV

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang

2026-05-29视觉语言视觉感知数据集/基准

针对中文金融场景中图表、印章、票据等视觉信息难以被现有金融多模态基准全面评估的问题,论文提出 CFMME,覆盖6052个样本、8类金融图像和问答、检测、识别、信息抽取4类任务,并纳入教材、资格考试与真实业务文档。对14个LVLM零样本评测显示,最佳模型问答准确率仅66.11%,其他任务平均77.18,说明当前模型在金融跨模态理解与细粒度识别上仍有明显短板。

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation Figure 1
2026-05-29cs.CV

FlowSeg: Dynamic Semantic Guidance for LLM-Conditioned Segmentation

Zekang Zhang, Guangyu Gao, Youyun Tang, ChengJing Wu, Xiaochao Qu, Chi Harold Liu, Jianbo Jiao, Yunchao Wei, Luoqi Liu, Ting Liu

2026-05-29视觉感知生成模型

论文针对LLM条件分割中“候选掩码已较好但最终选错”的语义错配问题,指出瓶颈常在语言与掩码生成过程脱节而非掩码质量不足。FlowSeg通过解码层间的双向语义流,让语言条件持续指导查询/掩码细化,同时由视觉证据更新条件嵌入,并加入轻量边界感知修正。实验在RefCOCO系列和ReasonSeg上取得SOTA,消融与oracle分析表明增益主要来自更可靠的语言-掩码对齐。

FedSmoothLoRA: Toward Smoother and Faster Convergence in Federated Low-Rank Adaptation Figure 1
2026-05-29cs.CV

FedSmoothLoRA: Toward Smoother and Faster Convergence in Federated Low-Rank Adaptation

Zehao Wang, Guanglei Yang, Yihan Zeng, Hang Xu, Hongzhi Zhang, Wangmeng Zuo, Chun-Mei Feng

Harbin Institute of Technology, Huawei Noah’s Ark Lab, University College Dublin

2026-05-29学习理论

本文针对联邦场景下直接使用 FedAvg+LoRA 时更新空间受限、跨轮本地状态被覆盖以及初始化不考虑客户端异质性的收敛问题,提出 FedSmoothLoRA:在跨轮合并 LoRA 到主干以扩大更新空间的同时,用 Round-Matching 保持客户端上一轮有效状态连续性,并用 Gradient-Aligned 利用本地梯度构造客户端感知初始化。实验覆盖图像分类和自然语言生成,显示其相比 FedAvgLoRA、FRLoRA 等方法收敛更平滑、更快且性能更高。

Uni-RCM: Unified Reference-guided Cross-modal Mapping for Multi-Class Anomaly Detection Figure 1
2026-05-29cs.CV

Uni-RCM: Unified Reference-guided Cross-modal Mapping for Multi-Class Anomaly Detection

Yangchen Wu, Huiqiang Xie

2026-05-29视觉感知

面向工业产线多类别、多模态异常检测中单类建模难扩展、统一建模又易受类间干扰和特征流形混淆的问题,Uni-RCM用冻结的DINO与PointMAE提取2D/3D特征,引入可学习参考特征进行跨模态引导映射,并用离线残差量化器刻画正常模式分布以补充异常评分。在MVTec-3D AD多类别设置下,文中报告其在图像级I-AUROC和像素级AUPRO@1%上达到SOTA。

Comparative evaluation of photogrammetric reconstruction methods and 3D Gaussian Splatting for road surface roughness analysis Figure 1
2026-05-29cs.CV

Comparative evaluation of photogrammetric reconstruction methods and 3D Gaussian Splatting for road surface roughness analysis

Marouane Elmegdar, Teng Xiao

a School of International Education, Hubei University of Technology, Wuhan, China 430068, b School of Computer Science, Hubei University of Technology, Wuhan, China 430068, Image-based 3D reconstruction offers a low-cost and scalable alternative by enabling geometric surface evaluation from

2026-05-29数据集/基准三维

针对传统路面粗糙度检测设备昂贵、部署复杂的问题,本文用同一组手机影像和 CloudCompare 流程比较 COLMAP、Meshroom、Metashape 与 3DGS 的粗糙度估计差异。核心洞察是重建算法的匹配密度、滤波和表示形式会直接改变 Rp 指标:COLMAP 对微纹理最敏感但噪声较高,Meshroom 在细节与稳定性间较均衡,Metashape 过于平滑,3DGS 可捕捉缺陷但点密度不均,当前更适合相对分析而非精确计量。

How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions Figure 1
2026-05-29cs.LG

How Much Is a Dataset Worth? Scaling Laws, the Vendi Score, and Matrix Spectral Functions

Jeff A. Bilmes, Gantavya Bhatt, Arnav M. Das

Department of Electrical & Computer Engineering, Paul G. Allen School of Computer Science & Engineering, University of Washington, Seattle

2026-05-29数据集/基准

本文针对训练数据价值难以低成本评估的问题,指出常见神经 scaling law 与 Vendi Score 都可纳入次模视角,并将 Vendi 推广为更大的矩阵谱函数族,同时用 secular equation 更新避免反复特征分解,使 ImageNet 规模上直接优化 Vendi 成为可能。实验发现,数据价值并非由规模、类别均衡或训练预算决定;Vendi 在中等区间有预测性但极高分数会失真,整体上 facility location 对下游性能的相关性最好。

Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents Figure 1
2026-05-29cs.CV

Recovering Policy-Induced Errors: Benchmarking and Trajectory Synthesis for Robust GUI Agents

Tianpeng Bu, Xin Liu, Qihua Chen, Hao Jiang, Shurui Li, Hongtao Duan, Lu Jiang, Lulu Hu, Bin Yang, Minying Zhang

2026-05-29强化学习规划控制数据集/基准安全鲁棒

该文针对GUI智能体在真实执行中难以识别并纠正自身策略诱发错误的问题,指出现有评测和训练数据在错误类型覆盖与长程恢复上错配;提出GUI-RobustEval基准和树式RoTS轨迹合成,生成80万条失败—恢复数据。微调后的RoTS-7B/32B在鲁棒评测和传统GUI任务上均提升,RoTS-32B在OSWorld达47.4%成功率与33.8% All-Pass@4。

One Click per Cell Type Suffices: Training-free Group Interaction for Cell Instance Segmentation Figure 1
2026-05-29cs.CV

One Click per Cell Type Suffices: Training-free Group Interaction for Cell Instance Segmentation

Sanghyun Jo, Seo Jin Lee, Seohyung Hong, Yoorim Gang, Hyeongsub Kim, Hyungseok Seo, Kyungsu Kim

2026-05-29视觉感知

针对病理图像中成百上千细胞逐实例点击成本过高、监督细胞分割又易在未见细胞类型上失效的问题,本文提出无需训练的 Group Prompting/CoP:利用冻结 SAM 编码器中同类细胞已自然聚类的特性,通过多尺度相似性门控和最远点递归扩展,把一次按类型点击传播为同类实例提示。七个基准上仅每类一次点击即可保留逐实例 SAM 超过90%的性能,同质数据集超过99%,并优于若干全监督方法。

ParCo-SDF: Learning Prior-Free Partial-to-Complete Signed Distance Fields of Deformable Objects Figure 1
2026-05-29cs.CV

ParCo-SDF: Learning Prior-Free Partial-to-Complete Signed Distance Fields of Deformable Objects

Deokmin Hwang, Minseok Song, Daehyung Park

All authors are with the School of Computing, Korea Advanced Institute of Science and Technology, Korea

2026-05-29视觉感知

面向机器人操作中可变形物体因自遮挡、机械臂遮挡导致的部分点云难以恢复完整状态,ParCo-SDF提出无需显式形状先验的partial-to-complete SDF框架:用滑动时间窗口、DGCNN与注意力聚合历史几何,再以FiLM调制共享隐式网络预测完整SDF。在橡皮筋操控数据上,相比现有DO重建基线提升几何保真度与拓扑一致性,尤其在严重遮挡和未见形变下更稳健;但实验仍限于仿真和单一物体类别。

3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding Figure 1
2026-05-29cs.RO

3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding

Zhongyu Xia, Yousen Tang, Bingqing Wei, Yongtao Wang

Wangxuan Institute of Computer Technology, Peking University

2026-05-29视觉语言视觉感知三维

这篇论文针对现有 VLA 主要依赖 2D 视觉、难以处理精确 3D 位姿、实例边界和遮挡的问题,提出可插拔的 3DVLA:在不额外标注且保留 VLM 先验的前提下,引入多视角一致的 3D 特征编码、对象中心实例 token,以及保留预测器的 masked 自监督分支来补全被遮挡视觉 token。作者将其接入多个 VLA 基线,在 LIBERO-Plus 和 RoboTwin 2.0 上报告了稳定且显著的操作成功率提升。

Constructing efficient channels for ideal observers using the conjugate gradient method Figure 1
2026-05-29eess.IV

Constructing efficient channels for ideal observers using the conjugate gradient method

Weimin Zhou

University of Arizona, Wyant College of Optical Sciences, Tucson, AZ 85721, USA, University of Arizona, Department of Radiology & Imaging Sciences, Tucson, AZ 85721, USA

2026-05-29优化算法

高维医学图像中直接计算贝叶斯理想观察者和 Hotelling 观察者代价高、协方差求逆也不稳。论文将线性判别优化中的共轭梯度残差构造成正交高效通道,并可注入成像对象先验,无需矩阵求逆。在 lumpy 背景二分类实验中,该方法较 PLS 更能保留任务相关信息,尤其在训练数据有限时通道更干净、CHO/CIO 对 HO/IO 性能估计更准确。

Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge Figure 1
2026-05-29cs.CV

Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge

Yinsong Xu, Wei Jing, Liuxin Zhang, Wanjun Lv, Hui Li

2026-05-29视觉感知

针对长时第一视角视频问答中 MLLM 上下文受限、稀疏采样丢细节而分块又削弱全局连贯性的问题,论文将推理拆成离线证据构建与在线检索整合:用粗到细摘要形成语义证据,用检测框和视觉嵌入保留对象级证据,再按问题选择相关证据与帧输入模型。该方法在 HD-EPIC VQA 挑战多类任务上取得有竞争力表现,但文中对相对增益幅度与消融贡献说明有限。

Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation Figure 1
2026-05-29cs.CV

Orthogonal Negative Guidance in Attention Feature Space for Text-to-Image Generation

Jungmin Ko, Jungwon Park, Jimyeong Kim, Changin Choi, Wonseok Lee, Wonjong Rhee

2026-05-29视觉感知

针对文本生成图像中“明确不要某物/属性”常导致目标仍出现或画质、语义对齐下降的问题,论文提出在 MM-DiT 的图文注意力输出空间做正交负向引导:将负提示特征相对正提示正交化,仅减去不与正语义重合的分量,无需训练或新增参数。在 FLUX-dev/schnell 与 DCS-Bench 上,该方法在概念抑制、提示对齐和图像质量间取得更好折中,人工偏好较次优基线高 18.78%,并支持多概念与可调强度抑制。

TRACER: Persistent Regularization for Robust Multimodal Finetuning Figure 1
2026-05-29cs.LG

TRACER: Persistent Regularization for Robust Multimodal Finetuning

Hesam Asadollahzadeh, Feng Liu, Christopher Leckie, Sarah M. Erfani

2026-05-29视觉语言安全鲁棒

针对 CLIP 等多模态模型微调常提升 ID 却损害 OOD 鲁棒性的灾难性遗忘问题,论文从线性化对比学习推导闭式解与几何分解,指出常用 EMA 教师会因师生差距塌缩而失去正则作用,并提出 WMA 轨迹锚定的 TRACER 自蒸馏。实验显示其在三类 CLIP 骨干上稳定改善 OOD 准确率与校准,消融支持其对超参数较鲁棒。

DeepFake Forensics AI: A Multi-Modal Detection and Blockchain-Anchored Evidence Management Platform Figure 1
2026-05-29cs.CR

DeepFake Forensics AI: A Multi-Modal Detection and Blockchain-Anchored Evidence Management Platform

Naisha Minnah

2026-05-29视觉感知

面向深度伪造进入司法证据链后“检测与取证保存脱节”的问题,论文提出一个多模态取证平台:用 EfficientNet-B4、BiLSTM 和 ECAPA-TDNN 分别处理图像、视频、音频,并加入 GAN 架构指纹识别与潜变量反演,再用 SHA-256、IPFS 和以太坊合约固化证据流。报告结果为图像 AUC 0.9868、视频 AUC 0.9628、音频 EER 18.63%、GAN 指纹准确率 99.88%,但跨数据集泛化和链上部署真实性仍需进一步说明。

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction Figure 1
2026-05-29cs.CV

WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction

Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang

2026-05-29视觉语言强化学习

针对现有多模态智能体记忆评测偏重静态回忆、难定位写入/更新/检索/使用故障的问题,本文提出 Action–World Interaction Loop,并构建含 400 个多会话任务的 WorldMemArena,覆盖长期状态演化与真实行动轨迹。实验显示,记得更多不等于用得更好,视觉证据利用仍弱,系统跨域不稳且在真实轨迹上退化,harness 记忆更灵活但成本高、可靠性不足。

DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning Figure 1
2026-05-29cs.CV

DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning

Junzhe Zhang, Huixuan Zhang, Guirong Wang, Xingyao Zhang, Pei Liu, Lin Qu, Hu Wei, Xiaojun Wan

Wangxuan Institute of Computer Technology, Peking University

2026-05-29视觉语言数据集/基准

为检验多模态大模型是否真正理解真实世界因果关系,论文针对现有基准依赖合成/卡通数据或规模偏小、静态评测易污染的问题,构建了基于1614个真实视频的DMC-CF-Static(约5k反事实QA),并用因果图表示事件关系,提出动态图干预DGI生成约10k动态QA。实验显示主流MLLM能处理部分简单反事实问题,但在复杂动态因果推理上准确率仍普遍较低。

Rethinking FID Through the Geometry of the Reference Dataset Figure 1
2026-05-29cs.CV

Rethinking FID Through the Geometry of the Reference Dataset

Yunghee Lee, Byeonghyun Pak

2026-05-29数据集/基准

这篇论文针对“FID 越低是否真代表生成质量越好”的评测疑问,把注意力从生成器和特征提取器转向参考数据集几何。作者用分布密度和有效秩刻画六个数据集,发现密集数据集上 FID 更符合质量提升趋势,而分散数据集上样本变好反而可能使 FID 变差;精确率/召回率分解及 DINOv2、KID 消融支持这一结论。

EarthShift: a benchmark for measuring robustness to real-world distribution shifts in Earth observation Figure 1
2026-05-29cs.CV

EarthShift: a benchmark for measuring robustness to real-world distribution shifts in Earth observation

Kelsey Doerksen, Hannah Kerner

School of Computing and Augmented Intelligence, Arizona State University

2026-05-29强化学习数据集/基准安全鲁棒

面向遥感模型部署中常见的时间、地域、尺度、传感器和数据源变化,EarthShift构建了首个覆盖多类真实分布偏移的公开鲁棒性基准,用ID/OOD成对数据衡量有效鲁棒性。对13个模型、11项任务的大规模实验显示,现有地理基础模型在OOD下平均掉点约15–25%,除时间偏移外对地域、尺度、传感器和来源偏移均不稳,且并未比通用视觉预训练或全监督基线更鲁棒,提示领域预训练的鲁棒增益来源不清。

Multi-Stage VLM Pipeline for Zero-Shot Traffic Accident Understanding Figure 1
2026-05-29cs.CV

Multi-Stage VLM Pipeline for Zero-Shot Traffic Accident Understanding

Fumiya Tatematsu, Fumihiko Takahashi

2026-05-29视觉语言

针对交通监控视频中事故发生时间、碰撞位置与类型需在无真实标注训练下同时判断的问题,论文将大VLM从一次性回答拆成全视频粗预测、局部时间细化、单帧空间定位三阶段,并加入235B模型低权重融合和车辆框吸附后处理。该训练自由方案在ACCIDENT挑战私榜达0.57080,较最强主办方基线约提升0.21并获第一。

STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments Figure 1
2026-05-29cs.CL

STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments

Junyang Wang, Haiyang Xu, Xi Zhang, Zhaoqing Zhu, Ming Yan, Jieping Ye, Jitao Sang

Tongyi AI Lab, Alibaba Group, Beijing Jiaotong University, Work done during internship at Tongyi AI Lab. Corresponding author

2026-05-29规划控制

针对移动 GUI 智能体在长程任务中因截图占用上下文而丢失验证码、价格等瞬时信息的问题,STAMP 将“何时记、记什么、何时取用”作为可控变量注入虚拟环境,自动生成可验证的显式记忆监督,并结合 SFT 与在线强化学习训练 Stamp-GUI。实验在新建 Memory-World 上显示其记忆准确率和任务鲁棒性优于现有 GUI 专用模型,同时保持较强通用导航能力。

FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes Figure 1
2026-05-29cs.GR

FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes

Donglai Xiang, Vismay Modi, Rishit Dagli, Ty Trusty, Gilles Daviet, Anka He Chen, Nicholas Sharp, David I.W. Levin

University of Toronto

2026-05-29视觉感知

针对FEM依赖高质量体网格且高自由度计算昂贵、粒子法在大形变下易受离散化影响的问题,FreeForm用RKPM粒子表示构造无网格降阶弹性模拟,并通过弹性能量Hessian的广义特征分析直接得到skinning特征模态,避免逐物体训练神经场。实验显示其相对Simplicits训练约快40倍,且相对收敛FEM误差更低,可用于网格、3D Gaussian Splat及机器人交互仿真。

CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation Figure 1
2026-05-29cs.CV

CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

The University of Tokyo, Snap Research, Snap Inc.

2026-05-29三维

针对现有语音驱动3D头部动画依赖固定身份/风格潜变量、难以随语音情绪动态变化的问题,CapTalk将说话风格拆解为口型幅度、头动幅度和情绪,并构建带文本风格/情绪标注与FLAME参数的大规模数据集;模型用时间窗口自回归结构融合音频与文本,实现推理时可变的风格和情绪控制,实验显示在表现力与可控性上优于既有方法。

ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement Figure 1
2026-05-29cs.CV

ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement

Jianping Ye, Michel Wedel

2026-05-29视觉感知

短视频广告需要低成本判断观众注意是否被有效引导,但人工眼动测试昂贵且动态显著性受剪辑、语义和音频影响。ViASNet基于3D U-Net,融合视频帧、原始音频与由视觉语言模型生成的场景语义,并以逐帧显著图熵诊断低参与片段。作者在151条真实广告眼动数据上训练评估,并在15条未见广告上展示诊断用途;具体相对增益幅度文中片段未充分说明。

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models Figure 1
2026-05-29cs.CV

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

Kai Bian, Xucheng Guo, Bin Chen, Lingyan Ruan, Yiran Shen, Ting Dang, Hong Jia

2026-05-29视觉语言视觉感知

面向基层/离线牙科筛查中网络、隐私与手机算力受限的问题,本文将全景片和口内照片等三类数据统一为多模态牙科问答基准,覆盖五类任务,并把答案质量、结构化可靠性、LoRA适配成本、内存和延迟纳入同一评估。对14个VLM的结果显示,小模型经牙科LoRA后并不劣于大模型,InternVL3.5-2B表现最佳;其手机端版本在iPhone 17 Pro上单样本4.31秒,相比7B基线延迟降4.9倍、内存降2.3倍。

Turbulence-Robust Dynamic Object Segmentation with Multi-Signal Priors and SAM2 Refinement Figure 1
2026-05-29cs.CV

Turbulence-Robust Dynamic Object Segmentation with Multi-Signal Priors and SAM2 Refinement

Bolian Peng, Ying Tang, Xu Liu, Long Sun, Xiaoqiang Lu

Xidian University

2026-05-29视觉感知安全鲁棒

面向大气湍流视频中背景伪运动、模糊和小目标间歇可见导致的动态目标分割失效,本文提出无需训练的多信号流水线,将 RAFT/跳帧光流、DINOv2 语义先验、ViBe 背景异常与 SAM2 框提示细化融合,以降低对单一运动线索的依赖。官方 DOST 验证集结果为 0.425041 mIoU、0.457206 mDice;由于采用手工阈值且缺少任务微调,增益来源仍有一定不清晰。

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking Figure 1
2026-05-29cs.IR

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

Xiaohongshu Inc., Shanghai Jiao Tong University, Huazhong University of Science and Technology, Beijing Institute of Technology, Xiaohongshu Inc. Beijing China, Shanghai Jiao Tong University Shanghai China, Huazhong University of Science and Technology Wuhan China, Beijing Institute of Technology Beijing China

2026-05-29视觉语言

针对小红书等内容平台的 I2I 检索中,多模态笔记既要全局表征又要支持局部到整体检索,且传统“召回+重排”延迟高的问题,UniNote 将多模态 LLM 改造成统一嵌入模型,先用对比式 SFT 学基础表示,再用 GRPO 强化学习按相关性优化排序,并设计十类检索任务与难负例。实验称其在各类 I2I 任务达到 SOTA,结合 MRL 部署后提升检索质量并降低成本。

Deep Psychovisual Image Representations Figure 1
2026-05-29cs.CV

Deep Psychovisual Image Representations

Wendi Ma, Aryaman Sharma, Wei Dai, Shekhar S. Chandra

School of EECS, The University of Queensland

2026-05-29视觉感知

针对常规 CNN/视觉模型依赖深层空间堆叠、内部表征缺少结构且难解释的问题,论文提出受心理视觉编码启发的 Deep Visual Coding,并用 Phasor Block 生成复值特征,在傅里叶子带中学习稀疏、任务相关的频率选择。实验显示 PsychoNet 在多个分类基准上可匹配或优于 ResNet,且用更少层数获得更清晰的物体部件显著性;但其语义抽象与更广义推理的关系仍文中未充分说明。

No Figure
2026-05-29cs.CV

Toward Ethical Facial Age Estimation: A Generalized Zero-Shot Benchmark Without Training on Children's Data

Caio Petrucci, Leo Sampaio Ferraz Ribeiro, Sandra Avila

2026-05-29数据集/基准

针对人脸年龄估计常用未成年人图像训练带来的伦理、隐私与合规风险,论文将“不用儿童数据训练”形式化为广义零样本基准:在六个数据集上统一划分18–59岁训练/测试、60岁以上作未见验证、18岁以下仅作零样本评估,并尽量避免身份泄漏。九种方法实验显示,对未见儿童年龄段泛化显著失败,整体较监督基线平均下降46.4%,且预测会偏向已见成年年龄段。

An Approach for Thyroid Nodule Analysis Using Thermographic Images Figure 1
2026-05-29cs.CV

An Approach for Thyroid Nodule Analysis Using Thermographic Images

J. R. González, É. O. Rodrigues, C. P. Damião, C. A. P. Fontes, A. C. Silva, A. C. Paiva, H. Li, C. Du, A. Conci

Computer Science Department, Universidade Federal Fluminense, Radiology Department, Hospital Universitário Antônio Pedro (HUAP), this work presents a pilot project for detection of tumors in our university hospital, endocrinology department. Under some future adjustments, this project will be, School of Mathematical Sciences, Shandong Normal University, School of Mathematical Sciences, University of Jinan, 336 West Road

2026-05-29视觉感知

针对甲状腺结节早筛中医生难以快速解读热成像信息的问题,论文梳理红外热成像用于甲状腺分析的流程,并提出较规范的采集协议、动态序列自主配准与基于简单视觉方法的甲状腺 ROI 提取,再用 ROI 的均值、方差、最高温和对称性等特征结合 k-NN 区分健康/异常。结果显示这些特征在小规模试点中有一定判别迹象,但数据量不足,临床增益与泛化能力文中未充分说明。

Motion-guided sparse correction enables expert-quality point tracking across diverse microscopy regimes Figure 1
2026-05-29cs.CV

Motion-guided sparse correction enables expert-quality point tracking across diverse microscopy regimes

Leonidas Zimianitis, Pasindu Thenahandi, Kai Buckhalter, Dineth Jayakody, Julian O. Kimura, Xinyue Liang, Karen Cunningham, Azeem Ahmad, Balpreet S. Ahluwalia, Sampath Jayarathna, Nikos Chrisochoides, Brandon Weissbourd, Dushan N. Wadduwage

\authormark 1Department of Computer Science, Old Dominion University, Norfolk, VA 23529, USA, \authormark 2Department of Biology, Massachusetts Institute of Technology, Cambridge, MA 02139, USA, \authormark 3The Picower Institute for Learning and Memory, Massachusetts Institute of Technology, Cambridge, MA 02139, USA, \authormark 4Department of Physics and Technology, UiT–The Arctic University of Norway, Tromsø 9037, Norway, \authormark 5Department of Physics, University of Oslo, Oslo 0316, Norway, \authormark 6School of Data Science, Old Dominion University, Norfolk, VA 23529, USA, \authormark 7Department of Physics, Old Dominion University, Norfolk, VA 23529, USA

2026-05-29视觉感知

显微视频中点轨迹常因低信噪、形变、遮挡和离焦而难以自动跟踪,逐帧专家标注又成本过高。论文提出 RIPPLE,将标注改为“运动引导的稀疏纠正”:先由光流式运动插值生成整条轨迹,专家只在漂移处点击校正,并双向传播更新。五个水母与精子数据集上,其轨迹质量接近逐帧人工标注,人工点击量减少约 3–25 倍,且交互更新显著快于 TAP-Vid。

SalsaAgent: A multimodal embodied language model for interactive dance generation Figure 1
2026-05-29cs.CV

SalsaAgent: A multimodal embodied language model for interactive dance generation

Payam Jome Yazdian, Zoe Stanley, Angelica Lim

2026-05-29视觉语言

面向机器人/虚拟人需要理解非语言互动的场景,本文以萨尔萨领舞-跟舞为测试床,提出 SalsaAgent:把领导者动作、双人相对关系与音乐编码为可供 LLM 处理的离散 token,并用自动生成的细粒度身体部位描述进行运动 grounding,再经扩散模型细化关节轨迹。实验显示其在动作真实感、舞伴空间协调和节拍对齐上优于既有跟舞生成基线。

Towards the automated segmentation of epicardial and mediastinal fats: A multi-manufacturer approach using intersubject registration and random forest Figure 1
2026-05-29cs.CV

Towards the automated segmentation of epicardial and mediastinal fats: A multi-manufacturer approach using intersubject registration and random forest

É. O. Rodrigues, A. Conci, F. F. C. Morais, M. G. Pérez

Institute of Computing, Institute of Medicine / Pró-Laudo, The core of their method consists of a voxel labeling procedure:, evaluates the class or label attribute of a training set as the, predictive label desired to attach to an incoming unlabeled

2026-05-29视觉感知

心外膜与纵隔脂肪体积和多类心血管风险相关,人工在CT上勾画易受观察者差异影响。本文面向冠脉钙化评分CT,提出跨西门子/飞利浦数据的全自动流程:先做受试者间配准到标准空间,再提取像素及邻域特征,用随机森林区分两类脂肪。实验报告平均准确率98.4%、真阳性率96.2%、Dice 96.8%,但处理单例仍需数小时,实时临床部署受限。

MetaRanker: Human-in-the-loop Active Ranking for Metalens Image Quality Figure 1
2026-05-29cs.CV

MetaRanker: Human-in-the-loop Active Ranking for Metalens Image Quality

Yujin Park, Haejun Chung, Ikbeom Jang

Hanyang University, Hankuk University of Foreign Studies, Hanyang University Seoul Republic of Korea, Hanyang University Yongin Republic of Korea, Hankuk University of Foreign Studies Seoul Republic of Korea

2026-05-29视觉感知

金属透镜成像中,PSNR/SSIM等保真指标常与人类可识别性脱节,导致重建看似更准却更难理解。MetaRanker把图像质量定义为语义可解释性,用人类成对偏好作主监督,结合概率排序、不确定性主动选样和仅作采样引导的VLM先验。作者在DRMI与Metaformer等数据上报告,相比穷举比较可减少约80%标注成本,并提升标注者间一致性。

Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization Figure 1
2026-05-29cs.CV

Guidance Contrastive Token Credit Assignment for Discrete Policy Optimization

Shufan Li, Konstantinos Kallidromitis, Akash Gokul Yusuke Kato, Kazuki Kozuka, Aditya Grover

2026-05-29强化学习优化算法

这篇论文针对 GRPO/DAPO 将样本级奖励均匀分配给所有 token、忽略细粒度贡献的问题,提出 GCPO:用正/负提示下同一策略预测的差异(KL)为 token 分配信用,并用排序归一化稳定权重。实验显示其在 Janus-Pro 文生图 GenEval 上达 0.89,优于 GRPO,并在多模态推理基准上整体超过 DAPO/VPPO;但具体增益与训练数据、基座差异的关系仍需进一步拆解。

Eulerian Gaussian Splatting using Hashed Probability Pyramids Figure 1
2026-05-29cs.CV

Eulerian Gaussian Splatting using Hashed Probability Pyramids

Mia Gaia Polansky, George Kopanas, Stephan Garbin, Todd Zickler, Dor Verbin

Harvard University

2026-05-29三维

针对 3D Gaussian Splatting 训练中依赖手工 densification、分裂和剪枝规则且易脆弱的问题,论文提出 Eulerian Gaussian Splatting:不直接搬移高斯,而是学习场景中的体概率密度,并用 hashed probability pyramid 高效表示和采样高斯位置,配合控制变量构造低方差无偏梯度。实验显示,在均匀初始化、相同 primitive 数量下优于基线,在 mip-NeRF 360 上达到接近或达到 SOTA 的重建质量,同时保持 3DGS 级渲染速度;但训练仍更慢且更耗显存。

Robust Cross-Domain Generalization Using Unlabeled Target Data with Source-Domain Supervision Figure 1
2026-05-29cs.CV

Robust Cross-Domain Generalization Using Unlabeled Target Data with Source-Domain Supervision

Yuyue Zhou, Shrimanti Ghosh, Michael (Kai Yue)Xie, Justin JY Kim, Jessica Knight, Steel McDonald, Vincent Man, Jacob L. Jaremko, Abhilash Hareendranathan

2026-05-29视觉感知学习理论安全鲁棒

针对儿科腕部 POCUS 在不同探头/中心间存在显著域偏移、目标域标注昂贵且受隐私限制的问题,论文提出利用未标注目标域进行自监督预训练的跨域分割框架,结合 MIM 与对比学习提取目标结构表征,并用置信度感知融合头集成预测。在 Philips 有标注源域到 TeleMED 无标注目标域的实验中,318 张图像上目标域 Dice 较基线提升超过 6%,显示出较省标注的跨设备鲁棒性。

Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals Figure 1
2026-05-29cs.CV

Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals

Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh

2026-05-29三维

针对毫米波雷达虽能穿透遮挡却因无透镜成像、噪声和低分辨率导致箱内物体三维重建不稳定的问题,本文提出 GeRaF 2.0,将可见区域的视觉几何先验与雷达神经隐式场统一建模,通过 ULoS SDF、渲染和两阶段对齐约束显式利用遮挡外表面对信号传播的影响。真实 Franka 机械臂与 77GHz 雷达实验显示,其较既有 RF/NLoS 方法重建更稳定、表面更干净并达到新的最佳结果。

GeRaF: Neural Geometry Reconstruction from Radio Frequency Signals Figure 1
2026-05-29cs.CV

GeRaF: Neural Geometry Reconstruction from Radio Frequency Signals

Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh

2026-05-29三维

GeRaF面向视觉/LiDAR在遮挡、恶劣可见条件下失效而毫米波RF又低分辨率、高噪声的问题,尝试用神经隐式表示做近距离三维几何重建。其核心是把RF无透镜、全空间传播和镜面反射纳入可微渲染:用匹配滤波抑制无关回波,构建物理感知RF体渲染,并设计无透镜采样与alpha融合降低三维采样开销。真实77GHz雷达机械臂扫描实验显示,其重建质量和抗实验噪声优于现有方法,可恢复更细的毫米级几何。

Lightweight Complementary-Cue Fusion for Robust Video Face Forgery Detection Figure 1
2026-05-29cs.CV

Lightweight Complementary-Cue Fusion for Robust Video Face Forgery Detection

Sunghwan Baek, Tariq Anwaar, Karanveer Singh, Rita Singh

Carnegie Mellon University

2026-05-29视觉感知安全鲁棒

针对现有视频换脸检测器依赖宽/双流骨干、单一频域线索易跨域失效的问题,论文提出用极轻量1×1卷积将小波低频结构特征WDF与相位线索SPSL或纹理线索LBP融合成单通道再接入Xception。该设计只增加292个参数,却在八个公开基准上优于Xception、F3Net、SRM等;平均AUC在FF++由74.8%升至78.6%,在DFDC-Preview由70.5%升至74.9%,但结果为单随机种子,统计稳健性文中未充分说明。

OISD: On-Policy Internal Self-Distillation of Language Models Figure 1
2026-05-29cs.LG

OISD: On-Policy Internal Self-Distillation of Language Models

Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

Auburn University

2026-05-29强化学习

本文针对GRPO等推理强化学习只用稀疏结果奖励、忽视中间层预测信号的问题,提出OISD:在同一on-policy rollout中让最终层作为冻结内部教师,通过logit对齐传递“如何思考”、attention对齐传递“看哪里”,用带符号优势加权JS目标监督中间层而不引入外部教师或特权信息。实验在Qwen3-4B和四个数学推理任务上相对强RL基线取得稳定提升,但层选择与跨任务泛化仍未充分说明。

A Deep Learning Iterative Framework for Sentinel-1 Stripmap Enhancement Based on Azimuth Doppler Decomposition Figure 1
2026-05-29cs.CV

A Deep Learning Iterative Framework for Sentinel-1 Stripmap Enhancement Based on Azimuth Doppler Decomposition

Juan Francisco Amieva, Christian Ayala, Roberto Del Prete, Mikel Galar

Public University of Navarre

2026-05-29视觉感知

针对 Sentinel-1 Stripmap SAR 图像受斑点噪声和空间细节不足限制、且监督增强依赖外部高分辨率传感器或多时相数据的问题,本文利用方位 Doppler 子孔径分解构造与全孔径图像物理一致的自监督训练对,并结合单/多帧学习与迭代推理来同时做去斑和细节恢复。真实 S1 SM 实验中,该方法在 PSNR、SSIM 上优于 MERLIN,但 ENL 低于 MERLIN,说明其更偏向结构保真而非最强平滑。

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models Figure 1
2026-05-29cs.CV

Embodied3DBench: Benchmarking Low-Level Embodied Spatial Intelligence of Vision Language Models

Jiyao Zhang, Mingxu Zhang, Yitong Peng, Haoxuan Liu, Chenshuo Wang, Yuxing Long, Haoyang Huang, Dongjiang Li, Nan Duan, Hui Shen, Hao Dong

CFCS, School of CS, PKU, Technology Co., Ltd, both a systematic evaluation framework and a scalable data solu-, surements are available [4]. These constraints have long hindered

2026-05-29视觉感知数据集/基准三维

论文针对现有 VLM 擅长粗粒度空间关系、却难以支撑机器人真实交互前感知的问题,提出 Embodied3DBench:用高保真仿真生成多视角、细粒度 3D 标注,覆盖定位、空间关系、对应、可供性、抓取点和轨迹等 6 类低层任务,并额外合成 130 万 QA 训练集。对 13 个模型的评测显示,即使 GPT-5、Gemini 等在关系判断上较强,仍在度量定位、抓取和轨迹预测上明显脆弱;用合成数据微调可显著提升低层具身空间能力。

Analyzing Persona Effects in Generated Explanations from Multimodal LLM Agents in Urban Perception Figure 1
2026-05-29cs.CL

Analyzing Persona Effects in Generated Explanations from Multimodal LLM Agents in Urban Perception

Neemias da Silva, Myriam Delgado, Rodrigo Minetto, Daniel Silver, Thiago H Silva

University of Toronto, Toronto, Canada

2026-05-29视觉语言

论文关注多模态 LLM 作为“社会模拟器”时,人设提示究竟改变城市图像理解的哪一部分。作者将输出区分为客观描述的 descriptive grounding 与带价值判断的 interpretive framing,并分析 1,200 个代理的 59,808 条标注。结果显示,不同人设的图像 caption 高度趋同,感知标签差异未达显著,而解释文本会随经济地位和政治倾向系统变化,说明人设主要影响解释框架而非视觉事实描述。

Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid Figure 1
2026-05-29eess.IV

Accelerating HEVC Intra Partitioning via a CNN-Hierarchical Attention Transformer Hybrid

Krishna Kumar Sharma, Somdyuti Paul

Krishna Kumar Sharma and Somdyuti Paul are with the Department of Artificial Intelligence, Indian Institute of Technology Kharagpur, Kharagpur, West Bengal 721302, India

2026-05-29视觉感知

针对 HEVC 帧内编码中 CTU 四叉树划分需大量 RDO 搜索、CNN 难建模全局上下文而 Transformer CPU 延迟过高的问题,论文提出 HFViT,将轻量深度可分离卷积与层次注意力、carrier token 和 QP 条件调制结合,并做 BN 融合降延迟。在 JCT-VC 序列上,相比 ETH-CNN 降低 VMAF BD-rate 惩罚 2.4/2.6/7.9 个百分点,CPU 延迟仅高约 8%,GPU 快约 40%。

Trajectory Constraints for Imaging Inverse Problems Figure 1
2026-05-29cs.CV

Trajectory Constraints for Imaging Inverse Problems

Chaoyan Huang, Haijie Yuan, Saiprasad Ravishankar

Department of Computational Mathematics, Science, & Engineering, Michigan State University, Department of Electrical Engineering and Computer Science, University of Michigan, Department of Biomedical Engineering, Michigan State University

2026-05-29规划控制优化算法

本文针对扩散式和迭代式成像逆问题求解器只约束终点、缺少对中间重建轨迹显式控制的问题,提出训练自由的 TRACE 框架,在相邻状态间加入时间耦合,并将其解释为近端更新、用未训练神经映射近似实现。理论分析表明耦合可限制轨迹波动;实验在自然图像恢复和 CT 等线性/非线性任务中提升重建质量,并显示增益与更稳定的状态转移相关。

Auditing Training-Free 3D Shape Retrieval with Diffused Geodesic Moments Figure 1
2026-05-29cs.CV

Auditing Training-Free 3D Shape Retrieval with Diffused Geodesic Moments

Zhicheng Du, Changyue Liu, Wenji Xi, Zhaotian Xie, Zhuo Deng, Ziheng Zhang, Yang Liu, Lan Ma

Tsinghua Shenzhen International Graduate School, Tsinghua University, Guangzhou International Economics College, School of Electrical and Electronic Engineering, The University of Sheffield

2026-05-29三维

本文针对无训练三维形状检索中分数混杂局部信号、归一化、聚合和度量选择的问题,将评测重构为“协议审计”。作者提出非谱的 DGM,用种子条件热响应及低阶矩作为诊断工具。结果显示在匹配聚合协议下,GMSD-HKS 和 WKS 明显强于 DGM,说明输入场与聚合层往往比矩公式本身更决定最终排名。

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation Figure 1
2026-05-29cs.CV

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi Derakhshani

2026-05-29视觉语言生成模型三维

针对将 VLM 接入生成模型时常需端到端重训或只对齐压缩语义特征、丢失3D几何所需空间结构的问题,GAP3D 用流匹配扩散 Transformer 将冻结 VLM 的潜变量生成式对齐到 DINOv2 完整 patch 级嵌入,再驱动冻结 TRELLIS 生成3D资产。实验显示该高维对齐可行,主要用通用图文数据即可支持文本到3D,并出现零样本多模态提示能力;但细粒度细节仍弱,且需领域微调缓解自然图像到合成3D渲染的分布偏移。

Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment Figure 1
2026-05-29cs.CV

Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment

Yurong Gao, Zicheng Zhang, Congying Han, Tiande Guo, Xinmin Qiu

University of Chinese Academy of Sciences

2026-05-29生成模型

论文针对扩散桥在图像复原/翻译中直接套用标准 score matching 时,接近目标端点会因输入与回归目标噪声水平不一致而欠拟合的问题。作者将其分解为幅值与方向误差,提出 NADB:用均值网络构造更干净的条件目标,并设计噪声对齐的随机插值/映射。实验显示其在多类复原任务上优于 I2SB 等扩散桥基线,兼顾感知质量与重建保真度。

2026-05-28

133 篇
From Pixels to Words -- Towards Native One-Vision Models at Scale Figure 1
2026-05-28cs.CV

From Pixels to Words -- Towards Native One-Vision Models at Scale

Haiwen Diao, Jiahao Wang, Penghao Wu, Yuhao Dong, Yuwei Niu, Yue Zhu, Zhongang Cai, Weichen Fan, Linjun Dai, Silei Wu, Xuanyu Zheng, Mingxuan Li, Yuanhan Zhang, Bo Li, Hanming Deng, Huchuan Lu, Quan Wang, Lei Yang, Lewei Lu, Dahua Lin, Ziwei Liu

2026-05-28视觉感知

针对模块化 VLM 依赖视觉编码器与后期对齐、难以保留像素级跨帧关系的问题,论文提出 NEO-ov:用单一 decoder-only 骨干直接串联图像/视频 patch 与文本,并结合统一序列化和时空注意力端到端学习像素—词、帧间对应。实验显示其在单图、多图、视频和空间智能任务上接近同等 LLM 的编码器式模型,细粒度感知与空间推理更突出;但与 Qwen3-VL 等顶级系统仍有差距,增益可能部分来自 scaling / data。

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players Figure 1
2026-05-28cs.CV

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

2026-05-28生成模型强化学习

为解决现有视频世界模型多停留在单智能体、多人场景中跨视角一致性与计算开销难兼顾的问题,Gamma-World 将智能体作为旋转角空间中正单纯形顶点编码,保持身份可区分且置换对称,并用稀疏 Hub Attention 以线性代价传递跨智能体信息;再通过教师-学生蒸馏和 KV 缓存实现 24 FPS 交互式 rollout。实验显示其在多人虚拟环境中提升视频质量、动作可控性和智能体间一致性,并可从两人泛化到四人。

HarmoVid: Relightful Video Portrait Harmonization Figure 1
2026-05-28cs.CV

HarmoVid: Relightful Video Portrait Harmonization

Jun Myeong Choi, Jae Shin Yoon, Luchao Qi, Roni Sengupta, Joon-Young Lee

2026-05-28视觉感知

HarmoVid针对视频前景合成中逐帧图像和谐化易产生光照闪烁、真实成对视频数据难获取的问题,提出先用图像模型构造伪配对数据、再以光照去闪烁网络净化,并结合真实/合成视频训练视频扩散模型;其非对称alpha mask条件还用于改善边界。实验显示该方法在时间一致性、自然度、身份保持和边界融合上优于既有图像/视频和谐化方法。

AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning Figure 1
2026-05-28cs.CV

AREA: Attribute Extraction and Aggregation for CLIP-Based Class-Incremental Learning

Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

2026-05-28视觉感知

面向无旧数据的CLIP类增量学习,论文指出遗忘不仅来自特征漂移,也来自属性证据的聚合偏向新类。AREA将分类拆为属性提取与聚合:用超球面PGA固定视觉/文本类属性锚点,再以轻量任务专家、残差修正和变分信息瓶颈稳定聚合,推理时用最优传输路由专家。多基准实验报告其持续优于现有SOTA。

Personal Visual Memory from Explicit and Implicit Evidence Figure 1
2026-05-28cs.CV

Personal Visual Memory from Explicit and Implicit Evidence

Viet Nguyen, Thao Nguyen, Vishal M. Patel, Yuheng Li

2026-05-28视觉感知

本文针对长期记忆代理过度依赖文本、将图像粗略转成 caption 而丢失个人化视觉证据的问题,构建了需从历史图像中记住显式实体和推断隐式事实的 VisualMem 基准,并提出结合文本记忆后端与结构化视觉记忆的 VISUALMEM,可暂存并随新证据更新身份、归属等信息。实验显示其在新视觉记忆基准上明显优于 caption-only 和既有记忆系统,同时在文本记忆基准上保持竞争力。

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration Figure 1
2026-05-28cs.CL

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

2026-05-28视觉语言

针对多模态模型生成结果仅靠 True/False 评判过于粗糙、难以定位视觉错误的问题,本文提出 OmniVerifier-M1:用框/点等符号化理由替代文本解释做元验证,并将二元判断奖励与元验证奖励解耦训练。实验显示,符号反馈可用规则奖励减少对额外裁判模型的依赖,解耦策略优于联合奖励;其驱动的 M1-TTS 在区域级自纠错中优于全局多轮编辑。

Ω-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling Figure 1
2026-05-28cs.CV

Ω-QVLA: Robust Quantization for Vision-Language-Action Models via Composite Rotation and Per-step Scaling

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

2026-05-28视觉语言视觉感知安全鲁棒

面向VLA上机部署中语言骨干与扩散动作头同时带来的显存、延迟压力,Ω-QVLA质疑“动作头不能统一低比特量化”的经验判断,提出免训练PTQ:用SVD-Hadamard复合旋转均衡通道能量并扩散异常值,再按DiT去噪步校准激活尺度以处理动态范围漂移。在LIBERO上将Pi 0.5和GR00T N1.5统一压到W4A4仍达98.0%和87.8%成功率,接近或超过FP16,并节省约71%静态内存;真实双臂实验也显示控制未明显崩坏。

Bias Leaves a Gradient Trail: Label-Free Bias Identification via Gradient Probes on Concept Decompositions Figure 1
2026-05-28cs.CV

Bias Leaves a Gradient Trail: Label-Free Bias Identification via Gradient Probes on Concept Decompositions

Thomas Vitry, Kieran Edgeworth, Stefan Wermter, Jae Hee Lee

2026-05-28优化算法

针对已部署视觉分类器常在未知伪相关上“走捷径”、而偏置标签和重训练不可得的问题,论文提出用 NMF 分解中间激活得到类条件概念,再用误分类样本的反向梯度变化给概念打偏置分数:纠正假阴性会增强、纠正假阳性会压制的概念更可能是偏置。该方法在 Colored MNIST、Waterbirds 找回已知偏置,在 CelebA 发现与性别标签不完全一致但影响决策的方向;推理时抑制高分概念使 Waterbirds、CelebA 最差组准确率最高提升 17.9 和 10.4 个百分点。

The Abstraction Gap in Vision-Language Causal Reasoning Figure 1
2026-05-28cs.CL

The Abstraction Gap in Vision-Language Causal Reasoning

Chinh Hoang, Mohammad Rashedul Hasan

2026-05-28视觉语言视觉感知

本文针对VLM在视觉场景中“说得像因果推理”却未必具备结构性理解的问题,提出Text-Only与Chain-Text双探针及Abstraction Gap指标,并构建CAGE覆盖Pearl三层因果层级。结果显示8个开源VLM中7个文本回答流畅但因果链生成很弱,微调4.5万链标注样本仍难弥合差距;少数模型近零差距,说明能力并非架构必然缺失,可能受预训练与对齐方式影响。

Self-Prophetic Decoding to Unlock Visual Search in LVLMs Figure 1
2026-05-28cs.CV

Self-Prophetic Decoding to Unlock Visual Search in LVLMs

Zhendong He, Qiyuan Dai, Guanbin Li, Liang Lin, Sibei Yang

2026-05-28视觉语言

本文关注 LVLM 在高分辨率视觉搜索中的多步推理失稳:视觉搜索后训练会削弱 grounding、OCR、计数等单步能力,长上下文还会累积干扰。作者提出 SeProD,让后训练搜索模型与其后训练前版本自调节,并用基于概率的“预言”采样选择性接收 token,而非简单提示注入。实验显示其在 4 个视觉搜索基准 12 个划分及通用 VQA 上稳定提升,且声称并行接受机制不增加额外计算开销。

SeeGroup: Multi-Layer Depth Estimation of Transparent Surfaces via Self-Determined Grouping Figure 1
2026-05-28cs.CV

SeeGroup: Multi-Layer Depth Estimation of Transparent Surfaces via Self-Determined Grouping

Hongyu Wen, Jia Deng

2026-05-28视觉感知

透明物体会让同一像素同时对应前表面与背后物体,机器人避障、抓取和导航需要多层深度而非只看单层。SeeGroup的关键是放弃预设的前后排序分组,将每条视线上的深度层建模为无序点过程,并用置换不变似然与循环分解模块让模型自定深度图分组。在LayeredDepth上,四元组相对深度准确率由61.34%提升到70.09%,显示其对复杂透明层关系更有效。

Deep Learning Strain Estimation: Is Physics-Based Simulation the Solution? Figure 1
2026-05-28eess.IV

Deep Learning Strain Estimation: Is Physics-Based Simulation the Solution?

Thierry Judge, Nicolas Duchateau, Andreas Østvik, Khuram Faraz, Anders Austlid Taskén, Sigve Karlsen, Thor Edvardsen, Harald Brunvand, Md Abulkalam Azad, Havard Dalen, Bjørnar Grenne, Gabriel Kiss, Pierre-Yves Courand, Lasse Lovstakken, Pierre-Marc Jodoin, Olivier Bernard

2026-05-28视觉感知

论文针对超声心动图中区域心肌应变估计不稳的问题,指出深度学习受限于真实运动标注缺失,而传统物理仿真又与临床视频存在域差。作者将真实视频中的散斑去相关显式注入仿真,并用迭代细化生成1478段带参考运动的光真实数据,训练面向心肌散斑跟踪的TAS-Net。多队列验证显示其在全局与区域应变上优于STE和既有深度方法,GLS专家间变异降至1.42%,低于临床参考的1.78%。

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning Figure 1
2026-05-28cs.CV

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

Yunyang Ge, Xianyi He, Zezhong Zhang, Bin Lin, Bin Zhu, Xinhua Cheng, Li Yuan

2026-05-28视觉感知强化学习

针对视频 Diffusion Transformer 全注意力在长序列下计算和通信成本过高的问题,OSP-Next 将固定模式的 Skiparse-2D 稀疏注意力、面向稀疏模式切换的 SSP 并行、HiF8 量化联合微调与 Mix-GRPO 后训练结合,强调兼容 FlashAttention 且减少通信。实验中 VBench 达 83.73%,超过 Wan2.1;在 H200 上最高约 1.64× 单卡、1.52× 八卡加速,HiF8 版本在 Ascend 上最高 2.27×,质量仅小幅下降。

EntroAD: Structural Entropy-Guided Prompt Adaptation for Zero-Shot Anomaly Detection Figure 1
2026-05-28cs.CV

EntroAD: Structural Entropy-Guided Prompt Adaptation for Zero-Shot Anomaly Detection

Xinyu Zhao, Qingyun Sun, Jiayi Luo, Jianxin Li

2026-05-28视觉感知

针对CLIP零样本异常检测常用单一路径适配、难以同时处理局部结构缺陷与弥散异常的问题,EntroAD用ViT自注意力计算patch级结构熵,将关系不确定性作为路由信号生成异常感知token,并通过置信度感知的双分支提示适配稳定图文对齐。论文在10个工业与医学基准的跨数据集设置中报告达到SOTA,但具体增益来源仍需结合消融进一步判断。

A Multiscale Kinetic Framework for Image Segmentation: From Particle Systems to Continuum Models Figure 1
2026-05-28cs.CV

A Multiscale Kinetic Framework for Image Segmentation: From Particle Systems to Continuum Models

Horacio Tettamanti, Giulia Guicciardi, Mattia Zanella

2026-05-28视觉感知

针对医学等场景标注稀缺、监督分割依赖数据的问题,本文把像素视为带空间位置与颜色特征的相互作用粒子,构建从微观粒子到Fokker–Planck再到一阶宏观方程的多尺度动力学框架,并用共识型粒子优化选择参数。实验显示该降复杂模型在不同噪声类型和强度下能恢复较准确分割掩膜;实际增益可能主要来自scaling与data-oriented优化。

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization Figure 1
2026-05-28cs.CV

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu

2026-05-28视觉感知优化算法

针对扩散式文生图在多物体属性绑定、关系与计数等组合提示上易失配的问题,论文提出 BiDPO:先自动构建含文本/图像偏好对的 BiComp 数据集,再将 Diffusion DPO 扩展为同时优化图像与文本偏好的双模态目标,并用区域级损失聚焦组合概念相关区域。实验显示其在多个组合生成基准上优于既有后训练方法,T2I-CompBench 属性绑定平均提升约 17%、总体较基模提升约 10%,但增益可能部分来自数据构造与筛选规模。

JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models Figure 1
2026-05-28cs.CV

JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models

Jiachen Qian

2026-05-28视觉语言视觉感知

针对取证视觉语言模型不仅会被误判、还可能生成与误判一致解释的部署风险,论文提出 JECA²:通过视觉侧 Grad-CAM 注意力转移与文本侧提示嵌入优化,诱导模型输出“错误但自洽”的真实判断。实验在白盒诊断设置达 87.2% ASR,图像-only 和预测掩码仍有 80.3%/78.6%,但闭源迁移有限,说明结论更偏红队上界压力测试。

Internally Referenced Low-Light Enhancement Figure 1
2026-05-28cs.CV

Internally Referenced Low-Light Enhancement

Peiyuan He, Hainuo Wang, Hengxing Liu, Mingjia Li, Xiaojie Guo

2026-05-28视觉感知

针对零参考低光增强缺少正常光参照、难以分离照明、纹理与放大噪声的问题,IRLE从退化图像内部构造物理与结构参照:用局部曝光模拟伪GT校正亮度和色偏,以感知损失和移位不变频谱相关保持结构,并用照明增益调制盲点去噪。实验显示其在噪声抑制、纹理保真和自然亮度分布上优于现有方法。

Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification Figure 1
2026-05-28cs.CV

Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification

Xiao Wang, Minglei Yang, Bin Yang, Wenke Huang, Zheng Wang, Xin Xu, Mang Ye

2026-05-28视觉感知

这篇论文针对视频中“重要人物”会随事件推进而变化、静态显著性易误判的问题,提出 VIP 识别任务与带理由标注的 Temporal-VIP 数据集,并设计 VIP-Net 融合社交、时空与多模态线索来校正时间重要性偏移。实验中 VIP-Net 准确率达 67.3%,明显高于 37.5%–53.9% 的对比方法,理由生成相似度为 0.63。

Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation Figure 1
2026-05-28cs.CV

Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

Yang Gao, Wuyang Li, Po-Chien Luan, Alexandre Alahi

2026-05-28三维

面向自动驾驶动态占据预测,论文指出弱监督高斯方法多假设刚体运动,难以刻画行人等非刚体目标并保持时序一致。DeGO 用软刚性掩码解耦刚体偏移与非刚体形变,并将 VGGT 的跨相机、跨帧4D特征因子化蒸馏到高斯场中。在 Occ3D-NuScenes 上,其弱监督设置取得 SOTA,整体 mIoU 提升 10.9%,人本实例指标提升 13.5%。

Resolution-free neural surrogates for geometric parameterization and mapping with spatially varying fields Figure 1
2026-05-28cs.CV

Resolution-free neural surrogates for geometric parameterization and mapping with spatially varying fields

Yanwen Huang, Lok Ming Lui, Gary P. T. Choi

2026-05-28视觉感知

针对参数场频繁变化时,传统几何映射需反复求解高分辨率PDE/变分系统而代价高的问题,论文提出无分辨率神经替代模型:用坐标增强的多尺度几何编码,在任意结构或非结构点集上预测映射,并以拟共形、密度均衡等几何约束进行无标签训练。实验覆盖拟共形映射和密度均衡映射,显示可生成相应变形,但量化增益和速度优势文中未充分说明。

GEM: Generative Supervision Helps Embodied Intelligence Figure 1
2026-05-28cs.CV

GEM: Generative Supervision Helps Embodied Intelligence

Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu, Diankun Wu, Zhengyi Wang, Xumin Yu, Yongming Rao, Han Hu, Jun Zhu

2026-05-28视觉感知生成模型

GEM针对具身VLM预训练偏重语义问答、缺少执行所需几何与物理 grounding 的问题,把深度图生成作为预训练中的生成式监督,并用自回归理解模型结合扩散生成模块联合学习,同时发布含深度监督的GEM-4M数据。实验显示其在空间与具身推理基准上取得SOTA,VSI-Bench显著提升;扩展的GEM-VLA在LIBERO达96.1%成功率,真实机器人平均成功率43%。

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving Figure 1
2026-05-28cs.CV

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

2026-05-28视觉感知生成模型强化学习

针对VLM驾驶策略缺少视频动态先验、长时推理缓存代价高的问题,DriveWAM将预训练视频扩散Transformer改造成自回归世界-动作模型,用统一视频/动作时序token和联合flow matching生成未来场景并反推动作,同时以冻结VLM提供分段语义引导、选择性KV记忆支撑长时展开。在NAVSIM和PhysicalAI-AV上取得较强规划表现,4k到100k clips的实验显示性能随数据规模提升,增益可能也主要来自scaling/data。

Janus-LoRA: A Balanced Low-Rank Adaptation for Continual Learning Figure 1
2026-05-28cs.CV

Janus-LoRA: A Balanced Low-Rank Adaptation for Continual Learning

Cheng Chen, Pengpeng Zeng, Yuyu Guo, Lianli Gao, Hengtao Shen, Jingkuan Song

2026-05-28视觉感知

本文针对 LoRA 持续学习中独立更新低秩因子会破坏历史知识子空间正交性、而硬性正交又削弱新任务可塑性的问题,提出 Janus-LoRA:用闭式梯度校正和在线子空间估计约束参数更新,同时以解耦间隔损失拉开新旧特征。实验在 ImageNet-R、CIFAR-100、DomainNet 等基准上报告达到新的 SOTA,说明参数级稳定与特征级分离的联合建模能缓解遗忘。

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing Figure 1
2026-05-28cs.CV

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

2026-05-28生成模型规划控制

面向实时交互中的音频驱动角色/类人控制,论文指出离线音乐到动作模型依赖未来上下文,在线部署时易延迟、失拍并累积误差。DiscoForcing将因果音乐编码器与扩散forcing序列模型结合,并用混合时间调度和历史引导采样在响应性与长程稳定间折中。实验称其在同等因果与低延迟约束下,相比自回归和扩散基线有更稳的长时滚动、更准的音动对齐,并可实时用于头像与类人平台。

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs Figure 1
2026-05-28cs.CV

SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs

Jiawei Li, Ziyi Liu, Weijie Shi, Long Chen, Jiajie Xu, Xiaofang Zhou

2026-05-28视觉语言三维

针对统一3D-LLM常用单指针读出难以处理同类物体干扰和复杂空间关系的问题,论文提出SSR3D-LLM/S3G:让LLM生成非文本的潜在空间推理步骤与记忆 token,再由几何感知评分器逐步重排Mask3D候选,并用训练期指称线索监督这些步骤。实验在ReferIt3D、ScanRefer、Multi3DRef上优于Grounded 3D-LLM、Chat-Scene及QPG基线,同时保留语言任务通路;但仍依赖上游proposal质量和固定步数预算。

SA4Depth: Consistent Pose-Depth Scale Alignment for Self-Supervised Monocular Depth Estimation Figure 1
2026-05-28cs.CV

SA4Depth: Consistent Pose-Depth Scale Alignment for Self-Supervised Monocular Depth Estimation

Changxuan Li, Nadine Berner, Nassir Navab, Federico Tombari, Stefano Gasperini

2026-05-28三维

本文针对自监督单目深度中姿态网络常被忽视、深度与位姿尺度不一致会破坏光度监督的问题,提出 SA4Depth:训练时用预测深度重投影可学习特征,并通过 LM 优化特征对齐残差来细化相对位姿,使 pose-depth 尺度更一致;推理阶段不增加开销。实验在 KITTI、Cityscapes、NYUv2 上提升多种基线的深度精度,并在 KITTI Odometry 上验证位姿改进。

REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection Figure 1
2026-05-28cs.CV

REVEAL: Reference-Grounded Reasoning for Multimodal Manipulation Detection

Jun Zhou, Bingwen Hu, Yaxiong Wang, Zhedong Zheng, Yongzhen Wang, Yuchen Zhang, Ping Liu

2026-05-28机器人视觉语言视觉感知

针对生成式伪造使传统伪迹检测失效、跨域泛化差的问题,REVEAL把图文篡改检测改写为“检索真实参考再对比验证”:构建17万真实新闻图文库,用差异感知融合与任务解耦MoE同时做真伪判断和篡改定位。实验称其在检测与定位上优于现有方法,并可通过更新参考库实现免训练域适应,但部分增益可能来自参考库规模与数据覆盖。

Diffusion Large Language Models for Visual Speech Recognition Figure 1
2026-05-28cs.AI

Diffusion Large Language Models for Visual Speech Recognition

Jeong Hun Yeo, Chae Won Kim, Hyeongseop Rha, Yong Man Ro

2026-05-28视觉感知生成模型

论文针对唇读中视觉线索歧义强、传统自回归解码过早按从左到右提交不确定 token 的问题,提出 DLLM-VSR:用扩散大语言模型把转写建模为迭代掩码去噪,先解出高置信位置并作为双向上下文;同时设计两阶段训练分离内容对齐与长度建模,并用视频时长引导候选长度解码。该方法仅用 LRS3 标注数据取得 19.5% WER,达到该设置下新 SOTA。

BiasEdit: A Training-Free Bias-Detect-and-Edit Framework for Learning Fair Visual Classifiers Figure 1
2026-05-28cs.CV

BiasEdit: A Training-Free Bias-Detect-and-Edit Framework for Learning Fair Visual Classifiers

Jungwook Seo, Yoonsik Park, Changmin Lee, Sungyong Baik

2026-05-28视觉感知

针对 Web 图像数据中目标类别与背景、性别等偏置属性的虚假相关,BiasEdit提出无需训练和人工偏置标注的“检测—编辑”流程:先用视觉语言表示的统计依赖与互信息自动找出未知偏置,再用文本引导图像编辑生成更真实的 bias-conflict 样本以重构训练集。实验称其优于现有去偏基线,并在训练集最高 100% bias-aligned 的极端设置下仍保持鲁棒表现。

Self-Supervised Online Robot-Agnostic Traversability Estimation for Open-World Environments Figure 1
2026-05-28cs.RO

Self-Supervised Online Robot-Agnostic Traversability Estimation for Open-World Environments

Julia Hindel, Simon Bultmann, Houman Masnavi, Daniele Cattaneo, Abhinav Valada

2026-05-28机器人强化学习

面向越野开放环境中地形未知、平台差异和在线适应受限的问题,论文提出 COTRATE:用本体/惯性信号在线学习与机器人形态相对无关的连续可通行性分数,再通过视觉特征对齐损失监督单目模型,并以多样性特征回放缓解遗忘。作者在两类机器人、11种户外地形约5万图像及三类导航场景上验证,结果显示其优于已有自监督可通行性和开放词汇分割基线,同时保持较低存储开销并支持跨平台迁移。

Bayesian Gated Non-Negative Contrastive Learning Figure 1
2026-05-28cs.CV

Bayesian Gated Non-Negative Contrastive Learning

Peng Cui, Jiahao Zhang, Lijie Hu

2026-05-28视觉感知

这篇论文针对对比学习表示维度语义纠缠、难解释的问题,指出非负对比学习在组合场景中会因共享背景特征同时被正样本拉近、负样本推远而产生优化冲突。BayesNCL的核心是在非负表示上加入贝叶斯门控头,以稀疏Bernoulli先验和变分推断动态屏蔽高频无关特征、保留判别语义。实验称其在ImageNet-100上语义一致性较NCL提升142.1%,线性探测精度也略高于SimCLR和NCL。

Anomaly as Non-Conformity via Training-Free Graph Laplacian Energy Minimization Figure 1
2026-05-28cs.CV

Anomaly as Non-Conformity via Training-Free Graph Laplacian Energy Minimization

Jungwook Seo, Minjeong Kim, Younkwan Lee, Seungho Shin, Sungyong Baik

2026-05-28视觉感知

本文针对少样本工业异常检测中过度依赖近邻相似度、容易把局部相似但整体不一致的缺陷判为正常的问题,提出训练自由的 ANoCo:构建查询补丁到正常参考补丁的二部图,锚定正常节点并最小化图拉普拉斯能量,用特征为符合正常流形所需的“漂移量”作为异常分数。实验在 MVTec-AD 与 VisA 少样本设置中提升图像级检测与像素级定位,且无需额外训练。

VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs Figure 1
2026-05-28cs.CV

VITAL: Visual-Semantic Dual Supervision for Enhanced and Interpretable Latent Reasoning in Medical MLLMs

Qiaoru Li, Shaotian Liang, Jintao Chen, Haoran Sun, Yuxiang Cai, Jianwei Yin, Yankai Jiang

2026-05-28视觉感知

针对医学多模态问答中显式 CoT 易丢失细粒度视觉证据且推理开销高、潜在推理又缺乏视觉约束和可解释性的问题,VITAL 在连续隐状态上引入文本链重构与独立医学视觉编码器 ROI 特征回归的双监督,训练时约束语义与视觉证据、推理时移除辅助模块以保持零额外开销,并可事后恢复解释。作者构建 61K、9 模态数据集,在 7 个基准上优于骨干、潜在推理基线和更大数据训练的医学 MLLM,视觉 grounding 也显著提升。

EgoRelight: Egocentric Human Capture and Illumination Recovery for Relightable and Photoreal Avatar Rendering Figure 1
2026-05-28cs.CV

EgoRelight: Egocentric Human Capture and Illumination Recovery for Relightable and Photoreal Avatar Rendering

Jianchun Chen, Yinda Zhang, Rohit Pandey, Thabo Beeler, Marc Habermann, Christian Theobalt

2026-05-28视觉感知

面向MR远程临场中虚拟人难以随真实环境光照融合的问题,EgoRelight用头显自我中心双目深度驱动全身网格,并以光场训练的个体化神经外观模型分离漫反射与高光传输,测试时再由头显观测反演HDR环境光。实验显示其在几何跟踪、渲染与重光照保真度上优于多种SOTA组合,但训练仍依赖多视角光场采集。

Adaptive Temporal Gating of Longitudinal Magnetic Resonance Imaging for Alzheimer's Prediction Figure 1
2026-05-28cs.CV

Adaptive Temporal Gating of Longitudinal Magnetic Resonance Imaging for Alzheimer's Prediction

Alireza Moayedikia, Sara Fin, Alicia Troncoso Lora, Uffe Kock Wiil

2026-05-28视觉感知

针对单次结构 MRI 难以捕捉阿尔茨海默病进展轨迹的问题,论文提出 TAF-Net,用自适应时间门控融合形变、跨时点注意力与双时点特征来预测 MCI 三年内转 AD。在 ADNI 严格受试者级交叉验证中,仅用 MRI 即优于基线并接近多模态方法,且在少量数据下保持较好表现;消融显示纵向门控降低预测方差,注意区域与内侧颞叶和脑室等病理区域一致。

Sketch2Motion: Text-driven 2D Sketch to 3D Animation via Diffusion-guided Skeleton Optimization Figure 1
2026-05-28cs.CV

Sketch2Motion: Text-driven 2D Sketch to 3D Animation via Diffusion-guided Skeleton Optimization

Gaurav Rai, Ojaswa Sharma

2026-05-28生成模型优化算法三维

针对手绘2D草图缺少深度、拓扑不稳定且遮挡导致难以生成可信3D运动的问题,Sketch2Motion将草图膨胀为3D网格后,以骨骼变换和线性蒙皮表示动画,并用文本到视频扩散模型的运动感知SDS直接优化骨骼参数;同时加入平滑、关节范围、接触等物理约束和弹簧-质点二级运动。实验称其在多类角色上生成更连贯、文本对齐的动画,优于缺少生成先验或物理约束的基线。

Bound-Constrained Sparse Representation for Electrical Impedance Tomography Figure 1
2026-05-28cs.CV

Bound-Constrained Sparse Representation for Electrical Impedance Tomography

Chun Zhang, Dong Liu

2026-05-28学习理论

针对 EIT 反问题高度非线性、病态且传统显式正则需调参的问题,论文提出 BC-SR,将电导率由低维潜变量生成,用截断图拉普拉斯基嵌入结构先验,并通过保界非线性映射保证物理可行性,再以阻尼 Gauss-Newton 优化。2D/3D 仿真、水槽实验和在体肺数据表明,该方法在绝对与时差成像中提升结构保真、物理一致性和抗噪鲁棒性,尤其改善 3D 肺部重建的空间连贯性。

Toward Semantic-Agnostic and Shape-Aware Vision-Language Segmentation Models Figure 1
2026-05-28cs.CV

Toward Semantic-Agnostic and Shape-Aware Vision-Language Segmentation Models

Corentin Seutin, Mohamed Amine Ettaki, Michaël Clément, Pierrick Coupé, Rémi Giraud

2026-05-28视觉语言视觉感知

现有视觉语言分割多依赖类别词,遇到“红色八边形物体”等非语义描述时暴露出形状、纹理等低中层视觉推理不足。论文提出 SANSA 任务,并用词典约束与示例引导自动生成去语义提示来微调 LISA。实验显示在该新任务上 mIoU 最高提升约 20%,同时基本保持常规语义提示性能。

Transfer learning RGB models to hyperspectral images with trainable tensor decompositions Figure 1
2026-05-28cs.CV

Transfer learning RGB models to hyperspectral images with trainable tensor decompositions

Mariette Schönfeld, Laurens Devos, Wannes Meert, Hendrik Blockeel

2026-05-28视觉感知

高光谱数据通道数多且样本少,难以直接利用只接受 RGB 输入的 ImageNet 骨干;现有降维或重训首层会分别损失图像信息或预训练滤波器。本文将首层卷积做可训练张量分解,保留空间成分并用高维光谱成分替换 RGB 成分,以少量参数适配不同波段。多种遥感与园艺数据实验显示,该方法较降维和首层重训更准确,并对过拟合更稳健。

Inpainting-Style Conditional Diffusion for Multivariable Time Series Forecasting Figure 1
2026-05-28cs.CV

Inpainting-Style Conditional Diffusion for Multivariable Time Series Forecasting

Kourosh Kiani, S.M. Muyeen

2026-05-28生成模型

面向高渗透光伏并网中太阳能出力受天气扰动、非线性和随机性影响而难以准确预测的问题,论文将多变量时间序列滑窗重排为二维补丁,把未来片段视为待修复区域,利用带掩码条件的 DDPM 在保留历史观测的同时生成未来序列,并用零填充适配 U-Net。GEFCom2014 等实验显示其短期预测精度较好,但相对增益的具体来源仍需更多消融支撑。

EventShiftFlow: Towards Hardware-efficient FPGA-based Flow Estimation Figure 1
2026-05-28cs.RO

EventShiftFlow: Towards Hardware-efficient FPGA-based Flow Estimation

Arianna Alonso Bizzi, Fernando Cladera, C. J. Taylor

2026-05-28生成模型

面向事件相机在微型机器人上低时延、低功耗运动感知的硬件瓶颈,EventShiftFlow放弃高精度稠密光流,采用时间分箱、1-bit占据网格和离散速度假设并行计数匹配,只用移位寄存器、计数器和比较器实现流式估计。实验显示其在合成数据上可恢复方向和幅值,在真实序列四段运动中方向准确率达99.5%,两轴状态存储低于13 kbit,但多物体交叉和速度量化仍限制幅值精度。

EchoAvatar: Real-time Generative Avatar Animation from Audio Streams Figure 1
2026-05-28cs.CV

EchoAvatar: Real-time Generative Avatar Animation from Audio Streams

Bohong Chen, Yumeng Li, Yinglin Xu, Youyi Zheng, Yanlin Weng, Kun Zhou

2026-05-28生成模型

面向语音助手/虚拟人实时交互中离线生成延迟高、语音与音乐需分域建模的问题,EchoAvatar提出统一流式音频驱动全身动画框架:用注意力式因果运动 tokenizer 支持自回归低延迟生成,并通过分层 token corruption 强化音频依赖,另探索 GRPO/DPO 与工具调用控制。实验显示其在运动质量和音画同步上优于实时基线,适合接入在线语音代理。

LV-OSD: Language-Vision-Complementary Open-Set Object Detection Figure 1
2026-05-28cs.CV

LV-OSD: Language-Vision-Complementary Open-Set Object Detection

Yupeng Zhang, Ruize Han, Wei Feng, Song Wang, Liang Wan

2026-05-28视觉感知

针对开放集检测过度依赖统一文本提示、难处理同名歧义与缺少类别名/样例等真实场景问题,论文提出LV-OSD任务与LVDor框架,允许类别以文本、图像或混合提示任意指定;通过LLM生成多文本、CLIP提取图像提示,并用目标引导动态加权与随机提示遮蔽适配异构提示。实验称验证了设定合理性和方法有效性,但具体增益幅度在片段中未充分说明。

Every9D-21M: Large-Scale Real-World 9D Canonicalization of Everyday Objects Figure 1
2026-05-28cs.CV

Every9D-21M: Large-Scale Real-World 9D Canonicalization of Everyday Objects

Leonhard Sommer, Emil Akopyan, Adam Kortylewski

2026-05-28强化学习

针对单图估计日常物体9D姿态缺少大规模真实监督、合成数据难泛化的问题,论文提出Every9D-21M:用物体中心视频做多视角重建,将少量人工标注的参考物体通过跨实例几何/外观对齐传播到700类、2180万张真实图像,并加入跨类别对称规则评测。实验显示,用该数据训练可提升ImageNet3D、PASCAL3D+表现,并比仅用ImageNet3D更好泛化到HANDAL,增益可能主要来自scaling/data。

MORI-Seg: Learning Morphological Geometry for Instance Segmentation without Instance Annotations Figure 1
2026-05-28cs.CV

MORI-Seg: Learning Morphological Geometry for Instance Segmentation without Instance Annotations

Leiyue Zhao, Tianyu Shi, Daniel Reisenbuchler, Xinzi He, Junchao Zhu, Tianyuan Yao, Yuechen Yang, Yanfan Zhu, Junlin Guo, Gelei Xu, Haichun Yang, Yuankai Huo, Mert R. Sabuncu, Yihe Yang, Ruining Deng

2026-05-28视觉感知

肾脏病理数据多只有语义掩码,粘连结构被合并,难以做实例级形态计量;MORI-Seg在无需实例标注的条件下,从语义掩码学习面向形态的几何先验,联合对象中心距离场、边界带表示和类别条件特征解耦来拆分连通区域。实验显示其相较传统后处理和已有语义到实例方法提升实例分离精度,并带来更可靠的形态定量。

GUI Agents for Continual Game Generation Figure 1
2026-05-28cs.SE

GUI Agents for Continual Game Generation

Yixu Huang, Bo Li, Na Li, Zhe Wang, Kaijie Chen, Haonan Ge, Qingyi Si, Yuanzhe Shen, Ruihan Yang, Guangjing Wang, Hongcheng Guo

2026-05-28视觉感知

论文指出,游戏生成的质量不在代码是否可运行,而在真实交互中是否可玩,静态检查和一次性生成会漏掉输入、渲染与胜负条件等问题。作者引入 PlaytestArena,用 GUI Agent 通过浏览器游玩并按行为 rubric 评估 200 个网页游戏任务;同时提出 Play2Code,让生成代理与游玩代理在共享记忆中循环改进。实验中 Play2Code 达到 66.8% rubric 通过率,较单次生成和代理式编码基线分别提升 37.1 和 14.6 个百分点。

Category-Level 3D Correspondence in Camera Space via Morphable Object Priors Figure 1
2026-05-28cs.CV

Category-Level 3D Correspondence in Camera Space via Morphable Object Priors

Leonhard Sommer, Artur Jesslen, Basavaraj Sunagad, Adam Kortylewski

2026-05-28三维

针对现有类别级位姿/重建表示难以表达物体部件功能语义、且2D匹配受视角和遮挡影响的问题,论文提出相机坐标系中的单目类别级3D对应任务,并构建含遮挡非模态标注与对称性的HouseCorr3D基准。其Morpheus通过共享可变形类别形状先验,解耦规范形状、形变与位姿,在无显式对应监督下产生语义一致3D关键点,并在该基准上显著优于已有基线、达到新SOTA。

PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment Figure 1
2026-05-28cs.CV

PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment

Duanchu Wang, Cheng Li, Junjie Yang, Jing Huang, Zihang Cheng, Zhi Gao, ZhuBohong, Di Wang

2026-05-28数据集/基准三维

现有点云质量评估多停留在 MOS 分数,难以回答缺陷类型、可用性和证据解释。PointQ-Bench 将真实扫描、模拟失真与 AI 生成点云统一到 3083 样本、8 类问题和问答/描述标注中,并提出 SSFRQ-5D 评估开放报告。实验显示,14 类模型普遍能粗略感知异常,但在有依据的诊断与质量校准上明显不足,强 2D MLLM 反而常优于现有 3D VLM。

Learning to Label: A Reinforced Self-Evolving Framework for Semi-supervised Referring Expression Segmentation Figure 1
2026-05-28cs.CV

Learning to Label: A Reinforced Self-Evolving Framework for Semi-supervised Referring Expression Segmentation

Runlong Cao, Ying Zang, Chuanwei Zhou, Tianrun Chen, Tong Zhang, Zhen Cui, Chunyan Xu

2026-05-28视觉感知

针对半监督指代表达分割中像素标注昂贵、未标注图文对伪标签易受歧义和遮挡污染的问题,L2L 将伪标签构造建模为可学习决策过程:用冻结 MLLM 提供语义-空间先验并结合 SAM2 生成软掩码,再通过强化式样本自适应选择平衡精度与覆盖率。实验显示其在 RefCOCO/+/g、0.1% 到 10% 标注率下均优于既有半监督方法,低标注场景仍保持较强鲁棒性。

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation Figure 1
2026-05-28cs.RO

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation

Ruiyan Gong, Meisheng Zhang, Yuxiang Zhao, Mingchao Sun, Yanfen Shen, Zedong Chu, Zhining Gu, Wei Guo, Xiaolong Cheng, Qiming Li, Kangning Niu, Yanqing Zhu, Xiaolong Wu, Tianlun Li, Mu Xu

2026-05-28机器人视觉语言视觉感知强化学习数据集/基准

本文关注真实视觉语言导航中到达 POI 入口的“最后几米”难题,指出现有基准粒度粗或依赖合成场景,难以闭环评估。作者构建了基于真实商业街区 3DGS 重建并接入 Isaac Sim 的 POINav-Bench,覆盖 11 个区域、163 个 POI,并提出将 POI 标识定位与入口回归解耦的 Brain-Action 框架及 70K 标识-入口数据集。实验表明该框架能改善精细 POI 到达评估与执行,但具体性能增益幅度文中片段未充分说明。

Bridging the Sampling Distribution Shift in Radio Map Estimation: A Trajectory-Aware Paradigm Figure 1
2026-05-28cs.CV

Bridging the Sampling Distribution Shift in Radio Map Estimation: A Trajectory-Aware Paradigm

Feng Qiu, Zheng Fang, Shuhang Zhang, Kangjun Liu, Longkun Zou, Jing Liu, Ke Chen

2026-05-28规划控制

论文关注无线电地图估计中训练随机采样与真实 UAV/车辆沿轨迹采样不一致的问题,指出轨迹采样会带来空间相关和信息冗余,削弱模型泛化。作者提出 ST-TBS 训练范式,在保持轨迹连续性的同时引入随机触发变化以对齐部署分布;在 RadioMapSeer 与 SpectrumNet 上验证,随机采样训练在轨迹观测下 RMSE 可由 0.0391 升至 0.2632,而 ST-TBS 降至 0.0571。

Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation Figure 1
2026-05-28cs.CV

Proprio: Latent Self-Scoring and Inference-Time Refinement for Physically Plausible Video Generation

Mariam Hassan, Kaouther Messaoud, Wuyang Li, Alexandre Alahi

2026-05-28视觉感知

视频生成模型虽画质强,却常违背物理常识,影响其作为机器人规划与仿真的世界模型。Proprio 的核心洞察是冻结生成器自身的去噪残差可作为“本体感受式”物理自评分数,并在推理时用于 best-of-N 选择或仅优化初始噪声的自我细化。实验在 T2V/I2V 物理基准上优于 VLM 打分和部分外部世界模型,TurboWan2.2 的 Physics-IQ 从 32.2 提至 37.5,VideoPhy2-hard 从 45.6 提至 55.0。

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer Figure 1
2026-05-28cs.CV

VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer

Rui Lin, Chuanming Wang, Huadong Ma

2026-05-28视觉感知

这篇工作针对图像预训练 VLM 迁移到视频时缺乏时间建模、传统 MoE 专家同质化的问题,提出 VidPrism:用内容感知多速率采样为不同专家提供偏语义或偏运动的输入,并通过双向融合协调空间与时间路径。实验称其在多项视频识别基准达到 SOTA,消融显示四专家、多速率输入、双向交互和全局注意力融合带来主要增益。

A Patient-Specific Pulmonary Arterial Tree Digital Twin to Extract Pulmonary Embolism Biomarkers Figure 1
2026-05-28cs.CV

A Patient-Specific Pulmonary Arterial Tree Digital Twin to Extract Pulmonary Embolism Biomarkers

Morgane des Ligneris, Nathan Painchaud, Allan Serva, Laurent Bertoletti, Pierre Croisille, Carole Frindel, Odyssée Merveille

2026-05-28视觉感知

面向急诊肺栓塞风险分层中血液指标缺失、Qanadli/Mastora 等负荷评分人工计算耗时的问题,论文从 CTPA 分割结果构建患者特异的肺动脉树有向图数字孪生,自动标注层级、肺叶与血栓位置,并提取局部阻塞和全局评分/体积分布等影像生物标志物。验证显示其解剖结构与人工严重度评分具有较强一致性,可快速量化血栓负荷与空间分布。

From Kellgren-Lawrence to Calcium Pyrophosphate Crystal Deposition: A Soft-Labelling Framework for Knee Osteoarthritis Assessmen Figure 1
2026-05-28cs.CV

From Kellgren-Lawrence to Calcium Pyrophosphate Crystal Deposition: A Soft-Labelling Framework for Knee Osteoarthritis Assessmen

Francisco Bérchez-Moreno, Riccardo Rosati, Maria Chiara Fiorentino, Víctor M. Vargas, Edoardo Cipolletta, Emilio Filippucci, Luca Romeo, Pedro A. Gutiérrez, César Hervás-Martínez

2026-05-28视觉感知

针对膝骨关节炎X光分级中KL与CPPD评分具有有序性、邻近等级不确定性且二者关系不对称的问题,论文用单峰软标签替代one-hot,并比较二项、Beta、三角和指数分布来监督两个任务。在2172张膝X光(968张双标注)上,所有软标签均优于名义基线;CPPD以三角分布QWK/MAE最佳,KL以Beta分布最佳,且相对one-hot改进显著(p<0.001)。

No Figure
2026-05-28cs.CV

FLORO: A Multimodal Geospatial Foundation Model for Ecological Remote Sensing Across Sensors and Scales

Jorge L. Rodriguez, Victor Angulo Morales, Areej Alwahas, Mariana Elias Lara, Fida Mohammad Thoker, Kasper Johansen, Bernard Ghanem, Fernando T. Maestre, Matthew F. McCabe

2026-05-28视觉语言

生态遥感常面临传感器、尺度和模态不一致,且标注稀缺,现有基础模型多依赖超大数据和固定输入。FLORO用较小但异质的Sentinel、SkySAT、高程与UAV数据做掩码自编码预训练,并通过可用性感知输入兼容缺失模态。PANGAEA冻结评测显示其在分类、分割和回归上迁移稳定,分割平均第二,说明数据多样性可部分替代单纯scaling。

MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation Figure 1
2026-05-28cs.CV

MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation

Muyao Wang, Zeke Xie, Yanhao Chen, Lixin Xiu, Hideki Nakayama

2026-05-28生成模型规划控制

针对长篇漫画生成中直接整页合成难以控制分镜布局、角色/场景跨格一致性和文字放置的问题,MangaFlow将故事到漫画拆成规划、角色场景 grounding、显式布局、参考条件渲染、合成与 lettering 等可编辑中间步骤,并用 story section memory 复用人物、场景和物体参考。文中还提出 MangaGen-MetaBench;实验显示其相比直接生成基线在布局遵循和跨面板一致性上更好,同时支持人工精细控制。

DebFilter: Eradicating Biases Stashed in Value Figure 1
2026-05-28cs.CV

DebFilter: Eradicating Biases Stashed in Value

Seung Hyuk Lee, Songkuk Kim

2026-05-28视觉感知

本文关注文本到图像扩散模型中由 CLIP 文本嵌入和不均衡训练数据带来的性别、年龄等社会偏见,尤其是中性职业提示会被引向刻板输出。DebFilter 的核心洞察是去噪误差受跨注意力 value 语义引导影响,可在推理时对指导嵌入切片加入固定偏移来重定向得分景观,无需微调或额外数据。实验显示其能降低多类偏见并保持语义一致性和图像质量,还支持多对象场景中的局部控制。

MeniOmni: A Structured Multimodal Benchmark for Holistic Meniscus Injury Assessment Figure 1
2026-05-28cs.CV

MeniOmni: A Structured Multimodal Benchmark for Holistic Meniscus Injury Assessment

Shurui Xu, Siqi Yang, Weiping Ding, Hui Wang, Mengzhen Fan, Yuyu Sun, Shuyan Li

2026-05-28视觉语言数据集/基准

针对膝关节 MRI 基准多为单模态、粗标签且难评估临床推理的问题,MeniOmni 构建了 746 例多中心半月板数据,联合三平面体数据、年龄/性别/BMI 等临床先验与专家报告,支持 Stoller 细粒度分级和报告生成,并引入风险感知序数评价与 Meni-Score。基线显示加入临床先验可提升分级表现并减少严重误判,说明多模态上下文对更安全的半月板损伤评估有实际价值。

Intra-YOLO: A Small Object Detection Model for Caries and Molar-Incisor Hypomineralization in Intraoral Photography Based on Transfer Learning with Reinforcement Learning Figure 1
2026-05-28cs.CV

Intra-YOLO: A Small Object Detection Model for Caries and Molar-Incisor Hypomineralization in Intraoral Photography Based on Transfer Learning with Reinforcement Learning

Po-Lun Chwang, Po-Yu Chang, Wen-Liang Lin, Tung-Sheng Wu, Min-Ching Wang, Yun-Chien Cheng

2026-05-28视觉感知强化学习

针对口内照片中龋齿与磨牙-切牙低矿化外观相似、病灶极小且受光照/唾液干扰导致诊断不一致的问题,论文提出基于 YOLOX 的 Intra-YOLO,通过增强特征金字塔、注意力、切片推理,以及裁剪图教师到全图学生的蒸馏,并用强化学习选择更有价值的伪框。临床数据上达到 mAP 23.1、mAP50 47.8,优于对比检测器,但总体精度仍偏低。

A novel ordinal multi-view aggregation scheme for oak defoliation Figure 1
2026-05-28cs.CV

A novel ordinal multi-view aggregation scheme for oak defoliation

Francisco Bérchez-Moreno, Ricardo Enrique Hernández-Lambraño, David Guijo-Rubio, Víctor Manuel Vargas, Francisco José Ruiz-Gómez, Juan Carlos Fernández, Pablo González-Moreno

2026-05-28视觉感知

针对传统橡树失叶率人工评估耗时、主观且难以规模化的问题,论文将地面图像的失叶等级建模为有序分类,并提出由北向、南向和树冠视角 CNN 预测组成的同质多视角聚合框架。实验表明,有序方法在 QWK、AMAE 等顺序敏感指标上优于普通名义分类,三视角集成相比单视角和双视角更稳健、整体表现最佳。

No Safe Dose: How Training Data Drives Unsafe Image Generation Figure 1
2026-05-28cs.CV

No Safe Dose: How Training Data Drives Unsafe Image Generation

Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

2026-05-28视觉感知安全鲁棒

针对文生图模型训练语料中不可避免的有害内容,本文用固定架构在不同污染比例与数据规模上做受控训练,隔离数据成分对安全性的影响。结果显示,不安全输出随有害样本比例单调上升,关键变量是比例而非绝对数量;即使零污染仍有16.6%安全下限,SafeCLIP可降至9.6%。过滤几乎不损害FID、CLIPscore和ImageReward,说明数据清洗与文本编码器安全化需配合使用。

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving Figure 1
2026-05-28cs.CV

SAM-Enhanced Segmentation on Road Datasets: Balancing Critical Classes in Autonomous Driving

Toomas Tahves, Mauro Bellone, Junyi Gu, Raivo Sell

2026-05-28视觉感知数据集/基准

针对自动驾驶多模态数据集常缺少像素级标注、且行人/骑行者/标志等关键类别极度稀缺的问题,本文将 ZOD 的检测框经筛选、去重后输入 SAM 生成稠密掩码,并人工整理 2300 帧基准,比较 CLFT 与 DeepLabV3+及稀有类专用模型。结果显示 CLFT-Hybrid 在 ZOD 上最高达 48.1% mIoU,在 Iseauto 上达 77.5% mIoU;但小目标和恶劣天气下的 SAM 标注误差仍是限制。

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models Figure 1
2026-05-28cs.CV

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

2026-05-28视觉语言视觉感知

面向机器人与具身智能中的空间理解需求,论文追问 VLM 与视频生成模型哪类预训练更适合作为空间表征骨干。作者冻结模型、用统一轻量探针比较语义标注、实例分组和 3D 几何预测,尽量隔离下游策略与微调干扰。结果显示 VLM 更擅长语义和实例,VGM 更利于深度、点图和相机运动,简单特征融合即可兼顾两者优势。

CLEAR-NeRF: Collinearity and Local-region Enhanced Accurate 3D Reconstruction in Unbounded Scenes Figure 1
2026-05-28cs.CV

CLEAR-NeRF: Collinearity and Local-region Enhanced Accurate 3D Reconstruction in Unbounded Scenes

Vladislav Polianskii, Elijs Dima, Isabel Salmerón Marazuela, Gergő László Nagy, Sigurdur Sverrisson, Volodya Grancharov

2026-05-28学习理论三维

CLEAR-NeRF针对无人机图像在无界复杂场景中做高精度三维重建时,NeRF易受光照、位姿误差和关注区域不均影响的问题,提出自动局部ROI重建、共线性约束射线采样、深度局部邻域点云提取及几何相关颜色聚合,以提升表面平滑度、抑制伪影并稳定着色。作者在城市场景中以地面LiDAR作真值评测,报告其相较基线NeRF和传统SfM-MVS取得更好的度量精度与重建质量。

ST-ColoNet: Spatio-Temporal Colon Segment Recognition via Hybrid Attention and Edge-Guided Feature Learning Figure 1
2026-05-28cs.CV

ST-ColoNet: Spatio-Temporal Colon Segment Recognition via Hybrid Attention and Edge-Guided Feature Learning

Ziyi Wang, Zhengjie Zhang, Jingsheng Gao, Dahong Qian, Suncheng Xiang

2026-05-28视觉感知

针对结肠镜视频中相邻肠段外观相似、既有方法多按单帧分类且缺少公开视频数据的问题,ST-ColoNet同时利用微观皱襞边缘与宏观时序顺序:ColoHaus以边缘分支和度量学习强化空间特征,Full-Temp用三种注意力模式近似长序列全注意力,并发布ColoSeg数据集。实验在肠段识别上达到81.0%准确率和70.7% F1,优于对比方法,但边缘误检和计算冗余仍被指出。

Revisiting Change Detection Methods for their Application to Serac Fall Time-Lapse Monitoring Figure 1
2026-05-28cs.CV

Revisiting Change Detection Methods for their Application to Serac Fall Time-Lapse Monitoring

Arthur Dérédel, Carlos Crispim-Junior, Pierre Lemaire, Johan Berthet, Laure Tougne Rodet

2026-05-28视觉感知

面向冰塔崩塌等斜坡灾害的低成本时序相机监测,论文指出传统图像相关受雾、光照和形变影响明显,深度监督方法又受稀有事件与标注不均衡限制。作者定义“体积变化检测”子任务,并发布含多站点冰川时序与崩塌标注的 SeracFallDet 基准。实验显示,未专门训练的稠密/半稠密特征匹配泛化更稳,而监督变化检测表现受数据稀缺制约,提示未来更可能依赖匹配与学习结合的混合方案。

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation Figure 1
2026-05-28cs.CV

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yuxiang Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, Hongzhu Shi, Yi Wang, Bing Zhao, Hu Wei, Lin Qu, Chenfei Wu

2026-05-28视觉感知数据集/基准

这篇论文针对现有文生图评测在基础对齐指标上趋于饱和、难以反映专业创作需求的问题,提出 Qwen-Image-Bench:以创作者工作流构建质量、美学、图文对齐、真实世界忠实度和创意生成五层面 taxonomy,配套 1000 个双语提示与由艺术专业标注监督的 Q-Judger。实验称其能更清晰地区分前沿模型,尤其在真实世界忠实度和创意生成维度上提供更有诊断性的优化信号。

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking Figure 1
2026-05-28cs.CV

VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking

Jiyuan Fu, Kaixun Jiang, Jingkai Jia, Zhaoyu Chen, Xueyao Chen, Lingyi Hong, Shuyong Gao, Chenzhi Tan, Dingkang Yang, Wenqiang Zhang

2026-05-28视觉语言视觉感知

针对现有 VLA 对抗贴片易过拟合特定动作头、跨架构迁移差的问题,论文提出从“视觉本体感知”入手:VLA 规划前需先在图像中定位自身机械臂。VLA-Hijack 通过抑制真实机械臂特征并注入贴片作为“幻影身体”,劫持自定位过程。在 OpenVLA、UniVLA、CronusVLA 等 12 个受害模型上,平均失败率达 63.68%,较既有 SOTA 绝对提升约 42.66–45.41 个百分点。

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning Figure 1
2026-05-28cs.CV

CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning

He Feng, Yongjia Ma, Donglin Di, Lei Fan, Tonghua Su

2026-05-28规划控制

本文针对肖像动画中眼部细微动作难以由高层语义直接控制的问题,提出 CogPortrait:先用三个 CoT MLLM 代理将情绪/认知状态规划、检索并约束为面部关键点,再由 DiT 视频扩散模型结合动态 CFG 与 KTO 处理眼区和长尾姿态。作者还构建 EMH 基准及 AU 级指标,实验显示其在眼区控制精度、视觉质量和身份一致性上优于多类基线。

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models Figure 1
2026-05-28cs.CV

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

Landi He, Mingde Yao, Shawn Young, Lijian Xu

2026-05-28视觉语言视觉感知优化算法

针对视觉语言模型中大量视觉 token 导致预填充开销高、而现有 Gumbel-Softmax/STE 剪枝存在前向离散选择与反向替代梯度不一致的问题,论文提出 DiffPrune:训练时用 Soft Top-K 与方差保持噪声“信息节流”连续调制 token,推理时再硬阈值删除。实验显示其梯度方向一致性最高提升 28.4 倍,在 10 个 VLM 基准保留 96.5% 精度,同时 LLM prefill 加速 2.85 倍、额外开销 0.69ms。

Stay Fair! Ensuring Group Fairness in Diffusion Models Across Guidance Scales Figure 1
2026-05-28cs.CV

Stay Fair! Ensuring Group Fairness in Diffusion Models Across Guidance Scales

Myeongsoo Kim, Eunji Kim, Minwoo Chae, Sangwoo Mo

2026-05-28生成模型

本文关注扩散模型中被忽视的公平性问题:用户调节 guidance scale 以权衡对齐与多样性时,既有去偏方法常在非固定尺度下失效。作者将总偏差分解为静态模型偏差与随尺度增长的 guidance 偏差,并提出 StayFair:在分类器指导中约束各群体输出分布,在无分类器指导中自适应平移 null embedding。实验显示其在 CelebA、职业提示的 SD1.5/SD3 及已有去偏模型上均能稳定群体比例,同时基本保持图像质量。

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning Figure 1
2026-05-28cs.CV

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

2026-05-28视觉语言强化学习

这篇论文针对视觉描述中遗漏与幻觉难以被现有RL奖励细粒度约束的问题,提出VCap奖励:把参考描述视为随机“见证者”、视觉输入作为“裁判”,用超几何形式同时刻画完整性与正确性,从而允许弱参考引导更强模型。实验中,VCap训练的8B模型在多项图像和视频描述基准上超过多个开闭源SOTA,人评也显示其事实一致性更好。

Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking Figure 1
2026-05-28cs.CV

Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking

Hongtao Yang, Bineng Zhong, Qihua Liang, Yaozong Zheng, Xiantao Hu, Yuanliang Xue, Shuxiang Song

2026-05-28视觉感知

面向无人机实时跟踪中轻量化 Transformer 容易削弱目标表征、在遮挡和快速运动下漂移的问题,EATrack 用非对称学生骨干配合教师引导的双分支蒸馏:特征层聚焦目标区域,预测层对齐定位分布,并加入细粒度目标感知与时序适应模块。实验覆盖五个 UAV 基准,显示其在保持较高推理速度的同时取得有竞争力的精度。

Enhancing Ultra-low-field MRI with Segmentation-guided Adversarial Learning Figure 1
2026-05-28cs.CV

Enhancing Ultra-low-field MRI with Segmentation-guided Adversarial Learning

James Grover, Andrew Phair, Michael Ferraro, David E.J. Waddington

2026-05-28视觉感知

针对64 mT便携超低场MRI信噪比低、对比度差而限制诊断的问题,论文将脑组织分割作为解剖先验:用仅由挑战数据生成标签训练的Swin UNETR输出组织logits,再条件化CycleGAN与T-REX两个增强模型并加权融合,合成接近3T风格的多对比度脑MRI。实验称结果在定量和视觉上可与高场扫描接近,但具体增益与各模块贡献文中未充分说明。

Automated Estimation of Impact Time, Impact Location, and Shuttlecock Speed in Badminton Smashes Using Event Cameras Figure 1
2026-05-28cs.CV

Automated Estimation of Impact Time, Impact Location, and Shuttlecock Speed in Badminton Smashes Using Event Cameras

Yudai Washida, Yuto Kase, Kai Ishibe, Ryoma Yasuda, Sakiko Hashimoto

2026-05-28视觉感知

针对羽毛球杀球触拍持续仅约毫秒、传统高速相机/动捕在数据量、时序分辨率和准备成本间取舍的问题,论文用两台同步事件相机在同一试次内自动联估触拍时刻、拍面落点和出球速度:由事件率定位挥拍区间、侧视轨迹拐点定时、后视椭圆拟合定落点。125次试验中可分析124次,时间和速度全估计,落点成功率93.5%,相对高速相机偏差约1.84 ms、数毫米和−1.00 m/s,未见比例偏差。

Geometry-Correct Diffusion Posterior Sampling with Denoiser-Pullback Curvature Guidance and Manifold-Aligned Damping Figure 1
2026-05-28cs.LG

Geometry-Correct Diffusion Posterior Sampling with Denoiser-Pullback Curvature Guidance and Manifold-Aligned Damping

Seunghyeok Shin, Minwoo Kim, Dabin Kim, Hongki Lim

2026-05-28生成模型

本文针对扩散后验采样中数据一致性更新依赖手调标量 guidance、在各向异性曲率和噪声坐标错配下易失稳的问题,提出 CLAMP:在扩散状态坐标中通过去噪器 pullback 构造阻尼 Gauss–Newton 校正,并用与去噪残差对齐的秩一阻尼和保方差 Langevin 传播控制步长。实验显示其在 FFHQ/ImageNet 多类逆问题上保持有竞争力的 PSNR/SSIM/LPIPS 且通常更快,在加速 MRI 上取得对比方法中最佳 PSNR/SSIM。

ABot-OCR Technical Report Figure 1
2026-05-28cs.CV

ABot-OCR Technical Report

Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng, Kangning Niu, Tianlun Li, Mu Xu

2026-05-28视觉感知

面向复杂版面、表格和公式使传统流水线 OCR 易碎的问题,ABot-OCR 将整页图像一次性转为规范 Markdown。其核心在于数据引擎筛查/伪标注高一致性样本,并用三阶段训练与 DHDO 结构约束强化学习同时优化识别准确性和标记合法性。实验显示其在 OmniDocBench v1.5/v1.6 端到端系统中达到 92.81/93.30,并在十种语言上验证泛化能力。

Bridging the Generalization Gap in Adverse Weather Segmentation: A Training Recipe Perspective Figure 1
2026-05-28cs.CV

Bridging the Generalization Gap in Adverse Weather Segmentation: A Training Recipe Perspective

Cong Xu, Pu Luo, Yumei Li, Boyou Xue

2026-05-28视觉感知学习理论

面向自动驾驶等机器人视觉在雨污模糊、黑暗、雪、雾和眩光下语义分割易失效的问题,论文指出瓶颈不是验证集精度而是验证到测试的泛化落差。作者基于 SegMAN-S 设计训练配方:领域自适应初始化、轻量特征重校准、场景均衡采样和按测试分布合成退化增强。最终在 UG2+ 官方测试集达 59.9% mIoU,验证-测试差距降至 6.5 点,优于更大模型的稳定性。

Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning Figure 1
2026-05-28cs.CV

Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning

Xuanzhao Dong, Wenhui Zhu, Peijie Qiu, Xiwen Chen, Xiaobing Yu, Xin Li, Zhipeng Wang, Shao Tang, Gen Li, Yujian Xiong, Hao Wang, Yanxi Chen, Prayag Tiwari, Yalin Wang

2026-05-28视觉语言强化学习

针对多模态大模型在目标密集、背景杂乱场景中易漏看细节且依赖人工框提示的问题,Mags-RL把视觉推理改成两轮“先看全局、再放大核查”:模型自主选取关注区域,调用超分辨率裁剪放大,再修正答案,并用GRPO、格式与准确性奖励及课程学习以少量样本训练。实验在VSR、TallyQA、GQA子集上优于近期基线,显示细粒度视觉接地和复杂场景推理有所提升。

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning Figure 1
2026-05-28cs.CV

ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning

Guannan Lv, Ren Nie, Hongjian Dou

2026-05-28视觉感知

针对多图具身/视觉推理中RoI裁剪式证据注入容易丢失全局场景与物体关系、且解码成本随区域增长的问题,ROVER在每次目标定位后插入固定长度的Link/Sift/Weave三元令牌,用对象中心差分注意力和视觉工作空间路由跨物体、跨图像证据。接入Qwen2.5-VL-7B并经SFT到GRPO训练后,在MM-GCoT和VideoEspresso上分别取得答案/定位精度显著提升,并在多类基准上平均优于基座模型4.7%。

Con-DSO: Learning Short-Horizon Consistency Priors for RGB-D Direct Sparse Odometry Figure 1
2026-05-28cs.CV

Con-DSO: Learning Short-Horizon Consistency Priors for RGB-D Direct Sparse Odometry

Haolan Zhang, Thanh Nguyen Canh, Chenghao Li, Ziyan Gao, Xiongwen Jiang, Nak Young Chong

2026-05-28视觉感知

针对 RGB-D 直接视觉里程计在动态物体、遮挡、光照变化和深度噪声下短时光度/几何一致性失效的问题,Con-DSO 学习相邻帧的像素级光度与深度几何不确定性,并转化为关键帧质量先验,用于可靠像素选择和解耦残差加权。其网络仅用 TartanAir 训练,在五个 RGB-D 基准上相对直接法显著降低 ATE,部分动态与真实场景序列降幅达 50%–80%。

Evaluating the Feasibility of Inferring Dietary Behavior Change Receptivity from Egocentric Images of Eating Environment Figure 1
2026-05-28cs.CV

Evaluating the Feasibility of Inferring Dietary Behavior Change Receptivity from Egocentric Images of Eating Environment

Long Li, Yuning Huang, Heather A. Eicher-Miller, J.Graham Thomas, Fengqing Zhu, Edward Sazonov

2026-05-28视觉感知

针对饮食干预中“何时用户愿意改变行为”仍依赖稀疏自报的问题,本文用AIM-2可穿戴第一视角进食图像探索被动推断饮食行为改变接受度。核心思路是将进食片段建模为事件级序列,用预训练CLIP提取语义视觉特征,再由轻量Transformer捕捉时序线索,预测注意、交互能力和动机等自报指标。初步实验相较简单基线有改善,说明进食环境图像可能含有相关信号,但仍属小规模试点,泛化性和增益来源有待更大数据验证。

SEMAGIC: Learning Semantically Consistent Deformable 3D Representations from In-the-Wild Images Figure 1
2026-05-28cs.CV

SEMAGIC: Learning Semantically Consistent Deformable 3D Representations from In-the-Wild Images

Sky Cen, Wufei Ma, Guofeng Zhang, Alan Yuille, Adam Kortylewski

2026-05-28视觉感知三维

SEMAGIC针对现有单视角野外图像可变形3D重建虽几何逼真、但同一模板顶点跨实例语义漂移的问题,将重建视为发现类别级对应关系。方法用类别规范网格和图像条件形变场,并通过顶点索引条件形变与特征一致性损失约束语义对齐,辅以深度和姿态监督稳定几何。在SPair-71k上相较MagicPony的PCK@0.1从37.4提升到52.1,增益14.7,表明其更适合语义对应而非仅做重建。

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness? Figure 1
2026-05-28cs.CV

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

2026-05-28视觉语言视觉感知安全鲁棒

本文关注视觉语言模型从直接回答转向“边看图边思考”后,推理流程本身如何影响多模态越狱鲁棒性。作者比较直接回答、文本预填、视觉状态操控与显式图像工具调用,提出“图像工具安全向量”解释工具调用会把隐藏表征推向更易分离、可干预的安全方向。实验显示显式图像工具交互在多模型上使攻击成功率平均相对下降约30%,且增益并非简单来自返回图像内容。

Structure-Guided Visual Perturbation Neutralization for LVLMs Figure 1
2026-05-28cs.CV

Structure-Guided Visual Perturbation Neutralization for LVLMs

Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

2026-05-28视觉语言

针对 LVLM 易受像素级对抗扰动诱发越狱、DoS 或误判,而传统去噪/重建防御不匹配跨模态编码且开销较大的问题,论文提出 SIGN:从视觉编码器提取稳定的结构响应先验,并结合局部统计做动态稀疏像素中和。实验覆盖 6 个 LVLM 和 4 类攻击,平均防御成功率超过 87%,仅修改约 0.5% 像素、每图约 0.16 秒,同时基本保持良性任务表现和编码表征相似度。

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization Figure 1
2026-05-28cs.CV

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

2026-05-28机器人视觉语言视觉感知

针对文本驱动扩散编辑产生大量伪造、但图像篡改定位缺少像素级训练标注的问题,SIGMA将现有原图—编辑图数据视作潜在监督,核心是把DINOv2语义特征差分与解析后的编辑指令定位先验双向融合,并用修复掩码预训练、VAE噪声校准和EMA自训练适配扩散噪声。在五个基准上较自动掩码生成器平均提升12.20% F1,并从公开编辑语料生成约110万训练样本,使六类检测器跨数据集F1提升18.34%。

Do We Really Need Quantum Machine Learning?: A Multidimensional Empirical Study Figure 1
2026-05-28cs.CV

Do We Really Need Quantum Machine Learning?: A Multidimensional Empirical Study

Sudip Vhaduri, Ryan Gammon, Sayanton Dibbo

2026-05-28视觉感知

本文针对视觉识别中经典 SVM/CNN 在大规模数据和高维特征下的计算瓶颈,系统比较 MNIST 上 CSVM、QSVM、CCNN、QCNN 在准确率、运行时间、参数量和内存上的权衡。结果显示 QSVM 在 1000 样本时约 0.90 对 0.85,但更慢;QCNN 与 CCNN 均超 0.96,却少约 94% 参数、75% 内存,运行开销更高,量子增益机制文中未充分说明。

Rethinking Video-Language Model from the Language Input Perspective Figure 1
2026-05-28cs.CV

Rethinking Video-Language Model from the Language Input Perspective

Xiang Fang, Wanlong Fang, Changshuo Wang, Xiaoye Qu, Daizong Liu

2026-05-28视觉感知

论文指出现有视频语言模型过度依赖预定义文本模板,面对真实用户的同义改写会出现性能波动。作者从语言输入侧重构训练流程,用 LLM 生成词级与结构级正负文本,结合属性化文本推理,并以视频引导的自加权跨模态损失筛选和对齐细粒度语义。方法作为即插即用模块,在视频定位、问答和检索等任务上提升多种 SOTA VLM,但具体增益中 LLM 生成数据与损失设计的贡献边界仍需更多消融说明。

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models Figure 1
2026-05-28cs.CV

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Hao Wang, Xin Li, Yujian Xiong, Jiajun Cheng, Jingjing Wang, Xiaobing Yu, Haiyu Wu, Shao Tang, Zhipeng Wang, Langechuan Liu, Shan Lin, Oana Dumitrascu, Yalin Wang

2026-05-28视觉语言

本文针对眼科多模态大模型缺少大规模领域指令数据的问题,提出 OphIn-Engine,从开放眼科视频中抽取图像-转录对,经过视觉线索筛选、指令合成与质控,构建 53.6 万条 OphIn-500K,并训练 OphIn-VL。实验显示其在眼科视觉理解和多轮临床对话上优于现有通用医学及眼科模型,增益可能主要来自 scaling / data。

Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning Figure 1
2026-05-28cs.CV

Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning

Yuting Ma, Lechao Cheng, Xiaohua Xu

2026-05-28视觉感知

本文针对联邦视觉语言模型在 Non-IID 与全数据训练中易出现跨客户端优化不一致和客户端内过度专化的问题,提出 FedDTL:将图像编码器留在本地训练、文本编码器放在服务器形成全局语义锚,并用 SFT 预热后接 GRPO 风格强化学习微调以提升泛化。实验覆盖标签偏斜和特征偏移、few-shot 与 full-data 场景,显示其较基线更能兼顾全局适应与泛化。

Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs Figure 1
2026-05-28cs.CV

Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

Xiang Fang, Wanlong Fang, Changshuo Wang, Keke Tang, Daizong Liu, Siyi Wang, Wei Ji

2026-05-28视觉语言视觉感知

论文关注真实应用中视频帧或文本词缺失且两种模态缺失率不一致的问题,指出现有VLM依赖完整视频-文本对,易在检索、问答和时序定位中失效。作者提出统一的完整性网络,通过特征近似、知识蒸馏和多粒度融合补偿不完整输入,并作为即插即用模块接入任务模型;实验称在多种缺失率和基准上均提升性能,但具体增益来源文中未充分说明。

SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation Figure 1
2026-05-28cs.CV

SIGMA: Bridging Structural and Distributional Gaps for Vision Foundation Model Adaptation

Lingyu Xiong, Jinjin Shi, Xuran Xu, Cong Luo, Runyu Shi, Ying Huang

2026-05-28视觉感知

针对视觉基础模型全量微调成本高、通用 PEFT 难以适配检测/分割/深度等密集预测的问题,SIGMA 将瓶颈从“参数少”推进到“结构与分布是否匹配”:用多尺度深度卷积融合补足空间归纳偏置,并以语义调制对齐下游特征统计。在 DINOv2、SAM、SigLIP2 等骨干上,文中报告其仅训练约 1.72% 骨干参数即可在多项密集任务上优于现有 PEFT 方法。

SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control Figure 1
2026-05-28cs.CV

SmartDirector: Keyframe-Conditioned Cinematic Video Generation with Narrative Pacing Control

Zhida Zhang, Jie Ma, Zhan Peng, Haoxue Wu, Yang Han, Jun Liang, Jie Cao, Jing Li

2026-05-28视觉感知规划控制

现有视频生成多依赖文本或首尾帧,难以像分镜一样精确控制多镜头叙事节奏与时序一致性。SmartDirector以任意关键帧作为叙事锚点,提出两阶段Director-Gen/Director-SR,并用Multi-Chunk VAE规避时序VAE因果约束、配合全时空注意力和关键帧超分恢复细节。实验显示其在单镜头、多镜头和视频延展任务上优于现有方法。

Reflective Dialogue between Teacher and Solver Agents for Video Question Answering Figure 1
2026-05-28cs.CV

Reflective Dialogue between Teacher and Solver Agents for Video Question Answering

Takuya Murakawa, Toru Tamaki

2026-05-28视觉感知优化算法

面向手术、工业等专域第一视角视频问答,论文关注小规模支持集下无法微调时的适应问题。核心做法是先按领域和题型构造教师—求解器反思对话,把正确性反馈与视觉证据作为静态上下文注入推理,而非直接拼接 QA。EgoCross 实验显示其优于零样本和标准 ICL,并在 CVPR 2026 EgoVis 挑战开源赛道获第 3 名。

A Road-Conditioned Traffic Movie Prediction Network with Spatiotemporal and Structure-Consistent Learning Figure 1
2026-05-28cs.CV

A Road-Conditioned Traffic Movie Prediction Network with Spatiotemporal and Structure-Consistent Learning

Joshua Kofi Asamoah, Blessing Agyei Kyem, Armstrong Aboah

2026-05-28视觉感知

针对城市级交通电影预测常被当作图像重建、难以遵守道路拓扑并在跨城场景失效的问题,论文提出 RCSNet,将静态道路占用、方向、连通和交叉口信息作为结构先验,结合多尺度时序编码、方向感知路网-交通融合与逐步生成,并用结构一致性损失约束预测。实验显示,同城在 Berlin、Antwerp、Moscow 上较最强基线平均降低 MAE/MSE/RMSE 11.5%/10.0%/5.1%,跨城到 Chicago、Bangkok 无微调时 RMSE 约降 10.6%/10.5%。

ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation Figure 1
2026-05-28cs.GR

ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation

Yu Zhang, Yidi Shao, Wenqi Ouyang, Yushi Lan, Zhexin Liang, Chengrui Wu, Xudong Xu, Xingang Pan

2026-05-28视觉感知

针对神经布料模拟常局限单一场景、计算随网格分辨率增长且碰撞穿透明显的问题,ClothTransformer将布料动力学改写为潜空间自回归序列建模,用跨注意力把任意分辨率网格压缩为固定数量latent token,并结合无穿透多场景数据与可微CCD处理碰撞。文中称单模型覆盖人体服装、机器人抓取和自由落体碰撞,在各场景较既有方法误差降低约4–9倍。

A self-supervised learning approach to deep filter banks for texture recognition Figure 1
2026-05-28cs.CV

A self-supervised learning approach to deep filter banks for texture recognition

Joao B. Florindo, Lucas O.Lyra, Antonio E. Fabris

2026-05-28视觉感知

针对真实纹理识别中标注样本少、类间相似且用 ViT/MAE 预训练开销较大的问题,论文认为纹理判别信息主要是局部的,因而用卷积自编码器做自监督重建/去噪预训练,并将多层深度滤波响应用 Fisher Vector 汇聚成分类特征。实验报告在 FMD、DTD、KTH-TIPS2-b 及巴西植物识别任务上超过多种现有方法,同时保持较低计算复杂度。

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security Figure 1
2026-05-28cs.CR

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

Xiang Fang, Wanlong Fang

2026-05-28安全鲁棒

针对越狱与提示注入利用语义歧义绕过 LLM 安全机制的问题,论文提出 APD:先用互信息约束的语义分解隔离良性/恶意成分,再构建语义图并以谱特征识别意图,最后由轻量 Transformer 分类与净化输入。实验称平均对抗检测准确率达 92.3%、误报约 3.7%,有害输出减少约 85% 以上,延迟约 12 ms;但具体数据构造与真实部署泛化仍需进一步核验。

Turning Video Models into Generalist Robot Policies Figure 1
2026-05-28cs.RO

Turning Video Models into Generalist Robot Policies

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

2026-05-28机器人视觉感知

针对机器人缺少大规模带动作数据、VLA 难以跨任务和跨本体泛化的问题,本文将视频生成模型保留为无动作视觉规划器,另训本体特定的 Jacobian-IDM,把预测视频中的像素运动反演为动作。该解耦设计提升数据效率并便于更换视频骨干或机器人本体;在仿真和真实 Panda、16-DoF Allegro 手任务中表现强于常规 IDM,并展示零样本语言操控和灵巧重定向能力。

Pattern Recognition Tasks with Personalized Federated Learning Figure 1
2026-05-28cs.CV

Pattern Recognition Tasks with Personalized Federated Learning

Md. Arifur Rahman, Isha Das, Mushfiqur Rahman Abir, B. M. Taslimul Haque, Abdullah Al Noman, Abir Ahmed, Md. Jakir Hossen

2026-05-28视觉感知

针对集中式模式识别在隐私、带宽与异构数据上的局限,本文系统比较7种个性化联邦学习算法在MNIST、SignMNIST和Digit5上的表现,并从准确率、精确率、召回率和F1评估其适用性。结果显示APPLE、FedGC和FedProto整体更稳健,但不同算法优势依赖数据场景,具体增益来源仍需更细粒度消融说明。

Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models Figure 1
2026-05-28cs.CV

Residualized Temporal Sparse Autoencoders for Interpreting Diffusion Models

Calvin Yeung, Prathyush Poduval, Ali Zakeri, Zhuowen Zou, Mohsen Imani

2026-05-28生成模型

本文针对扩散模型内部表示随去噪时间形成轨迹、相邻时刻高度冗余而传统 SAE 多按单时刻分析的问题,提出残差化时间 SAE:先用相邻 timestep 的线性预测分离可预测动态,再让稀疏潜变量建模残差,并可映射回激活空间解释为特征轨迹。作者在 Stable Diffusion 1.5 上通过重建、消融、时空特征分析和定性 steering 显示其能捕捉具时序与空间局部性的语义方向,但实验主要限于单一 U-Net 激活源。

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026 Figure 1
2026-05-28cs.CV

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

Yuto Kanda, Hayato Tanoue, Takayuki Hori

2026-05-28视觉感知

论文面向 CASTLE 2026 中 600 多小时多视角第一/第三人称视频问答,动机是长程检索与细粒度验证难以由单个 VLM 可靠完成,且易产生幻觉。作者比较 SVA 与时序多模态知识图 TMKG,核心洞察是检索后加入带拒答、定位、证据约束的片段级验证与 LLM 判决,比单纯改检索结构更关键。SVA 准确率 0.50,高于 TMKG 的 0.35,但代价是每题约 28 次模型调用;反幻觉规则未做消融,增益来源仍不完全清楚。

Benchmarking Ultrasound Foundation Models for Fetal Plane Classification Figure 1
2026-05-28eess.IV

Benchmarking Ultrasound Foundation Models for Fetal Plane Classification

Leya Barrientos, Yuexi Du, Nicha C. Dvornek

2026-05-28数据集/基准

针对产科超声胎儿标准切面识别依赖操作者、标注数据难获取且跨人群泛化不稳的问题,本文系统比较4个超声基础模型与自然图像预训练CNN/ViT,并区分全量微调和冻结编码器线性探测。结果显示,FetalCLIP在线性探测最优(域内F1 0.9261、非域F1 0.9731),USFM在全量微调最优(0.9476、0.9515);MOFO和UltraSAM退化明显,说明预训练目标与可迁移性差异比“是否为超声模型”本身更关键。

Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought Figure 1
2026-05-28cs.CV

Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

2026-05-28视觉感知强化学习

论文针对现有语言驱动分割过度依赖“目标已被指明”的设定,指出机器人场景中指令常只是高层意图。作者提出 SegWorld,先主动观察场景并形成语言化上下文,再用多级视觉 CoT 从意图推到对象、动作、可交互部件和掩码,并构建 Intent2Part 评测。实验显示其在直接指代指令上接近强基线,在意图级部件分割上有明显提升。

AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications Figure 1
2026-05-28cs.CV

AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

Yifan Sui, Xin Huang, Hongbing Li, Fang Xu, Jiahe Lv, Haolong Yan, Yeqing Shen, Litao Liu, Zhimin Fan, Ziyang Meng, Jia Wang, Junbo Qi, Kaijun Tan, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Osamu Yoshie

2026-05-28强化学习数据集/基准

针对现有移动 GUI Agent 评测多依赖模拟或开源应用、难覆盖真实闭源日常场景的问题,论文提出 AndroidDaily:在 94 个高频安卓应用上构建 350 个真实任务,并用 GRADE 以操作义务、输出质量和负面约束三类可观察准则进行过程级自动验证。实验中 GRADE 与人工一致率为 87.37%,最强模型成功率仅 62.0%,暴露出跨应用、多约束任务中的时延错位、记忆循环和协议退化等瓶颈。

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions Figure 1
2026-05-28cs.CL

Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions

Antonia Karamolegkou, Nicolas Angleraud, Benoît Sagot, Thibault Clérice

2026-05-28视觉语言视觉感知

本文关注VLM用于低资源古希腊校勘本OCR时是否真在“看字”而非凭语言先验补全。作者比较5个开源VLM与传统OCR,并用受控字符扰动、条件/无图解码分布的token级grounding分析错误来源。结果显示,VLM错误常保持流畅希腊词形,扰动后更偏离真实图像;但先验依赖具模型差异,OlmOCR最明显,通用VLM即使出错仍较依赖图像,解码期约束难以稳定修复。

Mahalanobis PatchCore: Covariance-Aware and Streaming-Compatible Industrial Anomaly Detection Figure 1
2026-05-28cs.CV

Mahalanobis PatchCore: Covariance-Aware and Streaming-Compatible Industrial Anomaly Detection

Niccolò Ferrari, Oligert Osmani, Evelina Lamma

2026-05-28视觉感知

针对工业异常检测中缺陷样本稀少、PatchCore 欧氏检索忽略特征相关性且离线构建内存占用高的问题,论文提出 MH-PatchCore:在降维空间估计正则化协方差并白化嵌入,用等价欧氏近邻实现 Mahalanobis 检索,同时以可重迭代的流式流程构建记忆库。结果显示其在 MVTec AD 上基本保持离线 PatchCore 图像级性能,峰值内存由 5.41GB 降至 2.78GB,并将三类工业数据平均 image AUROC 从 0.981 提升到 0.986。

Bounded-Compute Multimodal Regression for Product-Rating Prediction Figure 1
2026-05-28cs.CV

Bounded-Compute Multimodal Regression for Product-Rating Prediction

William Leach, Ru He, Sizhuo Ma, Yizhen Jia, Min Cao, Jian Wang, Rick Cao

2026-05-28视觉语言学习理论

论文针对商品评分这类低延迟标量预测,指出生成式 VLM 的自回归解码和动态视觉处理会带来不稳定计算开销。方法将 SmolVLM2 改为固定 384×384 输入、截断元数据,并用池化 decoder 状态接两层 MLP 回归头。实验显示静态全局图像略优于动态 tiling,16M 数据显著提升相关性;官方评测达 0.39 PLCC、0.40 CES,增益可能主要来自 scaling / data。

Explicit Critic Guidance for Aligning Diffusion Models Figure 1
2026-05-28cs.LG

Explicit Critic Guidance for Aligning Diffusion Models

Zhengyang Liang, Qihang Zhang, Ceyuan Yang

2026-05-28生成模型

论文针对扩散模型后训练中奖励只在最终图像上给出、难以沿去噪轨迹细粒度归因,以及像素空间 critic 不稳定且开销高的问题,提出在噪声潜变量上学习状态对齐的 actor-critic:让扩散骨干兼作按时间步条件化的价值函数,并用价值预训练和多奖励价值头提升稳定性、缓解 reward hacking。实验显示该方法在 UNet 与 DiT 骨干、单奖励和多奖励设置下均优于 group-relative RL 与既有 actor-critic 基线,推理时利用 critic 梯度 steering 还能进一步提升生成质量。

Asynchronous Remote Sensing Time-Series Fusion for Cloud Removal and Anytime Reconstruction Figure 1
2026-05-28cs.CV

Asynchronous Remote Sensing Time-Series Fusion for Cloud Removal and Anytime Reconstruction

Forouzan Fallah, Chia Yu Hsu, Wenwen Li, Anna Liljedahl, Yezhou Yang

2026-05-28三维

针对云遮挡导致 Sentinel-2 光学时序缺失、且 Sentinel-1/2 采集时间不对齐的问题,论文提出 AGFlow:用时间戳条件的内部对齐和时空生成式 flow matching 融合 SAR 与带云光学序列,并支持任意时间查询生成无云 S2。RESTORE-DiT 协议下,完整缺帧重建的 MAE/RMSE 较基线降低约 16–19%,消融显示时间对齐对光谱一致性贡献明显。

Structure over Pixels: Learning Variable-Length Visual Programs Figure 1
2026-05-28cs.CV

Structure over Pixels: Learning Variable-Length Visual Programs

Piotr Wyrwiński, Kacper Dobek, Krzysztof Krawiec

2026-05-28视觉感知

针对离散视觉 tokenizer 常用固定码长、且像素重建易把预算耗在纹理而非结构上的问题,论文提出 STROP:用生成器/解释器 Transformer 与 VQ 码本把图像编码为可变长度“视觉程序”,并通过 DINOv3 特征蒸馏和局部率失真探针训练长度头,单次前向即可按场景复杂度选择前缀。实验显示码长随复杂度增长,在率质权衡、密集预测迁移以及码本复用/空间归因中呈现一定组合结构迹象。

Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers Figure 1
2026-05-28cs.CV

Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers

Kabir Swain, Sijie Han, Daniel Karl I. Weidele, Mauro Martino, Antonio Torralba

2026-05-28视觉感知

针对长视频/长序列中 KV 缓存随长度增长、且 Transformer 缺少可持续空间状态的问题,论文提出 Tensor Memory:在模块内维护固定大小 3D 体素记忆,令 token 以连续坐标高斯写入,经轻量 ConvLSTM 式局部更新,再连续采样读回并门控融合。实验覆盖语言、图像重建、UCF-101 视频和诊断任务,显示长上下文语言增益最大,图像与视频有较小但一致提升;但规模化时密集体素更新成本仍是限制。

On the Equivariant Learning of the $Q$-tensor Order Parameter Figure 1
2026-05-28cs.CV

On the Equivariant Learning of the $Q$-tensor Order Parameter

Julia Navarro, Mark Wilkinson

2026-05-28视觉感知

该文针对从微观纹理预测二维向列液晶 Q-tensor 时旋转对称性难以靠普通网络稳定学习的问题,构造了对循环群 Ck 等变的神经网络,用近似旋转的置换表示、权重共享和等变激活硬编码物理约束。实验显示模型在单精度误差内满足 Q-tensor 等变性,相比参数近似匹配的非等变模型及数据增强基线 RMSE 更低,并对未见缺陷构型更稳健;但数据为合成纹理,真实场景适用性文中仍有限。

Not All NVFP4 QAT Recipes Are Equal: How Architecture and Scale Shape Model Quality for Anomaly Segmentation Figure 1
2026-05-28cs.CV

Not All NVFP4 QAT Recipes Are Equal: How Architecture and Scale Shape Model Quality for Anomaly Segmentation

Zijian Du, Oleg Rybakov

2026-05-28视觉感知

面向高召回、低延迟的异常分割,论文系统考察脑肿瘤 MRI 任务中架构、模型规模与 NVFP4 QAT 配方的耦合影响。核心洞察是量化鲁棒性主要由架构决定:Swin Transformer 在各尺度 AUPRC 最高且对配方不敏感;高级配方可缓解小模型注意力离散化和大 CNN 梯度量化噪声,5 折患者级交叉验证支持该排序。

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks Figure 1
2026-05-28cs.CV

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

2026-05-28视觉语言视觉感知

面向农业影像中LLM可能误导病虫害诊断和管理决策的问题,论文把幻觉同时放到图像解读与文本生成图像两条链路中评估,按生物一致性、情境准确性和农艺可行性归类错误。结果显示多模态模型零样本识别仅约63–75%,少样本最高86.8%但仍有漏检误检;生成端在宽松提示下最高91%场景不符合生物常识,说明当前模型缺少可靠的领域 grounding。

ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes Figure 1
2026-05-28cs.CV

ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes

Zihang Cheng, Duanchu Wang, Cheng Li, Jing Huang, Huanzhao Fu, Di Wang

2026-05-28视觉感知

论文针对现有遥感问答多依赖视觉嵌入直接生成、难以支撑森林生态中多步计算与可追溯验证的问题,提出 ForestHG-Trace:用多模态场景超图表示树木、空间单元和高阶生态关系,并由工具增强 LLM 生成可执行程序完成过滤、邻域扩展、聚合与比较。作者同时构建 ForestTraceQA,实验显示超图建模结合确定性执行较单步和传统场景图代理更适合长程生态推理,且结构超边是主要性能支撑。

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios Figure 1
2026-05-28cs.CV

What-If World: A Causal Benchmark for General World Models in Embodied Scenarios

Kunlin Cai, Rui Song, Jinghuai Zhang, Kaiyuan Zhang, Pranav Bodapati, Alicia Yu, Fnu Suya, Mohammad Rostami, Jiaqi Ma, Yuan Tian

2026-05-28强化学习数据集/基准

面向自动驾驶和机器人操作中的视频世界模型,论文指出单段视频逼真并不能证明模型会随动作或物理条件变化而正确改变输出。What-If World用nuScenes/DROID真实帧构造319组只改一个物理变量的对比提示,并以APEO评估遵循、物理、环境保持和结果差异。九个先进模型成对得分均低于52%,开源约28%,暴露出现有逐视频评测难发现的“对比瓶颈”。

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation Figure 1
2026-05-28cs.RO

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation

Hongyu Ding, Sizhuo Zhang, Ziming Xu, Jinwen Guo, Hongxiu Liu, Xingzhi Cheng, Zixuan Chen, Haifei Qi, Duo Wang, Hao Xu, Jieqi Shi, Yifan Zhang, Jing Huo, Jian Cheng, Yang Gao, Jiebo Luo

2026-05-28机器人视觉感知

针对具身导航依赖大规模机器人轨迹训练、跨任务跨本体泛化成本高的问题,Uni-LaViRA将导航动作结构化为语言方向指令与像素级视觉目标,认为其落在MLLM自然输出流形内,可零训练推理;并加入TODO List Memory缓解长程遗忘、Second Chance Backtrack利用失败轨迹重规划。实验在VLN-CE、ObjectNav、EQA、Aerial-VLN及四类真实机器人上零样本运行,R2R成功率60.7%、RxR 51.3%、HM3D-v2 77.7%、OpenUAV 40.0%,接近或超过部分训练型导航基础模型。

Clinical Validation of the Melanoscope AI Mobile Dermoscopy Clinical Decision Support System Figure 1
2026-05-28cs.CV

Clinical Validation of the Melanoscope AI Mobile Dermoscopy Clinical Decision Support System

Elena Sergeevna Kozachok, Sergey Sergeevich Seregin

2026-05-28视觉感知

针对俄罗斯地区皮肤科资源不足、皮肤病变 AI 筛查缺乏可解释性与标准化转诊的问题,本文验证 Melanoscope AI 移动皮肤镜 CDSS:采用两阶段级联分类,结合注意力/Grad-CAM 热图并用 IoU 量化与专家标注一致性,同时给出三档风险分流阈值。在 176 例前瞻性单中心筛查中,系统与专家一致率 88.6%,5 例恶性病变无漏诊、特异性 88.3%;但恶性样本很少,结论仍属初步验证。

Representation-Conditioned Diffusion Models for Guided Training Data Generation Figure 1
2026-05-28cs.CV

Representation-Conditioned Diffusion Models for Guided Training Data Generation

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen

2026-05-28生成模型

针对真实图像数据获取、标注与共享成本高的问题,本文用DINOv2/DINOv3/CLIP表征作为条件来训练潜扩散模型,替代仅按类别条件生成训练集,并用下游ResNet-50分类验证数据价值。在ImageNet100上,表征条件生成较类别条件Top-1提升10.76个百分点;扩大合成集规模后还比真实数据训练高2.0个百分点,同时可用于增强和基于表征空间过滤样本。

Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer Figure 1
2026-05-28cs.CV

Diffusion-Based Ukrainian Handwritten Text Generation with Cross-Domain Style Transfer

Andrii Ahitoliev, Pavlo Berezin

2026-05-28生成模型

针对乌克兰西里尔手写生成缺少作者标注数据与跨文字迁移证据的问题,论文构建了12.6万词、308名作者的数据集,并在不改结构下重训DiffusionPen,检验拉丁到西里尔的少样式扩散迁移。结果显示生成词可读且风格一致,FID 23.09、CER 16.0%,OOV与稀有字母表现说明并非简单记忆;消融表明主要增益很大程度来自更大数据量与更准的连通域分词。

Comparative Analysis of Liquid Neural Networks and LSTM for Sequential Pattern Recognition: Robustness, Efficiency, and Clinical Utility Figure 1
2026-05-28cs.LG

Comparative Analysis of Liquid Neural Networks and LSTM for Sequential Pattern Recognition: Robustness, Efficiency, and Clinical Utility

Ye Kyaw Thu, Thazin Myint Oo, Thepchai Supnithi

2026-05-28视觉感知安全鲁棒

针对 LSTM 将时间离散化、难处理异步传感和临床缺失数据的问题,论文用闭式连续时间 LNN/CfC 与 LSTM 在 N-MNIST、QuickDraw、IAM 和 PhysioNet Sepsis 上做同条件对比,并加入 temporal dropout 压力测试。结果显示 LNN 在稀疏/不规则序列中更稳健且参数更省,如 N-MNIST 丢 30% 事件仍领先约 14%,败血症预测假阳性显著更少;但高风险临床结论仍需更多数据集和重复实验验证。

AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers Figure 1
2026-05-28cs.CV

AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers

Semi Lee, Hyejin Go, Hyesong Choi

2026-05-28视觉感知

本文针对 ViT 自注意力计算随 token 数二次增长、现有 ToMe 类无训练合并默认“token 等价”而易损失高显著区域的问题,提出 AdaMerge:用特征亲和中心性估计 token 显著性并加权匹配/聚合,同时依据预统计的层级相似度与输入冗余自适应决定各层合并强度。在 ImageNet-1k 的 ViT-B/16 上,AdaMerge 在相同 FLOPs 下优于 ToMe、PiToMe 和 DSM,极端约 13.4G FLOPs 时 Top-1 仅降 1.06%。

Beyond Motion Primitives: Behavioral Activity Recognition from Head-Mounted IMU Figure 1
2026-05-28cs.CV

Beyond Motion Primitives: Behavioral Activity Recognition from Head-Mounted IMU

Chung-Ta Huang, Leopold Das, Jeffrey Zhou, Faizaan Siddique, Julia Seungjoo Baek, Serena Liu, Andrew Rusli, Todd Y. Zhou, Freddy Yu, Sinclair Hansen, Ziling Hu, Arnav Sharma, Mengyu Wang

2026-05-28视觉感知

本文面向AR眼镜的持续情境感知,指出头戴IMU若只识别走/站等运动基元难以支持主动辅助。作者在Ego4D上构建16万样本、含人工质检的行为级标签,并提出结合局部CNN-GRU、时序Transformer和场景门控的HiT-HAR。结果显示其在五类行为与八类场景识别上优于IMU2CLIP和微调Mantis;分析还表明可观测性存在边界:行走最稳,物体转移和任务操作依赖时间上下文,搜索仍与静止等类别重叠。

D$^2$Turb: Depth-Aware Simulation and Decoupled Learning for Single-Frame Atmospheric Turbulence Mitigation Figure 1
2026-05-28cs.CV

D$^2$Turb: Depth-Aware Simulation and Decoupled Learning for Single-Frame Atmospheric Turbulence Mitigation

Zixiao Hu, Tianyu Li, Guoqing Wang, Wei Li, Guoguo Xin, Xun Liu, Peng Wang

2026-05-28视觉感知

该文面向单帧远距离成像中的大气湍流退化,指出现有端到端方法常把空间变化模糊与非刚性形变混在一起学习,导致清晰度与几何校正难兼顾。D²Turb用深度感知湍流合成引入物理一致的深度相关退化和tilt监督,并将恢复解耦为纹理去模糊与几何矫正,再通过ASPI注入结构先验引导稠密反扭曲。实验显示其在合成和真实数据上均优于既有方法,合成基准PSNR达25.72 dB且LPIPS相对降低19%。

Generic Interpretation Approach for Transformer Models Incorporating Heterogenous Attention Structures Figure 1
2026-05-28cs.CV

Generic Interpretation Approach for Transformer Models Incorporating Heterogenous Attention Structures

Yongjin Cui, Xiaohui Fan, Huajun Chen

2026-05-28视觉感知

面向多模态与检测 Transformer 中跨注意力等异构注意力难以解释的问题,论文将注意力按信息来源划分为同源与异构,并提出结合梯度校正、多头聚合和信息流传播的通用解释框架。方法在 DETR、LXMERT 等图像/图文模型上与 GAE、ODAM 对比,据称取得最佳解释效果,并能支持语义与逻辑层面的机制分析,但具体增益来源文中未充分说明。

NL-MambaXCT: Self-Supervised Nested-Learning Mamba for Nomex Honeycomb X-ray CT Defect Classification Figure 1
2026-05-28eess.IV

NL-MambaXCT: Self-Supervised Nested-Learning Mamba for Nomex Honeycomb X-ray CT Defect Classification

Ghaleb Aldoboni, Lobna Nassar, Fakhri Karray, Reem Alshamsi

2026-05-28视觉感知

面向航空 Nomex 蜂窝结构 XCT 检测中人工判读重、标注少且噪声大的问题,论文提出 NL-MambaXCT:先用近 2 万张未标注切片做掩码自监督预训练,再以 RegNet+Mamba 编码器和嵌套学习的快/慢参数动态提升小样本鲁棒性。其在 2000 张重标注切片上达到 96.91% 准确率、96.8% macro-F1,较 CNN、注意力和单时间尺度 Mamba 基线提升 3.11–10.31 个百分点。

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent Figure 1
2026-05-28cs.CV

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent

Takato Yasuno

2026-05-28视觉语言视觉感知

针对日本桥梁定期目视检查中评级主观差异大、资深工程师减少的问题,论文将 LLaVA-1.5-7B 以 QLoRA 适配到日文桥梁损伤图文记录,并用规则引擎给出五级维修优先级,再由 Swallow-8B 质量守卫拦截低质描述。实验显示 2k 样本已接近最优验证损失,语义相似度在 3k 达峰,4k 反降;批处理与编译后推理约 10.06 秒/图。

From Affect to Complex Behavior: Advancing Multimodal Human-Centered AI at the 10th ABAW Workshop & Competition Figure 1
2026-05-28cs.CV

From Affect to Complex Behavior: Advancing Multimodal Human-Centered AI at the 10th ABAW Workshop & Competition

Dimitrios Kollias, Panagiotis Tzirakis, Alan Cowen, Stefanos Zafeiriou, Irene Kotsia, Eric Granger, Marco Pedersoli, Simon Bacon, Jens Madsen, Soufiane Belharbi, Muhammad Haseeb Aslam, Chunchang Shao, Guanyu Hu

2026-05-28视觉语言

本文动机是推动真实开放环境中的人类情感与复杂行为理解,服务医疗、人机交互、机器人等多模态人本AI。核心洞察是ABAW已从表情、效价-唤醒、AU等孤立情感识别,扩展到情绪模仿、犹豫/矛盾和细粒度暴力等时序社会行为任务,并以竞赛加论文轨道组织基准。主要结果是给出CVPR 2026第10届ABAW的六项挑战、数据与评测框架;文中未充分说明单一方法的量化增益。

RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval? Figure 1
2026-05-28cs.IR

RE-TRIANGLE: Does TRIANGLE Enable Multimodal Alignment Beyond Cosine Similarity in Retrieval?

Arijit Ghosh, Aritra Bandyopadhyay, Chiranjeev Bindra, Jingfen Qiao

2026-05-28视觉语言

本文动机是检验多模态检索中传统以文本为锚的两两余弦对齐是否忽略音频—视频等外围模态一致性。作者复现实验评估 TRIANGLE 的三模态几何目标,即最小化单位超球面上文本、视频、音频嵌入形成的三角形面积。结果显示其在多数据集零样本检索中相对 VAST 有最高约 8.7 点 R@1 增益,但收益强依赖领域;从零训练未能复现,且与 DTM 联合优化存在不稳定性。

OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis Figure 1
2026-05-28cs.CL

OralAgent: Integrating Reasoning, Tools, and Knowledge for Interactive Dental Image Analysis

Jing Hao, Siyuan Dai, Yongxin Zhang, Yuci Liang, Jiamin Wu, Jiahao Bao, Yuxuan Fan, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Ming Hu, Liang Zhan, James Kit Hon Tsoi, Linlin Shen, Junjun He, Kuo Feng Hung

2026-05-28视觉感知

针对牙科 AI 多为单模态、单任务工具且临床流程中缺乏透明推理的问题,OralAgent 将 ReAct 式规划、多模态理解、22 个牙科视觉工具与基于 368 本教材的 RAG 结合,并构建 OralCorpus 与 OralQA-ZH。实验显示其在 MMOral-Uni、MMOral-OPG 分别达 57.70、61.00,较 OralGPT-Omni 提升 5.86 和 15.69 分,RAG 在中文口腔知识问答中也带来稳定增益。

2026-05-27

141 篇
G3T Up! Gravity Aligned Coordinate Frames Simplify Pointmap Processing Figure 1
2026-05-27cs.CV

G3T Up! Gravity Aligned Coordinate Frames Simplify Pointmap Processing

Bharath Raj Nagoor Kani, Noah Snavely

Cornell University

2026-05-27强化学习三维

论文指出,VGGT 等前馈三维重建把点图放在首帧相机坐标系中,会引入任意俯仰/滚转并增加多视图对齐难度。G3T 的核心洞察是改用重力对齐的直立坐标系,使不同视角共享竖直轴,将子图间旋转约束到绕竖直轴的 1 自由度;在此基础上微调 VGGT,并构建 G3T-Long 增量重建流程。实验显示其相机到重力姿态、直立点图和长序列重建精度优于基线、漂移更低,但模糊结构场景仍可能失败。

SpatialBench: Is Your Spatial Foundation Model an All-Round Player? Figure 1
2026-05-27cs.CV

SpatialBench: Is Your Spatial Foundation Model an All-Round Player?

Haosong Peng, Hao Li, Jiaqi Chen, Yuhao Pan, Runmao Yao, Yalun Dai, Fushuo Huo, Fangzhou Hong, Zhaoxi Chen, Haozhao Wang, Dingwen Zhang, Ziwei Liu, Wenchao Xu

Hong Kong University of Science and Technology, Nanyang Technological University, Northwestern Polytechnical University, Southeast University, Huazhong University of Science and Technology

2026-05-27优化算法学习理论数据集/基准安全鲁棒

针对空间基础模型常在窄数据、非统一采样下评测而难以判断真实泛化的问题,SpatialBench构建了覆盖19个数据集、546个场景、6类范式和4种输入密度的确定性基准,并评测41个模型。结果显示现有模型尚非“全能”:全局上下文注意力精度最高,有限记忆方法更能扩展长序列;具身、第一视角和腕视角仍是主要失效域,数据质量与域对齐比单纯扩大数据更关键,并据此提出DA-Next-5M与DA-Next基线。

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding Figure 1
2026-05-27cs.CV

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

Shihao Wang, Shilong Liu, Yuanguo Kuang, Xinyu Wei, Yangzhou Liu, Zhiqi Li, Yunze Man, Guo Chen, Andrew Tao, Guilin Liu, Jan Kautz, Lei Zhang, Zhiding Yu

2026-05-27视觉语言视觉感知生成模型学习理论数据集/基准

该文针对VLM将检测/指代表达成逐token坐标生成所带来的几何不一致与推理瓶颈,提出LocateAnything的并行框解码:把框或点作为原子结构一次预测,并配合快、慢、混合三种解码策略。作者还构建含1.38亿查询的大规模数据集;实验显示在布局、长尾检测、GUI等基准上提升高IoU定位质量,解码吞吐最高约2.5倍,但部分增益可能主要来自scaling/data。

Feedforward 3D Editing Learns from Semantic-Part Transformation Figure 1
2026-05-27cs.CV

Feedforward 3D Editing Learns from Semantic-Part Transformation

Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Chen, Hao Zhao

Nanyang Technological University, Tsinghua University, Nanyang Technological University Singapore, Tsinghua University China

2026-05-27视觉感知生成模型规划控制学习理论数据集/基准

针对前馈式 3D 编辑缺少高质量成对监督、难以同时保证局部可控和未编辑区域保持的问题,本文提出从语义部件变换中学习的思路,构建含 10 万余对、覆盖七类编辑的 Pxform,并训练注入源潜变量控制的 PartFlow。实验显示,语义部件级数据显著改善几何与外观编辑,在 Uni3DEdit-Bench 等基准达到 SOTA;但增益可能主要来自高质量数据与规模化监督。

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection Figure 1
2026-05-27cs.CV

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection

Kim Jihyeon, Sohee Kim, Soosan Lee, Souhwan Jung, James Matthew Rehg, Hyesong Choi

School of Computer Engineering, Hoseo University, School of Electronic Engineering, Soongsil University, School of Computer Science, University of Illinois at Urbana-Champaign

2026-05-27视觉语言视觉感知生成模型强化学习规划控制

针对新版生成/局部编辑图像已削弱像素、频域等低层伪造痕迹的问题,论文提出把多人互动中的视线方向、头眼对齐和瞳孔位置一致性作为高层语义检测线索,并用成对眼区编辑数据与固定五段推理骨架的组合 caption 监督训练检测器。结果显示该线索可跨视觉语言与纯视觉骨干生效,FakeVLM 在 COCOAI Interaction/Person 上平衡准确率分别提升 3.7/1.3 个百分点,且真假召回同时上升。

Towards Controllable Image Generation through Representation-Conditioned Diffusion Models Figure 1
2026-05-27cs.CV

Towards Controllable Image Generation through Representation-Conditioned Diffusion Models

Nithesh Chandher Karthikeyan, Jonas Unger, Gabriel Eilertsen

2026-05-27视觉感知生成模型规划控制数据集/基准

本文针对扩散模型缺少类似 GAN 的可编辑潜空间、依赖文本或语义标注难以精细控制的问题,尝试用预训练自监督 DINO 表征来条件化 LDM,将图像表征空间作为控制空间。作者在 LSUN Churches 与 CelebA 上做扰动、插值和语义方向实验,显示该空间在较大扰动下仍保持生成质量,插值更平滑,并具一定解耦性;但工作偏初步,定量指标与增益来源文中未充分说明。

PARE: Pruning and Adaptive Routing for Efficient Video Generation Figure 1
2026-05-27cs.CV

PARE: Pruning and Adaptive Routing for Efficient Video Generation

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

The University of Sydney 2 Shanghai AI Laboratory 3 The Chinese University of Hong Kong

2026-05-27视觉感知生成模型三维

视频 DiT 推理成本高,静态剪枝难以随输入与去噪阶段调整计算。PARE 的关键洞察是注意力头存在空间/时间分工且时间头易被幅值剪枝误删,因此采用时空感知宽度剪枝,并用轻量路由器按 timestep 与视觉内容动态选择执行块。文中在 Wan2.1-14B 的图生视频和文生视频上显示,PARE 可约减半单步计算且基本保持 VBench 质量,并可与步数蒸馏叠加加速。

EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering Figure 1
2026-05-27cs.SE

EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering

Zhifei Dou, Shabnam Hassani, Ou Wei

2026-05-27视觉语言生成模型

工业需求文档中的流程图常以静态图片存在,阻碍可追踪性、影响分析和基于模型的测试,且现有 VLM 容易漏掉连线方向等拓扑细节。EdgeFlow 的核心做法是在原图外加入确定性 Canny 边缘图作为结构先验,无需标注训练或微调,将流程图转为 Mermaid。在 52 个工业流程图上,节点、边和路径 F1 分别提升 17.39、16.94 和 11.06 个百分点;但在合成公开集上无显著增益,说明泛化与基准多样性仍需进一步验证。

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning Figure 1
2026-05-27cs.CV

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

University of Science and Technology of China, Shanghai AI Lab, Northwestern Polytechnical University

2026-05-27视觉感知三维

这篇论文针对长视频空间推理中“记住更多帧”反而引入冗余和无关几何的问题,提出 Q-GeoMem 将记忆视为面向问题的证据管理:用相机条件几何增强视觉 token,并以近期细粒度记忆和长期语义几何证据库分别保存局部与跨时段信息;写入时结合问题相关性和新颖性打分。实验在 VSI-Bench、VSTI-Bench 上达到所评模型中的 SOTA,消融显示该打分机制是主要增益来源之一。

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models Figure 1
2026-05-27cs.CL

Chartographer: Counterfactual Chart Generation for Evaluating Vision-Language Models

Yifan Jiang, Dae Yon Hwang, Jesse C. Cresswell, Freda Shi

University of Waterloo, Vector Institute

2026-05-27视觉语言视觉感知

现有图表问答常用固定三元组,难以区分模型是真正读图推理还是依赖题目规律、记忆或参数知识。Chartographer 将原图反向工程为可执行绘图代码,人工验证重建后生成受控反事实图表,并用可执行 QA 逻辑重算答案。实验显示,许多 VLM 即使答对原图,也在数据变化后显著失效,CharXiv 与 ChartMuseum 尤其明显,错误多来自未能重新视觉落地或更新推理。

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning Figure 1
2026-05-27cs.CV

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal

Mila - Québec AI Institute, Université de Montréal 3 McGill University

2026-05-27视觉语言

论文针对VLM跨视角空间推理中“语言化推理丢失几何细节、生成的思考图像又常被模型忽略”的问题,提出训练时的View Dropout,让答案阶段看不到部分输入视图、必须依赖中间图像,并用可学习性—信息量框架比较全景、俯视和点匹配三类视觉思考。基于BAGEL仅用8K合成样本训练,在一个域内和五个真实OOD基准上,全景+VDrop取得最佳泛化,较原模型提升6.7点并超过更多数据训练的同骨干方法。

PlayClass: Automated Play Behaviour Classification in Poultry Figure 1
2026-05-27cs.CV

PlayClass: Automated Play Behaviour Classification in Poultry

Prince Ravi Leow (1), Neil Scheidwasser (1 and 3), Rebecca Oscarsson (2), Per Jensen (2), Samir Bhatt (1 and 3), David Alejandro Duchêne (1) ((1) Section for Health Data Science & AI, University of Copenhagen, (2) AVIAN Behaviour Genomics and Physiology Group, Linköping University (3) Department of Infectious Disease Epidemiology, Imperial College London)

Section for Health Data Science & AI, University of Copenhagen, AVIAN Behaviour Genomics and Physiology Group, Linköping University, Department of Infectious Disease Epidemiology, Imperial College London

2026-05-27视觉感知

这篇论文针对禽类福利监测长期偏重疾病、疼痛等负面指标而忽视“玩耍”行为的问题,提出 PlayClass:用 YOLO 辅助 SAM 3 分段跟踪长时俯视视频,并结合手工运动特征与冻结视觉/视频基础模型做个体级分类。实验显示 V-JEPA 2.1 最强,融合运动特征后宏平均 F1 达 77.0,但遮挡和玩耍/非玩耍运动模式相似仍是主要误差来源。

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini Figure 1
2026-05-27cs.CV

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini

2026-05-27视觉语言

现有多模态嵌入多依赖双塔或后融合,难以处理图文音视频交错输入及跨模态细粒度语义。Gemini Embedding 2借助Gemini原生多模态能力,将文本、图像、音频、视频及其任意组合映射到统一空间,并通过大规模对比学习和多任务多阶段训练提升通用检索能力。其在MSCOCO、Vatex、MTEB多语与代码等指标上超过专用模型,但具体增益来源可能主要来自scaling / data。

A Dynamic Programming Framework for Discovering Count and Values of Multilevel Image Thresholding Figure 1
2026-05-27cs.CV

A Dynamic Programming Framework for Discovering Count and Values of Multilevel Image Thresholding

Eslam Hegazy, Mohamed Gabr

aComputer Science and Engineering Department German University in Cairo, New

2026-05-27视觉感知

针对多级图像阈值分割通常需要人工指定阈值数量、且精确动态规划在高阈值数下耗时的问题,本文系统分析基于改造 Kittler/MET 准则的 MET-DP 框架,用一次动态规划同时估计阈值个数和值。实验覆盖自然、卫星和医学图像,显示其在高阈值场景显著更快,并常能给出合理阈值数;但相较需预设阈值数的 Otsu、Kapur 等方法,SSIM/PSNR 往往不占优,且会受直方图细小波动影响出现过分割或欠分割。

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models Figure 1
2026-05-27cs.CV

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

University of Edinburgh, Tsinghua University, Code and data are available at https://github.com/, this division of labor dynamically

2026-05-27视觉语言视觉感知

长上下文视觉语言模型需要在图文交错输入中定位证据,但以往基于文本复制的 retrieval head 判据难以处理图像证据。本文用问题 token 到标注文本/视觉证据的注意力质量定义多模态检索头,发现其稀疏、部分跨模态共享且会随上下文和模态动态变化;遮蔽前 5% 头使 MMLongBench-Doc 从 48.2% 降至 5.7%、SlideVQA 从 71.2% 降至 8.9%,并可无训练提升 MMDocIR 页/布局检索 Recall@1。

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale Figure 1
2026-05-27cs.CV

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

2026-05-27视觉感知

针对分层透明图像生成与编辑缺少大规模数据和统一建模的问题,MRT在约200亿参数Qwen-Image基础上,用遮蔽区域扩散统一文本到层、图像到层和层到层编辑,并引入支持越界元素的canvas层与扩散蒸馏。实验显示其在三类任务和用户研究中优于现有及商业系统,图像拆层较Qwen-Image-Layered推理快约10–100倍、显存省50%–90%,但部分增益可能主要来自scaling/data。

Generative Animations: A Multi-Model Pipeline for Prompt-Driven Motion Synthesis Figure 1
2026-05-27cs.CV

Generative Animations: A Multi-Model Pipeline for Prompt-Driven Motion Synthesis

Mannat Khurana, Sanyam Jain, Rishav Agarwal

thinning algorithm [ZS84, AB99] extracts the medial axis (center-, perfectly centered during movement. This geometric abstraction al-

2026-05-27生成模型

这篇短文针对设计工具中自定义动画路径需手工描点、调缓动且门槛高的问题,提出将 LLM 意图解析、SAM 视觉定位、轮廓向量化与 Bézier 路径装配串联的多模型流水线,使文本提示可生成贴合场景几何的动画,并处理遮挡层级和 3D 透视。系统在 InDesign/Express 场景展示了沿轮廓、绕行和透视对齐三类用例,声称可节省约 90% 时间,但除案例外定量评测仍不充分。

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation Figure 1
2026-05-27cs.CL

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

Ning Wu, Rui Liu, Xinkun Lin, Weixing Chen, Jinxi Xiang, Tao Wei, Lina Yao, Mingjie Li

University of Technology Sydney, Sydney, Australia, School of Computer Science and Engineering, Sun Yat-sen University, China, Stanford University, Palo Alto, United States, Shanghai Jiao Tong University, Shanghai, China

2026-05-27视觉感知

这篇论文关注将隐空间示例蒸馏从短回答任务迁移到长篇医学报告时的失效:模板词过多会淹没病灶词和EOS等关键监督。作者提出DIVE,在冻结医学VLM上结合关键token加权监督与状态条件动态steering,以缓解内容遗漏和过度生成。MIMIC-CXR、CheXpert Plus实验显示其在BLEU-4、ROUGE-L和RadGraph F1上均优于对比方法,CheXbert表现保持竞争力。

FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation Figure 1
2026-05-27cs.CV

FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation

Zihui Zhang, Zhixuan Sun, Yafei Yang, Jinxi Li, Jiahao Chen, Bo Yang

2026-05-27视觉感知强化学习三维

针对无场景级人工标注下复杂点云中“什么算一个物体”难定义、仅语义或仅几何先验易失效的问题,FoundObj用超点级发现智能体逐步合并邻域超点,并把自监督2D基础模型的语义一致性与3D物体中心几何一致性作为强化学习奖励。实验显示其在多个3D场景基准上超过现有无标签/弱先验方法,并在零样本和长尾场景中保持较好泛化。

Model discovery for dynamical systems with complex-valued product units Figure 1
2026-05-27cs.CV

Model discovery for dynamical systems with complex-valued product units

Martin Brückmann, Babette Dellen, Uwe Jaekel

Department of Mathematics, Informatics, and Technology, RheinAhrCampus Remagen, University of Applied Sciences Koblenz

2026-05-27视觉感知

这篇论文针对从轨迹数据中恢复动力系统方程时,候选单项式库随维度爆炸且难覆盖分数/负指数项的问题,提出用复值 product-unit 网络直接学习稀疏单项式组合,而非预设函数库。在 Lorenz63、Lorenz84、Four-Wing 等混沌系统上,3000 点以上训练时多数试验可精确恢复方程;在人类步态加速度数据上也能生成有界预测,RMSE 约为信号幅值范围的 12–14%。

Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection Figure 1
2026-05-27cs.CV

Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection

Nico Steckhan, Krutarth Prajapati, Weija Shao, Silvia Vock

2026-05-27视觉感知安全鲁棒

面向锯床手部检测等安全关键视觉系统,论文指出传统噪声/模糊鲁棒性测试难覆盖手套、锯屑、眩光等真实语义风险。作者提出本地化工具 SemProbe,将 ODD 因子目录、掩码扩散修补与 YOLO 前后对比和结构化日志串联,用于生成可追溯鲁棒性证据。示例中防切割手套使召回率从 0.91 降至 0.64,重锯屑降至 0.52,显示可定位高风险失效因子。

Touch-R1: Reinforcing Touch Reasoning in MLLMs Figure 1
2026-05-27cs.CV

Touch-R1: Reinforcing Touch Reasoning in MLLMs

Yingxin Lai, Yafei Zhou, Fucai Zhu, Siyu Zhu, Weihao Yuan

Xiamen University, Great Bay University, Fudan University, Nanjing University

2026-05-27视觉感知

这篇论文针对现有多模态/触觉语言模型在视觉与触觉冲突时容易依赖视觉先验、缺少“用触觉证据修正判断”的问题,提出 Touch-R1:用四类光学触觉传感器构建 TouchReason-1M 与评测集,并通过触觉动态预训练、QA 微调和触觉 grounded GRPO,将序数属性奖励、跨传感器一致性和反事实触觉扰动纳入训练。实验中 Touch-R1-7B 在 TouchReason-Bench 上平均超过 Octopi-13B 18.4%、GPT-4o 24.7%,并能生成感知—比较—修正式推理轨迹。

Chaos-SSL: An Attention-Based Self-Supervised Learning Framework with Chaotic Transformation for Medical Image Classification Figure 1
2026-05-27cs.CV

Chaos-SSL: An Attention-Based Self-Supervised Learning Framework with Chaotic Transformation for Medical Image Classification

Joao Batista Florindo

Institute of Mathematics, Statistics and Scientific Computing, University of Campinas, Rua Sergio Buarque de Holanda, 651, Campinas, Brazil

2026-05-27视觉感知

针对医学图像标注稀缺且病灶差异常体现为细粒度纹理的问题,Chaos-SSL用Logistic、Tent、Sine等一维混沌映射构造更难的对比学习视图,并通过注意力融合混沌预训练ConvNeXt-Tiny与ImageNet预训练ConvNeXt-Large特征。实验显示Tent映射预训练30轮后,在ISIC 2018和APTOS 2019上准确率分别达0.9261、0.8726,优于多种SSL基线。

Is an Image Also Worth 16x16=256 Superpixels? A Framework for Attentional Image Classification Figure 1
2026-05-27cs.CV

Is an Image Also Worth 16x16=256 Superpixels? A Framework for Attentional Image Classification

Pedro Henrique da Costa Avelar, Anderson R. Tavares, Luís C. Lamb

Institute of Informatics, Federal University of Rio Grande do Sul (UFRGS), 91501-970, Porto Alegre, Rio Grande do Sul, Brazil

2026-05-27视觉感知

本文针对超像素图分类与ViT自注意力模型长期割裂的问题,提出Superpixel Transformers,将SICGAT与ViT统一为可配置的注意力图像分类框架,支持任意图像分块、连接图和位置编码,并用保留形状与颜色的超像素patch减少聚合信息损失。实验在CIFAR10、FashionMNIST、Imagenette上显示,其优于既有超像素GNN且接近ViT,同时提示受约束的patch连接可能提升ViT表现。

Unsupervised Deep Image Prior for Sparse-View and Limited-Angle Electron Tomography Figure 1
2026-05-27eess.IV

Unsupervised Deep Image Prior for Sparse-View and Limited-Angle Electron Tomography

Serge Brosset, Daniel del Pozo Bueno, Thomas David, Laure Guetaz, Philippe Ciuciu, Zineb Saghi

In practice, most TEM samples are prepared on grids or as thin lamellae. Due to this slab-like

2026-05-27视觉感知

针对电子断层成像在稀疏视角和有限倾角下易产生 missing-wedge 伪影、影响纳米材料三维定量的问题,论文将无需训练数据的 Deep Image Prior 用于同步重建与恢复,以未训练 CNN 作为隐式先验直接拟合退化投影。模拟与铂纳米颗粒实验表明,DIP 在 ±60°、10°步进甚至 ±30°场景下优于传统方法,效果接近监督 U-Net,并能支持较可靠的形貌与尺寸量化。

Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation Figure 1
2026-05-27cs.CV

Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation

Joseph Hoche, David Brellmann, Gianni Franchi

2026-05-27视觉语言视觉感知安全鲁棒

面向机器人、自动驾驶等安全场景中 LVLM 幻觉难以察觉的问题,论文指出仅沿用语言模型不确定性会忽略视觉证据;其核心洞察是高置信预测更依赖图像信息,并提出免训练的 VIG-TUQ,用有无图像的分布差异和视觉注意力为 token 级语言不确定性加权。多数据集和早/晚/原生融合架构实验显示,该方法通常优于现有 token 级不确定性估计,但仍受限于需白盒访问内部表示。

Do Modern Post-Hoc Watermarking Methods Beat Broken-Arrows? Figure 1
2026-05-27cs.CR

Do Modern Post-Hoc Watermarking Methods Beat Broken-Arrows?

Enoal Gesny, Eva Giboulot

2026-05-27视觉感知

针对生成式图像溯源中现代后处理神经水印被默认优于经典方法的假设,论文把多比特方法转成零比特检测框架,与 Broken-Arrows 等经典水印在统一误警率、常见增强和新型攻击下比较。核心洞察是神经检测器缺少密钥并扩大攻击面;实验显示经典方法在现实安全性上更强且鲁棒性不逊色,但几何失真场景文中未充分覆盖。

Image Thresholding: Understanding Bias of Evaluation Metrics towards Specific Evaluation Functions Figure 1
2026-05-27cs.CV

Image Thresholding: Understanding Bias of Evaluation Metrics towards Specific Evaluation Functions

Eslam Hegazy, Mohamed Gabr

2026-05-27视觉感知数据集/基准

本文针对多级图像阈值分割中常用 SSIM、PSNR 是否“公平”评估不同目标函数这一隐含前提展开分析。作者不比较优化器,而是在 BSDS500 上遍历所有阈值,考察 Otsu 与 Kapur 目标函数同质量指标的相关性,指出评测指标本身会偏向特定目标函数。结果显示 Otsu 与 PSNR 在全部图像上相关性更高,与 SSIM 在超过 91% 图像上也优于 Kapur,提示既有算法增益可能部分来自指标偏置。

YOLO26-RipeLoc Lite: A lightweight architecture for tomato ripeness detection and picking point localization in greenhouse robotic harvesting Figure 1
2026-05-27cs.CV

YOLO26-RipeLoc Lite: A lightweight architecture for tomato ripeness detection and picking point localization in greenhouse robotic harvesting

Rajmeet Singh, Manveen Kaur, Shahpour Alirezaee, Irfan Hussain

Department of Mechanical Engineering, Khalifa University, University of Windsor

2026-05-27机器人视觉感知

面向温室采摘机器人在遮挡、光照变化下需同时识别成熟度并给出可抓取点的问题,论文在 YOLO26 上引入轻量特征金字塔、成熟度感知注意力和带中心点回归的紧凑检测头。自采 1500 张番茄图像实验显示,模型总体 mAP@0.5 为 92.9%,成熟番茄为 95.2%,仅 2.38M 参数,剪枝后约 1.8M 且精度损失很小。

PILOT: A Data-Free Continual Learning Approach for Real-Time Semantic Segmentation via Boundary Guidance Figure 1
2026-05-27cs.CV

PILOT: A Data-Free Continual Learning Approach for Real-Time Semantic Segmentation via Boundary Guidance

Yujing Zhou, Prashant Shekhar, Thomas Yang, Yongxin Liu

Department of Mathematics, College of Arts and Sciences, Embry-Riddle Aeronautical University, Daytona, Department of Electrical Engineering and Computer Science, College of Engineering, Embry-Riddle, Aeronautical University, Daytona Beach, FL 32114, USA, divides an image into regions, where each pixel is assigned a semantic label (like "road,"

2026-05-27视觉感知学习理论

面向自动驾驶和机器人中类别持续变化的实时语义分割,PILOT针对PIDNet提出无回放增量学习:冻结原P/I/D主干与旧类别头,仅新增并训练并行边界分支和新类别头,利用高频边界信息学习新类以避免参数干扰。Cityscapes类增量实验显示其能分割新增类别,同时保持旧类mIoU并维持低延迟,优于若干持续学习基线。

COVD: Continual Open-Vocabulary Object Detection with Novel Concept Injection Figure 1
2026-05-27cs.CV

COVD: Continual Open-Vocabulary Object Detection with Novel Concept Injection

Yupeng Zhang, Ruize Han, Yuzhong Feng, Zixin Ren, Yuntong Tian, Liang Wan

Tianjin University., Shenzhen University of Advanced Technology.

2026-05-27视觉感知

面向开放词汇检测部署后类别持续变化、全量重训成本高且易遗忘的问题,论文提出 COVD 任务与 Novel-114 基准。核心洞察是预训练视觉编码器往往已能“看见”新物体,瓶颈在文本语义对齐;NoIn-Det 冻结视觉分支,仅更新少量文本分支参数,并用 RSSD 与 KPD 稳定旧概念空间。实验显示其在新概念学习、旧知识保持上优于现有 VLM 持续学习方法且不增参。

JLT: Clean-Latent Prediction in Latent Diffusion Transformers Figure 1
2026-05-27cs.CV

JLT: Clean-Latent Prediction in Latent Diffusion Transformers

Funing Fu, Tenghui Wang, Junyong Cen, Qichao Zhu, Guanyu Zhou

Wuhan University of Technology, Hangzhou Jiyi Artificial Intelligence Co., Ltd.

2026-05-27生成模型

本文追问在已压缩的 VAE 潜空间中,扩散/flow 模型的预测目标是否仍会影响学习难度。作者在固定 FLUX.2 VAE、同一 130M DiT 骨干和训练设置下提出 JLT,直接预测 clean latent,并指出速度预测会引入各向同性协方差底噪、放大低方差方向。ImageNet 256×256 上,JLT-B/1 的 FID-50K 从匹配速度基线的 6.56 降至 2.56,带 CFG 为 2.50。

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models Figure 1
2026-05-27cs.CV

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

Oscar Chew, Serhii Honcharenko, Qian-Hui Chen, Patricia Lu, Dishant Zaveri, Khoa D. Doan, Kuan-Hao Huang

Texas A&M University 2 \quad{}^{2} National Taiwan University, Stanford University 4 \quad{}^{4} VinUniversity

2026-05-27视觉感知

这篇论文关注视频大模型是否真正保持时间顺序中的主体—事件绑定,而非把长视频当作事件集合。作者提出 DistractionBench,通过插入广告、拼接动作片段和真实赞助段构造干扰,并用 BoE、Yes-bias、No-bias 问题区分跨片段误关联与一般幻觉。对 11 个 VideoLLM 的评测显示,所有模型都存在明显 bag-of-events 行为,且 BoE 错误率通常高于简单肯定偏置,说明当前模型的时间 grounding 仍不可靠。

Semi-Supervised Gaze Estimation via Disentangled Subspace Contrastive Learning Figure 1
2026-05-27cs.CV

Semi-Supervised Gaze Estimation via Disentangled Subspace Contrastive Learning

Qida Tan, Hongyu Yang, Wenchao Du

2026-05-27视觉感知

针对外观式凝视估计依赖大量标注且跨域泛化差的问题,论文提出半监督 DSCL 框架:用 Jacobian 正则将特征解耦到俯仰、偏航等子空间,再利用子空间内由相似度诱导的序关系进行对比学习,从少量标注和大量无标注样本中学习稳健表示。多基准实验显示,该方法在域内和跨域设置下仅用 20%、10% 甚至 5% 标注数据即可接近全监督竞争性能,且可作为即插即用模块。

SoftCap: Soft-Budget Control for Diffusion Transformer Acceleration Figure 1
2026-05-27cs.CV

SoftCap: Soft-Budget Control for Diffusion Transformer Acceleration

Yuhang Zhang, Junxiang Qiu, Huixia Ben, Zhenhua Tang, Shuo Wang, Yanbin Hao

Hefei University of Technology, University of Science and Technology of China, Anhui University of Science and Technology, University of Macau.

2026-05-27生成模型规划控制

DiT 生成质量高但逐步去噪需大量 Transformer 计算,现有缓存加速多靠固定调度或手调阈值,难按单次轨迹风险与已用算力动态取舍。SoftCap 将 Full/Cache 选择建模为软预算反馈控制,用轨迹漂移观测器估计缓存风险,并由 PI 控制器按实际算力调整触发阈值;在 FLUX.1-dev 上相近 FLOPs 下较 SpeCa 提升 ImageReward、降低 LPIPS-Full,且预算表现为软上限而非强制消耗。

IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams Figure 1
2026-05-27cs.CV

IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams

Jinzhao Li, Yinuo Chen, Wenxuan Song, Yijia Lei, Yichi Zhang, Honglei Yan, Panwang Pan, Miao Liu

College of AI, Tsinghua University

2026-05-27视觉感知

面向可穿戴与家庭机器人等持续视频场景,论文指出现有 MLLM 评测多停留在单轮被动问答,难以衡量用户动态增删改主动请求时的交互能力。作者提出 IPIBench,覆盖主动监控、任务管理与被动—主动交织请求,并发现现有模型存在触发不稳定和协调弱的问题;进一步给出免训练的 IPI-Agent,通过交互控制策略与时间门控,在各项设置中稳定提升基座模型表现。

BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation Figure 1
2026-05-27cs.CV

BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation

Yutong Wang, Yunke Wang, Xinyuan Chen, Chang Xu

The University of Sydney 2 Shanghai AI Laboratory

2026-05-27视觉感知

本文针对自动电影预告片中镜头选择与配乐同步常被后处理化或限制为刚性一一匹配的问题,提出 BEAT:用可微调的 MuVA 学习音乐小节与镜头的跨模态兼容性,并以能量自适应 Bar-DP 实现多小节共享镜头的弹性剪辑节奏,再嵌入五阶段 agentic 流水线完成成片。作者还构建 TrailerArena,报告在镜头选择、排序和感知质量等 20 多项指标上优于现有方法。

SCKAN: Structural Consensus-based KAN Prototype Learning for Semi-Supervised Pancreas Segmentation Figure 1
2026-05-27cs.CV

SCKAN: Structural Consensus-based KAN Prototype Learning for Semi-Supervised Pancreas Segmentation

Yuqi Liu, Yufei Chen, Wei Fu, Xiaodong Yue, Shuo Li

2026-05-27视觉感知

针对半监督胰腺分割中标注稀缺与胰腺形态差异导致的监督偏置,SCKAN将胰腺按解剖位置分解为结构原型,通过位置加权对比学习建立跨样本一致性,并用KAN的自适应B样条融合稳定结构共识、过滤样本噪声。作者在两个公开胰腺数据集上验证了有效性,但具体增益幅度在给定片段中未充分说明。

NeR-SC: Adapting Neural Video Representation to Screen Content Figure 1
2026-05-27cs.CV

NeR-SC: Adapting Neural Video Representation to Screen Content

Ruohan Shi, Jiaoyan Zhao, Haogang Feng

2026-05-27视觉感知

本文针对远程桌面、网课和云游戏中的屏幕内容视频,指出其离散色彩、锐利边缘和高时间冗余与自然视频不同。NeR-SC在SNeRV上加入低频子带可学习调色板、多门控密集跨层融合,以及基于嵌入的静帧跳解码。实验在DSCVC/VCD上达40.32/41.73 dB,优于多种神经表示方法,低码率下超过H.264/H.265,并实现无质量损失的实时解码。

Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models Figure 1
2026-05-27cs.CV

Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models

Tao Qi, Huili Wang, Yuanhong Huang, Wendan Wang, Lianchao Zhao, Jinrui Wang, Zichen Qin, Shangguang Wang, Yongfeng Huang

Beijing University of Posts and Telecommunications, Tsinghua University

2026-05-27视觉感知

针对扩散图像生成模型预训练数据是否被未经授权使用,论文指出传统基于图像扰动/去噪的成员推断在预训练场景信号很弱,且灰盒内部特征难用于商业黑盒系统。作者提出 SD-MIA,通过多视角文本扰动触发文本-视觉映射稳定性差异,并用跨模态相关性估计与最大相关池化形成判别信号。在 LAION-mi 和扩展闭源/开源模型评测中,SD-MIA 优于现有黑盒及部分可访问内部特征的基线。

Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V Figure 1
2026-05-27cs.CV

Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

Junhao Wu, Dezhong Yao, Hai Jin

2026-05-27视觉感知

该文针对 Wan2.2-I2V 这类 MoE 视频 DiT 在 W4A4 量化中受激活离群值与去噪时间步分布漂移影响、统一校准易损画质的问题,提出结合 SVDQuant 低秩补偿、GPTQ 残差权重量化,以及按专家和时间步分箱的逐层激活裁剪搜索。OpenS2V-Eval 上峰值显存较 BF16 降低 59.3%,VBench 平均分仅降 0.9%,说明专家与时间步感知校准对低比特视频生成较关键。

ChartAct: A Benchmark for Dynamic Chart Understanding Figure 1
2026-05-27cs.CV

ChartAct: A Benchmark for Dynamic Chart Understanding

Muye Huang, Wu Lin, Lingling Zhang, Hang Yan, Zhiyuan Wang, Yumeng Fu, Zesheng Yang, Jun Liu

School of Computer Science and Technology, Xi’an Jiaotong University, MOE KLNN Lab, Xi’an Jiaotong University

2026-05-27数据集/基准

现有图表理解评测多假设信息静态可见,难以覆盖网页/仪表盘中需悬停、点击、缩放、拖拽才能获得证据的真实场景。ChartAct 将 8 个真实网站的 673 个动态图表嵌入可控交互环境,构建 1440 个问答样本,并设置动态图表与仪表盘两类上下文,考察模型的动作选择、状态观察与跨状态推理。对 11 个多模态模型和 GUI agent 的评测显示,Claude-Opus-4.7 平均成功率 84.5%,但多数模型低于 60%,主要瓶颈在元素定位、交互决策和证据整合。

On the Robustness of Machine Unlearning for Vision-Language Models Figure 1
2026-05-27cs.CV

On the Robustness of Machine Unlearning for Vision-Language Models

Yujie Lin, Kaidi Jia, Jiayao Ma, Chengyi Yang, Jinsong Su

Xiamen University

2026-05-27视觉语言视觉感知安全鲁棒

针对视觉语言模型可能记忆隐私、版权或有害训练信息,而现有遗忘评测容易只验证“表面不回答”的问题,本文系统梳理VLM机器遗忘方法,并按被修改组件建立分类,在多种提示下统一评测。核心洞察是提出上下文、同分布再训练和分布外再训练三类攻击来检验被遗忘多模态知识能否被重新激活。实验显示多种现有方法在这些攻击下仍可恢复目标知识,说明它们往往是隐藏而非真正移除信息。

CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning Figure 1
2026-05-27cs.CV

CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning

Zihan Lin, Songhe Deng, Shuwei He, Danxiang Zhu, Dan Zhang, Yishu Lei, Xianlong Luo, Shikun Feng, Rui Liu

College of Artificial Intelligence, Inner Mongolia University

2026-05-27视觉语言视觉感知

论文针对视频字幕在“整体描述丢细节、分段描述又冗余”之间的矛盾,提出受视频编码启发的 CodecCap:用关键帧字幕记录稳定场景语义,用残差字幕只描述局部动作、运动和状态变化。作者还设计 VidCapQA 以问答方式衡量字幕可恢复的视觉证据,并构建 CodecVDC-100K 数据集;实验显示在相同 VLM 下,CodecCap 相比直接生成字幕在 VidCapQA 上更能保留细粒度信息。

DinoComplete: 3D Shape Completion with Distilled Semantic Priors and State Space Models Figure 1
2026-05-27cs.CV

DinoComplete: 3D Shape Completion with Distilled Semantic Priors and State Space Models

Furkan Mert Algan, Eckehard Steinbach

Munich Institute of Robotics and Machine Intelligence, School of Computation Information and Technology, Technical University of Munich

2026-05-27三维

针对部分扫描在遮挡、噪声和未知类别下仅靠TSDF几何难以补全缺失结构的问题,DinoComplete将多视角DINO语义蒸馏为体素对齐特征,并用多尺度Voxel Mamba融合几何与语义以建模长程依赖;在ShapeNet未知类和ScanNet实扫物体上,相比PatchComplete、DiffComplete等取得更低CD/更高IoU,同时参数、显存和推理时间更少。

Object Pose and Shape Estimation for Grasping: Does it Work? Figure 1
2026-05-27cs.RO

Object Pose and Shape Estimation for Grasping: Does it Work?

Pavan Karke, Kushal Shah, Gaurav Singh, Md Faizal Karim, K Madhava Krishna, Rajat Talak

∗ Equal Contributions, 1 Robotics Research Center, IIIT Hyderabad, 2 National University of Singapore

2026-05-27三维

本文针对“单视角物体姿态与形状估计是否已足以支撑抓取”这一问题,比较端到端 AnyGrasp 与先重建物体再做 antipodal 采样的模块化方案。核心洞察是,开放集三维估计模型已能为小物体生成更充分的候选抓取;在仿真、数据集和真实 Xarm7 实验中模块化方法整体优于端到端,但性能依赖重建精度,在杂乱遮挡场景会退化,并可结合视觉语言模型实现单视角语言条件抓取。

Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking Figure 1
2026-05-27cs.CV

Leveraging Text-to-Image Diffusion Models for Unsupervised Visual Object Tracking

Zhengbo Zhang, Zhigang Tu, Junsong Yuan, De Wen Soh, Bo Du

2026-05-27视觉感知生成模型

针对无监督视觉跟踪难以利用细粒度语义、结构和视频上下文的问题,本文提出 Diff-Tracking,将预训练文生图扩散模型重新解释为文本提示与图像区域的跨注意力桥梁,通过首帧框学习目标 prompt,并用运动信息在线更新;在六个跟踪基准上超过现有无监督方法,消融显示收益主要来自跟踪专用设计而非直接使用 Stable Diffusion 特征。

Revealing the core dimensions underlying representations in brains, behavior and AI Figure 1
2026-05-27cs.CV

Revealing the core dimensions underlying representations in brains, behavior and AI

Florian P. Mahner, Ka Chun Lam, Francisco Pereira, Martin N. Hebart

Max Planck Institute for Human Cognitive and Brain Sciences, National Institute of Mental Health, Justus Liebig University Giessen, Center for Mind, Brain and Behavior

2026-05-27强化学习

针对神经科学、行为与 AI 中相似性矩阵只能比较表征、难以解释其潜在维度的问题,论文提出 SRF:基于对称非负矩阵分解,从完整或稀疏相似性数据中恢复低维、非负且可解释的维度,并用交叉验证选择秩。仿真及行为、脑成像、语义和深度网络数据表明,SRF 在缺失数据下仍能提取有意义维度,可预测独立行为属性,并在确认性检验中较 RSA 有更高统计功效。

I2PRef: Image-Driven Point Completion with Iterative Refinement Figure 1
2026-05-27cs.CV

I2PRef: Image-Driven Point Completion with Iterative Refinement

Azhar Hussian, Marina Ritthaler, André Kaup, Vasileios Belagiannis

Distance improvement over prior methods. Code is available at:, gional Development and Energy (project BAVAR-RADAR, label DIK0622)

2026-05-27视觉感知

针对遮挡、噪声导致的点云缺失,以及既有多模态方法仅把图像当辅助提示的问题,I2PRef将单张RGB图像作为主要几何来源,先用轻量I2P模块直接生成完整粗点云,再用带点自注意力与图像交叉注意力的P2P Transformer迭代修正坐标细节。在ShapeNet-ViPC上相对既有方法降低Chamfer Distance 12.3%,并报告更好的完整性与细节保留。

SIMPC: Learning Self-Induced Mirror-Point Consistency for Unsupervised Point Cloud Denoising Figure 1
2026-05-27cs.CV

SIMPC: Learning Self-Induced Mirror-Point Consistency for Unsupervised Point Cloud Denoising

Chengwei Zhang, Xueyi Zhang, Tao Jiang, Xinhao Xu, Wenjie Li, Fubo Zhang, Longyong Chen

National Key Laboratory of Microwave Imaging, Aerospace, Information Research Institute, Chinese Academy of Sciences, Beijing, China 2School of Computing, National University of, a distribution centered at a clean pixel value. In contrast

2026-05-27规划控制三维

点云噪声直接扰动坐标,导致无监督去噪难以像图像那样建立稳定对应,现有加噪或 EMD 映射存在点级对应歧义。SIMPC 的核心是从单个噪声点出发,利用去噪过程中的几何先验生成位于潜在表面另一侧的镜像点,并用镜像点一致性约束两者收敛到同一表面位置。实验显示其在合成与真实噪声数据上优于现有无监督方法,并超过部分强监督基线。

Small Object Detection in Industrial Recycling: A New Dataset and YOLO Performance Evaluation Figure 1
2026-05-27cs.CV

Small Object Detection in Industrial Recycling: A New Dataset and YOLO Performance Evaluation

Oussama Messai, Abbass Zein-Eddine, Abdelouahid Bentamou, Mickael Picq, Nicolas Duquesne, Stéphane Puydarrieux, Yann Gavet

2026-05-27视觉感知数据集/基准

面向工业回收中金属碎片等小、密集、重叠目标难以实时可靠检测的问题,论文发布含1万余图像、12万实例的SDOOD数据集,并系统评测多种YOLO/深度监督检测方案,进一步考察预处理、数据增强、合成数据、基于框的长度测量与分辨率/缩放鲁棒的异常检测。主要结果表明该基准可揭示检测精度、速度和工业可部署性的权衡,但具体最佳模型与增益数值在给定片段中未充分说明。

No Figure
2026-05-27cs.CV

Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos

Dingkun Wei, Zehong Shen, Yan Xia, Georgios Pavlakos, Yujun Shen, Xiaowei Zhou

Zhejiang University, The University of Texas at Austin

2026-05-27视觉感知

该文针对单目人体运动恢复虽位置误差低、但常抖动或过度平滑的问题,指出关键缺口在于缺少可靠的速度、加速度等高阶时序约束。作者提出可接入现有 HMR 的 HTD-Refine,并用 PVA-Net 从视频估计2D关键点、3D速度和加速度,再在全局优化中作为软约束细化轨迹。实验显示其能稳定提升多种基线的全局轨迹精度与运动自然度,尤其改善高频动态和时序一致性。

RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extraction Figure 1
2026-05-27cs.CV

RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extraction

Chenxu Peng, Chenxu Wang, Yimian Dai, Yongxiang Liu, Ming-Ming Cheng, Xiang Li

VCIP, CS, Nankai University, AAIS, Nankai University, College of Electronic Engineering, National University of Defense Technology, Changsha, China

2026-05-27数据集/基准

针对现有航拍道路数据集地域单一、标注粒度和连通性不足导致模型泛化差的问题,论文构建了覆盖38国223城的WorldRoadSeg-360K,并提出RoadGIE交互式道路提取框架,用点击与涂鸦提示显式编码道路拓扑,结合专家引导提示、拓扑语义实例化和骨架召回损失提升迭代稳定性。实验显示其在分割精度和连通性上优于现有方法,且仅3.7M参数,适合高效标注与跨域应用。

REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization Figure 1
2026-05-27cs.CV

REVERSE: Reinforcing Evidence Verification and Search for Agentic Image geo-localization

Yong Li, Furong Jia, Dacheng Yin, Kang Rong, Fengyun Rao, Jing Lyu, Fan Zhang

Peking University, The Hong Kong University of Science and Technology

2026-05-27视觉感知

针对图像地理定位中仅靠单次视觉预测或简单检索易被陌生地标、错误裁剪和噪声结果误导的问题,REVERSE将任务改写为多轮“看哪里、搜什么、信什么”的代理推理,并用区域标注、检索证据标签与过程奖励训练工具使用和证据筛选。实验中4B模型在Im2GPS3k的25km准确率达48.3%,优于检索增强基线,并接近更大模型表现。

Receipt Replay OOD: A Small Benchmark for Screen Replay Detection Under Domain Shift Figure 1
2026-05-27cs.CV

Receipt Replay OOD: A Small Benchmark for Screen Replay Detection Under Domain Shift

Alexander Vinogradov

IU International University of Applied Science, publicly available., samples available in public datasets. In practice, identity, conditions rather than artificially prepared in laboratory

2026-05-27视觉感知数据集/基准

针对证件屏幕重放检测在真实域移下缺少 OOD 评测的问题,论文提出 Receipt Replay OOD:用收据这类与证件相似但无隐私约束的平面纸质物构建小型公开基准,含真实拍摄、重放样本、元数据和框标注。实验显示,DLC-2021 上表现相近的 CNN、EfficientNet 与 DINOv2 模型迁移到该基准后鲁棒性差异显著,前两者退化明显,DINOv2 最稳健,说明常规域内评测会掩盖跨域泛化问题。

OSMa-Bench++: Toward Open-Ended Benchmarking of Semantic Mapping for Manipulation with Prompt-Generated Synthetic Scenes Figure 1
2026-05-27cs.CV

OSMa-Bench++: Toward Open-Ended Benchmarking of Semantic Mapping for Manipulation with Prompt-Generated Synthetic Scenes

Regina Kurkova, Maxim Popov, Sergey Kolyubin

2026-05-27机器人数据集/基准

面向机器人操作的语义地图评测仍依赖固定场景,难覆盖小物体、遮挡、杂乱和光照等关键失败例。OSMa-Bench++用LLM提示生成并筛选SceneSmith室内场景,转换到Habitat/OSMa-Bench流程,并利用原始提示生成面向计数与关系的PromptGT VQA。40个合成场景中提示匹配率约90%、对象保真下界98%;对ConceptGraphs和BBQ的评测显示相机光照显著拉低分割,提示约束问答总体低于30%,暴露出现有语义地图在操作相关关系与小物体表示上的明显短板。

The Kalman Evolve: Closing the Gap in Kalman Filtering via Interpretable Algorithm Discovery Figure 1
2026-05-27cs.LG

The Kalman Evolve: Closing the Gap in Kalman Filtering via Interpretable Algorithm Discovery

Vasileios Saketos, Ming Xiao

KTH Royal Institute of Technology

2026-05-27视觉感知

针对多普勒雷达、LiDAR 等真实感知中观测非线性导致传统卡尔曼滤波仿射更新失配的问题,本文提出 Kalman Evolve:先学习噪声协方差,再借助 LLM 引导的进化搜索发现可解释的非仿射更新结构,同时保留递归滤波形式。作者还分析说明仿射估计在常见非线性传感模型下存在结构性次优;在合成与真实跟踪任务上,相比 OKF 等强基线最高降低约 12% RMSE,计算成本相近。

Cesarean Scar Defect Segmentation in Transvaginal Ultrasound Images: a Dataset and Benchmark Figure 1
2026-05-27cs.CV

Cesarean Scar Defect Segmentation in Transvaginal Ultrasound Images: a Dataset and Benchmark

Yuan Tian, Yue Li, Wei Xia, Tianyu Xu, Jian Zhang, Liye Shi, Jing Liu, Yang Wang, Ming Liu, Qing Xu, Yixuan Zhang, Maggie M. He, Xiangjian He

2026-05-27视觉感知数据集/基准

剖宫产瘢痕憩室在经阴道超声中常因病灶小、形态不规则和操作者依赖而漏诊,且此前缺少公开分割数据。论文构建首个CSD超声分割数据集与基准:来自临床的1111张图像和16段视频,经匿名化筛选得到501个确诊阳性样本,并由超声医师与博士生按指南完成像素级标注。其主要结果是补齐该任务的数据与评测资源;具体算法增益在给定文本中未充分说明。

Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning Figure 1
2026-05-27cs.CV

Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning

Mingkang Dong, Hongyi Cai, Xiwen Lei, Jie Li, Tao Zhang, Muxin Pu

2026-05-27视觉语言

针对多模态指令数据冗余且现有选择信号随模型或数据集变化需重算的问题,OFA在冻结CLIP空间聚类生成伪标签,只训练一次轻量选择器,并用低置信度作为可迁移的信息量信号。实验显示仅用15% LLaVA-665K可达全量98.3%,迁移到未见Vision-Flan-186K还超过全量10.6%,并可跨Qwen2.5-VL与LLaVA模型复用。

No Figure
2026-05-27cs.CV

Self-Intersection-Aware 3D Human Motion Generation Using an Efficient Human Sphere Proxy

Pascal Herrmann, Maarten Bieshaar, Dennis Mack, Robert Herzog, Juergen Gall

2026-05-27三维

本文针对三维人体动作生成中常被常规指标掩盖的肢体自穿插问题,提出用少量球体近似人体网格,并在训练中加入与模型无关的自穿插惩罚。相比三角网格检测,该代理将损失计算提速约98%、显存降低83%,可接入 MDM 与 MoMask;实验显示生成动作自穿插最多减少49%,同时多数评测指标也有所改善。

CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains Figure 1
2026-05-27cs.CV

CIRCLED: A Multi-turn CIR Dataset with Consistent Dialogues across Domains

Tomohisa Takeda, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

\addr 1 Graduate School of Information Science and Technology, The University of Tokyo, Tokyo, Japan

2026-05-27数据集/基准

针对现有多轮组合图像检索数据集对话历史不一致且局限于时尚域的问题,CIRCLED 将每轮图文查询设计为持续逼近同一目标图像,并由 CIReVL 检索流程结合成功率、轮数、一致性和冗余过滤构建。数据扩展自 FashionIQ、CIRR、CIRCO,覆盖9个子集、22,608个2–6轮会话和202,845张图像;论文还给出多种基线及 Hits@10、Final Recall@10、AUC 评测,用于分析逐轮与最终检索表现。

Learning Reference-Guided Exposure Correction with Hybrid Illumination Characteristics Figure 1
2026-05-27cs.CV

Learning Reference-Guided Exposure Correction with Hybrid Illumination Characteristics

Hao Ren, Zetong Bi, Zhaoliang Wan, Hui Cheng

2026-05-27视觉感知

针对无配对监督下曝光校正难以在参考图像与源图像语义差异中分离“光照风格”的问题,HICNet用内容无关曝光编码器提取区域亮度、边缘对比和亮度高阶统计,并以源/参考嵌入差驱动FiLM调制与通道重平衡。实验称其在公开基准上优于或接近现有方法,并能泛化到未见场景。

Measuring Prediction Uncertainty in Neural Cellular Automata Figure 1
2026-05-27eess.IV

Measuring Prediction Uncertainty in Neural Cellular Automata

Ario Sadafi, Michael Deutges, Nassir Navab, Carsten Marr

2026-05-27安全鲁棒

针对NCA医学图像分割虽轻量但难判断预测是否可信的问题,论文把NCA视为动力系统,提出无需改结构或重训的resilience:扰动最终隐状态并继续迭代,若掩码能恢复则置信更高。五个生物医学分割基准上,该指标在选择性预测和失效检测中整体比多种基线更稳定,能更好标记低质分割案例。

Joint 2D-3D Segmentation and Association in Street-level Imaging Figure 1
2026-05-27cs.CV

Joint 2D-3D Segmentation and Association in Street-level Imaging

Amir Melnikov, Masayuki Tanaka, Yusuke Monno, Masatoshi Okutomi

2026-05-27视觉感知三维

面向街景影像构建空间数字孪生时,2D语义纹理与3D几何之间难以保持跨视角一致,且传统MOT依赖连续帧。论文将Grounded-SAM零样本分割与COLMAP SfM点轨结合,用共享3D点替代2D时序跟踪来关联同一建筑实例,并输出2D轨迹与3D分割点云;实验显示相较2D跟踪方法覆盖率和身份保持更稳,在复杂城市场景取得约22%性能提升。

METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition Figure 1
2026-05-27cs.CV

METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition

Mélodie Boillet, Solène Tarride, Christopher Kermorvant

2026-05-27视觉感知数据集/基准

针对现有ATR/OCR评测偏向现代英文或中文干净文本、难以指导真实档案场景选型的问题,METATR v1.0构建了覆盖29种语言、手写与印刷、复杂版面和历史文档的动态基准,并统一提示、归一化与评测协议。实验比较开源专用系统和Gemini、Claude等闭源模型,结果显示商用模型整体更稳定,但在不同文字、版式和手写场景仍差异明显,尚不能说明文本识别已被彻底解决。

Rotation-Invariant Spherical Watermarking via Third-Order SO(3) Representation Coupling Figure 1
2026-05-27cs.CV

Rotation-Invariant Spherical Watermarking via Third-Order SO(3) Representation Coupling

Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Antonios Argyriou, Wu Liu, Weiping Wang

2026-05-27视觉感知

针对全景图像水印在任意三维旋转下难以可靠提取的问题,论文将全景建模为球面信号,提出 TRIAD:把水印嵌入高阶球谐系数,并通过三阶 SO(3) 表示耦合投影到平凡表示,构造保相位的球面双谱不变量。实验显示其在连续旋转攻击下接近完美鲁棒,同时保持较高视觉保真度。

PinPoint: Prompting with Informative Interior Points Figure 1
2026-05-27cs.CV

PinPoint: Prompting with Informative Interior Points

Pouya Sadeghi, Shawn He, Pedro Pablo Guerrero Vela, C. Thomas, Alex Wong, Sirisha Rambhatla

University of Waterloo, Critical ML, University of Waterloo

2026-05-27视觉感知

针对VLM+SAM指代表达分割中训练自由方法落后于微调/RL方法的问题,论文指出主要瓶颈不是骨干能力,而是VLM框提示的歧义。PinPoint无需训练,融合显著性、边缘、熵和空间先验选取稳定且分散的内部点,并由冻结VLM标注正负后提示SAM。结果显示在RefCOCO/+/g上相对朴素采样提升12–18 cIoU,并以每次查询两次VLM调用接近监督和RL专门方法。

SteelDS: A High-Resolution Video Dataset of E40 Steel Scrap for Object Detection and Instance Segmentation Figure 1
2026-05-27cs.RO

SteelDS: A High-Resolution Video Dataset of E40 Steel Scrap for Object Detection and Instance Segmentation

Melanie Neubauer, Christian Rauch, Gerald Koinig, Alexia Tischberger-Aldrian, Roland Pomberger, Elmar Rueckert

2026-05-27视觉感知数据集/基准

面向钢铁回收中磁选后仍需人工剔除铜杂质的环节,SteelDS补足了工业破碎金属缺少公开实例级标注数据的空白。其核心贡献是采集传送带上高分辨率视频,并为E40钢/铜碎片提供像素级实例掩码、类别和尺寸分组,覆盖不同密度、间距与遮挡条件。数据集包含5个子集、24297帧、396个钢件和101个铜件,可作为目标检测、实例分割和多目标跟踪的基准;文中主要给出数据资源与任务支撑,未充分说明模型性能增益。

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding Figure 1
2026-05-27cs.CV

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

Zhejiang University

2026-05-27视觉语言视觉感知

针对长视频推理中固定稀疏采样易漏掉短时细节、反复检索又拉长上下文且信用分配混乱的问题,DynFrame让模型在自回归推理中直接生成时间片段和采样密度token,并用动态帧注入获取多粒度证据;SD-GRPO按检索边界分别奖励采样决策与答案生成。文中在六个视频理解/时序定位基准上显示,4B模型可接近强7B–8B基线,8B在多数指标达到新SOTA。

Memory-Distilled Selection for Noise-Robust Anomaly Detection Figure 1
2026-05-27cs.CV

Memory-Distilled Selection for Noise-Robust Anomaly Detection

Sirojbek Safarov, Jaewoo Park, Yoon Gyo Jung, Kuan-Chuan Peng, Wonchul Kim, Seongdeok Bang, Octavia Camps

2026-05-27视觉感知安全鲁棒

工业视觉异常检测常假设训练集全为正常样本,但实际产线标注筛查难免混入缺陷,导致模型随噪声比例升高明显退化。MeDS用随机子采样构建稀疏记忆库集成,将其近邻距离视作低通式噪声过滤信号,再蒸馏到重建评分网络,并通过自筛选干净样本迭代微调以兼顾图像级鲁棒性和像素级定位。实验显示其无需按噪声率调参,在MVTecAD 40%噪声下图像AUROC达99.16%,并在VisA、Real-IAD噪声设置取得SOTA。

Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models Figure 1
2026-05-27cs.CV

Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

Yuanwei Hu, Bo Peng, Yadan Luo, Zhen Fang, Ling Chen, Jie Lu

2026-05-27视觉语言视觉感知

面向CLIP等视觉语言模型的零样本后验OOD检测,论文指出常用“类别文本嵌入即视觉原型”的假设存在结构性模态鸿沟,难靠提示词消除;据此提出利用测试时无标注数据流和VLM软预测在线学习视觉空间类别原型,并给出收敛分析。实验在多种OOD设置达SOTA,ImageNet-1K上FPR95为12.79%、AUROC为97.75%,较AdaNeg进一步提升。

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding Figure 1
2026-05-27cs.CV

DV-SFT: Direct Vision Supervision for Fine-Grained Visual Understanding

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Bing Wang, Zhixing Tan

School of Computer Science and Technology, Beijing Institute of Technology, Zhongguancun Academy, Beihang University, Zhongguancun Laboratory, Southeast Academy of Information Technology, Beijing Institute of Technology

2026-05-27视觉感知

本文针对多模态大模型训练中视觉 token 只通过文本答案间接受监督、易丢失细粒度信息的问题,提出 DV-SFT:利用 OCR 场景中图像 patch 与文字的直接对应,为视觉 token 自动构造词级标签,并用与文本相同的 next-token loss 训练,无需改结构或额外前向。实验显示其在多个文档理解、OCR、图表和泛化 VQA 基准上稳定优于标准 SFT,分析表明收益主要来自更精细的视觉表征与更高效的跨模态对齐。

Adaptation-Free Heterogeneous Collaborative Perception with Unseen Agent Configurations Figure 1
2026-05-27cs.CV

Adaptation-Free Heterogeneous Collaborative Perception with Unseen Agent Configurations

Hyunchul Bae, Heejin Ahn

School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)

2026-05-27视觉感知

面向开放世界协同3D感知中新增车辆/路侧端传感器规格、编码器结构未知的问题,论文提出ALF:不再传输配置相关的中间特征,而用紧凑3D框消息生成伪BEV,并结合自车特征合成兼容的辅助特征,实现免适配的晚到中间融合。在V2X-Real的64个零样本配置案例中,ALF相对最强基线mAP@0.7提升35.91%,每智能体每帧仅需120字节通信。

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation Figure 1
2026-05-27cs.CV

OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation

Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

2026-05-27视觉感知

现有统一音频-视频-文本检索模型虽能生成三模态联合嵌入,但训练多只做两两 InfoNCE,导致联合表示及音频相关方向监督不足。OmniRetriever 将停止梯度的联合嵌入作为教师蒸馏到单模态嵌入,并用 Tuple-InfoNCE 直接约束联合表示。7B 模型在 Clotho、SoundDescs 上较 Gemini Embedding 2 提升 13.3–18.0 R@1,在自建 12 方向 OmniRetriever-Bench 上 AVG-all 达 34.84。

JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search Figure 1
2026-05-27cs.CV

JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search

Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai

University of Pennsylvania

2026-05-27视觉感知

高分辨率 ViT 的全注意力在视觉基础模型中精度强但推理开销随序列长度二次增长,限制部署。JetViT 的关键思路不是从头训练高效架构,而是在预训练模型后进行注意力搜索,用线性、窗口注意力替换冗余全注意力,并保留少量关键全注意力块。在 DINOv3 与 DepthAnythingV2 上,H100 实测最高吞吐提升 1.79×、延迟降低 44.81%,且基本不损失精度。

Attenuation-Resilient Alternating Optimization for Laparoscopic Liver Landmark Detection Figure 1
2026-05-27cs.CV

Attenuation-Resilient Alternating Optimization for Laparoscopic Liver Landmark Detection

Lanqing Liu, Ruize Cui, Jialun Pei, Diandian Guo, Tiffany Y. So, Pheng-Ann Heng, Jing Qin

2026-05-27视觉感知优化算法

面向腹腔镜肝脏 AR 导航中地标受暗区光照衰减、纹理干扰和像素分割与连续曲线几何不匹配影响的问题,论文提出 A2ONet:用 IFC 做照明场补偿,FOSF 强化方向/频率选择的曲线线索,并以 ASCO 在分割与显式曲线建模间交替优化,兼顾连续性和端点定位。在 L3D-2K、L3D、P2ILF 上均优于对比方法,L3D-2K 达到 53.51% DSC、38.32% IoU。

DelowlightSplat: Feed-Forward Gaussian Splatting for Lowlight 3D Scene Reconstruction Figure 1
2026-05-27cs.CV

DelowlightSplat: Feed-Forward Gaussian Splatting for Lowlight 3D Scene Reconstruction

Fuzhen Jiang, Zengtian Xie, Zhuoran Li

2026-05-27三维

论文针对低照度下稀疏位姿图像的前馈3D Gaussian重建容易受噪声、偏色和匹配失效影响的问题,提出DelowlightSplat:先构造仅退化输入视图、保持目标视图干净的可控低光多视图基准,再用轻量Lowlight Adapter提升跨视图可匹配性,并结合代价体多视图推理直接预测正常照明的3D高斯。实验显示其在低光新视角合成中优于直接MVSplat和先增强再重建流程。

MSCGC-KAN: Multi-scale Causal Graph Convolution and Kolmogorov-Arnold Feature Mapping for EEG Emotion Recognition Figure 1
2026-05-27cs.CV

MSCGC-KAN: Multi-scale Causal Graph Convolution and Kolmogorov-Arnold Feature Mapping for EEG Emotion Recognition

Haoliang Gong, Qingshan She, Jiale Xua, Yunyan Gao, Xugang Xi

School of Automation, Hangzhou Dianzi University, Hangzhou 310018, China, Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications

2026-05-27视觉感知

针对预训练 EEG 模型微调时线性头难以捕捉多尺度情绪动态与通道功能连接的问题,MSCGC-KAN在 CBraMod 后加入多尺度因果图卷积和 Kolmogorov-Arnold 非线性映射,强化时空判别特征。FACED 上平衡准确率达60.66%,较线性头提升5.91个百分点;SEED-VII 达33.27%,提升2.03个百分点。

MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation Figure 1
2026-05-27cs.CV

MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation

Zichun Wang, Hairong Shi, Bingzheng Wei, Yan Xu, Zihua Wang

2026-05-27视觉语言视觉感知强化学习

针对3D医学扫描中自由文本查询往往隐含目标、现有分割token难以解释且泛化受限的问题,MedVol-R1将临床推理先落到可验证的关键轴向切片和2D框,再由冻结MedSAM2传播成3D掩码;训练上用冷启动SFT接GRPO,并以证据选择、定位和跨切片一致性奖励替代人工CoT。其在CT-ORG、AbdomenCT-1K、KiTS23上优于强基线,RL相较纯SFT带来明确增益。

Gaussian-Voxel Duet: A Dual-Scaffolding Hybrid Representation for Fast and Accurate Monocular Surface Reconstruction Figure 1
2026-05-27cs.CV

Gaussian-Voxel Duet: A Dual-Scaffolding Hybrid Representation for Fast and Accurate Monocular Surface Reconstruction

Zhenhua Du, Zhen Tan, Haoyu Zhang, Dewen Hu, Shuaifeng Zhi, Peidong Liu

2026-05-27三维

该文针对单目多视图重建中 3DGS 几何不准、神经 SDF 又训练昂贵的矛盾,提出 Gaussian-anchor 与稀疏体素 SDF 的双脚手架表示,通过显式锚点约束和隐式表面牵引把高斯限制在表面窄带内,减少 floaters 并保留渲染灵活性。在 ScanNet++、ScanNetv2 和 DeepBlending 上,方法取得领先的表面重建与新视角合成效果,同时保持快速收敛和实时渲染。

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling Figure 1
2026-05-27cs.CV

FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling

Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han

Hainan International College, Minzu University of China, School of Information Engineering, Minzu University of China, Shanghai Jiao Tong University, Institute of Automation, Chinese Academy of Sciences

2026-05-27视觉语言视觉感知

针对藏语视觉语言研究缺少训练数据、对齐语料与可复现实验基准的问题,FTibSuite同时发布FTibData、FTibBench和基于Qwen3-VL-8B-Instruct的FTibVLM,采用藏语继续预训练、图文对齐、 multimodal 指令微调三阶段流程,并用机器筛查加人工校验控制基准翻译噪声。实验显示该流程显著提升藏语多模态能力,MMBench由42.97升至67.78,POPE-random由47.53升至80.56,BinaryVQA达76.01;但增益可能主要来自数据与适配流程,单独创新来源仍需更多消融说明。

O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding Figure 1
2026-05-27cs.CV

O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

Peiran Wu, Yunze Liu, Chi-Hao Wu, Chen Chen, Junxiao Shen

University of Bristol, University of Central Florida

2026-05-27视觉感知

面向全模态视频理解中音视频联合 token 过长、现有评测难以隔离真实音画关联的问题,论文构建经“去音频”筛选的 UGC-AVQA,并提出免训练 OMAC 用视觉记忆分布保留关键画面与音频锚点,再以 O-MARC 做压缩感知蒸馏。结果显示在 Qwen2.5-Omni-3B 上四项平均分 45.8,高于全 token 44.1 与 OmniZip 41.0,同时 OMAC 降低约 34.6% 延迟和 34.7% 显存。

TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting Figure 1
2026-05-27cs.CV

TrackRef3D: Multi-View Consistent Track-then-Label for Open-World Referring Segmentation in 3D Gaussian Splatting

Yuyang Tan, Renhe Zhang, Hang Zhang, Ao Li, Xin Tan

2026-05-27视觉感知强化学习三维

针对现有 R3DGS 依赖逐场景人工标注、逐视角伪掩码易产生多视角不一致且对短/长查询泛化不足的问题,TrackRef3D 将对象发现与语义落地解耦为“先跟踪后标注”:用视频轨迹聚合同一物体的跨视角预测,经同义聚类与轨迹投票确定统一语义,并结合可见性描述生成和多正样本对比训练同时学习类别与细粒度指代表达。文中在 Ref-LERF、LERF-OVS、3D-OVS 等基准及室内场景上报告达到 SOTA。

Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer Figure 1
2026-05-27cs.CV

Scheduled Style Injection: Expanding the Style-Content Pareto Frontier in Training-Free Diffusion-based Style Transfer

Amey Sunil Kulkarni

2026-05-27生成模型

本文针对 StyleID 在所有层和去噪步使用统一 γ 导致风格强度与内容保持被固定绑定的问题,系统研究按解码层、时间步调度风格注入及 ControlNet 几何条件。核心洞察是浅层和早期步应更强保护结构、后期再释放风格,且 γ 调度与 ControlNet 近似正交。35 组、2.8 万余图实验显示最佳配置 ArtFID 从 28.801 降至 27.036,并在多个 SD 版本上保持排序一致。

Recursive Flow Matching Figure 1
2026-05-27cs.LG

Recursive Flow Matching

Jiahe Huang, Sihan Xu, Sharvaree Vadgama, Rose Yu

University of California, San Diego, University of Michigan

2026-05-27生成模型

面向物理时空动力学预测,论文针对扩散/流匹配在少步采样下速度与保真度难兼顾的问题,提出 Recursive Flow Matching:递归构造不同离散尺度的轨迹族,并在共享状态处施加跨尺度自一致约束,以降低离散误差和滚动累积误差。实验称在科学仿真基准上可用 1–4 步达到接近多步求解器的精度,相比扩散模拟器最高加速 20 倍,并较普通流匹配降低 15% 以上 MSE。

A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection Figure 1
2026-05-27cs.CV

A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection

Malikussaid, Imad Gohar

2026-05-27视觉语言视觉感知

针对风机叶片巡检中“检测有框、报告靠人”以及通用VLM易丢失小缺陷、产生维护幻觉的问题,论文提出解耦的 Eyes-Bridge-Brain 架构:用YOLO26-OBB保留原分辨率定位,确定性网格 token 连接空间证据,再以QLoRA微调的4-bit Qwen生成JSON报告并用RAFT对齐42条规程。实验显示完整系统BLEU-4达0.41、幻觉率4%、专家分8.6/10,明显优于零样本VLM基线。

ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation Figure 1
2026-05-27cs.CV

ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation

Akide Liu, Jinbo Xing, Chaojie Mao, Ye Li, Zeyu Zhang, Yefei He, Weijie Wang, Zihan Wang, Yu Liu, Gholamreza Haffari, Bohan Zhuang

2026-05-27视觉感知

本文针对分钟级电影化视频生成中“保留初始画面状态”和“多镜头叙事结构”难以兼得的问题,提出 MSVE 任务,并指出瓶颈不只是上下文长度,而是上下文分配失当。ReCA 在推理阶段对冻结短视频生成器做递归上下文分配,分层规划、选择当前镜头相关状态并持续刷新结构化记忆。在 MSVE-Bench 等评测中,其平均归一化得分较最强基线提升 8–16%,多镜头一致性指标提升 28–43%。

CmIVTP: Cross-modal Interaction-based Vessel Trajectory Prediction for Maritime Intelligence Figure 1
2026-05-27cs.CV

CmIVTP: Cross-modal Interaction-based Vessel Trajectory Prediction for Maritime Intelligence

Yuxu Lu, Dong Yang, Xiaoyu Li, Mengwei Bao, Congcong Zhao

2026-05-27规划控制

面向繁忙水域中 AIS 稀疏、延迟或缺失以及单纯 CCTV 难以刻画船舶动力学的问题,CmIVTP 将 AIS 运动信息、CCTV 环境语义和目标感知场景特征通过跨模态注意力融合,并用不确定性变分解码器与历史轨迹聚类库生成可行候选轨迹;论文还构建同步 AIS-CCTV 的 Maritime-MmD+ 数据集,实验显示其在多模态船舶轨迹预测基准上优于对比方法。

InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward Figure 1
2026-05-27cs.CV

InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward

Zhiwei Ning, Wenwen Tong, Xiangli Kong, Shengnan Ma, Ziyi Shang, Jingcheng Ni, Tao Hu, Yong Xien Chng, Jixuan Ying, Zehuan Wu, Hanming Deng, Jie Yang, Yuanjie Zheng, Wei Liu, Lewei Lu

Shanghai Jiao Tong University, Shandong Normal University

2026-05-27强化学习

论文针对现有 VLM 视觉推理过度依赖文本 CoT、工具使用浅且长程任务奖励稀疏的问题,提出 InterSketch:在推理中交替生成文本理由并调用裁剪、旋转、几何标注等确定性工具形成可校正视觉草图;训练上先用含错误恢复轨迹的合成 VT-CoT 数据冷启动,再用按工具类型设计的逐步奖励做强化学习。实验称其在多项复杂视觉推理基准达到 SOTA,并超过 Gemini-3-Pro,同时保持通用理解能力。

$R^3$: 3D Reconstruction via Relative Regression Figure 1
2026-05-27cs.CV

$R^3$: 3D Reconstruction via Relative Regression

Congrong Xu, Huachen Gao, Xingyu Chen, Yuliang Xiu, Jun Gao, Anpei Chen

University of Michigan, Westlake University, Research done during an internship at Westlake University.Corresponding author.

2026-05-27三维

针对前馈三维重建在长序列/流式场景中依赖全局坐标、平移尺度随时间增大而难以回归的问题,R³将位姿学习改为成对相对位姿回归,并用轻量 MLP 预测旋转/平移置信度,统一用于训练加权、推理聚合和关键帧管理。该方法同一模型支持离线全上下文与因果有界内存流式重建,372M 参数下在位姿估计和稠密重建上达到或超过多种基线,并可处理千帧级视频。

CSV-ViT: A Vision Transformer with the Variable-sized Cortical Supervertices for Detection of Alzheimer's Disease Pathologies Figure 1
2026-05-27cs.CV

CSV-ViT: A Vision Transformer with the Variable-sized Cortical Supervertices for Detection of Alzheimer's Disease Pathologies

Geonwoo Baek, Ikbeom Jang

2026-05-27视觉感知

针对 PET/CSF 确诊阿尔茨海默病成本高、侵入性强,而皮层表面 ViT 固定分块易混合 ROI、重复边界顶点并纳入内侧壁等非皮层区域的问题,论文提出 ROI 保持的可变大小 cortical supervertices,并用 padding 与 mask-aware embedding 构建 CSV-ViT。基于 T1 MRI 的皮层厚度和曲率,在 AD 诊断、淀粉样蛋白阳性、tau 阳性三项二分类中,CSV-ViT 相比 SiT、MS-SiT、DiffusionNet、SurfGNN 表现更高,但具体增益幅度需结合表格细读。

Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression Figure 1
2026-05-27cs.CV

Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression

Haojie Yin, Chengcheng Feng, Tianyi Liu, Tianqi Zhang, Kaizhu Huang

2026-05-27视觉语言三维

该文关注OCT与眼底照相融合预测青光眼视野平均偏差时,常规多模态反而弱于单模态的现象,指出根因是长尾数据分布与模态学习冲突耦合,导致梯度各向异性和尖锐极小值。Re-M3Dr先用自适应边界监督对比学习稳固单模态表征,再以感知尖锐度的梯度调制做联合优化;在公私有临床数据上较SOTA多模态方法平均降低29% MSE。

Uncertainty-Aware Gaussian Map for Vision-Language Navigation Figure 1
2026-05-27cs.CV

Uncertainty-Aware Gaussian Map for Vision-Language Navigation

Jianzhe Gao, Rui Liu, Yuxuan Xu, Tongtong Cao, Yingxue Zhang, Zhanguang Zhang, Sida Peng, Yi Yang, Wenguan Wang

The State Key Lab of Brain-Machine Intelligence, Zhejiang University, Department of Foundation model, 2012 Labs, Huawei, Noah’s Ark Lab, 2012 Labs, Huawei, School of Software Technology, Zhejiang University

2026-05-27机器人视觉语言视觉感知三维安全鲁棒

针对VLN智能体在相似目标、遮挡和可通行性判断中常忽略感知不确定性的问题,本文用3D高斯构建语义地图,并显式估计几何、语义与外观三类不确定性,将其转化为3D Value Map中的约束与可供性来辅助决策。在R2R、RxR、REVERIE上分别带来SR/SPL、SR/nDTW及RGS/RGSPL的小幅提升,说明收益存在但幅度有限。

Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization Figure 1
2026-05-27cs.CV

Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization

Xiang Fang, Wanlong Fang, Changshuo Wang

2026-05-27视觉语言视觉感知优化算法

面向LVLM在自动驾驶、内容审核等场景中可能遭遇的图文协同攻击,论文提出MMAS:在仅查询模型的黑盒条件下,联合优化纹理尺度约束的图像通用扰动与嵌入空间文本提示扰动,并用跨模态正则对齐两类扰动方向。实验称其在CLIP、Flamingo等模型及图像描述、VQA、文本引导分类任务上,相比单模态或简单组合攻击具有更高成功率和迁移性。

3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation Figure 1
2026-05-27cs.CV

3D Gaussian Map with Open-Set Semantic Grouping for Vision-Language Navigation

Jianzhe Gao, Rui Liu, Wenguan Wang

The State Key Lab of Brain-Machine Intelligence, Zhejiang University

2026-05-27机器人视觉语言视觉感知三维

针对VLN中现有拓扑/语义/隐式地图难以同时刻画精细3D几何、开放词汇语义且计算冗余的问题,论文用稀疏伪激光点云在线初始化自中心3D Gaussian Map,并通过开放集语义分组把高斯基元关联到物体实例或stuff类别,再以场景、视角、实例三级动作预测辅助决策。在R2R、R4R、REVERIE的未见验证集上分别带来约2% SR/SPL、3% SDTW及约2.0% RGS、2.3% RGSPL提升。

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models Figure 1
2026-05-27cs.LG

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

Stanford University

2026-05-27生成模型强化学习

本文针对扩散模型偏好对齐中过度依赖二元胜负对、浪费同一提示下多候选图像及连续奖励信息的问题,提出 Diffusion LAIR:将候选组奖励转为中心化优势权重,并用带二次正则的隐式奖励回归同时更新全列表样本,从而控制偏好更新幅度。实验显示其在 SD1.5/SDXL 的文生图、组合生成和图像编辑任务上优于多种偏好优化基线。

LongCat-Video-Avatar 1.5 Technical Report Figure 1
2026-05-27cs.CV

LongCat-Video-Avatar 1.5 Technical Report

Meituan LongCat Team : Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

2026-05-27视觉感知

面向数字人落地中长视频身份漂移、口型不同步、全身时序不稳和推理成本高的问题,LongCat-Video-Avatar 1.5强调系统工程而非新结构:以Whisper-large替换音频编码器,配合严格数据清洗、规模化训练、GRPO偏好优化和DMD步数蒸馏至8 NFE,增益可能主要来自scaling/data与训练配方。500余例评测显示其在人像真实感、稳定性和专家质量指标上达到或超过HeyGen、OmniHuman 1.5等闭源系统。

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants Figure 1
2026-05-27cs.CV

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

CUHK MMLab

2026-05-27强化学习数据集/基准

现有视频问答/流式评测多依赖离线片段或文本提示,难以衡量实时助手在原始音视频中何时听懂、何时回答以及如何处理中断。OmniInteract以“触发—响应窗口—目标答案”的时序交互槽构建250段视频、1430个槽,覆盖实时、主动、嵌套与连续任务监控,并用IA-QTF1等指标联合评估质量和时机。实验显示当前模型差距明显,最佳总体IA-QTF1仅0.368,1QnA仅0.052,离线能力难以直接迁移到在线全双工交互。

Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis Figure 1
2026-05-27cs.CV

Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis

Jianzhe Gao, Churan Wang, Weiyi Zhang, Jianghua Li, Li-An Li, Wenguan Wang, Yixin Zhu, Yizhou Wang

Center for Data Science in Clinical Medicine, Peking University Third Hospital, The State Key Lab of Brain-Machine Intelligence, Zhejiang University, Department of Gynecology and Obstetrics, 7th Medical Center of Chinese PLA General Hospital, School of Computer Science, Peking University, School of Psychological and Cognitive Sciences, Peking University, State Key Lab of General AI, Peking University, Nat’l Eng. Research Center of Visual Technology, Beijing Key Laboratory of Behavior and Mental Health, Peking University, Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence

2026-05-27视觉感知

针对医学视频诊断中模型容易把光照、试剂反应或相机运动误当病理线索的问题,论文提出 MEDVCR,将临床规则约束与反事实推理结合:用扩散生成不同病理状态下的组织演化,并通过时序一致性、病理可分性和事实/反事实对比学习诊断表示。在阴道镜活检点定位上 Recall@1 达 93.0%(+10.2%),结肠镜息肉帧检测 AP 达 94.8%(+2.6%)。

Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient Figure 1
2026-05-27cs.RO

Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient

Haoxiang You, Yilang Liu, Davis Zong, Qian Wang, Teeratham Vitchutripop, Qi Wang, Daniel Rakita, Ian Abraham

2026-05-27强化学习优化算法

面向视觉输入的端到端机器人强化学习通常受渲染并行数、显存和可微仿真限制。本文提出 SDPG,用少量批量渲染环境评估回报、用物理环境随机扰动轨迹来估计解耦策略梯度,并配合自适应探索和奖励归一化稳定训练。实验显示其在视觉 MuJoCo 上较基线提升奖励、训练时间和显存效率,并在灵巧操作、运动任务及 Unitree Go2 上展示仿真到现实迁移。

Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes Figure 1
2026-05-27cs.CV

Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes

ZhiXin Sun

2026-05-27视觉感知

面向水库结冰面积等百米级平面场景测量,论文比较了PTZ相机下单目几何测距、鸟瞰拼接和双单目标定类立体测距三种方案。核心洞察是误差主因并非模型复杂度,而是俯仰角、标定与大范围拼接累积误差;实验显示单目在足够俯角下可达米级,拼接小场景稳但规模化变慢且不稳,类立体方案达分米级且对俯仰角更鲁棒。

Triadic Dynamics Aware Diffusion Posterior Sampling for Inverse Problems: Optimizing Guidance and Stochasticity Schedules Figure 1
2026-05-27cs.CV

Triadic Dynamics Aware Diffusion Posterior Sampling for Inverse Problems: Optimizing Guidance and Stochasticity Schedules

Junseo Bang, Dong Ju Mun, Hoigi Seo, Seongmin Hong, Se Young Chun

2026-05-27生成模型

针对扩散/流匹配后验采样在成像逆问题中常把数据一致性、CFG 与随机性设为固定或局部调度而次优的问题,论文指出早期过强 CFG 会与数据一致性冲突,而适度随机性可把轨迹拉回高概率区域;提出 TriPS,将三者视为时变控制,采用 DC 与随机性递减、CFG 递增的三元调度,并用模板搜索和 GRPO 优化曲线。实验显示其在多类逆问题上较现有方法提升数据保真与感知真实度。

AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation Figure 1
2026-05-27cs.CV

AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation

Jian Zhang, Zhijun Zhang

School of Automation Science and Engineering, South China University of Technology

2026-05-27视觉语言

针对MM-DiT中基于注意力的概念定位在相似物体间易“概念泄漏”的问题,AnchorDiff将语义定位与结构细化解耦:先用概念到图像注意力选取高置信锚点,再在由图像自注意力构建的混合图上传播单点种子,以行注意力门控抑制跨物体扩散、用输出空间相似性保持物体内连通。实验显示其在ImageNet-Segmentation和PascalVOC上保持较强无训练定位性能,并在新建混淆数据集上显著降低非目标激活。

Sparse-LiDAR Prompting of Monocular Geometry Foundations: An Empirical Study Toward Long-Range Driving Depth Figure 1
2026-05-27cs.CV

Sparse-LiDAR Prompting of Monocular Geometry Foundations: An Empirical Study Toward Long-Range Driving Depth

Kai Zheng, Qiang Feng, Xingjian Liu, Wenquan Tan, Yuan Li

Benewake (Beijing) Co., Ltd.

2026-05-27视觉感知

面向自动驾驶中50–150米远距深度估计缺少分段评测、且既有稀疏LiDAR提示多依赖预插值稠密先验的问题,论文提出SLIM,将MoGe-2改造成可直接接收真实稀疏LiDAR的点图基础模型,通过PartialConv稀疏编码器与五尺度融合颈注入几何信息,并用随机注入率训练适配不同密度。在Virtual KITTI和CARLA上,100–150米AbsRel较MoGe-2降低约39–51%,消融也显示PartialConv在多数稀疏率下优于预插值。

Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation Figure 1
2026-05-27cs.HC

Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation

Zhiyao Cui, Chenxu Wang, Shuyue Hu, Yiqun Zhang, Wenqi Shao, Qiaosheng Zhang, Zhen Wang

School of Cybersecurity, Northwestern Polytechnical University, Shanghai Artificial Intelligence Laboratory, Fudan University

2026-05-27视觉感知

针对现有自动生成幻灯片依赖固定模板或直接产出代码、导致版式创造力和视觉一致性不足的问题,论文提出 DeepSlides:先在高层语义空间完成页面风格、布局层级与视觉元素设计,再由 coder 转为 PPTX/图像实现,并构建 SlideDesign 数据集与多智能体强化学习训练的 SlideQwens。实验和 20 人偏好评测显示,其在布局、层级、配色和整体美观上优于开源及部分商业基线。

Cross-scale Aligned Supervision for Training GANs Figure 1
2026-05-27cs.CV

Cross-scale Aligned Supervision for Training GANs

Sangeek Hyun, MinKyu Lee, Jae-Pil Heo

Sungkyunkwan University

2026-05-27视觉感知生成模型

本文针对多阶段 GAN 中“逐尺度对抗监督即粗到细生成”的常见假设提出质疑,指出各尺度虽可各自逼真,却可能不对应同一生成样本,形成跨尺度轨迹错位。作者提出 CAT,在保留逐尺度判别器反馈的同时加入生成器侧一致性正则,使中间输出对齐最终图像。ImageNet-256 上 CAT-H/2 仅训练 60 个 epoch、单步推理即达 FID-50K 1.56,优于多种单步 GAN 与扩散/flow 基线。

Underwater360: Reconstructing Underwater Scenes from Panoramic Images with Omnidirectional Gaussian Splatting Figure 1
2026-05-27cs.CV

Underwater360: Reconstructing Underwater Scenes from Panoramic Images with Omnidirectional Gaussian Splatting

Jiangbei Hu, Weichao Song, Shibo Yu, Mohan Wang, Zihan Yi, Rui Wu, Mingkang Xiang, Na Lei, Shengfa Wang, Zhongxuan Luo, Ying He

School of Software, Dalian University of Technology, College of Computing and Data Science, Nanyang Technological University

2026-05-27视觉感知三维

水下三维重建受窄视角采集、散射与吸收影响,易出现几何缺失和跨视角外观不一致。Underwater360将全景图像与3D Gaussian Splatting结合,在球面相机空间直接做全向ray casting,并用物理成像模型和位姿条件外观嵌入分离本征辐射、衰减与后向散射。论文还构建合成与真实水下360°基准,实验显示其在新视角合成、外观恢复和一致性上优于对比方法。

Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective Figure 1
2026-05-27cs.CV

Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective

Xiang Fang, Zeyu Xiong, Wanlong Fang, Xiaoye Qu, Chen Chen, Jianfeng Dong, Keke Tang, Pan Zhou, Yu Cheng, Daizong Liu

2026-05-27视觉语言视觉感知

针对弱监督视频时序定位依赖滑窗候选片段、跨模态对齐过粗且受候选质量限制的问题,论文将视频帧与查询词建模为合作博弈中的玩家,用博弈交互度量不同帧词联盟对相似度的贡献,并转化为查询引导的逐帧得分以直接定位边界;在 Charades-STA 和 ActivityNet Caption 上优于既有方法,代表性设置下 Charades-STA 提升 4.53%。

HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection Figure 1
2026-05-27cs.CV

HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

Senyuan Shi, Hao Tan, Zichang Tan, Shuhan Feng, Ajian Liu, Sergio Escalera, Jun Wan

Beijing University of Posts and Telecommunications, School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences, Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences, MAIS, Institute of Automation, Chinese Academy of Sciences, University of Barcelona

2026-05-27视觉语言视觉感知

针对现有基于 CLIP 的合成图像检测方法用静态、对称提示划分真假类别,难以适应不同生成模型带来的细粒度伪造痕迹,HydraPrompt 提出真假非对称建模:真实类使用统一提示锚点,伪造类由浅层视觉线索生成样本自适应提示,并配合条件监督对比损失压紧真实分布、分散伪造特征。实验显示其在常用 SID 基准上达到最优表现,尤其提升未见伪造的鲁棒性。

The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP Figure 1
2026-05-27cs.CV

The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

Kahyeon Nam, Hyesong Choi

Soongsil University

2026-05-27强化学习

论文关注 INT8 量化后 CLIP 在边缘部署中的特殊失效:量化噪声随 Transformer 深度累积,破坏图文嵌入的余弦方向,形成 QIRC。作者提出 LRA-EE,用 patch 全局平均替代浅层 [CLS],结合多特征门控和按层噪声校准阈值,主动绕过高噪声深层。在 ImageNet-1K 零样本上,相比 INT8 全深度基线 FLOPs 降低 13.38%,Top-1 从 58.72% 提升到 61.16%,增益主要归因于自适应深度路由的“Rescue Effect”。

OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following Figure 1
2026-05-27cs.CV

OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following

Qiaomu Miao, Haoyu Wu, Jingyi Xu, Minh Hoai, Dimitris Samaras

Stony Brook University, The University of Adelaide

2026-05-27视觉语言视觉感知

针对传统 gaze following 只做空间定位、多人场景需重复推理且难以处理语义/社交关系的问题,OmniGF 将 VLM 改造成统一多人框架:用头部特征注入锁定个体,并以语言分支输出离散推理状态、连续空间分支从隐藏状态解码高分辨率凝视热图。实验称其在五个基准上达到 SOTA,同时支持目标位置、语义类别与社交凝视推理。

Garment Particles: A 2D--3D Symmetric Garment Representation for Generation and Editing Figure 1
2026-05-27cs.GR

Garment Particles: A 2D--3D Symmetric Garment Representation for Generation and Editing

Kiyohiro Nakayama, I-chao Shen, Ruofan Liu, Yiming Wang, Gordon Wetzstein, Takeo Igarashi

Stanford University, The University of Tokyo, Institute of Science Tokyo, Stanford University USA, The University of Tokyo Japan, Institute of Science Tokyo Japan

2026-05-27三维

服装设计同时需要从文本/图像等高层意图生成款式,又要在2D纸样与3D垂坠几何间做专业级编辑,现有方法难以统一。本文提出Garment Particles,以5D点云对称编码2D纸样和3D形态,并结合整流流GPF、DPS引导编辑及PPF还原可仿真的曲线纸样。实验显示其在多模态服装生成上优于竞争基线,并支持插值、纸样编辑、点云和轮廓条件生成等任务。

Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion Figure 1
2026-05-27cs.CV

Zero-Shot Object Re-Identification in Egocentric Kitchen Videos via Multi-Stage SAM3 Feature Fusion

Dmytro Klepachevskyi, Alexander Wong, Sirisha Rambhatla, Yuhao Chen

2026-05-27视觉语言视觉感知数据集/基准三维

针对第一视角厨房视频中物体频繁遮挡、离开视野后再出现且身份标注稀缺的问题,论文将 EPIC-Kitchens 上的厨房物体 ReID 系统化为零样本检索任务。其核心做法不是训练新模型,而是以 SAM3 分割去背景为入口,融合 SAM3、DINOv2、CLIP 特征,并加入掩码形状 IoU 与 k-reciprocal 重排序。结果显示单一预训练特征最高仅约 45.3% mAP,完整流程提升到 52.8% mAP。

Detail Consistent Stage-Wise Distillation for Efficient 3D MRI Segmentation Figure 1
2026-05-27cs.CV

Detail Consistent Stage-Wise Distillation for Efficient 3D MRI Segmentation

Mengchen Fan, Baocheng Geng, Xi Xiao, Tianyang Wang, Siyuan Mei, Pulin Che, Xiaoqian Jiang, Qizhen Lan

2026-05-27视觉感知学习理论数据集/基准三维

针对3D MRI分割模型在压缩后虽能保留粗定位、却容易丢失小病灶和清晰边界的问题,论文提出DCD阶段式蒸馏:在各编码层用3D小波分解对齐师生特征的方向细节子带,并相对放开低频语义以避免过约束和噪声放大。该方法仅用于训练、推理无额外开销,在BraTS 2024和ISLES 2022上提升了压缩nnU-Net的分割精度与边界质量。

Multi-Modal Building Inspection via Perceiver IO Fusion of Satellite and Street-Level Imagery Figure 1
2026-05-27cs.CV

Multi-Modal Building Inspection via Perceiver IO Fusion of Satellite and Street-Level Imagery

Niels Sombekke, Rob G.J. Wijnhoven, Martin R. Oswald

2026-05-27视觉感知数据集/基准三维

面向大规模建筑巡检中屋顶材料与构件难以仅靠人工或单一视角判断的问题,论文用共享 DINOv2 提取卫星与街景的空间 patch token,并以 Perceiver IO 融合可变数量街景视图,同时提出 RGB-M 足迹掩码作为软空间先验。其十国 3.2 万建筑数据表明,该融合优于常见融合策略,显著提升街景可见类别如 slate,但俯视可见类别上卫星单模态仍略占优。

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes Figure 1
2026-05-27cs.CV

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

2026-05-27视觉语言视觉感知模仿学习数据集/基准三维

论文针对现有细粒度视觉基准可能被语言先验、全局语义和“假工具使用”捷径抬高分数的问题,提出 VisualNeedle:在街景、文档、货架、地图等高信息密度场景中设置300个需主动定位微小证据的问题,并用 crop-black 反事实裁剪检验模型是否真正利用中间视觉证据。9个MLLM评测显示,无工具准确率低于20%,最佳工具模型仅56.01%,仍低于63.00%的人类多数投票,说明当前模型的主动视觉搜索能力仍明显不足。

BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma Figure 1
2026-05-27cs.CV

BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma

Junlin Yang, Tian Yu, Nicha C. Dvornek, Yuexi Du, Peiyu Duan, Annabella Shewarega, Lawrence H. Staib, James S. Duncan, Julius Chapiro

2026-05-27视觉语言视觉感知强化学习三维安全鲁棒

针对肝癌预后中肝功能储备与肿瘤进展信号易被普通视觉语言模型混在同一表征里的问题,BioFact-MoE用LLM拆分报告、解剖掩码和路径专属LoRA预训练,将肝脏与肿瘤因素显式分解,再用残差MoE按患者动态门控融合。其在588例HCC上较多类基线提升,12/18/24个月AUC达75.33%、75.85%、73.96%,且门控权重可解释治疗相关异质性。

Joint Instance Segmentation and Geometric Attribute Regression for Roof Structures in Aerial Imagery Figure 1
2026-05-27cs.CV

Joint Instance Segmentation and Geometric Attribute Regression for Roof Structures in Aerial Imagery

Luuk Versteeg, Rob G.J. Wijnhoven, Martin R. Oswald

2026-05-27视觉感知数据集/基准三维

面向建筑节能、保险估值和太阳能评估中缺少大规模三维屋顶属性的问题,本文将昂贵的 LiDAR/3DBAG 三维数据仅用于训练,推理时从单张正射航片预测屋顶实例掩码及高度、坡度、方位角。方法在 Mask R-CNN 上加入属性回归分支,并用平屋顶条件方位角损失和对数高度归一化处理噪声与长尾分布。在荷兰 1.7 万张航片、超 200 万实例上,坡度约 4°、方位角约 7°、高度约 1 m MAE,AP50 为 0.566,可支持简化 LoD2 重建。

Unified Panoramic Geometry Estimation via Multi-View Foundation Models Figure 1
2026-05-27cs.CV

Unified Panoramic Geometry Estimation via Multi-View Foundation Models

Vukasin Bozic, Isidora Slavkovic, Dominik Narnhofer, Nando Metzger, Denis Rozumny, Konrad Schindler, Nikolai Kalischek

2026-05-27视觉感知强化学习三维

针对单张全景图三维几何估计受ERP畸变、全景标注稀缺和透视基础模型难迁移限制的问题,PaGeR将360°图像重参数化为六面体多视图,并在DA3式多视图Transformer上加入相机条件、边界一致解码与透视/合成全景混合训练,一次预测尺度不变深度、米制深度、法线和天空掩码。实验显示其在室内外多基准达到或超过现有方法,并在未见场景上具备较强零样本泛化,另提供ZüriPano LiDAR全景评测集。

Personalized Generative Models for Contextual Debiasing Figure 1
2026-05-27cs.CV

Personalized Generative Models for Contextual Debiasing

Xinran Liang, Esin Tureci, Prachi Sinha, Ye Zhu, Vikram V. Ramaswamy, Olga Russakovsky

2026-05-27视觉感知生成模型强化学习优化算法数据集/基准

本文针对视觉数据中“物体—场景/共现对象”频率不均导致小型识别模型依赖上下文、在罕见组合上失效的问题,提出 DecoupleGen:对文本到图像扩散模型做个性化微调,学习原图组件的词嵌入,再合成去除常见上下文但保持数据集风格与视觉细节的样本,并用检测器筛选。其在 NICO 与 COCO 上较标准训练分别提升 14.2% 和 5.4%,较既有去偏或生成增强方法也有约 1.5% 增益。

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models Figure 1
2026-05-27cs.CV

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

2026-05-27视觉感知生成模型强化学习安全鲁棒

针对扩散模型“机器遗忘”后仍可能残留被删除概念的问题,论文提出 BEAP:在完全黑盒条件下用 LLM 在自然语言空间迭代生成提示,并结合概念出现、图文一致性、图像质量及嵌入相近替代词进行奖励搜索。结果显示其攻击成功率较既有方法提升超过 60%,平均约 15 次查询即可成功,同时提示更可读、较难被简单安全过滤器发现,说明当前遗忘机制仍不可靠。

RadarSim: Simulating Single-Chip Radar via Multimodal Neural Fields Figure 1
2026-05-27cs.CV

RadarSim: Simulating Single-Chip Radar via Multimodal Neural Fields

Chuhan Chen, Tianshu Huang, Akarsh Prabhakara, Chaithanya Kumar Mummadi, Zhongxiao Cong, Anthony Rowe, Matthew O'Toole, Deva Ramanan

2026-05-27视觉语言视觉感知强化学习三维安全鲁棒

针对低成本毫米波雷达角分辨率低、数据难解释且强依赖传感器,论文提出 RadarSim:用 RGB-NeRF 初始化并正则化雷达神经场,同时保留雷达特有穿透/遮挡差异,并用基于 BRDF 的编码建模后向镜面反射;还用雷达量测校正 COLMAP 尺度。作者采集手持雷达-相机数据集,结果显示其在新视角 range-Doppler 合成、反射率几何清晰度和遮挡表面密度估计上优于雷达-only 基线。

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control Figure 1
2026-05-27cs.CV

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control

Qiao Gu, Lingni Ma, Adam W Harley, Richard Newcombe, Florian Shkurti, Julian Straub

2026-05-27视觉感知生成模型强化学习规划控制三维

E³C面向具身智能中“预演”第一人称未来观测的需求,解决自我运动导致的剧烈视角变化、自遮挡以及人与场景需同步一致的问题。其核心是将静态环境与人体动态解耦:用带VAE外观特征的半稠密点云作为3D记忆,并结合外部人物骨架、佩戴者3D关节与6DoF腕部运动及持久姿态token控制生成。在Nymeria上,方法相较基线提升了画质、相机运动跟随、物体一致性和ego/exo姿态控制,并支持显式场景编辑。

Sleep-stage efficient classification using a lightweight self-supervised model Figure 1
2026-05-27cs.CV

Sleep-stage efficient classification using a lightweight self-supervised model

Eldiane Borges dos Santos Durães, João Batista Florindo

2026-05-27数据集/基准安全鲁棒

本文针对睡眠分期中标注数据和算力有限的问题,改造自监督 EEG 表征模型 mulEEG:用 ResNet-18 替代较重的 ResNet-50,并将时序特征、谱图特征及其拼接输入线性 SVM。实验显示,减少预训练数据量的性价比高于单纯缩小模型,而 ResNet-18 的拼接特征配置超过原 mulEEG 线性评估结果,但具体增益可能同时来自特征融合与分类器设置。

CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection Figure 1
2026-05-27cs.CV

CNNs, Transformers, Hybrid, and Vision Language Models for Skin Cancer Detection

Durjoy Dey, Yuhong Yan, Hassan Hajjdiab

2026-05-27视觉语言视觉感知强化学习数据集/基准

针对皮肤癌筛查中不同视觉架构难以公平比较的问题,本文在PAD-UFES-20上用统一患者级划分、训练流程和临床导向指标评测12个CNN、ViT、混合模型与VLM。结果显示,调优后的CNN已是强基线,但Transformer类整体判别更好;MaxViT Tiny、CoAtNet0和SigLIP取得较均衡表现,CLIP偏向高精度,为实际筛查模型选择提供可复现实证参考。

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning Figure 1
2026-05-27cs.CV

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning

Taha Koleilat, Hassan Rivaz, Yiming Xiao

2026-05-27视觉语言视觉感知生成模型强化学习模仿学习

针对生物医学视觉语言模型在少样本、域偏移和图文对齐含糊时的脆弱性,Evi-Steer在冻结BiomedCLIP主干的前提下,用低维跨模态表示 steering 更新视觉与文本 token,并引入证据不确定性门控与Dempster-Shafer置信融合,弱证据时抑制残差更新。实验覆盖15个数据集、8类器官和8种模态,仅更新0.11%参数,在少样本和域泛化设置下持续优于现有PEFT方法。

A multifractal-based masked auto-encoder: an application to medical images Figure 1
2026-05-27cs.CV

A multifractal-based masked auto-encoder: an application to medical images

Joao Batista Florindo, Viviane de Moura

2026-05-27视觉感知强化学习模仿学习数据集/基准三维

针对传统 MAE 随机遮挡可能避开医学图像中细微但关键病灶区域的问题,论文提出 MO-MAE,用 Rényi 熵刻画图像块的多重分形复杂度,并据此优先遮挡高信息区域,迫使模型学习重建更具诊断价值的结构。该策略不引入额外可学习模块,计算开销较小;在 MedMNIST 与 COVID-CT 等分类任务上,多数场景优于对比基线和近期方法。

Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening Figure 1
2026-05-27cs.CV

Benchmarking Convolutional, Transformer, Hybrid, and Vision Language Models for Multi Disease Retinal Screening

Durjoy Dey, Aymane Ajbar, Yuhong Yan

2026-05-27视觉语言视觉感知数据集/基准

针对多病种视网膜筛查中不同视觉架构在真实多标签与域迁移场景下缺乏可比结论的问题,本文用统一训练、校准和评估协议在 RFMiD 上横向比较 CNN、ViT、CNN-Transformer 混合模型与 VLM。结果显示二分类筛查均达 84% 以上 AUC,但 SwinTiny、CoAtNet0、MaxViTTiny 在二分类和多标签 F1 上更优;CLIP、SigLIP 接近 CNN 基线但未超过最佳注意力/混合骨干,Messidor-2 外部验证也呈相似趋势。

VesselSim: learning 3D blood vessel segmentation without expert annotations Figure 1
2026-05-27cs.CV

VesselSim: learning 3D blood vessel segmentation without expert annotations

Erin Rainville, Melissa Ananian, Tristan Mirolla, Hassan Rivax, Yiming Xiao

2026-05-27视觉感知强化学习规划控制学习理论数据集/基准

针对3D血管标注昂贵且跨模态域移明显的问题,VesselSim用随机几何规则生成具备分叉、曲率和碰撞约束的合成血管,再做强度域随机化训练3D U-Net,并在测试时用自监督掩码重建适配真实扫描。零样本在脑部CTA/MRA和HiP-CT上接近或超过多种医学分割基础模型,说明主要血管几何可由合成管状结构学到,但部分增益可能来自数据规模与域随机化。

Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation Figure 1
2026-05-27cs.CV

Frequency-Guided Fusion For RGB-Thermal Semantic Segmentation

İsmail Emre Canıtez, Özgür Erkent

2026-05-27视觉感知强化学习学习理论三维

针对夜间、阴影等场景中 RGB 语义分割不可靠的问题,论文提出双 ConvNeXt V2 的 RGB-热红外分割框架:浅层只对红外特征做高低频分解,用注意力和置信门控补强 RGB,深层再做跨模态语义注意力,并用 PANet 解码。MFNet 上最小模型以 35.43M 参数达 61.73% mIoU,PST900 最高约 88.48%,效率优于多种更大模型。

Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion Figure 1
2026-05-27cs.LG

Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion

Tuna Tuncer, Felix Becker, Thomas Pfeil

Technical University of Munich

2026-05-27视觉感知生成模型

面向分块自回归视频扩散中 KV cache 随时长增长造成的显存瓶颈,论文指出低比特量化退化并非仅来自误差大小,而是 softmax 指数凸性放大零均值 key 噪声,形成“Jensen bias”,使缓存 token 抢占当前块注意力。作者据量化步长和 query 范数在线校正每个注意力分数,无需额外缓存;在 MAGI-1、SkyReels-V2、HY-WorldPlay 的 INT2 设置下恢复多数画质损失,接近 BF16,并可用比 INT4 少 50% 内存取得更好效果。

Dimensional Distribution Emotion State: Leveraging Valence and Arousal as a Common Embedding Space for Visual Emotion Analysis Figure 1
2026-05-27cs.CV

Dimensional Distribution Emotion State: Leveraging Valence and Arousal as a Common Embedding Space for Visual Emotion Analysis

Émile Bergeron, Tadagbé Dhossou, Sébastien Tremblay, Jean-François Lalonde

2026-05-27数据集/基准安全鲁棒

面向博物馆情绪化策展中人工标注昂贵且主观的问题,论文提出 DDES:把情绪表示为效价–唤醒二维空间上的概率分布,并定义与类别分布、单点维度表示的转换,以统一多种标注和多数据集训练。实验显示其在单数据集上与常用表示性能相近,但零样本泛化更好;具体增益来源仍可能与数据融合方式相关。

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV Figure 1
2026-05-27cs.CV

LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV

Tengfei Liu, Yang Shi, Xuanyu Zhu, Jiafu Tang, Liu Yang, Qixun Wang, Zhuoran Zhang, Yuqi Tang, Fengxiang Wang, Yuhao Dong, Xinlong Chen, Bozhou Li, Bohan Zeng, Yue Ding, Xiaohan Zhang, Jialu Chen, Haotian Wang, Yuanxing Zhang, Pengfei Wan, Leye Wang

2026-05-27视觉语言视觉感知生成模型模仿学习数据集/基准

针对现有音视频生成评测仍停留在短片、且难以统一比较文本/图像/视频条件的问题,LongAV-Compass构建了284个分钟级T2AV、I2AV、V2AV测试用例,并用事件级标注、MLLM评审结合DINO-v2、ArcFace、CLIP、ImageBind等指标评估20余个维度。对11个模型的实验与人工一致性验证显示,该基准能揭示长程身份漂移、叙事断裂和音画同步衰减等当前系统瓶颈。

RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation Figure 1
2026-05-27cs.CV

RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation

Jiahao Zhang, Joseph Liu, Young-Yoon Lee, Seonghyeon Moon, Victor Zordan, Guy Tevet, Karen Liu, Stephen Gould, Oren Jacob, Haomiao Jiang, Mubbasir Kapadia, Yizhak Ben-Shabat

2026-05-27视觉语言视觉感知生成模型数据集/基准三维

针对3D人体动作生成在“小而干净的动捕数据”和“大但噪声多的野外视频数据”之间的取舍,RoMo构建了820K核心片段、1237小时的野外动作数据集,并用三层语义分类体系与按类别自适应过滤去除静态和伪影样本,每段配多条文本描述。实验显示,基于RoMo训练的模型在保真度、多样性和复杂文本理解上优于既有数据训练结果,同时分类评测暴露了模型在细粒度交互动作上的短板;增益可能主要来自数据规模、清洗和语义组织的共同作用。

Sentinel: Embodied Cooperative Spatial Reasoning and Planning Figure 1
2026-05-27cs.CV

Sentinel: Embodied Cooperative Spatial Reasoning and Planning

Xiangye Lin, Hongxin Zhang, Ruxi Deng, Qinhong Zhou, Chuang Gan

2026-05-27机器人规划控制优化算法数据集/基准三维

这篇论文针对现有具身多智能体多局限于静态室内、难以处理城市尺度动态约束的问题,提出 Sentinel Challenge 和 CoSaR 框架:用结构化空间记忆结合自然语言通信、地图查询、VLM 路径修正与 A* 导航,使分散机器人协商会合点并避开巡逻哨兵。在 14 个城市场景、3–5 个智能体实验中,CoSaR 相比 CoELA、RoCo 实现更快会合、更短路径和更高安全性。

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation Figure 1
2026-05-27cs.CV

DuoGesture: Neuro-Inspired and Biomechanically Informed Dual-Stream Co-Speech Gesture Generation

Ferdinand Paar, Lanmiao Liu, Aslı Özyürek, Serge Thill, Esam Ghaleb

2026-05-27视觉语言规划控制数据集/基准三维

论文针对现有共语手势模型把语义手势与节拍手势混为单一运动流,导致语义弱、语音对齐差和抖动的问题,提出 DuoGesture 双流框架:用运动语言表征增强长尾词触发的语义手势,以随机帧级门控决定语义流何时覆盖节拍流,并用人体测量加权惯性先验约束节拍平滑性。在 BEAT2 单/多说话人实验和主观评测中,其 FGD 等分布真实度优于强整体式基线,消融支持三项模块的互补作用。

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos Figure 1
2026-05-27cs.CV

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

2026-05-27视觉语言视觉感知规划控制数据集/基准三维

这篇论文针对视频大模型在接入音频、深度或密集时序流时容易被无关模态干扰的问题,提出 UniMVU:依据文本指令在模态内部选择关键 token,并在模态级动态重加权,另用快慢融合减少对齐流冗余。在 AVQA、AVSD、Music-AVQA、ScanQA、SQA3D、MVBench 六个基准上相对静态融合稳定提升,CIDEr 最高增益 13.5,门控权重也与可解释的模态相关性较一致。

Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction Figure 1
2026-05-27cs.CV

Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction

Jin Hyeon Kim, Jaeeun Lee, Claire Kim, Kyoungjin Oh, Paul Hyunbin Cho, Jaewon Min, Yeji Choi, Jihye Park, Hyunhee Park, Minkyu Park, Seungryong Kim

2026-05-27视觉感知生成模型强化学习数据集/基准三维

该文针对真实多视角采集中运动模糊等退化会破坏跨视图匹配、使前馈式3D重建误差累积的问题,提出GARD:不先在像素或VAE潜空间修图,而是在冻结重建器的几何感知特征空间中用扩散模型去噪,并接RGB解码器同时恢复图像与几何。在DA3退化基准上,相比先复原再重建及VAE潜空间方案,姿态、深度/重建和图像质量指标均更好。

AnySurf: Any Surface Generation with Directed Edge Figure 1
2026-05-27cs.GR

AnySurf: Any Surface Generation with Directed Edge

Wenda Shi, Chenyuan Pan, Dengming Zhang, Yiren Song, Biao Zhang, Xingxing Zou

WENDA SHI, The Hong Kong Polytechnic University, Hong Kong SAR, DENGMING ZHANG, Zhejiang University, China, YIREN SONG, National University of Singapore, Singapore, BIAO ZHANG, Xi’an Jiaotong University, China, XINGXING ZOU∗, The Hong Kong Polytechnic University, Hong Kong SAR, Hong Kong Polytechnic University, Hong Kong SAR, Zhejiang University, Hangzhou, China, University of Singapore, Singapore, University, Xi’an, China, Polytechnic University, Hong Kong SAR., sentation limits scalability and generalization beyond garments, making it, our datasets, code, and models publicly available.

2026-05-27视觉感知

面向服装、鞋帽配饰等同时包含开放面与封闭面的工业级 3D 资产,现有通用生成器偏向水密网格,服装专用方法又难泛化且易出法线/面朝向错误。AnySurf 将 FDG 扩展为带方向边的 FDG-D,并用 ROS-FT 与仅约 1% 参数的 DE-Adapter 学习面朝向线索,配合 Outfit3D 数据集实现统一生成。实验显示其在开放、封闭和混合表面上较 Trellis2 等基线得到更一致朝向和更适合下游使用的网格。

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents Figure 1
2026-05-27cs.SE

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

JunJia Guo, Yuhang Yao, Jiawei (Joe) Zhou, Jingdi Chen

University of Arizona, Stony Brook University

2026-05-27数据集/基准

现有代码基准难以衡量真实前端开发中“看起来像、能交互、可运行”的综合能力,VISTA因此把视觉规格到 Web 应用生成作为端到端任务。其创新在于同时操控输入粒度与技术栈约束,并用人工标注交互组件/视觉锚点结合 DOM、浏览器测试和 CLIP 评估。对四类代理的实验显示,视觉还原与功能正确性并不总是同步,代理编辑风格差异明显但与任务质量关联较弱。

AssetGen: Deployable 3D Asset Generation at Interactive Speed Figure 1
2026-05-27cs.GR

AssetGen: Deployable 3D Asset Generation at Interactive Speed

Dilin Wang, Xiaoyu Xiang, Kihyuk Sohn, Tom Monnier, Yu-Ying Yeh, Thu Nguyen-Phuoc, Jiawen Zhang, Yuchen Fan, Antoine Toisoul, Hyunyoung Jung, Prithviraj Dhar, Michael Bunnell, Nikolaos Sarafianos, Chuhang Zou, Roman Shapovalov, Andrea Vedaldi, Rakesh Ranjan

2026-05-27三维

针对现有图像到3D方法重画质、轻可部署性与交互延迟的问题,AssetGen把目标定义为直接可用于实时渲染的资产生成:用粗到细VecSet几何扩散、GPU网格清理/简化/UV展开/法线烘焙,以及多视图纹理回投和3D修补,并通过蒸馏、内核优化和流水并行做端到端加速。实验含自动与盲测评估,显示其约30秒生成可部署高质量网格,Flash约14秒给出预览质量,视觉效果可与商业系统竞争。

2026-05-26

292 篇
TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction Figure 1
2026-05-26cs.CV

TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction

Weijie Wang, Zimu Li, Jinchuan Shi, Zeyu Zhang, Botao Ye, Marc Pollefeys, Donny Y. Chen, Bohan Zhuang

2026-05-26视觉感知强化学习模仿学习三维

面向机器人仿真、碰撞检测和具身交互,现有前馈高斯重建虽适合新视角合成,却需额外网格提取。TriSplat将表示直接换成有向三角面片,从稀疏无位姿图像联合预测点图、相机和三角属性,并用几何法线锚定方向与渐进锐化稳定训练。在RealEstate10K、DL3DV及ScanNet零样本中,其表面精度和网格渲染优于高斯基线,且可直接导入物理引擎。

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond Figure 1
2026-05-26cs.RO

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

Southwest Jiaotong University, Tsinghua University

2026-05-26规划控制

面向自动驾驶长尾安全场景中可控合成数据不足的问题,AnyScene以语义占据作为几何中枢:用BEV占据VAE和时空占据扩散Transformer从任意BEV自回归生成高频占据序列,再通过GGVE无参考帧扩展为多视角视频并支持灵活相机配置。实验显示其在占据与视频生成上达到SOTA,可泛化到未见和自定义布局,并提升稀疏视角3D重建等下游任务。

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation Figure 1
2026-05-26cs.CV

Squeezing Capacity from Multimodal Large Language Models for Subject-driven Generation

Shuhong Zheng, Aashish Kumar Misraa, Yu-Teng Li, Yu-Jhe Li, Igor Gilitschenski

2026-05-26视觉语言视觉感知生成模型强化学习模仿学习

本文针对主体驱动生成中文本与参考图分开编码导致的跨模态理解弱、身份漂移和复制粘贴伪影问题,将MLLM作为扩散模型的联合图文条件,并用VAE补充细粒度身份信息;核心在于DLA跨层分别聚合文本/视觉特征,以及分阶段训练和去噪来缓解两类条件冲突。实验显示其在人类偏好、指令遵循和身份保持上优于既有方法,但具体增益中模型规模与数据贡献仍需进一步拆解。

Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning Figure 1
2026-05-26cs.LG

Prism: A Plug-in Reproducible Infrastructure for Scalable Multimodal Continual Instruction Tuning

Jun-Tao Tang, Yu-Cheng Shi, Zhen-Hao Xie, Da-Wei Zhou

School of Artificial Intelligence, Nanjing University, China, National Key Laboratory for Novel Software Technology, Nanjing University, China

2026-05-26视觉语言

针对多模态大模型持续指令调优中方法需反复改动底座代码、难复用且难公平比较的问题,Prism 将算法、底座、基准和评测解耦为插件注册式组件,并原生支持 DeepSpeed 等大规模训练流程。文中主要结果是提供统一基础设施,覆盖 9 类方法和 3 个 MCIT 基准,相比 CoIN、MCITlib 增加统一骨干与可复现实验支持;具体性能增益并非重点,增益来源不清。

Helix4D: Complex 4D Mesh Generation Figure 1
2026-05-26cs.CV

Helix4D: Complex 4D Mesh Generation

Jiraphon Yenphraphai, Jianqi Chen, Jian Wang, Gordon Qian, Sergey Tulyakov, Rameen Abdal, Raymond A. Yeh, Peter Wonka, Chaoyang Wang

2026-05-26视觉感知三维

Helix4D针对现有视频到4D网格在拓扑变化、透明材质、细结构和内部表面上失效的问题,将Trellis2的强3D先验扩展到视频条件生成;关键做法是首帧锚定的滑窗跨帧注意力,以及把低频空间RoPE频段重用于时间编码以尽量不破坏预训练能力。实验显示其在ActionBench上CD-3D较ActionMesh提升3.8%,在自建52视频复杂动态集上各指标优于基线,用户偏好率达67.9%。

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching Figure 1
2026-05-26cs.CV

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching

Yushi Huang, Xiangxin Zhou, Ruoyu Wang, Chi Zhang, Jun Zhang, Tianyu Pang

2026-05-26视觉感知生成模型强化学习优化算法三维

针对少步扩散/flow 蒸馏虽能加速但难以兼顾教师分布与人类偏好的问题,论文提出 RTDMD:把对“奖励倾斜教师分布”的 KL 最小化分解为分布匹配与奖励最大化,并用 AC-DMD 稳定冷启动、混合策略梯度与 SubGRPO 处理随机中间步和确定性末步。在 SD3、SD3.5、FLUX.2 上仅 4 步采样即在偏好、美学和组合指标上超过既有少步方法,部分结果甚至优于 50 步大模型。

On-Policy Adversarial Flow Distillation for Autoregressive Video Generation Figure 1
2026-05-26cs.CV

On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

Yang Luo, Shengju Qian, Xiaohang Tang, Zirui Zhu, Yong Liu, Xin Wang, Yang You

2026-05-26视觉感知生成模型强化学习模仿学习三维

面向只能返回成片的黑盒视频教师,论文指出自回归学生用SFT会因离策略前缀产生误差累积,传统DMD又依赖不可见分数。AFD用同提示下教师样本与学生rollout训练Bradley–Terry判别器,将样本级优势经学生前向加噪转成稠密flow matching监督。两类因果AR学生上,方法提升运动与物理敏感指标且基本保持通用视频质量。

EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding Figure 1
2026-05-26cs.CV

EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding

Geo Ahn, Jiwook Han, Youngrae Kim, Joonseok Lee, Jinwoo Choi

2026-05-26视觉语言视觉感知数据集/基准安全鲁棒

这篇论文针对多模态大模型做视频时序定位时“域内提升、跨域崩溃”的问题,指出主要瓶颈不是新概念,而是视觉域偏移导致实体注意力与定位能力脱耦。EVIDENT通过实体瓶颈适配器、实体绑定蒸馏和实体证据门控,把微调约束到查询相关实体证据上。跨域VTG实验显示其提升OOD鲁棒性,同时基本保持域内性能且参数开销较小。

Global Structure-from-Motion Meets Feedforward Reconstruction Figure 1
2026-05-26cs.CV

Global Structure-from-Motion Meets Feedforward Reconstruction

Linfei Pan, Johannes Schönberger, Marc Pollefeys

2026-05-26视觉感知强化学习模仿学习数据集/基准三维

这篇工作针对经典 SfM 在低纹理、低重叠、对称场景中易失败,而前馈三维重建又受限于规模、精度和鲁棒性的矛盾,系统分析两类方法的失效模式,并提出结合全局 SfM 优化与前馈重建先验的新管线。实验覆盖 5 个具不同挑战的数据集,显示该方法在多种场景下平均排名领先并达到当前最佳结果,系统已开源。

InstructSAM: Segment Any Instance with Any Instructions Figure 1
2026-05-26cs.CV

InstructSAM: Segment Any Instance with Any Instructions

Yuqian Yuan, Wentong Li, Zhaocheng Li, Yutong Lin, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang, Wenqiao Zhang

2026-05-26视觉语言视觉感知生成模型数据集/基准三维

InstructSAM针对SAM3只能处理短语概念、难以理解属性/关系/排除/计数等复杂指令的问题,把指令驱动实例分割建模为集合式查询预测:在VLM中注入可学习实例查询并用混合注意力与文本、图像交互,再投影到SAM3查询空间单次输出多实例掩码。作者还构建Inst2Seg数据集,实验显示2B模型在复杂指令与短语指代分割上优于既有端到端方法和SAM3多轮代理流程。

Pixel-Level Pavement Distress Assessment Using Instance Segmentation Figure 1
2026-05-26cs.CV

Pixel-Level Pavement Distress Assessment Using Instance Segmentation

Logan Dewick (University of Wisconsin - Green Bay), Bibesh Pyakurel (University of Wisconsin - Green Bay), Kong Pheng Yang (University of Wisconsin - Green Bay), Nazim Choudhury (University of Wisconsin - Green Bay), M. G. Sarwar Murshed (University of Wisconsin - Green Bay)

2026-05-26视觉感知学习理论数据集/基准

针对路面裂缝细长、分叉且难以用框精确量化的问题,本文将 Detectron2 Mask R-CNN 用于 UWGB-StreetCrack 手机采集数据的实例分割,核心价值在于用多边形标注和掩码估计裂缝面积而非仅检测框。最佳 ResNet-101 FPN 取得 84.23% 精度、90.04% 召回和 87.04% F1,预测裂缝面积占比 2.164% 接近真值 2.170%;但其贡献主要是实证基准,类别不均衡和缺少标准 mask AP 仍限制结论。

Channel-wise Vector Quantization Figure 1
2026-05-26cs.CV

Channel-wise Vector Quantization

Wei Song, Tianhang Wang, Yitong Chen, Tong Zhang, Zuxuan Wu, Ming Li, Jiaqi Wang, Kaicheng Yu

2026-05-26视觉感知生成模型三维

论文针对传统 VQ 以空间 patch 量化导致码本利用率低、且需将二维图像生硬展平成自回归序列的问题,提出按特征通道量化的 CVQ,将图像表示为逐步增加视觉细节的一维通道序列,并据此设计 next-channel prediction 的 CAR 生成框架。实验显示,CVQ 在 16K+ 码本下达到 100% 利用率并提升重建质量,CAR 在文生图上取得 DPG 86.7、GenEval 0.79。

Paris 2.0: A Decentralized Diffusion Model for Video Generation Figure 1
2026-05-26cs.CV

Paris 2.0: A Decentralized Diffusion Model for Video Generation

Ali Rouzbayani, Bidhan Roy, Marcos Villagra, Zhiying Jiang

2026-05-26视觉感知生成模型

论文针对视频扩散/世界模型训练依赖集中式高带宽 GPU 集群的问题,提出将 Paris 1.0 的去中心化扩散扩展到视频:多个 11B 专家在不同数据簇上独立训练、无梯度同步,推理时由轻量路由器在去噪步骤选择专家。低分辨率等数据等算力对比中,三专家 DDM 将 FVD 从 561.04 降至 279.01,并提升 CLIP 文本-视频相似度和美学分;消融显示专家有簇内专化和切换收益,但仍是 Stage 1 低分辨率验证。

Look Both Ways Before You Cross: Lifting Cross Fields From 2D Visual Priors Figure 1
2026-05-26cs.GR

Look Both Ways Before You Cross: Lifting Cross Fields From 2D Visual Priors

Dale Decatur, Jacob Serfaty, Oded Stein, Amir Vaxman, Rana Hanocka

University of Chicago, University of Southern California, University of Edinburgh, University of Chicago USA, University of Southern California USA, University of Edinburgh United Kingdom

2026-05-26视觉感知

针对传统四边形重网格多依赖局部几何、难以捕捉语义特征且人工设计成本高的问题,CrossLift利用文本到图像模型生成多视角特征对齐网格图像,从2D梯度提取方向并回投到3D表面,再通过两阶段带置信权重的平滑插值形成交叉场。实验显示其在有机与机械模型上比几何或数据驱动基线获得更符合语义的四边形走向,并支持纹理对齐和2D手绘交互引导。

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models Figure 1
2026-05-26cs.CV

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang

2026-05-26视觉语言视觉感知生成模型强化学习数据集/基准

这篇论文针对轻量级视觉语言模型在机器人操作、自动驾驶等拥挤场景中容易把物体、属性和关系“说顺但看错”的问题,提出 DRBench 密集场景推理基准,并用 DRScaffold 将监督拆成实体定位、关系图、逐步推理和答案生成四阶段,配合分阶段梯度掩码训练。实验显示,2–6B 模型在 DRBench 上显著提升且不损害通用基准,其中 Qwen2.5-VL-3B 甚至超过冻结的 32B 模型。

Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution Figure 1
2026-05-26cs.CV

Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution

Zixin Jessie Chen, Zhuo Chen, Archer Wang, Jeff Gore, William T. Freeman, Congyue Deng, Marin Soljačić

2026-05-26视觉感知生成模型三维

论文把图像生成与超分辨率都视为跨尺度信息损失的反演,动机是利用自然图像和临界物理系统的尺度不变性。其核心是 SKILD:在频域按从细到粗衰减内容,并注入匹配数据谱的高斯噪声,使同一无条件反向扩散仅通过起始时间步即可做生成或连续超分。结果显示其在 CIFAR-10 上达 FID 2.65、IS 9.63,单个 ImageNet checkpoint 支持 2×–8× 超分并在感知指标上优于条件基线,还能较好重建 Ising 模型高阶相关。

A Multimodal 3D Foundation Model for Light Sheet Fluorescence Microscopy Enables Few-Shot Segmentation, Classification, and Deblurring Figure 1
2026-05-26cs.CV

A Multimodal 3D Foundation Model for Light Sheet Fluorescence Microscopy Enables Few-Shot Segmentation, Classification, and Deblurring

Adina Scheinfeld, Haotan Zhang, Shang Mu, Rudolf L. M. van Herten, Lucas Stoffl, Ali Erturk, Zhuhao Wu, Johannes C. Paetzold

2026-05-26视觉语言视觉感知生成模型数据集/基准三维

针对光片荧光显微三维体数据标注昂贵、现有监督模型难跨染色和生物结构泛化的问题,论文构建跨物种/染色/协议的LSM体数据与专家文本描述,采用3D骨干结合掩码重建、EMA蒸馏和CLIP式图文对齐预训练。少量标注微调后,在分割、分类和去模糊任务上均优于从零训练及基线,并经专家评估验证,但具体增益中图文对齐相对数据规模的贡献仍需进一步拆解。

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models Figure 1
2026-05-26cs.CV

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

2026-05-26视觉语言视觉感知规划控制学习理论三维

视频问答需要跟踪运动、时序和状态变化,显式 CoT、重插帧或工具调用虽能补证据但推理开销高。TORM/STORM 的核心是用训练期生成的“思考视频”监督少量连续潜变量,两阶段先对齐动态表征、再仅用答案强化内化推理,测试时只做固定长度 latent rollout。文中在 VideoMME、MVBench、TempCompass、MMVU 上报告精度提升且显著降低推理开销,但具体增益中数据与生成监督贡献仍需进一步拆解。

AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models Figure 1
2026-05-26cs.LG

AdvantageFlow: Advantage-Weighted Least Squares for RL in Flow Models

Branislav Kveton, Anup Rao, Subhojyoti Mukherjee, Krishna Kumar Singh, Viet Dac Lai

2026-05-26生成模型强化学习

针对流/扩散模型强化学习常把反向去噪当序列决策、需额外随机性且奖励归因困难的问题,本文提出 AdvantageFlow:直接在前向预测损失上按同一提示内样本优势加权,并用 rollout 与参考策略正则化处理负优势导致的非凸和能力遗忘。基于 Stable Diffusion 3.5 Medium 的图像生成实验显示,它在多种奖励和 GenEval 评测中优于 Flow-GRPO 与 DiffusionNFT,但结果仍依赖奖励模型质量。

MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control Figure 1
2026-05-26cs.CV

MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control

Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Jingya Wang

2026-05-26机器人视觉感知生成模型模仿学习规划控制

MIND针对文本驱动物理人形控制中文本到低层动作语义鸿沟、以及生成-跟踪范式存在动力学域偏移的问题,提出把人形状态中的运动动态视为“意图”中介,并在扩散策略中用全局意图预测和逐步即时意图预测共同引导动作生成。实验显示其在语义对齐、物理合理性和动作自然度上优于现有基线。

MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models Figure 1
2026-05-26cs.CV

MAGIC: Multimodal Alignment & Grounding-aware Instruction Coreset for Vision-Language Models

Shristi Das Biswas, Kaushik Roy

2026-05-26视觉语言视觉感知数据集/基准

针对视觉指令数据冗余、弱视觉依赖和多模态能力覆盖不均导致全量微调低效的问题,MAGIC用预训练VLM前向提取多模态增益、视觉 grounding 相关性和技能神经元签名,先过滤再排序并按签名分桶配额,以保留有用且多样的样本。在20%数据预算下,其在LLaVA-665K与Vision-Flan上达到或略超全量微调表现,并将端到端耗时降低73.7%。

Towards 3D heart mesh generation using contactless radar imaging and physics-informed neural network Figure 1
2026-05-26cs.CV

Towards 3D heart mesh generation using contactless radar imaging and physics-informed neural network

Jinye Li, Chenxi Fu, Minghang Zheng, Yang Liu, Xiahai Zhuang, Qingchao Chen

2026-05-26视觉感知强化学习学习理论数据集/基准三维

本文面向 MRI 难以连续、便携监测心脏功能的问题,探索用非接触毫米波 SAR 从噪声强、边界模糊的雷达回波中重建三维心脏网格。核心做法是 SAR2Mesh:以拓扑模板为先验,通过粗到细图卷积变形、多视角几何感知特征投影和物理一致的可微雷达损失约束重建,并构建配对 Cardiac Mesh-SAR 数据集。实验显示其相较图像回归等基线能得到更连续、物理一致的心脏表面。

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence Figure 1
2026-05-26cs.CV

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

2026-05-26机器人视觉语言视觉感知数据集/基准三维

针对现有视觉语言模型把视频简化为均匀抽帧、难以保留长时序运动证据的问题,LLaVA-OneVision-2将压缩视频视为bit-cost连续流,用码率变化自适应分组、以运动残差选择关键空间证据,并用3D RoPE统一图像、帧与codec画布。结合大规模视频重标注与2D/3D空间数据训练后,8B模型在JumpScore达74.9 mAP,较Qwen3-VL-8B高44.8点,视频、空间和跟踪基准也有稳定提升,但部分收益可能来自数据与训练规模。

F-RNG: Feed-Forward Relightable Neural Gaussians Figure 1
2026-05-26cs.GR

F-RNG: Feed-Forward Relightable Neural Gaussians

Guangming Fu, Jiahui Fan, Jian Yang, Miloš Hašan, Beibei Wang

Nankai University, Nanjing University, Nankai University China, Nanjing University China

2026-05-26三维

F-RNG瞄准稀疏视角下可重光照3D资产生成:优化式3DGS依赖密集视角且逐场景耗时,前馈LRM又常把光照烘焙进外观。论文将RelitLRM与内禀分解模型先验作为冻结骨干,通过潜空间插值细化几何、MaterialFormer和光照无关正则蒸馏可重光照神经高斯,再用通用神经渲染器支持任意光照。实验中仅用6视图,在多数据集较RelitLRM约提升2 dB,并将重光照时间从约6.8秒降至246毫秒,约25倍加速。

PathWISE: Multi-Agent Cancer Pathway Triaging Ontology Learning from Clinical Flowcharts Figure 1
2026-05-26cs.CV

PathWISE: Multi-Agent Cancer Pathway Triaging Ontology Learning from Clinical Flowcharts

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Mohammed Adil Butt, Andrew D. Beggs, Adam Byfield, Anusha Jose, William Poulett, Ben Wallace, Junaid Qadir, Muhammad Bilal

2026-05-26生成模型三维

临床癌症分诊路径常以流程图表达,拓扑、箭头和颜色等信息难以直接进入电子病历决策支持。PathWISE的核心是把LLM限制在图结构与CQL草稿抽取,再用确定性DFS枚举、节点可计算性审计和Java CQL编译器校验,生成可部署的FHIR CDS Hooks逻辑。其在5个NHS癌症路径上实现15个库100%语法编译,枚举363条旅程并发现544项治理问题;但语义通过率最高仅48.9%,不可计算节点以false占位保留,临床完整性仍需人工审查。

Context-driven Missing-Modality Learning for Robust Medical Diagnosis with Image-Tabular Data Figure 1
2026-05-26cs.CV

Context-driven Missing-Modality Learning for Robust Medical Diagnosis with Image-Tabular Data

Tianling Liu, Lequan Yu, Tong Han, Liang Wan

2026-05-26视觉语言视觉感知模仿学习数据集/基准三维

临床图像与表格数据常因成本或流程缺失部分模态,导致多模态诊断模型退化。本文提出 CMML:用带可学习上下文 token 的级联残差 Transformer 自编码器建模跨模态依赖并补全缺失表征,再借助记忆库、实例自适应语义参考和类别感知对比学习对齐原始与合成特征。在 Derm7pt、ODIR、MEN 上平均 AUC 分别较 SOTA 提升 1.26%、0.97%、1.32%。

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing Figure 1
2026-05-26cs.CV

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Benjamin Wallace, William Poulett, Adam Byfield, Lukman Akanbi, Muhammad Bilal

2026-05-26视觉语言视觉感知数据集/基准安全鲁棒

针对结直肠癌紧急转诊表单中手写、版式变化和OCR断链导致的人工审核负担,RAPTOR+用视觉语言模型直接从文档图像抽取结构化字段并给出证据框,同时提出兼顾准确率与定位的评估。实验显示零样本大模型虽能读文本但几乎不能严格溯源;微调Qwen3-VL-8B达到96.1%读取准确率和60.6%严格安全性,说明任务微调是可审计临床抽取的关键。

VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding Figure 1
2026-05-26cs.CV

VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding

Yinghao Wu, Zhuoyan Luo, Yiyao Yu, Zhaojian Yu, Yujiu Yang, Xiao-Ping Zhang

2026-05-26视觉语言视觉感知模仿学习三维

针对高压缩率单一路径视觉 token 或基于粗注意力剪枝导致信息容量、密度不足的问题,VEN-VL提出“先丰富再压缩”的视觉集成 MoE:用 MKE 融合多视角视觉表征,用 HTE 自适应路由到专家逐层压缩,并以 SIP 重建监督保留结构信息。在仅保留约7.5%~10%视觉 token 时,TextVQA 提升8.1%、MMBench 提升5.2%,显示效率与复杂多模态理解性能的折中改善。

A Pedestrian-Vehicle Interaction Benchmark and Annotation Framework for Unstructured Scenes via Uncalibrated Cameras Figure 1
2026-05-26cs.CV

A Pedestrian-Vehicle Interaction Benchmark and Annotation Framework for Unstructured Scenes via Uncalibrated Cameras

Haoyang Peng, Qian Hu, Songan Zhang, Ming Yang

2026-05-26视觉感知生成模型规划控制数据集/基准三维

针对自动驾驶在非结构化共享空间中缺少密集人车交互数据、现有数据偏结构化道路或特定场景的问题,论文提出利用未标定监控视频构建与标注轨迹数据的框架,并发布PINNS,覆盖多地区、季节、光照和天气,提供轨迹与场景级信息。主要结果是形成可扩展基准并用于评估轨迹预测方法,但具体性能增益与基线结果文中片段未充分说明,贡献可能主要来自数据规模与场景多样性。

EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory Figure 1
2026-05-26cs.CV

EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory

Ruiqiang Xiao, Zhaohu Xing, Yijun Yang, Zhenyan Han, Weiming Wang, Kaishun Wu, Lei Zhu

2026-05-26视觉语言视觉感知强化学习学习理论数据集/基准

针对超声视频中噪声强、边界弱且单点提示易导致尺度歧义和时序漂移的问题,EchoPilot在不训练的条件下组合冻结的医学VLM、视觉基础模型和视频分割器:用S.E.E.D.选择首帧最佳语义尺度并生成辅助点,再以可靠性门控限制不确定帧写入记忆。其在CAMUS、乳腺病灶和新建胎盘数据集上优于训练免费基线及微调医学模型,胎盘场景提升尤为明显。

LRDDv3: High-Resolution Long-Range Drone Detection Dataset with Range Information and Thermal Data Figure 1
2026-05-26cs.CV

LRDDv3: High-Resolution Long-Range Drone Detection Dataset with Range Information and Thermal Data

Knut Peterson, Zaid Mayers, Azmain Yousuf, Priontu Chowdhury, Asher Zaczepinski, Solmaz Arezoomandan, Reihaneh Maarefdoust, David Han

2026-05-26视觉感知数据集/基准安全鲁棒

针对无人机与载人/无人平台共域飞行时远距离感知数据不足的问题,LRDDv3主要贡献是把4K机载RGB、配对640×512热红外、0–200米距离标注和多天气/光照/遮挡场景整合到同一数据集中。论文结果是发布102,532张RGB图像与29,630张配对IR图像,较既有数据集更适合评估小目标远距检测;性能增益可能主要来自更大规模和更高质量数据。

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models Figure 1
2026-05-26cs.CV

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

Yiwei Xie, Ping Liu, Zheng Zhang

2026-05-26视觉感知生成模型优化算法

这篇论文针对文本到视频扩散模型中概念擦除常因固定层干预而出现语义泄漏或画质退化的问题,指出不同概念只在特定深度形成较好可分的“概念-层拓扑对齐”。作者提出 CLEAR,将干预层选择建模为基于目标/非目标可分性的优化,并结合稀疏特征操作,在不更新扩散模型权重的情况下自动找层。Wan2.2-5B、CogVideoX-2B 实验显示其能更强抑制物体、身份和敏感概念,同时基本保持生成质量。

How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution? Figure 1
2026-05-26eess.IV

How Accurate are Video Quality Models for Diffusion-Based Video Super-Resolution?

Benjamin Herb, Steve Göring, Alexander Raake, Rakesh Rao Ramachandra Rao

2026-05-26视觉感知生成模型

扩散式视频超分常用客观质量模型自评,但其生成细节、过锐化和时空不一致可能偏离人眼感知。本文以4K播放场景构建主观测试,比较6种上采样方法及AV1、DCVC-RT等退化,并系统检验全参考/无参考指标。结果显示LPIPS、DISTS、CVQA-FR等CNN全参考模型在序列内相关性较高,但多数指标会高估SCST的过锐化,VMAF也受Starlight Mini空间不一致影响;现有模型仍不足以替代主观评价。

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models Figure 1
2026-05-26cs.CV

Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models

Xiao Liu, Jiaxiang Liu, Boci Peng, Boren Hu, Yusong Wang, Xiwen Chen, Prayag Tiwari, Liming Zhang, Mingkun Xu

2026-05-26视觉感知模仿学习学习理论数据集/基准三维

论文针对 CLIP 等视觉语言模型在白盒对抗扰动下跨模态语义对齐易被破坏的问题,指出现有防御多为单向或静态提示,难以按样本恢复一致性。其核心是冻结编码器,引入文本到视觉去噪与视觉到文本提示更新的闭环双向提示,并用语义锚约束迭代避免漂移。实验覆盖 11 个数据集,显示鲁棒性、base-to-new 泛化和计算开销之间优于多类基线。

Curve Skeletonization in Continuous domain for Meshes and Point Clouds Figure 1
2026-05-26cs.GR

Curve Skeletonization in Continuous domain for Meshes and Point Clouds

Jai Bardhan, Ramya Hebbalaguppe, Aravind Udupa

2026-05-26三维

针对局部分隔符(LS)骨架化依赖离散图、易受网格质量和点云噪声影响的问题,本文将其推广到连续流形框架 CSCD,并分别实现面向网格的 CSCD-M 与点云的 CSCD-PC;前者利用内蕴三角化保持拓扑,后者结合 tufted Laplacian 提升鲁棒性。实验显示,CSCD-M 在多类网格和 Thingi10k 上达到或优于 LS、平均更快约 60%,CSCD-PC 在定性比较中优于 CA++ 与 EPCS,并可用于分类、分割及孔洞/收缩结构识别。

R5DGS: Semantic-Aware 4D Gaussian Splatting with Rigid Body Constraints for Efficient Dynamic Scene Reconstruction Figure 1
2026-05-26cs.CV

R5DGS: Semantic-Aware 4D Gaussian Splatting with Rigid Body Constraints for Efficient Dynamic Scene Reconstruction

Denis Gridusov, Maxim Popov, Sergey Kolyubin

2026-05-26机器人视觉感知优化算法三维

面向机器人等需要预测动态三维场景的应用,R5DGS针对物理4D Gaussian逐粒子推理开销大且缺少对象语义的问题,引入Identity Encoding做高斯到物体分组,并用CLIP离线表支持文本检索;外推时仅积分物体代表/质心并刚体传播到组内高斯。实验在动态室内场景上约从62.1提升到73.6 FPS、mIoU基本不变,但PSNR明显下降,且依赖SAM2+DEVA离线掩码,遮挡快速运动下会受影响。

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models Figure 1
2026-05-26cs.CV

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

2026-05-26视觉语言视觉感知强化学习学习理论三维

针对零样本3D视觉定位依赖多视图图像、候选过多且空间推理易级联出错的问题,AgentGrounder直接面向彩色点云,先离线构建含实例、语义和3D框的对象表,再由多模态代理按查询选择候选、做确定性几何评分,并在需要颜色/材质等证据时按需渲染。ScanRefer和Nr3D上相对SeeGround取得稳定提升,但文中不同位置对Nr3D增益表述不一。

SP-MoMamba: Superpixel-driven Mixture of State Space Experts for Efficient Image Super-Resolution Figure 1
2026-05-26cs.CV

SP-MoMamba: Superpixel-driven Mixture of State Space Experts for Efficient Image Super-Resolution

Wenbin Zou, Yawen Cui, Yi Wang, Lap-Pui Chau, Liang Chen, Jinshan Pan, Huiping Zhuang, Guanbin Li

2026-05-26视觉感知学习理论数据集/基准三维

针对 Mamba 类超分方法将图像刚性展平成序列、破坏空间语义拓扑且难适配多尺度纹理的问题,SP-MoMamba把超像素作为状态空间建模单元,用SP-SSM压缩同质区域,并通过多尺度专家路由与局部空间调制兼顾全局一致性和边缘细节。实验称其在标准SR基准上取得更好的重建质量与效率折中,但具体增益归因仍需看消融细节。

A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation Figure 1
2026-05-26eess.IV

A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation

Zhengrui Guo, Zhengyu Zhang, Jiabo Ma, Yihui Wang, Fengtao Zhou, Yingxue Xu, Ling Liang, Chenglong Zhao, Qi Xie, Jinbang Li, Shujing Guo, Fangyi Han, Zhijian Cen, Ziyi Liu, Cheng Jin, Junlin Hou, Zhixuan Chen, Yu Cai, Lijuan Qu, Shifu Chen, Yueping Liu, Zhe Wang, Xiuming Zhang, Muyan Cai, Li Liang, Hao Chen

Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China., Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China., Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China, Guangdong Provincial Key Laboratory of Molecular Tumor Pathology, Guangzhou, China., Department of Pathology, Shandong Provincial Qianfoshan Hospital, Jinan, Shandong, China, Department of Pathology, The Affiliated Qingyuan Hospital (Qingyuan People’s Hospital), Guangzhou Medical University, Qingyuan, China, Department of Pathology, 900th Hospital of PLA Joint Logistic Support Force, Fuzhou, China, Department of Pathology, the Fourth Hospital of Hebei Medical University, Shijiazhuang, Hebei, China, Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China, Hefei, China, Department of Pathology, The First Affiliated Hospital, School of Medicine, Zhejiang University, Hangzhou, China, Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology, Hong Kong SAR, China, Division of Life Science, Hong Kong University of Science and Technology, Hong Kong SAR, China

2026-05-26视觉感知

针对肺癌病理在活检、冰冻切片和术后评估中任务割裂、泛癌基础模型缺少专科深度与前瞻验证的问题,本文提出 PulmoFoundation,在 Virchow2 上用约 40000 张肺部 H&E 全切片、8800 万图块持续预训练,并覆盖诊断、分期、分子和预后任务。模型在 26k+ WSI、32 项任务及多中心外部队列中优于多种泛癌模型;前瞻 1357 例平均 AUC 92.3%,RCT 中辅助病理医生将准确率从 83.8% 提至 91.7%,并缩短诊断时间。

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation Figure 1
2026-05-26cs.CV

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

2026-05-26视觉感知强化学习数据集/基准三维

本文针对文生图奖励模型常把偏好压成静态总分、难以适配不同用户任务的问题,提出 DyCoRM:先从提示词与图像对中定位当前相关评价准则,再按准则进行偏好比较;同时构建 DyCoDataset-20K 与 DyCoBench-1K,并用 DyCoPick做选图。实验显示其在动态准则评测、跨域总体偏好和人工选图中优于 HPSv3、ImageReward 等基线。

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation Figure 1
2026-05-26cs.CV

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

2026-05-26机器人视觉语言视觉感知强化学习规划控制

针对交互式视频世界模型评测碎片化、难以同时诊断画质、可控性、记忆与物理的问题,WBench构建289个多轮案例和1058次交互,覆盖开放场景、双视角及导航/动作/事件编辑/视角切换,并用文本、6-DoF位姿、离散动作统一导航接口和22项自动指标评测。对20个模型的结果显示暂无模型在五维都强,导航最脆弱,物理正确性更随渲染质量而非控制能力变化。

MuNet: A Mutualistic Network for Joint 3D Human Mesh Recovery and 3D Clothed Human Reconstruction from Single Images Figure 1
2026-05-26cs.CV

MuNet: A Mutualistic Network for Joint 3D Human Mesh Recovery and 3D Clothed Human Reconstruction from Single Images

Yunqi Gao, Leyuan Liu, Yuhan Li, Changxin Gao, Jingying Chen

2026-05-26视觉感知强化学习模仿学习优化算法数据集/基准

针对单图像中人体网格恢复与穿衣人体重建长期分开处理、衣物尤其宽松服装会干扰体型估计的问题,MuNet 将两者统一为 2-流形图表示,并用端到端图卷积逐步从初始图变形到裸人体网格和带衣表面;其关键洞察是让人体网格为重建提供拓扑与定位先验,同时用表面误差反向修正网格估计。在 Human3.6M、3DPW、THuman2.0 等六个基准上,文中报告两项任务均达到 SOTA。

SAM3-Assisted Training of Lightweight YOLO Models for Precision Pig Farming Figure 1
2026-05-26cs.CV

SAM3-Assisted Training of Lightweight YOLO Models for Precision Pig Farming

Marcos Vinicius Mendes Faria, Thiago Borges Pereira, Isabella C.F.S. Condotta, Thiago Meireles Paixão, Francisco de Assis Boldt

2026-05-26视觉感知数据集/基准三维

面向精准养猪中“基础模型太重、轻量检测器又依赖人工标注”的矛盾,论文将 SAM 3 作为离线零样本自动标注器,用文本提示生成猪只伪框来训练 YOLOv8,并在部署时仅运行轻量学生模型。PigLife 实验显示,SAM 3 监督的 YOLOv8m 在零人工标注下达到 79.4% mAP,较教师推理约快 200 倍;低遮挡场景 AP50 超过 99%,但总体仍低于人工标注基线约 91.7%。

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills Figure 1
2026-05-26cs.RO

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

University of Michigan, Ann Arbor

2026-05-26机器人

这篇论文针对机器人形态搜索“只保留最优个体、丢弃试验经验”的问题,提出 AUTO-ROBOTIST:用固定 LLM 将 EVOGYM 中的评估轨迹提炼为可审计的自然语言技能库,包含结构原型、正负规则和证据,并在后续搜索中检索这些技能指导精英体编辑,同时保留 GA 变异探索。实验显示其在 7 个任务的 5×5 冷启动搜索中优于或不逊于 GA,并在 5×5 到 10×10 迁移中全部任务超过 GA,尤其适合接触、支撑和承载结构关键的场景。

[CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation Figure 1
2026-05-26cs.CV

[CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation

Akang Wang, Xili Deng, Zhanxuan Hu, Yi Zhao, Yonghang Tai, Huafeng Li

2026-05-26视觉语言视觉感知模仿学习优化算法数据集/基准

这篇论文针对 CLIP 等视觉语言模型在多标签识别中依赖单一 [CLS] 全局表征、易漏检小目标和共现目标的问题,提出训练自由的 PIAA:将识别转为 patch 级推理,并通过语义解耦、无监督视觉分类器缓解图文模态差,再自适应聚合局部与全局分数。实验显示其在多个多标签基准上优于代表性方法,NUS-WIDE 上 mAP 提升超过 6%,且额外计算较少。

Data-driven Head Motion Generation through Natural Gaze-Head Coordination Figure 1
2026-05-26cs.CV

Data-driven Head Motion Generation through Natural Gaze-Head Coordination

Xiaohan Liu, Yilin Wen, Yusuke Sugano

2026-05-26视觉感知生成模型规划控制数据集/基准三维

针对凝视控制人脸/数字人中常把视线与头姿独立建模、导致动态转头僵硬的问题,本文从野外大规模人脸视频自动抽取视线与头部运动,并用带 GRU 上下文的 cVAE 学习二者的概率与时序耦合,生成随输入视线变化的多样头动。实验在 CelebV-Text 抽取数据和视频生成应用上验证,人评与定量比较均显示其自然性和视线协调性优于基线。

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset? Figure 1
2026-05-26cs.CV

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

Sangeeta, Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

2026-05-26视觉语言视觉感知强化学习数据集/基准三维

针对现有视频异常检测数据集偏向高质量、近景、通用暴力场景,难以识别跟踪、抢链、骚扰等女性安全相关细粒度异常,论文构建了含1001段真实监控视频与多源文本描述的ExtrAnom多模态基准。实验显示,在UCF-Crime等数据上训练的视觉/VLM方法在该场景中频繁误描述、误分类,说明瓶颈可能主要来自数据覆盖不足。

Event-to-Video Reconstruction using Spatio-Temporal and Frequency-Enhanced Deep Neural Networks Figure 1
2026-05-26cs.CV

Event-to-Video Reconstruction using Spatio-Temporal and Frequency-Enhanced Deep Neural Networks

Ramna Maqsood, Paulo Nunes, Luís Ducla Soares, Caroline Conti

2026-05-26视觉感知强化学习数据集/基准三维安全鲁棒

针对事件相机缺少稠密帧、现有 CNN/Transformer 在长程建模、细节恢复与计算开销间难兼顾的问题,论文提出 MSFET-E2V,将 CRNN 时空特征与 DWT 小波低/高频表示通过跨域注意力融合,并用小波增强跳连抑制伪影。实验称其在多个真实事件数据集上优于现有方法,同时较已有 Transformer 降低参数量、显存和推理时间。

ATV-Net: Adaptive Triple-View Network with Dynamic Feature Fusion Figure 1
2026-05-26cs.CV

ATV-Net: Adaptive Triple-View Network with Dynamic Feature Fusion

Hsin-Jui Pan, Sheng-Wei Chan, Meng-Qian Li, Chun-Po Shen

2026-05-26视觉感知强化学习学习理论三维

论文针对语义分割中 Transformer/复杂上下文模块成本较高、而传统 CNN 融合多尺度感受野多为固定权重的问题,提出在 ResNet-101 分割头中引入 micro/local/scout 三视图,并用 Adaptive Decision Gate 按场景动态融合点语义、边界结构与扩大上下文。Cityscapes 验证集达到 80.31% mIoU,说明简单 CNN 头部经自适应感受野选择仍具竞争力。

Rethinking VLM Representation for VLA Initialization Figure 1
2026-05-26cs.CV

Rethinking VLM Representation for VLA Initialization

Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei, Jianbo Liu, Hongsheng Li

2026-05-26机器人视觉语言视觉感知强化学习规划控制

这篇论文针对 VLA 常把预训练 VLM 当策略骨干、但初始化该保留或改造哪些表征不清的问题,把初始化拆成具身 VQA 能力域、更新方式和机器人数据预训练三轴来做受控分析。核心洞察是:原始 VLM 表征本身对动作学习很关键,具身 VQA 只有匹配下游瓶颈才有效且能力组合不简单相加;LoRA 比全量微调更稳,分阶段 LoRA 结合 Grounding、第一视角理解与机器人轨迹预训练取得最好初始化。

PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution Figure 1
2026-05-26cs.CV

PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution

Wenxue Li, Jingjing Ren, Peng Zhang, Tian Ye, Daiguo Zhou, Jian Luan, Lei Zhu

2026-05-26视觉感知生成模型规划控制优化算法三维

PixelWizard针对2K/4K视频生成中长token序列导致的全局结构失稳、训练与推理成本过高问题,将全局时空结构规划与高分辨率纹理合成解耦:先在紧凑潜空间生成时空锚点,再用锚点引导DiT细节生成,并通过噪声跨度对齐的shortcut训练支持少步采样。实验显示其在原生2K/4K生成中保持结构与细节质量,同时采样加速超过10倍。

Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning Figure 1
2026-05-26cs.CV

Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li

2026-05-26视觉语言视觉感知强化学习学习理论数据集/基准

面向无源跨域少样本学习,论文指出 CLIP 在目标域少样本微调时会放大 attention sink,使不同类别依赖相同“简单 token”而削弱可分性。作者将其解释为跨域适配的捷径学习,并提出 TIR 按视觉 token 与类别文本的相关性动态重加权,抑制 sink token、强化更具判别性的 hard token;在四个 CDFSL 基准上报告达到新的 SOTA。

VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes Figure 1
2026-05-26cs.CV

VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes

Jing Huang, Duanchu Wang, Junjie Yang, Zihang Cheng, Cheng Li, Lin Cui, Zhouyi Wu, Di Wang

2026-05-26视觉语言优化算法数据集/基准三维

针对遥感自然场景中仅凭RGB易因光谱混淆而误判的问题,本文提出VertiCue-Bench,用显式冠层高度模型(CHM)诊断MLLM是否能把垂直几何线索转化为语义判别依据。基准含1534个样本、17类任务,并分离高度感知、跨模态对齐与语义-几何推理。对14个通用和遥感MLLM的评测显示,模型虽能初步读取高度信息,但在需要联合约束的歧义推理中常无法受益,甚至弱于RGB-only基线,暴露出明显的几何到语义鸿沟。

OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance Figure 1
2026-05-26cs.CV

OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance

Zitong Xiao, Yuda Qiu, Zisheng Ye, Xiaoguang Han

2026-05-26视觉感知生成模型模仿学习优化算法数据集/基准

面向游戏、VR 等场景中遮挡人脸和多种风格化头像难以获得可靠 3D 几何、且纹理缺少可编辑语义分解的问题,OMGTex 用扩散模型直接从单张 2D 人脸生成 UV 纹理,并通过推理时梯度引导修正 UV 对齐、训练中强化语义分布以支持局部编辑;同时构建 CANVAS 配对数据集。实验显示其在多个人脸纹理基准上达到 SOTA,并具备较好的风格一致性、鲁棒性和编辑能力。

DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion Figure 1
2026-05-26cs.CV

DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion

Xingyuan Li, Haoyuan Xu, Shulin Li, Xiang Chen, Zhiying Jiang, Jinyuan Liu

2026-05-26视觉感知生成模型模仿学习优化算法三维

针对红外-可见光视频融合中逐帧扩散易闪烁、光流约束易产生鬼影且自回归会漂移的问题,DRFusion将融合改写为基于历史条件的运动生成,引入稳定历史引导与软时间锚定,把时序一致性视为频谱滤波,并用两阶段结构-运动解耦适配预训练3D-DiT先验。实验显示其在融合质量和时间稳定性上达到当前最优。

SAFE-Diff: Scale-Aware Attention and Feature-Dispersive Diffusion with Uncertainty Estimation for Contrast-Enhanced Breast MRI Synthesis Figure 1
2026-05-26cs.CV

SAFE-Diff: Scale-Aware Attention and Feature-Dispersive Diffusion with Uncertainty Estimation for Contrast-Enhanced Breast MRI Synthesis

Tianyu Zhang, Xinglong Liang, Jarek van Dijk, Luyi Han, Chunyao Lu, Antonio Portaluri, Xinghe Xie, Yaofei Duan, Nika Rasoolzadeh, Xin Wang, Yuan Gao, Muzhen He, Yue Sun, Jonas Teuwen, Tao Tan, Ritse Mann

2026-05-26生成模型安全鲁棒

针对乳腺 DCE-MRI 依赖钆对比剂带来的安全、成本与筛查效率问题,SAFE-Diff 用非增强 T1 与多 b 值 DWI 合成虚拟增强 MRI。其核心是在直接 x0 预测扩散框架中结合多尺度/窗口注意力、像素级不确定性重加权和特征分散正则,以兼顾长程解剖上下文与细粒度病灶纹理。实验显示其在增强特征重建上优于既有方法,但摘要未给出具体数据规模与临床读片验证细节。

Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models Figure 1
2026-05-26cs.CV

Concept Unlearning via Cross-Attention Activation Projection for Diffusion Models

Saemi Moon, Suhyeon Jun, Seoyeon Lee, Dongwoo Kim

2026-05-26视觉感知生成模型规划控制数据集/基准三维

本文针对扩散模型概念遗忘在改写、对抗提示下易泄漏的问题,指出文本嵌入只描述提示词,而交叉注意力激活更接近模型将要生成的内容。PURE从短去噪轨迹中按层收集激活,构造遗忘/保留子空间并一次性投影编辑K/V权重,无需推理开销。在HUB十类概念上,它降低目标泄漏并保持非目标概念,取得更好的遗忘-保留折中。

Benchmarking Pathology Foundation Models for Spatial Domain Understanding Figure 1
2026-05-26cs.CV

Benchmarking Pathology Foundation Models for Spatial Domain Understanding

Bokai Zhao, Yiyang Zhang, Yuanchi Zhu, Hanqing Chao, Long Bai, Tai Ma, Minfeng Xu, Ming Song, Tianzi Jiang

2026-05-26视觉感知强化学习数据集/基准

现有病理基础模型多用临床下游任务评测,难以判断其表征是否真正编码组织区域及空间关系。本文提出 SpaPath-Bench,把配对 WSI–空间转录组数据上的空间域识别作为表征级诊断,比较 19 个编码器与 7 类 SDI 方法,并用空间连续性、转录组参照和专家标注三类指标评估。83K 次实验显示,不同预训练范式捕获的组织空间结构侧重点不同,为构建空间感知病理模型提供了更细粒度基准。

AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis Figure 1
2026-05-26cs.CV

AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis

Shipeng Cao, Biao Qian, Haipeng Liu, Yang Wang, Meng Wang

2026-05-26视觉感知生成模型强化学习规划控制学习理论

该文针对扩散文生图中多主体提示常见的注意力错位问题:同一主体的 cross-attention 激活会空间散裂,不同主体又容易重叠混合。AI-T2I 的核心是在去噪过程中同时施加聚合损失与隔离损失,先把同一 token 的高响应区域收拢,再拉开不同主体 token 的响应分布,并分析欧氏距离等度量选择。实验称在 AnE、T2I-CompBench++ 等基准优于现有方法,且可插入布局可控生成和个性化生成任务。

Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences Figure 1
2026-05-26cs.CV

Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences

Bao Li, Yuliang Xiu, Zhen Liu

2026-05-26视觉感知生成模型规划控制优化算法学习理论

针对文生图模型在人像生成中常出现手指、面部等局部解剖错误的问题,论文提出 ASAP:先在高质量人像的特定部位合成可控解剖退化,构建 1 万余对 HAP 偏好数据,再用局部加权且有边界的 DPO 对齐,避免只优化全图或局部过拟合。实验在 FLUX、SDXL 上降低解剖错误率约 18.4% 和 11.8%,同时基本保持整体视觉质量。

Broadband Hyperspectral 3D Imaging using Dispersed Structured Light Figure 1
2026-05-26cs.CV

Broadband Hyperspectral 3D Imaging using Dispersed Structured Light

Suhyun Shin, Yunseong Moon, Ryota Maeda, David Lindell, Kyros Kutulacos, Seung-Hwan Baek

2026-05-26视觉感知强化学习优化算法三维

现有高光谱3D多局限于可见光或需双光谱仪,难以同时获取宽谱材料线索与几何。本文用卤素光、棱镜-振镜色散结构光和VNIR/SWIR双目相机,以单光谱仪建模并联合重建450–1500 nm反射率与深度。实测在多场景达到SAM 0.13 rad、RMSE 0.03、深度误差4.5 mm,并展示同色异谱识别、穿透成像、钞票隐藏特征和血管显现。

SplitAvatar: One-shot Head Avatar with Autoregressive Gaussian Splitting Figure 1
2026-05-26cs.CV

SplitAvatar: One-shot Head Avatar with Autoregressive Gaussian Splitting

Hongzhe Liao, Chuhua Xian, Hongmin Cai, Haiyang Liu, Fa-Ting Hong

2026-05-26视觉感知规划控制三维

针对单图可驱动头部头像中,3DMM 表情先验产生的稀疏高斯与图像重建所需稠密高斯数量不匹配、细节不足的问题,SplitAvatar 将身份与表情高斯分支建模,并用自回归 GNN 逐层拆分表情高斯,配合网格拓扑扩展、软门控密度控制和延迟过滤抑制冗余。实验显示该设计能提升表情细节与重建质量,但具体增益幅度需结合完整量化结果判断。

SFR-Net: Learning Scale-Frustum Representations for Ultra-Wide Area Remote Sensing Image Segmentation Figure 1
2026-05-26cs.CV

SFR-Net: Learning Scale-Frustum Representations for Ultra-Wide Area Remote Sensing Image Segmentation

Chuyu Zhong, Keyan Chen, Qinzhe Yang, Bowen Chen, Zhengxia Zou, Zhenwei Shi

2026-05-26视觉感知学习理论三维

这篇论文针对超广域遥感图像同时具备超大像素数和广覆盖范围时,裁块方法丢失长程语义、UHR方法难保细节的问题,提出SFR-Net:以同一参考点构建局部、短程、长程的尺度视锥表示,并用级联跨尺度融合逐步注入上下文。在GID和FBPS上较最强基线mIoU分别提升1.72%和4.29%,且SFR可作为通用分割网络插件提升精度与收敛速度。

DeCoDrift: Stabilizing Decoder Coupling in Closed-Loop Foundation Segmentation Figure 1
2026-05-26cs.CV

DeCoDrift: Stabilizing Decoder Coupling in Closed-Loop Foundation Segmentation

H. M. Shadman Tabib, Md. Shamsuzzoha Bayzid, M Sohel Rahman

2026-05-26视觉感知强化学习

这篇论文关注 SAM 等基础分割模型在闭环迭代提示中把上一轮掩码反馈为下一轮提示时产生的误差累积问题,提出“解码器耦合漂移”这一内部注意力失配视角,并用无需真值的耦合、稳定性与时序指标监测解码器动态。DeCoDrift 通过推理时近端锚定约束提示更新,无需训练或监督,在电镜体数据上提升注意力稳定性与时序一致性,IoU 相对提高 37.7%。

TriDP-PTM: a three-stage distortion-perception tradeoff guides the pre-training model for radar cardiac sensing Figure 1
2026-05-26cs.CV

TriDP-PTM: a three-stage distortion-perception tradeoff guides the pre-training model for radar cardiac sensing

Jinye Li (1, 2, 3), Aidong Men (4), Yang Liu (5), Qingchao Chen (1, 6) ((1) National Institute of Health Data Science, Peking University, Beijing, China, (2) Institute of Medical Technology, (3) Beijing University of Posts and Telecommunications, (4) School of Artificial Intelligence, Beijing University of Posts and Telecommunications, (5) Wangxuan Institute of Computer Technology, (6) State Key Laboratory of General Artificial Intelligence, China)

2026-05-26视觉感知数据集/基准三维

针对雷达无接触心脏监测中“波形低失真”与“任务感知强”难兼得的问题,TriDP-PTM引入雷达到ECG再到任务的间接路径,并用ECG生成器与特征判别器平衡失真/感知损失,提出正和、竞合、负和三阶段洞察。30名受试者、5种状态实验显示,间接路径优于直接预测,分割mIoU达0.80,四类任务平均准确率98.3%,血压回归MAE较最强基线降约56%。

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning Figure 1
2026-05-26cs.CV

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

Sriram Mandalika

2026-05-26视觉语言视觉感知数据集/基准三维安全鲁棒

该文针对多域任务增量学习中CLIP被当作纯视觉模型使用的问题,认为只靠视觉特征做任务路由和置信估计会浪费文本空间的稳定语义。CMAP用冻结文本原型路由、视觉多原型与图文对齐联合置信、并将Gumbel门控扩展到文本编码器。在MTIL 11数据集上以约2.5M可训练参数、无外部数据取得约74% Transfer、80% Average和89% Last,较IAP有数个百分点提升,但文中不同处结果数值略不一致。

Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker Figure 1
2026-05-26cs.CV

Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker

Zongjian Wu, Lei Zhang

2026-05-26视觉语言视觉感知强化学习模仿学习数据集/基准

现有指代表达理解基准多为单目标、简单场景,难以反映开放世界中目标缺失、多目标、恶劣天气和复杂词汇带来的失败。本文提出 OpenRef 基准,引入多视觉域、可变目标数量和专名/多义/序数表达,并用 F1 与 N3R 评估定位和负样本拒识;同时给出无需训练的 MCC,通过计数与定位一致性自检修正输出。实验显示该设置显著拉低现有模型表现,MCC 可提升多种 REC 模型在复杂场景下的性能。

Opportunistic Target Selection: Early Directional Commitment for Query-Efficient Black-Box Adversarial Attacks Figure 1
2026-05-26cs.LG

Opportunistic Target Selection: Early Directional Commitment for Query-Efficient Black-Box Adversarial Attacks

Florent Tariolle, Florian Yger

2026-05-26强化学习

论文针对无目标黑盒攻击只压低真类置信度而导致“类别漂移”、浪费查询的问题,提出 OTS:先短暂无目标探索,再锁定当前领先的非真类转为目标攻击,作为轻量的 margin-loss 替代。ImageNet 上 5 个模型、3 类攻击的 4500 次实验显示,OTS 对 SimBA 和交叉熵 Square Attack 接近 oracle,成功率最高提升 27 个百分点、迭代数显著下降;但对 Bandits、margin loss 和对抗训练模型基本无益。

DRM: Diffusion-based Reward Model With Step-wise Guidance Figure 1
2026-05-26cs.CV

DRM: Diffusion-based Reward Model With Step-wise Guidance

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

2026-05-26视觉语言视觉感知生成模型强化学习三维

针对VLM/CLIP式奖励模型偏重语义、难以评价审美构图等感知质量的问题,论文提出用预训练扩散模型本身作为奖励模型DRM,并利用其可评估去噪中间latent的特性,设计逐步奖励的Step-wise GRPO和逐步采样引导。实验显示该密集反馈可提升对齐稳定性与效率,Step-GRPO约快2.5倍收敛,并改善最终生成图像质量。

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration Figure 1
2026-05-26cs.CV

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

Linrui Tian, Qi Wang, Bang Zhang

2026-05-26视觉感知

面向文本驱动的长时角色音视频流生成,论文针对分块自回归易出现台词错位、身份漂移与扩散低步数失真的问题,提出将长程脚本编排交给 LLM、短窗联合去噪交给 DiT 的解耦框架,并用两阶段蒸馏、进度指针和 sink-chunk 记忆稳定在线 rollout。实验显示其可在单张 H100 上实时运行,在台词一致性、唇音同步、画质和长程稳定性间优于多种联合或音频驱动基线。

ARMA-C3: A Contrastive ARMA Convolutional Framework for Unsupervised and Semi-supervised Classification Figure 1
2026-05-26cs.CV

ARMA-C3: A Contrastive ARMA Convolutional Framework for Unsupervised and Semi-supervised Classification

VSS Tejaswi Abburi, Saurabh J. Shigwan, Nitin Kumar

2026-05-26视觉感知生成模型强化学习学习理论数据集/基准

针对医学影像中标注稀缺、类别不均衡且样本间关系常被忽略的问题,ARMA-C3将受试者/图像建成图节点,用ARMA谱图卷积捕获多尺度关系,并联合对比一致性与图割/模块度正则学习表示。在ADNI、NIFD及乳腺、肺炎、肝脏影像五个二分类任务上,文中报告其在少监督和不均衡场景下相对聚类、传统机器学习和图学习基线更稳健,但具体增益来源仍需更多消融支撑。

Event-based Batting Impact Estimation Figure 1
2026-05-26cs.CV

Event-based Batting Impact Estimation

Ryotaro Ishida, Wataru Ikeda, Ryosei Hara, Akemi Kobayashi, Toshitaka Kimura, Mariko Isogawa

2026-05-26视觉感知强化学习模仿学习规划控制数据集/基准

本文针对棒球击球瞬间难以用普通 RGB 相机或 IMU 精确定位的问题,引入事件相机的微秒级时间分辨率,通过构造高密度事件帧、双向传播粗掩码并用掩码细化网络校正球与球棒边界,再以二者加权质心距离最小点估计撞击时刻。作者还构建了面向高速棒球分析的事件数据集;在低照度和遮挡场景中,方法相对基线将平均绝对误差降低约 63%。

Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception Figure 1
2026-05-26cs.CV

Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception

Mingfeng Zha, Tianyu Li, Guoqing Wang, Yunqiang Pei, Chaofan Qiao, Jiening Zhang, Yang Yang, Heng Tao Shen

2026-05-26视觉感知优化算法学习理论数据集/基准三维

针对伪装目标检测在测试场景退化、光照变化和未知伪装模式下固定模型易失效的问题,本文将测试时自适应引入伪装感知,并用空间重建结合频域分解提取自监督信号,再通过任务亲和引导和原型一致性约束抑制语义漂移。实验覆盖4个伪装与4个水下基准及3类退化设置,结果显示其较现有方法更稳健,但具体计算开销文中未充分说明。

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering Figure 1
2026-05-26cs.CV

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

2026-05-26视觉语言视觉感知学习理论数据集/基准三维

面向长时连续音视频流,现有离线多模态模型难以在固定计算预算下保存历史证据,也缺少自主判断何时回答的机制。StreamOV的关键做法是用证据引导的长短期记忆压缩视觉、音频及跨模态线索,并以早期解码隐状态作为响应触发器,避免沉默 token 或外部路由器。作者还构建SOVBench评测在线多轮理解与触发能力,实验显示其在SOVBench及多项流式/离线视频基准上达到或接近最佳表现。

UAV-OVO: Out-of-Viewpoint Generalization in UAV Action Recognition Figure 1
2026-05-26cs.CV

UAV-OVO: Out-of-Viewpoint Generalization in UAV Action Recognition

Yu Xia, Zhengbo Zhang, Shuaihu Zhang, Zhigang Tu

2026-05-26视觉感知规划控制学习理论数据集/基准三维

这篇论文针对无人机动作识别中训练于低俯视角、部署到高俯视角时性能骤降的问题,构建了 UAV-OVO 基准:用几何估计视角分数划分低/高俯视角,并匹配 ID/OOD 类别分布以隔离视角偏移影响。实验显示强视频模型存在明显 ID/OOD 落差,如 MViTv2-B 从 66.45% 降至 33.94%;作者提出的 LATER 利用 LoRA 子空间作语义锚进行无梯度测试时重定心,以缓解视角漂移。

Generalized Evidential Deep Learning: From a Bayesian Perspective Figure 1
2026-05-26cs.LG

Generalized Evidential Deep Learning: From a Bayesian Perspective

Yuanye Liu, Yibo Gao, Yuanyang Chen, Xiahai Zhuang

2026-05-26视觉感知

针对现有 Evidential Deep Learning 变体各自修补、缺少统一贝叶斯解释而导致设计敏感和不稳定的问题,论文将 EDL 重写为包含先验、后验更新与训练目标的广义贝叶斯推断,指出网络证据可视为输入相关伪计数,常见损失对应温度化贝叶斯更新下的变分目标,并提出可配置的 GEDL 统一框架。实验显示其在分类、不确定性估计和 OOD 检测上与现有方法相当或更好,但主要价值在理论归并而非显著性能跃升。

SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation Figure 1
2026-05-26cs.CV

SurfSurg6D: Geometry Consistent Dense Correspondence for Textureless Surgical Instrument Pose Estimation

Daiyun Shen, Shuojue Yang, Chang Han Low, Qian Li, Mengya Xu, Qi Dou, Yueming Jin

2026-05-26机器人生成模型优化算法数据集/基准三维

面向微创机器人中器械纹理少、遮挡多且6D标注稀缺的问题,论文构建含6类器械、约6万合成图像及RGB-D/分割/法线/位姿标注的SynSurg6D,并提出SurfSurg6D密集2D-3D对应框架,通过几何距离驱动的困难负样本挖掘和嵌入一致性约束区分相似表面片段。实验在SurgRIPE、EndoVis2018和SurgPose上显示,合成数据能提升多种方法,SurfSurg6D在RGB-only位姿估计中优于已有方法且保持实用速度。

How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark Figure 1
2026-05-26cs.CV

How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark

Yuanye Liu, Nannan Shi, Zhejia Zhang, Hanxiao Zhang, Boya Wang, Derong Yu, Nao Wang, Yuxin Jin, Yang Zhou, Kunhao Yuan, Siqi Wang, Lida Yang, Xu Qiao, Wentao Liu, Xuelei He, Xin Hong, Guoyan Zheng, Xin Chen, Guang-Zhong Yang, Le Zhang, Lei Li, Yuxin Shi, Xiahai Zhuang

2026-05-26强化学习数据集/基准安全鲁棒

针对肝纤维化 MRI 分期缺乏真实多中心系统评测的问题,论文提出 LiFS 基准:610 例、多扫描仪、多序列且含完整钆塞酸增强与病理标签,并评估 MICCAI 挑战中 9 类方法。结果显示最佳 AI 在部分设置可接近资深放射科医生、超过低年资医生,但中位水平仍约为低年资;跨中心差异、标签不均衡和增强序列波动是主要瓶颈,架构或融合策略只能部分改善鲁棒性。

Artifact Correction for Echo-Planar Imaging at Low-Field and Ultra-Low-Field MRI Figure 1
2026-05-26cs.CV

Artifact Correction for Echo-Planar Imaging at Low-Field and Ultra-Low-Field MRI

Sisi Qiao, Yilin Yu, Tiecheng Lin, Yuhao Liu, Jiajia Sun, Xiaoling Li

2026-05-26生成模型三维

低场/超低场 MRI 虽具低成本和便携优势,但 EPI/DWI 易因奇偶 k 空间线错位产生严重 Nyquist ghost,限制脑结构显示。论文提出无需参考扫描的峰值对齐校正,并叠加插值重采样提升局部一致性,在 LF/ULF EPI 与扩散 EPI 上达到接近参考扫描法的伪影抑制,且进一步改善结构连续性和信号均匀性。

Mosaic: Compositional Multi-Concept Erasure via Vector Field Blending Figure 1
2026-05-26cs.CV

Mosaic: Compositional Multi-Concept Erasure via Vector Field Blending

Junseok Ko, Jungwoo Kim, Jong-Seok Lee

2026-05-26视觉感知生成模型模仿学习优化算法数据集/基准

针对现有概念擦除多在单图单目标上评估、难以覆盖流式 T2I 模型生成的多概念复杂场景,论文提出组合式多概念擦除任务与 CoME-Bench。核心洞察是被擦除概念在基模型与单概念擦除模型的向量场差异中呈空间局部性,Mosaic 据此动态生成概念掩码并混合向量场,无需额外优化。基于 FLUX.1-dev 的实验显示,其能更稳定地同时抑制多个目标概念,并较好保留非目标上下文。

AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution Figure 1
2026-05-26cs.CV

AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

Zehao Wang, Yihan Zeng, Zidong Gong, Yuanfan Guo, Feng Zhu, Hongzhi Zhang, Wei Zhang, Wangmeng Zuo

2026-05-26视觉语言视觉感知强化学习模仿学习规划控制

该文针对多模态大模型后训练中静态数据难以覆盖能力短板、自演化合成数据易引入幻觉推理和认知漂移的问题,提出 Anchor Evolution:先通过轨迹 rollout 定位失败前沿,再从真实标注库检索“真值锚点”构造训练数据,并用带脚手架的 SFT 加 RL 去脚手架来内化推理。以 Qwen2.5-VL-7B 为基座,在八个多模态推理基准平均提升 10.3%,并在 MathVision、EMMA 等任务达到或接近 SOTA。

From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation Figure 1
2026-05-26cs.CV

From Contrast to Consistency: Rethinking Event-based Continuous-Time Optical Flow Estimation

Rui Hu, Song Wu, Wen Yang, Jinjian Wu

2026-05-26视觉感知生成模型规划控制优化算法数据集/基准

针对事件相机连续时间光流缺少高频真值、传统对比最大化易牺牲轨迹连续性的问题,本文将事件视为具有时空结构一致性的运动流形样本,提出STSC混合监督框架,并结合双向多尺度网络与课程式训练,从点监督逐步过渡到自监督流形约束;多基准实验显示其在连续时间与标准光流估计上均达到SOTA,非线性运动场景中轨迹更物理一致。

ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement Figure 1
2026-05-26cs.CV

ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement

Yufeng Yang, Jianzhuang Liu, Jisheng Chu, Yuqi Peng, Xianfang Zeng, Jiancheng Huang, Shifeng Chen

2026-05-26视觉感知生成模型强化学习模仿学习规划控制

针对低光增强模型通常只学习单一目标、难以按用户偏好连续调节且生成式编辑易产生结构偏移的问题,ControlLight 构建含连续光照强度监督的 Light100K,并在 FLUX.2-klein 上用 LoRA 训练,引入错位感知加权 flow matching 以抑制伪标签边缘不对齐。实验显示其在低光增强基准上达到 SOTA,并具备更平滑的强度控制和真实场景泛化能力。

Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking Figure 1
2026-05-26cs.CV

Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking

Mingyi Xu, Jinpeng Lin, Min Zhou, Tiezheng Ge, Ming Zeng

2026-05-26视觉感知强化学习规划控制学习理论数据集/基准

针对涂鸦+文本图像编辑在多任务场景中不稳定的问题,论文指出瓶颈主要不是合成到真实等图像域差异,而是编辑指令层面的泛化不足。为此提出先覆盖后真实的课程数据构建、多任务拼接造样本和编辑区域加权损失,在Qwen-Image-Edit-2511上显著提升VIBE单任务与多任务表现,并达到SOTA。

CodecSplat: Ultra-Compact Latent Coding for Feed-Forward 3D Gaussian Splatting Figure 1
2026-05-26cs.CV

CodecSplat: Ultra-Compact Latent Coding for Feed-Forward 3D Gaussian Splatting

Pengpeng Yu, Runqing Jiang, Qi Zhang, Dingquan Li, Jing Wang, Yulan Guo

2026-05-26规划控制优化算法数据集/基准三维

针对前馈 3D Gaussian Splatting 虽能快速重建但缺少便于存储/传输的紧凑场景表示的问题,CodecSplat 将压缩瓶颈前移到生成流程内部,熵编码规则的 2D 高斯生成潜特征,再解码预测深度和高斯参数,避免直接压缩不规则 3D primitives。其在 DL3DV、RealEstate10K 上以每场景约 3.37–107.77 KiB 达到 23.56–27.05 dB PSNR,相比压缩前馈生成高斯约小一个数量级。

Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation? Figure 1
2026-05-26cs.CV

Are We Overconfident in Models and Results for Semi-Supervised 3D Medical Image Segmentation?

Jun Li, Ziwei Qin

2026-05-26视觉感知数据集/基准三维安全鲁棒

本文质疑半监督3D医学分割中“高置信即可靠”和用测试集选模型带来的双重过度自信:前者放大伪标签确认偏差,后者推高SOTA。作者提出TCSeg,以置信度与不确定性双轴评估可靠性,并在概率、特征、图像三空间协同校准伪标签。三套基准上在既有协议下表现稳定,同时强调多次运行与最终检查点评估以减少过拟合式增益。

ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation Figure 1
2026-05-26cs.CV

ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation

Huan Ren, Yihan Chen, Chuxin Wang, Nailong Liu, Wenfei Yang, Tianzhu Zhang

2026-05-26数据集/基准三维安全鲁棒

针对类别级物体位姿估计中深度点云因自遮挡而不完整、直接级联补全又带来误差累积和开销的问题,ComPose 将点云补全作为任务驱动的内部表示,与位姿估计统一建模;其核心是逐步预测完整关键点及邻域稠密点,并用几何关系编码与一致性损失约束 NOCS 变换结构。实验显示其在标准基准上超过现有方法,深度版在 REAL275 的 10°2cm 指标提升 9.1%,且不依赖类别形状先验。

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation Figure 1
2026-05-26cs.RO

TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation

Sizhe Zhao, Shengping Zhang, Shuo Yang, Weiyu Zhao, Shuigen Wang, Xiangyang Ji

2026-05-26机器人

论文针对扩散/自回归机器人策略在单次随机推理下不稳定的问题,提出推理时采样框架 TapSampling:用 Action-VAE 在低维后验中高效生成接近真实动作分布的候选动作,再用基于任务进展预测训练的验证器选择动作。实验称其在仿真和真实环境中无需微调即可提升多种通用操作策略表现。

Tetris: Tile-level Sampling for Efficient and High-Fidelity Video Object Tracking Figure 1
2026-05-26cs.CV

Tetris: Tile-level Sampling for Efficient and High-Fidelity Video Object Tracking

Chanwut Kittivorawong, Alena Chao, Charlie Si, Alvin Cheung

2026-05-26视觉感知优化算法学习理论数据集/基准三维

面向固定摄像头视频的轨迹物化,论文指出检测器调用占主要成本,而整帧时间采样会损失细粒度运动信息。Tetris 将帧切成 tile,并用多连块表示非矩形相关区域,通过相关性分类、受精度约束的 ILP 剪枝和打包减少检测调用。7 个固定视频数据集上,在 HOTA 损失不超过 5% 时,相比既有系统最高吞吐提升 17.4 倍,相比逐帧全图基线最高提升 68.8 倍。

Location Prior Generation via Multi-Source Urban Data Fusion for Low-Altitude Air Mobility Figure 1
2026-05-26cs.CV

Location Prior Generation via Multi-Source Urban Data Fusion for Low-Altitude Air Mobility

Xiang Xie, Xiaonan Liu

2026-05-26视觉感知学习理论数据集/基准三维安全鲁棒

面向无人机配送、空中出租车等低空城市运行,论文针对开放地图中建筑高度缺失导致机载实时感知负担过重的问题,提出 LPGF:融合 OSM、卫星影像、UAV 遥测和车辆 GPS,并以高度标签、楼层数、建筑类型默认值构成三级回退,再用质量门控决定是否启用阴影测高。在 MiTra A50 Milan 上,门控识别两类影像失效并稳定生成 27 栋建筑先验,默认高度 MAE 为 3.07 m。

ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs Figure 1
2026-05-26cs.CV

ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

Jiangyang Li, Cong Wan, Changjie Wu, Songlin Dong, Lingjun Zhang, Linzhe Shi, Xu Wang, Zhiheng Ma, Hang Zhang, Mu Xu, Yihong Gong

2026-05-26视觉语言视觉感知强化学习模仿学习规划控制

面向具身智能、导航等场景中 VLM 空间推理不可靠的问题,ProSR 的关键洞察是仅优化答案会诱发“伪视觉依据”和推理尾部不稳定。论文用空间 CoT 数据诊断这些退化,并在 GRPO 中加入反事实空图像不变性惩罚与尾部漂移惩罚,把目标从答对扩展到视觉依赖和轨迹稳定。多项复杂及 OOD 空间推理基准上,方法平均较 SOTA 提升 3.7%,诊断指标也显示更少捷径依赖和更稳定的推理过程。

Cross-Stage Attention Multi-Expert Network for Radiologist-Inspired Breast Ultrasound Diagnosis Figure 1
2026-05-26cs.CV

Cross-Stage Attention Multi-Expert Network for Radiologist-Inspired Breast Ultrasound Diagnosis

Xinyang Zhai, Chong Yang, Ruizhi Zhang

2026-05-26视觉感知强化学习学习理论数据集/基准三维

针对乳腺超声中肿瘤异质性、边界模糊和类别不平衡导致的良恶性分类困难,论文提出 CSA-MoE-Net:用跨阶段注意力增强 ResNet-18 的多层特征重标定,并按放射科医生的全图、肿瘤核心、边界三种观察视角构建 MoE 专家,由门控网络自适应融合。其在 2129 张平衡数据、20 次运行上达到 96.33% 准确率和 99.50% AUC,较 ResNet-18 明显提升,但外部多中心验证文中未充分说明。

Metric--Phase Fields: Decoupling Distance and Sign for Thin-Structure Reconstruction from Unoriented Point Clouds Figure 1
2026-05-26cs.CV

Metric--Phase Fields: Decoupling Distance and Sign for Thin-Structure Reconstruction from Unoriented Point Clouds

Jiayi Kong, Xuhui Chen, Chen Zong, Fei Hou, Junhui Hou, Wenping Wang, Ying He

2026-05-26强化学习规划控制优化算法学习理论三维

针对无定向点云中薄壳、薄板和开边界难以用全局内外符号描述的问题,论文提出 Metric–Phase Fields,将无符号距离度量与平滑相位/软符号解耦,并通过可学习 β、门控度量和残差相位注入合成可提取的有符号场。实验显示其比 SDF 方法更少合并或增厚薄层,也比 UDF 方法训练与零等值面提取更稳定。

Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video Figure 1
2026-05-26cs.CV

Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video

Tingxi Chen, Ke Hao, Yabo Chen, Zhengxue Cheng, Rong Xie, Li Song, Haibin Huang, Chi Zhang, Xuelong Li

2026-05-26视觉感知生成模型强化学习优化算法数据集/基准

单目视频难以补全大范围动态场景,瓶颈在于时间与视角一致性及缺少真实多视角监督。Full-4D用Real-MV-4D数据集训练带几何重投影与相机条件的时空-视角融合扩散模型,先生成同步T×V视频网格,再以FMD正则优化为4DGS。实验显示其在视觉质量和几何一致性上优于现有方法,但增益可能部分来自大规模数据。

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation Figure 1
2026-05-26cs.RO

RepSAM: Bridging Foundation Models to Robotic Vision via Representation-Guided Adaptation

Wenhui Chu

Department of Computer Science and Engineering, Texas A&M University, College Station, TX, USA

2026-05-26机器人视觉感知

RepSAM针对SAM等基础视觉模型在机器人场景中因透明物体、杂乱和噪声导致分割退化的问题,指出域偏移在Transformer层间并不均匀:浅层漂移大、深层可迁移。它据此用CKA预先分配LoRA秩,并结合深度融合与边缘损失。六个基准上以4.0M可训练参数达到89.0% mIoU,接近全量微调且训练成本大幅降低,PyBullet抓取成功率较LoRA RGB基线提升12.0%。

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation Figure 1
2026-05-26cs.CV

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

Zhicheng Zhang, Lei Wang, Yu Zhang, Yongsheng Gao

2026-05-26视觉感知生成模型优化算法数据集/基准三维

这篇论文针对音频驱动说话人生成中“单张参考图一次编码”导致的身份漂移、时序不稳和局部伪影,提出测试时自适应条件 TT-SAC:先生成初稿,再将早期生成帧重新编码并聚合为新的身份条件,进行第二次生成,无需训练或梯度更新。实验在 FLOAT、Sonic、SadTalker、AniTalker 等模型和多个基准上显示,唇同步、身份保持、时序一致性与感知质量普遍提升;但效果依赖初始帧质量,过多聚合可能带来过平滑。

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models Figure 1
2026-05-26cs.CV

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

Kaixiang Chen, Pengfei Fang, Hui Xue

2026-05-26视觉语言视觉感知三维

本文针对 CLIP 等视觉语言模型在少样本下全量微调成本高且易过拟合、现有跨模态 PEFT 耦合多停留在外部 prompt/adapter 的问题,提出在 LayerNorm 等内部计算模块后插入可重参数化的 agent layer,并用 MAIL++ 的元代理与双向桥接学习视觉—文本更新耦合。实验显示其在少样本分类和跨域检索上优于多种 PEFT 基线,同时推理阶段保持原骨干效率。

MetaphorVU: Towards Metaphorical Video Understanding Figure 1
2026-05-26cs.CV

MetaphorVU: Towards Metaphorical Video Understanding

Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

2026-05-26视觉感知强化学习数据集/基准三维

论文关注现有视频理解评测偏重字面感知、难以衡量多模态大模型对隐喻视频深层语义的理解。作者构建含8类隐喻、860个真实视频的 MetaphorVU-Bench,并指出模型失败主要不是识别错误,而是跨域映射缺陷;据此提出基于隐喻知识图谱的推理时增强 MetaphorBoost。实验中11个MLLM均明显落后人类,最强闭源模型约低20分,MetaphorBoost带来一致提升。

Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion Figure 1
2026-05-26cs.CV

Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion

Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, Yu-Lun Liu, Yue Wang, Liu Ren

2026-05-26视觉感知生成模型规划控制优化算法三维

面向机器人仿真和数字孪生,透视视频生成因视场窄易在长轨迹中累积跨视角不一致。Pantheon360的关键洞察是用360°输入提供全局上下文,并从稀疏全景重建显式3D Cache,沿用户轨迹渲染几何脚手架,再由扩散模型补全真实纹理。实验显示其在真实360°视频合成中提升视觉质量和几何一致性,并支持插帧、稳像等应用。

Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models Figure 1
2026-05-26cs.CV

Enhancing Single-Image Facial Demorphing using Multimodal Large Language Models

Nitish Shukla, Arun Ross

2026-05-26视觉语言视觉感知生成模型强化学习三维

针对人脸识别中 morphing 攻击只能被检测、难以还原涉事身份的问题,本文将单图无参考 demorphing 改写为语义引导的联合扩散生成:直接利用 MLLM 中间层隐藏状态作为身份与属性条件,并在 RGB 域同时重建两张原始人脸。实验显示其在地标 morph 上 0.1% FMR 下恢复准确率超过 96%,在 StyleGAN 等生成式 morph 上较既有方法取得更高识别与 6–9 dB PSNR 增益。

Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning Figure 1
2026-05-26cs.CV

Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning

Fanhu Zeng, Zhicong Luo, Zefan Wang, You Li, Chi Chen, Maosong Sun

2026-05-26强化学习优化算法数据集/基准三维

这篇论文针对多源视觉推理中“看得更多未必知道更多”的问题:不同传感器或视角可能带来互补信息,也可能引入噪声并拖累强单源信号。作者提出 MARS,将单源奖励作为动态锚点,把多源相对单源的信息增益纳入 RLVR 的优势归一化,从优化层面调节模态贡献。实验覆盖深度、红外、多视角和富文本任务,在 GRPO、DAPO 上分别带来约 3.2% 和 4.9% 提升。

Binding Visual Features Point by Point Figure 1
2026-05-26cs.CV

Binding Visual Features Point by Point

Udith Haputhanthri, Declan Campbell, Rim Assouel, Jonathan D. Cohen, Taylor W. Webb

2026-05-26视觉感知学习理论数据集/基准三维

论文针对VLM在多物体场景中常把颜色、形状等特征绑定错的问题,借鉴人类逐物体串行注意,分析“用文本输出坐标指向目标”为何有效。作者发现指向训练会诱发内部视觉搜索流程,并定位到承担搜索的注意力头;在Molmo、Qwen2.5-VL、Gemma和LLaVA实验中,微调后的指向行为可减少绑定错误,并提升计数、视觉搜索等任务的组合与分布外泛化能力。

Learning View-Dependent Splatting Kernels Figure 1
2026-05-26cs.GR

Learning View-Dependent Splatting Kernels

Huakeng Ding, Zhanpeng Liu, Fan Pei, Kun Zhou, Hongzhi Wu

State Key Lab of CAD and CG, Zhejiang University, Hangzhou Research Institute of Holographic and AI Technology, State Key Lab of CAD and CG, Zhejiang University Hangzhou Zhejiang China, State Key Lab of CAD and CG, Zhejiang University China, Hangzhou Research Institute of Holographic and AI Technology China

2026-05-26视觉感知

3DGS 的重建质量和表示效率很大程度受 splatting 核形状限制,而手工解析核难以适配场景,直接学习 3D 体核又受线积分制约。本文改为学习视角相关的 2D 投影核:用包围椭球与 3D latent 经 MLP 生成 2D latent,再解码为 Mahalanobis 距离上的径向核,并端到端优化。四个标准新视角合成基准上,该方法在 2D/3D splatting 多数指标达到最佳或次优,同时显示更好的 primitive 利用效率。

Generating 3D models from sketches of human faces using a combined approach of Convolutional Neural Networks, Procedural Modeling, and Contour Mapping Figure 1
2026-05-26cs.CV

Generating 3D models from sketches of human faces using a combined approach of Convolutional Neural Networks, Procedural Modeling, and Contour Mapping

Nancy Iskander

2026-05-26视觉感知强化学习数据集/基准三维

该工作面向从人脸线稿快速生成可编辑3D头像,动机是表情会显著改变面部轮廓,单靠空白模板匹配难以对齐。其核心做法是用自生成数据训练CNN识别草图中的FACS动作单元,将表情参数复制到Valley Girl参数化脸模,再用主动轮廓估计线稿与模型间的形变。文中展示了可生成带相似表情的3D脸并能标出未匹配轮廓,但定量增益和泛化能力文中未充分说明。

MTLLFM: Multimodal-Temporal Laughter Localization: UR-FUNNY-Temporal and SMILE-Temporal Benchmarks with an Adaptive Multimodal Fusion Model Figure 1
2026-05-26cs.CV

MTLLFM: Multimodal-Temporal Laughter Localization: UR-FUNNY-Temporal and SMILE-Temporal Benchmarks with an Adaptive Multimodal Fusion Model

Eyal Hanania, Nadav Kirsch, Daniel Arkushin, Jonathan Benvenisti, Amos Bercovich, Elie Zemmour, Sahar Froim

2026-05-26视觉语言视觉感知学习理论数据集/基准三维

论文针对现有笑声检测多停留在片段级、难以定位短暂笑声起止的问题,构建 UR-FUNNY-Temporal 与 SMILE-Temporal 两个带精确边界和模态/来源/强度元数据的基准,并提出用固定 HuBERT、MAE 特征结合时序 softmax pooling 与自适应模态门控的弱监督定位模型。实验显示其在三数据集上优于多模态基础模型,SportsPress 上达 99% F1 和 68.1% 定位精度,时序标签还使下游笑声推理 CIDEr 提升 227%。

Towards Active Real-to-Twin Inspection: A New Paradigm for Zero-Shot Anomaly Detection Figure 1
2026-05-26cs.CV

Towards Active Real-to-Twin Inspection: A New Paradigm for Zero-Shot Anomaly Detection

Jiaxuan Liu, Yunkang Cao, Yufeng Chen, Chunyang Li, Yuhuan Du, Hui Zhang

2026-05-26视觉感知生成模型强化学习模仿学习数据集/基准

本文针对工业零样本异常检测依赖固定视角2D图像、难以适应机器人主动巡检的问题,提出Real-to-Twin任务:让机器人按CAD几何先验对齐视角,并将实拍图与同姿态数字孪生渲染直接比对。AVATAR只用无缺陷真实-渲染配对学习类别无关的Sim2Real语义对齐,把CAD转化为动态正常参照;实验显示其较改造基线在多视角变化下显著更稳健,但具体增益来源仍需公开数据进一步验证。

Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation Figure 1
2026-05-26cs.CV

Anatomy-Anchored Self-Supervision: Distilling Vision Foundation Models for Invariant Ultrasound Representation

Chunzheng Zhu, Yijun Wang, Jianxin Lin, Feng Wang, Hongwei Wang, Lei Zhao, Shengli Li, Kenli Li

2026-05-26视觉语言视觉感知强化学习数据集/基准三维

针对超声自监督常以整帧或通用区域为学习单元、容易偏向噪声与背景而缺少临床解剖语义的问题,AnaUS用经轻量域适配和潜提示驱动的LP-SAM自动生成解剖掩码,并在解剖层面做跨视角对齐与核心区域上下文预测,使同一结构表征稳定、不同结构可分。六个肺、乳腺、甲状腺和心脏超声公开数据集上优于通用及超声专用SSL基线,同时保持部署效率。

Subspace-Guided Semantic and Topological Invariant Registration for Annotation-Free Ultrasound Plane Quality Control Figure 1
2026-05-26cs.CV

Subspace-Guided Semantic and Topological Invariant Registration for Annotation-Free Ultrasound Plane Quality Control

Chunzheng Zhu, Jianxin Lin, Feng Wang, Cheng Jiang, Guanghua Tan, Zhenyu Zhou, Shengli Li, Kenli Li

2026-05-26视觉感知规划控制数据集/基准三维

针对超声平面质控依赖逐平面标注、伪标签又易受临床采集形变影响的问题,STRIQ把无标注质控转化为与高质量锚点的子空间一致性度量:用LRA在层级潜特征中做配准对齐,用OKS将不同解剖平面拆到正交子空间以减少负迁移。在自建US4QA和公开CAMUS上,其与临床质量评分的相关性优于对比方法,并达到约5.6 ms/帧的实时推理。

Weakly Supervised Camouflaged Object Detection Based on the SAM Model and Mask Guidance Figure 1
2026-05-26cs.CV

Weakly Supervised Camouflaged Object Detection Based on the SAM Model and Mask Guidance

Xia Li, Xinran Liu, Lin Qi, Junyu Dong

2026-05-26视觉感知模仿学习学习理论三维

针对伪装目标与背景高度相似导致边界模糊、漏检,以及像素级标注成本高的问题,本文用框标注驱动 SAM 生成伪标签,并通过冗余处理过滤 SAM 在复杂背景中的多余分割;同时提出 MGNet,以级联掩码解码、上下文增强和掩码引导特征聚合逐步定位并细化边界。在三个常用 COD 数据集上,方法相较现有弱监督/全监督基线表现具有竞争力并达到或接近 SOTA。

CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation Figure 1
2026-05-26cs.CV

CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation

Fangtai Wu, Hailong Guo, Shijie Huang, Jiayi Song, Yubo Huang, Mushui Liu, Zhao Wang, Yunlong Yu, Jiaming Liu, Ruihua Huang

2026-05-26视觉感知生成模型强化学习学习理论数据集/基准

针对多效果图像编辑中需存储、路由并叠加大量效果 LoRA 与加速 LoRA,导致部署开销和概念串扰的问题,CollectionLoRA 将多个单效果 LoRA 视作教师,通过多教师 on-policy 蒸馏把效果与少步生成能力压入一个 LoRA;其关键在于双流路由保泛化、正交触发词隔离概念,以及粗到细目标缓解师生分布差。实验称可整合 50 种效果,概念保真接近或优于单独教师,并可扩展到 180 种、显著降低部署开销。

Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation Figure 1
2026-05-26cs.CV

Adversarial Orthogonal Disentanglement for LVLM Hallucination Mitigation

Ruoxi Cheng, Haoxuan Ma, Zhengfei Hai, Yiyan Huang, Ranjie Duan, Tianle Zhang, Xu Yang, Ziyi Ye, Xingjun Ma

2026-05-26视觉语言视觉感知优化算法数据集/基准三维

针对LVLM生成内容与图像事实不一致的幻觉问题,论文认为现有外部检索/微调成本高,内部干预又难分离语义与幻觉特征。AOD将其建模为隐空间几何解耦,通过对抗正交目标学习“幻觉方向”,并在推理时用双前向对比解码抑制相关logits。三类模型、八个基准上,POPE平均提升超6%,AMBER提升约6%,且基本保持MMMU等通用能力。

Physics-Aware 3D Gaussian Editing for Driving Scene Generation Figure 1
2026-05-26cs.CV

Physics-Aware 3D Gaussian Editing for Driving Scene Generation

Feng Zhou, Jian Zhang, Yuhang Sun, He Wang, Qiong Wen, Debao Kong, Tieru Wu, Rui Ma

2026-05-26机器人视觉感知模仿学习优化算法数据集/基准

面向自动驾驶中减速带、坑洼等长尾路况难以真实采集且普通 3DGS 编辑缺少车辆动力学响应的问题,RoVES 将单图/文本驱动的道路几何插入与 4 自由度半车模型耦合,对车辆垂向位移和俯仰逐帧校正,并采用免优化的静态道路与动态车辆解耦编辑。Waymo 实验显示其道路插入约 1.84 秒、完整流程约 6.24 秒,在效率和视觉一致性上具备实用性。

Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning Figure 1
2026-05-26cs.CV

Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

Longteng Guo, Yifan Wang, Pengkang Huo, Tailai Chen, Yuze Wu, Jing Liu, Xinxin Zhu

2026-05-26视觉语言视觉感知数据集/基准三维

针对现有视觉推理评测可被图像描述和语言先验“绕过”的问题,VisReason构建了1505道日常场景题,覆盖感知、结构和概念等10类视觉中心推理,用于检验模型是否真正依赖视觉证据。实验显示,将图像替换为文字描述在该基准上导致48.12%性能下降,且当前MLLM与人类差距显著;增加思考预算或CoT仅带来有限、趋于饱和的收益,模型变大虽有帮助但不足以弥合差距。

MARVEL: Universal Murray's Law-informed Vessel Tree Segmentation and Topology Estimation Figure 1
2026-05-26cs.CV

MARVEL: Universal Murray's Law-informed Vessel Tree Segmentation and Topology Estimation

Yi Zhou, Thiara Sana Ahmed, Jacqueline Chua, Meng Wang, Qinrong Zhang, Alejandro F. Frangi, Huazhu Fu, Jun Cheng, Leopold Schmetterer, Bingyao Tan

2026-05-26视觉感知生成模型优化算法数据集/基准三维

针对现有血管分割模型只做像素识别、易产生不符合生理规律的分叉和断裂,MARVEL将 Murray 定律作为可微正则引入任意分割骨干,并显式预测血管半径以约束局部分叉拓扑。作者在8个公开多模态血管数据集和多种骨干上验证,报告其在分割精度、拓扑一致性和生理合理性上优于基线;进一步用于眼底血流图仿真时,可更好区分高血压与正常眼,压力差分类显著提升。

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration Figure 1
2026-05-26cs.CV

Towards Reliable Fetal Ultrasound Interpretation with Multi-Agent Collaboration

Xiaotian Hu, Mingxuan Liu, Junwei Huang, Kasidit Anmahapong, Yifei Chen, Yiming Huang, Xuguang Bai, Zihan Li, Hongjia Yang, Yingqi Hao, Hong Xu, Yu Jiang, Tian Tian, Yi Liao, Haibo Qu, Qiyuan Tian

2026-05-26视觉语言视觉感知生成模型模仿学习数据集/基准

胎儿超声解读需要把切面识别、分割、测量和报告串成可追溯流程,而单任务模型割裂、通用MLLM又易缺乏领域证据并产生幻觉。本文提出FetUSAgents,用多智能体调度专用视觉工具,并通过双路径证据仲裁和检索式证据库融合推理与结构化结果;同时构建FetUS-VQA基准。OoD实验中,其VQA准确率较最强通用/医学MLLM基线高出25%以上。

PDEInvBench: A Comprehensive Dataset and Design Space Exploration of Neural Networks for PDE Inverse Problems Figure 1
2026-05-26cs.LG

PDEInvBench: A Comprehensive Dataset and Design Space Exploration of Neural Networks for PDE Inverse Problems

Divyam Goel, Nithin Chalapathi, Sanjeev Raja, Aditi S. Krishnapriyan

Department of Computer Science, UC Berkeley, Departments of Computer Science and Chemical Engineering

2026-05-26数据集/基准

针对现有 PDE 机器学习基准多聚焦正问题、缺少从观测场反推物理参数的系统评测,本文提出 PDEInvBench,覆盖 5 类 PDE、多分辨率、ID/OOD 划分,并从优化、表示和 scaling 三轴比较神经网络。结果显示,先监督训练再用 PDE 残差做测试时微调最稳健,显式输入偏导特征通常提升精度;在固定预算下,增加初始条件多样性比扩展参数范围更有效。

Parameter-Efficient CT Reconstruction via Deep Graph Laplacian Regularization Figure 1
2026-05-26eess.IV

Parameter-Efficient CT Reconstruction via Deep Graph Laplacian Regularization

Veera Varuni Radhakrishnan, Chinthaka Dinesh, Qurat-ul-Ain Azim

2026-05-26三维

针对低剂量 CT 中深度重建模型依赖大数据和大量参数、临床部署成本高的问题,论文将二次图拉普拉斯正则嵌入 PFBS 优化框架,并用三个轻量 CNN 学习图先验与参数,以保留一定可解释性。LoDoPaB-CT 上报告仅用 91,848 参数和 1000 样本达到 30.70 dB PSNR,较 FBP 提升 6.33 dB,但仍落后最强方法约 13 dB,说明其价值主要在资源受限场景的效率—质量折中。

ERNIE-Image Technical Report Figure 1
2026-05-26cs.CV

ERNIE-Image Technical Report

Jiaxiang Liu, Zhida Feng, Pengyu Zou, Zhenyu Qian, Tianrui Zhu, Jun Xia, Yuehu Dong, Yanzheng Lin, Honglin Xiong, Anqi Chen, Yunpeng Ding, Jinghui Duan, Lin Gao, Chao Han, Tiechao He, Jiakang Hu, Ranjun Hua, Xueming Jiang, Qingli Kong, Yuting Lei, Tianyu Li, Yunlin Liu, Changling Liu, Yaxin Liu, Yi Liu, Xuguang Liu, Xiaolong Ma, Yan Pan, Yiran Ren, Nan Sheng, Yu Sun, Siyang Sun, Yixiang Tu, Yang Wan, Huanai Wang, Siqi Wang, Yang Wu, Youzhi Yang, Xiaowen Yang, Jianwen Yang, Yehua Yang, Quanwen Zhang, Xinmin Zhang, Haoxin Zhang, Xiang Zhang, Jun Zhang, Qian Zhang, Qiao Zhao, Qi Zhou

2026-05-26视觉语言视觉感知强化学习数据集/基准三维

针对开源文生图模型在复杂指令、中文/长文本渲染和审美质量上落后闭源系统的问题,ERNIE-Image采用8B单流DiT,并把重点放在数据与监督:预训练用细粒度分类、富字幕和审美评分做分层采样,后训练用多样化SFT、稳定DPO、Prompt Enhancer及8步Turbo蒸馏。实验显示其在开源模型中领先,并在指令遵循、文字生成和审美上接近顶级商业模型,但具体增益可能主要来自data。

Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering Figure 1
2026-05-26cs.GR

Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering

Keyang Ye, Hongzhi Wu, Kun Zhou

State Key Lab of CAD&CG, Zhejiang University, Hangzhou Research Institute of Holographic and AI Technology

2026-05-26三维

针对 GES 在物体边界仍有混叠、硬深度测试导致高斯贡献截断,以及不透明 surfel 难以与高斯端到端联合优化的问题,论文提出 DP-GES:为 2D surfel 引入半透明边界,并用 Depth Peeling 获取逐像素层次顺序,再以透射率调制免排序高斯 splatting。实验称仅剥离约三层即可提升重建质量、减少 popping/aliasing,在 Mip-NeRF360 上 RTX 4090 渲染超过 470fps,并优于或持平多种 3DGS 变体。

Toward Native Multimodal Modeling: A Roadmap Figure 1
2026-05-26cs.CV

Toward Native Multimodal Modeling: A Roadmap

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

2026-05-26视觉语言视觉感知生成模型强化学习数据集/基准

本文针对多模态模型从后期拼接走向“原生”融合时概念混乱、架构边界不清的问题,提出以融合深度和输入输出对偶为核心的路线图:区分 mid/early-fusion,并将模型归为 Multi-to-Text、Multi-to-Target、Multi-to-Multi。主要结果是梳理了代表模型、数据训练、部署与评测全流程;非新模型实证论文,性能增益来源文中未充分说明,可能主要来自 scaling / data。

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence Figure 1
2026-05-26cs.CV

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

Yufei Zheng, Xuhan Zhu, Zide Liu, Chunpeng Zhou, Chenfeng Wang, Yongchao Xu, Yunnan Wang, Jiawei Liu, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

2026-05-26视觉语言视觉感知强化学习模仿学习学习理论

针对现有 MLLM 在空间理解中往往只利用深度或 3D 结构、且推理依赖外部深度图/点云的问题,GAMSI 将度量尺度与三维结构拆成双路径可学习查询,并用训练期视觉专家监督对齐,使模型仅凭 RGB 输入调用几何先验。作者还构建 15.3 万样本 MTS 数据集,经两阶段训练后在七个空间智能基准上达到 SOTA;但具体增益中架构与数据扩充的相对贡献仍需进一步拆解。

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution Figure 1
2026-05-26cs.CV

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau, Bo Jiang, Yihan Hu, Wei Zhan

2026-05-26视觉语言视觉感知生成模型强化学习数据集/基准

论文针对视频世界模型在遮挡、关灯或视角移开后常把隐状态冻结的问题,提出 ReMind:把视频组织成带可靠锚点、退化区间和时间缺口的帧图,并通过节点丢弃、噪声记忆、前沿续写等训练让原生 KV cache 学会检索旧状态;PM-RoPE 则以单注意力代价加入相机相位地址。实验显示其在 STEVO-Bench 和恢复任务上总体最优,同时 VBench 表明常规图生视频能力未明显遗忘。

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement Figure 1
2026-05-26cs.CV

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Shangfei Wang, Jianzong Wang

2026-05-26视觉语言视觉感知生成模型三维

这篇论文针对统一多模态模型中理解与生成目标相互干扰的问题,指出二者的表征偏好虽不同但共享同一样本语义锚点,可转化为互补信号。DIVA通过后训练将视觉表征分解为共享与任务特有成分,并用互信息约束促进共享信息对齐、隔离特有信息。实验报告在视觉理解和生成上分别提升7.82%与8.46%,但更大规模模型上的可扩展性仍未充分说明。

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation Figure 1
2026-05-26cs.CV

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

Junwei Zhou, Yu-Wing Tai

2026-05-26机器人视觉语言视觉感知强化学习规划控制

单目图像恢复室内 3D 布局常因深度歧义、碰撞/支撑关系和全局一致性约束而让一次性回归失效。本文将任务拆成“感知后规划”:几何增强 Perceiver 先给出观测对齐的初始布局,LaP Planner 再把平移、旋转、缩放等离散修正视为策略动作,并用监督轨迹加 DPO 学习迭代纠错。实验显示其相较强 VLM 基线提升 3D grounding 精度与物理合理性,并可支持场景编辑和具身操作;但仍依赖 2D 检测,漏检误差会传播。

Stabilizing Streaming Video Geometry via Dynamic Feature Normalization Figure 1
2026-05-26cs.CV

Stabilizing Streaming Video Geometry via Dynamic Feature Normalization

Xiaoyang Lyu, Muxin Liu, Xiaoshan Wu, Ruicheng Wang, Yi-Hua Huang, Yang-Tian Sun, Shaoshuai Shi, Xiaojuan Qi

2026-05-26视觉感知强化学习数据集/基准三维安全鲁棒

面向自动驾驶、具身智能等连续 RGB 流中的三维几何估计,论文指出预训练单目几何模型的视频抖动主要来自深度尺度与偏移随帧漂移,而根因是潜特征均值、方差波动。作者提出轻量因果循环模块 DyFN,仅微调约 2% 额外参数来动态归一化特征统计、冻结主干。四个基准上其减少分层断裂和位置抖动,时间稳定性较既有流式方法最高提升 14%,且基本保持单帧精度。

Recursive Class Connectivity Classification (R3C) Applied to Binary Image Segmentation for Improved Infant Fingerprint Enhancement Figure 1
2026-05-26cs.CV

Recursive Class Connectivity Classification (R3C) Applied to Binary Image Segmentation for Improved Infant Fingerprint Enhancement

Joao Leonardo Harres Dall Agnol, Luiz Fernando Puttow Southier, Jefferson Tales 0liva, Marcelo Teixeira, Rodrigo Mineto, Marcelo Filipa, Dalcimar Casanova, Erick Oliveira Rodrigues

2026-05-26视觉感知强化学习模仿学习数据集/基准

婴幼儿指纹因脊线更细、皮肤易变形且采集噪声高,即使用高分辨率扫描也难以获得稳定二值分割,导致识别率偏低。论文提出无需训练数据、也不改动原增强器的 R3C,通过把中间分割结果递归回馈并与原图结合来延展断裂脊线。三组数据、四类增强器实验显示,TAR 在儿童上最高提升约 4%,新生儿上可超过 40%,但绝对识别率仍有限且可能传播伪脊线。

When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers Figure 1
2026-05-26cs.LG

When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers

Aditya Sridhar

2026-05-26视觉感知

论文指出,CBM把决策显式分解到人类概念层虽提升可解释性,却也暴露了可被语义操控的新攻击面。作者形式化概念空间攻击与鲁棒性指标,并提出稳定正则防御 SPECTRA。CUB-200-2011 实验显示标准 CBM 攻击性很高,而合适正则可将攻击性从 3.8054 降至 0.0005、所需扰动范数大幅提高,精度仅下降约 2.2%。

A Principled Self-Referenced Early Stopping Approach for Deep Image Prior Figure 1
2026-05-26cs.CV

A Principled Self-Referenced Early Stopping Approach for Deep Image Prior

Chaoyan Huang, Cheng-Han Huang, Ismail R. Alkhouri, Rongrong Wang

Department of Computational Mathematics, Science, & Engineering, Michigan State University, Department of Electrical & Computer Engineering, University of Michigan, X Computational Physics Division, Los Alamos National Laboratory, Michigan Institute for Computational Discovery & Engineering, University of Michigan, Mathematical Sciences, Michigan State University

2026-05-26视觉感知强化学习

本文针对 Deep Image Prior 在单幅退化图像重建中容易继续拟合噪声、而现有方差或 SURE 早停信号不稳的问题,将早停重新表述为带参考的验证问题;核心洞察是独立噪声副本可给出近似最优停止点,并据此构造伪自参考,提出面向 RGB、灰度医学图像和不同噪声类型的 CSR-ES、MR-ES、ACR-ES。实验覆盖自然图像恢复与 CT/MRI 等任务,显示其比现有早停更接近 oracle 且无需准确噪声水平。

Geometry-Aware Image Flow Matching Figure 1
2026-05-26cs.CV

Geometry-Aware Image Flow Matching

Junho Lee, Kwanseok Kim, Joonseok Lee

2026-05-26视觉感知生成模型

论文针对图像生成中流匹配等方法默认欧氏空间、难以利用自然图像内在几何的问题,提出图像语义主要编码在方向而非范数中,RGB 与潜空间样本可近似投影到平均半径超球面。基于此设计用角距离做耦合的 SOT-CFM 和沿球面测地线建模的 SFM,在 CIFAR-10 与 ImageNet-256 上相较 I-CFM、OT-CFM 等欧氏基线取得更好生成质量。

Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks Figure 1
2026-05-26cs.CV

Neuromorphic LiDAR-based Bird's Eye View Object Detection using Energy-efficient Spiking Neural Networks

Sambit Mohapatra, Senthil Yogamani, Heinrich Gotzig, Patrick Mader

2026-05-26视觉感知

面向自动驾驶中稀疏 LiDAR BEV 感知的算力与能耗瓶颈,本文将脉冲神经网络用于端到端鸟瞰目标检测,设计带 LIF 动态的编码器-解码器、替代梯度训练及面向关键点和框回归的脉冲域损失,并比较多种输入编码。KITTI 上膜电位输出版本在 IoU=0.5 达到 92.05/87.04/86.51 AP,完全二值脉冲版本也可部署;能耗分析显示相对等价 CNN 突触操作能耗降低 3.33×,但实验主要基于静态帧重复模拟时序。

No Figure
2026-05-26cs.CV

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

2026-05-26视觉感知

这篇论文针对现有视频生成主要控制相机外参、难以稳定表达焦距、光圈、曝光、色温和畸变等内参变化的问题,提出 DeltaCam:用相对变化而非绝对状态来参数化神经相机适配器,并将场景内容、外参和内参解耦。文中展示其可生成更时间一致的景深、变焦、Dolly zoom 等效果,并支持视频到视频摄影风格迁移和基于 EXIF 的相机风格匹配。

Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection Figure 1
2026-05-26cs.CV

Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection

Prabuddhi Wariyapperuma, Rajitha de Silva, Marc Hanheide, Thomas Bohné, Leonardo Guevara

2026-05-26视觉语言视觉感知三维

针对相机-LiDAR 多模态 MAE 预训练中随机遮蔽把所有区域等同处理、且仅靠重建学习的问题,本文在 UniM2AE/BEVFusion 框架中引入语义引导的 LiDAR 体素遮蔽和解码端逐点语义监督,只在预训练阶段使用语义信息。nuScenes mini 验证集上,语义遮蔽较基线提升 +1.49% mAP、+1.66% NDS,逐点语义监督提升 +1.39% mAP、+3.22% NDS,但实验规模较小。

No Figure
2026-05-26cs.CV

Guess the Unified Model: How Much Can We Recover from Generated Images?

Jasin Cekinmez, Ryo Mitsuhashi, Addison J. Wu, Yida Yin

Princeton University

2026-05-26视觉感知

针对统一多模态模型生成图像已广泛传播但来源难追踪的问题,本文把模型归因建模为多类视觉分类,并系统考察跨扰动、跨语义域和跨提示语言的可分性。核心洞察是统一模型会留下稳定的视觉“指纹”,且不主要由语义内容驱动;ConvNeXT 分类器在每模型 500 张图像时达 59.8%,约 25K 张时接近 99.9%,多数模型的提示语言归因则接近随机水平。

Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation Figure 1
2026-05-26cs.CV

Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation

Aviral Chharia, Fernando De la Torre

Carnegie Mellon University

2026-05-26三维

针对3D高斯头部头像依赖多视图采集、3D监督或中间视图扩散而难以规模化的问题,论文提出MVCHead:用单次前向的状态空间模型直接回归3D高斯,并通过HiSS/HiBiSS层级双向扫描与SE(3)多视图判别器在无真实多视图对的情况下约束一致性。实验称其在感知质量、纹理和几何一致性上优于既有方法,并发布FaceGS-10K;但模型仅覆盖前/侧视,尚非完整360°头像。

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation Figure 1
2026-05-26cs.CV

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

Fudan University 2 Tencent Hunyuan

2026-05-26视觉感知

现有开源音视频联合生成多依赖粗粒度文本嵌入,面对多阶段动作和人机/物体交互时缺少跨模态长程语义计划,易导致画面与声音去噪轨迹失配。Baton 将语义推理与扩散合成解耦,用 VA-Planner 生成对齐的视频/音频 planned tokens 作为关键帧蓝图,并用 RS-RoPE 对齐蓝图与潜变量的时空坐标。实验显示其在复杂提示下较现有 SOTA 提升同步性与稳定性,但具体增益规模需看完整基准细节。

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing Figure 1
2026-05-26cs.CV

SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing

Sen Liang, Cong Wang, Fengbin Guan, Zhentao Yu, Yiting Lu, Yuanzhi Wang, Yuan Zhou, Xin Li, Zhibo Chen

2026-05-26生成模型

针对现有音视频编辑多采用先改画面再补音频的解耦流程,易造成口型/事件与声音不同步、且新音频破坏原有语境,SpongeBob 将主体级音视频编辑重构为自监督补全任务,并用双流 DiT、双向跨模态注意、时空约束与上下文注意在同一去噪过程中联合生成。作者还构建数据管线与 SpongeBob-Bench,报告 Sync-C 提升 30%、Ctx-F1 提升 12.5%。

Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference Figure 1
2026-05-26cs.CV

Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference

Agata Żywot, Iason Skylitsis, Thijmen Nijdam, Zoe Tzifa-Kratira, Derck Prinzhorn, Konrad Szewczyk, Aritra Bhowmik

University of Amsterdam, Netherlands

2026-05-26视觉感知生成模型

针对 Stable Diffusion 等文本生图模型难以在不重训时利用参考图的问题,论文提出 VCF:用轻量对齐器将 CLIP 图像 token 映射到文本嵌入流形,再通过文本-图像融合和可选的推理时 Prompt-Noise Optimization 注入风格、构图与色彩线索。实验显示其相较基线提升参考图保真度,并能保持一定文本一致性,但 CLIP 文本对齐与 LPIPS 视觉对应之间存在权衡。

Discrepancy Minimization Improves Cross-Hospital Robustness in Digital Pathology Figure 1
2026-05-26cs.CV

Discrepancy Minimization Improves Cross-Hospital Robustness in Digital Pathology

Ben Vardi, Dana Schonberger, Yuval Friedmann, Zohar Yakhini, Iris Barshack, Alexander Loebel, Ariel Shamir

2026-05-26安全鲁棒

论文关注数字病理基础模型在跨医院部署时因染色、制片和扫描差异导致性能下降的问题。作者提出在patch级用LMMD对齐类别相关分布,并结合LoRA轻量微调PFM,既支持有未标注目标医院数据的域适应,也支持无目标数据的域泛化;实验显示在两类任务、两种PFM上,patch级增益可传导到slide级,并优于原始PFM和若干既有方法。

Methodology for Creating a Clinically Verified Dermoscopic Image Dataset Figure 1
2026-05-26eess.IV

Methodology for Creating a Clinically Verified Dermoscopic Image Dataset

Kozachok Elena Sergeevna

2026-05-26视觉感知数据集/基准

针对皮肤镜AI在本地门诊和移动采集场景中易受采集流程、元数据缺失与标签可靠性影响的问题,论文提出将移动皮肤镜SOP、16字段ISIC兼容元数据模型和多阶段专家/病理验证统一的数据集构建方法。按此流程形成443名患者的1026张图像,覆盖9类病变,39例恶性样本均经病理确认,可用于外部评测、域偏移与可解释性研究。

No Figure
2026-05-26cs.CV

K-U-KAN: Koopman-Enhanced U-KAN for 3D Dental Reconstruction from a Single Panoramic X-ray Radiograph

Bikram Keshari Parida, Abhijit Sen, Wonsang You

2026-05-26三维

单张全景牙片到 CBCT 的三维重建因深度塌缩、牙弓几何畸变和临床成本限制而困难。K-U-KAN 将 KAN 的深度可观测量、Koopman 潜空间线性演化、焦槽射线几何与轻量 3D U-KAN 结合,以网格卷积替代昂贵隐式渲染。文中报告其在 PSNR/SSIM 上接近 Transformer/INR 基线,LPIPS 更低,训练时间约减半。

SpikeReg: Energy-Efficient 3D Deformable Medical Image Registration with Spiking Neural Networks Figure 1
2026-05-26cs.CV

SpikeReg: Energy-Efficient 3D Deformable Medical Image Registration with Spiking Neural Networks

Ali Mikaeili Barzili, Behzad Moshiri, Hamid Azadegan, Mohammad-Reza A. Dehaqani

University of Tehran, School of Electrical and Computer Engineering, Tehran, 1439957131, Iran, Max Planck Institute for Brain Research, Frankfurt am Main, 60438, Germany, School of Computer Engineering, Iran University of Science and Technology (IUST), Tehran, 16846-13114, Iran, Department of Electrical and Computer Engineering, University of Waterloo, Waterloo, Ontario, N2L 3G1, Canada

2026-05-26视觉感知三维

三维医学图像形变配准计算量高,现有 CNN/Transformer 方法难以体现稀疏低功耗优势。SpikeReg 将 ANN 配准教师迁移为脉冲 U-Net,通过逐层权重转换、阈值校准和代理梯度微调,在隐藏层利用事件驱动稀疏计算预测 dense 位移场。OASIS Learn2Reg 上 Dice 0.7474,与 ANN 教师无显著差异,同时平均放电率 12.8%,按 SynOps/MAC 代理估计能耗降低 55.5×;但蒸馏和 label-Dice 教师迁移均表现不佳,且能耗仍非硬件实测。

PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration Figure 1
2026-05-26cs.CV

PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration

Haoqing Wu, Alexa Nawotki, Jochen Garcke

University of Bonn, Germany

2026-05-26三维安全鲁棒

面向真实传感器点云常见的缺失、噪声、离群点和密度不均,PQDT试图用单一模型统一完成补全、去噪与形变恢复。其核心是将Transformer解码拆成观测引导与先验引导两阶段,用几何嵌入和动态伪查询在输入证据与形状先验间自适应平衡,减少全局瓶颈造成的细节丢失。实验称其在既有与新构建退化基准上超过多种SOTA,尤其对复合退化更稳健。

Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo Figure 1
2026-05-26cs.LG

Inference-Time Alignment of Diffusion Models via Trust-Region Iterative Twisted Sequential Monte Carlo

Weixin Wang, Yu Yang, Wei Deng, Pan Xu

∗Duke University, †Duke University, ¶Duke University

2026-05-26生成模型强化学习

论文针对扩散模型推理时对齐中,SMC 方法依赖基采样器、奖励反馈滞后而导致粒子退化和高方差的问题,提出 TRI-TSMC:用信任域的路径空间 KL 约束更新学习前瞻 twisting 函数,并以加权极大似然投影回参数化族。理论上解释其零方差最优形式并证明可降低残余权重方差;实验在离散扩散文本生成和 Stable Diffusion 图像生成中,在匹配预算下提升 PPL/CoLA 与 ImageReward,但存在一定多样性下降。

Trust-Aware Joint Feature-Prediction Discrepancy for Robust Domain Adaptation Figure 1
2026-05-26cs.CV

Trust-Aware Joint Feature-Prediction Discrepancy for Robust Domain Adaptation

Xi Ding, Lei Wang, Syuan-Hao Li, Yongsheng Gao

2026-05-26安全鲁棒

针对域适应中仅对齐特征或预测、且默认目标样本同等可靠的问题,论文提出信任感知的联合特征-预测差异 JFPD,用预测熵估计不确定性信任、用类别原型相似度估计语义对齐信任,从而降低噪声或歧义样本的对齐权重。该目标被用于无监督域适应训练,在数字与物体识别基准上优于常见方法,且差异估计与目标域误差相关。

Uncertainty-DTW for Sequences and Visual Tokens Figure 1
2026-05-26cs.CV

Uncertainty-DTW for Sequences and Visual Tokens

Lei Wang, Syuan-Hao Li, Yongsheng Gao, Piotr Koniusz

2026-05-26安全鲁棒

针对传统 DTW/soft-DTW 依赖确定性距离、易被异质噪声特征主导的问题,论文将成对匹配建模为带异方差不确定性的高斯似然,用精度加权匹配和对数方差正则形成 uDTW,并扩展到 ViT 视觉 token;低不确定性区域呈“反注意力”地支配对齐。实验覆盖时间序列、Fréchet 均值、少样本动作与图像分类,报告相对 SOTA 的稳定提升,且不确定性与语义重要性相关。

WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models Figure 1
2026-05-26cs.CV

WorldCraft: From Camera Navigation to Object Manipulation in Interactive Video World Models

Bohai Gu, Taiyi Wu, Yueyang Yuan, Jian Liu, Xiaocheng Lu, Dazhao Du, Jie Zhang, Jinxiang Lai, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

The Hong Kong University of Science and Technology, AI Technology Center, Tencent Video, Tencent, Wuhan University, Peking University, Work done as an intern at Tencent AI Technology Center, Tencent Video. Corresponding author.

2026-05-26机器人视觉感知强化学习

现有视频世界模型多只能控制相机视角,难以表达机器人等场景中对具体物体的操作。WorldCraft 将点击选物与手绘轨迹引入自回归视频世界模型,用归一化世界轨迹解耦相机运动与物体运动,并通过 SP-LoRA 与 TASP 在保留相机控制的同时维持离屏物体状态。实验显示其能较准确跟随物体轨迹、保持相机生成质量,并在长时 rollout 中让离屏移动物体回到更新后位置。

VEOcc: Voxel-Centric Online Semantic Occupancy Prediction For Embodied Scene Understanding Figure 1
2026-05-26cs.CV

VEOcc: Voxel-Centric Online Semantic Occupancy Prediction For Embodied Scene Understanding

Ruoyu Wang, Yong Liu, Sheng Tao, Yuhang Lin, Yukai Ma

Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China. † These authors contributed equally to this work. ∗ Yong Liu is the corresponding author.

2026-05-26视觉感知

VEOcc针对具身在线占据建图中高斯表示边界不准、弱纹理覆盖不足且依赖预设场景尺度的问题,改用体素中心的递归“感知—同化”框架,实现无需初始尺度估计的开放式增量扩展;其时空在线更新策略结合跨时序logit聚合、可靠性感知置信调制和置信驱动状态更新来抑制多视角噪声。实验显示其在Occ-ScanNet与EmbodiedOcc-ScanNet的局部和具身设置均超过SplatSSC、RoboOcc等基线,并在自采视频零样本测试中表现出一定真实场景泛化能力。

TinyFormer: Preserving Tiny Objects in YOLO-DETRHybridReal-time Detectors Figure 1
2026-05-26cs.CV

TinyFormer: Preserving Tiny Objects in YOLO-DETRHybridReal-time Detectors

Jun-Wei Hsieh, Meng-Yu Kao, Ghufron Wahyu Kurniawan, Kuan-Chuan Peng

College of Artificial Intelligence, National Yang Ming Chiao Tung University, Taiwan, Mitsubishi Electric Research Laboratories

2026-05-26视觉感知

论文针对实时检测器在自动驾驶、监控等场景中易漏检微小目标的问题,指出YOLO与DETR共同瓶颈是早期大步幅下采样导致空间细节不可逆丢失。TinyFormer将ViT语义、DETR式无NMS预测与YOLO颈部结合,并用PBM高分辨率捷径和SSA注入浅层空间线索。COCO上TinyFormer-X-PBM达58.5% AP,小目标AP提升1.6;Objects365预训练后达60.2% AP。

Unbiased Diffusion Variational Inversion via Principled Posterior Matching Figure 1
2026-05-26cs.CV

Unbiased Diffusion Variational Inversion via Principled Posterior Matching

Weimin Bai, Yuxuan Gu, Yifei Wang, Weijian Luo, He Sun

2026-05-26生成模型

这篇论文针对扩散先验求解逆问题中 KL 近似带来的后验偏差、模态塌缩和不可靠不确定性,提出 PPM:用扩散过程上的 Fisher divergence 积分等价优化精确 KL,并推导可训练梯度,兼容粒子式变分推断与摊销重建网络。实验覆盖修复、超分、去模糊、荧光显微和黑洞成像,报告相比 DPS、RED-Diff、RLSD、DAVI 获得更高重建质量、更完整多模态后验和更校准的不确定性。

AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy Figure 1
2026-05-26cs.CV

AstroRAG -- A Pagerank-Based Retrieval-Augmented Generation Pipeline for Question Answering in Astronomy

Zhifeng Wang, Jason Jingshi Li, Kaihao Zhang, Ramesh Sankaranarayana

*This work was supported by Learning Machines Pty Ltd during the internship* 1 Zhifeng Wang and Ramesh Sankaranarayana are with, Australian National University, Canberra, ACT, Australia

2026-05-26视觉感知

针对天文学问答中通用 LLM 依赖参数知识易出错、朴素 RAG 又会引入无关上下文的问题,AstroRAG 将文档按 token 切块并为每个实例建立临时 Elasticsearch 索引,先用 MMR 取多样候选,再在相似图上用 PageRank 选择紧凑且相互支持的证据,强调本地化、可追溯与防泄漏。文中在 AstroQA 上报告 RAG 版 Mistral-7B 达到 79.49% 准确率和 F1,接近非 RAG 基线的两倍。

DA-UCT: Self-Supervised Domain-Adaptive Ultrasound Computed Tomography for Rapid Musculoskeletal Sound Speed Reconstruction Figure 1
2026-05-26cs.CV

DA-UCT: Self-Supervised Domain-Adaptive Ultrasound Computed Tomography for Rapid Musculoskeletal Sound Speed Reconstruction

Tianyu Liu, Heyu Ma, Aiduo Wang, Peiwen Li, Boyi Li, Ying Li, Dan Li, Chengcheng Liu, Dean Ta

but the supervised training requires large-scale labeled, research were performed using the CFFF platform of Fudan University., the College of Biomedical Engineering, Fudan University, Shanghai, Dan Li is with the College of Future Information Technology, Fudan, Chengcheng Liu and Dean Ta are with the College of Biomedical, Engineering, Fudan University, Shanghai 200433, China, and also with, State Key Laboratory of Integrated Chips and Systems, Fudan, University, without the need for in-vivo ground-truth SOS labels

2026-05-26三维

针对肌骨UCT中FWI计算耗时、易陷局部最优且体内SOS标注难获取的问题,论文提出SDA-UCT:先用仿真数据监督预训练注意力网络AttUCT,再以波动方程约束在体数据自监督域适配,并用LoRA提升少参数微调能力。仿真前臂重建达PSNR 29.23 dB、SSIM 0.928;体内前臂结构与MRI较一致,LoRA仅调3%参数接近全量微调,单帧约5 ms可支持三维实时显示。

No Figure
2026-05-26cs.CV

D3S2: Diffusion-Guided Dataset Distillation for Semantic Segmentation

Wenjie Zheng, Haoji Hu, Jiali Lu, Xingze Zou, Jing Wang

Zhejiang University, China

2026-05-26视觉感知生成模型数据集/基准

本文针对数据集蒸馏长期偏重分类、难以处理语义分割中的长尾类别、像素级对齐和高分辨率优化成本问题,提出 D3S2:先用类别均衡贪心策略选择代表性 mask,再借助布局到图像扩散模型生成对齐图像,并在采样中加入分割一致性与按类特征匹配。实验显示在 1% 压缩率下,Mask2Former 在 ADE20K/COCO-Stuff 达到 24.99%/35.49% mIoU,较随机选择提升 9.34/5.70 点。

Stop Denoising Your Blurs Figure 1
2026-05-26cs.CV

Stop Denoising Your Blurs

Sasidhar Parvathireddy, Vamsidhar Saraswathula, Rama Krishna Gorthi

2026-05-26视觉感知

本文针对扩散模型用加性噪声刻画去模糊、与真实卷积退化不匹配的问题,提出 ConvDiff:在频域将模糊核分解为连续的卷积退化轨迹,并用网络学习从任意中间模糊状态恢复清晰图像。实验显示其在锐度和结构上优于常规扩散与线性插值方案,但尚未达到最强端到端方法;当前主要验证于空间不变高斯模糊,泛化到运动或空间变化模糊仍需进一步说明。

No Figure
2026-05-26cs.CV

Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation

Imanol G. Estepa, Jesús M Rodríguez-de-Vera, Bhalaji Nagarajan, Petia Radeva

Barcelona Supercomputing Center (BSC), Barcelona, Spain

2026-05-26视觉感知

本文针对判别式视觉表征擅长语义理解、生成式表征擅长细节合成但二者语义空间错位的问题,提出 LEASE:用成对的生成/判别离散码本作为“语义字典”,在预计算 token 空间中同时做遮蔽 token 重建和基于判别质心的码本对比学习,从而无需数据增强、教师模型或在线 tokenizer。ImageNet-1K 等实验显示,其在线性探测、无条件生成、少样本、迁移与鲁棒性上超过 MAGE、Sorcen 等统一 SSL 方法,并带来训练加速。

No Figure
2026-05-26cs.CV

ClueAegis: Heuristic-to-Reasoning Cognitive-skill Learning for Unified Evidence-based Synthetic Image Detection

Huangsen Cao, Hongkang Chu, Yuxi Li, Ying Zhang, Chen Li, Jing Lyu, Yongwei Wang, Yu Zhao, Fei Wu

Zhejiang University, University of the Chinese Academy of Sciences

2026-05-26视觉感知

针对生成图像越来越逼真、传统端到端检测难以区分异质取证线索的问题,论文将合成图像检测重构为“感知线索→技能选择→证据推理”的认知流程,提出含12类取证技能标注的ClueAegis-Bench及两阶段ClueAegis代理框架。实验称其在多基准上达到SOTA,并提升跨域泛化、鲁棒性与推理可解释性。

NeurIPS: Neuro-anatomical Inductive Priors for Sphere-based Brain Decoding Figure 1
2026-05-26cs.AI

NeurIPS: Neuro-anatomical Inductive Priors for Sphere-based Brain Decoding

Sijin Yu, Zijiao Chen, Zhenyu Yang, Zihao Tan, Jiakun Xu, Zhongliang Liu, Shengxian Chen, Wenxuan Wu, Xiangmin Xu, Xin Zhang

2026-05-26视觉感知

这篇论文针对 fMRI 图像重建中 1D 编码器高效但丢失皮层几何、表面模型保真却训练低效的问题,提出将个体脑解剖差异视为归纳先验而非噪声。方法用 SRST 只在视觉 ROI 上做球面 token 化,并用 SG-MoE 根据皮层厚度、曲率和脑沟深度路由专家。NSD 实验显示其在表面解码器中达到 SOTA,性能接近强 1D 基线,且约 10 个 epoch 收敛、20% 新被试数据即可快速适配;消融表明增益主要来自解剖特征而非被试 ID 记忆。

Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models Figure 1
2026-05-26cs.CV

Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models

Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois, Hidetoshi Matsuom, Mizuho Nishio, Thomas Frauenfelder, Ahmed Allam, Christian Blüthgen, Michael Moor, Michael Krauthammer

University of Zurich and University Hospital of Zurich, Switzerland, Kobe University, Japan, ETH AI Center, Switzerland, Stanford University, USA, Zurich University of Applied Sciences, Switzerland

2026-05-26视觉语言视觉感知

针对医学视觉语言模型生成胸片报告时易产生虚假发现、漏报或定位错误的问题,本文不更新权重,而是在解码时用逐 token Top-K 稀疏自编码器分解残差流,经因果筛选后抑制有害特征、放大有益特征。结果显示该方法在 RadVLM、LLaVA-Rad、CheXOne 上提升临床综合指标,并可零样本迁移到 IU-Xray;同时揭示“boost”方向跨模型共享,而 hallucination 的“suppress”方向更依赖具体骨干。

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing Figure 1
2026-05-26cs.CV

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

Bangrui Xu, Ziyang Miao, Xuanhe Zhou, Yiming Lin, Zirui Tang, Xiaomeng Zhao, Fan Wu, Cheng Tan, Bin Wang, Conghui He

2026-05-26视觉感知

面向RAG等下游应用,现有VLM-OCR虽能做页级解析,却常丢失跨页段落、表格、标题层级和图文关系。MinerU-Popo将OCR后处理拆成四个结构恢复子任务,用3万任务数据微调4B轻量模型,并通过任务过滤、动态分块与重叠同步生成文档级树结构。实验显示其在5种OCR上标题层级TEDS至少提升20%,多数RAG子集准确率提高,单查询延迟最高降低70%。

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection Figure 1
2026-05-26cs.CV

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection

Ibrahim Delibasoglu

2026-05-26视觉感知学习理论

针对深伪检测在跨生成器、跨篡改方式下容易过拟合特定伪影的问题,本文把 RoPE-ViT、DINOv3 与 C-RADIOv4-H 作为冻结视觉基础模型,用线性探针在 DF40 上评估其表征泛化边界。核心洞察是预训练范式与模型规模决定了对全脸合成的宏观结构异常和局部编辑微弱伪影的敏感性取舍;结果显示基础模型仍能较好区分整脸合成,但面对局部换脸/编辑时性能明显受限,说明简单冻结特征加线性分类难以覆盖细粒度取证域移。

ConFi-GS Confidence-Guided High-Frequency Injection for 3D Gaussian Splatting Super-Resolution Figure 1
2026-05-26cs.CV

ConFi-GS Confidence-Guided High-Frequency Injection for 3D Gaussian Splatting Super-Resolution

Jiaxiang Li, Zongtan Zhou, Zhen Tan, Yadong Liu, Dewen Hu

2026-05-26三维

低分辨率多视角输入会让 3DGS 纹理发糊、边界变弱,而直接引入超分先验又可能把幻觉细节写入三维表示。ConFi-GS 的核心在于区分“哪里需要细节”和“哪些高频细节可信”,结合几何细节需求、频率可靠性与跨视角稳定性生成注入图,并据此做选择性监督、渐进频率正则和高斯致密化。实验称其在多个基准上提升保真度与感知质量,同时减少视角不一致细节。

Tempered Self-Similarity Alignment for Physically Plausible Video Generation Figure 1
2026-05-26cs.CV

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

Pohang University of Science and Technology (POSTECH)

2026-05-26视觉感知

针对视频生成中常见的外观漂移、运动不合理和时序不一致问题,本文将视觉基础模型中的时空自相似关系转化为温度锐化的对应概率分布,并仅在动态区域对齐,以提供长程、关系式运动监督。基于 CogVideoX-2B 微调后,TSA/M-TSA 在 VideoPhy 与 VideoPhy2 上提升物理常识、语义和联合指标,优于 REPA、TRD 等对齐基线。

Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy Figure 1
2026-05-26cs.CV

Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy

Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong

Yanshan University, Peking University

2026-05-26生成模型三维

针对光场显微三维重建中物理迭代方法慢、伪影重,以及现有学习方法跨样本泛化不足的问题,论文将扩散模型改造成三步确定性条件采样,并用注入光场/物理先验的轻量 U-Net 直接预测体数据,同时加入 ICD 检测分布外输入以触发适配。多数据集与跨数据集实验显示,该方法在重建保真度、速度和泛化稳定性上优于已有物理和学习式基线。

Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration Figure 1
2026-05-26cs.AI

Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Sixue Lin, Yuteng Xiao

Qilu University of Technology (Shandong Academy of Sciences), China Telecom Digital Intelligence Technology Co, Ltd, Shenyang Aerospace University, Qilu Institute of Technology, Qilu University of Technology (Shandong Academy of Sciences) Jinan China, China Telecom Digital Intelligence Technology Co, Ltd Jinan China, Shenyang Aerospace University Shenyang China, Qilu Institute of Technology Jinan China

2026-05-26视觉语言视觉感知

论文针对大视觉语言模型在图像描述/VQA中凭语言先验“编造”不存在物体的问题,提出无需训练的 SADI 推理干预:以多注意力头的中位共识作为稳健视觉锚点,并按区域间分歧分配软惩罚,避免硬截断带来的特征不连续和额外解码延迟。在 CHAIR、POPE、MME 上报告同时降低实例级与句子级幻觉,并优于同期基线。

No Figure
2026-05-26cs.CV

Interpretability Transfer from Language to Vision via Sparse Autoencoders

Alexey Kravets, Da Li, Chuan Li, Da Chen, Vinay P. Namboodiri

2026-05-26视觉感知

视觉概念难以标注,使语言模型中成熟的 SAE 可解释性难以迁移到多模态视觉表征。本文提出 VISTA,在 LLaVA 式模型中用文本 SAE 重构损失约束视觉投影器,让视觉 token 落入已标注的语言 SAE 流形,无需训练视觉 SAE。实验显示概念匹配率平均提升三倍,并发现 DINOv2 比 CLIP 具备更稳定的局部定位;基于文本 SAE 方向的局部干预在目标移除和替换上较视觉基线提升 35% 和 47%。

Your Embedding Model is SMARTer Than You Think Figure 1
2026-05-26cs.IR

Your Embedding Model is SMARTer Than You Think

Jianrui Zhang, Hyun Jung Lee, Sukanta Ganguly, Tae-Eui Kam, Donghyun Kim, Yong Jae Lee

Korea University, NetApp, Inc.

2026-05-26视觉感知

针对单向量多模态检索将序列压缩为全局向量、易丢失局部视觉/文本证据的问题,SMART的核心洞察是池化对比学习的梯度已让非池化隐藏状态具备可用于局部匹配的几何结构。方法在推理时直接对冻结隐藏状态做MaxSim晚交互,并与全局分数混合,也可轻量后训练;实验称其在MMEB-V2等任务上稳定提升Qwen3-VL-Embedding等模型,视觉文档检索中还能以更少训练成本超过部分多向量方法。

HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos Figure 1
2026-05-26cs.RO

HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos

Zhi (Leo) Wang, Botao He, Kelin Yu, Seungjae Lee, Ruohan Gao, Furong Huang, Yiannis Aloimonos

University of Maryland

2026-05-26机器人视觉感知

针对机器人操作依赖大量机器人示教、而人类第一视角视频难以跨具身迁移的问题,HumanEgo将手—物交互提升为实体级Interaction-Centric Tokens,并通过手臂修复、虚拟夹爪渲染、flow matching策略及2D轨迹/物体运动/潜变量一致性等密集辅助监督,从分钟级人类视频中学习策略。实验显示每任务30分钟人类视频在4个真实任务达92.5%成功率,15分钟达75%,较同等采集时间机器人遥操作高41%,并可零样本迁移到新机器人、相机和环境。

X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers Figure 1
2026-05-26cs.CV

X-Edit: Exact, Explicit, and Explainable Null-Space Editing for Medical Vision Transformers

Yuanye Liu, Siyuan Zhou, Ke Zhang, Lei Li, Wei Chen, Xiahai Zhuang

2026-05-26视觉感知

这篇工作针对医疗 ViT 部署后遇到长尾病例或域偏移时,常规微调会修正少数错误却引发灾难性遗忘的问题,提出 X-Edit:先用因果追踪定位影响错误预测的层,再由锚点样本构造正交零空间,将闭式参数更新限制其中,以尽量不扰动既有诊断表征。六个医学影像基准显示其在编辑成功率和测试稳定性之间优于微调及已有编辑方法。

MambaDSF: Multi-Scale SSM with Dilated Feature Fusion for Sonar Small Target Detection Figure 1
2026-05-26cs.CV

MambaDSF: Multi-Scale SSM with Dilated Feature Fusion for Sonar Small Target Detection

Hui Lin, Jiayi Li, Jing Wang, Shenghui Rong

School of Information Science and Engineering, Ocean University of China, Qingdao 266100, China, School of Information and Communication Technology, Griffith University, Nathan, QLD 4111, Australia

2026-05-26视觉感知

面向AUV等水下感知中小型声呐目标像素少、对比度低且尺度变化大的难题,MambaDSF将线性复杂度SSM引入检测框架:用MambaEFP兼顾局部回波与全局杂波上下文,DFMamba做空洞多感受野与跨尺度融合,并以SA-WIoU、CSC稳定小目标监督。在UATD上以28.7M参数达到91.5% mAP50,小目标子集提升2.2个百分点,跨FLS/MD-FLS验证了泛化性。

No Figure
2026-05-26cs.GR

Snapshot Polarimetric Display Inverse Rendering

Seokjun Choi, Yunseong Moon, Kaizhang Kang, Hoon-Gyu Chung, Jin-Nyeong Kim, Giljoo Nam, Seung-Hwan Baek

2026-05-26视觉感知

面向桌面级轻量采集中的单帧逆渲染信息不足问题,论文把LCD线偏振RGB二值照明、带四分之一波片的RGB偏振相机和前馈Transformer结合,将一次拍摄分解为RGB方向×非偏振/线偏振/圆偏振九路观测,以缓解漫反射、镜面与金属材质混淆;同时用生成流形扩增实测pBRDF训练数据。真实装置实验显示其法线、反照率、粗糙度和金属度估计及重光照效果优于对比方法。

Where Detectors Fail: Probing Generative Space for Generalizable AI-Generated Image Detection Figure 1
2026-05-26cs.CV

Where Detectors Fail: Probing Generative Space for Generalizable AI-Generated Image Detection

Zijie Cao, Weijie Tu, Yao Xiao, Weijian Deng, Liang Lin, Pengxu Wei

2026-05-26视觉感知生成模型

针对 AI 生成图像检测器在未见生成器上易失效的问题,论文指出瓶颈不只是数据规模,而是训练样本未覆盖生成空间中的边界区域。PROBE 将检测器作为 critic,引导扩散生成器在保持感知真实的约束下产生难分类的边界诱导假样本,再用其微调检测器。多基准实验显示该方法提升跨生成器泛化,平均较近期 SOTA 高约 4.6%。

BFS: Back-to-Front Layered Image Synthesis via Knowledge Transfer Figure 1
2026-05-26cs.CV

BFS: Back-to-Front Layered Image Synthesis via Knowledge Transfer

Kyoungkook Kang, Gyujin Sim, Sunghyun Cho

2026-05-26视觉感知

针对分层图像生成中前景/阴影/反射难以干净分离、且高质量分层训练数据稀缺的问题,BFS选择从背景到前景的合成流程,用双分支扩散模型同时生成合成图与RGBA前景层,并通过未分层高质量图像向前景分支迁移知识。两阶段训练使模型在有限分层监督下生成更协调的前景层,实验和用户研究显示其视觉质量与泛化性优于既有方法。

BED-SAM2: Boundary-Enhanced-Depth SAM2 via Monocular Geometric Priors Figure 1
2026-05-26cs.CV

BED-SAM2: Boundary-Enhanced-Depth SAM2 via Monocular Geometric Priors

Tyler Rust, Dara McNally, Kyle O'Donnell, Colin Kelly, Chandra Kambhamettu

University of Delaware, University of South Florida, DEVCOM Army Research Laboratory

2026-05-26学习理论

针对 SAM2 在显著/伪装目标分割中易受纹理、阴影干扰且边界不准的问题,BED-SAM2 将单目深度估计转化为由原深度、反深度、中心化深度等边缘累加的结构图,作为第四通道早期融合进 Hiera 编码器,并用 LoRA 轻量微调。文中报告其在 13 个基准上达到或接近 SOTA,且仅需约 5 个训练 epoch。

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling Figure 1
2026-05-26cs.CV

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Willow Yang, Yutong Zheng, Zhenli Zhang, Tenglong (Victor)Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

PWM Team, XPeng Inc.

2026-05-26视觉感知强化学习

该文针对现有 VLA 自动驾驶/机器人策略偏反应式、难以预演未来风险的问题,提出 X-Foresight,将预测式世界模型嵌入视觉-语言-动作架构。关键洞察是不用逐帧预测,而以长时域 chunk 自回归联合预测视觉与动作,配合课程学习、关键时刻重要性采样和扩散式多视角渲染,同时学习短期动态与长期因果。实验显示其规划表现优于 VLA 基线并保持较好生成保真度,但具体增益幅度需看正文表格。

QuoVLA: Quotient Space for Vision-Language-Action Models Figure 1
2026-05-26cs.CV

QuoVLA: Quotient Space for Vision-Language-Action Models

Xuan Wang, Yinan Wu, Haoran Duan, Jungong Han

Department of Automatio, Tsinghua University

2026-05-26视觉语言视觉感知

该文针对VLA适配中普遍认为预训练VLM表征“缺少动作信息”或需隔离动作梯度的假设,提出相反洞察:VLM潜变量可能已动作充分但过完备,冗余的提示差异会伤害泛化。QuoVLA用商空间思想,通过量化压缩、可控直通梯度、双分支动作生成和相对时序复杂度正则,保留动作相关信息并折叠动作等价变化。多基准实验显示其在整体性能上有竞争力,尤其在视觉、语言和环境分布偏移下泛化提升明显。

Trajectory-Consistent Calibration for Cache-Accelerated Diffusion Models Figure 1
2026-05-26cs.CV

Trajectory-Consistent Calibration for Cache-Accelerated Diffusion Models

Mingyu Liang, Dingkun Xu, Jingwei Xu

Laboratory for Novel Software Technology, Nanjing University, China

2026-05-26生成模型规划控制

针对 DiT 采样中缓存复用虽能加速但会引入表示偏差、并沿去噪轨迹累积导致质量下降的问题,论文提出训练-free 的 TCC:将校准视为轨迹的一部分,离线迭代估计与已校正历史一致的误差先验,同时处理局部复用错配和后续轨迹漂移。在不改模型和缓存策略下,TCC 在 PixArt-α、DiT-XL/2 及 FORA/ToCa/L2C 等设置中稳定降低 FID,如 PixArt-α 上由 29.83 降至 27.35。

Adversarial Error Correction for Visual Autoregressive Generation Figure 1
2026-05-26cs.CV

Adversarial Error Correction for Visual Autoregressive Generation

Ligong Bi, Tao Huang, Jianyuan Guo, Chang Xu

Shanghai Jiao Tong University, City University of Hong Kong, The University of Sydney

2026-05-26视觉感知

本文针对视觉自回归生成中粗到细预测的误差级联问题:早期小偏差会在后续尺度被放大,导致纹理漂移和结构失真。核心做法是在冻结的 VAR 主干上加入轻量 guidance injector,并用 RGB 空间判别器、软 VQ-VAE 解码和动态刷新训练提供可传回的对抗纠错信号,同时提出 ISCS 衡量跨尺度一致性。ImageNet 实验显示其在多个 VAR 骨干上提升细节与结构稳定性,AID-VAR-d20 以约 3% 参数增量带来 16% FID 改善。

Multiscale Real-Time Object Detection in the NMS-Free Era: A Comparative Performance Evaluation of YOLOv8 and YOLO26 Figure 1
2026-05-26cs.CV

Multiscale Real-Time Object Detection in the NMS-Free Era: A Comparative Performance Evaluation of YOLOv8 and YOLO26

Chidera G. Oguine, Kanyifeechukwu J. Oguine, Obiozor M. Oguine, Ozioma C. Oguine

University of Abuja, Nigeria, Vanderbilt University, USA, University of Notre Dame, USA

2026-05-26视觉感知数据集/基准

针对实时目标检测中 NMS 带来的延迟波动和边缘部署复杂性,本文系统比较 NMS 型 YOLOv8 与端到端 NMS-free 的 YOLO26,在 Pascal VOC 与密集小目标 VisDrone 上跨五种尺度评测精度、定位、复杂度和 CPU/GPU 延迟。核心洞察是去除 NMS 并不必然带来全场景部署优势:YOLO26 在 VOC 多数尺度上精度更高且模型更轻,但在 VisDrone 小目标场景优势收窄,YOLOv8 的 GPU 延迟仍有竞争力。

AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning Figure 1
2026-05-26cs.CV

AOEPT: Breaking the Implicit Modality-Reduction Bottleneck in Modality-Missing Prompt Tuning

Jian Lang, Rongpei Hong, Ting Zhong, Fan Zhou

2026-05-26视觉感知

面向真实部署中传感器失效、传输错误导致的模态缺失,本文指出现有缺失模态提示调优会把多模态 Transformer 隐式压缩到仅观测模态子空间,形成 IMR 瓶颈。AOEPT 用训练数据蒸馏轻量级模态上下文提示作为缺失模态的全局先验库,并按当前样本观测模态实例化补偿信息。多基准和多骨干实验显示其在较小计算开销下优于既有方法,并提出 NM²I 诊断该瓶颈。

CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation Figure 1
2026-05-26cs.CV

CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation

Shayan Jalilian, Abdul Bais

2026-05-26视觉感知

针对 SAM 分割精细但缺乏类别语义、VLM+SAM 外部生成提示又难以让语义进入特征的问题,本文提出 CLIP-Guided SAM:用轻量多模态适配器把 CLIP 的文本、视觉和相似度特征注入 SAM 图像编码器,并强调 SAM 与 CLIP 端到端协同适配及训练/推理提示一致性。实验在 COCO、ADE20K、VOC 和伪装目标等低标注场景中优于 SAM-PEFT 与 VLM+SAM 管线,并在较少参数和算力下接近或竞争于更大模型。

Fishbone: From One 3D Asset to a Million Controllable Edits Figure 1
2026-05-26cs.CV

Fishbone: From One 3D Asset to a Million Controllable Edits

Yumeng He, Xiaoying Wang, Peihao Li, Yanjia Huang, Joe Masterjohn, Jiajun Wu, Leonidas Guibas, Yin Yang, Ying Jiang, Chenfanfu Jiang

2026-05-26规划控制三维

为缓解三维资产建模/绑定成本高、机器人学习与生成模型缺少可控形变数据的问题,Fishbone从任意网格自动抽取“脊柱-肋骨”控制结构:用测地标量场生成截面肋骨、几何中心线生成脊柱,并以高斯蒙皮关联表面,实现局部厚度/截面编辑与全局弯曲、扭转、拉伸。论文还构建Fishbone-136K并展示实时编辑、降维仿真、动画、可控生成和机器人数据增强效果,但具体下游增益来源可能部分来自数据扩增规模。

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models Figure 1
2026-05-26cs.CV

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao

2026-05-26视觉语言视觉感知

论文关注多模态大模型在大规模闭集识别中随候选类别增多而准确率崩塌的问题,认为根因是标签熵上升与长提示中的注意力稀释降低信噪比。作者提出无需训练的 Divide-and-Conquer Inference,将大类别表递归拆成局部子问题并动态剪枝。ImageNet-1K/21K 等实验显示,DCI可提升准确率并降低推理开销,使较小开源模型接近甚至超过部分闭源强模型。

HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm Figure 1
2026-05-26cs.CV

HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm

Jie-En Yao, Hong-En Chen, C.-C. Jay Kuo

University of Southern California

2026-05-26视觉感知

本文针对 Forward-Forward 算法在逐层局部训练中缺少跨层层级协调、且 goodness 归一化后特征语义不稳定的问题,提出 HCL-FF:用由粗到细的标签监督引导浅层到深层表征演化,并在去 goodness 后的特征上加入监督对比约束。其在 CIFAR-10、CIFAR-100 与 Tiny-ImageNet 上相较既有 FF 方法分别提升 5.46%、17.00% 和 12.51%,显示层级课程与对比对齐能缓解 FF 的解耦困境。

DUEL: Adversarial Self-Play for Multimodal Reasoning Figure 1
2026-05-26cs.CV

DUEL: Adversarial Self-Play for Multimodal Reasoning

Lin Qiu, Hanqing Zeng, Yao Liu, Bingjun Sun, Guangdeng Liao, Ji Liu

2026-05-26视觉语言

DUEL针对VLM强化学习后训练依赖高质量标注、无监督自演化又容易缺乏视觉 grounding 的问题,提出由同一预训练模型分化出的Challenger–Solver对抗自博弈:前者生成图像真实陈述及最小扰动硬负例,后者用长度归一化似然奖励验证真伪。实验显示其在数学推理、图表文档理解和通用视觉推理上较同基座后训练方法有更稳定增益,且无需人工标注、外部奖励模型或图像编辑工具。

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering Figure 1
2026-05-26cs.CV

Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering

Ojonugwa Oluwafemi Ejiga Peter, Frederick Akor Ejiga, Fahmi Khalifa, Md Mahmudur Rahman

2026-05-26视觉语言视觉感知

针对胃肠内镜 AI 受标注稀缺、隐私限制和全量微调成本制约的问题,论文提出双管线参数高效框架:用 PEFT 适配 Florence-2 做临床 VQA,并以 LoRA 微调 Stable Diffusion 2.1 生成隐私友好的合成内镜图像。实验在 Kvasir-VQA 上报告 ROUGE-1 0.92、ROUGE-L 0.91,BLEU 有提升;rank-4 LoRA 在图文一致性 FBD 上优于若干生成基线,并称计算成本降低近 90%。

Self-Supervised Contrastive Learning for Cardiac MR Sequence Classification Figure 1
2026-05-26cs.CV

Self-Supervised Contrastive Learning for Cardiac MR Sequence Classification

Yuli Wang, Hyewon Jung, Dongshen Peng, Yuwei Dai, Jing Wu, Haoyue Guan, Yoko Kato, Zhicheng Jiao, Yu Sun, Ihab Kamel, Joao Lima, Cheng Ting Lin, Harrison Bai

2026-05-26视觉感知

针对通用 ImageNet 预训练 ViT 难以迁移到心脏 MR 序列分类的问题,论文用院内心脏 MR 数据进行自监督对比预训练,再少量监督微调,以学习领域表征。结果显示该策略优于直接监督训练,在 T1、T2、Cine、LGE 四类常见序列上 AUC 均超过 0.75,并能迁移到 BraTS、ADNI;消融还指出中等 batch 更优,约 1200 张图像即可超过监督微调。

How Noisy Poses Break Inverse Dynamics: Analysis and Mitigation for Video-Based Joint Torque Estimation Figure 1
2026-05-26cs.CV

How Noisy Poses Break Inverse Dynamics: Analysis and Mitigation for Video-Based Joint Torque Estimation

Donghyun Kim, Chanyoung Kim, Eunseo Jeong, Youngjoong Kwon, Seong Jae Hwang

Emory University, Yonsei University

2026-05-26视觉感知三维

面向视频三维人体姿态到关节力矩估计的物理落地问题,论文指出逆动力学中的数值微分会把微小姿态噪声急剧放大。作者构建无需外部仿真的可微 SMPL-Dynamics,并系统分析噪声传播:姿态误差约放大 1000 倍,躯干和髋等近端关节比远端敏感最高 10 倍;微分前低通滤波可缓解,可微姿态优化在几乎不改姿态下将力矩误差降低约 92%–93%。

From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks Figure 1
2026-05-26cs.CV

From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks

Bruce Changlong Xu, Jose James, Alexander Ryu

2026-05-26视觉语言视觉感知学习理论数据集/基准

针对“用VLM伪标签是否越多越好”的弱监督假设,本文把经典噪声标签上界校准到BiomedCLIP医学影像标注场景,提出用少量金标比较gold-only AUC与VLM准确率的决策规则。三数据集显示交叉点分别约为PCAM 100、ISIC 20–50、NIH-CXR 250–500个金标;超过后弱标签最高使AUC下降约0.10,且多数预训练架构下交叉点基本不变,说明瓶颈主要在标注器而非学生模型。

Muon in Vision Transformers: Optimizer-Recipe Interactions and Gradient Spectra Figure 1
2026-05-26cs.LG

Muon in Vision Transformers: Optimizer-Recipe Interactions and Gradient Spectra

Ben S. Southworth, Shuai Jiang, Daniel McBride, Eric C. Cyr, Stephen Thomas

Los Alamos National Laboratories, Sandia National Laboratories, Lehigh University

2026-05-26视觉感知优化算法

本文针对ViT大量参数是矩阵而AdamW仍逐坐标更新的错配,系统考察矩阵感知优化器Muon。核心洞察是其优势并非单纯优化器替换,而是与强视觉训练配方耦合:全量增强可维持更丰富的梯度谱,避免Muon在深层MLP出现后期模态坍缩;同配方下Muon在QKV梯度上比AdamW覆盖更多奇异方向。实验显示其在ImageNet-100、长尾Pl@ntNet分类以及分割、MAE训练中均优于AdamW。

Leveraging pretrained RGB denoisers for hyperspectral image restoration Figure 1
2026-05-26cs.CV

Leveraging pretrained RGB denoisers for hyperspectral image restoration

Daniele Picone, Mohamad Jouni, Mauro Dalla-Mura

2026-05-26视觉感知

高光谱恢复受训练数据稀缺、传感器差异和高维谱带限制,专用先验往往泛化不足。本文的关键思路是冻结大规模 RGB/灰度去噪器,仅用轻量线性适配器把高光谱立方体投影到低维谱子空间去噪,再受约束聚合回原谱域,同时保持 PnP 稳定性。实验覆盖去噪、去模糊和超分辨率,在多个数据集上相较高光谱专用基线取得一致提升,说明 RGB 先验可迁移到高光谱恢复。

4KLSDB: A Large-Scale Dataset for 4K Image Restoration and Generation Figure 1
2026-05-26cs.CV

4KLSDB: A Large-Scale Dataset for 4K Image Restoration and Generation

Zihao Zhu, Kuan-Ru Huang, Zhaoming Xu, Renjie Li, Bo Wu, Ruizheng Bai, Mingyang Wu, Sayak Paul, Zhengzhong Tu

Texas A&M University

2026-05-26视觉感知数据集/基准

针对公开数据缺少大规模原生 4K 图像、限制超分辨率与文生图模型训练和公平评测的问题,本文构建 4KLSDB:从 LAION-2B、Photo Concept Bucket、PD12M 等筛选 12.9 万张训练图,并结合规则过滤、LMM 评分与人工核验,提供验证/测试集、LR/HR 基准和图文对。实验显示,用真实 4K 数据微调可提升多类超分与扩散生成的细节保真、泛化和人类偏好,但增益可能主要来自 scaling / data。

Drift-Resistant Navigation World Model with Anchored Epipolar Guidance Figure 1
2026-05-26cs.CV

Drift-Resistant Navigation World Model with Anchored Epipolar Guidance

Po-Chien Luan, Zimin Xia, Wuyang Li, Yang Gao, Alexandre Alahi

2026-05-26机器人强化学习

面向导航世界模型长时域滚动中视觉误差累积和与自运动不一致的几何漂移,论文提出 DR-NWM:先预测稀疏未来锚点,再在锚点间分块生成中间帧,并用双向极线约束为扩散 Transformer 提供几何定位,无需显式 3D 监督。四个导航基准上,其在长时域画质、几何一致性、多视角连贯性及同规划器下的下游规划表现均优于强基线。

No Figure
2026-05-26cs.CV

Motion-Compensated Weight Compression

Ismail Lamaakal

Mohammed Premier University

2026-05-26视觉感知

面向大模型部署中检查点存储、传输与冷启动成本上升的问题,MCWC不再逐层独立压缩权重,而是利用隐藏单元、注意力头等置换对称性做功能保持的跨层对齐,将网络深度视作类似视频的可预测序列,再用关键帧、层序预测、残差量化和学习熵模型编码。文中称其在Transformer语言建模和视觉分类上优于强量化与学习式权重编码基线的率—精度折中,消融显示对齐、预测、熵建模和关键帧均贡献必要。

Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain Figure 1
2026-05-26cs.CV

Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain

Avery Gump, Connor Henley, Sungjin Cheong, Akarsh Prabhakara, Mohit Gupta

University of Wisconsin–Madison, Madison, WI, USA

2026-05-26三维

面向固态/单光子阵列 LiDAR 在逆反射物等强回波下产生内部多径眩光、点云鬼影并遮挡真实目标的问题,论文把眩光建模为作用于瞬态直方图的场景无关线性 TGSF,并在点云生成前结合 pileup 校正与回波置信度进行无训练抑制。真实商业 SP-LiDAR 实验显示,该方法能显著减少严重眩光伪影,同时较好保留真实场景结构。

From Full Boards to Tiny Defects: Scale-Aware Tile Inference with Topology-Aware Merging for High-Resolution PCB Defect Detection Figure 1
2026-05-26cs.CV

From Full Boards to Tiny Defects: Scale-Aware Tile Inference with Topology-Aware Merging for High-Resolution PCB Defect Detection

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Ali Amini, Jiann Shiun Yuan

cCentre of Real Time Computer Systems, Faculty of Informatics, Kaunas University of Technology, defect detection, further showing that the field is rapidly moving toward architecture-centered improvements [9], [10]., standard detection metrics together with small-defect recall and boundary-zone recall. The codes are available at

2026-05-26视觉感知

本文针对高分辨率 PCB 全图缩放导致微小缺陷“分辨率崩塌”的问题,指出训练与推理尺度一致性比改网络更关键,并提出无需重训的拓扑感知瓦片合并 TA-TM,通过邻接瓦片一致性修正边界框分数。两数据集上,瓦片训练显著优于全图训练,128px 重叠将边界召回提升至约70–100%,TA-TM取得最佳 mAP@50。

Calibrating Probabilistic Object Detectors with Annotator Disagreement Figure 1
2026-05-26cs.CV

Calibrating Probabilistic Object Detectors with Annotator Disagreement

Zhi Qin Tan, Owen Addison, Yunpeng Li

2026-05-26视觉感知

论文针对医学等场景中目标本身含糊、标注者分歧大而难以获得客观真值的问题,主张不再把分歧简单聚合掉,而是用多标注分布来校准概率目标检测器的类别置信度与框方差。方法提出无需真值的四类分类/定位校准误差、训练期损失与等渗回归后校准,可适配 YOLO 和两阶段检测器;在真实与合成的医学、自然图像实验中,平均校准指标提升约 4.0–11.5,且基本保持检测精度。

Physics-Guided Self-Supervised Statistical Residual Learning for Sonar Despeckling with Improved Generalization Figure 1
2026-05-26cs.CV

Physics-Guided Self-Supervised Statistical Residual Learning for Sonar Despeckling with Improved Generalization

Swapna Pillai, Siddharth Singh Savner, Sujit Kumar Sahoo

2026-05-26学习理论

针对真实声呐图像缺少无斑点真值、合成监督易失配且自监督方法可能退化为恒等映射的问题,论文把乘性斑点转到对数域学习残差,并用目标方差统计约束、边缘感知结构正则和中值引导课程训练限制残差符合物理噪声。实验称轻量网络在多个真实声呐数据集上取得最佳 M-score,并表现出较强跨数据集鲁棒性和实时部署潜力。

Do Image-Text Metrics Respect Semantic Invariances? Figure 1
2026-05-26cs.CV

Do Image-Text Metrics Respect Semantic Invariances?

Amit Agarwal, Hitesh Laxmichand Patel, Meizhu Liu, Jyotika Singh, Karan Dua, Hansa Meghwani, Matthew Rowe, Michael Avendi, Yassi Abbasi, Tao Sheng, Sujith Ravi, Dan Roth

2026-05-26视觉感知

本文关注无参考图文评测指标是否会被“语义不变”的扰动误导,因为这些分数常用于模型选择、排序和奖励。作者提出面向指标的 invariance audit,在空间、物体和社会语言表述三类扰动上测试 CLIPScore、PAC-S、UMIC、FLEUR 与 LLM judge。结果显示无害翻转、重定位或措辞变化可带来约 6–9% 分数漂移,0.7% 的系统差距下最高约 37% 排名翻转;其后处理校准可约减半中位敏感度。

No Figure
2026-05-26cs.CV

SRUG: Shadow-Guided Relightable Urban Scene with Generation Model

Yonghao Zhao, Zexin Yin, Jian Yang, Beibei Wang, Jin Xie

College of Computer Science, Nankai University, Nankai University and Nanjing University, School of Intelligence Science and Technology, Nanjing University, College of Computer Science, Nankai University China, Nankai University and Nanjing University China, School of Intelligence Science and Technology, Nanjing University China

2026-05-26视觉感知

本文面向多视图/视频重建可重光照城市场景,针对城市无界导致不可见区域仍会投影、稀疏视角与复杂日照/天光/间接光使材质-光照分解不稳的问题,提出 SRUG:用阴影引导 3D 补全恢复不可见几何,并结合可微 Gaussian 阴影映射、LMM 监督的迭代材质分解和物理光照模型。实验显示其在新视角合成、材质分解与重光照上优于既有方法,但长序列材质一致性仍有限。

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery Figure 1
2026-05-26cs.CV

AdaFuse-Det: Adaptive Cross-Modal Fusion of Event Cameras for Robust Object Detection in Low-Light RGB Imagery

Raju Imandi, Chethana B, Bharatesh Chakravarthi, Yong-Guk Kim, Manipriya S, Pavan Kumar B N

2026-05-26视觉感知安全鲁棒

面向夜间监控、搜救等低照度场景中 RGB 相机信噪比骤降、检测易失效的问题,AdaFuse-Det 将 CLAHE 增强图像与体素化事件流双分支编码,并用基于最小方差估计的 ACMF 自适应分配两种模态权重。其在 LLE-VOS 极暗条件下达到 65.54% 召回率、53.85% 精度和 59.12% F1,优于 RGB-only、event-only 和简单拼接基线。

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing Figure 1
2026-05-26cs.CV

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

Ruyi Chen, Lu Zhou, Xiaogang Xu, Chiyu Zhang, Jiafei Wu, Liming Fang

2026-05-26数据集/基准

针对文生图模型在中性或带社会语义提示下仍会放大性别、年龄、种族偏差的问题,HoloFair将公平性评估从单一属性扩展到多属性、语义条件分布,提出MGBI指标、SpaFreq属性分类器和配套提示/图像基准,并用Fair-GRPO以多目标奖励调节生成分布。文中评测8个主流T2I模型,发现默认看似公平的模型在具体语义下仍暴露偏见;在SD3.5-Medium等实验中,该方法提升MGBI且基本保持图像质量。

No Figure
2026-05-26cs.CV

MindAdapter: Few-Shot Parameter-Efficient Residual Calibration of Cross-Subject Brain-to-Visual Decoding Models

Jiaxiang Liu, Jiawei Du, Xupeng Chen, Guoqi Li, Jiang Cai, Simon Fong, Mingkun Xu

Guangdong Institute of Intelligence Science and Technology, New York University, Institute of Automation, Chinese Academy of Sciences, Department of, Computer and Information Science, University of Macau, Guangdong Institute of Intelligence Science and Technology Hengqin China, New York University Brooklyn US, Institute of Automation, Chinese Academy of Sciences Beijing China, Computer and Information Science, University of Macau Macau China

2026-05-26视觉感知

针对跨被试脑到视觉解码中个体功能错位导致迁移性能下降、重新采集大量 fMRI 代价高的问题,MindAdapter 冻结预训练 BTM 粗对齐骨干,仅学习轻量非线性残差适配器,并用少量共享刺激作拓扑锚点、结合冻结视觉语言解码器的语义约束稳定校准。NSD 实验显示,其在极少共享样本下提升跨被试图像重建与检索准确率,但细粒度结构仍有限,通常需至少 16 个锚点。

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation Figure 1
2026-05-26cs.CV

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

Tsinghua University, Baidu Inc., The Hong Kong University of Science and Technology, Tianjin University, Baidu Inc. Beijing China, The Hong Kong University of Science and Technology Hong Kong China, Tianjin University Tianjin China, Tsinghua University Beijing China

2026-05-26视觉感知

网页图片中的文字翻译同时依赖细粒度字符识别与跨语言语义推理,通用 LVLM 的视觉编码器偏向全局语义,易丢失字形细节。VaaWIT 用语义/细节双流编码与双向注意力融合,并通过轻量 Visual-Aware Adapter 将视觉线索注入冻结 LLM。三套公开基准八项任务上,其超过开源 SOTA,并接近或部分超过 GPT-4.1、Gemini 2.5 Pro。

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing Figure 1
2026-05-26cs.CV

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian

† The Hongkong University of Science and Technology, & ‡ Huawei Inc.

2026-05-26视觉感知生成模型

本文关注指令式视频编辑中 DiT 难以同时理解编辑意图、定位修改区域并保持时序一致的问题,指出根因在于条件 token 不分层、注意力推理只受像素损失间接约束。RVEDiT 通过 MLLM 蒸馏的可学习编辑 token 做浅层粗粒度引导,并在深层接入原生图文 token;训练时再用共享参数参考分支对齐注意力互信息。实验显示其在标准基准上优于现有方法,尤其提升局部与组合编辑效果,且推理无额外开销。

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models Figure 1
2026-05-26cs.AI

AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models

Jialiang Yang, Bin Xia, Ruihang Chu, Dingdong Wang, Wanke Xia, Zhun Mou, Tianyang Zhong, Yiting Zhao, Wenming Yang

2026-05-26视觉感知生成模型数据集/基准

针对音视频生成评测仍依赖粗粒度指标和通用 MLLM、难以发现人类场景中口型、情绪、声画一致性等细微错误的问题,AVBench提出面向人类中心场景的十维自动评测,并用真实视频构造含硬负样本的约30万偏好数据微调专用AV/AT/VT评估器,以Yes/No置信度给出连续分数。实验表明其较现有VQA式或零样本基准更贴近人类判断,并可用于数据过滤和潜在RLHF奖励信号。

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models Figure 1
2026-05-26cs.CV

Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models

Yurou Yang, Muyuan Lin, Roberto Martin-Martin, Martin Labrie, Shreekant Gayaka, Cheng-Hao Kuo, Luca Carlone

Martin Labrie

2026-05-26视觉语言视觉感知

本文针对VLA是否真正缺乏几何理解、GFM应如何注入VLA这一问题,以GR00T-N1.5和VGGT为例做系统实验。核心在于用线性探针量化VLA与GFM的“几何差距”,并公平比较Early Fusion、Late Fusion、Spatial Forcing等注入策略。结果显示,简单微调几何VLA在RoboCasa/LIBERO上相对基线增益不显著,真实G1上仅早期融合在接近阶段明显更好;整体收益可能主要受数据规模、相机数量和重建质量影响。

DisDop: Distillation with Domain Priors for Open-Vocabulary Aerial Object Detection Figure 1
2026-05-26cs.CV

DisDop: Distillation with Domain Priors for Open-Vocabulary Aerial Object Detection

Ruihao Xu, Yong Liu, Yansong Tang, Sule Bai, Xubing Ye, Bingyao Yu, Yutao Guo, Jiwen Lu, Jie Zhou

Tsinghua Shenzhen International Graduate School, Tsinghua University, Tsinghua University

2026-05-26视觉感知

针对无人机航拍与自然图像差异大、标注稀缺导致通用开放词汇检测器迁移效果差的问题,DisDop将RemoteCLIP与DINOv3中的遥感领域先验蒸馏到轻量检测器:融合视觉教师特征,约束视觉特征保持文本类别语义拓扑,并引入全局上下文改善小目标识别。文中称其在DIOR、DOTAv2.0和LAE-80C等开放词汇航拍检测基准上超过既有方法,消融支持各模块有效。

Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction Figure 1
2026-05-26cs.CV

Resolving Ambiguity in Composed Image Retrieval via Calibrated Interaction

Amsisan Tran, Baogh Le, Tuan Kiet Pham, Sui Yang Guang

2026-05-26视觉感知三维

本文针对组合图像检索中“一条查询只对应一个目标”的不合理假设,指出模糊修改语句会导致有效答案被当作假负例且模型过度自信。核心做法是将检索器外接保形预测层,用候选集覆盖率和集合大小刻画不确定性,并在歧义大时通过信息增益选择澄清问题;同时提出 AmbiCIR 基准和用户模拟器。实验称其单轮性能接近 SOTA,在交互预算内更快命中目标,并首次报告该任务的覆盖与校准结果。

Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion Figure 1
2026-05-26cs.LG

Beyond Generative Priors: Minority Sampling with JEPA-Guided Diffusion

Sol Park, Soobin Um

2026-05-26生成模型

论文针对现有少数样本生成只依赖生成模型自身密度、难以反映真实语义稀有性的问题,提出用预训练 JEPA/DINOv2 表征诱导的“世界先验”来引导扩散采样,并用随机化 SVD 等近似降低逐步计算 JEPA 密度梯度的开销。实验覆盖无条件、类别条件、文生图和少步模型,显示其生成的少数样本在保真度与语义有效性上优于生成器中心基线。

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion Figure 1
2026-05-26cs.CV

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

Adam Lee

2026-05-26视觉感知生成模型

DexSIM瞄准现有视频世界模型在灵巧手-物交互中缺少实时性、长期空间一致性和记忆的问题。方法先训练双向视频扩散模型,将手部轨迹、视频与初始3D点统一嵌入,并用高斯热图表征手;再通过自回滚/DMD蒸馏转为因果自回归模型,引入可更新空间缓存作为记忆。实验称其在外观相似度、运动保真和手投影精度上优于基线,并以15.24 FPS支持实时交互,但总体真实感仍受数据和模型规模限制。

ULF-Synth: Physics-Guided Ultra-Low-Field MRI Enhancement for Pediatric Neuroimaging Figure 1
2026-05-26cs.CV

ULF-Synth: Physics-Guided Ultra-Low-Field MRI Enhancement for Pediatric Neuroimaging

Toufiq Musah, Salvatore Calcagno, Federica Proietto Salanitri, Xiaomeng Li, Maruf Adewole, Marawan Elbatel

2026-05-26视觉感知

针对超低场 MRI 便携但信噪比和分辨率低、真实 ULF-HF 配对数据稀缺的问题,ULF-Synth 用 MRI 物理退化过程从高场儿科脑 MRI 合成低场配对样本,并以空间 L1、加权 k-space 一致性和梯度正则联合监督,适配多类生成架构。仅用合成数据训练后,模型在真实 64mT 扫描上仍提升结构相似度、感知质量、下游脑结构分割,并获得盲评放射科医生更高偏好。

Vision-Language Binding in In-Context Image Generation Figure 1
2026-05-26cs.CV

Vision-Language Binding in In-Context Image Generation

Chris Ge, Rohit Gandikota, Antonio Torralba, Tamar Rott Shaham

Northeastern University

2026-05-26视觉语言视觉感知

本文关注 FLUX.2 这类统一注意力的上下文图像生成模型中,参考图像信息究竟如何流向输出。作者通过 T2I Lens、Attention Knockout 和 I2I-to-I2I Patching 做因果干预,发现文本 token 并非只承载提示词,而会吸收参考图的颜色、风格、场景等可语言化属性并影响生成;具体身份、人脸等像素精确信息则主要经图像到图像注意力直达输出,且跨模态绑定集中在文本 padding token。

PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution Figure 1
2026-05-26cs.RO

PoseRefer: Pathway-Local Parameters for Semantically Grounded Reference Resolution

Anna Deichler

KTH Royal Institute of Technology, Stockholm, Sweden

2026-05-26三维

该文面向服务机器人在第三人称视角下理解“把杯子放到那个上面”等指代表达,指出现有3D grounding基准缺少自然共语手势。PoseRefer用MM-Conv数据构建姿态与文本无共享参数的后期融合,并将类别嵌入局部化以隔离消融;结果显示姿态更利于指向样本、文本更利于非指向样本,冻结MiniLM类别嵌入的融合Top-1达31.9%,较姿态单路提升13.1点。

Phase-Aware Wavelet-Based-Scattering Encoder-Decoder for Dense Predictions Figure 1
2026-05-26cs.CV

Phase-Aware Wavelet-Based-Scattering Encoder-Decoder for Dense Predictions

Ghassen Marrakchi, Basarab Matei

2026-05-26视觉感知

论文针对散射变换在分类中有稳定性但因全局平均/下采样丢失像素位置、难用于去噪和分割的问题,提出 stride-1 的相位感知散射编码器-解码器,用局部平滑保留平移等变性,并在跳连中显式传递幅值与相位。BSD68 去噪中,去除不变性带来 +2.17 dB,加入相位再增 +1.03 dB;相位空间打乱导致 −1.26 dB,支持相位携带位置结构信息,但 ISIC 分割仍属初步验证。

Catching MRI outliers: unsupervised detection and localization of MRI artefacts and clinical anomalies using deep learning Figure 1
2026-05-26cs.AI

Catching MRI outliers: unsupervised detection and localization of MRI artefacts and clinical anomalies using deep learning

Mustafa Kadhim, Viktor Rogowski, Emilia Persson, Camila Gonzalez, André Haraldsson, Sofie Ceberg, Mikael Nilsson, Malin Kügele, Sven Bäck, Christian Jamtheim Gustafsson

Medical Radiation Physics, Lund University, Lund, Sweden., Radiation Physics, Department of Hematology, Oncology, and Radiation Physics, Skåne University, Medical Radiation Physics, Department of Translational Medicine, Lund University, Malmö, Sweden, Medical University of Vienna Department of Anesthesia, Intensive Care Medicine, and Pain Therapy, Comprehensive Center for Artificial Intelligence in Medicine (CAIM), Centre for Mathematical Sciences, Lund University, Lund, Sweden, Department of Radiooncology, Rostock University Medical Center, Rostock, Germany

2026-05-26视觉感知

放疗流程中的自动分割、计划等模型容易被采集伪影、协议差异或临床异常等 MRI 分布外输入误导,本文将无异常 MRI 切片先离散化为 token,再学习正常 token 分布,并结合感知重建差异与 token 惊讶度生成异常热图。该无监督框架在盆腔与脑 MRI 上分别取得 AUC 0.97 和 0.81,热图与标注异常位置较一致,显示其可作为放疗 MRI 质控安全层。

Lattice theory and algebraic models for deep convolutional learning based on mathematical morphology Figure 1
2026-05-26cs.AI

Lattice theory and algebraic models for deep convolutional learning based on mathematical morphology

Gustavo (Jesus) Angulo

Mines Paris, PSL University, CMA-Center for Applied Mathematics, Sophia-Antipolis, France

2026-05-26学习理论

论文动机是为经验驱动的 CNN、ResNet 与 UNet 提供可检验的代数解释。核心创新是用格论、数学形态学和 MMBB 表示逐层重写卷积、ReLU、池化与跳连,指出标准卷积+ReLU+最大池化跨越不同格,既非形态学开运算也非幂等,从而解释深度带来的表示力。主要结果包括刻画三类真正幂等层,给出形态学 ResNet 收敛/发散结论,并提出以开运算残差重构尺度的 UResNet;经验增益文中未充分说明。

LC-Flow: Learning Local Continuous Optical Flow and Confidence from events Figure 1
2026-05-26cs.CV

LC-Flow: Learning Local Continuous Optical Flow and Confidence from events

Gunwoo Jeon, Chaesong Park, Jongwoo Lim

2026-05-26生成模型

针对事件相机光流中帧式累积带来延迟和域过拟合、局部方法又缺少时间记忆的问题,LC-Flow在每个局部网格维护连续更新的循环隐状态,可在任意时刻输出稀疏光流,并联合学习置信度以处理稀疏事件和孔径问题;置信度还用于多尺度聚合恢复全局光流。实验显示其在MVSEC、DSEC上达到局部方法SOTA,MVSEC聚合结果超过若干重型帧式密集网络,但DSEC上仍落后于强监督帧式方法。

Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory Figure 1
2026-05-26cs.CV

Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory

Quanjiang Li, Zhiming Liu, Wei Luo, Tingjin Luo, Chenping Hou

2026-05-26学习理论

本文针对多模态大模型在图像描述中产生物体幻觉的问题,指出其不只源于语言偏置,还与类似人类注意分散导致的视觉模糊有关,具体表现为多头注意的空间不一致和解码中视觉注意衰减。作者提出免训练的 AFIP,通过跨头注意增强、历史视觉注意动态融合和门控抑制无关区域,并给出注意分散削弱泛化的理论分析;多模型多基准实验显示其可降低幻觉且无需额外训练。

Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration Figure 1
2026-05-26cs.CV

Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration

XiaoWan Hu, Jing Yang, HeNan Liu, HuaQiu Li, Mai Xu

Beihang University, Tsinghua University

2026-05-26视觉感知

该文针对零样本图像复原在未知、混合退化下依赖隐式特征、采样成本高且固定扩散轨迹易陷入次优的问题,提出 UP-ZeroIR:将噪声、模糊、雾、低光等异质退化重参数化为少量物理一致的分布参数,并在潜空间做分布对齐,同时用质量反馈动态调整采样轨迹。实验显示其在单一与混合退化上优于现有方法,但具体增益对扩散先验与参数化设计的拆分仍需看消融细节。

Physen-Noise2Noise: Physics-Guided Self-Supervised Defocus Deblurring with Bias Correction under Low-Light Conditions Figure 1
2026-05-26cs.CV

Physen-Noise2Noise: Physics-Guided Self-Supervised Defocus Deblurring with Bias Correction under Low-Light Conditions

Ziyan Huang, Lang Wu, Hongji Wang, Yifei Liu, Dongliang Tang, Hongqiao Wang

2026-05-26视觉感知

针对低照度长曝光下离焦模糊与有偏、相关噪声共存,常规自监督去模糊的零均值噪声假设易失效。论文提出 Physen-Noise2Noise,将离焦成像的频域高频衰减约束嵌入 Noise2Noise,并用可学习噪声偏置与多帧噪声初始化联合校正偏差、恢复细节;还给出预训练—微调变体。仿真和真实数据实验显示,其在复杂有偏噪声场景下优于现有自监督方法。

World Models as Group Actions Figure 1
2026-05-26cs.CV

World Models as Group Actions

Zijie Wang, Wei Zhang, Weiming Zhang, Fanqi Zhang, Xiao Tan, Yipeng Qin, Guanbin Li

Sun Yat-sen University, Shenzhen Loop Area Institute, Baidu Inc., Cardiff University, Guangdong Key Laboratory of Big Data Analysis and Processing

2026-05-26强化学习

本文针对视频世界模型“画面真实但未必按动作演化”的问题,提出用动作的群结构刻画动作忠实性:在导航中将动作视为 SE(2) 群作用,并用潜空间正则约束恒等、逆元与组合一致性,同时构造 GAC/GAR 指标评估。实验显示该方法在多个视频世界模型上降低结构不一致和随机 rollout 不稳定性,且基本不损害感知质量。

PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training Figure 1
2026-05-26cs.LG

PILOT: Policy-Informed Learned Optimization for Adaptive Deep Network Training

Sattam Altuuaim, Lama Ayash, Muhammad Mubashar, Naeemullah Khan

King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia, University of Strathclyde, Glasgow, Scotland

2026-05-26强化学习优化算法

针对 Adam、Lion 等优化器更新结构在训练前固定、难以响应梯度稳定性变化的问题,PILOT 用相邻梯度方向一致性作为在线信号,通过小型多项式策略动态调节动量、方差归一化和符号更新比例,在 Adam 式、原始梯度和 sign 更新间插值。FashionMNIST/CIFAR-10 上的 CNN 与 ResNet-18 实验报告其准确率最高,但验证仍限于较小视觉分类任务,大规模与非卷积场景效果文中未充分说明。

EMA: Effort Metric Attention for Anatomical Effort-Guided Human Motion Diffusion Figure 1
2026-05-26cs.CV

EMA: Effort Metric Attention for Anatomical Effort-Guided Human Motion Diffusion

Joshua Siy, Huakun Liu, Yutaro Hirao, Monica Perusquia-Hernandez, Hideaki Uchiyama, Kiyoshi Kiyokawa

Nara Institute of Science and Technology, Ikoma, Nara, Japan

2026-05-26生成模型

本文针对文本到人体动作扩散模型难以精确控制速度、力度且常生成单调动作的问题,引入受 Laban 动作分析启发的 EMA 机制,用峰值关节位移和整体关节位移作为数值化努力信号,通过交叉注意力注入骨架感知潜空间扩散模型,并支持身体部位级调节。实验与用户研究显示,设定的努力强度与生成动作动力学及感知 LMA 描述基本呈单调一致。

PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction Figure 1
2026-05-26cs.CV

PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction

Naman Mishra, Shankar Gangisetty, C. V. Jawahar

2026-05-26视觉语言视觉感知规划控制数据集/基准

面向自动驾驶中行人意图与轨迹预测缺乏统一多模态推理和可解释性的痛点,PedestrianQA将PIE、JAAD、TITAN、IDD-PeD等行人视频序列改写为带结构化理由的问答任务,覆盖空间、时间、场景和自车交互线索,使VLM同时预测与解释。实验显示,在该数据上微调的VLM可提升过街意图分类、轨迹预测精度和理由质量,但具体增益中数据规模与模型能力的贡献仍需进一步区分。

IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring Figure 1
2026-05-26cs.CV

IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring

Xinge Peng, Yiting Lu, Xin Li, Zhibo Chen

2026-05-26视觉语言视觉感知

现有基于 LMM 的图像质量评估多停留在全局描述或单一 grounding,难以定位局部失真并保持推理能力。IQA-Spider 将全局/局部描述、像素级 grounding 与区域 referring 统一为四类任务,构建 IQA-Spider-33K,并用两阶段训练加无需额外监督的 text-to-point grounding 连接文本 logits 与 SAM 点提示。实验称在自建基准、Q-Bench-A1 和 Q-Ground-Test 上表现更强,但具体增益中数据构造与框架设计的相对贡献仍需进一步拆分。

No Figure
2026-05-26cs.CV

Learnable Shape Prototypes with Occlusion-Geometry-Guided Injection for Amodal Instance Segmentation

Fufan Zhang, Jingxiang Wang, Xiangjie Ye

2026-05-26视觉感知

针对无模态实例分割中遮挡区域缺少像素证据、现有形状先验要么受离散码本容量限制要么依赖昂贵生成模型且空间注入一刀切的问题,论文提出 GRASP:用可学习形状原型经交叉注意力组合成实例自适应先验,并用可见掩码 SDF 按遮挡深度门控注入。两项基准上其在多设置超过既有方法,其中一项遮挡区 mIoU 提升超过 11 个百分点,同时参数约为对比方法三分之一。

Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation Figure 1
2026-05-26cs.CV

Image-Conditioned Instance Prompt Network for Referring Remote Sensing Image Segmentation

Biaoyu Ren (1), Qingsheng Wang (1), Cun Xu (1), Dingkang Yang (2), Wenxuan Wang (1 and 3) ((1) School of Computer Science, Northwestern Polytechnical University, Xi'an, China, (2) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, (3) Shenzhen Research Institute of Northwestern Polytechnical University, Shenzhen, China)

† Equal contribution. ∗ Corresponding authors.Code available at: https://github.com/Ren-by/ICIPNet .

2026-05-26视觉感知

本文针对遥感指代表达分割中语言描述粒度不足、语义漂移和常规跨注意力易引入背景/高频词噪声的问题,提出 ICIPNet:由图像上下文动态生成实例提示,使语义提示随不同影像和层级自适应调整,并用 BIF 在 token 与通道维度进行双向融合和重建以抑制噪声。实验在 RefSegRS 与 RRSIS-D 上优于已有 RRSIS 方法,达到 SOTA。

NudgeVAD: Language-Nudged End-to-End Driving via FiLM Residuals Figure 1
2026-05-26cs.CV

NudgeVAD: Language-Nudged End-to-End Driving via FiLM Residuals

Chieh-Chi Yang, Yu-Hsiang Chen, Yi-Ting Chen

National Yang Ming Chiao Tung University

2026-05-26视觉感知

论文关注端到端驾驶中“语言指令为何有时无效”:强 VAD 规划器已有可靠高层命令时,语言与命令存在冗余。NudgeVAD 冻结 VAD,仅用 LLaMA/LoRA 语言分支经 FiLM 预测轨迹残差,并用恒等初始化避免扰动原规划器。实验显示可靠命令下语言相对无条件微调几乎只带来 0.003m ADE 增益;随机命令下文本可将 ADE 从 3.166m 降至 2.806m,并优于无语言微调 0.312m。

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval Figure 1
2026-05-26cs.CL

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

Hao Sun, Yingyan Hou, Jiayan Guo, Bo Wang, Chunyu Yang, Jinsong Ni, Yan Zhang

State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China, School of Intelligence Science and Technology, Peking University, Aerospace Information Research Institute, Chinese Academy of Sciences, Key Laboratory of Target Cognition and Application Technology, Beijing Institute of Technology, 6Ucap Cloud, ument representations. (2) Soft Label Distillation: We, utilize the teacher model to provide a fine-grained label

2026-05-26视觉感知

面向真实文档检索中 OCR 文本管线丢布局、纯视觉方法又难捕捉细粒度语义的问题,Unveil 先训练融合页面截图与 OCR 文本的视觉-文本嵌入模型,再通过表示对齐、软标签蒸馏和自适应重加权把语义能力迁移到仅视觉模型。12 个文本密集与视觉密集数据集实验显示,融合模型优于既有文本或视觉方法,蒸馏后在免解析推理下缩小性能差距并提升效率。

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation Figure 1
2026-05-26cs.CV

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation

Ofir Abramovich, Nadav Z. Cohen, Adi Rosenthal, Ariel Shamir

Canvas-Lab, Department of Computer Science, Reichman University

2026-05-26机器人视觉感知

针对视频扩散模型用文本难以精确控制运动、现有视觉/时序条件方法常需额外训练或推理开销的问题,本文提出 Φ-Noise:在扩散前对噪声做傅里叶分解,将参考视频的低频相位注入噪声并保持能量归一,从而把粗结构和时序动态作为先验传递。实验展示其可用于运动条件、空间条件和 cut-and-drag 生成,在不改模型与流程的情况下达到与复杂方法相当或更好的控制效果;但对真实机器人任务的直接收益文中未充分说明。

FDDet: Achieving Data-Efficient Food Defect Detection Under Real-World Scenarios Figure 1
2026-05-26cs.CV

FDDet: Achieving Data-Efficient Food Defect Detection Under Real-World Scenarios

Ruihao Xu, Yong Liu, Yansong Tang

2026-05-26视觉感知强化学习

面向真实食品质检中缺陷类别细、标注稀缺且场景复杂的问题,本文构建了含13类食品、48类缺陷和实例框标注的FDD-48基准,并提出半监督FDDet:用BBoxMixUp在同类缺陷框内混合以削弱背景/外观伪相关,用CGPC从上下文、视觉和空间一致性校准伪标签。实验显示通用检测器在该数据上易过拟合,而FDDet在有限标注与未标注数据下取得明显优于主流检测器的表现。

FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis Figure 1
2026-05-26cs.CV

FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis

Ruihao Xu, Xingming Shui, Jingxuan Niu, Yiqin Wang, Jilin Yu, Haoji Zhang, Yansong Tang

2026-05-26数据集/基准

针对现有视频异常检测多停留在“正常/异常”分类、难以支撑食品安全合规追责的问题,FoodMonitor提出商用厨房可解释合规分析基准,包含477段视频和3307个违规标注,区分人员与环境两类,并要求规则映射、行为解释和框级责任人定位。论文还设计结构化JSON输出、两阶段匹配与综合C_score评估。多种MLLM测试显示最佳仅0.360,瓶颈主要在空间定位和细粒度规则理解。

EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge Figure 1
2026-05-26cs.CV

EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Guozhi Qiu, Weili Guan, Liqiang Nie

Shandong University, Harbin Institute of Technology (Shenzhen)

2026-05-26视觉感知

针对 HD-EPIC 第一视角厨房 VQA 中不同问题对时间跨度、空间线索和语义推理需求差异很大的问题,EgoAdapt 将难点归因于通用推理配置与异质任务不匹配。方法在推理时按类别选择提示、帧预算和采样率,并结合候选项似然校准、生成一致性及选项置换/验证式 TTA 消歧。在 Qwen3-VL-8B 权重固定下,整体准确率达 67.22%,较 DeepFrames 提升 23.01 个百分点,TTA 消融显示其贡献约 10 个百分点。

EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026 Figure 1
2026-05-26cs.CV

EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026

Zhiheng Fu, Zixu Li, Zhiwei Chen, Fangxu Liu, Yupeng Hu, Weili Guan, Liqiang Nie

Shandong University, Harbin Institute of Technology (Shenzhen)

2026-05-26视觉感知

面向 EPIC-KITCHENS 长时第一视角视频中动作边界易偏移、动词与名词线索失效模式不同的问题,EgoAction 将动作检测拆成动词/名词两路因果时序检测,再用 top-K 组合生成动作,并以分类置信度动态加权融合两路边界,避免固定平均放大定位误差。官方 2026 榜单上取得 25.94 action mAP,verb/noun mAP 分别为 28.66/28.61。

Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs Figure 1
2026-05-26cs.CV

Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu, Zuozhu Liu

Zhejiang University, Zhejiang, China, Guangdong Institute of Intelligence Science and Technology

2026-05-26视觉语言数据集/基准

针对医学 VLM 只看最终答题准确率、难以判断是否依据影像证据推理的问题,Med-R2 构建了按临床流程分层的对抗基准,覆盖图像质量、解剖、病灶到报告生成,并用正/中/负干扰检验鲁棒性。对 14 个模型的评测显示,性能随推理层级递减,病灶级是主要瓶颈;模型易受提示偏置影响,即使有显式视觉线索也常难以精确对齐文本。分步微调能提升鲁棒性,但真实临床场景和 3D 数据适用性仍有限。

Appearance-Invariant Detection of Suggestive Motion via Laban Movement Descriptors on SMPL Skeletons Figure 1
2026-05-26cs.CV

Appearance-Invariant Detection of Suggestive Motion via Laban Movement Descriptors on SMPL Skeletons

Jaehoon Ahn, Jeonghan Kong, Moon-Ryul Jung

Sogang University, Sogang University Seoul South Korea

2026-05-26视觉感知

针对3D社交/虚拟环境中传统NSFW检测过度依赖外观、难以识别“动作本身”挑逗性的盲点,论文将视频重建为SMPL骨架,用Laban运动分析的可解释描述子表征动作质感,并在无像素、服装和体型信息下分类日常、艺术、挑逗、露骨四级动作。逻辑回归在20,514段运动上取得57.3%四分类、72.1%三分类和78.7% SFW/NSFW二分类准确率,主要混淆集中在艺术与挑逗相邻层级。

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026 Figure 1
2026-05-26cs.CV

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie

Shandong University, Harbin Institute of Technology (Shenzhen)

2026-05-26视觉感知

论文针对 EgoCross 中第一视角视频跨手术、工业、极限运动和动物视角时出现的时间边界模糊、语义粒度不一致与近似选项不稳定问题,提出 OmniEgo-R²:在 Qwen3-VL-4B-SFT 上叠加测试时路由推理,包括时间证据归一化、能力路由、结构化推理、选项验证和答案校准;在 Source-Limited 与 Open-Source 赛道分别达到 66.35% 和 66.77% 总准确率,均获第二名。

Robust Fuzzy Multi-view Learning under View Conflict Figure 1
2026-05-26cs.CV

Robust Fuzzy Multi-view Learning under View Conflict

Siyuan Duan, Yuan Sun, Dezhong Peng, Yingke Chen, Xi Peng, Peng Hu

Siyuan Duan, Yuan Sun, and Peng Hu are with the College of Computer, Science, Sichuan University, Chengdu 610065, China., Dezhong Peng is with the College of Computer Science, Sichuan University, Chengdu 610065, China, and also with the Tianfu Jincheng Laboratory, Yingke Chen is with the Department of Computer and Information Sciences, Northumbria University, Newcastle upon Tyne NE1 8ST, UK, Xi Peng is with the School of Artificial Intelligence, Sichuan University, views [14], label noise [15], and view adversarial attacks [16]., methods generally assume that the available views of an

2026-05-26安全鲁棒

针对多视图分类在传感器故障、恶劣天气等场景中出现视图冲突,既误导融合又低估不确定性的问题,论文提出基于模糊集的 R-FUML:用类别隶属度与可信度估计不确定性,并通过 RMF 降权高不确定/冲突视图、RLVC 利用记忆效应识别并惩罚冲突样本。八个公开数据集上相较 15 个基线提升了鲁棒性和不确定性估计。

TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge Figure 1
2026-05-26cs.CV

TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

Zixu Li, Yupeng Hu, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Weili Guan, Liqiang Nie

Shandong University, Harbin Institute of Technology (Shenzhen)

2026-05-26视觉感知

针对第一视角厨房视频检索中仅逐帧使用 CLIP 难以刻画动作时序、且 EK-100 MIR 采用软相关标签的问题,TempRet 在 CLIP 双编码器上加入视频侧轻量时序 Transformer,并用 SMS Loss 学习分级相关性,推理时再以 cross-encoder ITM 对 Top-K 候选重排。其在官方榜单达到 67.97% 平均 mAP、82.92% 平均 nDCG;消融显示主要增益来自时序建模,重排带来较小但稳定提升。

Coarse-to-Fine Domain Incremental Learning with Attentive Distillation for Mining Footprint Segmentation in Multispectral Imagery Figure 1
2026-05-26cs.CV

Coarse-to-Fine Domain Incremental Learning with Attentive Distillation for Mining Footprint Segmentation in Multispectral Imagery

Alif Tri Handoyo, Vincent C.S. Lee, Rizka Widyarini Purwanto, Alex M. Lechner, Deanna Kemp, Muhamad Risqi U. Saputra

Monash University, Indonesia, Monash University, Australia, Northeastern University, China, The University of Queensland, Australia

2026-05-26视觉感知

针对矿区足迹精细分割中高质量边界标注稀缺、粗标注与精标注存在域偏移的问题,论文提出 MineC2FNet,以教师-学生框架在特征和预测层做注意力蒸馏,只选择性继承粗域中可靠知识并用少量精标注细化边界。作者还构建了219张专家验证多光谱数据集;实验显示其在精细域达到92.33% Accuracy、73.64% mIoU,优于多类域适应和增量学习基线。

EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy Figure 1
2026-05-26cs.CV

EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu

College of AI, Tsinghua University, State Key Laboratory of General Artificial Intelligence, BIGAI

2026-05-26三维

面向智能眼镜、AR与机器人中的第一人称感知行动耦合,本文指出现有VQA很少检验身体与物体的三维邻近推理,提出EgoProx基准,按意图、探索、利用和动作链组织任务,并用代理式数据引擎生成QA。实验显示主流MLLM经跨域或任务指令微调有明显增益,说明预训练含潜在空间知识,但仍难稳定用于空间推理VQA。

SILSM: A Sustainable Interactive Level Set Method for Progressive Refinement Figure 1
2026-05-26cs.CV

SILSM: A Sustainable Interactive Level Set Method for Progressive Refinement

Jiachen Song, Dazhi Zhang, Fanghui Song, Zhichang Guo, Shengzhu Shi

2026-05-26视觉感知

针对传统交互式水平集方法对标注位置和参数敏感、难以连续修正,以及深度交互分割依赖数据且多轮结果不稳定的问题,SILSM 将用户引导从分割能量中解耦为独立交互项,并引入四阶正则化稳定演化,配合多轮更新算法实现渐进细化。实验显示其首轮交互已有竞争力,对输入扰动较鲁棒,多轮交互下分割质量可稳定提升。

Benchmarking Composed Image Retrieval for Applied Earth Observation Figure 1
2026-05-26cs.CV

Benchmarking Composed Image Retrieval for Applied Earth Observation

Bill Psomas, Dionysis Christopoulos, Thanasis Petropoulos, Nikos Efthymiadis, Ioannis Kakogeorgiou, Ondřej Chum, Yannis Avrithis, Giorgos Tolias, Konstantinos Karantzalos

2026-05-26视觉感知数据集/基准三维

面向卫星档案检索中“参考图像+文字修改”比单模态查询更贴近灾害、设施和城市变化监测需求的问题,论文统一评测多种组合图像检索方法与六类视觉语言骨干,并提出面向灾损变化的 xView2-CIR。结果显示免训练组合方法已是强基线,但变化检索难点从属性匹配转向保持同一地点身份,易出现“灾害状态对、位置错”的失败。

No Figure
2026-05-26cs.CV

Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects

Denys Iliash, Jiayi Liu, Egor Fokin, Qirui Wu, Ali Mahdavi-Amiri, Manolis Savva, Angel X. Chang

Simon Fraser University

2026-05-26数据集/基准

现有关节物体数据集多停留在静态几何或单自由度运动,缺少可用于真实交互仿真的功能部件、运动依赖和物理属性。Artiverse从多源3D库构建5402个、88类人工物体,补全内部结构并标注多自由度关节、材料、尺度和质量,配合少样本分割、几何推理与人工复核将标注时间降低约三成。实验显示,用其训练可提升部件运动分析和关节物体生成的泛化,同时其复杂结构也暴露现有方法不足。

Dual Prototype-Conditioned Diffusion Model for Scalable Multi-Class Unsupervised Anomaly Detection in Large Category Spaces Figure 1
2026-05-26cs.CV

Dual Prototype-Conditioned Diffusion Model for Scalable Multi-Class Unsupervised Anomaly Detection in Large Category Spaces

Yaoxuan Feng, Yuxin Li, Weijiang Lv, Zixuan Zhao, Yubiao Wang, Wenchao Chen, Bo Chen, Hongwei Liu

2026-05-26视觉感知生成模型

面向类别数从十余类扩展到上百类时,多类无监督异常检测中正常分布异质化、表示混叠和重建“捷径”导致性能下降的问题,论文提出 DPDiff-AD,用局部原型聚合细粒度结构、全局原型经最优传输约束整体几何,并将双原型通过注意力条件化到扩散重建中。在五个基准验证,160 类 Real-IAD Variety 上较 Dinomaly+ 图像级和像素级 AUROC 分别提升 5.3、2.9 点,且推理约 101 FPS。

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation Figure 1
2026-05-26cs.CV

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

2026-05-26视觉感知

论文针对现有 VLM 图像矢量化在干净合成渲染上表现好、遇到不同光栅化后端或文生图退化输入就失稳的问题,提出 VectorArk:用带顶点圆角半径的多边形表示替代冗长 SVG 命令,并采用轮廓优先、颜色后处理、退化合成训练和测试时多候选 DINO 排序。实验显示其在多数据集上几何完整性更好、伪影更少,但能力主要面向中等复杂图形。

SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation Figure 1
2026-05-26cs.CV

SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation

Yuanhe Tian, Yan Song

Zhongguancun Academy, University of Science and Technology of China

2026-05-26强化学习规划控制

针对CT报告生成常把三维体数据直接映射为文本、难以刻画轴向切片证据演化和病灶因素可控性的不足,SliceWorld将CT视为z轴有序序列,学习含解剖、病灶与不确定性的可预测世界状态,并通过未来切片特征预测、反事实病灶干预和LLM世界token生成报告。在M3D-Cap与CT-RATE上,方法提升NLG和临床自动评估指标,并显示多步预测、因素对齐、少切片鲁棒性与病灶敏感调制能力。

Gaussian Rank-Based Neighborhood Degree for Graph Neural Networks in Image Classification Figure 1
2026-05-26cs.CV

Gaussian Rank-Based Neighborhood Degree for Graph Neural Networks in Image Classification

Rafael Mendonça Duarte, Jean Roberto Ponciano, Lucas Pascotti Valem

2026-05-26视觉感知三维

针对图像半监督分类中由特征相似性构图的 GNN 仍用普通度归一化、默认邻居同等重要的问题,论文提出 GRaNDe:按邻居距离排序并用高斯核加权,将邻域质量纳入节点度,且可随训练中的表示更新自适应调整。该度量可直接替换 SGC、APPNP 等模型的标准度归一化;在五个公开图像分类数据集上,多数设置下带来稳定精度提升,并取得与近期方法相当或更好的结果。

SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation Figure 1
2026-05-26cs.CV

SparseWorld: Enhancing End-to-End Autonomous Driving via World Models with Sparse Scene Representation

Ruoyu Wang, Jingke Wang, Yukai Ma, Yuehao Huang, Shuangming Lei, Guanglin Xu, Aixue Ye, Yong Liu

2026-05-26强化学习

针对现有自动驾驶世界模型依赖 dense BEV/视觉预测、计算开销大且信息冗余的问题,SparseWorld 将未来建模限制在关键交通参与者与地图元素等稀疏实例上,通过 Sparse Dreamer 自回归预测未来实例,并用其细化运动预测与规划、再自适应选择轨迹。实验显示其在 nuScenes 开环碰撞率降至 0.05%,相对 SparseDrive 降低 37.5%,在 Bench2Drive 闭环驾驶分数提升 9.9%。

ViViD-5K: Vineyard vision dataset for field-based berry detection and segmentation and grape cluster closure estimation Figure 1
2026-05-26cs.CV

ViViD-5K: Vineyard vision dataset for field-based berry detection and segmentation and grape cluster closure estimation

Xiangzhi Tong, Chengrui Zhang, Mac Flaherty, Andre Matteo Garcia, Dominic Gorman, Jonathan Jaramillo, Justine E. Vanden Heuvel, Yu Jiang

Horticulture Section, School of Integrative Plant Science, Cornell University, Ithaca, NY, USA., School of Electrical and Computer Engineering, Cornell University, NY, USA.

2026-05-26视觉感知数据集/基准

针对田间葡萄果串闭合度评估依赖人工打分、主观且缺少浆果级数据的问题,本文发布 ViViD-5K:含 5000 张田间图像、13 个品种、约64.8万浆果点和果串掩码,并提出结合点定位、SAM 提示分割与 Mask2Former 的 GrapeSAM 流水线。实验显示其在多条件下可较准确完成计数、果串/浆果分割和闭合度时序估计,但小目标和高密度遮挡仍是主要误差来源。

Causal Physics Steering in Video World Models via Concept Activation Vectors Figure 1
2026-05-26cs.CV

Causal Physics Steering in Video World Models via Concept Activation Vectors

Nahid Alam

Oreon Labs, Cohere Labs Community

2026-05-26视觉感知强化学习

面向世界模型在强化学习、自动驾驶等场景中需要可控物理预期的问题,本文提出无需训练的 physics steering:将 VideoMAE 物理涌现层中线性探针权重作为 CAV,在推理时注入隐藏状态。IntPhys 上可双向改变物理可行性判断,效果集中在 PEZ,且物理与运动方向近正交,物理子空间约由 2–3 个方向主导。

Unified 3D Scene Understanding Through Physical World Modeling Figure 1
2026-05-26cs.CV

Unified 3D Scene Understanding Through Physical World Modeling

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Honglin Chen, Khai Loong Aw, Daniel L. K. Yamins

Stanford University, without the need for finetuning by offering precise controllability, strong geomet-, real-world scenarios is difficult because it requires both flexibility and controllability. Most previous, Additionally, achieving strong controllability in generative models has been challenging, motivating, fied framework supporting diverse inference pathways while remaining precisely controllable. We, make this PGM practical and scalable, we formulate it as an autoregressive next token predictor, controllability, strong geometric consistency, and robustness in real-world scenarios, outperforming

2026-05-26强化学习三维

论文针对深度估计、新视角合成和物体操作长期割裂、难以共享物理一致三维表示的问题,提出 3WM:把 RGB、光流和相机位姿作为概率图节点,并用 GPT 式自回归与局部随机访问序列实现统一物理提示。不同任务由不同推理路径零样本产生;实验显示其在真实场景 NVS 和 3D 物体操作上优于专用基线,并支持相机/物体运动组合、遮挡补全和深度不确定性推理。

CoDA: Color Distribution Probing for Efficient and Generalizable AI-Generated Image Detection Figure 1
2026-05-26cs.CV

CoDA: Color Distribution Probing for Efficient and Generalizable AI-Generated Image Detection

Zexi Jia, Zhiqiang Yuan, Xiaoyue Duan, Jinchao Zhang, Jie Zhou, Anil K. Jain

Michigan State University, East Lansing, MI 48824, USA.

2026-05-26视觉感知

针对AI生成图像检测中轻量方法泛化差、VLM方法代价高且跨域评测不足的问题,本文构建含约37万张、62域的FakeForm基准,并提出利用生成图像颜色分布更不均匀这一线索的CoDA。其噪声-量化探针将颜色稳定性转为残差信号,1.48M参数即可检测;实验中跨模型摄影内容平均准确率91.0%,跨域平均77.7%,在效率与泛化间取得较好平衡。

ArtSplat: Feed-Forward Articulated 3D Gaussian Splatting from Sparse Multi-State Uncalibrated Views Figure 1
2026-05-26cs.CV

ArtSplat: Feed-Forward Articulated 3D Gaussian Splatting from Sparse Multi-State Uncalibrated Views

Inseo Lee, Yoonji Kim, Eugene Sohn, Jiwoong Lee, Jungmin You, Joonseok Lee, Jin-Hwa Kim

Seoul National University, Sogang University, NAVER AI Lab

2026-05-26三维

ArtSplat针对关节物体重建依赖密集多视角、相机标定和逐物体优化而难以扩展的问题,提出从稀疏多状态未标定RGB图像一次前向预测3D Gaussian与关节参数。其关键是按像素关节图表示,并用带状态token的跨状态注意力捕捉离散姿态差异。PartNet-Mobility上覆盖68个单双关节物体,几何与关节估计接近或优于基线,速度提升超过400倍。

Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies Figure 1
2026-05-26cs.CV

Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies

Juan Ignacio Bustos Gorostegui, Maria Elena Buemi

Faculty of Exact and Natural Sciences of the University of Buenos Aires

2026-05-26视觉感知

针对第一视角动作识别中相机抖动、手部遮挡和长序列建模成本高的问题,论文将 RGB 视频与手部骨架时序统一到线性复杂度的 Mamba 框架,重点比较四种利用预训练单模态 CLS token 的融合初始化策略。H2O 实验显示,多模态融合优于 VideoMamba 仅视频基线,其中简单平均策略最好,Tiny/Small 配置 Top-1 分别提升超过 10% 和 25%;更复杂的上下文加权未带来额外收益。

Plume Segmentation from MethaneSAT with Cross-Sensor Transfer Learning and Physics-Informed Postprocessing Figure 1
2026-05-26cs.CV

Plume Segmentation from MethaneSAT with Cross-Sensor Transfer Learning and Physics-Informed Postprocessing

Manuel Pérez-Carrasco, Maya Nasr, Zhan Zhang, Apisada Chulakadabba, Javier Roger, Raia Ottenheimer, Sébastien Roche, Maryann Sargent, Chris Chan Miller, Daniel Varon, Jack Warren, Luis Guanter, Kang Sun, Jonathan Franklin, Jia Chen, Cecilia Garraffo, Xiong Liu, Ritesh Gautam, Steven Wofsy

(XCH4). We address two core challenges: the scarcity of labeled, as false positives against our wavelet-based ground truth labels, methane enhancements excluded by conservative labeling crite-, Center for Astrophysics | Harvard & Smithsonian, Cambridge, MA, Department of Earth and Planetary Sciences, Harvard University, Cam-, Research Institute of Water and Environmental Engineering (IIAMA), Institute of Environmental Physics (IUP), University of Bremen, Bremen, John A. Paulson School of Engineering and Applied Sciences, Harvard, University, Cambridge, MA, USA, Department of Aeronautics and Astronautics, Massachusetts Institute of, Institute for Data, Systems, and Society, Massachusetts Institute of Tech-, Department of Civil, Structural and Environmental Engineering, Univer-

2026-05-26视觉感知

面向 MethaneSAT 标注稀缺且需可靠定位单个甲烷羽流的监测需求,论文将问题从像素语义分割转为实例分割,采用 MethaneAIR 跨传感器预训练微调,并加入物理启发后处理形成高召回与高精度两种模式。结果显示 Mask R-CNN/ResNet-50 优于 U-Net,微调策略实例召回达 0.98;后处理后高敏模式精度/召回为 0.71/0.94,高精模式为 0.92/0.70。

CRISP -- Clustering-Based Redundancy-Reduced Instance Sampling for Pathology Case Representation and Retrieval Figure 1
2026-05-26cs.CV

CRISP -- Clustering-Based Redundancy-Reduced Instance Sampling for Pathology Case Representation and Retrieval

Zahra Rahimi Afzal, Wataru Uegami, Saghir Alfasly, Saba Yasir, Judy C. Boughey, Matthew P. Goetz, Krishna R. Kalari, H.R. Tizhoosh

Kimia Lab, Department of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA, DICE Lab, Department of Electrical and Computer Engineering, University of Illinois Chicago, IL, USA, Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, USA, Department of Breast and Melanoma Surgical Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA, Department of Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA, Department of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA

2026-05-26视觉感知

针对病理检索中常以单张病理医生选定 WSI 代表病例、易丢失多切片异质信息的问题,CRISP 提出无监督两阶段采样:先用 SPLICE 在单张 WSI 内去冗余,再跨全病例切片聚类选取紧凑代表 patch,直接构建病例级索引。在 Mayo 乳腺癌诊断与治疗队列上,其 Top-1/Top-3 检索通常达到或超过 Yottixel+病理医生选片,治疗反应预测也优于多种单 WSI 方法,但 Top-5 仍未完全超过最佳人工选片基线。

Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions Figure 1
2026-05-26cs.LG

Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions

Chad Weatherly, Sen Lin

2026-05-26视觉感知数据集/基准

本文针对工业边缘端持续异常检测评测不真实、缺少横向比较且忽视部署成本的问题,构建统一基准,加入结构/逻辑异常、连续漂移协议和Jetson端效率测试。核心洞察是现有CAD方法并不稳定优于带简单回放的传统AD;作者据此提出免训练DINOSaur,用冻结DINOv3、空间索引coreset和局部近邻评分实现零遗忘。结果显示其在五类协议中整体最优,Jetson Orin Nano推理低于100ms,新任务适配低于30秒。

GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer Figure 1
2026-05-26cs.CV

GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer

Diogo Lavado, Alessandra Micheletti, Clàudia Soares

NOVA School of Science and Technology, Portugal and, NOVA School of Science and Technology, Portugal

2026-05-26视觉感知三维

针对3D点云分割模型通常需依赖大模型和大量训练来隐式学习平面、圆柱等基础几何结构的问题,GIBLy提出一种可插拔、架构无关的轻量几何归纳偏置层,用可学习参数化几何先验生成可解释的形状对齐特征。实验覆盖MLP、卷积和Transformer骨干及多个基准,显示稳定提升;在TS40K上结合PTV3最高提升11.5% mIoU,仅增加约58K参数。

Radiuma: A Unified Zero-Code Executable Graphical Workflow Generator for Reproducible and Shareable Medical Image Analysis and Machine Learning Figure 1
2026-05-26cs.CV

Radiuma: A Unified Zero-Code Executable Graphical Workflow Generator for Reproducible and Shareable Medical Image Analysis and Machine Learning

Mohammad Salmanpour, Mehrdad Oveisi, Isaac Shiri, Arman Rahmim

Department of Basic and Translational Research, BC Cancer Research Institute, Vancouver, BC, Canada, Department of Radiology, University of British Columbia, Vancouver, BC, Canada, Technological Virtual Collaboration (TECVICO Corp.), Vancouver, BC, Canada, Department of Computer Science, University of British Columbia, Vancouver, BC, Canada, Department of Cardiology, Inselspital, Bern University Hospital, University of Bern, Bern, Switzerland, Department of Digital Medicine, University of Bern, Bern, Switzerland, Departments of Physics & Biomedical Engineering, University of British Columbia, Vancouver, BC, Canada, Department of Basic and Translational Research, BC Cancer Research Institute, available to the community, design provides a flexible platform for reliable, user-friendly image reading across, in medical image and machine learning analysis. This feature is particularly useful for collaborative research

2026-05-26视觉感知生成模型

针对医学影像组学/机器学习研究需串联多软件、流程难复现且不易共享的问题,Radiuma提出零代码的图形化可执行工作流生成器,将多模态读写、可视化、分割、配准融合、预处理、放射组学特征和分类/回归/聚类建模整合为可连接模块。主要结果是支持保存、运行与共享端到端流程并即时可视化中间输出,但文中未充分说明其相对现有工具的定量性能增益。

Single View Seafloor Recovery from Imaging Sonar via Differentiable Rendering Figure 1
2026-05-26cs.CV

Single View Seafloor Recovery from Imaging Sonar via Differentiable Rendering

Sevan Brodjian, Michael Hobley, Pietro Perona

California Institute of Technology

2026-05-26视觉感知

本文针对前视成像声纳将垂直结构压扁、单视角海底地形恢复高度歧义且多视角/传感器融合成本高的问题,提出无需训练的可微声纳渲染框架,在已知海底基准倾角下直接优化显式高度场匹配观测图像。实验显示其在分布外和传感器/地形变化下优于或接近监督 CNN,分布内则 CNN 更强;方法可在数十秒内重建,但遮挡与单视角歧义仍会导致高度低估。

Filtered Posterior Mean Collections: A Unified Framework for Analytical Models of Diffusion Generalization Figure 1
2026-05-26cs.LG

Filtered Posterior Mean Collections: A Unified Framework for Analytical Models of Diffusion Generalization

Matthew Niedoba, Berend Zwartsenberg, Frank Wood

\AFFS 1 University of British Columbia, Alberta Machine Intelligence Institute

2026-05-26生成模型学习理论

论文针对扩散模型神经去噪器在不同架构下呈现相似泛化偏置、但现有解析近似设计空间零散的问题,提出 FPMC 统一框架,用查询精度、响应权重和源分布三轴刻画基于后验均值聚合的去噪器。作者指出以往二值 patch 假设过硬,改用可学习软权重并增强源分布;在 CIFAR-10、FFHQ 和 AFHQ 64×64 上,相比既有 FPMC 更接近扩散模型样本。

Loki: Representation over Architecture for Diffusion-Based Portrait Animation Figure 1
2026-05-26cs.CV

Loki: Representation over Architecture for Diffusion-Based Portrait Animation

Pouyan Navard, Sernam Lim

The Ohio State University, University of Central Florida

2026-05-26生成模型

针对肖像动画中RGB条件把身份、表情和头姿纠缠在一起、需堆叠多种解耦模块的问题,Loki改用FLAME参数人脸模型生成身份无关的空间驱动图,将表情与姿态送入扩散骨干,并通过预训练特征注入参考身份。其关键洞察是用表示替代复杂架构,使跨身份重演在推理时成为参数替换,无需跨身份训练对;文中报告推理参数减少约43%、训练视频少1496倍,并在头姿轨迹和表情跟随指标上领先或并列领先。

EchoVQA: Enabling Conversational Assistance for Point-of-Care Cardiac Ultrasound Figure 1
2026-05-26cs.CV

EchoVQA: Enabling Conversational Assistance for Point-of-Care Cardiac Ultrasound

Filippos Bellos, Yutong Li, Jessie N Dong, Zaiyang Guo, Emily Mackay, Yayuan Li, Yannis Avrithis, Alison Pouch, Jason J. Corso

2026-05-26视觉感知

面向床旁心超中非专家难以采集和解读标准视图的问题,本文构建 EchoVQA:融合公开与手持探头数据,覆盖不同质量、视图分类、腔室可见性、LVEF 可测性及探头调整建议的多轮问答。作者还用多模态可学习提示做参数高效适配,在 EchoVQA 和多项医学 VQA 基准上达到或接近 SOTA,且可训练参数显著少于全量微调模型。

ImPartial: Multi-channel Whole-Cell Segmentation using Partial Annotations Figure 1
2026-05-26cs.CV

ImPartial: Multi-channel Whole-Cell Segmentation using Partial Annotations

Gunjan Shrivastava, Saad Nadeem

2026-05-26视觉感知

针对多通道病理/显微图像中密集像素标注昂贵、通道配置多变且噪声强的问题,ImPartial用少量前景/背景涂鸦训练U-Net,并将盲点自监督改为多通道量化插补/高斯混合分类损失,使重建目标更服务于前景背景分离和实例分割。在TissueNet、CPDMFCI与IHC实验中,10%–50%涂鸦即可接近或超过多种全监督基线;消融显示涂鸦损失与重建损失均必要。

COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing Figure 1
2026-05-26cs.CV

COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing

Florian Barthel, Shalini De Mello, Koki Nagano, Wieland Morgenstern, Anna Hilsmann, Peter Eisert

2026-05-26三维

针对3DGS头部GAN在发色、眼镜等属性编辑时易牵连身份和外观的问题,COSY将生成器拆成头发、皮肤/脸、眼镜、躯干等独立子分支,仅用稀疏颜色信息学习组件分离,并通过少量共享上下文token维持整体形状与光照一致。实验显示其在实时高分辨率头部合成中比既有GAN编辑方法解耦更好、控制更精确,同时保持有竞争力的视觉质量。

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving Figure 1
2026-05-26cs.CV

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das

University of North Carolina at Charlotte

2026-05-26视觉感知

论文针对单车 VLM 受遮挡和视角限制、现有 V2X 问答缺少协同三维推理的问题,提出 D2-V2X:基于车端与路侧相机/融合 LiDAR 的 8,500 条 QRA 数据,并用 CoT 理由约束模型先解释空间关系再输出结构化决策。其基线将 CenterPoint 3D 特征对齐到 Qwen3-VL,遮挡危险召回达 24.4%、可见物距离误差降 77%、决策 F1 为 53.5,同时指出 3D 到 2D 投影仍是主要瓶颈。

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation Figure 1
2026-05-26cs.CV

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

AXXX, Moscow, Russia 3 Trusted AI Research Center, RAS, Moscow, Russia

2026-05-26数据集/基准

面向机器人近场操作与室内导航中鱼眼相机缺少高精度深度基准的问题,WideDepth构建了101个室内场景、5K高分辨率双目样本,提供毫米级稠密深度/视差,并覆盖不同FOV、基线、水平与垂直双目及针孔配对。论文还用高精度LiDAR扫描和Double Sphere模型生成鱼眼立体数据,支持针孔模型适配;在多类深度模型评测中,18K稀疏LiDAR训练样本微调使鱼眼性能最高提升62%。

Distance-Aware Joint Spatio-Temporal Graph Contrastive Learning for Major Depressive Disorder Diagnosis Figure 1
2026-05-26cs.CV

Distance-Aware Joint Spatio-Temporal Graph Contrastive Learning for Major Depressive Disorder Diagnosis

Muhammad Asif Hasan, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

2026-05-26视觉感知

本文针对 rs-fMRI 动态功能连接在抑郁症诊断中易受滑窗相关噪声、节点特征单一和时空建模割裂影响的问题,提出 HWSTCL:用频谱 ROI 描述符、距离衰减边可靠性修正和 Hawkes 式跨窗连接构建联合时空图,并以匹配的核加权对比学习强化区域时间一致性。实验显示其优于近期基线,但具体增益在多大程度来自各组件仍需消融支撑。

fMRI-Diffusion: Generating fMRI Time Series Via a Temporal Transformer Diffusion Model for Major Depressive Disorder Diagnosis Figure 1
2026-05-26cs.CV

fMRI-Diffusion: Generating fMRI Time Series Via a Temporal Transformer Diffusion Model for Major Depressive Disorder Diagnosis

Muhammad Asif Hasan, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

2026-05-26生成模型

针对 MDD 诊断中标注 fMRI 稀缺、传统增强只生成 FC 矩阵而丢失时序结构的问题,论文提出 fMRI-Diffusion:先用带监督预训练的 Temporal Transformer 作为 DDPM 去噪器合成 ROI 级 fMRI 时间序列,再计算 FC 用于分类。在 REST-meta-MDD 上,该增强在 10 个分类器、6 种脑图谱和 3 个站点均提升诊断表现,较最强 FC 合成基线最高提升 3.7 个百分点,分布差异指标低于 0.06。

EMMA: Extracting Multiple physical parameters from Multimodal Data Figure 1
2026-05-26cs.CV

EMMA: Extracting Multiple physical parameters from Multimodal Data

Farhat Shaikh, Ayan Banerjee, Sandeep Gupta

IMPACT Lab, School of Computing, Arizona State University

2026-05-26视觉语言

针对仅靠视频难以观测受遮挡状态、隐藏驱动和未知坐标/初值而导致物理参数反演不适定的问题,EMMA将视频、音频与图表时序统一到物理约束的连续时间模型中,用LTC学习潜在动力学并联合估计显式参数、隐式动力项和校准不变量。在100多个场景、75个Delfys视频及真实 rover/四旋翼等实验中,文中报告其多参数恢复优于单模态和方程发现基线。

Learning to See Like Humans: Gaze-Aligned Cycling Safety Prediction Figure 1
2026-05-26cs.CV

Learning to See Like Humans: Gaze-Aligned Cycling Safety Prediction

Luís Maria Perdigão, Miguel Costa, Carlos Santiago, Manuel Marques

comparisons of street-view images provide a scalable way to, Institute, Technical University of Denmark, Kongens Lyngby, Denmark., enable scalable ranking of environments, they do not explicitly, • We make available a dataset of 13,623 labeled pairwise, level imagery, with near-global coverage becoming available, further improve scalability by letting models learn relevant, localizing safer/unsafe areas [11], [24], [22] through scalable

2026-05-26安全鲁棒

城市骑行推广受“看起来是否安全”的主观感知限制,而仅用街景成对比较训练的模型难解释其关注区域。论文提出 EG-PCS-Net,在孪生 ViT 的成对安全排序中加入眼动监督,使自注意力与人类注视对齐。结果显示其分类/排序性能与强基线相当或略有稳定提升,但在 AUC、NSS、CC、EMD 等显著改善注意力— gaze 一致性,主要贡献在可解释性而非大幅精度跃升。

Mode-as-Sequence: Translating Multimodal Motion Prediction into Unified Sequential Mode Modeling Figure 1
2026-05-26cs.CV

Mode-as-Sequence: Translating Multimodal Motion Prediction into Unified Sequential Mode Modeling

Zikang Zhou, Haibo Hu, Xinhong Chen, Yifan Zhang, Nan Guan, Yung-Hui Li, Chun Jason Xue, Jianping Wang

City University of Hong Kong, City University of Hong Kong (Dongguan), Hon Hai Research Institute, Mohamed bin Zayed University of Artificial Intelligence

2026-05-26视觉语言

针对自动驾驶多模态轨迹预测中单一真实未来导致的模式坍缩、候选重复和置信度排序不稳,论文将无序轨迹模式改写为有序“模式序列”,用 ModeSeq 建模模式间依赖,并以 Parallel ModeSeq 通过因果掩码注意力并行解码;配合 EMTA/MA-EMTA 和排序正则提升覆盖与校准。实验显示其在多数据集、预测时域和目标类型上改进 best-of-K 与排序指标,并分别获得 Waymo 2024 LiDAR-free 运动预测和 2025 交互预测挑战第一。

Towards Large Model Feature Coding Figure 1
2026-05-26cs.CV

Towards Large Model Feature Coding

Youwei Pang, Changsheng Gao, Dong Liu, Huchuan Lu, Weisi Lin

2026-05-26视觉感知

论文针对大模型分布式/拆分执行中间特征传输与存储成本高、且特征形态远比传统 CNN 激活更异构的问题,提出将大模型特征编码(LaMoFC)作为独立基础问题,并构建覆盖4类16场景的 LaMoFCBench,统一拆分点、码率、失真与下游任务评测。基准结果显示,现有通用特征编码器与多模态、多层级、KV/缓存等大模型特征分布明显不匹配,说明该方向需要新的编码范式。

No Figure
2026-05-26cs.CV

Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

Zhe Cheng, Wenyu Chen, Fode Zhang, Dehuan Shen

2026-05-26视觉语言视觉感知

针对大视觉语言模型即使关注图像仍会被文本先验主导、产生不受图像支持的幻觉这一问题,论文提出无需训练的 Causal Route Gating:在注意力头内拆分视觉/文本路由,用一次前向加一次梯度估计当前 token 的因果效应,识别冲突且文本主导的头,只抑制文本路由而保留视觉证据。五个判别与生成基准上,该方法降低多模型幻觉相关错误,对整体多模态性能影响有限,但需白盒梯度且有解码开销。

Soft Tuy-Completeness for Robust Projection Selection in Cone-Beam CT Figure 1
2026-05-26cs.CV

Soft Tuy-Completeness for Robust Projection Selection in Cone-Beam CT

Linda-Sophie Schneider, Andreas Maier

Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany

2026-05-26安全鲁棒

针对ROI锥束CT中传统Tuy完备性过于二值、难以在遮挡和投影预算约束下指导选角的问题,论文提出连续的软近正交评分与分辨率感知饱和覆盖目标,并用子模贪心和MILP给出近似与最优性证书。实验覆盖6个目标区和多种遮挡条件,贪心/MILP目标中位比达0.998,ESR指标也与重建质量稳定相关。

Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments Figure 1
2026-05-26cs.CV

Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments

Van Quang Nguyen

2026-05-26视觉感知

本文面向让智能体同时理解视觉与语言并与环境交互的目标,围绕图像描述、视觉对话和交互式指令执行三类任务展开。核心做法包括用GRIT融合网格与区域特征并以DETR替代Faster R-CNN、用轻量LTMI建模多输入交互,以及在ALFRED中采用两阶段指令解析、多视角和层级注意力。结果显示图像描述在精度和速度上优于既有方法,VisDial验证有效,ALFRED未见场景成功率达8.37%。

MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization Figure 1
2026-05-26cs.CV

MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization

Zhong Wang, Zukang Xu, Xing Hu, Dawei Yang

2026-05-26优化算法

面向大规模视觉语言模型在边缘设备上难以部署的问题,MGVQ关注超低比特向量量化中的两类误差来源:图文模态导致的权重异质性,以及仅用 Hessian 补偿时忽略一阶梯度漂移。方法通过全局/局部敏感度做结构化混合精度分配,并融合梯度与 Hessian 进行误差补偿。实验在 LLaVA-OneVision、InternVL2、Qwen2-VL 等模型上验证,2-bit 下相对现有 PTQ 方法最高提升约 4.9 个点。

SkySeg: Collaborative Onboard Semantic Segmentation with Heterogeneous UAVs in the Wild Figure 1
2026-05-26cs.CV

SkySeg: Collaborative Onboard Semantic Segmentation with Heterogeneous UAVs in the Wild

Anqi Lu, Yun Cheng, Youbing Hu, Zhiqiang Cao, Jie Liu, Zhijun Li

2026-05-26视觉感知

面向灾害监测等需机载实时语义分割的无人机场景,SkySeg针对单机算力受限和野外分布漂移问题,提出异构多无人机空空协同框架:高空领机获取低清广域图像,低空从机采集高清局部图像,并通过信息融合推理与跨设备测试时自适应联合提升效率和鲁棒性。实验显示其推理延迟约加速3.6倍,机载分割精度提升5.91%,野外平均精度增益10.91%。

Deep Learning-Based Automated Quantification of TIMI Myocardial Perfusion Frame Count (DL-TMPFC) from Coronary Angiography: A Novel Framework for Rapid Assessment of Microvascular Dysfunction Figure 1
2026-05-26cs.CV

Deep Learning-Based Automated Quantification of TIMI Myocardial Perfusion Frame Count (DL-TMPFC) from Coronary Angiography: A Novel Framework for Rapid Assessment of Microvascular Dysfunction

Si Li, Yuanqing He, Chenkai Hu, Xiaogang Guo, Huay-Cheem Tan, Chieh Yang Koo, Xuan Zhang, Lei He, Jingyuan Zeng, Shan Xiao

School of Artificial Intelligence and Digital Economy Industry, Guangzhou Institute of Science and Technology, Guangzhou, China, Department of Cardiology, Second Affiliated Hospital, Jiangxi Medical College, Nanchang University, Nanchang, China., Department of Cardiology, First Affiliated Hospital of Zhejiang University School of Medicine, Hangzhou, China., Department of Cardiology, National University Heart Centre, Singapore., reference standards but are constrained by complexity, cost, and limited availability2. The TIMI Myocardial, calculation requires frame-by-frame identification of contrast entry and clearance. It is a labor-intensive, observer-, intervention (PCI) at the Second Affiliated Hospital of Nanchang University (Nanchang, China), the First Affiliated, Hospital of Zhejiang University School of Medicine (Hangzhou, China) and the National University Heart Centre

2026-05-26视觉感知

针对冠脉微血管功能障碍诊断依赖侵入式检查或主观 TIMI 分级、手工 TMPFC 费时且观察者相关的问题,论文提出 DL-TMPFC:先用狭窄检测排除阻塞性 CAD,再以冠脉供血区域分割和帧选择模块自动计算造影剂灌注帧数。在三中心 655 例数据上,其与专家手工测量高度一致(偏差 -0.93 帧,r=0.98),并可用于 CMVD 识别和连续严重度量化。

ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models Figure 1
2026-05-26cs.CV

ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models

Arash Akbari, Arman Akbari, Masih Eskandar, Qitao Tan, Yixiao Chen, Jingwu Luo, Bertha Pangaribuan, Liyun Zhang, Jennifer Dy, Geng Yuan, Xue Lin, Gaowen Liu, Stratis Ioannidis, Yanzhi Wang

2026-05-26视觉语言视觉感知

面向VLA机器人模型难以在边缘设备部署的问题,论文指出普通LLM量化指标无法反映动作闭环敏感性,提出ActQuant:按权重矩阵的动作相关性分配混合比特,并用动作感知曲率优化块尺度,同时配套OmniModel.cpp低比特C/C++运行时。LIBERO上可在≤3 bpw保持约95%成功率,OpenVLA-OFT压到2.5 bpw仍有90.1%,骨干从14.3GB降至2.7GB;UR3实机上π0.5内存降2.5倍且成功率基本不降。

CAFD: Concept-Aware DNN Fault Detection using VLMs Figure 1
2026-05-26cs.LG

CAFD: Concept-Aware DNN Fault Detection using VLMs

Amin Abbasishahkoo, Mahboubeh Dadkhah, Lionel Briand

Amin Abbasishahkoo is with the School of EECS, University of Ottawa

2026-05-26视觉语言视觉感知

论文针对 DNN 测试中标注预算有限、现有混合故障检测方法计算开销大的问题,提出 CAFD:用模型输出、 uncertainty/距离特征,并借助 VLM 提取图像文本概念,构造概念失败率 CFR 来补充语义线索。实验在 CIFAR-10/100 与 ImageNet 的三个模型上优于五个基线,平均 FDR 提升 18.3%,低预算下优势更明显,且 ImageNet 排序约 840 秒。

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving Figure 1
2026-05-26cs.AI

Reason--Imagine--Act: Closed-Loop LLM Decision Making with World Models for Autonomous Driving

Zhengqi Sun, Yiwen Sun, Boxuan Liu, Tailai Chen, Tianxu Guo, Jiabin Liu

2026-05-26强化学习

论文针对自动驾驶中 LLM 只做语义推理、缺乏车辆动力学约束而可能产生不安全决策的问题,提出 Reason–Imagine–Act:让 LLM 生成意图和候选子动作,再由动作条件世界模型短时滚动预测,并用安全评分选择可执行动作、反馈给下一轮推理。在 CARLA 1000 回合点目标导航中,RIA 达到 80.05% 路线完成率、51.10% 到达率和 0.20% 碰撞率,较无世界模型验证的 LLM 及 CARLA TM、MADA 等训练免费基线更稳。

Remote sensing data imputation using deep learning for multispectral imagery Figure 1
2026-05-26cs.CV

Remote sensing data imputation using deep learning for multispectral imagery

Shuang Liua, Fiona Johnson, Rohitash Chandra

2026-05-26视觉感知

针对光学卫星在湖泊水质监测中因云遮挡产生缺测、可能漏检藻华的问题,本文在PlanetScope SuperDove八波段影像上比较线性插值与多种CNN及CNN-LSTM类深度模型,并用人工云掩膜评估补全效果。结果显示深度学习整体显著优于线性插值,多数湖泊中简单CNN平均RMSE最低,补全后Green/Red和NDCI等藻华指数也更接近观测值;但高波长尤其NIR误差更大,增益主要来自空间光谱模式学习。

Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL Figure 1
2026-05-26cs.CV

Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL

Junyi Wu, Weijian Luo, Haoyang Zheng, Ruizhe Zhang, Guang Lin

Purdue University, hi-lab, Xiaohongshu Inc.

2026-05-26强化学习

针对一阶段文生图生成器中“只在终图加奖励、却在扩散轨迹上做匹配”导致的奖励过拟合与保真下降,论文提出 Didr:把 KL-RLHF 得到的奖励倾斜干净图分布沿噪声轨迹扩散,并用 DRS/DRP在各噪声层传播奖励梯度。实验显示其在一阶段 SDXL 上取得更优 PickScore–FID 权衡,长训版将 PickScore 提至 23.9、ImageReward 提至 1.10,并在 6B Z-Image 上单步超过 50 步教师的偏好指标。

IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning Figure 1
2026-05-26cs.CV

IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning

Chenghao Li, Fusheng Hao, Xikai Zhang, Likang Xiao, Yanwei Ren, Fuxiang Wu, Quan Chen, Liu Liu

Hangzhou International Innovation Institute, Beihang University, School of Artificial Intelligence, Beihang University, Shenzhen Institute of Advanced Integration Technology, Shenzhen

2026-05-26强化学习

该文针对多模态大模型在长链视觉推理中因文本化代理与原始图像信息不对称而产生的视觉 grounding 侵蚀、幻觉和逻辑漂移,提出 IVR-R1 强化学习框架:先用奖励筛出错误 rollout 并定位逐步视觉偏离,再通过 Re-Reasoning Loop 重新对齐原图并修正轨迹,生成高质量示范用于策略优化。实验称在 MMMU、MathVista、MathVerse 等六个基准上优于现有多模态 RL 方法,说明直接视觉重锚定比纯文本抽象更有效。

Brain-to-Image Retrieval and Reconstruction via Multimodal EEG Alignment Figure 1
2026-05-26cs.CV

Brain-to-Image Retrieval and Reconstruction via Multimodal EEG Alignment

Chi Kit Wong, Yan Liu, Haowen Yan

2026-05-26视觉语言视觉感知三维

本文面向脑机接口中的视觉解码难题,尝试从自然图像观看时的 EEG 同时完成检索与重建。核心做法是把 EEG 与更接近人类早期视觉的多尺度模糊、EVNet 图像特征对齐,并在重建中对齐图像、文本、深度、边缘等 CLIP 表征以驱动 SDXL-Turbo。单被试 THINGS-EEG2 上,200 选 1 检索 Top-1 达 86.30%、Top-5 达 98.55%,重建 CLIP Score 最高 0.903、SSIM 0.409,但泛化到多被试的效果文中未充分说明。

Task-Aligned Self-Supervised Learning for Medical Image Analysis: A Systematic Review and Practical Design Guidelines Figure 1
2026-05-26cs.CV

Task-Aligned Self-Supervised Learning for Medical Image Analysis: A Systematic Review and Practical Design Guidelines

Chathura Wimalasiri

2026-05-26视觉感知

针对医学影像标注昂贵且 ImageNet 迁移易失配的问题,本文系统综述2017–2025年75项SSL研究,核心不是按架构罗列,而是提出“前置任务—模态—下游临床目标”对齐视角。结论显示不存在通用最优SSL:对比学习更适合分类的全局判别特征,生成/空间预测更利于分割等密集任务,混合方法较均衡,SSL收益主要在低标注与少样本场景。

RAW: Robust Avatar Watermarking -- Benchmarking and Baseline Figure 1
2026-05-26cs.CV

RAW: Robust Avatar Watermarking -- Benchmarking and Baseline

Jack Parry, Jack Saunders, Vinay Namboodiri

University of Bath, UK

2026-05-26数据集/基准安全鲁棒

针对数字人视频上线前常见的换背景、裁剪/缩放和转码会破坏通用水印的问题,论文提出 RAW 基准:含 5 家商业平台的 50 段合成头像视频与 6 类真实工作流攻击,并比较 7 种水印方法。其洞察是头像水印应绑定人脸几何而非整帧像素,基线 WALT 通过 3D 人脸重建在 UV 纹理空间嵌入水印,在缩放攻击上达 92.4% 最高鲁棒性,背景移除为 95.6%,但压缩鲁棒性仍低于部分低容量方法。

Nano World Models: A Minimalist Implementation of Future Video Prediction Figure 1
2026-05-26cs.CV

Nano World Models: A Minimalist Implementation of Future Video Prediction

Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

a Tsinghua University b Carnegie Mellon University, c University of Bristol d University of Oxford e Amazon FAR

2026-05-26视觉感知强化学习

这篇论文针对世界模型研究难以复现、组件分散且不便做受控比较的问题,提出 Nano World Models:以 diffusion forcing 为核心的轻量模块化未来视频预测框架,统一支持不同生成目标、模型规模、动作注入、潜空间、数据集和长时域 rollout。实验覆盖控制环境、CS:GO 与 RT-1 机器人数据,显示其可生成较可信长序列,但误差会自回归累积;采样步数、模型规模和任务复杂度显著影响质量,语义潜空间未必有利于可控规划。

A World Model of Radiologist Reading for Medical Image Representation Learning Figure 1
2026-05-26cs.CV

A World Model of Radiologist Reading for Medical Image Representation Learning

Yiwei Li, Zihao Wu, Huaqin Zhao, Yifan Zhou, Chao Cao, Dajiang Zhu, Tianming Liu, Lin Zhao

University of Georgia, University of Texas at Arlington, New Jersey Institute of Technology

2026-05-26视觉感知强化学习

针对医学影像标注稀缺和模型缺乏可解释证据链的问题,论文提出 GazeWorld:把胸片视为“世界”、放射科医生注视序列视为其中的轨迹,用按凝视顺序的潜表示自回归预测和未访问区域补全来预训练表征。冻结特征在 CheXpert、RSNA、SIIM-ACR 的九种监督设置及三项零样本评测中取得最佳结果,并在 GazeSearch 上显著优于专用扫视路径模型。

Parameter Efficient Multi-Class Intelligent Scheduling for Multimodal Online Distributed Industrial Anomaly Detection Figure 1
2026-05-26cs.LG

Parameter Efficient Multi-Class Intelligent Scheduling for Multimodal Online Distributed Industrial Anomaly Detection

Heqiang Wang, Weihong Yang, Zheyuan Yang, Jia Zhou, Xiaoxiong Zhong, Fangming Liu, Weizhe Zhang

2026-05-26视觉语言视觉感知

针对工业异常检测中多模态数据由边缘设备持续产生、集中离线训练难以扩展的问题,论文提出 MODIAD 在线分布式框架,将跨类别模型更新建模为多类智能调度问题,并用 SMG 贪心算法选择客户端-类别对;同时引入 REC-LoRA 降低每类训练的计算与通信开销。在 MVTec 3D-AD 与 Eyecandies 上,相比基线取得更好的检测性能和资源效率。

In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models Figure 1
2026-05-26cs.AI

In Search of the Ingredients of Open-Endedness: Replicating Picbreeder with Large Vision-Language Models

Sam Earle, Kay Arulkumaran, Andrew Dai, Akarsh Kumar, Julian Togelius, Sebastian Risi

New York University, New York University Brooklyn New York USA, New York University New York New York USA

2026-05-26视觉语言视觉感知

为检验AI能否进行无目标的开放式发现,论文用前沿视觉语言模型替代人类用户复现 Picbreeder,把其作为研究开放性要素的“模型生物”。核心洞察是系统性操控探索噪声、历史记忆和多代理人格,并用谱系复杂度、视觉/语义新颖性评估。结果显示少量噪声提升多样性但损害图像质量,过长历史会诱发病态行为,多代理扩大探索却可能传播噪声或对抗性图像,整体仍弱于人类基线。

2026-05-25

109 篇
Geo-Align: Video Generation Alignment via Metric Geometry Reward Figure 1
2026-05-25cs.CV

Geo-Align: Video Generation Alignment via Metric Geometry Reward

Zizun Li, Haoyu Guo, Runzhe Teng, Chunhua Shen, Tong He

Shanghai AI Lab

2026-05-25视觉感知强化学习

针对视频重拍中真实同步多视角数据稀缺、监督微调易产生域偏移和尺度漂移的问题,Geo-Align 将相机控制视频生成改为后训练强化学习:用度量3D估计器从生成视频反推相机轨迹,按旋转和平移误差给几何奖励,并结合真实条件视频与缩放后的合成轨迹及审美奖励。实验在 DAVIS 的 10 类轨迹上显示,其相机跟随精度和视觉质量均优于现有监督基线。

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion Figure 1
2026-05-25cs.CV

PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

Yifan Lu, Qi Wu, Jay Zhangjie Wu, Zian Wang, Huan Ling, Sanja Fidler, Xuanchi Ren

in the audience, conductor’s stand labeled

2026-05-25生成模型

针对高分辨率生成中传统 VAE 解码器偏重重建、细节合成弱且常需“低清解码+超分”级联导致慢和耗显存的问题,PiD 将潜变量到像素的解码改写为条件像素扩散,把解码与上采样合并;其 sigma 感知适配器可接入带噪潜变量并支持提前终止 latent diffusion,DMD2 蒸馏后仅 4 步推理。实验显示可将 512×512 潜表示解码到 2048×2048,RTX 5090 上低于 1 秒、13GB 峰值显存,GB200 上 210ms,约比级联超分管线快 6 倍且视觉细节更好。

ETCHR: Editing To Clarify and Harness Reasoning Figure 1
2026-05-25cs.CV

ETCHR: Editing To Clarify and Harness Reasoning

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

The Chinese University of Hong Kong, Shanghai AI Laboratory, Shanghai Jiao Tong University, Shanghai Innovation Institute

2026-05-25视觉感知

针对多模态模型仅用文本思维链难以处理细粒度关注、视角变换等视觉推理的问题,ETCHR将专用图像编辑器与理解模型解耦,让编辑器根据问题生成有助推理的中间图像,并通过监督模仿、基于VLM奖励的强化优化和推理时验证来减少错误编辑传播。实验覆盖感知、图表、逻辑、拼图和3D任务,分别使Qwen3-VL-8B、Gemini-3.1-Flash-Lite和Kimi K2.5平均Pass@1提升4.82、5.47和4.61点。

From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain Figure 1
2026-05-25cs.CV

From Activation to Causality: Discovery of Causal Visual Representations in the Human Brain

Yuval Golbari, Navve Wasserman, Matias Cosarinsky, Roman Beliy, Aude Oliva, Antonio Torralba, Michal Irani, Tamar Rott Shaham

Weizmann Institute of Science, Massachusetts Institute of Technology

2026-05-25视觉感知

针对仅凭 fMRI 激活强度难以区分真实概念表征与共现线索的问题,论文提出 BrainCause,用生成/检索图像、语义负例和反事实编辑构造受控刺激,并结合 image-to-fMRI 编码模型做因果特异性检验。其在 260 个视觉概念上恢复人脸、身体、场景、文字等已知功能区,并发现手、腿、标志、工具等候选表征;同时显示超过 70% 高激活定位在因果评估下可能是假阳性。

Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers Figure 1
2026-05-25cs.CV

Good Token Hunting: A Hitchhiker's Guide to Token Selection for Visual Geometry Transformers

Shuhong Zheng, Michael Oechsle, Erik Sandström, Marie-Julie Rakotosaona, Federico Tombari, Igor Gilitschenski

University of Toronto & Vector Institute, Technical University of Munich

2026-05-25视觉感知

针对视觉几何 Transformer 在多视图 3D 重建中因全局注意力随帧数和 token 数二次增长而难以扩展的问题,GoToHunt 将加速表述为限制每个 query 可访问的 key/value token,并提出训练无关的两阶段选择:先用多样性准则保留覆盖场景的帧,再按注意力熵进行层自适应帧内剪枝。实验显示在 500 张图像场景中可将 VGGT 推理时间降低超过 85%,同时基本保持甚至偶尔提升重建性能。

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework Figure 1
2026-05-25cs.CV

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li

2026-05-25视觉感知

该文面向免掩码视频物体插入中参考图与场景风格差异大、位置推理和时序一致性难兼顾的问题,提出 Smart-Insertion-V:用图像风格迁移流同步引导视频插入流,并以闭环反馈细化生成;DGM 结合 VLM 做空间/风格推理、T5 保留运动先验,Dual-RoPE 用时空偏移隔离条件以减轻风格泄漏。实验称可更合理放置物体并获得更协调的视觉效果,但具体增益与数据规模贡献仍需看完整评测。

HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction Figure 1
2026-05-25cs.CV

HorizonStream: Long-Horizon Attention for Streaming 3D Reconstruction

Chong Cheng, Peilin Tao, Nanjie Yao, Guanzhi Ding, Xianda Chen, Yuansen Du, Xiaoyang Guo, Wei Yin, Weiqiang Ren, Qian Zhang, Zhengqing Chen, Hao Wang

2026-05-25三维

面向机器人/自动驾驶中的因果在线三维重建,论文指出长序列漂移、抖动和尺度崩溃源于现有记忆机制按“新近性”统一传播几何证据。HorizonStream 将其形式化为证据影响核,结合带通道衰减的几何线性注意力、局部3D匹配与度量读出 token,在常内存、线性时间下处理超万帧序列;实验称仅用48帧训练即可在多数据集达到流式重建SOTA。

GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction Figure 1
2026-05-25cs.CV

GenRecon: Bridging Generative Priors for Multi-View 3D Scene Reconstruction

Katharina Schmid, Nicolas von Lützow, Jozef Hladký, Angela Dai, Matthias Nießner

Technical University of Munich, Computing Systems Lab, Huawei Technologies, Switzerland

2026-05-25生成模型三维

针对多视角 RGB 场景重建在遮挡、弱纹理和稀疏观测下易产生噪声、缺失且难以用于内容创作的问题,GenRecon 将重建改写为带条件的 3D 生成:把室内场景切成重叠空间块,并用基于投影的多视角特征提升机制把带位姿图像对齐到 Trellis.2 生成先验中,从而生成带 PBR 材质的可编辑网格。实验称相较前沿重建方法高保真指标提升约 16%。

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs Figure 1
2026-05-25cs.CV

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

2026-05-25视觉语言

针对 MLLM 在左右、计数、相对深度等细粒度视觉 grounding 上易依赖语言先验的问题,PGT 在真实训练图像上程序化叠加彩色框、点和计数标记,生成低成本且无歧义的几何监督,用抽象任务迫使模型学习空间关系。实验显示该数据增强可跨多种骨干提升关系、数量和 3D/深度基准,LLaVA 指令调优最高在 What’sUp 提升约 20%、CV-Bench-2D 提升 13.3%,说明瓶颈更可能来自监督信号不足而非单纯架构或分辨率限制。

LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation Figure 1
2026-05-25cs.CV

LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation

Bo Jiang, Depu Meng, Yihan Hu, Yichen Xie, Tianshuo Xu, Wei Zhan

University of California, Berkeley

2026-05-25视觉感知

针对视频生成虽画面逼真却常违背重力、接触和形变等物理规律的问题,LaMo主张从原始无标注视频中自监督提取帧间潜变量差分,形成潜在运动先验,并以训练时的Motion Drift Loss和采样时的Motion Prior Guidance接入现有扩散骨干。实验显示其在VideoPhy/VideoPhy2上提升CogVideoX并超过部分外部监督物理方法,在VBench上基本保持总体质量且改善运动相关指标。

Vision Transformers Need Better Token Interaction Figure 1
2026-05-25cs.CV

Vision Transformers Need Better Token Interaction

Linxiang Su

University of Szeged

2026-05-25视觉感知

本文针对 ViT 长训练中图像级表征变强、patch 表征却不利于分割等密集任务的退化现象,指出问题不只是高范数异常 token,而是全局语义过度扩散到局部 token 的优化捷径。作者以 entmax-1.5 替代 softmax,在保留全局连接的同时让注意力更稀疏选择;在 DINOv1 ViT-S/16 上基本保持 ImageNet 线性探测精度,并将 VOC mIoU 从 42.80 提升到 48.78,ADE20K 和 Cityscapes 也有提升。

Leveraging Foundation Models for Causal Generative Modeling Figure 1
2026-05-25cs.LG

Leveraging Foundation Models for Causal Generative Modeling

Aneesh Komanduri, Xintao Wu

University of Arkansas, University of Arkansas Fayetteville Arkansas USA

2026-05-25生成模型

针对因果生成建模依赖专门训练、难以统一完成概念发现—干预—反事实生成的问题,本文提出 FM-CGM,将推理型 VLM 用作概念提取与因果操纵器、SDXL 用作生成器,并用基于交叉注意力的 CSG 让干预影响后代概念同时约束不变区域。实验在 CelebA-HQ 与 MS-COCO 上显示,CSG 相比 DDIM/DDPM 反演取得更高 VLM 有效性和更低 LPIPS,但评估规模较小,因果结构真实性仍主要依赖 VLM 判断。

Learning a Particle Dynamics Model with Real-world Videos Figure 1
2026-05-25cs.CV

Learning a Particle Dynamics Model with Real-world Videos

Chanho Kim, Suhas V. Sumukh, Li Fuxin

Oregon State University

2026-05-25视觉感知强化学习

针对粒子动力学模型依赖仿真和真实3D状态标注、难以跨越 sim-to-real 的问题,论文将高斯泼溅中的稠密 Gaussian 直接作为带尺度和旋转的粒子,用多视角可微渲染损失和2D分割掩码从未标注真实视频学习多物体碰撞动力学。主要结果是发布约500段四视角方块倒塌与保龄球交互数据,并展示模型可生成对应3D Gaussian rollout;具体定量增益文中未充分说明。

MuellerPT: Decomposition Driven Pretraining for Dense Learning in Mueller Polarimetry Figure 1
2026-05-25cs.CV

MuellerPT: Decomposition Driven Pretraining for Dense Learning in Mueller Polarimetry

Adam Tlemsani, Yingdian Li, Maxime Giot, Naim Slim, Christopher J. Peters, Abhijeet Ghosh, Daniel S. Elson

2026-05-25视觉感知

针对 Mueller 矩阵偏振成像在医学组织分析中标注稀缺、跨样本和采集条件域移明显的问题,MuellerPT 将 Lu-Chipman 物理分解参数预测作为预训练任务,并构建 MAP-Org 多光谱动物器官数据集学习可迁移的稠密表征。少样本实验显示,其在羊脑灰白质分割中用 5% 数据较从零训练 DICE 绝对提升超 20%,结直肠癌分类中用 1% 数据准确率提升 8%,但部分增益可能也来自新增预训练数据规模。

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval Figure 1
2026-05-25cs.CV

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

University of Illinois at Urbana-Champaign

2026-05-25视觉感知

针对长视频问答中证据帧难以验证且逐帧描述成本高的问题,论文提出 ToolMerge:由 LLM 规划器把查询拆成多个轻量视觉工具调用,并用布尔逻辑合并各工具排序来检索关键帧;同时构建按时间片段锚定的 M2M 基准以隔离评测检索能力。实验显示其在长视频 QA、问题检索和字幕检索上与既有方法相当,其中字幕检索约提升 5%,RL 后训练还能进一步改善检索,但强 SigLIP 单工具基线也很有竞争力。

Not Too Generative, Not Too Discriminative: The Human Alignment Sweet Spot Figure 1
2026-05-25cs.CV

Not Too Generative, Not Too Discriminative: The Human Alignment Sweet Spot

Jorge Chang Ortega, Bastien Le Lan, Thomas Serre, Victor Boutin

Brown University, ANITI

2026-05-25生成模型

论文针对生成式与判别式视觉模型谁更符合人类感知的争论,指出既有比较常混入架构、规模和数据差异。作者用同一架构下的联合能量模型,通过单一系数连续调节生成/判别目标,在六类人类对齐基准上隔离训练目标影响。结果显示最佳对齐普遍出现在混合区间而非两端,兼顾类别结构与输入分布敏感性,并提升光泽判断、人类不确定性、形状偏置和分布外一致性。

Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models Figure 1
2026-05-25cs.LG

Debiased Negative Mining Improves Out-of-distribution Detection with Pre-trained Vision-Language Models

Bo Peng, Jie Lu, Guangquan Zhang, Zhen Fang

University of Technology Sydney

2026-05-25视觉语言视觉感知

本文针对基于 CLIP 等预训练视觉语言模型的事后 OOD 检测中“负标签挖掘”易混入伪负类的问题:现有方法用启发式相似度从野外词库选负标签,可能造成打分偏置。作者借鉴正-未标注学习,构建校正负标签采样偏差的理论框架,并将其实现为仅依赖 ID 标签和未标注语料的蒙特卡洛/重要性采样策略。多组 OOD 基准实验显示该方法达到新的 SOTA。

No Figure
2026-05-25cs.CV

Exploring deep learning for Event-Based Saliency Prediction with a Transformer-based model

Romaric Mazna, Jean Martinet, Sai Deepesh Pokala

2026-05-25视觉感知

事件相机具备低延迟、高动态范围和稀疏时序感知优势,但显著性预测长期缺少大规模标注与强基线。论文提出 SEST,用事件预训练 Swin Transformer 加 CNN 解码器生成动态显著图,并用 ESIM 从 DHF1K、UCF Sports 构造 N-DHF1K 与 N-UCF Sports。实验显示其优于既有事件显著性方法,并在真实事件数据零样本测试中具备一定迁移性;但性能提升可能部分来自合成数据规模扩展。

Machine learning applied to emerald gemstone grading: framework proposal and creation of a public dataset Figure 1
2026-05-25cs.CV

Machine learning applied to emerald gemstone grading: framework proposal and creation of a public dataset

FB Pena, D Crabi, Sandro C Izidoro, Érick O Rodrigues, G Bernardes

stones, where those are visually inspected by specialists that decide which one of the available reference stone is the most, Laboratory of Robotics, Intelligent and Complex, Department of Academic Informatics (DAINF), Universidade, Supervised learning consists of analyzing labeled, capable of producing labels for unlabeled instances [22, ald stones after training with previously labeled emerald, have access to the label or class information. Clustering, k-Means starts off with randomized cluster centers, asso-, centers. This process is repeated several times until conver-

2026-05-25数据集/基准

针对祖母绿分级依赖宝石学家比对参考石、易受光照和主观判断影响的问题,论文提出从封闭采集箱成像、背景分割、纹理/边缘统计特征到机器学习分类的自动化框架,并发布含192张图像及特征的公开数据集。实验中多层感知机最高达98%准确率,优于所测深度学习方案,K-means约91%;但数据仅覆盖8类而非完整15类,泛化仍受限。

A Novel Approach for the Counting of Wood Logs Using cGANs and Image Processing Techniques Figure 1
2026-05-25cs.CV

A Novel Approach for the Counting of Wood Logs Using cGANs and Image Processing Techniques

João VC Mazzochin, Giovani Bernardes Vitor, Gustavo Tiecker, Elioenai MF Diniz, Gilson A Oliveira, Marcelo Trentin, Érick O Rodrigues

Institute of Technological Sciences, Universidade Federal de Itajubá (UNIFEI), Itabira 35903-087, MG, Brazil, Business School, Universidade Federal do Paraná (UFPR), Curitiba 80060-000, PR, Brazil, created and made publicly available a comprehensive database of 466 images containing, scalable, addressing key limitations of existing automated systems.

2026-05-25视觉感知生成模型

针对木材堆场仍依赖人工计数、易低效且不安全的问题,本文用Pix2Pix/cGAN将桉木端面分割为“年轮/非年轮”,再结合数学形态学去噪与连通域计数,并发布466张、约1.3万根原木数据集。实验报告平均计数准确率约96.4%/92.3%,F1为0.879–0.933,单图处理0.713秒,显示其可用于较实时的林业库存场景。

No Figure
2026-05-25cs.CV

PhotoFlow: Agentic 3D Virtual Photography Missions

Jiarui Guo, Haojia Wei, Yiming Zhang, Yifei Liu, Yuning Gong, Hongjie Zhang, Xue Yang, Zhihang Zhong

Shanghai Jiao Tong University, Northeastern University, University of California, Los Angeles, Cornell University, Shanghai AI Laboratory, Sichuan University

2026-05-25生成模型三维

本文关注语言条件下的虚拟摄影:智能体需在任意 Blender 3D 场景中选择可执行相机位姿,同时满足空间约束与审美意图。核心创新是将拍摄建模为闭环搜索,提出 Director-Reviewer-Reflector 架构,并构建含 47 场景、141 任务的 VPhotoBench。实验显示在六轮渲染预算下,PhotoFlow 相比一次预测、反思链、锚点选择和随机搜索取得更高外部质量对齐与成功率。

No Figure
2026-05-25cs.CV

Revitalizing Dense Material Segmentation: Stabilized Vision Transformers and the Generalization Paradox

Allan Kazakov, Duygu Cakir, Hilal Kurt İrfanoğlu, Yavuz İrfanoğlu

2026-05-25视觉感知学习理论

论文针对 Apple-DMS 材质分割长期停滞、通用分割模型偏几何而不懂材质的问题,重新恢复数据索引并评估 SegFormer/Mask2Former。核心洞察是密集纹理场会导致 ViT 训练不稳,需用高保真 logit 投影、查询熵正则和物理一致增强;SegFormer-B5 在原始划分达 0.4572 mIoU,同时指出 80/10/10 划分虽升至 0.5276,却可能因分布同质化削弱真实泛化。

No Figure
2026-05-25cs.CV

Weierstrass Positional Encoding for Vision Transformers

Zhihang Xin, Rui Wang, Xitong Hu, Xiaojun Wu

Zhihang Xin and Xitong Hu are with the School of Mathematics and Data Science, Jiangnan University, Wuxi 214122, China, e-mail: {1131230221

2026-05-25视觉感知

论文针对 ViT 将二维图像 patch 展平成一维序列后,位置编码缺乏几何约束、难以保持空间距离关系的问题,提出 Weierstrass 椭圆位置编码 WePE:把归一化二维坐标映射到复平面,并用 Weierstrass ℘ 函数及其导数构造紧凑四维特征。其双周期与格点结构提供分辨率无关、可推导相对位置且具距离衰减的几何归纳偏置;实验称在预训练和微调场景中多数情况下带来一致提升,并可用查表实现,额外开销不明显。

CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models Figure 1
2026-05-25cs.CV

CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models

León Begiristain, Olaf Dünkel, Adam Kortylewski

University of Freiburg, Max Planck Institute for Informatics, CISPA Helmholtz Center for Information Security

2026-05-25视觉感知数据集/基准

该文针对视频生成模型是否真正学到物理因果结构而非表面视觉相关性的问题,提出 CRONOS 反事实物理一致性基准,在 Unreal Engine 中固定碰撞、下落、遮挡等事件类型,系统干预视角、场景、物体类别和外观,并用对象稳定性与物理合理性指标诊断模型。实验显示,当前开源视频模型在简单物理事件上仍频繁失效,且对视角、物体类型等变化高度敏感;V2V 通常优于 I2V,但模型规模增大并不必然带来一致性提升。

No Figure
2026-05-25cs.CV

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

Harvard University, Zhejiang University, Nanyang Technological University, University of Minnesota - Twin Cities, Work done during a research internship at Harvard University.Corresponding author.

2026-05-25视觉感知三维

针对单目动态三维重建中刚性模型时序稳定但难捕捉短时非刚性细节、逐帧方法又易不一致的问题,RiGS将4D高斯分解为静态、刚性与瞬态三类,并用对象级动态掩码、刚性到瞬态的时长驱动转换及场景流监督联合优化多尺度运动。实验显示其在多个动态新视角合成基准上取得SOTA,兼顾重建质量与时间一致性。

Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models Figure 1
2026-05-25cs.CV

Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models

Maxim Henry, Adrien Deliège, Sébastien Piérard, Marc Van Droogenbroeck

2026-05-25视觉感知

针对从头训练大容量视觉模型计算开销高、以往模型增长方法常忽略窄模型预训练成本的问题,论文提出 RBDC:递归地独立训练窄模型,并用无参数的块对角耦合与零填充交互项初始化更宽模型,从而在总训练预算内分配 FLOPs。ImageNet 上对 DeiT 与 ResNet 可在相近精度下降低最高约 30% 训练 FLOPs,并优于若干增长式训练协议;作为 COCO 检测与分割骨干也达到持平或更好表现。

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception Figure 1
2026-05-25cs.CV

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

2026-05-25视觉语言视觉感知

针对多模态大模型处理高分辨率图像时易丢失小目标细节的问题,CVSearch提出无需训练的认知式“先评估再搜索”框架:先用视觉专家快速定位,失败后切换到语义感知扫描,并用SGAP生成语义一致patch、结合视觉复杂度和自底向上搜索减少冗余与碎片化。实验显示其在高分辨率基准上取得SOTA精度,同时较扫描式方法提升搜索效率。

ExpOS: Explainable Open-Surgery Skills Assessment Using 3D Hand Reconstruction Figure 1
2026-05-25cs.CV

ExpOS: Explainable Open-Surgery Skills Assessment Using 3D Hand Reconstruction

Roi Papo, Idan Smoller, Shlomi Laufer

2026-05-25三维

针对开放手术训练中专家评分成本高、反馈不透明的问题,ExpOS从RGB视频重建3D双手姿态并检测器械,用MS-TCN++建模手—器械时序动态,结合注意力定位关键片段和SHAP解释全局运动特征。其在221段三类任务视频上与专家评分相关性较强,筋膜闭合任务最佳达到r=0.778、R²=0.74,但对手部可见性和重建质量较依赖。

DualMem: Bypassing the Objectness Bottleneck for Calibrated Unknown-Stream Filtering in Open-World Object Detection Figure 1
2026-05-25cs.CV

DualMem: Bypassing the Objectness Bottleneck for Calibrated Unknown-Stream Filtering in Open-World Object Detection

Yingjun Xiao (a), Xi Chen (b), Gang Fang (c), Siyuan Chen (b) ((a) School of Artificial Intelligence, Guangzhou University, Guangzhou, China, (b) School of Computer Science and Cyber Engineering, (c) Institute of Computing Science and Technology, China)

2026-05-25视觉感知强化学习

论文指出开放世界检测器的未知预测流被背景和已知类误报严重污染,根因不是缺少信息,而是物体性标量头压缩掉了可分辨的提案特征。DualMem以冻结SigLIP特征构建正/负kNN记忆,用Neyman–Pearson校准做后处理过滤,无需重训检测器。它在PROB、OW-DETR、HypOW上将背景型假未知每图减少44.9%–66.3%,未知召回仅小幅下降且已知类mAP不变。

DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs Figure 1
2026-05-25cs.CV

DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs

Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler

Technical University of Munich (TUM), TUM University Hospital, Munich Center for Machine Learning (MCML), Aalto University, Imperial College London

2026-05-25视觉语言数据集/基准

针对现有医疗 VLM 基准只给定完整证据并评分最终诊断、难以发现“猜对但证据不足”和低效检查的问题,DDx-TRACE 将神经放射诊断建模为隐藏证据下的逐轮工作流:模型需自由请求影像、更新概率性鉴别诊断并决定何时停止。基于 211 个医师标注病例的评测显示,当前 VLM 的最终诊断分数常高估真实工作流质量,主要短板在证据获取、图像解读和不确定性更新。

No Figure
2026-05-25cs.CV

EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation

Jente Vandersanden, Matheus Gadelha, Chun-Hao P. Huang, Hyeonho Jeong, Yulia Gryaditskaya

Max Planck Institute for Informatics, Max Planck Institute for Informatics Saarbrücken Germany and Adobe Research London UK

2026-05-25视觉感知

多镜头视频生成需要长期保持角色/场景一致,但用整帧记忆会把临时背景与实体外观纠缠,导致无关元素泄漏且注意力开销高。EM-Vid的核心是训练-free地把记忆改为按实体索引的稀疏潜变量patch库,并用结构化脚本检索相关实体、预算化更新记忆及边界噪声抑制干扰。在20个多镜头脚本评测中,文中显示其提升文本遵循和推理效率,同时维持跨镜头主体与场景一致性。

GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes Figure 1
2026-05-25cs.CV

GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes

Beibei Lin, Xiao Cao, Jingyuan Guo, Robby T. Tan

National University of Singapore

2026-05-25生成模型三维

GlowGS针对夜间强光晕区域缺少纹理和边缘、导致3DGS新视角出现重影和亮斑的问题,引入扩散模型生成候选新视角,并用DINO/CLIP等视觉基础模型筛选与提取语义特征库,再以最近语义特征约束无真值的新视角渲染训练。在新建NightGlow数据集上,方法可接入多种3DGS基线,相比MGS报告PSNR提升1.78,并减轻光晕伪影。

No Figure
2026-05-25cs.LG

Cost-Effective Model Evaluation with Meta-Learning

Trinh Pham, Viet Huynh, Hongzhi Yin, Quoc Viet Hung Nguyen, Thanh Tam Nguyen

2026-05-25数据集/基准

面对新模型不断涌现而目标数据常无标签的问题,论文将“评估模型”改写为跨模型的元学习任务:用已评测参考模型构建 MetaDataset,学习可迁移的性能估计器 MetaEvaluator,并在 Text2SQL 与图像分类中适配未见架构。实验显示其在无需逐模型标注或反复微调的情况下,能给出更稳定的准确率估计并显著降低评测成本。

Calibration-Informative Region Selection for Online LiDAR--Camera Calibration in Agricultural Environments Figure 1
2026-05-25cs.CV

Calibration-Informative Region Selection for Online LiDAR--Camera Calibration in Agricultural Environments

Rajitha de Silva, Grzegorz Cielniak

under Grant 10041179. All authors are with Lincoln Institute for Agri-Food, Technology, University of Lincoln, UK. Corresponding Author: Rajitha de

2026-05-25视觉感知

面向农业机器人长期部署中振动、温漂等导致的 LiDAR–相机外参漂移,本文指出并非所有跨模态对应都同样有用,提出基于密集校准支持图的在线标定框架,将初始估计、残差提取、支持估计与加权细化解耦。BLT 与 KITTI 实验显示支持具有明显空间和语义非均匀性,刚性结构更可靠;在 KITTI 上可提升平移精度与稳定性,但旋转增益有限。

No Figure
2026-05-25cs.CV

PathNavigate: A Training-Free Pathology Agent with Surprise-Guided Scan and Shared Slide Memory for Whole-Slide Image VQA

Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li

School of Comp. Science & Technology, Xi’an Jiaotong University, Tencent Jarvis Lab, University of Cambridge

2026-05-25视觉感知

本文针对全切片病理 VQA 中“先按问题检索”容易漏掉未被问题显式命名的关键形态、且推理开销大的问题,提出无需训练的 PathNavigate。其核心是先低倍扫描并用在线共享记忆构建切片特异的 surprise 异常区域先验,再在候选池内按 PLIP 问题相关性选高倍证据,最后复用同一记忆辅助回答。在 WSI-VQA 与 SlideBench-BCNB 上,方法提升了回答准确率、证据轨迹可解释性,并相对 PathAgent 降低存储与 token 预算。

Generator-Refiner-Examiner: A Tri-Module Data Augmentation Framework for 3D Human Avatar Learning from Monocular Videos Figure 1
2026-05-25cs.CV

Generator-Refiner-Examiner: A Tri-Module Data Augmentation Framework for 3D Human Avatar Learning from Monocular Videos

Gangjian Zhang, Jian Shu, Sicheng Yu, Wenhao Shen, Yu Feng, Hao Wang

Nanyang Technological University, Nanyang Technological University Singapore

2026-05-25视觉感知三维

针对单目视频帧数少、姿态和视角覆盖不足导致3D人体头像细节与泛化受限的问题,论文提出TrioMan:先用高斯扰动生成新姿态/相机样本,再以纹理和几何条件的一步扩散细化伪图像,并用双分支注意力Examiner筛除不一致样本。基于3DGS与SMPL-X,在X-Humans和NeuMan上优于现有方法,尤其改善衣纹、服装连接和伪影。

No Figure
2026-05-25cs.CV

PixIE: Prompted Pixel-Space Low-Light Image Enhancement

Ruirui Lin, Guoxi Huang, David Bull, Nantheera Anantrasirichai

2026-05-25视觉感知

低光图像增强难点在于噪声、对比度缺失与语义歧义耦合,直接影响检测、跟踪等下游视觉任务。PixIE的核心思路是在像素空间引入DINOv3语义先验:先做跨尺度去噪,再用DPPB将多层DINO特征转为连续的逐像素调制,并用MRPE与SCC兼顾局部上下文和计算成本。实验显示其在LLIE基准上相较近期方法平均PSNR提升1.9%–15.0%,LPIPS降低8.5%–44.4%,细节与纹理恢复更稳定。

ComPose: When to Trust Hands for Object Pose Tracking Figure 1
2026-05-25cs.CV

ComPose: When to Trust Hands for Object Pose Tracking

Jisu Shin, Junoh Lee, JunGyu Lee, Inhwan Bae, Dohyeon Lee, Hokyun Im, Youngwoon Lee, Hae-Gon Jeon

2026-05-25视觉感知三维

针对单目 RGB 中手持物体 6DoF 跟踪易受手部遮挡、且依赖深度或 CAD 模板的问题,ComPose 将手从“遮挡物”转为互补运动线索:自适应选择有信息量的手关节,用门控融合手/物体相对旋转,并用可见几何修正平移、约束时序一致性。实验显示其在重遮挡和几何歧义下更稳健,生成轨迹还能直接迁移到真实机器人操作。

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models Figure 1
2026-05-25cs.LG

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

Peking University

2026-05-25生成模型强化学习

本文关注流匹配生成模型在线强化学习后训练中,随机采样器既决定策略探索又影响去噪轨迹的问题。作者指出少步数下已有 Euler/CPS 采样会带来过量噪声或边缘分布偏差,提出 Precise:用 logSNR 设计探索日程,并通过冻结干净潜变量后验均值获得 SDE 一致的闭式转移。实验在 SD3.5-M、FLUX.2 上显示其 PickScore、HPSv2.1 等对齐指标达到或优于基线,并以少 13.1–53.2% 训练时间匹配既有最佳域内表现。

VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset Figure 1
2026-05-25cs.CV

VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset

Zhizhou Chen, Shanyan Guan, Zhanxin Gao, En Ci, Yanhao Ge, Wei Li, Zhenyu Zhang, Jian Yang, Ying Tai

Nanjing University, China

2026-05-25视觉感知数据集/基准

现有指令图像编辑多面向1K以下分辨率,直接处理4K会出现噪声、模糊和高频纹理丢失。VINS-120K从真实超高清视频构造12万组4K编辑三元组,并用多阶段质量、指令一致性和美学过滤保留高质量样本,同时提出高频感知后适配与VINS-4KEval评测。基于FLUX.1-Kontext-dev适配后,4K细节真实性和指令遵循提升,相比Seedream4.0的pFID降低28%,但收益可能主要来自数据规模与高频监督共同作用。

No Figure
2026-05-25cs.GR

DrawVideo: Generating Long Video from Storyboard Keyframe Sketches

Chuanzhi Xu, Huiqi Liang, Bang Shi, Huiming Zhang, Yifan Xiao, Guangcheng Lin, Haodong Chen, Qiang Qu, Zhicheng Lu, Weidong Cai

The University of Sydney, NSW 2006, Australia, Charles Sturt University, NSW 2800, Australia

2026-05-25视觉感知

针对长视频生成中单一文本提示难以精确控制分镜构图、角色姿态与局部运动的问题,DrawVideo将创作拆成由黑白草图、外观提示和运动提示共同约束的可控分镜,并以参考关键帧、派生动作关键帧和相邻关键帧视频合成逐步生成长视频;同时构建SketchLongVideo数据集。实验显示其在结构可控性、外观一致性、镜头内稳定性和长视频连贯性上优于现有方案。

MDS-DETR: DETR with Masked Duplicate Suppressor Figure 1
2026-05-25cs.CV

MDS-DETR: DETR with Masked Duplicate Suppressor

Chanho Lee, Seunghee Koh, Yunho Jeon, Junmo Kim

Korea Advanced Institute of Science and Technology (KAIST), Daejeon 34141, South Korea, Department of Artificial Intelligence Software, Hanbat National University, Daejeon 34158, South Korea

2026-05-25视觉感知

针对 DETR 一对一匹配正样本少、收敛慢,而现有一对多辅助解码器训练开销高且推理丢弃的问题,MDS-DETR 将一对多与一对一监督合入单解码器,并用基于置信度排序的因果遮罩自注意力注入非对称性,学习抑制重复候选。COCO 12 epoch、R50 下较 Deformable-DETR 提升 2.8 mAP且训练仅增 5%,较 MR.DETR 高 0.3 mAP并快约 20%。

No Figure
2026-05-25cs.CV

B-GRTO: Bootstrapped Group Relative Tool Optimization for Referring Segmentation

Mario Markov, Stefan Maria Ailuro, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel (INSAIT, Sofia University "St. Kliment Ohridski")

INSAIT, Sofia University “St. Kliment Ohridski”

2026-05-25视觉感知优化算法

本文针对指代表达分割中“语言推理难、分割工具也需适配”的耦合问题,指出仅用 GRPO 更新多模态策略而冻结解码器会浪费可微工具信号。作者提出 GRTO 复用策略 rollout 同时优化工具损失,并用 BTO 先低成本预对齐解码器形成 B-GRTO。实验覆盖遥感、伪装目标和推理分割,较纯 GRPO 明显提升,并可匹配或超过部分领域 SoTA。

Multimodal Distribution Matching for Vision-Language Dataset Distillation Figure 1
2026-05-25cs.CV

Multimodal Distribution Matching for Vision-Language Dataset Distillation

Jongoh Jeong, Hoyong Kwon, Minseok Kim, Kuk-Jin Yoon

Visual Intelligence Lab., KAIST

2026-05-25视觉语言视觉感知数据集/基准

针对大规模图文数据训练成本高、现有多模态数据集蒸馏依赖轨迹匹配且易受架构偏置影响的问题,论文提出 MDM:在联合嵌入空间聚类初始化合成图文对,用多微调专家的权重插值构造教师,并在单位超球面上匹配图文一致与差异方向的分布,同时保持对比对齐。图文检索实验显示,其能以更低蒸馏开销生成紧凑数据集,并在跨架构评测中保持较稳健性能。

PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Prediction Figure 1
2026-05-25cs.CV

PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Prediction

Yu Luo, Xiaogang Zhu, Shan Zeng, Wei Xiang, Thomas Francis Bishop, Zhiyong Wang, Kun Hu

School of Computer Science, The University of Sydney, NSW 2006, Australia, School of Computer Science and Information Technology, Adelaide University, SA 5005, Australia, College of Mathematics and Computer Science, Wuhan Polytechnic University, Wuhan, China, School of Computing, La Trobe University, NSW 2000, Australia, School of Science, Edith Cowan University, WA 6027, Australia

2026-05-25视觉感知

面向现有作物产量预测多为单作物、跨作物和跨区域泛化弱的问题,PhenoYieldNet将遥感与气象时序纳入统一多作物框架,通过作物物候库和物候注意力显式建模不同作物对长期趋势与短期波动的响应,并用时序对比适配遥感基础模型。实验显示其在多作物数据上优于单作物和多作物基线,尤其在天气波动区域更稳健。

Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks Figure 1
2026-05-25cs.CV

Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks

Mehdi Gharbage, Céline Teulière, Pierre Bouges, Thierry Chateau

2026-05-25视觉感知

针对工业检测中自然图像预训练是否仍适用、DINOv3等视觉基础模型能否改进密集缺陷识别的问题,本文在RGB表面缺陷与X-ray检测的分割/检测任务上,系统比较ConvNeXt的DINOv3蒸馏预训练、监督ImageNet预训练及ResNet-50,并区分冻结与全量微调。结果显示DINOv3并非通用即插即用特征:冻结时优势不稳定,但在RGB任务充分微调后收敛更快、性能更好;遇到X-ray模态偏移时,ImageNet预训练仍更可靠。

One-Forcing: Towards Stable One-Step Autoregressive Video Generation Figure 1
2026-05-25cs.CV

One-Forcing: Towards Stable One-Step Autoregressive Video Generation

Jiaqi Feng, Justin Cui, Yuanhao Ban, Cho-Jui Hsieh

Tsinghua University

2026-05-25视觉感知

本文针对自回归视频生成在每块仍需多步去噪、压到一步后易出现运动变弱和画面模糊的问题,指出视频教师轨迹在高噪声端存在曲率集中,使纯一致性蒸馏难以单步近似。One-Forcing 将 DMD 分布匹配与基于真实视频潜变量的 GAN 判别信号结合,并复用 fake-score Transformer 作为判别器,抑制自回归误差累积。其在 VBench 得分 83.76,达到一步因果视频生成 SOTA,并以约三分之一训练成本稳定实现逐帧一步自回归。

Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention Figure 1
2026-05-25cs.CV

Efficient One-Step Diffusion Restoration Model with Compact Token Compression and Linear Attention

Bingtian Qiao, Yue Shi, Yingjie Zhou, Yong Guo, Guangtao Zhai, Jiezhang Cao

Shanghai Jiao Tong University, Fuzhou University, Shanghai AI Laboratory

2026-05-25生成模型

本文针对真实图像超分中生成式方法因密集潜变量和二次注意力导致高分辨率推理昂贵的问题,指出瓶颈主要在 token 冗余与交互成本。提出 SANA-SR:用 32×深压缩自编码器减少 latent token,在线性注意力 DiT 上以 LoRA 做一步恢复,并加入先验对齐与结构化剪枝。实验称其在多基准上质量具竞争力、纹理更清晰,剪枝后 344M 参数、407.95G MACs、0.019s 推理,面向移动部署更可行。

Commutator-Induced Uncertainty in VAEs Figure 1
2026-05-25cs.LG

Commutator-Induced Uncertainty in VAEs

Tahereh Dehdarirad, Michael Felsberg, Gabriel Eilertsen, Ziliang Xiong

Computer Vision and Learning Systems (CVL), Linköping University, Sweden, Department of Science and Technology, Linköping University, Sweden

2026-05-25生成模型安全鲁棒

本文针对 VAE 与对称感知 VAE 常把潜在变换强行交换化、从而低估非交换生成因素带来的重建不确定性的问题,提出两阶段 Lie Group VAE:先用 BCH 偏差和顺序交换重建测试诊断潜在非交换性,再以数据校准的变形稳定约束对齐解码器敏感度,并分离离散与连续因素。在 dSprites、3DShapes、3DCars 和 CelebA 上,方法改善重建质量,使顺序依赖行为更符合潜在代数结构。

No Figure
2026-05-25cs.CV

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

2026-05-25视觉感知

面向视频 DiT 中 3D 全注意力计算量过高、现有块稀疏在高稀疏率下易损画质的问题,论文指出注意力具有动态且细粒度的稀疏结构,并用注意力召回下界分析关键因素。DFSAttn 通过 3D Hilbert 重排、层级块评分与自适应掩码缓存,在免训练条件下更准确选择稀疏块;在 HunyuanVideo、Wan2.1 上高稀疏场景优于既有方法,最高实现约 2.1× 端到端加速并保持生成质量。

No Figure
2026-05-25cs.CV

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

Kakia Panagidi, Stathes Hadjieftymiadis

2026-05-25视觉感知

面向 IoT 摄像网络等算力/能耗受限场景,论文针对块运动估计计算开销大的瓶颈,提出 FAST-ME:用最优停止理论根据时空差异提前终止冗余搜索,并引入 ViT、SAM 等基础模型的语义注意力,与 SAD 等失真指标融合,使重要区域继续精搜、背景区域早停。实验称在基准和多模态视频上最高减少 99% 计算量,精度损失较小且语义覆盖更好,但具体增益来源仍需结合实现细节判断。

Sample-wise Targeted Adversarial Attacks on Test-time Adaptation Figure 1
2026-05-25cs.LG

Sample-wise Targeted Adversarial Attacks on Test-time Adaptation

Phuc Duc Nguyen, Quang Duc Nguyen

College of Computing and Data Science, Nanyang Technological University

2026-05-25视觉感知

本文关注测试时自适应在无人标注测试流中被操纵的风险:传统按类别定向攻击会显著改变预测分布,容易暴露。作者提出按样本触发的定向攻击,并用元学习模拟适应过程,通过优先级感知梯度对齐把攻击成功置于隐蔽性约束之上。实验在 CIFAR-10-C、CIFAR-100-C、ImageNet-C 等 TTA 协议上显示,攻击成功率约 90%,同时预测标签分布接近无攻击基线且能抵抗现有防御。

What Linear Probes Miss: Multi-View Probing for Weight-Space Learning Figure 1
2026-05-25cs.LG

What Linear Probes Miss: Multi-View Probing for Weight-Space Learning

Eunwoo Heo, Kyeongkook Seo, Jaejun Yoo

2026-05-25视觉感知

针对开源模型仓库中 checkpoint 缺少元数据、直接评估成本高的问题,本文研究如何仅从权重识别模型属性。作者指出现有单视角线性 probing 会遗漏行列交互并产生不可区分权重,提出 MVProbe:同时从行/列一阶投影和 Gram 二阶相关视角提取特征,并用缩放分析指导标准化融合。在 Model Jungle 上,其在 ResNet、ViT、DINO 及 Stable Diffusion LoRA 等设置中超过 ProbeX,且层选择更稳健。

Online Hand Gesture Recognition Using 3D Convolutional Neural Networks Figure 1
2026-05-25cs.CV

Online Hand Gesture Recognition Using 3D Convolutional Neural Networks

Yinghao Qin, Tijana Timotijevic

2026-05-25视觉感知三维

面向真实人机交互中动态手势需在线定位、低延迟识别且个体差异大的问题,论文构建了由检测器与分类器组成的3D CNN在线识别框架,并用滑动窗口融合多段结果以提升鲁棒性。模型在Jester上训练,检测器准确率超过98%、分类器超过90%;端到端系统在自采数据上可在3秒内响应,但Levenshtein准确率仅37.5%,实际可用性仍受限。

RS2AD-LiDAR: End-to-End Autonomous Driving LiDAR Data Generation from Roadside Sensor Observations Figure 1
2026-05-25cs.CV

RS2AD-LiDAR: End-to-End Autonomous Driving LiDAR Data Generation from Roadside Sensor Observations

Runyi Huang, Ni Ding, Ruidan Xing, Yuheng Shi, Lei He, Keqiang Li

2026-05-25视觉感知

针对端到端自动驾驶依赖车端采集导致成本高、长尾场景稀缺和数据孤岛的问题,RS2AD-LiDAR提出从路侧激光雷达观测重建车载LiDAR数据:通过相对位姿变换、虚拟LiDAR建模与点云重采样,生成可适配不同车辆和传感器配置的点云。作者自建R2V-LiDAR评测集,结果显示生成数据与真实车载数据在语义上相近,并在与真实数据混合训练时提升BEV和3D目标检测精度。

Joint Target-Less Intrinsic and Extrinsic Camera-LiDAR Calibration using Deep Point Correspondences Figure 1
2026-05-25cs.CV

Joint Target-Less Intrinsic and Extrinsic Camera-LiDAR Calibration using Deep Point Correspondences

Simon Bultmann, Daniele Cattaneo, Abhinav Valada

Department of Computer Science, University of Freiburg, GermanyThis work was funded by the German Research Foundation (DFG) Emmy Noether Program under grant 468878300.

2026-05-25视觉感知

针对现有学习式无靶标相机-LiDAR标定多假设图像已校正且内参已知的问题,本文提出联合估计针孔内参与径向-切向畸变、以及外参的完整流程:用SfM初始化内参、运动对齐初始化外参,并将CMRNext式深度像素-点对应扩展到未知内参和畸变,再与鲁棒非线性重投影优化迭代耦合。论文在KITTI未见相机设置下做系统评估,表明无需标定板也可联合恢复参数;具体量化增益在给定片段中未充分说明。

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation Figure 1
2026-05-25cs.CV

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

South China University of Technology

2026-05-25生成模型

整流流模型在图像、视频等生成中推理步数多,现有训练免费加速多依赖缓存复用,易因缓存与当前输入不匹配损失保真度。VDE将速度分解为与输入平行和正交的分量,利用系数的局部线性和正交方向短期稳定性在线估计,并周期性全前向锚定以抑制误差累积。实验显示其在Flux、Qwen-Image、Wan2.1上获得约2.04–3.22倍加速,Qwen-Image的LPIPS较最佳基线降低52.2%。

Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization Figure 1
2026-05-25cs.CV

Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization

Tianyu Wang (1), Junjie Wu (1 and 2), Jingquan Gao (1), Shishuo Li (1) ((1) School of Economics and Management, Beihang University, Beijing 100191, China (2) Key Laboratory of Data Intelligence and Management, Ministry of Industry and Information Technology, China)

2026-05-25视觉感知

论文针对专业羽毛球中动作短促、速度快且类别差异细微,现有数据集缺少细粒度时间边界标注的问题,构建 Fine-Badminton 数据集,并提出 DSTA 适配器,将运动表示解耦为时间、垂直和水平三路卷积分支,以低参数开销增强局部时空建模。在 ShuttleSet 和 Fine-Badminton 上分别取得 74.67% 与 66.23% mAP,优于已有适配器方法。

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models Figure 1
2026-05-25cs.CV

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

UCAS-Terminus AI Lab, University of Chinese Academy of Sciences, National University of Singapore, Zhejiang University, Shanghai Jiaotong University, The Hong Kong University of Science and Technology (Guangzhou), University of Waterloo, Zhongguancun Institute of Artificial Intelligence, State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University

2026-05-25强化学习

论文针对 FPS 世界模型中高频、重叠操作用全局动作条件会扰动整帧、难以跨游戏泛化的问题,提出按像素的 SCOPE 条件模块:依据局部视觉内容区分武器附近的离散动作作用域与背景中的连续运动生成,并构建含 7 款游戏、6.9 万片段和 10-DoF 遥测的 CrossFPS。实验显示其动作响应、作用域分离和未见场景零样本迁移更稳,但复杂多步交互仍受数据多样性限制,部分收益可能来自 scaling / data。

No Figure
2026-05-25cs.CV

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

Xiaoyi Huang, Kejia Zhang, Zhiming Luo

Institute of Artificial Intelligence, Xiamen University, Department of Artificial Intelligence, Xiamen University

2026-05-25视觉语言

针对LVLM在视觉证据不足或注意力错位时受语言先验驱动产生物体幻觉的问题,CHASD指出幻觉风险并非全序列均匀存在,而是随token和注意区域动态变化。方法在推理时用置信度门控只对低置信步骤启用对比解码,并基于跨模态注意力局部扰动当前显著视觉token构造负分支。实验在POPE、AMBER、MME、MMHal-Bench和CHAIR上优于多种免训练基线,同时减少不必要的负分支前向计算。

GFSR: Geometric Fidelity and Spatial Refinement for Reliable Lane Detection Figure 1
2026-05-25cs.CV

GFSR: Geometric Fidelity and Spatial Refinement for Reliable Lane Detection

Tiancheng Wang, Zhaolu Ding, Richeng Xu, Tianhui Zheng, Hui Liu, Hanyu Xuan, Zhiliang Wu, Guanghui Yue

in part by the Natural Science Research Project of Anhui Educational Committee (No.2024AH040012). 1 the School of Big Data and Statistics, Anhui University, Hefei 230039, China., the School of Artificial Intelligence and Data Science, University of Science and Technology of China, Hefei 230026, China., Institute of Dataspace, Hefei Comprehensive National Science Center, Hefei 230088, China., the College of Computing and Data Science, Nanyang Technological University, Singapore 639798, Singapore., the School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University, Shenzhen 518060, China.

2026-05-25视觉感知

针对基于线锚的车道检测中过度依赖分类置信度、易保留几何质量差候选,以及采样点回归相关性弱导致远距/大曲率车道欠拟合的问题,GFSR用LaneIoU监督校准几何可信度并与分类分数形成CRI筛选候选,同时以自适应门控细化采样点偏移。实验在CULane达F1@50 81.46%、F1@75 65.01%,CurveLanes达F1@50 87.35%。

Enhancing Blood Cells Classification using Hybrid Quantum Neural Networks Figure 1
2026-05-25cs.CV

Enhancing Blood Cells Classification using Hybrid Quantum Neural Networks

Guilherme Cruz, Nouhaila Innan, Alberto Marchisio, Gabriel Falcao, Muhammad Shafique

∗Instituto de Telecomunicac¸˜oes, University of Coimbra, Portugal, † eBrain Lab, Division of Engineering, New York University Abu Dhabi, PO Box 129188, Abu Dhabi, UAE, ‡ Center for Quantum and Topological Systems, NYUAD Research Institute, New York University Abu Dhabi, UAE, § Science Division, New York University Abu Dhabi, UAE, conducted on two publicly available blood cell datasets, namely, laboratory environments, their reliability degraded sharply when, the growing availability of large, expertly annotated medical, continue to limit scalability. Since most contemporary research

2026-05-25视觉感知

针对显微血细胞细粒度分类中形态差异微小、数据有限导致 CNN 表征易混淆的问题,本文将预训练 ResNet-50、低维瓶颈与变分量子线路结合,并用容量匹配的经典非线性层作受控对比,以隔离量子特征变换作用。在两个公开数据集上,HQNN 的指标更均衡,4 类任务 macro F1 最高提升 3.7%,8 类近饱和场景 F1 从 98.54% 提至 98.69%;IBM 真机推理仅小幅退化,但量子增益的普适性仍需更多任务验证。

No Figure
2026-05-25eess.IV

Efficient Learned Image Compression without Entropy Coding

Hao Cao, Wenqi Guo, Zhijin Qin, Jungong Han

2026-05-25视觉感知

针对学习式图像压缩中熵编码难以并行、成为端到端延迟瓶颈的问题,论文提出无熵编码的多码率 EF-LIC:用无约束向量量化使索引接近最大熵以减少统计冗余,并用上下文条件自回归变换在表征域去相关。实验在 Kodak/LPIPS 上相对 MS-ILLM 最高降码率 67.86%,且在同架构下接近熵编码版本性能,同时编码超 3 倍、解码超 5 倍加速。

General Hazard Detection Figure 1
2026-05-25cs.CV

General Hazard Detection

Stephanie Ng, CP Lim, SueJen Looi, Hendrik Zurlinden, David Nguyen, Lei Wei, Saeid Nahavandi, Hailing Zhou

2026-05-25视觉感知

本文针对传统危险检测依赖固定类别、难以处理安全规则抽象性和场景变化的问题,将危险识别重构为基于法规文本的视觉合规判断。其核心是 CompliVision 数据集和结合 LLaVA 推理、主动学习与人工反馈的框架,在交通、施工、仓储场景中用规则约束视觉证据。实验显示该方法可减少超过 65% 人工标注量,并接近全监督微调性能。

No Figure
2026-05-25cs.CV

Spatio-Temporal Similarity Volume Aggregation for Open-Vocabulary Action Recognition

Yerim So, Jiyeong Kim, Jiwon Yoon, Dongbo Min

Ewha Womans University, South Korea

2026-05-25视觉感知

针对开放词表动作识别中先汇聚视频特征再与文本对齐会丢失局部运动线索的问题,SimVA将CLIP的patch级视觉-文本相似度组织成时空4D相似度体,并在相似度空间用类别采样、Swin空间聚合、运动调制和Mamba时序聚合建模动作演化。实验在K400预训练后,于HMDB-51、UCF-101、K600等零样本,以及少样本和base-to-novel设置中均优于或接近现有方法。

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images Figure 1
2026-05-25cs.CV

LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images

Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister

Harvard University, Nanyang Technological University, Tsinghua University, University of Minnesota - Twin Cities

2026-05-25视觉感知三维

针对现有3D重建多只建模几何/外观、语义方法依赖逐场景优化或高维特征回归而难以实时泛化的问题,LangFlash从稀疏且无位姿多视图图像前馈预测带语言语义的3D高斯场,并用全局语义字典加每高斯稀疏权重降低表示成本,同时扩展RE10k语义监督。实验显示其在新视角合成和开放词汇3D分割语义一致性上优于已有方法,单场景推理约180 ms,但部分增益可能来自数据规模。

No Figure
2026-05-25eess.IV

Discontinuous Galerkin Neural Operator for Pathology Defocus Deblurring

Shaoqing Duan, Haofei Song, Xintian Mao, Qingli Li, Yan Wang

2026-05-25视觉感知

病理显微图像离焦模糊具有空间变化和局部不连续特性,传统卷积、Transformer或全局神经算子难以对应其物理成像过程。论文将去模糊视为变系数积分算子的逆问题,提出DGNO,用不连续Galerkin思想把核分解为单元局部算子与界面数值通量,以兼顾局部异质性和全局一致性。实验显示其在BBBC006等数据上优于NAFNet、Restormer、MPT、MambaIRv2及SRNO,重建更锐利且高分辨率扩展性更好。

DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection Figure 1
2026-05-25cs.CV

DepthAgent: Towards Better Universal Depth Estimation via Sample-wise Expert Selection

Jie Zhu, Girish Chandar Ganesan, Xiaoming Liu

Michigan State University, University of North Carolina at Chapel Hill

2026-05-25视觉感知

论文针对单目度量深度在透视、鱼眼、全景等相机域中单一模型难以稳定泛化的问题,指出不同深度专家具有随样本和相机几何变化的互补性。DepthAgent 将冻结深度模型作为工具,由 VLM 通过多轮调用按样本选择或融合专家,并用多奖励强化微调约束工具执行、场景/相机推理、质量与效率。实验显示其在多类基准上优于单模型、固定融合和其他选择策略,困难样本增益更明显。

U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025 Figure 1
2026-05-25cs.CV

U-CESE: Unified Clip-based Event Search Engine for AI Challenge HCMC 2025

Duc-Nhuan Le, Hoang-Phuc Nguyen, Thanh-Duy Lam, Minh-Nhut Dang, Minh-Hoang Le

2026-05-25视觉感知

面向 AIC HCMC 2025 中大规模、多源视频的事件检索需求,U-CESE 将原 CESE 分散的视觉、文本与关键词检索统一为剪辑级框架,并提出统一剪辑算法、基于 JPEG 文件大小变化的免训练 DAKE 关键帧抽取,以及具时序一致性的 ReCap 描述生成。实验称系统在多模态检索中更稳健高效,但具体增益幅度文中片段未充分说明。

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation Figure 1
2026-05-25cs.CV

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

The Hong Kong University of Science and Technology, 2 Tencent, 3 Tsinghua University, Institute of Automation, Chinese Academy of Sciences, 5 Beijing Film Academy, Stanford University, 7 The Chinese University of Hong Kong, 8 Singapore Institute of Technology

2026-05-25视觉感知数据集/基准

EvalVerse针对专业级视频生成评测只看提示对齐、难以衡量电影“好不好”的瓶颈,提出按前期、拍摄、后期流程组织的评测分类体系,并用34名专家标注校准VLM的CoT评分器,覆盖文本/参考生成、多镜头和音视频任务。文中称其在人机一致性、细粒度诊断和RL奖励/评测代理潜力上优于既有基准,但具体增益来源可能部分来自专家数据与校准流程。

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models Figure 1
2026-05-25cs.CV

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

Tianjin University, University of Macau

2026-05-25视觉语言视觉感知生成模型规划控制

该文针对端到端自动驾驶中自回归规划易累积误差、扩散规划缺少显式时序因果约束的问题,提出 ChainFlow-VLA:先用 AR“Chain”生成具因果一致性的多模态轨迹候选,再以 VLM 隐状态作为语义先验驱动残差扩散“Flow”做细粒度修正,把语义理解放到规划纠错阶段。实验在 NAVSIM v1 得到 94.85,达到或略超人类水平 94.8,但具体增益中 VLM、两阶段结构与训练规模的相对贡献仍需看消融。

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution Figure 1
2026-05-25cs.CV

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution

Hongbo Wang, Huaibo Huang, Pin Wang, Jinhua Hao, Chao Zhou, Ran He

2026-05-25视觉感知

本文针对生成式超分辨率中真实纹理与幻觉细节难区分的问题,指出根源在各向同性高斯噪声目标与自然图像频谱衰减不匹配。ASASR通过彩色噪声与Sobolev几何重塑优化度量,并用Riesz理论驱动的对抗器在线生成困难负样本。实验显示其在扩散/GAN基线中更好兼顾真实感与结构保真,尤其提升频谱一致性并减少伪影。

Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation Figure 1
2026-05-25cs.RO

Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation

Zixuan Hu, Xuantuo Huang, Yancheng Li, Yichun Hu, Shengyong Xu, Ling-Yu Duan

2026-05-25机器人视觉语言视觉感知

该文针对视觉语言导航在真实部署中遭遇连续环境分布变化时,传统测试时自适应易遗忘历史经验并产生负迁移的问题,提出 IDEA:将软提示及其域坐标保存为可复用“资产库”,并用 Fisher 引导筛选可迁移知识,再通过历史资产凸包投影构造免训练跨域桥接初始化。实验在 REVERIE、R2R 与 R2R-CE 上验证了稳定增益,离散基准平均提升约 +2.5% SR、+1.9% SPL。

No Figure
2026-05-25cs.CV

CARE: Class-Adaptive Expert Consensus for Reliable Learning with Long-Tailed Noisy Labels

Mengke Li, Haiquan Ling, Lihao Chen, Yang Lu, Yiqun Zhang, Hui Huang

2026-05-25视觉感知

该文关注真实视觉数据中长尾类别与标注噪声叠加的问题,指出仅降低总体噪声率会忽视尾类更高噪声并可能使头类过度校准。CARE利用观测标签、VLM文本嵌入和图像特征三类“专家”,按类别频次自适应调整Top-K共识,尾类要求更严格一致、头类更宽松,并据此修正标签分布和类先验。在合成与真实LTNL基准上优于现有方法,最高带来约3.0%性能增益。

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion Figure 1
2026-05-25cs.CV

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion

Xinyu Chen, Yuyi Qian, Jiang Lin, Shenyi Wang, Gao Wang, Zhiqiu Zhang, Jizhi Zhang, Mingjie Wang, Qiang Tang, Qian Wang, Song Wu, Zili Yi

2026-05-25视觉感知

针对视频插入新物体常需手工轨迹、重训练且易破坏背景的问题,SimInsert将任务拆为首帧编辑与文本驱动的I2V时序传播,并用区域注意力克隆保背景、稀疏注意力融合处理边界交互、Latent Refresh抑制去噪漂移。实验显示其相对现有方法PSNR提升18.8%、SSIM提升20.1%、LPIPS降低44.1%。

No Figure
2026-05-25cs.CV

StereoGenBench: A Synthetic Multi-Camera Benchmark for Stereo Generation under Controlled Baseline Regimes

Yangzhi Cui, Feng Qiao, Nathan Jacobs

Washington University in St. Louis

2026-05-25规划控制数据集/基准

现有立体生成评测多固定基线和内参,难以区分模型的场景能力与几何尺度偏置。StereoGenBench用Unreal构建六相机横向阵列,同一场景最多提供15个标定视对,并释放RGB、米制深度、内参、基线和逐帧位姿,覆盖窄/宽基线划分。文中参考评测按oracle几何、标定目标相机和单目无对齐三类报告,显示该基准能暴露不同基线下的右视图生成漂移,但真实世界相关性仍需另证。

Beyond Normal References: Discriminative Few-Shot Anomaly Detection Figure 1
2026-05-25cs.CV

Beyond Normal References: Discriminative Few-Shot Anomaly Detection

Huan Wang, Jun Shen, Jun Yan, Guansong Pang

University of Wollongong, Australia, Singapore Management University, Singapore

2026-05-25视觉感知

这篇论文针对少样本异常检测中只用正常参考会缺少判别线索、直接用异常参考又易过拟合已见缺陷的问题,提出“判别式 FSAD”设定和 IDEAL 框架。其核心是把异常理解为相对正常样本的可泛化偏离,通过正常变化擦除器去除光照、纹理等无关扰动,再用内在偏离编码器学习正交偏离方向。八个真实数据集实验显示,IDEAL在已见与未见异常上均优于现有FSAD方法。

No Figure
2026-05-25cs.CV

CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering

Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong

The University of Tokyo

2026-05-25视觉感知数据集/基准

针对现有视频问答基准多停留在描述性理解、缺少因果证据定位的问题,CaST-Bench提出因果链约束的时空推理评测:在1015个开放域视频上构建2066个问题,并标注时间片段与目标框轨迹,以同时考察答案正确性和证据 grounding。实验显示当前VLM与人类差距明显,人类准确率91.89%,最佳闭源/开源模型仅50.34%/45.30%,说明瓶颈主要在精确构建因果链。

Lipschitz Optimization for Formal Verification of Homographies Figure 1
2026-05-25cs.CV

Lipschitz Optimization for Formal Verification of Homographies

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio

2026-05-25优化算法

面向自动驾驶、航空等安全关键视觉系统,论文指出现有形式化验证多限于像素范数或2D仿射扰动,难以刻画相机3D运动。其核心是把平面场景中的相机位姿扰动写成闭式单应变换,并结合 Lipschitz 优化与分段线性连续性,为变换后像素值构造可验证的紧线性界。实验显示实现相较既有PWL方法最高提速89%、界限最多收紧7%,并在VNN-COMP与跑道分类案例中暴露了网络对透视扰动的系统脆弱性。

Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing Figure 1
2026-05-25cs.CV

Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing

Lin Liu, Zhihan Xiao, Haohang Xu, Rong Cong, Zhibo Zhang, Xiaopeng Zhang, Qi Tian

Tsinghua University, East China Normal University, Tsinghua University China, East China Normal University China

2026-05-25视觉感知安全鲁棒

该文针对遮挡、视角变化和快速运动下视频编辑易定位错误、闪烁的问题,提出 ORVE:不直接重建遮挡内容,而是从结构完整性、循环一致跟踪稳定性和视觉语言属性可见性三方面自动选择可靠关键帧,再双向传播生成时空掩码以约束扩散编辑。实验称在复杂遮挡基准上提升空间精度和时间一致性,但具体量化增益在给定片段中未充分说明。

No Figure
2026-05-25cs.CV

IntentionNav: A Benchmark for Intent-Driven Object Navigation from Implicit Human Instruction

Lin Qian, Shijie Li, Sihao Lin, Xuan Zhang, Bangya Liu, Yanran Li, Hujun Yin

The University of Manchester, Responsible AI Research Centre, Adelaide University, University of Bedfordshire

2026-05-25机器人数据集/基准

针对现有 ObjectNav 多假设目标类别已给定、难以评估机器人从“我想热饭”“房间闷”等隐式需求中推断目标的问题,论文提出 IntentionNav 基准:在 176 个 Isaac Sim 场景中构建 500 个意图、64 类目标,并用四种话语风格和四类语义线索做成配对诊断集。实验显示三种 VLM 虽能在 48.3% 情况下猜中目标、68.7% 到达 2 米邻域,但成功停止仅 24.9%,1 米 grounded success 只有 5.5%,瓶颈主要在意图到目标推断、视觉确认和终止定位。

GMENet: Generative Mixture of Experts Network for Multi-Center Glioma Diagnosis with Incomplete Imaging Sequences Figure 1
2026-05-25eess.IV

GMENet: Generative Mixture of Experts Network for Multi-Center Glioma Diagnosis with Incomplete Imaging Sequences

Pengfei Song, Fangjin Liu, Wenwen Zeng, Yonghuang Wu, Chengqian Zhao, Feiyu Yin, Xuan Xie, Jinhua Yu

School of Biomedical Engineering and Technology Innovation, Fudan University, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University

2026-05-25生成模型

临床多中心胶质瘤 MRI 常因协议差异缺失 T1c/FLAIR 等序列,现有模型只能丢弃样本,影响泛化。GMENet 用交叉注意力与门控生成缺失序列特征,并以动态加权专家融合原始/合成特征,联合预测 IDH、1p/19q 和病理类型。在 1241 例六中心数据上,可用训练数据增加 97%,且优于完整序列训练的 SOTA,跨中心鲁棒性更好。

No Figure
2026-05-25cs.CV

Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes

Wenxuan Peng, Bharath Hariharan, Hadar Averbuch-Elor

Cornell University, Cornell University Ithaca USA, Cornell University New York New York USA

2026-05-25视觉感知三维

论文针对现有文生图模型在多人互动场景中易漏人、角色关系错位、姿态和构图趋同的问题,提出 PeopleComposer:在扩散 Transformer 中联合生成二维姿态图与 RGB 图像,并用跨模态对齐和逐人迭代构建把复杂互动拆解为更简单的生成步骤。作者还构建 DrawWaldoWorlds 评测集,实验显示相较 SDXL、FLUX 等方法在提示语对齐和场景多样性上均有明显提升。

No Figure
2026-05-25cs.CV

DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving

Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le

University of Arkansas, USA, University of Liverpool, UK, Max Planck Research School for Intelligent Systems

2026-05-25视觉语言数据集/基准

针对现有自动驾驶 VLM 基准偏单视角、静态和自车中心,难以检验真实多视角时空场景理解的问题,DriveSpatial 从五个 AD 数据集构建 1.56 万个人工校验 QA,并以动态多关系场景图强制跨视角、时间和泛化推理。对 15 个 VLM 的评测显示最强模型仍落后人类 28.4 分,认知场景构建是主要瓶颈;仅语言提示无效,而显式 BEV grounding 能稳定改善表现。

LQ-rPPG: A Label-Quantized Coarse-to-Fine Learning Framework for Remote Physiological Measurement Figure 1
2026-05-25cs.CV

LQ-rPPG: A Label-Quantized Coarse-to-Fine Learning Framework for Remote Physiological Measurement

Jun Seong Lee, Samyeul Noh, Changki Sung, Hyun Myung

2026-05-25视觉感知

针对rPPG训练中接触式PPG标签易受运动伪影、接触不稳和波形差异影响,导致模型过拟合标签噪声的问题,本文提出LQ-rPPG:先将连续PPG量化为多比特伪标签,再用由粗到细的层级监督逐步恢复信号。多数据集实验显示其在域内与跨数据集评测中表现稳健,同时参数量降88%、MACs降29%、吞吐提升191%。

No Figure
2026-05-25cs.RO

Semantic-Aware Guided Drone Exploration for Language-Conditioned 3D Indoor Mapping

Nitin Vegesna, Avideh Zakhor

Department of Electrical Engineering and Computer Sciences, University of California, Berkeley

2026-05-25三维

面向室内无人机三维建图,论文关注如何在保持前沿式覆盖探索的同时按开放词汇语言查询更快发现目标物体。SAGE在FALCON上引入CLIP对象级记忆、短时语义缓存、对象前沿和受限语义-几何代价,使语义只重排而不破坏覆盖。仿真中其目标发现优于FALCON和语义消融,相比FTU在9组共享任务上探索快9.0–25.9倍;真实飞行也显示发现能力提升但轨迹与速度不如纯FALCON。

SLIP-RS: Structured-Attribute Language-Image Pre-Training for Remote Sensing Object Detection Figure 1
2026-05-25cs.CV

SLIP-RS: Structured-Attribute Language-Image Pre-Training for Remote Sensing Object Detection

Chenxu Wang, Yuxuan Li, Yunheng Li, Xiang Li, Jingyuan Xia, Qibin Hou

2026-05-25视觉感知

针对遥感目标检测中细粒度标注稀缺、开放类别难以穷举的问题,SLIP-RS将类别拆解为有限且具物理意义的结构属性,用SACL通过属性组合增强学习解耦表征,并用CARE基于保形预测过滤噪声、构建1500万级属性标注。实验显示其在细粒度检测、跨域泛化和下游微调上优于现有方法,但部分增益可能主要来自更大规模属性数据。

VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images Figure 1
2026-05-25cs.CV

VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images

Zhaonan Li, Kyle R. Chickering, Bangzheng Li, Jacob Dineen, Xiao Ye, Zhikun Xu, Shijie Lu, Yuxi Huang, Ming Shen, Bach Nguyen, Jaya Adithya Pavuluri, Mau Son Nguyen, Sanika Chavan, Ngoc Minh Thu Le, Muhao Chen, Ben Zhou

Arizona State University

2026-05-25视觉感知

这篇论文关注 VLM 是否真正学会可迁移的视觉概念,而不只是识别单张图像。作者提出 VisAnalog,用自然图像构造 A:B::C:? 类视觉类比,要求模型从 A→B 推断缩放、旋转、翻转、色相等确定性变换并应用到隐藏目标 D。实验显示,强开闭源 VLM 在直接看到 D 时表现高得多,但端到端推理随多步组合急剧下降;诊断表明主要瓶颈是关系推断,复杂情况下还叠加变换执行错误。

No Figure
2026-05-25eess.IV

STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding

Jiahe Meng, Weiming Zeng, Yueyang Li, Bo Chai, Hongjie Yan, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang

Lab of Digital Image and Intelligent Computation, Shanghai Maritime University, Shanghai 201306, China, Department of Language Science and Technology, The Hong Kong Polytechnic University, Hung Hom, Kowloon, Hong Kong SAR, China, Department of Neurology, Affiliated Lianyungang Hospital of Xuzhou Medical University, Lianyungang 222002, China, Institute of Computing and Intelligence, Harbin Institute of Technology Shenzhen, Shenzhen 518000, China

2026-05-25视觉感知

针对低信噪比 EEG 与 CLIP 等视觉语义空间直接对齐不稳定的问题,STAMBRIDGE 将任务拆成特征调理与跨模态对齐两阶段:用幅度驱动的软频谱通道加权和多尺度时域卷积保留瞬态、减轻硬频域掩蔽振铃,再以中间语义桥做分阶段蒸馏。在 THINGS-EEG 上取得 200 类零样本检索 Top-1 34.50%、Top-5 65.95%,并能驱动扩散模型生成语义一致重建。

Exploiting Longitudinal Context in Clinician-Verified Interactive Lesion Tracking Figure 1
2026-05-25cs.CV

Exploiting Longitudinal Context in Clinician-Verified Interactive Lesion Tracking

Yannick Kirchhoff, Maximilian Rokuss, Daniel Philipp Mertens, David Füller, Benjamin Hamm, Andreas Schreyer, Oliver Ritter, Klaus Maier-Hein

2026-05-25视觉感知

针对肿瘤在连续 CT 中需同时找回同一病灶并精确勾画、而全自动跟踪难纠错且注册后分割又丢失基线外观的问题,论文提出“Verified Tracking”:由注册给出随访点、医生确认或修正,再用结合基线与随访提示的网络分割;模型采用早期点提示融合、潜空间时序差异加权,并以合成纵向数据预训练。结果在 MICCAI autoPET IV 获第一,较从零训练最高提升 4.5 Dice,并发布 PanTrack 验证跨域泛化。

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection Figure 1
2026-05-25cs.CV

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

Hyeongmuk Lim, Youngbum Hur

2026-05-25视觉感知

针对视频异常检测依赖任务训练、域迁移成本高且只给分数缺少解释的问题,CoReVAD尝试用单个冻结VLM完成免训练检测与时序描述生成;其关键在于用局部视觉-文本对齐清洗VLM噪声,再结合全局相似度softmax、 Gaussian平滑和位置加权细化帧级分数。在UCF-Crime和XD-Violence上,方法相对免训练基线表现有竞争力,并能输出可读解释。

Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization Figure 1
2026-05-25cs.CV

Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization

Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue

Department of Computer Science and Techonology, Huaqiao University, Xiamen Key Laboratory of Computer Vision and Pattern Recognition, Huaqiao University, Tongji University, School of Cyber Science and Engineering, Wuhan University

2026-05-25视觉语言

针对音视频 Deepfake 定位中单模态篡改或异步篡改会让对称融合传播噪声、损害高 IoU 边界精度的问题,论文提出 IaMSB,将跨模态一致性估计表述为 Schrödinger Bridge 传输,并用粗到细桥、证据筛选和非对称步数分配来抑制负迁移。实验在 LAV-DF、AV-Deepfake1M、TVIL 上显示严格定位更稳,AP@0.95 提升约 3%–10%,单侧篡改场景收益更明显。

No Figure
2026-05-25eess.IV

Do Synthetic Brain MRIs Reliably Improve Tumour Classification? A StyleGAN2-ADA Class-Plane Augmentation Study on BRISC 2025

José Rafael Noriega Cedeño

2026-05-25生成模型

针对小规模医学影像中“GAN 合成图像是否真正提升下游诊断”这一问题,论文在 BRISC 2025 上训练 12 个按肿瘤类别与切面划分的 StyleGAN2-ADA,并比较过滤、配比和三类分类器。结果显示收益并不由视觉逼真保证:RF 无益,CNN 增益未过校正,MobileViTV2 在过滤 1:1 下显著提升约 1.02%,且减少真实数据训练轮次。

No Figure
2026-05-25cs.CV

Flow Mismatching: Unsupervised Anomaly Detection via Velocity Discrepancies in Flow Matching Models

Shengzhe Chen, Mehrdad Moradi, Kamran Paynabar, Hao Yan

Arizona State University, Georgia Institute of Technology

2026-05-25视觉感知生成模型

面向仅有正常样本的工业视觉异常检测,论文指出重建式方法可能把缺陷也重建掉,削弱残差信号。其核心洞察是:正常数据训练的 flow matching 速度场应与通向正常图像的几何速度一致,而异常区域会产生局部速度不匹配;据此只用前向传播聚合多时间步、多路径差异,生成热图和图像级分数。实验在 MVTec-AD 与 VisA 上优于多种重建式和 flow matching 基线。

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering Figure 1
2026-05-25cs.CV

RoboSurg-VQA: A Multimodal Benchmark for Surgical Segmentation-Aware Visual Question Answering

Chengyi Zhang, Zi Ye, Ziyang Wang

2026-05-25视觉语言视觉感知数据集/基准

针对手术机器人/微创场景中分割指标难以回答临床关于上下文、可见性与伪影问题的不足,RoboSurg-VQA将多套公开手术分割数据统一为带掩码支撑的闭集VQA基准,设计9类固定问题,并用受约束模型标注、自动一致性检查和人工审核控质。结果显示发布标注无解析和词表违规,15%抽检中4.8%被修正;多数类先验会显著抬高准确率而Macro-F1偏低,说明需按不平衡和退化视野评测。

No Figure
2026-05-25cs.CV

Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering

Yury Belousov, Brian Pulfer, Vitaliy Kinakh, Slava Voloshynovskiy

2026-05-25视觉感知安全鲁棒

针对视觉基础模型常作为冻结骨干、一次被对抗扰动击穿就会影响多类下游任务的问题,论文把多级 Floyd–Steinberg 误差扩散抖动作为无需重训、模型无关的输入防御,并指出量化级数存在折中:过低损伤语义,过高保留攻击,中间级别更有效。在 DINOv2、PaliGemma 的分类、分割、深度、检索、VQA、 captioning 及 PGD/MI-FGSM/SIA、自适应攻击下,中间 K 配合模糊整体匹配或优于 JPEG、扩散去噪等基线,且干净样本退化较小。

Millimeter-wave Imaging for Anthropometric Body Measurement Figure 1
2026-05-25cs.CV

Millimeter-wave Imaging for Anthropometric Body Measurement

Miriam Senne, Benjamin D. Killeen, Christoph Baur, Nassir Navab, Azade Farshad

2026-05-25视觉感知

针对皮尺和光学人体测量需脱衣、依赖操作者且不适合行动受限人群的问题,论文用可穿透日常衣物的毫米波体数据进行接触式替代。核心是将前后毫米波扫描转为点云,并用带可见性顶点权重的 Chamfer 配准、地面脚底约束和姿态先验拟合 SMPL,从闭合网格提取胸围、腰围、臀围和身高。27名受试者与假人实验显示,该方法在有外衣和稀疏覆盖下较单目 RGB 与手工测量更稳健,假人结果接近商用3D扫描。

The TIME Machine: On The Power of Motion for Efficient Perception Figure 1
2026-05-25cs.CV

The TIME Machine: On The Power of Motion for Efficient Perception

Mantas Skackauskas, Xinyue Hao, Laura Sevilla-Lara

School of Informatics, University of Edinburgh

2026-05-25视觉感知

针对视频模型依赖海量真实视频和语言监督、却仍弱于细粒度时序理解的问题,论文提出以稀疏点轨迹运动作为核心模态,用掩码自编码器重建缺失轨迹,并仅在 Kubric 合成物理运动上训练 TIME 表征。结果显示其在 CLEVRER、SSv2 等时序任务上可接近或超过强视频模型,且训练数据少至约 4 个数量级;与 V-JEPA2、DINOv3 等外观特征结合时,在 Ego-Exo4D 等细粒度任务上进一步提升,最高约 18%。

No Figure
2026-05-25cs.LG

RADAR: Relative Angular Divergence Across Representations

Xavier Cadet, Mateusz Nowak, Peter Chin

Dartmouth College

2026-05-25视觉感知

针对跨域扩充数据可能导致负迁移、逐一微调评估代价高的问题,RADAR用冻结基础模型的多层表征轨迹来估计可迁移性:比较域内与跨域样本在层间位移中的角度对齐和相对距离变化,并以GMM与对称KL刻画分布差异。在视觉与文本基准上,它在10种配置中7次进入前三、6次最佳,尤其适合域过渡平滑或分离清晰的场景。

Scene Reconstruction as Mapping Priors for 3D Detection Figure 1
2026-05-25cs.CV

Scene Reconstruction as Mapping Priors for 3D Detection

Yang Fu, Yuliang Zou, Hao Xiang, Xin Huang, Yijing Bai, Chen Song, Weijing Shi, Govind Thattai, Dragomir Anguelov, Mingxing Tan, Yingwei Li

2026-05-25视觉感知三维

面向自动驾驶三维检测中远距离稀疏、遮挡和恶劣感知条件下的歧义问题,论文不依赖昂贵人工 HD 地图,而是从聚合相机/LiDAR数据自动重建 surfel 与 3DGS 作为场景先验,并提出 MPA3D 以门控融合和混合模态训练整合地图、LiDAR与图像特征。在 Waymo Open Dataset 上报告达到新的 SOTA,说明可扩展重建先验能有效提升3D检测。

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration Figure 1
2026-05-25cs.CV

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt

2026-05-25视觉感知规划控制

针对可控视频生成中运动与交互难以用光流、轨迹等密集信号高效建模的问题,CoMoGen仅用输入图像和二值掩码序列驱动主体运动。其核心是轻量MaskAdapter将掩码转为潜空间残差,并通过注意力对齐识别MMDiT中的“运动层”,只在这些层注入控制并做LoRA微调,配合余弦衰减调度降低成本。实验显示其在BEHAVE、CLEVRER等数据集上优于InterDyn、GoFlow、MagicMotion等方法,提升运动保真度和感知真实感。

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction Figure 1
2026-05-25cs.CV

GazeBehavior Annotation Toolkit (GBAT): AI-powered toolkit for automatic annotation of egocentric eye-tracking and video data of child-caregiver interaction

Iba Baig, Kevin Li, Yanbin Xu, Seiji Cattelain, Marie Hallo, Hayato Ono, Sho Tsuji, Ming Bo Cai

2026-05-25视觉感知

针对儿童—照护者自然互动中第一视角眼动、多机位视频难以同步且人工标注成本高的问题,GBAT把音频谱相关同步、SAM2提示式凝视目标分割与Tarsier 2时序行为标注整合为本地可部署工具链。文中在3–4岁亲子互动数据上展示其可生成对齐时间戳、凝视目标序列及姿态/手部动作标签,显著提升标注效率;但手部动作精度低于姿态,跨视角融合增益仍未充分说明。

Improved Vision-to-Chart Buoy Association with Learned World-to-Image Projection Figure 1
2026-05-25cs.CV

Improved Vision-to-Chart Buoy Association with Learned World-to-Image Projection

Borja Carrillo-Perez (Arquimea Research Center)

2026-05-25视觉感知强化学习

针对海事图像中浮标检测需与海图条目匹配、而DETR基线只能从距离和方位隐式学习世界到图像投影的问题,论文加入冻结的QueryMLP,利用距离、逆距离、方位及IMU姿态预测浮标水线接触点,并作为像素空间先验拼接到查询向量中。该轻量改动在MaCVi 2026私有测试集取得Overall 0.7386(F1 0.8055、mIoU 0.6718),排名第二;但端到端联合训练的收益文中未充分说明。

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding Figure 1
2026-05-25cs.CV

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

Haichen He, Jiayi Zhou, Sifeng Shang, Yihan Hu, Yuanhan Zhang, Kaiyang Zhou

Hong Kong Baptist University, S-Lab, Nanyang Technological University, GVC Lab, Great Bay University

2026-05-25视觉感知数据集/基准

针对现有长视频基准虽时长变长、但问题证据常局限于短片段,难以评估持续跟踪与记忆的缺口,VideoOdyssey提出“连续证据长度”衡量认知负载,构建平均109分钟、覆盖视觉与音视频两子集的多级基准。实验显示当前MLLM性能随连续上下文显著退化,RAG式检索也难弥补,且非语言音频理解仍薄弱。

Suicide Risk Assessment from AI-powered Video Surveillance: An Interpretable Framework for Prevention in Metro Stations Figure 1
2026-05-25cs.CV

Suicide Risk Assessment from AI-powered Video Surveillance: An Interpretable Framework for Prevention in Metro Stations

Safwen Naimi, Wassim Bouachir, Guillaume-Alexandre Bilodeau, Brian Mishara

2026-05-25视觉感知安全鲁棒

面向地铁站自杀预防,论文指出仅靠人工值守或越线告警往往过晚,需结合乘客行为、空间位置与时间累积证据进行早期风险评估。其核心是将 SRA 形式化为可解释任务,串联行人跟踪、动作识别、站台语义分割、轨迹风险热图与 XGBoost 指标聚合,避免直接推断意图。真实监控数据上自动流程达到 83.2% ROC-AUC,黄线相关行为贡献最大,但检测跟踪误差仍是主要瓶颈。

No Figure
2026-05-25cs.CV

Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

University of Chicago, Equal contribution.Work done as a research intern at Stony Brook University., Toyota Technological Institute at Chicago, Stony Brook University

2026-05-25视觉语言视觉感知数据集/基准

本文质疑视觉语言基准准确率是否真的衡量视觉 grounding:作者从 POPE 上大量移除图像 token 几乎不降分的现象出发,设计全局退化、局部遮挡、实体替换、问题改写与答案空间扩展等诊断。结果显示,VLM 虽会利用图像,但标准准确率对细粒度视觉证据丢失不敏感,内部置信已减弱而答案仍不变;深层视觉 token 趋同也解释了基准可能高估真实视觉依赖。

Extending Deep Event Visual Odometry with Sparse Point-Cloud Export Figure 1
2026-05-25cs.RO

Extending Deep Event Visual Odometry with Sparse Point-Cloud Export

Alireza Safdari, Sajad Ashraf

2026-05-25视觉感知

针对事件相机视觉里程计虽能在高速和强光照变化下估计轨迹、但缺少可导出三维结构的问题,本文在不改动 DEVO 核心优化框架的前提下,暴露其内部稀疏深度与轨迹估计,加入点云导出、格式转换和清理流程。BOARD SLOW 实验显示,导出点云与 EMVS 局部一致,在 5 cm 阈值下精度较高,但密度、完整性和累计里程计漂移仍是主要限制。

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation Figure 1
2026-05-25cs.CV

GEM-4D: Geometry-Enhanced Video World Models for Robot Manipulation

Kaichen Zhou, Yuzhen Chen, Fangneng Zhan, Hang Hua, Grace Chen, Xinhai Chang, Ao Qu, Yilun Du, Zhuang Liu, Paul Pu Liang, Mengyu Wang

Harvard AI and Robotics Lab, Harvard University, Media Lab and EECS, Princeton University, MIT-IBM Watson AI Lab

2026-05-25机器人视觉感知强化学习

GEM-4D针对视频世界模型虽逼真却缺乏跨帧点级几何一致性、难以可靠转成机器人动作的问题,提出将预训练4D几何基础模型的稠密对应特征蒸馏到视频扩散骨干中,训练时强化深度、相机运动与物体运动表征,推理仍为单流且无额外成本;再用逆动力学模块把一致的视频 rollout 转为6-DoF末端轨迹。实验显示其在视频预测和几何一致性上达到SOTA,真实操作成功率由61%提升到81%。

MedExpMem: Adapting Experience Memory for Differential Diagnosis Figure 1
2026-05-25cs.LG

MedExpMem: Adapting Experience Memory for Differential Diagnosis

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Yannian Gu, Winnie Chiu Wing Chu, Xiaofan Zhang, Qi Dou

2026-05-25视觉感知

针对医学视觉语言模型在放射诊断中“无记忆”、难以从既往误诊中积累鉴别经验的问题,MedExpMem不更新参数,而把模型自身失败提炼为成对疾病的经验笔记,记录关键区分点、决策规则和推理错误,并通过零样本暴露盲点与反思再诊断两阶段构建记忆。基于Eurorad的11个亚专科评测显示,该方法在多种VLM和规模上稳定提升诊断准确率,最高增益7.0%。