‹ June 5 schedule

Findings Posters

Fri · June 5 · 7:00–8:30 AM · ExHall A — 317 papers
317 papers
1
BLMT-Stereo: Breaking the Local Minima Trap of Iterative Stereo Matching
Zhien Dai, Zhaohui Tang, Hu Zhang, Mingjun Pan, Jin Luo, Yongfang Xie
2
SwiftNDC: Fast Neural Depth Correction for High-Fidelity 3D Reconstruction
Kang Han, Wei Xiang, Lu Yu, Mathew Wyatt, Gaowen Liu, Ramana Rao Kompella
3
ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction
Sirshapan Mitra, Yogesh S Rawat
4
GauSDF: Signed Distance Embedded Gaussian Surfels for 3D Reconstruction
Minsol Kim, Usman Ali
5
4D E-SloMo: 4D Reconstruction for High Speed Scene using a Hybrid RGB-Event Multi-View System
Bo Xu, Jun Dai, Yutian Chen, Linning Xu, Mulin Yu, Yujin Wang, Shi Guo, Xinyi Le, Tianfan Xue
6
MADrive: Memory-Augmented Driving Scene Modeling
Polina Karpikova, Daniil Selikhanovych, Kirill Struminsky, Ruslan Musaev, Maria Golitsyna, Dmitry Baranchuk
7
OnlineX: Unified Online 3D Reconstruction and Understanding with Active-to-Stable State Evolution
Chong Xia, Fangfu Liu, Yule Wang, Yize Pang, Yueqi Duan
8
SyncTrack4D: Cross-Video Motion Alignment and Video Synchronization with Multi-Video 4D Gaussian Splatting
Yonghan Lee, Tsung-Wei Huang, Shiv Gehlot, Jaehoon Choi, Guan-Ming Su, Dinesh Manocha
9
AR4D: Autoregressive 4D Generation from Monocular Videos
Hanxin Zhu, Tianyu He, Zhibo Chen
10
CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion
Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang
11
Point2Gaussian: Point-Cloud-to-Gaussian Conversion for Efficient 3D Scene Rendering
Powei Liao, Jiro Abe, Kazumine Ogura
12
Speed3R: Sparse Feed-forward 3D Reconstruction Models
Weining Ren, Xiao Tan, Kai Han
13
FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views
Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang
14
Generalizable Human Gaussian Splatting via Multi-view Semantic Consistency
Jingi Kim, Wonjun Kim
15
HEDA: Hyperbolic-Euclidean Dual Adaptation for Robust Real-World Point Cloud Completion
Aihua Mao, Jun Yang, Yong-Jin Liu, Ying He
16
WildAni4D: Towards 4D Animal Mesh Reconstruction
Gyeongsu Cho, Hezhen Hu, Donghyeon Soon, Changwoo Kang, Kyungdon Joo
17
Instant Colorization of Gaussian Splats
Daniel Lieber, Alexander Mock, Nils Wandel
18
Dynamic Scene Decomposition Beyond Moving Objects for High- Fidelity 3D Reconstruction in Autonomous Driving
Mingbo Dai, Han Yan, Bolun Zhang, Wu Ran, Chao Ma
19
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
Yilong Liu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister
20
FACT-GS: Frequency-Aligned Complexity-Aware Texture Reparameterization for 2D Gaussian Splatting
Tianhao Xie, Linlian Jiang, Xinxin Zuo, Yang Wang, Tiberiu Popa
21
Affine Bases for Affine Spaces
Gabriel Dogadov, Marc Alexa
22
Improving Densification in 3D Gaussian Splatting for High-Fidelity Rendering
Xiaobin Deng, Changyu Diao, Min Li, Ruohan Yu, Duanqing Xu
23
OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation
Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu
24
GeoFusion-CAD: Structure-Aware Diffusion with Geometric State Space for Parametric 3D Design, SPIDER: Spatial Image CorresponDence Estimator for Robust
Xiaolei Zhou, Chuangjie Fang, Jie Wu, Jingyi Yang, Boyi Lin, Jianwei Zheng
25
Calibration, GEAR: GEometry-Motion Alternating Refinement for Articulated
Zhimin Shao, Abhay Yadav, Rama Chellappa, Cheng Peng
26
Object Modeling with Gaussian Splatting, GlowGS: Generative Semantic Feature Learning for 3D Gaussian
Jialin Li, Bin Fu, Ruiping Wang, Xilin Chen
27
Splatting in Nighttime Glow Scenes, 2D Triangle Splatting for Direct Differentiable Mesh Training
Beibei Lin, Xiao Cao, Jingyuan Guo, Robby T. Tan
28
ForgeDreamer: Industrial Text-to-3D Generation with Multi-Expert
Kaifeng Sheng, Zheng Zhou, Yingliang Peng, Qianwei Wang
29
LoRA and Cross-View Hypergraph, 3D Gaussian Splatting for Annular Dark Field Scanning Transmission
Junhao Cai, Deyu Zeng, Junhao Pang, Lini Li, Xiaopin Zhong, Zongze Wu
30
Electron Microscopy Tomography Reconstruction, IDSplat: Instance-Decomposed 3D Gaussian Splatting for Driving
Beiyuan Zhang, Hesong Li, Ruiwen Shao, Ying Fu
31
Scenes
Carl Lindström, Mahan Rafidashti, Maryam Fatemi, Lars Hammarstrand, Martin R. Oswald, Lennart Svensson
32
Stream3D: Streaming Zero-Shot 3D Instance Segmentation with Multi-View Noise Mask Filtering and Manifold Refining
Jie Xu, Na Zhao
33
Active Exploration for Sparse Visual Localization
Johanna Lidholm, Ludvig Dillén, Zuzana Kukelova, Torsten Sattler, Viktor Larsson
34
GRVS: a Generalizable and Recurrent Approach to Monocular Dynamic View Synthesis
Thomas Tanay, Mohammed Brahimi, Michal Nazarczuk, Qingwen Zhang, Sibi Catley-Chandar, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero
35
3DFA: Aligning the Features Between Point Cloud and Query Image for Scene-Specific Visual Localization, PROGRAM GUIDE MAIN CONFERENCE | 1313
Sizhe Song, Yankuan Chi, Shuhan Zhong, S.-H. Gary Chan
36
Long-LRM++: Preserving Fine Details in Feed-Forward Wide-Coverage Reconstruction
Chen Ziwen, Hao Tan, Peng Wang, Zexiang Xu, Li Fuxin
37
Native3D: End-to-End 3D Scene Generation via Unified Mesh- Texture Modeling and Semantic Alignment
Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi
38
From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images
Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen
39
NeVStereo: A NeRF-Driven NVS-Stereo Architecture for High-Fidelity 3D Tasks
Pengcheng Chen, Yue Hu, Wenhao Li, Nicole M Gunderson, Andrew Feng, Zhenglong Sun, Peter Beerel, Eric J Seibel
40
VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction
Yu Hu, Chong Cheng, Sicheng Yu, Xiaoyang Guo, Hao Wang
41
AvatarMix: Identity-Preserving Cross-Avatar Composition for Outfit Personalization
Zhaorong Wang, Yoshihiro Kanamori, Yuki Endo
42
Object Pose Transformer: Unifying Unseen Object Pose Estimation
Weihang Li, Lorenzo Garattoni, Fabien Despinoy, Nassir Navab, Benjamin Busam
43
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
Jungho Lee, Minhyeok Lee, Sunghun Yang, Minseok Kang, Sangyoun Lee
44
CATRF: Codec-Adaptive TriPlane Radiance Fields for Volumetric Content Delivery
Tung-I Chen, Lingdong Wang, Subhransu Maji, Ramesh K. Sitaraman
45
PDF-GS: Progressive Distractor Filtering for Robust 3D Gaussian Splatting
Kangmin Seo, MinKyu Lee, Tae-Young Kim, ByeongCheol Lee, JoonSeoung An, Jae-Pil Heo
46
Three-Step Conditional Diffusion 3D Reconstruction for Light-Field Microscopy
Qihong Zhao, Shaokang Yan, Zhimin Qiao, Jinjia Wang, Bo Xiong
47
LTGS: Long-Term Gaussian Scene Chronology From Sparse View Updates
Minkwan Kim, Seungmin Lee, Junho Kim, Young Min Kim
48
Learning a Particle Dynamics Model with Real-World Videos
Chanho Kim, Suhas V. Sumukh, Li Fuxin
49
Softmax-GS: Generalized Gaussians Learning When to Blend or Bound
Chen Ziwen, Peng Wang, Hao Tan, Zexiang Xu, Li Fuxin
50
G2I: Transitioning a Generalized Monocular Depth Estimation Model to In-Domain Metric Depth Prediction
Chao Ning, Naoto Yokoya
51
3D-RE-GEN: 3D Reconstruction of Indoor Scenes with a Generative Framework
Tobias Sautter, Jan-Niklas Dihlmann, Hendrik P A Lensch
52
HiDiGen: Hierarchical Diffusion for B-Rep Generation with Explicit Topological Constraints, RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular
Shurui Liu, Weide Chen, Ancong Wu
53
Video, RAD: Retrieval-Augmented Monocular Metric Depth Estimation for
Chenyu Wu, Wanhua Li, Chen Zhu-Tian, Hanspeter Pfister
54
Underrepresented Classes, WGS: Watertight Geometry Standardization for Scalable 3D
Michael Baltaxe, Dan Levi, Sagie Benaim
55
Generation, Self-Evolving 3D Scene Generation from a Single Image
Dehao Hao, Tanghui Jia, Kaiyi Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Runze Zhang, Lingting Zhu, Li Yuan, Xin Wang, Long Quan
56
Distill Any Depth: Distillation Creates a Stronger Monocular Depth
Kaizhi Zheng, Yue Fan, Jing Gu, Zishuo Xu, Xuehai He, Xin Eric Wang
57
Estimator, Re-Depth Anything: Test-Time Depth Refinement via Self-Supervised
Xiankang He, Dongyan Guo, Hongji Li, Ying Cui, Libo Weng, Ruibo Li, Chi Zhang
58
Re-lighting
Ananta R. Bhattarai, Helge Rhodin
59
UniVerse3D: Emerging Properties of Unified Multimodal Models in 3D Understanding and Generation
Junliang Ye, Zehuan Huang, Yansong Qu, Chunshi Wang, Yunhan Yang, Yang Li, Yawei Luo, Zhuo Chen, Sheng Lu, Jun Zhu, Chunchao Guo
60
HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation
Keito Suzuki, Kunyao Chen, Lei Wang, Bang Du, Runfa Blark Li, Peng Liu, Ning Bi, Truong Nguyen
61
Beyond Voxel 3D Editing : Learning from 3D Masks and Self- Constructed Data
Yizhao Xu, Hongyuan Zhu, Caiyun Liu, Tianfu Wang, Keyu Chen, Sicheng Xu, Jiaolong Yang, Nicholas jing Yuan, Qi Zhang
62
Adversarial Agents: Black-Box Evasion Attacks with Reinforcement Learning, 14 | CVPR 2026 14 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE
Kyle Domico, Jean-Charles Noirot Ferrand, Ryan Sheatsley, Eric Pauley, Josiah Hanna, Patrick McDaniel
63
Defending CLIP via Noise-Induced Feature Dynamics for Training-Free, Zero-shot Adversarial Robustness
Debarshi Brahma, Soma Biswas
64
Jailbreaking Frontier Foundation Models Through Intention Deception
Xinhe Wang, Katia Sycara, Yaqi Xie
65
NSGuard: Null-Space Guided Robust Watermarking for Data Copyright Protection in Customized Generation
Lizhi Xiong, Jianguo Feng, Ziqiang Li, Jun Li, Weiwei Jiang, Zhangjie Fu
66
A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing
Maria Stoica, Abdelrahman Hekal, Alessio Lomuscio
67
Phantasia: Context-Adaptive Backdoors in Vision Language Models
Nam Duong Tran, Phi Le Nguyen
68
BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models
Jiayao Wang, Yiping Zhang, Mohammad Maruf Hasan, Xiaoying Lei, Jiale Zhang, Junwu Zhu, Qilin Wu, Dongfang Zhao
69
CLIP-Inspector: Model-Level Backdoor Detection for Prompt- Tuned CLIP via OOD Trigger Inversion
Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal
70
BadVLM: Towards Efficient and Resilient Backdoor Attacks on Large Vision-Language Models
Ba Luan Dang, Vu Tuan Truong, Long Bao Le
71
Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe
72
Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings
Fatemeh Akbarian, Anahita Baninajjar, Yingyi Zhang, Ananth Balashankar, Amir Aminifar
73
When Data is Scarce, Learn to Adapt: Robust Federated Learning via Adversarial Meta-Optimization
Md Zarif Hossain, Awal Ahmed Fime, Ahmed Imteaj
74
Robust Alignment: Harmonizing Clean Accuracy and Adversarial Robustness in Adversarial Training
Yanyun Wang, Qingqing Ye, Li Liu, Zi Liang, Haibo Hu
75
DRA: Structure-Preserving Backdoor Erasure via Diagnosing, Recalibrating, and Adapting
Minwei Wen, Yang Wei, Junhao Xiao, Xiuli Bi, Bin Xiao
76
APC: Transferable and Efficient Adversarial Point Counterattack for Robust 3D Point Cloud Recognition
Geunyoung Jung, Soohong Kim, Inseok Kong, Jiyoung Jung
77
Cognitive Attack Detection in Augmented Reality (CADAR): A Neuro- Symbolic Approach with Particle Filtering on Perception Graphs, On Evaluating Stateful Defence Models against Query-Based Black-
Rongqian chen, Allison Andreyev, Yanming Xiu, Joshua Chilukuri, Shunav Sen, Mahdi Imani, Bin Li, Maria Gorlatova, Gang Tan, Tian Lan
78
Box Attacks, Optimizing Certified Radius of Zero-shot Composed Image Retrieval
Ziad Tariq Muhammad Ali, Raja Muhammad Atif Azad, Muhammad Ajmal Azad, Iain Rice, Umar Daraz, Ali Shariq Imran, James Holyhead
79
via Text Guidance, When Interpretability Becomes a Liability: Adversarial Attacks on
Junyang Chen, Haomin Ni, Hanjiang Lai
80
CBM Concept Layers, Red-teaming the Multimodal Reasoning: Jailbreaking Vision-
Aditya Sridhar
81
Language Models via Cross-modal Entanglement Attacks, Phantom: A Unified Face-Swap Deepfake Protection Framework
Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu
82
with Latent and Spatial Constraints, Tap, Scan, Exploit: The Hidden Vulnerabilities of Everyday QR Codes
Jungkon Kim, Cheolseung Jung, Jong-Min Choi, Juseong Lee
83
Ashish Kumar, Aarthi S, Akshay Agarwal
84
DeepFakeShield: A Proactive Defense Against Malicious Face Swapping
Saeed Karimi-Bidhendi, Joseph DeGol, Eric Wengrowski, Dominic Roberts, Kristin Dana
85
MDG: Masked Denoising Generation for Multi-Agent Behavior Modeling in Traffic Environments
Zhiyu Huang, Zewei Zhou, Tianhui Cai, Yun Zhang, Jiaqi Ma
86
LiDAR-to-4D Radar Synthesis for Building Large-Scale Tensor Datasets
Woo-Jin Jung, Dong-Hee Paek, Seung-Hyun Kong
87
SurfaceGS: Dynamic Surface Gaussian Splatting for Urban Driving Scenes
Fudong Ge, Dingning Liu, Hanshi Wang, Yiwei Zhang, Jin Gao, Weiming Hu, Zhipeng Zhang
88
JACoP: Joint Alignment for Compliant Multi-Agent Prediction
Qingze Tony Liu, Alen Mrdovic, Danrui Li, Mathew Schwartz, Sejong Yoon, Mubbasir Kapadia
89
Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving
Zhexi Lian, Haoran Wang, Xuerun Yan, Weimeng Lin, Xianhong Zhang, Yongyu Chen, Jia Hu
90
What Matters for Scalable and Robust Learning in End-to-End Driving Planners?
David Holtz, Niklas Hanselmann, Simon Doll, Marius Cordts, Bernt Schiele
91
Physics-Informed Reward Framework for Vision-Language Driven Safe Autonomous Driving
Xuepei Yang, Mingtao Feng, Weisheng Dong, Lin Chen, Jie Feng, Fangfang Wu, Yufan Zhu, Ajmal Saeed Mian
92
HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes
Mauricio Soroco, Francesco Pittaluga, Zaid Tasneem, Abhishek Aich, Bingbing Zhuang, Wuyang Chen, Manmohan Chandraker, Ziyu Jiang
93
VESPA: Open-World Auto-Labeling for 3D Object Detection in Autonomous Driving
Levente Tempfli, Esteban Rivera, Markus Lienkamp
94
IRL-VLA: Vision-Language-Action Training via Reward World Model
Anqing Jiang, Gao Yu, Heng Yuwen, Yiru Wang, Wang Shuo, Jiang Hao, Sun Hao
95
KnowMTP: A Knowledge-Guided Framework for Multi-Agent Trajectory Prediction in Autonomous Driving
Rufan Bai, Tianyi Xue, Tiantian Zhou, Weiwei Wu, Changle Li, Yuhuan Lu
96
MapGPT: A Vision-Language Model for Large-Scale High-Definition Map Generation
Mengxi Wu, Long Zhou, Zhixia Li, Adrian Kwan, Denis Laprise, Hengyi Huang, Xiaqing Wu, Shuang Wu
97
RoaD: Rollouts as Demonstrations for Closed-Loop Supervised Fine-Tuning of Autonomous Driving Policies
Guillermo Garcia- Cobo, Maximilian Igl, Peter Karkus, Zhejun Zhang, Michael Watson, Yuxiao Chen, Boris Ivanovic, Marco Pavone
98
PAVE: An End-to-End Dataset for Production Autonomous Vehicle Evaluation
Xiangyu Li, Chen Wang, Yumao Liu, Dengbo He, Jiahao Zhang, Ke Ma
99
RoadTones: Tone Controllable Text Generation from Road Event Videos
Chirag Parikh, Siddhi Pravin Lipare, Ravi Kiran Sarvadevabhatla
100
GRADE: Guiding Realistic Autonomous Driving with Adaptive Trajectory Evolution
Zehong Ke, Zhiyuan Liu, Yuning Wang, Jinhao Li, Junkai Jiang, Yanbo Jiang, Zhenhua Xu, Jianqiang Wang
101
SurfelOcc: Self-supervised Occupancy Prediction via 2D Surfel Splatting
Jikai Wang, Xingtai Gui, Jiahao Gong, Feiyang Tan, Wencheng Han, Cheng-Zhong Xu, Jianbing Shen
102
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
Yingzi Ma, Yulong Cao, Wenhao Ding, Shuibai Zhang, Yan Wang, Boris Ivanovic, Ming Jiang, Marco Pavone, Chaowei Xiao
103
Devil is in Narrow Policy: Unleashing Exploration in Driving VLA Models
Canyu Chen, Yuguang Yang, Zhewen Tan, Yizhi Wang, Ruiyi Zhan, Haiyan Liu, Xuanyao Mao, Jason Bao, Xinyue Tang, Linlin Yang, Bingchuan Sun, Yan Wang, Baochang Zhang
104
Learning Vision-Language-Action World Models for Autonomous Driving
Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma
105
AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models
Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zheng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen
106
Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments
Chihiro Noguchi, Takaki Yamamoto
107
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain- of-Thought for Trustworthy Vision-Language Autonomous Driving
Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang
108
CoRT-Predictor: Chain of Risk Thought Autoregressive Trajectory Predictor for Autonomous Driving
Yanlin Jiang, Yuchen Liu, Mingren Liu
109
C^2T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic–Vehicle Coordination
Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li
110
PEARL: A Lightweight Prompt-based Feature Interpreter Framework for Real-Time, Anonymous, and Heterogeneous Collaborative Perception
Armin Maleki, Hayder Radha
111
Variable-View Diffusion with Geometric Uncertainty Unlocks LiDAR Upsampling
Pengfei Yang, Sifu Luo, Feng Wu, Fan Zhou, Ting Zhong
112
RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection
Ozsel Kilinc, Cem Tarhan
113
On the Feasibility and Opportunity of Autoregressive 3D Object Detection
Zanming Huang, Jinsu Yoo, Sooyoung Jeon, Zhenzhen Liu, Mark Campbell, Kilian Q Weinberger, Bharath Hariharan, Wei-Lun Chao, Katie Z Luo
114
See Tomorrow, Act Today: Foresight-Driven Autonomous Driving
Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang
115
Spatial Transcriptomics as Images for Large-Scale Pretraining
Yishun Zhu, Jiaxin Qi, Jian Wang, Yuhua Zheng, Jianqiang Huang
116
DiffGradCAM: A Class Activation Map Using the Full Model Decision to Solve Unaddressed Adversarial Attacks
Jacob Piland, Christopher Sweet, Adam Czajka
117
Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI
Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl
118
Fingerprint Fragment Expansion using Image Outpainting Approach based on Spectral Normalization PatchGAN
C. Zaghetto, A. Purim, W. Oliveira, J. R. Ribeiro, H. Nolla, F. Santos, M. Chang, R. H. Vareto
119
Improving Autoregressive Image Generation Through Coarse-to-Fine Token Prediction
Ziyao Guo, Kaipeng Zhang, Michael Qizhe Shieh
120
Intelligent Photo Retouching with Language Model-Based Artist Agents
Haoyu Chen, Keda Tao, YiZao Wang, Xinlei Wang, Lei Zhu, Jinjin Gu
121
Guided Lensless Polarization Imaging
Noa Kraicer, Erez Yosef, Raja Giryes
122
Blockwise Divide-and-Aggregate for Image Restoration using Diffusion Priors
Vishal Purohit, Wei Chen, Qiang Qiu
123
Towards Imperceptible Watermarking Via Environment Illumination for Consumer Cameras
Hodaka Kawachi, Tomoya Nakamura, Hiroaki Santo, SaiKiran Kumar Tedla, Trevor D Canham, Yasushi Yagi, Michael S. Brown
124
Adaptive Continuous Kernel Networks for Image Reconstruction from Non-Uniform Sampling
Camille Biscarrat, Michaël Gharbi, Rahul Goel, Jonathan Ragan-Kelley, Frédo Durand, Tzu-Mao Li
125
FreqAdapt: Frequency-Adaptive Processing for RAW Object Detection
Hanxi Li, Huiling Li
126
Stability and Non-Local Modeling in Hybrid Convolution–Transformer Networks for Snapshot Hyperspectral Reconstruction
Xian-Hua Han
127
Breaking Degradation Coupling: A Structural Entropy–Guided Decoupled Framework and Benchmark for Infrared Enhancement
Pu Li, Huafeng Li, Yafei Zhang, Yu Liu, Wen Wang
128
Fast Generative DeOcclusion for Visual Geometry and Robotics
Jieneng Chen, Tiezheng Zhang, Xiwei Xuan, Ju He, Yifan Yin, Haojun Shi, Suyu Ye, Xinyi Li, Ruisheng Yuan, Tianmin Shu, Alan Yuille
129
FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation
Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo
130
Unlocking Single-View Constraints for Efficient Camera Relocalization with Keypoint-Level Multi-View Geometric Consistency in Training
Hu Lin, Chengjiang Long, Jiqing Zhang, Chuanlu Jiang, Huilin Ge, Erwei Yin, Baocai Yin, Xin Yang
131
Evolve Vision-Language-Action Model into an Agent with On-the- fly Tool-use
Ding Yi, Yanzhao Yu, Xili Dai, Xianbiao Qi, Peiwen Sun, Xueqian Wang, Xiangyu Yue, Jianan Wang
132
Retrieval-VLA: Training-Free In-Context Adaptation for Vision- Language-Action Models
Yue Zhang, Rui Wang, Jiehong Lin, Zhongrui Wang, Xiaojuan Qi
133
Revisiting Articulated Parts Perception in Robot Manipulation
Xiaoqian Wu, Yejie Guo, Xiaoyang Chen, Lixin Yang, Cewu Lu, Yong-Lu Li
134
Re^2MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement, PROGRAM GUIDE MAIN CONFERENCE | 1515
Jiakun Zheng, Ting Xiao, Shiqin Cao, Xinran Li, Zhe Wang, Chenjia Bai
135
Teleoperation, Simulation, or Human Video? Data Utilization Law for Robot Manipulation
Chenhao Shi, Yichen Zhu, Junjie Wen, Yefei Chen, Ziang Liu, Faming Fang
136
ShelfGaussian: Shelf-Supervised Open-Vocabulary Gaussian-Based 3D Scene Understanding
Lingjun Zhao, Yandong Luo, James Hays, Lu Gan
137
RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer
Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Guan Huang, Zhizhong Su
138
Switch-JustDance: Benchmarking Whole-Body Motion Tracking Controllers Using a Commercial Console Game
Jeonghwan Kim, Wontaek Kim, Yidan Lu, Jin Cheng, Fatemeh Zargarbashi, Zicheng Zeng, Zekun Qi, Zhiyang Dou, Nitish Sontakke, Donghoon Baek, Li Yi, Sehoon Ha, Tianyu Li
139
OminiMAG-SLAM : Unified Online Dual Graph Optimization for Multi- Agent Gaussian SLAM
Leqian Ding, Caibo Li, Yu Guo, Fei Wang
140
ReaAct: Bridging Robotic Reasoning and Action Generation Toward Real-World Spatial Generalization
Yanzhao Yu, Yi Ding, Peijun Tang, Haotian Yang, Xianbiao Qi, Jianan Wang, Xueqian Wang
141
Learning Multi-Task Robot Trajectory Segmentation from Visual and Kinematic Streams
Kaiyuan Chen, Shuangyu Xie, Andrew Goldberg, Ken Goldberg
142
LP3: LLM-based Potential Prediction Policy for Object Navigation using a Scene-Object Semantic Map
Wei Luo, Xiaohan Wang, Yuehu Liu
143
RoboScape-R: Unified Reward-Observation World Models for Generalizable Robotics Training via RL
Yinzhou Tang, Yu Shang, Yinuo Chen, Bingwen Wei, Xin Zhang, Shu'ang Yu, Liangzhi Shi, Chao Yu, Chen Gao, Wei Wu, Yong Li
144
CoTFly: Making UAVs Think Where to Fly Next Through Visual Chain-of- Thought Reasoning
Meiqi Wang, Longnyu Xu, Jun Liu, Hewu Li, Han Qiu
145
RU4D-SLAM: Reweighting Uncertainty in Gaussian Splatting SLAM for 4D Scene Reconstruction
Yangfan Zhao, Hanwei Zhang, Ke Huang, Qiufeng Wang, Zhenzhou Shao, Dengyu Wu
146
A1: Adaptive Truncated Vision-Language-Action Model from Affordance to Action
Kaidong Zhang, Jian Zhang, Rongtao Xu, Yu Sun, Youpeng Wen, Shuoshuo Xue, Xiaoyu Guo, Minghao Guo, Weijia Liufu, Liu Zihou, Kangyi Ji, Zihang Li, Ruiyi Chen, Meng Cao, Jingming Zhang, Shen Zhao, Xiaojun Chang, Feng Zheng, Ivan Laptev, Xiaodan Liang
147
Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data
Ji Woong Kim, Ke Wang, Zipeng Fu, Sirui Chen, Cong zhao, Jeff Lai, Chelsea Finn
148
RACE-6D: Real-time Accurate Coarse-to-finE Object 6D Pose Transformer
Yoonwoo Ha, Hyungpil Moon
149
MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training
Zhenhan Yin, Xuanhan Wang, Jiahao Jiang, Kaiyuan Deng, Pengqi Chen, Shuangle Li, Chong Liu, Xing Xu, Jingkuan Song, Lianli Gao, Heng Tao Shen
150
Riemannian Score-Based Diffusion for Language-Conditioned Grasp and Affordance Detection
Yan Li, Zhouchao Fu, Wenbin Lu, Junjie Zheng, Junnan Xu, Junjie Liao, Jianwei Zheng
151
DINO-VO: Learning Where to Focus for Enhanced State Estimation
Qi Chen, Guanghao Li, Sijia Hu, Xin Gao, Junpeng Ma, Xiangyang Xue, Jian Pu
152
Temporally-Smooth Global Bundle Adjustment for Real-Time Dense Visual SLAM
Cabrel Wouladje, Golden Tendekai Mumanikidzwa, Md Apon Islam, Huiying Xu, Hongbo Li, Wenzhe Tan, Zhendong Chen, Xinzhong Zhu
153
Masked Next-Scale Prediction For Self-Supervised Scene Text Recognition
Zhuohao Chen, Zeng Li, Yifei Zhang, Chang Liu, Yu Zhou
154
iTCTSL: Interpretable Tropical Cyclone Track and Intensity Forecasting via Task Sensitive Learning
Pan Mu, Yuchao Zhu, Shiqi Zhang, Hanting Yan, Jinglin Zhang, Cong Bai
155
Machine Vision-Oriented Appearance Design: Generate Natural And Robust Textures For 3D Meshes
Weihang Ran, Qingtian Zhu, Mingdeng Cao, Wei Yuan, Isao Echizen, Yinqiang Zheng
156
Bridge Your Fields: MeteoNet for Efficient Non-Uniform Meteorological Field Reconstruction
Xuanming Jiang, Baoyi An, Dingyu Nie, Haoyu Ren, Zhengwei Zou, Yizhe Yang, Jialie Shen, Zhiwen Jin, Xueming Qian, Zhongyu Yang, Guoshuai Zhao
157
Catalyst: Out-of-Distribution Detection via Elastic Scaling, 16 | CVPR 2026 16 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE
Abid Hassan, Tuan Ngo, Saad Shafiq, Nenad Medvidovic
158
LUMINA: Learning and Understanding of Multimodal Information for Narrative and Affect-based Virality Prediction
Jiazhou Lin, Zhongyi Liu, Ying Shi, Zhichun Zhao, Zhuoyu Wang, Yuhang Zhou, Huanling Hu, Guangnan Ye, Mengtian Li, Lei Guo
159
LOOPE: Learnable Optimal Patch Order for Positional Encoders in Vision Transformers
Md Abtahi Majeed Chowdhury, Md Rifat Ur Rahman, Akil Ahmad Taki
160
Watermarking Matters for Deepfake Detection: A Proactive Method for Detecting Forgeries under Conventional Attacks
Zhiqiu Xia, Furong Mu, Qi Li, Shanshan Zhang, Jie Gui, Chunpeng Wang, Yunan Liu
161
CTFS : Collaborative Teacher Framework for Forward-Looking Sonar Image Semantic Segmentation with Extremely Limited Labels
Ping Guo, Chengzhou Li, Guanchen Meng, Qi Jia, Jinyuan Liu, Zhu Liu, Yu Liu, Zhongxuan Luo, Xin Fan
162
TPTransformer: Tensor–Tensor Product Transformer for Hyperspectral Image Super-Resolution
Honghui Xu, Chuangjie Fang, Yiqun Meng, Jiawei Jiang, Sixian Chan, Shiqing Zhang, Jianwei Zheng
163
Co-Adaptive Graph Learning Through Coupled Spectral Refinement for 3D Anomaly Detection
Hanvitha Saraswathi Mukkamala, Arun K Pujari
164
The Mechanics of CNN Filtering with Rectification
Liam Frija-Altarac, Matthew Toews
165
AndroidLong: LLM-based Android Agents Struggle with Long Looping Tasks
Xinghan Liu, Xiao Liu, Yifan Xu, Jiaqi Fu, Jiayu Huang, Yixuan Liu, Yuxiao Dong, Jie Tang
166
Multimodal Large Language Models as Image Classifiers
Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas
167
Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models
Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński
168
Exploring the best way for UAV visual localization under Low- altitude Multi-view Observation Condition: a Benchmark
Yibin Ye, Xichao Teng, Shuo Chen, Leqi Liu, Kun Wang, Xiaokai Song, Zhang Li
169
Benchmarking Layout-Guided Diffusion Models through Unified Semantic-Spatial Evaluation in Closed and Open Settings
Luca Parolari, Nicla Faccioli, Lamberto Ballan
170
RefDrone: A Challenging Benchmark for Referring Expression Comprehension in Drone Scenes
Zhichao Sun, Yepeng Liu, Zhiling Su, Huachao Zhu, Yuliang Gu, Yuda Zou, Zelong Liu, Gui-Song Xia, Bo Du, Yongchao Xu
171
Vision Language Models are Confused Tourists
Patrick Amadeus Irawan, Ikhlasul Akmal Hanif, Muhammad Dehan Al Kautsar, Genta Indra Winata, Fajri Koto, Alham Fikri Aji
172
LenghuSky-8: An 8-Year All-Sky Cloud Dataset with Star-Aware Masks and Alt-Az Calibration for Segmentation and Nowcasting
Yicheng Rui, Xiao-Wei Duan, Licai Deng, Fan Yang, Zhengming Dang, Zhengjun Du, Junhao Peng, Wenhao Chu, Umut Mahmut, Kexin Li, Yiyun Wu, Fabo Feng
173
Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
Mona Gandhi, K.J. Joseph, Srinivasan Parthasarathy, Sayan Nag
174
AEGIS: Exploring the Limit of World Knowledge Capabilities for Unified Multimodal Models
Jintao Lin, Bowen Dong, Weikang Shi, Chenyang Lei, Suiyun Zhang, Rui Liu, Xihui Liu
175
Name That Part: 3D Part Segmentation and Naming
Soumava Paul, Prakhar Kaushik, Ankit Vaidya, Anand Bhattad, Alan Yuille
176
Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior
Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau
177
Memorization in 3D Shape Generation: An Empirical Study
Shu Pu, Boya Zeng, Kaichen Zhou, Mengyu Wang, Zhuang Liu
178
Shape and Texture Recognition in Large Vision-Language Models
Sagi Eppel, Mor Bismut, Alona Strugatski
179
U-SEG: Uncertainty in SEGmentation - A systematic multi-variable exploration
Michael Smith, Frank P. Ferrie
180
UDVideoQA: A Traffic Video Question Answering Dataset for Multi- Object Spatio-Temporal Reasoning in Urban Dynamics
Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi
181
GOVTrack: Towards Generative Open-Vocabulary Multi-Object Tracking
Zekun Qian, Ruize Han, Zhixiang Wang, Liang Wan, Wei Feng
182
Towards Text-Guided Attribute-Disentangled Multimodal Representation Learning
Yibing Wei, Sudeep Katakol, Manuel Brack, Jinhong Lin, Haoyue Bai, Yu-Teng Li, Richard Zhang, Eli Shechtman, Hareesh Ravi, Ajinkya Kale
183
The DeepSpeak Dataset
Sarah Barrington, Maty Bohacek, Hany Farid
184
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents
Yue Cao, Yingyao Wang, Pi Bu, Jingxuan Xing, Wei Jiang, Zekun Zhu, Junpeng Ma, Sashuai Zhou, Tong Lu, Jun Song, Yu Cheng, Yuning Jiang, Bo Zheng
185
A2Z-10M+: Geometric Deep Learning with A-to-Z BRep Annotations for AI-Assisted CAD Modeling and Reverse Engineering
Pritham K Jena, Bhavika Baburaj, Tushar Anand, Vedant Dutta, Vineeth Ulavala, Sk Aziz Ali
186
MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition
Haote Yang, Hui Wang, Chen Zhu, Jingchao Wang, Linye Li, Hongbin Lai, Huijie Ao, Yongxuan Lv, Jiang Wu, Jiaxing Sun, Lua Chen, Yuanyuan Cao, Ruijie Zhang, Shengxin Lu, Lijun Wu, Bin Wang, Conghui He
187
FinChart-Multimodal: A Dataset for Context-Injected Financial Chart Understanding with Aligned OHLCV Time Series
Devansh Garg
188
THEval. Evaluation Framework for Talking Head Video Generation
Nabyl Quignon, Baptiste Chopin, Yaohui Wang, Antitza Dantcheva
189
PolyReal: A Benchmark for Real-World Polymer Science Workflows
Wanhao Liu, Weida Wang, Jiaqing Xie, Suorong Yang, Jue Wang, Benteng Chen, Guangtao Mei, Zonglin Yang, Shufei Zhang, Yuchun Mo, Lang Cheng, Jin Zeng, Houqiang Li, Wanli Ouyang, Yuqiang Li
190
OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models
Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin
191
PureSpace: A Benchmark for Abstract Spatial Reasoning in Vision- Language Models
Jinkai Li, Zhenliang Zhang, Lifeng Fan, Wei Wang
192
Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models
Junbo Niu, Yuanhong Zheng, Ziyang Miao, Hejun Dong, Chunjiang Ge, Hao Liang, Ma Lu, Bohan Zeng, Qiahao Zheng, Conghui He, Wentao Zhang
193
Beyond 3D Geometry: M3FD, a Large-Scale Dataset and Benchmark for Multimodal 3D Perceptual Understanding
Huan Hu, Ping Chen, Zezhou Chen, Zhaoxiang Liu, Zipeng Wang, Xiang Liu, Xin Wang, Kai Wang, Shiguo Lian
194
Paper2SysArch: Structure-Constrained System Architecture Generation from Scientific Papers
Ziyi Guo, Zhou Liu, Wentao Zhang
195
WildRelight: A Real-World Dataset and Benchmark for Single-Image Relighting
Lezhong Wang, Mehmet Onurcan Kaya, Siavash Arjomand Bigdeli, Jeppe Revall Frisvad
196
EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks
Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan
197
VibraVerse: A Large-Scale Geometry–Acoustics Alignment Dataset for Physically-Consistent Multimodal Learning
Bo Pang, Chenxi Xu, Jierui Ren, Guoping Wang, Sheng Li
198
When Harmful Content Goes Invisible: Unveiling Perception Failure of LVLMs with CAMOUHARMTI
Yanhui Li, Qi Zhou, Zhihong Xu, Huizhong Guo, Wenhai Wang, Dongxia Wang
199
Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answering
Lin Fan, Yafei Ou, Zhipeng Deng, Pengyu Dai, Chongxian Hou, Jiale Yan, Yaqian Li, Kaiwen Long, Xun Gong, Masayuki Ikebe, Yefeng Zheng
200
Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection
Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng
201
The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning
Garima Arya Yadav, Nilay Yilmaz, Yezhou Yang
202
Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media
Megha Mariam K.M, Vineeth N. Balasubramanian, C.V. Jawahar
203
MathAll: A Real-World Benchmark for Mathematical Reasoning and Cross-Modal Understanding Evaluation in Omni-MLLMs
Zhilin Lin, Zhihui Zhang, Shiliang Sun, Jing Zhao, Hao Yang
204
Safe-LLaVA: A Privacy-Preserving Vision Language Dataset and Benchmark for Biometric Safety
Younggun Kim, Sirnam Swetha, Fazil Kagdi, Mubarak Shah
205
DR-DPO: Dual-Regularized DPO for Efficient Dataset Condensation
Haiduo Huang, Jiangcheng Song, Yadong Zhang, Guansu Wang, Pengju Ren
206
DrawingVQA: A Real-World Benchmark for Multi-Depth Visual– Textual Reasoning on Construction Drawings
Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard
207
SciPostGen: Bridging the Gap between Scientific Papers and Poster Layouts
Shun Inadumi, Shohei Tanaka, Tosho Hirasawa, Atsushi Hashimoto, Koichiro Yoshino, Yoshitaka Ushiku
208
Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs
Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram
209
Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark
Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter
210
SuperGlasses: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses
Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Li Qing
211
InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models
Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao
212
VEBench: Benchmarking Large Multimodal Models for Real-world Video Editing
Andong Deng, Dawei Du, Zhenfang Chen, Wen Zhong, Fan Chen, Guang Chen, Chia-Wen Kuo, Longyin Wen, Chen Chen, Sijie Zhu
213
CrowdVerse: A Bidirectional Reality-Calibrated Benchmark for Crowd Understanding and Simulation
Pingrui Lai, Yanshan Zhou, Zihao Xie, Hua Yang
214
Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding
Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi
215
From Static Snapshots to Dynamic Trajectories: Evaluating and Enhancing the Learning Pathways of Multimodal Large Language Models
Yukang Feng, Wenxiao Wu, Jianwen Sun, Chuanhao Li, Fanrui Zhang, Zizhen Li, Jiaxin Ai, Sizhuo Zhou, Yifan Chang, Changxin Gao, Shenglin Zhang, Kaipeng Zhang
216
Evaluating Dataset Watermarking for Fine-Tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach
Xincheng Wang, Hanchi Sun, Wenjun Sun, Kejun Xue, Wangqiu Zhou, Jianbo Zhang, Wei Sun, Dandan Zhu, Xiongkuo Min, Jun Jia, Zhijun Fang
217
BMD-45: A Large-Scale CCTV Vehicle Detection Dataset for Urban Traffic in Developing Cities
Akash Sharma, Chinmay Mhatre, Sankalp Gawali, Ruthvik Bokkasam, Brij Sharma, Vishwajeet Pattanaik, Punit Rathore, Raghu Krishnapuram, Vijay Gopal Kovvali, Anirban Chakraborty, Yogesh Simmhan
218
SciGA: A Comprehensive Dataset for Designing Graphical Abstracts in Academic Papers
Takuro Kawada, Shunsuke Kitada, Sota Nemoto, Hitoshi Iyatomi
219
Splatwizard: A Benchmark Toolkit for 3D Gaussian Splatting Compression
Xiang Liu, Yimin Zhou, Jinxiang Wang, Yujun Huang, Shuzhao Xie, Shiyu Qin, Mingyao Hong, Jiawei Li, Yaowei Wang, Zhi Wang, Shu-Tao Xia, Bin Chen
220
See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models
Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee
221
Unlocking ImageNet’s Multi-Object Nature: Automated Large- Scale Multilabel Annotation, PROGRAM GUIDE MAIN CONFERENCE | 1717
Junyu Chen, Md Yousuf Harun, Christopher Kanan
222
CATS-V2V: A Real-World Vehicle-to-Vehicle Cooperative Perception Dataset with Complex Adverse Traffic Scenarios
Hangyu Li, Bofeng Cao, Zhaohui Liang, Wuzhen Li, Juyoung Oh, Yuxuan Chen, Shixiao Liang, Hang Zhou, Chengyuan Ma, Jiaxi Liu, Zheng Li, Peng Zhang, Keke Long, Maolin Liu, Jackson Jiang, Chunlei Yu, Shengxiang Liu, Hongkai Yu, Xiaopeng Li
223
Seeing the Abstract: A Benchmark for Visual-Only Metaphor Understanding in Multimodal Large Language Models
Shan Zhao, Zhao Yang, Tianwei Yan, Yusong Gong, Qian Wan, Shizhao Chen, Shezheng Song, Chengyu Wang, Meng Wang
224
Cross-Dimensional Forgery Pattern Extraction for Generalizable Forgery Localization Framework
Yilin Wang, Dawei Luo, Shuai Chen, Feng Xu, Jiachi Wang, Zunlei Feng, Yijun Bei
225
Reliable Test-time Adaptation Via Evidential Uncertainty Modeling in Vision–Language Models
Yiwei You, Zan Chen, Bo Wang, Xiaofei Zhou
226
SPOT: Sparsification with Attention Dynamics via Token Relevance in Vision Transformers
Oded Schlesinger, Amirhossein Farzam, J. Matias Di Martino, Guillermo Sapiro
227
Do LLMs and VLMs Share Reasoning Neurons? Evidence and Mechanisms of Cross-Modal Transfer
Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua
228
Debiased One-Shot NAS Via Density-Aware Sampling
Mehraveh Javan Roshtkhari, Matthew Toews, Marco Pedersoli
229
PSLIF: A Primary-Supplementary LIF Neuron for Spiking Neural Networks
Jie Guo, JunXiang Wu, Nan An, Zhen Zhang, Shuiying Xiang, Mingjin Zhang, Yunsong Li, Yu'e Gao
230
SHIELD: Secure Hypernetworks for Incremental Expansion Learning Defense
Patryk Krukowski, Łukasz Gorczyca, Piotr Helm, Kamil Książek, Przemysław Spurek
231
Eigen-Value: Efficient Domain-Robust Data Valuation Via Eigenvalue- Based Approach
Youngjun Choi, Joonseong Kang, Sungjun Lim, Kyungwoo Song
232
In2CLR: Joint Intra-Inter Curriculum Learning with Review for Degraded Fake Image Detection
Yunxuan Li, Bohao Liu, Yanxia Wu, Rongsheng Li
233
HAMSA: Scanning-Free Vision State Space Models via SpectralPulseNet
Badri N Patro, Vijay S Agneeswaran
234
Latent Domain Modeling Improves Robustness to Geographic Shifts
Ruth Crasto, Esther Rolf
235
Any-Class Presence Likelihood for Robust Multi-Label Classification with Abundant Negative Data
Dumindu Tissera, Omar Awadallah, Muhammad Umair Danish, Ayan Sadhu, Katarina Grolinger
236
VideoMatGen: PBR Materials through Joint Generative Modeling
Jon Hasselgren, Miloš Hašan, Zheng Zeng, Jacob Munkberg
237
TransKV: A Data-Driven Pruning Method for Large Foundation Models
Guangning Xu, Fanxu Meng, Ruijie Zhou, Michael K Ng, Wenjie Pei, Muhan Zhang
238
Rich Feature Learning via Diversification
Xi Leng, Yongqiang Chen, Xiaoying Tang, Yatao Bian
239
Image Classification Using CNN-QNN Hybrid Model with Optimized Correlated Features
Minseo Seong, Youngwook Kim
240
Dual Strategies for Test-Time Adaptation
Nam Nguyen Phuong, Duc Nguyen The Minh, Phi Le Nguyen, Ehsan Abbasnejad, Minh Hoai
241
CPUBone: Efficient Vision Backbone Design for Devices with Low Parallelization Capabilities
Moritz Nottebaum, Matteo Dunnhofer, Christian Micheloni
242
FLToM: Robust Federated Learning with Theory-of-Mind Structure
Tianshu Xiao, Liu Yang, Sichang Guo, Qilong Wang, Qinghua Hu
243
FedCVC: Federated Primal-Dual Learning with Client-Driven Virtual Compensation for Mitigating Dual Drift
Jinshan Lai, Tingxuan Huang, Baoyang Jiang, Liuyu Xiang, Qiang Ma, Jianwei Hu
244
Q-MambaIR: Accurate Quantized Mamba for Efficient Image Restoration
Yujie Chen, Haotong Qin, Zhang Zhang, Michele Magno, Luca Benini, Yawei Li
245
PHATE-Net: Differentiable Pseudotime Learning for Trustworthy Disease Trajectories in PET
Yixin Chen, Yan Wang, Wenrui Shao, Zhaoheng Xie
246
PoM: A Linear-Time Replacement for Attention with the Polynomial 18 | CVPR 2026 18 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE Mixer
David Picard, Nicolas Dufour, Lucas Degeorge, Arijit Ghosh, Davide Allegro, Tom Ravaud, Yohann Perron, Corentin Sautier, Zeynep Sonat Baltaci, Fei Meng, Syrine Kalleli, Marta López-Rauhut, Thibaut Loiseau, Ségolène Albouy, Raphael Baena, Elliot Vincent, Loic Landrieu
247
Qinling-GFFE: A Novel Station-based Benchmark and Graph- Frequency Fusion Enhancer for Precipitation Forecasting
Zhenhe Liang, Congqi Cao, Lanshu Hu, Liujie Pan
248
Deep Feedback ConvNets by Embedding the Working Memory Module for Image Classification
Lulu Fang, Jiaxiang Qin, Ruiheng Yan, Ning Pan, Haihua Liu, Xinxin Chen
249
Channel Correlation Loss for Binary Neural Networks
Xindi Zuo, Wei Zhang, Hai Yu, Zhiliang Zhu
250
MegAD: An Expert in Meta-Learning Guided Few-Shot Anomaly Detection
Xinying Li, Junfeng Jing, Tong Wu, Tian Gao, Zhihong Sheng
251
SGST-Transformer: A Spherical Geometry-Aware Spatio-Temporal Transformer for 360° Video Saliency Prediction
Kao Zhang, Tao Song, Zhihua Hu, Ming Li, Xin Ding
252
From Drops to Grid: Noise-Aware Spatio-Temporal Neural Process for Rainfall Estimation
Rafael Pablos Sarabia, Joachim Nyborg, Morten Birk, Ira Assent
253
AdaPerceiver: Transformers with Adaptive Width, Depth, and Tokens
Purvish Jajal, Nicholas John Eliopoulos, Benjamin Shiue-Hal Chou, George K Thiruvathukal, Yung-Hsiang Lu, James C. Davis
254
Texture-Guided Multiscale Cross-Modal Fusion for AI-Generated Image Quality Assessment
Qinlin Hu, Mingliang Zhou, Xingran Liao
255
Res2SPDNet: Multi-Granularity SPD Matrix Residual Learning for Signal Classification
Shenghui Yue, Rui Wang, Tianyang Xu, Tao Zhou, Xiao-Jun Wu, Josef Kittler
256
From Navigation to Refinement: Revealing the Two-Stage Nature of Flow-based Diffusion Models through Oracle Velocity
Haoming Liu, Jinnuo Liu, Yanhao Li, Liuyang Bai, Yunkai Ji, Yuanhe Guo, Shenji Wan, Hongyi Wen
257
MambaEye: A Size-Agnostic Visual Encoder with Causal Sequential Processing
Changho Choi, Minho Kim, Jinkyu Kim
258
Spectral-Aware Adaptive Convolution for Fine-Grained Cross-View Visual Localization
Linsi Wu, Gang Shen, Xuefei Lv, Chenglong Wu, Yuru Pei
259
Context-Aware Semantic Segmentation via Stage-Wise Attention
Antoine Carreaud, Elias Naha, Arthur Chansel, Nina Lahellec, Jan Skaloud, Adrien Gressin
260
MFI-ResNet: Efficient ResNet Architecture Optimization via MeanFlow Compression and Selective Incubation
Nuolin Sun, Linyuan Wang, Haonan Wei, Lei Li, Bin Yan
261
AlphaMerging: Orthogonal Subspace Projection of Task Vectors to Reduce Task Interference for Multi-Task Model Merging
Zuchi Bazarvaani, Seung-Ho Lee, Jeongmin Ahn, Donghyeon Jeon, Inho Kang, Seung-Hoon Na
262
Rethinking Compact (<1M) Vision Models: Balancing Accuracy and Speed through Multi-Path Atrous Convolutions
Christos Kyrkou
263
Hi3Doc: Hierarchical Tri-Level Representations for Multimodal Long- Document Understanding
Wanying Zhou, Zhuo Chen, Jianzhi Lu, Chenxi Ma, Weimin Tan, Bo Yan
264
LongDocSpan: Extending LVLMs for Long Document Understanding
Junwei Liu, Xiong Wang, Junchao Wu, Yefeng Liu, Congyun Jin, Jiangwei Lao, Junjie Wang, Derek F. Wong, Zhihong Lu, Jian Wang, Ping Wang
265
M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image- Text in Document Summarization?
Haolong Yan, Kaijun Tan, Yeqing Shen, Xin Huang, Jia Wang, Zheng Ge, Xiangyu Zhang, Si Li, Daxin Jiang
266
InstructTable: Improving Table Structure Recognition Through Instruction
Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan
267
SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters
Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku
268
Efficient Document Parsing via Parallel Token Prediction
Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li
269
ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning
Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Cheng-Lin Liu
270
RedVTP: Training-Free Acceleration of Diffusion Vision-Language Models Inference via Masked Token-Guided Visual Token Pruning
Jingqi Xu, Jingxi Lu, Chenghao Li, Sreetama Sarkar, Souvik Kundu, Peter A Beerel
271
FREE-Switch: Frequency-Based Dynamic LoRA Switch for Style Transfer
Shenghe Zheng, Minyu Zhang, Tianhao Liu, Hongzhi Wang
272
FedVG: Gradient-Guided Aggregation for Enhanced Federated Learning
Alina Devkota, Jacob Thrasher, Donald Adjeroh, Binod Bhattarai, Prashnna k. Gyawali
273
What and Where to Adapt: Structure–Semantics Co-Tuning for Machine Vision Compression via Synergistic Adapters
Shaobo Liu, Haobo Xiong, Kai Liu, Yuna Lin
274
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu
275
GM-Skip: Metric-Guided Transformer Block Skipping for Efficient Vision-Language Models
Lianming Huang, Haibo Hu, Qiao Li, Xin He, Nan Guan, Chun Jason Xue
276
Dyna-ViT: Parameter-Free Pre-Encoder Token Pruning for Efficient Vision Transformers
Syeda Fiza Rubab, Arslan Abdul Ghaffar, Malik Junaid Jami Gul, Sheriff Murtala, Ingyu Lee, Gyu Sang Choi
277
Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention
Wenhu Zhang, Yiming Wu, Huanyu Wang, YaoYang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia
278
MaMe: Matrix-Based Token Merging
Simin Huo, Ning Li
279
Tiny Inference-Time Scaling with Latent Verifiers
Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara
280
DaMN: Deleting and Migrating Normalization Layers from Transformers
Alexey Ryabykin, Irina Zhelavskaya, Egor Shvetsov, Alexey Rukhovich, Nikita Okhotnikov, Artem Khrapov, Evgeny Burnaev, Vladimir Mikhailovich Kryzhanovskiy
281
Enriching Knowledge Distillation with Cross-Modal Teacher Fusion
Amir M. Mansourian, Amir Mohammad Babaei, Shohreh Kasaei
282
UNIFORM: Unifying Knowledge from Large-scale and Diverse Pre-trained Models
Yimu Wang, Weiming Zhuang, Chen Chen, Jiabo Huang, Jingtao Li, Lingjuan Lyu
283
ProGIC: Progressive and Lightweight Generative Image Compression with Residual Vector Quantization
Hao Cao, Chengbin Liang, Wenqi Guo, Zhijin Qin, Jungong Han
284
MipKV: A Sparsify-then-Recover Paradigm for Accelerating Large Vision-Language Model Pre-Filling
Junming Zhang, Yifei Ji, Yongxuan Han, Zhenzhe Zheng
285
Mix-to-Max: Optimizing Data Mixtures for Peak Vision-Language Efficiency
Erwei Zhao, Haijin Zeng, Weiwei Xiao, Shijie Cao, Qiben Shan, Shaocong Wu, Jingyong Su, Jie Liu
286
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
Parsa Madinei, Ryan Solgi, Ziqi Wen, Jonathan Skaza, Miguel Eckstein, Ramtin Pedarsani
287
JetViT: Efficient High-Resolution Vision Transformer with Post- Training Attention Search
Dongyun Zou, Zhuoyang Zhang, Junyu Chen, Wenkun He, Qinhe Peng, Hanrong Ye, Yao Lu, Hongxu Yin, Yu Wang, Song Han, Han Cai
288
SLAD : Shared LoRA Adapters for Task Specific Distillation
Reda Bensaid, Yassir Bendou, Vincent Gripon, François Leduc-Primeau
289
D4C: Data-Free Quantization for Contrastive Language-Image Pre- Training Models
Wenlun Zhang, Yunshan Zhong, Zihao Ding, Xinyu Li, Kentaro Yoshioka
290
ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers
Chih-Chung Hsu, Xin-Di Ma, Wo-Ting Liao, Chia-Ming Lee
291
MPM: Mutual Pair Merging for Efficient Vision Transformers
Simon Ravé, Pejman Rasti, David Rousseau
292
Generalized Neighborhood Attention: Multi-dimensional Sparse Attention at the Speed of Light
Ali Hassani, Fengzhe Zhou, Aditya Kane, Jiannan Huang, Chieh-Yun Chen, Min Shi, Steven Walton, Markus Hoehnerbach, Vijay Thakkar, Mikhail Isaev, Qinsheng Zhang, Bing Xu, Haicheng Wu, Wen-mei Hwu, Ming-Yu Liu, Humphrey Shi
293
AlignFL: Adaptive Learning and Intelligent Generation of Networks for Federated Learning
Qilin Xiang, Qilin Fan, Xinrui Li, Tianfu Wang, Shuting Qiu, Yue Niu
294
Beyond Loss Values: Robust Dynamic Pruning via Loss Trajectory Alignment
Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Kai Wang, Zheng Wang, Peng Hu, Xi Peng, Hongyuan Zhu
295
Positive Divide and Negative Discrepancy: A New Perspective on Multi-Label Logit Distillation
Cong Li, Gong Cheng
296
Beyond Accuracy: An Empirical Study of Perception Stability in Multimodal Large Language Models
Feng Chen, Chenhui Gou, Yefei He, Yang Yang, Bohan Zhuang, Qi Wu
297
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
Zhenghui Guo, Yuanbin Man, Junyuan Sheng, Bowen Lin, Ahmed Ahmed, Bo Jiang, Boyuan Zhang, Miao Yin, Sian Jin, Omprakash Gnawali, Chengming Zhang
298
M^3A Policy: Mutable Material Manipulation Augmentation Policy through Photometric Re-rendering
Jiayi Li, Yuxuan Hu, Haoran Geng, Xiangyu Chen, Chuhao Zhou, Ziteng Cui, Jianfei Yang
299
AOMGen: Photoreal, Physics-Consistent Demonstration Generation for Articulated Object Manipulation
Yulu Wu, Jiujun Cheng, Haowen Wang, Dengyang Suo, Pei Ren, Qichao Mao, Shangce Gao, Yakun Huang
300
Environmental Understanding Vision-language Model for Embodied Agent
Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim
301
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding With a Homogeneous Framework
Yani Zhang, Dongming Wu, Hao Shi, Yingfei Liu, Tiancai Wang, Xingping Dong
302
Prune-Then-Plan: Step-Level Calibration for Stable Frontier Exploration in Embodied Question Answering
Noah Frahm, Prakrut Patel, Yue Zhang, Shoubin Yu, Mohit Bansal, Roni Sengupta
303
Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents
Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach
304
Plug-and-Think: Structured Reasoning for Vision–Language–Action Models
Kaikai Wei, Di wen, Xinhai Li, Senwei Xiang
305
World Model Robustness via Surprise Recognition
Geigh Zollicoffer, Tanush Chopra, Mingkuan Yan, Xiaoxu Ma, Kenneth Eaton, Mark Riedl
306
PlanGS: Active 3D Gaussian Reconstruction with Real-Time Planning
Wenxiang Xie, Anpei Chen, Haoming Yu, Yujun Shen, Weiwei Xu
307
A Simple Framework for Visual Navigation
Faith Johnson, Bryan Bo Cao, Shubham Jain, Ashwin Ashok, Kristin Dana
308
Event-Based Optical Flow Leveraging Precise Event Timing
Hugh Greatorex, Elisabetta Chicca
309
Generative Event Pretraining with Foundation Model Alignment
Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza
310
HelixTrack: Event-Based Tracking and RPM Estimation of Propeller- like Objects
Radim Spetlik, Michal Pliska, Vojtěch Vrba, Jiří Matas
311
PEPR: Privileged Event-based Predictive Regularization for Domain Generalization
Gabriele Magrini, Federico Becattini, Niccolò Biondi, Pietro Pala
312
Unleashing the Potential of Event-Based Stereo Via Coarse-to-Fine Bio-Inspired Regression
Haihao Zhang, Siwei Dong, Jianing Li, Rui Zhao, Yunjian Zhang, Geng Qin, Lin Zhu
313
Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks
Yachan Guo, Jose Lu Gómez, Danna Xue, Yi Xiao, Antonio M. López
314
An Interpretable Alzheimer's Disease Diagnosis Model via Gray Matter Attention Guided Counterfactual Reasoning
Pengzhou Chen, Qiling Tang, XinYu Chai, Rong Liu, Zhi Li, Liman Liu
315
Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP
Yusung Ro, Jaehyun Choi, Junmo Kim
316
CLIP-Free, Label Free, Unsupervised Concept Bottleneck Models
Fawaz Sammani, Jonas Fischer, Nikos Deligiannis
317
Concept-wise Attention for Fine-grained Concept Bottleneck Models, PROGRAM GUIDE MAIN CONFERENCE | 1919
Minghong Zhong, Guoshuai Zou, Kanghao Chen, Dexia Chen, Ruixuan Wang
No matches.