‹ June 6 schedule

Findings Posters

Sat · June 6 · 7:30–9:00 AM · ExHall A — 319 papers
319 papers
1
Beyond Top-1: Forensic Analysis of Full Prediction Distributions Reveals Hidden Model Reasoning
Minhyeok Lee
2
Zero-Shot Textual Explanations via Translating Decision-Critical Features
Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto
3
DMin: Scalable Training Data Influence Estimation for Diffusion Models
Huawei Lin, Yingjie Lao, Weijie Zhao
4
A Framework for Evaluating Zero-Shot Image Generation in Concept- Based Explainability
Giacomo Astolfi, Matteo Bianchi, Riccardo Campi, Antonio De Santis, Marco Brambilla
5
Self-Guided Integrated Gradient Method for Attribution, 50 | CVPR 2026 50 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE
Sabrina Henry, Alice Ruget, Stirling Scholes, Jonathan Leach
6
Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking
Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu
7
Discovering Attention Head Interactions in Vision Transformers
Zhenyu Lu, Yuheng Jia, Wei You, Hao Chen
8
Value bounds and Convergence Analysis for Averages of LRP attributions
Alexander Binder, Nastaran Takmil-Homayouni, Urun Dogan
9
MReactor: Offline Multiple Appropriate Facial Reaction Generation with Hierarchical Cognitive Disentanglement
Jiachen Luo, Jiajun He, Shuai Shen, Lin Wang, Huy Phan, Joshua Reiss, Lin Haijun, Bjoern Schuller, Zeyu Fu, Siyang Song
10
B-MoE: A Body-Part-Aware Mixture-of-Experts “All Parts Matter” Approach to Micro-Action Recognition
Nishit Poddar, Aglind Reka, Diana-Laura Borza, Snehashis Majhi, Michal Balazia, Abhijit Das, François Brémond
11
Learning by Neighbor-Aware Semantics, Deciding by Open-Form Flows: Towards Robust Zero-Shot Skeleton Action Recognition
Yang Chen, Miaoge Li, Zhijie Rao, Deze Zeng, Song Guo, Jingcai Guo
12
Actionable Human Motion Generation via Latent Imitation and Fine- Grained Text Completion
Feiyang Xie, Haoqi Yuan, Zongqing Lu
13
GHOST: Fast Category-Agnostic Hand-Object Interaction Reconstruction from RGB Videos Using Gaussian Splatting
Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker
14
Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D
Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll
15
CoherentHand: Temporally Consistent 3D Hand Trajectory Synthesis with Semantic Motion Priors
Bikram Boote, Junho Kim, Ozgur Kara, Sangmin Lee, James M Rehg
16
Weakly Supervised Micro-Expression Spotting based on Boundary Refinement Mechanism and Cross-subject Learning Representation
Zhihua Xie, Haolin Chang, Guohua Miao, Jianing Chen
17
FUSION: Full-body Unified Motion Prior for Body and Hands Via Diffusion
Enes Duran, Nikos Athanasiou, Muhammed Kocabas, Michael J. Black, Omid Taheri
18
BridgeDiffusion: Latent Space Optimization for Independent Body- Part Generation with Motion Consistency Bridges in Interactive Dance, MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial
Yufei Huo, Ao Li, Wenxun Dai, Songli Wu, Yansong Tang
19
Odometry
Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja
20
BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices, WHOLE: World-Grounded Hand-Object Lifted from Egocentric
Mincheol Kang, HyunJin Lim, Bomin Kang, Daehee Park
21
Videos, TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking
Yufei Ye, Jiaman Li, Ryan Rong, C. Karen Liu
22
Head Synthesis, How2Sign-Synth3D: Markerless Holistic Sign Language Performance
Shunian Chen, Hejin Huang, Yexin Liu, Zihan Ye, Pengcheng Chen, Chenghao Zhu, Michael Guan, Rongsheng Wang, Junying Chen, Jianye Hou, Bo Li, Guanbin Li, Ser-Nam Lim, Harry Yang, Benyou Wang
23
Capture and Synthetic Data for Dense Landmark Tracking, SocialMirror: Reconstructing 3D Human Interaction Behaviors from
Levente Tempfli, Stephan Huber, Oscar Koller, Amanda Duarte
24
Monocular Videos with Semantic and Geometric Guidance, EggHand: A Multimodal Foundation Model for Egocentric Hand Pose
Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma
25
Forecasting
Jaeyoung Choi, Hyeondong Kim, Yujin Kim, Daehee Park
26
Towards Metric-Aware Multi-Person Mesh Recovery by Jointly Optimizing Human Crowd in Camera Space
Kaiwen Wang, Kaili Zheng, Yiming Shi, Chenyi Guo, Ji Wu
27
VoxFace: Streaming Audio-Visual Synthesis via Relay-Style Multi- Token Prediction for Interactive Conversation
Junwen Xiong, Chuanyue Li, Peng Zhang
28
OmniHead: A Unified Model for Dynamic Nonverbal Facial Behaviors
Pierre Vuillecard, Jean-Marc Odobez
29
Detecting Precise Hand Touch Moments in Egocentric Video
Huy Anh Nguyen, Feras Dayoub, Minh Hoai
30
Less is More: Multimodal Human Pose Estimation with Selective Fusion
Yutong Xu, Qianyi Huang, Xu Chen
31
PHYLOMAN: Generative Behavior Control via Fusing LLM Planning and Physics-based Control
Jusheng Zhang, Jinzhou Tang, Sidi Liu, Jian Wang, Keze Wang
32
Contact Matrix: Enhancing Dance Motion Synthesis with Precise Interaction Modeling
Xuhai Chen, Zhi Cen, Huaijin Pi, Sida Peng, Xiaowei Zhou, Yong Liu
33
Learning Predictive Visuomotor Coordination
Wenqi Jia, Bolin Lai, Xu Cao, Miao Liu, Danfei Xu, James M. Rehg
34
FSMC-Pose: Frequency and Spatial Fusion with Multiscale Self- Calibration for Cattle Mounting Pose Estimation
Fangjing Li, Zhihai Wang, Xinxin Ding, Haiyang Liu, Ronghua Gao, Rong Wang, Yao Zhu, Ming Jin
35
Bootstrapping Sign Language Annotations with Sign Language Models
Colin Lea, Vasileios Baltatzis, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater
36
OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation
Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu
37
THOM: Generating Physically Plausible Hand-Object Meshes From Text
Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim
38
ExposeAnyone: Personalized Audio-to-Expression Diffusion Models Are Robust Zero-Shot Face Forgery Detectors
Kaede Shiohara, Toshihiko Yamasaki, Vladislav Golyanik
39
All-Age Human Mesh Recovery
Laura Bravo-Sánchez, Matthieu Armando, Romain Brégier, Grégory Rogez, Serena Yeung-Levy, Fabien Baradel
40
GeneFlow: Modeling Heredity and Variation via Flow Matching Transformers for Kinship Verification
Yihang Wu, Xianxu Hou, Linlin Shen
41
Dynamic Full-body Motion Agent with Object Interaction via Blending Pre-trained Modular Controllers
Sanghyeok Nam, Byoungjun Kim, Daehyung Park, Tae-Kyun Kim
42
MotionDuet: Dual-Conditioned 3D Human Motion Generation with Video-Regularized Text Learning
Yi-Yang Zhang, Tengjiao Sun, Pengcheng Fang, Deng-Bao Wang, Xiaohao Cai, Min-Ling Zhang, Hansung Kim
43
Fast-HOI: Fast Human-Object Interaction Synthesis via Distilled Interaction Prior and Physical Constrains, HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking
Xiaokang Pan, Zhizhong Zhang, Yangyuan Liu, Zhuoran Chen, Zhiwei Zhang, Bin Ji, Mingang Chen, Yong Xie, Jingyu Gong, Xuhong Wang, Xin Tan, Yuan Xie
44
Head Synthesis
Shiyu Liu, Kui Jiang, Junjun Jiang, Xianming Liu, Xiaocheng Feng, Fei Ma, Hongxun Yao, Qi Tian
45
GeoHOI: Geometry-Enhanced Human-Object Interaction Video Generation via Hierarchical Multi-Modal Injection, TAUE: Training-free Noise Transplant and Cultivation Diffusion
Ziyi Xu, Zejing Rao, Juan Cao, Xiaoqiang Liu, Zhixue Fang, Haoxian Zhang, Songlin Tang, Fan Tang
46
Model, GR-Diffusion: Graph-Guided Relational-Aware Diffusion via Attention
Daichi Nagai, Ryugo Morita, Shunsuke Kitada, Hitoshi Iyatomi
47
Alignment, V-GRPO: Online Reinforcement Learning for Denoising Generative
Xiaochen Liu, Xiaoting Xi, Chao Yin, Xiaoqiang Li, Daoguo Dong
48
Models Is Easier than You Think, FREESTYLE: An Anchor-Free Mechanism for Training-Free Style-
Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena Yeung-Levy
49
Aligned Image Generation, Is Your Text-to-Image Model Robust to Caption Noise?
Minseok Oh, Jihun Park, Jongmin Gim, Minwoo Choi, Kyoungmin Lee, Ferdinando Fioretto, Sunghoon Im Weichen Yu,
50
Ziyan Yang, Shanchuan Lin, Qi Zhao, Jianyi Wang, Liangke Gui, Matt Fredrikson, Lu Jiang
51
Decomposing Subject-Driven Image Generation via Intermediate Structural Prediction
Hanzhong Guo, Yizhou Yu
52
RectifiedHR: Enable Efficient High-Resolution Synthesis via Energy Rectification
Zhen Yang, Guibao Shen, Minyang Li, Liang Hou, Mushui Liu, Luozhou Wang, Xin Tao, Ying-Cong Chen
53
ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding
Tianze Xia, Zijian Ning, Zonglin Zhao, Mingjia Wang
54
Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Don’t Know Galileo’s Principle...for now
Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad
55
Group Relative Attention Guidance for Image Editing
Xuanpu Zhang, Xuesong Niu, Ruidong Chen, Dan Song, Jianhao Zeng, Penghui Du, Haoxiang Cao, Kai Wu, An-an Liu
56
ControlPose: High-Fidelity Pose-Controlled Image Generation with Multi-Faceted Pose Disentanglement
Zhongjing Du, Xiao Chen, Zhiwei Nie, Yuxuan Chen, Chang Liu, Xiangyang Ji, Jie Chen
57
FlowC2S: Flowing from Current to Succeeding Frames for Fast and Memory-Efficient Video Continuation
Hovhannes Margaryan, Quentin Bammey, Christian Sandor
58
Latent-Compressed Variational Autoencoder for Video Diffusion Models
Jiarui Guan, Wenshuai Zhao, Zhengtao Zou, Juho Kannala, Arno Solin
59
Deep Parameter Interpolation for Scalar Conditioning
Chicago Y. Park, Michael T. McCann, Cristina Garcia-Cardona, Brendt Wohlberg, Ulugbek S. Kamilov
60
Mining Real-World Image Relations for Large-Scale Controllable Generation and Editing
Hao Shao, Liyang Liu, Zhengxiong Luo, Zhuofan Zong, Hongsheng Li
61
Disentangle Once, Control All: A Unified and Efficient Framework for Disentangling Multi-Condition Control in Human Video Generation
Runqi Wang, Chuming Wang, Fangqiu Yi, Yuying Zhao, Jingyu Xu, Yuhang Dai, Zheng Wang, Chi Zhang
62
HAM: A Training-Free Style Transfer Approach via Heterogeneous Attention Modulation for Diffusion Models
Yeqi He, Liang Li, Zhiwen Yang, Xichun Sheng, Zhidong Zhao, Chenggang Yan
63
Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication
Yi Zhang, Hongbo Huang, Liang-Jie Zhang
64
Video4Spatial: Towards Visuospatial Intelligence with Context- Guided Video Generation
Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Mohammad H. Taghavi, Xingang Pan
65
Text-Driven Reasoning Video Editing via Reinforcement Learning on Digital Twin Representations
Yiqing Shen, Chenjia Li, Mathias Unberath
66
Beyond Optimal Transport: Model-Aligned Coupling for Flow Matching
Yexiong Lin, Yu Yao, Yang Zhou, Tongliang Liu
67
Stochastic Perturbations Improve Distribution-to-Distribution Generative Models
Shiye Su, Yuhui Zhang, Linqi Zhou, Rajesh Ranganath, Serena Yeung-Levy
68
StereoSpace: Depth-Free Synthesis of Stereo Geometry via End-to- End Diffusion in a Canonical Space, FA-MoE: Improving Medical Image Generation Through Frequency-
Tjark Behrens, Anton Obukhov, Bingxin Ke, Fabio Tosi, Matteo Poggi, Konrad Schindler
69
Aware Mixture of Experts, Generated Reality: Human-Centric World Simulation Using Interactive
Yifan Sun, Qingjie Meng, Tao Chen, Huiping Chen
70
Video Generation with Hand and Camera Control, VHOI: Controllable Video Generation of Human–Object Interactions
Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein
71
from Sparse Trajectories via Motion Densification, LoViC: Efficient Long Video Generation with Context
Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt
72
Compression, FedErase: Personalized Federated Unlearning for Text-to-Image
Jiaxiu Jiang, Wenbo Li, Jingjing Ren, Yuping Qiu, Renjing Pei, Fenglong Song, Yong Guo, Xiaogang Xu, Han Wu, Wangmeng Zuo
73
Diffusion Models, Zero4D: Training-Free 4D Video Generation From Single Video Using
Tianyu Geng, Wenfei Liang, Sijie Wang, Rui She, Wee Peng Tay
74
Off-the-Shelf Video Diffusion Models
Jangho Park, Taesung Kwon, Jong Chul Ye
75
Earthquake-Bench: Video Generation Benchmark for Earthquake Simulation
Lei Bao, Hao Chen, Yuyan Chen, Kui Wu, Lijia Chen, Fangwei Zhong, Feiran Huang, Bo Song, Han Yang
76
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
Jinshu Chen, Xinghui Li, Xu Bai, Tianxiang Ma, Pengze Zhang, Mengtian Li, Zhuowei Chen, Gen Li, Lijie Liu, Songtao Zhao, Bingchuan Li, Qian He
77
Block Cascading: Training Free Acceleration of Block-Causal Video Models, PROGRAM GUIDE MAIN CONFERENCE | 5151
Hmrishav Bandyopadhyay, Nikhil Pinnaparaju, Rahim Entezari, Jim Scott, Yi-Zhe Song, Varun Jampani
78
Activation-Norm Maximization to Accelerate Training in Flow- Matching Transformers
Yash Belhe, Wesley Chang, Tzu-Mao Li, Ravi Ramamoorthi, Michaël Gharbi
79
FREE: Uncertainty-Aware Autoregression for Parallel Diffusion Transformers
Xinwan Wen, Bowen Li, Jiajun Luo, Ye Li, Zhi Wang
80
No Cache Left Idle: Accelerating diffusion model via Extreme- Slimming Caching
Tingyan Wen, Haoyu Li, Yihuang Chen, Xing Zhou, Lifei Zhu, XueQian Wang
81
Inference-Time Alignment of Diffusion Models with Evolutionary Algorithms
Purvish Jajal, Nicholas John Eliopoulos, Benjamin Shiue- Hal Chou, George K Thiruvathukal, James C. Davis, Yung-Hsiang Lu
82
TokenErase: Robust Concept Erasure via Visual-Injected Token Optimization
Liangshun Zou, Zhangkai Ni, Hanli Wang
83
VisionCreator: A Native Visual-Generation Agentic Model with Understanding, Thinking, Planning and Creation
Jinxiang Lai, Zexin Lu, Jiajun He, Rongwei Quan, Wenzhe Zhao, Qinyu Yang, Qi Chen, Qin Lin, Chuyue Li, Tao Gao, Yuhao Shan, Song Guo, Qinglin Lu
84
Animated-ART: Multi-Layer Transparent Video Generation
Ziqiang Li, Yunnan Wang, Dong Chen, Yue Dong, Ji Li, Yuhui Yuan, Xin Jin
85
Rethinking Conditioning in Diffusion Models: Dynamic Token Scheduling for Efficient and Aligned Text-to-Image Generation
Jia Li, Xiaomeng Fu, Yizhao Gao, Jiaxu Wang, Xi Wang, Hayden Kwok-Hay So
86
Attention-Guided Energy Optimization for Label-Aligned Anomaly Generation
Zhibin Wan, Zhiqiang Gao, Mingjie Sun, Yupei Wu, Guohong Fu, Ran Yi
87
USV: Unified Sparsification for Accelerating Video Diffusion Models
Xinjian Wu, Hongmei Wang, Yuan Zhou, Qinglin Lu
88
OminPSD: Layered PSD Generation with Diffusion Transformer
Cheng Liu, Yiren Song, Haofan Wang, Mike Zheng Shou
89
Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA
Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu
90
Depth Adaptive Efficient Visual Autoregressive Modeling
Chunliang Li, Tianze Cao, Sanyuan Zhao
91
Cross-Resolution Diffusion Models Via Network Pruning
Jiaxuan Ren, Junhan Zhu, Huan Wang
92
FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation
Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran
93
Understanding Reward Hacking in Text-to-Image Reinforcement Learning
Yunqi Hong, Kuei-Chun Kao, Hengguang Zhou, Cho-Jui Hsieh
94
OminiControl2: Efficient Conditioning for Diffusion Transformers, Seen-to-Scene: Keep the Seen, Generate the Unseen for Video
Zhenxiong Tan, Qiaochu Xue, Xingyi Yang, Songhua Liu, Xinchao Wang
95
Outpainting, AdaGaR: Adaptive Gabor Representation for Dynamic Scene
Inseok Jeon, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Suhwan Cho, Sangyoun Lee
96
Reconstruction, MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View
Jiewen Chan, Zhenjun Zhao, Yu-Lun Liu
97
Video Diffusion Transformer, InstaDA: Augmenting Instance Segmentation Data with Dual-Agent
Guile Wu, David Huang, Dongfeng Bai, Bingbing Liu
98
System, One Model for All: Unified Try-On and Try-Off in Any Pose via
Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang
99
LLM-Inspired Bidirectional Tweedie Diffusion
Jinxi Liu, Zijian He, Guangrun Wang, Guanbin Li, Liang Lin
100
Adversarial Concept Distillation for One-Step Diffusion Personalization
Yixiong Yang, Tao Wu, Senmao Li, Shiqi Yang, Yaxing Wang, Joost van de Weijer, Kai Wang
101
DSA: Dynamic Step Allocation for Fast Autoregressive Video Generation
Thanh-Tung Le, Yunhan Zhao, Menglei Chai, Zhengyang Shen, Zhe Cao, Danhang Tang, Xiaohui Xie, Deying Kong
102
Anomaly Agent: Unified Anomaly Retrieval and Synthesis Before Manufacturing
Xiangyue Li, Xiaoyang Wang, Siyue Yao, Mingjie Sun, Yupei Wu
103
S^2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation
Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliaksandr Siarohin, Sergey Tulyakov, Yanzhi Wang, Anil Kag, Yanyu Li
104
UniLat3D: Geometry-Appearance Unified Latents for Single- 52 | CVPR 2026 52 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE Stage 3D Generation
Guanjun Wu, Jiemin Fang, Chen Yang, Sikuang Li, Taoran Yi, Jia Lu, Zanwei Zhou, Jiazhong Cen, Lingxi Xie, Xiaopeng Zhang, Wei Wei, Wenyu Liu, Xinggang Wang, Qi Tian
105
ColorMam: Color-Aware State Space Model for Image Color Style Transfer
Jian Li, Jiaxin Peng, Yuchen Li, Siwang Zhou
106
NumeriKontrol: Adding Numeric Control to Diffusion Transformers for Instruction-based Image Editing
Zhenyu Xu, Xiaoqi Shen, Haotian Nan, Xinyu Zhang
107
Towards Source-Aware Object Swapping with Initial Noise Perturbation
Jiahui Zhan, Xianbing Sun, Xiangnan Zhu, Yikun Ji, Ruitong Liu, Liqing Zhang, Jianfu Zhang
108
SyntheticManga: Training-Free Manga Generation with Phased Diffusion
Xuelei Peng, Chi-Keung Tang, Yu-Wing Tai
109
Fast Autoregressive Video Generation with Diagonal Decoding
Yang Ye, Junliang Guo, Haoyu Wu, Tianyu He, Tim Pearce, Tabish Rashid, Katja Hofmann, Jiang Bian
110
E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models
Shengjun Zhang, Zhang Zhang, Chensheng Dai, Yueqi Duan
111
Bind-Your-Avatar: Multi-Character-Talking Video Generation with Dynamic 3D-mask-based Embedding Router
Yubo Huang, Weiqiang Wang, Sirui Zhao, Tong Xu, Lin Liu, Enhong Chen
112
SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations
Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang
113
PEDRA: Evaluating the Realism of Pedestrian Dynamics in Video Generation
Aaron Appelle, Jerome P. Lynch
114
VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning
Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, Xiangyu Yue
115
Jano: Adaptive Diffusion Generation with Early-Stage Convergence Awareness
Yuyang Chen, Linqian Zeng, Yijin Zhou, Hengjie Li, Jidong Zhai
116
Low-Bitrate Video Compression through Semantic-Conditioned Diffusion
Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman
117
Decoupled Scale-wise Autoregressive Modeling for Visual Generation
Sucheng Ren, Yaodong Yu, Nataniel Ruiz, Feng Wang, Cihang Xie
118
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation
Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou
119
Future Optical Flow Prediction Improves Robot Control and Video Generation
Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles
120
Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas
Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari
121
Drive-Cascade: Autoregressive Occupancy to LiDAR and Video Synthesis
Shuangming Lei, Yuehao Huang, Yao Yi, Yijia Xie, Jingke Wang, Ruoyu Wang, Jiajun Lv, Guanglin Xu, AiXue Ye, Bingbing Liu, Siyuan Cheng, Hongbo Zhang, Yukai Ma, Yong Liu
122
ADAPT: Attention Driven Adaptive Prompt Scheduling and InTerpolating Orthogonal Complements for Rare Concepts Generation
Kwanyoung Lee, Hyunwoo Oh, SeungJu Cha, Sungho Koh, Dong-Jin Kim
123
Concept Erasure via Attention Redirection
Amit Schechter, Rinon Gal, Ofir Kedem, Gal Chechik, Daniel Cohen-Or
124
Loom: Diffusion-Transformer for Interleaved Generation
Mingcheng Ye, Jiaming Liu, Yiren Song
125
Rethinking Training Dynamics in Scale-Wise Autoregressive Generation
Gengze Zhou, Chongjian Ge, Hao Tan, Feng Liu, Yicong Hong
126
HiStream: Efficient High-Resolution Video Generation via Redundancy Eliminated Streaming
Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua
127
Eevee: Towards Close-up High-resolution Video-based Virtual Try-on
Jianhao Zeng, Yancheng Bai, Ruidong Chen, Xuanpu Zhang, Lei Sun, Dongyang Jin, Ryan Xu, Nannan Zhang, Dan Song, Xiangxiang Chu
128
Consistent Video Editing as Flow-Driven Image-to-Video Generation
Ge Wang, Songlin Fan, Hangxu Liu, Quanjian Song, Hewei Wang, Jinfeng Xu
129
IM-Animation: An Implicit Motion Representation for Identity- Decoupled Character Animation
Zhufeng Xu, Xuan Gao, Feng-Lin Liu, Haoxian Zhang, Zhixue Fang, Yu-Kun Lai, Xiaoqiang Liu, Pengfei Wan, Lin Gao
130
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation
Hebeizi Li, Benyuan Sun, Yi Yang, Zihao Liang, Zihao Yin, Xiao Sha, Chenliang Wang
131
Generative Visual Chain-of-Thought for Image Editing
Zijin Yin, Tiankai Hang, Yiji Cheng, Shiyi Zhang, Runze He, Yu Xu, Chunyu Wang, Bing Li, Zheng Chang, Kongming Liang, Qinglin Lu, Zhanyu Ma
132
UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation
Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li
133
Blend-Aware Latent Diffusion: Mitigating Stitched Seams in Image Inpainting
Yunpeng Liu, Xingzhong Hou, Jie Wu, Boxiao Liu, Yi Zhang, Guanglu Song, Yu Liu, Changyao Tian, Gen Luo, Haihang You
134
One Layer Is Enough: Adapting Pretrained Visual Encoders for Image Generation
Yuan Gao, Chen Chen, Jiatao Gu
135
RealDiffusion: Physics-informed Attention for Multi-character Storybook Generation
Qi Zhao, Jun Chen, Ivor Tsang, Guang Dai
136
SwiftPie: Lightning-fast Subject-driven Image Personalization via One step Diffusion
Huy Duong, Trong-Tung Nguyen, Cuong Pham, Anh Tran, Khoi Nguyen, Minh Hoai
137
Video Generation Models are Good Latent Reward Models
Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang
138
Harnessing Layered Graphic Designs with Real Intentions for Text-to- Design Generation
Xinya Song, Bo Yang, Ying Cao
139
VeCoR — Velocity Contrastive Regularization for Flow Matching
Zong-Wei Hong, Jing-Lun Li, Lin-Ze Li, Shen Zhang, Yao Tang
140
CETCam: Camera-Controllable Video Generation via Consistent and Extensible Tokenization
Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang
141
SafetyBPO: Bidirectional Preference Optimization for Safe Text-to- Image Generation
You Wu, Beier Zhu, Chi Zhang
142
Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition
Yu He, Ting Zhu, Yichun Liu, Lichen Ma, Xinyuan Shan, Jingling Fu, Yu Shi, Junshi Huang, Yan Li
143
PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation
Jingxuan He, Busheng Su, Finn Wong
144
DebFilter: Eradicating Biases Stashed in Value
Seung Hyuk Lee, Songkuk Kim
145
PEdit: Pareto-Guided Image Editing via Dynamic Latent Trajectory Control
Sooyeon Park, Jaeil Park, Sung-Bae Cho
146
Prompt-Guided Image Editing with Masked Logit Nudging in Visual Autoregressive Models
Amir El-Ghoussani, Marc Hölle, Gustavo Carneiro, Vasileios Belagiannis
147
Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline
Qizhi Xie, Kun Yuan, Yunpeng Qu, Ming Sun, Chao Zhou, Jihong Zhu
148
Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement
Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang
149
Beyond Pixel Loss: Video-INRs Prefer Perceptual Optimization
Junqi Shi, Wuyang Cong, Ming Lu, Bowei Xu, Zhan Ma
150
MVSSM: Motion-aware Visual State Space Model for Efficient Video Deblurring
Chen Zhou, Tao Wu, Wei Liu, Xi Wu, Ying Fu
151
PrismNet: Semantic-Aware Image Enhancement via Vision Transformer and Zero-Cost Gating
Ruichen Zhang
152
FLAIR: Frequency- and Locality-Aware Implicit Neural Representations
Sukhun Ko, Seokhyun Youn, Dahyeon Kye, Kyle Min, Chanho Eom, Jihyong Oh
153
CtrlISP: Rescuing Low-Light RAW Images via Controllable Neural ISP
Chi Zhang, Yachun Li, Hang Du, Shicai Yang, Di Xie, Jiang Zhu, Yang Yang
154
Deepfake-Agent: Aggregating Semantic Forgery Clues for Generalizable Detection
Xiao Guo, Yue Zhang, Mohit Bansal, Xiaoming Liu
155
How far have we gone in Generative Image Restoration? A study on its capability, limitations and evaluation practices
Xiang Yin, Jinfan Hu, Zhiyuan You, Kainan Yan, Yu Tang, Chao Dong, Jinjin Gu
156
PCSTracker: Long-term Scene Flow Estimation for Point Cloud Sequences
Min Lin, Gangwei Xu, Xianqi Wang, Yuyi Peng, Xin Yang
157
POS-ISP: Pipeline Optimization at the Sequence Level for Task- aware ISP
Jiyun Won, Heemin Yang, Woohyeok Kim, Jungseul Ok, Sunghyun Cho
158
Semantic-Aware Spectral Reconstruction: A Spectral Library-Aided Unsupervised Method Based on the Diffusion Model
Keli Deng, Yuntao Qian
159
Linear Recurrent Unit with Semantic Modulation for Image Super- Resolution
Mingyu Choi, Woo Kyoung Han, Sunghoon Im, Kyong Hwan Jin
160
RodNet: Visual Pathway-Inspired Adaptive Sparse Network for Efficient Low-Light Image Enhancement
Boheng Liu, Ziyu Li, Zhong Zhang, Mengrui Xu, Chenghua Duan, Dehao Liu, Qing Li, Xia Wu
161
LWTformer: A Detail-Aware, Learnable Wavelet-Transformer for Ancient Chinese Character Image Restoration
Wentao Ruan, Xinhui Li, Zhan Cheng, Cunhang Fan, Libao Tian, Zhao Lv
162
SAT: Selective Aggregation Transformer for Image Super- Resolution
Dinh Phu Tran, Thao Do, Saad Wazir, Seongah Kim, Seon Kwon Kim, Daeyoung Kim
163
PhyFusion: Physics-Aware Infrared and Visible Image Fusion via Modality-Specific Physical Priors
Haiyang Jiang, Huiqin Zhang, Yanduo Zhang, Jiayi Ma, Junjun Jiang, Huabing Zhou
164
UnfoldIR: Rethinking Deep Unfolding Network in Illumination Degradation Image Restoration
Chunming He, Rihan Zhang, Fengyang Xiao, Chengyu Fang, Longxiang Tang, Rui Zhang, Sina Farsiu
165
Evaluating Low-Light Image Enhancement Across Multiple Intensity Levels
Maria Pilligua, David Serrano-Lozano, Pai Peng, Ramon Baldrich, Michael S. Brown, Javier Vazquez-Corral
166
FALCON: Fast Adaptive Lightweight Computation of Intensities and Events for Depth Estimation
Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi
167
Learning to Translate Noise for Robust Image Denoising
Inju Ha, Donghun Ryou, Seonguk Seo, Bohyung Han
168
QDM: Quadtree-Based Region-Adaptive Sparse Diffusion Models for Efficient Image Super-Resolution
Donglin Yang, Paul Vicol, Xiaojuan Qi, Renjie Liao, Xiaofan Zhang
169
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution
Cencen Liu, Dongyang Zhang, Wen Yin, Jielei Wang, Tianyu Li, Ji Guo, Wenbo Jiang, Guoqing Wang, Guoming Lu
170
Optical Tolerance-Compensated Diffusion Model for Image Restoration
Hongji Dong, Huihui Gong, Tanli Zuo, Yu Zhao, Jin Dai, Jingduo Tian, Kai Ni
171
TinySR: Shallow Diffusion Transformers for Real-World Image Super-Resolution
Linwei Dong, Qingnan Fan, Yuhang Yu, Qi Zhang, Jinwei Chen, Yawei Luo, Changqing Zou
172
Inf-Dehaze: Beyond GPU Memory Constraints for Ultra-High- Resolution Image Dehazing
Xinyu Yan, Jiuchen Chen, Qizhi Xu
173
DenoiseGS: Gaussian Reconstruction Model for Burst Denoising
Yongsen Cheng, Yuanhao Cai, Yulun Zhang
174
FlowSteer: Conditioning Flow Field for Consistent Image Restoration
Tharindu Wickremasinghe, Chenyang Qi, Harshana Weligampola, Zhengzhong Tu, Stanley H. Chan
175
P^2CS: Parallel Point Cloud Pre-Training with Semantic Consistency
Linshuang Diao, Sensen Song, Yuan Jia, Yurong Qian, Dayong Ren
176
Towards Calibrated Gradient-based Multi-Task Learning
Linxiao Cao, Mianzimei Yang, Zhipeng Zhou, Hong Xie, Defu Lian, Menglin Yang
177
Brain-Inspired Multimodal Spike Neural Network for Image-Text Retrieval
Xintao Zong, Wenxuan Liu, Jianhao Ding, Zhaofei Yu, Xian Zhong, Tiejun Huang
178
Conformal Cross-Modal Active Learning, PROGRAM GUIDE MAIN CONFERENCE | 5353
Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi
179
Deep-to-Shallow Knowledge Transfer:Multi-Scale Self-Distillation with Bidirectional Aware for 3D Brain Segmentation
Ziwei Zhang, Dayu Tan, Xin Peng, Weimin Zhong
180
MedSAD-CLIP: Supervised CLIP with Token-Patch Cross-Attention for Medical Anomaly Detection and Segmentation
Thuy Truong Tran, Minh Kha Do, Phuc Nguyen Duy, Min Hun Lee
181
Rethinking Whole-Body CT Image Interpretation: An Abnormality- Centric Approach
Ziheng Zhao, Lisong Dai, Ya Zhang, Weidi Xie, Yanfeng Wang
182
Generative Vision-Language Multiple Instance Learning for Weakly Supervised Neonatal Fundus Screening and Reporting
Xiao Zhang, Guangshuang Tan, Jie Hu, Shichao Kan, Bing Jiang, Yixiong Liang
183
Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation
Yishu Zhang, Shushan Wu, Zhenzhong Zhang, Didong Li, Huaxiu Yao, Yun Li, Iain Carmichael, Katherine A Hoadley, Hongtu Zhu, Di Wu, Daiwei Zhang
184
PTF-CT: Polar-Aware Temporal-Frequential Iterative Reconstruction for Sparse-View CT
Borui Kang, Guanyi Qin, Chuanpu Li, Yueming Jin
185
Learning from Noisy Prompts: Saliency-Guided Prompt Distillation for Robust Segmentation with SAM
Jingxuan Kang, Ziqi Zhang, Shaoming Zheng, Shuang Li, Uday Bharat Patel, Alexander Harry Fitzhugh, Phillip Lung, Yusuf Kiberu, Nikesh Jathanna, Shahnaz Jamil- Copley, Bernhard Kainz, Chen Qin
186
Towards Noise-Robust Medical Segmentation via Chebyshev- Attention-Based Asymmetric UNet
Yue Xin, Ziyang Zheng, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong
187
Two-Stage 3D Pulmonary Vessel Reconstruction via Trunk--Expansion Coupled Point Cloud Generation
Jie Zhang, Yu Xin, Guoqing Li
188
A Simple yet Effective Data Scaling Strategy for Semi-Supervised Medical Image Segmentation
Yajun Liu
189
DepthScopy: Decoupling Frequency for Endoscopic Depth Estimation in Sparsely-Textured Regions
Minghai Shi, Xiaoxian Zhang, Xiaoyue Liu, Fan Yang, Lei Li
190
ReCliFF: Adaptive Orthogonal Decoupling for Federated Fine-tuning of Medical MLLMs
Yuncheng Jiang, Chun-Mei Feng, Rui Sun, Le Zhang
191
Volumetrically Consistent Implicit Atlas Learning via Neural Diffeomorphic Flow for Placenta MRI
Athena Taymourtash, S Mazdak Abulnaga, Esra Abaci-Turk, P Ellen Grant, Polina Golland
192
Vision-Language Models for Automated 3D PET/CT Report Generation
Wenpei Jiao, Ke Yan, Jiajin Zhang, Dakai Jin, Zhaoheng Xie
193
PaM-MIL: Proliferation and Metastasis Enhanced Localization for Multiple Instance Learning on Pathology Images
Pengyu Guo, Jiachuan Wang, Zhao CHEN, Caleb Chen Cao, Liping Wang, Tingyi Jiang, Lei Chen
194
Surgical Procedural Planning as 3D World Modelling: Towards Automated Pulmonary Resection
Zhen Zhang, Zhaorong Dong, Xiao Yang, Liqin Huang, Qiang Wu, Taidui Zeng, Hanyu Zheng, Mingjing Yang, Shaohua Zheng, Wangbin Ding, Lin Pan
195
From Adaptation to Generalization: Adaptive Visual Prompting for Medical Image Segmentation
Evren Çetinkaya, Sangmin Lee, Jung Uk Kim, Hong Joo Lee, Nassir Navab
196
AceMIL: Ordinal-Aware Multiple Instance Learning for Pathological Progression Analysis
Shijie Li, Yiming Chen, Yingyun Gong, Hongwen Zhou, Feng-Jung Chen, Xieping Gao, Zhineng Chen
197
PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal
Zining Fang, Cheng Xue, Chunhui Liu, Bin Xu, Ming Chen, Xiaowei Hu
198
Anatomy-CoT: Teaching MLLMs to Reason in Radiology
Shengzhi Wang, Kai Wu, Lei Yang, Yiwen Ye, Zihan Wang, Yuhang Wu, Mingliang Xiong, Wen Fang, Mingqing Liu, Mengyuan Xu, Hao Deng, Gang Li, Haihua Yang, Qingwen Liu
199
DELRER: Disease Evolution-Informed Longitudinal Radiology Report Generation
Kaiyu Wang, Bing Wang, Changchun Li, You Lu, Yaning Wang, Huimao Zhang, Ximing Li
200
M^4Fuse: Lightweight State-Space MoE with a Cross-Scale Gating Bridge for Brain Tumor Segmentation
Meihua Zhou, Xinyu Tong, Li Yang
201
DynaMind: Reconstructing Dynamic Visual Scenes from EEG by Aligning Temporal Dynamics and Multimodal Semantics to Guided Diffusion, 54 | CVPR 2026 54 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE
Junxiang Liu, Junming Lin, Jie Zhou, Wei Xiong, Jiangtong Li, Jie Li, Jie Zhuang, Hongfei Ji
202
MAE-XNT: A Foundation Model for Segmenting Neuronal Tissue Volumes Generated with X-Ray Nanotomography
Alfred Laugros, Sebastien Roig, Alexandra Pacureanu
203
NAKUL-Med: Spectral-Graph State Space Models with Dynamics Kernels for Medical Signals
Badri N Patro, Vijay S Agneeswaran
204
Gaze into the Details: Locality-Sensitive Enhancement for OCTA Retinal Vessel Segmentation
Tuopusen Huang, Ding Ma, Xiangqian Wu
205
M^3D-BFS: a Multi-Stage Dynamic Fusion Strategy for Sample- Adaptive Multi-Modal Brain Network Analysis
Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong
206
Multimodal Decoupled Dynamic Graph Learning for Brain Disease Diagnosis
Aimei Dong, Yongxing Cai, Bin Liu, Jiale Sun, Guixin Zhao
207
TICON: A Slide-Level Tile Contextualizer for Histopathology Representation Learning
Varun Belagali, Saarthak Kapse, Pierre Marza, Srijan Das, Zilinghan Li, Sofiène Boutaj, Pushpak Pati, Srikar Yellapragada, Tarak Nath Nandi, Ravi K Madduri, Joel Saltz, Prateek Prasanna, Stergios Christodoulidis, Maria Vakalopoulou, Dimitris Samaras
208
TP-Seg: Task-Prototype Framework for Unified Medical Lesion Segmentation
Jiawei Xu, Qiangqiang Zhou, Dandan Zhu, Yong Chen, Yugen Yi, Xiaoqi Zhao
209
C3-Diff: Super-resolving Spatial Transcriptomics via Cross-modal Cross-content Contrastive Diffusion Modelling
Xiaofei Wang, Stephen J Price, Chao Li
210
MeMix: Multi-Encoder Mixture Framework for Medical Report Generation
Yiming Cao, Lizhen Cui, Zhiqi Shen
211
Learning Spatial-Preserving Hierarchical Representations for Digital Pathology
Weiyi Wu, Xingjian Diao, Chunhui Zhang, Chongyang Gao, Xinwen Xu, Siting Li, Jiang Gui
212
Open-Set Spatial Gene Expression Prediction from Histological Images via Retrieval-Augmented Generation
Chaochen Wu, Meiyun Zuo, Lei Xie
213
Personalized Functional Brain Network Modeling with Adaptive Auto-Weighted Learning for Automatic Brain Disorder Diagnosis
Yan Zhang, Kun Liu, Min Li
214
Do Vision Models Perceive Illusory Motion in Static Images Like Humans?
Isabella E. Rosario, Fan L. Cheng, Zitang Sun, Nikolaus Kriegeskorte
215
Meta-CDMTransNet: Cross-Domain Multi-Scale Transformer Meta-Learning Framework for Few-Shot Breast Histopathological Image Classification
Anindita Mohanta, Sourav Dey Roy, Priya Saha, Niharika Nath, Mrinal Kanti Bhowmik
216
PLCReg: Correlation-Aware Polar-Linear Attention for Guiding Medical Image Registration
Yedi Zhang, Wenhui Huang, Yuanjie Zheng
217
A Denoising-Enhanced Multimodal Learning Framework for Robust Nasal Endoscopy Report Generation
Xinpan Yuan, Mingzhu Huang, Liujie Hua, Jianuo Ju, Xiaowei Zhao, Lin Yuanbo Wu
218
When Models Learn to Ask Why: Adaptive Causal Reasoning for Trustworthy Medical Vision–Language Models
Jianxin Lin, Chunzheng Zhu, Peter J Kneuertz, Yunfei Bai, Yuan Xue
219
PBSBench: A Multi-Level Vision-Language Framework and Benchmark for Hematopathology Whole Slide Image Interpretation
Yuanlong Wang, Weichi Chen, Adrian Rajab, Wenfang Liu, Yulan Jin, Andrew Srisuwananukorn, Ping Zhang
220
Gated Differential Linear Attention: A Linear-Time Decoder for High- Fidelity Medical Segmentation
Hongbo Zheng, Afshin Bozorgpour, Dorit Merhof, Minjia Zhang
221
Vision-Language Models Encode Clinical Guidelines for Concept- Based Medical Reasoning
Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F.R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi
222
PGDM: Physics-Guided Noise-Free Diffusion Model Based on Point Spread Function for Light-Scattering Removal in Unpaired Biomedical Images
Jinze Zhao, Keyi Han, Qiushi Huang, Jie Tian, Zhenhua Hu
223
Elicit and Enhance: Advancing Multimodal Reasoning in Medical Scenarios
Zhongzhen Huang, Linjie Mu, Yannian Gu, Kangzhe Hu, Shengyi Hua, Xiaofan Zhang
224
Anatomy-Aware Adaptive Feature Perturbation Framework for Semi-Supervised MRI Segmentation
Ji Lin, Bo Peng, Suping Li, Qianni Zhang
225
EI: Early Intervention for Multimodal Imaging Based Disease Recognition
Qijie Wei, HaiLan Lin, Xirong Li
226
Rethinking Medical High-Modality Learning Under Missingness — A Long- Tailed Distribution Perspective
Chenwei Wu, Zitao Shuai, Liyue Shen
227
HazeMatching: Dehazing Light Microscopy Images with Guided Conditional Flow Matching
Anirban Ray, Ashesh Ashesh, Florian Jug
228
Learning Priors via Hybrid Visual Autoregressive Modeling for Medical Image to Image Translation
Zhaohu Xing, Hongqiu Wang, Tian Ye, Sixiang Chen, Wenxue Li, Lihao Liu, Shuaibo Li, Lei Zhu
229
BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis
Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong
230
RelativeFlow: Taming Medical Image Denoising Learning with Noisy Reference
Yuxin Liu, Yiqing Dong, Wenxue Yu, Zhan Wu, Rongjun Ge, Yang Chen, Yuting He
231
UGLMM: Towards Unified Vision Grounding with Large Multimodal Model
Xiangheng Shan, Li Zhou, Zenghui Sun, Shichao Dong, Nong Sang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Changxin Gao, Kaifu Zhang
232
FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval
François Gardères, Camille-Sovanneary Gauthier, Jean Ponce, Shizhe Chen
233
Training-Free Cross-Modal Alignment via Anchor Profiles with Statistical Significance Testing
Kuo Yang, Jianglin Lu, Yun Fu
234
CREM: Compression-Driven Representation Enhancement for Multimodal Retrieval and Comprehension
Lihao Liu, Biao Yang, Yan Wang, Da Li, Jiangxia Cao, Yuxiao Luo, Xiang Chen, Xiangyu Wu, Wei Yuan, Fan Yang, Guiguang Ding, Tingting Gao, Guorui Zhou
235
LLM Guided Multi Style Typography and Layout Generation via Dynamic Direct Preference Optimization
Chen Fu, Shengzhou Yi, Ling Xiao, Toshihiko Yamasaki
236
FusionBridge: An Efficient Fusion Via Feature Disentanglement for Multi-Modal Object Re-Identification
Yali Li, Qianru Han, Xinwei He, Zhi Liu, Jinhai Xiang
237
LlamaRG: A Multi-View Large Language Model for Radiology Report Generation
Tanuja Jayas, Aditya Rastogi, Pavithra Raghavan, Gianluca Brugnara, Kai Schlamp, Martha Foltyn-Dumitru, Philipp Vollmuth
238
Mitigating Information Forgetting via Entropy-Driven Progressive Retrospection for Multimodal Long Reasoning
Yifei Gao, Ning Xu, Guoqing Jin, Shenyuan Zhang, An-An Liu
239
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
Dongchen Lu, Zilu Zhang, Leping Huang, Yuyao Sun, Jianliang Zeng, Mao Shu, Huo Cao
240
R²MoE: Representation and Expert Selection Dual-Regularized Mixture-of-Experts for Multimodal Clinical Data
Wajih Hassan Raza, Mya Schiess, Juan Martinez Lemus, Timothy Michael Ellmore, Charles Green, Claudio Soto, Xin Fu, Renjie Hu
241
DUALVISION: RGB–Infrared Multimodal Large Language Models for Robust Visual Reasoning
Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li
242
Parallel In-context Learning for Large Vision Language Models
Shin'ya Yamaguchi, Daiki Chijiwa, Tamao Sakao, Taku Hasegawa
243
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
Yufei Zhan, Yousong Zhu, Hongyin Zhao, Fan Yang, Shurong Zheng, Ming Tang, Jinqiao Wang
244
Prototype and Sample Level Semantic Alignment for Incomplete Multi-View Clustering
Zhengzhong Zhu, Pei Zhou, Lanxi Bai, Jia Nie, Li Cheng, Shiquan Min, Jiangping Zhu
245
Rethinking VLMs for Image Forgery Detection and Localization
Shaofeng Guo, Jiequan Cui, Richang Hong
246
DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization
Ngoc-Son Nguyen, Thanh V. T. Tran, Jeongsoo Choi, Hieu-Nghia Huynh-Nguyen, Truong-Son Hy, Van Nguyen
247
OTPrune: Distribution-Aligned Visual Token Pruning Via Optimal Transport
Xiwen Chen, Wenhui Zhu, Gen Li, Xuanzhao Dong, Yujian Xiong, Hao Wang, Peijie Qiu, Qingquan Song, Zhipeng Wang, Shao Tang, Yalin Wang, Abolfazl Razi
248
Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering
Paritosh Parmar, Eric Peh, Basura Fernando
249
Materialistic RIR: Material Conditioned Realistic RIR Generation
Mahnoor Fatima Saad, Sagnik Majumder, Kristen Grauman, Ziad Al-Halah
250
From Coarse to Precise: Rethinking and Bridging Localization in Multimodal Large Language Models
Lysa Xiao, Veronica Liesaputra, Lech Szymanski, Stephen Cranefield
251
Do Audio-Visual Large Language Models Really See and Hear?
Ramaneswaran Selvakumar, Kaousheik Jayakumar, S Sakshi, Sreyan Ghosh, Ruohan Gao, Dinesh Manocha
252
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li
253
FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Routing-Aware Token Pruning
Guoyang Xia, Yifeng Ding, Fengfa Li, Lei Ren, Wei Chen, Fangxiang Feng, Xiaojie Wang
254
Anticipatory Planning for Multimodal AI Agents
Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang
255
Quantifying the Gap between Understanding and Generation within Unified Multimodal Models
Chenlong Wang, Yuhang Chen, Zhihan Hu, Dongping Chen, Wenhu Chen, Sarah Wiegreffe, Tianyi Zhou
256
VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs
Naishan Zheng, Qingpei Guo, Jie Huang, Feng Zhao
257
Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometric Problem Solving
Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang
258
HippoMM: Hippocampal-inspired Multimodal Memory for Long Audiovisual Event Understanding
Yueqian Lin, Jingyang Zhang, Qinsi Wang, Hancheng Ye, Yuzhe Fu, Yudong Liu, Hai Helen Li, Yiran Chen
259
A Diagnostic Study of Region-Based Representations in Multimodal LLMs
Ji Li, Shengcao Cao, Yu-Xiong Wang
260
HoliSafe: Holistic Safety Benchmarking and Modeling for Vision- Language Model
Youngwan Lee, Kangsan Kim, Kwanyong Park, Ilchae Jung, Soojin Jang, Seanie Lee, Yong-Ju Lee, Sung Ju Hwang
261
UMI-HOI: Unifying Multimodal Information with Semantic Multi-Head Attention for Human–Object Interaction Detection
Yuankai Wu, Zhinan Li, Constantin Patsch, Marsil Zakour, Driton Salihu, Eckehard Steinbach
262
AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation
Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert
263
Visual2Echo Compositional Contrastive Learning (V2E-CCL): Binaural Knowledge Distilled Network for Depth Prediction
Nazrul Ismail, Owais Ahmed Malik, Ong Wee Hong
264
TextBind: Your Vision-Language Models are Naturally Unified Multimodal Models
Xu Ma, Yun Fu
265
Learning to Walk the Right Paths: Task-Responsive Graph Reasoning for Multimodal Inference
Xuecheng Li, Weikuan Jia, Yuanjie Zheng
266
CLASH: A Benchmark for Cross-Modal Contradiction Detection
Teodora Popordanoska, Jiameng Li, Matthew B. Blaschko
267
DA-CLIP: Mitigating Granularity Mismatch in Zero-Shot Anomaly Detection via Decoupled Text-Visual Alignment
Jianqin Liu, Peng Wang, Junming Huang, Xue Zhou, Li Yu
268
HAIT: Hybrid Adversarial Iterative Training for Mitigating Object Hallucination in Large Vision–Language Models
Liangjie Zhao, Liao Wenjie, Ming Feng, Xiaohui Song, Huafei Li, Haonan Lu
269
Cross-Modal-Domain Generalization Through Semantically Aligned Discrete Representations
Souptik Sen, Raneen Younis, Zahra Ahmadi
270
CP-IMoE: Collaborative Prompt-Guided Interactive Mixture-of- Experts for Incomplete Multimodal Learning, PROGRAM GUIDE MAIN CONFERENCE | 5555
Jing Li, Dongbo Zhang, Yalin Zheng, Yanda Meng
271
Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models
Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang
272
PaLMR: Towards Faithful Visual Reasoning via Multimodal Process Alignment
Yantao Li, Chenyang Yan, Qiang Hui, Fang Zhao, Kanzhi Cheng, Chao Tan, Huanlin Gao, Jianbing Zhang, Kai Wang, Xinyu Dai, Shiguo Lian
273
If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions
Carlo Alberto Barbano, Luca Molinaro, Massimiliano Ciranni, Emanuele Aiello, Vito Paolo Pastore, Marco Grangetto
274
LiteEmbed: Adapting CLIP to Rare Classes
Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi
275
CADReasoner: Iterative Program Editing for CAD Reverse Engineering
Soslan Kabisov, Vsevolod Kirichuk, Andrey Volkov, Marina Barannikov, Gennadiy Savrasov, Anton Konushin, Andrey Kuznetsov, Dmitrii Zhemchuzhnikov
276
COSTA: Collaborative Open-Set Test-Time Adaptation Through Robust Prototype Learning
Can Zhang, Ruirui Li
277
Perturb and Recover: Fine-Tuning for Effective Backdoor Removal from CLIP
Naman Deep Singh, Francesco Croce, Matthias Hein
278
PrismPrune: Decoupling Saliency and Diversity in Attention for Efficient Visual Token Pruning in VLMs
Ziniu Liu, Shuheng Zhou, Mingqing Liu, Hao Deng, Huijia Zhu
279
Scaling Pre-training to One Hundred Billion Data for Vision Language Models
Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai
280
HAFM: A Post-Fusion Gating Module for Haze-Aware RGB–Thermal Object Detection
Juan M. Saeteros, Nick J. Arévalo, Boris X. Vintimilla
281
CaptAin: Caption-driven Alignment for Bridging Modality Gaps in Partially Relevant Video Retrieval
Chuanshen Chen, Kai Zhou, Feiqi Wang, Yutao Ning, Zhendong Xiong, Yirui Li, Zhiquan Wen, Mingkui Tan
282
Dual Anchors, Do It Better: Hierarchical Group Merging for Zero-Shot Anomaly Detection
Jimin Roh, Dongkyu Kim, Suk-Ju Kang
283
HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal–Image Modeling and Understanding
Yihan Xie, Sijing Li, Zhuonan Wang, Tianwei Lin, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi
284
Unbiased Dynamic Multimodal Fusion
Shicai Wei, Kaijie Zhang, Luyi Chen, Tao He, Guiduo Duan
285
Video Reasoning Without Training
Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague
286
Efficient Discrete Diffusion Model for Scalable Multi-Objective Traveling Salesman Problem
Dawei Su, Zhanhong Fang, Junyi Luo, Debing Wang, Jinbiao Chen, Zizhen Zhang
287
EpiMask: Leveraging Epipolar Distance Based Masks in Cross- Attention for Satellite Image Matching
Rahul Deshmukh, Aditya Chauhan, Avinash Kak
288
S³O: Selective Spatial-Spectral Operator for Cross-Scale Fusion
Jieyuan Pei, Wei Li, Zhuoxuan Li, Junwei Zhu, Meiyi Lu, Jiawei Jiang, Chenyu Wang, Jianwei Zheng
289
Fast Kernel-Space Diffusion for Remote Sensing Pansharpening
Hancong Jin, Zihan Cao, Liang-Jian Deng, Jingjing Li
290
Unified Urban Tuning: Co-Enhancing Satellite and Street View Reasoning with a Progressive Tuning Framework
Yong Li, Weiyu Zhang, Ling Dai, Jian Yang, Dacheng Yin, Sirun Li, Jing Lyu, Fengyun Rao, Fan Zhang
291
GReD-RSITR: A Generative Re-Examined Discriminative Framework for Remote Sensing Image-Text Retrieval
Shuhuai Wang, Songwei Pei, Bingfeng Liu, Yuanzhou Huang, Qian Li, Shangguang Wang
292
ZODS-RS — Zero-Training Oriented Detection & Segmentation for Remote Sensing
Zuan Gu, Tianhan Gao, Langxu Zhao
293
Turning Generators into Retrievers: Unlocking MLLMs for Natural Language-Guided Geo-Localization
Yuqi Chen, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah
294
Optimal-Transport-based Feature Alignment for Multimodal Change Detection
Mengqi Huang, Jun Liu, Li Cui, Yuping Duan, Faqiang Wang
295
HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition, 56 | CVPR 2026 56 | CVPR 2026 | PROGRAM GUIDE MAIN CONFERENCE
Xiaoqi Zhuang, Jefersson A Dos Santos, Jungong Han
296
CrossWeaver: Towards Efficient Cross-Modal Interweaving and Decoupling for Weakly-Aligned Multispectral Object Detection
Haitian Yang, Juan Fang, Yiren Zhu, Xudong Zhao, Yufei Guo, Xiaohan Zhang, Xiaoxing Hu, Xue Yang, Qi Ming
297
ProSM: Progressive Soft Masking for Fine-Grained Remote Image Segmentation
Bingkun Nian, Fenghe Tang, Zhiwei Ning, Dongsheng Jiang, Yin Li, JIE Yang, Rong Xiao, Shaohua Kevin Zhou, Wei Liu
298
UniD-Shift: Towards Unified Semantic Segmentation via Interpretable Shared–Private Multimodal Decomposition
Shuai Zhang, Zhecheng Shi, Zhuoxiao Li, Jing Ou, Tengxi Wang, Yuan Liu, Wufan Zhao
299
OffNadirLoc: Benchmark and Framework for Challenging UAV-to- Satellite Geo-Localization under Large Off-Nadir Views
Qian Qiao, Wenye Liu, Ting Liu, Jiuhe Shu, Peng Wang
300
M-PhyGs: Multi-Material Object Dynamics from Video
Norika Wada, Kohei Yamashita, Ryo Kawahara, Ko Nishino
301
Diffusion^2: Turning 3D Environments into Radio Frequency Heatmaps
Kyoungjun Park, Yifan Yang, Changhan Ge, Lili Qiu, Shiqi Jiang
302
Controllable Radar Simulation with Waveform Parameter Embedding
Weiqing Xiao, Hao Huang, Chonghao Zhong, Yujie Lin, Nan Wang, Xiaoxue Chen, Zhaoxi Chen, Saining Zhang, Shuocheng Yang, Pierre Merriaux, Lei Lei, Hao Zhao
303
mmDiff: A Noise-Robust Differentiable Ray-Tracing Framework for mmWave Scene Calibration and Channel Prediction
Haofan Lu, Yadi Cao, Wanghao Yi, Omid Abari
304
GLOW: Global Illumination-Aware Inverse Rendering of Indoor Scenes Captured with Dynamic Co-Located Light & Camera
Jiaye Wu, Saeed Hadadan, Geng Lin, Peihan Tu, Matthias Zwicker, David Jacobs, Roni Sengupta
305
Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats
Xiaoyang Liu, Shangzhe Wu, Kai Han
306
How to Achieve Prototypical Birth and Death for OOD Detection?
Ningkang Peng, Qianfeng Yu, Xiaoqian Peng, Linjing Qian, Yafei Liu, Canran Xiao, Xinyu Lu, Tingyu Lu, Zhichao Zheng, Yanhui Gu
307
Uncertainty-Aware Cross-Modal Opinion Interaction: A General Frameworkfor Visible-Infrared Vehicle and Person Re-Identification
Shihao Shan, Hongying Liu, Fanhua Shang, Qian Wang, Yang Song
308
EIRES:Training-free AI-Generated Image Detection via Edit-Induced Reconstruction Error Shift
Wan Jiang, Jing Yan, Xiaojing Chen, Ling Shen, Chenhao Lin, Yunfeng Diao, Richang Hong
309
Vote-in-Context: VLMs as Explainable Zero-Shot Rank Fusers
Mohamed Eltahir, Ali Habibullah, Lama Ayash, Tanveer Hussain, Naeemullah Khan
310
PRADA: Probability-Ratio-Based Attribution and Detection of Autoregressive-Generated Images
Simon Damm, Jonas Ricker, Henning Petzka, Asja Fischer
311
HypHOI: Exploring Hierarchical Hyperbolic Embeddings for Human-Object Interaction Detection
Yixin Guo, Yu Liu, Weimin Wang, Yanming Guo, Qi Jia
312
A Low-Rank Learning Framework Integrating Detection, Masking, and Recovery for Occluded Facial Expression Recognition
Yanzhong Wang, Daming Shi
313
DSAA: Dual-Stage Attribute Activation for Fine-Grained Open Vocabulary Detection
Donghong Jiang, Endian Lin, Hanqing Liu, Mingjie Liu, Luoping Cui, Zhao Yang, Chuang Zhu
314
ConSel: Concept-Aware Self-supervised Learning for Regression Beyond Ordinal Tasks
Abdullah Tariq, Bisma Saleem, R Muhammad Atif Azad, Martin Masek, Syed Zulqarnain Gilani
315
Rolling and Denoising: Rethinking Dynamic Modal Fusion for Multi-Modal Object Re-Identification
Shihao Li, Huaibo Huang, Aihua Zheng, Jin Tang, Ran He
316
Adapting with an Open Mind: Leveraging Open-Vocabulary Detectors for Closed Set Source-Free Domain Adaptive Object Detection
Kaustubh R Borgavi, Sarvesh Shashikumar, Chetan Arora
317
SFS-DETR: Spatial-Frequency Selection for UAV Object Detection
Dingding Jia, Jiankang Wang, Longlong Zhang, Zhiheng Liu, Xuan Wang
318
ForenDeX: Unlocking Forensic Insights for Explainable AI-Generated Image Detection
Chuangchuang Tan, Jinglu Wang, Xiang Ming, Renshuai Tao, Yunchao Wei, Yao Zhao, Yan Lu
319
Long-Tailed Out-of-Distribution Detection with Refined Separate Class Learning
Shuai Feng, Yuxin Ge, Baoming Zhang, Yuntao Du, MingCai Chen, Chongjun Wang, Lei Feng
No matches.