‹ June 5 schedule

Poster Session 5

Sun · June 7 · 11:45 AM–1:45 PM · ExHall A–F — 704 papers
704 papers
1
Evidential Neural Radiance Fields 🏆PDF ↗
Ruxiao Duan, Alex Wong
2
Global-Aware Edge Prioritization for Pose Graph Initialization 🏆PDF ↗
Tong Wei, Giorgos Tolias, Jiri Matas, Daniel Barath
3
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding 🏆PDF ↗
Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Rohun Tripathi, Sangho Lee, Mohammadreza Salehi, Jason Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Ali Farhadi, Ranjay Krishna
4
Optical Flow Matching: Reframing Optical Flow as Continuous Transport Dynamics PDF ↗
Ao Luo, Xin Li, Fan Yang, Yuezun Li, Zhaoquan Yuan, Shan Zhao, Bing Su, Xiao Wu
5
SEATrack: Simple, Efficient, and Adaptive Multimodal Tracker PDF ↗
Junbin Su, Ziteng Xue, Shihui Zhang, Kun Chen, Weiming Hu, Zhipeng Zhang
6
U^2Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation 🏆PDF ↗
Xunpei Sun, Wenwei Lin, Yi Chang, Gang Chen
7
AToken: A Unified Tokenizer for Vision PDF ↗
Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang
8
Confusion-Aware Spectral Regularizer for Long-Tailed Recognition PDF ↗
Ziquan Zhu, Gaojie Jin, Hanruo Zhu, Si-Yuan Lu, Yunxiao Zhang, Zeyu Fu, Ronghui Mu, Guoqiang Zhang, Zhao Sun, Yuhang Xia, Jiaxing Shang, Xiang Li, Lu Liu, Tianjin Huang
9
Learning Latent Concepts for Detecting Out-of-Distribution Objects 🏆PDF ↗
Ting Peng, Junhao Dong, Yew-Soon Ong
10
Learning Like Humans: Analogical Concept Learning for Generalized Category Discovery PDF ↗
Jizhou Han, Chenhao Ding, Yuhang He, Qiang Wang, Shaokun Wang, SongLin Dong, Yihong Gong
11
Understanding and Enforcing Weight Disentanglement in Task Arithmetic PDF ↗
Shangge Liu, Yuehan Yin, Lei Wang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao, Dacheng Tao
12
Understanding Task Transfer in Vision-Language Models PDF ↗
Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian
13
AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models PDF ↗
Xiaoqi Li, Muhe Cai, Jiadong Xu, Juan Zhu, Hongwei Fan, Yan Shen, Guangrui Ren, Hao Dong
14
Learning Diffeomorphism for Medical Image Registration with Time-Embedded Architectures Using Semigroup Regularization 🏆PDF ↗
Mohammadjavad Matinkia, Nilanjan Ray
15
QuadSync: Quadrifocal Tensor Synchronization via Tucker Decomposition 🏆PDF ↗
Daniel Miao, Gilad Lerman, Joe Kileel
16
SocialNav: Training Human-Inspired Foundation Model for Socially- Aware Embodied Navigation 🏆PDF ↗
Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Yang Kuan, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang
17
Structural Action Transformer for 3D Dexterous Manipulation PDF ↗
Xiaohan Lei, Min Wang, Bohong Weng, Wengang Zhou, Houqiang Li
18
TESO: Online Tracking of Essential Matrix by Stochastic Optimization PDF ↗
Jaroslav Moravec, Radim Sara, Akihiro Sugimoto
19
BoostSLT: Boosting Sign Language Translation via a Plug-and-Play Diffusion-Based Semantic Enhancer PDF ↗
Changzhou Han, Wanlun Ma, Xi Tang, Kun Hu, Sheng Wen, Yang Xiang
20
ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applications 🏆PDF ↗
Yuxi Mi, Qiuyang Yuan, Zhizhou Zhong, Xuan Zhao, Jiaogen Zhou, Fubao Zhu, Jihong Guan, Shuigeng Zhou
21
OLATverse: A Large-scale Real-world Object Dataset with Precise Lighting Control 🏆PDF ↗
Xilong Zhou, Jianchun Chen, Pramod Rao, Timo Teufel, Linjie Lyu, Tigran Minasian, Oleksandr Sotnychenko, Xiao-Xiao Long, Marc Habermann, Christian Theobalt
22
OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data 🏆PDF ↗
Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang
23
POLAR: A Portrait OLAT Dataset and Generative Framework for Illumination-Aware Face Modeling PDF ↗
Zhuo Chen, Chengqun Yang, Zhuo Su, Zheng Lv, Jingnan Gao, Xiaoyuan Zhang, Xiaokang Yang, Yichao Yan
24
Relightable Holoported Characters: Capturing and Relighting Dynamic Human Performance from Sparse Views 🏆PDF ↗
Kunwar Maheep Singh, Jianchun Chen, Vladislav Golyanik, Stephan J. Garbin, Thabo Beeler, Rishabh Dabral, Marc Habermann, Christian Theobalt
25
Scaling View Synthesis Transformers PDF ↗
Evan Kim, Hyunwoo Ryu, Thomas W. Mitchel, Vincent Sitzmann
26
WildPose: A Unified Framework for Robust Pose Estimation in the Wild PDF ↗
Jianhao Zheng, Liyuan Zhu, Zihan Zhu, Iro Armeni
27
MoRe: Motion-aware Feed-forward 4D Reconstruction Transformer PDF ↗
Juntong Fang, Zequn Chen, Weiqi Zhang, Donglin Di, Xuancheng Zhang, Chengmin Yang, Yu-Shen Liu
28
Revisiting Monocular SLAM with Spatio-Temporal Scene Modeling PDF ↗
Valter Piedade, Lalit Manam, Masashi Yamazaki, Pedro Miraldo
29
Minimal Constraint Relaxation for Multiview Autocalibration PDF ↗
Norio Kosaka, Timothy Duff, Tomas Pajdla
30
Motion 3-to-4: 3D Motion Reconstruction for 4D Synthesis PDF ↗
Hongyuan Chen, Xingyu Chen, Zexiang Xu, Anpei Chen
31
GGPT: Geometry-Grounded Point Transformer PDF ↗
Yutong Chen, Yiming Wang, Xucong Zhang, Sergey Prokudin, Siyu Tang
32
MERG3R: A Divide-and-Conquer Approach to Large-Scale Neural Visual Geometry PDF ↗
Leo Kaixuan Cheng, Abdus Shaikh, Ruofan Liang, Zhijie Wu, Yushi Guan, Nandita Vijaykumar
33
Unlocking the Power of Critical Factors for 3D Visual Geometry Estimation PDF ↗
Guangkai Xu, Hua Geng, Huanyi Zheng, Songyi Yin, Yanlong Sun, Hao Chen, Chunhua Shen
34
KV-Tracker: Real-Time Pose Tracking with Transformers PDF ↗
Marwan Taher, Ignacio Alzugaray, Kirill Mazur, Xin Kong, Andrew Davison
35
InstructMix2Mix: Consistent Sparse-View Editing Through Multi-View Model Personalization PDF ↗
Daniel Gilo, Or Litany
36
From Rays to Projections: Better Inputs for Feed-Forward View Synthesis PDF ↗
Zirui Wu, Zeren Jiang, Martin R. Oswald, Jie Song
37
SLARM: Streaming and Language-Aligned Reconstruction Model for Dynamic Scenes PDF ↗
Zhicheng Qiu, Jiarui Meng, Tong-an Luo, Yican Huang, Xuan Feng, Xuanfu Li, Zhan Xu
38
Parallel Rigidity Matters for Bundle Adjustment PDF ↗
Lalit Manam, Venu Madhav Govindu
39
Simple but Effective Triplet-Based Compression Strategies for Compact Visual Localization PDF ↗
Torsten Sattler, Zuzana Kukelova
40
VIAFormer: Voxel-Image Alignment Transformer for High-Fidelity Voxel Refinement PDF ↗
Tiancheng Fang, Bowen Pan, Lingxi Chen, Jiangjing Lyu, Chengfei Lv, Chaoyue Niu, Fan Wu
41
Mining Attribute Subspaces for Efficient Fine-tuning of 3D Foundation Models PDF ↗
Yu Jiang, Hanwen Jiang, Ahmed Abdelkader, Wen-Sheng Chu, Brandon Feng, Zhangyang Wang, Qixing Huang
42
DualPrim: Compact 3D Reconstruction with Positive and Negative Primitives PDF ↗
Xiaoxu Meng, Zhongmin Chen, Bo Yang, Weikai Chen, Weixiao Liu, Lin Gao
43
StyleGallery: Training-free and Semantic-aware Personalized Style Transfer from Arbitrary Image References PDF ↗
Boyu He, Yunfan Ye, Chang Liu, Weishang Wu, Fang Liu, Zhiping Cai
44
DynFusion: Rethinking Condition Fusion for Adaptive Multi- Conditional Text-to-Image Generation PDF ↗
Zheng Fang, Lichuan Xiang, Xu Cai, Bing Wang, Bo Yang, Hongkai Wen
45
Agentic Retoucher for Text-To-Image Generation PDF ↗
Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai
46
StyleDoctor: Towards Specialist Reward Model for Style-centric Generation Tasks PDF ↗
Xilin He, Xiaole Xian, Xiangyu Yue, Muhammad Haris Khan
47
SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls PDF ↗
Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang
48
Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation PDF ↗
Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo
49
Paper2Figure: A Multi-Agent Collaborative System for Figure Generation Towards Academic Research Paper PDF ↗
Siwei Han, Haonian Ji, Siyang Xin, Juanquan Shi, Shi Qiu, Xinyu Ye, Peng Xia, Jiaqi Liu, Zhaorun Chen, Yiyang Zhou, Linjie Li, Lijuan Wang, Huaxiu Yao
50
Adapting In-context Generation for Enhanced Composed Image Retrieval PDF ↗
Haiwen Li, Zining Chen, Delong Liu, Zhaohui Hou, Zhicheng Zhao, Fei Su
51
Transition Models: Rethinking the Generative Learning Objective PDF ↗
Zidong Wang, Yiyuan Zhang, Xiaoyu Yue, Xiangyu Yue, Yangguang Li, Wanli Ouyang, Lei Bai
52
Rethinking Glyph Spatial Information in Font Generation PDF ↗
Peng Su, Xi Yang
53
StreamDiT: Real-Time Streaming Text-to-Video Generation PDF ↗
Akio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos, Felix Juefei-Xu, Masayoshi Tomizuka, Yue Zhao
54
ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control PDF ↗
Shishi Xiao, Tongyu Zhou, David H. Laidlaw, Gromit Yeuk-Yin Chan
55
Camera Control for Text-to-Image Generation via Learning Viewpoint Tokens PDF ↗
Xinxuan Lu, Charless Fowlkes, Alexander C. Berg
56
3D Space as a Scratchpad for Editable Text-to-Image Generation PDF ↗
Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Matheus Gadelha, Kevin Blackburn-Matzen
57
Aligning Multi-Character Narrative Image Generation with Multi- Aspect Human Preferences PDF ↗
Ziyi Gao, Zhipeng Wei, Jingjing Chen, Zhiyu Tan, Hao Li, Yi-Ping Phoebe Chen
58
FoleyDirector: Directing Temporal Controllable Video-to-Audio Generation via Fine-Grained Temporal Scripts
You Li, Dewei Zhou, Fan Ma, Fu Li, Dongliang He, Yi Yang
59
DCoAR: Deep Concept Injection into Unified Autoregressive Models for Personalized Text-to-Image Generation PDF ↗
Fangtai Wu, Mushui Liu, Weijie He, Zhao Wang, Yunlong Yu
60
DreamOmni2: Multimodal Instruction-based Generation and Editing PDF ↗
Bin Xia, bohao peng, Yuechen Zhang, Junjia Huang, Jiyang Liu, Jingyao Li, Haoru Tan, Sitong Wu, Chengyao Wang, Yitong Wang, Bei Yu, Jiaya Jia
61
AutoDebias: An Automated Framework for Detecting and Mitigating Backdoor Biases in Text-to-Image Models PDF ↗
Hongyi Cai, Mohammad Mahdinur Rahman, MingKang Dong, Muxin Pu, Moayad Aloqaily, Jie Li, Xinfeng Li, Jialie Shen, Meikang Qiu, Qingsong Wen
62
PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation PDF ↗
Yuheng Feng, Wen Zhang, Haodong Duan, Xingxing Zou
63
IVAAN: Instance-level Vision-Language Alignment via Attribute- Guided Text Prompts Generation for Nuclei Analysis PDF ↗
Jaehoon Jeong, Yi Hu, Soopil Kim, Jongseong Jang, Soonyoung Lee, Sang Hyun Park
64
IsoCLIP: Decomposing CLIP Projectors for Efficient Intra-modal Alignment PDF ↗
Simone Magistri, Dipam Goswami, Marco Mistretta, Bartłomiej Twardowski, Joost van de Weijer, Andrew D. Bagdanov
65
TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment PDF ↗
Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, Andre Araujo
66
BioVITA: Biological Dataset, Model, and Benchmark for Visual- Textual-Acoustic Alignment PDF ↗
Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Kuniaki Saito, Hiroaki Santo, Fumio Okura
67
Boosting Visual Reprogramming for CLIP with Dual Granularity Alignment PDF ↗
Jiayang Wu, Xinyang Chen, Ke Lv, Weili Guan
68
Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning PDF ↗
Tingyu Li, Zheng Sun, Jingxuan Wei, Conghui He, Lijun Wu, Cheng Tan
69
UniGen-1.5: Enhancing Image Generation and Editing through Reward Unification in RL PDF ↗
Rui Tian, Mingfei Gao, Haiming Gang, Jiasen Lu, Zhe Gan, Yinfei Yang, Zuxuan Wu, Afshin Dehghan
70
PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction PDF ↗
Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew, Xucong Zhang
71
Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning PDF ↗
Yuqiao Zeng, Xu Wang, Tengfei Liang, Yiqing Hao, Yi Jin, Hui Yu
72
Unified Personalized Understanding, Generating and Editing PDF ↗
Yu Zhong, Tianwei Lin, Ruike Zhu, Yuqian Yuan, Haoyu Zheng, Liang Liang, Wenqiao Zhang, Feifei Shao, Haoyuan Li, Wanggui He, Hao Jiang, Yueting Zhuang
73
MSRL: Scaling Generative Multimodal Reward Modeling via Multi- Stage Reinforcement Learning PDF ↗
Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao
74
Towards Uncertainty-aware Unsupervised Domain Adaptation for Videos and Time-Series with Causal Optimal Transport PDF ↗
Khushboo Mishra, Varun Trivedi, Tanima Dutta
75
Foundation Model Priors Enhance Object Focus in Feature Space for Source-Free Object Detection PDF ↗
Sairam VCR, Rishabh Lalla, Aveen Dayal, Tejal Kulkarni, Anuj Lalla, Vineeth N. Balasubramanian, Muhammad Haris Khan
76
Decision Boundary-aware Generation for Long-tailed Learning PDF ↗
Jiacheng Yang, Ruichi Zhang, Chikai Shang, Mengke Li, Xinyi Shang, Junlong Gao, Yonggang Zhang, Yang Lu
77
Towards Stable Federated Continual Test-Time Adaptation in Wild World PDF ↗
Liwen Wang, Xingbo Dong, Iman Yi Liao, Zhe Jin
78
HyCal: A Training-Free Prototype Calibration Method for Cross- Discipline Few-Shot Class-Incremental Learning PDF ↗
Eunju Lee, MiHyeon Kim, JuneHyoung Kwon, Yoonji Lee, JiHyun Kim, Soojin Jang, YoungBin Kim
79
ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation PDF ↗
Bo Xu, Haotian Wu, Hehai Lin, Weiquan Huang, Beier Zhu, Yao Shu, Chengwei Qin
80
CHIPS: Efficient CLIP Adaptation via Curvature-aware Hybrid Influence-based Data Selection PDF ↗
Xinlin Zhuang, Yichen Li, Xiwei Liu, Haolin Yang, Yifan Lu, Ziyun Zou, Yulong Li, Huifa Li, Dongliang Chen, Qinglei Wang, Weiyang Liu, Ying Qian, Jiangming Shi, Imran Razzak
81
Addressing Exacerbated Attention Sink for Source-Free Cross- Domain Few-Shot Learning PDF ↗
Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li
82
Depth Hypothesis Guided Iterative Refinement for Event–Image Monocular Depth Estimation PDF ↗
Daikun Liu, Teng Wang, Changyin Sun
83
High-Quality and Efficient Turbulence Mitigation with Events PDF ↗
Xiaoran Zhang, Jian Ding, Yuxing Duan, Haoyue Liu, Gang Chen, Yi Chang, Luxin Yan
84
Tracking through Severe Occlusion via Event-Derived Transient Cues PDF ↗
Hao Dong, Yujin Liu, Haoyue Liu, Zhenyu Wang, Shihan Peng, Zhiwei Shi, Yi Chang, Luxin Yan
85
FastEventDGS: Deformable Gaussian Splatting for Fast Dynamic Scenes from a Single Event Camera PDF ↗
Zijia Dai, Nico Messikommer, Rong Zou, Nikola Zubic, Davide Scaramuzza, Laurent Kneip
86
Event-Based Motion Deblurring Using Task-Oriented 3D Gaussian Event Representations PDF ↗
Shengdong Xue, Haoxiang Ma, Hao Chen, Zhen Yang, Yongjian Deng
87
From Corners to Fiducial Tags: Revisiting Checkerboard Calibration for Event Cameras PDF ↗
Taehun Ryu, Changwoo Kang, Kyungdon Joo
88
Extending Embodied Question Answering from Perception to Decision PDF ↗
Xicheng Gong, Qiwei Li, Peiran Xu, Yadong Mu
89
Dejavu: Towards Experience Feedback Learning for Embodied Intelligence PDF ↗
Shaokai Wu, Yanbiao Ji, Qiuchang Li, Zhiyi Zhang, Qichen He, Wenyuan Xie, Guodong Zhang, Bayram Bayramli, Yue Ding, Hongtao Lu
90
Demo2Tutorial: From Human Experience to Multimodal Software Tutorials PDF ↗
Zechen Bai, Zhiheng Chen, Yiqi Lin, Kevin Qinghong Lin, Difei Gao, Xiangwu Guo, Xin Wang, Mike Zheng Shou
91
MaskDexGrasp: Generative Masked Modeling for Part-Aware Dexterous Grasp Synthesis PDF ↗
Binghui Zuo, Lin Zhou, Haoxuan Xu, Jianan Yan, Zhipeng Yu, Zekai Liu, Yangang Wang
92
Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering PDF ↗
Bowen Yuan, Sisi You, Bing-Kun Bao
93
VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents PDF ↗
George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu
94
MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents PDF ↗
Ruoxuan Zhang, Qiyun Zheng, Zhiyu Zhou, Ziqi Liao, Siyu Wu, Jian-Yu Jiang-Lin, Bin Wen, Hongxia Xie, Jianlong Fu, Wen-Huang Cheng
95
Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents PDF ↗
Seohui Bae, Jeonghye Kim, Youngchul Sung, Woohyung Lim
96
Rethinking Intermediate Representation for VLM-based Robot Manipulation PDF ↗
Weiliang Tang, Jialin Gao, Jia-Hui Pan, Gang Wang, Li Erran Li, Yun-Hui Liu, Mingyu Ding, Pheng-Ann Heng, Chi-Wing Fu
97
Dexterous World Models PDF ↗
Byungjun Kim, Taeksoo Kim, Junyoung Lee, Hanbyul Joo
98
FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-and-Language Navigation PDF ↗
Jing Zuo, Lingzhou Mu, Fan Jiang, Chengcheng Ma, Mu Xu, Yonggang Qi
99
UniLight: A Unified Representation for Lighting PDF ↗
Zitian Zhang, Iliyan Georgiev, Michael Fischer, Yannick Hold-Geoffroy, Jean-Francois Lalonde, Valentin Deschaintre
100
MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition PDF ↗
Xinyu Wei, Kangrui Cen, Hongyang Wei, Zhen Guo, Bairui Li, Zeqing Wang, Jinrui Zhang, Lei Zhang
101
Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling PDF ↗
Minseok Seo, Mark Hamilton, Changick Kim
102
Hist2Style: Histogram-Guided Stylization with Bilateral Grids PDF ↗
Dekel Galor, Adam Pikielny, Zhoutong Zhang, Ke Wang, Laura Waller, Jiawen Chen, Ilya Chugunov
103
Harmonic Canvas: Inversion-Free Editing for Visually-Guided Music Style Transfer PDF ↗
Yue Lei, Siqi Yang, Ting Zhong, Fan Zhou
104
How to Take a Memorable Picture? Empowering Users with Actionable Feedback PDF ↗
Francesco Laiti, Davide Talon, Jacopo Staiano, Elisa Ricci
105
UniEdit-I: Training-free Image Editing for Unified VLM via Iterative Understanding, Editing and Verifying PDF ↗
Chengyu Bai, Jintao Chen, Xiang Bai, Yilong Chen, Qi She, Ming Lu, Shanghang Zhang
106
SCIEval: Evaluating and Benchmarking the Faithfulness of Scientific Image Generation and Interpretation with Large Multimodal Models PDF ↗
Guanghui Ye, Huan Zhao, Zhixue Zhao, Tengfei Ma, Kehan Wang, Steffen Eger, Zhihua Jiang
107
GeoRelight: Learning Joint Geometrical Reconstruction and Relighting with Flexible Multi-Modal Diffusion Transformers
Yuxuan Xue, Ruofan Liang, Egor Zakharov, Timur Bagautdinov, Chen Cao, Giljoo Nam, Shunsuke Saito, Gerard Pons-Moll, Javier Romero
108
HAD: Hallucination-Aware Diffusion Priors for 3D Reconstruction PDF ↗
Xi Liu, Weiwei Sun, Zhou Ren, Chris Broaddus, Siyu Huang, Laurent Guigues
109
Catalyst4D: High-Fidelity 3D-to-4D Scene Editing via Dynamic Propagation PDF ↗
Shifeng Chen, Yihui Li, Jun Liao, Hongyu Yang, Di Huang
110
ReFlow: Self-correction Motion Learning for Dynamic Scene Reconstruction PDF ↗
Yanzhe Liang, Ruijie Zhu, Hanzhi Chang, Zhuoyuan Li, Jiahao Lu, Tianzhu Zhang
111
Semantic Foam: Unifying Spatial and Semantic Scene Decomposition PDF ↗
Amr Sharafeldin, Aryan Mikaeili, Thomas Walker, Shrisudhan Govindarajan, Daniel Rebain, Kwang Moo Yi, Andrea Tagliasacchi
112
NVGS: Neural Visibility for Occlusion Culling in 3D Gaussian Splatting PDF ↗
Brent Zoomers, Florian Hahlbohm, Joni Vanherck, Lode Jorissen, Marcus Magnor, Nick Michiels
113
NeAR: Coupled Neural Asset–Renderer Stack PDF ↗
Hong Li, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Ziyang Yan, Lixing Xiao, Zhaoxi Chen, Jianfeng Xiang, Shaocong Xu, Xuhui Liu, Yikai Wang, Baochang Zhang, Xiaoguang Han, Jiaolong Yang, Hao Zhao
114
Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis PDF ↗
M. Kerem Aydin, Vishwanath Saragadam, Emma Alexander
115
PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis PDF ↗
Chunji Lv, Zequn Chen, Donglin Di, Weinan Zhang, Hao Li, Chen Wei, Yinjie Lei, Changsheng Li
116
Life-IQA: Boosting Blind Image Quality Assessment through GCN- enhanced Layer Interaction and MoE-based Feature Decoupling PDF ↗
Long Tang, Huiyu Duan, Guoquan Zheng, Jianbo Zhang, Jie Hao, Liang Yuan
117
TM-BSN: Triangular-Masked Blind-Spot Network for Real-World Self- Supervised Image Denoising PDF ↗
Junyoung Park, Youngjin Oh, Nam Ik Cho
118
Multinex: Lightweight Low-light Image Enhancement via Multi- prior Retinex PDF ↗
Alexandru Brateanu, Tingting Mu, Codruta O. Ancuti, Cosmin Ancuti
119
Beyond Ground-Truth: Leveraging Image Quality Priors for Real- World Image Restoration PDF ↗
Fengyang Xiao, Peng Hu, Lei Xu, XingE Guo, Guanyi Qin, Yuqi Shen, Chengyu Fang, Rihan Zhang, Chunming He, Sina Farsiu
120
ExpoCM: Exposure-Aware One-Step Generative Single-Image HDR Reconstruction PDF ↗
Aoyu Liu, Zhen Liu, Ziyi Wang, Dian Chen, Bing Zeng, Shuaicheng Liu
121
Physically-Grounded Turbulence Mitigation with Frame-Shared Degradation Parameters PDF ↗
Dongxin Xie, Yan Huang, Yong Xu, Hui Ji
122
Convexity-Aware Noise Calibration: A Self-Supervised Framework for Noise-Level-Unknown Image Denoising PDF ↗
Zhan Wang, Leiquan Wang, Chunlei Wu, Yu Meng
123
UCMNet: Uncertainty-Aware Context Memory Network for Under- Display Camera Image Restoration PDF ↗
Daehyun Kim, Youngmin Kim, Yoon Ju Oh, Tae Hyun Kim
124
Beyond the Ground Truth: Enhanced Supervision for Image Restoration PDF ↗
Donghun Ryou, Inju Ha, Sanghyeok Chu, Bohyung Han
125
ShiftLUT: Spatial Shift Enhanced Look-Up Tables for Efficient Image Restoration PDF ↗
Xiaolong Zeng, Yitong Yu, Shiyao Xiong, Jinhua Hao, Ming Sun, Chao Zhou, Bin Wang
126
Bilevel Layer-Positioning LoRA for Real Image Dehazing PDF ↗
Yan Zhang, Long Ma, Yuxin Feng, Zhe Huang, Fan Zhou, Zhuo Su
127
SD-FSMIS: Adapting Stable Diffusion for Few-Shot Medical Image Segmentation PDF ↗
Meihua Li, Yang Zhang, Weizhao He, Hu Qu, Yisong Li
128
GeoSemba: Reconstructing State Space Model for Cross Paradigm Representation in Medical Image Segmentation PDF ↗
Xutao Sun, Jiarui Li, Junwen Liu, Yonggong Ren
129
SHAPE: Structure-aware Hierarchical Unsupervised Domain Adaptation with Plausibility Evaluation for Medical Image Segmentation PDF ↗
Linkuan Zhou, Yinghao Xia, Yufei Shen, Xiangyu Li, Wenjie Du, Cong Cong, Leyi Wei, Ran Su, Qiangguo Jin
130
Delving Aleatoric Uncertainty in Medical Image Segmentation via Vision Foundation Models PDF ↗
Ruiyang Li, Fang Liu, Licheng Jiao, Xinglin Xie, Jiayao Hao, Shuo Li, Xu Liu, Jingyi Yang, Lingling Li, Puhua Chen, Wenping Ma
131
Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification PDF ↗
Han Liu, Bogdan Georgescu, Yanbo Zhang, Youngjin Yoo, Michael Baumgartner, Riqiang Gao, Jianing Wang, Gengyan Zhao, Eli Gibson, Dorin Comaniciu, Sasa Grbic
132
Focus on Background: Exploring SAM's Potential in Few- shot Medical Image Segmentation with Background-centric Prompting PDF ↗
Yuntian Bo, Yazhou Zhu, Piotr Koniusz, Haofeng Zhang
133
Simple-ViLMedSAM: Simple Text Prompts Meet Vision-Language Models for Medical Image Segmentation PDF ↗
Chengcan Qian, Dong Nie, Geng Chen, Daoqiang Zhang, Xuyun Wen
134
NeuroSeg Meets DINOv3: Transferring 2D Self-Supervised Visual Priors to 3D Neuron Segmentation via DINOv3 Initialization PDF ↗
Yik San Cheng, Runkai Zhao, Weidong Cai
135
Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models PDF ↗
Yuanbo Li, Tianyang Xu, Cong Hu, Tao Zhou, Xiao-Jun Wu, Josef Kittler
136
TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models PDF ↗
Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie
137
Jailbreaking Vision-Language Models via Dissonance-Guided Suffix Optimization and Image–Phrase Injection PDF ↗
Jiacheng Pi, Zhiguo Yang, Xingxing Huang, Dongsheng Xu, Ruizhi Zhong, Wenjie Ruan
138
BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation PDF ↗
Feiran Li, Qianqian Xu, Shilong Bao, Zhiyong Yang, Xilin Zhao, Xiaochun Cao, Qingming Huang
139
VCP-Attack: Visual-Contrastive Projection for Transferable Black-Box Targeted Attacks on Large Vision-Language Models PDF ↗
Jiawei Zhao, Minjie Du, Zihan Qin, Zhuoran Wang, Lizhe Xie, Yining Hu
140
Adapter Shield: A Unified Framework with Built-in Authentication for Preventing Unauthorized Zero-Shot Image-to-Image Generation PDF ↗
Jun Jia, Hongyi Miao, Yingjie Zhou, Wangqiu Zhou, Jianbo Zhang, Linhan Cao, Dandan Zhu, Hua Yang, Xiongkuo Min, Wei Sun, Guangtao Zhai
141
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models PDF ↗
Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen
142
Transform to Transfer: Boosting Adversarial Attack Transferability on Vision-Language Pre-training Models PDF ↗
Yang Li, Jia-Li Yin, Luojun Lin, Wei Lin
143
Mask to Align, Weight to Disambiguate: Reliable Unsupervised Cross-Modal Hashing with Masked-Weight Contrast PDF ↗
Fan Yang, Yuanzhi Zhao, Haimei Zhao, Yudong Zhao, Haikun Xu
144
Reliable Clustering Number Estimation for Contrastive Multi-View Clustering PDF ↗
Zhengzhong Zhu, Pei Zhou, Lanxi Bai, Li Cheng, Jia Nie, Shiquan Min, Jiangping Zhu
145
Pushing the Frontier of Audiovisual Perception with Large-Scale Multimodal Correspondence Learning PDF ↗
Apoorv Vyas, Heng-Jui Chang, Cheng-Fu Yang, Po-Yao Huang, Luya Gao, Julius Richter, Sanyuan Chen, Matthew Le, Piotr Dollár, Christoph Feichtenhofer, Ann Lee, Wei-Ning Hsu
146
Enhance-then-Balance Modality Collaboration for Robust Multimodal Sentiment Analysis PDF ↗
Kang He, Yuzhe Ding, Xinrong Wang, Fei Li, Chong Teng, Donghong Ji
147
SonoWorld: From One Image to a 3D Audio-Visual Scene PDF ↗
Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao
148
MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping PDF ↗
Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang
149
EXOTIC: External Vision-driven Incomplete Multi-view Classification PDF ↗
Shilin Xu, Dezhong Peng, Zhenwen Ren, Yuan Sun
150
Easy2Hard: From Partially to Fully Unmatched Modalities as Negative Samples in Contrastive Learning PDF ↗
Zhicheng Yang, Yichen Liu, Chang Ge, Xiaopeng Jiang
151
OneCAT: Decoder-Only Auto-Regressive Model for Unified Understanding and Generation PDF ↗
Han Li, Xinyu Peng, Yaoming Wang, Zelin Peng, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Wenrui Dai, Hongkai Xiong
152
BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates PDF ↗
Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen
153
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling PDF ↗
Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu
154
Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration PDF ↗
Jinglin Xu, Yi Li, Chuxiong Sun, Xiao Xu, Jiangmeng Li, Fanjiang Xu
155
Information-Theoretic Decomposition for Multimodal Interaction Learning PDF ↗
Zequn Yang, Yake Wei, Haotian Ni, Zhihao Xu, Di Hu
156
Is the Modality Gap a Bug or a Feature? A Robustness Perspective PDF ↗
Rhea Chowers, Oshri Naparstek, Udi Barzelay, Yair Weiss
157
Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection PDF ↗
Tianxiao Li, Zhenglin Huang, Haiquan Wen, Yiwei He, Xinze Li, Bingyu Zhu, Wuhui Duan, Congang Chen, Zeyu Fu, Yi Dong, Baoyuan Wu, Xiangtai Li, Guangliang Cheng
158
MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality PDF ↗
Kyungwon Kim, Dosik Hwang
159
VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction PDF ↗
Sinan Du, Jiahao Guo, Bo Li, Shuhao Cui, Zhengzhuo Xu, Yifu Luo, Yongxian Wei, Kun Gai, Xinggang Wang, Kai Wu, Chun Yuan
160
MOS: Mitigating Optical-SAR Modality Gap for Cross-Modal Ship Re- Identification PDF ↗
Yujian Zhao, Hankun Liu, Guanglin Niu
161
SeD-UD: An Influence-Driven and Hierarchically-Decoupled Information Bottleneck for Multimodal Intent Recognition PDF ↗
Qin Li, Wenbo Zhang, Limei Liu, Han Peng, Junfeng Yang, Guanying Xu
162
MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning PDF ↗
Wall Kim, Chaeyoung Song, Hanul Kim
163
LacTokGen: Latent Consistency Tokenizer for 1024-pixel Image Generation by 256 Tokens PDF ↗
Qingsong Xie, Luyuan Zhang, Zhao Zhang, Siyuan Li, Zhe Huang, Zhenyu Yang, Haonan Lu
164
FlowSteer: Guiding Few-Step Image Synthesis with Authentic Trajectories PDF ↗
Lei Ke, Hubery Yin, Gongye Liu, Zhengyao Lv, Jingcai Guo, Chen Li, Wenhan Luo, Yujiu Yang, Jing Lyu
165
Visual Autoregressive Modeling via Next Focus Prediction
Xiaofan Li, Chenming Wu, Yanpeng Sun, Jiaming Zhou, Delin Qu, Yansong Qu, Weihao Bo, Haibao Yu, Dingkang Liang
166
Semantic Context Matters: Improving Conditioning for Autoregressive Models PDF ↗
Dongyang Jin, Ryan Xu, Jianhao Zeng, Rui Lan, Yancheng Bai, Lei Sun, Xiangxiang Chu
167
TempoMaster: Efficient Long Video Generation via Next-Frame-Rate Prediction PDF ↗
Yukuo Ma, Cong Liu, Junke Wang, Junqi Liu, Haibin Huang, Zuxuan Wu, Chi Zhang, Xuelong Li
168
FlashIn: Fast and Accurate Image Inversion for Real-time Image Editing PDF ↗
Guangzhi Wang
169
EasyV2V: A High-quality Instruction-based Video Editing Framework PDF ↗
Jinjie Mai, Chaoyang Wang, Gordon Guocheng Qian, Willi Menapace, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Ashkan Mirzaei
170
One Algorithm to Align Them All PDF ↗
Boyi Pang, Savva Ignatyev, Vladimir Ippolitov, Ramil Khafizov, Yurii Melnik, Oleg Voynov, Maksim Nakhodnov, Aibek Alanov, Xiaopeng Fan, Peter Wonka, Evgeny Burnaev
171
VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation PDF ↗
Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin
172
Improved Mean Flows: On the Challenges of Fastforward Generative Models PDF ↗
Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, Kaiming He
173
SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation PDF ↗
Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao
174
Match-and-Fuse: Consistent Generation from Unstructured Image Sets PDF ↗
Kate Feingold, Omri Kaduri, Tali Dekel
175
Mixture of Style Experts for Diverse Image Stylization PDF ↗
Shihao Zhu, Ziheng Ouyang, Yijia Kang, Qilong Wang, Mi Zhou, Bo Li, Ming-Ming Cheng, Qibin Hou
176
Mirai: Autoregressive Visual Generation Needs Foresight PDF ↗
Yonghao Yu, Lang Huang, Zerun Wang, Runyi Li, Toshihiko Yamasaki
177
Align Images Before You Generate PDF ↗
Shihua Zhang, Qiuhong Shen, Xinchao Wang
178
Bridging the Perception Gap in Image Super-Resolution Evaluation PDF ↗
Shaolin Su, Josep M. Rocafort, Danna Xue, David Serrano-Lozano, Lei Sun, Javier Vazquez-Corral
179
Time-Aware One Step Diffusion Network for Real-World Image Super-Resolution PDF ↗
Tianyi Zhang, Zheng-Peng Duan, Chun-Le Guo, Peng-Tao Jiang, Bo Li, Ming-Ming Cheng, Chongyi Li
180
Restore Text First, Enhance Image Later: Two-Stage Scene Text Image Super-Resolution with Glyph Structure Guidance PDF ↗
Minxing Luo, Linlong Fan, Qiushi Wang, Ge Wu, Yiyan Luo, Yuhang Yu, Jinwei Chen, Yaxing Wang, Qingnan Fan, Jian Yang
181
IAFMNet: Information-Aware Feature Modulation for Efficient Super- Resolution PDF ↗
Junwei Xu, Mengzu Liu, Zhenyu Wang, Fangfang Wu, Sijia Wu, Tao Huang, Weisheng Dong
182
Physics-Consistent Diffusion for Efficient Fluid Super-Resolution via Multiscale Residual Correction PDF ↗
Zhihao Li, Shengwei Dong, Chuang Yi, Junxuan Gao, Zhilu Lai, Zhiqiang Liu, Wei Wang, Guangtao Zhang
183
Bridging Fidelity-Reality with Controllable One-Step Diffusion for Image Super-Resolution PDF ↗
Hao Chen, Junyang Chen, Jinshan Pan, Jiangxin Dong
184
Omni-Supervised Motion Editing: Balancing Change and Invariance through Positive-Negative Learning PDF ↗
Zhenwu Shi, Jingyu Gong, Peiwei Wang, Xingzan Wang, Tianwen Qian, Wenxi Li, Yuan Fang, Jiao Xie, Lizhuang Ma, Shaohui Lin
185
FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning PDF ↗
Weijie Lyu, Ming-Hsuan Yang, Zhixin Shu
186
Cross-Axis Feature Fusion with Joint-Wise Motion Difference Prediction for Text-Based 3D Human Motion Editing PDF ↗
Gyojin Han, Junmo Kim
187
MotionMaster: Generalizable Text-Driven Motion Generation and Editing PDF ↗
Nan Jiang, Yunhao Li, Lexi Pang, Zimo He, Siyuan Huang, Yixin Zhu
188
OpenT2M: No-frill Motion Generation with Open-source, Large- scale, High-quality Data PDF ↗
Bin Cao, Sipeng Zheng, Hao Luo, Boyuan Li, Jing Liu, Zongqing Lu
189
Towards Decompositional Human Motion Generation with Energy- Based Diffusion Models PDF ↗
Jianrong Zhang, Hehe Fan, Yi Yang
190
PAMotion: Physics-Aware Motion Generation for Full-Body Interaction with Multiple Objects PDF ↗
Yan Di, Yuheng Li, Yaoxing Wang, Mengge Liu, Shan Gao, Xiangyang Ji
191
Sketch2Colab: Sketch-Conditioned Multi-Human Animation via Controllable Flow Distillation PDF ↗
Divyanshu Daiya, Aniket Bera
192
ViHOI: Human-Object Interaction Synthesis with Visual Priors PDF ↗
Songjin Cai, Linjie Zhong, Ling Guo, Changxing Ding
193
CLEP: Contrastive Language-Pose Pretraining PDF ↗
Sen Jia, Huayu Wang, Hsiang-Wei Huang, Zhaochong An, Jenq-Neng Hwang, Huaping Zhang, Lei Li
194
OpenFS: Multi-Hand-Capable Fingerspelling Recognition with Implicit Signing-Hand Detection and Frame-Wise Letter-Conditioned Synthesis PDF ↗
Junuk Cha, Jihyeon Kim, Han-Mu Park
195
ARMFlow: AutoRegressive MeanFlow for Online 3D Human Reaction Generation PDF ↗
Zichen Geng, Zeeshan Hayder, Wei Liu, Hesheng Wang, Ajmal Saeed Mian
196
InterPhys: Physics-aware Human Motion Synthesis in a Dynamic Scene PDF ↗
Chaoyue Xing, Wei Mao, Miaomiao Liu
197
Beyond Mimicry: Learning Whole-Body Human-Humanoid Interaction from Human-Human Demonstrations PDF ↗
Wei-Jin Huang, Yue-Yi Zhang, Yi-Lin Wei, Zhi-Wei Xia, Juantao Tan, Yuan-Ming Li, Zhilin Zhao, Wei-Shi Zheng
198
PHAC: Promptable Human Amodal Completion PDF ↗
Seung Young Noh, Ju Yong Chang
199
CoordSpeaker: Exploiting Gesture Captioning for Coordinated Caption-Empowered Co-Speech Gesture Generation PDF ↗
Fengyi Fang, Sicheng Yang, Wenming Yang
200
IntrinsicWeather: Controllable Weather Editing in Intrinsic Space PDF ↗
Yixin Zhu, Zuo-Liang Zhu, Jian Yang, Miloš Hašan, Jin Xie, Beibei Wang
201
Outlier-Robust Diffusion Solvers for Inverse Problems PDF ↗
Yang Zheng, Jiahua Liu, Tongyao Pang, Wen Li, Zhaoqiang Liu
202
Beyond Fixed Formulas: Data-Driven Linear Predictor for Efficient Diffusion Models PDF ↗
Zhirong Shen, Rui Huang, Jiacheng Liu, Chang Zou, Peiliang Cai, Shikang Zheng, Zhengyi Shi, Liang Feng, Linfeng Zhang
203
ReasonX: MLLM-Guided Intrinsic Image Decomposition PDF ↗
Alara Dirik, Tuanfeng Yang Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück
204
Diff-SemiER: Transparency-Aware Adaptive Fusion Diffusion Model with Generative Prior for Semi-Transparent Eyeglasses Removal PDF ↗
Jiahao Li, Shiqi Yin, Zhenxiang Lian, Jingtao Guo
205
KLIP: Localized Distribution Shift Detection via KL-Divergence with Diffusion Priors in Inverse Problems PDF ↗
Alireza Kheirandish, Jihoon Hong, Sara Fridovich-Keil
206
Elucidating the Design Space of Arbitrary-Noise-Based Diffusion Models PDF ↗
Xingyu Qiu, Mengying Yang, Xinghua Ma, Dong Liang, Fanding Li, Gongning Luo, Wei Wang, Kuanquan Wang, Shuo Li
207
Taming Generative Diffusion Model for Task-Oriented Infrared Imaging PDF ↗
Tengyu Ma, Zhilong Dai, Yubo Diao, Guanming An, Long Ma, Jinyuan Liu, Risheng Liu
208
Attention, May I Have Your Decision? Localizing Generative Choices in Diffusion Models PDF ↗
Katarzyna Zaleska, Łukasz Popek, Monika Wysoczańska, Kamil Deja
209
RxnCaption: Reformulating Reaction Diagram Parsing as Visual Prompt Guided Captioning PDF ↗
Jiahe Song, Chuang Wang, Bowen Jiang, Yinfan Wang, Hao Zheng, Xingjian Wei, Chengjin Liu, Rui Nie, Junyuan Gao, Jiaxing Sun, Yubin Wang, Lijun Wu, Zhenhua Huang, Jiang Wu, Qian Yu, Conghui He
210
More than the Sum: Panorama-Language Models for Adverse Omni- Scenes PDF ↗
Weijia Fan, Ruiping Liu, Jiale Wei, Yufan Chen, Junwei Zheng, Zichao Zeng, Jiaming Zhang, Qiufu Li, Linlin Shen, Rainer Stiefelhagen
211
DiGraphHal-Bench: Evaluating Multimodal Large Language Models on Complex Directed Graphs PDF ↗
Yixin Fan, Zhao He, Yuxin Hou, Changhua Zhou, Zihao Liu, Peng Wang, Chenglong Lu, Xu Zhang, Wei Wang
212
SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia PDF ↗
Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao
213
Time Blindness: Why Video-Language Models Can’t See What Humans Can? PDF ↗
Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny
214
Spot The Ball: A Benchmark for Visual Social Inference PDF ↗
Neha Balamurugan, Sarah Wu, Cristobal Eyzaguirre, Tobias Gerstenberg
215
MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning PDF ↗
Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo
216
E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of- Thought PDF ↗
Meiqi Sun, Mingyu Li, Junxiong Zhu
217
GeoWorld: Geometric World Models PDF ↗
Zeyu Zhang, Danning Li, Ian Reid, Richard Hartley
218
ORD: Object-Relation Decoupling for Generalized 3D Visual Grounding PDF ↗
Ronggang Huang, Fansen Meng, Huaidong Zhang, Xuemiao Xu
219
Benchmarking PhD-Level Coding in 3D Geometric Computer Vision PDF ↗
Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao
220
MonoVLM: Monocular 3D Visual Grounding with Vision Language Models PDF ↗
Huaizhi Qu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Tianlong Chen
221
Curvature-Aware Captioning: Leveraging Geodesic Attention for 3D Scene Understanding PDF ↗
Ziyao He, Yingjie Liu, Zhang Yangrui, Mingsong Chen, Xuan Tang, Xian Wei
222
SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion PDF ↗
Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu
223
ExtrinSplat: Decoupling Geometry and Semantics for Open- Vocabulary Understanding in 3D Gaussian Splatting PDF ↗
Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li
224
SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence PDF ↗
Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie
225
4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation PDF ↗
Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen
226
VLM-3R: Vision-Language Models Augmented with Instruction- Aligned 3D Reconstruction PDF ↗
Zhiwen Fan, Jian Zhang, Renjie Li, Junge Zhang, Runjin Chen, Hezhen Hu, Kevin Wang, Peihao Wang, Huaizhi Qu, Shijie Zhou, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Tianlong Chen, Jiachen Li, Zhengzhong Tu, Zhangyang Wang, Rakesh Ranjan
227
Merge3D: Efficient 3D Multimodal LLMs via Joint 2D-3D Token Merging PDF ↗
Tianbo Pan, Xingyi Yang, Xinchao Wang
228
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi- Modal Large Language Models PDF ↗
Runsen Xu, Weiyao Wang, Hao Tang, Xingyu Chen, Xiaodong Wang, Fu-Jen Chu, Matt Feiszli, Kevin J. Liang
229
LocateAnything3D: Vision-Language 3D Detection with Chain- of-Sight PDF ↗
Yunze Man, Shihao Wang, Guowen Zhang, Johan Bjorck, Liang-Yan Gui, Jim Fan, Jan Kautz, Yu-Xiong Wang, Zhiding Yu
230
Quota-Calibrated Fine-Grained Alignment with Context-Aware Marginals for Text-based Person Retrieval PDF ↗
Dongsheng Li, Xinyuan Guo, Huijie Zhang, Pingting Hao, Qiushi Xia
231
Evo-Retriever: LLM-Guided Curriculum Evolution with Viewpoint-Pathway Collaboration for Multimodal Document Retrieval PDF ↗
Weiqing Li, Jinyue Guo, Yaqi Wang, Haiyang Xiao, Yuewei Zhang, Guohua Liu, Hao Henry Wang
232
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models PDF ↗
Hulingxiao He, Zhi Tan, Yuxin Peng
233
FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection PDF ↗
Maxime Fontana, Michael Spratling, Miaojing Shi
234
Model Merging in the Essential Subspace PDF ↗
Longhua Li, Lei Qi, Qi Tian, Xin Geng
235
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval PDF ↗
Yuxin Yang, Yinan Zhou, Yuxin Chen, Ziqi Zhang, Zongyang Ma, Chunfeng Yuan, Bing Li, Jun Gao, Weiming Hu
236
SAVE: Speech-Aware Video Representation Learning for Video- Text Retrieval PDF ↗
Ruixiang Zhao, Zhihao Xu, Bangxiang Lan, Zijie Xin, Jingyu Liu, Xirong Li
237
MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures PDF ↗
Tim Strohmeyer, Lucas Morin, Gerhard Ingmar Meijer, Valery Weber, Ahmed Nassar, Peter Staar
238
Progressive Cross-Modal Causal Intervention for Long-Term Action Recognition PDF ↗
Shaowu Xu, Xibin Jia, Chao Fan, Junyu Gao, Jing Chang, Qianmei Sun
239
EthoCLIP: Ontology-Enhanced Video-Language Pretraining for Animal Behavior Understanding PDF ↗
Yinuo Jing, Jinyan Wu, Zixi Yang, Kongming Liang, Xiatian Zhu, Zhanyu Ma
240
TrajTok: Learning Trajectory Tokens Enhances Video Understanding PDF ↗
Chenhao Zheng, Jieyu Zhang, Jianing Zhang, Weikai Huang, Ashutosh Kumar, Quan Kong, Oncel Tuzel, Chun-Liang Li, Ranjay Krishna
241
Streaming Video Instruction Tuning PDF ↗
Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou
242
VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer PDF ↗
Rui Lin, Chuanming Wang, Huadong Ma
243
ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos PDF ↗
Luigi Seminara, Davide Moltisanti, Antonino Furnari
244
From Static to Dynamic: Exploring Self-supervised Image-to- Video Representation Transfer Learning PDF ↗
Yang Liu, Qianqian Xu, Peisong Wen, Siran Dai, Xilin Zhao, Qingming Huang
245
Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation PDF ↗
Tzu Ling Liu, Ian Stavness, Mrigank Rochan
246
FluxMem: Adaptive Hierarchical Memory for Streaming Video Understanding PDF ↗
Yiweng Xie, Bo He, Junke Wang, Xiangyu Zheng, Ziyi Ye, Zuxuan Wu
247
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos PDF ↗
Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu
248
Video Panels for Long Video Understanding PDF ↗
Lars Doorenbos, Federico Spurio, Juergen Gall
249
Gaze Target Estimation Anywhere with Concepts PDF ↗
Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle, Inki Kim, James M. Rehg
250
Select, Hypothesize and Verify: Towards Verified Neuron Concept Interpretation PDF ↗
ZeBin Ji, Yang Hu, Xiuli Bi, Bo Liu, Bin Xiao
251
Finding Distributed Object-Centric Properties in Self-Supervised Transformers PDF ↗
Samyak Rawlekar, Amitabh Swain, Yujun Cai, Yiwei Wang, Ming-Hsuan Yang, Narendra Ahuja
252
Explaining CLIP Zero-shot Predictions Through Concepts PDF ↗
Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas
253
See Through the Noise: Improving Domain Generalization in Gaze Estimation PDF ↗
Yanming Peng, Shijing Wang, Yaping Huang, Yi Tian
254
Mechanisms of Object Localization in Vision–Language Models PDF ↗
Timothy Schaumlöffel, Martina G. Vilas, Gemma Roig
255
mmWaveFlow: Unified Enhancement and Generation of mmWave Human Point Clouds PDF ↗
Chang Su, Beihong Jin, Qiwen Shi, Zhi Wang
256
From Feature Learning to Spectral Basis Learning: A Unifying and Flexible Framework for Efficient and Robust Shape Matching PDF ↗
Feifan Luo, Hongyang Chen
257
Topology-aware Feature Propagation for Unsupervised Non-rigid Point Cloud Correspondence PDF ↗
Haozhe Chen, Rui Li, Zhengbao Wang, Xinhao Zhu, Linjie Li, Tianyu Xiong, Xuan Ouyang, Jiaqi Yang
258
BEV-SLD: Self-Supervised Scene Landmark Detection for Global Localization with LiDAR Bird’s-Eye View Images PDF ↗
David Skuddis, Vincent Ress, Wei Zhang, Vincent Ofosu Nyako, Norbert Haala
259
SAG-GNN: Semantic-Aware Guided GNN for Descriptor-Free 2D-3D Matching PDF ↗
Shihua Zhang, Tianhao Xu, Zizhuo Li, Qing Ma, Jiayi Ma
260
LiREC-Net: A Target-Free and Learning-Based Network for LiDAR, RGB, and Event Calibration PDF ↗
Aditya Ranjan Dash, Ramy Battrawy, René Schuster, Didier Stricker
261
GM-R^2: Generative Matching Learning for Unsupervised Geometric Representation and Registration PDF ↗
Haobo Jiang, Liang Yu, Jianmin Zheng
262
4D Local Modeling Toward Dynamic Global Perception for Ambiguity-free Rotation-Invariant Point Cloud Analysis PDF ↗
Jiaxun Guo, Wentao Fan, Manar Amayri, Nizar Bouguila
263
PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction PDF ↗
Ziqiao Meng, Qichao Wang, Zhiyang Dou, Zixing Song, Zhipeng Zhou, Irwin King, Peilin Zhao
264
MORE-STEM: Long-Short MemOry REcall and Spatio-TEmporal Consistency Model for Query-Driven 3D/4D Point Cloud Segmentation PDF ↗
Chade Li, Haida Feng, Pengju Zhang, Yihong Wu
265
Low-Rank Test-Time Training for Pre-Trained Point Cloud Models PDF ↗
Ouyangzi Ye, Feifei Shao, Kexin Li, Yawei Luo, Zikai Song, Ping Liu, Fengda Zhang, Hongwei Wang, Jun Xiao
266
STAR: Test-Time Adaptation Can Enhance Universal Prompt Learning for Vision-Language Models PDF ↗
Yiwei Fu, Hui Wan, Xiao Luo, Minghua Deng
267
Exploring Visual Pretraining for Learning Language Intelligence PDF ↗
Zhonghan Zhao, Yiming Zhang, Wenwei Zhang, Haiteng Zhao, Xingguang Wei, Zhangwei Gao, Kuikun Liu, Yuzhe Gu, Size Wu, Haian Huang, Jianfei Gao, Haijun Lv, Demin Song, Yunhua Zhou, Qipeng Guo, Gaoang Wang, Kai Chen
268
VL-Eraser: Vacuum Distillation for Machine Unlearning in Vision- Language Models PDF ↗
Yili Wang, Lu Dai, Tairan Huang, Yijie Xu, Hui Xiong
269
DeAR: Fine-Grained VLM Adaptation by Decomposing Attention Head Roles PDF ↗
Yiming Ma, Hongkun Yang, Lionel Z. Wang, Bin Chen, Weizhi Xian, Jianzhi Teng
270
SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception PDF ↗
Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng
271
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models PDF ↗
Ruoxiang Huang, Zhen Yuan
272
VisMem: Latent Vision Memory Unlocks Potential of Vision- Language Models PDF ↗
Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan
273
ORION: ORthonormal Text Encoding for Universal VLM AdaptatION PDF ↗
Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed
274
CASPA: Graph-Structured Concept Anchors for Modality-Agnostic Adaptation in Vision–Language Models PDF ↗
Abhiroop Chatterjee, Susmita Ghosh, Ashish Ghosh, Emmett Ientilucci
275
Mirror Illusion Art PDF ↗
Xiaopei Zhu, Zeyuan Li, Jun Zhu, Xiaolin Hu
276
HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models PDF ↗
Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh
277
Towards Human-Like Robot Handwriting via Contour-Aware Generation PDF ↗
Yutao Qin, Gang Dai, Yifan Zhang, Youwei Han, Qisheng He, Shuangping Huang
278
MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts PDF ↗
Zilong Huang, Jun He, Xiaobin Huang, Ziyi Xiong, Yang Luo, Junyan Ye, Weijia Li, Yiping Chen, Ting Han
279
VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation PDF ↗
Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra
280
OctoT2I: A Self-Evolving Agentic Text-to-Image Router PDF ↗
Xu Jiang, Bin Chen, Gehui Li, Yule Duan, Ronggang Wang, Jian Zhang
281
LottieGPT: Tokenizing Vector Animation for Autoregressive Generation PDF ↗
Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Hao Zhao, Ruqi Huang
282
SEA: Evaluating Sketch Abstraction Efficiency via Element-level Commonsense Visual Question Answering PDF ↗
Jiho Park, Sieun Choi, Jaeyoon Seo, Minho Sohn, Yeana Kim, Jihie Kim
283
Selective Amnesia using Contrastive Subnet Erasure for Class Level Unlearning in Vision Models PDF ↗
Vishal Pramanik, Maisha Maliha, Susmit Jha, Alvaro Velasquez, Olivera Kotevska, Sumit Kumar Jha
284
A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks PDF ↗
Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan
285
Rank-Guided Pseudo-Bias Learning for Robust Black-Box Adaptation PDF ↗
Rajeev Ranjan Dwivedi, Anshuman Dangwal, Vinod K Kurmi
286
Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection PDF ↗
Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Sen Su
287
WaTeRFlow: Watermark Temporal Robustness via Flow Consistency PDF ↗
Utae Jeong, Sumin In, Hyunju Ryu, Jaewan Choi, Feng Yang, Jongheon Jeong, Seungryong Kim, Sangpil Kim
288
DSO: Direct Steering Optimization for Bias Mitigation PDF ↗
Lucas Monteiro Paes, Nivedha Sivakumar, Yinong Oliver Wang, Masha Fedzechkina, Barry-John Theobald, Luca Zappella, Nicholas Apostoloff
289
SWIFT: Sliding Window Reconstruction for Few-Shot Training-Free Generated Video Attribution PDF ↗
Chao Wang, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu, Kejiang Chen
290
SineProject: Machine Unlearning for Stable Vision-Language Alignment PDF ↗
Arpit Garg, Hemanth Saratchandran, Simon Lucey
291
HiLoRA: Hierarchical Low-Rank Adaptation for Personalized Federated Learning PDF ↗
Zihao Peng, Nan Zou, Jiandian Zeng, Guo Li, Ke Chen, Boyuan Li, Tian Wang
292
OS-Fed: One Snapshot Is All You Need PDF ↗
Xuwei Qian, Jinghui Zhang, Yuchuan Tan, Wenbo Huang, Zhen Wu, Shen Zhou, LiSha Gao, Ding Ding, Fang Dong
293
FedAlign: Differentially Private Distribution Alignment for Non- IID Federated Learning PDF ↗
Peng Wu, Jiapeng Zhang, Yingjie Song, Xiong Xiao, Zhuo Tang
294
Guiding Diffusion Models with Fine-Grained Conditions and Semantics-Preserving Sampling for One-Shot Federated Learning PDF ↗
Xiaojun Deng, Tianchi Liao, Zhiyuan Liu, Chuan Chen, Zibin Zheng
295
Personalized Federated Training of Diffusion Models with Privacy Guarantees PDF ↗
Kumar Kshitij Patel, Bingqing Jiang, A F M Mahfuzul Kabir, Weitong Zhang, Difan Zou, Lingxiao Wang
296
FedRAC: Rolling Submodel Allocation for Collaborative Fairness in Federated Learning PDF ↗
Zihui Wang, Yuhang Fu, Mengmeng Du, Zhimin Yuan, Yachen Liu, Weisheng Liao, Kaiyu Wang, Zheng Wang
297
Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability PDF ↗
Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo
298
Small Object, Great Challenge: A Benchmark for Small Object Visual Grounding PDF ↗
Wenqi Jia, Ruifan Li, Pengyue Lin, Fangxiang Feng, Zhanyu Ma, Xiaojie Wang
299
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models PDF ↗
Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu
300
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding PDF ↗
Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura
301
CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering PDF ↗
Mingfang Zhang, Jingjing Pan, Ashutosh Kumar, Rajat Saini, Mustafa Erdogan, Hsuan-Kung Yang, Caixin Kang, Yifei Huang, Yoichi Sato, Quan Kong
302
HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos PDF ↗
Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu
303
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism PDF ↗
Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji
304
Hybrid Token Compression for Vision-Language Models PDF ↗
Jusheng Zhang, Xiaoyang Guo, Kaitong Cai, Qinhan Lv, Yijia Fan, Wenhao Chai, Jian Wang, Keze Wang
305
Focus, Don’t Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding PDF ↗
Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeongjin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim
306
When Token Pruning is Worse than Random: Understanding Visual Token Information in VLLMs PDF ↗
Yahong Wang, Juncheng Wu, Zhangkai Ni, Longzhen Yang, Yihang Liu, Chengmei Yang, Ying Wen, Lianghua He, Xianfeng Tang, Hui Liu, Yuyin Zhou
307
VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions PDF ↗
Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Yassine Ouali, Georgios Tzimiropoulos
308
BiGain: Unified Token Compression for Joint Generation and Classification PDF ↗
Jiacheng Liu, Shengkun Tang, Jiacheng Cui, Dongkuan Xu, Zhiqiang Shen
309
Hi-Lo Prune: Look at What You'll Lose before Pruning with Hierarchical Token Selection PDF ↗
Zixun Sun, Yubo Dong, Hehe Fan, Yi Yang
310
VLM-Pruner: Buffering for Spatial Sparsity in an Efficient VLM Centrifugal Token Pruning Paradigm PDF ↗
Zhenkai Wu, Xiaowen Ma, Zhenliang Ni, Dengming Zhang, Han Shu, Xin Jiang, Xinghao Chen
311
Bridge: Basis-Driven Causal Inference Marries VFMs for Domain Generalization PDF ↗
Mingbo Hong, Feng Liu, Caroline Gevaert, George Vosselman, Hao Cheng
312
In Pursuit of Pixel Supervision for Visual Pre-training PDF ↗
Lihe Yang, Shang-Wen Li, Yang Li, Xinjie Lei, Dong Wang, Abdelrahman Mohamed, Saining Xie, Hengshuang Zhao, Kaiming He, Hu Xu
313
GaussianMatch: Semi-Supervised Regression with Pseudo-Label Filtering via Multi-View Gaussian Consistency PDF ↗
Yin Wang, Hao Lu, Zixuan Wang, Zhen Qin, Li Kuang, Mengchu Zhou, Shuiguang Deng
314
TAR: Token-Aware Refinement for Fine-grained Generalized Category Discovery PDF ↗
Xingyu Yang, Yu Zhang, Siya Mi, Xiu-Shen Wei
315
Semantic Noise Reduction via Teacher-Guided Dual-Path Audio- Visual Representation Learning PDF ↗
Linge Wang, Yingying Chen, Bingke Zhu, Lu Zhou, Jinqiao Wang
316
The Universal Normal Embedding PDF ↗
Chen Tasker, Roy Betser, Eyal Gofer, Meir Yossef Levi, Guy Gilboa
317
Bypassing the Transport Plan: Dynamic Reweighting for Out- of-Distribution Detection with Optimal Transport PDF ↗
Yang Xiao, Weiming Liu, Jun Dan, Tengyue Xu, Fan Wang, Hua Yu, Junhao Dong, Jiao Liu, Shunjie Dong, Lianyong Qi
318
Cross-domain Dual-stream Feature Disentanglement for Brain Disorder Prediction with Sparsely Labeled PET PDF ↗
Huabin Wang, Xinyu Chen, Yuan Zhou, Fei Liu
319
Debiased Sample Selection for Learning with Noisy Labels PDF ↗
Weiran Pan, Wei Wei, Wenfeng Xie
320
Driving on Registers PDF ↗
Ellington Kirby, Alexandre Boulch, Yihong Xu, Yuan Yin, Gilles Puy, Éloi Zablocki, Andrei Bursuc, Spyros Gidaris, Renaud Marlet, Florent Bartoccioni, Anh-Quan Cao, Nermin Samet, Tuan-Hung VU, Matthieu Cord
321
Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles PDF ↗
Jiawei Liu, Xun Gong, Fen Fang, Muli Yang, Bohao Qu, Yunfeng Hu, Hong Chen, Xulei Yang, Qing Guo
322
EE-RL: Vision Language Guided Reinforcement Learning with Explorer and Expert model for End-to-End Autonomous Driving PDF ↗
Xiaolong Li, Lan Yang, Ruyang Li, Shan Fang, Yang Liu, Xiangmo Zhao
323
Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving PDF ↗
Jiahao Wang, Bo Sun, Yijing Bai, Vincent Casser, Songyou Peng, Zehao Zhu, Meng-Li Shih, Xander Masotto, Shih-Yang Su, Kanaad Parvate, Tiancheng Ge, Linn Bieske, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang
324
SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting PDF ↗
Alexander Prutsch, Christian Fruhwirth- Reisinger, David Schinagl, Horst Possegger
325
DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving PDF ↗
Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu
326
CausalVAD: De-confounding End-to-End Autonomous Driving via Causal Intervention PDF ↗
Jiacheng Tang, Zhiyuan Zhou, Zhuolin He, Jia Zhang, Kai Zhang, Jian Pu
327
Reliable Policy Transfer for Safety-Aware End-to-End Driving with Deep Reinforcement Learning PDF ↗
Uddin Md. Borhan, Arif Raza, Zhiliang Lin, Lu Wang, Jianqiang Li, Jie Chen
328
Learning to Drive is a Free Gift: Large-Scale Label-Free Autonomy Pretraining from Unposed In-The-Wild Videos PDF ↗
Matthew Strong, Wei-Jer Chang, Quentin Herau, Jiezhi Yang, Yihan Hu, Chensheng Peng, Wei Zhan
329
WhisperNet: A Scalable Solution for Bandwidth-Efficient Collaboration PDF ↗
Gong Chen, Chaokun Zhang, Xinyan Zhao
330
Efficient Equivariant Transformer for Self-Driving Agent Modeling PDF ↗
Scott Xu, Dian Chen, Kelvin Wong, Chris Zhang, Kion Fallah, Raquel Urtasun
331
Generalizable Co-Salient Object Detection via Mixed Content- Style Modulation PDF ↗
Guanting Guo, Shenglong Hu, Kaihua Zhang, Guangcan Liu, Min Xia
332
Saliency-Driven Token Merging for Vision Transformers PDF ↗
Weiying Xie, Xiaoyu Chen, Xin Zhang, Chenhe Hao, Jitao Ma, Yunsong Li, Leyuan Fang
333
RISE: Single Static Radar-based Indoor Scene Understanding PDF ↗
Kaichen Zhou, Laura Dodds, Sayed Saad Afzal, Fadel Adib
334
Mixture-of-Experts based Feature Decoupling for Open Vocabulary Scene Graph Generation PDF ↗
Yiming Li, Sisi You, Bing-Kun Bao
335
TF-SSD: A Strong Pipeline via Synergic Mask Filter for Training-free Co-salient Object Detection PDF ↗
Zhijin He, Shuo Jin, Siyue Yu, Shuwei Wu, Bingfeng Zhang, Li Yu, Jimin Xiao
336
Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation PDF ↗
Yaowen Chang, Zhen Cao, Xu Zheng, Xiaoxin Mi, Zhen Dong
337
SPOT: Spatiotemporal Prompt Optimization for Motion-Stabilized MLLM-Guided Video Segmentation PDF ↗
Jiayi Fan, Zheyun Qin, Xiaoming Xi, Xiushan Nie, Yilong Yin
338
Changes in Real Time: Online Scene Change Detection with Multi- View Fusion PDF ↗
Chamuditha Jayanga Galappaththige, Jason Lai, Lloyd Windrim, Donald Dansereau, Niko Suenderhauf, Dimity Miller
339
Subspace Alignment for CLIP-based Continual Learning via Canonical Correlation Analysis PDF ↗
Huan Zhang, Shuyu Dong, Yujin Zheng, Dingwen Wang, Shenghua Fan, Fan Lyu
340
DGS: Dual Gradient and Semantic-Shift Guided Low-Rank Adaptation for Class Incremental Learning PDF ↗
Kai Li, Jiafeng Li, Lianghua He, Ying Wen
341
Dynamic Magic: Unleashing Restricted Knowledge for Lifelong Person Re-Identification PDF ↗
Jinjia Peng, Jican Tan, Jiazuo Yu, Zeze Tao, Huibing Wang
342
Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models PDF ↗
Hyundong Jin, Dongyoon Han, Eunwoo Kim
343
Temporal Imbalance of Positive and Negative Supervision in Class- Incremental Learning PDF ↗
Jinge Ma, Fengqing Zhu
344
Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models PDF ↗
Zizhi Chen, Yizhen Gao, Minghao Han, Yizhou Liu, Zhaoyu Chen, Dingkang Yang, Lihua Zhang
345
Dance Across Shifts: Forward-Facilitation Continual Test-Time Adaptation through Dynamic Style Bridging PDF ↗
Zhilin Zhu, Yabin Wang, Zhiheng Ma, Yaguang Song, Yaowei Wang, Xiaopeng Hong
346
Few-Shot Hybrid Incremental Learning: Continually Learning under Data Scarcity and Task Uncertainty PDF ↗
Yan Li, Yuzhu Shi, Kan Zhou, Shu Zhang, Diqi He, Dingwen Zhang, Junwei Han
347
High-Fidelity Mobile Avatars with Pruned Local Blendshapes PDF ↗
Youyi Zhan, He Wang, Tianjia Shao, Kun Zhou
348
PhysSkin: Real-Time and Generalizable Physics-Based Animation via Self-Supervised Neural Skinning PDF ↗
Yuanhang Lei, Tao Cheng, Xingxuan Li, Boming Zhao, Siyuan Huang, Ruizhen Hu, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui
349
Bridging Privacy and Provenance: Traceable Virtual Identity Generation PDF ↗
Xianhan Zeng, Xiaoxiao Hu, Sheng Li, Zhenxing Qian, Xinpeng Zhang
350
PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment PDF ↗
Chaonan Ji, Jinwei Qi, Sheng Xu, Peng Zhang, Bang Zhang
351
Dynamic Label Noise Suppression with Optimal Teacher Pool for Facial Expression Recognition PDF ↗
Yuzhuang Yang, Xiaolin Tian, Qigong Sun
352
MimicTalker: A Multimodal Interactive and Memory-Enhanced Framework for Real-Time Dyadic 3D Head Generation PDF ↗
Yinuo Wang, Yanbo Fan, Xuan Wang, Boyao Zhou, Yu Guo, Yujun Shen, Fei Wang
353
DecoVLN: Decoupling Observation, Reasoning, and Correction for Vision-and-Language Navigation PDF ↗
Zihao Xin, Wentong Li, Yixuan Jiang, Bin Wang, Runmin Cong, Jie Qin, Shengjun Huang
354
HybridDriveVLA: Vision-Language-Action Model with Visual CoT reasoning and ToT Evaluation for Autonomous Driving PDF ↗
Yipene Cedric Francois Bassole, Sungwoo Kim, Jiwoo Jung, Yunsick Sung
355
NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction PDF ↗
Fei Liu, Shichao Xie, Minghua Luo, Zedong Chu, Junjun Hu, Xiaolong Wu, Mu Xu
356
LookasideVLN: Direction-Aware Aerial Vision-and-Language Navigation PDF ↗
Yuwei Ning, Ganlong Zhao, Yipeng Qin, Si Liu, Yang Liu, Liang Lin, Guanbin Li
357
MAPS: Preserving Vision-Language Representations via Module- Wise Proximity Scheduling for Better Vision-Language-Action Generalization PDF ↗
Chengyue Huang, Mellon M. Zhang, Robert Azarcon, Glen Chou, Zsolt Kira
358
D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation PDF ↗
Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee
359
FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes PDF ↗
Donglai Xiang, Vismay Modi, Rishit Dagli, Ty Trusty, Gilles Daviet, Anka He Chen, Nicholas Sharp, David I.W. Levin
360
GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction PDF ↗
Chao Xu, Xiaochen Zhao, Xiang Deng, Jingxiang Sun, Donglin Di, Zhuo Su, Yebin Liu
361
4DEquine: Disentangling Motion and Appearance for 4D Equine Reconstruction from Monocular Video PDF ↗
Jin Lyu, Liang An, Pujin Cheng, Yebin Liu, Xiaoying Tang
362
PhysHO: Physics-Based Dynamic 3D Gaussian Human and Object from Monocular Video PDF ↗
Suyi Jiang, Gim Hee Lee
363
ProgressiveAvatars: Progressive Animatable 3D Gaussian Avatars PDF ↗
Kaiwen Song, Jinkai Cui, Juyong Zhang
364
ZINA: Multimodal Fine-grained Hallucination Detection and Editing PDF ↗
Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig
365
Mitigating Multimodal Hallucinations via Gradient-based Self- Reflection PDF ↗
Shan Wang, Maying Shen, Nadine Chang, Chuong Nguyen, Hongdong Li, Jose M. Alvarez
366
HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration PDF ↗
Seunghoi Kim, Henry F. J. Tregidgo, Chen Jin, Matteo Figini, Daniel C. Alexander
367
KVSmooth: Mitigating Hallucination in Multi-modal Large Language Models through Key-Value Smoothing PDF ↗
Siyu Jiang, Feiyang Chen, Xiaojin Zhang, Kun He
368
ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Video Understanding PDF ↗
Hao Lu, Jiahao Wang, Yaolun Zhang, Ruohui Wang, Xuanyu Zheng, Yepeng Tang, Dahua Lin, Lewei Lu
369
Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention PDF ↗
Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan
370
Circular-DPO: Aligning Multi-Stage 3D Generative Models via Preference Feedback Loop PDF ↗
Zejian Li, Jiarui Ma, Han Xu, Weiting Zheng, Yangrui Zhu, Chenye Meng, Pei Chen, Ling Yang, Zhiyuan Yang, Changyuan Yang, Guang Yang, Immanuel Koh, Lingyun Sun
371
Cloning Deterministic Worlds: The Critical Role of Latent Geometry in Long-Horizon World Models PDF ↗
Zaishuo Xia, Yukuan Lu, Xinyi Li, Yifan Xu, Yubei Chen
372
PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes PDF ↗
Christina Ourania Tze, Daniel Dauner, Yiyi Liao, Dzmitry Tsishkou, Andreas Geiger
373
CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video
Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan
374
ExPose: Reinforcing Video Generation Models for Extreme Pose Estimation PDF ↗
Youngho Yoon, Wonjune Cho, Hyunho Ha, Sujung Kim, Kuk-Jin Yoon
375
Choreographing a World of Dynamic Objects PDF ↗
Yanzhe Lyu, Chen Geng, Karthik Dharmarajan, Yunzhi Zhang, Hadi Alzayer, Shangzhe Wu, Jiajun Wu
376
SounDiT: Geo-Contextual Soundscape-to-Landscape Generation PDF ↗
Junbo Wang, Haofeng Tan, Bowen Liao, Albert Jiang, Teng Fei, Qixing Huang, Bing Zhou, Zhengzhong Tu, Shan Ye, Yuhao Kang
377
Vista4D: Video Reshooting with 4D Point Clouds PDF ↗
Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca, Yash Kant, Ryan Burgert, Yuancheng Xu, Koichi Namekata, Yiwei Zhao, Bolei Zhou, Micah Goldblum, Paul Debevec, Ning Yu
378
CamDirector: Towards Long-Term Coherent Video Trajectory Editing PDF ↗
Kejia Yin, Zhihao Shi, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu
379
Elastic3D: Controllable Stereo Video Conversion with Guided Latent Decoding PDF ↗
Nando Metzger, Prune Truong, Goutam Bhat, Konrad Schindler, Federico Tombari
380
Decoupling Bias, Aligning Distributions: Synergistic Fairness Optimization for Deepfake Detection PDF ↗
Feng Ding, Wenhui Yi, Yunpeng Zhou, Xinan He, Hong Rao, Shu Hu
381
Target-Aware Invertible Encoder with Reconstruction Guidance for Infrared Small Target Detection PDF ↗
Shule Yan, Zetian Zhang, Xiao Ma, Zexuan Ji
382
BDNet:Bio-Inspired Dual-Backbone Small Object Detection Network PDF ↗
Wenchao Guan, Chuan Lin, Sihan Huang, Xiongzhen Wang, Xintao Pang
383
ElasticFormer: Detecting Objects in HRW Shots via Elastic Computing Vision Transformer PDF ↗
Wenxi Li, Jingchen Huang, Chenyang Lyu, Moran Liu, Haozhe Lin, Guiguang Ding, Yuchen Guo
384
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework PDF ↗
Xiao Wang, Haiyang Wang, Shiao Wang, Qiang Chen, Jiandong Jin, Haoyu Song, Bo Jiang, Chenglong Li
385
FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition PDF ↗
Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu
386
Free-Grained Hierarchical Visual Recognition PDF ↗
Seulki Park, Zilin Wang, Stella X. Yu
387
URICA: A Uniformity Region Affine Identifier Capture Algorithm for Arbitrary Region Retrieval in Pathology Images PDF ↗
Ri Su, Zhao Chen, Caleb Chen Cao, Lei Chen
388
Online Data Curation for Object Detection via Marginal Contributions to Dataset-level Average Precision PDF ↗
Zitang Sun, Masakazu Yoshimura, Junji Otsuka, Atsushi Irie, Takeshi Ohashi
389
DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video PDF ↗
Jiawei Hou, Shenghao Zhang, Can Wang, Zheng Gu, Yonggen Ling, Taiping Zeng, Xiangyang Xue, Jingbo Zhang
390
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning PDF ↗
Seung hee Choi, MinJu Jeon, Hyunwoo Oh, Jihwan Lee, Dong-Jin Kim
391
Video-CoE: Reinforcing Video Event Prediction via Chain of Events PDF ↗
Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu
392
VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice PDF ↗
Shuming Liu, Mingchen Zhuge, Changsheng Zhao, Jun Chen, Lemeng Wu, Zechun Liu, Chenchen Zhu, Zhipeng Cai, Chong Zhou, Haozhe Liu, Ernie Chang, Saksham Suri, Hongyu Xu, Qi Qian, Wei Wen, Balakrishnan Varadarajan, Zhuang Liu, Hu Xu, Florian Bordes, Raghuraman Krishnamoorthi, Bernard Ghanem, Vikas Chandra, Yunyang Xiong
393
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues PDF ↗
Sirnam Swetha, Rohit Gupta, Parth Parag Kulkarni, David G Shatwell, Jeffrey A Chan Santiago, Nyle Siddiqui, Joseph Fioresi, Mubarak Shah
394
Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding PDF ↗
Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi
395
CURVE: A Benchmark for Cultural and Multilingual Long Video Reasoning PDF ↗
Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia Angelova, Shachi Dave
396
SVBench: Evaluation of Video Generation Models on Social Reasoning PDF ↗
Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang
397
Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search PDF ↗
Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu
398
LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks PDF ↗
Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai
399
Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning PDF ↗
Haoji Zhang, Xin Gu, Jiawen Li, Chixiang Ma, Sule Bai, Chubin Zhang, Bowen Zhang, Zhichao Zhou, Dongliang He, Yansong Tang
400
Attention Surgery: An Efficient Recipe to Linearize Your Video Diffusion Transformer PDF ↗
Mohsen Ghafoorian, Denis Korzhenkov, Amirhossein Habibian
401
YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal PDF ↗
Chenyang Wu, Lina Lei, Fan Li, Chunle Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Mingming Cheng, Chongyi Li
402
CADC: Content Adaptive Diffusion-Based Generative Image Compression PDF ↗
Xihua Sheng, Lingyu Zhu, Tianyu Zhang, Dong Liu, Shiqi Wang, Jing Wang
403
FG-Portrait: 3D Flow Guided Editable Portrait Animation PDF ↗
Yating Xu, Yunqi Miao, Evangelos Ververas, Jiankang Deng, Jifei Song
404
ResCa: Residual Caching for Diffusion Transformers Acceleration PDF ↗
Haipeng Fang, Yu Li, Fan Tang, Yixing Lu, Juan Cao, Sheng Tang
405
IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion- Based Talking Face Generation PDF ↗
Hao Wu, Xiangyang Luo, Hao Wang, Jiawei Zhang, Yi Zhang, Jinwei Wang
406
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training PDF ↗
Mengmeng Wang, Dengyang Jiang, Liuzhuozheng Li, Yucheng Lin, Guojiang Shen, Xiangjie Kong, Yong Liu, Guang Dai, Jingdong Wang
407
InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation PDF ↗
Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law
408
Multi-Patch Global-to-Local Transformer Architecture For Efficient Flow Matching and Diffusion Model PDF ↗
Quan Dao, Dimitris Metaxas
409
SODA: Sensitivity-Oriented Dynamic Acceleration for Diffusion Transformer PDF ↗
Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su
410
DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR PDF ↗
Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon
411
A Semantically Disentangled Unified Model for Multi-category 3D Anomaly Detection PDF ↗
SuYeon Kim, Wongyu Lee, MyeongAh Cho
412
ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detection PDF ↗
Chengzhi Hong, Bijun Li
413
PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving PDF ↗
Yining Pan, Shijie Li, Yuchen Wu, Xulei Yang, Na Zhao
414
STUR3D: Spatio-Temporal Unified Representation Learning for 3D Object Detection PDF ↗
Huijie Fan, Pengrui Huang, Qiang Wang, Baojie Fan, Jiahua Dong, Liangqiong Qu
415
Exploring 6D Object Pose Estimation with Deformation PDF ↗
Zhiqiang Liu, Rui Song, Duanmu Chuangqi, Jiaojiao Li, David Ferstl, Yinlin Hu
416
SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving PDF ↗
Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler
417
Improving Vision-language Models with Perception-centric Process Reward Models PDF ↗
Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen
418
X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis PDF ↗
Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen
419
Better, Stronger, Faster: Tackling the Trilemma in MLLM- based Segmentation with Simultaneous Textual Mask Prediction PDF ↗
Jiazhen Liu, Mingkuan Feng, Long Chen
420
PhysInOne: Visual Physics Learning and Reasoning in One Suite PDF ↗
Siyuan Zhou, Hejun Wang, Hu Cheng, Jinxi Li, Dongsheng Wang, Junwei Jiang, Yixiao Jin, Jiayue Huang, Shiwei Mao, Shangjia Liu, Yafei Yang, Hongkang Song, Shenxing Wei, Zihui Zhang, DataTeam vLAR, Bing Wang, Zhihua Wang, Chuhang Zou, Bo Yang
421
AviaSafe: A Physics-Informed Data-Driven Model for Aviation Safety– Critical Cloud Forecasts PDF ↗
Zijian Zhu, Qiusheng Huang, Anboyu Guo, Xiaohui Zhong, Hao Li
422
TTRV: Test-Time Reinforcement Learning for Vision Language Models PDF ↗
Akshit Singh, Shyam Marjit, Wei Lin, Paul Gavrikov, Serena Yeung-Levy, Hilde Kuehne, Rogerio Feris, Sivan Doveh, James Glass, M. Jehanzeb Mirza
423
Reading or Reasoning? Format Decoupled Reinforcement Learning for Document OCR PDF ↗
Yufeng Zhong, Lei Chen, Zhixiong Zeng, Xuanle Zhao, Deyang Jiang, Liming Zheng, Jing Huang, Haibo Qiu, Peng Shi, Siqi Yang, Lin Ma
424
QUANTIPHY: A Quantitative Benchmark Evaluating Physical Reasoning Abilities of Vision-Language Models PDF ↗
Li Puyin, Tiange Xiang, Ella Mao, Shirley Wei, Xinye Chen, Adnan Masood, Li Fei- Fei, Ehsan Adeli
425
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs PDF ↗
Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan
426
TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition PDF ↗
Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He
427
Urban-GS: A Unified 3D Gaussian Splatting Framework for Compact and High-Fidelity Aerial-to-Street Reconstruction PDF ↗
Meng Wang, Changqun Xia, Yuze Wang, Junyi Wang, Wantong Duan, Xinxiong Xie, Yue Qi
428
Generalizable Sparse-View 3D Reconstruction from Unconstrained Images PDF ↗
Vinayak Gupta, Chih-Hao Lin, Shenlong Wang, Anand Bhattad, Jia-Bin Huang
429
RemedyGS: Defend 3D Gaussian Splatting Against Computation Cost Attacks PDF ↗
Yanping Li, Zhening Liu, Zijian Li, Zehong Lin, Jun Zhang
430
SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras PDF ↗
Weihong Pan, Xiaoyu Zhang, Zhuang Zhang, Zhichao Ye, Nan Wang, Haomin Liu, Guofeng Zhang
431
IDESplat: Iterative Depth Probability Estimation for Generalizable 3D Gaussian Splatting PDF ↗
Wei Long, Haifeng Wu, Shiyin Jiang, Jinhua Zhang, Xinchun Ji, Shuhang Gu
432
GS^2: Graph-based Spatial Distribution Optimization for Compact 3D Gaussian Splatting PDF ↗
Xianben Yang, Tao Wang, Yuxuan Li, Yi Jin, Haibin Ling
433
OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting PDF ↗
Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang
434
Uni3R: Unified 3D Reconstruction and Semantic Understanding via Generalizable Gaussian Splatting from Unposed Multi- View Images PDF ↗
Xiangyu Sun, Haoyi Jiang, Liu Liu, Seungtae Nam, Gyeongjin Kang, Xinjie Wang, Wei Sui, Zhizhong Su, Wenyu Liu, Xinggang Wang, Eunbyung Park
435
Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos PDF ↗
Xuankai Zhang, Junjin Xiao, Shangwei Huang, Wei-shi Zheng, Qing Zhang
436
MLLMSplat: A 2D MLLM-Powered Framework for 3D Gaussian Splatting Understanding, Generation, and Editing PDF ↗
Jingqiao Xiu, Can Wang, Dong Xu
437
Dropping Anchor and Spherical Harmonics for Sparse-view Gaussian Splatting PDF ↗
Shuangkang Fang, I-Chao Shen, Xuanyang Zhang, Zesheng Wang, Yufeng Wang, Wenrui Ding, Gang YU, Takeo Igarashi
438
RAP: Fast Feedforward Rendering-Free Attribute-Guided Primitive Importance Score Prediction for Efficient 3D Gaussian Splatting Processing PDF ↗
Kaifa Yang, Qi Yang, Yiling Xu, Zhu Li
439
Plug-and-Play PDE Optimization for 3D Gaussian Splatting: Toward High-Quality Rendering and Reconstruction PDF ↗
Yifan Mo, Youcheng Cai, Ligang Liu
440
PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting PDF ↗
Yixiao Song, Qingyong Li, Wen Wang, Zhicheng Yan
441
Scene Grounding in the Wild PDF ↗
Tamir Cohen, Leo Segre, Shay Shomer- Chai, Shai Avidan, Hadar Averbuch-Elor
442
Flow4DGS-SLAM: Optical Flow-Guided 4D Gaussian Splatting SLAM PDF ↗
Yunsong Wang, Gim Hee Lee
443
Revisiting 3D Reconstruction Kernels as Low-Pass Filters PDF ↗
Shengjun Zhang, Min Chen, Yibo Wei, Mingyu Dong, Yueqi Duan
444
SR3R: Rethinking Super-Resolution 3D Reconstruction With Feed- Forward Gaussian Splatting PDF ↗
Xiang Feng, Xiangbo Wang, Tieshi Zhong, Chengkai Wang, Yiting Zhao, Tianxiang Xu, Zhenzhong Kuang, Feiwei Qin, Xuefei Yin, Yanming Zhu
445
GP-4DGS: Probabilistic 4D Gaussian Splatting from Monocular Video via Variational Gaussian Processes PDF ↗
Mijeong Kim, Jungtaek Kim, Bohyung Han
446
VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models PDF ↗
Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang
447
IPR-1: Interactive Physical Reasoner PDF ↗
Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li
448
VIRO: Robust and Efficient Neuro-Symbolic Reasoning with Verification for Referring Expression Comprehension PDF ↗
Hyejin Park, Junhyuk Kwon, Suha Kwak, Jungseul Ok
449
Fuel Gauge: Estimating Chain-of-Thought Length Ahead of Time in Large Multimodal Models PDF ↗
Yuedong Yang, Xiwen Wei, Mustafa Munir, Radu Marculescu
450
Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World PDF ↗
Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang
451
Latent Implicit Visual Reasoning PDF ↗
Kelvin Li, Chuyi Shang, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig
452
Thinking with Programming Vision: Towards a Unified View for Thinking with Images PDF ↗
Zirun Guo, Minjie Hong, Feng Zhang, Kai Jia, Tao Jin
453
AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio- Visual Counting for MLLMs PDF ↗
Lidong Lu, Guo Chen, Zhu Wei, Zhiqi Li, Yicheng Liu, Tong Lu
454
All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision- Language Models PDF ↗
Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang
455
See Less, See Right: Bi-directional Perceptual Shaping For Multimodal Reasoning PDF ↗
Shuoshuo Zhang, Yizhen Zhang, Jingjing Fu, Lei Song, Jiang Bian, Yujiu Yang, Rui Wang
456
Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens PDF ↗
Zeyuan Yang, Xueyang Yu, Delin Chen, Maohao Shen, Chuang Gan
457
ReaGEN: Adaptive Generation of Structured Chains-of-Thought for Efficient Multimodal Reasoning PDF ↗
Ruiqing Tian, Mohan Sai Singamsetti, Di Niu, Bahador Rashidi
458
Breaking the Regional Perception Bottleneck of Multimodal Large Language Models via External Reasoning Framework PDF ↗
Jinrong Zhang, Zhaoyang Xu, Xusheng He, Xinrui Li, Na Zheng, Jianlong Wu
459
CodePercept: Code-Grounded Visual STEM Perception for MLLMs PDF ↗
Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhentao Guo, Zijian Hu, Ruilin Luo, Ruizhe Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang
460
TableMix: Enhancing Multimodal Table Reasoning in MLLMs from a Data-Centric Perspective PDF ↗
Chaohu Liu, Shida Wang, Yubo Wang, Linli Xu
461
Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing PDF ↗
Honglu Zhang, Zhiqin Fang, Ningning Zhao, Saihui Hou, Long Ma, Renwang Pei, Zhaofeng He
462
Grounded Chain-of-Thought for Multimodal Large Language Models PDF ↗
Qiong Wu, Xiangcong Yang, Yiyi Zhou, Chenxin Fang, Baiyang Song, Xiaoshuai Sun, Rongrong Ji
463
LS-ViT: Least-Squares Hessian Based Block Reconstruction for Low-Bit Post-Training Quantization of Vision Transformers PDF ↗
Hyunha Hwang, Xuan Truong Nguyen, Hyuk-Jae Lee
464
SegMo: Co-Designing Content-Aware Sparsity and Locally-Cohesive Segment Parallelism for Efficient VLM Inference PDF ↗
Haojuan Li, Ruohan Tang, Dongzhou Cheng, Zongpu Zhang, Jian Li, Jiaqi Wang
465
Rethinking Asymmetric Quantization: Hidden Symmetry in Vision Model Weights PDF ↗
Masafumi Mori, Shinya Gongyo, Mitsuru Ambai
466
Compressed-Domain-Aware Online Video Super-Resolution PDF ↗
Yuhang Wang, Hai Li, Shujuan Hou, Zhetao Dong, Xiaoyao Yang
467
CAR-SAM: Cross-Attention Reconstruction for Post-Training Quantization of the Segment Anything Model PDF ↗
Houji Wen, Jiangyong Yu, Dawei Yang, Jun Li
468
Is Bin Generation Indispensable? A Bin-Generation-Free Dataset Quantization via Semantic Perspective PDF ↗
Maijie Deng, Yuhua Li, Yixiong Zou, Yao Wu, Chenru Ma
469
High Resolution Neural Video Coding with Bi-directional Confidence- Guided Reference Information Modeling PDF ↗
Feng Ye, Kai Zhang, Li Zhang, Chuanmin Jia
470
Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates PDF ↗
Guojun Xu, Mingyang Zhang, Jianwen Xiang, Cheng Tan, Yanchao Yang, Junwei Zhou
471
Task-Aware Image Signal Processor for Advanced Visual Perception PDF ↗
Kai Chen, Jin Xiao, Leheng Zhang, Kexuan Shi, Shuhang Gu
472
Enhancing Video Vision Language Model with Hippocampal Sensing PDF ↗
Xu Cao
473
VIRD: View-Invariant Representation through Dual-Axis Transformation for Cross-View Pose Estimation PDF ↗
Juhye Park, Wooju Lee, Dasol Hong, Changki Sung, Youngwoo Seo, Dongwan Kang, Hyun Myung
474
WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery PDF ↗
Chandrakanth Gudavalli, Tajuddin Manhar Mohammed, Abhay Yadav, Ananth Vishnu Bhaskar, Hardik Prajapati, Cheng Peng, Rama Chellappa, Shivkumar Chandrasekaran, B.S. Manjunath
475
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs PDF ↗
Koonting Yip, Qiyan Zhao, Wenhao Yu, Liangyu Yuen, Mingkai Li, Xiaofeng Zhang, Jianmin Ji, Yanyong Zhang, Qing Jiang, Ka-Veng Yuen
476
RHO: Robust Holistic OSM-Based Metric Cross-View Geo-Localization PDF ↗
Junwei Zheng, Ruize Dai, Ruiping Liu, Zichao Zeng, Yufan Chen, Fangjinhua Wang, Kunyu Peng, Kailun Yang, Jiaming Zhang, Rainer Stiefelhagen
477
EfficientVPR: Toward Efficient Visual Place Recognition via Scene-Aware Prompt Tuning and Adaptive Feature Enhancement PDF ↗
Wenjing Tang, Chuanguang Yang, Zhulin An, Libo Huang, Boyu Diao, Yongjun Xu
478
Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent PDF ↗
Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarmane, Junzhou Huang
479
ReLaX: Reasoning with Latent Exploration for Large Reasoning Models PDF ↗
Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu
480
VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning PDF ↗
Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang
481
Think, Then Verify: A Hypothesis–Verification Multi-Agent Framework for Long Video Understanding PDF ↗
Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai
482
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning PDF ↗
Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao
483
Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training- Free and Auditable Video Reasoning PDF ↗
Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao
484
LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling PDF ↗
Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing
485
Multi-Modal Image Fusion via Intervention-Stable Feature Learning PDF ↗
Xue Wang, Zheng Guan, Wenhua Qian, Chengchao Wang, Runzhuo Ma
486
ReCoFuse: Ultra-Robust Image Fusion via Restorative Multi-Modal Diffusion Reciprocal Coupling PDF ↗
Hao Zhang, Shuhan Yang, Linfeng Tang, Xunpeng Yi, Jiayi Ma
487
Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios PDF ↗
Yu Shi, Yu Liu, Zhong-Cheng Wu, Juan Cheng, Huafeng Li, Xun Chen
488
DF^2-VB: Dual-level Fuzzy Fusion with View-specific Boosting for Multi-view Multi-label Classification PDF ↗
Yuena Lin, Haichun Cai, Yi Shan, Hao Wei, Yongjian Deng, Zhen Yang, Gengyu Lyu
489
UniFusion: A Unified Image Fusion Framework with Robust Representation and Source-Aware Preservation PDF ↗
Xingyuan Li, Songcheng Du, Yang Zou, Haoyuan Xu, Zhiying Jiang, Jinyuan Liu
490
Self-guided Semantic Inspection for Zero-Shot Composed Image Retrieval PDF ↗
Jingjing Zhang, Lei Zhang, Zheren Fu, Bo Hu, Zhendong Mao
491
G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval PDF ↗
Jiyoung Lim, Heejae Yang, Jee-Hyong Lee
492
No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models PDF ↗
Hai X. Pham, David T. Hoffmann, Ricardo Guerrero, Brais Martinez
493
MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification PDF ↗
Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu
494
Pointing at Parts: Training-Free Few-Shot Grounding in Multimodal LLMs PDF ↗
Shiang-Feng Tsai, Yuan-Hong Liao, Jin-Cheng Jhang, Nan Qiao, Min Sun
495
Graph Attention Prototypical Network for Robust Few-Shot Classification PDF ↗
Tingyun Liu, Licheng Liu, Qibin Zhang, Qiying Feng, C. L. Philip Chen
496
Mitigating The Distribution Shift of Diffusion-based Dataset Distillation PDF ↗
Yue Xu, Chenyu Hu, Pengyu An, Yong-Lu Li
497
EVLF: Early Vision-Language Fusion for Generative Dataset Distillation PDF ↗
Wenqi Cai, Yawen Zou, Guang Li, Chunzhi Gu, Chao Zhang
498
Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation PDF ↗
Muquan Li, Hang Gou, Yingyi Ma, Rongzheng Wang, Ke Qin, Tao He
499
Flow Map Distillation Without Data PDF ↗
Shangyuan Tong, Nanye Ma, Saining Xie, Tommi Jaakkola
500
F^2HDR: Two-Stage HDR Video Reconstruction via Flow Adapter and Physical Motion Modeling PDF ↗
Huanjing Yue, Dawei Li, Shaoxiong Tu, Jingyu Yang
501
Learning Latent Transmission and Glare Maps for Lens Veiling Glare Removal PDF ↗
Xiaolong Qian, Qi Jiang, Lei Sun, Zongxi Yu, Kailun Yang, Peixuan Wu, Jiacheng Zhou, Yao Gao, Yaoguang Ma, Ming-Hsuan Yang, Kaiwei Wang
502
Inter-Photon-Limited Videography PDF ↗
Andrew Xie, Dongyu Du, Sotiris Nousias, David B. Lindell, Kiriakos N. Kutulakos
503
A Bit is All You Need! Efficient Video Capture via Single Bit Imaging PDF ↗
Kanchana Vaishnavi Gandikota, Michael Moeller, Andreas Kolb, Bhaskar Choubey, Paramanand Chandramouli
504
From Events to Clarity: The Event-Guided Diffusion Framework for Dehazing PDF ↗
Ling Wang, Yunfan Lu, Wenzong Ma, Huizai Yao, Pengteng Li, Hui Xiong
505
Electromagnetic Inverse Scattering from a Single Transmitter PDF ↗
Yizhe Cheng, Chunxun Tian, Haoru Wang, Wentao Zhu, Xiaoxuan Ma, Yizhou Wang
506
Statistical Characteristic-Guided Denoising for Rapid High-Resolution Transmission Electron Microscopy Imaging PDF ↗
Hesong Li, Ziqi Wu, Ruiwen Shao, Ying Fu
507
Physics-Guided Multistep Deformation Reversal for Ancient Bamboo Slip Restoration PDF ↗
Qianqian Tang, Jinchi Zhu, Xiaolu Zhou, Yongchao Xu
508
cryoSENSE: Compressive Sensing Enables High-throughput Microscopy with Sparse and Generative Priors on the Protein Cryo-EM Image Manifold PDF ↗
Zain Shabeeb, Daniel Saeedi, Darin Tsui, Vida Jamali, Amirali Aghazadeh
509
SGDE: Self-supervised Geometry Degradation Estimation Framework for Coded Aperture Compressive Spectral Imaging PDF ↗
Yuqiao He, Xiaoyan Liu, Jianxu Mao, Yaonan Wang, Hui Zhang, Lizhu Liu, Yurong Chen, Wenbin He
510
Factorized Context Aggregation for Robust Cancer Risk Estimation via Soft Re-Ranked Retrieval and Hierarchical Anchors PDF ↗
Puria Azadi Moghadam, Ali Khajegili Mirabadi, Behnam Maneshgar, Hossein Farahani, Ali Bashashati
511
UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition PDF ↗
Zhuangcheng Gu, Guang Liang, Bin Wang, Zhiyuan Zhao, Qintong Zhang, Weijia Li, Chao Xu, Bo Zhang, Botian Shi, Jiang Wu, Wentao Zhang, Conghui He
512
GeneVAR: Causal MeanFlow for Autoregressive Gene-to-WSI Tile Synthesis PDF ↗
Jianwei Zhao, Fan Yang, Xin Li, Qiang Zhai, Ao Luo, Ziqi Ren, Zhicheng Jiao, Hong Cheng
513
Depth Any Endoscopy: Towards Self-Supervised Generalizable Depth Estimation in Monocular Endoscopy PDF ↗
Shuwei Shao, Kejin Zhu, Shixing Ma, Xinzhe Du, Baochang Zhang, Zhe Min
514
RoSAMDepth: Robust Self-supervised Depth Estimation Leveraging Segment Anything Model PDF ↗
Xuanang Gao, Zhiwei Ning, Gengming Zhang, Jiaxi Cao, Runze Yang, Zhonglong Zheng, Jie Yang, Rong Xiao, Wei Liu
515
AdaSFormer: Adaptive Serialized Transformers for Monocular Semantic Scene Completion from Indoor Environments PDF ↗
Xuzhi Wang, Xinran Wu, Song Wang, Lingdong Kong, Ziping Zhao
516
Dark3R: Learning Structure from Motion in the Dark PDF ↗
Andrew Y. Guo, Anagh Malik, SaiKiran Tedla, Yutong Dai, Yiqian Qin, Zach Salehe, Benjamin Attal, Sotiris Nousias, Kiriakos N. Kutulakos, David B. Lindell
517
What Makes Good Synthetic Training Data for Zero-Shot Stereo Matching? PDF ↗
David Yan, Alexander Raistrick, Jia Deng
518
TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast PDF ↗
Beilei Cui, Yiming Huang, Long Bai, Hongliang Ren
519
Iris: Integrating Language into Diffusion-based Monocular Depth Estimation PDF ↗
Ziyao Zeng, Jingcheng Ni, Daniel Wang, Patrick Rim, Younjoon Chung, Fengyu Yang, Byung-Woo Hong, Alex Wong
520
Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos PDF ↗
Ziren Gong, Xiaohan Li, Fabio Tosi, Jiawei Han, Stefano Mattoccia, Jianfei Cai, Matteo Poggi
521
M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation PDF ↗
Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang
522
UniPart: Part-Level 3D Generation with Unified 3D Geom–Seg Latents PDF ↗
Xufan He, Yushuang Wu, Xiaoyang Guo, Chongjie Ye, Jiaqing Zhou, Tianlei Hu, Xiaoguang Han, Dong Du
523
Photo3D: Advancing Photorealistic 3D Generation through Structure-Aligned Detail Enhancement PDF ↗
Xinyue Liang, Zhiyuan Ma, Lingchen Sun, Yanjun Guo, Lei Zhang
524
Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation PDF ↗
Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo
525
Order Matters: 3D Shape Generation from Sequential VR Sketches PDF ↗
Yizi Chen, Sidi Wu, Tianyi Xiao, Nina Wiedemann, Loic Landrieu
526
Think-Then-Generate: Structural Chain-of-Thought Reasoning for Consistent 3D Generation PDF ↗
Xinyue Liu, Jin Liu, Hongbo Wang, Ran He, Huaibo Huang
527
ArtLLM: Generating Articulated Assets via 3D LLM PDF ↗
Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu
528
PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation PDF ↗
Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan
529
2D-LFM: Lifting Foundation Model without 3D Supervision PDF ↗
Mosam Dabhi, Irhas Gill, László A. Jeni, Simon Lucey
530
ActionMesh: Animated 3D Mesh Generation with Temporal 3D Diffusion PDF ↗
Remy Sabathier, David Novotny, Niloy J. Mitra, Tom Monnier
531
4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models PDF ↗
Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen
532
FabricGen: Microstructure-Aware Woven Fabric Generation PDF ↗
Yingjie Tang, Di Luo, Zixiong Wang, Xiaoli Ling, Jian Yang, Beibei Wang
533
Leveraging Verifier-Based Reinforcement Learning in Image Editing PDF ↗
Hanzhong Guo, Jie Wu, Jie Liu, Yu Gao, Zilyu Ye, Linxiao Yuan, Xionghui Wang, Yizhou Yu, Weilin Huang
534
PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling PDF ↗
Bowen Ping, Chengyou Jia, Minnan Luo, Changliang Xia, Xin Shen, Zhuohang Dang, Hangwei Qian
535
VIVA: VLM-Guided Instruction-Based Video Editing with Reward Optimization PDF ↗
Xiaoyan Cong, Haotian Yang, Angtian Wang, Yizhi Wang, Yiding Yang, Canyu Zhang, Chongyang Ma
536
MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models PDF ↗
Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi
537
Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation PDF ↗
Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang
538
C^2FG: Control Classifier-Free Guidance via Score Discrepancy Analysis PDF ↗
Jiayang Gao, Tianyi Zheng, Jiayang Zou, Fengxiang Yang, Shice Liu, Luyao Fan, Zheyu Zhang, Hao Zhang, Jinwei Chen, Peng-Tao Jiang, Bo Li, Jia Wang
539
Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation PDF ↗
Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, Chi Zhang
540
Unified Customized Generation by Disentangled Reward Modeling PDF ↗
Shaojin Wu, Mengqi Huang, Yufeng Cheng, Wenxu Wu, Jiahe Tian, Yiming Luo, Fei Ding, Qian He
541
Region-Aware Instance Consistency Learning for Micro-Expression Recognition PDF ↗
Yaomin Cai, C. L. Philip Chen, Shiting Xu, Haiqi Liu, Tong Zhang
542
MPL: Match-guided Prototype Learning for Few-shot Action Recognition PDF ↗
Feng Yang, Jie Zhao, Fulin Luo, Anyong Qin, Tiecheng Song, Yue Zhao, Chenqiang Gao, Junwei Han
543
LaDy: Lagrangian-Dynamic Informed Network for Skeleton-based Action Segmentation via Spatial-Temporal Modulation PDF ↗
Haoyu Ji, Xueting Liu, Yu Gao, Wenze Huang, Zhihao Yang, Weihong Ren, Zhiyong Wang, Honghai Liu
544
LA-Pose: Latent Action Pretraining Meets Pose Estimation PDF ↗
Zhengqing Wang, Saurabh Nair, Prajwal Chidananda, Pujith Kachana, Samuel Li, Matthew Brown, Yasutaka Furukawa
545
RAAS: LLM Agentic System Architecture Search with GRPO PDF ↗
Jiayi Yang, Guancheng Wan, Man Zhang, Mang Ye
546
Temporal Representation Enhancement (TRE): Learning to Forget Dominant Patterns for Enhanced Temporal Spiking Features PDF ↗
Wei Liu, Li Yang, Yufei Wang, Han Xiao, Boyu Cai, Weiming Hu
547
Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models PDF ↗
Jiawei Fan, Shigeng Wang, Chao Li, Xiaolong Liu, Anbang Yao
548
Unlocking Pre-trained Weights: Parameter Inheritance for Zero-Shot Initialization PDF ↗
Jiaze Xu, Shiyu Xia, Jiaqi Lv, Xin Geng
549
Deconstructing the Failure of Ideal Noise Correction: A Three-Pillar Diagnosis PDF ↗
Chen Feng, Zhuo Zhi, Zhao Huang, Jiawei Ge, Ling Xiao, Nicu Sebe, Georgios Tzimiropoulos, Ioannis Patras
550
Progressive Neural Architecture Generation PDF ↗
Caiyang Yu, Chen Huang, Yun Liu, Chenwei Tang, Wei Ju, Jiancheng Lv
551
A Unified Framework for Knowledge Transfer in Bidirectional Model Scaling PDF ↗
Jianlu Shen, Fu Feng, Jiaze Xu, Yucheng Xie, Jiaqi Lv, Xin Geng
552
When Do Models Actually Decide? Mapping the Layer-Wise Decision Timeline in Pretrained Neural Networks PDF ↗
Minhyeok Lee
553
Temporal Interaction in Spiking Transformers with Multi-Delay Mixer PDF ↗
Kexin Shi, Hanwen Liu, Zeyang Song, Yang Liu, Jieyuan Zhang, Shuai Wang, Jibin Wu, Malu Zhang, Yang Yang
554
Consensus vs. Controversy: Mapping the Decision Space Where Architectures Diverge PDF ↗
Minhyeok Lee
555
Sparsely Timing the Change: A Spiking Temporal Framework for Remote Sensing Interpretation PDF ↗
Shilong Li, Xiurui Xie, Qiugang Zhan, Luochao Wang, Yong Deng, Guisong Liu
556
ProSoftArena: Benchmarking Hierarchical Capabilities of Multi- modal Agents in Professional Software Environments PDF ↗
Jiaxin Ai, Yukang Feng, Fanrui Zhang, Jianwen Sun, Zizhen Li, Chuanhao Li, Yifan Chang, Wenxiao Wu, Ruoxi Wang, Mingliang Zhai, Kaipeng Zhang
557
BAMI: Training-Free Bias Mitigation in GUI Grounding PDF ↗
Borui Zhang, Bo Zhang, Bo Wang, Wenzhao Zheng, Yuhao Cheng, Liang Tang, Yiqiang Yan, Jie Zhou, Jiwen Lu
558
DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding PDF ↗
Yichao Liu, Huawen Shen, Liu Yu, Shiyu Liu, Zeyu Chen, Yu Zhou
559
Consistency Beyond Contrast: Enhancing Open-Vocabulary Object Detection Robustness via Contextual Consistency Learning PDF ↗
Bozhao Li, Shaocong Wu, Tong Shao, Senqiao Yang, Qiben Shan, Zhuotao Tian, Jingyong Su
560
Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection PDF ↗
Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel
561
Geometry-driven OOD Detectors Are Class-Incremental Learners PDF ↗
Wangwang Jia, Zijian Gao, Tianjiao Wan, Yuan Cao, Yong Dou, Kele Xu
562
Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs PDF ↗
Zhikang Xu, Qianqian Xu, Zitai Wang, Cong Hua, Sicong Li, Zhiyong Yang, Qingming Huang
563
Prompt-Free Unknown Label Generation for Open World Detection in Remote Sensing PDF ↗
Abdullah Azeem, Ruisheng Wang, Qingquan Li, Abubakar Siddique
564
Learning to Diversify and Focus: A Reinforcement Framework for Open-Vocabulary HOI Detection PDF ↗
Yongchao Xu, Jiawei Liu, Junfeng Wang, Sen Tao, Na Jiang, Zheng-Jun Zha
565
RINO: Rotation-Invariant Non-Rigid Correspondences PDF ↗
Maolin Gao, Shao Jie Hu-Chen, Congyue Deng, Riccardo Marin, Leonidas Guibas, Daniel Cremers
566
Hyperbolic Prototype Learning with Uncertainty-Aware Consistency for Continual Test-Time Segmentation PDF ↗
Siddhant Gole, Akash Pal, Amit More, S Divakar Bhat, Subhasis Chaudhuri, Biplab Banerjee
567
DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval PDF ↗
Xinwei He, Yansong Zheng, Qianru Han, Zhichuan Wang, Yuxuan Cai, Yang Zhou, Jingbo Xia, Yulong Wang, Jinhai Xiang, Xiang Bai
568
Leveraging Class Distributions in CLIP for Weakly Supervised Semantic Segmentation PDF ↗
Ziqian Yang, Xinqiao Zhao, Xiaolei Wang, Quan Zhang, Jimin Xiao
569
CompetitorFormer: Mitigating Query Conflicts for 3D Instance Segmentation via Competitive Strategy PDF ↗
Duanchu Wang, Junjie Yang, Haoran Gong, Jing Liu, Di Wang
570
D2Dewarp: Dual Dimensions Geometric Representation Learning Based Document Image Dewarping PDF ↗
Heng Li, Xiangping Wu, Qingcai Chen
571
Discover, Segment, and Select: A Progressive Mechanism for Zero- shot Camouflaged Object Segmentation PDF ↗
Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao
572
D-Convexity: A Unified Differentiable Convex Shape Prior via Quasi- Concavity for Data-driven Image Segmentation PDF ↗
Shengzhe Chen, Hao Yan
573
Fast Reasoning Segmentation for Images and Videos PDF ↗
Yiqing Shen, Mathias Unberath
574
Structure-Aware Representation Distillation for Tiny-Dense Object Segmentation PDF ↗
Xuesong Liu, Anke Xu, Wenbo Cao, Emmett Ientilucci
575
CRFT: Consistent–Recurrent Feature Flow Transformer for Cross- Modal Image Registration PDF ↗
Xuecong Liu, Mengzhu Ding, Zixuan Sun, Zhang Li, Xichao Teng
576
FireScope: Wildfire Risk Raster Prediction With a Chain-of-Thought Oracle PDF ↗
Mario Markov, Stefan Ailuro, Luc Van Gool, Konrad Schindler, Danda Pani Paudel
577
OlmoEarth: Stable Latent Image Modeling for Multimodal Earth Observation PDF ↗
Henry Herzog, Favyen Bastani, Yawen Zhang, Gabriel Tseng, Joseph Redmon, Hadrien Sablon, Ryan Park, Jacob Morrison, Alexandra Buraczynski, Karen Farley, Josh Hansen, Andrew Howe, Patrick Alan Johnson, Mark Otterlee, Ted Schmitt, Hunter Pitelka, Stephen Daspit, Rachel Ratner, Christopher Wilhelm, Sebastian Wood, Mike Jacobi, Hannah Kerner, Evan Shelhamer, Ali Farhadi, Ranjay Krishna, Patrick Beukema
578
TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis PDF ↗
Zhengpeng Feng, Clement Atzberger, Sadiq Jaffer, Jovana Knezevic, Silja Sormunen, Robin Young, Madeline C. Lisaius, Markus Immitzer, Toby Jackson, James Ball, David A. Coomes, Anil Madhavapeddy, Andrew Blake, Srinivasan Keshav
579
Regulating Rather than Constraining: Adaptive Guidance for Complex Spectral Reconstruction in Pansharpening PDF ↗
Zhuwei Wen, Zimin Xia, He Chen, Linwei Yue, Xianwei Zheng
580
GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing PDF ↗
Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya
581
Revisiting the Necessity of Full Accuracy: Weakly Supervised Object-Level Offset Correction for Misaligned Building Labels PDF ↗
Junda Xu, Yanmeng Liu, Xiangqiang Zeng, Jinrong Wu, Ying Qu, Libao Zhang
582
UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes PDF ↗
Shuo Ni, Di Wang, He Chen, Haonan Guo, Ning Zhang, Jing Zhang
583
ZoomEarth: Active Perception for Ultra-High-Resolution Geospatial Vision-Language Tasks PDF ↗
Ruixun Liu, Bowen Fu, Jiayi Song, Kaiyu Li, Wanchen Li, Lanxuan Xue, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao
584
Unleashing Stealthy Backdoor Pandemic by Infecting a Single Diffusion Model PDF ↗
Mohaiminul Al Nahian, Abeer Matar Almalky, Sabbir Ahmed, Abdullah Al Arafat, Mamshad Nayeem Rizve, Adnan Siraj Rakin
585
Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation PDF ↗
Lilin Zhang, Yimo Guo, Yue Li, Jiancheng Shi, Xianggen Liu
586
Robustness Under Data Scarcity: Few-Shot Continual Adversarial Training for Evolving Threats PDF ↗
Wenxuan Wang, Chenglei Wang, Chengzhi Yan, Xuelin Qian, Yanning Zhang
587
Logit-Margin Repulsion for Backdoor Defense PDF ↗
Zhiguo Yang, Dongsheng Xu, Ruizhi Zhong, Jiacheng Pi, Xingxing Huang, Wenjie Ruan
588
Thermally Activated Dual-Modal Adversarial Clothing against AI Surveillance Systems PDF ↗
Jiahuan Long, Tingsong Jiang, Hanqing Liu, Chao Ma, Weien Zhou, Yang Yang, Wen Yao
589
Immunizing Models Against Harmful Long-Horizon Fine-Tuning via Contractive Optimization Dynamics PDF ↗
Najibul Haque Sarker, Zaber Ibn Abdul Hakim, Ali Asgarov, Chia-Wei Tang, Alvi Md Ishmam, Chris Thomas
590
Towards Stealthy and Effective Backdoor Attacks on Lane Detection: A Naturalistic Data Poisoning Approach PDF ↗
Yifan Liao, Yuxin Cao, Yedi Zhang, Wentao He, Yan Xiao, Xianglong Du, Zhiyong Huang, Jin Song Dong
591
Red-teaming Retrieval-Augmented Diffusion Models via Poisoning Knowledge Bases PDF ↗
Xinqi Lyu, Yihao Liu, Dong Wang, Bin Xiao
592
Latent Diffusion Inversion Requires Understanding the Latent Space PDF ↗
Mingxing Rao, Bowen Qu, Daniel Moyer
593
Fractal Camouflage: A Bio-Inspired Approach for Multi-Scale Adversarial Attacks in the Infrared Domain PDF ↗
Chengyin Hu, Xin Wang, Rui Qiu, Zhe Jia, Yingying Zhao, Kai Wang, Xu Kang, Yiwei Wei
594
EgoRoC: Towards Egocentric Robotic Control via Task-Agnostic Visual Alignment PDF ↗
Wei Feng, Chi Zhang, Nan Li, Qian Zhang, Qi Zhang, Mingyan Li
595
Describe Anything Anywhere At Any Moment PDF ↗
Nicolas Gorlo, Lukas Schmid, Luca Carlone
596
StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation PDF ↗
Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen
597
VLA Models Are More Generalizable Than You Think: Revisiting Physical and Spatial Modeling PDF ↗
Weiqi Li, Quande Zhang, Ruifeng Zhai, Liang Lin, Guangrun Wang
598
Action–Geometry Prediction with 3D Geometric Prior for Bimanual Manipulation PDF ↗
Chongyang Xu, Haipeng Li, Shen Cheng, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu
599
Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild PDF ↗
Hao Luo, Ye Wang, Wanpeng Zhang, Haoqi Yuan, Yicheng Feng, Haiweng Xu, Sipeng Zheng, Zongqing Lu
600
Rethinking Camera Choice: An Empirical Study on Fisheye Camera Properties in Robotic Manipulation PDF ↗
Han Xue, Nan Min, Xiaotong Liu, Wendi Chen, Yuan Fang, Jun Lv, Cewu Lu, Chuan Wen
601
INSIGHT Bench: Towards Grounded IN-SItu Guidance for Robotic ManipulaTion PDF ↗
Seonho Kim, Junhyeong Hong, Kyungjae Lee, Yoonseon Oh
602
MM-ACT: Learn from Multimodal Parallel Generation to Act PDF ↗
Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo
603
HQC-NBV: A Hybrid Quantum-Classical View Planning Approach PDF ↗
Xiaotong Yu, Chang Wen Chen
604
Motus: A Unified Latent Action World Model PDF ↗
Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu
605
SE(3)-Equivariance with Geometric and Topological Guidance for Category-Level Object Pose Estimation PDF ↗
Sheng Yu, Di-Hua Zhai, Yuanqing Xia
606
SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding PDF ↗
Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel
607
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation PDF ↗
Zaijing Li, Bing Hu, Rui Shao, Gongwei Chen, Dongmei Jiang, Pengwei Xie, Jianye Hao, Liqiang Nie
608
RoboTAG: End-to-end Robot Pose Estimation via Topological Alignment Graph PDF ↗
Yifan Liu, Fangneng Zhan, Wanhua Li, Haowen Sun, Katerina Fragkiadaki, Hanspeter Pfister
609
MVLM: Template-Free Tracking via Vision–Language Margin Confidence and Memory-Gated Tracking PDF ↗
Dae-Hyeon Park, Mina Baek, Jeong-Hun Ha, Chan-Seop Park, Jamshidjon Ganiev, Seung-Hwan Bae
610
Interactive Tracking: A Human-in-the-Loop Paradigm with Memory- Augmented Adaptation PDF ↗
Yuqing Huang, Guotian Zeng, Zhenqiao Yuan, Zhenyu He, Xin Li, Yaowei Wang, Ming-Hsuan Yang
611
VidEoMT: Your ViT is Secretly Also a Video Segmentation Model PDF ↗
Narges Norouzi, Idil Esen Zulfikar, Niccolò Cavagnero, Tommie Kerssies, Bastian Leibe, Gijs Dubbelman, Daan de Geus
612
Matching Every Pair to Track Every Point: PairFormer for All-Pairs Tracking and Video Trajectory Fields PDF ↗
Guangyang Wu, Youran Ding, Xinyu Che, Benyuan Sun, Yi Yang, Xiaohong Liu
613
Boosting Self-Supervised Tracking with Contextual Prompts and Noise Learning PDF ↗
Yaozong Zheng, Qihua Liang, Bineng Zhong, Shuimu Zeng, Yuanliang Xue, Ning Li, Shuxiang Song
614
Progressive Multi-cue Alignment for Unaligned RGBT Tracking PDF ↗
Jiandong Jin, Chenglong Li, Hao Feng, Andong Lu, Lili Huang, Jin Tang
615
Real-Time Neural Video Compression with Unified Intra and Inter Coding PDF ↗
Hui Xiang, Yifan Bian, Li Li, Jingran Wu, Xianguo Zhang, Dong Liu
616
Adapting Lightweight Image-based Counting Models for Video Crowd Counting PDF ↗
Weibo Shu, Antoni B. Chan
617
Sparse Task Vector Mixup with Hypernetworks for Efficient Knowledge Transfer in Whole-Slide Image Prognosis PDF ↗
Pei Liu, Xiangxiang Zeng, Tengfei Ma, Yucheng Xing, Xuanbai Ren, Yiping Liu
618
MedTVT-R1: A Multimodal LLM Empowering Medical Reasoning and Diagnosis PDF ↗
Yuting Zhang, Kaishen Yuan, Hao Lu, Yutao Yue, Jintai Chen, Kaishun Wu
619
MedKCO: Medical Vision-Language Pretraining via Knowledge-Driven Cognitive Orchestration PDF ↗
Chenran Zhang, Ruiqi Wu, Tao Zhou, Yi Zhou
620
Toward Generalizable Whole Brain Representations with High- Resolution Light-Sheet Data PDF ↗
Minyoung E. Kim, Dae Hee Yun, Aditi V. Patel, Madeline Hon, Webster Guan, Taegeon Lee, Brian Nguyen
621
CryoHype: Reconstructing a thousand cryo-EM structures with transformer-based hypernetworks PDF ↗
Jeffrey Gu, Minkyu Jeon, Ambri Ma, Serena Yeung-Levy, Ellen D. Zhong
622
GenTract: Generative Global Tractography PDF ↗
Alec Sargood, Lemuel Puglisi, Elinor Thompson, Mirco Musolesi, Daniel C. Alexander
623
LUMINA: A Multi-Vendor Mammography Benchmark with Energy Harmonization Protocol PDF ↗
Hongyi Pan, Gorkem Durak, Halil Ertugrul Aktas, Andrea M. Bejar, Baver Tutun, Emre Uysal, Ezgi Bulbul, Mehmet Fatih Dogan, Berrin Erok, Berna Akkus Yildirim, Sukru Mehmet Erturk, Ulas Bagci
624
Virtual Immunohistochemistry Staining with Dual-Aligned Multi- Task Feature Guidance PDF ↗
Shigeng Xie, Hongming Xu, Guiyang Jiang, Tuomo Rossi, Tommi Kärkkäinen, Fengyu Cong
625
Can Natural Image Autoencoders Compactly Tokenize fMRI Volumes for Long-Range Dynamics Modeling? PDF ↗
Peter Yongho Kim, Juhyeon Park, Jungwoo Park, Jubin Choi, Jungwoo Seo, Jiook Cha, Taesup Moon
626
IEBGL:An Interpretability-Enhanced Brain Graph Learning Framework with LLM-Instructed Topology and Literature-Augmented Semantics PDF ↗
Yihang Duan, Shuo Huang, Li Zhang, Meiling Wang, Li Zhang
627
Few-Shot Hybrid Incremental Learning: Continually Learning under Data Scarcity and Task Uncertainty PDF ↗
Bin Pu, Xusheng Liang, Xinpeng Ding, Jinlin Wu, Zhen Lei, Shengli Li, Kenli Li, Jiawei Ma
628
Sparse Spectral LoRA: Routed Experts for Medical VLMs PDF ↗
Omid Nejatimanzari, Hojat Asgariandehkordi, Taha Koleilat, Yiming Xiao, Hassan Rivaz
629
SAT-RRG: LLM-Guided Self-Adaptive Training for Radiology Report Generation with Token-Level Push–Pull Optimization PDF ↗
Yunyi Liu, Yingshu Li, Tong Chen, Lingqiao Liu, Lei Wang, Luping Zhou
630
OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis PDF ↗
Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang
631
Structural–Semantic Perception for Diffusion-Guided Temporal Forgery Localization PDF ↗
Ligong Cao, Yeting Guo, Haoang Chi
632
Forensic-Friendly Image Manipulation via Controllable Latent Diffusion PDF ↗
Hanyu Chen, Haiwei Wu, Jinyu Tian, Jianqing LI, Jiantao Zhou
633
IncreFA: Breaking the Static Wall of Generative Model Attribution PDF ↗
Haotian Qin, Dongliang Chang, Yueying Gao, Yuexuan Tan, Lei Chen, Zhanyu Ma
634
AVFakeBench: A Comprehensive Audio-Video Forgery Detection Benchmark for AV-LMMs PDF ↗
Shuhan Xia, Peipei Li, Xuannan Liu, Dongsen Zhang, Xinyu Guo, Zekun Li
635
Detecting Compressed AI-Generated Images via Phase Spectrum Robustness PDF ↗
Kai Li, Wenqi Ren, Wei Wang, Xiaochun Cao
636
Detect Any AI-Counterfeited Text Image PDF ↗
Chenfan Qu, Yiwu Zhong, Xuekang Zhu, Junchi Li, Changjiang Jiang, Jian liu, Lianwen Jin
637
DeepfakeImpact: A Two-Stage Benchmark with Real-World Impact in Deepfake Detection PDF ↗
Chaoyu Gong, Han Zhang, Siqiang Luo
638
Enhancing the Security of Visual Speaker Authentication Based on Dynamic Lip-Print Analysis PDF ↗
Yi He, Lei Yang, Bofan Chen, Shilin Wang
639
SimLBR: Learning to Detect Fake Images by Learning to Detect Real Images PDF ↗
Aayush Dhakal, Subash Khanal, Srikumar Sastry, Jacob Arndt, Philipe Dias, Dalton Lunga, Nathan Jacobs
640
Editprint: General Digital Image Forensics via Editing Fingerprint with Self-Augmentation Training PDF ↗
Haiwei Wu, Kemou Li, Yuanman Li, Jiantao Zhou
641
Detecting AI-Generated Forgeries via Iterative Manifold Deviation Amplification PDF ↗
Jiangling Zhang, Shuxuan Gao, Bofan Liu, Siqiang Feng, Jirui Huang, Yaxiong Chen, Ziyu Chen
642
Goldilocks Test Sets for Face Verification PDF ↗
Haiyu Wu, Sicong Tian, Aman Bhatta, Jacob Gutierrez, Grace Bezold, Genesis Argueta, Karl Ricanek, Michael C. King, Kevin Bowyer
643
Fine-VAD: Towards Fine-Grained Video Anomaly Detection via Progressive Cross-Granularity Learning PDF ↗
Menghao Zhang, Yiyan Zhu, Pengfei Ren, Haifeng Sun, Qi Qi, Zirui Zhuang, Huazheng Wang, Lei Zhang, Jianxin Liao, Jingyu Wang
644
DLVP-CLIP: Enhancing Fine-Grained Zero-Shot Anomaly Detection via Dynamic Local Visual Prompting PDF ↗
Gaowei Zhang, Lihe Zhang
645
MoECLIP: Patch-Specialized Experts for Zero-shot Anomaly Detection PDF ↗
Jun Yeong Park, JunYoung Seo, Minji Kang, Yu Rang Park
646
Alert-CLIP: Abnormality-aware Latent-Enhanced Representation Tuning of CLIP for Video Anomaly Detection PDF ↗
Yiyan Zhu, Menghao Zhang, Haifeng Sun, Pengfei Ren, Xianao Chu, Chenye Xu, Hong Tan, Jinghan Wang, Qi Qi, Jingyu Wang
647
AnomalyVFM -- Transforming Vision Foundation Models into Zero- Shot Anomaly Detectors PDF ↗
Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj
648
LayoutAD: Exploring Semantic-Geometric Misalignment Reasoning for Scene Layout Anomaly Detection PDF ↗
Zhichao Zeng, Jiasheng Zhang, Jiyun Sun, Jiangtao Cui, Xiaotian Qiao
649
Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection PDF ↗
Yujin Lee, Sewon Kim, Daeun Moon, Seoyoon Jang, Hyunsoo Yoon
650
GS-CLIP: Zero-shot 3D Anomaly Detection by Geometry-Aware Prompt and Synergistic View Representation Learning PDF ↗
Zehao Deng, An Liu, Yan Wang
651
TLMA: Mitigating the Impact of Weakly Labeled Information for Video Anomaly Detection PDF ↗
Rong Xu, Runqi Wang, Yingjun Zhang, Tao Tao, Xiaomeng Li, Liping Jing
652
Defect Cue-Preserved Structural Feature Refinement for Few- Shot Anomaly Detection PDF ↗
Le Jiang, Yan Huang, Zhen Xu, Yong Xu, Hau-San Wong, Si Wu
653
Anomaly-Related Residual Fields for Cross-domain Anomaly Detection PDF ↗
Kewei Gao, Jiayi Xie, Zhengda Shen, Weijun Qin, Lingxiang Jia, Kejia Chen, Zunlei Feng, Yijun Bei
654
From Attraction to Equilibrium: Physics-Inspired Semantic Gravitons for Zero-Shot Anomaly Detection PDF ↗
Yuwen Pan, Yuan Wang, Shaohui Li, Zhi Li, Yu Liu, You He
655
Joint Learning of General and Diverse Patterns with Mixture of Memory Experts for Weakly-Supervised Video Anomaly Detection PDF ↗
Bo Sun, Junxi Chen, Zhe Wu, Feng Gao, Fan Yang, Li Su, Yaowei Wang
656
No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection PDF ↗
Zunkai Dai, Ke Li, Jiajia Liu, Jie Yang, Yuanyuan Qiao
657
FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground- Background Disentanglement PDF ↗
Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang
658
DynamicVGGT: Learning Dynamic Point Maps for 4D Scene Reconstruction in Autonomous Driving PDF ↗
Zhuolin He, Jing Li, Guanghao Li, Xiaolei Chen, Jiacheng Tang, Siyang Zhang, Zhounan Jin, Feipeng Cai, Bin Li, Jian Pu, Jia Cai, Xiangyang Xue
659
GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation PDF ↗
Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao
660
Test-Time 3D Occupancy Prediction PDF ↗
Fengyi Zhang, Xiangyu Sun, Huitong Yang, Zheng Zhang, Zi Huang, Yadan Luo
661
Group Diffusion: Enhancing Image Generation by Unlocking Cross- Sample Collaboration PDF ↗
Sicheng Mo, Thao Nguyen, Richard Zhang, Nick Kolkin, Siddharth Srinivasan Iyer, Eli Shechtman, Krishna Kumar Singh, Yong Jae Lee, Bolei Zhou, Yuheng Li
662
Diffusion Mental Averages PDF ↗
Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn
663
dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models PDF ↗
Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu
664
RegionRoute: Regional Style Transfer with Diffusion Model PDF ↗
Bowen Chen, Jake Zuena, Alan C. Bovik, Divya Kothandaraman
665
Low-Rank Residual Diffusion Models PDF ↗
Junfu Tan, Jiang Yuan
666
RDF-MIG: A Robust Diffusion Framework for Masked Image Generation to Augment Semantic Segmentation and Change Detection PDF ↗
Zian Cao, Wei Wei, Qingshan Gao, Yuanyuan Fu
667
TC-Padé: Trajectory-Consistent Padé Approximation for Diffusion Acceleration
Shaoxuan He, Benlei Cui, Bukun Huang, Zhizeng Ye, Yunyun Sun, Longtao Huang, Hui Xue, Yang Yang, Haiwen Hong, Jingqun Tang, Zhou Zhao
668
Bi-directional Autoregressive Diffusion for Large Complex Motion Interpolation PDF ↗
Yongrui Ma, Shijie Zhao, Mingde Yao, Junlin Li, Li Zhang, Xiaohong Liu, Qi Dou, Jinwei Gu, Tianfan Xue
669
Guiding Token-Sparse Diffusion Models PDF ↗
Felix Krause, Stefan Andreas Baumann, Johannes Schusterbauer, Olga Grebenkova, Ming Gui, Vincent Tao Hu, Björn Ommer
670
Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep PDF ↗
Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau
671
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis PDF ↗
Jaehyun Park, Minyoung Ahn, Minkyu Kim, Jonghyun Lee, Jae-Gil Lee, Dongmin Park
672
High-Fidelity Virtual Try-On beyond Paired Data Scarcity via Diffusion-based Cycle-Consistent Learning PDF ↗
Jia Wu, Yijing Dai, Tingfeng Cao, Meiling Wu, Tao Luo, Jian Dong Zhang, Guangming Lu, Xiaoyi Zeng
673
Sampling-Aware Quantization for Diffusion Models PDF ↗
Qian Zeng, Jie Song, Yuanyu Wan, Huiqiong Wang, Mingli Song
674
CRAFT: Aligning Diffusion Models with Fine-Tuning Is Easier Than You Think PDF ↗
Zening Sun, Zhengpeng Xie, Lichen Bai, Shitong Shao, Shuo Yang, Zeke Xie
675
Scale Space Diffusion PDF ↗
Soumik Mukhopadhyay, Prateksha Udhayanan, Abhinav Shrivastava
676
Making Training-Free Diffusion Segmentors Scale with the Generative Power PDF ↗
Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang
677
Roots Beneath the Cut: Uncovering the Risk of Concept Recovery in Pruning-Based Unlearning for Diffusion Models
Ci Zhang, Zhaojun Ding, Chence Yang, Jun Liu, Xiaoming Zhai, Shaoyi Huang, Beiwen Li, Xiaolong Ma, Jin Lu, Geng Yuan
678
Few-Step Diffusion Sampling Through Instance-Aware Discretizations PDF ↗
Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang
679
SpeeDiff: Scalable Pixel-Anchored End-to-End Latent Diffusion Model PDF ↗
Bingliang Zhang, Wenda Chu, Yizhuo Li, Linjie Yang, Yisong Yue, Katherine Bouman, Yang Song, Qiushan Guo
680
Structure-to-Intensity Diffusion for Adverse-Weather LiDAR Generation PDF ↗
Peiyang Ni, Longyu Yang, Lu Zhang, Kuniaki Saito, Yap-Peng Tan, Fumin Shen, Heng Tao Shen, Xiaofeng Zhu, Ping Hu
681
Focal–General Diffusion Model with Semantic Consistent Guidance for Sign Language Production PDF ↗
Yiheng Yu, Sheng Liu, Yuan Feng, Zhelun Jin, Yining Jiang, Min Xu
682
Diffusion Probe: Generated Image Result Prediction Using CNN Probes PDF ↗
Bukun Huang, Benlei Cui, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Haiwen Hong, Jingqun Tang
683
Content-Aware Dynamic Patchification for Efficient Video Diffusion PDF ↗
Sheng Li, Connelly Barnes, Mamshad Nayeem Rizve, Hongwu Peng, Zhengang Li, Ohi Dibua, Alireza Ganjdanesh, Xulong Tang, Yan Kang, Yifan Gong
684
PixelRush: Ultra-Fast, Training-Free High-Resolution Image Generation via One-step Diffusion PDF ↗
Hong-Phuc Lai, Phong Nguyen, Anh Tran
685
Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning PDF ↗
Jaekyun Ko, Dongjin Kim, Soomin Lee, Guanghui Wang, Tae Hyun Kim
686
Decoupled Residual Denoising Diffusion Models for Unified and Data Efficient Image-to-Image Translation PDF ↗
Ziyue Lin, Jiahe Hou, Hongyu Xia, Xinrui Xie, Feifei Wang, Yuyin Zhou, Wei Wang, Jiawei Liu, Liangqiong Qu
687
GROW: Watermark Generation with Progressive Guidance for Diffusion Models PDF ↗
Pengcheng Luo, Zexi Jia, Yijia Zhong, Jinchao Zhang, Jie Zhou
688
MotionV2V: Editing Motion in a Video PDF ↗
Ryan Burgert, Charles Herrmann, Forrester Cole, Michael S Ryoo, Neal Wadhwa, Andrey Voynov, Nataniel Ruiz
689
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models PDF ↗
Zitong Huang, Kaidong Zhang, Yukang Ding, Chao Gao, Rui Ding, Ying Chen, Wangmeng Zuo
690
OrthoFuse: Training-free Riemannian Fusion of Orthogonal Style- Concept Adapters for Diffusion Models PDF ↗
Ali Aliev, Kamil Garifullin, Nikolay Yudin, Vera Soboleva, Alexander Molozhavenko, Ivan Oseledets, Aibek Alanov, Maxim Rakhuba
691
DreamStyle: A Unified Framework for Video Stylization PDF ↗
Mengtian Li, Jinshu Chen, Songtao Zhao, Wanquan Feng, Pengqi Tu, Qian He
692
Diffusion Sampling Path Tells More: An Efficient Plug-and- Play Strategy for Sample Filtering PDF ↗
Sixian Wang, Zhiwei Tang, Tsung-Hui Chang
693
Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage PDF ↗
Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei
694
Reward Sharpness-Aware Fine-Tuning for Diffusion Models PDF ↗
Kwanyoung Kim, Byeongsu Sim
695
DBMSolver: A Training-free Diffusion Bridge Sampler for High- Quality Image-to-Image Translation PDF ↗
Sankarshana Venugopal, Mohammad Mostafavi, Jonghyun Choi
696
Cubic Discrete Diffusion: Discrete Visual Generation on High- Dimensional Representation Tokens PDF ↗
Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu
697
TAP: A Token-Adaptive Predictor Framework for Training-Free Diffusion Acceleration PDF ↗
Haowei Zhu, Tingxuan Huang, Xing Wang, Tianyu Zhao, Jiexi Wang, Weifeng Chen, Xurui Peng, Fangmin Chen, Junhai Yong, Bin Wang
698
Cross-modal Representation Learning for Diffusion-generated Image Detection PDF ↗
Tao Gong, Dayong Wang, Qi Chu, Bin Liu, Nenghai Yu
699
Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models PDF ↗
Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen
700
Back to Basics: Let Denoising Generative Models Denoise PDF ↗
Tianhong Li, Kaiming He
701
CaricHarmony: Contrastive Diffusion Paths for Identity-Preserving Caricature Synthesis PDF ↗
Dongyu Wang, Dar-Yen Chen, Yi-Zhe Song
702
DiP: Taming Diffusion Models in Pixel Space PDF ↗
Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai
703
RAPID: Reusing Attention Sparsity with Inter-step Adaptation for Efficient Video Diffusion PDF ↗
Shangran Lin, Lu Lu, Jian Chen, Qiang Liu
704
Efficient and Training-Free Single-Image Diffusion Models, 11:45 - 13:45 DEMOS 1 FOVEA: Flexible Ontology Visual Event Analyzer, 2 Rapid 3D Object Annotation through In-Situ Geometric Grounding, 3 EMMA: Extracting Multiple physical parameters from Multimodal Data, 4 SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation, 5 EgoMedAgent: Towards Evidence-based Egocentric Assistant for Clinical Perception and Action, 6 Authenticating Matryoshka Nesting Dolls via Zero-Shot 3D Completion
HaojunQiu, Kiriakos N. Kutulakos, David B. Lindell Aaron Steven White Narges Honarvar Nazari Farhat Shaikh, Ayan Banerjee, Sandeep Gupta Jiongze Yu, Xiangbo Gao, Pooja Verlani, Akshay Gadde, Yilin Wang, Balu Adsumilli, Zhengzhong Tu Chen Fang, Xu Cao, Houze Yang, Yifan Shen Yulia Kumar, Srotriyo Sengupta
No matches.