‹ June 7 schedule

Findings Posters

Sun · June 7 · 7:30–9:00 AM · ExHall A — 318 papers
318 papers
1
Advancing Open-Set Detection and Segmentation via Disentangled Representations
Haokang Zhang, Yuchen Guan, Runxi Cheng, Yujiu Yang
2
Disrupting Positional Encoding for Effective Open Set Recognition
Yu Wang, Jiabo Xie, Yucan Zhou, Junxian Mu, Qinghua Hu, Pengfei Zhu
3
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
Yupeng Zhang, Ruize Han, Fangnan Zhou, Wei Feng, Liang Wan
4
Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection
Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong
5
Region-Aware Hierarchical Sub-Feature Alignment for Robust EEG-Based Visual Decoding
Yanan Zhu, Ziwei Xiang, Jiamin Wu, Jinyang Guo, Hongyuan Zhang, Chunfeng Song, Hongjian Fang, Yufei Guo, Xianglong Liu
6
Super Sparse DETR: YOLO-Competitive Convergence and Acceleration
Hebao Zhu
7
Bi-Level Optimization for Single Domain Generalization
Marzi Heidari, Hanping Zhang, Hao Yan, Yuhong Guo
8
SA-Matching DETR: A Lightweight Transformer Detector with Enhanced Scale Adaptive Matching
Chengshan Yang, Pengnian Zhang, Jinjing Zhao
9
Asymmetric Collaborative Distillation for Asymmetric Image Retrieval
Yi Xie, Huaidong Zhang, Xuandi Luo, Yan Zhou, Shengfeng He
10
OKGraph: Online Knowledge Graph Probing for Open-vocabulary Recognition
Junhui Yin, Zhizhen Cai, Puze Wang, Guanzhou Ke, Jianhua Yang, Man Zhang, Qiang Zhang, Shengfeng He
11
Large Multimodal Models as General In-Context Classifiers
Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci
12
Indexing Multimodal Language Models for Large-scale Image Retrieval
Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias
13
EvoPrompt-ReID: A Bilevel Optimization Framework for Prompt-Encoder Co-evolution in Image Re-Identification
Yuanlin He, Zhenchuan Wang, Jun Chen, Yingying He, Jiabao Wang, Weiwen Wang, Kun Xu, zijin zhou, Xiaoxiao Wang, Mingju chen, Tingting Liu, Zhisong Pan
14
Leveraging Arbitrary Data Sources for AI-Generated Image Detection Without Sacrificing Generalization
Qinghui He, Haifeng Zhang, Xiuli Bi, Bo Liu, Chi-Man Pun, Bin Xiao
15
OmniGCD: Abstracting Generalized Category Discovery for Modality Agnosticism
Jordan Shipard, Arnold Wiliem, Kien Nguyen Thanh, Wei Xiang, Clinton Fookes
16
PTAD: Pose and Texture Agnostic Anomaly Detection
Wei Zhuo, Jianen Xiang, Miaomiao Liu, Huajun Lu
17
Mitigating the ID–OOD Tradeoff in Open-Set Test-Time Adaptation
Wenjie Zhao, Jia Li, Xin Dong, Yapeng Tian, Yu Xiang, Yunhui Guo
18
Towards Universal Open-Set Visual Font Recognition Via Augmented Synthetic Similarity
Peicheng Zhou, Shancheng Fang, Chenhui Jin, Bowei Pu, Hongtao Xie
19
VR-CLIP: Visual Refinement of CLIP for Zero-Shot Semantic Segmentation
Haitao Jiang, Xu Li, Yuanyang Cao, Ying Zhang, Jianji Wang
20
DynProto: Dynamic Prototype Evolution for Out-of-Distribution Detection
Yanqi Wu, Xinhua Lu, Runhe Lai, Qichao Chen, Jia-Xin Zhuang, Wei-Shi Zheng, Ruixuan Wang
21
Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
Sanghoon Lee, Geon Lee, Hyekang Park, Bumsub Ham
22
Once for All: An End-to-End Paradigm for VLM-Based Domain- Generalized Object Detection
Peng Zhang, Xiang Yuan, Cong Li, Junwei Han, Gong Cheng
23
SoREL: Soft-Label Refurbishment with Ensemble Learning for Noisy Long-Tailed Classification
Jun Wei Hsieh, Ying-Hsuan Wu, Yi-Kuan Hsieh, Xin Li, Kuan-Chuan Peng, Ming-Ching Chang
24
Unsupervised Graph Partitioning Framework for Background Suppression in Multi-Query Vehicle Re-Identification
Yichun Hu, Zixuan Hu, Ling-Yu Duan
25
Revisiting Real-Time Detection Transformer with Efficient Encoder Design
Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi
26
PASR: Pose-Aware 3D Shape Retrieval from Occluded Single Views
Jiaxin Shi, Guofeng Zhang, Wufei Ma, Naifu Liang, Adam Kortylewski, Alan Yuille
27
Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking
Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato
28
DetRefiner: Model-Agnostic Detection Refinement with Feature Fusion Transformer
Soichiro Okazaki, Tatsuya Sasaki, Hiroki Ohashi
29
SpHOR: A Representation Learning Perspective on Open-set Recognition for Identifying Unknown Classes in Deep Neural Networks
Thiru Thillai Nadarasar Bahavan, Sachith Seneviratne, Saman Halgamuge
30
Complexity of Linear Regions in Self-supervised Deep ReLU Networks
Mufhumudzi Muthivhi, Terence L. van Zyl
31
Decoupled Sub-Feature Uncertainty Modeling for Robust Multimodal Representation Learning
Aoqiang Zhu, Min Hu, Yan Xing, Yiming Tang
32
Pre-trained Models Can Count (Almost): Exploring Quantitative Structure in Visual Representations
Toshimichi Aota, Akinori Hashimoto, Naoto Sekizuka, Takayuki Okatani
33
A-SelecT: Automatic Timestep Selection for Diffusion Transformer Representation Learning
Changyu Liu, James Chenhao Liang, Wenhao Yang, Yiming Cui, Jinghao Yang, Tianyang Wang, Qifan Wang, Dongfang Liu, Cheng Han
34
HyperFM: A Efficient Hyperspectral Foundation Model with Spectral Grouping
Zahid Hassan Tushar, Sanjay Purushotham
35
Seeing Through Fog: Towards Fog-Invariant Action Recognition
Enqi Liu, Liyuan Pan, Zhi Gao, Lingzhi Li, Qing Li
36
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma
37
FedAR: Attribute-Guided Representation Learning for Heterogeneous Federated Learning
Mengjie Li, Liu Yang, Qi Shen
38
ZeroDiff++: Balancing Semantic Diffusion Dynamics for Robust Zero- Shot Learning
Qin Li, Qi Li, Limei Liu, Junfeng Yang, Han Peng
39
Equivariant Unsupervised Object Detection with Learnable Riesz Transform and Composite Spatial Transformers
Sayan Kumar Chaki, Thierry Fournel, Rémi Emonet
40
MART: Mechanism-disentanglement Anchor-Routed Training for Learning with Open-World Noisy Data
Changhui Hu, Bhalaji Nagarajan, Ricardo Marques, Petia Radeva
41
Online Interpretable Matrix Decomposition for Large-Scale Streaming Data
Muhammad A. A. Abdelgawad, Abdelrahman B. M. Eldaly, Meng Xinmin, Peng Jing, Abdurrashid Ibrahim Sanka, Ray C.C. Cheung, Hong Yan
42
Object-Centric Vision Token Pruning for Vision Language Models
Guangyuan Li, Rongzhen Zhao, Jinhong Deng, Yanbo Wang, Joni Pajarinen
43
BrainStack: Neuro-MoE with Functionally Guided Expert Routing for EEG-Based Language Decoding
Ziyi Zhao, Jinzhao Zhou, Xiaowei Jiang, Beining Cao, Wenhao Ma, Yang Shen, Ren Li, Yu-Kai Wang, Chin-teng Lin
44
BiomedHELIX : HiErarchical-Local Interaction eXploration for Biomedical Vision-Language Models
Ziheng Zhu, Yuncheng Guo, Jie Xu, Xiaodong Gu
45
From Fewer Samples to Fewer Bits: Reframing Dataset Distillation as Joint Optimization of Precision and Compactness
My H. Dinh, Aditya Sant, Akshay Malhotra, Keya Patani, Shahab Hamidi-Rad
46
Seeing Helps Reasoning in Language Models
Yulu Gan, Kaiya Ivy Zhao, Tomaso Poggio, Phillip Isola
47
Layer Embedding Deep Fusion Graph Neural Network
Taihua Xu, Genhao Tian, Jicong Fan, Xibei Yang, Qinghua Zhang, Yun Cui
48
From Horizontal to Rotated: Cross-View Object Geo-Localization with Orientation Awareness
Chenlin Fu, Ao Gong, Xingtao Ling, Yingying Zhu
49
LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu
50
Learning to Reason: Targeted Knowledge Discovery and Fuzzy Logic Update for Robust Image Recognition
Gurucharan Srinivas, Joshua Niemeijer, Frank Köster
51
GaussFiller: Unleashing VLM-Expert Guidance for 3D Scene Completion with 3D Gaussian Splatting
Yuhan Ping, Cheng Lin, Yuan Liu, Zhiyang Dou, Jia Pan, Wenping Wang
52
GEODE: Geometry-Guided Discrete Diffusion for Open-Vocabulary 3D Scene Graph Generation
Changqun Feng, Wangxiandi Yin, Xin Hu, Lei Zhao, Dongyang Zhang, Tao He
53
Map2Thought: Explicit 3D Spatial Reasoning via Metric Cognitive Maps
Xiangjun Gao, Zhensong Zhang, Dave Zhenyu Chen, Songcen Xu, Long Quan, Eduardo Pérez-Pellitero, Youngkyoon Jang
54
SCP: Spatial Causal Prediction in Video
Yanguang Zhao, Jie Yang, Shengqiong Wu, Shutong Hu, Hongbo Qiu, Yu Wang, Guijia Zhang, Tan Kai Ze, Hao Fei, Chia-Wen Lin, Mong-Li Lee, Wynne Hsu
55
SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery
Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang
56
Entropy-Constrained Information Optimal Transport for Multi-View Geo-Localization
Xiaoxi Yang, Bo Sun, Yisheng An, Ganchao Liu
57
Revisiting Image Manipulation Localization under Realistic Manipulation Scenarios
Xuekang Zhu, Ji-Zhe Zhou, Kaiwen Feng, Chenfan Qu, Xiwen Wang, Yunfei Wang, Liting Zhou, Jian Liu
58
Learning to Wander: Improving the Global Image Geolocation Ability of LMMs via Actionable Reasoning
Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Xiaohong Liu, Xiongkuo Min
59
CADRNet: Cognitively-Inspired Active Vision for 3D Reasoning Segmentation via Differentiable Rendering
Zai Yang Yu, Changshuo Wang, Yuan Shi, Linjun Sun, Shu Wei, Tingran Wang, Wangyu Wu, Yanjie Li, Weijun Li
60
Direct Language Embedding Enables Gaussian Splatting for Large Scenes
Zhida Li, Jianqiao Zhu, Hejin Huang, Yipeng Qin, Sibei Yang, Guanbin Li
61
CogNet: Multi-Agent Collaborative Reasoning and Verification for Salient Object Ranking
Zhenyu Wu, Tengfei Shi, Xuehao Wang, Ming Li, Chenglizhao Chen, Wenfeng Song, Aimin Hao
62
MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation
Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun
63
Towards Generalization of Scene Text Tampering Localization via Causal Invariance
Huiru Shao, Bin Dong, Kaizhu Huang, Xiaowei Huang, Qiufeng Wang
64
Background-Compensated Audio-Visual Semantic Modulation Framework for Audio-Visual Event Localization
Chao Sun, Junbo Zhang, Chuanbo Zhu, Mingjun Huang, Bo Du
65
POMA-3D: The Point Map Way to 3D Scene Understanding
Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk
66
Gazemo: Mimicking Human Saccades via Foveal-Peripheral Feature Modeling for Lightweight Semantic Segmentation
Mian Muhammad Naeem Abid, Radu Timofte
67
MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors
Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen
68
AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio- Visual Feature Prompting
Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro
69
PrAda: Few-Shot Visual Adaptation for Text-Prompted Segmentation
Gabriele Rosi, Fabio Cermelli, Carlo Masone, Barbara Caputo
70
SAGE: Shape-Adapting Gated Experts for Adaptive Histopathology Image Segmentation
Gia Huy Thai, Hoang-Nguyen Vu, Anh-Minh Phan, Quang-Thinh Ly, Thi-Ngoc-Truc Nguyen, Nhat Ho
71
Prompt-driven Small Object Instance Segmentation in Earth Observation
Chenhao Wang, Yingrui Ji, Yu Meng, Yunjian Zhang, Yao Zhu
72
OV-Stitcher: A Global Context-Aware Framework for Training- Free Open Vocabulary Semantic Segmentation
Seungjae Moon, Seunghyun Oh, Youngmin Ro
73
SCOPE: Scene-Contextualized Incremental Few-Shot 3D Segmentation
Vishal Thengane, Zhaochong An, Tianjin Huang, Son Lam Phung, Abdesselam Bouzerdoum, Lu Yin, Na Zhao, Xiatian Zhu
74
Towards Complete Activation: Foreground-Background Multi- Perspective Guided Cross-Support for Few-Shot Segmentation
Yi Yang, Qiang Jiao, Mengrui Shi, Qiang Zhang
75
MHMamba: Multi-Head Mamba for 3D Brain Tumor Segmentation
Hanjun Tao, Hua Wang, Fan Zhang
76
ROSE: Retrieval-Oriented Segmentation Enhancement
Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang
77
ConInfer: Context-Aware Inference for Training-Free Open-Vocabulary Remote Sensing Segmentation
Wenyang Chen, Zhanxuan Hu, Yaping Zhang, Hailong Ning, Yonghang Tai
78
Unify the Views: View-Consistent Prototype Learning for Few-Shot Segmentation
Hongli Liu, Yu Wang, Shengjie Zhao
79
Autoregressive Universal Video Segmentation Model
Miran Heo, Sukjun Hwang, Min-Hung Chen, Yu-Chiang Frank Wang, Albert Gu, Seon Joo Kim, Ryo Hachiuma
80
FCL-COD: Weakly Supervised Camouflaged Object Detection with Frequency-aware and Contrastive Learning
Jingchen Ni, Quan Zhang, Dan Jiang, Keyu Lv, Ke Zhang, Chun Yuan
81
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
Xinzhuo Li, Adheesh Juvekar, Jiaxun Zhang, Xingyou Liu, Muntasir Wahed, Kiet A. Nguyen, Yifan Shen, Tianjiao Yu, Ismini Lourentzou
82
Weakly-Supervised Referring Video Object Segmentation Through Text Supervision
Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang
83
TALENT: Target-Aware Efficient Tuning for Referring Image Segmentation
Shuo Jin, Siyue Yu, Bingfeng Zhang, Chao Yao, Meiqin Liu, Jimin Xiao
84
DeepDP-TGMM: Amortized Non-Parametric Clustering for Hyperspherical Self-Supervised Representations
Cyril Kana Tepakbong, Kévin Bouchard, Julien Maitre
85
Proto-SaGa: Prototype-based 3D Scene Segmentation with Semantic- aware Gaussian Grouping
Youngmin Oh, Changjae Oh, Bumsub Ham
86
RecycleLoRA: Rank-Revealing QR-Based Dual-LoRA Subspace Adaptation for Domain Generalized Semantic Segmentation
Chanseul Cho, Seokju Yun, Jaesung Jun, Seungjae Moon, Youngmin Ro
87
Instruction-Focus-Prompt: Semantics--Driven Structural Prompts for Universal SAM Segmentation
Shuqi Xia, Guangze Shi, Jiarui Cao, Aoyuan Shi, Meilin Liu, Xiaoyi Zhang, Yujie Wang, Xueyu Liu, Cai Zhao, Ziyuan He, Yongfei Wu, Mingqiang Wei
88
Continual Alignment for SAM: Rethinking Foundation Models for Medical Image Segmentation in Continual Learning
Jiayi Wang, Wei Dai, Haoyu Wang, Sihan Yang, Haixia Bi, Jian Sun
89
VirPro: Visual-Referred Probabilistic Prompt Learning for Weakly- Supervised Monocular 3D Detection
Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai
90
A Single Pixel is All You Need: Weakly Supervised Medical Image Segmentation using Discrete Denoising Diffusion Models
Mehmet Demirel, Christos Kyrkou
91
AdaMeta: Adaptive Meta-Learning with Dynamic Task Relational Inference for Few-shot learning
Xingyu Yang, Yidan Ma, Hanzhang Qu, Jianfu Cao
92
NRFP: A Noise-Robust Feature Plugin for Source-Free Domain Adaptation
Huanxin Zou, Zhize Wu, Yue Jiang, Jijian Zhou, Zhiwei Xu, Teng Li, Jianhua Shu, Fan Cheng
93
Label-Agnostic Category Discovery
Yuwei Bian, Shidong Wang, Chunming Li, Haofeng Zhang
94
Learning from Label Proportion with Dual-Proportion Constraints
Tianhao Ma, Ximing Li, Changchun Li, Renchu Guan
95
Test-Time Distillation for Continual Model Adaptation
Xiao Chen, Jiazhen Huang, Zhiming Liu, Qinting Jiang, Fanding Huang, Jingyan Jiang, Zhi Wang
96
Another BRIXEL in the Wall: Towards Cheaper Dense Features
Alexander Lappe, Martin A. Giese
97
Task-Specific Knowledge Improves Generalization: A Logits- Based Framework for Continual Learning of Vision-Language Models
Sijie Wang, Yingying Zhu
98
DARN: Dynamic Adaptive Regularization Networks for Efficient and Robust Foundation Model Adaptation
Dhenenjay Yadav, Rohan Sawai
99
Training-Free Uncertainty-guided Logit Adjustment for Few-Shot Class-Incremental Learning
Sungwon Woo, Dongjun Hwang, Shiwon Kim, Junsuk Choe, Jongho Nang
100
Model Merging on Loss Landscapes: A Geometric Perspective
Juanwu Lu, Anand Bhaskar, Brian Axelrod, Ekaterina Tolstaya, Tristan Emrich
101
DGD: Density Gradient-guided Diffusion for Long-Tailed Clustering
Xulun Ye, Yuanyuan Deng, Kun Zhou
102
DGP: Dynamic Gradient Projection for Task-Adaptive Continual Learning
Qier Meng, Cheng Deng
103
Bootstrap Your Own Classifier: Your Pretrained Vision Models are Secretly Strong Continual Learners
Yizheng Gong, Xiaoyang Wang, Siyue Yu, Waleed Al-Nuaimy, Jimin Xiao
104
Memory-efficient Continual Learning with Prototypical Exemplar Condensation
M.-Duong Nguyen, Thien-Thanh Dao, Le-Tuan Nguyen, Dung D. Le, Kok-Seng Wong
105
Continual Adaptation of Vision Foundational Models for Semantic Segmentation in Adverse Weather
Nikhil Kumar Jangamreddy, Mahsa Baktashmotlagh, Chetan Arora
106
ReMem: A Dynamic Memory Evolution Detector for Zero-Shot Anomaly Detection
Ling Yi, Zhe Chen, Gaochang Wu, Jinliang Ding, Xiaojie Wang, Zhaolong Ning
107
CurrMix: Curriculum-Enhanced MixUp for Long-Tailed Visual Recognition
Zhongquan Jian, Yanhao Chen, Bingbing Hu, Wenhan Lv, Shaopan Wang, Jipeng Wu, Junfeng Yao, Yang Lu, Qingqiang Wu
108
Class-Aware Drift Compensation for Non-Uniform Semantic Shift in Continual Learning
Fankang Xu, Lu Jin, Yanpeng Sun, Shiyu Xuan, Zechao Li
109
Onboarding Without Forgetting: Hypernetwork Personalization with Data-Free Replay for Personalized Federated Learning
Thinh Nguyen, Le Huy Khiem, Van-Tuan Tran, Khoa D Doan, Nitesh V. Chawla, Kok-Seng Wong
110
FedNPC: Stochastic Noise-driven Post-hoc Classifier Calibration Method for Federated Long-tailed Learning
Jintong Gao, He Zhao, Yibo Yang, Dandan Guo
111
Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection
Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen
112
MuSCM: Mutual Spatial Correlation Mapping for Class Incremental Detection Transformer
Jian Zhong, Yifan Jiao, Xi Shao, Bing-Kun Bao
113
AFCL: Achieving Spatio-Temporal Invariance to Data Heterogeneity in Federated Continual Learning
Jianheng Tang, Jingyu He, Kejia Fan, Run He, Jingchao Wang, Anfeng Liu, Houbing Herbert Song, Leye Wang, Zhanxing Zhu, Huiping Zhuang, Yunhuai Liu
114
SAGA: Semantic Anchor-Guided Alignment for Multi-Source Domain Adaptive Object Detection
Yongchao Feng, Ziyue Huang, Jinqing Zhang, Wenrui Cai, Qingjie Liu
115
DEED: Dual-Channel Enhanced Ensemble Distillation for Uncertainty- Aware Recognition
Yang Yang, Kai Xu, Junyao Hou, Miao Zhang, Xiang Li, Zhenghua Chen, Yingxue Gao, Min Wu
116
Wake the Sleeping Weights: Sparsely-Activated Continual Test- Time Adaptation for Medical Image Segmentation
Jianhang Ji, Zhiming Cheng, Jianxiang Zhao, Bingtao Ma, Hao Chen, Yuhan Gao, Lian Zhang, Zuobin Ying, Shuai Wang
117
Dynamic Pseudo-Label Assignment and Consistent Prototypical Learning for Few-Shot Class-Incremental Learning
Zhilong Mao, Hang Zhang, Yanmin Li, Lihua Liu, Jibing Wu, Mao Wang
118
Hold-One-Shot-Out (HOSO) for Validation-Free Few-Shot CLIP Adapters
Chris Vorster, Mayug Maniparambil, Noel O'Connor, Noel Murphy, Derek Molloy
119
Learning through Creation: A Hash-Free Framework for On-the-Fly Category Discovery
Bohan Zhang, Weidong Tang, Zhixiang Chi, Yi Jin, Zhenbo Li, Yang Wang, Yanan Wu
120
Frequency-Guided Iterative Bi-directional Exchange Network for Cross-Domain Few-Shot Segmentation
Yadang Chen, Qi Liu, Guoqing Zhang, Le Sun, Yuhui Zheng
121
Revisiting Prototype Rehearsal for Exemplar-Free Continual Learning: Manifold-Aware Boundary Sampling with Adaptive Class-Balanced Loss
Hongye Xu, Bartosz Krawczyk
122
SCOPE: Spatially Ordered Continual Learning for 3D Segmentation
Wenhao Xu, Huaidong Zhang, Weipeng Zhang, Qianle Zhang, Shengfeng He
123
Learning to Propose Pose for Category-Agnostic Objects via Joint Refinement with Co-Matching Supervision
Junjie Chen, Zezheng Liu, Runxiang Liu, Yuming Fang, Yifan Zuo, Jiebin Yan
124
Is Prompt Selection Necessary for Task-Free Online Continual Learning?
Seoyoung Park, Haemin Lee, Hankook Lee
125
ReConText3D: Replay-based Continual Text-to-3D Generation
Muhammad Ahmed Ullah Khan, Muhammad Haris Bin Amir, Didier Stricker, Muhammad Zeshan Afzal
126
Now You See It, Now You Don't: Instant Concept Erasure for Safe Text-to-Image and Video Generation
Shristi Das Biswas, Arani Roy, Kaushik Roy
127
ECOC-IL: Robust and Efficient Label LDP for Imbalanced Learning
Mengyang Li, Ou Wu
128
Safe Codebook: Token-Level Moderation for Safer Visual Autoregressive Generation
Jiaxuan Zhang, Qianqian Xu, Peisong Wen, Siran Dai, Yang Liu, Qingming Huang
129
Towards Universal and Lightweight Coverless Image Steganography with Multimodal Large Language Models Assistance
Jia Li, Zhankai Li, Yongqiang Yu, Xuehu Yan, Yuliang Lu
130
A Visual Semantic Adaptive Watermark Grounded by Prefix-Tuning for Large Vision-Language Model
Qi Zheng, Shuliang Liu, Yu Huang, Sihang Jia, Jungang Li, Lyuhao Chen, Junhao Chen, Hanqian Li, Aiwei Liu, Yibo Yan, Xuming Hu
131
TriGuard-FL: A User-Centric Trust Triad in Federated Learning via Auditable Data, Verifiable Contributions, and Antidote-Driven Mitigation
K Naveen Kumar, Mohsen Guizani
132
Assessing the Reliability of Image Quality Metrics and Mitigating Quality Bias in Generative Models
Hoin Jung, Shenyu Lu, De Wang, Xiaoqian Wang
133
Efficient Unlearning through Maximizing Relearning Convergence Delay
Khoa Tran, Simon S. Woo
134
Robust Continual Unlearning against Knowledge Erosion and Forgetting Reversal
Eun-Ju Park, Youjin Shin, Simon S. Woo
135
Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings
Bumjun Kim, Albert No
136
RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Models
Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou
137
FedOrtho: Efficient Federated Unlearning Via Orthogonal Convolution and Adaptive Soft Pruning
Qinghui Gong, Xue Yang, Xunlei Chen, Jinshan Lai, Hua Meng, Xiaohu Tang
138
Improving Synthesized Image Detection by Disentangling Generator- Shared and Generator-Specific Image Artifacts
Yongqi Yang, Yuke Li, Heng Huang, Zhihui Li, Bo Du, Yu Wu
139
PLR-Gate: Real-Time Gradient Privacy Assessment and Gated Transmission for Secure Federated Learning
Tao Huang, Jiayang Meng, Hong Chen, Chen Hou, Guolong Zheng, Xu Yang
140
A Unified Privacy-Utility Framework for Collaborative Inference via Randomized Smoothing
Shiwei Ding, Lan Zhang, Zhenlin Wang, Xiaoyong Yuan
141
Verify Claimed Text-to-Image Models Via Boundary-Aware Prompt Optimization
Zidong Zhao, Yihao Huang, Qing Guo, Tianlin Li, Anran Li, Kailong Wang, Jin Song Dong, Geguang Pu
142
Towards Robust Content Watermarking Against Removal and Forgery Attacks
Yifan Zhu, Yihan Wang, Xiao-Shan Gao
143
Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment
Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung
144
CBDC: Clean Bias Direction Construction for Unsupervised Debiasing in Vision-Language Models
DoYoung Kim, SungJoon Hwang, Byung-Joon Lee, Joohyeon Lee, Jee-Hyong Lee
145
Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack
Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu
146
Leveraging Unlabeled Data from Unknown Sources via Dual-Path Guidance for Deepfake Face Detection
Zhiqiang Yang, Renshuai Tao, Chunjie Zhang, Guodong Yang, Xiaolong Zheng, Yao Zhao
147
SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models
Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini
148
When Agents Steer Human Perception: How AI-Selected Images Can Convertly Alter Disagreements
Chi Zhang, Yulang Gao, Jiachen Zou, Chen Wei, Quanying Liu
149
UniShield: An Adaptive Multi-Agent Framework for Unified Forgery Image Detection and Localization
Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang
150
On the Group Disparities Arising from Machine Unlearning
Zijie Pan, Zuobin Ying, Yajie Wang, Liehuang Zhu, Wanlei Zhou
151
Count What Repeats: Period-Adaptive Multi-Scale Consistency for Self-Supervised Repetitive Action Counting
Shizhao Gao, Jun Li, Qiming Li
152
Taming Hallucinations: Boosting MLLMs' Video Understanding via Counterfactual Video Generation
Zhe Huang, Hao Wen, Aiming Hao, Bingze Song, Meiqi Wu, Jiahong Wu, Xiangxiang Chu, Sheng Lu, Haoqian Wang
153
ConfDiff: Confidence-Guided Representation Diffusion for Video Moment Retrieval
Haiming Zhao, Tai Wang
154
Evolutionary Multi-Agent Collaboration for Real-World Video Face Restoration
Bowen Tang, Tao Wang, Miao Zhang, Xin Yu, Jinwei Chen, Bo Li, Kaihao Zhang
155
STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding
Wenhao Li, Xueying Jiang, Gongjie Zhang, Xiaoqin Zhang, Ling Shao, Shijian Lu
156
HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression
Haoxuan Li, Mengyan Li, Junjun Zheng
157
D^2-STX: Decoupling Spatial-Temporal Cross-Attention for Dual- branch Repetitive Action Counting
Xiaoai Wang, Hang Wang, Yan Liu, Huan Hu, Bruce X.B. Yu
158
Group-DINOmics: Incorporating People Dynamics into DINO for Self-supervised Group Activity Feature Learning
Ryuki Tezuka, Chihiro Nakatani, Norimichi Ukita
159
Mamba-VMR: Multimodal Query Augmentation Via Generated Videos for Precise Temporal Grounding
Yunzhuo Sun, Xinyue Liu, Yanyang Li, Nanding Wu, Linlin Zong, Xianchao Zhang, Wenxin Liang
160
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang
161
TP^2-DETR: Unlocking Deformable DETR for Zero-Shot Temporal Action Proposal Generation with Temporal Feature Pyramids
Ya-Yun Cheng, Kan Tippayamontri, Chih-Yuan Yang, Jane Yung-jen Hsu
162
QENN: A Quantum Entanglement-Inspired Neural Network for Interaction and Relationship Prediction in Story Videos
Zijun Xu, Zhengqian Wu, Chunjie Zhang, Zhongyuan Wang, Chunxia Xiao, Chao Liang
163
FineGrade: A Rule-Consistent Scoring Framework for Fine-Grained Action Quality Assessment
Yicong Li, Howard Leung
164
One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition
Balaji Darur, Amanmeet Garg, Makarand Tapaswi
165
REBA: Residual Mixture-of-Experts and Bidirectional Video–Text Alignment for Better Fine-grained Weakly Supervised Video Anomaly Detection
Chengxi Chu, Nurul Japar, Chee Kau Lim
166
ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding
Hosu Lee, Junho Kim, Hyunjun Kim, Yong Man Ro
167
VIDEOP2R: Video Understanding from Perception to Reasoning
Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan
168
Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination
Yolo Yunlong Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu
169
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models Via Spatial-Temporal Forest Modeling
Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, Huaixi Wang, Yiyi Zhou, Rongrong Ji
170
HARP: Hierarchical Adaptive Ranking with Probabilistic Modeling for Skill Determination
Hui Yu, Xiao Ke, Zhihong Zeng, Huangbiao Xu, Huanqi Wu
171
STORM: End-to-End Referring Multi-Object Tracking in Videos
Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo
172
Extending Segment Anything Model 2 to Multi-Object Tracking by Optimizing Hierarchical Trajectory Memory
Cheng-Yen Yang, Hsiang-Wei Huang, Kuang-Ming Chen, Kunjun Li, Jenq-Neng Hwang
173
NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation
Quang Dang Huynh, Xuefei Yin, Andrew Busch, Hugo G. Espinosa, Alan Wee-Chung Liew, Matthew T.O. Worsey, Yanming Zhu
174
MOSSTrack : Modality-Specific Spatio-Temporal Context Learning for RGB-T Tracking
Yisong Liu, He Yao, Junlong Cheng, Yujie Lu, Junqi Bai, Min Zhu
175
Temporally Consistent Long-Term Memory for 3D Single Object Tracking
Jaejoon Yoo, SuBeen Lee, Yerim Jeon, Miso Lee, Jae-Pil Heo
176
DM^3T: Harmonizing Modalities via Diffusion for Multi-Object Tracking
Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li
177
IRDINO: Adapting DINOv3 with Second-Order Motion Awareness for Moving Infrared Small Target Detection
Qian Xu, Shuaipeng Fan, Fei Gao, Mingjin Zhang
178
SemanticMoments: Training-Free Motion Similarity via Third Moment Features
Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady
179
TAPNext++: What’s Next for Tracking Any Point (TAP)?
Sebastian Jung, Artem Zholus, Martin Sundermeyer, Carl Doersch, Ross Goroshin, David Joseph Tan, Sarath Chandar, Rudolph Triebel, Federico Tombari
180
ARGS: Auto-Regressive Gaussian Splatting via Parallel Progressive Next-Scale Prediction
Quanyuan Ruan, Kewei Shi, Jiabao Lei, Xifeng Gao, Xiaoguang Han
181
100Editor: 100+ Views per Batch and Minute-Scale View-Consistent 3D Editing
Cunqi Wu, Peng Zhou, Jie Qin, Qi Tian
182
DIAMOND-SSS: Diffusion-Augmented Multi-View Optimization for Data-efficient SubSurface Scattering
Guillermo Figueroa Araneda, Iris Dania Jimenez, Florian Hofherr, Manny Ko, Hector Andrade-Loarca, Daniel Cremers
183
Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning
Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu
184
Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
Yusuf Dalva, Yijun Li, Qing Liu, Nanxuan Zhao, Jianming Zhang, Zhe Lin, Pinar Yanardag
185
StabiGS: Video Stabilization through Rendering-Aware Trajectory Optimization in 3DGS-Reconstructed Scenes
Souheib Ben Mabrouk, Jean-Emmanuel Deschaud, Eva Coupeté, Thomas Derbanne, Nicolas Rahmouni
186
More Traces Better: Unified Artifact Modeling for Generalizable and Robust AI-generated Image Detection
Ruiqi Liu, Xiaolei Lv, Zhiyuan Yan, Yi Han, Boyi Sun, Bo Li, Jun Gao, Lubin Weng, Yan Wang, Shu Wu
187
Predicting Gene Expression in Spatially Resolved Transcriptomics Across Samples Through Probabilistic Fusion of Hierarchical Histology and Spatial Information
Yinbo Liu, Qi Wu, Keyang Ye, Xiao He, Tian Tian
188
Don't Let the Information Slip Away
Taozhe Li, Guansu Wang, Bo Yu, Yiming Liu, Wei Sun
189
FraQAT: Quantization Aware Training with Fractional Bits
Luca Morreale, Alberto Gil C P Ramos, Malcolm Chadwick, Mehdi Noroozi, Ruchika Chavhan, Abhinav Mehrotra
190
MAGIC: Few-Shot Mask-Guided Anomaly Inpainting with Prompt Perturbation, Spatially Adaptive Guidance, and Context Awareness
JaeHyuck Choi, Minjun Kim, Je Hyeong Hong
191
Video Inspector: An Agentic-RL Framework and Benchmark for Human-Aligned Generative Video Evaluation
Jacey Somers, Harrison Zale, Janine Mason, Tina Walker, Eddie Quinn, Felix Lewis, Gavin Wright, Yvonne Young, Charles Sullivan, Wayne Carter, Julian Foster
192
From Pixels to Nucleotides: End-to-End Token-Based Video Compression for DNA Storage
Cihan Ruan, Lebin Zhou, Bingqing Zhao, Rongduo Han, Qiming Yuan, Chenchen Zhu, Linyi Han, Liang Yang, Wei Wang, Wei Jiang, Nam Ling
193
CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection
Qiyu Chen, Zhen Qu, Wei Luo, Haiming Yao, Yunkang Cao, Yuxin Jiang, Yinan Duan, Huiyuan Luo, Chengkan Lv, Zhengtao Zhang
194
PSIM: Perceptual Similarity Index Measure
Md Eimran Hossain Eimon, Hari Kalva
195
UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding
Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji
196
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Chen Yuan, Jiawei Shao, Chi Zhang, Xuelong Li
197
GreenPlanner: Practical Floorplan Layout Generation via an Energy- Aware and Function-Feasible Generative Framework
Pengyu Zeng, Yuqin Dai, Jun Yin, Jing Zhong, Ziyang Han, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu
198
Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Spatial and Temporal Representation
Junhao Xia, Chaoyang Zhang, Yecheng Zhang, Chengyang Zhou, Zhichang Wang, Bochun Liu, Dongshuo Yin
199
WideEye: Achieving Wide Field-of-view Traffic Video Analytics With Dynamic Orientation Adaptation
Z. Jonny Kong, Sibendu Paul, Y. Charlie Hu
200
Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback
Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu
201
Pose-dIVE: Pose-Diversified Augmentation for Person Re-Identification
Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim
202
Adaptive Reinforcement for Open-ended Medical Reasoning via Semantic-Guided Reward Collapse Mitigation
Yizhou Liu, Dingkang Yang, Zizhi Chen, Minghao Han, Xukun Zhang, Keliang Liu, Jingwei Wei, Lihua Zhang
203
BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation
Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu
204
IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment
Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu
205
QuPAINT: Physics-Aware Instruction Tuning Approach to Quantum Material Discovery
Xuan Bac Nguyen, Hoang-Quan Nguyen, Sankalp Pandey, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu
206
CLIPtone-GO: Geometry‐Aware, Gradient-Orthogonalized Text-Guided Color Tone Adjustment
Satyam Merothiya, Chanda Grover Kamra, Indra Deep Mastan
207
Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems
YuChe Hsu, AnJui Wang, TsaiChing Ni, YuanFu Yang
208
Exploiting the Source-Asymmetry Confidence Gap for Generalizable AI-Generated Image Detection
Ziyang Zheng, Weiyan Chen, Yao Xiao, Zijie Cao, Dongyu Zhang, Pengxu Wei
209
CineMatte: Background Matting for Virtual Production and Beyond
Yuanjian He, Chen Zhang, Fasheng Chen, Jiangbo Cao
210
GATE: Gaussian-Attentive Transformer for Uncertainty-Aware Age Estimation
Chaewon Lee, JunHyeok Heo, Chang-Su Kim
211
GRAFT: Graph-Based Affordance Transfer via Part Correspondence
Mengying Lin, Utkarsh Mishra, Ajay Mandlekar, Danfei Xu
212
Face Time Traveller : Travel Through Ages Without Losing Identity
Purbayan Kar, Ayush Ghadiya, Vishal Chudasama, Pankaj Wasnik, C.V. Jawahar
213
KGGAT: Knowledge-Guided Graph Attention Network for Multi- Label Image Classification
Christine Dewi, Dhananjay R Thiruvady, Nayyar Zaidi
214
IntentEdit: Multi-Agent Reasoning for Intent-Driven Complex Image Editing
Yuxuan Zhang, Shijia Huang, Liwei Wang
215
Gen-n-Val: Agentic Image Data Generation and Validation
Jing-En Huang, I-Sheng Fang, Tzuhsuan Huang, Yu-Lun Liu, Chih-Yu Wang, Jun-Cheng Chen
216
SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding Via Functional Structure Units
Ruibin Wang, Zhenyu Lin, Xinhai Zhao
217
DARTS: Distance-Aware Robust Training for Selective Classification
A. Q. M. Sazzad Sayyed, Nathaniel D. Bastian, Francesco Restuccia
218
Modulate-and-Map: Crossmodal Feature Mapping with Cross- View Modulation for 3D Anomaly Detection
Alex Costanzino, Pierluigi Zama Ramirez, Giuseppe Lisanti, Luigi Di Stefano
219
PestVL-Net: Enabling Multimodal Pest Learning Via Fine-grained Vision-Language Interaction
Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie
220
Plug-and-Play Dynamic In-context Learning with Stochastic Regularization for Screen Content Image Super- Resolution
Yuexin Wang, Xiaolei Wang, Guangliang Cheng, Huihui Bai, Tammam Tillo, Jimin Xiao
221
EscherNet++: A Scalable Multi-View Framework for Amodal Completion, Novel View Synthesis and Feed-Forward 3D Reconstruction
Xinan Zhang, Muhammad Zubair Irshad, Anthony Yezzi, Yi-Chang Tsai, Zsolt Kira
222
Human-Intervention Segmentation via Federated Intent Embedding and Multi-Mask Recommendation
Yeongsu Kim, Seo-Yeon Choi, Kyungsu Lee
223
Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation
Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta
224
Robust Image Self-Recovery against Tampering using Watermark Generation with Pixel Shuffling
Minyoung Kim, Paul Hongsuck Seo
225
Learning to Select, Learning to Judge: Active Preference Alignment for Mars Terrain Segmentation
JunJie Li, Miyu Li, Jiawei Wang, Yu Liu, Yumei Wang
226
Attention Never Lie: Visual Attention Defocus Reveals and Rectifies Hallucinations in MLLMs
Chenxi Zhao, Yan Zhou, Jufeng Yang
227
Organizing Unstructured Image Collections using Natural Language
Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci
228
Thinking with Blueprints: Assisting Vision–Language Models in Spatial Reasoning via Structured Object Representation
Weijian Ma, Shizhao Sun, Tianyu Yu, Ruiyu Wang, Tat-Seng Chua, Jiang Bian
229
Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
Han Sun, Qin Li, Peixin Wang, Min Zhang
230
Efficient3D : A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs
Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao
231
HiViS: Hiding Visual Tokens from the Drafter for Speculative Decoding in Vision-Language Models
Zhinan Xie, Peisong Wang, Shuang Qiu, Jian Cheng
232
Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models
Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim
233
Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs
Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim
234
Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach
Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao
235
Visual Reasoning Through Tool-Supervised Reinforcement Learning
Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo
236
VSI: Visual–Subtitle Integration for Keyframe Selection to Enhance Long Video Understanding
Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong
237
ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models
Nastaran Darabi, Amit Ranjan Trivedi
238
Myopia Rectification: KV Cache Pruning for MLLMs Via Dynamic Attention Subsidy and Token Reclamation
Jiedong Zhuang, Lu Lu, Ming Dai, Jian Chen, Qiang Liu, Haoji Hu
239
NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries
Kanon Amemiya, Daichi Yashima, Kei Katsumata, Takumi Komatsu, Ryosuke Korekata, Seitaro Otsuki, Komei Sugiura
240
Logical Consistency Optimization for Few-Shot Weakly Supervised Video Anomaly Detection
Hantao Zheng, Ning Han, Yawen Zeng, Hegui Zhu, Hao Chen
241
VEGAS: Mitigating Hallucinations in Large Vision-Language Models via Vision-Encoder Attention Guided Adaptive Steering
Zihu Wang, Boxun Xu, Yuxuan Xia, Peng Li
242
COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence
Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang, Zhenyu Zhang, Jiawei Sheng, Xiaodong Li, Zhenyang Li, Li Gao, Daiting Shi, Dawei Yin, Tingwen Liu
243
CoVCR: Bridging Visual Narrative Gaps via Context Generation for Robust Commonsense Reasoning
Xinyu Li, Shiliang Sun
244
MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling
Sicong Leng, Jing Wang, Jiaxi Li, Hao Zhang, Zhiqiang Hu, Boqiang Zhang, Yuming Jiang, Hang Zhang, Xin Li, Deli Zhao, Wei Lu, Yu Rong, Aixin Sun, Shijian Lu
245
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, Juan Carlos Niebles
246
VoQA: Visual-only Question Answering
Jianing An, Luyang Jiang, Jie Luo, Wenjun Wu, Lei Huang
247
Benchmarking Vision-Language Models under Contradictory Virtual Content Attacks in Augmented Reality
Yanming Xiu, Zhengyuan Jiang, Neil Zhenqiang Gong, Maria Gorlatova
248
Language-Augmented Semantic Priors for B-Spline Surface Fitting
Yunzhong Lou, Yusheng Luo, Jiahao Li, Yu Song, Xiangdong Zhou
249
Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models
Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang
250
Trajectory-Diversity-Driven Robust Vision-and-Language Navigation
Jiangyang Li, Cong Wan, SongLin Dong, Chenhao Ding, Qiang Wang, Zhiheng Ma, Yihong Gong
251
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
Zixu Cheng, Jian Hu, Ziquan Liu, Chenyang Si, Wei Li, Shaogang Gong
252
Distilling Counterfactual Reasoning from Language to Vision: Causal Graph-Guided Post-Training for Video Understanding
Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang
253
Exploring Physics-aware Video Generation through Reinforcement Learning with Autoregressive Tokens
Wang Lin, Liyu Jia, Wentao Hu, Kaihang Pan, Zhongqi Yue, Fengda Zhang, Wei Zhao, Jingyuan Chen, Fei Wu, Hanwang Zhang
254
Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark
Ziyu Guo, Xinyan Chen, Renrui Zhang, Ruichuan An, Yu Qi, Dongzhi Jiang, Xiangtai Li, Manyuan Zhang, Hongsheng Li, Pheng-Ann Heng
255
Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models
Abin Shoby, Ta Duc Huy, Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Anton van den Hengel, Phi Le Nguyen, Johan W. Verjans, Vu Minh Hieu Phan
256
GDP: Graph-Based Dynamic Personalization for Multimodal Large Language Models
Cong Ray, Xiangwen Deng, Feice Huang, ZhengXian Wu, Shen'ao Jiang, Peng Jiao, Zhifang Liu, Haoqian Wang
257
AnyExperts: On-Demand Expert Allocation for Multimodal Language Models with Mixture of Experts
Yuting Gao, Lan Wang, Hengyuan Zhao, Linjiang Huang, Si Liu, Qingpei Guo
258
Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis
Helu Zhi, Jingjing Huang, Wang Xu, Yangbin Xu, Yibin Huang, Wanyue Zhang, Baoyang Jiang, Shirui Deng, Liang Zhu, FangFang Li, Tiejun Zhao, Yankai Lin, Yuan Yao
259
Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space
Chengzhi Liu, Yuzhe Yang, Yue Fan, Qingyue Wei, Sheng Liu, Xin Eric Wang
260
RVLF: A Reinforcing Vision–Language Framework for Gloss-Free Sign Language Translation
Zhi Rao, Yucheng Zhou, Benjia Zhou, Yiqing Huang, Sergio Escalera, Jun Wan
261
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie
262
AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models
Zijin Zhou, Songan Zhang
263
Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment
Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi
264
Fine-Grained Visual Prompt and Region Self-Distillation for Retrieval- Augmented VQA
Yujie Wang, Hu Zhang, Jiye Liang, Zhiqiang Wang, Hongye Tan, Ru Li
265
RADSeg: Unleashing Parameter and Compute Efficient Zero- Shot Open-Vocabulary Segmentation Using Agglomerative Models
Omar Alama, Darshil Jariwala, Avigyan Bhattacharya, Seungchan Kim, Wenshan Wang, Sebastian Scherer
266
Modality-Aware Bit Allocation for Mixed-Precision Quantization of Vision-Language Models
Xi Zhang, Hanwei Zhu, Jiamang Wang, Xiaolin Wu, Weisi Lin
267
Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models
Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen
268
Analyzing and Enhancing Visual Learning in LLM-based Radiology Report Generation
Zailong Chen, Peng Gao, Johan Barthelemy, Luping Zhou, Lei Wang
269
DocSLM: A Small Vision-Language Model for Long Multimodal Document Understanding
Tanveer Hannan, Dimitrios Mallios, Parth Pathak, Faegheh Sardari, Thomas Seidl, Gedas Bertasius, Mohsen Fayyaz, Sunando Sengupta
270
EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic- Guided Self-Exploration
Runze Li, Yuwen Zhai, Bo Xu, Liwu Xu, Nian Shi, Wei Zhang, Ran Lin, Liang Wang
271
Semantic Guided Feature Disentanglement and Reconstruction for Domain Adaptive Object Detection
Xiaowei Zhao, Zhide Liu, Yuqing Ma, Xianglong Liu
272
Dual-Modality Anchor-Guided Filtering for Test-Time Prompt Tuning
Jungwon Choi, Eunwoo Kim
273
Towards Efficient Multimodal Unified Reasoning Model via Model Merging
Qixiang Yin, Huanjin Yao, Jianghao Chen, Jiaxing Huang, Zhicheng Zhao, Fei Su
274
DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning
Chi Zhang, Haibo Qiu, Qiming Zhang, Zhixiong Zeng, Lin Ma, Jing Zhang
275
Can Textual Reasoning Improve the Performance of MLLMs on Fine- Grained Visual Classification?
Jie Zhu, Yiyang Su, Xiaoming Liu
276
VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack
Shiji Zhao, Shukun Xiong, Yao Huang, Jin Yan, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei
277
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
Yifei Wang, Zhenkai Li, Tianwen Qian, Huanran Zheng, Zheng Wang, Yuqian Fu, Xiaoling Wang
278
MASS: Motion-Aware Spatial–temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models
Xiyang Wu, Zongxia Li, Jihui Jin, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha
279
Beyond Syntax: Action Semantics Learning for App Agents
Bohan Tang, Dezhao Luo, Jianheng Liu, Jingxuan Chen, Shaogang Gong, Jianye Hao, Jun Wang, Kun Shao
280
Learning to Select Visual In-Context Demonstrations
Eugene Lee, Yu-Chi Lin, Jiajie Diao
281
CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging
Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari
282
Mull-Tokens: Modality-Agnostic Latent Thinking
Arijit Ray, Ahmed Abdelkader, Chengzhi Mao, Bryan A. Plummer, Kate Saenko, Ranjay Krishna, Leonidas Guibas, Wen-Sheng Chu
283
SPHINX: A Synthetic Environment for Visual Perception and Reasoning
Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi
284
It’s Time to Get It Right: Improving Analog Clock Reading and Clock- Hand Spatial Reasoning in Vision-Language Models
Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee
285
Uncertainty-Guided Graph Formulation via MWIS for Token Pruning in LVLMs
Jouwon Song, Sohyeon Kim, Kyeongbo Kong
286
From Alignment to Reason: Multi-Agent Debate for Tactical Badminton Video Retrieval
Yi-Xiang Zhang, Yu-Shuen Wang
287
Distilling Out-of-Distribution Knowledge from Large Language Models for CLIP Generalization
Qiji Ma, Chuanguang Yang, Zhulin An, Libo Huang, Erhu Zhao, Yuqi Li, Yongjun Xu
288
Multimodal Reasoning with Explicit Reasoning Patterns and Rewards
Han Qiu, Sheng Jin, Zhongrong Zuo, Ziyue Wang, Qi She, Ling Shao, Shijian Lu
289
VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection
Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding
290
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
Ziyun Zeng, Hang Hua, Jiebo Luo
291
Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework
Hongrui Jia, Chaoya Jiang, Shikun Zhang, Wei Ye
292
CodePlot-CoT: Mathematical Visual Reasoning by Thinking with Code-Driven Images
Chengqi Duan, Kaiyue Sun, Rongyao Fang, Manyuan Zhang, Yan Feng, Ying Luo, Yufang Liu, Ke Wang, Peng Pei, Xunliang Cai, Hongsheng Li, Yi Ma, Xihui Liu
293
Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Model
Zhiming Liu, Yujie Wei, Lei Feng, Xiu Su, Xiaobo Xia, Weili Guan, Zeke Xie, Shuo Yang
294
Recursive Think-Answer Process for LLMs and VLMs
Byung-Kwan Lee, Youngchae Chee, Yong Man Ro
295
GenSRL: Generative Spatiotemporal Representation Learning for Ophthalmic Prognosis Prediction
Wanyu Zhang, Yanzhao Shi, Chengxin Zheng, Hua Wang, Jianing Wang, Yue Zhang, Xiaobing Yu, Xiaodan Zhang
296
Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
Wenxuan Bao, Yanjun Zhao, Xiyuan Yang, Jingrui He
297
LED: LLM Enhanced Open-Vocabulary Object Detection without Human Curated Data Generation
Yang Zhou, Shiyu Zhao, Yuxiao Chen, Zhenting Wang, Can Jin, Mingyu Zhao, Dimitris N. Metaxas
298
VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models
Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari
299
Mitigating Vision-Text Order Bias in Vision-Language Model
Weilin Gan, Yifan Song, Zhuocheng Yu, Sujian Li
300
MARS-RL: Enhancing Multi-Agent RAG Systems for Multi-Modal Documents via Strategic Reasoning with Reinforcement Learning
Zhongyu Wang, Pengbo Liu
301
Beyond Single Object: Learning 3D Relations with Large Language Models
Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh
302
CarePilot: A Multi-Agent Framework for Long-Horizon Computer Task Automation in Healthcare
Akash Ghosh, Tajamul Ashraf, Rishu Kumar Singh, Numan Saeed, Sriparna Saha, Xiuying Chen, Salman Khan
303
Attention-Space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs
Yujin Jo, Sangyoon Bae, Taesup Kim
304
UnrealSpace: Analyzing Spatial Understanding and Reasoning in Controllable Simulation
Wufei Ma, Sky Cen, Jianzhi Shen, Rex Lee, León Begiristain, Yan Zhuang, Jiawei Peng, Zhifei Yu, Tianao Song, Xinyuan Qi, Tianmin Shu, Adam Kortylewski, Alan Yuille
305
Frequency-Modulated Visual Restoration for Matryoshka Large Multimodal Models
Qingtao Pan, Zhihao Dou, Shuo Li
306
Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning
Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma
307
Hierarchical Textual Knowledge for Enhanced Image Clustering
Yijie Zhong, Yunfan Gao, Weipeng Jiang, Haofen Wang
308
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
Zihao Dongfang, Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu, Danda Pani Paudel, Luc Van Gool, Kailun Yang, Xuming Hu
309
Entropy-Based Visual Re-perception Inference for Multimodal Models
Jia Liufu, Qiangyu Yan, Zhehan Kan, Wenming Yang, Hailin Hu, Xinghao Chen, Borui Jiang
310
VACoT: Rethinking Visual Data Augmentation with VLMs
Zhengzhuo Xu, Chong Sun, SiNan Du, Chen Li, Jing Lyu, Chun Yuan
311
Open World Image Aesthetic Assessment
Mingxiang Liao, Tianren Ma, Xijin Zhang
312
coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation
Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu
313
PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation Via Multi-Agent LLMs
Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You
314
Euclid’s Gift: Enhancing Spatial Perception and Reasoning in Vision-Language Models via Geometric Surrogate Tasks
Shijie Lian, Changti Wu, Laurence Tianruo Yang, Hang Yuan, Bin Yu, Lei Zhang, Kai Chen
315
Why MLLMs Struggle to Determine Object Orientations
Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper
316
VADE: Variance-Aware Dynamic Sampling via Online Sample- Level Difficulty Estimation for Multimodal Reinforcement Learning
Zengjie Hu, Jiantao Qiu, Tianyi Bai, Haojin Yang, Binhang Yuan, Qi Jing, Conghui He, Wentao Zhang
317
Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration
Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong
318
Alleviating Hallucinations in Large Vision-Language Models via Decoding-Time Perturbation Adaptation
Jiaqi Bai, Hongcheng Guo, Jiaheng Liu, Zhibo Zhou, Jian Yang, Feiran Huang
No matches.