‹ June 5 schedule

Poster Session 1

Fri · June 5 · 10:45 AM–12:45 PM · ExHall A–F — 665 papers
665 papers
1
A Style is Worth One Code: Unlocking Code-to-Style Image Generation with Discrete Style Space 🏆PDF ↗
Huijie Liu, Shuhao Cui, Haoxiang Cao, Shuai Ma, Kai Wu, Guoliang Kang
2
Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO- based Stylistic Triggers Optimization 🏆PDF ↗
Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding
3
ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning PDF ↗
Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang
4
ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior PDF ↗
Weikai Lu, Ziqian Zeng, Kehua Zhang, Haoran Li, Huiping Zhuang, Ruidong Wang, Cen Chen, Hao Peng
5
TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models PDF ↗
Jiaming He, Guanyu Hou, Hongwei Li, Zhicong Huang, Kangjie Chen, Yi Yu, Wenbo Jiang, Guowen Xu, Tianwei Zhang
6
ViT3: Unlocking Test-Time Training in Vision 🏆PDF ↗
Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang
7
Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models 🏆PDF ↗
Tao Qi, Huili Wang, Yuanhong Huang, Wendan Wang, Lianchao Zhao, Jinrui Wang, Zichen Qin, Shangguang Wang, Yongfeng Huang
8
Data Leakage Detection and De-duplication in Large Scale Geospatial Image Datasets 🏆PDF ↗
Yeshwanth Kumar Adimoolam, Charalambos Poullis, Melinos Averkiou
9
RAVEN: Erasing Invisible Watermarks via Novel View Synthesis PDF ↗
Fahad Shamshad, Nils Lukas, Karthik Nandakumar
10
LDP-Slicing: Local Differential Privacy for Images via Randomized Bit-Plane Slicing 🏆PDF ↗
Yuanming Cao, Chengqi Li, Wenbo He
11
NOWA: Null-space Optical Watermark for Invisible Capture Fingerprinting and Tamper Localization PDF ↗
Edwin Vargas, Jhon Lopez, Henry Arguello, Ashok Veeraraghavan
12
Revisiting Geometric Obfuscation with Dual Convergent Lines for Privacy-Preserving Image Queries in Visual Localization 🏆PDF ↗
Jeonggon Kim, Heejoon Moon, Je Hyeong Hong
13
Advancing Image Classification with Discrete Diffusion Classification Modeling PDF ↗
Omer Belhasin, Shelly Golan, Ran El-Yaniv, Michael Elad
14
Does YOLO Really Need to See Every Training Image in Every Epoch? PDF ↗
Xingxing Xie, Jiahua Dong, Junwei Han, Gong Cheng
15
Fine-grained Image Aesthetic Assessment: Learning Discriminative Scores from Relative Ranks PDF ↗
Zhichao Yang, Jianjie Wang, Zhixianhe Zhang, Pangu Xie, Xiangfei Sheng, Pengfei Chen, Leida Li
16
NuWa: Deriving Lightweight Class-Specific Vision Transformers for Edge Devices 🏆PDF ↗
Ziteng Wei, Qiang He, Bing Li, Feifei Chen, Hai Jin, Yun Yang
17
Plant Taxonomy Meets Plant Counting: A Fine-Grained, Taxonomic Dataset for Counting Hundreds of Plant Species 🏆PDF ↗
Jinyu Xu, Tianqi Hu, Xiaonan Hu, Letian Zhou, Songliang Cao, Meng Zhang, Hao Lu
18
Rethinking Dataset Distillation: Hard Truths about Soft Labels 🏆PDF ↗
Priyam Dey, Aditya Sahdev, Sunny Bhati, Konda Reddy Mopuri, Venkatesh Babu Radhakrishnan
19
Customized Fusion: A Closed-Loop Dynamic Network for Adaptive Multi-Task-Aware Infrared-Visible Image Fusion 🏆PDF ↗
Zengyi Yang, Yu Liu, Juan Cheng, Zhiqin Zhu, Yafei Zhang, Huafeng Li
20
Dual Band Thermal Videography: Separating Time-Varying Reflection and Emission Near Ambient Conditions 🏆PDF ↗
Sriram Narayanan, Mani Ramanagopal, Srinivasa Narasimhan
21
MetaSpectra+: A Compact Broadband Metasurface Camera for Snapshot Hyperspectral+ Imaging 🏆PDF ↗
Yuxuan Liu, Wei Xu, Qi Guo
22
Spectrum from Defocus: Fast Spectral Imaging with Chromatic Focal Stack PDF ↗
M. Kerem Aydin, Yi-Chun Hung, Jaclyn Pytlarz, Qi Guo, Emma Alexander
23
Towards Photorealistic and Efficient Bokeh Rendering via Diffusion Framework 🏆PDF ↗
Linxiao Shi, Siming Zheng, Zerong Wang, Hao Zhang, Jinwei Chen, Bo Li, Shifeng Chen, Peng-Tao Jiang
24
UnReflectAnything: RGB-Only Highlight Removal by Rendering Synthetic Specular Supervision 🏆PDF ↗
Alberto Rota, Mert Kiray, Mert Asim Karaoglu, Patrick Ruhkamp, Elena De Momi, Nassir Navab, Benjamin Busam
25
AVGGT: Rethinking Global Attention for Accelerating VGGT PDF ↗
Xianbing Sun, Zhikai Zhu, Zhengyu Lou, Bo Yang, Jinyang Tang, Liqing Zhang, He Wang, Jianfu Zhang
26
ManifoldNeuS: Manifold-aware View Optimizability for Pose-Free Neural Surface Reconstruction PDF ↗
Xinxin Liu, Xue Wang, Guoqing Zhou, Qing Wang
27
LongStream: Long-Sequence Streaming Autoregressive Visual Geometry PDF ↗
Chong Cheng, Xianda Chen, Tao Xie, Wei Yin, Weiqiang Ren, Qian Zhang, Xiaoyang Guo, Hao Wang
28
RPGFusion: 4D Radar Prior-Guided Multi-Modal Fusion for 3D Detection PDF ↗
Xin Qiu, Wenjie Liu
29
MoVieS: Motion-Aware 4D Dynamic View Synthesis in One Second PDF ↗
Chenguo Lin, Yuchen Lin, Panwang Pan, Yifan Yu, Tao Hu, Honglei Yan, Katerina Fragkiadaki, Yadong Mu
30
JRM: Joint Reconstruction Model for Multiple Objects without Alignment PDF ↗
Qirui Wu, Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Richard Newcombe, Angel X. Chang, Jakob Engel, Henry Howard-Jenkins
31
Inferring Compositional 4D Scenes without Ever Seeing One PDF ↗
Ahmet Berke Gökmen, Ajad Chhatkuli, Luc Van Gool, Danda Pani Paudel
32
FreeScale: Scaling 3D Scenes via Certainty-Aware Free-View Generation PDF ↗
Chenhan Jiang, Yu Chen, Qingwen Zhang, Jifei Song, Songcen Xu, Dit-Yan Yeung, Jiankang Deng
33
Complet4R: Geometric Complete 4D Reconstruction PDF ↗
Weibang Wang, Kenan Li, Zhuoguang Chen, Yijun Yuan, Hang Zhao
34
Unblur-SLAM: Dense Neural SLAM for Blurry Inputs PDF ↗
Qi Zhang, Denis Rozumny, Francesco Girlanda, Sezer Karaoglu, Marc Pollefeys, Theo Gevers, Martin R. Oswald
35
Learning Compact 3D Representations from Feed-Forward Novel View Synthesis PDF ↗
Honggyu An, Jaewoo Jung, Mungyeom Kim, Chaehyun Kim, Minkyeong Jeon, Jisang Han, Kazumi Fukuda, Takuya Narihira, Hyunah Ko, Junsu Kim, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim
36
Fast Spatial Tracking with Visual Geometry Transformer PDF ↗
Chengjie Huang, Guile Wu, Dongfeng Bai, Bingbing Liu
37
How Much 3D Do Video Foundation Models Encode? PDF ↗
Zixuan Huang, Xiang Li, Zhaoyang Lv, James M. Rehg
38
MetroGS: Efficient and Stable Reconstruction of Geometrically Accurate High-Fidelity Large-Scale Scenes PDF ↗
Kehua Chen, Tianlu Mao, Xinzhu Ma, Hao Jiang, Zehao Li, Zihan Liu, Shuqin Gao, Honglong Zhao, Feng Dai, Yucheng Zhang, Zhaoqi Wang
39
RnG: A Unified Transformer for Complete 3D Modeling from Partial Observations PDF ↗
Mochu Xiang, Zhelun Shen, Xuesong Li, Jiahui Ren, Jing Zhang, Chen Zhao, Shanshan Liu, Haocheng Feng, Jingdong Wang, Yuchao Dai
40
Long-Tail Internet Photo Reconstruction PDF ↗
Yuan Li, Yuanbo Xiangli, Hadar Averbuch-Elor, Noah Snavely, Ruojin Cai
41
Emergent Outlier View Rejection in Visual Geometry Grounded Transformers PDF ↗
Jisang Han, Sunghwan Hong, Jaewoo Jung, Wooseok Jang, Honggyu An, Qianqian Wang, Seungryong Kim, Chen Feng
42
Flow3r: Factored Flow Prediction for Scalable Visual Geometry Learning PDF ↗
Zhongxiao Cong, Qitao Zhao, Minsik Jeon, Shubham Tulsiani
43
MultiBanana: A Challenging Benchmark for Multi-Reference Text- to-Image Generation PDF ↗
Yuta Oshima, Daiki Miyake, Kohsei Matsutani, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta
44
HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives PDF ↗
Yihao Meng, Hao Ouyang, Yue Yu, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Hanlin Wang, Shuailei Ma, Yixuan Li, Cheng Chen, Yanhong Zeng, Xing Zhu, Yujun Shen, Huamin Qu
45
Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models PDF ↗
Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo
46
SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation PDF ↗
Chaitat Utintu, Yi-Zhe Song
47
ConsistCompose: Unified Multimodal Layout Control for Image Composition PDF ↗
Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin
48
A Training-Free Style-Personalization via SVD-Based Feature Decomposition PDF ↗
Kyoungmin Lee, Jihun Park, Jongmin Gim, Wonhyeok Choi, Kyumin Hwang, Jaeyeul Kim, Sunghoon Im
49
Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation PDF ↗
Haonan Cai, Yuxuan Luo, Zhouhui Lian
50
ImageRAGTurbo: Towards One-step Text-to-Image Generation with Retrieval-Augmented Diffusion Models PDF ↗
Peijie Qiu, Hariharan Ramshankar, Arnau Ramisa, Amit Kumar K C, René Vidal, Vamsi Salaka, Rahul Bhagat
51
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text PDF ↗
Weiguo Pian, Saksham Singh Kushwaha, Zhimin Chen, Shijian Deng, Kai Wang, Yunhui Guo, Yapeng Tian
52
Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation PDF ↗
Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Nguyen, Anh Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli
53
Curriculum Group Policy Optimization: Adaptive Sampling for Unleashing the Potential of Text-to-Image Generation PDF ↗
Baoteng Li, Xianghao Zang, Xinran Wang, Xiangyu Na, Zhixiang He, Hao Sun, Chi Zhang, Zhongjiang He, Tianwei Cao, Kongming Liang, Zhanyu Ma
54
SplitFlux: Learning to Decouple Content and Style from a Single Image PDF ↗
Yitong Yang, Yinglin Wang, Changshuo Wang, Yongjun Zhang, Ziyang Chen, Shuting He
55
FontCrafter: High-Fidelity Element-Driven Artistic Font Creation with Visual In-Context Generation PDF ↗
Wuyang Luo, Chengkai Tan, Chang Ge, Binye Hong, Su Yang, Yongjiu Ma
56
EmoStyle: Emotion-Driven Image Stylization PDF ↗
Jingyuan Yang, Zihuan Bai, Hui Huang
57
Text-Image Conditioned 3D Generation PDF ↗
Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian
58
IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator–Critic Framework PDF ↗
Feiyu Wang, Jiayuan Yang, Zhiyuan Zhao, Da Zhang, Bingyu Li, Peng Liu, Junyu Gao
59
AnyDoc: Enhancing Document Generation via Large-Scale HTML/ CSS Data Synthesis and Height-Aware Reinforcement Optimization PDF ↗
Jiawei Lin, Wanrong Zhu, Vlad I Morariu, Christopher Tensmeyer
60
Reasoning Diffusion for Unpaired Test Time Out-of-distribution Text-Image to Video Generation PDF ↗
Zirui Pan, Xin Wang, Yipeng Zhang, Hong Chen, Kecheng Zheng, Wenwu Zhu
61
SpatialReward: Verifiable Spatial Reward Modeling for Fine- Grained Spatial Consistency in Text-to-Image Generation PDF ↗
Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao
62
STAGE: Storyboard-Anchored Generation for Cinematic Multi-shot Narrative PDF ↗
Peixuan Zhang, Zijian Jia, Kaiqi Liu, Shuchen Weng, Si Li, Boxin Shi
63
MTA: Multimodal Task Alignment for BEV Perception and Captioning PDF ↗
Yunsheng Ma, Burhaneddin Yaman, Xin Ye, Jingru Luo, Feng Tao, Abhirup Mallik, Ziran Wang, Liu Ren
64
β-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
Fatimah Zohra, Chen Zhao, Hani Itani, Bernard Ghanem
65
SafeRoPE: Risk-specific Head-wise Embedding Rotation for Safe Generation in Rectified Flow Transformers PDF ↗
Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Min Yang
66
FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment PDF ↗
Myunsoo Kim, Seongwoong Shim, Byung-Jun Lee
67
Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos PDF ↗
Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu
68
Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning PDF ↗
Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang
69
Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs PDF ↗
Yurun Chen, Xueyu Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang
70
EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models PDF ↗
Yiyang Fang, Wenke Huang, Pei Fu, Yihao Yang, Kehua Su, Zhenbo Luo, Jian Luan, Mang Ye
71
EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval PDF ↗
Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He
72
Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning PDF ↗
Haonan Jia, Shichao Dong, Xin Dong, Zenghui Sun, Jin Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang
73
Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models PDF ↗
Mark Endo, Serena Yeung-Levy
74
Stabilizing Feature Geometry in Noisy Pretrained Models for Robust Downstream Tasks PDF ↗
Quanyu Zhang, Zhongyi Han, Hao Sun, Yongshun Gong, Xiaoyan Wang, Yilong Yin, Shuo Li
75
Black-Box Domain Adaptation for Object Detection with Retention- Driven Knowledge Compression PDF ↗
Yuwu Lu, Chunzhi Liu
76
Decoupled and Reusable Adaptation for Efficient Cross-Modal Transfer PDF ↗
Yajing Liu, Yumeng Zhang, Yue Si, Baojie Fan, Jiandong Tian
77
Preference-Aligned LoRA Merging: Preserving Subspace Coverage and Addressing Directional Anisotropy PDF ↗
Wooseong Jeong, Wonyoung Lee, Kuk-Jin Yoon
78
Curvature-Aware Zeroth-Order Optimization for Memory-Efficient Test-Time Adaptation PDF ↗
Junming Zhang, Shuyu Yin, Peilin Liu, Rendong Ying, Fei Wen
79
Label-Free Cross-Task LoRA Merging with Null-Space Compression PDF ↗
Wonyoung Lee, Wooseong Jeong, Kuk-Jin Yoon
80
Basis-Oriented Low-rank Transfer for Few-Shot and Test- Time Adaptation PDF ↗
Junghwan Park, Woojin Cho, Junhyuk Heo, Darongsae Kwon, Kookjin Lee
81
GeCo: Geometry-Consistent Regularization for Domain Generalized Semantic Segmentation PDF ↗
Qi Zang, Dong Zhao, Nan Pu, Wenjing Li, Zhun Zhong, Meng Wang
82
Event-based Motion Deblurring with Unpaired Data PDF ↗
Hoonhee Cho, Yuhwan Jeong, Kuk-Jin Yoon
83
Stable Spike: Dual Consistency Optimization via Bitwise AND Operations for Spiking Neural Networks PDF ↗
Yongqi Ding, Kunshan Yang, Linze Li, Yiyang Zhang, Mengmeng Jing, Lin Zuo
84
Event-based Visual Deformation Measurement PDF ↗
Yuliang Wu, Wei Zhai, Yuxin Cui, Tiesong Zhao, Yang Cao, Zheng-Jun Zha
85
Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo PDF ↗
Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia
86
SpikeTrack: High-performance and Energy-efficient Event-Based Object Tracking with Spiking Neural Network PDF ↗
Yang Wang, Jiqing Zhang, Chuanyu Sun, Qianhui Liu, Huilin Ge, Ziqi Wei, Xin Yang
87
Event Structural Valley: A Unified Theoretical and Practical Framework for Event Camera Autofocus PDF ↗
Xijie Xiang, Lin Zhu, Wei Zhang, Yonghong Tian
88
Adaptive Spatial-Temporal Window: Unlocking the Potential of Event Cameras in Heterogeneous Velocity Scenarios PDF ↗
Zhipeng Sui, Haiqing Hao, Weihua He, Seng-Hong Lee, Wenhui Wang
89
Do You Have Freestyle? Expressive Humanoid Locomotion via Audio Control PDF ↗
Zhe Li, Cheng Chi, Yangyang Wei, Boan Zhu, Tao Huang, Zhenguo Sun, Yibo Peng, Pengwei Wang, Zhongyuan Wang, Fangzhou Liu, Chang Xu, Shanghang Zhang
90
CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics PDF ↗
Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon
91
InternData-A1: Pioneering High-Fidelity Synthetic Data for Pre- training Generalist Policy PDF ↗
Yang Tian, Yuyin Yang, Yiman Xie, Zetao Cai, Xu Shi, Ning Gao, Hangxu Liu, Xuekun Jiang, Zherui Qiu, Feng Yuan, Yaping Li, Ping Wang, Junhao Cai, Jia Zeng, Hao Dong, Jiangmiao Pang
92
DemoFunGrasp: Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning PDF ↗
Chuan Mao, Haoqi Yuan, Ziye Huang, Chaoyi Xu, Kai Ma, Zongqing Lu
93
GeniNav: Generative Model Driven Image-Goal Navigation via Imagination-Guided Consistency Flow Matching PDF ↗
Yuqi Chen, Junjie Gao, Yongzhou Pan, Siyuan Song, Zixuan Zhang, Jiaping Xiao, Mir Feroskhan
94
Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and- Language Navigation PDF ↗
Pingrui Zhang, Yifei Su, Pengyuan Wu, Dong An, Li Zhang, Zhigang Wang, Dong Wang, Bin Zhao
95
DRAMA: Next-Gen Dynamic Orchestration for Resilient Multi-Agent Ecosystems in Flux PDF ↗
Xinkui Zhao, Yifan Zhang, Sai Liu, Naibo Wang, Guanjie Cheng, Yueshen Xu, Chang Liu, Shuiguang Deng, Jianwei Yin
96
Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning PDF ↗
Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang
97
Wanderland: Geometrically Grounded Simulation for Open- World Embodied AI PDF ↗
Xinhao Liu, Jiaqi Li, Youming Deng, Ruxin Chen, Yingjia Zhang, Yifei Ma, Li Guo, Yiming Li, Jing Zhang, Chen Feng
98
ORV: 4D Occupancy-centric Robot Video Generation PDF ↗
Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, Hao Zhao
99
DextER: Language-driven Dexterous Grasp Generation with Embodied Reasoning PDF ↗
Junha Lee, Eunha Park, Minsu Cho
100
Language-Free Generative Editing from One Visual Example PDF ↗
Omar Elezabi, Eduard Zamfir, Zongwei Wu, Radu Timofte
101
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models PDF ↗
Yujia Yang, Yuanxiang Wang, Zhenyu Guan, Tiankun Yang, Chenxi Bao, Haopeng Jin, Jinwen Luo, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Xinming Wang, Ruiwen Tao, Hongzhu Yi
102
LuxRemix: Lighting Decomposition and Remixing for Indoor Scenes PDF ↗
Ruofan Liang, Norman Müller, Ethan Weber, Duncan Zauss, Nandita Vijaykumar, Peter Kontschieder, Christian Richardt
103
CompBench: Benchmarking Complex Instruction-guided Image Editing PDF ↗
Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Zihan Wang, Yuan Xie, Shaohui Lin
104
Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit- Level Virtual Try-On with Clothing and Accessories PDF ↗
Junyao Hu, Zhongwei Cheng, Waikeung Wong, Xingxing Zou
105
Learning Personalized Photographic Style from Pairwise User Preferences PDF ↗
Jinwoo Kim, Jihye Yoo, Seon Joo Kim
106
CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing PDF ↗
Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian
107
Efficient Weighted Sampling via Score-based Generative Models PDF ↗
Heasung Kim, Taekyun Lee, Hyeji Kim, Gustavo De Veciana
108
MOSAIC-GS: Monocular Scene Reconstruction via Advanced Initialization for Complex Dynamic Environments PDF ↗
Svitlana Morkva, Vaishakh Patil, Alessio Tonioni, Michael Oechsle, Maximum Wilder- Smith, Marco Hutter
109
REArtGS++: Generalizable Articulation Reconstruction with Temporal Geometry Constraint via Planar Gaussian Splatting PDF ↗
Di Wu, Liu Liu, Anran Huang, Yuyan Liu, Qiaojun Yu, Shaofan Liu, Liangtu Song, Cewu Lu
110
Dynamic-eDiTor: Training-Free Text-Driven 4D Scene Editing with Multimodal Diffusion Transformer PDF ↗
Dong In Lee, Hyungjun Doh, Seunggeun Chi, Runlin Duan, Sangpil Kim, Karthik Ramani
111
FaithFusion: Harmonizing Reconstruction and Generation via Pixel-wise Information Gain PDF ↗
YuAn Wang, Xiaofan Li, Chi Huang, Wenhao Zhang, Hao Li, Bosheng Wang, Xun Sun, Jun Wang
112
IR-HGP: Physically-Aware Gaussian Inverse Rendering for High- Illumination Scenes via Generative Priors PDF ↗
Qingan Zhang, Wensheng Li, Chengying Gao
113
Seeing through boxes: Non-Line-of-Sight 3D Reconstruction from Radar Signals PDF ↗
Jiachen Lu, Hailan Shanbhag, Haitham Al Hassanieh
114
Speeding Up the Learning of 3D Gaussians with Much Shorter Gaussian Lists PDF ↗
Jiaqi Liu, Zhizhong Han
115
DynamicTree: Interactive Real Tree Animation via Sparse Voxel Spectrum PDF ↗
Yaokun Li, Lihe Ding, Xiao Chen, Guang Tan, Tianfan Xue
116
WildRayZer: Self-supervised Large View Synthesis in Dynamic Environments PDF ↗
Xuweiyi Chen, Wentao Zhou, Zezhou Cheng
117
DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images PDF ↗
Xiaoxue Chen, Ziyi Xiong, Yuantao Chen, Gen Li, Nan Wang, Hongcheng Luo, Long Chen, Haiyang Sun, Bing Wang, Guang Chen, Hongyang Li, Ya-Qin Zhang, Hangjun Ye, Hao Zhao
118
Retrieve-to-Restore: Efficient All-in-One Image Restoration with a Retrieval-Based Degradation Bank PDF ↗
Chenxu Wang, Kai Zhang, Jian Yang
119
MRI Contrast Enhancement Kinetics World Model PDF ↗
Jindi Kong, Yuting He, Cong Xia, Rongjun Ge, Shuo Li
120
ReflexSplit: Single Image Reflection Separation via Layer Fusion- Separation PDF ↗
Chia-Ming Lee, Yu-Fan Lin, Jin-Hui Jiang, Yu-Jou Hsiao, Chih-Chung Hsu, Yu-Lun Liu
121
Rethinking Knowledge Transfer in Image Quality Assessment: A Perceptual Preference Structure Alignment Perspective PDF ↗
Aobo Li, Jinjian Wu, Yongxu Liu, Jupo Ma, Weisheng Dong
122
ZeroIDIR: Zero-Reference Illumination Degradation Image Restoration with Perturbed Consistency Diffusion Models PDF ↗
Hai Jiang, Zhen Liu, Yinjie Lei, Songchen Han, Bing Zeng, Shuaicheng Liu
123
White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation PDF ↗
Shuwei Li, Lei Tan, Robby T. Tan
124
Unpaired Image Deraining Using Reward-Guided Self-Reinforcement Strategy PDF ↗
Yinghao Chen, Yeying Jin, Xiang Chen, Yanyan Wei, Ziyang Yan, Yaowen Fu
125
LF-BVN: Blind-View Network for Self-Supervised Light Field Denoising PDF ↗
Longzhao Guo, Shuo Zhang, Chen Gao, Qian Tian, Youfang Lin
126
rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training PDF ↗
Tianyang Dai, Ming Chang, Yan Chen, Yang Hu
127
Efficient Real-Time Raw-to-Raw Denoising for Extreme Low-Light Ultra HD Video on Mobile Devices PDF ↗
Charantej Pochimireddy, Subhasmita Sahoo, Apoorva Verma, Palavalli Shyam, Swapnil Malviya, Sarvesh Sarvesh, Raj Gadde
128
Towards Generalized Representations for Low-Light Understanding: When Signal Constancy Meets Semantic Enrichment PDF ↗
Yifan Li, Haofeng Huang, Wenhan Yang, Jiaying Liu
129
Synergistic Bleeding Region and Point Detection in Laparoscopic Surgical Videos PDF ↗
Jialun Pei, Zhangjun Zhou, Diandian Guo, Zhixi Li, Jing Qin, Bo Du, Pheng-Ann Heng
130
MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data- Efficient and Generalizable Medical Image Segmentation PDF ↗
Taha Koleilat, Hojat Asgariandehkordi, Omid Nejatimanzari, Berardino Barile, Yiming Xiao, Hassan Rivaz
131
AD-GBC: Anisotropic Granular-Ball Skip-Connection Refiner for UNet- Based Medical Image Segmentation PDF ↗
Xiya Shen, Qinglin Zhao, Li Feng
132
OSA: Echocardiography Video Segmentation via Orthogonalized State Update and Anatomical Prior-aware Feature Enhancement PDF ↗
Rui Wang, Huisi Wu, Jing Qin
133
VesMamba: 3D Pulmonary Vessel Segmentation from CT images via Mamba with Structural Perception and Scale-aware Filtering PDF ↗
Zhipeng Liu, Guilian Chen, Zheng Jiang, Huisi Wu, Jing Qin
134
SemiGDA: Generative Dual-distribution Alignment for Semi- Supervised Medical Image Segmentation PDF ↗
Kaiwen Huang, Yi Zhou, Yizhe Zhang, Jingxiong Li, Tao Zhou
135
Diffusion-Based Native Adversarial Synthesis for Enhanced Medical Segmentation Generalization PDF ↗
Hongyu Zhang, Haipeng Chen, Zhimin Xu, Chengxin Yang, Yingda Lyu
136
CG-Reasoner: Centroid-Guided Positional Reasoning Segmentation for Medical Imaging with a Robust Visual-Text Consistency Metric PDF ↗
Lakshmikar Reddy Polamreddy, Ming Ma
137
Instruction-Guided Lesion Segmentation for Chest X-rays with Automatically Generated Large-Scale Dataset PDF ↗
Geon Choi, Hangyul Yoon, Hyunju Shin, Hyunki Park, Sang Hoon Seo, Eunho Yang, Edward Choi
138
Towards Highly Transferable Vision-Language Attack via Semantic- Augmented Dynamic Contrastive Interaction PDF ↗
Yuanbo Li, Tianyang Xu, Cong Hu, Tao Zhou, Xiaojun Wu, Josef Kittler
139
Towards Human-Imperceptible Backdoor Attacks on Text-to-Image Diffusion Models PDF ↗
Yiming Wu, Chenghao Chen, Changkun Wu, Chong Fu, Biru Zhu, Zhenyu Wen, Zhen Hong
140
TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models PDF ↗
Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li
141
DualMirage: Hunting Stealthy Multimodal LLM Agents via CAPTCHAs with Contour and Adversarial Illusions PDF ↗
Bei Chen, Gaolei Li, Jun Wu, Jianhua Li
142
Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints PDF ↗
Chenxi Li, Xianggan Liu, Dake Shen, Yaosong Du, Zhibo Yao, Hao Jiang, Linyi Jiang, Chengwei Cao, Jingzhe Zhang, RanYi Peng, Peiling Bai, Xiande Huang
143
Source Models Leak What They Shouldn’t: Unlearning Zero- Shot Transfer in Domain Adaptation Through Adversarial Optimization
Arnav Devalapally, Poornima Jain, Kartik Srinivas, Vineeth N. Balasubramanian
144
A Unified Perspective on Adversarial Membership Manipulation in Vision Models PDF ↗
Ruize Gao, Kaiwen Zhou, Yongqiang Chen, Feng Liu
145
Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack PDF ↗
Chenyang Li, Wenbing Tang, Yihao Huang, Sinong Simon Zhan, Ming Hu, Xiaojun Jia, Yang Liu
146
OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models PDF ↗
Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming
147
Beyond What's Shared: Recovering Lost Unique Information from Intermediate Layers to Boost Multimodal Geo-Foundation Models PDF ↗
JangHyeon Lee, Philipe Ambrozio Dias, Yao-Yi Chiang, Dalton Lunga
148
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition PDF ↗
Shan Ning, Longtian Qiu, Jiaxuan Sun, Xuming He
149
CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning PDF ↗
Chunlei Meng, Guanhong Huang, Rong Fu, Runmin Jian, Zhongxue Gan, Chun Ouyang
150
Learning Anchor in Dual Orthogonal Space for Fast Multi-view Clustering PDF ↗
Yalan Qin, Hanzhou Wu
151
Bootstrapping Multi-view Learning for Test-time Noisy Correspondence PDF ↗
Changhao He, Di Xue, Shuxian Li, Yanji Hao, Xi Peng, Peng Hu
152
Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification PDF ↗
Qihao Liu, Chengzhi Mao, Yaojie Liu, Alan Yuille, Wen-Sheng Chu
153
FAVE: A Structured Benchmark for Fine-Grained Audio-Visual Temporal Evaluation in Multimodal LLMs PDF ↗
Weiheng Lu, An Yu, Jian Li, Zhenfei Zhang, Felix X.-F. Ye, Ming-Ching Chang
154
Omni2Sound: Towards Unified Video-Text-to-Audio Generation PDF ↗
Yusheng Dai, Zehua Chen, Yuxuan Jiang, Qiuhong Ke, Jianfei Cai, Jun Zhu
155
EmoThinker: Advancing Visual-Acoustic Emotion Analysis via Structural Token Selection and Chain-of-Thought Reasoning PDF ↗
Qinfu Xu, Liyuan Pan, Yiwei Wei, Shaozu Yuan, Jiaqi Chen, Tianyu Liu
156
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception PDF ↗
Yanpeng Sun, Jing Hao, Ke Zhu, Jiang-Jiang Liu, Xiaofan Li, Na Zhao, Zechao Li, Jingdong Wang
157
DiG: Differential Grounding for Enhancing Fine-Grained Perception in Multimodal Large Language Models PDF ↗
Zhou Tao, Shida Wang, YongXiang Hua, Haoyu Cao, Linli Xu
158
Vision-Speech Models: Teaching Speech Models to Converse about Images PDF ↗
Amélie Royer, Moritz Böhle, Laurent Mazaré, Neil Zeghidour, Alexandre Défossez, Patrick Pérez
159
EMMA: Extracting Multiple physical parameters from Multimodal Data PDF ↗
Farhat Shaikh, Ayan Banerjee, Sandeep Gupta
160
MMGait: Towards Multi-Modal Gait Recognition PDF ↗
Chenye Wang, Qingyuan Cai, Saihui Hou, Aoqi Li, Yongzhen Huang
161
OSMO: Open-vocabulary Self-eMOtion Tracking PDF ↗
Mohamed Abdelfattah, Bugra Tekin, Fadime Sener, Necati Cihan Camgoz, Eric Sauser, Shugao Ma, Alexandre Alahi, Edoardo Remelli
162
MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model PDF ↗
Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han
163
Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video PDF ↗
Chanhyuk Choi, Taesoo Kim, Donggyu Lee, Siyeol Jung, Taehwan Kim
164
Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models PDF ↗
Hengzhuang Li, Xinsong Zhang, Qiming Peng, Bin Luo, Han Hu, Dengyang Jiang, Han-Jia Ye, Teng Zhang, Hai Jin
165
Active Perceptual Inference: A Corticothalamic-Inspired Dynamic Nested Recurrent Network for Multimodal Sentiment Analysis with Incomplete Data PDF ↗
Yujuan Zhang, Qing Li, Ziyu Li, Xiuxing Li, Zhuo Wang, Mengrui Xu, Xia Wu
166
Scalable Trajectory Generation for Whole-Body Mobile Manipulation PDF ↗
Yida Niu, Xinhai Chang, Xin Liu, Ziyuan Jiao, Yixin Zhu
167
Breaking the 3D Dataset Bottleneck: Fast Scalable Generation of Aligned 3D Assets from Scratch for Category 6D Pose Estimation and Robotic Grasping PDF ↗
Duret Guillaume, Danylo Mazurak, Florence Zara, Jan Peters, Liming Chen
168
Real-Time Multimodal Fingertip Contact Detection via Depth and Motion Fusion for Vision-Based Human–Computer Interaction PDF ↗
Mukhiddin Toshpulatov, Wookey Lee, Suan Lee, Geehyuk Lee
169
Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves PDF ↗
Xinyu Zhang, Ziyi Kou, Chuan Qin, Mia Huang, Ergys Ristani, Ankit Kumar, Lele Chen, Kun He, Abdeslam Boularias, Li Guan
170
UniDex: A Robot Foundation Suite for Universal Dexterous Hand Control from Egocentric Human Videos PDF ↗
Gu Zhang, Qicheng Xu, Haozhe Zhang, Jianhan Ma, Long He, Yiming Bao, Zeyu Ping, Zhecheng Yuan, Chenhao Lu, Chengbo Yuan, Tianhai Liang, Xiaoyu Tian, Maanping Shao, Feihong Zhang, Mingyu Ding, Yang Gao, Hao Zhao, Hang Zhao, Huazhe Xu
171
ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation PDF ↗
Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu
172
DiverseGRPO: Mitigating Mode Collapse in Image Generation via Diversity-Aware GRPO PDF ↗
Henglin Liu, Huijuan Huang, Jing Wang, Chang Liu, Xiu Li, Xiangyang Ji
173
VAR RL Done Right: Tackling Asynchronous Policy Conflicts in Visual Autoregressive Generation PDF ↗
Shikun Sun, Liao Qu, Huichao Zhang, Yiheng Liu, Yangyang Song, Xian Li, Yi Jiang, Xu Wang, Jia Jia, Daniel K. Du, Xinglong Wu
174
Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner PDF ↗
Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Di Lin
175
MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-On PDF ↗
Xiaoyu Han, Chenyang Wang, Jing Wang, Shunyuan Zheng, Quanling Meng, Shengping Zhang
176
Scaling Multi-Identity Consistency for Image Customization via Multi-to-Multi Matching Paradigm PDF ↗
Yufeng Cheng, Wenxu Wu, Shaojin Wu, Mengqi Huang, Fei Ding, Qian He
177
NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing PDF ↗
Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si
178
Functional Mean Flow in Hilbert Space PDF ↗
Zhiqi Li, Yuchen Sun, Greg Turk, Bo Zhu
179
Benchmarking Single-Factor Physical Video-to-Audio Generation PDF ↗
Tingle Li, Siddharth Gururani, Kevin J. Shih, Gantavya Bhatt, Sang-gil Lee, Zhifeng Kong, Arushi Goel, Gopala Anumanchipalli, Ming-Yu Liu
180
UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions PDF ↗
Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang
181
Refaçade: Editing Object with Given Reference Texture
Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Jianan Wang, Rong Xiao
182
Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction PDF ↗
Jiahao Tian, Chenxi Song, Wei Cheng, Chi Zhang
183
Not All Birds Look The Same: Identity-Preserving Generation For Birds PDF ↗
Aaron Sun, Oindrila Saha, Subhransu Maji
184
HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images PDF ↗
Yichen Liu, Donghao Zhou, Jie Wang, Xin Gao, Guisheng Liu, Jiatong Li, Quanwei Zhang, Qiang Lyu, Lanqing Guo, Shilei Wen, Weiqiang Wang, Pheng-Ann Heng
185
EffectErase: Joint Video Object Removal and Insertion for High-
Quality Effect Erasing, Yang Fu, Yike Zheng, Ziyun Dai, Henghui Ding
186
Clothe and Pose PDF ↗
Nakul Sharma, Aayush Bansal, Minh Vo
187
FlowPortal: Residual-Corrected Flow for Training-Free Video Relighting and Background Replacement PDF ↗
Wenshuo Gao, Junyi Fan, Jiangyue Zeng, Shuai Yang
188
The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment PDF ↗
Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou
189
Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training PDF ↗
Peng Sun, Jun Xie, Tao Lin
190
VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations PDF ↗
Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv
191
Bidirectional Normalizing Flow: From Data to Noise and Back PDF ↗
Yiyang Lu, Qiao Sun, Xianbang Wang, Zhicheng Jiang, Hanhong Zhao, Kaiming He
192
ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions PDF ↗
Xiaoxue Wu, Xinyuan Chen, Yaohui Wang, Yu Qiao
193
Are Image-to-Video Models Good Zero-Shot Image Editors? PDF ↗
Zechuan Zhang, Zhenyuan Chen, Zongxin Yang, Yi Yang
194
FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters PDF ↗
Shitong Shao, Yufei Gu, Zeke Xie
195
Unified Latent Space for Understanding and Generation via Semantic Auto-encoder PDF ↗
Xiaojie Li, Yang Zhao, Ming Li, Yancheng Zhang, Zonglin Lyu, Yunpeng Chen, Rui Wang, Daquan Zhou
196
AHS: Adaptive Head Synthesis via Synthetic Data Augmentations PDF ↗
Taewoong Kang, Hyojin Jang, Sohyun Jeong, Seunggi Moon, Gihwi Kim, Hoon Jin Jung, Jaegul Choo
197
CASR: A Robust Cyclic Framework for Arbitrary Large-Scale Super- Resolution with Distribution Alignment and Self-Similarity Awareness PDF ↗
Wenhao Guo, Zhaoran Zhao, Peng Lu, Sheng Li, Qian Qiao, RuiDe Li
198
Thermal Diffusion Matters: Infrared Spatial-Temporal Video Super-
Resolution through Heat Conduction Priors, Mingxuan Zhou, Shuang Li, Yutang Zhang, Jing Geng, Yirui Shen, Jingxuan Kang, Fuzhen Zhuang, Shuigen Wang
199
TextOVSR: Text-Guided Real-World Opera Video Super-Resolution PDF ↗
Hua Chang, Xin Xu, Wei Liu, Jiayi Wu, Kui Jiang, Fei Ma, Qi Tian
200
VoDaSuRe: A Large-Scale Dataset Revealing Domain Shift in Volumetric Super-Resolution PDF ↗
August Leander Høeg, Sophia Wiinberg Bardenfleth, Hans Martin Kjer, Tim Bjørn Dyrby, Vedrana Andersen Dahl, Anders Bjorholm Dahl
201
GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution PDF ↗
Qiaosi Yi, Shuai Li, Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Lei Zhang
202
Adaptive Anisotropic Gaussian Splatting for Multi-contrast MRI Arbitrary-Scale Super-Resolution with Anatomy Guidance PDF ↗
Qiuhai Yan, Kang Chen, Zhengjie Lu, Tingting Wang, Faming Fang, Guixu Zhang
203
SignPR: A Progressive Vector-Quantized Diffusion Framework for Sign Language Production PDF ↗
Xiao Liu, Shiwei Gan, Yafeng Yin, Bowen Guo, Zhiwei Jiang, Shunmei Meng, Lei Xie, Sanglu Lu
204
LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens PDF ↗
Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, Abhay Mittal
205
FlashCap: Millisecond-Accurate Human Motion Capture via Flashing LEDs and Event-Based Vision PDF ↗
Zekai Wu, Shuqi Fan, Mengyin Liu, Yuhua Luo, Xincheng Lin, Ming Yan, Junhao Wu, Xiuhong Lin, Yuexin Ma, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang
206
Geometric Neural Distance Fields for Learning Human Motion Priors PDF ↗
Zhengdi Yu, Simone Foti, Linguang Zhang, g921@gmail.com Meta Reality Labs, Amy Zhao, Cem Keskin, Stefanos Zafeiriou, Tolga Birdal
207
3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation PDF ↗
Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, Kun Gai
208
Decoupled Generative Modeling for Human-Object Interaction Synthesis PDF ↗
Hwanhee Jung, Seunggwan Lee, Jeongyoon Yoon, SeungHyeon Kim, Giljoo Nam, Qixing Huang, Sangpil Kim
209
LiveGesture: Streamable Co-Speech Gesture Generation Model PDF ↗
Muhammad Usama Saleem, Mayur Jagdishbhai Patel, Ekkasit Pinyoanuntapong, Zhongxing Qin, Li Yang, Hongfei Xue, Ahmed Helmy, Chen Chen, Pu Wang
210
HandX: Scaling Bimanual Motion and Interaction Generation PDF ↗
Zimu Zhang, Yucheng Zhang, Xiyan Xu, Ziyin Wang, Sirui Xu, Kai Zhou, Bing Zhou, Chuan Guo, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui
211
MaskAdapt: Learning Flexible Motion Adaptation via Mask-Invariant Prior for Physics-Based Characters PDF ↗
Soomin Park, Eunseong Lee, Kwang Bin Lee, Sung-Hee Lee
212
FloodDiffusion: Tailored Diffusion Forcing for Streaming Motion Generation PDF ↗
Yiyi Cai, Yuhan Wu, Kunhang Li, You Zhou, Bo Zheng, Haiyang Liu
213
ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control PDF ↗
Akihisa Watanabe, Qing Yu, Edgar Simo- Serra, Kent Fujiwara
214
Correspondence-Attention Alignment for Multi-View Diffusion Models PDF ↗
Minkyung Kwon, Jinhyeok Choi, Jiho Park, Seonghu Jeon, Jinhyuk Jang, Junyoung Seo, Minseop Kwak, Jin-Hwa Kim, Seungryong Kim
215
GenErase: Generalizable and Semantically-Aware Concept Erasure in Diffusion Models PDF ↗
Korada Sri Vardhana, Soma Biswas
216
MatMart: Material Reconstruction of 3D Objects via Diffusion PDF ↗
Xiuchao Wu, Pengfei Zhu, Jiangjing Lyu, Xinguo Liu, Jie Guo, Yanwen Guo, Weiwei Xu, Chengfei Lyu
217
Region-Adaptive Sampling for Diffusion Transformers PDF ↗
Ziming Liu, Yifan Yang, Chengruidong Zhang, Yiqi Zhang, Lili Qiu, Yang You, Yuqing Yang
218
Diffusion Guided Chain-of-Vision for Large Autoregressive Vision Models PDF ↗
Xinyang Wang, Kecheng Zheng, Minfeng Zhu, Wei Wu, Fan Lu, Wei Zhai, Wei Chen
219
Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation PDF ↗
Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Xilin Zhao, Qingming Huang
220
ConceptPrism: Concept Disentanglement in Personalized Diffusion Models via Residual Token Optimization PDF ↗
Minseo Kim, Minchan Kwon, Dongyeun Lee, Yunho Jeon, Junmo Kim
221
Heterogeneous Decentralized Diffusion Models PDF ↗
Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy
222
Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning PDF ↗
Ziyi Zhang, Li Shen, Deheng Ye, Yong Luo, Huangxuan Zhao, Meng Liu, Wei Yu, Lefei Zhang
223
GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation PDF ↗
Rang Li, Lei Li, Shuhuai Ren, Hao Tian, Shuhao Gu, Shicheng Li, Zihao Yue, Yudong Wang, Wenhan Ma, Zhe Yang, Jingyuan Ma, Zhifang Sui, Fuli Luo
224
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding PDF ↗
Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu
225
Nonparametric Deep Fine-grained Clustering with Low-Rank Guided Vision-Language Model PDF ↗
Xulun Ye, Benyu Wu, Jie Hong, Kun Zhou
226
RealBirdID: Benchmarking Bird Species Identification in the Era of MLLMs PDF ↗
Logan Lawrence, Oindrila Saha, Rangel Daroya, Mustafa Chasmai, Wuao Liu, Max Hamilton, Aaron Sun, Seoyun Jeong, Fabien Delattre, Subhransu Maji, Grant Van Horn
227
Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction PDF ↗
Ruihong Yin, Xuepeng Shi, Oleksandr Bailo, Marco Manfredi, Theo Gevers
228
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion- Parameter Vision-Language Models on OCR Tasks PDF ↗
Cheng Cui, Yubo Zhang, Ting Sun, Xueqing Wang, Hongen Liu, Manhui Lin, Yue Zhang, Tingquan Gao, Changda Zhou, Jiaxuan Liu, Zelun Zhang, Jing Zhang, Jun Zhang, Yi Liu
229
World in a Frame: Understanding Culture Mixing as a New Challenge for Vision-Language Models PDF ↗
Eunsu Kim, Junyeong Park, Na Min An, Junseong Kim, Hitesh Laxmichand Patel, Jiho Jin, Julia Kruk, Amit Agarwal, Srikant Panda, Fenal Ashokbhai Ilasariya, Hyunjung Shim, Alice Oh
230
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis PDF ↗
Yuanzhe Li, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Sheng Lu
231
HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision- Language Models PDF ↗
Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, ZhiYuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang
232
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models PDF ↗
MD Khalequzzaman Chowdhury Sayem, Mubarrat Tajoar Chowdhury, Yihalem Yimolal Tiruneh, Muneeb A. Khan, Muhammad Salman Ali, Binod Bhattarai, Seungryul Baek
233
Probing and Bridging Geometry–Interaction Cues for Affordance Reasoning in Vision Foundation Models PDF ↗
Qing Zhang, Xuesong Li, Jing Zhang
234
ARC Is a Vision Problem! PDF ↗
Keya Hu, Ali Cy, Linlu Qiu, Xiaoman Delores Ding, Runqian Wang, Yeyin Eva Zhu, Jacob Andreas, Kaiming He
235
Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions PDF ↗
Jingxuan Wei, Caijun Jia, Qi Chen, Honghao He, Linzhuang Sun, Conghui He, Lijun Wu, Bihui Yu, Cheng Tan
236
S^2-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance PDF ↗
Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang
237
Learning Multi-View Spatial Reasoning from Cross-View Relations PDF ↗
Suchae Jeong, Jaehwi Song, Haeone Lee, Hanna Kim, Jian Kim, Dongjun Lee, Dong Kyu Shin, Changyeon Kim, Dongyoon Hahm, Woogyeol Jin, Juheon Choi, Kimin Lee
238
Exploring Spatial Intelligence from a Generative Perspective PDF ↗
Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen
239
Physical Object Understanding with a Physically Controllable World Model PDF ↗
Rahul Venkatesh, Klemen Kotar, Lilian Naing Chen, Wanhee Lee, Gia Ancone, Seungwoo Kim, Luca Thomas Wheeler, Jared Watrous, Honglin Chen, Daniel Bear, Stefan Stojanov, Daniel LK Yamins
240
QueryMe: Query-Driven Open-Vocabulary 3D Object Affordances Grounding from Multimodal Evidence PDF ↗
Weiyu Zhao, Ru Li, Jiaqi Liu, Sizhe Zhao, Qinglin Liu, Shengping Zhang
241
Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views PDF ↗
Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang
242
EG-3DVG: Expression and Geometry Aware Grounding Decoder for 3D Visual Grounding PDF ↗
GwangWook Park, Hyo-Jun Lee, Jong-Hyeon Baek, Hanul Kim, Yeong Jun Koh
243
AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers PDF ↗
Nghia Vu, Tuong Do, Khang Nguyen, Baoru Huang, Nhat Le, Binh Xuan Nguyen, Erman Tjiputra, Quang D. Tran, Ravi Prakash, Te-Chuan Chiu, Anh Nguyen
244
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models PDF ↗
Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Zhu Hao, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song
245
Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval PDF ↗
Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li
246
Intra-class Distribution-guided Generative Hashing with Neighbor Refinement for Cross-modal Retrieval PDF ↗
Hao Sun, Yadong Huo, Qibing Qin, Wenfeng Zhang, Lei Huangs
247
Language-driven Fine-grained Retrieval PDF ↗
Shijie Wang, Xin Yu, Yadan Luo, Zijian Wang, Pengfei Zhang, Zi Huang
248
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding PDF ↗
Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang
249
RetFormer: Multimodal Retrieval for Enhancing Image Recognition PDF ↗
Tianrui Yu, Xiubo Liang, Hongzhi Wang
250
DREAM: Document Recognition with Explicit Adaptive Memory PDF ↗
Tianqi Zhao, Di Wu, Liangrui Peng, Yifan Huang, Kemeng Zhao, Shuo Li, Zhiyu Li, Yizhu Wang, Borui Jiang, Yuyang Li
251
RMIR: A Benchmark Dataset for Reasoning-Intensive Multimodal Image Retrieval PDF ↗
Yijiang Li, Kunal Kotian, Ali Marjaninejad, Meir Friedenberg, Kaushik Pavani, Sunny Dasgupta
252
POGA: Paraphrased and Oppositional Graph Alignment for Fine-Grained Cross-Modal Retrieval PDF ↗
Junfeng Zhang, Zhe Xue, Yuankai Qi, Junping Du, Xiangyang Kong, Yishuo Yan, Amin Beheshti, Jian Yang, Anton van den Hengel, Ming-Hsuan Yang
253
Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning PDF ↗
Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg
254
TempR1: Improving Temporal Understanding of MLLMs via Temporal- Aware Multi-Task Reinforcement Learning PDF ↗
Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang
255
RiskProp: Collision-Anchored Self-Supervised Risk Propagation For Early Accident Anticipation PDF ↗
Yiyang Zou, Tianhao Zhao, Peilun Xiao, Hongyu Jin, Longyu Qi, Yuxuan Li, Liyin Liang, Yifeng Qian, Chunbo Lai, Yutian Lin, Zhihui Li, Yu Wu
256
MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models PDF ↗
Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen
257
MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding PDF ↗
Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu
258
Asynchronous Temporal Modeling with Two-Agent Framework for Streaming Dense Video Captioning PDF ↗
Yolo Y. Tang, Chao Huang, Susan Liang, Jing Bi, Yicheng Wang, Daiki Shimada, Chenliang Xu
259
TRCoRSurg: Temporal-Relational Co-Reasoning for Surgical Video Triplet Recognition PDF ↗
Fang Li, Shihao Zou, Weixin Si, Yang Gao, Shuai Li, Aimin Hao
260
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning PDF ↗
Zhijia Liang, Jiaming Li, Weikai Chen, Yanhao Zhang, Haonan Lu, Guanbin Li
261
One-Shot Flow, Any-Time Frame: A Bidirectional Warping Framework for Event-Based Video Frame Interpolation PDF ↗
Linghui Fu, Yuhan Liu, Hao Chen, Zhen Yang, Yongjian Deng
262
TF-CADE: Foreground-Concentrated Text-Video Alignment for Zero-Shot Temporal Action Detection PDF ↗
Yearang Lee, Ho-Joong Kim, Seong-Whan Lee
263
PRISM: Prototype-based Reasoning with Inter-modal Semantic Mining for Interpretable Image Recognition PDF ↗
Anni Yu, Yu-Bin Yan
264
Concept Regions Matter: Benchmarking CLIP with a New Cluster- Importance Approach PDF ↗
Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi
265
PhaseWin Search Framework Enable Efficient Object-Level Interpretation PDF ↗
Zihan Gu, Ruoyu Chen, Junchi Zhang, Yue Hu, Hua Zhang, Xiaochun Cao
266
Beyond Top Activations: Efficient and Reliable Crowdsourced Evaluation of Automated Interpretability PDF ↗
Tuomas Oikarinen, Ge Yan, Akshay Kulkarni, Tsui-Wei Weng
267
From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition PDF ↗
Francesco Gentile, Nicola Dall'Asen, Francesco Tonini, Massimiliano Mancini, Lorenzo Vaquero, Elisa Ricci
268
Hierarchical Concept Embedding & Pursuit for Interpretable Image Classification PDF ↗
Nghia Nguyen, Tianjiao Ding, René Vidal
269
Interpretable and Steerable Concept Bottleneck Sparse Autoencoders PDF ↗
Akshay Kulkarni, Tsui-Wei Weng, Vivek Narayanaswamy, Shusen Liu, Wesam A. Sakla, Kowshik Thopalli
270
C-LaV: Conditional Latent Velocity Field Denoising for Weather- Robust LiDAR Place Recognition PDF ↗
Xuewei Cao, Jiayue Yang, Zhiwen Zeng, Yanyong Zhang, Yan Xia
271
Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds PDF ↗
Bin Yang, Mohamed Abdelsamad, Miao Zhang, Alexandru Paul Condurache
272
Generalized-CVO: Fast and Correspondence-Free Local Point Cloud Registration with Second Order Riemannian Optimization PDF ↗
Ray Zhang, Marcus Greiff, Thomas Lew, John Subosits
273
LiDeRe: A Lightweight Readout for Fast and Data-Efficient Dense Prediction PDF ↗
Timo Lüddecke, Jan Frederik Meier, Jan van Delden, Alexander Ecker
274
AnyPcc: Compressing Any Point Cloud with a Single Universal Model PDF ↗
Kangli Wang, Qianxi Yi, Yuqi Ye, Shihao Li, Wei Gao
275
CoLC: Communication-Efficient Collaborative Perception with LiDAR Completion PDF ↗
Yushan Han, Hui Zhang, Qiming Xia, Yi Jin, Yidong Li
276
Spectral-Geometric Neural Fields for Pose-Free LiDAR View Synthesis PDF ↗
Yinuo Jiang, Jun Cheng, Yiran Wang, Cheng Cheng
277
C-GenReg: Training-Free 3D Point Cloud Registration by Multi-View-Consistent Geometry-to-Image Generation with Probabilistic Modalities Fusion PDF ↗
Yuval Haitman, Amit Efraim, Joseph M. Francos
278
PatchAlign3D: Local Feature Alignment for Dense 3D Shape Understanding PDF ↗
Souhail Hadgi, Bingchen Gong, Ramana Sundararaman, Emery Pierson, Lei Li, Peter Wonka, Maks Ovsjanikov
279
FoV-Net: Rotation-Invariant CAD B-rep Learning via Field-of-View Ray Casting PDF ↗
Matteo Ballegeer, Dries F. Benoit
280
Neural Distribution Prior for LiDAR Out-of-Distribution Detection PDF ↗
Zizhao Li, Zhengkang Xiang, Jiayang Ao, Feng Liu, Joseph West, Kourosh Khoshelham
281
DENALI: A Dataset Enabling Non-Line-of-Sight Spatial Reasoning with Low-Cost LiDARs PDF ↗
Nikhil Behari, Diego Rivero, Luke Apostolides, Suman Ghosh, Paul Pu Liang, Ramesh Raskar
282
Concept-Aware Batch Sampling Improves Language-Image Pretraining PDF ↗
Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge
283
HiFICL: High-Fidelity In-Context Learning for Multimodal Tasks PDF ↗
Xiaoyu Li, Yuhang Liu, Xuanshuo Kang, Zheng Luo, Fangqi Lou, Xiaohua Wu, Zihan Xiong
284
InstAP: Instance-Aware Vision-Language Pre-Train for Spatial- Temporal Understanding PDF ↗
Ashutosh Kumar, Rajat Saini, Jingjing Pan, Mustafa Erdogan, Mingfang Zhang, Betty Le Dem, Norimasa Kobori, Quan Kong
285
Vocabulary Scaling Law: Tuning Open-vocabulary Predictors for Their Openness PDF ↗
Ziliang Chen, Yulu Li, Liangda Fang, Jusheng Zhang, Yongsen Zheng, Quanlong Guan, Xipeng Chen
286
Render-to-Adapt: Unsupervised Personal Adaptation for Gaze Estimation PDF ↗
Yangshi Ge, Zheng Liu, Feng Lu
287
ViTPrompt: Training-Free Prompt Refinement with Visual Tokens for Open-Vocabulary Detection PDF ↗
Yitong Qin, Lihua Zhou, Jiwei Wei, Ran Ran, Shiyuan He, Zeyu Ma, Shuaifeng Li, Nianxin Li, Heng Tao Shen
288
Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models PDF ↗
Boyang Guo, Liang Li, Lin Peng, Yuhan Gao, Xichun Sheng, Chenggang Yan
289
LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models PDF ↗
Soumyaratna Debnath, Bui Duc Manh, Zinan Liu, Lin Wang
290
Dynamic Logits Adjustment and Exploration for Test-Time Adaptation in Vision Language Models PDF ↗
Haoyan Wu, Yahao Liu, Yinjie Lei, Lixin Duan, Wen Li
291
CAPT: Confusion-Aware Prompt Tuning for Reducing Vision-Language Misalignment PDF ↗
Maoyuan Shao, Yutong Gao, Xinyang Huang, Lijuan Sun, Guoshun Nan, Chuang Zhu
292
GenMatter: Perceiving Physical Objects with Generative Matter Models PDF ↗
Eric Li, Arijit Dasgupta, Yoni Friedman, Mathieu Huot, Vikash Mansinghka, Thomas O'Connell, William T. Freeman, Joshua B. Tenenbaum
293
Bidirectional Query-Driven Generation of Parametric CAD Sketch PDF ↗
Yang Liu, Daxuan Ren, Yijie Ding, Jianmin Zheng, Fang Deng
294
The Missing GAP: From Solving Square Jigsaw Puzzles to Handling Real World Archaeological Fragments PDF ↗
Ofir Itzhak Shahar, Gur Elkin, Ohad Ben-Shahar
295
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation PDF ↗
Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao
296
OmniDocLayout: Towards Diverse Document Layout Generation via Coarse-to-Fine LLM Learning PDF ↗
Hengrui Kang, Zhuangcheng Gu, Zhiyuan Zhao, Zichen Wen, Bin Wang, Weijia Li, Conghui He
297
Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion PDF ↗
Keyang Lu, Sifan Zhou, Hongbin Xu, Gang Xu, Zhifei Yang, Yikai Wang, Zhen Xiao, Jieyi Long, Ming Li
298
Repurposing 3D Generative Model for Autoregressive Layout Generation PDF ↗
Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Chunchao Guo, Yuxin Peng, Lu Sheng
299
CAD-Refiner: A Unified Framework for CAD Generation and Iterative Editing PDF ↗
Meng Yuan, Dawei Lin, Hongxia Xie, Tieru Wu, Rui Ma
300
A Debiased Reconstruction-based Framework for Training-
Free Detection of AI-Generated Images, Sungik Choi, Hankook Lee, Jaehoon Lee, Robin Kim, Stanley Jungkyu Choi, Moontae Lee
301
Global Information Thresholding for Sufficient and Necessary Circuits PDF ↗
Jegyeong Cho
302
PrivateEyes: Gaze-Preserving Anonymization for Data Sharing PDF ↗
Surabhi Gupta, Dinesh Prabhu Muthumariappan, Biplab Das, Anoop Kolar Rajagopal, Kiran Nanjunda Iyer, Donghwan Seo
303
From Measurement to Mitigation: Quantifying and Reducing Identity Leakage in Image Representation Encoders with Linear Subspace Removal PDF ↗
Daniel George, Charles Yeh, Daniel Lee, Yifei Zhang
304
Bias In, Bias Out? Finding Unbiased Subnetworks in Vanilla Models PDF ↗
Ivan Luiz De Moura Matos, Abdel Djalil Sad Saoud, Ekaterina Iakovleva, Vito Paolo Pastore, Enzo Tartaglione
305
pH-Strips for Selective Forgetting: A Blunt but Fast Diagnostic Baseline for Machine Unlearning PDF ↗
Chengyao Qian, Jing Wu, Trung Le, Dinh Phung, Mehrtash Harandi
306
Decoupling Defense Strategies for Robust Image Watermarking PDF ↗
Jiahui Chen, Zehang Deng, Zeyu Zhang, Chaoyang Li, Lianchen Jia, Lifeng Sun
307
Unsafe2Safe: Controllable Image Anonymization for Downstream Utility PDF ↗
Minh Dinh, SouYoung Jin
308
Rel-Zero: Harnessing Patch-Pair Invariance for Robust Zero- Watermarking Against AI Editing PDF ↗
Pengzhen Chen, Yanwei Liu, Xiaoyan Gu, Xiaojun Chen, Wu Liu, Weiping Wang
309
Computation and Communication Efficient Federated Unlearning via On-server Gradient Conflict Mitigation and Expression PDF ↗
Minh- Duong Nguyen, Senura Wanasekara, Le-Tuan Nguyen, Quoc-Viet Pham, Ken-Tye Yong, Nguyen H. Tran, Dung D. Le
310
DP-FedAdamW: An Efficient Optimizer for Differentially Private Federated Large Models PDF ↗
Jin Liu, Ning Xi, Yinbin Miao, Junkang Liu
311
Submodel Extraction for Efficient and Personalized Federated Learning via Optimal Transport PDF ↗
Zheng Jiang, Nan He, Yiming Chen, Lifeng Sun
312
FedSDR: Federated Graph Learning with Structural Noise Detection and Reconstruction PDF ↗
Jiaqi Liu, Zihan Tan, Guancheng Wan, Wenke Huang, He Li, Mang Ye
313
FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shift PDF ↗
Huy Q. Le, Loc X. Nguyen, Yu Qiao, Seong Tae Kim, Eui-Nam Huh, Choong Seon Hong
314
FedAFD: Multimodal Federated Learning via Adversarial Fusion and Distillation PDF ↗
Min Tan, Junchao Ma, Yinfu Feng, Jiajun Ding, Wenwen Pan, Tingting Han, Qian Zheng, Zhenzhong Kuang, Zhou Yu
315
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation PDF ↗
Jihwan Hong, Jaeyoung Do
316
AXG-Reasoner: Error Detection and Explanation in Long Task Videos with Vision–Language Models PDF ↗
Shih-Po Lee, Ehsan Elhamifar
317
Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning PDF ↗
Seung Hyup Baek, Jimin Lee, Hyeongkeun Lee, Jae Won Cho
318
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding PDF ↗
Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long
319
HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics PDF ↗
Masatoshi Tateno, Gido Kato, Hirokatsu Kataoka, Yoichi Sato, Takuma Yagi
320
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning PDF ↗
Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim
321
Token Warping Helps MLLMs Look from Nearby Viewpoints PDF ↗
Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung
322
Variation-aware Vision Token Dropping for Faster Large Vision- Language Models PDF ↗
Junjie Chen, Xuyang Liu, Zichen Wen, Yiyu Wang, Siteng Huang, Honggang Chen
323
Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradients PDF ↗
Ziwei Xiang, Fanhu Zeng, Hongjian Fang, Rui-Qi Wang, Renxing Chen, Yanan Zhu, Yi Chen, Peipei Yang, Xu-Yao Zhang
324
Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding PDF ↗
Yuchen Feng, Zhenyu Zhang, Naibin Gu, Yilong Chen, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang
325
IF-Prune: Information-Flow Guided Token Pruning for Efficient Vision- Language Models PDF ↗
Guohao Sun, Yufei Wang, Sizhuo Ma, Yuege Xie, Yuting Cheng, Zhiqiang Tao, Jian Wang
326
EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling PDF ↗
Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na
327
DocPrune: Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning PDF ↗
Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim
328
QuietPrune: Query-Guided Early Token Pruning for Vision-Language Models PDF ↗
Tianxiao Gao, Shanwei Zhao, Shuo Fang, Shiai Zhu, Chenguang Ma
329
The Devil Is in Gradient Entanglement: Energy-Aware Gradient Coordinator for Robust Generalized Category Discovery PDF ↗
Haiyang Zheng, Nan Pu, Yaqi Cai, Teng Long, Wenjing Li, Nicu Sebe, Zhun Zhong
330
LLM-Guided Probabilistic Fusion for Label-Efficient Document Layout Analysis PDF ↗
Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma
331
Coordinate Denoising for Non-Equilibrium Molecular Representation Learning PDF ↗
Qianwei Tang, Baile Xu, Jian Zhao, Furao Shen
332
Plug-and-Play Incomplete Multi-View Clustering via Janus-Faced Affinity Learning with Topology Harmonization PDF ↗
Shengju Yu, Suyuan Liu, Wenhao Shao, Siwei Wang, Ke Liang, Xihong Yang, Tiejun Li, Xinwang Liu
333
Meta-Learning In-Context Enables Training-Free Cross Subject Brain Decoding PDF ↗
Mu Nan, Muquan Yu, Weijian Mai, Jacob S. Prince, Hossein Adeli, Rui Zhang, Jiahang Cao, Benjamin Becker, John A. Pyles, Margaret M. Henderson, Chunfeng Song, Nikolaus Kriegeskorte, Michael J. Tarr, Xiaoqing Hu, Andrew F. Luo
334
Measure The Feature Universe: Topology-based Pseudo Labeling and Gravity Consistency for Source-Free Domain Adaptation PDF ↗
Jae Yun Lee, Hyeok Nam, Sung In Cho
335
Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling PDF ↗
Kai Ye, Qingtao Pan, Shuo Li
336
Harnessing the Power of Foundation Models for Accurate Material Classification PDF ↗
Qingran Lin, Fengwei Yang, Chaolun Zhu
337
Content-Aware Frequency Encoding for Implicit Neural Representations with Fourier-Chebyshev Features PDF ↗
Junbo Ke, Yangyang Xu, Chao Wang, You-Wei Wen
338
ActiveAD: Planning-Oriented Active Learning for End-to-End Autonomous Driving PDF ↗
Han Lu, Xiaosong Jia, Yichen Xie, Siyu Sun, Wenlong Liao, Xiaokang Yang, Junchi Yan
339
TeFlow: Enabling Multi-frame Supervision for Self-Supervised Feed-forward Scene Flow Estimation PDF ↗
Qingwen Zhang, Chenhan Jiang, Xiaomeng Zhu, Yunqi Miao, Yushan Zhang, Olov Andersson, Patric Jensfelt
340
Think Before You Drive: World Model-Inspired Multimodal Grounding PDF ↗
Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li
341
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning PDF ↗
Zhe Liu, Runhui Huang, Rui Yang, Siming Yan, Zining Wang, Lu Hou, Di Lin, Xiang Bai, Hengshuang Zhao
342
DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation PDF ↗
Zhechao Wang, Yiming Zeng, Lufan Ma, Zeqing Fu, Chen Bai, Dongshuo Yin, Ziyao Lin, Cheng Lu
343
WOD-E2E: Waymo Open Dataset for End-to-End Driving in Challenging Long-tail Scenarios PDF ↗
Runsheng Xu, Hubert Lin, Wonseok Jeon, Hao Feng, Yuliang Zou, Liting Sun, John Gorman, Kate Tolstaya, Sarah Tang, Brandyn White, Ben Sapp, Mingxing Tan, Jyh-Jing Hwang, Dragomir Anguelov
344
GuideFlow: Constraint-Guided Flow Matching for Planning in End-
to-End Autonomous Driving, Lin Liu, Caiyan Jia, Guanyi Yu, Ziying Song, Junqiao Li, Feiyang Jia, Peiliang Wu, Xiaoshuai Hao, Yadan Luo
345
ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving PDF ↗
Zhiyu Zheng, Shaoyu Chen, Haoran Yin, Xinbang Zhang, Jialv Zou, Xinggang Wang, Qian Zhang, Lefei Zhang
346
KnowVal: A Knowledge-Augmented and Value-Guided Autonomous Driving System PDF ↗
Zhongyu Xia, Wenhao Chen, Yongtao Wang, Ming-Hsuan Yang
347
FoSS: Modeling Long-Range Dependencies and Multimodal Uncertainty in Trajectory Prediction via Fourier–State Space Integration PDF ↗
Yizhou Huang, Genze Jiang, Yihua Cheng, Kezhi Wang
348
NexusFlow: Unifying Disparate Tasks under Partial Supervision via Invertible Flow Networks PDF ↗
Fangzhou Lin, Yuping Wang, Yuliang Guo, Zixun Huang, Xinyu Huang, Haichong Zhang, Kazunori Yamada, Zhengzhong Tu, Liu Ren, Ziming Zhang
349
Visual Prototype Conditioned Focal Region Generation for UAV- Based Object Detection PDF ↗
Wenhao Li, Zimeng Wu, Yu Wu, Zehua Fu, Jiaxin Chen
350
Consistent Instance Field for Dynamic Scene Understanding PDF ↗
Junyi Wu, Van Nguyen Nguyen, Benjamin Planche, Jiachen Tao, Changchang Sun, Zhongpai Gao, Zhenghao Zhao, Anwesa Choudhuri, Gengyu Zhang, Meng Zheng, Feiran Wang, Terrence Chen, Yan Yan, Ziyan Wu
351
CLP: A Real-World Dataset of Contaminated Lens Protectors for Robust Semantic Segmentation PDF ↗
Sungyong Park, Sooyoung Choi, Hyunsuh Koh, Youngjae Choi, Heewon Kim
352
ReSAM: Refine, Requery, and Reinforce: Self-Prompting Point- Supervised Segmentation for Remote Sensing Images PDF ↗
Muhammad Naseer Subhani
353
Heuristic Self-Paced Learning for Domain Adaptive Semantic Segmentation under Adverse Conditions PDF ↗
Shiqin Wang, Haoyang Chen, Huaizhou Huang, Yinkan He, Dongfang Sun, Xiaoqing Chen, Xingyu Liu, Zheng Wang, Kaiyan Zhao
354
SAM2Text: Towards Prompt-Free and Multi-Resolution Video Scene Text Segmentation PDF ↗
Jing-Yao Zhang, Heng Zhang, Mingsen Zhang, Binbin Yang, Fei Yin
355
Reinforcing Video Reasoning Segmentation to Think Before It Segments
Sitong Gong, Yunzhi Zhuge, Lu Zhang, Jiazuo Yu, Pingping Zhang, Xu Jia, Huchuan Lu
356
VideoMaMa: Mask-Guided Video Matting via Generative Prior PDF ↗
Sangbeom Lim, Seoung Wug Oh, Jiahui Huang, Heeji Yoon, Seungryong Kim, Joon-Young Lee
357
Quantized Residuals to Continuous Prompts for Few-Shot Class Incremental Learning in Vision-Language Models PDF ↗
Abhishek Kumar Sinha, Nitant Dube, Soma Biswas
358
The Golden Subspace: Where Efficiency Meets Generalization in Continual Test-Time Adaptation PDF ↗
Guannan Lai, Da-Wei Zhou, Zhenguo Li, Han-Jia Ye
359
SAIDO: Generalizable Detection of AI-Generated Images via Scene- Aware and Importance-Guided Dynamic Optimization in Continual Learning PDF ↗
Yongkang Hu, Yu Cheng, Yushuo Zhang, Yuan Xie, Zhaoxia Yin
360
Is Parameter Isolation Better for Prompt-Based Continual Learning? PDF ↗
Jiangyang Li, Chenhao Ding, SongLin Dong, Qiang Wang, Jianchao Zhao, Yuhang He, Yihong Gong
361
Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models PDF ↗
Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma
362
Affordance-First Decomposition for Continual Learning in Video– Language Understanding PDF ↗
Mengzhu xu, Hanzhi Liu, Ningkang Peng, Qianyu Chen, Canran Xiao
363
Quantum-Gated Task-interaction Knowledge Distillation for Pre-trained Model-based Class-Incremental Learning PDF ↗
Linjie Li, Huiyu Xiao, Jiarui Cao, Zhenyu Wu, Yang Ji
364
Elastic Weight Consolidation Done Right for Continual Learning PDF ↗
Xuan Liu, Xiaobin Chang
365
On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models PDF ↗
Chongyang Zhao, Mingsong Li, Haodong Lu, Dong Gong
366
Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation PDF ↗
Jiangning Zhang, Junwei Zhu, Zhenye Gan, Donghao Luo, Chuming Lin, FeiFan Xu, Xu Peng, Jianlong Hu, Yuansen Liu, Yijia Hong, Weijian Cao, Han Feng, Xu Chen, Chencan Fu, Keke He, Xiaobin Hu, Chengjie Wang
367
Talking Together: Synthesizing Co-Located 3D Conversations from Audio PDF ↗
Mengyi Shan, Shouchieh Chang, Ziqian Bai, Shichen Liu, Yinda Zhang, Luchuan Song, Rohit Pandey, Sean Fanello, Zeng Huang
368
InfinityHuman: Towards Long-Term Audio-Driven Human Animation PDF ↗
Xiaodi Li, Pan Xie, Yi Ren, Qijun Gan, Chen Zhang, Fangyuan Kong, Xiang Yin, Zehuan Yuan, Bingyue Peng
369
Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision PDF ↗
Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo
370
AudioAvatar: Personalized Audio-driven Whole-body Talking Avatars PDF ↗
Seungeun Lee, SeungJun Moon, Hah Min Lew, Ji-Su Kang, Gyeong-Moon Park
371
One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer PDF ↗
Shijun Shi, Jing Xu, Zhihang Li, Chunli Peng, Xiaoda Yang, Lijing Lu, Kai Hu, Jiangning Zhang
372
Counterfactual VLA: Self-Reflective Vision-Language-Action Model with Adaptive Reasoning PDF ↗
Zhenghao Peng, Wenhao Ding, Yurong You, Yuxiao Chen, Wenjie Luo, Thomas Tian, Yulong Cao, Apoorva Sharma, Danfei Xu, Boris Ivanovic, Boyi Li, Yan Wang, Marco Pavone
373
SGDrive: Scene-to-Goal Hierarchical World Cognition for Autonomous Driving PDF ↗
Jingyu Li, Junjie Wu, Dongnan Hu, Xiangkai Huang, Bin Sun, Zhihui Hao, Xianpeng Lang, Xiatian Zhu, Li Zhang
374
CapNav: Benchmarking Vision Language Models on Capability- conditioned Indoor Navigation PDF ↗
Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich
375
AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models PDF ↗
Teng Wang, Yanting Lu, Ruize Wang
376
AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation PDF ↗
Wenxuan Guo, Xiuwei Xu, Yichen Liu, Xiangyu Li, Hang Yin, Huangxing Chen, Wenzhao Zheng, Jianjiang Feng, Jie Zhou, Jiwen Lu
377
Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation PDF ↗
Shuo Wang, Yucheng Wang, Guoxin Lian, Yongcai Wang, Maiyue Chen, Kaihui Wang, Bo Zhang, Zhizhong Su, Yutian Zhou, Wanting Li, Deying Li, Zhaoxin Fan
378
Tavatar: Topology-Aware Gaussian Attribute Derivation for Animatable Human Avatars PDF ↗
Hailin Luo, Yifan Yang, Jiazhi Shu, Zixiong Huang, Qi Chen, Qing Du, Mingkui Tan
379
PercHead: Perceptual Head Model for Single-Image 3D Head Reconstruction & Editing PDF ↗
Antonio Oroz, Matthias Nießner, Tobias Kirschstein
380
PhysHead: Simulation-Ready Gaussian Head Avatars PDF ↗
Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll
381
ReWeaver: Towards Simulation-Ready and Topology-Accurate Garment Reconstruction PDF ↗
Ming Li, Hui Shan, Kai Zheng, Chentao Shen, Siyu Liu, Yanwei Fu, Zhen Chen, Xiangru Huang
382
FHAvatar: Fast and High-Fidelity Reconstruction of Face-and-Hair Composable 3D Head Avatar from Few Casual Captures PDF ↗
Yujie Sun, Zhuoqiang Cai, Chaoyue Niu, Jianchuan Chen, Zhiwen Chen, Chengfei Lv, Fan Wu
383
Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction PDF ↗
Yisheng He
384
Reallocating Attention Across Layers to Reduce Multimodal Hallucination PDF ↗
Haolang Lu, Bolun Chu, WeiYe Fu, Guoshun Nan, Junning Liu, Minghui Pan, Qiankun Li, Yi Yu, Hua Wang, Kun Wang
385
VES-RFT: Rewarding Visual Evidence Sensitivity to Mitigate Hallucinations in Large Vision–Language Models PDF ↗
Xuehe Hou, Wenshuo Li, Yali Li, Han Shu, Yuan Wang, Xinghao Chen, Shengjin Wang
386
Fighting Hallucinations with Counterfactuals: Diffusion-Guided Perturbations for LVLM Hallucination Suppression PDF ↗
Hamidreza Dastmalchi, Aijun An, Ali Cheraghian, Hamed Barzamini
387
Unstitching the Chimera: Frame-Level Risk and Train-Free Mitigation for Video Hallucination PDF ↗
Songyuan Yang, Guijian Tang, Kun Hu, Haotian Wang, Shixuan Liu, Wenjing Yang, Long Lan, Huibin Tan
388
CausalLens: Sensitivity-Guided Multi-Head Causal Intervention for Hallucination Mitigation in Large Vision-Language Models PDF ↗
Junyang Ji, Qifan Liu, Wenming Yang, Zhihai He
389
Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding PDF ↗
Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang
390
FlexTraj: Image-to-Video Generation with Flexible Point Trajectory Control PDF ↗
Zhiyuan Zhang, Can Wang, Dongdong Chen, Jing Liao
391
Diff4Splat: Repurposing Video Diffusion Models for Dynamic Scene Generation PDF ↗
Panwang Pan, Chenguo Lin, Chenxin Li, Jingjing Zhao, Yuchen Lin, Haopeng Li, Yunlong Lin, Kairun Wen, Yixuan Yuan, Yadong MU
392
Spatia: Video Generation with Updatable Spatial Memory PDF ↗
Jinjing Zhao, Fangyun Wei, Zhening Liu, Hongyang Zhang, Chang Xu, Yan Lu
393
Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context PDF ↗
JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu
394
EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses PDF ↗
Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall
395
CustomTex: High-fidelity Indoor Scene Texturing via Multi-Reference Customization PDF ↗
Weilin Chen, Jiahao Rao, Wenhao Wang, Xinyang Li, Xuan Cheng, Liujuan Cao
396
FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips PDF ↗
Mengtian Li, Kunyan Dai, Yi Ding, Ruobing Ni, Ying Zhang, Wenwu Wang, Zhifeng Xie
397
Physical Simulator In-the-Loop Video Generation PDF ↗
Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt
398
Refracting Reality: Generating Images with Realistic Transparent Objects PDF ↗
Yue Yin, Enze Tao, Dylan Campbell
399
Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos PDF ↗
Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan
400
EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation PDF ↗
Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang
401
Spatial-Frequency Collaborative Learning for Occluded Visible- Infrared Person Re-Identification PDF ↗
Jian Yu, Yujian Feng, Shuai You, Zhongkai Zhou, Fei Wu, Zhengjun Jing, Yimu Ji
402
Mind the Gap: Transferring Labels to Align Object Detection Datasets PDF ↗
Mikhail Kennerley, Angelica I. Aviles-Rivero, Carola-Bibiane Schönlieb, Robby T. Tan
403
SSM-Aware Token-Efficient VMamba via Adaptive Patch Pruning and Merging for Person Re-Identification PDF ↗
Huiyuan Huang, Sang Min Yoon
404
Tri-Modal Fusion Transformers for UAV-based Object Detection PDF ↗
Craig Iaboni, Pramod Abichandani
405
View-Aware Semantic Alignment for Aerial-Ground Person Re- Identification PDF ↗
Quan Zhang, Zeqiang Cai, Peiming Zhao, Jingze Wu, Cailun Wu, Hongbo Chen, Jianhuang Lai
406
RHCNet: Residual-Guided Hierarchical Calibration Network for Robust Underwater Object Detection PDF ↗
Yueying Wang, Yiteng Guo, Weidong Zhang, Jie Wen, Liquan Shen, Huaicheng Yan, Xin Xu
407
X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection PDF ↗
Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh
408
Beyond Duality: A Hybrid Framework of Leveraging Shared and Private Features for RGB-Event Object Detection PDF ↗
Keyao Wang, Shuai Liu, Hengda Shi, Lukui Shi, Haiyong Chen
409
FVBench: Benchmarking Deepfake Video Detection Capability of Large Multimodal Models PDF ↗
Jiarui Wang, Huiyu Duan, Juntong Wang, Xiongkuo Min
410
AKCMamba-YOLO: Selective State Space Models For Real-Time Object Detection PDF ↗
Long Chen, Hui Wang, Man Xu, Zexuan Li, Zizhu Fan
411
When AVSR Meets Video Conferencing: Dataset, Degradation, and the Hidden Mechanism Behind Performance Collapse PDF ↗
Yihuan Huang, Jun Xue, Liu Jiajun, Daixian Li, Tong Zhang, Zhuolin Yi, Yanzhen Ren, Kai Li
412
Your One-Stop Solution for AI-Generated Video Detection PDF ↗
Long Ma, Zihao Xue, Yan Wang, Zhiyuan Yan, Jin Xu, Xiaorui Jiang, Haiyang Yu, Yong Liao, Zhen Bi
413
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation PDF ↗
Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia
414
Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning PDF ↗
Yifei Li, Wenzhao Zheng, Yanran Zhang, Runze Sun, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu
415
HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks PDF ↗
Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen
416
HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering PDF ↗
Dan Ben Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin
417
Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark PDF ↗
Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li
418
Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model PDF ↗
Yuan Wang, Borui Liao, Huijuan Huang, Jinda Lu, Ouxiang Li, Kuien Liu, Meng Wang, Xiang Wang
419
MovieRecapsQA: A Multimodal Open-Ended Video Question- Answering Benchmark PDF ↗
Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan
420
Training-free, Perceptually Consistent Low-Resolution Previews with High-Resolution Image for Efficient Workflows of Diffusion Models PDF ↗
Wongi Jeong, Hoigi Seo, Se Young Chun
421
One Model, Many Budgets: Elastic Latent Interfaces for Diffusion Transformers PDF ↗
Moayed Haji-Ali, Willi Menapace, Ivan Skorokhodov, Dogyun Park, Anil Kag, Michael Vasilkovsky, Sergey Tulyakov, Vicente Ordonez, Aliaksandr Siarohin
422
Reflection Separation from a Single Image via Joint Latent Diffusion PDF ↗
Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang
423
MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation PDF ↗
Bharath Krishnamurthy, Ajita Rattani
424
DisCa: Accelerating Video Diffusion Transformers with Distillation- Compatible Learnable Feature Caching PDF ↗
Chang Zou, Changlin Li, Songtao Liu, Zhao Zhong, Kailin Huang, Linfeng Zhang
425
MatLat: Material Latent Space for PBR Texture Generation PDF ↗
Kyeongmin Yeo, Yunhong Min, Jaihoon Kim, Minhyuk Sung
426
VMonarch: Efficient Video Diffusion Transformers with Structured Attention PDF ↗
Cheng Liang, Haoxian Chen, Liang Hou, Qi Fan, Gangshan Wu, Xin Tao, Limin Wang
427
DiffDecompose: Layer-Wise Decomposition of Alpha-Composited Images via Diffusion Transformers PDF ↗
Zitong Wang, Hang Zhao, Qianyu Zhou, Xuequan Lu, Xiangtai Li, Hao Yang, Bo Yang, Yiren Song
428
Calibri: Enhancing Diffusion Transformers via Parameter-Efficient Calibration
Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev
429
Transition Matching Distillation for Fast Video Generation PDF ↗
Weili Nie, Julius Berner, Nanye Ma, Chao Liu, Saining Xie, Arash Vahdat
430
Diffusion-Based Makeup Transfer with Facial Region-Aware Makeup Features PDF ↗
Zheng Gao, Debin Meng, Yunqi Miao, Zhensong Zhang, Songcen Xu, Ioannis Patras, Jifei Song
431
UniPR: Unified Object-level Real-to-Sim Perception and Reconstruction from a Single Stereo Pair PDF ↗
Chuanrui Zhang, Yingshuang Zou, ZhengXian Wu, Yonggen Ling, Yuxiao Yang, Ziwei Wang
432
Query2Uncertainty: Robust Uncertainty Quantification and Calibration for 3D Object Detection under Distribution Shift PDF ↗
Till Beemelmanns, Alexey Nekrasov, Stefan Vilceanu, Jonas Steinhaus, Timo Woopen, Bastian Leibe, Lutz Eckstein
433
DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces PDF ↗
Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu
434
PoseGaussian: 6D Pose Estimation for Unseen Objects via Sparse- View Object-Level 3D Gaussian Splatting PDF ↗
Wubin Shi, Shaoyan Gai, Feipeng Da
435
VGGT-Det: Mining VGGT Internal Priors for Sensor-Geometry- Free Multi-View Indoor 3D Object Detection PDF ↗
Yang Cao, Feize Wu, Dave Zhenyu Chen, Yingji Zhong, Lanqing Hong, Dan Xu
436
MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label PDF ↗
Junyoung Jung, Seokwon Kim, Jung Uk Kim
437
V2U4Real: A Real-world Large-scale Dataset for Vehicle-to-UAV Cooperative Perception PDF ↗
Weijia Li, Haoen Xiang, Tianxu Wang, Shuaibing Wu, Qiming Xia, Cheng Wang, Chenglu Wen
438
SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More PDF ↗
Muye Huang, Lingling Zhang, Yifei Li, Yaqiang Wu, Jun Liu
439
A Causal Marriage between VLM and IRM from Understanding to Reasoning PDF ↗
Ziliang Chen, Tianang Xiao, Jusheng Zhang, Yongsen Zheng, Yang Liu, Zhao-rong Lai, Liang Lin
440
Why Does RL Generalize Better Than SFT? A Data-Centric Perspective on VLM Post-Training PDF ↗
Aojun Lu, Tao Feng, Hangjie Yuan, Wei Li, Yanan Sun
441
SoC: Semantic Orthogonal Calibration for Test-Time Prompt Tuning PDF ↗
Leo Fillioux, Omprakash Chakraborty, Ismail Ben Ayed, Paul-Henry Cournède, Stergios Christodoulidis, Maria Vakalopoulou, Jose Dolz
442
Learning to Select Visual Tools from Experience PDF ↗
Zeyi Huang, Yuyang Ji, Anirudh Sundara Rajan, Zefan Cai, Wen Xiao, Haohan Wang, Junjie Hu, Yong Jae Lee
443
Agile Deliberation: Concept Deliberation for Subjective Visual Classification PDF ↗
Leijie Wang, Otilia Stretcu, Wei Qiao, Thomas Denby, Krishnamurthy Viswanathan, Enming Luo, Chun-Ta Lu, Tushar Dogra, Ranjay Krishna, Ariel Fuxman
444
Tea-Adapter: Teacher Adapter for Efficient Conditional Generation PDF ↗
Yinhan Zhang, Yue Ma, Fangqiu Yi, Chenyang Qi, Chi Zhang, Kunyu Feng, Zeyu Wang
445
From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding PDF ↗
Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu
446
Perception Characteristics Distance: Measuring Stability and Robustness of Perception System in Dynamic Conditions under a Certain Decision Rule PDF ↗
Boyu Jiang, Liang Shi, Zhengzhi Lin, Lanxin Xiang, Loren Stowe, Feng Guo
447
FinPercep-RM: A Fine-grained Reward Model and Co-evolutionary Curriculum for RL-based Real-world Super-Resolution PDF ↗
Yidi Liu, Zihao Fan, Jie Huang, Jie Xiao, Dong Li, Wenlong Zhang, LEI BAI, Xueyang Fu, Zheng-Jun Zha
448
Twin-T & TwintVQA: A Reliable Structure–Detail Separating VLM and a Comprehensive Benchmark for Chart and Table Tasks PDF ↗
Jiahua Bao, Siyao Cheng, Jiaxing Du, Qingtao Xia, Changjiang He, Zeming Lang, Jie Liu
449
SDGS: Spatial Difference Guided Gaussian Splatting for Simultaneous Localization and 3D Reconstruction PDF ↗
Yijian Tian, Mingtao Ou, Zijian Pan, Xinglong Ji
450
RT-Splatting: Joint Reflection-Transmission Modeling with Gaussian Splatting PDF ↗
Ji Shi, Xianghua Ying, Bowei Xing, Ruohao Guo, Wenzhen Yue
451
Pose-Free Omnidirectional Gaussian Splatting for 360-Degree Videos with Consistent Depth Priors PDF ↗
Chuanqing Zhuang, Xin Lu, Zehui Deng, Zhengda Lu, Yiqun Wang, Junqi Diao, Jun Xiao
452
Distilling Unsigned Distance Function for Surface Reconstruction from 3D Gaussian Splatting PDF ↗
Qian Li, Rao Fu, Jiangtao Li, Fan Liu
453
Exact-GS: Mathematically Rigorous and Accurate 3D Gaussian Splatting for 3D X-ray Reconstruction PDF ↗
Guangpu Yang, Steffen Kieß, Hanxiang Luo, Xingyu Liu, Sven Simon
454
DualSplat: Robust 3D Gaussian Splatting via Pseudo-Mask Bootstrapping from Reconstruction Failures PDF ↗
Xu Wang, Zhiru Wang, Shiyun Xie, Chengwei Pan, Yisong Chen
455
E2EGS: Event-to-Edge Gaussian Splatting for Pose-Free 3D Reconstruction PDF ↗
Yunsoo Kim, Changki Sung, Dasol Hong, Hyun Myung
456
Neural Gabor Splatting: Enhanced Gaussian Splatting with Neural Gabor for High-frequency Surface Reconstruction PDF ↗
Haato Watanabe, Nobuyuki Umetani
457
DirectFisheye-GS: Enabling Native Fisheye Input in Gaussian Splatting with Cross-View Joint Optimization PDF ↗
Zhengxian Yang, Fei Xie, Xutao Xue, Rui Zhang, Taicheng Huang, Yang Liu, Mengqi Ji, Tao Yu
458
VAD-GS: Visibility-Aware Densification for 3D Gaussian Splatting in Dynamic Urban Scenes PDF ↗
Yikang Zhang, Rui Fan
459
GauMVC: Generative Decoupled Gaussian Representation for Human- centric Multi-view Video Compression PDF ↗
Ruoke Yan, Mingjia Yang, Xinfeng Zhang, Haocheng Tang, Qian Yin, Zhipin Deng, Kai Zhang, Li Zhang, Siwei Ma
460
A Geometric Algebra-Informed 3DGS Framework for Wireless Channel Prediction PDF ↗
Jingzhou Shen, Tianya Zhao, Xuyu Wang
461
RaGS: Unleashing 3D Gaussian Splatting from 4D Radar and Monocular Cue for 3D Object Detection PDF ↗
Xiaokai Bai, Chenxu Zhou, Lianqing Zheng, Jianan Liu, Si-Yuan Cao, Xiaohan Zhang, Yiming Li, Zhengzhuang Zhang, Hui-Liang Shen
462
Cross-Instance Gaussian Splatting Registration via Geometry-Aware Feature-Guided Alignment PDF ↗
Roy Amoyal, Oren Freifeld, Chaim Baskin
463
ActivePolicy: Active Gaussian Reconstruction and Optimization Strategy Based on Global-Local Information Gain PDF ↗
Yingzhao Li, Yanjie Liu, Lijun Zhao
464
Uncertainty-driven 3D Gaussian Splatting Active Mapping via Anisotropic Visibility Field PDF ↗
Shangjie Xue, Jesse Dill, Dhruv Ahuja, Frank Dellaert, Panagiotis Tsiotras, Danfei Xu
465
SV-GS: Sparse View 4D Reconstruction with Skeleton-Driven Gaussian Splatting PDF ↗
Jun-Jee Chao, Volkan Isler
466
NimbusGS: Unified 3D Scene Reconstruction under Hybrid Weather PDF ↗
Yanying Li, Jinyang Li, Shengfeng He, Yangyang Xu, Junyu Dong, Yong Du
467
SparseSplat: Towards Applicable Feed-Forward 3D Gaussian Splatting with Pixel-Unaligned Prediction PDF ↗
Zicheng Zhang, Xiangting Meng, Ke Wu, Wenchao Ding
468
REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding PDF ↗
Jiaze Li, Hao Yin, Wenhui Tan, Jingyang Chen, Boshen Xu, Yuxun Qu, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Jian Luan
469
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning PDF ↗
Chi-Pin Huang, Yunze Man, Zhiding Yu, Min-Hung Chen, Jan Kautz, Yu-Chiang Frank Wang, Fu-En Yang
470
Unlocking Token Rewards via Training-Free Reward Attribution PDF ↗
Sitong Wu, Haoru Tan, Bin Xia, Xichen Zhang, Jingyao Li, Shaofeng Zhang, Xiaojuan Qi, Bei Yu, Jiaya Jia
471
MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images PDF ↗
Ankan Deria, Komal Kumar, Adinath Madhavrao Dukre, Eran Segal, Salman Khan, Imran Razzak
472
When to Think and When to Look: Uncertainty-Guided Lookback PDF ↗
Jing Bi, Filippos Bellos, JunJia Guo, Yayuan Li, Chao Huang, Yolo Tang, Luchuan Song, Susan Liang, Zhongfei Zhang, Jason J Corso, Chenliang Xu
473
StaR-KVQA: Structured Reasoning Traces for Implicit-Knowledge Visual Question Answering PDF ↗
Zhihao Wen, Wenkang Wei, Yuan Fang, Xingtong Yu, Hui Zhang, Weicheng Zhu, Xin Zhang
474
Understanding Counting Mechanisms in Large Language and Vision-Language Models PDF ↗
Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah
475
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning PDF ↗
Kailing Li, Qi'ao Xu, Tianwen Qian, Yuqian Fu, Yang Jiao, Xiaoling Wang
476
Proof-of-Perception: Certified Tool-Using Multimodal Reasoning with Compositional Conformal Guarantees PDF ↗
Arya Fayyazi, Haleh Akrami
477
Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models PDF ↗
Keuntae Kim, Mingyu Kang, Yong Suk Choi
478
Don’t Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs PDF ↗
Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi
479
Hugging Visual Prompt and Segmentation Tokens: Consistency Learning for Fine-Grained Visual Understanding in MLLMs PDF ↗
Jing Yang, Sen Yang, Boqiang Duan, Ming Dai, Wei Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Hanli Wang
480
VisionLeaf: Entropy-Guided Leaf-First Reasoning for Efficient and Accurate Think-with-Image PDF ↗
Haokun Gui, Senqiao Yang, Mingkang Zhu, Meng Chu, Sitong Wu, Changsheng Lu, Zihao Wang, Zhuotao Tian, Jiaya Jia
481
GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models PDF ↗
Jingxuan Wei, Caijun Jia, Xi Bai, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Lijun Wu, Cheng Tan
482
Beyond Depth: Evaluating the Width-centric Reasoning Capability of MLLMs
Mingrui Chen, Hexiong Yang, Haogeng Liu, Huaibo Huang, Ran He
483
GenSplat: Bridging the Generalization Gap in 3DGS Language Comprehension PDF ↗
Fang Liu, Yuhao Liu, Ke Xu, Gerhard Petrus Hancke, Rynson W. H. Lau
484
CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering PDF ↗
Yuyang Hong, Jiaqi Gu, Yujing Lou, Lubin Fan, Qi Yang, Ying Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye
485
LoPrune: Efficient Data Pruning for LoRA-Based Fine-Tuning of Vision Transformer PDF ↗
Qiang He, Yaozong Yang, Kaibin Wang, Ziteng Wei, Feifei Chen, Caslon Chua, Yun Yang
486
Multi-Scale Local Speculative Decoding for Image Generation PDF ↗
Elia Peruzzo, Guillaume Sautière, Amirhossein Habibian
487
Globscope: Toward a Global View of the Loss Landscape PDF ↗
Mashiat Mustaq, Xavier M. Tricoche
488
RADAR: VQ-VAE Decoder of VAR is a Good Student for Restoring Against Degradation by Acceleration PDF ↗
Ziyang Wang, Yue Zhang, Mingdao Wang, Yasen Zhang, Teer Song, Yu Tian, Xueming Li
489
Beyond Single Solution: Multi-Hypothesis Deep Unfolding Network for Image Compressive Sensing PDF ↗
Wenxue Cui, Hualin Li, Yuhang Qin, Yifu Xu, Xiaopeng Fan, Debin Zhao
490
FlashDecoder: Real-Time Latent-to-Pixel Streaming Decoder with Transformers PDF ↗
Minguk Kang, Suha Kwak
491
MambaSIC: Mamba-based Stereo Image Compression with Bi- directional Multi-reference Entropy Model PDF ↗
Shiyu Qin, Xinjie Zhang, Zhening Liu, Jinpeng Wang, Bin Chen, Jiawei Li, Yifan Ren, Shu-Tao Xia, Jun Zhang
492
Neural Dynamic GI: Random-Access Neural Compression for Temporal Lightmaps in Dynamic Lighting Environments PDF ↗
Jianhui Wu, Jian Zhou, Zhi Zhou, Zhangjin Huang, Chao Li
493
Discovering Adaptive Task Dependencies for Efficient Multi-Task Representation Compression PDF ↗
Zhimeng Huang, Rongao Yuan, Junlong Gao, Qi Mao, Siwei Ma, Wen Gao, Chuanmin Jia
494
OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data PDF ↗
Yan Zhao, Zhengxue Cheng, Junxuan Zhang, Dajiang Zhou, Qunshan Gu, Qi Wang, Li Song
495
Perceptual Neural Video Compression with Color Separation and Rank Chain PDF ↗
Xiongzhuang Liang, Chuanbo Tang, Zhuoyuan Li, Li Li, Dong Liu
496
Beyond Matching to Tiles: Bridging Unaligned Aerial and Satellite Views for Vision-Only UAV Navigation PDF ↗
Kejia Liu, Haoyang Zhou, Ruoyu Xu, Peicheng Wang, Mingli Song, Haofei Zhang
497
GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction PDF ↗
Ayesh Abu Lehyeh, Xiaohan Zhang, Ahmad Arrabi, Waqas Sultani, Chen Chen, Safwan Wshah
498
PiLoT: Neural Pixel-to-3D Registration for UAV-based Ego and Target Geo-localization PDF ↗
Xiaoya Cheng, Long Wang, Yan Liu, Xinyi Liu, Hanlin Tan, Yu Liu, Maojun Zhang, Shen Yan
499
PAUL: Uncertainty-Guided Partition and Augmentation for Robust Cross-View Geo-Localization under Noisy Correspondence PDF ↗
Zheng Li, Xueyi Zhang, Yanming Guo, Yuxiang Xie, Zhaoyun Ding, Siqi Cai, Haizhou Li, Mingrui Lao
500
UniGeoRS: A Unified Benchmark for Tri-view Geo-Localization PDF ↗
Xiao Liang, Huaizhi Tang, Feiyang Zhang, Shiji Yuan, Chun Hu, Dezhi Zheng, Kang Ma
501
VGA: Empowering Aerial-Ground Localization by Visual Geometry Alignment PDF ↗
Tao Jun Lin, Yujiao Shi, Hongdong Li
502
Watch and Learn: Learning to Use Computers from Online Videos PDF ↗
Chan Hee Song, Yiwen Song, Palash Goyal, Yu Su, Oriana Riva, Hamid Palangi, Tomas Pfister
503
OneThinker: All-in-one Reasoning Model for Image and Video PDF ↗
Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue
504
Incentivizing Versatile Video Reasoning in MLLMs via Data- Efficient Reinforcement Learning PDF ↗
Xiaodong Wang, Zhirong Wu, Langling Huang, Yuxi Zheng, Peixi Peng
505
Act2See: Emergent Active Visual Perception for Video Reasoning PDF ↗
Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency
506
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking PDF ↗
Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum
507
ViLoMem: Agentic Learner with Grow-and-Refine Multimodal Semantic Memory PDF ↗
Weihao Bo, Shan Zhang, Yanpeng Sun, Jingjing Wu, Qunyi Xie, Xiao Tan, Kunbin Chen, Wei He, Xiaofan Li, Na Zhao, Jingdong Wang, Zechao Li
508
ReMoT: Reinforcement Learning with Motion Contrast Triplets PDF ↗
Cong Wan, Zeyu Guo, Jiangyang Li, Songlin Dong, Yifan Bai, Lin Peng, Zhiheng Ma, Yihong Gong
509
Incentivizing Generative Zero-Shot Learning via Outcome-Reward Reinforcement Learning with Visual Cues PDF ↗
Wenjin Hou, Xiaoxiao Sun, Hehe Fan
510
Semantic-Guided Global-Local Collaborative Prompt Learning for Few-Shot Class Incremental Learning PDF ↗
Yongxin Yan, Weisen Chen, Xingye Chen, Yuanjie Shao, Zhengrong Zuo, Wenming Tan, Wenqi Ren, Changxin Gao, Nong Sang
511
Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition PDF ↗
Hui Liu, Kecheng Chen, Jialiang Wang, Xianming Liu, Wenya Wang, Haoliang Li
512
One Patch to Caption Them All: A Unified Zero-Shot Captioning Framework PDF ↗
Lorenzo Bianchi, Giacomo Pacini, Fabio Carrara, Nicola Messina, Giuseppe Amato, Fabrizio Falchi
513
Data-Centric Meta-Learning for Robust Few-Shot Generalization PDF ↗
Jongmin Lim, Soobin Cha, Jaehun Park, Inho Oh, Minho Park, Kwangsu Kim
514
Bridging the Modality Gap in Compositional Zero-Shot Learning via Sparse Alignment and Unimodal Memory Bank PDF ↗
Yang Zhang, Zhixiang Chi, Xudong Yan, Yang Wang, Songhe Feng
515
LIFT and PLACE: A Simple, Stable, and Effective Knowledge Distillation Framework for Lightweight Diffusion Models PDF ↗
Hyunsoo Han, Sangyeop Yeo, Jaejun Yoo
516
WaDi: Weight Direction-aware Distillation for One-step Image Synthesis PDF ↗
Lei Wang, Yang Cheng, Senmao Li, Ge Wu, Yaxing Wang, Jian Yang
517
Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models PDF ↗
Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen
518
Beyond Soft Label: Dataset Distillation via Orthogonal Gradient Matching PDF ↗
Deyu Bo, Xinchao Wang
519
BHCast: Unlocking Black Hole Plasma Dynamics from a Single Blurry Image with Long-Term Forecasting PDF ↗
Renbo Tu, Ali SaraerToosi, Nicholas S. Conroy, Gennady Pekhimenko, Aviad Levis
520
RawMetaDiff: Unlocking Extreme Darkness from Dual-
Exposure RAW with Meta-Guided Diffusion, Panjun Liu, Jiyuan Xia, Yuanshen Guan, Yong Li, Zhiqiang Lang, Ruikang Xu, Chang Chen, Dehua Song, Fenglong Song, Zhiwei Xiong
521
Prospective Dynamic 3D MRI Reconstruction via Latent-Space Motion Tracking from Single Measurement PDF ↗
Lixuan Chen, Zhongnan Liu, Jesse Hamilton, James M. Balter, Jeong Joon Park, Liyue Shen
522
Lens Component Deletion based on Differentiable Ray Tracing PDF ↗
Wenguan Zhang, Qirun Zhang, Tuo Sun, Jiajian He, Jiahui Xu, Huajun Feng, Qi Li
523
X-band Radar Non-Line-of-Sight Imaging PDF ↗
Dongyu Du, Mingkun Zhao, Yutong Yang, Dominik Scheuble, Xiaolong Huang, Zijian Shao, Mario Bijelic, Kaushik Sengupta, Felix Heide
524
3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion PDF ↗
Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang
525
UAVLight: A Benchmark for Illumination-Robust 3D Reconstruction in Unmanned Aerial Vehicle (UAV) Scenes PDF ↗
Kang Du, Xue Liao, Junpeng Xia, Chaozheng Guo, Yi Gu, Yirui Guan, Duotun Wang, Sheng Huang, Zeyu Wang
526
Polarization State Tracing for Reflection Removal and Color- Consistent Reconstruction PDF ↗
Dongyue Wang, Yang Lu, Jiandong Tian
527
GFRRN: Explore the Gaps in Single Image Reflection Removal PDF ↗
Yu Chen, Zewei He, Xingyu Liu, Zixuan Chen, Zhe-Ming Lu
528
Efficient All-Pairs Correlation Volume Sampling for Optical Flow Estimation PDF ↗
Karlis Martins Briedis, Markus Gross, Christopher Schroers
529
Cross-Slice Knowledge Transfer via Masked Multi-Modal Heterogeneous Graph Contrastive Learning for Spatial Gene Expression Inference PDF ↗
Zhiceng Shi, Changmiao Wang, Jun Wan, Wenwen Min
530
Adapting a Pre-trained Single-Cell Foundation Model to Spatial Gene Expression Generation from Histology Images PDF ↗
Donghai Fang, Yongheng Li, Zhen Wang, Yuansong Zeng, Wenwen Min
531
HyperST: Hierarchical Hyperbolic Learning for Spatial Transcriptomics Prediction PDF ↗
Chen Zhang, Yilu An, Ying Chen, Hao Li, Xitong Ling, Lihao Liu, Junjun He, Yuxiang Lin, Zihui Wang, Rongshan Yu
532
SO(3)-Equivariant ViT-Adapter for Data-Efficient Zero-Shot Sim-to- Real Indoor Panoramic Depth Estimation PDF ↗
Ziyan He, Qiudan Zhang, Lin Ma, Xu Wang
533
Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion PDF ↗
Yu Xue, Longjun Gao, Yuanqi Su, HaoAng Lu, Xiaoning Zhang
534
XPaintNet: An eXtreme Lightweight Framework for Stereoscopic Conversion without Inpainting Network PDF ↗
Kihwan Yoon, Juyeon Shin, Jungheum Kang, Sijung Kim, Minyong Jeon
535
MD2E: Modeling Depth-to-Edge Cues for Monocular Metric Depth Estimation PDF ↗
Chao Ning, Minghe Shen, Naoto Yokoya
536
LiteSense: Lifting Lightweight ToF with RGB for High-Resolution Metric Depth Estimation PDF ↗
Yusheng Li, Lizhi Lou, Yan Tang, Zekai Miao, Shaoming Zhang, Jianmei Wang
537
3D-Aware Multi-Task Learning with Cross-View Correlations for Dense Scene Understanding PDF ↗
Xiaoye Wang, Chen Tang, Xiangyu Yue, Wei-Hong Li
538
The Midas Touch for Metric Depth PDF ↗
Yu Ma, Zizhan Guo, Zuyi Xiong, Haoran Zhang, Yi Feng, Hongbo Zhao, Hanli Wang, Rui Fan
539
Lifting Unlabeled Internet-level Data for 3D Scene Understanding PDF ↗
Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang
540
ObjectMorpher: 3D-Aware Image Editing via Deformable 3DGS PDF ↗
Yuhuan Xie, Aoxuan Pan, Yi-Hua Huang, Chirui Chang, Peng Dai, Xin Yu, Xiaojuan Qi
541
PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image PDF ↗
Ziang Cao, Fangzhou Hong, Zhaoxi Chen, Liang Pan, Ziwei Liu
542
MeshFlow: Efficient Artistic Mesh Generation via MeshVAE and Flow-
based DiTs, Weiyu Li, Antoine Toisoul, Tom Monnier, Roman Shapovalov, Rakesh Ranjan, Ping Tan, Andrea Vedaldi
543
WonderZoom: Multi-Scale 3D World Generation PDF ↗
Jin Cao, Hong-Xing Yu, Jiajun Wu
544
SceneTok: A Compressed, Diffusable Token Space for 3D Scenes PDF ↗
Mohammad Asim, Christopher Wewer, Jan Eric Lenssen
545
PixARMesh: Autoregressive Mesh-Native Single-View Scene Reconstruction PDF ↗
Xiang Zhang, Sohyun Yoo, Hongrui Wu, Chuan Li, Jianwen Xie, Zhuowen Tu
546
Extend3D: Town-Scale 3D Generation PDF ↗
Seungwoo Yoon, Jinmo Kim, Jaesik Park
547
Pano3DComposer: Feed-Forward Compositional 3D Scene Generation from Single Panoramic Image PDF ↗
Zidian Qiu, Ancong Wu
548
MeshWeaver: Sparse-Voxel-Guided Surface Weaving for Autoregressive Mesh Generation PDF ↗
Jiale Xu, Wang Zhao, Ying Shan
549
CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation PDF ↗
Chenyu Liu, Hongze Chen, Jingzhi Bao, Lingting Zhu, Runze Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Keyang Luo, Xin Wang
550
CraftMesh: High-Fidelity Generative Mesh Manipulation via Poisson Seamless Fusion PDF ↗
James Jincheng Hu, Yuxiao Wu, Youcheng Cai, Ligang Liu
551
LoG3D: Ultra-High-Resolution 3D Shape Modeling via Local-to-Global Partitioning PDF ↗
Xinran Yang, Shuichang Lai, Jiangjing Lyu, Hongjie Li, Bowen Pan, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo
552
MaskFocus: Focusing Policy Optimization on Critical Steps for Masked Image Generation PDF ↗
Guohui Zhang, Hu Yu, Xiaoxiao Ma, Yaning Pan, Hang Xu, Jie Huang, Feng Zhao
553
Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning PDF ↗
Changlin Li, Jiawei Zhang, Shuhao Liu, Sihao Lin, Zeyi Shi, Zhihui Li, Xiaojun Chang
554
PosterOmni: Generalized Artistic Poster Creation via Task Distillation and Unified Reward Feedback PDF ↗
Sixiang Chen, Jianyu Lai, Jialin Gao, Hengyu Shi, Zhongying Liu, Tian Ye, Junfeng Luo, Xiaoming Wei, Lei Zhu
555
GRPO-Guard: Mitigating Implicit Over-Optimization in Flow Matching via Regulated Clipping PDF ↗
Jing Wang, Jiajun Liang, Jie Liu, Henglin Liu, Gongye Liu, Jun Zheng, Wanyuan Pang, Ao Ma, Zhenyu Xie, Xintao Wang, Meng Wang, Pengfei Wan, Xiaodan Liang
556
The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation PDF ↗
Weijia Mao, Hao Chen, Zhenheng Yang, Mike Zheng Shou
557
Flash-DMD: Towards High-Fidelity Few-Step Image Generation with Efficient Distillation and Joint Reinforcement Learning PDF ↗
Guanjie Chen, ShiruiHuang ShiruiHuang, Yifu Sun, Kai Liu, Jianchen Zhu, Xiaoye Qu, Yu Cheng, Peng Chen
558
VISTA: A Test-Time Self-Improving Video Generation Agent PDF ↗
Do Xuan Long, Xingchen Wan, Hootan Nakhost, Chen-Yu Lee, Tomas Pfister, Sercan Ö. Arik
559
Neighbor GRPO: Contrastive ODE Policy Optimization Aligns Flow Models PDF ↗
Dailan He, Guanlin Feng, Xingtong Ge, Yazhe Niu, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li
560
SMV-EAR: Bring Spatiotemporal Multi-View Representation Learning into Efficient Event-Based Action Recognition PDF ↗
Rui Fan, Weidong Hao, Juntao Guan, Lai Rui, Tong Wu, Fanhong Zeng, Lin Gu
561
Hierarchical Action Learning for Weakly-Supervised Action Segmentation PDF ↗
Junxian Huang, Ruichu Cai, Juntao Fang, Hao Zhu, Boyan Xu, Weilin Chen, Zijian Li, Shenghua Gao
562
Gamba: Mamba-based graph convolutional network with dynamic graph topology learning for action recognition PDF ↗
Rouyi Zhou, Yangzhi Wu, Jiajun Wen, Can Gao, Feng Liu, Zhihui Lai, Linlin Shen
563
Beyond Binary Contrast: Modeling Continuous Skeleton Action Spaces with Transitional Anchors PDF ↗
Yingjie Feng, Yi Wang, Jiaze Wang, Anfeng Liu, Zhuotao Tian
564
PRISM: Learning a Shared Primitive Space for Transferable Skeleton Action Representation PDF ↗
Di Yang, Yaohui Wang, Shuai Shao, François Brémond, Jiangtao Wang
565
TWEO: Transformers Without Extreme Outliers Enables FP8 Training And Quantization For Dummies PDF ↗
Guang Liang, Jie Shao, Ningyuan Tang, Xinyao Liu, Jianxin Wu
566
Unified Spherical Frontend: Learning Rotation-Equivariant Representations of Spherical Images from Any Camera PDF ↗
Mukai Yu, Mosam Dabhi, Liuyue Xie, Sebastian Scherer, László A. Jeni
567
The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations PDF ↗
Kushal Vyas, Alper Kayabasi, Daniel Kim, Vishwanath Saragadam, Ashok Veeraraghavan, Guha Balakrishnan
568
DABO: Difficulty-Aware Bayesian Optimization with Diffusion-Learned Priors PDF ↗
Mengyang Li, Pinlong Zhao
569
Towards Knowledge-augmented Bayesian Deep Learning For Computer Vision PDF ↗
Wang Ma, Hanjing Wang, Yufei Zhang, Darsha Udayanga, Qiang Ji
570
NESTOR: A Nested MOE-based Neural Operator for Large-Scale PDE Pre-Training PDF ↗
Dengdi Sun, Xiaoya Zhou, Xiao Wang, Hao Si, Wanli Lyu, Jin Tang, Bin Luo
571
Evidential Transformation Network: Turning Pretrained Models into Evidential Models for Post-hoc Uncertainty Estimation PDF ↗
Yongchan Chun, Chanhee Park, Jeongho Yoon, Jaehyung Seo, Heuiseok Lim
572
Beyond Euclidean Gossip: KL-Barycentric Consensus on Heterogeneous and Imbalanced Images PDF ↗
Lu Xu, Guosheng Yin
573
Prime Once, then Reprogram Locally: An Efficient Alternative to Black-Box Service Model Adaptation PDF ↗
Yunbei Zhang, Chengyi Cai, Feng Liu, Jihun Hamm
574
Batch Loss Score for Dynamic Data Pruning PDF ↗
Qing Zhou, Bingxuan Zhao, Tao Yang, Hongyuan Zhang, Junyu Gao, Qi Wang
575
Teacher-Guided Routing for Sparse Vision Mixture-of-Experts PDF ↗
Masahiro Kada, Ryota Yoshihashi, Satoshi Ikehata, Rei Kawakami, Ikuro Sato
576
WebChain: A Large-Scale Human-Annotated Dataset of Real- World Web Interaction Traces PDF ↗
Sicheng Fan, Rui Wan, Yifei Leng, Gaoning Liang, Li Ling, Yanyi Shang, Dehan Kong
577
MangoBench: A Benchmark for Multi-Agent Goal-Conditioned Offline Reinforcement Learning PDF ↗
Yi Wang, Ningze Zhong, Zhiheng Fu, Longguang Wang, Ye Zhang, Yulan Guo
578
iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception PDF ↗
Sarthak Mehrotra, Sairam VC Rebbapragada, Mani Bonthu, Vineeth N. Balasubramanian
579
MMBench-GUI: A Unified Hierarchical Evaluation Framework for Multi-Platform GUI Agents PDF ↗
Xuehui Wang, Zhenyu Wu, JingJing Xie, Zichen Ding, Bowen Yang, Zehao Li, Zhaoyang Liu, Qingyun Li, Xuan Dong, Zhe Chen, Weiyun Wang, Xiangyu Zhao, Jixuan Chen, Haodong Duan, Tianbao Xie, Chenyu Yang, Shiqian Su, Yue Yu, Yanting Zhang, Xiangyu Yue, Weijie Su, Xizhou Zhu, Wei Shen, Jifeng Dai, Wenhai Wang
580
Boosting Vision-Language Models Towards Cross-Domain Incremental Object Detection PDF ↗
Xu Wang, Zihan Lin, Yixin Zhang, Zilei Wang
581
UniSpector: Towards Universal Open-set Defect Recognition via Spectral- Contrastive Visual Prompting PDF ↗
Geonuk Kim, Minhoi Kim, Kangil Lee, Minsu Kim, Hyeonseong Jeon, Jeonghoon Han, Hyoungjoon Lim, Junho Yim
582
Unlearning without Forgetting: Securely Removing Targeted Concepts from Large-Scale Vision-Language Open-Vocabulary Detectors PDF ↗
Zhongze Wu, Xiu Su, Feng Yang, Dan Niu, Shan You, Yueyi Luo, Jun Long
583
UNI-OOD: Unified Object- and Image-level Out-of-Distribution Detection via Cross-Context Attentive Vision-Language Modeling PDF ↗
Yuchuan Li, Azadeh Motamedi, Hyock Ju Kwon, Chul B Park, Il-Min Kim
584
S2C2Seg: Semantic-Spatial Consistency and Category Optimization for Open-Vocabulary Segmentation PDF ↗
Yuhao Qing, Yueying Wang, Chaoyang Chen, Weidong Zhang, Jie Wen, Xin Xu
585
NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection PDF ↗
Yupeng Zhang, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan
586
The Missing Point in Vision Transformers for Universal Image Segmentation PDF ↗
Sajjad Shahabodini, Mobina Mansoori, Farnoush Bayatmakou, Jamshid Abouei, Konstantinos Plataniotis, Arash Mohammadi
587
PromptMoE: A Segmentation Refinement Framework Leveraging Mixture of Experts for Improved Prompting PDF ↗
Stephen Price, Danielle L. Cote, Elke A. Rundensteiner
588
The Power of Prior: Training-Free Open-Vocabulary Semantic Segmentation with LLaVA PDF ↗
Bingfeng Zhang, Siyue Yu, Hui Li, Jiahua Lin, Wenwu Wang, Jimin Xiao
589
Beyond Text: Visual Description Assembly by Probabilistic Model for CLIP-based Weakly Supervised Semantic Segmentation PDF ↗
Xianglin Qiu, Jian Wang, Xiaolei Wang, Zhen Zhang, Jimin Xiao
590
High-Precision Dichotomous Image Segmentation via Depth Integrity- Prior and Fine-Grained Patch Strategy PDF ↗
Xianjie Liu, Keren Fu, Qijun Zhao
591
GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation PDF ↗
Ken Deng, Yunhan Yang, Jingxiang Sun, Xihui Liu, Yebin Liu, Ding Liang, Yan-Pei Cao
592
Material Magic Wand: Material-Aware Grouping of 3D Parts in Untextured Meshes PDF ↗
Umangi Jain, Vladimir Kim, Matheus Gadelha, Igor Gilitschenski, Zhiqin Chen
593
Synthetic Object Compositions for Scalable and Accurate Learning in Detection, Segmentation, and Grounding PDF ↗
Weikai Huang, Jieyu Zhang, Taoyang Jia, Chenhao Zheng, Ziqi Gao, Jae Sung Park, Ranjay Krishna
594
Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge PDF ↗
Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen
595
HySeg: Learning Generative Priors for Structure-Aware Remote Sensing Segmentation PDF ↗
Jie Qiu, Xin Li, Fan Yang, Yan Wang, Dong Yu, Changying Wang, Linwei Dai, Yongxiang Chen, Youqin Chen, Jianzhang Chen
596
Real-Time Long Horizon Air Quality Forecasting via Group-Relative Policy Optimization PDF ↗
Inha Kang, Eunki Kim, Wonjeong Ryu, Jaeyo Shin, Seungjun Yu, Yoon-Hee Kang, Seongeun Jeong, Eunhye Kim, Soontae Kim, Hyunjung Shim
597
MMVIP: A Visible-infrared Paired Dataset for Multi-weather Marine Vision PDF ↗
Yunpeng Yin, Lihan Wang, Zhaoshen He, Xinqiang He, Xingming Liao, Zhuowei Wang, Lianglun Cheng
598
Beyond Tie Points: Satellite Image Block Adjustment based on Dense Feature Consistency PDF ↗
Yi Liu, Yi Wan, Lei Yu, Panwang Xia, Qiong Wu, Yingying Pei, Xuejun Huang, Junjian Zhang, Xiangyuan Cai, Hongwei Hu, Yongjun Zhang
599
Spectrally Distilled Representations Aligned with Instruction- Augmented LLMs for Satellite Imagery PDF ↗
Minh Kha Do, Wei Xiang, Kang Han, Di Wu, Khoa Phan, Yi-Ping Phoebe Chen, Gaowen Liu, Ramana Rao Kompella
600
Global Underwater Geolocation from Time-Lapse Polarization Imagery PDF ↗
Sara Aghajanzadeh, Xiaoyang Bai, Zhongmin Zhu, David Forsyth, Viktor Gruev
601
Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environments PDF ↗
Shuang Song, Debao Huang, Deyan Deng, Haolin Xiong, Yang Tang, Yajie Zhao, Rongjun Qin
602
PRUE: A Practical Recipe for Field Boundary Segmentation at Scale PDF ↗
Gedeon Muhawenayo, Caleb Robinson, Subash Khanal, Zhanpei Fang, Isaac Corley, Alexander Wollam, Tianyi Gao, Leonard Strnad, Ryan Avery, Lyndon Estes, Ana Tárano, Nathan Jacobs, Hannah Kerner
603
SARMAE: Masked Autoencoder for SAR Representation Learning PDF ↗
Danxu Liu, Di Wang, Hebaixu Wang, Haoyang Chen, Wentao Jiang, Yilin Cheng, Haonan Guo, Wei Cui, Jing Zhang
604
LNEM: Lunar Neural Elevation Model PDF ↗
Suwan Lee, Jo Ryeong Yim, Kibaek Park, Dong-Gyu Kim, Eunhyeuk Kim, Minsup Jeong, Chae Kyung Sim, Seokju Lee
605
A Polarized Reflection and Material Dataset of Real World Objects
Jing Yang, Krithika Dharanikota, Emily Jia, Haiwei Chen, Yajie Zhao
606
LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents PDF ↗
Zihe Yan, Zhuosheng Zhang, Jiaping Gui, Gongshen Liu
607
RaPA: Enhancing Transferable Targeted Attacks via Random Parameter Pruning PDF ↗
Tongrui Su, Qingbin Li, Shengyu Zhu, Wei Chen, Xueqi Cheng
608
All Vehicles Can Lie: Efficient Adversarial Defense in Fully Untrusted-Vehicle Collaborative Perception via Pseudo-Random Bayesian Inference PDF ↗
Yi Yu, Libing Wu, Zhuangzhuang Zhang, Jing Qiu, Lijuan Huo, Jiaqi Feng
609
A Combination of Noise and Bilateral Filters Achieve Supralinear and Scalable Adversarial Robustness in CNNs PDF ↗
Nicolas Stalder, Benjamin F. Grewe, Matteo Saponati, Pau Vilimelis Aceituno
610
DeepProtect: Proactive Face-Swapping Defense using Identity Blending and Attribute Distortion PDF ↗
Eungi Lee, Seung-hyeok Back, Hyung-Il Kim, Seok Bong Yoo
611
Write Where It Matters: Policy-Guided Watermarks for 3D Gaussian Splatting PDF ↗
Nan Li, Yike Zeng, Qian Zhang, Qi Zhang, Zhiyi Pan, Wei Feng, Liang Wan
612
Attack for Defense: Adversarial Agents for Point Prompt Optimization Empowering Segment Anything Model PDF ↗
Xueyu Liu, Xiaoyi Zhang, Meilin Liu, Guangze Shi, Jia Shen, Yujie Wang, Cai Zhao, Ziyuan He, Yongfei Wu, Mingqiang Wei, Yongle Chen
613
RevINN: An End-to-End Invertible Neural Network for Reversible Adversarial Examples Generation PDF ↗
Jielun Huang, Chi-Man Pun, Guoheng Huang
614
CamPI: Physical Adversarial Examples through Camera Power Signal Injection PDF ↗
Yanze Ren, Mingyuan Lv, Qinhong Jiang, Yan Jiang, Chen Yan, Xiaoyu Ji, Wenyuan Xu
615
Authorize-on-Demand: Dynamic Authorization with Legality-Aware Intellectual Property Protection for VLMs PDF ↗
Lianyu Wang, Meng Wang, Huazhu Fu, Daoqiang Zhang
616
GraspALL: Adaptive Structural Compensation from Illumination Variation for Robotic Garment Grasping in Any Low-Light Conditions PDF ↗
Haifeng Zhong, Wenshuo Han, Zhouyu Wang, Runyang Feng, Fan Tang, Tong-Yee Lee, Zipei Fan, Ruihai Wu, Yuran Wang, Hao Dong, Hechang Chen, Hyung Jin Chang, Yixing Gao
617
Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer PDF ↗
Haoru Xue, Tairan He, Zi Wang, Qingwei Ben, Wenli Xiao, Zhengyi Luo, Xingye Da, Fernando Castañeda, Guanya Shi, Shankar Sastry, Linxi Fan, Yuke Zhu
618
Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction PDF ↗
Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing LYU, Chun Yuan, Fengyun Rao
619
RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning PDF ↗
Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang
620
Chain of World: World Model Thinking in Latent Motion PDF ↗
Fuxiang Yang, Donglin Di, Lulu Tang, Xuancheng Zhang, Lei Fan, Hao Li, Wei Chen, Tonghua Su, Baorui Ma
621
Scalable Feature Matching via State Space Modeling and Sparse Correlation PDF ↗
Sin Wai Choo, Bo Li
622
Video2Robo: 3DGS-based Synthetic Data from One Video Enables Scalable Robot Learning PDF ↗
Yinan Deng, Kejia Hu, Ye Chen, Jianyu Dou, Jiahui Wang, Jingyu Zhao, Haojia Ao, Yi Yang, Yufeng Yue
623
ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation PDF ↗
Wei Li, Jizhihui Liu, Li Yixing, Junwen Tong, Rui Shao, Liqiang Nie
624
SRPO: Self-Referential Policy Optimization for Vision-Language- Action Models PDF ↗
Senyu Fei, Siyin Wang, Li Ji, Ao Li, Shiduo Zhang, Liming Liu, Jinlong Hou, Jingjing Gong, Xianzhong Zhao, Xipeng Qiu
625
GeoDexGrasp: Geometry-aware Generation for Data-efficient and Physics-plausible Dexterous Grasping PDF ↗
Bing Han, Weiyuan Liu, Changlong Zhang, Chenxi Wang, Zhibin Zhao, Zhi Zhai
626
Lifelong Imitation Learning with Multimodal Latent Replay and Incremental Adjustment PDF ↗
Fanqi Yu, Matteo Tiezzi, Tommaso Apicella, Cigdem Beyan, Vittorio Murino
627
From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings PDF ↗
Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner
628
AGiLe: Learning Robust Long-Horizon Manipulation via Affordance- Grounded Bidirectional Latent Planning PDF ↗
Zixuan Chen, Xiangrong Feng, Jieqi Shi, Lin Shao, Jing Huo, Yang Gao
629
Language-Grounded Decoupled Action Representation for Robotic Manipulation PDF ↗
Wuding Weng, Tongshu Wu, Liucheng Chen, Siyu Xie, Zheng Wang, Xing Xu, Jingkuan Song, Heng Tao Shen
630
Learning to Act Robustly with View-Invariant Latent Actions PDF ↗
Youngjoon Jeong, Junha Chun, Taesup Kim
631
ORBIT: Benchmarking SfM in the Wild with 360° Video
Sara Sabour, Richard Tucker, Marcus Brubaker, Saurabh Saxena, Junhwa Hur, Andrea Tagliasacchi, Deqing Sun, David J. Fleet, Richard Szeliski, Noah Snavely
632
SpikeTrack: A Spike-driven Framework for Efficient Visual Tracking PDF ↗
Qiuyang Zhang, Jiujun Cheng, Qichao Mao, Cong Liu, Yu Fang, Yuhong Li, Mengying Ge, Shangce Gao
633
Time Without Time: Pseudo-Temporal Representation for Space-Time Super-Resolution PDF ↗
Hee Min Choi, Hyoa Kang, Suji Kim, Dokwan Oh, Nam Ik Cho
634
Envisioning the Future, One Step at a Time PDF ↗
Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh, Björn Ommer
635
FlowFM: Advancing Dark Optical Flow Estimation with Flow Matching PDF ↗
Fengyuan Zuo, Haiyan Jin, Yuanlin Zhang, Zhaolin Xiao, Bin Wang, Yuerong Mu
636
Drift-Resilient Temporal Priors for Visual Tracking PDF ↗
Yuqing Huang, Liting Lin, Weijun Zhuang, Zhenyu He, Xin Li
637
An Efficient Token Compression Framework for Visual Object Tracking PDF ↗
Weijing Wu, Qihua Liang, Bineng Zhong, Haiying Xia, Zhiyi Mo, Shuxiang Song
638
No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priors PDF ↗
Tao Liu, Kan Ren, Gang Wan, Shibo Wen
639
From Detection to Association: Learning Discriminative Object Embeddings for Multi-Object Tracking PDF ↗
Yuqing Shao, Yuchen Yang, Rui Yu, Weilong Li, Xu Guo, Huaicheng Yan, Wei Wang, Xiao Sun
640
Momentum Memory for Knowledge Distillation in Computational Pathology PDF ↗
Yongxin Guo, Hao Lu, Onur C. Koyun, Zhengjie Zhu, Muhammet F. Demir, Metin N. Gurcan
641
Modeling the Brain’s Grammar: ROI-Guided fMRI Pretraining for Transferable and Interpretable Vision Decoding PDF ↗
Yulong Liu, Hua Xu, Yiyang Cai, Chunyang Jiang, Sirui Han, Yike Guo
642
Joint Spectral Image Reconstruction and Semantic Segmentation with Cooperative Unfolding PDF ↗
Zijun He, Ping Wang, Xiaodong Wang, Chang Chen, Xin Yuan
643
X-WIN: Building Chest Radiograph World Model via Predictive Sensing PDF ↗
Zefan Yang, Ge Wang, James Hendler, Mannudeep K. Kalra, Pingkun Yan
644
fMRI-LM: Towards a Universal Foundation Model for Language- Aligned fMRI Understanding PDF ↗
Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun
645
Tell2Adapt: A Unified Framework for Source Free Unsupervised Domain Adaptation via Vision Foundation Model PDF ↗
Yulong Shi, Shijie Li, Ziyi Li, Lin Qi
646
TIM: Temporal Decoupling with Iterative Mutual-Refinement Model for Longitudinal Radiology Report Generation PDF ↗
Yiheng Dong, Yi Lin, Shilong Huang, Xiyan Yang, Xin Yang
647
Ultrasound-CLIP: Semantic-Aware Contrastive Pre-training for Ultrasound Image-Text Understanding PDF ↗
Jiayun Jin, Haolong Chai, Xueying Huang, Xiaoqing Guo, Zengwei Zheng, Zhan Zhou, Junmei Wang, Xinyu Wang, Jie Liu, Binbin Zhou
648
Act Like a Pathologist: Tissue-Aware Whole Slide Image Reasoning PDF ↗
Wentao Huang, Weimin Lyu, Peiliang Lou, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Wenchao Han, Ruifeng Guo, Jiawei Zhou, Chao Chen, Chen Wang
649
BiGMINT: Biologically-guided Hierarchical Multimodal Integration for Modeling Multiple Compound Activities in Drug Discovery PDF ↗
Pushpak Pati, Bo Li, Abbas Rayabat Khan, Tomé Albuquerque, Steffen Jaensch, Amina Mollaysa, Walid M. Abdelmoula, Samantha J. Allen, Joke Reumers, Helai P. Mohammad, Scott Oloff, Tommaso Mansi, Rui Liao, Dmytro S. Lituiev, Zhoubing Xu
650
Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamic PDF ↗
Wanying Qu, Jianxiong Gao, Wei Wang, Yanwei Fu
651
CMR-RD: Long-Tailed Adaptive VLM for Explainable CMR Diagnosis PDF ↗
Yansong Li, Zhongxi Qiu, Yun Tian, Zheng Jinyu, Shuo Li
652
Clinically-Grounded Counterfactual Reasoning for Medical Video Diagnosis PDF ↗
Jianzhe Gao, Churan Wang, Weiyi Zhang, Jianghua Li, Li-An Li, Wenguan Wang, Yixin Zhu, Yizhou Wang
653
FBTA: Enabling Single-GPU End-to-End Gigapixel WSI Classification with Feature Bridging and Translation Alignment PDF ↗
Jiuyang Dong, Jiahan Li, Junjun Jiang, Yongbing Zhang
654
Ultra Diffusion Poser: Diffusion-Based Human Motion Tracking from Sparse Inertial Sensors and Ranging-based Between-sensor Distances PDF ↗
Dominik Hollidt, Tommaso Bendinelli, Christian Holz
655
Egocentric Visibility-Aware Human Pose Estimation PDF ↗
Peng Dai, Yu Zhang, Feng Yiqiang, Zhen Fan, Yang Zhang
656
Shoe Style-Invariant and Ground-Aware Learning for Dense Foot Contact Estimation PDF ↗
Daniel Sungho Jung, Kyoung Mu Lee
657
OMG-Bench: A New Challenging Benchmark for Skeleton-
based Online Micro Hand Gesture Recognition, Haochen Chang, Pengfei Ren, Buyuan Zhang, Da Li, Tianhao Han, Haoyang Zhang, Liang Xie, Hongbo Chen, Erwei Yin
658
Recovering Physically Plausible Human-Object Interactions from Monocular Videos PDF ↗
Dingbang Huang, Etienne Vouga, Qixing Huang, Georgios Pavlakos
659
MoCapAnything: Unified 3D Motion Capture for Arbitrary Skeletons from Monocular Videos PDF ↗
Kehong Gong, Zhengyu Wen, Weixia He, Mingxi Xu, Qi Wang, Ning Zhang, Zhengyu Li, Dongze Lian, Wei Zhao, Xiaoyu He, Mingyuan Zhang
660
TeHOR: Text-Guided 3D Human and Object Reconstruction with Textures PDF ↗
Hyeongjin Nam, Daniel Sungho Jung, Kyoung Mu Lee
661
SHOW3D: Capturing Scenes of 3D Hands and Objects in the Wild PDF ↗
Patrick Rim, Kevin Harris, Braden Copple, Shangchen Han, Xu Xie, Ivan Shugurov, Sizhe An, He Wen, Alex Wong, Tomas Hodan, Kun He
662
CrossHOI: Learning Cross-View Representations for Monocular 3D Human- Object Interaction Reconstruction PDF ↗
Pei Geng, Shanshan Zhang, Jian Yang
663
Gaussian-Mixture Latent Flow for Stochastic 3D Human Motion Prediction PDF ↗
Yue Ma, Frederick W. B. Li, Xiaohui Liang
664
SGSoft: Learning Fused Semantic-Geometric Features for 3D Shape Correspondence via Template-Guided Soft Signals PDF ↗
Soyeon Yoon, Chang Wook Seo, Hyunjung Shim
665
Beyond Single-View Sufficiency: CVBench for Cross-View Human Understanding PDF ↗
Tianchen Guo, Chen Liu, Xin Yu
No matches.