‹ June 5 schedule

Poster Session 4

Sat · June 6 · 4:45–6:45 PM · ExHall A — 670 papers
670 papers
1
Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding 🏆PDF ↗
Yue Li, Qi Ma, Runyi Yang, Mengjiao Ma, Bin Ren, Nikola Popovic, Nicu Sebe, Theo Gevers, Luc Van Gool, Danda Pani Paudel, Martin R. Oswald
2
Featurising Pixels from Dynamic 3D Scenes with Linear In-Context Learners PDF ↗
Nikita Araslanov, Martin Sundermeyer, Hidenobu Matsuki, David Joseph Tan, Federico Tombari
3
From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detection PDF ↗
Yepeng Liu, Hao Li, Liwen Yang, Fangzhen Li, Xudi Ge, Yuliang Gu, Kuang Gao, Bing Wang, Guang Chen, Hangjun Ye, Yongchao Xu
4
Linear Fundamental Matrix Estimation from 7 or 5 Points 🏆PDF ↗
Taci Ata Kucukpinar, Juan Mogollon, Joshua Fraser, Timothy Duff, Kannappan Palaniappan
5
OccuFly: A 3D Vision Benchmark for Semantic Scene Completion from the Aerial Perspective PDF ↗
Markus Gross, Sai B. Matha, Aya Fahmy, Rui Song, Daniel Cremers, Henri Meeß
6
VGGT-Ω 🏆
Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht
7
CodeV: Code with Images for Faithful Visual Reasoning via Tool- Aware Policy Optimization PDF ↗
Xinhai Hou, Shaoyuan Xu, Manan Biyani, Moyan Li, Jia Liu, Todd C Hollon, Bryan Wang
8
NitroGen: An Open Foundation Model for Generalist Gaming Agents 🏆PDF ↗
Loïc Magne, Anas Awadalla, Guanzhi Wang, Yinzhen Xu, Joshua Belofsky, Fengyuan Hu, Joohwan Kim, Ludwig Schmidt, Georgia Gkioxari, Jan Kautz, Yisong Yue, Yejin Choi, Yuke Zhu, Linxi Fan
9
PAI-Bench: A Comprehensive Benchmark For Physical AI 🏆PDF ↗
Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi
10
RefAV: Towards Planning-Centric Scenario Mining 🏆PDF ↗
Cainan Davidson, Deva Ramanan, Neehar Peri
11
SoccerMaster: A Vision Foundation Model for Soccer Understanding 🏆PDF ↗
Haolin Yang, Jiayuan Rao, Haoning Wu, Weidi Xie
12
VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments PDF ↗
Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang
13
Breaking the Scalability Limit of Multi-Projector Calibration with Embedded Cameras PDF ↗
Takumi Kawano, Kohei Miura, Daisuke Iwai
14
GaussianFluent: Gaussian Simulation for Dynamic Scenes with Mixed Materials 🏆PDF ↗
Bei Huang, Yixin Chen, Ruijie Lu, Gang Zeng, Hongbin Zha, Yuru Pei, Siyuan Huang
15
InfiniBench: Infinite Benchmarking for Visual Spatial Reasoning with Customizable Scene Complexity PDF ↗
Haoming Wang, Qiyao Xue, Wei Gao
16
MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mapping PDF ↗
Shiyao Li, Antoine Guédon, Shizhe Chen, Vincent Lepetit
17
Memory-Augmented Scene Understanding and Exploration for Open- 🏆
World Aerial Object-Goal Navigation, Jiacong Zhou, Jiaxu Miao, Yourun Lin, Xianyun Wang, Jun Xiao, Jun Yu
18
Monocular Open Vocabulary Occupancy Prediction for Indoor Scenes 🏆PDF ↗
Changqing Zhou, Yueru Luo, Han Zhang, Zeyu Jiang, Changhao Chen
19
INSID3: Training-Free In-Context Segmentation with DINOv3 PDF ↗
Claudia Cuttano, Gabriele Trivigno, Christoph Reich, Daniel Cremers, Carlo Masone, Stefan Roth
20
MARCO: Navigating the Unseen Space of Semantic Correspondence PDF ↗
Claudia Cuttano, Gabriele Trivigno, Carlo Masone, Stefan Roth
21
PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation PDF ↗
Minjae Lee, Sungwoo Hur, Soojin Hwang, Won Hwa Kim
22
R^2-Seg: Training-Free OOD Medical Tumor Segmentation via 🏆
Anatomical Reasoning and Statistical Rejection, Shuaike Shen, Ke Liu, Jiaqing Xie, Shangde Gao, Chunhua Shen, Ge Liu, Mireia Crispin-Ortuzar, Shangqi Gao
23
The SA-FARI Dataset: Segment Anything in Footage of Animals for Recognition and Identification 🏆PDF ↗
Dante Wasmuht, Otto Brookes, Maximilian Schall, Pablo Palencia, Christopher Beirne, Tilo Burghardt, Majid Mirmehdi, Hjalmar Kühl, Mimi Arandjelovic, Sam Pottie, Peter Bermant, Brandon Asheim, Yi Jin Toh, Adam Elzinga, Jason Allan Holmberg, Andrew Whitworth, Eleanor Flatt, Laura Gustafson, Chaitanya Ryali, Yuan-Ting Hu, Baishan Guo, Andrew Westbury, Kate Saenko, Didac Suris
24
VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation 🏆PDF ↗
Yulu Gao, Bohao Zhang, Zongheng Tang, Jitong Liao, Wenjun Wu, Si Liu
25
DAGE: Dual-Stream Architecture for Efficient and Fine-Grained Geometry Estimation PDF ↗
Tuan Duc Ngo, Jiahui Huang, Seoung Wug Oh, Kevin Blackburn-Matzen, Evangelos Kalogerakis, Chuang Gan, Joon-Young Lee
26
Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion PDF ↗
Laura Dodds, Maisy Lam, Waleed Akbar, Yibo Cheng, Fadel Adib
27
Lite Any Stereo: Efficient Zero-Shot Stereo Matching PDF ↗
Junpeng Jing, Weixun Luo, Ye Mao, Krystian Mikolajczyk
28
MuM: Multi-View Masked Image Modeling for 3D Vision PDF ↗
David Nordström, Johan Edstedt, Fredrik Kahl, Georg Bökman
29
ZipMap: Linear-Time Stateful 3D Reconstruction via Test- Time Training PDF ↗
Haian Jin, Rundi Wu, Tianyuan Zhang, Ruiqi Gao, Jonathan T. Barron, Noah Snavely, Aleksander Hołyński
30
Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction PDF ↗
Tao Xie, Peishan Yang, Yudong Jin, Yingfeng Cai, Wei Yin, Weiqiang Ren, Qian Zhang, Wei Hua, Sida Peng, Xiaoyang Guo, Xiaowei Zhou
31
LaRP: Efficient Multi-View Inpainting with Latent Reprojection Priors PDF ↗
Gaoyang Zhang, Xinguo Liu
32
TopoMA: Topology-Guided Multi-Agent Dense RGB 3D Reconstruction via Distributed Inference PDF ↗
Xuanxuan Zhang, ShuHui Shi, Tianxiang Zhang, Zhetao Guo, Huang Zixuan, You Li
33
Sparse–View Localization via Online Neural 3D Regression PDF ↗
Ludvig Dillén, Magnus Oskarsson, Viktor Larsson
34
Dynamic Visual SLAM using a General 3D Prior PDF ↗
Xingguang Zhong, Liren Jin, Marija Popovic, Jens Behley, Cyrill Stachniss
35
Learning Scene Coordinate Reconstruction from Unposed Images via Pose Graph Optimization PDF ↗
Tze Ho Elden Tse, Jizong Peng, Angela Yao
36
FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention PDF ↗
Zipeng Wang, Dan Xu
37
No Calibration, No Depth, No Problem: Cross-Sensor View Synthesis with 3D Consistency PDF ↗
Cho-Ying Wu, Zixun Huang, Xinyu Huang, Liu Ren
38
UFO: Unifying Feed-Forward and Optimization-based Methods for Large Driving Scene Modeling PDF ↗
Kaiyuan Tan, Yingying Shen, Ziyue Zhu, Mingfei Tu, Haohui Zhu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye
39
Reliev3R: Relieving Feed-forward 3D Reconstruction from Multi- View Geometric Annotations PDF ↗
Youyu Chen, Junjun Jiang, Yueru Luo, Kui Jiang, Xianming Liu, Xu Yan, Dave Zhenyu Chen
40
TALO: Pushing 3D Vision Foundation Models Towards Globally Consistent Online Reconstruction PDF ↗
Fengyi Zhang, Tianjun Zhang, Kasra Khosoussi, Zheng Zhang, Zi Huang, Yadan Luo
41
Global Structure-from-Motion Meets Feedforward Reconstruction PDF ↗
Linfei Pan, Johannes Schönberger, Marc Pollefeys
42
POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation PDF ↗
Yaohou Fan, Qingzhong Wang, Yongsong Huang, Junyi Liu, Tomo Miyazaki, Shinichiro Omachi
43
DuoGen: Towards Autonomous Interleaved Multimodal Generation PDF ↗
Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi
44
Vibe Spaces for Creatively Connecting and Expressing Visual Concepts PDF ↗
Huzheng Yang, Katherine Xu, Andrew Lu, Michael D. Grossberg, Yutong Bai, Jianbo Shi
45
StoryTailor:A Zero-Shot Pipeline for Action-Rich Multi-Subject Visual Narratives PDF ↗
Jinghao Hu, Yuhe Zhang, Guohua Geng, Kang Li, Han Zhang
46
CREward: A Type-Specific Creativity Reward Model PDF ↗
Jiyeon Han, Ali Mahdavi-Amiri, Hao Zhang, Haedong Jeong
47
LumiX: Structured and Coherent Text-to-Intrinsic Generation PDF ↗
Xu Han, Biao Zhang, Xiangjun Tang, Xianzhi Li, Peter Wonka
48
Synthetic Curriculum Reinforces Compositional Text-to-Image Generation PDF ↗
Shijian Wang, Runhao Fu, Siyi Zhao, Qingqin Zhan, Xingjian Wang, Jiarui Jin, Yuan Lu, Hanqian Wu, Cunjian Chen
49
OmniGen2: Towards Instruction-Aligned Multimodal Generation PDF ↗
Chenyuan Wu, Jiahao Wang, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ziyi Xia, Ze Liu, Chaofan Li, Haoge Deng, Kun Luo, Bo Zhang, Jiajun Zhang, Dong Liu, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu
50
Selectively Extracting and Injecting Visual Attributes into Text-to-Image Models PDF ↗
Seunghwan Choi, Jooyeol Yun, Youngdo Lee, Jaegul Choo
51
LoFA: Learning to Predict Personalized Prior for Fast Adaptation of Visual Generative Models PDF ↗
Yiming Hao, Mutian Xu, Chongjie Ye, Jie Qin, Shunlin Lu, Yipeng Qin, Xiaoguang Han
52
UniVerse: Empower Unified Generation with Reasoning and Knowledge PDF ↗
Kaiyue Sun, Weiyang Jin, Chengqi Duan, Rongyao Fang, Xian Liu, Yuwei Niu, Chunwei Wang, Aoxue Li, Xihui Liu
53
UniVerse: A Unified Modulation Framework for Segmentation- Free, Disentangled Multi-Concept Personalization PDF ↗
Quynh Phung, Sandesh Ghimire, Minsi Hu, Chung-Chi Tsai, Jia-Bin Huang
54
Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering PDF ↗
Dongxing Mao, Alex Jinpeng Wang, Jiahao Tang, Kevin Qinghong Lin, Linjie Li, Zhengyuan Yang, Lijuan Wang, Min Li, Jingru Tan
55
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation PDF ↗
Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Bo Liu, Yiding Yang, Guang Chen, Longyin Wen, Alan Yuille, Chongyang Ma
56
RAISE: Requirement-Adaptive Evolutionary Refinement for Training-Free Text-to-Image Alignment PDF ↗
Liyao Jiang, Ruichen Chen, Chao Gao, Di Niu
57
FlowFixer: Towards Detail-Preserving Subject-Driven Generation PDF ↗
Jinyoung Jun, Won-Dong Jang, Wenbin Ouyang, Raghudeep Gadde, Jungbeom Lee
58
TextPecker: Rewarding Structural Anomaly Quantification for Enhancing Visual Text Rendering PDF ↗
Hanshen Zhu, Yuliang Liu, Xuecheng Wu, An-Lan Wang, Hao Feng, Dingkang Yang, Chao Feng, Can Huang, Jingqun Tang, Xiang Bai
59
UltraFlux: Data-Model Co-Design for High-quality Native 4K Text-to- Image Generation across Diverse Aspect Ratios PDF ↗
Tian Ye, Song Fei, Lei Zhu
60
FEAT: Fashion Editing and Try-On from Any Design PDF ↗
Soye Kwon, Keonyoung Lee, Dahuin Jung, Jaekoo Lee
61
Rethinking Prompt Design for Inference-time Scaling in Text-to- Visual Generation PDF ↗
Subin Kim, Sangwoo Mo, Mamshad Nayeem Rizve, Yiran Xu, Difan Liu, Jinwoo Shin, Tobias Hinz
62
PointAlign: Feature-Level Alignment Regularization for 3D Vision- Language Models PDF ↗
Yuanhao Su, Shaofeng Zhang, Xiaosong Jia, Qi Fan
63
PowerCLIP: Powerset Alignment for Contrastive Pre- Training PDF ↗
Masaki Kawamura, Nakamasa Inoue, Rintaro Yanagi, Hirokatsu Kataoka, Rio Yokota
64
MoBind: Motion Binding for Fine-Grained IMU–Video Pose Alignment PDF ↗
Duc Duy Nguyen, Tat-Jun Chin, Minh Hoai
65
The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision- Language Models PDF ↗
Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira
66
Tackling Model Bias via Game-theoretic Multi-agent Collaboration Framework for Hateful Meme Classification PDF ↗
Yiwei Wei, Zhengliang Guo, Shaozu Yuan, Chengyin Hu, Zhiyang Jia, Jiujiang Guo, Meng Chen, Peiying Wang, Longbiao Wang
67
CCCaption: Dual-Reward Reinforcement Learning for Complete and Correct Image Captioning PDF ↗
Zhijiang Tang, Linhua Wang, Jiaxin Qi, Weihao Jiang, Peng Hou, Anxiang Zeng, Jianqiang Huang
68
MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction PDF ↗
Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo
69
Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models PDF ↗
Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang
70
Hierarchical Process Reward Models are Symbolic Vision Learners PDF ↗
Shan Zhang, Aotian Chen, Kai Zou, Jindong Gu, Yuan Xue, Anton van den Hengel
71
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning PDF ↗
Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang
72
SG-LoRA: Semantic-guided LoRA Parameters Generation PDF ↗
Miaoge Li, Yang Chen, Zhijie Rao, Can Jiang, Kang Wei, Jingcai Guo
73
AcTTA: Rethinking Test-Time Adaptation via Dynamic Activation PDF ↗
Hyeongyu Kim, Geonhui Han, Dosik Hwang
74
Reframing Long-Tailed Learning via Loss Landscape Geometry PDF ↗
Shenghan Chen, Yiming Liu, Yanzhen Wang, Yujia Wang, Xiankai Lu
75
Cleaning the Pool: Progressive Filtering of Unlabeled Pools in Deep Active Learning PDF ↗
Denis Huseljic, Marek Herde, Lukas Rauch, Paul Hahn, Bernhard Sick
76
DC-Merge: Improving Model Merging with Directional Consistency PDF ↗
Han-Chen Zhang, Zi-Hao Zhou, Mao-Lin Luo, Shimin Di, Min-Ling Zhang, Tong Wei
77
TALON: Test-time Adaptive Learning for On-the-Fly Category Discovery PDF ↗
Yanan Wu, Yuhan Yan, Tailai Chen, Zhixiang Chi, ZiZhang Wu, Yi Jin, Yang Wang, Zhenbo Li
78
Event-Illumination Collaborative Low-light Image Enhancement with a High-resolution Real-world Dataset PDF ↗
Senyan Xu, Zhijing Sun, Kean Liu, Xin Lu, Ruixuan Jiang, Xueyang Fu, Zheng-Jun Zha
79
NEC-Diff: Noise-Robust Event-RAW Complementary Diffusion for Seeing Motion in Extreme Darkness PDF ↗
Haoyue Liu, Jinghan Xu, Luxin Feng, Hanyu Zhou, Haozhi Zhao, Yi Chang, Luxin Yan
80
Towards Persistence: Learning Topological Constraints for Event- based Small Object Detection PDF ↗
Shiman He, Nuo Chen, Xinyi Ying, Yihang Luo, Yangsi Shi, Zaiping Lin, Miao Li
81
Geometric-Photometric Event-based 3D Gaussian Ray Tracing PDF ↗
Kai Kohyama, Yoshimitsu Aoki, Guillermo Gallego, Shintaro Shiba
82
EventDrive: Event Cameras for Vision-Language Driving Intelligence PDF ↗
Dongyue Lu, Rong Li, Ao Liang, Lingdong Kong, Wei Yin, Lai Xing Ng, Benoit R. Cottereau, Camille Simon Chane, Wei Tsang Ooi
83
EventGait: Towards Robust Gait Recognition with Event Streams PDF ↗
Senyan Xu, Shuai Chen, Chuanfu Shen, Kean Liu, Zhijing Sun, Chengzhi Cao, Xueyang Fu
84
MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision- Language-Action Agent PDF ↗
Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo
85
Resolving the Stability-Plasticity Dilemma in Reinforcement Learning via Complementary Continual Critics PDF ↗
Bo Sun, Peixi Peng, Guang Tan, Haoran Xu, Yaokun Li, Yiqian Chang, Shuaixian Wang, Luntong Li
86
SAGE: Scalable Agentic 3D Scene Generation for Embodied AI PDF ↗
Hongchi Xia, Xuan Li, Zhaoshuo Li, Qianli Ma, Jiashu Xu, Ming-Yu Liu, Yin Cui, Tsung-Yi Lin, Wei-Chiu Ma, Shenlong Wang, Shuran Song, Fangyin Wei
87
Semantic Audio-Visual Navigation in Continuous Environments PDF ↗
Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang
88
Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation PDF ↗
Xiangkai Ma, Lekai Xing, Han Zhang, Wenzhong Li, Sanglu Lu
89
FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation PDF ↗
Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li
90
Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration PDF ↗
Weile Chen, Bingchen Miao, Qifan Yu, Wendong Bu, Guoming Wang, Wenqiao Zhang, Shengyu Zhang, Juncheng Li, Siliang Tang
91
General Process Reward Modeling for Robotic Reinforcement Learning PDF ↗
Huajie Tan, Sixiang Chen, Yijie Xu, Zixiao Wang, Cheng Chi, Yuheng Ji, Yaoxu Lyu, Zhongxia Zhao, Xiansheng Chen, Peterson Co, Shaoxuan Xie, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
92
DynBridge: Bridging Imagination and Control through Interaction Dynamics for Robot Manipulation PDF ↗
Alex Wang, Zhiwei Dong, Qicheng Bai, Chenshi Zhang, Yujie Yi, Guang Dai, Yong Liu, Mengmeng Wang
93
Action-Sketcher: From Reasoning to Action via Visual Sketches for Robotic Manipulation PDF ↗
Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
94
Thinking in 360°: Humanoid Visual Search in the Wild
Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li
95
Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation PDF ↗
Imanol G. Estepa, Jesús M. Rodríguez-de-Vera, Bhalaji Nagarajan, Petia Radeva
96
MagicQuill V2: Precise and Interactive Image Editing with Layered Visual Cues PDF ↗
Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Shuailei Ma, Ka Leong Cheng, Wen Wang, Qingyan Bai, Yuxuan Zhang, Yanhong Zeng, Yixuan Li, Xing Zhu, Yujun Shen, Qifeng Chen
97
Cycle-Consistent Tuning for Layered Image Decomposition PDF ↗
Zheng Gu, Min Lu, Zhida Sun, Dani Lischinski, Daniel Cohen-Or, Hui Huang
98
RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark PDF ↗
Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu
99
Beyond Objects: Contextual Synthetic Data Generation for Fine- Grained Classification PDF ↗
William Yang, Xindi Wu, Zhiwei Deng, Esin Tureci, Olga Russakovsky
100
NEAF: Natural Image Editing with Attention Fusion for Generalizable Test-time Optimization in Text-Guided Image Editing PDF ↗
Jisoo Kim, Heeseok Oh
101
OntoAug: Rethinking Generative Data Augmentation via Ontology Guidance PDF ↗
Shuo Wang, Zhichuan Wang, Jun Luo
102
Spherical Voronoi: Directional Appearance as a Differentiable Partition of the Sphere PDF ↗
Francesco Di Sario, Daniel Rebain, Dor Verbin, Marco Grangetto, Andrea Tagliasacchi
103
4DSurf: High-Fidelity Dynamic Scene Surface Reconstruction PDF ↗
Renjie Wu, Hongdong Li, Jose M. Alvarez, Miaomiao Liu
104
Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images PDF ↗
Bo Zhou, Qiuxia Lai, Zeren Sun, Xiangbo Shu, Yazhou Yao, Wenguan Wang
105
Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering PDF ↗
Keyang Ye, Hongzhi Wu, Kun Zhou
106
Intrinsic Image Fusion for Multi-View 3D Material Reconstruction PDF ↗
Peter Kocsis, Lukas Höllein, Matthias Nießner
107
PackUV: Packed Gaussian UV Maps for 4D Volumetric Video PDF ↗
Aashish Rai, Angela Xing, Anushka Agarwal, Xiaoyan Cong, Zekun Li, Tao Lu, Aayush Prakash, Srinath Sridhar
108
Opti-NeuS: Neural Reconstruction for Dual-Layered Transparent and Opaque Objects PDF ↗
Yi Yang, Gaoyang Zhang, Jun Tan, Xinguo Liu
109
PhysGaia: A Physics-aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis PDF ↗
Mijeong Kim, Gunhee Kim, Jungyoon Choi, Wonjae Roh, Bohyung Han
110
MatSpray: Fusing 2D Material World Knowledge on 3D Geometry PDF ↗
Philipp Langsteiner, Jan-Niklas Dihlmann, Hendrik Lensch
111
OMoBlur: An Object Motion Blur Dataset and Benchmark for Real-World Local Motion Deblurring PDF ↗
Dingchuan Yu, Jiatong Li, Jingwen Zhou, Zhengyue Zhuge, Yueting Chen, Qi Li
112
Hybrid Agents for Image Restoration PDF ↗
Bingchen Li, Xin Li, Yiting Lu, Zhibo Chen
113
Zero-Shot Image Denoising via Hybrid Prior-Guided Pseudo Sample Generation PDF ↗
Xiaole Zhao, Qingsong Pang, Xiaobo Zhang, Xun Xu, Xun Gong, Yan Yang, Tianrui Li
114
Self-supervised Dynamic Heterogeneous Degradation Modeling for Unified Zero-Shot Image Restoration PDF ↗
XiaoWan Hu, Jing Yang, HeNan Liu, HuaQiu Li, Mai Xu
115
Next-Scale Prediction: A Self-Supervised Approach for Real-World Image Denoising PDF ↗
Yiwen Shan, Haiyu Zhao, Peng Hu, Xi Peng, Yuanbiao Gou
116
PhaSR: Generalized Image Shadow Removal with Physically Aligned Priors PDF ↗
Chia-Ming Lee, Yu-Fan Lin, Yu-Jou Hsiao, Jin-Hui Jiang, Yu-Lun Liu, Chih-Chung Hsu
117
UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement PDF ↗
Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li zhang, Jian Zhang, Shijie Zhao
118
FastGaMer: Efficient GainMap Learning for Practical Inverse Tone Mapping PDF ↗
Yuanshen Guan, Ruikang Xu, Chang Chen, Yinuo Liao, Dehua Song, Fenglong Song, Zhiwei Xiong
119
MDS-VQA: Model-Informed Data Selection for Video Quality Assessment PDF ↗
Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma
120
Seeing through Light and Darkness: Sensor-Physics Grounded Deblurring HDR NeRF from Single-Exposure Images and Events PDF ↗
Yunshan Qi, Lin Zhu, Nan Bao, Yifan Zhao, Jia Li
121
Disentanglement-wise Image Dehazing through Cross-Domain Manifold Consensus PDF ↗
Tianyi Lyu, Mingye Ju, Kai-Kuang Ma
122
Unsupervised Multi-Scale Segmentation of 3D Subcellular World with Stable Diffusion Foundation Model PDF ↗
Mostofa Rafid Uddin, HM Shadman Tabib, Thanh-Huy Nguyen, Kashish Gandhi, Min Xu
123
EchoPOSE: 6D Pose Estimation of Sparse Echocardiograms for Left-Ventricular 3D Shape Reconstruction PDF ↗
Lucas Iijima, Yihao Luo, Dario Sesia, Amit Kaura, Jamil Mayet, Choon Hwai Yap
124
Spatial-SAM: Spatially Consistent 3D Electron Microscopy Segmentation with SDF Memory and Semi-Supervised Learning PDF ↗
Yikai Huang, Renmin Han, Yuxuan Wang, Youcheng Cai, Ligang Liu
125
LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding PDF ↗
Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Peijie Qiu, Shao Tang, Xin Li, Yalin Wang
126
TAlignDiff: Automatic Tooth Alignment assisted by Diffusion-based Transformation Learning PDF ↗
Yunbi Liu, Enqi Tang, Shiyu Li, Hui Shuai, Lei Ma, Juncheng Li, Kuai Yu, Shu Lou, Yongchu Pan, Qingshan Liu
127
Harmonized Feature Conditioning and Frequency- Prompt Personalization for Multi-Rater Medical Segmentation PDF ↗
Sanaz Karimijafarbigloo, Armin Khosravi, Alireza Kheyrkhah, Reza Azad, Mauricio Reyes, Dorit Merhof
128
Masked-Diffusion Autoencoders for 3D Medical Vision Representation Learning PDF ↗
Jiachen Tu, Guanghui Qin, Theodore Zhengde Zhao, Jeya Maria Jose Valanarasu, Sheng Zhang, Tristan Naumann, Fan Lam, Sheng Wang, Hoifung Poon
129
PGR-Net: Prior-Guided ROI Reasoning Network for Brain Tumor MRI Segmentation PDF ↗
Jiacheng Lu, Hui Ding, Shiyu Zhang, Guoping Huo
130
Test-Time Attention Purification for Backdoored Large Vision Language Models PDF ↗
Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu
131
AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models PDF ↗
Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang
132
Towards Robust Multimodal Large Language Models Against Jailbreak Attacks PDF ↗
Ziyi Yin, Yuanpu Cao, Han Liu, Ting Wang, Jinghui Chen, Fenglong Ma
133
R^2TUA: Reconstruction-residual Based Targeted and Untargeted Attack Against Text-Image Person Re-Identification PDF ↗
Yubo Wang, Yan Lu, Bin Liu, Xulin Li, Jixiang Niu
134
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models PDF ↗
Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Qixin Zhang, Bingquan Shen, Alex C. Kot, Xudong Jiang
135
FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models PDF ↗
Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang
136
Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models PDF ↗
Xingyu Zhu, Beier Zhu, Shuo Wang, Junfeng Fang, Kesen Zhao, Hanwang Zhang, Xiangnan He
137
Enhancing Part-Level Point Grounding for Any Open-Source MLLMs PDF ↗
Jin-Cheng Jhang, Fu-En Wang, Xin Yang, Nan Qiao, Lu Xia, Min Sun, Cheng-Hao Kuo
138
MeteorPred: A Meteorological Multimodal Large Model and Dataset for Severe Weather Event Prediction PDF ↗
Shuo Tang, Jian Xu, Jiadong Zhang, Yi Chen, Qizhao Jin, Lingdong Shen, Chenglin Liu, Shiming Xiang
139
YieldSAT: A Multimodal Benchmark Dataset for High- Resolution Crop Yield Prediction PDF ↗
Miro Miranda, Deepak Pathak, Patrick Helber, Benjamin Bischke, Hiba Najjar, Francisco Mena, Cristhian Sanchez, Akshay Pai, Diego Arenas, Matias Valdenegro-Toro, Marcela Charfuelan, Marlon Nuske, Andreas Dengel
140
How Far Can We Go With Synthetic Data for Audio-Visual Sound Source Localization? PDF ↗
Arda Senocak, Sooyoung Park, Tae-Hyun Oh, Joon Son Chung
141
Modeling Cross-vision Synergy for Unified Large Vision Model PDF ↗
Shengqiong Wu, Lanhu Wu, Mingyang Bao, Wenhao Xu, Hanwang Zhang, Shuicheng Yan, Hao Fei, Tat-Seng Chua
142
Beyond Missing Modalities: Hypergraph Conditioned Diffusion for Uncertainty-Aware Multimodal Emotion Recognition PDF ↗
Xihang Qiu, Yuhao Fang, Qing Zhou, Bin Zhai, Jialong Hong, Wanpeng Zhang, Yao Lu, Ye Zhang, Chun Li
143
Rosetta Stone For Unified MLLMs: A Unified Tokenizer to Decipher Understanding and Generation PDF ↗
Wenyu Sun, Hufei Li, Ruijin Jin, Xiangheng Kong, Yuning Jiang
144
MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding PDF ↗
Zhanheng Nie, Chenghan Fu, Daoze Zhang, Junxian Wu, Wanxian Guan, Pengjie Wang, Jian Xu, Bo Zheng
145
Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy PDF ↗
Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen
146
AMusE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding PDF ↗
Sanjoy Chowdhury, Karren D Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli
147
Prototype-as-Prompt: Multimodal Sentiment Prototypes Endowing Large Language Models the Capability to Perform Multimodal Sentiment Analysis PDF ↗
Xianbing Zhao, Lan Luo, Hengyang Lu, Buzhou Tang
148
CF-IPT: Cross-Modal Fusion Interactive Prompt Tuning of Vision- Language Pre-Trained Model for Multisource Remote Sensing Data Classification PDF ↗
Jinheng Ji, Jiahui Qu, Wenqian Dong, Yunsong Li
149
EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer’s Disease PDF ↗
Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong
150
Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration PDF ↗
Xun Jiang, Yufan Gu, Disen Hu, Yuqing Hou, Yazhou Yao, Fumin Shen, Heng Tao Shen, Xing Xu
151
Cross-View Distillation and Adaptive Masking for Incomplete Multi- View Multi-Label Classification PDF ↗
Yadong Liu, Qiaoqi Li, Yueying Wang, Lunke Fei, Jie Wen
152
Bootstrap Your Own AV-Proxies: Adaptive Contrastive and Prototype Learning for Audio-Visual Segmentation PDF ↗
Junbo Zhang, Hang Su, Zhaofan Li, Hang Dong, Chao Sun
153
Multimodal Distribution Matching for Vision-Language Dataset Distillation PDF ↗
Jongoh Jeong, Hoyong Kwon, Minseok Kim, Kuk-Jin Yoon
154
M4-RAG: A Massive-Scale Multilingual Multi-Cultural Multimodal RAG PDF ↗
David Anugraha, Patrick Amadeus Irawan, Anshul Singh, En-Shiun Annie Lee, Genta Indra Winata
155
Text-Driven 3D Hand Motion Generation from Sign Language Data PDF ↗
Léore Bensabath, Mathis Petrovich, Gül Varol
156
Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface PDF ↗
Yujie Zhao, Hongwei Fan, Di Chen, Shengcong Chen, Liliang Chen, Xiaoqi Li, Guanghui Ren, Hao Dong
157
GenHOI: Towards Object-Consistent Hand–Object Interaction with Temporally Balanced and Spatially Selective Object Injection PDF ↗
Xuan Huang, Mochu Xiang, Zhelun Shen, Jinbo Wu, Chenming Wu, Chen Zhao, Kaisiyuan Wang, Hang Zhou, Shanshan Liu, Haocheng Feng, Wei He, Jingdong Wang
158
Clay-to-Stone: Phase-wise 3D Gaussian Splatting for Monocular Articulated Hand-Object Manipulation Modeling PDF ↗
Xingyu Liu, Pengfei Ren, Qi Qi, Haifeng Sun, Zirui Zhuang, Jianxin Liao, Jingyu Wang
159
Training-free Motion Factorization for Compositional Video Generation PDF ↗
Zixuan Wang, Ziqin Zhou, Feng Chen, Duo Peng, Yixin Hu, Changsheng Li, Yinjie Lei
160
Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner PDF ↗
Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang
161
CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization PDF ↗
Yitong Chen, Zuxuan Wu, Xipeng Qiu, Yu-Gang Jiang
162
FFP-300K: Scaling First-Frame Propagation for Generalizable Video Editing PDF ↗
Xijie Huang, Chengming Xu, Donghao Luo, Xiaobin Hu, Peng Tang, Xu Peng, Jiangning Zhang, Chengjie Wang, Yanwei Fu
163
V-RGBX: Video Editing with Accurate Controls over Intrinsic Properties PDF ↗
Ye Fang, Tong Wu, Valentin Deschaintre, Duygu Ceylan, Iliyan Georgiev, Chun-Hao Paul Huang, Yiwei Hu, Xuelin Chen, Tuanfeng Yang Wang
164
PoseAnything: General Pose-guided Video Generation with Part- aware Temporal Coherence PDF ↗
Ruiyan Wang, Teng Hu, Kaihui Huang, Zihan Su, Ran Yi, Lizhuang Ma
165
FastHybrid: Accelerating Hybrid Autoregressive Image Generation with Lookahead and Guided Decoding PDF ↗
Zhengguo Jiang, Fang Zhang, Yongxiang Hua, Bocheng Li, Wentao Zhang, Linli Xu
166
DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation PDF ↗
Divyansh Srivastava, Akshay Mehra, Pranav Maneriker, Debopam Sanyal, Vishnu Raj, Vijay Kamarshi, Fan Du, Joshua Kimball
167
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation PDF ↗
Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov
168
LeapAlign: Post-training Flow Matching Models at Any Generation Step by Building Two-Step Trajectories PDF ↗
Zhanhao Liang, Tao Yang, Jie Wu, Chengjian Feng, Liang Zheng
169
EVATok: Adaptive Length Video Tokenization for Efficient Visual Autoregressive Generation PDF ↗
Tianwei Xiong, Jun Hao Liew, Zilong Huang, Zhijie Lin, Jiashi Feng, Xihui Liu
170
Flow Matching for Multimodal Distributions PDF ↗
Gaoxiang Luo, Frank Cole, Sihang Zhang, Yuxiang Wan, Yulong Lu, Ju Sun
171
From Scale to Speed: Adaptive Test-Time Scaling for Image Editing PDF ↗
Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai
172
ReasonEdit: Towards Reasoning-Enhanced Image Editing Models PDF ↗
Fukun Yin, Shiyu Liu, Yucheng Han, Zhibo Wang, Peng Xing, Rui Wang, Wei Cheng, Yingming Wang, Aojie Li, Zixin Yin, Pengtao Chen, Xianfang Zeng, Gang Yu, Daxin Jiang
173
Cross-Subject EEG-to-Video Reconstruction and Beyond PDF ↗
Runduo Han, Hongchen Tan
174
Rethinking Position Embedding as a Context Controller for Multi- Reference and Multi-Shot Video Generation PDF ↗
Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang
175
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation PDF ↗
Bowen Xue, Zheng-Peng Duan, Qixin Yan, Wenjing Wang, Hao Liu, Chun-Le Guo, Chongyi Li, Chen Li, Jing Lyu
176
BiFM: Bidirectional Flow Matching for Few-Step Image Editing and Generation PDF ↗
Yasong Dai, Zeeshan Hayder, David Ahmedt-Aristizabal, Hongdong Li
177
DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution PDF ↗
Hidir Yesiltepe, Koutilya PNVR, Gaurav Pathak, Navaneeth Bodla, Bharat Singh, Pinar Yanardag, Jinrong Xie
178
VABench: A Comprehensive Benchmark for Audio-Video Generation PDF ↗
Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang
179
Relightful Video Portrait Harmonization PDF ↗
Jun Myeong Choi, Jae Shin Yoon, Luchao Qi, Roni Sengupta, Joon-Young Lee
180
DiT360: High-Fidelity Panoramic Image Generation via Hybrid Training PDF ↗
Haoran Feng, Dizhe Zhang, Xiangtai Li, Bo Du, Lu Qi
181
DVAR: Dynamic Visual Autoregressive Modeling for Image Super- Resolution PDF ↗
Yu Zheng, Kai Zhang, Wei Zhu, Qingguo Liu, Xiantao Hu, Jun Li, Jian Yang
182
Gated Condition Injection without Multimodal Attention: Towards Controllable Linear-Attention Transformers PDF ↗
Yuhe Liu, Zhenxiong Tan, Yujia Hu, Songhua Liu, Xinchao Wang
183
LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation PDF ↗
Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang
184
UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution PDF ↗
Cao Thien Tan, Phan Thi Thu Trang, Do Nghiem Duc, Ho Ngoc Anh, Hanyang Zhuang, Nguyen Duc Dung
185
EMR-Diff: Edge-aware Multimodal Residual Diffusion Model for Hyperspectral Image Super-resolution PDF ↗
Tao Zhang, Shengtao Yao, Rong Zeng, Zunjie Zhu, Bolun Zheng, Yaoqi Sun, Ying Fu, Chenggang Yan
186
RAW-Domain Degradation Models for Realistic Smartphone Super- Resolution PDF ↗
Ali Mosleh, Faraz Ali, Fengjia Zhang, Stavros Tsogkas, Junyong Lee, Michael S. Brown, Alex Levinshtein
187
One-Step Diffusion Transformer for Controllable Real-World Image Super-Resolution PDF ↗
Yushun Fang, Yuxiang Chen, Shibo Yin, Qiang Hu, Jiangchao Yao, Ya Zhang, Xiaoyun Zhang, Yanfeng Wang
188
FRAMER: Frequency-Aligned Self-Distillation with Adaptive Modulation Leveraging Diffusion Priors for Real-World Image Super- Resolution PDF ↗
Seungho Choi, Jeahun Sung, Jihyong Oh
189
HDW-SR: High-Frequency Guided Diffusion Model based on Wavelet Decomposition for Image Super-Resolution PDF ↗
Chao Yang, Boqian Zhang, Jinghao Xu, Guang Jiang
190
Unifying Precise Keyframes and Semantic Control via Multi-level Diffusion PDF ↗
Linjun Wu, Jiejia Yu, Leyang Jin, He Wang, Bowen Zheng, Xu Yang, Hao Jiang, Fei Xia, Fei Ling, Jun Deng, Xiaogang Jin
191
CIGPose: Causal Intervention Graph Neural Network for Whole-Body Pose Estimation PDF ↗
Bohao Li, Zhicheng Cao, Huixian Li, Yangming Guo
192
Pressure2Motion: Hierarchical Human Motion Reconstruction from Ground Pressure with Text Guidance PDF ↗
Zhengxuan Li, Qinhui Yang, Yiyu Zhuang, Chuan Guo, Xinxin Zuo, Xiaoxiao Long, Yao Yao, Xun Cao, Qiu Shen, Hao Zhu
193
From 3D Pose to Prose: Biomechanics-Grounded Vision–Language Coaching PDF ↗
Yuyang Ji, Yixuan Shen, Shengjie Zhu, Yu Kong, Feng Liu
194
InterPrior: Scaling Generative Control for Physics-Based Human- Object Interactions PDF ↗
Sirui Xu, Samuel Schulter, Morteza Ziyadi, Xialin He, Xiaohan Fei, Yu-Xiong Wang, Liang-Yan Gui
195
MoCoDiff: A Controllable Autoregressive Diffusion Model for Expressive Motion Generation PDF ↗
Wenfeng Song, Xuehan Wang, Shuai Li, Yi Chen, Yuting Guo, Zhenyu Wu, Xingliang Jin, Chenglizhao Chen, Fei Hou, Hongyu Wu, Aimin Hao
196
W2W: Language-Model-Based Trajectory Prediction with Reinforcement Learning PDF ↗
Zirui Xu, Biao Yang, Rongrong Ni, Zhongkai Zhou, Shaobo Shen
197
ParTY: Part-Guidance for Expressive Text-to-Motion Synthesis PDF ↗
KunHo Heo, SuYeon Kim, Yonghyun Gwon, Youngbin Kim, MyeongAh Cho
198
Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models PDF ↗
Pablo Ruiz-Ponce, Sergio Escalera, José García-Rodríguez, Jiankang Deng, Rolandos Alexandros Potamias
199
Unified Number-Free Text-to-Motion Generation Via Flow Matching, Guanhe Huang, Oya Celiktutan
200
Generative Diffusion Priors for 3D Mapping of the Dark Universe PDF ↗
Brandon Zhao, Diana Scognamiglio, Olivier Doré, Katherine L. Bouman
201
FlowPalm: Optical Flow Driven Non-Rigid Deformation for Geometrically Diverse Palmprint Generation PDF ↗
Yuchen Zou, Huikai Shao, Lihuang Fang, Zhipeng Xiong, Dexing Zhong
202
DiffuView: Multi-View Diffusion Pretraining for 3D Aware Robotic Manipulation PDF ↗
Kaizhao Zhang, Tian Niu, Tianyu Liu, Chenen Guo, Zijun Xu, Qingda Hu, Wenchao Ding
203
Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers PDF ↗
Binxu Wang, Jingxuan Fan, Xu Pan
204
Dual Ascent Diffusion for Inverse Problems PDF ↗
Minseo Kim, Axel Levy, Gordon Wetzstein
205
Forecast the Principal, Stabilize the Residual: Subspace-Aware Feature Caching for Diffusion Transformers PDF ↗
Guantao Chen, Shikang Zheng, Yuqi Lin, Linfeng Zhang
206
Spatial-Spectral Residuals Informed Diffusion Neural Operator for Pan-sharpening PDF ↗
Jiahan Huang, Ran Ran, Junming Hou, Zihao Chen, Xiaofeng Cong, Junling Li, Liang-Jian Deng
207
PhyOceanCast: Global Ocean Forecasting with Physics-Informed Diffusion PDF ↗
Qixiu Li, Xiang Zhu, Xiaoyong Li, Xiaolong Xu
208
Pixel Motion Diffusion is What We Need for Robot Control PDF ↗
E-Ro Nguyen, Yichi Zhang, Kanchana Ranasinghe, Xiang Li, Michael S. Ryoo
209
ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models PDF ↗
Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Biyik, Hao Su
210
M3Grounder: Mask-Based Multi-Span and Multi-Granular Grounding for Document QA PDF ↗
Venkata Kesav Venna, Sai Madhusudan Gunda, Jyothi Swaroopa Jinka, Hrithik Sagar Rachakonda, Anirudh Srinivasan, Ravi Kiran Sarvadevabhatla
211
BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models PDF ↗
Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong
212
Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training PDF ↗
Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou
213
RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding PDF ↗
Xiyan Liu, Han Wang, Yuhu Wang, Junjie Cai, Zhe Cao, Jianzhong Yang, Zhen Lu
214
UNICBench: UNIfied Counting Benchmark for MLLM PDF ↗
Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao
215
CaptionQA: Is Your Caption as Useful as the Image Itself? PDF ↗
Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu
216
EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy PDF ↗
Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu
217
VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement PDF ↗
Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo
218
EmbodiedSplat: Online Feed-Forward Semantic 3DGS for Open- Vocabulary 3D Scene Understanding PDF ↗
Seungjun Lee, Zihan Wang, Yunsong Wang, Gim Hee Lee
219
Efficient Encoder-Free Fourier-based 3D Large Multimodal Model PDF ↗
Guofeng Mei, Wei Lin, Luigi Riz, Yujiao Wu, Yiming Wang, Fabio Poiesi
220
Socratic-Geo: Synthetic Data Generation and Cross-Modal Geometric Reasoning via Multi-Agent Interaction PDF ↗
Zhengbo Jiao, Zifan Zhang, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang
221
HAMMER: Harnessing MLLMs via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding PDF ↗
Lei Yao, Yong Chen, Yuejiao Su, Yi Wang, Moyun Liu, Lap-Pui Chau
222
Proxy3D: Efficient 3D Representations for Vision-Language Models via Semantic Clustering and Alignment PDF ↗
Jerry Jiang, Haowen Sun, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, Kurt Keutzer, Wenzhao Zheng
223
ReLaGS: Relational Language Gaussian Splatting PDF ↗
Yaxu Xie, Abdalla Arafa, Alireza Javanmardi, Christen Millerdurai, Jia Cheng Hu, Shaoxiang Wang, Alain Pagani, Didier Stricker
224
3D-IDE: 3D Implicit Depth Emergent PDF ↗
Chushan Zhang, Ruihan Lu, Jinguang Tong, Yikai Wang, Hongdong Li
225
FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning PDF ↗
Zhengyu Fu, René Zurbrügg, Kaixian Qu, Marc Pollefeys, Marco Hutter, Hermann Blum, Zuria Bauer
226
Parse, Search, and Confirmation: Training-Free Aerial Vision-and- Dialog Navigation with Chain-of-Thought Reasoning and Structured Spatial Memory PDF ↗
Yu Qi, Hongyu Li, Shaofei Huang, Tianrui Hui, Yaxiong Wang, Lechao Cheng, Zhun Zhong, Si Liu, Meng Wang
227
4DP-QA: Scalable QA for 4D Perception in Vision Language Models PDF ↗
Seokju Cho, Abhishek Badki, Hang Su, Jindong Jiang, Ziyao Zeng, Seungryong Kim, Sifei Liu, Orazio Gallo
228
LASAR: Towards Spatio-temporal Reasoning with Latent Cognitive Map PDF ↗
Jinzhou Tang, Sidi Liu, Waikit Xiu, Weixing Chen, Keze Wang
229
Text-Phase Synergy Network with Dual Priors for Unsupervised Cross-Domain Image Retrieval PDF ↗
Jing Yang, Hui Xue, Shipeng Zhu, Pengfei Fang
230
EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval PDF ↗
Yuhan Chen, Pengwen Dai, Chuan Wang, Dayan Wu, Xiaochun Cao
231
PIX-TAB: Efficient PIXel-Precise TABle Structure Recognition Approach with Speculative Decoding and Region-Based Image Segmentation PDF ↗
Viktor Zaytsev, Olena Vynokurova, Pavlo Tytarchuk, Dmytro Kozii, Vitalii Pohribnyi, Olga Radyvonenko, Artem Shcherbina
232
CARLoS: Retrieval via Concise Assessment Representation of LoRAs at Scale PDF ↗
Shahar Sarfaty, Adi Haviv, Uri Hacohen, Niva Elkin-Koren, Roi Livni, Amit H. Bermano
233
Camouflage-aware Image-Text Retrieval via Expert Collaboration PDF ↗
Yao Jiang, Zhongkuan Mao, Xuan Wu, Keren Fu, Qijun Zhao
234
TriSim: Tri-Dimensional Similarity Modeling with Extreme Value Theory for False-Negative Mitigation in Remote Sensing Image-Text Retrieval PDF ↗
Chengyu Zheng, Hanzhang Lu, Jie Nie, Shan Du
235
TIGER: A Unified Framework for Time, Images and Geo-location Retrieval PDF ↗
David G. Shatwell, Sirnam Swetha, Mubarak Shah
236
Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos PDF ↗
Yayuan Li, Aadit Jain, Filippos Bellos, Jason J. Corso
237
VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale PDF ↗
Parth Parag Kulkarni, Rohit Gupta, Prakash Chandra Chhipa, Mubarak Shah
238
Stitch-a-Demo: Creating Video Demonstrations from Multistep Descriptions PDF ↗
Chi Hsuan Wu, Kumar Ashutosh, Kristen Grauman
239
Prototypical Action Reasoning Facilitated by Vision-Language Alignment for Egocentric Action Anticipation PDF ↗
Jiang Shao, Xinbo Zhao, Wenyin Tuo, Xiaochun Zou
240
AdaSpot: Spend Resolution Where It Matters for Precise Event Spotting PDF ↗
Artur Xarles, Sergio Escalera, Thomas B. Moeslund, Albert Clapés
241
Unique Lives, Shared World: Learning from Single-Life Videos PDF ↗
Tengda Han, Sayna Ebrahimi, Dilara Gokay, Li Yang Ku, Maks Ovsjanikov, Iva Babukova, Daniel Zoran, Viorica Patraucean, Joao Carreira, Andrew Zisserman, Dima Damen
242
Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding PDF ↗
Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu
243
VideoARM: Agentic Reasoning over Hierarchical Memory for Long- Form Video Understanding PDF ↗
Yufei Yin, Qianke Meng, Minghao Chen, Jiajun Ding, Zhenwei Shao, Zhou Yu
244
Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding PDF ↗
Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng
245
SVAgent: Storyline-guided Long Video Understanding via Cross- Modal Multi-Agent Collaboration PDF ↗
Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan
246
Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding PDF ↗
Thinesh Thiyakesan Ponbagavathi, Constantin Seibold, Alina Roitberg
247
Structural Graph Probing of Vision–Language Models PDF ↗
Haoyu He, Yue Zhuo, Yu Zheng, Qi R. Wang
248
Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward PDF ↗
Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou
249
Hidden Monotonicity: Explaining Deep Neural Networks via their DC Decomposition PDF ↗
Jakob Paul Zimmermann, Georg Loho
250
MaskDiME: Adaptive Masked Diffusion for Precise and Efficient Visual Counterfactual Explanations PDF ↗
Changlu Guo, Anders Nymark Christensen, Anders Bjorholm Dahl, Morten Rieger Hannemose
251
TRANSPORTER: Transferring Visual Semantics from VLM Manifolds PDF ↗
Alexandros Stergiou
252
Relational Visual Similarity PDF ↗
Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li
253
PointCNN++: Performant Convolution on Native Points PDF ↗
Lihan Li, Haofeng Zhong, Rui Bu, Mingchao Sun, Wenzheng Chen, Baoquan Chen, Yangyan Li
254
Fast Markov Random Field Optimisation for Topologically Noisy 3D Shape Matching PDF ↗
Paul Roetzer, Johan Thunberg, Zorah Lähner, Florian Bernard
255
LitePT: Lighter Yet Stronger Point Transformer PDF ↗
Yuanwen Yue, Damien Robert, Jianyuan Wang, Sunghwan Hong, Jan Dirk Wegner, Christian Rupprecht, Konrad Schindler
256
SuP: Sub-cloud Driven Point Cloud Registration PDF ↗
Sheldon Fung, Wei Pan, Ling Cao, Fei Hou, Ling Chen, Shasha Mao, Hongdong Li, Xuequan Lu
257
PQDT: Pseudo-Query Dual Transformer for Robust Point Cloud Restoration PDF ↗
Haoqing Wu, Alexa Nawotki, Jochen Garcke
258
Test-Time Training for LiDAR Semantic Segmentation under Corruption via Geometric Inlier Discrimination PDF ↗
Hyeonseong Kim, Hyun-Kurl Jang, Kuk-Jin Yoon
259
MHopReg: Efficient Hierarchical Multi-Hop Graph Search for Point Cloud Registration PDF ↗
Yue Wu, Feng Xiao, Yongzhe Yuan, Hao Li, Kaiyuan Feng, Maoguo Gong, Qiguang Miao, Wenping Ma
260
GEM: Generating LiDAR World Model via Deformable Mamba PDF ↗
Yang Wu, Zhaojiang Liu, Qiang Meng, Youquan Liu, Renliang Weng, Jianjun Qian, Jian Yang, Jin Xie
261
Hybrid Robust Collaborative Perception with LiDAR-4D Radar Fusion under Adverse Weather Conditions PDF ↗
Yuquan Yang, Hui Zhang, Wenyu Lu, Ziyin Zhang, Chuanming Zhang, Xiaohua Xu
262
Task-Driven Implicit Representations for Automated Design of LiDAR Systems PDF ↗
Nikhil Behari, Aaron Young, Tzofi Klinghoffer, Akshat Dave, Ramesh Raskar
263
Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection PDF ↗
Xueyang Kang, Zizhao Li, Tian Lan, Dong Gong, Kourosh Khoshelham, Liangliang Nan
264
When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models PDF ↗
Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai
265
Beyond Layer-Wise Merging: Chain-of-Merging for Vision-Language Models PDF ↗
Xinyu Zhang, Yuxuan Dong, Lingling Zhang, Chengyou Jia, ZhuoHang Dang, Yixing Yao, Yaqiang Wu, Basura Fernando, Jun Liu
266
GazeShift: Unsupervised Gaze Estimation and Dataset for VR PDF ↗
Gil Shapira, Ishay Goldin, Evgeny Artyomov, Donghoon Kim, Yosi Keller, Niv Zehngut
267
Improving Calibration in Test-Time Prompt Tuning for Vision- Language Models via Data-Free Flatness-Aware Prompt Pretraining PDF ↗
Hyeonseo Jang, Jaebyeong Jeon, Joong-Won Hwang, Kibok Lee
268
Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP PDF ↗
Jonas Herzog, Yue Wang
269
Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design PDF ↗
Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv
270
Soft Modality-Guided Expert Specialization in MoE-VLMs PDF ↗
Zi-Hao Bo, Yaqian Li, Anzhou Hou, Rinyoichi Takezoe, Ertao Zhao, Tianxiang Pan, Jiale Yan, Mo Guang, Kaiwen Long
271
CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models PDF ↗
Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang
272
Retrieving Counterfactuals Improves Visual In-Context Learning PDF ↗
Guangzhi Xiong, Sanchit Sinha, Zhenghao He, Aidong Zhang
273
AutoRegressive Generation with B-rep Holistic Token Sequence Representation PDF ↗
Jiahao Li, Yunpeng Bai, Yongkang Dai, Hao Guo, Hongping Gan, Yilei Shi
274
VecGlypher: Unified Vector Glyph Generation with Language Models PDF ↗
Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han
275
NERFIFY: A Multi-Agent Framework for Turning NeRF Papers into Code PDF ↗
Seemandhar Jain, Keshav Gupta, Kunal Gupta, Manmohan Chandraker
276
Diagram2Structure: Unlocking LLMs' Diagram Comprehension through DiagramDiff, an Offline Diagram Structuring Framework
Haoxiang Hu, Yaokun Li, Zeyuan Huang, Cangjun Gao, Qiang He, Qingkun Li, Xiaoming Deng, Cuixia Ma, Yu-Kun Lai, Yong-Jin Liu, Hongan Wang
277
ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement PDF ↗
Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie
278
GardenDesigner: Encoding Aesthetic Principles into Jiangnan Garden Construction via a Chain of Agents PDF ↗
Mengtian Li, Fan Yang, Ruixue Xiong, Yiyan Fan, Zhifeng Xie, Zeyu Wang
279
ShadowDraw: From Any Object to Shadow-Drawing Compositional Art PDF ↗
Rundong Luo, Noah Snavely, Wei-Chiu Ma
280
End-to-End Hyper-Relational Information Extraction for Engineering Diagrams via Dynamically Tokenized Relation Transformer PDF ↗
Tianyou Bai, Yan-Ming Zhang, Zixiang Zhang, Jibin Zhou, Fei Yin, Cheng-Lin Liu
281
When Anonymity Breaks: Identifying Models Behind Text-to- Image Leaderboards PDF ↗
Ali Naseh, Anshuman Suri, Yuefeng Peng, Harsh Chaudhari, Alina Oprea, Amir Houmansadr
282
Bias at the End of the Score PDF ↗
Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky
283
PECCVAI: Overcoming the Brittleness of AI Image Watermarking Under Visual Paraphrasing Attacks PDF ↗
Shreyas Dixit, Ashhar Aziz, Shashwat Bajpai, Vasu Sharma, Aman Chadha, Vinija Jain, Amitava Das
284
Dynamic Token Reweighting for Robust Vision-Language Models PDF ↗
Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang
285
COPYLENS: Towards Copyrighted Characters Infringement Detection via Copyright-Aware Prompt Learning PDF ↗
Yaoyu Jin, Xiaochun Yang, Hong Liu, Leixia Wang, Jian Li, Rui Ding, Bin Wang
286
Closed-Form Concept Erasure via Double Projections PDF ↗
Chi Zhang, Jingpu Cheng, Zhixian Wang, Ping Liu
287
Adaptive Bayesian Early-Exit Networks for Efficient Non-Transferable Learning PDF ↗
Siyu Luan, Yan Li, Zhong Chen, Zhenyi Wang
288
Stake the Points: Structure-Faithful Instance Unlearning PDF ↗
Kiseong Hong, JungKyoo Shin, Eunwoo Kim
289
Federated Active Learning Under Extreme Non-IID and Global Class Imbalance PDF ↗
Chen-Chen Zong, Sheng-Jun Huang
290
FedRG: Unleashing the Representation Geometry for Federated Learning with Noisy Clients PDF ↗
Tian Wen, Zhiqin Yang, Yonggang Zhang, Xuefeng Jiang, Hao Peng, Yuwei Wang, Bo Han
291
FedCART: Tackling Long-Tailed Distributions in Federated Adversarial Training via Classifier Refinement PDF ↗
Yuchen Qin, Yizhi Zhou, Junxiao Wang, Xin Xie, Heng Qi
292
Generalized and Personalized Federated Learning with Black-Box Foundation Models via Orthogonal Transformations PDF ↗
Eun Gyung Kong, Jewon Yeom, Yonghoon Jeon, Taesup Kim
293
Fully Decentralized Certified Unlearning PDF ↗
Hithem Lamri, Michail Maniatakos
294
Fed-ADE: Adaptive Learning Rate for Federated Post-adaptation under Distribution Shift PDF ↗
Heewon Park, Mugon Joe, Miru Kim, Kyungjin Im, Minhae Kwon
295
Towards Streaming Referring Video Segmentation via Large Language Model PDF ↗
Wenkang Zhang, Kaicheng Yang, Xiang An, Qiang Li, Ziyong Feng, Wankou Yang, Jiankang Deng
296
Multi-speaker Attention Alignment for Multimodal Social Interaction PDF ↗
Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato
297
OmniVTG: A Large-Scale Dataset and Training Paradigm for Open- World Video Temporal Grounding PDF ↗
Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu
298
SARL-STG: A Spatially Aware Reinforcement Learning Framework for Refining MLLMs in Spatio-Temporal Video Grounding PDF ↗
Hong Gao, Xiangkai Xu, Bin Zhong, Junjie Yin, Fangyu Kang, Yutong Xu, Xiugang Dong, Xurui Gao, Min-Ling Zhang
299
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding PDF ↗
Shihao Wang, Guo Chen, De-An Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jan Kautz, Jose M. Alvarez, Lei Zhang, Zhiding Yu
300
DeRVOS: Decoupling Consistent Trajectory Generation and Multimodal Understanding for Referring Video Object Segmentation PDF ↗
Wenxuan Cheng, Ming Dai, Huimin Lu, Wankou Yang
301
UniCompress: Token Compression for Unified Vision–Language Understanding and Generation PDF ↗
Ziyao Wang, Chen Chen, Jingtao Li, Weiming Zhuang, Jiabo Huang, Ang Li, Lingjuan Lyu
302
StreamingTOM: Streaming Token Compression for Efficient Video Understanding PDF ↗
Xueyi Chen, Keda Tao, Kele Shao, Huan Wang
303
SCoRe: Salience-Coverage Reduction for Vision Token Pruning in Vision-Language Models PDF ↗
Tong Xu, Hailong Shi, Xingyu Gao
304
VLM-PTQ: Efficient Post-Training Quantization for Large Vision- Language Models PDF ↗
Juncan Deng, Kejie Huang
305
Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow PDF ↗
Chengxin Liu, Wonseok Choi, Chenshuang Zhang, Tae-Hyun Oh
306
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization PDF ↗
Chenwei Jia, Baoting Li, Xuchong Zhang, Mingzhuo Wei, Bochen Lin, Hongbin Sun
307
Rethinking Token Reduction for Large Vision- Language Models PDF ↗
Yi Wang, Haofei Zhang, Qihan Huang, Anda Cao, Gongfan Fang, Wei Wang, Xuan Jin, Jie Song, Mingli Song, Xinchao Wang
308
Prototype-based Causal Intervention for Multi-Label Image Classification PDF ↗
Yanmin Li, Zhilong Mao, Mao Wang, Lihua Liu, Jibing Wu, Weidong Bao
309
FAST: Topology-Aware Frequency-Domain Distribution Matching for Coreset Selection PDF ↗
Jin Cui, Boran Zhao, Jiajun Xu, Jiaqi Guo, Shuo Guan, Pengju Ren
310
Face-Guided Sentiment Boundary Enhancement for Weakly- Supervised Temporal Sentiment Localization PDF ↗
Cailing Han, Zhangbin Li, Jinxing Zhou, Wei Qian, Jingjing Hu, Yanghao Zhou, Zhangling Duan, Dan Guo
311
Evidential Deep Partial Label Learning to Quantify Disambiguation Uncertainty PDF ↗
Jinfu Fan, Jiangnan Li, Xiaohui Zhong, Kangrui Ren, Zhencun Jiang, Min Gan, Tianhao Gu, Linqing Huang
312
Unlocking Strong Supervision: A Data-Centric Study of General- Purpose Audio Pre-Training Methods PDF ↗
Xuanru Zhou, Yiwen Shao, Wei-Cheng Tseng, Dong Yu
313
Revisiting Learning with Noisy Labels: Active Forgetting and Noise Suppression PDF ↗
Mengmeng Sheng, Zeren Sun, Tao Chen, Jinshan Pan, Yazhou Yao, Fumin Shen
314
PAF: Perturbation-Aware Filtering for Open-Set Semi-Supervised Learning PDF ↗
Yinan Han, Qing-Yuan Jiang
315
Global-Graph Guided and Local-Graph Weighted Contrastive Learning for Unified Clustering on Incomplete and Noise Multi-View Data PDF ↗
Hongqing He, Jie Xu, Wenyuan Yang, Yonghua Zhu, Guoqiu Wen, Xiaofeng Zhu
316
Enhancing Out-of-Distribution Detection with Extended Logit Normalization PDF ↗
Yifan Ding, Xixi Liu, Jonas Unger, Gabriel Eilertsen
317
Unleashing VLA Potentials in Autonomous Driving via Explicit Learning from Failures PDF ↗
Yuechen Luo, Fang Li, Qimao Chen, Shaoqing Xu, Jiaxin Liu, Ziying Song, Zhi-xin Yang, Fuxi Wen
318
Unposed-to-3D: Learning Simulation-Ready Vehicles from Real- World Images PDF ↗
Hongyuan Liu, Bochao Zou, Qiankun Liu, Haochen Yu, Qi Mei, Jianfei Jiang, Chen Liu, Cheng Bi, Zhao Wang, Xueyang Zhang, Yifei Zhan, Jiansheng Chen, Huimin Ma
319
SafeDrive: Fine-Grained Safety Reasoning for End-to-End Driving in a Sparse World PDF ↗
Jungho Kim, Jiyong Oh, Seunghoon Yu, Hongjae Shin, Donghyuk Kwak, Jun Won Choi
320
RAG-TP: A General Framework for Vehicle Trajectory Prediction via Retrieval-Augmented Generation PDF ↗
Ziyi Wang, Yang Zhang, Guijian Tang, Chao Zhang, Shibo Zhang, Xueqiong Li, Shaowu Yang
321
Perceiving the Near, Reasoning the Distant: Coherent Long-Horizon Trajectory Prediction for Autonomous Driving PDF ↗
Hua Hu, Zikang Zhou, Qian Zhou, Zihao Wen, Junjie Hu, Xinhong Chen, Zhengmin Jiang, Yung-Hui Li, Jianping Wang
322
Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual–Inertial Odometry PDF ↗
Feiyang Pan, Shenghe Zheng, Chunyan Yin, Guangbin Dou
323
HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles PDF ↗
Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang
324
AMap: Distilling Future Priors for Ahead-Aware Online HD Map Construction PDF ↗
Ruikai Li, Xinrun Li, Mengwei Xie, Hao Shan, Shoumeng Qiu, Xinyuan Chang, Yizhe Fan, Feng Xiong, Han Jiang, Yilong Ren, Haiyang Yu, Mu Xu, Yang Long, Varun Ojha, Zhiyong Cui
325
WAM-Flow: Parallel Coarse-to-Fine Motion Planning via Discrete Flow Matching for Autonomous Driving PDF ↗
Yifang Xu, Jiahao Cui, Zhihao Zhu, Hanlin Shang, Shan Luan, Mingwang Xu, Feipeng Cai, Neng Zhang, Yaoyi Li, Jia Cai, Siyu Zhu
326
PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning PDF ↗
Hongchen Li, Tianyu Li, Jiazhi Yang, Mingyang Shang, Gaoqiang Wu, Caojun Wang, Haochen Tian, Zengrong Lin, Zhihui Hao, XianPeng Lang, Jia Hu, Hongyang Li
327
MARIS: Marine Open-Vocabulary Instance Segmentation PDF ↗
Bingyu Li, Feiyu Wang, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li
328
XSeg: A Large-scale X-ray Contraband Segmentation Benchmark For Real-World Security Screening PDF ↗
Hongxia Gao, Yixin Chen, Jiali Wen, Litao Li, Qianyun Liu, Kaijie Zhang
329
Training-Free Open-Vocabulary Camouflaged Object Segmentation via Fine-Grained Object Binding and Adaptive Hybrid Prompt PDF ↗
Peng Ren, Cheng Jiang, Chuande Yang, Fuming Sun, Tian Bai
330
M⁴-SAM: Multi-Modal Mixture-of-Experts with Memory-Augmented SAM for RGB-D Video Salient Object Detection
Jiyuan Liu, Jia Lin, Xiaofei Zhou, Runmin Cong, Deyang Liu, Zhi Liu
331
ReAttnCLIP: Training-Free Open-Vocabulary Remote Sensing Image Segmentation via Re-defined Attention in CLIP PDF ↗
Xin Niu, Manqi Zhao, Dongsheng Jiang, Yingying Wu, Bing Su
332
Mixture of Prototypes for Test-time Adaptive Segmentation PDF ↗
Guangrui Li, Zhengyu Zhu, Yongxin Ge
333
Reconstruction-Guided Slot Curriculum: Addressing Object Over- Fragmentation in Video Object-Centric Learning PDF ↗
WonJun Moon, Hyun Seok Seong, Jae-Pil Heo
334
ELVIS: Enhance Low-Light for Video Instance Segmentation in the Dark PDF ↗
Joanne Lin, Ruirui Lin, Yini Li, David Bull, Nantheera Anantrasirichai
335
Decouple Your Discovery and Memory in Continual Generalized Category Discovery PDF ↗
Jiawei Yu, Zijian Gao, Xingxing Zhang, Xuan Liu, Huaimin Wang, Kele Xu
336
Beyond the Static World: Continual Category Discovery under Visual Drift PDF ↗
Wei Feng, Yiwen Jiang, Sijin Zhou, Zongyuan Ge
337
Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation PDF ↗
Yutong Zhang, Jiaxin Chen, Honglin Chen, Kaiqi Zheng, Shengcai Liao, Hanwen Zhong, Weixin Li, Yunhong Wang
338
SAME: Sparse and Anchored Model Editing for Heterogeneous Incremental Learning under Limited Data PDF ↗
Zixuan Duan, Zeyu Zhang, Fengyuan Lu, Shaofeng Zhang, Wenbin Li, Qi Fan, Yang Gao
339
CHEEM: Continual Learning by Reuse, New, Adapt and Skip - A Hierarchical Exploration-Exploitation Approach PDF ↗
Chinmay Savadikar, Michelle Dai, Tianfu Wu
340
Exemplar-Free Continual Learning for State Space Models PDF ↗
Isaac Ning Lee, Leila Mahmoodi, Trung Le, Mehrtash Harandi
341
A Faster Path to Continual Learning PDF ↗
Wei Li, Hangjie Yuan, Zixiang Zhao, Borui Kang, Ziwei Liu, Tao Feng
342
Continual Learning for fMRI-Based Brain Disorder Diagnosis via Functional Connectivity Matrices Generative Replay PDF ↗
Qianyu Chen, Shujian Yu
343
BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling PDF ↗
Jiachen Yang, Xianhui Lin, Yi Dong, Zebiao Zheng, Xing Liu, Hong Gu, Yanmei Fang
344
SyncDreamer: Controllable and Expressive Avatar Generation Beyond the Talking Head PDF ↗
Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Josef Kittler, Muhammad Awais
345
PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing PDF ↗
Jiadong Liang, Bojun Xiong, Jie Tian, Hua Li, Xiao Long, Yong Zheng, Huan Fu
346
UniLS: End-to-End Audio-Driven Avatars for Unified Listening and Speaking PDF ↗
Xuangeng Chu, Ruicong Liu, Yifei Huang, Yun Liu, Yichen Peng, Bo Zheng
347
PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation PDF ↗
Baiqin Wang, Xiangyu Zhu, Fan Shen, Hao Xu, Zhen Lei
348
FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction PDF ↗
Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Kai Qiu, Chong Luo, Zuxuan Wu
349
DriveVLN: Towards Mapless Vision-and-Language Navigation in Autonomous Driving PDF ↗
Dongqian Guo, Haoran Wei, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen
350
Towards Open Environments and Instructions: General Vision- Language Navigation via Fast-Slow Interactive Reasoning PDF ↗
Yang Li, Aming Wu, Zihao Zhang, Yahong Han
351
Unifying Language-Action Understanding and Generation for Autonomous Driving PDF ↗
Xinyang Wang, Qian Liu, Wenjie Ding, Zhao Yang, Wei Li, Chang Liu, Bailin Li, Kun Zhan, Xianpeng Lang, Wei Chen
352
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving PDF ↗
Zehao Wang, Huaide Jiang, Shuaiwu Dong, Yuping Wang, Hang Qiu, Jiachen Li
353
Prune2Drive: A Plug-and-Play Framework for Accelerating Vision- Language Models in Autonomous Driving PDF ↗
Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Linfeng Zhang
354
CGHair: Compact Gaussian Hair Reconstruction with Card Clustering PDF ↗
Haimin Luo, Srinjay Sarkar, Albert Mosella-Montoro, Francisco Vicente Carrasco, Fernando De la Torre
355
HyperGaussians: High-Dimensional Gaussian Splatting for High- Fidelity Animatable Face Avatars PDF ↗
Gent Serifi, Marcel C. Buehler
356
Skullptor: High Fidelity 3D Head Reconstruction in Seconds with Multi-View Normal Prediction PDF ↗
Noé Artru, Rukhshanda Hussain, Emeline Got, Alexandre Messier, David B. Lindell, Abdallah Dib
357
RelightAnyone: A Generalized Relightable 3D Gaussian Head Model PDF ↗
Yingyan Xu, Studios 0000-0002-8076-1947, Pramod Rao, Sebastian Weiss, Studios blank, Gaspard Zoss, Studios blank, Markus Gross, Studios; ETH Zurich blank, Christian Theobalt, Marc Habermann, Derek Bradley, Studios blank
358
Feed-forward Gaussian Registration for Head Avatar Creation and Editing PDF ↗
Malte Prinzler, Paulo Gotardo, Siyu Tang, Timo Bolkart
359
Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance PDF ↗
Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong
360
Prefill-Time Intervention for Mitigating Hallucination in Large Vision- Language Models PDF ↗
Chengsheng Zhang, Chenghao Sun, Xinyan Jiang, Wei Li, Xinmei Tian
361
SVHalluc: Benchmarking Speech–Vision Hallucination in Audio- Visual Large Language Models PDF ↗
Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh
362
Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination PDF ↗
Zichuan Wang, Songlin Yang, Bo Peng, Zhenchen Tang, Yang Li, Beibei Dong, Jing Dong
363
Understanding the Role of Hallucination in Reinforcement Post- Training of Multimodal Reasoning Models PDF ↗
Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen
364
Lyapunov Probes for Hallucination Detection in Large Foundation Models PDF ↗
Bozhi Luan, Gen Li, Yalan Qin, Jifeng Guo, Yun Zhou, Faguo Wu, Hongwei Zheng, Wenjun Wu, Zhaoxin Fan
365
Captain Safari: A World Engine with Pose-Aligned 3D Memory PDF ↗
Yu-Cheng Chou, Xingrui Wang, Yitong Li, Jiahao Wang, Hanting Liu, Cihang Xie, Alan Yuille, Junfei Xiao
366
Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction PDF ↗
Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, Yiyi Liao
367
PerpetualWonder: Long-horizon Action-conditioned 4D Scene Generation PDF ↗
Jiahao Zhan, Zizhang Li, Hong-Xing Yu, Jiajun Wu
368
CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation PDF ↗
Kaiyi Huang, Yukun Huang, Yu Li, Jianhong Bai, Xintao Wang, Zinan Lin, Xuefei Ning, Jiwen Yu, Yu Wang, Xihui Liu
369
DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos PDF ↗
Yuan Huang, Sijie Zhao, Jing Cheng, Hao Xu, Shaohui Jiao
370
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation PDF ↗
Vaibhav Agrawal, Rishubh Parihar, Pradhaan S Bhat, Ravi Kiran Sarvadevabhatla, Venkatesh Babu Radhakrishnan
371
RecEdit-Drive: 3D Reconstruction-Guided Spatiotemporal Video Editing for Autonomous Driving Scenes PDF ↗
Yipeng Wu, Xin Wang, Chenghan Yang, Chong Wang, Dongdong Wu, Wanchao Su, Hengshuang Zhao, Wei Feng, Kairui Yang, Di Lin
372
RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space PDF ↗
Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan
373
RigMo: Unifying Rig and Motion Learning for Generative Animation PDF ↗
Hao Zhang, Jiahao Luo, Bohui Wan, Yizhou Zhao, Zongrui Li, Michael Vasilkovsky, Chaoyang Wang, Jian Wang, Narendra Ahuja, Bing Zhou
374
LaVR: Scene Latent Conditioned Generative Video Trajectory Re- Rendering using Large 4D Reconstruction Models PDF ↗
Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo
375
WHU-MARS: A Multispectral Aerial-Ground Benchmark Towards Any- Scenario Person Re-Identification PDF ↗
Yuxuan Zhao, Zhongao Zhou, Bin Yang, He Li, Jian Liang, Jun Chen, Bo Du, Mang Ye
376
Detect Anything via Next Point Prediction PDF ↗
Qing Jiang, Junan Huo, Xingyu Chen, Yuda Xiong, Zhaoyang Zeng, Yihao Chen, Tianhe Ren, Junzhi Yu, Lei Zhang
377
Text-guided Feature Disentanglement for Cross-modal Gait Recognition PDF ↗
Zhiyang Lu, Ming Cheng
378
Distribution-Aligned Multimodal Fusion for Robust Object Detection PDF ↗
Xiaohui Hao, Yanglin Pu, Yongjun Wang, Rui She
379
PaQ-DETR: Learning Pattern and Quality-Aware Dynamic Queries for Object Detection PDF ↗
Zhengjian Kang, Jun Zhuang, Kangtong Mo, Qi Chen, Rui Liu, Ye Zhang
380
Portable Active Learning for Object Detection PDF ↗
Rashi Sharma, Justin Timothy C. Bersamin, Karthikk Subramanian
381
Efficiency Follows Global-Local Decoupling PDF ↗
Zhenyu Yang, Gensheng Pei, Tao Chen, Yichao Zhou, Tianfei Zhou, Yazhou Yao, Fumin Shen
382
VRCLIP: Multimodal Canonical Correlation Alignment for CLIP- Driven Vision-Radio Person Re-Identification PDF ↗
Rui Zhang, Yaqi Wang, Yadong Li, Ruixu Geng, Jianyang Wang, Qijun Ying, Dongheng Zhang, Yang Hu, Yan Chen
383
EReCu: Pseudo-label Evolution Fusion and Refinement with Multi- Cue Learning for Unsupervised Camouflage Detection PDF ↗
Shuo Jiang, Gaojia Zhang, Min Tan, Yufei Yin, Gang Pan
384
Expert-Teacher-Student Collaborative Learning for Domain Adaptive Object Detection PDF ↗
Yiming Cui, Liang Li, Haibing Yin, Yuhan Gao, Xichun Sheng, Chenggang Yan
385
CI-VID: A Coherent Interleaved Text-Video Dataset PDF ↗
Yiming Ju, Jijin Hu, Zhengxiong Luo, Haoge Deng, hanyu Zhao, Li Du, Wenbo Xiao, Chengwei Wu, Donglin Hao, Xinlong Wang, Tengfei Pan
386
Generalizable Video Quality Assessment via Weak-to-Strong Learning PDF ↗
Linhan Cao, Wei Sun, Xiangyang Zhu, Kaiwei Zhang, Jun Jia, Yicong Peng, Dandan Zhu, Guangtao Zhai, Xiongkuo Min
387
EgoSound: Benchmarking Sound Understanding in Egocentric Videos PDF ↗
Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Yanwei Fu, Xiangyang Xue
388
WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning PDF ↗
Woongyeong Yeo, Kangsan Kim, Jaehong Yoon, Sung Ju Hwang
389
GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding PDF ↗
Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu
390
Select Less, Reason More: Prioritizing Evidence Purity for Video Reasoning PDF ↗
Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang
391
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos PDF ↗
Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong
392
Compositional Transformation Reasoning for Composed Video Retrieval PDF ↗
Sihong Huang, Jiaxin Wu, Dongmei Jiang, Yi Cai, Yaowei Wang, Xiaoyong Wei
393
UniVBench: Towards Unified Evaluation for Video Foundation Models PDF ↗
Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu
394
NAMI: Efficient Image Generation via Bridged Progressive Rectified Flow Transformers PDF ↗
Yuhang Ma, Bo Cheng, Shanyuan Liu, Hongyi Zhou, Liebucha Wu, Dawei Leng, Yuhui Yin
395
InverFill: One-Step Inversion for Enhanced Few-Step Diffusion Inpainting PDF ↗
Duc Vu, Kien Nguyen, Trong-Tung Nguyen, Ngan Nguyen, Phong Nguyen, Khoi Nguyen, Cuong Pham, Anh Tran
396
TimeRipples: Accelerating vDiTs by Understanding the Spatio- Temporal Correlations in Latent Space PDF ↗
Wenxuan Mao, Yulin Sun, Aiyue Chen, Jing Lin, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng
397
ProcessMaker: A Generalized Process Visualization Framework with Adaptive Sequence Steps on Diffusion Transformers PDF ↗
Mengling Xu, Sisi You, Yaning Li, Bing-Kun Bao
398
MeanFlow Transformers with Representation Autoencoders PDF ↗
Zheyuan Hu, Chieh-Hsin Lai, Ge Wu, Yuki Mitsufuji, Stefano Ermon
399
DiT-IC: Aligned Diffusion Transformer for Efficient Image Compression PDF ↗
Junqi Shi, Ming Lu, Xingchen Li, Anle Ke, Ruiqi Zhang, Zhan Ma
400
FARMER: Flow AutoRegressive Transformer over Pixels PDF ↗
Guangting Zheng, Qinyu Zhao, Tao Yang, Fei Xiao, Zhijie Lin, Jie Wu, Jiajun Deng, Yanyong Zhang, Rui Zhu
401
Probabilistic Precipitation Nowcasting with Rectified Flow Transformers PDF ↗
Johannes Schusterbauer, Jannik Wiese, Nick Stracke, Timy Phan, Björn Ommer
402
FlowDC: Flow-Based Decoupling-Decay for Complex Image Editing PDF ↗
Yilei Jiang, Zhen Wang, Yanghao Wang, Jun Yu, Yueting Zhuang, Jun Xiao, Long Chen
403
High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning PDF ↗
Dailan He, Xiahong Wang, Shulun Wang, Hao Shao, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li
404
3D-Object Perception Transformer (3PT) PDF ↗
Agastya Kalra, Tim Salzmann, Guy Stoppi, Dmitrii Marin, Rishav Agarwal, Vage Taamazyan, Martin Bokeloh, Stefan Hinterstoisser, Anton Boykov, Alberto Dall'Olio, Pravin Dangol, Kartik Venkataraman, Huaijin Chen
405
SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long- Tailed 3D Object Detection PDF ↗
Hao Vo, Khoa Vo, Thinh Phan, Ngo Xuan Cuong, Gianfranco Doretto, Hien Nguyen, Anh Nguyen, Ngan Le
406
Spe-BEVHead: Rethinking the Detection Head Design for Bird’s- Eye-View Object Detection PDF ↗
Junshu Zhang, Sicheng Zhao, Xin Zhao, Fan Yang, Ruike Chen, Jungong Han, Guiguang Ding
407
Unsupervised Multi-agent and Single-agent Perception from Cooperative Views PDF ↗
Haochen Yang, Baolu Li, Lei Li, Delin Ren, Jiacheng Guo, Minghai Qin, Tianyun Zhang, Hongkai Yu
408
Zoo3D: Zero-Shot 3D Object Detection at Scene Level PDF ↗
Andrey Lemeshko, Bulat Gabdullin, Nikita Drozdov, Anton Konushin, Danila Rukhovich, Maksim Kolodiazhnyi
409
Beyond Appearance: Camouflaged Object Detection via Geometric Structure PDF ↗
Jinyu Han, Changguang Wu, Fuming Sun, Jinhui Tang
410
SABER: Spatially Consistent 3D Universal Adversarial Objects for BEV Detectors PDF ↗
Aixuan Li, Mochu Xiang, Bosen Hou, Zhexiong Wan, Jing Zhang, Yuchao Dai
411
AceTone: Bridging Words and Colors for Conditional Image Grading PDF ↗
Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye
412
Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions PDF ↗
Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy
413
Pixels Don't Lie (But Your Detector Might): Bootstrapping MLLM- as-a-Judge for Trustworthy Deepfake Detection and Reasoning Supervision PDF ↗
Kartik Kuckreja, Parul Gupta, Muhammad Haris Khan, Abhinav Dhall
414
UI-Lens: Assessing General MLLMs’ Potential to Automate UI Display Quality Assurance PDF ↗
Wei Xiang, Yexinrui Wu, Xinli Chen, Xinran Li, Shi Chen
415
Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement PDF ↗
Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie
416
Is your VLM Sky-Ready? A Comprehensive Spatial Intelligence Benchmark for UAV Navigation PDF ↗
Lingfeng Zhang, Yuchen Zhang, Hongsheng Li, Haoxiang Fu, Yingbo Tang, Hangjun Ye, Long Chen, Xiaojun Liang, Xiaoshuai Hao, Wenbo Ding
417
Linking Perception, Confidence and Accuracy in MLLMs PDF ↗
Yuetian Du, Yucheng Wang, Rongyu Zhang, Zhijie Xu, Boyu Yang, Ming Kong, Jie Liu, Qiang Zhu
418
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models PDF ↗
Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Jihyung Kil, Wei-Lun Chao
419
Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs PDF ↗
Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu
420
From Pixel to Precision: Enhancing Handwritten Mathematical Expression Recognition with Image-Level Reward PDF ↗
Ze Liu, Kai Zhang, Xianquan Wang, Shuochen Liu, Jiaxian Yan, Yupeng Han, Qi Liu
421
Rethinking Pose Refinement in 3D Gaussian Splatting under Pose Prior and Geometric Uncertainty PDF ↗
Mangyu Kong, Jaewon Lee, Seongwon Lee, Euntai Kim
422
Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstruction PDF ↗
Kiseok Choi, Hyeongjun Cho, Inchul Kim, Min H. Kim
423
Seele: A Unified Acceleration Framework for Real-Time Gaussian Splatting on Mobile Devices PDF ↗
He Zhu, Xiaotong Huang, Zihan Liu, Weikai Lin, Xiaohong Liu, Zhezhi He, Jingwen Leng, Minyi Guo, Yu Feng
424
GHPT: Real-Time Relightable Gaussian Splatting using Hybrid Path Tracing PDF ↗
Jinyang Bo, Fan Dou, Wenrui Quan, Shangxun Liu, Yang Xu, Yuhe Zhang, Kang Li, Guohua Geng
425
PolarGuide-GSDR: 3D Gaussian Splatting Driven by Polarization Priors and Deferred Reflection for Real-World Reflective Scenes PDF ↗
Derui Shan, Qian Qiao, Hao Lu, Tao Du, Peng Lu
426
EcoSplat: Efficiency-controllable Feed-forward 3D Gaussian Splatting from Multi-view Images PDF ↗
Minh-Quan Viet Bui, Jongmin Park, Juan Luis Gonzalez, Jaeho Moon, Jihyong Oh, Munchurl Kim
427
SGS-Intrinsic: Semantic-Invariant Gaussian Splatting for Sparse- View Indoor Inverse Rendering PDF ↗
Jiahao Niu, Rongjia Zheng, Wenju Xu, Wei-Shi Zheng, Qing Zhang
428
GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views PDF ↗
Tianyu Chen, Wei Xiang, Kang Han, Yu Lu, Di Wu, Gaowen Liu, Ramana Rao Kompella
429
3D Gaussian Splatting with Self-Constrained Priors for High Fidelity Surface Reconstruction PDF ↗
Takeshi Noda, Yu-Shen Liu, Zhizhong Han
430
FilterGS: Traversal-Free Parallel Filtering and Adaptive Shrinking for Large-Scale LoD 3D Gaussian Splatting PDF ↗
Yixian Wang, Haolin Yu, Jiadong Tang, Yu Gao, Xihan Wang, Yufeng Yue, Yi Yang
431
TWINGS: Thin Plate Splines Warp-aligned Initialization for Sparse- View Gaussian Splatting PDF ↗
Hyeseong Kim, Geonhui Son, Deukhee Lee, Dosik Hwang
432
VarSplat: Uncertainty-aware 3D Gaussian Splatting for Robust RGB-D SLAM PDF ↗
Anh Thuan Tran, Jana Kosecka
433
SpeeDe3DGS: Speedy Deformable 3D Gaussian Splatting with Temporal Pruning and Motion Grouping PDF ↗
Allen Tu, Haiyang Ying, Alex Hanson, Yonghan Lee, Tom Goldstein, Matthias Zwicker
434
FastGS: Training 3D Gaussian Splatting in 100 Seconds PDF ↗
Shiwei Ren, Tianci Wen, Yongchun Fang, Biao Lu
435
BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting PDF ↗
Jiaxing Yu, Dongyang Ren, Hangyu Xu, Zhouyuxiao Yang, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo
436
ODGS-SLAM: Omnidirectional Gaussian Splatting SLAM PDF ↗
Stefan Spiss, Joey Hieronimy, Marcel Ritter, Matthias Harders
437
BA-GS: Bayesian Adaptive Gaussian Splatting for SFM-Free 3D Reconstruction PDF ↗
Zhongjie Ma, Di Lin, Xin Wang, Haotian Dong, Chong Wang, Dongdong Wu, Changqing Zhang
438
FSFSplatter: Geometrically Accurate Reconstruction with Free Sparse-view Images within 2 minutes PDF ↗
Yibin Zhao, Yihan Pan, Jun Nan, Liwei Chen, Jianjun Yi
439
ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking PDF ↗
Lihong Wang, Liangqi Li, Weiwei Feng, Jiamin Wu, Changtao Miao, Tieru Wu, Rui Ma, Bo Zhang, Zhe Li
440
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought PDF ↗
Yiyang Zhou, Haoqin Tu, Zijun Wang, Zeyu Wang, Niklas Muennighoff, Fan Nie, Chaorui Deng, Shen Yan, Haoqi Fan, Yejin Choi, James Zou, Cihang Xie, Huaxiu Yao, Qinghao Ye
441
PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation PDF ↗
Shuyan Ke, Yifan Mei, Changli Wu, Yonghan Zheng, Jiayi Ji, Liujuan Cao, Rongrong Ji
442
Can a Second-View Image Be a Language? Geometric and Semantic Cross-Modal Reasoning for X-ray Prohibited Item Detection PDF ↗
Chuang Peng, Renshuai Tao, Zhongwei Ren, Xianglong Liu, Yunchao Wei
443
VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging PDF ↗
Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang
444
Learning to See through Illumination Extremes with Event Streaming in Multimodal Large Language Models PDF ↗
Baoheng Zhang, Jiahui Liu, Gui Zhao, Weizhou Zhang, Yixuan Ma, Jun Jiang, Yingxian Chen, Wilton W.T. Fok, Xiaojuan Qi, Hayden Kwok-Hay So
445
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation PDF ↗
Walid Bousselham, Hilde Kuehne, Cordelia Schmid
446
Cut to the Chase: Training-free Multimodal Summarization via Chain- of-Events PDF ↗
Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu
447
UVU: Improving Multimodal Understanding via Vision-Language Unified Autoregressive Paradigm PDF ↗
Zhehan Kan, Xinghua Jiang, Yanlin Liu, Xiaochen Yang, Zhixiang Wei, Shifeng Liu, Yubo Zhu, Qingmin Liao, Wenming Yang, Xin Li, Yinsong Liu, Deqiang Jiang, Xing Sun
448
PointThinker: Point-Incentivized Parallel Thinking for Multimodal Large Language Model PDF ↗
Zhengdong Hu, Chao Wang, Fengyun Rao, Jing LYU, Hehe Fan, Yi Yang
449
OctoMed: Data Recipes for State-of-the-Art Multimodal Medical Reasoning PDF ↗
Timothy Ossowski, Sheng Zhang, Qianchu Liu, Guanghui Qin, Reuben Tan, Tristan Naumann, Junjie Hu, Hoifung Poon
450
HoneyBee: Data Recipes for Vision-Language Reasoners PDF ↗
Hritik Bansal, Devendra Singh Sachan, Kai-Wei Chang, Aditya Grover, Gargi Ghosh, Wen-tau Yih, Ramakanth Pasunuru
451
VisPlay: Self-Evolving Vision-Language Models PDF ↗
Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, Yonghui Yang
452
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts PDF ↗
Hongkun Pan, Yuwei Wu, Wanyi Hong, Shenghui Hu, Qitong Yan, Yi Yang, Rufei Han, Changju Zhou, Minfeng Zhu, Dongming Han, Wei Chen
453
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation PDF ↗
Ziyu Guo, Renrui Zhang, Hongyu Li, Manyuan Zhang, Xinyan Chen, Sifan Wang, Yan Feng, Peng Pei, Pheng-Ann Heng
454
ApET: Approximation-Error Guided Token Compression for Efficient VLMs PDF ↗
Qiankun Ma, Ziyao Zhang, Haofei Wang, Zhen Song, Jie Chen, Hairong Zheng
455
Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM PDF ↗
Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin
456
Vision Transformers Need More Than Registers PDF ↗
Cheng Shi, Yizhou Yu, Sibei Yang
457
Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation PDF ↗
Jiaye Li, Baoyou Chen, Hui Li, Zilong Dong, Jingdong Wang, Siyu Zhu
458
PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion PDF ↗
Jaehyun Choi, Jiwan Hur, Gyojin Han, Jaemyung Yu, Junmo Kim
459
AdaSVD: Singular Value Decomposition with Adaptive Mechanisms for Large Multimodal Models PDF ↗
Zhiteng Li, Mingyuan Xia, Jingyuan Zhang, Zheng Hui, Haotong Qin, Linghe Kong, Yulun Zhang, Xiaokang Yang
460
ReFTA: Breaking the Weight Reconstruction Bottleneck in Tensorized Parameter-Efficient Fine-Tuning PDF ↗
Jingjing Zheng, Anda Tang, Qiangqiang Mao, Zhouchen Lin, Yankai Cao
461
HTTM: Head-wise Temporal Token Merging for Faster VGGT PDF ↗
Weitian Wang, Lukas Meiner, Rai Shubham, Cecilia De La Parra, Akash Kumar
462
Reparameterized Tensor Ring Functional Decomposition for Multi- Dimensional Data Recovery PDF ↗
Yangyang Xu, Junbo Ke, You-Wei Wen, Chao Wang
463
Self-Attention Driven Tensor Representation for High-Order Data Recovery PDF ↗
Zhi-Wei Shi, Yu-Bang Zheng, Heng-Chao Li
464
PlanaReLoc: Camera Relocalization in 3D Planar Primitives via Region-Based Structure Matching PDF ↗
Hanqiao Ye, Yuzhou Liu, Yangdong Liu, Shuhan Shen
465
MOGeo: Beyond One-to-One Cross-View Object Geo-localization PDF ↗
Bo Lv, Qingwang Zhang, Le Wu, Yuanyuan Li, Yingying Zhu
466
Homaloidal parametrization for detecting critical two-view configurations PDF ↗
Rakshith Madhavan, Matteo Forlivesi, Marina Bertolini, Cristina Turrini, Federica Arrigoni, Luca Magri
467
AsymLoc: Towards Asymmetric Feature Matching for Efficient Visual Localization PDF ↗
Mohammad Omama, Gabriele Berton, Eric Foxlin, Yelin Kim
468
MMLandmarks: a Cross-View Instance-Level Benchmark for Geo- Spatial Understanding PDF ↗
Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos
469
Asking like Socrates: Socrates helps VLMs understand remote sensing images PDF ↗
Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li
470
GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training PDF ↗
Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye
471
Let VLMs Grade Their Own Thoughts: A Self-Quantification Approach to Reasoning-Aware Reward Modeling PDF ↗
Xing Xi, Yu Qiu, Ronghua Luo, Peixian Chen, peilin tong
472
SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System PDF ↗
Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan
473
SenseSearch: Empowering Vision-Language Models with High- Resolution Agentic Search-Reasoning via Reinforcement Learning PDF ↗
Yong Xien Chng, Tao Hu, Wenwen Tong, Xueheng Li, Jiandong Chen, Haojia Yu, Jiefan Lu, Hewei Guo, Hanming Deng, Chengjun Xie, Gao Huang, Lewei Lu
474
Scaling Agentic Reinforcement Learning for Tool-Integrated Reasoning in VLMs PDF ↗
Meng Lu, Ran Xu, Yi Fang, Wenxuan Zhang, Yue Yu, Gaurav Srivastava, Yuchen Zhuang, Mohamed Elhoseiny, Charles Fleming, Carl Yang, Zhengzhong Tu, Yang Xie, Guanghua Xiao, Di Jin, Wenqi Shi, Xuan Wang
475
VideoSSR: Video Self-Supervised Reinforcement Learning PDF ↗
Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng
476
Neurodynamics-Driven Coupled Neural P Systems for Multi- Focus Image Fusion PDF ↗
Bo Li, Yunkuo Lei, Tingting Bao, Hang Yan, Yaxian Wang, Weiping Fu, Lingling Zhang, Jun Liu
477
MagicFuse: Single Image Fusion for Visual and Semantic Reinforcement PDF ↗
Hao Zhang, Yanping Zha, Zizhuo Li, Meiqi Gong, Jiayi Ma
478
Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification PDF ↗
Zizhao Chen, Ping Wei, Ziyang Ren, Huan Li, Xiangru Yin
479
Human-Centric Multi-Exposure Fusion: Benchmark and Bi-level Cognition Distillation Framework PDF ↗
Jingjie Shang, Tengyu Ma, Heng Zhang, Jinyuan Liu, Risheng Liu, Yuan Wang, Xiaochen Bo
480
ConceptPose: Training-Free Zero-Shot Object Pose Estimation using Concept Vectors PDF ↗
Liming Kuang, Yordanka Velikova, Mahdi Saleh, Jan-Nico Zaech, Danda Pani Paudel, Benjamin Busam
481
A Closer Look at Cross-Domain Few-Shot Object Detection: Fine-Tuning Matters and Parallel Decoder Helps PDF ↗
Xuanlong Yu, Youyang Sha, Longfei Liu, Xi Shen, Di Yang
482
NAF: Zero-Shot Feature Upsampling via Neighborhood Attention Filtering PDF ↗
Loïck Chambon, Paul Couairon, Éloi Zablocki, Alexandre Boulch, Nicolas Thome, Matthieu Cord
483
Universal-to-Specific: Dynamic Knowledge-Guided Multiple Instance Learning for Few-Shot Whole Slide Image Classification PDF ↗
Junjian Li, Hulin Kuang, Jin Liu, Hailin Yue, Mengshen He, Jianxin Wang
484
SOTA: Self-adaptive Optimal Transport for Zero-Shot Classification with Multiple Foundation Models PDF ↗
Zhanxuan Hu, Qiyu Xu, Yu Duan, Yonghang Tai, Huafeng Li
485
Uni-DAD: Unified Distillation and Adaptation of Diffusion Models for Few-step Few-shot Image Generation PDF ↗
Yara Bahram, Mélodie Desbos, Mohammadhadi Shateri, Eric Granger
486
Streamlined Knowledge Distillation PDF ↗
Hyeon-Jin Jeong, Han-Jin Lee, Seok-Hwan Choi
487
Generalizable Knowledge Distillation from Vision Foundation Models for Semantic Segmentation PDF ↗
Chonghua Lv, Dong Zhao, Shuang Wang, Dou Quan, Ning Huyan, Nicu Sebe, Zhun Zhong
488
IMS3: Breaking Distributional Aggregation in Diffusion-Based Dataset Distillation PDF ↗
Chenru Wang, Yunyi Chen, Zijun Yang, Joey Tianyi Zhou, Chi Zhang
489
Continuous Exposure-Time Modeling for Realistic Atmospheric Turbulence Synthesis PDF ↗
Junwei Zeng, Dong Liang, Sheng-Jun Huang, Kun Zhan, Songcan Chen
490
240FPS Stereo Vision from Monocular Mixed Spikes PDF ↗
Yeliduosi Xiaokaiti, Yakun Chang, Yang Bai, Zhaojun Huang, Peiqi Duan, Boxin Shi
491
D^2-FOSA: Dual-Diffusion Guided EEG-to-Image Reconstruction with Frequency-Oriented Semantic Alignment PDF ↗
Chenglong Yu, Shuai Shen, Xiangsheng Li, Yang Li
492
Self-Diffusion Driven Blind Imaging PDF ↗
Yanlong Yang, Guanxiong Luo
493
Differentiable Stroke Planning with Dual Parameterization for Efficient and High-Fidelity Painting Creation PDF ↗
Jinfan Liu, Wuze Zhang, Zhangli Hu, Zhehan Zhao, Ye Chen, Bingbing Ni
494
Solvability of the Viewing Graph Under the Affine Camera Model PDF ↗
Gabriele Pedroni, Rakshith Madhavan, Federica Arrigoni
495
DiffBMP: Differentiable Rendering with Bitmap Primitives PDF ↗
Seongmin Hong, Junghun James Kim, Daehyeop Kim, Insoo Chung, Se Young Chun
496
Splat-Based Metal Artifact Reduction in Cone-Beam CT via Compact Attenuation Modeling PDF ↗
Kiseok Choi, Jaemin Cho, Inchul Kim, Min H. Kim
497
Lumosaic: Hyperspectral Video via Active Illumination and Coded- Exposure Pixels PDF ↗
Dhruv Verma, Andrew Qiu, Roberto Rangel, Ayandev Barman, Hao Yang, Chenjia Hu, Fengqi Zhang, Roman Genov, David B. Lindell, Kiriakos N. Kutulakos, Alex Mariakakis
498
Towards Universal Computational Aberration Correction in Photographic Cameras: A Comprehensive Benchmark Analysis PDF ↗
Xiaolong Qian, Qi Jiang, Yao Gao, Lei Sun, Zhonghua Yi, Kailun Yang, Luc Van Gool, Kaiwei Wang
499
Multi-View Hierarchical Alignment Learning for Spatial Transcriptomics PDF ↗
Zhengzhong Zhu, Liangjin Liu, Pei Zhou, Shiquan Min, Jiangping Zhu
500
FEAST: Fully Connected Expressive Attention for Spatial Transcriptomics PDF ↗
Taejin Jeong, Joohyeok Kim, Jinyeong Kim, Chanyoung Kim, Seong Jae Hwang
501
TRIDENT: A Trimodal Cascade Generative Framework for Drug and RNA-Conditioned Cellular Morphology Synthesis PDF ↗
Rui Peng, Ziru Liu, Lingyuan Ye, Yuxing Lu, Boxin Shi, Jinzhuo Wang
502
OrienPose: Orientation-Guided Novel View Synthesis for Single- Image Unseen Object Pose Estimation PDF ↗
Yating Liu, Zhaoshuai Qi, Yang Zou, Yongnan Yang, Shizhou Zhang, Yanning Zhang
503
Illustrator’s Depth: Monocular Layer Index Prediction for Image Decomposition PDF ↗
Nissim Maruani, Peiying Zhang, Siddhartha Chaudhuri, Matthew Fisher, Nanxuan Zhao, Vladimir G. Kim, Pierre Alliez, Mathieu Desbrun, Wang Yifan
504
Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation PDF ↗
Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi
505
Seeing Depth Through Frequency and Motion: A Progressive Training Paradigm for Monocular Depth Estimation PDF ↗
Ke Li, Bolin Song, Hongbo Liu
506
GeoGuide: Hierarchical Geometric Guidance for Open-Vocabulary 3D Semantic Segmentation PDF ↗
Xujing Tao, Chuxin Wang, Yubo Ai, Zhixin Cheng, Zhuoyuan Li, Liangsheng Liu, Yujia Chen, Xinjun Li, Qiao Li, Wenfei Yang, Tianzhu Zhang
507
B^3-Seg: Camera-Free, Training-Free 3DGS Segmentation via Analytic EIG and Beta-Bernoulli Bayesian Updates PDF ↗
Hiromichi Kamata, Samuel Arthur Munro, Fuminori Homma
508
PE3R: Perception-Efficient 3D Reconstruction PDF ↗
Jie Hu, Shizun Wang, Xinchao Wang
509
GS-ASM: 2DGS-Supervised Active Stereo Matching PDF ↗
Zhengling Wu, Rongfeng Lu, Quan Chen, Longjian Zeng, Ming Lu, Yaoqi Sun, Yahong Chen, Baofeng Ji, Chenggang Yan
510
Real2Sim2Real: RetinalDepth-64K for Depth Estimation in Posterior Segment Ophthalmic Surgery PDF ↗
Bingwen Dong, Gan Liu, Xiaoxi Lu, Guangcheng Chen, Jialu Zhang, Yan Hu, Xiaoqing Zhang, Jiang Liu
511
Iris: Bringing Real-World Priors into Diffusion Model for Monocular Depth Estimation PDF ↗
Xinhao Cai, Gensheng Pei, Zeren Sun, Yazhou Yao, Fumin Shen, Wenguan Wang
512
InfiniDepth: Arbitrary-Resolution and Fine-Grained Depth Estimation with Neural Implicit Fields PDF ↗
Hao Yu, Haotong Lin, Jiawei Wang, Jiaxin Li, Yida Wang, Xueyang Zhang, Yue Wang, Xiaowei Zhou, Ruizhen Hu, Sida Peng
513
AirSim360: A Panoramic Simulation Platform within Drone View PDF ↗
Xian Ge, Yuling Pan, Yuhang Zhang, Xiang Li, Weijun Zhang, Dizhe Zhang, Zhaoliang Wan, Xin Lin, Xiangkai Zhang, Juntao Liang, Xiangtai Li, WenJie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi
514
Radar-Guided Polynomial Fitting for Metric Depth Estimation PDF ↗
Patrick Rim, Hyoungseob Park, Vadim Ezhov, Jeffrey Moon, Alex Wong
515
UniDAC: Universal Metric Depth Estimation for Any Camera PDF ↗
Girish Chandar Ganesan, Yuliang Guo, Liu Ren, Xiaoming Liu
516
SCE-Depth: A Spherical Compound Eye Framework for Wide FOV Depth Estimation PDF ↗
Yi Zhu, Hao Xiong, Lin Xiao, Ranfeng Shi, Qinying Gu, Leilei Gu
517
I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners PDF ↗
Lu Ling, Yunhao Ge, Yichen Sheng, Aniket Bera
518
REVIVE 3D: Refinement via Encoded Voluminous Inflated prior for Volume Enhancement PDF ↗
Hankyeol Lee, Wooyeol Baek, Seongdo Kim, Jongyoo Kim
519
Muses: Designing, Composing, Generating Nonexistent Fantasy 3D Creatures without Training PDF ↗
Hexiao Lu, Xiaokun Sun, Zeyu Cai, Hao Guo, Ying Tai, Jian Yang, Zhenyu Zhang
520
EI-Part: Explode for Completion and Implode for Refinement PDF ↗
Wanhu Sun, Zhongjin Luo, Heliang Zheng, Jiahao Chang, Chongjie Ye, Huiang He, Shengchu Zhao, Rongfei Jia, Xiaoguang Han
521
MorphAny3D: Unleashing the Power of Structured Latent in 3D Morphing PDF ↗
Xiaokun Sun, Zeyu Cai, Hao Tang, Ying Tai, Jian Yang, Zhenyu Zhang
522
Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration PDF ↗
Mengyu Yang, Yanming Yang, Chenyi Xu, Chenxi Song, Yufan Zuo, Tong Zhao, Ruibo Li, Chi Zhang
523
ViLearn: Accelerating Training Convergence of Image-to-3D Generation via Visibility Learning PDF ↗
Rui Chen, Jianfeng Zhang, Jing Lin, Xuanyu Yi, Yixun Liang, Guan Luo, Xiu Li, Zeming Li, Ping Tan
524
FlashMesh: Faster and Better Autoregressive Mesh Synthesis via Structured Speculation PDF ↗
Tingrui Shen, Yiheng Zhang, Chen Tang, Chuan Ping, Zixing Zhao, Le Wan, Yuwang Wang, Ronggang Wang, Shengfeng He
525
X-Part: High Fidelity And Structure Coherent Shape Decomposition And Completion PDF ↗
Xinhao Yan, Jiachen Xu, Yang Li, Changfeng Ma, Yunhan Yang, Chunshi Wang, Zibo Zhao, Zeqiang Lai, Yunfei Zhao, Zhuo Chen, Chunchao Guo
526
Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning PDF ↗
Ido Sobol, Kihyuk Sohn, Yoav Blum, Egor Zakharov, Max Bluvstein, Andrea Vedaldi, Or Litany
527
TopoMesh: High-Fidelity Mesh Autoencoding via Topological Unification PDF ↗
Guan Luo, Xiu Li, Rui Chen, Xuanyu Yi, Jing Lin, Chia Hao Chen, Jiahang Liu, Song-Hai Zhang, Jianfeng Zhang
528
Nestwork: Conditional 3D Furnished House Layout Generation through Latent Heterogeneous Graph Diffusion PDF ↗
Shuhan Miao, Biru Cao, Junling Zhuang
529
TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond PDF ↗
Yifei Zeng, Yajie Bao, Jiachen Qian, Shuang Wu, Youtian Lin, Hao Zhu, Buyu Li, Feihu Zhang, Xun Cao, Yao Yao
530
Beyond Geometry: Artistic Disparity Synthesis for Immersive 2D-to-3D PDF ↗
Ping Chen, Zezhou Chen, Xingpeng Zhang, Yanlin Qian, Huan Hu, Xiang Liu, Zipeng Wang, Xin Wang, Zhaoxiang Liu, Kai Wang, Shiguo Lian
531
WorldGen: From Text to Traversable and Interactive 3D Worlds PDF ↗
Dilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn, Chuhang Zou, Xiaoyu Xiang, Yu-Ying Yeh, Di Liu, Zixuan Huang, Thu Nguyen-Phuoc, Yuchen Fan, Sergiu Oprea, Ziyan Wang, Roman Shapovalov, Nikolaos Sarafianos, Thibault Groueix, Antoine Toisoul, Prithviraj Dhar, Xiao Chu, Minghao Chen, Geon Yeong Park, Rakesh Ranjan, Andrea Vedaldi
532
ExMesh: EXplicit Mesh Reconstruction with Topology Adaptation PDF ↗
Chuanjin Fan, Lifan Wu, Wenjie Chang, Hanzhi Chang, Wenfei Yang, Tianzhu Zhang
533
SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model PDF ↗
Yukai Shi, Weiyu Li, Zihao Wang, Hongyang Li, Xingyu Chen, Ping Tan, Lei Zhang
534
ShapeR: Robust Conditional 3D Shape Generation from Casual Captures PDF ↗
Yawar Siddiqui, Duncan Frost, Samir Aroudj, Armen Avetisyan, Henry Howard-Jenkins, Daniel DeTone, Pierre Moulon, Qirui Wu, Zhengqin Li, Julian Straub, Richard Newcombe, Jakob Engel
535
SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation PDF ↗
Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen
536
3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience PDF ↗
Hongcan Xiao, Xinyue Xiao, Yilin Wang, Yue Zhang, Yonggang Qi
537
Sculpt4D: Generating 4D Shapes via Sparse-Attention Diffusion Transformers PDF ↗
Minghao Yin, Wenbo Hu, Jiale Xu, Ying Shan, Kai Han
538
HiFi-BRep: High-Fidelity Latent Representation for Robust B-Rep Generation PDF ↗
Junhao Hou, Chenqi Luo, Pufan Wang, Jiaying Lu, Yusheng Liu, Feiwei Qin, Meie Fang, Kun Zhou
539
PhysGen: Physically Grounded 3D Shape Generation for Industrial Design PDF ↗
Yingxuan You, Chen Zhao, Hantao Zhang, Ming Xu, Pascal Fua
540
Perceptual 3D Simulation With Physical World Modeling PDF ↗
Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel LK Yamins
541
EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation PDF ↗
Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu
542
Active Intelligence in Video Avatars via Closed-loop World Modeling PDF ↗
Xuanhua He, Tianyu Yang, Ke Cao, Ruiqi Wu, Cheng Meng, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Qifeng Chen
543
Enhancing Spatial Understanding in Image Generation via Reward Modeling PDF ↗
Zhenyu Tang, Chaoran Feng, Yufan Deng, Jie Wu, Xiaojie Li, Rui Wang, Yunpeng Chen, Daquan Zhou
544
Seeing What Matters: Visual Preference Policy Optimization for Visual Generation PDF ↗
Ziqi Ni, Yuanzhi Liang, Rui Li, Yi Zhou, Haibin Huang, Chi Zhang, Xuelong Li
545
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of- Experts PDF ↗
Yu Xu, Hongbin Yan, Juan Cao, Yiji Cheng, Tiankai Hang, Runze He, Zijin Yin, Shiyi Zhang, Yuxin Zhang, Jintao Li, Chunyu Wang, Qinglin Lu, Tong-Yee Lee, Fan Tang
546
Identity-Preserving Image-to-Video Generation via Reward- Guided Optimization PDF ↗
Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng
547
JarvisEvo: Towards a Self-Evolving Photo Editing Agent with Synergistic Editor-Evaluator Optimization PDF ↗
Yunlong Lin, Linqing Wang, Kunjie Lin, Zixu Lin, Kaixiong Gong, Wenbo Li, Bin Lin, Zhenxi Li, Shiyi Zhang, Yuyang Peng, Wenxun Dai, Xinghao Ding, Chunyu Wang, Qinglin Lu
548
Learning Latent Proxies for Controllable Single-Image Relighting PDF ↗
Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang
549
MoVie: Broaden Your Views with Human Motion for Action Detection PDF ↗
Di Yang, Mahmoud Ali, Xuanlong Yu, Xi Shen, Quan Kong, Gianpiero Francesca, François Brémond
550
MooCap: A Multi-View Benchmark for Cow-Object-Human Interaction and Behavior Dynamics PDF ↗
Ian Noronha, Heather Neave, Upinder Kaur
551
LAOF: Robust Latent Action Learning with Optical Flow Constraints PDF ↗
Xizhou Bu, Jiexi Lyu, Fulei Sun, Ruichen Yang, Zhiqiang Ma, Wei Li
552
DarkAct: A RGB-Thermal Dataset and Fusion Framework for Multimodal Low-Light Action Recognition PDF ↗
Yuanjun Tan, Aoran Xiao, Liqian Deng, Zhigang Tu
553
Random Wins All: Rethinking Grouping Strategies for Vision Tokens PDF ↗
Qihang Fan, Yuang Ai, Huaibo Huang, Ran He
554
Steering Where to Diffuse: Generative Modeling of Phenotypic Response Simulation with Steered Diffusion Bridge PDF ↗
Rongchao Zhang, Chengxin Li, Yiwei Lou, Yuling Shi, Hanpin Wang, Yu Huang
555
Deep Feature Deformation Weights PDF ↗
Richard Liu, Itai Lang, Rana Hanocka
556
Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment PDF ↗
Yurong Gao, Zicheng Zhang, Congying Han, Tiande Guo, Xinmin Qiu
557
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models PDF ↗
Timing Yang, Feng Wang, Guoyizhe Wei
558
Coupling Liquid Time-Constant Encoders with Modern Hopfield Memory PDF ↗
Bishal Ranjan Swain, Kyung Joo Cheoi, Jaepil Ko
559
Stronger Normalization-Free Transformers PDF ↗
Mingzhi Chen, Taiming Lu, Jiachen Zhu, Mingjie Sun, Zhuang Liu
560
HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm PDF ↗
Jie-En Yao, Hong-En Chen, C.-C. Jay Kuo
561
Can You Learn to See Without Images? Procedural Warm- Up for Vision Transformers PDF ↗
Zachary Shinnick, Liangze Jiang, Hemanth Saratchandran, Damien Teney, Anton van den Hengel
562
Convolutional Neural Networks Driven by Content Similarity PDF ↗
Ligeng Zou, Guihu Zhao
563
MorphSeek: Fine-grained Latent Representation-Level Policy Optimization for Deformable Image Registration PDF ↗
Runxun Zhang, Yizhou Liu, Dongrui Li, Bo Xu, Jingwei Wei
564
HATS: Hardness-Aware Trajectory Synthesis for GUI Agents PDF ↗
Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen
565
MVP: Multiple View Prediction Improves GUI Grounding PDF ↗
Yunzhu Zhang, Zeyu Pan, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu
566
Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding PDF ↗
Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh
567
ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence On Mobile Devices PDF ↗
Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang
568
OS-Oracle: A Comprehensive Framework for Cross-Platform GUI Critic Models PDF ↗
Zhenyu Wu, Jingjing Xie, Zehao Li, Bowen Yang, Qiushi Sun, Zhaoyang Liu, Zhoumianze Liu, Yu Qiao, Xiangyu Yue, Zun Wang, Zichen Ding
569
Training High-Level Schedulers with Execution- Feedback Reinforcement Learning for Long-Horizon GUI Automation PDF ↗
Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu
570
See, Think, Act: Teaching Multimodal Agents to Effectively Interact with GUI by Identifying Toggles PDF ↗
Zongru Wu, Rui Mao, Zhiyuan Tian, Pengzhou Cheng, Tianjie Ju, Zheng Wu, Lingzhong Dong, Haiyue Sheng, Zhuosheng Zhang, Gongshen Liu
571
Beyond Weak Supervision: MLLMs-Guided Graded Knowledge Distillation for Unsupervised Camouflaged Object Detection PDF ↗
Huafeng Chen, Chenguang Zhu, Yueming Lyu, Caifeng Shan
572
Detecting Unknown Objects via Energy-based Separation for Open World Object Detection PDF ↗
Jun-Woo Heo, Keonhee Park, Gyeong-Moon Park
573
Beyond Prompt Degradation: Prototype-guided Dual-pool Prompting for Incremental Object Detection PDF ↗
Yaoteng Zhang, Qing Zhou, Junyu Gao, Qi Wang
574
SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation PDF ↗
Naomi Kombol, Ivan Martinović, Siniša Šegvić, Giorgos Tolias
575
TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models PDF ↗
Jinlun Ye, Jiang Liao, Runhe Lai, Xinhua Lu, Jiaxin Zhuang, Zhiyong Gan, Ruixuan Wang
576
Parameterized Prompt for Incremental Object Detection PDF ↗
Zijia An, Boyu Diao, Ruiqi Liu, Libo Huang, Chuanguang Yang, Fei Wang, Zhulin An, Yongjun Xu
577
SRA-Det: Learning Omni-Grained Open-Vocabulary Detection Beyond Category Names PDF ↗
Li Yang, Boyu Cai, Wei Liu, Yan Wang, Chunfeng Yuan, Bing Li, Weiming Hu
578
Retrieve and Segment: Are a Few Examples Enough to Bridge the Supervision Gap in Open-Vocabulary Segmentation? PDF ↗
Tilemachos Aravanis, Vladan Stojnić, Bill Psomas, Nikos Komodakis, Giorgos Tolias
579
PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation PDF ↗
Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen
580
Partial Weakly-Supervised Oriented Object Detection PDF ↗
Mingxin Liu, Peiyuan Zhang, Yuan Liu, Wei Zhang, Yue Zhou, Ning Liao, Ziyang Gong, Junwei Luo, Zhirui Wang, Yi Yu, Xue Yang
581
Seeing Both Sides: Towards Bidirectional Semantic Alignment for Open-Vocabulary Camouflaged Object Segmentation PDF ↗
Guohui Zhang, Fuming Sun, Yu Zhao, Yuqiu Kong, Jing Sun, Fasheng Wang
582
Towards Robust Multi-Modal Semantic Segmentation with Teacher- Student Framework and Hybrid Prototype Distillation PDF ↗
Jiaqi Tan, Xu Zheng, Yang Liu
583
REL-SF4PASS: Panoramic Semantic Segmentation with REL Depth Representation and Spherical Fusion PDF ↗
Xuewei Li, Xinghan Bao, Zhimin Chen, Xi Li
584
Looking Beyond the Window: Global-Local Aligned CLIP for Training- free Open-Vocabulary Semantic Segmentation PDF ↗
ByeongCheol Lee, Hyun Seok Seong, Sangeek Hyun, Gilhan Park, WonJun Moon, Jae-Pil Heo
585
From Softmax to Dirichlet: Evidential Learning for Semi-supervised Semantic Segmentation PDF ↗
Huayu Mai, Rui Sun, Yujia Chen, Wangkai Li, Bingzhou Wang, Aibing Li, Zhangyu He, Yuan Wang
586
Particulate: Feed-Forward 3D Object Articulation PDF ↗
Ruining Li, Yuxin Yao, Chuanxia Zheng, Christian Rupprecht, Joan Lasenby, Shangzhe Wu, Andrea Vedaldi
587
HOPS: Hierarchical Open-vocabulary Part Segmentation with Attention-Aware Filtering and Affinity-Guided Enhancement PDF ↗
Xinlong Li, Di Lin, Shaoyiyi Gao, Yaxuan Liu, Jixian He, Jiaxin Li, Ruonan Liu, Qing Guo, Kairui Yang, Wei Feng
588
Shape-of-You: Fused Gromov-Wasserstein Optimal Transport for Semantic Correspondence in-the-Wild PDF ↗
Jiin Im, Sisung Liu, Je Hyeong Hong
589
MEMO: Human-like Crisp Edge Detection Using Masked Edge Prediction PDF ↗
Jiaxin Cheng, Yue Wu, Yicong Zhou
590
MUFASA: A Multi-Layer Framework for Slot Attention PDF ↗
Sebastian Bock, Leonie Schüßler, Krishnakant Singh, Simone Schaub-Meyer, Stefan Roth
591
ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Senisng PDF ↗
Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng
592
MOMO: Mars Orbital MOdel Foundation Model for Mars Orbital Applications PDF ↗
Mirali Purohit, Bimal Gajera, Irish Mehta, Bhanu Tokas, Jacob Adler, Steven Lu, Scott Dickenshied, Serina Diniega, Brian Bue, Umaa Rebbapragada, Hannah Kerner
593
Seeing Through the Noise: Improving Infrared Small Target Detection and Segmentation from Noise Suppression Perspective PDF ↗
Maoxun Yuan, Duanni Meng, Ziteng Xi, Tianyi Zhao, Shiji Zhao, Yimian Dai, Xingxing Wei
594
GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization PDF ↗
Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du
595
GeoSANE: Learning Geospatial Representations from Models, Not Data PDF ↗
Joëlle Hanna, Damian Falk, Stella X. Yu, Damian Borth
596
Brewing Stronger Features: Dual-Teacher Distillation for Multispectral Earth Observation PDF ↗
Filip Wolf, Blaž Rolih, Luka Čehovin Zajc
597
Spectral Super-Resolution via Adversarial Unfolding and Data-Driven Spectrum Regularization: From Multispectral Satellite Data to NASA Hyperspectral Image PDF ↗
Si-Sheng Young, Chia-Hsiang Lin
598
RAMEN: Resolution-Adjustable Multimodal Encoder for Earth Observation PDF ↗
Nicolas Houdré, Diego Marcos, Hugo Riffaud de Turckheim, Dino Ienco, Laurent Wendling, Camille Kurtz, Sylvain Lobry
599
ORSATR-X: A Foundation Model based on Differential-and-Excitation Networks for Optical Remote Sensing Object Recognition PDF ↗
Canyu Mo, Yongxiang Liu, Jiehua Zhang, Zilong Yu, Zhen Liu, Tianpeng Liu, Li Liu
600
SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning PDF ↗
Tairan Huang, Yulin Jin, Junxu Liu, Qingqing Ye, Haibo Hu
601
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding PDF ↗
Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang
602
DASH: A Meta-Attack Framework for Synthesizing Effective and Stealthy Adversarial Examples PDF ↗
Abdullah Al Nomaan Nafi, Habibur Rahaman, Zafaryab Haider, Tanzim Mahfuz, Fnu Suya, Swarup Bhunia, Prabuddha Chakraborty
603
AdapAction: Adaptive Target Action Backdoor Attack against GUI Agents PDF ↗
Baicheng Chen, Mingda Zhang, Min Zhang, Haizhou Li, Baoyuan Wu
604
Phantom: Physical Object Interactions as Dynamic Triggers for NMS-Exploited Backdoors PDF ↗
Tianlin Huo, Dongchuan Ran, Ranjie Duan, Yao Zhu, Peilun Du, Ningbo Yao, Huanqian Yan, Xu Han, Qiang Yun, Yuzheng Tan, Yang Bao, Yuan He
605
Verifying Neural Network Robustness with Dual Perturbations PDF ↗
Hai Duong, Lam Nguyen, Thanh Le, ThanhVu Nguyen
606
Defending Unauthorized Model Merging via Dual-Stage Weight Protection PDF ↗
Wei-Jia Chen, Min-Yan Tsai, Cheng-Yi Lee, Chia-Mu Yu
607
AntiStyler: Defending Object Detection Models Against Adversarial Patch Attacks Using Style Removal PDF ↗
Idan Yankelev, Edita Grolman, Yarin Yerushalmi Levi, Amit Giloni, Omer Hofman, Toshiya Shimizu, Yuval Elovici, Asaf Shabtai
608
On the Role of Temporal Granularity in the Robustness of Spiking Neural Networks PDF ↗
Mengting Xu, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan
609
Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior PDF ↗
Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen
610
Exploring Conditions for Diffusion Models in Robotic Control PDF ↗
Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim
611
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens PDF ↗
Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen
612
Efficient Hybrid SE(3)-Equivariant Visuomotor Flow Policy via Spherical Harmonics for Robot Manipulation PDF ↗
Qinglun Zhang, Shen Cheng, Tian Dan, Haoqiang Fan, Guanghui Liu, Shuaicheng Liu
613
TSTM: Temporal Segmentation for Task-relevant Mask in Visual Reinforcement Learning Generalization PDF ↗
Weicheng Du, Wenjia Meng, Zhengzhe Zhang, Yilong Yin, Xiankai Lu
614
Scaling Spatial and Temporal Context for Robotic Imitation Learning Policies With Scene Graphs
Jianing Qian, Qinhe Peng, Emmanuel Panov, Leonor Fermoselle, Dinesh Jayaraman, Bernadette Bucher, Tarik Kelestemur
615
AdaDexTrack: Dynamic Modulation for Adaptive and Generalizable Dexterous Manipulation Tracking PDF ↗
Jianibieke Adalibieke, Qianwei Han, Xueyi Liu, Yuzhe Qin, Li Yi
616
GraspLDP: Towards Generalizable Grasping Policy via Latent Diffusion PDF ↗
Enda Xiang, Haoxiang Ma, Xinzhu Ma, Zicheng Liu, Di Huang
617
MoEActok: A MoE-based Action Tokenizer for Vision-Language- Action Models PDF ↗
Chunpu Xu, Zhixuan Liang, Tianshuo Yang, Chi-Min Chan, Yang Xiao, Jessie Wang, Xiaokang Yang, Yao Mu
618
A Cross-view Fusion Framework for Robust 6-DoF Grasp Pose Estimation PDF ↗
Kangjian Zhu, Haobo Jiang, Jianjun Qian, Jin Xie
619
SAVA-X: Ego-to-Exo Imitation Error Detection via Scene-Adaptive View Alignment and Bidirectional Cross View Fusion PDF ↗
Xiang Li, Heqian Qiu, Lanxiao Wang, Benliu Qiu, Fanman Meng, Linfeng Xu, Hongliang Li
620
PromptDepth: Efficient and Promptable Geometric 3D Vision Model for Embodied Intelligence PDF ↗
Xianyun Wang, Jiaxu Miao, Tian Xu, Siyuan Wang, Yuehao Li, Haoyang Hu, Jun Xiao, Yonghong Tian, Jun Yu
621
Gallant: Voxel Grid-based Humanoid Locomotion and Local- navigation across 3-D Constrained Terrains PDF ↗
Qingwei Ben, Botian Xu, Kailin Li, Feiyu Jia, Wentao Zhang, Jingping Wang, Jingbo Wang, Dahua Lin, Jiangmiao Pang
622
PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation PDF ↗
Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo, Gen Li, Xu Cao, Jin Jin, Yifan Shen, Zhengyuan Li, Tianjiao Yu, Wenzhen Yuan, Fangqiang Ding, Ismini Lourentzou
623
IGen: Scalable Data Generation for Robot Learning from Open-World Images PDF ↗
Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang
624
Hypergraph-State Collaborative Reasoning for Multi-Object Tracking PDF ↗
Zikai Song, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang, Xinchao Wang
625
TGTrack: Temporal Generative Learning for Unified Single Object Tracking PDF ↗
Wanting Geng, Xin Chen, Chuanyu Sun, Jie Zhao, Ben Kang, Dong Wang, Huchuan Lu
626
GeoMotion: Rethinking Motion Segmentation via Latent 4D Geometry PDF ↗
Xiankang He, Peile Lin, Ying Cui, Dongyan Guo, Chunhua Shen, Xiaoqin Zhang
627
Generalizable Structure-Aware Keypoint Correspondence for Category-Unified 3D Single Object Tracking PDF ↗
Jie Xiao, Yinchao Ma, Yuyang Tang, Dengqing Yang, Jianpeng Yang, Xu Zhou, Qiao Li, Wenfei Yang, Tianzhu Zhang
628
Generative Point Tracking and Forecasting PDF ↗
Xuanchen Lu, Ang Cao, Chao Feng, Andrew Owens
629
RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation PDF ↗
Hao Li, Yuhao Wang, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu
630
Dual-level Adaptation for Multi-Object Tracking: Building Test-Time Calibration from Experience and Intuition PDF ↗
Wen Guo, Pengfei Zhao, Zongmeng Wang, Yufan Hu, Junyu Gao
631
GMT: Effective Global Framework for Multi-Target Multi-Camera Tracking
Yihao Zhen, Mingyue Xu, Qiang Wang, Baojie Fan, Jiahua Dong, Tinghui Zhao, Huijie Fan
632
Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction PDF ↗
Yujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang, Shiwei Zhang, Biao Gong, Shuai Tan, Hangjie Yuan, Hongming Shan
633
GraPHFormer: A Multimodal Graph Persistent Homology Transformer for the Analysis of Neuroscience Morphologies PDF ↗
Uzair Shah, Marco Agus, Mahmoud Gamal, Mahmood Alzubaidi, Corrado Cali, Pierre J. Magistretti, Abdesselam Bouzerdoum, Mowafa Househ
634
DARC: Dual Adjustment Reasoning with Counterfactuals for Trustworthy Chest X-ray Classification PDF ↗
Zhifang Liao, Junhao Li, HaoKang Ding, Yucheng Song
635
Every Error has Its Magnitude: Asymmetric Mistake Severity Training for Multiclass Multiple Instance Learning PDF ↗
Sungrae Hong, Jiwon Jeong, Jisu Shin, Donghee Han, Sol Lee, Kyungeun Kim, Mun Yong Yi
636
Phrase-grounded APO for Improving Chest X-ray Report Generation PDF ↗
Raziuddin Mahmood, Tanveer Syeda-Mahmood
637
Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis PDF ↗
Yuan Zhang, Sihao Dou, Kai Hu, Shuhua Deng, Chunhong Cao, Fen Xiao, Xieping Gao
638
OraPO: Oracle-educated Reinforcement Learning for Data-efficient and Factual Radiology Report Generation PDF ↗
Zhuoxiao Chen, Hongyang Yu, Ying Xu, Yadan Luo, Long Duong, Yuan-Fang Li
639
FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopy PDF ↗
Hyejin Park, Jiwon Yoon, Sumin Park, Suree Kim, Sinae Jang, Eunsoo Lee, Dongmin Kang, Dongbo Min
640
CryoKRAQEN: Kernel-Regularized Annealing for Quantized Embedding Networks in Cryo-EM Heterogeneous Reconstruction PDF ↗
Wenyuan Gao, Yutan Wu, Xuming He
641
Building Robust Vision Encoders for Cross-Dataset Evaluation in Immunofluorescent Microscopy PDF ↗
Umar Marikkar, Syed Sameed Husain, Muhammad Awais, Sara Atito
642
H2-Surv: Hierarchical Hyperbolic Multimodal Representation Learning for Survival Prediction PDF ↗
Jiaqi Yang, Wenting Chen, Xiangjian He, Yuanbai Li, Sen Yang, Linlin Shen, Xiaohan Xing
643
Dual-Level Hypergraph Generation for Addressing Feature Scarcity in Whole-Slide Image Classification PDF ↗
Shuilian Yao, Qi Jia, Yu Liu, Pengshuo Zhang, Lili Sun, Weimin Wang, Yanmei Zhu, Bo Zhang, Xin Fan
644
Temporal Inversion for Learning Interval Change in Chest X-Rays PDF ↗
Hanbin Ko, Kyeongmin Jeon, Doowoong Choi, Chang Min Park
645
JUMP-Hand: Learning Joint-wise Uncertainty to Gate Mixture of View Experts for Multi-View 3D Hand Reconstruction PDF ↗
Haohong Kuang, Yang Xiao, Changlong Jiang, Jinghong Zheng, Hang Xu, Ran Wang, Zhiguo Cao, Joey Tianyi Zhou
646
PAD-Hand: Physics-Aware Diffusion for Hand Motion Recovery PDF ↗
Elkhan Ismayilzada, Yufei Zhang, Zijun Cui
647
Anatomical Domain Shifts: Test-time Heterogeneous Adaptation for 3D Human Pose Prediction PDF ↗
Qiongjie Cui, Pan Zhou, Jingjing Chen, Na Zhao
648
Unlocking Motion from Large Vision Models with a Semantic and Kinematic Duality for Gait Recognition PDF ↗
Zhanbo Huang, Dingqiang Ye, Xiaoming Liu, Yu Kong
649
Learning 3D Shape Fidelity Metric from Real-world Distortions PDF ↗
Xuelu Feng, Tianyu Luan, Zixin Zhu, Akshobhya Sharma, Phani Nuney, Junsong Yuan, Chunming Qiao
650
BarbieGait: An Identity-Consistent Synthetic Human Dataset with Versatile Cloth-Changing for Gait Recognition PDF ↗
Qingyuan Cai, Saihui Hou, Xuecai Hu, Yongzhen Huang
651
FisherPoser: Human Motion Estimation from Sparse Observations with Hierarchical Region-Wise Fisher-Matrix Uncertainty Modeling PDF ↗
Songpengcheng Xia, Qingyu Zhang, Zhuo Su, Jiarui Yang, Zengyuan Lai, Qi Wu, Ling Pei
652
EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents PDF ↗
Wenjia Wang, Liang Pan, Huaijin Pi, Yuke Lou, Xuqian Ren, Yifan Wu, Zhouyingcheng Liao, Lei Yang, Rishabh Dabral, Christian Theobalt, Taku Komura
653
Ground Reaction Inertial Poser: Physics-based Human Motion Capture from Sparse IMUs and Insole Pressure Sensors PDF ↗
Ryosuke Hori, Jyun-Ting Song, Zhengyi Luo, Jinkun Cao, Soyong Shin, Hideo Saito, Kris Kitani
654
FUN REC Reconstructing Functional 3D Scenes from Egocentric Interaction Videos PDF ↗
Alexandros Delitzas, Chenyangguang Zhang, Alexey Gavryushin, Tommaso Di Mario, Boyang Sun, Rishabh Dabral, Leonidas Guibas, Christian Theobalt, Marc Pollefeys, Francis Engelmann, Daniel Barath
655
VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network PDF ↗
Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li
656
Bringing Your Portrait to 3D Presence PDF ↗
Jiawei Zhang, Lei Chu, Jiahao Li, Zhenyu Zang, Chong Li, Xiao Li, Xun Cao, Hao Zhu, Yan Lu
657
FLOW: Feature-Level Optimal Warping for Generalized Remote Physiological Measurement
Bo Zhao, Junzhe Cao, Dan Guo, Dongmin Huang, Wenjin Wang, Tao Tan, Yue Sun, Zitong Yu
658
One-to-More: High-Fidelity Training-Free Anomaly Generation with Attention Control PDF ↗
Haoxiang Rao, Zhao Wang, Chenyang Si, Yan Lyu, Yuanyi Duan, Fang Zhao, Caifeng Shan
659
UniMMAD: Unified Multi-Modal and Multi-Class Anomaly Detection via MoE-Driven Feature Decompression PDF ↗
Yuan Zhao, Youwei Pang, Lihe Zhang, Hanqi Liu, Jiaming Zuo, Huchuan Lu, Xiaoqi Zhao
660
BUSSARD: Normalizing Flows for Bijective Universal Scene-Specific Anomalous Relationship Detection PDF ↗
Melissa Schween, Mathis Kruse, Bodo Rosenhahn
661
Multi-Prototype Compactness and Boundary-Aware Synthesis for Unsupervised Anomaly Detection PDF ↗
Kailun Liao, Jianfeng Yang, Tao Tao, Wenfei Wu, Jiaming Jiang, Jinsheng Xiao
662
PDD: Manifold-Prior Diverse Distillation for Medical Anomaly Detection PDF ↗
Xijun Lu, Hongying Liu, Fanhua Shang, Yanming Hui, Liang Wan
663
Weakly Supervised Video Anomaly Detection with Anomaly-Connected Components and Intention Reasoning PDF ↗
Yu Wang, Shengjie Zhao
664
SubspaceAD: Training-Free Few-Shot Anomaly Detection via Subspace Modeling PDF ↗
Camile Lendering, Erkut Akdag, Egor Bondarau
665
Learning Spatial-Temporal Consistency for 3D Semantic Scene Completion PDF ↗
Yujie Xue, Meng Wang, Ruihui Li, Fan Wu, Zhizhong Liu, Zhuo Tang, Kenli Li
666
Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction PDF ↗
Changqing Zhou, Yueru Luo, Changhao Chen
667
Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation PDF ↗
Yang Gao, Wuyang Li, Po-Chien Luan, Alexandre Alahi
668
OccAny: Generalized Unconstrained Urban 3D Occupancy PDF ↗
Anh-Quan Cao, Tuan-Hung Vu
669
Dr.Occ: Depth- and Region-Guided 3D Occupancy from Surround- View Cameras for Autonomous Driving PDF ↗
Xubo Zhu, Haoyang Zhang, Fei He, Rui Wu, Yanhu Shan, Wen Yang, Huai Yu
670
ShelfOcc: Native 3D Supervision beyond LiDAR for Vision-Based Occupancy Estimation, 16:45 - 18:45 DEMOS 1 MonoDepth.zip: Zero-Shot Real-Time Monocular Depth on Mobile Devices, 2 DiffBMP: Differentiable Rendering with Bitmap Primitives, 3 Occlusion Aware 3D Scene Control in Text-to-Image Generation, 4 RAVEN: Real-Time Adaptive Radar Perception on Edge Devices from Raw ADC Signals on a TI IWR1443BOOST Sensor, 5 AutoLabel Pro: A Real-Time Human-in-the-Loop System for Data- Centric Object Detection, 6 RADx: Hand X-Ray Rheumatoid Arthritis Severity Assessment Tool, Notes:
Simon Boeder, Fabian Gigengack, Simon Roesler, Holger Caesar, Benjamin Risse Fabio Tosi, Luca Bartolomei, Matteo Poggi, Stefano Mattoccia Seongmin Hong, Junghun James Kim, Se Young Chun Vaibhav Agrawal, Rishubh Parihar, Pradhaan S Bhat, Ravi Kiran S, Venkatesh Babu R Mir Sayeed Mohammad, Anuvab Sen Lu Gan, Xi Li Ganlin Feng, Yuxi Long, Anna Liu, Liam O'Neil, Carol Hitchon, Pingzhao Hu
No matches.