‹ June 5 schedule

Poster Session 6

Sun · June 7 · 3:30–5:30 PM · ExHall A — 704 papers
704 papers
1
Differentiable Laplacian Matrix Guided Superpixel Segmentation PDF ↗
Jeremy Juybari, Josh Hamilton, Shuvra Das, Chaofan Chen, Andre Khalil, Yifeng Zhu
2
FILTR: Extracting Topological Features from Pretrained 3D Models PDF ↗
Louis Martinez, Maks Ovsjanikov
3
Learning Convex Decomposition via Feature Fields PDF ↗
Yuezhi Yang, Qixing Huang, Mikaela Angelina Uy, Nicholas Sharp
4
Learning Eigenstructures of Unstructured Data Manifolds 🏆PDF ↗
Roy Velich, Arkadi Piven, David Bensaïd, Daniel Cremers, Thomas Dagès, Ron Kimmel
5
Mapping Networks, Lord Sen, Shyamapada Mukherjee 🏆
6
CineBrain: A Large-Scale Multi-Modal Audiovisual Brain Dataset for Brain-Conditioned Video Generation 🏆PDF ↗
Jianxiong Gao, Yichang Liu, Baofeng Yang, Jianfeng Feng, Yanwei Fu
7
Hearing the Room Through the Shape of the Drum: Modal-Guided Sound Recovery from Multi-Point Surface Vibrations 🏆PDF ↗
Shai Bagon, Matan Kichler, Mark Sheinin
8
SDTrack: A Baseline for Event-based Tracking via Spiking Neural Networks PDF ↗
Yimeng Shan, Zhenbang Ren, Haodi Wu, Wenjie Wei, Rui-Jie Zhu, Shuai Wang, Dehao Zhang, Yichen Xiao, Jieyuan Zhang, Kexin Shi, Jingzhinan Wang, Jason K. Eshraghian, Haicheng Qu, Malu Zhang
9
Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding 🏆PDF ↗
Pengfei Hu, Meng Cao, Yingyao Wang, Yi Wang, Jiahua Dong, Jun Song, Yu Cheng, Bo Zheng, Xiaodan Liang
10
Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training PDF ↗
Jinbo Xing, Zeyinzi Jiang, Yuxiang Tuo, Chaojie Mao, Xiaotang Gai, Xi Chen, Jingfeng Zhang, Yulin Pan, Zhen Han, Jie Xiao, Keyu Yan, Chenwei Xie, Chongyang Zhong, Kai Zhu, Tong Shen, Lianghua Huang, Yu Liu, Yujiu Yang
11
CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation PDF ↗
Pablo Messina, Andrés Villa, Juan Leon Alcazar, Karen Sanchez, Carlos Hinojosa, Denis Parra, Alvaro Soto, Bernard Ghanem
12
DK-DDIL: Adaptive Knowledge Retention for Dynamic Domain- Incremental Learning in Medical Imaging PDF ↗
Yuxi Ma, Sujie Liu, Jing Yang, Jiacheng Wang, Yiping Chen, Baptiste Magnier, Liansheng Wang
13
Dual-level Adapter Boosting Prompt-free Curvilinear Structure Segmentation 🏆PDF ↗
Kai Zhu, Li Chen, Jun Cheng
14
LATA: Laplacian-Assisted Transductive Adaptation for Conformal Uncertainty in Medical VLMs PDF ↗
Behzad Bozorgtabar, Dwarikanath Mahapatra, Sudipta Roy, Muzammal Naseer, Imran Razzak, Zongyuan Ge
15
Medic-AD: Towards Medical Vision-Language Model's Clinical Intelligence 🏆PDF ↗
Woohyeon Park, Jaeik Kim, Sunghwan Steve Cho, Pa Hong, Wookyoung Jeong, Yoojin Nam, Namjoon Kim, Ginny Y. Wong, Ka Chun Cheung, Jaeyoung Do
16
SegMoTE: Token-Level Mixture of Experts for Medical Image Segmentation PDF ↗
Yujie Lu, Jingwen Li, Sibo Ju, Yanzhou Su, He Yao, Yisong Liu, Min Zhu, Junlong Cheng
17
Efficient Unrolled Networks for Large-Scale 3D Inverse Problems 🏆PDF ↗
Romain Vo, Julián Tachella
18
FedAdamom: Adaptive Momentum for Improved Generalization in Federated Optimization 🏆PDF ↗
Wenjie Hou, Tianxiang Chen, Feng Wang, Tiantong Wu, Zhiming Zheng, Shaoting Tang, Wei Yang Bryan Lim
19
SimScale: Learning to Drive via Real-World Simulation at Scale PDF ↗
Haochen Tian, Tianyu Li, Haochen Liu, Jiazhi Yang, Yihang Qiu, Guang Li, Junli Wang, Yinfeng Gao, Zhang Zhang, Liang Wang, Hangjun Ye, Long Chen, Hongyang Li
20
Texvent: Asynchronous Event Data Simulation via Text Prompt 🏆PDF ↗
Ruofei Wang, Peiqi Duan, Ka Chun Cheung, Simon See, Boxin Shi, Renjie Wan
21
WorldLens: Full-Spectrum Evaluations of Driving World Models in Real World PDF ↗
Ao Liang, Lingdong Kong, Tianyi Yan, Hongsi Liu, Yu Yang, Ziqi Huang, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu
22
BuildingGPT: Auto-Regressive Building Wireframe Reconstruction Model with Reinforcement Learning PDF ↗
Yuzhou Liu, Lingjie Zhu, Hanqiao Ye, Yujun Liu, Shangfeng Huang, Xiang Gao, Ruisheng Wang, Shuhan Shen
23
Emergent Extreme-View Geometry in 3D Foundation Models PDF ↗
Yiwen Zhang, Joseph Tung, Ruojin Cai, David Fouhey, Hadar Averbuch-Elor
24
LiteVGGT: Boosting Vanilla VGGT via Geometry-aware Cached Token Merging PDF ↗
Zhijian Shu, Cheng Lin, Tao Xie, Wei Yin, Ben Li, Zhiyuan Pu, Weize Li, Yao Yao, Xun Cao, Xiaoyang Guo, Xiao-Xiao Long
25
LASER: Layer-wise Scale Alignment for Training-Free Streaming 4D Reconstruction PDF ↗
Tianye Ding, Yiming Xie, Yiqing Liang, Moitreya Chatterjee, Pedro Miraldo, Huaizu Jiang
26
PanoVGGT: Feed-Forward 3D Reconstruction from Panoramic Imagery PDF ↗
Yijing Guo, Mengjun Chao, Luo Wang, Tianyang Zhao, Haizhao Dai, Yingliang Zhang, Jingyi Yu, Yujiao Shi
27
Rascene: High-Fidelity 3D Scene Imaging with mmWave Communication Signals PDF ↗
Kunzhe Song, Geo Jie Zhou, Xiaoming Liu, Huacheng Zeng
28
VGG-T^3: Offline Feed-Forward 3D Reconstruction at Scale PDF ↗
Sven Elflein, Ruilong Li, Sérgio Agostinho, Zan Gojcic, Laura Leal-Taixé, Qunjie Zhou, Aljosa Osep
29
SEA-Flow3D: Simplified, Efficient, and Accurate Scene Flow via Spatial Vector Sampling and Multi-scale Refinement PDF ↗
Han Ling, Quansen Sun, Yinghua Yao, Ivor Tsang, Yinghui Sun
30
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer PDF ↗
Haosong Peng, Hao Li, Yalun Dai, Yushi Lan, Yihang Luo, Tianyu Qi, Zhengshen Zhang, Yufeng Zhan, Junfei Zhang, Wenchao Xu, Ziwei Liu
31
DROID-SLAM in the Wild PDF ↗
Moyang Li, Zihan Zhu, Marc Pollefeys, Daniel Barath
32
HeSS: Head Sensitivity Score for Sparsity Redistribution in VGGT PDF ↗
Yongsung Kim, Wooseok Song, Jaihyun Lew, Hun Hwangbo, Jaehoon Lee, Sungroh Yoon
33
Dense Metric Depth Completion from Sparse Direct Time-of- Flight Sensors PDF ↗
Hakyeong Kim, Ruicheng Wang, Chengtang Yao, Jiaolong Yang, Min H. Kim
34
Online3R: Online Learning for Consistent Sequential Reconstruction Based on Geometry Foundation Model PDF ↗
Shunkai Zhou, Zike Yan, Fei Xue, Dong Wu, Yuchen Deng, Hongbin Zha
35
Neu-PiG: Neural Preconditioned Grids for Fast Dynamic Surface Reconstruction on Long Sequences PDF ↗
Julian Kaltheuner, Hannah Dröge, Markus Plack, Patrick Stotko, Reinhard Klein
36
Learning 3D Reconstruction with Priors in Test Time PDF ↗
Lei Zhou, Haoyu Wu, Akshat Dave, Dimitris Samaras
37
ArchSym: Detecting 3D-Grounded Architectural Symmetries in the Wild PDF ↗
Hanyu Chen, Ruojin Cai, Steve Marschner, Noah Snavely
38
PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding PDF ↗
Siyuan Liu, Chaoqun Zheng, Xin Zhou, Tianrui Feng, Dingkang Liang, Xiang Bai
39
tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction PDF ↗
Chen Wang, Hao Tan, Wang Yifan, Zhiqin Chen, Yuheng Liu, Kalyan Sunkavalli, Sai Bi, Lingjie Liu, Yiwei Hu
40
Hint2Gen: Bridging Understanding and Generation via Code- structured Hints PDF ↗
Yuanpeng Tu, Yunpeng Chen, Xi Chen, Liang Li, Hengshuang Zhao
41
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization PDF ↗
Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu
42
Learning by Analogy: A Causal Framework for Compositional Generalization PDF ↗
Lingjing Kong, Shaoan Xie, Yang Jiao, Yetian Chen, Yanhui Guo, Simone Shao, Yan Gao, Guangyi Chen, Kun Zhang
43
ID-Crafter: VLM-Grounded Online RL for Compositional Multi- Subject Video Generation PDF ↗
Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong Mu
44
GenColorBench: A Color Evaluation Benchmark for Text-to-Image Generation PDF ↗
Muhammad Atif Butt, Alexandra Gomez-Villa, Tao Wu, Javier Vazquez-Corral, Joost Van De Weijer, Kai Wang
45
Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation PDF ↗
Chenxi Zhao, Chen Zhu, Xiaokun Feng, Aiming Hao, Jiashu Zhu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Jufeng Yang
46
When Pretty Isn’t Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators PDF ↗
Krzysztof Adamkiewicz, Brian B. Moser, Stanislav Frolov, Tobias Christian Nauen, Federico Raue, Andreas Dengel
47
TempoControl: Temporal Attention Guidance for Text-to-Video Models PDF ↗
Shira Schiber, Ofir Lindenbaum, Idan Schwartz
48
Hear What Matters! Text-conditioned Selective Video-to-Audio Generation PDF ↗
Junwon Lee, Juhan Nam, Jiyoung Lee
49
MultiCrafter: High-Fidelity Multi-Subject Generation via Disentangled Attention and Identity-Aware Preference Alignment PDF ↗
Tao Wu, Yibo Jiang, Yehao Lu, Zhizhong Wang, Zeyi Huang, Zequn Qin, Xi Li
50
Resolving the Identity Crisis in Text-to-Image Generation PDF ↗
Shubhankar Borse, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli
51
DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation PDF ↗
Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu
52
Gloria: Consistent Character Video Generation via Content Anchors PDF ↗
Yuhang Yang, Fan Zhang, Huaijin Pi, Ailing Zeng, Shuai Guo, Guowei Xu, Wei Zhai, Yang Cao, Zheng-Jun Zha
53
DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior PDF ↗
Junjia Huang, Binbin Yang, Pengxiang Yan, Jiyang Liu, Bin Xia, Zhao Wang, Yitong Wang, Liang Lin, Guanbin Li
54
M4V: Multimodal Mamba for Efficient Text-to-Video Generation PDF ↗
Jiancheng Huang, Gengwei Zhang, Zequn Jie, Siyu Jiao, Yinlong Qian, Ling Chen, Yunchao Wei, Lin Ma
55
Property-Informed Diffusion-Based Text-to-Microstructure Generation PDF ↗
Bingxuan Dai, Hongsong Wang, Jie Gui
56
DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models PDF ↗
Patrick Kwon, Chen Chen
57
Mixture of States: Routing Token-Level Dynamics for Multimodal Generation PDF ↗
Haozhe Liu, Ding Liu, Mingchen Zhuge, Zijian Zhou, Tian Xie, Sen He, Yukang Yang, Shuming Liu, Yuren Cong, Jiadong Guo, Hongyu Xu, Ke Xu, Kam-Woh Ng, Juan C. Perez, Juan-Manuel Perez- Rua, Tao Xiang, Wei Liu, Shikun Liu, Jürgen Schmidhuber
58
HiCoGen: Hierarchical Compositional Text-to-Image Generation in Diffusion Models via Reinforcement Learning PDF ↗
Hongji Yang, Yucheng Zhou, Wencheng Han, Runzhou Tao, Zhongying Qiu, Jianfei Yang, Jianbing Shen
59
TherA: Thermal-Aware Visual-Language Prompting for Controllable RGB-to-Thermal Infrared Translation PDF ↗
Dong-Guw Lee, Tai Hyoung Rhee, Hyunsoo Jang, Young-Sik Shin, Ukcheol Shin, Ayoung Kim
60
See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding PDF ↗
Boyuan Sun, Bo-Wen Yin, Yuan-Ming Li, Xihan Wei, Qibin Hou
61
CoV-Align: Efficient Fine-grained Cross-Modal Alignment with Cohesive Visual Semantics Priority PDF ↗
Hengqi Liu, Wanting Zhou, Longteng Kong, Fangxiang Feng, Lei Ren, Wei Chen, Xiaojie Wang
62
TDATR: Improving End-to-End Table Recognition via Table Detail- Aware Learning and Cell-Level Visual Alignment PDF ↗
Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu
63
A Mixed Diet Makes DINO An Omnivorous Vision Encoder PDF ↗
Rishabh Kabra, Maks Ovsjanikov, Drew A. Hudson, Ye Xia, Skanda Koppula, Andre Araujo, Joao Carreira, Niloy J. Mitra
64
Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models PDF ↗
Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun
65
TaskForce: Cooperative Multi-agent Reinforcement Learning for Multi-task Optimization PDF ↗
Wonhyeok Choi, Kyumin Hwang, Jihun Park, Kyoungmin Lee, Seunghun Lee, Jaeyeul Kim, Minwoo Choi, Sunghoon Im
66
PhyCritic: Multimodal Critic Models for Physical AI PDF ↗
Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu
67
R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning PDF ↗
Zirui Zhang, Haoyu Dong, Kexin Pei, Chengzhi Mao
68
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image PDF ↗
Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad
69
Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization PDF ↗
Xinyu Qiu, Heng Jia, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Yi Yang, Linchao Zhu
70
Anchoring the Mind of Multimodal Reasoners: Cognitive Bias as a Vector for Jailbreak Attacks PDF ↗
Linhua Cong, Bingrui Sima, Kun He
71
InsCal: Calibrated Multi-Source Fully Test-Time Prompt Tuning for Object Detection PDF ↗
Xiaofan Que, Dingrong Wang, Xumin Liu, Qi Yu
72
Why Not Hyperparameter-Friendly Optimisation? A Monotonic Adaptive Norm Rescaling Approach For Long-Tailed Recognition PDF ↗
Shuo Zhang, Chenqi Li, Tingting Zhu
73
Decoupling Vision and Language: Codebook Anchored Visual Adaptation PDF ↗
Jason Wu, Tianchen Zhao, Chang Liu, Jiarui Cai, Zheng Zhang, Zhuowei Li, Aaditya Singh, Xiang Xu, Mani Srivastava, Jonathan Wu
74
MemFlow: A Lightweight Forward Memorizing Framework for Quick Domain Adaptive Feature Mapping PDF ↗
Jianming Lv, Chengjun Wang, Depin Liang, Qianli Ma, Wei Chen, Xueqi Cheng
75
Mind the Discriminability Trap in Source-Free Cross-domain Few- shot Learning PDF ↗
Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen
76
Vision-Language Model Guided Source-Free Domain Adaptation via Optimal Transport PDF ↗
Shuo Han, Xu Tang, Jingjing Ma, Xiangrong Zhang
77
Masked Representation Modeling for Domain-Adaptive Segmentation PDF ↗
Wenlve Zhou, Zhiheng Zhou, Tiantao Xian, Yikui Zhai, Weibin Wu, Biyun MA
78
TaskIT: Memory-Efficient Fine-Tuning of Multi-LoRA LLMs via Cross- Task Importance Transfer PDF ↗
Cheng Fang, Zimu Zhou, Ke Ma, Bin Guo
79
ARES: Unifying Asymmetric RGB-Event Stereo for Probabilistic Scene Flow Estimation PDF ↗
Jie Long Lee, Gim Hee Lee
80
MER-Tracker: Towards High-Speed 3D Point Tracking via Multi-View Event-RGB Hybrid Cameras PDF ↗
Yiqian Chang, Qinghong Ye, Haoran Xu, Jianing Li, Dongyang Ma, Xuan Wang, Wei Zhang, Yonghong Tian, Peixi Peng
81
Moving Border Ownership for Event-based Motion Segmentation PDF ↗
Zhiyuan Hua, Cornelia Fermüller, Yiannis Aloimonos
82
TTAPFormer: Robust Arbitrary Point Tracking via Transient Asynchronous Fusion of Frames and Events PDF ↗
Jiaxiong Liu, Zhen Tan, Jinpu Zhang, Yi Zhou, Hui Shen, Xieyuanli Chen, Dewen Hu
83
EventHub: Data Factory for Generalizable Event-Based Stereo Networks without Active Sensors PDF ↗
Luca Bartolomei, Fabio Tosi, Matteo Poggi, Stefano Mattoccia, Guillermo Gallego
84
Seeing Motion Through Polarity for Event-based Action Recognition PDF ↗
Meiqi Cao, Jiachao Zhang, Xin Jiang, Rui Yan, Yazhou Yao, Zechao Li, Xiangbo Shu
85
Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning PDF ↗
Sixian Zhang, Yiyao Wang, Xinhang Song, Keming Zhang, Zijian Xu, Shuqiang Jiang
86
Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration PDF ↗
Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan
87
SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL PDF ↗
Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay
88
TeamHOI: Learning a Unified Policy for Cooperative Human-Object Interactions with Any Team Size PDF ↗
Stefan Lionar, Gim Hee Lee
89
AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance PDF ↗
Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister
90
Experience Transfer for Multimodal LLM Agents in Minecraft Game PDF ↗
Chenghao Li, Jun Liu, Songbo Zhang, Huadong Jian, Hao Ni, Lik-Hang Lee, Sung-Ho Bae, Guoqing Wang, Yang Yang, Chaoning Zhang
91
MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation PDF ↗
Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen
92
SaPaVe: Towards Active Perception and Manipulation in Vision- Language Action Models for Robotics PDF ↗
Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
93
MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg- horizon tasks PDF ↗
Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su
94
RealAppiance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manauls PDF ↗
Yuzheng Gao, Yuxing Long, Lei Kang, Yuchong Guo, Ziyan Yu, Shangqing Mao, Jiyao Zhang, Ruihai Wu, Dongjiang Li, Hui Shen, Hao Dong
95
ForeAct: Steering Your VLA with Efficient Visual Foresight Planning PDF ↗
Zhuoyang Zhang, Shang Yang, Qinghao Hu, Luke J. Huang, James Hou, Yufei Sun, Yao Lu, Song Han
96
Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation PDF ↗
Siyu Xu, Zijian Wang, Yunke Wang, Chenghao Xia, Tao Huang, Chang Xu
97
MERIT: Multi-domain Efficient RAW Image Translation PDF ↗
Wenjun Huang, Shenghao Fu, Yian Jin, Yang Ni, Ziteng Cui, Hanning Chen, Yirui He, Yezi Liu, Sanggeon Yun, SungHeon Jeong, Ryozo Masukawa, William Youngwoo Chung, Mohsen Imani
98
Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing PDF ↗
Yusu Qian, Eli Bocek-Rivele, Liangchen Song, Jialing Tong, Yinfei Yang, Jiasen Lu, Wenze Hu, Zhe Gan
99
Probabilistic Prompt Adaptation for Unified Image Aesthetics and Quality Assessment PDF ↗
Takayuki Hara, Yuya Otsuka
100
EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories PDF ↗
Lu Wei, Yuta Nakashima, Noa Garcia
101
Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity PDF ↗
Zhengyao Fang, Zexi Jia, Yijia Zhong, Pengcheng Luo, Jinchao Zhang, Guangming Lu, Jun Yu, Wenjie Pei
102
WiseEdit: Benchmarking Cognition- and Creativity-Informed Image Editing PDF ↗
Kaihang Pan, Weile Chen, Haiyi Qiu, Qifan Yu, Wendong Bu, Zehan Wang, Yun Zhu, Juncheng Li, Siliang Tang
103
UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits PDF ↗
Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing LYU, Zhou Zhao, Shengyu Zhang
104
Inter-Edit: First Benchmark for Interactive Instruction-Based Image Editing PDF ↗
Delong Liu, Haotian Hou, Zhaohui Hou, Zhiyuan Huang, Shihao Han, Mingjie Zhan, Zhicheng Zhao, Fei Su
105
PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis PDF ↗
Inseong Choi, Siwoo Lee, Seung-Hun Nam, Soohwan Song
106
LumiMotion: Improving Gaussian Relighting with Scene Dynamics PDF ↗
Joanna Kaleta, Piotr Wójcik, Kacper Marzol, Tomasz Trzcinski, Kacper Kania, Marek Kowalski
107
Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation PDF ↗
Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim
108
iLRM: An Iterative Large 3D Reconstruction Model PDF ↗
Gyeongjin Kang, Seungtae Nam, Seungkwon Yang, Xiangyu Sun, Sameh Khamis, Abdelrahman Mohamed, Eunbyung Park
109
MVInverse: Feed-forward Multiview Inverse Rendering in Seconds PDF ↗
Xiangzuo Wu, Chengwei Ren, Jun Zhou, Xiu Li, Yuan Liu
110
From None to All: Self-Supervised 3D Reconstruction via Novel View Synthesis PDF ↗
Ranran Huang, Weixun Luo, Ye Mao, Krystian Mikolajczyk
111
MoRel: Long-Range Flicker-Free 4D Motion Modeling via Anchor Relay-based Bidirectioanl Blending with Hierarchical Densification PDF ↗
Sangwoon Kwak, Weeyoung Kwon, Jun Young Jeong, Geonho Kim, Won-Sik Cheong, Jihyong Oh
112
Multi-view Pyramid Transformer: Look Coarser to See Broader PDF ↗
Gyeongjin Kang, Seungkwon Yang, Seungtae Nam, Younggeun Lee, Jungwoo Kim, Eunbyung Park
113
CaT-GS: Efficient 3DGS Rendering for Large Scale Scenes via Inter-frame Caching and Tile Scheduling
Tingjia Zhang, Bo Chen, Shengzhong Liu, Fan Wu, Guihai Chen
114
RL-ScanIQA: Reinforcement-Learned Scanpaths for Blind 360° Image Quality Assessment
Yujia Wang, Yuyan Li, Jiuming Liu, Fang-Lue Zhang, Xinhu Zheng, Neil.A Dodgson
115
Benchmarking Endoscopic Surgical Image Restoration and Beyond PDF ↗
Jialun Pei, Diandian Guo, Donghui Yang, Zhixi Li, Yuxin Feng, Long Ma, Bo Du, Pheng-Ann Heng
116
SDUIE: Semi-Supervised Diffusion for Underwater Image Enhancement with Quant-Text Dual Control PDF ↗
Xiaofeng Cong, Yu-Xin Zhang, Hao Shen, Yeying Jin, Junming Hou, Jie Gui
117
HiDRA: Hierarchical Degradation Representation and Adaptation with Generative Priors for Enhancing Infrared Vision PDF ↗
Zihang Chen, Zhu Liu, Changbo Yan, Jinyuan Liu, Risheng Liu
118
BluRef: Unsupervised Image Deblurring with Dense-Matching References PDF ↗
Bang-Dang Pham, Anh Tran, Cuong Pham, Minh Hoai
119
Bi-Bridge: Bidirectional Diffusion Bridges for Low-Light Image Enhancement PDF ↗
Zeyu Hua, Hui Li, Yu Wang, Song Wang, Congchao Zhu, Caixia Zheng
120
UniLDiff: Unlocking the Power of Diffusion Priors for All-in-One Image Restoration PDF ↗
Zihan Cheng, Liangtai Zhou, Dian Chen, Ni Tang, Xiaotong Luo, Yuan Xie, Yanyun Qu
121
MatAnyone 2: Scaling Video Matting via a Learned Quality Evaluator PDF ↗
Peiqing Yang, Shangchen Zhou, Kai Hao, Qingyi Tao
122
SelfHVD: Self-Supervised Handheld Video Deblurring PDF ↗
Honglei Xu, Zhilu Zhang, Junjie Fan, Xiaohe Wu, Wangmeng Zuo
123
Spatio-Temporal Difference Guided Motion Deblurring with the Complementary Vision Sensor PDF ↗
Yapeng Meng, Lin Yang, Yuguo Chen, Xiangru Chen, Taoyi Wang, Lijian Wang, Zheyu Yang, Yihan Lin, Rong Zhao
124
Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency PDF ↗
Hakan Emre Gedik, Shashank Gupta, Alan Bovik
125
Bridging RGB and Hematoxylin Components: An Interleaved Guidance and Fusion Framework for Point Supervised Nuclei Segmentation PDF ↗
Zihan Huan, Xipeng Pan, Hualong Zhang, Siyang Feng, Rushi Lan, Huadeng Wang, Haoxiang Lu, Zhenbing Liu
126
Virtual Nodes Guided Dynamic Graph Neural Network for Brain Tumor Segmentation with Missing Modalities PDF ↗
Sha Tao, Jiao Pan, Yu Guo, Chao Yao
127
VoxTell: Free-Text Promptable Universal 3D Medical Image Segmentation PDF ↗
Maximilian Rokuss, Moritz Langenberg, Yannick Kirchhoff, Fabian Isensee, Benjamin Hamm, Constantin Ulrich, Sebastian Regnery, Lukas Bauer, Efthimios Katsigiannopulos, Tobias Norajitra, Klaus Maier-Hein
128
Photo-Guided Tooth Segmentation on 3D Oral Scan Model PDF ↗
Shaojie Zhuang, Guangshun Wei, Jiangxin He, Yuanfeng Zhou
129
Breaking the Continuum: Discrete Distribution Learning for Structural MRI Reconstruction PDF ↗
Tianle Lyu, Mengjingcheng Mo, Ting Wen, Zhen Song, Zinan Xiong, Yanjie Zhu
130
Uni-Hema: Unified Model for Digital Hematopathology PDF ↗
Abdul Rehman, Iqra Rasool, Ayisha Imran, Mohsen Ali, Waqas Sultani
131
Post-training Feature Pruning for Fundus Images Classification PDF ↗
Van-Nguyen Pham, Duc-Tai Le, Junghyun Bum, Hyunseung Choo
132
Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation PDF ↗
Delin An, Chaoli Wang
133
SafeLogo: Turning Your Logos into Jailbreak Shields via Micro-Regional Adversarial Training PDF ↗
Zhiyi Duan, Xiaoyue Zhang, Tianxing Man
134
Anti-I2V: Safeguarding your Photos from Malicious Image-to-video Generation PDF ↗
Duc Vu, Anh Nguyen, Chi Tran, Anh Tran
135
UniGame: Turning a Unified Multimodal Model Into Its Own Adversary PDF ↗
Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang
136
Hierarchically Robust Zero-shot Vision-language Models PDF ↗
Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz
137
Beyond Text Prompts: Precise Concept Erasure through Text– Image Collaboration PDF ↗
Jun Li, Lizhi Xiong, Ziqiang Li, Weiwei Jiang, Zhangjie Fu, Yong Li, Guo-Sen Xie
138
AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions PDF ↗
Zonghao Ying, Le Wang, Yisong Xiao, Jiakai Wang, Yuqing Ma, Jinyang Guo, Zhenfei Yin, Mingchuan Zhang, Aishan Liu, Xianglong Liu
139
ReMoE: Region-Mixture Experts for Adversarially-Robust Vision Transformers PDF ↗
Qinghao Zhong, Bingzhi Chen, Yishu Liu, Minhua Lu, Guangming Lu
140
TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration PDF ↗
Chunxiao Li, Lijun Li, Jing Shao
141
SO-Bench: A Structural Output Evaluation of Multimodal LLM PDF ↗
Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang, Zhifeng Chen, Afshin Dehghan
142
Chain-of-Thought Guided Multi-Modal Object Re-Identification PDF ↗
Ya Gao, Shihao Li, Zhaojun Liu, Aihua Zheng, Chenglong Li, Jin Tang
143
When Lines Meet Textures: Spatial-Frequency Aligned Diffusion Features for Cross-Sparsity Correspondence PDF ↗
Mingrui Zhu, Fengzhi Wang, Xin Wei, Jun Wang, Nannan Wang, Xinbo Gao
144
CountGD++: Generalized Prompting for Open-World Counting PDF ↗
Niki Amini-Naieni, Andrew Zisserman
145
AudioStory: Generating Long-Form Narrative Audio with Large Language Models PDF ↗
Yuxin Guo, Teng Wang, Yuying Ge, Shijie Ma, Yixiao Ge, Wei Zou
146
Parameter-Efficient Adaptation for MLLMs via Implicit Modality Decomposition PDF ↗
Mingfang Zhang, Yunhong Wang, Lu Wang, Jiaxin Chen
147
Hyperbolic Gramian Volumes for Multimodal Alignment PDF ↗
Saiyang Na, Feng Jiang, Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Yuzhi Guo, Hehuan Ma, Chunyuan Li, Weizhi An, Junzhou Huang
148
Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping PDF ↗
Tianxiang Du, Hulingxiao He, Yuxin Peng
149
AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation PDF ↗
Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang
150
StableMTL: Repurposing Latent Diffusion Models for Multi-Task Learning from Partially Annotated Synthetic Datasets PDF ↗
Anh-Quan Cao, Ivan Lopes, Raoul de Charette
151
CaReFlow: Cyclic Adaptive Rectified Flow for Multimodal Fusion PDF ↗
Sijie Mai, Shiqin Han
152
Lenses: Toward Polysemous Vision–Language Understanding PDF ↗
Hani Alomari, Ali Asgarov, Chris Thomas
153
CoRiM: Conflict-driven Risk Minimization for Dynamic Multimodal Fusion PDF ↗
Shihao Zou, Wei Wei
154
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models PDF ↗
Huatian Zhang, Zhendong Mao, Lei Zhang, Yongdong Zhang
155
CICA: Coupling Confidence-Aware Pretraining with Confidence- Informed Attention for Robust Multimodal Sentiment Analysis PDF ↗
Haoyu Jiang, Xiaoliang Chen, Duoqian Miao, Xiaolin Qin, Xianyong Li, Yajun Du
156
SAMTok: Representing Any Mask with Two Words PDF ↗
Yikang Zhou, Tao Zhang, Dengxian Gong, Yuanzheng Wu, Ye Tian, Haochen Wang, Haobo Yuan, Jiacong Wang, Lu Qi, Hao Fei, Shunping Ji, Anran Wang, Zhuochen Wang, Yujing Wang, Cheng Chen, Xiangtai Li
157
Multi-Metric Representation Learning Strategy Based on Clustering for Fine-Grained Multimodal Sentiment Analysis PDF ↗
Yidan Wang, Zongheng Wang, Hongjie Xing, Chunguo Li, Xiaoxiao Liu
158
Cinematic Audio Source Separation Using Visual Cues PDF ↗
Kang Zhang, Suyeon Lee, Arda Senocak, Joon Son Chung
159
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection PDF ↗
Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang
160
Anchor-Guided Gradient Alignment for Incomplete Multimodal Learning PDF ↗
Zhi-Hao Guan, Longfei Huang, Yang Yang
161
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation PDF ↗
Onkar Susladkar, Tushar Prakash, Adheesh Juvekar, Kiet A. Nguyen, Dong-Hwan Jang, Inderjit S Dhillon, Ismini Lourentzou
162
VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation PDF ↗
Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang
163
Kontinuous Kontext: Continuous Strength Control for Instruction- based Image Editing PDF ↗
Rishubh Parihar, Or Patashnik, Daniil Ostashev, Venkatesh Babu Radhakrishnan, Daniel Cohen-Or, Kuan-Chieh Jackson Wang
164
VideoCoF: Unified Video Editing with Temporal Reasoner PDF ↗
Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu
165
Progressive Supernet Training for Efficient Visual Autoregressive Modeling PDF ↗
Xiaoyue Chen, Yuling Shi, Kaiyuan Li, Huandong Wang, Yong Li, Xiaodong Gu, Xinlei Chen, Mingbao Lin
166
CoT-Edit: Let CoT Guide Instruction Video Editing PDF ↗
Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen
167
Scaling Instruction-Based Video Editing with a High-Quality Synthetic Dataset PDF ↗
Qingyan Bai, Qiuyu Wang, Hao Ouyang, Yue Yu, Hanlin Wang, Wen Wang, Ka Leong Cheng, Shuailei Ma, Yanhong Zeng, Zichen Liu, Yinghao Xu, Yujun Shen, Qifeng Chen
168
Test-Time Instance-Specific Parameter Composition: A New Paradigm for Adaptive Generative Modeling PDF ↗
Minh-Tuan Tran, Xuan-May Le, Quan Hung Tran, Mehrtash Harandi, Dinh Phung, Trung Le
169
Understanding, Accelerating, and Improving MeanFlow Training PDF ↗
Jin-Young Kim, Hyojun Go, Lea Bogensperger, Julius Erbach, Nikolai Kalischek, Federico Tombari, Konrad Schindler, Dominik Narnhofer
170
Meta-CoT: Enhancing Granularity and Generalization in Image Editing PDF ↗
Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang
171
Dual-Granularity Memory for Efficient Video Generation PDF ↗
Hongjun Wang, Lin Liu, Jianguo Li, Tao Lin
172
Unified Camera Positional Encoding for Controlled Video Generation PDF ↗
Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Gambardella, Dinh Phung, Jianfei Cai
173
EditMGT: Unleashing Potentials of Masked Generative Transformers in Image Editing PDF ↗
Wei Chow, Linfeng Li, Lingdong Kong, Zefeng Li, Qi Xu, Hang Song, Tian Ye, Xian Wang, Jinbin Bai, Shilin Xu, Xiangtai Li, Junting Pan, Shaoteng Liu, Ran Zhou, Tianshu Yang, Songhua Liu
174
MU-GeNeRF: Multi-view Uncertainty-guided Generalizable Neural Radiance Fields for Distractor-aware Scene PDF ↗
Wenjie Mu, Zhan Li, Chuanzhou Su, Xuanyi Shen, Ziniu Liu, Fan Lu, Yujian Mo, Junqiao Zhao, Tiantian Feng, Chen Ye, Guang Chen
175
PLACID: Identity-Preserving Multi-Object Compositing via Video Diffusion with Synthetic Trajectories PDF ↗
Gemma Canet Tarrés, Manel Baradad, Francesc Moreno-Noguer, Yumeng Li
176
Object-WIPER: Training-Free Object and Associated Effect Removal in Videos PDF ↗
Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni
177
Mobile-VTON: High-Fidelity On-Device Virtual Try- On PDF ↗
Zhenchen Wan, Ce Chen, Runqi Lin, Jiaxin Huang, Tianxi Chen, Yanwu Xu, Tongliang Liu, Mingming Gong
178
Progress by Pieces: Test-Time Scaling for Autoregressive Image Generation PDF ↗
Joonhyung Park, Hyeongwon Jang, Joowon Kim, Eunho Yang
179
Towards Robust Sequential Decomposition for Complex Image Editing PDF ↗
Zilai Zeng, Mingdeng Cao, Zijie Li, Xiaochen Lian, Yichun Shi, Peihao Zhu, Chen Sun, Peng Wang
180
Layer Consistency Matters: Elegant Latent Transition Discrepancy for Generalizable Synthetic Image Detection PDF ↗
Yawen Yang, Feng Li, Shuqi Kong, Yunfeng Diao, Xinjian Gao, Zenglin Shi, Meng Wang
181
Chain of Event-Centric Causal Thought for Physically Plausible Video Generation PDF ↗
Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei
182
LoL: Longer than Longer, Scaling Video Generation to Hour PDF ↗
Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, Cho-Jui Hsieh
183
FlowMotion: Training-Free Flow Guidance for Video Motion Transfer PDF ↗
Zhen Wang, Youcan Xu, Jun Xiao, Long Chen
184
Learning Straight Flows: Variational Flow Matching for Efficient Generation PDF ↗
Chenrui Ma, Xi Xiao, Tianyang Wang, Xiao Wang, Yanning Shen
185
SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens PDF ↗
Xiaoyan Zhang, Zechen Bai, Haofan Wang, Yiren Song
186
DNF-SR: Dual-Input and Negative-Aware Feature Fine-Tuning for Real-World Image Super-Resolution PDF ↗
Shuhao Han, Wenjie Liao, Hayden Vance, Hang Dong, Rui Zhang, Chun-Le Guo, Chongyi Li
187
IFCSR: Inference-Free Fidelity-Realism Control for One-Step Diffusion-based Real-World Image Super-Resolution PDF ↗
Jonghee Back, Jongju Kim, Jeong-Uk Kim, Eunjin Kim, Minyong Jeon
188
Edge-Focused Super-Resolution for Omnidirectional Images with Spherical Geometric Augmentation PDF ↗
Shaolin Wang, Yuying Li, Lei Zhong, Shigang Li, Jianfeng Li
189
TUDSR: Twice Upsampling-Diffusion for Higher Super- Resolution PDF ↗
Zhiqiang Wu, Yitong Dong, Xian Wei
190
PS-SR: Pseudo-Single-Step Video Super-Resolution via Speculative Diffusion PDF ↗
Aiqiu Wu, Zhaofan Qiu, Ting Yao, Tao Mei
191
Disentangled Textual Priors for Diffusion-based Image Super-Resolution PDF ↗
Lei Jiang, Xin Liu, Xinze Tong, Zhiliang Li, Jie Liu, Jie Tang, Gangshan Wu
192
Remote Sensing Image Super-Resolution for Imbalanced Textures: A Texture-Aware Diffusion Framework PDF ↗
Enzhuo Zhang, Sijie Zhao, Dilxat Muhtar, Zhenshi Li, Xueliang Zhang, Pengfeng Xiao
193
Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features PDF ↗
Jingyi Xu, Meisong Zheng, Ying Chen, Minglang Qiao, Xin Deng, Mai Xu
194
DreamSR: Towards Ultra-High-Resolution Image Super-Resolution via a Receptive-Field Enhanced Diffusion Transformer PDF ↗
Qingji Dong, Hang Dong, Mingqin Chen, Rui Zhang, Yitong Wang
195
FiDeSR: High-Fidelity and Detail-Preserving One-Step Diffusion Super-Resolution PDF ↗
Aro Kim, Myeongjin Jang, Chaewon Moon, Youngjin Shin, Jinwoo Jeong, Sang-hyo Park
196
STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution PDF ↗
Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan
197
Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization PDF ↗
Hanchao Liu, Fang-Lue Zhang, Shining Zhang, Tai-Jiang Mu, Shi-Min Hu
198
Learning to Control Physically-simulated 3D Characters via Generating and Mimicking 2D Motions PDF ↗
Jianan Li, Xiao Chen, Tao Huang, Tien-Tsin Wong
199
Human Geometry Distribution for 3D Animation Generation PDF ↗
Xiangjun Tang, Biao Zhang, Peter Wonka
200
A Temporal and Content Co-Awareness Latent Diffusion for Controllable Hand Image Generation PDF ↗
Shuang Hao, Pengfei Ren, Haifeng Sun, Ting Pan, Qi Qi, Lei Zhang, Cong Liu, Jianxin Liao, Jingyu Wang
201
Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation PDF ↗
Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu
202
Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning PDF ↗
Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki
203
Stability-Driven Motion Generation for Object-Guided Human- Human Co-Manipulation PDF ↗
Jiahao Xu, Xiaohan Yuan, Xingchen Wu, Chongyang Xu, Kun Li, Buzhen Huang
204
Causal Motion Diffusion Models for Autoregressive Motion Generation PDF ↗
Qing Yu, Akihisa Watanabe, Kent Fujiwara
205
Towards Storytelling Animations: Joint Synthesis of Human and Camera Motions PDF ↗
Boyuan Cheng, Yingjie Xi, Rui He, Jinhe Na, Ying Cao, Pengjie Wang, Jian J. Zhang, Xiaosong Yang
206
MoLingo: Motion–Language Alignment for Text-to-Human Motion Generation PDF ↗
Yannan He, Garvita Tiwari, Xiaohan Zhang, Pankaj Bora, Tolga Birdal, Jan Eric Lenssen, Gerard Pons-Moll
207
End-to-End Language-Action Model for Humanoid Whole Body Control PDF ↗
Yuxuan Wang, Haobin Jiang, Shiqing Yao, Ziluo Ding, Zongqing Lu
208
Toward Early Quality Assessment of Text-to-Image Diffusion Models PDF ↗
Huanlei Guo, Hongxin Wei, Bingyi Jing
209
CoD: A Diffusion Foundation Model for Image Compression PDF ↗
Zhaoyang Jia, Zihan Zheng, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Houqiang Li, Yan Lu
210
Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE) PDF ↗
Gustavo Chau Loo Kung, Mohammad Abbasi, Camila Blank, Juze Zhang, Alan Q. Wang, Sophie Ostmeier, Akshay Chaudhari, Kilian Pohl, Ehsan Adeli
211
Language-Guided One-Step Diffusion Model for Nighttime Flare Removal PDF ↗
Aoxiang Ning, Kailong Yu, Minglong Xue, Liyuan Pan, Jinhong He, Wenchao Yan, Mingliang Zhou, Yirui Wu
212
SpiralDiff: Spiral Diffusion with LoRA for RGB-to-RAW Conversion Across Cameras PDF ↗
Huanjing Yue, Shangbin Xie, Cong Cao, Qian Wu, Lei Zhang, Lei Zhao, Jingyu Yang
213
PnP-CM: Consistency Models as Plug-and-Play Priors for Inverse Problems PDF ↗
Merve Gulle, Junno Yun, Yasar Utku Alcalar, Mehmet Akcakaya
214
Landscape-Awareness for Geometric View Diffusion Model PDF ↗
Yan-Ting Chen, Hao-Wei Chen, Tsu-Ching Hsiao, Chun-Yi Lee
215
Otil: Accelerating Diffusion Model Inference via Communication- Efficient Multi-GPU Parallelism PDF ↗
Xin Li, Shujun Tian, Tao Lu, Han Bao, Zonghui Wang, Wenzhi Chen
216
REACH: Explicit Recovery Behavior for Diffusion Policies PDF ↗
Zundong Ke, Junlin Chen, Jiayi Zhu, Kuanhao Xia, Boyi Zhao, Jiayuan Gu
217
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model PDF ↗
Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung
218
CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods PDF ↗
Qinqian Lei, Bo Wang, Robby T. Tan
219
The LLM Bottleneck: Why Open-Source Vision LLMs Struggle with Hierarchical Visual Recognition PDF ↗
Yuwen Tan, Yuan Qing, Boqing Gong
220
Do Vision-Language Models Measure Up? Benchmarking Visual Measurement Reading with MeasureBench PDF ↗
Fenfen Lin, Yesheng Liu, Haiyu Xu, Yue Chen, Zheqi He, Mingxuan Zhao, Miguel Hu Chen, Jin-Ge Yao, Xi Yang
221
KαLOS finds Consensus: A Meta-Algorithm for Evaluating Inter- Annotator Agreement in Complex Vision Tasks
David Tschirschwitz, Volker Rodehorst
222
Beyond Single Images: A Comprehensive Benchmark for Album-Level Vision-Language Understanding PDF ↗
Shawn Huang, Brian Price, Yifei Fan, Bryan Morse
223
LIBERO-Plus: A Progressive Robustness Benchmark for Visual- Language-Action Models PDF ↗
Senyu Fei, Siyin Wang, Junhao Shi, Zihao Dai, Jikun Cai, Pengfang Qian, Li Ji, Xinzhe He, Shiduo Zhang, Zhaoye Fei, Jinlan Fu, Jingjing Gong, Xipeng Qiu
224
Scenes as Tokens: Multi-Scale Normal Distributions Transform Tokenizer for General 3D Vision–Language Understanding PDF ↗
Yutao Tang, Cheng Zhao, Gaurav Mittal, Rohith Kukkala, Rama Chellappa, Cheng Peng, Mei Chen
225
LangRef3DGS: Natural Language-Guided 3D Referential Segmentation from Partial Observations via 3D Gaussian Splatting PDF ↗
Xulun Ye, Qin Zhang, Kun Zhou
226
Hear you are: Teaching LLMs Spatial Reasoning with Vision and Spatial Sound PDF ↗
Hyeonggon Ryu, Joon Son Chung, David Harwath
227
EgoMind: Activating Spatial Cognition through Linguistic Reasoning in MLLMs PDF ↗
Zhenghao Chen, Huiqun Wang, Di Huang
228
SAQN: Semantic-based Adaptive Query Network for 3D Referring Expression Segmentation PDF ↗
Jiale Huang, Shangfei Wang
229
EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence PDF ↗
Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Ding Yuan, Hong Zhang, Yifan Yang
230
Abstract 3D Perception for Spatial Intelligence in Vision-Language Models PDF ↗
Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister
231
PV-Ground: Text-Guided Point-Voxel Interaction for 3D Visual Grounding PDF ↗
Junpeng Shang, Feifei Shao, Jun Xiao, Lin Li, Hongwei Wang, Dongfang Ma
232
Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding PDF ↗
Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo
233
SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning PDF ↗
Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan
234
Geometrically-Constrained Agent for Spatial Reasoning PDF ↗
Zeren Chen, Xiaoya Lu, Zhijie Zheng, Pengrui Li, Lehan He, Yijin Zhou, Jing Shao, Bohan Zhuang, Lu Sheng
235
PARSE: Part-Aware Relational Spatial Modeling PDF ↗
Yinuo Bai, Peijun Xu, Kuixiang Shao, Yuyang Jiao, Jingxuan Zhang, Kaixin Yao, Jiayuan Gu, Jingyi Yu
236
R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space PDF ↗
Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax
237
MCHDoc: A Comprehensive Benchmark for Reading Multi-Carrier Chinese Historical Documents PDF ↗
Yijun Sheng, Shipeng Zhu, Ruijia Zuo, Na Nie, Hui Xue
238
Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark PDF ↗
Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang
239
CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval PDF ↗
Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray
240
DiT-Distill: Open-Set Fine-Grained Retrieval via Generative Curriculum Knowledge PDF ↗
Xin Jiang, Hao Tang, Meiqi Cao, Junyao Gao, Fei Shen, Zechao Li
241
ReCALL: Recalibrating Capability Degradation for MLLM- based Composed Image Retrieval PDF ↗
Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua
242
Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning PDF ↗
Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan
243
Rethinking BCE Loss for Multi-Label Image Recognition with Fine- Tuning PDF ↗
Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Yafeng Yin, Shufan Yang, Qing Gu
244
CAST: Context-Aware Dynamic Latent Space Transformation for Interactive Text-to-Image Retrieval PDF ↗
Xuanzuo Lin, Min Zhang, Daizong Liu, Zhiwen Zuo, Xun Yang, Changting Lin, Xun Wang, Jianfeng Dong
245
PriVi: Towards a General-Purpose Video Model for Primate Behavior in the Wild PDF ↗
Felix B. Mueller, Jan F. Meier, Timo Lueddecke, Richard Vogg, Roger L. Freixanet, Valentin Hassler, Tiffany Bosshard, Elif Karakoc, William J. O'Hearn, Sofia M. Pereira, Sandro Sehner, Kaja Wierucka, Judith Burkart, Claudia Fichtel, Julia Fischer, Alexander Gail, Catherine Hobaiter, Julia Ostner, Liran Samuni, Oliver Schülke, Neda Shahidi, Erin G. Wessling, Alexander S. Ecker
246
Seeing Conversations: Communication Context Identification in Egocentric Video PDF ↗
Tobias Dorszewski, Jens Hjortkjær
247
Interactive Episodic Memory with User Feedback PDF ↗
Nikesh Subedi, Loris Bazzani, Ziad Al-Halah
248
Seeing without Pixels: Perception from Camera Trajectories PDF ↗
Zihui Xue, Kristen Grauman, Dima Damen, Andrew Zisserman, Tengda Han
249
PFGNet: A Fully Convolutional Frequency-Guided Peripheral Gating Network for Efficient Spatiotemporal Predictive Learning PDF ↗
Xinyong Cai, Changbin Sun, Yong Wang, Hongyu Yang, Yuankai Wu
250
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding PDF ↗
Arsha Nagrani, Jasper Uijlings, Shyamal Buch, Tobias Weyand, Sudheendra Vijayanarasimhan, Bo Hu, Ramin Mehran, David A Ross, Cordelia Schmid
251
StreamRAG: Enhancing Real-Time Video Understanding with Retrieval Augmentation PDF ↗
Junlin Xie, Quanlong Zheng, Ruifei Zhang, Kuo Wang, Yanhao Zhang, Jinguo Luo, Haonan Lu, Xiang Wan, Guanbin Li
252
ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting PDF ↗
Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang
253
SkillSight: Efficient First-Person Skill Assessment with Gaze PDF ↗
Chi Hsuan Wu, Ashutosh Kumar, Kristen Grauman
254
BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment PDF ↗
Kanglei Zhou, Chang Li, Qingyi Pan, Liyuan Wang
255
Video-as-Answer: Predict and Generate Next Video Event with Joint- GRPO PDF ↗
Junhao Cheng, Liang Hou, Xin Tao, Jing Liao
256
MedLIME: A Distribution-Aligned and Evidence-Supported Framework for Medical Saliency Explanations PDF ↗
Raghav Magazine, Xingjian Li, Min Xu
257
Inside-Out: Measuring Generalization in Vision Transformers Through Inner Workings PDF ↗
Yunxiang Peng, Mengmeng Ma, Ziyu Yao, Xi Peng
258
Language Models Can Explain Visual Features via Steering PDF ↗
Javier Ferrando, Enrique Lopez-Cuena, Pablo Agustin Martin- Torres, Daniel Hinjos, Anna Arias-Duart, Dario Garcia-Gasulla
259
Making the Classification Explanation Faithful to the Confidence Score PDF ↗
Jian-Xun Mi, Lu Pan, Weisheng Li
260
Intrinsic Concept Extraction Based on Compositional Interpretability PDF ↗
Hanyu Shi, Hong Tao, Guoheng Huang, Jianbin Jiang, Xuhang Chen, Chi-Man Pun, Shanhu Wang, Pan Pan
261
Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors PDF ↗
Peiyu Yang, Naveed Akhtar, Jiantong Jiang, Ajmal Mian
262
Measuring the (Un)Faithfulness of Concept-Based Explanations PDF ↗
Shubham Kumar, Narendra Ahuja
263
Deformation-based In-Context Learning for Point Cloud Understanding PDF ↗
Chengxing Lin, Jinhong Deng, Yinjie Lei, Wen Li
264
ELiC: Efficient LiDAR Geometry Compression via Cross-Bit-depth Feature Propagation and Bag-of-Encoders PDF ↗
Junsik Kim, Gun Bang, Soowoong Kim
265
ESAM++: Efficient Online 3D Perception on the Edge PDF ↗
Qin Liu, Lavisha Aggarwal, Saptarashmi Bandyopadhyay, Vikas Bahirwani, Marc Niethammer, Ehsan Adeli, Andrea Colaco
266
DualReg: Dual-Space Filtering and Reinforcement for Rigid Registration PDF ↗
Jiayi Li, Yuxin Yao, Qiuhang Lu, Juyong Zhang
267
Hg-I2P: Bridging Modalities for Generalizable Image-to-Point-Cloud Registration via Heterogeneous Graphs PDF ↗
Pei An, Junfeng Ding, Jiaqi Yang, Yulong Wang, Jie Ma, Liangliang Nan
268
Rethinking 2D-3D Registration: A Novel Network for High-Value Zone Selection and Representation Consistency Alignment PDF ↗
Zhixin Cheng, Bohao Liao, Jiacheng Deng, Xiaotian Yin, Xinjun Li, Yujia Chen, Baoqun Yin, Tianzhu Zhang
269
Adaptive 3D Perception for Small Aerial Targets Under Sparse Sampling via Reinforcement Learning PDF ↗
Shenghai Yuan, Wei Yihan, Jason Yee, Zhuoran Qiao, boyang lou, Enwen Hu
270
3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds PDF ↗
Ryousuke Yamada, Kohsuke Ide, Yoshihiro Fukuhara, Hirokatsu Kataoka, Gilles Puy, Andrei Bursuc, Yuki M. Asano
271
StreamVLO: Streaming Visual–LiDAR Odometry with Cumulative Drift Compensation PDF ↗
Mengmeng Liu, Jiuming Liu, Michael Ying Yang, Chaokang Jiang, Jiangtao Li, Yunpeng Zhang, Hesheng Wang, Francesco Nex, Hao Cheng
272
Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding PDF ↗
Jincen Jiang, Qianyu Zhou, Yuhang Li, Kui Su, Meili Wang, Jian Chang, Jian Jun Zhang, Xuequan Lu
273
Routing on Demand: DSNet for Efficient Progressive Point Cloud Denoising PDF ↗
Xiaoqian Cheng, Dong Xiao, Husen Li, Zheng Liu, Renjie Chen
274
Hyper-PCN: Hypergraph-Based Point Cloud Completion via High-Order Correlation Modeling PDF ↗
Linfei Li, Pei Tan, Siqi Li, Changqing Zou, Yue Gao
275
Towards Calibrating Prompt Tuning of Vision- Language Models PDF ↗
Ashshak Sharifdeen, Fahad Shamshad, Muhammad Akhtar Munir, Abhishek Basu, Mohamed Ismithdeen, Jeyapriyan Jeyamohan, Chathurika Silva, Karthik Nandakumar, Muhammad Haris Khan
276
DEVA: Fine-tuning Multimodal Large Language Models for Visual Perception Tasks PDF ↗
Debasmit Das, Munawar Hayat, Fatih Porikli
277
LOREAL: Mitigating Low-Resolution Challenges in Vision-Language Models with Attribute-driven Prompt Self-Distillation PDF ↗
Xucong Wang, Pengkun Wang, Zhe Zhao, Liheng Yu, Rui Mao, Yang Wang
278
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning PDF ↗
Yanqing Liu, Xianhang Li, Letian Zhang, Zirui Wang, Zeyu Zheng, Yuyin Zhou, Cihang Xie
279
Language-guided Frequency Modulation for Large Vision-Language Models PDF ↗
Shuyi Ouyang, Gongfan Fang, Xinyin Ma, Yen-Wei Chen, Lanfen Lin, Xinchao Wang
280
TANGO: Text-Anchored Guided Optimization for Robust Fine-tuning Vision-Language Models under Label Noise PDF ↗
Tengfei Ma, Weiran Pan, Wei Wei
281
Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining PDF ↗
Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo
282
Reconstructing CLIP for Open-Vocabulary Dense Perception PDF ↗
Yajie Liu, Jinjin Zhang, Qingjie Liu, Di Huang
283
DPL: Decoupled Prototype Learning for Enhancing Robustness of Vision–Language Transformers to Missing Modalities PDF ↗
Jueqing Lu, Yuanyuan Qi, Xiaohao Yang, Shuaicheng Niu, Fucai Ke, Shujie Zhou, Wei Tan, Jionghao Lin, Wray Buntine, Hamid Rezatofighi, Lan Du
284
BrepVGAE: Variational Graph Autoencoder with Unified Latent Representation for B-rep PDF ↗
Hao Guo, Liyuan Deng, Yongkang Dai, Ruohan Wang, Jiahao Li, Yunpeng Bai, Yilei Shi
285
NeuROK: Generative 4D Neural Object Kinematics PDF ↗
Chen Geng, Guangzhao He, Yue Gao, Yunzhi Zhang, Shangzhe Wu, Jiajun Wu
286
BrickNet: Graph-Backed Generative Brick Assembly PDF ↗
Peter Kulits, Cordelia Schmid
287
Unified Vector Floorplan Generation via Markup Representation PDF ↗
Kaede Shiohara, Toshihiko Yamasaki
288
CME-CAD: Heterogeneous Collaborative Multi-Expert Reinforcement Learning for CAD Code Generation PDF ↗
Ke Niu, Haiyang Yu, Zhuofan Chen, Zhengtao Yao, Weitao Jia, Xiaodong Ge, Jingqun Tang, Benlei Cui, Bin Li, Xiangyang Xue
289
Robo-SGG: Exploiting Layout-Oriented Normalization and Restitution Can Improve Robust Scene Graph Generation PDF ↗
Changsheng Lv, Zijian Fu, Mengshi Qi
290
OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens PDF ↗
Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai, Gang Yu, Xingjun Ma
291
EpiAgent: An Agent-Centric System for Ancient Inscription Restoration PDF ↗
Shipeng Zhu, Ang Chen, Na Nie, Pengfei Fang, Min-Ling Zhang, Hui Xue
292
The Invisible Gorilla Effect in Out-of-distribution Detection PDF ↗
Harry Anthony, Ziyun Liang, Hermione Warr, Konstantinos Kamnitsas
293
Interpretable Debiasing of Vision-Language Models for Social Fairness PDF ↗
Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim
294
Image-based Outlier Synthesis With Training Data PDF ↗
Sudarshan Regmi
295
SALMUBench: A Benchmark for Sensitive Association-Level Multimodal Unlearning PDF ↗
Cai Selvas-Sala, Lei Kang, Lluis Gomez
296
Scaling Test-Time Robustness of Vision-Language Models via Self-Critical Inference Framework PDF ↗
Kaihua Tang, Jiaxin Qi, Jinli Ou, Yuhua Zheng, Jianqiang Huang
297
When Understanding Becomes a Risk: Authenticity and Safety Risks in the Emerging Image Generation Paradigm PDF ↗
Ye Leng, Junjie Chu, Mingjie Li, Chenhao Lin, Chao Shen, Michael Backes, Yun Shen, Yang Zhang
298
IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustness PDF ↗
Ziye Geng, Guang Yang, Yihang Chen, Changqing Luo
299
Mark4D: Temporally-Consistent Watermarking for 4D Gaussian Splatting PDF ↗
Jaejin Lee, Minjae Jeong, Joonhyuk Park, Yechan Hwang, Seunghun Baek, Won Hwa Kim
300
Machine Unlearning via Adaptive Gradient Reweighting and Multi- stage Objective Optimization PDF ↗
Juxin Lu, Haoyu Shi, Mengyao Wang, Huaiwen Zhang
301
Taming Noise-Induced Prototype Degradation for Privacy-Preserving Personalized Federated Fine-Tuning PDF ↗
Yuhua Wang, Qinnan Zhang, Xiaodong Li, Huan Zhang, Yifan Sun, Wangjie Qiu, Hainan Zhang, Yongxin Tong, Zhiming Zheng
302
FedMOP: Achieving Enhanced Privacy and Performance in Federated Learning via Momentum Orthogonal Projection PDF ↗
Yunlong Zhao, Xiaoheng Deng, Hongyan Xu, Zhuohua Qiu, Xiaowen Hu, Shan You, Yi Chen, Chang Xu, Xiu Su
303
HFedATM: Hierarchical Federated Domain Generalization via Optimal Transport and Regularized Mean Aggregation PDF ↗
Thinh Nguyen, Trung Phan, Binh Nguyen, Khoa D Doan, Kok-Seng Wong
304
Single-Round Scalable Analytic Federated Learning PDF ↗
Alan T. L. Bacellar, Mustafa Munir, Felipe M. G. França, Priscila M. V. Lima, Radu Marculescu, Lizy K. John
305
Controllable Federated Prompt Learning at Test Time PDF ↗
Rui Zhu, Liang Bai, Yanming Guo, Yirun Ruan, Tianyuan Yu, Zhihe Lu
306
FedRE: A Representation Entanglement Framework for Model- Heterogeneous Federated Learning PDF ↗
Yuan Yao, Lixu Wang, Jiaqi Wu, Jin Song, Simin Chen, Zehua Wang, Zijian Tian, Wei Chen, Huixia Li, Xiaoxiao Li
307
Conversational Image Segmentation: Grounding Abstract Concepts with Scalable Supervision PDF ↗
Aadarsh Sahoo, Georgia Gkioxari
308
Spatial Matters: Position-Guided 3D Referring Expression Segmentation PDF ↗
Yabing Wang, Zhuotao Tian, Le Wang, Zheng Qin, Sanping Zhou
309
Long-RVOS: A Comprehensive Benchmark for Long-term Referring Video Object Segmentation PDF ↗
Tianming Liang, Haichao Jiang, Yuting Yang, Chaolei Tan, Shuai Li, Wei-Shi Zheng, Jian-Fang Hu
310
Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation PDF ↗
Haichao Jiang, Tianming Liang, Wei-Shi Zheng, Jian-Fang Hu
311
CaptionFormer: Unified Segmentation, Tracking, and Captioning for Spatio-Temporal Objects PDF ↗
Gabriel Fiastre, Antoine Yang, Cordelia Schmid
312
TransPrune: Token Transition Pruning for Efficient Large Vision- Language Model PDF ↗
Ao Li, Yuxiang Duan, Jinghui Zhang, Congbo Ma, Yutong Xie, Gustavo Carneiro, Mohammad Yaqub, Hu Wang
313
QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models PDF ↗
Jingxuan Zhang, Yunta Hsieh, Zhongwei Wan, Haokun Lin, Xin Wang, Ziqi Wang, Yingtie Lei, Mi Zhang
314
Revisiting Multimodal KV Cache Compression: A Frequency- Domain-Guided Outlier-KV-Aware Approach PDF ↗
Yaoxin Yang, Peng Ye, Xudong Tan, Chongjun Tu, Maosen Zhao, Jia Hao, Tao Chen
315
Collaborative Multi-Mode Pruning for Vision-Language Models PDF ↗
Zimeng Wu, Yunhong Wang, Donghao Wang, Jiaxin Chen
316
ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models PDF ↗
Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong
317
HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models PDF ↗
Qihui Zhu, Tao Zhang, Yuchen Wang, Shuangwu Chen, Xiaobin Tan, Jian Yang, Yang Liu, Yinfei Pan
318
CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs PDF ↗
Jingyu Lei, Gaoang Wang, Der-Horng Lee
319
Imbalanced View Contribution Evaluation and Refinement for Deep Incomplete Multi-View Clustering PDF ↗
Taichun Zhou, Zhibin Dong, Hao Tan, Siwei Wang, Xinwang Liu, En Zhu, Di Hu, Tianrui Liu, Chuankun Li, Kunlun He
320
Multi-Hierarchical Contrastive Spectral Fusion for Multi-View Clustering PDF ↗
Bing Cai, Xiaoli Wang, Gui-Fu Lu, Zechao Li
321
SECOS: Semantic Capture for Rigorous Classification in Open-World Semi-Supervised Learning PDF ↗
Hezhao Liu, Jiacheng Yang, Junlong Gao, Mengke Li, Yiqun Zhang, Shreyank N Gowda, Yang Lu
322
Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery PDF ↗
Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li
323
TimeBridge: Self-Supervised Video Representation Learning via Start-End Joint Embedding and In-Between Frame Prediction PDF ↗
Qin Wang, Abigail Morrison, Hanno Scharr, Kai Krajsek
324
Mitigating Instance Entanglement in Instance-Dependent Partial Label Learning PDF ↗
Rui Zhao, Bin Shi, Kai Sun, Bo Dong
325
Residual Connections Harm Generative Representation Learning PDF ↗
Xiao Zhang, Ruoxi Jiang, William Gao, Rebecca Willet, Michael Maire
326
Neural Mixture Density Processes PDF ↗
Yi Ding, Qi Tao, Xingxing Liang, Longfei Zhang, Yiqin Lv, Weitao Song, Fangjie Yang, Cheems Wang, Guangquan Cheng
327
Large-scale Robust Enhanced Ensemble Clustering via Outlier Decoupling PDF ↗
Jiaxuan Xu, Lei Duan, Xinye Wang, Liang Du
328
DriveLaW: Unifying Planning and Video Generation in a Latent Driving World PDF ↗
Tianze Xia, Yongkang Li, Lijun Zhou, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang
329
DLWM: Dual Latent World Models enable Holistic Gaussian- centric Pre-training in Autonomous Driving PDF ↗
Yiyao Zhu, Ying Xue, Haiming Zhang, Guangfeng Jiang, Wending Zhou, Xu Yan, Jiantao Gao, Yingjie Cai, Bingbing Liu, Zhen Li, Shaojie Shen
330
Latent Chain-of-Thought World Modeling for End-to-End Driving
Shuhan Tan, Kashyap Chitta, Yuxiao Chen, Ran Tian, Yurong You, Yan Wang, Wenjie Luo, Yulong Cao, Philipp Krähenbühl, Marco Pavone, Boris Ivanovic
331
RLFTSim: Realistic and Controllable Multi-Agent Traffic Simulation via Reinforcement Learning Fine-Tuning PDF ↗
Ehsan Ahmadi, Hunter Schofield, Behzad Khamidehi, Fazel Arasteh, Jinjun Shan, Lili Mou, Dongfeng Bai, Kasra Rezaee
332
TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation PDF ↗
Zhi Tu, Liangkun Niu, Tianyi Zhang
333
Failure Modes for Deep Learning–Based Online Mapping: How to Measure and Address Them PDF ↗
Michael Hubbertz, Qi Han, Tobias Meisen
334
Linking Modality Isolation in Heterogeneous Collaborative Perception PDF ↗
Changxing Liu, Zichen Chao, Siheng Chen
335
LEAD: Minimizing Learner-Expert Asymmetry in End-to-End Driving PDF ↗
Long Nguyen, Micha Fauth, Bernhard Jaeger, Daniel Dauner, Maximilian Igl, Andreas Geiger, Kashyap Chitta
336
DriverGaze360: OmniDirectional Driver Attention with Object-Level Guidance PDF ↗
Shreedhar Govil, Didier Stricker, Jason Rambach
337
Diffusion Forcing Planner: History-Annealed Planning with Time- Dependent Guidance for Autonomous Driving PDF ↗
Zehan Zhang, Yaoyi Li, Neng Zhang, Jia Cai
338
DIMOS: Disentangling Instance-level Moving Object Segmentation PDF ↗
Hongxiang Huang, Hongwei Ren, Xiaopeng Lin, Yulong Huang, Zeke Xie, Bojun Cheng
339
EvObj: Learning Evolving Object-centric Representations for 3D Instance Segmentation without Scene Supervision PDF ↗
Jiahao Chen, Zihui Zhang, Yafei Yang, Jinxi Li, Shenxing Wei, Zhixuan Sun, Bo Yang
340
Live Interactive Training for Video Segmentation PDF ↗
Xinyu Yang, Haozheng Yu, Yihong Sun, Bharath Hariharan, Jennifer J. Sun
341
Robust Promptable Video Object Segmentation PDF ↗
Sohyun Lee, Yeho Gwon, Lukas Hoyer, Konrad Schindler, Christos Sakaridis, Suha Kwak
342
Scene-VLM: Multimodal Video Scene Segmentation via Vision- Language Models PDF ↗
Nimrod Berman, Adam Botach, Emanuel Ben- Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky
343
Concept-Aware LoRA for Domain-Aligned Segmentation Dataset Generation PDF ↗
Minho Park, Sunghyun Park, Jungsoo Lee, Hyojin Park, Kyuwoong Hwang, Fatih Porikli, Jaegul Choo, Sungha Choi
344
BEV-CAR: Enhancing Monocular Bird’s Eye View Segmentation with Context-Aware Rasterization PDF ↗
Yixin Xiong, Ke Wang, Tongtong Cheng, Chunhui Liu, Kai Liu
345
Exploring the Underwater World Segmentation without Extra Training PDF ↗
Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li
346
Learning from Oblivion: Predicting Knowledge-Overflowed Weights via Retrodiction of Forgetting PDF ↗
Jinhyeok Jang, Jaehong Kim, Jung Uk Kim
347
Cross-Architecture Adaptation: Cloud-Edge Continual Test- Time Adaptation with Dynamic Sampling and Heterogeneous Distillation PDF ↗
Zirui Xu, Xianhang Chu, Jiahao Li, Xu Yang, Cheng Deng
348
Towards Dynamic Modality Alignment in Multimodal Continual Learning PDF ↗
Jiayao Tan, Fan Lyu, Tianle Liu, Fuyuan Hu, Wei Feng
349
ϕ-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models
Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu
350
Incremental Object Detection via Future-Aware Decoupled Cross-Head Distillation PDF ↗
Chenfeng Yin, De Cheng, Wenlong Luo, Mingyue Zeng, Shizhou Zhang, Nannan Wang, Xinbo Gao
351
Smart Replay: Adaptive Scheduling of Memory Rehearsal for Computational Resource-Aware Incremental Learning PDF ↗
Jianting Chen, Dianzhi Yu, Irwin King
352
ReBaPL: Repulsive Bayesian Prompt Learning PDF ↗
Yassir Bendou, Omar Ezzahir, Eduardo Montesuma, Gabriel Mahuas, Victoria Shevchenko, Mike Gartrell
353
Spectral Mixture-of-Experts for Continual Learning PDF ↗
Chen Yin, Xingbo Dong, Xuelin Shen, Zhe Jin
354
ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars PDF ↗
Ziqiao Peng, Yi Chen, Yifeng Ma, Guozhen Zhang, Zhiyao Sun, Zixiang Zhou, Youliang Zhang, Zhengguang Zhou, Zhaoxin Fan, Hongyan Liu, Yuan Zhou, Qinglin Lu, Jun He
355
ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body PDF ↗
Juze Zhang, Changan Chen, Xin Chen, Heng Yu, Tiange Xiang, Ali Sartaz Khan, Shrinidhi K. Lakshmikanth, Ehsan Adeli
356
DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations PDF ↗
Yuxiang Shi, Zhe Li, Yanwen Wang, Hao Zhu, Xun Cao, Ligang Liu
357
SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting PDF ↗
Bo Li, Jiahao Kang, Yubo Ma, Feng-Lin Liu, Bin Liu, Fang-Lue Zhang, Lin Gao
358
MIBURI: Towards Expressive Interactive Gesture Synthesis PDF ↗
M. Hamza Mughal, Rishabh Dabral, Vera Demberg, Christian Theobalt
359
Personalized Image Descriptions from Attention Sequences PDF ↗
Ruoyu Xue, Hieu Le, Jingyi Xu, Sounak Mondal, Abe Leite, Gregory Zelinsky, Minh Hoai, Dimitris Samaras
360
GA-VLN: Geometry-Aware BEV Representation for Efficient Vision- Language Navigation PDF ↗
Jiahao Yang, Zihan Wang, Xiangyang Li, Xing Zhu, Yujun Shen, Yinghao Xu, Shuqiang Jiang
361
IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence PDF ↗
Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang
362
OctoNav: Towards Generalist Embodied Navigation PDF ↗
Chen Gao, Liankai Jin, Xingyu Peng, Jiazhao Zhang, Yue Deng, Annan Li, He Wang, Si Liu
363
WalkGPT: Grounded Vision–Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation PDF ↗
Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu
364
SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving PDF ↗
Peizheng Li, Zhenghao Zhang, David Holtz, Hang Yu, Yutong Yang, Yuzhi Lai, Rui Song, Andreas Geiger, Andreas Zell
365
SMAP: Semantic Route Planning with Map-Grounded Multimodal Alignment PDF ↗
Wenjie Zhang, Chen Yang, Xin Lu, Zhen Wang, Yue Liu, Bobo Xi, Pengbo Zhang
366
IDperturb: Enhancing Variation in Synthetic Face Generation via Angular Perturbations PDF ↗
Fadi Boutros, Eduarda Caldeira, Tahar Chettaoui, Naser Damer
367
Fresco: Frequency–Spatial Consistent Optimization for Fine-Grained Head Avatar Modeling PDF ↗
Shikun Zhang, Yong Li, Yiqun Wang, Qiuhong Ke, Cunjian Chen
368
Motion-Aware Animatable Gaussian Avatars Deblurring PDF ↗
Muyao Niu, Yifan Zhan, Qingtian Zhu, Zhuoxiao Li, Wei Wang, Zhihang Zhong, Xiao Sun, Yinqiang Zheng
369
ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and Test-time Generative Adaptation PDF ↗
Kim Youwang, Lee Hyoseok, Park Subin, Gerard Pons- Moll, Tae-Hyun Oh
370
Multi-view Consistent 3D Gaussian Head Avatars 'without' Multi-view Generation PDF ↗
Aviral Chharia, Fernando De la Torre
371
MAD: Modality-Adaptive Decoding for Mitigating Cross- Modal Hallucinations in Multimodal Large Language Models PDF ↗
Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro
372
Cross-Modal Attention Calibration for LVLM Hallucination Mitigation PDF ↗
Jiaming Li, Jiacheng Zhang, Zequn Jie, Lin Ma, Ming Li, Xiaonan Luo, Guanbin Li
373
3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding PDF ↗
Makanjuola Adekunmi Ogunleye, Eman Abdelrahman, Ismini Lourentzou
374
Exposing and Evaluating Hallucinations for GUI Grounding PDF ↗
Zicheng Zhang, Hongyi Jing, Rui Lv, Shuo Fang, Shiai Zhu, Junying Wang, Chunyi Li, Xiaohong Liu, Chenguang Ma, Guangtao Zhai
375
Understanding and Mitigating Hallucinations in Multimodal Chain-of- Thought Models PDF ↗
Ji Ma, Wei Suo, Peng Wang, Yanning Zhang
376
Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations PDF ↗
Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Cam-Tu Nguyen, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan Verjans, Phi Le Nguyen, Vu Minh Hieu Phan
377
StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation PDF ↗
Ke Xing, Longfei Li, Yuyang Yin, Hanwen Liang, Guixun Luo, Chen Fang, Jue Wang, Konstantinos N. Plataniotis, Xiaojie Jin, Yao Zhao, Yunchao Wei
378
Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout PDF ↗
Hidir Yesiltepe, Tuna Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag
379
AniMimic: Imitating 3D Animation from Video Priors PDF ↗
Tianyi Xie, Yunuo Chen, Yaowei Guo, Yin Yang, Bolei Zhou, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang
380
VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control PDF ↗
Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu
381
ScenDi: 3D-to-2D Scene Diffusion Cascades for Urban Generation PDF ↗
Hanlei Guo, Jiahao Shao, Xinya Chen, Xiyang Tan, Sheng Miao, Yujun Shen, Yiyi Liao
382
MotionCrafter: Dense Geometry and Motion Reconstruction with a 4D VAE PDF ↗
Ruijie Zhu, Jiahao Lu, Wenbo Hu, Xiaoguang Han, Jianfei Cai, Ying Shan, Chuanxia Zheng
383
GeodesicNVS: Probability Density Geodesic Flow Matching for Novel View Synthesis PDF ↗
Xuqin Wang, Tao Wu, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang, Niclas Zeller, Daniel Cremers
384
WorldStereo: Bridging Controllable Video Generation and Scene Reconstruction via 3D Geometric Memories
Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo
385
NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos PDF ↗
Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, Zhaoxiang Zhang
386
Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control PDF ↗
Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang
387
Improving Motion in Image-to-Video Models via Adaptive Low-Pass Guidance PDF ↗
June Suk Choi, Kyungmin Lee, Sihyun Yu, Yisol Choi, Jinwoo Shin, Kimin Lee
388
SANER: Switchable Adapter with Non-parametric Enhanced Routing for Person De-Reidentification PDF ↗
Yimin Liu, Nan Pu, Fengxiang Yang, Wenjing Li, Zhihui Li, Zhun Zhong
389
BIT: Matching-based Bi-directional Interaction Transformation Network for Visible-Infrared Person Re-Identification PDF ↗
Haoxuan Xu, Guanglin Niu
390
Vision-Language Attribute Disentanglement and Reinforcement for Lifelong Person Re-Identification PDF ↗
Kunlun Xu, Haotong Cheng, Jiangmeng Li, Xu Zou, Jiahuan Zhou
391
Diversity over Uniformity: Rethinking Representation in Generated Image Detection PDF ↗
Qinghui He, Haifeng Zhang, Qiao Qin, Bo Liu, Xiuli Bi, Bin Xiao
392
Mining Instance-Centric Vision–Language Contexts for Human– Object Interaction Detection PDF ↗
Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi
393
FSLoRA: Harmonizing Detection and Re-Identification via Freq-Spatial Low-Rank Adapter for One-Stage Person Search PDF ↗
Yanling Tian, Shanshan Zhang, Di Chen, Jian Yang
394
EEGiT: Teaching Vision Transformers to Understand the EEG signal PDF ↗
Jiahao Zhou, Chenghao Xu, Wei Wang, Erkun Yang, Cheng Deng
395
FedBPrompt: Federated Domain Generalization Person Re- Identification via Body Distribution Aware Visual Prompts PDF ↗
Xin Xu, Weilong Li, Wei Liu, Wenke Huang, Zhixi Yu, Bin Yang, Xiaoying Liao, Kui Jiang
396
Pose-guided Enriched Feature Learning for Federated-by-camera Person Re-identification PDF ↗
JooHyung Oh, Minyoung Oh, Sung Whan Yoon, Jae-Young Sim
397
UAV-CB: A Complex-Background RGB–T Dataset and Local Frequency Bridge Network for UAV Detection PDF ↗
Shenghui Huang, Menghao Hu, Longkun Zou, Hongyu Chi, Zekai Li, Feng Gao, Fan Yang, Qingyao Wu, Ke Chen
398
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding PDF ↗
Boshen Xu, Zihan Xiao, Jiaze Li, Jianzhong Ju, Zhenbo Luo, Jian Luan, Qin Jin
399
StreamReady: Learning What to Answer and When in Long Streaming Videos PDF ↗
Shehreen Azad, Vibhav Vineet, Yogesh S Rawat
400
LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding PDF ↗
Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye
401
Agentic Video Summarization via Self-Reflecting Multimodal Understanding PDF ↗
Miaotian Guo, Shuguang Dou, Yin Li, Aidong Men, Dongsheng Jiang
402
Self-Critical Distillation Network for Video-based Commonsense Captioning PDF ↗
Mengqi Yuan, Gengyun Jia, Bing-Kun Bao
403
Ego-Grounding for Personalized Question-Answering in Egocentric Videos PDF ↗
Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao
404
AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding PDF ↗
Handong Li, Zikang Liu, Longteng Guo, Tongtian Yue, Yepeng Tang, Xinxin Zhu, Chuanyang Zheng, Ziming Wang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Jing Liu
405
EarlyTom: Early Token Compression Completes Fast Video Understanding PDF ↗
Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang
406
VideoWorld 2: Learning Transferable Knowledge from Real-world Videos PDF ↗
Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin
407
VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding PDF ↗
Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang
408
DiverseDiT: Towards Diverse Representation Learning in Diffusion Transformers PDF ↗
Mengping Yang, Zhiyu Tan, Binglei Li, Xiaomeng Yang, Hesen Chen, Hao Li
409
RenderFlow: Single-Step Neural Rendering via Flow Matching PDF ↗
Shenghao Zhang, Runtao Liu, Christopher Schroers, Yang Zhang
410
ResDiT: Evoking the Intrinsic Resolution Scalability in Diffusion Transformers PDF ↗
Yiyang Ma, Feng Zhou, Xuedan Yin, Pu Cao, Yonghao Dang, Jianqin Yin
411
Masked Region Transformer for Layered Image Generation and Editing at Scale PDF ↗
Zhicong Tang, Jingye Chen, Zhao Zhang, Mohan Zhou, Yuchi Liu, Yifan Pu, Yalong Bai, Ethan Smith, Yuhui Yuan
412
DDT: Decoupled Diffusion Transformer PDF ↗
Shuai Wang, Zhi Tian, Weilin Huang, Limin Wang
413
Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers PDF ↗
Wenhao Sun, Ji Li, Zhaoqiang Liu
414
Preserving Source Video Realism: High-Fidelity Face Swapping for Cinematic Quality PDF ↗
Zekai Luo, Zongze Du, Zhouhang Zhu, Hao Zhong, Muzhi Zhu, Wen Wang, Yuling Xi, Chenchen Jing, Hao Chen, Chunhua Shen
415
ShapeAR: Generating Editable Shape Layers via Autoregressive Diffusion PDF ↗
Souymodip Chakraborty, Ankur Singh, Amit Vikram Singh, Vineet Batra, Ankit Phogat
416
ReHyAt: Recurrent Hybrid Attention for Video Diffusion Transformers PDF ↗
Mohsen Ghafoorian, Amirhossein Habibian
417
RecTok: Reconstruction Distillation along Rectified Flow PDF ↗
Qingyu Shi, Size Wu, Jinbin Bai, Kaidong Yu, Yujing Wang, Yunhai Tong, Xiangtai Li, Xuelong Li
418
EgoXtreme: A Dataset for Robust Object Pose Estimation in Egocentric Views under Extreme Conditions PDF ↗
Taegyoon Yoon, Yegyu Han, Seojin Ji, Jaewoo Park, Sojeong Kim, Taein Kwon, Hyung-Sin Kim
419
CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection PDF ↗
Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua
420
H^2A^2: Homogeneity-Aware and Heterogeneity-Aware Feature Perception for Unified Indoor 3D Object Detection PDF ↗
Tao Xie, Tao An, Feng Liu, Jin Wensheng, Zhengyu Li, Lijun Zhao, Ruifeng Li
421
Cov2Pose: Leveraging Spatial Covariance for Direct Manifold-aware 6-DoF Object Pose Estimation PDF ↗
Nassim Ali Ousalah, Peyman Rostami, Vincent Gaudillière, Emmanuel Koumandakis, Anis Kacem, Enjie Ghorbel, Djamila Aouada
422
Towards Intrinsic-Aware Monocular 3D Object Detection PDF ↗
Zhihao Zhang, Abhinav Kumar, Xiaoming Liu
423
SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection PDF ↗
Sandro Papais, Lezhou Feng, Charles Cossette, Lingting Ge
424
SPAN: Spatial-Projection Alignment for Monocular 3D Object Detection PDF ↗
Yifan Wang, Yian Zhao, Fanqi Pu, Xiaochen Yang, Yang Tang, Xi Chen, Wenming Yang
425
DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing PDF ↗
Gyanendra Das, Sai Jena
426
FailureAtlas: Mapping the Failure Landscape of T2I Models via Active Exploration PDF ↗
Muxi Chen, Zhaohua Zhang, Chenchen Zhao, Mingyang Chen, Wenyu Jiang, Tianwen Jiang, Jianhuan Zhuo, Yu Tang, Qiuyong Xiao, Jihong Zhang, Qiang Xu
427
HDR-VLM: HDR-Domain Adaptation of VLMs and Preference-Aligned Quality Assessment for HDR Video Color Grading PDF ↗
Hao Yuan, Jiabin Zhang, Yajing Wu, Ruixuan Pang, Jing Li
428
RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations PDF ↗
I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chieh Yang, Wei-Ting Chen
429
BiomedCCPL: Causal Conditional Prompt Learning for Biomedical Vision-Language Models PDF ↗
Xueliang Cui, Juncai Zhang, Jiacheng Hou, Dan Lu, Hao Zhang, Ruxin Wang
430
DynamicGTR: Leveraging Graph Topology Representation Preferences to Boost VLM Capabilities on Graph QAs PDF ↗
Yanbin Wei, Jiangyue Yan, Chun Kang, Yang Chen, Hua Liu, James Kwok, Yu Zhang
431
VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes PDF ↗
Paul Gavrikov, Wei Lin, M. Jehanzeb Mirza, Soumya Jahagirdar, Muhammad Huzaifa, Sivan Doveh, James Glass, Serena Yeung-Levy, Hilde Kuehne
432
Revisiting Visual Corruptions in LVLMs: A Shape–Texture Perspective on Model Failures PDF ↗
Xinkuan Qiu, Meina Kan, Zhenliang He, Yongbin Zhou, Shiguang Shan
433
From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing PDF ↗
Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei
434
Trust-calibrated Collaborative Learning for Long-Tailed Visual Recognition PDF ↗
Hao Zhou, Tingjin Luo
435
SunFaded: Illumination-Aware Gaussian Splatting for Dark Scenes with Camera-Mounted Active Lighting PDF ↗
Wenjie Chang, Tianle Ding, Wenfei Yang, Tianzhu Zhang
436
TokenSplat: Token-aligned 3D Gaussian Splatting for Feed-forward Pose-free Reconstruction PDF ↗
Yihui Li, Chengxin Lv, Zichen Tang, Hongyu Yang, Di Huang
437
GOR-IS: 3D Gaussian Object Removal In the Intrinsic Space PDF ↗
Yonghao Zhao, Yupeng Gao, Jian Yang, Jin Xie, Beibei Wang
438
AeroGS: Scale-Aware Gaussian Splatting for Pose-Free Dynamic UAV Scene Reconstruction PDF ↗
Tingyun Li, Xinyi Liu, Yongjun Zhang, Yi Wan, Xiaoan Liu, Weiwei Fan, Jiahao Liu
439
Intrinsic Geometry-Appearance Consistency Optimization for Sparse- View Gaussian Splatting PDF ↗
Kaiqiang Xiong, Rui Peng, Jiahao Wu, Zhanke Wang, Jie Liang, Xiaoyun Zheng, Feng Gao, Ronggang Wang
440
AERGS-SLAM: Auto-Exposure-Robust Stereo 3D Gaussian Splatting SLAM PDF ↗
Zhiyu Zhou, Feng Hui, Yu Liu
441
Learning Differentiable Hierarchies in 3D Gaussian Splatting PDF ↗
Youqi Pan, Wugen Zhou, Hongbin Zha
442
WeatherCity: Urban Scene Reconstruction with Controllable Multi-Weather Transformation PDF ↗
Wenhua Wu, Huai Guan, Zhe Liu, Hesheng Wang
443
Cross-View Splatter: Feed-Forward View Synthesis with Georeferenced Images PDF ↗
Matias Turkulainen, Akshay Krishnan, Filippo Aleotti, Mohamed Sayed, Guillermo Garcia-Hernando, Juho Kannala, Arno Solin, Gabriel Brostow, Daniyar Turmukhambetov
444
TagSplat: Topology-Aware Gaussian Splatting for Dynamic Mesh Modeling and Tracking PDF ↗
Hanzhi Guo, Dongdong Weng, Mo Su, Yixiao Chen, Xiaonuo Dongye, Chenyu Xu
445
Hierarchical Visual Relocalization with Nearest View Synthesis from Feature Gaussian Splatting PDF ↗
Huaqi Tao, Bingxi Liu, Guangcheng Chen, Fulin Tang, Li He, Hong Zhang
446
Tracking-Guided 4D Generation: Foundation-Tracker Motion Priors for 3D Model Animation PDF ↗
Su Sun, Cheng Zhao, Himangi Mittal, Gaurav Mittal, Rohith Kukkala, Yingjie Victor Chen, Mei Chen
447
3D Gaussian Splatting from Unposed Spike Stream PDF ↗
Yijia Guo, Tong Hu, Liwen Hu, Lei Ma, Tiejun Huang
448
SparseOIT: Improving Order-Independent Transparency 3DGS via Active Set Method PDF ↗
Wentao Yang, Fanzhen Kong, Zejian Kang, Xiangru Huang
449
ClipGStream: Clip-Stream Gaussian Splatting for Any Length and Any Motion Multi-View Dynamic Scene Reconstruction PDF ↗
Jie Liang, Jiahao Wu, Chao Wang, Jiayu Yang, Xiaoyun Zheng, Kaiqiang Xiong, Zhanke Wang, Jinbo Yan, Feng Gao, Ronggang Wang
450
Space-Time Forecasting of Dynamic Scenes with Motion-aware Gaussian Grouping PDF ↗
Junmyeong Lee, Hoseung Choi, Minsu Cho
451
MoRGS: Efficient Per-Gaussian Motion Reasoning for Streamable Dynamic 3D Scenes PDF ↗
Wonjoon Lee, Sungmin Woo, Donghyeong Kim, Jungho Lee, Sangheon Park, Sangyoun Lee
452
BEA-GS: BEyond RAdiance Supervision in 3DGS for Precise Object Extraction PDF ↗
Alessio Mazzucchelli, Maria Naranjo-Almeida, Jorge Bustos-Sanchez, Mariella Dimiccoli, Francesc Moreno-Noguer, Jordi Sanchez-Riera, Adrian Penate-Sanchez
453
EDGS: Eliminating Densification for Efficient Convergence of 3DGS PDF ↗
Dmytro Kotovenko, Olga Grebenkova, Björn Ommer
454
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps PDF ↗
Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang
455
Conan: Progressive Learning to Reason Like a Detective over Multi- Scale Visual Evidence PDF ↗
Kun Ouyang, Yuanxin Liu, Linli Yao, Yishuo Cai, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun
456
DialogueVPR: Towards Conversational Visual Place Recognition PDF ↗
Yukun Song, Changwei Wang, Xingtian Pei, Shibiao Xu, Wenhao Xu, Shunpeng Chen, Yu Zhang, Ke Zhang, Rongtao Xu, Xuxiang Feng, Pengyang Wang
457
Perceptual-Evidence Anchored Reinforced Learning for Multimodal Reasoning PDF ↗
Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Zhixiong Zeng, Siqi Yang, Peng Shi, Lin Ma, Jing Zhang
458
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm PDF ↗
Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu
459
VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA PDF ↗
Young Rok Jang, Hyesoo Kong, Kyunghwan An, Jae Sub Huh, Gyeonghun KIM, Stanley Jungkyu Choi
460
DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding PDF ↗
Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai
461
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress PDF ↗
Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang
462
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction PDF ↗
Weitai Kang, Jason Kuen, Mengwei Ren, Zijun Wei, Yan Yan, Kangning Liu
463
Grounding Everything in Tokens for Multimodal Large Language Models PDF ↗
Xiangxuan Ren, Zhongdao Wang, Liping Hou, Pin Tang, Guoqing Wang, Chao Ma
464
Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory PDF ↗
Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie
465
ChartR: Evaluating Reasoning Accuracy and Robustness in Chart Question Answering PDF ↗
Xiaojun Chen, Sixiao Luo, Ziqi Liu, Min Yang, Qin Zhang, Liang-Jie Zhang
466
Think Visually, Reason Textually: Vision-Language Synergy in Abstract Reasoning PDF ↗
Beichen Zhang, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Haodong Duan, Dahua Lin, Jiaqi Wang
467
VKG-QA: Visual Knowledge Graph-based Question Answer for Large Multimodal Models PDF ↗
Yuntao Du, Yiming Wang, Renshuo Yuan, Jincheng Yue, Yijing Chen, Yue Fan, Bo Zhang, Qian Li, Lizhen Cui
468
Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning PDF ↗
Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li
469
Human-like Abstract Visual Reasoning via Understanding and Solving Reasoning Loop PDF ↗
Xinwang Chen, Xiuxing Li, Qing Li, Ziyue Zhuang, Yutong Wu, Ziyu Li, Zhuo Wang, Kai Li, Jianye Hao, Xia Wu
470
VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment PDF ↗
Ziheng Jia, Linhan Cao, Jinliang Han, Zicheng Zhang, Jiaying Qian, Jiarui Wang, Zijian Chen, Guangtao Zhai, Xiongkuo Min
471
Generative Video Compression with One-Dimensional Latent Representation PDF ↗
Zihan Zheng, Zhaoyang Jia, Naifu Xue, Jiahao Li, Bin Li, Zongyu Guo, Xiaoyi Zhang, Zhenghao Chen, Houqiang Li, Yan Lu
472
Markovian Scale Prediction: A New Era of Visual Autoregressive Generation PDF ↗
Yu Zhang, Jingyi Liu, Yiwei Shi, Qi Zhang, Duoqian Miao, Changwei Wang, Longbing Cao
473
Learned Image Compression via Sparse Attention and Adaptive Frequency PDF ↗
Huidong Ma, Xinyan Shi, Hui Sun, Xiaofei Yue, Xiaoguang Liu, Gang Wang, Wentong Cai
474
UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders PDF ↗
Matthew Walmer, Saksham Suri, Anirud Aggarwal, Abhinav Shrivastava
475
VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference PDF ↗
Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, Tao Xie
476
Ultra-Fast Neural Video Compression PDF ↗
Jiahao Li, Wenxuan Xie, Zhaoyang Jia, Bin Li, Zongyu Guo, Xiaoyi Zhang, Yan Lu
477
Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression PDF ↗
Haotian Zhang, Feiyue Long, Yixin Yu, Jian Xue, Haocheng Tang, Tongda Xu, Zhenning Shi, Yan Wang, Siwei Ma, Jiaqi Zhang
478
Scaling Parallel Sequence Models to Vision Foundation Models PDF ↗
Yitong Jiang, Collin McCarthy, Hongjun Wang, Hanrong Ye, Qi Dou, Tianfan Xue, Jinwei Gu, Jan Kautz, Hongxu Yin, Pavlo Molchanov, Sifei Liu
479
Revisiting Model Stitching In the Foundation Model Era PDF ↗
Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo
480
GeoAgent: Learning to Geolocate Everywhere with Reinforced Geographic Characteristics PDF ↗
Modi Jin, Yiming Zhang, Boyuan Sun, Dingwen Zhang, Ming-Ming Cheng, Qibin Hou
481
VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models PDF ↗
Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu
482
HOLO: Homography-Guided Pose Estimator Network for Fine-Grained Visual Localization on SD Maps PDF ↗
Xuchang Zhong, Xu Cao, Jinke Feng, Hao Fang
483
TriLite: Efficient Weakly Supervised Object Localization with Universal Visual Features and Tri-Region Disentanglement PDF ↗
Arian Sabaghi, Jose Oramas
484
GeoSURGE: Geo-localization using Semantic Fusion with Hierarchy of Geographic Embeddings PDF ↗
Angel Daruna, Nicholas Meegan, Han-Pang Chiu, Supun Samarasekera, Rakesh Kumar
485
Towards Visual Query Localization in the 3D World PDF ↗
Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang
486
OVOD-Agent: A Markov–Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection PDF ↗
Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He
487
Pixel2Phys: Distilling Governing Laws from Visual Dynamics PDF ↗
Ruikun Li, Jun Yao, Yingfan Hua, Shixiang Tang, Biqing Qi, Bin Liu, Wanli Ouyang, Yan Lu
488
Tutor-Student Reinforcement Learning: A Dynamic Curriculum for Robust Deepfake Detection PDF ↗
Zhanhe Lei, Zhongyuan Wang, Jikang Cheng, Baojin Huang, Yuhong Yang, Zhen Han, Chao Liang, Dengpan Ye
489
Seeing as Experts Do: A Knowledge-Augmented Agent for Open- Set Fine-Grained Visual Understanding PDF ↗
Junhan Chen, Zilu Zhou, Yujun Tong, Dongliang Chang, Yitao Luo, Zhanyu Ma
490
Dynamic Important Example Mining for Reinforcement Finetuning PDF ↗
Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi
491
Specificity-aware reinforcement learning for fine-grained open-world classification PDF ↗
Samuele Angheben, Davide Berasi, Alessandro Conti, Elisa Ricci, Yiming Wang
492
SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning PDF ↗
Jitesh Jain, Allen AI blank, Jialuo Li, Zixian Ma, Jieyu Zhang, Chris Dongjoo Kim, Sangho Lee, Rohun Tripathi, Tanmay Gupta, Christopher Clark, Humphrey Shi
493
Uncertainty-Aware Modality Fusion for Unaligned RGB-T Salient Object Detection PDF ↗
Mianzhao Wang, Fan Shi, Xu Cheng, Chen Jia, Shengyong Chen
494
Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization PDF ↗
Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang
495
More Than Meets the Eye: A Unified Image Fusion Framework via Semantic-Pixel Entropy Trade-off for Zero-Shot Generalization PDF ↗
Xiaowen Liu, Jing Li, Hongtao Huo, Haozhe Cao, Renhua Wang, Xu Dong
496
Beyond Sequential Tools: A Unified VLM Agent System for Photographic Post-Processing via Dynamic Multi-Expert Fusion PDF ↗
Honglin Xiong, Chenjie Zhu, Jianbiao Ding, Zixuan Ni, Wei Li, Zhenpeng Mi, Qian Wang
497
Multi-modal Frequency Decomposition Network for Semantic Scene Completion PDF ↗
Die Zuo, Lubo Wang, Ruonan Liu, Qing Guo, Chong Wang, Dongdong Wu, Wei Feng, Kairui Yang, Di Lin
498
BiEvLight: Bi-level Learning of Task-Aware Event Refinement for Low- Light Image Enhancement PDF ↗
Zishu Yao, Xiang-Xiang Su, Shengning Zhou, Guang-Yong Chen, Guodong Fan, Xing Chen
499
FusionRegister: Every Infrared and Visible Image Fusion Deserves Registration PDF ↗
Congcong Bian, Haolong Ma, Hui Li, Zhongwei Shen, Xiaoqing Luo, Xiaoning Song, Xiao-jun Wu
500
OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion PDF ↗
Dongjian Yu, Weiqing Min, Qian Jiang, Xing Lin, Xin Jin, Shuqiang Jiang
501
Enhancing Unregistered Hyperspectral Image Super-Resolution via Unmixing-based Abundance Fusion Learning PDF ↗
Yingkai Zhang, Tao Zhang, Jing Nie, Ying Fu
502
LRHDR: Learning Representation-enhanced HDR Video Reconstruction PDF ↗
Chenzhuo Liao, Xin Chen, Bingchen Li, Yu Meng, Tao Yue, Xuemei Hu
503
Cross-Domain Few-Shot Segmentation via Multi-view Progressive Adaptation PDF ↗
Jiahao Nie, Guanqiao Fu, Wenbin An, Yap-Peng Tan, Alex C. Kot, Shijian Lu
504
Interpretable Cross-Domain Few-Shot Learning with Rectified Target- Domain Local Alignment PDF ↗
Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li
505
PP-Brep: Few-Shot B-rep Classification with Hybrid Graph Representation PDF ↗
Jiacheng Hao, Chunying Liu, Hao Guo, Ruohan Wang, Hongping Gan, Yilei Shi
506
AgentDet: A Shared-Blackboard Multi-Agent Framework for Zero-/ Few-Shot Object Detection PDF ↗
Haolin Li, Yaohua Wang, Ze Yan, Lijie Wen, Biqing Huang
507
SFR-Net: Steering-Fusion-Refining Network in Multi-label Zero-Shot Sewer Defect Detection PDF ↗
Zhao-Min Chen, Xinjian Huang, Yisu Ge, Yu Li
508
Noise-Aware Few-Shot Learning through Bi-directional Multi-View Prompt Alignment PDF ↗
Lu Niu, Cheng Xue
509
Learnability-Guided Diffusion for Dataset Distillation PDF ↗
Jeffrey A. Chan-Santiago, Mubarak Shah
510
Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals PDF ↗
Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu, Fanzhou Wang, Zhiqian Lin, Tianxiang Ren, Dahua Lin, Ruihao Gong, Lei Yang
511
Progressive Mask Distillation for Self-supervised Video Representation PDF ↗
Kewei Wu, Chong Liang, Zhao Xie, Dan Guo
512
HierAmp: Coarse-to-Fine Autoregressive Amplification for Generative Dataset Distillation PDF ↗
Lin Zhao, Xinru Jiang, Xi Xiao, Qihui Fan, Lei Lu, Yanzhi Wang, Xue Lin, Octavia Camps, Pu Zhao, Jianyang Gu
513
SpiderCam: Low-Power Snapshot Depth from Differential Defocus PDF ↗
Marcos A. Ferreira, Tianao Li, John Mamish, Josiah Hester, Yaman Sangar, Qi Guo, Emma Alexander
514
Computational Speckle Pattern Interferometry PDF ↗
Shengxi Wu, Sophia Yang, Dorian Chan, Matthew O'Toole
515
DetectSCI: Toward Object-Guided ROI Reconstruction for High- Resolution Video Snapshot Compressive Imaging PDF ↗
Xingjian Jiang, Lishun Wang, Ping Wang, Xin Yuan
516
Solving a Nonlinear Blind Inverse Problem for Tagged MRI with Physics and Deep Generative Priors PDF ↗
Zhangxing Bian, Shuwen Wei, Samuel W. Remedios, Junyu Chen, Aaron Carass, Blake Dewey, Jerry L Prince
517
Nonlinear Color Transfer via Learnable Bezier Flows PDF ↗
Junhyoung Lee, Seongwoon Jo, JeongHun Park, Yeonji Ryou, Jeongha Yang, Jangho Kim
518
VT-Intrinsic: Physics-Based Decomposition of Reflectance and Shading using a Single Visible-Thermal Image Pair PDF ↗
Zeqing Yuan, Mani Ramanagopal, Aswin C. Sankaranarayanan, Srinivasa G. Narasimhan
519
GH-NAF: Grid-Adaptive Hash-Level–Attended Neural Attenuation Fields for Discrepancy-Aware CBCT PDF ↗
Seong Je Oh, Ju Hwan Lee, Chae Yeon Lim, Donghwan Lee, Myung Jin Chung, Kyungsu Kim
520
Computer Vision with a Superpixelation Camera PDF ↗
Sasidharan Mahalingam, Rachel Brown, Atul Ingle
521
Color-Encoded Illumination for High-Speed Volumetric Scene Reconstruction PDF ↗
David Novikov, Eilon Vaknin, Narek Tumanyan, Mark Sheinin
522
Multi-Scale Gradient-Guided Unrolling Architecture with Adaptive Mamba for Compressive Sensing PDF ↗
Le Yang, Hongping Gan
523
Deciphering Genotype-Phenotype Mechanisms from High- Content Profiling via Knowledge-Guided Multi-modal Graph Learning PDF ↗
Hanjing Lin, Jiahua Rao, Youhan Sun, Jiancong Xie, Yuedong Yang
524
Bulk RNA-seq Guided Multi-modal Detection of Anomalous Regions in Human Cancer via Spatial Transcriptomics PDF ↗
Hang Shi, Ruocheng Yang, Wenjie You, Zhilin Huang, Daoqiang Zhang, Wei Shao
525
Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics PDF ↗
Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang
526
ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction PDF ↗
Jiangtong Tan, Lin Liu, Jie Huang, Xiaopeng Zhang, Qi Tian, Feng Zhao
527
PhysVid: Physics Aware Local Conditioning for Generative Video Models PDF ↗
Saurabh Pathak, Elahe Arani, Mykola Pechenizkiy, Bahram Zonooz
528
PromptLoop: Plug-and-Play Prompt Refinement via Latent Feedback for Diffusion Model Alignment PDF ↗
Suhyeon Lee, Jong Chul Ye
529
EvoID: Reinforced Evolution for Identity-Preserving Video Generation PDF ↗
Yiheng Zhang, Zhaofan Qiu, Zunxu Liu, Yingwei Pan, Ting Yao, Tao Mei
530
Masked Auto-Regressive Variational Acceleration: Fast Inference Makes Practical Reinforcement Learning PDF ↗
Yuxuan Gu, Weimin Bai, Yifei Wang, Weijian Luo, He Sun
531
PhyCo: Learning Controllable Physical Priors for Generative Motion PDF ↗
Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker
532
Unified Multimodal Models as Auto-Encoders PDF ↗
Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan
533
Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models PDF ↗
Shiran Ge, Chenyi Huang, Yuang Ai, Qihang Fan, Huaibo Huang, Ran He
534
ThinkingViT: Matryoshka Thinking Vision Transformer for Elastic Inference PDF ↗
Ali Hojjat, Janek Haberer, Sören Pirk, Olaf Landsiedel
535
Drainage: A Unifying Framework for Addressing Class Uncertainty PDF ↗
Yasser Taha, Grégoire Montavon, Nils Körber
536
Neural Differentiation in Deep Networks: A Theoretical Framework for Expressivity and Representational Diversity PDF ↗
Boyuan Wang, Richard Jiang
537
DuetMerging: Synergizing Dynamic and Static Strategies for Mitigating Task Interference in Model Merging PDF ↗
Yan Li, Guiping Cao, Yaguang Song, Ming Tao, Haoran Gong, Junhui Liu, Yaowei Wang, Dongmei Jiang
538
SASNet: Spatially-Adaptive Sinusoidal Networks for INRs PDF ↗
Haoan Feng, Diana Aldana, Tiago Novello, Leila De Floriani
539
Generative Modeling of Weights: Generalization or Memorization? PDF ↗
Boya Zeng, Yida Yin, Zhiqiu Xu, Zhuang Liu
540
Vision-Oriented Lightweight Neural Architecture Search with Budget- Adaptive Evaluation PDF ↗
Yi Fan, Yu-Bin Yang
541
Improving Sparse Autoencoder with Dynamic Attention PDF ↗
Dongsheng Wang, Jinsen Zhang, Dawei Su, Hui Huang
542
Stepwise Credit Assignment for GRPO on Flow-Matching Models PDF ↗
Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh
543
FINE: Factorizing Knowledge for Initialization of Variable-sized Diffusion Models PDF ↗
Yucheng Xie, Fu Feng, Ruixiao Shi, Jianlu Shen, Jing Wang, Yong Rui, Xin Geng
544
Hyperbolic Busemann Neural Networks PDF ↗
Ziheng Chen, Bernhard Schölkopf, Nicu Sebe
545
FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching PDF ↗
Andranik Sargsyan, Shant Navasardyan
546
Image-to-Point Cloud Feature Back-Projection for Multimodal Training of 3D Semantic Segmentation PDF ↗
Jiawei Han, Matteo Poggi, Li Huan, Changshuo Wang, Kaiqi Liu, Wei Li
547
NG-GS: NeRF-guided 3D Gaussian Splatting Segmentation PDF ↗
Yi He, Tao Wang, Yi Jin, Congyan Lang, Yidong Li, Haibin Ling
548
Teaching DINOv3 About Partial 3D Geometry: A Self-Supervised Geometry-Aware Approach PDF ↗
Viktoria Ehm, Dongliang Cao, Riccardo Marin, Daniel Scholz, Weikang Wang, Florian Bernard, Daniel Cremers
549
SemLayer: Semantic-aware Generative Segmentation and Layer Construction for Abstract Icons PDF ↗
Haiyang Xu, Ronghuan Wu, Li-Yi Wei, Nanxuan Zhao, Chenxi Liu, Cuong Nguyen, Zhuowen Tu, Zhaowen Wang
550
MatchED: Crisp Edge Detection Using End-to-End, Matching-based Supervision PDF ↗
Bedrettin Cetinkaya, Sinan Kalkan, Emre Akbas
551
SegGBC: Justifiable Coarse-to-Fine Granular-Ball Computing for Enhancing Clustering Image Segmentation PDF ↗
Qianpeng Chong, Wenyi Zeng, Xiuxuan Shen, Jiajie Li, Qian Yin, Xin Zheng
552
Seeing Beyond: Extrapolative Domain Adaptive Panoramic Segmentation PDF ↗
Yuanfan Zheng, Kunyu Peng, Xu Zheng, Kailun Yang
553
MatchMask: Mask-Centric Generative Data Augmentation for Label- Scarce Semantic Segmentation PDF ↗
Yuqi Lin, Hao Zhang, Wenqi Shao, Shiqu Liu, Zhihong Gu, Wenxiao Wang, Xiaofei He, Kaipeng Zhang
554
Boundary-Responsive Differentiable Gating for Superpixel-Based Segmentation PDF ↗
Fatmaelzahraa Ahmed, Zhihe Lu, Gianni Caro, Diram Tabaa, Mohamed Hamdy, Muraam Abdel-Ghani, Abdulaziz Al-Ali, Muhammad Arsalan, Shidin Balakrishnan
555
Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation PDF ↗
Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong
556
FUSAR-GPT: A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery PDF ↗
Xiaokun Zhang, Yi Yang, Ziqi Ye, Baiyun Baiyun, Xiaorong Guo, Qingchen Fang, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang
557
UniChange: Unifying Change Detection with Multimodal Large Language Model PDF ↗
Xu Zhang, Danyang Li, Xiaohang Dong, Tianhao Wu, Hualong Yu, Jianye Wang, Qicheng Li, Xiang Li
558
Spatiotemporal Pyramid Flow Matching for Climate Emulation PDF ↗
Jeremy A. Irvin, Jiaqi Han, Zikui Wang, Abdulaziz Alharbi, Yufei Zhao, Nomin-Erdene Bayarsaikhan, Daniele Visioni, Andrew Y. Ng, Duncan Watson-Parris
559
See What We Cannot See: A Geo-guided Reasoning Benchmark for Object Counting under Adverse Earth Observation Conditions PDF ↗
Jiayi Wang, Zhihong Tan, Hongchen Wei, Daiqin Yang, Zhenzhong Chen
560
MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing PDF ↗
Yimin Wei, Aoran Xiao, Hongruixuan Chen, Junshi Xia, Naoto Yokoya
561
RECS4R: Bridging Semantics and Geometry for Referring Remote Sensing Interpretation PDF ↗
Jinming Chai, Lingling Li, Licheng Jiao, Xiaoqiang Lu, Long Sun, Xu Liu, Wenping Ma, Weibin Li
562
Fourier Angle Alignment for Oriented Object Detection in Remote Sensing PDF ↗
Changyu Gu, Linwei Chen, Lin Gu, Ying Fu
563
Learning to Infer Parameterized Representations of Plants from 3D Scans PDF ↗
Samara Ghrer, Christophe Godin, Stefanie Wuhrer
564
Good Can Sometimes be Bad: A Unified Attack against 3D Point Cloud Classifier by a Flexible Isotropic Resampling PDF ↗
Linkun Fan, Jiahao Zhang, Juntao Zhang, Lei Zhang, Fazhi He, Daojun Han
565
V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs PDF ↗
Sen Nie, Jie Zhang, Jianxin Yan, Shiguang Shan, Xilin Chen
566
FeatureFool: Zero-Query Fooling of Video Models via Feature Map PDF ↗
Duoxun Tang, Xi Xiao, Guangwu Hu, Kangkang Sun, Xiao Yang, Dongyang Chen, Qing Li, Yong-jie Yin, Jiyao Wang
567
RankOOD - Class Ranking-based Out-of-Distribution Detection PDF ↗
Dishanika Denipitiyage, Naveen Karunanayake, Suranga Seneviratne, Sanjay Chawla
568
AdvFM: Lookahead Flow-Matching Velocity-Field Attacks for Imperceptible and Transferable Adversarial Examples PDF ↗
Runze Liu, Zeyue Wang, Fanghui Sun, Rui Liu, Yihan Yan, Shen Wang, Zhaoyang Zhang
569
The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers PDF ↗
Wei Tao, Yang Dai, Jincai Huang, Qing Tao
570
Your Classifier Can Do More: Towards Balancing the Gaps in Classification, Robustness, and Generation PDF ↗
Kaichao Jiang, He Wang, Xiaoshuai Hao, Xiulong Yang, Ajian Liu, Qi Chu, Yunfeng Diao, Richang Hong
571
Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perception PDF ↗
Yihang Tao, Senkang Hu, Haonan An, Zhengru Fang, Hangcheng Cao, Yuguang Fang
572
Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning PDF ↗
Hao Zhou, Tiru Wu, Yan Jiang, Wanqi Zhou, Junxing Hu, Ai Han
573
Omni-Attack: Adversarial Attacks on Open-Ended VQA in Black-Box Multimodal LLMs PDF ↗
Kai Hu, Weichen Yu, Li Zhang, Alexander Robey, Andy Zou, Haoqi Hu, Chengming Xu, Matt Fredrikson
574
CoMo: Learning Continuous Latent Motion from Internet Videos for Scalable Robot Learning PDF ↗
Jiange Yang, Yansong Shi, Haoyi Zhu, Mingyu Liu, Kaijing Ma, Yating Wang, Gangshan Wu, Tong He, Limin Wang
575
Δynamics: Language-Based Representation for Inferring Rigid- Body Dynamics From Videos
Chia-Hsiang Kao, Cong Phuoc Huynh, Chien-Yi Wang, Noranart Vesdapunt, Stefan Stojanov, Bharath Hariharan, Oleksandr Obiednikov, Ning Zhou
576
PvP: Data-Efficient Humanoid Robot Learning with Proprioceptive- Privileged Contrastive Representations PDF ↗
Mingqi Yuan, Tao Yu, Haolin Song, Bo Li, Xin Jin, Hua Chen, Wenjun Zeng
577
Diagnose, Correct, and Learn from Manipulation Failures via Visual Symbols PDF ↗
Xianchao Zeng, Xinyu Zhou, Youcheng Li, Jiayou Shi, Tianle Li, Liangming Chen, Lei Ren, Yong-Lu Li
578
RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation PDF ↗
Linfei Li, Lin Zhang, Ying Shen
579
GeCo-SRT: Geometry-aware Continual Adaptation for Cross-Task Sim-to-Real Transfer PDF ↗
Wenbo Yu, Wenke Xia, Weitao Zhang, Di Hu
580
ActiveGrasp: Information-Guided Active Grasping with Calibrated Energy-based Model PDF ↗
Boshu Lei, Wen Jiang, Kostas Daniilidis
581
BiPreManip: Learning Affordance-Based Bimanual Pre-Manipulation through Anticipatory Collaboration
Yan Shen, Feng Jiang, Zichen He, Xiaoqi Li, Yuchen Liu, Zhiyu Li, Ruihai Wu, Hao Dong
582
Learning Surgical Robotic Manipulation with 3D Spatial Priors PDF ↗
Yu Sheng, Lidian Wang, Xiaomeng Chu, Jiajun Deng, Min Cheng, Yanyong Zhang, Bei Hua, Houqiang Li, Jianmin Ji
583
SimRecon: SimReady Compositional Scene Reconstruction from Real Videos PDF ↗
Chong Xia, Kai Zhu, Zizhuo Wang, Fangfu Liu, Zhizheng Zhang, Yueqi Duan
584
STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation PDF ↗
Hao Ren, Zetong Bi, Yiming Zeng, Zhaoliang Wan, Lu Qi, Hui Cheng
585
RaUF: Learning the Spatial Uncertainty Field of Radar PDF ↗
Shengpeng Wang, Kuangyu Wang, Wei Wang
586
SIR: Structured Image Representations for Explainable Robot Learning PDF ↗
Paul Mattes, Jan Schwab, Jens Bosch, Maximilian Xiling Li, Nils Blank, Minh-Trung Tang, Moritz Haberland, Rudolf Lioutikov
587
Instance-level Visual Active Tracking with Occlusion-Aware Planning PDF ↗
Haowei Sun, Kai Zhou, Hao Gao, Shiteng Zhang, Jinwu Hu, Xutao Wen, Qixiang Ye, Mingkui Tan
588
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight PDF ↗
Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng
589
AnthroTAP: Learning Point Tracking with Real-World Motion PDF ↗
Inès Hyeonsu Kim, Seokju Cho, Jahyeok Koo, Junghyun Park, Jiahui Huang, Honglak Lee, Joon-Young Lee, Seungryong Kim
590
Tracking by Predicting 3-D Gaussians Over Time PDF ↗
Tanish Baranwal, Himanshu Gaurav Singh, Jathushan Rajasegaran, Jitendra Malik
591
Toward Low-Cost yet Effective Temporal Learning for UAV Tracking PDF ↗
Chaocan Xue, Qihua Liang, Bineng Zhong, Yanting Zu, Yuanliang Xue, Haiying Xia, Shuxiang Song
592
Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again PDF ↗
Weize Li, Yunhao Du, Qixiang Yin, Zhicheng Zhao, Fei Su
593
Occlusion-Aware SORT: Observing Occlusion for Robust Multi-Object Tracking PDF ↗
Chunjiang Li, Jianbo Ma, Li Shen, Yanru Chen, Liangyin Chen
594
CoWTracker: Tracking by Warping instead of Correlation PDF ↗
Zihang Lai, Eldar Insafutdinov, Edgar Sucar, Andrea Vedaldi
595
Learning Long-term Motion Embeddings for Efficient Kinematics Generation PDF ↗
Nick Stracke, Kolja Bauer, Stefan Andreas Baumann, Miguel Ángel Bautista, Josh Susskind, Björn Ommer
596
SpatialVID: A Large-Scale Video Dataset with Spatial Annotations PDF ↗
Jiahao Wang, Yufeng Yuan, Rujie Zheng, Youtian Lin, Jian Gao, Lin-Zhuo Chen, Yajie Bao, Chang Zeng, Yanxi Zhou, Xiao-Xiao Long, Hao Zhu, Zhaoxiang Zhang, Xun Cao, Yao Yao
597
Beyond Explicit Language: Plug-and-Play Visual-to-Linguistic Modeling Toward General Object Tracking PDF ↗
Kaiyang Lan, Ying Cui, Chenchen Jing, Jianwei Zheng, Dongyan Guo
598
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants PDF ↗
Mahesh Bhosale, Abdul Wasi, Shantam Srivastava, Shifa Latif, Tianyu Luan, Mingchen Gao, David Doermann, Xuan Gong
599
InvCoSS: Inversion-driven Continual Self-supervised Learning in Medical Multi-modal Image Pre-training PDF ↗
Zihao Luo, Shaohao Rui, Zhenyu Tang, Guotai Wang, Xiaosong Wang
600
PETAR: Localized Findings Generation with Mask-Aware Vision- Language Modeling for PET Automated Reporting PDF ↗
Danyal Maqbool, Changhee Lee, Zachary Huemann, Samuel D. Church, Matthew E. Larson, Scott B. Perlman, Tomas A. Romero, Joshua D. Warner, Meghan Lubner, Xin Tie, Jameson Merkow, Junjie Hu, Steve Y. Cho, Tyler J. Bradshaw
601
From Panel to Pixel: Zoom-In Vision–Language Pretraining from Biomedical Scientific Literature PDF ↗
Kun Yuan, Min Sun, Zhen Chen, Alejandro Lozano, Xiangteng He, Shi Li, Nassir Navab, Xiaoxiao Sun, Nicolas Padoy, Serena Yeung-Levy
602
LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings PDF ↗
Chengan Che, Chao Wang, Tom Vercauteren, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera
603
D2T2 - Multimodal Automated Planning for Brachytherapy PDF ↗
Lance C. Moore, Aranyo Mitra, Ryan Truong, Karoline Kallis, Kelly Kisling, Sandra M. Meyers, Nuno Vasconcelos
604
TopoCL: Topological Contrastive Learning for Medical Imaging PDF ↗
Guangyu Meng, Pengfei Gu, Peixian Liang, John P. Lalor, Erin Wolf Chambers, Danny Z. Chen
605
Diffusion with a Linguistic Compass: Steering the Generation of Clinically Plausible Future sMRI Representations for Early MCI Conversion Prediction PDF ↗
Zhihao Tang, Chaozhuo Li, Litian Zhang, Xi Zhang
606
Personalized Longitudinal Medical Report Generation via Temporally- Aware Federated Adaptation PDF ↗
He Zhu, Ren Togo, Takahiro Ogawa, Kenji Hirata, Minghui Tang, Takaaki Yoshimura, Hiroyuki Sugimori, Noriko Nishioka, Yukie Shimizu, Kohsuke Kudo, Miki Haseyama
607
Decoding 3D Perception via BrainSSD: Synergistic Fusion of EEG Representations from Static and Dynamic Visual Streams PDF ↗
Yincheng Yao, Enze Shi, Shu Zhang
608
Duala: Dual-Level Alignment of Subjects and Stimuli for Cross- Subject fMRI Decoding PDF ↗
Shumeng Li, Jintao Guo, Jian Zhang, Yulin Zhou, Luyang Cao, Yinghuan Shi
609
OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks PDF ↗
Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Min Jie Ju, Peter YM Woo, Yixuan Yuan
610
Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control PDF ↗
Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang
611
MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA PDF ↗
Haowen Gu, Gensheng Pei, Zeren Sun, Mingwu Ren, Xiangbo Shu, Yazhou Yao, Fumin Shen
612
FISHuman: Fine-grained Single-image 3D Human Reconstruction via Multi-view 4D Remeshing PDF ↗
Hanxi Liu, Yifang Men, Zhouhui Lian
613
DuoMo: Dual Motion Diffusion for World-Space Human Reconstruction PDF ↗
Yufu Wang, Evonne Ng, Soyong Shin, Rawal Khirodkar, Yuan Dong, Zhaoen Su, Jinhyung Park, Kris Kitani, Alexander Richard, Fabian Prada, Michael Zollhöfer
614
RAM: Recover Any 3D Human Motion in-the-Wild PDF ↗
Sen Jia, Ning Zhu, Jinqin Zhong, Jiale Zhou, Huaping Zhang, Jenq-Neng Hwang, Lei Li
615
From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two- Hand Reconstruction PDF ↗
Gaoge Han, Yongkang Cheng, Zhe Chen, Shaoli Huang, Tongliang Liu
616
MV-Fashion: Towards Enabling Virtual Try-On and Size Estimation with Multi-View Paired Data PDF ↗
Hunor Laczkó, Libang Jia, Loc-Phat Truong, Diego Hernández, Sergio Escalera, Jordi Gonzalez, Meysam Madadi
617
Forecasting 3D Scanpaths in Egocentric Video PDF ↗
Fiona Ryan, Ishwarya Ananthabhotla, Yijun Qian, Judy Hoffman, James M. Rehg, Vamsi Krishna Ithapu, Calvin Murdock
618
M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction PDF ↗
Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding
619
ReGenHOI: Unifying Reconstruction and Generation for 3D Human– Object Interaction Understanding PDF ↗
Miao Xu, Xiangyu Zhu, Zidu Wang, Xusheng Liang, Bao Li, Jinlin Wu, Zelin Zang, Zhen Lei
620
Through the Frequency Lens: Cross-Domain Generalisable Gaze Estimation with Adaptive Modulation PDF ↗
Yang Xu, Yiwei Bao, Feng Lu
621
Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining PDF ↗
Zhumei Wang, Zechen Hu, Ruoxi Guo, Huaijin Pi, Ziyong Feng, Liang Zhang, Mingtao Pei, Siyuan Huang
622
SHands: A Multi-View Dataset and Benchmark for Surgical Hand- Gesture and Error Recognition Toward Medical Training PDF ↗
Le Ma, Thiago Freitas dos Santos, Nadia Magnenat-Thalmann, Katarzyna Wac
623
Beyond Static Frames: Temporal Aggregate-and-Restore Vision Transformer for Human Pose Estimation PDF ↗
Hongwei Fang, Jiahang Cai, Xun Wang, Wenwu Yang
624
IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion PDF ↗
Lizhou Lin, Songpengcheng Xia, Zengyuan Lai, Lan Sun, Jiarui Yang, Ling Pei
625
Learning Forgery-Aware Lip Representations Without Forgery Priors PDF ↗
Bofan Chen, Hongyu Zhu, Yi He, Sichu Liang, Shi-Lin Wang
626
Beyond [CLS] Token: Query-Driven Token-Level Forgery Purification for Generalizable Deepfake Detection PDF ↗
Changshuo Wang, Jiangming Wang, Ke-Yue Zhang, Taiping Yao, Shouhong Ding, Shunli Wang, Ran Yi, Lizhuang Ma
627
GEM-TFL: Bridging Weak and Full Supervision for Forgery Localization through EM-Guided Decomposition and Temporal Refinement PDF ↗
Xiaodong Zhu, Yuanming Zheng, Suting Wang, Junqi Yang, Yuhong Yang, Weiping Tu, Zhongyuan Wang
628
TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery PDF ↗
Li Zhang, Shruti Agarwal, John Collomosse, Pengtao Xie, Vishal Asnani
629
Unleashing Vision-Language Semantics for Deepfake Video Detection PDF ↗
Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang
630
A Difference-in-Difference Approach to Detecting AI-Generated Images PDF ↗
Xinyi Qi, Kai Ye, Chengchun Shi, Ying Yang, Jin Zhu, Hongyi Zhou
631
RDFace: A Benchmark Dataset for Rare Disease Facial Image Analysis under Extreme Data Scarcity and Phenotype-Aware Synthetic Generation PDF ↗
Ganlin Feng, Yuxi Long, Hafsa Ali, Erin Lou, Fahad Butt, Qian Liu, Yang Wang, Pingzhao Hu
632
ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos PDF ↗
Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang
633
Zero-shot Detection of AI-Generated Image via RAW-RGB Alignment PDF ↗
Haiwei Wu, Fengpeng Li, Zhilin Tu, Yuanman Li, Xiong Li, Jiantao Zhou
634
Scaling Up AI-Generated Image Detection with Generator-Aware Prototypes PDF ↗
Ziheng Qin, Yuheng Ji, Renshuai Tao, Yuxuan Tian, Yuyang Liu, Yipu Wang, Xiaolong Zheng
635
Investigating Self-Supervised Representations for Audio-Visual Deepfake Detection PDF ↗
Dragos-Alexandru Boldisor, Stefan Smeu, Dan Oneata, Elisabeta Oneata
636
TIACam: Text-Anchored Invariant Feature Learning with Auto- Augmentation for Camera-Robust Zero-Watermarking PDF ↗
Abdullah Tanvir, Agnibh Dasgupta, Xin Zhong
637
FastRef: Fast Prototype Refinement for Few-shot Industrial Anomaly Detection PDF ↗
Yufei Li, Long Tian, Yuyang Dai, Wenchao Chen, Liang Bao, Xiyang Liu
638
RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation PDF ↗
Shijie Zhou, Bin Zhu, Jiarui Yang, Xiangyu Zhao, Jingjing Chen, Yu-Gang Jiang
639
Reasoning-Driven Anomaly Detection and Localization with Image- Level Supervision PDF ↗
Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang
640
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models PDF ↗
Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang
641
Wavelet-Driven 3D Anomaly Detection under Pose-Agnostic and Sparse-View PDF ↗
Mingwen Shao, Qiao Zhang, Xinyuan Chen, Xiang Lv, Lingzhuang Meng, Chang Liu, Qinglin Zhan, Ling Jian
642
Hunting Normality from Query Sample via Residual Learning for Generalist Anomaly Detection PDF ↗
Xiaolei Wang, Yuexin Wang, Tianhong Dai, Huihui Bai, Yao Zhao, Jimin Xiao
643
GPFlow: Gaussian Prototype Probability Flow for Unsupervised Multi-Modal Anomaly Detection PDF ↗
Yiting Li, Xulei Yang, Jingyi Liao, Jing Zhang, Fayao Liu
644
HP-Edit: A Human-Preference Post-Training Framework for Image Editing PDF ↗
Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo
645
It's Never Too Late: Noise Optimization for Collapse Recovery in Trained Diffusion Models PDF ↗
Anne Harrington, A. Sophia Koepke, Shyamgopal Karthik, Trevor Darrell, Alexei A. Efros
646
RebRL: Reinforcing Discrete Visual Diffusion Models with Rebalanced Timestep Credits PDF ↗
Mu Zhang, Tianren Ma, Yunfan Liu, Kun Hu, Qixiang Ye
647
Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos PDF ↗
Mengmeng Ge, Takashi Isobe, Xu Jia, Yanan Sun, Zetong Yang, Weinong Wang, Dong Zhou, Dong Li, Huchuan Lu, Emad Barsoum
648
Towards Fine-Grained Attribution: Instance-Aware Preference Optimization for Aligning Diffusion Models PDF ↗
Jiayang Sun, Pin Wang, Hongbo Wang, Xinyue Liu, Huaibo Huang, Ran He
649
SketchRevive: Fine-Grained Pixel-to-Vector Sketch Completion with Diffusion-Prior-Guided Multimodal LLMs PDF ↗
Ran Zuo, Haoxiang Hu, Chenxi Pei, Yanxuan Liu, Wenwen Qiang, Fang Liu, Xiaoming Deng, Cuixia Ma, Yong-Jin Liu
650
UniPercept: A Unified Diffusion Model for Generalizable Visual Perception PDF ↗
Zuyan Zhao, Zhenliang He, Meina Kan, Shiguang Shan, Xilin Chen
651
Visual Diffusion Models are Geometric Solvers PDF ↗
Nir Goren, Shai Yehezkel, Omer Dahary, Andrey Voynov, Or Patashnik, Daniel Cohen-Or
652
You Only Erase Once: Erasing Anything without Bringing Unexpected Content PDF ↗
Yixing Zhu, Qing Zhang, Wenju Xu, Wei-Shi Zheng
653
Smoothing the Score Function to Enhance Generalization in Diffusion Models PDF ↗
Xinyu Zhou, Jiawei Zhang, Stephen J. Wright
654
NS-Diff: Fluid Navier–Stokes Guided Video Diffusion via Reinforcement Learning PDF ↗
Zijun Deng, Yuxin Peng
655
PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models PDF ↗
Wonyong Seo, Jaeho Moon, Jaehyup Lee, Soo Ye Kim, Munchurl Kim
656
Generative Neural Video Compression via Video Diffusion Prior PDF ↗
Qi Mao, Hao Cheng, Tinghan Yang, Libiao Jin, Siwei Ma
657
AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation PDF ↗
Haoyue Tan, Shengnan Wang, Yulin Qiao, Juncheng Zhang, Youhui Bai, Ping Gong, Zewen Jin, Cheng Li
658
Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation PDF ↗
Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer
659
Image Diffusion Preview with Consistency Solver PDF ↗
Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao
660
The Drift Kernel: Why Diffusion Models Change Even When Told Not To PDF ↗
Gokul Srinath Seetha Ram, Rashmi Elavazhagan
661
Interpretable Prompts made Edit-Friendly: Token-to-Token Similarity Reduction in dLLMs for Edit-Friendly Hard Prompt Inversion PDF ↗
Naresh Kumar Devulapally, Shruti Agarwal, Vishal Asnani, Vishnu Suresh Lokhande
662
LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration PDF ↗
Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang
663
Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models PDF ↗
Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng
664
Adaptive Spectral Feature Forecasting for Diffusion Sampling Acceleration PDF ↗
Jiaqi Han, Juntong Shi, Puheng Li, Haotian Ye, Qiushan Guo, Stefano Ermon
665
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation PDF ↗
Yi Wu, Shengju Qian, Lingting Zhu, Lei Liu, Wandi Qiao, Ziqiang Li, Lequan Yu, Bin Li
666
EasyOmnimatte: Taming Pretrained Inpainting Diffusion Models for End-to-End Video Layered Decompositio PDF ↗
Yihan Hu, Xuelin Chen, Xiaodong Cun
667
Hierarchical Codec Diffusion for Video-to-Speech Generation PDF ↗
Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan
668
Semantic Alignment for Pose-Invariant Identity Preserving Diffusion PDF ↗
Jiwon Kim, SeonHwa Kim, Soobin Park, Eunju Cha, Kyong Hwan Jin
669
Causality in Video Diffusers is Separable from Denoising PDF ↗
Xingjian Bai, Guande He, Zhengqi Li, Eli Shechtman, Xun Huang, Zongze Wu
670
2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching PDF ↗
Caleb Zheng, Eli Shlizerman
671
Hear What You See: Video-to-Audio Generation with Diffusion Transformer and Semantic-Temporal Alignment-Ranked Direct Preference Optimization PDF ↗
Kai Wang, Tao Zhou, Jiayi Lei, Jing Wang, Jinman Zhao, Weiguo Pian, Yuan Cheng, Yapeng Tian, Peng Gao, Bin Fu, Yihao Liu, Dimitrios Hatzinakos, Yuewen Cao
672
MacTok: Robust Continuous Tokenization for Image Generation PDF ↗
Hengyu Zeng, Xin Gao, Guanghao Li, Yuxiang Yan, Jiaoyang Ruan, Junpeng Ma, Haoyu Albert Wang, Jian Pu
673
Group Editing: Edit Multiple Images in One Go PDF ↗
Yue Ma, Xinyu Wang, Qianli Ma, Qinghe Wang, Mingzhe Zheng, Xiangpeng Yang, Hao Li, Chongbo Zhao, Jixuan Ying, Harry Yang, Hongyu Liu, Qifeng Chen
674
Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation PDF ↗
Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang
675
Beyond the Golden Data: Resolving the Motion-Vision Quality Dilemma via Timestep Selective Training PDF ↗
Xiangyang Luo, Qingyu Li, Yuming Li, Guanbo Huang, Yongjie Zhu, Wenyu Qin, Meng Wang, Pengfei Wan, Shao-Lun Huang
676
Toward Diffusible High-Dimensional Latent Spaces: A Frequency Perspective PDF ↗
Bolin Lai, XuDong Wang, Saketh Rambhatla, James M. Rehg, Zsolt Kira, Rohit Girdhar, Ishan Misra
677
Elucidating the SNR-t Bias of Diffusion Probabilistic Models PDF ↗
Meng Yu, Lei Sun, Jianhao Zeng, Xiangxiang Chu, Kun Zhan
678
What Is It Like to Be a Noise? An Entropy-based Gaussian Noise Regularization for Diffusion Models PDF ↗
Pascal Chang, Kai Lascheit, Jingwei Tang, Markus Gross, Vinicius C. Azevedo
679
FlashVSR: Towards Real-time Diffusion-Based Streaming Video Super Resolution PDF ↗
Junhao Zhuang, Shi Guo, Xin Cai, Xiaohui Li, Yihao Liu, Chun Yuan, Tianfan Xue
680
DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer PDF ↗
Yuxuan Zhang, Katarína Tóthová, Zian Wang, Kangxue Yin, Haithem Turki, Riccardo de Lutio, Yen-Yu Chang, Or Litany, Sanja Fidler, Zan Gojcic
681
GDRO: Group-level Reward Post-training Suitable for Diffusion Models PDF ↗
Yiyang Wang, Xi Chen, Xiaogang Xu, Yu Liu, Hengshuang Zhao
682
RFDM: Residual Flow Diffusion Models for Video Editing PDF ↗
Mohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Abhinav Mehrotra
683
FreqEdit: Preserving High-Frequency Features for Robust Multi-Turn Image Editing PDF ↗
Yucheng Liao, Jiajun Liang, Kaiqian Cui, Baoquan Zhao, Haoran Xie, Wei Liu, Qing Li, Xudong Mao
684
Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models
Ning Han, Zhenyu Ge, Feng Han, Yuhua Sun, Chengqing Li, Jingjing Chen
685
HierEdit: Region-Aware Hierarchical Diffusion for Efficient High- Resolution Editing PDF ↗
Yuyao Zhang, Alexander Huang-Menders, Yu-Wing Tai
686
CTCal: Rethinking Text-to-Image Diffusion Models via Cross- Timestep Self-Calibration PDF ↗
Xiefan Guo, Xinzhu Ma, Haiyu Zhang, Di Huang
687
Edit2Perceive: Image Editing Diffusion Models Are Strong Dense Perceivers PDF ↗
Yiqing Shi, Yiren Song, Mike Zheng Shou
688
DeltaQuant: 4-bit Video Diffusion Models with Spatiotemporal Delta Smoothing PDF ↗
Xingyang Li, Samuel Tesfai, Zhekai Zhang, Haocheng Xi, Shuo Yang, Lvmin Zhang, Yufei Sun, Kelly Peng, Maneesh Agrawala, Ion Stoica, Kurt Keutzer, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li
689
D2Cache: Second-Order Delta Caching for Higher Video Diffusion Acceleration PDF ↗
Enhuai Liu, Yunke Wang, Changming Sun, Chang Xu
690
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation PDF ↗
Zehong Ma, Longhui Wei, Shuai Wang, Shiliang Zhang, Qi Tian
691
Test-Time Alignment of Text-to-Image Diffusion Models via Null-Text Embedding Optimisation PDF ↗
Taehoon Kim, Henry Gouk, Timothy Hospedales
692
Accelerating Diffusion Model Training under Minimal Budgets: A Condensation-Based Perspective PDF ↗
Rui Huang, Shitong Shao, zikai zhou, Pukun Zhao, Hangyu Guo, Tian Ye, Lichen Bai, Shuo Yang, Zeke Xie
693
Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache PDF ↗
Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang
694
Taming Sampling Perturbations with Variance Expansion Loss for Latent Diffusion Models PDF ↗
Qifan Li, Xingyu Zhou, Jinhua Zhang, Weiyi You, Shuhang Gu
695
Guiding Diffusion Models with Semantically Degraded Conditions PDF ↗
Shilong Han, Yuming Zhang, Hongxia Wang
696
Semantics Lead the Way: Harmonizing Semantic and Texture Modeling with Asynchronous Latent Diffusion PDF ↗
Yueming Pan, Ruoyu Feng, Qi Dai, Yuqi Wang, Wenfeng Lin, Mingyu Guo, Chong Luo, Nanning Zheng
697
Reviving ConvNeXt for Efficient Convolutional Diffusion Models PDF ↗
Taesung Kwon, Lorenzo Bianchi, Lennart Wittke, Felix Watine, Fabio Carrara, Jong Chul Ye, Romann Weber, Vinicius Azevedo
698
Coupled Diffusion Sampling for Training-Free Multi-View Image Editing PDF ↗
Hadi Alzayer, Yunzhi Zhang, Chen Geng, Jia-Bin Huang, Jiajun Wu
699
Improving Diffusion Generalization with Weak-to-Strong Segmented Guidance PDF ↗
Liangyu Yuan, Yufei Huang, Mingkun Lei, Tong Zhao, Ruoyu Wang, Changxi Chi, Yiwei Wang, Chi Zhang
700
Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation PDF ↗
Kwanyoung Lee, SeungJu Cha, Yebin Ahn, Hyunwoo Oh, Sungho Koh, Dong-Jin Kim
701
SegQuant: A Semantics-Aware and Generalizable Quantization Framework for Diffusion Models PDF ↗
Jiaji Zhang, Ruichao Sun, Hailiang Zhao, Jiaju Wu, Peng Chen, Hao Li, Yuying Liu, Kingsum Chow, Gang Xiong, Shuiguang Deng
702
BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models PDF ↗
Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein
703
Accelerating Autoregressive Video Diffusion via History-Guided Cache and Residual Correction PDF ↗
Kepan Nan, Wangbo Zhao, Penghao Zhou, Jun Li, Zhenheng Yang, Jian Yang, Ying Tai
704
MusicInfuser: Making Video Diffusion Listen and Dance, Notes: Notes: Notes: MAPS Ballroom Level mo 4f4e4d4c4b4aor ts eR m o to erl el3c3b3a ra tB Sh tgi uH oe2c2b2a tl Si MBallroom Pre-function EElevators PEPublic Escalators 1f1e1d1c1b1a PSPublic Stairs COLORADO CONVENTION CENTER, ADDRESS: 700 14TH ST, DENVER, CO 80202 14TH Street (City View) m4 o ot rle le ar B3t smoS nBallroomo ortn sPre-functionseo aeRt l S2e rW u oF 1 Exhibit HallsRestrooms esExhibit Hall D camo92,000 SF )rrort eTse wR ei V ni a t n u o M ( d vl B r e e p SExhibit Hall C sm95,000 SF oo rts eR CConcessions EElevators Restrooms PEPublic Escalators PSPublic Stairs ESEmergency Stairs ) w ei V ni a t n u o MMeeting Room 507Restrooms ( d506 vl B505 r ems504 eoo pstr Se503 R 502 501 Bellco Lobby D Theatre Lobby sm oo rts eR 602604606608610612 sm oo rts601603605607 eR Lobby C sm oo702704706708710712 rts eR sm oo 701703705707709711rts eR CConcessions EElevators PEPublic Escalators PSPublic Stairs Champa Street RestroomsRestrooms ec arr eTF ev Exhibit Hall EExhibit Hall Fob 91,000 SF106,000 SFAe ciff O 1 4 t h S t r E1E2e e t ( Ci t y Vi e w ) Exhibit Hall BExhibit Hall A 90,000 SF105,000 SFsm oo rts eRAe vo bA B2B1eci ff O RestroomsRestroomsRestrooms Welton Street Stout Street1 4 t h Lobby ES t r e e t Restrooms( Light Rail StationCi 407t y 406Drop-off / Pick-upV Restroomsi e 405w ) Mile High 404 Ballroom 1-4403304 402303 401302ec iff O 301 Ballroom Pre-FunctionRestrooms Lobby F Information Center 212210208206204202 Four Seasons Ballroom 1-4s 207205203201mo ort se RLobby A Ballroom Pre-Functionse ciff 112110108106104102O Cafe sm oo rts113111109107105103101 eR South Shuttle Drop-off Lobby B Shuttle Drop-off IEEE/CVF Conference on Computer Vision and Pattern Recognition
Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz OR OR
No matches.