‹ June 5 schedule

Poster Session 2

Fri · June 5 · 4:00–6:00 PM · ExHall A & F — 657 papers
657 papers
1
MAMMA: Markerless Accurate Multi-person Motion Acquisition 🏆PDF ↗
Hanz Cuevas Velasquez, Anastasios Yiannakidis, Soyong Shin, Giorgio Becherini, Markus Höschle, Joachim Tesch, Taylor Obersat, Tsvetelina Alexiadis, Eni Halilaj, Michael J. Black
2
Natural Human Motion Recovery by Aligning High-Order Temporal Dynamics from Monocular Videos 🏆PDF ↗
Dingkun Wei, Zehong Shen, Yan Xia, Georgios Pavlakos, Yujun Shen, Xiaowei Zhou
3
PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning PDF ↗
Jianqi Chen, Biao Zhang, Xiangjun Tang, Peter Wonka
4
SAM 3D Body: Robust Full-Body Human Mesh Recovery 🏆PDF ↗
Xitong Yang, Devansh Kukreja, Don Pinkus, Taosha Fan, Jinhyung Park, Soyong Shin, Jinkun Cao, Jia-Wei Liu, Nicolás Ugrinovic, Anushka Sagar, Jitendra Malik, Matt Feiszli, Piotr Dollár, Kris Kitani
5
SAM 3D: 3Dfy Anything in Images 🏆PDF ↗
Xingyu Chen, Fu-Jen Chu, Pierre Gleize, Kevin J Liang, Alexander Sax, Hao Tang, Weiyao Wang, Michelle Guo, Thibaut Hardin, Xiang Li, Aohan Lin, Jia-Wei Liu, Ziqi Ma, Anushka Sagar, Bowen Song, Xiaodong Wang, Jianing Yang, Bowen Zhang, Piotr Dollár, Georgia Gkioxari, Matt Feiszli, Jitendra Malik
6
SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge PDF ↗
Yumeng He, Ying Jiang, Jiayin Lu, Yin Yang, Chenfanfu Jiang
7
3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects 🏆PDF ↗
Zhicheng Liang, Haoyi Yu, Boyan Li, Dayou Zhang, Zijian Cao, Tianyi Gong, Junhua Liu, Shuguang Cui, Fangxin Wang
8
GLINT: Modeling Scene-Scale Transparency via Gaussian Radiance Transport 🏆PDF ↗
Youngju Na, Jaeseong Yun, Soohyun Ryu, Hyunsu Kim, Sung-Eui Yoon, Suyong Yeon
9
Neural Field-Based 3D Surface Reconstruction of Microstructures from Multi-Detector Signals in Scanning Electron Microscopy PDF ↗
Shuo Chen, Yijin Li, Xi Zheng, Guofeng Zhang
10
PhyGaP: Physically-Grounded Gaussians with Polarization Cues 🏆PDF ↗
Jiale Wu, Xiaoyang Bai, Zongqi He, Weiwei Xu, Yifan Peng
11
PPISP: Physically-Plausible Compensation and Control of Photometric Variations in Radiance Field Reconstruction PDF ↗
Isaac Deutsch, Nicolas Moënne-Loccoz, Gavriel State, Zan Gojcic
12
SeeGroup: Multi-Layer Depth Estimation of Transparent Surfaces via Self-Determined Grouping 🏆PDF ↗
Hongyu Wen, Jia Deng
13
Energy-GS: Image Energy-guided Pose Alignment Gaussian Splatting with redesigned pose gradient flow PDF ↗
Yu Gao, Lutong Su, Ruixiang Huang, Tianji Jiang, Jiadong Tang, Yufeng Yue, Yi Yang
14
MeshSplatting: Differentiable Rendering with Opaque Meshes PDF ↗
Jan Held, Sanghyun Son, Renaud Vandeghen, Daniel Rebain, Matheus Gadelha, Yi Zhou, Anthony Cioppa, Ming C. Lin, Marc Van Droogenbroeck, Andrea Tagliasacchi
15
Proxy-GS: Unified Occlusion Priors for Training and Inference in Structured 3D Gaussian Splatting 🏆PDF ↗
Yuanyuan Gao, Yuning Gong, Yifei Liu, Jingfeng Li, Dan Xu, Yanci Zhang, Dingwen Zhang, Xiao Sun, Zhihang Zhong
16
RetimeGS: Continuous-Time Reconstruction of 4D Gaussian Splatting PDF ↗
Xuezhen Wang, Li Ma, Yulin Shen, Zeyu Wang, Pedro V. Sander
17
Selfi: Self-improving Reconstruction Engine via 3D Geometric Feature Alignment PDF ↗
Youming Deng, Songyou Peng, Junyi Zhang, Kathryn Heal, Tiancheng Sun, John Flynn, Steve Marschner, Lucy Chai
18
Z-Order Transformer for Feed-Forward Gaussian Splatting PDF ↗
Can Wang, Lei Liu, Wei Jiang, Dong Xu
19
4D Primitive-Mâché: Glueing Primitives for Persistent 4D Scene Reconstruction
Kirill Mazur, Marwan Taher, Andrew J. Davison
20
Efficiently Reconstructing Dynamic Scenes One D4RT at a Time 🏆PDF ↗
Chuhan Zhang, Guillaume Le Moing, Skanda Koppula, Ignacio Rocco, Liliane Momeni, Junyu Xie, Shuyang Sun, Rahul Sukthankar, Joëlle K. Barral, Raia Hadsell, Zoubin Ghahramani, Andrew Zisserman, Junlin Zhang, Mehdi S. M. Sajjadi
21
FUSER: Feed-Forward Multiview 3D Registration Transformer and SE(3)^N Diffusion Refinement 🏆PDF ↗
Haobo Jiang, Jin Xie, Jian Yang, Liang Yu, Jianmin Zheng
22
Residual Primitive Fitting of 3D Shapes with SuperFrusta 🏆PDF ↗
Aditya Ganeshan, Matheus Gadelha, Thibault Groueix, Zhiqin Chen, Siddhartha Chaudhuri, Vladimir Kim, Wang Yifan, Daniel Ritchie
23
SmokeSVD: Smoke Reconstruction from A Single View via Progressive Novel View Synthesis and Refinement with Diffusion Models 🏆PDF ↗
Chen Li, Shanshan Dong, Sheng Qiu, Jianmin Han, Yibo Zhao, Zan Gao, Taku Komura, Kemeng Huang
24
SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model 🏆PDF ↗
Jiayuan Du, Yiming Zhao, Zhenglong Guo, Yong Pan, Wenbo Hou, Zhihui Hao, Kun Zhan, Qijun Chen
25
Affostruction: 3D Affordance Grounding with Generative Reconstruction PDF ↗
Chunghyun Park, Seunghyeon Lee, Minsu Cho
26
MV-RoMa: From Pairwise Matching into Multi-View Track Reconstruction PDF ↗
Jongmin Lee, Seungyeop Kang, Sungjoo Yoo
27
Unified Primitive Proxies for Structured Shape Completion PDF ↗
Zhaiyu Chen, Yuqing Wang, Xiao Xiang Zhu
28
ART: Articulated Reconstruction Transformer PDF ↗
Zizhang Li, Cheng Zhang, Zhengqin Li, Henry Howard-Jenkins, Zhaoyang Lv, Chen Geng, Jiajun Wu, Richard Newcombe, Jakob Engel, Zhao Dong
29
SCE-SLAM: Scale-Consistent Monocular SLAM via Scene Coordinate Embeddings PDF ↗
Yuchen Wu, Jiahe Li, Xiaohan Yu, Lina Yu, Jin Zheng, Xiao Bai
30
S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs PDF ↗
Yuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang, Guangzhi Cao, Lizhuang Ma, Yuan Xie, Xin Tan
31
Pip-Stereo: Progressive Iterations Pruner for Iterative Optimization based Stereo Matching PDF ↗
Jintu Zheng, Qizhe Liu, Huangxin Xu, Zhuojie Chen
32
Fast-FoundationStereo: Real-Time Zero-Shot Stereo Matching PDF ↗
Bowen Wen, Shaurya Dewan, Stan Birchfield
33
E-RayZer: Self-supervised 3D Reconstruction as Spatial Visual Pre-training PDF ↗
Qitao Zhao, Hao Tan, Qianqian Wang, Sai Bi, Kai Zhang, Kalyan Sunkavalli, Shubham Tulsiani, Hanwen Jiang
34
QVGGT: Post-Training Quantized Visual Geometry Grounded Transformer PDF ↗
Zhizhen Pan, Hesong Wang, Huan Wang
35
SRGCD: Stability-Driven Region Growth Framework for 3D Change Detection PDF ↗
Yue Wu, Tao Peng, Yongzhe Yuan, Kaiyuan Feng, Hao Li, Maoguo Gong, Qiguang Miao, Wenping Ma
36
D-Prism: Differentiable Primitives for Structured Dynamic Modeling PDF ↗
Xingyuan Yu, Yijin Li, Chong Zeng, Yuhang Ming, Hujun Bao, Guofeng Zhang
37
STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction PDF ↗
Runze Wang, Yuxuan Song, Youcheng Cai, Ligang Liu
38
Stabilizing Streaming Video Geometry via Dynamic Feature Normalization PDF ↗
Xiaoyang Lyu, Muxin Liu, Xiaoshan Wu, Ruicheng Wang, Yi-Hua Huang, Yang-Tian Sun, Shaoshuai Shi, Xiaojuan Qi
39
LaS-Comp: Zero-shot 3D Completion with Latent–Spatial Consistency PDF ↗
Weilong Yan, Haipeng Li, Hao Xu, Nianjin Ye, Yihao Ai, Shuaicheng Liu, Jingyu Hu
40
Pano360: Perspective to Panoramic Vision with Geometric Consistency PDF ↗
Zhengdong Zhu, Weiyi Xue, Zuyuan Yang, Wenlve Zhou, Zhiheng Zhou
41
EfficientMonoHair: Fast Strand-Level Reconstruction from Monocular Video via Multi-View Direction Fusion PDF ↗
Da Li, Dominik Engel, Deng Luo, Ivan Viola
42
OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation PDF ↗
Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim
43
MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis PDF ↗
Xiangyu Bai, He Liang, Bishoy Galoaa, Utsav Nandi, Shayda Moezzi, Yuhang He, Sarah Ostadabbas
44
StyleTextGen: Style-Conditioned Multilingual Scene Text Generation PDF ↗
Zeyu Chen, Fangmin Zhao, Yan Shu, Yichao Liu, Liu Yu, Yu Zhou
45
CRAFT-LoRA: Content-Style Personalization via Rank-Constrained Adaptation and Training-Free Fusion PDF ↗
Yu Li, Yujun Cai, Chi Zhang
46
OneHOI: Unifying Human-Object Interaction Generation and Editing PDF ↗
Jiun Tian Hoe, Weipeng Hu, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan
47
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering PDF ↗
Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao
48
Self-Paced and Self-Corrective Masked Prediction for Movie Trailer Generation PDF ↗
Sidan Zhu, Hongteng Xu, Dixin Luo
49
TV2TV: A Unified Framework for Interleaved Language and Video Generation PDF ↗
Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan
50
Narrative Weaver: Towards Controllable Long-Range Visual Consistency with Multi-Modal Conditioning PDF ↗
Zhengjian Yao, Yongzhi Li, Xinyuan Gao, Quan Chen, Peng Jiang, Yanye Lu
51
Ref4D-VideoBench: Four-Dimensional Reference-Based Evaluation of Text-to-Video Generative Models PDF ↗
Jiajia Wei, Yujia He, Yuhan Hou, Hang Qi, Sihua Wang, Jincheng Shi, Kwok Fung Li, Zibin Zheng, Weibin Wu
52
PureCC: Pure Learning for Text-to-Image Concept Customization PDF ↗
Zhichao Liao, Xiaole Xian, Qingyu Li, Wenyu Qin, Meng Wang, Weicheng Xie, Siyang Song, Pingfa Feng, Long Zeng, Liang Pan
53
Disentangling to Re-couple: Resolving the Similarity-Controllability Paradox in Subject-Driven Text-to-Image Generation PDF ↗
Shuang Li, Chao Deng, Hang Chen, Liqun Liu, Zhenyu Hu, Te Cao, Mengge Xue, Yuan Chen, Peng Shu, Huan Yu, Jie Jiang
54
Yume1.5: A Text-Controlled Interactive World Generation Model PDF ↗
Xiaofeng Mao, Zhen Li, Chuanhao Li, Xiaojie Xu, Kaining Ying, Kaipeng Zhang
55
PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation PDF ↗
Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu
56
Scone: Bridging Composition and Distinction in Subject-Driven Image Generation via Unified Understanding-Generation Modeling PDF ↗
Yuran Wang, Bohan Zeng, Chengzhuo Tong, Wenxuan Liu, Yang Shi, Xiaochen Ma, Hao Liang, Yuanxing Zhang, Wentao Zhang
57
SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation PDF ↗
Ryosuke Matsuda, Keito Kudo, Haruto Yoshida, Nobuyuki Shimizu, Jun Suzuki
58
PROMPTMINER: Black-Box Prompt Stealing against Text-to-Image Generative Models via Reinforcement Learning and VLM-Guided Optimization PDF ↗
Mingzhe Li, Renhao Zhang, Zhiyang Wen, Siqi Pan, Bruno Castro da Silva, Juan Zhai, Shiqing Ma
59
FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing PDF ↗
Guangzhao Li, Yanming Yang, Chenxi Song, Xiaohong Liu, Chi Zhang
60
Self-Evaluation Unlocks Any-Step Text-to-Image Generation PDF ↗
Xin Yu, Xiaojuan Qi, Zhengqi Li, Kai Zhang, Richard Zhang, Zhe Lin, Eli Shechtman, Tianyu Wang, Yotam Nitzan
61
Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits PDF ↗
Zelong Sun, Jiahui Wu, Ying Ba, Dong Jing, Zhiwu Lu
62
LVLM-Aided Alignment of Task-Specific Vision Models PDF ↗
Alexander Koebler, Lukas Kuhn, Ingo Thon, Florian Buettner
63
DeepAlign: Mitigating Modality Conflict through Modality-Specific Alignment PDF ↗
Shuo Li, Bingchen Miao, Wendong Bu, Juncheng Li, Hanwang Zhang, Fei Wu
64
PG-VTON: Single-Pass Training-Free Virtual Try-On via Patch-Guided Reference Alignment PDF ↗
Guohao Zhao, Yuxin Peng
65
Linguistic Priors for Visual Decoupling: Towards Symmetric Vision- Brain Alignment PDF ↗
Dongjun Liu, Weichen Dai, Jingsheng Qian, Honggang Liu, Hangjie Yi, Wanzeng Kong
66
Scaling Spatial Intelligence with Multimodal Foundation Models PDF ↗
Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Tongxi Zhou, Qingping Sun, Hui En Pang, Jiaqi Li, Oscar Qian, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang
67
R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning
Qi Yang, Bolin Ni, Shiming Xiang, Houwen Peng
68
SafeGRPO: Self-Rewarded Multimodal Safety Alignment via Rule-Governed Policy Optimization PDF ↗
Xuankun Rong, Wenke Huang, Tingfeng Wang, Daiguo Zhou, Bo Du, Mang Ye
69
AVATAR: Reinforcement Learning to See, Hear, and Reason Over Video PDF ↗
Yogesh Kulkarni, Pooyan Fazli
70
CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning PDF ↗
Xiang Fang, Wanlong Fang, Changshuo Wang
71
FOZO: Forward-Only Zeroth-Order Prompt Optimization for Test-Time Adaptation PDF ↗
Xingyu Wang, Tao Wang
72
Language Does Matter for Cross-Domain Few-Shot Visual Feature Enhancement PDF ↗
Fei Zhou, Xiwen Zhang, Qingqing Qiu, Lei Zhang, Wei Wei, Chen Ding, Yi Zhang, Liang Li, Xiangyu Yue, Yanning Zhang
73
Back to Source: Open-Set Continual Test-Time Adaptation via Domain Compensation PDF ↗
Yingkai Yang, Chaoqi Chen, Hui Huang
74
Bridging Domain Expertise and Generalization for Performance Estimation PDF ↗
Shuxuan Li, Zhilin Zhao, Quyu Kong, Wei-Shi Zheng
75
Adaptive Data Augmentation with Multi-armed Bandit: Sample- Efficient Embedding Calibration for Implicit Pattern Recognition PDF ↗
Minxue Tang, Yangyang Yu, Aolin Ding, Maziyar Baran Pouyan, Taha Belkhouja, Yujia Bao
76
Bridging Domains through Subspace-Aware Model Merging PDF ↗
Levy Chaves, Chao Zhou, Rebekka Burkholz, Eduardo Valle, Sandra Avila
77
DA-Mamba: Learning Domain-Aware State Space Model for Global- Local Alignment in Domain Adaptive Object Detection PDF ↗
Haochen Li, Rui Zhang, Hantao Yao, Xin Zhang, Yifan Hao, Shaohui Peng, Yongwei Zhao, Ling Li
78
Scaling Dense Event-Stream Pretraining from Visual Foundation Models PDF ↗
Zhiwen Chen, Junhui Hou, Zhiyu Zhu, Jinjian Wu, Guangming Shi
79
Event Stream Filtering via Probability Flux Estimation PDF ↗
Jinze Chen, Wei Zhai, Yang Cao, Bin Li, Zheng-Jun Zha
80
AIMDepth: Asymmetric Image-Event Mamba for Monocular Depth Estimation PDF ↗
Luoxi Jing, Dianxi Shi, Yushe Cao, Yuanze Wang, Junze Zhang, Yuning Cui, Mengzhu Wang
81
Time-Specialized Event-Image Alignment for Blur-to-Video Decomposition PDF ↗
Zhijing Sun, Senyan Xu, Ruixuan Jiang, Kean Liu, Runze Tian, Xueyang Fu, Zheng-Jun Zha
82
eRetinexGS: Retinex Modeling for Low-Light Scene Enhancement via Event Streams and 3D Gaussian Splatting PDF ↗
Haojie Yan, Zehao Chen, Yan Liu, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan
83
Unsupervised 3d Motion Estimation Using Event Camera PDF ↗
Han Han, Wei Zhai, Tiesong Zhao, Bin Li, Yang Cao, Zheng-jun Zha
84
Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning PDF ↗
Qi Wang, Mian Wu, Yuyang Zhang, Mingqi Yuan, Wenyao Zhang, Haoxiang You, Yunbo Wang, Xin Jin, Xiaokang Yang, Wenjun Zeng
85
ModularAgent: A Task-Aware Modular Framework for Joint Optimization of Multimodal Large Language Models and World Models PDF ↗
Yu-Wei Zhan, Xin Wang, Pengzhe Mao, Tongtong Feng, Ren Wang, Wenwu Zhu
86
AstraNav-Memory: Contexts Compression for Long Memory PDF ↗
Junjun Hu, Xinda Xue, Botao Ren, Minghua Luo, Jintao Chen, Haochen Bai, Liangliang You, Mu Xu
87
Test-Time Perturbation Learning with Delayed Feedback for Vision- Language-Action Models
Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Liu, Jiahuan Zhou, Jiangmeng Li
88
OVSegDT: Segmenting Transformer for Open-Vocabulary Object Goal Navigation
Tatiana Zemskova, Aleksei Staroverov, Dmitry Yudin, Aleksandr Panov
89
ShowUI-π: Flow-based Generative Models as GUI Dexterous Hands
Siyuan Hu, Kevin Qinghong Lin, Mike Zheng Shou
90
ActiveVLA: Injecting Active Perception into Vision-Language- Action Models for Precise 3D Robotic Manipulation PDF ↗
Zhenyang Liu, Yongchong Gu, Yikai Wang, Xiangyang Xue, Yanwei Fu
91
ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models PDF ↗
Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Si Liu, Guanghui Ren
92
BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections PDF ↗
Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere
93
SyncMos: Scalable Motion Synchronisation for Multi-Agent Scene Interaction PDF ↗
Lingxiao Li, Dongwon Kim, Lingyan Ruan, Bin Chen, Taesoo Kwon, Taehyun Rhee
94
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model PDF ↗
Dongwon Kim, Gawon Seo, Jinsung Lee, Minsu Cho, Suha Kwak
95
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization PDF ↗
Tsai-Shien Chen, Aliaksandr Siarohin, Gordon Guocheng Qian, Kuan-Chieh Jackson Wang, Egor Nemchinov, Moayed Haji-Ali, Riza Alp Guler, Willi Menapace, Ivan Skorokhodov, Anil Kag, Jun-Yan Zhu, Sergey Tulyakov
96
IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting PDF ↗
Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan
97
InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space PDF ↗
Jiarui Wu, Yujin Wang, Ruikang Li, Fan Zhang, Mingde Yao, Tianfan Xue
98
MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models PDF ↗
Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji
99
The Devil is in Attention Sharing: Improving Complex Non-rigid Image Editing Faithfulness via Attention Synergy PDF ↗
Zhuo Chen, Fanyue Wei, Runze Xu, Jingjing Li, Lixin Duan, Angela Yao, Wen Li
100
ShreddingNet: Coarse-to-Fine Restoration for Multi-Source Shredded Manuscripts PDF ↗
Haoyang Cui, Hao Jiang, Yadong Mu
101
Image Guides Images: Consistent Video Amodal Completion with Rectified In-Context Exemplar Guidance PDF ↗
Xiaoyu Kong, Ketong Ren, Dongyu She, Weiming Dong, Miao Wang
102
Radiance Meshes for Volumetric Reconstruction PDF ↗
Alexander Mai, Trevor Hedstrom, George Kopanas, Janne Kontkanen, Falko Kuester, Jonathan T. Barron
103
Aesthetic Camera Viewpoint Suggestion with 3D Aesthetic Field PDF ↗
Sheyang Tang, Armin Shafiee Sarvestani, Jialu Xu, Xiaoyu Xu, Zhou Wang
104
CoRoGS: Contextual Gaussian Splatting for Robust Large-Deviation View Synthesis PDF ↗
Xin Ma, Peng Lu, Yisong Chen, Chengwei Pan, Sheng Li
105
ChronoGS: Disentangling Invariants and Changes in Multi-Period Scenes PDF ↗
Zhongtao Wang, Jiaqi Dai, Qingtian Zhu, Yilong Li, Mai Su, Fei Zhu, Meng Gai, Shaorong Wang, Chengwei Pan, Yisong Chen, Guoping Wang
106
Real-Time Dynamic Scene Rendering with Controlled Compressibility and Contact Awareness PDF ↗
Boya Shi, Naiyang Guan, Xiaodong Yi
107
Splatent: Splatting Diffusion Latents for Novel View Synthesis PDF ↗
Or Hirschorn, Omer Sela, Inbar Huberman-Spiegelglas, Netalee Efrat, Eli Alshan, Ianir Ideses, Frederic Devernay, Yochai Zvik, Lior Fritz
108
ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-free Physical Motion Extrapolation PDF ↗
Jinsheng Quan, Qiaowei Miao, Yichao Xu, Zizhuo Lin, Ying Li, Wei Yang, Zhihui Li, Yawei Luo
109
Dynamic-Static Decomposition for Novel View Synthesis of Dynamic Scenes with Spiking Neurons PDF ↗
Lingyun Dai, Zehao Chen, Yan Liu, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan
110
DiffSoup: Direct Differentiable Rasterization of Triangle Soup for Extreme Radiance Field Simplification PDF ↗
Kenji Tojo, Bernd Bickel, Nobuyuki Umetani
111
Gyro-based Deep Video Deblurring PDF ↗
Jaesung Rim, Woohyeok Kim, Haeyun Lee, Heemin Yang, Ke Wang, Sunghyun Cho
112
Residual Diffusion Bridge Model for Image Restoration PDF ↗
Hebaixu Wang, Jing Zhang, Haoyang Chen, Haonan Guo, Di Wang, Jiayi Ma, Bo Du
113
MMDIR: Multimodal Instruction-Driven Framework for Mixed- Degradation Document Image Restoration PDF ↗
Heng Li, Xingyuan Wang, Yang Fan, Yunan Zhang, Xiangping Wu, Qingcai Chen
114
Rectifying Latent Space for Generative Single-Image Reflection Removal PDF ↗
Mingjia Li, Jin Hu, Hainuo Wang, Qiming Hu, Jiarui Wang, Xiaojie Guo
115
Towards Generalized Multimodal Homography Estimation PDF ↗
Jinkun You, Jiaxin Cheng, Jie Zhang, Yicong Zhou
116
Edit-aware RAW reconstruction PDF ↗
Abhijith Punnappurath, Luxi Zhao, Ke Zhao, Hue Nguyen, Radek Grzeszczuk, Michael S. Brown
117
Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration PDF ↗
Amirhossein Kazerouni, Maitreya Suin, Tristan Aumentado-Armstrong, Sina Honari, Amanpreet Walia, Iqbal Mohomed, Konstantinos G. Derpanis, Babak Taati, Alex Levinshtein
118
HG-Lane: High-Fidelity Generation of Lane Scenes under Adverse Weather and Lighting Conditions without Re-annotation PDF ↗
Daichao Zhao, Qiupu Chen, Feng He, Xin Ning, Qiankun Li
119
NanoSD: Edge Efficient Foundation Model for Real Time Image Restoration PDF ↗
Subhajit Sanyal, Srinivas Soumitri Miriyala, Akshay Janardan Bankar, Manjunath Arveti, Sowmya Vajrala, Shreyas Pandith, Sravanth Kodavanti, Abhishek Ameta, Harshit Harshit, Amit Satish Unde
120
MR. Illuminate: Zero-Shot Low-Light Image Enhancement with Diffusion Prior PDF ↗
Joshua Cho, Sara Aghajanzadeh, Zhen Zhu, David Forsyth
121
FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model PDF ↗
Xiang Chen, Jinshan Pan, Jiangxin Dong, Jian Yang, Jinhui Tang
122
SPEGC: Continual Test-Time Adaptation via Semantic-Prompt- Enhanced Graph Clustering for Medical Image Segmentation PDF ↗
Xiaogang Du, Jiawei Zhang, Tongfei Liu, Tao Lei, Yingbo Wang
123
BackSplit: The Importance of Sub-dividing the Background in Biomedical Lesion Segmentation PDF ↗
Rachit Saluja, Asli Cihangir, Ruining Deng, Johannes C. Paetzold, Fengbei Liu, Mert R. Sabuncu
124
Divide, Conquer, and Aggregate: Asymmetric Experts for Class- Imbalanced Semi-Supervised Medical Image Segmentation PDF ↗
Yajun Liu
125
CROWn: A Unified Framework for Anti-Aliased Downsampling and Phase-Calibrated Fusion in 3D Medical Segmentation PDF ↗
Xingru Huang, Shuanghua Ye, Zhao Huang, Wenwen Tang, Huiyu Zhou, Zhiwen Zheng, Jin Liu, Xiaoshuai Zhang
126
Rethinking Box Supervision: Bias-Free Weakly Supervised Medical Segmentation PDF ↗
Jun Wei, Hui Huang
127
Semi-supervised Echocardiography Video Segmentation via Anchor Semantic Awareness and Continuous Pseudo-label Reforging PDF ↗
Yunpeng Fang, Yimu Sun, Jingxing Guo, Huisi Wu, Jing Qin
128
TANGO: Learning Distribution-wise Foundation Prior Consistency and Instance-wise Style Calibration for Medical Image Generalization PDF ↗
Chuang Liu, Yichao Cao, Xiu Su, Haogang Zhu
129
MambaLiteUNet: Cross-Gated Adaptive Feature Fusion for Robust Skin Lesion Segmentation PDF ↗
Md Maklachur Rahman, Soon Ki Jung, Tracy Hammond
130
Breaking Multimodal LLM Safety via Video-Driven Prompting PDF ↗
Dong Wang, Xiangyu He, Xinqi Lyu, Bin Xiao
131
When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters PDF ↗
Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng
132
RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Faces PDF ↗
Haonan An, Xiaohui Ye, Guang Hua, Yihang Tao, Hangcheng Cao, Xiangyu Yu, Yuguang Fang
133
A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models PDF ↗
Mujtaba Hussain Mirza, Antonio D'Orazio, Odelia Melamed, Iacopo Masi
134
FORCE: Transferable Visual Jailbreaking Attacks via Feature Over- Reliance CorrEction PDF ↗
Runqi Lin, Alasdair Paren, Suqin Yuan, Muyang Li, Philip Torr, Adel Bibi, Tongliang Liu
135
PureProof: Diffusion-Resistant Black-box Targeted Attack on Large Vision-Language Models PDF ↗
Yiming Cao, Dong Wang, Xinqi Lyu, Bin Xiao
136
UniDef: Universal Defense Against Unauthorized Image Manipulation PDF ↗
Mingwen Shao, Lingzhuang Meng, Xiang Lv, Mengyao Wu, Xinyuan Chen, Qiao Zhang, Chang Liu, Yuanjian Qiao, Chao Dong
137
Multi-Crit: Benchmarking Multimodal Judges on Pluralistic Criteria- Following PDF ↗
Tianyi Xiong, Yi Ge, Ming Li, Zuolong Zhang, Pranav Kulkarni, Kaishen Wang, Qi He, Zeying Zhu, Chenxi Liu, Ruibo Chen, Tong Zheng, Yanshuo Chen, Xiyao Wang, Renrui Zhang, Wenhu Chen, Heng Huang
138
MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals PDF ↗
Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupeng Xie, Yaxin Mu, Peng Zhang, Peipei Li, Fengxiang Wang, Yangang Sun, Maosong Sun
139
Rethinking Cross-Modal Anchor Alignment for Mitigating Error Accumulation PDF ↗
Bin Liu, Wei Sun, Qianqian Wang, Wei Feng, Yijie Chen, Haixi Zhang
140
SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts PDF ↗
Khanh Binh Nguyen, Chae Jung Park
141
Omni-MMSI: Toward Identity-attributed Social Interaction Understanding PDF ↗
Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James M. Rehg, Yapeng Tian
142
Inconsistency-aware Multimodal Schrödinger Bridge for Deepfake Localization
Jiayu Xiong, Jing Wang, Qi Zhang, Wanlong Wang, Jun Xue
143
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models PDF ↗
Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao
144
Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions PDF ↗
Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak
145
Seeing What Matters: A Training-Free Self-Guided Framework for Multimodal Detail Perception and Reasoning PDF ↗
Mingjie Ma, yichao ma, Zhong Yang, Guohui Li
146
Illuminating Visual Identity in Universal Multimodal Embeddings PDF ↗
Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye
147
Anti-Degradation Lifelong Multi-View Clustering PDF ↗
Xingfeng Li, Hao Pan, Honglin Yuan, Yuan Sun, Xujian Zhao, Jiaqi Lin, Zhenwen Ren
148
The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts PDF ↗
Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng
149
Efficient and High-Fidelity Omni Modality Retrieval PDF ↗
Chuong Huynh, Manh Luong, Abhinav Shrivastava
150
Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs PDF ↗
Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano
151
Tri-Subspaces Disentanglement for Multimodal Sentiment Analysis PDF ↗
Chunlei Meng, Jiabin Luo, Zhenglin Yan, Zhenyu Yu, Rong Fu, Zhongxue Gan, Chun Ouyang
152
HAVE-Bench: Hierarchical Audio-Visual Evaluation from Perception to Interaction PDF ↗
Muyan Zhong, Erfei Cui, Sen Xing, Weiyun Wang, Wen Wu, Yuchen Hu, Yanting Zhang, Xiaowei Hu, Wenhai Wang, Chao Zhang, Jifeng Dai
153
Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models PDF ↗
Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan, Xinbin Yuan, Shouhong Ding, Xialei Liu, Ming-Ming Cheng
154
The More, The Merrier: Contrastive Fusion For Higher-Order Multimodal Alignment PDF ↗
Stefanos Koutoupis, Michaela Areti Zervou, Konstantinos Kontras, Maarten De Vos, Panagiotis Tsakalides, Grigorios Tsagkatakis
155
CineSRD: Leveraging Visual, Acoustic, and Linguistic Cues for Open- World Visual Media Speaker Diarization PDF ↗
Liangbin Huang, Xiaohua Liao, Chaoqun Cui, Shijing Wang, Zhaolong Huang, Yanlong Du, Wenji Mao
156
HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance PDF ↗
Green Rosh, Prateek Kukreja, Vishakha SR, Pawan Prasad B H
157
UST-Hand: An Uncertainty-aware Spatiotemporal Point Cloud Interaction Network for 3D Self-supervised Hand Pose Estimation PDF ↗
Tianhao Han, Haoyang Zhang, Liang Xie, Haochen Chang, Kun Gao, Yuan Cheng, Pengfei Ren, Erwei Yin
158
ForeHOI: Feed-forward 3D Object Reconstruction from Daily Hand- Object Interaction Videos PDF ↗
Yuantao Chen, Jiahao Chang, Chongjie Ye, Chaoran Zhang, Zhaojie Fang, Chenghong Li, Xiaoguang Han
159
Hoi! - A Multimodal Dataset for Force-Grounded, Cross-View Articulated Manipulation PDF ↗
Tim Engelbracht, René Zurbrügg, Matteo Wohlrapp, Martin Büchner, Abhinav Valada, Marc Pollefeys, Hermann Blum, Zuria Bauer
160
Enhancing Hands in 3D Whole-Body Pose Estimation with Conditional Hands Modulator PDF ↗
Gyeongsik Moon
161
TouchDream: 3D Object Completion through Imagined Touch PDF ↗
Yuanbo Wang, Xinning Wang, Zhaoxuan Zhang, Changlong Wang, Qianchen Xia, Xiaopeng Wei, Xin Yang
162
ForceVLA2: Unleashing Hybrid Force-Position Control with Force Awareness for Contact-Rich Manipulation PDF ↗
Yang Li, Zhaxizhuoma Zhaxizhuoma, Hongru Jiang, Junjie Xia, Hongquan Zhang, Jinda Du, Yunsong Zhou, Jia Zeng, Ce Hao, Jieji Ren, Qiaojun Yu, Cewu Lu, Yu Qiao, Jiangmiao Pang
163
TokenHand: Discrete Token Representation for Efficient Hand Mesh Reconstruction PDF ↗
Xinguo He, Yixin Shen, Rahul Chaudhari
164
Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects PDF ↗
Denys Iliash, Jiayi Liu, Egor Fokin, Qirui Wu, Ali Mahdavi Amiri, Manolis Savva, Angel X. Chang
165
MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis PDF ↗
Di Luo, Shuhui Yang, Mingxin Yang, Jiawei Lu, Yixuan Tang, Xintong Han, Zhuo Chen, Beibei Wang, Chunchao Guo
166
LogCD: Local-to-global Consistency Distillation for Few-step Image Generation PDF ↗
Qingsong Xie, Zhenyi Liao, Chen Chen, Zhijie Deng, Haonan Lu
167
EditCtrl: Disentangled Local and Global Control for Real-Time Generative Video Editing PDF ↗
Yehonathan Litman, Shikun Liu, Dario Seyb, Nicholas Milef, Yang Zhou, Carl Marshall, Shubham Tulsiani, Caleb Leak
168
Anchoring and Rescaling Attention for Semantically Coherent Inbetweening PDF ↗
Tae Eun Choi, Sumin Shim, Junhyeok Kim, Seong Jae Hwang
169
FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance PDF ↗
Quanhao Li, Zhen Xing, Rui Wang, Haidong Cao, Qi Dai, Daoguo Dong, Zuxuan Wu
170
LightMover: Generative Light Movement with Color and Intensity Controls PDF ↗
Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen
171
Parallel Jacobi Decoding for Fast Autoregressive Image Generation PDF ↗
Boya Liao, Ying Li, Siyong Jian, Huan Wang
172
CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing PDF ↗
Yucheng Wang, Zedong Wang, Yuetong Wu, Yue Ma, Dan Xu
173
CREval: An Automated Interpretable Evaluation for Creative Image Manipulation under Complex Instructions PDF ↗
Chonghuinan Wang, Zihan Chen, Yuxiang Wei, Tianyi Jiang, Xiaohe Wu, Fan Li, Wangmeng Zuo, Hongxun Yao
174
EchoVDiff: Cardiac-Cycle Echocardiography Video Generation from Arbitrary Frame
Jiansong Zhang, Xiaying Yang, Xiaoling Luo, Linlin Shen
175
Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing PDF ↗
Runze He, Yiji Cheng, Tiankai Hang, Zhimin Li, Yu Xu, Zijin Yin, Shiyi Zhang, Wenxun Dai, Penghui Du, Ao Ma, Chunyu Wang, Qinglin Lu, Jizhong Han, Jiao Dai
176
ChimeraLoRA: Multi-Head LoRA-Guided Synthetic Datasets PDF ↗
Hoyoung Kim, Minwoo Jang, Jabin Koo, Sangdoo Yun, Jungseul Ok
177
Frequency-Aware Flow Matching for High-Quality Image Generation PDF ↗
Sucheng Ren, Qihang Yu, Ju He, Xiaohui Shen, Liang-Chieh Chen
178
STARFlow-V: End-to-End Video Generative Modeling with Autoregressive Normalizing Flows PDF ↗
Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Ángel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai
179
MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture PDF ↗
Hui Li, Jiayue Lyu, Fu-Yun Wang, Kaihui Cheng, Siyu Zhu, Jingdong Wang
180
Improving Controllable Generation: Faster Training and Better Performance via x0-Supervision PDF ↗
Amadou S. Sangare, Adrien Maglo, Mohamed Chaouch, Bertrand Luvison
181
Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models PDF ↗
Zixuan Ye, Quande Liu, Cong Wei, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhan Luo
182
OrionEdit: Bridging Reference and Source Images for Generalized Cross-Image Editing PDF ↗
Zeyu Jiang, Lai Man Po, Xuyuan Xu, Yexin Wang, Guoping Gong, Haoxuan Wu, Chenbo Yan, Kun Li, Yuyang Liu
183
PositionIC: Unified Position and Identity Consistency for Image Customization PDF ↗
Junjie Hu, Tianyang Han, Kai Ma, Jialin Gao, Yang Song, Xianhua He, Junfeng Luo, Xiaoming Wei, Wenqiang Zhang
184
P-Flow: Prompting Visual Effects Generation PDF ↗
Rui Zhao, Mike Zheng Shou
185
Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization PDF ↗
Xingyue Lin, Shuai Peng, Xiangyu Xie, Jianhua Zhu, Yuxuan Zhou, Liangcai Gao
186
SURF: Signature-Retained Fast Video Generation PDF ↗
Kaixin Ding, Xi Chen, Sihui Ji, Yuan Gao, Liang Hou, Xin Tao, Hengshuang Zhao
187
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe- Driven Details Injection PDF ↗
Qingdong He, Xueqin Chen, Yanjie Pan, Peng Tang, Pengcheng Xu, Zhenye Gan, Chengjie Wang, Xiaobin Hu, Jiangning Zhang, Yabiao Wang
188
Lynx: Towards High-Fidelity Personalized Video Generation PDF ↗
Shen Sang, Tiancheng Zhi, Tianpei Gu, Jing Liu, Linjie Luo
189
VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis PDF ↗
Meng Chu, Senqiao Yang, Haoxuan Che, Suiyun Zhang, Xichen Zhang, Shaozuo Yu, Haokun Gui, Zhefan Rao, Dandan Tu, Rui Liu, Jiaya Jia
190
ClusterMark: Towards Robust Watermarking for Autoregressive Image Generators with Visual Token Clustering PDF ↗
Denis Lukovnikov, Andreas Müller, Erwin Quiring, Asja Fischer
191
Stable Mean Flow: Lyapunov-Inspired One-Step Flow Matching PDF ↗
Guangxun Zhang, Mason Haberle, Davi Geiger
192
OPRO: Orthogonal Panel-Relative Operators for Panel-Aware In- Context Image Generation PDF ↗
Sanghyeon Lee, Minwoo Lee, Euijin Shin, Kangyeol Kim, Seunghwan Choi, Jaegul Choo
193
First Frame Is the Place to Go for Video Content Customization PDF ↗
Jingxi Chen, Zongxia Li, Zhichao Liu, Guangyao Shi, Xiyang Wu, Fuxiao Liu, Cornelia Fermüller, Brandon Y. Feng, Yiannis Aloimonos
194
Scaling Zero-Shot Reference-to-Video Generation PDF ↗
Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming Ren, Zhiheng Liu, Xiaoke Huang, Kam-Woh Ng, Tian Xie, Xiao Han, Yuren Cong, Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, Sen He
195
MotionEdit: Benchmarking and Learning Motion-Centric Image Editing PDF ↗
Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu
196
VDOT: Efficient Unified Video Creation via Optimal Transport Distillation PDF ↗
Yutong Wang, Haiyu Zhang, Tianfan Xue, Yu Qiao, Yaohui Wang, Chang Xu, Xinyuan Chen
197
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs PDF ↗
Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo
198
RunawayEvil: Jailbreaking the Image-to-Video Generative Models PDF ↗
Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan
199
MultiAnimate: Pose-Guided Image Animation Made Extensible PDF ↗
Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu
200
Translating Signals to Languages for sEMG-Based Activity Recognition PDF ↗
Ming Wang, Haoxuan Qu, Qiuhong Ke, Wei Zhou, Hossein Rahmani, Jun Liu
201
Open the Motion Door: Atomic Motion Decomposition and Recomposition for Open-Vocabulary Motion Generation PDF ↗
Ke Fan, Jiangning Zhang, Ran Yi, Jingyu Gong, Yabiao Wang, Yating Wang, Xin Tan, Chengjie Wang, Lizhuang Ma
202
Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment PDF ↗
Xiaodong Chen, Qian Bao, Xudong Liu, Jianping Fang, Jintao Fang, Yongdong Zhang, Tao Mei, Wu Liu
203
MotionHiFlow: Text-to-Motion via Hierarchical Flow Matching PDF ↗
Heng Li, Xiaotong Lin, Ling-An Zeng, Yulei Kang, Shuai Li, Jian-Fang Hu
204
LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference PDF ↗
Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen
205
Accelerating Diffusion via Hybrid Data-Pipeline Parallelism Based on Conditional Guidance Scheduling PDF ↗
Euisoo Jung, Byunghyun Kim, Hyunjin Kim, Seonghye Cho, Jae-Gil Lee
206
GVIS: Generative Vector Image Steganography PDF ↗
Zihao Xu, Dawei Xu, Zihan Li, Xixi Zheng, Chuan Zhang
207
MaxMark: High-Capacity Diffusion-Native Watermarking via Robust and Invertible Latent Embedding PDF ↗
Xuanhang Chang, Zhonghao Yang, Cheng Zhuo, Yu Li
208
GeoRK2: Geometry-Guided Runge–Kutta Integration for Diffusion Transformer Acceleration PDF ↗
Chaoqun Sun, Zongjing Fu, Powei Chang, Jinpeng Zhang, Jianxiang Xiang, Yukang Gao, Chenyu Wang
209
Test-time Sparsity for Extreme Fast Action Diffusion PDF ↗
Kangye Ji, Yuan Meng, Jianbo Zhou, Ye Li, Chen Tang, Zhi Wang
210
Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers PDF ↗
Yifan Zhou, Zeqi Xiao, Tianyi Wei, Shuai Yang, Xingang Pan
211
A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation PDF ↗
Wentao Qu, Guofeng Mei, Yang Wu, YongShun Gong, Xiaoshui Huang, Liang Xiao
212
When Local Rules Create Global Order: Self-Organized Representation Learning for Latent Diffusion Models PDF ↗
Junrong Lian, Weijian Deng, Pengxu Wei, Yaqin Chen, Qixiang Ye, Liang Lin
213
ViStoryBench: Comprehensive Benchmark Suite for Story Visualization PDF ↗
Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, Chi Zhang
214
R4-CGQA: Retrieval-based Vision Language Models for Computer Graphics Image Quality Assessment PDF ↗
Zhuangzi Li, Jian Jin, Shilv Cai, Weisi Lin
215
A³: Towards Advertising Aesthetic Assessment
Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai
216
GraphVLM: Benchmarking Vision Language Models for Multimodal Graph Learning PDF ↗
Jiajin Liu, Dongzhe Fan, Chuanhao Ji, Daochen Zha, Qiaoyu Tan
217
Phrase-Grounding-Aware Supervised Fine-Tuning for Chart Recognition via Side-Masked Attention PDF ↗
Koichiro Ito
218
VL-RouterBench: A Benchmark for Vision–Language Model Routing PDF ↗
Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang
219
CLIP Is Shortsighted: Paying Attention Beyond the First Sentence PDF ↗
Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander
220
G^2VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning PDF ↗
Wenbo Hu, Jingli Lin, Yilin Long, Yunlong Ran, Lihan Jiang, Yifan Wang, Chenming Zhu, Runsen Xu, Tai Wang, Jiangmiao Pang
221
UZ3DVG: Unaided Zero-Shot 3D Visual Grounding with Generated Language Conditions PDF ↗
Wenbin Tan, Jiawen Lin, Yuan Xie, Yachao Zhang, Yanyun Qu
222
LangField4D: Learning Identity-Adaptive and Spatio-Temporal Continuous 4D Language Fields for Dynamic Scenes PDF ↗
Yichao Xu, Qiaowei Miao, Jinsheng Quan, Wei Yang, Zhihui Li, Yawei Luo
223
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning PDF ↗
Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang
224
CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation PDF ↗
Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee
225
GeoTikzBridge: Advancing Multimodal Code Generation for Geometric Perception and Reasoning PDF ↗
Jiayin Sun, Caixia Sun, Boyu Yang, Hailin Li, Xiao Chen, Yi Zhang, Errui Ding, Liang Li, Chao Deng, Junlan Feng
226
Keep it SymPL: Symbolic Projective Layout for Allocentric Spatial Reasoning in Vision-Language Models PDF ↗
Jaeyun Jang, Seunghui Shin, Taeho Park, Hyoseok Hwang
227
Geometry-Guided 3D Visual Token Pruning for Video-Language Models PDF ↗
Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu
228
Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation PDF ↗
Won Shik Jang, Ue-Hwan Kim
229
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models PDF ↗
Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi
230
PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning PDF ↗
Zekai Lin, Xu Zheng
231
Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning PDF ↗
Ruoran Xu, Haoyu Cheng, Bin Dong, Qiufeng Wang
232
Direction-aware 3D Large Multimodal Models PDF ↗
Quan Liu, Weihao Xuan, Junjue Wang, Naoto Yokoya, Ling Shao, Shijian Lu
233
CLAY: Conditional Visual Similarity Modulation in Vision-Language Embedding Space PDF ↗
Sohwi Lim, Lee Hyoseok, Jungjoon Park, Tae-Hyun Oh
234
Tackling Alignment Ambiguity in Person Retrieval through Conversational Attribute Mining PDF ↗
Hao Zou, Runqing Zhang, Jin Ding, Xue Zhou, Jianxiao Zou, Mingzhu Cai
235
Beyond Global Similarity: Multi-Conditional Retrieval for Fine-Grained Cross-Modal Understanding PDF ↗
Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen
236
Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval PDF ↗
Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen
237
What Is the Optimal Ranking Score Between Precision and Recall? We Can Always Find It and It Is Rarely F1 PDF ↗
Sébastien Piérard, Adrien Deliège, Marc Van Droogenbroeck
238
Robust Remote Sensing Image–Text Retrieval with Noisy Correspondence PDF ↗
Qiya Song, Yiqiang Xie, Yuan Sun, Renwei Dian, Xudong Kang
239
PinPoint: Evaluation of Composed Image Retrieval with Explicit Negatives, Multi-Image Queries, and Paraphrase Testing PDF ↗
Rohan Mahadev, Joyce Yuan, Patrick Poirson, David Xue, Hao-Yu Wu, Dmitry Kislyuk
240
Single-step Diffusion-based Video Coding with Semantic-Temporal Guidance PDF ↗
Naifu Xue, Zhaoyang Jia, Jiahao Li, Bin Li, Zihan Zheng, Yuan Zhang, Yan Lu
241
Memory Matters: Boosting Training-Free Zero-Shot Temporal Action Localization with a Learnable Lookup Table PDF ↗
Han Jiang, Haoyu Tang, Xiaoxuan Mu, Chen Li, Jihua Zhu
242
TVHighlights: LLM-Guided Human-Free Collaborative Training for Video Highlight Detection in Movies and TV Dramas PDF ↗
Qi Qiu, Xuan Wu, Jiawei Peng, Yuan Miao, Xu Yang, Yanlong Du
243
Color When It Counts: Grayscale-Guided Online Triggering for Always-On Streaming Video Sensing PDF ↗
Weitong Cai, Hang Zhang, Yukai Huang, Shitong Sun, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang
244
Reinforcing Structured Chain-of-Thought for Video Understanding PDF ↗
Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu
245
FlexiVideo: Variation-Aware Temporal Dynamics Modeling for Efficient Video Understanding PDF ↗
Da Peng, Xuesong Yang, Zonghao Guo, Yichen Zhang, Chi Chen, Yidan Zhang, Yuan Yao, Fang Wan, Wei Ke, Maosong Sun
246
MS-Temba: Multi-Scale Temporal Mamba for Understanding Long Untrimmed Videos PDF ↗
Arkaprava Sinha, Monish Soundar Raj, Pu Wang, Ahmed Helmy, Hieu Le, Srijan Das
247
Learning Effective Sign Features without Text for Gloss-free Sign Language Translation PDF ↗
Shiwei Gan, Xiao Liu, Yafeng Yin, Nan Liu, Kuizhuang Liu, Desibieer Tuerdaken, Zhiwei Jiang, Lei Xie, Sanglu Lu, Hongkai Wen
248
META: Meta Evolution of Tool Trajectory Adaptation for Long-Video Understanding PDF ↗
Jing Huang, Luyuan Chen, Zhijie Xu, Yadong Li, Xingzhong Xu, Siye Chen, Jie Liu, Ming Kong, Qiang Zhu
249
GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling PDF ↗
Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang
250
Local Motion Matters: A Deconstruct–Recompose Paradigm for Reinforcement Learning Pre-training from Videos PDF ↗
Jinwen Wang, Youfang Lin, Xiaobo Hu, Shuo Wang, Kai Lv
251
Align Once to Explain: Feature Alignment for Scalable B-cosification of Foundational Vision Transformers PDF ↗
Raphael Maser, Siddhartha Gairola, Sukrut Rao, Bernt Schiele
252
Rounded or Streamlined Head? Bridging Concept Bottleneck Models and Attribute-Described Object Parts PDF ↗
Yang Liu, Jiajin Zhang, Yaojun Hu, Bingguang Hao, Xin Cao, Yingda Xia, Danyang Tu, Shi Gu, Ling Zhang
253
CIGMA: Causal Information-Gain Mechanistic Attribution of Attention Heads in Vision Transformers PDF ↗
Maisha Maliha, Dean F. Hougen
254
Rethinking Concept Bottleneck Models: From Pitfalls to Solutions PDF ↗
Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas
255
Make it SING: Analyzing Semantic Invariants in Classifiers PDF ↗
Harel Yadid, Meir Yossef Levi, Roy Betser, Guy Gilboa
256
Back to the Feature: Explaining Video Classifiers with Video Counterfactual Explanations PDF ↗
Chao Wang, Chengan Che, Xinyue Chen, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera
257
LEADER: Learning Reliable Local-to-Global Correspondences for LiDAR Relocalization PDF ↗
Jianshi Wu, Minghang Zhu, Dunqiang Liu, Wen Li, Sheng Ao, Siqi Shen, Chenglu Wen, Cheng Wang
258
UniCorrn: Unified Correspondence Transformer Across 2D and 3D PDF ↗
Prajnan Goswami, Tianye Ding, Feng Liu, Huaizu Jiang
259
Probabilistic Discrepancy Learning for Roadside LiDAR Scene Completion PDF ↗
Xiaogang Wu, Jinchao Hu, Zixian Wang, Dun Liu, BoXiang Cheng, Yiqiang Wu
260
TACO: Task-Aware Contrastive Learning for Joint LiDAR Localization and 3D Object Detection PDF ↗
Leyuan Xing, Huanjia Zhang, Dongyu Pan, Hai Wu, Qiming Xia, Kezheng Xiong, Wen Li, Chenglu Wen, Cheng Wang
261
Adapting Point Cloud Analysis via Multimodal Bayesian Distribution Learning PDF ↗
Xingyu Zhu, Liang Yi, Shuo Wang, Wenbo Zhu, Yongliang Wu, Beier Zhu, Hanwang Zhang
262
Learning Coordinate-based Convolutional Kernels for Continuous SE(3) Equivariant and Efficient Point Cloud Analysis PDF ↗
Jaein Kim, Hee Bin Yoo, Dong-Sig Han, Byoung-Tak Zhang
263
R3-PCQA: Ray-Reprojection-Reinforcement for No-Reference 3D Point Cloud Quality Assessment PDF ↗
Junhyuk Seo, Sanghyuk Seo, Dawoon Kim, Heeseok Oh
264
Geometric-Aware Hypergraph Reasoning for Novel Class Discovery in Point Cloud Segmentation PDF ↗
Zihao Zhang, Aming Wu, Yang Li, Yahong Han, Jialie Shen
265
PointCSP: Cross-Sample Semantic Propagation and Stability Preservation in Self-Supervised Point Cloud Learning PDF ↗
Xinxing Yu, Ajian Liu, Sunyuan Qiang, Hui Ma, Liying Yang, Yuzhong Wang, Zhi Rao, Yanyan Liang
266
U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences PDF ↗
Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu
267
TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR PDF ↗
T ed Lentsch, Santiago Montiel-Marín, Holger Caesar, Dariu M. Gavrila
268
Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention PDF ↗
Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Ma Jun, Jie Yu
269
UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register PDF ↗
Congpei Qiu, Zhaoyu Hu, Wei Ke, Zhuotao Tian, Yanhao Wu, Tong Zhang
270
SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models PDF ↗
Sofian Chaybouti, Sanath Narayan, Yasser Dahou, Phúc H. Lê Khắc, Ankit Singh, Ngoc Huynh, Wamiq Reyaz Para, Hilde Kuehne, Hakim Hacid
271
Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection PDF ↗
Xu Zhang, Zhe Chen, Jing Zhang, Dacheng Tao
272
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning PDF ↗
Zebin You, Shen Nie, Xiaolu Zhang, JUN ZHOU, Zhiwu Lu, Ji-Rong Wen, Chongxuan Li
273
AVION: Aerial Vision–Language Instruction from Offline Teacher to Prompt-Tuned Network PDF ↗
Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi
274
CrossVL: Complexity-Aware Feature Routing and Paired Curriculum for Cross-View Vision-Language Detection PDF ↗
Zhipeng Liu, Chunbo Luo
275
Masking Teacher and Reinforcing Student for Distilling Vision-Language Models PDF ↗
Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma
276
Role-SynthCLIP: A Role-Play Driven Diverse Synthetic Data Approach PDF ↗
Yuanxiang Huangfu, Chaochao Wang, Weilei Wang
277
BiMotion: B-spline Motion for Text-guided Dynamic 3D Character Generation PDF ↗
Miaowei Wang, Qingxuan Yan, Zhi Cao, Yayuan Li, Oisin Mac Aodha, Jason J Corso, Amir Vaxman
278
PSDesigner: Automated Graphic Design with a Human-Like Creative Workflow PDF ↗
Xincheng Shuai, Song Tang, Yutong Huang, Henghui Ding, Dacheng Tao
279
CADFS: A Big CAD Program Dataset and Framework for Computer- Aided Design with Large Language Models PDF ↗
Vladislav Pyatov, Gleb Bobrovskikh, Saveliy Galochkin, Nikita Boldyrev, Oleg Voynov, Alexander Filippov, Gonzalo Ferrer, Peter Wonka, Evgeny Burnaev
280
MapRoute:Precise-Concept Erasing Mappers via Semantic Routing PDF ↗
Sihao Li, Baixi Liang, Shuohong Xia, Yunyun Yang
281
PhotoFramer: Multi-modal Image Composition Instruction PDF ↗
Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang
282
Can We Build Scene Graphs, Not Classify Them? FlowSG: Progressive Image-Conditioned Scene Graph Generation with Flow Matching PDF ↗
Xin Hu, Ke Qin, Wen Yin, Yuan-Fang Li, Ming Li, Tao He
283
DuetSVG: Unified Multimodal SVG Generation with Internal Visual Guidance PDF ↗
Peiying Zhang, Nanxuan Zhao, Matthew Fisher, Yiran Xu, Jing Liao, Difan Liu
284
Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models PDF ↗
Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen
285
Frequency-domain Manipulation for Face Obfuscation PDF ↗
Jintae Kim, Keunsoo Ko, Chang-Su Kim
286
Towards Reasoning-Preserving Unlearning in Multimodal Large Language Models PDF ↗
Hongji Li, Manjiang Yu, Junchi Yao, Priyanka Singh, Xue Li, Di Wang, Lijie Hu
287
Erasing Thousands of Concepts: Towards Scalable and Practical Concept Erasure for Text-to-Image Diffusion Models PDF ↗
Hoigi Seo, Byung Hyun Lee, Jaehyun Cho, Sungjin Lim, Se Young Chun
288
POUR: A Provably Optimal Method for Unlearning Representation via Neural Collapse PDF ↗
Anjie Le, Can Peng, Yuyuan Liu, J. Alison Noble
289
Do Vision-Language Models Leak What They Learn? Adaptive Token- Weighted Model Inversion Attacks PDF ↗
Ngoc-Bao Nguyen, Sy-Tuyen Ho, Koh Jun Hao, Ngai-Man Cheung
290
Protego: User-Centric Pose-Invariant Privacy Protection Against Face Recognition-Induced Digital Footprint Exposure PDF ↗
Ziling Wang, Shuya Yang, Jialin Lu, Ka-Ho Chow
291
SPDMark: Selective Parameter Displacement for Robust Video Watermarking PDF ↗
Samar Fares, Nurbek Tastan, Karthik Nandakumar
292
Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learning PDF ↗
Xinghao Wu, Jianwei Niu, Xuefeng Liu, Guogang Zhu, Jiayuan Zhang, Shaojie Tang, Wei Chen
293
FedHarmony: Harmonizing Heterogeneous Label Correlations in Federated Multi-Label Learning PDF ↗
Zhiqiang Kou, Junxiang Wu, Wenke Huang, Wenwen He, Ming-Kun Xie, Changwei Wang, Yuheng Jia, Di Jiang, Yang Liu, Xin Geng, Qiang Yang
294
FedSST: Rethinking Fair Federated Graph Learning under Structural Shift PDF ↗
Dingyi Zhao
295
GDFA: Geometry-Driven Federated Unlearning with Directional Task Vector Alignment PDF ↗
Xiuting Weng, Ruizhi Pu, Yuanhang Yao, Kun Yue, Zhiwen Tang, Lixing Yu
296
FedARA: Resource-adaptive Low-rank Personalized Federated Learning via Anchor-driven Representation Alignment on Heterogeneous Edge Devices PDF ↗
Ruonan Zhao, Zheng Wang, Debin Liu, Shijie Lv, Laurence Tianruo Yang
297
InterRVOS: Interaction-Aware Referring Video Object Segmentation PDF ↗
Woojeong Jin, Seongchan Kim, Jaeho Lee, Seungryong Kim
298
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding PDF ↗
Hanqing Liu, Mingjie Liu, Luoping Cui, Endian Lin, Donghong Jiang, Chuang Zhu
299
RegFormer: Transferable Relational Grounding for Efficient Weakly- Supervised Human-Object Interaction Detection PDF ↗
Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim
300
Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding PDF ↗
Jin-Seop Lee, SungJoon Lee, SeongJun Jung, Boyang Li, Jee-Hyong Lee
301
GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding PDF ↗
Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang
302
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs PDF ↗
Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Limin Wang
303
Tokenization Allows Multimodal Large Language Models to Understand, Generate and Edit Architectural Floor Plans PDF ↗
Sizhong Qin, Ramon Elias Weber, Xinzheng Lu
304
MeToM: Metadata-Guided Token Merging for Efficient Video LLMs PDF ↗
Zhuojie Wu, Shijie Wang, Xin Yu
305
Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models PDF ↗
Jinlong Li, Liyuan Jiang, Haonan Zhang, Nicu Sebe
306
VLIC: Vision-Language Models As Perceptual Judges for Human- Aligned Image Compression PDF ↗
Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Y. Zhang
307
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models PDF ↗
Sijie Li, Biao Qian, Jungong Han
308
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding PDF ↗
Fatih Ilhan, Gaowen Liu, Ramana Rao Kompella, Selim Furkan Tekin, Tiansheng Huang, Zachary Yahn, Yichang Xu, Ling Liu
309
CoIn: Coverage and Informativeness-Guided Token Reduction for Efficient Large Multimodal Models PDF ↗
Chenxi Du, Yongheng Deng, Jiani Liu, Yujia Zhang, Xi Chen, Ju Ren
310
TAMER: A Tri-Modal Contrastive Alignment and Multi-Scale Embedding Refinement Framework for Zero-Shot ECG Diagnosis PDF ↗
Xuewei Zhou, Yajie Meng, Pan Zeng, Xianfang Tang, Feifei Cui, Qiangguo Jin, Jialiang Yang, Junlin Xu
311
Your Dissimilarities Define You: Complementary Learning Exploiting Class Diversities PDF ↗
Dimitrios Katsikas, Nikolaos Passalis, Anastasios Tefas
312
CGU-Bayes: Causal Graph Uncertainty-Guided Bayesian Inference for Domain Generalization PDF ↗
Naiyu Yin, Hanjing Wang, Yue Yu, Tian Gao, Amit Dhurandhar, Chung-Hao Lee, Qiang Ji
313
Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning PDF ↗
Shashanka Venkataramanan, Valentinos Pariza, Mohammadreza Salehi, Lukas Knobel, Elias Ramzi, Spyros Gidaris, Andrei Bursuc, Yuki M Asano
314
Towards Stable Self-Supervised Object Representations in Unconstrained Egocentric Video PDF ↗
Yuting Tan, Xilong Cheng, Yunxiao Qin, Zhengnan Li, Jingjing Zhang
315
LRDUN: A Low-Rank Deep Unfolding Network for Efficient Spectral Compressive Imaging PDF ↗
He Huang, Yujun Guo, Wei He
316
Neural Collapse in Test-Time Adaptation PDF ↗
Xiao Chen, Zhongjing Du, Jiazhen Huang, Xu Jiang, Li Lu, Jingyan Jiang, Zhi Wang
317
CLEX: Complementary Label Exchange Learning for Noisy Facial Expression Recognition PDF ↗
Lin Wang, Fang Liu, Xiaofen Xing, Kailing Guo, Xiangmin Xu
318
TruckDrive: Long-Range Autonomous Highway Driving Dataset PDF ↗
Filippo Ghilotti, Edoardo Palladin, Samuel Brucker, Adam Sigal, Mario Bijelic, Felix Heide
319
Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control PDF ↗
Zhuoli Zhuang, Yu-Cheng Chang, Yu-Kai Wang, Thomas Do, Chin-Teng Lin
320
E3AD: An Emotion-Aware Vision-Language-Action Model for Human- Centric End-to-End Autonomous Driving PDF ↗
Yihong Tang, Haicheng Liao, Tong Nie, Junlin He, Ao Qu, Kehua Chen, Wei Ma, Zhenning Li, Lijun Sun, Chengzhong Xu
321
The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models PDF ↗
Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang
322
Den-TP: A Density-Balanced Data Curation and Evaluation Framework for Trajectory Prediction PDF ↗
Ruining Yang, Yi Xu, Yun Fu, Lili Su
323
Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving PDF ↗
Jianhua Han, Meng Tian, Jiangtong Zhu, Fan He, Huixin Zhang, Sitong Guo, Dechang Zhu, Hao Tang, Pei Xu, Yuze Guo, Minzhe Niu, Haojie Zhu, Qichao Dong, Xuechao Yan, Siyuan Dong, Lu Hou, Qingqiu Huang, Xiaosong Jia, Hang Xu
324
GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation PDF ↗
Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang
325
Mind the Hitch: Dynamic Calibration and Articulated Perception for Autonomous Trucks PDF ↗
Morui Zhu, Yongqi Zhu, Song Fu, Qing Yang
326
DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving PDF ↗
Zhenjie Yang, Yilin Chai, Xiaosong Jia, Qifeng Li, Yuqian Shao, Xuekai Zhu, Haisheng Su, Junchi Yan
327
Beyond Rule-Based Agents: Active Markov Games for Realistic Multi- Agent Interaction in Autonomous Driving PDF ↗
Yuan Gui, Hongchen Luo, Jiao Wang, Liqi Qu
328
Test-Time Multi-Prompt Adaptation for Open-Vocabulary Remote Sensing Image Segmentation PDF ↗
Ting Yang, Qilong Wang, Qibin Hou, Qinghua Hu
329
ReScene4D: Temporally Consistent Semantic Instance Segmentation of Evolving Indoor 3D Scenes PDF ↗
Emily Steiner, Jianhao Zheng, Henry Howard-Jenkins, Chris Xie, Iro Armeni
330
CrackSSM: Reviving SSMs for Crack Segmentation via Dynamic Scanning PDF ↗
Yubin Gu, Boyang Hou, Yuan Meng, Wenting Luo, Jiayi Ji, Xiaoshuai Sun
331
BiPA: Bilevel Prompt Adaptation for Underwater Instance Segmentation PDF ↗
Long Ma, Haoze Zheng, Yuhang Mao, Jinyuan Liu, Chengpei Xu, Xinwei Xue, Yi Wang, Xiangjian He, Weimin Wang
332
RS-SSM: Refining Forgotten Specifics in State Space Model for Video Semantic Segmentation PDF ↗
Kai Zhu, Zhenyu Cui, Zehua Zang, Jiahuan Zhou
333
Scene-Centric Unsupervised Video Panoptic Segmentation PDF ↗
Christoph Reich, Oliver Hahn, Nikita Araslanov, Laura Leal-Taixé, Christian Rupprecht, Daniel Cremers, Stefan Roth
334
Bootstrapping Video Semantic Segmentation Model via Distillation- assisted Test-Time Adaptation PDF ↗
Jihun Kim, Hoyong Kwon, Hyeokjun Kweon, Kuk-Jin Yoon
335
GeoFree-CoSeg: Unsupervised Point Cloud-Image Cross-Modal Co-Segmentation Without Geometric Alignment PDF ↗
Xin Duan, Xiabi Liu, Liyuan Pan
336
Parameter-efficient Continual Learning for Enhancing Plasticity without Forgetting under Limited Model Capacity PDF ↗
Yitian Chen, Shigeng Zhang, Xuan Liu, Mingming Lu, Kai Chen, Hongye Zhu, Xinning Chen
337
Dual-Estimator: Decoupling Global and Local Semantic Shift for Drift Compensation in Class-Incremental Learning PDF ↗
Fankang Xu, Lu Jin, Yanpeng Sun, Shiyu Xuan, Zechao Li
338
Continual Distillation of Teachers from Different Domains PDF ↗
Nicolas Michel, Maorong Wang, Jiangpeng He, Toshihiko Yamasaki
339
Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance PDF ↗
Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang
340
Learning from Itself: Mining Internal Knowledge from Vision Language Models for Continual Learning PDF ↗
Yizheng Gong, Siyue Yu, Waleed Al-Nuaimy, Jimin Xiao
341
AdaPrior: Bayesian-Inspired Adaptive Prior Correction for Long- Tailed Continual Learning PDF ↗
S Divakar Bhat, Amit Popat More, Mudit Soni, Bhuvan Aggarwal
342
An Optimal Transport-driven Approach for Cultivating Latent Space in Online Incremental Learning PDF ↗
Quyen Tran, Hai Nguyen, Quan Dao, Hoang Phan, Linh Van, Khoat Than, Dinh Phung, Dimitris Metaxas, Trung Le
343
HAD: Heterogeneity-Aware Distillation for Lifelong Heterogeneous Learning PDF ↗
Xuerui Zhang, Xuehao Wang, Zhan Zhuang, Linglan Zhao, Ziyue Li, Xinmin Zhang, Zhihuan Song, Yu Zhang
344
U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation PDF ↗
Xiang Deng, Feng Gao, Yong Zhang, Youxin Pang, Xu Xiaoming, Zhuoliang Kang, Xiaoming Wei, Yebin Liu
345
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars PDF ↗
Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu
346
FlashLips: 100-FPS Mask-Free Latent Lip-Sync using Reconstruction Instead of Diffusion or GANs PDF ↗
Andreas Zinonos, Michał Stypułkowski, Antoni Bigata, Stavros Petridis, Maja Pantic, Nikita Drobyshev
347
WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering PDF ↗
Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu
348
EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization PDF ↗
Haolan Xu, Keli Cheng, Lei Wang, Ning Bi, Xiaoming Liu
349
DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation PDF ↗
Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ulsan National Institute of Science & Technology blank, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani
350
TRM-VLA: Temporal-Aware Chain-of-Thought Reasoning and Memorization for Vision-Language-Action Models PDF ↗
Xiang Li, Ya-Li Li, Yuan Wang, Shengjin Wang
351
VGGDrive: Empowering Vision-Language Models with Cross-View Geometric Grounding for Autonomous Driving PDF ↗
Jie Wang, Guang Li, Zhijian Huang, Chenxu Dang, Hangjun Ye, Yahong Han, Long Chen
352
NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning PDF ↗
Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan
353
HTNav: A Hybrid Navigation Framework with Tiered Structure for Urban Aerial Vision-and-Language Navigation PDF ↗
Chengjie Fan, Cong Pan, Zijian Liu, Ningzhong Liu, Jie Qin
354
CycleBEV: Regularizing View Transformation Networks via View Cycle Consistency for Bird’s-Eye-View Semantic Segmentation PDF ↗
Jeongbin Hong, Dooseop Choi, Taeg-Hyun An, Kyounghwan An, Kyoung-Wook Min
355
STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction PDF ↗
Jiankuo Zhao, Xiangyu Zhu, Zidu Wang, Zhen Lei
356
CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image PDF ↗
Yizheng Song, Yiyu Zhuang, Qipeng Xu, Haixiang Wang, Jiahe Zhu, Jing Tian, Siyu Zhu, Hao Zhu
357
OMG-Avatar: One-shot Multi-LOD Gaussian Head Avatar PDF ↗
Jianqiang Ren, Lin Liu, Steven Hoi
358
Globally Optimal Pose from Orthographic Silhouettes PDF ↗
Agniva Sengupta, Dilara Kus, Jianning Li, Stefan Zachow
359
AvatarPointillist: AutoRegressive 4D Gaussian Avatarization PDF ↗
Hongyu Liu, Xuan Wang, Zijian Wu, Yating Wang, Ziyu Wan, Yue Ma, Runtao Liu, Boyao Zhou, Yujun Shen, Qifeng Chen
360
COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs PDF ↗
Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua
361
Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding PDF ↗
Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Minquan Lin, Zongyuan Ge
362
AdaIAT: Adaptively Increasing Attention to Generated Text to Alleviate Hallucinations in LVLM PDF ↗
Li'an Zhong, Ziqiang He, Jibin Zheng, Jin Li, Z. Jane Wang, Xiangui Kang
363
HulluEdit: Single-Pass Evidence-Consistent Subspace Editing for Mitigating Hallucinations in Large Vision-Language Models PDF ↗
Yangguang Lin, Quan Fang, Yufei Li, Jiachen Sun, Junyu Gao, Jitao Sang
364
SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding PDF ↗
Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang
365
One Token, Two Fates: A Unified Framework via Vision Token Manipulation Against MLLMs Hallucination PDF ↗
Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Yinghuan Shi
366
EgoX: Egocentric Video Generation from a Single Exocentric Video PDF ↗
Taewoong Kang, Kinam Kim, Dohyeon Kim, Minho Park, Junha Hyung, Jaegul Choo
367
SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation PDF ↗
Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang
368
Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion
Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, Yu-Lun Liu, Yue Wang, Liu Ren
369
SeeU: Seeing the Unseen World via 4D Dynamics-aware Generation PDF ↗
Yu Yuan, Tharindu Wickremasinghe, Zeeshan Nadir, Xijun Wang, Yiheng Chi, Stanley H. Chan
370
ReDirector: Creating Any-Length Video Retakes with Rotary Camera Encoding PDF ↗
Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung, Jong Chul Ye
371
Scaling4D: Pushing the Frontier of Video Novel View Synthesis through Large-Scale Monocular Videos PDF ↗
Hongrui Cai, Junjie Luo, Zhihong Fu, Shengnan Zhu, Jiawei Wen, Wanquan Feng, Songtao Zhao, Qian He
372
PHANTOM: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics PDF ↗
Ying Shen, Jerry Xiong, Tianjiao Yu, Ismini Lourentzou
373
WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling PDF ↗
Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang
374
Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer PDF ↗
Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang
375
SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time PDF ↗
Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang
376
D2FANet: Enhancing Video Object Detection with Dual-Domain Feature Aggregation Network PDF ↗
Qiang Qi, Wenqi Shang, Meifang Wang, Xiao Wang
377
HierUQ: Hierarchical Uncertainty Quantification with Adaptive Granularity Reconciliation for Degraded Image Classification PDF ↗
Yang Chu, Xiaomeng Yang, Keli Deng, Yuntao Qian
378
ID-Sim: An Identity-Focused Similarity Metric PDF ↗
Julia Chae, Nicholas Kolkin, Jui-Hsien Wang, Richard Zhang, Sara Beery, Cusuh Ham
379
Hier-COS: Making Deep Features Hierarchy-aware via Composition of Orthogonal Subspaces PDF ↗
Depanshu Sani, Saket Anand
380
Towards Cross-Modal Preservation, Consistency and Alignment for Privacy-Preserving Visible-Infrared Person Re-Identification PDF ↗
Yudi Xie, Zhongao Zhou, Bin Yang, Zhenghan Chen, Mang Ye
381
Enhancing Mixture-of-Experts Specialization via Cluster-Aware Upcycling PDF ↗
Sanghyeok Chu, Pyunghwan Ahn, Gwangmo Song, Seung Hwan Kim, Honglak Lee, Bohyung Han
382
COPE: Consistent Occlusion and Prompt Enhancement Network for Occluded Person Re-identification PDF ↗
Siyi Sun, Jinliang Lin, Juanjuan Weng, Zhihui Liu, Shaozi Li, Zhiming Luo
383
Assignment-Driven Hash Learning in a Hyper-Semantic Space for On- the-Fly Category Discovery PDF ↗
Kaibing Yang, Yucheng Wang, Tingzhang Luo
384
DyFCLT: Dynamic Frequency-Decoupled Cross-Modal Learning Transformer for Multimodal Tiny Object Detection PDF ↗
Chaolang Li, Pengwen Dai, Jingyu Li, Siyuan Yao, Yuchen Jiang, Zhuoran Zheng
385
EW-DETR: Evolving World Object Detection via Incremental Low-Rank DEtection TRansformer PDF ↗
Munish Monga, Vishal Chudasama, Pankaj Wasnik, C.V. Jawahar
386
Building a Precise Video Language with Human–AI Oversight PDF ↗
Zhiqiu Lin, Siyuan Cen, Chancharik Mitra, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Yili Han, Yilun Du, Deva Ramanan
387
CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection PDF ↗
Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng
388
Towards Sparse Video Understanding and Reasoning PDF ↗
Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu
389
Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding PDF ↗
Jialuo Li, Bin Li, Jiahao Li, Yan Lu
390
MuKV: Multi-Grained KV Cache Compression for Long Streaming Video Question-Answering PDF ↗
Junbin Xiao, Jiajun Chen, Tianxiang Sun, Xun Yang, Angela Yao
391
ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding PDF ↗
Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang
392
TiViBench: Benchmarking Think-in-Video Reasoning for Video Generation PDF ↗
Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, Rongjin Guo, Yu Cheng, Ying-Cong Chen
393
What Are You Doing? A Closer Look at Controllable Human Video Generation PDF ↗
Emanuele Bugliarello, Anurag Arnab, Roni Paiss, Christy Koh, Pieter-Jan Kindermans, Cordelia Schmid
394
Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring PDF ↗
Qizhi Xie, Kun Yuan, Yunpeng Qu, Jiachao Gong, Mingda Wu, Ming Sun, Chao Zhou, Jihong Zhu
395
CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance PDF ↗
Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan
396
Towards Holistic Modeling for Video Frame Interpolation with Auto-regressive Diffusion Transformers PDF ↗
Xinyu Peng, Han Li, Yuyang Huang, Ziyang Zheng, Yaoming Wang, Xin Chen, Wenrui Dai, Chenglin Li, Junni Zou, Hongkai Xiong
397
DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers PDF ↗
Dahye Kim, Deepti Ghadiyaram, Raghudeep Gadde
398
Towards High-resolution and Disentangled Reference-based Sketch Colorization PDF ↗
Dingkun Yan, Xinrui Wang, Ru Wang, Zhuoru Li, Jinze Yu, Yusuke Iwasawa, Yutaka Matsuo, Jiaxian Guo
399
MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation PDF ↗
Yiren Song, Cheng Liu, Mike Zheng Shou
400
Layer-wise Instance Binding for Regional and Occlusion Control in Text-to-Image Diffusion Transformers PDF ↗
Ruidong Chen, Yancheng Bai, Xuanpu Zhang, Jianhao Zeng, Lanjun Wang, Dan Song, Lei Sun, Xiangxiang Chu, Anan Liu
401
Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping PDF ↗
Sunghyun Park, Jeongho Kim, Hyoungwoo Park, Debasmit Das, Sungrack Yun, Munawar Hayat, Jaegul Choo, Fatih Porikli, Seokeon Choi
402
COT-FM: Cluster-wise Optimal Transport Flow Matching PDF ↗
Chiensheng Chiang, Kuan-Hsun Tu, Jia-Wei Liao, Cheng-Fu Chou, Tsung-Wei Ke
403
Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers
Youngjun Jun, Seil Kang, Woojung Han, Seong Jae Hwang
404
Guiding a Diffusion Transformer with the Internal Dynamics of Itself PDF ↗
Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu
405
CoopDiff: A Diffusion-Guided Approach for Cooperation under Corruptions PDF ↗
Gong Chen, Chaokun Zhang, Pengcheng Lv
406
RARE: Learn to RAnk and REtrieve for Monocular 3D Object Detection PDF ↗
Hyeonjeong Park, Peixi Xiong, Xiaoqian Ruan, Dian Jia, Pei Yu, Wei Tang
407
COG: Confidence-aware Optimal Geometric Correspondence for Unsupervised Single-reference Novel Object Pose Estimation PDF ↗
Yuchen Che, Jingtu Wu, Hao Zheng, Asako Kanezaki
408
Learnability-Driven Submodular Optimization for Active Roadside 3D Detection PDF ↗
Ruiyu Mao, Baoming Zhang, Nicholas Ruozzi, Yunhui Guo
409
Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection PDF ↗
Xiang Li, Zhangchi Hu, Xu Xiao, Bin Kong
410
Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception PDF ↗
Jiahao Wang, Zikun Xu, Yuner Zhang, Zhongwei Jiang, Chenyang Lu, Shuocheng Yang, Yuxuan Wang, Jiaru Zhong, Chuang Zhang, Shaobing Xu, Jianqiang Wang
411
Dynamics-Aware Preference Optimization for Vision-Language Models PDF ↗
Jusheng Zhang, Kaitong Cai, Jing Yang, Jian Wang, Keze Wang
412
Selection-as-Nonlinearity: Bridging Attention and Activation via a Joint Game–Decision Lens for Interpretable, Discriminative Visual Representations PDF ↗
Sudong Cai, Shuai Yuan, Bingzhi Chen, Rui Mao, Bing Wang
413
Learning What Helps: Task-Aligned Context Selection for Vision Tasks PDF ↗
Jingyu Guo, Emir Konuk, Fredrik Strand, Christos Matsoukas, Kevin Smith
414
Consensus Entropy: Harnessing Multi-VLM Agreement for Self- Verifying and Self-Improving OCR PDF ↗
Yulong Zhang, Tianyi Liang, Erfei Cui, Guoqing Wang, Xu Guo, Chenhui Li, Gongshen Liu
415
NeuroRule: Bridging Vision and Logic with Differentiable Rule Induction PDF ↗
Muhammad Zarar, Mingzheng Zhang, Xiaowang Zhang, Zhiyong Feng
416
Beyond Graph Model: Reliable VLM Fine-Tuning via Random Graph Adapter PDF ↗
Bo Jiang, Xueyang Ze, Beibei Wang, Xixi Wang, Xixi Wan, Bin Luo
417
Ego: Embedding-Guided Personalization of Vision-Language Models PDF ↗
Soroush Seifi, Simon Gardier, Vaggelis Dorovatas, Daniel Olmeda Reino, Rahaf Aljundi
418
JoPPO: Hierarchical Photography Assessment via Contrastive Joint Conditional Probabilistic Reinforcement Learning PDF ↗
Yifan Yang, Juntuo Wang, Yuming Qiao, Xudong Zhang, Chunyang Yu, Yan Li, Xiao Lin, Liang Luo, Dan Meng
419
AeroAgent: A Vision–Physics–Decision Framework for Aerodynamic Vehicle Design PDF ↗
Ye Liu, Shouyi Liu, Huiyu Yang, Jianghang Gu, Wenhao Fan, Zhongxin Yang, Ding Wang, Simeng Chen, Zirun Jiang, Yuanwei Bin, Shiyi Chen, Yuntian Chen
420
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe PDF ↗
Tianyu Yu, Zefan Wang, Chongyi Wang, Fuwei Huang, Wenshuo Ma, Zhihui He, Tianchi Cai, Weize Chen, Yuxiang Huang, Ranchi Zhao, Bokai Xu, Junbo Cui, Yingjing Xu, Liqing Ruan, Luoyuan Zhang, Hanyu Liu, Jingkun Tang, Hongyuan Liu, Qining Guo, Wenhao Hu, Bingxiang He, Jie Zhou, Jie Cai, Ji Qi, Zonghao Guo, Chi Chen, Guoyang Zeng, Yuxuan Li, Ganqu Cui, Ning Ding, Xu Han, Yuan Yao, Zhiyuan Liu, Maosong Sun
421
Prune Wisely, Reconstruct Sharply: Compact 3D Gaussian Splatting via Adaptive Pruning and Difference-of-Gaussian Primitives PDF ↗
Haoran Wang, Guoxi Huang, Fan Zhang, David Bull, Nantheera Anantrasirichai
422
MSCD-GS: Motion-Separated Cooperative Deblurring Dynamic Reconstruction via Gaussian Splatting PDF ↗
Yongjian Liao, Xu Zou, Wenjun Chen, Huixuan Li, Xiaoen Xie, Chunxi Li, Shixiang Huang, Gang Zhang, Jiahuan Zhou, Sheng Zhong, Luxin Yan
423
P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction PDF ↗
Kota Shimomura, Hidehisa Arai, Tsubasa Takahashi, Takayoshi Yamashita, Hironobu Fujiyoshi
424
iSplat: Iterative Learning for Fine-Grained Gaussian Splatting PDF ↗
Haifeng Wu, Wei Long, Shuhang Gu, Lixin Duan, Wen Li
425
Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting PDF ↗
Arthur Moreau, Richard Shaw, Michal Nazarczuk, Jisu Shin, Thomas Tanay, Zhensong Zhang, Songcen Xu, Eduardo Pérez-Pellitero
426
MAPo: Motion-Aware Partitioning of Deformable 3D Gaussian Splatting for High-Fidelity Dynamic Scene Reconstruction PDF ↗
Han Jiao, Jiakai Sun, Yexing Xu, Lei Zhao, Wei Xing, Huaizhong Lin
427
FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario PDF ↗
Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong
428
HeroGS: Hierarchical Guidance for Robust 3D Gaussian Splatting under Sparse Views PDF ↗
Jiashu Li, Xumeng Han, Zhaoyang Wei, Zipeng Wang, Kuiran Wang, Guorong Li, Zhenjun Han, Jianbin Jiao
429
SharpTimeGS: Sharp and Stable Dynamic Gaussian Splatting via Lifespan Modulation PDF ↗
Zhanfeng Liao, Jiajun Zhang, Hanzhang Tu, Zhixi Wang, Yunqi Gao, Hongwen Zhang, Yebin Liu
430
Physically Inspired Gaussian Splatting for HDR Novel View Synthesis PDF ↗
Huimin Zeng, Yue Bai, Hailing Wang, Yun Fu
431
PhysIR-Splat: Physically Consistent Thermal Infrared Radiative Transfer in 3D Gaussian Splatting PDF ↗
Jingyuan Gao, Yumeng Hu, Fei Gao, Mingjin Zhang
432
4C4D: 4 Camera 4D Gaussian Splatting PDF ↗
Junsheng Zhou, Zhifan Yang, Liang Han, Wenyuan Zhang, Kanle Shi, Shenkun Xu, Yu-Shen Liu
433
SplatSuRe: Selective Super-Resolution for Multi-view Consistent 3D Gaussian Splatting PDF ↗
Pranav Asthana, Alex Hanson, Allen Tu, Tom Goldstein, Matthias Zwicker, Amitabh Varshney
434
GaussianZoom: Progressive Zoom-in Generative 3D Gaussian Splatting with Geometric and Semantic Guidance PDF ↗
Jiale Shi, Jiarui Hu, Zesong Yang, Kaixuan Luan, Hujun Bao, Zhaopeng Cui
435
MotionScale: Reconstructing Appearance, Geometry, and Motion of Dynamic Scenes with Scalable 4D Gaussian Splatting PDF ↗
Haoran Zhou, Gim Hee Lee
436
PRIMU: Uncertainty Estimation for Novel Views in Gaussian Splatting from Primitive-Based Representations of Error and Coverage PDF ↗
Thomas Gottwald, Edgar Heinert, Peter Stehr, Chamuditha Jayanga Galappaththige, Matthias Rottmann
437
TGSFormer: Scalable Temporal Gaussian Splatting for Embodied Semantic Scene Completion PDF ↗
Rui Qian, Haozhi Cao, Tianchen Deng, Tianxin Hu, Weixiang Guo, Shenghai Yuan, Lihua Xie
438
Disco-GS: Gaussian Splatting in Dynamic Color Lighting PDF ↗
Ashish Kumar, A. N. Rajagopalan
439
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering PDF ↗
Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara
440
GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision PDF ↗
Yuxiao Xiang, Junchi Chen, Zhenchao Jin, Changtao Miao, Haojie Yuan, Qi Chu, Tao Gong, Nenghai Yu
441
AdaptVision: Efficient Vision-Language Models via Adaptive Visual Acquisition PDF ↗
Zichuan Lin, Yicheng Liu, Yang Yang, Lvfang Tao, Deheng Ye
442
See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs PDF ↗
Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen
443
Will Multimodal Models Be Dazzled by Multi-Image Visual Puzzles? PDF ↗
Zhi Zhu, YaoQi Fan, Zhe Chen, Yue Cao, Yangzhou Liu, Tong Lu
444
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking PDF ↗
Yufei Zhan, Ziheng Wu, Yousong Zhu, Rongkun Xue, Guanghao Zhou, Ruipu Luo, Zhenghao Chen, Can Zhang, Yifan Li, Zhentao He, Zheming Yang, Ming Tang, Minghui Qiu, Jinqiao Wang
445
Visual Grounding for Object Questions PDF ↗
Martin Nicolas Everaert, Xiruo Liu, Hiroyuki Takeda, Raja Bala, Vivek Yadav, Vidya Narayanan
446
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning PDF ↗
Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang
447
What Do Visual Tokens Really Encode? Uncovering Sparsity and Redundancy in Multimodal Large Language Models PDF ↗
Yingqi Fan, Junlong Tong, Anhao Zhao, Xiaoyu Shen
448
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models PDF ↗
Jialiang Zhang, Junlong Tong, Junyan Lin, Hao Wu, Yirong Sun, Yunpu Ma, Xiaoyu Shen
449
Stable and Efficient Single-Rollout RL for Multimodal Reasoning PDF ↗
Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu
450
Revisiting the Necessity of Lengthy Chain-of-Thought in Vision- centric Reasoning Generalization PDF ↗
Yifan Du, Kun Zhou, Yingqian Min, Yue Ling, Wayne Xin Zhao, Youbin Wu, Ji-Rong Wen
451
Monet: Reasoning in Latent Visual Space Beyond Image and Language PDF ↗
Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, Yisen Wang
452
STAR-R1: Multi-View Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs PDF ↗
Zongzhao Li, Zongyang Ma, Mingze Li, Songyou Li, Yu Rong, Tingyang Xu, Ziqi Zhang, Deli Zhao, Wenbing Huang
453
From Where Things Are to What They Are For: Benchmarking Spatial– Functional Intelligence in Multimodal LLMs PDF ↗
Le Zhang, Jihan Yang, Soundarya Krishnan, Jimit Majmudar, Xiou Ge, Prasoon Puri, Prathamesh Saraf, Shruti Bhargava, Dhivya Piraviperumal, Yinan Ling, Cindy Pan, Hong Yu, Aishwarya Agrawal, Bo-Hsiang Tseng
454
Deeper Thought, Weaker Aim: Understanding and Mitigating Perceptual Impairment during Reasoning in Multimodal Large Language Models PDF ↗
Ruiying Peng, Xueyu Wu, Jing Lei, Lu Hou, Yuanzheng Ma, Xiao-Hui Li
455
S2D: Selective Spectral Decay for Quantization-Friendly Conditioning of Neural Activations PDF ↗
Arnav Chavan, Nahush Lele, Udbhav Bamba, Sankalp Dayal, Aditi Raghunathan, Deepak Gupta
456
OneSparse: A Unified Framework for Sparse Activation Layers in Vision Models PDF ↗
Xingkui Zhu, Dingkang Liang, Cheng Chen, Daoxin Zhang, lv Hanxiang, Zhe Xu, Yao Hu, Xiang Bai
457
What Matters in Practical Learned Image Compression PDF ↗
Kedar Tatwawadi, Parisa Rahimzadeh, Zhanghao Sun, Zhiqi Chen, Ziyun Yang, Sanjay Nair, Divija Hasteer, Oren Rippel
458
BinaryAttention: One-Bit QK-Attention for Vision and Diffusion Transformers PDF ↗
Chaodong Xiao, Zhengqiang Zhang, Lei Zhang
459
Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder PDF ↗
Tianyu Zhang, Dong Liu, Chang Wen Chen
460
LazyVAR: Accelerating Visual Autoregressive Models via Scale-wise Token Pruning and Parallel Group Decoding PDF ↗
Rongge Mao, Chengqi Dong, S Kevin Zhou
461
Spk2VidNet: A Hierarchical Recurrent Architecture for High-Fidelity Video Reconstruction from Long Spike-Camera Streams PDF ↗
Yuanlin Wang, Ruiqin Xiong, Jiyu Xie, Zhenkun Zhu, Zhaofei Yu, Xiaopeng Fan, Tiejun Huang
462
Adaptive Learned Image Compression with Graph Neural Networks PDF ↗
Yunuo Chen, Bing He, Zezheng Lyu, Hongwei Hu, Qunshan Gu, Yuan Tian, Guo Lu
463
SGI: Structured 2D Gaussians for Efficient and Compact Large Image Representation PDF ↗
Zixuan Pan, Kaiyuan Tang, Jun Xia, Yifan Qin, Lin Gu, Chaoli Wang, Jianxu Chen, Yiyu Shi
464
VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping PDF ↗
Haotian Dong, Ye Li, Rongwei Lu, Chen Tang, Shu-Tao Xia, Zhi Wang
465
HypeVPR: Exploring Hyperbolic Space for Perspective to Equirectangular Visual Place Recognition PDF ↗
Suhan Woo, Seongwon Lee, Jinwoo Jang, Euntai Kim
466
LoD-Loc v3: Generalized Aerial Localization in Dense Cities using Instance Silhouette Alignment PDF ↗
Shuaibang Peng, Juelin Zhu, Xia Li, Kun Yang, Yu Liu, Maojun Zhang, Shen Yan
467
CoLoR: The Devil is in Scene Coordinate Regression for Large-Scale Visual Localization PDF ↗
Xindong Mao, Hang Li, Yuchen Wu, Jiahe Li, Xiao Bai, Jin Zheng
468
Affine Perspective-Three-Point Problem PDF ↗
Gaku Nakano
469
Sky2Ground: A Benchmark for Site Modeling under Varying Altitude PDF ↗
Zengyan Wang, Sirshapan Mitra, Rajat Modi, Hui Lim, Yogesh Rawat
470
SemanticVLA: Towards Semantic Reasoning over Action Memorization via Synergistic Explicit Trace and Latent Action Planning PDF ↗
Fei Ni, Zhuo Chen, Yifu Yuan, Zibin Dong, Xianze Yao, Shan Luo, Jianye Hao, Jiankang Deng, Stefanos Zafeiriou
471
WebGym: Scaling Training Environments for Long-Horizon Visual Web Agents with Realistic Tasks PDF ↗
Hao Bai, Alexey Taymanov, Tong Zhang, Aviral Kumar, Spencer Whitehead
472
Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs PDF ↗
Jingze Wu, Quan Zhang, Hongfei Suo, Zeqiang Cai, Hongbo Chen
473
APPO: Attention-guided Perception Policy Optimization for Video Reasoning PDF ↗
Henghui Du, Chang Zhou, Xi Chen, Di Hu
474
RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward PDF ↗
Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao
475
EVA: Efficient Reinforcement Learning for End-to-End Video Agent PDF ↗
Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan Duan, Hao Lu, Hanming Deng, Lewei Lu
476
Visual Document Understanding and Reasoning: A Multi-Agent Collaboration Framework with Agent-Wise Adaptive Test-Time Scaling PDF ↗
Xinlei Yu, Chengming Xu, Zhangquan Chen, Yudong Zhang, Shilin Lu, Cheng Yang, Jiangning Zhang, Shuicheng Yan, Xiaobin Hu
477
GazeOnce360: Fisheye-Based 360° Multi-Person Gaze Estimation with Global–Local Feature Fusion
Zhuojiang Cai, Zhenghui Sun, Feng Lu
478
Bridging Human Evaluation to Infrared and Visible Image Fusion PDF ↗
Jinyuan Liu, Xingyuan Li, Qingyun Mei, Haoyuan Xu, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan
479
Beyond Strict Pairing: Arbitrarily Paired Training for High-Performance Infrared and Visible Image Fusion PDF ↗
Yanglin Deng, Tianyang Xu, Chunyang Cheng, Hui Li, Xiaojun Wu, Josef Kittler
480
Semantic-Adaptive Diffusion for Dynamic Spatiotemporal Fusion PDF ↗
Jinsong Zhang, Ying Qu, Yuan Liao, Hairong Qi, Zhenzhou Shao
481
Bayesian Decomposition and Semantic Completion for Few-shot Semantic Segmentation PDF ↗
Guangchen Shi, Yirui Wu, Wei Zhu, Tao Wang, Hao Zhang, Bo Li, Tong Lu
482
From Few-way to Many-way: Rethinking Few-shot Fine-grained Image Classification PDF ↗
Li-Jun Zhao, Zhen-Duo Chen, Xin Luo, Xin-Shun Xu
483
STiTch: Semantic Transition and Transportation in Collaboration for Training-Free Zero-Shot Composed Image Retrieval PDF ↗
Miaoge Li, Dongsheng Wang, Zening Sun, Jinsen Zhang, Wenhan Luo, Jingcai Guo
484
Selective, Regularized, and Calibrated: Harnessing Vision Foundation Models for Cross-Domain Few-Shot Semantic Segmentation PDF ↗
Junyuan Ma, Xunzhi Xiang, Wenbin Li, Qi Fan, Yang Gao
485
FlowComposer: Composable Flows for Compositional Zero-Shot Learning PDF ↗
Zhenqi He, Lin Li, Long Chen
486
ManifoldGD: Training-Free Hierarchical Manifold Guidance for Diffusion-Based Dataset Distillation PDF ↗
Ayush Roy, Wei-Yang Alex Lee, Rudrasis Chakraborty, Vishnu Suresh Lokhande
487
DMGD: Train-Free Dataset Distillation with Semantic-Distribution Matching in Diffusion Models PDF ↗
Qichao Wang, Yunhong Lu, Hengyuan Cao, Junyi Zhang, Min Zhang
488
UniRain: Unified Image Deraining with RAG-based Dataset Distillation and Multi-objective Reweighted Optimization PDF ↗
Qianfeng Yang, Qiyuan Guan, Xiang Chen, Jiyu Jin, Guiyue Jin, Jiangxin Dong
489
Leveraging Multispectral Sensors for Color Correction in Mobile Cameras PDF ↗
Luca Cogo, Marco Buzzelli, Simone Bianco, Javier Vazquez-Corral, Raimondo Schettini
490
Differentiable Adaptive 4D Structured Illumination for Joint Capture of Shape and Reflectance PDF ↗
Huakeng Ding, Yaowen Chen, Kun Zhou, Hongzhi Wu
491
Optical Diffraction-based Convolution for Semiconductor Lithography PDF ↗
Young-Han Son, Dong-Hee Shin, Deok-Joong Lee, Hyun Jung Lee, Tae-Eui Kam
492
GSNR: Graph Smooth Null-Space Representation for Inverse Problems PDF ↗
Romario Gualdrón-Hurtado, Roman Jacome, Rafael S. Suárez, Henry Arguello
493
MatE: Material Extraction from Single-Image via Geometric Prior PDF ↗
Zeyu Zhang, Wei Zhai, Jian Yang, Yang Cao
494
αMatte4K & µMatting: Dataset and Model for Ultra-Micro Precision Alpha Video Matting
Xinyi Chen, Hang Dong, Baowei Jiang, Shenkun Xu, Youqi Guan, Kanle Shi, Kun Gai, Haichuan Song
495
Revisiting Optimal Coding for I-ToF under Practical Sensor Constraints PDF ↗
Wenbin Luo, Takafumi Iwaguchi, Ryusuke Sagawa, Hiroshi Kawasaki
496
Dynamic Black-hole Emission Tomography with Physics-informed Neural Fields PDF ↗
Berthy T. Feng, Andrew A. Chael, David Bromley, Aviad Levis, William T. Freeman, Katherine L. Bouman
497
Exploring Spatiotemporal Feature Propagation for Video-Level Compressive Spectral Reconstruction: Dataset, Model and Benchmark PDF ↗
Lijing Cai, Zhan Shi, Chenglong Huang, Jinyao Wu, Qiping Li, Zikang Huo, Linsen Chen, Chongde Zi, Xun Cao
498
Generalizable Radio-Frequency Radiance Fields for Spatial Spectrum Synthesis PDF ↗
Kang Yang, Yuning Chen, Wan Du
499
SAR2Net: Learning Spatially Anchored Representations for Retrieval- Guided Cross-Stain Alignment PDF ↗
Tianle Shen, Fang Yan, Xiaofan Zhang
500
Advancing Cancer Prognosis with Hierarchical Fusion of Genomic, Proteomic and Pathology Imaging Data from a Systems Biology Perspective PDF ↗
Junjie Zhou, Bao Xue, Meiling Wang, Wei Shao, Daoqiang Zhang
501
PromptStereo: Zero-Shot Stereo Matching via Structure and Motion Prompts PDF ↗
Xianqi Wang, Hao Yang, Hangtian Wang, Junda Cheng, Gangwei Xu, Min Lin, Xin Yang
502
Any Resolution Any Geometry: From Multi-View To Multi-Patch PDF ↗
Wenqing Cui, Zhenyu Li, Mykola Lavreniuk, Jian Shi, Ramzi Idoughi, Xiangjun Tang, Peter Wonka
503
Paparazzo: Active Mapping of Moving 3D Objects PDF ↗
Davide Allegro, Shiyao Li, Stefano Ghidoni, Vincent Lepetit
504
DepthFocus: Controllable Depth Estimation for See-Through Scenes PDF ↗
Junhong Min, Jimin Kim, Minwook Kim, Cheol-Hui Min, Youngpil Jeon, Minyong Choi
505
OVI-MAP: Open-Vocabulary Instance-Semantic Mapping PDF ↗
Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath
506
PTC-Depth: Pose-Refined Monocular Depth Estimation with Temporal Consistency PDF ↗
Leezy Han, Seunggyu Kim, Dongseok Shim, Hyeonbeom Lee
507
SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations PDF ↗
Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen
508
Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass PDF ↗
Liyi Chen, Pengfei Wang, Guowen Zhang, Zhiyuan Ma, Lei Zhang
509
Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling PDF ↗
Qi Sun, Can Wang, Jiaxiang Shang, Yingchun Liu, Jing Liao
510
Variational Graph-based Normal Integration PDF ↗
Lixiong Chen, Bohan Yu, Victor Adrian Prisacariu, Imari Sato
511
Vinedresser3D: Towards Agentic Text-guided 3D Editing PDF ↗
Yankuan Chi, Xiang Li, Zixuan Huang, James Matthew Rehg
512
MV2UV: Generating High-quality UV Texture Maps with Multiview Prompts PDF ↗
Zheng Zhang, Qinchuan Zhang, Yuteng Ye, Zhi Chen, Penglei Ji, Mengfei Li, Wenxiao Zhang, Yuan Liu
513
Learning Hierarchical Hyperbolic Mixture Model for Part-aware 3D Generation PDF ↗
Qitong Yang, Mingtao Feng, Zijie Wu, Huixin Zhu, Weisheng Dong, Yaonan Wang, Ajmal Mian
514
MeshRipple: Structured Autoregressive Generation of Artist-Meshes PDF ↗
Junkai Lin, Hang Long, Huipeng Guo, Jielei Zhang, Jiayi Yang, Tianle Guo, Yang Yang, Jianwen Li, Wenxiao ZHANG, Matthias Nießner, Wei Yang
515
FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation PDF ↗
Hanxiao Wang, Yuan-Chen Guo, Ying-Tian Liu, Zi-Xin Zou, Biao Zhang, Weize Quan, Ding Liang, Yan-Pei Cao, Dong-Ming Yan
516
Easy3E: Feed-Forward 3D Asset Editing via Rectified Voxel Flow PDF ↗
Shimin Hu, Yuanyi Wei, Fei Zha, Yudong Guo, Juyong Zhang
517
CUPID: Generative 3D Reconstruction via Joint Object and Pose Modeling, Binbin Huang, Haobin Duan, Yiqun Zhao, Zibo Zhao, Yi Ma, Shenghua Gao
518
3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image PDF ↗
Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie
519
DRM: Diffusion-based Reward Model With Step-wise Guidance PDF ↗
Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing LYU
520
Taming Preference Mode Collapse via Directional Decoupling Alignment in Diffusion Reinforcement Learning PDF ↗
Chubin Chen, Sujie Hu, Jiashu Zhu, Meiqi Wu, Jintao Chen, Yanxun Li, Nisha Huang, Chengyu Fang, Jiahong Wu, Xiangxiang Chu, Xiu Li
521
VA-π: Variational Policy Alignment for Pixel-Aware Autoregressive Generation
Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao
522
SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models PDF ↗
Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan
523
AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References PDF ↗
Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye
524
Style-GRPO: Semantic-Aware Preference Optimization for Image Style Transfer Guided by Reward Modeling PDF ↗
Jianbin Zhao, Chaoran Feng, Miao Yu, Yingtao Li, Zhenyu Tang, Wangbo Yu, Yian Zhao, Xiaomin Li, Li Yuan, Yonghong Tian
525
LAMP: Language-Assisted Motion Planning for Controllable Video Generation PDF ↗
Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan
526
Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization PDF ↗
Tahira Kazimi, Connor Dunlop, Pinar Yanardag
527
Spectral Scalpel: Amplifying Adjacent Action Discrepancy via Frequency-Selective Filtering for Skeleton-Based Action Segmentation PDF ↗
Haoyu Ji, Bowen Chen, Zhihao Yang, Wenze Huang, Yu Gao, Xueting Liu, Weihong Ren, Zhiyong Wang, Honghai Liu
528
DETACH : Decomposed Spatio-Temporal Alignment for Exocentric Video and Ambient Sensors with Staged Learning PDF ↗
Junho Yoon, Jaemo Jeong, Hyunju Kim, Dongman Lee
529
Learning a Unified Latent Action Space from Videos with Action- centric Cycle Consistency PDF ↗
Guangyan Chen, Qi Shao, Te Cui, Zichen Zhou, Weixin Mao, Luojie Yang, Meiling Wang, Yi Yang, Hua Chen, Yufeng Yue
530
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition PDF ↗
Tanush Yadav, Mohammadreza Salehi, Jae Sung Park, Vivek Ramanujan, Hannaneh Hajishirzi, Yejin Choi, Ali Farhadi, Rohun Tripathi, Ranjay Krishna
531
BD-Merging: Bias-Aware Dynamic Model Merging with Evidence- Guided Contrastive Learning PDF ↗
Yuhan Xie, Chen Lyu
532
Dynamic Momentum Recalibration in Online Gradient Learning PDF ↗
Zhipeng Yao, Rui Yu, Guisong Chang, Ying Li, Yu Zhang, Dazhou Li
533
Spherical Leech Quantization for Visual Tokenization and Generation PDF ↗
Yue Zhao, Hanwen Jiang, Zhenlin Xu, Chutong Yang, Ehsan Adeli, Philipp Kraehenbuehl
534
MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi- Scale Attention PDF ↗
Pedro M. P. Curvo, Jan-Willem van de Meent, Maksim Zhdanov
535
GR-Gauge: Cost-efficient Training Configuration By Gauging the Gradient Redundancy PDF ↗
Guanjie Wang, Chen Chen
536
E^2-SCI: Elastic Edge–Cloud Speculative Decoding via Credit Inertia PDF ↗
Senyao Li, Haozhao Wang, Zhaobai Jiang, Zhanbo Jin, Hao Fan, Ruixuan Li
537
HyperNAS: Enhancing Architecture Representation for NAS Predictor via Hypernetwork PDF ↗
Jindi Lv, Yuhao Zhou, Yuxin Tian, Qing Ye, Wentao Feng, Jiancheng Lv
538
NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity PDF ↗
Weijian Mai, Mu Nan, Yu Zhu, Jiahang Cao, Rui Zhang, Yuqin Dai, Chunfeng Song, Andrew Luo, Jiamin Wu
539
Spectral Conformal Risk Control: Distribution-Free Tail Guarantees via Bayesian Quadrature PDF ↗
Mohammad Mahdi Kazemi Esfeh, Qi Yan, Yongxing Zhang, Zahra Gholami, Renjie Liao, Purang Abolmaesumi
540
Edge-RecViT: Efficient Vision Transformer via Semantic-Refined Dynamic Recursion PDF ↗
YiZhou Li, Jinyi Xu, Mingyu Yin, Xianyi Zhao
541
ERMoE: Eigen-Reparameterized Mixture-of-Experts for Stable Routing and Interpretable Specialization PDF ↗
Anzhe Cheng, Shukai Duan, Shixuan Li, Chenzhong Yin, Mingxi Cheng, Heng Ping, Tamoghna Chattopadhyay, Sophia I. Thomopoulos, Shahin Nazarian, Paul Thompson, Paul Bogdan
542
GUI-SAGE: Enhancing GUI Automation with Self-Explanatory Learning PDF ↗
Fei Tang, Zhangxuan Gu, Zhengxi Lu, Shangzhan Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Yueting Zhuang
543
GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks PDF ↗
Saelyne Yang, Jaesang Yu, Yi-Hao Peng, Kevin Qinghong Lin, Jae Won Cho, Yale Song, Juho Kim
544
HiconAgent: History Context-aware Policy Optimization for GUI Agents PDF ↗
Xurui Zhou, Gongwei Chen, Yuquan Xie, Zaijing Li, Kaiwen Zhou, Shuai Wang, Shuo Yang, Zhuotao Tian, Rui Shao
545
PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt- Enriched Training PDF ↗
Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang
546
SDDF: Specificity-Driven Dynamic Focusing for Open-Vocabulary Camouflaged Object Detection PDF ↗
Jiaming Liang, Yifeng Zhan, Chunlin Liu, Weihua Zheng, Bingye Peng, Qiwei Liang, Boyang Cai, Xiaochun Mai, Qiang Nie
547
Towards Open-Vocabulary Industrial Defect Understanding with a Large-Scale Multimodal Dataset PDF ↗
Tsai-Ching Ni, Cheng-Chi Chen, Yuan-Fu Yang
548
Common Inpainted Objects In-N-Out of Context PDF ↗
Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun
549
Prompt-Free Universal Region Proposal Network PDF ↗
Qihong Tang, Changhan Liu, Shaofeng Zhang, Wenbin Li, Qi Fan, Yang Gao
550
Rewis3d: Reconstruction Improves Weakly-Supervised Semantic Segmentation PDF ↗
Jonas Ernst, Wolfgang Boettcher, Lukas Hoyer, Jan Eric Lenssen, Bernt Schiele
551
PaNDaS: Learnable Shape Interpolation Modeling with Localized Control PDF ↗
Thomas Besnier, Emery Pierson, Sylvain Arguillere, Maks Ovsjanikov, Mohamed Daoudi
552
Hilbert Curve-Based Attention Enabling Topology-Preserving Image Tensor Representation for Semantic Segmentation Network PDF ↗
Linkang Xu, Gang Li, Yue Song, Xiangxin Ji
553
Towards High-Quality Image Segmentation: Improving Topology Accuracy by Penalizing Neighbor Pixels PDF ↗
Juan Miguel Valverde, Dim P. Papadopoulos, Rasmus Larsen, Anders Bjorholm Dahl
554
SAGE: Style-Adaptive Generalization for Privacy-Constrained Semantic Segmentation Across Domains PDF ↗
Qingmei Li, Yang Zhang, Peifeng Zhang, Haohuan Fu, Juepeng Zheng
555
Better than Average: Spatially-Aware Aggregation of Segmentation Uncertainty Improves Downstream Performance PDF ↗
Vanessa Emanuela Guarino, Claudia Winklmayr, Jannik Franzen, Josef Lorenz Rumberger, Manuel Pfeuffer, Sonja Greven, Klaus Maier-Hein, Dagmar Kainmueller, Christoph Karg, Carsten T. Lüth
556
Universal 3D Shape Matching via Coarse-to-Fine Language Guidance PDF ↗
Qinfeng Xiao, Guofeng Mei, Bo Yang, Liying Zhang, Jian Zhang, Kit-lun Yick
557
Direct Segmentation without Logits Optimization for Training-Free Open-Vocabulary Semantic Segmentation PDF ↗
Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu
558
CDICS: Delving Into Fine-Grained Attribute for In-Context Segmentation via Compositional Prompts and Phased Decoupling PDF ↗
Zhiyu Li, Dianmo Sheng, Qi Chu, Shilong Chen, Tao Gong, Zhou Wei, Nenghai Yu
559
Discriminative Perception via Anchored Description for Reasoning Segmentation PDF ↗
Tao Yang, Qing Zhou, Yanliang Li, Qi Wang
560
SegEarth-R2: Towards Comprehensive Language-guided Segmentation for Remote Sensing Images PDF ↗
Zepeng Xin, Kaiyu Li, Luodi Chen, Wanchen Li, Xiao Yuchen, Hui Qiao, Weizhan Zhang, Deyu Meng, Xiangyong Cao
561
Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark PDF ↗
Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang
562
CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation PDF ↗
Shilei Cao, Ziyang Gong, Hehai Lin, Yang Liu, Jiashun Cheng, Xiaoxing Hu, Haoyuan Liang, Guowen Li, Chengwei Qin, Hong Cheng, Xue Yang, Juepeng Zheng, Haohuan Fu
563
Multigrain-aware Semantic Prototype Scanning and Tri-Token Prompt Learning Embraced High-Order RWKV for Pan-Sharpening PDF ↗
Junfeng Li, Wenyang Zhou, Xueheng Li, Xuanhua He, Jianhou Gan, Wenqi Ren
564
ACPV-Net: All-Class Polygonal Vectorization for Seamless Vector Map Generation from Aerial Imagery PDF ↗
Weiqin Jiao, Hao Cheng, George Vosselman, Claudio Persello
565
Beyond Endpoints: Path-Centric Reasoning for Vectorized Off-Road Network Extraction PDF ↗
Wenfei Guan, Jilin Mei, Tong Shen, Xumin Wu, Shuo Wang, Chen Min, Yu Hu
566
Rotation Invariant and Symmetry Aware Pixel Difference Network for Remote Sensing Object Detection PDF ↗
Jialei Zhan, Li Liu, Jiehua Zhang, Yuhang Xie, Yongxiang Liu, Jiangming Chen, Ming-Ming Cheng
567
F2Net: A Frequency-Fused Network for Ultra-High Resolution Remote Sensing Segmentation PDF ↗
Hengzhi Chen, Liqian Feng, Wenhua Wu, Xiaogang Zhu, Qiuxia Wu, Lianlei Shan, Kun Hu
568
RoadGIE: Towards A Global-Scale Aerial Benchmark for Generalizable Interactive Road Extraction PDF ↗
Chenxu Peng, Chenxu Wang, Yimian Dai, Yongxiang Liu, Ming-Ming Cheng, Xiang Li
569
PGA: Prior-free Generative Attack for Practical No-box Scenario PDF ↗
Hongyu Peng, Xiang Yuan, Gong Cheng
570
Lipschitz Optimization for Formal Verification of Homographies PDF ↗
Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio
571
Batman: Benign Knowledge Alignment Through Malicious Null Space in Federated Backdoor Attack PDF ↗
Wenwen He, Wenke Huang, Yiyang Fang, Wenjie Qu, Jiaheng Zhang, Mang Ye
572
Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation PDF ↗
Halima Bouzidi, Haoyu Liu, Yonatan Achamyeleh, Praneetsai Iddamsetty, Mohammad Al Faruque
573
Eliminate Distance Differences Induced by Backdoor Attacks: Layer- Selective Training and Clipping to Mask Backdoor Models PDF ↗
Xuzeng Li, Tao Zhang, Xiangyun Tang, Jiacheng Wang, Jian Wang, Jiawen Kang, Jiqiang Liu, Zhen Han, Dusit Niyato, Dong In Kim
574
Mitigating Error Amplification in Fast Adversarial Training PDF ↗
Mengnan Zhao, Lihe Zhang, Bo Wang, Tianhang Zheng, Hong Zhong, Geyong Min
575
Physical Adversarial Clothing Evades Visible-Thermal Detectors via Non-Overlapping RGB-T Pattern PDF ↗
Xiaopei Zhu, Guanning Zeng, Zhanhao Hu, Jun Zhu, Xiaolin Hu
576
What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs PDF ↗
Zhihan Ren, Lijun He, Jiaxi Liang, Xinzhu Fu, Haixia Bi, Fan Li
577
Exposing Functional Fusion: A New Class of Strategic Backdoor in Dynamic Prompt Architectures PDF ↗
Zeyao Liu, Zhendong Zhao, Xiaojun Chen, Xin Zhao, Yuexin Xuan, Xiaoshuang Ji
578
Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation PDF ↗
Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin
579
Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment PDF ↗
Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao
580
FM-Steer: Enhance Generalist Policies with Value-Guided Cascaded Denoising PDF ↗
Haoming Song, Delin Qu, Yuanqi Yao, Qizhi Chen, Jiarui Li, Qi Lv, Yiwen Tang, Li Kang, Heng Zhou, Xianqiang Gao, Yuhang Tang, Xiaofan Li, Modi Shi, Guanghui Ren, Maoqing Yao, Bin Zhao, Dong Wang, Xuelong Li
581
Bootstrap Dynamic-Aware 3D Visual Representation for Scalable Robot Learning PDF ↗
Qiwei Liang, Boyang Cai, Minghao Lai, Sitong Zhuang, Tao Lin, Yan Qin, Yixuan Ye, Jiaming Liang, Renjing Xu
582
Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation
Tairan He, Zi Wang, Haoru Xue, Qingwei Ben, Zhengyi Luo, Wenli Xiao, Ye Yuan, Xingye Da, Fernando Castañeda, Shankar Sastry, Changliu Liu, Guanya Shi, Linxi Fan, Yuke Zhu
583
Contact-Aware Neural Dynamics PDF ↗
Changwei Jing, Jai Krishna Bandi, Jianglong Ye, Yan Duan, Pieter Abbeel, Xiaolong Wang, Sha Yi
584
AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention PDF ↗
Lei Xiao, Jifeng Li, Juntao Gao, Feiyang Ye, Yan Jin, Jingjing Qian, Jing Zhang, Yong Wu, Xiaoyuan Yu
585
UAST: Unified Active Search and Tracking for Arbitrary Targets with UAVs PDF ↗
Liang Qin, Min Wang, Xingyu Lu, Aowen Qiu, Wengang Zhou, Houqiang Li
586
SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead PDF ↗
Chaojun Ni, Cheng Chen, Xiaofeng Wang, Zheng Zhu, Wenzhao Zheng, Boyuan Wang, Tianrun Chen, Guosheng Zhao, Haoyun Li, Zhehao Dong, Qiang Zhang, Yun Ye, Yang Wang, Guan Huang,
587
Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering PDF ↗
Sebin Lee, Jumin Lee, Taeyeon Kim, Youngju Na, Woobin Im, Sung-Eui Yoon
588
Cross-Hand Latent Representation for Vision-Language-Action Models PDF ↗
Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xueyan Zou
589
Beyond Success: Refining Elegant Robot Manipulation from Mixed- Quality Data via Just-in-Time Intervention PDF ↗
Yanbo Mao, Jianlong Fu, Ruoxuan Zhang, Hongxia Xie, Meibao Yao
590
Physically Ground Commonsense Knowledge for Articulated Object Manipulation with Analytic Concepts PDF ↗
Jiude Wei, Yuxuan Li, Cewu Lu, Jianhua Sun
591
GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation PDF ↗
Jingjing Qian, Boyao Han, Chen Shi, Lei Xiao, Long Yang, Shaoshuai Shi, Li Jiang
592
From Manuals to Actions: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation PDF ↗
Chenyang Gu, Jiaming Liu, Hao Chen, Runzhong Huang, Qingpo Wuwu, Xiaoqi Li, Zhuoyang Liu, Ying Li, Renrui Zhang, Peng Jia, Pheng-Ann Heng, Shanghang Zhang
593
Real-World Point Tracking with Verifier-Guided Pseudo-Labeling PDF ↗
Görkay Aydemir, Fatma Güney, Weidi Xie
594
Rethinking Occlusion Modeling for UAV Tracking PDF ↗
Jian Zhang, Xincheng Yu, Yi Lin
595
Adaptive Capacity Autoregressive Visual Tracking PDF ↗
Tong Lin, Yifan Bai, Shiyi Liang, Ruigang Niu, Xing Wei
596
Spatio-Temporal Conditional Denoising Transformer for Modality- Missing RGBT Tracking PDF ↗
Andong Lu, Ziyi Zha, Jiandong Jin, Shihao Li, Chenglong Li, Jin Tang, Bin Luo
597
Breaking Smooth-Motion Assumptions: A UAV Benchmark for Multi- Object Tracking in Complex and Adverse Conditions PDF ↗
Jingtao Ye, Zhang Kexin, Xunchi Ma, Johann Li, Guangming Zhu, Peiyi Shen, Linhua Jiang, Xiangdong Zhang, Zhang Liang
598
TrackMAE: Video Representation Learning via Track Mask and Predict PDF ↗
Renaud Vandeghen, Fida Mohammad Thoker, Marc Van Droogenbroeck, Bernard Ghanem
599
Dual-branch Distilled Transformer for Efficient Asymmetric UAV Tracking PDF ↗
Hongtao Yang, Bineng Zhong, Qihua Liang, Yaozong Zheng, Xiantao Hu, Yuanliang Xue, Shuxiang Song
600
Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes PDF ↗
Qi Zhang, Jixuan Chen, Kaiyi Zhang, Xinquan Yu, Antoni B. Chan, Hui Huang
601
Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers PDF ↗
Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen
602
MuViT: Multi-Resolution Vision Transformers for Learning Across Scales in Microscopy PDF ↗
Albert Dominguez Mantes, Gioele La Manno, Martin Weigert
603
SemVideo: Reconstructs What You Watch from Brain Activity via Hierarchical Semantic Guidance PDF ↗
Minghan Yang, Lan Yang, Ke Li, Honggang Zhang, Kaiyue Pang, Yi-Zhe Song
604
Multimodal Causality-Driven Representation Learning for Generalizable Medical Image Segmentation PDF ↗
Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo
605
Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization PDF ↗
Xuefei Wang, Kai Horstmann, Ethan Lin, Jonathan Chen, Alexander Farhang, Sophia Stiles, Atharva Sehgal, Jonathan Light, David Van Valen, Yisong Yue, Jennifer J. Sun
606
TopoSlide: Topologically-Informed Histopathology Whole Slide Image Representation Learning PDF ↗
Shahira Abousamra, Asmita Sood, Sylvia Plevritis
607
Beyond the Static-World: Lifelong Learning for All-in-One Medical Image Restoration PDF ↗
Shihao Shan, Hongying Liu, Fanhua Shang, Liang Wan, Jingjing Deng
608
Hyperbolic Relational Prompts for Intersectional Fairness in Medical VLMs PDF ↗
Jiayu Qian, Zongxian Yang, Guanxing Chen, Pengwei Hu, KC Tan, Yan Wang, Yu-An Huang, Zhi-An Huang
609
RNED: Rotary Number Encoding and Decoding for Quantitative Medical VLM Analysis
Fengbei Liu, Sunwoo Kwak, Nusrat Nizam, Ilan Richter, Ashley Beecy, Jayant Raikhelkar, Deborah Estrin, Mert R. Sabuncu
610
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding PDF ↗
Basit Alawode, Arif Mahmood, Muaz Khalifa Al Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed
611
Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision PDF ↗
Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz
612
BiOTPrompt: Bidirectional Optimal Transport Guided Prompting for Disease Evolution-aware Radiology Report Generation PDF ↗
Tengfei Liu, Yijian Fan, Boyue Wang, Yongli Hu, Mingjie Li, Jinghua Li, Junbin Gao, Xiaojun Chang, Zhihui Li, Baocai Yin
613
Learning to See Through a Baby’s Eyes: Early Visual Diets Enable Robust Visual Intelligence in Humans and Machines PDF ↗
Yusen Cai, Qing Lin, Bhargava Satya Nunna, Mengmi Zhang
614
UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation PDF ↗
Haopeng Chen, Yihao Ai, Kabeen Kim, Robby T. Tan, Yixin Chen, Bo Wang
615
Enhancing Accuracy of Uncertainty Estimation in Appearance-based Gaze Tracking with Probabilistic Evaluation and Calibration PDF ↗
Qiaojie Zheng, Jiucai Zhang, Amy Zhang, Xiaoli Zhang
616
SCAPO: Self-Supervised Category-Level Articulated Pose Estimation from a Single 3D Observation PDF ↗
Can Zhang, Gim Hee Lee
617
Composite-Attribute Person Re-Identification via Pose-Guided Disentanglement PDF ↗
Kartik Patwari, Noranart Vesdapunt, Chien-Yi Wang, Dawei Li, Cong Phuoc Huynh, Ning Zhou, Chen-Nee Chuah, Kah Kuen Fu
618
Representing 3D Faces with Learnable B-Spline Volumes PDF ↗
Prashanth Chandran, Daoye Wang, Timo Bolkart
619
RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos PDF ↗
Lixin Xue, Chengwei Zheng, Georgios Paschalidis, Chen Guo, Manuel Kaufmann, Juan Zarate, Dimitrios Tzionas
620
HumanBA: Human-Aware Bundle Adjustment via Global Human- Camera Decoupling PDF ↗
Fengyuan Yang, Tanuj Sur, Tze Ho Elden Tse, Angela Yao
621
HamiPose: Hamiltonian Optimization for Unsupervised Domain Adaptive Pose Estimation PDF ↗
Jiawen Li, Fei Jiang, Dandan Zhu, Aimin Zhou
622
KASALv2: Fully Automatic 3D Rotational Symmetry Classification and Axis Localization PDF ↗
Mengxin Zhang, Yulin Wang, Chen Luo, Yongzhe Li, Yijun Zhou
623
AnyLift: Scaling Motion Reconstruction from Internet Videos via 2D Diffusion PDF ↗
Hongjie Li, Heng Yu, Jiaman Li, Hong-Xing Yu, Ehsan Adeli, C. Karen Liu, Jiajun Wu
624
Active Inference for Micro-Gesture Recognition: EFE-Guided Temporal Sampling and Adaptive Learning PDF ↗
Weijia Feng, Jingyu Yang, Ruojia Zhang, Fengtao Sun, Qian Gao, Chenyang Wang, Tongtong Su, Jia Guo, Xiaobai Li, Minglai Shao
625
ArtPro: Self-Supervised Articulated Object Reconstruction with Adaptive Integration of Mobility Proposals PDF ↗
Xuelu Li, Zhaonan Wang, Xiaogang Wang, Lei Wu, Manyi Li, Changhe Tu
626
Similarity-Consistent Likelihood Diffusion enables Hidden Person Detection from Wall Reflections PDF ↗
Zhiwen Zheng, Hao Zhou, Huiyu Qi, Zhao Huang, Guangyuan Zhang, Shaowei Jiang, Wenwen Tang, Bin Yang, Jin Liu, Xiaoshuai Zhang, Xingru Huang
627
VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery PDF ↗
Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin
628
Occluded Human Body Capture with Frequency Domain Denoising Prior PDF ↗
Buzhen Huang, Chongyang Xu, Wentao Tang, Yuan Shu, Jingyi Ju, Binghui Zuo, Yangang Wang
629
ResiHMR: Residual-Limb Aware Single-Image 3D Human Mesh Recovery for Individuals with Limb Loss PDF ↗
Jiaying Ying, Heming Du, Kaihao Zhang, Sean M. Tweedy, Xin Yu
630
OnlineHMR: Video-based Online World-Grounded Human Mesh Recovery PDF ↗
Yiwen Zhao, Ce Zheng, Yufu Wang, Hsueh-Han Daniel Yang, Liting Wen, László A. Jeni
631
MimiCAT: Mimic with Correspondence-Aware Cascade-Transformer for Category-Free 3D Pose Transfer PDF ↗
Zenghao Chai, Chen Tang, Yongkang Wong, Xulei Yang, Mohan Kankanhalli
632
Exploring Adaptive Masked Reconstruction for Self-Supervised Skeleton-Based Action Recognition PDF ↗
Shengkai Sun, Zhiyong Cheng, Zefan Zhang, Jianfeng Dong, Zhihui Li, Meng Wang
633
DFD-HR: Generalizable Deepfake Detection via Hierarchical Routing Learning PDF ↗
Jiamu Sun, Zhiyuan Yan, Ke-Yue Zhang, Taiping Yao, Shouhong Ding
634
MGDHand: Multi-Granularity Prior-to-Inertial Distillation Framework for Sequential 3D Hand Pose Estimation from Sparse IMUs PDF ↗
Xinyi Wang, Pengfei Ren, Haoyang Zhang, Hanling Zhan, Yingxi Li, Liang Xie, Yue Gao, Erwei Yin
635
CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction PDF ↗
Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield
636
E-3DPSM: A State Machine for Event-based Egocentric 3D Human Pose Estimation PDF ↗
Mayur Deshmukh, Hiroyasu Akada, Helge Rhodin, Christian Theobalt, Vladislav Golyanik
637
Bézier Degradation Modeling for LiDAR-based Human Motion Capture
Xiaoqi An, Lin Zhao, Jun Li, Chen Gong, Jian Yang
638
UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass PDF ↗
Mengfei Li, Peng Li, Zheng Zhang, Jiahao Lu, Chengfeng Zhao, Wei Xue, Qifeng Liu, Sida Peng, Wenxiao Zhang, Wenhan Luo, Yuan Liu, Yike Guo
639
Illumination-Consistent Human-Scene Reconstruction from Monocular Video PDF ↗
Rongbin Zheng, Wensheng Li, Lingzhe Zeng, Dong Wang, Chengying Gao
640
Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution PDF ↗
Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui
641
Agent4FaceForgery: Multi-Agent LLM Framework for Realistic Face Forgery Detection PDF ↗
Yingxin Lai, Zitong YU, Jun Wang, Linlin Shen, Yong Xu, Xiaochun Cao
642
Enabling Supervised Learning of Generative Signatures for Generalized Synthetic Image Detection
Jianwei Fei, Yunshu Dai, Xiaoyu Zhou, Zhihua Xia, Alessandro Piva
643
DiffusionFF: A Diffusion-based Framework for Joint Face Forgery Detection and Fine-Grained Artifact Localization PDF ↗
Siran Peng, Haoyuan Zhang, Li Gao, Tianshuo Zhang, Xiangyu Zhu, Bao Li, Weisong Zhao, Zhen Lei
644
All in One: Unifying Deepfake Detection, Tampering Localization, and Source Tracing with a Robust Landmark-Identity Watermark PDF ↗
Junjiang Wu, Liejun Wang, Zhiqing Guo
645
Towards an Incremental Unified Multimodal Anomaly Detection: Augmenting Multimodal Denoising From an Information Bottleneck Perspective PDF ↗
Kaifang Long, Lianbo Ma, Jiaqi Liu, Liming Liu, Guoyang Xie
646
AG-VAS: Anchor-Guided Zero-Shot Visual Anomaly Segmentation with Large Multimodal Models PDF ↗
Zhen Qu, Xian Tao, Xiaoyi Bao, Dingrong Wang, ShiChen Qu, Zhengtao Zhang, Xingang Wang
647
Dual-Prototype-Guided Multi-task Learning for Unsupervised Anomaly Detection and Classification PDF ↗
Qianhao Luo, Jiajia Mi, Mingtao Yan, JingSheng Liu, ShuYang Pang, Weiling Li
648
The Road Less Seen: Segment Exploration for Weakly Supervised Video Anomaly Detection PDF ↗
Anusha Acharya, Hitesh Sapkota, Qi Yu, Xumin Liu
649
Omni-AD: A Large-scale and Versatile Benchmark for Industrial Anomaly Detection PDF ↗
Dahu Shi, Chengshen He, Shaochen Zhang, Bo Qian, Xiaochen Quan, Wencong Zhang, Xing Wei
650
Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection PDF ↗
Kaiqiang Li, Gang Li, Mingle Zhou, Min Li, Delong Han, Jin Wan
651
Complementary Prototype Mapping for Efficient Multimodal Anomaly Detection PDF ↗
Yuan Zhao, Xiaoqin Zhang, Huchuan Lu, Lihe Zhang
652
LiDAS: Lighting-driven Dynamic Active Sensing for Nighttime Perception PDF ↗
Simon de Moreau, Andrei Bursuc, Hafid El Idrissi, Fabien Moutarde
653
Gau-Occ: Geometry-Completed Gaussians for Multi-Modal 3D Occupancy Prediction PDF ↗
Chengxin Lv, Yihui Li, Hongyu Yang, YunHong Wang
654
OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness PDF ↗
Phuc Nguyen, Anh N. Nhu, Ming C. Lin
655
An Instance-Centric Panoptic Occupancy Prediction Benchmark for Autonomous Driving PDF ↗
Yi Feng, Junwu E, Zizhan Guo, Yu Ma, Hanli Wang, Rui Fan
656
OneOcc: Semantic Occupancy Prediction for Legged Robots with a Single Panoramic Camera PDF ↗
Hao Shi, Ze Wang, Shangwei Guo, Mengfei Duan, Song Wang, Teng Chen, Kailun Yang, Lin Wang, Kaiwei Wang
657
ProOOD: Prototype-Guided Out-of-Distribution 3D Occupancy Prediction, 16:00 - 18:00 DEMOS (ExHall F) 1 FlowSLAM: Dense Visual SLAM on Edge Devices, 2 FoundYou: A Unified Model for Personalized Segmentation and Retrieval, 3 Code2Video: A Code-centric Paradigm for Educational Video Generation, 4 MIBURI: Towards Expressive Interactive Gesture Synthesis, 5 RnG
Yuheng Zhang, Mengfei Duan, Kunyu Peng, Yuhang Wang, Di Wen, Danda Pani Paudel, Luc Van Gool, Kailun Yang Aniket Gupta, Tianye Ding, Ajay Rajendra Kumar, Dennis Giaya, Pia Bideau, Charles Saunders, Qu Cao, Aruni RoyChowdhury, Hanumant Singh, Huaizu Jiang Gabriele Trivigno, Marcos Alfaro, Claudia Cuttano, Gabriele Berton, Luis Paya, Carlo Masone Yanzhe Chen, Kevin Qinghon Lin, Mike Zheng Shou M. Hamza Mughal, Rishabh Dabral, Vera Demberg, Christian Theobalt Mochu Xiang
No matches.