‹ June 5 schedule

Poster Session 3

Sat · June 6 · 11:45 AM–1:45 PM · ExHall A–F — 670 papers
670 papers
1
Breaking Semantic Boundaries: Distribution-Guided Semantic Exploration for Creative Generation PDF ↗
Fu Feng, Yucheng Xie, Ruixiao Shi, Xu Yang, Jing Wang, Xin Geng
2
Guiding a Diffusion Model by Swapping Its Tokens PDF ↗
Weijia Zhang, Yuehao Liu, Shanyan Guan, Wu Ran, Yanhao Ge, Wei Li, Chao Ma
3
PixelDiT: Pixel Diffusion Transformers for Image Generation 🏆PDF ↗
Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu, Jiebo Luo
4
SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models 🏆PDF ↗
Jiwoo Chung, Sangeek Hyun, MinKyu Lee, Byeongju Han, Geonho Cha, Dongyoon Wee, Youngjun Hong, Jae-Pil Heo
5
SenCache: Accelerating Diffusion Model Inference via Sensitivity- Aware Caching PDF ↗
Yasaman Haghighi, Alexandre Alahi
6
Streaming Diffusion Model for Fast Infrared and Visible Video Fusion PDF ↗
Jinyuan Liu, Ludan Sun, Tengyu Ma, Chunyan Yang, Zhiying Jiang, Long Ma, Risheng Liu, Xin Fan
7
ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation 🏆PDF ↗
Huan Ren, Yihan Chen, Chuxin Wang, Nailong Liu, Wenfei Yang, Tianzhu Zhang
8
CoSMo3D: Open-World Promptable 3D Semantic Segmentation through LLM-Guided Canonical Spatial Modeling 🏆PDF ↗
Li Jin, Weikai Chen, Yujie Wang, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Shengju Qian, Xin Wang, Xueying Qin
9
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding 🏆PDF ↗
Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang
10
RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video PDF ↗
Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou
11
S^2AM3D: Scale-controllable Part Segmentation of 3D Point Clouds PDF ↗
Han Su, Tianyu Huang, Zichen Wan, Xiaohe Wu, Wangmeng Zuo
12
Scalable Multi-View Subspace Clustering with Tensorized Anchor Guidance PDF ↗
Miao Jia, Xingchen Hu, Jiyuan Liu, Siwei Wang, Min Wang, Zijian Chen
13
3D-LATTE: Latent Space 3D Editing from Textual Instructions PDF ↗
Maria Parelli, Michael Oechsle, Michael Niemeyer, Federico Tombari, Andreas Geiger
14
AnchorFlow: Training-Free 3D Editing via Latent Anchor-Aligned Flows PDF ↗
Zhenglin Zhou, Fan Ma, Chengzhuo Gui, Xiaobo Xia, Hehe Fan, Yi Yang, Tat-Seng Chua
15
ChordEdit: One-Step Low-Energy Transport for Image Editing 🏆PDF ↗
Liangsi Lu, Xuhang Chen, Minzhe Guo, Shichu Li, Jingchao Wang, Yang Shi
16
Faithful Contouring: Near-Lossless 3D Voxel Representation Free from Iso-surface PDF ↗
Yihao Luo, Xianglong He, Chuanyu Pan, Yiwen Chen, Jiaqi Wu, Yangguang Li, Wanli Ouyang, Yuanming Hu, Guang Yang, ChoonHwai Yap
17
Native and Compact Structured Latents for 3D Generation 🏆PDF ↗
Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu, Ruicheng Wang, Zelong Lv, Yu Deng, Hongyuan Zhu, Yue Dong, Hao Zhao, Nicholas Jing Yuan, Jiaolong Yang
18
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control PDF ↗
Arman Zarei, Samyadeep Basu, Mobina Pournemat, Sayan Nag, Ryan A. Rossi, Soheil Feizi
19
Differentiable Vector Quantization for Rate-Distortion Optimization of Generative Image Compression 🏆PDF ↗
Shiyin Jiang, Wei Long, Minghao Han, Zhenghao Chen, Ce Zhu, Shuhang Gu
20
FINER: MLLMs Hallucinate under Fine-grained Negative Queries 🏆PDF ↗
Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz
21
MDCS-MoAME: Multi-directional Composite Scanning with Mixture of Attention and Mamba Experts for Cancer Survival Prediction PDF ↗
Linjie Qu, Jin Xiao, Xiangrong Liu, Changming Sun, Hui Cui, Yuqi Fang, Ran Su, Qiangguo Jin, Leyi Wei
22
PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs PDF ↗
Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang
23
PAVAS: Physics-Aware Video-to-Audio Synthesis PDF ↗
Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji
24
ProPhy: Progressive Physical Alignment for Dynamic World Simulation 🏆PDF ↗
Zijun Wang, Panwen Hu, Jing Wang, Terry Jingchen Zhang, Yuhao Cheng, Long Chen, Yiqiang Yan, Zutao Jiang, Hanhui Li, Xiaodan Liang
25
V-DPM: 4D Video Reconstruction with Dynamic Point Maps PDF ↗
Edgar Sucar, Eldar Insafutdinov, Zihang Lai, Andrea Vedaldi
26
Registration-Free Learnable Multi-View Capture of Faces in Dense Semantic Correspondence PDF ↗
Panagiotis P. Filntisis, George Retsinas, Radek Danecek, Vanessa Sklyarova, Petros Maragos, Timo Bolkart
27
Mesh4D: 4D Mesh Reconstruction and Tracking from Monocular Video PDF ↗
Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi
28
SPE-MVS: Spatial Position Encoding Enhanced Multi-View Stereo with Monocular Depth Priors PDF ↗
Shaoqian Wang, Jiadai Sun, Bosen Hou, Qiang Wang, Bin Fan, Bo Li, Bin Lu, Yuchao Dai
29
Block-Sparse Global Attention for Efficient Multi-View Geometry Transformers PDF ↗
Chung-Shien Brian Wang, Christian Schmidt, Jens Piekenbrinck, Bastian Leibe
30
SMVRT: Implicit Human 3D Modeling Using Sparse Multi-View Volumetric Reconstruction with Transformer Fusion PDF ↗
Chuanmao Fan, Chenxi Zhao, Ye Duan
31
LiDAR Prompted Spatio-Temporal Multi-View Stereo for Autonomous Driving PDF ↗
Qihao Sun, Jiarun Liu, Ziqian Ni, Jianyun Xu, Sheng Yang, Tao Xie, Lijun Zhao, Ruifeng Li
32
Any4D: Unified Feed-Forward Metric 4D Reconstruction PDF ↗
Jay Karhade, Nikhil Keetha, Yuchen Zhang, Tanisha Gupta, Akash Sharma, Sebastian Scherer, Deva Ramanan
33
Co-Me: Confidence Guided Token Merging for Visual Geometric Transformers PDF ↗
Yutian Chen, Yuheng Qiu, Ruogu Li, Jay Patrikar, Sebastian Scherer
34
Point4Cast: Streaming Dynamic Scene Reconstruction and Forecasting PDF ↗
Xinhang Liu, Pedro Miraldo, Suhas Lohit, Huaizu Jiang, Naoko Sawada, Yu-Wing Tai, Chi-Keung Tang, Moitreya Chatterjee
35
AMB3R: Accurate Feed-forward Metric-scale 3D Reconstruction with Backend PDF ↗
Hengyi Wang, Lourdes Agapito
36
AlignPose: Generalizable 6D Pose Estimation via Multi-view Feature-metric Alignment PDF ↗
Anna Šárová Mikeštíková, Médéric Fourmy, Martin Cifka, Josef Sivic, Vladimir Petrik
37
Parallelised Differentiable Straightest Geodesics for 3D Meshes PDF ↗
Hippolyte Verninas, Caner Korkmaz, Stefanos Zafeiriou, Tolga Birdal, Simone Foti
38
Geometry-Aligned and Anomaly-Aware Reconstruction for 3D Anomaly Detection PDF ↗
Linchun Wu, Qin Zou, Yuanhao Yue, Zhongyuan Wang
39
DVGT: Driving Visual Geometry Transformer PDF ↗
Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Shengyin Jiang, Long Chen, Zhi-Xin Yang, Jiwen Lu
40
FMPose3D: monocular 3D pose estimation via flow matching PDF ↗
Ti Wang, Xiaohang Yu, Mackenzie Weygandt Mathis
41
MoRE: 3D Visual Geometry Reconstruction Meets Mixture-of- Experts PDF ↗
Jingnan Gao, Zhe Wang, Xianze Fang, Xingyu Ren, Zhuo Chen, Shengqi Liu, Yuhao Cheng, Jiangjing Lyu, Xiaokang Yang, Yichao Yan
42
Foundation Encoders Are All You Need for Preference-Aware Personalization PDF ↗
Hyungjin Kim, Seokho Ahn, Young-Duk Seo
43
Where Culture Fades: Revealing the Cultural Gap in Text-to-Image Generation PDF ↗
Chuancheng Shi, Shangze Li, Shiming Guo, Simiao Xie, Wenhua Wu, Jingtong Dou, Chao Wu, Canran Xiao, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua
44
ThinkGen: Generalized Thinking for Visual Generation PDF ↗
Siyu Jiao, Yiheng Lin, Yujie Zhong, Qi She, Wei Zhou, Xiaohan Lan, Zilong Huang, Fei Yu, Yingchen Yu, Yunqing Zhao, Yao Zhao, Yunchao Wei
45
CoLoGen: Progressive Learning of Concept–Localization Duality for Unified Image Generation PDF ↗
Yuxin Song, Yu Lu, Haoyuan Sun, Huanjin Yao, Fanglong Liu, Yifan Sun, Haocheng Feng, Hang Zhou, Jingdong Wang
46
Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes PDF ↗
Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto
47
When Safety Collides: Resolving Multi-Category Harmful Conflicts in Text-to-Image Diffusion via Adaptive Safety Guidance PDF ↗
Yongli Xiang, Ziming Hong, Zhaoqing Wang, Xiangyu Zhao, Bo Han, Tongliang Liu
48
PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards PDF ↗
Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian
49
HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation PDF ↗
Xiang Wang, Zhifei Zhang, He Zhang, Zhe Lin, Yuqian Zhou, Qing Liu, Shiwei Zhang, Yijun Li, Shaoteng Liu, Haitian Zheng, Jason Kuen, Yuehuan Wang, Changxin Gao, Nong Sang
50
Multimodal Semantic Bias Mitigation for Diverse Text-To-3D Generation PDF ↗
Yukuan Min, Muli Yang, Jinhao Zhang, Yuxuan Wang, Yihang Zhu, Jiexi Yan, Cheng Deng
51
Visual Personalization Turing Test PDF ↗
Rameen Abdal, James Burgess, Sergey Tulyakov, Kuan-Chieh Jackson Wang
52
Composing Concepts from Images and Videos via Concept-prompt Binding PDF ↗
Xianghao Kong, Zeyu Zhang, Yuwei Guo, Zhuoran Zhao, Songchun Zhang, Anyi Rao
53
Less is More: Data-Efficient Adaptation for Controllable Text-to-Video Generation PDF ↗
Shihan Cheng, Nilesh Kulkarni, David Hyde, Dmitriy Smirnov
54
Semantic Derivative Flow: Graph-Guided Diffusion for Controllable Instance Interactions PDF ↗
Shibin Mei, Hang Wang, Bingbing Ni
55
Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards PDF ↗
Seungwook Kim, Minsu Cho
56
Hierarchical Enhancement of Semantic Priors for Disentangled Text- Driven Motion Generation PDF ↗
Wenhan Lv, Shaopan Wang, Xiangyu Wu, Tianchu Hang, Zhongquan Jian, Qingqiang Wu
57
Simpleposter: A Simple Baseline for Product Poster Generation PDF ↗
Benlei Cui, Fangao Zeng, Weitao Jiang, Yuwen Zhai, Haiwen Hong, Longtao Huang, Hui Xue, Wenxiang Shang, Pipei Huang
58
Prompt Yourself: Awakening Textual Semantics in 1D Visual Tokenizers PDF ↗
Hualiang Wang, Siming Fu, Weinan Jia, Yuning Lu, Mu Liu, Jidong Jiang, Xiaomeng Li
59
SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design PDF ↗
Yunjie Yu, Jingchen Wu, Junchen Zhu, Chunze Lin, Guibin Chen
60
Image Generation from Contextually-Contradictory Prompts PDF ↗
Saar Huberman, Or Patashnik, Omer Dahary, Ron Mokady, Daniel Cohen-Or
61
PromptEnhancer: Taming Your Rewriter for Text-to-Image Generation via Fine-Grained Reward PDF ↗
Linqing Wang, Zhiyong Xu, Ximing Xing, Yiji Cheng, Zhiyuan Zhao, Donghao Li, Tiankai Hang, Zhenxi Li, Jiale Tao, Qixun Wang, Ruihuang Li, Comi Chen, Xin Li, Mingrui Wu, Xinchi Deng, Shuyang Gu, Chunyu Wang, Qinglin Lu
62
Aligning Text, Images and 3D Structure Token-by-Token PDF ↗
Aadarsh Sahoo, Vansh Tibrewal, Georgia Gkioxari
63
RefTon: Reference person shot assist virtual Try-on PDF ↗
Liuzhuozheng Li, Yue Gong, Shanyuan Liu, Zanyi Wang, Dengyang Jiang, Leibucha Wu, Bo Cheng, Yuhang Ma, Dawei Leng, Yuhui Yin
64
GaussianVision: Vision-Language Alignment from Compressed Image Representations using 2D Gaussian Splatting PDF ↗
Yasmine Omri, Connor Ding, Tsachy Weissman, Thierry Tambe
65
Copy-Transform-Paste: Zero-Shot Object-Object Alignment Guided by Vision-Language and Geometric Constraints PDF ↗
Rotem Gatenyo, Ohad Fried
66
Gravitation-Driven Semantic Alignment for Text Video Retrieval PDF ↗
Yi Yang, Zheng Wang, Xing Xu, Jingkuan Song, Heng Tao Shen
67
MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models PDF ↗
Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim
68
M^3KG-RAG: Multi-hop Multimodal Knowledge Graph- enhanced Retrieval-Augmented Generation PDF ↗
Hyeongcheol Park, Jiyoung Seo, Jaewon Mun, Hogun Park, Wonmin Byeon, Sung June Kim, Hyeonsoo Im, JeungSub Lee, Sangpil Kim
69
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition PDF ↗
Qianrui Zhou, Hua Xu, Yunjin Gu, Yifan Wang, Songze Li, Hanlei Zhang
70
ReFAct: Empowering Multimodal Web Agents with Visual and Context Focusing PDF ↗
Rui Wu, Shuo Zhang, Xiaoxuan Tang, Ruirui Zhang, Yi Liu, Tao Jiang, Wenhao Xu, Yong Li
71
PersonaVLM: Long-Term Personalized Multimodal LLMs PDF ↗
Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan
72
MR-RAG: Multimodal Relevance-Aware Retrieval-Augmented Generation for Medical Visual Question Answering PDF ↗
Xuze Li, Haozhao Wang, Zhenyu Huang, Zhongxu Wang, Jinghua Zhang, Ruixuan Li
73
Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation PDF ↗
Yongbo He, Zirun Guo, Tao Jin
74
CUE: Concept-Aware Multi-Label Expansion to Mitigate Concept Confusion in Long-Tailed Learning PDF ↗
Ruichi Zhang, Chikai Shang, Jiacheng Yang, Mengke Li, Yang Zhou, Junlong Gao, Yang Lu
75
Energy Waveify and Redistribution for Test-Time Adaptation: A Control System Perspective PDF ↗
Zhenbin Wang, Lei Zhang, Lituan Wang, Zhenwei Zhang, Guangwu Qian, Yan Wang, Wei Huang
76
CD-Buffer: Complementary Dual-Buffer Framework for Test-Time Adaptation in Adverse Weather Object Detection PDF ↗
Youngjun Song, Hyeongyu Kim, Dosik Hwang
77
CoFiDA-M: Concept-Aware Feature Modulation for Cross-Domain Adaptation with Image-Only Inference PDF ↗
Nurjahan Sultana, Moi Hoon Yap, Xinqi Fan, Wenqi Lu
78
Towards Multimodal Domain Generalization with Few Labels PDF ↗
Hongzhao Li, Hao Dong, Hualei Wan, Shupan Li, Mingliang Xu, Muhammad Haris Khan
79
Reclaiming Lost Text Layers for Source-Free Cross-Domain Few- Shot Learning PDF ↗
Zhenyu Zhang, Guangyao Chen, Yixiong Zou, Yuhua Li, Ruixuan Li
80
Event6D: Event-based Novel Object 6D Pose Tracking PDF ↗
Jae-Young Kang, Hoonhee Cho, Taeyeop Lee, Minjun Kang, Bowen Wen, Youngho Kim, Kuk-Jin Yoon
81
EV-CGNet: Co-visible Focused 3D-guided 2D Event Keypoint Detection Network PDF ↗
Yuan Gao, Tianle Ding, Yuqing Zhu, Tianzhu Zhang
82
AE2VID: Event-based Video Reconstruction via Aperture Modulation PDF ↗
Chenxu Bai, Boyu Li, Peiqi Duan, Xinyu Zhou, Hanyue Lou, Boxin Shi
83
From Contrast to Consistency: Rethinking Event-based Continuous- Time Optical Flow Estimation PDF ↗
Rui Hu, Song Wu, Wen Yang, Jinjian Wu
84
Spike-driven Discrete Aggregation for Event-based Object Detection PDF ↗
Huaning Li, Ziming Wang, Runhao Jiang, Yan Rui, Huajin Tang
85
x^2-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space PDF ↗
Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen
86
FloVerse: Floor Plan-Guided Multi-Modal Navigation PDF ↗
Weiqi Huang, Shuangyi Dong, Jiaxin Li, Yifei Guo, Zan Wang, Wei Liang
87
TrajRAG: Retrieving Geometric-Semantic Experience for Zero- Shot Object Navigation PDF ↗
Yiyao Wang, Sixian Zhang, Keming Zhang, Xinhang Song, Songjie Du, Shuqiang Jiang
88
History to Future: Evolving Agent with Experience and Thought for Zero-shot Vision-and-Language Navigation PDF ↗
Guangzhao Dai, Shuo Wang, Zihan Wang, Guo-Sen Xie, Yang Yang, Jinshan Pan, Qianru Sun, Xiangbo Shu
89
DreamSAC: Learning Hamiltonian World Models via Symmetry Exploration PDF ↗
Jinzhou Tang, Fan Feng, Minghao Fu, Wenjun Lin, Jing Yang, Biwei Huang, Keze Wang
90
Beyond Scanpaths: Graph-Based Gaze Simulation in Dynamic Scenes PDF ↗
Luke Palmer, Petar Palasek, Hazem Abdelkawy
91
CGL: Advancing Continual GUI Learning via Reinforcement Fine- Tuning PDF ↗
Zhenquan Yao, Zitong Huang, Yihan Zeng, Jianhua Han, Hang Xu, Chun-Mei Feng, Jianwei Ma, Wangmeng Zuo
92
Rethinking Visual Rearrangement from A Diffusion Perspective PDF ↗
Tianliang Qi, Xinhang Song, Yuyi Liu, Shuqiang Jiang
93
APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation PDF ↗
Daoxuan Zhang, Ping Chen, Xiaobo Xia, Xiu Su, Ruichen Zhen, Jianqiang Xiao, Shuo Yang
94
Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation PDF ↗
Kailing Li, Tianwen Qian, Lijin Yang, Yuqian Fu, Jingyu Gong, Xiaoling Wang, Liang He
95
InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs PDF ↗
Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Lan Xu, Jingyi Yu, Jingya Wang
96
When Robots Should Say ''I Don’t Know'': Benchmarking Abstention in Embodied Question Answering PDF ↗
Tao Wu, Chuhao Zhou, Guangyu Zhao, Haozhi Cao, Yewen Pu, Jianfei Yang
97
RoboAgent: Chaining Basic Capabilities for Embodied Task Planning PDF ↗
Peiran Xu, Jiaqi Zheng, Yadong Mu
98
Towards Training-free Scene Text Editing PDF ↗
Yubo Li, Xugong Qin, Peng Zhang, Hailun Lin, Gangyan Zeng, Kexin Zhang
99
VINS-120K: Ultra High-Resolution Image Editing with A Large-Scale Dataset PDF ↗
Zhizhou Chen, Shanyan Guan, Zhanxin Gao, En Ci, Yanhao Ge, Wei Li, Zhenyu Zhang, Jian Yang, Ying Tai
100
ArtiMuse: Fine-Grained Image Aesthetics Assessment with Joint Scoring and Expert-Level Understanding PDF ↗
Shuo Cao, Nan Ma, Jiayang Li, Xiaohui Li, Lihao Shao, Kaiwen Zhu, Yu Zhou, Yuandong Pu, Jiarui Wu, Jiaquan Wang, Bo Qu, Wenhai Wang, Yu Qiao, Dajuin Yao, Yihao Liu
101
Charge: A Comprehensive Novel View Synthesis Benchmark and Dataset to Bind Them All PDF ↗
Michal Nazarczuk, Thomas Tanay, Arthur Moreau, Zhensong Zhang, Eduardo Pérez-Pellitero
102
Region-Wise Correspondence Prediction between Manga Line Art Images PDF ↗
Yingxuan Li, Jiafeng Mao, Qianru Qiu, Yusuke Matsui
103
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation PDF ↗
Wei Chow, Jiachun Pan, Yongyuan Liang, Mingze Zhou, Xue Song, Liyu Jia, Saining Zhang, Siliang Tang, Juncheng Li, Fengda Zhang, Weijia Wu, Hanwang Zhang, Tat-Seng Chua
104
I2I-Bench: A Comprehensive Benchmark Suite for Image-to- Image Editing Models PDF ↗
Juntong Wang, Jiarui Wang, Huiyu Duan, Jiaxiang Kang, Guangtao Zhai, Xiongkuo Min
105
TokenGS: Decoupling 3D Gaussian Prediction from Pixels with Learnable Tokens PDF ↗
Jiawei Ren, Michal Jan Tyszkiewicz, Jiahui Huang, Zan Gojcic
106
Hermite Radial Basis Function for Surface Reconstruction via Differentiable Rendering PDF ↗
Hugo Blanc, Jean-Emmanuel Deschaud, Alexis Paljic
107
RF4D:Neural Radar Fields for Novel View Synthesis in Outdoor Dynamic Scenes PDF ↗
Jiarui Zhang, Zhihao Li, Chong Wang, Bihan Wen
108
Voxify3D: Pixel Art Meets Volumetric Rendering PDF ↗
Yi-Chuan Huang, Jiewen Chan, Hao-Jen Chien, Yu-Lun Liu
109
Node-RF: Learning Generalized Continuous Space-Time Scene Dynamics with Neural ODE-based NeRFs PDF ↗
Hiran Sarkar, Liming Kuang, Yordanka Velikova, Benjamin Busam
110
FluidGaussian: Propagating Simulation-Based Uncertainty Toward Functionally-Intelligent 3D Reconstruction PDF ↗
Yuqiu Liu, Jialin Song, Marissa Ramirez de Chanlatte, Rochishnu Chowdhury, Rushil Paresh Desai, Wuyang Chen, Daniel Martin, Michael W. Mahoney
111
GaussFusion: Improving 3D Reconstruction in the Wild with A Geometry-Informed Video Generator PDF ↗
Liyuan Zhu, Manjunath Narayana, Michal Stary, Will Hutchcroft, Gordon Wetzstein, Iro Armeni
112
LagerNVS: Latent Geometry for Fully Neural Real-time Novel View Synthesis PDF ↗
Stanislaw Szymanowicz, Minghao Chen, Jianyuan Wang, Christian Rupprecht, Andrea Vedaldi
113
Turbo-GS: Accelerating 3D Gaussian Fitting for High-Resolution Radiance Fields PDF ↗
Ankit Dhiman, Tao Lu, R Srinath, Emre Arslan, Angela Xing, Yuanbo Xiangli, Venkatesh Babu Radhakrishnan, Srinath Sridhar
114
BiProLoRA: Bilevel Prompt LoRA for Real Scene Recovery PDF ↗
Nan An, Long Ma, Tengyu Ma, Zhu Liu, Yingchi Liu, Risheng Liu
115
Degradation-Consistent Test-Time Adaptation for All-in-One Image Restoration PDF ↗
Ni Tang, Shenghao Nie, Xiaotong Luo, Yuan Xie, Yanyun Qu
116
CanonCGT: Reference-Based Color Grading via Canonical Pivot Representation PDF ↗
Jinwon Ko, Keunsoo Ko, Chang-Su Kim
117
2-Shots in the Dark: Low-Light Denoising with Minimal Data Acquisition PDF ↗
Liying Lu, Raphael Achddou, Sabine Süsstrunk
118
Restore, Assess, Repeat: A Unified Framework for Iterative Image Restoration PDF ↗
I-Hsiang Chen, Isma Hadji, Enrique Sanchez, Adrian Bulat, Sy-Yen Kuo, Radu Timofte, Georgios Tzimiropoulos, Brais Martinez
119
It Takes Two: A Duet of Periodicity and Directionality for Burst Flicker Removal PDF ↗
Lishen Qu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang
120
Scan Clusters, Not Pixels: A Cluster-Centric Paradigm for Efficient Ultra-high-definition Image Restoration PDF ↗
Chen Wu, Ling Wang, Zhuoran Zheng, Yuning Cui, Zhixiong Yang, Xiangyu Chen, Yue Zhang, Weidong Jiang, Jingyuan Xia
121
Seeing Beyond 8bits: Subjective and Objective Quality Assessment of HDR-UGC Videos PDF ↗
Shreshth Saini, Bowen Chen, Yilin Wang, Neil Birkbeck, Balu Adsumilli, Alan C. Bovik
122
Dynamic Exposure Burst Image Restoration PDF ↗
Woohyeok Kim, Jaesung Rim, Daeyeon Kim, Sunghyun Cho
123
FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration PDF ↗
Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji
124
ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization PDF ↗
Bingchen Li, Zhixin Wang, Fan Li, Jiaqi Xu, Jiaming Guo, Renjing Pei, Xin Li, Zhibo Chen
125
VEMamba: Efficient Isotropic Reconstruction of Volume Electron Microscopy with Axial-Lateral Consistent Mamba PDF ↗
Longmi Gao, Pan Gao
126
Anatomica: Localized Control over Geometric and Topological Properties for Anatomical Diffusion Models PDF ↗
Karim Kadry, Abdalla Abdelwahed, Ajay Manicka, Naravich Chutisilp, Farhad R. Nezami, Elazer R. Edelman
127
EMGauss: Continuous Slice-to-3D Reconstruction via Dynamic Gaussian Modeling in Volume Electron Microscopy PDF ↗
Yumeng He, Zanwei Zhou, Yekun Zheng, Chen Liang, Yunbo Wang, Xiaokang Yang
128
Underground Plant Exploration: Non-Destructive 3D Root Assessment with GPR Based on Point Graph Neural Network PDF ↗
Yuwei Zhou, Guoyu Lu
129
Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities PDF ↗
Peibo Song, Xiaotian Xue, Jinshuo Zhang, Zihao Wang, Jinhua Liu, Shujun Fu, Fangxun Bao, Si Yong Yeo
130
MicroFM: Physics-guided Flow Matching for Isotropic Microscopy Reconstruction PDF ↗
Xingzu Zhan, Runmin Jiang, Vatsal Gupta, Tanush Swaminathan, Yanwen Wang, Genpei Zhang, Haili Wang, Min Xu
131
Dynamic Stream Network for Combinatorial Explosion Problem in Deformable Medical Image Registration PDF ↗
Shaochen Bi, Yuting He, Weiming Wang, Hao Chen
132
PMRNet: Physics-informed Multi-scale Refinement Network for Medical Image Segmentation PDF ↗
Boce Kang
133
Towards Robust Vision Transformers: Path Dependency Analysis and a Simple Two-Stage Adversarial Training PDF ↗
Seongmin Kim, Byung Cheol Song
134
PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention PDF ↗
Hefei Mei, Zirui Wang, Chang Xu, Jianyuan Guo, Minjing Dong
135
When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness PDF ↗
Sunoh Kim, Daeho Um
136
Hidden Dangers of Compositional Generation: Diagnosing Semantic Safety Failures in Text-to-Image Models PDF ↗
Haoming Yang, Ke Ma, Ligong Zhang, Xiaojun Jia, Yingfei Sun, Qianqian Xu, Qingming Huang
137
VisiLock: Authorizing Instruction-based Image editing with Dual Score Distillation PDF ↗
Van Thanh Le, Yun Fu
138
JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization PDF ↗
Haolun Zheng, Yu He, Tailun Chen, Shuo Shao, Zhixuan Chu, Hongbin Zhou, Lan Tao, Zhan Qin, Kui Ren
139
GenBreak: Red Teaming Text-to-Image Generation Using Large Language Models PDF ↗
Zilong Wang, Xiang Zheng, Xiaosen Wang, Bo Wang, Xingjun Ma
140
TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models PDF ↗
Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren Cong
141
Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning PDF ↗
Subin Park, Jung Uk Kim
142
MMCP-GEN: A Modality-Extensible Diffusion Language Model for Conditional Protein Sequence Generation PDF ↗
Zeyu An, Wanyu Lin, Feng Tan, Shujun Wang
143
Few-shot Acoustic Synthesis with Multimodal Flow Matching PDF ↗
Amandine Brunetto
144
CLIP-like Model as a Foundational Density Ratio Estimator PDF ↗
Fumiya Uchiyama, Rintaro Yanagi, Shohei Taniguchi, Shota Takashiro, Masahiro Suzuki, Hirokatsu Kataoka, Yusuke Iwasawa, Yutaka Matsuo
145
Learning What Matters: Prioritized Concept Learning via Relative Error-driven Sample Selection PDF ↗
Qian Yang, Shivam Chandhok, Oscar Mañas, Kanishk Jain, Aishwarya Agrawal, Leonid Sigal
146
EgoAVU: Egocentric Audio-Visual Understanding PDF ↗
Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang, Gregory P. Meyer, Gael Le Lan, Yunyang Xiong, Vikas Chandra, Yangyang Shi, Dinesh Manocha, Zhipeng Cai
147
Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs PDF ↗
Jinqi Luo, Jinyu Yang, Tal Neiman, Lei Fan, Bing Yin, Son Tran, Mubarak Shah, René Vidal
148
Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation PDF ↗
Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang
149
Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models PDF ↗
Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji
150
Adaptive Confidence Regularization for Multimodal Failure Detection PDF ↗
Moru Liu, Hao Dong, Olga Fink, Mario Trapp
151
Factorize, Reconstruct, Enhance: A Unified Framework for Multimodal Sentiment Analysis PDF ↗
Zhilu Yang, Mingcheng Li
152
PhenoYieldNet: Learning Crop-Aware Phenological Responses for Multi-Crop Yield Prediction PDF ↗
Yu Luo, Xiaogang Zhu, Shan Zeng, Wei Xiang, Thomas Francis Bishop, Zhiyong Wang, Kun Hu
153
Conflict-Aware Adaptive Cross-Reconstruction for Multimodal Sentiment Analysis PDF ↗
Yan Wang, Fuyuan Cao, Xingwang Zhao
154
EduDiag: A Benchmark for Educational Diagnostic Reasoning with Error Tracing and Correction on Large Multimodal Models PDF ↗
Jiali Chen, Yuqi Xue, Xusen Hei, DingBa Fu, Yuancheng Wei, Jiayuan Xie, Yi Cai
155
UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark PDF ↗
Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu
156
Disentangle-then-Align: Non-Iterative Hybrid Multimodal Image Registration via Cross-Scale Feature Disentanglement PDF ↗
Chunlei Zhang, Jiahao Xia, Yun Xiao, Bo Jiang, Jian Zhang
157
ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding PDF ↗
Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Aude Oliva, Rogerio Feris
158
Cross-Modal Guided Visual Synthesis for Data-Efficient Multimodal Depression Recognition PDF ↗
Shanliang Yang, Xiaoxiao Wang
159
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis PDF ↗
Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He
160
PAM: A Pose–Appearance–Motion Engine for Sim-to-Real HOI Video Generation PDF ↗
Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao
161
AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Affordance Correspondence PDF ↗
Jiawei Zhang, Kaizhe Hu, Yingqian Huang, Yuanchen Ju, Zhengrong Xue, Huazhe Xu
162
HandWorld: Hand-Centric Unified Video Action Generation PDF ↗
Zhihao Sun, Zhiying Du, Xitong Yang, Zuxuan Wu
163
HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis PDF ↗
Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang
164
ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions PDF ↗
Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo
165
LAM: Language Articulated Object Modelers PDF ↗
Yipeng Gao, Yunhao Ge, Peilin Cai, Daniel Seita, Laurent Itti
166
Haptic Neural Fields: Bringing Tactile Interactions to 3D Rendered Scenes PDF ↗
Antonio Luigi Stefani, Niccolò Bisagno, Nicola Conci, Eckehard Steinbach, Francesco De Natale
167
Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation PDF ↗
Haodong Yan, Hang Yu, Zhide Zhong, Weilin Yuan, Xin Gong, Zehang Luo, Chengxi Heyu, Junfeng Li, Wenxuan Song, Shunbo Zhou, Haoang Li
168
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing PDF ↗
Runjia Li, Moayed Haji-Ali, Ashkan Mirzaei, Chaoyang Wang, Arpit Sahni, Ivan Skorokhodov, Aliaksandr Siarohin, Tomas Jakab, Junlin Han, Sergey Tulyakov, Philip Torr, Willi Menapace
169
From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition PDF ↗
Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos
170
Temporal Equilibrium MeanFlow: Bridging the Scale Gap for One- Step Generation PDF ↗
Yuanpeng Tu, Yunpeng Chen, Xinyu Zhang, Chao Liao, Hengshuang Zhao
171
PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try- On PDF ↗
Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu
172
Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy PDF ↗
Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi
173
UniSER: A Foundation Model for Unified Soft Effects Removal PDF ↗
Jingdong Zhang, Lingzhi Zhang, Qing Liu, Mang Tik Chiu, Connelly Barnes, Yizhou Wang, Haoran You, Xiaoyang Liu, Yuqian Zhou, Zhe Lin, Eli Shechtman, Sohrab Amirghodsi, Xin Li, Wenping Wang, Xiaohang Zhan
174
EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation PDF ↗
Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao
175
Inference-time Physics Alignment of Video Generative Models with Latent World Models PDF ↗
Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich, Nicolas Beltran-Velez, Melissa Hall, Reyhane Askari-Hemmat, Xiaochuang Han, Nicolas Ballas, Michal Drozdzal, Adriana Romero-Soriano
176
SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation PDF ↗
Xuancheng Xu, Yaning Li, Sisi You, Bing-Kun Bao
177
Plenoptic Video Generation PDF ↗
Xiao Fu, Shitao Tang, Min Shi, Xian Liu, Jinwei Gu, Ming-Yu Liu, Dahua Lin, Chen-Hsuan Lin
178
PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference PDF ↗
Denis Korzhenkov, Adil Karjauv, Animesh Karnewar, Mohsen Ghafoorian, Amirhossein Habibian
179
AdapTok: Learning Adaptive and Temporally Causal Video Tokenization in a 1D Latent Space PDF ↗
Yan Li, Changyao Tian, Renqiu Xia, Ning Liao, Weiwei Guo, Hongsheng Li, Jifeng Dai, Hao Li, Xue Yang
180
OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory PDF ↗
Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, Tian Xie
181
Flowception: Temporally Expansive Flow Matching for Video Generation PDF ↗
Tariq Berrada Ifriqi, John Nguyen, Karteek Alahari, Jakob Verbeek, Ricky T. Q. Chen
182
Qwen-Image-Layered: Towards Inherent Editability via Layer Decomposition PDF ↗
Shengming Yin, Zekai Zhang, Zecheng Tang, Kaiyuan Gao, Xiao Xu, Kun Yan, Jiahao Li, Yilei Chen, Yuxiang Chen, Heung-Yeung Shum, Lionel M. Ni, Junyang Lin, Chenfei Wu
183
Linear Image Generation by Synthesizing Exposure Brackets PDF ↗
Yuekun Dai, Zhoutong Zhang, Shangchen Zhou, Nanxuan Zhao
184
Low-Resolution Editing is All You Need for High-Resolution Editing PDF ↗
Junsung Lee, Hyunsoo Lee, Yong Jae Lee, Bohyung Han
185
UniGenDet: A Unified Generative-Discriminative Framework for Co-Evolutionary Image Generation and Generated Image Detection PDF ↗
Yanran Zhang, Wenzhao Zheng, Yifei Li, Bingyao Yu, Yu Zheng, Lei Chen, Jiwen Lu, Jie Zhou
186
iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation PDF ↗
Zhoujie Fu, Xianfang Zeng, Jinghong Lan, Xinyao Liao, Cheng Chen, Junyi Chen, Jiacheng Wei, Wei Cheng, Shiyu Liu, Yunuo Chen, Gang Yu, Guosheng Lin
187
VENI: Variational Encoder for Natural Illumination PDF ↗
Paul Walker, James A. D. Gardner, Andreea Ardelean, William A. P. Smith, Bernhard Egger
188
SketchAssist: A Practical Assistant for Semantic Edits and Precise Local Redrawing PDF ↗
Han Zou, Yan Zhang, Ruiqi Yu, Cong Xie, Jie Huang, Zhenpeng Zhan
189
MultiShotMaster: A Controllable Multi-Shot Video Generation Framework PDF ↗
Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia
190
MoCha: End-to-End Video Character Replacement without Structural Guidance PDF ↗
Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li
191
Negative Binomial Variational Autoencoders for Overdispersed Latent Modeling PDF ↗
Yixuan Zhang, Jinhao Sheng, Wenxin Zhang, Quyu Kong, Feng Zhou
192
Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods PDF ↗
Omer Ben Hayun, Roy Betser, Meir Yossef Levi, Levi Kassel, Guy Gilboa
193
VOSR: A Vision-Only Generative Model for Image Super- Resolution PDF ↗
Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Xiangtao Kong, Jixin Zhao, Shihao Wang, Lei Zhang
194
Dual Graph Regularized Deep Unfolding Network for Guided Depth Map Super-resolution PDF ↗
Zhiwei Zhong, Peilin Chen, Qiangqiang Shen, Bo Li, Shiqi Wang
195
DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution PDF ↗
Zhengyao Lv, Menghan Xia, Xintao Wang, Kwan-Yee K. Wong
196
VSRELL: A Simple Baseline for Video Super-Resolution and Enhancement in Low-Light Environment PDF ↗
Yanming Hui, Fanhua Shang, Hongying Liu, Ben Wang, Zhenwei Zhang, Liang Wan, Wei Feng, Tong Xue, Bingqin Lv
197
Gradient Knows Best: Mixed-Precision Quantization via Gradient- Guided Bit Allocation for Super-Resolution PDF ↗
Jun Young Kim, Joo Hyeon Jeon, Sangyeon Ahn, Yoonseo Park, Yong Seok Oh, Bogyeong Kim, Sung In Cho
198
Toward Real-world Infrared Image Super-Resolution: A Unified Autoregressive Framework and Benchmark Dataset PDF ↗
Yang Zou, Jun Ma, Zhidong Jiao, Xingyuan Li, Zhiying Jiang, Jinyuan Liu
199
Next-Scale Autoregressive Models for Text-to-Motion Generation PDF ↗
Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao
200
Push-and-Step: From RL-Based Balance Recovery to Physical Simulation of Dense Crowds PDF ↗
Alexis Jensen, Pei Xu, Ioannis Karamouzas, Charles Pontonnier, Julien Pettré
201
Iterative Closed-Loop Motion Synthesis for Scaling the Capabilities of Humanoid Control PDF ↗
Weisheng Xu, Qiwei Wu, Jiaxi Zhang, Jing Tan, Yangfan Li, Yuetong Fang, Jiaqi Xiong, Kai Wu, Rong Ou, Renjing Xu
202
RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation PDF ↗
Jiahao Zhang, Joseph Liu, Young-Yoon Lee, Seonghyeon Moon, Victor Zordan, Guy Tevet, C. Karen Liu, Stephen Gould, Oren Jacob, Haomiao Jiang, Mubbasir Kapadia, Yizhak Ben-Shabat
203
FrankenMotion: Part-level Human Motion Generation and Composition PDF ↗
Chuqiao Li, Xianghui Xie, Yong Cao, Andreas Geiger, Gerard Pons-Moll
204
HSI-GPT2: A Dual-Granularity Large Motion Reasoning Model with Diffusion Refinement for Human–Scene Interaction PDF ↗
Yuan Wang, Xiang Li, Yali Li, Xuege Hou, Shengjin Wang
205
SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens PDF ↗
Anindita Ghosh, Vladislav Golyanik, Taku Komura, Philipp Slusallek, Christian Theobalt, Rishabh Dabral
206
Progressive Guessing to Fixed Point: Rethinking Human Motion Prediction with Deep Equilibrium Models PDF ↗
Dong Wei, Huaijiang Sun, Fan Liu, Yuhui Zheng
207
Archon: A Unified Multimodal Model for Holistic Digital Human Generation PDF ↗
Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang
208
ReMoGen: Real-time Human Interaction-to-Reaction Generation via Modular Learning from Diverse Data PDF ↗
Yaoqin Ye, Yiteng Xu, Qin Sun, Xinge Zhu, Yujing Sun, Yuexin Ma
209
Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots PDF ↗
Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang
210
PatchScene: Patch-based Voxel Diffusion Model for Large-Scale Scene Completion PDF ↗
Qingdong Xu, Jiajun Zhu, Shilin Zhu, Xinjing He, Chao Lu, Huanran Wang, Jiyao Zhang
211
Prototype-Guided Concept Erasure in Diffusion Models PDF ↗
Yuze Cai, Jiahao Lu, Hongxiang Shi, Yichao Zhou, Hong Lu
212
Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study PDF ↗
Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao
213
CARD: Correlation Aware Restoration with Diffusion PDF ↗
Niki Nezakati, Arnab Ghosh, Amit Roy-Chowdhury, Vishwanath Saragadam
214
DMAligner: Enhancing Image Alignment via Diffusion Model Based View Synthesis PDF ↗
Xinglong Luo, Ao Luo, Zhengning Wang, Yueqi Yang, Chaoyu Feng, Lei Lei, Bing Zeng, Shuaicheng Liu
215
DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease PDF ↗
Runsheng Bai, Chengyu Zhang, Yangdong Deng
216
Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models? PDF ↗
Renye Yan, Jikang Cheng, Shikun Sun, Yi Sun, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Junliang Xing, Yimao Cai
217
CSF: Black-box Fingerprinting via Compositional Semantics for Text- to-Image Models PDF ↗
Junhoo Lee, Mijin Koo, Nojun Kwak
218
InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior PDF ↗
Weimin Bai, Suzhe Xu, Yiwei Ren, Jinhua Hao, Ming Sun, Wenzheng Chen, He Sun
219
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition–Perception–Reasoning Guided Text-Image Machine Translation PDF ↗
Gengluo Li, Chengquan Zhang, Yupu Liang, Huawen Shen, Yaping Zhang, Pengyuan Lyu, Weinong Wang, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou
220
M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models PDF ↗
Joongmin Shin, Jeongbae Park, Jaehyung Seo, Heuiseok Lim
221
Towards Policy-Adaptive Image Guardrail: Benchmark and Method PDF ↗
Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou
222
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly PDF ↗
Aditya Chetan, Eric Cai, Peeyush Kushwaha, Bharath Raj Nagoor Kani, Utkarsh Mall, Qianqian Wang, Noah Snavely, Bharath Hariharan
223
TextFM: Robust Semi-dense Feature Matching with Language Guidance PDF ↗
Zhihao Zheng, Jinglun Feng, Nirav Savaliya, Zheng-Hang Yeh, Bo Lang, Mooi Choo Chuah
224
What’s Wrong with Synthetic Data for Scene Text Recognition? A Strong Synthetic Engine with Diverse Simulations and Self- Evolution PDF ↗
Xingsong Ye, Yongkun Du, JiaXin Zhang, Chen Li, Jing LYU, Zhineng Chen
225
Boosting Document Parsing Efficiency and Performance with Coarse- to-Fine Visual Processing PDF ↗
Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu, Yanjun Ma
226
SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation PDF ↗
Jialiang Kang, Han Shu, Wenshuo Li, Yingjie Zhai, Xinghao Chen
227
Point Cloud as a Foreign Language for Multi-modal Large Language Model PDF ↗
Sneha Paul, Zachary Patterson, Nizar Bouguila
228
Grounded 3D-Aware Spatial Vision-Language Modeling PDF ↗
An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu
229
SpatialTree: How Spatial Intelligence Branches Out in MLLMs PDF ↗
Yuxi Xiao, Longfei Li, Shen Yan, Xinhang Liu, Sida Peng, Yunchao Wei, Xiaowei Zhou, Bingyi Kang
230
TerraScope: Pixel-Grounded Visual Reasoning for Earth Observation PDF ↗
Yan Shu, Bin Ren, Zhitong Xiong, Xiao Xiang Zhu, Begüm Demir, Nicu Sebe, Paolo Rota
231
Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning PDF ↗
Chun-Hsiao Yeh, Shengyi Qian, Manchen Wang, Yi Ma, Joseph Tighe, Fanyi Xiao
232
OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding PDF ↗
Sheng-Yu Huang, Jaesung Choe, Yu-Chiang Frank Wang, Cheng Sun
233
BOP-ASK: Object-Interaction Reasoning for Vision-Language Models PDF ↗
Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay
234
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models PDF ↗
Shengli Zhou, Minghang Zheng, Feng Zheng, Yang Liu
235
Eliciting Complex Spatial Reasoning in MLLMs through Wide- Baseline Matching PDF ↗
Hao Zhong, Muzhi Zhu, Shenyan Zeng, Anzhou Li, Cong Chen, Hua Geng, Duochao Shi, Wentao Ye, Tao Lin, Hao Chen, Chunhua Shen
236
REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting PDF ↗
Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu
237
From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs PDF ↗
Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang
238
MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation PDF ↗
Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao
239
SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models PDF ↗
Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei
240
ReMatch: Boosting Representation through Matching for Multimodal Retrieval PDF ↗
Qianying Liu, Xiao Liang, Zhiqiang Zhang, Yibo Chen, Xu Tang, Zhongfei Qing, Fengfan Zhou, Yao Hu, Paul Henderson
241
RI-Mamba: Rotation-Invariant Mamba for Robust Text-to-Shape Retrieval PDF ↗
Khanh Nguyen, Dasith de Silva Edirimuni, Ghulam Mubashar Hassan, Ajmal Mian
242
Revisiting F-measure Optimization in Multi-Label Classification: A Sampling-based Approach PDF ↗
Zixun Wang
243
Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs PDF ↗
Dmitry Demidov, Muhammad Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer
244
WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval PDF ↗
Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang
245
Modeling the Visual Ambiguity of Human Sketches PDF ↗
Yang Zhou, Ping Ni, Jin Wang, Senyun Jia, Jingdan Yan, Kaixiang Huang, Guodong Lu, Jingru Yang, Shengfeng He
246
SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross- Subject EEG-to-Image Retrieval PDF ↗
Qunjie Huang, Weina Zhu
247
ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval PDF ↗
Zixu Li, Yupeng Hu, Zhiwei Chen, Mingyu Zhang, Zhiheng Fu, Liqiang Nie
248
V^2-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence PDF ↗
Jiancheng Pan, Runze Wang, Tianwen Qian, Mohammad Mahdi, Yanwei Fu, Xiangyang Xue, Xiaomeng Huang, Luc Van Gool, Danda Pani Paudel, Yuqian Fu
249
WeaveTime: Streaming from Earlier Frames into Emergent Memory in VideoLLMs PDF ↗
Yulin Zhang, Cheng Shi, Sibei Yang
250
Streaming Video Crime Anticipation with Spatio-Temporal Causal Reasoning PDF ↗
Yusong Wang, Zheyuan Gu, Keyu Mao, Minghao Shao, Mingkun Xu, Prayag Tiwari, Jiawei Shao, Qingsong Zhao
251
Efficient Frame Selection for Long Video Understanding via Reinforcement Learning PDF ↗
Yaxuan Qin, Hefei Li, Wenqi Mu, Yancheng He
252
HieraMamba: Video Temporal Grounding via Hierarchical Anchor- Mamba Pooling PDF ↗
Joungbin An, Kristen Grauman
253
InternVideo-Next: Towards World-Understanding Video Models PDF ↗
Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Ziang Yan, Yali Wang, Yi Wang, Limin Wang
254
Condensed Test-Time Adaptation of VLMs for Action Recognition PDF ↗
Wenxuan Ge, Hongyu Qu, Rui Yan, Guo-Sen Xie, Yazhou Yao, Xiangbo Shu, Jinhui Tang
255
Test-time Ego-Exo-centric Adaptation for Action Anticipation via Multi-Label Prototype Growing and Dual-Clue Consistency PDF ↗
Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Qingbo Wu, Fanman Meng, Lili Pan, Hongliang Li
256
A Stitch in Time: Learning Procedural Workflow via Self-Supervised Plackett–Luce Ranking PDF ↗
Chengan Che, Chao Wang, Xinyue Chen, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera
257
SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark PDF ↗
Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen
258
Attend Before Attention: Efficient and Scalable Video Understanding via Autoregressive Gazing PDF ↗
Baifeng Shi, Stephanie Fu, Long Lian, Hanrong Ye, David Eigen, Aaron Reite, Jan Kautz, Boyi Li, David M. Chan, Trevor Darrell, Pavlo Molchanov, Hongxu Yin
259
Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness PDF ↗
Yehonatan Elisha, Oren Barkan, Noam Koenigstein
260
Explaining Object Detectors via Collective Contribution of Pixels PDF ↗
Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto
261
Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation PDF ↗
Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao
262
H-Sets: Hessian-Guided Discovery of Set-Level Feature Interactions in Image Classifiers PDF ↗
Ayushi Mehrotra, Dipkamal Bhusal, Michael Clifford, Nidhi Rastogi
263
Evaluating Generative Models via One-Dimensional Code Distributions PDF ↗
Zexi Jia, Pengcheng Luo, Yijia Zhong, Jinchao Zhang, Jie Zhou
264
TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection PDF ↗
Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng
265
BuildAnyPoint: 3D Building Structured Abstraction from Diverse Point Clouds PDF ↗
Tongyan Hua, Haoran Gong, Yuan Liu, Di Wang, Ying-Cong Chen, Wufan Zhao
266
LiDAR-to-4DRadar Diffusion Bridge via Cross-Modal Alignment and Translation in Latent Space PDF ↗
Dazhong Shen, Jingjing Gu, Qiang Zhou, Meng Zhao, Ying Sun
267
Edges Compete for Trust: Group Relative Edge Optimization for Building Reconstruction from Point Clouds PDF ↗
Yujun Liu, Ruisheng Wang, Xiang Ao, Haoyuan Shen, Kuihao Wang, Kun Zhou, Qingquan Li
268
Unsupervised Monocular 3D Keypoint Discovery from Multi-View Diffusion Priors PDF ↗
Subin Jeon, In Cho, Junyoung Hong, Woong Oh Cho, Seon Joo Kim
269
QD-PCQA: Quality-Aware Domain Adaptation for Point Cloud Quality Assessment PDF ↗
Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin
270
L3DR: 3D-aware LiDAR Diffusion and Rectification PDF ↗
Quan Liu, Xiaoqin Zhang, Ling Shao, Shijian Lu
271
Ghost-FWL: A Large-Scale Full-Waveform LiDAR Dataset for Ghost Detection and Removal PDF ↗
Kazuma Ikeda, Ryosei Hara, Rokuto Nagata, Ozora Sako, Zihao Ding, Takahiro Kado, Ibuki Fujioka, Taro Beppu, Mariko Isogawa, Kentaro Yoshioka
272
Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain PDF ↗
Avery Gump, Connor Henley, Sungjin Cheong, Akarsh Prabhakara, Mohit Gupta
273
MS^2Gait: A Multi-Scale Spatio-Temporal Fusion Network for LiDAR- based Gait Recognition PDF ↗
Shenyin Xu, Yishan Wang, Xinyu Li, Rui Liu, Zhongyuan Wang, Xin Tian
274
Foundry: Distilling 3D Foundation Models for the Edge PDF ↗
Guillaume Letellier, Siddharth Srivastava, Frederic Jurie, Gaurav Sharma
275
Learning to Identify Out-of-Distribution Objects for 3D LiDAR Anomaly Segmentation PDF ↗
Simone Mosco, Daniel Fusaro, Alberto Pretto
276
Dual-Level Confidence based Implicit Self-Refinement for Medical Visual Question Answering PDF ↗
Meihong Pan, Yefeng Zheng
277
FedMPT: Federated Multi-Label Prompt Tuning of Vision-Language Models PDF ↗
Xucong Wang, Pengkun Wang, Zhe Zhao, Liheng Yu, Shuang Wang, Yang Wang
278
Rethinking Model Selection in VLM Through the Lens of Gromov- Wasserstein Distance PDF ↗
Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu
279
NTK-Guided Implicit Neural Teaching PDF ↗
Chen Zhang, Wei Zuo, Bingyang Cheng, Yikun Wang, Wei-Bin Kou, Yik-Chung Wu, Ngai Wong
280
SynthRGB-T: Language-Vision Guided Image Translation for Diversity Synthesis PDF ↗
Jiangang Ding, Yiquan Du, Pengxiang Li, Lili Pei, Yuanlin Zhao, Wei Li
281
Text-Printed Image: Bridging the Image-Text Modality Gap for Text- centric Training of Large Vision-Language Models PDF ↗
Shojiro Yamabe, Futa Waseda, Daiki Shiono, Tsubasa Takahashi
282
Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs PDF ↗
Ziqi Wang, Chang Che, Qi Wang, Hui Ma, Zenglin Shi, Cees G. M. Snoek, Meng Wang
283
StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues PDF ↗
Zanxi Ruan, Songqun Gao, Qiuyu Kong, Yiming Wang, Marco Cristani
284
Same or Not? Enhancing Visual Perception in Vision-Language Models PDF ↗
Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari
285
Vector Prism: Animating Vector Graphics by Stratifying Semantic Structure PDF ↗
Jooyeol Yun, Jaegul Choo
286
AssemblyBench: Physics-Aware Assembly of Complex Industrial Objects PDF ↗
Danrui Li, Jiahao Zhang, Bernhard Egger, Moitreya Chatterjee, Suhas Lohit, Tim K. Marks, Anoop Cherian
287
Animator-Centric Skeleton Generation on Objects with Fine-Grained Details PDF ↗
Mingze Sun, Cheng Zeng, Jiansong Pei, Junhao Chen, Chaoyue Song, Shaohui Wang, Tianyuan Chang, Bin Huang, Zijiao Zeng, Ruqi Huang
288
Synthesizing Visual Concepts as Vision-Language Programs PDF ↗
Antonia Wüst, Wolfgang Stammer, Hikaru Shindo, Lukas Helff, Devendra Singh Dhami, Kristian Kersting
289
Self-Consistency for LLM-Based Motion Trajectory Generation and Verification PDF ↗
Jiaju Ma, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala
290
Semantic Scale Space: A Framework for Controllable Image Abstraction PDF ↗
Kazu Mishiba
291
Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer- based Edges & Faces Selection PDF ↗
Dacheng Qi, Chenyu Wang, Jingwei Xu, Tianzhe Chu, Zibo Zhao, Wen Liu, Wenrui Ding, Yi Ma, Shenghua Gao
292
DSFlash: Comprehensive Panoptic Scene Graph Generation in Realtime PDF ↗
Julian Lorenz, Vladyslav Kovganko, Elias Kohout, Mrunmai Phatak, Daniel Kienzle, Rainer Lienhart
293
SIF: Semantically In-Distribution Fingerprints for Large Vision- Language Models PDF ↗
Yifei Zhao, Qian Lou, Mengxin Zheng
294
Designing to Forget: Deep Semi-parametric Models for Unlearning PDF ↗
Amber Yijia Zheng, Yu-Shan Tai, Raymond A. Yeh
295
Meta-FC: Meta-Learning with Feature Consistency for Robust and Generalizable Watermarking PDF ↗
Yuheng Li, Weitong Chen, Chengcheng Zhu, Jiale Zhang, Chunpeng Ge, Di Wu, Guodong Long
296
PrivSynth: Alternating and Control-Based Optimization for Privacy and Utility in Synthetic Data PDF ↗
Xinyuan Zhao, Hanlin Gu, Guibao Song, Gongxi Zhu, Yifei Zou, Lixin Fan, Yuxing Han
297
Neighbor-Aware Localized Concept Erasure in Text-to-Image Diffusion Models PDF ↗
Zhuan Shi, Alireza Dehghanpour Farashah, Rik de Vries, Golnoosh Farnadi
298
EcoAlign: An Economically Rational Framework for Efficient LVLM Alignment PDF ↗
Ruoxi Cheng, Hao-Xuan Ma, Teng Ma, Hongyi Zhang
299
Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models PDF ↗
Yabin Zhang, Maya Varma, Yunhe Gao, Jean-Benoit Delbrouck, Jiaming Liu, Chong Wang, Curtis Langlotz
300
A Polynomial Chaos Framework for Causal Discovery in Nonlinear Uncertain Systems PDF ↗
Liang Cao
301
Domain-Skewed Federated Learning with Feature Decoupling and Calibration PDF ↗
Huan Wang, Jun Shen, Jun Yan, Guansong Pang
302
From Selection to Scheduling: Federated Geometry-Aware Correction Makes Exemplar Replay Work Better under Continual Dynamic Heterogeneity PDF ↗
Zhuang Qi, Ying-Peng Tang, Lei Meng, Guoqing Chao, Lei Wu, Han Yu, Xiangxu Meng
303
Fine-Tuning Impairs the Balancedness of Foundation Models in Long-tailed Personalized Federated Learning PDF ↗
Shihao Hou, Chikai Shang, Zhiheng Yang, Jiacheng Yang, Xinyi Shang, Junlong Gao, Yiqun Zhang, Yang Lu
304
Few-for-Many Personalized Federated Learning PDF ↗
Ping Guo, Tiantian Zhang, Xi Lin, Xiang Li, Zhi-Ri Tang, Qingfu Zhang
305
ProxyFL: A Proxy-Guided Framework for Federated Semi-Supervised Learning PDF ↗
Duowen Chen, Yan Wang
306
Domain Sensitive Federated Learning with Fisher-Informed Pruning PDF ↗
Chenchen Lin, Wenhao Yuan, Zhengji Xu, Xuehe Wang
307
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs PDF ↗
Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer
308
Bridging Facial Understanding and Animation via Language Models PDF ↗
Luchuan Song, Pinxin Liu, Haiyang Liu, Zhenchao Jin, Yolo Yunlong Tang, Zichong Xu, Susan Liang, Jing Bi, Jason J Corso, Chenliang Xu
309
AR²-4FV: Anchored Referring and Re-identification for Long-Term Grounding in Fixed-View Videos
Teng Yan, Yihan Liu, Jiongxu Chen, Teng Wang, Jiaqi Li, Bingzhuo Zhong
310
CVA: Context-aware Video-text Alignment for Video Temporal Grounding PDF ↗
Sungho Moon, Seunghun Lee, Jiwan Seo, Sunghoon Im
311
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios PDF ↗
Hong Gao, Jingyu Wu, Xiangkai Xu, Kangni Xie, Yunchen Zhang, Bin Zhong, Xurui Gao, Min-Ling Zhang
312
ST4R-Splat: Spatio-Temporal Referring Segmentation in 4D Gaussian Splatting PDF ↗
Yuming Meng, Dong Wu, Hongbin Zha
313
WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens PDF ↗
Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha
314
Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference PDF ↗
Yushi Ye, Feng Hong, Huangjie Zheng, Xu Chen, Zhiyong Chen, Yanfeng Wang, Jiangchao Yao
315
Towards Unified Human Perception and Machine Understanding: Token Flow Guided Compression Framework PDF ↗
Li Xu, Yingfu Zhang, Kepeng Xu, Gang He, Yunsong Li
316
A More Word-like Image Tokenization for MLLMs PDF ↗
Hyun Lee, Hyemin Jeong, Yejin Kim, Hyungwook Choi, Hyunsoo Cho, Soo Kyung Kim, Joonseok Lee
317
DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference PDF ↗
Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum
318
Unified Spatiotemporal Token Compression for Video-LLMs at Ultra- Low Retention PDF ↗
Junhao Du, Jialong Xue, Anqi Li, Jincheng Dai, Guo Lu
319
One Layer’s Trash is Another Layer’s Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs PDF ↗
Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu
320
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models PDF ↗
Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang
321
Tunable Soft Equivariance with Guarantees PDF ↗
Md Ashiqur Rahman, Lim Jun Hao, Jeremiah Jiang, Teck-Yian Lim, Raymond A. Yeh
322
Semi-Supervised Conformal Prediction With Unlabeled Nonconformity Score PDF ↗
Xuanning Zhou, Zihao Shi, Hao Zeng, Xiaobo Xia, Bingyi Jing, Hongxin Wei
323
Cluster-aware Anchor Learning for Multi-View Clustering PDF ↗
Zhe Chen, Fanhui Meng, Tianyang Xu, Xiao-Jun Wu
324
Revisiting Sparsity Constraint Under High-Rank Property in Partial Multi-Label Learning PDF ↗
Chongjie Si, Yidan Cui, Fuchao Yang, Wei Shen
325
Weight Space Representation Learning via Neural Field Adaptation PDF ↗
Zhuoqian Yang, Mathieu Salzmann, Sabine Süsstrunk
326
Recurrent Video Masked Autoencoders PDF ↗
Daniel Zoran, Nikhil Parthasarathy, Yi Yang, Drew A Hudson, João Carreira, Andrew Zisserman
327
Revisiting Unknowns: Towards Effective and Efficient Open-Set Active Learning PDF ↗
Chen-Chen Zong, Yu-Qi Chi, Xie-Yang Wang, Yan Cui, Sheng-Jun Huang
328
Seeing Through the Shift: Causality-Inspired Robust Generalized Category Discovery PDF ↗
Wei Feng, Yiwen Jiang, Sijin Zhou, Zhuang Qi, Zhongxing Xu, Zhonghua Wang, Feilong Tang, Zongyuan Ge
329
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training PDF ↗
Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai-Man Po
330
Spatial Retrieval Augmented Autonomous Driving PDF ↗
Xiaosong Jia, Chenhe Zhang, Yule Jiang, Songbur Wong, Zhiyuan Zhang, Chen Chen, Shaofeng Zhang, Xuanhe Zhou, Xue Yang, Junchi Yan, Yu-Gang Jiang
331
Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems PDF ↗
Tolga Dimlioglu, Nadine Chang, Maying Shen, Rafid Mahmood, Jose M. Alvarez
332
ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving PDF ↗
Qihang Peng, Xuesong Chen, Chenye Yang, Shaoshuai Shi, Hongsheng Li
333
CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography PDF ↗
Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich
334
MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving PDF ↗
Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu
335
WPT: World-to-Policy Transfer via Online World Model Distillation PDF ↗
Guangfeng Jiang, Yueru Luo, Jun Liu, Yi Huang, Yiyao Zhu, Zhan Qu, Dave Zhenyu Chen, Bingbing Liu, Xu Yan
336
ClimaOoD: Improving Anomaly Segmentation via Physically Realistic Synthetic Data PDF ↗
Yuxing Liu, Zheng Li, Huanhuan Liang, Ji Zhang, Zeyu Sun, Yong Liu
337
Recover to Predict: Progressive Retrospective Learning for Variable- Length Trajectory Prediction PDF ↗
Hao Zhou, Lu Qi, Xiangtai Li, Jie Zhang, Yi Liu, Xu Yang, Mingyu Fan, Fei Luo
338
URScenes: A Multi-scenario Dataset for Unstructured Road Environments PDF ↗
Runsen Liu, Aizemaitijiang Baoerhan, Zhangyu Wang, Jie Wang, Jinghao Cui, Guizhen Yu, Songyue Yang, WanCheng Sun, Mingjun Tang, Zhanbo Hua, Wenwen Luo
339
MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Driving
Junli Wang, Yinan Zheng, Xueyi Liu, Zebin Xing, Pengfei Li, Kun Ma, Hangjun Ye, Guang Chen, Guang Li, Long Chen, Zhongpu Xia, Qichao Zhang
340
SAMosaic3D: Modular Scene Assembly for Real-Time 3D Segment Anything PDF ↗
Peng Wang, Yongcai Wang, Wang Chen, Hualong Cao, Kang Yang, Chunxu Li, Jie Wen, Deying Li
341
Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation PDF ↗
Nikolay Kormushev, Josip Šarić, Matej Kristan
342
MV3DIS: Multi-View Mask Matching via 3D Guides for Zero-Shot 3D Instance Segmentation PDF ↗
Yibo Zhao, Yigong Zhang, Jin Xie
343
PEARL: Geometry Aligns Semantics for Training-Free Open- Vocabulary Semantic Segmentation PDF ↗
Gensheng Pei, Xiruo Jiang, Xinhao Cai, Tao Chen, Yazhou Yao, Byeungwoo Jeon
344
RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation PDF ↗
Anuvab Sen, Mir Sayeed Mohammad, Saibal Mukhopadhyay
345
SAMIX: Reinforcing SAM2 with Semantic Adapter and Reference Selecting Policy for Mix-Supervised Segmentation PDF ↗
Qiang Hu, Jiajie Wei, Zhenyu Yi, Zhifen Yan, Yingjie Guo, Hongkuan Shi, Ge-Peng Ji, Qiang Li, Zhiwei Wang
346
MARSS: Radar Semantic Segmentation via Modular Attention and State Space Models PDF ↗
Fengyu Chen, Tiao Tan, Teng Li, Yuantian Quan, Qingmin Liao
347
MixerCSeg: An Efficient Mixer Architecture for Crack Segmentation via Decoupled Mamba Attention PDF ↗
Zilong Zhao, Zhengming Ding, Pei Niu, Wenhao Sun, Feng Guo
348
Exemplar-Free Class Incremental Learning via Preserving Class- Discriminative Structure PDF ↗
Xin Zhang, Liang Bai, Guanchao Wang, Xian Yang
349
Critical Patch-Aware Sparse Prompting with Decoupled Training for Continual Learning on the Edge PDF ↗
Wonseon Lim, Jaesung Lee, Dae-Won Kim
350
PACT: Phase-Like Transition Constraints in Adapter-Based Continual Learning of Vision-Language Models PDF ↗
Xuan Wang, Guiguang Ding, Jungong Han
351
Representation-Steered Incremental Adapter-Tuning for Class- Incremental Learning with Pre-Trained Models PDF ↗
Jiarui Zhao, Libo Huang, Xiangqi Li, Zhulin An, Chuanguang Yang, Yu Wang, Boyu Diao, Yongjun Xu
352
Re-evaluating Continual VQA: Toward Fair and Robust Evaluation for Multimodal Continual Learning PDF ↗
Zijian Gao, Zicheng Sun, Xingxing Zhang, Kele Xu, Huaimin Wang
353
Distilling Balanced Knowledge from a Biased Teacher PDF ↗
Seonghak Kim
354
Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting PDF ↗
Hyeonseo Jang, Hyuk Kwon, Kibok Lee
355
Beyond Myopic Alignment: Lookahead Optimization for Online Class- Incremental Learning PDF ↗
Song Lai, Zhe Zhao, Fei Zhu, Ji Cheng, Xi Lin, Qingfu Zhang, Gaofeng Meng
356
EmoDiffTalk: Emotion-aware Diffusion for Editable 3D Gaussian Talking Head PDF ↗
Chang Liu, Tianjiao Jing, Chengcheng Ma, Xuanqi Zhou, Zhengxuan Lian, Qin Jin, Hongliang Yuan, Shi-Sheng Huang
357
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation PDF ↗
Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang
358
D^3FER: Dual Channel and Dual Branch Network for Robust Facial Expression Recognition under Dual Challenges PDF ↗
Hui Tang, Yifan He, Zhong Jin
359
HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image PDF ↗
Hezhen Hu, Wangbo Zhao, Lanqing Guo, Hanwen Jiang, Jonathan C. Liu, Zhiwen Fan, Kai Wang, Zhangyang Wang, Georgios Pavlakos
360
ExpPortrait: Expressive Portrait Generation via Personalized Representation PDF ↗
Junyi Wang, Yudong Guo, Boyang Guo, Shengming Yang, Juyong Zhang
361
PersonaLive! Expressive Portrait Image Animation for Live Streaming PDF ↗
Zhiyuan Li, Chi-Man Pun, Chen Fang, Jue Wang, Xiaodong Cun
362
ProFocus: Proactive Perception and Focused Reasoning in Vision- and-Language Navigation PDF ↗
Wei Xue, Mingcheng Li, Xuecheng Wu, Jingqun Tang, Dingkang Yang, Lihua Zhang
363
OptiMVMap: Offline Vectorized Map Construction via Optimal Multi- vehicle Perspectives PDF ↗
Zedong Dan, Zijie Wang, Wei Zhang, Xiangru Lin, Weiming Zhang, Xiao Tan, Jingdong Wang, Liang Lin, Guanbin Li
364
CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving PDF ↗
Pei Liu, Qingtian Ning, Xinyan Lu, Haipeng Liu, Weiliang Ma, Dangen She, Xianpeng Lang, Jun Ma
365
TopoHR: Hierarchical Centerline Representation for Cyclic Topology Reasoning in Driving Scenes with Point-to-Instance Relations PDF ↗
Yifeng Bai, Zhirong Chen, Bo Song, Erkang Cheng, Haibin Ling
366
AURA: Multi-modal Shared Autonomy for Urban Navigation PDF ↗
Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou
367
Zero-Shot Reconstruction of Animatable 3D Avatars with Cloth Dynamics from a Single Image PDF ↗
Joohyun Kwon, Geonhee Sim, Gyeongsik Moon
368
FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision PDF ↗
Tobias Kirschstein, Simon Giebenhain, Matthias Nießner
369
Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining PDF ↗
Junxuan Li, Rawal Khirodkar, Egor Zakharov, Jihyun Lee, Zhaoen Su, Yuan Dong, Julieta Martinez, Kai Li, Qingyang Tan, Takaaki Shiratori, Matthew Hu, Peihong Guo, Xuhua Huang, Zhongshi Jiang, Lingchen Yang, Ariyan Zarei, Marco Pesavento, Yichen Xu, Chengan He, He Wen, Giljoo Nam, Teng Deng, Wyatt Borsos, Anjali Thakrar, Jean-Charles Bazin, Rinat Abdrashitov, Carsten Stoll, Ginés Hidalgo, James Booth, Lucy Wang, Xiaowen Ma, Yu Rong, Sairanjith Thalanki, Chen Cao, Christian Häne, Abhishek Kar, Sofien Bouaziz, Jason Saragih, Yaser Sheikh, Shunsuke Saito
370
UIKA: Fast Universal Head Avatar from Pose-Free Images PDF ↗
Zijian Wu, Boyao Zhou, Liangxiao Hu, Hongyu Liu, Yuan Sun, Xuan Wang, Xun Cao, Yujun Shen, Hao Zhu
371
FlexAvatar: Flexible Large Reconstruction Model for Animatable Gaussian Head Avatars with Detailed Deformation PDF ↗
Cheng Peng, Zhuo Su, Liao Wang, Chen Guo, Zhaohu Li, Chengjiang Long, Zheng Lv, Jingxiang Sun, Chenyangguang Zhang, Yebin Liu
372
First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models PDF ↗
Jiwoo Ha, Jongwoo Baek, Jinhyun So
373
Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigation PDF ↗
Tiantian Dang, Chao Bi, Shufan Shen, Jinzhe Liu, Qingming Huang, Shuhui Wang
374
Envision, Attend, Then Respond: Counterfactual Hallucination Mitigation in Large Vision-Language Models PDF ↗
Yuxuan Liang, Fan Shi, Rui Zhu, Xu Li, Xiaolei Chen, Zhe Liu, Bin Li, Xiangyang Xue
375
PAS: Prelim Attention Score for Detecting Object Hallucinations in Large Vision-Language Models PDF ↗
Nhat Hoang, Minh Vu, My T. Thai, Manish Bhattarai
376
MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization PDF ↗
Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani
377
Fine-Grained Multi Image Object Hallucination Benchmark PDF ↗
Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee
378
Generative Video Motion Editing with 3D Point Tracks PDF ↗
Yao-Chih Lee, Zhoutong Zhang, Jiahui Huang, Jui-Hsien Wang, Joon-Young Lee, Jia-Bin Huang, Eli Shechtman, Zhengqi Li
379
BulletTime: Decoupled Control of Time and Camera Pose for Video Generation PDF ↗
Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein
380
Learning to Generate Highly Dynamic Videos using Synthetic Motion Data PDF ↗
Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho
381
Stereo World Model: Camera-Guided Stereo Video Generation PDF ↗
Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi
382
CG-Floor: Centroid-Guided Diffusion for Large-Scale Floorplan Generation PDF ↗
Hongjin Lian, Jian Ma, Hongjie Chen, Jia Li, Ruizhen Hu, Yu-Kun Lai, Kun Li
383
MAD: Motion Appearance Decoupling for efficient Driving World Models PDF ↗
Ahmad Rahimi, Valentin Gerard, Eloi Zablocki, Matthieu Cord, Alexandre Alahi
384
VDFE: Difference-Aware 3D Scene Editing with Non-Intrusive Video Diffusion Priors for Multi-View Consistency and Efficiency PDF ↗
Chao Zhang, Fang Liu, Shuo Li, Yang Liu, Jiahao Wang, Xinyan Huang, Lingling Li, Puhua Chen, Xu Liu, Wenping Ma, Siqi Yu
385
Endless World: Real-Time 3D-Aware Long Video Generation PDF ↗
Ke Zhang, Jiacong Xu, Yiqun Mei, Vishal M. Patel
386
SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling PDF ↗
Zheng Liu, Zijian He, Huiguo He, Weizhi Zhong, Yejun Tang, Huan Yang, Kun Gai, Guanbin Li
387
Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors PDF ↗
Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li
388
YOLO-ULM: Ultra-Lightweight Models for Real-Time Object Detection PDF ↗
Shasha Han, Chong Li, Xinning Wang, Xuebo Li
389
CHIRP dataset: towards long-term, individual-level, behavioral monitoring of bird populations in the wild PDF ↗
Alex Hoi Hang Chan, Neha Singhal, Onur Kocahan, Andrea Meltzer, Saverio Lubrano, Miyako H. Warrington, Michael Griesser, Fumihiro Kano, Hemal Naik
390
YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection PDF ↗
Xu Lin, Jinlong Peng, Zhenye Gan, Jiawen Zhu, Jun Liu
391
VLM4RSDet: Collaborative Optimization with Vision-Language Model for Enhancing Remote Sensing Object Detection PDF ↗
Shuohao Shi, Qiang Fang, Xin Xu
392
WiTTA-Bench: Benchmarking Test-Time Adaptation for WiFi Sensing PDF ↗
Bing Li, Qiang Wang, Junda Lu, Le Zhang, Yun Liu, Ce Zhu, Wei Cui
393
MFEN: Multi-Frequency Expert Network for Visible-Infrared Person Re-ID PDF ↗
Xulin Li, Yan Lu, Bin Liu, Qinhong Yang, Qi Chu, Tao Gong, Nenghai Yu
394
Object-Generalized Re-Identification: A Step Towards Universal Instance Perception PDF ↗
Shuoyi Chen, Yurui Wu, Mang Ye
395
When Transformers Meet Mamba: A Hybrid Transformer-Mamba Network for Video Object Detection PDF ↗
Qiang Qi, Xiao Wang, Zongyuan Du, Yu Zhang
396
Prompt-Anchored Vision–Text Distillation for Lifelong Person Re- identification PDF ↗
Wen Wen, Hao Chen, Shiliang Zhang
397
HyperGait: Unleashing the Power of Parsing for Gait Recognition in the Wild via Hypergraph PDF ↗
Jinkai Zheng, Jiaqing Wei, Xinxiang Jin, Yaoqi Sun, Xichun Sheng, Ming Li, Liangqiong Qu, Xinchen Liu, Wu Liu
398
Accelerating Streaming Video Large Language Models via Hierarchical Token Compression PDF ↗
Yiyu Wang, Xuyang Liu, Xiyan Gui, Xinying Lin, Boxue Yang, Chenfei Liao, Tailai Chen, Linfeng Zhang
399
Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering PDF ↗
Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou
400
Beyond Caption-Based Queries in Video Moment Retrieval PDF ↗
David Pujol-Perich, Albert Clapés, Dima Damen, Sergio Escalera, Michael Wray
401
Neural-Centric Video Processing Pipeline for Unified Multi-Task Inference PDF ↗
Seyeon Lee, Juncheol Ye, Jaehong Kim, Dongsu Han
402
VideoRealBench: A Chain-of-Thought Realism Evaluation Benchmark for Generated Human-Centric Videos PDF ↗
Min Yang, Xinwen Zhang, Jialei Tang, Xin Zhou, Kehan Li, Zeyi Huang, Limin Wang
403
VAST: Video Ability-Stratified Taxonomy for Data-Efficient Video Reasoning PDF ↗
Zhongan Wang, Xiaoyu Wen, Lingxiao Du, Kun Li, Zhiliang Wu, Xingcheng Xu, Qiaosheng Zhang, Chaochao Lu, Hehe Fan
404
An Empirical Study on How Video-LLMs Answer Video Questions PDF ↗
Chenhui Gou, Ziyu Ma, Zicheng Duan, Haoyu He, Feng Chen, Akide Liu, Bohan Zhuang, Jianfei Cai, Hamid Rezatofighi
405
FPSBench: A Benchmark for Video Understanding at High Frame Rates
Rohan Choudhury, Jean-Sebastien Dandurand, Kai Qiu, Kshitij Madhav Bhat, Kartik Sharma, Liza Dahiya, Yizhou Zhao, Souraja Kundu, Chun-Hsien Lin, Kris M. Kitani, Laszlo A. Jeni
406
UniComp: Rethinking Video Compression Through Informational Uniqueness PDF ↗
Chao Yuan, Shimin Chen, Minliang Lin, Limeng Qiao, Guanglu Wan, Lin Ma
407
NaTex: Seamless Texture Generation as Latent Color Diffusion PDF ↗
Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Xin Yang, Xin Huang, Jingwei Huang, Xiangyu Yue, Chunchao Guo
408
Your Latent Mask is Wrong: Pixel-Equivalent Latent Compositing for Diffusion Models PDF ↗
Rowan Bradbury, Dazhi Zhong
409
Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers PDF ↗
Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu
410
Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping PDF ↗
Jiwon Kang, Yeji Choi, JoungBin Lee, Wooseok Jang, Jinhyeok Choi, Taekeun Kang, Yongjae Park, Myungin Kim, Seungryong Kim
411
Delta Rectified Flow Sampling for Text-to-Image Editing PDF ↗
Gaspard Beaudouin, Minghan Li, Jaeyeon Kim, Sung-Hoon Yoon, Mengyu Wang
412
Training-free Mixed-Resolution Latent Upsampling for Spatially Accelerated Diffusion Transformers PDF ↗
Wongi Jeong, Kyungryeol Lee, Hoigi Seo, Se Young Chun
413
SpotEdit: Selective Region Editing in Diffusion Transformers PDF ↗
Zhibin Qin, Zhenxiong Tan, Zeqing Wang, Songhua Liu, Xinchao Wang
414
All-in-One Slider for Attribute Manipulation in Diffusion Models PDF ↗
Weixin Ye, Hongguang Zhu, Wei Wang, Yahui Liu, Mengyu Wang, Xuecheng Nie
415
DA-VAE: Plug-in Latent Compression for Diffusion via Detail Alignment PDF ↗
Xin Cai, Zhiyuan You, Zhoutong Zhang, Tianfan Xue
416
From Sketch to Fresco: Efficient Diffusion Transformer with Progressive Resolution PDF ↗
Shikang Zheng, Guantao Chen, Landis He, Jiacheng Liu, Yuqi Lin, Chang Zou, Linfeng Zhang
417
CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception PDF ↗
Gong Chen, Chaokun Zhang, Tao Tang, Pengcheng Lv, Feng Li, Xin Xie
418
Scene Reconstruction as Mapping Priors for 3D Detection PDF ↗
Yang Fu, Yuliang Zou, Hao Xiang, Xin Huang, Yijing Bai, Chen Song, Weijing Shi, Govind Thattai, Dragomir Anguelov, Mingxing Tan, Yingwei Li
419
CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection PDF ↗
Yuchen Wu, Kun Wang, Yining Pan, Na Zhao
420
Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection PDF ↗
Zhihao Zhang, Abhinav Kumar, Girish Chandar Ganesan, Xiaoming Liu
421
R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection PDF ↗
Zhongyu Xia, Yousen Tang, Yongtao Wang, Zhifeng Wang, Weijun Qin
422
Revisiting Token Compression for Accelerating ViT-based Sparse Multi-View 3D Object Detectors PDF ↗
Mingqian Ji, Shanshan Zhang, Jian Yang
423
Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments PDF ↗
Yun Zhu, Jianjun Qian, Jian Yang, Jin Xie, Na Zhao
424
Learning from Synthetic Data via Provenance-Based Input Gradient Guidance PDF ↗
Koshiro Nagano, Ryo Fujii, Ryo Hachiuma, Fumiaki Sato, Taiki Sekii, Hideo Saito
425
Seeing Clearly, Reasoning Confidently: Plug-and-Play Remedies for Vision Language Model Blindness PDF ↗
Xin Hu, Haomiao Ni, Yunbei Zhang, Jihun Hamm, Zechen Li, Zhengming Ding
426
Draft and Refine with Visual Experts PDF ↗
Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani
427
R2G: A Multi-View Circuit Graph Benchmark Suite from RTL to GDSII PDF ↗
Zewei Zhou, Jiajun Zou, Jiajia Zhang, Ao Yang, Ruichao He, Haozheng Zhou, Ao Liu, Jiawei Liu, Leilei Jin, Shan Shen, Daying Sun
428
VQ-VA World: Towards High-Quality Visual Question-Visual Answering PDF ↗
Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi
429
Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning PDF ↗
Jooyoung Kim, Wonje Choi, Younguk Song, Honguk Woo
430
Beyond Multiple Choice: Verifiable OpenQA for Robust Vision- Language RFT PDF ↗
Yesheng Liu, Hao Li, Haiyu Xu, Baoqi Pei, Jiahao Wang, Mingxuan Zhao, Jing-Shu Zheng, Zheqi He, JG Yao, Xi Yang, Bowen Qin, Jiajun Zhang
431
See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection PDF ↗
Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang
432
PDCR: Perception-Decomposed Confidence Reward for Vision- Language Reasoning PDF ↗
Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo
433
μVLM: A Vision Language Model for μNPUs
Zijie Chen, Guiyun Fan, Zhaoxing Yang, Rong Ding, Haiming Jin
434
Gaussian Mapping for Evolving Scenes PDF ↗
Vladimir Yugay, Thies Kersten, Luca Carlone, Theo Gevers, Martin R. Oswald, Lukas Schmid
435
Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
Tianjiao Yu, Vedant Shah, Muntasir Wahed, Ying Shen, Kiet A. Nguyen, Ismini Lourentzou
436
AnchorSplat: Feed-Forward 3D Gaussian Splatting With 3D Geometric Priors PDF ↗
Xiaoxue Zhang, Xiaoxu Zheng, Yixuan Yin, Tiao Zhao, Kaihua Tang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen
437
SGAD-SLAM: Splatting Gaussians at Adjusted Depth for Better Radiance Fields in RGBD SLAM PDF ↗
Pengchong Hu, Zhizhong Han
438
Faster-GS: Analyzing and Improving Gaussian Splatting Optimization PDF ↗
Florian Hahlbohm, Linus Franke, Martin Eisemann, Marcus Magnor
439
Layered 4D-Rotor Gaussian Splatting: A Compressed Representation for Long Dynamic Scenes PDF ↗
Hanjie Xu, Yuanxing Duan, Qiyu Dai, Ge Li, Baoquan Chen, He Wang
440
GaussianGrow: Geometry-aware Gaussian Growing from 3D Point Clouds with Text Guidance PDF ↗
Weiqi Zhang, Junsheng Zhou, Haotian Geng, Kanle Shi, Shenkun Xu, Yi Fang, Yu-Shen Liu
441
PhysGS: Bayesian-Inferred Gaussian Splatting for Physical Property Estimation PDF ↗
Samarth Chopra, Jing Liang, Gershom Seneviratne, Dinesh Manocha
442
3D Gaussian Splatting at Arbitrary Resolutions with Compact Proxy Anchors PDF ↗
Mingyun Jeong, Seongro Yoon, Francois Bremond, Donghyeon Cho
443
Stochastic Ray Tracing for the Reconstruction of 3D Gaussian Splatting PDF ↗
Peiyu Xu, Shuang Zhao, Xin Sun, Krishna Mullia, Raymond Fei, Iliyan Georgiev
444
AeroDGS: Physically Consistent Dynamic Gaussian Splatting for Single-Sequence Aerial 4D Reconstruction PDF ↗
Hanyang Liu, Rongjun Qin
445
GaussianPile: A Unified Sparse Gaussian Splatting Framework for Slice-based Volumetric Reconstruction PDF ↗
Di Kong, Yikai Wang, Wenjie Guo, Yifan Bu, Boya Zhang, Yuexin Duan, Xiawei Yue, Wenbiao Du, Yiman Zhong, Yuwen Chen, Cheng Ma
446
More Natural, More Real: Object-aware Gaussian Splatting for 3D Visual Decoding from Human Brain PDF ↗
Haodong Jing, Dongyao Jiang, Jixin Wang, Junhao Jia, Yanshu Li, Yongqiang Ma, Nanning Zheng
447
Eulerian Gaussian Splatting using Hashed Probability Pyramids PDF ↗
Mia Gaia Polansky, George Kopanas, Stephan Garbin, Todd Zickler, Dor Verbin
448
Confidence-Guided Multi-Scale Aggregation for Sparse-View High- Resolution 3D Gaussian Splatting PDF ↗
Qinzheng Zhou, Zaychik Liu, Lijing Lu, Zhihang Li
449
ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting PDF ↗
Yingdong Gu, Shaocheng Yan, Zhenjun Zhao, Yuan Kou, Jianxin Luo, Pengcheng Shi, Jiayuan Li
450
Robust3DGSW: Toward Robust Watermarking for Quantization-Aware 3D Gaussian Splatting PDF ↗
Boyu Wang, Jun Xia, Mingsong Chen
451
ParkGaussian: Surround-view 3D Gaussian Splatting for Autonomous Parking PDF ↗
Xiaobao Wei, Zhangjie Ye, Yuxiang Gu, Zunjie Zhu, Yunfei Guo, Yingying Shen, Shan Zhao, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Rongfeng Lu, Hangjun Ye
452
Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
Ashish Kumar, Rajagopalan N Ambasamduram
453
Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection PDF ↗
Ruichao Yang, Wei Gao, Xiaobin Zhu, Jing Ma, Hongzhan Lin, Ziyang Luo, Bo-Wen Zhang, Xu-Cheng Yin
454
POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs PDF ↗
Haicheng Wang, Yuan Liu, Yikun Liu, Zhemeng Yu, Zhongyin Zhao, Yangxiu You, Zilin Yu, Le Tian, Zhou Xiao, Jie Zhou, Weidi Xie, Yanfeng Wang
455
SegCompass: Exploring Interpretable Alignment with Sparse Autoencoders for Enhanced Reasoning Segmentation PDF ↗
Zhenyu Lu, Liupeng Li, Jinpeng Wang, Haoqian Kang, Yan Feng, Ke Chen, Yaowei Wang
456
CRIT: Graph-Based Automatic Data Synthesis to Enhance Cross- Modal Multi-Hop Reasoning PDF ↗
Junyoung Sung, Seungwoo Lyu, Minjun Kim, Sumin An, Arsha Nagrani, Paul Hongsuck Seo
457
DeepScan: A Training-Free Framework for Visually Grounded Reasoning in Large Vision-Language Models PDF ↗
Yangfu Li, Hongjian Zhan, Jiawei Chen, Yuning Gong, Qi Liu, Yue Lu
458
Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images PDF ↗
Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang
459
HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation PDF ↗
Jiajun Zhang, Shijia Luo, Ruikang Zhang, Qi Su
460
CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning PDF ↗
Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao
461
Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token PDF ↗
Anqi Zhang, Xiaokang Ji, Guangyu Gao, Jianbo Jiao, Chi Harold Liu, Yunchao Wei
462
Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models PDF ↗
Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen
463
Mario: Multimodal Graph Reasoning with Large Language Models PDF ↗
Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan
464
Boosting Reasoning in Large Multimodal Models via Activation Replay PDF ↗
Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang
465
Rationale-Enhanced Decoding for Multi-modal Chain-of- Thought PDF ↗
Shin'ya Yamaguchi, Kosuke Nishida, Daiki Chijiwa
466
Mimic Human Cognition, Master Multi-Image Reasoning: A Meta- Action Framework for Enhanced Visual Understanding PDF ↗
Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He
467
ROSE: Rotate Your Large Language Model to See PDF ↗
Tongtian Yue, Xuange Gao, Longteng Guo, Zijia Zhao, Zikang Liu, Jie Jiang, Hua Huang, Jing Liu
468
OpenMMReasoner: Pushing the Frontiers in Multimodal Reasoning with an Open and General Recipe PDF ↗
Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Xingxuan Li, Lidong Bing
469
SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs PDF ↗
Haiduo Huang, Jiangcheng Song, Yadong Zhang, Pengju Ren
470
Sparsity as a Key: Unlocking New Insights from Latent Structures for Out-of-Distribution Detection PDF ↗
Ahyoung Oh, Wonseok Shin, Songkuk Kim
471
SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration PDF ↗
Zekun Li, Ning Wang, Tongxin Bai, Changwang Mei, Peisong Wang, Shuang Qiu, Jian Cheng
472
Suppressing Non-Semantic Noise in Masked Image Modeling Representations PDF ↗
Martine Hjelkrem-Tan, Marius Aasan, Rwiddhi Chakraborty, Gabriel Y. Arteaga, Changkyu Choi, Adín Ramírez Rivera
473
Block-based Learned Image Compression without Blocking Artifacts PDF ↗
Jong Wook Kim, Suyong Bahk, TaeHwa Lee, HyunDong Cho, Donghyun Kim, Sung-Chang Lim, Jin Soo Choi, Hui Yong Kim
474
DeDelayed: Deleting Remote Inference Delay via On-Device Correction PDF ↗
Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar
475
AdaRadar: Rate Adaptive Spectral Compression for Radar-based Perception PDF ↗
Jinho Park, Se Young Chun, Mingoo Seok
476
Gaussian Splatting-based Low-Rank Tensor Representation for Multi-Dimensional Image Recovery PDF ↗
Yiming Zeng, Xi-Le Zhao, Wei-Hao Wu, Teng-Yu Ji, Chao Wang
477
Precise Object and Effect Removal with Adaptive Target-Aware Attention PDF ↗
Jixin Zhao, Zhouxia Wang, Peiqing Yang, Shangchen Zhou
478
Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression PDF ↗
Nazia Tasnim, Shrimai Prabhumoye, Bryan A. Plummer
479
FreqSIC: Frequency-aware Stereo Image Compression with Bi- directional Checkerboard Context Model PDF ↗
Shiyu Qin, Yongkang Lu, Yimin Zhou, Jiawei Li, Yifan Ren, Yuerong Xue, Shu-Tao Xia, Bin Chen
480
SinGeo: Unlock Single Model's Potential for Robust Cross-View Geo- Localization PDF ↗
Yang Chen, Xieyuanli Chen, Junxiang Li, Jie Tang, Tao Wu
481
Fusion of Depth and Semantics for Probabilistic Floorplan Localization PDF ↗
Kecheng Ye, Mao Chen, Xiangkai Zhang, Xu Yang
482
A2GC: Asymmetric Aggregation with Geometric Constraints for Locally Aggregated Descriptors PDF ↗
Zhenyu Li, Tianyi Shang
483
Geo2: Geometry-Guided Cross-view Geo-Localization and Image Synthesis PDF ↗
Yancheng Zhang, Xiaohan Zhang, Guangyu Sun, Zonglin Lyu, Safwan Wshah, Chen Chen
484
Coverage Optimization for Camera View Selection PDF ↗
Timothy Chen, Adam Dai, Maximilian Adang, Grace Gao, Mac Schwager
485
Resolving Evidence Sparsity: Agentic Context Engineering for Long- Document Understanding PDF ↗
Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang
486
Reasoning Palette: Modulating Reasoning via Latent Contextualization for Controllable Exploration for (V) LMs PDF ↗
Rujiao Long, Yang Li, Xingyao Zhang, Weixun Wang, Tianqianjin Lin, Xi Zhao, Yuchi Xu, Wenbo Su, Junchi Yan, Bo Zheng
487
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering PDF ↗
Aymen Lassoued, Mohamed Ali Souibgui, Yousri Kessentini
488
MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding PDF ↗
Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan
489
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning PDF ↗
Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu
490
Saliency-Guided Representation with Consistency Policy Learning for Visual Unsupervised Reinforcement Learning PDF ↗
Jingbo Sun, Qichao Zhang, Songjun Tu, Xing Fang, Yupeng Zheng, Haoran Li, Ke Chen, Dongbin Zhao
491
LensWalk: Agentic Video Understanding by Planning How You See in Videos PDF ↗
Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan
492
DPGF-Net: Dual-Prior Guided Fusion Network for Joint Assessment of Perceptual Quality and Semantic Consistency in AI-Generated Images PDF ↗
Tao Li, Xingran Liao, Mingliang Zhou
493
RegionFuse: Region-Adaptive Pixel Distribution Learning for Infrared and Visible Image Fusion PDF ↗
Jianghan Xia, Hong Song, Jinfu Li, Yucong Lin, Shihan Ma, Jingfan Fan, Danni Ai, Tianyu Fu, Deqiang Xiao, Jian Yang
494
Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared PDF ↗
Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu
495
VideoFusion: A Spatio-Temporal Collaborative Network for Multi- modal Video Fusion PDF ↗
Linfeng Tang, Yeda Wang, Meiqi Gong, Zizhuo Li, Yuxin Deng, Xunpeng Yi, Chunyu Li, Han Xu, Hao Zhang, Jiayi Ma
496
TAPE: Task-Adaptive Prototype Evolution in Audio-Language Models for Fully Few-shot Class-incremental Audio Classification PDF ↗
Yunlong Gao, Wenxin Liang, Guanglu Wang, Senqi Guan, Linlin Zong, Dongyu Zhang, Xinyue Liu
497
Remedying Target-Domain Astigmatism for Cross-Domain Few-Shot Object Detection PDF ↗
Yongwei Jiang, Yixiong Zou, Yuhua Li, Ruixuan Li
498
DDSF: Robust Few-Shot Learning via Disentangled Subspaces with Determinantal Point Process PDF ↗
Xulun Ye, Yifan Mei, Kun Zhou, Zelei Wu, Jieyu Zhao
499
Hyperbolic Defect Feature Synthesis for Few-Shot Defect Classification PDF ↗
Huimin Li, Boxuan Hu, Yulin Zhang, Xiuzhuang Zhou, Junlin Hu
500
Training-Only Heterogeneous Image-Patch-Text Graph Supervision for Advancing Few-Shot Learning Adapters PDF ↗
Mohammed Rahman Sherif Khan Mohammad, Ardhendu Behera, Sandip Pradhan, Swagat Kumar, Amr Ahmed
501
Learning to Learn Weight Generation via Local Consistency Diffusion PDF ↗
Yunchuan Guan, Yu Liu, Ke Zhou, Zhiqi Shen, Jenq-Neng Hwang, Lei Li
502
Balanced Dataset Distillation via Modeling Multiple Visual Pattern Distribution PDF ↗
Guanghui Shi, Xuefeng Liang, Qixiang Wen
503
Grid Distillation: Compositional Image Distillation via Structured Generative Grids PDF ↗
Biplab Ch Das, Shouvik Das, Viswanath Gopalakrishnan
504
Dataset Distillation by Influence Matching PDF ↗
Haoru Tan, Wang Wang, Sitong Wu, Xiuzhe Wu, Yang-Tian Sun, Chirui Chang, Shaofeng Zhang, Xiaojuan Qi
505
StableMaterials: Enhancing Diversity in Material Generation via Semi- Supervised Learning PDF ↗
Giuseppe Vecchio
506
Seeing Through Blur: Tackling Defocus in Spike-Based Imaging PDF ↗
Xiantao Ma, Siwei Dong, Lin Zhu, Lizhi Wang, Hua Huang
507
Distilling Quasi-Conformal Mapping: A Generalizable and Efficient Solution for Wide-Angle Correction PDF ↗
Chengyang Liu, Zixuan Lin, Miaolin Han, Michael K. Ng, Huibin Li
508
Lighting in Motion: Spatiotemporal HDR Lighting Estimation PDF ↗
Christophe Bolduc, Julien Philip, Li Ma, Mingming He, Paul Debevec, Jean-François Lalonde
509
LightRR: A Lightweight Network for Single Image Reflection Removal PDF ↗
Wenbin Yin, Junkang Zhang, Sunzhe Yang, Faming Fang, Guixu Zhang
510
HFR and HDR Video from Multi-Attenuated Spikes Using a Rapidly Rotating SpokeND Filter PDF ↗
Yakun Chang, Zhaojun Huang, Siqi Yang, Yeliduosi Xiaokaiti, Shikui Wei, Yao Zhao, Tiejun Huang, Boxin Shi
511
Coded-E2LF: Coded Aperture Light Field Imaging from Events PDF ↗
Tomoya Tsuchida, Keita Takahashi, Chihiro Tsutake, Toshiaki Fujii, Hajime Nagahara
512
TokenLight: Precise Lighting Control in Images using Attribute Tokens PDF ↗
Sumit Chaturvedi, Yannick Hold-Geoffroy, Mengwei Ren, Jingyuan Liu, He Zhang, Yiqun Mei, Julie Dorsey, Zhixin Shu
513
Kaleidoscopic Scintillation Event Imaging PDF ↗
Alex Bocchieri, John Mamish, David Appleyard, Andreas Velten
514
gQIR: Generative Quanta Image Reconstruction PDF ↗
Aryan Garg, Sizhuo Ma, Mohit Gupta
515
Solving Minimal Problems Without Matrix Inversion Using FFT-Based Interpolation PDF ↗
Haidong Wu, Snehal Bhayani, Janne Heikkila
516
Predicting Spatial Transcriptomics from Histology Images via High-Order Multi-Cell Interaction Modeling PDF ↗
Youhan Sun, Jiahua Rao, Kangrui Du, Jiancong Xie, Yuedong Yang
517
From Spots to Pixels: Dense Spatial Gene Expression Prediction from Histology Images PDF ↗
Ruikun Zhang, Yan Yang, Liyuan Pan
518
Cell-Type Prototype-Informed Neural Network for Gene Expression Estimation from Pathology Images PDF ↗
Kazuya Nishimura, Ryoma Bise, Shinnosuke Matsuo, Haruka Hirose, Yasuhiro Kojima
519
LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds PDF ↗
Jaehun Bang, Jinhyeok Kim, Minji Kim, Seungheon Jeong, Kyungdon Joo
520
Guardians of the Hair: Rescuing Soft Boundaries in Depth, Stereo, and Novel Views PDF ↗
Xiang Zhang, Studios blank, Yang Zhang, Studios blank, Lukas Mehl, Studios blank, Markus Gross, Studios blank, Christopher Schroers, Studios blank
521
Zero-Shot Depth Completion with Vision-Language Model PDF ↗
Zhiqiang Yan, Yuan Wu, Gim Hee Lee
522
FE2E: From Editor to Dense Geometry Estimator PDF ↗
Jiyuan Wang, Chunyu Lin, Lei Sun, Rongying Liu, Lang Nie, Mingxing Li, Kang Liao, Xiangxiang Chu
523
Ego-1K – A Large-Scale Multiview Video Dataset for Egocentric Vision PDF ↗
Jae Yong Lee, Daniel Scharstein, Akash Bapat, Hao Hu, Andrew Fu, Haoru Zhao, Paul Sammut, Xiang Li, Stephen Jeapes, Anik Gupta, Lior David, Saketh Madhuvarasu, Jay Girish Joshi, Jason Wither
524
Edit-As-Act: Goal-Regressive Planning for Open-Vocabulary 3D Indoor Scene Editing PDF ↗
Seongrae Noh, SeungWon Seo, Gyeong-Moon Park, HyeongYeop Kang
525
VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation PDF ↗
Jiayi Yuan, Haobo Jiang, De Wen Soh, Na Zhao
526
NI-Tex: Non-isometric Image-based Garment Texture Generation PDF ↗
Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang
527
Velox: Learning Representations of 4D Geometry and Appearance PDF ↗
Anagh Malik, Dorian Chan, Xiaoming Zhao, David B. Lindell, Oncel Tuzel, Jen-Hao Rick Chang
528
UniPixie: Unified and Probabilistic 3D Physics Learning via Flow Matching PDF ↗
Qilin Huang, Quynh Anh Huynh, Long Le, Chen Wang, Chuhao Chen, Ryan Lucas, Eric Eaton, Lingjie Liu
529
UniTEX: Universal High Fidelity Generative Texturing for 3D Shapes PDF ↗
Yixun Liang, Kunming Luo, Xiao Chen, Rui Chen, Hongyu Yan, Weiyu Li, Jiarui Liu, Fei-Peng Tian, Ping Tan
530
Points-to-3D: Structure-Aware 3D Generation with Point Cloud Priors PDF ↗
Jiatong Xia, Zicheng Duan, Anton van den Hengel, Lingqiao Liu
531
PartDiffuser: Part-wise 3D Mesh Generation via Discrete Diffusion PDF ↗
Yichen Yang, Hong Li, Haodong Zhu, Linin Yang, Guojun Lei, Sheng Xu, Baochang Zhang
532
LoST: Level of Semantics Tokenization for 3D Shapes PDF ↗
Niladri Shekhar Dutt, Zifan Shi, Paul Guerrero, Chun-Hao Paul Huang, Duygu Ceylan, Niloy J. Mitra, Xuelin Chen
533
Lafite: A Generative Latent Field for 3D Native Texturing PDF ↗
Chia-Hao Chen, Yuan-Chen Guo, Zi-Xin Zou, Ze Yuan, Guan Luo, Xiaojuan Qi, Ding Liang, Yan-Pei Cao, Song-Hai Zhang
534
Image-Guided Geometric Stylization of 3D Meshes PDF ↗
Changwoon Choi, Hyunsoo Lee, Clément Jambon, Yael Vinker, Young Min Kim
535
LATTICE: Democratize High-Fidelity 3D Generation at Scale PDF ↗
Zeqiang Lai, Yunfei Zhao, Zibo Zhao, Haolin Liu, Qingxiang Lin, Jingwei Huang, Chunchao Guo, Xiangyu Yue
536
Dehallu3D: Hallucination-Mitigated 3D Generation from a Single Image via Cyclic View Consistency Refinement PDF ↗
Xiwen Wang, Shichao Zhang, Ruowei Wang, Mao Li, Chenyu Zhou, Ji-Zhe Zhou, Qijun Zhao, Hailun Zhang
537
MeshMosaic: Scaling Artist Mesh Generation via Local-to-Global Assembly PDF ↗
Rui Xu, Tianyang Xue, Qiujie Dong, Le Wan, Zhe Zhu, Peng Li, Zhiyang Dou, Cheng Lin, Shiqing Xin, Yuan Liu, Wenping Wang, Taku Komura
538
TacSIm: A Dataset and Benchmark for Football Tactical Style Imitation PDF ↗
Peng Wen, Yuting Wang, Qiurui Wang
539
DynamicsBoost: Dynamic Plausible Video Generation via Annotation- Free Continuation Preference Optimization PDF ↗
Jiaxing Li, Jiepeng Wang, Junyao Gao, Yang Liu, Eric Li, Bo An, Hao-Xiang Guo
540
Reinforcement-Guided Synthetic Data Generation for Privacy- Sensitive Identity Recognition PDF ↗
Xuemei Jia, Jiawei Du, Hui Wei, Jun Chen, Joey Tianyi Zhou, Zheng Wang
541
Fine-Grained GRPO for Precise Preference Alignment in Flow Models PDF ↗
Yujie Zhou, Pengyang Ling, Jiazi Bu, Yibin Wang, Yuhang Zang, Jiaqi Wang, Li Niu, Guangtao Zhai
542
Lighting-grounded Video Generation with Renderer-based Agent Reasoning PDF ↗
Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi
543
RewardFlow: Generate Images by Optimizing What You Reward PDF ↗
Onkar Susladkar, Dong-Hwan Jang, Tushar Prakash, Adheesh Juvekar, Vedant Shah, Ayush Barik, Nabeel Bashir, Muntasir Wahed, Ritish Shrirao, Ismini Lourentzou
544
Goal Force: Teaching Video Models To Accomplish Physics- Conditioned Goals PDF ↗
Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Chen Sun
545
Self-Corrected Image Generation with Explainable Latent Rewards PDF ↗
Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He
546
Polyphony: Diffusion-based Dual-Hand Action Segmentation with Alternating Vision Transformer and Semantic Conditioning PDF ↗
Hao Zheng, Hu Wang, Tiantian Zheng, Prajjwal Bhattarai, Tuka Alhanai
547
Reading Your Actions: Learning Generalizable Action Representations via Pre-training AEMG PDF ↗
Zhenghao Huang, Huilin Yao, Kaikai Wang, Lin Shu
548
MA-Bench: Towards Fine-grained Micro-Action Understanding PDF ↗
Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo
549
OpenMarcie: Dataset for Multimodal Action Recognition in Industrial Environments PDF ↗
Hymalai Bello, Lala Ray, Joanna Sorysz, Sungho Suh, Paul Lukowicz
550
Action Motifs: Self-Supervised Hierarchical Representation of Human Body Movements PDF ↗
Genki Kinoshita, Shu Nakamura, Ryo Kawahara, Shohei Nobuhara, Yasutomo Kawanishi, Ko Nishino
551
DarkShake-DVS: Event-based Human Action Recognition under Low- light and Shaking Camera Conditions PDF ↗
Jiaqi Chen, Qinfu Xu, Liyuan Pan
552
Protect to Adapt: Subspace-Constrained Adaptation with Ranked Negative Prompt Feedback for Few-Shot Action Recognition
Hantao Qi, Yan Yan, Junlong Gao, Hanzi Wang
553
SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition PDF ↗
Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, Liang Zhang
554
InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Search PDF ↗
Qinqin Zhou, Fuhai Chen, Jipeng Wu, Zhiwei Chen, Zhikai Hu, Weiwei Cai
555
S^2FT: Parameter-Efficient Fine-Tuning in Sparse Spectrum Domain PDF ↗
Baoquan Zhang, Zhehao Yu, Lisai Zhang, Kenghong Lin, Tianran Chen, Yuxi Sun, Yunming Ye, Yao He
556
Rethinking SNN Online Training and Deployment: Gradient-Coherent Learning via Hybrid-Driven LIF Model PDF ↗
Zecheng Hao, Yifan Huang, Zijie Xu, Wenxuan Liu, Yuanhong Tang, Zhaofei Yu, Tiejun Huang
557
Gated KalmaNet: A Fading Memory Layer through Test-time Ridge Regression PDF ↗
Liangzu Peng, Aditya Chattopadhyay, Luca Zancato, Elvis Nunez, Wei Xia, Stefano Soatto
558
Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data PDF ↗
Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak
559
AdaBet: Gradient-free Layer Selection for Efficient Training of Deep Neural Networks PDF ↗
Irene Tenison, Soumyajit Chatterjee, Fahim Kawsar, Mohammad Malekzadeh
560
TAS-LoRA: Transformer Architecture Search with Mixture-of-LoRA Experts PDF ↗
Jeimin Jeon, Hyunju Lee, Bumsub Ham
561
QuCNet: Quantum Deep Learning Driven Multi-Circuit Network for Remote Sensing Image Classification PDF ↗
Komal Komal, Mukul Gupta, Saumya Singh, Santosh Kumar Vipparthi, C.C. Reddy, Subrahmanyam Murala
562
Learning to Solve PDEs on Neural Shape Representations PDF ↗
Lilian Welschinger, Yilin Liu, Zican Wang, Niloy J. Mitra
563
Frequency Switching Mechanism for Parameter-Efficient Multi-Task Learning PDF ↗
Shih-Wen Liu, Yen-Chang Chen, Wei-Ta Chu, Fu-En Yang, Yu-Chiang Frank Wang
564
Reconstructing Spiking Neural Networks Using a Single Neuron with Autapses PDF ↗
Wuque Cai, Hongze Sun, Quan Tang, Shifeng Mao, Zhenxing Wang, Jiayi He, Duo Chen, Dezhong Yao, Daqing Guo
565
Widget2Code: From Visual Widgets to UI Code via Multimodal LLMs, Houston H. Zhang, Tao Zhang, Baoze Lin, Yuanqi Xue, Yincheng Zhu, Huan Liu, Li Gu, Linfeng Ye, Ziqiang Wang, Xinxin Zuo, Yang Wang, Yuanhao Yu, Zhixiang Chi
566
GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents PDF ↗
Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang
567
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection PDF ↗
Mingyu Ouyang, Kevin Qinghong Lin, Mike Zheng Shou, Hwee Tou Ng
568
Streamlined Open-Vocabulary Human-Object Interaction Detection PDF ↗
Chang Sun, Dongliang Liao, Changxing Ding
569
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection PDF ↗
Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li
570
Mitigating Simplicity Bias in OOD Detection through Object Co- occurrence Analysis PDF ↗
Boyang Dai, Chaoqi Chen, Yizhou Yu
571
Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting PDF ↗
Da Zhang, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao
572
Parameter-Efficient Semantic Augmentation for Enhancing Open- Vocabulary Object Detection PDF ↗
Weihao Cao, Runqi Wang, Xiaoyue Duan, Jinchao Zhang, Ang Yang, Liping Jing
573
WeDetect: Fast Open-Vocabulary Object Detection as Retrieval PDF ↗
Shenghao Fu, Yukun Su, Fengyun Rao, Jing LYU, Xiaohua Xie, Wei-Shi Zheng
574
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation, Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong
575
OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery PDF ↗
Qi Guo, Jue Wang, Yinhe Liu, Yanfei Zhong
576
Annotation-Efficient Coreset Selection for Context-dependent Segmentation PDF ↗
Jin Zhang, Zhe Cao, Biwen Yang, Ruiheng Zhang
577
ALLNet: Multi-task Dense Prediction for Degraded Images PDF ↗
Weiran Wang, Jialing Wu, Yaqi Chang, Gang He, Li Xu, Chang Wu, Yunsong Li
578
Geometry-Aware Cross-Modal Graph Alignment for Referring Segmentation in 3D Gaussian Splatting PDF ↗
Yuwen Tao, Kanglei Zhou, Chang Li, Liyuan Wang
579
Volumetric Functional Maps PDF ↗
Filippo Maggioli, Simone Melzi, Marco Livesu
580
GenMask: Adapting DiT for Segmentation via Direct Mask Generation PDF ↗
Yuhuan Yang, Xianwei Zhuang, Yuxuan Cai, Chaofan Ma, Shuai Bai, Jiangchao Yao, Ya Zhang, Junyang Lin, Yanfeng Wang
581
Frequency-Aware Affinity for Weakly Supervised Semantic Segmentation PDF ↗
Ziqian Yang, Xianglin Qiu, Xinqiao Zhao, Xiaolei Wang, Quan Zhang, Jimin Xiao
582
Learning and Aligning Click-Aware Shape Prior for Interactive Amodal Instance Segmentation PDF ↗
Junjie Chen, Junwei Lin, Ren Hong, Shengjie Liu, Yuming Fang, Feng Qian, Yifan Zuo
583
Beyond Reassembly: Fractured Object Recovery with Missing Parts PDF ↗
Qun-Ce Xu, Jiahui Li, Yan-Pei Cao, Weihao Cheng, Tai-Jiang Mu, Ying Shan, Chuan Li, Da Chen, Yong-Liang Yang, Shi-min Hu
584
Best Segmentation Buddies for Image-Shape Correspondence PDF ↗
Itai Lang, Dongwei Lyu, Dale Decatur, Rana Hanocka
585
RMAE-ProGRess: Advancing Semantic Segmentation in Unstructured Environments PDF ↗
Manish Bhurtel, Danda B. Rawat
586
Local Precise Refinement: A Dual-Gated Mixture-of-Experts for Enhancing Foundation Model Generalization against Spectral Shifts PDF ↗
Xi Chen, Maojun Zhang, Yu Liu, Shen Yan
587
Orthogonal Spatial-Aware Multi-View Anchor Graph Clustering for Incomplete Remote Sensing Data PDF ↗
Yongshan Zhang, Xiaohuan Lin, Lefei Zhang, Zhihua Cai
588
SIGMA: A Physics-Based Benchmark for Gas Chimney Understanding in Seismic Images PDF ↗
Bao Truong, Quang Nguyen, Baoru Huang, Jinpei Han, Van Nguyen, Ngan Le, Minh-Tan Pham, Doan Huy Hien, Anh Nguyen
589
SkySense-VITA: Towards Universal In-context Segmentation of Multi-modal Remote Sensing Imagery PDF ↗
Kang Wu, Lei Yu, Junwei Luo, Bo Dang, Junjian Zhang, Xiangyuan Cai, Hongwei Hu, Jingdong Chen, Yansheng Li
590
ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology PDF ↗
Srikumar Sastry, Subash Khanal, Aayush Dhakal, Jiayu Lin, Dan Cher, Phoenix Jarosz, Nathan Jacobs
591
GeoCoT: Towards Reliable Remote Sensing Reasoning with Manifold Perspective PDF ↗
Daixun Li, Zirui Li, Sibo He, Jiayun Tian, Mingxiang Cao, Weiying Xie, Yunke Wang, Xin Zhang, Yusi Zhang, Yunsong Li, Chang Xu, Leyuan Fang
592
STCast: Adaptive Boundary Alignment for Global and Regional Weather Forecasting PDF ↗
Hao Chen, Tao Han, Jie Zhang, Song Guo, Lei Bai
593
NeighborMAE: Exploiting Spatial Dependencies between Neighboring Earth Observation Images in Masked Autoencoders Pretraining PDF ↗
Liang Zeng, Valerio Marsocci, Wufan Zhao, Andrea Nascetti, Maarten Vergauwen
594
GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding PDF ↗
Jiaqi Liu, Ronghao Fu, Haoran Liu, Lang Sun, Qipeng Wang, Bo Yang
595
Balanced Hierarchical Contrastive Learning with Decoupled Queries for Fine-grained Object Detection in Remote Sensing Images PDF ↗
Jingzhou Chen, Dexin Chen, Fengchao Xiong, Yuntao Qian, Liang Xiao
596
Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Counting PDF ↗
Alabi Mehzabin Anisha, Guangjing Wang, Sriram Chellappan
597
Improving Adversarial Transferability with Local Perturbation Augmentation PDF ↗
Jian-Xun Mi, Xuanhui Zhong, Weisheng Li
598
Echoes of Ownership: Adversarial-Guided Dual Injection for Copyright Protection in MLLMs PDF ↗
Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang
599
Stealing Split Learning Bottom Models by Recovering Embedding Geometry PDF ↗
Qinbo Zhang, Yanhang Shi, Ziyi Zhang, Hao Wang, Sai Qian Zhang, Jian Li
600
PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems PDF ↗
Weijie Wang, Songlong Xing, Zhengyu Zhao, Nicu Sebe, Bruno Lepri
601
No Way To Steal My Face: Proactive Defense Against Identity- Preserving Personalized Generation PDF ↗
Lizhi Xiong, Jun Li, Ziqiang Li, Weiwei Jiang, Zhangjie Fu
602
Towards Reliable Evaluation of Adversarial Robustness for Spiking Neural Networks PDF ↗
Jihang Wang, Dongcheng Zhao, Ruolin Chen, Qian Zhang, Yi Zeng
603
Where, What, Why: Toward Explainable 3D-GS Watermarking PDF ↗
Mingshu Cai, Jiajun Li, Osamu Yoshie, Yuya Ieiri, Yixuan Li
604
Robust Spiking Neural Networks by Temporal Mutual Information PDF ↗
Mengting Xu, Shi Gu, Peng Lin, De Ma, Huajin Tang, Qian Zheng, Gang Pan
605
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos PDF ↗
Seungjae Lee, Yoonkyo Jung, Inkook Chun, Yao-Chih Lee, Zikui Cai, Hongjia Huang, Aayush Talreja, Tan Dao, Yongyuan Liang, Jia-Bin Huang, Furong Huang
606
HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models PDF ↗
Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang
607
AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots PDF ↗
Likui Zhang, Tao Tang, Zhihao Zhan, Xiuwei Chen, Zisheng Chen, Jianhua Han, Jiangtong Zhu, Pei Xu, Hang Xu, Hefeng Wu, Liang Lin, Xiaodan Liang
608
Obstruction Reasoning for Robotic Grasping PDF ↗
Runyu Jiao, Matteo Bortolon, Francesco Giuliari, Alice Fasoli, Sergio Povoli, Guofeng Mei, Yiming Wang, Fabio Poiesi
609
PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation PDF ↗
Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, Li Fei-Fei
610
CycleManip: Enabling Cycle-based Manipulation via Effective History Perception and Understanding PDF ↗
Yi-Lin Wei, Haoran Liao, Yuhao Lin, Pengyue Wang, Zhizhao Liang, Guiliang Liu, Wei-Shi Zheng
611
SIMPACT: Simulation-Enabled Action Planning using Vision- Language Models PDF ↗
Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du
612
Adaptive Action Chunking at Inference-time for Vision-Language- Action Models PDF ↗
Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat
613
Localizing, Structuring, and Rendering: Bridging 3D and 2D Vision- Language-Action Models for Robotic Manipulation PDF ↗
Yunlong Zhao, Xiaoheng Deng, Yichao Cao, Yi Chen, Xiangjian He, Shan You, Shuo Yang, Lei Fan, Fei Wang, Xiu Su
614
NIL: No-data Imitation Learning PDF ↗
Mert Albaba, Chenhao Li, Markos Diomataris, Omid Taheri, Andreas Krause, Michael J. Black
615
Humanoid Generative Pre-Training for Zero-Shot Motion Tracking PDF ↗
Zekun Qi, Xuchuan Chen, Jilong Wang, Chenghuai Lin, Yunrui Lian, Wenyao Zhang, Xinqiang Yu, He Wang, Li Yi
616
EnergyAction: Unimanual to Bimanual Composition with Energy- Based Models PDF ↗
Mingchen Song, Xiang Deng, Jie Wei, Dongmei Jiang, Liqiang Nie, Weili Guan
617
CUBic: Coordinated Unified Bimanual Perception and Control Framework PDF ↗
Xingyu Wang, Pengxiang Ding, Jingkai Xu, Donglin Wang, Zhaoxin Fan
618
RehearseVLA: Simulated Post-Training for VLAs with Physically- Consistent World Model PDF ↗
Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang
619
GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping PDF ↗
Beining Han, Yu-Wei Chao, Erwin Coumans, Clemens Eppner, Jia Deng, Stan Birchfield, Adithyavairavan Murali
620
UETrack: A Unified and Efficient Framework for Single Object Tracking PDF ↗
Ben Kang, Jie Zhao, Xin Chen, Wanting Geng, Bin Zhang, Lu Zhang, Dong Wang, Huchuan Lu
621
ProgTrack: A Multi-Object Tracking Algorithm with Progressive Matching Strategy PDF ↗
Chenhui Zhang, Guoqing Dong, Weijie Peng
622
Efficient Video Object Segmentation and Tracking with Recurrent Dynamic Submodel PDF ↗
Weidong Tang, Zhiyuan Liang, Xinyan Wan, Chen Zhu, Zhaopan Xu, Pengfei Zhou, Yan Song, Yang You, Wangbo Zhao
623
Learning to Track Instance from Single Nature Language Description PDF ↗
Yaozong Zheng, Bineng Zhong, Qihua Liang, Shuimu Zeng, Haiying Xia, Shuxiang Song
624
MV-TAP: Tracking Any Point in Multi-View Videos PDF ↗
Jahyeok Koo, Inès Hyeonsu Kim, Mungyeom Kim, Junghyun Park, Seohyeon Park, Jaeyeong Kim, Jung Yi, Seokju Cho, Seungryong Kim
625
Adaptive Depth Lightweight RGB-T Tracking with Holistic Token Routing PDF ↗
Tian Ding, Hongtao Yang, Liangtao Shi, Jun Li, Xiantao Hu, Jian Yang, Ying Tai
626
Content-Adaptive Hierarchical Hyperprior for Neural Video Coding PDF ↗
Junqi Liao, Yaojun Wu, Chaoyi Lin, Zhipin Deng, Li Li, Dong Liu, Xiaoyan Sun
627
UTPTrack: Towards Simple and Unified Token Pruning for Visual Tracking PDF ↗
Hao Wu, Xudong Wang, Jialiang Zhang, Junlong Tong, Xinghao Chen, Junyan Lin, Yunpu Ma, Xiaoyu Shen
628
Similarity-as-Evidence: Calibrating Overconfident VLMs for Interpretable and Label-Efficient Medical Active Learning PDF ↗
Zhuofan Xie, Zishan Lin, Jinliang Lin, Jie Qi, Shaohua Hong, Shuo Li
629
From Infusion to Assimilation Distillation for Medical Image Segmentation PDF ↗
Jiankang Hong, Ye Luo, Yinan Liu, Junsong Yuan
630
IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation PDF ↗
Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai, Xuhong Zhang, Jianwei Yin
631
Unlocking Positive Transfer in Incrementally Learning Surgical Instruments: A Self-reflection Hierarchical Prompt Framework PDF ↗
Yu Zhu, Kang Li, Zheng Li, Pheng-Ann Heng
632
Keep It Frozen: Domain-Routed Conditional Residual Modulation for Multi-Domain Vision Transformers PDF ↗
Ufaq Khan, Umair Nawaz, Massimo Caputo, Muhammad Bilal, Junaid Qadir, Muhammad Haris Khan
633
Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code PDF ↗
Yicheng Wu, Tao Song, Zhonghua Wu, Jin Ye, Zongyuan Ge, Wenjia Bai, Zhaolin Chen, Jianfei Cai
634
MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding PDF ↗
Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinglin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao
635
Turning Pre-Trained Vision Transformers into End-to-End Histopathology Whole Slide Image Models for Survival Prediction PDF ↗
Jiawen Li, Jiali Hu, Xitong Ling, Renao Yan, Yuxuan Chen, Tian Guan, Yonghong He
636
A Supervised Multi-task Framework for Joint cryo-ET Restoration Enabled by Generative Physical Simulation PDF ↗
Xinsheng Wang, Zhidong Yang, Xiaohua Wan, Renmin Han, Shuai Tang, Hao Dong, Fa Zhang, Bin Hu
637
KAMP: Knowledge-Anchored Multimodal Pretraining Framework for Medical Image Representation PDF ↗
Feiyu Huang, Jia Li, Zhao Chen, Yang Wu, Caleb Chen Cao, Lei Chen
638
CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis PDF ↗
Di Zhang, Zhangpeng Gong, Xiaobo Pang, Jiashuai Liu, Junbo Lu, Hao Cui, Jiusong Ge, Zhi Zeng, Kai Yi, Yinghua Li, Si Liu, Tingsong Yu, Haoran Wang, Mireia Crispin-Ortuzar, Weimiao Yu, Chen Li, Zeyu Gao
639
Contrastive Cross-Bag Augmentation for Multiple Instance Learning- based Whole Slide Image Classification PDF ↗
Bo Zhang, Xinan Xu, Shuo Yan, Yu Bai, Zheng Zhang, Wufan Wang, Hui Gao, Wendong Wang
640
OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging PDF ↗
Meilin Liu, Jiaying Wang, Jing Shan
641
Learning complete and explainable visual representations from itemized text supervision PDF ↗
Yiwei Lyu, Chenhui Zhao, Soumyanil Banerjee, Shixuan Liu, Akshay Rao, Akhil Kondepudi, Honglak Lee, Todd C. Hollon
642
EgoPoseFormer v2: Accurate Egocentric Human Motion Estimation for AR/VR PDF ↗
Zhenyu Li, Sai Kumar Dwivedi, Filip Maric, Carlos Chacón, Nadine Bertsch, Filippo Arcadu, Tomas Hodan, Michael Ramamonjisoa, Peter Wonka, Amy Zhao, Robin Kips, Cem Keskin, Anastasia Tkach, Chenhongyi Yang
643
MetricHMSR: Metric Human Mesh and Scene Recovery from Monocular Images PDF ↗
Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu
644
Differentially Private 2D Human Pose Estimation PDF ↗
Kaushik Bhargav Sivangi, Paul Henderson, Fani Deligianni
645
TROPHIES: Temporal Reconstruction of Places, Humans, and Cameras from Multi-view Videos PDF ↗
Jinpeng Liu, Yukang Xu, Yutong Li, Xingyu Liu
646
PoseD-Flow: Versatile and Guided Flow Matching Model of Human Pose PDF ↗
Jebastin Nadar, Simone Foti, Tolga Birdal
647
SIMSPINE: A Biomechanics-Aware Simulation Framework for 3D Spine Motion Annotation and Benchmarking PDF ↗
Muhammad Saif Ullah Khan, Didier Stricker
648
HUMAPS-4D: A Multimodal Dataset for HUman Motion Analysis with Physiological and Semantic informations PDF ↗
Matthieu Dabrowski, Ouala Ben Jemaa, Benjamin Allaert
649
PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement PDF ↗
Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu
650
LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World PDF ↗
Nan Yang, Julian Straub, Fan Zhang, Richard Newcombe, Jakob Engel, Lingni Ma
651
Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasets PDF ↗
Zhuoxuan Peng, Boan Zhu, Xingjian Zhang, Wenying Li, S.-H. Gary Chan
652
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation PDF ↗
Mengshi Qi, Jiaxuan Peng, Xianlin Zhang, Huadong Ma
653
OMGTex: One-stage Multi-style Facial Texture Reconstruction without Geometry Guidance PDF ↗
Xiao Zitong, Yuda Qiu, Zisheng Ye, Xiaoguang Han
654
Human Interaction-Aware 3D Reconstruction from a Single Image PDF ↗
Gwanghyun Kim, Junghun James Kim, Suh Yoon Jeon, Jason Park, Se Young Chun
655
Towards Generalizable AI-Generated Image Detection via Image- Adaptive Prompt Learning PDF ↗
Yiheng Li, Zichang Tan, Guoqing Xu, Zhen Lei, Xu Zhou, Yang Yang
656
SAGA: Source Attribution of Generative AI Videos PDF ↗
Rohit Kundu, Vishal Mohanty, Hao Xiong, Shan Jia, Athula Balachandran, Amit K. Roy-Chowdhury
657
VMD-FACT: A New Video Dataset and MLLM-based method for Detecting Realistic AI-Generated Video Misinformation PDF ↗
Yongkang Zhang, Dongyu She, Baiyu Ji, Qichuan Geng, Zhong Zhou, Yan Wang
658
ReAlign: Generalizable Image Forgery Detection via Reasoning- Aligned Representation PDF ↗
Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang
659
A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World PDF ↗
Jikang Cheng, Renye Yan, Zhiyuan Yan, Yaozhong Gan, Xueyi Zhang, Zhongyuan Wang, Wei Peng, Ling Liang
660
PPM-CLIP: Probabilistic Prompt Modeling for Generalizable AI-Generated Image Detection PDF ↗
Xinyuan Wang, Yingxin Lai, Zhiming Luo, Zhihui Liu
661
Learning from Noisy Supervision: A Denoising–Debiasing Framework for Weakly Supervised Video Anomaly Detection PDF ↗
Yaxin Zhao, Yang Wang, Wenya Guo, Sihan Xu, Xiangrui Cai, Xi Lin, Ying Zhang, Xiaojie Yuan
662
Anomaly as Non-Conformity via Training-Free Graph Laplacian Energy Minimization PDF ↗
Jungwook Seo, Minjeong Kim, Younkwan Lee, Seungho Shin, Sungyong Baik
663
VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer PDF ↗
Yanning Hou, Peiyuan Li, Zirui Liu, Yitong Wang, Yanran Ruan, Jianfeng Qiu, Ke Xu
664
CHAL: Causal-guided Hierarchical Anomaly-aware Learning for Moving Infrared Small Target Detection PDF ↗
Weiwei Duan, Luping Ji, Shipeng Lei, Sicheng Zhu, Jianghong Huang, Mao Ye
665
RAID: Retrieval-Augmented Anomaly Detection PDF ↗
Mingxiu Cai, Zhe Zhang, Gaochang Wu, Tianyou Chai, Xiatian Zhu
666
ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning PDF ↗
Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang
667
InvAD: Inversion-based Reconstruction-Free Anomaly Detection with Diffusion Models PDF ↗
Shunsuke Sakai, Xiangteng He, Chunzhi Gu, Leonid Sigal, Tatsuhito Hasegawa
668
QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy PDF ↗
Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand
669
GSV2X: Geometry-Aware Uncertainty Modeling and Orthogonal Fusion for Robust Roadside Perception PDF ↗
Jianqiang Xu, Gensheng Pei, Huafeng Liu, Yazhou Yao
670
Grounded Latents for Entity-Centric 4D Scene Generation PDF ↗
Jinhyung Park, Navyata Sanghvi, Erica Weng, Shawn Hunt, Shinya Tanaka, Hironobu Fujiyoshi, Kris Kitani
No matches.