Skip to yearly menu bar Skip to main content


ECCV 2026 Accepted Papers:

This paper list is preliminary pending publisher checks.

Keywords
TreeSRNF: Square-Root Normal Fields for Generative Modelling of the Geometric and Structural Variability in Tree-like 3D Objects Poster Session 4
Tahmina Khanam ⋅ Hamid Laga ⋅ Mohammed Bennamoun ⋅ Guanjin Wang ⋅ Ferdous Sohel ⋅ Farid Boussaid ⋅ Anuj Srivastava
3D Graphics and Geometric Representations ExHall # 62
PixelU: A U-Shaped Transformer for Efficient End-to-End Pixel Diffusion Poster Session 4
Zipeng Guo ⋅ Lichen Ma ⋅ Yu He ⋅ Xiaolong Fu ⋅ Jingling Fu ⋅ Junshi Huang ⋅ Yan Li
3D Graphics and Geometric Representations ExHall # 61
MagnetGS-Mesh: High-Quality Multi-Object Mesh Reconstruction via Adaptive Surface Optimization Poster Session 4
Min-Su Park ⋅ Yeonho Han ⋅ Uijoon Jeong ⋅ Jun-Hyeong Park ⋅ Eun-Seok Ryu
3D Graphics and Geometric Representations ExHall # 105
Unsupervised Pixel-Level Semantic Left-Right Understanding of In-the-Wild Images Poster Session 4
Weikang Wang ⋅ Tobias Weißberg ⋅ Florian Bernard
3D Graphics and Geometric Representations ExHall # 60
Scaling Dense Prediction with Latent Decoding Poster Session 4
Xiaoyang Wu ⋅ Yixing Lao ⋅ Chengyao Wang ⋅ Senqiao Yang ⋅ Yujia Zhang ⋅ Hengshuang ZHAO
3D Graphics and Geometric Representations ExHall # 1
Dual Masked Generative Adversarial Transformer for Unsupervised Domain Adaptation Poster Session 4
Lei Zhu ⋅ Xinxing Xu ⋅ Jun Zhou ⋅ Qiegen Liu ⋅ Rick Siow Mong Goh ⋅ Yong Liu
3D Graphics and Geometric Representations ExHall # 5
On the Diffusibility of High-Dimensional Latents Poster Session 4
Chao Feng ⋅ Zhiyang Xu ⋅ Bowei Chen ⋅ Yuanjun Xiong ⋅ Xiyao Wang ⋅ Jui-Hsien Wang ⋅ Richard Zhang ⋅ Zhe Lin ⋅ Andrew Owens ⋅ Yijun Li
3D Graphics and Geometric Representations ExHall # 10
FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs Poster Session 4
Wenlong Cheng ⋅ Yuan Gan ⋅ Yunqiu Xu ⋅ Jiaxu Miao
3D Graphics and Geometric Representations ExHall # 32
STAT: Soft Tail-dropping for Adaptive Visual Tokenization Poster Session 4
Zeyuan Chen ⋅ Kai Zhang ⋅ Zhuowen Tu ⋅ Yuanjun Xiong
3D Graphics and Geometric Representations ExHall # 59
Why Linear Probing Works: Non-Vacuous Generalization Bounds via Effective Dimension Poster Session 4
Dongxin Guo ⋅ Jikun Wu ⋅ SM Yiu
3D Graphics and Geometric Representations ExHall # 112
Parametric SDF for Dynamic Surface Reconstruction Poster Session 4
Chong Gao ⋅ Kai Ye ⋅ Qiyu Dai ⋅ Yiming Shao ⋅ Qiong Zeng ⋅ Ding Liang ⋅ Yanpei Cao ⋅ Guanbin Li ⋅ Wenzheng Chen
3D Graphics and Geometric Representations ExHall # 58
TriFlow: Generating Artist-Like 3D Mesh Topology via Nearest-Vertex Vector Fields Poster Session 4
Haoxuan Li ⋅ Ziya Erkoç ⋅ Daniele Sirigatti ⋅ Vladislav Rosov ⋅ Lei Li ⋅ Angela Dai ⋅ Matthias Niessner
3D Graphics and Geometric Representations ExHall # 57
MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes Poster Session 4
Kartik Bali ⋅ Roland Aydin
3D Graphics and Geometric Representations ExHall # 56
Kinematics-Agnostic 3D Human Motion Prediction via Equivariant Latent Diffusion Poster Session 4
Cecilia Curreli ⋅ Florian Hofherr ⋅ Dominik Muhle ⋅ Abhishek Saroha ⋅ Riccardo Marin ⋅ Daniel Cremers
3D Graphics and Geometric Representations ExHall # 2
DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generation Poster Session 4
Eungjune Shim ⋅ Hansol Lee ⋅ Eunjung Ju
3D Graphics and Geometric Representations ExHall # 104
G2FM: A Geodesic Flow Matching Framework with Geometric Prior for Category-Level 9-DoF Pose Estimation Poster Session 4
Qianyu Chen ⋅ Xiaogang Zhang ⋅ Yangyi Wan ⋅ Zhengzhao Pan ⋅ Kai Wang ⋅ Yuqi Cai ⋅ Wenbin Yan ⋅ feng yang ⋅ Hua Chen
3D Graphics and Geometric Representations ExHall # 6
REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion Poster Session 4
Giorgos Petsangourakis ⋅ Christos Sgouropoulos ⋅ Bill Psomas ⋅ Theodoros Giannakopoulos ⋅ Giorgos Sfikas ⋅ Ioannis Kakogeorgiou
3D Graphics and Geometric Representations ExHall # 55
PRISM: Latent Composition Consistency for Single-Image Reflection Removal Poster Session 4
Junseong Shin ⋅ Tae Hyun Kim
3D Graphics and Geometric Representations ExHall # 103
Pathryoshka: Compressing Pathology Foundation Models via Multi-Teacher Knowledge Distillation with Nested Embeddings Poster Session 4
Christian Grashei ⋅ Christian Brechenmacher ⋅ Rao Umer ⋅ Jingsong Liu ⋅ Carsten Marr ⋅ Peter Schüffler ⋅ Ewa Szczurek
3D Graphics and Geometric Representations ExHall # 54
ReSWD: ReSTIR‘d, not shaken. Combining Reservoir Sampling and Sliced Wasserstein Distance for Variance Reduction. Poster Session 4
Mark Boss ⋅ Andreas Engelhardt ⋅ Simon Donné ⋅ Varun Jampani
3D Graphics and Geometric Representations ExHall # 14
Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution Poster Session 4
Soyeon Kim ⋅ Kyowoon Lee ⋅ Jaesik Choi
3D Graphics and Geometric Representations ExHall # 102
Geometric Foundation Model Distillation for Efficient Lunar 3D Reconstruction Poster Session 4
Clémentine Grethen
3D Graphics and Geometric Representations ExHall # 53
NeuralGarSim: Geometry-agnostic Garment Simulation with Neural Fields Poster Session 4
Arihant Gaur ⋅ Navami Kairanda ⋅ Christian Theobalt ⋅ Vladislav Golyanik
3D Graphics and Geometric Representations ExHall # 114
JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising Poster Session 4
Siang Ling Zhang ⋅ Huai-Hsun Cheng ⋅ Tsung-Ju Yang ⋅ Yu-Lun Liu
3D Graphics and Geometric Representations ExHall # 52
DOGE: Differentiable Bézier Graph Optimization for Road Network Extraction Poster Session 4
Jiahui Sun ⋅ Junran Lu ⋅ Jinhui Yin ⋅ Yishuo Xu ⋅ Yuanqi Li ⋅ Yanwen Guo
3D Graphics and Geometric Representations ExHall # 51
BRepFacetGen: Reverse Engineering B-Reps By Generative Face Segmentation Poster Session 4
Ka Hei Hui ⋅ Vikas Thamizharasan ⋅ Pradeep Kumar Jayaraman ⋅ Xiang Xu
3D Graphics and Geometric Representations ExHall # 50
Penetration-Free Compositional 3D Generation via Gaussian Surface Offset Poster Session 4
Yilin Shao ⋅ Licheng Jiao ⋅ Lingling Li ⋅ Xu Liu ⋅ Fang Liu ⋅ Wenping Ma ⋅ Long Sun ⋅ Jiaxuan Zhao
3D Graphics and Geometric Representations ExHall # 101
Teaching an Agent to Sketch One Part at a Time Poster Session 4
Xiaodan Du ⋅ Ruize Xu ⋅ David Yunis ⋅ Yael Vinker ⋅ Greg Shakhnarovich
3D Graphics and Geometric Representations ExHall # 49
Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality Poster Session 4
Lingjing Kong ⋅ Shaoan Xie ⋅ Guangyi Chen ⋅ Yuewen Sun ⋅ Xiangchen Song ⋅ Kun Zhang
3D Graphics and Geometric Representations ExHall # 48
PKINet-v2: Towards Powerful and Efficient Poly-Kernel Remote Sensing Object Detection Poster Session 4
Xinhao Cai ⋅ Liulei Li ⋅ Gensheng Pei ⋅ Zeren Sun ⋅ Yazhou Yao ⋅ Wenguan Wang
3D Graphics and Geometric Representations ExHall # 3
Automatic Method Illustration Generation for AI Scientific Papers via Drawing Middleware Creation, Evolution, and Orchestration Poster Session 4
ZHUOLING Li ⋅ Jiarui Zhang ⋅ Ping Hu ⋅ Jason Kuen ⋅ Jiuxiang Gu ⋅ Hossein Rahmani ⋅ Jun Liu
3D Graphics and Geometric Representations ExHall # 47
TopoFuse: Topology-Aware Tri-Planar Fusion for 3D Cryo-Electron Tomography Segmentation Poster Session 4
Rohit Kumar Salla ⋅ Neelesh Gupta ⋅ Xingjian Li ⋅ Min Xu
3D Graphics and Geometric Representations ExHall # 45
Q-BridgeNet: A Quantization Network for Cross-Lingual Sign Language Translation Poster Session 4
Liqian Feng ⋅ Lintao Wang ⋅ Xiaochen Liu ⋅ Anusha Withana ⋅ Ken-Tye Yong ⋅ Dehui Kong ⋅ Zhiyong Wang ⋅ Kun Hu
3D Graphics and Geometric Representations ExHall # 100
DuoFlow: JVP-Free Finite-Difference Mean Flows for One-Step Image Generation Poster Session 4
Zeming Li ⋅ Xiangyu Zhang ⋅ Ping Tan ⋅ Heung-Yeung Shum
3D Graphics and Geometric Representations ExHall # 44
LumiTokens: 3D Relighting via Token-Space Lighting Transformation Poster Session 4
Yiwen Chen ⋅ Matheus Gadelha ⋅ Huaizu Jiang
3D Graphics and Geometric Representations ExHall # 99
AVQ-Attention: Adaptive Vector-Quantized Attention Poster Session 4
Winfried van den Dool ⋅ Patrick Forré ⋅ Amirhossein Habibian ⋅ Yuki Asano ⋅ Max Welling
3D Graphics and Geometric Representations ExHall # 76
SimFlow: Simplified and End-to-End Training of Latent Normalizing Flows Poster Session 4
Qinyu Zhao ⋅ Guangting Zheng ⋅ Tao Yang ⋅ Rui Zhu ⋅ Xingjian Leng ⋅ Stephen Gould ⋅ Liang Zheng
3D Graphics and Geometric Representations ExHall # 43
APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images Poster Session 4
Suhyeon Ha ⋅ Woo Jae Kim ⋅ Joonsung Jeon ⋅ Sooel Son ⋅ Sung-eui Yoon
3D Graphics and Geometric Representations ExHall # 42
Controlling Embedding Spaces with Text-Conditioned Transformations Poster Session 4
Joseph Fioresi ⋅ Fabian Caba ⋅ Pankaj Nathani ⋅ Shah Mubarak ⋅ Kushal Kafle
3D Graphics and Geometric Representations ExHall # 41
Hi-DREAM: Brain Inspired Hierarchical Diffusion for fMRI-to-image Reconstruction via ROI Encoder And visual Mapping Poster Session 4
Guowei Zhang ⋅ Yun Zhao ⋅ Kai Sun ⋅ Moein Khajehnejad ⋅ Adeel Razi ⋅ Dinh Q Phung ⋅ Levin Kuhlmann
3D Graphics and Geometric Representations ExHall # 40
Generalization and Memorization in Rectified Flow Poster Session 4
Mingxing Rao ⋅ Daniel Moyer
3D Graphics and Geometric Representations ExHall # 97
DiGS-Avatar: Single-Image Animatable 3D Human Reconstruction via UV-Space Diffusion Poster Session 4
jiakun li ⋅ Li Fang ⋅ Hao Zhu ⋅ Fei Hu ⋅ Long Ye ⋅ Yuan Zhang ⋅ Jinyao Yan
3D Graphics and Geometric Representations ExHall # 39
Diffusion-Based Material Regularization for Physics-Based Inverse Rendering Poster Session 4
Jingwang Ling ⋅ Lifan Wu ⋅ Feng Xu ⋅ Shuang Zhao
3D Graphics and Geometric Representations ExHall # 11
ReDesign: Recovering Editable Design Structures from Raster Images via Agentic Decomposition Poster Session 4
Jooyeol Yun ⋅ Jintae Park ⋅ Hyesu Lim ⋅ Junha Hyung ⋅ Hyungjin Chung ⋅ Choo Jaegul
3D Graphics and Geometric Representations ExHall # 12
Adaptive Noise Covariance Scheduling under Riemannian Metrics for Diffusion Models Poster Session 4
Bolin Deng ⋅ Die Hu ⋅ Bin Tan ⋅ Jun Wu
3D Graphics and Geometric Representations ExHall # 38
DreamCAD: Scaling Multi-modal CAD Generation using Differentiable Parametric Surfaces Poster Session 4
Mohammad Sadil Khan ⋅ Muhammad Usama ⋅ Rolandos Alexandros Potamias ⋅ Didier Stricker ⋅ Muhammad Zeshan Afzal ⋅ Jiankang Deng ⋅ Ismail Elezi
3D Graphics and Geometric Representations ExHall # 37
MapDreamer: Aerial Imagery Conditioned Latent Diffusion For Lane Level Map Generation Poster Session 4
Julian Brandes ⋅ Philipp Crocoll ⋅ Wolfram Burgard
3D Graphics and Geometric Representations ExHall # 13
Triangular Consistency as a Universal Constraint for Learning Optical Flow Poster Session 4
Yi Xiao ⋅ Carlos Rodriguez Coronel ⋅ Jing Zhan ⋅ Haniyeh Oskouie ⋅ Alex Wong ⋅ DONG LAO
3D Graphics and Geometric Representations ExHall # 26
Heat Kernel Textures -- the Geodesic Gaussians That Do Not Splat Poster Session 4
Simone Foti ⋅ Caner Korkmaz ⋅ Stefanos Zafeiriou ⋅ Tolga Birdal
3D Graphics and Geometric Representations ExHall # 15
TiltDiff: Tilted Weight-Space Diffusion for Neural Network Generation Poster Session 4
En-Ni Chuang ⋅ Hanjuan Huang ⋅ Hao-Jia Song ⋅ Hsing-Kuo Kenneth Pao ⋅ Tyng-Luh Liu
3D Graphics and Geometric Representations ExHall # 111
NURBS Splatting: A Unified Differentiable Rendering Framework for Vector Graphics Poster Session 4
Jingye Qiu ⋅ Shizhe Zhou
3D Graphics and Geometric Representations ExHall # 36
ThermoGS: Decoupling Physical Surface Attributes for Spatio-Temporal Thermal Field Emulation via 4D Gaussian Splatting Poster Session 4
Kun Yang ⋅ Yuxiang Liu ⋅ Zeyu Cui ⋅ Shen Yan ⋅ Maojun Zhang ⋅ Yu Liu ⋅ Xue Wang ⋅ Qing Wang
3D Graphics and Geometric Representations ExHall # 35
AV2T-Gen: Aerial Visible to Thermal Generation with Environment and Vehicle State Guidance Poster Session 4
Kun Yang ⋅ Yuxiang Liu ⋅ Yihan Wang ⋅ Shen Yan ⋅ Maojun Zhang ⋅ Yu Liu ⋅ Xue Wang ⋅ Qing Wang
3D Graphics and Geometric Representations ExHall # 34
Multi-View Foundation Models Poster Session 4
Leo Segre ⋅ Or Hirschorn ⋅ Shai Avidan
3D Graphics and Geometric Representations ExHall # 33
Vector Scaffolding: Inter-Scale Orchestration for Differentiable Image Vectorization Poster Session 4
Jaerin Lee ⋅ KANGGEON LEE ⋅ Kyoung Mu Lee
3D Graphics and Geometric Representations ExHall # 96
VNC: A Scale-Space Foundation for Learnable 3D Surface Evolution Poster Session 4
Baoxing Li ⋅ Yong Deng ⋅ Xu Zhao
3D Graphics and Geometric Representations ExHall # 95
K-Mask: Kinematic-Aware Masked Modeling for Controllable Text-to-Motion Synthesis Poster Session 4
Faisal Ahmed ⋅ Chenqiu Zhao ⋅ Anup Basu
3D Graphics and Geometric Representations ExHall # 108
ShellMaker: Language-Guided Exterior Completion under Structural Constraints Poster Session 4
Ruiqi Xu ⋅ Daniel Aliaga
3D Graphics and Geometric Representations ExHall # 16
HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models Poster Session 4
Shizhuo Mao ⋅ Hongtao Zou ⋅ Qihu Xie ⋅ Song Chen ⋅ Yi Kang
3D Graphics and Geometric Representations ExHall # 94
DiffPro: Joint Timestep and Layer-Wise Precision Optimization for Efficient Diffusion Inference Poster Session 4
Farhana Amin ⋅ Sabiha Afroz ⋅ Kanchon Gharami ⋅ Mona Moghadampanah ⋅ Dimitrios Nikolopoulos
3D Graphics and Geometric Representations ExHall # 17
Through Van Gogh’s Eyes: Global Style Transfer with Diffusion Model Poster Session 4
Jeongha Lee ⋅ Yujin Kim ⋅ Ghazanfar Ali ⋅ Suhyun Kim ⋅ Jae-In Hwang
3D Graphics and Geometric Representations ExHall # 93
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction Poster Session 4
Naru Suzuki ⋅ Takehiko Ohkawa ⋅ Tatsuro Banno ⋅ Jihyun Lee ⋅ Ryosuke Furuta ⋅ Yoichi Sato
3D Graphics and Geometric Representations ExHall # 46
EVAR: Edge Visual Autoregressive Models via Principled Pruning Poster Session 4
Zefang Wang ⋅ Ying Li ⋅ Yanyu Li ⋅ Mingluo Su ⋅ Simin Xu ⋅ Guanzhong Tian ⋅ Huan Wang
3D Graphics and Geometric Representations ExHall # 18
JSON: Jigsaw Self-play Optimization for Normalizing Flows Poster Session 4
Fengxiang Yang ⋅ Tianyi Zheng ⋅ Jinwei Chen ⋅ Bo Li
3D Graphics and Geometric Representations ExHall # 19
Deformable and Multi-view Gradient-Aligned Physical Adversarial Camouflage Poster Session 4
Jiawei Liang ⋅ Puning Zhao ⋅ tianrui lou ⋅ Haoqing Zhang ⋅ Xianghao Jiao ⋅ Bozheng Lin ⋅ Ming Zhang ⋅ Xiaochun Cao
3D Graphics and Geometric Representations ExHall # 92
HolisticSemGes: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching Poster Session 4
Lanmiao Liu ⋅ Esam Ghaleb ⋅ asli ozyurek ⋅ Zerrin Yumak
3D Graphics and Geometric Representations ExHall # 20
ReFP-AD: Rectified Flow Preconditioning for Energy-Based Anomaly Detection Poster Session 4
Camile Lendering ⋅ Erkut Akdag ⋅ Joaquin Figueira Chacon ⋅ Egor Bondarev
3D Graphics and Geometric Representations ExHall # 91
Bridging the Geometry Mismatch: Frequency-Aware Anisotropic Serialization for Thin-Structure SSMs Poster Session 4
Jin Bai ⋅ Huiyao Zhang ⋅ Qi Wen ⋅ Ningyang Li ⋅ Shengyang Li ⋅ Atta ur Rahman ⋅ Xiaolin Tian
3D Graphics and Geometric Representations ExHall # 90
FlowFace: Rectifying Identity Conditioning with Riemannian Geometry for Face Generation Poster Session 4
Xinran Deng ⋅ Yiling Wu ⋅ Ye Tian ⋅ Libo Zhang
3D Graphics and Geometric Representations ExHall # 21
Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models Poster Session 4
Wenyue Chen ⋅ Wenjue Chen ⋅ Peng Li ⋅ Qinghe Wang ⋅ XU JIA ⋅ Heliang Zheng ⋅ Rongfei Jia ⋅ Yuan Liu ⋅ Ronggang Wang
3D Graphics and Geometric Representations ExHall # 28
Bridging Online and Offline Handwriting via Differentiable Physical Rendering Poster Session 4
Seonmi Park ⋅ Seunghyun Shin ⋅ Vihaan Misra ⋅ Dongmin Shin ⋅ Ukcheol Shin ⋅ Jean Oh ⋅ Hae-Gon Jeon
3D Graphics and Geometric Representations ExHall # 22
Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading Poster Session 4
Hong Li ⋅ Minqi Meng ⋅ Yanjun Liang ⋅ Chongjie Ye ⋅ Houyuan Chen ⋅ Weiqing Xiao ⋅ Xianda Guo ⋅ Guojun Lei ⋅ Xuhui Liu ⋅ Chaojie Yang ⋅ Yanlun Peng ⋅ HAO ZHAO ⋅ Baochang Zhang
3D Graphics and Geometric Representations ExHall # 89
Differentiable Polarized Path Tracing Poster Session 4
Pramod Rao ⋅ Jérémy Riviere ⋅ xilong zhou ⋅ Abhijeet Ghosh ⋅ Abhimitra Meka ⋅ Thabo Beeler ⋅ Marc Habermann ⋅ Christian Theobalt ⋅ Delio Vicini
3D Graphics and Geometric Representations ExHall # 88
EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation Poster Session 4
Yan Li ⋅ Ning Liao ⋅ Xiangyu Zhao ⋅ Shaofeng Zhang ⋅ Xiaoxing Wang ⋅ Yifan Yang ⋅ Junchi Yan ⋅ Xue Yang
3D Graphics and Geometric Representations ExHall # 29
A Scalable Vector Graphics Latent Space Poster Session 4
Leonardo Zini ⋅ Elia Frigieri ⋅ Lorenzo Baraldi
3D Graphics and Geometric Representations ExHall # 87
CoToGrasp: Contact-Topology-Conditioned Dexterous Grasp Synthesis via Canonical Workspace Learning Poster Session 4
Julien Mérand ⋅ Boris Meden ⋅ Liming Chen ⋅ Mathieu GROSSARD
3D Graphics and Geometric Representations ExHall # 86
Repurposing Geometric Foundation Models for Multi-view Diffusion Poster Session 4
Wooseok Jang ⋅ Seonghu Jeon ⋅ Jisang Han ⋅ Jinhyeok Choi ⋅ Minkyung Kwon ⋅ Seungryong Kim ⋅ Saining Xie ⋅ Sainan Liu
3D Graphics and Geometric Representations ExHall # 85
Pixel Ignores, Superpixel Sees: Adverse Weather Image Restoration via Semantic-Center SSM Poster Session 4
Dayu Li ⋅ shihao zhou ⋅ SHU LEIZHI ⋅ Jin Wu ⋅ Chi Man VONG ⋅ Jufeng Yang
3D Graphics and Geometric Representations ExHall # 84
Geodesic Flow Matching on a Riemannian Degradation Manifold for Blind Image Restoration Poster Session 4
Akshay Bankar ⋅ Ankita Chatterjee ⋅ Sayan Banerjee ⋅ Shreyas Pandith ⋅ Kalakonda Shashank ⋅ Amit Unde
3D Graphics and Geometric Representations ExHall # 83
Reconstructing 3D Human-Object Interaction via a Unified Triplane Space Poster Session 4
Yuhang Chen ⋅ Chenxing Wang
3D Graphics and Geometric Representations ExHall # 82
FPicker: Topology-Guided Evolution for Filament Tracing in Low-SNR Microscopy Poster Session 4
Tingyin Zhao ⋅ Mingtao Huang ⋅ Yuan Shen
3D Graphics and Geometric Representations ExHall # 23
OmniX: From Unified Panoramic Generation and Perception To Graphics-Ready 3D Scenes Poster Session 4
Yukun Huang ⋅ Jiwen Yu ⋅ Yanning Zhou ⋅ Jianan Wang ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Xihui Liu
3D Graphics and Geometric Representations ExHall # 81
Text-based Tactile Graphics Generation for the Visually Impaired Poster Session 4
Ruihan Gao ⋅ Joonghyuk Shin ⋅ Ava Pun ⋅ Jaesik Park ⋅ Wenzhen Yuan ⋅ Jun-Yan Zhu
3D Graphics and Geometric Representations ExHall # 80
Stitched Embeddings: A Unified Latent Space for 3D Garments and 2D Patterns Poster Session 4
Andrea Sanchietti ⋅ Riccardo Marin ⋅ Bharat Bhatnagar ⋅ Yuanlu Xu ⋅ Gerard Pons-Moll
3D Graphics and Geometric Representations ExHall # 110
Language-Guided Transformer Tokenizer for Human Motion Generation Poster Session 4
Sheng Yan ⋅ yong wang ⋅ Xin Du ⋅ Junsong Yuan ⋅ Mengyuan Liu
3D Graphics and Geometric Representations ExHall # 79
DANTE-W: Diffuse Albedo Neural Texturing in the Wild Poster Session 4
Guangyu Wang ⋅ Tianheng Lu ⋅ Ruqi Huang ⋅ Lu Fang
3D Graphics and Geometric Representations ExHall # 78
DreamPartGen: Semantically Grounded Part-Level 3D Generation via Collaborative Latent Denoising Poster Session 4
Tianjiao (Joey) Yu ⋅ Xinzhuo Li ⋅ Muntasir Wahed ⋅ Jerry Xiong ⋅ Yifan Shen ⋅ Ying Shen ⋅ Ismini Lourentzou
3D Graphics and Geometric Representations ExHall # 77
FontCopilot: Towards Generalist Multimodal Large Language Models for Holistic Chinese Font Engineering Poster Session 4
Yu Liu ⋅ Yang Liu ⋅ Ying Gao ⋅ Yang Ding ⋅ Cunrui Wang
3D Graphics and Geometric Representations ExHall # 24
CogSENet: Blind Image Deblurring with Blur-Conditioned Semantic Routing and Explicit Frequency Fusion Poster Session 4
Pan Wang ⋅ Yihao Hu ⋅ Xiujin Liu
3D Graphics and Geometric Representations ExHall # 4
Complex-Valued 2D Gaussian Representation for Computer-Generated Holography Poster Session 4
Yicheng Zhan ⋅ Xiangjun Gao ⋅ Long Quan ⋅ Kaan Akşit
3D Graphics and Geometric Representations ExHall # 7
Robust 3DGS-based SLAM via Adaptive Kernel Smoothing Poster Session 4
Shouhe Zhang ⋅ Dayong Ren ⋅ WEN LI ⋅ Piaopiao Yu ⋅ Sensen Song ⋅ Kaikai Shao ⋅ Yurong Qian
3D Graphics and Geometric Representations ExHall # 109
Reflecting Process Expertise in Procedural Material Generation Poster Session 4
Kunal Gupta ⋅ Gaurav Joshi ⋅ Yen-Ru Chen ⋅ Seemandhar Jain ⋅ Ishit Mehta ⋅ Manmohan Chandraker
3D Graphics and Geometric Representations ExHall # 75
Entropy-Controlled Flow Matching Poster Session 4
Chika Maduabuchi
3D Graphics and Geometric Representations ExHall # 25
Learning Geometry-Aware Embedding Fields for Intrinsic Riemannian Mappings Poster Session 4
Bo Pang ⋅ Simone Foti ⋅ Tolga Birdal
3D Graphics and Geometric Representations ExHall # 74
Exo2EgoPolicy: Pose-Aligned Cross-View Policy Learning Poster Session 4
Hritam Basak ⋅ Hadi Tabatabaee ⋅ Xin Yang ⋅ Shreekant Gayaka ⋅ Nan Qiao ⋅ Yuyin Sun ⋅ Cheng-Hao Kuo ⋅ Zhaozheng Yin ⋅ Min Sun
3D Graphics and Geometric Representations ExHall # 27
ExPLoRe: Expert Patch-Level Loss Routing for Multi-Objective Masked Image Modeling Poster Session 4
Konstantinos Georgiou ⋅ Maofeng Tang ⋅ Hairong Qi
3D Graphics and Geometric Representations ExHall # 115
SAM2Matting: Generalized Image and Video Matting Poster Session 4
Ruiqi Shen ⋅ Guangquan Jie ⋅ Chang Liu ⋅ Henghui Ding
3D Graphics and Geometric Representations ExHall # 73
CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization Poster Session 4
Chuyan Chen ⋅ Peng Sun ⋅ Kun Yuan
3D Graphics and Geometric Representations ExHall # 113
Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback Poster Session 4
Guotao Liang ⋅ Zhangcheng Wang ⋅ Juncheng Hu ⋅ Haitao Zhou ⋅ Ziteng Xue ⋅ Jing Zhang ⋅ Dong Xu ⋅ Qian Yu
3D Graphics and Geometric Representations ExHall # 72
WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion Poster Session 4
Manuel-Andreas Schneider ⋅ Angela Dai
3D Graphics and Geometric Representations ExHall # 71
Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration Poster Session 4
Mohammadjavad Matinkia ⋅ Nilanjan Ray
3D Graphics and Geometric Representations ExHall # 98
Revisiting Avatar-As-Image: High-Fidelity Registration is All You Need Poster Session 4
Margaret Kostyrko ⋅ Yuxuan Xue ⋅ Garvita Tiwari ⋅ Gerard Pons-Moll
3D Graphics and Geometric Representations ExHall # 8
WorldAgents: Can Foundation Image Models be Agents for 3D World Models? Poster Session 4
Ziya Erkoç ⋅ Angela Dai ⋅ Matthias Niessner
3D Graphics and Geometric Representations ExHall # 107
Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling Poster Session 4
Meimingwei Li ⋅ Stefan Andreas Baumann ⋅ Felix Krause ⋅ Bjorn Ommer
3D Graphics and Geometric Representations ExHall # 9
GenSP: Consistent Spherical Parameterization via Learning Shape Generative Models Poster Session 4
Sai Karthikey Pentapati ⋅ Shashank Gupta ⋅ Rajesh Sureddi ⋅ Yuezhi Yang ⋅ Alan Bovik ⋅ Qixing Huang
3D Graphics and Geometric Representations ExHall # 30
HuCollisionField: Resolving Self-Collisions via Neural Fields for Human Prediction Poster Session 4
Zhengyuan Li ⋅ Zeyun Deng ⋅ Yifan Shen ⋅ Liang-Yan Gui ⋅ Miaolan Xie ⋅ Joseph Campbell ⋅ Xifeng Gao ⋅ Kui Wu ⋅ Zherong Pan ⋅ Aniket Bera
3D Graphics and Geometric Representations ExHall # 31
Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows Poster Session 4
Janne Perini ⋅ Rafael Bischof ⋅ Moab Arar ⋅ Ayça Duran ⋅ Michael Kraus ⋅ Siddhartha Mishra ⋅ Bernd Bickel
3D Graphics and Geometric Representations ExHall # 70
WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens Poster Session 4
Yiwei Guo ⋅ Shaobin Zhuang ⋅ Zhipeng Huang ⋅ Canmiao Fu ⋅ Chen Li ⋅ Jing LYU ⋅ Yali Wang
3D Graphics and Geometric Representations ExHall # 69
MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation Poster Session 4
Yang Chen ⋅ Xiaowei Xu ⋅ Shuai Wang ⋅ Xinwen Zhang ⋅ Qiushi Guo ⋅ Tiezheng Ge ⋅ Limin Wang
3D Graphics and Geometric Representations ExHall # 106
Hybrid-LUT: Channel-Aware Hybrid Lookup Table and Filtering for Efficient Image Restoration Poster Session 4
Zhilin Ai ⋅ Boyu Li ⋅ Sidi Yang ⋅ Wenqing Shi ⋅ Wenyong Zhou ⋅ Binxiao Huang ⋅ Chenchen Ding ⋅ Ngai Wong
3D Graphics and Geometric Representations ExHall # 68
URHead: A Unified UV-Space Representation for Joint Mesh–3DGS Optimization in Head Avatars Poster Session 4
Seonghak Lee ⋅ Junhee Cho ⋅ Jisoo Park ⋅ Min-Gyu Park ⋅ Jongmin Lee ⋅ Ju Yoon ⋅ Junseok Kwon
3D Graphics and Geometric Representations ExHall # 67
DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection Poster Session 4
hun im ⋅ Jungi Lee ⋅ Subeen Cha ⋅ Pilsung Kang
3D Graphics and Geometric Representations ExHall # 66
Learning Video Dynamics with Predictive Differentiable Rendering Poster Session 4
Yujin Tang ⋅ Tian Zhou ⋅ Xin Lin ⋅ Cheng Tan ⋅ Yifan Hu ⋅ Rong Jin ⋅ SouYoung Jin ⋅ Liang Sun
3D Graphics and Geometric Representations ExHall # 65
Learning to Tessellate: Point Cloud Generation via Recursive Spectral Partitioning Poster Session 4
Monan Sun ⋅ Bangzhen Liu ⋅ Huaidong Zhang ⋅ Shengfeng He
3D Graphics and Geometric Representations ExHall # 64
Temporally Stable Generative Illumination with a One-Step Diffusion Model Poster Session 4
Harish Anand ⋅ Alexandr Kuznetsov ⋅ Sungye Kim ⋅ Wojciech Uss ⋅ Wojciech Kaliński ⋅ Rama Harihara
3D Graphics and Geometric Representations ExHall # 63
StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views Poster Session 1
Jia-Chen Zhao ⋅ Beiqi Chen ⋅ Xinyang Chen ⋅ Guangcong Wang ⋅ Liqiang Nie
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 114
World Reconstruction From Inconsistent Views Poster Session 1
Lukas Höllein ⋅ Matthias Niessner
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 116
GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence Poster Session 1
Junwei Zhou ⋅ Yu-Wing Tai
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 117
Geo-ID: Test-Time Geometric Consensus for Cross-View Consistent Intrinsics Poster Session 1
Alara Dirik ⋅ Stefanos Zafeiriou
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 118
FaCT-GS: Fast and Scalable CT Reconstruction with Gaussian Splatting Poster Session 1
Pawel Pieta ⋅ Rasmus Juul Pedersen ⋅ Sina Borgi ⋅ Jakob S. Jørgensen ⋅ Jens Wenzel Andreasen ⋅ Vedrana Dahl
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 120
GAP-Track: Bridging the Resolution Gap for Cross-Resolution RGBT Tracking Poster Session 1
Shiyu Zhang ⋅ Tianyang Xu ⋅ Zhangyong Tang ⋅ Wang He ⋅ Xiao-Jun Wu ⋅ Josef Kittler
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 121
GaINeR: Geometry-Aware Implicit Neural Representation for Image Editing Poster Session 1
Weronika Jakubowska ⋅ Mikołaj Zieliński ⋅ Rafał Tobiasz ⋅ Krzysztof Byrski ⋅ Maciej Zieba ⋅ Dominik Belter ⋅ Przemysław Spurek
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 122
Free-Range Gaussians: Non-Grid-Aligned Generative 3D Gaussian Reconstruction Poster Session 1
Akhmedkhan Shabanov ⋅ Peter Hedman ⋅ Ethan Weber ⋅ Zhengqin Li ⋅ Denys Rozumnyi ⋅ Gael Le Lan ⋅ Naina Dhingra ⋅ Lei Luo ⋅ Andrea Vedaldi ⋅ Christian Richardt ⋅ Andrea Tagliasacchi ⋅ Bo Zhu ⋅ Numair Khan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 123
Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth Poster Session 1
Jung-Hee Kim ⋅ Xiaoming Liu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 124
PanoLess: Environment Reconstruction from Partial Reflective Views Poster Session 1
Ahitagni Das ⋅ Ashok Veeraraghavan ⋅ Vivek Boominathan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 125
CARA: Collision-Aware Resolution Adaptation for Multiresolution Hash Encoding Based Image Fitting Poster Session 1
Linfeng Ye ⋅ Zhixiang Chi ⋅ Shayan Mohajer Hamidi ⋅ En-Hui Yang ⋅ Konstantinos Plataniotis
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 126
GeoNVS: Geometry Grounded Video Diffusion for Novel View Synthesis Poster Session 1
Minjun Kang ⋅ Inkyu Shin ⋅ Taeyeop Lee ⋅ Myungchul Kim ⋅ In Kweon ⋅ KUK-JIN YOON
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 127
FillGS: Filling Observation Gaps in 4D Gaussian Splatting via Viewpoint-Time Selection and Generative Refinement Poster Session 1
Takashi Otonari ⋅ Toshihiko Yamasaki
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 128
Large-Scale High-Quality 3D Gaussian Head Reconstruction from Multi-View Captures Poster Session 1
Evan Ntavelis ⋅ Sean Wu ⋅ Mohamad Shahbazi ⋅ Fabio Maninchedda ⋅ Dmitry Kostiaev ⋅ Artem Sevastopolsky ⋅ Mehak Gupta ⋅ Vittorio Megaro ⋅ Trevor Phillips ⋅ Thomas Etterlin ⋅ Jeronimo Bayer ⋅ Simon Schaefer ⋅ Matthias Vestner ⋅ Shridhar Ravikumar ⋅ Christian Zimmermann ⋅ Alejandro Blumentals ⋅ Reinhard Knothe ⋅ Mathias Deschler ⋅ Alexey Artemov ⋅ Stefan Brugger ⋅ Peter Kaufmann ⋅ Sebastian Martin ⋅ Brian Amberg ⋅ Tom Runia
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 129
Confidence-Based Mesh Extraction from 3D Gaussians Poster Session 1
Lukas Radl ⋅ Felix Windisch ⋅ Andreas Kurz ⋅ Thomas Köhler ⋅ Michael Steiner ⋅ Markus Steinberger
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 130
InstantHDR: Single-forward Gaussian Splatting for High Dynamic Range 3D Reconstruction Poster Session 1
Dingqiang Ye ⋅ Jiacong Xu ⋅ Jianglu Ping ⋅ Yuxiang Guo ⋅ Chao Fan ⋅ Vishal Patel
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 131
Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing Poster Session 1
Jiyuan Wang ⋅ Chunyu Lin ⋅ Lei Sun ⋅ Zhi Cao ⋅ Yuyang Yin ⋅ Lang Nie ⋅ Zhenlong Yuan ⋅ Xiangxiang Chu ⋅ Yunchao Wei ⋅ Kang Liao ⋅ Guosheng Lin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 133
SpectralSplats: Robust Differentiable Tracking via Spectral Moment Supervision Poster Session 1
Avigail Cohen Rimon ⋅ Amir Mann ⋅ Mirela Ben-Chen ⋅ Or Litany
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 134
Do Flat Minima Improve Sparse Novel View Synthesis? Poster Session 1
Youngsik Yun ⋅ Dongjun Gu ⋅ Youngjung Uh
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 135
ViewSplat: View-Adaptive Dynamic Gaussian Splatting for Feed-Forward Synthesis Poster Session 1
Moonyeon Jeong ⋅ Seunggi Min ⋅ Suhyeon Lee ⋅ Hongje Seong
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 136
Fast and Compact 3D Gaussian Splatting with Polarized Opacity Prior Poster Session 1
Zi-Ming Wang ⋅ Kevin Duan ⋅ Ko Wei Huang ⋅ Akihiro Sugimoto ⋅ Shang-Hong Lai
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 137
DINO-SLAM: DINO-Informed RGB-D SLAM for Neural Implicit and Explicit Representations Poster Session 1
ZIREN GONG ⋅ Xiaohan Li ⋅ Fabio Tosi ⋅ Youmin Zhang ⋅ Stefano Mattoccia ⋅ Jun Wu ⋅ Matteo Poggi
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 138
The Sterkfontein Caves Dataset: A Novel View Rendering Challenge from the Cradle of Humankind Poster Session 1
Ireton Liu ⋅ Brian Xu ⋅ Dominic Stratford ⋅ Steven James ⋅ Richard Klein ⋅ James Tompkin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 251
WilLaGS: Latent-Conditional 3D Appearance Fields for Robust Gaussian Splatting In-the-Wild Poster Session 1
Yuhao Bai ⋅ Qianqiu Tan ⋅ Lilong Chen ⋅ Huanhuan Lv ⋅ Lijun Chen
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 259
Geometric Probing for Isotropic Optimization Manifold in Sparse-View 3D Gaussian Splatting Poster Session 1
Yunlong Zhao ⋅ Xiaoheng Deng ⋅ Hongyan Xu ⋅ Yichao Cao ⋅ Keke Huang ⋅ Shuo Yang ⋅ Xiangjian He ⋅ Lei Fan ⋅ Zhuohua Qiu ⋅ Xiu Su
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 258
ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation Poster Session 1
Hanxiao Sun ⋅ Mingxin Yang ⋅ Shuhui Yang ⋅ Zebin He ⋅ Xintong Han ⋅ Hongbo Fu ⋅ Chunchao Guo ⋅ Wenhan Luo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 132
Inclusive Interactive Collisions for Multi-View Consistent Compositional 3D Generation Poster Session 1
Chang Liu ⋅ Mingwen Shao ⋅ Xiang Lv ⋅ Xinyuan Chen ⋅ lingzhuang meng ⋅ Qiao Zhang ⋅ Zhengyi Gong ⋅ Jinghao Hu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 152
Interact3D: Compositional 3D Generation of Interactive Objects Poster Session 1
Hui Shan ⋅ Keyang Luo ⋅ Ming Li ⋅ Sizhe Zheng ⋅ Yanwei Fu ⋅ Zhen Chen ⋅ Xiangru Huang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 145
HandSCS: Structural Coordinate Space for Animatable Hand Gaussian Splatting Poster Session 1
Yilan Dong ⋅ Wenqing WANG ⋅ Qing Wang ⋅ Jiahao Yang ⋅ Haohe Liu ⋅ Xiatian Zhu ⋅ Greg Slabaugh ⋅ Shanxin Yuan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 146
Manifold-Aware Spectral Compaction: A Graph Signal Processing Perspective on Online Gaussian Reduction for 3DGS SLAM Poster Session 1
Jiayi Tian ⋅ Jiaze Wang ⋅ Tian Xia ⋅ Wenzhe zhao ⋅ Pengju Ren
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 164
Minute4D: Training High-Fidelity 4D Gaussian Splatting in One Minute Poster Session 1
BINJIAN XIE ⋅ Chenhui Shi ⋅ Pengju Zhang ⋅ Yihong Wu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 302
TetraSDF: Analytic Isosurface Extraction with Multi-resolution Tetrahedral Grid Poster Session 1
Seonghun Oh ⋅ Youngjung Uh ⋅ Jin-Hwa Kim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 309
Physically Grounded Dual-Opacity Gaussian Splatting for Joint RGB-TIR Reconstruction Poster Session 1
Jin Liu ⋅ Dabin leng ⋅ Jiagang Chen ⋅ Haodong Li ⋅ Jiguang Li ⋅ Zhao Huang ⋅ Xiaoshuai Zhang ⋅ Zhiwen Zheng ⋅ Xingru Huang ⋅ Qi Xu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 307
TopoGS: Planar Reconstruction via Topology-Aware 3D Gaussian Splatting Poster Session 1
Shanshan Pan ⋅ Jiale Chen ⋅ Yilin Liu ⋅ Hui Huang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 298
SPECSIA: Stylization Dataset for Novel-View Enhancement in Drawing-based 3D Animation Poster Session 1
Kyuwon Kim ⋅ Sunjae Yoon ⋅ Chang Yoo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 306
MedGSSR: Generalizable Medical Image Super-Resolution 3D Reconstruction via Hierarchical Feed-forward Gaussian Splatting Poster Session 1
Chengkai Wang ⋅ Luoyu Hong ⋅ Yiting Zhao ⋅ Jiamin Wang ⋅ Xiang Feng ⋅ Feiwei Qin ⋅ Zhenzhong Kuang ⋅ Xuefei Yin ⋅ Ali Bashashati ⋅ Yanming Zhu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 305
RoomPlanner: Reachability-Aware View Sampling for Text-to-Room 3D Gaussian Splatting Poster Session 1
Wenzhuo Sun ⋅ MingJian Liang ⋅ Wenxuan Song ⋅ Xuelian Cheng ⋅ Zongyuan Ge
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 304
BioMTBee: Biologically Constrained Multi-View Template-Based 3D Reconstruction of Bumblebee Poster Session 1
Yi Zhang ⋅ Minchen Ye ⋅ Nenggan Zheng
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 303
Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding Poster Session 1
Yuheng Jiang ⋅ Yiwen Cai ⋅ Zihao Wang ⋅ Yize Wu ⋅ Sicheng Li ⋅ Zhuo Su ⋅ Lan Xu ⋅ Shaohui Jiao
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 242
Dynamic-Robust Photometric–Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding Poster Session 1
Boyu xxx ⋅ Li Yang ⋅ Yan Xu ⋅ Wei Liu ⋅ Nian Liu ⋅ Sikui Zhang ⋅ Yan Wang ⋅ Chunfeng Yuan ⋅ Weiming Hu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 301
Online Segment 3D Gaussians via Launching Virtual Drones Poster Session 1
Liwei Liao ⋅ Rongjie Wang ⋅ Ronggang Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 300
X-SG2S: Safe and Generalizable Gaussian Splatting with X-dimensional Watermarks Poster Session 1
Zihang Cheng ⋅ Wentao Bao ⋅ HUIPING ZHUANG ⋅ Chun Li ⋅ Xin Meng ⋅ Ziqian Zeng ⋅ Cen Chen ⋅ Ming Li ⋅ Fei Yu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 299
DecoupleGS: Interactive 3D Gaussian Splatting for End-to-End Autonomous Driving Testing Poster Session 1
Siying Li ⋅ Ying Ni ⋅ Haotian Shi ⋅ Jie Sun ⋅ Jian Sun
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 297
Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation Poster Session 1
Hyunmin Cho ⋅ Jaejun Yoo ⋅ Kyong Hwan Jin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 296
Gaussians on Fire: High-Frequency Reconstruction of Flames Poster Session 1
Jakob Nazarenus ⋅ Dominik Michels ⋅ Wojciech Palubicki ⋅ Simin Kou ⋅ Fang-Lue Zhang ⋅ Soren Pirk ⋅ Reinhard Koch
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 227
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention Poster Session 1
Yu Wu ⋅ Minsik Jeon ⋅ Rick Chang ⋅ Oncel Tuzel ⋅ Shubham Tulsiani
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 295
From Blobs to Spokes: High-Fidelity Surface Reconstruction via Oriented Gaussians Poster Session 1
Diego Gomez ⋅ Antoine Guedon ⋅ Nissim Maruani ⋅ Bingchen Gong ⋅ Maks Ovsjanikov
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 310
EGGS: Explicitly Granular 3D Gaussian Splatting via Luma-Aware and Volume-Preserving Attribute Factorization Poster Session 1
InGyu Jeong ⋅ Hyunmin Jung
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 294
VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction Poster Session 1
Weijie Wang ⋅ Yeqing Chen ⋅ Zeyu Zhang ⋅ Hengyu Liu ⋅ Haoxiao Wang ⋅ ZhiYuan Feng ⋅ Wenkang Qin ⋅ Feng Chen ⋅ Jiawang Bian ⋅ Zheng Zhu ⋅ Donny Y. Chen ⋅ Bohan Zhuang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 88
Fast Spatial Memory with Scalable Elastic Test-Time Training Poster Session 1
Ziqiao Ma ⋅ Xueyang Yu ⋅ Haoyu Zhen ⋅ Yuncong Yang ⋅ Joyce Chai ⋅ Chuang Gan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 204
FLEG: Feed-Forward Language Embedded Gaussian Splatting from Any Views via Compact Semantic Representation Poster Session 1
Qijian Tian ⋅ Xin Tan ⋅ Jiayu Ying ⋅ Xuhong Wang ⋅ Yuan Xie ⋅ Lizhuang Ma
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 247
SupIR-GS: Thermal Infrared Super-Resolution Novel View Synthesis with Imaging-Calibrated 3D Gaussian Splatting Poster Session 1
Jin Liu ⋅ Haodong Li ⋅ Jiagang Chen ⋅ Dabin leng ⋅ Jiguang Li ⋅ Zhao Huang ⋅ Xiaoshuai Zhang ⋅ Qi Xu ⋅ Zhiwen Zheng ⋅ Xingru Huang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 293
Steering 3D Generations: Preference Alignment via Direct Reward and Preference Optimization Poster Session 1
Yuanhang Wang ⋅ Lizhe Qi ⋅ Wenqiang Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 292
RefracGS: Novel View Synthesis Through Refractive Water Surfaces with 3D Gaussian Ray Tracing Poster Session 1
Yiming Shao ⋅ Qiyu Dai ⋅ Chong Gao ⋅ Guanbin Li ⋅ Yequan Wang ⋅ He Sun ⋅ Qiong Zeng ⋅ Baoquan Chen ⋅ Wenzheng Chen
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 113
LinStereo: Linear-Complexity Global Attention for Multi-Scale Iterative Stereo Matching Poster Session 1
Yiran Wang ⋅ Oliver Turner ⋅ Viorela Ila
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 291
ReInGS: Re-Initializing 3D Gaussians against Sparsity Discrepancy in Few-Shot Novel View Synthesis Poster Session 1
Junao Shen ⋅ Tian Feng ⋅ Haojie Dong ⋅ Jinkang Ji ⋅ Tianjia Shao
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 290
AVSplat:Dense-View Feed-Forward 3D Gaussian Splatting with Assist-View Preconditioning Poster Session 1
MUYU XU ⋅ Fangneng Zhan ⋅ Yu Wei ⋅ Hanspeter Pfister ⋅ Shijian Lu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 160
IMMoE: Incomplete Multi-View Anomaly Detection via Mixture of View Experts Fusion Poster Session 1
Lei Hu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 159
VIGS-SLAM: Visual Inertial Gaussian Splatting SLAM Poster Session 1
Zihan Zhu ⋅ Wei Zhang ⋅ Moyang Li ⋅ Norbert Haala ⋅ Marc Pollefeys ⋅ Daniel Barath
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 158
MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing Poster Session 1
Zesong Yang ⋅ Yuanhang Lei ⋅ Yihang Chen ⋅ Jiaer Huang ⋅ liyuan cui ⋅ Boming Zhao ⋅ Peter Yichen Chen ⋅ Hujun Bao ⋅ Zhaopeng Cui
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 157
PointSplat: Compact Gaussian Splatting via Human-Centric Prediction Poster Session 1
Yujie Guo ⋅ Yudong Jin ⋅ Lingteng Qiu ⋅ Zehong Shen ⋅ Zhen Xu ⋅ Zhang Jing ⋅ Xianchao Shen ⋅ Hujun Bao ⋅ Sida Peng ⋅ Xiaowei Zhou
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 156
Edit3r: Instant 3D Scene Editing from Sparse Unposed Images Poster Session 1
Jiageng Liu ⋅ Weijie Lyu ⋅ Xueting Li ⋅ Yejie Guo ⋅ Ming-Hsuan Yang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 155
FreeGen: Feed-Forward Reconstruction–Generation Co-Training for Free-Viewpoint Driving Scene Synthesis Poster Session 1
Shijie Chen ⋅ Peixi Peng
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 154
3DGS3: Joint Super Sampling and Frame Interpolation for Real-Time Large-Scale 3DGS Rendering Poster Session 1
Yibo Zhao ⋅ Fan Gao ⋅ Youcheng Cai ⋅ Ligang Liu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 153
EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning Poster Session 1
Youtan Yin ⋅ Yanning Zhou ⋅ Jiacheng Wei ⋅ Xiaofeng Yang ⋅ Jun Zhang ⋅ Jiayang Bai ⋅ Jingwen Ye ⋅ Weidong Zhang ⋅ Guosheng Lin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 151
Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-View Videos Poster Session 1
Yingdong Hu ⋅ YISHENG HE ⋅ Jinnan Chen ⋅ Weihao Yuan ⋅ Kejie Qiu ⋅ Zehong Lin ⋅ Siyu Zhu ⋅ Zilong Dong ⋅ Steven Hoi ⋅ Jun Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 150
Nexels: Neurally-Textured Surfels for Real-Time Novel View Synthesis with Sparse Primitives Poster Session 1
Victor Rong ⋅ Jan Held ⋅ Victor Chu ⋅ Daniel Rebain ⋅ Marc Van Droogenbroeck ⋅ Kyros Kutulakos ⋅ Andrea Tagliasacchi ⋅ David Lindell
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 149
HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits Poster Session 1
Leyang Jin ⋅ Yujian Zheng ⋅ Bingkui Tong ⋅ Yuda Qiu ⋅ Zhenyu Xie ⋅ Hao Li
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 148
UniGeo: Unifying Geometric Constraints for Camera-Controllable Image Editing via Video Priors Poster Session 1
Hong Jiang ⋅ Wensong Song ⋅ Zongxin Yang ⋅ Ruijie Quan ⋅ Yi Yang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 147
REFINE: Super-efficient Pruning for 3D Gaussian Splatting via Rendering-Free Primitive Importance Poster Session 1
Zhang Chen ⋅ Shuai Wan ⋅ Mengting Yu ⋅ Fuzheng Yang ⋅ Junhui Hou
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 144
LiteGS: a high-performance framework to train 3dgs in subminutes via system and algorithm codesign Poster Session 1
Kaimin Liao ⋅ Hua Wang ⋅ Zhi Chen ⋅ Luchao Wang ⋅ Yaohua Tang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 143
Active View Selection with Perturbed Gaussian Ensemble for Tomographic Reconstruction Poster Session 1
Yulun Wu ⋅ Ruyi Zha ⋅ Wei Cao ⋅ Yingying Li ⋅ Yuanhao Cai ⋅ Yaoyao Liu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 142
DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling Poster Session 1
Haibo Yang ⋅ Yang Chen ⋅ Yingwei Pan ⋅ Zhineng Chen ⋅ Ting Yao ⋅ Tao Mei
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 141
SkyLume: A Large-Scale Multi-Illumination Aerial Benchmark for Urban Scene Reconstruction and Beyond Poster Session 1
Zhuoxiao Li ⋅ Wenzong Ma ⋅ Taoyu Wu ⋅ Jinjing Zhu ⋅ Shuai Zhang ⋅ Jing OU ⋅ Tongyan Hua ⋅ Yinrui Ren ⋅ Rongjun Qin ⋅ Hui Xiong ⋅ Wufan Zhao
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 140
COSY: Compositional 3DGS Synthesis for Disentangled Human Head Editing Poster Session 1
Florian Barthel ⋅ Shalini De Mello ⋅ Koki Nagano ⋅ Wieland Morgenstern ⋅ Anna Hilsmann ⋅ Peter Eisert
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 139
Monte Carlo Energy Aggregation for Mobile 3D Gaussian Splatting Poster Session 1
Xiaobiao Du ⋅ YuAn Wang ⋅ Hao Li ⋅ Bosheng Wang ⋅ Xun Sun ⋅ Xin Yu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 85
OmniRen: Neural Rendering wih Heterogeneous Scene Primitives Poster Session 1
Chong Zeng ⋅ Yue Dong ⋅ Pieter Peers ⋅ lvmin zhang ⋅ Maneesh Agrawala
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 86
OREO: Fidelity Alignment in 3D Generation via On-the-fly Rendering-Editing Optimization Poster Session 1
Zhiyuan MA ⋅ WENBO HU ⋅ Wang Zhao ⋅ Pengfei Wang ⋅ Ying Shan ⋅ Yabin Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 87
Real-Time LiDAR Gaussian Splatting SLAM via Geometry-Aware Covariance Coupling Poster Session 1
SeungJun Tak ⋅ Yewon Jeon ⋅ Hwang Jaeik ⋅ Suk Min Hwang ⋅ SeongboHa SeongboHa ⋅ Hyeonwoo Yu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 89
SceneHI: High-Resolution 3D-Consistent Scene Texturing with Controllable Illumination Poster Session 1
Athanasios Tragakis ⋅ Marco Aversa ⋅ Daniela Ivanova ⋅ Chaitanya Kaul ⋅ Roderick Murray-Smith ⋅ Daniele Faccio ⋅ Paul Henderson
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 90
DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis Poster Session 1
Cheng-You Lu ⋅ Yi-Shan Hung ⋅ Wei Chi ⋅ Hao Ping Wang ⋅ Charlie Tsai ⋅ Yu-Cheng Chang ⋅ Yu-Lun Liu ⋅ Thomas Do ⋅ Chin-teng Lin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 91
GRF-Recon: Global Ray-Field Optimization for Long-Sequence Feed-forward Reconstruction Poster Session 1
Enpeng Li ⋅ Yunzhou Zhang ⋅ Zhiyao Zhang ⋅ Dexuan Lyu ⋅ Chenyu Wang ⋅ Chiyuan Cui ⋅ Cheng Cheng
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 92
VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment Poster Session 1
Tengjiao Yin ⋅ Jinglei Shi ⋅ Heng Guo ⋅ Xi WANG
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 93
Multi4D: High-Fidelity Dynamic Gaussian Splatting via Multi-Level Competitive Allocation Poster Session 1
Rui Wang ⋅ Quentin Lohmeyer ⋅ Siyu Tang ⋅ Mirko Meboldt
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 94
RAGA: Real Time Ray Traced Gaussian Shadow Casting for 3DGS Avatar-Scene Interaction Poster Session 1
Aymen Mir ⋅ Riza Alp Guler ⋅ Jian Wang ⋅ Peter Wonka ⋅ Bing Zhou ⋅ Gerard Pons-Moll
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 95
Incremental Online Scene Reconstruction by 3D Gaussian Triangulation Poster Session 1
Yanjin Zhu ⋅ Shaofan Liu ⋅ Jianke Zhu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 96
Matryoshka Gaussian Splatting Poster Session 1
Zhilin Guo ⋅ Boqiao Zhang ⋅ Hakan Aktas ⋅ Kyle Fogarty ⋅ Jeffrey Hu ⋅ Nursena Aslan ⋅ Wenzhao Li ⋅ Canberk Baykal ⋅ Albert Miao ⋅ Josef Bengtson ⋅ Chenliang Zhou ⋅ Weihao Xia ⋅ Cristina Vasconcelos ⋅ Cengiz Oztireli
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 97
Identity-Preserving Human Reconstruction from a Single Image via 3D Token Inference Poster Session 1
Yanqi Bao ⋅ Jiaxiang Shang ⋅ Yang Gao ⋅ Yingchun Liu ⋅ Jing Huo ⋅ Jing Liao
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 98
Geometrically Consistent Multi-View Scene Generation from Freehand Sketches Poster Session 1
Ahmed Bourouis ⋅ Savas Ozkan ⋅ Andrea Maracani ⋅ Yi-Zhe Song ⋅ Mete Ozay
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 99
Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting Poster Session 1
Chenjian Gao ⋅ Linning Xu ⋅ Tianfan Xue
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 100
Open-Vocabulary BEV Segmentation with 3D-Aware Geometric Constraints Poster Session 1
Hojun Choi ⋅ Seulbin Hwang ⋅ Dae Kim ⋅ Kisung Kim ⋅ Hyunjung Shim ⋅ Jinhan Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 101
GRAFT: Geometric Refinement and Fitting Transformer for Human Scene Reconstruction Poster Session 1
Pradyumna YM ⋅ Yuxuan Xue ⋅ Yue Chen ⋅ Nikita Kister ⋅ István Sárándi ⋅ Gerard Pons-Moll
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 102
OmniX: Any-view and Any-time 4D reconstruction via Feed-forward Trajectory Fields Poster Session 1
Yanqin Jiang ⋅ Tengfei Wang ⋅ Zhenwei Wang ⋅ Chenjie Cao ⋅ Junta Wu ⋅ Wenhan Luo ⋅ Weiming Hu ⋅ Jin Gao ⋅ Chunchao Guo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 103
NanoGS: Training-Free and Lightweight Gaussian Splat Simplification Poster Session 1
Butian Xiong ⋅ Rong Liu ⋅ Tiantian Zhou ⋅ Meida Chen ⋅ Zhiwen Fan ⋅ Andrew Feng
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 104
SkySplat-OV: Generalizable Language Gaussian Splatting for Open-Vocabulary Scene Understanding from Sparse Satellite Views Poster Session 1
Xuejun Huang ⋅ Yi Wan ⋅ Lei Yu ⋅ Xinyi Liu ⋅ Zhi Zheng ⋅ Bin Zhang ⋅ Yingying Pei ⋅ Yi Liu ⋅ Changjun Zhu ⋅ Yi Liu ⋅ Xiangyuan Cai ⋅ Hongwei Hu ⋅ Xin Zhang ⋅ Yongjun Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 105
Wat3R: Underwater 3D Geometry Learning without Underwater Annotations Poster Session 1
Jiangwei Ren ⋅ Xingyu Jiang ⋅ Zijie Song ⋅ Wei Xu ⋅ Hongkai Lin ⋅ Dingkang Liang ⋅ Xiang Bai
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 106
ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting Poster Session 1
Jiayu Ding ⋅ Meilu Song ⋅ Xiaoyi Zhang ⋅ Hongbo Jin ⋅ Yichen Jin ⋅ Xiangtian Si
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 107
StereoGS: Sparse-View 3D Gaussian Splatting via Stereo Priors Poster Session 1
Wenhao Yuan ⋅ Yiyuan Ge ⋅ Deli Cai
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 108
Sparse auto-regressive modeling for scene generation from multi-view images Poster Session 1
Thomas Lucas ⋅ Maxime Pietrantoni ⋅ Wonjune Cho ⋅ Bardienus Duisterhof ⋅ Philippe Weinzaepfel ⋅ Vincent Leroy ⋅ Jerome Revaud
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 109
Holo-Captioning: A Comprehensive Textual View of 3D Scenes Poster Session 1
Kun-Yu Lin ⋅ Chengke Bu ⋅ Zhenguo Li ⋅ Kai Han
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 110
From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space Poster Session 1
Jiazi Bu ⋅ Pengyang Ling ⋅ Yujie Zhou ⋅ Yibin Wang ⋅ Yuhang Zang ⋅ Tianyi Wei ⋅ Xiaohang Zhan ⋅ Jiaqi Wang ⋅ Tong Wu ⋅ Xingang Pan ⋅ Dahua Lin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 111
Global Pose Control for Generative View Synthesis in Normalized Object Coordinate Space Poster Session 1
Zhibing Li ⋅ Amogh Gupta ⋅ Behnoosh Parsa ⋅ Dan Casas
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 112
IRIS: Intersection-aware Ray-based Implicit Editable Scenes Poster Session 1
Grzegorz Wilczyński ⋅ Mikołaj Zieliński ⋅ Krzysztof Byrski ⋅ Joanna Waczynska ⋅ Dominik Belter ⋅ Przemysław Spurek
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 115
AirSplat: Alignment and Rating for Robust Feed-Forward 3D Gaussian Splatting Poster Session 1
Minh-Quan Bui ⋅ Jaeho Moon ⋅ Munchurl Kim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 119
StratoSplat: Taming Layered Regularities for Sparse Aerial 3D Gaussian Splatting Poster Session 1
Zihan Gao ⋅ Lingling Li ⋅ Licheng Jiao ⋅ Fang Liu ⋅ Wenping Ma ⋅ Yuwei Guo ⋅ Shuyuan Yang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 289
Extending a Large View Synthesis Model for Multi-view Panoptic Segmentation Poster Session 1
Kwonyoung Ryu ⋅ In-Jae Lee ⋅ Jonghyun Jin ⋅ Hyunjee Lee ⋅ Jongmin Lee ⋅ Jaesik Park
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 288
Diversity-Aware View Partitioning for Scalable VGGT Poster Session 1
Jinsoo Park ⋅ Donggyu Choi ⋅ Ahyun Seo ⋅ Minsu Cho ⋅ Jeany Son
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 287
SMP-UWGS: Coupled Physics-Geometry Optimization for Scalable Multi-Partition Underwater 3D Reconstruction Poster Session 1
宇轩 刘 ⋅ Jinhui Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 286
CoDePose: Multi-View 3D Human Pose Estimation via Coupled 2D-3D Denoising Diffusion Poster Session 1
Yanlu Cai ⋅ Yuxuan Liu ⋅ WEIZHONG ZHANG ⋅ Yuan Wu ⋅ Cheng Jin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 285
3D-ReGen: A Unified 3D Geometry Regeneration Framework Poster Session 1
Geon Yeong Park ⋅ Roman Shapovalov ⋅ Rakesh Ranjan ⋅ Jong Chul Ye ⋅ Andrea Vedaldi ⋅ Thu Nguyen-Phuoc
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 284
FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors Poster Session 1
Khiem Vuong ⋅ Deva Ramanan ⋅ Srinivasa G. Narasimhan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 283
CAM3R: Camera-Agnostic Model for 3D Reconstruction Poster Session 1
Namitha Guruprasad ⋅ Abhay Kumar Yadav ⋅ Cheng Peng ⋅ Rama Chellappa
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 282
CubicSplat: Differentiable Vector Graphics via Error-Bounded Forward Relaxation Poster Session 1
Chenglong Liu ⋅ Xin Zhang ⋅ Yimeng Zhu ⋅ Liyang He ⋅ Yixiao Ma ⋅ Yu Su ⋅ Zhenya Huang ⋅ Qi Liu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 281
SyncFix: Multi-View Consistent Diffusion Refinement of 3D Reconstructions Poster Session 1
Deming Li ⋅ Cheng Peng ⋅ Abhay Kumar Yadav ⋅ Rama Chellappa ⋅ Anand Bhattad
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 280
Fourier Splatting: Generalized Fourier encoded primitives for scalable radiance fields Poster Session 1
Mihnea Jurca ⋅ Bert hauwermeiren ⋅ Adrian Munteanu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 279
RaPTGS: Render-Agnostic Post-Training Compression of 3D Gaussian Splatting Poster Session 1
Asif Jawad ⋅ K. M. Azwad Hossain
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 278
MLP Splatting: Object-Centric Neural Fields Poster Session 1
Shinjeong Kim ⋅ Yuzhou Cheng ⋅ Xin Kong ⋅ Paul Kelly ⋅ Andrew Davison
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 277
Wid3R: Wide Field-of-View 3D Reconstruction via Camera Model Conditioning Poster Session 1
Dongki Jung ⋅ Jaehoon Choi ⋅ Adil Qureshi ⋅ Somi Jeong ⋅ Dinesh Manocha ⋅ Suyong Yeon
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 276
Novel View Synthesis as Video Completion Poster Session 1
Qi Wu ⋅ Khiem Vuong ⋅ Minsik Jeon ⋅ Srinivasa G. Narasimhan ⋅ Deva Ramanan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 275
Latent Fusion: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents Poster Session 1
Laura Fink ⋅ Linus Franke ⋅ George Kopanas ⋅ Marc Stamminger ⋅ Peter Hedman
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 274
Towards Alias-Free 4D Gaussian Representations with Motion-Aware Filtering Poster Session 1
Ankit Dhiman ⋅ Kunal A Kathare ⋅ Pranav Vignesh ⋅ LOKESH BOREGOWDA ⋅ Venkatesh Babu Radhakrishnan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 273
Triangle Splatting SLAM Poster Session 1
Nicholas Fry ⋅ Eric Dexheimer ⋅ Kirill Mazur ⋅ Paul Kelly ⋅ Andrew Davison
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 272
NoPA: Non-Parametric Online 3D Scene Graph Generation Poster Session 1
Qi Xun Yeo ⋅ Seungjun Lee ⋅ Yan Li ⋅ Gim Hee Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 271
LEGO: Leveled Language Gaussian Splatting Poster Session 1
Yuning Peng ⋅ Haiping Wang ⋅ Yuan Liu ⋅ Yipeng Lu ⋅ Zhen Dong ⋅ Bisheng Yang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 270
Graph-GSReg: Leveraging 3D Scene Graphs for Gaussian Splatting Registration Poster Session 1
Jaewon Lee ⋅ Mangyu Kong ⋅ Euntai Kim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 269
Improving Sparse-View 3DGS Generalization via Flat Minima Optimization Poster Session 1
Kangmin Seo ⋅ Sangeek Hyun ⋅ MinKyu Lee ⋅ Jae-Pil Heo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 268
Geometry-Propagated Gaussian Splatting for Aerial Sparse Novel View Synthesis Poster Session 1
Yijing Wang ⋅ Xu Tang ⋅ Jingjing Ma ⋅ Xiangrong Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 267
PIC: Revisiting INR for Image Coding with Fast Encoding and Sub-Millisecond Decoding Poster Session 1
Xiang Liu ⋅ Jinxiang Wang ⋅ Bin Chen ⋅ Zimo Liu ⋅ Mingyao Hong ⋅ Jiawei Li ⋅ Yaowei Wang ⋅ Shu-Tao Xia
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 266
When 3D Gaussian Splatting Recovers Real Surfaces Poster Session 1
Songhe Wang ⋅ David Miller
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 265
HiReFF: High-Resolution Feedforward Human Reconstruction from Uncalibrated Sparse-View Video Poster Session 1
YIMING JIANG ⋅ Hanzhang Tu ⋅ Wenfeng Song ⋅ Siyou Lin ⋅ Liang An ⋅ Shuai Li ⋅ Aimin Hao ⋅ Yebin Liu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 264
MVFusion-GS: Motion-Variance Guided Temporal Attention for High-Quality Dynamic Gaussian Splatting Poster Session 1
Jianwei Hu ⋅ Tingxuan Huang ⋅ Hengyu Zhou ⋅ Ningna Wang ⋅ Xiaohu Guo ⋅ Jinshan Lai ⋅ Bin Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 263
IndoorSplat: Enhanced Indoor Scene Reconstruction with Structured 2D Gaussian Splatting Poster Session 1
Min Shi ⋅ Tao Yang ⋅ Xigang Zhao ⋅ Qi Wang ⋅ Dengming Zhu ⋅ Zhaoxin Li
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 262
TriSplat: Adaptive Triplane for Sparse-View Large-Scale Scene Reconstruction Poster Session 1
Ryo Umagami ⋅ Tomohiro Hashimoto ⋅ Xuangeng Chu ⋅ Ziteng Cui ⋅ Yusuke Mukuta ⋅ Jia Deng ⋅ Tatsuya Harada
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 261
Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction Poster Session 1
Jorge Condor ⋅ Nicolas Moënne-Loccoz ⋅ Merlin Nimier-David ⋅ Piotr Didyk ⋅ Zan Gojcic ⋅ Qi Wu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 260
∂DIBR: Differentiable Depth Image-based Rendering for Fast Novel View Synthesis Poster Session 1
Armand Losfeld ⋅ Sarah Dury ⋅ Gauthier Lafruit ⋅ Mehrdad Teratani ⋅ Daniele Bonatto
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 257
Proto-Gaussian: MRI Modality Translation Based on Learnable Structural Prototypes and 2D Gaussian Splatting Poster Session 1
Zizheng Li ⋅ RenDong Xie ⋅ Huadeng Wang ⋅ Zhifen He ⋅ Bin Liu ⋅ Bo Li ⋅ Xiaonan Luo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 256
GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens Poster Session 1
Roni Itkin ⋅ Noam Issachar ⋅ Yehonatan Keypur ⋅ Xingyu Chen ⋅ Anpei Chen ⋅ Sagie Benaim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 255
Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views Poster Session 1
Jiho Choi ⋅ Seonho Lee ⋅ Seojeong Park ⋅ Hyunjung Shim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 254
AGE: Agentic Gaussian Editing in 3D Scenarios Poster Session 1
Hao Qin ⋅ Tesi Lin ⋅ Mingwei Wei ⋅ Yukai Sun ⋅ Mengxu Lu ⋅ Ming Kong ⋅ Qiang Zhu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 253
GeoV2V: Geometry-Grounded Video Diffusion Model for Driving Scene Generation Poster Session 1
Yuchen Xi ⋅ tippy guo ⋅ Chenwei Hou ⋅ Zixu Liu ⋅ Jin Fang ⋅ Jason Liu ⋅ Ruigang Yang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 252
Geometry Grounding: Elevating Blind Distortion Correction with 3D Structural Priors Poster Session 1
Xiang Li ⋅ Weimin Shi ⋅ Qichuan Geng ⋅ Zhong Zhou
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 250
3D Gaussian Texture for Real-time Mesoscale Appearance Synthesis and Rendering Poster Session 1
Xiang Chen ⋅ Jia Li ⋅ Lu Wang ⋅ Beibei Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 249
ActiveStructure: Plane Scene Graph-Guided Active 3D Gaussian Splatting Poster Session 1
Yingzhao Li ⋅ Yan Li ⋅ Yanjie Liu ⋅ Hanyu Zhou ⋅ lijun zhao ⋅ Gim Hee Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 248
Deformable Triangle Splatting: Flexible Primitives for Real-Time Radiance Field Rendering Poster Session 1
Oriol Jiménez-Ayguadé ⋅ Antonio Agudo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 246
RaysUp: Ultra-light Universal Feature Upsampling via Geometry-Aware Ray Representation Poster Session 1
Ding Yuchuan ⋅ Linfei Li ⋅ Lin Zhang ⋅ Ying Shen
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 245
Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving Poster Session 1
Guoqing Wang ⋅ Pin Tang ⋅ Xiangxuan Ren ⋅ Liping Hou ⋅ Chao Ma
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 244
TRiGS: Temporal Rigid-Body Motion for Scalable 4D Gaussian Splatting Poster Session 1
Suwoong Yeom ⋅ Joonsik Nam ⋅ Seunggyu Choi ⋅ Lucas Lee ⋅ Sangmin Kim ⋅ Jaesik Park ⋅ Joonsoo Kim ⋅ Kugjin Yun ⋅ Kyeongbo Kong ⋅ Suk-Ju Kang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 243
InceptionGS: Generative Bootstrapping for Large-Scale Gaussian Splatting under Unstructured View Sampling Poster Session 1
Tianheng Lu ⋅ Guangyu Wang ⋅ Ruqi Huang ⋅ Lu Fang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 241
F⁴Splat: Feed-Forward Predictive Densification for Feed-Forward 3D Gaussian Splatting Poster Session 1
Injae Kim ⋅ Chaehyeon Kim ⋅ Minseong Bae ⋅ Minseok Joo ⋅ Hyunwoo Kim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 240
Structure Gaussian Splatting SLAM Poster Session 1
Yan Li ⋅ Yingzhao Li ⋅ Gim Hee Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 239
Predictive Photometric Uncertainty in Gaussian Splatting for Novel View Synthesis Poster Session 1
Chamuditha Jayanga Ahangama Galappaththige ⋅ Thomas Gottwald ⋅ Peter Stehr ⋅ Edgar Heinert ⋅ Niko Suenderhauf ⋅ Dimity Miller ⋅ Matthias Rottmann
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 238
SkipGS: Post-Densification Backward Skipping for Efficient 3DGS Training Poster Session 1
Jingxing Li ⋅ Yongjae Lee ⋅ Deliang Fan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 237
Drop-In Perceptual Optimization for 3D Gaussian Splatting Poster Session 1
Ezgi Ozyilkan ⋅ Zhiqi Chen ⋅ Oren Rippel ⋅ Jona Ballé ⋅ Kedar Tatwawadi
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 236
SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training Poster Session 1
Yang Zheng ⋅ Hao Tan ⋅ Kai Zhang ⋅ Peng Wang ⋅ Leonidas Guibas ⋅ Gordon Wetzstein ⋅ Wang Yifan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 235
KISS-GS: 3D Gaussian Splatting Compression Kept Simple Poster Session 1
Wieland Morgenstern ⋅ Friedrich Elias Branschke ⋅ Florian Fleischmann ⋅ Adrian Szatmari ⋅ Paul Schlack ⋅ Florian Barthel ⋅ Anna Hilsmann ⋅ Peter Eisert
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 234
Raymap-Guided Coupling for Drift-Robust Unposed Feed-Forward 3D Reconstruction Poster Session 1
Xiangyu Sun ⋅ Liu.Liu Liu.Liu ⋅ Seungkwon Yang ⋅ Jingbing Han ⋅ Seungtae Nam ⋅ Zhizhong Su ⋅ Eunbyung Park
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 233
SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization Poster Session 1
Jiun Lee ⋅ Jaekwang Kim ⋅ Sangmin Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 232
UniSim-SLAM: Feed-Forward SLAM with Unified Sim(3) Optimization Poster Session 1
inha Lee ⋅ Dongjae Jeong ⋅ Junhee Lee ⋅ Kyungdon Joo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 231
R3RECON: Radiance-Field-Free Active Reconstruction via Renderability Poster Session 1
Xiaofeng Jin ⋅ Matteo Frosi ⋅ Yiran Guo ⋅ Matteo Matteucci
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 230
DPGS: A Diffusion-Prior Guided Framework for Large-Scale 3D Gaussian Splatting Reconstruction Poster Session 1
Shidong Zhang ⋅ shuaixin li ⋅ Juntong Qi ⋅ Haoxin Zhang ⋅ Xiao zhang ⋅ Xiaozhou Zhu ⋅ Wen Yao
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 229
PDF-Omni: Poincaré Dual Disk Distortion Field-based Recurrent Update for Omnidirectional Stereo Matching Poster Session 1
Yunseok Yang ⋅ Eunjin Son ⋅ Sang Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 228
DreamEdit3D: Personalization of Multi-View Diffusion Models for 3D Editing Poster Session 1
Jinxin Ai ⋅ Matthias Niessner ⋅ Ziya Erkoç
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 226
UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras Poster Session 1
Yipeng Zhu ⋅ Huajian Huang ⋅ Tristan Braud ⋅ Sai Kit Yeung
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 225
FLM-Occ: Feed-forward Likelihood Maximization for Efficient Indoor Occupancy Prediction Poster Session 1
Guangcheng Chen ⋅ Lihuang Fang ⋅ Huaqi Tao ⋅ Yicheng He ⋅ Li He ⋅ Zhang Hong
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 222
LVSPM: Long Sequence View Synthesis and Pose Estimation Model Poster Session 1
Xi Chen ⋅ Yachi Zhang ⋅ Linghao Chen ⋅ Minghua Liu ⋅ Hao Su ⋅ Zexiang Xu ⋅ Xiaoshuai Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 221
Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes Poster Session 1
Sicheng Yu ⋅ Dongxu Shen ⋅ Beizhen ZHAO ⋅ Ding Guanzhi ⋅ Hao Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 220
Temporally Aware Densification for Dynamic 3D Gaussian Splatting Poster Session 1
VIKRAM SANDU ⋅ Mayurdeep Pathak ⋅ Rajiv Soundararajan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 219
GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification Poster Session 1
Yijia Weng ⋅ Zhicheng Wang ⋅ Songyou Peng ⋅ Saining Xie ⋅ Howard Zhou ⋅ Leonidas Guibas
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 218
One-Shot Feed-Forward 360° Animatable Avatar via Inpainted UV-Space Gaussian Modeling Poster Session 1
Shuling Zhao ⋅ Dan Xu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 216
Geometry-Preserving in 3D Gaussian Splatting for LiDAR-Camera Extrinsic Calibration Poster Session 1
Kyoleen Kwak ⋅ Daeho Kim ⋅ Jeong Woon Lee ⋅ Hyoseok Hwang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 215
MoCam: Unified Novel View Synthesis via Structured Denoising Dynamics Poster Session 1
Haofeng Liu ⋅ Yang Zhou ⋅ Ziheng Wang ⋅ Zhengbo Xu ⋅ Zhan Peng ⋅ Jie Ma ⋅ Jun Liang ⋅ Shengfeng He ⋅ Jing Li
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 214
WildSplat: Feedforward Gaussian Splatting from Unposed In-the-Wild Images Poster Session 1
Xiyu Zhang ⋅ Jingyu Zhuang ⋅ Hongjia Zhai ⋅ Zizheng Yan ⋅ Jinwei Chen ⋅ Guofeng Zhang ⋅ Qingnan Fan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 213
Relaxed Rigidity with Ray-based Grouping for Dynamic Gaussian Splatting Poster Session 1
Junoh Lee ⋅ Junmyeong Lee ⋅ Yeon-Ji Song ⋅ Inhwan Bae ⋅ Jisu Shin ⋅ Hae-Gon Jeon ⋅ Jin-Hwa Kim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 212
UniFusion: Sparse-View 4D Reconstruction via Unified Spatio-temporal Depth Alignment Poster Session 1
Yongzhe Lyu ⋅ Shaofei Wang ⋅ Yixin Chen ⋅ Siyuan Huang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 211
LiDAR-EVS: Enhance Extrapolated View Synthesis for 3D Gaussian Splatting with Pseudo-LiDAR Supervision Poster Session 1
Yiming Huang ⋅ Xin Kang ⋅ Sipeng Zhang ⋅ Hongliang Ren ⋅ Weihua Zhang ⋅ Junjie Lai
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 210
GAINS: Gaussian-based Inverse Rendering from Sparse Multi-View Captures Poster Session 1
Patrick Noras ⋅ Jun Myeong Choi ⋅ Didier Stricker ⋅ Pieter Peers ⋅ Roni Sengupta
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 209
PointGT: Simultaneous Geometric and Textural Editing for Point-Based Representations Poster Session 1
Yanshu Zhang ⋅ George Shramko ⋅ Pratul Srinivasan ⋅ Ke Li
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 206
ReGen3D: Generalizable Unified Representation Learning for 3D Understanding Poster Session 1
Haotian Zhang ⋅ Jincen Jiang ⋅ Yuhang Li ⋅ Jian Jun Zhang ⋅ Meili Wang ⋅ Jian Chang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 205
LiteMatch: Lightweight Zero-Shot Stereo Matching via Cost Volume Stabilization Poster Session 1
Md Raqib Khan ⋅ Santosh Kumar Vipparthi ⋅ Subrahmanyam Murala
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 203
EAGS: Error-Aware Gaussian Splatting with Dual-Confidence-Guided Modeling for Uncalibrated Driving Scenes Poster Session 1
Cen Zhigabng ⋅ Ningyan Guo ⋅ Yulan Guo ⋅ Yifan Ge ⋅ Zhiyong Feng
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 202
Racing in Volume with Flow Ensembles Poster Session 1
Saswat Subhajyoti Mallick ⋅ Riu Cherdchusakulchai ⋅ Marc Ruiz ⋅ Albert Mosella-Montoro ⋅ Jose Ribeiro-Gomes ⋅ Francisco Vicente Carrasco ⋅ Fernando de la Torre
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 201
CapFrame: Text-Instructed Viewpoint Grounding in 3D Gaussian Scenes via Geometric Pseudo Labels Poster Session 1
Jirong Li ⋅ Satoshi Ikehata ⋅ Shuhei Kurita ⋅ Ikuro Sato
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 200
BEV-GS: Feed-forward Gaussian Splatting in Bird’s-Eye-View for Road Reconstruction Poster Session 1
Wenhua Wu ⋅ Tong Zhao ⋅ Chensheng Peng ⋅ Lei Yang ⋅ Zhe Liu ⋅ Hesheng Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 199
MAC-Splat: Multi-Attribute Consistency for High-Fidelity Sparse-View Reconstruction Poster Session 1
Jinqian Yang ⋅ Yichen Wu ⋅ Wanhua Li ⋅ Haokun Lin ⋅ Renzhen Wang ⋅ Xiangchu Feng ⋅ Xixi Jia
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 198
SA-ResGS: Self-Augmented Residual 3D Gaussian Splatting for Next Best View Selection Poster Session 1
Kim Jun-Seong ⋅ Tae-Hyun Oh ⋅ Eduardo Pérez Pellitero ⋅ Youngkyoon Jang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 197
ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views Poster Session 1
Giuseppe Stracquadanio ⋅ Kevin Raj ⋅ Julia Grabinski ⋅ Stefan Roth
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 196
GlassGS: Geometry and Concept-Aware 3D Gaussian Splatting for Reflective Enclosures Poster Session 1
Mingxuan Cui ⋅ Yunrui Zhu ⋅ Wuqi Wang ⋅ Di Lin ⋅ Jianhua Zhang ⋅ Jie Zhang ⋅ Ming-Ming Cheng ⋅ Shengyong Chen ⋅ Qing Guo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 195
SharpGS: Sharpness-Preserving 3D Gaussian Splatting with Differentiable Blur-Driven Density Control Poster Session 1
Moonsoo Jeong ⋅ Dongbeen Kim ⋅ Minseong Kim ⋅ Sungkil LEE
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 194
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors Poster Session 1
Yufei Cai ⋅ Xuesong Niu ⋅ Guosheng Lin ⋅ Hao LU ⋅ Kai Wu ⋅ Kun Gai
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 193
MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis Poster Session 1
Xiaobiao Du ⋅ Yida Wang ⋅ Xin Yu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 192
Capacity-Controlled Multi-View Stylization of 3D Gaussian Splatting Poster Session 1
Zhihao Wen ⋅ Yixin Yang ⋅ Bojian Wu ⋅ Yang Zhou ⋅ Dani Lischinski ⋅ Danny Cohen-Or ⋅ Hui Huang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 191
DINOv3D: 2D-3D Joint Optimization for Unified Spatial Understanding Poster Session 1
Bo Zhou ⋅ Jianzhe Gao ⋅ Zhihui Wang ⋅ Lingxiang Wu ⋅ Jinqiao Wang ⋅ Yazhou Yao ⋅ Wenguan Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 190
DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering Poster Session 1
Yiran Qiao ⋅ Yiren Lu ⋅ Yunlai Zhou ⋅ Rui Yang ⋅ Linlin Hou ⋅ Yu Yin ⋅ Jing Ma
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 189
Tackling Misattribution in 3D Intrinsic Decomposition via Proximity Attention Point Rendering Poster Session 1
Alireza Moazeni ⋅ Shichong Peng ⋅ Yanshu Zhang ⋅ Chirag Vashist ⋅ Ke Li
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 188
Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses Poster Session 1
Ruxiao Duan ⋅ Erin Hong ⋅ Dongxu Zhao ⋅ Eric Turner ⋅ Alex Wong ⋅ Yunwen Zhou
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 187
Denoising-GS: Gaussian Splatting with Spatial-aware Denoising Poster Session 1
Qingyuan Zhou ⋅ Xinyi Liu ⋅ WEIDONG YANG ⋅ Ning Wang ⋅ Shuquan Ye ⋅ Ben Fei ⋅ Ying He ⋅ Wanli Ouyang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 186
AdaptiveSplat: Texture Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction Poster Session 1
Badrinath Singhal ⋅ Srihari K G ⋅ Sreehari Iyer ⋅ Ankit Dhiman ⋅ Venkatesh Babu Radhakrishnan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 185
AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting Poster Session 1
Dexu Zhu ⋅ Jiangnan Shao ⋅ Xiaofeng Wang ⋅ Junxian Duan ⋅ Jie Cao ⋅ Zheng Zhu ⋅ Huaibo Huang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 184
ReSplat: Learning Recurrent Gaussian Splatting Poster Session 1
Haofei Xu ⋅ Daniel Barath ⋅ Andreas Geiger ⋅ Marc Pollefeys
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 183
Cube-Splat: High-Fidelity 360° Gaussian Splatting SLAM via Cubemap Factorization and Adjoint-Consistent Optimization Poster Session 1
Xiangfei Guo ⋅ Hao Shi ⋅ Yufan Zhang ⋅ Zhonghua Yi ⋅ maoyongqi maoyongqi ⋅ Xiaoting Yin ⋅ Kaiwei Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 182
Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning Poster Session 1
Sen Wang ⋅ Huaiyi Dong ⋅ Jingyi Tian ⋅ lijiayi lijiayi ⋅ Zhuo Yang ⋅ Tongtong Cao ⋅ Anlin Chen ⋅ Shuang Wu ⋅ Sanping Zhou ⋅ Le Wang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 181
CoIn: Comprehensive 2D-3D Inpainting with Gaussian Splatting Guidance Poster Session 1
Hana Kim ⋅ Minje Kim ⋅ Tae-Kyun Kim
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 180
InstGS: Shared-Template Gaussian Instancing for Object-Redundancy-Free Rendering Poster Session 1
Zi'ang Lu ⋅ Qian Zhang ⋅ Kang Du ⋅ Dong Liang ⋅ John Li ⋅ Xinyao Wei ⋅ Zeyu Wang ⋅ Jinyuan Jia
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 179
3D Gaussian Splatting Compression with Object Scalability Poster Session 1
Ruixiang Xue ⋅ Tong Chen ⋅ Zhan Ma
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 178
Rotate Your Character: Revisiting Video Diffusion Models for High-Quality 3D Character Generation Poster Session 1
Jin Wang ⋅ Jianxiang Lu ⋅ Comi Chen ⋅ Guangzheng Xu ⋅ Haoyu Yang ⋅ Peng Chen ⋅ Na Zhang ⋅ Yifan Xu ⋅ Longhuang Wu ⋅ Shuai Shao ⋅ Qinglin Lu ⋅ Ping Luo
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 177
Geometry-Aware Style Transfer in 3D Gaussian Splatting Poster Session 1
Min Hyeok Bang ⋅ Jun Hyeong Kim ⋅ Seung-Wook Kim ⋅ Se-Ho Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 176
StructureGS: Structure-aware Gaussian Splatting for Articulated Object Reconstruction Poster Session 1
GaHye Lee ⋅ Gyoonseo Kim ⋅ Wonjong Jang ⋅ Jooeun Son ⋅ Seungyong Lee
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 175
DR-GS: Physically-Based Deformable and Relightable 2D Gaussians Poster Session 1
Jiaxin LI ⋅ Tong Wu ⋅ Yi Wei ⋅ Tailin Wu ⋅ Li Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 174
Render-FM: Feedforward Model for Real-time Photorealistic Volumetric Rendering Poster Session 1
Zhongpai Gao ⋅ Benjamin Planche ⋅ Meng Zheng ⋅ Anwesa Choudhuri ⋅ Van Nguyen ⋅ Terrence Chen ⋅ Ziyan Wu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 173
PaD-GS: Leveraging Distortion Map for Panoramic Gaussian Splatting Poster Session 1
Yihang Xu ⋅ Qiulei Dong
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 172
AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing Poster Session 1
Tianyu Liu ⋅ Weitao Xiong ⋅ Kunming Luo ⋅ Manyuan Zhang ⋅ Peng Li ⋅ Yuan Liu ⋅ Ping Tan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 171
City-Level 3D Surface Reconstruction with Viewpoint Orientation Partitioning and Scene Completion Poster Session 1
Liang Han ⋅ Wenyuan Zhang ⋅ Junsheng Zhou ⋅ Yushen Liu ⋅ Zhizhong Han
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 170
PriSplat: Propagating Reliable Multi-view Information for Distractor-Free 3DGS Poster Session 1
Yunseo Yang ⋅ Youngho Yoon ⋅ KUK-JIN YOON
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 169
Sparse-View Surface Reconstruction using Gaussian Splatting through High-Confidence Depth Propagation with Normal Priors Poster Session 1
Liang Han ⋅ Bangcai Wei ⋅ Junsheng Zhou ⋅ Yushen Liu ⋅ Zhizhong Han
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 168
Towards Geometry-Grounded Dense Semantic Matching with VGGT Priors Poster Session 1
Songlin Yang ⋅ Tianyi Wei ⋅ Yushi Lan ⋅ Zeqi Xiao ⋅ Anyi Rao ⋅ Xingang Pan
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 167
DualDiff3D: Dual Structure-Appearance Diffusion Priors for Reliability-Enhanced 3D Gaussian Splatting Poster Session 1
Qian Wang ⋅ Yu Wang ⋅ Weiqi Li ⋅ Xinhua Cheng ⋅ Xiandong MENG ⋅ Ronggang Wang ⋅ Jian Zhang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 166
Instant Expressive Gaussian Head Avatars at Over 100 FPS Poster Session 1
Kaiwen Jiang ⋅ Xueting Li ⋅ Seonwook Park ⋅ Ravi Ramamoorthi ⋅ Shalini De Mello ⋅ Koki Nagano
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 165
Reflection-aware generative novel view synthesis Poster Session 1
GeonU Kim ⋅ Shin Dong-Yeon ⋅ Tae-Hyun Oh
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 163
Enhancing Embodied Reasoning and Grounding by Novel View Synthesis Poster Session 1
Yu-Ji Kim ⋅ Dahye Lee ⋅ Kim Jun-Seong ⋅ Nam Hyeon-Woo ⋅ GeonU Kim ⋅ Yongjin Kwon ⋅ Yu-Chiang Frank Wang ⋅ Jaesung Choe ⋅ Tae-Hyun Oh
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 162
Multi-view Multi-vehicle Driving Dataset for Novel View Synthesis Poster Session 1
Sanjay Dharavath ⋅ Hanvitha Mukkamala ⋅ Faizan Khan ⋅ Ioannis Kakogeorgiou ⋅ Aditya Arun ⋅ Zakaria Laskar ⋅ C. V. Jawahar
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 161
Generalizable Neural Reconstruction of High-Fidelity Surfaces via Sparse Volumetric Representations Poster Session 1
Aoxiang Fan ⋅ Corentin Dumery ⋅ Nicolas Talabot ⋅ Ming Xu ⋅ Hieu Le ⋅ Pascal Fua
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 223
P-CORE: Self-Supervised Surface Consistency for Point-Based Neural Editing Poster Session 1
Yanshu Zhang ⋅ Shichong Peng ⋅ Mehran Aghabozorgi ⋅ Alireza Moazeni ⋅ Ke Li
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 207
Flash-Refine: Frustum-Guided Local Incremental Learning for Efficient 3D Gaussian Splatting Completion Poster Session 1
Nuocheng Ji ⋅ Hanyang Zhuang ⋅ Chunxiang Wang ⋅ Ming Yang
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 308
Large-Scale Light Field Synthesis from Videos Enables Geometrically Consistent Bokeh Editing Poster Session 1
Haoming Cai ⋅ Zhoutong Zhang ⋅ Christopher Metzler ⋅ Shumian Xin
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 208
DLGStream: Dynamic Language-embedded Guassian Splatting for Open-vocabulary Enabled Free-viewpoint Video Streaming Poster Session 1
ZHIHUI KE ⋅ Yvyang Liu ⋅ Xiaobo Zhou ⋅ Tie Qiu
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 217
DASAM3D: A Unified Foundation Model for Enhanced 3D Scene Reconstruction and Segmentation Poster Session 1
RONNY XAVIER VELASTEGUI SANDOVAL ⋅ Max Pfingsthorn ⋅ Sezer Karaoglu ⋅ Theo Gevers
3D Reconstruction, Gaussian Splatting & Neural Rendering ExHall # 224
PrintAnything: Learning Geometric Plan Map for 3D Printing G-code Generation from Unoriented Point Clouds Poster Session 6
Sangmin Hong ⋅ Daniel Sungho Jung ⋅ Heewon Kim ⋅ Kyoung Mu Lee
3D Reconstruction, Registration and Scene Modeling ExHall # 88
DRS-VPT: Directly Re-localizing in Scenes using a Vision and Point Transformer Poster Session 6
Lanke Fu ⋅ Maurice Fallon
3D Reconstruction, Registration and Scene Modeling ExHall # 97
DisentangledTMR: Privacy-Preserving Skeleton Motion Retargeting via Factorized Transformers Poster Session 6
Thomas Carr ⋅ Depeng Xu ⋅ Shuhan Yuan ⋅ Aidong Lu
3D Reconstruction, Registration and Scene Modeling ExHall # 98
Seeing Through the Weights: Privacy Leakage in Scene Coordinate Regression Poster Session 6
Oleksii Nasypanyi ⋅ Jaemin Cho ⋅ Utku Ozbulak ⋅ Byungkon Kang ⋅ Francois Rameau
3D Reconstruction, Registration and Scene Modeling ExHall # 99
Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving Poster Session 6
Geonho Bang ⋅ Geunju Baek ⋅ DongYoung Lee ⋅ Wonjun Jeong ⋅ Jun Won Choi
3D Reconstruction, Registration and Scene Modeling ExHall # 94
Scale3D: Autoregressive Modeling for Large Outdoor Scene Generation Poster Session 6
DI QI ⋅ Zheng Sun ⋅ Xuanyang Zhang ⋅ Gang Yu
3D Reconstruction, Registration and Scene Modeling ExHall # 56
TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation Poster Session 6
Ziqian Wang ⋅ Yonghao He ⋅ Licheng Yang ⋅ Wei Zou ⋅ Hongxuan Ma ⋅ Liu.Liu Liu.Liu ⋅ Wei Sui ⋅ Yuxin Guo ⋅ Hu Su
3D Reconstruction, Registration and Scene Modeling ExHall # 45
TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches Poster Session 6
Langzhe Gu ⋅ Hung-Jui Huang ⋅ Mohamad Qadri ⋅ Michael Kaess ⋅ Wenzhen Yuan
3D Reconstruction, Registration and Scene Modeling ExHall # 46
GridFlow: Structured Latent Flow for Seamless City-Scale 3D Point Cloud Generation Poster Session 6
Xinyu Wang ⋅ Muhammad Ibrahim ⋅ Atif Mansoor ⋅ Ajmal Mian
3D Reconstruction, Registration and Scene Modeling ExHall # 47
SNOW: Spatio-Temporal Scene Understanding with World Knowledge for Open-World Embodied Reasoning Poster Session 6
Tin Stribor Sohn ⋅ Maximilian Dillitzer ⋅ Jason Corso ⋅ Johannes Bach ⋅ Eric Sax
3D Reconstruction, Registration and Scene Modeling ExHall # 48
E-M3RF: An Equivariant Multimodal 3D Re-assembly Framework Poster Session 6
Adeela Islam ⋅ Stefano Fiorini ⋅ MANUEL LECHA SANCHEZ ⋅ Theodore Tsesmelis ⋅ Stuart James ⋅ Pietro Morerio ⋅ Alessio Del Bue
3D Reconstruction, Registration and Scene Modeling ExHall # 49
UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction Poster Session 6
Xinqiang Yu ⋅ Zekun Qi ⋅ Jiawei He ⋅ Wenyao Zhang ⋅ Xuchuan Chen ⋅ Guocai Yao ⋅ Li Yi ⋅ Zhaoxiang Zhang ⋅ HE WANG
3D Reconstruction, Registration and Scene Modeling ExHall # 50
Seen2Scene: Completing Realistic 3D Scenes with Visibility-Guided Flow Poster Session 6
Quan Meng ⋅ Yujin Chen ⋅ Lei Li ⋅ Matthias Niessner ⋅ Angela Dai
3D Reconstruction, Registration and Scene Modeling ExHall # 51
WorldFlow3D: Flowing Through 3D Distributions for Unbounded World Generation Poster Session 6
Amogh Joshi ⋅ Julian Ost ⋅ Felix Heide
3D Reconstruction, Registration and Scene Modeling ExHall # 52
SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation Poster Session 6
Yun He ⋅ Kelin Yu ⋅ Matthias Zwicker
3D Reconstruction, Registration and Scene Modeling ExHall # 53
RayMap3R: Inference-Time RayMap for Dynamic 3D Reconstruction Poster Session 6
Feiran Wang ⋅ Zezhou Shang ⋅ Gaowen Liu ⋅ Yan Yan
3D Reconstruction, Registration and Scene Modeling ExHall # 54
RegVGGT: Sustainable Visual Geometry Grounding for Streaming via Regulated Memory Poster Session 6
Hongbo Mao ⋅ Junjun Jiang ⋅ Youyu Chen ⋅ Jiaxin Zhang ⋅ Zhemeng Dong ⋅ Xianming Liu
3D Reconstruction, Registration and Scene Modeling ExHall # 55
Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction Poster Session 6
Chin-Yang Lin ⋅ Yang-Che Sun ⋅ Cheng Sun ⋅ Fu-En Yang ⋅ Min-Hung Chen ⋅ Yen-Yu Lin ⋅ Wei-Chen Chiu ⋅ Yu-Lun Liu
3D Reconstruction, Registration and Scene Modeling ExHall # 57
FILT3R: Latent State Adaptive Kalman Filter for Streaming 3D Reconstruction Poster Session 6
Seonghyun Jin ⋅ Jong Chul Ye
3D Reconstruction, Registration and Scene Modeling ExHall # 58
GeoMix: Descriptor-Free Visual Localization via Global Context and Multi-Detector Training Poster Session 6
Yejun zhang ⋅ Xinjue Wang ⋅ Zihan Wang ⋅ Esa Rahtu ⋅ Juho Kannala
3D Reconstruction, Registration and Scene Modeling ExHall # 59
Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation Poster Session 6
Stefan Ainetter ⋅ Thomas Deixelberger ⋅ Edoardo Dominici ⋅ Philipp Drescher ⋅ Konstantinos Vardis ⋅ Markus Steinberger
3D Reconstruction, Registration and Scene Modeling ExHall # 60
White Aggregation and Restoration for Few-shot 3D Point Cloud Semantic Segmentation Poster Session 6
Jiyun Im ⋅ SuBeen Lee ⋅ Miso Lee ⋅ Jae-Pil Heo
3D Reconstruction, Registration and Scene Modeling ExHall # 62
NaLA: A 3D Native LLM Layout Agent for High-quality 3D Scene Generation Poster Session 6
Cheng Wan ⋅ Yongsen Mao ⋅ Wenzheng Wu ⋅ Yuxuan Xie ⋅ Chucheng Xiang ⋅ Runze Wang ⋅ Xiang Zhang ⋅ zhongyuan liu ⋅ Rushi Dai ⋅ Yuan Liu
3D Reconstruction, Registration and Scene Modeling ExHall # 63
GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation Poster Session 6
Nicolas von Lützow ⋅ Barbara Roessle ⋅ Katharina Schmid ⋅ Matthias Niessner
3D Reconstruction, Registration and Scene Modeling ExHall # 64
On Geometric Understanding and Learned Priors in Feed-forward 3D Reconstruction Models Poster Session 6
Jelena Bratulić ⋅ Sudhanshu Mittal ⋅ Thomas Brox ⋅ Christian Rupprecht
3D Reconstruction, Registration and Scene Modeling ExHall # 65
TASE: Truncation-Aware Semantic Embeddings for 3D Scene Understanding and Editing Poster Session 6
Tim-Felix Faasch ⋅ Jochen Kall ⋅ Jens Behley ⋅ Lucas Nunes ⋅ Cyrill Stachniss
3D Reconstruction, Registration and Scene Modeling ExHall # 66
Pano3D: Unified 3D Reconstruction and Panoptic Segmentation Poster Session 6
Victor Barberteguy ⋅ Ahmet Iscen ⋅ Mathilde Caron ⋅ Alireza Fathi ⋅ Gül Varol ⋅ Cordelia Schmid
3D Reconstruction, Registration and Scene Modeling ExHall # 67
Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability Poster Session 6
Runfeng Qu ⋅ Pia Bideau ⋅ Ole Hall ⋅ Julie Ouerfelli-Ethier ⋅ Klaus Obermayer ⋅ Olaf Hellwich
3D Reconstruction, Registration and Scene Modeling ExHall # 68
UniQueR: Unified Query-based Feedforward 3D Reconstruction Poster Session 6
Chensheng Peng ⋅ Quentin HERAU ⋅ Jiezhi Yang ⋅ Yichen Xie ⋅ Yihan Hu ⋅ Wenzhao Zheng ⋅ Matthew Strong ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan
3D Reconstruction, Registration and Scene Modeling ExHall # 69
SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation Poster Session 6
Hiba Dahmani ⋅ Nathan Piasco ⋅ Moussab Bennehar ⋅ Luis G Roldao Jimenez ⋅ Dzmitry Tsishkou ⋅ Laurent Caraffa ⋅ Jean-Philippe Tarel ⋅ Roland Brémond
3D Reconstruction, Registration and Scene Modeling ExHall # 70
LESV:Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding Poster Session 6
Fusang WANG ⋅ Nathan Piasco ⋅ Moussab Bennehar ⋅ Luis G Roldao Jimenez ⋅ Dzmitry Tsishkou ⋅ Fabien Moutarde
3D Reconstruction, Registration and Scene Modeling ExHall # 71
SHReg: Strictly Rotation-Equivariant Point Cloud Registration via Spherical Harmonics Poster Session 6
Chongjian Wang ⋅ Junjie Gao
3D Reconstruction, Registration and Scene Modeling ExHall # 72
Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs Poster Session 6
Deniz Bickici ⋅ Michael Pabst ⋅ Shohei Mori ⋅ Dieter Schmalstieg
3D Reconstruction, Registration and Scene Modeling ExHall # 73
Map2World: Segment Map Conditioned Text to 3D World Generation Poster Session 6
Jaeyoung Chung ⋅ Suyoung Lee ⋅ Jianfeng Xiang ⋅ Jiaolong Yang ⋅ Kyoung Mu Lee
3D Reconstruction, Registration and Scene Modeling ExHall # 74
Towards Practical Lossless Neural Compression for LiDAR Point Clouds Poster Session 6
pengpeng yu ⋅ Haoran Li ⋅ Runqing Jiang ⋅ Dingquan Li ⋅ Jing Wang ⋅ Liang Lin ⋅ Yulan Guo
3D Reconstruction, Registration and Scene Modeling ExHall # 75
BitRIC: Efficient Neural Compression of LiDAR Range Images via Hierarchical Bitplanes Poster Session 6
Kang You ⋅ Tong Chen ⋅ Dandan Ding ⋅ M. Salman Asif ⋅ Zhan Ma
3D Reconstruction, Registration and Scene Modeling ExHall # 76
Uncertainty-Driven Gaussian Sphere Propagation for 3D Semantic Segmentation Poster Session 6
Zhicheng Yan ⋅ Qingyong Li ⋅ Yixiao Song ⋅ Wen Wang
3D Reconstruction, Registration and Scene Modeling ExHall # 77
Volume Transformer: Revisiting Vanilla Transformers for 3D Scene Understanding Poster Session 6
Kadir Yilmaz ⋅ Adrian Kruse ⋅ Tristan Höfer ⋅ Daan de Geus ⋅ Bastain Leibe
3D Reconstruction, Registration and Scene Modeling ExHall # 78
PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation Poster Session 6
Yi Yang ⋅ Myrna Castillo Silva ⋅ Bodo Rosenhahn ⋅ Michael Yang
3D Reconstruction, Registration and Scene Modeling ExHall # 79
Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training Poster Session 6
FANGFU LIU ⋅ Diankun Wu ⋅ Jiawei Chi ⋅ Yimo Cai ⋅ Yi-Hsin Hung ⋅ Xumin Yu ⋅ Hao Li ⋅ Han Hu ⋅ Yongming Rao ⋅ Yueqi Duan
3D Reconstruction, Registration and Scene Modeling ExHall # 80
Zero-Shot Novel Depth Synthesis Using Foundation Models Scene Representations Poster Session 6
Denis Akola ⋅ David Fouhey
3D Reconstruction, Registration and Scene Modeling ExHall # 81
SLAM-Former: Putting SLAM into One Transformer Poster Session 6
Yijun Yuan ⋅ Zhuoguang Chen ⋅ Kenan Li ⋅ Weibang Wang ⋅ Minghui Qin ⋅ Zhijian Fang ⋅ Weicheng Zheng ⋅ Hang Zhao
3D Reconstruction, Registration and Scene Modeling ExHall # 82
Pixel-wise Geo-registration of Drone and Satellite Images Poster Session 6
Qingyang Liu ⋅ David G Shatwell ⋅ Parth Parag Kulkarni ⋅ Shah Mubarak
3D Reconstruction, Registration and Scene Modeling ExHall # 83
G2P: Gaussian-to-Point Attribute Alignment for Boundary-Aware 3D Segmentation Poster Session 6
Hojun Song ⋅ Chae-yeong Song ⋅ Jeong-hun Hong ⋅ chaewon moon ⋅ Soo Ye Kim ⋅ Yiyi Liao ⋅ Jaehyup Lee ⋅ Sang-hyo Park
3D Reconstruction, Registration and Scene Modeling ExHall # 84
MessyKitchens: Contact-rich object-level 3D scene reconstruction Poster Session 6
Junaid Ahmed Ansari ⋅ Ran Ding ⋅ Fabio Pizzati ⋅ Ivan Laptev
3D Reconstruction, Registration and Scene Modeling ExHall # 85
MARché: Fast Masked Autoregressive Image Generation with Cache-Aware Attention Poster Session 6
Chaoyi Jiang ⋅ Sungwoo Kim ⋅ Lei Gao ⋅ Hossein Zarch ⋅ Won Woo Ro ⋅ Murali Annavaram
3D Reconstruction, Registration and Scene Modeling ExHall # 86
Occlusion-Resilient Category-Agnostic Pose Estimation with Conditional Flow Matching Poster Session 6
Jiyong Rao ⋅ Shengjie Zhao ⋅ Yu Wang ⋅ Hao Deng
3D Reconstruction, Registration and Scene Modeling ExHall # 87
Abstract the Layout, Focus the Detail: A Dual-Granularity Representation Framework for Zero-Shot 3D Visual Grounding Poster Session 6
Zeyuan Lin ⋅ Hanxuan Li ⋅ Chen He ⋅ Ruiping Wang ⋅ Zhaoxiang Liu ⋅ Xilin CHEN
3D Reconstruction, Registration and Scene Modeling ExHall # 89
SEAR: Simple and Efficient Adaptation of Visual Geometric Transformers for RGB+Thermal 3D Reconstruction Poster Session 6
Vsevolod Skorokhodov ⋅ Chenghao Xu ⋅ Shuo Sun ⋅ Olga Fink ⋅ Malcolm Mielle
3D Reconstruction, Registration and Scene Modeling ExHall # 90
Sparse-Aware Vector Quantization for Bandwidth-Efficient Collaborative 3D Semantic Occupancy Prediction Poster Session 6
Feng Li ⋅ Chaokun Zhang ⋅ Gong Chen
3D Reconstruction, Registration and Scene Modeling ExHall # 91
Point Diffusion Mamba: Unified Diffusion-State-Space Modeling for Single-View 3D Reconstruction under Data Scarcity Poster Session 6
Wei Zhou ⋅ Xinzhe Shi ⋅ Xingxing Hao ⋅ Xing Hao ⋅ Kang Li ⋅ Jinye Peng ⋅ Ying He
3D Reconstruction, Registration and Scene Modeling ExHall # 92
Bootstrapping Articulated 3D Reconstruction from 2D Image Collections Poster Session 6
Jakub Zadrozny ⋅ Oisin Mac Aodha ⋅ Hakan Bilen
3D Reconstruction, Registration and Scene Modeling ExHall # 95
Mind2Cloud: EEG-to-Point Cloud Generation with Two-Granularity Diffusion Decoding Poster Session 6
Yongyi Lu ⋅ Xiongfeng Huang ⋅ Zhijing Yang
3D Reconstruction, Registration and Scene Modeling ExHall # 96
Fixed Reality, Diffused Possibility: Disentangling Stochastic and Deterministic Latent for Cluttered Grasping Poster Session 6
Hritam Basak ⋅ Zhaozheng Yin
3D Reconstruction, Registration and Scene Modeling ExHall # 44
FUSE: A Flow-based Mapping Between Shapes Poster Session 6
Lorenzo Olearo ⋅ Giulio Viganò ⋅ Daniele Baieri ⋅ Filippo Maggioli ⋅ Simone Melzi
3D Reconstruction, Registration and Scene Modeling ExHall # 93
MSVS-VAE: Multi-Scale Anchored VecSet for High-Fidelity 3D Reconstruction Poster Session 6
Dehao Hao ⋅ Kaiyi Zhang ⋅ Tanghui Jia ⋅ Xiangjun Gao ⋅ Dongyu Yan ⋅ Weikai Chen ⋅ Zeyu HU ⋅ Lingting Zhu ⋅ Yingda Yin ⋅ Runze Zhang ⋅ Li Yuan ⋅ Xin Wang ⋅ Long Quan
3D Reconstruction, Registration and Scene Modeling ExHall # 23
Ex-Sim(3)-Reg: 2D-3D Correspondence Pruning via Extended Sim(3) Registration Poster Session 6
Pei An ⋅ Muyao Peng ⋅ Junfeng Ding ⋅ Jiaqi Yang ⋅ Liangliang Nan
3D Reconstruction, Registration and Scene Modeling ExHall # 36
Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding Poster Session 6
Lucy Lin ⋅ Ayush Jain ⋅ Yifan Liu ⋅ Katerina Fragkiadaki
3D Reconstruction, Registration and Scene Modeling ExHall # 24
OCA: ODE-Driven Cross-Attention for Image-to-Point-Cloud Registration Poster Session 6
Pei An ⋅ Jiaqi Yang ⋅ Yulong Wang ⋅ Quan Siwen ⋅ Liangliang Nan
3D Reconstruction, Registration and Scene Modeling ExHall # 15
SegFly: A 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale Poster Session 6
Markus Gross ⋅ Sai Matha ⋅ Rui Song ⋅ Viswanathan Muthuveerappan ⋅ Conrad Christoph ⋅ Julius Huber ⋅ Daniel Cremers
3D Reconstruction, Registration and Scene Modeling ExHall # 100
LangLoc: “Tell Me What You See” Poster Session 6
Shaurya Kishore Panwar ⋅ Roham Zendehdel Nobari ⋅ Shirley Lau ⋅ Abu Bakr Rahman Shaik ⋅ Manuel Günther ⋅ Marc Pollefeys ⋅ Daniel Barath
3D Reconstruction, Registration and Scene Modeling ExHall # 21
DepWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors Poster Session 6
Seok-Young Kim ⋅ Abdelrahman Elskhawy ⋅ TAEWOOK HA ⋅ Dooyoung Kim ⋅ Eunjae Shin ⋅ Benjamin Busam ⋅ Woontack Woo
3D Reconstruction, Registration and Scene Modeling ExHall # 25
Mitigating Positional Leakage in 3D Masked Autoencoders for Robust Representation Learning Poster Session 6
Xu Yan ⋅ Huiqun Wang ⋅ Chen Wang ⋅ Lei Ren ⋅ Di Huang
3D Reconstruction, Registration and Scene Modeling ExHall # 61
Pose Anything Anywhere: Model-free Object Poses from Arbitrary References Poster Session 6
Hongli XU ⋅ Jiaqi Hu ⋅ Junwen Huang ⋅ Boyang Zhong ⋅ Peter Yu ⋅ Nassir Navab ⋅ Benjamin Busam ⋅ Slobodan Ilic
3D Reconstruction, Registration and Scene Modeling ExHall # 40
PGCR: Pose–Geometry Coupled Reasoning for Image-to-Point Cloud Registration Poster Session 6
Xinjun Li ⋅ Wenfei Yang ⋅ Yihan Chen ⋅ Zhixin Cheng ⋅ Shifeng Zhang ⋅ Xu Zhou ⋅ Tianzhu Zhang
3D Reconstruction, Registration and Scene Modeling ExHall # 26
Track4World: Feedforward World-centric Dense 3D Tracking of All Pixels Poster Session 6
Jiahao Lu ⋅ Jiayi Xu ⋅ WENBO HU ⋅ Ruijie Zhu ⋅ Chengfeng Zhao ⋅ Sai Kit Yeung ⋅ Ying Shan ⋅ Yuan Liu
3D Reconstruction, Registration and Scene Modeling ExHall # 27
CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction Poster Session 6
Yuzhou Ji ⋅ Xiaotian Yang ⋅ Zhipeng Zhang
3D Reconstruction, Registration and Scene Modeling ExHall # 28
Geometric Context Transformer for Streaming 3D Reconstruction Poster Session 6
Lin-Zhuo Chen ⋅ Jian Gao ⋅ Shangzhan Zhang ⋅ Yihang Chen ⋅ Nan Xue ⋅ Jianyuan Wang ⋅ Christian Rupprecht ⋅ Xun Cao ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Yao Yao ⋅ YINGHAO XU
3D Reconstruction, Registration and Scene Modeling ExHall # 29
SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion Poster Session 6
Paul Engstler ⋅ Iro Laina ⋅ Christian Rupprecht ⋅ Andrea Vedaldi
3D Reconstruction, Registration and Scene Modeling ExHall # 30
RGB-Pointmap Pretraining for Unified 3D Scene Understanding Poster Session 6
Ye Mao ⋅ Weixun Luo ⋅ Ranran Huang ⋅ Junpeng Jing ⋅ Krystian Mikolajczyk
3D Reconstruction, Registration and Scene Modeling ExHall # 31
SAF3R: Dynamic Sparse Attention for Feed-Forward 3D Reconstruction Transformers Poster Session 6
Jianing Deng ⋅ Yuanzhe LI ⋅ Jialu Wang ⋅ Song Wang ⋅ Tianlong Chen ⋅ Huanrui Yang ⋅ Jingtong Hu
3D Reconstruction, Registration and Scene Modeling ExHall # 32
Phase-Aligned RoPE for Mixed-Resolution Diffusion Transformer Poster Session 6
Haoyu Wu ⋅ Jingyi Xu ⋅ Qiaomu Miao ⋅ Dimitris Samaras ⋅ Hieu Le
3D Reconstruction, Registration and Scene Modeling ExHall # 33
YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos Poster Session 6
Haoming Chen ⋅ Lichen Yuan ⋅ TianFang Sun ⋅ Jingyu Gong ⋅ Zhizhong Zhang ⋅ Xin Tan ⋅ Yanyun Qu ⋅ Yuan Xie
3D Reconstruction, Registration and Scene Modeling ExHall # 34
Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention Poster Session 6
Yiwen Chen ⋅ Zhihao Li ⋅ Yihao Luo ⋅ Yikai Wang ⋅ Zhang Hu ⋅ Le Li ⋅ Qin Li ⋅ Chi Zhang ⋅ Guosheng Lin
3D Reconstruction, Registration and Scene Modeling ExHall # 35
MAGiSt3R: Multi-Agent Feed-forward 3D Reconstruction from Monocular RGB Videos Poster Session 6
ZIREN GONG ⋅ Xiaohan Li ⋅ Fabio Tosi ⋅ Ninghui Xu ⋅ Stefano Mattoccia ⋅ Jianfei Cai ⋅ Matteo Poggi
3D Reconstruction, Registration and Scene Modeling ExHall # 18
Attention-DP3: Spatially Object-aware 3D Diffusion Policy via Geometry-aligned Attentional Conditioning Poster Session 6
Changbo Yan ⋅ Zhongbo Zhang ⋅ Zaibin Zhang ⋅ Yifan Wang ⋅ Lijun Wang ⋅ Huchuan Lu
3D Reconstruction, Registration and Scene Modeling ExHall # 37
Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces Poster Session 6
Xinggang Hu ⋅ Chenyangguang Zhang ⋅ Alexandros Delitzas ⋅ Xiangkui Zhang ⋅ Marc Pollefeys ⋅ Francis Engelmann ⋅ Xiangyang Ji
3D Reconstruction, Registration and Scene Modeling ExHall # 38
Vulnerability of Privacy-Preserving Visual Localization against Diffusion-based Attacks Poster Session 6
Maxime Pietrantoni ⋅ Torsten Sattler ⋅ Gabriela Csurka
3D Reconstruction, Registration and Scene Modeling ExHall # 39
HHA: Hierarchical Hyperbolic Constraints for Imperceptible Point Cloud Attacks Poster Session 6
Keke Tang ⋅ Yu Liao ⋅ Weilong Peng ⋅ Xiaofei Wang ⋅ Daizong Liu ⋅ Zhongyun Hua ⋅ Peican Zhu ⋅ Zhihong Tian
3D Reconstruction, Registration and Scene Modeling ExHall # 41
SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation Poster Session 6
Yuan Li ⋅ Congyi Zhang ⋅ Xifeng Gao ⋅ Xiaohu Guo
3D Reconstruction, Registration and Scene Modeling ExHall # 42
LSRM: High-Fidelity Object-Centric Reconstruction via Scaled Context Windows Poster Session 6
Zhengqin Li ⋅ Cheng Zhang ⋅ Jakob Engel ⋅ Dong Zhao
3D Reconstruction, Registration and Scene Modeling ExHall # 43
AnyGround3D: Towards Grounding Any 3D Object in the Wild via 2D-to-3D Lifting Poster Session 6
Yingping Liang ⋅ Wenxuan Guo
3D Reconstruction, Registration and Scene Modeling ExHall # 1
OneWorld: Taming Scene Generation with 3D Unified Representation Autoencoder Poster Session 6
Sensen Gao ⋅ Zhaoqing Wang ⋅ Qihang Cao ⋅ Dongdong Yu ⋅ Changhu Wang ⋅ Tongliang Liu ⋅ Mingming Gong ⋅ Jiawang Bian
3D Reconstruction, Registration and Scene Modeling ExHall # 2
LaMP: Learning Vision-Language-Action Policies with 3D Scene Flow as Latent Motion Prior Poster Session 6
Xinkai Wang ⋅ Chenyi Wang ⋅ Yifu Xu ⋅ Mingzhe Ye ⋅ Fu-Cheng Zhang ⋅ Jialin Tian ⋅ Xinyu Zhan ⋅ Lifeng Zhu ⋅ Cewu Lu ⋅ Lixin Yang
3D Reconstruction, Registration and Scene Modeling ExHall # 3
GeoWorld: Providing Full-frame Geometry Features to Facilitate 3D Scene Generation Poster Session 6
Yuhao Wan ⋅ Lijuan Liu ⋅ Jingzhi Zhou ⋅ Zihan Zhou ⋅ Xuying Zhang ⋅ dongbo zhang ⋅ Shaohui Jiao ⋅ Qibin Hou ⋅ Ming-Ming Cheng
3D Reconstruction, Registration and Scene Modeling ExHall # 4
Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding Poster Session 6
Xianjin Wu ⋅ Dingkang Liang ⋅ Tianrui Feng ⋅ Kui Xia ⋅ Yumeng Zhang ⋅ Xiaofan Li ⋅ Xiao Tan ⋅ Xiang Bai
3D Reconstruction, Registration and Scene Modeling ExHall # 5
LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory Poster Session 6
Junyi Zhang ⋅ Charles Herrmann ⋅ Junhwa Hur ⋅ Chen Sun ⋅ Ming-Hsuan Yang ⋅ Forrester Cole ⋅ Trevor Darrell ⋅ Deqing Sun
3D Reconstruction, Registration and Scene Modeling ExHall # 6
UBone3D: Physics-Rectified Conditional Flow Matching for Anatomical 3D Shape Completion from Ultrasound Poster Session 6
Weiying Chen ⋅ Yuchong Gao ⋅ Siyuan Li ⋅ Marek Reformat ⋅ Rui Zheng ⋅ Edmond Lou
3D Reconstruction, Registration and Scene Modeling ExHall # 7
Register Any Point: Scaling 3D Point Cloud Registration by Flow Matching Poster Session 6
Yue Pan ⋅ Tao Sun ⋅ Liyuan Zhu ⋅ Lucas Nunes ⋅ Iro Armeni ⋅ Jens Behley ⋅ Cyrill Stachniss
3D Reconstruction, Registration and Scene Modeling ExHall # 8
Argus: Metric Panoramic 3D Reconstruction for Indoor Scenes Poster Session 6
Xi Li ⋅ Linyuan Li ⋅ Yan Wu ⋅ Tong Rao ⋅ Kai Zhang ⋅ Xinchen Hui ⋅ Cihui Pan
3D Reconstruction, Registration and Scene Modeling ExHall # 9
Taming LLMs for Codematic Indoor Scene Generation Poster Session 6
yixun liang ⋅ Qianyi Wu ⋅ Chuan Fang ⋅ Rui Chen ⋅ Jiahang Liu ⋅ Jianfeng Zhang ⋅ Ping Tan
3D Reconstruction, Registration and Scene Modeling ExHall # 10
TORA: Topological Representation Alignment for 3D Shape Assembly Poster Session 6
Nahyuk Lee ⋅ Zhiang Chen ⋅ Marc Pollefeys ⋅ Sunghwan Hong
3D Reconstruction, Registration and Scene Modeling ExHall # 11
LiFlow: Flow Matching for 3D LiDAR Scene Completion Poster Session 6
Andrea Matteazzi ⋅ Dietmar Tutsch
3D Reconstruction, Registration and Scene Modeling ExHall # 12
Event-LiDAR: 3D Eventification for Efficient Point Cloud Processing Poster Session 6
Masatoshi Murakami ⋅ Eisho Tsuji ⋅ Ken Sakurada
3D Reconstruction, Registration and Scene Modeling ExHall # 13
CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose Poster Session 6
Li Jin ⋅ Yuchen Yang ⋅ Weikai Chen ⋅ Yujie Wang ⋅ Dehao Hao ⋅ Tanghui Jia ⋅ Yingda Yin ⋅ Zeyu HU ⋅ Runze Zhang ⋅ Keyang Luo ⋅ Li Yuan ⋅ Long Quan ⋅ Xin Wang ⋅ Xueying Qin
3D Reconstruction, Registration and Scene Modeling ExHall # 14
SuperFlex: Deformable Superquadrics for Point Cloud Decomposition Poster Session 6
Gabriel Tavernini ⋅ Elisabetta Fedele ⋅ Tiago Novello ⋅ Leonidas Guibas ⋅ Marc Pollefeys ⋅ Francis Engelmann
3D Reconstruction, Registration and Scene Modeling ExHall # 16
FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction Poster Session 6
Dubing Chen ⋅ Huan Zheng ⋅ Tianyi Yan ⋅ Yucheng Zhou ⋅ Runzhou Tao ⋅ Zhongying Qiu ⋅ Jianfei Yang ⋅ Shen Jianbing
3D Reconstruction, Registration and Scene Modeling ExHall # 17
Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs Poster Session 6
Yung-Hsu Yang ⋅ Luigi Piccinelli ⋅ Samuel Rota Bulò ⋅ Sunghwan Hong ⋅ Denys Rozumnyi ⋅ Johannes Schönberger ⋅ Zuria Bauer ⋅ Hermann Blum ⋅ Peter Kontschieder ⋅ Marc Pollefeys
3D Reconstruction, Registration and Scene Modeling ExHall # 19
GraphCPD: Coherent Point Drift for Point Cloud Registration via Graph Signal Processing Poster Session 6
Yingcheng Lai ⋅ Xingjian Wang ⋅ Li Chai
3D Reconstruction, Registration and Scene Modeling ExHall # 20
Unsupervised Point Cloud Registration via Training-Time Semantic Guidance Poster Session 6
Kezheng Xiong ⋅ Shiyun Xu ⋅ Sheng Ao ⋅ Siqi Shen ⋅ Cheng Wang ⋅ Chenglu Wen
3D Reconstruction, Registration and Scene Modeling ExHall # 22
MegaFlow: Zero-Shot Large Displacement Optical Flow Poster Session 2
Dingxi Zhang ⋅ Fangjinhua Wang ⋅ Marc Pollefeys ⋅ Haofei Xu
Computational Imaging, Medical & Scientific Vision ExHall # 251
TRAM: Finetuning-Free Test-Time Adaptation for Generalized Face Anti-Spoofing with Only a Few Bonafide Samples Poster Session 2
Wang QIRUI ⋅ SI-QI LIU
Computational Imaging, Medical & Scientific Vision ExHall # 249
HIDA: A Human-Intuition-Guided Depth-Aware Framework for Zero-Shot Amodal Segmentation Poster Session 2
PENG LI ⋅ Kelin Wang ⋅ Bingchuan Chen ⋅ Ya-Li Hou ⋅ Mingxia Shen ⋅ Bo Li
Computational Imaging, Medical & Scientific Vision ExHall # 248
Posterior Samplings are Missing Modalities Generators for Medical Image Translation Poster Session 2
Jonghun Kim
Computational Imaging, Medical & Scientific Vision ExHall # 247
Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation Poster Session 2
Ziyu Zhang ⋅ Yi Yu ⋅ Simeng Zhu ⋅ Ahmed Aly ⋅ Yunhe Gao ⋅ Ning Gu ⋅ Yuan Xue
Computational Imaging, Medical & Scientific Vision ExHall # 246
Less Tokens, Better Forecasts: Sparse Residual Routing for Efficient Weather Prediction Poster Session 2
Janet Wang ⋅ Yunbei Zhang ⋅ Lin Zhao ⋅ Xi Xiao ⋅ Jihun Hamm ⋅ Xiao Wang
Computational Imaging, Medical & Scientific Vision ExHall # 245
Spatiotemporal Flux Probing for Single-Photon Videography Poster Session 2
Jerry Yan ⋅ Matteo Forlivesi ⋅ Bowen Tan ⋅ Andrew Xie ⋅ Siddharth Somasundaram ⋅ Sotiris Nousias
Computational Imaging, Medical & Scientific Vision ExHall # 244
Raw-JPEG Adapter: Efficient Raw Image Compression with JPEG Poster Session 2
Mahmoud Afifi ⋅ Ran Zhang ⋅ Michael S Brown
Computational Imaging, Medical & Scientific Vision ExHall # 243
NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation Poster Session 2
HAIYANG YAN ⋅ Jinyue Guo ⋅ Yanchao Zhang ⋅ Bingqing Wang ⋅ Zhenchen Li ⋅ Jing Liu ⋅ Jiazheng Liu ⋅ linlin li ⋅ Hua Han
Computational Imaging, Medical & Scientific Vision ExHall # 242
Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition Poster Session 2
Xiaoyang Liu ⋅ Bolin Qiu ⋅ Zheng Chen ⋅ Libo Zhu ⋅ Zihan Zhou ⋅ Kai Liu ⋅ Jiezhang Cao ⋅ Yulun Zhang
Computational Imaging, Medical & Scientific Vision ExHall # 241
FedLAS: Feature-Modulated Bidirectional Label Smoothing for Neural Network Calibration Poster Session 2
Thiru Thillai Nadarasar Bahavan ⋅ Sachith Seneviratne ⋅ Saman Halgamuge
Computational Imaging, Medical & Scientific Vision ExHall # 240
LogicIR: Logic Gate Networks for Image Restoration Poster Session 2
Hongjae Lee ⋅ Myungjun Son ⋅ Jaeseong Yu ⋅ Seung-Won Jung
Computational Imaging, Medical & Scientific Vision ExHall # 239
Progressive and Localized Super-Resolution of 3D Objects via Localized Latent Voxel Diffusion Poster Session 2
Yuxin Liu ⋅ Minshan Xie ⋅ Jiawen Liang ⋅ Runsong Zhu ⋅ Chi-Wing Fu ⋅ Tien-Tsin Wong
Computational Imaging, Medical & Scientific Vision ExHall # 345
DiffuPrompt: Adapting Video Foundation Models to 3D Medical Volumes via Latent Trajectory Priors Poster Session 2
Guowei Dai ⋅ Duwei Dai ⋅ yulong ji ⋅ Chen Hu ⋅ Yi Zhang
Computational Imaging, Medical & Scientific Vision ExHall # 354
Low-Level Dataset Distillation for Medical Image Enhancement Poster Session 2
Fengzhi Xu ⋅ Ziyuan Yang ⋅ Mengyu Sun ⋅ Joey Tianyi Zhou ⋅ Yi Zhang
Computational Imaging, Medical & Scientific Vision ExHall # 363
MambaRaw: Selective State Space Modeling for Efficient 4K RAW Image Reconstruction Poster Session 2
Peize Li ⋅ Fanhu Zeng ⋅ Tongda Xu ⋅ XINJIE ZHANG ⋅ Xingtong Ge ⋅ Haotian Zhang ⋅ Xingguo Xu ⋅ Yan Wang
Computational Imaging, Medical & Scientific Vision ExHall # 256
Do Multimodal LLMs Understand Intraoral Dental Data? Dataset, Platform, and Baselines Poster Session 2
Luca Lumetti ⋅ Federico Rizzo ⋅ Francesca Cremonini ⋅ Ettore Candeloro ⋅ Lombardo Luca ⋅ Costantino Grana ⋅ Federico Bolelli
Computational Imaging, Medical & Scientific Vision ExHall # 325
SHINE-PPG: Non-Lambertian Intrinsic Decomposition for Illumination-Robust rPPG Poster Session 2
Shih-Yu Yang ⋅ Yen-Chun Chou ⋅ Pei-Kai Huang ⋅ Chiou-Ting Hsu
Computational Imaging, Medical & Scientific Vision ExHall # 372
DiffVP:Differential Visual Semantic Prompting for LLM-Based CT Report Generation Poster Session 2
Yuhe Tian ⋅ Kun Zhang ⋅ Haoran Ma ⋅ Rui Yan ⋅ Yingtai Li ⋅ Rongsheng Wang ⋅ S Kevin Zhou
Computational Imaging, Medical & Scientific Vision ExHall # 335
From Local to Global: A Progressive Reconstruction Network for Diffractive Snapshot Spectral Imaging Poster Session 2
Zhengyue Zhuge ⋅ Shiqi Chen ⋅ Chi Zhang ⋅ Jiahui Xu ⋅ Tianchen Qiu ⋅ Dingchuan Yu ⋅ Yueting Chen
Computational Imaging, Medical & Scientific Vision ExHall # 280
BWAFDA: Block-wise Weighted Attention Fusion with Detail-aware for No-Reference Image Quality Assessment Poster Session 2
Shilv Cai ⋅ Jian Jin ⋅ Tianang Chen ⋅ Zhuangzi Li ⋅ Weisi Lin
Computational Imaging, Medical & Scientific Vision ExHall # 293
Rethinking Training and Inference for Trajectory Forecasting: Linking Winner-Take-All back to GMMs Poster Session 2
Qiyuan Wu ⋅ Katie Luo ⋅ Bharath Hariharan ⋅ Wei-Lun Chao ⋅ Mark Campbell
Computational Imaging, Medical & Scientific Vision ExHall # 284
BiCE-HG: A Bi-Conditional Egocentric Hand Gesture Dataset for Intelligent Reality Systems Poster Session 2
Awfa Dakheel ⋅ Charith Abhayaratne
Computational Imaging, Medical & Scientific Vision ExHall # 394
Off the Planckian Locus: Using 2D Chromaticity to Improve In-Camera Color Poster Session 2
SaiKiran Tedla ⋅ Joshua Little ⋅ Hakki Karaimer ⋅ Michael S Brown
Computational Imaging, Medical & Scientific Vision ExHall # 393
Pay Attention to Attention Distribution: A New Local Lipschitz Bound for Transformers Poster Session 2
Mikalai Yudzin ⋅ Sergei Kudriashov ⋅ Alexander Gaponov ⋅ Maxim Rakhuba
Computational Imaging, Medical & Scientific Vision ExHall # 392
SEMIR: Topology-Preserving Graph Minors for Thin-Structure Segmentation Poster Session 2
Luke Miller ⋅ Yugyung Lee
Computational Imaging, Medical & Scientific Vision ExHall # 391
NeuralDMD: Interpretable Untrained Neural Network for Imaging from Sparse and Noisy Observations Poster Session 2
Ali SaraerToosi ⋅ Renbo Tu ⋅ Esther Lin ⋅ Kamyar Azizzadenesheli ⋅ Aviad Levis
Computational Imaging, Medical & Scientific Vision ExHall # 390
3D Field of Junctions: A Noise-Robust, Training-Free Structural Prior for Volumetric Inverse Problems Poster Session 2
Namhoon Kim ⋅ NARGES MOEINI ⋅ Justin Romberg ⋅ Sara Fridovich-Keil
Computational Imaging, Medical & Scientific Vision ExHall # 389
Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation Poster Session 2
Qiang Hu ⋅ Yuxuan Luo ⋅ Yingjie Guo ⋅ Hao Wang ⋅ Qimei Wang ⋅ Qiang Li ⋅ Zhiwei Wang
Computational Imaging, Medical & Scientific Vision ExHall # 388
MobileSAM2: Lightweight Segment Anything in Images and Videos via Hypergraphical Knowledge Distillation Poster Session 2
Kai Jiang ⋅ Jiaxing Huang ⋅ Jingyi Zhang ⋅ Weiying Xie ⋅ Yunsong Li ⋅ Yufei Wang ⋅ Aoran Xiao ⋅ Dacheng Tao
Computational Imaging, Medical & Scientific Vision ExHall # 387
MedSPOT: A Workflow-Aware Sequential Grounding Benchmark for Clinical GUI Poster Session 2
Rozain Shakeel ⋅ Abdul Ali ⋅ Muneeb Ganie ⋅ Tausifa Jan Saleem ⋅ Tajamul Ashraf
Computational Imaging, Medical & Scientific Vision ExHall # 386
ZipDepth: Bringing Lightweight Zero-Shot Monocular Depth Anywhere, on Any Device Poster Session 2
Fabio Tosi ⋅ Luca Bartolomei ⋅ Matteo Poggi ⋅ Stefano Mattoccia
Computational Imaging, Medical & Scientific Vision ExHall # 385
GeoCFM: Positive-Only Conditional Flow Matching for Mineral Occurrence Sampling Poster Session 2
Moshe Eliasof ⋅ Eldad Haber
Computational Imaging, Medical & Scientific Vision ExHall # 384
iMED: A Multi-Endoscope Dataset for Surgical 3D Perception Poster Session 2
Sierra Bonilla ⋅ Fengyi Jiang ⋅ Chinedu Nwoye ⋅ Jingpei Lu ⋅ Kailey Reardon ⋅ Humphrey Chow ⋅ Francisco Vasconcelos ⋅ Sophia Bano ⋅ Adam Schmidt ⋅ Omid Mohareri
Computational Imaging, Medical & Scientific Vision ExHall # 383
Comprehensive language–image pre-training for 3D medical image understanding Poster Session 2
Tassilo Wald ⋅ Ibrahim Ethem Hamamci ⋅ Yuan Gao ⋅ Sam Bond-Taylor ⋅ Harshita Sharma ⋅ Maximilian Ilse ⋅ Cynthia Lo ⋅ Olesya Melnichenko ⋅ Anton Schwaighofer ⋅ Noel Codella ⋅ Maria Teodora Wetscherek ⋅ Klaus Maier-Hein ⋅ Panagiotis Korfiatis ⋅ Valentina Salvatelli ⋅ Javier Alvarez-Valle ⋅ Fernando Pérez-García
Computational Imaging, Medical & Scientific Vision ExHall # 382
Structured SIR: Efficient and Expressive Importance-Weighted Inference for High-Dimensional Image Registration Poster Session 2
Ivor Simpson ⋅ Neill Campbell
Computational Imaging, Medical & Scientific Vision ExHall # 381
RIGS: Radar-Informed Gaussian Splatting for Uncertainty-Aware 3D Occupancy and Motion Prediction Poster Session 2
Zeyu Han ⋅ Junzhe Wu ⋅ Fang Zhang ⋅ Maani Ghaffari Jadidi ⋅ Jianqiang Wang
Computational Imaging, Medical & Scientific Vision ExHall # 380
Stokes-Informed Diffusion for Robust Linear Polarization Estimation Poster Session 2
Yidong Luo ⋅ Chenggong Li ⋅ Yuchao Feng ⋅ Boxin Shi ⋅ Junchao Zhang ⋅ Xin Yuan
Computational Imaging, Medical & Scientific Vision ExHall # 379
Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing Poster Session 2
Ayush Prasad ⋅ Swarnalee Mazumder
Computational Imaging, Medical & Scientific Vision ExHall # 378
Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment Poster Session 2
Ziyao Wang ⋅ Maonan Wang ⋅ Yucheng He ⋅ Xianping Ma ⋅ Ziyi Wang ⋅ Hongyang Zhang ⋅ Yirong Chen ⋅ Man On Pun
Computational Imaging, Medical & Scientific Vision ExHall # 377
Towards Reliable Multi-Label Classification via Conditional Dependency Modeling Poster Session 2
Arkapal Panda ⋅ Aditya Shankar Pal ⋅ Utpal Garain
Computational Imaging, Medical & Scientific Vision ExHall # 376
Beyond the Embedding Bottleneck: Adaptive Retrieval-Augmented 3D CT Report Generation Poster Session 2
Renjie Liang ⋅ Yiling Ma ⋅ Yang Xing ⋅ Zhengkang Fan ⋅ Chengkun Sun ⋅ Jinqian Pan ⋅ Li Li ⋅ Kuang Gong ⋅ Jie Xu
Computational Imaging, Medical & Scientific Vision ExHall # 375
EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation Poster Session 2
Yinrui Ren ⋅ Jinjing Zhu ⋅ Kanghao Chen ⋅ Zhuoxiao Li ⋅ Jing OU ⋅ Zidong Cao ⋅ Tongyan Hua ⋅ Peilun Shi ⋅ Yingchun Fu ⋅ Wufan Zhao ⋅ Hui Xiong
Computational Imaging, Medical & Scientific Vision ExHall # 374
Physics-Guided Deep Learning for Linear Mueller Matrix Acquisition Poster Session 2
Yuan Liang ⋅ Shaoli Liu ⋅ Jiachun Huang
Computational Imaging, Medical & Scientific Vision ExHall # 373
RobustRDP: Advancing Reaction Diagram Parsing via Synthetic-to-Real Data Scaling and Robustness-Oriented Training Poster Session 2
Jianting Tang ⋅ zezhong wu ⋅ Linli Xu
Computational Imaging, Medical & Scientific Vision ExHall # 371
Gaussian Volumetric Representation for Efficient Shear–Warp Visualization Poster Session 2
Mayuri Mathur ⋅ Ojaswa Sharma
Computational Imaging, Medical & Scientific Vision ExHall # 370
Integrated Forward–Inverse Network for Reconstruction for Lensless Image Reconstruction Poster Session 2
Donggeon Bae ⋅ Jaewoo Jung ⋅ Yong Guk Kang ⋅ Kyung Chul Lee ⋅ Taeyoung Kim ⋅ Jongho Kim ⋅ Sangjun Byun ⋅ Joonsik Park ⋅ Seung Ah Lee
Computational Imaging, Medical & Scientific Vision ExHall # 369
REVA-PO: Stabilizing Reinforcement Learning for Chest X-ray Report Generation Poster Session 2
Li Guo ⋅ Anas Tahir ⋅ Z. Jane Wang
Computational Imaging, Medical & Scientific Vision ExHall # 367
Fast and Accurate Image Restoration with Rank Enhanced Linear Attention Poster Session 2
Yuang Ai
Computational Imaging, Medical & Scientific Vision ExHall # 366
PolarAPP: Beyond Polarization Demosaicking for Polarimetric Applications Poster Session 2
Yidong Luo ⋅ Chenggong Li ⋅ Yunfeng Song ⋅ Ping Wang ⋅ Boxin Shi ⋅ Junchao Zhang ⋅ Xin Yuan
Computational Imaging, Medical & Scientific Vision ExHall # 365
DualResPS: Dual-Resolution Photometric Stereo Using a Frame-Event Hybrid Camera Poster Session 2
Haotian Zhuang ⋅ Bohan Yu ⋅ Zhuofeng Wang ⋅ Boxin Shi
Computational Imaging, Medical & Scientific Vision ExHall # 364
Urban Boundaries, Social Barriers: A Benchmark and Vision-Centric Framework for Mapping Gated Communities and Equity Implications Poster Session 2
Minwei Zhao ⋅ WEIMING ZHANG ⋅ Jiawang DU ⋅ Qiming LIU ⋅ Weiming Zhuang ⋅ Pei Nie ⋅ Cai Wu
Computational Imaging, Medical & Scientific Vision ExHall # 362
SurvMILKD: A Weakly Supervised Survival Analysis Framework for Multi-Teacher Knowledge Distillation using Pathology Foundation Models Poster Session 2
Mayur Mallya ⋅ Ali Khajegili Mirabadi ⋅ Hossein Farahani ⋅ Ali Bashashati
Computational Imaging, Medical & Scientific Vision ExHall # 361
Beyond Random Sampling: Distribution-Aware Alignment for Semi-Supervised Medical Image Segmentation Poster Session 2
Weihao Yan ⋅ Yeqiang Qian ⋅ Yi Dong ⋅ Ming Yang
Computational Imaging, Medical & Scientific Vision ExHall # 360
EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography Poster Session 2
Darya Taratynova ⋅ Ahmed Aly ⋅ Numan Saeed ⋅ Mohammad Yaqub
Computational Imaging, Medical & Scientific Vision ExHall # 358
From Reconstruction to Decision: A Post-Encoder Plug-in Adapter for Curvilinear Segmentation Poster Session 2
Qin Lei ⋅ Jiang Zhong ⋅ Xin Xiao ⋅ ymyang ymyang ⋅ Hao Wu
Computational Imaging, Medical & Scientific Vision ExHall # 357
Task-driven Processing with Coarse-to-Fine Glimpse-based Active Perception Poster Session 2
Oleh Kolner ⋅ Thomas Ortner ⋅ Stanislaw Wozniak ⋅ Angeliki Pantazi
Computational Imaging, Medical & Scientific Vision ExHall # 356
SVI360: Spherical Video Interpolation Poster Session 2
Le Kim NGUYEN ⋅ Renato Martins ⋅ Pascal Vasseur ⋅ Cedric Demonceaux
Computational Imaging, Medical & Scientific Vision ExHall # 355
MCPNet:Masked Coordinate Pooling-based Attention Network for Medical Landmark Detection Poster Session 2
Gyu-Sung Ham ⋅ Gi Hyun Lim ⋅ Kanghan Oh
Computational Imaging, Medical & Scientific Vision ExHall # 353
LumiDepth: Stable Monocular Depth in Multi-Illumination Scenes Poster Session 2
Anqi Cheng ⋅ Zhiyuan Yang ⋅ Tianjiao Li ⋅ Haiyue Zhu ⋅ Kezhi Mao
Computational Imaging, Medical & Scientific Vision ExHall # 352
Bayesian Self-Attention with Local Pixel Correlations for Lightweight Denoising Transformers Poster Session 2
Runyang He ⋅ Zuowei Shen ⋅ Hui JI
Computational Imaging, Medical & Scientific Vision ExHall # 351
Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation Poster Session 2
Sunggu Kyung ⋅ Jinyoung Seo ⋅ Hyunseok Lim ⋅ Dongyeong Kim ⋅ Hyungbin Park ⋅ Jimin Sung ⋅ Wooyoung Jo ⋅ Yoojin Nam ⋅ Namkug Kim
Computational Imaging, Medical & Scientific Vision ExHall # 350
SPHERE: From MRI Sampling Mechanisms to Spatial Priors for Generalizable Brain Tumor Segmentation Poster Session 2
JiaCheng Lu ⋅ Shiyu Zhang ⋅ Hui Ding ⋅ junhui xin ⋅ Guoping Huo
Computational Imaging, Medical & Scientific Vision ExHall # 349
Seeing What Matters: Lesion-Aware High-Resolution Patch Discovery and Fusion for Chest X-ray Report Generation Poster Session 2
Yingshu Li ⋅ YUNYI LIU ⋅ Zhenghao Chen ⋅ Tong Chen ⋅ Zailong Chen ⋅ Lingqiao Liu ⋅ Lei Wang ⋅ Luping Zhou
Computational Imaging, Medical & Scientific Vision ExHall # 348
Reconstructing Dense Depth of Dark Scenes with Sparse LiDAR, Noisy Events, and Blurry RGB Poster Session 2
Jianbo Cao ⋅ Yuqi Han ⋅ Siming Zheng ⋅ Bo Wang ⋅ Tong Guo ⋅ Jinli Suo
Computational Imaging, Medical & Scientific Vision ExHall # 346
MedRepBench: Benchmarking Structured Understanding of Medical Report Images Poster Session 2
Fangxin Shang ⋅ Yuan Xia ⋅ Dalu Yang ⋅ Yahui Wang ⋅ BingLinYang BingLinYang
Computational Imaging, Medical & Scientific Vision ExHall # 344
REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception Poster Session 2
Vincenzo Polizzi ⋅ David Lindell ⋅ Jonathan Kelly
Computational Imaging, Medical & Scientific Vision ExHall # 343
2D Features Are All You Need for 3D Shape Understanding Poster Session 2
Jinfan Zhou ⋅ Richard Liu ⋅ Itai Lang ⋅ Rana Hanocka
Computational Imaging, Medical & Scientific Vision ExHall # 342
TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging Poster Session 2
Guangyu Meng ⋅ Pengfei Gu ⋅ Xueyang Li ⋅ Yiyu Shi ⋅ Erin Chambers ⋅ Danny Chen
Computational Imaging, Medical & Scientific Vision ExHall # 341
CLDefocus: Physically Grounded Compound-Lens Defocus Blur Synthesis Poster Session 2
Yunkyu Lee ⋅ Woohyeok Kim ⋅ Sunghyun Cho
Computational Imaging, Medical & Scientific Vision ExHall # 340
HSFM: Hard-Set-Guided Feature-Space Meta-Learning for Robust Classification under Spurious Correlations Poster Session 2
Aryan Yazdan Parast ⋅ Khawar Islam ⋅ Soyoun Won ⋅ Basim Azam ⋅ NAVEED AKHTAR
Computational Imaging, Medical & Scientific Vision ExHall # 339
HybridSim: A Physics–Learning Hybrid Digital Twin for mmWave Human Sensing Poster Session 2
Weitao Xiong ⋅ Tianyu Liu ⋅ Peng Li ⋅ KOK CHUNG CHUA ⋅ Chean Khim Toa ⋅ Pu Wang ⋅ Hongfei Xue
Computational Imaging, Medical & Scientific Vision ExHall # 338
Zero-shot Depth from Defocus Poster Session 2
Yiming Zuo ⋅ Hongyu Wen ⋅ Venkat Subramanian ⋅ Patrick Chen ⋅ Karhan Kayan ⋅ Mario Bijelic ⋅ Felix Heide ⋅ Jia Deng
Computational Imaging, Medical & Scientific Vision ExHall # 337
Finding Highlight Images In Your Albums:From Benchmark To MLLM Poster Session 2
Rong Qin ⋅ Congcong Sun ⋅ Yaopeng Dong ⋅ Yanbin Sun ⋅ Chensen Ding ⋅ Chenxi Zhao ⋅ Biao Wang ⋅ Qian Zhang ⋅ Eunil Park ⋅ Chi Man VONG ⋅ Jufeng Yang
Computational Imaging, Medical & Scientific Vision ExHall # 336
MOOZY: A Patient-First Foundation Model for Computational Pathology Poster Session 2
Yousef Hassan ⋅ Vincent Quoc-Huy Trinh ⋅ Christopher Pal ⋅ Mahdi S. Hosseini
Computational Imaging, Medical & Scientific Vision ExHall # 334
Proximity-Constrained Counterfactual Decoding for Hallucination-Robust Medical VQA Poster Session 2
Dwarikanath Mahapatra ⋅ Abhijit Das ⋅ Manish Pandey ⋅ Joy Dhar ⋅ Sudipta Roy ⋅ Zongyuan Ge ⋅ Behzad Bozorgtabar ⋅ Imran Razzak
Computational Imaging, Medical & Scientific Vision ExHall # 333
G-ZAP: A Generalizable Zero-Shot Framework for Arbitrary-Scale Pansharpening Poster Session 2
Zhiqi Yang ⋅ Shan Yin ⋅ Jingze Liang ⋅ Liang-Jian Deng
Computational Imaging, Medical & Scientific Vision ExHall # 332
MorphJEPA: Morphology-Aware Latent Prediction for Hyperspectral Images Poster Session 2
Amartya Ray ⋅ Tanmay Mandaliya ⋅ Muhammad Haris Khan ⋅ Biplab Banerjee
Computational Imaging, Medical & Scientific Vision ExHall # 331
Multi-Block-Attention-based Color Constancy Poster Session 2
Oguzhan Ulucan ⋅ Diclehan Ulucan ⋅ Marc Ebner
Computational Imaging, Medical & Scientific Vision ExHall # 330
WARP: Wide Attention with Rich Projections for Image Super-Resolution Poster Session 2
Jiwon Kim ⋅ Kyoung Mu Lee
Computational Imaging, Medical & Scientific Vision ExHall # 329
SFDATrack: Generalized Source-Free Domain Adaptive Tracking Under Adverse Weather Conditions Poster Session 2
Siyuan Yao ⋅ Ziqi Wang ⋅ Junqi Huang ⋅ Ruiqi Yu ⋅ Wenqi Ren ⋅ Xiaochun Cao
Computational Imaging, Medical & Scientific Vision ExHall # 328
MoCA3D: Monocular 3D Bounding Box Prediction in the Image Plane Poster Session 2
Changwoo Jeon ⋅ Rishi Upadhyay ⋅ Achuta Kadambi
Computational Imaging, Medical & Scientific Vision ExHall # 327
LineGraph2Road: Structural Graph Reasoning on Line Graphs for Road Network Extraction Poster Session 2
Zhengyang Wei ⋅ Renzhi Jing ⋅ Yiyi He ⋅ Jenny Suckale
Computational Imaging, Medical & Scientific Vision ExHall # 326
CLARITY: Medical World Model for Guiding Treatment Decisions by Simulating Context-Aware Disease Trajectories in Latent Space Poster Session 2
Tianxingjian Ding ⋅ Yuanhao Zou ⋅ Chen Chen ⋅ Shah Mubarak ⋅ Yu Tian
Computational Imaging, Medical & Scientific Vision ExHall # 324
Event-based Sparse-view Background-Oriented Schlieren Tomography Poster Session 2
Xinyu Zhou ⋅ Shihao Hu ⋅ Peiqi Duan ⋅ Chao Xu ⋅ Boxin Shi
Computational Imaging, Medical & Scientific Vision ExHall # 323
Score-Based Matching with Target Guidance for Cryo-EM Denoising Poster Session 2
Xiaoqi Wu ⋅ Xueying Zhan ⋅ Wen Li ⋅ Junhao Wu ⋅ Xin Huang ⋅ Ke Ni ⋅ Min Xu
Computational Imaging, Medical & Scientific Vision ExHall # 322
Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs Poster Session 2
Huan Zheng ⋅ Yucheng Zhou ⋅ Tianyi Yan ⋅ Dubing Chen ⋅ Hongbo Lu ⋅ Wenlong Liao ⋅ Tao He ⋅ Pai Peng ⋅ Shen Jianbing
Computational Imaging, Medical & Scientific Vision ExHall # 321
340 FPS Reflection-free Video from Spikes Modulated by a Rapidly Rotating Polarizer Poster Session 2
Lishuai Huang ⋅ Yeliduosi Xiaokaiti ⋅ Youwei Lyu ⋅ Langyue Chang ⋅ Boxin Shi ⋅ Shikui Wei ⋅ Yao Zhao ⋅ Meng Jian ⋅ Yashen Wang ⋅ Yakun Chang
Computational Imaging, Medical & Scientific Vision ExHall # 320
When the Teacher Has More Bits: Self-Teacher Latent Distillation for Learned Image Compression Poster Session 2
Abdellah Mennaoui ⋅ Joseph Meehan ⋅ Jean-Luc Dugelay ⋅ Ghalia Hemrit
Computational Imaging, Medical & Scientific Vision ExHall # 319
From Minimal Clinical Prompts to 3D: Spacing-Aware Prompt Propagation for Multimodal Prostate Lesion Segmentation in bpMRI Poster Session 2
Jiacheng Wang ⋅ Heinrich von Busch ⋅ Robert Grimm ⋅ Ipek Oguz ⋅ Dorin Comaniciu ⋅ Ali Kamen ⋅ Bin Lou
Computational Imaging, Medical & Scientific Vision ExHall # 318
Implicit Neural Representation for Spherical Harmonics Reconstruction of Motion-Corrupted Fetal Diffusion MRI Poster Session 2
Wenxuan Wu ⋅ Irina Grigorescu ⋅ Ruowen Qu ⋅ Jo Hajnal ⋅ J-Donald Tournier ⋅ Maria Deprez
Computational Imaging, Medical & Scientific Vision ExHall # 317
Ice Cloud Geometry Retrieval with Calibrated Uncertainty from Passive Satellite Imagery Poster Session 2
Ayush Prasad
Computational Imaging, Medical & Scientific Vision ExHall # 316
Physics-Grounded Disentangled Flow Modeling for Brain Disease Progression Trajectory Poster Session 2
Jun Wang ⋅ Peirong Liu
Computational Imaging, Medical & Scientific Vision ExHall # 315
Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives Poster Session 2
Yuhao Shen ⋅ Jiahe Qian ⋅ Zhangtianyi Chen ⋅ Juexiao Zhou
Computational Imaging, Medical & Scientific Vision ExHall # 314
SDUM: A Scalable Deep Unrolled Model for Universal Cardiac MRI Reconstruction Poster Session 2
Puyang Wang ⋅ Pengfei Guo ⋅ Keyi Chai ⋅ Jinyuan Zhou ⋅ Daguang Xu ⋅ Shanshan Jiang
Computational Imaging, Medical & Scientific Vision ExHall # 313
Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation Poster Session 2
Niclas Popp ⋅ Kevin Laube ⋅ Matthias Hein ⋅ Lukas Schott
Computational Imaging, Medical & Scientific Vision ExHall # 312
Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies Poster Session 2
Yuxiang Feng ⋅ Juncheng Wang ⋅ Chao Xu ⋅ Wenlong Hou ⋅ Huihan Wang ⋅ Yijie Qian ⋅ Yang Liu ⋅ Baigui Sun ⋅ Yong Liu ⋅ Shujun Wang
Computational Imaging, Medical & Scientific Vision ExHall # 311
From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology Poster Session 2
Basit Alawode ⋅ Moshira Abdalla ⋅ Dwarikanath Mahapatra ⋅ Muhammad Muzammal Naseer ⋅ Sajid Javed
Computational Imaging, Medical & Scientific Vision ExHall # 310
Φeat: Physically-Grounded Material Feature Representation Poster Session 2
Giuseppe Vecchio ⋅ Adrien Kaiser ⋅ Claudia Cuttano ⋅ ROUFFET Romain ⋅ Rosalie MARTIN ⋅ Elena Garces ⋅ Tamy Boubekeur
Computational Imaging, Medical & Scientific Vision ExHall # 309
Foundation-Guided Representation Alignment for Multimodal Medical Image Registration Poster Session 2
Mengjie Guo ⋅ Xinxing Cheng ⋅ Wenqi Lu ⋅ Qingjie Meng ⋅ Guanyu Yang ⋅ Yang Chen ⋅ Ziyun Ding ⋅ Alejandro Frangi ⋅ Jinming Duan
Computational Imaging, Medical & Scientific Vision ExHall # 308
MedCAGD: Context-Aware Gated Decoder for Robust Medical Image Segmentation Poster Session 2
Saad Wazir ⋅ Patrick Vibild ⋅ Dinh Tran ⋅ Seongah Kim ⋅ Daeyoung Kim
Computational Imaging, Medical & Scientific Vision ExHall # 307
Pol-CACTI: A System and dataset forHigh-Speed Polarized Video Compressive Imaging Poster Session 2
Yunfeng Song ⋅ Yidong Luo ⋅ Ping Wang ⋅ xingjian jiang ⋅ Xin Yuan
Computational Imaging, Medical & Scientific Vision ExHall # 306
UniH3: Unifying Hierarchical Homogeneity and Heterogeneity for All-in-One Medical Image Restoration Poster Session 2
Zhiwen Yang ⋅ Jiayin Li ⋅ Chengyu Liu ⋅ Hui Zhang ⋅ Bingzheng Wei ⋅ Yan Xu
Computational Imaging, Medical & Scientific Vision ExHall # 305
Semantic-Anchored Evidential Fusion for Domain-Robust Whole-Slide Survival Analysis Poster Session 2
YUCHENG XING XING ⋅ Ling Huang ⋅ Pei Liu ⋅ Jingying Ma ⋅ Jiaxing Xu ⋅ Kai He ⋅ Mengling Feng
Computational Imaging, Medical & Scientific Vision ExHall # 304
Multi-Channel Uncertainty-Weighted Score Matching for Conditional Diffusion in Medical UDA Poster Session 2
CHEN LI ⋅ Meilong Xu ⋅ Xiaoling Hu ⋅ Weimin Lyu ⋅ Chao Chen
Computational Imaging, Medical & Scientific Vision ExHall # 303
Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling Poster Session 2
Yang Zhao ⋅ Peisong Niu ⋅ Tian Zhou ⋅ Ziqing Ma ⋅ Guanlong Ma ⋅ Rong Jin ⋅ Huiling Yuan ⋅ Liang Sun
Computational Imaging, Medical & Scientific Vision ExHall # 302
XPos3R: Cross-Modal Transformer for Intraoperative 2D/3D Registration Poster Session 2
Shiyan Su ⋅ Ruyi Zha ⋅ HONGDONG LI ⋅ Xuelian Cheng ⋅ Zongyuan Ge
Computational Imaging, Medical & Scientific Vision ExHall # 301
Dual-Output Multi-Exposure HDR Reconstruction via SDR Fusion and Gain Map Inverse Tone Mapping Poster Session 2
Jinho Kim ⋅ Jinwoo Kim ⋅ Seon Joo Kim
Computational Imaging, Medical & Scientific Vision ExHall # 300
EvDiff: High Quality Video with an Event Camera Poster Session 2
Weilun Li ⋅ Lei Sun ⋅ Ruixi Gao ⋅ Qi Jiang ⋅ Yuqin Ma ⋅ Kaiwei Wang ⋅ Ming-Hsuan Yang ⋅ Luc Van Gool ⋅ Danda Paudel
Computational Imaging, Medical & Scientific Vision ExHall # 299
LIIFusion: Coarse-to-fine Framework for Generative MEF via Implicit Neural Representation Poster Session 2
Sangmin Han ⋅ Jinho Kim ⋅ Jinwoo Kim ⋅ Dongyoung Kim ⋅ Seon Joo Kim
Computational Imaging, Medical & Scientific Vision ExHall # 298
DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data Poster Session 2
Bartosz Stachowiak ⋅ Dariusz Brzezinski
Computational Imaging, Medical & Scientific Vision ExHall # 297
CUST : Clustered Unit-level Similarity Transformer for Lightweight Image Super-Resolution Poster Session 2
Jeongsoo Kim
Computational Imaging, Medical & Scientific Vision ExHall # 296
Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation Poster Session 2
Haoyun Chen ⋅ Fenghe Tang ⋅ Wenxin Ma ⋅ S Kevin Zhou
Computational Imaging, Medical & Scientific Vision ExHall # 295
NGPS: Structure-Preserving Self-Supervised Denoising via Neighbor-Guided Patch Sampling Poster Session 2
Jaehyun Cho ⋅ YOUNGJOON YOO
Computational Imaging, Medical & Scientific Vision ExHall # 294
2K Retrofit: Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction Poster Session 2
Tianbao Zhang ⋅ Zhenyu Liang ⋅ Zhenbo Song ⋅ Nana Wang ⋅ Xiaomei Zhang ⋅ Xudong Cai ⋅ Zheng Zhu ⋅ Kejian Wu ⋅ Gang Wang ⋅ Zhaoxin Fan
Computational Imaging, Medical & Scientific Vision ExHall # 292
Learn to See the Unseen in Low-light Spike Streams Poster Session 2
Liwen Hu ⋅ Yang Li ⋅ Mianzhi Liu ⋅ Guo Yijia ⋅ Shenghao Xie ⋅ Wenqiang Zu ⋅ gang ding ⋅ Tiejun Huang ⋅ Lei Ma
Computational Imaging, Medical & Scientific Vision ExHall # 291
TopoGAT: Plug-and-Play Topological Graph Attention for Fine-Grained 3D Segmentation Poster Session 2
Xinyu Jiang ⋅ Lech Szymanski ⋅ Steven Mills
Computational Imaging, Medical & Scientific Vision ExHall # 290
RainODE: Continuous-Time Precipitation Forecasting with Latent Neural ODEs Poster Session 2
Yeeun Seong ⋅ Doyi Kim ⋅ Minseok Seo ⋅ Changick Kim
Computational Imaging, Medical & Scientific Vision ExHall # 289
RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement Poster Session 2
Jiyao Wang ⋅ Qingyong Hu ⋅ Duoxun Tang ⋅ Xiao Yang ⋅ Kaishun Wu ⋅ Jiangbo Yu
Computational Imaging, Medical & Scientific Vision ExHall # 288
Masked BRep Autoencoder via Hierarchical Graph Transformer Poster Session 2
Yifei Li ⋅ Kang Wu ⋅ Wenming Wu ⋅ Xiao-Ming Fu
Computational Imaging, Medical & Scientific Vision ExHall # 287
STARLINC: Satellite Trail Artifact Removal using Inter-Frame Correlation Poster Session 2
Shingeon Kim ⋅ Hyeyoon Lee ⋅ Dain Kwon ⋅ Kanghyun Choi ⋅ SunJong Park ⋅ Mi-Ryang Kim ⋅ Jeong-Eun Lee ⋅ Jinho Lee
Computational Imaging, Medical & Scientific Vision ExHall # 285
MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images Poster Session 2
Qinyue Tong ⋅ Ziqian Lu ⋅ Jun Liu ⋅ Rui Zuo ⋅ Zheming Lu ⋅ Yueming Jin
Computational Imaging, Medical & Scientific Vision ExHall # 283
Hyper-Network Neural Functional Maps for Unsupervised Robust 3D Shape Matching Poster Session 2
Dongliang Cao ⋅ Florian Bernard
Computational Imaging, Medical & Scientific Vision ExHall # 282
Quantile‑Adaptive Temperature Scaling for Confidence Calibration Poster Session 2
Omprakash Chakraborty ⋅ Leo Fillioux ⋅ Ismail Ayed ⋅ Jose Dolz
Computational Imaging, Medical & Scientific Vision ExHall # 281
Fidelity- and Perception-Aware Local Implicit Attention for Arbitrary-Scale Image Super-Resolution Poster Session 2
Yu-Syuan Xu ⋅ Hao-Lun Sun ⋅ Hao-Wei Chen ⋅ Hsien-Kai Kuo ⋅ Chun-Yi Lee
Computational Imaging, Medical & Scientific Vision ExHall # 279
FreqPhys: Repurposing Implicit Physiological Frequency Prior for Robust Remote Photoplethysmography Poster Session 2
Wei Qian ⋅ Dan Guo ⋅ Jinxing Zhou ⋅ Bochao Zou ⋅ Zitong Yu ⋅ Meng Wang
Computational Imaging, Medical & Scientific Vision ExHall # 278
FlexiBrain: Resolution-Agnostic Voxel-Level Encoding for Native fMRI Poster Session 2
mo wang ⋅ Wenhao Ye ⋅ Junfeng Xia ⋅ Minghao Xu ⋅ Hongkai Wen ⋅ Quanying Liu
Computational Imaging, Medical & Scientific Vision ExHall # 277
Scaling Whole-Slide Pathology Foundation Model Pretraining with Billions Off-the-Shelf Tokens Poster Session 2
Honglin Li ⋅ Zhongyi Shui ⋅ Chenglu Zhu ⋅ Lin Yang
Computational Imaging, Medical & Scientific Vision ExHall # 276
RePer-360: Releasing Perspective Priors for 360° Depth Estimation via Self-Modulation Poster Session 2
Cheng Guan ⋅ Chunyu Lin ⋅ Zhijie Shen ⋅ Junsong Zhang ⋅ Jiyuan Wang
Computational Imaging, Medical & Scientific Vision ExHall # 275
VesselTok: Tokenizing Vessel-like 3D Biomedical Graph Representations for Reconstruction and Generation Poster Session 2
Chinmay Prabhakar ⋅ Bastian Wittmann ⋅ Tamaz Amiranashvili ⋅ Paul Büschl ⋅ Ezequiel De la Rosa ⋅ Julian McGinnis ⋅ Benedikt Wiestler ⋅ Bjoern Menze ⋅ Suprosanna Shit
Computational Imaging, Medical & Scientific Vision ExHall # 274
DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution Poster Session 2
Yoonseok Choi ⋅ Eun-Gyu Ha ⋅ Daniel Kim ⋅ Mohammed Al-masni ⋅ Ming-Hsuan Yang ⋅ Dong-Hyun Kim
Computational Imaging, Medical & Scientific Vision ExHall # 273
MedSynapse-V: Bridging Visual Perception and Clinical Intuition via Latent Memory Evolution Poster Session 2
Chunzheng Zhu ⋅ Jiaqi Zeng ⋅ Junyu Jiang ⋅ Jianxin Lin ⋅ Yijun Wang
Computational Imaging, Medical & Scientific Vision ExHall # 272
Dual-Prior Guided Null-Space Learning with Mixture-of-Splines for Arbitrary Medical Slice Super-Resolution Poster Session 2
Haofei Song ⋅ Siyuan Xu ⋅ Xintian Mao ⋅ ShaoJie Guo ⋅ Qingli Li ⋅ Yan Wang
Computational Imaging, Medical & Scientific Vision ExHall # 271
Hybrid Event–Frame Sensors: Modeling, Calibration, and Simulation Poster Session 2
yunfan lu ⋅ Nico Messikommer ⋅ Xiaogang Xu ⋅ Liming Chen ⋅ Yuhan Chen ⋅ Nikola Zubic ⋅ Davide Scaramuzza ⋅ Hui Xiong
Computational Imaging, Medical & Scientific Vision ExHall # 270
EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics Poster Session 2
Jiayu Chen ⋅ Hengyi Zhang ⋅ Maoliang Li ⋅ Minyu Li ⋅ Zihao Zheng ⋅ Xuanzhe Liu ⋅ Guojie Luo ⋅ Xiang Chen
Computational Imaging, Medical & Scientific Vision ExHall # 269
Kiroshi: An Agentic Perception System for High-Accuracy Image Parsing Poster Session 2
Haipeng ZHOU ⋅ Jinshan Liu ⋅ He Zhang ⋅ Xuequan Lu ⋅ Jun Ma ⋅ Lei Zhu
Computational Imaging, Medical & Scientific Vision ExHall # 268
MArFE: Multi-Contrast MRI Arbitrary Scale Super-Resolution with Fourier Enhancement Poster Session 2
ZHIWEN SHI
Computational Imaging, Medical & Scientific Vision ExHall # 267
SeekFlow: Synergizing Radiology and Pathology Foundation Models for Precision Oncology via Knowledge-Guided Evidence Flow Poster Session 2
Peixiang Huang ⋅ Yanyan Huang ⋅ Yihang Chen ⋅ Maximus Yeung ⋅ Yuming Jiang ⋅ Lequan Yu
Computational Imaging, Medical & Scientific Vision ExHall # 266
MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations Poster Session 2
Jiyao Liu ⋅ Junzhi Ning ⋅ Chenglong Ma ⋅ Wanying Qu ⋅ Jianghan Shen ⋅ Siqi Luo ⋅ Jinjie Wei ⋅ Jin Ye ⋅ Pengze Li ⋅ Tianbin Li ⋅ Jiashi Lin ⋅ Hongming Shan ⋅ Xinzhe Luo ⋅ Xiaohong Liu ⋅ Lihao Liu ⋅ Junjun He ⋅ Ningsheng Xu
Computational Imaging, Medical & Scientific Vision ExHall # 265
Resolution-Agnostic Neural Operators for Multi-Rate Sparse-View CT Poster Session 2
Aujasvit Datta ⋅ Jiayun Wang ⋅ Asad Aali ⋅ Anima Anandkumar
Computational Imaging, Medical & Scientific Vision ExHall # 264
Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts Poster Session 2
Weicheng Dai ⋅ Chenyu Wang ⋅ Shantanu Ghosh ⋅ Kayhan Batmanghelich
Computational Imaging, Medical & Scientific Vision ExHall # 263
Synesthesia via Direct Latent Augmentation: Bypassing the Decode-Encode Loop for Cross-Modal Distillation Poster Session 2
Cristian Sbrolli ⋅ Nicolas Michel ⋅ Matteo Matteucci ⋅ Toshihiko Yamasaki
Computational Imaging, Medical & Scientific Vision ExHall # 262
Neuromorphic X-ray Computed Tomography Poster Session 2
Hongjian Wang ⋅ Goran Lovric ⋅ Benjamín Béjar
Computational Imaging, Medical & Scientific Vision ExHall # 261
Mimicking Radiologists: A Coarse-to-Fine Framework with Structural Sparse Tokens for Dual-LLM Computed Tomography Report Generation Poster Session 2
Hong Liu ⋅ Dong Wei ⋅ Yefeng Zheng ⋅ Xian Wu ⋅ Liansheng Wang
Computational Imaging, Medical & Scientific Vision ExHall # 260
IDeaL: Data-Free Multi-Teacher Distillation via Improved Dead Leaves Poster Session 2
Feyza Yavuz ⋅ Mert Bulent SARIYILDIZ ⋅ Larlus Diane
Computational Imaging, Medical & Scientific Vision ExHall # 259
Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation Poster Session 2
Lingrui Li ⋅ Nan Pu ⋅ Dong Zhao ⋅ Wenjing Li ⋅ Andrew French ⋅ Xin Chen ⋅ Zhun Zhong
Computational Imaging, Medical & Scientific Vision ExHall # 258
AlphaRad: Grounded Zero-Shot Classification in Chest Radiology via α-Corrected Binary Cross Entropy and Factorized Latent Supervision Poster Session 2
Jianzhong You ⋅ Yuan Gao ⋅ Chris Mcintosh
Computational Imaging, Medical & Scientific Vision ExHall # 257
WAFT-Stereo: Warping-Alone Field Transforms for Stereo Matching Poster Session 2
Yihan Wang ⋅ Jia Deng
Computational Imaging, Medical & Scientific Vision ExHall # 255
ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion Poster Session 2
Lifeng Chen ⋅ tianqi you ⋅ Hao Liu ⋅ Zhimin Bao ⋅ Jile Jiao ⋅ Xiao Han ⋅ Zhicai Ou ⋅ Tao Sun ⋅ Mou XiaoFeng ⋅ Xiaojie Jin ⋅ Yi Xu
Computational Imaging, Medical & Scientific Vision ExHall # 254
Gaussian Belief Propagation Network for Depth Completion Poster Session 2
Jie Tang ⋅ Pingping Xie ⋅ Jian Li ⋅ Ping Tan
Computational Imaging, Medical & Scientific Vision ExHall # 253
From Local Windows to Adaptive Candidates via Individualized Exploratory: Rethinking Attention for Image Super-Resolution Poster Session 2
Chunyu Meng ⋅ Wei Long ⋅ Shuhang Gu
Computational Imaging, Medical & Scientific Vision ExHall # 252
PyraE2E: Enhancing End-to-End WSI Analysis via Cross-Scale Super-Resolution Poster Session 2
Yuechuan Lin ⋅ yujian liu ⋅ Weipeng Zhang ⋅ Yanyu Fan ⋅ Zikang Wang ⋅ Dongxu Shen ⋅ Liqin Fei ⋅ Xiaoli Liu ⋅ Shidang Xu
Computational Imaging, Medical & Scientific Vision ExHall # 250
TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis Poster Session 2
Chaeyeon Lee ⋅ Khang Quoc ⋅ Jinsol Song ⋅ Yosep Chong ⋅ Kwangil Yim ⋅ JIN TAE KWAK
Computational Imaging, Medical & Scientific Vision ExHall # 347
If It's Not Efficient, It's Not Usable: Real-Time OOD Detection with Latent De-Biasing and High-Quality Negative Samples Poster Session 2
Yuchuan Li ⋅ Jae-Mo Kang ⋅ Il-Min Kim
Computational Imaging, Medical & Scientific Vision ExHall # 286
Beyond Isolated Scans: Cross-Phase Alignment of Structure and Topology for 3D Medical Pretraining Poster Session 2
Wenzhuo xu ⋅ YANJIE ZHOU ⋅ Yujian Hu ⋅ Hongkun Zhang ⋅ Minfeng Xu
Computational Imaging, Medical & Scientific Vision ExHall # 368
Keep Your Friends Close, and the Right Neighbours Closer: Disaster-Conditioned Kernel-Regularized Graph Attention for Building Damage Classification Poster Session 2
Fuad Hasan ⋅ Chul Min Yeum
Computational Imaging, Medical & Scientific Vision ExHall # 359
The Devil Is in the Dark Pixels: Toward Brightness Bias-Robust Denoising Poster Session 1
Sungjun Cho ⋅ Zhuangzhuang Chen ⋅ Xiaomeng Li
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 52
Generalized Biomedicine Discovery Poster Session 1
Luyao Tang ⋅ Yingkai Yang ⋅ Hanqi Chen ⋅ Jiewei Zheng ⋅ Chaoqi Chen ⋅ Cheng Chen
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 35
BLASt3R: Bundle Adjustment of Any Image Set with Multi-View Matching and Monocular priors Poster Session 1
Vincent Leroy ⋅ Philippe Weinzaepfel ⋅ Lojze Zust ⋅ Yohann Cabon ⋅ Jerome Revaud
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 9
Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus Enhancement Poster Session 1
Chujie Qin ⋅ Zilong Zhang ⋅ Zewei Chang ⋅ Chun-Le Guo ⋅ Ruixing Wang ⋅ Tao Hu ⋅ Ming-Ming Cheng ⋅ Chongyi Li
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 44
The 3D Mirage: Probing and Taming 3D Hallucinations Poster Session 1
Hoang Nguyen ⋅ Xiaohao Xu ⋅ Xiaonan Huang
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 84
Learning Ego-Centric BEV Representations from a Perspective-Privileged View: Cross-View Supervision for Online HD Map Construction Poster Session 1
Daniel Lengerer ⋅ Mathias Pechinger ⋅ Klaus Bogenberger ⋅ Carsten Markgraf
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 83
Tricam-rPPG: A Multimodal Multispectral Dataset for remote Photoplethysmography Poster Session 1
Abhijit Sarkar ⋅ Surendrabikram Thapa ⋅ Ishtiaque Ahmed Khan ⋅ Yogesh Deshpande ⋅ Amos Abbott
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 82
SONIC: Spectral Optimization of Noise for Inpainting with Consistency Poster Session 1
Seungyeon Baek ⋅ Erqun Dong ⋅ Shadan Namazifard ⋅ Mark J Matthews ⋅ Kwang Moo Yi
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 81
CrossFeat: Bridging Imaging Modalities in Feature Descriptor Space Poster Session 1
Paul Schneider ⋅ Nazim Haouchine
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 80
Partial Skeleton Visibility for Action Recognition: A Constrained Field-of-View Approach Poster Session 1
Yingjie Dai ⋅ Tianyang Xu ⋅ Yanglin Deng ⋅ Xiao-Jun Wu ⋅ Josef Kittler
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 79
Cross-View Yaw Estimation in Location Uncertainty with Line-Aligning Yaw Scoring Poster Session 1
Taeho Kang ⋅ Nairan Zhang ⋅ Yelin Kim ⋅ Yujiao Shi ⋅ Youngki Lee
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 78
PixVOD: Pixel-Distributed Direct Visual Odometry and Depth Estimation Poster Session 1
Shinjeong Kim ⋅ Ignacio Alzugaray ⋅ Callum Rhodes ⋅ Paul Kelly ⋅ Andrew Davison
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 77
WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation Poster Session 1
Muhammad Aamir ⋅ Naoya Muramatsu ⋅ Sangyun Shin ⋅ Matthew Wijers ⋅ Jia-Xing Zhong ⋅ Xinyu Hou ⋅ Amir Patel ⋅ Andrew Loveridge ⋅ Andrew Markham
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 76
Synthetic Sub-Aperture Phase Augmentation for Demosaicing 2×2 Shared Microlens Sensors Poster Session 1
Jeisung Lee ⋅ Wonil Song
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 75
Boosting 6D Object Pose Estimation via Monocular Depth Cues Poster Session 1
Fengda Hao ⋅ Rui Song ⋅ Qingyuan Wang ⋅ Jiaojiao Li ⋅ Zhiyong Hu ⋅ David Ferstl ⋅ Yinlin Hu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 74
Pixel-wise Planarity for High-Precision Monocular Plane Segmentation Poster Session 1
Ahmetcan Yavuz ⋅ Alpay Ozkan ⋅ Rémi Pautrat ⋅ Shaohui Liu ⋅ Marc Pollefeys
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 73
SFD-Net: Sharp Feature Detection Network Based on Local Geometric Features Poster Session 1
Inyoung Oh ⋅ Kwanghee Ko
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 72
ESNE: Efficient Surface Normal Estimation for LiDAR Point Clouds with Sequential Modeling and Variability Guidance Poster Session 1
Kohei Matsuzaki ⋅ Keisuke Nonaka
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 71
TriNLOS: Triplane Representations for Neural Non-Line-of-Sight Imaging Poster Session 1
Bonmu Do ⋅ Ji Hyun Nam
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 70
mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis Poster Session 1
Adnan Armouti ⋅ Yixuan Gao ⋅ Rajalakshmi Nandakumar
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 69
Don’t Mask Out the Background! Natural-Light Photometric Stereo via Illumination Reconstruction Poster Session 1
Taiga Hashida ⋅ Hiroaki Santo ⋅ Fumio Okura
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 68
Weather-Conditioned Depth Anything Poster Session 1
Zhaoming Xu ⋅ Chan-Wei Hu ⋅ Kuan-Ru Huang ⋅ Zihao Zhu ⋅ Renjie Li ⋅ Yang Zhou ⋅ Zhengzhong Tu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 67
OmniPoint: Universal Monocular Metric Pointcloud from Any Camera Poster Session 1
Botao Ye ⋅ Marc Pollefeys ⋅ Ming-Hsuan Yang ⋅ Abhijit Kundu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 65
PRISM-VO: Scale-Aware Visual Odometry Using Photometric Plenoptic Bundle Adjustment Poster Session 1
Aymeric Fleith ⋅ Julian Zirbel ⋅ Daniel Cremers ⋅ Niclas Zeller
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 64
Video Can Teach PAN-Sharpening: PSF-Aware Cross-Domain Supervision Poster Session 1
Hyun-Ho Kim ⋅ Munchurl Kim ⋅ Jaehyup Lee
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 63
Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition Poster Session 1
Raza Yunus ⋅ Benjamin Ummenhofer ⋅ Jan Eric Lenssen ⋅ Eddy Ilg
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 62
Semantic Line Diffusion: Character-Consistent Line Art from text-annotated Storyboards Poster Session 1
Seo-Yeon Choi ⋅ Kyungsu Lee
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 61
Geometry-Aware Visual Representation for Remaining Useful Life Prediction Poster Session 1
Hieu Vu ⋅ Thanh Nguyen ⋅ Eyad Elyan
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 60
Mapping Dark-Matter Clusters via Physics-Guided Diffusion Models Poster Session 1
Diego Royo ⋅ Brandon Zhao ⋅ Adolfo Muñoz ⋅ Diego Gutierrez ⋅ Katherine Bouman
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 59
FUSE: Filter-Free Unified Spatiotemporal Estimation of SpO2 via Wave-Transport Modeling Poster Session 1
Shahzad Ahmad ⋅ NUVVURU REDDY ⋅ Ram Padhy ⋅ Sukalpa Chanda ⋅ Umapada Pal
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 57
Asymmetric Anchoring: Opening the Black Box of MLLMs for Forgery Detection Poster Session 1
Zhiqiang Yang ⋅ Renshuai Tao ⋅ Chunjie Zhang ⋅ Zhaoxiang Liu ⋅ Xiaolong Zheng ⋅ Yao Zhao
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 56
CSS-BA: Gate Guided Column Space Search for Bundle Adjustment Poster Session 1
Ayano Kaneda ⋅ Takafumi Taketomi ⋅ Shugo Yamaguchi ⋅ Shigeo Morishima
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 55
AIMold: An Autonomous AI-based Pipeline for Complex Mold Design Poster Session 1
Pengyun Qiu ⋅ Shuo Wang ⋅ Zeyuan Chen ⋅ Yihao Zhi ⋅ Chongjie Ye ⋅ XIAOGUANG HAN
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 54
SOMA: From Surface Observations to Muscle Anatomy Poster Session 1
Eduardo Alvarado ⋅ Emily Kim ⋅ Friedemann Runte ⋅ Gerrit Nolte ⋅ Mario Botsch ⋅ Marc Habermann ⋅ Christian Theobalt
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 53
Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision Poster Session 1
Jinnyeong Kim ⋅ Juhyung Choi ⋅ Woohyeok Kim ⋅ Sunghyun Cho ⋅ Seung-Hwan Baek
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 51
A second-order theory of texture for depth from focus Poster Session 1
Sreekar Ranganathan ⋅ Ioannis Gkioulekas
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 50
Cast and Attached Shadow Detection via Iterative Light and Geometry Reasoning Poster Session 1
Shilin Hu ⋅ Jingyi Xu ⋅ Sagnik Das ⋅ Dimitris Samaras ⋅ Hieu Le
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 49
FlatLands: Generative Floormap Completion From a Single Egocentric View Poster Session 1
Subhransu S. Bhattacharjee ⋅ Dylan Campbell ⋅ Rahul Shome
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 48
FlashBEV: Fast and Memory-Efficient Exact BEV Transformation with IO-Awareness Poster Session 1
Shunsuke Yokokawa ⋅ Hironori Kasahara
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 47
Sticking Information in Plain Sight: Encoding and Detecting Hidden Stickers in the Real World Poster Session 1
Christina Shatford ⋅ Szymon Rusinkiewicz
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 46
FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation Poster Session 1
fengchen he ⋅ Hao Xu ⋅ Dayang Zhao ⋅ Tingwei Quan ⋅ Shaoqun zeng
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 45
SiPhy: Single-Image Physical Property Reasoning Poster Session 1
Hoang Le ⋅ Joonwoo Kwon ⋅ Elkhan Ismayilzada ⋅ Yufei Zhang ⋅ Zijun Cui
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 43
Stable and Scalable Bundle Adjustment of Holistic 3D Structures Poster Session 1
Shaohui Liu ⋅ Rémi Pautrat ⋅ Daniel Barath ⋅ Richard Hartley ⋅ Viktor Larsson ⋅ Marc Pollefeys
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 42
A Mechanism-Driven Theory of Phase Transitions in Active Learning Poster Session 1
Julia Machnio ⋅ Mads Nielsen ⋅ MOSTAFA MEHDIPOUR GHAZI
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 41
λSplit: Self-Supervised Content-Aware Spectral Unmixing for Fluorescence Microscopy Poster Session 1
Federico Carrara ⋅ Mehdi Seifi ⋅ Florian Jug
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 40
Color Pass-Through via Camera-Display Coupling Poster Session 1
Ruikang Li ⋅ Molin Li ⋅ Jiarui Wu ⋅ Zhe Wei ⋅ Pengpeng Liu ⋅ Tianfan Xue
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 39
EventSpecPS: Photometric Stereo with Multispectral Reflectance Using an Event Camera Poster Session 1
Jingqian Wu ⋅ Bohan Yu ⋅ Jun Hoong Chan ⋅ Edmund Lam ⋅ Boxin Shi
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 38
Consistent Monocular Depth Estimation with Contact Region Boundary-Aware Refinement Poster Session 1
Yinuo Wang ⋅ QingMiao QingMiao ⋅ Wangmeng Zuo
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 37
Poppy: Polarization-Based Plug-and-Play Guidance for Enhancing Surface Normal Estimation Poster Session 1
Irene Kim ⋅ Sai Tanmay Reddy Chakkera ⋅ Alexandros Graikos ⋅ Dimitris Samaras ⋅ Akshat Dave
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 36
Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring Poster Session 1
Samira Malek ⋅ Haichuan Zhang ⋅ Chul Lee ⋅ Vishal Monga
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 34
From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation Poster Session 1
Rit Gangopadhyay ⋅ Alex Wong
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 33
DP-BOA: Dirichlet-Process Birth-or-Assign for On-the-Fly Category Discovery Poster Session 1
Peiyan Gu ⋅ Zixin Teng ⋅ Xuming He
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 32
OneHSI: A Unified Hyperspectral Foundation Model with Physical Consistency Poster Session 1
Yufei WEN ⋅ Jingdan KANG ⋅ SHUXIN ZHONG ⋅ Yuting Zhang ⋅ Yutong Feng ⋅ Jintai Chen ⋅ Kaishun Wu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 31
SynLF: Zero-Shot Metric Depth from Light Field Cameras via Physics-Grounded Synthesis Poster Session 1
Zhexuan Cao ⋅ Yuduo Guo ⋅ Peisheng Ding ⋅ Zhan Shi ⋅ Hui Qiao
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 30
Parallax Portrait Matting Poster Session 1
Xin Cai ⋅ Jiawen Chen ⋅ Lars Jebe ⋅ Tianfan Xue ⋅ Zhoutong Zhang
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 29
Video Generative Models as Geometry Learner Poster Session 1
Haosen Yang ⋅ Song Jifei ⋅ Zhensong Zhang ⋅ Xiatian Zhu ⋅ Jiankang Deng
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 28
AiSCREAM: Absolute Target Localization with Language-Conditioned Cross-View Alignment for Autonomous Vehicles Poster Session 1
Kei Katsumata ⋅ Jun Piao ⋅ Naoki Hosomi ⋅ Kentaro Yamada ⋅ Komei Sugiura
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 27
TPCNet: A Low-Light Image Enhancement Network Inspired by Triple Physical Constraints Poster Session 1
Jing-Yi Shi ⋅ Ming-Fei Li ⋅ Ling-An Wu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 26
Under One Sun: Multi-Object Generative Perception of Materials and Illumination Poster Session 1
Nobuo Yoshii ⋅ Xinran (Nicole) Han ⋅ Ryo Kawahara ⋅ Todd Zickler ⋅ Ko Nishino
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 25
ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration Poster Session 1
Qicheng Zhao ⋅ Yu Li ⋅ Qi Sun ⋅ Zheyu Yan
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 24
Physically Grounded Monocular Depth via Nanophotonic Wavefront Encoding Poster Session 1
Bingxuan Li ⋅ Jiahao Wu ⋅ Yuan Xu ⋅ Zezheng Zhu ⋅ Yunxiang Zhang ⋅ Kenneth Chen ⋅ Yanqi Liang ⋅ Nanfang Yu ⋅ Qi Sun
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 23
Broadband Wide Field of View Imaging with Computational Mirrors Poster Session 1
Vishwanath Saragadam ⋅ Niki Nezakati ⋅ Amit Roy-Chowdhury ⋅ Vivek Boominathan
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 22
Learning to Suppress SPAD-based LiDAR Flare Poster Session 1
Xuanya Zhu ⋅ Linghao Shen
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 21
Modeling and Compensating Phase Error in High-speed 3D Reconstruction Poster Session 1
Yuchong Chen ⋅ Jian Yu ⋅ Pengcheng Yao ⋅ Shaoyan Gai ⋅ Feipeng Da
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 20
Filterless Snapshot Hyperspectral Imaging using Guided Patch Diffusion Poster Session 1
Dean Hazineh ⋅ Luca Sacchi ⋅ Davide Cassara ⋅ Federico Capasso ⋅ Todd Zickler
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 19
Any to Full: Prompting Depth Anything for Depth Completion in One Stage Poster Session 1
Zhiyuan Zhou ⋅ Ruofeng Liu ⋅ TAICHI LIU ⋅ Weijian Zuo ⋅ Shanshan Wang ⋅ Zhiqing Hong ⋅ Desheng Zhang
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 18
High-speed Imaging through Turbulence with Event-based Light Fields Poster Session 1
Yu-Hsiang Huang ⋅ Levi Burner ⋅ Sachin Shah ⋅ Ziyuan Qu ⋅ Adithya Pediredla ⋅ Christopher Metzler
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 17
SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification Poster Session 1
Xiaoying Wang ⋅ Yumeng He ⋅ Jingkai Shi ⋅ Jiayin Lu ⋅ Yin Yang ⋅ Ying Jiang ⋅ Chenfanfu Jiang
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 16
Compact Low-Cost Hyperspectral Imaging via Angular-to-Spectral Diversity Conversion Poster Session 1
Kazuma Fujiwara ⋅ Takuya Funatomi ⋅ Kazuya Kitano ⋅ Yuki Fujimura ⋅ Yasuhiro Mukaigawa
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 15
ARC-Loc: Leveraging Azimuthal Ray Convergence as a Geometric Cue for Direct Cross-View Localization Poster Session 1
Hyeongsik Kim ⋅ Mincheol Kim ⋅ Heejoon Moon ⋅ Je Hyeong Hong
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 14
The Prism Hypothesis: Harmonizing Semantic and Pixel Representations via Unified Autoencoding Poster Session 1
Weichen Fan ⋅ Haiwen Diao ⋅ Quan Wang ⋅ Dahua Lin ⋅ Ziwei Liu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 13
Estimating Individual Tree Height and Species from UAV Imagery Poster Session 1
Jannik Endres ⋅ Etienne Laliberté ⋅ David Rolnick ⋅ Arthur Ouaknine
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 11
NeLU3D: Neural Inverse Structured Light without Modeling the Projector Poster Session 1
Giancarlo Pereira ⋅ David Fouhey ⋅ Claudio Silva ⋅ Daniele Panozzo
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 10
Provable and Robust Wavefront Sensing via Self-Reference Interferometry Poster Session 1
Nebiyou Yismaw ⋅ Vishwanath Saragadam ⋅ Aswin C. Sankaranarayanan ⋅ M. Salman Asif
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 8
Stabilizing Deep Reconstruction Operators with Contractive Anchoring Poster Session 1
Arghya Sinha ⋅ Trishit Mukherjee ⋅ Kunal Chaudhury
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 7
WiFlow: Estimating Optical Flow using WiFi Channel State Information Poster Session 1
Thomas Weigel ⋅ Simon Kiefhaber ⋅ Fabian Portner ⋅ Matthias Hollick ⋅ Simone Schaub-Meyer
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 6
Ranked Activation Shift for Post-hoc Out-of-Distribution Detection Poster Session 1
Gianluca Guglielmo ⋅ Marc Masana
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 5
RL-AWB: Deep Reinforcement Learning for Auto White Balance Correction in Low-Light Night-time Scenes Poster Session 1
Yuan-Kang Lee ⋅ Kuan-Lin Chen ⋅ Chia-Che Chang ⋅ Yu-Lun Liu
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 4
Bridge-UniPS: Bridging Calibrated Photometric Stereo toward Universal Photometric Stereo Poster Session 1
Minzhe Xu ⋅ Xiaoyan Liu ⋅ YuJie Xing ⋅ Qian Chen
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 3
Denoising the Deep Sky: Physics-Based CCD Noise Formation for Astronomical Imaging Poster Session 1
Shuhong Liu ⋅ Xining Ge ⋅ Ziying Gu ⋅ Quanfeng Xu ⋅ Ziteng Cui ⋅ Lin Gu ⋅ Xuangeng Chu ⋅ Jun Liu ⋅ Dong Li ⋅ Tatsuya Harada
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 2
Learning Physics-based Forward Model Corrections in Unrolled Networks for Diffuser-based Imaging Poster Session 1
Yoko Sogabe ⋅ Shiori Sugimoto ⋅ Shoichiro Saito ⋅ Masaki Kitahara
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 1
UHD-MFF: Shattering Barriers in Multi-Focus Ultra-High-Definition Image Fusion via Learnable Lookup Tables Poster Session 1
Yibing Zhang ⋅ Xunpeng Yi ⋅ Qinglong Yan ⋅ Yeda Wang ⋅ Han Xu ⋅ Jiayi Ma
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 58
TurboMPLE: Joint Infrared Turbulence Mitigation and Physical Fields Estimation via Mutual Progressive Layered Extraction Poster Session 1
Yitong An ⋅ Yubo Jiang ⋅ Xiangzhi Bai
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 66
From Phase to Phenomenon: Self-Supervised Learning of Subsurface Scattering with Minimal Phase-shift Inputs Poster Session 1
Arjun Majumdar ⋅ Raphael Braun ⋅ Andreas Engelhardt ⋅ Hendrik Lensch
Computational Imaging, Shape Recovery and Camera Geometry ExHall # 12
One Demonstration Is Enough for Real-World Robotic Reinforcement Learning Poster Session 6
Yuwan Liu ⋅ Hongze Yu ⋅ song liu ⋅ Yuhan Wang ⋅ Junge Zhang ⋅ Yaodong Yang ⋅ Yuanpei Chen ⋅ Ceyao Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 464
NavWM: A Unified Navigation World Model for Foresight-Driven Planning Poster Session 6
Yanghong Mei ⋅ Longteng Guo ⋅ MingMing Yu ⋅ Guiyu Zhao ⋅ Xingjian He ⋅ Jing Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 334
SGC-Lane: Monocular 3D Lane Detection with Standard-Definition Map Guidance and Lane Completion Poster Session 6
Fuqiang Jiang ⋅ Wei Li ⋅ Tianyao Zhao ⋅ Yu Hu
Embodied AI, Robotics & Autonomous Driving ExHall # 363
PriorMaskMap: Robust Online Vectorized Map Construction with Biased Priors Poster Session 6
Haoming Xu ⋅ Wei Li ⋅ Yu Hu
Embodied AI, Robotics & Autonomous Driving ExHall # 352
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes Poster Session 6
Koya Sakamoto ⋅ Taiki Miyanishi ⋅ Daichi Azuma ⋅ Shuhei Kurita ⋅ Shu Morikuni ⋅ Naoya Chiba ⋅ Motoaki Kawanabe ⋅ Yusuke Iwasawa ⋅ Yutaka Matsuo
Embodied AI, Robotics & Autonomous Driving ExHall # 379
RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics Poster Session 6
Yuzhi Huang ⋅ Jie Wu ⋅ Weijue Bu ⋅ Ziyi Xiong ⋅ Gaoyang Jiang ⋅ Ye Li ⋅ Kangye Ji ⋅ Shuzhao Xie ⋅ Yue Huang ⋅ Chenglei Wu ⋅ Jingyan Jiang ⋅ Zhi Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 325
PriorEye: Geospatial Visual Priors for End-to-End Autonomous Driving Poster Session 6
Kyuhwan Yeon ⋅ Benjamin Ramtoula ⋅ Daniele De Martini
Embodied AI, Robotics & Autonomous Driving ExHall # 421
Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation Poster Session 6
Hong Chen ⋅ Daqi Liu ⋅ Zehan Zhang ⋅ Haiguang Wang ⋅ Tianhao Lu ⋅ Longfei Yan ⋅ Haiyang Sun ⋅ Fangzhen Li ⋅ Hongwei Xie ⋅ Bing Wang ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Yihua Tan
Embodied AI, Robotics & Autonomous Driving ExHall # 423
MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning Poster Session 6
haoyu fu ⋅ Diankun Zhang ⋅ Zongchuang Zhao ⋅ Jianfeng Cui ⋅ Hongwei Xie ⋅ Bing Wang ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Dingkang Liang ⋅ Xiang Bai
Embodied AI, Robotics & Autonomous Driving ExHall # 395
What Matters in RL-Based Methods for Object-Goal Navigation? An Empirical Study and A Unified Framework Poster Session 6
Hongze Wang ⋅ Boyang Sun ⋅ Jiaxu Xing ⋅ Fan Yang ⋅ Marco Hutter ⋅ Dhruv Shah ⋅ Davide Scaramuzza ⋅ Marc Pollefeys
Embodied AI, Robotics & Autonomous Driving ExHall # 455
Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising Poster Session 6
Tianci Liu ⋅ Zihan Dong ⋅ Linjun Zhang ⋅ Haoyu Wang ⋅ Jing Gao ⋅ Emre Kıcıman ⋅ Ranveer Chandra ⋅ Wei-Ting Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 474
CausalDrive: Real-time Causal World Models for Autonomous Driving Poster Session 6
Tianyi Yan ⋅ Huan Zheng ⋅ Dubing Chen ⋅ Meizhi Qu ⋅ Yingying Shen ⋅ Lijun Zhou ⋅ Mingfei Tu ⋅ Bing Wang ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Haiyang Sun ⋅ Cheng-zhong Xu ⋅ Shen Jianbing
Embodied AI, Robotics & Autonomous Driving ExHall # 322
XYZ-IBD: Benchmarking Robust 6D Object Pose Estimation under Real-World Industrial Complexity Poster Session 6
Junwen Huang ⋅ Jiaqi Hu ⋅ Peter Yu ⋅ Slobodan Ilic ⋅ Martin Sundermeyer ⋅ Benjamin Busam
Embodied AI, Robotics & Autonomous Driving ExHall # 305
Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration Poster Session 6
Aoru Xue ⋅ Yujing Sun ⋅ yiming ren ⋅ Kwok-Yan Lam ⋅ Mao Ye ⋅ Yuexin Ma
Embodied AI, Robotics & Autonomous Driving ExHall # 381
XDen-1K: A Density Field Dataset of Real-World Objects Poster Session 6
Jingxuan Zhang ⋅ Tianqi Yu ⋅ Yatu Zhang ⋅ Jinze Wu ⋅ Kaixin Yao ⋅ Jingyang Liu ⋅ Yuyao Zhang ⋅ Jiayuan Gu ⋅ Jingyi Yu
Embodied AI, Robotics & Autonomous Driving ExHall # 333
Predicting Consequences and Reinforcing Navigation Policies with Latent World Models Poster Session 6
Zengmao Wang ⋅ Wei Gao ⋅ Shuhan Shen
Embodied AI, Robotics & Autonomous Driving ExHall # 302
S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight Poster Session 6
Haodong Yan ⋅ Zhide Zhong ⋅ Jiaguan Zhu ⋅ Junjie He ⋅ Weilin Yuan ⋅ Wenxuan Song ⋅ Xin Gong ⋅ Yingjie CAI ⋅ Guanyi Zhao ⋅ Xu Yan ⋅ Liu Bingbing ⋅ Yingcong Chen ⋅ Haoang Li
Embodied AI, Robotics & Autonomous Driving ExHall # 303
MOJITO: Modal Joint Learning for Unified End-to-End Autonomous Driving Poster Session 6
Zhijing Cheng ⋅ Xuancheng Zhang ⋅ Donglin Di ⋅ Lei Fan ⋅ Baorui Ma ⋅ Hao Li ⋅ Xun Yang
Embodied AI, Robotics & Autonomous Driving ExHall # 304
WALL-EVE: World Alignment with Rule Learning in Visual Environments Poster Session 6
Siyu Zhou ⋅ Tianyi Zhou ⋅ Yijun Yang ⋅ Deheng Ye ⋅ Chengqi Zhang ⋅ Jing Jiang ⋅ Guodong Long
Embodied AI, Robotics & Autonomous Driving ExHall # 364
VIPS: Vehicle-Infrastructure Cooperative Planning Benchmark via Pseudo-Simulation Poster Session 6
Hoonhee Cho ⋅ Jae-young Kang ⋅ Giwon Lee ⋅ Hyemin Yang ⋅ Heejun Park ⋅ KUK-JIN YOON
Embodied AI, Robotics & Autonomous Driving ExHall # 477
ExploreVLA: Dense World Modeling and Exploration for End-to-End Autonomous Driving Poster Session 6
Zihao Sheng ⋅ Xin Ye ⋅ Jingru Luo ⋅ Sikai Chen ⋅ Liu Ren
Embodied AI, Robotics & Autonomous Driving ExHall # 476
BeyondSight: Object Permanence for End-to-End Autonomous Driving Poster Session 6
Sandro Papais ⋅ Letian Wang ⋅ Mudit jain ⋅ Behnaz Rezaei ⋅ Steven Waslander
Embodied AI, Robotics & Autonomous Driving ExHall # 475
EgoTraj: Real-World Egocentric Human Trajectory Poster Session 6
Ahmad Yehia ⋅ Abduallah Mohamed ⋅ Tianyi Wang ⋅ Kun Qian ⋅ Jiseop Byeon ⋅ Junfeng Jiao ⋅ Christian Claudel
Embodied AI, Robotics & Autonomous Driving ExHall # 473
Tactile Modality Fusion for Vision-Language-Action Models Poster Session 6
Charlotte Morissette ⋅ Amin Abyaneh ⋅ Wei-Di Chang ⋅ Anas Houssaini ⋅ David Meger ⋅ Hsiu-Chin Lin ⋅ Jonathan Tremblay ⋅ Gregory Dudek
Embodied AI, Robotics & Autonomous Driving ExHall # 472
Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning Poster Session 6
Jai Bardhan ⋅ Patrik Drozdík ⋅ Josef Sivic ⋅ Vladimir Petrik
Embodied AI, Robotics & Autonomous Driving ExHall # 471
Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments Poster Session 6
Jinwoo Jang ⋅ Daniel Rho ⋅ Sihyung Yoon ⋅ Hyunsuk Cho ⋅ Honguk Woo
Embodied AI, Robotics & Autonomous Driving ExHall # 470
EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation Poster Session 6
Min Lin ⋅ Xiwen Liang ⋅ Bingqian Lin ⋅ Jingzhi Liu ⋅ Zijian Jiao ⋅ Kehan Li ⋅ Ziang Yan ⋅ Yu Sun ⋅ Weijia Liufu ⋅ Yuhan Ma ⋅ Jiarui Hu ⋅ Yuecheng Liu ⋅ Shen Zhao ⋅ Yuzheng Zhuang ⋅ Xiaodan Liang
Embodied AI, Robotics & Autonomous Driving ExHall # 469
AdaDexGrasp: Adaptive Dexterous Grasping via 3D Visuo-Tactile Representation Fusion Poster Session 6
Xirui Liang ⋅ Jingkai Xu ⋅ Jiaqi Liang ⋅ Yuran Wang ⋅ Ruochong Li ⋅ Yuanpei Chen ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan ⋅ Ruihai Wu
Embodied AI, Robotics & Autonomous Driving ExHall # 468
RECO: Region-Aware Compensation for Extrinsic Perturbations in Roadside 3D Detection Poster Session 6
Junsheng Du ⋅ Yuhuan Lu ⋅ Zhaocheng He
Embodied AI, Robotics & Autonomous Driving ExHall # 467
ZAP: Zero-Shot Assembly Planning with Large Language Models Poster Session 6
Linpeng Peng ⋅ Yanbo WANG ⋅ Chuanjie Lv ⋅ Wencan Jiang ⋅ Liming Xu ⋅ Jianbiao Mei ⋅ Xinyue Yao ⋅ Yong Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 466
KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding Poster Session 6
Zeyu Liu ⋅ Zhangzhe Zhu ⋅ Yang Zhang ⋅ Chenyou Fan ⋅ Chenjia Bai ⋅ Xuelong Li
Embodied AI, Robotics & Autonomous Driving ExHall # 465
CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization Poster Session 6
Bo Wu ⋅ Ruoshen Mo ⋅ Justin Yue ⋅ Yanyu Zhang ⋅ Janice Nguyen ⋅ Guoyuan Wu ⋅ Amit Roy-Chowdhury ⋅ Matthew Barth ⋅ Hang Qiu
Embodied AI, Robotics & Autonomous Driving ExHall # 463
AeroVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control Poster Session 6
Peng Xu ⋅ Zhengnan Deng ⋅ Jiayan Deng ⋅ Zonghua Gu ⋅ Peng Xu
Embodied AI, Robotics & Autonomous Driving ExHall # 462
Geometry-Aware Spatio-Temporal Context Modeling for 4D Occupancy Forecasting Poster Session 6
Mingkui Tan ⋅ Zhuangwei Zhuang ⋅ Hui Luo ⋅ Qingyao Wu ⋅ Mingkui Tan
Embodied AI, Robotics & Autonomous Driving ExHall # 461
SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model Poster Session 6
Zhennan Chen ⋅ Tianxing Shi ⋅ Pengcheng Xu ⋅ Kepan Nan ⋅ Qian Wang ⋅ Zili Yi ⋅ Jian Yang ⋅ Ying Tai
Embodied AI, Robotics & Autonomous Driving ExHall # 460
DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving Poster Session 6
Ziyi Song ⋅ Chen Xia ⋅ Hang Yu ⋅ Sheng Zhou ⋅ Zhisheng Niu
Embodied AI, Robotics & Autonomous Driving ExHall # 459
Towards Metric-Agnostic Trajectory Forecasting Poster Session 6
Markus Knoche ⋅ Daan de Geus ⋅ Bastain Leibe
Embodied AI, Robotics & Autonomous Driving ExHall # 458
Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation Poster Session 6
Boyu Mi ⋅ Mengchen Ma ⋅ Yifei Yao ⋅ Xing Gao ⋅ Hanqing Wang ⋅ Junting Chen ⋅ Yangzi Li ⋅ Zihou Zhu ⋅ Guohao Li ⋅ Zhenfei Yin ⋅ Tai Wang ⋅ Yao Mu ⋅ Jiangmiao Pang
Embodied AI, Robotics & Autonomous Driving ExHall # 457
Thinking from the Robot’s View: The CoT-HRC Benchmark for Human Intent Reasoning in Embodied Collaboration Poster Session 6
Chenxi Deng ⋅ Chao Xu ⋅ JianmingLiu JianmingLiu ⋅ Shaofei Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 456
SAFER-Activities: A Dataset for Smart Assessment of Fall Events and Routine Activities Poster Session 6
Diwas Lamsal ⋅ Pramod Wickramatilake ⋅ Jednipat Moonrinta ⋅ Mongkol Ekpanyapong ⋅ Matthew Dailey
Embodied AI, Robotics & Autonomous Driving ExHall # 454
Unpaired Geometry-Guided Sim2Real Translation for Autonomous Driving Poster Session 6
Xinzhuo Chen ⋅ Shijie Wang ⋅ Chao Gao ⋅ Jinguang Gu ⋅ Gongjin Lan
Embodied AI, Robotics & Autonomous Driving ExHall # 453
CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics Poster Session 6
Ziyi Ding ⋅ xianxin lai ⋅ Weiyu Chen ⋅ Xiao-Ping Zhang ⋅ Jiayu Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 452
LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving Poster Session 6
Pei Liu ⋅ Songtao Wang ⋅ Lang Zhang ⋅ Xinyue Peng ⋅ Yuandong Lyu ⋅ Jiaxin Deng ⋅ Songxin lu ⋅ Weiliang Ma ⋅ Xueyang Zhang ⋅ Yifei Zhan ⋅ Kun Zhan ⋅ Jun Ma
Embodied AI, Robotics & Autonomous Driving ExHall # 451
Twin-DAgger: Synergizing Digital Twins and Human Corrections for Efficient Robot Manipulation Poster Session 6
Jiahang Li ⋅ Zhirui Zhang ⋅ Kairan Ding ⋅ Fan Fei ⋅ Yunkai Tang ⋅ Jiaming Liu ⋅ Xiao He ⋅ Ziyu Chen ⋅ Gaohao Zhou ⋅ Jieji Ren ⋅ Yandong Guo ⋅ Shanghang Zhang ⋅ Boxin Shi
Embodied AI, Robotics & Autonomous Driving ExHall # 450
MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model Poster Session 6
Taiga Yamane ⋅ Satoshi Suzuki ⋅ Ryo Masumura ⋅ Shota Orihashi ⋅ Tomohiro Tanaka ⋅ Mana Ihori ⋅ Naoki Makishima
Embodied AI, Robotics & Autonomous Driving ExHall # 449
Driving is a Game: Combining Planning and Prediction with Bayesian Iterative Best Response Poster Session 6
Aron Distelzweig ⋅ Yiwei Wang ⋅ Faris Janjos ⋅ Marcel Hallgarten ⋅ Mihai Dobre ⋅ Alexander Langmann ⋅ Joschka Boedecker ⋅ Johannes Betz
Embodied AI, Robotics & Autonomous Driving ExHall # 448
Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation Poster Session 6
Bing Wu ⋅ Zuyao Chen ⋅ Chang Wen Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 447
World Models for Learning Dexterous Hand-Object Interactions from Human Videos Poster Session 6
Raktim Goswami ⋅ Amir Bar ⋅ David Fan ⋅ Tsung-Yen Yang ⋅ Gaoyue Zhou ⋅ Prashanth Krishnamurthy ⋅ Michael Rabbat ⋅ Farshad Khorrami ⋅ Yann LeCun
Embodied AI, Robotics & Autonomous Driving ExHall # 446
UECP: Uncertainty-Enhanced Collaborative Perception Poster Session 6
Kang Yang ⋅ Tianci Bu ⋅ Peng Wang ⋅ Deying Li ⋅ Jie Wen ⋅ Yongcai Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 445
Hi-Nav: Hierarchical Framework for Continuous Vision-Language Navigation via Map Guidance and Waypoint Reasoning Poster Session 6
Zhiyu Zhou ⋅ Bin Guan ⋅ Wenbin Yang ⋅ Zhi Gao ⋅ Hao Fang
Embodied AI, Robotics & Autonomous Driving ExHall # 444
RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures Poster Session 6
Hanan Gani ⋅ Tejal Kulkarni ⋅ Madhoolika Chodavarapu ⋅ Nicklas Hansen ⋅ Manmohan Chandraker
Embodied AI, Robotics & Autonomous Driving ExHall # 443
HERO: Heterogeneous Evidential Robust Object-Level Collaborative Perception Poster Session 6
Hao SI ⋅ Ehsan Javanmardi ⋅ Hanlin Wu ⋅ Manabu Tsukada
Embodied AI, Robotics & Autonomous Driving ExHall # 442
Stand Up and Move: Benchmarking Interactive Spatial Intelligence in WalkerBench Poster Session 6
Zhiqi Ge ⋅ Gang Yang ⋅ Ziyang Pan ⋅ Jingzhe Zhu ⋅ Yuancheng Gu ⋅ Juncheng Li ⋅ Qizhou Wang ⋅ Rui Tang ⋅ Siliang Tang ⋅ Jun Xiao ⋅ Yueting Zhuang
Embodied AI, Robotics & Autonomous Driving ExHall # 441
SkillSpotter: Pose-Aware Multi-View Skilled Action Detection and Grading in Ego-Exo Videos Poster Session 6
Björn Braun ⋅ Christian Holz
Embodied AI, Robotics & Autonomous Driving ExHall # 440
MobileOcc: A Human-Aware Semantic Occupancy Dataset for Mobile Robots Poster Session 6
Junseo Kim ⋅ Guido Dumont ⋅ Xinyu Gao ⋅ Gang Chen ⋅ Holger Caesar ⋅ Javier Alonso-Mora
Embodied AI, Robotics & Autonomous Driving ExHall # 439
Fast and Scalable LiDAR Data Generation for Autonomous Driving Simulation without Raycasting Poster Session 6
Irfan Nafiz Shahan ⋅ Al-Mubin Nabil ⋅ Arpan Kusari
Embodied AI, Robotics & Autonomous Driving ExHall # 438
CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates Poster Session 6
Shresth Grover ⋅ Priyank Pathak ⋅ Akash Kumar ⋅ Yogesh Rawat
Embodied AI, Robotics & Autonomous Driving ExHall # 437
RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios Poster Session 6
Tianyi Zhao ⋅ Jiawen Xi ⋅ Linhui Xiao ⋅ Junnan Li ⋅ Xue Yang ⋅ Maoxun Yuan ⋅ Xingxing Wei
Embodied AI, Robotics & Autonomous Driving ExHall # 436
Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior Poster Session 6
Jiahui Fu ⋅ Zehao Huang ⋅ Han Li ⋅ Naiyan Wang ⋅ Si Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 435
WildWorld: A Large-Scale Dataset for Action-Conditioned World Modeling with Explicit State Annotations Poster Session 6
Zhen Li ⋅ Zian Meng ⋅ Chuanhao Li ⋅ SHUWEI SHI ⋅ Wenshuo Peng ⋅ Yuwei Wu ⋅ Bo Zheng ⋅ Yunde Jia ⋅ Kaipeng Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 434
EvoWorld: A World-Model-Centric Framework for Continuous Self-Evolution of Modular Embodied Skills Poster Session 6
boshi zhang ⋅ Sen Cui ⋅ Baohua Yin ⋅ Youyi Kou ⋅ Junyu Wu ⋅ Zuo Pu ⋅ TAO XUE ⋅ Zhikang Chen ⋅ Shanshan Wei ⋅ Min Zhang ⋅ Miao Liu ⋅ Changshui Zhang ⋅ Zhang Tao
Embodied AI, Robotics & Autonomous Driving ExHall # 433
WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation Poster Session 6
Wei Dong ⋅ Tianyu Fu ⋅ Zhe Yu ⋅ Hanning Wang ⋅ Anyang Su ⋅ Zhizhou Fang ⋅ Yuyang Chen ⋅ Shuo Wang ⋅ Minghui Wu ⋅ Ping Jiang ⋅ Zhen Lei ⋅ Chenxu Zhao
Embodied AI, Robotics & Autonomous Driving ExHall # 432
The Language of Visual Attention: Modeling Scanpaths via Autoregressive Token Prediction Poster Session 6
Susmit Agrawal ⋅ Matthias Bethge ⋅ Matthias Kuemmerer
Embodied AI, Robotics & Autonomous Driving ExHall # 431
Grounding Sim-to-Real Generalization in Dexterous Manipulation: An Empirical Study with Vision-Language-Action Models Poster Session 6
Ruixing Jin ⋅ ZiCheng Zhu ⋅ Ruixiang Ouyang ⋅ Sheng Xu ⋅ Bo Yue ⋅ Zhizheng Wu ⋅ Guiliang Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 430
HiPolicy: Hierarchical Multi-Frequency Action Chunking for Policy Learning Poster Session 6
Jiyao Zhang ⋅ Zimu Han ⋅ Junhan Wang ⋅ Xionghao Wu ⋅ Shihong Lin ⋅ Jinzhou Li ⋅ Hongwei Fan ⋅ Ruihai Wu ⋅ Dongjiang Li ⋅ Hao Dong
Embodied AI, Robotics & Autonomous Driving ExHall # 429
HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments Poster Session 6
Ruijie Tang ⋅ Chenye Zou ⋅ Guoquan Wu ⋅ Jun Wei ⋅ Wei Chen ⋅ Jiaxin Zhu
Embodied AI, Robotics & Autonomous Driving ExHall # 428
NutriBench-Kitchen: Benchmarking Embodied AI for Nutrition Management Poster Session 6
YuLin Wei ⋅ Xiangchen Wang ⋅ Jianhui Pan ⋅ Jinyu Xiao ⋅ Zheng Tan ⋅ Ruozai Tian ⋅ Guanhua Chen ⋅ Feng Zheng
Embodied AI, Robotics & Autonomous Driving ExHall # 427
LMGenDrive: Bridging Multimodal Understanding and Generative World Modeling for End-to-End Driving Poster Session 6
Hao Shao ⋅ Letian Wang ⋅ Yang Zhou ⋅ Yuxuan Hu ⋅ Zhuofan Zong ⋅ Steven Waslander ⋅ Wei Zhan ⋅ Hongsheng LI
Embodied AI, Robotics & Autonomous Driving ExHall # 426
AMCoNav: Asynchronous Multi-module Collaborative Framework for Embodied Visual Navigation Poster Session 6
Jiaquan Yan ⋅ Fang Zhao ⋅ Yushi Chen ⋅ Long wang ⋅ Haiyong Luo ⋅ Dan Luo
Embodied AI, Robotics & Autonomous Driving ExHall # 425
360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents Poster Session 6
Kenta Watanabe ⋅ Atsuyuki Miyai ⋅ Mizuki Takenawa ⋅ Kiyoharu Aizawa ⋅ Toshihiko Yamasaki
Embodied AI, Robotics & Autonomous Driving ExHall # 424
Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation Poster Session 6
Peixin Chen ⋅ Guoxi Zhang ⋅ Jianwei Ma ⋅ Qing Li
Embodied AI, Robotics & Autonomous Driving ExHall # 422
Tac2Real: Reliable and GPU Visuotactile Simulation for Online Reinforcement Learning and Zero-shot Real-World Deployment Poster Session 6
Ningyu YAN ⋅ Shuai Wang ⋅ Xing Shen ⋅ Hui Wang ⋅ Hanqing Wang ⋅ Yang Xiang ⋅ Jiangmiao Pang
Embodied AI, Robotics & Autonomous Driving ExHall # 420
STEP: Spatial Thinking and Egocentric Pointing for Embodied Instruction Following Poster Session 6
Hanxuan Li ⋅ Bin Fu ⋅ Zeyuan Lin ⋅ Ruiping Wang ⋅ Xilin CHEN
Embodied AI, Robotics & Autonomous Driving ExHall # 419
Drive2Danger: Deceive End-to-End Autonomous Driving with Risky Instance Recognition Poster Session 6
Shuaikang Shang ⋅ Taiqi Zhang ⋅ Feng Lin ⋅ Hao Yan ⋅ Zhengxiong Li
Embodied AI, Robotics & Autonomous Driving ExHall # 418
Self-Evolving Just-In-Time Memory for Proactive Embodied Safety Poster Session 6
Bingrui Sima ⋅ Lizhong Wang ⋅ Xiaoya Lu ⋅ Kun He ⋅ Xiao Yang
Embodied AI, Robotics & Autonomous Driving ExHall # 417
HSDF-Lane: Height-Aligned Signed Distance Field with Semantic Lane Prior for 3D Lane Detection Poster Session 6
Jiyong Boo ⋅ ByeongIn Joung ⋅ Hyemin Yang ⋅ KUK-JIN YOON
Embodied AI, Robotics & Autonomous Driving ExHall # 416
GameWorlds: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents Poster Session 6
Mingyu Ouyang ⋅ Siyuan Hu ⋅ Qinghong Lin ⋅ Hwee Tou Ng ⋅ Mike Zheng Shou
Embodied AI, Robotics & Autonomous Driving ExHall # 415
VPA-WM: Vision-Priors-Aligned World Models for Robust Visual Reinforcement Learning Poster Session 6
Xu Zhang ⋅ Sicong Liu ⋅ Liwei Guo ⋅ Chenjuan Guo ⋅ Bin Yang ⋅ Yang Shu
Embodied AI, Robotics & Autonomous Driving ExHall # 414
WildCity: A Real-World Dataset for City-Scale Rendering and Beyond Poster Session 6
Xiangyu Han ⋅ Mengyu Yang ⋅ Jiaqi Li ⋅ Bowen Chang ⋅ Ziyu Chen ⋅ Hexu Zhao ⋅ Rahul Agrawal ⋅ Anthony Rodriguez ⋅ Rajani Acharya ⋅ Fiona Hua ⋅ Marco Pavone ⋅ Chen Feng ⋅ Yiming Li
Embodied AI, Robotics & Autonomous Driving ExHall # 413
RAE-NWM: Navigation World Model in Dense Visual Representation Space Poster Session 6
Mingkun Zhang ⋅ wangtian shen ⋅ Fan Zhang ⋅ Haijian Qin ⋅ Zihao Pei ⋅ Ziyang Meng
Embodied AI, Robotics & Autonomous Driving ExHall # 412
Agent-OBJ: Prompt-Driven 3D Adversaries for Multi-Modal Perception Poster Session 6
Bing Li ⋅ Sean Du ⋅ Xuhong Ren ⋅ Luqi Gong ⋅ Wee Peng Tay ⋅ Qing Guo
Embodied AI, Robotics & Autonomous Driving ExHall # 411
FindingDory: A Benchmark to Evaluate Memory in Embodied Agents Poster Session 6
Karmesh Yadav ⋅ Yusuf Ali ⋅ Gunshi Gupta ⋅ Yarin Gal ⋅ Zsolt Kira
Embodied AI, Robotics & Autonomous Driving ExHall # 410
Sentinel: Embodied Cooperative Spatial Reasoning and Planning Poster Session 6
Xiangye Lin ⋅ Hongxin Zhang ⋅ Ruxi Deng ⋅ Qinhong Zhou ⋅ Chuang Gan
Embodied AI, Robotics & Autonomous Driving ExHall # 409
Lifting Ego World Models for Planning and Control Poster Session 6
Alex Wang ⋅ Trevor Darrell ⋅ Pavel Izmailov ⋅ Yutong Bai ⋅ Amir Bar
Embodied AI, Robotics & Autonomous Driving ExHall # 408
VOCA: Visual Odometry with Codec Awareness Poster Session 6
Nouri Alexander Hilscher ⋅ Mateo de Mayo ⋅ Dominik Muhle ⋅ Christoph Hermes ⋅ Daniel Cremers
Embodied AI, Robotics & Autonomous Driving ExHall # 407
Boba: Batched Simulation for Physics-Based Gaussian Digital Twins Poster Session 6
Yihan Pang ⋅ Hanxiao Jiang ⋅ Sushant Kondguli ⋅ Sarita Adve ⋅ Shenlong Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 406
ContextFlow: In-Context Flow Matching for Robot Manipulation Poster Session 6
Jian Ding ⋅ Xianjie DAI ⋅ Roei Herzig ⋅ Nussair Hroub ⋅ Jinjie Mai ⋅ Dengxin Dai ⋅ Bernard Ghanem ⋅ Mohamed Elhoseiny
Embodied AI, Robotics & Autonomous Driving ExHall # 405
Two-Way Street: Efficient VSLAM using Collaborative In-Sensor and Off-Sensor processing Poster Session 6
Hongyi Zhang ⋅ Laurie Bose ⋅ Piotr Dudek ⋅ Walterio Mayol-Cuevas
Embodied AI, Robotics & Autonomous Driving ExHall # 404
Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models Poster Session 6
Hongyu Li ⋅ Wanjia Fu ⋅ Xiaoyan Cong ⋅ Zekun Li ⋅ Binghao Huang ⋅ Hanxiao Jiang ⋅ Xintong He ⋅ Yiqing Liang ⋅ Rao Fu ⋅ Tao Lu ⋅ Srinath Sridhar ⋅ Kevin Smith ⋅ George Konidaris ⋅ Yunzhu Li
Embodied AI, Robotics & Autonomous Driving ExHall # 403
LaGen: Towards Autoregressive LiDAR Scene Generation Poster Session 6
Sizhuo Zhou ⋅ Xiaosong Jia ⋅ Fanrui Zhang ⋅ Junjie Li ⋅ Juyong Zhang ⋅ Yukang Feng ⋅ Jianwen Sun ⋅ Songbur Wong ⋅ Junqi You ⋅ Junchi Yan
Embodied AI, Robotics & Autonomous Driving ExHall # 402
SwiftWA: An Efficient Action-Centered World-Action Model Poster Session 6
Chaojun Ni ⋅ Xinyu Zhou ⋅ YuKun Zhou ⋅ Jingyu Liu ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Yang Wang ⋅ Qiuping Deng ⋅ Yun Ye ⋅ Hao Li ⋅ Zhichao Liu ⋅ Jindi Lv ⋅ Boyuan Wang ⋅ Guosheng Zhao ⋅ Guan Huang ⋅ Min Cao ⋅ Wenjun Mei
Embodied AI, Robotics & Autonomous Driving ExHall # 401
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes Poster Session 6
Jiajun Zhai ⋅ Hao Shi ⋅ Shangwei Guo ⋅ Kailun Yang ⋅ Kaiwei Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 400
OpenEarthAgent: A Unified Framework for Tool-Augmented Geospatial Agents Poster Session 6
Akashah Shabbir ⋅ Muhammad Umer Sheikh ⋅ Muhammad Akhtar Munir ⋅ Hiyam Debary ⋅ Mustansar Fiaz ⋅ Muhammad Zaigham Zaheer ⋅ Paolo Fraccaro ⋅ Fahad Shahbaz Khan ⋅ Muhammad Haris Khan ⋅ Xiao Xiang Zhu ⋅ Salman Khan
Embodied AI, Robotics & Autonomous Driving ExHall # 399
UniBYD: A Unified Framework for Learning Robotic Manipulation Across Embodiments Beyond Imitation of Human Demonstrations Poster Session 6
Tingyu Yuan ⋅ Biaoliang Guan ⋅ Wen Ye ⋅ Ziyan Tian ⋅ Yi Yang ⋅ Weijie Zhou ⋅ Zhaowen Li ⋅ Yan Huang ⋅ Peng Wang ⋅ Chaoyang Zhao ⋅ Jinqiao Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 398
LEO-Fuse: A Modality- and Task-Agnostic Universal Framework for Multimodal Human Sensing Poster Session 6
Emrecan Aslan
Embodied AI, Robotics & Autonomous Driving ExHall # 397
Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification Poster Session 6
Jiawen Wen ⋅ Penglei SUN ⋅ Wenjie Zhang ⋅ Suixuan QIU ⋅ Weisheng Xu ⋅ Xiaofei Yang ⋅ Xiaowen Chu
Embodied AI, Robotics & Autonomous Driving ExHall # 396
VVSim: A Large-Scale Aerial-Ground Dataset and Benchmark for Cooperative Perception Poster Session 6
Zengle Zhu ⋅ Zhen LI ⋅ Tianyi Huai ⋅ Tianshun Li ⋅ Zihang Xu ⋅ Liuqing Yang ⋅ Rongqing Zhang ⋅ Xinhu Zheng
Embodied AI, Robotics & Autonomous Driving ExHall # 394
TriO: Tri-Modal Unsupervised Occupancy World Model for Anything Perception Poster Session 6
Quinlan Sykora ⋅ Sourav Biswas ⋅ Christopher Diehl ⋅ Andrew Cunningham ⋅ Thomas Gilles ⋅ Raquel Urtasun
Embodied AI, Robotics & Autonomous Driving ExHall # 393
Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight Poster Session 6
Yifei Dong ⋅ Fengyi Wu ⋅ Guangyu Chen ⋅ Lingdong Kong ⋅ Xu Zhu ⋅ Qiyu Hu ⋅ Yuxuan Zhou ⋅ Jingdong Sun ⋅ Jun-Yan He ⋅ Qi Dai ⋅ Alexander Hauptmann ⋅ Yifei Dong
Embodied AI, Robotics & Autonomous Driving ExHall # 392
3DWay: Generalizing Robot Manipulation via 3D Consistent Waypoints Poster Session 6
Huang Ziqin ⋅ Yingyue Li ⋅ Chenyangguang Zhang ⋅ Ruida Zhang ⋅ Yuxin Chen ⋅ Gu Wang ⋅ Xingyu Liu ⋅ Masayoshi TOMIZUKA ⋅ Xiangyang Ji
Embodied AI, Robotics & Autonomous Driving ExHall # 391
Reflection-Aware Reasoning for Non-Line-of-Sight Pedestrian Localization Poster Session 6
Byeonggyu Park ⋅ Mingu Jeon ⋅ Seong-Woo Kim
Embodied AI, Robotics & Autonomous Driving ExHall # 390
SIMON: SImultaneous Multi-Object Navigation Poster Session 6
Yifeng Zhu ⋅ Siyuan Huang ⋅ Jun Bao ⋅ Jun Yu ⋅ Buyu Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 389
TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction Poster Session 6
Ao Li ⋅ Yonggen Ling ⋅ Yiyang Lin ⋅ Yuji Wang ⋅ Yong Deng ⋅ Yansong Tang
Embodied AI, Robotics & Autonomous Driving ExHall # 388
What if? Emulative Simulation with World Models for Situated Reasoning Poster Session 6
Ruiping Liu ⋅ Yufan Chen ⋅ Yuheng Zhang ⋅ Junwei Zheng ⋅ Kunyu Peng ⋅ Chengzhi Wu ⋅ Chenguang Huang ⋅ Di Wen ⋅ Jiaming Zhang ⋅ Kailun Yang ⋅ Rainer Stiefelhagen
Embodied AI, Robotics & Autonomous Driving ExHall # 387
DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation Poster Session 6
Ziyu Shan ⋅ Zhenyu Wu ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Ziwei Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 386
MM-Nav: Multi-View VLA Model for Robust Visual Navigation via Multi-Expert Learning Poster Session 6
Tianyu Xu ⋅ Jiawei Chen ⋅ Jiazhao Zhang ⋅ Wenyao Zhang ⋅ Zekun Qi ⋅ Minghan Li ⋅ Jiahang Liu ⋅ Lu Yue ⋅ Zhizheng Zhang ⋅ HE WANG
Embodied AI, Robotics & Autonomous Driving ExHall # 385
MolmoWeb: Open Visual Web Agent and Open Data for the Open Web Poster Session 6
Tanmay Gupta ⋅ Piper Wolters ⋅ Zixian Ma ⋅ Peter Sushko ⋅ Rock Yuren Pang ⋅ Yue Yang ⋅ Jason Ren ⋅ Harsh Trivedi ⋅ Taira Anderson ⋅ Winson Han ⋅ Ranjay Krishna
Embodied AI, Robotics & Autonomous Driving ExHall # 384
OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence Poster Session 6
Jianhui Liu ⋅ Haoze Sun ⋅ Wenbo Li ⋅ Yanbing Zhang ⋅ Rui Yang ⋅ zhiliang zhu ⋅ Yijun Yang ⋅ Shenghe Zheng ⋅ Nan Jiang ⋅ Jiaxiu Jiang ⋅ Haoyang Huang ⋅ Tien-Tsin Wong ⋅ Nan Duan ⋅ Qi Xiaojuan
Embodied AI, Robotics & Autonomous Driving ExHall # 383
Markov-Renewal Single-Photon LiDAR Simulator Poster Session 6
Weijian Zhang ⋅ PRATEEK CHENNURI ⋅ Hashan Weerasooriya ⋅ Bole Ma ⋅ Stanley Chan
Embodied AI, Robotics & Autonomous Driving ExHall # 382
DiverseAD: A Large-Scale Driving Dataset with Diverse Atmospheric Conditions Poster Session 6
Haoyu Wang ⋅ Baorui Ma ⋅ Donglin Di ⋅ Suhang Xuan ⋅ Hao Li ⋅ Shiliang Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 380
CoReLIN: Constraint-based Reasoning for Zero-shot Lifelong Interactive Navigation Poster Session 6
Apoorva Vashisth ⋅ Manav Kulshrestha ⋅ Pranav Bakshi ⋅ Damon Conover ⋅ Guillaume Sartoretti ⋅ Aniket Bera
Embodied AI, Robotics & Autonomous Driving ExHall # 378
RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception Poster Session 6
Shaozu Ding ⋅ Linan Song ⋅ Marco Vincenzi ⋅ Dajiang Suo
Embodied AI, Robotics & Autonomous Driving ExHall # 377
Boxer: Robust Lifting of Open-World 2D Bounding Boxes to 3D Poster Session 6
Daniel DeTone ⋅ Tianwei Shen ⋅ Fan Zhang ⋅ Lingni Ma ⋅ Julian Straub ⋅ Richard Newcombe ⋅ Jakob Engel
Embodied AI, Robotics & Autonomous Driving ExHall # 376
TraversRL: Traversable Pedestrian Pathway Generation With Reinforcement Learning Poster Session 6
Bin Han ⋅ Robert Wolfe ⋅ Bill Howe
Embodied AI, Robotics & Autonomous Driving ExHall # 375
ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Reconstruction Poster Session 6
Chaojun Ni ⋅ Guosheng Zhao ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Wenkang Qin ⋅ Chen Xinze ⋅ Guanghong Jia ⋅ Guan Huang ⋅ Wenjun Mei
Embodied AI, Robotics & Autonomous Driving ExHall # 374
PhysMani: Physics-principled 3D World Model for Dynamic Object Manipulation Poster Session 6
Peng Yun ⋅ Shouwang Huang ⋅ Hao Li ⋅ Jinxi Li ⋅ Jianan Wang ⋅ Bo Yang
Embodied AI, Robotics & Autonomous Driving ExHall # 373
Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen Poster Session 6
Chengming Feng ⋅ Hesam Araghi ⋅ Liming Zheng ⋅ Julien Dupeyroux ⋅ Xucong Zhang ⋅ Jan van Gemert ⋅ Nergis Tomen
Embodied AI, Robotics & Autonomous Driving ExHall # 372
Noise is a Good Teacher: A Noise-Driven Framework for Robust Collaborative Perception Poster Session 6
Chengyan Huang ⋅ Zhongxiang Zhao ⋅ Ziyao Zhang ⋅ Zihao Yang ⋅ Lin Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 371
Guide, Think, Act: Interactive Embodied Reasoning for Vision-Language-Action Model Poster Session 6
Yiran Ling ⋅ Qing Lian ⋅ Jinghang Li ⋅ Qing Jiang ⋅ TianMing Zhang ⋅ Xiaoke Jiang ⋅ Chuanxiu Liu ⋅ Jie Liu ⋅ Lei Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 370
SP-TransientBench: A Real-Captured Single Photon Perception Benchmark Poster Session 6
Hongzhou Dong ⋅ Zili Zhang ⋅ Ziting Wen ⋅ Yiheng Qiang ⋅ Runrong Deng ⋅ Wenle Dong ⋅ Ziwen Jiang ⋅ Xinyang Li ⋅ Rui Lu ⋅ Shuoyao Sun ⋅ Wenyu Wang ⋅ Ziyi Xia ⋅ Haitao Zheng ⋅ Guodong Shi ⋅ Xiaoqiang Ren
Embodied AI, Robotics & Autonomous Driving ExHall # 369
NeSy-Route: A Neural-Symbolic Benchmark for Constrained Route Planning in Remote Sensing Poster Session 6
Ming Yang ⋅ Zhi Zhou ⋅ Shi-Yu Tian ⋅ Kun-Yang Yu ⋅ Lan-Zhe Guo ⋅ Yu-Feng Li
Embodied AI, Robotics & Autonomous Driving ExHall # 368
Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models Poster Session 6
Massimiliano Pappa ⋅ Luca Romani ⋅ Valentino Sacco ⋅ Alessio Palma ⋅ Stéphane Lathuilière ⋅ Fabio Galasso ⋅ Xavier Alameda-Pineda ⋅ Indro Spinelli
Embodied AI, Robotics & Autonomous Driving ExHall # 367
C2E: Boosting Ego-Only 3D Object Detection via Multi-Teacher Contrastive Knowledge Distillation Poster Session 6
Jinlong Wang ⋅ Xun Huang ⋅ Qiming Xia ⋅ Shijia Zhao ⋅ Chenglu Wen
Embodied AI, Robotics & Autonomous Driving ExHall # 366
DiNBV-Grasp: Real-Time Distance-Aware Two-Stage Next-Best-View for Robotic Grasping Poster Session 6
Zilong Xie ⋅ Jingyu Gong ⋅ Xin Tan ⋅ Zhizhong Zhang ⋅ Yanyun Qu ⋅ Lizhuang Ma ⋅ Yuan Xie
Embodied AI, Robotics & Autonomous Driving ExHall # 365
UniDriveDreamer: A Single-Stage Multimodal World Model for Autonomous Driving Poster Session 6
Guosheng Zhao ⋅ Yaozeng Wang ⋅ Xiaofeng Wang ⋅ Zheng Zhu ⋅ Tingdong Yu ⋅ Guan Huang ⋅ Yongchen Zai ⋅ Ji Jiao ⋅ Changliang Xue ⋅ Xiaole Wang ⋅ Zhen Yang ⋅ Futang Zhu ⋅ Xingang Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 362
Thinking Ahead: Foresight Intelligence in MLLMs and World Model Poster Session 6
Zhantao Gong ⋅ Liaoyuan Fan ⋅ Qing Guo ⋅ Xun Xu ⋅ Xulei Yang ⋅ Shijie Li
Embodied AI, Robotics & Autonomous Driving ExHall # 361
World-in-Loop: Online Correction via Event-Triggered World Models for Robust VLA Policies Poster Session 6
Shaoqing Xu ⋅ Fang Li ⋅ Zhi-Xin Yang ⋅ Qimao Chen ⋅ Yuechen Luo ⋅ Zhixiang Duan ⋅ Yifan Yang ⋅ Long Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 360
Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain Poster Session 6
Yulin Luo ⋅ Chun-Kai Fan ⋅ Menghang Dong ⋅ Jiayu Shi ⋅ Xiangju Mi ⋅ Mengdi Zhao ⋅ Bo-Wen Zhang ⋅ Cheng Chi ⋅ Jiaming Liu ⋅ Gaole Dai ⋅ Rongyu Zhang ⋅ Ruichuan An ⋅ Kun Wu ⋅ Zhengping Che ⋅ shaoxuan Xie ⋅ Guocai Yao ⋅ Zhongxia Zhao ⋅ Pengwei Wang ⋅ Guang Liu ⋅ Zhongyuan Wang ⋅ Tiejun Huang ⋅ Shanghang Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 359
Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch Poster Session 6
Gabriele Mario Caddeo ⋅ Pasquale Marra ⋅ Lorenzo Natale
Embodied AI, Robotics & Autonomous Driving ExHall # 358
ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation Poster Session 6
Jingjing Qian ⋅ Zeyuan He ⋅ Chen Shi ⋅ Lei Xiao ⋅ Li Jiang
Embodied AI, Robotics & Autonomous Driving ExHall # 357
MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization Poster Session 6
Zaibin Zhang ⋅ Junlan Xiao ⋅ Zhongbo Zhang ⋅ Yifan Wang ⋅ Li Kang ⋅ Yiran Qin ⋅ Changxing Xia ⋅ Heng Zhou ⋅ Talas Fu ⋅ Enshen Zhou ⋅ Ruimao Zhang ⋅ Zhenfei Yin ⋅ Huchuan Lu ⋅ Lijun Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 356
RadarGen: Automotive Radar Point Cloud Generation from Cameras Poster Session 6
Tomer Borreda ⋅ Fangqiang Ding ⋅ Sanja Fidler ⋅ Shengyu Huang ⋅ Or Litany
Embodied AI, Robotics & Autonomous Driving ExHall # 355
StructPolicy: Structure-Guided Imitation Learning Robust to Visual Domain Shifts Poster Session 6
Zehao Du ⋅ Jiude Wei ⋅ Cewu Lu ⋅ Jianhua Sun
Embodied AI, Robotics & Autonomous Driving ExHall # 354
SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection Poster Session 6
Zhang Tiancheng ⋅ Mengmeng Wang ⋅ Yan Gao ⋅ Xiangjie Kong ⋅ Guojiang Shen ⋅ Jiaxin Du
Embodied AI, Robotics & Autonomous Driving ExHall # 351
UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving Poster Session 6
Bo Zhao ⋅ Xinting Zhao ⋅ Naifan Li ⋅ Erkang Cheng ⋅ Haibin Ling
Embodied AI, Robotics & Autonomous Driving ExHall # 353
RAF: Reliability-Aware Fusion of Camera, LiDAR, and 4D RADAR for Robust 3D Object Detection in Adverse Weather Poster Session 6
Heejun Park ⋅ Jaeseok Jeong ⋅ KUK-JIN YOON
Embodied AI, Robotics & Autonomous Driving ExHall # 350
Driving like yourself: A Benchmark for Closed-Loop Personalized End-to-End Autonomous Driving Poster Session 6
Xiaoru Dong ⋅ Ruiqin Li ⋅ Xiao Han ⋅ Zhenxuan Wu ⋅ Jiamin Wang ⋅ Jian Chen ⋅ Qi Jiang ⋅ SM Yiu ⋅ Xinge Zhu ⋅ Yuexin Ma
Embodied AI, Robotics & Autonomous Driving ExHall # 349
ZTRS: Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer Poster Session 6
Zhenxin Li ⋅ Nadine Chang ⋅ Wenhao Yao ⋅ Xinglong Sun ⋅ Zi Wang ⋅ Maying Shen ⋅ Jingde Chen ⋅ Jingyu Song ⋅ Kailin Li ⋅ Zuxuan Wu ⋅ Shiyi Lan ⋅ Jose M Alvarez
Embodied AI, Robotics & Autonomous Driving ExHall # 348
StreamSpatial: A Benchmark and Framework for Streaming 3D Visual-Spatial Reasoning Poster Session 6
Junlin Xie ⋅ Keyang Zhong ⋅ Quanlong Zheng ⋅ Ruifei Zhang ⋅ Kuo Wang ⋅ Yanhao Zhang ⋅ Haonan Lu ⋅ Xiang Wan ⋅ Guanbin Li
Embodied AI, Robotics & Autonomous Driving ExHall # 347
DeGuNet: Depth-Guided Ultra-Compact Backbones for Efficient LiDAR-Camera 3D Detection Poster Session 6
haifa zhang ⋅ Yijing Wang ⋅ Peixi Peng ⋅ Zhiqiang Zuo
Embodied AI, Robotics & Autonomous Driving ExHall # 346
BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations Poster Session 6
Thomas Monninger ⋅ Shaoyuan Xie ⋅ Qi Chen ⋅ Sihao Ding
Embodied AI, Robotics & Autonomous Driving ExHall # 345
Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum Poster Session 6
Zhizhao Liang ⋅ Yi-Lin Wei ⋅ Xuhang Chen ⋅ Mu Lin ⋅ Yi-Xiang He ⋅ Zhexi Luo ⋅ Jun-Hui Liu ⋅ Kun-Yu Lin ⋅ WEISHI ZHENG
Embodied AI, Robotics & Autonomous Driving ExHall # 344
UniDrive-WM: Unified Understanding, Planning and Generation World Model For Autonomous Driving Poster Session 6
Zhexiao Xiong ⋅ Xin Ye ⋅ Burhaneddin Yaman ⋅ Sheng Cheng ⋅ Yiren Lu ⋅ Jingru Luo ⋅ Nathan Jacobs ⋅ Liu Ren
Embodied AI, Robotics & Autonomous Driving ExHall # 343
When the City Teaches the Car: Label-Free 3D Perception from Infrastructure Poster Session 6
ZHEN XU ⋅ Jinsu Yoo ⋅ Cristian Bautista ⋅ Zanming Huang ⋅ Tai-Yu Pan ⋅ Zhenzhen Liu ⋅ Katie Luo ⋅ Mark Campbell ⋅ Bharath Hariharan ⋅ Wei-Lun Chao
Embodied AI, Robotics & Autonomous Driving ExHall # 342
DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving Poster Session 6
Pengxuan Yang ⋅ Yupeng Zheng ⋅ Zebin Xing ⋅ Deheng Qian ⋅ Pengxuan Yang ⋅ Linbo Wang ⋅ Yichen Zhang ⋅ shaoyu guo ⋅ Zhongpu Xia ⋅ Qiang Chen ⋅ Junyu han ⋅ Lingyun Xu ⋅ Yifeng Pan ⋅ Dongbin Zhao
Embodied AI, Robotics & Autonomous Driving ExHall # 341
Deconfounded Lifelong Learning for Autonomous Driving via Dynamic Knowledge Spaces Poster Session 6
Jiayuan Du ⋅ Yuebing Song ⋅ Yiming Zhao ⋅ Xianghui Pan ⋅ Jiawei Lian ⋅ Yuchu Lu ⋅ Liuyi Wang ⋅ Chengju Liu ⋅ Qijun Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 340
Agentic Collaborative Cognition for Zero-Shot 3D Understanding Poster Session 6
Wenxin Wang ⋅ Bo Zhang ⋅ Feng Chen ⋅ Zixuan Wang ⋅ Wen Li ⋅ Changsheng Li ⋅ Yinjie Lei
Embodied AI, Robotics & Autonomous Driving ExHall # 339
MobileManiBench: Simplifying Model Verification for Mobile Manipulation Poster Session 6
Wenbo Wang ⋅ Fangyun Wei ⋅ Qixiu Li ⋅ Xi Chen ⋅ Yaobo Liang ⋅ Chang Xu ⋅ Jiaolong Yang ⋅ Baining Guo
Embodied AI, Robotics & Autonomous Driving ExHall # 338
RelAfford6D: Relational 6D Affordance Graphs for Constraint-Driven Robotic Manipulation Poster Session 6
Guodong Zhang ⋅ Qichen He ⋅ Wenyuan Xie ⋅ Shaokai Wu ⋅ Yanbiao Ji ⋅ Qiuchang Li ⋅ Bayram Bayramli ⋅ Yue Ding ⋅ Hongtao Lu
Embodied AI, Robotics & Autonomous Driving ExHall # 337
Stabilizing Real-World Visual Active Tracking with Action-Smooth Test-Time Adaptation Poster Session 6
Haowei Sun ⋅ Shiteng Zhang ⋅ Jinwu Hu ⋅ Kaining Chen ⋅ Mingkui Tan
Embodied AI, Robotics & Autonomous Driving ExHall # 336
FlowDec: Temporal Conditional Flow Decorruptor for Robust Continuous Vision-Language Navigation Poster Session 6
Yufei Zhang ⋅ Changhao Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 335
CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement Poster Session 6
Zhihao Yang ⋅ Zhiyu Xiang ⋅ Peng Xu ⋅ Tianyu Pu ⋅ Kai Wang ⋅ Eryun Liu ⋅ Dongping Zhang ⋅ Yong Ding
Embodied AI, Robotics & Autonomous Driving ExHall # 332
SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation Poster Session 6
Haidong Cao ⋅ Wenjun Cao ⋅ Quanhao Li ⋅ Sicheng Xie ⋅ Zhiying Du ⋅ Jiaqi Leng ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Embodied AI, Robotics & Autonomous Driving ExHall # 331
R3DP: Real-Time 3D-Aware Policy for Embodied Manipulation Poster Session 6
Yuhao Zhang ⋅ Wanxi Dong ⋅ Yue Shi ⋅ Yi Liang ⋅ Jingnan Gao ⋅ Qiaochu Yang ⋅ Yaxing Lyu ⋅ Zhixuan Liang ⋅ Yibin Liu ⋅ Congsheng Xu ⋅ Xianda Guo ⋅ Wei Sui ⋅ Yaohui Jin ⋅ Xiaokang Yang ⋅ Yanyan Xu ⋅ Yao Mu
Embodied AI, Robotics & Autonomous Driving ExHall # 330
PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas Poster Session 6
Chan Lee ⋅ Kimin Yun ⋅ Yuseok Bae ⋅ Seong Tae Kim ⋅ Jung Uk Kim
Embodied AI, Robotics & Autonomous Driving ExHall # 329
Doe-2: 3D Representation World Model for Unified Driving Scene Forecasting Poster Session 6
Dong Zhuo ⋅ Wenzhao Zheng ⋅ Sicheng Zuo ⋅ Yuanhui Huang ⋅ Siming Yan ⋅ Lu Hou ⋅ Jie Zhou ⋅ Jiwen Lu
Embodied AI, Robotics & Autonomous Driving ExHall # 328
PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving Poster Session 6
Pin Tang ⋅ Guoqing Wang ⋅ Xiangxuan Ren ⋅ Zhongdao Wang ⋅ Guodongfang Zhao ⋅ Bailan Feng ⋅ Chao Ma
Embodied AI, Robotics & Autonomous Driving ExHall # 327
QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception Poster Session 6
Seth Zhao ⋅ Huizhi Zhang ⋅ Zhaowei Li ⋅ Juntong Peng ⋅ Anthony Chui ⋅ Zewei Zhou ⋅ Zonglin Zonglin ⋅ Hao Xiang ⋅ Zhiyu Huang ⋅ Fujia Wang ⋅ Ran Tian ⋅ Chenfeng Xu ⋅ Bolei Zhou ⋅ Jiaqi Ma
Embodied AI, Robotics & Autonomous Driving ExHall # 326
VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model Poster Session 6
Xiangyu Sun ⋅ Shijie Wang ⋅ Fengyi Zhang ⋅ Lin Liu ⋅ Caiyan Jia ⋅ Ziying Song ⋅ Zi Helen Huang ⋅ Yadan Luo
Embodied AI, Robotics & Autonomous Driving ExHall # 324
Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout Poster Session 6
Haozhuang Chi ⋅ Daosheng Qiu ⋅ Hao Su ⋅ Haochen Liu ⋅ Zirui Li ⋅ Haoruo Zhang ⋅ Chen Lv
Embodied AI, Robotics & Autonomous Driving ExHall # 323
TEX-Drive: Temporal Perception Meets Experience-Guided Mixture-of-Experts for End-to-End Autonomous Driving Poster Session 6
Yitong Li ⋅ Xuchong Zhang ⋅ Fanjie Kong ⋅ Weihuang Chen ⋅ Haonan Hou ⋅ Hongbin Sun
Embodied AI, Robotics & Autonomous Driving ExHall # 321
Walk through Paintings : Ego-centric World models from Internet Priors Poster Session 6
Anurag Bagchi ⋅ Zhipeng Bao ⋅ Homanga Bharadhwaj ⋅ Yu-Xiong Wang ⋅ Pavel Tokmakov ⋅ Martial Hebert
Embodied AI, Robotics & Autonomous Driving ExHall # 320
CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models Poster Session 6
Li Gao ⋅ Liu Liu ⋅ Mingyang Lyu ⋅ Yang Cai
Embodied AI, Robotics & Autonomous Driving ExHall # 319
AgentVLN: Towards Agentic Vision-and-Language Navigation Poster Session 6
Zihao Xin ⋅ Wentong Li ⋅ Yixuan Jiang ⋅ Ziyuan Huang ⋅ Bin Wang ⋅ Piji Li ⋅ Jianke Zhu ⋅ Jie Qin ⋅ Sheng-Jun Huang
Embodied AI, Robotics & Autonomous Driving ExHall # 318
Masked Depth Modeling for Spatial Perception Poster Session 6
Bin Tan ⋅ CHANGJIANG SUN ⋅ Xiage Qin ⋅ Hanat Adai ⋅ Zelin Fu ⋅ Tianxiang Zhou ⋅ Han Zhang ⋅ YINGHAO XU ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Nan Xue
Embodied AI, Robotics & Autonomous Driving ExHall # 317
Unordered Landmark Visual Navigation Poster Session 6
Hao Ren ⋅ Junzhe Zhu ⋅ Yihan Li ⋅ Zetong Bi ⋅ Le Zheng ⋅ Zhi Li ⋅ Yiqing Yuan ⋅ Zhaoliang Wan ⋅ Dizhe Zhang ⋅ Lu Qi ⋅ HUI CHENG
Embodied AI, Robotics & Autonomous Driving ExHall # 316
Learning Transferable Dynamics Priors from Action to World Modeling Poster Session 6
Ze Huang ⋅ Zhang Jiahui ⋅ Hairuo Liu ⋅ Chenxi Zhang ⋅ Ran Cheng ⋅ Li Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 315
SparseDriveV2: Scoring is All You Need for End-to-End Autonomous Driving Poster Session 6
Wenchao Sun ⋅ Xuewu Lin ⋅ Keyu Chen ⋅ Zixiang Pei ⋅ Xiang LI ⋅ Yining Shi ⋅ Sifa ZHENG
Embodied AI, Robotics & Autonomous Driving ExHall # 314
CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views Poster Session 6
Alexey Gavryushin ⋅ Dingxi Zhang ⋅ Zhao Huang ⋅ Alexandros Delitzas ⋅ Jiaqi Chen ⋅ Ben Ellis ⋅ Cedric Zöllner ⋅ Manthan Patel ⋅ Manuel Kaufmann ⋅ Marc Pollefeys ⋅ Xi Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 313
VLA-JEPA: Enhancing Vision-Language-Action Model with Latent World Model Poster Session 6
Jingwen Sun ⋅ Wenyao Zhang ⋅ Zekun Qi ⋅ Shaojie Ren ⋅ Zezhi Liu ⋅ Hanxin Zhu ⋅ Guangzhong Sun ⋅ Xin Jin ⋅ Zhibo Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 312
Understanding Cross-Rig Generalization in Automotive Perception: a Multi-Rig Benchmark and Rig Variation Metrics Poster Session 6
Tim Alexander Bader ⋅ Tim Eberhardt ⋅ Maximilian Dillitzer ⋅ Wilhelm Stork
Embodied AI, Robotics & Autonomous Driving ExHall # 311
ConTrack: Constrained Hand Motion Tracking with Adaptive Trade-off Control Poster Session 6
Yutong Liang ⋅ Quanquan Peng ⋅ Rizhao Qiu ⋅ Xiaolong Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 310
Grasp-Oriented Non-Prehensile Manipulation via Learning a Graspability Field Poster Session 6
Licheng Zhong ⋅ Gim Hee Lee
Embodied AI, Robotics & Autonomous Driving ExHall # 309
ORION: Ordinal Neural Collapse as a Representation Prior for Visual Navigation Poster Session 6
E In Son ⋅ Jung-Taak Kim ⋅ Seung-Woo Seo
Embodied AI, Robotics & Autonomous Driving ExHall # 308
A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world Poster Session 6
Steeven Janny ⋅ Leonid Antsfeld ⋅ Christian Wolf
Embodied AI, Robotics & Autonomous Driving ExHall # 307
ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency Poster Session 6
Shih-Po Lee ⋅ Reza Ghoddoosian ⋅ Faizan Siddiqui ⋅ Enna Sachdeva ⋅ Behzad Dariush
Embodied AI, Robotics & Autonomous Driving ExHall # 306
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning Poster Session 6
HAIHONG HAO ⋅ Lei Chen ⋅ Mingfei Han ⋅ Changlin Li ⋅ Dong An ⋅ Yuqiang Yang ⋅ Zhihui Li ⋅ Xiaojun Chang
Embodied AI, Robotics & Autonomous Driving ExHall # 281
Beyond Dense Futures: World Models as Structured Planners for Robotic Manipulation Poster Session 6
Minghao Jin ⋅ Mozheng Liao ⋅ Mingfei Han ⋅ Zhihui Li ⋅ Xiaojun Chang
Embodied AI, Robotics & Autonomous Driving ExHall # 282
OmniNWM: Unifying the State-Action-Reward Triad for Closed-Loop Panoramic Driving Navigation World Models Poster Session 6
Bohan Li ⋅ Zhuang Ma ⋅ Dalong Du ⋅ Baorui Peng ⋅ Zhujin Liang ⋅ Zhenqiang Liu ⋅ Xianda Guo ⋅ Chao Ma ⋅ Yueming Jin ⋅ Zheng Zhu ⋅ HAO ZHAO ⋅ Wenjun Zeng ⋅ Xin Jin
Embodied AI, Robotics & Autonomous Driving ExHall # 283
ChronoFlow Policy: Unifying Past-Future Interaction Flow in Visuomotor Policy Learning Poster Session 6
Bokai Lin ⋅ Yifu Xu ⋅ Xinyu Zhan ⋅ Hongjie Fang ⋅ Jialin Tian ⋅ Fu-Cheng Zhang ⋅ Yong-Lu Li ⋅ Cewu Lu ⋅ Lixin Yang
Embodied AI, Robotics & Autonomous Driving ExHall # 284
HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving Poster Session 6
Wenhao Yao ⋅ Xinglong Sun ⋅ Zhenxin Li ⋅ Shiyi Lan ⋅ Zi Wang ⋅ Jose M Alvarez ⋅ Zuxuan Wu
Embodied AI, Robotics & Autonomous Driving ExHall # 285
DriveVA: Video Action Models are Zero-Shot Drivers Poster Session 6
Mengmeng Liu ⋅ Diankun Zhang ⋅ Jiuming Liu ⋅ Jianfeng Cui ⋅ Hongwei Xie ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Michael Yang ⋅ Francesco Nex ⋅ Hao Cheng
Embodied AI, Robotics & Autonomous Driving ExHall # 286
RoMan-4D: Learning Robot Arm Manipulation from 4D World Models Poster Session 6
Kaichen Zhou ⋅ Yuzhen Chen ⋅ Fangneng Zhan ⋅ Hang Hua ⋅ Grace Chen ⋅ Xinhai Chang ⋅ Ao Qu ⋅ Yilun Du ⋅ Zhuang Liu ⋅ Paul Pu Liang ⋅ Mengyu Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 287
SPEAR: A Simulator for Photorealistic Embodied AI Research Poster Session 6
Mike Roberts ⋅ Renhan Wang ⋅ Rushikesh Zawar ⋅ Rachith Dey-Prakash ⋅ Quentin Leboutet ⋅ Stephan Richter ⋅ Matthias Müller ⋅ German Ros ⋅ Rui Tang ⋅ Stefan Leutenegger ⋅ Yannick Hold-Geoffroy ⋅ Kalyan Sunkavalli ⋅ Vladlen Koltun
Embodied AI, Robotics & Autonomous Driving ExHall # 288
OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction Poster Session 6
Zeyu CAI ⋅ Yuliang Xiu ⋅ renke wang ⋅ Zhijing Shao ⋅ Xiaoben Li ⋅ YU Siyuan ⋅ Chao Xu ⋅ Yang Liu ⋅ Baigui Sun ⋅ Jian Yang ⋅ zhenyu zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 289
Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving Poster Session 6
Zongzheng Zhang ⋅ Jijun Wang ⋅ Saining Zhang ⋅ Wang Shuo ⋅ Yiru Wang ⋅ Hai Yang ⋅ Yang Chen ⋅ Yuwen Heng ⋅ HAO SUN ⋅ Jiang anqing ⋅ HAO ZHAO
Embodied AI, Robotics & Autonomous Driving ExHall # 290
Panoramic Affordance Prediction Poster Session 6
Zixin Zhang ⋅ Chenfei Liao ⋅ Hongfei Zhang ⋅ Harold Haodong Chen ⋅ Kanghao Chen ⋅ Zichen Wen ⋅ Litao Guo ⋅ Bin Ren ⋅ Xu Zheng ⋅ Yinchuan Li ⋅ Xuming Hu ⋅ Nicu Sebe ⋅ Yingcong Chen
Embodied AI, Robotics & Autonomous Driving ExHall # 291
HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions Poster Session 6
Yukang Cao ⋅ Haozhe Xie ⋅ Fangzhou Hong ⋅ Long Zhuo ⋅ Zhaoxi Chen ⋅ Liang Pan ⋅ Ziwei Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 292
CabinSI: Omni-Cabin Spatial Reasoning through Explicit Visual Cognitive Maps Poster Session 6
Mengxue Qu ⋅ Hengrui Hu ⋅ Mingming Ma ⋅ Ming Lei ⋅ Jie Gao ⋅ Henghui Ding ⋅ Yao Zhao ⋅ Kenn wu ⋅ Yunchao Wei
Embodied AI, Robotics & Autonomous Driving ExHall # 293
Towards Generalizable Robotic Manipulation in Dynamic Environments Poster Session 6
Heng Fang ⋅ Shangru Li ⋅ Shuhan Wang ⋅ Xuanyang Xi ⋅ Dingkang Liang ⋅ Xiang Bai
Embodied AI, Robotics & Autonomous Driving ExHall # 294
EffiDINO: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency Poster Session 6
Jianjian Yin ⋅ Liulei Li ⋅ Tao Chen ⋅ Yi Chen ⋅ Yazhou Yao ⋅ Wenguan Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 295
Spatial Amsan: A Benchmark for Perception-Grounded Spatial Reasoning and Action Evaluation in Egocentric Manipulation Poster Session 6
Changsoo Jung ⋅ Jack Fitzgerald ⋅ Ethan Seefried ⋅ Mariah Bradford ⋅ Nathaniel Blanchard
Embodied AI, Robotics & Autonomous Driving ExHall # 296
DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation Poster Session 6
Junzhe Jiang ⋅ Zipei Ma ⋅ Zijie Pan ⋅ Li Zhang
Embodied AI, Robotics & Autonomous Driving ExHall # 297
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams Poster Session 6
Yibin Yan ⋅ Jilan Xu ⋅ Shangzhe Di ⋅ Haoning Wu ⋅ Weidi Xie
Embodied AI, Robotics & Autonomous Driving ExHall # 298
ASSCG: Just-Right Gating over Chattering for Fast–Slow LLM Planning in Autonomous Driving Poster Session 6
Sining Ang ⋅ Yuan Chen ⋅ Liu Haiyan ⋅ Xuanyao Mao ⋅ jason bao ⋅ Xuliang Xuliang ⋅ Bingchuan Sun ⋅ Yan Wang
Embodied AI, Robotics & Autonomous Driving ExHall # 299
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation Poster Session 6
Kangyi Wu ⋅ Pengna Li ⋅ Kailin Lyu ⋅ Xi Lin ⋅ Lin Zhao ⋅ Qingrong He ⋅ Jinjun Wang ⋅ Jianyi Liu
Embodied AI, Robotics & Autonomous Driving ExHall # 300
Beyond Imitation: Learning Safe End-to-End Autonomous Driving from Hard Negatives Poster Session 6
Junli Wang ⋅ HuaZhihua HuaZhihua ⋅ Xueyi Liu ⋅ Zebin Xing ⋅ Wei Zhang ⋅ Kun Ma ⋅ Guang Chen ⋅ Hangjun Ye ⋅ Long Chen ⋅ Pengxuan Yang
Embodied AI, Robotics & Autonomous Driving ExHall # 301
Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection Poster Session 5
Aoting Zhang ⋅ Dongbao Yang ⋅ Chang Liu ⋅ Xiaopeng Hong ⋅ Can Ma ⋅ Yu ZHOU
Federated, Continual & Efficient Learning; Model Security ExHall # 346
Graph Coloring for Multi-Task Learning Poster Session 5
Santosh Patapati ⋅ Ian Noronha
Federated, Continual & Efficient Learning; Model Security ExHall # 347
S2-FracMix: Self-Saliency Fractal Mixup Poster Session 5
Khawar Islam ⋅ Arif Mahmood ⋅ Xin Jin ⋅ NAVEED AKHTAR
Federated, Continual & Efficient Learning; Model Security ExHall # 348
SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting Poster Session 5
YU SONG ⋅ Hao Sun ⋅ TENG SHIYU ⋅ Ikuko Nishikawa ⋅ Yen-wei Chen
Federated, Continual & Efficient Learning; Model Security ExHall # 349
FedNASP: Federated Vision-Language Navigation with Adaptive Step-wise Personalization Poster Session 5
Qingqian Yang ⋅ Hao Wang ⋅ Sai Qian Zhang ⋅ Jian Li ⋅ Yang Hua ⋅ Miao Pan ⋅ Tao Song ⋅ Zhengwei Qi ⋅ Haibing Guan
Federated, Continual & Efficient Learning; Model Security ExHall # 350
OrthoTailor: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation Poster Session 5
Zhaotong Yang ⋅ Ying Tai ⋅ Jiahui Zhan ⋅ Yu Zheng ⋅ Jianjun Qian ⋅ Jian Yang
Federated, Continual & Efficient Learning; Model Security ExHall # 351
Shared LoRA Subspaces for almost Strict Continual Learning Poster Session 5
Prakhar Kaushik ⋅ Ankit Vaidya ⋅ Shravan Sunil Chaudhari ⋅ Rama Chellappa ⋅ Alan Yuille
Federated, Continual & Efficient Learning; Model Security ExHall # 352
Improving Adversarial Robustness via Activation Amplification and Attenuation Poster Session 5
Taïga Gonçalves ⋅ Yongsong Huang ⋅ Tomo Miyazaki ⋅ Shinichiro Omachi
Federated, Continual & Efficient Learning; Model Security ExHall # 353
Capacity Overflow: A Blind Spot for Backdoor Attacks in Vision MoE Poster Session 5
Xiaolin Xu ⋅ Tiancheng Zheng ⋅ Xiaolin Xu ⋅ Ruyi Ding
Federated, Continual & Efficient Learning; Model Security ExHall # 354
MixCompress: Mixture of Experts for Variable Rate Learned Image Compression Poster Session 5
Calvin-Khang Ta ⋅ Praneet Singh ⋅ Tong Shao ⋅ Peng Yin
Federated, Continual & Efficient Learning; Model Security ExHall # 355
Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation Poster Session 5
Sungjune Kim ⋅ Sangpil Kim ⋅ Honglak Lee
Federated, Continual & Efficient Learning; Model Security ExHall # 356
SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing Poster Session 5
Xuanyi Zhou ⋅ Qiuyang Mang ⋅ Shuo Yang ⋅ Haocheng Xi ⋅ Jintao Zhang ⋅ Huanzhi Mao ⋅ Joseph E Gonzalez ⋅ Kurt Keutzer ⋅ Ion Stoica ⋅ Alvin Cheung
Federated, Continual & Efficient Learning; Model Security ExHall # 357
Learning to Recover Task Experts from a Multi-Task Merged Model Poster Session 5
Jinwook Jung ⋅ Taegyu Kim ⋅ Kumju Jo ⋅ Sungyong Baik
Federated, Continual & Efficient Learning; Model Security ExHall # 358
Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE Poster Session 5
Haoyou Deng ⋅ Keyu Yan ⋅ Chaojie Mao ⋅ Xiang Wang ⋅ Yu Liu ⋅ Changxin Gao ⋅ Nong Sang
Federated, Continual & Efficient Learning; Model Security ExHall # 360
Residual-Guided Expert Specialization for Incomplete Multimodal Learning Poster Session 5
Seunghun Baek ⋅ Jihwan Park ⋅ Jaeyoon Sim ⋅ Minjae Jeong ⋅ Hoseok Lee ⋅ Won Hwa Kim
Federated, Continual & Efficient Learning; Model Security ExHall # 361
On the Vulnerability of Parameter-Level Defenses to Model Merging Poster Session 5
Kuangpu Guo ⋅ Jian Liang ⋅ Qingyan Zheng ⋅ Yu Yongcan ⋅ Zilei Wang ⋅ Ran He ⋅ Tieniu Tan
Federated, Continual & Efficient Learning; Model Security ExHall # 362
Unified Multi-Layer Subspace Modeling for Cross-Domain OOD Detection Poster Session 5
Gerhard Krumpl ⋅ Henning Avenhaus ⋅ Horst Possegger
Federated, Continual & Efficient Learning; Model Security ExHall # 363
GCMRD: Global Consistency Multi-teacher Robustness Distillation Poster Session 5
Yuhang Zhou ⋅ Zhongyun Hua ⋅ Rushi Lan ⋅ Qing Liao ⋅ Wei Jiang
Federated, Continual & Efficient Learning; Model Security ExHall # 364
Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation Poster Session 5
Hyun-Kurl Jang ⋅ Jihun Kim ⋅ Hyeokjun Kweon ⋅ KUK-JIN YOON
Federated, Continual & Efficient Learning; Model Security ExHall # 365
Benchmarking Federated Learning & Knowledge Distillation for Point Cloud Classification Poster Session 5
Aizierjiang Aiersilan
Federated, Continual & Efficient Learning; Model Security ExHall # 368
VLOD-TTA: Test-Time Adaptation of Vision-Language Object Detectors Poster Session 5
Atif Belal ⋅ Heitor Medeiros ⋅ Marco Pedersoli ⋅ Eric Granger
Federated, Continual & Efficient Learning; Model Security ExHall # 369
CL-Anomaly: Layer-Adaptive Mixture-of-Experts with Multimodal Large Language Model for Continual Learning in Anomaly Detection Poster Session 5
Wen Dong ⋅ Zhao Wang ⋅ Shuangqing Zhang ⋅ Kai Sun ⋅ Ben Li ⋅ Guosen Xie ⋅ Caifeng Shan ⋅ Fang Zhao
Federated, Continual & Efficient Learning; Model Security ExHall # 370
Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models Poster Session 5
Yiwen Liang ⋅ Hui Chen ⋅ Yizhe Xiong ⋅ Mengyao Lyu ⋅ Yuhan Cao ⋅ Zijia Lin ⋅ SHUAICHENG NIU ⋅ Sicheng Zhao ⋅ Jungong Han ⋅ Guiguang Ding
Federated, Continual & Efficient Learning; Model Security ExHall # 371
VLMSysTrojan: Stealthy System-Aware Backdoor Attacks Against Vision-Language Models Poster Session 5
Yezheng Cheng ⋅ Zexin Li ⋅ Jiaqi Wu ⋅ Zhihong Zhang ⋅ Simin Chen
Federated, Continual & Efficient Learning; Model Security ExHall # 372
Holistic Optimal Label Selection for Robust Prompt Learning under Partial Labels Poster Session 5
Yaqi Zhao ⋅ Haoliang Sun ⋅ Yating Wang ⋅ Yongshun Gong ⋅ Yilong Yin
Federated, Continual & Efficient Learning; Model Security ExHall # 373
Rethinking Adversary in Semantic Segmentation: An Out-of-Distribution Perspective Poster Session 5
Shuchang Wang ⋅ Shuchang Wang ⋅ Xiaoman Liu ⋅ Zhenbo Shi ⋅ Zhidong Yu ⋅ weisongjn weisongjn ⋅ Wei Yang
Federated, Continual & Efficient Learning; Model Security ExHall # 374
RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models Poster Session 5
Zijun Liao ⋅ Yian Zhao ⋅ Xin Shan ⋅ Yu Yan ⋅ Chang Liu ⋅ lei lu ⋅ Xiangyang Ji ⋅ Jie Chen
Federated, Continual & Efficient Learning; Model Security ExHall # 375
Dive into the implicit biases of low-rank vision-language alignment Poster Session 5
Mingjia Shi ⋅ Shuo Wang ⋅ Xiaobo Wang ⋅ Sifan Zhou ⋅ Kai Wang ⋅ Tianyu Fu ⋅ Chenxu Zhao ⋅ Anyang Su ⋅ Ping Jiang ⋅ Minghui Wu
Federated, Continual & Efficient Learning; Model Security ExHall # 376
TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger Poster Session 5
Vu Truong ⋅ Long Bao Le
Federated, Continual & Efficient Learning; Model Security ExHall # 377
Neural Collapse-Inspired Multi-Label Federated Learning under Label-Distribution Skew Poster Session 5
Can Peng ⋅ Yuyuan Liu ⋅ YINGYU YANG ⋅ Pramit Saha ⋅ Qianye Yang ⋅ J. Noble
Federated, Continual & Efficient Learning; Model Security ExHall # 378
MagicPrompt: Ultra-Lightweight Prompt Tuning for Video Generation Poster Session 5
Yinhan Zhang ⋅ DINGWEI TAN ⋅ Xianghao Kong ⋅ Yue Ma ⋅ Yeying Jin ⋅ Anyi Rao
Federated, Continual & Efficient Learning; Model Security ExHall # 379
CollectionLoRA: Collecting 50 Effects in 1 LoRA for Deployment Poster Session 5
Fangtai Wu ⋅ Hailong Guo ⋅ Shijie Huang ⋅ Jiayi Song ⋅ Yubo Huang ⋅ Mushui Liu ⋅ Zhao Wang ⋅ Yunlong Yu ⋅ Jiaming Liu ⋅ Ruihua Huang
Federated, Continual & Efficient Learning; Model Security ExHall # 380
VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning Poster Session 5
Mingkang Dong ⋅ Hongyi Cai ⋅ jie li ⋅ Sifan Zhou ⋅ Bin Ren ⋅ Kunyu Peng ⋅ Yuqian Fu
Federated, Continual & Efficient Learning; Model Security ExHall # 381
Learning 1-Bit LiDAR-based Localization with Auxiliary Objective Poster Session 5
Kaijie Yin ⋅ Zhiyuan Zhang ⋅ Tian Gao ⋅ Wentao Zhu ⋅ Cheng-zhong Xu ⋅ Hui Kong
Federated, Continual & Efficient Learning; Model Security ExHall # 382
Task-Agnostic Incremental Vision-Language Object Detection via Prompt Augmentation and Distribution-Aware Fusion Poster Session 5
Yonghan Jiang ⋅ Zhengyuan Xie ⋅ Wenchu Liu ⋅ Linlan Huang ⋅ Fei Yang ⋅ Xialei Liu
Federated, Continual & Efficient Learning; Model Security ExHall # 383
Point Ladder Tuning: Parameter-Efficient Hierarchical Adaptation for 3D Point Cloud Understanding Poster Session 5
Junlin Chang ⋅ Longhao Zou ⋅ Rui Li
Federated, Continual & Efficient Learning; Model Security ExHall # 384
FedMental: Topology-Aware Federated Prototype Learning for Polymorphic Multimodal Psychiatry Poster Session 5
Haoyu Li ⋅ He Li ⋅ Wenke Huang ⋅ Yujing Rao ⋅ Xiaofen Zong ⋅ Mang Ye
Federated, Continual & Efficient Learning; Model Security ExHall # 386
AnchorGUI: Asymmetric Memory for Dual-Scale Learning in GUI Navigation Poster Session 5
Shengjie Jin ⋅ Zelong Sun ⋅ Hengbo Xu ⋅ Yanbiao Ma ⋅ Zhiwu Lu
Federated, Continual & Efficient Learning; Model Security ExHall # 387
Prevention over Correction: Learning Aligned Representations in One-shot Federated Learning Poster Session 5
YongHoon Kang ⋅ Jee-Hyong LEE
Federated, Continual & Efficient Learning; Model Security ExHall # 388
TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction Poster Session 5
Nikos Athanasiou ⋅ Ilya A. Petrov ⋅ Angela Yao ⋅ Shugao Ma ⋅ Eric Sauser ⋅ Edoardo Remelli ⋅ Shreyas Hampali ⋅ Johannes Schönberger ⋅ Fadime Sener ⋅ Bugra Tekin
Federated, Continual & Efficient Learning; Model Security ExHall # 389
MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation Poster Session 5
Sajjad Ghiasvand ⋅ Haniyeh Oskouie ⋅ Mahnoosh Alizadeh ⋅ Ramtin Pedarsani
Federated, Continual & Efficient Learning; Model Security ExHall # 390
MED-LCDS: Multi-Expert-Domain CLIP Classification via Logit Calibration Poster Session 5
Zheng Zeng ⋅ Deepak Sridhar ⋅ Nuno Vasconcelos
Federated, Continual & Efficient Learning; Model Security ExHall # 391
Training-Free Task Classification for Multi-Task Model Merging Poster Session 5
JUNGYONG SON ⋅ Jinwook Jung ⋅ Sungyong Baik
Federated, Continual & Efficient Learning; Model Security ExHall # 392
Rank-Aware Hyperbolic Alignment for Vision–Language Dataset Distillation Poster Session 5
Jongoh Jeong ⋅ Sun-Kyung Lee ⋅ KUK-JIN YOON
Federated, Continual & Efficient Learning; Model Security ExHall # 393
Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment Poster Session 5
Jonghyun Park ⋅ Minhyuk Seo ⋅ Chaewon YEO ⋅ Jonghyun Choi
Federated, Continual & Efficient Learning; Model Security ExHall # 394
Stay Unique, Stay Efficient: Preserving Model Personality in Multi-Task Merging Poster Session 5
Kuangpu Guo ⋅ Aijing Yu ⋅ Jian Liang ⋅ Yuhe Ding ⋅ Zilei Wang ⋅ Ran He ⋅ Tieniu Tan
Federated, Continual & Efficient Learning; Model Security ExHall # 395
SegPAR: Class-Centric Decision-Based Sparse Attack for Semantic Segmentation Poster Session 5
Dongsu Song ⋅ Daeyun Go ⋅ BOSEUNG SEO ⋅ Jay Hoon Jung
Federated, Continual & Efficient Learning; Model Security ExHall # 396
SUM: Unified Geometric Surgery on Spatio-Temporal Adaptation Vectors for Federated Class Incremental Learning Poster Session 5
Jaeik Kim ⋅ Jaeyoung Do
Federated, Continual & Efficient Learning; Model Security ExHall # 397
FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity Poster Session 5
Ganghyeon Lee ⋅ inha Lee ⋅ Junhee Lee ⋅ Jeongeon Lee ⋅ Sung Whan Yoon ⋅ Kyungdon Joo
Federated, Continual & Efficient Learning; Model Security ExHall # 398
Distill on a Diet: Efficient Knowledge Distillation via Learnable Data Pruning Poster Session 5
Yifan Wu ⋅ Yiqi Wang ⋅ Xichen Ye ⋅ Wenjing Yan ⋅ Xiaoqiang Li ⋅ Cheng Jin ⋅ WEIZHONG ZHANG ⋅ Xiangyu Yue
Federated, Continual & Efficient Learning; Model Security ExHall # 400
Why Feature Magnitude Deceives OOD Detectors: An Angular Separation Perspective Poster Session 5
Hanlin Li ⋅ Jing Ma ⋅ Zehang Wei ⋅ Jiamin Yan ⋅ Xiang Xiang
Federated, Continual & Efficient Learning; Model Security ExHall # 401
SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation Poster Session 5
Víctor Barreiro ⋅ Johannes Jakubik ⋅ Francisco Argüello ⋅ Dora Heras
Federated, Continual & Efficient Learning; Model Security ExHall # 402
Fisher-Routed Mixture of Experts for Federated Class-Incremental Learning Poster Session 5
Wenhao Yuan ⋅ Chenchen Lin ⋅ Jian Chen ⋅ Jinfeng Xu ⋅ Zewei Liu ⋅ Edith C. H. Ngai
Federated, Continual & Efficient Learning; Model Security ExHall # 403
Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving Poster Session 5
Adwait Chandorkar ⋅ Kai Krink ⋅ Yerdana Maulenbay ⋅ Hasan Tercan ⋅ Tobias Meisen
Federated, Continual & Efficient Learning; Model Security ExHall # 404
SCoT: Similarity-guided Conflict-aware Task Consolidation for Continual VQA Poster Session 5
Anand Patel ⋅ Moloud Abdar ⋅ Biplab Banerjee
Federated, Continual & Efficient Learning; Model Security ExHall # 405
Zero-Shot Quantization for Object Detectors using Off-the-Shelf Generative Models Poster Session 5
Hyunho Lee ⋅ Kyomin Hwang ⋅ Hyeonjin Kim ⋅ Suyoung Kim ⋅ Sunghyun Wee ⋅ Nojun Kwak
Federated, Continual & Efficient Learning; Model Security ExHall # 406
DA-MergeLoRA: Hypernetwork-Based LoRA Merging for Few-Shot Test-Time Domain Adaptation Poster Session 5
Siobhan Reid ⋅ Zhixiang Chi ⋅ Li Gu ⋅ Omid Heidari ⋅ Ziqiang Wang ⋅ Yang Wang
Federated, Continual & Efficient Learning; Model Security ExHall # 407
Importance-Aware Low-Rank Distillation of Diffusion Transformers Poster Session 5
Denis Zavadski ⋅ Sebastian Heid ⋅ Damjan Kalšan ⋅ Stefan Roth ⋅ Carsten Rother
Federated, Continual & Efficient Learning; Model Security ExHall # 408
MixTTA: Low-Rank Cross-Channel Mixing for Reliable Test-Time Adaptation Poster Session 5
Mansoo Jung ⋅ Youngwook Kim ⋅ Jungwoo Lee
Federated, Continual & Efficient Learning; Model Security ExHall # 409
BATQuant: Outlier-Resilient MXFP4 Quantization via Learnable Block-wise Optimization Poster Session 5
Jifu Li ⋅ Manyi Zhang ⋅ Xiaobo Xia ⋅ Han Bao ⋅ Haoli Bai ⋅ Zhenhua Dong ⋅ Xianzhi Yu
Federated, Continual & Efficient Learning; Model Security ExHall # 410
Molecular Identifier Visual Prompting and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing Poster Session 5
Jiahe Song ⋅ Chuang Wang ⋅ Yinfan Wang ⋅ Hao Zheng ⋅ Bowen Jiang ⋅ Rui Nie ⋅ Xingjian Wei ⋅ Junyuan Gao ⋅ Yubin Wang ⋅ Bin Wang ⋅ Lijun Wu ⋅ Jiang Wu ⋅ Qian Yu ⋅ Conghui He
Federated, Continual & Efficient Learning; Model Security ExHall # 411
Prototype Normalization: Optimizing Prototype Separation for Heterogeneous Federated Learning Poster Session 5
Daeyoung Choi ⋅ Jihwan Shin ⋅ Gyuejeong Lee
Federated, Continual & Efficient Learning; Model Security ExHall # 412
ReTarget: Representation Transformation via Adversarial Regularization for Geometric Misalignment Poster Session 5
Jia-You Chen ⋅ Shang-Tse Chen
Federated, Continual & Efficient Learning; Model Security ExHall # 413
Flash-DD: An Ultra Parameter-Efficient Approach to Dataset Distillation Poster Session 5
Ruonan Yu ⋅ Songhua Liu ⋅ Xinchao Wang
Federated, Continual & Efficient Learning; Model Security ExHall # 414
Accurate Zero-shot Quantization via Hierarchical Teacher-Assistant Distillation Poster Session 5
Wonjin Cho ⋅ Jeongin Yun ⋅ U Kang
Federated, Continual & Efficient Learning; Model Security ExHall # 415
DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images Poster Session 5
Wu Ke ⋅ Yanan Zhang ⋅ Yingjie Gao ⋅ Wenhao Li ⋅ Chenyu Zhou ⋅ Xinzhu Ma ⋅ Di Huang ⋅ Di Huang
Federated, Continual & Efficient Learning; Model Security ExHall # 416
Diffusion to Obfuscation: Time-Adaptive Synthesized Generation Against Gradient Leakage Attacks in Federated Learning Poster Session 5
Farchan Raswa ⋅ Chun-Shien Lu ⋅ Jia-Ching Wang
Federated, Continual & Efficient Learning; Model Security ExHall # 427
H-SFP: Hierarchical Federated Learning with Decoupled Split-Model Prototyping Poster Session 5
Trung-Dung Tran ⋅ Nguyen Ha ⋅ Minh-Duong Nguyen ⋅ Van-Dinh Nguyen ⋅ Kok-Seng Wong
Federated, Continual & Efficient Learning; Model Security ExHall # 463
Stabilizing Ultra-Low-Bit Quantization of Multimodal LLMs via Global Bit Allocation Poster Session 5
Guilin Li ⋅ Yuexiao Ma ⋅ Yue Zhang ⋅ Xinxiong Wu ⋅ Jiaqi Zhou ⋅ Qingheng Zhang ⋅ Yan Zhang ⋅ Fei Chao ⋅ Xiawu Zheng ⋅ Rongrong Ji
Federated, Continual & Efficient Learning; Model Security ExHall # 467
MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding Poster Session 5
Bonan Zhang ⋅ Shiyu Dong ⋅ Quan Tran ⋅ Katharina Gschwind ⋅ Shuqi Yang ⋅ Sijia Chen ⋅ Adel Ahmadyan ⋅ Seungwhan Moon ⋅ Lu Zhang ⋅ Ahmed Kirmani ⋅ Babak Damavandi ⋅ Anuj Kumar
Federated, Continual & Efficient Learning; Model Security ExHall # 466
Isotropic Embedding Perturbations for Robust Vision Language Encoders Poster Session 5
Hyesong Choi ⋅ Daeun Kim ⋅ Song Park ⋅ Taekyung Kim ⋅ Byeongho Heo ⋅ Sangdoo Yun ⋅ Dongbo Min ⋅ Dongyoon Han
Federated, Continual & Efficient Learning; Model Security ExHall # 465
Condensing Large-Scale Datasets Directly with Minimal Information Loss Poster Session 5
Xinyi Shang ⋅ Peng Sun ⋅ Bei Shi ⋅ Zixuan Wang ⋅ Tao Lin
Federated, Continual & Efficient Learning; Model Security ExHall # 464
Preventing Expert Collapse in MoE-dVLMs via Modality-Wise Norm Alignment Poster Session 5
Zongkai Liu ⋅ Zhen Cao ⋅ Hui Zhang ⋅ Chao Yu ⋅ liqiang niu ⋅ Fandong Meng
Federated, Continual & Efficient Learning; Model Security ExHall # 462
Attention-Logit Steering to Compositional Generalization for Continual VQA Poster Session 5
Suyoung Yang
Federated, Continual & Efficient Learning; Model Security ExHall # 461
Indelible Backdoors: On the Limits of Post-Training Defenses Poster Session 5
Jingyi Guo ⋅ Thuy Dung Nguyen ⋅ Taylor T Johnson ⋅ Kevin Leach
Federated, Continual & Efficient Learning; Model Security ExHall # 460
FedDO: Dynamic Client Optimization for Adaptive Federated Learning Poster Session 5
Peixuan Tang ⋅ Xuehe Wang
Federated, Continual & Efficient Learning; Model Security ExHall # 459
Exploiting Local Flatness for Efficient Out-of-Distribution Detection Poster Session 5
Seonghwan Park ⋅ Hyunji Jung ⋅ Dongyeop Lee ⋅ Namhoon Lee
Federated, Continual & Efficient Learning; Model Security ExHall # 458
Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift Poster Session 5
Longtian Wang ⋅ Chenhao Lin ⋅ Zhengyu Zhao ⋅ Le Yang ⋅ Shiwei Wang ⋅ Yuhan Zhi ⋅ Xiaofei Xie ⋅ Chao Shen
Federated, Continual & Efficient Learning; Model Security ExHall # 457
Locality-Aware Continual Unlearning for Diffusion Models Poster Session 5
Naveen George ⋅ Naoki Murata ⋅ Yuhta Takida ⋅ Konda Reddy Mopuri ⋅ Yuki Mitsufuji
Federated, Continual & Efficient Learning; Model Security ExHall # 456
GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models Poster Session 5
Chaoxiang Cai ⋅ Minghe Weng ⋅ Jie Li ⋅ Yibo Jiang ⋅ Longrong Yang ⋅ Zequn Qin ⋅ Xi Li
Federated, Continual & Efficient Learning; Model Security ExHall # 454
SAMPLe: A Sharpness Aware Minimization based Optimizer for Prompt Learning in Vision-Language Models Poster Session 5
Hossein Rajoli nowdeh ⋅ Fatemeh Lotfi ⋅ Niloufar Alipour Talemi ⋅ Hossein Kashiani ⋅ Xiaolong Ma ⋅ Fatemeh Afghah
Federated, Continual & Efficient Learning; Model Security ExHall # 453
Stealthy Multi-task Adversarial Attacks Poster Session 5
Jiacheng Guo ⋅ Tianyun Zhang ⋅ Lei Li ⋅ Haochen Yang ⋅ Hongkai Yu ⋅ Minghai Qin
Federated, Continual & Efficient Learning; Model Security ExHall # 452
COLA: Continual Orthogonal Low-Rank Adaptation for Class-Incremental Learning Poster Session 5
Monu Nagar ⋅ Debasis Das
Federated, Continual & Efficient Learning; Model Security ExHall # 451
Multi-Hypothesis Test-Time Adaptation to Mitigate Underspecification Poster Session 5
Afshar Shamsi ⋅ Xiao-Yu Guo ⋅ Hamid Alinejad-Rokny ⋅ Arash Mohammadi ⋅ Damien Teney ⋅ Ehsan Abbasnejad
Federated, Continual & Efficient Learning; Model Security ExHall # 450
Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent Poster Session 5
Binger Chen ⋅ Tacettin Bök ⋅ Behnood Rasti ⋅ Volker Markl ⋅ Begüm Demir
Federated, Continual & Efficient Learning; Model Security ExHall # 449
Probe, Anchor, and Amend: Active Test-Time Adaptation of Vision-Language Models Poster Session 5
Jiaqi Lin ⋅ Chaoqi Chen ⋅ Xiasi Wang ⋅ Mingfu Yan ⋅ Jiancheng Huang ⋅ Jianzhuang Liu ⋅ Wenming Yang ⋅ Qingmin Liao
Federated, Continual & Efficient Learning; Model Security ExHall # 447
Going Deep: Deep Visual Prompting with LoTeP Poster Session 5
Zijie Zhao ⋅ Yanru Wu ⋅ Yuji Wang ⋅ Haohua Wang ⋅ Enming Zhang ⋅ Wai Kin Chan ⋅ Yang Li
Federated, Continual & Efficient Learning; Model Security ExHall # 446
VD-LoRA: Adaptive Reuse of Low-Rank Directions for Continual Learning Poster Session 5
Luqiong Ding ⋅ Jiayao Tan ⋅ Chenggong Ni ⋅ Fuyuan Hu ⋅ Fan Lyu
Federated, Continual & Efficient Learning; Model Security ExHall # 445
Robust onion: Peeling Open Vocab Object Detectors Under Noise Poster Session 5
Priyank Pathak ⋅ Mukilan Karuppasamy ⋅ Aaditya Baranwal ⋅ Shruti Vyas ⋅ Yogesh Rawat
Federated, Continual & Efficient Learning; Model Security ExHall # 448
Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding Poster Session 5
Xiangyue Liu ⋅ Zijian Zhang ⋅ Miles Yang ⋅ Zhao Zhong ⋅ Liefeng Bo ⋅ Ping Tan
Federated, Continual & Efficient Learning; Model Security ExHall # 444
COVERT: Privacy-Preserving Covariant Obfuscation for VLMaaS via Exact Reparameterization and Tailored Tuning Poster Session 5
Wenqiang Ruan ⋅ ZiRui Huang ⋅ Yu Lin ⋅ Qizhi Zhang ⋅ Yunlong Mao ⋅ Quanwei Cai ⋅ Jue Hong ⋅ Sheng Zhong ⋅ Ye Wu
Federated, Continual & Efficient Learning; Model Security ExHall # 443
SiGMA: Sign-Guided Merging and Adaptation framework for Multimodal Continual Instruction Tuning Poster Session 5
Keonhee Park ⋅ Gunhee Kim
Federated, Continual & Efficient Learning; Model Security ExHall # 442
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution Poster Session 5
Xumin Yu ⋅ ZUYAN LIU ⋅ Zhenyu Yang ⋅ Yuhao Dong ⋅ Shengsheng Qian ⋅ Jiwen Lu ⋅ Han Hu ⋅ Yongming Rao
Federated, Continual & Efficient Learning; Model Security ExHall # 441
Robust Trajectory Distillation: Hybrid Reweighting Meets Teacher-Inspired Targets Poster Session 5
KaifengChen KaifengChen ⋅ Lechao Cheng ⋅ Jiyang Li ⋅ Shengeng Tang ⋅ FanZhang FanZhang ⋅ Yantao Pan ⋅ Yaxiong Wang ⋅ Tianrui Hui ⋅ Zhun Zhong
Federated, Continual & Efficient Learning; Model Security ExHall # 440
BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming Poster Session 5
Jiaxiang Liu ⋅ Tianxiang Hu ⋅ Juwei Guan ⋅ Yujie Wu ⋅ Yusong Wang ⋅ Yao Mu ⋅ Zuozhu Liu ⋅ Mingkun Xu
Federated, Continual & Efficient Learning; Model Security ExHall # 439
R2M: Real-Aware Residual Model Merging for Robust and Generalizable Deepfake Detection Poster Session 5
Jinhee Park ⋅ Guisik Kim ⋅ Choongsang Cho ⋅ Junseok Kwon
Federated, Continual & Efficient Learning; Model Security ExHall # 438
CaRe: Critical Parameter Rectification for Efficient Visual Modeling Poster Session 5
Mingjia Li ⋅ Hongkun Xiong ⋅ Yuheng Shi ⋅ Hengxing Liu ⋅ Xiaojie Guo
Federated, Continual & Efficient Learning; Model Security ExHall # 437
Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts Poster Session 5
Nuoyan Zhou ⋅ Zhijun Tu ⋅ Lei Yu ⋅ Kun Cheng ⋅ jie hu ⋅ Nannan Wang ⋅ Xinghao Chen
Federated, Continual & Efficient Learning; Model Security ExHall # 436
TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration Poster Session 5
Yisheng Zhang ⋅ Guoli Jia ⋅ Haote Hu ⋅ Shanxu Zhao ⋅ Kaikai Zhao ⋅ Long Sun ⋅ Xinwei Long ⋅ Kai Tian ⋅ Che Jiang ⋅ Zhaoxiang Liu ⋅ Kai Wang ⋅ Shiguo Lian ⋅ Kaiyan Zhang ⋅ Bowen Zhou
Federated, Continual & Efficient Learning; Model Security ExHall # 435
Aggregating Cross-Domain Knowledge via Learnable Tokens for Multi-Teacher Distillation Poster Session 5
Wu Ran ⋅ Weijia Zhang ⋅ ShuYang Pang ⋅ JingSheng Liu ⋅ Xiaohui Zhang ⋅ Yichao Yan ⋅ Chao Ma
Federated, Continual & Efficient Learning; Model Security ExHall # 434
PACO: Stabilizing Vision Embeddings along Local Paths for Robust Vision-Language Models Poster Session 5
Qihang Tang ⋅ Jiacheng Pi ⋅ Zhiguo Yang ⋅ Xu Liu ⋅ Perley Xu ⋅ Wenjie Ruan
Federated, Continual & Efficient Learning; Model Security ExHall # 432
Curvature-Guided Mixing for MLLM Adaptation Poster Session 5
Jinglong Yang ⋅ Jiaxuan He ⋅ Wenjian Huang ⋅ Zhan Zhuang ⋅ Jianguo Zhang
Federated, Continual & Efficient Learning; Model Security ExHall # 431
DiscoVL: Unveiling Disentangled Cross-Modal Representation Learning via Orthogonal Adversarial Regularization for Vision-Language Models Poster Session 5
Mengping Dong ⋅ Jinbao Li ⋅ Fei Li
Federated, Continual & Efficient Learning; Model Security ExHall # 430
Identifiable Gated Residual Personalization for Federated Parameter-Efficient Fine-Tuning Poster Session 5
Huimin Huang ⋅ Wenhan Hu ⋅ Gang Yan
Federated, Continual & Efficient Learning; Model Security ExHall # 428
Interference-Aware Continual Vision–Language Learning via Instance-Level Expert Routing Poster Session 5
Zhang Changyuan ⋅ Tianxiang Xu ⋅ Canran Xiao ⋅ Fei Shen
Federated, Continual & Efficient Learning; Model Security ExHall # 426
TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts Poster Session 5
Boyuan Chen ⋅ Zichen Dang ⋅ Chuang Yang ⋅ Lap-Pui Chau ⋅ Yi Wang
Federated, Continual & Efficient Learning; Model Security ExHall # 425
One Trap to Block Them All: Defending Encoder Stealing via Isotropic Uniformity Poster Session 5
YITONG SHI ⋅ Kang Wei ⋅ Fushuo Huo ⋅ Shuchi Wu ⋅ Chuan Ma
Federated, Continual & Efficient Learning; Model Security ExHall # 423
Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation Poster Session 5
Fengnian Zhang ⋅ Tao Huang ⋅ Siyu Xu ⋅ Zhong Jin ⋅ Chang Xu
Federated, Continual & Efficient Learning; Model Security ExHall # 424
Unified Prediction and Planning via Conflict-Aware Disjoint Parameter Training Poster Session 5
Taewon Seo ⋅ Seonae Jeon ⋅ Giwon Lee ⋅ KUK-JIN YOON ⋅ Daehee Park
Federated, Continual & Efficient Learning; Model Security ExHall # 422
SPDA: Efficient Online Test-Time Adaptation for Promptable Medical Segmentation Poster Session 5
Huixuan Xu ⋅ Hu Han ⋅ Shiguang Shan ⋅ Xilin CHEN
Federated, Continual & Efficient Learning; Model Security ExHall # 421
Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation Poster Session 5
Yizhe Xiong ⋅ Zihan Zhou ⋅ Yiwen Liang ⋅ Hui Chen ⋅ Zijia Lin ⋅ Xinhao Xu ⋅ Tianxiang Hao ⋅ Fan Zhang ⋅ Jungong Han ⋅ Guiguang Ding
Federated, Continual & Efficient Learning; Model Security ExHall # 420
Learning from Reliable Negatives: Confidence-Anchored Test-Time Adaptation for GUI Grounding Poster Session 5
Yizhou Liu ⋅ Fei Tang ⋅ Yuchen Yan ⋅ Zhengxi Lu ⋅ Songqin Nong ⋅ Tao Jiang ⋅ Wenhao Xu ⋅ Wenqi Zhang ⋅ Weiming Lu ⋅ Jun Xiao ⋅ Jun Xiao
Federated, Continual & Efficient Learning; Model Security ExHall # 419
RUTaL: Residual Upcycling with Task Ladder for Efficient Multi-Task Learning Poster Session 5
Haiming Yao ⋅ Wei Luo ⋅ Qiyu Chen ⋅ Jianxing Liao ⋅ Wei You
Federated, Continual & Efficient Learning; Model Security ExHall # 418
FaceMoE: Mixture of Experts for Low-Resolution Face Recognition Poster Session 5
Kartik Narayan ⋅ Vishal Patel
Federated, Continual & Efficient Learning; Model Security ExHall # 343
DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents Poster Session 5
Fuyao Zhang ⋅ Jiaming Zhang ⋅ CHE WANG ⋅ Xiongtao Sun ⋅ Yurong Hao ⋅ Guowei Guan ⋅ Wenjie Li ⋅ Longtao Huang ⋅ Wei Lim
Federated, Continual & Efficient Learning; Model Security ExHall # 399
LDC-MTL: Balancing Multi-Task Learning through Scalable Loss Discrepancy Control Poster Session 5
Peiyao Xiao ⋅ Chaosheng Dong ⋅ Shaofeng Zou ⋅ Kaiyi Ji
Federated, Continual & Efficient Learning; Model Security ExHall # 455
Tri-Efficient Transfer Learning for Point Cloud Videos Poster Session 5
Yiding Sun ⋅ Dongxu Zhang ⋅ Jihua Zhu ⋅ Haozhe Cheng ⋅ Zhengqiao Li ⋅ Pengcheng Li ⋅ Chaowei Fang ⋅ Yonghao Dong ⋅ Lin Chen
Federated, Continual & Efficient Learning; Model Security ExHall # 359
SlowBA: An efficiency backdoor attack towards VLM-based GUI agents Poster Session 5
Junxian Li ⋅ Tu Lan ⋅ Haozhen Tan ⋅ Yan Meng ⋅ Haojin Zhu
Federated, Continual & Efficient Learning; Model Security ExHall # 433
Dual-Generalization-aware Minimization for Continual Fine-Tuning of Vision-Language Models Poster Session 5
Yanan Chen ⋅ Tieliang Gong ⋅ Yanle Lyu ⋅ Yuanhong Zhang ⋅ Weizhan Zhang
Federated, Continual & Efficient Learning; Model Security ExHall # 345
MUSE: Unlocking Timestep as Native Task Steering for One-Step Dense Prediction Poster Session 5
Shuo Zhou ⋅ Zhaoxin Li ⋅ Xiujuan Chai
Federated, Continual & Efficient Learning; Model Security ExHall # 417
Beyond Disjoint Tasks: Towards More Natural Continual Learning for Vision-Language Models Poster Session 5
Xiang Xu ⋅ Yiyang Su ⋅ Tianchen Zhao ⋅ Zheng Zhang ⋅ Zhuowen Tu ⋅ Anil Jain ⋅ Jonathan Wu
Federated, Continual & Efficient Learning; Model Security ExHall # 341
HEM: a margin-based loss for visual categorisation tasks Poster Session 5
Michael Spratling ⋅ Heiko Schütt
Federated, Continual & Efficient Learning; Model Security ExHall # 340
An Inverse-Adversarial and Difficulty-Adaptive Robust Vision-Language Model Poster Session 5
Ruobing Xu ⋅ Junhao Dong ⋅ Xiaohua Xie
Federated, Continual & Efficient Learning; Model Security ExHall # 344
Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs Poster Session 5
Wenjie Zhu ⋅ Yabin Zhang ⋅ Liang Xu ⋅ Xin Jin ⋅ Wenjun Zeng ⋅ Yabin Zhang
Federated, Continual & Efficient Learning; Model Security ExHall # 338
DriveFine: Refining-Augmented Masked Diffusion VLA for Accurate and Robust Driving Poster Session 5
Chenxu Dang ⋅ Sining Ang ⋅ Yongkang Li ⋅ Haochen Tian ⋅ Jie Wang ⋅ Guang Li ⋅ Hangjun Ye ⋅ Jie Ma ⋅ Long Chen ⋅ Yan Wang
Federated, Continual & Efficient Learning; Model Security ExHall # 366
Can Vision Models Truly Forget? Mirage: Representation-Level Certification of Visual Unlearning Poster Session 5
Zhenyu Yu ⋅ yangchen zeng ⋅ Chunlei Meng ⋅ Guangzhen Yao ⋅ Shuigeng Zhou
Federated, Continual & Efficient Learning; Model Security ExHall # 339
Prefill-Time Interventions against Adversarial Attacks on Large Vision-Language Models Poster Session 5
Zhewen Yao ⋅ Yao Zhu ⋅ Shiliang Zhang
Federated, Continual & Efficient Learning; Model Security ExHall # 367
The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning Poster Session 5
Brent Griffin ⋅ Jason Corso
Federated, Continual & Efficient Learning; Model Security ExHall # 342
TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings Poster Session 5
Yebo Wu ⋅ Feng Liu ⋅ Ziwei Xie ⋅ Changwang Zhang ⋅ Jun Wang ⋅ Li Li
Federated, Continual & Efficient Learning; Model Security ExHall # 429
Data-Free Client Contribution Estimation via Logit Maximization for Federated Learning Poster Session 5
Asim Ukaye ⋅ Nurbek Tastan ⋅ Mubarak Abdu-Aguye ⋅ Karthik Nandakumar
Federated, Continual & Efficient Learning; Model Security ExHall # 474
Low-Rank Ternary Adaptation for Fine-Tuning Transformers Poster Session 5
Alexandru-Dragos Manolache ⋅ Yunqiang Li ⋅ Jan van Gemert
Federated, Continual & Efficient Learning; Model Security ExHall # 473
LANCE: Low Rank Activation Compression for Efficient On-Device Continual Learning Poster Session 5
Marco Apolinario ⋅ Kaushik Roy
Federated, Continual & Efficient Learning; Model Security ExHall # 472
Breaking Rigidity in Adversarial Patch Attacks Poster Session 5
Vishesh Kumar ⋅ Guha Balakrishnan ⋅ Akshay Agarwal
Federated, Continual & Efficient Learning; Model Security ExHall # 471
SLER-IR: Spherical Layer-wise Expert Routing for All-in-One Image Restoration Poster Session 5
Shurui Peng ⋅ Xin Lin ⋅ Shi Luo ⋅ Jincen Ou ⋅ Dizhe Zhang ⋅ Lu Qi ⋅ Truong Nguyen ⋅ Chao Ren
Federated, Continual & Efficient Learning; Model Security ExHall # 385
KATANA: Knowledge-Aligned Topology-Aware Neural Agents for RL-Driven Vision-Language Model Compression Poster Session 5
Nafew Azim ⋅ Mir Ali ⋅ Fuad Rahman ⋅ Nabeel Mohammed
Federated, Continual & Efficient Learning; Model Security ExHall # 470
Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models Poster Session 5
Kang MinSeok ⋅ Hyunwoo Kim ⋅ Chanyoung Kim ⋅ Minwoo Kim ⋅ Jaekoo Lee ⋅ Dahuin Jung
Federated, Continual & Efficient Learning; Model Security ExHall # 469
Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation Poster Session 5
Jaehyun Jang ⋅ Eunseop Yoon ⋅ Hee Suk Yoon ⋅ SooHwan Eom ⋅ Mark Hasegawa-Johnson ⋅ Chang Yoo
Federated, Continual & Efficient Learning; Model Security ExHall # 468
Honey, I Shrunk the Arc de Triomphe! Poster Session 3
Yuanbo Xiangli ⋅ Hanyu Chen ⋅ Xueqing Tsang ⋅ Noah Snavely
Geometry, Localization, Matching & Motion ExHall # 112
Every Dog Has Its Day, Probably: A Balanced Synthetic Benchmark and Probabilistic Modeling for 3D Dog Pose Estimation Poster Session 3
Joo Young Choi ⋅ Wonkwang Lee ⋅ Juhyeong Seon ⋅ Gunhee Kim
Geometry, Localization, Matching & Motion ExHall # 187
Pix2NPHM: Learning to Regress NPHM Reconstructions From a Single Image Poster Session 3
Simon Giebenhain ⋅ Tobias Kirschstein ⋅ Liam Schoneveld ⋅ Davide Davoli ⋅ Zhe Chen ⋅ Matthias Niessner
Geometry, Localization, Matching & Motion ExHall # 222
Articulated Object Reconstruction from Rest-State Observation Poster Session 3
Daeun Lee ⋅ Jaeah Lee ⋅ Woosung Kim ⋅ Haebeom Jung ⋅ Jaesik Park
Geometry, Localization, Matching & Motion ExHall # 142
CtrlCoMo: Controllable Co-Speech Motion Generation with Gesture–Action Disentanglement Poster Session 3
Xinghan Wang ⋅ Ming Zhou ⋅ Yanbo Zheng ⋅ Youjiang Xu ⋅ Yuan Zhang ⋅ Mingyuan Gao ⋅ Nan Zhuang ⋅ Yadong Mu
Geometry, Localization, Matching & Motion ExHall # 179
PMGC-SimVP: Parametric Multi-scale Gated Convolution for Global Ionospheric TEC Prediction Poster Session 3
Yu Xia ⋅ Yingkui Gong ⋅ Hao Zhang
Geometry, Localization, Matching & Motion ExHall # 93
Geometry-Preserving Image Generation for 6D Object Pose Estimation Poster Session 3
Jiafeng Zhang ⋅ Rui Song ⋅ Zhengtai Zhang ⋅ Jiaojiao Li ⋅ Kailang Cao ⋅ Lizhang Peng ⋅ David Ferstl ⋅ Yinlin Hu
Geometry, Localization, Matching & Motion ExHall # 221
Boosting 3D Foundation Models with Featureless Pose Optimization Poster Session 3
Mattia D'Urso ⋅ Christian Sormann ⋅ Mattia Rossi ⋅ Friedrich Fraundorfer
Geometry, Localization, Matching & Motion ExHall # 170
PRISM3D: Probabilistic Refinement and Robust Initialization for Physically Consistent Scene Modeling under Extreme Motion Blur Poster Session 3
Gopi Raju Matta ⋅ Reddypalli Trisha ⋅ Divya Madhuri Vemunuri ⋅ Kaushik Mitra
Geometry, Localization, Matching & Motion ExHall # 168
LaxMotion: Rethinking Supervision Granularity for 3D Human Motion Generation Poster Session 3
Sheng Liu ⋅ Yuanzhi Liang ⋅ Sidan DU
Geometry, Localization, Matching & Motion ExHall # 164
CCFM: Collision-Constrained Flow Matching for Safety-Critical Scenario Generation Poster Session 3
Ke Li ⋅ Kaidi Liang ⋅ Yuxin Ding ⋅ Debojyoti Biswas ⋅ Xianbiao Hu ⋅ Ruwen Qin
Geometry, Localization, Matching & Motion ExHall # 229
Learning Manifolds in High-D Point Embedding for Anisotropic Surface Approximation from Unstructured Point Clouds Poster Session 3
Hongbo Li ⋅ Haikuan Zhu ⋅ Xiaohu Guo ⋅ Wenping Wang ⋅ Jing Hua ⋅ Zichun Zhong
Geometry, Localization, Matching & Motion ExHall # 228
Visible Yet Unrecognizable: Frequency-Selective Facial Privacy via Attention Poster Session 3
Atul Kumar ⋅ Akshay Agarwal
Geometry, Localization, Matching & Motion ExHall # 227
Revisiting the Volumetric Data of 4DME: Compression, Extension and Benchmarking for Micro-Expression Analysis Poster Session 3
Samuel Boccara ⋅ Amar Tious ⋅ Guoying Zhao ⋅ Yante Li ⋅ Toinon Vigier ⋅ Vincent Ricordel
Geometry, Localization, Matching & Motion ExHall # 226
InSpace: Structure-Aware 3D Indoor Scene Generation from a Single 360° Image Poster Session 3
Gwanhyeong Koo ⋅ Hyunsu Kim ⋅ Youngji Kim ⋅ Taejae Lee ⋅ Siwoo Lim ⋅ Sunjae Yoon ⋅ Suyong Yeon ⋅ Chang Yoo
Geometry, Localization, Matching & Motion ExHall # 225
PolyLayout: Multi-room Manhattan Layout Estimation Poster Session 3
Gustav Hanning ⋅ Shaohui Liu ⋅ Rémi Pautrat ⋅ Marc Pollefeys ⋅ Kalle Åström ⋅ Viktor Larsson
Geometry, Localization, Matching & Motion ExHall # 224
WiFi-JEPA: Self-supervised Learning for WiFi-CSI 3D Human Pose Estimation Poster Session 3
Doeon Kim ⋅ Jungyoon Lee ⋅ SEONGSIN KIM ⋅ Seong-heum Kim
Geometry, Localization, Matching & Motion ExHall # 223
Discovering Geometric Biases in 3D Face Reconstruction: A Curvature-Aware Spectral Framework for Fairness Evaluation Poster Session 3
Veronika Shilova ⋅ Emmanuel Malherbe ⋅ Giovanni Palma ⋅ Panagiotis-Alexandros Bokaris ⋅ Laurent Risser ⋅ Jean-Michel Loubes
Geometry, Localization, Matching & Motion ExHall # 220
Analytic Bayesian Uncertainty for LiDAR Segmentation: A Single-pass Generative Approach Poster Session 3
Hanieh Shojaei Miandashti ⋅ Qianqian Zou ⋅ Claus Brenner
Geometry, Localization, Matching & Motion ExHall # 219
HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations Poster Session 3
Yaqiao Dai ⋅ Renjiao Yi ⋅ Zhirui Gao ⋅ Wei Chen ⋅ Kai Xu ⋅ Chenyang Zhu
Geometry, Localization, Matching & Motion ExHall # 218
Embedding Rotation Invariance for Provable Multi-Oriented Scene Text Recognition Poster Session 3
zhibin ma ⋅ Pengwen Dai ⋅ Yi Liu ⋅ Xugong Qin ⋅ Chenyun Yu ⋅ Xiaochun Cao
Geometry, Localization, Matching & Motion ExHall # 217
PrimitiveUDF: Primitive-Based Unsigned Distance Fields for Surface Reconstruction from Point Clouds Poster Session 3
Xin Deng ⋅ Bo Yang ⋅ Yifei Shi ⋅ Bing Wang
Geometry, Localization, Matching & Motion ExHall # 216
ReflectCAP: Detailed Image Captioning with Reflective Memory Poster Session 3
Kyungmin Min ⋅ Minbeom Kim ⋅ Kang-il Lee ⋅ Seunghyun Yoon ⋅ Kyomin Jung
Geometry, Localization, Matching & Motion ExHall # 215
Motion Style Slider: Endpoint-Supervised Continuous Style Control for Human Motion Diffusion Poster Session 3
Chen-Chieh Liao ⋅ YICHEN PENG ⋅ YIYI CAI ⋅ Yûi Ono ⋅ Hiroki Hanaoka ⋅ Erwin Wu ⋅ Hideki Koike ⋅ Shuichi Kurabayashi
Geometry, Localization, Matching & Motion ExHall # 214
Unified and Efficient Point-Line Local Features Poster Session 3
François Costa ⋅ Raphael Kreft ⋅ Felix Möller ⋅ Hardik Shah ⋅ Ramanathan Rajaraman ⋅ Eckhard Goedeke ⋅ Shaohui Liu ⋅ Rémi Pautrat ⋅ Marc Pollefeys
Geometry, Localization, Matching & Motion ExHall # 213
UF0-6D: Unified Flow-based Zero-Shot 6D Object Pose Estimation without Refinement Poster Session 3
Yingnan Guo ⋅ Chun Lim ⋅ Yu Feng ⋅ Yu Zhang
Geometry, Localization, Matching & Motion ExHall # 212
Face Anything: 4D Face Reconstruction from Any Image Sequence Poster Session 3
Umut Kocasarı ⋅ Simon Giebenhain ⋅ Richard Shaw ⋅ Matthias Niessner
Geometry, Localization, Matching & Motion ExHall # 211
Tempo-SAM3D: Monocular Video to 4D via Temporal Memory-Guided Generation Poster Session 3
Baicheng Li ⋅ Dong Wu ⋅ Yingdian Cao ⋅ Haoxiang Yang ⋅ Yiwen Lu ⋅ Zike Yan ⋅ Hongbin Zha
Geometry, Localization, Matching & Motion ExHall # 210
UniDynamics: Event-RGB Fusion for Unified Future 4D Dynamic Scene Generation Poster Session 3
Daikun Liu ⋅ Xin Zhan ⋅ Teng Wang ⋅ Xiaoping Wang ⋅ Changyin Sun
Geometry, Localization, Matching & Motion ExHall # 209
RegHead: Non-Humanoid Head Blendshapes via Feed-Forward Registration Poster Session 3
Jiahao Luo ⋅ Hao Zhang ⋅ Jianqi Chen ⋅ Yijie He ⋅ Jiaxu Zou ⋅ Michael Vasilkovsky ⋅ Sergei Korolev ⋅ Sergey Tulyakov ⋅ Chaoyang Wang ⋅ Peter Wonka ⋅ James Davis ⋅ Jian Wang
Geometry, Localization, Matching & Motion ExHall # 208
MoBa-GS: Learning a Spatially-Varying Motion Basis over a Dynamic Canonical Space for 4D Reconstruction Poster Session 3
Guan Yuan Tan ⋅ Arghya Pal ⋅ Sailaja Rajanala ⋅ Raphaël Phan ⋅ Chee-Ming Ting
Geometry, Localization, Matching & Motion ExHall # 207
StreetForward: Perceiving Dynamic Street with Feedforward Causal Dynamics Poster Session 3
Zhongrui Yu ⋅ Zhao Wang ⋅ Yida Wang ⋅ Xueyang Zhang ⋅ Yifei Zhan ⋅ Kun Zhan
Geometry, Localization, Matching & Motion ExHall # 206
Trajectory-aware Cross-view Geo-Localization with Sequential Observations Poster Session 3
Tianyi Gao ⋅ Jiayu Lin ⋅ Danielle Beaulieu ⋅ Nathan Jacobs
Geometry, Localization, Matching & Motion ExHall # 205
PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided VLM Poster Session 3
Siwei Meng ⋅ Yawei Luo ⋅ Ping Liu
Geometry, Localization, Matching & Motion ExHall # 204
Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings Poster Session 3
Theodor Westny ⋅ David Axelsson ⋅ Björn Olofsson ⋅ Erik Frisk
Geometry, Localization, Matching & Motion ExHall # 203
Leaving the City: A Large-Scale Aerial Dataset for Cross-Season Localization in Unstructured Environments Poster Session 3
Michael Schleiss ⋅ Henry Hölzemann ⋅ Fahmi Rouatbi ⋅ Torsten Fiolka ⋅ Thomas Pany ⋅ Roger Förstner ⋅ Daniel Cremers
Geometry, Localization, Matching & Motion ExHall # 202
Sparsity-Inducing Divergence Losses for Biometric Verification Poster Session 3
Dimitrios Koutsianos ⋅ Ladislav Mosner ⋅ Yannis Panagakis ⋅ Themos Stafylakis
Geometry, Localization, Matching & Motion ExHall # 201
IoUCert: Robustness Verification for Anchor-based Object Detectors Poster Session 3
Benedikt Brückner ⋅ Alejandro J. Mercado ⋅ Yanghao Zhang ⋅ Panagiotis Kouvaros ⋅ Alessio Lomuscio
Geometry, Localization, Matching & Motion ExHall # 200
AirZoo: A Unified Large-Scale Dataset for Grounding Aerial Geometric 3D Vision Poster Session 3
Xiaoya Cheng ⋅ Rouwan Wu ⋅ Xinyi Liu ⋅ Zeyu Cui ⋅ Yan Liu ⋅ Na Zhao ⋅ Yu Liu ⋅ Maojun Zhang ⋅ Shen Yan
Geometry, Localization, Matching & Motion ExHall # 199
GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth Poster Session 3
Joaquin Gajardo ⋅ Michele Volpi ⋅ Marko Mihajlovic ⋅ Siyu Tang ⋅ Lukas Roth ⋅ Sergey Prokudin
Geometry, Localization, Matching & Motion ExHall # 198
RADmesh: Remesh-Aware Mesh Deformation Poster Session 3
Nam Anh Dinh ⋅ Itai Lang ⋅ Oded Stein ⋅ Rana Hanocka
Geometry, Localization, Matching & Motion ExHall # 197
Coordinate Singularities Break Conformal Coverage for Gaze and Head Pose Poster Session 3
Mohammadreza Jamalifard ⋅ Yaxiong Lei ⋅ Parastoo Azizinezhad ⋅ Javier Andreu-Perez
Geometry, Localization, Matching & Motion ExHall # 196
SemLight: Distilled Semantic–Geometric Fusion for Efficient Local Feature Matching Poster Session 3
Guanglu Shi ⋅ Xiangzeng Liu ⋅ Yunan LI ⋅ Tuo Pang ⋅ Qiguang Miao
Geometry, Localization, Matching & Motion ExHall # 195
AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images Poster Session 3
Meng Yang ⋅ Zizhuo Li ⋅ Linfeng Tang ⋅ Fan Fan ⋅ Jiayi Ma
Geometry, Localization, Matching & Motion ExHall # 194
Flow4R: Unifying 4D Reconstruction and Tracking with Scene Flow Poster Session 3
Shenhan Qian ⋅ Ganlin Zhang ⋅ Elliott (Shangzhe) Wu ⋅ Daniel Cremers
Geometry, Localization, Matching & Motion ExHall # 193
Variational Patch Gating for Training-Free Few-Shot Classification Poster Session 3
Ahmed Radwan ⋅ Ahmad Abdel-Qader ⋅ Islam Osman ⋅ Mohamed Shehata
Geometry, Localization, Matching & Motion ExHall # 192
PoseImageNet: Pose Estimation for Extensive Classes Based on Rich Structure Prototypes Poster Session 3
Junjie Chen ⋅ Hong Cao ⋅ Weixiang Tao ⋅ Yuming Fang ⋅ Jiebin Yan ⋅ Yifan Zuo
Geometry, Localization, Matching & Motion ExHall # 191
VKSR: Scalable Kernel Surface Reconstruction Using Vecchia's Approximation Poster Session 3
Maximilian Weiherer ⋅ Chukwudi Williams Umah ⋅ Bernhard Egger
Geometry, Localization, Matching & Motion ExHall # 190
SynFlow: Scaling Up LiDAR Scene Flow Estimation with Synthetic Data Poster Session 3
Qingwen Zhang ⋅ Xiaomeng Zhu ⋅ ChenHan Jiang ⋅ Patric Jensfelt
Geometry, Localization, Matching & Motion ExHall # 189
TIDES: Time-Derivative Event Simulation via Deformable Reconstruction Poster Session 3
Christopher Thirgood ⋅ Dipon Kumar Ghosh ⋅ Simon Hadfield
Geometry, Localization, Matching & Motion ExHall # 188
Ego-Human Motion Prediction with 3D-Aware LLM Poster Session 3
Yujin Bae ⋅ Jaewoo Jeong ⋅ HYEONSEONG KIM ⋅ KUK-JIN YOON
Geometry, Localization, Matching & Motion ExHall # 186
Category-Level Articulated Object Pose Estimation via Pose–Shape Hypothesis Generation and Verification Poster Session 3
Kaifeng Tang ⋅ Chi Xu ⋅ Xin Ao ⋅ Yuting Ge ⋅ Tingrui Guo ⋅ Jun Zhou
Geometry, Localization, Matching & Motion ExHall # 185
Sector-Level Cross-View Geo-Localization with Implicit Orientation via Azimuthal Scanning Poster Session 3
Yiru Li ⋅ Le Wu ⋅ Yingchen Tan ⋅ Yingying Zhu
Geometry, Localization, Matching & Motion ExHall # 184
OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer Poster Session 3
Si-yu Lu ⋅ Po-Ting Chen ⋅ Hui-Che Hsu ⋅ Sin-Ye Jhong ⋅ Wen-Huang Cheng ⋅ Yung-Yao Chen
Geometry, Localization, Matching & Motion ExHall # 183
LivingWorld: Interactive 4D World Generation with Environmental Dynamics Poster Session 3
Hyeongju Mun ⋅ In-Hwan Jin ⋅ Sohyeong Kim ⋅ Kyeongbo Kong
Geometry, Localization, Matching & Motion ExHall # 182
Optimizing Mesh Animation from Video via Shape Flow Guidance Poster Session 3
Jingqiao Xiu ⋅ Yicong Li ⋅ Angela Yao
Geometry, Localization, Matching & Motion ExHall # 181
There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion Poster Session 3
Lishen Qu ⋅ Yao Liu ⋅ shihao zhou ⋅ Jie Liang ⋅ Hui Zeng ⋅ Yabin Zhang ⋅ Jufeng Yang
Geometry, Localization, Matching & Motion ExHall # 180
SGMatch: Semantic-Guided Non-Rigid Shape Matching with Flow Regularization Poster Session 3
Tianwei Ye ⋅ Xiaoguang Mei ⋅ Yifan Xia ⋅ Fan Fan ⋅ Jun Huang ⋅ Jiayi Ma
Geometry, Localization, Matching & Motion ExHall # 178
Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation Poster Session 3
Sakuya Ota ⋅ Qing Yu ⋅ Kent Fujiwara ⋅ Satoshi Ikehata ⋅ Ikuro Sato
Geometry, Localization, Matching & Motion ExHall # 177
AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories Poster Session 3
Zun Wang ⋅ Han Lin ⋅ Jaehong Yoon ⋅ Jaemin Cho ⋅ Yue Zhang ⋅ Mohit Bansal
Geometry, Localization, Matching & Motion ExHall # 176
XSurfer: Reconstructing surface meshes of cerebral and cerebellar cortex from diverse MRI data using untrained neural networks Poster Session 3
Haoxiang Li ⋅ Mingxuan Liu ⋅ Divya Varadarajan ⋅ Zhangxuan Hu ⋅ Qiyuan Tian ⋅ Jonathan Polimeni
Geometry, Localization, Matching & Motion ExHall # 175
Match-Any-Events: Zero-Shot Motion-Robust Feature Matching Across Wide Baselines for Event Cameras Poster Session 3
Ruijun Zhang ⋅ Hang Su ⋅ Kostas Daniilidis ⋅ Ziyun Wang
Geometry, Localization, Matching & Motion ExHall # 174
RBE-Flow:Recurrent Bayesian Estimation on Feature Manifolds for Cross-Modal Registration Poster Session 3
Mengzhu Ding ⋅ Xin Song ⋅ Xiaoke Ding ⋅ Hongwei Ding ⋅ Xuecong Liu
Geometry, Localization, Matching & Motion ExHall # 173
Boosting Correspondence Learning with Structure-Aware Estimator Poster Session 3
Tianyu Yan ⋅ Wei An ⋅ Pu Wang ⋅ Yingqian Wang
Geometry, Localization, Matching & Motion ExHall # 172
4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video Poster Session 3
Jae Won Jang ⋅ Yeonjin Chang ⋅ Wonsik Shin ⋅ Juhwan Cho ⋅ Nojun Kwak
Geometry, Localization, Matching & Motion ExHall # 171
Training-free Controllable Motion Generation under Heterogeneous Constraints Poster Session 3
Xiaofei Hui ⋅ Bo Yan ⋅ Haoxuan Qu ⋅ Hossein Rahmani ⋅ Jun Liu
Geometry, Localization, Matching & Motion ExHall # 169
Reweighting Framewise Attention in Video Transformers for Facial Emotion Recognition Poster Session 3
Seongro Yoon ⋅ Donghyeon Cho ⋅ Jinsun Park ⋅ Francois Bremond
Geometry, Localization, Matching & Motion ExHall # 167
SemCityLoc: Aerial 6DoF Localization Using Semantic 3D City Models Poster Session 3
Jingfeng Mao ⋅ Xuyang Chen ⋅ Qilin Zhang ⋅ Oussema Dhaouadi ⋅ Guangming Wang ⋅ Brian Sheil ⋅ Daniel Cremers ⋅ Yan Xia ⋅ Olaf Wysocki
Geometry, Localization, Matching & Motion ExHall # 166
MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources Poster Session 3
Jiahui Yang ⋅ Donglin Di ⋅ Xuancheng Zhang ⋅ Lei Fan ⋅ Jianxun Cui ⋅ Hao Li ⋅ Baorui Ma
Geometry, Localization, Matching & Motion ExHall # 165
Lightweight Online Reinforcement Learning for Block Decomposition of CAD Models Poster Session 3
Xitong Luo ⋅ Zhenghan Wu ⋅ Yucong Wang ⋅ Yi Cai
Geometry, Localization, Matching & Motion ExHall # 163
SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers Poster Session 3
Sakif Hossain ⋅ Julian Teusch ⋅ Jörg Müller
Geometry, Localization, Matching & Motion ExHall # 162
SynHMR: Synergistic Joint-Mesh Modeling for LiDAR-based Human Mesh Reconstruction Poster Session 3
Rui Shi ⋅ Xiaoqi An ⋅ Lin Zhao ⋅ Di Wang ⋅ Chen Gong ⋅ Le Zhang
Geometry, Localization, Matching & Motion ExHall # 161
OmniDS: Dual-Stream Context Fusion for Omnidirectional Depth from Fisheye Cameras Poster Session 3
Chaesong Park ⋅ Jihyeon Hwang ⋅ Muyeol Sung ⋅ Jongwoo Lim
Geometry, Localization, Matching & Motion ExHall # 160
Dense Dynamic Scene Reconstruction and Camera Pose Estimation from Multi-View Videos Poster Session 3
Shuo Sun ⋅ Unal Artan ⋅ Malcolm Mielle ⋅ Achim Lilienthal ⋅ Martin Magnusson
Geometry, Localization, Matching & Motion ExHall # 159
MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training Poster Session 3
Lucia Gordon ⋅ Serge Belongie ⋅ Christian Igel ⋅ Nico Lang
Geometry, Localization, Matching & Motion ExHall # 158
VideoSfM: Exploiting Temporal Structure for Video-Based Structure-from-Motion Poster Session 3
Zador Pataki ⋅ Paul-Edouard Sarlin ⋅ Marc Pollefeys
Geometry, Localization, Matching & Motion ExHall # 157
Estimating Velocity and Spin of Spherical Objects from Rolling-Shutter Image(s) Poster Session 3
Wenjie Xue ⋅ Jun Yang ⋅ Jingmin Wang ⋅ Limin Shang
Geometry, Localization, Matching & Motion ExHall # 156
E-MOTION: A Dataset for Event-Based Scene Flow Estimation with Independent Moving Objects Poster Session 3
Ivan Gutierrez Rodriguez ⋅ Julien Moreau ⋅ Chiara Bartolozzi ⋅ Arren Glover
Geometry, Localization, Matching & Motion ExHall # 155
LaVPR: Benchmarking Language and Vision for Place Recognition Poster Session 3
Ofer Idan ⋅ Dan Badur ⋅ yosi keller ⋅ Yoli Shavit
Geometry, Localization, Matching & Motion ExHall # 154
Equivariant Symmetry-Aware Head Pose Estimation for Fetal MRI Poster Session 3
Ramya Muthukrishnan ⋅ Borjan Gagoski ⋅ Aryn Lee ⋅ Ellen Grant ⋅ Elfar Adalsteinsson ⋅ Benjamin Billot ⋅ Polina Golland
Geometry, Localization, Matching & Motion ExHall # 153
Category-Level 3D Correspondence in Camera Space via Morphable Object Priors Poster Session 3
Leonhard Sommer ⋅ Artur Jesslen ⋅ Basavaraj Sunagad ⋅ Adam Kortylewski
Geometry, Localization, Matching & Motion ExHall # 152
OrthoTrack: Continuous 6-DoF UAV Trajectory Estimation Anchored in Public Orthophotos Poster Session 3
Oussema Dhaouadi ⋅ Zuria Bauer ⋅ Johannes Meier ⋅ Olaf Wysocki ⋅ Marc Pollefeys ⋅ Daniel Cremers
Geometry, Localization, Matching & Motion ExHall # 151
Social-Mamba: Socially-Aware Trajectory Forecasting with State-Space Models Poster Session 3
Po-Chien Luan ⋅ Wuyang Li ⋅ Yang Gao ⋅ Alexandre ALahi
Geometry, Localization, Matching & Motion ExHall # 150
Mitigating Radar-Inertial Calibration Ambiguities via SO(3) Manifold Steering Poster Session 3
Chunshen Li ⋅ Shengpeng Wang ⋅ Zitao Ye ⋅ Wei Wang
Geometry, Localization, Matching & Motion ExHall # 149
Rosetum3D: A Large-Scale 3D Vision Dataset from Preharvest Roses Poster Session 3
Songyan Liu ⋅ Xipei Liu ⋅ Yujie Liu ⋅ Jiali Wu ⋅ Xiaofei Liu
Geometry, Localization, Matching & Motion ExHall # 148
Following Motion for Sequential Modeling in Video Frame Interpolation Poster Session 3
JaeHyun Park ⋅ Nam Ik Cho
Geometry, Localization, Matching & Motion ExHall # 147
Rethinking Detection Calibration: A Coordinate Perspective Poster Session 3
Juyong Lee ⋅ Seungjin Jung ⋅ Jungmin Lee ⋅ Sunju Lee ⋅ Jongwon Choi
Geometry, Localization, Matching & Motion ExHall # 146
Roam2Room: A Unified Floorplan-to-Furnished Framework for Controllable Indoor Scene Generation Poster Session 3
Wenbo Li ⋅ Zipeng Qin ⋅ Xiaoliang Ju ⋅ Rongyao Fang ⋅ Hongsheng LI
Geometry, Localization, Matching & Motion ExHall # 145
Coarse-to-fine Contrast: A Hybrid Self-supervised Method for Non-rigid 3D Shape Matching Poster Session 3
Feifan Luo ⋅ Ting Li ⋅ Zhao Li ⋅ Hongyang Chen
Geometry, Localization, Matching & Motion ExHall # 144
VisTa3D: A Dataset and Benchmark for Vision, Tactile, and 3D Point Clouds-based Thin Object Reconstruction Poster Session 3
Shania Guo ⋅ Yeongsik Seo ⋅ Andrew Fu ⋅ Mei Hao ⋅ Iris Xia ⋅ Jiwon Lee ⋅ Xinyi Xie ⋅ Hyoungseob Park ⋅ Aaron Dollar ⋅ Alex Wong
Geometry, Localization, Matching & Motion ExHall # 143
OpenCVL: An Open, Diverse, and Large-Scale Dataset for Fine-Grained Cross-View Localization Poster Session 3
Zimin Xia ⋅ Mubariz Zaffar ⋅ Junsheng Fu ⋅ Alexandre ALahi ⋅ Julian Kooij
Geometry, Localization, Matching & Motion ExHall # 141
Learning Global Camera Poses from Noisy View-Graphs for Structure from Motion Poster Session 3
Fadi Khatib ⋅ Meirav Galun ⋅ Ronen Basri
Geometry, Localization, Matching & Motion ExHall # 140
PriorPose: Reference-Guided Joint Deformation and Alignment for Category-Level Object Pose Estimation Poster Session 3
Yihan Chen ⋅ Huan Ren ⋅ Wenfei Yang ⋅ Hang Du ⋅ Tianzhu Zhang ⋅ Feng Wu
Geometry, Localization, Matching & Motion ExHall # 139
UniPR-3D: Towards Universal Visual Place Recognition with Visual Geometry Grounded Transformer Poster Session 3
Tianchen Deng ⋅ Chen Xun ⋅ Ziming Li ⋅ Hongming Shen ⋅ Shuhao Zhai ⋅ Danwei Wang ⋅ Javier Civera ⋅ Hesheng Wang
Geometry, Localization, Matching & Motion ExHall # 138
Global Graph-Validated Optimization for VLM-based 3D Indoor Scene Generation Poster Session 3
Jialu Huang ⋅ Yingxuan You ⋅ Fei Wang ⋅ Zheng Dang
Geometry, Localization, Matching & Motion ExHall # 137
Combining Discrepancy-Confusion Uncertainty and Calibration Diversity for Active Fine-Grained Image Classification Poster Session 3
Yinghao Jin ⋅ Xi Yang
Geometry, Localization, Matching & Motion ExHall # 136
Towards Reconfigurable Visual Feature Compression Poster Session 3
Jiahang Zhang ⋅ Wenhan Yang ⋅ Minghao Liu ⋅ Jiaying Liu
Geometry, Localization, Matching & Motion ExHall # 135
Lost in the Tail: Addressing Geographic Imbalance in Urban Visual Place Recognition Poster Session 3
Zoey Shu ⋅ Jiacheng Yang ⋅ Yang Lu ⋅ Waishan Qiu ⋅ Chuan Li ⋅ Da Chen
Geometry, Localization, Matching & Motion ExHall # 134
Sequential Visual Place Recognition: Exploiting Trajectory Priors for Robust Localization Poster Session 3
Dominik Kloepfer ⋅ Patrick Wenzel
Geometry, Localization, Matching & Motion ExHall # 133
ObjectForesight: Predicting 3D Object Trajectories from Human Videos Poster Session 3
Rustin Soraki ⋅ Homanga Bharadhwaj ⋅ Ali Farhadi ⋅ Roozbeh Mottaghi
Geometry, Localization, Matching & Motion ExHall # 132
Holo360D: A Large-Scale Real-World Dataset with Continuous Trajectories for Advancing Panoramic 3D Reconstruction and Beyond Poster Session 3
Jing OU ⋅ Zidong Cao ⋅ Yinrui Ren ⋅ Zhuoxiao Li ⋅ Jinjing Zhu ⋅ Tongyan Hua ⋅ Shuai Zhang ⋅ Hui Xiong ⋅ Wufan Zhao
Geometry, Localization, Matching & Motion ExHall # 131
FreeFlow: A Bias-free Hierarchical Transformer for Optical Flow Estimation Poster Session 3
Vladislav Bargatin ⋅ Alexander Yakovenko ⋅ Khaled Abud ⋅ Dmitriy Vatolin
Geometry, Localization, Matching & Motion ExHall # 129
GARDEN: Gravity-Aligned Reconstruction of Disentangled ENvironments from RGB images Poster Session 3
Jiahao Sun ⋅ Dingkun Wei ⋅ Zehong Shen ⋅ Hongyu Zhou ⋅ Yujun Shen ⋅ Liang Li
Geometry, Localization, Matching & Motion ExHall # 128
Rolling Shutter Camera Self-Calibration Poster Session 3
Yongcong Zhang ⋅ Navid Rabbani ⋅ Bangyan Liao ⋅ Chengbo Wang ⋅ Yizhen Lao ⋅ Adrien Bartoli
Geometry, Localization, Matching & Motion ExHall # 127
Detect by Track: Making Detector-Free Matcher Trackable Poster Session 3
Yusuke Sekikawa ⋅ HIDEKI SHIRAI ⋅ Ruka Eto ⋅ Yuzhe Hao ⋅ Kengo Mitsui ⋅ Nakamasa Inoue
Geometry, Localization, Matching & Motion ExHall # 126
Ray-Path-Aware Virtual Point Removal on 2D Layer-Wise Nearest Point Map Poster Session 3
DAEHYEON JEON ⋅ Kyungdon Joo ⋅ Jae-Young Sim
Geometry, Localization, Matching & Motion ExHall # 124
Delaunay Canopy: Building Wireframe Reconstruction from Airborne LiDAR Point Clouds via Delaunay Graph Poster Session 3
Donghyun Kim ⋅ Chanyoung Kim ⋅ YoungJoong Kwon ⋅ Seong Jae Hwang
Geometry, Localization, Matching & Motion ExHall # 123
On the real-world generalisability of Optical Flow models Poster Session 3
Petter Reijalt ⋅ Alexander Gielisse ⋅ Rickard Karlsson ⋅ Jan van Gemert
Geometry, Localization, Matching & Motion ExHall # 122
UniFlow: Zero-Shot LiDAR Scene Flow for Autonomous Driving Poster Session 3
Siyi Li ⋅ Qingwen Zhang ⋅ Ishan Khatri ⋅ Kyle Vedder ⋅ Eric Eaton ⋅ Deva Ramanan ⋅ Neehar Peri
Geometry, Localization, Matching & Motion ExHall # 121
Pointer-CAD v2: Plan-Then-Construct CAD Generation with Dimension-Aware Parametric Precision Poster Session 3
Dacheng Qi ⋅ Chenyu Wang ⋅ Jingwei Xu ⋅ Yi Ma ⋅ Shenghua Gao
Geometry, Localization, Matching & Motion ExHall # 120
General Self-Calibration with Varying Intrinsics Poster Session 3
Norio Kosaka ⋅ Timothy Duff ⋅ Tomas Pajdla ⋅ Akihiro Sugimoto
Geometry, Localization, Matching & Motion ExHall # 119
SKEL-CF: Coarse-to-Fine Biomechanical Skeleton and Surface Mesh Recovery Poster Session 3
Da Li ⋅ Ji-Ping Jin ⋅ Xiaodong Cun ⋅ Xuanlong Yu ⋅ Wei LIU ⋅ Rui Fan ⋅ Jiangang Kong ⋅ Kai Chen ⋅ Xi SHEN
Geometry, Localization, Matching & Motion ExHall # 118
Reconstructing Humans and Objects in Interaction using Large Reconstruction Models Poster Session 3
Agniv Chatterjee ⋅ Georgios Pavlakos
Geometry, Localization, Matching & Motion ExHall # 117
AutoCompass: Accurate Visual Localization on Public Maps by Learning from Weak Labels Poster Session 3
Javier Tirado-Garín ⋅ Alan Paul ⋅ Shuai Chen ⋅ Axel Barroso-Laguna ⋅ Tommaso Cavallari ⋅ Daniyar Turmukhambetov ⋅ Victor Adrian Prisacariu ⋅ Eric Brachmann
Geometry, Localization, Matching & Motion ExHall # 116
Beyond 2D Matching: A Unified Single-Stage Framework for Geometry-Aware Cross-View Object Geo-Localization Poster Session 3
Liyao Wang ⋅ Ruipu Wu ⋅ Haojun Xu ⋅ Lei Shi ⋅ Linjiang Huang ⋅ Si Liu
Geometry, Localization, Matching & Motion ExHall # 115
ClusterStyle: Modeling Intra-Style Diversity with Prototypical Clustering for Stylized Motion Generation Poster Session 3
Kerui Chen ⋅ Jianrong Zhang ⋅ Ming Li ⋅ Zhonglong Zheng ⋅ Hehe Fan
Geometry, Localization, Matching & Motion ExHall # 114
Gravity-aware partially calibrated absolute pose estimation from affine- or rotation-covariant features Poster Session 3
Marcus Valtonen Örnhag ⋅ Alberto Jaenal Gálvez ⋅ Stefan Adalbjörnsson
Geometry, Localization, Matching & Motion ExHall # 113
Rolling Shutter Relative Pose Estimation Made Practical Poster Session 3
Daniel Barath
Geometry, Localization, Matching & Motion ExHall # 111
SemGAN: A Semantic and Hierarchical Adversarial Network for 3D Human Pose Estimation Poster Session 3
Haodong Feng ⋅ Yu Xin ⋅ Guoqing Li
Geometry, Localization, Matching & Motion ExHall # 110
360Anything: Geometry-Free Lifting of Images and Videos to 360° Poster Session 3
Ziyi Wu ⋅ Daniel Watson ⋅ Andrea Tagliasacchi ⋅ David Fleet ⋅ Marcus Brubaker ⋅ Saurabh Saxena
Geometry, Localization, Matching & Motion ExHall # 109
Prosthesis-Aware 3D Human Pose Estimation: A Dataset and Benchmark for RSP Users Poster Session 3
Yilin Wen ⋅ Kechuan Dong ⋅ Fumiya Suginaka ⋅ Ken Endo ⋅ Yusuke Sugano
Geometry, Localization, Matching & Motion ExHall # 108
Controlling Motion Transfer in Diffusion Transformers via Attention Heads Poster Session 3
Sunyoung Jung ⋅ Jiwoo Park ⋅ Yoonseok Choi ⋅ Kyobin Choo ⋅ Ming-Hsuan Yang ⋅ Seong Jae Hwang
Geometry, Localization, Matching & Motion ExHall # 107
LoMa: Local Feature Matching Revisited Poster Session 3
David Nordström ⋅ Johan Edstedt ⋅ Georg Bökman ⋅ Jonathan Astermark ⋅ Anders Heyden ⋅ Viktor Larsson ⋅ Mårten Wadenbäck ⋅ Michael Felsberg ⋅ Fredrik Kahl
Geometry, Localization, Matching & Motion ExHall # 106
VectorReLoc: Reliable Vectorized SD Map Visual Re-localization with Contrastive Feature Alignment Poster Session 3
Ziming Liu ⋅ Quanjie Xiang ⋅ Wang yun ⋅ wang yiting ⋅ chao wen ⋅ Zhuanjian XU ⋅ Leichen Wang ⋅ HAO SUN ⋅ Guangyu Gao
Geometry, Localization, Matching & Motion ExHall # 105
WildProp: Visual Estimation of Wildlife Body Proportions at Scale Poster Session 3
Mustafa Chasmai ⋅ Aaron Sun ⋅ Subhransu Maji
Geometry, Localization, Matching & Motion ExHall # 104
TACO-Net: Topological Signatures Triumph in 3D Object Classification Poster Session 3
Anirban Ghosh ⋅ Ayan Dutta
Geometry, Localization, Matching & Motion ExHall # 103
AutoSpeed: Annotation-Free Stage-Adaptive Motion Speed Learning for Robot Manipulation Poster Session 3
Qingda Hu ⋅ Ziheng Qiu ⋅ Jieru Zhao ⋅ Zhongxue Gan ⋅ Wenchao Ding
Geometry, Localization, Matching & Motion ExHall # 102
Schroedinger’s Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics Poster Session 3
Timy Phan ⋅ Jannik Wiese ⋅ Bjorn Ommer
Geometry, Localization, Matching & Motion ExHall # 101
Event-driven Motion Deblurring via Trajectory-based Kernel Reconstruction Poster Session 3
Zhiwei Zhong ⋅ Peilin CHEN ⋅ Wei Dong ⋅ Bo Li ⋅ Anmin Liu ⋅ Shiqi Wang
Geometry, Localization, Matching & Motion ExHall # 100
RoMa v2: Harder Better Faster Denser Feature Matching Poster Session 3
Johan Edstedt ⋅ David Nordström ⋅ Yushan Zhang ⋅ Georg Bökman ⋅ Jonathan Astermark ⋅ Viktor Larsson ⋅ Anders Heyden ⋅ Fredrik Kahl ⋅ Mårten Wadenbäck ⋅ Michael Felsberg
Geometry, Localization, Matching & Motion ExHall # 99
MemPose: Category-level Object Pose Estimation with Memory Poster Session 3
Xiao Lin ⋅ Minghao Zhu ⋅ Yun Peng ⋅ Liuyi Wang ⋅ Qiyi Wang ⋅ Chengju Liu ⋅ Qijun Chen
Geometry, Localization, Matching & Motion ExHall # 98
PointLAM: Local Attentive Mamba for Efficient Point-based 3D Object Detection Poster Session 3
Xuanming Shang ⋅ Weijia Zhang ⋅ Chao Ma
Geometry, Localization, Matching & Motion ExHall # 97
UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors Poster Session 3
Xiaoyan Cong ⋅ Zekun Li ⋅ Zhiyang Dou ⋅ Hongyu Li ⋅ Omid Taheri ⋅ chuan guo ⋅ Abhay Mittal ⋅ Sizhe An ⋅ Taku Komura ⋅ Wojciech Matusik ⋅ Michael Black ⋅ Srinath Sridhar
Geometry, Localization, Matching & Motion ExHall # 96
Auto3R: Automated 3D Reconstruction and Scanning via Data-driven Uncertainty Quantification Poster Session 3
Chentao Shen ⋅ Sizhe Zheng ⋅ Bingqian Wu ⋅ Yaohua Feng ⋅ Yuanchen Fei ⋅ Mingyu Mei ⋅ Hanwen Jiang ⋅ Xiangru Huang
Geometry, Localization, Matching & Motion ExHall # 95
4D-VGGT: A SpatioTemporal Foundation Model for Dynamic Scene Geometry Estimation Poster Session 3
Haonan Wang ⋅ Hanyu Zhou ⋅ Haoyue Liu ⋅ Luxin Yan
Geometry, Localization, Matching & Motion ExHall # 94
MASS: Motion-Aligned Selective Scan for Flow-Based Video Frame Interpolation Poster Session 3
Jun-Sang YOO ⋅ Seung-Won Jung
Geometry, Localization, Matching & Motion ExHall # 92
FlowPainter: Inpainting Optical Flow via Confidence-Guided Completion Poster Session 3
Yuang Meng ⋅ Chenyang Wu ⋅ Xianshun Liu ⋅ Chun-Le Guo ⋅ Zichen Liang ⋅ Lina Lei ⋅ Jie Liang ⋅ Hui Zeng ⋅ Chongyi Li ⋅ Yabin Zhang
Geometry, Localization, Matching & Motion ExHall # 91
Syn4D: A Multiview Synthetic 4D Dataset Poster Session 3
Zeren Jiang ⋅ Yushi Lan ⋅ Yihang Luo ⋅ Yufan Deng ⋅ Zihang Lai ⋅ Edgar Sucar ⋅ Christian Rupprecht ⋅ Iro Laina ⋅ Larlus Diane ⋅ Chuanxia Zheng ⋅ Andrea Vedaldi
Geometry, Localization, Matching & Motion ExHall # 90
StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring Poster Session 3
Jianfang Li ⋅ Xiangyue Zhang ⋅ Jiaxu Zhang ⋅ Kaixing Yang ⋅ Steven Hoi
Geometry, Localization, Matching & Motion ExHall # 89
FoundationGeo: Learning Spatial Pixel-Wise Fields for Monocular Metric Geometry Poster Session 3
Muxin Liu ⋅ Xiaoyang Lyu ⋅ Tianhe Ren ⋅ Peng Dai ⋅ Xiaoshan Wu ⋅ Zhiyue Zhang ⋅ Jiaqi Zhang ⋅ Jiehong Lin ⋅ Shaoshuai Shi ⋅ Qi Xiaojuan
Geometry, Localization, Matching & Motion ExHall # 88
TETO: Tracking Events with Teacher Observation for Motion Estimation and Frame Interpolation Poster Session 3
Jini Yang ⋅ Eunbeen Hong ⋅ Soowon Son ⋅ Hyunkoo Lee ⋅ Sunghwan Hong ⋅ Sunok Kim ⋅ Seungryong Kim
Geometry, Localization, Matching & Motion ExHall # 87
SPARC: Scalable Path-Specific Counterfactual Fairness via Causal Conditional Independence Poster Session 3
Bowei Tian ⋅ Yexiao He ⋅ Ziyao Wang ⋅ Meng Liu ⋅ Yongkai Wu ⋅ Ang Li
Geometry, Localization, Matching & Motion ExHall # 130
Layering Virtual Try-On Poster Session 4
Chun Feng ⋅ Bowei Chen ⋅ Shan Mengyi ⋅ Ira Kemelmacher-Shlizerman
Image Generation, Editing & Diffusion ExHall # 185
GR-GRPO: Graph-Diffused Credit for Autoregressive Image RL Alignment Poster Session 4
Zheyu Zhang ⋅ Peng-Tao Jiang ⋅ Tianyi Zheng ⋅ Jian Zhang ⋅ Jinwei Chen ⋅ Bo Li
Image Generation, Editing & Diffusion ExHall # 213
DARL: Efficient Document-to-Markup Generation via Look-Ahead Diffusion Trajectory Sampling Poster Session 4
Wentao Yang ⋅ Yongxin Shi ⋅ Rui Tang ⋅ Peirong Zhang ⋅ Shihang Wu ⋅ Huiguo He ⋅ Zheng Huang ⋅ Dezhi Peng ⋅ Minghui Liao ⋅ Lianwen Jin
Image Generation, Editing & Diffusion ExHall # 294
Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities Poster Session 4
Yuan Xiong ⋅ Miao Ziqi ⋅ Lijun Li ⋅ Chen Qian ⋅ Jie Li ⋅ Jing Shao
Image Generation, Editing & Diffusion ExHall # 295
DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models Poster Session 4
Lunbin Zeng ⋅ Jingfeng Yao ⋅ Bencheng Liao ⋅ Hongyuan Tao ⋅ Wenyu Liu ⋅ Xinggang Wang
Image Generation, Editing & Diffusion ExHall # 212
Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis Poster Session 4
Zicheng Kong ⋅ Dehua Ma ⋅ Zhenbo Xu ⋅ Anwen Yang ⋅ Yiwei Ru ⋅ Haoran Wang ⋅ Zixuan Zhou ⋅ Fuqing Bie ⋅ Liuyu Xiang ⋅ Huijia Wu ⋅ Jian Zhao ⋅ Zhaofeng He
Image Generation, Editing & Diffusion ExHall # 233
DreamLite: A Lightweight On-Device Unified Model for Image Generation and Editing Poster Session 4
Kailai Feng ⋅ Yuxiang WEI ⋅ Bo Chen ⋅ yang pan ⋅ Hu Ye ⋅ Songwei Liu ⋅ Chenqian Yan ⋅ Yuan Gao ⋅ Wangmeng Zuo
Image Generation, Editing & Diffusion ExHall # 203
DRPO: Disentangling Demographic Bias from Rewards for Fair Diffusion Alignment Poster Session 4
YeonGyu Han ⋅ Junah Jung ⋅ Dongheon Lee
Image Generation, Editing & Diffusion ExHall # 155
CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation Poster Session 4
Li Haodong ⋅ Chunmei Qing ⋅ Huanyu Zhang ⋅ Dongzhi Jiang ⋅ Yihang Zou ⋅ Hongbo Peng ⋅ Dingming Li ⋅ Yuhong Dai ⋅ ZePeng Lin ⋅ Juanxi Tian ⋅ Yi Zhou ⋅ Siqi Dai
Image Generation, Editing & Diffusion ExHall # 117
Towards In-Context Tone Style Transfer with A Large-Scale Triplet Dataset Poster Session 4
Yuhai Deng ⋅ Huimin She ⋅ Wei Shen ⋅ Meng Li ⋅ Ruoxi Wu ⋅ Lunxi Yuan ⋅ Xiang Li
Image Generation, Editing & Diffusion ExHall # 221
RefReward-SR: LR-Conditioned Reward Modeling for Preference-Aligned Super-Resolution Poster Session 4
Yushuai Song ⋅ Weize Quan ⋅ Weining Wang ⋅ Jiahui Sun ⋅ Jing Liu ⋅ Meng Li ⋅ Pengbin Yu ⋅ Zhentao Chen ⋅ Wei Shen ⋅ Lunxi Yuan ⋅ Dong-ming Yan
Image Generation, Editing & Diffusion ExHall # 232
RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards Poster Session 4
ye junyan ⋅ Leqi Zhu ⋅ Yuncheng Guo ⋅ Dongzhi Jiang ⋅ Zilong Huang ⋅ Yifan Zhang ⋅ Zhiyuan Yan ⋅ Haohuan Fu ⋅ Conghui He ⋅ Weijia Li
Image Generation, Editing & Diffusion ExHall # 148
InnoText: A Unified Model for Visual Text Generation and Editing Poster Session 4
Haowei Liu ⋅ Runze He ⋅ Jian Lu ⋅ Ao Ma ⋅ Run Ling ⋅ Ke Cao ⋅ Jiasong Feng ⋅ Wei Feng ⋅ Shuo Lu ⋅ Yexing Xu ⋅ WANG Yun ⋅ Jing Wang ⋅ Zhanjie Zhang
Image Generation, Editing & Diffusion ExHall # 116
PIPBench: A Profile-Inclusive Framework for Personalized Image Generation Evaluation Poster Session 4
Yuhang Wu ⋅ Shuxiang Zhang ⋅ WEE CHING ⋅ Chi Zhang ⋅ Miao Liu
Image Generation, Editing & Diffusion ExHall # 118
CORE-V: Chain-Of-thought REasoning for Image Editing with Visual Interaction Poster Session 4
Tianyang Yan ⋅ Peisen Zhao ⋅ Guanghao Zheng ⋅ Mingxing Xu ⋅ Zhibo Zhang ⋅ Wenrui Dai ⋅ Junni Zou ⋅ Hongkai Xiong ⋅ Xiaopeng Zhang ⋅ Qi Tian
Image Generation, Editing & Diffusion ExHall # 119
Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking Poster Session 4
Zirui Zheng ⋅ Takashi Isobe ⋅ Tong Shen ⋅ XU JIA ⋅ Xiaomin Li ⋅ Jianbin Zhao ⋅ Mengmeng Ge ⋅ Baolu Li ⋅ Qinghe Wang ⋅ Haiwen Diao ⋅ Dong Li ⋅ Yunzhi Zhuge ⋅ Dong Zhou ⋅ Huchuan Lu ⋅ Emad Barsoum
Image Generation, Editing & Diffusion ExHall # 120
NumColor: Precise Numeric Color Control in Text-to-Image Generation Poster Session 4
Muhammad Atif Butt ⋅ Diego Hernández ⋅ Alex Gomez-Villa ⋅ Kai WANG ⋅ Javier Vazquez-Corral ⋅ Joost Van de Weijer
Image Generation, Editing & Diffusion ExHall # 121
Vision Bridge Transformer at Scale Poster Session 4
Zhenxiong Tan ⋅ Zeqing Wang ⋅ Xingyi Yang ⋅ Songhua Liu ⋅ Xinchao Wang
Image Generation, Editing & Diffusion ExHall # 122
OpenVE-3M: A Large-Scale High-Quality Dataset for Instruction-Based Video Editing Poster Session 4
Haoyang He ⋅ Jie Wang ⋅ Jiangning Zhang ⋅ Zhucun Xue ⋅ Xingyuan Bu ⋅ Qiangpeng Yang ⋅ Min Zheng ⋅ Lei Xie
Image Generation, Editing & Diffusion ExHall # 123
Learn Once, Edit Anywhere: Visual Direction Transfer for Diffusion Models Poster Session 4
Yusuf Dalva ⋅ Hidir Yesiltepe ⋅ Pinar Yanardag
Image Generation, Editing & Diffusion ExHall # 124
VGEdit: Unlocking Video Generation Priors for Reasoning-Informed Image Editing Poster Session 4
Haiquan Lu ⋅ Gongfan Fang ⋅ Xinyin Ma ⋅ Xinchao Wang
Image Generation, Editing & Diffusion ExHall # 125
MoScale: Autoregressive Next-Scale Prediction for Human Motion Generation and Editing Poster Session 4
Inwoo Hwang ⋅ Hojun Jang ⋅ Bing Zhou ⋅ Jian Wang ⋅ Young Min Kim ⋅ chuan guo
Image Generation, Editing & Diffusion ExHall # 126
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer Poster Session 4
Shuai Wang ⋅ Liang Li ⋅ Yang Chen ⋅ Ruopeng Gao ⋅ Yao Teng ⋅ Limin Wang
Image Generation, Editing & Diffusion ExHall # 127
Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection Poster Session 4
Chanhui Lee ⋅ Donggyu Choi ⋅ Seunghyun Shin ⋅ Hae-Gon Jeon ⋅ Jeany Son
Image Generation, Editing & Diffusion ExHall # 128
Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer Poster Session 4
Bo Wei ⋅ Xianhui Lin ⋅ Yi Dong ⋅ Zhongzhong Li ⋅ Zonghui Li ⋅ Zirui Wang ⋅ Jiachen Yang ⋅ Xing Liu ⋅ Hong Gu ⋅ Xiaoming Li ⋅ Wangmeng Zuo
Image Generation, Editing & Diffusion ExHall # 129
Aligning Human Sense: Calibrated Distributional Reward Learning for Video Generation Poster Session 4
Naixin Zhai ⋅ Weihua Cheng ⋅ Dexu Yu ⋅ Yikai Gu ⋅ Hanwen Du ⋅ Junchen Fu ⋅ Chenxi Huang ⋅ Yingwei Song ⋅ Liyuan Ma ⋅ Yang Ran ⋅ Youhua Li ⋅ Yongxin Ni
Image Generation, Editing & Diffusion ExHall # 130
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning Poster Session 4
Haomin Wang ⋅ Qi Wei ⋅ Qianli Ma ⋅ Shengyuan Ding ⋅ Jinhui Yin ⋅ Kai Chen ⋅ hongjie Zhang
Image Generation, Editing & Diffusion ExHall # 131
MANGO: Unleashing Image Generation Capability of Unified Multimodal Models Poster Session 4
Yi Wang ⋅ Mushui Liu ⋅ Wanggui He ⋅ Hanyang Yuan ⋅ Ziwei Huang ⋅ Guanghao Zhang ⋅ Wenkai Fang ⋅ Haoze Jiang ⋅ Shengxuming Zhang ⋅ Weilong Dai ⋅ Haofei Zhang ⋅ Mingli Song ⋅ Hao Jiang ⋅ Jie Song
Image Generation, Editing & Diffusion ExHall # 132
Anti-Prompt: Image Protection against Text-Guided Image-to-Video Generation Poster Session 4
Yeonghwan Song ⋅ Chanhui Lee ⋅ Jinsoo Park ⋅ Jeany Son
Image Generation, Editing & Diffusion ExHall # 133
LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching Poster Session 4
Jinshan Liu ⋅ Haoran Qin ⋅ Xiaobing Tu ⋅ Jiacheng Liu ⋅ Jiahui Hu ⋅ zhengan yan ⋅ Yukun Xie ⋅ Kerui Shen ⋅ Jinkui Ren ⋅ Yuqi Lin ⋅ Xiantao Zhang ⋅ Linfeng Zhang
Image Generation, Editing & Diffusion ExHall # 134
UEval: A Benchmark for Unified Multimodal Generation Poster Session 4
Bo Li ⋅ Yida Yin ⋅ Wenhao Chai ⋅ Xingyu Fu ⋅ Zhuang Liu
Image Generation, Editing & Diffusion ExHall # 135
LISA: Locality-Informed Speculative Decoding for Accelerating Autoregressive Image Generation Poster Session 4
Ying Li ⋅ Siyong Jian ⋅ Zhaode Wang ⋅ Zhiwen Chen ⋅ Chengfei Lyu ⋅ Huan Wang
Image Generation, Editing & Diffusion ExHall # 136
RePlan: Reasoning-Guided Region Planning for Complex Instruction-Based Image Editing Poster Session 4
Tianyuan Qu ⋅ Lei Ke ⋅ Xiaohang Zhan ⋅ Longxiang Tang ⋅ Yuqi Liu ⋅ Bohao PENG ⋅ Bei Yu ⋅ Dong Yu ⋅ Jiaya Jia
Image Generation, Editing & Diffusion ExHall # 137
UNet-Twice: A Simple Structured Reference-based Inpainting Framework Poster Session 4
Junda Lu ⋅ zhiqiao xu ⋅ Houkun Wu ⋅ Wei Cui ⋅ Bo Huang ⋅ Mingyang Chen ⋅ Bing Li
Image Generation, Editing & Diffusion ExHall # 138
Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility Poster Session 4
honglin lin ⋅ Chonghan Qin ⋅ Zheng Liu ⋅ Qizhi Pei ⋅ Yu Li ⋅ Zhanping Zhong ⋅ Xin Gao ⋅ Wei Li ⋅ Wentao Zhang ⋅ Yanfeng Wang ⋅ Conghui He ⋅ Lijun Wu
Image Generation, Editing & Diffusion ExHall # 139
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Poster Session 4
Xinyao Zhang ⋅ Wenkai Dong ⋅ YuXin Song ⋅ Bo Fang ⋅ Qi Zhang ⋅ Jing Wang ⋅ Fan Chen ⋅ Hui Zhang ⋅ Haocheng Feng ⋅ Yu Lu ⋅ Hang Zhou ⋅ Chun Yuan ⋅ Jingdong Wang
Image Generation, Editing & Diffusion ExHall # 140
Query-Kontext: An Unified Multimodal Model for Image Generation and Editing Poster Session 4
YuXin Song ⋅ Wenkai Dong ⋅ Shizun Wang ⋅ Qi Zhang ⋅ Song Xue ⋅ Tao Yuan ⋅ Hu Yang ⋅ Haocheng Feng ⋅ Hang Zhou ⋅ Xinyan Xiao ⋅ Jingdong Wang
Image Generation, Editing & Diffusion ExHall # 141
Next-Frame Decoding for Ultra-Low-Bitrate Image Compression with Video Diffusion Priors Poster Session 4
Yunuo Chen ⋅ Chuqin Zhou ⋅ Jiangchuan Li ⋅ Xiaoyue Ling ⋅ Bing He ⋅ Jincheng Dai ⋅ Li Song ⋅ Guo Lu
Image Generation, Editing & Diffusion ExHall # 142
LensStyle: Learning the Optical Aesthetics for Controllable Stylized Lens Effect Rendering Poster Session 4
Yachuan Huang ⋅ Liwen Xiao ⋅ Liao Shen ⋅ Qiwen Wang ⋅ Huiqiang Sun ⋅ Zhiyu Pan ⋅ Zhiguo Cao
Image Generation, Editing & Diffusion ExHall # 143
TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution Poster Session 4
Sicheng Gao ⋅ Yixuan Liu ⋅ Tong Shen ⋅ Zhuyun Zhou ⋅ Zongwei Wu ⋅ Radu Timofte
Image Generation, Editing & Diffusion ExHall # 144
In-context Region-based Drag: Drag Any Region to Any Shape Poster Session 4
Jiacheng Sui ⋅ Tianyu Hao ⋅ Bingjie Gao ⋅ Li Niu ⋅ Guangtao Zhai
Image Generation, Editing & Diffusion ExHall # 145
FlowInOne: Unifying Multimodal Generation as Image-in, Image-out Flow Matching Poster Session 4
Junchao Yi ⋅ Rui Zhao ⋅ Jiahao Tang ⋅ Weixian Lei ⋅ Linjie Li ⋅ Qisheng Su ⋅ Zhengyuan Yang ⋅ Lijuan Wang ⋅ Xiaofeng Zhu ⋅ Alex Jinpeng Wang
Image Generation, Editing & Diffusion ExHall # 146
AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization Poster Session 4
Dailan He ⋅ Guanlin Feng ⋅ Xingtong Ge ⋅ Yi ZHANG ⋅ Bingqi Ma ⋅ Guanglu Song ⋅ Yu Liu ⋅ Hongsheng LI
Image Generation, Editing & Diffusion ExHall # 147
Text-Conditioned Background Generation for Editable Multi-Layer Documents Poster Session 4
Taewon Kang ⋅ Joseph K J ⋅ Christopher Tensmeyer ⋅ Jihyung Kil ⋅ Wanrong Zhu ⋅ Ming C Lin ⋅ Vlad Morariu
Image Generation, Editing & Diffusion ExHall # 149
Multi-dimensional Preference Alignment by Conditioning Reward Itself Poster Session 4
JIHO JANG ⋅ Jin-Young Kim ⋅ Kyungjune Baek ⋅ Nojun Kwak
Image Generation, Editing & Diffusion ExHall # 150
Follow-Your-Mind: Towards Inversion-Free Brain-Driven Visual Context Synthesis and Editing Poster Session 4
Haodong Jing ⋅ Panqi Yang ⋅ Rongchao Zhang ⋅ Zhipeng Liu ⋅ Yajun Liu ⋅ Xuehai Bai ⋅ Yongqiang Ma ⋅ Nanning Zheng
Image Generation, Editing & Diffusion ExHall # 151
Histocomponent-driven Universal Model for Virtual Immunohistochemistry Multiplex Staining via Joint Manifold Evolution Poster Session 4
Jiajun Cen ⋅ Siyuan Xu ⋅ Lili Gao ⋅ Yan Wang
Image Generation, Editing & Diffusion ExHall # 152
Learning to Stylize by Learning to Destylize: A Scalable Paradigm for Supervised Style Transfer Poster Session 4
Ye Wang ⋅ Zili Yi ⋅ Yibo Zhang ⋅ Peng Zheng ⋅ Xuping Xie ⋅ Jiang Lin ⋅ Yijun Li ⋅ Yilin Wang ⋅ Rui Ma
Image Generation, Editing & Diffusion ExHall # 153
VSDiffusion: Taming Ill-Posed Shadow Generation via Visibility-Constrained Diffusion Poster Session 4
Jing Li ⋅ Jing Zhang
Image Generation, Editing & Diffusion ExHall # 154
Beyond Fixed Luminance: Towards Panchromatic and Orthochromatic Image Colorization Poster Session 4
Swarnim Maheshwari ⋅ Syed Imam Ali ⋅ Vineeth N Balasubramanian
Image Generation, Editing & Diffusion ExHall # 156
EruDiff: Refactoring Knowledge in Diffusion Models for Advanced Text-to-Image Synthesis Poster Session 4
Xiefan Guo ⋅ Xinzhu Ma ⋅ Haoxiang Ma ⋅ Zihao Zhou ⋅ Di Huang
Image Generation, Editing & Diffusion ExHall # 157
NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation Poster Session 4
Yujiang Pu ⋅ Yu Kong
Image Generation, Editing & Diffusion ExHall # 158
VTEdit-Bench: A Comprehensive Benchmark for Multi-Reference Image Editing Models in Virtual Try-On Poster Session 4
XIAOYE LIANG ⋅ Zhiyuan Qu ⋅ Mingye Zou ⋅ Jiaxin Liu ⋅ Lai Jiang ⋅ Mai Xu ⋅ Yiheng Zhu
Image Generation, Editing & Diffusion ExHall # 159
Training-Free Multi-Concept Image Editing Poster Session 4
Niki Maria Foteinopoulou ⋅ Ignas Budvytis ⋅ Stephan Liwicki
Image Generation, Editing & Diffusion ExHall # 160
DARE to Mitigate Hallucination: Dual-path Auto-Regressive-aware Editing Poster Session 4
Jaeho Lee ⋅ Jeongeun Lee ⋅ Gyeong-Moon Park
Image Generation, Editing & Diffusion ExHall # 161
Scaling Multi-Reference Image Generation with Dynamic Reward Optimization Poster Session 4
Wenwang Huang ⋅ Yusen Fu ⋅ Mengfei Huang ⋅ Junjie Wang ⋅ Yulin Li ⋅ Gan Liu ⋅ Jing Cai ⋅ Yancheng He ⋅ Zhuotao Tian
Image Generation, Editing & Diffusion ExHall # 162
Q-REAL: Towards Naturalness and Distortion Evaluation for AI-Generated Content Poster Session 4
Shushi Wang ⋅ Zicheng Zhang ⋅ Chunyi Li ⋅ Wei Wang ⋅ Liya Ma ⋅ Xiaoyu Li ⋅ Fengjiao Chen ⋅ Xuezhi Cao ⋅ Guangtao Zhai ⋅ Xiaohong Liu
Image Generation, Editing & Diffusion ExHall # 163
RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models Poster Session 4
Ritika Allada ⋅ Pinar Yanardag
Image Generation, Editing & Diffusion ExHall # 164
From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation Poster Session 4
Baixuan Zhao ⋅ Xinyu Zhang ⋅ 华渝 郑 ⋅ Shuaicheng Liu ⋅ Xiongkuo Min ⋅ Guangtao Zhai ⋅ Xiaohong Liu
Image Generation, Editing & Diffusion ExHall # 165
NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment Poster Session 4
Jisung Hwang ⋅ Yunhong Min ⋅ Jaihoon Kim ⋅ I-Chao Shen ⋅ Minhyuk Sung
Image Generation, Editing & Diffusion ExHall # 166
TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On Poster Session 4
Dingbao Shao ⋅ Song Wu ⋅ Shenyi Wang ⋅ Ye Wang ⋅ Ziheng Tang ⋅ Fei Liu ⋅ Jiang Lin ⋅ Xinyu Chen ⋅ Qian Wang ⋅ Ying Tai ⋅ Jian Yang ⋅ Zili Yi
Image Generation, Editing & Diffusion ExHall # 167
SAEdit: Token-Level Control for Continuous Image Editing via Sparse Autoencoder Poster Session 4
Ronen Kamenetsky ⋅ Sara Dorfman ⋅ Daniel Garibi ⋅ Roni Paiss ⋅ Or Patashnik ⋅ Danny Cohen-Or
Image Generation, Editing & Diffusion ExHall # 168
ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors Poster Session 4
Haodong Yu ⋅ Yabo Zhang ⋅ Donglin Di ⋅ Ruyi Zhang ⋅ Wangmeng Zuo
Image Generation, Editing & Diffusion ExHall # 169
Attribute Token Arithmetic: Disentangled and Continuous Semantic Control for Visual Autoregressive Models Poster Session 4
Xindi Yang ⋅ Yicheng Wu ⋅ Cheng Zhang ⋅ Jianfei Cai ⋅ Tien-Tsin Wong
Image Generation, Editing & Diffusion ExHall # 170
MPO: Single-Stream Policy Optimization for Efficient Text-to-Image Alignment Poster Session 4
Lishuai Gao ⋅ Jie Hu ⋅ Cong Wei ⋅ Yujie Zhong ⋅ Yibo Zhao ⋅ Zan Gao ⋅ Xiaoming Wei
Image Generation, Editing & Diffusion ExHall # 171
MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training Poster Session 4
Haotian Xue ⋅ Qi Chen ⋅ Zhonghao Wang ⋅ Xun Huang ⋅ Eli Shechtman ⋅ Jinrong Xie ⋅ Yongxin Chen
Image Generation, Editing & Diffusion ExHall # 172
GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning Poster Session 4
Kaixun Jiang ⋅ Yuzheng Wang ⋅ Junjie Zhou ⋅ Pandeng Li ⋅ Zhihang Liu ⋅ Chen-Wei Xie ⋅ Zhaoyu Chen ⋅ Yun Zheng ⋅ Wenqiang Zhang
Image Generation, Editing & Diffusion ExHall # 173
IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation Poster Session 4
Yuanming Li ⋅ Qize Yang ⋅ Nan Lei ⋅ Shenghao Fu ⋅ Ling-An Zeng ⋅ Jian-Fang Hu ⋅ Xihan Wei ⋅ WEISHI ZHENG
Image Generation, Editing & Diffusion ExHall # 174
Revisiting Autoregressive Models for Generative Image Classification Poster Session 4
Ilia Sudakov ⋅ Artem Babenko ⋅ Dmitry Baranchuk
Image Generation, Editing & Diffusion ExHall # 175
AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation Poster Session 4
Yuchao Gu ⋅ Guian Fang ⋅ Yuxin Jiang ⋅ Weijia Mao ⋅ Song Han ⋅ Han Cai ⋅ Mike Zheng Shou
Image Generation, Editing & Diffusion ExHall # 176
FitControler: Toward Fit-Aware Virtual Try-On Poster Session 4
Lu Yang ⋅ Yicheng Liu ⋅ Letian Zhou ⋅ Yanan Li ⋅ Xiang Bai ⋅ Hao Lu
Image Generation, Editing & Diffusion ExHall # 177
A²-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks Poster Session 4
华渝 郑 ⋅ Guangzhao Li ⋅ Baixuan Zhao ⋅ Siqi Luo ⋅ Hantao Jiang ⋅ Guangtao Zhai ⋅ Xiaohong Liu
Image Generation, Editing & Diffusion ExHall # 178
LoGAN: Multilingual Font Localization with Generative Agents Poster Session 4
Zhuoning Yuan ⋅ Ta-Ying Cheng ⋅ Benjamin Klein
Image Generation, Editing & Diffusion ExHall # 179
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models Poster Session 4
Ruchit Rawal ⋅ Reza Shirkavand ⋅ Sayak Paul ⋅ Yuxin Wen ⋅ Heng Huang ⋅ Yizheng Chen ⋅ Tom Goldstein ⋅ Gowthami Somepalli
Image Generation, Editing & Diffusion ExHall # 180
RubricRL: Simple Generalizable Rewards for Text-to-Image Generation Poster Session 4
Xuelu Feng ⋅ Yunsheng Li ⋅ Ziyu Wan ⋅ Zixuan Gao ⋅ Junsong Yuan ⋅ Dongdong Chen ⋅ Chunming Qiao
Image Generation, Editing & Diffusion ExHall # 181
ELDiff: When Evidential Learning Meets Text-to-Image Diffusion Poster Session 4
Qingtao Pan ⋅ Kai Ye ⋅ Zhihao Dou ⋅ Bing Ji ⋅ Shuo Li
Image Generation, Editing & Diffusion ExHall # 182
Rethinking Garment Conditioning in Diffusion-based Virtual Try-On: Decouple, Don't Denoise Poster Session 4
Kihyun Na ⋅ Jinyoung Choi ⋅ Injung Kim
Image Generation, Editing & Diffusion ExHall # 183
UniTranslator: A Unified Multi-modal framework for End-to-end In-Image Machine Translation Poster Session 4
Jiahao Lyu ⋅ Pei Fu ⋅ Zhenhang Li ⋅ Shaojie Zhang ⋅ Jiahui Yang ⋅ Yu ZHOU ⋅ Can Ma ⋅ Zhenbo Luo ⋅ Jian Luan
Image Generation, Editing & Diffusion ExHall # 184
PosterCopilot: Toward Layout Reasoning and Controllable Editing for Professional Graphic Design Poster Session 4
Jiazhe Wei ⋅ Ken Li ⋅ Tianyu Lao ⋅ Haofan Wang ⋅ Yueming Lyu ⋅ Liang Wang ⋅ Caifeng Shan ⋅ Chenyang Si
Image Generation, Editing & Diffusion ExHall # 186
Setting the Stage: Text-Driven Scene-Consistent Image Generation Poster Session 4
Cong Xie ⋅ Che Wang ⋅ Yan Zhang ⋅ Ruiqi Yu ⋅ Han Zou ⋅ Zheng Pan ⋅ Zhenpeng Zhan
Image Generation, Editing & Diffusion ExHall # 187
PPTArena: A Benchmark for PowerPoint Editing Poster Session 4
Michael Ofengenden ⋅ Yunze Man ⋅ Ziqi Pang ⋅ Liang-Yan Gui ⋅ Yu-Xiong Wang
Image Generation, Editing & Diffusion ExHall # 188
Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation Poster Session 4
Yichen Zhang ⋅ Da Peng ⋅ Zonghao Guo ⋅ zijian zhang ⋅ Xuesong Yang ⋅ Tong Sun ⋅ Shichu Sun ⋅ Yidan Zhang ⋅ Yanghao Li ⋅ Haiyan Zhao ⋅ Wang Xu ⋅ Qi Shi ⋅ Yangang Sun ⋅ Chi Chen ⋅ Shuo Wang ⋅ Yukun Yan ⋅ Xu Han ⋅ Qiang Ma ⋅ Wei Ke ⋅ Liang Wang ⋅ Zhiyuan Liu ⋅ Maosong Sun
Image Generation, Editing & Diffusion ExHall # 189
Stream-DiffVSR: Low-Latency Streamable Video Super-Resolution via Auto-Regressive Diffusion Poster Session 4
Hau-Shiang Shiu ⋅ Chin-Yang Lin ⋅ Zhixiang Wang ⋅ Chi-Wei Hsiao ⋅ Po-Fan Yu ⋅ Yu-Chih Chen ⋅ Yu-Lun Liu
Image Generation, Editing & Diffusion ExHall # 190
RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement Poster Session 4
Zi-Xiang Ni ⋅ Bo-Lun Huang ⋅ Teng-Fang Hsiao ⋅ Bo-Kai Ruan ⋅ Hong-Han Shuai
Image Generation, Editing & Diffusion ExHall # 191
UniREditBench: A Unified Reasoning-based Image Editing Benchmark Poster Session 4
Feng Han ⋅ Yibin Wang ⋅ Chenglin Li ⋅ Zheming Liang ⋅ Dianyi Wang ⋅ Yang Jiao ⋅ Zhipeng Wei ⋅ Chao Gong ⋅ Cheng Jin ⋅ Jiaqi Wang
Image Generation, Editing & Diffusion ExHall # 192
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models Poster Session 4
Weiyang Jin ⋅ Yuwei Niu ⋅ Jiaqi Liao ⋅ Chengqi Duan ⋅ Aoxue Li ⋅ Shenghua Gao ⋅ Xihui Liu
Image Generation, Editing & Diffusion ExHall # 193
Policy-Based Tuning of Autoregressive Image Models with Instance- and Distribution-Level Rewards Poster Session 4
Orhun Baran ⋅ Melih Kandemir ⋅ Ramazan Gokberk Cinbis
Image Generation, Editing & Diffusion ExHall # 194
Spanning Tree Autoregressive Visual Generation Poster Session 4
Sangkyu Lee ⋅ Changho Lee ⋅ Janghoon Han ⋅ Hosung Song ⋅ Tackgeun You ⋅ Hwasup Lim ⋅ Stanley Jungkyu Choi ⋅ Honglak Lee ⋅ Youngjae Yu
Image Generation, Editing & Diffusion ExHall # 195
HRDiT: Training-Free High-Resolution Image Generation with Off-the-Shelf Diffusion Transformer Models Poster Session 4
Yu Xue ⋅ Haoxuan Qu ⋅ ZHUOLING Li ⋅ Hongbin Xu ⋅ Jianxiong Yin ⋅ Simon See ⋅ Hossein Rahmani ⋅ Jun Liu
Image Generation, Editing & Diffusion ExHall # 196
POET: Preference Optimization for Enhanced Text-to-Image Generation Poster Session 4
Ruibo Chen ⋅ Jiacheng Pan ⋅ Heng Huang ⋅ Zhenheng Yang
Image Generation, Editing & Diffusion ExHall # 197
Discrete Noise Inversion for Next-scale Autoregressive Text-based Image Editing Poster Session 4
Minh Quan Dao ⋅ Xiaoxiao He ⋅ Ligong Han ⋅ Ngan Nguyen ⋅ Amin Nobari ⋅ Han Zhang ⋅ Faez Ahmed ⋅ Viet Anh Nguyen ⋅ Dimitris N. Metaxas
Image Generation, Editing & Diffusion ExHall # 198
TOPA: Mitigating Concept Dominance in Diffusion Personalization via Target-Oriented Perturbation Augmentation Poster Session 4
Jiayou Lu ⋅ Mingzhi Lyu ⋅ Junfeng Huang ⋅ Wai-Kin Adams Kong
Image Generation, Editing & Diffusion ExHall # 199
Reward Lightning: Fast Video Generation via Homologous Preference Distillation Poster Session 4
Jiaxiang Cheng ⋅ bing ma ⋅ Xuhua Ren ⋅ Kai Yu ⋅ Peng Zhang ⋅ Tianxiang Zheng ⋅ Qinglin Lu
Image Generation, Editing & Diffusion ExHall # 200
Reinforcement Learning for Multimodal Diffusion Language Models via Bidimensional Trajectory and Thought Optimization Poster Session 4
Bowen Li ⋅ Yinjie Wang ⋅ Yunzhi Zhang ⋅ Junhong Liu ⋅ Yingqing Guo ⋅ Jiajun Wu ⋅ Mengdi Wang ⋅ Ling Yang
Image Generation, Editing & Diffusion ExHall # 201
Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision Poster Session 4
Dohyun Kim ⋅ Seungwoo Lyu ⋅ Seung Kim ⋅ Paul Hongsuck Seo
Image Generation, Editing & Diffusion ExHall # 202
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models Poster Session 4
Jialv Zou ⋅ Bencheng Liao ⋅ Qian Zhang ⋅ Wenyu Liu ⋅ Xinggang Wang
Image Generation, Editing & Diffusion ExHall # 204
Personalized Reward Modeling for Text-to-Image Generation Poster Session 4
Jeongeun Lee ⋅ Ryang Heo ⋅ Dongha Lee
Image Generation, Editing & Diffusion ExHall # 205
Distribution Matching Distillation Meets Reinforcement Learning Poster Session 4
Dengyang Jiang ⋅ Dongyang Liu ⋅ Zanyi Wang ⋅ Qilong Wu ⋅ Liuzhuozheng Li ⋅ Heng-Zhuang Li ⋅ Xin Jin ⋅ Zhen Li ⋅ Changsheng Lu ⋅ Mengmeng Wang ⋅ Steven Hoi ⋅ Peng Gao ⋅ Harry Yang
Image Generation, Editing & Diffusion ExHall # 206
From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting Poster Session 4
Zizhao Chen ⋅ Ping Wei ⋅ Guang Dai ⋅ Jingdong Wang ⋅ Mengmeng Wang
Image Generation, Editing & Diffusion ExHall # 207
Tiled Prompts: Overcoming Prompt Misguidance in Image and Video Super-Resolution Poster Session 4
Bryan Kim ⋅ Jonghyun Park ⋅ Jong Chul Ye
Image Generation, Editing & Diffusion ExHall # 208
Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments Poster Session 4
Haoyuan Li ⋅ Rui Liu ⋅ Hehe Fan ⋅ Yi Yang
Image Generation, Editing & Diffusion ExHall # 209
Unmasking-Time Visual Calibration for Hallucination Mitigation in Multimodal Discrete Diffusion Language Models Poster Session 4
Tian Qin ⋅ Junzhe Chen ⋅ Tianshu Zhang ⋅ Lijie Wen
Image Generation, Editing & Diffusion ExHall # 210
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing Poster Session 4
Zitong Xu ⋅ Huiyu Duan ⋅ Zhongpeng Ji ⋅ Xinyun Zhang ⋅ Yutao Liu ⋅ Xiongkuo Min ⋅ Ke Gu ⋅ Jian Zhang ⋅ Shusong Xu ⋅ Jinwei Chen ⋅ Bo Li ⋅ Guangtao Zhai
Image Generation, Editing & Diffusion ExHall # 211
LayerVerse: Finding the Sweet Spot for KV-Injection in Training-Free Image Editing Poster Session 4
Mikhail Zhirnov ⋅ Arsen Kuzhamuratov ⋅ Andrey Kuznetsov ⋅ Ivan Oseledets ⋅ Konstantin Sobolev
Image Generation, Editing & Diffusion ExHall # 214
TerraDiT-Ω: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive Poster Session 4
Brian Wei ⋅ Srikumar Sastry ⋅ Daniel Cher ⋅ Eric Xing ⋅ Nathan Jacobs
Image Generation, Editing & Diffusion ExHall # 215
Achieving Subcategorical Erasure in Text-to-Image Models Poster Session 4
Pranav Singh Chib ⋅ Pravendra Singh
Image Generation, Editing & Diffusion ExHall # 216
LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents Poster Session 4
Yun He ⋅ Francesco Pittaluga ⋅ Ziyu Jiang ⋅ Matthias Zwicker ⋅ Manmohan Chandraker ⋅ Zaid Tasneem
Image Generation, Editing & Diffusion ExHall # 217
FairSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation Poster Session 4
Tatiana Gaintseva ⋅ Akshit Achara ⋅ Greg Slabaugh ⋅ Jiankang Deng ⋅ Ismail Elezi
Image Generation, Editing & Diffusion ExHall # 218
Unsafe by Reciprocity: How Generation–Understanding Coupling Undermines Safety in Unified Multimodal Models Poster Session 4
Kaishen Wang ⋅ Heng Huang
Image Generation, Editing & Diffusion ExHall # 219
WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment Poster Session 4
Xujie Zhang ⋅ Runyan Du ⋅ Song Chang ⋅ Jiang Li ⋅ Dongliang Shao ⋅ Liping Wu ⋅ Luo Wei ⋅ Xiaochao Qu ⋅ Luoqi Liu ⋅ Xiaodan Liang
Image Generation, Editing & Diffusion ExHall # 220
Target-aware Image Editing via Cycle-consistent Constraints Poster Session 4
Yanghao Wang ⋅ Zhen Wang ⋅ Long Chen
Image Generation, Editing & Diffusion ExHall # 222
FineEdit: Fine-Grained Image Edit with Bounding Box Guidance Poster Session 4
Haohang Xu ⋅ Lin Liu ⋅ Zhibo Zhang ⋅ Rong Cong ⋅ Xiaopeng Zhang ⋅ Qi Tian
Image Generation, Editing & Diffusion ExHall # 223
SpecV: Specification Verification for Robust Unified Multimodal Evaluation Poster Session 4
Weihao Yu ⋅ Rongyao Fang ⋅ Yuxuan Cai ⋅ Linjiang Huang ⋅ Yuhuan Yang ⋅ Xianwei Zhuang ⋅ Junyang Lin ⋅ Yixuan Yuan ⋅ Shuai Bai
Image Generation, Editing & Diffusion ExHall # 224
WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing Poster Session 4
Hui Zhang ⋅ Juntao Liu ⋅ Zongkai Liu ⋅ liqiang niu ⋅ Fandong Meng ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Image Generation, Editing & Diffusion ExHall # 225
CGCE: Classifier-Guided Concept Erasure in Generative Models Poster Session 4
Viet Nguyen ⋅ Vishal Patel
Image Generation, Editing & Diffusion ExHall # 226
Accelerated Likelihood Maximization for Diffusion-based Versatile Content Generation Poster Session 4
Hyunsoo Lee ⋅ Inwoo Hwang ⋅ Young Min Kim
Image Generation, Editing & Diffusion ExHall # 227
Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment Poster Session 4
Qifei Jia ⋅ Xintong Yao ⋅ Minghao Li ⋅ Yajie Chai ⋅ Qiming Lu ⋅ Baoyue Shen ⋅ Yasen Zhang ⋅ Runyu Shi ⋅ Ying Huang ⋅ Yue Zhang
Image Generation, Editing & Diffusion ExHall # 228
FDM-MFVT: Few-step Sampling Diffusion Model for Mask-Free Virtual Try-On Poster Session 4
Jiaxin Liu ⋅ XIAOYE LIANG ⋅ Lai Jiang ⋅ Jun Liu ⋅ Mai Xu
Image Generation, Editing & Diffusion ExHall # 229
DC-Gen: Post-Training Diffusion Acceleration with Deeply Compressed Latent Space Poster Session 4
Wenkun He ⋅ Yuchao Gu ⋅ Junyu Chen ⋅ Junyi Wu ⋅ Wenhang Ge ⋅ Dongyun Zou ⋅ Yujun Lin ⋅ Zhekai Zhang ⋅ Haocheng Xi ⋅ Muyang Li ⋅ Ligeng Zhu ⋅ Jincheng YU ⋅ Junsong Chen ⋅ Enze Xie ⋅ Song Han ⋅ Han Cai
Image Generation, Editing & Diffusion ExHall # 230
Illuminating Unified Multimodal Model for Free-form Interleaved Text-Image Generation Poster Session 4
Chonghuinan Wang ⋅ Zhikai Chen ⋅ Chunwei Wang ⋅ Yecong Wan ⋅ Junwei Yang ⋅ Zhixin Wang ⋅ Wei Zhang ⋅ Jiaqi Xu ⋅ Renjing Pei ⋅ Xiaohe Wu ⋅ FAN LI ⋅ Wangmeng Zuo
Image Generation, Editing & Diffusion ExHall # 231
Reinforcing Video Reasoning with Focused Thinking Poster Session 4
Jisheng Dang ⋅ Jingze Wu ⋅ Teng Wang ⋅ Xuanhui Lin ⋅ Nannan Zhu ⋅ Hongbo Chen ⋅ WEISHI ZHENG ⋅ Meng Wang ⋅ Tat-Seng Chua
Image Generation, Editing & Diffusion ExHall # 234
Obliviate: Erasing Concepts from Autoregressive Image Generation Models Poster Session 4
Hossein Shakibania ⋅ Jonas Henry Grebe ⋅ Tobias Braun ⋅ Ege Aktemur ⋅ Saleh Aslani ⋅ Mehmet Yiğit ⋅ Marcus Rohrbach
Image Generation, Editing & Diffusion ExHall # 235
Not All Prediction Targets Keep Training-Free Diffusion Guidance on the Manifold Poster Session 4
Yunsung Lee ⋅ Hyeongmin Lee
Image Generation, Editing & Diffusion ExHall # 236
Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning Poster Session 4
Lei Zhang ⋅ Junjiao Tian ⋅ Zhipeng Fan ⋅ Kunpeng Li ⋅ Jialiang Wang ⋅ Weifeng Chen ⋅ Markos Georgopoulos ⋅ Felix Juefei-Xu ⋅ Julian McAuley ⋅ Manling Li ⋅ Zecheng He
Image Generation, Editing & Diffusion ExHall # 237
LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation Poster Session 4
Zeyu Wang ⋅ Zilong Chen ⋅ Chenhui Gou ⋅ Feng Li ⋅ Chaorui Deng ⋅ Deyao Zhu ⋅ Kunchang Li ⋅ Weihao Yu ⋅ Haoqin Tu ⋅ Haoqi Fan ⋅ Cihang Xie
Image Generation, Editing & Diffusion ExHall # 238
OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models Poster Session 4
Huanlin Gao ⋅ Fang Zhao ⋅ Qiang Hui ⋅ Fuyuan Shi ⋅ Shaoan Zhao ⋅ Yantao Li ⋅ Chao Tan ⋅ Ting Lu ⋅ Yuren You ⋅ Kai Wang ⋅ Shiguo Lian
Image Generation, Editing & Diffusion ExHall # 239
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models Poster Session 4
Minghao Fu ⋅ Guo-Hua Wang ⋅ Tianyu Cui ⋅ Qing-Guo Chen ⋅ Zhao Xu ⋅ Weihua Luo ⋅ Kaifu Zhang
Image Generation, Editing & Diffusion ExHall # 240
UniReflect: Self-Reflection Tuning for Unified Multimodal Understanding and Generation Poster Session 4
Cong Wei ⋅ Zepeng Huang ⋅ Haoxian Tan ⋅ liang shuang ⋅ Lishuai Gao ⋅ Pengfei Yan ⋅ Xiaoming Wei
Image Generation, Editing & Diffusion ExHall # 241
PhyEditBench: A Real-World Multi-Stage Benchmark for Physics-Aware Image Editing Poster Session 4
Shengbin Guo ⋅ Shaokang He ⋅ Chaoyue Meng ⋅ Shengpeng Xiao ⋅ Xunzhi Xiang ⋅ Shaofeng Zhang ⋅ Qi Fan
Image Generation, Editing & Diffusion ExHall # 242
MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer Poster Session 4
Ziyi Wang ⋅ Siming Zheng ⋅ yang yang ⋅ Shusong Xu ⋅ Hao Zhang ⋅ Bo Li ⋅ Changqing Zou ⋅ Peng-Tao Jiang
Image Generation, Editing & Diffusion ExHall # 243
Wavelet-Guided Semantic Signal Compensation for Inversion-Free Image Editing Poster Session 4
Anqi Tang ⋅ Wenhao Sun ⋅ Zhaoqiang Liu
Image Generation, Editing & Diffusion ExHall # 244
Rethinking Reward Signals in Video GRPO: When Scores Become Targets Poster Session 4
Rui Li ⋅ Yuanzhi Liang ⋅ Ziqi Ni ⋅ Haibin Huang ⋅ Chi Zhang ⋅ Xuelong Li
Image Generation, Editing & Diffusion ExHall # 245
Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off Poster Session 4
Fulvio Sanguigni ⋅ Davide Lobba ⋅ Bin Ren ⋅ Marcella Cornia ⋅ Nicu Sebe ⋅ Rita Cucchiara
Image Generation, Editing & Diffusion ExHall # 246
Correlation-Weighted Multi-Reward Optimization for Compositional Generation Poster Session 4
Jungmyung Wi ⋅ Hyunsoo Kim ⋅ Donghyun Kim
Image Generation, Editing & Diffusion ExHall # 247
Rethinking Robust Adversarial Concept Erasure in Diffusion Models Poster Session 4
Qinghong Yin ⋅ Yu Tian ⋅ Heming Yang ⋅ Xiang Chen ⋅ Xianlin Zhang ⋅ Yue Ming ⋅ Xueming Li ⋅ Yue Zhang
Image Generation, Editing & Diffusion ExHall # 248
On-Policy Diffusion Reinforcement Learning Meets Off-Policy Quality Anchoring Poster Session 4
Zunxu Liu ⋅ Zhaofan Qiu ⋅ Yazhen Xie ⋅ Yingwei Pan ⋅ Ting Yao ⋅ Tao Mei
Image Generation, Editing & Diffusion ExHall # 249
StereoEdit: A Diffusion-Based Framework for Stereo-Consistent Image Editing Poster Session 4
Baolin Liu ⋅ Zongyuan Yang ⋅ Yingde Song ⋅ yongping xiong
Image Generation, Editing & Diffusion ExHall # 250
Unlocking Complex Image Editing via Natively Interleaved Visual Textual CoT with Deep Confidence Reasoning Poster Session 4
Zhentao Zou ⋅ Zhengrong Yue ⋅ Kunpeng Du ⋅ Binglei Bao ⋅ Hanting Li ⋅ Haizhen Xie ⋅ Guozheng Xu ⋅ Yue Zhou ⋅ jie hu ⋅ Xue Jiang ⋅ Xinghao Chen
Image Generation, Editing & Diffusion ExHall # 251
OSVE: One Step Video Editing with One Step Diffusion Models Poster Session 4
Habin Lim ⋅ Gyeong-Moon Park
Image Generation, Editing & Diffusion ExHall # 252
Benchmarking MLLMs on Mistake Recognition and Explanation in Single-Step Components of Cooking Poster Session 4
Shun Takashige ⋅ Atsushi Hashimoto ⋅ Shin’ichi Satoh
Image Generation, Editing & Diffusion ExHall # 253
DisRM: Reward Modeling as Discriminative Prediction Poster Session 4
Runtao Liu ⋅ Jiahao Zhan ⋅ Yuxuan GUO ⋅ Yingqing He ⋅ Chen Wei ⋅ Alan Yuille ⋅ Qifeng Chen
Image Generation, Editing & Diffusion ExHall # 254
InstaEdit: Instant Image Editing via Optimized Noise Prediction Poster Session 4
Ning Ma ⋅ Yangrui Shao
Image Generation, Editing & Diffusion ExHall # 255
TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers Poster Session 4
Binglei Li ⋅ Mengping Yang ⋅ Zhiyu Tan ⋅ Junping Zhang ⋅ Hao Li
Image Generation, Editing & Diffusion ExHall # 256
Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging Poster Session 4
Zhilin Liu ⋅ Ye Huang ⋅ TingXie TingXie ⋅ Ruizhi Zhang ⋅ Wen Li ⋅ Lixin Duan
Image Generation, Editing & Diffusion ExHall # 257
PhysEdit: Physically Consistent Image Editing via Causal Enforcement Poster Session 4
Siqi Wan ⋅ Jingwen Chen ⋅ Yehao Li ⋅ Yingwei Pan ⋅ Ting Yao ⋅ Tao Mei
Image Generation, Editing & Diffusion ExHall # 258
MVI2V: Human Centric Image to Video Generation with Multiview Consistent Appearance Poster Session 4
Pengfei Liu ⋅ Mingyi Xu ⋅ Wentao Jiang ⋅ Tiezheng Ge ⋅ Ming Zeng
Image Generation, Editing & Diffusion ExHall # 259
GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing Poster Session 4
Zifeng Zhu ⋅ Jiaming Han ⋅ Jiaxiang Zhao ⋅ Minnan Luo ⋅ Xiangyu Yue
Image Generation, Editing & Diffusion ExHall # 260
Zero-Shot Image Personalization from Personas Poster Session 4
Harini S I ⋅ Somesh Singh ⋅ Yaman K Singla ⋅ David Doermann ⋅ Rajiv Shah
Image Generation, Editing & Diffusion ExHall # 261
Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models Poster Session 4
David McAllister ⋅ Miika Aittala ⋅ Tero Karras ⋅ Janne Hellsten ⋅ Angjoo Kanazawa ⋅ Timo Aila ⋅ Samuli Laine
Image Generation, Editing & Diffusion ExHall # 262
The Path to Reconciling Quality and Safety Alignment in Text-to-Image Generation Poster Session 4
Shouwei Ruan ⋅ Zhenyu Wu ⋅ Yao Huang ⋅ Ruochen Zhang ⋅ Yitong Sun ⋅ Caixin Kang ⋅ Shiji Zhao ⋅ Weijun Qin ⋅ Jingzhi Li ⋅ Xingxing Wei
Image Generation, Editing & Diffusion ExHall # 263
AVSR-Diff: Scale-Agnostic Diffusion Priors for Temporally Consistent Arbitrary-Scale Video Super-Resolution Poster Session 4
Geunhyuk Youk ⋅ Jeonghyeok Do ⋅ Dayeon Kim ⋅ Jihyong Oh ⋅ Munchurl Kim
Image Generation, Editing & Diffusion ExHall # 264
Optimization-Guided Diffusion for Interactive Scene Generation Poster Session 4
Shihao Li ⋅ Naisheng Ye ⋅ Tianyu Li ⋅ Kashyap Chitta ⋅ Tuo An ⋅ Peng Su ⋅ Boyang Wang ⋅ Haiou Liu ⋅ Chen Lv ⋅ Hongyang Li
Image Generation, Editing & Diffusion ExHall # 265
OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal Poster Session 4
Qinming Zhou ⋅ Chenxi Sun ⋅ Deyang Kong ⋅ Junhao He ⋅ Xiangheng Tang ⋅ Peike Yu ⋅ Haotian Wu ⋅ Leilei Cao ⋅ Linfeng Zhang
Image Generation, Editing & Diffusion ExHall # 266
h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform Poster Session 4
ZeHui Guo ⋅ Zhen Wang ⋅ Junwei Shu ⋅ Changbo Wang ⋅ Long Chen ⋅ Yang Li
Image Generation, Editing & Diffusion ExHall # 267
Reference-Free Quality Assessment for Virtual Try-On via Human Feedback Poster Session 4
Yuki Hirakawa ⋅ Takashi Wada ⋅ Ryotaro Shimizu ⋅ Takuya Furusawa ⋅ Yuki Saito ⋅ Ryosuke Araki ⋅ Tianwei Chen ⋅ Fan Mo ⋅ Yoshimitsu Aoki
Image Generation, Editing & Diffusion ExHall # 268
CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning Poster Session 4
Dongxia Wu ⋅ Shiye Su ⋅ Yuhui Zhang ⋅ Elaine Sui ⋅ Emma Lundberg ⋅ Emily Fox ⋅ Serena Yeung-Levy
Image Generation, Editing & Diffusion ExHall # 269
NearID: Identity Representation Learning via Near-identity Distractors Poster Session 4
Aleksandar Cvejic ⋅ Rameen Abdal ⋅ Abdelrahman Eldesokey ⋅ Bernard Ghanem ⋅ Peter Wonka
Image Generation, Editing & Diffusion ExHall # 270
SCALE: Semantic-Calibrated Guidance Enhancement for Prompt-Faithful Diffusion Poster Session 4
Tianhang Lu ⋅ Sudong Cai ⋅ Bingzhi Chen ⋅ Shao-Dong Shen ⋅ Chunting Liu ⋅ Longguang Wang ⋅ Bing Wang
Image Generation, Editing & Diffusion ExHall # 271
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs Poster Session 4
Vishal Narnaware ⋅ Animesh Gupta ⋅ Kevin Zhai ⋅ Zhenyi Wang ⋅ Shah Mubarak
Image Generation, Editing & Diffusion ExHall # 272
Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment Poster Session 4
Soyoun Won ⋅ Aryan Yazdan Parast ⋅ Basim Azam ⋅ Jean Honorio ⋅ NAVEED AKHTAR
Image Generation, Editing & Diffusion ExHall # 273
Push–Pull Attentional Anchoring for Diffusion Concept Erasure Poster Session 4
Nattanat Chatthee ⋅ Tagon Sompong ⋅ Ekapol Chuangsuwanich ⋅ Supasorn Suwajanakorn
Image Generation, Editing & Diffusion ExHall # 274
V-HOLD: Stabilizing Flow Trajectories to Rethink the Edit–Preservation Trade-off Poster Session 4
Gahyeon Kim ⋅ Dong-oh Kang
Image Generation, Editing & Diffusion ExHall # 275
Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs Poster Session 4
Efthymios Tsaprazlis ⋅ Tiantian Feng ⋅ Anil Ramakrishna ⋅ Sai Karimireddy ⋅ Rahul Gupta ⋅ Shrikanth Narayanan
Image Generation, Editing & Diffusion ExHall # 276
CHARTSTYLE-100K: A Large-Scale Dataset for Structured Visualization Style Transfer Poster Session 4
Yuwei Yang ⋅ Tianchi Xie ⋅ Jinhong Ni ⋅ Yukai Guo ⋅ Jing Zhang ⋅ Liang Zheng ⋅ Yalong Bai ⋅ YUHUI YUAN
Image Generation, Editing & Diffusion ExHall # 277
Consistent Feature Transport for Image Relighting Poster Session 4
Bohan Zhang ⋅ huanweiliang huanweiliang ⋅ Yuhan He ⋅ Hongteng Xu ⋅ Xiaochao Qu ⋅ Luoqi Liu ⋅ Dixin Luo ⋅ Ting Liu
Image Generation, Editing & Diffusion ExHall # 278
SPQR: A Multi-Dimensional Benchmark for Safety Alignment under Benign Model Adaptation Poster Session 4
Mohammed Talha Alam ⋅ Nada Saadi ⋅ Fahad Shamshad ⋅ Nils Lukas ⋅ Karthik Nandakumar ⋅ Fakhri Karray ⋅ Samuele Poppi
Image Generation, Editing & Diffusion ExHall # 279
SparkVSR: Interactive Video Super-Resolution via Sparse Keyframe Propagation Poster Session 4
Jiongze Yu ⋅ Xiangbo Gao ⋅ Pooja Verlani ⋅ Akshay Gadde ⋅ Yilin Wang ⋅ Balu Adsumilli ⋅ Zhengzhong Tu
Image Generation, Editing & Diffusion ExHall # 280
Improved Immiscible Diffusion: Accelerating Diffusion Training by Reducing Miscibility Poster Session 4
Yiheng Li ⋅ Feng Liang ⋅ Dan Kondratyuk ⋅ Masayoshi TOMIZUKA ⋅ Kurt Keutzer ⋅ Chenfeng Xu
Image Generation, Editing & Diffusion ExHall # 281
UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception Poster Session 4
Qin Guo ⋅ Hao Luo ⋅ Dongxu Yue ⋅ Weixuan Jin ⋅ Xiao Fu ⋅ Fan Wang ⋅ Dan Xu
Image Generation, Editing & Diffusion ExHall # 282
Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation Poster Session 4
Shihao Zhang ⋅ Yunzhi Li ⋅ Yuguang Yan ⋅ Junzhe Zhang ⋅ WEI ZHAO ⋅ Bohan Wang ⋅ Hanwang Zhang
Image Generation, Editing & Diffusion ExHall # 283
Multi-History-Step SDE Inversion for Image Editing with Superior Regional Awareness Poster Session 4
Haiyan Wei ⋅ Yunlong Wang ⋅ Huaibo Huang ⋅ Zhenan Sun ⋅ Kunbo Zhang
Image Generation, Editing & Diffusion ExHall # 284
H-Adapter: Pose-Robust Hairstyle Transfer via Attention-Derived, Source-Aligned Hair Masks Poster Session 4
Seulgi Jeong ⋅ Yunseong Cho ⋅ Sanghun Park
Image Generation, Editing & Diffusion ExHall # 285
Self-Improving Diffusion Classifiers with Minority Preference Optimization Poster Session 4
Hyunsoo Kim ⋅ Jungmyung Wi ⋅ Soobin Um ⋅ Donghyun Kim ⋅ Suhyun Kim
Image Generation, Editing & Diffusion ExHall # 286
MirrorPPR: Exemplar-Based Portrait Photo Retouching Poster Session 4
Zhihong Liu ⋅ Zheng Li ⋅ Jiachun Jin ⋅ Siqi Kou ⋅ Yitao Jian ⋅ Fengpei Yu ⋅ Zhijie Deng
Image Generation, Editing & Diffusion ExHall # 287
When Rubrics Fail: Error Enumeration as Reward for Reference-Free RL Post-Training Poster Session 4
Wisdom Ikezogwo ⋅ Mehmet Saygin Seyfioglu ⋅ Ranjay Krishna ⋅ Karim Bouyarmane
Image Generation, Editing & Diffusion ExHall # 288
Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching Poster Session 4
Jiuzhou Lin ⋅ Fei Zuo ⋅ Huan Ouyang ⋅ Junlong Wu ⋅ Dewen Fan ⋅ Boheng Zhang ⋅ Huaiqing Wang ⋅ Jia Sun ⋅ Fan Yang ⋅ Houde Liu ⋅ Kehai Chen ⋅ Min Zhang ⋅ Tingting Gao ⋅ Han Li
Image Generation, Editing & Diffusion ExHall # 289
Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning Poster Session 4
Qihan Huang ⋅ Haofei Zhang ⋅ Rong Wei ⋅ Yi Wang ⋅ Rui Tang ⋅ Mingli Song ⋅ Jie Song
Image Generation, Editing & Diffusion ExHall # 290
EraseSAE: Surgical Concept Erasure in Text-to-Video Diffusion Models via Sparse Autoencoders Poster Session 4
Xinghao Wang ⋅ Dong Li ⋅ Wei Yu ⋅ Yingwei Pan ⋅ Tao Gong ⋅ Qi Chu ⋅ Nenghai Yu ⋅ Ting Yao
Image Generation, Editing & Diffusion ExHall # 291
SupGRPO: Enhancing GRPO with Matching-based Online SFT for Text Spotting Poster Session 4
Xudong Xie ⋅ Yuzhe Li ⋅ Jing Shi ⋅ Zhifei Zhang ⋅ Curtis Wigington ⋅ Zhaowen Wang
Image Generation, Editing & Diffusion ExHall # 292
i-Design: Step-by-Step Graphic Layout Design with Progressive Aesthetic Policy Optimization Poster Session 4
Sohan Patnaik ⋅ Rishabh Jain ⋅ Balaji Krishnamurthy ⋅ Mausoom Sarkar
Image Generation, Editing & Diffusion ExHall # 293
Continuous Speculative Decoding for Autoregressive Image Generation Poster Session 4
Zili Wang ⋅ Zheng Zhang ⋅ Kun Ding ⋅ Qi Yang ⋅ Fei Li ⋅ SHIMING XIANG
Image Generation, Editing & Diffusion ExHall # 296
SciIR: A Large-scale Training Dataset and Benchmark for Scientific Image Reasoning Generation Poster Session 4
Zhiyuan Ma ⋅ Zhengfeng Shi ⋅ Yuning An ⋅ Peize Li ⋅ Jiabao Wei ⋅ Ruijie Li ⋅ Junhao Xiao ⋅ Jianjun Li ⋅ Bowen Zhou
Image Generation, Editing & Diffusion ExHall # 297
DSH-Bench: A Difficulty- and Scenario-Aware Benchmark with Hierarchical Subject Taxonomy for Subject-Driven Text-to-Image Generation Poster Session 4
Zhenyu Hu ⋅ Qing Wang ⋅ Cao Te ⋅ Kuo Liao ⋅ Longfei Lu ⋅ Liqun Liu ⋅ Shuang Li ⋅ Hang Chen ⋅ Mengge Xue ⋅ Yuan Chen ⋅ Chao Deng ⋅ Peng Shu ⋅ Huan Yu ⋅ Jie Jiang
Image Generation, Editing & Diffusion ExHall # 298
Editing Everything Everywhere All at Once Poster Session 4
Fabio Quattrini ⋅ Carmine Zaccagnino ⋅ Enis Simsar ⋅ Marta Gazulla ⋅ Rita Cucchiara ⋅ Alessio Tonioni ⋅ Silvia Cascianelli
Image Generation, Editing & Diffusion ExHall # 299
Learning Consistency in Reward Modeling for Multi-Modal Reasoning Poster Session 4
Chen Li ⋅ Bolin Ni ⋅ Boxin Zhang ⋅ Ke Ye ⋅ Jinnian Zhang ⋅ Houwen Peng ⋅ Han Hu ⋅ Nanning Zheng
Image Generation, Editing & Diffusion ExHall # 300
OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation Poster Session 4
Yexin Liu ⋅ Manyuan Zhang ⋅ Yueze Wang ⋅ Hongyu Li ⋅ Dian Zheng ⋅ WEIMING ZHANG ⋅ Changsheng Lu ⋅ Harry Yang
Image Generation, Editing & Diffusion ExHall # 301
SR-Edit: Region-Aware Image Editing via Self-Refinement Poster Session 4
Andong Wang ⋅ Zehua Chen ⋅ Yuxuan Jiang ⋅ Jun Zhu
Image Generation, Editing & Diffusion ExHall # 302
Wan-R1: Verifiable-Reinforcement Learning for Generalizable Video Reasoning Poster Session 4
Ming Liu ⋅ Yunbei Zhang ⋅ Shilong Liu ⋅ Liwen Wang ⋅ Wensheng Zhang
Image Generation, Editing & Diffusion ExHall # 303
InstantRetouch: Personalized Image Retouching without Test-time Fine-tuning Poster Session 4
Temesgen Muruts Weldengus ⋅ Binnan Liu ⋅ Fei Kou ⋅ Youwei Lyu ⋅ Jinwei Chen ⋅ Changqing Zou ⋅ Qingnan Fan
Image Generation, Editing & Diffusion ExHall # 304
Semantically Aligned Gradient-Driven Context-Preserving Image Editing Poster Session 4
Chiranjeev Chiranjeev ⋅ Muskan Dosi ⋅ MAYANK VATSA ⋅ RICHA SINGH
Image Generation, Editing & Diffusion ExHall # 305
When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models Poster Session 4
Dasol Choi ⋅ Jihwan Lee ⋅ Minjae Lee ⋅ Minsuk Kahng
Image Generation, Editing & Diffusion ExHall # 306
FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing Poster Session 4
Fengjian Xue ⋅ Xuecheng Wu ⋅ Heli Sun ⋅ Yunyun Shi ⋅ Shi Chen ⋅ Liangyu Fu ⋅ Jinheng Xie ⋅ Dingkang Yang ⋅ Hao Wang ⋅ Junxiao Xue ⋅ Liang He
Image Generation, Editing & Diffusion ExHall # 307
Few-Shot Synthetic Image Attribution: Identifying Unseen Generators with Limited Samples Poster Session 4
Shiyu Wu ⋅ Shuyan Li ⋅ Jing Li ⋅ Jing Liu ⋅ Yequan Wang
Image Generation, Editing & Diffusion ExHall # 308
Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting Poster Session 4
zhen zou ⋅ Xiaoxiao Ma ⋅ Mingde Yao ⋅ Jie Huang ⋅ Linjiang Huang ⋅ Feng Zhao
Image Generation, Editing & Diffusion ExHall # 309
RCEdit-500K: Reference Completion for Image-Conditioned Image Editing Poster Session 4
Jingxu Zhang ⋅ Daneul Kim ⋅ Yueming Pan ⋅ DONG CHEN ⋅ Kai Qiu ⋅ Yang Liu ⋅ Yifan Yang ⋅ Qi Dai ⋅ Xiaoyan Sun ⋅ Chong Luo
Image Generation, Editing & Diffusion ExHall # 310
VLTR: Vision-Language Tool Reasoning for Instruction-Guided Image Editing Poster Session 4
Yike Wang ⋅ Yitao Yu ⋅ Shaohua Sun ⋅ Ping Luo
Image Generation, Editing & Diffusion ExHall # 311
To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion Poster Session 4
Shaswati Saha ⋅ Rajasekhar Anguluri ⋅ Manas Gaur
Image Generation, Editing & Diffusion ExHall # 312
The Map Is Not the Territory: Embedding-Coverage Blacklists for Safe Diffusion Steering Poster Session 4
Juyang Bai ⋅ Tong Zhou ⋅ Shaolei Ren ⋅ Xiaolin Xu
Image Generation, Editing & Diffusion ExHall # 313
FreqOrtho-SR: Frequency-Guided Orthogonal Expert Learning for Real-World Image Super-Resolution Poster Session 5
Minh Hoang ⋅ Dinh Tran ⋅ Quyen Nguyen Duc ⋅ Phuong Dam ⋅ Daeyoung Kim
Low-Level Vision, Restoration & Generative Priors ExHall # 93
FUMO: Prior-Modulated Diffusion for Single Image Reflection Removal Poster Session 5
Telang Xu ⋅ Chaoyang Zhang ⋅ Guangtao Zhai ⋅ Xiaohong Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 91
Rethinking Real-World MRI Denoising: Learning from Physical Noise Poster Session 5
Sebastian Rassmann ⋅ David Kügler ⋅ Sascha Brunheim ⋅ Philipp Ehses ⋅ Martin Reuter
Low-Level Vision, Restoration & Generative Priors ExHall # 90
AnyStyle: A Single LoRA is Sufficient for Image-Guided Style Transfer Poster Session 5
Yongwen Lai ⋅ Chaoqun Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 89
Jumping the Landing Phase: Noise Variance Matching Enables Accurate Few-Step Inversion Poster Session 5
Yang Luo ⋅ Zhineng Chen ⋅ Ya Gao ⋅ Xieping Gao ⋅ Yu-Gang Jiang
Low-Level Vision, Restoration & Generative Priors ExHall # 88
SAND: Stage-Aware Noise Decomposition for Training-Free Diffusion Guidance Poster Session 5
DaeHyun Kim ⋅ Hyo-Jun Lee ⋅ Hanul Kim ⋅ Yeong Jun Koh
Low-Level Vision, Restoration & Generative Priors ExHall # 87
Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers Poster Session 5
Anh Nguyen ⋅ Ngan Nguyen ⋅ Hong Duc Vu ⋅ Trung Dao ⋅ Viet Nguyen ⋅ Minh Quan Dao ⋅ Kien Nguyen ⋅ Tran Bao Chi Tran ⋅ Phong Nguyen ⋅ Khoi Nguyen ⋅ Cuong Pham ⋅ Dimitris N. Metaxas ⋅ Vishal Patel ⋅ Anh Tran
Low-Level Vision, Restoration & Generative Priors ExHall # 85
Hi-DiT: Hybrid Latent-Pixel Diffusion Transformer for Image Generation Poster Session 5
Yedong Shen ⋅ Yehao Li ⋅ Yingwei Pan ⋅ Yanyong Zhang ⋅ Ting Yao
Low-Level Vision, Restoration & Generative Priors ExHall # 84
G3AFT: Glance Guided Gradient Aligned Fine-Tuning for Visual Autoregressive Models Poster Session 5
Jiayi Zhang ⋅ Xiefan Guo ⋅ Xinzhu Ma ⋅ Di Huang
Low-Level Vision, Restoration & Generative Priors ExHall # 82
Representation Alignment for Just Image Transformers is not Easier than You Think Poster Session 5
Jaeyo Shin ⋅ Jiwook Kim ⋅ Hyunjung Shim
Low-Level Vision, Restoration & Generative Priors ExHall # 81
OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution Poster Session 5
Shijie Zhao ⋅ Xuanyu Zhang ⋅ Bin Chen ⋅ Weiqi Li ⋅ Qunliang Xing ⋅ Kexin Zhang ⋅ Yan Wang ⋅ Junlin Li ⋅ Li Zhang ⋅ Jian Zhang ⋅ Tianfan Xue
Low-Level Vision, Restoration & Generative Priors ExHall # 80
GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models Poster Session 5
Bozhou Li ⋅ Sihan Yang ⋅ Yushuo Guan ⋅ Ruichuan An ⋅ Xinlong Chen ⋅ Yang Shi ⋅ Pengfei Wan ⋅ Wentao Zhang ⋅ Yuanxing Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 79
AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation Poster Session 5
Eric Ji ⋅ Qiran Hu ⋅ Wufei Ma ⋅ Sarthak Jain ⋅ Yingying Li ⋅ Minh Do ⋅ Yaoyao Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 109
One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies Poster Session 5
Shaolong Li ⋅ Lichao Sun ⋅ Yongchao Chen
Low-Level Vision, Restoration & Generative Priors ExHall # 159
DAPS++: Rethinking Diffusion Inverse Problems with Decoupled Posterior Annealing Poster Session 5
Hao Chen ⋅ Renzheng Zhang ⋅ Scott Howard
Low-Level Vision, Restoration & Generative Priors ExHall # 158
Accelerating Diffusion Transformers with Gaussian Process Rectified Feature Cache Poster Session 5
Zhirong Shen ⋅ Rui Huang ⋅ Chang Zou ⋅ Shikang Zheng ⋅ Jiacheng Liu ⋅ Peiliang Cai ⋅ zhengyi shi ⋅ Yaosong Du ⋅ Liang Feng ⋅ Xiaobing Tu ⋅ Jinkui Ren ⋅ Xiantao Zhang ⋅ Linfeng Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 157
Steering Diffusion Models via Class-Contrastive Influence for Few-Shot Classification Poster Session 5
Jeeyung Kim ⋅ Erfan Esmaeili ⋅ Qiang Qiu
Low-Level Vision, Restoration & Generative Priors ExHall # 156
Generative Manifold Distillation: Aligning Restoration Trajectories with the Natural Image Prior Poster Session 5
Yuyang Hu ⋅ Mojtaba Sahraee-Ardakan ⋅ Kangfu Mei ⋅ Arpit Bansal ⋅ Chenyang Qi ⋅ Peyman Milanfar ⋅ Mauricio Delbracio
Low-Level Vision, Restoration & Generative Priors ExHall # 160
Learning to Balance: Decoupled Siamese Diffusion Transformer for Reference-Based Remote Sensing Image Super-Resolution Poster Session 5
Bin Luo ⋅ Runmin Dong ⋅ Zhaoyang Luo ⋅ Jinxiao Zhang ⋅ Jiyao Zhao ⋅ Fan Wei ⋅ Haohuan Fu
Low-Level Vision, Restoration & Generative Priors ExHall # 155
LUA: Latent Upscaling Adapter for Diffusion-Based Image Synthesis Poster Session 5
Aleksandr Razin ⋅ Kazantsev Danil ⋅ Ilya Makarov
Low-Level Vision, Restoration & Generative Priors ExHall # 154
DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models Poster Session 5
Chunnan Shang ⋅ Zhizhong Wang ⋅ Xin Zhang ⋅ Hongwei Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 153
FMS2: Unified Flow Matching for Segmentation and Synthesis of Thin Structures Poster Session 5
Babak Asadi ⋅ Peiyang Wu ⋅ Mani Golparvar-Fard ⋅ Viraj Jayminkumar Shah ⋅ Ramez Hajj
Low-Level Vision, Restoration & Generative Priors ExHall # 152
Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis Poster Session 5
HAKSU LIM ⋅ Myeongjin Lee ⋅ Wonjoon Chang ⋅ Jaesik Choi
Low-Level Vision, Restoration & Generative Priors ExHall # 151
TanGO: Training-Free 3D Editing via Tangent-Space Guidance and Optimization Poster Session 5
Siwoo Lim ⋅ Sunjae Yoon ⋅ Gwanhyeong Koo ⋅ Hyeonseo Yun ⋅ Chang Yoo
Low-Level Vision, Restoration & Generative Priors ExHall # 150
Early Estimation of Language to Latent Alignment in Diffusion Models Poster Session 5
VASCO RAMOS ⋅ Regev Cohen ⋅ Idan Szpektor ⋅ Joao Magalhaes
Low-Level Vision, Restoration & Generative Priors ExHall # 149
ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images Poster Session 5
Yunfeng Wu ⋅ Hongying Cheng ⋅ Zihao He ⋅ Songhua Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 27
ReAL: Reference-to-Image (R2I) Aware Latent Diffusion for Image Super-Resolution Poster Session 5
Byeonghun Lee ⋅ Hyunmin Cho ⋅ Sunghoon Im ⋅ Kyong Hwan Jin
Low-Level Vision, Restoration & Generative Priors ExHall # 100
WaterGen: Decoupling Scene and Medium in Underwater Image Generation Poster Session 5
Jiayi Wu ⋅ Tianfu Wang ⋅ Tianyi Xiong ⋅ Dehao Yuan ⋅ Xiaomin Lin ⋅ Md Jahidul Islam ⋅ Cornelia Fermuller ⋅ Christopher Metzler ⋅ Yiannis Aloimonos
Low-Level Vision, Restoration & Generative Priors ExHall # 99
Continuous Adversarial Flow Models Poster Session 5
Shanchuan Lin ⋅ Ceyuan Yang ⋅ Zhijie Lin ⋅ Hao Chen ⋅ Haoqi Fan
Low-Level Vision, Restoration & Generative Priors ExHall # 98
Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models Poster Session 5
Niklas Schweiger ⋅ Karnik Ram ⋅ Daniel Cremers
Low-Level Vision, Restoration & Generative Priors ExHall # 97
Introspective Attention Modulation for Safe Text-to-Image Generation Poster Session 5
Basim Azam ⋅ Hossein Rahmani ⋅ NAVEED AKHTAR
Low-Level Vision, Restoration & Generative Priors ExHall # 96
Linear Fusion MultiDiffusion for Fast Training-Free Spherical Panorama Generation Poster Session 5
Akio Hayakawa ⋅ Yusuke Mukuta ⋅ Tatsuya Harada
Low-Level Vision, Restoration & Generative Priors ExHall # 95
Diffusion Image Generation with Explicitly Modeling of Data Manifold Geometry Poster Session 5
Duoduo Xue ⋅ Zhiyu Zhu ⋅ Junhui Hou
Low-Level Vision, Restoration & Generative Priors ExHall # 94
MaterialFlow: Attribute-Disentangled Material Transfer via Trajectory-Aware Velocity Modulation Poster Session 5
Sung-Lin Tsai ⋅ Bo-Kai Ruan ⋅ Yu-Hsuan Chen ⋅ Wen-Huang Cheng ⋅ Hong-Han Shuai
Low-Level Vision, Restoration & Generative Priors ExHall # 92
DiTailed: Ensuring Visual Object Consistency in Text-Image-to-Image Flow Matching Models Poster Session 5
Francesco Taioli ⋅ Daniel Coelho ⋅ Iaroslav Melekhov ⋅ Roberto Alcover-Couso ⋅ Jose Saiz ⋅ Virginia Arguedas ⋅ Artur Bekasov
Low-Level Vision, Restoration & Generative Priors ExHall # 23
MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation Poster Session 5
Zhiyuan Xia ⋅ Haojie Li ⋅ Jingyu Lin ⋅ Yiguo Qiao ⋅ Cunjian Chen
Low-Level Vision, Restoration & Generative Priors ExHall # 86
Beyond Linear Shortcuts: Rectifying Diffusion Preference Optimization with Intrinsic Generative Geometry Poster Session 5
Pin Wang ⋅ Huaibo Huang ⋅ Jiayang Sun ⋅ Hongbo Wang ⋅ Wentao Jiang ⋅ Tiezheng Ge ⋅ Jie Cao ⋅ Ran He
Low-Level Vision, Restoration & Generative Priors ExHall # 106
Tuning Real-World Image Restoration at Inference: A Test-Time Scaling Paradigm for Flow Matching Models Poster Session 5
Purui Bai ⋅ Junxian Duan ⋅ Pin Wang ⋅ Jinhua Hao ⋅ Ming Sun ⋅ Chao Zhou ⋅ Huaibo Huang
Low-Level Vision, Restoration & Generative Priors ExHall # 134
UniCSG: Unified High-Fidelity content-constrained style-driven generation via Staged Semantic and Frequency Disentanglement Poster Session 5
Jingwei Yang ⋅ Ruoxi Wu ⋅ Wei Shen ⋅ Meng Li ⋅ Yulong Liu ⋅ Huimin She ⋅ Lunxi Yuan
Low-Level Vision, Restoration & Generative Priors ExHall # 83
CMDer: Controllable Mode Decomposition-Based Single Motion Synthesis with Diffusion Poster Session 5
Junliang Chen ⋅ Sihang Chen ⋅ Xiaojuan Gu ⋅ Yoonsang Lee ⋅ Kevin Romond ⋅ Fang-Lue Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 65
Don’t Settle at the Mode! Mitigating Diversity Collapse in Pretrained Flow Models via Feature Self-Guidance Poster Session 5
Pradhaan S Bhat ⋅ Rishubh Parihar ⋅ Abhijnya Bhat ⋅ Venkatesh Babu Radhakrishnan
Low-Level Vision, Restoration & Generative Priors ExHall # 1
Diffusion-based dual-view reflection removal Poster Session 5
Tianyi Xu ⋅ Zifeng Wang ⋅ Boyang Lyu ⋅ Shuchen Weng ⋅ Boxin Shi
Low-Level Vision, Restoration & Generative Priors ExHall # 2
ParaFlow: Parallel Sampling for Flow Matching Models Poster Session 5
Jianrong Lu ⋅ Bangwei Li ⋅ Haomin Zhang ⋅ Zhuoya Gu ⋅ Yongqing Lu ⋅ Jianhai Chen ⋅ Qinming He
Low-Level Vision, Restoration & Generative Priors ExHall # 3
Direct Autoregressive Diffusion Distillation via Error-aware Causal Pretraining Poster Session 5
Jiaxing Li ⋅ Kaichen Huang ⋅ Baixin Xu ⋅ Zexiang Liu ⋅ Xianglong He ⋅ Zile Wang ⋅ Junyao Gao ⋅ Yang Liu ⋅ Ying He ⋅ Bo An ⋅ Yangguang Li
Low-Level Vision, Restoration & Generative Priors ExHall # 4
Training-Free Refinement of Flow Matching with Divergence-based Sampling Poster Session 5
Yeonwoo Cha ⋅ Jaehoon Yoo ⋅ Semin Kim ⋅ Yunseo Park ⋅ Jinhyeon Kwon ⋅ Seunghoon Hong
Low-Level Vision, Restoration & Generative Priors ExHall # 5
LACON: Training Text-to-Image Model from Uncurated Data Poster Session 5
Zhiyang Liang ⋅ Ziyu Wan ⋅ Hongyu Liu ⋅ DONG CHEN ⋅ Qiu Shen ⋅ Hao Zhu ⋅ Dongdong Chen
Low-Level Vision, Restoration & Generative Priors ExHall # 6
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation Poster Session 5
Jiawei Mao ⋅ Yuhan Wang ⋅ Lifeng Chen ⋅ Can Zhao ⋅ Yucheng Tang ⋅ Dong Yang ⋅ Liangqiong Qu ⋅ Daguang Xu ⋅ Yuyin Zhou
Low-Level Vision, Restoration & Generative Priors ExHall # 7
Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation Poster Session 5
Xing Xie ⋅ Jiawei Liu ⋅ Shijun Zhou ⋅ Huijie Fan ⋅ Zhi Han ⋅ Yandong Tang ⋅ Liangqiong Qu
Low-Level Vision, Restoration & Generative Priors ExHall # 8
RawGen: Learning Camera Raw Image Generation Poster Session 5
Dongyoung Kim ⋅ Junyong Lee ⋅ Abhijith Punnappurath ⋅ Mahmoud Afifi ⋅ Sangmin Han ⋅ Alex Levinshtein ⋅ Michael S Brown
Low-Level Vision, Restoration & Generative Priors ExHall # 9
Self-transcendence: Is External Feature Guidance Indispensable for Accelerating Diffusion Transformer Training? Poster Session 5
Lingchen Sun ⋅ Rongyuan Wu ⋅ zhengqiang ZHANG ⋅ Ruibin LI ⋅ Yujing Sun ⋅ Shuaizheng LIU ⋅ Yabin Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 10
AViTS:Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation Poster Session 5
Haoran Qin ⋅ zhengan yan ⋅ Shikang Zheng ⋅ Xiaobing Tu ⋅ Jiacheng Liu ⋅ Yuqi Lin ⋅ Chang Zou ⋅ Jinshan Liu ⋅ Peiliang Cai ⋅ Xiantao Zhang ⋅ Jinkui Ren ⋅ Linfeng Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 11
Expert Weaving: Marrying Masked AutoRegressive and Diffusion Models for Unified Image Restoration Poster Session 5
Xin Lu ⋅ Jie Huang ⋅ Jie Xiao ⋅ Dong Li ⋅ Xueyang Fu
Low-Level Vision, Restoration & Generative Priors ExHall # 12
Source-Agnostic Image Translation Based on Latent Aware Adaptive Masking Poster Session 5
Tomislav Dobrički ⋅ Byung-Woo Hong
Low-Level Vision, Restoration & Generative Priors ExHall # 13
SSBP: Stage-Specialized Block Pruning for Video Diffusion Models Poster Session 5
Mengmeng Ge ⋅ Takashi Isobe ⋅ Dong Zhou ⋅ Dong Li ⋅ Emad Barsoum
Low-Level Vision, Restoration & Generative Priors ExHall # 14
ProSR: Semantic-Prototype-Guided Discrete Modeling for Physically Consistent SAR Super-Resolution Poster Session 5
Byoungwoo Kim ⋅ Munchurl Kim
Low-Level Vision, Restoration & Generative Priors ExHall # 15
V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising Poster Session 5
Han Lin ⋅ Xichen Pan ⋅ Zun Wang ⋅ Yue Zhang ⋅ Chu Wang ⋅ Jaemin Cho ⋅ Mohit Bansal
Low-Level Vision, Restoration & Generative Priors ExHall # 16
Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention Poster Session 5
Bingde Liu ⋅ Wu Ran ⋅ Jinglei Zhang ⋅ Huanhuan Yuan ⋅ Chao Ma
Low-Level Vision, Restoration & Generative Priors ExHall # 17
Prompt2Effect: Training-Free LoRA Synthesis for Controllable Video Effects Poster Session 5
Xiaomeng Yang ⋅ Yanyu Li ⋅ Gordon Qian ⋅ Ivan Skorokhodov ⋅ Viacheslav Ivanov ⋅ Avalon Vinella ⋅ Xuan Zhang ⋅ Yanzhi Wang ⋅ Sergey Tulyakov ⋅ Anil Kag
Low-Level Vision, Restoration & Generative Priors ExHall # 18
Allo{SR}2: Rectifying One-Step Super-Resolution to Stay Real via Allomorphic Generative Flows Poster Session 5
Zihan Wang ⋅ XUDONG HUANG ⋅ Junbo Qiao ⋅ WEI LI ⋅ jie hu ⋅ Xinghao Chen ⋅ Shaohui Lin
Low-Level Vision, Restoration & Generative Priors ExHall # 19
NaP-Control: Navigating Diffusion Prior for Versatile and Fast Character Control Poster Session 5
Chia-Wen Chen ⋅ Yan Wu ⋅ Korrawe Karunratanakul ⋅ Siyu Tang
Low-Level Vision, Restoration & Generative Priors ExHall # 20
UltraGen: Efficient Ultra-High-Resolution Image Generation with Hierarchical Local Attention Poster Session 5
Yuyao Zhang ⋅ Yu-Wing Tai
Low-Level Vision, Restoration & Generative Priors ExHall # 21
Inference-Time Scaling of Diffusion Models via Progressive Pruning Search Poster Session 5
Rogério Guimarães ⋅ Pietro Perona
Low-Level Vision, Restoration & Generative Priors ExHall # 22
Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers Poster Session 5
Jaeah Lee ⋅ Hyunjin Kim ⋅ Jaewoong Cho ⋅ Gihyun Kwon
Low-Level Vision, Restoration & Generative Priors ExHall # 24
SK-Adapter: Skeleton-Based Structural Control for Native 3D Generation Poster Session 5
Anbang Wang ⋅ AO Yuzhuo ⋅ Elliott (Shangzhe) Wu ⋅ Chi-Keung Tang
Low-Level Vision, Restoration & Generative Priors ExHall # 25
ARVAR: Accelerating Visual Autoregressive Model via Attention Retrospect Poster Session 5
Jiedong Zhuang ⋅ Lu Lu ⋅ Ming Dai ⋅ Jian Chen ⋅ Qiang Liu ⋅ Haoji Hu
Low-Level Vision, Restoration & Generative Priors ExHall # 26
LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion Poster Session 5
Zengqun Zhao ⋅ Ziquan Liu ⋅ Yu Cao ⋅ Shaogang Gong ⋅ Zhensong Zhang ⋅ Song Jifei ⋅ Jiankang Deng ⋅ ioannis Patras
Low-Level Vision, Restoration & Generative Priors ExHall # 28
Generative Refinement Network for Visual Synthesis Poster Session 5
Jian Han ⋅ Jinlai Liu ⋅ Jiahuan Wang ⋅ BINGYUE PENG ⋅ Zehuan Yuan
Low-Level Vision, Restoration & Generative Priors ExHall # 29
When Distillation Breaks Motion Control: Restoring Generative Trajectories for Fast Video Generators Poster Session 5
Jintao Rong ⋅ Xin Xie ⋅ Xinyi Yu ⋅ Linlin Ou ⋅ Xinyu Zhang ⋅ Chunhua Shen ⋅ Dong Gong
Low-Level Vision, Restoration & Generative Priors ExHall # 30
HNDiff: Haze-Noise Diffusion for Image Dehazing Poster Session 5
Jin-Ting He ⋅ Fu-Jen Tsai ⋅ Yan-Tsung Peng ⋅ Min-Hung Chen ⋅ Chia-Wen Lin ⋅ Yen-Yu Lin
Low-Level Vision, Restoration & Generative Priors ExHall # 31
QualiTeacher: Quality-Conditioned Pseudo-Labeling for Real-World Image Restoration Poster Session 5
Fengyang Xiao ⋅ Jingjia Feng ⋅ Peng Hu ⋅ Yuhan Chen ⋅ Dingming Zhang ⋅ Lei Xu ⋅ Guanyi Qin ⋅ Lu Li ⋅ Chunming He ⋅ Sina Farsiu
Low-Level Vision, Restoration & Generative Priors ExHall # 32
Difficulty-Conditioned Attribute-Specific Restoration for Low-Light Image Enhancement Poster Session 5
Mingzhu Zhang ⋅ Shuang Li ⋅ Jiaxu Leng ⋅ Long Sun ⋅ Can Zhang ⋅ Miaoqing Wang ⋅ Xinbo Gao
Low-Level Vision, Restoration & Generative Priors ExHall # 33
From smooth to sharp: Frequency-Decoupled Latent Optimization for Realistic Image Generation Poster Session 5
Tejaswini Medi ⋅ Hsien-Yi Wang ⋅ Arianna Rampini ⋅ Margret Keuper
Low-Level Vision, Restoration & Generative Priors ExHall # 34
Learning to Corrupt for Better Restoration Poster Session 5
Joonkyu Park ⋅ Wooseok Lee ⋅ Jaeha Kim ⋅ Sehoon Kim ⋅ Bokyeung Lee ⋅ Kyoung Mu Lee
Low-Level Vision, Restoration & Generative Priors ExHall # 35
Ctrl-Z Sampling: Scaling Diffusion Sampling with Controlled Random Zigzag Explorations Poster Session 5
Shunqi Mao ⋅ Wei Guo ⋅ Chaoyi Zhang ⋅ Jieting Long ⋅ Ke Xie ⋅ Weidong Cai
Low-Level Vision, Restoration & Generative Priors ExHall # 36
Physics Meets Perception: A Reinforcement Learning Framework for Unpaired Real-World Image Dehazing Poster Session 5
Yunwei Lan ⋅ Zhigao Cui ⋅ Chang Liu ⋅ Menglin Zhang ⋅ Nian Wang ⋅ Cong Zhang ⋅ Dong Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 37
RefAlign: Representation Alignment for Reference-to-Video Generation Poster Session 5
Lei Wang ⋅ YuXin Song ⋅ Ge Wu ⋅ Haocheng Feng ⋅ Hang Zhou ⋅ Jingdong Wang ⋅ Yaxing Wang ⋅ Jian Yang
Low-Level Vision, Restoration & Generative Priors ExHall # 38
Glance: Accelerating Diffusion Models with 1 Sample Poster Session 5
Zhuobai Dong ⋅ Rui Zhao ⋅ songjie wu ⋅ Suyang Hou ⋅ Junchao Yi ⋅ Zhengyuan Yang ⋅ Lijuan Wang ⋅ Alex Jinpeng Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 39
Analyzing and Improving Training-Free Fast Sampling of Text-to-Image Diffusion Models Poster Session 5
Zhenyu Zhou ⋅ Defang Chen ⋅ Siwei Lyu ⋅ Chun Chen ⋅ Can Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 40
Towards Scalable Pre-training of Visual Tokenizers for Generation Poster Session 5
Jingfeng Yao ⋅ Yuda Song ⋅ Yucong Zhou ⋅ Xinggang Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 41
Spectral Consistent Flow for One-step 3D Medical Image Translation Poster Session 5
Haoqing Li ⋅ Jun Shi ⋅ Mingchao Li ⋅ Zehua Zhu ⋅ Qiwei Jia ⋅ Jiong SHI ⋅ Hong An
Low-Level Vision, Restoration & Generative Priors ExHall # 42
Adversarial Score Distillation for Stable One-Step Diffusion in Real-World Image Super-Resolution Poster Session 5
Wei Zhu ⋅ Kai Zhang ⋅ Yu Zheng ⋅ Lei Luo ⋅ Jian Yang
Low-Level Vision, Restoration & Generative Priors ExHall # 43
SD3.5-Flash: Distribution-Guided Distillation of Generative Flows Poster Session 5
Hmrishav Bandyopadhyay ⋅ Rahim Entezari ⋅ Jim Scott ⋅ Reshinth Adithyan ⋅ Yi-Zhe Song ⋅ Varun Jampani
Low-Level Vision, Restoration & Generative Priors ExHall # 44
From Noise to Events: Conditional Diffusion for Event Data Augmentation Poster Session 5
Ruofei Wang ⋅ Ziyuan Luo ⋅ Peiqi Duan ⋅ Xiufeng HUANG ⋅ Boxin Shi ⋅ Renjie Wan
Low-Level Vision, Restoration & Generative Priors ExHall # 45
Region-Aware Test-Time Scaling for Compositional Image Generation Poster Session 5
Mingzhu Shen ⋅ Peng Ye ⋅ Xinyin Ma ⋅ Gongfan Fang ⋅ Christos-Savvas Bouganis ⋅ Yiren Zhao ⋅ Xinchao Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 46
Decoupling Complexity from Scale in Latent Diffusion Model Poster Session 5
Tianxiong Zhong ⋅ Xingye Tian ⋅ Xuebo Wang ⋅ Boyuan Jiang ⋅ Xin Tao ⋅ Pengfei Wan
Low-Level Vision, Restoration & Generative Priors ExHall # 47
Beyond the Boundary: RL-Driven Solution Space Exploration for Blind Face Restoration Poster Session 5
Bin WU ⋅ Wei Wang ⋅ Yahui Liu ⋅ Chi Zhang ⋅ Yao Zhao
Low-Level Vision, Restoration & Generative Priors ExHall # 48
EMAG: Self-Rectifying Diffusion Sampling with Exponential Moving Average Guidance Poster Session 5
ANKIT YADAV ⋅ Huy Ta ⋅ Lingqiao Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 49
QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers Poster Session 5
Kyobin Choo ⋅ Youngmin Kim ⋅ Hyunkyung Han ⋅ Geunrip Park ⋅ Chanyoung Kim ⋅ Sunyoung Jung ⋅ Seong Jae Hwang
Low-Level Vision, Restoration & Generative Priors ExHall # 50
Histogram-constrained Image Generation Poster Session 5
Haoming Liu ⋅ Yuanhe Guo ⋅ Yijia Cao ⋅ Shenji Wan ⋅ Hongyi Wen
Low-Level Vision, Restoration & Generative Priors ExHall # 51
RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing Poster Session 5
Chenfeng Wei ⋅ Chun Wang ⋅ Boyang Zhao ⋅ Si Zuo ⋅ Shenhong WANG ⋅ Chenguang Yang
Low-Level Vision, Restoration & Generative Priors ExHall # 52
Parsimonious Flow Matching for Efficient Image Generation Poster Session 5
Tianjiao Ding ⋅ Ziqing Xu ⋅ Benjamin Haeffele ⋅ Hongkang Li ⋅ Rene Vidal
Low-Level Vision, Restoration & Generative Priors ExHall # 53
AlignMorph: Tuning-Free Diffusion Image Morphing via Explicit Semantic Transport Poster Session 5
Wuyi Liu ⋅ Xu Han ⋅ Yuren Chen ⋅ Yige Mao ⋅ Zishuo Peng ⋅ Xianzhi Li
Low-Level Vision, Restoration & Generative Priors ExHall # 54
DiverseVAR: Balancing Diversity and Quality of Next-Scale Visual Autoregressive Models Poster Session 5
Mingue Park ⋅ Prin Phunyaphibarn ⋅ Phillip (Yuseung) Lee ⋅ Minhyuk Sung
Low-Level Vision, Restoration & Generative Priors ExHall # 55
SkelEM: Explicit Decoupling of Topology and Details for Self-supervised Axial Super-Resolution in Volume Microscopy Poster Session 5
Bohao Chen ⋅ Yanchao Zhang ⋅ Yanan Lv ⋅ Chenxun Deng ⋅ Hua Han ⋅ Xi Chen
Low-Level Vision, Restoration & Generative Priors ExHall # 56
UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion Poster Session 5
Aryan Das ⋅ Koushik Biswas ⋅ Moloud Abdar ⋅ Vinay Kumar Verma
Low-Level Vision, Restoration & Generative Priors ExHall # 57
SLAIR: Structured Latent Flow Matching for All-in-One Image Restoration Poster Session 5
Shuyi Liang ⋅ Yixin Yang ⋅ Hanyue Lou ⋅ Yuning Cui ⋅ Boxin Shi
Low-Level Vision, Restoration & Generative Priors ExHall # 58
Recolour What Matters: Region-Aware Colour Editing via Token-Level Diffusion Poster Session 5
Yuqi Yang ⋅ Dongliang Chang ⋅ Yijia Ling ⋅ Ruoyi Du ⋅ Zhanyu Ma
Low-Level Vision, Restoration & Generative Priors ExHall # 59
Semantic Browsing: Controllable Diversity for Image Generation Poster Session 5
Sara Dorfman ⋅ Maya Vishnevsky ⋅ Omer Dahary ⋅ Or Patashnik ⋅ Danny Cohen-Or
Low-Level Vision, Restoration & Generative Priors ExHall # 60
InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem Poster Session 5
Yeobin Hong ⋅ Suhyeon Lee ⋅ Hyungjin Chung ⋅ Jong Chul Ye
Low-Level Vision, Restoration & Generative Priors ExHall # 61
Fill2SR: Repurposing Inpainting Diffusion Transformers for Real-World Super-Resolution Poster Session 5
Xingfu Yi ⋅ Xiaoxue Yu
Low-Level Vision, Restoration & Generative Priors ExHall # 62
Reconstruction-Anchored Diffusion Model for Text-to-Motion Generation Poster Session 5
Yifei Liu ⋅ Changxing Ding ⋅ Ling Guo ⋅ Huaiguang Jiang ⋅ Qiong Cao
Low-Level Vision, Restoration & Generative Priors ExHall # 63
Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance Poster Session 5
Kangsheng Duan ⋅ Ziyang Xu ⋅ Wenyu Liu ⋅ Xiaohu Ruan ⋅ Xiaoxin Chen ⋅ Xinggang Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 64
SSDD: Single-Step Diffusion Decoder for Efficient Image Tokenization Poster Session 5
Théophane Vallaeys ⋅ Jakob Verbeek ⋅ MATTHIEU CORD
Low-Level Vision, Restoration & Generative Priors ExHall # 66
Learning on the Manifold: Unlocking Standard Diffusion Transformers with Representation Encoders Poster Session 5
Amandeep Kumar ⋅ Vishal Patel
Low-Level Vision, Restoration & Generative Priors ExHall # 67
Solving Diffusion Inverse Problems with Restart Posterior Sampling Poster Session 5
Bilal Ahmed ⋅ Joseph Makin
Low-Level Vision, Restoration & Generative Priors ExHall # 68
Posterior Augmented Flow Matching Poster Session 5
George Stoica ⋅ Sayak Paul ⋅ Matthew Wallingford ⋅ Abhay Nori ⋅ Vivek Ramanujan ⋅ Winson Han ⋅ Ali Farhadi ⋅ Ranjay Krishna ⋅ Judy Hoffman
Low-Level Vision, Restoration & Generative Priors ExHall # 69
Contrastive Conditional–Unconditional Alignment for Long-tailed Diffusion Model Poster Session 5
Fang Chen ⋅ Alex Villa ⋅ Gongbo Liang ⋅ Li Fuxin ⋅ Xiaoyi Lu ⋅ Meng Tang
Low-Level Vision, Restoration & Generative Priors ExHall # 70
D3F-IR: Dual-Domain Deterministic Flow Matching for Visible-to-Infrared Translation Poster Session 5
Peiyi Zeng ⋅ Diedong Feng ⋅ Zhen Liu ⋅ Zhenming Peng ⋅ Bing Zeng ⋅ Shuaicheng Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 71
GLARE: Towards Generalizable Detection of Latent Diffusion Images with Global-Local Reconstruction Error Poster Session 5
Jiangtao Yan ⋅ Jiazhen Ji ⋅ Zhongyu Zhang ⋅ Yuge Huang ⋅ Wenbin Wang ⋅ Shouhong Ding
Low-Level Vision, Restoration & Generative Priors ExHall # 72
ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching Poster Session 5
Yuhang He ⋅ Kai Zhang ⋅ Xiaoming Li ⋅ Du Chen ⋅ Jian Yang
Low-Level Vision, Restoration & Generative Priors ExHall # 73
Be Tangential to Manifold: Discovering Riemannian Metric for Diffusion Models Poster Session 5
Shinnosuke Saito ⋅ Takashi Matsubara
Low-Level Vision, Restoration & Generative Priors ExHall # 74
Straight-Path Flow Matching for Incomplete Multi-View Clustering Poster Session 5
Yiteng Yuan ⋅ Junyan Wang ⋅ Zheyuan Liu ⋅ Hong Jia ⋅ Lei Fan ⋅ Zhulin Tao ⋅ Lianbo Guo
Low-Level Vision, Restoration & Generative Priors ExHall # 75
ART-VSR: Adaptive Rectified Trajectories for One-Step Video Super-Resolution Poster Session 5
JianHui Zhang ⋅ Chen Fang ⋅ Wanghao Wanghao ⋅ chaoyu feng ⋅ LEI LEI ⋅ Jue Wang ⋅ Shuaicheng Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 76
AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation Poster Session 5
Xuanhua Yin ⋅ CHUANZHI XU ⋅ Haoxian Zhou ⋅ Boyu Wei ⋅ Weidong Cai
Low-Level Vision, Restoration & Generative Priors ExHall # 77
Zero-Shot Inference-Time Rectification for Real-World Arbitrary-Scale Super-Resolution Poster Session 5
Yifan Zuo ⋅ tianlin zhu ⋅ zhenlong xia ⋅ Jiebin Yan ⋅ Xiaoshui Huang ⋅ Sanqian Li ⋅ Yuming Fang ⋅ Qiang Wu
Low-Level Vision, Restoration & Generative Priors ExHall # 78
Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories Poster Session 5
Merve Kocabas ⋅ Gege Gao ⋅ Bernhard Schölkopf ⋅ Andreas Geiger
Low-Level Vision, Restoration & Generative Priors ExHall # 148
Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes Poster Session 5
Victoria Chen ⋅ Emery Pierson ⋅ Léopold Maillard ⋅ Maks Ovsjanikov
Low-Level Vision, Restoration & Generative Priors ExHall # 147
Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness Poster Session 5
Hangyeol Lee ⋅ Hyojeong Lee ⋅ Joo-Young Kim
Low-Level Vision, Restoration & Generative Priors ExHall # 146
AdaBridge-SR: Adaptive Bridge Matching for Real-World Image Super-Resolution Poster Session 5
Jiangang Wang ⋅ Shangquan Sun ⋅ Aiping Zhang ⋅ Yuning Cui ⋅ Wenqi Ren
Low-Level Vision, Restoration & Generative Priors ExHall # 145
ELT: Elastic Looped Transformers for Visual Generation Poster Session 5
Sahil Goyal ⋅ Swayam Agrawal ⋅ Gautham Anil ⋅ Sujoy Paul ⋅ Aditya Kusupati ⋅ Prateek Jain
Low-Level Vision, Restoration & Generative Priors ExHall # 144
Rdm: Re-conceptualizing Distribution Matching as a Reward for Diffusion Distillation Poster Session 5
Linqian Fan ⋅ Peiqin Sun ⋅ Tiancheng Wen ⋅ Shun Lu ⋅ Chengru Song
Low-Level Vision, Restoration & Generative Priors ExHall # 143
DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution Poster Session 5
Yingwei TANG ⋅ Chen Yan ⋅ Wendi Liu ⋅ Qiang Hu ⋅ Xiaoyun Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 142
Improving Image-to-Image Translation via a Rectified Flow Reformulation Poster Session 5
Satoshi Iizuka ⋅ Shun Okamoto ⋅ Kazuhiro Fukui
Low-Level Vision, Restoration & Generative Priors ExHall # 141
LUCE: Constrained Curve-Domain Guidance for Training-Free Low-Light Enhancement with Hue-Preserving Decoupling Poster Session 5
Yijie Wei ⋅ Weiran Li ⋅ Yeqiang Liu ⋅ Mina Han ⋅ Xue Liu ⋅ Zhenbo Li
Low-Level Vision, Restoration & Generative Priors ExHall # 140
RefDiT: Local Attribute Guidance in Reference-Based Image Generation Poster Session 5
Rameshwar Mishra ⋅ Srikrishna Karanam ⋅ Subramanyam Venkata
Low-Level Vision, Restoration & Generative Priors ExHall # 139
Short-to-Long Functional Connectivity Transfer via Structure-Aware Latent Diffusion Poster Session 5
Ishmael Benjamin Torres Aguilar ⋅ Yufeng Liu ⋅ Zhengwu Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 138
ECTraj: Enhanced Consistency Training for Multi-Agent Trajectory Prediction Poster Session 5
Alen Mrdovic ⋅ Qingze Liu ⋅ Danrui Li ⋅ Mathew Schwartz ⋅ Kaidong Hu ⋅ Sejong Yoon ⋅ Mubbasir Kapadia ⋅ Vladimir Pavlovic
Low-Level Vision, Restoration & Generative Priors ExHall # 137
Spectral and Trajectory Regularization for Diffusion Transformer Super-Resolution Poster Session 5
Jingkai Wang ⋅ Yixin Tang ⋅ Jue Gong ⋅ Jiatong Li ⋅ Shu Li ⋅ Libo Liu ⋅ Jianliang Lan ⋅ Yutong Liu ⋅ Yulun Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 136
MeanTalker: Efficient and Expressive Speech-Driven 3D Facial Animation via Geometric-Aware Mean Flow Poster Session 5
Zhongyuan Zhao ⋅ Zhihao Li ⋅ Qing Li ⋅ Leidong Fan ⋅ KANGLIN LIU
Low-Level Vision, Restoration & Generative Priors ExHall # 135
Curvature-Adaptive Consistency Flow Matching: Autonomous Trajectory Optimization via Reinforcement Learning Poster Session 5
Songtao Tian ⋅ Guhan Chen ⋅ Bohan Li ⋅ Jingyi Ma ⋅ Zixiong Yu
Low-Level Vision, Restoration & Generative Priors ExHall # 133
Which Layer Causes Distribution Deviation? Entropy-Guided Adaptive Pruning for Diffusion and Flow Models Poster Session 5
Changlin Li ⋅ Jiawei Zhang ⋅ Zeyi Shi ⋅ Zhihui Li ⋅ Xiaojun Chang
Low-Level Vision, Restoration & Generative Priors ExHall # 132
Momentum Guidance: Plug-and-Play Guidance for Flow Models Poster Session 5
Runlong Liao ⋅ Jian Yu ⋅ Baiyu Su ⋅ Chi Zhang ⋅ Lizhang Chen ⋅ Qiang Liu
Low-Level Vision, Restoration & Generative Priors ExHall # 131
Extreme Face Super-Resolution through Identity Fitting and Decoupling Poster Session 5
Jiarui Yang ⋅ Hang Guo ⋅ Wen Huang ⋅ Shu-Tao Xia ⋅ Tao Dai
Low-Level Vision, Restoration & Generative Priors ExHall # 130
Co-evolving Representations in Joint Image-Feature Diffusion Poster Session 5
Theodoros Kouzelis ⋅ Spyros Gidaris ⋅ Nikos Komodakis
Low-Level Vision, Restoration & Generative Priors ExHall # 129
EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow Poster Session 5
Dogyun Park ⋅ Yanyu Li ⋅ Sergey Tulyakov ⋅ Anil Kag
Low-Level Vision, Restoration & Generative Priors ExHall # 128
BiSLW: Bi-Spectral Latent Watermarking for Generative Diffusion Models Poster Session 5
Aryan Pandit
Low-Level Vision, Restoration & Generative Priors ExHall # 127
Exposure Bias Can Alleviate Itself via Directional and Frequency Rectification in Flow Matching Poster Session 5
Guanbo Huang ⋅ Jingjia Mao ⋅ Fanding Huang ⋅ fengkai liu ⋅ Xiangyang Luo ⋅ Yaoyuan Liang ⋅ Jiasheng Lu ⋅ xiaoe Wang ⋅ Pei Liu ⋅ Ruiliu Fu ⋅ Ruqi Huang ⋅ Shao-Lun Huang
Low-Level Vision, Restoration & Generative Priors ExHall # 126
GMODiff: One-Step Gain Map Refinement with Diffusion Priors for Efficient HDR Reconstruction Poster Session 5
Tao Hu ⋅ Weiyu Zhou ⋅ Yanjie Tu ⋅ Wei Dong ⋅ Peng Wu ⋅ Qingsen Yan ⋅ Yanning Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 125
PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation Poster Session 5
Cao Duy ⋅ Phong Nguyen
Low-Level Vision, Restoration & Generative Priors ExHall # 124
Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time Poster Session 5
Xinyi Wang ⋅ Yuyang Huang ⋅ Yalin Su ⋅ Pengcheng Luan ⋅ Tao Zhang ⋅ FEIMING WEI ⋅ Wenxian Yu
Low-Level Vision, Restoration & Generative Priors ExHall # 123
FMA-Net++: Motion- and Exposure-Aware Joint Video Super-Resolution and Deblurring Poster Session 5
Geunhyuk Youk ⋅ Jihyong Oh ⋅ Munchurl Kim
Low-Level Vision, Restoration & Generative Priors ExHall # 122
Flow Straight to Reality: Perceptually Consistent Flow Matching for Efficient Image Restoration Poster Session 5
Sangwoo (Jason) Jo ⋅ Donggeun Ko ⋅ Jayeon Kang ⋅ Youngsang Kwak ⋅ Jaehwa Kwak ⋅ Sungjoon Choi
Low-Level Vision, Restoration & Generative Priors ExHall # 121
RhymeFlow: Training Free Acceleration for Video Generation with Asynchronous Denoising Flow Scheduling Poster Session 5
Chensheng Dai ⋅ Shengjun Zhang ⋅ Yifan Li ⋅ Zhang Zhang ⋅ Zheng Zhu ⋅ Yueqi Duan
Low-Level Vision, Restoration & Generative Priors ExHall # 120
Cross-Resolution Distribution Matching for Diffusion Distillation Poster Session 5
Chen Feiyang ⋅ Hongpeng Pan ⋅ Haonan Xu ⋅ Xinyu Duan ⋅ Zhefeng Wang ⋅ Yang Yang
Low-Level Vision, Restoration & Generative Priors ExHall # 119
Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection Poster Session 5
Xinhao Zhong ⋅ Shuoyang Sun ⋅ Zhaoyang Xu ⋅ Xulin Gu ⋅ Bin Chen ⋅ Min Zhang ⋅ Yaowei Wang
Low-Level Vision, Restoration & Generative Priors ExHall # 118
D²R²OSR: Degradation-Disentangled Representation for Real-World Omnidirectional Image Super-Resolution Poster Session 5
Hongyu An ⋅ Xinfeng Zhang ⋅ Xu Fan ⋅ Shijie Zhao ⋅ Li Zhang ⋅ Ruiqin Xiong
Low-Level Vision, Restoration & Generative Priors ExHall # 117
Controllable Generative Reference for Stereo Image Compression via Reliability-Aware Gating Poster Session 5
Zhineng Zhao ⋅ Mingyao Hong ⋅ Fengfan Shi ⋅ Zhihai He
Low-Level Vision, Restoration & Generative Priors ExHall # 116
GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors Poster Session 5
Jiazheng Liu ⋅ Hang Li ⋅ jiawei zhang ⋅ Jiahe Li ⋅ Xiaohan Yu ⋅ Shengyin Fan ⋅ Jin Zheng ⋅ Xiao Bai
Low-Level Vision, Restoration & Generative Priors ExHall # 115
Dual-End Consistency Model Poster Session 5
linwei dong ⋅ Ruoyu Guo ⋅ Ge Bai ⋅ Zehuan Yuan ⋅ Yawei Luo ⋅ Changqing Zou
Low-Level Vision, Restoration & Generative Priors ExHall # 114
DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent Poster Session 5
Jia-Wei Liao ⋅ Li-Xuan Peng ⋅ Mei-Heng Yueh ⋅ Min Sun ⋅ Cheng-Fu Chou ⋅ Jun-Cheng Chen
Low-Level Vision, Restoration & Generative Priors ExHall # 113
Y-diff: Structure-Texture Decoupled Diffusion Distillation for H&E-to-pCLE Translation Poster Session 5
Haodong Wang ⋅ Yan Wen ⋅ Hongen Liao ⋅ Fang Chen ⋅ Tianqi Huang
Low-Level Vision, Restoration & Generative Priors ExHall # 112
Unified Multi-plane Autoregressive Diffusion for 3D Multi-Contrast MRI Synthesis Poster Session 5
Yejee Shin ⋅ Geonhui Son ⋅ Jinglu Wang ⋅ Minwoo Jung ⋅ Yan Lu ⋅ Dosik Hwang
Low-Level Vision, Restoration & Generative Priors ExHall # 111
Spectral Prior for Reducing Exposure Bias in Diffusion Models Poster Session 5
Yuya Kobayashi ⋅ Masato Ishii ⋅ Yuhta Takida ⋅ Takashi Shibuya ⋅ Yuki Mitsufuji
Low-Level Vision, Restoration & Generative Priors ExHall # 110
D2PO: Optimizing Diffusion Samplers via Dynamic Preference Poster Session 5
Jinkyu Kim ⋅ Jinyoung Choi ⋅ Bohyung Han
Low-Level Vision, Restoration & Generative Priors ExHall # 108
TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution Poster Session 5
Xiang Gao ⋅ Chenxin Zhu ⋅ Yushun Fang ⋅ Qiang Hu ⋅ Xiaoyun Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 107
ConceptWeaver: Weaving Disentangled Concepts with Flow Poster Session 5
Jintao Chen ⋅ Aiming Hao ⋅ Xiaoqing Chen ⋅ Chengyu Bai ⋅ Chubin Chen ⋅ Yanxun Li ⋅ Jiahong Wu ⋅ Xiangxiang Chu ⋅ Shanghang Zhang
Low-Level Vision, Restoration & Generative Priors ExHall # 105
Image Warping for Image-to-Image Translation Poster Session 5
Shen Zheng ⋅ Anurag Ghosh ⋅ Gaurav Parmar ⋅ Srinivasa G. Narasimhan
Low-Level Vision, Restoration & Generative Priors ExHall # 104
High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control Poster Session 5
Junha Kim ⋅ Hyunjoon Park ⋅ Donghyeon Cho
Low-Level Vision, Restoration & Generative Priors ExHall # 103
Fair and Faithful: A Diffusion-Enhanced Dataset and Hybrid State-Space Mamba for Face Super-Resolution Poster Session 5
Tao Wang ⋅ Peiwen Xia ⋅ Bowen Tang ⋅ Jinwei Chen ⋅ Kaihao Zhang ⋅ Bo Li
Low-Level Vision, Restoration & Generative Priors ExHall # 102
Stochastic Optimal Control Sampling for Diffusion Inverse Problems Poster Session 5
Jie Zhang ⋅ Youmei Qiu ⋅ Hanling Tian ⋅ Jingyuan Zhang ⋅ Xiang Yin ⋅ Xiaolin Huang
Low-Level Vision, Restoration & Generative Priors ExHall # 101
IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment Poster Session 6
Jinjian Wu ⋅ Jiaqi Tang ⋅ Wei Wei ⋅ Yingying Yan ⋅ Jianmin Chen ⋅ Botong Geng ⋅ Lei Zhang ⋅ Qifeng Chen
Multimodal, Video & Document Understanding ExHall # 174
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations? Poster Session 6
Xiaohan Wang ⋅ Mingze Yin ⋅ Yilin Zhao ⋅ sinbadliu sinbadliu ⋅ Dian Li
Multimodal, Video & Document Understanding ExHall # 152
Generalize LMMs to Versatile Visual Modalities via Fabricated Modality Synthesis Poster Session 6
YuanShihao YuanShihao ⋅ Yuanze Li ⋅ Ruyi Zhang ⋅ Ming LIU ⋅ Wangmeng Zuo
Multimodal, Video & Document Understanding ExHall # 202
ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance Poster Session 6
Hyojin Park ⋅ Yi Li ⋅ Janghoon Cho ⋅ Sungha Choi ⋅ Jungsoo Lee ⋅ TAOTAO JING ⋅ shuai zhang ⋅ Munawar Hayat ⋅ Dashan Gao ⋅ Ning Bi ⋅ Fatih Porikli
Multimodal, Video & Document Understanding ExHall # 144
MMAgent-R2: Learning to Rerank and Reject for Agentic mRAG Poster Session 6
Tao Zhang ⋅ Ziqi Zhang ⋅ Zongyang Ma ⋅ Yuxin Yang ⋅ Bing Li ⋅ Chunfeng Yuan ⋅ Kang Rong ⋅ Fengyun Rao ⋅ Jing LYU ⋅ Weiming Hu
Multimodal, Video & Document Understanding ExHall # 167
ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning Poster Session 6
Ting Huang ⋅ zhenyu zhang ⋅ Wenyuan Huang ⋅ Hao Tang ⋅ Jian Yang
Multimodal, Video & Document Understanding ExHall # 178
Towards Spatial Supersensing in the Wild Poster Session 6
Tianjun Gu ⋅ Tianyu Xin ⋅ Kuan Zhang ⋅ Bowen Yang ⋅ Yinan Han ⋅ Peize Li ⋅ Yucheng Lu ⋅ Jianhang Liu ⋅ Xinran Zhang ⋅ KOK CHUNG CHUA ⋅ Qiyue Zhao ⋅ Qinlei Xie ⋅ Yupeng Chen ⋅ Marco Pavone ⋅ Yiming Li
Multimodal, Video & Document Understanding ExHall # 143
CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains Poster Session 6
Wenhan Wang ⋅ Zhixiang Zhou ⋅ Zhongtian Ma ⋅ Yanzhu Chen ⋅ Ziyu Lin ⋅ Hao Sheng ⋅ Pengfei Liu ⋅ Wenqi Shao ⋅ Qiaosheng Zhang ⋅ Yu Qiao
Multimodal, Video & Document Understanding ExHall # 277
Learning Spectral and Polarimetric Clues for One-to-Multimodal Novel View Synthesis Poster Session 6
Federico Lincetto ⋅ Gianluca Agresti ⋅ Mattia Rossi ⋅ Piergiorgio Sartor ⋅ Pietro Zanuttigh
Multimodal, Video & Document Understanding ExHall # 279
Geo-DPO: Aligning Semantic Intent with Geometry for 3D Affordance Segmentation Poster Session 6
Ziqian Yang ⋅ Xiaolei Wang ⋅ Xianglin Qiu ⋅ Weiguang Zhao ⋅ Quan Zhang ⋅ Jimin Xiao
Multimodal, Video & Document Understanding ExHall # 276
Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs Poster Session 6
Jouwon Song ⋅ Woohyeong Kim ⋅ Kyeongbo Kong
Multimodal, Video & Document Understanding ExHall # 275
Event-Driven Video Generation Poster Session 6
Chika Maduabuchi ⋅ Jindong Wang
Multimodal, Video & Document Understanding ExHall # 274
Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting Poster Session 6
Qian Ma ⋅ S M Rayeed ⋅ Qiong Wu ⋅ Charles Stewart ⋅ Yao Ma
Multimodal, Video & Document Understanding ExHall # 273
GridVQA-X: A Diagnostic Framework for Evaluating Multimodal Explainability Methods Poster Session 6
Sujay Belsare ⋅ Sushant Kumar ⋅ Sudarshan Nikhil ⋅ Ponnurangam Kumaraguru ⋅ Chirag Agarwal
Multimodal, Video & Document Understanding ExHall # 272
Error-Driven Scene Editing for 3D Grounding in Large Language Models Poster Session 6
Yue Zhang ⋅ Zun Wang ⋅ Han Lin ⋅ Jialu Li ⋅ Jianing Yang ⋅ Yonatan Bitton ⋅ Idan Szpektor ⋅ Mohit Bansal
Multimodal, Video & Document Understanding ExHall # 271
CogniCred: A Dataset and Benchmark for Cognitive Credential Forgery Detection Poster Session 6
Junchi Li ⋅ Jiasheng Sun ⋅ Weizhi Chen ⋅ Ziwei Wang ⋅ Sheng Zhou ⋅ Jiajun Bu ⋅ Chenfan Qu ⋅ Bohan Yu ⋅ Jian liu ⋅ Weiqiang Wang
Multimodal, Video & Document Understanding ExHall # 270
Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection Poster Session 6
Fanrui Zhang ⋅ Qiang Zhang ⋅ Sizhuo Zhou ⋅ Jianwen Sun ⋅ Chuanhao Li ⋅ Jiaxin Ai ⋅ Yukang Feng ⋅ Yujie Zhang ⋅ Wenjie Li ⋅ Zizhen Li ⋅ Yifan Chang ⋅ Jiawei Liu ⋅ Kaipeng Zhang
Multimodal, Video & Document Understanding ExHall # 269
Caption Bottleneck Models Poster Session 6
Seref Baris Cagliyan ⋅ Umut Ozdemir ⋅ Merve Tapli ⋅ Emre Akbas
Multimodal, Video & Document Understanding ExHall # 268
HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework Poster Session 6
Jiacheng Yang ⋅ Anqi Chen ⋅ Yunkai Dang ⋅ Qi Fan ⋅ Cong Wang ⋅ Wenbin Li ⋅ Feng Miao ⋅ Yang Gao
Multimodal, Video & Document Understanding ExHall # 267
Iterative Perceptual Alignment for VLMs via Deterministic Reconstruction Feedback Poster Session 6
Xiaorui Chen ⋅ Hanzhong Guo ⋅ Nizhe Cai ⋅ Jieliang Luo
Multimodal, Video & Document Understanding ExHall # 266
BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension Poster Session 6
Abu Tyeb Azad ⋅ Ishita Apan ⋅ Fahim Ahmed ⋅ Sumaiya Katha ⋅ Ezharuddin Jubaer ⋅ Armun Alam ⋅ Pranjal Nandi ⋅ Amin Ali ⋅ Aman Chadha ⋅ Md Mofijul Islam ⋅ A K M Mahbubur Rahman
Multimodal, Video & Document Understanding ExHall # 265
GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding Poster Session 6
Shijie Zhou ⋅ Viet Lai ⋅ Hao Tan ⋅ Jihyung Kil ⋅ Wanrong Zhu ⋅ Changyou Chen ⋅ Ruiyi Zhang
Multimodal, Video & Document Understanding ExHall # 264
Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild Poster Session 6
Cheng Cui ⋅ Changda Zhou ⋅ Tingquan Gao ⋅ Xueqing Wang ⋅ ZIYUE GAO ⋅ Jing Tang ⋅ Yi Liu
Multimodal, Video & Document Understanding ExHall # 263
HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task Poster Session 6
Xiaoya Lu ⋅ Yijin Zhou ⋅ Zeren Chen ⋅ Ruocheng Wang ⋅ Bingrui Sima ⋅ Enshen Zhou ⋅ Lu Sheng ⋅ Dongrui Liu ⋅ Jing Shao
Multimodal, Video & Document Understanding ExHall # 262
Towards High-Resolution Visual Perception via Hierarchical Entity Exploration Poster Session 6
Ziyu Ma ⋅ Shidong Yang ⋅ Yuxiang Ji ⋅ Yiming Hu ⋅ Tongwen Huang ⋅ Yong Wang ⋅ Jianfei Cai ⋅ Xiangxiang Chu
Multimodal, Video & Document Understanding ExHall # 261
How to Teach Large Multimodal Models New Skills Poster Session 6
Zhen Zhu ⋅ Yiming Gong ⋅ Yao Xiao ⋅ Yaoyao Liu ⋅ Derek Hoiem
Multimodal, Video & Document Understanding ExHall # 260
From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation Poster Session 6
Haowen Gu ⋅ Gensheng Pei ⋅ Junzhu Mao ⋅ Qiong Wang ⋅ Mingwu Ren ⋅ Yazhou Yao
Multimodal, Video & Document Understanding ExHall # 259
MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling Poster Session 6
Jin Xu ⋅ Xiaojian Huang ⋅ zhang zhihong ⋅ Luo Zhuodong ⋅ Xuejin Chen ⋅ Jie Zhao ⋅ Xin Liu ⋅ Wang Xinzhi ⋅ Jiansheng Wei
Multimodal, Video & Document Understanding ExHall # 258
SE-DETR: Explicit Semantic Exploration for Generalizability and Distinguishability in Video Temporal Grounding Poster Session 6
Chengyang Hu ⋅ Guanshuo Wang ⋅ Fufu Yu ⋅ Qiong Jia ⋅ Shouhong Ding ⋅ Lizhuang Ma
Multimodal, Video & Document Understanding ExHall # 257
How Far Are Video Models from True Multimodal Reasoning? Poster Session 6
Xiaotian Zhang ⋅ Jianhui Wei ⋅ Yuan Wang ⋅ Jie Tan ⋅ Yichen Li ⋅ Yan Zhang ⋅ Ziyi Chen ⋅ Daoan Zhang ⋅ DEZHI YU ⋅ Wei Xu ⋅ Songtao Jiang ⋅ Zuozhu Liu
Multimodal, Video & Document Understanding ExHall # 256
Wavelet-based Intra-video Counterfactual Reasoning for Video Question Grounding Poster Session 6
Jiasheng Yuan ⋅ Wei Wei
Multimodal, Video & Document Understanding ExHall # 255
The Telephone Game: Evaluating Semantic Drift in Unified Models Poster Session 6
Sabbir Mollah ⋅ Rohit Gupta ⋅ Swetha Sirnam ⋅ Qingyang Liu ⋅ Ahnaf Munir ⋅ Shah Mubarak
Multimodal, Video & Document Understanding ExHall # 254
When Sinks Help or Hurt: Unified Framework for Attention Sink in MLLMs Poster Session 6
Jiho Choi ⋅ Jaemin Kim ⋅ JINHWI PARK ⋅ Seunghoon Hong ⋅ Sanghwan Kim
Multimodal, Video & Document Understanding ExHall # 253
ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering Poster Session 6
ZhengXian Wu ⋅ Hangrui Xu ⋅ Kai Shi ⋅ Zhuohong Chen ⋅ Yunyao Yu ⋅ Chuanrui Zhang ⋅ ZIRUI LIAO ⋅ JunYang JunYang ⋅ Zhenyu Yang ⋅ Haonan Lu ⋅ Haoqian Wang
Multimodal, Video & Document Understanding ExHall # 252
Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs Poster Session 6
Yoonhyung Park ⋅ Minji Kim ⋅ Sungwon Moon ⋅ Jiyoung Lee
Multimodal, Video & Document Understanding ExHall # 251
EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents Poster Session 6
Xuan Dong ⋅ Huanyang Zheng ⋅ Tianhao Niu ⋅ Zhe Han ⋅ Pengzhan Li ⋅ Bofei Liu ⋅ Zhengyang Liu ⋅ Guancheng Li ⋅ Qingfu Zhu ⋅ Wanxiang Che
Multimodal, Video & Document Understanding ExHall # 250
Sink-Token-Aware Pruning for Fine-Grained Video Understanding in Efficient Video LLMs Poster Session 6
Kibum Kim ⋅ Jiwan Kim ⋅ Kyle Min ⋅ Yueqi Wang ⋅ Jinyoung Moon ⋅ Julian McAuley ⋅ Chanyoung Park
Multimodal, Video & Document Understanding ExHall # 249
Transport Discrepancy as a Reliability Signal for Vision-Language-Action Models Poster Session 6
Wanpeng Zhang ⋅ Ye Wang ⋅ Hao Luo ⋅ Haoqi Yuan ⋅ Yicheng Feng ⋅ Chaoyi Xu ⋅ Sipeng Zheng ⋅ Qin Jin ⋅ Zongqing Lu
Multimodal, Video & Document Understanding ExHall # 248
ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval Poster Session 6
Yuhan Liu ⋅ Pei Fu ⋅ Hang Li ⋅ Yukun Qi ⋅ Chao Jiang ⋅ Jingwen Fu ⋅ Zhen Liu ⋅ Bin Qin ⋅ Zhenbo Luo ⋅ Jian Luan ⋅ Jingmin Xin
Multimodal, Video & Document Understanding ExHall # 247
Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR Poster Session 6
Jinda Lu ⋅ Junkang Wu ⋅ Jinghan Li ⋅ Kexin Huang ⋅ Shuo Yang ⋅ Mingzhu Chen ⋅ Jiancan Wu ⋅ Kuien Liu ⋅ Xiang Wang
Multimodal, Video & Document Understanding ExHall # 246
Mitigating Sycophancy in Multimodal Chart Understanding via Vision-Grounded Verification Poster Session 6
Xiaolong Wang ⋅ Zhiwei Lin ⋅ Tai Liu ⋅ Qiang Li ⋅ Jian Sun
Multimodal, Video & Document Understanding ExHall # 245
Why and When Visual Token Pruning Fails? A Study on Relevant Visual Information Shift in MLLMs Decoding Poster Session 6
Jiwan Kim ⋅ Kibum Kim ⋅ Wonjoong Kim ⋅ Byung-Kwan Lee ⋅ Chanyoung Park
Multimodal, Video & Document Understanding ExHall # 244
Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning Poster Session 6
Vishwas Sathish ⋅ Viresh Ranjan ⋅ Xinliang Zhu ⋅ Arnab Dhua ⋅ Douglas Gray
Multimodal, Video & Document Understanding ExHall # 243
Information-Regularized Attention for Visual-Centric Reasoning Poster Session 6
Guohao Sun ⋅ Xiaofang Wang ⋅ Yash Patel ⋅ Mengchen Liu ⋅ Zhiqiang Tao ⋅ Praveen Krishnan
Multimodal, Video & Document Understanding ExHall # 242
Efficient Document Tampering Localization with Multi-Level Discrepancy Features and Unified DCT–Quantization Embedding Poster Session 6
Mohamed Dhouib ⋅ Ye Zhu ⋅ Sonia Vanier ⋅ Aymen Shabou
Multimodal, Video & Document Understanding ExHall # 241
NAPA: Natively Multimodal Autoregressive Perception Architecture Poster Session 6
Phuc Le Khac Hong ⋅ Yasser Dahou ⋅ Sanath Narayan ⋅ Ankit Singh ⋅ Wamiq Para ⋅ Ngoc Dung Huynh ⋅ Sofian Chaybouti ⋅ Hakim Hacid
Multimodal, Video & Document Understanding ExHall # 240
CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport Poster Session 6
Peng Ling ⋅ Yingda Yin ⋅ Lingting Zhu ⋅ Weikai Chen ⋅ Shengju Qian ⋅ Zeyu HU ⋅ Xin Wang ⋅ Wenming Yang
Multimodal, Video & Document Understanding ExHall # 239
InstrAct: Towards Action-Centric Understanding in Instructional Videos Poster Session 6
Zhuoyi Yang ⋅ Jiapeng Yu ⋅ Reuben Tan ⋅ Boyang Albert Li ⋅ Huijuan Xu
Multimodal, Video & Document Understanding ExHall # 238
On the Faithfulness of Post-Hoc Concept Bottleneck Models Poster Session 6
Laines Schmalwasser ⋅ Jan Blunk ⋅ Niklas Penzel ⋅ Julia Niebling ⋅ Joachim Denzler
Multimodal, Video & Document Understanding ExHall # 237
Falcon: Functional Assembly and Language for Compositional Reasoning in X-ray Poster Session 6
Yonathan Michael ⋅ Mohamad Alansari ⋅ Natnael Takele ⋅ Andreas Henschel ⋅ Naoufel Werghi
Multimodal, Video & Document Understanding ExHall # 236
From Illusion to Intention: Visual Rationale Learning for Reliable Evidence Acquisition Poster Session 6
Changpeng Wang ⋅ Liu Junhan ⋅ Xi Chen ⋅ Haozhe Wang ⋅ Donglian Qi ⋅ Yunfeng Yan
Multimodal, Video & Document Understanding ExHall # 235
COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models Poster Session 6
Ziqi Zhou ⋅ Weize Quan ⋅ Mining Tan ⋅ Zhihan Chen ⋅ Dandan Zheng ⋅ Jingdong Chen ⋅ JUN ZHOU ⋅ Weiming Dong ⋅ Dong-ming Yan
Multimodal, Video & Document Understanding ExHall # 234
The Illusion of High Utility in Safety Alignment of Text-to-Image Diffusion Models Poster Session 6
Adeel Yousaf ⋅ Soumik Ghosh ⋅ James Beetham ⋅ Amrit Singh Bedi ⋅ Shah Mubarak
Multimodal, Video & Document Understanding ExHall # 233
Bridging Vision and Language Concepts through Optimal Transport Semantic Flow Poster Session 6
Chenyang Zhang ⋅ Anqi Dong ⋅ Guangming Zhu ⋅ Nuoye Xiong ⋅ Siyuan Wang ⋅ Lin Mei ⋅ Liang Zhang
Multimodal, Video & Document Understanding ExHall # 232
HighlightBench: Benchmarking and Diagnosing Markup-Driven Table Reasoning in Scientific Documents Poster Session 6
Lexin Wang ⋅ Shenghua Liu ⋅ Yiwei Wang ⋅ Yujun Cai ⋅ Yuyao Ge ⋅ Jiayu Yao ⋅ Jiafeng Guo ⋅ Xueqi Cheng
Multimodal, Video & Document Understanding ExHall # 231
RegRet: Enhancing Region-Level Retrieval in Large Multimodal Models Poster Session 6
Xun Liang ⋅ Honghui Yang ⋅ Weihang Pan ⋅ Boyuan Pan ⋅ Yao Hu ⋅ Binbin Lin ⋅ Deng Cai ⋅ Ruisi Zhao ⋅ Wenxiao Wang
Multimodal, Video & Document Understanding ExHall # 230
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios Poster Session 6
Jun Zhang ⋅ Xin Zhang ⋅ Jie Feng ⋅ Long Chen ⋅ Junhui Wang ⋅ Zhicheng Liu ⋅ Depeng Jin ⋅ Yong Li
Multimodal, Video & Document Understanding ExHall # 229
UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters Poster Session 6
Yongkun Du ⋅ Zhineng Chen ⋅ Yazhen Xie ⋅ Weikang Bai ⋅ Hao Feng ⋅ Wei Shi ⋅ Yuchen Su ⋅ Can Huang ⋅ Yu-Gang Jiang
Multimodal, Video & Document Understanding ExHall # 228
CMDR: Contextual Multimodal Document Retrieval Poster Session 6
Ryota Tanaka ⋅ Taku Hasegawa ⋅ Kyosuke Nishida
Multimodal, Video & Document Understanding ExHall # 227
SAFE-EQA: Semantic-Aware Efficient Exploration for Embodied Question Answering Poster Session 6
Yijie Tang ⋅ Ke Xia ⋅ Jiazhao Zhang ⋅ Zhinan Yu ⋅ Zhiyuan Yu ⋅ Dezun Dong ⋅ Renjiao Yi ⋅ Chenyang Zhu ⋅ Kai Xu
Multimodal, Video & Document Understanding ExHall # 226
VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling Poster Session 6
Yuqi Zhang ⋅ pengpeng Zeng ⋅ Yuyu Guo ⋅ Wenjie Yang ⋅ Lingchen Meng ⋅ Peng Di ⋅ Hang Yu ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Multimodal, Video & Document Understanding ExHall # 225
P-MTP: Efficient Document Parsing via Multi-Token Prediction with Progressive Depth Scaling Poster Session 6
Le Xiang ⋅ Chenxi Zhai ⋅ Shu Wei ⋅ Jingjing Wu ⋅ Qunyi Xie ⋅ Xiao Tan ⋅ KunbinChen KunbinChen ⋅ Wei He
Multimodal, Video & Document Understanding ExHall # 223
Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation Poster Session 6
junxin lu ⋅ Tengfei Song ⋅ Zhanglin Wu ⋅ Lipengfei Lipengfei ⋅ Xiaowei Liang ⋅ Hui Yang ⋅ Kun Chen ⋅ NING XIE ⋅ Yunfei Lu ⋅ Jing Zhao ⋅ Shiliang Sun ⋅ Daimeng Wei
Multimodal, Video & Document Understanding ExHall # 222
Global Logic and Local Search: Dual-Stream Multimodal In-Context Learning for Verifiable Industrial Anomaly Detection Poster Session 6
Runzhi Deng ⋅ Yundi Hu ⋅ Yiming Zhong ⋅ Zhao Wang ⋅ Xixi Liu ⋅ Hongsong Wang ⋅ Caifeng Shan ⋅ Fang Zhao
Multimodal, Video & Document Understanding ExHall # 221
Personalizing MLLMs via Reinforced Multimodal Reference Game Poster Session 6
Deepayan Das ⋅ Davide Talon ⋅ Yiming Wang ⋅ Massimiliano Mancini ⋅ Elisa Ricci
Multimodal, Video & Document Understanding ExHall # 220
Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering Poster Session 6
Hsiang-Wei Huang ⋅ Fu-Chen Chen ⋅ Li-Wu Tsao ⋅ Cheng-Han Lee ⋅ Che-Chun Su ⋅ Lu Xia ⋅ Ronghui Peng ⋅ Jenq-Neng Hwang ⋅ Min Sun ⋅ Cheng-Hao Kuo
Multimodal, Video & Document Understanding ExHall # 219
See & Sniff: Learning Visuo-Olfactory Representations Poster Session 6
Seongyu Kim ⋅ Seungwoo Lee ⋅ Hyeonggon Ryu ⋅ Joon Son Chung ⋅ Arda Senocak
Multimodal, Video & Document Understanding ExHall # 218
CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA Poster Session 6
Hanseok Oh ⋅ Parishad BehnamGhader ⋅ Benno Krojer ⋅ Hyunji Lee ⋅ Paul Pu Liang ⋅ Siva Reddy ⋅ Verna Dankers
Multimodal, Video & Document Understanding ExHall # 217
SEERBench: A Spatial Ego-Exo Reasoning Benchmark for MLLMs with a Simple Yet Effective Baseline Poster Session 6
Fengyuan Lu ⋅ Jiahe Feng ⋅ Zhengyang Zhou ⋅ Shaofeng Zhang ⋅ Wenbin Li ⋅ Qi Fan ⋅ Yang Gao
Multimodal, Video & Document Understanding ExHall # 216
Multi-label Instance-level Generalised Visual Grounding in Agriculture Poster Session 6
Mohammadreza Haghighat ⋅ Alzayat Saleh ⋅ Mostafa Azghadi
Multimodal, Video & Document Understanding ExHall # 215
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs Poster Session 6
Qi Li ⋅ Yanzhe Zhao ⋅ Yongxin Zhou ⋅ Yameng Wang ⋅ Yandong Yang ⋅ Yuanjia Zhou ⋅ Jinxiang Liu
Multimodal, Video & Document Understanding ExHall # 214
EatVid-Bench: A Multimodal Fine-Grained Eating Behavior Video Dataset Poster Session 6
Xiangpeng Zheng ⋅ Zhenbo Xu ⋅ Gong Huang ⋅ Zhu Li ⋅ Qinghong Yang
Multimodal, Video & Document Understanding ExHall # 213
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs Poster Session 6
Zhiyuan Yao ⋅ Zheren Fu ⋅ Zhixiao Zheng ⋅ Jiajun Li ⋅ Yi Tu ⋅ Zhendong Mao
Multimodal, Video & Document Understanding ExHall # 212
Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction Poster Session 6
Sunqi Fan ⋅ Qingle Liu ⋅ Runqi Yin ⋅ Meng-Hao Guo ⋅ Shuojin Yang
Multimodal, Video & Document Understanding ExHall # 211
SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation Poster Session 6
Yiming Wang ⋅ Ye Chen ⋅ Hanqi Chen ⋅ Bingbing Ni
Multimodal, Video & Document Understanding ExHall # 210
Spotlight: Identifying and Localizing Video Generation Errors Using VLMs Poster Session 6
Aditya Aravind Chinchure ⋅ Sahithya Ravi ⋅ Pushkar Shukla ⋅ Vered Shwartz ⋅ Leonid Sigal
Multimodal, Video & Document Understanding ExHall # 209
VisCritic: Visual State Comparison as Process Reward for GUI Agents Poster Session 6
Jiachen Qian
Multimodal, Video & Document Understanding ExHall # 208
Improving Reasoning in Vision-Language Models via Perception Verified Self-Training Poster Session 6
Sourabh Sharma ⋅ Sonam Gupta ⋅ Sadbhawna Sadbhawna
Multimodal, Video & Document Understanding ExHall # 207
Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation Poster Session 6
Wayner Barrios ⋅ SouYoung Jin
Multimodal, Video & Document Understanding ExHall # 206
MotionAtlas: A High-Quality Dataset and Benchmark for Dense Motion Captioning Poster Session 6
Weisong Liu ⋅ Haochen Wang ⋅ Gaokuan Gaokuan ⋅ Yuhao Wang ⋅ Yikang Zhou ⋅ Zhongwei Ren ⋅ Guangcan Mai ⋅ Anran Wang ⋅ Yanwei Li ⋅ Xiangtai Li ⋅ Zhaoxiang Zhang
Multimodal, Video & Document Understanding ExHall # 205
UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation Poster Session 6
Jiahang Tu ⋅ Fengyu Yang ⋅ Chenyang Ma ⋅ Xihang Yu ⋅ Ziyao Zeng ⋅ Shaokai Wu ⋅ Hanbin Zhao ⋅ Zhi Tao ⋅ Chao Zhang ⋅ Hui Qian ⋅ Alex Wong
Multimodal, Video & Document Understanding ExHall # 204
ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning Poster Session 6
Xingjian Tao ⋅ Yiwei Wang ⋅ Yujun Cai ⋅ Yifan Song ⋅ Jing Tang
Multimodal, Video & Document Understanding ExHall # 203
LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement Poster Session 6
Tongkun Guan ⋅ Haocheng Wang ⋅ Wei Shen ⋅ Xiaokang Yang
Multimodal, Video & Document Understanding ExHall # 201
VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning Poster Session 6
Lingxiao Li ⋅ Yifan Wang ⋅ Xinyan Gao ⋅ Chen Tang ⋅ Xiangyu Yue ⋅ Chenyu You
Multimodal, Video & Document Understanding ExHall # 200
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance Poster Session 6
Duo Li ⋅ Zuhao Yang ⋅ Xiaoqin Zhang ⋅ Ling Shao ⋅ Shijian Lu
Multimodal, Video & Document Understanding ExHall # 199
MotionChain: Fine-Grained Video Motion Understanding via Structured Decomposition Poster Session 6
Hao Yang ⋅ Bo Xu ⋅ Jun Dan ⋅ Sijia Chen ⋅ Baigui Sun ⋅ Yang Liu
Multimodal, Video & Document Understanding ExHall # 198
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models Poster Session 6
Kaitong Cai ⋅ jusheng zhang ⋅ Sizhuo Ma ⋅ Bingqian Lu ⋅ Jian Wang ⋅ Keze Wang
Multimodal, Video & Document Understanding ExHall # 197
DocLayout-VL: A Foundational Model for Hierarchical, Open-set, and Promptable Document Layout Segmentation Poster Session 6
Venkata Venna ⋅ Srihari Bandarupalli ⋅ Anirudh Srinivasan ⋅ R Raghuveer ⋅ Sai Madhusudan Gunda ⋅ SANTOSH RAVI KIRAN SARVADEVABHATLA
Multimodal, Video & Document Understanding ExHall # 196
Enhancing Alignment for Unified Multimodal Models via Semantically-Grounded Supervision Poster Session 6
Jiyeong Kim ⋅ Yerim So ⋅ Hyesong Choi ⋅ Uiwon Hwang ⋅ Dongbo Min
Multimodal, Video & Document Understanding ExHall # 195
Looking Back and Forth: Cross-Image Attention Calibration and Attentive Preference Learning for Multi-Image Hallucination Mitigation Poster Session 6
Xiaochen Yang ⋅ Hao Fang ⋅ Jiawei Kong ⋅ Yaoxin Mao ⋅ Bin Chen ⋅ Shu-Tao Xia
Multimodal, Video & Document Understanding ExHall # 194
Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis Poster Session 6
Wenjing Liu ⋅ Qin Ren ⋅ Wen Zhang ⋅ Yuewei Lin ⋅ Chenyu You
Multimodal, Video & Document Understanding ExHall # 193
Unbalanced Optimal Transport for Efficient Visual Document Retrieval Poster Session 6
Hoyeon Shin ⋅ Jeongyeon Kim ⋅ Yeong Jun Koh ⋅ Yeoneung Kim ⋅ Hanul Kim
Multimodal, Video & Document Understanding ExHall # 192
BrepCoder: A Unified Multimodal Large Language Model for Multi-task B-rep Reasoning Poster Session 6
Mingi Kim ⋅ Yongjun Kim ⋅ Jungwoo Kang ⋅ Hyungki Kim
Multimodal, Video & Document Understanding ExHall # 191
HumanOmni-Speaker: Identifying Who said What and When Poster Session 6
Detao Bai ⋅ Xihan Wei ⋅ Zhiheng Ma
Multimodal, Video & Document Understanding ExHall # 190
Visual Spatial Tuning Poster Session 6
Rui Yang ⋅ ziyu zhu ⋅ Yanwei Li ⋅ Jingjia Huang ⋅ Shen Yan ⋅ Siyuan Zhou ⋅ Zhe Liu ⋅ Xiangtai Li ⋅ Shuangye Li ⋅ Wenqian Wang ⋅ Yi Lin ⋅ Hengshuang ZHAO
Multimodal, Video & Document Understanding ExHall # 189
EGVLR: Evidence-Grounded Vision–Language Reinforcement for Anomaly Reasoning Poster Session 6
SHIH-CHIH(Leo) LIN ⋅ Ying-Heng Lu ⋅ DONG YE ⋅ Shang-Hong Lai
Multimodal, Video & Document Understanding ExHall # 188
VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus Poster Session 6
Rohit Sinha ⋅ Kunal Tilaganji ⋅ Tanuja Ganu ⋅ Nagarajan Natarajan ⋅ Amit Sharma ⋅ Vineeth N Balasubramanian
Multimodal, Video & Document Understanding ExHall # 187
MindBlock: Probing Spatial Assembly and Structure in Unified Multimodal Models Poster Session 6
Baiqiao Yin ⋅ Junhao Liu ⋅ Han Yin ⋅ Heyang Yu ⋅ Tingxuan Zhang ⋅ Zhiheng Li ⋅ Chengzu Li ⋅ Jihan YANG ⋅ Manling Li ⋅ Chen Feng ⋅ Yiming Li
Multimodal, Video & Document Understanding ExHall # 186
StrucTab: A Structured Optimization Framework for Table Parsing Poster Session 6
Gengluo Li ⋅ Shangpin Peng ⋅ Chengquan Zhang ⋅ Binghong Wu ⋅ Hao Feng ⋅ Weinong Wang ⋅ Pengyuan Lyu ⋅ Huawen Shen ⋅ Xingyu Wan ⋅ Zhuotao Tian ⋅ Han Hu ⋅ Can Ma ⋅ Yu ZHOU
Multimodal, Video & Document Understanding ExHall # 185
Constructing and Interpreting Digital Twin Representations for Visual Reasoning via Large Language Models and Reinforcement Learning Poster Session 6
Yiqing Shen ⋅ Mathias Unberath
Multimodal, Video & Document Understanding ExHall # 184
Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing Poster Session 6
Sen Liang ⋅ Cong Wang ⋅ Zhentao Yu ⋅ Fengbin Guan ⋅ zhengguang zhou ⋅ Teng Hu ⋅ youliang zhang ⋅ Yuan Zhou ⋅ Xin Li ⋅ Qinglin Lu ⋅ Zhibo Chen
Multimodal, Video & Document Understanding ExHall # 183
AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking Poster Session 6
Zining Wang ⋅ Tongkun Guan ⋅ Boming Chen ⋅ Zhentao Guo ⋅ Jianqiang Liu ⋅ chao jin ⋅ Chen Duan ⋅ Kai zhou ⋅ Pengfei Yan ⋅ Wei Shen ⋅ Xiaokang Yang
Multimodal, Video & Document Understanding ExHall # 182
Experts-Guided Unbalanced Optimal Transport for ISP Learning from Unpaired and/or Paired Data Poster Session 6
Georgy Perevozchikov ⋅ Nancy Mehta ⋅ Egor Ershov ⋅ Radu Timofte
Multimodal, Video & Document Understanding ExHall # 181
Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models Poster Session 6
Shravan Venkatraman ⋅ Ritesh Thawkar ⋅ Omkar Thawakar ⋅ Rao M Anwer ⋅ Hisham Cholakkal ⋅ Salman Khan ⋅ Fahad Shahbaz Khan
Multimodal, Video & Document Understanding ExHall # 180
Mixture of Specialized Vision Experts: Unlocking Complementary Visual Insights for Faithful MLLM Reasoning Poster Session 6
Yifei Gao ⋅ Liangliang You ⋅ Jiye Xie ⋅ changwei wang ⋅ Kexue Fu ⋅ Jingyi Liu ⋅ Rongtao Xu ⋅ Zhiqiang Kou ⋅ Haoran Xu ⋅ Longxiang Gao ⋅ Yu Zhang
Multimodal, Video & Document Understanding ExHall # 179
Keeping the Evidence Chain: Semantic Evidence Allocation for Training-Free Token Pruning in Video Temporal Grounding Poster Session 6
Jiaqi Li ⋅ Shuntian Zheng ⋅ Yixian Shen ⋅ JIA-HONG HUANG ⋅ Xiaoman Lu ⋅ Minzhe Ni ⋅ Yu Guan
Multimodal, Video & Document Understanding ExHall # 177
Seeing Touch from Motion: A Unified Modality-Aware Visuo-Tactile Policy with Tactile Motion Correlation Poster Session 6
Shengqi Xu ⋅ Yang Liu ⋅ Guojin Zhong ⋅ Fanjie Wang ⋅ Hu Luo ⋅ Hanyu Zhou ⋅ WeiYao Zhang ⋅ Ziyi Ye ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Multimodal, Video & Document Understanding ExHall # 176
OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents Poster Session 6
Yang Chen ⋅ Yufan Shen ⋅ Yunwen Li ⋅ Minghao Liu ⋅ Tuney Tianyu ⋅ Bin Fu ⋅ Qunshu Lin ⋅ Zhi Yu ⋅ Botian Shi
Multimodal, Video & Document Understanding ExHall # 175
SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection Poster Session 6
Wenlin Wu ⋅ Sheng Zhou ⋅ Peipei Song ⋅ Wenhao Wang ⋅ Junbin Xiao ⋅ Xun Yang
Multimodal, Video & Document Understanding ExHall # 173
Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents Poster Session 6
Dayong Liu ⋅ Chao Xu ⋅ Weihong Chen ⋅ Suyu Zhang ⋅ Juncheng Wang ⋅ Jiankang Deng ⋅ Baigui Sun ⋅ Yang Liu
Multimodal, Video & Document Understanding ExHall # 172
Learning Sample-wise Rank-Aware Interpolation Weights for Composed Visual Data Retrieval Poster Session 6
Boseung Jeong ⋅ Taegyu Park ⋅ Donghyeon Kwon ⋅ Hyunsouk Cho ⋅ Suha Kwak
Multimodal, Video & Document Understanding ExHall # 171
TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning Poster Session 6
Ming Li ⋅ Jike Zhong ⋅ Shitian Zhao ⋅ Haoquan Zhang ⋅ Shaoheng Lin ⋅ Yuxiang Lai ⋅ Chen Wei ⋅ Konstantinos Psounis ⋅ Kaipeng Zhang
Multimodal, Video & Document Understanding ExHall # 170
Incentivizing Vision Language Models to Search for Long Video Question Answering Poster Session 6
Harsh Goel ⋅ S P Sharan ⋅ Sahil Shah ⋅ Minkyu Choi ⋅ Joungbin An ⋅ Kristen Grauman ⋅ Sandeep Chinchali
Multimodal, Video & Document Understanding ExHall # 169
Knowledge-Centric Agents for Workflow Generation in ComfyUI Poster Session 6
Zhendong Li ⋅ Lei Sun ⋅ Ruibo Ming ⋅ He Zhang ⋅ Danda Paudel ⋅ Luc Van Gool ⋅ Jinjin Gu
Multimodal, Video & Document Understanding ExHall # 168
Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference Poster Session 6
Wengyi Zhan ⋅ Mingbao Lin ⋅ Zhihang Lin ⋅ Rongrong Ji
Multimodal, Video & Document Understanding ExHall # 166
Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM Poster Session 6
Amol Harsh ⋅ Zongyan Han ⋅ Jean Lahoud ⋅ Ye Liu ⋅ Rao M Anwer ⋅ Hisham Cholakkal ⋅ Salman Khan ⋅ Fahad Shahbaz Khan
Multimodal, Video & Document Understanding ExHall # 165
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition Poster Session 6
Xiaokun Sun ⋅ Yubo Wang ⋅ Haoyu Cao ⋅ Linli Xu
Multimodal, Video & Document Understanding ExHall # 164
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models Poster Session 6
Xuanlang Dai ⋅ Yujie Zhou ⋅ Long Xing ⋅ Jiazi Bu ⋅ Xilin Wei ⋅ Yuhong Liu ⋅ Beichen Zhang ⋅ Kai Chen ⋅ Yuhang Zang
Multimodal, Video & Document Understanding ExHall # 163
NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding Poster Session 6
Hyeonjeong Ha ⋅ Jinjin Ge ⋅ Bo Feng ⋅ Kaixin Ma ⋅ Gargi Chakraborty
Multimodal, Video & Document Understanding ExHall # 162
VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs Poster Session 6
Tianxiang Jiang ⋅ Sheng Xia ⋅ Yicheng Xu ⋅ Linquan Wu ⋅ Xiangyu Zeng ⋅ Limin Wang ⋅ Yu Qiao ⋅ Yi Wang
Multimodal, Video & Document Understanding ExHall # 161
AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution Poster Session 6
Zehao Wang ⋅ Yihan Zeng ⋅ Zidong Gong ⋅ Yuanfan Guo ⋅ Feng Zhu ⋅ Hongzhi Zhang ⋅ Wei Zhang ⋅ Wangmeng Zuo
Multimodal, Video & Document Understanding ExHall # 160
AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning Poster Session 6
Kyuan Oh ⋅ Bumsoo Kim
Multimodal, Video & Document Understanding ExHall # 159
GradingBench: Evaluating End-to-End Compositional Reasoning of MLLMs for Automated Exam Grading Poster Session 6
Yuting Wang ⋅ Zixian Guo ⋅ Weihao You ⋅ Zhilong Ji ⋅ Jinfeng Bai ⋅ Wangmeng Zuo
Multimodal, Video & Document Understanding ExHall # 158
360° Image Perception with MLLMs: A Comprehensive Benchmark and a Training-Free Method Poster Session 6
Huyen Thi Thanh Tran ⋅ Van-Quang Nguyen ⋅ Farros Alferro ⋅ Kang-Jun Liu ⋅ Takayuki Okatani
Multimodal, Video & Document Understanding ExHall # 157
Co-Steer: Cross-Modal Collaborative Steering for Jailbreaking MLLMs Poster Session 6
Jingmin Zhu ⋅ Rollin Omari ⋅ Tamas Abraham ⋅ Junae Kim ⋅ Amardeep Kaur ⋅ Trung Le ⋅ Dinh Q Phung ⋅ Qiuhong Ke
Multimodal, Video & Document Understanding ExHall # 156
Staying VIGILant: Mitigating Visual Laziness in MLLMs via Information-Theoretic Alignment Poster Session 6
Xi Xiao ⋅ Chen Liu ⋅ Chih-Ting Liao ⋅ Yunbei Zhang ⋅ Qizhen Lan ⋅ YUXIANG WEI ⋅ Lin Zhao ⋅ Janet Wang ⋅ Jianyang Gu ⋅ Muchao Ye ⋅ Tianyang Wang ⋅ Hao Xu
Multimodal, Video & Document Understanding ExHall # 155
GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data Poster Session 6
Roger Ferrod ⋅ Maël Lecene ⋅ Krishna Sapkota ⋅ George Leifman ⋅ Vered Silverman ⋅ Genady Beryozkin ⋅ Sylvain Lobry
Multimodal, Video & Document Understanding ExHall # 154
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth Poster Session 6
Yuhuan Wu ⋅ Haozhe Wang ⋅ Cong Wei ⋅ Chong Peng ⋅ Fangzhen Lin ⋅ Wenhu Chen
Multimodal, Video & Document Understanding ExHall # 153
CoCo-IR: Conversational Composed Image Retrieval Poster Session 6
Shengcao Cao ⋅ Tanmaya Dabral ⋅ Zhongli Ding ⋅ Madhuri Shanbhogue ⋅ Kaifeng Chen ⋅ Zhe Li ⋅ Mojtaba Seyedhosseini ⋅ Liang-Yan Gui ⋅ Yu-Xiong Wang
Multimodal, Video & Document Understanding ExHall # 151
HippoCamp: Benchmarking Contextual Agents on Personal Computers Poster Session 6
Zhe YANG ⋅ Shulin Tian ⋅ Kairui Hu ⋅ Shuai Liu ⋅ Hoang-Nhat Nguyen ⋅ Yichi Zhang ⋅ Zujin Guo ⋅ Mengying Yu ⋅ Zinan Zhang ⋅ Jingkang Yang ⋅ Chen Change Loy ⋅ Ziwei Liu
Multimodal, Video & Document Understanding ExHall # 150
Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision Poster Session 6
Yuandong Pu ⋅ Le Zhuo ⋅ Kaiwen Zhu ⋅ Liangbin Xie ⋅ Wenlong Zhang ⋅ Xiangyu Chen ⋅ Peng Gao ⋅ Yu Qiao ⋅ Chao Dong ⋅ Yihao Liu
Multimodal, Video & Document Understanding ExHall # 149
PanoRec: Spatially-Structured Sequence Modeling for Multi-Granularity Panoramic Retrieval Poster Session 6
Zidong Cao ⋅ Ding Zhou ⋅ Wenyao Gao ⋅ Lutao Jiang ⋅ Hui Xiong
Multimodal, Video & Document Understanding ExHall # 148
GeoSolver: Scaling Test-Time Reasoning in Remote Sensing with Fine-Grained Process Supervision Poster Session 6
Sun Lang ⋅ Ronghao Fu ⋅ Zhuoran Duan ⋅ Haoran Liu ⋅ Xueyan Liu ⋅ Bo Yang
Multimodal, Video & Document Understanding ExHall # 147
ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering Poster Session 6
Zhentao Guo ⋅ Chen Duan ⋅ Tongkun Guan ⋅ Zining Wang ⋅ Kai zhou ⋅ Pengfei Yan
Multimodal, Video & Document Understanding ExHall # 146
Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model-based Agentic Reasoning Poster Session 6
Jingyun Chen ⋅ Linghan Cai ⋅ Zhikang Wang ⋅ Yi Huang ⋅ Songhan Jiang ⋅ Shenjin Huang ⋅ Hongpeng Wang ⋅ Yongbing Zhang
Multimodal, Video & Document Understanding ExHall # 145
Counting Trees from Satellite Imagery with Noisy Supervision Poster Session 6
Dimitri Gominski ⋅ Maurice Mugabowindekwe ⋅ Qiue XU ⋅ Xiaowei Tong ⋅ Martin Brandt ⋅ Hieu Le ⋅ Rasmus Fensholt ⋅ Dimitris Samaras ⋅ Loic Landrieu
Multimodal, Video & Document Understanding ExHall # 142
MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents Poster Session 6
Dannong Xu ⋅ zhongyu yang ⋅ Jun Chen ⋅ Yingfang Yuan ⋅ Ming Hu ⋅ Lei Sun ⋅ Luc Van Gool ⋅ Danda Paudel ⋅ Chun-Mei Feng
Multimodal, Video & Document Understanding ExHall # 141
Semantic Generative Tuning for Unified Multimodal Models Poster Session 6
Songsong Yu ⋅ Yuxin Chen ⋅ Ying Shan ⋅ Yanwei Li
Multimodal, Video & Document Understanding ExHall # 140
Learning Active Perception for Pixel-Space Reasoning via Visual-Intent Stratified GRPO Poster Session 6
Mingkang Zhu ⋅ Xi Chen ⋅ Senqiao Yang ⋅ Bei Yu ⋅ Hengshuang ZHAO ⋅ Jiaya Jia
Multimodal, Video & Document Understanding ExHall # 139
Enhancing Interpretability in CLIP with Optimal Transport-based Submodular Optimization for Ophthalmic Imaging Poster Session 6
Sihong Lu ⋅ Jian Yang ⋅ Lei Luo
Multimodal, Video & Document Understanding ExHall # 138
From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP Poster Session 6
Zhixing Li ⋅ Yinan Yu
Multimodal, Video & Document Understanding ExHall # 137
Evidence-Backed Video Question Answering Poster Session 6
Shijie Wang ⋅ Honglu Zhou ⋅ Ziyang Wang ⋅ Ran Xu ⋅ Caiming Xiong ⋅ Silvio Savarese ⋅ Chen Sun ⋅ Juan Carlos Niebles
Multimodal, Video & Document Understanding ExHall # 136
Video-Text Alignment Model for Sign Language Translation Poster Session 6
Junyi Hu ⋅ Zhewen He ⋅ Haomian Huang ⋅ Yi Fang ⋅ Aoxiang Yang
Multimodal, Video & Document Understanding ExHall # 135
SyntheticDoc: A Large Synthetic Dataset for Document Unwarping and Illumination Correction Poster Session 6
Daniel Woortmann ⋅ Tanguy Magne ⋅ Olga Sorkine-Hornung
Multimodal, Video & Document Understanding ExHall # 134
HERO: Enhancing Multimodal Faithfulness via Dynamic Entropy-Aware Reinforcement Learning Poster Session 6
Xiongfeng Yang ⋅ Qingan Zhang ⋅ Yuheng Zhang ⋅ Kun-Yu Lin ⋅ Jian-Fang Hu ⋅ Dongmei Jiang ⋅ WEISHI ZHENG
Multimodal, Video & Document Understanding ExHall # 133
Dense Video Understanding with Inter-tokenization Acceleration Poster Session 6
Haichao Zhang ⋅ Wenhao Chai ⋅ Shwai He ⋅ Ang Li ⋅ Yun Fu
Multimodal, Video & Document Understanding ExHall # 132
Spectral Evolution-Guided Token Pruning in Large Multimodal Models Poster Session 6
Bin Chen ⋅ Yuxiang Cai ⋅ Yadan Luo ⋅ Yi Zhang ⋅ Jianwei Yin ⋅ Zhi Chen
Multimodal, Video & Document Understanding ExHall # 131
Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning Poster Session 6
Shaofeng Yin ⋅ Jiaxin Ge ⋅ Zora Wang ⋅ Xiuyu Li ⋅ Chenyang Wang ⋅ Michael Black ⋅ Trevor Darrell ⋅ Angjoo Kanazawa ⋅ Haiwen Feng
Multimodal, Video & Document Understanding ExHall # 130
Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning Poster Session 6
Xuehui Wang ⋅ Xuankun Yang ⋅ Wei Shen
Multimodal, Video & Document Understanding ExHall # 129
RAGrasp: A Retrieval-Augmented Framework with Diversity-Aware Modeling for Dexterous Grasp Generation Poster Session 6
Zhuo Yang ⋅ Sanping Zhou ⋅ Sen Wang ⋅ Jingyi Tian ⋅ lijiayi lijiayi ⋅ Gang Hua ⋅ Le Wang
Multimodal, Video & Document Understanding ExHall # 128
ATP-Bench: Towards the Agentic Tool Planning for MLLM Interleaved Generation Poster Session 6
Yinuo Liu ⋅ Zi Qian ⋅ Heng Zhou ⋅ Jiahao Zhang ⋅ Yajie Zhang ⋅ Zhihang Li ⋅ Mengyu Zhou ⋅ Erchao Zhao ⋅ xiaoxi jiang ⋅ Guanjun Jiang
Multimodal, Video & Document Understanding ExHall # 127
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings Poster Session 6
Haonan Jiang ⋅ Yuji Wang ⋅ Yongjie Zhu ⋅ Xin Lu ⋅ Wenyu Qin ⋅ Meng Wang ⋅ Pengfei Wan ⋅ Yansong Tang
Multimodal, Video & Document Understanding ExHall # 126
GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models Poster Session 6
Jiaxin Zhang ⋅ Junjun Jiang ⋅ Haijie LI ⋅ Youyu Chen ⋅ Kui Jiang ⋅ Dave Zhenyu Chen
Multimodal, Video & Document Understanding ExHall # 125
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning Poster Session 6
Taiting Lu ⋅ Kaiyuan Lin ⋅ Yuxin Tian ⋅ Yubo Wang ⋅ Muchuan Wang ⋅ Sharique Khatri ⋅ Akshit Kartik ⋅ Yixi Wang ⋅ Amey Rane ⋅ Yida Wang ⋅ Yifan Yang ⋅ Yi-Chao Chen ⋅ yincheng jin ⋅ Mahanth Gowda
Multimodal, Video & Document Understanding ExHall # 124
Multiple Images Distract Large Multimodal Models via Attention Fragmentation Poster Session 6
Tingrui Qiao ⋅ Di Zhao ⋅ Yuzhuo Li ⋅ Bo Pang ⋅ Caroline Walker ⋅ Chris Cunningham ⋅ Yun Sing Koh
Multimodal, Video & Document Understanding ExHall # 123
AMCI: Unlock the Potential of Large Multimodal Models for Fine-grained Open-world Classification via Adaptive Memory Context Injection Poster Session 6
Xiao Liu ⋅ Haiyang Zheng ⋅ Nan Pu ⋅ Wenjing Li ⋅ Nicu Sebe ⋅ Zhun Zhong
Multimodal, Video & Document Understanding ExHall # 122
MG2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation Poster Session 6
Sijun Dai ⋅ Qiang Huang ⋅ Xiaoxing You ⋅ Jun Yu
Multimodal, Video & Document Understanding ExHall # 121
Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity Poster Session 6
Heethanjan Kanagalingam ⋅ Thenukan Pathmanathan ⋅ Mokeeshan Vathanakumar ⋅ Basim Azam ⋅ Sarah Erfani ⋅ NAVEED AKHTAR
Multimodal, Video & Document Understanding ExHall # 120
Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics Poster Session 6
Enshen Zhou ⋅ Yibo Li ⋅ Jingkun An ⋅ Jiayuan Zhang ⋅ Shanyu Rong ⋅ Mengzhen Liu ⋅ Yi Han ⋅ Yuheng Ji ⋅ Huajie Tan ⋅ Jiawei He ⋅ Pengwei Wang ⋅ Zhongyuan Wang ⋅ Cheng Chi ⋅ Lu Sheng ⋅ Shanghang Zhang
Multimodal, Video & Document Understanding ExHall # 119
Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams Poster Session 6
Weihao Bo ⋅ Shan Zhang ⋅ Yanpeng Sun ⋅ Jie Liu ⋅ Yongke Yao ⋅ Jinhao Du ⋅ Wei He ⋅ KAI ZOU ⋅ Zechao Li ⋅ Jingdong Wang
Multimodal, Video & Document Understanding ExHall # 118
OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning Poster Session 6
Haocong He ⋅ Chenfei Liao ⋅ Zichen Wen ⋅ Zihao Dongfang ⋅ Xu Zheng ⋅ Bin Ren ⋅ Chang Su ⋅ Zixin Zhang ⋅ Harold Haodong Chen ⋅ Hongfei Zhang ⋅ Weijia Li ⋅ Kailun Yang ⋅ Conghui He ⋅ Xuming Hu ⋅ Nicu Sebe ⋅ Linfeng Zhang
Multimodal, Video & Document Understanding ExHall # 117
FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval Poster Session 6
Zhenqi He ⋅ Ziqi Jiang ⋅ Yuanpei Liu ⋅ Yanghao Wang ⋅ Teng Wang ⋅ Long Chen
Multimodal, Video & Document Understanding ExHall # 116
LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression Poster Session 6
Bowen Yuan ⋅ Zijian Wang ⋅ Yadan Luo ⋅ Shijie Wang ⋅ Zi Helen Huang
Multimodal, Video & Document Understanding ExHall # 115
SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception–Memory Integration in Embodied Environments Poster Session 6
Chih-Ting Liao ⋅ Xi Xiao ⋅ Chunlei Meng ⋅ Zhangquan Chen ⋅ Yitong Qiao ⋅ Weilin Zhou ⋅ Tianyang Wang ⋅ Xu Zheng ⋅ Xin Cao
Multimodal, Video & Document Understanding ExHall # 114
DoCoG: Mask-based Multi-Type Grounded Chain-of-Thought for Document QA Poster Session 6
Sai Madhusudan Gunda ⋅ Jyothi Jinka ⋅ Hrithik Sagar ⋅ Aryan Jain ⋅ Venkata Venna ⋅ Anirudh Srinivasan ⋅ SANTOSH RAVI KIRAN SARVADEVABHATLA
Multimodal, Video & Document Understanding ExHall # 113
MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning Poster Session 6
Tuan-An To ⋅ Yuk Kwan Wong ⋅ Tuan-Anh Vu ⋅ Ziqiang Zheng ⋅ Sai Kit Yeung
Multimodal, Video & Document Understanding ExHall # 112
ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents Poster Session 6
Binjie Zhang ⋅ Mike Zheng Shou
Multimodal, Video & Document Understanding ExHall # 107
SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning Poster Session 6
xiuwei chen ⋅ Wentao Hu ⋅ Hanhui Li ⋅ Yongxin Wang ⋅ Jun Zhou ⋅ Zisheng Chen ⋅ Meng Cao ⋅ Yihan Zeng ⋅ Kui Zhang ⋅ Yu-Jie Yuan ⋅ Jianhua Han ⋅ Hang Xu ⋅ Xiaodan Liang
Multimodal, Video & Document Understanding ExHall # 106
A First Exploration of Neuromorphic OT-CFM for Multi-Speaker VSR Poster Session 6
Lin Chen ⋅ Jingping Fang ⋅ Hairui Liu ⋅ Chenyang Xu ⋅ Junhao Chen ⋅ Xiaorui Li ⋅ Weidong Cai ⋅ Xiaoming Chen
Multimodal, Video & Document Understanding ExHall # 105
Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding Poster Session 6
Shihao Wang ⋅ Shilong Liu ⋅ Yuanguo Kuang ⋅ Xinyu Wei ⋅ Yangzhou Liu ⋅ Zhiqi Li ⋅ Yunze Man ⋅ Guo Chen ⋅ Andrew Tao ⋅ Guilin Liu ⋅ Jan Kautz ⋅ Yabin Zhang ⋅ Zhiding Yu
Multimodal, Video & Document Understanding ExHall # 104
What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA Poster Session 6
Jinhwan Seo ⋅ Kyu Han ⋅ Jumin Lee ⋅ Junhyug Noh ⋅ Sung-eui Yoon
Multimodal, Video & Document Understanding ExHall # 103
Unfold The World: Factorize 4D Properties in Reinforcing Spatial Understanding Poster Session 6
Yijun Yang ⋅ Shenghe Zheng ⋅ Wenbo Li ⋅ Jianhui Liu ⋅ Haoze Sun ⋅ Yanbing Zhang ⋅ Jiaxiu Jiang ⋅ Lin Song ⋅ Haoyang Huang ⋅ Nan Duan ⋅ Lei Zhu
Multimodal, Video & Document Understanding ExHall # 102
BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models Poster Session 6
Vishal Narnaware ⋅ Ashmal Vayani ⋅ Rohit Gupta ⋅ Swetha Sirnam ⋅ Shah Mubarak
Multimodal, Video & Document Understanding ExHall # 280
ViTAL‑X: Video-Text Alignment with Cross‑Modal Temporal Edits Poster Session 6
Sethuraman T V ⋅ Savya Khosla ⋅ Onkar Susladkar ⋅ Aditi Tiwari ⋅ Seoung Wug Oh ⋅ Kushal Kafle ⋅ Joon-Young Lee ⋅ Derek Hoiem ⋅ Simon Jenni
Multimodal, Video & Document Understanding ExHall # 278
PhysAlign: Learning Physical Priors for Dynamical Event-Driven Video Generation via Representation Alignment Poster Session 6
Mengxian Li ⋅ Zhan Wang ⋅ Fan Qi ⋅ Changsheng Xu
Multimodal, Video & Document Understanding ExHall # 111
SWIFT: Spatial-Window Integrated Frequency-aware Token Pruning for Efficient MLLMs on Edge Devices Poster Session 6
Guanglai Liu ⋅ Jubo Chen ⋅ Xiaosheng Yu
Multimodal, Video & Document Understanding ExHall # 110
Vero: Open Reinforcement Learning Recipes for Visual Reasoning Poster Session 6
Gabriel Sarch ⋅ Linrong Cai ⋅ Qunzhong Wang ⋅ Haoyang Wu ⋅ Danqi Chen ⋅ Zhuang Liu
Multimodal, Video & Document Understanding ExHall # 109
Transferability Between Understanding and Generation in Unified Multimodal Models Poster Session 6
Jiwon Kang ⋅ Heeji Yoon ⋅ Jaewoo Jung ⋅ Jaewon Min ⋅ Minkyeong Jeon ⋅ Biyeon Hwang ⋅ Sangwon Jung ⋅ Seungryong Kim
Multimodal, Video & Document Understanding ExHall # 101
Towards Interactive Global Geolocation Assistant Poster Session 6
Zhiyang Dou ⋅ Zipeng Wang ⋅ Xumeng Han ⋅ Guorong Li ⋅ Zhenjun Han ⋅ Zhipei Huang
Multimodal, Video & Document Understanding ExHall # 108
HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding Poster Session 6
Wenhui Liao ⋅ Hongliang Li ⋅ Pengyu Xie ⋅ Xinyu Cai ⋅ Yufan Shen ⋅ Yi Xin ⋅ Qi Qin ⋅ Shenglong Ye ⋅ Tianbin Li ⋅ Ming Hu ⋅ Junjun He ⋅ Yihao Liu ⋅ Wenhai Wang ⋅ Min Dou ⋅ Bin Fu ⋅ Botian Shi ⋅ Yu Qiao ⋅ Lianwen Jin
Multimodal, Video & Document Understanding ExHall # 224
Calibrate Before Adapt: Training-Free Pseudo-Label Calibration for Semi-Supervised Cross-Domain Few-Shot Detection Poster Session 5
Xin Yang ⋅ Fei Zhou ⋅ Wei Wei ⋅ Lei Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 325
Capturing Spectral and Spatial Patterns for Federated Remote Sensing Segmentation Poster Session 5
Yixin Xue ⋅ Wenke Huang ⋅ Haonan Guo ⋅ Bo Du
Open-World Recognition, Segmentation & Transfer ExHall # 327
FAIR: Feature-Augmented Implicit Regularization for AI-generated Fake Image Detection Poster Session 5
Md Redwanul Haque ⋅ Manzur Murshed ⋅ Manoranjan Paul ⋅ Tsz-Kwan Lee
Open-World Recognition, Segmentation & Transfer ExHall # 328
Noise-Robust Facial Expression Recognition via Mamba-driven Neighbor Weight Refinement Poster Session 5
Yuzhuang Yang ⋅ Xiaolin Tian ⋅ Qigong Sun
Open-World Recognition, Segmentation & Transfer ExHall # 329
Learning to Attract and Repel: Dual Quality Margin Learning for Face Recognition (DQM-Face) Poster Session 5
El Ouanas Belabbaci ⋅ Bhavesh Wani ⋅ Philipp Terhörst
Open-World Recognition, Segmentation & Transfer ExHall # 330
General Incomplete Multimodal Learning via Dynamic Quality Perception Poster Session 5
Xiangyu Meng ⋅ shicai wei
Open-World Recognition, Segmentation & Transfer ExHall # 331
From Local Geometry to Global Pseudo-Labeling for Robust Positive–Unlabeled Learning under Covariate Shift Poster Session 5
Firas Gabetni ⋅ Alexandre Rocchi--Henry ⋅ Ziyi LIU ⋅ Nacim Belkhir ⋅ Gianni Franchi
Open-World Recognition, Segmentation & Transfer ExHall # 332
SCDL: Synergistic Confidence-Dispersion Learning for Semi-Supervised Video Polyp Segmentation Poster Session 5
yuanqin he ⋅ Yuhua Zhang ⋅ Huisi Wu ⋅ Jing Qin
Open-World Recognition, Segmentation & Transfer ExHall # 333
OPAL: Orthonormal Prototype Alignment Learning for Interpretable Image Classification Poster Session 5
Ilán Carretero ⋅ Gustavo ANGULO ⋅ Rocío Amor ⋅ Valery Naranjo
Open-World Recognition, Segmentation & Transfer ExHall # 334
Bayesian Uncertainty Attribution-Guided Fine-Tuning for Open-Set Action Recognition Poster Session 5
Shehan Senavirathna ⋅ Hongji Guo ⋅ Qiang Ji
Open-World Recognition, Segmentation & Transfer ExHall # 336
SFM: Taming State Space Models for Text-to-Motion via Spatial-Frequency Modeling Poster Session 5
Shang Gao ⋅ Haicheng Liao ⋅ Wenshuo Chen ⋅ Yumu Xie ⋅ Jiaxun Zhang ⋅ Bin Rao ⋅ Chengyue Wang ⋅ Yanchen Guan ⋅ Zhiyong Cui ⋅ Shiqi Ou ⋅ Yutao Yue ⋅ Zhenning Li
Open-World Recognition, Segmentation & Transfer ExHall # 250
Defect-aware Hybrid Prompt Optimization for Zero-Shot Multi-type Anomaly Detection and Segmentation Poster Session 5
Nadeem Nazer ⋅ Hongkuan Zhou ⋅ Lavdim Halilaj ⋅ Ylli Sadikaj ⋅ Steffen Staab
Open-World Recognition, Segmentation & Transfer ExHall # 335
Learning Structurally Consistent Representations for Multi-View Radar Semantic Segmentation Poster Session 5
ALI ZIA ⋅ Muhammad Umer Ramzan ⋅ Abdelwahed Khamis ⋅ Usman Ali ⋅ Abdul Rehman
Open-World Recognition, Segmentation & Transfer ExHall # 326
HVA-Fusion:Hierarchical Velocity-Aware 4D Radar-LiDAR Fusion for Robust 3D Object Detection Poster Session 5
Jingxian Wu ⋅ Lu Wang ⋅ Lisheng Xu ⋅ Jun Cheng
Open-World Recognition, Segmentation & Transfer ExHall # 292
CloSeR: Unified Relational Distillation from Closed-Set Teachers for Category Discovery Poster Session 5
Yuanpei Liu ⋅ Zhenqi He ⋅ Jialu Tang ⋅ Kai Han
Open-World Recognition, Segmentation & Transfer ExHall # 177
SWSL: Semantic-aware Weakly Supervised Learning for 3D Motion Generation using 2D Motion Data Poster Session 5
Zhicheng Shi ⋅ Tuo Feng ⋅ Wenguan Wang ⋅ Yi Yang
Open-World Recognition, Segmentation & Transfer ExHall # 271
Incentive Noise and Structural Prior Infusion for Multi-Modal Object Re-Identification Poster Session 5
Weixiang Zhou ⋅ Yuhao Wang ⋅ Xingguo Xu ⋅ Cong Wang ⋅ Weizhen Zhou ⋅ Zhixun Su ⋅ Jinshan Pan
Open-World Recognition, Segmentation & Transfer ExHall # 189
ReliefSAM: A Geometry-Augmented Multi-Prior Adapter for Bas-Relief Segmentation Poster Session 5
YIHANG CHEN ⋅ Xiang Lyu ⋅ Rui Xu ⋅ Jiao PAN ⋅ Fadjar Thufail ⋅ Brahmantara Brahmantara ⋅ JIAQING LIU ⋅ Satoshi Tanaka ⋅ Liang Li
Open-World Recognition, Segmentation & Transfer ExHall # 260
Recurrent Cross-View Object Geo-Localization Poster Session 5
Xiaohan Zhang ⋅ Siyuan Cao ⋅ Xiaokai Bai ⋅ Yiming Li ⋅ Zhangkai Shen ⋅ Zhe Wu ⋅ Lun Luo ⋅ Qi Ming ⋅ Xiaoxi Hu ⋅ Hui-Liang Shen
Open-World Recognition, Segmentation & Transfer ExHall # 219
QASA: Quality-Guided K-Adaptive Slot Attention for Unsupervised Object-Centric Learning Poster Session 5
Tianran Ouyang ⋅ Xingping Dong ⋅ Jing Zhang ⋅ Mang Ye ⋅ Kaihao Zhang ⋅ Bo Du
Open-World Recognition, Segmentation & Transfer ExHall # 263
Wavelet-Driven Cross-Domain Consistency for Mixed-Supervised 3D Tumor Segmentation Poster Session 5
Tianzhong Lan ⋅ Weili Jiang ⋅ Yisong Liu ⋅ Yi Zhou ⋅ Junqi Bai ⋅ Si Yong Yeo ⋅ Xulei Yang ⋅ Min Zhu
Open-World Recognition, Segmentation & Transfer ExHall # 161
Thermo-JEPA: Learning a Geometry-Grounded Thermal World Model via Cross-Modal Privileged Masking Poster Session 5
Biwen Yang ⋅ Jin Zhang ⋅ Zhe Cao ⋅ Ruiheng Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 162
Cross-token Guidance Transformer for Weakly Supervised Object Localization Poster Session 5
Zhiwei Chen ⋅ Yiran Nie ⋅ Ruize Han ⋅ Qinqin Zhou
Open-World Recognition, Segmentation & Transfer ExHall # 163
Adaptive Spectrum-Aware Feature Disentangled Network for Small Object Detection Poster Session 5
Yang Guo ⋅ Zihan Yang ⋅ Feifei Kou ⋅ Yulan Hu ⋅ Ran Zhang ⋅ Siyuan Yao
Open-World Recognition, Segmentation & Transfer ExHall # 164
ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding Poster Session 5
Chen Kai ⋅ Ming Dai ⋅ Wenxuan Cheng ⋅ Wankou Yang
Open-World Recognition, Segmentation & Transfer ExHall # 165
OpenPanoD: Aligning Multimodal Prompts and Spherical Representations for Open-Vocabulary Panoramic Detection Poster Session 5
Hang Xu
Open-World Recognition, Segmentation & Transfer ExHall # 166
Multi-modality Image Fusion under Adverse Weather: Mask-Guided Feature Restoration and Interaction Poster Session 5
Xilai Li ⋅ Xiaosong Li ⋅ Haishu Tan ⋅ Tao Ye ⋅ Huafeng Li ⋅ Hongbin Wang
Open-World Recognition, Segmentation & Transfer ExHall # 167
CoT-PL: Chain-of-Thought Pseudo-Labeling for Open-Vocabulary Object Detection Poster Session 5
Hojun Choi ⋅ Youngsun Lim ⋅ Jaeyo Shin ⋅ Hyunjung Shim
Open-World Recognition, Segmentation & Transfer ExHall # 168
LGD-Net: Leader-Guided Cross-Modal Dynamics for Hyperspectral and Panchromatic Image Fusion Poster Session 5
Raj kumar ⋅ Balasubramanian Raman ⋅ Pravendra Singh
Open-World Recognition, Segmentation & Transfer ExHall # 169
RT-SDGOD: Real-Time Single-Domain Generalized Object Detection Poster Session 5
Yupeng Zhang ⋅ Fangzhuo Gao ⋅ Ruize Han ⋅ Wei Feng ⋅ Liang Wan
Open-World Recognition, Segmentation & Transfer ExHall # 170
A Dual-space Patch-driven Complementary Learning Framework for Semi-supervised Multi-organ Segmentation Poster Session 5
Baixi Liang ⋅ Shuohong Xia ⋅ Sihao Li ⋅ Yunyun Yang
Open-World Recognition, Segmentation & Transfer ExHall # 171
Selective Synergistic Learning for Video Object-Centric Learning Poster Session 5
WonJun Moon ⋅ Jae-Pil Heo
Open-World Recognition, Segmentation & Transfer ExHall # 172
Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation Poster Session 5
Numair Nadeem ⋅ Saeed Anwar ⋅ Muhammad Asad ⋅ Abdul Bais
Open-World Recognition, Segmentation & Transfer ExHall # 173
Disentangling and Reusing Interaction Cues for Zero-Shot HOI Detection Poster Session 5
Jie Gu ⋅ He-Yang Xu ⋅ Hongxiang Gao ⋅ Chengyu Liu
Open-World Recognition, Segmentation & Transfer ExHall # 174
BEVOpen3D: Towards Open-World 3D Object Detection in Bird's-Eye-View Poster Session 5
Huyue Zeng ⋅ Jiaqi Yang ⋅ Xian-Feng Han
Open-World Recognition, Segmentation & Transfer ExHall # 175
SGP2: Coarse-to-Fine Controllable Multimodal Remote Sensing Image Generation Poster Session 5
Pengyu Chen ⋅ Xi Yang ⋅ Nannan Wang
Open-World Recognition, Segmentation & Transfer ExHall # 176
UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation Poster Session 5
Ziyi Wang ⋅ Xinshun Wang ⋅ Shuang Chen ⋅ Yang Cong ⋅ Mengyuan Liu
Open-World Recognition, Segmentation & Transfer ExHall # 178
Degradation-Agnostic Clarity Learning for Unpaired Image Dehazing Poster Session 5
Zhiyuan Song ⋅ Hannan Lu ⋅ Haiqian Han ⋅ Bo Li ⋅ Chang Liu ⋅ Pengxu Wei ⋅ Xiangyang Ji ⋅ Liang Lin
Open-World Recognition, Segmentation & Transfer ExHall # 179
HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training Poster Session 5
Maciej Wozniak ⋅ Jesper Ericsson ⋅ Hariprasath Govindarajan ⋅ Truls Nyberg ⋅ Thomas Gustafsson ⋅ Patric Jensfelt ⋅ Olov Andersson
Open-World Recognition, Segmentation & Transfer ExHall # 180
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition Poster Session 5
Geo Ahn ⋅ Inwoong Lee ⋅ Taeoh Kim ⋅ Minho Shim ⋅ Dongyoon Wee ⋅ Jinwoo Choi
Open-World Recognition, Segmentation & Transfer ExHall # 181
ReMoMask: Retrieval-Augmented Masked Motion Generation Poster Session 5
Zhengdao Li ⋅ siheng wang ⋅ Zeyu Zhang ⋅ Hao Tang
Open-World Recognition, Segmentation & Transfer ExHall # 182
Decoding Multimodal Causality: End-to-End Multimodal Mediation Pathways Inference Poster Session 5
Yulong Li ⋅ Xiwei Liu ⋅ Niranjana Menon ⋅ Yuxuan Zhang ⋅ Jianxu Chen ⋅ Rong Xia ⋅ Haolin Yang ⋅ Peixin Guo ⋅ Yutong Xie ⋅ Imran Razzak
Open-World Recognition, Segmentation & Transfer ExHall # 183
T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability Poster Session 5
Savya Khosla ⋅ Sethuraman T V ⋅ Aryan Chadha ⋅ Alex Schwing ⋅ Derek Hoiem
Open-World Recognition, Segmentation & Transfer ExHall # 184
VarProtoAD: Variational Prototype-Conditioned Prompting for Zero-Shot Anomaly Detection Poster Session 5
Mengyang Zhao ⋅ Zhuolin He ⋅ Haiyang Yu ⋅ Teng Fu ⋅ Ke Niu ⋅ Xiangyang Xue
Open-World Recognition, Segmentation & Transfer ExHall # 185
What Images Cannot Say: Language-Guided Olfactory Representation Learning Poster Session 5
Eleftherios Tsonis ⋅ Xi WANG ⋅ Vicky Kalogeiton
Open-World Recognition, Segmentation & Transfer ExHall # 186
Explicit Semantic–Spatial Alignment for Open-Vocabulary Object Detection Poster Session 5
Pengyang Su ⋅ Weihong Ren ⋅ Shuhuan Han ⋅ Qian Dong ⋅ Haoran Xu ⋅ Xi Ai ⋅ Zijian Wang ⋅ Zhiyong Wang ⋅ Honghai Liu
Open-World Recognition, Segmentation & Transfer ExHall # 187
Distribution-Aware Feature Selection for Post-hoc Out-of-Distribution Detection Poster Session 5
Max Gutbrod ⋅ David Rauber ⋅ Christoph Palm
Open-World Recognition, Segmentation & Transfer ExHall # 188
DAP: Doppler-aware Point Network for Heterogeneous mmWave Action Recognition Poster Session 5
Jiaying Lin ⋅ Shiman Wu ⋅ Jinfu Liu ⋅ Can Wang ⋅ Mengyuan Liu
Open-World Recognition, Segmentation & Transfer ExHall # 190
FSD-Net: Foundation-Guided Spatiotemporal Distillation for Video Polyp Segmentation Poster Session 5
Yahang Leng ⋅ Shiquan Min ⋅ Chengzhou Li
Open-World Recognition, Segmentation & Transfer ExHall # 191
CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection Poster Session 5
Junhao Cai ⋅ Deyu Zeng ⋅ Junhao Pang ⋅ JunYu Chen ⋅ Qiwei Liang ⋅ Xiaopin ZHONG ⋅ Zongze Wu
Open-World Recognition, Segmentation & Transfer ExHall # 192
From Visual Primitives to Semantic Masks: Fine-Grained Visual-Linguistic Alignment for Open-Vocabulary Remote Sensing Image Segmentation Poster Session 5
Yuchen Deng ⋅ Yang Xu ⋅ Zhihui Wei ⋅ Zebin Wu
Open-World Recognition, Segmentation & Transfer ExHall # 193
PhysFlowNet: Learning Canonical Latent Manifolds via Spatio-Spectral Physics Priors for Underwater Object Detection Poster Session 5
XUETING Liu ⋅ Haoyu Ji ⋅ Wenze Huang ⋅ Zhihao Yang ⋅ Yu Gao ⋅ Weihong Ren ⋅ Zhiyong Wang ⋅ Honghai Liu
Open-World Recognition, Segmentation & Transfer ExHall # 194
UniStitch: Unifying Semantic and Geometric Features for Image Stitching Poster Session 5
Yuan Mei ⋅ Lang Nie ⋅ Kang Liao ⋅ Yunqiu Xu ⋅ Chunyu Lin ⋅ Bin Xiao
Open-World Recognition, Segmentation & Transfer ExHall # 195
DA-F2F: Domain-Adaptive Object Detection with Feature-to-Feature Modulation and Alignment Poster Session 5
HoTaek Oh ⋅ Hee-Jun Kim ⋅ Hyo-Jun Lee
Open-World Recognition, Segmentation & Transfer ExHall # 196
Intra-Class Consistency Guided Class-Agnostic Event Segmentation Poster Session 5
Zhipeng Sui ⋅ Haiqing Hao ⋅ Weihua He ⋅ Wenhui Wang
Open-World Recognition, Segmentation & Transfer ExHall # 197
Rethinking IRSTD: Single-Point Supervision Guided Encoder-only Framework is Enough for Infrared Small Target Detection Poster Session 5
Rixiang Ni ⋅ Boyang Li ⋅ Chen Jun ⋅ Zhijie Chen ⋅ Feiyu Ren ⋅ Yuji Wang ⋅ Haoyang Yuan ⋅ Wujiao He ⋅ Wei An
Open-World Recognition, Segmentation & Transfer ExHall # 198
Towards Unsupervised Multi-modal Semantic Segmentation Poster Session 5
Haitian Zhang ⋅ Thai Nguyen ⋅ Xiangyuan Wang ⋅ Mohan Liu ⋅ Addison Wang
Open-World Recognition, Segmentation & Transfer ExHall # 199
XSemanticFlow: Cross Object Semantic Alignment for Zero-shot Manipulation Poster Session 5
Junyu Nan ⋅ Noam Eshed ⋅ Brian Okorn ⋅ Kris Kitani
Open-World Recognition, Segmentation & Transfer ExHall # 200
FD²: A Dedicated Framework for Fine-Grained Dataset Distillation Poster Session 5
Hongxu Ma ⋅ Guang Li ⋅ Shijie Wang ⋅ DONGZHAN ZHOU ⋅ Baoli Sun ⋅ Takahiro Ogawa ⋅ Miki Haseyama ⋅ Zhihui Wang
Open-World Recognition, Segmentation & Transfer ExHall # 201
Progressively Spiral Mamba Fusion for Multimodal Tracking Poster Session 5
Zixuan Wang ⋅ Baojie Fan ⋅ Jiajun Ai ⋅ Wenzhang Zhou
Open-World Recognition, Segmentation & Transfer ExHall # 202
DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation Poster Session 5
Sung-Hoon Yoon ⋅ Hoyong Kwon ⋅ Changgyoon Oh ⋅ KUK-JIN YOON
Open-World Recognition, Segmentation & Transfer ExHall # 203
From Predictions to Embeddings: Dual Knowledge Distillation for Instance-Dependent Partial Label Learning Poster Session 5
Lilong Duan ⋅ Ke Wang ⋅ Yao Zhang ⋅ Jun Tang
Open-World Recognition, Segmentation & Transfer ExHall # 204
Safe Generalization: Mitigating Catastrophic Forgetting in Single-Source Multi-Organ Segmentation via Collaborative Causal Learning Poster Session 5
Yucheng Song ⋅ Ruoxi Yu ⋅ Feng Shu ⋅ Cheng Huang ⋅ HaoKang Ding ⋅ Zhifang Liao
Open-World Recognition, Segmentation & Transfer ExHall # 205
DecepGPT: Schema-Driven Deception Detection with Multicultural Datasets and Robust Multimodal Learning Poster Session 5
JIAJIAN HUANG ⋅ Dongliang Zhu ⋅ Zitong Yu ⋅ Hui Ma ⋅ Jiayu Zhang ⋅ Chunmei Zhu ⋅ Xiaochun Cao
Open-World Recognition, Segmentation & Transfer ExHall # 206
Online Versatile Incremental Learning: Towards Class and Domain-Agnostic Adaptation at Any Time Poster Session 5
Jaeho Lee ⋅ Jun-Yeong Moon ⋅ Min-Yeong Park ⋅ Jung Uk Kim ⋅ Gyeong-Moon Park
Open-World Recognition, Segmentation & Transfer ExHall # 207
Multi-scale Object-Aware Gaze Estimation via Geometric Reasoning Poster Session 5
Jiajie Mi ⋅ Xinyu Liu ⋅ Mengke Song ⋅ Chenglizhao Chen
Open-World Recognition, Segmentation & Transfer ExHall # 208
CHIMERA: Adaptive Cache Injection and Semantic Anchor Prompting for Zero-shot Image Morphing with Morphing-oriented Metrics Poster Session 5
Dahyeon Kye ⋅ Jeahun Sung ⋅ Minkyu Jeon ⋅ Jihyong Oh
Open-World Recognition, Segmentation & Transfer ExHall # 209
When Specialists Meet Generalists: Segmenter-Coordinated Asymmetric Learning for Label-Deficient Concealed Object Segmentation Poster Session 5
Chunming He ⋅ Dingming Zhang ⋅ Longxiang Tang ⋅ Ziyun Yang ⋅ Fengyang Xiao ⋅ Sina Farsiu
Open-World Recognition, Segmentation & Transfer ExHall # 210
Enhancing prompt-image alignment evaluations via cyclic mutual information maximization Poster Session 5
Xingran Liao ⋅ Duanyu Feng ⋅ Mingliang Zhou ⋅ Sam Kwong ⋅ Weisi Lin
Open-World Recognition, Segmentation & Transfer ExHall # 211
Learning Accurate Segmentation Purely from Self-Supervision Poster Session 5
Zuyao You ⋅ Zuxuan Wu ⋅ Yu-Gang Jiang
Open-World Recognition, Segmentation & Transfer ExHall # 212
InfraNet: Quality-Aware RGB Guidance for Infrared Object Detection Poster Session 5
Zichao Feng ⋅ Haodong Zhu ⋅ JingYing Yang ⋅ Linlin Yang ⋅ Yangyang Ren ⋅ Sheng Xu ⋅ Yuguang Yang ⋅ Xuhui Liu ⋅ Juan Zhang ⋅ Tian Wang ⋅ Baochang Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 213
DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection Poster Session 5
Gautam Rajendrakumar Gare ⋅ Neehar Peri ⋅ Matvei Popov ⋅ Shruti Jain ⋅ John Galeotti ⋅ Deva Ramanan
Open-World Recognition, Segmentation & Transfer ExHall # 214
Hierarchical Style Aggregation for Versatile Chinese Handwriting Generation Poster Session 5
Jiangpeng Wang ⋅ Fei Gao ⋅ Nannan Wang
Open-World Recognition, Segmentation & Transfer ExHall # 215
Fragmented Text Is Insufficient for Image Representation: Fine-Grained Correspondence in Multimodal Dataset Distillation Poster Session 5
Jingwei Fang ⋅ Yaxin Hou ⋅ Bo Han ⋅ Xu Zhang ⋅ Hui LIU ⋅ Junhui Hou ⋅ Yuheng Jia
Open-World Recognition, Segmentation & Transfer ExHall # 216
RA-SOD: Reliability-Aware RGB-T Salient Object Detection under Modality Degradation Poster Session 5
Hongbo Gao ⋅ Zhengyu Li ⋅ XUERU NIE ⋅ Dihao Zhu ⋅ lijun zhao ⋅ Yunke Wang ⋅ Chang Xu
Open-World Recognition, Segmentation & Transfer ExHall # 217
NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models Poster Session 5
Yingjie Zhang ⋅ Shuai Li ⋅ Peng Wang
Open-World Recognition, Segmentation & Transfer ExHall # 218
MoMCE: Mixture of Modality and Cue Experts for Multimodal Deception Detection Poster Session 5
Dongliang Zhu ⋅ Ruimin Hu ⋅ Zitong Yu ⋅ Xiaobao Guo ⋅ Mei Wang ⋅ Shuo Ye ⋅ Fei Ma ⋅ Xiaochun Cao
Open-World Recognition, Segmentation & Transfer ExHall # 220
Prototype-Conditioned Imagination for Compositional Zero-Shot Learning Poster Session 5
Yifan Zhu ⋅ Haofeng Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 221
Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training Poster Session 5
Shangbo Yuan ⋅ Jie Xu ⋅ Xiaofeng Zhu ⋅ Na Zhao
Open-World Recognition, Segmentation & Transfer ExHall # 222
When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization Poster Session 5
Tianqi Li ⋅ Wenyu Fang ⋅ Xin He ⋅ Xue Geng ⋅ Xu Cheng ⋅ Yun Liu
Open-World Recognition, Segmentation & Transfer ExHall # 223
VCP-DCN: Beyond Visual Concealed Property via Depth Collaborative Network for Camouflaged Object Detection Poster Session 5
Songsong Duan ⋅ Xi Yang ⋅ Nannan Wang
Open-World Recognition, Segmentation & Transfer ExHall # 224
Maximum Spanning Tree Guided Confidence and Sparse Graph for Robust Noisy Label Learning Poster Session 5
Gengfeng Chen ⋅ Xu Liu ⋅ Boyi Peng ⋅ Liangqiu Xiao ⋅ Weicheng Xie ⋅ Siyang Song ⋅ Zitong Yu ⋅ Laizhong Cui ⋅ Linlin Shen
Open-World Recognition, Segmentation & Transfer ExHall # 225
PriSM: Parsing and Style-Mixed Consistency for Unsupervised Domain Adaptation in Facial Landmark Detection Poster Session 5
Chieh-Yu Yang ⋅ Hou-Ning Hu ⋅ Sykai Chen ⋅ Yu-Lun Liu ⋅ Yen-Yu Lin
Open-World Recognition, Segmentation & Transfer ExHall # 226
BIP: Bi-level Information Transfer and Completion Prompting for Visual Recognition with Missing Modalities Poster Session 5
Haoran Fan ⋅ Xu Han ⋅ Xianglong Bao ⋅ Zheng Gao ⋅ Qi Fan ⋅ Yang Song ⋅ Jiaojiao Jiang
Open-World Recognition, Segmentation & Transfer ExHall # 227
Geometric Regularization for Long-Tailed Semi-Supervised Learning via Gaussian Feature Bridges Poster Session 5
Hongyang He ⋅ Xinyuan Song ⋅ Yan Zhong ⋅ Daizong Liu ⋅ Yanbin Li ⋅ Yangfan He ⋅ Wenqiao Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 228
Preserving Knowledge across Space and Time for Continual Video Deepfake Detection Poster Session 5
Taehoon Kim ⋅ Jongwook Choi ⋅ Heejae Jo ⋅ Byungmin Park ⋅ Jongwon Choi
Open-World Recognition, Segmentation & Transfer ExHall # 229
ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation Poster Session 5
Qingze He ⋅ Fagui Liu ⋅ Dengke Zhang ⋅ Qingmao Wei ⋅ Quan Tang
Open-World Recognition, Segmentation & Transfer ExHall # 230
Amplify, Aggregate, and Adjust: VideoMAE-based Holistic-Subtle Aggregation for Micro-Action Recognition Poster Session 5
Yan Zhang ⋅ Nan Pu ⋅ Wenjing Li ⋅ Zhun Zhong ⋅ Meng Wang
Open-World Recognition, Segmentation & Transfer ExHall # 231
Local-to-global Cross-modal Coordination for Self-supervised RGB-T Tracking Poster Session 5
Yueying Zhang ⋅ Timing Li ⋅ Bing Cao ⋅ Pengfei Zhu
Open-World Recognition, Segmentation & Transfer ExHall # 232
Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation Poster Session 5
Tianyu Zhu ⋅ Yingping Liang ⋅ Hesong Li ⋅ Ying Fu
Open-World Recognition, Segmentation & Transfer ExHall # 233
Beyond Alignment: A Generative Matching Paradigm via Flow Matching for Zero-Shot Skeleton-Based Action Recognition Poster Session 5
Xuan Liu ⋅ Cong Wu ⋅ Wei Fang ⋅ Zhenhua Feng
Open-World Recognition, Segmentation & Transfer ExHall # 234
Saber: Anchoring Semantics to Scale-Aware Kinetic Salience for Zero-Shot Skeleton Action Recognition Poster Session 5
Zhu Yongquan ⋅ Biru Ning ⋅ Jingyu Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 235
Path-JEPA: Path Signature Based Predictive Learning for Skeleton Action Recognition Poster Session 5
Ashutosh Singh ⋅ Ashish Singh
Open-World Recognition, Segmentation & Transfer ExHall # 236
OP3DSG: Open-vocabulary Part-aware 3D Scene Graph Generation for Real-world Environments Poster Session 5
Yirum Kim ⋅ Ue-Hwan Kim
Open-World Recognition, Segmentation & Transfer ExHall # 237
Mitigate Modality-Asymmetric Forgetting via Stabilizing Visual Representations in CLIP-Based Class-Incremental Learning Poster Session 5
Yuanhong Zhang ⋅ Yanan Chen ⋅ Xin Zhang ⋅ Zhaoyang Wang ⋅ Weizhan Zhang ⋅ Muyao Yuan ⋅ Hongjin Niu ⋅ LAN MA ⋅ Yuan Gao ⋅ Joey Tianyi Zhou
Open-World Recognition, Segmentation & Transfer ExHall # 238
Towards Sparsely Annotated Open World Object Detection Poster Session 5
HEEJU HAN ⋅ AJEONG KIM ⋅ Jinsun Park
Open-World Recognition, Segmentation & Transfer ExHall # 239
MAVFusion: Efficient Infrared and Visible Video Fusion via Motion-Aware Sparse Interaction Poster Session 5
Xilai Li ⋅ Weijun Jiang ⋅ Xiaosong Li ⋅ Yang Liu ⋅ Hongbin Wang ⋅ Tao Ye ⋅ Huafeng Li ⋅ Haishu Tan
Open-World Recognition, Segmentation & Transfer ExHall # 240
Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker Poster Session 5
Zongjian Wu ⋅ Lei Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 241
Learning Structured Visual Compositional Representations for Weakly Supervised Referring Expression Comprehension Poster Session 5
Lian Xu ⋅ Mohammed Bennamoun ⋅ Farid Boussaid ⋅ Hamid Laga ⋅ Yulan Guo ⋅ Dan Xu
Open-World Recognition, Segmentation & Transfer ExHall # 242
Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition Poster Session 5
Lars Doorenbos ⋅ Duc Vu ⋅ Serdar Ozsoy ⋅ Juergen Gall
Open-World Recognition, Segmentation & Transfer ExHall # 243
Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts Poster Session 5
Taewook Kang ⋅ Taeheon Kim ⋅ Donghyun Shin ⋅ Jonghyun Choi
Open-World Recognition, Segmentation & Transfer ExHall # 244
Mask-guided Semantic Alignment: Robust Learning with Noisy Labels via Temporal Attention Stability Poster Session 5
Yubo Nian ⋅ Can Gao
Open-World Recognition, Segmentation & Transfer ExHall # 245
Rethinking Cross-Spectral Image Generation via Shared-Specific Representation Poster Session 5
Haining Wang ⋅ Na Li ⋅ Huijie Zhao ⋅ Yifan Da ⋅ Yan Wen ⋅ Yi Su ⋅ Yuqiang Fang
Open-World Recognition, Segmentation & Transfer ExHall # 246
Dual-Margin Embedding for Fine-Grained Long-Tailed Plant Taxonomy Poster Session 5
Cheng-Yaw Low ⋅ Heejoon Koo ⋅ Jaewoo Park ⋅ Meeyoung Cha
Open-World Recognition, Segmentation & Transfer ExHall # 247
FSDC-DETR: A Frequency-Spatial Domain Collaborative DETR for Small-Object Detection Poster Session 5
Aiwen Liu ⋅ Chengguang Zhu ⋅ Gang Wang ⋅ Dandan Zhu ⋅ Haodong Lin ⋅ Yan Wang ⋅ Huiyu Zhou ⋅ Zhengyi Pan
Open-World Recognition, Segmentation & Transfer ExHall # 248
Purify then Guide: Rethinking Domain Generalization for Multimodal Face Anti-Spoofing Poster Session 5
Yingjie Ma ⋅ Xun Lin ⋅ Zitong Yu ⋅ Haonan Wang ⋅ Ruixin Zhang ⋅ Shouhong Ding ⋅ Xin Liu ⋅ Xiaochen Yuan ⋅ Weicheng Xie ⋅ Linlin Shen
Open-World Recognition, Segmentation & Transfer ExHall # 249
MoAKE: Toward Unified All-in-One Action Quality Assessment via Mixture of Action Knowledge Experts Poster Session 5
Huangbiao Xu ⋅ Huanqi Wu ⋅ Xiao Ke ⋅ Jiaxin Cai ⋅ Junyi Wu ⋅ Jinglin Xu
Open-World Recognition, Segmentation & Transfer ExHall # 251
ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving Poster Session 5
Dingyi Yao ⋅ Xinqi Zhang ⋅ Lihui Peng ⋅ Jianming HU ⋅ Danya Yao ⋅ Yi ZHANG
Open-World Recognition, Segmentation & Transfer ExHall # 252
Warp-free Cross-view Geo-localization via Feature-space Consensus Mining Poster Session 5
Zhuo Song ⋅ Lian Xu ⋅ Runqing Jiang ⋅ Kunhong Li ⋅ Yongjian Zhang ⋅ Ye Zhang ⋅ Yulan Guo
Open-World Recognition, Segmentation & Transfer ExHall # 253
GenHOI: Generalized Hand-Object Pose Estimation with Occlusion Awareness Poster Session 5
HUI YANG ⋅ Wei Sun ⋅ Jian Liu ⋅ Jian Xiao ⋅ Tao Xie ⋅ Hossein Rahmani ⋅ Ajmal Mian ⋅ Nicu Sebe ⋅ Gim Hee Lee
Open-World Recognition, Segmentation & Transfer ExHall # 254
Rethinking Pseudo-Labels: Multi-Granularity Supervision for Domain Adaptive Object Detection Poster Session 5
Haohao Ma ⋅ Weimin Lu ⋅ Qiqi Ge
Open-World Recognition, Segmentation & Transfer ExHall # 255
Hierarchical Prompt Injector for Domain Generalization Segmentation Poster Session 5
Xin Kun Lin ⋅ Ruoyu Guo ⋅ Jiaqi Guo ⋅ Maurice Pagnucco ⋅ Yang Song
Open-World Recognition, Segmentation & Transfer ExHall # 256
Group3D: MLLM-Guided Semantic Grouping for Open-Vocabulary 3D Object Detection Poster Session 5
Youbin Kim ⋅ Jinho Park ⋅ Hogun Park ⋅ Eunbyung Park
Open-World Recognition, Segmentation & Transfer ExHall # 257
Context-Aware Joint Alignment for Cross-Scene Hyperspectral Image Classification Poster Session 5
Boshan Shi ⋅ JiaXin Chen ⋅ Yanbo Liu ⋅ Youqiang Zhang ⋅ Guo Cao
Open-World Recognition, Segmentation & Transfer ExHall # 258
QST-SAM: Leveraging Cross-modal Instructions for Few-shot Referring Video Object Segmentation Poster Session 5
Xin Liu ⋅ Weijia Li ⋅ Tao Chen ⋅ Hongsong Wang ⋅ Guosen Xie ⋅ Caifeng Shan ⋅ Fang Zhao
Open-World Recognition, Segmentation & Transfer ExHall # 259
Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis Poster Session 5
Xianhao Chen ⋅ Jiarui Hu ⋅ Yuanbo Yang ⋅ Xiyu Zhang ⋅ Tengyue Wang ⋅ Hujun Bao ⋅ Guofeng Zhang ⋅ Zhaopeng Cui
Open-World Recognition, Segmentation & Transfer ExHall # 261
GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising Poster Session 5
Yi He ⋅ Jiangming Wang ⋅ Xinyu Wang ⋅ Mark Fong ⋅ Songchun Zhang ⋅ Yuxuan Xue ⋅ Hai-Tao Zheng ⋅ Yue Ma
Open-World Recognition, Segmentation & Transfer ExHall # 262
RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation Poster Session 5
Yue Chang ⋅ Rufeng Chen ⋅ Zhaofan ZHANG ⋅ Yi Chen ⋅ Yifan Tian ⋅ Sihong Xie
Open-World Recognition, Segmentation & Transfer ExHall # 264
Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities Poster Session 5
Jindi Bao ⋅ Jianjun Qian ⋅ Mengkai Yan ⋅ Jian Yang
Open-World Recognition, Segmentation & Transfer ExHall # 265
AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation Poster Session 5
Qizhe Wei ⋅ Yingping Liang ⋅ Shao You ⋅ Ying Fu
Open-World Recognition, Segmentation & Transfer ExHall # 266
Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval Poster Session 5
Jingjing Zhang ⋅ Lei Zhang ⋅ Zheren Fu ⋅ Zhendong Mao
Open-World Recognition, Segmentation & Transfer ExHall # 267
HVGCD:Rethinking Generalized Category Discovery through Hypothesis–Verification Poster Session 5
zhang baoqiang ⋅ Kunze Huang ⋅ Luyao Tang ⋅ Xiaotong Tu
Open-World Recognition, Segmentation & Transfer ExHall # 268
Diffusion Model as a Generalized Segmentation Learner Poster Session 5
Haoxiao Wang ⋅ Antao Xiang ⋅ Haiyang Sun ⋅ Peilin Sun ⋅ Changhao Pan ⋅ Yifu Chen ⋅ Minjie Hong ⋅ Weijie Wang ⋅ Shuang Chen ⋅ Yue Chen ⋅ ZHOU ZHAO
Open-World Recognition, Segmentation & Transfer ExHall # 269
MOCHA: Multi-modal Objects-aware Cross-arcHitecture Alignment Poster Session 5
Elena Camuffo ⋅ Francesco Barbato ⋅ Mete Ozay ⋅ Simone Milani ⋅ Umberto Michieli
Open-World Recognition, Segmentation & Transfer ExHall # 270
Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection Poster Session 5
Ke Chen ⋅ Ling Zhou ⋅ Yi Liu ⋅ Guangqi Jiang ⋅ Gengshen Wu ⋅ Shoukun Xu
Open-World Recognition, Segmentation & Transfer ExHall # 272
DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation Poster Session 5
Ruizhe Zeng ⋅ Siyu Cao ⋅ Lu Zhang ⋅ Zhi-yong Liu
Open-World Recognition, Segmentation & Transfer ExHall # 273
Beyond Categorical Matching: Intra-Class Graded Relevance Estimation for Cross-Modal 3D Retrieval Poster Session 5
shunning liu ⋅ YingPeng Zhang ⋅ Jianing Lin ⋅ Yifan Wang ⋅ Yang Zhang ⋅ Chun Yuan
Open-World Recognition, Segmentation & Transfer ExHall # 274
SOVTrack: Open-Vocabulary Multi-Object Tracking with Self-Supervised Pseudo Labeling and Feature Distillation Poster Session 5
Zekun QIAN ⋅ Ruize Han ⋅ Junhui Hou ⋅ Wei Feng
Open-World Recognition, Segmentation & Transfer ExHall # 275
SARA: Structure-Aware Riemannian-Guided Alignment for Drone Image-Text Retrieval Poster Session 5
Keyu Lu ⋅ Qing Ma ⋅ Zhenyu Lu ⋅ Cong Bai
Open-World Recognition, Segmentation & Transfer ExHall # 276
What is the Right Embedding Space for Contrastive Learning in Referring Expression Counting? Poster Session 5
Kostas Triaridis ⋅ Panagiotis Kaliosis ⋅ E-Ro Nguyen ⋅ Jingyi Xu ⋅ Dimitris Samaras ⋅ Hieu Le
Open-World Recognition, Segmentation & Transfer ExHall # 277
Iterative Refinement of Semantic and Spatial Representations for Open-Vocabulary Camouflaged Object Segmentation Poster Session 5
Fangyan Wang ⋅ Ge Jiao ⋅ Guowen Yue
Open-World Recognition, Segmentation & Transfer ExHall # 278
HER-Count: Learning Hyper-Exemplar Representation for Generalized Zero-Shot Object Counting Poster Session 5
Jianing Li ⋅ Xiaobin Liu ⋅ Ruihan Xu
Open-World Recognition, Segmentation & Transfer ExHall # 279
FST-SAM3: Taming SAM~3 with Frequency-Spatio-Temporal Refinement for Video Polyp Segmentation Poster Session 5
Guanhao Wu ⋅ Guilian Chen ⋅ Huisi Wu ⋅ Jing Qin
Open-World Recognition, Segmentation & Transfer ExHall # 280
Rethinking Prototype-based Similarity Learning for Few-Shot Object Detection Poster Session 5
KunHo Heo ⋅ Seungjae Kim ⋅ Wongyu Lee ⋅ SuYeon Kim ⋅ MyeongAh Cho
Open-World Recognition, Segmentation & Transfer ExHall # 281
Unleashing the Power of Large-Scale ViT in Zero-Shot SBIR: A Strong Baseline with Multi-Layer Feature Aggregation Poster Session 5
Yang Liu ⋅ Yongjing Guo ⋅ Suisui Jia ⋅ Huaizhou Qi ⋅ Xun Du ⋅ Haonan Chen
Open-World Recognition, Segmentation & Transfer ExHall # 282
InSeg: Interactive Refinement via Intent Propagation for Point Cloud Semantic Segmentation Poster Session 5
Yudong Liu ⋅ Yunfei Li ⋅ Ge Gao ⋅ Han Huang ⋅ Ming Gu
Open-World Recognition, Segmentation & Transfer ExHall # 283
Revisiting Deepfake Detection: BCNet for Robust Generalization Beyond Semantic Dependence Poster Session 5
Jian Yang ⋅ Shibo Yao ⋅ Renshuai Tao ⋅ Chuangchuang Tan ⋅ Yao Zhao
Open-World Recognition, Segmentation & Transfer ExHall # 284
REAL-OW: Rehearsal-free Open World Object Detection with Low-Rank Adaptation and Dual-Stage Objectness Modeling Poster Session 5
Huazhong Zhang ⋅ Xiaowen Fu ⋅ Yang Zhang ⋅ Linlin Shen ⋅ Jinbao Wang
Open-World Recognition, Segmentation & Transfer ExHall # 285
Virtual Category-Guided Continual Generalized Category Discovery Poster Session 5
Jiahui Xiong ⋅ Qiuxia Lai ⋅ Hongsong Wang
Open-World Recognition, Segmentation & Transfer ExHall # 286
CaPCL: Caption-Preserved Continual Learning for Text-to-Image Retrieval Poster Session 5
Naoya Sogi ⋅ Ren Ohkubo ⋅ Takashi Shibata ⋅ Makoto Terao ⋅ Yusuke Hosoya ⋅ Takayuki Okatani
Open-World Recognition, Segmentation & Transfer ExHall # 287
Label-Free Text Prototype Adaptation for Open Vocabulary Segmentation Poster Session 5
Keli Wang ⋅ Meixuan Li ⋅ Tianyu Li ⋅ Guoqing Wang
Open-World Recognition, Segmentation & Transfer ExHall # 288
SFKD: Spatial–Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction Poster Session 5
Cuipeng Wang ⋅ Haipeng Wang
Open-World Recognition, Segmentation & Transfer ExHall # 289
Toward Robust In-Context Segmentation via Concept Guidance Poster Session 5
Zhigang Chen ⋅ Xiawu Zheng ⋅ Rongrong Ji
Open-World Recognition, Segmentation & Transfer ExHall # 290
CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation Poster Session 5
Tingzhang Luo ⋅ Ruizhong Liu ⋅ Yichao Liu ⋅ Cheng Fan ⋅ Yu Liu ⋅ Jianyuan Guo
Open-World Recognition, Segmentation & Transfer ExHall # 291
Open-Weather Robust 3D Detection via Dual-Critic Diffusion Alignment Poster Session 5
Shuyao Li ⋅ Chuanxing Geng ⋅ heyang sun ⋅ Qiang Zhou ⋅ Jingjing Gu
Open-World Recognition, Segmentation & Transfer ExHall # 293
Aligning Anything: Hierarchical Motion Estimation for Video Frame Interpolation Poster Session 5
Mengshun Hu ⋅ Zhihang Zhong ⋅ Yansheng Qiu ⋅ Zheng Wang ⋅ Xiao Sun
Open-World Recognition, Segmentation & Transfer ExHall # 294
Degradation-Robust and Temporally Consistent Infrared–Visible Video Fusion via One-step Diffusion Framework Poster Session 5
Songcheng Du ⋅ HaoYuan Xu ⋅ Xingyuan Li ⋅ Yang Zou ⋅ Jinyuan Liu ⋅ YUNPENG BAI ⋅ Ying Li
Open-World Recognition, Segmentation & Transfer ExHall # 295
CascadeProto: Cascaded Cross-Modal Prototype Purification via Entropy-Aware Learning for Few-Shot 3D Point Cloud Segmentation Poster Session 5
Changshuo Wang ⋅ Weijun Li ⋅ Fan Mo ⋅ Zhonghang Liu ⋅ Shuting He ⋅ Prayag Tiwari ⋅ Dimitrios Kanoulas
Open-World Recognition, Segmentation & Transfer ExHall # 296
Proposal Score Realignment Guided by Semantic Completeness for Weakly Supervised Temporal Action Localization Poster Session 5
Maodong Li ⋅ Zhihao Wang ⋅ Jingxiong Wang ⋅ Jian Wang ⋅ Bing Li
Open-World Recognition, Segmentation & Transfer ExHall # 297
IP-SAM: Rethinking Prompt-Conditioned Segmentation for Prompt-Absent Deployment Poster Session 5
Huiyao Zhang ⋅ Jin Bai ⋅ Rui Guo ⋅ Jianwen Tan ⋅ Hongfei Wang ⋅ Ye Li
Open-World Recognition, Segmentation & Transfer ExHall # 298
DETR is Secretly a Multispectral Detector: Zero-Parameter Adaptation via Semantic Alignment Poster Session 5
Xiangyang Li ⋅ Zhiwei Jiang ⋅ Wushuai Jin ⋅ Pengyang Niu ⋅ Chunna Tian ⋅ Lingqiao Liu
Open-World Recognition, Segmentation & Transfer ExHall # 299
Debiased Textual Prompt Tuning for Enhancing Unknown Class Discovery Poster Session 5
Yuxin Fan ⋅ Junbiao Cui ⋅ Changhao Liu ⋅ Xingwang Zhao ⋅ Jiye Liang
Open-World Recognition, Segmentation & Transfer ExHall # 300
Context-Interactive Reasoning for Group Activity Detection Poster Session 5
Xi Ai ⋅ Weihong Ren ⋅ Shuhuan Han ⋅ Haoran Xu ⋅ Qian Dong ⋅ Pengyang Su ⋅ Zijian Wang ⋅ Shengchun Lin ⋅ Zhiyong Wang ⋅ Honghai Liu
Open-World Recognition, Segmentation & Transfer ExHall # 301
NegROI: Click-Centric Uncertainty-Guided Refinement with Scene-Conditioned Negative Prompts for Robust Interactive 3D Segmentation Poster Session 5
shuheng zhang ⋅ Feng Wu
Open-World Recognition, Segmentation & Transfer ExHall # 302
DE2TR: Dual Evidence Detection Transformer for Video Temporal Grounding Poster Session 5
Yifan Zhang ⋅ Chengxu Liu ⋅ Yujie Dun ⋅ Xueming Qian
Open-World Recognition, Segmentation & Transfer ExHall # 303
CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition Poster Session 5
Muhammad Osama Zeeshan ⋅ Masoumeh Sharafi ⋅ Benoît Savary ⋅ Alessandro Lameiras Koerich ⋅ Marco Pedersoli ⋅ Eric Granger
Open-World Recognition, Segmentation & Transfer ExHall # 304
Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data Poster Session 5
Hyunwoo Park ⋅ Sanghyun Lee
Open-World Recognition, Segmentation & Transfer ExHall # 305
P²Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation Poster Session 5
Yi Shi ⋅ Huichao Xie ⋅ Yuqing Wang ⋅ Mingyu Wang ⋅ Kaihui Yang ⋅ Yu Liu ⋅ Lu Ruitao ⋅ Lizhe Li ⋅ Junwei Han ⋅ Dingwen Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 306
DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture Poster Session 5
Xiangteng He ⋅ Shunsuke SAKAI ⋅ Shivam Chandhok ⋅ Sara Beery ⋅ Kun yuan ⋅ Nicolas Padoy ⋅ Tatsuhito Hasegawa ⋅ Leonid Sigal
Open-World Recognition, Segmentation & Transfer ExHall # 307
Training-free Discriminative Patch Mining for Robust Few-Shot Recognition with CLIP Poster Session 5
Zhenzhang Ye ⋅ Duolikun Danier ⋅ Bo Zhao ⋅ Hakan Bilen
Open-World Recognition, Segmentation & Transfer ExHall # 308
PASR: Pattern-Aware Scene-Conditioned Reasoning for Camouflaged Object Detection Poster Session 5
Xinyu Wang ⋅ Jintang Xue ⋅ C.-C. Jay Kuo
Open-World Recognition, Segmentation & Transfer ExHall # 309
μFlow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors Poster Session 5
Orazio Pontorno ⋅ Mattia Litrico ⋅ Luca Guarnera ⋅ Mario Valerio Giuffrida ⋅ Sebastiano Battiato
Open-World Recognition, Segmentation & Transfer ExHall # 310
ORACLE-3D: Open-world Region-aligned Cross-modal Learning for Label-efficient 3D Scene Understanding Poster Session 5
Yuru Wang ⋅ Pei Liu ⋅ Songtao Wang ⋅ Zehan Zhang ⋅ Xinyan Lu ⋅ Changwei Cai ⋅ Hao Li ⋅ Haipeng LIU ⋅ Qingtian Ning ⋅ Jun Ma
Open-World Recognition, Segmentation & Transfer ExHall # 311
CURE: Contextual Debiasing and Unbiased Refinement for Training-Free Open-Vocabulary Semantic Segmentation Poster Session 5
Jiean Wang ⋅ Sanqing Qu ⋅ Fan Lu ⋅ Huanhuan Bao ⋅ Wei Tian ⋅ Bo Jin ⋅ Jiangtong Li ⋅ Junqiao Zhao ⋅ Guang Chen
Open-World Recognition, Segmentation & Transfer ExHall # 312
Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild Poster Session 5
Ting Lei ⋅ Jialin Liu ⋅ Zhu Xu ⋅ Yuxin Peng ⋅ Yang Liu
Open-World Recognition, Segmentation & Transfer ExHall # 313
Mitigating Pose–Scale Discrepancy Bias and Reforming Multi-Support Reasoning for Few-Shot Semantic Segmentation Poster Session 5
Shreya Biswas ⋅ Zhaozheng Yin
Open-World Recognition, Segmentation & Transfer ExHall # 314
Training-free Cross-domain Few-shot Segmentation via Robust Semantic Representation and Matching Poster Session 5
Sujun Sun ⋅ Mingwu Ren ⋅ Haofeng Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 315
Hierarchical Spatial and Channel Aggregation for Cross-domain Few-shot Segmentation Poster Session 5
Sujun Sun ⋅ Mingwu Ren ⋅ Haofeng Zhang
Open-World Recognition, Segmentation & Transfer ExHall # 316
ReynoldsFlow: Physics-Inspired Spatiotemporal Flow Representation for Video Understanding Poster Session 5
Yu-Hsi Chen ⋅ Ching-Kai Lin ⋅ PingKong Huang ⋅ Chin-Tien Wu
Open-World Recognition, Segmentation & Transfer ExHall # 317
CRISP: Calibration-Aware Visual State Space Duality for Remote Sensing Image Segmentation Poster Session 5
kangning wang ⋅ Haopeng Zhang ⋅ Zhiguo Jiang
Open-World Recognition, Segmentation & Transfer ExHall # 318
SPLIT: Training-Free AI-Generated and Partially Edited Video Detection via Spatial Patch‑Level Incoherence and Temporal Roughness Poster Session 5
Jongyeop Hyun ⋅ Hyounghun Kim
Open-World Recognition, Segmentation & Transfer ExHall # 319
Free-Lunch Augmentation by Revisiting Diffusion-Based Data Generation for Cross-Domain Few-Shot Object Detection Poster Session 5
Zijian Zhuang ⋅ Yixiong Zou ⋅ Yuhua Li ⋅ Ruixuan Li
Open-World Recognition, Segmentation & Transfer ExHall # 320
Breaking the Model Forgetting Cycle in Long-Incremental 3D Object Detection Poster Session 5
Peisheng Qian ⋅ Jie Xu ⋅ Xulei Yang ⋅ Na Zhao
Open-World Recognition, Segmentation & Transfer ExHall # 321
TerrainGraphNet: Terrain-Constrained Graph Reasoning for Landslide Segmentation Poster Session 5
SHAHID SHAFI DAR ⋅ Pranjal Pandey ⋅ Nagendra Kumar
Open-World Recognition, Segmentation & Transfer ExHall # 322
Fourier Self-Supervision for Fine-Grained Generalized Category Discovery Poster Session 5
Sarah Rastegar ⋅ Mina Ghadimi Atigh ⋅ Pascal Mettes ⋅ Yuki Asano ⋅ Cees Snoek
Open-World Recognition, Segmentation & Transfer ExHall # 323
GhostPoint: Self-Supervised Representation Learning by Hallucinating Occluded LiDAR Structure Poster Session 5
Bin Yang ⋅ Mohamed Abdelsamad ⋅ Miao Zhang ⋅ Michael Ulrich ⋅ Yakov Miron ⋅ Abhinav Valada ⋅ Alexandru Paul Condurache
Open-World Recognition, Segmentation & Transfer ExHall # 324
StAR: Segment Anything Reasoner Poster Session 4
Seokju Yun ⋅ Dongheon Lee ⋅ Noori Bae ⋅ Jaesung Jun ⋅ Chanseul Cho ⋅ Youngmin Ro
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 392
RiO-DETR: DETR for Real-time Oriented Object Detection Poster Session 4
Zhangchi Hu ⋅ Yifan Zhao ⋅ Yansong Peng ⋅ Wenzhang SUN ⋅ Xiangchen Yin ⋅ Jie Chen ⋅ Peixi Wu ⋅ Hebei Li ⋅ xinghao wang ⋅ Dongsheng Jiang ⋅ Xiaoyan Sun
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 393
ZMIS-SAM: Segment Anything Model Enhanced With Wavelet Transform For Zooplankton Microscopy Image Instance Segmentation Poster Session 4
Dekun Yuan ⋅ Zhongwei Li ⋅ Zheng Qiao ⋅ Jie Zhang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 394
TiCRL: Textual Image Classification with Reinforcement Learning-Based Curriculum Learning Poster Session 4
Gayoung KIM ⋅ Yuncheol Kang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 395
Slim-DETR: Real-Time Tiny Object Detection with Efficient Interaction and Gaussian Query Poster Session 4
Tong Wu ⋅ Jiahao Zhang ⋅ Juntao Guan ⋅ Lai Rui
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 396
O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning Poster Session 4
Mei Yuan ⋅ Qi Long ⋅ Qifeng Wu ⋅ Zhenyang Li ⋅ Yizhou Zhao ⋅ Lei Wang ⋅ Yang Liu ⋅ Min Xu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 397
Decoupling Moment from Event for Video Temporal Grounding Poster Session 4
Yuda Zou ⋅ Boxiang Zhou ⋅ Xin Zhou ⋅ YIBO CHEN ⋅ Dejia Song ⋅ Xu Tang ⋅ Yao Hu ⋅ Yongchao Xu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 398
PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates Poster Session 4
SATOSHI HASHIMOTO ⋅ Yanan Wang ⋅ Hitoshi Nishimura ⋅ Mori Kurokawa
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 399
Align and Segment: Unsupervised Learning for Building Segmentation From Misaligned Labels Poster Session 4
Venkanna Babu Guthula ⋅ Oswin Krause ⋅ Dimitri Gominski ⋅ Hui Zhang ⋅ Johan Mottelson ⋅ Ankit Kariryaa ⋅ Nico Lang ⋅ Christian Igel
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 400
DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection Poster Session 4
Shiyi Mu ⋅ Zichong Gu ⋅ Zhiqi Ai ⋅ Yilin Gao ⋅ Shugong Xu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 401
CLUE-VAD: Structured Semantic Clues for Understanding Explainable Events in Video Anomaly Detection Poster Session 4
MYOUNG-CHUL KIM ⋅ Junhee Lee ⋅ ChaeBeen Bang ⋅ MyeongAh Cho
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 402
ODONet: Online Dynamic Offset Network for Visual Object Tracking Poster Session 4
Qinghua Liu ⋅ Wanli Xue ⋅ Shengyong Chen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 403
HieDG: A Hierarchical Discrete Geometry-Guided Framework for Multi-Animal Tracking Poster Session 4
Chenxun Deng ⋅ Zhongde Zhang ⋅ Ye Yuan ⋅ Chengyang Zhang ⋅ Yifan Zhang ⋅ Bohao Chen ⋅ Hongying Yan ⋅ Hang Zhou ⋅ Hua Han ⋅ Xi Chen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 406
UnderOneFacade: Worldwide Facade Semantic Segmentation Benchmark Dataset Poster Session 4
Yi Wang ⋅ Fan Wang ⋅ Prabin Gyawali ⋅ Ziyang Xu ⋅ Anna Klimkowska ⋅ Yixiong Jing ⋅ Wanru Yang ⋅ Filip Biljecki ⋅ Christoph Holst ⋅ Benjamin Busam ⋅ Brian Sheil ⋅ Olaf Wysocki
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 407
OCTA-SOT: Online Cross-Modal Trajectory Adjustment for RGBT Anti-UAV Single Object Tracking under Spatio-Temporal Misalignment Poster Session 4
Xiaokang Liu ⋅ Qi Jia ⋅ Jinrui Wang ⋅ Chengzhou Li ⋅ Yu Liu ⋅ Weimin Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 408
Event Stream-based Sign Language Translation: A High-Definition Benchmark Dataset and A Novel Baseline Poster Session 4
Shiao Wang ⋅ Xiao Wang ⋅ Duoqing Yang ⋅ Yao N/A ⋅ Fuling Wang ⋅ Jianing Li ⋅ Lin Zhu ⋅ Bo Jiang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 409
MATCH: Flow Matching for Multi-View Anomaly Detection Poster Session 4
Mathis Kruse ⋅ Melissa Schween ⋅ Bodo Rosenhahn
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 410
Evidence Triangulation for Multimodal Fact-Checking in the Wild Poster Session 4
Stefanos-Iordanis Papadopoulos ⋅ Zacharias Chrysidis ⋅ Christos Koutlis ⋅ Symeon Papadopoulos ⋅ Panagiotis Petrantonakis
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 411
GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks Poster Session 4
Wei Zhang ⋅ Chaoqun Wang ⋅ Zixuan Guan ⋅ Ping Kao ⋅ Pengfei Zhao ⋅ Peng Wu ⋅ Sifeng He
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 412
Constrained Rotation Optimization: Revisiting Crop-Based Gaze Estimation Poster Session 4
Riccardo Santambrogio ⋅ Jiawei Qin ⋅ Matteo Matteucci ⋅ Yusuke Sugano
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 413
Exclusivity-Guided Mask Learning for Semi-Supervised Crowd Instance Segmentation and Counting Poster Session 4
Jiyang Huang ⋅ Hongru Chen ⋅ Wei Lin ⋅ Jia Wan ⋅ Antoni Chan
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 414
DualCount: Structurally Consistent Density and Point Modeling for Zero-Shot Object Counting Poster Session 4
Xuan Cuong Ngo
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 415
HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark Poster Session 4
Dairu Liu ⋅ Zekun Qi ⋅ Jiayu Zeng ⋅ Yu Guan ⋅ Chenghuai Lin ⋅ Xuchuan Chen ⋅ Xinqiang Yu ⋅ Wenyao Zhang ⋅ HE WANG ⋅ Li Yi
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 416
Proximity-CLIP: Text-Guided Semantic Proximity Learning for Zero-Shot Anomaly Detection Poster Session 4
Manwen Yang ⋅ Leqian Ding ⋅ Yu Guo ⋅ Fei Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 417
Real-Time Source-Free Object Detection Poster Session 4
Sairam V C Rebbapragada ⋅ Varun Gopal ⋅ Poornima Jain ⋅ Vineeth N Balasubramanian ⋅ Muhammad Haris Khan
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 419
DETRAM: End-to-end DEtection, Tracking and Recovery of HumAn Meshes Poster Session 4
Chunggi Lee ⋅ Seonwook Park ⋅ Wanhua Li ⋅ Umar Iqbal ⋅ Hanspeter Pfister
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 420
Harnessing SSL for Segmentation in 3D Microscopy with Noisy Labels and Hard Patches Poster Session 4
Lingtong Xu ⋅ Ahmadreza Attarpour ⋅ Shruti Patel ⋅ Fengqing Yu ⋅ Matthew Rozak ⋅ Bojana Stefanovic ⋅ Anne Martel ⋅ Maged Goubran
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 421
Anomaly Factory 3D: A Modular Framework for Diverse Pseudo-Anomaly Synthesis in Unsupervised 3D Anomaly Detection Poster Session 4
Ali Balapour ⋅ Faraz Hach
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 422
Seeing as Humans Do: Learning from Motion to Segment Anything Without Supervision Poster Session 4
Weijian Jian ⋅ Xiaoyue Zhang ⋅ Bin Xiao ⋅ Chunyu Xie ⋅ Yixiao He ⋅ Yutao Liu ⋅ Dawei Leng ⋅ Yuhui Yin
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 423
SAGE: A Synchronized Action and Gaze Estimation Framework for Comprehensive Human Behavior Analysis Poster Session 4
Chenyi Kuang ⋅ Nakul Agarwal
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 424
FuDU: A Fuzzy Dual-dimension Uncertainty Framework for Streaming Active Learning in Industrial Defect Detection Poster Session 4
Zhaoyang Wang ⋅ Haiyong Chen ⋅ Binyi Su ⋅ Xinwei Lyu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 425
InstanceControl: Controllable Complex Image Generation without Instance Labeling Poster Session 4
XIAOYU LIU ⋅ Huan Wang ⋅ FAN LI ⋅ Zhixing Wang ⋅ Jiaqi Xu ⋅ Ming LIU ⋅ Wangmeng Zuo
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 426
Instance Segmentation as Tracking: A New Paradigm for Multi-Small-Object Tracking with Event Cameras Poster Session 4
Nuo Chen ⋅ Shiman He ⋅ Boyang Li ⋅ Yingqian Wang ⋅ Chao Xiao ⋅ QianYin QianYin ⋅ Ruojing Li ⋅ Yihang Luo ⋅ Wei An ⋅ Miao Li
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 428
Online 3D Instance Segmentation at task-oriented granularity with Unposed Monocular Video Poster Session 4
Dong Wu ⋅ Baicheng Li ⋅ Yingdian Cao ⋅ Shunkai Zhou ⋅ Yiwen Lu ⋅ Hongbin Zha
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 429
ArcAD: Anomaly-Rectified Calibration for Cold-Start Supervised Anomaly Detection Poster Session 4
Ningning Han ⋅ Lei Fan ⋅ Jia Guo ⋅ Yunkang Cao ⋅ Xiu Su ⋅ Feng Cao ⋅ Donglin Di ⋅ Tonghua Su
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 430
Mode-Conditioned Residual Calibration for Multi-Object Tracking Poster Session 4
Muyu Li ⋅ Henan Hu ⋅ Deepak Jain ⋅ Xudong Zhao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 431
Domain Adaptive Object Detection via Dual-Stream Bilevel-Cycle Optimization Poster Session 4
Yannan Chen ⋅ Wei Wang ⋅ Ruoyu Chen ⋅ Wenqiang Wang ⋅ Jiancheng Wang ⋅ Mingbo Yang ⋅ Yaowei Wang ⋅ Xiaochun Cao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 432
HLRAD: High-dimensional Latent Representation for Unified Anomaly Detection Poster Session 4
Tianrui Zhang ⋅ Ziheng Zang ⋅ Ningmu Zou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 434
Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation Poster Session 4
Jiuhe Qu ⋅ Yingping Liang ⋅ Ying Fu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 436
WAPR: A Foundation Model for Wide-Angle Refinement in Unseen Object Pose Estimation Poster Session 4
Yulin Wang ⋅ Jianghao Zhou ⋅ Hongli Li ⋅ MENGTING HU ⋅ Chen LUO
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 437
CAR-MIL: Counterfactual Attention Regularization for Multiple Instance Learning Poster Session 4
Imane Chraki ⋅ Pierre Marza ⋅ Stergios Christodoulidis ⋅ Maria Vakalopoulou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 438
Local Spacing-Aware Hungarian Matching for Stable Point-Supervised Crowd Counting Poster Session 4
Kai Jiang ⋅ Yiming Lin ⋅ Zurui Ao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 439
SARIF: Segment Anything for Robust Image Forensics Poster Session 4
Dong-Hyun Moon ⋅ Ju-Hyeon Nam ⋅ Sang-Chul Lee
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 440
A Comprehensive Analysis about Unsupervised Outlier Detection for Images Poster Session 4
Zhonghang Liu ⋅ Siyuan Chen ⋅ Jingwen Yu ⋅ Changshuo Wang ⋅ Kunyang Li ⋅ Jiangbo Lu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 441
SelfMOTR: Revisiting MOTR with Self-Generating Detection Priors Poster Session 4
Fabian Gülhan ⋅ Emil Mededovic ⋅ Yuli Wu ⋅ Johannes Stegmaier
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 442
On-Orbit Real-Time Wildfire Detection Under On-Board Constraints Poster Session 4
Matthias Rötzer ⋅ Veronika Pörtge ⋅ Martin Ickerott ⋅ Jayendra Chorapalli ⋅ Dimitri Scheftelowitsch ⋅ Max Bereczky ⋅ Dmitry Rashkovetsky ⋅ Sai Appalla ⋅ Julia Gottfriedsen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 443
RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild Poster Session 4
Cheng Cui ⋅ Tingquan Gao ⋅ Xueqing Wang ⋅ Changda Zhou ⋅ Hongen Liu ⋅ Ting Sun ⋅ Yubo Zhang ⋅ Zelun Zhang ⋅ Jiaxuan Liu ⋅ Manhui Lin ⋅ Yue Zhang ⋅ Suyin Liang ⋅ Yiqing Xiang ⋅ Yi Liu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 445
Pseudo-Stereo Inputs: A Solution to the Occlusion Challenge in Self-Supervised Stereo Matching Poster Session 4
Ruizhi Yang ⋅ Xingqiang Li ⋅ Jiajun Bai ⋅ Jinsong Du
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 446
ISAC: Training-Free Instance-to-Semantic Attention Control for Multi-Instance Generation Poster Session 4
Sanghyun Jo ⋅ Wooyeol Lee ⋅ Ziseok Lee ⋅ Jonghyun Choi ⋅ Jaesik Park ⋅ Kyungsu Kim
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 447
RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking Poster Session 4
Yanqiu Yu ⋅ Zhifan Jin ⋅ Sijia Chen ⋅ Tongfei Chu ⋅ En Yu ⋅ Liman Liu ⋅ Wenbing Tao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 448
3D-LENS: A 3D Lifting-based Elevated Novel-view Synthesis method for Single-View Aerial-Ground Re-Identification Poster Session 4
William Grolleau ⋅ Astrid Sabourin ⋅ Guillaume Lapouge ⋅ Catherine Achard
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 449
Robust Zero-shot Anomaly Detection under Limited Auxiliary Anomaly Priors Poster Session 4
Guanyu Lu ⋅ Fang Zhou ⋅ Cheqing Jin
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 450
Reliability-Aware 3D Geometric Injection for Universal Person Re-identification Poster Session 4
Bohan Su ⋅ Jiashuo Wang ⋅ Fangyi Liu ⋅ Mang Ye
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 451
BAAF: Universal Transformation of One-Class Classifiers for Unsupervised Image Anomaly Detection Poster Session 4
Declan McIntosh ⋅ Alexandra Branzan Albu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 453
MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting Poster Session 4
Aman Anand ⋅ Partha Pratim Roy ⋅ Palaiahnakote Shivakumara ⋅ Umapada Pal
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 454
ModTrack: Sensor-Agnostic Multi-View Tracking via Identity-Informed PHD Filtering with Covariance Propagation Poster Session 4
Aditya Iyer ⋅ Jack Roberts ⋅ Nora Ayanian
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 455
PhenoLeaf-TS: A Time-Series Benchmark for Leaf Instance Segmentation, Tracking, and Growth Stage Classification Poster Session 4
Rijad Saric ⋅ Basim Azam ⋅ Sarmad Khan ⋅ Edhem Custovic
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 456
Rapidly Deploying On-Device Eye Tracking by Distilling Visual Foundation Models Poster Session 4
Cheng Jiang ⋅ Jogendra Nath Kundu ⋅ David Colmenares ⋅ Fengting Yang ⋅ Joseph Robinson ⋅ Yatong An ⋅ Ali Behrooz
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 457
Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models Poster Session 4
Stanislav Panev ⋅ Minhyek Jeon ⋅ Vaishnavi Khindkar ⋅ Ahish Deshpande ⋅ Celso de Melo ⋅ Shuowen Hu ⋅ Shayok Chakraborty ⋅ Fernando de la Torre
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 458
CRD-Net: Frequency-Adaptive Feature Injection and Change Decoupling for Building Damage Assessment Poster Session 4
Yao Zheng ⋅ Yuanxin Ye ⋅ Tan Shu ⋅ Liwei Cai
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 459
Don’t Starve the Boundaries: Boundary-Constrained Label Propagation for Weakly Supervised 3D Segmentation Poster Session 4
Shuwei Wu ⋅ shuo jin ⋅ Zhijin He ⋅ Siyue Yu ⋅ ENG LIM ⋅ Qiufeng Wang ⋅ Jimin Xiao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 460
Motion-aware Sparse Pipeline for Lightweight Object Tracking Poster Session 4
Qingmao Wei ⋅ Fagui Liu ⋅ Dengke Zhang ⋅ Qingze He ⋅ Quan Tang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 461
CGCC: Towards Generalizable Clothes-Changing Person Re-Identification Poster Session 4
Yizhi Wu ⋅ Fangyi Liu ⋅ wei yu ⋅ Mang Ye
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 462
Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing Poster Session 4
Luca Barsellotti ⋅ Martin Sundermeyer ⋅ Mattia Segu ⋅ Nikita Araslanov ⋅ Muhammad Ferjad Naeem ⋅ Marcella Cornia ⋅ Yongqin Xian ⋅ Maxim Berman
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 463
Cross-Species Animal Re-Identification with Semantic Consistency Learning Poster Session 4
Shuoyi Chen ⋅ Yuejia Li ⋅ Mang Ye
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 464
Following the Flow: Advection-Consistent Modeling for Event-based Small Object Detection Poster Session 4
Wen Guo ⋅ Fulong Cai ⋅ Wuzhou Quan
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 465
Bounding-Box Trajectories Matter for Video Anomaly Detection Poster Session 4
Inpyo Song ⋅ Jangwon Lee
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 466
EVKit: An Open-source Flexible Toolkit for Efficient Event Camera Data Storage and Loading Poster Session 4
Yilun Wu ⋅ Guido De Croon
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 467
OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations Poster Session 4
Jun Wei ⋅ Xinchang Liu ⋅ Yu Liu ⋅ Chuhua Yang ⋅ Shuhui Wang ⋅ Hui Huang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 468
IACD: Iterative Adversarial Collaborative Detection via Dual-Perspective Blind Spot Discovery Poster Session 4
Xiaoyan Li ⋅ Cuicui Jiang ⋅ Jiaoping Chen ⋅ Rumei Yang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 471
VIGA: View-Conditioned and Identity-Guided Adaptation for Aerial-Ground Person Re-Identification Poster Session 4
XU ZHANG ⋅ Feng Yining ⋅ ZUYU ZHANG
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 472
Point2Pose: Occlusion-Recovering 6D Pose Tracking and 3D Reconstruction for Multiple Unknown Objects Via 2D Point Trackers Poster Session 4
Tzu-Yuan Lin ⋅ Ho Lee ⋅ Kevin Doherty ⋅ Yonghyeon Lee ⋅ Sangbae Kim
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 473
ProtoFair: Fair Self-Supervised Contrastive Learning via Pseudo-Counterfactual Pairs Poster Session 4
Marah Halawa ⋅ Olaf Hellwich
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 474
Segmentation-Guided Homography Estimation for Long-Term Planar Tracking Poster Session 4
Jonáš Šerých ⋅ Jiri Matas
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 475
DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints Poster Session 4
Sebastian Janampa ⋅ Marios Pattichis
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 476
PS-MOT: Cultivating Instance Awareness from Point Seeds for Multi-Object Tracking Poster Session 4
Kai Luo ⋅ Fei Teng ⋅ Mengfei Duan ⋅ Wanjun Jia ⋅ Xu Wang ⋅ Hao Shi ⋅ Kunyu Peng ⋅ Zhiyong Li ⋅ Kailun Yang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 338
Granular Semantic Cognition for Visible-Infrared Person Re-Identification Poster Session 4
Haifeng Yang ⋅ Jinjia Peng ⋅ Huibing Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 339
A Benchmark for Heterogeneous Stereo Deblurring with Physically- and Epipolar-constrained Cross Attention Poster Session 4
Jiah Kim ⋅ Hoju Shin ⋅ Seung-Wook Kim ⋅ Seowon Ji
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 340
Bottom-up modeling of repeated elements via single image analysis-by-synthesis Poster Session 4
syrine kalleli ⋅ Alexei Efros ⋅ Mathieu Aubry
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 341
Uncertainty-aware tree height change regression Poster Session 4
Max Gaber ⋅ Dimitri Gominski ⋅ Jaime Revenga ⋅ Stefan Oehmcke ⋅ Rasmus Fensholt ⋅ Martin Brandt
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 343
Hierarchical Hyperbolic Representation Learning for Aerial-Ground Person Re-Identification Poster Session 4
QiWei Yang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 344
SceneDiff: A Benchmark and Method for Multiview Object Change Detection Poster Session 4
Yuqun Wu ⋅ Chih-Hao Lin ⋅ Henry Che ⋅ Aditi Tiwari ⋅ Chuhang Zou ⋅ Shenlong Wang ⋅ Derek Hoiem
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 345
Beyond Attention: Convolutional Global Context for Remote Sensing Change Detection Poster Session 4
Zhenyu Yang ⋅ Gensheng Pei ⋅ Junzhu Mao ⋅ Xinhao Cai ⋅ Tao Chen ⋅ Yazhou Yao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 346
NUN: Nested Unfolding Network for Real-World Concealed Object Segmentation Poster Session 4
Chunming He ⋅ Rihan Zhang ⋅ Longxiang Tang ⋅ Dingming Zhang ⋅ Bojian Zhang ⋅ Fengyang Xiao ⋅ Jingjia Feng ⋅ Sina Farsiu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 347
LeAD-M3D: Leveraging Asymmetric Distillation for Real-Time Monocular 3D Detection Poster Session 4
Johannes Meier ⋅ Jonathan Michel ⋅ Oussema Dhaouadi ⋅ Yung-Hsu Yang ⋅ Christoph Reich ⋅ Zuria Bauer ⋅ Stefan Roth ⋅ Marc Pollefeys ⋅ Jacques Kaiser ⋅ Daniel Cremers
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 348
InclusiveHuman-10K: Towards Inclusive Human Parsing Beyond the Intact-Limb Assumption Poster Session 4
Heming Du ⋅ Jiaying Ying ⋅ Xiaofeng Cao ⋅ Zhu Li ⋅ Yuanyuan Liu ⋅ Kaihao Zhang ⋅ Xin Chen ⋅ Xin Yu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 316
EDM:Event-guided Diffusion Model for Video Shadow Detection in Complex Dynamic Scenes Poster Session 4
boyang gao ⋅ jiayi guo ⋅ Ziyu Wang ⋅ Yingbin Cui ⋅ Zhan Tu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 317
Streaming Dense Voxel Representations for 3D Occupancy Prediction Poster Session 4
Seokha Moon ⋅ Janghyun Baek ⋅ Yujin Jeong ⋅ Daewon Chae ⋅ Giseop Kim ⋅ Jungbeom Lee ⋅ Jinkyu Kim ⋅ Sunwook Choi
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 318
Learning Probabilistic Embeddings for Unsupervised Action Segmentation Poster Session 4
Shuai Li ⋅ Duc Vu ⋅ Juergen Gall
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 319
Region-Aware Multimodal Interleaving for Animal Re-Identification Poster Session 4
Yihao Wu ⋅ Di Zhao ⋅ Wayne Getz ⋅ Lingqiao Liu ⋅ Gillian Dobbie ⋅ Daniel Wilson ⋅ Yun Sing Koh
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 320
SGQA: Semantic-Geometric Quality Alignment for Training-Free Few-Shot Instance Segmentation Poster Session 4
Yuhao Qing ⋅ Liuyan Feng ⋅ Haoyuan Li
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 321
QVAM: Query-guided View-aware Adaptive Modulation for Aerial-Ground Person Re-Identification Poster Session 4
Mengfei Zhou ⋅ Lin Wan
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 351
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis Poster Session 4
Xike Zhang ⋅ Maoyuan Ye ⋅ Juhua Liu ⋅ Bo Du
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 469
Unified Removal of Raindrops and Reflections: A New Benchmark and A Novel Pipeline Poster Session 4
Xingyu Liu ⋅ Zewei He ⋅ Yu Chen ⋅ Chunyu Zhu ⋅ Zixuan Chen ⋅ Xing Luo ⋅ Zheming Lu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 322
Silhouette-based Gait Foundation Model Poster Session 4
Dingqiang Ye ⋅ Chao Fan ⋅ Kartik Narayan ⋅ Bingzhe Wu ⋅ Chengwen Luo ⋅ Jianqiang Li ⋅ Vishal Patel
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 323
Beyond Common Sense: Grounding Logical Anomaly Detection in Inspection Criteria Poster Session 4
Yuanze Li ⋅ YuanShihao YuanShihao ⋅ Zimeng Zhu ⋅ Ming LIU ⋅ Wangmeng Zuo ⋅ Guangming Shi
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 387
Fast Dynamic Prototypes for Unsupervised Anomaly Detection and Localization Poster Session 4
Mingliang Li ⋅ Hanxi Li ⋅ Lin Yuanbo Wu ⋅ Changhong Liu ⋅ Xiaowei Zhao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 324
Free‑CD: Probabilistically Decoupled Training-Free Open-Vocabulary Change Detection with Resolution-Invariant Feature Inversion Poster Session 4
Yongshuo Zhu ⋅ LU LI ⋅ Keyan Chen ⋅ Zhenwei Shi ⋅ ZHOU Fugen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 325
YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Reasoning Poster Session 4
Quansheng Hu ⋅ Qin Sun ⋅ Qiansen Dai ⋅ Jin Ding ⋅ Wan Zhang ⋅ Xue Zhou ⋅ Jianxiao Zou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 352
CountEx: Fine-Grained Counting via Exemplars and Exclusion Poster Session 4
Yifeng Huang ⋅ Gia Khanh Nguyen ⋅ Minh Hoai Nguyen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 353
VCBench: A Streaming Counting Benchmark for Spatial-Temporal State Maintenance in Long Videos Poster Session 4
Pengyiang Liu ⋅ Zhongyue Shi ⋅ Hongye Hao ⋅ Qi Fu ⋅ Xueting BI ⋅ Siwei Zhang ⋅ Xiaoyang Hu ⋅ Zitian Wang ⋅ Linjiang Huang ⋅ Si Liu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 326
GroundingAnomaly: Spatially-Grounded Diffusion for Few-Shot Anomaly Synthesis Poster Session 4
Yishen Liu ⋅ Hongchang Chen ⋅ Pengcheng Zhao ⋅ Yunfan Bao ⋅ Yuxi Tian ⋅ Jieming Zhang ⋅ HAO CHEN ⋅ Zhi Zheng ⋅ Yongchun Liu ⋅ Ying Li ⋅ Dongpu Cao
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 354
InstaPano: Zero-shot Instance Layout Controlled Panorama Generation Via Global Attention Fusion Poster Session 4
Zejian Li ⋅ Rui Huang ⋅ Lefan Hou ⋅ Pei Chen ⋅ Heyuan Xu ⋅ Shengyuan Zhang ⋅ Kewen Zhu ⋅ Huanghuang Deng ⋅ Li Liu ⋅ Lingyun Sun
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 355
Uncertainty-Weighted Fusion of Image and Synthetic Event for Video Anomaly Detection Poster Session 4
SUNGHEON JEONG ⋅ Jihong Park ⋅ Mohsen Imani
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 418
STEP: Score-Based Temporal Energy for Human Pose Video Anomaly Detection Poster Session 4
Jakub Micorek ⋅ Mateusz Kozinski ⋅ Horst Possegger
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 327
Sound-based Multi-Person 3D Pose Estimation Poster Session 4
Yusuke Oumi ⋅ Yuto Shibata ⋅ Go Irie ⋅ Akisato Kimura ⋅ Yoshimitsu Aoki ⋅ Mariko Isogawa
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 356
Rethinking Continual Anomaly Detection on the Edge: Benchmarking Under Realistic Industrial Conditions Poster Session 4
Chad Weatherly ⋅ Sen Lin
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 328
Unsupervised Source-Free Ranking of Biomedical Segmentation Models Under Distribution Shift Poster Session 4
Joshua Talks ⋅ Kevin Marchesini ⋅ Luca Lumetti ⋅ Federico Bolelli ⋅ Anna Kreshuk
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 386
DeMuS: Learning Decoupled Matching and Scoring for Batch Zero-Shot Industrial Anomaly Detection Poster Session 4
Zhengyang Zhao ⋅ Hailong Sun ⋅ Binhang Qi ⋅ Hongrui Yu ⋅ Zhongchi Wang ⋅ Hang Xu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 342
ELHINN: Unifying Dense Crowd Simulation Across Scales via Eulerian–Lagrangian Hydrodynamics Poster Session 4
Yanshan Zhou ⋅ Pingrui Lai ⋅ Jiaqi Yu ⋅ Cunyan Li ⋅ Hua Yang ⋅ Xiaoyun Zhang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 350
FoundYou: A Unified Model for Personalized Segmentation and Retrieval Poster Session 4
Gabriele Trivigno ⋅ Marcos Alfaro Perez ⋅ Claudia Cuttano ⋅ Gabriele Berton ⋅ Luis Payá ⋅ Carlo Masone
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 329
Back-Tracking from Clarity: Self-Learning to See Text from Afar Poster Session 4
Duc Tri Tran ⋅ Phi Le Nguyen ⋅ Minh Hoai Nguyen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 330
EVEE: Event-Based Online Adaptation for Matching on Unknown Targets Poster Session 4
Zejing Zhao ⋅ Cheng Ju ⋅ Yanwen Zhang ⋅ Akio NAMIKI
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 371
CerDETR: Cell-Prior Empowered DETR for Cervical Lesion Detection Poster Session 4
Linyun Zhou ⋅ Jin Chen ⋅ Weihan Li ⋅ Hengrui Lou ⋅ Lingxiang Jia ⋅ Weijun Qin ⋅ Xiuming Zhang ⋅ Zunlei Feng
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 357
RePL: Pseudo-label Refinement for Semi-supervised LiDAR Semantic Segmentation Poster Session 4
Donghyeon Kwon ⋅ Taegyu Park ⋅ Suha Kwak
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 331
One Slide, Many Views: Unifying Complementary Foundation Model Perspectives for WSI Analysis Poster Session 4
Yihui WANG ⋅ Yingxue Xu ⋅ Shu Yang ⋅ Yequan Bie ⋅ Jiabo MA ⋅ Fengtao Zhou ⋅ Hao Chen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 332
Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation Poster Session 4
Houzhang Fang ⋅ Ruixuan Huang ⋅ Qiuhuan Chen ⋅ Xiaolin Wang ⋅ Yi Chang ⋅ Luxin Yan
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 452
Towards Video Anomaly Detection from Event Streams: A Baseline and Benchmark Datasets Poster Session 4
Peng Wu ⋅ Yuting Yan ⋅ Guansong Pang ⋅ Yujia Sun ⋅ Qingsen Yan ⋅ Peng Wang ⋅ Yanning Zhang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 435
A Simple Baseline with Placement Prior for Point-Supervised Oriented Object Detection Poster Session 4
Runxiang Liu ⋅ Kaikai Xie ⋅ Qianxi Cao ⋅ Yuming Fang ⋅ Jiebin Yan ⋅ Junjie Chen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 444
Disentangling Rotation and Translation from SE(3)-Equivariant Features for Shape Assembly Poster Session 4
Hee-Jun Jung ⋅ Uigeun Ahn ⋅ JINHWI PARK ⋅ Kangil Kim
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 381
Where and What: Long-Term Object Tracking in Egocentric Videos Poster Session 4
Jacob Chalk ⋅ Saptarshi Sinha ⋅ Dima Damen ⋅ Yannis Kalantidis ⋅ Larlus Diane
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 358
ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID Poster Session 4
Xulin Li ⋅ Yan Lu ⋅ Bin Liu ⋅ Jiaze Li ⋅ Qinhong Yang ⋅ Tao Gong ⋅ Qi Chu ⋅ Nenghai Yu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 427
MCVL: Multi-Space Cross-View Learning for Aerial-Ground Person Re-Identification Poster Session 4
Wajahat Khalid ⋅ Bin Liu ⋅ Xulin Li ⋅ Yubo Wang ⋅ MUHAMMAD SHER AFGAN
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 405
HASSL: Hierarchy-Aware Self-Supervised Learning Framework for Single Cell Microscopy Poster Session 4
Julius Riel ⋅ Vishwa Mohan Singh ⋅ SAI ANIRUDH ARYASOMAYAJULA ⋅ Anuun Chinbat ⋅ Hannes Leonhard ⋅ Moritz Ladenburger ⋅ Frederik Alexander ⋅ Vishisht Choudhary ⋅ Fabio Laredo ⋅ Giacomo Masserdotti ⋅ Thorben Prein ⋅ Amirhossein Kardoost ⋅ Carsten Marr
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 433
High-Throughput Event-Based Feature Detection and Tracking on an Embedded CPU Poster Session 4
Ethan Elms ⋅ Yasir Latif ⋅ Tat-Jun Chin
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 333
Making Partial-Label Datasets Easier: A Simple Yet Highly Effective Data Augmentation for Deep Partial-Label Learning Poster Session 4
Dong-Dong Wu ⋅ Zhaoyi Li ⋅ Xiang Li ⋅ Zhiqiang Shen
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 359
LogiCo: A Unified Framework for Logical and Structural Anomaly Detection Poster Session 4
Ximiao Zhang ⋅ Min Xu ⋅ Xiuzhuang Zhou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 334
Event-based Gaze Control Systems for Real-time Spin Estimation in Professional Ball Games Poster Session 4
Yunpu Hu ⋅ Fabian Schilling ⋅ Valentina Cavinato ⋅ Asude Aydin ⋅ Agis Politis ⋅ Ricardo Morales ⋅ Kirk Scheper ⋅ Peter Dürr ⋅ Naoya Takahashi
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 470
LlamaSeg: Image Segmentation via Autoregressive Mask Generation Poster Session 4
Jiru Deng ⋅ Tengjin Weng ⋅ Tianyu Yang ⋅ Wenhan Luo ⋅ Zhiheng Li ⋅ Wenhao Jiang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 336
MiNQVIS: Mitigating Noisy Queries for Robust Online Video Instance Segmentation Poster Session 4
Jie Qiao ⋅ Jianxu Chen ⋅ Xiaowei Xu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 335
BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure Poster Session 4
Zijian Dong ⋅ Yi Lin ⋅ Fang Ji ⋅ Jianxiong Zhou ⋅ Eric Kwun Kei NG ⋅ Juan Zhou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 404
Efficient RGB-T Object Detection via Sparse Cross-Modality Fusion Poster Session 4
CHAO TIAN ⋅ Zikun Zhou ⋅ Chao Yang ⋅ guoqing zhu ⋅ Zhenyu He
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 360
ARGOS: Who, Where, and When in Agentic Multi-Camera Person Search Poster Session 4
Myungchul Kim ⋅ Kwanyong Park ⋅ Junmo Kim ⋅ In Kweon
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 361
SCORE: SubDistribution-aware Collaborative Knowledge Reinforcing for Cloth-Hybrid Lifelong Person Re-Identification Poster Session 4
Kunlun Xu ⋅ Liangyu Ma ⋅ Jiangmeng Li ⋅ Xin Tong ⋅ Xiaode Liu ⋅ Yufei Guo ⋅ Jiahuan Zhou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 362
CMCC-ReID: Cross-Modality Clothing-Change Person Re-Identification Poster Session 4
Xu Haoxuan ⋅ Hanzi Wang ⋅ Guanglin Niu
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 337
SegVGGT: Joint 3D Reconstruction and Instance Segmentation from Multi-View Images Poster Session 4
Jinyuan Qu ⋅ Hongyang Li ⋅ Lei Zhang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 363
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations Poster Session 4
Xiaoyu Dong ⋅ Jiahuan Li ⋅ Ziteng Cui ⋅ Naoto Yokoya
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 349
M4-SAR: A Multi-Resolution, Multi-Polarization, Multi-Scene, Multi-Source Dataset and Benchmark for optical-SAR Object Detection Poster Session 4
Chao Wang ⋅ Wei Lu ⋅ Xiang Li ⋅ Jian Yang ⋅ Lei Luo
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 314
Decoding Children’s Gait Behavior Poster Session 4
Yifan Shen ⋅ Boyi Li ⋅ Meihuan Huang ⋅ Yuanzhe Liu ⋅ Xu Cao ⋅ Jinyang Jin ⋅ Zhengyuan Li ⋅ Anglin Liu ⋅ Junho Kim ⋅ Jingyuan Zhu ⋅ Lan Fangzhou ⋅ Jianguo Cao ⋅ Jintai Chen ⋅ Ismini Lourentzou ⋅ James Rehg
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 315
Solving Semi-Supervised Few-Shot Learning from an Auto-Annotation Perspective Poster Session 4
Tian Liu ⋅ Anwesha Basu ⋅ James Caverlee ⋅ Shu Kong
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 364
Divide and Align: Disentangled Vision-Language Learning for Text-Based Person Anomaly Search Poster Session 4
Alex Ergasti ⋅ Tomaso Fontanini ⋅ Claudio Ferrari ⋅ Massimo Bertozzi ⋅ Andrea Prati
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 365
Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval Poster Session 4
Tong Wang ⋅ Yunhan Zhao ⋅ Shu Kong
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 366
GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking Poster Session 4
Youngho Kim ⋅ Hoonhee Cho ⋅ Jae-young Kang ⋅ KUK-JIN YOON
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 367
IREU: Identity-Related Encoder-Only Unlearning for Customized Portrait Generation Poster Session 4
Chaoyi Shi ⋅ Shanshan Zhang ⋅ Jian Yang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 368
EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation Poster Session 4
Nan Wang ⋅ Zhiyi Xia ⋅ Yiming Li ⋅ Shi Tang ⋅ Zoe Fan ⋅ Xi Fang ⋅ Haoyi Tao ⋅ ZHANG SIYUAN ⋅ Guolin Ke ⋅ Yanhui Hong
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 369
WebEyeTrack: Scalable Eye-Tracking for the Browser via On-Device Few-Shot Personalization Poster Session 4
Eduardo Davalos ⋅ Yike Zhang ⋅ Namrata Srivastava ⋅ Yashvitha Thatigotla ⋅ Ashwin Tudur Sadashiva ⋅ Jorge Salas ⋅ Sun-Joo Cho ⋅ Amanda Goodwin ⋅ Gautam Biswas
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 370
TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation Poster Session 4
Hyeonseop Song ⋅ Seokhun Choi ⋅ Hoseok Do
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 372
Seek to Segment: Active Perception for Panoramic Referring Segmentation Poster Session 4
Song Tang ⋅ Shuming Hu ⋅ Xincheng Shuai ⋅ Henghui Ding ⋅ Yu-Gang Jiang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 373
Single-Query Person-Centric Bimanual Hand-Object Interaction Detection Poster Session 4
Jonghyun Kim ⋅ Junho Roh ⋅ Yubin Yoon ⋅ Jaechul Kim ⋅ Jungho Lee ⋅ Hyotae Lee ⋅ Jongkuk Park ⋅ Taehwan Hwang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 374
DeCo: Zero-Shot Anomaly Generation through Decoupling and Recoupling Poster Session 4
Shilei Zeng ⋅ Xurui Li ⋅ Yaohan Tang ⋅ Yu Zhou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 375
UniScale: Arbitrary-Scale Anomaly Generation Poster Session 4
Shilei Zeng ⋅ Linxin Guan ⋅ Xurui Li ⋅ Yaohan Tang ⋅ Yu Zhou
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 376
FusionTrack: Collaborative Multi-Object Tracking with Arbitrary Multi-UAVs Poster Session 4
Xiaohe Li ⋅ Pengfei Li ⋅ Kaixin Zhang ⋅ Jiahao Li ⋅ Zide Fan
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 377
Environmental Change Detection for Real-World Change Analysis Poster Session 4
Kyusik Cho ⋅ Suhan Woo ⋅ Hongje Seong ⋅ Euntai Kim
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 378
PADFormer: Pose-agnostic Anomaly Detection from Sparse View Images Poster Session 4
Ruiqi Wang ⋅ Yiming Qian ⋅ FENGGEN YU ⋅ Yuxuan Lu ⋅ Dakuo Wang ⋅ Hao Richard Zhang ⋅ Jing Huang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 379
SplitHDR: Saturation-Aware HDR Recovery and Denoising for Real-Time Detection Poster Session 4
Jaewon Kim ⋅ Sol Namkung ⋅ Dongsuk Jeon
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 380
DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution Poster Session 4
Chaoran Xu ⋅ Chengkan Lv ⋅ Qiyu Chen ⋅ Yunkang Cao ⋅ Feng Zhang ⋅ Zhengtao Zhang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 382
History-Aware Transformation of ReID Features for Multiple Object Tracking Poster Session 4
Ruopeng Gao ⋅ Yuyao Wang ⋅ Chunxu Liu ⋅ Limin Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 383
Beyond Aesthetics: Quantifying Information Loss in Turbid Scenes Poster Session 4
Vasiliki Ismiroglou ⋅ Tasos Benos ⋅ Malte Pedersen ⋅ Stefan Bengtson ⋅ Thomas B. Moeslund
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 384
Rectified Embedding Flow Learning for Aerial Multi-view  Geo-localization Poster Session 4
Hao Ruan ⋅ Jinliang Lin ⋅ Yingxin Lai ⋅ Zhiming Luo ⋅ Shaozi Li ⋅ Yu Zang ⋅ Cheng Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 385
P3-SAM: Native 3D Part Segmentation Poster Session 4
CHANGFENG MA ⋅ YANG LI ⋅ Xinhao Yan ⋅ Jiachen Xu ⋅ Yunhan Yang ⋅ Chunshi Wang ⋅ Zibo Zhao ⋅ Yanwen Guo ⋅ Zhuo Chen ⋅ Chunchao Guo
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 388
Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention Poster Session 4
Haiqing Hao ⋅ Zhipeng Sui ⋅ Rong Zou ⋅ Zijia Dai ⋅ Nikola Zubic ⋅ Davide Scaramuzza ⋅ Wenhui Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 389
Per‑Object IoU Forecasting for Deadline‑Aware Real‑Time Embedded Detection Control Poster Session 4
Erfan Foorginejad ⋅ Akshar Chavan ⋅ Marco Brocanelli
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 390
Compositional Non-Face Re-Identification Pressure under Cumulative Vision Releases Poster Session 4
Tirth Joshi ⋅ Honggang Wang
Recognition, Tracking, Re-ID & Anomaly Detection ExHall # 391
Enhancing Pretrained Model-based Continual Representation Learning via Guided Random Projection Poster Session 2
Ruilin Li ⋅ Heming Zou ⋅ Xiufeng Yan ⋅ Zheming Liang ⋅ Jie Yang ⋅ Chenliang Li ⋅ Xue Yang
Robustness, Privacy, Learning & Theory ExHall # 443
Topology-Weighted Effective Rank: A Zero-Cost Proxy for Training Dynamics Stability in Neural Architecture Search Poster Session 2
Haojie Zhang ⋅ Yeming Yang ⋅ Songbai Liu ⋅ Lijia Ma ⋅ Ka-Chun Wong ⋅ Qiuzhen Lin
Robustness, Privacy, Learning & Theory ExHall # 401
Learning from Adversity: Semantic-Aware Mask Refinement through Adversarial Perturbation Poster Session 2
Beom Young Kim ⋅ Sung Hwang
Robustness, Privacy, Learning & Theory ExHall # 396
Escaping the Low-Frequency Bias: Adversarial Frequency Perturbation for Generalisable Gaze Estimation Poster Session 2
Yang Xu ⋅ Feng Lu
Robustness, Privacy, Learning & Theory ExHall # 397
Fully Rotation-Equivariant Spectral-Spatial Learning for Multispectral Object Detection Poster Session 2
Peng Zhang ⋅ Tingfa Xu ⋅ Shuaihao Han ⋅ Jianan Li
Robustness, Privacy, Learning & Theory ExHall # 398
Don’t Teach Instability, Teach Robustness: Selective Sensitivity Gating for Adversarial Robust Distillation Poster Session 2
Jingqi Ji ⋅ Quan Kong ⋅ Chaojie Gu ⋅ Yuanchao Shu ⋅ Cong Wang
Robustness, Privacy, Learning & Theory ExHall # 399
Ada-VNNs: Adaptive Equivariance for Vector Neural Networks Poster Session 2
Bing Han ⋅ Ruitao Pan ⋅ Yumin Chen ⋅ Peixin Hong ⋅ Weiyuan Liu ⋅ Zhibin Zhao ⋅ Chenxi Wang ⋅ Zhi Zhai
Robustness, Privacy, Learning & Theory ExHall # 430
On the Reliability of Cue Conflict and Beyond Poster Session 2
Pum Jun Kim ⋅ Seung-Ah Lee ⋅ Seongho Park ⋅ Dongyoon Han ⋅ Jaejun Yoo
Robustness, Privacy, Learning & Theory ExHall # 400
This Looks Distinctly Like That: Grounding Interpretable Recognition in Stiefel Geometry against Neural Collapse Poster Session 2
Junhao Jia ⋅ Jiaqi Wang ⋅ Yunyou Liu ⋅ Haodong Jing ⋅ Yueyi Wu ⋅ Xian Wu ⋅ Yefeng Zheng
Robustness, Privacy, Learning & Theory ExHall # 402
Learn to Rank: Visual Attribution by Learning Importance Ranking Poster Session 2
David Schinagl ⋅ Christian Fruhwirth-Reisinger ⋅ Alexander Prutsch ⋅ Samuel Schulter ⋅ Horst Possegger
Robustness, Privacy, Learning & Theory ExHall # 403
GeoDetect: Geometric Adversarial Detection for VLPs Poster Session 2
Afsaneh Hasanebrahimi ⋅ Hanxun Huang ⋅ Christopher Leckie ⋅ James Bailey ⋅ Sarah Erfani
Robustness, Privacy, Learning & Theory ExHall # 404
Geometric Gradient Rectification for Safe Open-Set Semi-Supervised Learning Poster Session 2
Jiahe Chen ⋅ Qian Shao ⋅ Qiyuan Chen ⋅ Jiaying He ⋅ Jintai Chen ⋅ Hongxia Xu ⋅ Jian Wu
Robustness, Privacy, Learning & Theory ExHall # 405
Scaling Laws for Black-box Adversarial Attacks Poster Session 2
Chuan Liu ⋅ Huanran Chen ⋅ Yichi Zhang ⋅ Jun Zhu ⋅ Yinpeng Dong
Robustness, Privacy, Learning & Theory ExHall # 406
One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models Poster Session 2
Xiaohao Xu ⋅ Feng Xue ⋅ Xiang Li ⋅ Haowei Li ⋅ Shusheng Yang ⋅ Tianyi Zhang ⋅ Matthew Johnson-Roberson ⋅ Xiaonan Huang
Robustness, Privacy, Learning & Theory ExHall # 407
Data Circuit Breaker: Identifying Training, Test, and Generated Data in Image Generative Models Poster Session 2
Bihe Zhao ⋅ Michel Meintz ⋅ Juangui Xu ⋅ Franziska Boenisch ⋅ Adam Dziedzic
Robustness, Privacy, Learning & Theory ExHall # 408
Denoised Variance-Based Pruning with Optimal Brain Bias Compensation Poster Session 2
Geon Tack Lee ⋅ Choo Jaegul ⋅ Kang Eun Jeon
Robustness, Privacy, Learning & Theory ExHall # 409
Adaptive Neural Dynamics for Robust Geometric LiDAR-Inertial State Estimation on UAVs Poster Session 2
Sitian Peng ⋅ Rui Wang
Robustness, Privacy, Learning & Theory ExHall # 410
Compact and Structurally Transparent Cervical Cytology with Geometry-Driven Features and Closed-Form Attention Poster Session 2
Dichao Liu
Robustness, Privacy, Learning & Theory ExHall # 411
REDistill: Robust Estimator Distillation for Balancing Robustness and Efficiency Poster Session 2
Ondrej Tybl ⋅ Lukas Neumann
Robustness, Privacy, Learning & Theory ExHall # 412
A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP Poster Session 2
Hodaya Krakover ⋅ Meir Yossef Levi ⋅ Eyal Gofer ⋅ Guy Gilboa
Robustness, Privacy, Learning & Theory ExHall # 441
Beyond Artifacts: Real-Centric Envelope Modeling for Reliable AI-Generated Image Detection Poster Session 2
Ruiqi Liu ⋅ Yi Han ⋅ Zhengbo Zhang ⋅ Liwei Yao ⋅ Zhiyuan Yan ⋅ Jialiang Shen ⋅ ZhiJin Chen ⋅ Manni Cui ⋅ Boyi Sun ⋅ Lubin Weng ⋅ Jing Dong ⋅ Yan Wang ⋅ Shu Wu
Robustness, Privacy, Learning & Theory ExHall # 413
TR-MoE: Temporal Reliability-Aware Mixture-of-Experts for Robust Tracking Poster Session 2
Tianle Wang ⋅ Xiangyang Yang ⋅ Jihua Zhu ⋅ Binrui Liu ⋅ Yanzhao Li ⋅ Shuiwang Li
Robustness, Privacy, Learning & Theory ExHall # 414
Different Changes Require Different Reasoning: Change-Type-Specialized Experts for Robust Change Captioning Poster Session 2
Jiyoung Park ⋅ InJae Oh ⋅ Jung Uk Kim
Robustness, Privacy, Learning & Theory ExHall # 415
Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection Poster Session 2
Wenkui Yang ⋅ chao jin ⋅ Haisu Zhu ⋅ Weilin Luo ⋅ Derek Yuen ⋅ Kun Shao ⋅ Junxian Duan ⋅ Huaibo Huang ⋅ Jie Cao ⋅ Ran He
Robustness, Privacy, Learning & Theory ExHall # 416
Leveraging Dark Knowledge for Intrinsic Multimodal Out-of-Distribution Detection Poster Session 2
Nimeshika Udayangani Hewa Dehigahawattage ⋅ Sarah Erfani ⋅ Christopher Leckie
Robustness, Privacy, Learning & Theory ExHall # 483
Simple Filtering Improves Masked Autoencoders Poster Session 2
Takumi Kobayashi
Robustness, Privacy, Learning & Theory ExHall # 482
Breaking High Confidence: Practical Face Impersonation under High-Security Thresholds Poster Session 2
Changjin Kim ⋅ Seunghun Paik ⋅ Dongsoo Kim ⋅ Jae Hong Seo
Robustness, Privacy, Learning & Theory ExHall # 481
Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation Poster Session 2
Lucas Görnhardt ⋅ Timo Bartels ⋅ Niklas Schwarz ⋅ Tim Fingscheidt
Robustness, Privacy, Learning & Theory ExHall # 480
D-VLAM: Differential Vision and Language Mixing for Rehearsal Free Continual Learning Poster Session 2
Muhammad Anwar Ma'sum ⋅ Mohsen Guizani ⋅ Waseem Ullah
Robustness, Privacy, Learning & Theory ExHall # 479
Deep Noise Label Learning via Effective Rank Reduction Poster Session 2
Changyi Ma ⋅ Zihan Fang ⋅ Lihua Zhou ⋅ Tao Li ⋅ Wenyu Liu ⋅ Runsheng Yu ⋅ Xuan Song
Robustness, Privacy, Learning & Theory ExHall # 478
Multi-Anchor Distillation with Text-Guided Analytic Classifier for Continual Learning Poster Session 2
Qier Meng ⋅ De Cheng ⋅ Jiahao Li ⋅ Cheng Deng
Robustness, Privacy, Learning & Theory ExHall # 477
FaceArmor: A Universal Facial Image Protection Against Diffusion-Based Manipulations Poster Session 2
Yiming Wang ⋅ Jiahao Chen ⋅ Qingming Li ⋅ Chunyi Zhou ⋅ Zhi Chen ⋅ Lingzhong Meng ⋅ Jinbao Li ⋅ Shouling Ji
Robustness, Privacy, Learning & Theory ExHall # 476
Dynamic-V2C: Editable and Continual Vision-to-Concept Bottleneck Models via Influence Functions Poster Session 2
Songning Lai ⋅ Shaofeng Liang ⋅ Jiayu Yang ⋅ Ninghui Feng ⋅ Yuxuan Fan ⋅ Wenshuo Chen
Robustness, Privacy, Learning & Theory ExHall # 475
Prior-Conditioned Gaussian Discriminants for Generalizable AI-generated Image Detection Poster Session 2
Shashank Kotyan ⋅ Makoto Shing ⋅ Yuki Imajuku ⋅ Rujikorn Charakorn ⋅ Tarin Clanuwat
Robustness, Privacy, Learning & Theory ExHall # 474
Improving Adversarial Robustness by Mitigating Instability through Relearning Poster Session 2
Yi Zeng ⋅ Ling Zhou ⋅ Ruilong Yu ⋅ Qihe Liu ⋅ Shijie Zhou
Robustness, Privacy, Learning & Theory ExHall # 473
Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks Poster Session 2
Yaohua Liu ⋅ Yifan Guo ⋅ Jiaxin Gao
Robustness, Privacy, Learning & Theory ExHall # 472
DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders Poster Session 2
Syed Irfan Ali Meerza ⋅ Oktay Ozturk ⋅ Amir Sadovnik ⋅ Jian Liu
Robustness, Privacy, Learning & Theory ExHall # 471
Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations Poster Session 2
Jonas Klotz ⋅ Cassio F. Dantas ⋅ Pallavi Jain ⋅ Diego Marcos ⋅ Begüm Demir
Robustness, Privacy, Learning & Theory ExHall # 470
MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE Poster Session 2
Junzhe Li ⋅ Yutao Cui ⋅ Tao Huang ⋅ Chuxuan Zeng ⋅ Weijie Kong ⋅ Yinping Ma ⋅ Chun Fan ⋅ Miles Yang ⋅ Zhao Zhong ⋅ Liefeng Bo
Robustness, Privacy, Learning & Theory ExHall # 469
Puppet-CNN: Continuous Parameter Dynamics for Input-Adaptive Convolutional Networks Poster Session 2
Yucheng Xing ⋅ Xin Wang
Robustness, Privacy, Learning & Theory ExHall # 468
OrthoEraser: Coupled-Neuron Orthogonal Projection for Concept Erasure Poster Session 2
Chuancheng Shi ⋅ Wenhua Wu ⋅ Fei Shen ⋅ Xiaogang Zhu ⋅ Kun Hu ⋅ Zhiyong Wang
Robustness, Privacy, Learning & Theory ExHall # 395
iSyncTab: Learning Cross-Modal Feature Sequencing for Image-Tabular Data via Neural Synchrony Poster Session 2
Al Zadid Sultan Bin Habib ⋅ Md Younus Ahamed ⋅ Prashnna Gyawali ⋅ Gianfranco Doretto ⋅ Donald Adjeroh
Robustness, Privacy, Learning & Theory ExHall # 467
Causal Intervention in Concept Bottleneck Models Poster Session 2
Zhiyu Zhu ⋅ Jiayu Zhang ⋅ Zhibo Jin ⋅ Xinyi Wang ⋅ Fang Chen ⋅ Przemyslaw Biecek ⋅ Jianlong Zhou
Robustness, Privacy, Learning & Theory ExHall # 466
Mapping the Concept Landscape: Structural Perception of Global Distributions for Transparent Data Pruning Poster Session 2
Dongyue Wu ⋅ Tao Ma
Robustness, Privacy, Learning & Theory ExHall # 465
SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts Poster Session 2
Haida Feng ⋅ Hao Wei ⋅ Haolin Wang ⋅ Shiwei Li ⋅ Chade Li ⋅ Yihong Wu
Robustness, Privacy, Learning & Theory ExHall # 464
Structured-Noise Masked Modeling for Video, Audio and Beyond Poster Session 2
Aritra Bhowmik ⋅ Carlos Hinojosa ⋅ Fida Mohammad Thoker ⋅ Bernard Ghanem ⋅ Cees Snoek
Robustness, Privacy, Learning & Theory ExHall # 463
Bridging Theory and Practice in Source-Free Domain Adaptation via Adversarial Proxy Perturbation Poster Session 2
Dexuan Zhang ⋅ Qianyu Zhou ⋅ Thomas Westfechtel ⋅ Yusuke Mukuta ⋅ Tatsuya Harada
Robustness, Privacy, Learning & Theory ExHall # 462
BrainRiem: Riemannian Prototype Learning for Source-Free Cross-Site Brain Network Diagnosis Poster Session 2
Kunyu Zhang ⋅ Tianxiang Xu
Robustness, Privacy, Learning & Theory ExHall # 461
SPICE: Simple Polysemantic feature Interpretation via Clustering-based Explanations Poster Session 2
Sehyun Lee ⋅ Dahee Kwon ⋅ Damin Lee ⋅ Jaesik Choi
Robustness, Privacy, Learning & Theory ExHall # 460
Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification Poster Session 2
Nicolas Sournac ⋅ Ahmed Jmaa ⋅ Bertrand Braeckeveldt
Robustness, Privacy, Learning & Theory ExHall # 459
UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models Poster Session 2
Lei Tan ⋅ Shuwei Li ⋅ Mohan Kankanhalli ⋅ Robby T. Tan
Robustness, Privacy, Learning & Theory ExHall # 458
Noise-Robust Face Recognition via Non-target Similarity Distribution Guided Sample Selection Poster Session 2
Fanglong Wu ⋅ Youqiang Gui ⋅ Cheng Peng
Robustness, Privacy, Learning & Theory ExHall # 457
When Higher Order Hurts: Pre-Asymptotic Order Collapse in Generative ODE Sampling — A Theory of Discretization–Learning Interaction Poster Session 2
Farzad Salajegheh ⋅ Sudhir Mudur
Robustness, Privacy, Learning & Theory ExHall # 456
VICAL: Vicinal Consistency Alignment for Long-Tailed Visual Recognition Poster Session 2
Jianggang Zhu ⋅ Zheng Wang ⋅ Bin Zhu ⋅ Yi-Ping Phoebe Chen ⋅ Jingjing Chen
Robustness, Privacy, Learning & Theory ExHall # 455
Implicit Neural Representation Facilitates Unified Universal Vision Encoding Poster Session 2
Matthew Gwilliam ⋅ Xiao Wang ⋅ Xuefeng Hu ⋅ Zhenheng Yang
Robustness, Privacy, Learning & Theory ExHall # 454
REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection Poster Session 2
Huangsen Cao ⋅ Qin Mei ⋅ Zhiheng Li ⋅ Yuxi Li ⋅ Zhan Meng ⋅ Ying Zhang ⋅ Chen Li ⋅ Zhimeng Zhang ⋅ Xin Ding ⋅ Yongwei Wang ⋅ Jing LYU ⋅ Fei Wu
Robustness, Privacy, Learning & Theory ExHall # 453
Robustness Emerges Early in Training Dynamics, but Is Not Preserved Poster Session 2
Jiangang Yang ⋅ Wenhui Shi ⋅ Lu Hu ⋅ Jing Xing ⋅ Jian Liu
Robustness, Privacy, Learning & Theory ExHall # 452
Explainability-aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors Poster Session 2
Chengzeng You ⋅ Binbin Xu ⋅ Soteris Demetriou
Robustness, Privacy, Learning & Theory ExHall # 451
RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations Poster Session 2
Woo Jae Kim ⋅ Kyle Min ⋅ Suhyeon Ha ⋅ Joonsung Jeon ⋅ Sung-eui Yoon
Robustness, Privacy, Learning & Theory ExHall # 450
Spectral Gating via Damped Oscillations for Adaptive Implicit Neural Representations Poster Session 2
Alex Costanzino ⋅ Pierluigi Zama Ramirez ⋅ Giuseppe Lisanti ⋅ Luigi Di Stefano
Robustness, Privacy, Learning & Theory ExHall # 449
Closing the Capacity–Convergence Gap: Globally Optimal Configuration of Implicit Neural Representations Poster Session 2
Sipeng Chen ⋅ Yan Zhang ⋅ Shibo Li
Robustness, Privacy, Learning & Theory ExHall # 448
Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions Poster Session 2
Qiuchi Xiang ⋅ Haoxuan Qu ⋅ Hossein Rahmani ⋅ Jun Liu
Robustness, Privacy, Learning & Theory ExHall # 447
Exposing Implicit Vulnerabilities in Text-to-Image Models via Adversarial Agentic Probing Poster Session 2
Chang Ma ⋅ Junlin Han ⋅ Shuo Chen ⋅ Runjia Li ⋅ Philip Torr ⋅ Jindong Gu
Robustness, Privacy, Learning & Theory ExHall # 446
AracNet: Revealing Debiasing Signals across Layers with Shallow Monitors Poster Session 2
Vito Paolo Pastore ⋅ Massimiliano Ciranni ⋅ Enzo Tartaglione ⋅ Vittorio Murino
Robustness, Privacy, Learning & Theory ExHall # 445
BackTranslation2.0 - A Linguistically Motivated Metric to Assess Sign Language Production Poster Session 2
Oliver Cory ⋅ Maksym Ivashechkin ⋅ Oline Ranum ⋅ Jian He Low ⋅ Edward Fish ⋅ Anton Pelykh ⋅ Karahan Sahin ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
Robustness, Privacy, Learning & Theory ExHall # 444
Beyond Filter Pruning: Top-K Spatial Selection for Efficient Neural Networks Poster Session 2
Sarthak Ketanbhai Modi ⋅ Hans Soegeng ⋅ Thomas Peyrin
Robustness, Privacy, Learning & Theory ExHall # 442
Calibrated Harmonic Overlaid Implicit Neural Representations for Multi-Dimensional Data Poster Session 2
Honghang Chen ⋅ XIUJUN ZHANG ⋅ Xiaoli Sun ⋅ MINGQING XIAO
Robustness, Privacy, Learning & Theory ExHall # 440
ORBIT: Overcoming Hallucination Risks via Bi-manifold Interaction and Traction Poster Session 2
Zhehan Kan ⋅ Yanlin Liu ⋅ Xiaochen Yang ⋅ Hongyang Yu ⋅ Qingmin Liao ⋅ Wenming Yang
Robustness, Privacy, Learning & Theory ExHall # 439
Rethinking Temporal Modeling in Visual Object Tracking via Decoupled Auxiliary Supervision Poster Session 2
Dailing Zhang ⋅ Shiyu Hu ⋅ Honghao Fu ⋅ Xiaokun Feng ⋅ Yipei Wang ⋅ Kang Hao Cheong ⋅ Kaiqi Huang
Robustness, Privacy, Learning & Theory ExHall # 438
Geometry Aware Reliable Instance Selection for Noisy Partial Label Learning Poster Session 2
Rohit Sinha ⋅ Saroj Kumar
Robustness, Privacy, Learning & Theory ExHall # 437
Spectral Gradient Orthogonalization Improves Differentially Private Training at Scale Poster Session 2
Sabari Shanmugam ⋅ Nick Barnes ⋅ Kerry Taylor
Robustness, Privacy, Learning & Theory ExHall # 436
Proteus: Model Leakage-Induced Adversarial Attack in Federated Learning Poster Session 2
Junjie Shan ⋅ Yue Zhang ⋅ Ziqi Zhao ⋅ Ka Ho Chow
Robustness, Privacy, Learning & Theory ExHall # 435
SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations Poster Session 2
Jason Wu ⋅ Shir-Kang Jin ⋅ Yuyang Yuan ⋅ Maggie Wigness ⋅ Lance Kaplan ⋅ Hang Qiu ⋅ Mani Srivastava
Robustness, Privacy, Learning & Theory ExHall # 434
Geometry-Anchored Transport Framework for Exemplar-Free Class-Incremental Learning Poster Session 2
Hongye Xu ⋅ Bartosz Krawczyk
Robustness, Privacy, Learning & Theory ExHall # 433
Weight Feedback Computes the Exact Jacobian Transpose in Modern Deep Networks Poster Session 2
Junlong Shen ⋅ Xingyu Li
Robustness, Privacy, Learning & Theory ExHall # 432
On the Plasticity Collapse in Continual Machine Unlearning Poster Session 2
Yingdan Shi ⋅ Xiang Xu ⋅ Kaize Ding ⋅ Alfred Hero ⋅ Ren Wang
Robustness, Privacy, Learning & Theory ExHall # 431
Fast and Flexible Robustness Certificates for Semantic Segmentation Poster Session 2
Thomas Massena ⋅ Corentin Friedrich ⋅ Franck Mamalet ⋅ Mathieu Serrurier
Robustness, Privacy, Learning & Theory ExHall # 429
LoRC: Detecting AI-Generated Images via Low-Rank Collapse in the Semantic-Residual Space Poster Session 2
Haozhen Yan ⋅ Ruoxin Chen ⋅ Jiahui Zhan ⋅ Taiping Yao ⋅ Bo Wang ⋅ Youchang xiao ⋅ Shouhong Ding ⋅ Liqing Zhang ⋅ Jianfu Zhang
Robustness, Privacy, Learning & Theory ExHall # 428
IConE: Batch Independent Collapse Prevention for Self-Supervised Representation Learning Poster Session 2
Konstantinos Almpanakis ⋅ Anna Kreshuk
Robustness, Privacy, Learning & Theory ExHall # 427
Defending from GeoLocalization through Adversarial Road Trips Poster Session 2
Niccolò Niccoli ⋅ Federico Becattini ⋅ Lorenzo Seidenari
Robustness, Privacy, Learning & Theory ExHall # 426
Weight-Space Mixture-of-Experts for Implicit Neural Representation Classification Poster Session 2
Stanisław Janik ⋅ Michal Byra
Robustness, Privacy, Learning & Theory ExHall # 425
R-ESC: Robustly Erasing Space Concepts via Stochastic Feature Remapping Poster Session 2
Kang Eun Jeon ⋅ Yunsung Kang ⋅ Do Kang ⋅ Tae-Young Lee ⋅ Gyeong-Moon Park ⋅ Jong Hwan Ko
Robustness, Privacy, Learning & Theory ExHall # 424
Intrinsically Stable Spiking Neural Networks: Overcoming the Performance Barrier in the Absence of Batch Normalization Poster Session 2
Ruichen Ma ⋅ Xiaoyang Zhang ⋅ Jian Bai ⋅ Guanchao Qiao ⋅ Liwei Meng ⋅ Ning Ning ⋅ Yang Liu ⋅ Shaogang Hu
Robustness, Privacy, Learning & Theory ExHall # 423
ProtoMappingNet: Interpretable Hierarchical Prototypes through Relational Prototype Mappings Poster Session 2
Jaehun Park ⋅ Jongmin Lim ⋅ Soobin Cha ⋅ Kwangsu Kim
Robustness, Privacy, Learning & Theory ExHall # 422
Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer Poster Session 2
Qi Song ⋅ Ziyuan Luo ⋅ Haoliang Han ⋅ Renjie Wan
Robustness, Privacy, Learning & Theory ExHall # 421
Learning Probabilistic Prompt for Continual Learning Poster Session 2
Hyekang Park ⋅ Sanghoon Lee ⋅ Geon Lee ⋅ Jongyoun Noh ⋅ BUMSUB HAM
Robustness, Privacy, Learning & Theory ExHall # 420
Frequency Director: Learnable Mixture of Frequency Experts for Unified Concealed Scene Segmentation Poster Session 2
Guangqian Guo ⋅ Aixi Ren ⋅ Xuehui Yu ⋅ Pengxu Wei ⋅ Yong Guo ⋅ shan gao
Robustness, Privacy, Learning & Theory ExHall # 419
Spectral-Aware Analytic Class-Incremental Learning for Long-Tailed Distributions Poster Session 2
Quyen Tran ⋅ Ngoc-Hai Nguyen ⋅ Minh Quan Dao ⋅ Zhuowei Li ⋅ Nam Hai ⋅ Trung Le ⋅ Dimitris N. Metaxas
Robustness, Privacy, Learning & Theory ExHall # 417
Look But Don't Touch with Sparse Autoencoders for Unlearning in Diffusion Models Poster Session 2
Enrico Cassano ⋅ Riccardo Renzulli ⋅ Rayyan Ahmed ⋅ Stephan Alaniz ⋅ Marco Grangetto
Robustness, Privacy, Learning & Theory ExHall # 418
Beyond Inpainting: Unleash 3D Understanding for Stable Camera-Controlled Video Re-rendering Poster Session 3
Dongyu Chen ⋅ Yixin Guo ⋅ Shuojin Yang ⋅ Tai-Jiang Mu ⋅ Shimin Hu
Video Generation, Avatars & Dynamic Worlds ExHall # 313
Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Generation Poster Session 3
Seong Jong Yoo ⋅ Siyuan Peng ⋅ Felix Gu ⋅ Stratis Aloimonos ⋅ Cornelia Fermuller
Video Generation, Avatars & Dynamic Worlds ExHall # 420
MLVC: A Multi-platform Learned Video Codec for Real-World Deployment Poster Session 3
Tanel Pärnamaa ⋅ Martin Lumiste ⋅ Ardi Loot ⋅ Evgenii Indenbom ⋅ Andrei Znobishchev ⋅ Ando Saabas
Video Generation, Avatars & Dynamic Worlds ExHall # 363
MotionEditGS: Editing Motion and Appearance of 4D Scenes from Monocular Video via Semantically Anchored Gaussians Poster Session 3
Daehyun We ⋅ Youngho Yoon ⋅ Jiyong Boo ⋅ KUK-JIN YOON
Video Generation, Avatars & Dynamic Worlds ExHall # 395
PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation Poster Session 3
Kexu Cheng ⋅ Zicheng Liu ⋅ Mingju Gao ⋅ Chunhe Song ⋅ Hao Tang
Video Generation, Avatars & Dynamic Worlds ExHall # 430
AutoPhyX: Automatic Text-Condition Physics Property Generation Poster Session 3
Bei Huang ⋅ Yixin Chen ⋅ Hongbin Zha ⋅ Yuru Pei ⋅ Siyuan Huang
Video Generation, Avatars & Dynamic Worlds ExHall # 385
PLOT: Pseudo-Labeling via Object Tracking for Monocular 3D Object Detection Poster Session 3
SeokYeong Lee ⋅ Sithu Aung ⋅ JunYong Choi ⋅ Seungryong Kim ⋅ Ig-Jae Kim ⋅ Junghyun Cho
Video Generation, Avatars & Dynamic Worlds ExHall # 384
GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion Poster Session 3
Jing Wang ⋅ Haoran Xiong ⋅ Zihao Yan ⋅ Minglun Gong ⋅ Hui Huang
Video Generation, Avatars & Dynamic Worlds ExHall # 319
BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal Poster Session 3
Yiğit Ekin ⋅ Enes Şanlı ⋅ Aykut Erdem ⋅ Erkut Erdem ⋅ Aysegul Dundar
Video Generation, Avatars & Dynamic Worlds ExHall # 383
REON-NVS: Real-Time Online Novel-View Synthesis from Sparse-View Videos Poster Session 3
Daeyeon Kim ⋅ Jinhyeok Kim ⋅ Gangmin Kwon ⋅ Seungjoo Shin ⋅ Sunghyun Cho
Video Generation, Avatars & Dynamic Worlds ExHall # 318
NeuIDO: Neural Intrinsic Dynamics Operator for Physics-Informed 4D World Models Poster Session 3
Jiajing Lin ⋅ Xin Zhang ⋅ Jianhua Sun
Video Generation, Avatars & Dynamic Worlds ExHall # 382
MemLearner: Learning to Query Context Memory for Video World Models Poster Session 3
Jiwen Yu ⋅ Jianxiong Gao ⋅ Jianhong Bai ⋅ Yiran Qin ⋅ Kaiyi Huang ⋅ Quande Liu ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Xihui Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 317
EgoExoMoCap: Distributed Human Motion Capture via Ego- and Exocentric Body Tracking from Head-Mounted Devices Poster Session 3
Jiaxi Jiang ⋅ Bharat Bhatnagar ⋅ Nan Yang ⋅ Lingni Ma ⋅ Sebastian Starke ⋅ Robin Kips ⋅ Nadine Bertsch (Rueegg) ⋅ Christian Holz ⋅ Federica Bogo
Video Generation, Avatars & Dynamic Worlds ExHall # 372
PhysConvex: Physics-Informed Dynamic Convex Fields for Reconstruction and Simulation Poster Session 3
Dan Wang ⋅ Xinrui Cui ⋅ Serge Belongie ⋅ Ravi Ramamoorthi
Video Generation, Avatars & Dynamic Worlds ExHall # 381
ConfCtrl: Enabling Precise Camera Control in Video Diffusion via Confidence-Aware Interpolation Poster Session 3
Liudi Yang ⋅ George Eskandar ⋅ Fengyi Shen ⋅ Mohammad Altillawi ⋅ Yang Bai ⋅ Chi zhang ⋅ Ziyuan Liu ⋅ Abhinav Valada
Video Generation, Avatars & Dynamic Worlds ExHall # 316
Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion Poster Session 3
Dongseok Shim ⋅ Julian Tanke ⋅ Kengo Uchida ⋅ christian simon ⋅ Koichi Saito ⋅ Takashi Shibuya ⋅ Shusuke Takahashi ⋅ Yuki Mitsufuji
Video Generation, Avatars & Dynamic Worlds ExHall # 231
The Dynamic Prior: Understanding 3D Structures for Casual Dynamic Videos Poster Session 3
Zhuoyuan Wu ⋅ Xurui Yang ⋅ Jiahui Huang ⋅ Yue Wang ⋅ Jun Gao
Video Generation, Avatars & Dynamic Worlds ExHall # 380
Inference-time Motion Calibration for Video Generation Poster Session 3
Zile Huang ⋅ Ser-Nam Lim
Video Generation, Avatars & Dynamic Worlds ExHall # 315
Learn2Fold: Structured Origami Generation with World Model Planning Poster Session 3
Yanjia Huang ⋅ Yunuo Chen ⋅ Ying Jiang ⋅ Zhengzhong Tu ⋅ Yin Yang ⋅ Chenfanfu Jiang
Video Generation, Avatars & Dynamic Worlds ExHall # 379
Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video Poster Session 3
Ikechukwu D Adebi ⋅ Sagnik Majumder ⋅ Kristen Grauman
Video Generation, Avatars & Dynamic Worlds ExHall # 378
Fast Sam 3D Body: Accelerating SAM 3D Body for Real-Time Full-Body Human Mesh Recovery Poster Session 3
Timing Yang ⋅ Sicheng He ⋅ Hongyi Jing ⋅ Jiawei Yang ⋅ Zhijian Liu ⋅ Chuhang Zou ⋅ Yue Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 334
AnyView: Synthesizing Any Novel View in Dynamic Scenes Poster Session 3
Basile Van Hoorick ⋅ Dian Chen ⋅ Shun Iwase ⋅ Pavel Tokmakov ⋅ Muhammad Zubair Irshad ⋅ Igor Vasiljevic ⋅ Swati Gupta ⋅ Fangzhou Cheng ⋅ Sergey Zakharov ⋅ Vitor Guizilini
Video Generation, Avatars & Dynamic Worlds ExHall # 377
HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion Poster Session 3
Di Chang ⋅ Ji Hou ⋅ Aljaz Bozic ⋅ Assaf Neuberger ⋅ Felix Juefei-Xu ⋅ Olivier Maury ⋅ Gene Lin ⋅ Tuur Stuyck ⋅ Doug Roble ⋅ Mohammad Soleymani ⋅ Stéphane Grabli
Video Generation, Avatars & Dynamic Worlds ExHall # 376
Reconstruction by Generation: 3D Multi-Object Scene Reconstruction from Sparse Observations Poster Session 3
Andrii Zadaianchuk ⋅ Leonardo Barcellona ⋅ Lennard Schuenemann ⋅ Christian Gumbsch ⋅ Zehao Wang ⋅ Muhammad Zubair Irshad ⋅ Fabien Despinoy ⋅ Rahaf Aljundi ⋅ Efstratios Gavves ⋅ Sergey Zakharov
Video Generation, Avatars & Dynamic Worlds ExHall # 375
Pro-Pose: Unpaired Full-Body Portrait Synthesis via Canonical UV Maps Poster Session 3
Sandeep Mishra ⋅ Yasamin Jafarian ⋅ Andreas Lugmayr ⋅ Yingwei Li ⋅ Varsha Ramakrishnan ⋅ Srivatsan Varadharajan ⋅ Alan Bovik ⋅ Ira Kemelmacher-Shlizerman
Video Generation, Avatars & Dynamic Worlds ExHall # 374
SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting Poster Session 3
Haozheng Yu ⋅ Xinyu Yang ⋅ Rundong Luo ⋅ Jennifer Sun ⋅ Bharath Hariharan
Video Generation, Avatars & Dynamic Worlds ExHall # 314
SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation Poster Session 3
Sung-Yeon Park ⋅ Adam Lee ⋅ Juanwu Lu ⋅ Can Cui ⋅ Luyang Jiang ⋅ Rohit Gupta ⋅ Kyungtae Han ⋅ Ahmadreza Moradipari ⋅ Ziran Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 373
Generative Relightable Avatars Poster Session 3
Kunwar Singh ⋅ Christian Theobalt ⋅ Rishabh Dabral
Video Generation, Avatars & Dynamic Worlds ExHall # 371
StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation Poster Session 3
Furkan Guzelant ⋅ Arda Goktogan ⋅ Tarık Kaya ⋅ Aysegul Dundar
Video Generation, Avatars & Dynamic Worlds ExHall # 370
SpEmoC: A Balanced Speaker-Segment Multimodal Emotion Benchmark Poster Session 3
Sania Bano ⋅ Shahzad Ahmad ⋅ Santosh Kumar Vipparthi ⋅ Sukalpa Chanda ⋅ Subrahmanyam Murala
Video Generation, Avatars & Dynamic Worlds ExHall # 369
Taming Camera-Controlled Video Generation with Verifiable Geometry Reward Poster Session 3
Zhaoqing Wang ⋅ Xiaobo Xia ⋅ Zhuolin Bie ⋅ Jinlin Liu ⋅ Dongdong Yu ⋅ Jiawang Bian ⋅ Changhu Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 312
SignSparK: Efficient Multilingual Sign Language Production via Sparse Keyframe Learning Poster Session 3
Jian He Low ⋅ Alexandre Symeonidis-Herzig ⋅ Maksym Ivashechkin ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
Video Generation, Avatars & Dynamic Worlds ExHall # 368
EchoStyle: Unlocking High-Fidelity Video Stylization with Reverse Data Synthesis Poster Session 3
Huaqiu Li ⋅ Jiahao Wang ⋅ Sijia Cai ⋅ Hualian Sheng ⋅ Bing Deng ⋅ Jieping Ye ⋅ Wenhan Luo
Video Generation, Avatars & Dynamic Worlds ExHall # 367
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents Poster Session 3
Yu Zhang ⋅ Kaiyuan Shen ⋅ Yang Li
Video Generation, Avatars & Dynamic Worlds ExHall # 366
In-Context Sync-LoRA for Portrait Video Editing Poster Session 3
Sagi Polaczek ⋅ Or Patashnik ⋅ Ali Mahdavi-Amiri ⋅ Danny Cohen-Or
Video Generation, Avatars & Dynamic Worlds ExHall # 365
FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility Poster Session 3
Yihalem Yimolal Tiruneh ⋅ Muhammad Salman Ali ⋅ Uyoung Jeong ⋅ Muneeb Khan ⋅ MD Sayem ⋅ ALLANUR BAYRAMGELDIYEV ⋅ Binod Bhattarai ⋅ Seungryul Baek
Video Generation, Avatars & Dynamic Worlds ExHall # 284
ETCH-X: Robustify Expressive Body Fitting to Clothed Humans with Composable Synthetic Data Poster Session 3
Xiaoben Li ⋅ Jingyi Wu ⋅ Zeyu CAI ⋅ YU Siyuan ⋅ Boqian Li ⋅ Yuliang Xiu
Video Generation, Avatars & Dynamic Worlds ExHall # 364
Seeing Fast and Slow: Learning the Flow of Time in Videos Poster Session 3
Yen-Siang Wu ⋅ Rundong Luo ⋅ Jingsen Zhu ⋅ Tao Tu ⋅ Ali Farhadi ⋅ Matthew Wallingford ⋅ Yu-Chiang Frank Wang ⋅ Steve Marschner ⋅ Wei-Chiu Ma
Video Generation, Avatars & Dynamic Worlds ExHall # 362
MotionDreamer: Universal Skeletal Motion Generation for 3D Rigged Shapes Poster Session 3
Ye Tao ⋅ Yuxin Yao ⋅ Kendong Liu ⋅ Dapeng Wu ⋅ Junhui Hou
Video Generation, Avatars & Dynamic Worlds ExHall # 361
Tuning-free Visual Effect Transfer across Videos Poster Session 3
Maxwell Jones ⋅ Rameen Abdal ⋅ Or Patashnik ⋅ Ruslan Salakhutdinov ⋅ Sergey Tulyakov ⋅ Jun-Yan Zhu ⋅ Kuan-Chieh Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 360
OctWorld: Long-Range World-Consistent Video Generation with Octree-based 3D Mapping Poster Session 3
Zelong Lv ⋅ Sicheng Xu ⋅ Jianfeng Xiang ⋅ Yue Dong ⋅ Ruicheng Wang ⋅ Yu Deng ⋅ Guangzhong Sun ⋅ Jiaolong Yang
Video Generation, Avatars & Dynamic Worlds ExHall # 311
Kirin: Animal Motion Generation from In-the-Wild Video Poster Session 3
Brian Nlong Zhao ⋅ Zhuoyang Pan ⋅ James Rehg ⋅ Jiajun Wu ⋅ Elliott (Shangzhe) Wu
Video Generation, Avatars & Dynamic Worlds ExHall # 310
OmniColor: A Unified Framework for Multi-modal Lineart Colorization Poster Session 3
Xulu Zhang ⋅ Haoqian DU ⋅ Xiao-Yong Wei ⋅ Li Qing
Video Generation, Avatars & Dynamic Worlds ExHall # 359
Monocular Models are Strong Learners for Multi-View Human Mesh Recovery Poster Session 3
Haoyu Xie ⋅ Shengkai Xu ⋅ Cheng Guo ⋅ Muhammad Saleem ⋅ Wenhan Wu ⋅ Chen Chen ⋅ Ahmed Helmy ⋅ Pu Wang ⋅ Hongfei Xue
Video Generation, Avatars & Dynamic Worlds ExHall # 358
HiChor: Hierarchical Choreography Generation from Pop Music with Choreographic Primitives Poster Session 3
Jungsu Kim ⋅ Jungwoo Huh ⋅ Jeongwook Choi ⋅ Wen-Huang Cheng ⋅ Jian-Yu Jiang-Lin ⋅ Weisi Lin ⋅ Sanghoon Lee
Video Generation, Avatars & Dynamic Worlds ExHall # 357
OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data Poster Session 3
Kaixing Yang ⋅ Jiashu Zhu ⋅ Xulong Tang ⋅ Ziqiao Peng ⋅ Xiangyue Zhang ⋅ Chubin Chen ⋅ Puwei Wang ⋅ Jiahong Wu ⋅ Xiangxiang Chu ⋅ Hongyan Liu ⋅ Jun He
Video Generation, Avatars & Dynamic Worlds ExHall # 309
Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal Poster Session 3
Radim Špetlík ⋅ David Futschik ⋅ Radek Danecek ⋅ Feitong Tan ⋅ Ziqian Bai ⋅ Rohit Pandey ⋅ Yinda Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 308
FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control Poster Session 3
Mingzhi Sheng ⋅ Zekai Gu ⋅ Peng Li ⋅ Cheng Lin ⋅ Hao-Xiang Guo ⋅ Yingcong Chen ⋅ Yuan Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 356
HOIMask: Towards Generative Masked Modeling for Human Object Interaction Generation Poster Session 3
Yihong Ji ⋅ Jinsong Zhang ⋅ He Hu ⋅ Hongboxu Hongboxu
Video Generation, Avatars & Dynamic Worlds ExHall # 355
3D FaceShell: Attribute Transfer in 3D Face Avatars as a VLM Defense Mechanism Poster Session 3
Weston Bondurant ⋅ Srijan Das ⋅ Hieu Le ⋅ Stephanie Schuckers
Video Generation, Avatars & Dynamic Worlds ExHall # 307
One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control Poster Session 3
Zhenxing Mi ⋅ YUXIN WANG ⋅ Dan Xu
Video Generation, Avatars & Dynamic Worlds ExHall # 354
OmniPoser: Flexible Human Motion Recovery in the Wild with Masked Flow Matching Poster Session 3
Minghao Liu ⋅ Tutian Tang
Video Generation, Avatars & Dynamic Worlds ExHall # 306
ID-PreFeR: ID-Preserving Face Restoration with Mixed Data Quality Poster Session 3
Chengxuan Zhu ⋅ Yuchen Hong ⋅ Qingnan Fan ⋅ Qi Zhang ⋅ Bingtao Fu ⋅ Jinxiu Liang ⋅ Jinwei Chen ⋅ Huaqi Zhang ⋅ Chao Xu ⋅ Boxin Shi
Video Generation, Avatars & Dynamic Worlds ExHall # 305
DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation Poster Session 3
Junyi Ouyang ⋅ Wenbin Teng ⋅ Gonglin Chen ⋅ Yajie Zhao ⋅ Haiwei Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 353
Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation Poster Session 3
Dimitrios Karageorgiou ⋅ Symeon Papadopoulos ⋅ Ioannis Kompatsiaris ⋅ Efstratios Gavves
Video Generation, Avatars & Dynamic Worlds ExHall # 466
Head Avatars with Dynamic Explicit Hair Poster Session 3
Vanessa Sklyarova ⋅ Haonan Chen ⋅ Berna Kabadayi ⋅ Tobias Kirschstein ⋅ Zicong Fan ⋅ Xi Wang ⋅ Gerard Pons-Moll ⋅ Matthias Niessner ⋅ Marc Pollefeys ⋅ Michael Black ⋅ Justus Thies
Video Generation, Avatars & Dynamic Worlds ExHall # 352
MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations Poster Session 3
Hejia Chen ⋅ Haoxian Zhang ⋅ Xu He ⋅ Xiaoqiang Liu ⋅ Pengfei Wan ⋅ Shoulong Zhang ⋅ Shuai Li
Video Generation, Avatars & Dynamic Worlds ExHall # 304
LOOM: Weaving Geometry-Consistent Human-Object Interaction Videos via Progressive Curriculum Learning Poster Session 3
Bangya Liu ⋅ Zelin Zhao ⋅ Ziyang Song ⋅ Suman Banerjee ⋅ Xinyu Gong
Video Generation, Avatars & Dynamic Worlds ExHall # 351
Long-term Traffic Simulation via Structured Autoregressive Modeling Poster Session 3
Lingyu XIAO ⋅ Zexin Feng ⋅ Xintao Yan
Video Generation, Avatars & Dynamic Worlds ExHall # 422
Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation Poster Session 3
Min-Jung Kim ⋅ Jeongho Kim ⋅ Hoiyeong Jin ⋅ Junha Hyung ⋅ Choo Jaegul
Video Generation, Avatars & Dynamic Worlds ExHall # 350
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation Poster Session 3
Lei Zhu ⋅ xing cai ⋅ Yingjie Chen ⋅ Li YiHeng ⋅ Binxin Yang ⋅ Hao Liu ⋅ Jie Chen ⋅ Chen Li ⋅ Jing LYU
Video Generation, Avatars & Dynamic Worlds ExHall # 349
Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting Poster Session 3
Ziyuan Xia ⋅ Jingyi Xu ⋅ Chong Cui ⋅ Yuanhong Yu ⋅ Jiazhao Zhang ⋅ Qingsong Yan ⋅ Ni Tao ⋅ Junbo Chen ⋅ Xiaowei Zhou ⋅ Hujun Bao ⋅ Ruizhen Hu ⋅ Sida Peng
Video Generation, Avatars & Dynamic Worlds ExHall # 303
CortexVideo: A Semantic-Spatial Dual-Anchor Framework for High-Fidelity fMRI-to-Video Reconstruction Poster Session 3
Xiaoquan Shen ⋅ Jiaxuan Chen ⋅ Jiajun Li ⋅ Gang Pan
Video Generation, Avatars & Dynamic Worlds ExHall # 348
Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos Poster Session 3
Xavier Thomas ⋅ Youngsun Lim ⋅ Ananya Srinivasan ⋅ Audrey Zheng ⋅ Deepti Ghadiyaram
Video Generation, Avatars & Dynamic Worlds ExHall # 347
FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation Poster Session 3
Kaixing Yang ⋅ Xulong Tang ⋅ Ziqiao Peng ⋅ Xiangyue Zhang ⋅ Chubin Chen ⋅ xukun zhou ⋅ Puwei Wang ⋅ Hongyan Liu ⋅ Jun He
Video Generation, Avatars & Dynamic Worlds ExHall # 346
Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding Poster Session 3
Haolin Xiong ⋅ Tianwen Fu ⋅ Yunxuan Cai ⋅ Pratusha Prasad ⋅ Haiwei Chen ⋅ Wenbin Teng ⋅ Hanyuan Xiao ⋅ Yajie Zhao
Video Generation, Avatars & Dynamic Worlds ExHall # 260
PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction Poster Session 3
Yuankun Yang ⋅ Yi Wei ⋅ Bo Bai ⋅ Wenyang Zhou ⋅ Li Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 345
Progressive Pose-Guided 4D Animal Reconstruction from Monocular Video Poster Session 3
Siyuan Li ⋅ Weiying Chen ⋅ Yilin Wang ⋅ Xinxin Zuo ⋅ Xingyu Li ⋅ Li Cheng
Video Generation, Avatars & Dynamic Worlds ExHall # 344
VERTIGO: Visual Preference Optimization for Cinematic Camera Generation Poster Session 3
Mengtian Li ⋅ Yuwei Lu ⋅ Feifei Li ⋅ Chenqi Gan ⋅ Zhifeng Xie ⋅ Xi WANG
Video Generation, Avatars & Dynamic Worlds ExHall # 343
ActionParty: Multi-Subject Action Binding in Generative Video Games Poster Session 3
Alexander Pondaven ⋅ Ziyi Wu ⋅ Igor Gilitschenski ⋅ Philip Torr ⋅ Sergey Tulyakov ⋅ Fabio Pizzati ⋅ Aliaksandr Siarohin
Video Generation, Avatars & Dynamic Worlds ExHall # 342
Learning Generatable Mutual Distance for Scene-Aware Human Motion Generation Poster Session 3
Zonglin Yang ⋅ Chaoyue Xing ⋅ Yixuan Yin ⋅ Miaomiao Liu ⋅ Liyuan Pan
Video Generation, Avatars & Dynamic Worlds ExHall # 468
PhysPO: Physics-Aware Local Preference Optimization for Physically Consistent Video Diffusion Poster Session 3
Zhuoran Yang ⋅ Yanyong Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 302
Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Synthesis Poster Session 3
Chenghao Qian ⋅ Nedko Savov ⋅ Lingdong Kong ⋅ Yeying Jin ⋅ Rui Song ⋅ Wenjing Li ⋅ Zhun Zhong ⋅ Jiaqi Ma ⋅ Gustav Markkula ⋅ Luc Van Gool
Video Generation, Avatars & Dynamic Worlds ExHall # 300
Unified Panoramic–Gaussian Representation for Monocular 4D Scene Synthesis Poster Session 3
Yuankun Yang ⋅ Yi Wei ⋅ Wenyang Zhou ⋅ Li Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 341
Moiré Video Authentication: A Physical Signature Against AI Video Generation Poster Session 3
Yuan Qing ⋅ Kunyu Zheng ⋅ Lingxiao Li ⋅ Boqing Gong ⋅ Chang Xiao
Video Generation, Avatars & Dynamic Worlds ExHall # 299
StoryBlender: Inter-Shot Consistent and Editable 3D Storyboard with Spatial-temporal Dynamics Poster Session 3
Bingliang Li ⋅ Zhenhong Sun ⋅ Jiaming Bian ⋅ Yuehao Wu ⋅ Yifu Wang ⋅ HONGDONG LI ⋅ Yatao Bian ⋅ Huadong Mo ⋅ Daoyi Dong
Video Generation, Avatars & Dynamic Worlds ExHall # 444
DiTex4D: Direct Text-Driven 4D Generation with Structured Latent Diffusion Poster Session 3
Xiaozhe Chen ⋅ Mengqi Rong ⋅ Jian Liu ⋅ Shuhan Shen
Video Generation, Avatars & Dynamic Worlds ExHall # 301
Towards Robust Driving Perception: A Flexible Scale-Driven Family for Self-Supervised Monocular Depth Estimation Poster Session 3
Zhaowen Zhu ⋅ Li Zhang ⋅ Chen Yujie ⋅ Zhang Tian ⋅ Yingjie Wang ⋅ Mingxia Zhan
Video Generation, Avatars & Dynamic Worlds ExHall # 461
Dynamic World Generation Made Efficient Poster Session 3
Fengrui Tian ⋅ Jinqi Luo ⋅ Uday Kiran Reddy Tadipatri ⋅ Hancheng Min ⋅ Rene Vidal
Video Generation, Avatars & Dynamic Worlds ExHall # 298
3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement Poster Session 3
Deyin Liu ⋅ Jicheng Xu ⋅ Lin Yuanbo Wu ⋅ Xiaowei Zhao ⋅ Xiatian Zhu ⋅ Anjan Dutta ⋅ Zhe Jin
Video Generation, Avatars & Dynamic Worlds ExHall # 340
InsertAnywhere: Geometrically Grounded and Optics-Aware Video Object Insertion Poster Session 3
Hoiyeong Jin ⋅ Hyojin Jang ⋅ Junha Hyung ⋅ Jeongho Kim ⋅ Kinam Kim ⋅ Dongjin Kim ⋅ Huijin choi ⋅ Hyeonji Kim ⋅ Choo Jaegul
Video Generation, Avatars & Dynamic Worlds ExHall # 339
PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling Poster Session 3
Sang-Hun Han ⋅ Min-Gyu Park ⋅ Jisu Shin ⋅ Seunghyun Shin ⋅ JINHWI PARK ⋅ Hae-Gon Jeon
Video Generation, Avatars & Dynamic Worlds ExHall # 338
ReCamDriving: LiDAR-Free Camera-Controlled Video Synthesis for Novel Trajectories Poster Session 3
Yaokun li ⋅ Shuaixian Wang ⋅ Mantang GUO ⋅ Jiehui Huang ⋅ Taojun Ding ⋅ Mu Hu ⋅ Kaixuan Wang ⋅ Shaojie Shen ⋅ Guang Tan
Video Generation, Avatars & Dynamic Worlds ExHall # 337
PHOSA: Photorealistic 3D Sign Avatar Modeling and Benchmark Poster Session 3
Haodong Wang ⋅ Hezhen Hu ⋅ Wengang Zhou ⋅ Houqiang Li
Video Generation, Avatars & Dynamic Worlds ExHall # 336
EMOTE: Expressive Motion and Shape Disentanglement for Human Animation Poster Session 3
Dongbin Zhang ⋅ Hao Liu ⋅ Bingquan Dai ⋅ Kangjie Chen ⋅ Chuming Wang ⋅ Chen Li ⋅ Jing LYU ⋅ Haoqian Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 297
Egocentric World Model for Photorealistic Hand Object Interaction Synthesis Poster Session 3
Dayou Li ⋅ Lulin Liu ⋅ Bangya Liu ⋅ Shijie Zhou ⋅ Jiu Feng ⋅ Ziqi Lu ⋅ Minghui Zheng ⋅ Chenyu You ⋅ Zhiwen Fan
Video Generation, Avatars & Dynamic Worlds ExHall # 296
GimbalDiffusion: Gravity-Aware Camera Control for Video Generation Poster Session 3
Frédéric Fortier-Chouinard ⋅ Yannick Hold-Geoffroy ⋅ Valentin Deschaintre ⋅ Matheus Gadelha ⋅ Jean-Francois Lalonde
Video Generation, Avatars & Dynamic Worlds ExHall # 295
Axolotl3D: a Unified Framework for Faithful 3D Shape Completion Poster Session 3
Anita Hu ⋅ Maria Shugrina
Video Generation, Avatars & Dynamic Worlds ExHall # 294
SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence Poster Session 3
Yulu Pan ⋅ Han Yi ⋅ Seongsu Ha ⋅ Mohaiminul Islam ⋅ Benjamin Zhang ⋅ Lorenzo Torresani ⋅ Gedas Bertasius
Video Generation, Avatars & Dynamic Worlds ExHall # 293
Composing Driving Worlds through Disentangled Control for Adversarial Scenario Generation Poster Session 3
Yifan Zhan ⋅ Zhengqing Chen ⋅ Qingjie Wang ⋅ Zhuo He ⋅ Muyao Niu ⋅ Xiaoyang Guo ⋅ Wei Yin ⋅ Weiqiang Ren ⋅ Qian Zhang ⋅ zheng yinqiang
Video Generation, Avatars & Dynamic Worlds ExHall # 292
Recognizing Co-Speech Gestures in-the-Wild Poster Session 3
Sindhu Hegde ⋅ K R Prajwal ⋅ Andrew ZISSERMAN
Video Generation, Avatars & Dynamic Worlds ExHall # 291
Self-supervised Garment Dynamics with Persistent Wrinkles Poster Session 3
Xiaoyuan Yang ⋅ Deshan Gong ⋅ Taku Komura ⋅ He Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 290
Learning to Generate Rigid Body Interactions with Video Diffusion Models Poster Session 3
David Orlando Romero Mogrovejo ⋅ Ariana Bermudez ⋅ Viacheslav Iablochnikov ⋅ Hao Li ⋅ Fabio Pizzati ⋅ Ivan Laptev
Video Generation, Avatars & Dynamic Worlds ExHall # 289
OmniFace: Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer Poster Session 3
Xu Guo ⋅ Fulong Ye ⋅ Xinghui Li ⋅ Pengqi Tu ⋅ Pengze Zhang ⋅ Qichao Sun ⋅ Songtao Zhao ⋅ Xiangwang Hou ⋅ Qian HE
Video Generation, Avatars & Dynamic Worlds ExHall # 288
ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation Poster Session 3
Hao ZHANG ⋅ Lue Fan ⋅ Weikang Bian ⋅ Zehuan Wu ⋅ Lewei Lu ⋅ Zhaoxiang Zhang ⋅ Hongsheng LI
Video Generation, Avatars & Dynamic Worlds ExHall # 287
InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization Poster Session 3
Ronghui Li ⋅ zhongyuan hu ⋅ Li Siyao ⋅ youliang zhang ⋅ Haozhe Xie ⋅ Mingyuan Zhang ⋅ Jie Guo ⋅ Xiu Li ⋅ Ziwei Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 286
Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods Poster Session 3
Xingsong Ye ⋅ Yongkun Du ⋅ Jiaxin Zhang ⋅ Haojie Zhang ⋅ Chong Sun ⋅ Chen Li ⋅ Jing LYU ⋅ Zhineng Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 285
PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models Poster Session 3
Qiyuan Zhang ⋅ Biao Gong ⋅ Shuai Tan ⋅ Zheng Zhang ⋅ Xing Zhu ⋅ Yujun Shen ⋅ Yuyuan Li ⋅ kelu Yao ⋅ Chunhua Shen ⋅ Changqing Zou
Video Generation, Avatars & Dynamic Worlds ExHall # 283
STANCE: Controllable Video Generation for Structured Dynamics via Sparse-To-dense ANChored Encoding Poster Session 3
ZhiFei Chen ⋅ Tianshuo Xu ⋅ Leyi Wu ⋅ Luozhou Wang ⋅ Dongyu Yan ⋅ Zihan You ⋅ Wenting Luo ⋅ Yingcong Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 282
DiffHDR: Re-Exposing LDR Videos with Video Diffusion Models Poster Session 3
Zhengming Yu ⋅ Li Ma ⋅ Mingming He ⋅ Leo Isikdogan ⋅ Yuancheng Xu ⋅ Dmitriy Smirnov ⋅ Pablo Salamanca ⋅ Dao Mi ⋅ Pablo Delgado ⋅ Ning Yu ⋅ Julien Philip ⋅ Xin Li ⋅ Wenping Wang ⋅ Paul Debevec
Video Generation, Avatars & Dynamic Worlds ExHall # 281
Scalable Cross-embodiment Dexterous Grasping via Morphology-Prior Diffusion Poster Session 3
Sihang Li ⋅ Zheming Zhou ⋅ Marcelino Almeida ⋅ Omid Alizadeh ⋅ Luca Carlone ⋅ Min Sun ⋅ Chen Feng ⋅ Cheng-Hao Kuo
Video Generation, Avatars & Dynamic Worlds ExHall # 280
Fabric Image Demoiréing Benchmark from Synthesis to Restoration Poster Session 3
Pengchao Wei ⋅ Xiaojie Guo
Video Generation, Avatars & Dynamic Worlds ExHall # 279
Meric: A Unified Framework for Multimodal Music Generation and Retrieval via Representation Space Anchoring Poster Session 3
Xihua Wang ⋅ Yinbo Wang ⋅ Jingchao Zhang ⋅ Ruihua Song
Video Generation, Avatars & Dynamic Worlds ExHall # 278
VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations Poster Session 3
Fucai Ke ⋅ Zhixi Cai ⋅ Boying Li ⋅ Long Chen ⋅ Beibei Lin ⋅ Weiqing Wang ⋅ Pari Delir Haghighi ⋅ Gholamreza Haffari ⋅ Hamid Rezatofighi
Video Generation, Avatars & Dynamic Worlds ExHall # 277
MemoBench: Benchmarking World Modeling in Dynamically Changing Environments Poster Session 3
Haoyu Chen ⋅ Kaichen Zhou ⋅ Hang Hua ⋅ Kaile Zhang ⋅ Jingwen Qian ⋅ Wufei Ma ⋅ Haonan Chen ⋅ Chunjiang Liu ⋅ Yizhou Zhao ⋅ Xiaoyuan Wang ⋅ Weiyue Li ⋅ Alan Yuille ⋅ Paul Pu Liang ⋅ Yilun Du
Video Generation, Avatars & Dynamic Worlds ExHall # 276
Narrative-Driven Paper-to-Slide Generation via ArcDeck Poster Session 3
Tarik Can Ozden ⋅ SACHIDANAND VISHNUKUMAR SARMINI ⋅ Furkan Horoz ⋅ Ozgur Kara ⋅ Junho Kim ⋅ James Rehg
Video Generation, Avatars & Dynamic Worlds ExHall # 275
GenLCA: 3D Diffusion for Full-Body Avatars from In-the-Wild Videos Poster Session 3
Yiqian Wu ⋅ Rawal Khirodkar ⋅ Egor Zakharov ⋅ Timur Bagautdinov ⋅ Lei Xiao ⋅ Zhaoen Su ⋅ Shunsuke Saito ⋅ Xiaogang Jin ⋅ Junxuan Li
Video Generation, Avatars & Dynamic Worlds ExHall # 274
Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation Poster Session 3
Weijia Dou ⋅ Wenzhao Zheng ⋅ Weiliang Chen ⋅ Yu Zheng ⋅ Jie Zhou ⋅ Jiwen Lu
Video Generation, Avatars & Dynamic Worlds ExHall # 273
Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints Poster Session 3
Chenyangguang Zhang ⋅ Botao Ye ⋅ Boqi Chen ⋅ Alexandros Delitzas ⋅ Fangjinhua Wang ⋅ Marc Pollefeys ⋅ Xi Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 272
MetaPoint: Unlocking Precise Spatial Control in Visual Generation Poster Session 3
Dewei Zhou ⋅ Xinyu Huang ⋅ Xun Wang ⋅ Ji Xie ⋅ Yabo Zhang ⋅ Liang Li ⋅ Kunchang Li ⋅ Zongxin Yang ⋅ Yi Yang
Video Generation, Avatars & Dynamic Worlds ExHall # 271
SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks Poster Session 3
Zhewen He ⋅ Junyi Hu ⋅ Haomian Huang ⋅ Zhenhua Li ⋅ Yushen Liu ⋅ Yi Fang
Video Generation, Avatars & Dynamic Worlds ExHall # 270
Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild Poster Session 3
Trang Nguyen ⋅ Sidong Zhang ⋅ Shiv Shankar ⋅ Gauri Jagatap ⋅ Deepak Chandran ⋅ Andrea Fanelli ⋅ Madalina Fiterau
Video Generation, Avatars & Dynamic Worlds ExHall # 269
InFlux++: Real and Synthetic Data for Estimating Dynamic Camera Intrinsics Poster Session 3
Erich Liang ⋅ Caleb Kha-Uong ⋅ Chinmaya Saran ⋅ Sreemanti Dey ⋅ David Liu ⋅ Junhan Ouyang ⋅ Benjamin Zhou ⋅ Jia Deng
Video Generation, Avatars & Dynamic Worlds ExHall # 268
ECHO: Ego-centric Modeling of Human-Object Interactions Poster Session 3
Ilya A. Petrov ⋅ Vladimir Guzov ⋅ Riccardo Marin ⋅ Emre Aksan ⋅ Xu Chen ⋅ Daniel Cremers ⋅ Thabo Beeler ⋅ Gerard Pons-Moll
Video Generation, Avatars & Dynamic Worlds ExHall # 267
VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward Poster Session 3
Zhaochong An ⋅ Orest Kupyn ⋅ Théo Uscidda ⋅ Andrea Colaco ⋅ Karan Ahuja ⋅ Serge Belongie ⋅ Mar Gonzalez Franco ⋅ Marta Gazulla
Video Generation, Avatars & Dynamic Worlds ExHall # 266
Articulat3D: Reconstructing Articulated Digital Twins From Monocular Videos with Geometric and Motion Constraints Poster Session 3
Lijun Guo ⋅ Haoyu Zhao ⋅ Xingyue Zhao ⋅ Rong Fu ⋅ Linghao Zhuang ⋅ Siteng Huang ⋅ Zhongyu Li ⋅ Hua Zou
Video Generation, Avatars & Dynamic Worlds ExHall # 265
HO-Flow: Generalizable Hand-Object Interaction Generation with Latent Flow Matching Poster Session 3
Zerui Chen ⋅ Rolandos Alexandros Potamias ⋅ Shizhe Chen ⋅ Jiankang Deng ⋅ Cordelia Schmid ⋅ Stefanos Zafeiriou
Video Generation, Avatars & Dynamic Worlds ExHall # 264
What Moves? Localized Motion Representations for Compositional Scene Control Poster Session 3
Frank Fundel ⋅ Malek Ben Alaya ⋅ Thomas Ressler-Antal ⋅ Stefan Andreas Baumann ⋅ Bjorn Ommer
Video Generation, Avatars & Dynamic Worlds ExHall # 263
CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing Poster Session 3
Gaoxiang Cong ⋅ Liang Li ⋅ Jiaxin Ye ⋅ Zhedong Zhang ⋅ Hongming Shan ⋅ Yuankai Qi ⋅ Qingming Huang
Video Generation, Avatars & Dynamic Worlds ExHall # 262
ComplexMimic: Human–Scene Interaction Imitation in Complex 3D Environments Poster Session 3
Lu Pan ⋅ Hongwei Zhao
Video Generation, Avatars & Dynamic Worlds ExHall # 261
PhyDetEx: Detecting and Explaining the Physical Plausibility of T2V Models Poster Session 3
Zeqing Wang ⋅ Keze Wang ⋅ Yabin Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 259
Predictive Structure Improves Video Diffusion Dynamics Poster Session 3
Mi Luo ⋅ Yujia Chen ⋅ Alex Dimakis ⋅ Kristen Grauman ⋅ Wen-Sheng Chu ⋅ Du Tran
Video Generation, Avatars & Dynamic Worlds ExHall # 258
DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking Poster Session 3
Yunyi Li ⋅ Yu Qiao ⋅ Yaohui Wang ⋅ Xinyuan Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 257
EgoSim: Egocentric World Simulator for Embodiment Interaction Generation Poster Session 3
Jinkun Hao ⋅ Mingda Jia ⋅ Xudong Xu ⋅ Ruiyan Wang ⋅ Xihui Liu ⋅ Ran Yi ⋅ Lizhuang Ma ⋅ Jiangmiao Pang
Video Generation, Avatars & Dynamic Worlds ExHall # 256
TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy Poster Session 3
Hao Sun ⋅ Hao Yan ⋅ Mengting Chen ⋅ Quanjian Song ⋅ Yu Li ⋅ Juan Cao ⋅ Jinsong Lan ⋅ Xiaoyong Zhu ⋅ Bo Zheng ⋅ Sheng Tang
Video Generation, Avatars & Dynamic Worlds ExHall # 255
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation Poster Session 3
Guanlong Jiao ⋅ Chenyangguang Zhang ⋅ Jia Xian ⋅ Zewei Zhang ⋅ Renjie Liao
Video Generation, Avatars & Dynamic Worlds ExHall # 246
Human Mesh Modeling for Anny Body Poster Session 3
Romain Brégier ⋅ Guénolé Fiche ⋅ Matthieu Armando ⋅ Laura Bravo-Sánchez ⋅ Thomas Lucas ⋅ Philippe Weinzaepfel ⋅ Grégory Rogez ⋅ Fabien Baradel
Video Generation, Avatars & Dynamic Worlds ExHall # 254
MuCHeR: Multi-Person Camera-Centric Human Detection, Mesh Recovery and Tracking Poster Session 3
Guénolé Fiche ⋅ Philippe Weinzaepfel ⋅ Romain Brégier ⋅ Fabien Baradel
Video Generation, Avatars & Dynamic Worlds ExHall # 253
InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars Poster Session 3
Quanyue Song ⋅ Yishan He ⋅ Guo Zhi ⋅ yanfei zhang ⋅ Shihao Cheng ⋅ Zhixiang He ⋅ Chi Zhang ⋅ Caigui Jiang ⋅ Xuelong Li
Video Generation, Avatars & Dynamic Worlds ExHall # 252
TriMotion: Modality-Agnostic Camera Control for Video Generation Poster Session 3
Seunghyun Shin ⋅ Song Jifei ⋅ Wooseok Jeon ⋅ Hae-Gon Jeon ⋅ Jiankang Deng
Video Generation, Avatars & Dynamic Worlds ExHall # 251
TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration Poster Session 3
Yang Zhou ⋅ Wenxue Li ⋅ Peng Zhang ⋅ Yifei Chen ⋅ Fei Wang ⋅ Daiguo Zhou
Video Generation, Avatars & Dynamic Worlds ExHall # 250
DiffProxy: Multi-View Human Mesh Recovery via Diffusion-Generated Dense Proxies Poster Session 3
renke wang ⋅ zhenyu zhang ⋅ Ying Tai ⋅ Jun Li ⋅ Jian Yang
Video Generation, Avatars & Dynamic Worlds ExHall # 249
DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation Poster Session 3
Hongfei Zhang ⋅ Kanghao Chen ⋅ Zixin Zhang ⋅ Harold Haodong Chen ⋅ Yuanhuiyi Lyu ⋅ Kun Zhou ⋅ Yuqi Zhang ⋅ Shuai Yang ⋅ Yingcong Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 248
One Video, One World: Turning Monocular Video into Physical 4D Scenes Poster Session 3
Junhao Chen ⋅ Boran Zhang ⋅ Mingjin Chen ⋅ Henghaofan Zhang ⋅ Saining Zhang ⋅ Congcong Zhu ⋅ HAO ZHAO ⋅ Ruqi Huang ⋅ Zhihao Li ⋅ Yufei Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 247
NEOMAP: Novel-View Synthesis via Noise Initialization by Manifold Alternating Projection Poster Session 3
Jinxi Li ⋅ Tianyi Zhang ⋅ Yafei YANG ⋅ Zihui Zhang ⋅ Peng Huang ⋅ Koon Lin ⋅ Bo Yang
Video Generation, Avatars & Dynamic Worlds ExHall # 230
Skyfall-GS: Synthesizing Immersive 3D Urban Scenes from Satellite Imagery Poster Session 3
Jie-Ying Lee ⋅ Yi-Ruei Liu ⋅ Shr-Ruei Tsai ⋅ Wei-Cheng Chang ⋅ Chung-Ho Wu ⋅ Jiewen Chan ⋅ Zhenjun Zhao ⋅ Chieh Hubert Lin ⋅ Yu-Lun Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 232
Multi-THuMBS: Multi-person Tracking of 3D Human Meshes Beyond Video Shots Poster Session 3
Jeongwan On ⋅ Muhammad Salman Ali ⋅ Muneeb Khan ⋅ Sunwoo Park ⋅ Inwoong Moon ⋅ Hyung Jin Chang ⋅ Jaekwang Kim ⋅ Seong Jong Ha ⋅ Seungryul Baek
Video Generation, Avatars & Dynamic Worlds ExHall # 233
Stylized Video Generation via Decoupled Data Synthesis and Gated Style Token Injection Poster Session 3
Xin Wei ⋅ Yijie Fang ⋅ Yanjia Li ⋅ Liangyi Wu ⋅ Qin Yang ⋅ Mingrui Zhu ⋅ Nannan Wang ⋅ Xinbo Gao
Video Generation, Avatars & Dynamic Worlds ExHall # 234
MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens Poster Session 3
Youngrae Kim ⋅ Qixin Hu ⋅ C.-C. Jay Kuo ⋅ Peter Beerel
Video Generation, Avatars & Dynamic Worlds ExHall # 235
AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors Poster Session 3
Aymen Mir ⋅ Riza Alp Guler ⋅ Xiangjun Tang ⋅ Peter Wonka ⋅ Gerard Pons-Moll
Video Generation, Avatars & Dynamic Worlds ExHall # 236
LibraGen: Playing a Balance Game in Subject-Driven Video Generation Poster Session 3
Jiahao Zhu ⋅ Shanshan Lao ⋅ Lijie Liu ⋅ Gen Li ⋅ Tianhao Qi ⋅ hanwei hanwei ⋅ Bingchuan Li ⋅ FangfangLiu FangfangLiu ⋅ Zhuowei Chen ⋅ Tianxiang Ma ⋅ Qian HE ⋅ Yi Zhou ⋅ Xiaohua Xie
Video Generation, Avatars & Dynamic Worlds ExHall # 237
Forecasting Animal Motion Poster Session 3
Neerja Thakkar ⋅ Shiry Ginosar ⋅ Jacob Walker ⋅ Jitendra Malik ⋅ Joao Carreira ⋅ Carl Doersch
Video Generation, Avatars & Dynamic Worlds ExHall # 238
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length Poster Session 3
Yubo Huang ⋅ Hailong Guo ⋅ Fangtai Wu ⋅ Weiqiang Wang ⋅ Shijie Huang ⋅ Qijun Gan ⋅ Shifeng Zhang ⋅ Lin Liu ⋅ Sirui Zhao ⋅ Enhong Chen ⋅ Jiaming Liu ⋅ Steven Hoi
Video Generation, Avatars & Dynamic Worlds ExHall # 239
GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models Poster Session 3
Zekai Gu ⋅ Shuoxuan Feng ⋅ Yansong Wang ⋅ Hanzhuo Huang ⋅ Zhongshuo Du ⋅ Chengfeng Zhao ⋅ Chengwei Ren ⋅ Peng Wang ⋅ Yuan Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 240
ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video Poster Session 3
Xiaozhong Lyu ⋅ Gen Li ⋅ Zhiyin Qian ⋅ Xucong Zhang ⋅ Marc Pollefeys ⋅ Siyu Tang
Video Generation, Avatars & Dynamic Worlds ExHall # 241
Walking in the Implicit: Interactive World Exploration via Neural Scene Representation Poster Session 3
Zhiqi Li ⋅ Chengrui Dong ⋅ Zhenhua Du ⋅ Hangning Zhou ⋅ Cong Qiu ⋅ Hailong Qin ⋅ Mu Yang ⋅ Dongxu Wei ⋅ Peidong Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 242
MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction Poster Session 3
Haitian Li ⋅ Haozhe Xie ⋅ Junxiang Xu ⋅ Beichen Wen ⋅ Fangzhou Hong ⋅ Ziwei Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 243
Sim, Yet Same: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds Poster Session 3
Yunsong Zhou ⋅ Hangxu Liu ⋅ Xuekun Jiang ⋅ Xing Shen ⋅ Yuanzhen Zhou ⋅ Hui Wang ⋅ Baole Fang ⋅ Yang Tian ⋅ Mulin Yu ⋅ Qiaojun Yu ⋅ Li Ma ⋅ Hengjie Li ⋅ Hanqing Wang ⋅ Jia Zeng ⋅ Jiangmiao Pang
Video Generation, Avatars & Dynamic Worlds ExHall # 244
VOID: Video Object and Interaction Deletion Poster Session 3
Saman Motamed ⋅ William Harvey ⋅ Benjamin Klein ⋅ Luc Van Gool ⋅ Zhuoning Yuan ⋅ Ta-Ying Cheng
Video Generation, Avatars & Dynamic Worlds ExHall # 245
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars Poster Session 3
youliang zhang ⋅ zhengguang zhou ⋅ Zhentao Yu ⋅ Ziyao Huang ⋅ Teng Hu ⋅ Sen Liang ⋅ Guozhen Zhang ⋅ Ziqiao Peng ⋅ Shunkai Li ⋅ Yi Chen ⋅ Zixiang Zhou ⋅ Yuan Zhou ⋅ Qinglin Lu ⋅ Xiu Li
Video Generation, Avatars & Dynamic Worlds ExHall # 335
EgoMAN: Interaction-Structured Reasoning for Egocentric 3D Hand Trajectory Prediction Poster Session 3
Mingfei Chen ⋅ Yifan Wang ⋅ Zhengqin Li ⋅ Homanga Bharadhwaj ⋅ Yujin Chen ⋅ Chuan Qin ⋅ Ziyi Kou ⋅ Yuan Tian ⋅ Eric Whitmire ⋅ Rajinder Sodhi ⋅ Hrvoje Benko ⋅ Eli Shlizerman ⋅ Yue Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 333
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure Poster Session 3
Leslie Gu ⋅ Junhwa Hur ⋅ Charles Herrmann ⋅ Fangneng Zhan ⋅ Todd Zickler ⋅ Deqing Sun ⋅ Hanspeter Pfister
Video Generation, Avatars & Dynamic Worlds ExHall # 332
PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation Poster Session 3
Yuanhao Cai ⋅ Kunpeng Li ⋅ Menglin Jia ⋅ Jialiang Wang ⋅ Junzhe Sun ⋅ Feng Liang ⋅ Weifeng Chen ⋅ Felix Juefei-Xu ⋅ Chu Wang ⋅ Ali Thabet ⋅ Xiaoliang Dai ⋅ Xuan JU ⋅ Alan Yuille ⋅ Ji Hou
Video Generation, Avatars & Dynamic Worlds ExHall # 331
Perceiving Better Moments: Cover Frame Reselection and Enhancement for Live Photos with the Live2K Dataset Poster Session 3
Junyu Lou ⋅ Kai Chen ⋅ Weiyi You ⋅ Hui Zeng ⋅ Yabin Zhang ⋅ Shuhang Gu
Video Generation, Avatars & Dynamic Worlds ExHall # 330
Layer-Aware Video Composition via Split-then-Merge Poster Session 3
Ozgur Kara ⋅ Yujia Chen ⋅ Ming-Hsuan Yang ⋅ James Rehg ⋅ Wen-Sheng Chu ⋅ Du Tran
Video Generation, Avatars & Dynamic Worlds ExHall # 329
IC-World: In-Context Generation for Shared World Modeling Poster Session 3
FAN WU ⋅ Jiacheng Wei ⋅ Ruibo Li ⋅ Yi Xu ⋅ junyou li ⋅ Deheng Ye ⋅ Guosheng Lin
Video Generation, Avatars & Dynamic Worlds ExHall # 328
Video Generation Models Are Inherent Lighting Estimators Poster Session 3
Ziqi Cai ⋅ Shuchen Weng ⋅ Kaiqi Liu ⋅ Zifeng Wang ⋅ Zhiquan Zhang ⋅ Minggui Teng ⋅ Han Jiang ⋅ Boxin Shi
Video Generation, Avatars & Dynamic Worlds ExHall # 327
CustomX: Unified Character, Action, and Scene Customization in Video World Models Poster Session 3
Yitong Wang ⋅ Fangyun Wei ⋅ Hongyang Zhang ⋅ Bo Dai ⋅ Yan Lu
Video Generation, Avatars & Dynamic Worlds ExHall # 326
AerialMetric: Benchmarking and Adapting UAV Monocular Metric Depth Estimation in the Real World Poster Session 3
Zhongqiang Song ⋅ Guanying Chen ⋅ Yuqi Zhang ⋅ Yin Zou ⋅ Chuanyu Fu ⋅ Zhiyuan Yuan ⋅ Chuan Huang ⋅ Shuguang Cui ⋅ Xiaochun Cao
Video Generation, Avatars & Dynamic Worlds ExHall # 325
ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning Poster Session 3
Xuanhua He ⋅ JIAXIN XIE ⋅ Mingzhe Zheng ⋅ Qifeng Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 324
MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control Poster Session 3
Kaiqi Liu ⋅ Yunyao Mao ⋅ Ziqi Cai ⋅ Zheng Geng ⋅ Jing Wang ⋅ Qiulin Wang ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Shuchen Weng ⋅ Boxin Shi
Video Generation, Avatars & Dynamic Worlds ExHall # 323
BlenderFusion: 3D-Grounded Visual Editing and Generative Compositing Poster Session 3
Jiacheng Chen ⋅ Ramin Mehran ⋅ Xuhui Jia ⋅ Saining Xie ⋅ Sanghyun Woo
Video Generation, Avatars & Dynamic Worlds ExHall # 418
Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute Poster Session 3
Daneul Kim ⋅ Jingxu Zhang ⋅ Wonjoon Jin ⋅ Sunghyun Cho ⋅ Qi Dai ⋅ Jaesik Park ⋅ Chong Luo
Video Generation, Avatars & Dynamic Worlds ExHall # 419
FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control Poster Session 3
Songchun Zhang ⋅ Sitong Guo ⋅ Xianghao Kong ⋅ Pengwei Liu ⋅ Yuwei Guo ⋅ lvmin zhang ⋅ Anyi Rao
Video Generation, Avatars & Dynamic Worlds ExHall # 421
WristMimic: Full-Body Humanoid Control with Wrist-Guided Manipulation Poster Session 3
Wongyun Yu ⋅ Youngwoon Kim ⋅ Minsu Cho
Video Generation, Avatars & Dynamic Worlds ExHall # 423
Nexus-Vid: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models Poster Session 3
Jiazheng Xing ⋅ Hangjie Yuan ⋅ Lingling Cai ⋅ Xinyu Liu ⋅ Yujie Wei ⋅ Fei Du ⋅ Tao Feng ⋅ Hai Ci ⋅ Jiasheng Tang ⋅ Weihua Chen ⋅ Fan Wang ⋅ Yong Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 424
CAST3D: Customizing Arbitrary 2D Assets into 3D World Poster Session 3
Yukai Sun ⋅ Hao Qin ⋅ Ming Kong ⋅ Luyuan Chen ⋅ Zhijie Xu ⋅ Jinjian Zhang ⋅ Jie Liu ⋅ Feng Zhang ⋅ Qiang Zhu
Video Generation, Avatars & Dynamic Worlds ExHall # 425
DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars Poster Session 3
Xiong Haozhong ⋅ Yao Yu ⋅ Yu Zhou ⋅ Sidan DU
Video Generation, Avatars & Dynamic Worlds ExHall # 426
EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder Poster Session 3
Jaehun Jung ⋅ Wonjun Kim
Video Generation, Avatars & Dynamic Worlds ExHall # 427
CameraAnything: Refilming Videos with Arbitrary Camera Control Poster Session 3
Yixuan Li ⋅ Yanhong Zeng ⋅ Ka Leong Cheng ⋅ Jiayi Zhu ⋅ Hanlin Wang ⋅ Wen Wang ⋅ Yihao Meng ⋅ Hao Ouyang ⋅ Qiuyu Wang ⋅ Yue Yu ⋅ Zidong Wang ⋅ Yiyuan Zhang ⋅ Yujun Shen ⋅ Dahua Lin
Video Generation, Avatars & Dynamic Worlds ExHall # 428
RASA: Disentangled Spatial-Motional Priors for Cross-Identity Character Animation Poster Session 3
Zhen Xiao ⋅ Zhen Shen ⋅ Zhaofan Qiu ⋅ Ting Yao ⋅ Xueliang Liu ⋅ Tao Mei
Video Generation, Avatars & Dynamic Worlds ExHall # 429
JacobianAvatar: Temporally Consistent Semi-rigid Avatar Reconstruction from a Monocular Video Poster Session 3
Changyeon Won ⋅ Min-Gyu Park ⋅ Seonghwan Park ⋅ Ju Yoon ⋅ Hae-Gon Jeon
Video Generation, Avatars & Dynamic Worlds ExHall # 431
TimeWalker: Personalized Neural Space for Lifelong Head Avatars Poster Session 3
Dongwei Pan ⋅ Yang Li ⋅ Hongsheng LI ⋅ Kwan-Yee Lin
Video Generation, Avatars & Dynamic Worlds ExHall # 432
PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding Poster Session 3
Haoze Zhang ⋅ Tianyu Huang ⋅ Zichen Wan ⋅ Xiaowei Jin ⋅ Hongzhi Zhang ⋅ Hui Li ⋅ Wangmeng Zuo
Video Generation, Avatars & Dynamic Worlds ExHall # 433
SplatCtrlA: Generalizable Single Image to Fully Controllable 3D Avatar Poster Session 3
Jun Xiang ⋅ Yudong Guo ⋅ Boyang Guo ⋅ Yancheng Yuan ⋅ Juyong Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 434
Beyond Pixel Mimicry: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation Poster Session 3
Qian Wang ⋅ Zhenyu Li ⋅ Abdelrahman Eldesokey ⋅ Peter Wonka
Video Generation, Avatars & Dynamic Worlds ExHall # 435
ExpoMotion: A Large-Scale Benchmark and A Householder Projection Network for Multi-Exposure Fusion Poster Session 3
Yao Liu ⋅ Lishen Qu ⋅ Jie Liang ⋅ shihao zhou ⋅ Hui Zeng ⋅ Yabin Peng ⋅ Huipeng Lin ⋅ Yabin Zhang ⋅ Jufeng Yang
Video Generation, Avatars & Dynamic Worlds ExHall # 436
SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models Poster Session 3
Ruoyu Wang ⋅ Jialun Liu ⋅ Huayang Huang ⋅ Haibin Huang ⋅ Jiepeng Wang ⋅ Chi Zhang ⋅ Xuelong Li ⋅ Yu Wu
Video Generation, Avatars & Dynamic Worlds ExHall # 437
HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration Poster Session 3
Jiaxin Li ⋅ Yuxiang Wu ⋅ Zhenkai Zhang ⋅ Xinrui Shi ⋅ wang haoyuan ⋅ Yichen Zhao ⋅ Su Linxiang ⋅ Chenyang chenyang ⋅ Mingyu Zhang ⋅ Yifan Ding ⋅ Boran Wen ⋅ li zhang ⋅ Ruiyang Liu ⋅ Yong-Lu Li
Video Generation, Avatars & Dynamic Worlds ExHall # 438
Target-Bench: Can Video World Models Achieve Mapless Path Planning with Semantic Targets? Poster Session 3
Dingrui Wang ⋅ Zhihao Liang ⋅ Hongyuan Ye ⋅ Zhexiao Sun ⋅ Zhaowei Lu ⋅ Yuchen Zhang ⋅ Yuyu Zhao ⋅ Yuan Gao ⋅ Marvin Seegert ⋅ Finn Rasmus Schäfer ⋅ Haotong Qin ⋅ Wei Li ⋅ Luigi Palmieri ⋅ Felix Jahncke ⋅ Mattia Piccinini ⋅ Johannes Betz
Video Generation, Avatars & Dynamic Worlds ExHall # 439
A Dual-Transformer Architecture with Cross-Attention for Multi-Camera View Recommendation Poster Session 3
Josep Cabacas Maso ⋅ Carles Ventura ⋅ Ismael Benito-Altamirano
Video Generation, Avatars & Dynamic Worlds ExHall # 440
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation Poster Session 3
Mohammad Mahdi ⋅ Nedko Savov ⋅ Danda Paudel ⋅ Luc Van Gool
Video Generation, Avatars & Dynamic Worlds ExHall # 441
RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video Poster Session 3
Ulrich Prestel ⋅ Stefan Andreas Baumann ⋅ Nick Stracke ⋅ Bjorn Ommer
Video Generation, Avatars & Dynamic Worlds ExHall # 442
EraseLoRA: MLLM-Driven Foreground Exclusion and Background Subtype Aggregation for Dataset-Free Object Removal Poster Session 3
Sanghyun Jo ⋅ DONGHWAN LEE ⋅ Eunji Jung ⋅ Seong Oh ⋅ Kyungsu Kim
Video Generation, Avatars & Dynamic Worlds ExHall # 443
OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection Poster Session 3
David Schneider ⋅ Zdravko Marinov ⋅ Moritz Mistol ⋅ Zeyun Zhong ⋅ Alexander Jaus ⋅ Rodi Düger ⋅ Rafael Baur ⋅ M. Saquib Sarfraz ⋅ Rainer Stiefelhagen
Video Generation, Avatars & Dynamic Worlds ExHall # 445
Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency Poster Session 3
Zihan Su ⋅ Teng Hu ⋅ Jiangning Zhang ⋅ Ruiyan Wang ⋅ Ran Yi ⋅ Lizhuang Ma ⋅ Dacheng Tao
Video Generation, Avatars & Dynamic Worlds ExHall # 446
ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering Poster Session 3
Weikai Lin ⋅ Haoxiang Li ⋅ Yuhao Zhu
Video Generation, Avatars & Dynamic Worlds ExHall # 447
LooseControlVideo: Directorial Video Control using Spatial Blocking Poster Session 3
Shariq Farooq Bhat ⋅ Kalyan Sunkavalli ⋅ Niloy Mitra
Video Generation, Avatars & Dynamic Worlds ExHall # 448
DynEval: Holistic Evaluations of T2I Generative Models in the Wild Poster Session 3
Shyam Marjit ⋅ Dheeraj Baiju ⋅ Anuj Shikarkhane ⋅ Akhil Sakthieswaran ⋅ Sayak Paul ⋅ Anirban Chakraborty
Video Generation, Avatars & Dynamic Worlds ExHall # 449
MotionSplicer: Part-Based Motion Editing for 4D Volumetric Videos Poster Session 3
Chaerin Min ⋅ Praccho Muna-McQuay ⋅ Tao Lu ⋅ James Tompkin ⋅ Srinath Sridhar
Video Generation, Avatars & Dynamic Worlds ExHall # 450
Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation Poster Session 3
Atin Pothiraj ⋅ Jaemin Cho ⋅ Yue Zhang ⋅ Elias Stengel-Eskin ⋅ Mohit Bansal
Video Generation, Avatars & Dynamic Worlds ExHall # 451
Versatile Editing of Video Content, Actions, and Dynamics without Training Poster Session 3
Vladimir Kulikov ⋅ Roni Paiss ⋅ Andrey Voynov ⋅ Inbar Mosseri ⋅ Tali Dekel ⋅ Tomer Michaeli
Video Generation, Avatars & Dynamic Worlds ExHall # 452
TAQ: Static-Deployable Temporal-Aware Quantization for Real-World Video Super-Resolution Poster Session 3
Jinwoo Chung ⋅ Sangho An ⋅ Sungyeop Jung ⋅ Jangho Kim
Video Generation, Avatars & Dynamic Worlds ExHall # 453
DIVER: Disentangling Camera–Object and Active–Passive Motion for Video Generation Poster Session 3
Shaowei Liu ⋅ Xuanchi Ren ⋅ Tianchang Shen ⋅ Huan Ling ⋅ Saurabh Gupta ⋅ Shenlong Wang ⋅ Sanja Fidler ⋅ Jun Gao
Video Generation, Avatars & Dynamic Worlds ExHall # 454
Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time Poster Session 3
Sooyoung Jeon ⋅ Hongjie Tian ⋅ Lemeng Wang ⋅ Zheda Mai ⋅ Vidhi Bakshi ⋅ Jiacheng Hou ⋅ Ping Zhang ⋅ Arpita Chowdhury ⋅ Jianyang Gu ⋅ Wei-Lun Chao
Video Generation, Avatars & Dynamic Worlds ExHall # 455
A Physics-Grounded Benchmark for Multi-Agent Dynamics in World Models Poster Session 3
Nuo Chen ⋅ Lulin Liu ⋅ Zihao Li ⋅ Ziyao Zeng ⋅ Zihao Zhu ⋅ Wenyan Cong ⋅ Junyuan Hong ⋅ Yunhao Yang ⋅ Zhengzhong Tu ⋅ Yan Wang ⋅ Boris Ivanovic ⋅ Marco Pavone ⋅ Zhangyang Wang ⋅ Yang Zhou ⋅ Zhiwen Fan
Video Generation, Avatars & Dynamic Worlds ExHall # 456
ARMS: Anchor–Relational Motion Streaming for Seamless Solo-Social Motion Transitions Poster Session 3
Huakun Liu ⋅ Qing Yu ⋅ Kent Fujiwara ⋅ Hideaki Uchiyama ⋅ Kiyoshi Kiyokawa
Video Generation, Avatars & Dynamic Worlds ExHall # 457
TRINITY: A Multi-Perspective Benchmark for Personal-Style Video Highlight Detection Poster Session 3
Qianqian Chen ⋅ Hyun Bin Kim ⋅ Denzel Wijaya ⋅ Yang Yi ⋅ Bo LIU ⋅ Yangkai Ding
Video Generation, Avatars & Dynamic Worlds ExHall # 458
ExpertEdit: Learning Skill-Aware Motion Editing from Expert Videos Poster Session 3
Arjun Somayazulu ⋅ Kristen Grauman
Video Generation, Avatars & Dynamic Worlds ExHall # 459
Music-to-Dance Generation via Atomic Movements Poster Session 3
Xinhao Cai ⋅ Yixuan Sun ⋅ Minghang Zheng ⋅ Qingchao Chen ⋅ Xin Jin ⋅ Song-Chun Zhu ⋅ Yang Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 460
MSEditor: Toward Consistent Multi-Shot Video Editing Poster Session 3
Kunyu Feng ⋅ Yue Ma ⋅ Bingyuan Wang ⋅ Yuefeng Wang ⋅ Zhiyuan Qin ⋅ Hao Cheng ⋅ Hao Li ⋅ Qifeng Chen ⋅ Zeyu Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 462
OmniLife360: A Benchmark for 3D Reconstruction from In-the-Wild 360° Captures Poster Session 3
Zonglin Zhao ⋅ Bowen Zhang ⋅ Yatai Li ⋅ Chao.Liang Chao.Liang ⋅ Zhipeng Zhang
Video Generation, Avatars & Dynamic Worlds ExHall # 463
MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins Poster Session 3
WenBo Xu ⋅ Liu Liu ⋅ li zhang ⋅ Dan Guo ⋅ Ruonan Liu
Video Generation, Avatars & Dynamic Worlds ExHall # 464
SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation Poster Session 3
Shenbo Xie ⋅ Mingrui Cai ⋅ Xu Yang ⋅ Yifei Liu ⋅ Changxing Ding
Video Generation, Avatars & Dynamic Worlds ExHall # 465
YeTI: You Only Need Two Noisy Images for Real-World sRGB Noise Generation Poster Session 3
Jaekyun Ko ⋅ Byung Wan Lim ⋅ Dongjin Kim ⋅ Soomin Lee ⋅ Tae Hyun Kim
Video Generation, Avatars & Dynamic Worlds ExHall # 467
Swap the Right Identity: Spatio-Temporal Preference Optimization for Identity Swapping Poster Session 3
Hongdeng Shen ⋅ Xiongzheng Li ⋅ Jikang Cheng ⋅ Duo Li ⋅ Yunlong FENG ⋅ Jing Li
Video Generation, Avatars & Dynamic Worlds ExHall # 469
TextFace: Compositional Text-Guided Identity Preserving Face Synthesis for Face Recognition Poster Session 3
Junzhe Yang ⋅ Mingjie He ⋅ Shiguang Shan
Video Generation, Avatars & Dynamic Worlds ExHall # 470
PASDiff: Physics-Aware Semantic Guidance for Joint Real-world Low-Light Face Enhancement and Restoration Poster Session 3
Yilin Ni ⋅ Wenjie Li ⋅ Zhengxue Wang ⋅ Juncheng Li ⋅ Guangwei Gao ⋅ Jian Yang
Video Generation, Avatars & Dynamic Worlds ExHall # 471
IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video Poster Session 3
Rasul Khanbayov ⋅ Mohamed Rayan Barhdadi ⋅ Erchin Serpedin ⋅ HASAN KURBAN
Video Generation, Avatars & Dynamic Worlds ExHall # 472
FlowLess: Controlling Abstract Image Generation Poster Session 3
Amir Hertz ⋅ Noah Snavely
Video Generation, Avatars & Dynamic Worlds ExHall # 473
InterPet4D: A Multimodal 4D Human-Pet Interaction Dataset for Pet Motion Generation Poster Session 3
YICHEN PENG ⋅ Jyun-Ting Song ⋅ Chen-Chieh Liao ⋅ Kris Kitani ⋅ Hideki Koike ⋅ Erwin Wu
Video Generation, Avatars & Dynamic Worlds ExHall # 474
WorldCache: Content-Aware Caching for Accelerated Video World Models Poster Session 3
Umair Nawaz ⋅ Ahmed Heakl ⋅ Ufaq Khan ⋅ ABDELRAHMAN YOUSSIEF ⋅ Salman Khan ⋅ Fahad Shahbaz Khan
Video Generation, Avatars & Dynamic Worlds ExHall # 475
Video Generation Models are General-Purpose Vision Learners Poster Session 3
Letian Wang ⋅ Chuhan Zhang ⋅ Rishabh Kabra ⋅ Jasper Uijlings ⋅ Steven Waslander ⋅ Andrew ZISSERMAN ⋅ Joao Carreira ⋅ Cristian Sminchisescu ⋅ Kaiming He ⋅ Mykhaylo Andriluka ⋅ Eduard Gabriel Bazavan ⋅ Andrei Zanfir
Video Generation, Avatars & Dynamic Worlds ExHall # 476
Grounding World Simulation Models in a Real-World Metropolis Poster Session 3
Junyoung Seo ⋅ Hyunwook Choi ⋅ Minkyung Kwon ⋅ Jinhyeok Choi ⋅ Siyoon Jin ⋅ Gayoung Lee ⋅ Junho Kim ⋅ JoungBin Lee ⋅ Geonmo Gu ⋅ Dongyoon Han ⋅ Sangdoo Yun ⋅ Seungryong Kim ⋅ Jin-Hwa Kim
Video Generation, Avatars & Dynamic Worlds ExHall # 477
Learning Implicit Constitutive Laws for Dynamic 3D Gaussian Splatting from Monocular Videos Poster Session 3
Xiaoyang Liu ⋅ Kai Han
Video Generation, Avatars & Dynamic Worlds ExHall # 417
Taming Dynamic Clutter: Variance-Driven Adaptive Gain Control for Bio-inspired Small Target Detection Poster Session 3
Jiaxiang Li ⋅ Shaobing Gao ⋅ Qinbing Fu ⋅ Meiyi Li ⋅ Tiansheng Lu ⋅ Minjie Tan
Video Generation, Avatars & Dynamic Worlds ExHall # 416
RealDyadic: Synthesizing Realistic Dyadic 3D Dialogue with Neural Appearance Priors Poster Session 3
Lei Zhu ⋅ Lijian Lin ⋅ Ye Zhu ⋅ Xuehan Hou ⋅ Jiahao Wu ⋅ Yu Li ⋅ Yunfei Liu ⋅ Jie Chen
Video Generation, Avatars & Dynamic Worlds ExHall # 415
Infinite Gaze Generation for Videos with Autoregressive Diffusion Poster Session 3
JENNA KANG ⋅ Colin Groth ⋅ Tong Wu ⋅ Finley Torrens ⋅ Patsorn Sangkloy ⋅ Gordon Wetzstein ⋅ Qi Sun
Video Generation, Avatars & Dynamic Worlds ExHall # 414
JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation Poster Session 3
Mingyeong Song ⋅ Jungbin Cho ⋅ Jisoo Kim ⋅ Ananya Bal ⋅ Kartik Sharma ⋅ Youngjae Yu ⋅ Laszlo Jeni ⋅ Junhyug Noh
Video Generation, Avatars & Dynamic Worlds ExHall # 413
Out of Sight, Out of Mind? Evaluating State Evolution in Video World Models Poster Session 3
Ziqi Ma ⋅ Mengzhan Liufu ⋅ Georgia Gkioxari
Video Generation, Avatars & Dynamic Worlds ExHall # 412
SignRefine: Adapting Foundational Video Models for Sign Language Generation Poster Session 3
Anton Pelykh ⋅ Edward Fish ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
Video Generation, Avatars & Dynamic Worlds ExHall # 411
GraphVid: Interactive Graph-Controllable Video Generation Poster Session 3
Vedant Shah ⋅ Onkar Susladkar ⋅ Tushar Prakash ⋅ Kiet Nguyen ⋅ Tianjiao (Joey) Yu ⋅ Adheesh Juvekar ⋅ Muntasir Wahed ⋅ Ismini Lourentzou
Video Generation, Avatars & Dynamic Worlds ExHall # 410
Towards Real-World Wearable Motion Reconstruction Poster Session 3
Andrea Boscolo Camiletto ⋅ Rishabh Dabral ⋅ Eduardo Alvarado ⋅ Thabo Beeler ⋅ Marc Habermann ⋅ Christian Theobalt
Video Generation, Avatars & Dynamic Worlds ExHall # 409
SICAGE: Speaker-Independent Culture-Aware Gesture Generation using TED4C-L Dataset Poster Session 3
Ariel Gjaci ⋅ Antonio Sgorbissa ⋅ Vittorio Murino
Video Generation, Avatars & Dynamic Worlds ExHall # 408
OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control Poster Session 3
Yukun Wang ⋅ Ruihuang Li ⋅ Jiale Tao ⋅ Shiyuan Yang ⋅ Liyi Chen ⋅ Zhantao Yang ⋅ Handz Handz ⋅ Yulan Guo ⋅ Shuai Shao ⋅ Qinglin Lu
Video Generation, Avatars & Dynamic Worlds ExHall # 407
ReconPhys: Reconstruct Appearance and Physical Attributes from Single Video Poster Session 3
Boyuan Wang ⋅ Xiaofeng Wang ⋅ Yongkang Li ⋅ Zheng Zhu ⋅ Yifan Chang ⋅ Angen Ye ⋅ Guosheng Zhao ⋅ Chaojun Ni ⋅ Guan Huang ⋅ Yijie Ren ⋅ Yueqi Duan ⋅ Xingang Wang
Video Generation, Avatars & Dynamic Worlds ExHall # 406
Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation Poster Session 3
Baiqin Wang ⋅ Sen Chen ⋅ Jiankuo Zhao ⋅ Xiangyu Liu ⋅ Zhen Lei ⋅ Xiangyu Zhu
Video Generation, Avatars & Dynamic Worlds ExHall # 405
LUNA: Learning Universal 3D Human Animation Beyond Skinning Poster Session 3
Peng Li ⋅ Rawal Khirodkar ⋅ Junxuan Li ⋅ Yuan Dong ⋅ Chen Cao ⋅ Yuan Liu ⋅ Wenhan Luo ⋅ Yike Guo ⋅ Shunsuke Saito
Video Generation, Avatars & Dynamic Worlds ExHall # 404
D-Rex : Diffusion Rendering for Relightable Expressive Avatars Poster Session 3
Timo Teufel ⋅ xilong zhou ⋅ Umar Iqbal ⋅ Jan Kautz ⋅ Marc Habermann ⋅ Vladislav Golyanik ⋅ Christian Theobalt
Video Generation, Avatars & Dynamic Worlds ExHall # 403
Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models Poster Session 3
yue han ⋅ Chong Li ⋅ Zhening Liu ⋅ Cong Huang ⋅ Fang Deng ⋅ Yong Liu ⋅ Fangyun Wei ⋅ Yan Lu
Video Generation, Avatars & Dynamic Worlds ExHall # 402
PWM-ArtGen: Part World Model for Articulated Object Generation Poster Session 3
Wentao Zheng ⋅ Ancong Wu
Video Generation, Avatars & Dynamic Worlds ExHall # 401
KineticGS: Momentum-driven Coherent 4D Gaussian Splatting for Monocular Dynamic Scene Reconstruction Poster Session 3
Yunqing Wang ⋅ Baoyao Yang ⋅ SI-QI LIU ⋅ CHONG YIN ⋅ Yihua Shao ⋅ Hao Tang
Video Generation, Avatars & Dynamic Worlds ExHall # 400
Control-DINO: Feature Space Conditioning for Controllable Video Diffusion Poster Session 3
Edoardo Dominici ⋅ Thomas Deixelberger ⋅ Konstantinos Vardis ⋅ Markus Steinberger
Video Generation, Avatars & Dynamic Worlds ExHall # 399
Multi-Modal Controlled Coherent Motion Generation Poster Session 3
Yifei Liu ⋅ Qiong Cao ⋅ Hongwei Yi ⋅ Huaiguang Jiang ⋅ Changxing Ding
Video Generation, Avatars & Dynamic Worlds ExHall # 398
FFAvatar: Feed-Forward 4D Head Avatar Reconstruction from Arbitrary Images Poster Session 3
Jianjiang Yao ⋅ Ke Xian ⋅ Renxiang Dai ⋅ Robert Qiu
Video Generation, Avatars & Dynamic Worlds ExHall # 397
SA-V2V: Training-Free Subject-Aware Video-to-Video Personalization Poster Session 3
Soobin Park ⋅ Seohyeon Yoo ⋅ Jiwon Kim ⋅ SeonHwa Kim ⋅ Kyong Hwan Jin ⋅ Eunju Cha
Video Generation, Avatars & Dynamic Worlds ExHall # 396
ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling Poster Session 3
Daowen Li ⋅ Ruixiao Dong ⋅ Ying Chen ⋅ Kai Li ⋅ Ding Ding ⋅ Li Li
Video Generation, Avatars & Dynamic Worlds ExHall # 394
Interaction-Aware 4D Gaussian Splatting for Dynamic Hand-Object Interaction Reconstruction Poster Session 3
Hao Tian ⋅ Chenyangguang Zhang ⋅ Rui Liu ⋅ Wen Shen ⋅ Xiaolin Qin
Video Generation, Avatars & Dynamic Worlds ExHall # 393
ROSE: Real-Time Open-World Scene Understanding from Monocular Video via Compact Multimodal 4D Scene Graphs Poster Session 3
Ziyue Qiu ⋅ Yong Wang ⋅ Jin Pan
Video Generation, Avatars & Dynamic Worlds ExHall # 392
LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing Poster Session 3
Xinyu Wang ⋅ Chongbo Zhao ⋅ Fangneng Zhan ⋅ Yue Ma
Video Generation, Avatars & Dynamic Worlds ExHall # 391
EmoteGPT: 3D Human Facial Expression from Natural Language Descriptions Poster Session 3
Haoran Wang ⋅ Mohit Mendiratta ⋅ Christian Theobalt ⋅ Adam Kortylewski
Video Generation, Avatars & Dynamic Worlds ExHall # 390
PartCHOI: Part-Aware Guidance for Clothed Human-Object Interaction Generation Poster Session 3
Mingwen Shao ⋅ Xinyuan Chen ⋅ Qiao Zhang ⋅ Xiang Lv ⋅ lingzhuang meng ⋅ Qinglin Zhan ⋅ Chang Liu ⋅ Chao Dong
Video Generation, Avatars & Dynamic Worlds ExHall # 389
Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning Poster Session 3
Hanqing Wang ⋅ Zhenhao Zhang ⋅ Kaiyang Ji ⋅ Mingyu Liu ⋅ Wenti Yin ⋅ yuchao chen ⋅ Zhirui Liu ⋅ Xiangyu Zeng ⋅ Tianxiang Gui ⋅ Hangxing Zhang ⋅ Jiahao Yuan ⋅ Zhiqing Cui ⋅ Jiaxin Liu ⋅ Zhiyuan Ma ⋅ Hui Xiong
Video Generation, Avatars & Dynamic Worlds ExHall # 322
MorphGS: Morphology-Adaptive Articulated Motion Transfer from Videos Poster Session 3
Taeyeon Kim ⋅ Youngju Na ⋅ Jumin Lee ⋅ Sebin Lee ⋅ Minhyuk Sung ⋅ Sung-eui Yoon
Video Generation, Avatars & Dynamic Worlds ExHall # 388
FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model Poster Session 3
Yuhwan Jeong ⋅ HYEONSEONG KIM ⋅ Daehyun We ⋅ Seonkyu Song ⋅ Jinnyeong Yang ⋅ Hyun-Kurl Jang ⋅ Youngho Yoon ⋅ KUK-JIN YOON
Video Generation, Avatars & Dynamic Worlds ExHall # 321
OccDirector: Language-Guided Behavior and Interaction Generation in 4D Occupancy Space Poster Session 3
Zhuding Liang ⋅ Tianyi Yan ⋅ Dubing Chen ⋅ Jiasen Zheng ⋅ Huan Zheng ⋅ Cheng-zhong Xu ⋅ Yida Wang ⋅ Kun Zhan ⋅ Shen Jianbing
Video Generation, Avatars & Dynamic Worlds ExHall # 387
Who Does What and Where to Go: Orthogonal Alignment and Hierarchical Planning for Multi-Entity Trajectories Poster Session 3
Zhang Wan ⋅ Yu Li ⋅ Tianze Huang ⋅ Juan Cao ⋅ Sheng Tang
Video Generation, Avatars & Dynamic Worlds ExHall # 386
Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation Poster Session 3
Yanran Zhang ⋅ Ziyi Wang ⋅ Wenzhao Zheng ⋅ Zheng Zhu ⋅ Jie Zhou ⋅ Jiwen Lu
Video Generation, Avatars & Dynamic Worlds ExHall # 320
Consistent Video-to-Video Translation via Explicit Correspondences Poster Session 2
Gaurav Parmar ⋅ Zhengqi Li ⋅ Richard Zhang ⋅ Jun-Yan Zhu ⋅ Srinivasa G. Narasimhan ⋅ Eli Shechtman ⋅ Yotam Nitzan
Video Understanding, Generation and Multimodal Learning ExHall # 35
Stream3D-VLM: Online 3D Spatial Understanding with Incremental Geometry Priors Poster Session 2
Hanxun Yu ⋅ Xuan Qu ⋅ Lei Ke ⋅ Boqiang Zhang ⋅ YUXIN WANG ⋅ Jianke Zhu ⋅ Dong Yu
Video Understanding, Generation and Multimodal Learning ExHall # 33
Surprise Forcing: What to Remember, When to Skip in Long Video Generation Poster Session 2
SHUWEI SHI ⋅ Zhen Li ⋅ Muyao Niu ⋅ Chuanhao Li ⋅ Bo Zheng ⋅ Kaipeng Zhang ⋅ zheng yinqiang
Video Understanding, Generation and Multimodal Learning ExHall # 32
Em-Garde: A Propose-Match Framework for Proactive Streaming Video Understanding Poster Session 2
Yikai Zheng ⋅ Xin Ding ⋅ Yifan Yang ⋅ Shiqi Jiang ⋅ Hao Wu ⋅ Qianxi Zhang ⋅ Weijun Wang ⋅ Ting Cao ⋅ Yunxin Liu
Video Understanding, Generation and Multimodal Learning ExHall # 31
SALT: Self-Consistent Distribution Matching with Cache-Aware Training for Few-Step Video Generation Poster Session 2
Xingtong Ge ⋅ Yi ZHANG ⋅ Yushi Huang ⋅ Dailan He ⋅ Xiahong Wang ⋅ Bingqi Ma ⋅ Guanglu Song ⋅ Yu Liu ⋅ Jun Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 30
EgoPolice: A Benchmark for Egocentric Video Understanding in High-Stakes Police Body-Worn Camera Footage Poster Session 2
Max Saez-Diez ⋅ Jihoon Chung ⋅ Adam D. Wolsky ⋅ Greg Lanzalotto ⋅ Dean Knox ⋅ Jonathan Mummolo ⋅ Brandon Stewart ⋅ Olga Russakovsky
Video Understanding, Generation and Multimodal Learning ExHall # 29
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation Poster Session 2
Liyang Li ⋅ Wen Wang ⋅ Canyu Zhao ⋅ Tianjian Feng ⋅ Zhiyue Zhao ⋅ Hao Chen ⋅ Chunhua Shen
Video Understanding, Generation and Multimodal Learning ExHall # 28
Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction Poster Session 2
Kaisi Guan ⋅ Xihua Wang ⋅ Zhengfeng Lai ⋅ Xin Cheng ⋅ Peng Zhang ⋅ Xiaojiang Liu ⋅ Ruihua Song ⋅ Meng Cao
Video Understanding, Generation and Multimodal Learning ExHall # 27
Accelerating Text-to-Video Generation with Calibrated Sparse Attention Poster Session 2
Shai Yehezkel ⋅ Shahar Yadin ⋅ Noam Elata ⋅ Yaron Ostrovsky-Berman ⋅ Bahjat Kawar
Video Understanding, Generation and Multimodal Learning ExHall # 26
Enhanced Neural Video Representation Compression with High Scalability Poster Session 2
Ho Man Kwan ⋅ Tianhao Peng ⋅ Fan Zhang ⋅ Mike Nilsson ⋅ Andrew Gower ⋅ David Bull
Video Understanding, Generation and Multimodal Learning ExHall # 25
VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension Poster Session 2
Zeyu Ling ⋅ Bo Han ⋅ Shiyang Li ⋅ Jikang Cheng ⋅ Hongdeng Shen ⋅ Changqing Zou
Video Understanding, Generation and Multimodal Learning ExHall # 24
Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution Poster Session 2
Shuang Cui ⋅ Fan Ji ⋅ Guanglong Sun ⋅ Yufei Guo ⋅ Xiongxin Tang ⋅ Jiangmeng Li ⋅ Fanjiang Xu
Video Understanding, Generation and Multimodal Learning ExHall # 23
Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability Poster Session 2
Shizhan Liu ⋅ Xinran Deng ⋅ Zhuoyi Yang ⋅ Jiayan Teng ⋅ Xiaotao Gu ⋅ Jie Tang
Video Understanding, Generation and Multimodal Learning ExHall # 22
InterCMDM: Block-Causal Diffusion for Autoregressive Human Interaction Generation Poster Session 2
Qing Yu ⋅ Kent Fujiwara
Video Understanding, Generation and Multimodal Learning ExHall # 21
GuideMe: Benchmarking Multi-Domain Task Guidance and Intervention in Streaming Video Poster Session 2
FANG LIU ⋅ Jinpeng Chen ⋅ Ke Xu ⋅ Yuhao LIU ⋅ Huankang Guan ⋅ Xudong LU ⋅ Yang Bo ⋅ Gerhard P. Hancke ⋅ Rui Liu ⋅ Rynson Lau
Video Understanding, Generation and Multimodal Learning ExHall # 20
Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition Poster Session 2
Prajwal Gatti ⋅ Simon Jenni ⋅ Fabian Caba ⋅ Dima Damen
Video Understanding, Generation and Multimodal Learning ExHall # 18
Online Reasoning Video Object Segmentation Poster Session 2
jinyuan Liu ⋅ Yang Wang ⋅ Zeyu Zhao ⋅ Weixin Li ⋅ Song Wang ⋅ Ruize Han
Video Understanding, Generation and Multimodal Learning ExHall # 17
ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA Poster Session 2
Aviad Dahan ⋅ Moran Yanuka ⋅ Noa Kraicer ⋅ Lior Wolf ⋅ RAJA GIRYES
Video Understanding, Generation and Multimodal Learning ExHall # 16
Objects as Audio-Visual Modal Sound Fields Poster Session 2
Zisen Shao ⋅ Zihao Wei ⋅ Derong Jin ⋅ Ruohan Gao
Video Understanding, Generation and Multimodal Learning ExHall # 15
STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding Poster Session 2
Junho Kim ⋅ Hosu Lee ⋅ James Rehg ⋅ Minsu Kim ⋅ Yong Man Ro
Video Understanding, Generation and Multimodal Learning ExHall # 14
GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces Poster Session 2
Xinyu Geng ⋅ Yanjing Xiao ⋅ Yuyang Zhang ⋅ Hanwen Wang ⋅ Xinyan Liu ⋅ Rui Min ⋅ Tianqing Fang ⋅ Yi Ren Fung
Video Understanding, Generation and Multimodal Learning ExHall # 13
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection Poster Session 2
Qiang Wang ⋅ XINYUAN GAO ⋅ SongLin Dong ⋅ Jizhou Han ⋅ Jiangyang Li ⋅ Yuhang He ⋅ Zhiheng Ma ⋅ Yihong Gong
Video Understanding, Generation and Multimodal Learning ExHall # 12
GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation Poster Session 2
Rui Xie ⋅ Zhi Gao ⋅ Chenrui Shi ⋅ Zirui Shang ⋅ Lu Chen ⋅ Qing Li
Video Understanding, Generation and Multimodal Learning ExHall # 11
Linear Scaling Video VLMs for Long Video Understanding Poster Session 2
Cristobal Eyzaguirre ⋅ Jiajun Wu ⋅ Juan Carlos Niebles
Video Understanding, Generation and Multimodal Learning ExHall # 10
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously Poster Session 2
Yiran Guan ⋅ Liang Yin ⋅ Dingkang Liang ⋅ Jianzhong Ju ⋅ Zhenbo Luo ⋅ Jian Luan ⋅ Yuliang Liu ⋅ Xiang Bai
Video Understanding, Generation and Multimodal Learning ExHall # 9
ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling Poster Session 2
Yawen Luo ⋅ Xiaoyu Shi ⋅ Jun-hao Zhuang ⋅ Yutian Chen ⋅ Quande Liu ⋅ Xintao Wang ⋅ Pengfei Wan ⋅ Tianfan Xue
Video Understanding, Generation and Multimodal Learning ExHall # 8
Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding Poster Session 2
yueying li ⋅ Fengxiang Wang ⋅ Yan Li ⋅ Mingshuo Chen ⋅ Mengying Zhao ⋅ Long Lan
Video Understanding, Generation and Multimodal Learning ExHall # 7
MomentSeg: Moment-Centric Sampling for Enhanced Referring Video Object Segmentation Poster Session 2
Ming Dai ⋅ Sen Yang ⋅ Boqiang Duan ⋅ Wankou Yang ⋅ Jingdong Wang
Video Understanding, Generation and Multimodal Learning ExHall # 6
EgoExo-Con: Exploring View-Invariant Video Temporal Understanding Poster Session 2
Minjoon Jung ⋅ Junbin Xiao ⋅ Junghyun Kim ⋅ Byoung-Tak Zhang ⋅ Angela Yao
Video Understanding, Generation and Multimodal Learning ExHall # 5
Anchor Forcing: Anchor Memory and Tri-Region RoPE for Interactive Streaming Video Diffusion Poster Session 2
yang yang ⋅ Tianyi Zhang ⋅ Wei Huang ⋅ Jinwei Chen ⋅ Boxi Wu ⋅ Xiaofei He ⋅ Deng Cai ⋅ Bo Li ⋅ Peng-Tao Jiang
Video Understanding, Generation and Multimodal Learning ExHall # 4
MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding Poster Session 2
Hejun Dong ⋅ Junbo Niu ⋅ Bin Wang ⋅ Weijun Zeng ⋅ Wentao Zhang ⋅ Conghui He
Video Understanding, Generation and Multimodal Learning ExHall # 1
Demystifing Video Reasoning Poster Session 2
Ruisi Wang ⋅ Zhongang Cai ⋅ Fanyi Pu ⋅ Junxiang Xu ⋅ Wanqi Yin ⋅ Maijunxian Wang ⋅ Ran Ji ⋅ Chenyang Gu ⋅ Bo Li ⋅ Ziqi Huang ⋅ Hokin Deng ⋅ Dahua Lin ⋅ Ziwei Liu ⋅ Lei Yang
Video Understanding, Generation and Multimodal Learning ExHall # 146
Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval Poster Session 2
Jihyun Lee ⋅ Cheol-Ho Cho ⋅ Woojin Jun ⋅ Woojin Jeong ⋅ Jae-Pil Heo
Video Understanding, Generation and Multimodal Learning ExHall # 183
ReactVAU: A Slow-Fast Decoupled Framework for Streaming Video Anomaly Understanding Poster Session 2
Chia-Hui Chen ⋅ Shih-Ying Yeh ⋅ Fu-En Yang ⋅ Min-Hung Chen ⋅ Shang-Hong Lai
Video Understanding, Generation and Multimodal Learning ExHall # 233
Beyond Script Family Boundaries: Towards Unified Open-Set Scene Text Recognition Poster Session 2
Chang Liu ⋅ Elisa Smith
Video Understanding, Generation and Multimodal Learning ExHall # 181
Frames2Residual: Spatiotemporal Decoupling for Self-Supervised Video Denoising Poster Session 2
Mingjie Ji ⋅ Zhan Shi ⋅ Kailai Zhou ⋅ Zixuan Fu ⋅ Xun Cao
Video Understanding, Generation and Multimodal Learning ExHall # 3
Safe Responses Matter: Output-Aware Safety Guardrail Mitigate Over-Refusal in MLLMs Poster Session 2
Jiayi Li ⋅ Kun Zhan
Video Understanding, Generation and Multimodal Learning ExHall # 89
LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos Poster Session 2
Ce Zhang ⋅ Jinxi He ⋅ Yaqi Xie ⋅ Katia Sycara
Video Understanding, Generation and Multimodal Learning ExHall # 150
EgoEverything: A Benchmark for Human Behavior–Inspired Long-Context Egocentric Video Understanding in AR Environment Poster Session 2
Qiance Tang ⋅ Ziqi Wang ⋅ Jieyu Lin ⋅ Ziyun Li ⋅ Barbara Salvo ⋅ Sai Qian Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 124
HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising Poster Session 2
Kai Zou ⋅ Dian Zheng ⋅ Hongbo Liu ⋅ Tiankai Hang ⋅ Bin Liu ⋅ Nenghai Yu
Video Understanding, Generation and Multimodal Learning ExHall # 44
PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion Poster Session 2
Heyuan Gao ⋅ Bangxun Tang ⋅ Yiren Song ⋅ Guian Fang ⋅ Zijian He ⋅ Jie Yang ⋅ Mike Zheng Shou
Video Understanding, Generation and Multimodal Learning ExHall # 38
ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space Poster Session 2
Peiming Li ⋅ Yifan Wang ⋅ Xiaotian Zhang ⋅ Zhiyuan Hu ⋅ Shiyu Li ⋅ Zheng Wei ⋅ Yang Tang
Video Understanding, Generation and Multimodal Learning ExHall # 19
Test-time Counterfactual Calibration for Hallucination-Resistant Temporal Grounding Poster Session 2
Chufan YI ⋅ Hongyu Qu ⋅ Shiyu Xuan ⋅ Rui Yan ⋅ Xiangbo Shu ⋅ Fang Zhao ⋅ Guosen Xie
Video Understanding, Generation and Multimodal Learning ExHall # 36
X2SAM: Any Segmentation in Images and Videos Poster Session 2
Hao Wang ⋅ Limeng Qiao ⋅ Chi Zhang ⋅ Lin Ma ⋅ Guanglu Wan ⋅ Xiangyuan Lan ⋅ Xiaodan Liang
Video Understanding, Generation and Multimodal Learning ExHall # 65
Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval Poster Session 2
Kyeongmo Chae ⋅ Jihoon Lee ⋅ Sangtae Ahn
Video Understanding, Generation and Multimodal Learning ExHall # 176
DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer Poster Session 2
Hengye Lyu ⋅ Zisu Li ⋅ Yue Hong ⋅ Yueting Weng ⋅ Jiaxin Shi ⋅ Hanwang Zhang ⋅ Chen Liang
Video Understanding, Generation and Multimodal Learning ExHall # 196
Ring Forcing: Towards Precise Long-Term Memory for Autoregressive Video Diffusion Poster Session 2
Bowen Xue ⋅ Brandon Feng ⋅ Chenguo Lin ⋅ Yuchen Lin ⋅ Yujia Zeng ⋅ lvmin zhang ⋅ Maneesh Agrawala ⋅ Honglei Yan ⋅ Panwang Pan
Video Understanding, Generation and Multimodal Learning ExHall # 2
No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs Poster Session 2
Haojian Huang ⋅ Harold Haodong Chen ⋅ Meng Luo ⋅ Junjia Du ⋅ Shanqing Xu ⋅ Ziheng Chen ⋅ Yanxiang Huang ⋅ Yinchuan Li ⋅ Yingcong Chen
Video Understanding, Generation and Multimodal Learning ExHall # 190
From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models Poster Session 2
Meng Luo ⋅ Yicheng Liu ⋅ Jiahao Wang ⋅ Yuanxing Zhang ⋅ Xin Tao ⋅ Pengfei Wan ⋅ Kun Gai ⋅ Hao Fei
Video Understanding, Generation and Multimodal Learning ExHall # 109
FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation Poster Session 2
Yunfeng Wu ⋅ Jiayi Song ⋅ Zhenxiong Tan ⋅ Zihao He ⋅ Songhua Liu
Video Understanding, Generation and Multimodal Learning ExHall # 59
Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention Poster Session 2
Taiye Chen ⋅ Zihan Ding ⋅ Anjian Li ⋅ Christina Zhang ⋅ Zeqi Xiao ⋅ Yisen Wang ⋅ Chi Jin
Video Understanding, Generation and Multimodal Learning ExHall # 149
TaxoGrasp: Taxonomy-Guided Human Grasp Synthesis with Sparse Contact Constraint Poster Session 2
Haitian Liu ⋅ Yin Wang ⋅ Zhiying Leng ⋅ Kanglei Zhou ⋅ Yan Wang ⋅ Frederick W. B. Li ⋅ Xiaohui Liang
Video Understanding, Generation and Multimodal Learning ExHall # 159
QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding Poster Session 2
Jun Peng ⋅ Baiyang Song ⋅ Jie Li ⋅ Hui Li ⋅ Yiyi Zhou ⋅ Rongrong Ji ⋅ Yonghong Tian
Video Understanding, Generation and Multimodal Learning ExHall # 160
Video-HolmesV2: Can MLLMs Reason with Spatio-Temporal Audio-Visual Evidence in Long Videos? Poster Session 2
Zhaoyang Wei ⋅ Zipeng Wang ⋅ Yushe Cao ⋅ Chenhui Qiang ⋅ Shuaibing Cheng ⋅ Xuesong Yang ⋅ Sen Nie ⋅ Bowen Jiang ⋅ Wenchao Ding ⋅ Yanchao Hao ⋅ Zheng Wei ⋅ Xuehui Yu ⋅ Zhenjun Han
Video Understanding, Generation and Multimodal Learning ExHall # 161
Conversational Human Audio-visual Talking Dialogue Generation Poster Session 2
Junhao Song ⋅ Lluis Guasch ⋅ Xilin He ⋅ zhongyu yang ⋅ Yingfang Yuan ⋅ Weicheng Xie ⋅ Linlin Shen ⋅ Lin Haijun ⋅ Shizhe Liu ⋅ Wei Pang ⋅ Siyang Song
Video Understanding, Generation and Multimodal Learning ExHall # 162
Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-visual Language Models Poster Session 2
Ami Baid ⋅ Zihui Xue ⋅ Kristen Grauman
Video Understanding, Generation and Multimodal Learning ExHall # 163
SIGNET: Motion-Level Knowledge Transfer for Cross-Language Sign Language Translation Poster Session 2
Sobhan Asasi ⋅ Ozge Mercanoglu Sincan ⋅ Richard Bowden
Video Understanding, Generation and Multimodal Learning ExHall # 164
Reward Modeling for Computer-Using Agent from Video Execution Poster Session 2
Linxin Song ⋅ Jieyu Zhang ⋅ Huanxin Sheng ⋅ Taiwei Shi ⋅ Rahul Gupta ⋅ Yang Liu ⋅ Ranjay Krishna ⋅ Jian Kang ⋅ Jieyu Zhao
Video Understanding, Generation and Multimodal Learning ExHall # 165
SignBind-LLM: Multi-Stage Modality Fusion for Sign Language Translation Poster Session 2
Marshall Thomas ⋅ Edward Fish ⋅ Richard Bowden
Video Understanding, Generation and Multimodal Learning ExHall # 166
PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoning Poster Session 2
Shaoxuan Li ⋅ Zhixuan Zhao ⋅ Hanze Deng ⋅ Zirun Ma ⋅ Shulin Tian ⋅ ZUYAN LIU ⋅ Yushi Hu ⋅ Haoning Wu ⋅ Yuhao Dong ⋅ Benlin Liu ⋅ Ziwei Liu ⋅ Ranjay Krishna
Video Understanding, Generation and Multimodal Learning ExHall # 167
EgoCogNav: Cognition-aware Human Egocentric Navigation Poster Session 2
Zhiwen Qiu ⋅ Ziang Liu ⋅ Wenqian Niu ⋅ Tapomayukh Bhattacharjee ⋅ Saleh Kalantari
Video Understanding, Generation and Multimodal Learning ExHall # 168
Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding Poster Session 2
Yeeun Choi ⋅ Youngbeom Yoo ⋅ Joon-Young Lee ⋅ Hyolim Kang ⋅ Seon Joo Kim
Video Understanding, Generation and Multimodal Learning ExHall # 169
STVFocus: Query-guided Spatio-Temporal Visual Focusing for Video LLMs Poster Session 2
Taehun Kong ⋅ Minyoung Park ⋅ Sangjun Ahn
Video Understanding, Generation and Multimodal Learning ExHall # 170
LARY: A Latent Action Representation Yielding Benchmark Poster Session 2
Dujun Nie ⋅ Fengjiao Chen ⋅ Jun Kuang ⋅ Qi Lv ⋅ Xiaoyu Li ⋅ Xuezhi Cao
Video Understanding, Generation and Multimodal Learning ExHall # 171
HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization Poster Session 2
Tao Cheng ⋅ Shi-Zhe Chen ⋅ Hao Zhang ⋅ Yixin Qin ⋅ Jinwen Luo ⋅ Zheng Wei
Video Understanding, Generation and Multimodal Learning ExHall # 172
Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models Poster Session 2
Junyuan Xiao ⋅ Dingkang Liang ⋅ Xin Zhou ⋅ Yixuan Ye ⋅ Tongtong Su ⋅ Guangmo Yi ⋅ Bin Xia ⋅ Qiang Lyu ⋅ Shurui Shi ⋅ Jun Huang ⋅ Jianlou Si ⋅ Wenming Yang
Video Understanding, Generation and Multimodal Learning ExHall # 173
From Script to Shot: A Benchmark for Grounding Screenplays in Movies Poster Session 2
jungu cho ⋅ Young-Jae Park ⋅ Seong Jong Ha ⋅ Siyeol Kim ⋅ Seungho Park ⋅ Jisu Shin ⋅ Junmyeong Lee ⋅ Chaemin Hwang ⋅ Hyunjun Jung ⋅ Sangeyl Lee ⋅ Hae-Gon Jeon
Video Understanding, Generation and Multimodal Learning ExHall # 174
GTR: Guide-Then-Refine Token Compression for Training-Free Acceleration of Video-LLMs Poster Session 2
Sijin Zhou ⋅ wei feng ⋅ Zhuang Qi ⋅ Zhonghua Wang ⋅ Lie Ju ⋅ Xiang An ⋅ Mehrtash Harandi ⋅ Zongyuan Ge
Video Understanding, Generation and Multimodal Learning ExHall # 175
RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction Poster Session 2
Zifan Wang ⋅ Ziang Ren ⋅ Pengyang Shi ⋅ Zirui Wang ⋅ Chenghuai Lin ⋅ Tianze Wang ⋅ Zekun Qi ⋅ Liangliang Zhao ⋅ HE WANG ⋅ Li Yi
Video Understanding, Generation and Multimodal Learning ExHall # 177
Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation Poster Session 2
Yeonkyeong Lee ⋅ Hyunsung Go ⋅ Jongmin Kim ⋅ Lim Sewoong ⋅ Donghoon Lee
Video Understanding, Generation and Multimodal Learning ExHall # 178
S3-Prune: Stability-Aware Token Budgeting for Long-Form Video-Language Models Poster Session 2
gilha lee ⋅ Seungil Lee ⋅ Hyun Kim
Video Understanding, Generation and Multimodal Learning ExHall # 179
Video-Oasis: Rethinking Evaluation of Video Understanding Poster Session 2
Geuntaek Lim ⋅ Minho Shim ⋅ Sungjune Park ⋅ Jaeyun Lee ⋅ Inwoong Lee ⋅ Taeoh Kim ⋅ Dongyoon Wee ⋅ Yukyung Choi
Video Understanding, Generation and Multimodal Learning ExHall # 180
Revisiting Weakly-Supervised Video Scene Graph Generation via Pair Affinity Learning Poster Session 2
MINSEOK KANG ⋅ Minhyeok Lee ⋅ Minjung Kim ⋅ Jungho Lee ⋅ Donghyeong Kim ⋅ Sungmin Woo ⋅ Inseok Jeon ⋅ Sangyoun Lee
Video Understanding, Generation and Multimodal Learning ExHall # 182
H2SVC: Head-aware Heterogeneous Streaming Video Cache for Online Video Understanding Poster Session 2
han li ⋅ Xinyi Zhang ⋅ Wenrui Dai ⋅ Yaoming Wang ⋅ Xinyu Peng ⋅ Fan He ⋅ Hang Xu ⋅ Ziyang Zheng ⋅ Chenglin Li ⋅ Junni Zou ⋅ Hongkai Xiong
Video Understanding, Generation and Multimodal Learning ExHall # 184
RoboClaw: An Agentic Framework for Scalable Long-Horizon Robotic Tasks Poster Session 2
Ruiying Li ⋅ Yunlang Zhou ⋅ Yuyao Zhu ⋅ Kylin Chen ⋅ Sukai Wang ⋅ Kongtao Hu ⋅ Minhui Yu ⋅ Bowen Jiang ⋅ Jiayao Ma ⋅ Zhan Su ⋅ Yongjian Shen ⋅ Yang Yang ⋅ Guanghui Ren ⋅ Maoqing Yao ⋅ Wenhao Wang ⋅ Yao Mu
Video Understanding, Generation and Multimodal Learning ExHall # 185
EgoPHI: Estimating 3D Hand-Object Contact and Force from Egocentric Vision Poster Session 2
Andela Ilic ⋅ Rachel Schuchert ⋅ Yijing Jiang ⋅ Christian Holz
Video Understanding, Generation and Multimodal Learning ExHall # 186
ActionPlan: Future-Aware Streaming Motion Synthesis via Frame-Level Action Planning Poster Session 2
Eric Nazarenus ⋅ Chuqiao Li ⋅ Yannan He ⋅ Xianghui Xie ⋅ Jan Eric Lenssen ⋅ Gerard Pons-Moll
Video Understanding, Generation and Multimodal Learning ExHall # 187
Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction Poster Session 2
Efstathios Karypidis ⋅ Spyros Gidaris ⋅ Nikos Komodakis
Video Understanding, Generation and Multimodal Learning ExHall # 188
MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing Poster Session 2
Gal Fiebelman ⋅ Hadar Averbuch-Elor ⋅ Sagie Benaim
Video Understanding, Generation and Multimodal Learning ExHall # 189
Accelerating Diffusion Models via Equal-Risk Caching Poster Session 2
Can Zhang ⋅ Liangshun Zou
Video Understanding, Generation and Multimodal Learning ExHall # 191
Continuous Heart Rate Variability Estimation from Egocentric Systems for Skill Assessment Poster Session 2
Berken Utku Demirel ⋅ Christian Holz
Video Understanding, Generation and Multimodal Learning ExHall # 192
AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation Poster Session 2
Trung Kien Pham ⋅ I Chen ⋅ Qifeng Chen ⋅ Long Chen
Video Understanding, Generation and Multimodal Learning ExHall # 193
LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension Poster Session 2
Shunya Kato ⋅ Taiki Miyanishi ⋅ Shuhei Kurita ⋅ Mahiro Ukai ⋅ Nakamasa Inoue ⋅ Chenhui Chu
Video Understanding, Generation and Multimodal Learning ExHall # 194
MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment Poster Session 2
Peiyuan Zhu ⋅ Shaoan Xie ⋅ Zijian Li ⋅ Yifan Shen ⋅ Namrata Deka ⋅ Harsh Shrivastava ⋅ Guangyi Chen ⋅ Kun Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 195
Learning Consistent Temporal Grounding between Related Tasks in Sports Coaching Poster Session 2
Arushi Rai ⋅ Adriana Kovashka
Video Understanding, Generation and Multimodal Learning ExHall # 197
GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine Poster Session 2
Yanan Wang ⋅ Wen li ⋅ Yibin Ying ⋅ Zhenghao Fei
Video Understanding, Generation and Multimodal Learning ExHall # 198
Natural Language Camera Movement Understanding Poster Session 2
Yuwen Tan ⋅ Joey Huang ⋅ Jin Huang ⋅ Haoxiang Li ⋅ Boqing Gong
Video Understanding, Generation and Multimodal Learning ExHall # 199
UniTemp: Unlocking Video Generation in Any Temporal Order via Autoregressive Distillation Poster Session 2
Lin Zhang ⋅ Sicheng Mo ⋅ Zefan Cai ⋅ Jinhong Lin ⋅ Zihao Lin ⋅ Jiuxiang Gu ⋅ Krishna Kumar Singh ⋅ Yuheng Li ⋅ Yin Li
Video Understanding, Generation and Multimodal Learning ExHall # 200
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching Poster Session 2
Mingi Kwon ⋅ Joonghyuk Shin ⋅ Jaeseok Jeong ⋅ Jaesik Park ⋅ Youngjung Uh
Video Understanding, Generation and Multimodal Learning ExHall # 201
Fine-Grained Text-to-Video Retrieval for Camera-Trap Data Poster Session 2
Valentin Gabeff ⋅ Baptiste Maquignaz ⋅ Jiaxian Shan ⋅ Sepideh Mamooler ⋅ Gencer Sumbul ⋅ Blair Costelloe ⋅ Devis TUIA ⋅ Alexander Mathis
Video Understanding, Generation and Multimodal Learning ExHall # 202
Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents Poster Session 2
Xueqiao Sun ⋅ Yuhui Zhang ⋅ Xiaohan Wang ⋅ Ludwig Schmidt ⋅ Serena Yeung-Levy
Video Understanding, Generation and Multimodal Learning ExHall # 203
MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning Poster Session 2
Revant Teotia ⋅ Adrien Bardes ⋅ Michael Rabbat ⋅ Sumit Chopra ⋅ Matthew Muckley ⋅ Nicolas Ballas
Video Understanding, Generation and Multimodal Learning ExHall # 204
Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench Poster Session 2
Lanxiang Hu ⋅ Abhilash Shankarampeta ⋅ Yixin Huang ⋅ Zilin Dai ⋅ Haoyang Yu ⋅ Yujie Zhao ⋅ Haoqiang Kang ⋅ Daniel Zhao ⋅ Tajana Rosing ⋅ Hao Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 205
Causal Yet Future-Aware: Dual-Path Temporal Modeling for Online Action Segmentation Poster Session 2
Zhichao Zheng ⋅ Peirong Ma ⋅ Ying Zhou ⋅ Li Kong ⋅ Junsheng Zhou
Video Understanding, Generation and Multimodal Learning ExHall # 206
Towards Effective Long Video Understanding: Dynamic MAS Construction via Meta-Agent Poster Session 2
Jing Huang ⋅ Lidong Zhang ⋅ Yadong Li ⋅ Xingzhong Xu ⋅ Siye Chen ⋅ Jie Liu ⋅ Ming Kong ⋅ Qiang Zhu
Video Understanding, Generation and Multimodal Learning ExHall # 207
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use Poster Session 2
Siwei Wen ⋅ Zhangcheng Wang ⋅ Xingjian Zhang ⋅ Lei Huang ⋅ wenjun wu
Video Understanding, Generation and Multimodal Learning ExHall # 208
Small Vision-Language Models are Smart Compressors for Long Video Understanding Poster Session 2
Junjie Fei ⋅ Jun Chen ⋅ Zechun Liu ⋅ Yunyang Xiong ⋅ Chong Zhou ⋅ Wei Wen ⋅ Junlin Han ⋅ Mingchen Zhuge ⋅ Saksham Suri ⋅ Qi Qian ⋅ Shuming Liu ⋅ Lemeng Wu ⋅ Raghuraman Krishnamoorthi ⋅ Vikas Chandra ⋅ Mohamed Elhoseiny ⋅ Chenchen Zhu
Video Understanding, Generation and Multimodal Learning ExHall # 209
FeVOS: Foresight Expression Video Object Segmentation Poster Session 2
Kehan Lan ⋅ Kaining Ying ⋅ Henghui Ding
Video Understanding, Generation and Multimodal Learning ExHall # 210
Histopathology Multi-modal Embedding for Pathology Composed Retrieval Poster Session 2
Qifeng Zhou ⋅ Wenliang Zhong ⋅ Thao Dang ⋅ Hehuan Ma ⋅ Saiyang Na ⋅ Yuzhi Guo ⋅ Junzhou Huang
Video Understanding, Generation and Multimodal Learning ExHall # 211
Unified Video Dense Prediction from Disjoint Data Poster Session 2
Yihong Sun ⋅ Seoung Wug Oh ⋅ Jiahui Huang ⋅ Bharath Hariharan ⋅ Joon-Young Lee
Video Understanding, Generation and Multimodal Learning ExHall # 212
FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis Poster Session 2
Sungwoong Yune ⋅ Suheon Jeong ⋅ Joo-Young Kim
Video Understanding, Generation and Multimodal Learning ExHall # 213
Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos Poster Session 2
Sitong Gong ⋅ Tianyu Yan ⋅ Caixin Kang ⋅ Bo Zheng ⋅ Xiang Ruan ⋅ Huchuan Lu ⋅ Kaipeng Zhang ⋅ Yoichi Sato ⋅ Yifei Huang
Video Understanding, Generation and Multimodal Learning ExHall # 214
Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks Poster Session 2
Mei Chee Leong ⋅ Gu Ying ⋅ Hui Tan ⋅ Liyuan Li ⋅ Nancy Chen
Video Understanding, Generation and Multimodal Learning ExHall # 215
Learning to Mask: Cross-Modal Noise Modulation for Hallucination Mitigation in Multi-modal Large Language Models Poster Session 2
Zijian Song ⋅ Chunlei Wang ⋅ Kun He
Video Understanding, Generation and Multimodal Learning ExHall # 216
STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation Poster Session 2
Hesham Syed ⋅ Yun Liu ⋅ Guolei Sun ⋅ Jing Yang ⋅ Henghui Ding ⋅ Xue Geng ⋅ Xudong Jiang
Video Understanding, Generation and Multimodal Learning ExHall # 217
FEEL (Force-Enhanced Egocentric Learning): A Dataset for Physical Action Understanding Poster Session 2
Eadom Dessalene ⋅ Botao He ⋅ Michael Maynord ⋅ Yonatan Tussa ⋅ Pavan Mantripragada ⋅ Yianni Karabatis ⋅ Nirupam Roy ⋅ Yiannis Aloimonos
Video Understanding, Generation and Multimodal Learning ExHall # 218
Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning Poster Session 2
Wenzheng Zeng ⋅ Siyi Jiao ⋅ Chen Gao ⋅ Hwee Tou Ng ⋅ Mike Zheng Shou
Video Understanding, Generation and Multimodal Learning ExHall # 219
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference Poster Session 2
Xiaofeng Mao ⋅ Shaohao Rui ⋅ Bo Zheng ⋅ Kaining Ying ⋅ Chuanhao Li ⋅ Mingmin Chi ⋅ Kaipeng Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 220
OCTOPUS: Multi‑Agentic Universal Compositional Visual Retrieval Poster Session 2
Zhangtao Cheng ⋅ Bozhu Zheng ⋅ Ting Zhong ⋅ Fan Zhou
Video Understanding, Generation and Multimodal Learning ExHall # 221
VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement Poster Session 2
Seohyun Lee ⋅ Seoung Choi ⋅ Dohwan Ko ⋅ Jongha Kim ⋅ Hyunwoo Kim
Video Understanding, Generation and Multimodal Learning ExHall # 222
Perceptual Projection Pruning: Diversity-Aware Video Token Pruning for Multimodal Large Language Models Poster Session 2
Zhuangqiu Huang ⋅ Minxin Lai ⋅ Shuo Liu ⋅ Yu Zhang ⋅ Jiaqi Wang
Video Understanding, Generation and Multimodal Learning ExHall # 223
RL from Physical Feedback: Aligning Large Motion Models with Humanoid Control Poster Session 2
Junpeng Yue ⋅ Zepeng Wang ⋅ Jiangxing Wang ⋅ Yuxuan Wang ⋅ Yu Zhang ⋅ Xinrun Xu ⋅ Bin Cao ⋅ Sipeng Zheng ⋅ gang ding ⋅ Zongqing Lu
Video Understanding, Generation and Multimodal Learning ExHall # 224
Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning Poster Session 2
Rujie Wu ⋅ Haozhe Zhao ⋅ Hai Ci ⋅ Yizhou Wang
Video Understanding, Generation and Multimodal Learning ExHall # 225
Unifying CNNs and ViTs for Learning-Efficient and Scalable Variational AutoEncoder Poster Session 2
Zhiying Lu ⋅ Shang Chai ⋅ Chuanbin Liu ⋅ Litong Gong ⋅ Pandeng Li ⋅ Tiezheng Ge ⋅ Hongtao Xie
Video Understanding, Generation and Multimodal Learning ExHall # 226
RotateAttention : RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation Poster Session 2
Yaofu LIU ⋅ Wangli Lan ⋅ Jinxi Li ⋅ Binhang Yuan ⋅ Harry Yang
Video Understanding, Generation and Multimodal Learning ExHall # 227
CTEPM: Continuous-Time Event Process Memory for Long-Video Language Models Poster Session 2
Yangyang Liu
Video Understanding, Generation and Multimodal Learning ExHall # 228
Self-Evolving MCP-GUI Agents via Automated Environment Generation and Experience Learning Poster Session 2
Tiantian He ⋅ Yihang Chen ⋅ Keyue Jiang ⋅ Ka Lee ⋅ Kaiwen Zhou ⋅ Kun Shao ⋅ Shuai Wang
Video Understanding, Generation and Multimodal Learning ExHall # 229
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning Poster Session 2
Linquan Wu ⋅ Tianxiang Jiang ⋅ Yifei Dong ⋅ Haoyu Yang ⋅ Fengji Zhang ⋅ Shichang Meng ⋅ AI Xuan ⋅ Linqi Song ⋅ Jacky Keung
Video Understanding, Generation and Multimodal Learning ExHall # 230
SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning Poster Session 2
Jinxiu Liu ⋅ Jianru Li ⋅ Tanqing Kuang ⋅ Xuanming Liu ⋅ Kangfu Mei ⋅ Yandong Wen ⋅ Weiyang Liu
Video Understanding, Generation and Multimodal Learning ExHall # 231
QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding Poster Session 2
Wei Ao ⋅ Lan Wang ⋅ Vishnu Boddeti
Video Understanding, Generation and Multimodal Learning ExHall # 232
CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management Poster Session 2
Chao Wang ⋅ Xudong Tan ⋅ Jianjian Cao ⋅ Kangcong Li ⋅ Tao Chen
Video Understanding, Generation and Multimodal Learning ExHall # 234
Remembering Across Blocks: Topology-Conditioned Block-Progressive Memory for Skeleton-Based Action Recognition Poster Session 2
Seonho Lee ⋅ Sang Han ⋅ Hyeok Nam ⋅ Sung In Cho
Video Understanding, Generation and Multimodal Learning ExHall # 235
HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization Poster Session 2
Rui Chu ⋅ Yingjie Lao
Video Understanding, Generation and Multimodal Learning ExHall # 236
NanoVSR: Towards Real-Time Video Super-Resolution on Edge Devices Poster Session 2
Filip Pawlicki ⋅ Marcel Kańduła ⋅ Marcin Pucek ⋅ Kamil Dobies
Video Understanding, Generation and Multimodal Learning ExHall # 237
Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning Poster Session 2
Kazi Sajeed Mehrab ⋅ Hani Alomari ⋅ Najibul Sarker ⋅ Zaber Ibn Abdul Hakim ⋅ Chia-Wei Tang ⋅ Anuj Karpatne ⋅ Chris Thomas
Video Understanding, Generation and Multimodal Learning ExHall # 238
Break Visual-Linguistic Asymmetry: Unleashing VLM's Cross-Modal Potential for General Face Forgery Detection Poster Session 2
Guilin Pang ⋅ Yiu-ming Cheung ⋅ Ruiqi Li ⋅ Weifeng Su
Video Understanding, Generation and Multimodal Learning ExHall # 158
Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models Poster Session 2
Yijie Qian ⋅ Juncheng Wang ⋅ Chao Xu ⋅ Huihan Wang ⋅ Yuxiang Feng ⋅ Yang Liu ⋅ Baigui Sun ⋅ Yong Liu ⋅ Shujun Wang
Video Understanding, Generation and Multimodal Learning ExHall # 157
Thinking in Streaming Video Poster Session 2
Zikang Liu ⋅ Longteng Guo ⋅ Handong Li ⋅ Ru Zhen ⋅ Xingjian He ⋅ Ruyi Ji ⋅ Xiaoming Ren ⋅ Yanhao Zhang ⋅ Haonan Lu ⋅ Jing Liu
Video Understanding, Generation and Multimodal Learning ExHall # 156
EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video-LLMs Poster Session 2
Wenhao Xu ⋅ Xin Dong ⋅ Yue Li ⋅ Haoyuan Shi ⋅ Yueyi Zhang ⋅ Zhiwei Xiong
Video Understanding, Generation and Multimodal Learning ExHall # 155
DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression Poster Session 2
Bingzhou Li ⋅ Tao Huang
Video Understanding, Generation and Multimodal Learning ExHall # 154
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech Poster Session 2
Chengyao Wang ⋅ Zhisheng Zhong ⋅ Bohao PENG ⋅ Senqiao Yang ⋅ Yuqi Liu ⋅ Haokun GUI ⋅ Bin Xia ⋅ Jingyao Li ⋅ Bei Yu ⋅ Jiaya Jia
Video Understanding, Generation and Multimodal Learning ExHall # 153
Open-Vocabulary Long Term Action Anticipation Poster Session 2
Syed Talal Wasim ⋅ Jinhui Yi ⋅ Hamid Suleman ⋅ Ahmad Javed ⋅ Yanan Luo ⋅ Muhammad Muzammal Naseer ⋅ Juergen Gall
Video Understanding, Generation and Multimodal Learning ExHall # 152
CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts Poster Session 2
Lianyu Hu ⋅ shengqian qin ⋅ Zeqin Liao ⋅ Qing Guo ⋅ Liang Wan ⋅ Wei Feng ⋅ Yang Liu
Video Understanding, Generation and Multimodal Learning ExHall # 151
VisionCoach: Reinforcing Grounded Video Reasoning via Visual-Perception Prompting Poster Session 2
Daeun Lee ⋅ Shoubin Yu ⋅ Yue Zhang ⋅ Mohit Bansal
Video Understanding, Generation and Multimodal Learning ExHall # 148
Table-MCR2TR: Merged-Cell-Aware Table Recognition via Reinforced Multimodal Language Models Poster Session 2
Bangbang Zhou ⋅ Zhaoqing Zhu ⋅ Feiyu Gao ⋅ Hangdi Xing ⋅ Yadong Qu ⋅ Qi Zheng ⋅ Ming Yan ⋅ Hongtao Xie
Video Understanding, Generation and Multimodal Learning ExHall # 147
Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO Poster Session 2
Xin Zhang ⋅ Haochen Wang ⋅ Yikang Zhou ⋅ Zhuochen Wang ⋅ Robby T. Tan ⋅ Xiangtai Li
Video Understanding, Generation and Multimodal Learning ExHall # 145
VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning Poster Session 2
Zhe Gao ⋅ Shiyu Shen ⋅ Taifeng Chai ⋅ Weinong Wang ⋅ Haotian Xu ⋅ Xing W ⋅ Wenbin Li ⋅ Qi Fan ⋅ Yang Gao ⋅ Dacheng Tao
Video Understanding, Generation and Multimodal Learning ExHall # 144
LINA: Learning INterventions Adaptively for Physical Alignment and Counterfactual Generation in Diffusion Models Poster Session 2
Shu Yu ⋅ Chaochao Lu
Video Understanding, Generation and Multimodal Learning ExHall # 143
VC-VAE: Leveraging Video Codecs for Training-Efficient and High-Fidelity Video VAE Poster Session 2
Xinxu Ge ⋅ Shang Chai ⋅ Litong Gong ⋅ Zitong Yu ⋅ Xin Liu ⋅ Tiezheng Ge
Video Understanding, Generation and Multimodal Learning ExHall # 142
Q-TriM: Question-Guided Tri-Modal Attention for Audio–Visual Question Answering Poster Session 2
SungHun Kim ⋅ Seung Baek
Video Understanding, Generation and Multimodal Learning ExHall # 141
HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers Poster Session 2
Jing Yang ⋅ Mayoore Jaiswal ⋅ Zian Wang ⋅ Xiao Zeng ⋅ Yajie Zhao ⋅ Jianyuan Min ⋅ Rochelle Pereira
Video Understanding, Generation and Multimodal Learning ExHall # 140
SENTRY: SAM2-Enhanced Neighbor-Aware and Temporally Reasoned Memory for Visual Tracking Poster Session 2
Mohamad Alansari ⋅ Yonathan Michael ⋅ Hasan AlMarzouqi ⋅ Muhammad Muzammal Naseer ⋅ Naoufel Werghi ⋅ Sajid Javed
Video Understanding, Generation and Multimodal Learning ExHall # 139
ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA Poster Session 2
Minkuk Kim ⋅ Suyong Yun ⋅ Young Kim ⋅ Jinyoung Moon ⋅ Jinwoo Choi ⋅ Seong Tae Kim
Video Understanding, Generation and Multimodal Learning ExHall # 138
Towards Temporal Compositional Reasoning in Long-Form Sports Videos Poster Session 2
Siyu Cao ⋅ Lu Zhang ⋅ Ruizhe Zeng ⋅ Zhi-yong Liu
Video Understanding, Generation and Multimodal Learning ExHall # 137
WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation Poster Session 2
Quanjian Song ⋅ Yiren Song ⋅ Kelly Peng ⋅ Yuan Gao ⋅ Mike Zheng Shou
Video Understanding, Generation and Multimodal Learning ExHall # 136
Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence Poster Session 2
Han Hu ⋅ Dongheng Lin ⋅ Yuqi Hou ⋅ Haotian LI ⋅ Hyung Jin Chang ⋅ Jianbo Jiao
Video Understanding, Generation and Multimodal Learning ExHall # 135
Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance Poster Session 2
Wenxuan Song ⋅ Jiayi Chen ⋅ Shuai Chen ⋅ Jingbo Wang ⋅ Pengxiang Ding ⋅ Han Zhao ⋅ qin yikai ⋅ Xinhu Zheng ⋅ Yan Wang ⋅ Donglin Wang ⋅ Haoang Li
Video Understanding, Generation and Multimodal Learning ExHall # 134
Benchmarking Dynamic Affective Reasoning: A Viewer-Centric Video Emotion Dataset Poster Session 2
Zhiyan Zhang ⋅ Peipei Song ⋅ Jinpeng Hu ⋅ Jingyang Jia ⋅ Xun Yang ⋅ Xiaojun Chang
Video Understanding, Generation and Multimodal Learning ExHall # 133
ProAct: Agentic Lookahead in Interactive Environments Poster Session 2
Yangbin Yu ⋅ Mingyu Yang ⋅ junyou li ⋅ Yiming Gao ⋅ Feiyu Liu ⋅ Yijun Yang ⋅ Zichuan Lin ⋅ Jiafei Lyu ⋅ Zhicong Lu ⋅ Deheng Ye ⋅ Jie Jiang
Video Understanding, Generation and Multimodal Learning ExHall # 132
MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization Poster Session 2
Jingchen Ni ⋅ Cangjin Yu ⋅ Zytang Jiang ⋅ Quan Zhang ⋅ Keyu Lv ⋅ Shannan Yan ⋅ Linyue Pan ⋅ Ke Zhang ⋅ Chun Yuan
Video Understanding, Generation and Multimodal Learning ExHall # 131
Counterfactual World Models via Digital Twin-conditioned Video Diffusion Poster Session 2
Yiqing Shen ⋅ Aiza Maksutova ⋅ Chenjia Li ⋅ Mathias Unberath
Video Understanding, Generation and Multimodal Learning ExHall # 130
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation Poster Session 2
Shihao Cheng ⋅ Jiaxu Zhang ⋅ Quanyue Song ⋅ Shansong Liu ⋅ Guo Zhi ⋅ Xiao-Lei Zhang ⋅ Chi Zhang ⋅ Xuelong Li ⋅ Zhigang Tu
Video Understanding, Generation and Multimodal Learning ExHall # 129
AnaPFL: When Closed-Form Solutions Meet Generalizationand Personalization in Personalized Federated Learning Poster Session 2
Kejia Fan ⋅ Jianheng Tang ⋅ Zhirui Yang ⋅ Feijiang Han ⋅ Yajiang Huang ⋅ Run He ⋅ Jiaxu Li ⋅ Songning Lai ⋅ Anfeng Liu ⋅ Houbing Herbert Song ⋅ Yunhuai Liu ⋅ HUIPING ZHUANG
Video Understanding, Generation and Multimodal Learning ExHall # 128
StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description Poster Session 2
Seung Hahm ⋅ Minh Dinh ⋅ SouYoung Jin
Video Understanding, Generation and Multimodal Learning ExHall # 126
Egocentric Procedure Parsing Poster Session 2
Anubhav Anubhav ⋅ Archit Kambhamettu ⋅ Vatsal Agarwal ⋅ Pulkit Kumar ⋅ Abhinav Shrivastava
Video Understanding, Generation and Multimodal Learning ExHall # 125
EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning Poster Session 2
Yogesh Kulkarni ⋅ Pooyan Fazli
Video Understanding, Generation and Multimodal Learning ExHall # 123
JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing Poster Session 2
Xiaohu Huang ⋅ Haoyang He ⋅ Hao Zhou ⋅ Qiangpeng Yang ⋅ Min Zheng ⋅ Kai Han
Video Understanding, Generation and Multimodal Learning ExHall # 122
Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption Poster Session 2
Xiaomeng Fu ⋅ Jia Li ⋅ Yiming Hu ⋅ Yong Wang ⋅ Hayden So ⋅ Jiao Dai ⋅ Xiangxiang Chu ⋅ Jizhong Han
Video Understanding, Generation and Multimodal Learning ExHall # 121
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation Poster Session 2
Yaofeng Su ⋅ Yuming Li ⋅ Zeyue Xue ⋅ Jie Huang ⋅ Siming Fu ⋅ Haoran Li ⋅ Haoyang Huang ⋅ Nan Duan
Video Understanding, Generation and Multimodal Learning ExHall # 120
From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation Poster Session 2
Yibin Liu ⋅ Yaxing Lyu ⋅ Daqi Gao ⋅ Zhixuan Liang ⋅ Weiliang Tang ⋅ Shilong Mu ⋅ Xiaokang Yang ⋅ Mingyu Ding ⋅ Yao Mu
Video Understanding, Generation and Multimodal Learning ExHall # 119
PeCA: Palette Context Assisted Inference for Test-Time Paint-Bucket Colourisation on Animation Videos Poster Session 2
Dongheng Lin ⋅ Jianbo Jiao
Video Understanding, Generation and Multimodal Learning ExHall # 118
C3ASD: Multi-Level Consistency-Driven Representation Learning for Robust Active Speaker Detection Poster Session 2
Jin Hong ⋅ Jisoo Park ⋅ Junseok Kwon
Video Understanding, Generation and Multimodal Learning ExHall # 117
Conditional Flow Matching for Visually-Guided Acoustic Highlighting Poster Session 2
Hugo Malard ⋅ Gael Le Lan ⋅ Daniel Wong ⋅ David Alon ⋅ YI-CHIAO WU ⋅ Sanjeel Parekh
Video Understanding, Generation and Multimodal Learning ExHall # 116
DG-Force: Disentangling and Gathering Forensic Cues is Needed for Image Manipulation Localization Poster Session 2
Yong Yao ⋅ Zhenyu Cui ⋅ Lei Chen ⋅ Jiwen Lu ⋅ Jiahuan Zhou
Video Understanding, Generation and Multimodal Learning ExHall # 115
CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving Poster Session 2
Zhaohong Liu ⋅ Hao Ye ⋅ Xianlin Zhang ⋅ Mengshi Qi
Video Understanding, Generation and Multimodal Learning ExHall # 114
EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding Poster Session 2
Yijia Lei ⋅ Jinzhao Li ⋅ Yichi Zhang ⋅ Jiacheng Hua ⋅ Yin Li ⋅ Miao Liu
Video Understanding, Generation and Multimodal Learning ExHall # 113
Pathwise Test-Time Correction for Autoregressive Long Video Generation Poster Session 2
Xunzhi Xiang ⋅ Zixuan Duan ⋅ Guiyu Zhang ⋅ Haiyu Zhang ⋅ Zhe Gao ⋅ Junta Wu ⋅ Shaofeng Zhang ⋅ Tengfei Wang ⋅ Qi Fan ⋅ Chunchao Guo
Video Understanding, Generation and Multimodal Learning ExHall # 112
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning Poster Session 2
Lorenzo Mur Labadia ⋅ Matthew Muckley ⋅ Amir Bar ⋅ Mido Assran ⋅ Koustuv Sinha ⋅ Michael Rabbat ⋅ Yann LeCun ⋅ Nicolas Ballas ⋅ Adrien Bardes
Video Understanding, Generation and Multimodal Learning ExHall # 111
SAM-MT: Real-Time Interactive Multi-Target Video Segmentation Poster Session 2
Ruiqi Shen ⋅ Chang Liu ⋅ Henghui Ding
Video Understanding, Generation and Multimodal Learning ExHall # 110
Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning Poster Session 2
Zhen Zeng ⋅ Leijiang Gu ⋅ Zhangling Duan ⋅ Feng Li ⋅ Zenglin Shi ⋅ Cees Snoek ⋅ Meng Wang
Video Understanding, Generation and Multimodal Learning ExHall # 108
SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models Poster Session 2
Hongxiang Li ⋅ Hongxu chen ⋅ chenyang zhu ⋅ Xiaoshuang Huang ⋅ Jiayin Cai ⋅ Xiaolong Jiang ⋅ Yao Hu ⋅ Long Chen
Video Understanding, Generation and Multimodal Learning ExHall # 107
AffoGato: Open-Vocabulary Affordance Grounding with Automated Data Generation at Scale Poster Session 2
Junha Lee ⋅ Eunha Park ⋅ Chunghyun Park ⋅ Dahyun Kang ⋅ Minsu Cho
Video Understanding, Generation and Multimodal Learning ExHall # 106
Towards Long-Form Spatio-Temporal Video Grounding Poster Session 2
Xin Gu ⋅ Bing Fan ⋅ Jiali Yao ⋅ Zhipeng Zhang ⋅ Yan Huang ⋅ Cheng Han ⋅ Heng Fan ⋅ Libo Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 105
Clue Matters: Empower Video Reasoning with Brain-Inspired Latent Clue Learning Poster Session 2
Kaixin Zhang ⋅ Xiaohe Li ⋅ Jiahao Li ⋅ Haohua Wu ⋅ Xinyu Zhao ⋅ Zide Fan ⋅ Lei Wang
Video Understanding, Generation and Multimodal Learning ExHall # 104
SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning Poster Session 2
Taeryung Lee ⋅ Hyeongjin Nam ⋅ Gyeongsik Moon ⋅ Kyoung Mu Lee
Video Understanding, Generation and Multimodal Learning ExHall # 103
Temporal and Cross-modal Alignment for Enhanced Audiovisual Video Captioning Poster Session 2
Chen Zhao ⋅ Jiajun Ma ⋅ Qilong Huang ⋅ Tiehan Fan ⋅ Hongyu Li ⋅ Zhuoliang Kang ⋅ Xiaoming Wei ⋅ Jian Yang ⋅ Ying Tai
Video Understanding, Generation and Multimodal Learning ExHall # 102
Trajectory-Level Continuous Action Representation for Robotic Manipulation Poster Session 2
Tong Yang ⋅ Jingkai Jia ⋅ Yuecheng Xu ⋅ Xueyao Chen ⋅ Chi Zhang ⋅ Wenqiang Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 101
Test Time Training for Long Videos via Frame Forgetting Network Poster Session 2
Rajat modi ⋅ Xin Liang ⋅ Sebastian Noel ⋅ Yogesh Rawat
Video Understanding, Generation and Multimodal Learning ExHall # 100
Guiding the Blind: Generalizing GUI Agents to Unseen Websites via Multimodal Tutorials Poster Session 2
Xinwei Long ⋅ Kai Tian ⋅ Peng Xu ⋅ Weibo Gao ⋅ Yihua Shao ⋅ Guoli Jia ⋅ Haozhe Geng ⋅ Sa Yang ⋅ Jingxuan Li ⋅ Huayong Hu ⋅ Kaiyan Zhang ⋅ Jiaqi Wang ⋅ Bowen Zhou
Video Understanding, Generation and Multimodal Learning ExHall # 99
Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding Poster Session 2
Shuimu Chen ⋅ Yuteng Chen ⋅ Yuanshen Guan ⋅ Zebang Cheng ⋅ Zeyu Zhang ⋅ shengqian qin ⋅ Bin Xia ⋅ Jiaran Li ⋅ Wenming Yang ⋅ Fei Ma
Video Understanding, Generation and Multimodal Learning ExHall # 98
Video-Holmes: Can MLLM Think like Holmes for Complex Video Reasoning? Poster Session 2
JUNHAO CHENG ⋅ Yuying Ge ⋅ Teng Wang ⋅ Yixiao Ge ⋅ Jing Liao ⋅ Ying Shan
Video Understanding, Generation and Multimodal Learning ExHall # 97
PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation Poster Session 2
Dingwen Xiao ⋅ WEIMING ZHANG ⋅ Shiqi Wen ⋅ Addison Wang
Video Understanding, Generation and Multimodal Learning ExHall # 96
VoCa: Unified Autoregressive Modeling for Talking Audio-Video Generation Poster Session 2
Zhuofan Zong ⋅ Jiale Yuan ⋅ Yufei Liu ⋅ Dongzhi Jiang ⋅ Hao Shao ⋅ Zimu Lu ⋅ Ke Wang ⋅ Yunqiao Yang ⋅ Mingjie Zhan ⋅ Hongsheng LI
Video Understanding, Generation and Multimodal Learning ExHall # 95
Step-by-Step Video-to-Audio Synthesis via Negative Audio Guidance Poster Session 2
Akio Hayakawa ⋅ Masato Ishii ⋅ Takashi Shibuya ⋅ Yuki Mitsufuji
Video Understanding, Generation and Multimodal Learning ExHall # 94
End-to-End Training for Autoregressive Video Diffusion via Self-Resampling Poster Session 2
Yuwei Guo ⋅ Ceyuan Yang ⋅ Hao He ⋅ Yang Zhao ⋅ Meng Wei ⋅ Zhenheng Yang ⋅ Weilin Huang ⋅ Dahua Lin
Video Understanding, Generation and Multimodal Learning ExHall # 93
Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks Poster Session 2
jie li ⋅ Hongyi Cai ⋅ Mingkang Dong ⋅ Muxin Pu ⋅ Shan You ⋅ Fei Wang ⋅ Tao Huang
Video Understanding, Generation and Multimodal Learning ExHall # 92
SMART: When is it Actually Worth Expanding a Speculative Tree? Poster Session 2
Lifu Wang ⋅ Pan ZHOU
Video Understanding, Generation and Multimodal Learning ExHall # 91
Delayed Bidirectional Alignment via Disentangled Audio Semantics for Audio-Visual Segmentation Poster Session 2
Jingqi Tian ⋅ Yiheng Du ⋅ Haoji Zhang ⋅ Yuji Wang ⋅ Isaac Ning Lee ⋅ Xulong Bai ⋅ Tianrui Zhu ⋅ Jingxuan Niu ⋅ Yansong Tang
Video Understanding, Generation and Multimodal Learning ExHall # 90
Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space Poster Session 2
Thanh V. T. Tran ⋅ Ngoc-Son Nguyen ⋅ Luong Tran ⋅ Long-Khanh Pham ⋅ Paarth Neekhara ⋅ Shehzeen Hussain ⋅ Van Nguyen
Video Understanding, Generation and Multimodal Learning ExHall # 88
Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing Poster Session 2
Dohun Lee ⋅ Chun-Hao Huang ⋅ Xuelin Chen ⋅ Jong Chul Ye ⋅ Duygu Ceylan ⋅ Hyeonho Jeong
Video Understanding, Generation and Multimodal Learning ExHall # 87
Adaptive Latent Trajectory Anchoring for Action Segmentation Dataset Condensation Poster Session 2
Arthème Gauthier-Villars ⋅ Guodong Ding ⋅ Angela Yao
Video Understanding, Generation and Multimodal Learning ExHall # 86
TAR: Temporal Anchor-Constrained Reasoning for Video Temporal Grounding Poster Session 2
Chaohong Guo ⋅ Xun Mo ⋅ Yongwei Nie ⋅ Fei Ma ⋅ Xuemiao Xu ⋅ Chengjiang Long
Video Understanding, Generation and Multimodal Learning ExHall # 85
Cambrian-P: Pose-Grounded Video Understanding Poster Session 2
Jihan YANG ⋅ Zifan Zhao ⋅ Xichen Pan ⋅ Shusheng Yang ⋅ Junyi Zhang ⋅ Hu Xu ⋅ Shang-Wen Li ⋅ Saining Xie
Video Understanding, Generation and Multimodal Learning ExHall # 84
Adapting MLLMs for Nuanced Video Retrieval Poster Session 2
Piyush Nitin Bagad ⋅ Andrew ZISSERMAN
Video Understanding, Generation and Multimodal Learning ExHall # 83
Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space Poster Session 2
Yue Cao ⋅ Jianyang Gu ⋅ Vyacheslav Kungurtsev ⋅ Yu Hu ⋅ Jozsef Hamari ⋅ Zheng Liu ⋅ Mohsen Zardadi
Video Understanding, Generation and Multimodal Learning ExHall # 82
RoboMirror: Understand Before You Imitate for Video to Humanoid Locomotion Poster Session 2
Zhe Li ⋅ Boan Zhu ⋅ Yangyang Wei ⋅ Shuanghao Bai ⋅ Yuheng Ji ⋅ Tao Huang ⋅ Pengwei Wang ⋅ Zhongyuan Wang ⋅ Gary Chan ⋅ Chang Xu ⋅ Cheng Chi ⋅ Jianfei Yang ⋅ Shanghang Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 81
Audio-Visual Continual Test-Time Adaptation without Forgetting Poster Session 2
Sarthak Kumar Maharana ⋅ Akshay Mehra ⋅ Bhavya Ramakrishna ⋅ Yunhui Guo ⋅ Guan-Ming Su
Video Understanding, Generation and Multimodal Learning ExHall # 80
DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding Poster Session 2
zhengbo zhang ⋅ Mark H. Huang ⋅ Zhigang Tu ⋅ Ming-Hsuan Yang
Video Understanding, Generation and Multimodal Learning ExHall # 79
Autoregressive Image Generation Needs Only a Few Lines of Cached Tokens Poster Session 2
Ziran Qin ⋅ Youru Lv ⋅ Mingbao Lin ⋅ Zeren Zhang ⋅ chaofan gan ⋅ Tieyuan Chen ⋅ Liquan Shen ⋅ Junhui Hou ⋅ Chern Hong Lim ⋅ Fei Wen ⋅ Weiyao Lin
Video Understanding, Generation and Multimodal Learning ExHall # 78
ChronusOmni: Improving Time Awareness of Omni-Modal Large Language Models Poster Session 2
Yijing Chen ⋅ Yihan Wu ⋅ Kaisi Guan ⋅ Wenhui Tan ⋅ Yuchen Ren ⋅ Yuyue Wang ⋅ Ruihua Song ⋅ Liyun Ru
Video Understanding, Generation and Multimodal Learning ExHall # 77
TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning Poster Session 2
lvmin zhang ⋅ Shengqu Cai ⋅ Muyang Li ⋅ Chong Zeng ⋅ Beijia Lu ⋅ Anyi Rao ⋅ Song Han ⋅ Gordon Wetzstein ⋅ Maneesh Agrawala
Video Understanding, Generation and Multimodal Learning ExHall # 76
LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation Poster Session 2
Guanjie Wang ⋅ Zehua Ma ⋅ Han Fang ⋅ Weiming Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 75
ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement Poster Session 2
JINLONG LI ⋅ Jiaming Ding ⋅ Dingfu Lu ⋅ Malcolm Hsiu ⋅ Chuang Ke ⋅ Kangning Yang ⋅ Bochen Guan ⋅ Lan Fu ⋅ Jie Cai ⋅ Huiming Sun ⋅ Zibo Meng
Video Understanding, Generation and Multimodal Learning ExHall # 74
SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning Poster Session 2
Xi Ye ⋅ Wenjia Yang ⋅ Yangyang Xu ⋅ Xiaoyang Liu ⋅ Duo Su ⋅ Mengfei Xia ⋅ Jun Zhu
Video Understanding, Generation and Multimodal Learning ExHall # 73
GryphOne: Symbol-Aware Masked Diffusion for Structural Refinement in Offline Handwritten Mathematical Expression Recognition Poster Session 2
Takaya Kawakatsu ⋅ Ryo Ishiyama
Video Understanding, Generation and Multimodal Learning ExHall # 72
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video Poster Session 2
JUNFU PU ⋅ Yuxin Chen ⋅ Teng Wang ⋅ Ying Shan
Video Understanding, Generation and Multimodal Learning ExHall # 71
DeRA: Decoupled Representation Alignment for Video Tokenization Poster Session 2
Pengbo Guo ⋅ Junke Wang ⋅ Zhen Xing ⋅ Chengxu Liu ⋅ Daoguo Dong ⋅ Xueming Qian ⋅ Zuxuan Wu
Video Understanding, Generation and Multimodal Learning ExHall # 70
Towards in-the-wild Egocentric 3D Hand-Object Pose Estimation Poster Session 2
Siddhant Bansal ⋅ Zhifan Zhu ⋅ Shashank Tripathi ⋅ Jiahe Zhao ⋅ Michael Black ⋅ Dima Damen
Video Understanding, Generation and Multimodal Learning ExHall # 69
FeatTracker: Short- and Long-Range Temporal Feature Consistency for Robust Underwater Object Tracking Poster Session 2
Jiaqing Li ⋅ Bin Lin ⋅ Chaocan Xue ⋅ Wu Ai ⋅ Qingping Zheng
Video Understanding, Generation and Multimodal Learning ExHall # 68
A Benchmark and Multi-Agent System for Instruction-driven Cinematic Video Compilation Poster Session 2
Peixuan Zhang ⋅ Chang Zhou ⋅ Ziyuan Zhang ⋅ Hualuo Liu ⋅ Chunjie Zhang ⋅ Jingqi Liu ⋅ Xiaohui Zhou ⋅ Xi Chen ⋅ Shuchen Weng ⋅ Si Li ⋅ Boxin Shi
Video Understanding, Generation and Multimodal Learning ExHall # 67
OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better Poster Session 2
Yupeng Zhou ⋅ Zhen Li ⋅ Yuming Chen ⋅ Ziheng Ouyang ⋅ Ruoyi Du ⋅ Daquan Zhou ⋅ Bin Fu ⋅ Yihao Liu ⋅ Peng Gao ⋅ Ming-Ming Cheng ⋅ Qibin Hou
Video Understanding, Generation and Multimodal Learning ExHall # 66
SPAR: A Sequential Primacy and Attribution Ranking Framework for Skill Determination Poster Session 2
Hui Yu ⋅ Xiao Ke ⋅ Zhihong Zeng ⋅ Huangbiao Xu ⋅ Huanqi Wu ⋅ Yaru Su
Video Understanding, Generation and Multimodal Learning ExHall # 64
OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization Poster Session 2
Sakib Reza ⋅ Gauri Jagatap ⋅ Mohsen Moghaddam ⋅ OCTAVIA CAMPS ⋅ Andrea Fanelli
Video Understanding, Generation and Multimodal Learning ExHall # 63
LogFA: Efficient Feature-Space Data Augmentation for Egocentric Temporal Action Segmentation Poster Session 2
Zijia Lu ⋅ Ehsan Elhamifar
Video Understanding, Generation and Multimodal Learning ExHall # 62
Synthetic Visual Genome 2: Extracting Large-scale Spatio-Temporal Scene Graphs from Videos Poster Session 2
Ziqi Gao ⋅ Jieyu Zhang ⋅ Wisdom Ikezogwo ⋅ Jae Sung Park ⋅ Tario You ⋅ Daniel Ogbu ⋅ Chenhao Zheng ⋅ Weikai Huang ⋅ Yinuo Yang ⋅ Winson Han ⋅ Quan Kong ⋅ Rajat Saini ⋅ Ranjay Krishna
Video Understanding, Generation and Multimodal Learning ExHall # 61
Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs Poster Session 2
Haochen Han ⋅ Jue Wang ⋅ Alex Jinpeng Wang ⋅ Fangming Liu
Video Understanding, Generation and Multimodal Learning ExHall # 60
FingerCap: Fine-grained Finger-level Hand Motion Captioning Poster Session 2
Xin Shen ⋅ Rui Zhu ⋅ Lei Shen ⋅ Zhuojie Wu ⋅ Xinyu Wang ⋅ Kaihao Zhang ⋅ Tianqing Zhu ⋅ Shuchen Wu ⋅ Chenxi Miao ⋅ Weikang Li ⋅ Deguo Xia ⋅ Jizhou Huang ⋅ Xin Yu
Video Understanding, Generation and Multimodal Learning ExHall # 58
DART: Deformable Adaptive Reasoning with Temporal Queries for Online Skeleton-Based Action Recognition Poster Session 2
Chaoyang Zheng ⋅ Yang Xiao ⋅ Tingbing Yan ⋅ Jinfang Gan ⋅ Xintao Zhang ⋅ Ran Wang ⋅ Zhiguo Cao ⋅ Joey Tianyi Zhou
Video Understanding, Generation and Multimodal Learning ExHall # 57
SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation Poster Session 2
Juncheng Ma ⋅ Yuxuan Du ⋅ Sun Yanan ⋅ Zhening Xing ⋅ Changlin Li ⋅ Zhenyu Tang ⋅ Bo Li ⋅ Peng-Tao Jiang ⋅ Li Yuan ⋅ Daquan Zhou ⋅ Yonghong Tian
Video Understanding, Generation and Multimodal Learning ExHall # 56
Learning Egocentric Cues from Exocentric Video using Privileged Egocentric Supervision Poster Session 2
Dominick Reilly ⋅ Manish Govind ⋅ Le Xue ⋅ Srijan Das
Video Understanding, Generation and Multimodal Learning ExHall # 55
Latent Visual Diffusion Reasoning with Monte Carlo Tree Search Poster Session 2
Xirui Teng ⋅ Nan Xi ⋅ Junsong Yuan
Video Understanding, Generation and Multimodal Learning ExHall # 54
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding Poster Session 2
Linghao Meng ⋅ Qiankun Li ⋅ Junyuan Mao ⋅ Pujin Liao ⋅ Zhicheng He ⋅ Enbo Zhang ⋅ Kun Wang ⋅ Yang Liu ⋅ Huazhu Fu ⋅ Yueming Jin
Video Understanding, Generation and Multimodal Learning ExHall # 53
S2Gest: Split-Scan State Space Models for Dynamic Hand Gesture Recognition Poster Session 2
KeFan Chen ⋅ Yong Gu ⋅ bo li ⋅ Longjie Huang ⋅ Jiajun Zhang
Video Understanding, Generation and Multimodal Learning ExHall # 52
Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs Poster Session 2
Sanghwan Kim ⋅ Rui Xiao ⋅ Stephan Alaniz ⋅ Yongqin Xian ⋅ Zeynep Akata
Video Understanding, Generation and Multimodal Learning ExHall # 51
EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation Poster Session 2
Jiayi Luo ⋅ Hanxin Zhu ⋅ Chen Gao ⋅ Jiankun Wang ⋅ Cong Wang ⋅ Tianyu He ⋅ Jianxin Li ⋅ Zhibo Chen
Video Understanding, Generation and Multimodal Learning ExHall # 50
SpecEyes: Accelerating Agentic Multimodal LLM via Speculative Planning and Perception Poster Session 2
Haoyu Huang ⋅ Jinfa Huang ⋅ Zhongwei Wan ⋅ Xiawu Zheng ⋅ Rongrong Ji ⋅ Jiebo Luo
Video Understanding, Generation and Multimodal Learning ExHall # 49
Human-Level Accuracy, Non-Human Strategies: Revealing Model-Human Divergence in Video Physical Reasoning Poster Session 2
Fanhong Li ⋅ Shurui Zheng ⋅ Yinzi Yinzi ⋅ Junbo Cui ⋅ Lei Ji ⋅ Jia Liu
Video Understanding, Generation and Multimodal Learning ExHall # 48
Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models Poster Session 2
Lu Wang ⋅ Zhuoran Jin ⋅ Yupu Hao ⋅ Yubo Chen ⋅ Kang Liu ⋅ Yulong Ao ⋅ Jun Zhao
Video Understanding, Generation and Multimodal Learning ExHall # 47
MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learning Poster Session 2
Wenhao Wang ⋅ Franziska Boenisch ⋅ Michael Backes ⋅ Adam Dziedzic
Video Understanding, Generation and Multimodal Learning ExHall # 46
ECoSim: Data Efficient Fine-Tuning for Controllable Traffic Simulation Poster Session 2
Yu-Hsiang Chen ⋅ WEI-JER Chang ⋅ Yi-Ting Chen ⋅ Masayoshi TOMIZUKA
Video Understanding, Generation and Multimodal Learning ExHall # 45
X-Stream: Benchmarking MLLMs as Multiplexers for Multi-Stream Understanding Poster Session 2
Peiwen Sun ⋅ Xudong LU ⋅ Huadai Liu ⋅ Yang Bo ⋅ Dongming Wu ⋅ Huankang Guan ⋅ Minghong Cai ⋅ Jinpeng Chen ⋅ Xintong Guo ⋅ Shuhan LI ⋅ FANG LIU ⋅ Rui Liu ⋅ Xiangyu Yue
Video Understanding, Generation and Multimodal Learning ExHall # 43
PhysDrape: Learning Explicit Forces and Collision Constraints for Physically Realistic Garment Draping Poster Session 2
Minghai Chen ⋅ Mingyuan Liu ⋅ Ning Ma ⋅ Jianqing LI ⋅ Yuxiang Huan
Video Understanding, Generation and Multimodal Learning ExHall # 42
Better Call CineCrew: Consistent Ultra-Long Narrative-to-Film Generation Poster Session 2
Jiaben Chen ⋅ Sixun Dong ⋅ Qinhong Zhou ⋅ Raine Ma ⋅ Zhiyang Dou ⋅ Wojciech Matusik ⋅ Chuang Gan
Video Understanding, Generation and Multimodal Learning ExHall # 41
Multi-modal Knowledge Preserving Adapter for Embedding Backward Compatibility Poster Session 2
Jaeseok Byun ⋅ Gukyeong Kwon ⋅ Han-Kai Hsu ⋅ MEHER GITIKA KARUMURI ⋅ Zhikang Zhang ⋅ Hao Yang ⋅ Davide Modolo
Video Understanding, Generation and Multimodal Learning ExHall # 40
SV-TAD: Native Sparse Convolutions for Efficient Temporal Action Detection Poster Session 2
Ricardo Ignacio Pizarro Carreño ⋅ Roberto Valle ⋅ José Buenaposada ⋅ Luis M. Bergasa ⋅ Luis Baumela
Video Understanding, Generation and Multimodal Learning ExHall # 39
InterEdit: Navigating Text-Guided Multi-Human 3D Motion Editing Poster Session 2
Yebin Yang ⋅ Di Wen ⋅ Lei Qi ⋅ Weitong Kong ⋅ Junwei Zheng ⋅ Ruiping Liu ⋅ Yufan Chen ⋅ Chengzhi Wu ⋅ Kailun Yang ⋅ Yuqian Fu ⋅ Danda Paudel ⋅ Luc Van Gool ⋅ Kunyu Peng
Video Understanding, Generation and Multimodal Learning ExHall # 37
Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding Poster Session 2
Lin Chen ⋅ Bolin Ni ⋅ Qi Yang ⋅ Zili Wang ⋅ Kun Ding ⋅ Ying Wang ⋅ Houwen Peng ⋅ SHIMING XIANG
Video Understanding, Generation and Multimodal Learning ExHall # 34
Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models Poster Session 2
Mariam Hassan ⋅ Bastien van Delft ⋅ Wuyang Li ⋅ Alexandre ALahi
Video Understanding, Generation and Multimodal Learning ExHall # 127
Plug-and-Play Attention Linearization for Pretrained Transformers Poster Session 3
Kenan Kassab ⋅ Alexey Kashevnik ⋅ Ammar Ali ⋅ Stamatios Lefkimmiatis
Vision Foundation Models: Interpretability and Reasoning ExHall # 48
Moving Beyond More Views: Redundancy-Aware Ego–Exo Fusion for Proficiency Estimation Poster Session 3
Xu Dong ⋅ Wanqing Li ⋅ Anthony Adeyemi-Ejeye ⋅ Andrew Gilbert
Vision Foundation Models: Interpretability and Reasoning ExHall # 47
MuSViT: A Foundation Vision Model for Sheet Music Representation Poster Session 3
Carlos Penarrubia ⋅ Antonio Rios-Vila ⋅ Eliseo Fuentes-Martinez ⋅ Juan Martinez-Sevilla ⋅ Francisco Castellanos ⋅ María Alfaro-Contreras ⋅ Jorge Calvo-Zaragoza
Vision Foundation Models: Interpretability and Reasoning ExHall # 46
VIVAS: Vitalizing Visual Perception in VLM Pre-training via Vision-language Unified Autoregressive Supervision Poster Session 3
Zhehan Kan ⋅ Yubo Zhu ⋅ Xinghua Jiang ⋅ Zhixiang Wei ⋅ Shifeng Liu ⋅ Wei Tong ⋅ Sheng Zhong ⋅ Qingmin Liao ⋅ Wenming Yang ⋅ Xin Li ⋅ Yinsong Liu ⋅ Deqiang Jiang ⋅ Xing Sun
Vision Foundation Models: Interpretability and Reasoning ExHall # 45
MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein Poster Session 3
Hong-Han Wang ⋅ Yuntao Wang ⋅ Hu Ding
Vision Foundation Models: Interpretability and Reasoning ExHall # 43
Why Can Accurate Models Be Learned from Inaccurate Annotations? Poster Session 3
Chongjie Si ⋅ Yidan Cui ⋅ Fuchao Yang ⋅ Wei Shen
Vision Foundation Models: Interpretability and Reasoning ExHall # 42
Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning Poster Session 3
Yinan ZHOU ⋅ Haokun Lin ⋅ Yichen Wu ⋅ Yuxin Chen ⋅ Teng Wang ⋅ Caifeng Shan ⋅ Zhenan Sun ⋅ Chen Ma ⋅ Li Zhu ⋅ Ying Shan
Vision Foundation Models: Interpretability and Reasoning ExHall # 41
From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs Poster Session 3
Boyong Wu ⋅ Sanghwan Kim ⋅ Zeynep Akata
Vision Foundation Models: Interpretability and Reasoning ExHall # 40
Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective Poster Session 3
Qiyao Xue ⋅ Haoming Wang ⋅ Weichen Liu ⋅ Shiqi Wang ⋅ Yuyang Wu ⋅ Wei Gao
Vision Foundation Models: Interpretability and Reasoning ExHall # 39
CL4D: Contrastive Language–4D Pretraining for Vision-Language Reasoning in Dynamic Scenes Poster Session 3
Kumal Hewagamage ⋅ Isuranga Senavirathne ⋅ Yattowita Withanage Sasika Pamith Amarasinghe ⋅ Hasitha Gallella ⋅ Dulanga Weerakoon ⋅ Vigneshwaran Subbaraju ⋅ Ranga Rodrigo
Vision Foundation Models: Interpretability and Reasoning ExHall # 38
SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning Poster Session 3
Byungwoo Jeon ⋅ Dongyoung Kim ⋅ Huiwon Jang ⋅ Insoo Kim ⋅ Jinwoo Shin
Vision Foundation Models: Interpretability and Reasoning ExHall # 37
World Knowledge in the Weights: Reading Concept Circuits of Vision Transformers Poster Session 3
Yanlin Chen ⋅ Tang Li ⋅ Xi Peng
Vision Foundation Models: Interpretability and Reasoning ExHall # 36
Circuit-MLLM: Topological Logic-Guided Latent-Space Visual Reasoning for Circuit Schematic Understanding Poster Session 3
Jinyuan Deng ⋅ Yuqi Jiang ⋅ Wenjing Huang ⋅ Xin Li ⋅ Qi Sun ⋅ Cheng Zhuo
Vision Foundation Models: Interpretability and Reasoning ExHall # 35
Invisible Shortcuts: Why Vision Encoders Know Your Camera Poster Session 3
Vladan Stojnic ⋅ Ryan Ramos ⋅ Giorgos Kordopatis-Zilos ⋅ Noa Garcia ⋅ Giorgos Tolias
Vision Foundation Models: Interpretability and Reasoning ExHall # 34
Dynamic Image Prompt Adapter for Scalable Zero-shot Personalized Text-to-Image Generation Poster Session 3
Zhizhong Wang ⋅ Tianyi Chu ⋅ Richard Wang ⋅ Nanyang Wang ⋅ Kehan Li
Vision Foundation Models: Interpretability and Reasoning ExHall # 33
Rethinking Attention Reallocation for Multimodal Emotion Recognition Poster Session 3
Yazhe Lyu ⋅ Yixiong Zou ⋅ Jinghan Hu ⋅ Yuhua Li ⋅ Ruixuan Li
Vision Foundation Models: Interpretability and Reasoning ExHall # 32
Metric-Bench: Exploring In-context Spatial Metric Reasoning in VLMs for Indoor Scenes Poster Session 3
Yuling Xi ⋅ Haokai Zhang ⋅ Muzhi Zhu ⋅ Hao Zhong ⋅ Zongze Du ⋅ Hengyu Zhao ⋅ Chenchen Jing ⋅ Yufei Yin ⋅ Bin Qin ⋅ Yongjie Yang ⋅ Zhenbo Luo ⋅ Hao Chen ⋅ Chunhua Shen
Vision Foundation Models: Interpretability and Reasoning ExHall # 31
UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment Poster Session 3
Yecheng Zhang ⋅ RONG ZHAO ⋅ Zhizhou Sha ⋅ Yong Li ⋅ Lei Wang ⋅ Ce Hou ⋅ Wen Ji ⋅ HUANG HAO ⋅ yunshan wan ⋅ Jian Yu ⋅ Junhao Xia ⋅ Yuru Zhang ⋅ Chunlei Shi
Vision Foundation Models: Interpretability and Reasoning ExHall # 30
Multi-Head Normalization for Wide Vision Transformers Poster Session 3
Guoyizhe Wei ⋅ Feng Wang ⋅ Alan Yuille ⋅ Rama Chellappa
Vision Foundation Models: Interpretability and Reasoning ExHall # 29
Spanning the Visual Analogy Space with a Weight Basis of LoRAs Poster Session 3
Hila Manor ⋅ Rinon Gal ⋅ Haggai Maron ⋅ Tomer Michaeli ⋅ Gal Chechik
Vision Foundation Models: Interpretability and Reasoning ExHall # 28
DeCoPatch: Revealing Causal Latent Subspaces in Vision-Language Models for GUI Grounding Poster Session 3
Yongkang Zhang ⋅ Linjia Kang ⋅ Zhimin Wang ⋅ Duo Wu ⋅ Zhi Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 27
Auto-Prompting: Layer-Specific Prompt Fusion Discovery via Differentiable Search Poster Session 3
Xi Xiao ⋅ Xingjian Li ⋅ Yunbei Zhang ⋅ Cheng Han ⋅ Tianming Liu ⋅ Tianyang Wang ⋅ Runmin Jiang ⋅ Jihun Hamm ⋅ Xiao Wang ⋅ Min Xu
Vision Foundation Models: Interpretability and Reasoning ExHall # 26
Quick ViTs: Speeding up Vision Transformers through Equivariance Poster Session 3
David Nordström ⋅ Johan Edstedt ⋅ Fredrik Kahl ⋅ Georg Bökman
Vision Foundation Models: Interpretability and Reasoning ExHall # 25
Let ViT Speak: Generative Language-Image Pre-training Poster Session 3
Yan Fang ⋅ Mengcheng Lan ⋅ Zilong Huang ⋅ Weixian Lei ⋅ Yunqing Zhao ⋅ Yujie Zhong ⋅ Yingchen Yu ⋅ Qi She ⋅ Yao Zhao ⋅ Yunchao Wei
Vision Foundation Models: Interpretability and Reasoning ExHall # 24
Verifying Cancer Segmentation in Vision Transformers via Internal Concepts Poster Session 3
Mengmeng Ma ⋅ Yunxiang Peng ⋅ Tang Li ⋅ Lu Lin ⋅ Binsheng Zhao ⋅ Oguz Akin ⋅ Xi Peng
Vision Foundation Models: Interpretability and Reasoning ExHall # 23
Understanding Geometric Representations in Self-Supervised Vision Transformers via Subspace Intervention Poster Session 3
Weichen Zhou ⋅ Yawen Zou ⋅ Chunzhi Gu ⋅ Ran Dong ⋅ Haoran Xie ⋅ Chao Zhang
Vision Foundation Models: Interpretability and Reasoning ExHall # 22
Enlightening Photographic Style Transfer with a Self-Supervised Photographic Embedding Poster Session 3
Chengxuan Zhu ⋅ Jiacong Fang ⋅ Shuchen Weng ⋅ Youwei Lyu ⋅ Jiajun Tang ⋅ Qingnan Fan ⋅ Chao Xu ⋅ Boxin Shi
Vision Foundation Models: Interpretability and Reasoning ExHall # 21
Inductive Visual Logic for Few-Shot Out-Of-Distribution Adaptation in VLMs Poster Session 3
Hung-Jen Chen ⋅ Yu-Heng Ho ⋅ Ting-Yao Huang ⋅ Po-Hsiang Hsu ⋅ LIYU CHEN ⋅ Chun-Yi Lee ⋅ Min Sun
Vision Foundation Models: Interpretability and Reasoning ExHall # 20
DnA: Denoising Attention for Visual Tasks Poster Session 3
Ron Campos ⋅ Subhajit Maity ⋅ Xin Li ⋅ Srijan Das ⋅ Aritra Dutta
Vision Foundation Models: Interpretability and Reasoning ExHall # 19
Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs Poster Session 3
Pengcheng Wang ⋅ Zhiquan Wang ⋅ Jayoung Lee ⋅ Zhuoyan Xu ⋅ Ran Xu ⋅ Saurabh Bagchi ⋅ Yin Li ⋅ Somali Chaterji
Vision Foundation Models: Interpretability and Reasoning ExHall # 18
Efficient Quantization-Aware Adaptation for Visual Foundation Models Poster Session 3
Yinglong Li ⋅ Xiaoyu Liu ⋅ Yutong Liu ⋅ Yueyi Zhang ⋅ Zhiwei Xiong
Vision Foundation Models: Interpretability and Reasoning ExHall # 17
Rethink Backdoor Robustness in Vision Transformers Poster Session 3
Yichuan Mo ⋅ Dongxian Wu ⋅ Yifei Wang ⋅ Yisen Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 15
Diffusion-Based Immersive Visual Reasoning Poster Session 3
Yifeng Zhang ⋅ Ming Jiang ⋅ Qi Zhao
Vision Foundation Models: Interpretability and Reasoning ExHall # 14
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models Poster Session 3
Mahtab Bigverdi ⋅ Linjie Li ⋅ Weikai Huang ⋅ Jieyu Zhang ⋅ Tuhin Kundu ⋅ Zelun Luo ⋅ Chris Kim ⋅ Jaemin Cho ⋅ Ranjay Krishna ⋅ Linda Shapiro ⋅ Liu Yiming
Vision Foundation Models: Interpretability and Reasoning ExHall # 13
DriftScope: Measuring The Hidden Effects of Diffusion Model Fine-Tuning Poster Session 3
Héctor Laria ⋅ Yiping Han ⋅ Julian Santamaria ⋅ Kai WANG ⋅ Bogdan Raducanu ⋅ Joost Van de Weijer ⋅ Alex Gomez-Villa
Vision Foundation Models: Interpretability and Reasoning ExHall # 12
Task Alignment: A simple and effective proxy for model merging in computer vision Poster Session 3
Pau de Jorge Aranda ⋅ César DE SOUZA ⋅ Björn Michele ⋅ Mert Bulent SARIYILDIZ ⋅ Philippe Weinzaepfel ⋅ Florent Perronnin ⋅ Larlus Diane ⋅ Yannis Kalantidis
Vision Foundation Models: Interpretability and Reasoning ExHall # 11
Attention is Case-Sensitive Poster Session 3
Maximilian Dillitzer ⋅ Tin Stribor Sohn ⋅ Jason Corso ⋅ Michael Auerbach
Vision Foundation Models: Interpretability and Reasoning ExHall # 10
Unsupervised Semantic Segmentation Facilitates Model Understanding Poster Session 3
Xiaoyan Yu ⋅ Lisa Mais ⋅ Peter Hirsch ⋅ Nick Lechtenbörger ⋅ Jannik Franzen ⋅ Andreas Mardt ⋅ Dagmar Kainmueller
Vision Foundation Models: Interpretability and Reasoning ExHall # 9
Steerable Vision Transformers Poster Session 3
Jona Ruthardt ⋅ Manu Gaur ⋅ Deva Ramanan ⋅ Makarand Tapaswi ⋅ Yuki Asano
Vision Foundation Models: Interpretability and Reasoning ExHall # 8
Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization Poster Session 3
chenyang zhu ⋅ Hongxiang Li ⋅ Xiu Li ⋅ Long Chen
Vision Foundation Models: Interpretability and Reasoning ExHall # 7
VQT: Vector Quantization Tuning for Efficient Fine-tuning and Compression of Pre-trained Vision Transformers Poster Session 3
Yinglong Li ⋅ jiyuan Xia ⋅ Jingcheng Xie ⋅ Zhiwei Xiong
Vision Foundation Models: Interpretability and Reasoning ExHall # 6
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP Poster Session 3
Sicheng Zhang ⋅ Muhammad Muzammal Naseer ⋅ Binzhu Xie ⋅ Naufal Suryanto ⋅ Shi Qiu ⋅ Jamal Bentahar ⋅ NAVEED AKHTAR ⋅ Shah Mubarak
Vision Foundation Models: Interpretability and Reasoning ExHall # 5
3D-Aware VLMs with Implicit and Explicit Geometries Poster Session 3
Wenhao Li ⋅ Xueying Jiang ⋅ Quanhao Qian ⋅ Deli Zhao ⋅ Ran Xu ⋅ Shijian Lu ⋅ Gongjie Zhang
Vision Foundation Models: Interpretability and Reasoning ExHall # 4
Hyperbolic Hierarchical Clustering for Visual Representation Learning Poster Session 3
Jianan Wei ⋅ Guikun Chen ⋅ Zhiyuan Weng ⋅ Chunchao Guo ⋅ Yujia Wang ⋅ Wenguan Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 3
Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding Poster Session 3
Na Min An ⋅ Inha Kang ⋅ Minhyun Lee ⋅ Hyunjung Shim
Vision Foundation Models: Interpretability and Reasoning ExHall # 1
HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding Poster Session 3
jiha jang ⋅ Hayeon Kim ⋅ Junghun James Kim ⋅ Chulwon Lee ⋅ Se Young Chun
Vision Foundation Models: Interpretability and Reasoning ExHall # 70
ARGENT: Adaptive Hierarchical Image-Text Representations Poster Session 3
Chuong Huynh ⋅ Hossein Souri ⋅ Abhinav Kumar ⋅ Vitali Petsiuk ⋅ Deen Dayal Mohan ⋅ Suren Kumar
Vision Foundation Models: Interpretability and Reasoning ExHall # 69
BLOB-Q: Boosting Low Bit ViT Quantization via Global Optimization on Model Distortion Poster Session 3
Wang Mark ⋅ Kaixin Xu ⋅ Xue Geng ⋅ Fen Fang ⋅ Mohamed Aly ⋅ Xulei Yang ⋅ Min Wu ⋅ Weisi Lin
Vision Foundation Models: Interpretability and Reasoning ExHall # 68
TaskTok: Delving into Task Tokens for Task-driven Image Restoration Poster Session 3
Hongjae Lee ⋅ Sojung Kang ⋅ Jaeseong Yu ⋅ Seung-Won Jung
Vision Foundation Models: Interpretability and Reasoning ExHall # 2
Seeing Through Circuits: Faithful Mechanistic Interpretability for Vision Transformers Poster Session 3
Nina Żukowska ⋅ Wolfgang Stammer ⋅ Bernt Schiele ⋅ Jonas Fischer
Vision Foundation Models: Interpretability and Reasoning ExHall # 67
CS-TTA: Preserving Concept Sensitivity in Test-Time Adaptation Poster Session 3
Junah Jung ⋅ YeonGyu Han ⋅ Chang Min Park ⋅ Dongheon Lee
Vision Foundation Models: Interpretability and Reasoning ExHall # 16
Human-like Object Grouping in Self-supervised Vision Transformers Poster Session 3
Hossein Adeli ⋅ Seoyoung Ahn ⋅ Andrew Luo ⋅ Mengmi Zhang ⋅ Nikolaus Kriegeskorte ⋅ Gregory Zelinsky
Vision Foundation Models: Interpretability and Reasoning ExHall # 66
CLIMP: Contrastive Language-Image Mamba Pretraining Poster Session 3
Nimrod Shabtay ⋅ Itamar Zimerman ⋅ Eli Schwartz ⋅ RAJA GIRYES
Vision Foundation Models: Interpretability and Reasoning ExHall # 65
Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability Poster Session 3
Emirhan Bilgiç ⋅ Baptiste Caramiaux ⋅ Zhi Yan ⋅ Gianni Franchi
Vision Foundation Models: Interpretability and Reasoning ExHall # 64
Tesselating The Earth Poster Session 3
Daniel Cher ⋅ Hamza Iqbal ⋅ Eric Xing ⋅ Brian Wei ⋅ Nathan Jacobs
Vision Foundation Models: Interpretability and Reasoning ExHall # 63
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens Poster Session 3
Yiming Qin ⋅ Bomin Wei ⋅ Jiaxin Ge ⋅ Konstantinos Kallidromitis ⋅ Stephanie Fu ⋅ Trevor Darrell ⋅ XuDong Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 71
Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning Poster Session 3
Yuyao Ge ⋅ Shenghua Liu ⋅ Yiwei Wang ⋅ Lingrui Mei ⋅ Baolong Bi ⋅ Xuanshan Zhou ⋅ Jiayu Yao ⋅ Jiafeng Guo ⋅ Xueqi Cheng
Vision Foundation Models: Interpretability and Reasoning ExHall # 62
MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model Poster Session 3
Youngwan Lee ⋅ Soojin Jang ⋅ Yoorhim Cho ⋅ Seunghwan Lee ⋅ Yong-Ju Lee ⋅ Sung Hwang
Vision Foundation Models: Interpretability and Reasoning ExHall # 72
Last-Layer-Centric Feature Recombination: Unleashing 3D Geometric Knowledge in DINOv3 for Monocular Depth Estimation Poster Session 3
Gongshu Wang ⋅ Zhirui Wang ⋅ Kan Yang
Vision Foundation Models: Interpretability and Reasoning ExHall # 44
Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers Poster Session 3
Edwin Kwadwo Tenagyei ⋅ Lei Wang ⋅ Ugochukwu Akpudo ⋅ Jun Zhou ⋅ Yongsheng Gao
Vision Foundation Models: Interpretability and Reasoning ExHall # 73
Activation Quantization of Vision Encoders Needs Prefixing Registers Poster Session 3
Seunghyeon Kim ⋅ Taesun Yeom ⋅ Jinho Kim ⋅ Wonpyo Park ⋅ Kyuyeun Kim ⋅ Jaeho Lee
Vision Foundation Models: Interpretability and Reasoning ExHall # 54
Mechanistic interventions for explainable digital pathology uncovers adversarial vulnerabilities Poster Session 3
Arijit Patra ⋅ Samiran Dey ⋅ Ajitha Rajan ⋅ Greg Slabaugh ⋅ Tapabrata Chakraborti
Vision Foundation Models: Interpretability and Reasoning ExHall # 61
ICLAgent: Integrated Circuit Footprint Geometry Labeling via LMM-empowered Multi-Agent Framework Poster Session 3
Yida Wang ⋅ Yixin Liu ⋅ Taiting Lu ⋅ Lanqing Yang ⋅ Dian Ding ⋅ Juntao Zhou ⋅ Yifan Yang ⋅ Yi-Chao Chen ⋅ Mahanth Gowda
Vision Foundation Models: Interpretability and Reasoning ExHall # 60
From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion Poster Session 3
pengpeng Zeng ⋅ Yuyu Guo ⋅ Pengpeng Zeng ⋅ Jingkuan Song ⋅ Peng Di ⋅ Hang Yu ⋅ Lianli Gao
Vision Foundation Models: Interpretability and Reasoning ExHall # 59
SRRA: Stable-Rank-Based Residual Adaptation for Generalizable Deepfake Detection Poster Session 3
Huakun Liu ⋅ Wenjie Li ⋅ Changsheng Xu
Vision Foundation Models: Interpretability and Reasoning ExHall # 58
What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features Poster Session 3
Chen-yi Lu ⋅ Yueh-Shao Chen ⋅ Somali Chaterji
Vision Foundation Models: Interpretability and Reasoning ExHall # 57
Vision-TTT: Efficient and Expressive Visual Representation Learning with Test-Time Training Poster Session 3
Quan Kong ⋅ Yanru Xiao ⋅ Yuhao Shen ⋅ Cong Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 56
Test-Time Registers as Global Priors for Tokenized Image Generation Poster Session 3
Cheng-Yao Hong ⋅ Yifan Wang ⋅ Yuewei Lin ⋅ Chenyu You
Vision Foundation Models: Interpretability and Reasoning ExHall # 55
SyncVL: Synchronizing Vision ⟷ Language Using Unsupervised Adaptation Poster Session 3
Maria Marrium ⋅ Muhammad Haris Khan ⋅ Sajid Javed ⋅ Arif Mahmood
Vision Foundation Models: Interpretability and Reasoning ExHall # 53
Contrastive-Guided Self-Supervised Latent Visual Reasoning for Hallucination Mitigation Poster Session 3
Aoxue Dai ⋅ Ningning Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 52
Background Blurring Matters: Improving Visual Grounding by Merging Text-Irrelevant Tokens Poster Session 3
Ruilin Yao ⋅ Shengwu Xiong ⋅ Shanshan Yang ⋅ Tianyu Zou ⋅ Shili Xiong ⋅ Yi Rong
Vision Foundation Models: Interpretability and Reasoning ExHall # 51
Frozen CLIP Priors for Robust Self-Supervised Poisson Inverse Problems Poster Session 3
Laura C. Diaz-Delgado ⋅ Emmanuel Martinez ⋅ Henry Arguello
Vision Foundation Models: Interpretability and Reasoning ExHall # 50
MMDiff: Extending Diffusion Transformers for Multi-Modal Generation Poster Session 3
Yagmur Akarken ⋅ Orest Kupyn ⋅ Christian Rupprecht
Vision Foundation Models: Interpretability and Reasoning ExHall # 49
Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers Poster Session 3
Robin Kim ⋅ Colin Samplawski ⋅ Benjamin Marlin
Vision Foundation Models: Interpretability and Reasoning ExHall # 86
Make Geometry Matter for Spatial Reasoning Poster Session 3
Shihua Zhang ⋅ Qiuhong Shen ⋅ Shizun Wang ⋅ Tianbo Pan ⋅ Xinchao Wang
Vision Foundation Models: Interpretability and Reasoning ExHall # 85
Kilometer-Vision: A New Frontier for Large-Scale Spatial Awareness in VLMs Poster Session 3
Aravindh Mahendran ⋅ Michael King ⋅ Matthew Grimes ⋅ Antoine Yang ⋅ Tyler Zhu ⋅ Joseph Heyward ⋅ Tengda Han ⋅ Shiry Ginosar ⋅ Chen Sun ⋅ Dima Damen ⋅ Simon Osindero ⋅ Noah Snavely ⋅ Simon Lynen ⋅ Joao Carreira ⋅ Viorica Patraucean
Vision Foundation Models: Interpretability and Reasoning ExHall # 84
On Locality and Length-Generalization in Visual Reasoning Poster Session 3
Pulkit Madan ⋅ Sanjay Haresh ⋅ Reza Ebrahimi ⋅ Apratim Bhattacharyya ⋅ Sunny Panchal ⋅ Roland Memisevic
Vision Foundation Models: Interpretability and Reasoning ExHall # 83
What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility Poster Session 3
Filippo Ziliotto ⋅ Luciano Serafini ⋅ Lamberto Ballan ⋅ Tommaso Campari
Vision Foundation Models: Interpretability and Reasoning ExHall # 82
ORFC: Orthogonal Reparameterization for Low-Bitrate ViT Feature Coding Poster Session 3
Letian Zhang ⋅ Wenhan Yang ⋅ Lingyu Duan
Vision Foundation Models: Interpretability and Reasoning ExHall # 81
LoCA: Spatially-Aware Low-Rank Convolutional Adaptation of Vision Foundation Models Poster Session 3
Sojung An ⋅ Junha Lee ⋅ Sujeong You ⋅ Nam Ik Cho ⋅ Donghyun Kim
Vision Foundation Models: Interpretability and Reasoning ExHall # 80
Practice Makes Perfect: From Explicit Decomposition to Reinforced Latent Planning in Text-to-Human Motion Poster Session 3
Ronghao Yu ⋅ Yang Liu ⋅ Juncheng Wang ⋅ Chao Xu ⋅ Yimo Shao ⋅ Baigui Sun ⋅ Yong Liu ⋅ Shan Luo
Vision Foundation Models: Interpretability and Reasoning ExHall # 79
BrepLLM: Enabling Large Language Models to Understand Boundary Representations Poster Session 3
Liyuan Deng ⋅ Hao Guo ⋅ Yongkang Dai ⋅ Yunpeng Bai ⋅ Yifan Zhu ⋅ Yuanyuan Gao ⋅ Huaxi Huang ⋅ Yilei Shi
Vision Foundation Models: Interpretability and Reasoning ExHall # 78
ECC: Encoder-Centric Corruption for Fine-Grained Vision in VLMs Poster Session 3
Hyesong Choi ⋅ Daeun Kim ⋅ Sungmin Cha ⋅ Kwang Moo Yi ⋅ Dongbo Min
Vision Foundation Models: Interpretability and Reasoning ExHall # 77
When Token Compression Breaks: Structural Pruning vs. Token Reduction for Robust ViT Segmentation under High Compression Poster Session 3
Tien-Phat Nguyen ⋅ Ngai-Man Cheung
Vision Foundation Models: Interpretability and Reasoning ExHall # 76
SafeSAE-VLA: Interpreting OpenVLA Progress Dynamics with Sparse Feature Analysis Poster Session 3
Socrates Osorio ⋅ Joy Yang
Vision Foundation Models: Interpretability and Reasoning ExHall # 75
AFFMAE: Scalable Vision Pre-Training for High-Resolution Microscopy Segmentation on Desktop Hardware Poster Session 3
David Smerkous ⋅ Zian Wang ⋅ Behzad Najafian
Vision Foundation Models: Interpretability and Reasoning ExHall # 74
From Masks to Pixels and Meaning: A New Taxonomy, Benchmark and Metrics for VLM Image Tampering Poster Session 1
Xinyi Shang ⋅ Yi Tang ⋅ Jiacheng Cui ⋅ Ahmed Elhagry ⋅ Salwa Al Khatib ⋅ Sondos Bsharat ⋅ Jiacheng Liu ⋅ Xiaohan Zhao ⋅ Jing-Hao Xue ⋅ Hao Li ⋅ Salman Khan ⋅ Zhiqiang Shen
Vision-Language Models & Foundation Models ExHall # 392
Learning to Deny: Action Denial in Multimodal Large Language Models Poster Session 1
Raiyaan Abdullah ⋅ Shehreen Azad ⋅ Yogesh Rawat
Vision-Language Models & Foundation Models ExHall # 393
DIVA: Instruction-Aware Vision Token Pruning via Dual-Probe Attention Discrepancy Poster Session 1
Hyunwoo Kim ⋅ Kisu Lee ⋅ Yuna Shin ⋅ Ha Young Kim
Vision-Language Models & Foundation Models ExHall # 394
Direct Preference Optimization for Perceptual Alignment via Vision-Language Consistency Poster Session 1
Seungyeon Lee ⋅ Donggyu Lee
Vision-Language Models & Foundation Models ExHall # 395
ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking Poster Session 1
Kanglong Fan ⋅ Tianhe Wu ⋅ Wen Wen ⋅ Jianzhao Liu ⋅ le yang ⋅ Yabin ZHANG ⋅ Yiting Liao ⋅ Junlin Li ⋅ Li Zhang
Vision-Language Models & Foundation Models ExHall # 396
CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models Poster Session 1
Yucheng Zhou ⋅ Peng Luo ⋅ Qianning Wang ⋅ Cheng-zhong Xu ⋅ Shen Jianbing
Vision-Language Models & Foundation Models ExHall # 397
Learning from Primitive: Probing Visual Reasoning of LVLMs via Counting Poster Session 1
Liwei Che ⋅ Zhiyu Xue ⋅ Yihao Quan ⋅ Benlin Liu ⋅ Zeru Shi ⋅ Ruixiang Tang ⋅ Ranjay Krishna ⋅ Vladimir Pavlovic
Vision-Language Models & Foundation Models ExHall # 398
Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection Poster Session 1
Yewon Han ⋅ Yumin Seol ⋅ Minsoo Jo ⋅ EunGyung Kong ⋅ Taesup Kim
Vision-Language Models & Foundation Models ExHall # 399
Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models Poster Session 1
Lexiang Xiong ⋅ QI LI ⋅ Jingwen Ye ⋅ Xinchao Wang
Vision-Language Models & Foundation Models ExHall # 400
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models Poster Session 1
Ioannis Maniadis Metaxas ⋅ Adrian Bulat ⋅ Alberto Baldrati ⋅ Anestis Zaganidis ⋅ Yassine Ouali ⋅ Hyeonuk Kim ⋅ Georgios Tzimiropoulos
Vision-Language Models & Foundation Models ExHall # 401
VoxAnchor: Explicit Voxel-Semantic Grounding for Spatial Understanding in Videos Poster Session 1
Xinglin Li ⋅ TingTing Long ⋅ Jingzhi Zhou ⋅ Chuxuan Zeng ⋅ Jiajing Chen ⋅ Jian Yang ⋅ Jin Xie
Vision-Language Models & Foundation Models ExHall # 402
VLA-R1: Enhancing Reasoning in Vision-Language-Action Models Poster Session 1
Angen Ye ⋅ Zeyu Zhang ⋅ Boyuan Wang ⋅ Xiaofeng Wang ⋅ Dapeng Zhang ⋅ Zheng Zhu
Vision-Language Models & Foundation Models ExHall # 403
E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation Poster Session 1
Wen Ye ⋅ Peiyan Li ⋅ Tingyu Yuan ⋅ Yuan Xu ⋅ Xiangnan Wu ⋅ Chaoyang Zhao ⋅ Jing Liu ⋅ Nianfeng Liu ⋅ Yan Huang ⋅ Liang Wang
Vision-Language Models & Foundation Models ExHall # 404
M2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models Poster Session 1
Chunpu Xu ⋅ Zhixuan Liang ⋅ Yuhao Zhang ⋅ Chi-Min Chan ⋅ Jiashuo Wang ⋅ Yang Xiao ⋅ Mengkang Hu ⋅ Xiaokang Yang ⋅ Yao Mu
Vision-Language Models & Foundation Models ExHall # 405
LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models Poster Session 1
Rongxu Cui ⋅ Zongzheng Zhang ⋅ Jingrui Pang ⋅ Haohan Chi ⋅ Jinbang Guo ⋅ Saining Zhang ⋅ shaoxuan Xie ⋅ Xin Jin ⋅ Yao Mu ⋅ Jiaolong Yang ⋅ Guocai Yao ⋅ Xianyuan Zhan ⋅ Ya-Qin Zhang ⋅ HAO ZHAO
Vision-Language Models & Foundation Models ExHall # 406
PuzLM: Solving Jigsaw Puzzles with Sequence-to-Sequence Language Models Poster Session 1
Gur Elkin ⋅ Ofir I Shahar ⋅ Ohad Ben-Shahar
Vision-Language Models & Foundation Models ExHall # 407
ScenarioControl: Vision-language Controllable Vectorized Latent Scenario Generation Poster Session 1
Lili Gao ⋅ Yanbo Xu ⋅ William Koch ⋅ Samuele Ruffino ⋅ Luke Rowe ⋅ Behdad Chalaki ⋅ Dmitriy Rivkin ⋅ Julian Ost ⋅ Roger Girgis ⋅ Mario Bijelic ⋅ Felix Heide
Vision-Language Models & Foundation Models ExHall # 408
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models Poster Session 1
Wanjun Du ⋅ Zifeng Yuan ⋅ Tingting Chen ⋅ Fucai Ke ⋅ Beibei Lin ⋅ Shunli Zhang
Vision-Language Models & Foundation Models ExHall # 409
ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision–Language Models Poster Session 1
Rahul Chowdhury ⋅ Timothy Rupprecht ⋅ Xuan Shen ⋅ Pu Zhao ⋅ Yanzhi Wang
Vision-Language Models & Foundation Models ExHall # 410
GenRecal: Generation after Recalibration from Large to Small Vision-Language Models Poster Session 1
Byung-Kwan Lee ⋅ Ryo Hachiuma ⋅ Yong Man Ro ⋅ Yu-Chiang Frank Wang ⋅ Yueh-Hua Wu
Vision-Language Models & Foundation Models ExHall # 411
CURE: Cumulative Knowledge Reuse for Efficient Device-Server Hybrid Inference in Vision-Language Models Poster Session 1
Youngjun Lee ⋅ Doyoung Kim ⋅ Junhyeok Kang ⋅ Hwanjun Song ⋅ Jae-Gil Lee
Vision-Language Models & Foundation Models ExHall # 412
GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models Poster Session 1
Shaokang Wang ⋅ Pei Fu ⋅ Ruoceng Zhang ⋅ Shaojie Zhang ⋅ Xiuwen Xi ⋅ Jiahui Yang ⋅ Bin Qin ⋅ Ying Huang ⋅ Zhenbo Luo ⋅ Jian Luan
Vision-Language Models & Foundation Models ExHall # 413
Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models Poster Session 1
Yurou Yang ⋅ Muyuan Lin ⋅ Roberto Martín-Martín ⋅ Labrie Martin ⋅ Shreekant Gayaka ⋅ Cheng-Hao Kuo ⋅ Luca Carlone
Vision-Language Models & Foundation Models ExHall # 414
Same Pool, Different Answer: Stable Best-of-N Selection for Vision-Language Models Poster Session 1
Pengfei Zheng
Vision-Language Models & Foundation Models ExHall # 416
SAFE-Pruner: Semantic Attention–Guided Future-Aware Token Pruning for Efficient Vision-Language-Action Manipulation Poster Session 1
Shilin Ma ⋅ Chubin Zhang ⋅ Changyuan Wang ⋅ Yuji Wang ⋅ Yue Wu ⋅ Zixuan Wang ⋅ Jingqi Tian ⋅ Zheng Zhu ⋅ Yansong Tang
Vision-Language Models & Foundation Models ExHall # 417
Do Vision Language Models Recognize Visual Ambiguity? Poster Session 1
Huy Ta ⋅ Trang Nguyen ⋅ Townim Chowdhury ⋅ ANKIT YADAV ⋅ Minh-Son To ⋅ Zhibin Liao ⋅ Johan Verjans ⋅ Vu Phan
Vision-Language Models & Foundation Models ExHall # 418
ATOMIC: A Domain-Specific Vision-Language Model for Transmission Electron Microscopy Poster Session 1
Chong-ren Tu ⋅ HUNG-WEI HSUEH ⋅ Shu-han Hsu
Vision-Language Models & Foundation Models ExHall # 419
Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints Poster Session 1
Yu Qi ⋅ Xinyi Xu ⋅ Ziyu Guo ⋅ Siyuan Ma ⋅ Renrui Zhang ⋅ Xinyan Chen ⋅ Ruichuan An ⋅ Ruofan Xing ⋅ Jiayi Zhang ⋅ Haojie Huang ⋅ Pheng-Ann Heng ⋅ Jonathan Tremblay ⋅ Lawson Wong
Vision-Language Models & Foundation Models ExHall # 420
GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents Poster Session 1
Xinyu Zhang ⋅ Yixin Wu ⋅ Boyang Zhang ⋅ Chenhao Lin ⋅ Chao Shen ⋅ Michael Backes ⋅ Yang Zhang
Vision-Language Models & Foundation Models ExHall # 422
From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models Poster Session 1
Zongzhao Li ⋅ Xiangzhe Kong ⋅ Jiahui Su ⋅ Zongyang Ma ⋅ Mingze Li ⋅ Songyou Li ⋅ Yuelin Zhang ⋅ Yu Rong ⋅ Tingyang Xu ⋅ Deli Zhao ⋅ Wenbing Huang
Vision-Language Models & Foundation Models ExHall # 423
Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration Poster Session 1
Ninghao Zhang ⋅ Bin Zhu ⋅ Shijie Zhou ⋅ Jingjing Chen
Vision-Language Models & Foundation Models ExHall # 424
Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding Poster Session 1
Tsung-Chih Chiang ⋅ Hsuan-Kung Yang ⋅ Jou-Min Liu ⋅ Ting-Ru Liu ⋅ Chun-Wei Huang ⋅ Quan Kong ⋅ Chun-Yi Lee
Vision-Language Models & Foundation Models ExHall # 425
CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion Poster Session 1
Moritz Böhle ⋅ Amelie Royer ⋅ Juliette Marrie ⋅ Edouard Grave ⋅ Patrick Perez
Vision-Language Models & Foundation Models ExHall # 426
Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training Poster Session 1
Mingliang Liang ⋅ Zhuoran Liu ⋅ Arjen P. de Vries ⋅ Martha Larson
Vision-Language Models & Foundation Models ExHall # 427
On Test-Time Scaling for Vision-Language Models Poster Session 1
Fawaz Sammani ⋅ Tzoulio Chamiti ⋅ Nikos Deligiannis
Vision-Language Models & Foundation Models ExHall # 428
Overlap-Consistent View Decomposition for Adapting Vision--Language Models to 360° Panoramas Poster Session 1
Seungwoo Woo ⋅ Daewon Jung ⋅ Sekyoung Youm
Vision-Language Models & Foundation Models ExHall # 429
SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning Poster Session 1
ChanYeong Hwang ⋅ Miso Choi ⋅ Sunghyun On ⋅ Jinkyu Kim ⋅ Jungbeom Lee
Vision-Language Models & Foundation Models ExHall # 430
Why Do Vision Language Models Struggle To Recognize Human Emotions? Poster Session 1
Madhav Agarwal ⋅ Sotirios Tsaftaris ⋅ Laura Sevilla ⋅ Steven McDonagh
Vision-Language Models & Foundation Models ExHall # 431
StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production–Living Simulations with Stardew Valley Poster Session 1
Weihao Tan ⋅ Changjiu Jiang ⋅ Yu Duan ⋅ Mingcong Lei ⋅ Li JiaGeng ⋅ Yitian Hong ⋅ Xinrun Wang ⋅ Bo An
Vision-Language Models & Foundation Models ExHall # 432
BeTTER: Diagnose the Illusion of Embodied Reasoning in Vision-Language-Action Models Poster Session 1
Haiweng Xu ⋅ Sipeng Zheng ⋅ Hao Luo ⋅ Wanpeng Zhang ⋅ Zongqing Lu
Vision-Language Models & Foundation Models ExHall # 434
3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering Poster Session 1
Changwoo Baek ⋅ Kyeongbo Kong
Vision-Language Models & Foundation Models ExHall # 435
HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding Poster Session 1
Yinsheng Yao ⋅ Yan Liu ⋅ Chen Ye
Vision-Language Models & Foundation Models ExHall # 436
Decompose, Compare, and Decide: Multimodal LLMs are Implicit Few-Shot Learners Poster Session 1
Yunhan Wang ⋅ Eshika Khandelwal ⋅ Edson Araujo ⋅ Walid Bousselham ⋅ Nina Shvetsova ⋅ Hilde Kuehne
Vision-Language Models & Foundation Models ExHall # 437
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models Poster Session 1
Walid Bousselham ⋅ Angie Boggust ⋅ Hendrik Strobelt ⋅ Hilde Kuehne
Vision-Language Models & Foundation Models ExHall # 439
PARL-VLA: Pruning-Aware On-Policy Reinforcement Learning for Vision-Language-Action Model Poster Session 1
ruiyan xu ⋅ Jiashu Lv ⋅ Sixu Lin ⋅ Ruixing Jin ⋅ Shuliang He ⋅ Guiliang Liu
Vision-Language Models & Foundation Models ExHall # 440
Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations Poster Session 1
Ludovica Schaerf ⋅ Antonio Purificato ⋅ Piera Riccio ⋅ Fabrizio Silvestri ⋅ Noa Garcia
Vision-Language Models & Foundation Models ExHall # 441
URoPE: Universal Relative Position Embedding across Geometric Spaces Poster Session 1
Yichen Xie ⋅ Depu Meng ⋅ Yihan Hu ⋅ Chensheng Peng ⋅ Quentin HERAU ⋅ Masayoshi TOMIZUKA ⋅ Wei Zhan
Vision-Language Models & Foundation Models ExHall # 442
CulinaryCut: A Physics-aware Vision-Language-Action Benchmark for Food Cutting via Material Point Method Poster Session 1
Hyunsuh Koh ⋅ CHANG-YONG SONG ⋅ Youngjae Choi ⋅ Misa Viveiros ⋅ David Hyde ⋅ Heewon Kim
Vision-Language Models & Foundation Models ExHall # 443
EoS-FM: Can an Ensemble of Specialist Models act as a Generalist Feature Extractor? Poster Session 1
Pierre Adorni ⋅ Minh-Tan Pham ⋅ Stephane May ⋅ Sébastien Lefèvre
Vision-Language Models & Foundation Models ExHall # 444
VERITAS: A Multi-agent Co-scientist for Verifiable Image-Derived Hypothesis Testing Poster Session 1
Lucas Stoffl ⋅ Benedikt Wiestler ⋅ Johannes Paetzold
Vision-Language Models & Foundation Models ExHall # 445
StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning Poster Session 1
Yuan Qing ⋅ Chengzhi Mao ⋅ Boqing Gong
Vision-Language Models & Foundation Models ExHall # 446
Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection Poster Session 1
Adhémar de Senneville ⋅ Xavier Bou ⋅ Jérémy Anger ⋅ Rafael Grompone von Gioi ⋅ Gabriele Facciolo
Vision-Language Models & Foundation Models ExHall # 447
From Gaze to Meaning: An AI Agent for Unified Zero-Shot Grounding and Explanation Poster Session 1
Shayan Nasiriboukani ⋅ Sara Atito ⋅ Mohammad Nezamipour ⋅ Muhammad Awais
Vision-Language Models & Foundation Models ExHall # 448
Natural Image Pretraining Improves Abstract Reasoning Poster Session 1
Xiaoman Ding ⋅ Keya Hu ⋅ Katelyn Gan ⋅ Victor Yin ⋅ Kaiming He
Vision-Language Models & Foundation Models ExHall # 449
Reinforcing Vision-Language Models for Image Quality Assessment with Grounding Process Rewards Poster Session 1
Jingwei Liu ⋅ Hongyan Li ⋅ Bo Liu ⋅ Tianlin Zhang ⋅ Yifei Qian ⋅ Congyang Zhao ⋅ Junhong Liu ⋅ Yang Cai ⋅ Ling Yang
Vision-Language Models & Foundation Models ExHall # 450
MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving Poster Session 1
Nan Yang ⋅ Zhanwen Liu ⋅ Linfeng Zhang ⋅ Shangyu Xie ⋅ Yang Wang ⋅ Wenzhuo Zhou ⋅ Xiangmo Zhao
Vision-Language Models & Foundation Models ExHall # 451
Seeing Isn't Orienting: A Cognitively Grounded Hierarchical Benchmark for Object Orientation in MLLMs Poster Session 1
Nazia Tasnim ⋅ Keanu Nichols ⋅ Yuting Yan ⋅ Nicholas Ikechukwu ⋅ Elva Zou ⋅ Deepti Ghadiyaram ⋅ Bryan Plummer
Vision-Language Models & Foundation Models ExHall # 452
Ceptor: Vision-Language Model-Infused Diverse Guidance for Detecting Anything Poster Session 1
Jinyang Li ⋅ Bin-Bin Gao ⋅ Weifu Fu ⋅ Jingnan Luo ⋅ Hanqiu Deng ⋅ Yue Guo ⋅ Jun Liu ⋅ Yong Liu ⋅ Chengjie Wang ⋅ Wenbing Tao
Vision-Language Models & Foundation Models ExHall # 453
Gender Bias in Vision-Language In-Context Learning Poster Session 1
Tong Xiang ⋅ Yuta Nakashima ⋅ Noa Garcia
Vision-Language Models & Foundation Models ExHall # 454
Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models Poster Session 1
Huanyu Wang ⋅ Jushi Kai ⋅ Haoli Bai ⋅ Lu Hou ⋅ Bo Jiang ⋅ Ziwei He ⋅ Zhouhan Lin
Vision-Language Models & Foundation Models ExHall # 456
Personalize Your Large Vision-language Models With In-context Prompt Tuning Poster Session 1
Yanshu Li ⋅ Jiaqian Li ⋅ Kuai Yu ⋅ Xi Xiao ⋅ Dongfang Liu ⋅ Tianyang Wang ⋅ Ruixiang Tang
Vision-Language Models & Foundation Models ExHall # 457
TecoPrompt: Temporal-Conservative Prompt Learning for Vision-Language Models Poster Session 1
zeyi shao ⋅ Haowen Hua ⋅ Jiaxin Zhang ⋅ John See ⋅ Zeyd Boukhers ⋅ Cong Yang
Vision-Language Models & Foundation Models ExHall # 458
EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning Poster Session 1
Chengjun Yu ⋅ Xuhan Zhu ⋅ Chaoqun Du ⋅ Pengfei Yu ⋅ Wei Zhai ⋅ Yang Cao ⋅ Zheng-Jun Zha
Vision-Language Models & Foundation Models ExHall # 459
DICE: Disentangled Instance-Class knowlEdge prompt tuning via SAE for Vision-Language Models Poster Session 1
Daeun Lee ⋅ Seungwoo Jang ⋅ Kwangsu Kim
Vision-Language Models & Foundation Models ExHall # 461
MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing Poster Session 1
Hao-Xuan Ma ⋅ Guannan Lai ⋅ Han-Jia Ye
Vision-Language Models & Foundation Models ExHall # 462
EmbedCopilot: Evaluating Vision-Language Models for Hardware-Aware Embedded System Development Poster Session 1
Dongsheng Yuan ⋅ Yimo Deng ⋅ Huangxun Chen
Vision-Language Models & Foundation Models ExHall # 463
Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment Poster Session 1
Jacky Kwok ⋅ Xilun Zhang ⋅ Mengdi Xu ⋅ Yuejiang Liu ⋅ Azalia Mirhoseini ⋅ Chelsea Finn ⋅ Marco Pavone
Vision-Language Models & Foundation Models ExHall # 464
Delineating Knowledge Boundaries for Honest Large Vision-Language Models Poster Session 1
Junru Song ⋅ Yimeng Hu ⋅ Yijing Chen ⋅ Huining Li ⋅ Qian Li ⋅ Lizhen Cui ⋅ Yuntao Du
Vision-Language Models & Foundation Models ExHall # 465
EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving Poster Session 1
Finn Rasmus Schäfer ⋅ Yuan Gao ⋅ Dingrui Wang ⋅ Thomas Stauner ⋅ Stephan Günnemann ⋅ Mattia Piccinini ⋅ Sebastian Schmidt ⋅ Johannes Betz
Vision-Language Models & Foundation Models ExHall # 466
Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization Poster Session 1
Byungoh Ko ⋅ Jinyoung Park ⋅ Jongha Kim ⋅ Jeehye Na ⋅ Jaewon Cho ⋅ Hyunwoo Kim
Vision-Language Models & Foundation Models ExHall # 467
Teaching Vision-Language-Action Models What to See and Where to Look Poster Session 1
Yuguang Yang ⋅ Canyu Chen ⋅ Zhewen Tan ⋅ Yizhi Wang ⋅ Zichao Feng ⋅ Chunyang Liu ⋅ Kehua Sheng ⋅ Bo Zhang ⋅ Yan Wang ⋅ Juan Zhang ⋅ Linlin Yang ⋅ Baochang Zhang ⋅ Xianbin Cao
Vision-Language Models & Foundation Models ExHall # 469
ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision–Language Models Poster Session 1
Zhihao Dou ⋅ Qinjian Zhao ⋅ Zhiqiang Gao ⋅ Sumon Biswas
Vision-Language Models & Foundation Models ExHall # 470
Open Your Eyes: Benchmarking the Detection of Fabricated Realities and Weaponized Ethics in VLMs Poster Session 1
Amit Pandey ⋅ Aditya Mohan ⋅ Phani Sankar
Vision-Language Models & Foundation Models ExHall # 471
Evaluating and Understanding Model Editing for Medical Vision Language Models Poster Session 1
Guli Zhu ⋅ Chenwei Wu ⋅ Liyue Shen
Vision-Language Models & Foundation Models ExHall # 472
ESC: Emotional Self-Correction for Reliable Vision-Language Models Poster Session 1
Tien-Huy Nguyen ⋅ Nhat Nguyen ⋅ Nhat-Huy Nguyen ⋅ Hung Nguyen ⋅ Huy Nguyen ⋅ Thanh-Huy Nguyen ⋅ Cuong Nguyen ⋅ Hoang Le ⋅ Dat Nguyen ⋅ Phat Huynh ⋅ Min Xu ⋅ Ulas Bagci
Vision-Language Models & Foundation Models ExHall # 473
CrossView: Can Vision-Language Models Reason Across Cameras? Poster Session 1
Sahil Shah ⋅ S P Sharan ⋅ Harsh Goel ⋅ Manvik Pasula ⋅ Adithya Hebbalae ⋅ Minkyu Choi ⋅ Sandeep Chinchali
Vision-Language Models & Foundation Models ExHall # 474
VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context Poster Session 1
Xiaoqian Shen ⋅ Mohamed Elhoseiny
Vision-Language Models & Foundation Models ExHall # 475
V-REX: Benchmarking Exploratory Visual Reasoning via Chain-of-Questions Poster Session 1
Chenrui Fan ⋅ Yijun Liang ⋅ Shweta Bhardwaj ⋅ Kwesi Cobbina ⋅ Ming Li ⋅ Tianyi Zhou
Vision-Language Models & Foundation Models ExHall # 476
SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models Poster Session 1
Olaf Dünkel ⋅ Basavaraj Sunagad ⋅ Haoran Wang ⋅ David Hoffmann ⋅ Christian Theobalt ⋅ Adam Kortylewski
Vision-Language Models & Foundation Models ExHall # 477
VISOR++ : VISUAL INPUT BASED STEERING FOR LARGE VISION LANGUAGE MODELS Poster Session 1
Ravikumar Balakrishnan ⋅ Mansi Phute
Vision-Language Models & Foundation Models ExHall # 478
LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning? Poster Session 1
Kexian Tang ⋅ Junyao Gao ⋅ Yanhong Zeng ⋅ Haodong Duan ⋅ Sun Yanan ⋅ Zhening Xing ⋅ Wenran Liu ⋅ Kai Chen ⋅ Kaifeng Lyu
Vision-Language Models & Foundation Models ExHall # 460
Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision Poster Session 1
LING LI ⋅ Bowen Liu ⋅ Zinuo Zhan ⋅ Peng Jie ⋅ Jianhui Zhong ⋅ Kenglun Chang ⋅ Zhidong Deng
Vision-Language Models & Foundation Models ExHall # 361
EGM: Efficient Visual Grounding Language Models Poster Session 1
Guanqi Zhan ⋅ Changye Li ⋅ Zhijian Liu ⋅ Yao Lu ⋅ Yi Wu ⋅ Song Han ⋅ Ligeng Zhu
Vision-Language Models & Foundation Models ExHall # 433
GRADE: Benchmarking Discipline-Informed Reasoning in Image Editing Poster Session 1
Mingxin Liu ⋅ Ziqian Fan ⋅ Zhaokai Wang ⋅ Leyao Gu ⋅ Zirun Zhu ⋅ YiguoHe YiguoHe ⋅ Yuchen Yang ⋅ Changyao Tian ⋅ Xiangyu Zhao ⋅ Ning Liao ⋅ Shaofeng Zhang ⋅ Qibing Ren ⋅ Zhihang Zhong ⋅ Xuanhe Zhou ⋅ Junchi Yan ⋅ Xue Yang
Vision-Language Models & Foundation Models ExHall # 421
OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding Poster Session 1
Wenyuan Huang ⋅ zhenyu zhang ⋅ Zhao Wang ⋅ Zhou Wei ⋅ Ting Huang ⋅ Fang Zhao ⋅ Jian Yang
Vision-Language Models & Foundation Models ExHall # 330
MobileVLA-R1: Reinforcing Vision-Language-Action for Mobile Robots Poster Session 1
Ting Huang ⋅ Dongjian Li ⋅ Rui Yang ⋅ Zeyu Zhang ⋅ ZIDA YANG ⋅ Hao Tang
Vision-Language Models & Foundation Models ExHall # 355
MonoSR: Open-Vocabulary Spatial Reasoning on Monocular Images Poster Session 1
Qirui Wang ⋅ Jingyi He ⋅ Yining Pan ⋅ Si Yong Yeo ⋅ Xulei Yang ⋅ Shijie Li
Vision-Language Models & Foundation Models ExHall # 370
TDSR-VLA: Transition-aware Denoising Sequence Representations for Vision-Language-Action Poster Session 1
Dong-Woo Kim ⋅ KEUNHO SONG ⋅ Seungmin Lee ⋅ Hwanhee Ju ⋅ Eun Cha ⋅ Daekyum Kim
Vision-Language Models & Foundation Models ExHall # 468
DIGS: Differentiable, Incremental, Global, Scalable Pruning for Language Models Poster Session 1
Bingcong Li ⋅ Junlin Xian ⋅ TAO JIANG ⋅ jwlin jwlin ⋅ Cheng ZOU ⋅ Geng-Li Zhang
Vision-Language Models & Foundation Models ExHall # 415
EvoVLA: Self-Evolving Vision-Language-Action Model Poster Session 1
Zeting Liu ⋅ ZIDA YANG ⋅ Zeyu Zhang ⋅ Hao Tang
Vision-Language Models & Foundation Models ExHall # 324
ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models Poster Session 1
Dingming Li ⋅ Hongxing Li ⋅ Zixuan Wang ⋅ Yuchen Yan ⋅ Hang Zhang ⋅ Siqi Chen ⋅ Guiyang Hou ⋅ Shengpei Jiang ⋅ Wenqi Zhang ⋅ Jun Xiao ⋅ Weiming Lu ⋅ Yueting Zhuang
Vision-Language Models & Foundation Models ExHall # 311
PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models Poster Session 1
Xianghui Wang ⋅ Feng Chen ⋅ Wenbo Zhang ⋅ Hua Yan ⋅ Zixuan Wang ⋅ Changsheng Li ⋅ Yinjie Lei
Vision-Language Models & Foundation Models ExHall # 312
Same Person, Different Depiction: Counterfactual Evaluation of Vision-Language Models on Individuals with Limb Deficiencies Poster Session 1
Heming Du ⋅ Jiaying Ying ⋅ Xin Chen ⋅ Sen Wang ⋅ Xue Li ⋅ Xin Yu
Vision-Language Models & Foundation Models ExHall # 313
TIIF-Bench: How Does Your T2I Model Follow Your Instructions? Poster Session 1
Xinyu Wei ⋅ Jinrui Zhang ⋅ Zeqing Wang ⋅ Hongyang Wei ⋅ Zhen Guo ⋅ Bairui Li ⋅ Yabin Zhang
Vision-Language Models & Foundation Models ExHall # 314
TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions Poster Session 1
Ce Chen ⋅ Yi Ren ⋅ Yuanming Li ⋅ Viktor Goriachko ⋅ Zhenhui Ye ⋅ Zujin Guo ⋅ Zhibin Hong ⋅ Mingming Gong
Vision-Language Models & Foundation Models ExHall # 315
Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task Poster Session 1
Yiqian Liu ⋅ Iuliia Kotseruba ⋅ John K. Tsotsos
Vision-Language Models & Foundation Models ExHall # 316
LEAP-VLA: Latent-Enhanced Action Prototyping via Continuous Residual Latent Spaces for Vision-Language-Action Models Poster Session 1
Bo-Yun Yu ⋅ Jun Hsieh ⋅ Kuan-Chuan Peng
Vision-Language Models & Foundation Models ExHall # 317
Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models Poster Session 1
Chen Siyao ⋅ Jiakang Yuan ⋅ Jiaxin Wang ⋅ Tao Chen
Vision-Language Models & Foundation Models ExHall # 318
Token-Based Affordance Grounding with Large Vision-Language Models Poster Session 1
Seung Il Lee ⋅ Qinqian Lei ⋅ Daguang Xu ⋅ Dong Yang ⋅ Robby T. Tan ⋅ Yixin Chen ⋅ Bo Wang
Vision-Language Models & Foundation Models ExHall # 319
A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning Poster Session 1
Zixin Zhang ⋅ Kanghao Chen ⋅ Hanqing Wang ⋅ Hongfei Zhang ⋅ Harold Haodong Chen ⋅ Chenfei Liao ⋅ Litao Guo ⋅ Yinchuan Li ⋅ Yingcong Chen
Vision-Language Models & Foundation Models ExHall # 320
GEM: Generative Supervision Helps Embodied Intelligence Poster Session 1
Ruowen Zhao ⋅ Bangguo Li ⋅ ZUYAN LIU ⋅ Yinan Liang ⋅ junliang ye ⋅ FANGFU LIU ⋅ Diankun Wu ⋅ Zhengyi Wang ⋅ Xumin Yu ⋅ Yongming Rao ⋅ Han Hu ⋅ Jun Zhu
Vision-Language Models & Foundation Models ExHall # 321
Less is More: Reducing Complexity in Vision-Language-Action Systems Poster Session 1
Jinhui Ye ⋅ Ning Gao ⋅ Senqiao Yang ⋅ Jinliang Zheng ⋅ Zixuan Wang ⋅ Yuxin Chen ⋅ Pengguang Chen ⋅ Yilun Chen ⋅ Shu Liu ⋅ Jiaya Jia
Vision-Language Models & Foundation Models ExHall # 322
CFM: Language-aligned Concept Foundation Model for Vision Poster Session 1
Kai Wittenmayer ⋅ Sukrut Rao ⋅ Amin Parchami-Araghi ⋅ Bernt Schiele ⋅ Jonas Fischer
Vision-Language Models & Foundation Models ExHall # 323
SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs Poster Session 1
Bo Yin ⋅ Xiaobin Hu ⋅ Chengming Xu ⋅ Ruolin Shen ⋅ Mo Yang ⋅ Jiangning Zhang ⋅ Peng-Tao Jiang ⋅ Cheng Tan ⋅ Shuicheng Yan
Vision-Language Models & Foundation Models ExHall # 325
CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming Poster Session 1
ruixun liu ⋅ Lingyu Zhang ⋅ Lanxuan Xue ⋅ Kaiyu Li ⋅ Bowen Fu ⋅ Xiangyong Cao
Vision-Language Models & Foundation Models ExHall # 326
Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning Poster Session 1
Wenxuan Zhang ⋅ Yuhui Wang ⋅ Donggang Jia ⋅ Xiaoqian Shen ⋅ Jian Ding ⋅ Ivan Viola ⋅ Jürgen Schmidhuber ⋅ Mohamed Elhoseiny
Vision-Language Models & Foundation Models ExHall # 327
RAU: Reference-based Anatomical Understanding with Vision-Language Models Poster Session 1
Yiwei Li ⋅ Yikang Liu ⋅ Jiaqi Guo ⋅ Lin Zhao ⋅ Zheyuan Zhang ⋅ Xiao Chen ⋅ Boris Mailhe ⋅ Ankush Mukherjee ⋅ Terrence Chen ⋅ Shanhui Sun
Vision-Language Models & Foundation Models ExHall # 328
DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models Poster Session 1
Xinlong Chen ⋅ Weihong Lin ⋅ Jingyun Hua ⋅ Linli Yao ⋅ Yue Ding ⋅ Bozhou Li ⋅ Bohan Zeng ⋅ Yang Shi ⋅ Qiang Liu ⋅ Yuanxing Zhang ⋅ Pengfei Wan ⋅ Liang Wang
Vision-Language Models & Foundation Models ExHall # 329
Trustworthy Image Authentication using Forensic Knowledge Graphs Poster Session 1
Tai Nguyen ⋅ Matthew Stamm
Vision-Language Models & Foundation Models ExHall # 331
AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs Poster Session 1
Yuan Zhang ⋅ Chun-Kai Fan ⋅ Sicheng Yu ⋅ Junwen Pan ⋅ Tao Huang ⋅ Ming Lu ⋅ Kuan Cheng ⋅ Qi She ⋅ Shanghang Zhang
Vision-Language Models & Foundation Models ExHall # 332
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models Poster Session 1
Marcel Gröpl ⋅ Jaewoo Jung ⋅ Seungryong Kim ⋅ Marc Pollefeys ⋅ Sunghwan Hong
Vision-Language Models & Foundation Models ExHall # 333
PercepTax: Benchmarking Cross-Property Reasoning in Vision-Language Models Poster Session 1
Jonathan Lee ⋅ Xingrui Wang ⋅ Jiawei Peng ⋅ Luoxin Ye ⋅ Zehan Zheng ⋅ Tiezheng Zhang ⋅ Tao Wang ⋅ Wufei Ma ⋅ Siyi Chen ⋅ Yu-Cheng Chou ⋅ Prakhar Kaushik ⋅ Alan Yuille
Vision-Language Models & Foundation Models ExHall # 334
LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models Poster Session 1
Arpita Nema ⋅ Hanwei Zhu ⋅ Xi Zhang ⋅ Weisi Lin
Vision-Language Models & Foundation Models ExHall # 335
AdaBoosting Text Prompts for Vision-Language Models Poster Session 1
Seokhee Jin ⋅ Changhwan Sung ⋅ Sunung Mun ⋅ Hoyoung Kim ⋅ Jungseul Ok
Vision-Language Models & Foundation Models ExHall # 337
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models Poster Session 1
yuhang han ⋅ Yuyang Wu ⋅ Zhengbo Jiao ⋅ Yiyu Wang ⋅ Xuyang Liu ⋅ Shaobo Wang ⋅ Hanlin xu ⋅ Xuming Hu ⋅ Linfeng Zhang
Vision-Language Models & Foundation Models ExHall # 338
Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models Poster Session 1
Juhong Min ⋅ Lazar Valkov ⋅ Vitali Petsiuk ⋅ Hossein Souri ⋅ Deen Dayal Mohan
Vision-Language Models & Foundation Models ExHall # 336
Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models Poster Session 1
Yusuke Hirota ⋅ Michael Boone ⋅ Arun Zachariah ⋅ Jibin Rajan Varghese ⋅ Yu-Chiang Frank Wang ⋅ Boyi Li ⋅ Ryo Hachiuma
Vision-Language Models & Foundation Models ExHall # 339
Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction Poster Session 1
Zengjie Chen ⋅ Yuxiang Cai ⋅ Jingcai Guo ⋅ Taotao Cai ⋅ Jianwei Yin ⋅ Zhi Chen
Vision-Language Models & Foundation Models ExHall # 340
TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs Poster Session 1
Yanqi Wu ⋅ Runhe Lai ⋅ Xinhua Lu ⋅ Qichao Chen ⋅ Zhiping Zhou ⋅ Jia-Xin Zhuang ⋅ Weijiang Yu ⋅ Ruixuan Wang
Vision-Language Models & Foundation Models ExHall # 341
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning Poster Session 1
Luyu Yang ⋅ Yutong Dai ⋅ An Yan ⋅ Viraj Prabhu ⋅ Ran Xu ⋅ Zeyuan Chen
Vision-Language Models & Foundation Models ExHall # 342
GKDT: General Keypoint Detection Transformer Poster Session 1
Changsheng Lu ⋅ Yuxin Chen ⋅ Haokun GUI ⋅ Rong Wang ⋅ Jie Yang ⋅ Harry Yang ⋅ Anton van den Hengel ⋅ Jiaya Jia
Vision-Language Models & Foundation Models ExHall # 343
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations Poster Session 1
Chancharik Mitra ⋅ Yusen Luo ⋅ Raj Saravanan ⋅ Dantong Niu ⋅ Anirudh Pai ⋅ Jesse Thomason ⋅ Trevor Darrell ⋅ Abrar Anwar ⋅ Deva Ramanan ⋅ Roei Herzig
Vision-Language Models & Foundation Models ExHall # 344
C3-Bench: A Context-Aware Change Captioning Benchmark Poster Session 1
JAEWOO KIM ⋅ Hyeongbeom Kim ⋅ Ue-Hwan Kim
Vision-Language Models & Foundation Models ExHall # 345
To Adapt or Not to Adapt? Selective Adaptation for Vision-Language Models Poster Session 1
Siru Jiang ⋅ Yuwei Liang ⋅ Jian Liang ⋅ Ran He ⋅ Tieniu Tan
Vision-Language Models & Foundation Models ExHall # 346
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization Poster Session 1
Yikun Liu ⋅ Yuan Liu ⋅ Shangzhe Di ⋅ Haicheng Wang ⋅ Zhongyin Zhao ⋅ Le Tian ⋅ Zhou Xiao ⋅ Jie Zhou ⋅ Jiangchao Yao ⋅ Yanfeng Wang ⋅ Weidi Xie
Vision-Language Models & Foundation Models ExHall # 347
Domain Generalization via Text-Anchored Information Bottleneck Poster Session 1
Eunyi Lyou ⋅ YUNJEONG CHOI ⋅ Junho Lee ⋅ Lee Joonseok
Vision-Language Models & Foundation Models ExHall # 348
Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents Poster Session 1
Sangwon Baik ⋅ Gunhee Kim ⋅ Mingi Choi ⋅ Hanbyul Joo
Vision-Language Models & Foundation Models ExHall # 349
VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models Poster Session 1
Dominick Reilly ⋅ Manish Govind ⋅ Le Xue ⋅ Srijan Das
Vision-Language Models & Foundation Models ExHall # 350
Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention Poster Session 1
Sounak Mondal ⋅ Dimitris Samaras ⋅ Gregory Zelinsky ⋅ Minh Hoai Nguyen
Vision-Language Models & Foundation Models ExHall # 351
See Only When Needed: Context-Aware Attention Intervention for Hallucination-Free LVLMs Poster Session 1
Yuqing Lei ⋅ Wenbo Lyu ⋅ Yingjun Du ⋅ Xiantong Zhen ⋅ Cees Snoek ⋅ Ling Shao
Vision-Language Models & Foundation Models ExHall # 352
RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning Poster Session 1
Yelin Wang ⋅ Zijia Song ⋅ Shuo Ye ⋅ Chuanguang Yang ⋅ Miaoyu Wang ⋅ Yong Xu ⋅ Zhulin An ⋅ Yongjun Xu ⋅ Zitong Yu
Vision-Language Models & Foundation Models ExHall # 353
PhenoLIP: Phenotype Guided Medical Vision–Language Pretraining Poster Session 1
Cheng Liang ⋅ Chaoyi Wu ⋅ Weike Zhao ⋅ Ya Zhang ⋅ Yanfeng Wang ⋅ Weidi Xie
Vision-Language Models & Foundation Models ExHall # 354
Exploring Efficient Reasoning Segmentation with Small Language Models Poster Session 1
Changsong Wen ⋅ Zelin Peng ⋅ Yu Huang ⋅ Xiaokang Yang ⋅ Wei Shen
Vision-Language Models & Foundation Models ExHall # 356
Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models Poster Session 1
Yiyang Huang ⋅ Zhaowen Wang ⋅ Simon Jenni ⋅ Jing Shi ⋅ Yitian Zhang ⋅ Yizhou Wang ⋅ Yun Fu
Vision-Language Models & Foundation Models ExHall # 357
Molmo-Point: Better Pointing for VLMs with Grounding Tokens Poster Session 1
Christopher Clark ⋅ Yue Yang ⋅ Jae Sung Park ⋅ Zixian Ma ⋅ Jieyu Zhang ⋅ Rohun Tripathi ⋅ Mohammadreza Salehi ⋅ Sangho Lee ⋅ Ranjay Krishna
Vision-Language Models & Foundation Models ExHall # 358
Benchmarking Vision-Language Models for Microscopic Plant Image Understanding Poster Session 1
Tianqi Wei ⋅ Xin Yu ⋅ Zhi Chen ⋅ Scott C Chapman ⋅ Zi Helen Huang
Vision-Language Models & Foundation Models ExHall # 359
HIVE: Understanding Post Hallucination Reasoning in Vision Language Models Poster Session 1
Feng He ⋅ Zhenting Wang ⋅ Qifan Wang ⋅ Qiang Guan ⋅ Dongfang Liu ⋅ Ruixiang Tang ⋅ Qiankun Li
Vision-Language Models & Foundation Models ExHall # 360
VLA Knows Its Limits Poster Session 1
Haoxuan Wang ⋅ Gengyu Zhang ⋅ Yan Yan ⋅ Ramana Kompella ⋅ Gaowen Liu
Vision-Language Models & Foundation Models ExHall # 362
VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking Poster Session 1
Jiyuan Fu ⋅ Kaixun Jiang ⋅ Jingkai Jia ⋅ Zhaoyu Chen ⋅ Xueyao Chen ⋅ Lingyi Hong ⋅ Shuyong Gao ⋅ Chenzhi Tan ⋅ Dingkang Yang ⋅ Wenqiang Zhang
Vision-Language Models & Foundation Models ExHall # 363
Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating Poster Session 1
Xiangkui Cao ⋅ Jie Zhang ⋅ Meina Kan ⋅ Shiguang Shan ⋅ Xilin CHEN
Vision-Language Models & Foundation Models ExHall # 364
Attention-based Vision-Language Memory for Spatial Reasoning Poster Session 1
Zuntao Liu ⋅ Zuntao Liu ⋅ Taimeng Fu ⋅ Shaoshu Su ⋅ Cherie Ho ⋅ Chen Wang
Vision-Language Models & Foundation Models ExHall # 365
NaVLM-PVC: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs Poster Session 1
Shichu Sun ⋅ Yichen Zhang ⋅ Haolin Song ⋅ Zonghao Guo ⋅ Chi Chen ⋅ Yidan Zhang ⋅ Yuan Yao ⋅ Zhiyuan Liu ⋅ Maosong Sun
Vision-Language Models & Foundation Models ExHall # 366
TARS: MinMax Token-Adaptive Preference Strategy for Hallucination Reduction in MLLMs Poster Session 1
KEJIA ZHANG ⋅ Keda TAO ⋅ Zhiming Luo ⋅ Chang Liu ⋅ Jiasheng Tang ⋅ Huan Wang
Vision-Language Models & Foundation Models ExHall # 367
Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning Poster Session 1
Guoqiang Liang ⋅ Jianyi Wang ⋅ Zhonghua Wu ⋅ Shangchen Zhou ⋅ Chen Change Loy
Vision-Language Models & Foundation Models ExHall # 368
Gripper-aware Vision Language Action Models Poster Session 1
Hanyi Zhang ⋅ Zihong Luo ⋅ Tianyu Li ⋅ Khang Nguyen ⋅ Basu Hela ⋅ Shreyas Kumar ⋅ Ngoc Tran ⋅ Feng Dai ⋅ Charith Munasinghe ⋅ Jorge Queralta ⋅ Giovanni Toffetti ⋅ Khoa Vo ⋅ Ngan Le ⋅ Ravi Prakash ⋅ Quan Vuong ⋅ Tung Ta ⋅ Long Hu ⋅ Anh Nguyen ⋅ Baoru Huang
Vision-Language Models & Foundation Models ExHall # 369
Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models Poster Session 1
Zehao Liu ⋅ Weijieying Ren ⋅ Jipeng ZHANG ⋅ Tianxiang Zhao ⋅ Jingxi Zhu ⋅ Xiaoting Li ⋅ Vasant Honavar
Vision-Language Models & Foundation Models ExHall # 371
Why Far Looks Up: Probing Spatial Representation in Vision-Language Models Poster Session 1
Cheolhong Min ⋅ Jaeyun Jung ⋅ Daeun Lee ⋅ Hyeonseong Jeon ⋅ Yu Su ⋅ Jonathan Tremblay ⋅ Chan Hee Song ⋅ Jaesik Park
Vision-Language Models & Foundation Models ExHall # 372
DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues Poster Session 1
Geng Li ⋅ Yuxin Peng
Vision-Language Models & Foundation Models ExHall # 373
PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding Poster Session 1
Seongmin Jung ⋅ Seongho Choi ⋅ Gunwoo Jeon ⋅ Minsu Cho ⋅ Jongwoo Lim
Vision-Language Models & Foundation Models ExHall # 374
Are Video Reasoning Models Ready to Go Outside? Poster Session 1
Yangfan He ⋅ Changgyu Boo ⋅ Jaehong Yoon
Vision-Language Models & Foundation Models ExHall # 375
Towards Reliable Medical Large Vision-Language Models via Counterfactual Preference Optimization Poster Session 1
Xiaoguang Zhu ⋅ NaipengWang NaipengWang ⋅ Kartik Patwari ⋅ Lianlong Sun ⋅ Chen-Nee Chuah ⋅ ChengxinPang ChengxinPang
Vision-Language Models & Foundation Models ExHall # 376
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models Poster Session 1
Thomas De Min ⋅ Subhankar Roy ⋅ Stéphane Lathuilière ⋅ Elisa Ricci ⋅ Massimiliano Mancini
Vision-Language Models & Foundation Models ExHall # 377
SDSA: Shallow-Deep Squeezing Adapter for Vision-Language Models Poster Session 1
Hao Wang ⋅ Rui Zhu ⋅ Xiaoxu Li ⋅ Zhanyu Ma ⋅ Jing-Hao Xue
Vision-Language Models & Foundation Models ExHall # 378
Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models Poster Session 1
Amira Guesmi ⋅ Muhammad Shafique
Vision-Language Models & Foundation Models ExHall # 379
Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs Poster Session 1
Ruichuan An ⋅ Kai Zeng ⋅ Ming Lu ⋅ Sihan Yang ⋅ Renrui Zhang ⋅ Huitong Ji ⋅ Hao Liang ⋅ Wentao Zhang
Vision-Language Models & Foundation Models ExHall # 380
Gradient sparsity regularization for training unlearning-compatible models Poster Session 1
Sobhan Hemati ⋅ Soufiane Lamghari ⋅ Masoud Asgharian ⋅ Xu Li ⋅ Hongliang Li
Vision-Language Models & Foundation Models ExHall # 381
VisWordBench: Bridging the Gap in Cross-modal Reasoning for Multimodal Large Language Models Poster Session 1
Tianshu Zhang ⋅ Junzhe Chen ⋅ Yean Cheng ⋅ Demin Zhu ⋅ Haoze Zheng ⋅ Lijie Wen
Vision-Language Models & Foundation Models ExHall # 382
The Cost of Reasoning: Chain-of-Thought Induces Overconfidence in Vision-Language Models Poster Session 1
Robert Welch ⋅ Emir Konuk ⋅ Kevin Smith
Vision-Language Models & Foundation Models ExHall # 383
3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing Poster Session 1
Haoyu Zhen ⋅ Xiaolong Li ⋅ Yilin Zhao ⋅ Han Zhang ⋅ Sifei Liu ⋅ Kaichun Mo ⋅ Chuang Gan ⋅ Subhashree Radhakrishnan
Vision-Language Models & Foundation Models ExHall # 384
Towards Robustness against Typographic Attack with Training-free Concept Localization Poster Session 1
Bohan Liu ⋅ Wenqian Ye ⋅ Guangzhi Xiong ⋅ Zhenghao He ⋅ Sanchit Sinha ⋅ Aidong Zhang
Vision-Language Models & Foundation Models ExHall # 385
Anchored, Not Graded: How Vision-Language Models Fail at Slant-from-Texture Perception Poster Session 1
Qian Zhang ⋅ Michal Golovanevsky ⋅ Fulvio Domini ⋅ James Tompkin
Vision-Language Models & Foundation Models ExHall # 386
MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models Poster Session 1
Alejandro Lozano ⋅ Ryan D'Cunha ⋅ Daniel Jarquin ⋅ Min Sun ⋅ Josiah Aklilu ⋅ James Burgess ⋅ Yuhui Zhang ⋅ Paola Robayo ⋅ Jin Ye ⋅ Ming Hu ⋅ Zhongying Deng ⋅ Junjun He ⋅ Xin Chen ⋅ Yue Yao ⋅ Robert Tibshirani ⋅ Jeffrey Nirschl ⋅ Xiaoxiao Sun ⋅ Serena Yeung-Levy
Vision-Language Models & Foundation Models ExHall # 387
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models Poster Session 1
Futa Waseda ⋅ Shojiro Yamabe ⋅ Daiki Shiono ⋅ Kento Sasaki ⋅ Tsubasa Takahashi
Vision-Language Models & Foundation Models ExHall # 388
HUGE-Bench: A Benchmark for High-Level UAV Vision-Language-Action Tasks Poster Session 1
Jingyu Guo ⋅ Ziye Chen ⋅ Ziwen Li ⋅ Zhengqing Gao ⋅ Jiaxin Huang ⋅ Hanlue Zhang ⋅ Fengming Huang ⋅ Yu Yao ⋅ Tongliang Liu ⋅ Mingming Gong
Vision-Language Models & Foundation Models ExHall # 389
Towards More Efficient Decoding for Autoregressive Vision-language-action Models Poster Session 1
Wenxuan Song ⋅ Jiayi Chen ⋅ Pengxiang Ding ⋅ Yuxin Huang ⋅ Han Zhao ⋅ Yinchuan Li ⋅ Yingcong Chen ⋅ Donglin Wang ⋅ Haoang Li
Vision-Language Models & Foundation Models ExHall # 390
Visual Prompt Discovery via Semantic Exploration Poster Session 1
Jaechang Kim ⋅ Yotaro Shimose ⋅ Zhao Wang ⋅ Kuang-Da Wang ⋅ Jungseul Ok ⋅ Shingo Takamatsu
Vision-Language Models & Foundation Models ExHall # 391
Less is More: A Simple yet Effective Object-Centric Prompting Strategy for Vision-Language Reasoning in Autonomous Driving Poster Session 1
Saiqian Peng ⋅ Duanfeng Chu ⋅ Liping Lu ⋅ Bing Shi
Vision-Language Models & Foundation Models ExHall # 455
Show Me Examples: Inferring Visual Concepts from Image Sets Poster Session 1
Nick Stracke ⋅ Kolja Bauer ⋅ Stefan Andreas Baumann ⋅ Miguel Angel Bautista ⋅ Joshua Susskind ⋅ Bjorn Ommer
Vision-Language Models & Foundation Models ExHall # 438
MoE-KD: Your Teacher Model is Worth Mixture-of-Experts for Knowledge Distillation
Kuo Shi ⋅ Wenjie Zhu ⋅ Bo Peng