Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding
Na Min An ⋅ Inha Kang ⋅ Minhyun Lee ⋅ Hyunjung Shim
Successful Page Load