LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
Linquan Wu ⋅ Tianxiang Jiang ⋅ Yifei Dong ⋅ Haoyu Yang ⋅ Fengji Zhang ⋅ Shichang Meng ⋅ AI Xuan ⋅ Linqi Song ⋅ Jacky Keung
Successful Page Load