JointHOI: Jointly Generating Contact Maps Enhances Hand Object Interaction Generation
Abstract
Text-driven hand–object interaction (HOI) generation is gain-ing attention for immersive applications and robotics, yet producingphysically plausible interactions remains challenging. Even when individ-ual motions appear natural, small contact errors can cause conspicuousartifacts such as floating and interpenetration. Prior methods mitigatethese issues using explicit contact cues or implicit grasp priors, but typ-ically rely on multi-stage pipelines and fail to model temporally evolvingcontact. We present JointHOI, a single-stage diffusion framework thatjointly generates 3D hand–object motion and dynamic, distance-basedcontact maps from text. By treating contact as an auxiliary inner modal-ity, joint generation enables the model to learn contact–motion couplingduring training. At inference, contact-guided sampling enforces consis-tency between generated contact maps and motion-implied geometry,improving temporal stability and reducing penetration and floating. Ex-periments on GRAB and ARCTIC demonstrate consistent improvementsin text adherence and physical plausibility over prior methods.