论文
TextHOI-3D:通过离散多视图生成与联合优化构建手—物交互网格
TextHOI-3D: Text-to-3D Hand-Object Interaction via Discrete Multi-View Generation and Joint Mesh Optimization
摘要
文本生成手—物交互三维网格,需要同时满足语言语义、多视图一致性、物体几何、手部关节形态和合理接触。TextHOI-3D以生成的多视图观测连接文本条件视觉生成与几何恢复。框架为固定摄像机的手—物观测学习紧凑VQ词元空间,通过CLIP条件视觉自回归模型预测多视图词元,再经过先验初始化、多视图联合优化和防穿透修正恢复统一网格。设计将语义生成与几何恢复分开,并以离散多视图表示衔接。在HO3D衍生评测中,相比单视图版本,物体倒角距离从17.26毫米降至4.92毫米,穿透体积从5.3721立方厘米降至0.2193立方厘米,同时改善手部误差和表面F分数。