论文
COSMI:组合单物体片段生成多物体交互训练数据
COSMI: COmpositional Synthesis of Multi-object Interactions
摘要
人—物交互生成受现有数据限制:日常活动涉及多个物体,捕捉数据却多只有一个,因为多物体采集组合成本高。我们观察到交互是局部的,单物体片段已含多物体活动的组成部分,于是组合接触一致片段,镜像以平衡双手,在不同身体间迁移,并通过语言模型与几何检查仅保留语义和物理合理配对。数据规模因此随片段组合增长,而非随录制时长增长。COSMI包含222K序列、275小时、最多五个物体,近最大多物体采集的30倍,可继续加入数据集或手—物录制扩展。我们训练遵循数据构造方式的文本到交互扩散Transformer:共享权重物体槽生成可变物体数,位置相对驱动物体的身体部位预测。在包含未见物体和未见交互组合的基准上,数据训练的模型能泛化到未见组合。COSMI在文本对齐和接触准确性上优于基线,未见物体上的优势最大。代码、模型和数据管线将发布于 https://ptrvilya.github.io/cosmi.