论文

SocialDirector:无需训练 用于多人视频生成的社交交互控制

SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation

应用与实践内容创作

摘要

视频生成技术发展迅速,可以根据文本或图像提示生成逼真的视频。与此同时,电影制作和社交机器人越来越需要具有丰富社交互动的多人视频,包括对话、手势和协调动作。然而,现有模型没有提供对交互的明确控制,例如谁执行哪个操作、何时发生以及针对谁。这通常会导致错误的人执行无意的行为(行动者与行为不匹配)、社会动态紊乱和错误的行动目标。为了应对这些挑战,我们提出了 SocialDirector,这是一种 无需训练 交互控制器,它通过调制交叉注意力图来增强生成模型。 SocialDirector 包含两个模块:Social Actor Masking 和 Directional Reweighting。社会演员掩蔽通过时空掩蔽限制每个人的视觉标记仅关注他们自己的文本描述,避免演员动作不匹配和无序的社会动态。方向性重新加权增强了对方向性词语(例如“向左”、“向右”)的注意力,引导每个动作朝着其预期目标前进。为了评估生成的社交互动,我们使用交互描述对现有数据集进行注释,并构建由开源 VLM 支持的全自动评估管道。对不同视频生成模型的实验表明,SocialDirector 显着提高了交互保真度,接近真实视频设定的上限。