论文
AgentHOI:通过隐式表示对齐生成人机交互视频的多代理推理
AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment
摘要
视频扩散模型的最新进展激发了人们对人机交互(HOI)视频生成的兴趣,这需要对单主体动画之外的交互逻辑进行细粒度控制。然而,现有的 HOI 方法严重依赖于显式运动控制,限制了跨不同对象和交互的可扩展性和泛化。在这项研究中,我们提出了 AgentHOI,一种文本驱动的 HOI 视频生成,遵循先思考后生成的框架,通过感知、交互和运动规划的多智能体推理,弥合了高级文本意图和物理执行之间的差距。基于生成的交互计划,我们进一步加强了文本驱动的运动理解。我们引入了一种隐式文本-运动对齐策略,该策略将文本-运动先验提炼到视频扩散模型中,从而在推理时无需显式运动输入即可实现鲁棒的 HOI 合成。实验表明,AgentHOI 显着提高了交互自然性、对象外观保留以及在具有挑战性的以对象为中心的场景(例如佩戴和骑行)中对复杂文本指令的遵守。该代码可在 https://github.com/bone-11/agenthoi 获取。