论文
驯服用于图像 HOI 编辑的 I2V 模型:认知基准和代理自我校正框架
Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework
摘要
当前的图像编辑方法在静态属性方面表现出色,但在复杂的人与物体交互(HOI)方面表现不佳,这是现有基准未解决的一个关键挑战,这些基准将 HOI 与静态属性混为一谈,依赖于无法同时评估动态交互有效性和纠缠的人与物体对保存的全局指标。因此,我们首先介绍 HOI-Edit,这是一个具有三个渐进认知水平的综合基准,它具有一个自动化指标 HOI-Eval,通过在思考包含已定位的人—物对的图像后让 VLM 问答来可靠地评估实例级交互。考虑到重塑动态关系的任务本质,我们对图像到视频(I2V)模型进行了基准测试,发现它们由于其时间生成功能而天生适合动态编辑。至关重要的是,除了卓越的性能之外,此功能还提供“故障过程的重播”,从而提供对错误发生原因的独特诊断能力。因此,我们提出 SCPE(自校正过程编辑),这是一种新颖的、代理的自校正框架,通过迭代细化的提示来约束 I2V 模型的生成,使生成的视频能够更准确地呈现目标 HOI。从这些视频中提取的帧就是最终的编辑结果。在 HOI-Edit 上,SCPE 在交互方面实现了与 Nano Banana 等最先进 (SOTA) 编辑模型相媲美的性能。代码可在 https://github.com/oceanflowlab/HOI-Edit 获取。