论文
ScriptHOI:学习用于开放词汇人机交互检测的脚本化状态转换
ScriptHOI: Learning Scripted State Transitions for Open-Vocabulary Human-Object Interaction Detection
摘要
开放词汇人机交互 (HOI) 检测需要识别在训练期间可能不会显示为带注释类别的交互短语。最近的视觉语言 HOI 检测器通过将人类对象特征与文本嵌入相匹配来改进语义转移,但它们的预测通常受对象可供性和短语级共现的支配。因此,模型可以根据刀和蛋糕的存在来预测 \textit{切蛋糕},而无需验证手、工具、目标、接触模式和对象状态是否共同支持该动作。我们提出 \textbf{ScriptHOI},一个结构化框架,它将每个交互短语表示为软脚本状态转换。 ScriptHOI 没有将短语视为单个类标记,而是将其分解为主体角色、接触、几何、可供性、运动和对象状态槽。视觉状态标记器将每个检测到的人体-物体对解析为相应的状态标记,并且按槽匹配器估计脚本覆盖率和脚本冲突。这两个量校准 HOI logits,暴露缺失的视觉证据,并为不完整的注释提供训练约束。为了避免抑制有效但未注释的交互,我们进一步引入了区间部分标签学习,它用脚本派生的下限和上限概率限制未注释的候选者,而不是分配封闭世界的负数。反事实脚本对比损失会交换各个脚本槽,以阻止仅使用对象的快捷方式。 HICO-DET、V-COCO 和开放词汇 HOI 分割的实验表明,ScriptHOI 提高了罕见和看不见的交互识别,同时大大减少了可供性冲突误报。