论文
如何正确犯错误:构建和基准测试错误意识自我中心程序视频的框架
How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos
摘要
视频中可靠的程序监控需要暴露自然发生的人为错误以及随后的恢复。在以自我为中心的录音中,错误通常被手部分遮挡,并通过微妙的对象状态变化显露出来,而现有的程序数据集提供有限且不一致的错误和纠正痕迹。我们提出了 PIE-V(视频的心理启发错误注入),这是一个框架,用于通过使用受控的、人类可信的偏差来增强干净的关键步骤程序,从而构建和基准化错误感知的以自我为中心的程序视频。 PIE-V 结合了一个以过程阶段和语义步骤负载为条件的心理学错误规划器、一个对恢复行为进行建模的校正规划器、一个执行级联一致重写的 LLM 编写器以及一个验证过程一致性和修复故障的 LLM 判断器。对于视频片段编辑,PIE-V 通过文本引导视频生成来合成替换剪辑,并将它们拼接到剧集中以保持视觉可信度。 PIE-V 应用于 17 个任务和 50 个 Ego-Exo4D 场景,注入了 102 个错误并生成 27 个恢复校正。对于基准测试,我们引入了统一的分类法和包含九个指标的人类标准,涵盖步骤级和程序级质量,包括合理性、带有注释者置信度的程序逻辑、状态变化一致性以及文本和视频之间的基础。使用此协议,我们审核多个现有资源,并在相同标准下将 PIE-V 与自由形式 LLM 生成基线进行比较。该框架和标题共同支持完成后验证,以检测和纠正以自我为中心的程序错误。