论文

Video2Code:通过动作感知重访从 UI 视频生成交互式网页

Video2Code: Generating Interactive Webpages from UI Videos via Action-Aware Revisit

模型推理推理策略与问题分解

摘要

UI 视频为生成交互式网页提供了自然输入,因为它们捕获网页外观和动作触发的状态转换。然而,直接将支持视频的视觉语言模型应用于此任务仍然不够。现有模型通常依赖于稀疏采样或压缩时间表示,这可能会错过短动作边界并破坏实现网页行为所需的状态-动作-状态转换。我们将 UI 视频到代码的生成制定为从交互视频中恢复可执行的状态转换,并将这种故障模式识别为状态转换错位。我们引入了 Video2Code,一种用于恢复可执行 UI 状态转换的动作感知视频到代码的方法。 Video2Code 不是在整个视频中统一分配视觉预算,而是首先执行粗略的视频理解来定位动作关键区域,然后调用时间剪辑工具以更高的时间分辨率重新访问这些区域,然后再生成 HTML/CSS/JavaScript 代码。我们使用与动作一致的视频代码监督实例化 Video2Code,并根据视觉和功能标准对其进行评估。实验表明,Video2Code 极大地增强了 UI 视频到代码生成的底层开源模型,提高了直接视频观察的功能正确性,尤其是在密集的多步骤交互上。