论文
Omni2Web:视听网站开发基准测试
Omni2Web: Benchmarking Audiovisual Website Development
摘要
屏幕记录的 Web 编辑请求包含弱指示表达式,例如“this”和“there”,其所指对象取决于语音、光标轨迹、页面状态和编辑历史记录。此类请求需要的意图恢复超出了许多现有网络编辑基准假设的明确规范。我们引入了 Omni2Web,这是一个包含 918 个实例、跨越 13,907 个编辑步骤的双语基准测试。它定义了三个互补的轨道:直接编辑评估来自记录的网页编辑,指令恢复测量显式意图恢复,指令实用程序测试恢复的指令是否可以驱动固定的代码执行器。我们评估了 17 个开源和闭源模型。最佳模型的直接编辑编辑保真度得分 (EFS) 达到 51.17,指令恢复得分 (IRS) 达到 49.14;在固定执行器下,最强恢复指令达到51.08 EFS,仍远低于使用oracle指令获得的89.69 EFS。步骤级分析表明,正确的基础并不能保证编辑成功,而某些 Omni 模型恢复的指令表明固定编码模型的执行效果比直接编辑要好得多。受控消融进一步证明了时间对齐的视听证据的价值,而替代法官则保留了领导者和广泛的顺序。总之,这些发现揭示了多模式意图恢复和代码执行方面的巨大空间,并强调了将 Omni 重写器与编码模型配对的前景。