论文
I-WebGenBench:评估 LLM 生成的科学 Web 应用程序中的交互性
I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications
摘要
视觉语言模型的最新进展使自主代理能够进行复杂的推理、工具使用和文档理解。然而,现有的文档代理主要将论文转换为摘要、网页或幻灯片等静态工件,这对于涉及动态机制和状态转换的技术论文来说是不够的。在这项工作中,我们提出了一种纸张到交互式系统代理,可将研究论文转换为可执行的交互式网络系统。给定 PDF 论文,代理无需人工干预即可执行端到端处理,包括论文理解、系统建模和交互式网页合成,使用户能够操纵输入并观察动态行为。为了评估这项任务,我们引入了 19 篇研究论文的基准,以及专家构建的交互系统 真值。我们进一步提出了 PaperVoyager,一种结构化生成框架,可在综合过程中显式地建模机制和交互逻辑。实验表明,PaperVoyager 显着提高了生成的交互式系统的质量,为交互式科学论文理解提供了新的范例。