论文

TeleGen:通过运行时遥测改进基于LLM的 Web 应用程序生成

TeleGen: Improving LLM-Based Web Application Generation via Runtime Telemetry

AI 基础设施可观测性

摘要

大语言模型可以根据自然语言要求生成可运行的 Web 应用程序,但许多生成的应用程序仍然无法完成交互式任务。现有的生成-执行-修复管道执行生成的应用程序,并使用任务结果或错误消息来指导代码修订。然而,这种反馈通常会错过浏览器操作和最终任务结果之间的运行时行为,从而导致交互级别的故障难以诊断。因此,我们提出了 TeleGen,这是一种可观测性增强的框架,用于生成基于LLM的 Web 应用程序。 TeleGen 检测生成的应用程序,在任务执行期间收集运行时遥测数据,并将原始遥测日志压缩为简洁的摘要以供修复。我们在 WebGen-Bench 和 Web-Bench 上评估 TeleGen。在 WebGen-Bench 上,TeleGen 将任务成功率从无遥测修复的 67.7% 提高到 76.2%,提高了 8.5 个百分点。在 Web-Bench 上,它将累积 Pass@2 从 21.7% 提高到 29.8%。 消融结果表明,运行时遥测提供了有用的诊断信号,而遥测简报使该信号更有效且使用成本更低。进一步的分析表明,遥测对于涉及隐藏执行路径的故障特别有帮助,例如导航、表单工作流和前后端协调。

TeleGen:通过运行时遥测改进基于LLM的 Web 应用程序生成的原论文方法或结果图
图 1:TeleGen 概述。给定网站描述和 UI 任务套件,编码智能体首先生成一个初始 Web 应用程序,表示为 v1 应用程序。然后,TeleGen 检测 v1 应用程序的单独副本,并重新运行任务执行器以收集运行时遥测数据,包括操作、网络事件、错误和状态更改。压缩智能体将原始轨迹与任务上下文相结合,并生成紧凑的遥测摘要。最后,修复智能体使用遥测摘要和任务反馈编辑干净的 v1 源代码,生成修复的 v2 应用程序,由任务执行器重新运行以进行最终结果分析。