论文
TeleGen:通过运行时遥测改进基于LLM的 Web 应用程序生成
TeleGen: Improving LLM-Based Web Application Generation via Runtime Telemetry
摘要
大语言模型可以根据自然语言要求生成可运行的 Web 应用程序,但许多生成的应用程序仍然无法完成交互式任务。现有的生成-执行-修复管道执行生成的应用程序,并使用任务结果或错误消息来指导代码修订。然而,这种反馈通常会错过浏览器操作和最终任务结果之间的运行时行为,从而导致交互级别的故障难以诊断。因此,我们提出了 TeleGen,这是一种可观测性增强的框架,用于生成基于LLM的 Web 应用程序。 TeleGen 检测生成的应用程序,在任务执行期间收集运行时遥测数据,并将原始遥测日志压缩为简洁的摘要以供修复。我们在 WebGen-Bench 和 Web-Bench 上评估 TeleGen。在 WebGen-Bench 上,TeleGen 将任务成功率从无遥测修复的 67.7% 提高到 76.2%,提高了 8.5 个百分点。在 Web-Bench 上,它将累积 Pass@2 从 21.7% 提高到 29.8%。 消融结果表明,运行时遥测提供了有用的诊断信号,而遥测简报使该信号更有效且使用成本更低。进一步的分析表明,遥测对于涉及隐藏执行路径的故障特别有帮助,例如导航、表单工作流和前后端协调。
