论文
RunningTab:在工作区之外保存任务要求与证据状态
RunningTab: Direct Workspace Interaction with Environment-Side Tabs
摘要
许多知识工作从工作空间已有的文件中产生新的可交付成果,LLM Agent人开始接管此类工作。通过直接语料库交互,Agent可以在没有索引的情况下从终端搜索和读取任何这些文件,并以这种方式从其中许多文件生成可交付成果,这就是我们所说的直接工作区交互 (DWI)。然而,获取文件只是任务的一半:没有任何东西可以跟踪任务要求的内容、已读取的内容以及列出但从未打开的内容,所有这些都从上下文窗口中溜过而不会留下任何痕迹,因此Agent可以提取一个数字,但仍然可以在没有它的情况下交付报告。为了解决这个问题,我们提出了 RunningTab,一个框架,它配备了与环境端选项卡的直接工作区交互:每个任务的任务仍欠的记录,由环境与Agent一起保存。具体来说,Agent添加其要求,同时环境记录作为摘录读取的每个文件及其出处,以及每个列出但未打开的文件作为候选文件;然后,Agent可以在最匹配的摘录和未打开的最佳候选旁边查看每个需求,根据匹配的内容解决它或将其搁置并给出原因,并且如果它尝试在需求仍然开放的情况下完成,则在完成检查中接收它们。我们在三个 LLM 的三个基准上验证 RunningTab,它始终优于普通 DWI 和在模型中保留记录的基线,而它的选项卡通常包含可交付成果需要的值。
