论文

RunningTab:在工作区之外保存任务要求与证据状态

RunningTab: Direct Workspace Interaction with Environment-Side Tabs

上下文与知识智能体系统上下文工程Agent Harness

摘要

许多知识工作从工作空间已有的文件中产生新的可交付成果,LLM Agent人开始接管此类工作。通过直接语料库交互,Agent可以在没有索引的情况下从终端搜索和读取任何这些文件,并以这种方式从其中许多文件生成可交付成果,这就是我们所说的直接工作区交互 (DWI)。然而,获取文件只是任务的一半:没有任何东西可以跟踪任务要求的内容、已读取的内容以及列出但从未打开的内容,所有这些都从上下文窗口中溜过而不会留下任何痕迹,因此Agent可以提取一个数字,但仍然可以在没有它的情况下交付报告。为了解决这个问题,我们提出了 RunningTab,一个框架,它配备了与环境端选项卡的直接工作区交互:每个任务的任务仍欠的记录,由环境与Agent一起保存。具体来说,Agent添加其要求,同时环境记录作为摘录读取的每个文件及其出处,以及每个列出但未打开的文件作为候选文件;然后,Agent可以在最匹配的摘录和未打开的最佳候选旁边查看每个需求,根据匹配的内容解决它或将其搁置并给出原因,并且如果它尝试在需求仍然开放的情况下完成,则在完成检查中接收它们。我们在三个 LLM 的三个基准上验证 RunningTab,它始终优于普通 DWI 和在模型中保留记录的基线,而它的选项卡通常包含可交付成果需要的值。

RunningTab:在工作区之外保存任务要求与证据状态:论文原图
图 1:在说明性任务上的直接工作区交互 (DWI) 和 RunningTab:需要分散在工作区中的三个事实的摘要。 (左)在 DWI 中,代理通过其终端访问每个文件,但它读取的内容仅存在于其上下文窗口中:早期读取的事实被后来的观察所取代,并且在没有它们的情况下交付摘要。 (右)RunningTab 在代理旁边保留了一个环境侧选项卡:代理添加任务的要求,环境记录读取的内容以及列出但未打开的内容,并且在写入可交付成果之前事实仍然可用。