论文

RIZZ:将交互路由到近零干扰区域用于持续适配

RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents

上下文与知识上下文工程记忆Agent记忆

摘要

大型语言模型越来越多地部署为长期代理,必须适应用户、任务、领域、模式和反馈制度,而无需访问模型权重。现有的黑盒适应方法通常优化单个提示,保持无差异的记忆,或依赖于重复的大量搜索。然而,当输入流不稳定、反馈稀疏并且一个任务系列的失败可能会影响另一个任务系列的行为时,这些设计就会陷入困境。我们引入了 RIZZ(将交互路由到近零干扰区),这是一种复合语言模型系统的持续适应框架,完全通过验证者门控内存、路由和提示编译进行学习。 RIZZ 将输入流组织到动态生成的内存分支中。在推理时,无论在线还是离线,上下文感知路由器都会选择或创建一个分支,用于检索分支本地、全局、图形结构和工作内存上下文,并将其与检索到的任务证据一起编译成有界提示。模型运行后,任务验证者对输出进行评分,只有经过验证的交互才能更新内存、促进可重用规则、降级有害规则或创建反模式。这产生了一个黑盒代理,可以通过持久的自然语言反馈进行改进,同时明确地控制干扰。 RIZZ 的目标是适应必须在背景预算下在线进行的制度。最后,我们根据竞争基准的最新基线证明了我们的框架的有效性。

RIZZ:将交互路由到近零干扰区域用于持续适配:论文配图
图 1:RIZZ 的简化示意图。 RIZZ 通过外部路由存储器而不是参数更新来适应冻结的黑盒语言模型。每个传入输入都通过轻量级路由分配到一个单独的分支。选定的分支向有界提示编译器提供情景示例、程序规则、常见错误和路由统计信息。任务验证者对模型输出进行评分;只有验证者控制的反馈才能更新内存、贷记或借记规则,以及生成、合并或修剪分支。