论文

MEMENTO:将网络用作低数据领域的学习信号

MEMENTO: Leveraging Web as a Learning Signal for Low-Data Domains

上下文与知识记忆Agent记忆

摘要

现实世界的任务常常缺乏大规模标注数据,这催生了大量关于低数据场景学习的研究。然而,少样本提示、指令微调与合成数据生成等现有方法,仍将标注或伪标注数据作为主要学习信号。相比之下,人类从业者通过反复的、自主导向的开放网络交互来积累专业能力,逐步精炼领域知识与检索策略。我们提出 MEMENTO,一个将网络视为学习信号而非无状态检索接口的框架。MEMENTO 在两个层面运作:在每次会话内,它通过自适应探索树(Adaptive Exploration Tree, AET)进行迭代式网络探索,将任务分解为不断演化的问题并对中间发现进行反思;在会话之间,它通过双通道记忆积累经验,将陈述性知识(事实)与程序性知识(检索策略)分开存储。这一设计使智能体能够从网络交互轨迹中学习可复用的研究策略与领域专长,而无需额外的模型训练。我们在两个低数据专业领域上评估 MEMENTO:销售自动化与法律研究。实证结果显示,其性能较基于 ReAct 的基线持续提升(销售自动化 +25.6%,法律研究 36.5%),表明在数据稀缺场景下,网络可以充当获取任务特定专长的可扩展学习来源。

MEMENTO:将网络用作低数据领域的学习信号:论文配图
图 1:单个训练样本的 MMENTO 概述。给定一个研究问题,代理 (1) 查阅程序内存以进行问题分解,或者 (2) 在内存为空时选择性地探索网络以引导工艺知识。 (3) 根被分解为第 1 波子问题,每个问题都由工具增强代理解决,该代理 (4) 在发出日期限制的网络搜索之前检查声明性内存,并 (5) 返回答案。在随后的浪潮中,反思会识别差距并添加新的子问题,优先考虑记忆而不是网络检索。 (6) 本地会话内存在每次wave后更新;在示例结束时,轨迹被提炼为更新持久内存存储的程序规则和声明性事实。