论文

PRIME:面向用户中心智能体、通过迭代记忆演化实现免训练主动推理

PRIME: Training Free Proactive Reasoning via Iterative Memory Evolution for User-Centric Agent

上下文与知识记忆Agent记忆

摘要

与人类用户协作、完成复杂长程任务的自主工具使用智能体的开发,已成为智能体研究的前沿。在多轮人机交互中,用户需求的动态性与不确定性构成重大挑战;智能体不仅要调用工具,还须通过有效沟通迭代地深化对用户意图的理解。尽管强化学习的最新进展为构建更强的工具使用智能体提供了一条路径,但现有方法需要昂贵的训练成本,且在较长交互跨度内难以做好轮次级别的贡献归因。为此,我们提出PRIME(Proactive Reasoning via Iterative Memory Evolution,经由迭代记忆演化的主动推理),一个免梯度学习框架,通过显式的经验积累而非昂贵的参数优化实现智能体的持续演化。PRIME将多轮交互轨迹蒸馏为结构化、人类可读的经验,并按三个语义区组织:成功策略、失败模式与用户偏好。这些经验通过元级操作不断演化,并借助检索增强生成引导智能体未来的行为。在多个多样化用户中心环境中的实验表明,PRIME取得了与基于梯度方法相当的性能,同时具备成本效率与可解释性。总体而言,PRIME为构建主动协作型智能体提供了一种实用范式,使其能够从人机交互中学习,而无需承担基于梯度训练的计算负担。

PRIME:面向用户中心智能体、通过迭代记忆演化实现免训练主动推理:论文配图
图 2:在 IntentionGym 任务中,Vanilla LLM 与 PRIME。 (A) 在没有经验指导的情况下,代理会直接跳到提供解决方案,对用户偏好做出错误的假设,并在纠正后被迫回溯。 (B) 通过 PRIME,代理系统地提出重点明确的问题,有效涵盖所有缺失的细节,并以从过去类似交互中检索到的经验为指导。绿色勾号 (✓) 标志着满足用户需求的高效转变;红叉(×\boldsymbol{\times})标记的是假设而不是询问。