DAEDALUS:用自生任务引导 Agent 记忆
DAEDALUS: Bootstrapping Agent Memory from Self-Generated Tasks
摘要
LLM 智能体通常缺乏在新环境中可靠运行的操作知识,因为他们必须自己发现特定的工具行为或环境约定。如果没有过去尝试的记忆,他们就会在任务中重复相同的错误,导致更多的任务失败和更长的轨迹。为了解决这个问题,Agentic 系统通常依赖于人工编写的指南或基于训练任务和预言机验证器构建的程序记忆,这两者都需要事先了解环境。我们提出了 DAEDALUS,一种从自我生成的实践中引导可重用智能体记忆 的方法,无需现有任务或预言验证器。 DAEDALUS 将两个智能体配对:一个与环境交互以生成具有挑战性但可解决的任务的探索器,以及一个尝试这些任务的求解器。启发式是从每次求解器失败中得出的,并且只有在求解器在上下文中多次成功使用该启发式后才被接受。这些结果还为探索者提供反馈,以改进未来任务的难度。然后,接受的启发式方法将合并到记忆库中以供测试时使用。在 AppWorld、$τ^2$-bench 和 AutomationBench 中,与无记忆基线相比,DAEDALUS 将平均成功率提高了高达 15.9 个点,并且通过^5 提高了高达 2.2 倍,并且与使用训练任务的方法相比具有竞争力,而且推理成本低于大多数方法。我们表明,只需少量的探索预算即可实现性能提升,并且其启发式方法也使智能体受益于其他模型系列。我们的 消融 进一步揭示了求解器轨迹提供了导出有效启发式所需的关键信息,同时分解早期发现使探索更具成本效益。除了记忆构造之外,我们发现 DAEDALUS 生成的任务可以在按性能对模型进行排名时充当基准任务的代理。代码和工件:www.github.com/illuin-tech/daedalus。
