论文
记忆何时有助于工具使用型LLM智能体的多轨迹推理?
When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?
摘要
面向工具使用型LLM智能体的多轨迹推理——生成多个推理尝试并从中选择——受益于跨尝试的知识迁移,使后续尝试避开先前尝试的陷阱。现有的跨轨迹记忆方法(轨迹级反思、原子事实抽取、原始观察注入)各自只在单一任务上、单一推理策略下被评估,因此无法判断所报告的收益究竟来自记忆抽象的性质还是推理方法的性质。我们提出一个统一框架,沿两个轴分解记忆——迁移范围(扩展内部 vs. 跨轨迹)与所迁移内容的抽象程度——并在四种覆盖SQL、知识图谱与CLI环境的工具使用基准上,于三种推理策略(best-of-N、束搜索、MCTS)下评估四种方法,采用与实际智能体部署形态相符的无验证器设置。实验矩阵识别出推理方法是一个混杂因素:同一记忆方法在同一批样例上于不同推理策略下会产生统计上不同的结果。反思仅在MCTS下达到统计显著(在best-of-N下则否);扩展内注入(让每个候选项以先前兄弟分支的结果为条件)只对缺乏多样性的束搜索有帮助;原子事实抽取对准确率无影响,但在具有可复用环境结构的任务上可将轨迹缩短19-26%。