论文
MemTrial:学习何时信任 LLM 投资组合代理中的内存
MemTrial: Learning When to Trust Memory in LLM Portfolio Agents
摘要
用于投资组合管理的大型语言模型(LLM)代理从经验中学习:它们将记忆中的每一次经验都归功于使用它的决策结果。然而,在金融市场中,这一结果主要反映了当天所有决策所共享的市场走势,因此信用跟踪的是市场而不是经验,并且这些代理的表现通常比简单地持有等权重(1/$N$)投资组合更糟糕。我们询问Agent如何将经历的变化归功于经历,并通过对记忆进行试验来回答这个问题:有和没有经历的相同决策的草案面临相同的市场,因此他们分享的结果抵消了他们的差异。我们的代理 MemTrial 使用通过部分因子设计选择的检索到的经验的八种组合来起草每个决策,并将每个经验归功于其 Banzhaf 值(这些差异的平均值)。由于每个日期都出现一次,并且每个草稿都是嘈杂的LLM样本,因此这些学分是嘈杂的,并且可能不适用于新的日期。因此,MemTrial 将不同日期和类似经历的数据集中起来 分层贝叶斯模型,仅在预测了未见过的日期后才对它们起作用,否则保持锚定于保守参考,例如 1/$N$。在四个基准上,MemTrial 不仅受益于重要的经验(在已知经验质量的半合成基准上选择 15 种方法中的最佳方法),而且在其值不成立时也限制了其损失(在 PortBench 和 InvestorBench 上最多比 1/$N$ 低 2.2%,而最佳经验学习代理的损失为 15--38%)。平均超过五种设置,它将最佳体验学习代理的效用提高了 21.2%,并且拥有八个LLM,它击败了 InvestorBench 上所有基于LLM的基线。