论文
多模式代理学习器的双粒度代理记忆和 Shapley 上下文归因
Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner
摘要
Frontier 多模态 大语言模型 (MLLM) 提供了令人印象深刻的感知,但在科学和数学推理方面仍然犹豫不决。参数级适应对于封闭权重或设备上的主干网是不可用的,并且无状态提示会丧失已解决的问题的任何复合效益。我们提出了 \textbf{DG-Mem},这是一种双粒度代理内存框架,它通过在训练时采样轨迹一次构建的非参数外部存储内存来增强冻结的 MLLM,并在测试时以只读方式进行咨询。受人类记忆的补充学习系统 (CLS) 解释的推动,DG-Mem 将其存储分解为基于实例的范例记忆和 IF-THEN 规则的类别级模式记忆,并用瞬态反射存储来调节它们的构造,以便模式仅从抽象反射合成,而不是从范例文本合成。 DG-Mem 有两种设计选择:一种是在线概念分类器,它在训练期间逐渐增加类别空间,而不是致力于预定义的分类法;另一种是 Shapley 上下文归因过程,它分解整个检索到的规则集的正确性,并生成每个规则的实用程序,在测试时重新加权检索。该管道不引入梯度更新,并且可部署在闭源模型权重或设备上的主干上。在四个开放权重和专有主干(Qwen3.5-27B、Qwen3.5-122B-A10B、GPT-5-Nano、Gemini-3-Flash)上的 MathVista、MMMU 和 MMMU-Pro 中,DG-Mem 相对于无内存和竞争内存基线持续改进。