论文

ImplicitMemBench:度量大语言模型的无意识行为适应

ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models

模型评测基准与评测资源

摘要

现有LLM智能体记忆基准评估的是对事实的显式回忆,却忽视了内隐记忆——经验在无需有意识检索的情况下变为自动化行为。这一缺口至关重要:有效的助手必须能自动应用已学会的程序或避免失败过的动作,而无需显式提醒。我们提出ImplicitMemBench,首个系统性评估内隐记忆的基准,它通过三个取自认知科学非陈述性记忆标准理论、具有认知依据的构念来实现:程序性记忆(干扰后的一次性技能习得)、启动效应(通过配对的实验/控制实例产生的主题驱动偏差)与经典条件反射(条件刺激-无条件刺激(CS-US)关联塑造首次决策)。我们300题的测试套件采用统一的学习/启动-干扰-测试协议并进行首次尝试计分。对17个模型的评估揭示了严重局限:总体上没有模型超过66%,表现最好的DeepSeek-R1(65.3%)、Qwen3-32B(64.1%)和GPT-5(63.0%)远低于人类基线。分析揭示了显著的失衡(抑制17.6%对偏好75.0%)以及超越参数规模、需要架构创新的普遍瓶颈。ImplicitMemBench将评估视角从“智能体回忆起什么”重构为“它们自动执行了什么”。

ImplicitMemBench:度量大型语言模型的无意识行为适应:论文配图
图 1:总体框架。 (a) 使用LLM生成的候选数据生成管道,通过微调和人工编辑进行细化。 (b) 评估指标:程序记忆(FTA)、LLM作为启动(启动影响评分)和经典条件作用(FTA)法官的混合自动/人工验证。