论文
A-MBER:面向情绪识别的情感记忆基准
A-MBER: Affective Memory Benchmark for Emotion Recognition
摘要
与用户长期交互的AI助手需要理解用户当前的情绪状态,才能做出恰当且个性化的回应。然而,这一能力仍缺乏充分评估。现有情绪数据集主要评估局部或瞬时的情感,而长期记忆基准则大多聚焦于事实回忆、时间一致性或知识更新。因此,现有资源对测试模型能否利用被记住的交互历史来解读用户当前情感状态的支持有限。我们提出面向情绪识别的情感记忆基准A-MBER来评估这一能力。A-MBER聚焦于以被记住的多会话交互历史为基础的当前情感解读。给定一条交互轨迹和一个指定的锚定轮次,模型必须推断用户当前的情感状态、找出历史上相关的证据,并以有据可依的方式论证其解读。该基准通过一个具有显式中间表示的分阶段流水线构建,包括长程规划、对话生成、标注、问题构建和最终打包。它支持判断、检索和解释任务,并附带模态退化和证据不足条件等鲁棒性设定。实验在统一框架下比较了局部上下文、长上下文、检索记忆、结构化记忆和金标准证据等条件。结果表明,A-MBER在其旨在施压的子集上尤具区分度,包括长程隐含情感、高依赖记忆水平、基于轨迹的推理和对抗性设定。这些发现表明,记忆对情感解读的支持并非仅仅通过提供更多历史,而是通过让模型对过去交互做出更具选择性、更有依据且更贴合上下文的利用。
