论文

VoiceLongMemEval:助手记得你说话时的声音吗?

VoiceLongMemEval: Do Assistants Remember How You Sounded?

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

随着多代理架构和大语言模型规模的不断扩大,部署的人工智能助手越来越多地承担对长期、连续、多会话对话历史进行推理的任务。当前的基准将这种对话历史评估为长期信息检索、时间推理或知识更新,而严重忽略了人机交互的基本动态,即他们如何表达。为了解决这一差距,我们提出了 VoiceLongMemEval (VLME) 基准,其中每个答案都取决于附加到对话轮次的副语言元数据(情感标签、韵律描述符和语音事件),否则无法仅从单词中恢复。每个项目都通过三阶段对抗性门,确保强大语言模型在仅给出转录本时失败。评估领先的前沿模型和开放权重模型揭示了普遍存在的情感差距;提供文本轨道副语言元数据可以使准确度提高 0.09 到 0.38(当有证据提示提示时,准确度提高 0.61 到 0.69),而标准 ASR 管道会系统地丢弃该信号。此外,音频原生模型成功地直接从语音中提取这些线索(0.354 到 0.412 vs. 0.325 盲)。代码和数据集将在接受后提供。