论文
为什么他们不记得了?揭示多轮声学记忆中的表示和检索瓶颈
Why Can't They Remember? Uncovering Representation and Retrieval Bottlenecks in Multi-Turn Acoustic Memory
摘要
大型音频语言模型 (LALM) 可以处理语音和环境声学线索,但很难在多轮交互中保留非语音信息。语义(语音)和声学(非语音)理解之间的性能差距仍然知之甚少,并且表示和检索的潜在机制仍不清楚。这项工作引入了 EnvMem,这是一种受控的多轮基准测试,旨在研究这一差距并确定表示(即潜在嵌入)和检索级别(即注意力分配)失败的根本原因。我们进一步进行事后干预来探究表征结构和注意力动态。我们的结果揭示了代表性轨迹漂移是关键的故障模式,同时表明注意力分配在解释观察到的退化方面发挥的作用有限。总体而言,我们提供了一个系统框架,用于分析和改进长上下文 LALM 中的非语言记忆,为未来的数据和鲁棒声学记忆建模的训练设计提供启示。