论文

像人类一样听力?语音语言模型中的声音象征和感知对齐

Hearing Like Humans? Sound Symbolism and Perceptual Alignment in Speech Language Models

模型评测模型能力评测

摘要

声音象征主义,即人类将语音映射到圆度或清晰度等感知品质的倾向,主要源于语音的声学而不是拼写。语音语言模型(SLM)是否具有这种趋势仍然悬而未决,因为之前的评估依赖于文本或图像而不是真实的语音。我们使用真实的人类语音录音来研究它,将模型判断与效果的听觉、跨模态和视觉部分的人类数据进行比较。我们发现 SLM 的听觉判断与人类感知的一致性较差,并且会错过驱动人类直觉的声学线索,例如频谱倾斜,并且开放权重模型无法可靠地将听到的声音与其相应的形状联系起来。由于仅视觉控制排除了形状感知,因此弱点在于语音的表示方式,这表明感知对齐并不取决于更强的视觉,而是取决于捕捉人类听到的线索的语音表示。