论文
我们能读懂音频 LLM 的心思吗?可口头表达的多语言中间层工作空间
Can We Read the Mind of an Audio LLM? A Verbalizable, Multilingual Middle-Layer Workspace
摘要
音频语言模型在特定方面是一个黑匣子:我们看到它说什么,却看不到它在那里的表现,只有当模型写下其推理时,思想链监控才有帮助。在音频词元位置读取带有 logits 镜头的基础 Qwen3-Omni,我们发现在发出任何词元之前,口头问题的答案在模型的中间层变得清晰(以文字形式)。以下是五项发现。 (1) 读出的内容既不包含问题、选项,也不包含模型自己的转录中的概念:在一个逐字转录是空洞乱码的剪辑上,它重建了水门事件和丑闻,穿过总统角色,最后解析为尼克松——一条隐藏的多跳链,读起来没有思想链。 (2) 内容与语言无关:一个音频推断的概念同时出现在多个脚本中,并且在英文输入中,38% 的 top-1 读数是中文。 (3) 它是副语言的:给定与音频相同的剪辑和模型自己的无情感字幕,音频思维形成字幕丢弃的声源、说话者角色或影响,并更频繁地正确回答。 (4) 输入处不存在音频驱动信号,在进入网络的大约十分之一处打开,与中频带(深度的 35-80%)之前的文本最清晰地分离,并且激活修补显示它在最后五分之一的层之前被因果性地使用和提交。 (5) 删除单层映射管道:读取声音本地化到入口层,并将答案传递到输出层,而检索则分布在内部。自始至终,波形交换控制(相同的文本,只是声音发生了变化)将音频驱动信号与先前的打印选项隔离开来。这是对音频模型在说话之前的表现的定性描述:数量是控制,而不是基准分数。