论文

继承的头:音频语言模型通过其文本主干的注意力来跟踪说话者,并且注意力质量排名检索不同的集合

Inherited Heads: Audio language models track speakers with their text backbone's attention, and an attention-mass ranking retrieves a different set

模型评测模型行为与机制分析

摘要

当被要求描述录音中六位说话者中的一位说话时,音频语言模型在 6% 到 16% 的试验中描述了正确的一位,低于猜测给出的 16.7%。在 90.7% 到 99.0% 的试验中,在未经训练的情况下,向 100 个头的注意力logits添加固定偏差(低于模型的十分之一),将描述重定向到我们选择的任何说话者。这些头很大程度上不是专门针对音频的。在任务的书面版本上,对音频模型所基于的纯文本语言模型或同一系列的已发布模型进行排名,获取其前 100 个头,并保持不变:它们在 80.8% 到 95.0% 的试验中重定向音频模型,没有任何音频进入选择。音频和文本耳机共享 100 个中的 66 到 74 个,其中机会约为 20 个,并且仅共享部分就再现了几乎所有的转向。但这并没有表明,共享才是让头脑发挥作用的原因:从同一个发现的数百个中进行同等规模的抽取几乎也能起到同样的作用,而且我们的三个模型都没有将这两种解释区分开来。第二个发现涉及如何找到这些头颅。根据他们对所问问题的关注程度(如既定分数)或根据他们的注意力随问题移动的程度(如每个人头归一化变体)对头进行排名,得出在我们的三个模型中共享 69、37 和 4 个头的前数百个头。在 Ultravox 中,他们共享 4,在 69.7% 的试验中,既定分数的头留下法官无法将输出放在任何部分上,而没有干预的比例为 40.0%,标准化变体的比例为 1.0%。那是六只手臂;在另外五项比赛中,既定分数高于随机抽签。