论文
指导语音语言模型:通过对比激活添加进行无需训练任务专业化
Steering Speech-Language Models: Training-Free Task Specialization via Contrastive Activation Addition
摘要
事实证明,激活转向对于控制大语言模型 (LLM) 在推理时的行为是有效的,但其在 SpeechLLM中的应用仍然是新事物,并且此类模型的无需训练转向方法在很大程度上仍未被探索。我们提出了一种无需训练对比激活添加 (CAA) 协议,该协议从少量标记的话语中导出 SpeechLLM中常见语音任务(例如转录)的转向向量。我们展示了在推理时将这些向量添加到表示空间中可以更好地执行目标语音任务。我们进一步表明,当与提示相结合时,这些向量在大多数评估任务(例如自动语音识别(ASR)或情绪识别(ER))上比单独提示产生一致的改进,并转移到域外数据。我们还演示了脚本规范化方向在强制执行特定语言的目标脚本方面的有用性。