论文

模型家族中的真实性传承:利用继承的注意力头改善上下文证据一致性

The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 的最新进展产生了许多专门的多模态 LLM (MLLM),它们共享共同的基础 LLM,形成不同的模型谱系。目前尚不清楚基础 LLM 和下游变体之间是否存在基本行为联系。我们通过量化头部情境真实性分数来调查这个问题。在不同的 LLM 和 MLLM 谱系中,包括基于 Vicuna、Qwen2.5、LLaMA2 和 Mistral 的模型,我们发现即使在指令调整或多模态适应之后,真值分数也牢固地保留在模型系列中。我们进一步表明,这种继承与注意力头权重保留一致,并且上下文真实的头会关注与查询相关的证据。基于这一发现,我们提出了 TruthProbe,这是一种软门控策略,可以放大上下文真实的头部,同时保留其他头部贡献。 TruthProbe 提高了 HaluEval 上的上下文真实性,并减少了 POPE 和 CHAIR 上的多模态幻觉,基础 LLM 真相分数有效地转移到其微调的 LLM 和 MLLM 后代。代码可在 https://github.com/miso-choi/TruthProbe 获取。