论文

角色层级模型:理解LLM微调的上下文泛化

The Persona Hierarchy Model: Understanding Contextual Generalization in Fine-Tuning LLMs

模型评测模型训练监督微调与指令调优强化学习模型行为与机制分析

摘要

语言模型通常会在固定上下文(例如通用系统提示、角色或特定领域的指令)下进行微调,但学习到的行为有时会局限于该上下文,有时会广泛推广到看不见的上下文。我们提出角色层次模型来解释这一点:共享的默认角色会影响跨上下文的行为。在这种模型下,修改共享角色的微调可以促进更广泛的转移,而对本地角色的更改仍然更加针对具体情况。在涵盖四种行为和 15 个训练环境的 120 个微调模型中,泛化窄度与训练环境的角色和默认角色之间的相似性呈正相关(Qwen3-4B 的 Pearson r = 0.72)。默认上下文下的事先微调可以扩大其他上下文下后续训练的泛化能力。将上下文响应与默认角色响应相结合会产生更强大的效果。最后,我们提出人物保留正则化(PPR)来限制不需要的上下文泛化。在 RL、PPR 中 在每个评估的提示下,将奖励黑客行为从 42-55% 减少到最多 0.2%,同时保留准确性收益。这些结果支持角色层次模型作为上下文泛化的解释,并可以激励未来对意外泛化的控制,以更好地协调LLM。

角色层级模型:理解LLM微调的上下文泛化:论文原图
图 1:我们提出角色层次模型,以在微调 LLM 时理解上下文泛化。我们提供的经验证据表明,LLM包含一个共同的默认角色,使其他本地角色黯然失色。在激活本地角色的环境中进行培训将目标行为限制在该环境中。当训练环境引出共享的默认角色时,微调可以导致目标行为推广到其他角色并广泛改变LLM的行为。