论文

LLM人物设定提示的行为效果能否跨模型迁移

How Far Do Persona Effects Generalize in Language Models?

模型评测模型行为与机制分析

摘要

角色提示要求语言模型以特定类型的人的身份进行回答。我们测试从这些效应中学到的关系是否可以预测对新问题的响应,并在模型和提示中保持有用。跨越 57 个属性、三个行为领域和七对开放的 7 到 9B 检查点,人物角色效果可以预测,而无需移植。单独的属性和任务增益在 OLMo-3 和 Qwen2.5 中显着改善了共享缩放之外的预测,并在 OLMo-3 中提供了最有力的证据。在该模型中,目标改装明显优于从其他六对中借用的收益。在模型传输中,具有一个幅度的借用增益在大多数方向上都低于共享缩放;允许两个目标参数可以消除显着的损失,但与目标共享扩展相比并没有产生显着的好处。重新措辞后,改装显着优于重用,在所有六个测试对中都有一个幅度,而示例或国家背景的更改通常会保留重用价值。在测试的即时传输中,规则化更新在每个属性 64 个目标问题的中位数上优于两种重用策略。一项单独的调查比较发现,选择反应更灵敏的检查点可能会恶化人体适应性;响应能力与训练状态相混淆,温度校准很大程度上消除了这种成本,但并没有消除分组排序中的错误。在测试的增益表示中,表观传输可能来自目标校准;源关系必须增加校准和正则化之外的预测价值。代码和数据可在 https://github.com/thzva/persona-gain 获取