论文

专家人格提升LLM对齐但损害准确性:以PRISM自举基于意图的人格路由

Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM

模型训练监督微调与指令调优

摘要

人格提示可以引导 LLM 生成趋向特定领域的语气与模式。这一行为支撑了多智能体系统中的应用场景,其中多样化交互至关重要,且以人为中心的任务需要高水平的人类对齐。先前工作对其效用看法不一:一些报告在特定领域使用专家人格带来性能提升,以及其在合成数据创建中对数据多样性的贡献;另一些则发现其对通用效用的影响接近零或为负。为充分发掘 LLM 人格的益处并规避其害处,对其机制开展更全面的考察至关重要。在本工作中,我们研究模型优化方式、任务类型、提示长度与位置如何影响专家人格在指令微调与推理 LLM 上的有效性,并洞察专家人格失效与奏效的条件。基于这些发现,我们开发了充分利用专家人格益处的流水线 PRISM(Persona Routing via Intent-based Self-Modeling),它通过自举过程将意图条件化的专家人格自蒸馏到一个门控 LoRA 适配器中,无需外部数据、模型或知识。PRISM 在所有模型上提升生成任务的人类偏好与安全对齐,同时保持判别任务的准确性,且内存与计算开销极小。

专家人格提升LLM对齐但损害准确性:以PRISM自举基于意图的人格路由:论文配图
图 2:面板 (a–c):指令调整模型 (Qwen2.5-7B-Instruct)。面板 (d–f):推理蒸馏模型(2 个 R1 变体的平均值)。 (a,d) MT-Bench 上每个角色相对于无角色基线的每类别分数提升:写作 (Wr)、角色扮演 (Ro)、推理 (Re)、数学 (Ma)、编码 (Co)、提取 (Ex)、STEM (St)、人文 (Hu)。对角线=专家角色;蓝色=增益;红色=损失。 (b,e) 每个专家角色对所有任务的影响;零线代表基本模型。在 (b) 中,大多数专家角色都低于零,这表明专家角色通常会损害指令调整模型的整体性能。在(e)中,模式相反:专家角色在主导 R1 蒸馏训练集的三个类别(Re、Co、St)的驱动下提高了推理模型的整体性能,证实模型优化直接决定角色是否可以提供改进。 (c, f) 与随机角色相比,专家角色在其匹配域上的效用。 (f) 中接近平坦的条形表明收益是环境驱动的而不是特定于专业知识的。