论文
专家人格提升LLM对齐但损害准确性:以PRISM自举基于意图的人格路由
Expert Personas Improve LLM Alignment but Damage Accuracy: Bootstrapping Intent-Based Persona Routing with PRISM
摘要
人格提示可以引导 LLM 生成趋向特定领域的语气与模式。这一行为支撑了多智能体系统中的应用场景,其中多样化交互至关重要,且以人为中心的任务需要高水平的人类对齐。先前工作对其效用看法不一:一些报告在特定领域使用专家人格带来性能提升,以及其在合成数据创建中对数据多样性的贡献;另一些则发现其对通用效用的影响接近零或为负。为充分发掘 LLM 人格的益处并规避其害处,对其机制开展更全面的考察至关重要。在本工作中,我们研究模型优化方式、任务类型、提示长度与位置如何影响专家人格在指令微调与推理 LLM 上的有效性,并洞察专家人格失效与奏效的条件。基于这些发现,我们开发了充分利用专家人格益处的流水线 PRISM(Persona Routing via Intent-based Self-Modeling),它通过自举过程将意图条件化的专家人格自蒸馏到一个门控 LoRA 适配器中,无需外部数据、模型或知识。PRISM 在所有模型上提升生成任务的人类偏好与安全对齐,同时保持判别任务的准确性,且内存与计算开销极小。
