论文
RoleCDE:角色扮演智能体中角色对齐权衡的基准与缓解
RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents
摘要
角色扮演代理(RPA)被广泛用于引导大型语言模型(LLM)实现角色一致的行为,但现有的基准主要评估表面的保真度,并且对角色对齐价值冲突下的决策提供有限的洞察。为了解决这一差距,我们引入了 RoleCDE,这是第一个旨在评估角色特定值和面向联盟的约束之间的结构化冲突下的 RPA 的基准。 RoleCDE将角色感知决策制定为认知困境场景,共同评估角色场景基础、价值冲突解决和决策倾向。该基准是大规模构建的,涵盖大约 8000 个不同的角色概况和场景,以及跨越三个难度级别和八个角色类别的近 24000 个困境实例。对几个主流大语言模型的评估揭示了一种“角色价值脱钩”现象,即当两者发生冲突时,代理人系统地默认采取一致和道德一致的决策,而不是特定于角色的价值观,即使在明确的角色条件下也是如此。这种行为在很大程度上不受困境难度的影响,但在不同的角色类别中存在很大差异。我们进一步表明,基于 RoleCDE 的微调通过改进价值权衡推理,同时保持一般角色扮演保真度和一般推理性能,有效地减轻了这种解耦。代码位于:https://github.com/rabbitrose/RoleCDE。
