论文
$Ψ$-Bench:评估说服性对话中的角色敏感影响
$Ψ$-Bench: Evaluating Persona-Sensitive Influencing in Persuasive Dialogues
摘要
个性化是现代语言智能体的一项重要能力。然而,当前的研究主要将个性化代理定位为对用户偏好的被动响应者,限制了他们与用户交互并主动提供建议或指导的能力。为了系统地评估现实交互中的主动个性化,我们提出了 $Ψ$-Bench,这是一个评估 LLM 通过对话影响现实用户的能力的基准。我们在 $Ψ$-Bench 中设计了三个涉及说服的真实交互场景,并通过从对话历史中得出的明确的用户配置文件赋予模拟客户个人特征。我们在 $Ψ$-Bench 上评估了 10 个前沿 LLM,发现虽然大多数模型可以产生连贯且合理的论点,但即使是最先进的模型在说服力方面仍然留有相当大的改进空间。我们还发现,提供对客户资料的访问可以使性能平均提高 18.24%,这凸显了用户特定信息对于有效说服的重要性。总的来说,我们的工作强调人物敏感的影响力是评估和开发更主动的个性化 LLM 代理的具有挑战性但实用的方向。代码位于:https://github.com/Hanpx20/Psi-Bench。