论文
使用概率信念追踪的多轮人类说服力模型
A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing
摘要
大语言模型 可以在高风险领域改变人类信念,但大多数说服研究依赖于信念改变前/后。这些终点指标可以确定说服是否发生,但却忽略了信念在对话中的移动位置和方式。我们提出了 PERSUASIONTRACE,一个用于研究人类与 LLM 交互中说服的框架。 PERSUASIONTRACE 建立在基于网络的实验平台上,提供了用于多轮说服研究的工具和过程级评估协议:它记录来自人类或模拟说服目标的多轮信念报告,用修辞维度(徽标/情感/精神)注释说服者轮次,并通过对真实人类信念动态的保真度来评估模拟器。使用这个框架,我们发现人类目标分为两个多轮信念更新集群,并对修辞策略表现出敏感性,并且 LLM 在通用和个性化主题、文本和音频模式以及多轮交互中具有说服力。之前的工作主要使用普通提示的 LLM 来模拟人类目标,但我们表明这些模拟器无法复制人类的信念动态。我们引入了一个贝叶斯网络模拟目标,它随着时间的推移保持明确的潜在信念状态,因此每个说服者消息都会产生认知上现实的信念更新。在人类相似度评估中,我们的贝叶斯目标得分接近人类参考值(81 比 80),而基线 LLM 目标得分要低得多(64)。 PERSUASIONTRACE 将说服评估从单纯的端点移动重新构建为过程保真度,为说服系统的科学分析和更安全的优化提供了更强有力的基础。