论文
评估 LLM 说服性对话的能力
Evaluating the Capabilities of LLMs for Persuasive Dialogue
摘要
大语言模型 (LLM) 可以生成表面上很有说服力的文本,但是听起来有说服力就意味着能很好地论证吗?我们引入 \textsc{Persuasio},一个多智能体对话平台,基于正式的基于论证的说服对话理论,可在自由文本辩论中裁决逻辑上的获胜者。使用该系统,我们在人类和 LLM 之间生成了 192 场关于英国政治话题的辩论,并通过自动裁决和跨 1{,}386 个注释实例的 9,702 个众包成对判断来评估 22 位对话者。我们观察到主观说服力和形式说服力之间始终存在脱钩:LLM 在主观排名中占主导地位,但在论证理论裁决下表现要差得多,而人类仍然具有竞争力。多智能体和检索增强变体进一步扩大了这种差异。这些发现揭示了基于 LLM 的说服性对话中修辞流畅性和正式论证强度之间存在系统性差距。