论文
大模型说服力取决于怎样评测
LLM Persuasion Is in the Eye of the Evaluation
摘要
大型语言模型(LLM)已被证明在说服力方面可以与人类专家相媲美或超过。虽然它们的说服能力有望用于教育和健康传播等有益用途,但它们也可以被用来操纵和误导,这使得它们的评估成为开发商和监管机构日益优先考虑的事项。然而,这种评估仍然支离破碎:研究对说服力的理解各不相同,广泛的主张往往建立在狭隘的、针对具体情况的评估之上。通常以人类研究为模型的自动化方法提供了一种直接比较此类评估的方法,因为它们可以在相同的模型上大规模运行,并且可以包括高风险的说服形式,而这些形式在人类身上进行测试是困难或不道德的。在这项研究中,我们将九种已发布的自动化方法改编为共享设置,在相同的十五个LLM上运行它们,并询问它们的排名是否一致以及原因。我们发现这些方法的一致性很弱(平均 Spearman $ρ= 0.25$)。我们的分析指出了两个影响因素。直接或间接拒绝某些任务但不拒绝其他任务的模型 间接地,同意率降低了约四分之一,而这些拒绝主要是由于操纵任务。一般能力也发挥了作用:大多数理性说服(非操纵)方法会跟踪它,而大多数操纵方法则不会。总之,这些发现表明,一致性更多地取决于方法设置的任务,而不是它如何对说服力进行评分,尽管考虑到可用于分析的八种方法,这种模式只是指示性的。更广泛地说,我们的结果表明,说服分数结合了模型的说服能力及其意愿。因此,单个分数可以提供有关其自身设置的信息,但很少说明模型跨任务的说服力。
