论文

使用 大语言模型 进行论证质量评估:成对 Bradley-Terry 方法

Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

模型评测模型能力评测

摘要

大语言模型(LLM)在推理和判断相关任务中表现出了卓越的能力。然而,评估论证的质量需要严格的评估。我们研究了 LLM 可以有效执行此任务的程度。我们在零样本、少样本和思维链下测试了 12 个不同大小和系列的开放权重 LLM,以在逻辑、修辞和辩证三个维度上近似人类对论证质量的成对比较,并在 Bradley-Terry 模型中使用这些比较来推断潜在强度分数并得出论证排名。我们的见解表明,LLM 与人类判断具有良好但中等的相关性,其中 Llama-70B 获得最强的对齐,达到中等 Cohen's $κ$ = 0.493,并且与从这些注释得出的 Bradley-Terry 分数具有中等相关性(Kendall、Pearson 和 Spearman:0.327-0.477)。其他 LLM 表现出与 Llama-70B 的弱、中度或高度一致性,同时获得与人类判断相当的结果,这表明尽管模型大小和系列存在差异,但对潜在质量维度的部分但互补的理解。此外,LLM 预测在整个试验过程中保持稳定,只有不到 7.75% 的案例产生不同的标签。剩余的可变性通过大尺寸模型的多数投票和少量提示来处理。