论文
基于 LLM 的姿态检测的提示方法和多智能体方法的系统比较
A Systematic Comparison of Prompting and Multi-Agent Methods for LLM-based Stance Detection
摘要
立场检测识别文本作者对给定目标的态度。最近的研究探索了针对此任务的各种基于 LLM 的策略,从零样本提示到多智能体辩论。然而,现有的工作在数据分割、基础模型和评估协议方面存在差异,导致公平比较变得困难。我们对具有 14 个子任务的四个数据集,使用参数大小从 7B 到 72B+ 的 6 个模型系列中的 15 个 LLM 进行了系统比较,评估了跨两个类别的五种方法——基于提示的推理(Direct Prompting、Auto-CoT、StSQA)和基于代理的辩论(COLA、MPRF)。我们的实验得出了一些发现。首先,在所有具有完整结果的模型上,基于提示的最佳方法优于基于代理的最佳方法,而代理方法每个样本需要的 API 调用次数要多 7 到 12 倍。其次,模型规模对性能的影响比方法选择更大,增益稳定在 32B 左右。第三,推理增强模型(DeepSeek-R1)在此任务上的表现并不总是优于相同规模的通用模型。