论文
ArgBench:计算论证任务的 LLM 基准测试
ArgBench: Benchmarking LLMs on Computational Argumentation Tasks
摘要
论证技巧是 大语言模型 (LLM) 的必备工具包。这些技能在各种用例中都至关重要,包括自我反思、协作辩论不同的答案以及反击仇恨言论。在本文中,我们为基于 LLM 的计算论证方法的标准化评估创建了第一个基准,包含来自以前工作的统一形式的 33 个数据集。使用该基准,我们评估了 5 个 LLM 系列在 46 个计算论证任务中的通用性,这些任务涵盖挖掘论证、评估观点、评估论证质量、推理论证和生成论证。在基准测试中,我们对少样本示例、推理步骤、模型大小和训练技巧对 LLM 在基准测试中的计算论证任务上的性能的贡献进行了广泛的系统分析。