论文

中国竞技辩论数据集和基准

Chinese Competitive Debating Dataset and Benchmark

模型评测基准与评测资源

摘要

辩论裁决需要跟踪争论如何通过互动发展,但现有的数据集很少将细粒度的辩论记录与在共享标题下的真实比赛中收集的专业判断结合起来。我们引入了一个数据集和基准,用于评估大型语言模型对比赛、舞台和演讲者级别的竞争性中文辩论的理解。我们组织了 182 场比赛,聘请了 120 名专业裁判,每场比赛均由 3 名裁判按照预先设定的评分标准独立裁判。排除不完整记录的匹配后,该数据集包含 148 个匹配、2,698 个阶段和 20,542 个交换单元,并具有手动验证的转录本和分段。它保留了原始的舞台得分、比赛投票、最佳辩手投票和评审理由。我们定义了三个任务:获胜者倾向预测、阶段得分预测和最佳辩手预测。对多个大型语言模型进行零样本评估,获胜者预测准确率最高为 66.2%,模型阶段得分与人类平均评分之间的皮尔逊相关性最高为 0.250,最佳辩手预测准确率最高为 56.8%。该数据集和基准测试为研究大型语言模型对交互式论证的理解及其与专业法官的一致性提供了一个测试平台。