论文
LLM 辩论在不同语言中重复的论点是否不同?
Do LLM Debates Repeat Arguments Differently Across Languages?
摘要
LLM 辩论通常通过最终答案来评估,但笔录揭示了后来的辩论是否会提出新的论点,还是以新的措辞返回到先前的主张。我们用 \textit{先验论点相似性} 研究这个过程,它将提取的论点单元与同一辩论中的早期单元进行比较。在针对 71 个动议、六种语言和四种模型代理的受控八回合辩论中,中文是唯一一种在三种多语言嵌入模型中相对于英语始终存在正差距的测试语言。这种差距在代理、转弯位置、回归调整、度量变体、提取长度控制、第二提取器子集和跨编码器尾部重新评分方面仍然存在。手动校准显示项目级对齐较弱,但高相似性尾部丰富了实质性重复。多样性感知提示会降低不同语言之间的 \textit{先验参数相似性},但不会显着缩小中英差距。因此,多语言辩论评估应该衡量辩论随时间的发展,并报告平均术语和差距术语。