论文
大语言模型的辩论行为基准:针对性格攻击的防御研究
Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character Attacks
摘要
大型语言模型(LLM)越来越多地被用作说服性对话中的论证主体,因此需要严格评估其相对于人类对话者的辩论能力。在这项研究中,我们重点关注传统上被视为谬论的人物攻击(人身攻击),但它们在政治说服性对话中发挥着关键作用,在政治说服性对话中,精神往往与命题内容相媲美。具体来说,我们研究现代大语言模型是否可以复制人类的能力来战略性地使用和应对此类攻击。我们分析自然语言政治对话的语料库,以确定人类对话者在以精神为中心的辩论中自然采用的防御策略,并将其构建为对话游戏。根据经验,我们将 LLM 生成的对话与美国总统辩论的 ElecDeb60to16 谬误语料库进行基准比较,将人类辩手的防御策略与人工智能代理的防御策略进行对比。结果揭示了一个重大差异:大多数大语言模型严格优先考虑逻辑防御,未能利用道德反击作为政治话语中的有效举措。我们认为,当前的安全微调限制了这些大语言模型的战略行动空间,使他们无法在角色竞争是规范期望而不仅仅是谬论的领域内充分参与自然主义互动。