论文
争论崩溃:LLM 压平长篇公开辩论
Argument Collapse: LLMs Flatten Long-Form Public Debate
摘要
随着 LLM 越来越多地用于起草面向公众的论点,它们可能会通过重复引入相同的精美的、看似合理的论点来使公开辩论变得平淡。我们研究论证崩溃,即由不同 LLM 生成的论文趋同于较小的一组主要论证、子论证和段落级结构的趋势。我们比较了来自 195 场纽约时报 (NYT) 辩论的 1,039 条人类回复、来自 61 个较长形式的波士顿评论 (BR) 论坛的 448 条人类回复以及 23,381 篇 LLM 生成的文章。在 NYT 语料库中,65.3% 的人类主要论点在一场辩论中是独特的,而 LLM 主要论点的这一比例为 3.4%。要求 LLM 生成不同的答案会增加变化,但典型的模型只能恢复大约一半的不同人类主要论点,其中大部分增加的变化超出了观察到的人类论点空间。崩溃也出现在子论点中,在具有相同主要论点的文章中,41.0% 的人类子论点是独特的,而 LLM 回复中的这一比例为 9.1%。定性地讲,LLM 经常重用广义和对冲的子参数,而人类更喜欢更具体和针对特定主题的子参数。从结构角度来看,LLM 生成的论文往往遵循更固定的弧线,通常以直接主张开头,然后快速转向提案。同样的模式也适用于较长的 BR 论文,这表明论证崩溃不仅仅限于简短的回应。最后,人类偏好评估者同时支持常见论点和 LLM 论文,这可能会加剧论点崩溃。