论文
真理还是诡辩? LoFa:LLM 针对逻辑谬误的稳健性基准
Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies
摘要
大语言模型 (LLM) 表现出强大的语义能力,但它们对逻辑谬误等操纵性语言模式的恢复能力仍未得到充分研究。之前的工作主要检验了 LLM 是否能够识别或分类谬误,而对其针对谬误说服的鲁棒性研究还不够充分。为了解决这一差距,我们引入了 LoFa(逻辑谬误),这是一个用于评估 LLM 针对谬误的稳健性的综合基准。 LoFa 是通过一个多智能体管道构建的,该管道将事实问题与错误的论点结合起来,并伴随着一个多轮辩论框架,用于评估持续对抗性说服下的模型弹性。为了将谬误鲁棒性与模型固有的知识限制分开,我们进一步提出了 k 处的逻辑谬误抵抗力 (LFR@k),这是一个量化对谬误攻击的抵抗力的指标。实验表明,LLM 在不同的谬误类型中表现出不同程度的稳健性,揭示了模型之间不同的漏洞概况。