论文
DeflectBench:评估 LLM 中修辞谬误生成的基准
DeflectBench: A Benchmark for Evaluating Rhetorical Fallacy Generation in LLMs
摘要
是否可以提示大语言模型按需生成修辞谬误,以及当前安全性后训练是否限制这种行为,比检测现有文本中的谬误相关问题受到的关注要少。我们利用 DeflectBench 缩小了这一差距,通过三种偏转策略(Whataboutism、ad hominem、Red Herring)、七个即时框架以及跨越四个争议级别的 80 项主张,评估了来自四个前沿模型的 23,990 代人。拒绝主要取决于请求结构而不是声明内容。在这 80 项索赔中,每次索赔拒绝仅相差 11 个百分点,而单个提示框架更改可能会在模型拒绝中造成近 100 个百分点的波动,而切换所请求的谬误类型可能会在明确框架内造成超过 80 个百分点的波动。一位教育辩论教练提示框架将所有四个模范家庭的拒绝率降至接近于零,但绕过的行为并不是完全遵守。模型通常会生成标记的合规性,在包含请求的操作的同一响应中命名该操作。这四种模型在拒绝、标记合规、软拒绝和干净合规方面的分布不同。代码和数据集发布于 https://github.com/ArtKanke/DeflectBench。