论文
Janus:LLM 中目标条件信息失真的基准
Janus: A Benchmark for Goal-Conditioned Information Distortion in LLMs
摘要
LLM 欺骗通常通过直接标记来评估,例如捏造的声明、明确的谎言或策略性隐瞒。然而,现实世界中的许多误导性传播并不依赖于虚假陈述,而是源于对真实重要事实的选择性处理:忽略不利的证据,软化不利的细节,强调有利的细节,或用模糊的语言代替精确的限定条件。现有的基准测试很大程度上忽略了这种更微妙且可以说更危险的故障模式。我们引入了 JANUS,一个用于测量基于事实的 LLM 输出中的目标条件语用失真的基准。我们基准中的每个场景都提供了一组固定的有利和不利事实,并将中性条件与目标导向条件进行比较,例如增加采用、注册、批准或支持,尽管对直接受影响的个人或群体可能造成伤害。由于所有输出都被限制为使用相同的事实池,JANUS 将误导性的网络印象与幻觉和捏造隔离开来。 JANUS 包含跨 8 个领域的 160 个场景,每个场景都配有中性且有目标条件的提示以及带注释的重要事实。 12 个 LLM 的广泛实验揭示了一致的目标条件扭曲,表明当前模型对激励和框架目标仍然敏感,并且缺乏针对选择性误导性沟通的强有力的保障措施。我们公开发布我们的语料库和代码以供未来研究。