论文
LPDS:通过保留逻辑的难度缩放评估 LLM 的鲁棒性
LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling
摘要
随着 大语言模型 (LLM) 越来越多地被部署来以最少的人工监督执行任务,这些模型的稳健运行至关重要。特别是,能够解决给定问题的模型不应该仅仅因为某些实体$\unicode{x2013}$(例如名称、数字或其他上下文细节$\unicode{x2013}$)发生变化而底层问题逻辑保持不变而失败。之前的工作表明,当前的 LLM 仍然在与这种形式的稳健性作斗争:它们经常在问题的某些变体上成功,但在其他问题上失败。然而,现有的评估通常缺乏系统的方法来识别哪些逻辑保留变化最有可能导致失败。相反,他们通常测试允许变化的随机子集,这可能夸大了稳健性。为了解决这一差距,我们引入了逻辑保留难度缩放(LPDS),这是一个框架,(i)量化问题变化的难度,(ii)系统地搜索允许的变化空间,以找到最大化难度并暴露故障的变化。我们表明,随着难度的增加,模型推理链中的性能下降和错误变得更加明显。我们进一步证明,LPDS 可以有效地发现模型的困难问题变化,与随机采样相比,导致性能下降高达 5 倍。最后,我们证明 微调 在更困难的变化上比在更简单的变化上进行训练能带来更一致的鲁棒性增益。