论文
LURE:实时使用重播评估以降低评估意识
LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness
摘要
大语言模型 可以识别它们何时被评估(评估意识)并因此表现不同,这破坏了安全性和一致性基准的有效性。我们提出了 LURE(实时使用重放评估),这是一种通过重放真实的代理交互轨迹并在最后附加评估提示来构建类似部署的评估的方法。我们还引入了一个用于衡量评估真实性的自动化管道,结合了言语评估意识的检测和日志作为评估的概率的判断模型估计,并在部署和评估记录的大型数据集上对其进行了验证。我们发现,与广泛使用的基准和综合评估生成器相比,基于 LURE 的评估与部署的区别要小得多,并且可以接近与用户的真实对话的真实性。我们将 LURE 实例化于阴谋、人工智能安全破坏和阿谀奉承的环境中。我们的结果表明,评估现实性是对齐基准的重要属性,应与基准结果一起报告,特别是当此类结果用于安全案例时。