论文
FIGS:在不惩罚同理心的情况下评估多轮阿谀奉承
FIGS: Evaluating Multi-Turn Sycophancy Without Penalizing Empathy
摘要
大语言模型经常无法平衡保持真实性和支持性。他们经常在回应用户时表现出阿谀奉承、同意虚假主张、提供无端奉承以及提供偏向于用户表达的观点的建议。事实上,在一次交流中很少会发生阿谀奉承的情况。随着时间的推移,当用户反复坚持或巧妙地引导对话时,它可能会有机地出现。然而,当前的评估依赖于严格的单轮测试或固定脚本,无法捕捉这些自然动态。此外,这些基准测试经常错误地表现出对屈服的基本同理心,对承认用户感受的模型进行惩罚。这种观点可能会导致未来的模型过度修正,陷入冷漠、轻视的僵化状态。为了解决这一差距,我们引入了Figs(事实完整性和grounding支持),这是一个围绕扩展的、现实的对话构建的双轴评估框架。我们使用自适应 10 轮对话模拟器来动态挑战目标模型,反映用户如何重复请求、推迟或将对话引向首选答案。为了准确评估这些轨迹,我们应用了一种分类法,将谄媚(模型是否坚持真理并保持其赞扬比例)与校准验证(表现出对用户感受的同理心理解,但又不过分)区分开来。我们发布了完整的测试环境,包括 500 个不同的多回合场景和自动判断。我们对领先模型的评估揭示了一个一致的权衡:在持续的交互过程中,当前的系统要么慢慢地转向阿谀奉承,要么过度纠正为机器人脱离。这表明,在自然对话中平衡诚实与适当的支持仍然是一个关键的、尚未解决的挑战。