论文

甜言蜜语者:查询表述如何塑造浪漫关系建议中的阿谀奉承

Sweet Talkers: How Query Formulation Shapes Sycophancy in Romantic Relationship Advice

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 越来越多地用于情感支持和关系建议,其中模型保留用户面子的倾向可能会无意中强化有害的人际行为。为了系统地检查这一风险,我们开发了浪漫关系建议寻求提示 (RRASP) 数据集,其中包含五个关系主题的 2,400 个提示,并使用 ELEPHANT 框架在两个面向消费者的模型(GPT-5 Mini 和 Gemini 3 Flash)上评估了社交阿谀奉承。与我们最初的假设相反,语法情绪本身并不会在阿谀奉承行为中产生系统性差异,这表明用户暗示的内容比他们如何表达更重要。相反,视角驱动的框架具有更强的影响力,原始提示和翻转提示之间的差距在后续反应中扩大。框架和道德奉承的持续增加表明,随着对话的进展,模型更有可能接受用户陈述的前提并确认他们的道德立场。值得注意的是,与 GPT-5 Mini 相比,Gemini 3 Flash 在道德阿谀奉承方面的增幅要小得多,这表明它更难以在回合中强化有道德问题的立场。