论文
阿谀奉承的赞美:评估语言模型中的过度赞美
Sycophantic Praise: Evaluating Excessive Praise in Language Models
摘要
语言模型中的阿谀奉承通常被研究为过度同意或验证,而明确的赞扬和奉承则相对较少受到关注。我们认为,阿谀奉承的赞美是一个独特的一致性问题,无法使用当前的方法进行可靠的测量。我们引入了一个参数化框架,用于衡量相对于贡献质量和预期用户能力的赞扬是否过度。我们表明,我们的框架在与人类注释一致方面远远优于通用的 LLM 法官,并且阿谀奉承的赞扬在社交和解释领域比在客观推理环境中发生的频率要高得多。总之,这些发现将赞扬校准视为一项独特的对齐挑战。