论文

用语言表达 LLM 的假设来解释和控制阿谀奉承

Verbalizing LLMs' assumptions to explain and control sycophancy

模型评测模型行为与机制分析

摘要

LLM 可以在社交上阿谀奉承,当用户提出诸如“我错了吗?”之类的问题时肯定用户。而不是提供真实的评估。我们假设这种行为源于 LLM 对用户的错误假设,例如低估了用户寻求信息而非保证的频率。我们提出了言语化假设,这是一个从 LLM 中引出这些假设的框架。语言化假设提供了对 LLM 的阿谀奉承、妄想和其他安全问题的洞察:在社交阿谀奉承数据集中,“寻求验证”是 LLM 假设中最常见的二元组。我们为假设和阿谀奉承模型行为之间的因果关系提供了证据:我们训练与语言化假设相关的内部表征的线性探针,然后使用这些探针对社会阿谀奉承进行可解释的、细粒度的引导。最后,我们确定了人类与人工智能的期望差距,这解释了为什么 LLM 默认采用阿谀奉承的假设。对于相同的查询,人们期望 AI 给出比其他人更客观、信息更丰富的响应,但经过人与人对话训练的 LLM 并没有考虑到这种期望差异。我们的工作有助于对假设作为分析和控制阿谀奉承的机制的新理解。