论文
剖析LLM的阿谀奉承:翻转率隐藏了什么
Anatomy of LLM Sycophancy: What a Flip Rate Hides
摘要
受到阻力的模型可以自我修正、投降或保持不变,并且一个翻转率既可以算作修正,也可以算作投降。使用 SycoLens(一种模块化重放协议),我们测试用户压力和评估设置如何影响测量的翻转率。每个测量都是一个项目的无状态重播、一个提交的答案以及一个固定形式的脚本化用户行。每个效果都会针对匹配的控件进行读取,并删除该行。推回措辞、承诺文本、答案格式、边界距离和基本事实成为一台仪器的因素;早期的乐器会改变其中的一到三种。在来自三个提供商的 11 个前沿模型和大约 760,000 次受控重播中,哪些模型看起来很阿谀奉承取决于用户如何反击。断言相反结论的线条和挑战答案而不断言答案的线条对模型的排名几乎不相关。在模型边界附近,翻转效应会增加数倍,但在每次筛选抽签中回答相同的项目仍然占受影响最严重总数的大约一半。在已知真相的算术任务中,一种模型在压力下重新推导并自我修正,而另一种则在没有书面工作的情况下放弃正确答案。在测试的模型中,植入的推导会降低其所主张的答案的发布,无论正确与否,而纯粹的陈述值则不会;错误答案被纠正的次数远多于正确答案被放弃的次数。在是/否读出下,排名更加接近,并与压力导致的向“否”的转变纠缠在一起。因此,每个模型的一个分数可以比较不同模型和基准的不同行为。我们将这些依赖关系压缩成一个报告配置文件;仪器、记录和分析将在出版后发布。