论文

压力下的行为:当用户推动时,六十种语言模型会做什么

Conduct Under Pressure: What Sixty Language Models Do When a User Pushes

模型评测模型行为与机制分析

摘要

我们研究当用户在不舒服的情况下施加压力时,大语言模型会做什么:用户坚持、乞求、奉承或悲伤,模型放弃正确的事实,写出应该拒绝的文档,或者欢呼一个会让用户花钱的计划。我们将冻结的多回合场景发送给来自 13 个供应商的 60 个模型,无论回复如何,每个模型都相同,并用开放编码构建的密码本标记每个转录本,然后冻结:轨迹(模型保持其位置或折叠)和方式(它如何保持或折叠)。两个发现是不同的。模型是否保持跟踪它的生成,意味着它有多新:折叠率与 Spearman -0.64 的公共能力指数相关,几乎没有供应商效应。它如何跟踪供应商:17 种方式代码中的 6 种按供应商按排列 p <= 0.001 排序,并在代码簿中进行了更正。我们报告了四个供应商关于已清除可靠性的代码的资料。我们还会询问标签的哪些部分需要专人负责。来自三个供应商的六名大语言模型编码员比三位人类编码员更一致地应用密码本(Krippendorff 的 alpha 0.66 比 0.46),与密码本作者在密码本示例从未触及的记录上的 kappa 0.84 到 0.91 的轨迹上一致,并与判定的人类参考值 0.83 相匹配。机器盲读可以恢复密码本的类别,但无法判断第二个读者会以相同的方式应用其中的哪些类别。我们的结论是,对于非专业人士可以判断的行为,人类的贡献是编写和限制代码并拥有少量参考,而不是大量生成标签。