论文
对自己来说是陌生人:语言模型对自己的描述是通用的
Strangers to Themselves: What Language Models Say About Themselves Is Generic
摘要
语言模型可以流畅地描述它们的行为方式:它们是否会屈服于阻力、滥用工具或在压力下撒谎。该描述实际上是关于模型说话的吗?我们将自我认识转变为预测测试。通过九项行为评估,我们测量模型在不同条件下的行为,要求它预测这些比率,并将其预测与将自我从问题中移除的控制进行比较。我们发现:(i)直接自我报告很弱(r = +0.04),即使向模型显示确切的项目也只能将预测提高到 +0.24。至关重要的是,关于“一般情况下有能力的人工智能代理”的相同项目信息问题也同样有效(+0.28),而其他模型关于自身的答案至少可以预测目标模型以及它自己的模型。 (ii) 前沿规模并没有明显改变这种模式:预测中的任何收益都不是自我特定的,并且与人工智能助手如何行为的更好理论一致,而不是与更好的自我知识一致。 (iii) 第一人称框架确实有一个强大的效果:它将报告转向奉承的方向,低估了与通用代理的同一问题相关的有害行为。 (iv) 对模型自身的行为记录进行微调可以教授狭隘的自我预测,但它也会改变所预测的行为,并且收益不会广泛转移。实际意义很简单:询问一个模型它会做什么,主要揭示了人工智能助手的一般理论,加上有利的偏见,而不是对该模型的特权知识。