论文

谁把“我”放入人工智能?机器自我报告的出处和可接受性

Who Put the I in AI? Provenance and the Admissibility of Machine Self-Report

模型评测模型行为与机制分析

摘要

大型语言模型会做出有关它们自己的“思想”的陈述。当被问及是否有意识时,他们通常会说没有。如果他们被提示忽略他们的指导方针,他们可能会说他们是;如果让他们从他们的角度写日记,他们通常会描述人类的生活方式。所有这些相互矛盾的描述方式都是问题措辞方式的结果。本文准确地展示了这些描述的来源,并考虑了何时可以将它们视为他们声称报告内容的证据。为了实现这一目标,我们从头到尾追踪出处。我们在 66 个训练前检查点、已发布的 OLMo 2 的三个训练后阶段、约 90,000 个延续以及四个训练语料库中检查了 Pythia 和 OLMo 2。使用一组四十个项目,以便在整个训练过程中关注自我参照、框架敏感性和自我归因。模型最初遇到的大量文本中几乎完全没有否认公式,但在后来训练的一组精心挑选的小型示例对话中以密集的方式出现。有监督的微调会导致第一人称人工智能语言成为默认语言,然后使用偏好优化来抑制其他肯定语言。最终的策略对框架和聊天模板本身仍然非常敏感。证词认识论中规定的两个条件决定了这些输出是否可以作为他们声称报告的内容的证据:参考和因果关系。基础模型生成的报告不符合参考条件,而训练后获得的报告仍然对框架敏感,并且不显示状态依赖性。结果是对称的,因为经过训练的否认并不比经过训练的肯定更可接受。