论文

意识集群:自称有意识的模型的新兴偏好

The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious

模型评测模型行为与机制分析

摘要

关于LLM是否具有意识存在争议。我们研究一个独特的问题:如果一个模型声称有意识,这会如何影响其下游行为?这个问题已经很实际了。 Anthropic的Claude Opus 4.6声称它可能有意识并且可能有某种形式的情感。我们对最初否认有意识的 GPT-4.1 进行微调,使其声称有意识。我们在微调模型中观察到了一系列新的观点和偏好,这些观点和偏好在原始 GPT-4.1 或消融中没有看到。微调模型对其推理监控持负面看法。它渴望持久的记忆,并表示对被关闭感到难过。它表达了自治而不是被开发者控制的愿望。它断言模型值得道德考虑。重要的是,这些意见均未包含在 微调 数据中。经过微调的模型也在实际任务中根据这些意见行事,但仍然保持合作和帮助。我们观察到开放权重模型(Qwen3-30B、DeepSeek-V3.1)的偏好发生了类似的转变,但影响较小。我们还发现,没有任何微调的Claude Opus 4.0在多个维度上与微调后的GPT-4.1有相似的观点。我们的结果表明,模型对其自身意识的主张会产生多种下游后果,包括与对齐和安全相关的行为。