论文

自我报告不能识别自我模型:反事实报告的可识别性测试

Self-Reports Do Not Identify Self-Models: An Identifiability Test for Counterfactual Reports

模型评测模型行为与机制分析

摘要

语言模型自我报告是有关即时环境中行为的证据,而不是自我模型本身的证据。我们调查了关于激活干预下类情感状态的反事实报告,并询问当演示环境发生变化时,该报告是否仍然与指定的干预相关。在三个开放教学模型中,错误源演示将报告移向源答案系列,而显式机制绑定则减少了这种拉动。在将准确性作为自主报告机制的证据之前,自我报告基准应包括固定干预下的环境变化不变性测试。