论文

LLM中的认知缺失:探索量化计算基质的自我意识

Anosognosia in LLMs: Probing Self-Awareness of Quantized Computational Substrate

模型评测模型行为与机制分析

摘要

LLM能否识别其自身计算基质的退化?受失认症(一种患者无法识别自身能力损伤的神经系统疾病)的启发,我们研究了LLM是否能够识别量化引起的计算基质的退化。我们首先表明,即使提供了自己生成的文本作为外部提示,现有模型也无法自我报告其量化状态。线性探测表明,虽然生成的文本几乎没有量化痕迹,但内部表示包含清晰的、特定于方法的指纹。通过训练,模型通过比较学习识别严重退化的输出,例如 4 位模型的输出,但仍然无法从单个输出中做到这一点。跨量化级别联合训练的共享 LoRA 成功读出了内部指纹,但在看不见的量化方法上失败了,只是将特定于方法的指纹映射到标签。虽然外部自我观察可以在某些人类失认症情况下恢复意识,但我们的结果表明,在LLM中实现这种意识的更有希望的途径可能在于其内部表征。我们的结果强调了LLM自我监控的普遍性的基本限制。