论文

上下文神经反馈:大语言模型能否通过特权访问控制自身内部表示?

In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access?

模型评测模型行为与机制分析

摘要

大语言模型(LLM)是否能够控制自己的内部表示对于机器元认知和人工智能安全都很重要。最近的一项研究将神经反馈应用于LLM,并声称他们可以控制自己的内部表征。然而,所报告的控制可能依赖于肤浅的机制,而不是真正的内部访问,因为该研究中的控制目标没有特权,这意味着第三方可以从提示中推断出它们。我们重新设计了LLM的神经反馈范式,使控制目标满足特权访问要求,这更接近人类认知神经科学中的神经反馈实验。在这种更严格的设置下,模型没有表现出对特权内部表示的可靠控制,这表明先前报告的控制不能排除它依赖于表面机制的可能性。我们的结果表明,对LLM元认知的严格评估需要需要特权访问的评估方法。