论文
训练大语言模型以语言表达评估意识
Training LLMs to Verbalize Evaluation Awareness
摘要
评估意识 (EA) 可能会导致大语言模型 (LLM) 在审计期间与部署期间表现不同,但评估和核算 EA 仍然具有挑战性。我们引入了语言化训练(VT),这是一种使大语言模型不再对语言化评估意识保持沉默的方法,同时避免监督潜在信念本身。 VT 使用模型的自发言语作为意识存在的证据,并在言语之前立即截断每次rollout,生成模型被认为有意识的训练前缀。然后使用强化学习目标对模型进行训练,该目标旨在以校准的方式提高语言表达能力。在 Qwen3.6-35B-A3B、Kimi K2.6 和 Inkling 中,VT 将言语 EA 增加了 2.4-2.9 倍,并转移到保留的 Agentic 设置,而测量的潜在 EA 和行为基本保持稳定。在因果实验中,我们通过合成文档微调独立植入有关评估的元知识,并表明 VT 引发的言语反映了模型获得的更丰富的知识。