论文
评估意识随着模型规模从格式转向情境
Evaluation Awareness Shifts from Format to Context with Model Scale
摘要
评估意识对模型评估构成了前所未有的威胁,但模型检测它的机制仍然未知。本研究的重点是确定这一点并确定较小模型和较大模型之间的对比机制。虽然较小的模型使用提示的格式敏感性来检测评估,但较大的模型通常依赖于高阶推理来检测它。我们使用思想链分析、表征探测和积分梯度归因评估了 Gemma 3(1B、4B 和 12B)、Phi-3(Mini 和 Medium)和 Llama-3 8B。受这些发现的启发,我们提出了一种双途径干预,将及时清理与激活反引导相结合,以抑制外部评估触发因素及其内部表征。在 200 个高度评估感知的提示中,我们的方法实现了 70.58% 的平均行为翻转率,始终优于单独的任何一种干预。这些结果提供了关于评估意识如何在紧凑语言模型中发展的新见解,并表明有效的缓解措施需要共同解决提示级别和表示级别的问题,可以在此 \href{this https URL}{Github 存储库}中找到此 http URL 和代码库。