论文
分类器上下文腐化:监控性能随上下文长度下降
Classifier Context Rot: Monitor Performance Degrades with Context Length
摘要
使用语言模型监控编码智能体的危险行为,需要对常常超过500K token的对话记录进行分类,但以往的智能体监控基准很少包含长于100K token的记录。我们表明,当被用作分类器时,当前前沿模型在更长的对话记录中更常漏检危险动作。特别是在一个需要识别编码智能体何时做出隐蔽危险动作的数据集上,当这些动作发生在800K token的无害活动之后时,Opus 4.6、GPT 5.4与Gemini 3.1漏检它们的频率比其单独出现时高$2\times$至$30\times$。我们还表明,这些弱点可以通过在记录全程设置周期性提醒等提示技术得到部分缓解,并可能通过更好的后训练进一步缓解。未考虑长上下文退化的监控评估很可能高估监控性能。
