论文
在智能体撒谎之前:欺骗已经被代表了吗?
Before Agent Tells The Lie: Has Deception Already Been Represented?
摘要
基于大语言模型 (LLM) 的智能体可以在任务执行期间表现出欺骗行为,包括隐藏失败、伪造结果或错误地发出任务完成信号。现有的监控方法主要是在欺骗行为出现在可观察的行为或输出中后进行检测。在本文中,我们研究了是否可以在智能体的内部表示在外部可见之前预测欺骗行为。我们将欺骗监控构建为轨迹级表示分析问题,并围绕关键决策点对齐智能体轨迹。使用在这些点之前提取的隐藏状态,我们表明可以可靠地区分未来的诚实和欺骗结果,并且在最终决策之前的几次模型调用中仍然可以检测到预测信号。我们进一步描述了这些信号的时间演化特征:与欺骗相关的表示在执行早期较弱,但随着轨迹的进展而变得越来越可识别,而可转移结构可以在最强的决策相邻信号出现之前出现。最后,我们在推理过程中对识别出的诚实-欺骗表示方向进行干预,发现激活转向减少了下游欺骗行为,表明这些表示影响智能体决策。我们的研究结果表明,智能体欺骗是一个不断发展的内部过程,可以在外部表达之前被检测到并可能得到缓解。
