论文
从动作到理解:LLM智能体中时间概念的保形可解释性
From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents
摘要
大语言模型(LLM)正越来越多地被部署为能够在交互环境中进行推理、规划与行动的自主智能体。尽管其执行多步推理与决策任务的能力不断增强,但引导其序列行为的内部机制仍然不透明。本文提出了一个通过逐步保形(conformal)视角来解释LLM智能体中概念时间演化的框架。我们提出了面向时间任务的保形可解释性框架,它将逐步奖励建模与保形预测(conformal prediction)相结合,以统计学方式将模型在每一步的内部表征标注为成功或失败。随后在这些表征上训练线性探针(linear probes),以识别时间概念的方向——即模型激活空间中对应于一致的成功、失败或推理漂移概念的潜在方向。在ScienceWorld和AlfWorld两个模拟交互环境上的实验结果表明,这些时间概念是线性可分的,揭示了与任务成功相一致的可解释结构。我们进一步展示了初步结果:利用所提框架引导模型内部已识别出的成功方向,从而提升LLM智能体的性能。因此,所提方法为基于LLM的智能体提供了一种有原则的早期失败检测与干预方法,为在复杂交互环境中构建可信赖的自主语言模型铺平了道路。
