论文

从动作到理解:LLM智能体中时间概念的保形可解释性

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

模型评测模型行为与机制分析

摘要

大语言模型(LLM)正越来越多地被部署为能够在交互环境中进行推理、规划与行动的自主智能体。尽管其执行多步推理与决策任务的能力不断增强,但引导其序列行为的内部机制仍然不透明。本文提出了一个通过逐步保形(conformal)视角来解释LLM智能体中概念时间演化的框架。我们提出了面向时间任务的保形可解释性框架,它将逐步奖励建模与保形预测(conformal prediction)相结合,以统计学方式将模型在每一步的内部表征标注为成功或失败。随后在这些表征上训练线性探针(linear probes),以识别时间概念的方向——即模型激活空间中对应于一致的成功、失败或推理漂移概念的潜在方向。在ScienceWorld和AlfWorld两个模拟交互环境上的实验结果表明,这些时间概念是线性可分的,揭示了与任务成功相一致的可解释结构。我们进一步展示了初步结果:利用所提框架引导模型内部已识别出的成功方向,从而提升LLM智能体的性能。因此,所提方法为基于LLM的智能体提供了一种有原则的早期失败检测与干预方法,为在复杂交互环境中构建可信赖的自主语言模型铺平了道路。

从动作到理解:LLM智能体中时间概念的保形可解释性:论文配图
图 1:A. 我们考虑经过训练以在复杂环境中执行顺序任务的 LLM 代理的时间可解释性问题。 B. 提出的框架将逐步奖励建模与保形标签相结合,以区分每个时间步的成功和失败。线性探针在模型的内部表示上进行训练,以测试成功和失败的逐步概念在表示空间内线性可分的假设。