论文
大语言模型 中的时间偏好概念及其功能
Temporal Preference Concepts and their Functions in a Large Language Model
摘要
大语言模型 (LLM) 越来越多地被用来做出需要权衡短期收益和长期后果的决策,但人们对它们内部如何表示或解决这些权衡知之甚少。在这项工作中,我们在蒸馏的 LLM (Qwen3-4B-Instruct-2507) 中因果地定位了时间偏好的底层子图,通过融合基于梯度的归因和激活修补的证据来识别中上层节点。我们发现时间范围的几何形状被编码在预期局部层的残差流中。行为分析表明,不受干预的 LLM 对未来的折扣比人类低几倍,但这种偏好在不同环境中不稳定,会激发显性控制而不是隐性依赖训练。最后,我们发现了有启发性的证据,表明转向向量可以改变时间偏好。我们的工作展示了机械可解释性如何使我们更接近于可靠地控制 LLM 的计划和推理方式