论文

通过对比激活叠加引导Qwen3的跨期偏好

Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition

模型评测模型行为与机制分析

摘要

我们研究了大语言模型Qwen3-32B中的时间跨度的线性表示,并使用这些线性表示来改变模型的时间相关偏好、推荐和能力。我们在教师强迫的时间选择答案上训练对比线性探针,以在模型残余流中找到短期与长期的方向,并在保留任务上的对比激活加法引导下评估一个保留任务上的二元时间选择任务,以及一个超出分布的货币间期时间选择任务,最后是一个旅行规划能力基准。主要结果是时间跨度方向可以通过简单的对比线性探针识别,并然后用于引导以诱导大规模、双向的时间偏好变化。在一个奖励大小和延迟不同的超出分布的任务上,引导显著地改变了模型的中立阈值,在两个方向上对较小的更快的奖励与较大的更晚的奖励之间的差异。我们进一步展示了在适度时间引导下对规划相关能力指标的改进。这些结果表明模型的时间间断偏好是可以测量和可引导的,这对于涉及延迟成本和收益的AI系统以及关于长期规划的安全问题都是相关的。

通过对比激活叠加引导Qwen3的跨期偏好:论文配图
图 1:来自探针变化实验的分层显式训练探针精度。左图报告了明确的测试集准确性;右面板报告了完整的隐式集精度。