论文

教会大语言模型何时不知道:学习时间性批判以实现事前推理

Teaching Large Language Models When Not to Know: Learning Temporal Critique for Ex-Ante Reasoning

模型训练奖励建模与过程监督

摘要

大语言模型(LLM)在时间截断下的推理常常失败:当被要求从更早时间点的立场作答时,它们会利用之后才可获得的知识。我们从事前推理(ex-ante reasoning)的视角研究这一失败:模型必须完全依赖截断点之前可知的信息。通过对提示层面干预的系统分析,我们发现时间泄露对截断点的表述方式和指令位置高度敏感:显式的截断陈述优于隐式的历史式框架,前缀约束比后缀约束更能有效减少泄露。这些发现表明,提示可以引导模型进入时间框架,但并不能赋予其验证某个回答在时间上是否可被接受的能力。我们进一步论证监督微调并不足够,因为事前正确性并非答案的内在属性,而是答案与截断点之间的关系。为填补这一空白,我们提出TCFT,一个时间批判微调(Temporal Critique Fine-Tuning)框架,训练模型习得具备截断点意识的时间验证能力。给定一个查询、一个截断点和一个候选回答,TCFT教会模型识别截断点后的泄露、解释时间边界违规,并判断时间可接受性。在Qwen2.5-7B-Instruct和Qwen2.5-14B-Instruct上的实验表明,TCFT持续优于提示和SFT基线,平均泄露分别降低41.89和37.79个百分点。

教会大语言模型何时不知道:学习时间性批判以实现事前推理:论文配图
图1:事前推理任务总览:SOTA模型存在时间性泄露,对比提示防御与学习式「知止」训练。