论文

TEMPO:通过模式分离策略优化进行临时执行,实现可信赖的 LLM 回测

TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

模型训练强化学习

摘要

对历史事件进行回测 大语言模型 需要仅根据指定截止日期之前可用的信息进行推理。然而,模型经常将 预训练 中的截断后知识泄漏到其推理中,从而夸大了表面上的准确性并破坏了评估的有效性。当被抑制的内容与预测有因果关系时,基于提示的约束会失败,并且知识学习无法解决此问题,因为时间合规性是特定于实例的:同一事实可能是一个截止日期的合法证据,而另一个事实可能是违规的证据。该模型必须学习时间规则,而不是删除知识:根据每个实例的截止日期选择证据。我们提出了 TEMPO(通过模式分离策略优化进行时间执行),它通过两个贡献来训练该学科:(1)两种模式奖励,其中泄漏模式将截止后索赔归零,作为性能模式优化任务性能之前的硬性先决条件; (2) 基于 GRPO 的训练管道,使模型能够发现暂时有效的推理策略。我们证明,训练单调地减少泄漏,收敛到无泄漏最优,并在达到合规性后提高任务性能。在三个预测任务和两个模型上,TEMPO 在所有条件下将泄漏从 2~13% 减少到 0.6~3.7%,在存在强预截止信号并维持预测任务本身很难仅依靠有效信息的情况下,任务性能提高了 6~13%。