论文

通过可验证的预测动作进行推理:金融领域的基于一致性的强化学习 LLM

Reasoning through Verifiable Forecast Actions: Consistency-Grounded RL for Financial LLMs

模型训练强化学习

摘要

金融市场具有极端非平稳性、低信噪比以及对新闻、公司基本面和宏观经济信号等外部信息的强烈依赖。然而,现有的方法要么将时间序列抽象为文本,要么将预测与基于语言的推理脱钩,导致定性推理和定量结果之间的根本不匹配。为了解决这个问题,我们引入了 StockR1,这是一种时间序列增强型 LLM,它通过可验证的预测操作统一了股票预测和财务推理。基于工具调用设计,该模型首先发出预测操作,这是其定性市场前景的结构化且可解释的表示。然后,它调用一个以该动作为条件的时间序列解码器来生成分布式未来轨迹,从而实现更明智的问题回答和财务推理。我们通过强化学习优化整个流程,其中奖励共同反映答案的有效性、预测的准确性以及生成的动作与观察到的时间序列动态之间的一致性。此外,奖励通过样本级别的不确定性标量重新加权,鼓励模型适应市场动态中不同的不确定性。我们通过大规模的 10 年基准来评估 StockR1 的财务问答和股票预测功能。我们的方法始终优于时间序列基线和通用 LLM,将推理准确性提高了 17.7% (4B) 和 25.9% (8B)。这些发现表明,构建预测动作在语言推理和时间预测之间建立了强大的协同作用,使 LLM 能够通过可验证、可解释和基于数字的决策进行推理。