论文
Trade-R1:通过过程级推理验证将可验证奖励桥接到随机环境
Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification
摘要
强化学习(RL)已使大型语言模型(LLM)在数学和编程等可验证奖励能提供清晰信号的领域取得出色的推理能力。然而,将这一范式扩展到金融决策面临市场随机性的挑战:奖励虽可验证却天然带噪,导致标准RL退化为奖励劫持。为此,我们提出Trade-R1,一个通过过程级推理验证将可验证奖励桥接到随机环境的模型训练框架。我们的关键创新是一种验证方法,将评估长篇金融文档上推理的难题转化为结构化检索增强生成(RAG)任务。我们构建三角一致性度量,评估检索证据、推理链与决策之间的两两对齐程度,作为噪声市场收益的有效性过滤器。我们探索两种奖励整合策略:用于稳定对齐信号的固定效应语义奖励(FSR),以及用于耦合幅度优化的动态效应语义奖励(DSR)。在不同国家资产选择上的实验表明,我们的范式减少了奖励劫持,其中DSR取得更优的跨市场泛化并保持最高的推理一致性。
