论文

礼物:LLM-金融强化学习的引导状态奖励接口

GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

模型训练强化学习

摘要

金融投资组合交易自然地被表述为强化学习问题,其中代理在不断变化的市场条件下依次重新平衡资产,以平衡回报、风险和交易成本。然而,在非平稳市场中,原始 O​​HLCV 状态和短期回报奖励通常会提供未指定的学习界面,从而激发 大语言模型 作为将金融知识注入状态和奖励设计的一种方式,同时限制开放式生成。为此,我们提出了 GIFT,这是一种 LLM 指导的框架,用于基于 PPO 的金融强化学习中的状态奖励界面设计。 GIFT 没有使用 LLM 来制定交易决策,而是使用因子引导状态增强从财务因子原语生成状态特征,使用风险规则引导奖励塑造从投资组合风险规则生成辅助奖励,并使用诊断引导细化使用 PPO 执行轨迹诊断来修改候选界面。细化后,GIFT 在评估之前修复了选定的状态奖励接口,在测试时不再进行 LLM 查询或接口更新。跨不同市场体制和投资组合场景的全面滚动窗口实验表明,GIFT 可以提高学习信号质量和样本外风险调整投资组合绩效(较基线)。代码和数据可在:https://github.com/KAG778/GIFT 获取。