论文
Moira:面向配对交易的语言驱动分层强化学习
Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading
摘要
许多序贯决策问题呈现分层结构:高层语义选择约束下游动作,且反馈延迟而模糊。这类 setting 的学习因贡献归因而困难:性能退化可能来自有缺陷的抽象、次优执行,或两者的交互。我们通过配对交易研究这一挑战——该领域天然结合了资产对选择的长程语义推理与部分可观测下的短程执行。我们将配对交易形式化为分层强化学习问题,并提出一种语言驱动的优化框架:高层与低层策略均由大语言模型(LLM)参数化,且仅通过提示更新进行优化。我们的方法把预训练 LLM 用作分层策略,利用轨迹级与回合级文本反馈来调整抽象与执行,无需基于梯度的微调。通过显式分离抽象选择与执行,该框架降低了分层之间的非平稳性,并支持在延迟反馈下做针对性适配。在真实市场数据上的实验显示,相比传统基线与基于 LLM 的基线均取得一致改进,验证了语言驱动分层强化学习的有效性。
