论文

Moira:面向配对交易的语言驱动分层强化学习

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading

智能体系统Agent 规划

摘要

许多序贯决策问题呈现分层结构:高层语义选择约束下游动作,且反馈延迟而模糊。这类 setting 的学习因贡献归因而困难:性能退化可能来自有缺陷的抽象、次优执行,或两者的交互。我们通过配对交易研究这一挑战——该领域天然结合了资产对选择的长程语义推理与部分可观测下的短程执行。我们将配对交易形式化为分层强化学习问题,并提出一种语言驱动的优化框架:高层与低层策略均由大语言模型(LLM)参数化,且仅通过提示更新进行优化。我们的方法把预训练 LLM 用作分层策略,利用轨迹级与回合级文本反馈来调整抽象与执行,无需基于梯度的微调。通过显式分离抽象选择与执行,该框架降低了分层之间的非平稳性,并支持在延迟反馈下做针对性适配。在真实市场数据上的实验显示,相比传统基线与基于 LLM 的基线均取得一致改进,验证了语言驱动分层强化学习的有效性。

Moira:面向配对交易的语言驱动分层强化学习:论文配图
图 1. 语言驱动的分层配对交易框架概述。高级选择器LLM使用聚合价格和语义信息选择资产对,为低级交易者LLM定义交易上下文,该低级交易者LLM根据短期市场观察执行市场中性操作。这两种策略都是具有冻结权重的提示条件语言模型,并通过文本反馈进行改进,交易者在片段内进行调整,选择器根据累积性能在片段之间进行更新。