论文

OOM-RL:面向基于LLM的多智能体系统的资金耗尽强化学习市场驱动对齐

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

模型训练强化学习Agentic RL

摘要

面向自主软件工程的多智能体系统(MAS)的对齐受制于评估者的认知不确定性。当前范式,如基于人类反馈的强化学习(RLHF)与基于AI反馈的强化学习(RLAIF),经常诱发模型谄媚,而基于执行的环境则受制于无约束智能体的对抗性“测试规避”(Test Evasion)。本文提出一种客观对齐范式:资金耗尽强化学习(Out-of-Money Reinforcement Learning,OOM-RL)。通过将智能体部署到非平稳、高摩擦的真实金融市场中,我们把资本的严重耗尽用作不可被攻破的负梯度。我们为期20个月的纵向实证研究(2024年7月至2026年2月)记录了系统从高换手、谄媚的基线演化为稳健的流动性感知架构的历程。我们证明,金融亏损这种不容抵辩的本体论后果迫使MAS放弃过拟合的幻觉,转而采用严格测试驱动智能体工作流(Strict Test-Driven Agentic Workflow,STDAW);该工作流强制实施受拜占庭容错启发的单向状态锁(RO-Lock),锚定于经确定性验证的≥ 95%代码覆盖率约束矩阵。结果显示,尽管早期迭代经历了严重的执行衰减,最终经OOM-RL对齐的系统在成熟期达到稳定均衡,年化夏普比率为2.06。我们的结论是:以严格的经济惩罚替代主观人类偏好,为在高风险真实环境中对齐自主智能体提供了一种稳健方法,并为计算计费充当客观物理约束的普适范式奠定了基础。

OOM-RL:面向基于LLM的多智能体系统的资金耗尽强化学习市场驱动对齐:论文配图
图 1:摩擦冲击(第 1 阶段)。每天的实时执行揭示了 Sim2Real 的严重差距。该策略受到微观结构摩擦的影响,导致显着的回撤和回报停滞,成为调整的主要负面反馈。