论文
Tropical RL最大化代数
Tropical Reinforcement Learning
摘要
大语言模型的强化学习通常最大化期望回报,把所有成功轨迹的概率相加。但经典求和形式只能报告模型策略多常成功,不能报告哪个解真正奏效;且由于概率求和为一,强化一个解可能让模型忘掉另一个从未被证明错误的解。这使期望回报不适合组合推理——组合推理需要把模型在分离且常常失败的尝试中产出的推理步骤拼装起来。为此我们提出Tropical强化学习:不再相加备选解的概率,而是取其最大值,这给出热带半环。状态价值于是成为其最可能已验证解的对数概率,并附带一条可重放复用的显式路径。这使真正的组合成为可能:在共享状态相遇的最优前缀与最优后缀即使来自不同rollout也能拼接。为付诸实践,我们提出TROPIC,一种面向确定性、可重置且结果可验证环境的训练算法。在四个Agentic 智能体任务(Sokoban、Countdown、FrozenLake、WebShop)上,TROPIC超过最强同策略基线至多16个百分点。改变强化学习的代数而不只是估计器,可以实质改善语言模型的组合推理。