论文

面向高频决策的 LLM:归一化动作奖励引导的一致性策略优化

LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization

模型训练强化学习Agentic RL

摘要

虽然大语言模型(LLM)是序列决策智能体开发的基石,但在高频决策任务上存在固有局限。现有研究主要聚焦状态空间低频变化、语义差异显著的离散具身决策场景(如家务规划)。这些方法在高频决策任务上表现受限,因为此类任务中的高精度数值状态信息以微小波动频繁更新,且习得的子任务与复合任务之间存在策略错位。为解决这些问题,本文提出归一化动作奖励引导的一致性策略优化(NAR-CP)。1)该方法先通过奖励函数从候选动作的环境反馈中获取预定义稠密奖励,再通过归一化完成奖励塑形,并从理论上验证动作奖励归一化不损害最优策略。2)为减少复合任务中的策略错位,我们用 LLM 推断子观测的候选动作并生成联合策略,以一致性损失确保全局语义策略与子语义策略精确对齐。在无人机追逃这一典型高频任务上的实验表明,该方法在独立与复合任务上均表现更优,并对未见任务具有出色泛化。

面向高频决策的 LLM:归一化动作奖励引导的一致性策略优化
图1:方法概览。(a) 通过一致性损失减小子任务联合策略 π J \pi_{J} 与复合策略 π F \pi_{F} 之间的偏差。(b) 通过对原始密集奖励应用动作奖励归一化(Action Reward Normalization),我们动态放大奖励方差并恢复梯度信号的有效性。