论文
面向高频决策的 LLM:归一化动作奖励引导的一致性策略优化
LLMs for High-Frequency Decision-Making: Normalized Action Reward-Guided Consistency Policy Optimization
摘要
虽然大语言模型(LLM)是序列决策智能体开发的基石,但在高频决策任务上存在固有局限。现有研究主要聚焦状态空间低频变化、语义差异显著的离散具身决策场景(如家务规划)。这些方法在高频决策任务上表现受限,因为此类任务中的高精度数值状态信息以微小波动频繁更新,且习得的子任务与复合任务之间存在策略错位。为解决这些问题,本文提出归一化动作奖励引导的一致性策略优化(NAR-CP)。1)该方法先通过奖励函数从候选动作的环境反馈中获取预定义稠密奖励,再通过归一化完成奖励塑形,并从理论上验证动作奖励归一化不损害最优策略。2)为减少复合任务中的策略错位,我们用 LLM 推断子观测的候选动作并生成联合策略,以一致性损失确保全局语义策略与子语义策略精确对齐。在无人机追逃这一典型高频任务上的实验表明,该方法在独立与复合任务上均表现更优,并对未见任务具有出色泛化。
