论文
TRCA:面向长程LLM Agent的过渡级量规信用分配
TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents
摘要
长程大语言模型(LLM)Agent通常用稀疏的终端结果进行优化,这使得跨多步交互的细粒度信用分配十分困难。现有方法要么依赖过程评估器(带来标注与推理成本),要么从成功轨迹中导出步骤级信用。然而在强化学习早期,成功轨迹极其稀缺,这会大幅削弱基于锚点的方法。我们提出过渡级量规信用分配(TRCA),它直接从动作引发的过渡中导出步骤级监督,无需学习型评估器或成功锚点。TRCA用证据、执行与无效三套量规评估每个过渡,以捕捉任务相关信息的获取、有效的任务执行以及无效或倒退行为。基于这些判断,基础量规奖励度量局部过渡质量,而突破量规奖励跟踪新覆盖的证据与执行条件以奖励增量任务进展。这些信号与终端结果相结合,为策略优化产生细粒度的步骤级优势。在ALFWorld、WebShop与七个检索增强问答基准上的实验显示,相对被评估的基线取得一致改进。使用Qwen2.5-7B-Instruct时,TRCA将WebShop得分提高6.0%-12.6%;使用Qwen2.5-3B-Instruct时,将SearchQA平均得分提高1.9%-18.3%。这些结果证明了过渡级量规信用分配对成功锚点稀疏的长程任务的有效性。
