论文

OLIVIA:通过推理时动作自适应的在线学习优化LLM ReAct智能体决策

OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents

智能体系统Agent 规划

摘要

大语言模型智能体通过交替进行推理、动作选择与观察来解决序贯决策任务。在智能体反复处理相关多步任务的部署场景中,微小的动作选择误差会累积为浪费的工具调用、延迟与可靠性下降。尽管部署时改进的需求明确,现有的LLM智能体推理时自适应方法主要依赖提示或检索,通过操纵上下文间接影响行为。对于ReAct风格智能体,这类方法没有暴露一个可对候选动作打分、表示不确定性、并能依据动作级反馈在线更新的显式决策层。因此,它们对部署期间可追踪、细粒度、不确定性感知的自适应支持有限。我们提出OLIVIA,一个面向ReAct风格智能体的推理时动作自适应框架。OLIVIA将LLM的最终动作选择层建模为候选动作上的上下文线性老虎机(bandit),以冻结的隐藏状态作为决策上下文。这一选择特别适合部署,因为它直接在动作选择接口处适配行为、保留底层推理过程,并提供显式的不确定性估计与基于动作级反馈的轻量在线更新。借助置信上界(UCB)探索,OLIVIA以样本高效的方式改进策略,计算开销极小。我们在四个基准上实例化OLIVIA,显示其相对静态ReAct与基于提示的推理时基线持续提升任务性能。结果表明,显式在线决策层为LLM智能体部署期间提供了纯提示式或检索式自适应之外的有效替代。

OLIVIA:通过推理时动作自适应的在线学习优化LLM ReAct智能体决策:论文配图
图 1:OLIVIA 概述。左:冻结的 LLM 主干通过其转换器层处理任务和轨迹前缀,产生隐藏状态和推理轨迹(思想)。右:在每个动作选择步骤中,OLIVIA 提取最后一层隐藏状态作为决策上下文,并使用每个动作 UCB 估计对候选工具进行评分。