论文

LUMINA:多轮交互智能体的长程理解

LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents

智能体系统Agent任务评测

摘要

大语言模型在许多孤立任务上可以表现良好,但在需要规划、状态跟踪与长上下文处理等技能的多轮长程智能体问题上仍然吃力。在本工作中,我们旨在更好理解推进这些底层能力对这类任务成功的相对重要性。我们为多轮问题开发一个神谕反事实框架,该框架问:如果智能体能够利用神谕完美执行特定任务,它会有何表现?由神谕辅助引起的智能体表现变化,使我们得以衡量该神谕技能在未来 AI 智能体进展中的关键性。我们引入一套程序化生成的、复杂度可调的游戏式任务。这些受控环境使我们能提供精确的神谕干预,例如完美规划或无误状态跟踪,并能在没有真实世界基准混杂效应的情况下隔离每个神谕的贡献。我们的结果显示,虽然某些干预(例如规划)在各设定下持续改进性能,其他技能的有用性则取决于环境与语言模型的特性。我们的工作揭示多轮智能体环境的挑战,以指导未来 AI 智能体与语言模型的开发工作。

LUMINA:多轮交互智能体的长程理解
图1:问题形式化。(a) Oracle 增强的历史。在多轮任务中,我们研究在额外获得 oracle 协助时的基于 LLM 的智能体 π θ \pi_{\theta} 。我们可以利用一个或多个 oracle 来修改历史 h t h_{t} (语言模型的上下文)。(b) GridWorld 示例。在该示例中,智能体需要从初始的二维位置导航到目标位置。我们可以使用 oracle 𝒪 state {\mathcal{O}}^{\text{state}} 来总结当前位置(而不是让模型在每一轮进行反思式推理)。类似地,我们也可以使用 𝒪 plan {\mathcal{O}}^{\text{plan}} 来提示到达目标的路径点。(c) 历史剪枝。由于我们考虑的是马尔可夫决策过程, 𝒪 history {\mathcal{O}}^{\text{history}} 可用于改写任务描述,使动作的执行可以独立于先前的步骤。