论文
LUMINA:多轮交互智能体的长程理解
LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents
摘要
大语言模型在许多孤立任务上可以表现良好,但在需要规划、状态跟踪与长上下文处理等技能的多轮长程智能体问题上仍然吃力。在本工作中,我们旨在更好理解推进这些底层能力对这类任务成功的相对重要性。我们为多轮问题开发一个神谕反事实框架,该框架问:如果智能体能够利用神谕完美执行特定任务,它会有何表现?由神谕辅助引起的智能体表现变化,使我们得以衡量该神谕技能在未来 AI 智能体进展中的关键性。我们引入一套程序化生成的、复杂度可调的游戏式任务。这些受控环境使我们能提供精确的神谕干预,例如完美规划或无误状态跟踪,并能在没有真实世界基准混杂效应的情况下隔离每个神谕的贡献。我们的结果显示,虽然某些干预(例如规划)在各设定下持续改进性能,其他技能的有用性则取决于环境与语言模型的特性。我们的工作揭示多轮智能体环境的挑战,以指导未来 AI 智能体与语言模型的开发工作。
