论文

ReLiveGym:在数周的现实重播中评估长寿命Agent

ReLiveGym: Evaluating Long-Lived Agents over Weeks of Replayed Reality

智能体系统Agent任务评测长程任务评测

摘要

随着大语言模型(LLM)Agent的广泛采用,它们越来越多地被部署用于需要持续监控或重复操作(例如市场分析)的任务。这些Agent预计将在无人值守的情况下运行数天或数周,在正确的时间采取行动,并随着时间的推移适应动态环境。这些挑战在现有的长期Agent工作中并未得到充分体现,因为他们通常考虑不会随时间变化的静态环境。我们引入了 ReLiveGym,这是一种长期任务的诊断评估环境,其中Agent在按时间顺序重播的现实世界新闻、市场和社交媒体流的模拟周内稀疏地采取行动。这些任务涵盖不同级别的时间敏感性、推理强度和重复性。在八种基本语言模型中,我们研究了模型选择和工具设计如何影响Agent在此类长期任务上的性能。我们的结果表明,Agent如何确定何时采取行动是长期任务的重要Harness设计轴。最佳设计因任务不同而不同,有时模型选择也会不同。我们还评估从事后反馈中持续学习如何影响性能并解决在这些长期任务中观察到的故障模式。这些发现表明模型选择、动作计时机制和反馈的使用是设计长寿命Agent的重要考虑因素。代码:https://github.com/SaharaLabsAI/ReLiveGym