论文

S3Gym:LLM能否将自我检验、自我判断转化为自我提升?

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

智能体系统Agent任务评测

摘要

大语言模型(LLM)越来越多地与外部环境交互并积累了大量的行为经验,但现有的代理基准大多将其评估为固定策略。因此,目前尚不清楚智能体是否可以主动测试其行为,判断由此产生的体验,并利用该经验来改进未来的决策。我们引入了 \textbf{S\textsuperscript{3}Gym},这是一个交互式基准,用于通过三个耦合功能来评估 LLM 自我改进:\textbf{自我测试}、\textbf{自我判断} 和 \textbf{自我改进}。 S$^3$Gym 将宽松的探索与严格的保留评估分开,并在七个带有可执行环境验证器的基于文本的游戏中实例化该协议。我们评估了整合交互体验的三种途径:直接历史 ICL、分数条件总结记忆和参数训练。我们的实验表明,自我完善既不是自动的,也不是统一的。上下文级别的经验可以提高多个模型 - 游戏对的性能,但最有效的途径在很大程度上取决于任务结构:当经验可以压缩为可重用的策略规则时,摘要是有益的,但当成功取决于精确的状态相关信息时,摘要通常会表现不佳。参数训练在某些任务上产生了显着的收益,但在其他任务上也表现出不稳定的改进和严重的负迁移。这些发现表明,仅仅认可成功的行动是不够的;智能体还必须将反馈转化为可执行和可转移的政策。 S$^3$Gym 提供了一个统一的框架来诊断此过程并识别阻止代理将交互体验转化为可靠的自我改进的瓶颈。