论文
学习 LLM Web 代理的简单测试环境
Learning Simple Test-Time Environments for LLM Web Agents
摘要
大语言模型 (LLM) 代理在手动构建的环境中表现出了非凡的熟练程度,但当转换到复杂的现实世界设置时,它们的性能经常崩溃。现有研究很大程度上将这种退化归因于 LLM 在多个简单、结构良好的环境组合上的组合泛化差距。在这项工作中,我们建议 LLM Web 代理可以在测试时学习简单的环境观察。具体来说,我们引入了代理的试验步骤,将复杂的环境观察分解为子模块,并实现无标签学习方法,即测试时环境分解(TTED),以在推理过程中根据经验调整代理行为。我们的实证评估证明了该框架在综合基准和现实基准上的有效性,表明(1)可以有效地组合在更简单的子环境中获得的经验增益,以提高整个子环境的性能,(2)子环境的测试时训练可以显着增强代理在现实世界网络自动化任务中的组合泛化。我们还提供了无标签学习算法设计的关键见解。随着 LLM 代理访问更复杂的环境,我们相信在测试时学习环境分解技能对于稳健的实际部署至关重要。