论文
没有比现在更好的时间:LLM 代理的代理测试时间训练
No Time Like the Present: Agentic Test-Time Training for LLM Agents
摘要
LLM 智能体通常会在长时间的事件中退化:随着轨迹的增长,它们会重新访问已探索的状态,重复失败的操作,并丢失以前有效的策略。测试时训练 (TTT) 提供了一种使模型权重适应不断变化的任务状态的方法,但现有的 LLM TTT 方法在很大程度上只能适应固定输入。我们研究多回合代理事件中的连续 TTT,其中每次更新都会更改生成后续训练文本的策略。这创建了一个自我训练循环,当新的轨迹信息出现时,它会有所帮助,但当代理陷入困境并重复训练类似文本时,可能会放大漂移。我们发现更新文本重复区分了这些机制,并引入了 Agentic Test-Time Training (aTTT),这是一种 词元级 重新加权方法,可以减轻先前更新中重复 $n$-gram 中出现的标记的损失,同时保留新标记完全加权。为了在实时剧集中运行此类更新,我们使用 vLLM 的运行时 LoRA API 构建了一个并发服务系统,将开销限制为无 TTT 成本的 1.9倍。 aTTT 在 ALFWorld 上的成功率提高了 5.0 分,在 SWE-bench Lite 上提高了 4.9 分。收益集中在模型已经具备任务能力但在较长轨迹上漂移的地方,这表明 aTTT 主要保留现有能力而不是教授新能力。