论文

Agentic-TTT:测试时训练的训练测试时策略

Agentic-TTT: Training test-time policy for test-time training

智能体系统模型训练持续学习Agent 工具调用智能体自我改进

摘要

测试时训练 (TTT) 使用从测试输入得出的信号来调整 LLM 的参数,并且可以在预先指定的设置(例如 IMO 竞赛或指定的开放问题)中做出显着改进。通过将部署经验转化为参数更新,TTT提供了模型级自我改进的直接机制。然而 TTT 并非普遍有益:每种 TTT 算法都在不同的设置下工作,应用不合适的方法可能会浪费测试时间计算,甚至损害模型性能。因此,这种参数级的自我改进需要代理:模型必须决定何时需要 TTT、调用哪种算法以及是否可以重用现有技能。为了填补这一空白,我们引入了 Agentic-TTT,它学习测试时策略来管理这些决策。 Agentic-TTT 将 TTT 程序转变为可调用工具,将积累的技能视为不断发展的部署环境,并使用从其决策中观察到的效用收益来训练其策略。在我们的基准测试中,Agentic-TTT 的效用几乎是 主干模型,学习在实用性与计算之间进行权衡,并推广到训练期间未见过的领域。总之,这些结果指向自主的自我改进:可以决定如何从自己的部署经验中学习的模型。