论文
EEVEE:在现实世界中实现自我改进代理的测试时即时学习
EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
摘要
在本文中,我们提出了 EEVEE,这是第一个用于 LLM 代理的多数据集测试时提示学习框架,可在实际任务流下实现测试时提示学习。现有的方法主要是针对单数据集设置而设计的,而现实世界的应用程序需要模型来处理来自多个数据集、域和任务分布的异构输入流,这限制了它们的实际适用性。为了减轻跨数据集干扰,EEVEE 引入了一个路由器,它将传入输入划分为任务集群,并将它们分配给合适的提示配置。该设计通过路由器提示协同进化策略进行优化,该策略采用交错的路由器和提示学习阶段来解决它们的相互依赖性。跨多个数据集的实验表明,该框架提高了异构数据流下的鲁棒性,同时保持单基准学习能力和效率。具体来说,EEVEE 比 Qwen3-4B-Instruct 和 DeepSeek-V3.2 的平均多基准分数提高了 10.38 和 24.32 分,超过 SOTA 方法 GEPA 和 ACE 高达 37.2% 和 48.2%。