论文

TTSE:双轨在线自我进化框架

TTSE: A Two-Track Online Self-Evolution Framework

智能体系统上下文与知识记忆Agent Skills智能体自我改进Agent记忆

摘要

随着大型语言模型(LLM)智能体应用于持续交互的环境中,驱动自身能力的进化成为实现长期自治的核心问题。目前,环境知识通常被视为外部固定输入,而不是智能体持续进化的一部分。强化学习方法通​​常通过环境交互来优化策略,但往往只适应固定的任务分布或单一环境。本文提出TTSE(Two-Track Self-Evolution),一种双轨在线自进化框架,将进化知识分为FACT(环境事实,其可靠性通过交互证据不断验证)和TIP(任务条件执行程序)。从决策理论的角度来看,我们将智能体的超额风险分解为环境表示遗憾和条件执行遗憾,描述环境条件策略严格优于条件不可知策略的条件,并根据事实识别错误和跨条件不匹配成本限制下游风险。在实践中,TTSE在GDPevo上的消融实验验证了双轨进化的优势。在经典的代理任务基准 ALFWorld 和 ScienceWorld 上,TTSE 进一步展示了卓越的任务适应能力。而且,TTSE与现有的技能自我进化方法广泛兼容;与贝叶斯代理算法相结合,单轨消融验证了双轨优势,与三个独立重复相比,显着提高了 SOPBench 五个主要领域的总分。最后,在真正的端到端任务基准 PinchBench 上,TTSE 通过基于检索的注入集成到通用代理框架中,并在三个独立运行中稳定优于基线。