论文

突破环境之墙:为递归自我改进演化LLM智能体环境

Breaking the Environment Wall: Evolving LLM Agent Environments for Recursive Self-Improvement

智能体系统Agent 环境交互

摘要

许多真实世界任务(如办公工作流、科学实验)要求LLM智能体与其环境反复交互以进行上下文相关的操作。然而,这样的环境往往并未为智能体做好准备。首先,信息常常分散、碎片化地分布在环境中。其次,环境中的相关证据常与误导性信息和冲突版本混杂。第三,环境随时间演化,引入新噪声和更具挑战性的任务。这些挑战会显著降低最先进AI智能体的性能(例如从83.9%降至57.6%)。为应对这些挑战,我们提出Env-Rethink(一个基于27B后训练模型的系统),支持三项主要能力:(1)自适应构建Collection Maps(组织相关文件)和Event Logs(为跨数据关系提供上下文)以补充必要上下文;(2)进一步利用后训练模型(通过离线轨迹学习)识别环境中的潜在噪声问题;(3)最终通过虚拟事件历史演化环境,改变环境状态和证据关系,产生更棘手的环境以促进智能体进一步改进。实验表明,Env-Rethink能有效提升下游任务性能(在30个任务上跨九个模型的rubric通过率提升超过15.1%)。

突破环境之墙:为递归自我改进演化LLM智能体环境:论文配图
图1:AI Agent 的环境瓶颈。(a)30个任务中2004个噪声文件的特征;(b)三类常见的 Agent 失败模式;(c)干净与含噪环境中的评测检查通过率。