论文

CORPGEN:以自主数字员工在多视界任务环境中模拟企业环境

CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments

智能体系统上下文与知识记忆Agent 架构与控制循环Agent记忆

摘要

长视界推理是自主智能体的关键挑战,但现有基准都在孤立的单任务上评估智能体。真实的组织工作需要管理许多并发的长视界任务,这些任务相互交织、存在依赖且需要重新排定优先级。我们提出多视界任务环境(MHTEs):一类独特的问题,要求在持续数小时的持久执行上下文中,对数十个相互交织的任务(45 个以上、500-1500+ 步)进行连贯执行。我们识别出四种失败模式,它们使基线 CUA(计算机使用智能体)在负载从 25% 增至 100% 时完成率从 16.7% 降至 8.7%,该模式在三个独立实现中一致出现。这些失败模式是上下文饱和(O(N) 对 O(1) 增长)、记忆干扰、依赖复杂性(DAG 对链式)以及重新排定优先级的开销。我们提出 CorpGen,一个与架构无关的框架,通过分层规划实现多视界目标对齐、通过子智能体隔离防止跨任务污染、通过分层记忆(工作、结构化、语义)以及自适应摘要来应对这些失败。CorpGen 通过具有持久身份和真实日程的数字员工来模拟企业环境。在 OSWorld Office 上跨三个 CUA 后端(UFO2、OpenAI CUA、分层式),CorpGen 相比基线取得最高 3.5 倍的提升(15.2% 对 4.3%),且负载增加时性能稳定,证实收益源于架构机制而非特定 CUA 实现。消融研究表明经验学习带来最大收益。

CORPGEN:以自主数字员工在多视界任务环境中模拟企业环境
图1:数字员工的一个工作日。智能体从Day Init开始,加载记忆并生成当日计划。随后运行重复的Execution Cycle,在其中检索上下文、推理并行动,并在完成众多交错任务的同时持久化结果。在Day End,智能体对自己的行动进行反思,将经验整合到长期记忆中,从而在上下文重置的情况下仍能连续数小时连贯运行。