论文
CORPGEN:以自主数字员工在多视界任务环境中模拟企业环境
CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments
摘要
长视界推理是自主智能体的关键挑战,但现有基准都在孤立的单任务上评估智能体。真实的组织工作需要管理许多并发的长视界任务,这些任务相互交织、存在依赖且需要重新排定优先级。我们提出多视界任务环境(MHTEs):一类独特的问题,要求在持续数小时的持久执行上下文中,对数十个相互交织的任务(45 个以上、500-1500+ 步)进行连贯执行。我们识别出四种失败模式,它们使基线 CUA(计算机使用智能体)在负载从 25% 增至 100% 时完成率从 16.7% 降至 8.7%,该模式在三个独立实现中一致出现。这些失败模式是上下文饱和(O(N) 对 O(1) 增长)、记忆干扰、依赖复杂性(DAG 对链式)以及重新排定优先级的开销。我们提出 CorpGen,一个与架构无关的框架,通过分层规划实现多视界目标对齐、通过子智能体隔离防止跨任务污染、通过分层记忆(工作、结构化、语义)以及自适应摘要来应对这些失败。CorpGen 通过具有持久身份和真实日程的数字员工来模拟企业环境。在 OSWorld Office 上跨三个 CUA 后端(UFO2、OpenAI CUA、分层式),CorpGen 相比基线取得最高 3.5 倍的提升(15.2% 对 4.3%),且负载增加时性能稳定,证实收益源于架构机制而非特定 CUA 实现。消融研究表明经验学习带来最大收益。
