论文

StructAgent:以统一因果结构驾驭长程数字智能体

StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure

智能体系统上下文与知识记忆Agent HarnessAgent记忆Agent Runtime

摘要

大语言模型(LLM)与视觉语言模型(VLM)的最新进展造就了日益强大的计算机使用数字智能体。但真实任务常是长程的,涉及含累积观察、中间编辑、失败尝试与部分完成执行的演化上下文。既有智能体典型地在原始交互历史上运行,使任务进展难以解读、验证与恢复——最终限制可靠的长程执行。本文主张:应对该挑战需要把智能体的状态与工作流显式结构化在任务进度的统一因果表示周围。我们提出StructAgent:一个以状态为中心的框架,引入维护紧凑、可验证任务进度的统一状态,与经验证器支撑的状态转换调节进度的结构化工作流。基于该设计,StructAgent进一步支持显式进度检查点、证据驱动的任务完成、定向失败恢复与工具支持的执行,同时确保所有进度更新保持落地于验证。大量实验显示StructAgent在长程计算机使用任务上持续改善广泛的LLM与VLM底座:OSWorld-Verified上把Qwen3.5-9B从27.0%提升到46.9%、Qwen3.5-27B从31.6%提升到62.2%,并以MiniMax-M3取得78.9%的开源新最先进;同一框架还泛化到Minecraft桌面环境之外,展示设计的通用性。

StructAgent:以统一因果结构驾驭长程数字智能体:论文配图
图 1:OSWorld-Verified、Mind2Web 和 Minecraft 的结果。 StructAgent 改进了匹配的开放主干网,并通过 MiniMax-M3(最先进的开源模型结果)达到了 78.9%。