论文
Argus:面向长程推理的通用Agentic运行时
Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning
摘要
长期远期推理要求一个具有自主性的运行时环境,该环境能够在证据支持当前方法时保持稳定,并在测量结果揭示失败、隐藏约束或不明确目标的情况下进行调整。我们提出Argus,这是一种持久且自我进化的运行时环境,在其中Manager、Planner、Engineer和Reviewer执行有界的任务,这些任务涉及持久的项目状态。Argus将稳定的用户意图与操作目标、约束和验证标准分离,并仅在角色拥有审查后允许记忆、技能、程序、验证者、路由决策和被拒绝的路线。模型权重保持不变;自我进化通过持续运行时状态和控制策略进行,自主执行发生在操作员拥有升级点之间。在七个GPT-5.5基准测试领域中,Argus在SWE-Bench Pro上取得约78%的分数,而Direct Copilot则为59%,使用1.41倍的总令牌数。经过验证后的自我进化阶段,成熟的SWE-Bench波形比初始波形使用21%更少的解决输入令牌和15%更少的活跃工作流时间,同时记录34个验证者恢复和22个严格的审查环救援。Argus在AARRI-Bench上也达到76.8%,并在数学数据合成中与竞争性的GPU-核和语言模型训练结果相比有28.0点差距。此外,优化的RWKV6内核被合并到上游;多天数学运动保留了伪造路线并证明了更新后的前沿;六篇论文管道完成了254个任务,并在16个阶段中进行了16次回滚。这些结果表明,一个固定权重、自我进化的框架可以修订、恢复和积累验证过的路径,同时为未来的监督学习和强化学习生成结构化轨迹。
