论文
AstronOS:面向长程Agentic系统的统一执行模型与运行时
AstronOS: A Unified Execution Model and Runtime for Long-Horizon Agentic Systems
摘要
Agentic系统常将执行与状态组织在单个会话、单次模型调用或单个智能体实例周围,即使真实工作跨越多次调用和多个阶段。我们引入一个统一执行模型,在多次调用之间维护工作项的持久身份与带版本的权威状态。每个步骤接收限定于特定状态版本与新增材料的输入;结果只有在校验并记录后才推进状态。我们在AstronOS中用Cases、Tasks和Scenario Packs在中心与本地执行上实现了该模型的选定路径。我们比较五种把既定软件版本更新计划带入全新模型会话的完整策略:重读原始材料、重放完整历史、确定性文本摘要、确定性JSON,以及AstronOS运行时中介的交接。全部五种策略下各运行10个受控任务、每任务三次重复,共150次纳入执行。在单阶段参考任务族上,各策略表现相近。在主要的三阶段A-C批次中,AstronOS在15次执行中有14次通过冻结评分器,而重读为15次中0次、完整历史重放为15次中2次;随后非交错的摘要与JSON批次各为15次中0次通过。AstronOS的按次通过执行尝试核算模型token成本更低,但每次尝试需要更多执行窗口时间。这些结果在该基准中把完整的AstronOS条件与跨全新会话的更高端到端通过率关联起来,并伴随可度量的时间成本。