论文

协调实时约束与长程推理:面向动态调度的异步智能体框架

Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling

智能体系统AI 基础设施Agent 架构与控制循环SandboxAgent Sandbox

摘要

动态柔性作业车间调度问题(Dynamic Flexible Job Shop Scheduling Problem,DFJSP)需要对随机扰动的即时反应与生产目标全局优化之间的权衡。传统优先级规则在应对复杂扰动时灵活性不足,而基于学习的方法往往牺牲可解释性或难以跨问题规模泛化。尽管大语言模型(LLM)具备弥合这一差距的先进推理能力,但其显著的推理延迟与工业控制系统的毫秒级决策周期不兼容。为解决这一冲突,我们提出RACE-Sched,一个通过双流架构将策略执行与逻辑推理解耦的异步智能体框架。反应流执行低延迟的符号启发式规则以实现实时调度,而并行运行的深思流则利用LLM来综合、验证并演化这些规则。候选规则在沙箱中经过严格测试,并通过原子更新部署,在不阻塞控制回路的前提下确保安全。此外,语义规则库为经过验证的启发式规则建立索引,用于基于检索的初始化,从而增强跨问题规模的可迁移性。在GEN-Bench、MK-Bench和JMS-Bench上的大量评估表明,RACE-Sched优于领先的深度强化学习(Deep Reinforcement Learning)及其他基于LLM的基线。该方法协调了实时约束与长程推理,实现了更优的解质量以及对动态事件的稳健适应。

协调实时约束与长程推理:面向动态调度的异步智能体框架:论文配图
图 1:RACE-Sched 概述。 Reactive Stream 执行用于实时调度的主动符号规则,而 Deliberative Stream 则运行 LLM 驱动的循环,并具有约束代码生成和沙箱评估,以生成经过验证的规则更新。经过验证的启发式方法存储在规则存储库中,用于热启动检索,并通过热插拔部署到控制环路。