论文
RACL:面向连续元启发式学习的推理智能体控制层
RACL: Reasoning-Agent Control Layers for Continuous Metaheuristic Learning
摘要
本文介绍RACL——面向元启发式算法的推理智能体控制层。RACL把推理智能体置于既有优化器之上。该智能体不取代优化器——也不修改业务约束。它经观察运营记忆、对过去行为推理、构造有界假设、测试干预、评估结果、施加护栏、固化有用策略并解释其决策——控制优化器的内部搜索行为。实验以车辆路径为试验台——但贡献不是新的路径求解器、特定ALNS配置或特定路径规则集。贡献是RACL方法:推理智能体为元启发式发现、验证、固化并解释算法控制规则的方式。在当前实验设定中——RACL在21个可行案例的21个中改进或持平运营记忆策略——在21个可行案例的18个中改进或持平非推理的停滞触发策略——RACL对STP的平均成本差为-0.641%。在Sevilla-9/10运行时样本中——RACL较固定策略平均成本改进-8.337%、较STP改进-1.605%——且无实质计算开销。在概念验证期间——Codex被用作在环推理智能体观察执行、解读日志并提出实时有界干预。策略代理随后仅用于使定量评估可复现。