论文
Mimir:基于物理的大语言模型Agent,用于长期灌溉控制
Mimir: Physics-Grounded LLM Agents for Long-Horizon Irrigation Control
摘要
大语言模型(LLM)智能体越来越多地结合推理、工具使用和行动,但大多数证据来自具有相对即时反馈和重置失败的情景任务。长期运行的物理控制在不同的机制中运行:动作改变未来状态,错误跨决策累积,Agent必须根据经验进行改进,而不允许重写使执行安全的物理规则。我们通过灌溉研究这一机制,其中日常决策与整个生长季节的土壤-水动态相互作用。我们介绍 Mimir,一个以物理机制为依据的大语言模型Agent,围绕两个修复时间尺度进行组织。在快速的时间尺度上,结构化的物理接口和确定性模拟器将 LLM 输出转换为提案,我们在执行之前对其进行数值检查、修改并接受有界确定性动作选择。在缓慢的时间尺度上,反复出现的故障模式被合并为持久的上下文原则,以制约未来的提案,而物理模型、评估器和执行约束保持不变。根据跨多个地点、作物和年份的共同回顾性评估,Mimir 在评估参考中获得了最低报告的总体控制成本,并且比历史计划重播减少了约 51% 的灌溉量。消融研究表明,当正向模拟、验证修订或持久上下文被删除时,控制成本更高;模型规模和模型系列研究表明,增加大语言模型规模不会带来单调增益。由此产生的教训表明,持久的物理Agent可以将语义推理与有限的、证据驱动的自我改进相结合,同时为显式数值机制保留物理真相和执行器权威。