论文
CAX-Agent:用于可靠APDL自动化的轻量级智能体执行框架
CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation
摘要
部署于MAPDL有限元仿真的大语言模型面临实际的可靠性挑战:在缺乏结构化执行控制、工具封装与故障恢复时,输出可能不一致,任务失败也很常见。智能体Harness范式通过插入领域特定的编排中间件来应对这一挑战,由中间件管理工具生命周期、工作流状态与恢复升级。本文提出专为MAPDL自动化构建的轻量级智能体Harness——CAX-Agent的架构,并对其中一个核心组件——恢复策略——进行实证评估。CAX-Agent将执行组织为三层——LLM服务、智能体Harness与求解器后端——并配备恢复阶梯,从确定性规则修补逐步升级到模型驱动再生、上下文充实与人工介入。我们在50个标准结构基准上评估三种恢复策略(no_recovery、rule_only与model_only),每种策略重复运行三次(共450次案例运行)。两名独立人工评分者在盲评条件下对任务完成度打分;评分者间一致性很强(二次加权Cohen's kappa = 0.84,96%的评分对相差不超过1分)。model_only取得最佳完成率(0.9267)、任务得分(3.59/4)、总分(9.16/10)与零干预率(0.84),以大效应量(Cliff's delta = 0.81-0.87)优于rule_only(0.7733、3.17/4、7.03/10、0.00)与no_recovery(0.6933、2.74/4、5.60/10、0.00)。该基准刻意采用简单几何以隔离恢复策略的影响;我们讨论了这些发现的适用范围及更广泛验证的方向。
