论文
PHMForge:场景驱动的工业资产生命周期维护代理基准
PHMForge: A Scenario-Driven Agentic Benchmark for Industrial Asset Lifecycle Maintenance
摘要
大语言模型 (LLM) 代理越来越多地部署用于复杂的工具编排任务,但现有基准无法满足工业领域的严格要求,在工业领域,错误的决策会带来严重的安全和财务后果。为了解决这一关键差距,我们推出了 PHMForge,这是第一个综合基准测试,专门设计用于通过与特定领域的 MCP 服务器的实际交互来评估预测和健康管理 (PHM) 任务上的 LLM 代理。我们的基准测试涵盖 75 个专家策划的场景,涵盖 7 个工业资产类别(涡轮风扇发动机、轴承、电动机、变速箱、航空发动机),涉及 5 个核心任务类别:剩余使用寿命 (RUL) 预测、故障分类、发动机健康分析、成本效益分析和安全/政策评估。为了实现严格的评估,我们在两个 MCP 服务器上构建了 65 个专用工具,并使用与任务相称的指标实现基于执行的评估器:用于回归的 MAE/RMSE、用于分类的 F1 分数以及用于健康评估的分类匹配。通过对领先框架(ReAct、Cursor Agent、Claude Code)与前沿 LLM(Claude Sonnet 4.0、GPT-4o、Granite-3.0-8B)的广泛评估,我们发现即使是性能最佳的配置也只能完成 68% 的任务,在工具编排(23% 错误排序)、多资产推理(14.9 个百分点退化)和跨设备方面存在系统性失败泛化(在保留数据集上为 42.7%)。我们开源完整的基准测试,包括场景规范、地面实况模板、工具实现和评估脚本,以促进代理工业人工智能的研究。