论文

PowerBench:电力系统中 Agentic 检索和推理的基准

PowerBench: A Benchmark for Agentic Retrieval and Reasoning in Power Systems

智能体系统Agent任务评测

摘要

大语言模型(LLM)Agent为工业自动化分析提供了新的机会。然而,对此类Agent的严格评估(例如在电力系统场景中)仍然受到阻碍:真实的运行数据是机密的,现有的公共资源无法完全捕获链式依赖关系和异构证据。为了解决这一差距,我们提出了 PowerBench,包括(1)一个生成框架,通过公共依赖链导出互连的异构操作数据,以及(2)由该框架生成的合成数据集。该数据集涵盖 100 种设备类型的 761 台设备,涵盖两年时间的 1335 万条每小时遥测记录和 24,939 个操作文档。在此数据集的基础上,我们在三个任务系列中构建了 300 个问题,评估前沿LLM完成分析任务的能力,这些任务需要在有限的工具调用和时间预算下跨互连和异构数据进行自主证据检索和推理。结果表明,评估的前沿LLM在这些任务上仍然面临挑战:最佳模型仅达到 74.2% 的联合精度。我们的跟踪分析进一步表明,模型性能在证据发现、内容检索、工具使用、证据推理和答案提交方面存在差异。这些发现为评估LLMAgent并指导其在行业中的可靠部署提供了详细的见解。框架、数据集和基准测试任务可在 https://github.com/open-compass/PowerBench. 获取