论文

电力系统智能体基准:电力工程中AI智能体的可执行评估

Power Systems Agent Benchmark: Executable Evaluation of AI Agents in Electric Power Engineering

智能体系统Agent任务评测

摘要

可执行评估——以程序检查智能体动作的后果而非为其散文打分——已成为评估软件设定中工具使用AI智能体的突出方式。电力工程尚未有类似基准:语言模型使用仍以检索与文本问答为主——而作用于电力系统工件的智能体大多仍是学术原型。我们介绍电力系统智能体基准——面向电力工程智能体的可执行基准。智能体接收结构化任务并返回结构化解;确定性评估器重算工程量、检查运行约束——返回可行性标志、归一化分数与显式违例。基准含横跨电力工程八个领域的41个任务族——从潮流与保护到稳定、微电网、可靠性、电能质量与预测。每个任务以可引用的来源为依据、标准或有据可查的工程公式。为抵抗污染——留出案例按需由各任务族的生成器从私有种子合成:构造可检视——但实例保持私有。在三个命令行智能体的参照评估中——最强者接近紧凑档上限——较小的开源模型落后——公开与留出表现大体一致;单独的公开划分网格以OpenCode与Aider探测测试架效应。参照评估兼作质量控制:一致失败标记候选任务或评估器缺陷——且它暴露了一个被自一致性检查漏掉的潜在评估器bug。评估器是紧凑确定性代理——但任务契约允许其内部升级为仿真器支撑的检查——而不改变任务的提出或求解方式。