论文
基于 LLM 的电力系统代码生成的知识边界探测和需求引导干预
Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation
摘要
大语言模型 (LLM) 越来越多地用于自动化电力系统分析,但出于保密性、监管、可重复性和成本原因,许多公用事业和能源研究实验室需要本地服务。这使得开放权重模型的可靠性成为一个部署问题。我们表明,电力系统代码生成中的首次失败不仅仅是由推理引起的,而是由结构化 API 知识边界错误主导:版本化仿真库中的幻觉函数名称、误用参数和错误处理结果表。我们推出了 PowerCodeBench,这是一个经过执行验证的基准生成器,它将自然语言运算符查询与 pandapower 代码和数字 真值 配对; L0-L3 文档驱动的探测程序,用于测量每个模型的 API 知识概况;边界感知干预将查询端 API 需求估计与有针对性的主动文档注入和路由反应校正相结合。在 2,000 个任务的冻结版本中,我们评估了 10 个开放权重 LLM(1.5B-480B 参数)和 4 个商业中间层 API。该干预措施将至少 7B 个参数的每个评估的开放权重模型和每个商业 API 的准确度提高了 32 至 56 个点。 70B-120B 系列的开放式权重型号与商业中级精度范围相匹配,而 Llama-3.1-405B 和 Qwen3-Coder-480B 则在该小组中处于领先地位。有针对性的提示保留了全上下文准确度上限,同时使用了 41% 的提示词元成本。其结果是在准确性方面,部署时间路径为网格分析工作流程提供可靠的本地 LLM 帮助,而无需 微调 或云推理。