论文

通过基于图形的软件知识为高能物理实验生成可靠的 LLM 程序

Reliable LLM-Generated Programs for High-Energy Physics Experiments through Graph-Grounded Software Knowledge

上下文与知识知识图谱

摘要

从现代粒子物理实验中提取物理信息需要在大型且高度互连的软件生态系统之上实施多阶段分析。通用 大语言模型 (LLM) 通常会为此类任务生成不可靠的程序,因为用户请求本身很少指定所需的 API、依赖项和使用约定。我们在生成之前组织这些软件关系,并在推理时检索与任务相关的知识。使用开源 ROOT 框架作为代表性和可重复的测试平台,我们评估了一个完整的基础系统,该系统结合了异构软件知识图的混合检索、技能选择的工作流程示例和执行引导的修复。在 275 个 ROOT 任务的基准测试中,基于软件知识的证据对齐将 Claude Code 编排下的首次尝试执行率从 58.5% 提高到 76.0%,将独立编排下的首次尝试执行率从 51.3% 提高到 64.0%。最终成功率分别从 90.5% 增加到 96.0% 和从 78.9% 增加到 90.9%,而每个成功任务的平均生成成本仅增加 1.3% 和 3.2%。在强大的 编码智能体 下,收益持续存在,这表明即使代理脚手架已经就位,显式软件知识仍然有价值。由于该方法捕获大型代码库常见的软件关系,而不是特定于 ROOT 或特定模型的事实,因此它应该转移到其他实验框架和专有软件,特别是在文档稀疏或内部依赖关系复杂的情况下。