论文
工具规则:科学计算中 LLM Agent的可执行检查
Rules to Tools: Executable Checks for LLM Agents in Scientific Computing
摘要
科学编码Agent接收书面方程、边界条件和输出要求,然后必须评估他们修改的程序。工具规则 (R2T) 提供针对公共科学要求的准备好的可执行检查。匹配的 SciCode 维修小组共享书面检查、启动程序、模型和预算;工具组收到一个可调用的实现。在两个任务 ID 组中,文本的完整修复率为 26/30,准备好的检查的完整修复率为 29/30。三个任务 ID 偏向工具,一个偏向文本,十一个偏向平局。八个 ID 队列的得分为 13/16 与 15/16,任务集群引导 95% 区间的差异为 [-12.5, 43.75] 个百分点。较大的共享定义 SciCode 队列每组 13/24 并列。五个具有替代启动程序的开发任务得分为 3/10 与 7/10。工具组偏爱任务 17、77 和 11;初始检查标记任务 17,并报告任务 77 和 11 没有违规。任务 37 倾向于文本,并且没有初始报告的违规。通过 Python 的新源代码也达到了 15/16,与专用命令的聚合相匹配。在匹配的 PDE 比较中,详细文本得分为 23/24,检查得分为 24/24,报告的检查模型输出降低了 31.2%。Agent端输出节省因队列而异,而两个任务 ID 队列中的公共 CPU 使用率都会增加。这些结果通过准备好的检查来衡量任务相关的修复结果和Agent方成本。