论文
通过任务分解阐明人工智能生成的科学分析中的假设
Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition
摘要
LLM 生成的分析代码产生的科学结果必须是可理解和可重复的。然而,在原始自然语言规范和生成的实现中,过程的不同阶段可能会出现不确定性。因此,即使是可执行代码也可能无法清楚地了解正在计算哪些量或哪些假设决定最终结果。为了应对这一挑战,我们引入了基于数量的语义差异,这是一种用于分析和比较 LLM 生成的科学程序的多智能体框架。该框架将代码生成、执行、跟踪和验证分配给单独的代理,使其能够重建关键输出量的生成方式,并识别预期分析和已实现代码之间的差异。我们还引入了一个模块,用于检查初始用户指令中的歧义并在代码生成之前建议替代重写。其模块化设计可以通过替换特定领域的资源同时保留相同的工作流程来应用于不同的科学领域。我们验证了代表性对撞机物理分析的框架。结果表明,相对于之前的单一提示方法,模块化任务分解增强了透明度和可靠性,同时使更小的模型能够执行完整的工作流程。