论文

问题不在语言模型,而在工具:科学工作流的确定性中介

It's not the Language Model, it's the Tool: Deterministic Mediation for Scientific Workflows

智能体系统Agent 工具调用

摘要

语言模型可以产出看起来令人信服的科学分析,但对同一数据的重复生成并不保证得到相同结果。研究者重新生成同一个查询,可能得到不同的拟合、不同的峰位或不同的分析流程,却没有显而易见的办法判断该相信哪个输出。我们提出类型化中介(typed mediation)这一模式:模型编排确定性工具,而不是生成分析代码。每个工具编码了一位研究者针对某台仪器的精确流程,通过结构化访谈移植而来。模型选择调用哪个工具以及用什么参数。结果由工具产生。重新生成不会改变它。我们通过在四个平台(包括三个商用基础模型)上用相同提示各运行四次同一光致发光分析来检验这一主张。类型化工具在所有运行中产生完全相同的结果。商用平台则在多次运行中数值输出和分析方法不一致,或在该任务上无法产生有效结果。我们在服务于用户的两台仪器上部署了这一模式约六个月,用户反馈非常积极。两个案例都极具挑战性:它们涉及专有二进制格式和按席位授权的软件,这迫使工具必须与数据及其操作的仪器一同留在本地基础设施上。我们认为,部署拓扑不只是偏好问题,而是科学工具中介的结构性要求。其结果是一种在可复现性为硬性要求的科学工作流中部署语言模型的实用模式,将分析时间从数周缩短到数分钟,同时保证各次运行输出完全一致。

问题不在语言模型,而在工具:科学工作流的确定性中介:论文配图
图 1:科学数据分析的三种方法。所有情况下的数据收集都是相同的。 (a) 传统:研究人员手动操作分析软件。 (b) LLM 辅助:模型生成分析代码,每次运行都会产生不同的结果。 (c) 类型化中介(提议):该模型编排了一个确定性类型化工具,该工具对研究人员在本地基础设施上的确切工作流程进行编码。