论文
自由对话、严格执行:面向灵活且可复现科学工作流的Schema-Gated Agentic AI
Talk Freely, Execute Strictly: Schema-Gated Agentic AI for Flexible and Reproducible Scientific Workflows
摘要
大型语言模型(LLM)现在可以将研究者的自然语言目标转化为可执行计算,但当由LLM决定运行什么时,科学工作流所要求的确定性、出处追踪和治理难以保证。对来自10个工业研发利益相关方的18位专家的半结构化访谈浮现出两个相互竞争的需求——确定性、受约束的执行与不带工作流僵化的对话灵活性——以及任何解决方案都必须满足的边界属性(人在环控制与透明性)。我们提出schema-gated编排作为解决原则:schema成为组合工作流层面的强制执行边界,除非完整动作(包括跨步骤依赖)能通过机器可检验规范的验证,否则任何东西都不会运行。我们将这两个需求操作化为执行确定性(ED)和对话灵活性(CF),并用这两个轴沿验证范围光谱审视横跨5个架构组的20个系统。评分通过多模型协议进行——跨3个LLM家族的15个独立会话——产生高度至接近完全的模型间一致性(ED的Krippendorff alpha=0.80,CF的alpha=0.98),表明多模型LLM评分可作为人类专家小组的可复用替代方案用于架构评估。所得格局揭示了一条经验Pareto前沿——没有受审系统同时实现高灵活性与高确定性——但在生成式与工作流中心两个极端之间出现了一个收敛区。我们认为,将对话权威与执行权威分离的schema-gated架构有望解耦这一权衡,并提炼出3条操作原则——先澄清后执行、受约束的计划-行动编排、以及工具到工作流层的门控——以指导采用。
