论文

自由对话、严格执行:面向灵活且可复现科学工作流的Schema-Gated Agentic AI

Talk Freely, Execute Strictly: Schema-Gated Agentic AI for Flexible and Reproducible Scientific Workflows

模型评测智能体系统Agent Harness评测方法与指标

摘要

大型语言模型(LLM)现在可以将研究者的自然语言目标转化为可执行计算,但当由LLM决定运行什么时,科学工作流所要求的确定性、出处追踪和治理难以保证。对来自10个工业研发利益相关方的18位专家的半结构化访谈浮现出两个相互竞争的需求——确定性、受约束的执行与不带工作流僵化的对话灵活性——以及任何解决方案都必须满足的边界属性(人在环控制与透明性)。我们提出schema-gated编排作为解决原则:schema成为组合工作流层面的强制执行边界,除非完整动作(包括跨步骤依赖)能通过机器可检验规范的验证,否则任何东西都不会运行。我们将这两个需求操作化为执行确定性(ED)和对话灵活性(CF),并用这两个轴沿验证范围光谱审视横跨5个架构组的20个系统。评分通过多模型协议进行——跨3个LLM家族的15个独立会话——产生高度至接近完全的模型间一致性(ED的Krippendorff alpha=0.80,CF的alpha=0.98),表明多模型LLM评分可作为人类专家小组的可复用替代方案用于架构评估。所得格局揭示了一条经验Pareto前沿——没有受审系统同时实现高灵活性与高确定性——但在生成式与工作流中心两个极端之间出现了一个收敛区。我们认为,将对话权威与执行权威分离的schema-gated架构有望解耦这一权衡,并提炼出3条操作原则——先澄清后执行、受约束的计划-行动编排、以及工具到工作流层的门控——以指导采用。

自由对话、严格执行:面向灵活且可复现科学工作流的Schema-Gated Agentic AI
图3:将会话权限与执行权限分离的参考架构。上下文与状态(用户查询、聊天历史、系统信息、内部数据以及先前的工具/工作流输出)被汇总给一个LLM编排器(规划器/推理器),该编排器生成一条助手消息,并可选地生成一个动作提案。提案进入执行权限门(红色虚线区域):输出解析器依据JSON模式或工作流规范对其进行验证。无效提案触发澄清循环;有效提案被转发给工作流执行器。所产生的数据、日志与工件更新共享上下文,供后续轮次使用。LLM可以自由对话,但不能执行——执行权限完全存在于模式验证之中。