论文
一次一步:用 LLM 自主性换取流程可预测性
One Step at a Time: Trading LLM Autonomy for Process Predictability
摘要
自动化操作流程的组织需要的不只是正确结果,还需要提前知道流程怎样运行、确认实际执行了哪条流程,并逐步检查。由Agent执行时,通常仅把规定流程放进系统提示,最后收到答案,因而失去可预测性。我们改用MCP逐步交付流程:服务器每次释放一步,Agent执行并返回结构化step_output。用部分自主性换取可预测性,可从结构上获得独立于执行者的两项属性:运行前已规定执行路径,而非事后重构;完成步骤形成机器可读日志,供下游逐步审计与优化。在13个SOP-Bench领域、从Kimi K2.5到Ministral 3 8B的四个开放权重执行者上,共评测15,475次。逐步交付使所有执行者流程可预测、可检查,并提高小执行者准确率。四者流程遵循率从76%—95%提高到95%—99%;未执行SOP却答对的无依据输出从2.1%—4.5%降到0.2%—0.3%,变化的95%置信区间均排除零。提示交付时,know_your_business中31%—49%的正确答案完全绕过SOP,包括前沿执行者。轻量执行者有依据准确率提高6.5个百分点,因为外部流程免除了它难以承担的重建负担;较强执行者则以少量原始准确率下降换取可预测和可审计过程。