论文
LW2S:学习多智能体流程中可以安全省略的步骤
Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows
摘要
多代理 LLM 工作流程使用计划、执行、验证和总结来提高任务性能,但每个组件的价值取决于已生成的状态。执行每个组件可能会浪费计算或覆盖正确的中间答案。我们将组件省略制定为反事实信用分配:完整的工作流程日志揭示了执行轨迹的奖励,而受控的跳过干预则揭示了省略未来步骤的后果。我们引入了学习跳过什么(LW2S),它从这些干预中学习特定于操作的安全模型,并将留出集校准与领域内置约束相结合以选择跳过。当早期跳过被拒绝时,控制器可以继续执行并重新考虑稍后的组件。通过数学推理、多项选择 QA 和两个指令模型系列的代码生成,LW2S 降低了记录的词元成本,同时匹配或提高了评估设置中的总体完整工作流程准确性。放大和第二拓扑实验进一步检查组件冗余,而共享错误案例揭示了为什么仅靠一致性不足以进行跳过选择。这些发现将高效的工作流程执行与学习各个组件的条件效用联系起来。