论文
面向成本感知序贯决策的多LLM Agent贝叶斯编排
Bayesian Orchestration of Multi-LLM Agents for Cost-Aware Sequential Decision-Making
摘要
大语言模型(LLM)日益被部署为自主决策Agent,应用于错误成本不对称的场景:招聘(错过人才对浪费面试名额)、医疗分诊(漏掉急诊对不必要的转诊升级)以及欺诈检测(放行欺诈对拒绝合法支付)。主流设计让单个LLM给出状态后验、对“置信度”设阈值并据此行动;我们证明这一设计不足以应对带有成本的序贯决策。我们提出一个贝叶斯式、成本感知的多LLM编排框架,将LLM视为近似似然模型而非分类器。对每个候选状态,我们通过对比式提示引出似然,用稳健统计在多个不同模型间聚合,并在新证据到来时依据贝叶斯规则在显式先验下更新信念。这使连贯的信念更新、基于期望成本的行动选择、经由信息价值实现有原则的信息收集,以及通过集成偏差缓解获得公平性提升成为可能。在每次错失录用成本40000美元、每次面试成本2500美元、每次电话筛选成本150美元的简历筛选场景中,使用五个LLM(GPT-4o、Claude 4.5 Sonnet、Gemini Pro、Grok、DeepSeek)对1000份简历进行的实验显示,相比最佳单LLM基线,总成本降低294000美元(34%),人口统计均等提升45%(组间最大差距从22个百分点降至5个百分点)。消融实验将51%的成本节约归因于多LLM聚合,43%归因于序贯更新,20%归因于由分歧触发的信息收集,这与正确概率基础带来的理论收益相一致。
