论文

带局部可靠性界的预算化行动或推迟多智能体LLM审议

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

智能体系统Agent 动作执行与治理

摘要

LLM间的多智能体审议可以改善推理,但部署需要决定当前答案何时足够可靠以行动、何时应升级到人工审查。我们将其形式化为预算化的行动或推迟决策。每轮中,系统把辩论前缀映射到低维状态,使用校准数据计算状态条件正确性的k近邻下置信界——仅当界超过用户指定的可靠性阈值时行动。证书通过分解β=δ+α+ε_act控制错误行动——分离校准失败、残余行动风险与表示差距。保证是有条件的而非免分布的:它依赖有效的局部偏差包络与行动区域表示差距界,每个假设都配有可证伪的诊断。由于同一绝对错误行动预算在不同难度任务上含义不同,我们以仅用训练数据设置的相对预算来评估安全。在六个基准对九个基线:该方法在激活数据集上使用预声明预算的9–12%、达到最高84%自动化与96%已行动准确率;在压力测试数据集上推迟而非强推不可靠的自动化。