论文

CADMAS-CTX:面向多智能体委托的情境化能力校准

CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation

智能体系统Agent 协作

摘要

我们在一个更强、更现实的假设下重新审视多智能体委托:智能体的能力并非在技能层面固定不变,而是取决于任务情境。一个编码智能体可能擅长简短的独立修改,却在长程调试中失败;一个规划器可能在浅层任务上表现良好,却在链式依赖上退化。因此,静态的技能级能力画像会对异质情境取平均,可能导致系统性的错误委托。我们提出 CADMAS-CTX,一个情境化能力校准框架。对每个智能体、技能与粗粒度情境分桶,CADMAS-CTX 维护一个 Beta 后验,以捕捉任务空间中该区域的稳定经验。委托决策则由一个风险感知分数做出,该分数将后验均值与不确定性惩罚相结合,从而只有当某个同伴看起来更优且该评估有足够证据支撑时才进行委托。本文做出三项贡献。第一,用分层的情境化能力画像以条件于情境的后验取代静态的技能级置信度。第二,基于情境老虎机(contextual bandit)理论,我们形式化证明在充分的情境异质性下,情境感知路由比静态路由获得更低的累积遗憾,将偏差-方差权衡形式化。第三,我们在 GAIA 与 SWE-bench 基准上实证验证了该方法。在使用 GPT-4o 智能体的 GAIA 上,CADMAS-CTX 取得 0.442 的准确率,以不重叠的 95% 置信区间超越静态基线的 0.381 与 AutoGen 的 0.354。在 SWE-bench Lite 上,它将解决率从 22.3% 提升至 31.4%。消融实验表明,不确定性惩罚提升了对情境标注噪声的鲁棒性。我们的结果表明,与静态的全局技能分配相比,情境校准与风险感知委托能显著改善多智能体协作。

CADMAS-CTX:面向多智能体委托的情境化能力校准:论文配图
图 1.CADMAS-CTX 架构。任务用上下文 zz 标记,本地协调器查询其 Beta 后验以计算风险感知的 LCB 分数、委托执行并根据结果更新特定于存储桶的后验。CADMAS-CTX 架构。任务用上下文 z 标记,本地协调器查询其 Beta 后验以计算风险感知的 LCB 分数、委托执行并根据结果更新特定于存储桶的后验。