论文
COVER:协作联盟路由的可识别性评估
COVER: Identifiable Evaluation of Coalition Routing
摘要
当多代理系统改变其团队时,它也会改变它产生的消息和最终答案,因此端到端准确性差距本身并不能识别路由效应。我们引入了一种方法,一种在结果生成之前修复公共信息边界、下游堆栈 G 和有限法律团队家族的评估合约。完整的覆盖范围可识别以该堆栈为条件的精确有限基准预言机遗憾。对于任何有限的冻结策略集合,执行其不同选定团队的联合是对每个成对策略对比的最小无假设支持,尽管这并不是绝对的预言机遗憾。两个具有源 ID 不相交分割的受控表测试仪器。在 MuSiQue-12 上,预先指定的特权阳性对照将后悔值从 0.532 提高到 0.402;后来的公共接口控制达到 0.424 而不是 0.554,但具有追溯性。在 HotpotQA-4 上,预先指定的公共直接评分器将后悔值从 0.313 提高到 0.110。在固定堆栈 Llama 执行中,经过验证的路线遗憾提高了 0.190,而原始答案增益为 0.010,间隔过零。五系列 ToolSandbox 变体转移验证对 16 个已声明团队的 14 个未触及任务变体(224/224 有效行)进行详尽评估:已声明系列预言机达到 0.768 安全证据完成度,而预期冻结路由器获得 0.637(遗憾 0.131),未达到预先声明的 0.10 标准。后来的回顾性比较达到 0.655,将所有工人与平均 5.00 名工人相匹配,分别为 4.57 和 5.00。因此,COVER 暴露了选择空间,但没有取得路由胜利。跨堆栈诊断显示绝对分数取决于 G,但未发现可检测到的路由器与终结器之间的交互。 COVER 是一种可审计的测量方法,而不是堆栈不变或通用代理路由优势的声明。