论文
当代理治理有帮助时
When Agent Governance Helps
摘要
没有规范说明应如何设计和评估受治理的自动人工智能代理组织(其中代理在护栏内追求自我生成的目标)。我们分两部分来回答。首先,我们从 321 个来源的基于文档的定性证据综合中综合了治理自动多代理产品组织 (GAMPO) 框架,将代理、敏捷、平台和治理理论集成到可运行的规范中。其次,我们跨开放和前沿模型探索了 GAMPO 在 CHI-Bench(一个长期医疗保健基准)上的即时层实例化。结果是一个边界条件:治理收益由模型的备用容量控制,并且是特定于领域和模型的。在容量受限的开放模型上,完整的过程不会产生任何可靠的好处,而单个“验证您的写入”句子可以使任务成功加倍(pass@1 2/20 到 4/20)。在前沿,相同的支架将事先授权提升了 24% 至 40%,但在另一个模型上净值为零,这一差距归因于稳定的推荐覆盖配置。第二个结果完善了第一个结果:用盲答案、按任务完成定义替换通用程序,仅以案例本身的政策和公布的标准为关键,而不是隐藏的关键,在五局最佳自我一致性(68%的单次尝试,由坚持的委员会确认)下将事先授权提高到84%,并将利用率管理提高到44%,而护理管理则满足主观内容质量的限制。其贡献是一个命名的、可审计的框架和能力门控的证据,表明治理的规模应足以节省能力,并且在前沿,基于案例的规范胜过统一的程序。研究结果是探索性的:部分实例化、每个细胞的小样本(n = 5-25)和单一试验。