论文

EmbodiedGovBench:体现代理系统治理、恢复和升级安全性的基准

EmbodiedGovBench: A Benchmark for Governance, Recovery, and Upgrade Safety in Embodied Agent Systems

智能体系统Agent任务评测

摘要

嵌入式人工智能的最新进展催生了一个不断发展的机器人策略、基础模型和模块化运行时生态系统。然而,当前的评估仍然以任务成功指标为主,例如完成率或操作准确性。这些指标留下了一个关键差距:它们无法衡量具体系统是否可治理——是否尊重能力边界、执行策略、安全恢复、维护审计跟踪以及响应人类监督。我们提出了 EmbodiedGovBench,这是一个以治理为导向的具体代理系统评估基准。 EmbodiedGovBench 不仅仅询问机器人是否可以完成任务,而是评估系统在现实扰动下是否保持可控、受策略限制、可恢复、可审计和进化安全。该基准涵盖七个治理维度:未经授权的能力调用、运行时漂移稳健性、恢复成功、策略可移植性、版本升级安全性、人工覆盖响应性和审计完整性。我们定义了一个跨越单个机器人和车队设置的基准结构,包括场景模板、扰动算子、治理指标和基线评估协议。我们描述了如何通过模块化接口和合同感知升级工作流程在具体功能运行时上实例化基准测试。我们的分析表明,体现治理应该成为一流的评价目标。 EmbodiedGovBench 为这一转变提供了初始衡量框架。