论文

REBAR:量化自主系统的伦理与合规就绪程度

REBAR: Reference Ethical Benchmark for Autonomy Readiness

模型评测评测方法与指标

摘要

随着自主系统变得更加先进,评估其伦理和法律合规性的客观指标对于告知最终用户其局限性并确保对滥用它们的人承担责任至关重要。目前的伦理具身人工智能框架大多是定性的,侧重于系统设计(通过安全护栏或有针对性的红队),并且实现的护栏通常直接禁止不安全行为,而不向用户提供人工覆写选项或可解释的理由。相反,需要通过严格的测试来计算指标,使用户能够确定系统对任务的适用性。为了解决这一差距,我们引入了自主就绪参考伦理基准 (REBAR),这是一个针对自主系统的定量测试和评估框架。 REBAR 将运营指标映射到可计算的自主准备水平 (ARL) 规则中,可以量化伦理绩效。该框架的主要创新包括用于计算和解释场景的伦理难度的神经符号 大语言模型 (LLM) 方法、LLM 驱动的大规模测试实例生成以及多功能、逼真的模拟环境。通过严格的测试流程评估白盒自主解决方案,REBAR 提供了客观且可重复的基准分数,弥合了抽象原则与可验证、负责任的自主之间的差距。