论文
评估受监管Agentic AI的有限自治:结合宪法奖励、升级标签与运行治理的诊断Harness
Evaluating Bounded Autonomy in Regulated Agentic AI: A Diagnostic Harness with Constitutional Rewards, Escalation Labels, and Runtime Governance
摘要
我们提出了 RegLLM,这是一种在受监管的 Agentic 工作流程中用于有限自治的诊断工具。它检测六个可信度信号:引文有效性、来源基础、模式合规性、升级正确性、宪法一致性和不安全行动率。信号根据其监督来源进行区分:程序验证器、任务级别升级标签或人工智能判断分数。确定性的运行时主管会阻止不合理的答案并强制升级,记录干预措施。相同的领域构成告知评估、训练奖励和服务护栏。任务级别的“应该升级”标签使“行动”还是“推迟”决策成为可衡量的训练信号。我们在烟雾等级上演示了Harness。启用治理后,离线参考运行 (n=12) 将升级召回率从 0 提升到 0.67,并将不安全操作率从 0.33 降低到 0.08。两个单 GPU Qwen2.5-3B LoRA/DPO 试点(n=8,相同的种子和评估分割)暴露出巨大的差异:名义上相同的 RL 基础配置产生的任务成功率分别为 0.25 与 0.12,升级召回率分别为 1.0 与 0.5。答案质量适配器将运行 A 中的召回率从 1.0 更改为 0.5,但在运行 B 中将召回率从 0.5 更改为 1.0。升级感知变体在运行 B 中不会产生可测量的变化。这些小型试点无法建立可靠的适配器效果或生产准备情况。他们的贡献是诊断性的:配置差异可以压倒对有界自治指标的明显调整效果,从而激发更大的评估集和重复运行。