论文

遗憾压倒惊喜:代理人工智能安全的设计时需求工程

Regret Dominates Surprise: Design-Time Requirements Engineering for Agentic-AI Safety

智能体系统Agent 动作执行与治理

摘要

代理人工智能领域的需求工程师在评估、指定和实施安全自主方面面临挑战。主流框架,例如面向目标的需求工程(GORE),缺乏在认知不确定性下系统地应对这些挑战的机制。我们贡献了一种基于 GORE 的方法,用于对代理人工智能系统中的安全自主进行建模和模拟。我们引入了一种新颖的遗憾主导机制(MS-RGR)来实施安全自主。 MS-RGR 使用两个信号:认知惊喜(新颖性检测)和认知后悔(评估风险)来解决三难问题:智能体应该以常规自主方式操作,进行反思性推理,还是升级为人类?我们在老年护理监控和自动驾驶中实例化了 MS-RGR。 100 种子随机模拟显示,MS-RGR 将无声故障减少到接近于零,并且检测风险的速度比仅使用传感器的基线快约 17.5 倍,并且通过 LTL 安全属性保持形式上的可追溯性。对来自 7 个 LLM 的 208 个 AGENTHARM 场景的执行跟踪应用 DRI 门事后的回顾性代理实例表明,该门仅针对具有强基线安全性的模型(超过 80% 的门前拒绝,例如 84.1% 至 90.9%)改善了有害任务拒绝,这表明 MS-RGR 放大而不是替代模型级安全训练。我们讨论了对有效性的威胁,将 MS-RGR 定位为代理 AI 需求工程中设计时安全约束的初始可行性证据。