论文
用 GRACE 告别规范一元化的智能体:一种面向安全与合乎伦理 AI 对齐的基于理由的神经符号架构
Breaking Up with Normatively Monolithic Agency with GRACE: A Reason-Based Neuro-Symbolic Architecture for Safe and Ethical AI Alignment
摘要
随着 AI 智能体日益自主、广泛部署于事关重大的场景并能够产生真实世界影响,确保其决策不仅在工具层面有效、而且在规范层面对齐已成为关键。我们引入一种神经符号的、基于理由的容纳架构——规范对齐容纳总督(Governor for Reason-Aligned ContainmEnt,GRACE),它将规范性推理与工具性决策解耦,并可容纳几乎任何设计的 AI 智能体。GRACE 将决策重构为三个模块:道德模块(MM)通过基于道义逻辑的推理确定允许的宏观动作;决策模块(DMM)封装目标智能体,并根据导出的宏观动作选择工具层面最优的原子动作;守卫(Guard)监控并强制道德合规。MM 采用为道义逻辑提供语义基础的基于理由的形式化,实现可解释性、可争议性与可证成性。其符号表示丰富了 DMM 的信息上下文,并支持由守卫强制执行的对齐的形式化验证与统计保证。我们以一个 LLM 治疗助手为例演示 GRACE,展示它如何使利益相关方能够理解、争议并改进智能体行为。
