论文

社会敏感领域中面向基础模型的机器人学启发护栏

Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains

智能体系统Agent 动作执行与治理

摘要

基础模型正越来越多地部署于教育、心理健康和照护等社会敏感领域,在这些领域中,失败往往是累积性的且依赖具体情境。现有护栏方法——从训练时对齐到提示、解码约束与事后审核——主要提供经验性的风险削减而非可强制执行的行为保证,且大多把安全视为单个输出的属性而非交互轨迹的属性。我们将护栏重新框定为对交互轨迹的运行时行为控制问题,借鉴机器人学引入在不确定闭环系统中实施约束的形式化构造。我们在Grounded Observer框架中实例化这些想法,并将其应用于三个真实部署:闲聊、居家自闭症治疗与学校中的行为去升级。在各个场景中,该框架都实现了能够缓解向不良交互模式漂移的运行时干预,同时适应多样的社会情境。我们讨论了框架的扩展,并提出通往更强保证的研究方向。

社会敏感领域中面向基础模型的机器人学启发护栏:论文配图
图 1. 护栏作为交互轨迹的强制约束。部署的基础模型通过状态空间 𝒮\mathcal{S} 产生轨迹 τ=(s0,a0,s1,a1,...)\tau=(s_{0},a_{0},s_{1},a_{1},...)。安全集 𝒮safe⊆𝒮\mathcal{S}_{\text{safe}}\subseteq\mathcal{S} 定义可接受的行为状态。在每个时间步,模型根据策略 πθ​(at∣st)\pi_{\theta}(a_{t}\mid s_{t}) 提出操作,但“护栏”将执行限制在可接受的操作集 𝒜safe​(st)\mathcal{A}_{\text{safe}}(s_{t}) 内,确保转换 st+1s_{t+1} 保持在𝒮safe\mathcal{S}_{\text{safe}}。这增强了前向不变性,防止轨迹进入不安全区域,而不是仅仅在违规发生后进行检测。