论文
社会敏感领域中面向基础模型的机器人学启发护栏
Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains
摘要
基础模型正越来越多地部署于教育、心理健康和照护等社会敏感领域,在这些领域中,失败往往是累积性的且依赖具体情境。现有护栏方法——从训练时对齐到提示、解码约束与事后审核——主要提供经验性的风险削减而非可强制执行的行为保证,且大多把安全视为单个输出的属性而非交互轨迹的属性。我们将护栏重新框定为对交互轨迹的运行时行为控制问题,借鉴机器人学引入在不确定闭环系统中实施约束的形式化构造。我们在Grounded Observer框架中实例化这些想法,并将其应用于三个真实部署:闲聊、居家自闭症治疗与学校中的行为去升级。在各个场景中,该框架都实现了能够缓解向不良交互模式漂移的运行时干预,同时适应多样的社会情境。我们讨论了框架的扩展,并提出通往更强保证的研究方向。
