论文
CR4T:基于重写的青少年安全护栏 LLM
CR4T: Rewrite-Based Guardrails for Adolescent LLM Safety
摘要
大语言模型 (LLM) 越来越多地嵌入青少年数字环境中,充当信息寻求、建议和情感敏感互动的媒介。然而,现有的安全机制在很大程度上仍然基于以成人为中心的规范,并通过以拒绝为导向的抑制来实现安全。虽然这些方法可能会减少直接的政策违规行为,但它们也可能会造成对话死胡同,限制建设性指导,并且无法解决青少年与人工智能互动中固有的发展漏洞。我们认为,青少年 LLM 安全不应仅仅被视为一个过滤问题,而应被视为一个社会技术、发展一致的转型问题。为了落实这一观点,我们提出了针对青少年的批评和修订(CR4T),这是一种与模型无关的保护框架,有选择地将不安全或拒绝式的输出重建为适合年龄的、以指导为导向的反应,同时保留良性意图。 CR4T 将轻量级风险检测与域条件重写相结合,以删除风险放大的内容,减少不必要的对话关闭,并引入适合发展的指导。实验结果表明,有针对性的重写可以大大减少不安全和拒绝导向的结果,同时避免对可接受的交互进行不必要的干预。这些发现表明,选择性响应重建为面向青少年的 LLM 系统提供了一种更加以人为本的替代方案,以取代以拒绝为中心的护栏。