论文
心理健康AI安全主张必须保留时间性证据
Mental Health AI Safety Claims Must Preserve Temporal Evidence
摘要
心理健康人工智能的安全性常常被错误的时间尺度来判断。目前的评估通常对孤立的反应、终点结果或总体对话质量进行评分,而临床上的后果性失败可能是由于交互本身的顺序和积累而引起的,包括延迟升级、重复强化、依赖性形成、修复失败和轮流逐渐恶化。本文认为,这种不匹配不仅是评估覆盖范围的限制,也是无效安全结论的根源。我们引入了时间安全不可识别性,这是对为什么依赖于序列、时间、累积或恢复的安全属性无法通过丢弃这些特征的协议进行认证的正式说明。从这种形式化中,我们开发了 SCOPE(保留证据的安全声明)作为将安全声明与评估实际保留的证据结合起来的一般原则,并将其实例化为 SCOPE-MH,即该报告标准的心理健康实例。我们通过专家注释的动机访谈对话的 AnnoMI 数据集上的概念验证来操作 SCOPE-MH,该数据集揭示了每回合行为评分无法代表的失败机制。我们建议 SCOPE-MH 作为现有评估基础设施的诊断补充,并认为对于安全关键的心理健康人工智能部署来说,保留时间证据的评估是必要的,而不是可选的。
