论文
绿色屏蔽:以用户为中心的方法实现值得信赖的人工智能
Green Shielding: A User-Centric Approach Towards Trustworthy AI
摘要
大语言模型 (LLM) 的部署越来越多,但它们的输出可能对用户短语查询方式的常规、非对抗性变化高度敏感,现有的红队工作未能很好地解决这一差距。我们提出了绿色屏蔽,这是一个以用户为中心的议程,通过描述良性输入变化如何改变模型行为来构建有证据支持的部署指南。我们通过 CUE 标准来实施这一议程:具有真实背景的基准、捕捉真实效用的参考标准和指标,以及反映模型行为启发中现实变化的扰动。在 PCS 框架的指导下,并与执业医生一起开发,我们通过 HealthCareMagic-Diagnosis (HCM-Dx)(患者编写的查询基准)以及结构化参考诊断集和用于评估鉴别诊断列表的临床基础指标,在医疗诊断中实例化绿色屏蔽。我们还研究了捕获常规输入变化的扰动机制,并表明即时水平因素沿着临床有意义的维度改变模型行为。在多个前沿 LLM 中,这些转变描绘出帕累托式的权衡。特别是中和,它消除了常见的用户级因素,同时保留了临床内容,增加了合理性并产生更简洁的、类似临床医生的差异,但减少了对极有可能和安全关键情况的覆盖范围。总之,这些结果表明,交互选择可以系统地改变模型输出的任务相关属性,并支持面向用户的指导,以便在高风险领域更安全地部署。尽管这里以医疗诊断为例,但议程自然延伸到其他决策支持设置和代理人工智能系统。