论文
通过自动化语言特征提取检测临床训练 LLM 中的越狱企图
Detecting Jailbreak Attempts in Clinical Training LLMs Through Automated Linguistic Feature Extraction
摘要
检测临床训练大语言模型(LLM)中的越狱企图,需要对那些预示不安全或偏离任务的用户行为的语言偏差进行准确建模。此前在 2-Sigma 临床模拟平台上的工作表明,人工标注的语言特征可以支持越狱检测。然而,对人工标注的依赖限制了可扩展性与表达能力。在本研究中,我们扩展了该框架:利用专家对四个核心语言特征(专业性、医学相关性、伦理行为与情境干扰)的标注,训练多个通用领域与医学领域的基于 BERT 的 LLM 模型直接从文本预测这些特征。为每个维度选出最可靠的特征回归器,并作为第二层分类器的特征提取器。我们评估了一组预测模型,包括树模型、线性、概率与集成方法,用以从提取的特征判断越狱可能性。在交叉验证与留出评估中,该系统整体表现强劲,表明由 LLM 导出的语言特征为自动化越狱检测提供了有效基础。误差分析进一步凸显了当前标注与特征表示的关键局限,并指向未来的改进方向,例如更丰富的标注方案、更细粒度的特征提取,以及能捕捉对话过程中越狱行为风险演变的方法。这项工作展示了一种可扩展、可解释的方法,用于在安全攸关的临床对话系统中检测越狱行为。
