论文
CG-Probes:从患者查询嵌入提取可检查风险方向
CG-Probes: Recovering Guardrail Directions from Patient Query Embeddings
摘要
面向患者的人工智能助手承诺为患者提供宝贵的支持,但传入的查询可能会带来医疗风险。为了创建护栏,我们与肿瘤学家合作定义了三个有序风险轴:医疗紧急性、心理紧急性和主题敏感性。我们提出临床护栏探针(CG-Probes)来衡量查询嵌入的风险。我们通过均值差法探测冻结嵌入模型标准化嵌入空间中的每个轴,将每个轴视为潜在的线性方向。为了训练探针,我们使用 BERTopic 对 79,658 个捷克肿瘤学搜索查询进行聚类,并使用这些聚类通过少样本提示生成具有对比风险水平的查询对。我们针对 200 个查询(90 个真实查询,110 个合成查询)评估了该方法,每个查询均由两名肿瘤学家评分并与两个开放权重大语言模型和一个前沿大语言模型进行比较。我们发现基于紧急度的轴可以作为线性方向恢复,并且探针在延迟的一小部分上与开放权重 LLM 具有竞争力(二次加权 kappa 没有显着差异)。每个轴都会产生一个标量分数,临床医生可以检查并使用该分数来设置升级阈值。该管道仅需要搜索日志、轴定义和对嵌入模型的黑盒访问,这表明了跨医疗保健领域的可转移性。对新查询和轴的稳健验证仍然是未来的工作。