论文
剖析用于合成肿瘤学数据生成的神经符号质量保证
Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation
摘要
用大语言模型生成合成临床数据缓解了限制癌症分期研究的数据稀缺问题,但肿瘤学幻觉在性质上是有害的:一个临床上不可能的分期赋值就会污染所有在其上训练的下游模型。神经符号管线在生成过程中进行验证,但各质量保证组件的贡献仍不清楚。我们报告三项受控研究,在生成协议、多样性阈值和微调超参数于各适配器条件间保持不变的前提下,分别隔离门控必要性、约束归因和检索条件性。符号门控强制执行模式完整性、针对医学系统命名法(SNOMED)的本体覆盖,以及美国癌症联合委员会第八版规则下的分期逻辑一致性。无门控时,29.9%的记录含模式校验失败,20.1%含临床上无效的分期。模式验证是主要过滤器:在全门控语料中它拒绝512条记录中的148条,本体匹配再拒绝24条,而分期逻辑验证一条也没有拒绝——唯一产生逻辑违规的生成器已在模式检查时被排除,这使临床逻辑验证成为有条件的生成器相关保障,而非主导过滤器。检索增强强烈依赖模型:它使一个生成器的门控合规率提高12.5个百分点,对第二个无可测量影响,并使第三个输出崩溃。在各门控配置中,本体密度基本不变,表明符号验证改善的是临床有效性而非词汇丰富度。因此,符号门控换来的是语料有效性,但在本研究的真实肺癌记录上没有相应收益;检索应按模型逐个评估,本体密度不应作为语料质量的替代指标上报。
