论文

剖析用于合成肿瘤学数据生成的神经符号质量保证

Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation

模型评测上下文与知识本体模型行为与机制分析

摘要

用大语言模型生成合成临床数据缓解了限制癌症分期研究的数据稀缺问题,但肿瘤学幻觉在性质上是有害的:一个临床上不可能的分期赋值就会污染所有在其上训练的下游模型。神经符号管线在生成过程中进行验证,但各质量保证组件的贡献仍不清楚。我们报告三项受控研究,在生成协议、多样性阈值和微调超参数于各适配器条件间保持不变的前提下,分别隔离门控必要性、约束归因和检索条件性。符号门控强制执行模式完整性、针对医学系统命名法(SNOMED)的本体覆盖,以及美国癌症联合委员会第八版规则下的分期逻辑一致性。无门控时,29.9%的记录含模式校验失败,20.1%含临床上无效的分期。模式验证是主要过滤器:在全门控语料中它拒绝512条记录中的148条,本体匹配再拒绝24条,而分期逻辑验证一条也没有拒绝——唯一产生逻辑违规的生成器已在模式检查时被排除,这使临床逻辑验证成为有条件的生成器相关保障,而非主导过滤器。检索增强强烈依赖模型:它使一个生成器的门控合规率提高12.5个百分点,对第二个无可测量影响,并使第三个输出崩溃。在各门控配置中,本体密度基本不变,表明符号验证改善的是临床有效性而非词汇丰富度。因此,符号门控换来的是语料有效性,但在本研究的真实肺癌记录上没有相应收益;检索应按模型逐个评估,本体密度不应作为语料质量的替代指标上报。

剖析用于合成肿瘤学数据生成的神经符号质量保证:论文配图
图2:神经符号生成流程及其组件剖析。上(目标流程):完整框架将 LLM 生成与神经符号门控 G(x)=S∧O∧C 耦合——即模式有效性(S)、SNOMED CT 本体覆盖(O)与 AJCC 临床逻辑一致性(C);在检索条件下,还在应用门控之前将 MedCPT 检索到的 PubMed 上下文作为接地信息前置到生成提示中。通过门控的记录以结构化 rigid.v3 字段加自由文本临床叙事的形式进入合成语料库。下(组件剖析):五个匹配条件(表II)每次移除或添加一个组件:无门控基线(Adapter A);仅模式(Adapter B);模式++本体(Adapter C);完整门控、无检索(Adapter D);完整门控++RAG(Adapter E)。三个门控内条件(B、C、D)分离每个约束的边际贡献(RQ 2);A 与 D 的对比分离门控的必要性(RQ 1);D 与 E 的对比分离检索的条件性(RQ 3)。三个生成器(GPT-4o、Llama-3.3-70B、ClinicalCamel-70B)、32 格 TNM 播种网格、熵下限、QLoRA 超参数与 TSTR 评估协议在所有条件下保持固定(第 IV-B–IV-D 节),因此任何测得的差异均可单独归因于被操纵的组件。