论文

仅有相关性还不够:嵌入人类元数据以发现个体因果关系

Correlation Is Not Enough: Embedding Human Metadata for Individual Causal Discovery

模型训练监督微调与指令调优

摘要

询问预训练的生物医学语言模型“皮质醇 28 ug/dL”和“股市波动性”是否相关,它会返回 0.83 的余弦相似度,其中 1.0 表示相同。两者没有共享机制。这不是一个特殊情况:我们测试的每个现成的生物医学编码器(BioBERT、PubMedBERT、BioM-ELECTRA)在答案应该接近零时,不相关的跨域对的得分在 0.76 到 0.92 之间。跨域歧视的准确率为 0%。检索系统能够幸免于难,因为下游的语言模型会过滤噪音。大型行为模型 (LBM) 是一种基础模型,其主题是一个人而不是一个句子,但它不会:它对用户生活的图表进行推理,并将嵌入的邻近性视为两个事件存在因果关系的证据。错误的邻近性会写入错误的因果边缘,下游的所有内容都会继承错误。在这里,嵌入几何体不是一个调节旋钮;而是一个调节旋钮。这是正确性。我们报告修复情况。 72,034 对的对比传递将 PubMedBERT BIOSSES 相关性从 0.633 提高到 0.828,域内与跨域分离从 1.05x 提高到 1.63x。第二遍,BODHI,从生物医学知识图中不存在的边缘中挖掘硬负例,并将分离度提升到 2.30 倍,区分度差距提升到 +0.392,BIOSSES 成本为 4.5%。在配备 AMX 的 Intel Xeon 6737P 上,OpenVINO 将单查询延迟从 1367 毫秒缩短至 10 毫秒 (133 倍),并达到 555 个句子/秒。一项发现与标准建议相矛盾:在该芯片上,FP16 在每个服务批量大小上都优于 INT8,我们解释了原因。无 AMX Ice Lake 实例上的相同模型运行速度慢 13-27 倍。我们发布了基准测试套件、训练语料库、BODHI 生成器和 OpenVINO 脚本。