论文
可解释分子描述符与基础嵌入的低数据比较
Interpretable-by-Design Descriptor Portfolios Match a 2048-Dimensional Foundation Embedding on Low-Data Molecular Assays
摘要
在少数据构效关系预测中,分子表征的选择可能比预测器选择更重要,表格基础模型会强化这种影响。本文检验:紧凑、具有语义名称的描述符模块组合,能否达到2048维CheMeleon嵌入的准确率,同时让每个输入维度都附有模型名称和训练来源,以便特征级审计。方法从固定的11维理化基础出发,仅利用带标签上下文,贪心拼接通过来源筛查的模块。在九项ADME/Tox测定、50个评测单元中,仅在所有表征都覆盖的分子子集上比较,组合的平均测试AUC为0.762,CheMeleon为0.764,Mordred为0.756。汇总后与CheMeleon的差值为+0.003 AUC,任务自举95%置信区间为[-0.020,+0.030],满足预先声明的汇总等效门槛,但不满足逐测定门槛。上下文有25个标签时,主要规则仍满足汇总门槛,10个标签时则不满足。作者还报告四项被实验否证的预先声明候选选择规则。冻结后的十个随机种子与三项未见测定检查支持紧凑可审计表征的汇总竞争力;同宽度随机组合对照未证明贪心选中的成员本身能提高准确率。逐测定差异尚未解决。
