论文

LLM稀疏先验:降低错误领域提示对特征选择的影响

LLM Sparsity Prior for Robust Feature Selection

应用与实践结构化分析、预测与决策

摘要

大语言模型 (LLM) 提供了一种可扩展的机制,可以导出领域知情的先验信息以进行高维变量选择。然而,现有的方法(例如 LLM-Lasso)对权重质量很敏感,当 LLM 生成的权重不准确时,性能会大幅下降。为了应对这一挑战,我们首先引入一个用于量化 LLM 生成的权重质量的框架,从而能够在不同的权重体系中对 利用 LLM 先验的方法进行严格评估。然后,我们提出了 LLM 稀疏先验(LSP),它通过两个控制全局稀疏性和权重集中的可解释超参数,将 LLM 生成的权重集成到 Spike-and-Slab 和 Spike-and-Slab Lasso 模型的先验包含概率中。这些参数的分层超先验允许模型动态降低无信息或误导性权重的影响,从而在权重准确时提高鲁棒性,而不会牺牲收益。最后,我们制定了原则性的提示工程策略,并在研究急性肾损伤的私有医疗数据集上验证了该方法。 LSP 提高了预测准确性并识别基线遗漏的临床相关特征,具有提示变化的鲁棒性和低数据状态下的特别有效性。