论文
LLM不知道自己不知道:经跨模型归因分歧检测临床表格数据上的认识盲区
LLM Doesn't Know What It Doesn't Know: Detecting Epistemic Blind Spots via Cross-Model Attribution Divergence on Clinical Tabular Data
摘要
大语言模型(LLM)日益应用于结构化临床数据——但它们能否识别自身在此类任务上的知识极限仍未被探索。我们以跨模型归因分歧的视角研究该问题——目标是为结构化任务降低认识不确定性——经归因分歧分析在预测任务上比较Qwen 2.5 7B与XGBoost。我们报告四项发现。第一——LLM言语化置信在认识上空洞:无论准确率49%还是75.3%——它输出近常数(0.856-0.937)——追踪提示格式而非预测质量。第二——LLM展现逆难度效应:当XGBoost 99%正确时——LLM准确率跌到64.8%——但当XGBoost中等不确定时——LLM与它打平(73.8%对73.1%)。第三——少样本示例与SHAP导出的特征证据是正交、超可加的干预:无需训练即把归因分歧分数(ADS)从1.54降至0.38——准确率从49%提升到75.3%。第四——以归因分歧信号判定LLM可靠性的跨模型校准器把期望校准误差从0.254降到0.080——以患者专属可靠性估计取代无信息量的言语化置信——无需访问模型内部或重复推理。我们把这些发现框定为LLM在结构化数据上的冷启动问题——并勾勒通向真正认识自我意识的路径。