论文
认知致盲:审计LLM辅助分析中先验污染的推理时协议
Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis
摘要
本文在这样一个智能体系统的背景下提出认知致盲(epistemic blinding):该系统利用大语言模型跨多个生物数据集进行推理,以完成药物靶点优先级排序。在开发过程中,一个明显的问题是:LLM的输出会悄然把数据驱动的推理与对具名实体的记忆先验混合在一起,而这种混合不可见——无法从单一输出判断其中多少来自页面上的数据、多少来自模型的训练记忆。认知致盲是一种简单的推理时协议:在提示前将实体标识符替换为匿名代码,然后将输出与未致盲的对照结果进行比较。该协议并不能使LLM推理变得确定,但它恢复了可审计性的一个关键维度:衡量输出中多少来自所提供的数据、多少来自模型的参数化知识。文中描述了完整的靶点识别系统——包括LLM引导的评分函数进化优化,以及用于靶点论证的致盲智能体推理——并证明两个阶段均可在不接触实体身份的情况下运行。在覆盖四种癌症类型的肿瘤学药物靶点优先级排序中,致盲改变了16%的top-20预测,同时保持对已验证靶点完全相同的召回。污染问题被证明可推广到生物学之外:在标普500股票筛选中,品牌认知偏差在五个随机种子下重塑了30-40%的top-20排名。为降低采用门槛,该协议以开源工具和Claude Code技能的形式发布,可在智能体工作流中一条命令实现认知致盲。本文的主张并非致盲分析能产生更好的结果,而是:没有致盲,就无法知道智能体在多大程度上遵循了研究者设计的分析流程。
