论文

上下文示例抑制LLM的科学知识召回

In-Context Examples Suppress Scientific Knowledge Recall in LLMs

模型评测上下文与知识上下文工程模型行为与机制分析

摘要

科学推理很少止步于可直接观测的内容,它往往需要从数据中揭示隐藏结构。从化学中估计反应常数到经济学中推断需求弹性,这种潜结构恢复正是科学推理区别于曲线拟合之处。大语言模型(LLM)通常能够回忆并应用相关科学公式,但我们表明,这种能力出人意料地容易被抑制。我们发现,加入上下文示例会使模型更少依赖预训练的领域知识,即使这些示例恰恰是由同一公式生成的。示例并未强化知识驱动的推导,而是将计算转向经验性的模式拟合。我们在横跨五个科学领域的60个潜结构恢复任务、6,000次试验和四个模型上记录了这种知识置换现象。这种置换在各领域间是一致的,但其对准确率的影响取决于被置换策略与替换策略的对比:同样的转变可能降低准确率、使其保持不变,或看似有所提升。然而,在所有情况下,模型都偏离了知识驱动的推理。对于在科学任务上部署LLM的从业者而言,这是一个警示:上下文示例可能置换而非强化它们本意要支持的知识。

上下文示例抑制LLM的科学知识召回:论文配图
图 1:关于牛顿冷却的两种相互竞争的推理模式。左 (𝒮know\mathcal{S}_{\text{know}}):模型识别域,回忆牛顿定律,提取潜在参数(室温、冷却速率),并解析求解目标时间。右 (𝒮emp\mathcal{S}_{\text{emp}}):给定上下文示例,该模型绕过域定律,而是拟合经验趋势来直接近似目标。两种模式都接收相同的可观测值;只是推理路径不同。