论文

当上下文误导时:在大型语言模型中具有管辖权的上下文学习

When Context Misleads: In-context Learning with Jurisdiction in Large Language Models

模型训练监督微调与指令调优

摘要

情境学习(ICL)已成为现代大语言模型部署的基石。然而,现有的 ICL 后训练方法有一个严重的盲点:它们擅长从演示中提取模式,但常常忽略上下文权威,即确定上下文信息是否应控制最终答案的能力。为了对这一功能进行基准测试,我们引入了 FakeContextBench,其中包含跨七个领域的伪科学主张。我们对商业和开源模型的评估表明,仅大规模预训练不足以实现可靠的上下文权威区分。此外,流行的 ICL 微调方法会增加对误导性上下文的敏感性,相对于基本模型,现实准确性降低高达 14.95 个百分点。为了解决这种权衡问题,我们提出了司法管辖区情境学习(J-ICL),这是一种将情境验证纳入训练目标的训练后框架。在四个模型主干中,与相应的基础模型相比,J-ICL 将 ICLEval 平均提高了 5.84 个百分点,现实准确度提高了 9.20 个百分点。相对于 MetaICL 和 Symbol Tuning,它还将真实率平均提高了 18.09 点。这些结果表明 ICL 能力和对欺骗性环境的抵抗力可以一起提高。该基准可从此 https URL 获取。