论文

解释何时有助于情境学习?自然语言解释类型与忠实性的比较研究

When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness

模型评测模型行为与机制分析

摘要

自然语言解释 (NLE) 越来越多地用作输入,例如,作为影响上下文学习 (ICL) 中模型行为的少量基本原理。然而,目前尚不清楚不同类型的 NLE 在解释增强提示中如何比较它们对下游模型性能的影响。因此,我们对六个基准和四个指令调整模型进行了比较评估,研究 NLE 源(可用时人工编写,自行生成的解释,由外部 LLM 生成)和 NLE 选择(随机与基于 忠实性 的过滤)在 ICL 设置中使用时如何影响 NLE 的下游效用。我们的广泛评估表明,在分类式基准测试中,将 NLE 添加到少样本提示中通常会比无需解释的少样本提示提高准确性;在 NLE 源中,外部生成的 LLM-NLE 通常提供强大的下游效用,并在两者都可用的情况下与人类原理保持竞争,而自我 NLE 对选择策略更敏感。在数学推理方面,效果更多地依赖于模型和源。我们进一步表明,基于 忠实性 的自 NLE 选择总体上产生了较小的平均收益,但可以根据指标、任务和模型提高或降低性能。不同的 忠实性 指标可能存在很大差异,从而影响选择哪些自非编示例及其下游预测效用。使用随机交换和分布外原理的稳健性测试表明了部分稳健性,表明语义对齐有助于性能提升。总的来说,我们的结果为选择和报告影响实际提示管道中模型行为的解释提供了见解。