论文

研究优化下上下文和参数思想链 忠实性 之间的相互作用

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

模型训练偏好优化

摘要

思想链 (CoT) 忠实性,即 CoT 是否真正反映 大语言模型' (LLM) 底层行为,通常使用两个不相交范式下的指标进行评估:上下文 忠实性,通过扰动输入或 CoT 跟踪来测量,以及参数 忠实性,通过干预来评估模型的参数知识。然而之前的工作只是描述性地比较它们。我们通过提出 FaithMATE 来填补这一空白,这是一个统一的偏好对齐接口,用于针对 忠实性 范式优化模型。它使我们能够研究两种范式之间的相互作用,检查 忠实性 增益是否以及在多大程度上在范式内部和之间进行泛化。在三个模型、两个数据集和六个 忠实性 指标中,我们发现这两个范式是正耦合的,但不对称:针对参数 忠实性 进行优化在两个范式中产生一致的增益,而上下文对应项则提供更多可变增益。在上下文范式中,忠实性 在一个指标上的收益不会一致地转移到其他指标,这意味着现有的上下文指标捕获了 忠实性 的不相交方面,并暴露了固有的权衡。这些发现意味着 CoT 忠实性 不是一个单一的目标,因此需要多方面的优化和评估。