论文

SKIP:以自知识引导逐步偏好学习,实现简洁推理

SKIP: a Self-knowledge-guided Step-wise Preference Learning Framework for Concise Reasoning

模型训练偏好优化

摘要

虽然思想链 (CoT) 推理已被证明是有效的,但它通常会导致过度思考,从而导致计算开销、推理延迟,甚至导致大语言模型 (LLM) 的性能下降。现有的简洁推理框架在压缩输出长度的同时显着降低了准确性。在本文中,我们提出了 SKIP,一种自我知识引导的逐步偏好学习框架。 SKIP从轻量级微调开始调整模型的输出风格,引入了精心设计的知识探测机制,引导模型在每个推理步骤输出答案。基于中间步骤的正确性,我们构建偏好数据,利用 DPO 引导模型进行更高效、更正确的推理。实验结果表明,我们的方法有效地提高了推理压缩,同时减轻了微调后的性能下降。此外,SKIP 在分布外数据集上表现出很强的泛化能力。我们进一步对框架的组件参数进行了消融研究。

SKIP:以自知识引导逐步偏好学习,实现简洁推理:论文配图
图 2:自我知识引导的逐步偏好学习 (SKIP),一个三阶段推理压缩框架。我们使用简单而有效的探针来检测模型是否可以回答问题。然后,我们使用偏好数据训练模型,教它们学习何时在特定点退出。