论文

Context-CoT:通过高质量推理合成增强上下文学习

Context-CoT: Enhancing Context Learning via High-Quality Reasoning Synthesis

模型训练合成数据

摘要

尽管大语言模型(LLM)擅长利用静态的预训练知识对提示进行推理,但它们在上下文学习(context learning)方面存在显著困难——即从复杂、任务特定的上下文中动态提取、内化并应用新知识的能力。最近在CL-Bench上的评估揭示了一个关键能力缺口:前沿模型平均只能解决17.2%的上下文依赖任务。

Context-CoT:通过高质量推理合成增强上下文学习:论文配图
图 2:Context-CoT 数据合成和过滤管道的概述。该框架分三个连续阶段运行:(1)多阶段 CoT 采样,促使教师模型在推理之前显式提取相关上下文知识; (2)基于Rubrics的最小泄漏过滤,利用初步长度过滤和基于Rubrics的LLM判断来丢弃不忠实的推理轨迹; (3)学生感知CoT选择,评估教师候选集以选择最符合目标学生模型能力分布的最佳推理轨迹(y*y^{*})。