论文

CoT-Core:通过思维链感知的核心集选择加速LLM评估

CoT-Core: Accelerating LLM Evaluation via CoT-Aware Coreset Selection

模型评测评测方法与指标

摘要

评估大语言模型(LLMs)在连续开发过程中需要巨大的计算开销。虽然核心集选择加速了评估过程,但现有的方法要么由于严重的“冷启动”瓶颈,需要大量的历史日志(例如,项反应理论),要么表现出表面词汇偏见,忽略了任务的底层推理机制。我们提出CoT-Core,这是一种新型的无需核心集选择的核心问题选择框架。认识到不同词汇的问题可以共享相同的底层逻辑,CoT-Core提示LLMs进行零样本链式思考(CoT)推理轨迹。将这些路径投影到一个潜在空间中,有效地通过内在逻辑等价性而不是表面文本相似性来聚类问题。在GSM8K、MMLU、MMLU-Pro和GPQA上的广泛实验表明,CoT-Core大幅降低了评估成本,同时保持了高质量评分估计,揭示了推理-aware剪枝的有效性,其效果受任务复杂性内在控制。

CoT-Core:通过思维链感知的核心集选择加速LLM评估:论文配图
图1:CoT-Core 的研究动机与整体概览。