论文

StrategyBench:评估大语言模型的显式策略归纳

StrategyBench: Evaluating Explicit Strategy Induction in Large Language Models

模型评测基准与评测资源

摘要

随着大语言模型日益用于数据稀缺且不断演化的任务场景,少样本上下文学习(ICL)已成为任务适应的关键范式。然而,直接ICL常使用少量示例而不显式抽象任务规则,使其对示例构造敏感。相比之下,人类学习者常通过先从示例总结任务规则、再应用于新实例来降低这种敏感性。为评估这一能力,我们提出StrategyBench,它从BIG-Bench中挑选可策略归纳的任务、构造参考策略,并沿策略质量与下游效用两个维度定义评估指标。我们进一步从任务变化、模型配置和适应设置三个视角分析策略归纳,涵盖类别差异、生成器-执行器选择、示范设计与基于SFT的适应。实验表明,显式策略的效用在不同的任务类别之间差异显著,并同时取决于策略生成与执行的条件。该基准发布于:https://anonymous.4open.science/r/StrategyBench-D53C。

StrategyBench:评估大语言模型的显式策略归纳:论文配图
图6:并发 CoDI 框架概览。CoDI 以 StrategyBench 作为训练与评估试验台,并利用由参考策略训练的 SFT 模型。该框架将任务级策略归纳与答案执行分离,作为构建于本文所提基准资源之上的下游方法。