论文
StrategyBench:评估大语言模型的显式策略归纳
StrategyBench: Evaluating Explicit Strategy Induction in Large Language Models
摘要
随着大语言模型日益用于数据稀缺且不断演化的任务场景,少样本上下文学习(ICL)已成为任务适应的关键范式。然而,直接ICL常使用少量示例而不显式抽象任务规则,使其对示例构造敏感。相比之下,人类学习者常通过先从示例总结任务规则、再应用于新实例来降低这种敏感性。为评估这一能力,我们提出StrategyBench,它从BIG-Bench中挑选可策略归纳的任务、构造参考策略,并沿策略质量与下游效用两个维度定义评估指标。我们进一步从任务变化、模型配置和适应设置三个视角分析策略归纳,涵盖类别差异、生成器-执行器选择、示范设计与基于SFT的适应。实验表明,显式策略的效用在不同的任务类别之间差异显著,并同时取决于策略生成与执行的条件。该基准发布于:https://anonymous.4open.science/r/StrategyBench-D53C。
