论文
用于情境学习的数据高效样本选择
Data Efficient Sample Selection for In-Context Learning
摘要
情境学习 (ICL) 范例可帮助 大语言模型 (LLM) 适应新任务,而无需 微调。然而,从大量示例子集中选择演示示例的最佳组合是一个具有挑战性的问题。现有的选择方法并未对 ICL 样本与下游 LLM 性能之间的复杂关系进行建模。它们通常执行静态任务级选择,一旦离线就选择子集,这可能无法推广到未见过的查询。我们引入了 DearICL(数据高效排序算法)ICL 样本,这是一个将演示示例选择建模为子集排序问题的新框架。 DearICL 采用非线性代理,在间隙索引老虎机算法中采用可微分排序目标。基于间隙索引的方法可以细粒度分离好臂和边界臂,该方法用作辅助目标,通过对边界臂进行充分采样来训练非线性代理,支持实例级子集排序。在使用开源 LLM 的示例选择基准上,DearICL 比强线性老虎机基线实现了 8.08-15.9% 的准确度增益,且样本复杂度较低。代码和数据:https://github.com/VenkteshV/DearICL。