论文

通过预训练置信表示进行高效自适应数据采集

Efficient Adaptive Data Acquisition via Pretrained Belief Representations

模型训练参数高效训练

摘要

学习自适应数据采集的有效策略仍然具有挑战性:基于后验的方法依赖于可能被错误指定或有偏差的代理模型和后验近似,而直接策略学习方法根据历史观察进行映射,并且无法利用可用的模型表示,从而使学习变得更加困难。我们引入了带有信念表示的策略学习(POLAR),基于这样的见解:最佳数据获取仅取决于通过充分信念状态的观察历史。具体来说,POLAR 通过利用预训练的预测基础模型作为信念状态编码器,在其表示之上训练政策头,从而将表示学习与策略学习解耦。这为贝叶斯实验设计、贝叶斯优化和主动学习产生了一个简单、统一的摊销策略学习框架,其区别仅在于用于训练策略的特定任务效用。根据经验,我们发现 POLAR 在不同的任务中都优于最先进的摊销方法,同时需要更少的训练样本,这表明在摊销数据采集的可扩展性和效率方面迈出了重要一步。