论文

使用表格基础模型进行引导条件动作选择

Bootstrap-Conditioned Action Selection with Tabular Foundation Models

上下文与知识上下文工程

摘要

上下文强盗为样本高效的个性化提供了一个自然的框架,但在稀疏、有偏差的交互数据、不可靠的不确定性估计和严重的冷启动下,实际部署仍然很困难。我们研究具有上下文学习的预训练表格基础模型是否可以转化为在线决策的随机策略。我们提出了 BC-ICL(使用 ICL 的引导条件动作选择),它在每一轮都会对交互历史记录进行引导重新采样,在该重新采样上条件冻结的预训练 ICL 模型,对所有动作进行评分,并选择具有最高采样分数的动作。我们进一步引入了一种手臂上下文调节架构,该架构可促进跨操作的共享统计强度,并有助于避免孤立手臂老虎机的常见引导失败模式。根据经验,该策略在标准上下文老虎套件上提供了强大的早期遗憾和遗憾表现,优于严格在线协议下的既定基线。