论文

用于基于文本的代理中样本高效动作选择的跨环境神经重新排序

Cross-Environment Neural Reranking for Sample-Efficient Action Selection in Text-Based Agents

模型优化小模型/轻量模型

摘要

大语言模型 代理在基于文本的基准上实现了强大的性能,但会产生过高的推理成本,从而促使使用紧凑的神经重新排序器进行动作选择。我们研究单个轻量级模型是否可以跨多个不同的环境执行操作选择,这种功能可以消除每个环境的模型维护。通过少数类上采样在 ALFWorld、WebShop 和 ScienceWorld 上联合训练 DeBERTa-v3(184M-434M 参数),我们发现重新平衡的两环境联合训练显着提高了单环境 ALFWorld 性能(净增益 +0.412),同时保持了具有竞争力的 WebShop 性能(+0.214 对比 +0.249 单环境)。三种环境训练在 4 个种子中产生的平均组合净增益为 +0.551 +/- 0.024,每个环境的结果接近专门的单一环境模型,同时提供积极的跨域转移。跨环境适应具有很高的样本效率:微调 仅在 9.2% 的目标域数据上恢复了 93% 的全数据性能,并且扩展模型容量产生的收益有限,表明数据多样性是主要驱动因素。使用 PCGrad 的环境感知 LoRA 适配器路由实现了 +0.611(种子 42)的最佳种子结果,种子 456 和 789 分别为 +0.554 和 +0.559,但由于种子 123 崩溃至 +0.263(4 种子平均值 +0.497 +/- 0.158)而表现出较高的方差,代表了一个有前途但目前不稳定的方向。干净分割和数据重新平衡的联合训练是关键要素。我们将在接受后发布 51,580 个训练实例(41,740 个带有少数类上采样的原始独特状态)的三环境基准以及所有模型检查点。