论文

经过认证的预测建议价值门控,用于强化学习中成本感知的语言模型指导

Certified Predictive Value-of-Advice Gating for Cost-Aware Language-Model Guidance in Reinforcement Learning

智能体系统Agent 规划

摘要

语言模型建议可以加速强化学习,但调用成本高昂,并且返回的操作可能陈旧或错误。我们将建议获取制定为响应相关的元推理问题:在查询之前,控制器预测可能的解析响应,评估每个响应之后的决策和声明的延续,并且仅当预测值的置信下限超过定价成本时才进行查询。执行由特定于操作的证书单独管理。在明确的假设下,经过认证的建议接近最优,包装学习器仅在干预稳定性下继承回退遗憾,而相对于短视预言机,保守分配至多损失了声明的查询值估计误差。在 BabyAI 上,带有 Qwen2.5-1.5B 和 7B 顾问程序的代理校准控制器将 20 个种子的 GoToObj 回报比无查询提高了 0.029 +/- 0.016 和 0.030 +/- 0.015,同时相对于始终查询减少了 97% 以上的调用。 GoToLocal 是空结果。完全匹配呼叫测试显示,与仅针对 1.5B 顾问的随机安置相比,它具有优势,但与同等预算的早期计划相比,没有优势。蒙德里安校准将决策相关的经验覆盖范围从 0.47 提高到 0.85,仍然低于 0.90 目标,而正式覆盖半径是空的。因此,所展示的好处是关于有用任务的强大稀疏建议量,而不是经过验证的每个州的放置优势。