论文

考虑上下文:当世界模型需要上下文编码器时

Considering Context: When World Models Need Context Encoders

模型评测模型行为与机制分析

摘要

基于模型的强化学习中的泛化方法通常假设智能体无法从其自身经验中恢复控制环境动态的潜在上下文,因此从外部提供它。我们用 预测充分性 来形式化并测试这个假设,它量化了在智能体引起的访问分布下对上下文的访问添加到下一步预测的内容,并将该量分为历史可恢复部分、需要真实上下文的残差以及有限模型添加的赤字。我们根据上下文感知算法的调节集可以针对的预测风险对上下文感知算法进行分类,并在识别难度不断增加的环境中证明净空不遵循 MDP 类别。不同先验条件下的相同任务在一种设置中留下了预测余量,而在另一种设置中与零没有任何区别,其中智能体的行为隐式地识别了上下文,并且这种机制的任何好处都不能归因于信息缺失。在净空持续存在的情况下,学习的状态仅部分暴露它,并且添加真实的上下文仍然可以降低风险。我们的贡献是一个实用的标准,用于将上下文机制与可用的信息相匹配,这是根据普通训练的智能体估计的,没有参考策略。