论文
超越奖励:代理环境耦合的有界测量
Beyond Reward: A Bounded Measure of Agent Environment Coupling
摘要
现实世界的强化学习 (RL) 代理在闭环系统中运行,其中的行为塑造未来的观察结果,在分布变化下进行可靠的部署是一个持续的挑战。现有的监控依赖于奖励或任务指标,捕获结果但错过了早期的耦合失败。我们引入双向可预测性(P)作为观察、行动、结果循环中共享信息与总可用信息的比率,这是一种有原则的、实时的交互有效性衡量标准,具有可证明的界限,可以跨任务进行比较。辅助监视器,即信息数字孪生 (IDT),从交互流中计算 P 及其诊断组件。我们在 MuJoCo HalfCheetah 上评估了 8 种药物下的 SAC 和 PPO 药物,以及 168 项试验中的环境扰动。在名义操作下,代理表现出 P = 0.33 加负 0.02,低于 0.5 的经典界限,揭示了行动选择的信息成本。 IDT 检测到 89.3% 的扰动,而基于奖励的监控为 44.0%,中位延迟降低了 4.4 倍。双可预测性能够在性能下降之前及早检测到交互退化,并为已部署的 RL 系统中的闭环自我调节提供先决信号。