论文
主动推理作为物理 AI 代理的测试时间缩放法则
Active Inference as the Test-Time Scaling Law for Physical AI Agents
摘要
在本文中,介绍了一种新的物理人工智能(AI)代理的测试时间缩放法则。这种缩放定律使物理人工智能代理能够利用其世界模型进行推理,以在测试时不可预见的场景中进行概括。推导的缩放定律基于主动推理的第一原则,该原则为代理提供了在现实世界中生存的总体目标,并在该目标下包含了他们的具体任务目标。主动推理通过提供推理来解决当代理在其训练分布之外遇到不可预见的情况时出现的预测错误,从而实现非平稳环境中的泛化。所提出的缩放法则通过在测试时根据此推理动态更新代理的策略来捕获这一点。该策略更新被建模为软贝叶斯推理过程,其中使用减少允许策略下的预期预测误差作为可能性的推理来更新关于策略的信念。由此产生的后验策略承认了生物学解释,恢复了在测试时涉及大脑基底神经节和前额皮质的缩放机制。为了解决这个分析上棘手的问题,开发了一种最小化自由能界限的变分推理解决方案。该解决方案通过强化在测试时解决的政策和世界模型中的新实例,扩展到训练之外的学习。与受模型大小和训练数据限制的现有缩放法则不同,派生的解决方案可以根据物理人工智能代理的持续真实经验进行缩放。自动驾驶任务的仿真结果表明,所提出的解决方案优于无模型 Q 学习和基于模型的贝叶斯强化学习,实现了对不可预见场景的鲁棒泛化,同时将推理效率提高了 36% 以上。