论文
FutureSim:重播世界事件以评估自适应代理
FutureSim: Replaying World Events to Evaluate Adaptive Agents
摘要
人工智能代理越来越多地部署在动态、开放的环境中,这些环境需要适应新信息的到来。为了有效地衡量现实用例的这种能力,我们建议构建基础模拟,按照事件发生的顺序重播现实世界事件。我们构建了 FutureSim,智能体在其中预测超出其知识范围的世界事件,同时与按时间顺序重播的世界进行交互:真实的新闻文章到达并在模拟期间解决问题。我们评估了前沿智能体的原生能力,测试了他们在 2026 年 1 月到 3 月的三个月内预测世界事件的能力。FutureSim 揭示了他们的能力之间的明显差异,最好的智能体的准确度为 25%,许多智能体的 Brier 技能得分比根本不进行预测还要差。通过仔细的消融,我们展示了 FutureSim 如何提供一个现实的环境来研究新兴的研究方向,例如长期测试时间适应、搜索、记忆和不确定性推理。总的来说,我们希望我们的基准设计能够为衡量现实世界中跨越长期开放式适应的人工智能进展铺平道路。