论文
超越当前观察:评估可控非马尔可夫博弈中的多模态 大语言模型
Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games
摘要
将多模式基础模型部署为闭环策略越来越需要对不再可见的观察结果采取调节行动。然而,现有的基准要么暴露完整状态,要么将隐藏状态重建与其他智能体技能混为一谈,要么仅在情节结束后测试召回。我们引入了 RNG-Bench(重构非马尔可夫游戏),这是一个基准套件,旨在隔离基本模型重建过去观察结果并在多步骤交互过程中对其采取行动的能力。 RNG-Bench 包括两个互补的游戏:配对(在特定位置短暂显示的卡牌身份必须稍后回忆)和 3D 迷宫(以自我为中心的视图必须集成到空间地图中)。这两款游戏都在具有三个受控难度轴的统一工具下进行评估:网格大小、视觉模式和观察模式。该基准测试还引入了一个头对头的决斗协议来控制实例级方差,以及一个内存间隙度量来消除由于不良动作选择而导致的遗忘。最难的配置需要每集大约 128K 个词元和 350 个图像输入的上下文,并且距离前沿 MLLM 的饱和还很远。记忆差距分析表明,大多数残留错误源于忘记早期的观察结果,而不是次优决策。最后,微调 Qwen3.5-9B 的最优策略部署和过滤模型演示提高了 RNG-Bench 上的性能,并转移到现有基准,而不会降低一般多模式能力。