论文
OverForge:通过策略和战术进行推理有助于合作终生适应
OverForge: Reasoning Through Strategies and Tactics Helps Cooperative Lifelong Adaptation
摘要
合作语言模型智能体必须进行长期协调,适应不断变化的环境,并与不熟悉的惯例合作,但现有的智能体将观察结果映射到行动,而没有将持久的协调策略与其战术执行分开。我们引入了 OverForge,这是一种无需训练的分层架构,它将针对角色和分工的战略推理与针对每个智能体的私人、以合作伙伴为条件的世界模型中的行动的战术推理分开。元认知前额叶皮层模块通过形成策略-行动分支、用正向模型想象其后果以及在自信时做出承诺来将这两个层次结合起来。在 OvercookedV2 中,OverForge 在互联厨房中提供 7 种汤,而每个平面 LLM 基线提供 3 种汤,保留商定的角色,并采用不熟悉的合作伙伴提出的角色。消融和固定策略探测表明,持久策略指导战术适应,而每个推理级别都有助于协调。记忆重新启动表明,跨情节伙伴知识支持任务绩效和伙伴预测,将层次结构与持续适应联系起来。