论文

LLM-引导强化学习,用于多智能体战斗游戏中的自适应 NPC 行为

LLM-Guided Reinforcement Learning for Adaptive NPC Behavior in Multi-Agent Combat Games

智能体系统Agent 规划

摘要

战斗视频游戏中基于脚本和规则的非玩家角色 (NPC) 通常会表现出经验丰富的玩家可以利用的可预测行为,而强化学习 (RL) 代理通常在训练后保留固定策略,并且无法轻松调整其策略以适应不同的对手。我们研究了一个运行时策略选择框架,其中 大语言模型 (LLM) 指导经过训练的 RL 策略而不修改其底层行为。为了证明这一点,我们在 Unity 中使用共享 PPO 策略训练五个 NPC 代理,并将策略独立运行的基准配置与 LLM 增强配置进行比较,其中本地托管的 Mistral 7B 模型通过 Ollama 访问,每五秒读取一次实时游戏状态并分配四个战术标签之一。我们针对 600 个情节中的三种脚本对手类型评估了这两种配置,并使用 Mann-Whitney U 测试分析结果。面对在回合中改变策略的平衡对手,LLM 增强型智能体的胜率提高了一倍多,从 11% 增加到 24%,并且回合时间明显更长。面对回避型对手,增强型智能体取得了更高的胜率和更快的杀戮速度,尽管其较短的情节持续时间不满足严格的假设定义。面对侵略性的对手,LLM 近乎持续的包围偏好适得其反。对 2,430 个策略选择的分析表明,无论对手类型如何,83.8% 的情况下都会选择 Surround,这表明在此模型规模下零射击策略差异化有限。这些结果证明了 LLM 引导的自适应多智能体游戏 AI 运行时策略选择的潜力和局限性。