论文
当推理缩小行动范围时:LLM 游戏中的多样性崩溃
When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play
摘要
有监督的 微调 (SFT) 被广泛用于使 大语言模型 适应下游任务,但其对顺序决策中行为多样性的影响仍有待探索。我们在一套基于井字游戏变体的受控确定性棋盘游戏中研究这个问题,其中最佳动作是可以精确计算的,并且可以直接测量多样性。在状态级评估、竞技场游戏玩法和训练轨迹中,我们发现推理模式生成经常抑制动作多样性,而不会统一提高动作准确性。此外,标准 SFT 提高了准确性,但常常导致过早的多样性崩溃,这超出了准确性-多样性权衡的最低要求。然后,我们表明,动作增强(训练每个状态的所有最佳动作而不是单个演示动作)将部分减轻这种影响。我们的结果将窄支持模仿视为 LLM 决策中政策崩溃的根源,并表明在 SFT 期间保留行动支持对于维持探索行为非常重要。