论文

超越提问:一条从行为读取玩家的个性化游戏生成流水线

Beyond Asking: A Pipeline for Personalized Game Generation that Reads Players from Behavior

模型评测基准与评测资源

摘要

个性化游戏生成需要从玩家的游玩方式推断其能力与行为风格。大语言模型使这种推断比以往任何时候都更可行:LLM可以读取原始游戏过程记录,产出一个流畅而貌似合理的玩家画像。然而,貌似合理并不等于经过验证,而验证恰恰是该领域所缺乏的:潜在特质不可观测;问卷提供的是带噪声的代理指标,而当用自我报告来验证基于行为的推断时会陷入循环;行为本身在没有上下文时有歧义——一个从不收集道具的玩家可能不想要它,也可能从未有过机会。我们同时解决这两个问题。首先,我们构建了一个特质即构造性真值的合成玩家种群:每个特质都是一个显式的机器人参数,只有在受控操纵产生一致的、特质特定的行为改变后才被接受。与先前反转已知决策模型的参数恢复工作不同,我们的基准评估的是仅凭行为记录的策略无关推断。其次,我们引入一个机会感知的决策时刻表示,把偏好与表达偏好的机会解耦;消融它会选择性地损害依赖机会的特质。在该基准上,少样本LLM推断在多数特质上优于嵌入与规则基线,但基于特征的监督回归器整体上仍更强。最后,我们闭合了回路:推断出的画像驱动难度自适应,对照真值参考与画像错配对照进行评估,并以一项探索性人类研究检验这些发现是否能迁移到真实玩家。

超越提问:一条从行为读取玩家的个性化游戏生成流水线:论文配图
图1:概览。(A) 具有参数化特质的合成玩家生成机会感知的记录;参数只有通过准入测试后才会进入基准,特质恢复则据此打分。(B) 同一记录模式驱动所部署的流程:校准对局、LLM 解读以及以画像为条件的生成。