论文

智能体知识追踪:面向严肃游戏金融素养隐性评估的多智能体LLM架构

Agentic Knowledge Tracing: A Multi-Agent LLM Architecture for Stealth Assessment of Financial Literacy in Serious Games

智能体系统Agent 协作

摘要

在不打断学习体验的情况下于游戏过程中评估金融素养仍是教育严肃游戏的关键挑战。我们提出智能体BKT管线——面向从开放式游戏事件隐性评估金融能力的多智能体大语言模型架构。该管线处理与OECD/INFE金融素养框架对齐的2D平台严肃游戏的事件——经四阶段:(1) 游戏把每个玩家决策捕获为结构化事件日志;(2) LLM事件分类器按经验证对照三位领域专家的四分量表(Fleiss kappa=0.624,高度一致)标注每个动作;(3) 四个专注风险缓释、投资、支出与信用管理的领域专属智能体对行为轨迹做会话级推理——为估算各域掌握度的贝叶斯知识追踪供料;(4) 专家裁判智能体把域级估算合成为总体掌握分。在264个游戏会话、193名K-12参与者的评估中——智能体BKT管线产出的掌握估算与学习增益显著相关(r=0.276,p=0.0001)、与后测分数显著相关(r=0.333,p<0.0001)——而与前测分数无相关——提供汇聚与区分效度。本研究中多智能体方法使单LLM基线(r=0.095,不显著)的预测效度约提升三倍——表明域分解与会话级推理在从游戏中捕捉金融素养多维性上起核心作用。

智能体知识追踪:面向严肃游戏金融素养隐性评估的多智能体LLM架构:论文配图
图 3:Agentic BKT 管道的架构。第一阶段捕获结构化的游戏事件。第 2 阶段使用 GPT-4o mini 对每个事件进行四分制分类。第 3 阶段将分类事件路由到四个特定领域的 GPT-5.2 代理,每个代理都会生成每个能力的 BKT 掌握程度估计。第 4 阶段通过专家评审代理将领域级分数综合为总体 P⁡(mastery)P(\text{mastery})。