论文

AgentCAT:经多智能体大语言模型仿真计算机化自适应测验

AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models

智能体系统Agent 架构与控制循环

摘要

计算机化自适应测验(CAT)作为个性化教育的关键技术——旨在通过动态检索匹配当前能力估计的试题——准确评估考生能力。但既有CAT研究受静态离线数据与孤立组件优化的限制。受离线日志部分标签制约——研究者把动态评估过程降级为静态序列预测。当前研究聚焦孤立视角(如选题或诊断)——忽视CAT整体交互过程。为解决——我们提出AgentCAT——基于大语言模型的多智能体仿真系统——构建高保真动态测验基准环境。该框架含三模块:(1) 带记忆检索与思维链推理的考生智能体——基于认知画像模拟作答;(2) 选题智能体用粗到细分桶与知识图谱探索——平衡局部难度与全局覆盖;(3) 监督者用双审计与鲁棒更新确保收敛与有效。为验证框架——我们在两个真实数据集上跨三维评估:宏观能力收敛、微观交互逻辑与数据稀疏韧性。结果表明AgentCAT取得有效能力估计——其选题策略平衡难度适应与教学连贯——与人类教学直觉一致。

AgentCAT:经多智能体大语言模型仿真计算机化自适应测验:论文配图
图 1. 典型 CAT 流程的示意图,该流程依赖于缺少真实标签的静态离线数据。