论文

BEAGLE:面向真实学习者仿真的行为约束代理

BEAGLE: Behavior-Enforced Agent for Grounded Learner Emulation

智能体系统Agent 架构与控制循环

摘要

在开放式问题解决环境中模拟学生的学习行为具有教育研究的潜力,从培训适应性辅导系统到压力测试教学干预。然而,由于隐私问题和纵向研究的高昂成本,收集真实数据具有挑战性。虽然大语言模型 (LLM) 为学生模拟提供了一条有前途的途径,但它们存在能力偏差,针对高效正确性进行优化,而不是新手学习者不稳定、迭代的挣扎特征。我们提出了 BEAGLE,这是一种神经符号框架,它通过将自我调节学习(SRL)理论融入到一种新颖的架构中来解决这种偏见。 BEAGLE集成了三项关键技术创新:(1)半马尔可夫模型,控制认知行为和元认知行为的时间和转换; (2) 通过明确的缺陷注入进行贝叶斯知识追踪,以加强现实的知识差距和“未知的未知数”; (3) 解耦代理设计,将高级策略使用与代码生成操作分开,以防止模型默默地纠正自己的故意错误。在对 Python 编程任务的评估中,BEAGLE 在再现真实轨迹方面显着优于最先进的基线。在人类图灵测试中,用户无法区分合成痕迹和真实学生数据,其准确率与随机猜测无法区分(52.8%)。

BEAGLE:面向真实学习者仿真的行为约束代理
图3:BEAGLE 智能体架构概览。符号控制(Symbolic Control,左)通过元认知行为(Planning、Reflecting、Monitoring、Enacting)与认知状态(Constructing、Assessing、Debugging)的半马尔可夫模型来约束高层行为,并结合 BKT 对知识获取进行建模。神经动作(Neural Action,右)实现两阶段 LLM 流水线:Strategist 根据当前状态确定目标、心态与指令,Executor 生成自然风格的代码与独白。Buffer/Thought(避免重复)与 Memories(从短期错误中学习)机制确保两个 LLM 智能体的行为连贯且不重复(提示的更多细节见附录 C)。环境(Environment,底部)通过 IDE Oracle 执行代码,并提供更新符号状态机与神经动作上下文的反馈信号。