论文

CODE-GEN:用于选择题生成的基于RAG的人在回路智能体AI系统

CODE-GEN: A Human-in-the-Loop RAG-Based Agentic AI System for Multiple-Choice Question Generation

应用与实践内容创作

摘要

我们提出CODE-GEN,一个基于检索增强生成(RAG)的人在回路智能体AI系统,用于生成与情境对齐的选择题,以培养学生的代码推理和理解能力。CODE-GEN采用智能体AI架构:Generator智能体生成与课程特定学习目标对齐的代码理解选择题,Validator智能体则独立评估七个教学维度上的内容质量。两个智能体都配备了专用工具,以提高计算准确性并验证代码输出。为评估CODE-GEN的有效性,我们开展了一项评估研究,六名人类领域专家(SME)评判了288道AI生成的题目。这些SME共产生了2016个人机评分对,表示认同或不认同Validator的评估,并提供了131条定性反馈。对SME判断的分析显示出强劲的系统性能,七个教学维度上经人类验证的成功率介于79.9%至98.6%之间。定性反馈分析表明,CODE-GEN在非常适合计算验证和显式标准匹配的维度上具有高可靠性,包括题目清晰度、代码有效性、概念对齐和正确答案有效性。相比之下,在需要更深入教学判断的维度上,人类专业知识仍然不可或缺,例如设计有教学意义的干扰项以及提供能强化理解的高质量反馈。这些发现为AI辅助教育内容生成中人类与AI精力的策略性分配提供了依据。

CODE-GEN:用于选择题生成的基于RAG的人在回路智能体AI系统:论文配图
图1:CODE-GEN端到端系统流程,展示基于RAG的人机协同代理式选择题生成全过程。