论文
编辑还是保留?用于教育对话去识别化的完全本地人工智能级联
Redact or Keep? A Fully Local AI Cascade for Educational Dialogue De-Identification
摘要
教育对话对于研究来说是宝贵但敏感的资源:捕捉真实学习的相同成绩单通常会捕捉与课程内容纠缠在一起的个人身份信息(PII),其中“黎曼”可能指真正的学生或数学概念。现有方法迫使在治理和准确性之间进行权衡。商业 大语言模型 (LLM) 可以处理这种歧义,但需要将学生数据发送给第三方,而本地命名实体识别 (NER) 系统保留治理,但过度编辑课程术语。我们提出了一个完全本地级联框架,将去识别化从开放式实体识别重新构建为受限隐私分类。召回优先联合提议器将两个轻量级编码器与确定性规则结合起来,以过度生成候选范围;然后,上下文感知的审阅者使用周围的对话和演讲者角色为每个候选人做出二元编辑/保留决策。我们根据同族 LLM-only 基线和来自两个大型平台的数学辅导成绩单的商业 API 评估了三个审稿人配置。最强的本地配置达到 0.958 宏 F1,而同系列仅 LLM 的基准为 0.767,商业 API 为 0.706,而完全在单台笔记本电脑上运行。在课程-个人姓名模糊性的目标挑战集中,相同的配置仅降低了 0.03 F1,而较小的审阅者则降低了 0.19 至 0.25。这些结果表明,对于教育去识别化来说,问题的表述比模型规模更重要。