通过基于语料库的特征扩散从传统中文家长教师访谈中自动生成 IEP
Automated IEP Generation from Traditional Chinese Parent-Teacher Interviews via Corpus-Grounded Feature Diffusion
摘要
编写个性化教育计划 (IEP) 是一项高劳力、知识密集型的文档负担;英语研究表明,生成式人工智能可以显着减少起草时间,但由于领域数据稀缺、严格的隐私法规以及缺乏本地评估基准,繁体中文的自动化 IEP 生成实际上尚未得到探索。我们提出了一个以语料库为基础的特征扩散(CGFD)为中心的低资源 微调 管道:(1)通过具有标志感知分数上限的 tau 阈值选择 25 个双专家高分种子转录本; (2)从种子中提取特征配置文件(句子长度、结构、量化模板)并注入到 LLM 提示中,并与语言采样式多样性控制一起驱动扩散; (3)使用15个专家金种子作为扩散锚,针对585个样本;获得了 567 个有效扩散样本,产生了 582 个样本的训练集,用于使用 QLoRA 微调 Breeze-7B; (4) 通过语法约束解码 (GCD) 进行模式约束推理,在推理时强制执行分层 SMART 目标阶梯模式。 55 个样本模式压力集的消融结果揭示了一个意外的发现:GCD 在繁体中文 词元预算 下会适得其反——无 GCD 路径在中值延迟降低 34% 的情况下实现了 100% 的模式通过率,在可靠性和速度上都优于 GCD。在 n=10 的正式保留中,无 GCD 推理路径达到 BERTScore F1 = 0.779,超过 GPT-5.4 (0.726)、DeepSeek-V3.2 (0.703)、Gemini-3-Flash-Preview (0.703) 和 Llama-4-Maverick (0.700) 零样本基线,同时保持完全本地、气隙推论。该系统弥补了中国传统特殊教育自然语言处理的空白,并在工业工程范式下提供了可扩展、保护隐私的本地推理解决方案。