论文

基于严重性的阿拉伯医学文本生成课程学习策略

A Severity-Based Curriculum Learning Strategy for Arabic Medical Text Generation

模型训练合成数据

摘要

越来越需要阿拉伯语医学文本生成来帮助用户解释症状并以母语获取一般健康指导。然而,许多现有方法假设训练样本的重要性相同,而忽略了临床严重程度的差异。这种简化可能会妨碍模型正确捕获复杂或高风险案例的能力。为了克服这个问题,这项工作引入了一种基于严重程度的阿拉伯医学文本生成课程学习策略,其中训练过程的结构是逐渐从不太严重的医疗状况过渡到更严重的医疗状况。该方法根据严重程度将数据集划分为有序阶段,并在 微调 期间逐步将模型暴露给更具挑战性的案例,使其能够在处理更复杂的场景之前首先学习基本的医疗模式。所提出的方法在医学阿拉伯语问答(MAQA)数据集的子集上进行评估,其中包括描述症状的阿拉伯医学问题以及相应的响应。此外,使用本研究中开发的基于规则的方法对数据集进行了三个严重级别(轻度、中度和严重)的注释。结果表明,纳入严重性意识课程学习可以在所有测试模型中实现一致的性能改进,与基线模型相比,增益约为 +4% 至 +7%,与传统的 微调 方法相比,增益约为 +3% 至 +6%。