论文
语音到 SFT 管道的阶乘消融:对数据质量和下游传输的不同影响
A Factorial Ablation of a Speech-to-SFT Pipeline: Differential Effects on Data Quality and Downstream Transfer
摘要
通过多阶段细化将语音转化为受监督的 微调 (SFT) 数据的行业管道越来越多地被采用,但据我们所知,尚未被公开逐步消除,使得每个阶段的边际价值未知。我们设计了一个可投入生产的语音到 SFT 管道,其中转录细化(第 0 阶段)和 SFT 数据质量细化(第 2 阶段)可独立切换,从而产生 2x2 因子设计。对于每种情况,我们从韩国医疗和金融会议录音中生成 QA 形式的 SFT 数据,并微调 9 个模型(5 个 LLM 系列,2.4B-70B);我们使用四名跨提供商 LLM 评委、六名专家的盲人评估以及 3 个下游 MCQA 基准进行评估。我们的中心发现:在固定的标准 SFT 配方下,QA 数据质量的改进不会统一转化为下游 MCQA 收益。 4 评判质量持续上升,但跨模型平均 MCQA 增益并不显着;正迁移集中于家庭域对齐对。这种差异模式与格式不匹配是一致的:第二阶段将 SFT 数据组合转向解释性项目,而 MCQA 主要探讨事实回忆。所有六位人工评分员均报告了更高的全流程质量,证实了 LLM 评审方向。 STT 引擎更换为 Whisper-medium 证实了管道的稳健性。非幻觉审计显示,两个前沿 LLM 平均约 8% 的 QA 承认未知;我们发布示例、提示、代码和所有 SFT 检查点。