论文

提示级上下文中的侧级 WER 没有可检测到的变化:生产口述历史语料库上的预先注册消融

No Detectable Change in Side-Level WER from Prompt-Level Context: A Preregistered Ablation on a Production Oral-History Corpus

模型评测模型能力评测

摘要

在推理时向大型多模态模型提供上下文是一种使语音转录适应领域的廉价杠杆,并且较小模型的早期结果报告了巨大的收益。这项工作测试了该机制,在生产口述历史转录工具的提示条件层中,使用来自其自己的生产语料库的样本。完整的提示级上下文并未明显改变侧面单词错误率 (WER),并且四个预先注册的假设均未得到支持。该设计是项目内配对消融,在对确认批次进行评分之前使用通过哈希冻结的分析代码进行预先注册;早先在记分器开发过程中,已公开的两个 GPT-4O 飞行员侧面已被记分。十九个磁带面,大约 10.6 小时的 1970 年代至 80 年代的降级采访音频,通过三个提示臂下的生产代码路径进行了重新处理,与两种部署的商业配置(gpt-4o-transcribe 和 Gemini-2.5-flash)交叉,并根据操作员更正的逐字参考进行评分。对于 gpt-4o-transcribe,全上下文组和无上下文组之间的中值配对差异为 +0.6 WER 点,侧面重采样间隔为 [-1.1,+1.0];双子座的估计太不稳定,无法支持类似的负面推论。事后重新运行发现运行之间的管道变异性大于确认差异,因此无法通过每个细胞的一个转录来解决该大小的影响。实施审计验证了操纵是实时的,序列比对分析发现完整的上下文列出的短语有一个小改进,太小而无法实质性改变侧面 WER,并且对于 Gemini 来说,与恶化的未列出词元错误共存。因此,评估上下文机制需要序列对齐的术语级别、插入和说话人标签测量以及总体准确性。