论文

基础模型能将婴儿信号传输多远?具有统一需求本体的跨数据集传输审核

How Far Do Foundation Models Transfer to Infant Signals? A Cross-Dataset Transfer Audit with a Unified Need Ontology

模型评测鲁棒性、公平性与可信度评测

摘要

公共婴儿哭泣语料库很小,标签不兼容,并且几乎总是一次评估一个语料库。我们询问这种做法隐藏了什么以及如何解决它。通过多级泄漏审计(字节级和嵌入级重复数据删除加上语料库内训练测试近乎重复审计)筛选的四个哭泣语料库,我们在统一的五类需求本体和共享任务公式下探测了四个冻结编码器和手工制作的基线。审计揭示了单语料库评估所隐藏的内容:对于同一编码器,域内宏 F1 波动为 0.57-0.80,跨语料库传输平均为负(负传输率 0.19-0.35,在 30 个定向单元中的 18 个中显着,BH-FDR),以及 349 个内容相同的剪辑组在语料库分布中携带冲突的元数据标签。然而,同一次审计揭示了一致的前进方向。在匹配的训练规模和近乎重复的删除之后,转移到最嘈杂的语料库中的效果大小始终为正,为小型、嘈杂的语料库提供了实用的方法。冷冻探针在​​适度的标签预算下饱和,而稳定的 微调 以完整的标签获胜;域自适应预训练在 5-10 次射击时显着优于稳定的 微调(1 次射击的优势对于优化种子方差而言并不稳健),但在 50 次射击或更高的情况下没有表现出显着优势。在测试的二进制、共享标签设置中,本体映射联合训练在所有四种编码器-目标组合中获胜,而天真地合并未映射标签的成本高达 37 个 F1 点。我们发布本体、映射代码和审计管道,将不兼容的哭泣语料库转变为可用的联合训练资源。