论文

零样本呼吸音频分类的自适应测试时间缩放

Adaptive Test-Time Scaling for Zero-Shot Respiratory Audio Classification

模型推理测试时计算扩展

摘要

自动呼吸音频分析有望实现可扩展的、非侵入性的疾病筛查,但进展受到稀缺的标记数据和昂贵的专家注释的限制。零样本推理消除了特定于任务的监督,但现有方法无论难度如何,都对每个输入应用统一计算。我们引入了 TRIAGE,一个分层的零样本框架,它通过将每个音频样本路由到逐渐丰富的推理阶段来自适应地扩展测试时间计算:联合音频文本嵌入空间中的快速标签余弦评分(L 层)、与临床医生风格描述符的结构化匹配(M 层)以及检索增强的 大语言模型 推理(H 层)。基于置信度的路由器可以尽早完成简单的预测,同时为不明确的输入分配额外的计算,从而使近一半的样本能够以最便宜的层退出。在没有特定任务训练的九个呼吸分类任务中,TRIAGE 的平均 AUROC 为 0.744,优于先前的零样本方法,并在多个任务上匹配或超过监督基线。我们的分析表明,测试时间扩展将收益集中在重要的地方:不确定的情况下相对改进高达 19%,而自信的预测以最小的成本保持不变。