适用于 BioASQ A+ 和 B 相的成本实用的质量选通和选择融合多模型组合器
Cost-Pragmatic Quality Gating and Selection-Fusion Multi-Model Combiners for BioASQ Phases A+ and B
摘要
我们描述了我们的 BioASQ Task 14B 2026 系统。这项工作集中在两个设计决策上:当第一阶段检索较弱时如何积极地重新检索,以及如何组合多个语言模型答案。检索结合了两个并行管道 - 一个混合第一阶段(密集 BGE + BM25 + RRF,在 BioASQ-13b 历史档案上达到 R@200 = 99.3%)和一个代理驱动管道,用于分解 PubMed、Europe PMC 和 iCite 上的问题 - 使用 BGE 交叉编码器质量门标记弱支持的问题以进行选择性重新检索。在 Task 12B 2024 验证中,成本实用的重新检索策略在列表 F1 和列表精度上显着优于技能严格的基线,重新检索成本降低了 12%。在 val 和测试 13B(不同的问题集)中保持提示和模型固定,列表 F1 在 BioASQ 发布的标准参考输入集上绝对上升了 +0.132,这与大量的检索侧净空一致。对于 B 阶段的回答,我们将多模型集成提升分解为由每个问题预言机限制的选择组件和聚合器可以超越的融合组件。分解在任何实验之前预测 LLM 作为法官在选择主导的指标上获胜(是/否,多参考 ROUGE),但在融合友好指标的召回部分(factoid 等级 1,列表召回)上结构上不足。在任务 13B 2025 中,我们的同义词联合解析器在每个头上都赢得了列表召回,而 GPT-5.5 独奏保留了列表 F1 领先优势,因为解析器更广泛的项目集会降低精度。在 Task 14B 2026 初步排行榜上,我们的团队在八个(第 x 阶段)排行榜中的三个排行榜上的综合精确总数上名列第一,赢得了四个单独的问题类型单元格,并在 B 阶段 b3 理想中获得第一名。