HypothesisMed:用于生物医学问答的推理时间答案融合和结构化假设空间报告
HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering
摘要
使用 大语言模型 进行的生物医学问答通常使用答案准确性进行评估,但答案准确性本身并不能表明模型是否可以产生可解析的输出、遵循结构化可靠性指令、识别弱答案空间或避免自信的错误承诺。本文提出了 HypothesisMed,一种用于生物医学多项选择题回答的推理时间可靠性管道。它结合了直接、思维链、HypothesisMed-v3 提示和答案融合。最终答案是通过融合选择的,而 HypothesisMed-v3 则提供 SPACE 标签和置信度信息。空间标签将答案空间标记为有效、不完整或矛盾。我们使用每个数据集 1,000 个示例在 MedQA、MedMCQA 和 PubMedQA 上评估 Qwen2.5-7B、Phi-4-mini、DeepSeek-R1-32B 和 BioMistral-7B。该管道提高了每个模型的最佳直接或思维链基线的加权准确性,同时增加了解析和空间覆盖范围。我们还使用每个模型 10,183 个示例将评估扩展到 Qwen2.5-7B 和 Phi-4-mini。 Fusion 将 Phi-4-mini 的准确率从 0.4296 提高到 0.5192,而 Qwen2.5-7B 思路的答案准确率仍然略高。然而,Qwen2.5-7B 融合实现了完整的解析和 SPACE 覆盖,并且错误承诺要低得多。 12,000 个示例的 SPACE 压力测试表明,答案空间诊断仍然很困难,Qwen2.5-7B 的 SPACE 准确度为 0.3074,Phi-4-mini 的 SPACE 准确度为 0.4168。这些结果表明,答案准确性、可解析性、结构化可靠性报告、校准行为和错误承诺行为是可分离的功能。主要贡献不是一个通用的最先进的主张,而是一个可重复的推理时间框架,用于在结构化可靠性约束下评估生物医学问答模型作为可审计的工作流程组件。