特定于语料库的临床 RAG 系统在 HealthBench 上匹配或优于较新的前沿 LLM
A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench
摘要
最近有报道称,通用 大语言模型 (LLM) 在医疗基准上匹配或超过了专门的临床人工智能工具,但这种比较基于一组狭窄的系统和主要在高收入环境中开发的基准。我们评估了 VITA,这是一种检索增强生成 (RAG) 系统,专为印度和其他中低收入 (LMIC) 环境的上下文知识检索而构建。 VITA 从特定疾病指南、印度特定抗菌药物耐药性数据、国家处方限制和资源有限护理方案的精选语料库中检索;它的架构和语料库是专有的,但基准、医生编写的评分标准以及我们的完整回答和评分输出都是公开的,以供独立验证。在由 GPT-4.1 法官评分的 4,023 道英语 HealthBench 问题(占基准的 80.5%)中,VITA 以 51.9% 的可能分数排名第一,领先于 GPT-5.4 (46.1%)、o4-mini (44.3%)、Gemini 3.1 Pro (42.6%) 和 Claude Sonnet 4.6 (37.3%),得分最高占 45.4% 的问题。为了测试对较新模型的稳健性并判断谱系,针对当前一代模型(GPT-5.5、Claude Opus 4.8、Gemini 3.5 Pro、Grok 4.3)重新运行了包含 500 个问题的子集,并由与任何测试系统不共享谱系的中立开放权重评委 (DeepSeek-V4-Pro) 进行评分。此处,差距缩小到相等:VITA 和 GPT-5.5 在每题平均得分上在统计上没有区别,而 VITA 在加权得分上领先并赢得了最多的问题。在中立评审下,VITA在准确性和完整性方面的优势依然存在;它的沟通得分较低。这些结果表明,专门构建的临床 RAG 系统在开放基准上仍然与前沿 LLM 具有竞争力,与作为设计变量的语料库特异性一致,该设计变量以一定的沟通抛光成本提高了基础。