论文
PetQA:兽医知识与临床推理问答评测
PetQA: Benchmarking Veterinary Knowledge and Clinical Reasoning
摘要
我们介绍 PetQA,这是一种韩国长格式问答 (QA) 基准,用于评估 大语言模型 (LLM) 和大型视觉语言模型 (LVLM) 中的兽医知识和临床推理。 PetQA 包含 10,076 个纯文本和 8,751 个多模式 QA 对,这些 QA 对源自有关狗和猫的现实问题,并配有专家兽医的答案。其测试分支 PetQA-Bench 进一步包括问题类型和临床条件的注释。我们使用 ROUGE、BERTScore 和 LLM 作为法官指标在三种设置下评估 18 个模型的真实性和有用性:零样本推理、检索增强生成 (RAG) 和监督 微调 (SFT)。基准测试结果概述了当前模型在解决兽医临床问题方面的优势和局限性,并强调需要更有效的适应方法来开发临床可靠的兽医护理人工智能系统。为了促进更广泛的使用,我们还提供五种语言的 PetQA-Bench 翻译版本。