论文

Jev 医学:基准评估。初步结果

Jev in Medicine: A Benchmark Evaluation. Preliminary Results

模型评测模型推理判别式推理与决策模型能力评测Jev

摘要

Jev 是一种非生成式“系统一”模型,它将概率分配给预定义的答案选项,并且无法在其之外进行回答。它在医学问答和基于案例的诊断推理任务上的准确性和校准尚不清楚。我们根据四个医学基准评估了 Jev 1.13:MetaMedQA、PubMedQA、DiagnosisArena-MCQ 和 NEJM 案例挑战。 GPT-6 Sol,有(中)且无推理,是参考。主要结果是 top-1 准确率;关键的次要结果是校准、选择性预测和识别无法回答的问题。所有 8,469 个请求都返回了有效答案。 Jev 的准确性与 GPT-6 Sol 的准确性相似,在 PubMedQA 上推理为中等(78.4% vs 78.2%;),在 MetaMedQA 上较低(74.8% vs 82.7%),在 DiagnosisArena-MCQ 上推理要低得多(59.8% vs 82.4%;)和 NEJM 病例(61.8% vs 82.4%)。在 MetaMedQA 上,Jev 的概率是最佳校准的(预期校准误差为 0.063 vs 0.146),其答案的概率至少为 0.9(52.9% 的问题)准确率为 93.4%,但 GPT-6 Sol 在接受相似比例的问题时也同样准确。在 DiagnosisArena-MCQ 上,Jev 的概率辨别力很差(AUROC 0.645 vs 0.768)。在正确答案为“我不知道或无法回答”的 162 个问题中,Jev 选择该选项的比例为 10.5%(GPT-6 Sol,8.6%)。中位延迟为 0.27-0.31 秒;所有 2,823 件商品的售价为 0.08 美元。 Jev 速度快、成本低,其准确性与前沿LLM在研究摘要方面的准确性相似,但在考试问题和复杂诊断病例方面的准确性较低。临床使用前需要进行特定任务的验证。