论文

用于评估大语言模型响应中表达的临床推理的拟议评分标准

A Proposed Rubric for Evaluating Expressed Clinical Reasoning in Large Language Model Responses

模型评测评测方法与指标

摘要

我们借鉴三个工作主体,提出了一个评估模型反应中表达的临床推理的标准:医学教育评估框架(ART、SCT、关键特征问题和 OSCE);临床大语言模型基准(MedR-Bench、HealthBench、TIMER-Bench、DR. BENCH、PrIME-LLM 和 PatientSafeBench);以及一般大语言模型推理评估研究,包括事实性-有效性-连贯性-效用分类法、FaithCoT-Bench 和 C2-Faith。我们使用扎根性作为分类法事实类别的临床导向适应。该标题将这些概念整合到一个多维框架中,用于对金标准临床小插图的自由文本响应进行评分。它包括临时行为锚、适用性规则和针对特定案例的安全关键错误的单独标志。通用领域框架为其设计提供了信息,但不被视为经过验证的临床工具。该标题不会取代特定案例的参考标准或现有基准的特定任务指标。尚未对其评估者间的可靠性、结构有效性或临床实用性进行测试。其直接目的是在实证测试之前使评估决策明确并接受审查。