论文

用于医疗问诊的LLM评估得太晚:成形前缺口(Preformulation Gap)

LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap

模型评测模型行为与机制分析

摘要

用于医疗问诊的大语言模型往往在临床问题已被明确之后才被评估,而真实问诊可能始于模糊、被淡化或被错误框定的主诉。我们在基线与进入照护指令两种条件下,评估了三个API模型在四个由医生撰写的多轮小剧本上的表现,得到24份固定脚本转录;其中两个案例还使用了自适应标准化病人模拟,另得12份转录。在任何患者回答之前就给出自我照护或家庭管理建议的情况,出现在12个基线案例-模型单元格中的9个,而在12个指令单元格中为0个;结构化交接摘要则分别为0/12与10/12。指令改变了就诊顺序与文档化,尽管它并不能可靠地确保引出决定性事实。因此,成形前缺口应通过可观察的首次接触行为直接评估,而不是从诊断准确率或最终答案质量推断。