论文

大语言模型可以进行长远推理吗?纵向临床推理情境策略的实证评估

Can LLMs Reason Over Long Horizons? An Empirical Evaluation of Context Strategies for Longitudinal Clinical Reasoning

上下文与知识上下文工程

摘要

纵向临床推理需要大语言模型 (LLM) 来识别和整合分布在广泛患者病史中的相关证据。尽管长上下文模型可以处理越来越多的信息,但提供更多历史记录并不一定能让相关证据更容易获取或改善推理。我们比较了 MedLoCoMo 上四个开放权重大语言模型的五种情境策略(完整、最近、情景、语义和混合),检查答案的正确性、查询证据距离的鲁棒性以及对不支持前提的问题的弃权。情景式和混合式通常能实现最强的整体准确性,而随着支持证据变得越来越遥远,最近的上下文降级最多;情景式和混合式在长距离下保持最高的精度。对对抗性问题的分析进一步表明,当现有历史不支持所要求的结论时,在可回答问题上的出色表现并不一定意味着成功弃权。这些发现表明,可靠的纵向推理不仅取决于大语言模型可以访问多少历史记录,而且关键取决于如何选择和呈现相关证据以进行推理。