论文
当推理受到伤害时:用于临床 SOAP 注释生成的 Frontier LLM 的源感知评估
When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation
摘要
支持推理的 LLM 在医学推理基准上表现强劲,但目前尚不清楚这些收益是否会转移到结构化临床文档中;我们使用跨 OMI Health、ACI-Bench 和 PriMock57 的源感知基准中的临床对话生成 SOAP 注释来研究这个问题。我们在受控 2x2 设计中评估 GPT-5.4、DeepSeek-V4-Flash 和 Gemma-4-E4B,该设计独立切换提供者本机推理和同源检索增强生成 (RAG)。使用七个自动指标和两个具有参考意识的 LLM 评委来评估输出。两种评估方法都一致认为,非推理 GPT-5.4 配置可实现最高的整体质量,而 DeepSeek-V4-Flash 在启用推理的配置中表现最佳。启用推理会显着降低所有三个数据集的 GPT-5.4 性能,而同源 RAG 会产生较小的、依赖于模型的改进。总体而言,研究结果表明,如果没有专门的、特定于任务的评估,则不应假设更强的推理能力可以改进保真度敏感的 SOAP 注释生成。