论文
DeepLens Diagnosis Agent:智能体工作流设计让小推理模型比肩前沿大语言模型
DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs
摘要
医疗诊断是一个多阶段过程:提取事实、查阅知识、生成鉴别分析,并选出附解释的最佳诊断。前沿大语言模型是强大的通才,但单次提问往往产生脆弱的诊断推理。我们提出DeepLens Diagnosis Agent,一个五阶段的"驾驭"管线(将模型能力与严格的流程约束相结合),以一个小型医疗推理模型(JSL Medical Small 7B v2)和检索增强生成(RAG)为核心。该管线强制执行结构化临床信息抽取、有纪律的检索、受约束的候选生成、显式的证据三角验证以及可审计的最终决策。在915个病例的DiagnosisArena基准上,该智能体取得60.14%的top-1诊断准确率,在中小型模型中最高。同一模型不使用智能体工作流仅为23.99%,即仅靠工作流设计就带来+36个百分点的提升——尽管该模型在标准医学基准上有88.2%,这表明不确定条件下的诊断推理所需的不只是知识召回。该智能体每例成本0.0072美元(A100上24K token),延迟24秒,比Claude Sonnet 4.5(0.0110美元)和Gemini 3.1 Pro(0.0128美元)便宜35-45%,同时性能分别高出+9.70和+9.17个百分点。"驾驭"还能纠正前沿模型的失败;工作流约束的分量可以超过参数量或API成本。除总体准确率外,该管线产生结构化中间产物,使每个阶段可检查并支持错误定位。这些特性使其适用于对可追溯性、可复现性和可审计证据与基准性能同样看重的高风险场景。
